@article{beyondtrajectoryimitationstrategyguidedp, title = {Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning}, author = {Tianyuan Shi and Canbin Huang and Bei Li and Xin Chen and Xiaojun Quan and Jingang Wang and Qifan Wang}, year = {2026}, eprint = {2606.24064}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2606.24064}, }