@article{themirageofoptimizingtrainingpoliciesmon, title = {The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning}, author = {Jing Liang and Hongyao Tang and Yi Ma and Yancheng He and Weixun Wang and Xiaoyang Li and Ju Huang and Wenbo Su and Jinyi Liu and Yan Zheng and Jianye Hao and Bo Zheng}, year = {2026}, eprint = {2606.29526}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2606.29526}, }