@article{thinkingbasednonthinkingsolvingthereward, title = {Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning}, author = {Siyuan Gan and Jiaheng Liu and Boyan Wang and Tianpei Yang and Runqing Miao and Yuyao Zhang and Fanyu Meng and Junlan Feng and Linjian Meng and Jing Huo and Yang Gao}, year = {2026}, eprint = {2601.04805}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2601.04805}, }