@article{beyondgrpoandonpolicydistillationanempir, title = {Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training}, author = {Yuanda Xu and Hejian Sang and Zhengze Zhou and Ran He and Zhipeng Wang and Alborz Geramifard}, year = {2026}, eprint = {2605.12483}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2605.12483}, }