@article{gupogradientuncertaintyawarepolicyoptimi, title = {GUPO: Gradient Uncertainty-aware Policy Optimization for Post-Training Large Language Models}, author = {Peizheng Guo and Jianqi Zhang and Xingyu Zhang and Yun Fan and Jiahuan Zhou and Changwen Zheng and Wenwen Qiang}, year = {2026}, eprint = {2608.17411}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2608.17411}, }