@article{howoffpolicycangrpobemugrpoforefficientl, title = {How Off-Policy Can GRPO Be? Mu-GRPO for Efficient LLM Reinforcement Learning}, author = {Minghao Tian and Yunfei Xie and Chen Wei}, year = {2026}, eprint = {2605.17570}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2605.17570}, }