@article{pr2predictiveroutingreplayformoebasedllm, title = {PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning}, author = {Daize Dong and Junlin Chen and Haolong Jia and Jiang Liu and Jiawei Wu and Huanwei Di and Jialian Wu and Zhengzhong Liu and Zicheng Liu and Emad Barsoum and Dimitris N. Metaxas and Hongyi Wang}, year = {2026}, eprint = {2606.00395}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2606.00395}, }