@article{smopdmultirewardreinforcementlearningvia, title = {SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation}, author = {Wen Wang and Jiahua Bao and Tu Yongsiqi and Yihao Liu and Haotian Zhou and Haoxuan Ma and Mengyu Zhou and Wenkui Fan and Junwei He and Xiaoxi Jiang and Guanjun Jiang}, year = {2026}, eprint = {2608.03092}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2608.03092}, }