@article{r1rewardtrainingmultimodalrewardmodel, title = {R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning}, author = {Yi-Fan Zhang and Xingyu Lu and Xiao Hu and Chaoyou Fu and Bin Wen and Tianke Zhang and Changyi Liu and Kaiyu Jiang and Kaibing Chen and Kaiyu Tang and Haojie Ding and Jiankang Chen and Fan Yang and Zhang Zhang and Tingting Gao and Liang Wang}, year = {2025}, eprint = {2505.02835}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2505.02835v2}, }