@article{prefgrpopairwisepreferencerewardbasedgrp, title = {Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning}, author = {Yibin Wang and Zhimin Li and Yuhang Zang and Yujie Zhou and Jiazi Bu and Chunyu Wang and Qinglin Lu and Cheng Jin and Jiaqi Wang}, year = {2025}, eprint = {2508.20751}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2508.20751}, }