@article{alleviatingsparserewardsbymodelingstepwi, title = {Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO}, author = {Yunze Tong and Mushui Liu and Canyu Zhao and Didi Zhu and Wanggui He and Shiyi Zhang and Hongwei Zhang and Peng Zhang and Jinlong Liu and Hao Jiang}, year = {2026}, eprint = {2602.06422}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2602.06422}, }