@article{semioffpolicyreinforcementlearningforvis, title = {Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning}, author = {Junhao Shen and Haiteng Zhao and Yuzhe Gu and Songyang Gao and Kuikun Liu and Haian Huang and Jianfei Gao and Dahua Lin and Wenwei Zhang and Kai Chen}, year = {2025}, eprint = {2507.16814}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2507.16814}, }