@article{answerconsistentchainofthoughtreinforcem, title = {Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models}, author = {Minbin Huang and Runhui Huang and Chuanyang Zheng and Jingyao Li and Guoxuan Chen and Han Shi and Hong Cheng}, year = {2025}, eprint = {2510.10104}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2510.10104}, }