@article{whymultisteptoolusereinforcementlearning, title = {Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It}, author = {Yupu Hao and Zhuoran Jin and Huanxuan Liao and Kang Liu and Jun Zhao}, year = {2026}, eprint = {2606.26027}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2606.26027}, }