@article{reasoninchainslearnintreesselfrectificat, title = {Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization}, author = {Yu Li and Sizhe Tang and Tian Lan}, year = {2026}, eprint = {2604.07165}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2604.07165}, }