@article{planthenactionhighlevelplanningguidancer, title = {Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning}, author = {Zhihao Dou and Qinjian Zhao and Zhongwei Wan and Dinggen Zhang and Weida Wang and Towsif Raiyan and Benteng Chen and Qingtao Pan and Yang Ouyang and Chaoda Song and Zhiqiang Gao and Shufei Zhang and Sumon Biswas}, year = {2025}, eprint = {2510.01833}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2510.01833}, }