@article{modularizedreinforcementlearningonllmsfr, title = {Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning}, author = {Zhao Yang and Yuxuan Jiang and Ting-Chih Chen and Lincen Yang and Annie Wong and Chao Gao and Jacob E. Kooi and Zhong Li and Jiayang Shi and Kevin Qiu and Qi Huang and Xinrui Zu and Shiping Yang and Hengyuan Zhang and Ngai Wong and Filip Ilievski and Shujian Yu and Aske Plaat and Zhaochun Ren and Mark Hoogendoorn and Vincent François-Lavet}, year = {2026}, eprint = {2606.21943}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2606.21943}, }