@article{rewardevolutionwithgraphofthoughtsabilev, title = {Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning}, author = {Changwei Yao and Xinzi Liu and Chen Li and Marios Savvides}, year = {2025}, eprint = {2509.16136}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2509.16136}, }