@article{forgequalityawarereinforcementlearningfo, title = {Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs}, author = {Xiaozhe Li and Xinyu Fang and Shengyuan Ding and Yang Li and Linyang Li and Haodong Duan and Qingwen Liu and Kai Chen}, year = {2026}, eprint = {2605.08905}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2605.08905}, }