@article{inverseqtokenlevelreinforcementlearning, title = {Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data}, author = {Han Xia and Songyang Gao and Qiming Ge and Zhiheng Xi and Qi Zhang and Xuanjing Huang}, year = {2024}, eprint = {2408.14874}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2408.14874v2}, }