@article{counteringrewardoveroptimizationinllm, title = {Countering Reward Over-optimization in LLM with Demonstration-Guided Reinforcement Learning}, author = {Mathieu Rita and Florian Strub and Rahma Chaabouni and Paul Michel and Emmanuel Dupoux and Olivier Pietquin}, year = {2024}, eprint = {2404.19409}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2404.19409v1}, }