@article{reinforcementlearningamplifiesemergentmi, title = {Reinforcement Learning Can Amplify Emergent Misalignment from Harmless Rewards}, author = {Magnus Jørgenvåg and David Kaczér and Lasse Ruttert and Marvin Gülhan and Lucie Flek and Florian Mai}, year = {2026}, eprint = {2605.31328}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2605.31328}, }