@article{alignmentfakinginlargelanguagemodels, title = {Alignment faking in large language models}, author = {Ryan Greenblatt and Carson Denison and Benjamin Wright and Fabien Roger and Monte MacDiarmid and Sam Marks and Johannes Treutlein and Tim Belonax and Jack Chen and David Duvenaud and Akbir Khan and Julian Michael and Sören Mindermann and Ethan Perez and Linda Petrini and Jonathan Uesato and Jared Kaplan and Buck Shlegeris and Samuel R. Bowman and Evan Hubinger}, year = {2024}, eprint = {2412.14093}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2412.14093v2}, }