@article{emulateddisalignmentsafetyalignmentfor, title = {Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!}, author = {Zhanhui Zhou and Jie Liu and Zhichen Dong and Jiaheng Liu and Chao Yang and Wanli Ouyang and Yu Qiao}, year = {2024}, eprint = {2402.12343}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2402.12343v4}, }