@article{jailbreakinglargelanguagemodelsagainst, title = {Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters}, author = {Haibo Jin and Andy Zhou and Joe D. Menke and Haohan Wang}, year = {2024}, eprint = {2405.20413}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2405.20413v1}, }