@article{autodanautomaticandinterpretable, title = {AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models}, author = {Sicheng Zhu and Ruiyi Zhang and Bang An and Gang Wu and Joe Barrow and Zichao Wang and Furong Huang and Ani Nenkova and Tong Sun}, year = {2023}, eprint = {2310.15140}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2310.15140v2}, }