@article{usingmechanisticinterpretabilitytocraft, title = {Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models}, author = {Thomas Winninger and Boussad ADDAD and Katarzyna Kapusta}, year = {2025}, eprint = {2503.06269}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2503.06269v2}, }