@article{safetyanalystinterpretabletransparentand, title = {SafetyAnalyst: Interpretable, Transparent, and Steerable Safety Moderation for AI Behavior}, author = {Jing-Jing Li and Valentina Pyatkin and Max Kleiman-Weiner and Liwei Jiang and Nouha Dziri and Anne G. E. Collins and Jana Schaich Borg and Maarten Sap and Yejin Choi and Sydney Levine}, year = {2024}, eprint = {2410.16665}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2410.16665v3}, }