@misc{indiciae9dac24ca3bc9, title = {SafetyAnalyst: Interpretable, Transparent, and Steerable Safety Moderation for AI Behavior}, author = {Jing-Jing Li and Valentina Pyatkin and Max Kleiman-Weiner and Liwei Jiang and Nouha Dziri and Anne G. E. Collins and Jana Schaich Borg and Maarten Sap and Yejin Choi and Sydney Levine}, year = {2025}, url = {https://arxiv.org/abs/2410.16665}, note = {Source identifier: 2410.16665} }