TY - RPRT TI - Detecting and Understanding Vulnerabilities in Language Models via Mechanistic Interpretability AU - Jorge García-Carrasco AU - Alejandro Maté AU - Juan Trujillo PY - 2024 DO - 10.24963/ijcai.2024/43 UR - https://arxiv.org/abs/2407.19842 ID - 2407.19842 ER -