TY - RPRT TI - Phi-3 Safety Post-Training: Aligning Language Models with a "Break-Fix" Cycle AU - Emman Haider AU - Daniel Perez-Becker AU - Thomas Portet AU - Piyush Madan AU - Amit Garg AU - Atabak Ashfaq AU - David Majercak AU - Wen Wen AU - Dongwoo Kim AU - Ziyi Yang AU - Jianwen Zhang AU - Hiteshi Sharma AU - Blake Bullwinkel AU - Martin Pouliot AU - Amanda Minnich AU - Shiven Chawla AU - Solianna Herrera AU - Shahed Warreth AU - Maggie Engler AU - Gary Lopez AU - Nina Chikanov AU - Raja Sekhar Rao Dheekonda AU - Bolor-Erdene Jagdagdorj AU - Roman Lutz AU - Richard Lundeen AU - Tori Westerhoff AU - Pete Bryan AU - Christian Seifert AU - Ram Shankar Siva Kumar AU - Andrew Berkley AU - Alex Kessler PY - 2024 UR - https://arxiv.org/abs/2407.13833 ID - 2407.13833 ER -