TY - RPRT TI - GUARD: Role-playing to Generate Natural-language Jailbreakings to Test Guideline Adherence of Large Language Models AU - Haibo Jin AU - Ruoxi Chen AU - Peiyan Zhang AU - Andy Zhou AU - Haohan Wang PY - 2025 UR - https://arxiv.org/abs/2402.03299 ID - 2402.03299 ER -