TY - RPRT TI - xJailbreak: Representation Space Guided Reinforcement Learning for Interpretable LLM Jailbreaking AU - Sunbowen Lee AU - Shiwen Ni AU - Chi Wei AU - Shuaimin Li AU - Liyang Fan AU - Ahmadreza Argha AU - Hamid Alinejad-Rokny AU - Ruifeng Xu AU - Yicheng Gong AU - Min Yang PY - 2025 UR - https://arxiv.org/abs/2501.16727 ID - 2501.16727 ER -