TY - RPRT TI - Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization AU - Huilin Zhou AU - Jian Zhao AU - Yilu Zhong AU - Zhen Liang AU - Xiuyuan Chen AU - Yuchen Yuan AU - Tianle Zhang AU - Chi Zhang AU - Lan Zhang AU - Xuelong Li PY - 2026 UR - https://arxiv.org/abs/2605.10067 ID - 2605.10067 ER -