TY - RPRT TI - Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals AU - Sirui Chen AU - Lei Xu AU - Yuying Zhao AU - Yutian Chen AU - Yu Wang AU - Beier Zhu AU - Hanwang Zhang AU - Shengjie Zhao AU - Chaochao Lu PY - 2026 UR - https://arxiv.org/abs/2605.23384 ID - 2605.23384 ER -