TY - RPRT TI - Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement Learning AU - Tiehua Mei AU - Minxuan Lv AU - Leiyu Pan AU - Zhenpeng Su AU - Hongru Hou AU - Hengrui Chen AU - Ao Xu AU - Deqing Yang PY - 2026 UR - https://arxiv.org/abs/2603.09803 ID - 2603.09803 ER -