TY - RPRT TI - ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning AU - Qing Miao AU - Yiming Zhao AU - Jing Yang AU - Chenxi Liu AU - Yuehai Chen AU - Yuewen Liu AU - Shaoyi Du AU - Badong Chen PY - 2026 UR - https://arxiv.org/abs/2606.08088 ID - 2606.08088 ER -