TY - RPRT TI - Self-Hinting Language Models Enhance Reinforcement Learning AU - Baohao Liao AU - Hanze Dong AU - Xinxing Xu AU - Christof Monz AU - Jiang Bian PY - 2026 UR - https://arxiv.org/abs/2602.03143 ID - 2602.03143 ER -