TY - RPRT TI - Learning to Hint for Reinforcement Learning AU - Yu Xia AU - Canwen Xu AU - Zhewei Yao AU - Julian McAuley AU - Yuxiong He PY - 2026 UR - https://arxiv.org/abs/2604.00698 ID - 2604.00698 ER -