TY - RPRT TI - Distribution-Aware Reward Estimation for Test-Time Reinforcement Learning AU - Bodong Du AU - Xuanqi Huang AU - Xiaomeng Li PY - 2026 UR - https://arxiv.org/abs/2601.21804 ID - 2601.21804 ER -