TY - RPRT TI - Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty AU - Chao Xue AU - Yao Wang AU - Mengqiao Liu AU - Di Liang AU - Xingsheng Han AU - Peiyang Liu AU - Xianjie Wu AU - Chenyao Lu AU - Lei Jiang AU - Yu Lu AU - Haibo Shi AU - Shuang Liang AU - Minlong Peng AU - Flora D. Salim PY - 2026 UR - https://arxiv.org/abs/2604.10072 ID - 2604.10072 ER -