TY - RPRT TI - Learning Latent Reasoning Traces for Scalar Reward Models End-to-End AU - Sanwoo Lee AU - Clive Bai AU - Hsiu-Yuan Huang AU - Kun Liang AU - Weijie Liu AU - Yunfang Wu PY - 2026 UR - https://arxiv.org/abs/2607.29185 ID - 2607.29185 ER -