TY - RPRT TI - Using Context Is Not Enough: Test-Time Training for Personalized Reward Modeling AU - Bohao Wang AU - Xiaoyan Zhao AU - Yang Zhang AU - Jinghang Guo AU - Chun Chen AU - Can Wang AU - Jiawei Chen PY - 2026 UR - https://arxiv.org/abs/2609.35109 ID - 2609.35109 ER -