TY - RPRT TI - One Adapts to Any: Meta Reward Modeling for Personalized LLM Alignment AU - Hongru Cai AU - Yongqi Li AU - Tiezheng Yu AU - Fengbin Zhu AU - Wenjie Wang AU - Fuli Feng AU - Wenjie Li PY - 2026 UR - https://arxiv.org/abs/2601.18731 ID - 2601.18731 ER -