TY - RPRT TI - Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback AU - Yunpeng Chu PY - 2026 UR - https://arxiv.org/abs/2607.26094 ID - 2607.26094 ER -