TY - RPRT TI - Learning to summarize user information for personalized reinforcement learning from human feedback AU - Hyunji Nam AU - Yanming Wan AU - Mickel Liu AU - Peter Ahnn AU - Jianxun Lian AU - Natasha Jaques PY - 2026 UR - https://arxiv.org/abs/2507.13579 ID - 2507.13579 ER -