TY - RPRT TI - Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback AU - Gihoon Kim AU - Euntai Kim PY - 2026 UR - https://arxiv.org/abs/2603.12595 ID - 2603.12595 ER -