TY - RPRT TI - Regret Bounds for Reinforcement Learning from Multi-Source Imperfect Preferences AU - Ming Shi AU - Yingbin Liang AU - Ness B. Shroff AU - Ananthram Swami PY - 2026 UR - https://arxiv.org/abs/2603.20453 ID - 2603.20453 ER -