TY - RPRT TI - Exploring Re-inforcement Learning via Human Feedback under User Heterogeneity AU - Sarvesh Shashidhar AU - Abhishek Mishra AU - Madhav Kotecha PY - 2026 UR - https://arxiv.org/abs/2601.20760 ID - 2601.20760 ER -