TY - RPRT TI - Interaction-Grounded Learning for Contextual Markov Decision Processes with Personalized Feedback AU - Mengxiao Zhang AU - Yuheng Zhang AU - Haipeng Luo AU - Paul Mineiro PY - 2026 UR - https://arxiv.org/abs/2602.08307 ID - 2602.08307 ER -