TY - RPRT TI - Reinforcement Learning for Individual Optimal Policy from Heterogeneous Data AU - Rui Miao AU - Babak Shahbaba AU - Annie Qu PY - 2026 UR - https://arxiv.org/abs/2505.09496 ID - 2505.09496 ER -