TY - RPRT TI - OHP-RL: Online Human Preference as Guidance in Reinforcement Learning for Robot Manipulation AU - Yunyang Mo AU - Jian Li AU - Qiwei Wu AU - Yihang Kang AU - Renjing Xu PY - 2026 UR - https://arxiv.org/abs/2605.15971 ID - 2605.15971 ER -