@misc{indiciaeb731e82edac6, title = {OHP-RL: Online Human Preference as Guidance in Reinforcement Learning for Robot Manipulation}, author = {Yunyang Mo and Jian Li and Qiwei Wu and Yihang Kang and Renjing Xu}, year = {2026}, url = {https://arxiv.org/abs/2605.15971}, note = {Source identifier: 2605.15971} }