TY - RPRT TI - OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration AU - Yiqin Yang AU - Hao Hu AU - Yihuan Mao AU - Jin Zhang AU - Chengjie Wu AU - Yuhua Jiang AU - Xu Yang AU - Runpeng Xie AU - Yi Fan AU - Bo Liu AU - Yang Gao AU - Bo Xu AU - Chongjie Zhang PY - 2026 UR - https://arxiv.org/abs/2604.02349 ID - 2604.02349 ER -