TY - RPRT TI - Sample-Efficient Reinforcement Learning from Human Feedback via Information-Directed Sampling AU - Han Qi AU - Haochen Yang AU - Qiaosheng Zhang AU - Zhuoran Yang PY - 2025 UR - https://arxiv.org/abs/2502.05434 ID - 2502.05434 ER -