TY - RPRT TI - Neural Dueling Bandits: Preference-Based Optimization with Human Feedback AU - Arun Verma AU - Zhongxiang Dai AU - Xiaoqiang Lin AU - Patrick Jaillet AU - Bryan Kian Hsiang Low PY - 2025 UR - https://arxiv.org/abs/2407.17112 ID - 2407.17112 ER -