TY - RPRT TI - Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback AU - Teng Xiao AU - Suhang Wang PY - 2024 DO - 10.1609/aaai.v36i8.20849 UR - https://arxiv.org/abs/2401.08959 ID - 2401.08959 ER -