TY - RPRT TI - Sequential Search with Off-Policy Reinforcement Learning AU - Dadong Miao AU - Yanan Wang AU - Guoyu Tang AU - Lin Liu AU - Sulong Xu AU - Bo Long AU - Yun Xiao AU - Lingfei Wu AU - Yunjiang Jiang PY - 2022 DO - 10.1145/3459637.3481954 UR - https://arxiv.org/abs/2202.00245 ID - 2202.00245 ER -