TY - RPRT TI - Switch-based Active Deep Dyna-Q: Efficient Adaptive Planning for Task-Completion Dialogue Policy Learning AU - Yuexin Wu AU - Xiujun Li AU - Jingjing Liu AU - Jianfeng Gao AU - Yiming Yang PY - 2018 UR - https://arxiv.org/abs/1811.07550 ID - 1811.07550 ER -