TY - RPRT TI - Learning Goal-Oriented Visual Dialog via Tempered Policy Gradient AU - Rui Zhao AU - Volker Tresp PY - 2020 DO - 10.1109/slt.2018.8639546 UR - https://arxiv.org/abs/1807.00737 ID - 1807.00737 ER -