TY - RPRT TI - Cold-Start Reinforcement Learning with Softmax Policy Gradient AU - Nan Ding AU - Radu Soricut PY - 2017 UR - https://arxiv.org/abs/1709.09346 ID - 1709.09346 ER -