TY - RPRT TI - Q-Learning in enormous action spaces via amortized approximate maximization AU - Tom Van de Wiele AU - David Warde-Farley AU - Andriy Mnih AU - Volodymyr Mnih PY - 2020 UR - https://arxiv.org/abs/2001.08116 ID - 2001.08116 ER -