TY - RPRT TI - Sample-Efficient Reinforcement Learning with Maximum Entropy Mellowmax Episodic Control AU - Marta Sarrico AU - Kai Arulkumaran AU - Andrea Agostinelli AU - Pierre Richemond AU - Anil Anthony Bharath PY - 2019 UR - https://arxiv.org/abs/1911.09615 ID - 1911.09615 ER -