TY - RPRT TI - Optimization for Reinforcement Learning: From Single Agent to Cooperative Agents AU - Donghwan Lee AU - Niao He AU - Parameswaran Kamalaruban AU - Volkan Cevher PY - 2019 DO - 10.1109/msp.2020.2976000 UR - https://arxiv.org/abs/1912.00498 ID - 1912.00498 ER -