TY - RPRT TI - Learning Stochastic Optimal Policies via Gradient Descent AU - Stefano Massaroli AU - Michael Poli AU - Stefano Peluchetti AU - Jinkyoo Park AU - Atsushi Yamashita AU - Hajime Asama PY - 2021 DO - 10.1109/lcsys.2021.3086672. UR - https://arxiv.org/abs/2106.03780 ID - 2106.03780 ER -