@misc{indiciae6cd1ea637bf8, title = {Learning Stochastic Optimal Policies via Gradient Descent}, author = {Stefano Massaroli and Michael Poli and Stefano Peluchetti and Jinkyoo Park and Atsushi Yamashita and Hajime Asama}, year = {2021}, doi = {10.1109/lcsys.2021.3086672.}, url = {https://arxiv.org/abs/2106.03780}, note = {Source identifier: 2106.03780} }