TY - RPRT TI - Learning Optimal Deterministic Policies with Stochastic Policy Gradients AU - Alessandro Montenegro AU - Marco Mussi AU - Alberto Maria Metelli AU - Matteo Papini PY - 2024 UR - https://arxiv.org/abs/2405.02235 ID - 2405.02235 ER -