TY - RPRT TI - Policy-based optimization: single-step policy gradient method seen as an evolution strategy AU - Jonathan Viquerat AU - Régis Duvigneau AU - Philippe Meliga AU - Alexander Kuhnle AU - Elie Hachem PY - 2021 UR - https://arxiv.org/abs/2104.06175 ID - 2104.06175 ER -