TY - RPRT TI - Policy Optimization via Adv2: Adversarial Learning on Advantage Functions AU - Matthieu Jonckheere AU - Chiara Mignacco AU - Gilles Stoltz PY - 2025 UR - https://arxiv.org/abs/2310.16473 ID - 2310.16473 ER -