TY - RPRT TI - Multi-agent cooperation through learning-aware policy gradients AU - Alexander Meulemans AU - Seijin Kobayashi AU - Johannes von Oswald AU - Nino Scherrer AU - Eric Elmoznino AU - Blake Richards AU - Guillaume Lajoie AU - Blaise Agüera y Arcas AU - João Sacramento PY - 2025 UR - https://arxiv.org/abs/2410.18636 ID - 2410.18636 ER -