TY - RPRT TI - Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient AU - Xiaoyang Yu AU - Youfang Lin AU - Shuo Wang AU - Sheng Han PY - 2025 UR - https://arxiv.org/abs/2507.09989 ID - 2507.09989 ER -