TY - RPRT TI - Descent-Guided Policy Gradient for Scalable Cooperative Multi-Agent Learning AU - Shan Yang AU - Yang Liu PY - 2026 UR - https://arxiv.org/abs/2602.20078 ID - 2602.20078 ER -