TY - RPRT TI - Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition AU - Dan Qiao AU - Wenhao Li AU - Shanchao Yang AU - Hongyuan Zha AU - Baoxiang Wang PY - 2026 UR - https://arxiv.org/abs/2505.05968 ID - 2505.05968 ER -