@misc{indiciaedaf73d81530a, title = {MARPO: A Reflective Policy Optimization for Multi Agent Reinforcement Learning}, author = {Cuiling Wu and Yaozhong Gan and Junliang Xing and Ying Fu}, year = {2025}, url = {https://arxiv.org/abs/2512.22832}, note = {Source identifier: 2512.22832} }