TY - RPRT TI - Policy Optimization and Multi-agent Reinforcement Learning for Mean-variance Team Stochastic Games AU - Junkai Hu AU - Li Xia PY - 2025 UR - https://arxiv.org/abs/2503.22779 ID - 2503.22779 ER -