TY - RPRT TI - Personalized Multi-Agent Average Reward TD-Learning via Joint Linear Approximation AU - Leo Muxing Wang AU - Pengkun Yang AU - Lili Su PY - 2026 UR - https://arxiv.org/abs/2603.02426 ID - 2603.02426 ER -