TY - RPRT TI - Distributed Zeroth-Order Policy Gradient for Networked Multi-agent Reinforcement Learning from Human Feedback AU - Pengcheng Dai AU - He Wang AU - Dongming Wang AU - Jian Qin AU - Wenwu Yu PY - 2026 UR - https://arxiv.org/abs/2605.15697 ID - 2605.15697 ER -