@misc{indiciaefef2880f19eb, title = {Distributed Zeroth-Order Policy Gradient for Networked Multi-agent Reinforcement Learning from Human Feedback}, author = {Pengcheng Dai and He Wang and Dongming Wang and Jian Qin and Wenwu Yu}, year = {2026}, url = {https://arxiv.org/abs/2605.15697}, note = {Source identifier: 2605.15697} }