TY - RPRT TI - Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning AU - Zhiyuan Hu AU - Yunhai Hu AU - Juncheng Liu AU - Shuyue Stella Li AU - Yucheng Wang AU - Zhen Xu AU - See-Kiong Ng AU - Anh Tuan Luu AU - Xinxing Xu AU - Bryan Hooi AU - Cynthia Breazeal AU - Hae Won Park PY - 2026 UR - https://arxiv.org/abs/2601.09667 ID - 2601.09667 ER -