TY - RPRT TI - One Model, All Roles: Multi-Turn, Multi-Agent Self-Play Reinforcement Learning for Conversational Social Intelligence AU - Bowen Jiang AU - Taiwei Shi AU - Ryo Kamoi AU - Yuan Yuan AU - Camillo J. Taylor AU - Longqi Yang AU - Pei Zhou AU - Sihao Chen PY - 2026 UR - https://arxiv.org/abs/2602.03109 ID - 2602.03109 ER -