TY - RPRT TI - IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents AU - Senhao Wang AU - Chenghao Cai AU - Haitao Hu AU - Mingxing Huang AU - Xingguang Wang AU - Wenhao Li AU - Zecheng Lin PY - 2026 UR - https://arxiv.org/abs/2608.06735 ID - 2608.06735 ER -