TY - RPRT TI - Dream to Chat: Model-based Reinforcement Learning on Dialogues with User Belief Modeling AU - Yue Zhao AU - Xiaoyu Wang AU - Dan Wang AU - Zhonglin Jiang AU - Qingqing Gu AU - Teng Chen AU - Ningyuan Xi AU - Jinxian Qu AU - Yong Chen AU - Luo Ji PY - 2025 UR - https://arxiv.org/abs/2508.16876 ID - 2508.16876 ER -