TY - RPRT TI - Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization AU - Xiaoyuan Cheng AU - Wenxuan Yuan AU - Zhancun Mu AU - Yuanzhao Zhang AU - Yiming Yang AU - Hai Wang AU - Zhuo Sun AU - Che Liu PY - 2026 UR - https://arxiv.org/abs/2605.26282 ID - 2605.26282 ER -