@misc{indiciae8ec0c3c778a8, title = {Say, Dream, and Act: Learning Video World Models for Instruction-Driven Robot Manipulation}, author = {Songen Gu and Yunuo Cai and Tianyu Wang and Simo Wu and Yanwei Fu}, year = {2026}, url = {https://arxiv.org/abs/2602.10717}, note = {Source identifier: 2602.10717} }