@misc{indiciae369c8271ee62, title = {Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation}, author = {Yanbo Ding and Yijia Fan and Caihua Shan and Yifan Yang and Yifei Shen and Weijie Wang and Xirui Hu and Dongsheng Li and Lili Qiu and Yuqing Yang and Yali Wang}, year = {2026}, url = {https://arxiv.org/abs/2608.14043}, note = {Source identifier: 2608.14043} }