@misc{indiciae2b81f0da9c78, title = {How Far Are Video Models from True Multimodal Reasoning?}, author = {Xiaotian Zhang and Jianhui Wei and Yuan Wang and Jie Tan and Yichen Li and Yan Zhang and Ziyi Chen and Daoan Zhang and Dezhi YU and Wei Xu and Songtao Jiang and Zuozhu Liu}, year = {2026}, url = {https://arxiv.org/abs/2604.19193}, note = {Source identifier: 2604.19193} }