@misc{indiciae954e17516283, title = {VideoFusion: A Spatio-Temporal Collaborative Network for Multi-modal Video Fusion}, author = {Linfeng Tang and Yeda Wang and Meiqi Gong and Zizhuo Li and Yuxin Deng and Xunpeng Yi and Chunyu Li and Han Xu and Hao Zhang and Jiayi Ma}, year = {2026}, url = {https://arxiv.org/abs/2503.23359}, note = {Source identifier: 2503.23359} }