@misc{indiciaee302d64ad3ed, title = {Video Understanding: From Geometry and Semantics to Unified Models}, author = {Zhaochong An and Zirui Li and Mingqiao Ye and Feng Qiao and Jiaang Li and Zongwei Wu and Vishal Thengane and Chengzu Li and Lei Li and Luc Van Gool and Guolei Sun and Serge Belongie}, year = {2026}, doi = {10.1007/s11633-026-1656-7}, url = {https://arxiv.org/abs/2603.17840}, note = {Source identifier: 2603.17840} }