@misc{indiciae0f8017e89b02, title = {Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos}, author = {Haobo Yuan and Xiangtai Li and Tao Zhang and Yueyi Sun and Zilong Huang and Shilin Xu and Shunping Ji and Yunhai Tong and Lu Qi and Jiashi Feng and Ming-Hsuan Yang}, year = {2026}, doi = {10.1109/tpami.2026.3720379}, url = {https://arxiv.org/abs/2501.04001}, note = {Source identifier: 2501.04001} }