@misc{indiciae7c341e21a09b, title = {SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability}, author = {Jiankang Wang and Zhihan Zhang and Zhihang Liu and Yang Li and Jiannan Ge and Hongtao Xie and Yongdong Zhang}, year = {2025}, url = {https://arxiv.org/abs/2503.13983}, note = {Source identifier: 2503.13983} }