@misc{indiciae63cfd32f7b28, title = {VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos}, author = {Shehan Munasinghe and Hanan Gani and Wenqi Zhu and Jiale Cao and Eric Xing and Fahad Shahbaz Khan and Salman Khan}, year = {2025}, url = {https://arxiv.org/abs/2411.04923}, note = {Source identifier: 2411.04923} }