@misc{indiciaec682b594e894, title = {VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding}, author = {Shihao Wang and Guo Chen and De-an Huang and Zhiqi Li and Minghan Li and Guilin Liu and Jose M. Alvarez and Lei Zhang and Zhiding Yu}, year = {2026}, url = {https://arxiv.org/abs/2507.13353}, note = {Source identifier: 2507.13353} }