@misc{indiciae67a635873cdc, title = {SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs}, author = {Mohamad Alansari and Naufal Suryanto and Divya Velayudhan and Sajid Javed and Naoufel Werghi and Muzammal Naseer}, year = {2026}, url = {https://arxiv.org/abs/2603.12382}, note = {Source identifier: 2603.12382} }