@misc{indiciaea82ba1d0b9ca, title = {ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models}, author = {Tingshu Mou and Jiabo He and Renying Wang and Ce Liu and Hao Yang and Tiehua Zhang and Jingjing Chen and Xingjun Ma}, year = {2026}, url = {https://arxiv.org/abs/2605.10106}, note = {Source identifier: 2605.10106} }