@misc{indiciae33d0bf4b312a, title = {TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models}, author = {Ziyao Shangguan and Chuhan Li and Yuxuan Ding and Yanan Zheng and Yilun Zhao and Tesca Fitzgerald and Arman Cohan}, year = {2025}, url = {https://arxiv.org/abs/2410.23266}, note = {Source identifier: 2410.23266} }