@misc{indiciae8cb30acf99f7, title = {VLM4D: Towards Spatiotemporal Awareness in Vision Language Models}, author = {Shijie Zhou and Alexander Vilesov and Xuehai He and Ziyu Wan and Shuwang Zhang and Aditya Nagachandra and Di Chang and Dongdong Chen and Xin Eric Wang and Achuta Kadambi}, year = {2025}, url = {https://arxiv.org/abs/2508.02095}, note = {Source identifier: 2508.02095} }