@misc{indiciaeb94d9ebc0022, title = {LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding}, author = {Hongyu Li and Jinyu Chen and Ziyu Wei and Shaofei Huang and Tianrui Hui and Jialin Gao and Xiaoming Wei and Si Liu}, year = {2025}, url = {https://arxiv.org/abs/2501.08282}, note = {Source identifier: 2501.08282} }