TY - RPRT TI - LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding AU - Hongyu Li AU - Jinyu Chen AU - Ziyu Wei AU - Shaofei Huang AU - Tianrui Hui AU - Jialin Gao AU - Xiaoming Wei AU - Si Liu PY - 2025 UR - https://arxiv.org/abs/2501.08282 ID - 2501.08282 ER -