TY - RPRT TI - Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting AU - Yunlong Tang AU - Jing Bi AU - Chao Huang AU - Susan Liang AU - Daiki Shimada AU - Hang Hua AU - Yunzhong Xiao AU - Yizhi Song AU - Pinxin Liu AU - Mingqian Feng AU - Junjia Guo AU - Zhuo Liu AU - Luchuan Song AU - Ali Vosoughi AU - Jinxi He AU - Liu He AU - Zeliang Zhang AU - Jiebo Luo AU - Chenliang Xu PY - 2025 UR - https://arxiv.org/abs/2504.05541 ID - 2504.05541 ER -