@misc{indiciae96c525826746, title = {Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting}, author = {Yunlong Tang and Jing Bi and Chao Huang and Susan Liang and Daiki Shimada and Hang Hua and Yunzhong Xiao and Yizhi Song and Pinxin Liu and Mingqian Feng and Junjia Guo and Zhuo Liu and Luchuan Song and Ali Vosoughi and Jinxi He and Liu He and Zeliang Zhang and Jiebo Luo and Chenliang Xu}, year = {2025}, url = {https://arxiv.org/abs/2504.05541}, note = {Source identifier: 2504.05541} }