@misc{indiciaea0cf2177d947, title = {Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization}, author = {Changli Tang and Yixuan Li and Yudong Yang and Jimin Zhuang and Guangzhi Sun and Wei Li and Zujun Ma and Chao Zhang}, year = {2024}, url = {https://arxiv.org/abs/2410.06682}, note = {Source identifier: 2410.06682} }