@misc{indiciae4ccb6888ce06, title = {Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search}, author = {Linhao Yu and Xinguang Ji and Yahui Liu and Fanheng Kong and Chenxi Sun and Jingyuan Zhang and Hongzhi Zhang and V. W. and Fuzheng Zhang and Deyi Xiong}, year = {2025}, url = {https://arxiv.org/abs/2506.11155}, note = {Source identifier: 2506.11155} }