@misc{indiciae0ee94c460ffe, title = {CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models}, author = {Zihui Cheng and Qiguang Chen and Jin Zhang and Hao Fei and Xiaocheng Feng and Wanxiang Che and Min Li and Libo Qin}, year = {2025}, url = {https://arxiv.org/abs/2412.12932}, note = {Source identifier: 2412.12932} }