@misc{indiciae0958d85d6880, title = {VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models}, author = {Zejun Li and Ruipu Luo and Jiwen Zhang and Minghui Qiu and Xuanjing Huang and Zhongyu Wei}, year = {2025}, url = {https://arxiv.org/abs/2405.16919}, note = {Source identifier: 2405.16919} }