@misc{indiciaeae17ad770520, title = {Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models}, author = {Minbin Huang and Runhui Huang and Chuanyang Zheng and Jingyao Li and Guoxuan Chen and Han Shi and Hong Cheng}, year = {2025}, url = {https://arxiv.org/abs/2510.10104}, note = {Source identifier: 2510.10104} }