TY - RPRT TI - Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models AU - Minbin Huang AU - Runhui Huang AU - Chuanyang Zheng AU - Jingyao Li AU - Guoxuan Chen AU - Han Shi AU - Hong Cheng PY - 2025 UR - https://arxiv.org/abs/2510.10104 ID - 2510.10104 ER -