TY - RPRT TI - R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning AU - Zirui Zhang AU - Haoyu Dong AU - Kexin Pei AU - Chengzhi Mao PY - 2026 UR - https://arxiv.org/abs/2603.25720 ID - 2603.25720 ER -