TY - RPRT TI - R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning AU - Qi Yang AU - Bolin Ni AU - Shiming Xiang AU - Han Hu AU - Houwen Peng AU - Jie Jiang PY - 2025 UR - https://arxiv.org/abs/2508.21113 ID - 2508.21113 ER -