TY - RPRT TI - Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning AU - Junhao Shen AU - Haiteng Zhao AU - Yuzhe Gu AU - Songyang Gao AU - Kuikun Liu AU - Haian Huang AU - Jianfei Gao AU - Dahua Lin AU - Wenwei Zhang AU - Kai Chen PY - 2025 UR - https://arxiv.org/abs/2507.16814 ID - 2507.16814 ER -