@misc{indiciae10e60d5229f8, title = {Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning}, author = {Junhao Shen and Haiteng Zhao and Yuzhe Gu and Songyang Gao and Kuikun Liu and Haian Huang and Jianfei Gao and Dahua Lin and Wenwei Zhang and Kai Chen}, year = {2025}, url = {https://arxiv.org/abs/2507.16814}, note = {Source identifier: 2507.16814} }