TY - RPRT TI - Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration AU - Zhicheng Yang AU - Zhijiang Guo AU - Yinya Huang AU - Yongxin Wang AU - Dongchun Xie AU - Hanhui Li AU - Yiwei Wang AU - Xiaodan Liang AU - Jing Tang PY - 2026 UR - https://arxiv.org/abs/2508.13755 ID - 2508.13755 ER -