TY - RPRT TI - Difficulty-Adaptive Tree-Structured Policy Optimization for Expanding Reasoning Coverage in RLVR AU - Youngjun Yu AU - Sanghwan Jang AU - Hwanjo Yu PY - 2026 UR - https://arxiv.org/abs/2609.08650 ID - 2609.08650 ER -