TY - RPRT TI - The Easy, the Hard, and the Learnable: Confidence and Difficulty-Adaptive Policy Optimization for LLM Reasoning AU - Zhanke Zhou AU - Xiangyu Lu AU - Chentao Cao AU - Brando Miranda AU - Tongliang Liu AU - Bo Han AU - Sanmi Koyejo PY - 2026 UR - https://arxiv.org/abs/2606.07950 ID - 2606.07950 ER -