TY - RPRT TI - POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration AU - Yuxiao Qu AU - Amrith Setlur AU - Virginia Smith AU - Ruslan Salakhutdinov AU - Aviral Kumar PY - 2026 UR - https://arxiv.org/abs/2601.18779 ID - 2601.18779 ER -