TY - RPRT TI - Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability Learning AU - Ömer Faruk Akgül AU - Rajgopal Kannan AU - Willie Neiswanger AU - Viktor Prasanna PY - 2026 UR - https://arxiv.org/abs/2605.06241 ID - 2605.06241 ER -