TY - RPRT TI - A Recipe for Long-Context Reasoning in Large Language Models via On-Policy Optimization and Distillation AU - Miguel Moura Ramos AU - Duarte M. Alves AU - André F. T. Martins PY - 2026 UR - https://arxiv.org/abs/2605.12227 ID - 2605.12227 ER -