TY - RPRT TI - On the Optimal Reasoning Length for RL-Trained Language Models AU - Daisuke Nohara AU - Taishi Nakamura AU - Rio Yokota PY - 2026 UR - https://arxiv.org/abs/2602.09591 ID - 2602.09591 ER -