TY - RPRT TI - Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback AU - Patrick Wilhelm AU - Odej Kao PY - 2026 UR - https://arxiv.org/abs/2607.13389 ID - 2607.13389 ER -