TY - RPRT TI - Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning AU - Yuxiao Qu AU - Matthew Y. R. Yang AU - Amrith Setlur AU - Lewis Tunstall AU - Edward Emanuel Beeching AU - Ruslan Salakhutdinov AU - Aviral Kumar PY - 2025 UR - https://arxiv.org/abs/2503.07572 ID - 2503.07572 ER -