@misc{indiciae2edd139c6a6b, title = {Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions}, author = {Lu Ma and Hao Liang and Meiyi Qiang and Lexiang Tang and Xiaochen Ma and Zhen Hao Wong and Junbo Niu and Chengyu Shen and Runming He and Yanhao Li and Bin Cui and Wentao Zhang}, year = {2026}, url = {https://arxiv.org/abs/2506.07527}, note = {Source identifier: 2506.07527} }