TY - RPRT TI - Predicting and improving test-time scaling laws via reward tail-guided search AU - Muheng Li AU - Jian Qian AU - Wenlong Mou PY - 2026 UR - https://arxiv.org/abs/2602.01485 ID - 2602.01485 ER -