TY - RPRT TI - Answer First, Reason Later: Aligning Search Relevance via Mode-Balanced Reinforcement Learning AU - Shijie Zhang AU - Xiang Guo AU - Rujun Guo AU - Shaoyu Liu AU - Xiaozhao Wang AU - Guanjun Jiang AU - Kevin Zhang PY - 2026 UR - https://arxiv.org/abs/2602.10006 ID - 2602.10006 ER -