TY - RPRT TI - Think Longer to Explore Deeper: Learn to Explore In-Context via Length-Incentivized Reinforcement Learning AU - Futing Wang AU - Jianhao Yan AU - Yun Luo AU - Ganqu Cui AU - Zhi Wang AU - Xiaoye Qu AU - Yue Zhang AU - Yu Cheng AU - Tao Lin PY - 2026 UR - https://arxiv.org/abs/2602.11748 ID - 2602.11748 ER -