TY - RPRT TI - STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability AU - Haipeng Luo AU - Qingfeng Sun AU - Songli Wu AU - Can Xu AU - Wenfeng Deng AU - Han Hu AU - Yansong Tang PY - 2026 UR - https://arxiv.org/abs/2606.19236 ID - 2606.19236 ER -