TY - RPRT TI - STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens AU - Shiqi Liu AU - Zeyu He AU - Guojian Zhan AU - Letian Tao AU - Zhilong Zheng AU - Jiang Wu AU - Yinuo Wang AU - Yang Guan AU - Kehua Sheng AU - Bo Zhang AU - Keqiang Li AU - Jingliang Duan AU - Shengbo Eben Li PY - 2026 UR - https://arxiv.org/abs/2602.15620 ID - 2602.15620 ER -