TY - RPRT TI - SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models AU - Yifu Huo AU - Chenglong Wang AU - Ziming Zhu AU - Shunjie Xing AU - Peinan Feng AU - Tongran Liu AU - Qiaozhi He AU - Tianhua Zhou AU - Xiaojia Chang AU - Jingbo Zhu AU - Zhengtao Yu AU - Tong Xiao PY - 2026 UR - https://arxiv.org/abs/2604.16995 ID - 2604.16995 ER -