TY - RPRT TI - Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning AU - Weitao Feng AU - Lixu Wang AU - Peizhuo Lv AU - Tianyi Wei AU - Jie Zhang AU - Chongyang Gao AU - Sinong Zhan AU - Wei Dong PY - 2026 UR - https://arxiv.org/abs/2508.20697 ID - 2508.20697 ER -