TY - RPRT TI - When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning AU - Xiuyi Lou AU - Zicheng Xu AU - Yu-Neng Chuang AU - Hoang Anh Duy Le AU - Zhaozhuo Xu AU - Guanchu Wang AU - Vladimir Braverman PY - 2026 UR - https://arxiv.org/abs/2607.07976 ID - 2607.07976 ER -