TY - RPRT TI - Making Bias Non-Predictive: Training Robust LLM Reasoning via Reinforcement Learning AU - Qian Wang AU - Xuandong Zhao AU - Zirui Zhang AU - Zhanzhi Lou AU - Nuo Chen AU - Dawn Song AU - Bingsheng He PY - 2026 UR - https://arxiv.org/abs/2602.01528 ID - 2602.01528 ER -