TY - RPRT TI - FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning AU - Zhaopeng Qiu AU - Shuang Yu AU - Jingqi Zhang AU - Shuai Zhang AU - Xue Huang AU - Jingyi Yang AU - Junjie Lai PY - 2026 UR - https://arxiv.org/abs/2601.18150 ID - 2601.18150 ER -