TY - RPRT TI - TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models AU - Xin Wang AU - Hao Yu AU - Zhengyang Zhuge AU - Bochao Mao AU - Zheng Li AU - Junda Feng AU - Yuyan Luo AU - Yi Zhang AU - Yizhong Cao AU - Mi Zhang AU - Dayiheng Liu AU - Jianwei Zhang PY - 2026 UR - https://arxiv.org/abs/2610.07767 ID - 2610.07767 ER -