TY - RPRT TI - QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides AU - Zhengyang Zhuge AU - Hao Yu AU - Xin Wang AU - Zheng Li AU - Yizhong Cao AU - Dayiheng Liu AU - Jianwei Zhang PY - 2026 UR - https://arxiv.org/abs/2607.15810 ID - 2607.15810 ER -