TY - RPRT TI - How Off-Policy Can GRPO Be? Mu-GRPO for Efficient LLM Reinforcement Learning AU - Minghao Tian AU - Yunfei Xie AU - Chen Wei PY - 2026 UR - https://arxiv.org/abs/2605.17570 ID - 2605.17570 ER -