TY - RPRT TI - EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL AU - Lunjun Zhang AU - Jimmy Ba PY - 2026 UR - https://arxiv.org/abs/2602.04417 ID - 2602.04417 ER -