@misc{indiciae6fc158eadc92, title = {EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL}, author = {Lunjun Zhang and Jimmy Ba}, year = {2026}, url = {https://arxiv.org/abs/2602.04417}, note = {Source identifier: 2602.04417} }