TY - RPRT TI - An Expectation-Maximization Perspective on Reinforcement Learning for LLM Reasoning AU - Tianbing Xu PY - 2026 UR - https://arxiv.org/abs/2504.18587 ID - 2504.18587 ER -