TY - RPRT TI - Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning AU - Luckeciano C. Melo AU - Alessandro Abate AU - Yarin Gal PY - 2026 UR - https://arxiv.org/abs/2510.00819 ID - 2510.00819 ER -