@misc{indiciaefe63d9b8cebe, title = {Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning}, author = {Luckeciano C. Melo and Alessandro Abate and Yarin Gal}, year = {2026}, url = {https://arxiv.org/abs/2510.00819}, note = {Source identifier: 2510.00819} }