@misc{indiciae06442aa45a2c, title = {Vanishing Gradients in Reinforcement Finetuning of Language Models}, author = {Noam Razin and Hattie Zhou and Omid Saremi and Vimal Thilak and Arwen Bradley and Preetum Nakkiran and Joshua Susskind and Etai Littwin}, year = {2024}, url = {https://arxiv.org/abs/2310.20703}, note = {Source identifier: 2310.20703} }