TY - RPRT TI - Teaching Large Language Models to Reason with Reinforcement Learning AU - Alex Havrilla AU - Yuqing Du AU - Sharath Chandra Raparthy AU - Christoforos Nalmpantis AU - Jane Dwivedi-Yu AU - Maksym Zhuravinskyi AU - Eric Hambro AU - Sainbayar Sukhbaatar AU - Roberta Raileanu PY - 2024 UR - https://arxiv.org/abs/2403.04642 ID - 2403.04642 ER -