TY - RPRT TI - Integrating Large Language Models and Reinforcement Learning for Non-Linear Reasoning AU - Yoav Alon AU - Cristina David PY - 2024 UR - https://arxiv.org/abs/2410.13501 ID - 2410.13501 ER -