TY - RPRT TI - Grounding Large Language Models in Interactive Environments with Online Reinforcement Learning AU - Thomas Carta AU - Clément Romac AU - Thomas Wolf AU - Sylvain Lamprier AU - Olivier Sigaud AU - Pierre-Yves Oudeyer PY - 2026 UR - https://arxiv.org/abs/2302.02662 ID - 2302.02662 ER -