TY - RPRT TI - Reinforcement Learning for Aligning Large Language Models Agents with Interactive Environments: Quantifying and Mitigating Prompt Overfitting AU - Mohamed Salim Aissi AU - Clement Romac AU - Thomas Carta AU - Sylvain Lamprier AU - Pierre-Yves Oudeyer AU - Olivier Sigaud AU - Laure Soulier AU - Nicolas Thome PY - 2025 UR - https://arxiv.org/abs/2410.19920 ID - 2410.19920 ER -