TY - RPRT TI - Countering Reward Over-optimization in LLM with Demonstration-Guided Reinforcement Learning AU - Mathieu Rita AU - Florian Strub AU - Rahma Chaabouni AU - Paul Michel AU - Emmanuel Dupoux AU - Olivier Pietquin PY - 2024 UR - https://arxiv.org/abs/2404.19409 ID - 2404.19409 ER -