TY - RPRT TI - TROLL: Trust Regions improve Reinforcement Learning for Large Language Models AU - Philipp Becker AU - Niklas Freymuth AU - Serge Thilges AU - Fabian Otto AU - Gerhard Neumann PY - 2026 UR - https://arxiv.org/abs/2510.03817 ID - 2510.03817 ER -