TY - RPRT TI - Optimizing Language Models for Inference Time Objectives using Reinforcement Learning AU - Yunhao Tang AU - Kunhao Zheng AU - Gabriel Synnaeve AU - Rémi Munos PY - 2025 UR - https://arxiv.org/abs/2503.19595 ID - 2503.19595 ER -