TY - RPRT TI - RL-finetuning LLMs from on- and off-policy data with a single algorithm AU - Yunhao Tang AU - Taco Cohen AU - David W. Zhang AU - Michal Valko AU - Rémi Munos PY - 2025 UR - https://arxiv.org/abs/2503.19612 ID - 2503.19612 ER -