TY - RPRT TI - Reinforcement Learning via Self-Distillation AU - Jonas Hübotter AU - Frederike Lübeck AU - Lejs Behric AU - Anton Baumann AU - Marco Bagatella AU - Daniel Marta AU - Ido Hakimi AU - Idan Shenfeld AU - Thomas Kleine Buening AU - Carlos Guestrin AU - Andreas Krause PY - 2026 UR - https://arxiv.org/abs/2601.20802 ID - 2601.20802 ER -