TY - RPRT TI - From Data to Rewards: a Bilevel Optimization Perspective on Maximum Likelihood Estimation AU - Abdelhakim Benechehab AU - Gabriel Singer AU - Corentin Léger AU - Youssef Attia El Hili AU - Giuseppe Paolo AU - Albert Thomas AU - Maurizio Filippone AU - Balázs Kégl PY - 2025 UR - https://arxiv.org/abs/2510.07624 ID - 2510.07624 ER -