TY - RPRT TI - Maximum Likelihood Reinforcement Learning AU - Fahim Tajwar AU - Guanning Zeng AU - Yueer Zhou AU - Yuda Song AU - Daman Arora AU - Yiding Jiang AU - Jeff Schneider AU - Ruslan Salakhutdinov AU - Haiwen Feng AU - Andrea Zanette PY - 2026 UR - https://arxiv.org/abs/2602.02710 ID - 2602.02710 ER -