TY - RPRT TI - Offline Reinforcement Learning via Inverse Optimization AU - Ioannis Dimanidis AU - Tolga Ok AU - Peyman Mohajerin Esfahani PY - 2026 UR - https://arxiv.org/abs/2502.20030 ID - 2502.20030 ER -