TY - RPRT TI - Learning Reasoning Rewards from Expert Demonstrations with Inverse Reinforcement Learning AU - Claudio Fanconi AU - Nicolás Astorga AU - Mihaela van der Schaar PY - 2026 UR - https://arxiv.org/abs/2510.01857 ID - 2510.01857 ER -