@misc{indiciaeea6fd17c7ebc, title = {Learning Reasoning Rewards from Expert Demonstrations with Inverse Reinforcement Learning}, author = {Claudio Fanconi and Nicolás Astorga and Mihaela van der Schaar}, year = {2026}, url = {https://arxiv.org/abs/2510.01857}, note = {Source identifier: 2510.01857} }