TY - RPRT TI - IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking AU - Mohammad Beigi AU - Ming Jin AU - Junshan Zhang AU - Jiaxin Zhang AU - Qifan Wang AU - Lifu Huang PY - 2026 UR - https://arxiv.org/abs/2602.19416 ID - 2602.19416 ER -