TY - RPRT TI - OPIRL: Sample Efficient Off-Policy Inverse Reinforcement Learning via Distribution Matching AU - Hana Hoshino AU - Kei Ota AU - Asako Kanezaki AU - Rio Yokota PY - 2022 UR - https://arxiv.org/abs/2109.04307 ID - 2109.04307 ER -