TY - RPRT TI - PAGAR: Taming Reward Misalignment in Inverse Reinforcement Learning-Based Imitation Learning with Protagonist Antagonist Guided Adversarial Reward AU - Weichao Zhou AU - Wenchao Li PY - 2024 UR - https://arxiv.org/abs/2306.01731 ID - 2306.01731 ER -