TY - RPRT TI - Reinforcement Learning From Imperfect Corrective Actions And Proxy Rewards AU - Zhaohui Jiang AU - Xuening Feng AU - Paul Weng AU - Yifei Zhu AU - Yan Song AU - Tianze Zhou AU - Yujing Hu AU - Tangjie Lv AU - Changjie Fan PY - 2024 UR - https://arxiv.org/abs/2410.05782 ID - 2410.05782 ER -