TY - RPRT TI - STRAPPER: Preference-based Reinforcement Learning via Self-training Augmentation and Peer Regularization AU - Yachen Kang AU - Li He AU - Jinxin Liu AU - Zifeng Zhuang AU - Donglin Wang PY - 2023 UR - https://arxiv.org/abs/2307.09692 ID - 2307.09692 ER -