TY - RPRT TI - RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models AU - Jiongxiao Wang AU - Junlin Wu AU - Muhao Chen AU - Yevgeniy Vorobeychik AU - Chaowei Xiao PY - 2024 UR - https://arxiv.org/abs/2311.09641 ID - 2311.09641 ER -