@misc{indiciaef6f9a18267f4, title = {Language Models Learn to Mislead Humans via RLHF}, author = {Jiaxin Wen and Ruiqi Zhong and Akbir Khan and Ethan Perez and Jacob Steinhardt and Minlie Huang and Samuel R. Bowman and He He and Shi Feng}, year = {2024}, url = {https://arxiv.org/abs/2409.12822}, note = {Source identifier: 2409.12822} }