TY - RPRT TI - Reverse Engineering Human Preferences with Reinforcement Learning AU - Lisa Alazraki AU - Tan Yi-Chern AU - Jon Ander Campos AU - Maximilian Mozes AU - Marek Rei AU - Max Bartolo PY - 2026 UR - https://arxiv.org/abs/2505.15795 ID - 2505.15795 ER -