TY - RPRT TI - Scalable Ensembling For Mitigating Reward Overoptimisation AU - Ahmed M. Ahmed AU - Rafael Rafailov AU - Stepan Sharkov AU - Xuechen Li AU - Sanmi Koyejo PY - 2024 UR - https://arxiv.org/abs/2406.01013 ID - 2406.01013 ER -