TY - RPRT TI - Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF AU - Banghua Zhu AU - Michael I. Jordan AU - Jiantao Jiao PY - 2024 UR - https://arxiv.org/abs/2401.16335 ID - 2401.16335 ER -