TY - RPRT TI - Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization AU - Juntao Dai AU - Taiye Chen AU - Yaodong Yang AU - Qian Zheng AU - Gang Pan PY - 2025 UR - https://arxiv.org/abs/2503.18130 ID - 2503.18130 ER -