@misc{indiciae6820473ff3cc, title = {Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization}, author = {Juntao Dai and Taiye Chen and Yaodong Yang and Qian Zheng and Gang Pan}, year = {2025}, url = {https://arxiv.org/abs/2503.18130}, note = {Source identifier: 2503.18130} }