@misc{indiciae4661b3575929, title = {Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation}, author = {Xiaoying Zhang and Jean-Francois Ton and Wei Shen and Hongning Wang and Yang Liu}, year = {2024}, url = {https://arxiv.org/abs/2403.05171}, note = {Source identifier: 2403.05171} }