TY - RPRT TI - Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation AU - Xiaoying Zhang AU - Jean-Francois Ton AU - Wei Shen AU - Hongning Wang AU - Yang Liu PY - 2024 UR - https://arxiv.org/abs/2403.05171 ID - 2403.05171 ER -