TY - RPRT TI - MONA: Myopic Optimization with Non-myopic Approval Can Mitigate Multi-step Reward Hacking AU - Sebastian Farquhar AU - Vikrant Varma AU - David Lindner AU - David Elson AU - Caleb Biddulph AU - Ian Goodfellow AU - Rohin Shah PY - 2025 UR - https://arxiv.org/abs/2501.13011 ID - 2501.13011 ER -