TY - RPRT TI - Invariance in Policy Optimisation and Partial Identifiability in Reward Learning AU - Joar Skalse AU - Matthew Farrugia-Roberts AU - Stuart Russell AU - Alessandro Abate AU - Adam Gleave PY - 2023 UR - https://arxiv.org/abs/2203.07475 ID - 2203.07475 ER -