TY - RPRT TI - Reward Learning as Doubly Nonparametric Bandits: Optimal Design and Scaling Laws AU - Kush Bhatia AU - Wenshuo Guo AU - Jacob Steinhardt PY - 2023 UR - https://arxiv.org/abs/2302.12349 ID - 2302.12349 ER -