TY - RPRT TI - Batch Active Preference-Based Learning of Reward Functions AU - Erdem Bıyık AU - Dorsa Sadigh PY - 2018 UR - https://arxiv.org/abs/1810.04303 ID - 1810.04303 ER -