TY - RPRT TI - Reward Learning from Suboptimal Demonstrations with Applications in Surgical Electrocautery AU - Zohre Karimi AU - Shing-Hei Ho AU - Bao Thach AU - Alan Kuntz AU - Daniel S. Brown PY - 2024 DO - 10.1109/ismr63436.2024.10585785 UR - https://arxiv.org/abs/2404.07185 ID - 2404.07185 ER -