TY - RPRT TI - SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations AU - Peter Crowley AU - Zachary Serlin AU - Tyler Paine AU - Makai Mann AU - Michael Benjamin AU - Calin Belta PY - 2025 UR - https://arxiv.org/abs/2507.08707 ID - 2507.08707 ER -