TY - RPRT TI - DIPPER: Direct Preference Optimization to Accelerate Primitive-Enabled Hierarchical Reinforcement Learning AU - Utsav Singh AU - Souradip Chakraborty AU - Wesley A. Suttle AU - Brian M. Sadler AU - Vinay P Namboodiri AU - Amrit Singh Bedi PY - 2024 UR - https://arxiv.org/abs/2406.10892 ID - 2406.10892 ER -