TY - RPRT TI - Hierarchical Reward Design from Language: Enhancing Alignment of Agent Behavior with Human Specifications AU - Zhiqin Qian AU - Ryan Diaz AU - Sangwon Seo AU - Vaibhav Unhelkar PY - 2026 UR - https://arxiv.org/abs/2602.18582 ID - 2602.18582 ER -