TY - RPRT TI - Learning Interpretable Policies in Hindsight-Observable POMDPs through Partially Supervised Reinforcement Learning AU - Michael Lanier AU - Ying Xu AU - Nathan Jacobs AU - Chongjie Zhang AU - Yevgeniy Vorobeychik PY - 2024 UR - https://arxiv.org/abs/2402.09290 ID - 2402.09290 ER -