TY - RPRT TI - Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy AU - Jim Dilkes AU - Vahid Yazdanpanah AU - Sebastian Stein PY - 2026 UR - https://arxiv.org/abs/2608.02087 ID - 2608.02087 ER -