TY - RPRT TI - Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization AU - Sayambhu Sen AU - Shalabh Bhatnagar PY - 2026 UR - https://arxiv.org/abs/2511.07288 ID - 2511.07288 ER -