TY - RPRT TI - PolicyGuard: Towards Test-time and Step-level Adversary (Backdoor) Defense for Reinforcement Learning Agent AU - Junfeng Guo Heng Huang PY - 2026 UR - https://arxiv.org/abs/2606.12896 ID - 2606.12896 ER -