TY - RPRT TI - Deceptive Sequential Decision-Making via Regularized Policy Optimization AU - Yerin Kim AU - Alexander Benvenuti AU - Bo Chen AU - Mustafa Karabag AU - Abhishek Kulkarni AU - Nathaniel D. Bastian AU - Ufuk Topcu AU - Matthew Hale PY - 2026 UR - https://arxiv.org/abs/2501.18803 ID - 2501.18803 ER -