TY - RPRT TI - Policy Iteration Is Not Strongly Polynomial for Deterministic Markov Decision Processes: The Price of Algorithmic Anarchy AU - Han Zhong AU - Yinyu Ye PY - 2026 UR - https://arxiv.org/abs/2609.40147 ID - 2609.40147 ER -