TY - RPRT TI - Policy Gradient Learning for Distributionally Robust Markov Decision Processes under Wasserstein Ambiguity AU - Yadh Hafsi AU - Samy Mekkaoui AU - Huyên Pham AU - Kaixin Yan PY - 2026 UR - https://arxiv.org/abs/2606.27610 ID - 2606.27610 ER -