TY - RPRT TI - Markov Decision Processes of the Third Kind: Learning Distributions by Policy Gradient Descent AU - Nicole Bäuerle AU - Athanasios Vasileiadis PY - 2026 UR - https://arxiv.org/abs/2602.06567 ID - 2602.06567 ER -