TY - RPRT TI - QPLEX Decision Processes: Formulation via Nonlinear Markov Chains and Optimization via Policy Gradients AU - Antonius B. Dieker AU - Steven T. Hackman AU - Zitong Wang AU - Yunhao Yan PY - 2026 UR - https://arxiv.org/abs/2605.17149 ID - 2605.17149 ER -