TY - RPRT TI - Regularized policy gradient with learned mixtures of Gaussians for games with continuous actions AU - Ondřej Kubíček AU - Viliam Lisý AU - Tuomas Sandholm PY - 2026 UR - https://arxiv.org/abs/2609.36787 ID - 2609.36787 ER -