TY - RPRT TI - Convergence of a L2 regularized Policy Gradient Algorithm for the Multi Armed Bandit AU - Stefana Anita AU - Gabriel Turinici PY - 2026 DO - 10.1007/978-3-031-78395-1_27 UR - https://arxiv.org/abs/2402.06388 ID - 2402.06388 ER -