TY - RPRT TI - Reinforcement Learning in POMDP's via Direct Gradient Ascent AU - Jonathan Baxter AU - Peter L. Bartlett PY - 2025 UR - https://arxiv.org/abs/2512.02383 ID - 2512.02383 ER -