TY - RPRT TI - Improved Sample Complexity Analysis of Natural Policy Gradient Algorithm with General Parameterization for Infinite Horizon Discounted Reward Markov Decision Processes AU - Washim Uddin Mondal AU - Vaneet Aggarwal PY - 2024 UR - https://arxiv.org/abs/2310.11677 ID - 2310.11677 ER -