TY - RPRT TI - Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm AU - Qinbo Bai AU - Washim Uddin Mondal AU - Vaneet Aggarwal PY - 2024 UR - https://arxiv.org/abs/2402.02042 ID - 2402.02042 ER -