@misc{indiciaef805bc3b495e, title = {Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm}, author = {Qinbo Bai and Washim Uddin Mondal and Vaneet Aggarwal}, year = {2024}, url = {https://arxiv.org/abs/2402.02042}, note = {Source identifier: 2402.02042} }