TY - RPRT TI - On the Global Optimality of Policy Gradient Methods in General Utility Reinforcement Learning AU - Anas Barakat AU - Souradip Chakraborty AU - Peihong Yu AU - Pratap Tokekar AU - Amrit Singh Bedi PY - 2025 UR - https://arxiv.org/abs/2410.04108 ID - 2410.04108 ER -