@misc{indiciae187a40b0b67f, title = {Unified Policy Optimization for Continuous-action Reinforcement Learning in Non-stationary Tasks and Games}, author = {Rong-Jun Qin and Fan-Ming Luo and Hong Qian and Yang Yu}, year = {2022}, url = {https://arxiv.org/abs/2208.09452}, note = {Source identifier: 2208.09452} }