TY - RPRT TI - Revisiting Regularized Policy Optimization for Stable and Efficient Reinforcement Learning in Two-Player Games AU - Kazuki Ota AU - Takayuki Osa AU - Motoki Omura AU - Tatsuya Harada PY - 2026 UR - https://arxiv.org/abs/2602.10894 ID - 2602.10894 ER -