@misc{indiciae0c42fd5af52a, title = {EPO: Explicit Policy Optimization for Strategic Reasoning in LLMs via Reinforcement Learning}, author = {Xiaoqian Liu and Ke Wang and Yongbin Li and Yuchuan Wu and Wentao Ma and Aobo Kong and Fei Huang and Jianbin Jiao and Junge Zhang}, year = {2025}, url = {https://arxiv.org/abs/2502.12486}, note = {Source identifier: 2502.12486} }