TY - RPRT TI - EPO: Explicit Policy Optimization for Strategic Reasoning in LLMs via Reinforcement Learning AU - Xiaoqian Liu AU - Ke Wang AU - Yongbin Li AU - Yuchuan Wu AU - Wentao Ma AU - Aobo Kong AU - Fei Huang AU - Jianbin Jiao AU - Junge Zhang PY - 2025 UR - https://arxiv.org/abs/2502.12486 ID - 2502.12486 ER -