TY - RPRT TI - PGPO: Enhancing Agent Reasoning via Pseudocode-style Planning Guided Preference Optimization AU - Zouying Cao AU - Runze Wang AU - Yifei Yang AU - Xinbei Ma AU - Xiaoyong Zhu AU - Bo Zheng AU - Hai Zhao PY - 2025 UR - https://arxiv.org/abs/2506.01475 ID - 2506.01475 ER -