TY - RPRT TI - PRIME: Policy-Reinforced Iterative Multi-agent Execution for Algorithmic Reasoning in Large Language Models AU - Jiawei Xu AU - Zhenyu Yu AU - Ziqian Bi AU - Minh Duc Pham AU - Xiaoyi Qu AU - Danyang Zhang PY - 2026 UR - https://arxiv.org/abs/2602.11170 ID - 2602.11170 ER -