TY - RPRT TI - PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop Question Answering AU - Yu Liu AU - Wenxiao Zhang AU - Cong Cao AU - Wenxuan Lu AU - Fangfang Yuan AU - Diandian Guo AU - Kun Peng AU - Qiang Sun AU - Kaiyan Zhang AU - Yanbing Liu AU - Jin B. Hong AU - Bowen Zhou AU - Zhiyuan Ma PY - 2026 UR - https://arxiv.org/abs/2601.05465 ID - 2601.05465 ER -