@misc{indiciaebe0023e6555c, title = {PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop Question Answering}, author = {Yu Liu and Wenxiao Zhang and Cong Cao and Wenxuan Lu and Fangfang Yuan and Diandian Guo and Kun Peng and Qiang Sun and Kaiyan Zhang and Yanbing Liu and Jin B. Hong and Bowen Zhou and Zhiyuan Ma}, year = {2026}, url = {https://arxiv.org/abs/2601.05465}, note = {Source identifier: 2601.05465} }