TY - RPRT TI - From Solver Feedback to Faithful Plans: Multi-Role Reinforcement Learning for Symbolic Planning AU - Chenghao Zhang AU - Yikai Mao AU - Haoyu Gao AU - Saisai Hu AU - Yuxi Cheng AU - Shanqi Liu AU - Dan Roth PY - 2026 UR - https://arxiv.org/abs/2608.21897 ID - 2608.21897 ER -