TY - RPRT TI - Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias AU - Rahaf Abu Hara AU - Vaibbhav Murarri AU - Claudio Zito PY - 2026 UR - https://arxiv.org/abs/2605.08315 ID - 2605.08315 ER -