TY - RPRT TI - UniOPSD: Unifying Outcome and Hindsight Feedback for Agentic Reinforcement Learning AU - Zenghuang Fu AU - Zhaoyang Li AU - Qiuyuan Ai AU - Xiaofeng Han AU - Zelong Zheng AU - Haoyu Wu AU - Tianyu Fu AU - Chenxu Zhao AU - Minghui Wu AU - Guannan He AU - Changwei Wang PY - 2026 UR - https://arxiv.org/abs/2609.34810 ID - 2609.34810 ER -