@misc{indiciaed29f136252bc, title = {UniOPSD: Unifying Outcome and Hindsight Feedback for Agentic Reinforcement Learning}, author = {Zenghuang Fu and Zhaoyang Li and Qiuyuan Ai and Xiaofeng Han and Zelong Zheng and Haoyu Wu and Tianyu Fu and Chenxu Zhao and Minghui Wu and Guannan He and Changwei Wang}, year = {2026}, url = {https://arxiv.org/abs/2609.34810}, note = {Source identifier: 2609.34810} }