TY - RPRT TI - Boosting Virtual Agent Learning and Reasoning: A Step-Wise, Multi-Dimensional, and Generalist Reward Model with Benchmark AU - Bingchen Miao AU - Yang Wu AU - Minghe Gao AU - Qifan Yu AU - Wendong Bu AU - Wenqiao Zhang AU - Yunfei Li AU - Siliang Tang AU - Tat-Seng Chua AU - Juncheng Li PY - 2025 UR - https://arxiv.org/abs/2503.18665 ID - 2503.18665 ER -