TY - RPRT TI - Deep Research as Rubric for Reinforcement Learning AU - Wangyi Mei AU - Zhouhong Gu AU - Zhenhan Bai AU - Yin Cai AU - Lefan Zhang AU - Zhenxin Ding AU - Bo Chen AU - Yan Gao AU - Yi Wu AU - Yao Hu AU - Jiaqing Liang AU - Deqing Yang PY - 2026 UR - https://arxiv.org/abs/2606.01091 ID - 2606.01091 ER -