TY - RPRT TI - GDEPO: Group Dual-dynamic and Equal-right Advantage Policy Optimization with Enhanced Training Data Utilization for Sample-Constrained Reinforcement Learning AU - Zhengqing Yan AU - Xinyang Liu AU - Yi Zhang AU - Fan Guo AU - ChengXun Jia AU - Junchen Wan AU - Yao Liu AU - Qi Liu AU - Jihao Huang AU - Kang Song PY - 2026 UR - https://arxiv.org/abs/2601.06795 ID - 2601.06795 ER -