@misc{indiciae76bb2d8c6033, title = {GDEPO: Group Dual-dynamic and Equal-right Advantage Policy Optimization with Enhanced Training Data Utilization for Sample-Constrained Reinforcement Learning}, author = {Zhengqing Yan and Xinyang Liu and Yi Zhang and Fan Guo and ChengXun Jia and Junchen Wan and Yao Liu and Qi Liu and Jihao Huang and Kang Song}, year = {2026}, url = {https://arxiv.org/abs/2601.06795}, note = {Source identifier: 2601.06795} }