@misc{indiciae86ea60f6b9ef, title = {GVPO: Group Variance Policy Optimization for Large Language Model Post-Training}, author = {Kaichen Zhang and Yuzhong Hong and Junwei Bao and Hongfei Jiang and Yang Song and Dingqian Hong and Hui Xiong}, year = {2025}, url = {https://arxiv.org/abs/2504.19599}, note = {Source identifier: 2504.19599} }