TY - RPRT TI - GVPO: Group Variance Policy Optimization for Large Language Model Post-Training AU - Kaichen Zhang AU - Yuzhong Hong AU - Junwei Bao AU - Hongfei Jiang AU - Yang Song AU - Dingqian Hong AU - Hui Xiong PY - 2025 UR - https://arxiv.org/abs/2504.19599 ID - 2504.19599 ER -