TY - RPRT TI - Group Causal Policy Optimization for Post-Training Large Language Models AU - Ziyin Gu AU - Jingyao Wang AU - Ran Zuo AU - Chuxiong Sun AU - Zeen Song AU - Changwen Zheng AU - Wenwen Qiang PY - 2025 UR - https://arxiv.org/abs/2508.05428 ID - 2508.05428 ER -