TY - RPRT TI - A First-Principles Derivation of LLM Policy Optimization: From Expected Reward to GRPO and Its Structural Extensions AU - Jianghan Shen AU - Siqi Luo AU - Yue Li AU - Jiyao Liu AU - Wanying Qu AU - Yi Zhang AU - Ziyan Huang AU - Tianbin Li AU - Ming Hu AU - Xiaohong Liu AU - Yirong Chen AU - Junjun He PY - 2026 UR - https://arxiv.org/abs/2606.16733 ID - 2606.16733 ER -