@misc{indiciaea64ca61f7d91, title = {A First-Principles Derivation of LLM Policy Optimization: From Expected Reward to GRPO and Its Structural Extensions}, author = {Jianghan Shen and Siqi Luo and Yue Li and Jiyao Liu and Wanying Qu and Yi Zhang and Ziyan Huang and Tianbin Li and Ming Hu and Xiaohong Liu and Yirong Chen and Junjun He}, year = {2026}, url = {https://arxiv.org/abs/2606.16733}, note = {Source identifier: 2606.16733} }