TY - RPRT TI - f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment AU - Rajdeep Haldar AU - Lantao Mei AU - Guang Lin AU - Yue Xing AU - Qifan Song PY - 2026 UR - https://arxiv.org/abs/2602.05946 ID - 2602.05946 ER -