TY - RPRT TI - TIC-GRPO: Provable and Efficient Optimization for Reinforcement Learning from Human Feedback AU - Lei Pang AU - Jun Luo AU - Ruinan Jin PY - 2026 UR - https://arxiv.org/abs/2508.02833 ID - 2508.02833 ER -