TY - RPRT TI - ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning AU - Jinpeng Wang AU - Chao Li AU - Ting Ye AU - Mengyuan Zhang AU - Wei Liu AU - Jian Luan PY - 2026 UR - https://arxiv.org/abs/2511.21005 ID - 2511.21005 ER -