TY - RPRT TI - Adaptive Group Policy Optimization: Towards Stable Training and Token-Efficient Reasoning AU - Chen Li AU - Nazhou Liu AU - Kai Yang PY - 2025 UR - https://arxiv.org/abs/2503.15952 ID - 2503.15952 ER -