TY - RPRT TI - Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents AU - Mingkang Zhu AU - Xi Chen AU - Bei Yu AU - Hengshuang Zhao AU - Jiaya Jia PY - 2025 UR - https://arxiv.org/abs/2510.06214 ID - 2510.06214 ER -