TY - RPRT TI - Internalizing Meta-Experience into Memory for Guided Reinforcement Learning in Large Language Models AU - Shiting Huang AU - Zecheng Li AU - Yu Zeng AU - Qingnan Ren AU - Zhen Fang AU - Qisheng Su AU - Kou Shi AU - Lin Chen AU - Zehui Chen AU - Feng Zhao PY - 2026 UR - https://arxiv.org/abs/2602.10224 ID - 2602.10224 ER -