TY - RPRT TI - Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents AU - Tianjun Pan AU - Yuan Li AU - Hongda Wang AU - Linbo Jin AU - Mengfei Song AU - Lei Gao AU - Qiming Shi AU - Shaokang Fu AU - Jiarong Zhao AU - Chengyu Wang AU - Chengfu Huo PY - 2026 UR - https://arxiv.org/abs/2608.09555 ID - 2608.09555 ER -