TY - RPRT TI - Closing the Feedback Loop: From Experience Extraction to Insight Governance in Verbal Reinforcement Learning AU - Yanwei Cui AU - Xing Zhang AU - Yulong Zhang AU - Li Shao AU - Xiaofeng Shi AU - Guanghui Wang AU - Peiyang He PY - 2026 UR - https://arxiv.org/abs/2606.17591 ID - 2606.17591 ER -