TY - RPRT TI - Meta-Reinforcement Learning with Self-Reflection for Agentic Search AU - Teng Xiao AU - Yige Yuan AU - Hamish Ivison AU - Huaisheng Zhu AU - Faeze Brahman AU - Nathan Lambert AU - Pradeep Dasigi AU - Noah A. Smith AU - Hannaneh Hajishirzi PY - 2026 UR - https://arxiv.org/abs/2603.11327 ID - 2603.11327 ER -