TY - RPRT TI - CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents AU - Hao Dou PY - 2026 UR - https://arxiv.org/abs/2607.16244 ID - 2607.16244 ER -