TY - RPRT TI - Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning AU - Haiwen Yi AU - Xinyuan Song PY - 2026 UR - https://arxiv.org/abs/2607.05458 ID - 2607.05458 ER -