TY - RPRT TI - Sample-Efficient Online Learning in LM Agents via Hindsight Trajectory Rewriting AU - Michael Y. Hu AU - Benjamin Van Durme AU - Jacob Andreas AU - Harsh Jhamtani PY - 2026 UR - https://arxiv.org/abs/2510.10304 ID - 2510.10304 ER -