TY - RPRT TI - Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization AU - Chenliang Li AU - Adel Elmahdy AU - Alex Boyd AU - Zhongruo Wang AU - Siliang Zeng AU - Alfredo Garcia AU - Parminder Bhatia AU - Taha Kass-Hout AU - Cao Xiao AU - Mingyi Hong PY - 2026 UR - https://arxiv.org/abs/2511.20718 ID - 2511.20718 ER -