@misc{indiciae155f1f1abe7d, title = {Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization}, author = {Chenliang Li and Adel Elmahdy and Alex Boyd and Zhongruo Wang and Siliang Zeng and Alfredo Garcia and Parminder Bhatia and Taha Kass-Hout and Cao Xiao and Mingyi Hong}, year = {2026}, url = {https://arxiv.org/abs/2511.20718}, note = {Source identifier: 2511.20718} }