TY - RPRT TI - In-Context Reinforcement Learning From Suboptimal Historical Data AU - Juncheng Dong AU - Moyang Guo AU - Ethan X. Fang AU - Zhuoran Yang AU - Vahid Tarokh PY - 2026 UR - https://arxiv.org/abs/2601.20116 ID - 2601.20116 ER -