TY - RPRT TI - Reward Is Enough: LLMs Are In-Context Reinforcement Learners AU - Kefan Song AU - Amir Moeini AU - Peng Wang AU - Lei Gong AU - Rohan Chandra AU - Shangtong Zhang AU - Yanjun Qi PY - 2026 UR - https://arxiv.org/abs/2506.06303 ID - 2506.06303 ER -