TY - RPRT TI - Pretraining Decision Transformers with Reward Prediction for In-Context Multi-task Structured Bandit Learning AU - Subhojyoti Mukherjee AU - Josiah P. Hanna AU - Qiaomin Xie AU - Robert Nowak PY - 2025 UR - https://arxiv.org/abs/2406.05064 ID - 2406.05064 ER -