TY - RPRT TI - When is Off-Policy Evaluation (Reward Modeling) Useful in Contextual Bandits? A Data-Centric Perspective AU - Hao Sun AU - Alex J. Chan AU - Nabeel Seedat AU - Alihan Hüyük AU - Mihaela van der Schaar PY - 2024 UR - https://arxiv.org/abs/2311.14110 ID - 2311.14110 ER -