TY - RPRT TI - Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits AU - Yuta Natsubori AU - Masataka Ushiku AU - Yuta Saito PY - 2026 UR - https://arxiv.org/abs/2607.22012 ID - 2607.22012 ER -