TY - RPRT TI - Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits AU - Tatsuhiro Shimizu AU - Koichi Tanaka AU - Ren Kishimoto AU - Haruka Kiyohara AU - Masahiro Nomura AU - Yuta Saito PY - 2024 UR - https://arxiv.org/abs/2408.11202 ID - 2408.11202 ER -