TY - RPRT TI - Instance-Dependent Regret Bounds for Learning Two-Player Zero-Sum Games with Bandit Feedback AU - Shinji Ito AU - Haipeng Luo AU - Taira Tsuchiya AU - Yue Wu PY - 2025 UR - https://arxiv.org/abs/2502.17625 ID - 2502.17625 ER -