TY - RPRT TI - Adapting to Stochastic and Adversarial Losses in Episodic MDPs with Aggregate Bandit Feedback AU - Shinji Ito AU - Kevin Jamieson AU - Haipeng Luo AU - Arnab Maiti AU - Taira Tsuchiya PY - 2025 UR - https://arxiv.org/abs/2510.17103 ID - 2510.17103 ER -