TY - RPRT TI - Learning in Markovian bandits with non-observable states and constrained decision epochs AU - Thomas Hira AU - Victor Boone AU - Urtzi Ayesta AU - Ina Maria Verloop PY - 2026 UR - https://arxiv.org/abs/2606.27448 ID - 2606.27448 ER -