TY - RPRT TI - Achieving $\widetilde{\mathcal{O}}(\sqrt{T})$ Regret in Average-Reward POMDPs with Known Observation Models AU - Alessio Russo AU - Alberto Maria Metelli AU - Marcello Restelli PY - 2025 UR - https://arxiv.org/abs/2501.18790 ID - 2501.18790 ER -