TY - RPRT TI - Efficient Exploration in Average-Reward Constrained Reinforcement Learning: Achieving Near-Optimal Regret With Posterior Sampling AU - Danil Provodin AU - Maurits Kaptein AU - Mykola Pechenizkiy PY - 2024 UR - https://arxiv.org/abs/2405.19017 ID - 2405.19017 ER -