TY - RPRT TI - Efficient Model-Based Concave Utility Reinforcement Learning through Greedy Mirror Descent AU - Bianca Marin Moreno AU - Margaux Brégère AU - Pierre Gaillard AU - Nadia Oudjane PY - 2023 UR - https://arxiv.org/abs/2311.18346 ID - 2311.18346 ER -