TY - RPRT TI - Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search AU - Amna Najib AU - Stefan Depeweg AU - Phillip Swazinna PY - 2024 UR - https://arxiv.org/abs/2411.09722 ID - 2411.09722 ER -