TY - RPRT TI - Sample-efficient Iterative Lower Bound Optimization of Deep Reactive Policies for Planning in Continuous MDPs AU - Siow Meng Low AU - Akshat Kumar AU - Scott Sanner PY - 2022 UR - https://arxiv.org/abs/2203.12679 ID - 2203.12679 ER -