TY - RPRT TI - Greedification Operators for Policy Optimization: Investigating Forward and Reverse KL Divergences AU - Alan Chan AU - Hugo Silva AU - Sungsu Lim AU - Tadashi Kozuno AU - A. Rupam Mahmood AU - Martha White PY - 2022 UR - https://arxiv.org/abs/2107.08285 ID - 2107.08285 ER -