TY - RPRT TI - Discovering Diverse Solutions in Deep Reinforcement Learning by Maximizing State-Action-Based Mutual Information AU - Takayuki Osa AU - Voot Tangkaratt AU - Masashi Sugiyama PY - 2022 UR - https://arxiv.org/abs/2103.07084 ID - 2103.07084 ER -