TY - RPRT TI - Regularized Softmax Deep Multi-Agent $Q$-Learning AU - Ling Pan AU - Tabish Rashid AU - Bei Peng AU - Longbo Huang AU - Shimon Whiteson PY - 2021 UR - https://arxiv.org/abs/2103.11883 ID - 2103.11883 ER -