TY - RPRT TI - Stabilizing Q Learning Via Soft Mellowmax Operator AU - Yaozhong Gan AU - Zhe Zhang AU - Xiaoyang Tan PY - 2020 UR - https://arxiv.org/abs/2012.09456 ID - 2012.09456 ER -