TY - RPRT TI - On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima AU - Nitish Shirish Keskar AU - Dheevatsa Mudigere AU - Jorge Nocedal AU - Mikhail Smelyanskiy AU - Ping Tak Peter Tang PY - 2017 UR - https://arxiv.org/abs/1609.04836 ID - 1609.04836 ER -