@misc{indiciae064eda6fe313, title = {On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima}, author = {Nitish Shirish Keskar and Dheevatsa Mudigere and Jorge Nocedal and Mikhail Smelyanskiy and Ping Tak Peter Tang}, year = {2017}, url = {https://arxiv.org/abs/1609.04836}, note = {Source identifier: 1609.04836} }