@article{onlargebatchtrainingfordeeplearning, title = {On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima}, author = {Nitish Shirish Keskar and Dheevatsa Mudigere and Jorge Nocedal and Mikhail Smelyanskiy and Ping Tak Peter Tang}, year = {2016}, eprint = {1609.04836}, archivePrefix = {arXiv}, url = {http://arxiv.org/abs/1609.04836v2}, }