@article{dataparalleldistributedtrainingofvery, title = {Data-parallel distributed training of very large models beyond GPU capacity}, author = {Samuel Matzek and Max Grossman and Minsik Cho and Anar Yusifov and Bryant Nelson and Amit Juneja}, year = {2018}, eprint = {1811.12174}, archivePrefix = {arXiv}, url = {http://arxiv.org/abs/1811.12174v1}, }