@article{maximizingparallelismindistributed, title = {Maximizing Parallelism in Distributed Training for Huge Neural Networks}, author = {Zhengda Bian and Qifan Xu and Boxiang Wang and Yang You}, year = {2021}, eprint = {2105.14450}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2105.14450v1}, }