@article{galvatronefficienttransformertrainingove, title = {Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism}, author = {Xupeng Miao and Yujie Wang and Youhe Jiang and Chunan Shi and Xiaonan Nie and Hailin Zhang and Bin Cui}, year = {2022}, eprint = {2211.13878}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2211.13878v1}, }