@article{alexateachermodelpretrainingand, title = {Alexa Teacher Model: Pretraining and Distilling Multi-Billion-Parameter Encoders for Natural Language Understanding Systems}, author = {Jack FitzGerald and Shankar Ananthakrishnan and Konstantine Arkoudas and Davide Bernardi and Abhishek Bhagia and Claudio Delli Bovi and Jin Cao and Rakesh Chada and Amit Chauhan and Luoxin Chen and Anurag Dwarakanath and Satyam Dwivedi and Turan Gojayev and Karthik Gopalakrishnan and Thomas Gueudre and Dilek Hakkani-Tur and Wael Hamza and Jonathan Hueser and Kevin Martin Jose and Haidar Khan and Beiye Liu and Jianhua Lu and Alessandro Manzotti and Pradeep Natarajan and Karolina Owczarzak and Gokmen Oz and Enrico Palumbo and Charith Peris and Chandana Satya Prakash and Stephen Rawls and Andy Rosenbaum and Anjali Shenoy and Saleh Soltan and Mukund Harakere Sridhar and Liz Tan and Fabian Triefenbach and Pan Wei and Haiyang Yu and Shuai Zheng and Gokhan Tur and Prem Natarajan}, year = {2022}, eprint = {2206.07808}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2206.07808v1}, }