@article{acceleratinginferenceandlanguagemodel, title = {Accelerating Inference and Language Model Fusion of Recurrent Neural Network Transducers via End-to-End 4-bit Quantization}, author = {Andrea Fasoli and Chia-Yu Chen and Mauricio Serrano and Swagath Venkataramani and George Saon and Xiaodong Cui and Brian Kingsbury and Kailash Gopalakrishnan}, year = {2022}, eprint = {2206.07882}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2206.07882v1}, }