@inproceedings{layerwisepruningoftransformerattention, title = {Layer-wise Pruning of Transformer Attention Heads for Efficient Language Modeling}, author = {Kyuhong Shim and Iksoo Choi and Wonyong Sung and Jungwook Choi}, year = {2021}, booktitle = {2021 18th International SoC Design Conference (ISOCC) 2021 11}, eprint = {2110.03252}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2110.03252v1}, }