@article{howtransformersutilizemultiheadattention, title = {How Transformers Utilize Multi-Head Attention in In-Context Learning? A Case Study on Sparse Linear Regression}, author = {Xingwu Chen and Lei Zhao and Difan Zou}, year = {2024}, eprint = {2408.04532}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2408.04532v1}, }