@article{gatedsparseattentioncombiningcomputation, title = {Gated Sparse Attention: Combining Computational Efficiency with Training Stability for Long-Context Language Models}, author = {Alfred Shen and Aaron Shen}, year = {2026}, eprint = {2601.15305}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2601.15305}, }