@article{efficientvisionlanguagemodelsby, title = {Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers}, author = {Yuxin Wen and Qingqing Cao and Qichen Fu and Sachin Mehta and Mahyar Najibi}, year = {2024}, eprint = {2410.14072}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2410.14072v1}, }