@article{longllavascalingmultimodalllmsto1000, title = {LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid Architecture}, author = {Xidong Wang and Dingjie Song and Shunian Chen and Chen Zhang and Benyou Wang}, year = {2024}, eprint = {2409.02889}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2409.02889v2}, }