@article{geminifusionefficientpixelwisemultimodal, title = {GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer}, author = {Ding Jia and Jianyuan Guo and Kai Han and Han Wu and Chao Zhang and Chang Xu and Xinghao Chen}, year = {2024}, eprint = {2406.01210}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2406.01210v2}, }