@article{mtfnetmutualtransformerfusionnetworkfor, title = {MutualFormer: Multi-Modality Representation Learning via Cross-Diffusion Attention}, author = {Xixi Wang and Xiao Wang and Bo Jiang and Jin Tang and Bin Luo}, year = {2021}, eprint = {2112.01177}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2112.01177v3}, }