@article{hybridfusionbasedinterpretablemultimodal, title = {VISTANet: VIsual Spoken Textual Additive Net for Interpretable Multimodal Emotion Recognition}, author = {Puneet Kumar and Sarthak Malik and Balasubramanian Raman and Xiaobai Li}, year = {2022}, eprint = {2208.11450}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2208.11450v3}, }