@article{multimodalemotionrecognitionusingaudio, title = {Multimodal Emotion Recognition using Audio-Video Transformer Fusion with Cross Attention}, author = {Joe Dhanith P R and Shravan Venkatraman and Vigya Sharma and Santhosh Malarvannan and Modigari Narendra}, year = {2024}, eprint = {2407.18552}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2407.18552v3}, }