@article{modellingvisualsemanticsviaimage, title = {Modelling Visual Semantics via Image Captioning to extract Enhanced Multi-Level Cross-Modal Semantic Incongruity Representation with Attention for Multimodal Sarcasm Detection}, year = {2024}, eprint = {2408.02595}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2408.02595v1}, }