paper-with-me

홈 › Papers

PAT: Parallel Attention Transformer for Visual Question Answering in Vietnamese

2023-07-17 · Nghia Hieu Nguyen, Kiet Van Nguyen

We present in this paper a novel scheme for multimodal learning named the Parallel Attention mechanism. In addition, to take into account the advantages of grammar and context in Vietnamese, we propose the Hierarchical Linguistic Features Extractor instead of using an LSTM network to extract linguistic features. Based on these two novel modules, we introduce the Parallel Attention Transformer (PAT), achieving the best accuracy compared to all baselines on the benchmark ViVQA dataset and other SOTA methods including SAAA and MCAN.

📄 PDF Abstract BibTeX arXiv:2307.08247

Code (0)

등록된 구현이 없습니다.

Tasks

Question AnsweringVietnamese Visual Question AnsweringVisual Question Answering

Methods 이 논문이 사용한 방법론

Multi-Head Attention 설명 없음
Attention 설명 없음
Linear Layer A Linear Layer is a projection $\mathbf{XW + b}$.
BPE Byte Pair Encoding, or BPE, is a subword segmentation algorithm that encodes rare and unknown words as sequences of subword units. The intuition is that various word…
Position-Wise Feed-Forward Layer 설명 없음
Label Smoothing Label Smoothing is a regularization technique that introduces noise for the labels. This accounts for the fact that datasets may have mistakes in them, so maximizing the…
Residual Connection 설명 없음
Absolute Position Encodings Absolute Position Encodings are a type of position embeddings for [Transformer-based models] where positional encodings are…

Similar Papers 제목 키워드 기반

On the Efficacy of Co-Attention Transformer Layers in Visual Question Answering

2022-01-11 · Ankur Sikarwar, Gabriel Kreiman

In recent years, multi-modal transformers have shown significant progress in Vision-Language tasks, such as Visual Question Answering (VQA), outperforming previous architectures by a considerable margin. This improvement…

POSQuestion AnsweringVisual Question AnsweringVisual Question Answering (VQA)

Self-Segregating and Coordinated-Segregating Transformer for Focused Deep Multi-Modular Network for Visual Question Answering

2020-06-25 · Chiranjib Sur

Attention mechanism has gained huge popularity due to its effectiveness in achieving high accuracy in different domains. But attention is opportunistic and is not justified by the content or usability of the content. Tra…

DiversityQuestion AnsweringVisual Question AnsweringVisual Question Answering (VQA)+1

ISAAQ -- Mastering Textbook Questions with Pre-trained Transformers and Bottom-Up and Top-Down Attention

2020-10-01 · Jose Manuel Gomez-Perez, Raul Ortega

Textbook Question Answering is a complex task in the intersection of Machine Comprehension and Visual Question Answering that requires reasoning with multimodal information from text and diagrams. For the first time, thi…

Multiple-choiceQuestion AnsweringReading ComprehensionVisual Question Answering+1

ISAAQ - Mastering Textbook Questions with Pre-trained Transformers and Bottom-Up and Top-Down Attention

2020-11-01 · EMNLP 2020 11 · Jose Manuel Gomez-Perez, Ra{\'u}l Ortega

Textbook Question Answering is a complex task in the intersection of Machine Comprehension and Visual Question Answering that requires reasoning with multimodal information from text and diagrams. For the first time, thi…

Multiple-choiceQuestion AnsweringReading ComprehensionVisual Question Answering+1

Multilevel Hierarchical Network with Multiscale Sampling for Video Question Answering

2022-05-09 · Min Peng, Chongyang Wang, Yuan Gao, Yu Shi 외

Video question answering (VideoQA) is challenging given its multimodal combination of visual understanding and natural language processing. While most existing approaches ignore the visual appearance-motion information a…

multimodal interactionQuestion AnsweringVideo Question AnsweringVisual Reasoning