Question Answering 벤치마크
Question Answering on FinQA
Execution Accuracy
- 2021-09-01 — FinQANet (RoBERTa-large): Execution Accuracy 65.05
- 2022-10-18 — ELASTIC (RoBERTa-large): Execution Accuracy 68.96
- 2022-12-14 — APOLLO: Execution Accuracy 71.07
- 2026-05-06 — FinAgent-RAG: Execution Accuracy 76.81
| Rank | Model | Execution Accuracy | Program Accuracy | Paper | Code | Year |
|---|---|---|---|---|---|---|
| 1 | FinAgent-RAG 자동 추출 | 76.81 | – | Agentic Retrieval-Augmented Generation for Financial Document Question Answering | 2026 | |
| 2 | APOLLO | 71.07 | 68.94 | APOLLO: An Optimized Training Approach for Long-form Numerical Reasoning | gasolsun36/iter-cot · gasolsun36/dynamicrag · gasolsun36/apollo | 2022 |
| 3 | ELASTIC (RoBERTa-large) | 68.96 | 65.21 | ELASTIC: Numerical Reasoning with Adaptive Symbolic Compiler | neurasearch/neurips-2022-submission-3358 | 2022 |
| 4 | GPT-4 (8k) | 68.79 | – | Are ChatGPT and GPT-4 General-Purpose Solvers for Financial Text Analytics? A Study on Several Typical Tasks | 2023 | |
| 5 | FinQANet (RoBERTa-large) | 65.05 | 63.52 | FinQA: A Dataset of Numerical Reasoning over Financial Data | czyssrs/finqa | 2021 |
| 6 | FinQANet (BERT-large) | 57.43 | 55.52 | FinQA: A Dataset of Numerical Reasoning over Financial Data | czyssrs/finqa | 2021 |
| 7 | FinQANet (FinBert ) | 53.71 | 51.71 | FinQA: A Dataset of Numerical Reasoning over Financial Data | czyssrs/finqa | 2021 |