Common Sense Reasoning on CommonsenseQA
Accuracy
- 2018-11-02 — BERT-LARGE: Accuracy 55.9
- 2019-06-06 — CAGE-reasoning: Accuracy 64.7
- 2019-07-26 — RoBERTa-Large 355M: Accuracy 72.1
- 2019-09-09 — XLNet+GraphReason: Accuracy 75.3
- 2019-09-26 — Albert Lan et al. (2020) (ensemble): Accuracy 76.5
- 2020-05-02 — UnifiedQA 11B (fine-tuned): Accuracy 79.1
- 2020-12-09 — DEKCOR: Accuracy 83.3
- 2021-12-06 — DeBERTaV3-large+KEAR: Accuracy 91.2
- 2024-06-18 — GPT-4o (HPT): Accuracy 92.54