Coreference Resolution on Winograd Schema Challenge
Accuracy
- 2016-11-13 — KEE+NKAM winner of the WSC2016: Accuracy 58.3
- 2018-06-07 — Ensemble of 14 LMs: Accuracy 63.7
- 2018-11-05 — GPT-2 Medium 774M (partial scoring): Accuracy 69.2
- 2019-02-14 — GPT-2-XL 1.5B: Accuracy 70.7
- 2019-04-22 — BERT-SocialIQA 340M: Accuracy 72.5
- 2019-07-24 — RoBERTa-WinoGrande 355M: Accuracy 90.1
- 2019-10-23 — T5-XXL 11B (fine-tuned): Accuracy 93.8
- 2020-06-05 — DeBERTa-1.5B: Accuracy 95.9
- 2022-02-17 — ST-MoE-32B 269B (fine-tuned): Accuracy 96.6
- 2022-04-05 — PaLM 540B (fine-tuned): Accuracy 100.0