paper-with-me

Coreference Resolution 벤치마크

Coreference Resolution on Winograd Schema Challenge

82개 결과 · ⬇ CSV · JSON

Accuracy

36.5 52.38 68.25 84.12 100 2016-11 2026-09 KEE+NKAM winner of the WSC2016 — 58.3 (2016-11-13) Subword-level Transformer LM — 54.1 (2017-06-12) Ensemble of 14 LMs — 63.7 (2018-06-07) Word-level CNN+LSTM (partial scoring) — 62.6 (2018-06-07) Char-level CNN+LSTM (partial scoring) — 57.9 (2018-06-07) Knowledge Hunter — 57.1 (2018-10-02) BERT-large 340M — 62.0 (2018-10-11) GPT-2 Medium 774M (partial scoring) — 69.2 (2018-11-05) GPT-2 Medium 774M (full scoring) — 64.5 (2018-11-05) GPT-2 Small 117M (partial scoring) — 61.5 (2018-11-05) GPT-2 Small 117M (full scoring) — 55.7 (2018-11-05) GPT-2-XL 1.5B — 70.7 (2019-02-14) DSSM — 63.0 (2019-04-03) UDSSM-II (ensemble) — 62.4 (2019-04-03) UDSSM-II — 59.2 (2019-04-03) UDSSM-I (ensemble) — 57.1 (2019-04-03) UDSSM-I — 54.5 (2019-04-03) BERT-SocialIQA 340M — 72.5 (2019-04-22) BERT-large 340M — 67.0 (2019-04-22) BERTwiki 340M (fine-tuned on WSCR) — 72.5 (2019-05-15) BERT-large 340M (fine-tuned on WSCR) — 71.4 (2019-05-15) BERTwiki 340M (fine-tuned on half of WSCR) — 70.3 (2019-05-15) BERT-base 110M (fine-tuned on WSCR) — 62.3 (2019-05-15) BERT-base 110M + MAS — 60.3 (2019-05-31) USSM + Supervised DeepNet + KB — 52.8 (2019-05-31) USSM + KB — 52.0 (2019-05-31) RoBERTa-WinoGrande 355M — 90.1 (2019-07-24) RoBERTa-DPR 355M — 83.1 (2019-07-24) WKH — 57.1 (2019-07-24) KEE+NKAM on WinoGrande — 52.8 (2019-07-24) HNN — 75.1 (2019-07-27) T5-XXL 11B (fine-tuned) — 93.8 (2019-10-23) TTTTT 3B (fine-tuned) — 84.6 (2020-03-18) RoBERTa-large + G-DAug-Inf — 80.0 (2020-04-24) GPT-3 175B (few-shot) — 80.1 (2020-05-28) DeBERTa-1.5B — 95.9 (2020-06-05) ALBERT-xxlarge 235M — 78.8 (2021-04-16) RoBERTa-large 354M — 73.9 (2021-04-16) RoBERTa-base 125M — 63.0 (2021-04-16) BERT-large 340M — 61.4 (2021-04-16) BERT-base 110M — 56.5 (2021-04-16) ALBERT-base 11M — 55.4 (2021-04-16) Random chance baseline — 50.0 (2021-04-16) FLAN 137B (prompt-tuned) — 86.5 (2021-09-03) FLAN 137B (zero-shot) — 80.8 (2021-09-03) longdoc S (OntoNotes + PreCo + LitBank) — 60.1 (2021-09-20) longdoc S (ON + PreCo + LitBank + 30k pseudo-singletons) — 59.4 (2021-09-20) ST-MoE-32B 269B (fine-tuned) — 96.6 (2022-02-17) ST-MoE-L 4.1B (fine-tuned) — 93.3 (2022-02-17) PaLM 540B (fine-tuned) — 100.0 (2022-04-05) PaLM 540B (5-shot) — 89.5 (2022-04-05) PaLM 540B (0-shot) — 89.1 (2022-04-05) PaLM 540B (1-shot) — 86.3 (2022-04-05) UL2 20B (fine-tuned) — 98.1 (2022-05-10) UL2 20B (0-shot) — 79.9 (2022-05-10) N-Grammer 343M — 68.3 (2022-07-13) AlexaTM 20B — 68.3 (2022-08-02) Neo-6B (QA + WS) — 77.9 (2022-10-05) Neo-6B (QA) — 74.7 (2022-10-05) Neo-6B (few-shot) — 36.5 (2022-10-05) Flipped-3B — 58.37 (2022-10-06) Flan-T5 XXL (zero -shot) — 89.82 (2022-10-20) KiC-770M — 65.4 (2022-10-28) Vega v2 6B (KD-based prompt transfer) — 98.6 (2022-12-04) Turing NLR v5 XXL 5.4B (fine-tuned) — 97.3 (2022-12-04) H3 125M (3-shot, rank classification) — 63.5 (2022-12-28) H3 125M (0-shot, rank classification) — 61.5 (2022-12-28) Hybrid H3 125M (3-shot, logit scoring) — 43.3 (2022-12-28) RoE-3B — 62.21 (2023-02-07) Pythia 12B (0-shot) — 54.8 (2023-04-03) Pythia 2.8B (0-shot) — 38.5 (2023-04-03) Pythia 6.9B (0-shot) — 36.5 (2023-04-03) Pythia 12B (5-shot) — 36.5 (2023-04-03) GPT-2-XL 1.5B — 73.3 (2023-04-27) LaMini-GPT 1.5B — 69.6 (2023-04-27) T5-Large 738M — 66.7 (2023-04-27) LaMini-F-T5 783M — 64.1 (2023-04-27) LaMini-T5 738M — 59.0 (2023-04-27) PaLM 2-M (1-shot) — 88.1 (2023-05-17) PaLM 2-L (1-shot) — 86.9 (2023-05-17) PaLM 2-S (1-shot) — 84.6 (2023-05-17) T0-3B (CoT fine-tuned) — 66.0 (2023-05-23) KEE+NKAM winner of the WSC2016 — 58.3 (2016-11-13) Ensemble of 14 LMs — 63.7 (2018-06-07) GPT-2 Medium 774M (partial scoring) — 69.2 (2018-11-05) GPT-2-XL 1.5B — 70.7 (2019-02-14) BERT-SocialIQA 340M — 72.5 (2019-04-22) RoBERTa-WinoGrande 355M — 90.1 (2019-07-24) T5-XXL 11B (fine-tuned) — 93.8 (2019-10-23) DeBERTa-1.5B — 95.9 (2020-06-05) ST-MoE-32B 269B (fine-tuned) — 96.6 (2022-02-17) PaLM 540B (fine-tuned) — 100.0 (2022-04-05)
RankModel Accuracy PaperCodeYear
1 PaLM 540B (fine-tuned) 100 PaLM: Scaling Language Modeling with Pathways lucidrains/CoCa-pytorch · lucidrains/PaLM-pytorch · google/paxml · +4 2022
2 Vega v2 6B (KD-based prompt transfer) 98.6 Toward Efficient Language Model Pretraining and Downstream Adaptation via Self-Evolution: A Case Study on SuperGLUE 2022
3 UL2 20B (fine-tuned) 98.1 UL2: Unifying Language Learning Paradigms google-research/google-research · opennlg/openba-v2 2022
4 Turing NLR v5 XXL 5.4B (fine-tuned) 97.3 Toward Efficient Language Model Pretraining and Downstream Adaptation via Self-Evolution: A Case Study on SuperGLUE 2022
5 ST-MoE-32B 269B (fine-tuned) 96.6 ST-MoE: Designing Stable and Transferable Sparse Expert Models tensorflow/mesh · xuefuzhao/openmoe · yikangshen/megablocks 2022
6 DeBERTa-1.5B 95.9 DeBERTa: Decoding-enhanced BERT with Disentangled Attention huggingface/transformers · microsoft/DeBERTa · osu-nlp-group/mind2web · +11 2020
7 T5-XXL 11B (fine-tuned) 93.8 Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer huggingface/transformers · PaddlePaddle/PaddleNLP · google-research/text-to-text-transfer-transformer · +54 2019
8 ST-MoE-L 4.1B (fine-tuned) 93.3 ST-MoE: Designing Stable and Transferable Sparse Expert Models tensorflow/mesh · xuefuzhao/openmoe · yikangshen/megablocks 2022
9 RoBERTa-WinoGrande 355M 90.1 WinoGrande: An Adversarial Winograd Schema Challenge at Scale vered1986/self_talk · mindspore-ai/contrib · swarnahub/explanationhardness · +7 2019
10 Flan-T5 XXL (zero -shot) 89.82 Scaling Instruction-Finetuned Language Models google-research/flan · declare-lab/flan-alpaca · formulamonks/llm-benchmarker-suite · +6 2022
11 PaLM 540B (5-shot) 89.5 PaLM: Scaling Language Modeling with Pathways lucidrains/CoCa-pytorch · lucidrains/PaLM-pytorch · google/paxml · +4 2022
12 PaLM 540B (0-shot) 89.1 PaLM: Scaling Language Modeling with Pathways lucidrains/CoCa-pytorch · lucidrains/PaLM-pytorch · google/paxml · +4 2022
13 PaLM 2-M (1-shot) 88.1 PaLM 2 Technical Report eternityyw/tram-benchmark 2023
14 PaLM 2-L (1-shot) 86.9 PaLM 2 Technical Report eternityyw/tram-benchmark 2023
15 FLAN 137B (prompt-tuned) 86.5 Finetuned Language Models Are Zero-Shot Learners hiyouga/llama-efficient-tuning · bigcode-project/starcoder · bigscience-workshop/promptsource · +5 2021
16 PaLM 540B (1-shot) 86.3 PaLM: Scaling Language Modeling with Pathways lucidrains/CoCa-pytorch · lucidrains/PaLM-pytorch · google/paxml · +4 2022
17 TTTTT 3B (fine-tuned) 84.6 TTTTTackling WinoGrande Schemas 2020
17 PaLM 2-S (1-shot) 84.6 PaLM 2 Technical Report eternityyw/tram-benchmark 2023
19 RoBERTa-DPR 355M 83.1 WinoGrande: An Adversarial Winograd Schema Challenge at Scale vered1986/self_talk · mindspore-ai/contrib · swarnahub/explanationhardness · +7 2019
20 FLAN 137B (zero-shot) 80.8 Finetuned Language Models Are Zero-Shot Learners hiyouga/llama-efficient-tuning · bigcode-project/starcoder · bigscience-workshop/promptsource · +5 2021
1–20 / 82 다음 → 페이지당 10 20 50 100