{"task":"Common Sense Reasoning","dataset":"CommonsenseQA","metric_names":["Accuracy"],"rows":[{"id":32241,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"GPT-4o (HPT)","metrics":{"Accuracy":"92.54"},"paper_url":"https://arxiv.org/abs/2406.12644v4","paper_title":"Hierarchical Prompting Taxonomy: A Universal Evaluation Framework for Large Language Models Aligned with Human Cognitive Principles","paper_date":"2024-06-18","code_links":[{"title":"devichand579/HPT","url":"https://github.com/devichand579/HPT"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32242,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"DeBERTaV3-large+KEAR","metrics":{"Accuracy":"91.2"},"paper_url":"https://arxiv.org/abs/2112.03254v3","paper_title":"Human Parity on CommonsenseQA: Augmenting Self-Attention with External Attention","paper_date":"2021-12-06","code_links":[{"title":"microsoft/DEKCOR-CommonsenseQA","url":"https://github.com/microsoft/DEKCOR-CommonsenseQA"},{"title":"microsoft/kear","url":"https://github.com/microsoft/kear"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]},{"id":32243,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"PaLM 2 (few‑shot, CoT, SC)","metrics":{"Accuracy":"90.4"},"paper_url":"https://arxiv.org/abs/2305.10403v3","paper_title":"PaLM 2 Technical Report","paper_date":"2023-05-17","code_links":[{"title":"eternityyw/tram-benchmark","url":"https://github.com/eternityyw/tram-benchmark"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]},{"id":32244,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"KEAR","metrics":{"Accuracy":"89.4"},"paper_url":"https://arxiv.org/abs/2112.03254v3","paper_title":"Human Parity on CommonsenseQA: Augmenting Self-Attention with External Attention","paper_date":"2021-12-06","code_links":[{"title":"microsoft/DEKCOR-CommonsenseQA","url":"https://github.com/microsoft/DEKCOR-CommonsenseQA"},{"title":"microsoft/kear","url":"https://github.com/microsoft/kear"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]},{"id":32245,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"DEKCOR","metrics":{"Accuracy":"83.3"},"paper_url":"https://arxiv.org/abs/2012.04808v3","paper_title":"Fusing Context Into Knowledge Graph for Commonsense Question Answering","paper_date":"2020-12-09","code_links":[{"title":"microsoft/kear","url":"https://github.com/microsoft/kear"},{"title":"microsoft/DEKCOR-CommonsenseQA","url":"https://github.com/microsoft/DEKCOR-CommonsenseQA"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]},{"id":32246,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"Unicorn 11B (fine-tuned)","metrics":{"Accuracy":"79.3"},"paper_url":"https://arxiv.org/abs/2103.13009v1","paper_title":"UNICORN on RAINBOW: A Universal Commonsense Reasoning Model on a New Multitask Benchmark","paper_date":"2021-03-24","code_links":[{"title":"allenai/rainbow","url":"https://github.com/allenai/rainbow"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32247,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"MUPPET Roberta Large","metrics":{"Accuracy":"79.2"},"paper_url":"https://arxiv.org/abs/2101.11038v1","paper_title":"Muppet: Massive Multi-task Representations with Pre-Finetuning","paper_date":"2021-01-26","code_links":[{"title":"facebook/muppet-roberta-base","url":"https://huggingface.co/facebook/muppet-roberta-base"},{"title":"facebook/muppet-roberta-large","url":"https://huggingface.co/facebook/muppet-roberta-large"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]},{"id":32248,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"UnifiedQA 11B (fine-tuned)","metrics":{"Accuracy":"79.1"},"paper_url":"https://arxiv.org/abs/2005.00700v3","paper_title":"UnifiedQA: Crossing Format Boundaries With a Single QA System","paper_date":"2020-05-02","code_links":[{"title":"allenai/unifiedqa","url":"https://github.com/allenai/unifiedqa"},{"title":"facebookresearch/metaicl","url":"https://github.com/facebookresearch/metaicl"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]},{"id":32249,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"DRAGON","metrics":{"Accuracy":"78.2"},"paper_url":"https://arxiv.org/abs/2210.09338v2","paper_title":"Deep Bidirectional Language-Knowledge Graph Pretraining","paper_date":"2022-10-17","code_links":[{"title":"michiyasunaga/dragon","url":"https://github.com/michiyasunaga/dragon"},{"title":"HaochenLiu2000/QAP","url":"https://github.com/HaochenLiu2000/QAP"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32250,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"T5-XXL 11B (fine-tuned)","metrics":{"Accuracy":"78.1"},"paper_url":"https://arxiv.org/abs/2005.00700v3","paper_title":"UnifiedQA: Crossing Format Boundaries With a Single QA System","paper_date":"2020-05-02","code_links":[{"title":"allenai/unifiedqa","url":"https://github.com/allenai/unifiedqa"},{"title":"facebookresearch/metaicl","url":"https://github.com/facebookresearch/metaicl"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32251,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"Albert Lan et al. (2020) (ensemble)","metrics":{"Accuracy":"76.5"},"paper_url":"https://arxiv.org/abs/1909.11942v6","paper_title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","paper_date":"2019-09-26","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"tensorflow/models","url":"https://github.com/tensorflow/models/tree/master/official/nlp/albert"},{"title":"PaddlePaddle/PaddleNLP","url":"https://github.com/PaddlePaddle/PaddleNLP/blob/develop/paddlenlp/transformers/albert/modeling.py"},{"title":"CLUEbenchmark/CLUE","url":"https://github.com/CLUEbenchmark/CLUE"},{"title":"brightmart/albert_zh","url":"https://github.com/brightmart/albert_zh"},{"title":"google-research/ALBERT","url":"https://github.com/google-research/ALBERT"},{"title":"Tencent/TurboTransformers","url":"https://github.com/Tencent/TurboTransformers"},{"title":"kpe/bert-for-tf2","url":"https://github.com/kpe/bert-for-tf2"},{"title":"lonePatient/albert_pytorch","url":"https://github.com/lonePatient/albert_pytorch"},{"title":"plkmo/BERT-Relation-Extraction","url":"https://github.com/plkmo/BERT-Relation-Extraction"},{"title":"facebookresearch/anli","url":"https://github.com/facebookresearch/anli"},{"title":"lucidrains/routing-transformer","url":"https://github.com/lucidrains/routing-transformer"},{"title":"lucidrains/sinkhorn-transformer","url":"https://github.com/lucidrains/sinkhorn-transformer"},{"title":"graykode/ALBERT-Pytorch","url":"https://github.com/graykode/ALBERT-Pytorch"},{"title":"kamalkraj/ALBERT-TF2.0","url":"https://github.com/kamalkraj/ALBERT-TF2.0"},{"title":"lucidrains/compressive-transformer-pytorch","url":"https://github.com/lucidrains/compressive-transformer-pytorch"},{"title":"epfml/collaborative-attention","url":"https://github.com/epfml/collaborative-attention"},{"title":"Sanyuan-Chen/RecAdam","url":"https://github.com/Sanyuan-Chen/RecAdam"},{"title":"mindspore-lab/mindnlp","url":"https://github.com/mindspore-lab/mindnlp/blob/master/mindnlp/models/albert/albert.py"},{"title":"benywon/ReCO","url":"https://github.com/benywon/ReCO"},{"title":"KnightZhang625/BERT_TF","url":"https://github.com/KnightZhang625/BERT_TF"},{"title":"AdamStein97/Semi-Supervised-BERT-NER","url":"https://github.com/AdamStein97/Semi-Supervised-BERT-NER"},{"title":"mandubian/codenets","url":"https://github.com/mandubian/codenets"},{"title":"codegram/calbert","url":"https://github.com/codegram/calbert"},{"title":"yahah100/text_summarization","url":"https://github.com/yahah100/text_summarization"},{"title":"Soikonomou/albert_final_infer12","url":"https://github.com/Soikonomou/albert_final_infer12"},{"title":"xinyooo/ALBERT4Rec","url":"https://github.com/xinyooo/ALBERT4Rec"},{"title":"rajatgermany/qa-nlp","url":"https://github.com/rajatgermany/qa-nlp"},{"title":"Soikonomou/bert_new","url":"https://github.com/Soikonomou/bert_new"},{"title":"Soikonomou/bert_new_new","url":"https://github.com/Soikonomou/bert_new_new"},{"title":"Soikonomou/albert_final","url":"https://github.com/Soikonomou/albert_final"},{"title":"Soikonomou/albert_final_infer8","url":"https://github.com/Soikonomou/albert_final_infer8"},{"title":"benywon/Chinese-GPT-2","url":"https://github.com/benywon/Chinese-GPT-2"},{"title":"jpablou/Matching-The-Blanks-Ths","url":"https://github.com/jpablou/Matching-The-Blanks-Ths"},{"title":"vvvm23/albert","url":"https://github.com/vvvm23/albert"},{"title":"common-english/bert-all","url":"https://github.com/common-english/bert-all"},{"title":"AhmedYounes94/Semi-supervised-BERT-NER","url":"https://github.com/AhmedYounes94/Semi-supervised-BERT-NER"},{"title":"appcoreopc/berty","url":"https://github.com/appcoreopc/berty"},{"title":"lyqcom/albert","url":"https://github.com/lyqcom/albert"},{"title":"mtzcorporations/nlp_teamjodka","url":"https://github.com/mtzcorporations/nlp_teamjodka"},{"title":"cui0523/Code6","url":"https://github.com/cui0523/Code6/tree/main/albert"},{"title":"cypressd1999/FYP_2021","url":"https://github.com/cypressd1999/FYP_2021"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/albert"},{"title":"Mind23-2/MindCode-131","url":"https://github.com/Mind23-2/MindCode-131"},{"title":"2023-MindSpore-1/ms-code-219","url":"https://github.com/2023-MindSpore-1/ms-code-219/tree/main/albert"},{"title":"hieudepchai/BERT_IE","url":"https://github.com/hieudepchai/BERT_IE"},{"title":"DataScienceNigeria/ALBERT-for-Natural-Language-Processing","url":"https://github.com/DataScienceNigeria/ALBERT-for-Natural-Language-Processing"},{"title":"MindSpore-paper-code-3/code9","url":"https://github.com/MindSpore-paper-code-3/code9/tree/main/albert"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32252,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"UnifiedQA 11B (zero-shot)","metrics":{"Accuracy":"76.2"},"paper_url":"https://arxiv.org/abs/2005.00700v3","paper_title":"UnifiedQA: Crossing Format Boundaries With a Single QA System","paper_date":"2020-05-02","code_links":[{"title":"allenai/unifiedqa","url":"https://github.com/allenai/unifiedqa"},{"title":"facebookresearch/metaicl","url":"https://github.com/facebookresearch/metaicl"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32253,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"QA-GNN","metrics":{"Accuracy":"76.1"},"paper_url":"https://arxiv.org/abs/2104.06378v5","paper_title":"QA-GNN: Reasoning with Language Models and Knowledge Graphs for Question Answering","paper_date":"2021-04-13","code_links":[{"title":"michiyasunaga/qagnn","url":"https://github.com/michiyasunaga/qagnn"},{"title":"rucaibox/safe","url":"https://github.com/rucaibox/safe"},{"title":"tobias-opsahl/fact-or-fiction","url":"https://github.com/tobias-opsahl/fact-or-fiction"},{"title":"HaochenLiu2000/QAP","url":"https://github.com/HaochenLiu2000/QAP"},{"title":"CMSC470-Team/Model","url":"https://github.com/CMSC470-Team/Model"},{"title":"worksheets/0xf215deb0","url":"https://worksheets.codalab.org/worksheets/0xf215deb05edf44a2ac353c711f52a25f"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32254,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"XLNet+GraphReason","metrics":{"Accuracy":"75.3"},"paper_url":"https://arxiv.org/abs/1909.05311v2","paper_title":"Graph-Based Reasoning over Heterogeneous External Knowledge for Commonsense Question Answering","paper_date":"2019-09-09","code_links":[{"title":"DecstionBack/AAAI_2020_CommonsenseQA","url":"https://github.com/DecstionBack/AAAI_2020_CommonsenseQA"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32255,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"GrapeQA: PEGA","metrics":{"Accuracy":"73.5"},"paper_url":"https://arxiv.org/abs/2303.12320v2","paper_title":"GrapeQA: GRaph Augmentation and Pruning to Enhance Question-Answering","paper_date":"2023-03-22","code_links":[],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32256,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"RoBERTa+HyKAS Ma et al. (2019)","metrics":{"Accuracy":"73.2"},"paper_url":"https://arxiv.org/abs/1910.14087v1","paper_title":"Towards Generalizable Neuro-Symbolic Systems for Commonsense Question Answering","paper_date":"2019-10-30","code_links":[],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32257,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"GPT-3 Direct Finetuned","metrics":{"Accuracy":"73.0"},"paper_url":"https://arxiv.org/abs/2112.03254v3","paper_title":"Human Parity on CommonsenseQA: Augmenting Self-Attention with External Attention","paper_date":"2021-12-06","code_links":[{"title":"microsoft/DEKCOR-CommonsenseQA","url":"https://github.com/microsoft/DEKCOR-CommonsenseQA"},{"title":"microsoft/kear","url":"https://github.com/microsoft/kear"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32258,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"STaR (on GPT-J)","metrics":{"Accuracy":"72.3"},"paper_url":"https://arxiv.org/abs/2203.14465v2","paper_title":"STaR: Bootstrapping Reasoning With Reasoning","paper_date":"2022-03-28","code_links":[{"title":"ezelikman/STaR","url":"https://github.com/ezelikman/STaR"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32259,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"RoBERTa-Large 355M","metrics":{"Accuracy":"72.1"},"paper_url":"https://arxiv.org/abs/1907.11692v1","paper_title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","paper_date":"2019-07-26","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"pytorch/fairseq","url":"https://github.com/pytorch/fairseq"},{"title":"PaddlePaddle/PaddleNLP","url":"https://github.com/PaddlePaddle/PaddleNLP/blob/develop/paddlenlp/transformers/roberta/modeling.py"},{"title":"salesforce/codet5","url":"https://github.com/salesforce/codet5"},{"title":"brightmart/roberta_zh","url":"https://github.com/brightmart/roberta_zh"},{"title":"utterworks/fast-bert","url":"https://github.com/utterworks/fast-bert"},{"title":"kaushaltrivedi/fast-bert","url":"https://github.com/kaushaltrivedi/fast-bert"},{"title":"Tencent/TurboTransformers","url":"https://github.com/Tencent/TurboTransformers"},{"title":"IndicoDataSolutions/finetune","url":"https://github.com/IndicoDataSolutions/finetune"},{"title":"xiaoqian19940510/text-classification-surveys","url":"https://github.com/xiaoqian19940510/text-classification-surveys"},{"title":"xiaoqian19940510/text-classification-","url":"https://github.com/xiaoqian19940510/text-classification-"},{"title":"oneflow-inc/libai","url":"https://github.com/oneflow-inc/libai"},{"title":"facebookresearch/anli","url":"https://github.com/facebookresearch/anli"},{"title":"awslabs/mlm-scoring","url":"https://github.com/awslabs/mlm-scoring"},{"title":"hkuds/easyrec","url":"https://github.com/hkuds/easyrec"},{"title":"musixmatchresearch/umberto","url":"https://github.com/musixmatchresearch/umberto"},{"title":"octanove/shiba","url":"https://github.com/octanove/shiba"},{"title":"wzzzd/LM_NER","url":"https://github.com/wzzzd/LM_NER"},{"title":"sdadas/polish-roberta","url":"https://github.com/sdadas/polish-roberta"},{"title":"lvyufeng/bert4ms","url":"https://github.com/lvyufeng/bert4ms"},{"title":"few-shot-NER-benchmark/BaselineCode","url":"https://github.com/few-shot-NER-benchmark/BaselineCode"},{"title":"obi-ml-public/ehr_deidentification","url":"https://github.com/obi-ml-public/ehr_deidentification"},{"title":"GeorgeLuImmortal/Hierarchical-BERT-Model-with-Limited-Labelled-Data","url":"https://github.com/GeorgeLuImmortal/Hierarchical-BERT-Model-with-Limited-Labelled-Data"},{"title":"Karthik-Bhaskar/Context-Based-Question-Answering","url":"https://github.com/Karthik-Bhaskar/Context-Based-Question-Answering"},{"title":"benywon/ReCO","url":"https://github.com/benywon/ReCO"},{"title":"lashoun/hanna-benchmark-asg","url":"https://github.com/lashoun/hanna-benchmark-asg"},{"title":"dig-team/hanna-benchmark-asg","url":"https://github.com/dig-team/hanna-benchmark-asg"},{"title":"nguyenvulebinh/vietnamese-roberta","url":"https://github.com/nguyenvulebinh/vietnamese-roberta"},{"title":"eternityyw/tram-benchmark","url":"https://github.com/eternityyw/tram-benchmark"},{"title":"aistairc/kirt_bert_on_abci","url":"https://github.com/aistairc/kirt_bert_on_abci"},{"title":"SindhuMadi/FakeNewsDetection","url":"https://github.com/SindhuMadi/FakeNewsDetection"},{"title":"traviscoan/cards","url":"https://github.com/traviscoan/cards"},{"title":"zfj1998/CodeBert-Code2Text","url":"https://github.com/zfj1998/CodeBert-Code2Text"},{"title":"haisongzhang/roberta-tiny-cased","url":"https://github.com/haisongzhang/roberta-tiny-cased"},{"title":"viethoang1512/kpa","url":"https://github.com/viethoang1512/kpa"},{"title":"devhemza/BERTweet_sentiment_analysis","url":"https://github.com/devhemza/BERTweet_sentiment_analysis"},{"title":"clovaai/textual-kd-slu","url":"https://github.com/clovaai/textual-kd-slu"},{"title":"znhy1024/protoco","url":"https://github.com/znhy1024/protoco"},{"title":"abdumaa/hiqualprop","url":"https://github.com/abdumaa/hiqualprop"},{"title":"simon-benigeri/narrative-generation","url":"https://github.com/simon-benigeri/narrative-generation"},{"title":"NathanDuran/Sentence-Encoding-for-DA-Classification","url":"https://github.com/NathanDuran/Sentence-Encoding-for-DA-Classification"},{"title":"blawok/named-entity-recognition","url":"https://github.com/blawok/named-entity-recognition"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-3/roberta"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/5/xlm_roberta"},{"title":"CalumPerrio/WNUT-2020","url":"https://github.com/CalumPerrio/WNUT-2020"},{"title":"duanchi1230/NLP_Project_AI2_Reasoning_Challenge","url":"https://github.com/duanchi1230/NLP_Project_AI2_Reasoning_Challenge"},{"title":"common-english/bert-all","url":"https://github.com/common-english/bert-all"},{"title":"ibm/vira-intent-discovery","url":"https://github.com/ibm/vira-intent-discovery"},{"title":"expertailab/spaceqa","url":"https://github.com/expertailab/spaceqa"},{"title":"abhishekanand1710/noiseandbias","url":"https://github.com/abhishekanand1710/noiseandbias"},{"title":"bfopengradient/NLP_ROBERTA","url":"https://github.com/bfopengradient/NLP_ROBERTA"},{"title":"tighu20/Kaggle-Tweet-Sentiment-Extraction","url":"https://github.com/tighu20/Kaggle-Tweet-Sentiment-Extraction"},{"title":"flexible-fl/flex-nlp","url":"https://github.com/flexible-fl/flex-nlp"},{"title":"bcaitech1/p2-klue-Heeseok-Jeong","url":"https://github.com/bcaitech1/p2-klue-Heeseok-Jeong"},{"title":"10Exahertz/Text-ResNet-on-Sentimental-LIAR-Fake-News","url":"https://github.com/10Exahertz/Text-ResNet-on-Sentimental-LIAR-Fake-News"},{"title":"knuddy/op_text","url":"https://github.com/knuddy/op_text"},{"title":"bluejurand/Kaggle_QA_Google_Labeling","url":"https://github.com/bluejurand/Kaggle_QA_Google_Labeling"},{"title":"2023-MindSpore-1/ms-code-163","url":"https://github.com/2023-MindSpore-1/ms-code-163"},{"title":"zaradana/Fast_BERT","url":"https://github.com/zaradana/Fast_BERT"},{"title":"mthcom/hscore-dataset-pruning","url":"https://github.com/mthcom/hscore-dataset-pruning"},{"title":"MS-P3/code7","url":"https://github.com/MS-P3/code7/tree/main/xlm_roberta_xl"},{"title":"pisalore/roberta_results","url":"https://github.com/pisalore/roberta_results"},{"title":"knuddj1/op_text","url":"https://github.com/knuddj1/op_text"},{"title":"ricaelum42/Contextual-Twitter-Sarcasm-Detection","url":"https://github.com/ricaelum42/Contextual-Twitter-Sarcasm-Detection"},{"title":"UnknownGenie/altered-BERT-KPE","url":"https://github.com/UnknownGenie/altered-BERT-KPE"},{"title":"G-4-R-Y/Tweet-Sentiment-Extraction-roBERTa-5fold","url":"https://github.com/G-4-R-Y/Tweet-Sentiment-Extraction-roBERTa-5fold"},{"title":"G-4-R-Y/Tweet-Sentiment-Extraction","url":"https://github.com/G-4-R-Y/Tweet-Sentiment-Extraction"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32260,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"STaR without Rationalization (on GPT-J)","metrics":{"Accuracy":"68.8"},"paper_url":"https://arxiv.org/abs/2203.14465v2","paper_title":"STaR: Bootstrapping Reasoning With Reasoning","paper_date":"2022-03-28","code_links":[{"title":"ezelikman/STaR","url":"https://github.com/ezelikman/STaR"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32261,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"OPT 66B (1-shot)","metrics":{"Accuracy":"66.4"},"paper_url":"https://arxiv.org/abs/2303.17564v3","paper_title":"BloombergGPT: A Large Language Model for Finance","paper_date":"2023-03-30","code_links":[{"title":"yangletliu/finlora","url":"https://github.com/yangletliu/finlora"},{"title":"open-finance-lab/finlora","url":"https://github.com/open-finance-lab/finlora"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32262,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"Bloomberg GPT 50B (1-shot)","metrics":{"Accuracy":"65.5"},"paper_url":"https://arxiv.org/abs/2303.17564v3","paper_title":"BloombergGPT: A Large Language Model for Finance","paper_date":"2023-03-30","code_links":[{"title":"yangletliu/finlora","url":"https://github.com/yangletliu/finlora"},{"title":"open-finance-lab/finlora","url":"https://github.com/open-finance-lab/finlora"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32263,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"CAGE-reasoning","metrics":{"Accuracy":"64.7"},"paper_url":"https://arxiv.org/abs/1906.02361v1","paper_title":"Explain Yourself! Leveraging Language Models for Commonsense Reasoning","paper_date":"2019-06-06","code_links":[{"title":"salesforce/cos-e","url":"https://github.com/salesforce/cos-e"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32264,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"BLOOM 176B (1-shot)","metrics":{"Accuracy":"64.2"},"paper_url":"https://arxiv.org/abs/2303.17564v3","paper_title":"BloombergGPT: A Large Language Model for Finance","paper_date":"2023-03-30","code_links":[{"title":"yangletliu/finlora","url":"https://github.com/yangletliu/finlora"},{"title":"open-finance-lab/finlora","url":"https://github.com/open-finance-lab/finlora"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32265,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"UnifiedQA 440M (fine-tuned)","metrics":{"Accuracy":"64"},"paper_url":"https://arxiv.org/abs/2005.00700v3","paper_title":"UnifiedQA: Crossing Format Boundaries With a Single QA System","paper_date":"2020-05-02","code_links":[{"title":"allenai/unifiedqa","url":"https://github.com/allenai/unifiedqa"},{"title":"facebookresearch/metaicl","url":"https://github.com/facebookresearch/metaicl"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32266,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"BART-large 440M (fine-tuned)","metrics":{"Accuracy":"62.5"},"paper_url":"https://arxiv.org/abs/2005.00700v3","paper_title":"UnifiedQA: Crossing Format Boundaries With a Single QA System","paper_date":"2020-05-02","code_links":[{"title":"allenai/unifiedqa","url":"https://github.com/allenai/unifiedqa"},{"title":"facebookresearch/metaicl","url":"https://github.com/facebookresearch/metaicl"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32267,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"BERT_CSlarge","metrics":{"Accuracy":"62.2"},"paper_url":"https://arxiv.org/abs/1908.06725v5","paper_title":"Align, Mask and Select: A Simple Method for Incorporating Commonsense Knowledge into Language Representation Models","paper_date":"2019-08-19","code_links":[],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32268,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"GPT-NeoX 20B (1-shot)","metrics":{"Accuracy":"60.4"},"paper_url":"https://arxiv.org/abs/2303.17564v3","paper_title":"BloombergGPT: A Large Language Model for Finance","paper_date":"2023-03-30","code_links":[{"title":"yangletliu/finlora","url":"https://github.com/yangletliu/finlora"},{"title":"open-finance-lab/finlora","url":"https://github.com/open-finance-lab/finlora"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32269,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"GPT-J Direct Finetuned","metrics":{"Accuracy":"60.0"},"paper_url":"https://arxiv.org/abs/2203.14465v2","paper_title":"STaR: Bootstrapping Reasoning With Reasoning","paper_date":"2022-03-28","code_links":[{"title":"ezelikman/STaR","url":"https://github.com/ezelikman/STaR"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32270,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"KagNet","metrics":{"Accuracy":"58.9"},"paper_url":"https://arxiv.org/abs/1909.02151v1","paper_title":"KagNet: Knowledge-Aware Graph Networks for Commonsense Reasoning","paper_date":"2019-09-04","code_links":[{"title":"INK-USC/KagNet","url":"https://github.com/INK-USC/KagNet"},{"title":"INK-USC/MHGRN","url":"https://github.com/INK-USC/MHGRN"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]},{"id":32271,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"BERT-LARGE","metrics":{"Accuracy":"55.9"},"paper_url":"http://arxiv.org/abs/1811.00937v2","paper_title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","paper_date":"2018-11-02","code_links":[{"title":"jonathanherzig/commonsenseqa","url":"https://github.com/jonathanherzig/commonsenseqa"},{"title":"xlang-ai/batch-prompting","url":"https://github.com/xlang-ai/batch-prompting"},{"title":"hkunlp/batch-prompting","url":"https://github.com/hkunlp/batch-prompting"},{"title":"francois-rd/accord","url":"https://github.com/francois-rd/accord"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]},{"id":32272,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"UL2 20B (chain-of-thought + self-consistency)","metrics":{"Accuracy":"55.7"},"paper_url":"https://arxiv.org/abs/2205.05131v3","paper_title":"UL2: Unifying Language Learning Paradigms","paper_date":"2022-05-10","code_links":[{"title":"google-research/google-research","url":"https://github.com/google-research/google-research"},{"title":"opennlg/openba-v2","url":"https://github.com/opennlg/openba-v2"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32273,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"Few-shot CoT LaMDA 137B","metrics":{"Accuracy":" 55.6"},"paper_url":"https://arxiv.org/abs/2203.14465v2","paper_title":"STaR: Bootstrapping Reasoning With Reasoning","paper_date":"2022-03-28","code_links":[{"title":"ezelikman/STaR","url":"https://github.com/ezelikman/STaR"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32274,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"UL2 20B (chain-of-thought)","metrics":{"Accuracy":"51.4"},"paper_url":"https://arxiv.org/abs/2205.05131v3","paper_title":"UL2: Unifying Language Learning Paradigms","paper_date":"2022-05-10","code_links":[{"title":"google-research/google-research","url":"https://github.com/google-research/google-research"},{"title":"opennlg/openba-v2","url":"https://github.com/opennlg/openba-v2"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32275,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"Few-shot CoT GPT-J","metrics":{"Accuracy":"36.6"},"paper_url":"https://arxiv.org/abs/2203.14465v2","paper_title":"STaR: Bootstrapping Reasoning With Reasoning","paper_date":"2022-03-28","code_links":[{"title":"ezelikman/STaR","url":"https://github.com/ezelikman/STaR"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32276,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"UL2 20B (zero-shot)","metrics":{"Accuracy":"34.2"},"paper_url":"https://arxiv.org/abs/2205.05131v3","paper_title":"UL2: Unifying Language Learning Paradigms","paper_date":"2022-05-10","code_links":[{"title":"google-research/google-research","url":"https://github.com/google-research/google-research"},{"title":"opennlg/openba-v2","url":"https://github.com/opennlg/openba-v2"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32277,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"Chain of thought ASDiv","metrics":{"Accuracy":"28.6"},"paper_url":"https://arxiv.org/abs/2201.11903v6","paper_title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","paper_date":"2022-01-28","code_links":[{"title":"microsoft/guidance","url":"https://github.com/microsoft/guidance"},{"title":"guidance-ai/guidance","url":"https://github.com/guidance-ai/guidance"},{"title":"thudm/chatglm2-6b","url":"https://github.com/thudm/chatglm2-6b"},{"title":"srush/minichain","url":"https://github.com/srush/minichain"},{"title":"lupantech/chameleon-llm","url":"https://github.com/lupantech/chameleon-llm"},{"title":"lastmile-ai/aiconfig","url":"https://github.com/lastmile-ai/aiconfig"},{"title":"rlqja1107/torch-LLM4SGG","url":"https://github.com/rlqja1107/torch-LLM4SGG"},{"title":"scofield7419/thor-isa","url":"https://github.com/scofield7419/thor-isa"},{"title":"imnearth/coat","url":"https://github.com/imnearth/coat"},{"title":"coldmist-lu/erroranalysis_prompt","url":"https://github.com/coldmist-lu/erroranalysis_prompt"},{"title":"sunlab-osu/understanding-cot","url":"https://github.com/sunlab-osu/understanding-cot"},{"title":"TianduoWang/MsAT","url":"https://github.com/TianduoWang/MsAT"},{"title":"infini-ai-lab/sirius","url":"https://github.com/infini-ai-lab/sirius"},{"title":"yinzhangyue/eot","url":"https://github.com/yinzhangyue/eot"},{"title":"nicolay-r/thor-ecac","url":"https://github.com/nicolay-r/thor-ecac"},{"title":"mrlab-ai/NL2Plan","url":"https://github.com/mrlab-ai/NL2Plan"},{"title":"yinzhangyue/AoR","url":"https://github.com/yinzhangyue/AoR"},{"title":"mbzuai-clear/ioe-prompting","url":"https://github.com/mbzuai-clear/ioe-prompting"},{"title":"thu-keg/korc","url":"https://github.com/thu-keg/korc"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":32278,"task":"Common Sense Reasoning","parent_task":null,"dataset":"CommonsenseQA","model_name":"Few-shot Direct GPT-J","metrics":{"Accuracy":"20.9"},"paper_url":"https://arxiv.org/abs/2203.14465v2","paper_title":"STaR: Bootstrapping Reasoning With Reasoning","paper_date":"2022-03-28","code_links":[{"title":"ezelikman/STaR","url":"https://github.com/ezelikman/STaR"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]}]}