{"task":"Arithmetic Reasoning","dataset":"MultiArith","metric_names":["Accuracy"],"rows":[{"id":127450,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"MultiArith","model_name":"Text-davinci-002 (175B)(zero-shot-cot)","metrics":{"Accuracy":"78.7"},"paper_url":"https://arxiv.org/abs/2205.11916v4","paper_title":"Large Language Models are Zero-Shot Reasoners","paper_date":"2022-05-24","code_links":[{"title":"kojima-takeshi188/zero_shot_cot","url":"https://github.com/kojima-takeshi188/zero_shot_cot"},{"title":"skytliang/multi-agents-debate","url":"https://github.com/skytliang/multi-agents-debate"},{"title":"zongqianwu/st-cot","url":"https://github.com/zongqianwu/st-cot"},{"title":"nicolay-r/reasoning-for-sentiment-analysis-framework","url":"https://github.com/nicolay-r/reasoning-for-sentiment-analysis-framework"}],"metrics_order":"[\"Accuracy\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127451,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"MultiArith","model_name":"Text-davinci-002 (175B) (zero-shot)","metrics":{"Accuracy":"17.7"},"paper_url":"https://arxiv.org/abs/2205.11916v4","paper_title":"Large Language Models are Zero-Shot Reasoners","paper_date":"2022-05-24","code_links":[{"title":"kojima-takeshi188/zero_shot_cot","url":"https://github.com/kojima-takeshi188/zero_shot_cot"},{"title":"skytliang/multi-agents-debate","url":"https://github.com/skytliang/multi-agents-debate"},{"title":"zongqianwu/st-cot","url":"https://github.com/zongqianwu/st-cot"},{"title":"nicolay-r/reasoning-for-sentiment-analysis-framework","url":"https://github.com/nicolay-r/reasoning-for-sentiment-analysis-framework"}],"metrics_order":"[\"Accuracy\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]}]}