{"task":"Arithmetic Reasoning","dataset":"GSM8K","metric_names":["Accuracy","Parameters (Billion)"],"rows":[{"id":127453,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Claude 3.5 Sonnet (HPT)","metrics":{"Accuracy":"97.72"},"paper_url":"https://arxiv.org/abs/2406.12644v4","paper_title":"Hierarchical Prompting Taxonomy: A Universal Evaluation Framework for Large Language Models Aligned with Human Cognitive Principles","paper_date":"2024-06-18","code_links":[{"title":"devichand579/HPT","url":"https://github.com/devichand579/HPT"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127454,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DUP prompt upon GPT-4","metrics":{"Accuracy":"97.1"},"paper_url":"https://arxiv.org/abs/2404.14963v5","paper_title":"Achieving >97% on GSM8K: Deeply Understanding the Problems Makes LLMs Better Solvers for Math Word Problems","paper_date":"2024-04-23","code_links":[{"title":"whu-zqh/dup","url":"https://github.com/whu-zqh/dup"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127455,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Qwen2-Math-72B-Instruct\n(greedy)","metrics":{"Accuracy":"96.7","Parameters (Billion)":"72"},"paper_url":"https://arxiv.org/abs/2407.10671v4","paper_title":"Qwen2 Technical Report","paper_date":"2024-07-15","code_links":[{"title":"qwenlm/qwen1.5","url":"https://github.com/qwenlm/qwen1.5"},{"title":"qwenlm/qwen2","url":"https://github.com/qwenlm/qwen2"},{"title":"vicentvankor/sun-shine","url":"https://github.com/vicentvankor/sun-shine"},{"title":"ziye2chen/LLMs-for-Mathematical-Analysis","url":"https://github.com/ziye2chen/LLMs-for-Mathematical-Analysis"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-3/qwen2_moe"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-1/qwen2"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127456,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"SFT-Mistral-7B (Metamath, OVM, Smart Ensemble)","metrics":{"Accuracy":"96.4","Parameters (Billion)":"7"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127457,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath2-Llama3.1-70B (majority@256)","metrics":{"Accuracy":"96.0"},"paper_url":"https://arxiv.org/abs/2410.01560v2","paper_title":"OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data","paper_date":"2024-10-02","code_links":[{"title":"NVIDIA/NeMo-Skills","url":"https://github.com/NVIDIA/NeMo-Skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127458,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Jiutian-大模型","metrics":{"Accuracy":"95.2","Parameters (Billion)":"75"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127459,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DAMOMath-7B(MetaMath, OVM, BS, Ensemble)","metrics":{"Accuracy":"95.1","Parameters (Billion)":"7"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127460,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Claude 3 Opus (0-shot chain-of-thought)","metrics":{"Accuracy":"95"},"paper_url":"https://www.anthropic.com/news/claude-3-family","paper_title":"The Claude 3 Model Family: Opus, Sonnet, Haiku","paper_date":"2024-03-04","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127461,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath2-Llama3.1-70B","metrics":{"Accuracy":"94.9"},"paper_url":"https://arxiv.org/abs/2410.01560v2","paper_title":"OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data","paper_date":"2024-10-02","code_links":[{"title":"NVIDIA/NeMo-Skills","url":"https://github.com/NVIDIA/NeMo-Skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127462,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"GPT-4 (Teaching-Inspired)","metrics":{"Accuracy":"94.8"},"paper_url":"https://arxiv.org/abs/2410.08068v1","paper_title":"Teaching-Inspired Integrated Prompting Framework: A Novel Approach for Enhancing Reasoning in Large Language Models","paper_date":"2024-10-10","code_links":[{"title":"sallytan13/teaching-inspired-prompting","url":"https://github.com/sallytan13/teaching-inspired-prompting"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127463,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"SFT-Mistral-7B (Metamath + ovm +ensemble)","metrics":{"Accuracy":"94.13","Parameters (Billion)":"7"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127464,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath2-Llama3.1-8B (majority@256)","metrics":{"Accuracy":"94.1"},"paper_url":"https://arxiv.org/abs/2410.01560v2","paper_title":"OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data","paper_date":"2024-10-02","code_links":[{"title":"NVIDIA/NeMo-Skills","url":"https://github.com/NVIDIA/NeMo-Skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127465,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Qwen2-72B-Instruct-Step-DPO (0-shot CoT)","metrics":{"Accuracy":"94.0"},"paper_url":"https://arxiv.org/abs/2406.18629v1","paper_title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","paper_date":"2024-06-26","code_links":[{"title":"dvlab-research/step-dpo","url":"https://github.com/dvlab-research/step-dpo"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127466,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DAMOMath-7B(MetaMath, OVM, Ensemble)","metrics":{"Accuracy":"93.2","Parameters (Billion)":"7"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127467,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Claude 3 Sonnet (0-shot chain-of-thought)","metrics":{"Accuracy":"92.3"},"paper_url":"https://www.anthropic.com/news/claude-3-family","paper_title":"The Claude 3 Model Family: Opus, Sonnet, Haiku","paper_date":"2024-03-04","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127468,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"AlphaLLM (with MCTS)","metrics":{"Accuracy":"92","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2404.12253v2","paper_title":"Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing","paper_date":"2024-04-18","code_links":[{"title":"yetianjhu/alphallm","url":"https://github.com/yetianjhu/alphallm"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127469,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath2-Llama3.1-8B","metrics":{"Accuracy":"91.7"},"paper_url":"https://arxiv.org/abs/2410.01560v2","paper_title":"OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data","paper_date":"2024-10-02","code_links":[{"title":"NVIDIA/NeMo-Skills","url":"https://github.com/NVIDIA/NeMo-Skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127470,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"PaLM 2 (few-shot, k=8, SC)","metrics":{"Accuracy":"91.0"},"paper_url":"https://arxiv.org/abs/2305.10403v3","paper_title":"PaLM 2 Technical Report","paper_date":"2023-05-17","code_links":[{"title":"eternityyw/tram-benchmark","url":"https://github.com/eternityyw/tram-benchmark"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127471,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"GaC(Qwen2-72B-Instruct + Llama-3-70B-Instruct)","metrics":{"Accuracy":"90.91"},"paper_url":"https://arxiv.org/abs/2406.12585v2","paper_title":"Breaking the Ceiling of the LLM Community by Treating Token Generation as a Classification for Ensembling","paper_date":"2024-06-18","code_links":[{"title":"yaoching0/gac","url":"https://github.com/yaoching0/gac"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127472,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath-CodeLlama-70B (w/ code, SC, k=50)","metrics":{"Accuracy":"90.8","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2402.10176v2","paper_title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","paper_date":"2024-02-15","code_links":[{"title":"kipok/nemo-skills","url":"https://github.com/kipok/nemo-skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127473,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DART-Math-Llama3-70B-Uniform (0-shot CoT, w/o code)","metrics":{"Accuracy":"90.4","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2407.13690v2","paper_title":"DART-Math: Difficulty-Aware Rejection Tuning for Mathematical Problem-Solving","paper_date":"2024-06-18","code_links":[{"title":"hkust-nlp/dart-math","url":"https://github.com/hkust-nlp/dart-math"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127474,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath-Llama2-70B (w/ code, SC, k=50)","metrics":{"Accuracy":"90.1","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2402.10176v2","paper_title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","paper_date":"2024-02-15","code_links":[{"title":"kipok/nemo-skills","url":"https://github.com/kipok/nemo-skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127475,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DART-Math-Llama3-70B-Prop2Diff (0-shot CoT, w/o code)","metrics":{"Accuracy":"89.6","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2407.13690v2","paper_title":"DART-Math: Difficulty-Aware Rejection Tuning for Mathematical Problem-Solving","paper_date":"2024-06-18","code_links":[{"title":"hkust-nlp/dart-math","url":"https://github.com/hkust-nlp/dart-math"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127476,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Shepherd+Mistral-7B (SFT on MetaMATH + PRM RL+ PRM rerank, k=256)","metrics":{"Accuracy":"89.1","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2312.08935v3","paper_title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","paper_date":"2023-12-14","code_links":[{"title":"hkust-nlp/b-star","url":"https://github.com/hkust-nlp/b-star"},{"title":"chang-github-00/llm-predictive-decoding","url":"https://github.com/chang-github-00/llm-predictive-decoding"},{"title":"peiyi9979/Math-Shepherd","url":"https://huggingface.co/datasets/peiyi9979/Math-Shepherd"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127477,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Llama SFT (Metamath ToRA Ensemble)","metrics":{"Accuracy":"89.0","Parameters (Billion)":"13"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127478,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Minerva 62B (maj5@100)","metrics":{"Accuracy":"89","Parameters (Billion)":"62"},"paper_url":"https://arxiv.org/abs/2206.14858v2","paper_title":"Solving Quantitative Reasoning Problems with Language Models","paper_date":"2022-06-29","code_links":[{"title":"gair-nlp/abel","url":"https://github.com/gair-nlp/abel"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127479,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Claude 3 Haiku (0-shot chain-of-thought)","metrics":{"Accuracy":"88.9"},"paper_url":"https://www.anthropic.com/news/claude-3-family","paper_title":"The Claude 3 Model Family: Opus, Sonnet, Haiku","paper_date":"2024-03-04","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127480,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"ToRA-70B (SC, k=50)","metrics":{"Accuracy":"88.3","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2309.17452v4","paper_title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","paper_date":"2023-09-29","code_links":[{"title":"microsoft/tora","url":"https://github.com/microsoft/tora"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127481,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DeepSeekMATH-RL-7B","metrics":{"Accuracy":"88.2","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2402.03300v3","paper_title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","paper_date":"2024-02-05","code_links":[{"title":"shibing624/medicalgpt","url":"https://github.com/shibing624/medicalgpt"},{"title":"deepseek-ai/deepseek-math","url":"https://github.com/deepseek-ai/deepseek-math"},{"title":"openpsi-project/realhf","url":"https://github.com/openpsi-project/realhf"},{"title":"synthlabsai/big-math","url":"https://github.com/synthlabsai/big-math"},{"title":"yynil/rwkvinside","url":"https://github.com/yynil/rwkvinside"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127482,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DART-Math-DSMath-7B-Uniform (0-shot CoT, w/o code)","metrics":{"Accuracy":"88.2","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2407.13690v2","paper_title":"DART-Math: Difficulty-Aware Rejection Tuning for Mathematical Problem-Solving","paper_date":"2024-06-18","code_links":[{"title":"hkust-nlp/dart-math","url":"https://github.com/hkust-nlp/dart-math"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127483,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath-CodeLlama-34B (w/ code, SC, k=50)","metrics":{"Accuracy":"88.0","Parameters (Billion)":"34"},"paper_url":"https://arxiv.org/abs/2402.10176v2","paper_title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","paper_date":"2024-02-15","code_links":[{"title":"kipok/nemo-skills","url":"https://github.com/kipok/nemo-skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127484,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Claude 2 (0-shot chain-of-thought)","metrics":{"Accuracy":"88"},"paper_url":"https://www-files.anthropic.com/production/images/Model-Card-Claude-2.pdf","paper_title":"Model Card and Evaluations for Claude Models","paper_date":"2023-07-11","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127485,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Shivaay-4B (8-shot chain-of-thought)","metrics":{"Accuracy":"87.41","Parameters (Billion)":"4"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127486,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DeepMind 70B Model (SFT+ORM-RL, ORM reranking)","metrics":{"Accuracy":"87.3","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2211.14275v1","paper_title":"Solving math word problems with process- and outcome-based feedback","paper_date":"2022-11-25","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127487,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MMOS-DeepSeekMath-7B(0-shot,k=50)","metrics":{"Accuracy":"87.2","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2403.00799v1","paper_title":"An Empirical Study of Data Ability Boundary in LLMs' Math Reasoning","paper_date":"2024-02-23","code_links":[{"title":"cyzhh/MMOS","url":"https://github.com/cyzhh/MMOS"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127488,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DeepMind 70B Model (SFT+PRM-RL, PRM reranking)","metrics":{"Accuracy":"87.1","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2211.14275v1","paper_title":"Solving math word problems with process- and outcome-based feedback","paper_date":"2022-11-25","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127489,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"GPT-4","metrics":{"Accuracy":"87.1"},"paper_url":"https://arxiv.org/abs/2303.12712v5","paper_title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","paper_date":"2023-03-22","code_links":[{"title":"microsoft/guidance","url":"https://github.com/microsoft/guidance"},{"title":"gammatauai/leetcode-hard-gym","url":"https://github.com/gammatauai/leetcode-hard-gym"},{"title":"emrgnt-cmplxty/zero-shot-replication","url":"https://github.com/emrgnt-cmplxty/zero-shot-replication"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127490,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath-Mistral-7B (w/ code, SC, k=50)","metrics":{"Accuracy":"86.9","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2402.10176v2","paper_title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","paper_date":"2024-02-15","code_links":[{"title":"kipok/nemo-skills","url":"https://github.com/kipok/nemo-skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127491,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Orca-Math 7B (fine-tuned)","metrics":{"Accuracy":"86.8","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2402.14830v1","paper_title":"Orca-Math: Unlocking the potential of SLMs in Grade School Math","paper_date":"2024-02-16","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127492,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DART-Math-DSMath-7B-Prop2Diff (0-shot CoT, w/o code)","metrics":{"Accuracy":"86.8","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2407.13690v2","paper_title":"DART-Math: Difficulty-Aware Rejection Tuning for Mathematical Problem-Solving","paper_date":"2024-06-18","code_links":[{"title":"hkust-nlp/dart-math","url":"https://github.com/hkust-nlp/dart-math"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127493,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath-CodeLlama-13B (w/ code, SC, k=50)","metrics":{"Accuracy":"86.8","Parameters (Billion)":"13"},"paper_url":"https://arxiv.org/abs/2402.10176v2","paper_title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","paper_date":"2024-02-15","code_links":[{"title":"kipok/nemo-skills","url":"https://github.com/kipok/nemo-skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127494,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Gemini Pro (maj1@32)","metrics":{"Accuracy":"86.5"},"paper_url":"https://arxiv.org/abs/2312.11805v5","paper_title":"Gemini: A Family of Highly Capable Multimodal Models","paper_date":"2023-12-19","code_links":[{"title":"valdecy/pybibx","url":"https://github.com/valdecy/pybibx"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127495,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Codex (Self-Evaluation Guided Decoding, PAL, multiple reasoning chains, 9-shot gen, 5-shot eval)","metrics":{"Accuracy":"85.5"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127496,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Claude 1.3 (0-shot chain-of-thought)","metrics":{"Accuracy":"85.2"},"paper_url":"https://www-files.anthropic.com/production/images/Model-Card-Claude-2.pdf","paper_title":"Model Card and Evaluations for Claude Models","paper_date":"2023-07-11","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127497,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"ToRA-Code-34B (SC, k=50)","metrics":{"Accuracy":"85.1","Parameters (Billion)":"34"},"paper_url":"https://arxiv.org/abs/2309.17452v4","paper_title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","paper_date":"2023-09-29","code_links":[{"title":"microsoft/tora","url":"https://github.com/microsoft/tora"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127498,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath-CodeLlama-7B (w/ code, SC, k=50)","metrics":{"Accuracy":"84.8","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2402.10176v2","paper_title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","paper_date":"2024-02-15","code_links":[{"title":"kipok/nemo-skills","url":"https://github.com/kipok/nemo-skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127499,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OVM-Mistral-7B (verify100@1)","metrics":{"Accuracy":"84.7","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2311.09724v2","paper_title":"OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning","paper_date":"2023-11-16","code_links":[{"title":"freedomintelligence/ovm","url":"https://github.com/freedomintelligence/ovm"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127500,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath-Llama2-70B (w/ code)","metrics":{"Accuracy":"84.7","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2402.10176v2","paper_title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","paper_date":"2024-02-15","code_links":[{"title":"kipok/nemo-skills","url":"https://github.com/kipok/nemo-skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127501,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath-CodeLlama-70B (w/ code)","metrics":{"Accuracy":"84.6","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2402.10176v2","paper_title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","paper_date":"2024-02-15","code_links":[{"title":"kipok/nemo-skills","url":"https://github.com/kipok/nemo-skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127502,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"code-davinci-002 175B (LEVER, 8-shot)","metrics":{"Accuracy":"84.5","Parameters (Billion)":"175"},"paper_url":"https://arxiv.org/abs/2302.08468v3","paper_title":"LEVER: Learning to Verify Language-to-Code Generation with Execution","paper_date":"2023-02-16","code_links":[{"title":"niansong1996/lever","url":"https://github.com/niansong1996/lever"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127503,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"ToRA 70B","metrics":{"Accuracy":"84.3","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2309.17452v4","paper_title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","paper_date":"2023-09-29","code_links":[{"title":"microsoft/tora","url":"https://github.com/microsoft/tora"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127504,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Shepherd + Mistral-7B (SFT on MetaMATH + PRM RL)","metrics":{"Accuracy":"84.1","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2312.08935v3","paper_title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","paper_date":"2023-12-14","code_links":[{"title":"hkust-nlp/b-star","url":"https://github.com/hkust-nlp/b-star"},{"title":"chang-github-00/llm-predictive-decoding","url":"https://github.com/chang-github-00/llm-predictive-decoding"},{"title":"peiyi9979/Math-Shepherd","url":"https://huggingface.co/datasets/peiyi9979/Math-Shepherd"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127505,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MathCoder-L-70B","metrics":{"Accuracy":"83.9","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2310.03731v1","paper_title":"MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning","paper_date":"2023-10-05","code_links":[{"title":"mathllm/mathcoder","url":"https://github.com/mathllm/mathcoder"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127506,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"WizardMath-7B-V1.1","metrics":{"Accuracy":"83.2","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2308.09583v2","paper_title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","paper_date":"2023-08-18","code_links":[{"title":"nlpxucan/wizardlm","url":"https://github.com/nlpxucan/wizardlm"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127507,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DIVERSE 175B (8-shot)","metrics":{"Accuracy":"83.2","Parameters (Billion)":"175"},"paper_url":"https://arxiv.org/abs/2206.02336v3","paper_title":"Making Large Language Models Better Reasoners with Step-Aware Verifier","paper_date":"2022-06-06","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127508,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OVM-Mistral-7B (verify20@1)","metrics":{"Accuracy":"82.6","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2311.09724v2","paper_title":"OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning","paper_date":"2023-11-16","code_links":[{"title":"freedomintelligence/ovm","url":"https://github.com/freedomintelligence/ovm"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127509,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DART-Math-Mistral-7B-Uniform (0-shot CoT, w/o code)","metrics":{"Accuracy":"82.6","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2407.13690v2","paper_title":"DART-Math: Difficulty-Aware Rejection Tuning for Mathematical Problem-Solving","paper_date":"2024-06-18","code_links":[{"title":"hkust-nlp/dart-math","url":"https://github.com/hkust-nlp/dart-math"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127510,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"ChatGPT (Ask, Refine, Trust)","metrics":{"Accuracy":"82.6"},"paper_url":"https://arxiv.org/abs/2311.07961v1","paper_title":"The ART of LLM Refinement: Ask, Refine, and Trust","paper_date":"2023-11-14","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127511,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DART-Math-Llama3-8B-Uniform (0-shot CoT, w/o code)","metrics":{"Accuracy":"82.5","Parameters (Billion)":"8"},"paper_url":"https://arxiv.org/abs/2407.13690v2","paper_title":"DART-Math: Difficulty-Aware Rejection Tuning for Mathematical Problem-Solving","paper_date":"2024-06-18","code_links":[{"title":"hkust-nlp/dart-math","url":"https://github.com/hkust-nlp/dart-math"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127512,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MetaMath 70B","metrics":{"Accuracy":"82.3","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2309.12284v4","paper_title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","paper_date":"2023-09-21","code_links":[{"title":"meta-math/MetaMath","url":"https://github.com/meta-math/MetaMath"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127513,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MuggleMATH 70B","metrics":{"Accuracy":"82.3","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2310.05506v3","paper_title":"MuggleMath: Assessing the Impact of Query and Response Augmentation on Math Reasoning","paper_date":"2023-10-09","code_links":[{"title":"ofa-sys/gsm8k-screl","url":"https://github.com/ofa-sys/gsm8k-screl"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127514,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"PaLM 540B (Self Improvement, Self Consistency)","metrics":{"Accuracy":"82.1","Parameters (Billion)":"540"},"paper_url":"https://arxiv.org/abs/2210.11610v2","paper_title":"Large Language Models Can Self-Improve","paper_date":"2022-10-20","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127515,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MathCoder-CL-34B","metrics":{"Accuracy":"81.7","Parameters (Billion)":"34"},"paper_url":"https://arxiv.org/abs/2310.03731v1","paper_title":"MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning","paper_date":"2023-10-05","code_links":[{"title":"mathllm/mathcoder","url":"https://github.com/mathllm/mathcoder"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127516,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"WizardMath-70B-V1.0","metrics":{"Accuracy":"81.6","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2308.09583v2","paper_title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","paper_date":"2023-08-18","code_links":[{"title":"nlpxucan/wizardlm","url":"https://github.com/nlpxucan/wizardlm"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127517,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Phi-GSM+V 1.3B+1.3B (verify48@1)","metrics":{"Accuracy":"81.5","Parameters (Billion)":"2.6"},"paper_url":"https://arxiv.org/abs/2312.09241v1","paper_title":"TinyGSM: achieving >80% on GSM8k with small language models","paper_date":"2023-12-14","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127518,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DART-Math-Mistral-7B-Prop2Diff (0-shot CoT, w/o code)","metrics":{"Accuracy":"81.1","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2407.13690v2","paper_title":"DART-Math: Difficulty-Aware Rejection Tuning for Mathematical Problem-Solving","paper_date":"2024-06-18","code_links":[{"title":"hkust-nlp/dart-math","url":"https://github.com/hkust-nlp/dart-math"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127519,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DART-Math-Llama3-8B-Prop2Diff (0-shot CoT, w/o code)","metrics":{"Accuracy":"81.1","Parameters (Billion)":"8"},"paper_url":"https://arxiv.org/abs/2407.13690v2","paper_title":"DART-Math: Difficulty-Aware Rejection Tuning for Mathematical Problem-Solving","paper_date":"2024-06-18","code_links":[{"title":"hkust-nlp/dart-math","url":"https://github.com/hkust-nlp/dart-math"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127520,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Claude Instant 1.1 (0-shot chain-of-thought)","metrics":{"Accuracy":"80.9"},"paper_url":"https://www-files.anthropic.com/production/images/Model-Card-Claude-2.pdf","paper_title":"Model Card and Evaluations for Claude Models","paper_date":"2023-07-11","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127521,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"ToRA-Code 34B","metrics":{"Accuracy":"80.7","Parameters (Billion)":"34"},"paper_url":"https://arxiv.org/abs/2309.17452v4","paper_title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","paper_date":"2023-09-29","code_links":[{"title":"microsoft/tora","url":"https://github.com/microsoft/tora"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127522,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath-CodeLlama-34B (w/ code)","metrics":{"Accuracy":"80.7","Parameters (Billion)":"34"},"paper_url":"https://arxiv.org/abs/2402.10176v2","paper_title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","paper_date":"2024-02-15","code_links":[{"title":"kipok/nemo-skills","url":"https://github.com/kipok/nemo-skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127523,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"PaLM 2 (few-shot, k=8, CoT)","metrics":{"Accuracy":"80.7"},"paper_url":"https://arxiv.org/abs/2305.10403v3","paper_title":"PaLM 2 Technical Report","paper_date":"2023-05-17","code_links":[{"title":"eternityyw/tram-benchmark","url":"https://github.com/eternityyw/tram-benchmark"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127524,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MMOS-DeepSeekMath-7B(0-shot)","metrics":{"Accuracy":"80.5","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2403.00799v1","paper_title":"An Empirical Study of Data Ability Boundary in LLMs' Math Reasoning","paper_date":"2024-02-23","code_links":[{"title":"cyzhh/MMOS","url":"https://github.com/cyzhh/MMOS"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127525,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MMOS-CODE-34B(0-shot)","metrics":{"Accuracy":"80.4","Parameters (Billion)":"34"},"paper_url":"https://arxiv.org/abs/2403.00799v1","paper_title":"An Empirical Study of Data Ability Boundary in LLMs' Math Reasoning","paper_date":"2024-02-23","code_links":[{"title":"cyzhh/MMOS","url":"https://github.com/cyzhh/MMOS"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127526,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath-Mistral-7B (w/ code)","metrics":{"Accuracy":"80.2","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2402.10176v2","paper_title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","paper_date":"2024-02-15","code_links":[{"title":"kipok/nemo-skills","url":"https://github.com/kipok/nemo-skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127527,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Self-Evaluation Guided Decoding (Codex, PAL, single reasoning chain, 9-shot gen, 5-shot eval)","metrics":{"Accuracy":"80.2"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127528,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath-CodeLlama-13B (w/ code)","metrics":{"Accuracy":"78.8","Parameters (Billion)":"13"},"paper_url":"https://arxiv.org/abs/2402.10176v2","paper_title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","paper_date":"2024-02-15","code_links":[{"title":"kipok/nemo-skills","url":"https://github.com/kipok/nemo-skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127529,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Minerva 540B (CoT)","metrics":{"Accuracy":"78.5","Parameters (Billion)":"540"},"paper_url":"https://arxiv.org/abs/2206.14858v2","paper_title":"Solving Quantitative Reasoning Problems with Language Models","paper_date":"2022-06-29","code_links":[{"title":"gair-nlp/abel","url":"https://github.com/gair-nlp/abel"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127530,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Camelidae-8×34B (5-shot)","metrics":{"Accuracy":"78.3"},"paper_url":"https://arxiv.org/abs/2401.02731v4","paper_title":"Parameter-Efficient Sparsity Crafting from Dense to Mixture-of-Experts for Instruction Tuning on General Tasks","paper_date":"2024-01-05","code_links":[{"title":"wuhy68/parameter-efficient-moe","url":"https://github.com/wuhy68/parameter-efficient-moe"},{"title":"ShayekhBinIslam/openrag","url":"https://github.com/ShayekhBinIslam/openrag"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127531,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Qwen2idae-16x14B (5-shot)","metrics":{"Accuracy":"77.8"},"paper_url":"https://arxiv.org/abs/2401.02731v4","paper_title":"Parameter-Efficient Sparsity Crafting from Dense to Mixture-of-Experts for Instruction Tuning on General Tasks","paper_date":"2024-01-05","code_links":[{"title":"wuhy68/parameter-efficient-moe","url":"https://github.com/wuhy68/parameter-efficient-moe"},{"title":"ShayekhBinIslam/openrag","url":"https://github.com/ShayekhBinIslam/openrag"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127532,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MetaMath-Mistral-7B","metrics":{"Accuracy":"77.7","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2309.12284v4","paper_title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","paper_date":"2023-09-21","code_links":[{"title":"meta-math/MetaMath","url":"https://github.com/meta-math/MetaMath"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127533,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenChat-3.5 7B","metrics":{"Accuracy":"77.3","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2309.11235v2","paper_title":"OpenChat: Advancing Open-source Language Models with Mixed-Quality Data","paper_date":"2023-09-20","code_links":[{"title":"imoneoi/openchat","url":"https://github.com/imoneoi/openchat"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127534,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DeepMind 70B Model (STaR, maj1@96)","metrics":{"Accuracy":"76.5","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2211.14275v1","paper_title":"Solving math word problems with process- and outcome-based feedback","paper_date":"2022-11-25","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127535,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Arithmo2-Mistral-7B","metrics":{"Accuracy":"76.4","Parameters (Billion)":"7"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127536,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OpenMath-CodeLlama-7B (w/ code)","metrics":{"Accuracy":"75.9","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2402.10176v2","paper_title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","paper_date":"2024-02-15","code_links":[{"title":"kipok/nemo-skills","url":"https://github.com/kipok/nemo-skills"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127537,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"ToRA-Code 13B","metrics":{"Accuracy":"75.8","Parameters (Billion)":"13"},"paper_url":"https://arxiv.org/abs/2309.17452v4","paper_title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","paper_date":"2023-09-29","code_links":[{"title":"microsoft/tora","url":"https://github.com/microsoft/tora"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":590537,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Before you <think>, monitor: Implementin","metrics":{"Accuracy":"75.42"},"paper_url":"https://paperswithcode.com/paper/before-you-think-monitor-implementing-flavell-s-metacognitive-framework-in-llms","paper_title":"Before you <think>, monitor: Implementing Flavell's metacognitive framework in LLMs","paper_date":"2025-10-18","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":127538,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Arithmo-Mistral-7B","metrics":{"Accuracy":"74.7","Parameters (Billion)":"7"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127539,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"PaLM 540B maj1@40 (8-shot)","metrics":{"Accuracy":"74.4","Parameters (Billion)":"540"},"paper_url":"https://arxiv.org/abs/2203.11171v4","paper_title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","paper_date":"2022-03-21","code_links":[{"title":"codelion/optillm","url":"https://github.com/codelion/optillm/blob/main/optillm/self_consistency.py"},{"title":"lastmile-ai/aiconfig","url":"https://github.com/lastmile-ai/aiconfig/tree/main/cookbooks/Multi-LLM-Consistency"},{"title":"hughbzhang/o1_inference_scaling_laws","url":"https://github.com/hughbzhang/o1_inference_scaling_laws"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127540,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"PaLM 540B (Self Consistency)","metrics":{"Accuracy":"74.4","Parameters (Billion)":"540"},"paper_url":"https://arxiv.org/abs/2210.11610v2","paper_title":"Large Language Models Can Self-Improve","paper_date":"2022-10-20","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127541,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Phi-GSM 2.7B (fine-tuned)","metrics":{"Accuracy":"74.3","Parameters (Billion)":"2.7"},"paper_url":"https://arxiv.org/abs/2312.09241v1","paper_title":"TinyGSM: achieving >80% on GSM8k with small language models","paper_date":"2023-12-14","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127542,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MathCoder-CL-13B","metrics":{"Accuracy":"74.1","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2310.03731v1","paper_title":"MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning","paper_date":"2023-10-05","code_links":[{"title":"mathllm/mathcoder","url":"https://github.com/mathllm/mathcoder"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127543,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MuggleMATH 13B","metrics":{"Accuracy":"74","Parameters (Billion)":"13"},"paper_url":"https://arxiv.org/abs/2310.05506v3","paper_title":"MuggleMath: Assessing the Impact of Query and Response Augmentation on Math Reasoning","paper_date":"2023-10-09","code_links":[{"title":"ofa-sys/gsm8k-screl","url":"https://github.com/ofa-sys/gsm8k-screl"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127544,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MMOS-CODE-7B(0-shot)","metrics":{"Accuracy":"73.9","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2403.00799v1","paper_title":"An Empirical Study of Data Ability Boundary in LLMs' Math Reasoning","paper_date":"2024-02-23","code_links":[{"title":"cyzhh/MMOS","url":"https://github.com/cyzhh/MMOS"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127545,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"CodeT5+","metrics":{"Accuracy":"73.8","Parameters (Billion)":"0.77"},"paper_url":"https://arxiv.org/abs/2305.07922v2","paper_title":"CodeT5+: Open Code Large Language Models for Code Understanding and Generation","paper_date":"2023-05-13","code_links":[{"title":"salesforce/codet5","url":"https://github.com/salesforce/codet5"},{"title":"leiluk1/codesearcher","url":"https://github.com/leiluk1/codesearcher"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127546,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Llama-3.3-70B + CAPO","metrics":{"Accuracy":"73.73"},"paper_url":"https://arxiv.org/abs/2504.16005v3","paper_title":"CAPO: Cost-Aware Prompt Optimization","paper_date":"2025-04-22","code_links":[{"title":"finitearth/promptolution","url":"https://github.com/finitearth/promptolution"},{"title":"finitearth/capo","url":"https://github.com/finitearth/capo"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127547,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"OVM-Llama2-7B (verify100@1)","metrics":{"Accuracy":"73.7","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2311.09724v2","paper_title":"OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning","paper_date":"2023-11-16","code_links":[{"title":"freedomintelligence/ovm","url":"https://github.com/freedomintelligence/ovm"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127548,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"PaLM 540B (Self Improvement, CoT Prompting)","metrics":{"Accuracy":"73.5","Parameters (Billion)":"540"},"paper_url":"https://arxiv.org/abs/2210.11610v2","paper_title":"Large Language Models Can Self-Improve","paper_date":"2022-10-20","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127549,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"KwaiYiiMath 13B","metrics":{"Accuracy":"73.3","Parameters (Billion)":"13"},"paper_url":"https://arxiv.org/abs/2310.07488v2","paper_title":"KwaiYiiMath: Technical Report","paper_date":"2023-10-11","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127550,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"ToRA-Code 7B","metrics":{"Accuracy":"72.6","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2309.17452v4","paper_title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","paper_date":"2023-09-29","code_links":[{"title":"microsoft/tora","url":"https://github.com/microsoft/tora"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127551,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MathCoder-L-13B","metrics":{"Accuracy":"72.6","Parameters (Billion)":"13"},"paper_url":"https://arxiv.org/abs/2310.03731v1","paper_title":"MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning","paper_date":"2023-10-05","code_links":[{"title":"mathllm/mathcoder","url":"https://github.com/mathllm/mathcoder"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127552,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DBRX Base 132B","metrics":{"Accuracy":"72.3"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127553,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Self-Evaluation Guided Decoding (Codex, CoT, single reasoning chain, 9-shot gen, 5-shot eval)","metrics":{"Accuracy":"71.9"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127554,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MetaMath 13B","metrics":{"Accuracy":"71.0","Parameters (Billion)":"13"},"paper_url":"https://arxiv.org/abs/2309.12284v4","paper_title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","paper_date":"2023-09-21","code_links":[{"title":"meta-math/MetaMath","url":"https://github.com/meta-math/MetaMath"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127555,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MuggleMATH 7B","metrics":{"Accuracy":"69.8","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2310.05506v3","paper_title":"MuggleMath: Assessing the Impact of Query and Response Augmentation on Math Reasoning","paper_date":"2023-10-09","code_links":[{"title":"ofa-sys/gsm8k-screl","url":"https://github.com/ofa-sys/gsm8k-screl"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127556,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"LLaMA 65B-maj1@k","metrics":{"Accuracy":"69.7","Parameters (Billion)":"65"},"paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","paper_date":"2023-02-27","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"ggml-org/llama.cpp","url":"https://github.com/ggml-org/llama.cpp"},{"title":"ggerganov/llama.cpp","url":"https://github.com/ggerganov/llama.cpp"},{"title":"meta-llama/llama","url":"https://github.com/meta-llama/llama"},{"title":"facebookresearch/llama","url":"https://github.com/facebookresearch/llama"},{"title":"tatsu-lab/stanford_alpaca","url":"https://github.com/tatsu-lab/stanford_alpaca"},{"title":"llamafamily/llama-chinese","url":"https://github.com/llamafamily/llama-chinese"},{"title":"flagalpha/llama2-chinese","url":"https://github.com/flagalpha/llama2-chinese"},{"title":"nebuly-ai/nebullvm","url":"https://github.com/nebuly-ai/nebullvm/tree/main/apps/accelerate/chatllama"},{"title":"Lightning-AI/lit-llama","url":"https://github.com/Lightning-AI/lit-llama"},{"title":"facico/chinese-vicuna","url":"https://github.com/facico/chinese-vicuna"},{"title":"qwopqwop200/GPTQ-for-LLaMa","url":"https://github.com/qwopqwop200/GPTQ-for-LLaMa"},{"title":"phoebussi/alpaca-cot","url":"https://github.com/phoebussi/alpaca-cot"},{"title":"young-geng/easylm","url":"https://github.com/young-geng/easylm"},{"title":"xusenlinzy/api-for-open-llm","url":"https://github.com/xusenlinzy/api-for-open-llm"},{"title":"guinmoon/llmfarm","url":"https://github.com/guinmoon/llmfarm"},{"title":"aethercortex/llama-x","url":"https://github.com/aethercortex/llama-x"},{"title":"beomi/koalpaca","url":"https://github.com/beomi/koalpaca"},{"title":"freedomintelligence/huatuogpt","url":"https://github.com/freedomintelligence/huatuogpt"},{"title":"icalk-nlp/educhat","url":"https://github.com/icalk-nlp/educhat"},{"title":"ecnu-icalk/educhat","url":"https://github.com/ecnu-icalk/educhat"},{"title":"ganjinzero/rrhf","url":"https://github.com/ganjinzero/rrhf"},{"title":"squeezeailab/squeezellm","url":"https://github.com/squeezeailab/squeezellm"},{"title":"chaoyi-wu/pmc-llama","url":"https://github.com/chaoyi-wu/pmc-llama"},{"title":"kbressem/medalpaca","url":"https://github.com/kbressem/medalpaca"},{"title":"chaoyi-wu/finetune_llama","url":"https://github.com/chaoyi-wu/finetune_llama"},{"title":"ofa-sys/expertllama","url":"https://github.com/ofa-sys/expertllama"},{"title":"xiaoman-zhang/PMC-VQA","url":"https://github.com/xiaoman-zhang/PMC-VQA"},{"title":"fsoft-ai4code/codecapybara","url":"https://github.com/fsoft-ai4code/codecapybara"},{"title":"kayvr/token-hawk","url":"https://github.com/kayvr/token-hawk"},{"title":"ntunlplab/traditional-chinese-alpaca","url":"https://github.com/ntunlplab/traditional-chinese-alpaca"},{"title":"teelinsan/camoscio","url":"https://github.com/teelinsan/camoscio"},{"title":"replicate/cog_stanford_alpaca","url":"https://github.com/replicate/cog_stanford_alpaca"},{"title":"greenbitai/low_bit_llama","url":"https://github.com/greenbitai/low_bit_llama"},{"title":"krafton-ai/korani","url":"https://github.com/krafton-ai/korani"},{"title":"yuanmu97/secure-transformer-inference","url":"https://github.com/yuanmu97/secure-transformer-inference"},{"title":"xzhang97666/alpacare","url":"https://github.com/xzhang97666/alpacare"},{"title":"hamishivi/easylm","url":"https://github.com/hamishivi/easylm"},{"title":"xvyaward/owq","url":"https://github.com/xvyaward/owq"},{"title":"vcskaushik/LLMzip","url":"https://github.com/vcskaushik/LLMzip"},{"title":"batsresearch/alfred","url":"https://github.com/batsresearch/alfred"},{"title":"grantslatton/llama.cpp","url":"https://github.com/grantslatton/llama.cpp"},{"title":"zihanzhaosjtu/librisqa","url":"https://github.com/zihanzhaosjtu/librisqa"},{"title":"fajri91/indommlu","url":"https://github.com/fajri91/indommlu"},{"title":"akanyaani/miniLLAMA","url":"https://github.com/akanyaani/miniLLAMA"},{"title":"stanfordbdhg/llama.cpp","url":"https://github.com/stanfordbdhg/llama.cpp"},{"title":"facebookresearch/chai","url":"https://github.com/facebookresearch/chai"},{"title":"aozhongzhang/magr","url":"https://github.com/aozhongzhang/magr"},{"title":"abhaskumarsinha/Corpus2GPT","url":"https://github.com/abhaskumarsinha/Corpus2GPT"},{"title":"ohadrubin/rpt","url":"https://github.com/ohadrubin/rpt"},{"title":"ecolab-postech/owq","url":"https://github.com/ecolab-postech/owq"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama2"},{"title":"Mind23-2/MindCode-140","url":"https://github.com/Mind23-2/MindCode-140"},{"title":"longhao-chen/aicas2024","url":"https://github.com/longhao-chen/aicas2024"},{"title":"MindSpore-scientific-2/code-14","url":"https://github.com/MindSpore-scientific-2/code-14/tree/main/llama"},{"title":"2023-MindSpore-4/Code12","url":"https://github.com/2023-MindSpore-4/Code12/tree/main/MindFormers/llama"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127557,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Minerva 62B (maj1@100)","metrics":{"Accuracy":"68.5","Parameters (Billion)":"62"},"paper_url":"https://arxiv.org/abs/2206.14858v2","paper_title":"Solving Quantitative Reasoning Problems with Language Models","paper_date":"2022-06-29","code_links":[{"title":"gair-nlp/abel","url":"https://github.com/gair-nlp/abel"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127558,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"code-davinci-002 (Least-to-Most Prompting)","metrics":{"Accuracy":"68.01","Parameters (Billion)":"175"},"paper_url":"https://arxiv.org/abs/2205.10625v3","paper_title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","paper_date":"2022-05-21","code_links":[{"title":"RUCAIBox/LLMBox","url":"https://github.com/RUCAIBox/LLMBox"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127559,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MathCoder-CL-7B","metrics":{"Accuracy":"67.8","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2310.03731v1","paper_title":"MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning","paper_date":"2023-10-05","code_links":[{"title":"mathllm/mathcoder","url":"https://github.com/mathllm/mathcoder"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127560,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"DBRX Instruct 132B","metrics":{"Accuracy":"66.9"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127561,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MetaMath 7B","metrics":{"Accuracy":"66.4","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2309.12284v4","paper_title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","paper_date":"2023-09-21","code_links":[{"title":"meta-math/MetaMath","url":"https://github.com/meta-math/MetaMath"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127562,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Mistral-Small-24B + CAPO","metrics":{"Accuracy":"65.07"},"paper_url":"https://arxiv.org/abs/2504.16005v3","paper_title":"CAPO: Cost-Aware Prompt Optimization","paper_date":"2025-04-22","code_links":[{"title":"finitearth/promptolution","url":"https://github.com/finitearth/promptolution"},{"title":"finitearth/capo","url":"https://github.com/finitearth/capo"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127563,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"RFT 70B","metrics":{"Accuracy":"64.8","Parameters (Billion)":"79"},"paper_url":"https://arxiv.org/abs/2308.01825v2","paper_title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","paper_date":"2023-08-03","code_links":[{"title":"ofa-sys/gsm8k-screl","url":"https://github.com/ofa-sys/gsm8k-screl"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127564,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"MathCoder-L-7B","metrics":{"Accuracy":"64.2","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2310.03731v1","paper_title":"MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning","paper_date":"2023-10-05","code_links":[{"title":"mathllm/mathcoder","url":"https://github.com/mathllm/mathcoder"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127565,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"WizardMath-13B-V1.0","metrics":{"Accuracy":"63.9","Parameters (Billion)":"13"},"paper_url":"https://arxiv.org/abs/2308.09583v2","paper_title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","paper_date":"2023-08-18","code_links":[{"title":"nlpxucan/wizardlm","url":"https://github.com/nlpxucan/wizardlm"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127566,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"GPT-J (CoRe)","metrics":{"Accuracy":"63.2","Parameters (Billion)":"12"},"paper_url":"https://arxiv.org/abs/2210.16257v5","paper_title":"Solving Math Word Problems via Cooperative Reasoning induced Language Models","paper_date":"2022-10-28","code_links":[{"title":"tianhongzxy/core","url":"https://github.com/tianhongzxy/core"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127567,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Llama-2 70B (on 100 first questions, 4-shot, auto-optimized prompting)","metrics":{"Accuracy":"61","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2402.10949v2","paper_title":"The Unreasonable Effectiveness of Eccentric Automatic Prompts","paper_date":"2024-02-09","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127568,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Qwen2.5-32B + CAPO","metrics":{"Accuracy":"60.2"},"paper_url":"https://arxiv.org/abs/2504.16005v3","paper_title":"CAPO: Cost-Aware Prompt Optimization","paper_date":"2025-04-22","code_links":[{"title":"finitearth/promptolution","url":"https://github.com/finitearth/promptolution"},{"title":"finitearth/capo","url":"https://github.com/finitearth/capo"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127569,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"LLaMA 2 70B (CoT-Influx)","metrics":{"Accuracy":"59.59","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2312.08901v3","paper_title":"Fewer is More: Boosting LLM Reasoning with Reinforced Context Pruning","paper_date":"2023-12-14","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127570,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Orca 2 13B","metrics":{"Accuracy":"59.14","Parameters (Billion)":"13"},"paper_url":"https://arxiv.org/abs/2311.11045v2","paper_title":"Orca 2: Teaching Small Language Models How to Reason","paper_date":"2023-11-18","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127571,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"U-PaLM","metrics":{"Accuracy":"58.5","Parameters (Billion)":"540"},"paper_url":"https://arxiv.org/abs/2210.11399v2","paper_title":"Transcending Scaling Laws with 0.1% Extra Compute","paper_date":"2022-10-20","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127572,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"PaLM-540B (few-Shot-cot)","metrics":{"Accuracy":"58.1","Parameters (Billion)":"540"},"paper_url":"https://arxiv.org/abs/2205.11916v4","paper_title":"Large Language Models are Zero-Shot Reasoners","paper_date":"2022-05-24","code_links":[{"title":"kojima-takeshi188/zero_shot_cot","url":"https://github.com/kojima-takeshi188/zero_shot_cot"},{"title":"skytliang/multi-agents-debate","url":"https://github.com/skytliang/multi-agents-debate"},{"title":"zongqianwu/st-cot","url":"https://github.com/zongqianwu/st-cot"},{"title":"nicolay-r/reasoning-for-sentiment-analysis-framework","url":"https://github.com/nicolay-r/reasoning-for-sentiment-analysis-framework"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127573,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"GPT-3.5 (few-shot, k=5)","metrics":{"Accuracy":"57.1"},"paper_url":"https://arxiv.org/abs/2303.08774v5","paper_title":"GPT-4 Technical Report","paper_date":"2023-03-15","code_links":[{"title":"openai/evals","url":"https://github.com/openai/evals"},{"title":"shmsw25/factscore","url":"https://github.com/shmsw25/factscore"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"gpt4life/alpagasus","url":"https://github.com/gpt4life/alpagasus"},{"title":"emrgnt-cmplxty/zero-shot-replication","url":"https://github.com/emrgnt-cmplxty/zero-shot-replication"},{"title":"ethz-privsec/superhuman-ai-consistency","url":"https://github.com/ethz-privsec/superhuman-ai-consistency"},{"title":"ethz-spylab/superhuman-ai-consistency","url":"https://github.com/ethz-spylab/superhuman-ai-consistency"},{"title":"eternityyw/tram-benchmark","url":"https://github.com/eternityyw/tram-benchmark"},{"title":"AUCOHL/RTL-Repo","url":"https://github.com/AUCOHL/RTL-Repo"},{"title":"zach-zhiling-zheng/reticular_chemist","url":"https://github.com/zach-zhiling-zheng/reticular_chemist"},{"title":"lflage/openfactscore","url":"https://github.com/lflage/openfactscore"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127574,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Minerva 8B (maj5@100)","metrics":{"Accuracy":"56.8","Parameters (Billion)":"8"},"paper_url":"https://arxiv.org/abs/2206.14858v2","paper_title":"Solving Quantitative Reasoning Problems with Language Models","paper_date":"2022-06-29","code_links":[{"title":"gair-nlp/abel","url":"https://github.com/gair-nlp/abel"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127575,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"LLaMA 2 70B (on-shot)","metrics":{"Accuracy":"56.8","Parameters (Billion)":"70"},"paper_url":"https://arxiv.org/abs/2307.09288v2","paper_title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","paper_date":"2023-07-18","code_links":[{"title":"facebookresearch/llama","url":"https://github.com/facebookresearch/llama"},{"title":"llamafamily/llama-chinese","url":"https://github.com/llamafamily/llama-chinese"},{"title":"flagalpha/llama2-chinese","url":"https://github.com/flagalpha/llama2-chinese"},{"title":"Lightning-AI/lit-gpt","url":"https://github.com/Lightning-AI/lit-gpt"},{"title":"young-geng/easylm","url":"https://github.com/young-geng/easylm"},{"title":"IBM/Dromedary","url":"https://github.com/IBM/Dromedary"},{"title":"squeezeailab/squeezellm","url":"https://github.com/squeezeailab/squeezellm"},{"title":"xverse-ai/xverse-13b","url":"https://github.com/xverse-ai/xverse-13b"},{"title":"usyd-fsalab/fp6_llm","url":"https://github.com/usyd-fsalab/fp6_llm"},{"title":"rijgersberg/geitje","url":"https://github.com/rijgersberg/geitje"},{"title":"xzhang97666/alpacare","url":"https://github.com/xzhang97666/alpacare"},{"title":"glb400/Toy-RecLM","url":"https://github.com/glb400/Toy-RecLM"},{"title":"ninglab/ecellm","url":"https://github.com/ninglab/ecellm"},{"title":"zurichnlp/contradecode","url":"https://github.com/zurichnlp/contradecode"},{"title":"eternityyw/tram-benchmark","url":"https://github.com/eternityyw/tram-benchmark"},{"title":"idiap/abroad-re","url":"https://github.com/idiap/abroad-re"},{"title":"meetyou-ai-lab/can-mc-evaluate-llms","url":"https://github.com/meetyou-ai-lab/can-mc-evaluate-llms"},{"title":"xuetianci/pacit","url":"https://github.com/xuetianci/pacit"},{"title":"coastalcph/eu-politics-llms","url":"https://github.com/coastalcph/eu-politics-llms"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127576,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"PaLM 540B (8-shot)","metrics":{"Accuracy":"56.5","Parameters (Billion)":"540"},"paper_url":"https://arxiv.org/abs/2206.14858v2","paper_title":"Solving Quantitative Reasoning Problems with Language Models","paper_date":"2022-06-29","code_links":[{"title":"gair-nlp/abel","url":"https://github.com/gair-nlp/abel"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127577,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"PaLM 540B (CoT Prompting)","metrics":{"Accuracy":"56.5","Parameters (Billion)":"540"},"paper_url":"https://arxiv.org/abs/2210.11610v2","paper_title":"Large Language Models Can Self-Improve","paper_date":"2022-10-20","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127578,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"RFT 13B","metrics":{"Accuracy":"55.3","Parameters (Billion)":"13"},"paper_url":"https://arxiv.org/abs/2308.01825v2","paper_title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","paper_date":"2023-08-03","code_links":[{"title":"ofa-sys/gsm8k-screl","url":"https://github.com/ofa-sys/gsm8k-screl"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127579,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Finetuned GPT-3 175B + verifier","metrics":{"Accuracy":"55.0","Parameters (Billion)":"175"},"paper_url":"https://arxiv.org/abs/2205.11916v4","paper_title":"Large Language Models are Zero-Shot Reasoners","paper_date":"2022-05-24","code_links":[{"title":"kojima-takeshi188/zero_shot_cot","url":"https://github.com/kojima-takeshi188/zero_shot_cot"},{"title":"skytliang/multi-agents-debate","url":"https://github.com/skytliang/multi-agents-debate"},{"title":"zongqianwu/st-cot","url":"https://github.com/zongqianwu/st-cot"},{"title":"nicolay-r/reasoning-for-sentiment-analysis-framework","url":"https://github.com/nicolay-r/reasoning-for-sentiment-analysis-framework"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127580,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"WizardMath-7B-V1.0","metrics":{"Accuracy":"54.9","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2308.09583v2","paper_title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","paper_date":"2023-08-18","code_links":[{"title":"nlpxucan/wizardlm","url":"https://github.com/nlpxucan/wizardlm"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127581,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"LLaMA 33B-maj1@k","metrics":{"Accuracy":"53.1","Parameters (Billion)":"33"},"paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","paper_date":"2023-02-27","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"ggml-org/llama.cpp","url":"https://github.com/ggml-org/llama.cpp"},{"title":"ggerganov/llama.cpp","url":"https://github.com/ggerganov/llama.cpp"},{"title":"meta-llama/llama","url":"https://github.com/meta-llama/llama"},{"title":"facebookresearch/llama","url":"https://github.com/facebookresearch/llama"},{"title":"tatsu-lab/stanford_alpaca","url":"https://github.com/tatsu-lab/stanford_alpaca"},{"title":"llamafamily/llama-chinese","url":"https://github.com/llamafamily/llama-chinese"},{"title":"flagalpha/llama2-chinese","url":"https://github.com/flagalpha/llama2-chinese"},{"title":"nebuly-ai/nebullvm","url":"https://github.com/nebuly-ai/nebullvm/tree/main/apps/accelerate/chatllama"},{"title":"Lightning-AI/lit-llama","url":"https://github.com/Lightning-AI/lit-llama"},{"title":"facico/chinese-vicuna","url":"https://github.com/facico/chinese-vicuna"},{"title":"qwopqwop200/GPTQ-for-LLaMa","url":"https://github.com/qwopqwop200/GPTQ-for-LLaMa"},{"title":"phoebussi/alpaca-cot","url":"https://github.com/phoebussi/alpaca-cot"},{"title":"young-geng/easylm","url":"https://github.com/young-geng/easylm"},{"title":"xusenlinzy/api-for-open-llm","url":"https://github.com/xusenlinzy/api-for-open-llm"},{"title":"guinmoon/llmfarm","url":"https://github.com/guinmoon/llmfarm"},{"title":"aethercortex/llama-x","url":"https://github.com/aethercortex/llama-x"},{"title":"beomi/koalpaca","url":"https://github.com/beomi/koalpaca"},{"title":"freedomintelligence/huatuogpt","url":"https://github.com/freedomintelligence/huatuogpt"},{"title":"icalk-nlp/educhat","url":"https://github.com/icalk-nlp/educhat"},{"title":"ecnu-icalk/educhat","url":"https://github.com/ecnu-icalk/educhat"},{"title":"ganjinzero/rrhf","url":"https://github.com/ganjinzero/rrhf"},{"title":"squeezeailab/squeezellm","url":"https://github.com/squeezeailab/squeezellm"},{"title":"chaoyi-wu/pmc-llama","url":"https://github.com/chaoyi-wu/pmc-llama"},{"title":"kbressem/medalpaca","url":"https://github.com/kbressem/medalpaca"},{"title":"chaoyi-wu/finetune_llama","url":"https://github.com/chaoyi-wu/finetune_llama"},{"title":"ofa-sys/expertllama","url":"https://github.com/ofa-sys/expertllama"},{"title":"xiaoman-zhang/PMC-VQA","url":"https://github.com/xiaoman-zhang/PMC-VQA"},{"title":"fsoft-ai4code/codecapybara","url":"https://github.com/fsoft-ai4code/codecapybara"},{"title":"kayvr/token-hawk","url":"https://github.com/kayvr/token-hawk"},{"title":"ntunlplab/traditional-chinese-alpaca","url":"https://github.com/ntunlplab/traditional-chinese-alpaca"},{"title":"teelinsan/camoscio","url":"https://github.com/teelinsan/camoscio"},{"title":"replicate/cog_stanford_alpaca","url":"https://github.com/replicate/cog_stanford_alpaca"},{"title":"greenbitai/low_bit_llama","url":"https://github.com/greenbitai/low_bit_llama"},{"title":"krafton-ai/korani","url":"https://github.com/krafton-ai/korani"},{"title":"yuanmu97/secure-transformer-inference","url":"https://github.com/yuanmu97/secure-transformer-inference"},{"title":"xzhang97666/alpacare","url":"https://github.com/xzhang97666/alpacare"},{"title":"hamishivi/easylm","url":"https://github.com/hamishivi/easylm"},{"title":"xvyaward/owq","url":"https://github.com/xvyaward/owq"},{"title":"vcskaushik/LLMzip","url":"https://github.com/vcskaushik/LLMzip"},{"title":"batsresearch/alfred","url":"https://github.com/batsresearch/alfred"},{"title":"grantslatton/llama.cpp","url":"https://github.com/grantslatton/llama.cpp"},{"title":"zihanzhaosjtu/librisqa","url":"https://github.com/zihanzhaosjtu/librisqa"},{"title":"fajri91/indommlu","url":"https://github.com/fajri91/indommlu"},{"title":"akanyaani/miniLLAMA","url":"https://github.com/akanyaani/miniLLAMA"},{"title":"stanfordbdhg/llama.cpp","url":"https://github.com/stanfordbdhg/llama.cpp"},{"title":"facebookresearch/chai","url":"https://github.com/facebookresearch/chai"},{"title":"aozhongzhang/magr","url":"https://github.com/aozhongzhang/magr"},{"title":"abhaskumarsinha/Corpus2GPT","url":"https://github.com/abhaskumarsinha/Corpus2GPT"},{"title":"ohadrubin/rpt","url":"https://github.com/ohadrubin/rpt"},{"title":"ecolab-postech/owq","url":"https://github.com/ecolab-postech/owq"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama2"},{"title":"Mind23-2/MindCode-140","url":"https://github.com/Mind23-2/MindCode-140"},{"title":"longhao-chen/aicas2024","url":"https://github.com/longhao-chen/aicas2024"},{"title":"MindSpore-scientific-2/code-14","url":"https://github.com/MindSpore-scientific-2/code-14/tree/main/llama"},{"title":"2023-MindSpore-4/Code12","url":"https://github.com/2023-MindSpore-4/Code12/tree/main/MindFormers/llama"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127582,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Minerva 62B (8-shot)","metrics":{"Accuracy":" 52.4","Parameters (Billion)":"62"},"paper_url":"https://arxiv.org/abs/2206.14858v2","paper_title":"Solving Quantitative Reasoning Problems with Language Models","paper_date":"2022-06-29","code_links":[{"title":"gair-nlp/abel","url":"https://github.com/gair-nlp/abel"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127583,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Mistral 7B (maj@8)","metrics":{"Accuracy":"52.2","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2310.06825v1","paper_title":"Mistral 7B","paper_date":"2023-10-10","code_links":[{"title":"mistralai/mistral-src","url":"https://github.com/mistralai/mistral-src"},{"title":"facebookresearch/fairseq2","url":"https://github.com/facebookresearch/fairseq2"},{"title":"mgmalek/efficient_cross_entropy","url":"https://github.com/mgmalek/efficient_cross_entropy"},{"title":"ninglab/ecellm","url":"https://github.com/ninglab/ecellm"},{"title":"knowlab/bi-weekly-paper-presentation","url":"https://github.com/knowlab/bi-weekly-paper-presentation"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/2/mistral"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127584,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Llemma 34B","metrics":{"Accuracy":"51.5","Parameters (Billion)":"34"},"paper_url":"https://arxiv.org/abs/2310.10631v3","paper_title":"Llemma: An Open Language Model For Mathematics","paper_date":"2023-10-16","code_links":[{"title":"eleutherai/gpt-neox","url":"https://github.com/eleutherai/gpt-neox"},{"title":"EleutherAI/math-lm","url":"https://github.com/EleutherAI/math-lm"},{"title":"wellecks/llmstep","url":"https://github.com/wellecks/llmstep"},{"title":"wellecks/llemma_formal2formal","url":"https://github.com/wellecks/llemma_formal2formal"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127585,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Text-davinci-002-175B (zero-plus-few-Shot-cot (8 samples))","metrics":{"Accuracy":"51.5","Parameters (Billion)":"175"},"paper_url":"https://arxiv.org/abs/2205.11916v4","paper_title":"Large Language Models are Zero-Shot Reasoners","paper_date":"2022-05-24","code_links":[{"title":"kojima-takeshi188/zero_shot_cot","url":"https://github.com/kojima-takeshi188/zero_shot_cot"},{"title":"skytliang/multi-agents-debate","url":"https://github.com/skytliang/multi-agents-debate"},{"title":"zongqianwu/st-cot","url":"https://github.com/zongqianwu/st-cot"},{"title":"nicolay-r/reasoning-for-sentiment-analysis-framework","url":"https://github.com/nicolay-r/reasoning-for-sentiment-analysis-framework"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127586,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"RFT 7B","metrics":{"Accuracy":"51.2","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2308.01825v2","paper_title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","paper_date":"2023-08-03","code_links":[{"title":"ofa-sys/gsm8k-screl","url":"https://github.com/ofa-sys/gsm8k-screl"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127587,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"LLaMA 65B","metrics":{"Accuracy":"50.9","Parameters (Billion)":"65"},"paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","paper_date":"2023-02-27","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"ggml-org/llama.cpp","url":"https://github.com/ggml-org/llama.cpp"},{"title":"ggerganov/llama.cpp","url":"https://github.com/ggerganov/llama.cpp"},{"title":"meta-llama/llama","url":"https://github.com/meta-llama/llama"},{"title":"facebookresearch/llama","url":"https://github.com/facebookresearch/llama"},{"title":"tatsu-lab/stanford_alpaca","url":"https://github.com/tatsu-lab/stanford_alpaca"},{"title":"llamafamily/llama-chinese","url":"https://github.com/llamafamily/llama-chinese"},{"title":"flagalpha/llama2-chinese","url":"https://github.com/flagalpha/llama2-chinese"},{"title":"nebuly-ai/nebullvm","url":"https://github.com/nebuly-ai/nebullvm/tree/main/apps/accelerate/chatllama"},{"title":"Lightning-AI/lit-llama","url":"https://github.com/Lightning-AI/lit-llama"},{"title":"facico/chinese-vicuna","url":"https://github.com/facico/chinese-vicuna"},{"title":"qwopqwop200/GPTQ-for-LLaMa","url":"https://github.com/qwopqwop200/GPTQ-for-LLaMa"},{"title":"phoebussi/alpaca-cot","url":"https://github.com/phoebussi/alpaca-cot"},{"title":"young-geng/easylm","url":"https://github.com/young-geng/easylm"},{"title":"xusenlinzy/api-for-open-llm","url":"https://github.com/xusenlinzy/api-for-open-llm"},{"title":"guinmoon/llmfarm","url":"https://github.com/guinmoon/llmfarm"},{"title":"aethercortex/llama-x","url":"https://github.com/aethercortex/llama-x"},{"title":"beomi/koalpaca","url":"https://github.com/beomi/koalpaca"},{"title":"freedomintelligence/huatuogpt","url":"https://github.com/freedomintelligence/huatuogpt"},{"title":"icalk-nlp/educhat","url":"https://github.com/icalk-nlp/educhat"},{"title":"ecnu-icalk/educhat","url":"https://github.com/ecnu-icalk/educhat"},{"title":"ganjinzero/rrhf","url":"https://github.com/ganjinzero/rrhf"},{"title":"squeezeailab/squeezellm","url":"https://github.com/squeezeailab/squeezellm"},{"title":"chaoyi-wu/pmc-llama","url":"https://github.com/chaoyi-wu/pmc-llama"},{"title":"kbressem/medalpaca","url":"https://github.com/kbressem/medalpaca"},{"title":"chaoyi-wu/finetune_llama","url":"https://github.com/chaoyi-wu/finetune_llama"},{"title":"ofa-sys/expertllama","url":"https://github.com/ofa-sys/expertllama"},{"title":"xiaoman-zhang/PMC-VQA","url":"https://github.com/xiaoman-zhang/PMC-VQA"},{"title":"fsoft-ai4code/codecapybara","url":"https://github.com/fsoft-ai4code/codecapybara"},{"title":"kayvr/token-hawk","url":"https://github.com/kayvr/token-hawk"},{"title":"ntunlplab/traditional-chinese-alpaca","url":"https://github.com/ntunlplab/traditional-chinese-alpaca"},{"title":"teelinsan/camoscio","url":"https://github.com/teelinsan/camoscio"},{"title":"replicate/cog_stanford_alpaca","url":"https://github.com/replicate/cog_stanford_alpaca"},{"title":"greenbitai/low_bit_llama","url":"https://github.com/greenbitai/low_bit_llama"},{"title":"krafton-ai/korani","url":"https://github.com/krafton-ai/korani"},{"title":"yuanmu97/secure-transformer-inference","url":"https://github.com/yuanmu97/secure-transformer-inference"},{"title":"xzhang97666/alpacare","url":"https://github.com/xzhang97666/alpacare"},{"title":"hamishivi/easylm","url":"https://github.com/hamishivi/easylm"},{"title":"xvyaward/owq","url":"https://github.com/xvyaward/owq"},{"title":"vcskaushik/LLMzip","url":"https://github.com/vcskaushik/LLMzip"},{"title":"batsresearch/alfred","url":"https://github.com/batsresearch/alfred"},{"title":"grantslatton/llama.cpp","url":"https://github.com/grantslatton/llama.cpp"},{"title":"zihanzhaosjtu/librisqa","url":"https://github.com/zihanzhaosjtu/librisqa"},{"title":"fajri91/indommlu","url":"https://github.com/fajri91/indommlu"},{"title":"akanyaani/miniLLAMA","url":"https://github.com/akanyaani/miniLLAMA"},{"title":"stanfordbdhg/llama.cpp","url":"https://github.com/stanfordbdhg/llama.cpp"},{"title":"facebookresearch/chai","url":"https://github.com/facebookresearch/chai"},{"title":"aozhongzhang/magr","url":"https://github.com/aozhongzhang/magr"},{"title":"abhaskumarsinha/Corpus2GPT","url":"https://github.com/abhaskumarsinha/Corpus2GPT"},{"title":"ohadrubin/rpt","url":"https://github.com/ohadrubin/rpt"},{"title":"ecolab-postech/owq","url":"https://github.com/ecolab-postech/owq"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama2"},{"title":"Mind23-2/MindCode-140","url":"https://github.com/Mind23-2/MindCode-140"},{"title":"longhao-chen/aicas2024","url":"https://github.com/longhao-chen/aicas2024"},{"title":"MindSpore-scientific-2/code-14","url":"https://github.com/MindSpore-scientific-2/code-14/tree/main/llama"},{"title":"2023-MindSpore-4/Code12","url":"https://github.com/2023-MindSpore-4/Code12/tree/main/MindFormers/llama"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127588,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Orca 2 7B","metrics":{"Accuracy":"47.23","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2311.11045v2","paper_title":"Orca 2: Teaching Small Language Models How to Reason","paper_date":"2023-11-18","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127589,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Llama-2 13B (on 100 first questions, 4-shot, auto-optimized prompting)","metrics":{"Accuracy":"43","Parameters (Billion)":"13"},"paper_url":"https://arxiv.org/abs/2402.10949v2","paper_title":"The Unreasonable Effectiveness of Eccentric Automatic Prompts","paper_date":"2024-02-09","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127590,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"text-davinci-002 175B (2-shot, CoT)","metrics":{"Accuracy":"41.3","Parameters (Billion)":"175"},"paper_url":"https://arxiv.org/abs/2205.11916v4","paper_title":"Large Language Models are Zero-Shot Reasoners","paper_date":"2022-05-24","code_links":[{"title":"kojima-takeshi188/zero_shot_cot","url":"https://github.com/kojima-takeshi188/zero_shot_cot"},{"title":"skytliang/multi-agents-debate","url":"https://github.com/skytliang/multi-agents-debate"},{"title":"zongqianwu/st-cot","url":"https://github.com/zongqianwu/st-cot"},{"title":"nicolay-r/reasoning-for-sentiment-analysis-framework","url":"https://github.com/nicolay-r/reasoning-for-sentiment-analysis-framework"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127591,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Mistral 7B (on 100 first questions, 4-shot, auto-optimized prompting)","metrics":{"Accuracy":"41","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2402.10949v2","paper_title":"The Unreasonable Effectiveness of Eccentric Automatic Prompts","paper_date":"2024-02-09","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127592,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"text-davinci-002 175B (0-shot, CoT)","metrics":{"Accuracy":"40.7","Parameters (Billion)":"175"},"paper_url":"https://arxiv.org/abs/2205.11916v4","paper_title":"Large Language Models are Zero-Shot Reasoners","paper_date":"2022-05-24","code_links":[{"title":"kojima-takeshi188/zero_shot_cot","url":"https://github.com/kojima-takeshi188/zero_shot_cot"},{"title":"skytliang/multi-agents-debate","url":"https://github.com/skytliang/multi-agents-debate"},{"title":"zongqianwu/st-cot","url":"https://github.com/zongqianwu/st-cot"},{"title":"nicolay-r/reasoning-for-sentiment-analysis-framework","url":"https://github.com/nicolay-r/reasoning-for-sentiment-analysis-framework"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127593,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Branch-Train-MiX 4x7B (sampling top-2 experts)","metrics":{"Accuracy":"37.1"},"paper_url":"https://arxiv.org/abs/2403.07816v1","paper_title":"Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM","paper_date":"2024-03-12","code_links":[{"title":"Leeroo-AI/mergoo","url":"https://github.com/Leeroo-AI/mergoo"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127594,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Llemma 7B","metrics":{"Accuracy":"36.4","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2310.10631v3","paper_title":"Llemma: An Open Language Model For Mathematics","paper_date":"2023-10-16","code_links":[{"title":"eleutherai/gpt-neox","url":"https://github.com/eleutherai/gpt-neox"},{"title":"EleutherAI/math-lm","url":"https://github.com/EleutherAI/math-lm"},{"title":"wellecks/llmstep","url":"https://github.com/wellecks/llmstep"},{"title":"wellecks/llemma_formal2formal","url":"https://github.com/wellecks/llemma_formal2formal"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127595,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"LLaMA 33B","metrics":{"Accuracy":"35.6","Parameters (Billion)":"33"},"paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","paper_date":"2023-02-27","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"ggml-org/llama.cpp","url":"https://github.com/ggml-org/llama.cpp"},{"title":"ggerganov/llama.cpp","url":"https://github.com/ggerganov/llama.cpp"},{"title":"meta-llama/llama","url":"https://github.com/meta-llama/llama"},{"title":"facebookresearch/llama","url":"https://github.com/facebookresearch/llama"},{"title":"tatsu-lab/stanford_alpaca","url":"https://github.com/tatsu-lab/stanford_alpaca"},{"title":"llamafamily/llama-chinese","url":"https://github.com/llamafamily/llama-chinese"},{"title":"flagalpha/llama2-chinese","url":"https://github.com/flagalpha/llama2-chinese"},{"title":"nebuly-ai/nebullvm","url":"https://github.com/nebuly-ai/nebullvm/tree/main/apps/accelerate/chatllama"},{"title":"Lightning-AI/lit-llama","url":"https://github.com/Lightning-AI/lit-llama"},{"title":"facico/chinese-vicuna","url":"https://github.com/facico/chinese-vicuna"},{"title":"qwopqwop200/GPTQ-for-LLaMa","url":"https://github.com/qwopqwop200/GPTQ-for-LLaMa"},{"title":"phoebussi/alpaca-cot","url":"https://github.com/phoebussi/alpaca-cot"},{"title":"young-geng/easylm","url":"https://github.com/young-geng/easylm"},{"title":"xusenlinzy/api-for-open-llm","url":"https://github.com/xusenlinzy/api-for-open-llm"},{"title":"guinmoon/llmfarm","url":"https://github.com/guinmoon/llmfarm"},{"title":"aethercortex/llama-x","url":"https://github.com/aethercortex/llama-x"},{"title":"beomi/koalpaca","url":"https://github.com/beomi/koalpaca"},{"title":"freedomintelligence/huatuogpt","url":"https://github.com/freedomintelligence/huatuogpt"},{"title":"icalk-nlp/educhat","url":"https://github.com/icalk-nlp/educhat"},{"title":"ecnu-icalk/educhat","url":"https://github.com/ecnu-icalk/educhat"},{"title":"ganjinzero/rrhf","url":"https://github.com/ganjinzero/rrhf"},{"title":"squeezeailab/squeezellm","url":"https://github.com/squeezeailab/squeezellm"},{"title":"chaoyi-wu/pmc-llama","url":"https://github.com/chaoyi-wu/pmc-llama"},{"title":"kbressem/medalpaca","url":"https://github.com/kbressem/medalpaca"},{"title":"chaoyi-wu/finetune_llama","url":"https://github.com/chaoyi-wu/finetune_llama"},{"title":"ofa-sys/expertllama","url":"https://github.com/ofa-sys/expertllama"},{"title":"xiaoman-zhang/PMC-VQA","url":"https://github.com/xiaoman-zhang/PMC-VQA"},{"title":"fsoft-ai4code/codecapybara","url":"https://github.com/fsoft-ai4code/codecapybara"},{"title":"kayvr/token-hawk","url":"https://github.com/kayvr/token-hawk"},{"title":"ntunlplab/traditional-chinese-alpaca","url":"https://github.com/ntunlplab/traditional-chinese-alpaca"},{"title":"teelinsan/camoscio","url":"https://github.com/teelinsan/camoscio"},{"title":"replicate/cog_stanford_alpaca","url":"https://github.com/replicate/cog_stanford_alpaca"},{"title":"greenbitai/low_bit_llama","url":"https://github.com/greenbitai/low_bit_llama"},{"title":"krafton-ai/korani","url":"https://github.com/krafton-ai/korani"},{"title":"yuanmu97/secure-transformer-inference","url":"https://github.com/yuanmu97/secure-transformer-inference"},{"title":"xzhang97666/alpacare","url":"https://github.com/xzhang97666/alpacare"},{"title":"hamishivi/easylm","url":"https://github.com/hamishivi/easylm"},{"title":"xvyaward/owq","url":"https://github.com/xvyaward/owq"},{"title":"vcskaushik/LLMzip","url":"https://github.com/vcskaushik/LLMzip"},{"title":"batsresearch/alfred","url":"https://github.com/batsresearch/alfred"},{"title":"grantslatton/llama.cpp","url":"https://github.com/grantslatton/llama.cpp"},{"title":"zihanzhaosjtu/librisqa","url":"https://github.com/zihanzhaosjtu/librisqa"},{"title":"fajri91/indommlu","url":"https://github.com/fajri91/indommlu"},{"title":"akanyaani/miniLLAMA","url":"https://github.com/akanyaani/miniLLAMA"},{"title":"stanfordbdhg/llama.cpp","url":"https://github.com/stanfordbdhg/llama.cpp"},{"title":"facebookresearch/chai","url":"https://github.com/facebookresearch/chai"},{"title":"aozhongzhang/magr","url":"https://github.com/aozhongzhang/magr"},{"title":"abhaskumarsinha/Corpus2GPT","url":"https://github.com/abhaskumarsinha/Corpus2GPT"},{"title":"ohadrubin/rpt","url":"https://github.com/ohadrubin/rpt"},{"title":"ecolab-postech/owq","url":"https://github.com/ecolab-postech/owq"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama2"},{"title":"Mind23-2/MindCode-140","url":"https://github.com/Mind23-2/MindCode-140"},{"title":"longhao-chen/aicas2024","url":"https://github.com/longhao-chen/aicas2024"},{"title":"MindSpore-scientific-2/code-14","url":"https://github.com/MindSpore-scientific-2/code-14/tree/main/llama"},{"title":"2023-MindSpore-4/Code12","url":"https://github.com/2023-MindSpore-4/Code12/tree/main/MindFormers/llama"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127596,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Vicuna (SYRELM)","metrics":{"Accuracy":"35.2","Parameters (Billion)":"13"},"paper_url":"https://arxiv.org/abs/2312.05571v2","paper_title":"Frugal LMs Trained to Invoke Symbolic Solvers Achieve Parameter-Efficient Arithmetic Reasoning","paper_date":"2023-12-09","code_links":[{"title":"joykirat18/syrelm","url":"https://github.com/joykirat18/syrelm"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127597,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"PaLM 62B (8-shot)","metrics":{"Accuracy":"33.0","Parameters (Billion)":"62"},"paper_url":"https://arxiv.org/abs/2206.14858v2","paper_title":"Solving Quantitative Reasoning Problems with Language Models","paper_date":"2022-06-29","code_links":[{"title":"gair-nlp/abel","url":"https://github.com/gair-nlp/abel"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127598,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"PaLM 540B (Self Improvement, Standard-Prompting)","metrics":{"Accuracy":"32.2","Parameters (Billion)":"540"},"paper_url":"https://arxiv.org/abs/2210.11610v2","paper_title":"Large Language Models Can Self-Improve","paper_date":"2022-10-20","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127599,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"LLaMA 13B-maj1@k","metrics":{"Accuracy":"29.3","Parameters (Billion)":"13"},"paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","paper_date":"2023-02-27","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"ggml-org/llama.cpp","url":"https://github.com/ggml-org/llama.cpp"},{"title":"ggerganov/llama.cpp","url":"https://github.com/ggerganov/llama.cpp"},{"title":"meta-llama/llama","url":"https://github.com/meta-llama/llama"},{"title":"facebookresearch/llama","url":"https://github.com/facebookresearch/llama"},{"title":"tatsu-lab/stanford_alpaca","url":"https://github.com/tatsu-lab/stanford_alpaca"},{"title":"llamafamily/llama-chinese","url":"https://github.com/llamafamily/llama-chinese"},{"title":"flagalpha/llama2-chinese","url":"https://github.com/flagalpha/llama2-chinese"},{"title":"nebuly-ai/nebullvm","url":"https://github.com/nebuly-ai/nebullvm/tree/main/apps/accelerate/chatllama"},{"title":"Lightning-AI/lit-llama","url":"https://github.com/Lightning-AI/lit-llama"},{"title":"facico/chinese-vicuna","url":"https://github.com/facico/chinese-vicuna"},{"title":"qwopqwop200/GPTQ-for-LLaMa","url":"https://github.com/qwopqwop200/GPTQ-for-LLaMa"},{"title":"phoebussi/alpaca-cot","url":"https://github.com/phoebussi/alpaca-cot"},{"title":"young-geng/easylm","url":"https://github.com/young-geng/easylm"},{"title":"xusenlinzy/api-for-open-llm","url":"https://github.com/xusenlinzy/api-for-open-llm"},{"title":"guinmoon/llmfarm","url":"https://github.com/guinmoon/llmfarm"},{"title":"aethercortex/llama-x","url":"https://github.com/aethercortex/llama-x"},{"title":"beomi/koalpaca","url":"https://github.com/beomi/koalpaca"},{"title":"freedomintelligence/huatuogpt","url":"https://github.com/freedomintelligence/huatuogpt"},{"title":"icalk-nlp/educhat","url":"https://github.com/icalk-nlp/educhat"},{"title":"ecnu-icalk/educhat","url":"https://github.com/ecnu-icalk/educhat"},{"title":"ganjinzero/rrhf","url":"https://github.com/ganjinzero/rrhf"},{"title":"squeezeailab/squeezellm","url":"https://github.com/squeezeailab/squeezellm"},{"title":"chaoyi-wu/pmc-llama","url":"https://github.com/chaoyi-wu/pmc-llama"},{"title":"kbressem/medalpaca","url":"https://github.com/kbressem/medalpaca"},{"title":"chaoyi-wu/finetune_llama","url":"https://github.com/chaoyi-wu/finetune_llama"},{"title":"ofa-sys/expertllama","url":"https://github.com/ofa-sys/expertllama"},{"title":"xiaoman-zhang/PMC-VQA","url":"https://github.com/xiaoman-zhang/PMC-VQA"},{"title":"fsoft-ai4code/codecapybara","url":"https://github.com/fsoft-ai4code/codecapybara"},{"title":"kayvr/token-hawk","url":"https://github.com/kayvr/token-hawk"},{"title":"ntunlplab/traditional-chinese-alpaca","url":"https://github.com/ntunlplab/traditional-chinese-alpaca"},{"title":"teelinsan/camoscio","url":"https://github.com/teelinsan/camoscio"},{"title":"replicate/cog_stanford_alpaca","url":"https://github.com/replicate/cog_stanford_alpaca"},{"title":"greenbitai/low_bit_llama","url":"https://github.com/greenbitai/low_bit_llama"},{"title":"krafton-ai/korani","url":"https://github.com/krafton-ai/korani"},{"title":"yuanmu97/secure-transformer-inference","url":"https://github.com/yuanmu97/secure-transformer-inference"},{"title":"xzhang97666/alpacare","url":"https://github.com/xzhang97666/alpacare"},{"title":"hamishivi/easylm","url":"https://github.com/hamishivi/easylm"},{"title":"xvyaward/owq","url":"https://github.com/xvyaward/owq"},{"title":"vcskaushik/LLMzip","url":"https://github.com/vcskaushik/LLMzip"},{"title":"batsresearch/alfred","url":"https://github.com/batsresearch/alfred"},{"title":"grantslatton/llama.cpp","url":"https://github.com/grantslatton/llama.cpp"},{"title":"zihanzhaosjtu/librisqa","url":"https://github.com/zihanzhaosjtu/librisqa"},{"title":"fajri91/indommlu","url":"https://github.com/fajri91/indommlu"},{"title":"akanyaani/miniLLAMA","url":"https://github.com/akanyaani/miniLLAMA"},{"title":"stanfordbdhg/llama.cpp","url":"https://github.com/stanfordbdhg/llama.cpp"},{"title":"facebookresearch/chai","url":"https://github.com/facebookresearch/chai"},{"title":"aozhongzhang/magr","url":"https://github.com/aozhongzhang/magr"},{"title":"abhaskumarsinha/Corpus2GPT","url":"https://github.com/abhaskumarsinha/Corpus2GPT"},{"title":"ohadrubin/rpt","url":"https://github.com/ohadrubin/rpt"},{"title":"ecolab-postech/owq","url":"https://github.com/ecolab-postech/owq"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama2"},{"title":"Mind23-2/MindCode-140","url":"https://github.com/Mind23-2/MindCode-140"},{"title":"longhao-chen/aicas2024","url":"https://github.com/longhao-chen/aicas2024"},{"title":"MindSpore-scientific-2/code-14","url":"https://github.com/MindSpore-scientific-2/code-14/tree/main/llama"},{"title":"2023-MindSpore-4/Code12","url":"https://github.com/2023-MindSpore-4/Code12/tree/main/MindFormers/llama"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127600,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Minerva 8B-maj1@k (8-shot)","metrics":{"Accuracy":" 28.4","Parameters (Billion)":"8"},"paper_url":"https://arxiv.org/abs/2206.14858v2","paper_title":"Solving Quantitative Reasoning Problems with Language Models","paper_date":"2022-06-29","code_links":[{"title":"gair-nlp/abel","url":"https://github.com/gair-nlp/abel"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127601,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"GPT-2-Medium 355M + question-solution classifier (BS=5)","metrics":{"Accuracy":"20.8","Parameters (Billion)":"0.355"},"paper_url":"https://arxiv.org/abs/2210.11522v1","paper_title":"Composing Ensembles of Pre-trained Models via Iterative Consensus","paper_date":"2022-10-20","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127602,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"GPT-Neo-2.7B + Self-Sampling","metrics":{"Accuracy":"19.5","Parameters (Billion)":"2.7"},"paper_url":"https://arxiv.org/abs/2205.14318v2","paper_title":"Learning Math Reasoning from Self-Sampled Correct and Partially-Correct Solutions","paper_date":"2022-05-28","code_links":[{"title":"microsoft/tracecodegen","url":"https://github.com/microsoft/tracecodegen"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127603,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"GPT-2-Medium 355M (fine-tuned, BS=5)","metrics":{"Accuracy":"18.3","Parameters (Billion)":"0.355"},"paper_url":"https://arxiv.org/abs/2210.11522v1","paper_title":"Composing Ensembles of Pre-trained Models via Iterative Consensus","paper_date":"2022-10-20","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127604,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"LLaMA 7B (maj1@k)","metrics":{"Accuracy":"18.1","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","paper_date":"2023-02-27","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"ggml-org/llama.cpp","url":"https://github.com/ggml-org/llama.cpp"},{"title":"ggerganov/llama.cpp","url":"https://github.com/ggerganov/llama.cpp"},{"title":"meta-llama/llama","url":"https://github.com/meta-llama/llama"},{"title":"facebookresearch/llama","url":"https://github.com/facebookresearch/llama"},{"title":"tatsu-lab/stanford_alpaca","url":"https://github.com/tatsu-lab/stanford_alpaca"},{"title":"llamafamily/llama-chinese","url":"https://github.com/llamafamily/llama-chinese"},{"title":"flagalpha/llama2-chinese","url":"https://github.com/flagalpha/llama2-chinese"},{"title":"nebuly-ai/nebullvm","url":"https://github.com/nebuly-ai/nebullvm/tree/main/apps/accelerate/chatllama"},{"title":"Lightning-AI/lit-llama","url":"https://github.com/Lightning-AI/lit-llama"},{"title":"facico/chinese-vicuna","url":"https://github.com/facico/chinese-vicuna"},{"title":"qwopqwop200/GPTQ-for-LLaMa","url":"https://github.com/qwopqwop200/GPTQ-for-LLaMa"},{"title":"phoebussi/alpaca-cot","url":"https://github.com/phoebussi/alpaca-cot"},{"title":"young-geng/easylm","url":"https://github.com/young-geng/easylm"},{"title":"xusenlinzy/api-for-open-llm","url":"https://github.com/xusenlinzy/api-for-open-llm"},{"title":"guinmoon/llmfarm","url":"https://github.com/guinmoon/llmfarm"},{"title":"aethercortex/llama-x","url":"https://github.com/aethercortex/llama-x"},{"title":"beomi/koalpaca","url":"https://github.com/beomi/koalpaca"},{"title":"freedomintelligence/huatuogpt","url":"https://github.com/freedomintelligence/huatuogpt"},{"title":"icalk-nlp/educhat","url":"https://github.com/icalk-nlp/educhat"},{"title":"ecnu-icalk/educhat","url":"https://github.com/ecnu-icalk/educhat"},{"title":"ganjinzero/rrhf","url":"https://github.com/ganjinzero/rrhf"},{"title":"squeezeailab/squeezellm","url":"https://github.com/squeezeailab/squeezellm"},{"title":"chaoyi-wu/pmc-llama","url":"https://github.com/chaoyi-wu/pmc-llama"},{"title":"kbressem/medalpaca","url":"https://github.com/kbressem/medalpaca"},{"title":"chaoyi-wu/finetune_llama","url":"https://github.com/chaoyi-wu/finetune_llama"},{"title":"ofa-sys/expertllama","url":"https://github.com/ofa-sys/expertllama"},{"title":"xiaoman-zhang/PMC-VQA","url":"https://github.com/xiaoman-zhang/PMC-VQA"},{"title":"fsoft-ai4code/codecapybara","url":"https://github.com/fsoft-ai4code/codecapybara"},{"title":"kayvr/token-hawk","url":"https://github.com/kayvr/token-hawk"},{"title":"ntunlplab/traditional-chinese-alpaca","url":"https://github.com/ntunlplab/traditional-chinese-alpaca"},{"title":"teelinsan/camoscio","url":"https://github.com/teelinsan/camoscio"},{"title":"replicate/cog_stanford_alpaca","url":"https://github.com/replicate/cog_stanford_alpaca"},{"title":"greenbitai/low_bit_llama","url":"https://github.com/greenbitai/low_bit_llama"},{"title":"krafton-ai/korani","url":"https://github.com/krafton-ai/korani"},{"title":"yuanmu97/secure-transformer-inference","url":"https://github.com/yuanmu97/secure-transformer-inference"},{"title":"xzhang97666/alpacare","url":"https://github.com/xzhang97666/alpacare"},{"title":"hamishivi/easylm","url":"https://github.com/hamishivi/easylm"},{"title":"xvyaward/owq","url":"https://github.com/xvyaward/owq"},{"title":"vcskaushik/LLMzip","url":"https://github.com/vcskaushik/LLMzip"},{"title":"batsresearch/alfred","url":"https://github.com/batsresearch/alfred"},{"title":"grantslatton/llama.cpp","url":"https://github.com/grantslatton/llama.cpp"},{"title":"zihanzhaosjtu/librisqa","url":"https://github.com/zihanzhaosjtu/librisqa"},{"title":"fajri91/indommlu","url":"https://github.com/fajri91/indommlu"},{"title":"akanyaani/miniLLAMA","url":"https://github.com/akanyaani/miniLLAMA"},{"title":"stanfordbdhg/llama.cpp","url":"https://github.com/stanfordbdhg/llama.cpp"},{"title":"facebookresearch/chai","url":"https://github.com/facebookresearch/chai"},{"title":"aozhongzhang/magr","url":"https://github.com/aozhongzhang/magr"},{"title":"abhaskumarsinha/Corpus2GPT","url":"https://github.com/abhaskumarsinha/Corpus2GPT"},{"title":"ohadrubin/rpt","url":"https://github.com/ohadrubin/rpt"},{"title":"ecolab-postech/owq","url":"https://github.com/ecolab-postech/owq"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama2"},{"title":"Mind23-2/MindCode-140","url":"https://github.com/Mind23-2/MindCode-140"},{"title":"longhao-chen/aicas2024","url":"https://github.com/longhao-chen/aicas2024"},{"title":"MindSpore-scientific-2/code-14","url":"https://github.com/MindSpore-scientific-2/code-14/tree/main/llama"},{"title":"2023-MindSpore-4/Code12","url":"https://github.com/2023-MindSpore-4/Code12/tree/main/MindFormers/llama"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127605,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"PaLM 540B (few-shot)","metrics":{"Accuracy":"17.9","Parameters (Billion)":"540"},"paper_url":"https://arxiv.org/abs/2205.11916v4","paper_title":"Large Language Models are Zero-Shot Reasoners","paper_date":"2022-05-24","code_links":[{"title":"kojima-takeshi188/zero_shot_cot","url":"https://github.com/kojima-takeshi188/zero_shot_cot"},{"title":"skytliang/multi-agents-debate","url":"https://github.com/skytliang/multi-agents-debate"},{"title":"zongqianwu/st-cot","url":"https://github.com/zongqianwu/st-cot"},{"title":"nicolay-r/reasoning-for-sentiment-analysis-framework","url":"https://github.com/nicolay-r/reasoning-for-sentiment-analysis-framework"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127606,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"PaLM 540B (Standard-Prompting)","metrics":{"Accuracy":"17.9","Parameters (Billion)":"540"},"paper_url":"https://arxiv.org/abs/2210.11610v2","paper_title":"Large Language Models Can Self-Improve","paper_date":"2022-10-20","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127607,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"LLaMA 13B","metrics":{"Accuracy":"17.8","Parameters (Billion)":"13"},"paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","paper_date":"2023-02-27","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"ggml-org/llama.cpp","url":"https://github.com/ggml-org/llama.cpp"},{"title":"ggerganov/llama.cpp","url":"https://github.com/ggerganov/llama.cpp"},{"title":"meta-llama/llama","url":"https://github.com/meta-llama/llama"},{"title":"facebookresearch/llama","url":"https://github.com/facebookresearch/llama"},{"title":"tatsu-lab/stanford_alpaca","url":"https://github.com/tatsu-lab/stanford_alpaca"},{"title":"llamafamily/llama-chinese","url":"https://github.com/llamafamily/llama-chinese"},{"title":"flagalpha/llama2-chinese","url":"https://github.com/flagalpha/llama2-chinese"},{"title":"nebuly-ai/nebullvm","url":"https://github.com/nebuly-ai/nebullvm/tree/main/apps/accelerate/chatllama"},{"title":"Lightning-AI/lit-llama","url":"https://github.com/Lightning-AI/lit-llama"},{"title":"facico/chinese-vicuna","url":"https://github.com/facico/chinese-vicuna"},{"title":"qwopqwop200/GPTQ-for-LLaMa","url":"https://github.com/qwopqwop200/GPTQ-for-LLaMa"},{"title":"phoebussi/alpaca-cot","url":"https://github.com/phoebussi/alpaca-cot"},{"title":"young-geng/easylm","url":"https://github.com/young-geng/easylm"},{"title":"xusenlinzy/api-for-open-llm","url":"https://github.com/xusenlinzy/api-for-open-llm"},{"title":"guinmoon/llmfarm","url":"https://github.com/guinmoon/llmfarm"},{"title":"aethercortex/llama-x","url":"https://github.com/aethercortex/llama-x"},{"title":"beomi/koalpaca","url":"https://github.com/beomi/koalpaca"},{"title":"freedomintelligence/huatuogpt","url":"https://github.com/freedomintelligence/huatuogpt"},{"title":"icalk-nlp/educhat","url":"https://github.com/icalk-nlp/educhat"},{"title":"ecnu-icalk/educhat","url":"https://github.com/ecnu-icalk/educhat"},{"title":"ganjinzero/rrhf","url":"https://github.com/ganjinzero/rrhf"},{"title":"squeezeailab/squeezellm","url":"https://github.com/squeezeailab/squeezellm"},{"title":"chaoyi-wu/pmc-llama","url":"https://github.com/chaoyi-wu/pmc-llama"},{"title":"kbressem/medalpaca","url":"https://github.com/kbressem/medalpaca"},{"title":"chaoyi-wu/finetune_llama","url":"https://github.com/chaoyi-wu/finetune_llama"},{"title":"ofa-sys/expertllama","url":"https://github.com/ofa-sys/expertllama"},{"title":"xiaoman-zhang/PMC-VQA","url":"https://github.com/xiaoman-zhang/PMC-VQA"},{"title":"fsoft-ai4code/codecapybara","url":"https://github.com/fsoft-ai4code/codecapybara"},{"title":"kayvr/token-hawk","url":"https://github.com/kayvr/token-hawk"},{"title":"ntunlplab/traditional-chinese-alpaca","url":"https://github.com/ntunlplab/traditional-chinese-alpaca"},{"title":"teelinsan/camoscio","url":"https://github.com/teelinsan/camoscio"},{"title":"replicate/cog_stanford_alpaca","url":"https://github.com/replicate/cog_stanford_alpaca"},{"title":"greenbitai/low_bit_llama","url":"https://github.com/greenbitai/low_bit_llama"},{"title":"krafton-ai/korani","url":"https://github.com/krafton-ai/korani"},{"title":"yuanmu97/secure-transformer-inference","url":"https://github.com/yuanmu97/secure-transformer-inference"},{"title":"xzhang97666/alpacare","url":"https://github.com/xzhang97666/alpacare"},{"title":"hamishivi/easylm","url":"https://github.com/hamishivi/easylm"},{"title":"xvyaward/owq","url":"https://github.com/xvyaward/owq"},{"title":"vcskaushik/LLMzip","url":"https://github.com/vcskaushik/LLMzip"},{"title":"batsresearch/alfred","url":"https://github.com/batsresearch/alfred"},{"title":"grantslatton/llama.cpp","url":"https://github.com/grantslatton/llama.cpp"},{"title":"zihanzhaosjtu/librisqa","url":"https://github.com/zihanzhaosjtu/librisqa"},{"title":"fajri91/indommlu","url":"https://github.com/fajri91/indommlu"},{"title":"akanyaani/miniLLAMA","url":"https://github.com/akanyaani/miniLLAMA"},{"title":"stanfordbdhg/llama.cpp","url":"https://github.com/stanfordbdhg/llama.cpp"},{"title":"facebookresearch/chai","url":"https://github.com/facebookresearch/chai"},{"title":"aozhongzhang/magr","url":"https://github.com/aozhongzhang/magr"},{"title":"abhaskumarsinha/Corpus2GPT","url":"https://github.com/abhaskumarsinha/Corpus2GPT"},{"title":"ohadrubin/rpt","url":"https://github.com/ohadrubin/rpt"},{"title":"ecolab-postech/owq","url":"https://github.com/ecolab-postech/owq"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama2"},{"title":"Mind23-2/MindCode-140","url":"https://github.com/Mind23-2/MindCode-140"},{"title":"longhao-chen/aicas2024","url":"https://github.com/longhao-chen/aicas2024"},{"title":"MindSpore-scientific-2/code-14","url":"https://github.com/MindSpore-scientific-2/code-14/tree/main/llama"},{"title":"2023-MindSpore-4/Code12","url":"https://github.com/2023-MindSpore-4/Code12/tree/main/MindFormers/llama"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127608,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"GPT-2-Medium 355M + question-solution classifier (BS=1)","metrics":{"Accuracy":"16.8","Parameters (Billion)":"0.355"},"paper_url":"https://arxiv.org/abs/2210.11522v1","paper_title":"Composing Ensembles of Pre-trained Models via Iterative Consensus","paper_date":"2022-10-20","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127609,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Minerva 8B (8-shot)","metrics":{"Accuracy":"16.2","Parameters (Billion)":"8"},"paper_url":"https://arxiv.org/abs/2206.14858v2","paper_title":"Solving Quantitative Reasoning Problems with Language Models","paper_date":"2022-06-29","code_links":[{"title":"gair-nlp/abel","url":"https://github.com/gair-nlp/abel"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127610,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"GPT-2-Medium 355M (BS=5)","metrics":{"Accuracy":"12.2","Parameters (Billion)":"0.355"},"paper_url":"https://arxiv.org/abs/2210.11522v1","paper_title":"Composing Ensembles of Pre-trained Models via Iterative Consensus","paper_date":"2022-10-20","code_links":[],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":590126,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Testing LLM Arithmetic Reasoning General","metrics":{"Accuracy":"12.16"},"paper_url":"https://paperswithcode.com/paper/testing-llm-arithmetic-reasoning-generalization-with-automatic-numeric-remapping-attacks","paper_title":"Testing LLM Arithmetic Reasoning Generalization with Automatic Numeric-Remapping Attacks","paper_date":"2026-06-02","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":127611,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"LLaMA 7B","metrics":{"Accuracy":"11.0","Parameters (Billion)":"7"},"paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","paper_date":"2023-02-27","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"ggml-org/llama.cpp","url":"https://github.com/ggml-org/llama.cpp"},{"title":"ggerganov/llama.cpp","url":"https://github.com/ggerganov/llama.cpp"},{"title":"meta-llama/llama","url":"https://github.com/meta-llama/llama"},{"title":"facebookresearch/llama","url":"https://github.com/facebookresearch/llama"},{"title":"tatsu-lab/stanford_alpaca","url":"https://github.com/tatsu-lab/stanford_alpaca"},{"title":"llamafamily/llama-chinese","url":"https://github.com/llamafamily/llama-chinese"},{"title":"flagalpha/llama2-chinese","url":"https://github.com/flagalpha/llama2-chinese"},{"title":"nebuly-ai/nebullvm","url":"https://github.com/nebuly-ai/nebullvm/tree/main/apps/accelerate/chatllama"},{"title":"Lightning-AI/lit-llama","url":"https://github.com/Lightning-AI/lit-llama"},{"title":"facico/chinese-vicuna","url":"https://github.com/facico/chinese-vicuna"},{"title":"qwopqwop200/GPTQ-for-LLaMa","url":"https://github.com/qwopqwop200/GPTQ-for-LLaMa"},{"title":"phoebussi/alpaca-cot","url":"https://github.com/phoebussi/alpaca-cot"},{"title":"young-geng/easylm","url":"https://github.com/young-geng/easylm"},{"title":"xusenlinzy/api-for-open-llm","url":"https://github.com/xusenlinzy/api-for-open-llm"},{"title":"guinmoon/llmfarm","url":"https://github.com/guinmoon/llmfarm"},{"title":"aethercortex/llama-x","url":"https://github.com/aethercortex/llama-x"},{"title":"beomi/koalpaca","url":"https://github.com/beomi/koalpaca"},{"title":"freedomintelligence/huatuogpt","url":"https://github.com/freedomintelligence/huatuogpt"},{"title":"icalk-nlp/educhat","url":"https://github.com/icalk-nlp/educhat"},{"title":"ecnu-icalk/educhat","url":"https://github.com/ecnu-icalk/educhat"},{"title":"ganjinzero/rrhf","url":"https://github.com/ganjinzero/rrhf"},{"title":"squeezeailab/squeezellm","url":"https://github.com/squeezeailab/squeezellm"},{"title":"chaoyi-wu/pmc-llama","url":"https://github.com/chaoyi-wu/pmc-llama"},{"title":"kbressem/medalpaca","url":"https://github.com/kbressem/medalpaca"},{"title":"chaoyi-wu/finetune_llama","url":"https://github.com/chaoyi-wu/finetune_llama"},{"title":"ofa-sys/expertllama","url":"https://github.com/ofa-sys/expertllama"},{"title":"xiaoman-zhang/PMC-VQA","url":"https://github.com/xiaoman-zhang/PMC-VQA"},{"title":"fsoft-ai4code/codecapybara","url":"https://github.com/fsoft-ai4code/codecapybara"},{"title":"kayvr/token-hawk","url":"https://github.com/kayvr/token-hawk"},{"title":"ntunlplab/traditional-chinese-alpaca","url":"https://github.com/ntunlplab/traditional-chinese-alpaca"},{"title":"teelinsan/camoscio","url":"https://github.com/teelinsan/camoscio"},{"title":"replicate/cog_stanford_alpaca","url":"https://github.com/replicate/cog_stanford_alpaca"},{"title":"greenbitai/low_bit_llama","url":"https://github.com/greenbitai/low_bit_llama"},{"title":"krafton-ai/korani","url":"https://github.com/krafton-ai/korani"},{"title":"yuanmu97/secure-transformer-inference","url":"https://github.com/yuanmu97/secure-transformer-inference"},{"title":"xzhang97666/alpacare","url":"https://github.com/xzhang97666/alpacare"},{"title":"hamishivi/easylm","url":"https://github.com/hamishivi/easylm"},{"title":"xvyaward/owq","url":"https://github.com/xvyaward/owq"},{"title":"vcskaushik/LLMzip","url":"https://github.com/vcskaushik/LLMzip"},{"title":"batsresearch/alfred","url":"https://github.com/batsresearch/alfred"},{"title":"grantslatton/llama.cpp","url":"https://github.com/grantslatton/llama.cpp"},{"title":"zihanzhaosjtu/librisqa","url":"https://github.com/zihanzhaosjtu/librisqa"},{"title":"fajri91/indommlu","url":"https://github.com/fajri91/indommlu"},{"title":"akanyaani/miniLLAMA","url":"https://github.com/akanyaani/miniLLAMA"},{"title":"stanfordbdhg/llama.cpp","url":"https://github.com/stanfordbdhg/llama.cpp"},{"title":"facebookresearch/chai","url":"https://github.com/facebookresearch/chai"},{"title":"aozhongzhang/magr","url":"https://github.com/aozhongzhang/magr"},{"title":"abhaskumarsinha/Corpus2GPT","url":"https://github.com/abhaskumarsinha/Corpus2GPT"},{"title":"ohadrubin/rpt","url":"https://github.com/ohadrubin/rpt"},{"title":"ecolab-postech/owq","url":"https://github.com/ecolab-postech/owq"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama"},{"title":"MS-P3/code5","url":"https://github.com/MS-P3/code5/tree/main/llama2"},{"title":"Mind23-2/MindCode-140","url":"https://github.com/Mind23-2/MindCode-140"},{"title":"longhao-chen/aicas2024","url":"https://github.com/longhao-chen/aicas2024"},{"title":"MindSpore-scientific-2/code-14","url":"https://github.com/MindSpore-scientific-2/code-14/tree/main/llama"},{"title":"2023-MindSpore-4/Code12","url":"https://github.com/2023-MindSpore-4/Code12/tree/main/MindFormers/llama"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127612,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"Text-davinci-002-175B (0-shot)","metrics":{"Accuracy":"10.4","Parameters (Billion)":"175"},"paper_url":"https://arxiv.org/abs/2205.11916v4","paper_title":"Large Language Models are Zero-Shot Reasoners","paper_date":"2022-05-24","code_links":[{"title":"kojima-takeshi188/zero_shot_cot","url":"https://github.com/kojima-takeshi188/zero_shot_cot"},{"title":"skytliang/multi-agents-debate","url":"https://github.com/skytliang/multi-agents-debate"},{"title":"zongqianwu/st-cot","url":"https://github.com/zongqianwu/st-cot"},{"title":"nicolay-r/reasoning-for-sentiment-analysis-framework","url":"https://github.com/nicolay-r/reasoning-for-sentiment-analysis-framework"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127613,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"GPT-Neo 125M + Self-Sampling","metrics":{"Accuracy":"7.5","Parameters (Billion)":"0.125"},"paper_url":"https://arxiv.org/abs/2205.14318v2","paper_title":"Learning Math Reasoning from Self-Sampled Correct and Partially-Correct Solutions","paper_date":"2022-05-28","code_links":[{"title":"microsoft/tracecodegen","url":"https://github.com/microsoft/tracecodegen"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127614,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"UL2 20B (chain-of-thought)","metrics":{"Accuracy":"4.4","Parameters (Billion)":"20"},"paper_url":"https://arxiv.org/abs/2205.05131v3","paper_title":"UL2: Unifying Language Learning Paradigms","paper_date":"2022-05-10","code_links":[{"title":"google-research/google-research","url":"https://github.com/google-research/google-research"},{"title":"opennlg/openba-v2","url":"https://github.com/opennlg/openba-v2"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":127615,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"PaLM 8B (8-shot)","metrics":{"Accuracy":"4.1","Parameters (Billion)":"8"},"paper_url":"https://arxiv.org/abs/2206.14858v2","paper_title":"Solving Quantitative Reasoning Problems with Language Models","paper_date":"2022-06-29","code_links":[{"title":"gair-nlp/abel","url":"https://github.com/gair-nlp/abel"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":1,"source":"archive","tags":[]},{"id":127616,"task":"Arithmetic Reasoning","parent_task":null,"dataset":"GSM8K","model_name":"UL2 20B (0-shot)","metrics":{"Accuracy":"4.1","Parameters (Billion)":"20"},"paper_url":"https://arxiv.org/abs/2205.05131v3","paper_title":"UL2: Unifying Language Learning Paradigms","paper_date":"2022-05-10","code_links":[{"title":"google-research/google-research","url":"https://github.com/google-research/google-research"},{"title":"opennlg/openba-v2","url":"https://github.com/opennlg/openba-v2"}],"metrics_order":"[\"Accuracy\", \"Parameters (Billion)\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]}]}