{"task":"Code Generation","dataset":"LiveCodeBench","metric_names":["Pass@1"],"rows":[{"id":591619,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 3 Pro Preview (high) (Google)","metrics":{"Pass@1":"91.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":591792,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 3 Flash Preview (Reasoning) (Google)","metrics":{"Pass@1":"90.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-17","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593291,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek V3.2 Speciale (DeepSeek)","metrics":{"Pass@1":"89.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-01","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":591739,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5.2 (medium) (OpenAI)","metrics":{"Pass@1":"89.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592290,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GLM-4.7 (Reasoning) (Z AI)","metrics":{"Pass@1":"89.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":591464,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5.2 (xhigh) (OpenAI)","metrics":{"Pass@1":"88.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593772,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"gpt-oss-120b (high) (OpenAI)","metrics":{"Pass@1":"87.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":591543,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude Opus 4.5 (Reasoning) (Anthropic)","metrics":{"Pass@1":"87.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-24","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":591960,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5.1 (high) (OpenAI)","metrics":{"Pass@1":"86.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-13","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592453,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"MiMo-V2-Flash (Reasoning) (Xiaomi)","metrics":{"Pass@1":"86.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-16","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592368,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek V3.2 (Reasoning) (DeepSeek)","metrics":{"Pass@1":"86.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-01","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592954,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"o4-mini (high) (OpenAI)","metrics":{"Pass@1":"85.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-16","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592258,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 3 Pro Preview (low) (Google)","metrics":{"Pass@1":"85.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592305,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Kimi K2 Thinking (Kimi)","metrics":{"Pass@1":"85.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-06","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592038,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5.1 Codex (high) (OpenAI)","metrics":{"Pass@1":"84.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-13","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592131,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5 (high) (OpenAI)","metrics":{"Pass@1":"84.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":591907,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5 Codex (high) (OpenAI)","metrics":{"Pass@1":"84"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-23","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592830,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5 mini (high) (OpenAI)","metrics":{"Pass@1":"83.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592519,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5.1 Codex mini (high) (OpenAI)","metrics":{"Pass@1":"83.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-13","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592767,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Grok 4 Fast (Reasoning) (SpaceXAI)","metrics":{"Pass@1":"83.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-19","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592702,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"MiniMax-M2 (MiniMax)","metrics":{"Pass@1":"82.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-26","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592531,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Grok 4.1 Fast (Reasoning) (SpaceXAI)","metrics":{"Pass@1":"82.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-19","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592221,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Grok 4 (SpaceXAI)","metrics":{"Pass@1":"81.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-10","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593315,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"ERNIE 5.0 Thinking Preview (Baidu)","metrics":{"Pass@1":"81.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-13","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592433,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"MiniMax-M2.1 (MiniMax)","metrics":{"Pass@1":"81"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-23","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":590425,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DreamPRM-Code","metrics":{"Pass@1":"80.9"},"paper_url":"https://paperswithcode.com/paper/dreamprm-code-function-as-step-process-reward-model-with-label-correction-for-llm-coding","paper_title":"DreamPRM-Code: Function-as-Step Process Reward Model with Label Correction for LLM Coding","paper_date":"2025-12-17","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":592542,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"o3 (OpenAI)","metrics":{"Pass@1":"80.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-16","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593505,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Apriel-v1.6-15B-Thinker (ServiceNow)","metrics":{"Pass@1":"80.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-25","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592937,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.5 Pro (Google)","metrics":{"Pass@1":"80.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-06-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593125,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek V3.1 Terminus (Reasoning) (DeepSeek)","metrics":{"Pass@1":"79.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592779,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 3 Flash Preview (Non-reasoning) (Google)","metrics":{"Pass@1":"79.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-17","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592998,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek V3.2 Exp (Reasoning) (DeepSeek)","metrics":{"Pass@1":"78.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-29","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593613,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5 nano (high) (OpenAI)","metrics":{"Pass@1":"78.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593675,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 235B A22B 2507 (Reasoning) (Alibaba)","metrics":{"Pass@1":"78.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-25","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593481,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek V3.1 (Reasoning) (DeepSeek)","metrics":{"Pass@1":"78.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-21","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594073,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 Next 80B A3B (Reasoning) (Alibaba)","metrics":{"Pass@1":"78.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593201,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.5 Pro Preview (Mar' 25) (Google)","metrics":{"Pass@1":"77.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-25","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594199,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"INTELLECT-3 (Prime Intellect)","metrics":{"Pass@1":"77.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-27","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594680,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"gpt-oss-20b (high) (OpenAI)","metrics":{"Pass@1":"77.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593283,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.5 Pro Preview (May' 25) (Google)","metrics":{"Pass@1":"77"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-06","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593587,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek R1 0528 (May '25) (DeepSeek)","metrics":{"Pass@1":"77"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593302,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"K-EXAONE (Reasoning) (LG AI Research)","metrics":{"Pass@1":"76.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-31","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593079,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 Max (Alibaba)","metrics":{"Pass@1":"76.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-23","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592907,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Doubao Seed Code (ByteDance Seed)","metrics":{"Pass@1":"76.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593808,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Seed-OSS-36B-Instruct (ByteDance Seed)","metrics":{"Pass@1":"76.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592465,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5 (low) (OpenAI)","metrics":{"Pass@1":"76.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593729,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5 nano (medium) (OpenAI)","metrics":{"Pass@1":"76.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593866,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Magistral Medium 1.2 (Mistral)","metrics":{"Pass@1":"75"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592714,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"KAT-Coder-Pro V1 (KwaiKAT)","metrics":{"Pass@1":"74.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595056,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"EXAONE 4.0 32B (Reasoning) (LG AI Research)","metrics":{"Pass@1":"74.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-15","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594801,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) (NVIDIA)","metrics":{"Pass@1":"74.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-15","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592050,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude Opus 4.5 (Non-reasoning) (Anthropic)","metrics":{"Pass@1":"73.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-24","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593650,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GLM-4.5 (Reasoning) (Z AI)","metrics":{"Pass@1":"73.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593846,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 VL 32B (Reasoning) (Alibaba)","metrics":{"Pass@1":"73.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-21","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594707,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama Nemotron Super 49B v1.5 (Reasoning) (NVIDIA)","metrics":{"Pass@1":"73.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-25","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594143,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"o3-mini (high) (OpenAI)","metrics":{"Pass@1":"73.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-01-31","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593343,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Nova 2.0 Pro Preview (medium) (Amazon)","metrics":{"Pass@1":"73"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-27","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593414,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Apriel-v1.5-15B-Thinker (ServiceNow)","metrics":{"Pass@1":"72.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-30","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595179,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Falcon-H1R-7B (TII UAE)","metrics":{"Pass@1":"72.4"},"paper_url":null,"paper_title":null,"paper_date":"2026-01-04","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595454,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"NVIDIA Nemotron Nano 9B V2 (Reasoning) (NVIDIA)","metrics":{"Pass@1":"72.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594901,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Magistral Small 1.2 (Mistral)","metrics":{"Pass@1":"72.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-17","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593749,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"o3-mini (OpenAI)","metrics":{"Pass@1":"71.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-01-31","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592409,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 4.5 Sonnet (Reasoning) (Anthropic)","metrics":{"Pass@1":"71.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-29","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593091,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.5 Flash Preview (Sep '25) (Reasoning) (Google)","metrics":{"Pass@1":"71.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-25","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593515,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Nova 2.0 Lite (high) (Amazon)","metrics":{"Pass@1":"71.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-29","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593915,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"MiniMax M1 80k (MiniMax)","metrics":{"Pass@1":"71.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-06-17","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594259,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"gpt-oss-120b (low) (OpenAI)","metrics":{"Pass@1":"70.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594402,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 30B A3B 2507 (Reasoning) (Alibaba)","metrics":{"Pass@1":"70.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-30","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592155,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5 (medium) (OpenAI)","metrics":{"Pass@1":"70.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595871,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"NVIDIA Nemotron Nano 9B V2 (Non-reasoning) (NVIDIA)","metrics":{"Pass@1":"70.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594533,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 VL 30B A3B (Reasoning) (Alibaba)","metrics":{"Pass@1":"69.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-03","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593250,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Grok 3 mini Reasoning (high) (SpaceXAI)","metrics":{"Pass@1":"69.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-02-19","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592727,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GLM-4.6 (Reasoning) (Z AI)","metrics":{"Pass@1":"69.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-30","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593600,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.5 Flash (Reasoning) (Google)","metrics":{"Pass@1":"69.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595697,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Olmo 3.1 32B Think (Allen Institute for AI)","metrics":{"Pass@1":"69.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-12","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594378,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"K2-V2 (high) (MBZUAI Institute of Foundation Models)","metrics":{"Pass@1":"69.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595425,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"NVIDIA Nemotron Nano 12B v2 VL (Reasoning) (NVIDIA)","metrics":{"Pass@1":"69.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592499,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5 mini (medium) (OpenAI)","metrics":{"Pass@1":"69.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594237,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning) (Google)","metrics":{"Pass@1":"68.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-08","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597216,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Cogito v2.1 (Reasoning) (Deep Cogito)","metrics":{"Pass@1":"68.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":590572,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"CWM","metrics":{"Pass@1":"68.6"},"paper_url":"https://paperswithcode.com/paper/cwm-an-open-weights-llm-for-research-on-code-generation-with-world-models","paper_title":"CWM: An Open-Weights LLM for Research on Code Generation with World Models","paper_date":"2025-09-30","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":595401,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Hermes 4 - Llama-3.1 405B (Reasoning) (Nous Research)","metrics":{"Pass@1":"68.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-27","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594107,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GLM-4.5-Air (Z AI)","metrics":{"Pass@1":"68.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594469,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 Next 80B A3B Instruct (Alibaba)","metrics":{"Pass@1":"68.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593177,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"o1 (OpenAI)","metrics":{"Pass@1":"67.9"},"paper_url":null,"paper_title":null,"paper_date":"2024-12-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595239,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 Omni 30B A3B (Reasoning) (Alibaba)","metrics":{"Pass@1":"67.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594615,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Ling-1T (InclusionAI)","metrics":{"Pass@1":"67.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-08","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596092,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Olmo 3 32B Think (Allen Institute for AI)","metrics":{"Pass@1":"67.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592886,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5.2 (Non-reasoning) (OpenAI)","metrics":{"Pass@1":"66.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593717,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Nova 2.0 Lite (medium) (Amazon)","metrics":{"Pass@1":"66.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-29","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593448,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Nova 2.0 Omni (medium) (Amazon)","metrics":{"Pass@1":"66"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-26","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593357,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Grok Code Fast 1 (SpaceXAI)","metrics":{"Pass@1":"65.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594302,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"MiniMax M1 40k (MiniMax)","metrics":{"Pass@1":"65.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-06-17","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594132,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mi:dm K 2.5 Pro (Korea Telecom)","metrics":{"Pass@1":"65.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592659,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 4 Sonnet (Reasoning) (Anthropic)","metrics":{"Pass@1":"65.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592168,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 4.1 Opus (Reasoning) (Anthropic)","metrics":{"Pass@1":"65.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595121,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Hermes 4 - Llama-3.1 70B (Reasoning) (Nous Research)","metrics":{"Pass@1":"65.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-27","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594327,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"gpt-oss-20b (low) (OpenAI)","metrics":{"Pass@1":"65.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593705,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 Max (Preview) (Alibaba)","metrics":{"Pass@1":"65.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594604,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Motif-2-12.7B-Reasoning (Motif Technologies)","metrics":{"Pass@1":"65.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-04","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593493,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 VL 235B A22B (Reasoning) (Alibaba)","metrics":{"Pass@1":"64.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-23","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594159,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Ring-1T (InclusionAI)","metrics":{"Pass@1":"64.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-13","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594575,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning) (Google)","metrics":{"Pass@1":"64.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-25","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594817,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 4B 2507 (Reasoning) (Alibaba)","metrics":{"Pass@1":"64.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-06","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595365,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3.1 Nemotron Ultra 253B v1 (Reasoning) (NVIDIA)","metrics":{"Pass@1":"64.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593636,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Nova 2.0 Pro Preview (low) (Amazon)","metrics":{"Pass@1":"63.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-27","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592477,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 4 Opus (Reasoning) (Anthropic)","metrics":{"Pass@1":"63.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594522,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"QwQ 32B (Alibaba)","metrics":{"Pass@1":"63.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594029,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"HyperCLOVA X SEED Think (32B) (Naver)","metrics":{"Pass@1":"62.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-26","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595675,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Ring-flash-2.0 (InclusionAI)","metrics":{"Pass@1":"62.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-19","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593761,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning) (Google)","metrics":{"Pass@1":"62.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-25","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594509,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 235B A22B (Reasoning) (Alibaba)","metrics":{"Pass@1":"62.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594004,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek R1 (Jan '25) (DeepSeek)","metrics":{"Pass@1":"61.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-01-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596534,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Olmo 3 7B Think (Allen Institute for AI)","metrics":{"Pass@1":"61.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595413,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Solar Pro 2 (Reasoning) (Upstage)","metrics":{"Pass@1":"61.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-09","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592814,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 4.5 Haiku (Reasoning) (Anthropic)","metrics":{"Pass@1":"61.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-15","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593141,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Kimi K2 0905 (Kimi)","metrics":{"Pass@1":"61"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595342,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GLM-4.5V (Reasoning) (Z AI)","metrics":{"Pass@1":"60.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594339,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 VL 235B A22B Instruct (Alibaba)","metrics":{"Pass@1":"59.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-23","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593055,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek V3.2 (Non-reasoning) (DeepSeek)","metrics":{"Pass@1":"59.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-01","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594916,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.5 Flash-Lite (Reasoning) (Google)","metrics":{"Pass@1":"59.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-06-17","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594095,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Nova 2.0 Omni (low) (Amazon)","metrics":{"Pass@1":"59.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-26","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592627,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 4.5 Sonnet (Non-reasoning) (Anthropic)","metrics":{"Pass@1":"59"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-29","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595218,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Ling-flash-2.0 (InclusionAI)","metrics":{"Pass@1":"58.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-17","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593833,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 Coder 480B A35B Instruct (Alibaba)","metrics":{"Pass@1":"58.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593425,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek V3.1 (Non-reasoning) (DeepSeek)","metrics":{"Pass@1":"57.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-21","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594419,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"o1-mini (OpenAI)","metrics":{"Pass@1":"57.6"},"paper_url":null,"paper_title":null,"paper_date":"2024-09-12","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597227,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mi:dm K 2.5 Pro Preview (Korea Telecom)","metrics":{"Pass@1":"57.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592846,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GLM-4.7 (Non-reasoning) (Z AI)","metrics":{"Pass@1":"56.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593209,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GLM-4.6 (Non-reasoning) (Z AI)","metrics":{"Pass@1":"56.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-30","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593992,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5 (minimal) (OpenAI)","metrics":{"Pass@1":"55.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593662,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Kimi K2 (Kimi)","metrics":{"Pass@1":"55.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593402,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek V3.2 Exp (Non-reasoning) (DeepSeek)","metrics":{"Pass@1":"55.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-29","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":590251,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Embarrassingly Simple Self-Distillation ","metrics":{"Pass@1":"55.3"},"paper_url":"https://paperswithcode.com/paper/embarrassingly-simple-self-distillation-improves-code-generation","paper_title":"Embarrassingly Simple Self-Distillation Improves Code Generation","paper_date":"2026-04-01","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":595466,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Hermes 4 - Llama-3.1 405B (Non-reasoning) (Nous Research)","metrics":{"Pass@1":"54.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-27","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595636,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 32B (Reasoning) (Alibaba)","metrics":{"Pass@1":"54.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594351,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5 mini (minimal) (OpenAI)","metrics":{"Pass@1":"54.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594218,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5 (ChatGPT) (OpenAI)","metrics":{"Pass@1":"54.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592975,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 4 Opus (Non-reasoning) (Anthropic)","metrics":{"Pass@1":"54.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594696,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"K2-V2 (medium) (MBZUAI Institute of Foundation Models)","metrics":{"Pass@1":"54.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593010,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 Max Thinking (Preview) (Alibaba)","metrics":{"Pass@1":"53.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-03","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593368,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek V3.1 Terminus (Non-reasoning) (DeepSeek)","metrics":{"Pass@1":"52.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594655,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Magistral Medium 1 (Mistral)","metrics":{"Pass@1":"52.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-06-10","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593820,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 235B A22B 2507 Instruct (Alibaba)","metrics":{"Pass@1":"52.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-21","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596152,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 14B (Reasoning) (Alibaba)","metrics":{"Pass@1":"52.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596754,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Exaone 4.0 1.2B (Reasoning) (LG AI Research)","metrics":{"Pass@1":"51.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-15","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595376,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 30B A3B 2507 Instruct (Alibaba)","metrics":{"Pass@1":"51.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-29","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594976,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 VL 32B Instruct (Alibaba)","metrics":{"Pass@1":"51.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-21","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595037,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Magistral Small 1 (Mistral)","metrics":{"Pass@1":"51.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-06-10","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595091,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek R1 0528 Qwen3 8B (DeepSeek)","metrics":{"Pass@1":"51.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-29","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593113,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 4.5 Haiku (Non-reasoning) (Anthropic)","metrics":{"Pass@1":"51.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-15","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595303,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 30B A3B (Reasoning) (Alibaba)","metrics":{"Pass@1":"50.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593945,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.5 Flash Preview (Reasoning) (Google)","metrics":{"Pass@1":"50.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-17","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594389,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.5 Flash (Non-reasoning) (Google)","metrics":{"Pass@1":"49.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593529,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5.1 (Non-reasoning) (OpenAI)","metrics":{"Pass@1":"49.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-13","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595561,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3.1 Nemotron Nano 4B v1.1 (Reasoning) (NVIDIA)","metrics":{"Pass@1":"49.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594274,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-4.1 mini (OpenAI)","metrics":{"Pass@1":"48.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-14","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595110,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 VL 30B A3B Instruct (Alibaba)","metrics":{"Pass@1":"47.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-03","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592802,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 3.7 Sonnet (Reasoning) (Anthropic)","metrics":{"Pass@1":"47.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-02-24","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594313,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Nova 2.0 Pro Preview (Non-reasoning) (Amazon)","metrics":{"Pass@1":"47.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-27","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596201,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"EXAONE 4.0 32B (Non-reasoning) (LG AI Research)","metrics":{"Pass@1":"47.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-15","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595715,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-5 nano (minimal) (OpenAI)","metrics":{"Pass@1":"47"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593892,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Nova 2.0 Lite (low) (Amazon)","metrics":{"Pass@1":"46.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-29","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595389,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"ERNIE 4.5 300B A47B (Baidu)","metrics":{"Pass@1":"46.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-06-30","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594443,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mistral Large 3 (Mistral)","metrics":{"Pass@1":"46.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-02","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595618,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 4B (Reasoning) (Alibaba)","metrics":{"Pass@1":"46.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594639,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Solar Pro 2 (Preview) (Reasoning) (Upstage)","metrics":{"Pass@1":"46.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593692,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-4.1 (OpenAI)","metrics":{"Pass@1":"45.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-14","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":592985,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 4 Sonnet (Non-reasoning) (Anthropic)","metrics":{"Pass@1":"44.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594552,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Devstral 2 (Mistral)","metrics":{"Pass@1":"44.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-09","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596521,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Reka Flash 3 (Reka AI)","metrics":{"Pass@1":"43.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-10","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596585,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Ling-mini-2.0 (InclusionAI)","metrics":{"Pass@1":"42.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-09","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593795,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Grok 3 (SpaceXAI)","metrics":{"Pass@1":"42.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-02-19","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594746,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-4o (March 2025, chatgpt-4o-latest) (OpenAI)","metrics":{"Pass@1":"42.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-27","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595753,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Solar Pro 2 (Non-reasoning) (Upstage)","metrics":{"Pass@1":"42.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-09","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596291,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 Omni 30B A3B Instruct (Alibaba)","metrics":{"Pass@1":"42.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595012,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GLM-4.6V (Non-reasoning) (Z AI)","metrics":{"Pass@1":"41.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-08","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594363,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mistral Medium 3.1 (Mistral)","metrics":{"Pass@1":"40.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-12","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594894,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.5 Flash Preview (Non-reasoning) (Google)","metrics":{"Pass@1":"40.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-17","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596863,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 8B (Reasoning) (Alibaba)","metrics":{"Pass@1":"40.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594426,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek V3 0324 (DeepSeek)","metrics":{"Pass@1":"40.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-25","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594488,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 Coder 30B A3B Instruct (Alibaba)","metrics":{"Pass@1":"40.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-31","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593042,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"MiMo-V2-Flash (Non-reasoning) (Xiaomi)","metrics":{"Pass@1":"40.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-16","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594120,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Grok 4 Fast (Non-reasoning) (SpaceXAI)","metrics":{"Pass@1":"40.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-19","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594667,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mistral Medium 3 (Mistral)","metrics":{"Pass@1":"40"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595956,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.5 Flash-Lite (Non-reasoning) (Google)","metrics":{"Pass@1":"40"},"paper_url":null,"paper_title":null,"paper_date":"2025-06-17","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594040,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Grok 4.1 Fast (Non-reasoning) (SpaceXAI)","metrics":{"Pass@1":"39.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-19","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594587,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 4 Maverick (Meta)","metrics":{"Pass@1":"39.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":593153,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 3.7 Sonnet (Non-reasoning) (Anthropic)","metrics":{"Pass@1":"39.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-02-24","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595550,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"K2-V2 (low) (MBZUAI Institute of Foundation Models)","metrics":{"Pass@1":"39.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595140,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Solar Pro 2 (Preview) (Non-reasoning) (Upstage)","metrics":{"Pass@1":"38.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595160,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 3.5 Sonnet (Oct '24) (Anthropic)","metrics":{"Pass@1":"38.1"},"paper_url":null,"paper_title":null,"paper_date":"2024-10-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595572,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Kimi Linear 48B A3B Instruct (Kimi)","metrics":{"Pass@1":"37.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-30","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595894,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 4B 2507 Instruct (Alibaba)","metrics":{"Pass@1":"37.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-06","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595169,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek R1 Distill Qwen 14B (DeepSeek)","metrics":{"Pass@1":"37.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-01-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595859,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) (NVIDIA)","metrics":{"Pass@1":"36"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-15","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594929,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek V3 (Dec '24) (DeepSeek)","metrics":{"Pass@1":"35.9"},"paper_url":null,"paper_title":null,"paper_date":"2024-12-26","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595103,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen2.5 Max (Alibaba)","metrics":{"Pass@1":"35.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-01-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595067,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 VL 8B (Reasoning) (Alibaba)","metrics":{"Pass@1":"35.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-14","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595932,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GLM-4.5V (Non-reasoning) (Z AI)","metrics":{"Pass@1":"35.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596267,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Ministral 3 14B (Mistral)","metrics":{"Pass@1":"35.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-02","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594997,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Devstral Small 2 (Mistral)","metrics":{"Pass@1":"34.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-09","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594843,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.0 Pro Experimental (Feb '25) (Google)","metrics":{"Pass@1":"34.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-02-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594851,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Nova 2.0 Lite (Non-reasoning) (Amazon)","metrics":{"Pass@1":"34.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-29","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596421,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) (NVIDIA)","metrics":{"Pass@1":"34.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595024,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 235B A22B (Non-reasoning) (Alibaba)","metrics":{"Pass@1":"34.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594719,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Devstral Medium (Mistral)","metrics":{"Pass@1":"33.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-10","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595335,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"QwQ 32B-Preview (Alibaba)","metrics":{"Pass@1":"33.7"},"paper_url":null,"paper_title":null,"paper_date":"2024-11-27","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594754,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.0 Flash (Feb '25) (Google)","metrics":{"Pass@1":"33.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-02-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595535,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-4o (May '24) (OpenAI)","metrics":{"Pass@1":"33.4"},"paper_url":null,"paper_title":null,"paper_date":"2024-05-13","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595606,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 VL 8B Instruct (Alibaba)","metrics":{"Pass@1":"33.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-14","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595190,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-4.1 nano (OpenAI)","metrics":{"Pass@1":"32.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-14","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596006,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 30B A3B (Non-reasoning) (Alibaba)","metrics":{"Pass@1":"32.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594544,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.0 Flash Thinking Experimental (Jan '25) (Google)","metrics":{"Pass@1":"32.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-01-21","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595734,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 VL 4B (Reasoning) (Alibaba)","metrics":{"Pass@1":"32"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-14","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594626,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Nova Premier (Amazon)","metrics":{"Pass@1":"31.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-30","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595250,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-4o (Aug '24) (OpenAI)","metrics":{"Pass@1":"31.7"},"paper_url":null,"paper_title":null,"paper_date":"2024-08-06","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595132,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 1.5 Pro (Sep '24) (Google)","metrics":{"Pass@1":"31.6"},"paper_url":null,"paper_title":null,"paper_date":"2024-09-24","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594766,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 3.5 Haiku (Anthropic)","metrics":{"Pass@1":"31.4"},"paper_url":null,"paper_title":null,"paper_date":"2024-10-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594946,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-4o (Nov '24) (OpenAI)","metrics":{"Pass@1":"30.9"},"paper_url":null,"paper_title":null,"paper_date":"2024-11-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596844,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 1.7B (Reasoning) (Alibaba)","metrics":{"Pass@1":"30.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595079,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Nova 2.0 Omni (Non-reasoning) (Amazon)","metrics":{"Pass@1":"30.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-26","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595583,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3.1 Instruct 405B (Meta)","metrics":{"Pass@1":"30.5"},"paper_url":null,"paper_title":null,"paper_date":"2024-07-23","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596634,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Ministral 3 8B (Mistral)","metrics":{"Pass@1":"30.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-02","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596103,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 4 Scout (Meta)","metrics":{"Pass@1":"29.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595274,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Sonar (Perplexity)","metrics":{"Pass@1":"29.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-01-21","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595905,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen2.5 Coder Instruct 32B (Alibaba)","metrics":{"Pass@1":"29.5"},"paper_url":null,"paper_title":null,"paper_date":"2024-11-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596707,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Sarvam M (Reasoning) (Sarvam)","metrics":{"Pass@1":"29.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-23","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595354,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mistral Large 2 (Nov '24) (Mistral)","metrics":{"Pass@1":"29.3"},"paper_url":null,"paper_title":null,"paper_date":"2024-11-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596777,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Exaone 4.0 1.2B (Non-reasoning) (LG AI Research)","metrics":{"Pass@1":"29.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-15","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595661,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3.1 Tulu3 405B (Allen Institute for AI)","metrics":{"Pass@1":"29.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-01-30","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595744,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-4 Turbo (OpenAI)","metrics":{"Pass@1":"29.1"},"paper_url":null,"paper_title":null,"paper_date":"2023-11-06","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595511,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama Nemotron Super 49B v1.5 (Non-reasoning) (NVIDIA)","metrics":{"Pass@1":"29"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-25","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596508,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 VL 4B Instruct (Alibaba)","metrics":{"Pass@1":"29"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-14","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595288,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3.3 Instruct 70B (Meta)","metrics":{"Pass@1":"28.8"},"paper_url":null,"paper_title":null,"paper_date":"2024-12-06","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595524,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 32B (Non-reasoning) (Alibaba)","metrics":{"Pass@1":"28.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595795,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Command A (Cohere)","metrics":{"Pass@1":"28.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-13","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595595,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3.3 Nemotron Super 49B v1 (Non-reasoning) (NVIDIA)","metrics":{"Pass@1":"28"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595912,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 14B (Non-reasoning) (Alibaba)","metrics":{"Pass@1":"28"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594874,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 3 Opus (Anthropic)","metrics":{"Pass@1":"27.9"},"paper_url":null,"paper_title":null,"paper_date":"2024-03-04","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594779,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3.3 Nemotron Super 49B v1 (Reasoning) (NVIDIA)","metrics":{"Pass@1":"27.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595262,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen2.5 Instruct 72B (Alibaba)","metrics":{"Pass@1":"27.6"},"paper_url":null,"paper_title":null,"paper_date":"2024-09-19","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595316,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Sonar Pro (Perplexity)","metrics":{"Pass@1":"27.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-01-21","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595765,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mistral Small 3.2 (Mistral)","metrics":{"Pass@1":"27.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-06-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595727,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 1.5 Flash (Sep '24) (Google)","metrics":{"Pass@1":"27.3"},"paper_url":null,"paper_title":null,"paper_date":"2024-09-24","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594987,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek R1 Distill Qwen 32B (DeepSeek)","metrics":{"Pass@1":"27"},"paper_url":null,"paper_title":null,"paper_date":"2025-01-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595995,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Hermes 4 - Llama-3.1 70B (Non-reasoning) (Nous Research)","metrics":{"Pass@1":"26.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-27","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595708,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Grok 2 (Dec '24) (SpaceXAI)","metrics":{"Pass@1":"26.7"},"paper_url":null,"paper_title":null,"paper_date":"2024-12-12","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595883,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mistral Large 2 (Jul '24) (Mistral)","metrics":{"Pass@1":"26.7"},"paper_url":null,"paper_title":null,"paper_date":"2024-07-24","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595147,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek R1 Distill Llama 70B (DeepSeek)","metrics":{"Pass@1":"26.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-01-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596765,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Olmo 3 7B Instruct (Allen Institute for AI)","metrics":{"Pass@1":"26.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-11-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595687,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Pixtral Large (Mistral)","metrics":{"Pass@1":"26.1"},"paper_url":null,"paper_title":null,"paper_date":"2024-11-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594863,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Devstral Small (May '25) (Mistral)","metrics":{"Pass@1":"25.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-21","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595323,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Devstral Small (Jul '25) (Mistral)","metrics":{"Pass@1":"25.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-10","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595944,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mistral Small 3 (Mistral)","metrics":{"Pass@1":"25.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-01-30","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596255,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Granite 4.0 H Small (IBM)","metrics":{"Pass@1":"25.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595852,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen2.5 Instruct 32B (Alibaba)","metrics":{"Pass@1":"24.8"},"paper_url":null,"paper_title":null,"paper_date":"2024-09-19","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597021,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Ministral 3 3B (Mistral)","metrics":{"Pass@1":"24.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-02","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596120,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 1.5 Pro (May '24) (Google)","metrics":{"Pass@1":"24.4"},"paper_url":null,"paper_title":null,"paper_date":"2024-05-15","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595845,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Grok Beta (SpaceXAI)","metrics":{"Pass@1":"24.1"},"paper_url":null,"paper_title":null,"paper_date":"2024-08-13","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595982,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GPT-4o mini (OpenAI)","metrics":{"Pass@1":"23.4"},"paper_url":null,"paper_title":null,"paper_date":"2024-07-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595782,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Nova Pro (Amazon)","metrics":{"Pass@1":"23.3"},"paper_url":null,"paper_title":null,"paper_date":"2024-12-03","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596023,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 4B (Non-reasoning) (Alibaba)","metrics":{"Pass@1":"23.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596075,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek R1 Distill Llama 8B (DeepSeek)","metrics":{"Pass@1":"23.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-01-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596030,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3.1 Instruct 70B (Meta)","metrics":{"Pass@1":"23.2"},"paper_url":null,"paper_title":null,"paper_date":"2024-07-23","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596358,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Phi-4 (Microsoft)","metrics":{"Pass@1":"23.1"},"paper_url":null,"paper_title":null,"paper_date":"2024-12-12","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596221,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 1.5 Flash-8B (Google)","metrics":{"Pass@1":"21.7"},"paper_url":null,"paper_title":null,"paper_date":"2024-10-03","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":590618,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Dream-Coder","metrics":{"Pass@1":"21.4"},"paper_url":"https://paperswithcode.com/paper/dream-coder-7b-an-open-diffusion-language-model-for-code","paper_title":"Dream-Coder 7B: An Open Diffusion Language Model for Code","paper_date":"2025-09-01","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":596141,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3.2 Instruct 90B (Vision) (Meta)","metrics":{"Pass@1":"21.4"},"paper_url":null,"paper_title":null,"paper_date":"2024-09-25","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595494,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mistral Small 3.1 (Mistral)","metrics":{"Pass@1":"21.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-17","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595049,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.0 Flash (experimental) (Google)","metrics":{"Pass@1":"21"},"paper_url":null,"paper_title":null,"paper_date":"2024-12-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596497,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Jamba Reasoning 3B (AI21 Labs)","metrics":{"Pass@1":"21"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-08","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596311,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 8B (Non-reasoning) (Alibaba)","metrics":{"Pass@1":"20.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596650,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3 Instruct 70B (Meta)","metrics":{"Pass@1":"19.8"},"paper_url":null,"paper_title":null,"paper_date":"2024-04-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596351,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 1.5 Flash (May '24) (Google)","metrics":{"Pass@1":"19.6"},"paper_url":null,"paper_title":null,"paper_date":"2024-05-14","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596236,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepHermes 3 - Mistral 24B Preview (Non-reasoning) (Nous Research)","metrics":{"Pass@1":"19.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-13","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596545,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 2.1 (Anthropic)","metrics":{"Pass@1":"19.5"},"paper_url":null,"paper_title":null,"paper_date":"2023-11-21","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596303,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Hermes 3 - Llama-3.1 70B (Nous Research)","metrics":{"Pass@1":"18.8"},"paper_url":null,"paper_title":null,"paper_date":"2024-08-15","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595478,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.0 Flash-Lite (Feb '25) (Google)","metrics":{"Pass@1":"18.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-02-25","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596243,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Jamba 1.7 Large (AI21 Labs)","metrics":{"Pass@1":"18.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596907,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Granite 4.0 Micro (IBM)","metrics":{"Pass@1":"18"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595543,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 2.0 Flash-Lite (Preview) (Google)","metrics":{"Pass@1":"17.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-02-05","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596454,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mistral Large (Feb '24) (Mistral)","metrics":{"Pass@1":"17.8"},"paper_url":null,"paper_title":null,"paper_date":"2024-02-26","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596371,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 3 Sonnet (Anthropic)","metrics":{"Pass@1":"17.5"},"paper_url":null,"paper_title":null,"paper_date":"2024-03-04","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596337,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Jamba 1.6 Large (AI21 Labs)","metrics":{"Pass@1":"17.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-06","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596604,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 2.0 (Anthropic)","metrics":{"Pass@1":"17.1"},"paper_url":null,"paper_title":null,"paper_date":"2023-07-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595817,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3.1 Nemotron Instruct 70B (NVIDIA)","metrics":{"Pass@1":"16.9"},"paper_url":null,"paper_title":null,"paper_date":"2024-10-15","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595969,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Nova Lite (Amazon)","metrics":{"Pass@1":"16.7"},"paper_url":null,"paper_title":null,"paper_date":"2024-12-03","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596130,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen2.5 Turbo (Alibaba)","metrics":{"Pass@1":"16.3"},"paper_url":null,"paper_title":null,"paper_date":"2024-11-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":594051,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"GLM-4.6V (Reasoning) (Z AI)","metrics":{"Pass@1":"16"},"paper_url":null,"paper_title":null,"paper_date":"2025-12-08","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596180,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen2 Instruct 72B (Alibaba)","metrics":{"Pass@1":"15.9"},"paper_url":null,"paper_title":null,"paper_date":"2024-06-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596702,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek Coder V2 Lite Instruct (DeepSeek)","metrics":{"Pass@1":"15.8"},"paper_url":null,"paper_title":null,"paper_date":"2024-06-17","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596552,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude 3 Haiku (Anthropic)","metrics":{"Pass@1":"15.4"},"paper_url":null,"paper_title":null,"paper_date":"2024-03-04","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596971,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"LFM2 8B A1B (Liquid AI)","metrics":{"Pass@1":"15.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596462,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mixtral 8x22B Instruct (Mistral)","metrics":{"Pass@1":"14.8"},"paper_url":null,"paper_title":null,"paper_date":"2024-04-17","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597084,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemma 3n E4B Instruct (Google)","metrics":{"Pass@1":"14.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-06-26","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596283,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Jamba 1.5 Large (AI21 Labs)","metrics":{"Pass@1":"14.3"},"paper_url":null,"paper_title":null,"paper_date":"2024-08-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596400,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mistral Small (Sep '24) (Mistral)","metrics":{"Pass@1":"14.1"},"paper_url":null,"paper_title":null,"paper_date":"2024-09-17","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596378,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Nova Micro (Amazon)","metrics":{"Pass@1":"14"},"paper_url":null,"paper_title":null,"paper_date":"2024-12-03","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596433,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemma 3n E4B Instruct Preview (May '25) (Google)","metrics":{"Pass@1":"13.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-05-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597005,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemma 3 27B Instruct (Google)","metrics":{"Pass@1":"13.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-12","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597192,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemma 3 12B Instruct (Google)","metrics":{"Pass@1":"13.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-12","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596440,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Phi-4 Multimodal Instruct (Microsoft)","metrics":{"Pass@1":"13.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-02-26","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596981,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Granite 3.3 8B (Non-reasoning) (IBM)","metrics":{"Pass@1":"12.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-16","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596187,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Phi-4 Mini Instruct (Microsoft)","metrics":{"Pass@1":"12.6"},"paper_url":null,"paper_title":null,"paper_date":"2024-02-26","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596447,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen2.5 Coder Instruct 7B  (Alibaba)","metrics":{"Pass@1":"12.6"},"paper_url":null,"paper_title":null,"paper_date":"2024-09-19","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596993,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 1.7B (Non-reasoning) (Alibaba)","metrics":{"Pass@1":"12.6"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596733,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Command-R+ (Apr '24) (Cohere)","metrics":{"Pass@1":"12.2"},"paper_url":null,"paper_title":null,"paper_date":"2024-04-04","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597173,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 0.6B (Reasoning) (Alibaba)","metrics":{"Pass@1":"12.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":595830,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3.1 Instruct 8B (Meta)","metrics":{"Pass@1":"11.6"},"paper_url":null,"paper_title":null,"paper_date":"2024-07-23","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596410,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Phi-3 Mini Instruct 3.8B (Microsoft)","metrics":{"Pass@1":"11.6"},"paper_url":null,"paper_title":null,"paper_date":"2024-04-23","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596695,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemini 1.0 Pro (Google)","metrics":{"Pass@1":"11.6"},"paper_url":null,"paper_title":null,"paper_date":"2023-12-06","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596740,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"OpenChat 3.5 (1210) (OpenChat)","metrics":{"Pass@1":"11.5"},"paper_url":null,"paper_title":null,"paper_date":"2023-12-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596833,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Granite 4.0 H 1B (IBM)","metrics":{"Pass@1":"11.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597057,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemma 3 4B Instruct (Google)","metrics":{"Pass@1":"11.2"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-12","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596612,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mistral Small (Feb '24) (Mistral)","metrics":{"Pass@1":"11.1"},"paper_url":null,"paper_title":null,"paper_date":"2024-02-26","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596671,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3.2 Instruct 11B (Vision) (Meta)","metrics":{"Pass@1":"11"},"paper_url":null,"paper_title":null,"paper_date":"2024-09-25","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596925,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Claude Instant (Anthropic)","metrics":{"Pass@1":"10.9"},"paper_url":null,"paper_title":null,"paper_date":"2023-03-14","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596620,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mistral Medium (Mistral)","metrics":{"Pass@1":"9.9"},"paper_url":null,"paper_title":null,"paper_date":"2023-12-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596719,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 2 Chat 70B (Meta)","metrics":{"Pass@1":"9.8"},"paper_url":null,"paper_title":null,"paper_date":"2023-07-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596726,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 2 Chat 13B (Meta)","metrics":{"Pass@1":"9.8"},"paper_url":null,"paper_title":null,"paper_date":"2023-07-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596664,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"LFM 40B (Liquid AI)","metrics":{"Pass@1":"9.6"},"paper_url":null,"paper_title":null,"paper_date":"2024-09-30","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597138,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3 Instruct 8B (Meta)","metrics":{"Pass@1":"9.6"},"paper_url":null,"paper_title":null,"paper_date":"2024-04-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597072,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemma 3n E2B Instruct (Google)","metrics":{"Pass@1":"9.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-06-26","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596747,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DBRX Instruct (Databricks)","metrics":{"Pass@1":"9.3"},"paper_url":null,"paper_title":null,"paper_date":"2024-03-27","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596918,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepHermes 3 - Llama-3.1 8B Preview (Non-reasoning) (Nous Research)","metrics":{"Pass@1":"8.5"},"paper_url":null,"paper_title":null,"paper_date":"2025-02-13","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596477,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3.2 Instruct 3B (Meta)","metrics":{"Pass@1":"8.3"},"paper_url":null,"paper_title":null,"paper_date":"2024-09-25","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":590455,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"ThinkMerge","metrics":{"Pass@1":"8.28"},"paper_url":"https://paperswithcode.com/paper/think-in-parallel-answer-as-one-logit-averaging-for-open-ended-reasoning","paper_title":"Think in Parallel, Answer as One: Logit Averaging for Open-Ended Reasoning","paper_date":"2025-12-02","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":596807,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"LFM2 2.6B (Liquid AI)","metrics":{"Pass@1":"8.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-09-23","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597161,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Qwen3 0.6B (Non-reasoning) (Alibaba)","metrics":{"Pass@1":"7.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-04-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596856,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Jamba 1.6 Mini (AI21 Labs)","metrics":{"Pass@1":"7.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-06","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596595,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DeepSeek R1 Distill Qwen 1.5B (DeepSeek)","metrics":{"Pass@1":"7"},"paper_url":null,"paper_title":null,"paper_date":"2025-01-20","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596326,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"OLMo 2 32B (Allen Institute for AI)","metrics":{"Pass@1":"6.8"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-13","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596880,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mixtral 8x7B Instruct (Mistral)","metrics":{"Pass@1":"6.6"},"paper_url":null,"paper_title":null,"paper_date":"2023-12-11","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":590169,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"DuST","metrics":{"Pass@1":"6.2"},"paper_url":"https://paperswithcode.com/paper/primal-generation-dual-judgment-self-training-from-test-time-scaling","paper_title":"Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling","paper_date":"2026-05-11","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":590362,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Bridging Online and Offline RL: Contextu","metrics":{"Pass@1":"6.2"},"paper_url":"https://paperswithcode.com/paper/bridging-online-and-offline-rl-contextual-bandit-learning-for-multi-turn-code-generation","paper_title":"Bridging Online and Offline RL: Contextual Bandit Learning for Multi-Turn Code Generation","paper_date":"2026-02-03","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":596825,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Jamba 1.5 Mini (AI21 Labs)","metrics":{"Pass@1":"6.2"},"paper_url":null,"paper_title":null,"paper_date":"2024-08-22","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596795,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Jamba 1.7 Mini (AI21 Labs)","metrics":{"Pass@1":"6.1"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-07","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596933,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Command-R (Mar '24) (Cohere)","metrics":{"Pass@1":"4.8"},"paper_url":null,"paper_title":null,"paper_date":"2024-03-12","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596953,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Granite 4.0 1B (IBM)","metrics":{"Pass@1":"4.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596941,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Mistral 7B Instruct (Mistral)","metrics":{"Pass@1":"4.6"},"paper_url":null,"paper_title":null,"paper_date":"2023-09-27","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596564,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"OLMo 2 7B (Allen Institute for AI)","metrics":{"Pass@1":"4.1"},"paper_url":null,"paper_title":null,"paper_date":"2024-11-26","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596575,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Molmo 7B-D (Allen Institute for AI)","metrics":{"Pass@1":"3.9"},"paper_url":null,"paper_title":null,"paper_date":"2024-09-25","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597099,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Granite 4.0 350M (IBM)","metrics":{"Pass@1":"2.4"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597120,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"LFM2 1.2B (Liquid AI)","metrics":{"Pass@1":"2"},"paper_url":null,"paper_title":null,"paper_date":"2025-07-10","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597109,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Granite 4.0 H 350M (IBM)","metrics":{"Pass@1":"1.9"},"paper_url":null,"paper_title":null,"paper_date":"2025-10-28","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597150,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 3.2 Instruct 1B (Meta)","metrics":{"Pass@1":"1.9"},"paper_url":null,"paper_title":null,"paper_date":"2024-09-25","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":597045,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemma 3 1B Instruct (Google)","metrics":{"Pass@1":"1.7"},"paper_url":null,"paper_title":null,"paper_date":"2025-03-13","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596888,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Gemma 3 270M (Google)","metrics":{"Pass@1":"0.3"},"paper_url":null,"paper_title":null,"paper_date":"2025-08-14","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]},{"id":596469,"task":"Code Generation","parent_task":null,"dataset":"LiveCodeBench","model_name":"Llama 2 Chat 7B (Meta)","metrics":{"Pass@1":"0.2"},"paper_url":null,"paper_title":null,"paper_date":"2023-07-18","code_links":[{"title":"artificialanalysis.ai","url":"https://artificialanalysis.ai/"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":null,"source":"external","tags":[]}]}