paper-with-me

Language Modelling 벤치마크

Language Modelling on Artificial Analysis Intelligence Index

641개 결과 · ⬇ CSV · JSON

Index

3 15.6 28.2 40.8 53.4 2022-11 2026-09 GPT-3.5 Turbo (OpenAI) — 5.5 (2022-11-30) Llama 65B (Meta) — 5.0 (2023-02-24) GPT-4 (OpenAI) — 6.7 (2023-03-14) Claude Instant (Anthropic) — 5.0 (2023-03-14) PALM-2 (Google) — 5.4 (2023-05-10) Claude 2.0 (Anthropic) — 5.5 (2023-07-11) Llama 2 Chat 7B (Meta) — 5.7 (2023-07-18) Llama 2 Chat 70B (Meta) — 5.3 (2023-07-18) Llama 2 Chat 13B (Meta) — 5.3 (2023-07-18) Qwen Chat 14B (Alibaba) — 5.0 (2023-09-25) Mistral 7B Instruct (Mistral) — 5.0 (2023-09-27) GPT-4 Turbo (OpenAI) — 7.0 (2023-11-06) Claude 2.1 (Anthropic) — 5.6 (2023-11-21) DeepSeek LLM 67B Chat (V1) (DeepSeek) — 5.3 (2023-11-29) Qwen Chat 72B (Alibaba) — 5.4 (2023-11-30) Gemini 1.0 Ultra (Google) — 5.8 (2023-12-06) Gemini 1.0 Pro (Google) — 5.3 (2023-12-06) Mistral Medium (Mistral) — 5.5 (2023-12-11) Mixtral 8x7B Instruct (Mistral) — 5.1 (2023-12-11) OpenChat 3.5 (1210) (OpenChat) — 5.3 (2023-12-18) Solar Mini (Upstage) — 6.4 (2024-01-25) Phi-4 Mini Instruct (Microsoft) — 6.3 (2024-02-26) Mistral Large (Feb '24) (Mistral) — 5.8 (2024-02-26) Mistral Small (Feb '24) (Mistral) — 5.5 (2024-02-26) Claude 3 Opus (Anthropic) — 8.7 (2024-03-04) Claude 3 Sonnet (Anthropic) — 5.9 (2024-03-04) Claude 3 Haiku (Anthropic) — 5.6 (2024-03-04) Command-R (Mar '24) (Cohere) — 5.0 (2024-03-12) Grok-1 (SpaceXAI) — 6.3 (2024-03-17) DBRX Instruct (Databricks) — 5.3 (2024-03-27) Command-R+ (Apr '24) (Cohere) — 5.3 (2024-04-04) Mixtral 8x22B Instruct (Mistral) — 5.7 (2024-04-17) Llama 3 Instruct 70B (Meta) — 5.5 (2024-04-18) Llama 3 Instruct 8B (Meta) — 4.8 (2024-04-18) Phi-3 Mini Instruct 3.8B (Microsoft) — 5.8 (2024-04-23) Arctic Instruct (Snowflake) — 5.4 (2024-04-24) Qwen1.5 Chat 110B (Alibaba) — 5.7 (2024-04-25) DeepSeek-V2-Chat (DeepSeek) — 5.5 (2024-05-06) GPT-4o (May '24) (OpenAI) — 7.3 (2024-05-13) Gemini 1.5 Flash (May '24) (Google) — 5.9 (2024-05-14) Gemini 1.5 Pro (May '24) (Google) — 6.4 (2024-05-15) Qwen2 Instruct 72B (Alibaba) — 6.3 (2024-06-07) DeepSeek-Coder-V2 (DeepSeek) — 6.0 (2024-06-17) DeepSeek Coder V2 Lite Instruct (DeepSeek) — 5.3 (2024-06-17) Claude 3.5 Sonnet (June '24) (Anthropic) — 7.2 (2024-06-21) GPT-4o mini (OpenAI) — 6.7 (2024-07-18) Llama 3.1 Instruct 405B (Meta) — 7.3 (2024-07-23) Llama 3.1 Instruct 8B (Meta) — 6.9 (2024-07-23) Llama 3.1 Instruct 70B (Meta) — 6.6 (2024-07-23) Mistral Large 2 (Jul '24) (Mistral) — 6.8 (2024-07-24) GPT-4o (Aug '24) (OpenAI) — 7.7 (2024-08-06) Grok Beta (SpaceXAI) — 6.9 (2024-08-13) Hermes 3 - Llama-3.1 70B (Nous Research) — 6.0 (2024-08-15) Jamba 1.5 Large (AI21 Labs) — 6.0 (2024-08-22) Jamba 1.5 Mini (AI21 Labs) — 5.2 (2024-08-22) DeepSeek-V2.5 (DeepSeek) — 6.6 (2024-09-06) o1-preview (OpenAI) — 11.4 (2024-09-12) o1-mini (OpenAI) — 9.8 (2024-09-12) Mistral Small (Sep '24) (Mistral) — 5.8 (2024-09-17) Qwen2.5 Instruct 72B (Alibaba) — 7.7 (2024-09-19) Qwen2.5 Instruct 32B (Alibaba) — 6.9 (2024-09-19) Qwen2.5 Coder Instruct 7B (Alibaba) — 5.8 (2024-09-19) Gemini 1.5 Pro (Sep '24) (Google) — 7.9 (2024-09-24) Gemini 1.5 Flash (Sep '24) (Google) — 7.1 (2024-09-24) Llama 3.2 Instruct 90B (Vision) (Meta) — 6.4 (2024-09-25) Llama 3.2 Instruct 3B (Meta) — 5.7 (2024-09-25) Molmo 7B-D (Allen Institute for AI) — 5.6 (2024-09-25) Llama 3.2 Instruct 11B (Vision) (Meta) — 5.4 (2024-09-25) Llama 3.2 Instruct 1B (Meta) — 4.8 (2024-09-25) LFM 40B (Liquid AI) — 5.4 (2024-09-30) Gemini 1.5 Flash-8B (Google) — 6.2 (2024-10-03) Reka Flash (Sep '24) (Reka AI) — 6.4 (2024-10-04) Llama 3.1 Nemotron Instruct 70B (NVIDIA) — 6.9 (2024-10-15) Claude 3.5 Haiku (Anthropic) — 8.9 (2024-10-22) Claude 3.5 Sonnet (Oct '24) (Anthropic) — 7.9 (2024-10-22) Qwen2.5 Coder Instruct 32B (Alibaba) — 6.7 (2024-11-11) Mistral Large 2 (Nov '24) (Mistral) — 7.6 (2024-11-18) Pixtral Large (Mistral) — 7.1 (2024-11-18) Qwen2.5 Turbo (Alibaba) — 6.4 (2024-11-18) GPT-4o (Nov '24) (OpenAI) — 8.4 (2024-11-20) OLMo 2 7B (Allen Institute for AI) — 5.6 (2024-11-26) QwQ 32B-Preview (Alibaba) — 7.6 (2024-11-27) Nova Pro (Amazon) — 7.0 (2024-12-03) Nova Lite (Amazon) — 6.7 (2024-12-03) Nova Micro (Amazon) — 5.9 (2024-12-03) o1 (OpenAI) — 15.2 (2024-12-05) Llama 3.3 Instruct 70B (Meta) — 7.7 (2024-12-06) DeepSeek-V2.5 (Dec '24) (DeepSeek) — 6.6 (2024-12-10) Gemini 2.0 Flash (experimental) (Google) — 8.2 (2024-12-11) Grok 2 (Dec '24) (SpaceXAI) — 7.1 (2024-12-12) Phi-4 (Microsoft) — 5.9 (2024-12-12) Gemini 2.0 Flash Thinking Experimental (Dec '24) (Google) — 6.6 (2024-12-19) DeepSeek V3 (Dec '24) (DeepSeek) — 8.5 (2024-12-26) DeepSeek R1 (Jan '25) (DeepSeek) — 11.4 (2025-01-20) DeepSeek R1 Distill Qwen 32B (DeepSeek) — 8.4 (2025-01-20) DeepSeek R1 Distill Llama 70B (DeepSeek) — 7.9 (2025-01-20) DeepSeek R1 Distill Qwen 14B (DeepSeek) — 7.8 (2025-01-20) DeepSeek R1 Distill Llama 8B (DeepSeek) — 6.5 (2025-01-20) DeepSeek R1 Distill Qwen 1.5B (DeepSeek) — 5.5 (2025-01-20) Gemini 2.0 Flash Thinking Experimental (Jan '25) (Google) — 9.4 (2025-01-21) Sonar (Perplexity) — 7.7 (2025-01-21) Sonar Pro (Perplexity) — 7.6 (2025-01-21) Sonar Reasoning Pro (Perplexity) — 11.8 (2025-01-28) Sonar Reasoning (Perplexity) — 8.7 (2025-01-28) Qwen2.5 Max (Alibaba) — 8.0 (2025-01-28) Llama 3.1 Tulu3 405B (Allen Institute for AI) — 7.2 (2025-01-30) Mistral Small 3 (Mistral) — 6.7 (2025-01-30) o3-mini (OpenAI) — 12.5 (2025-01-31) o3-mini (high) (OpenAI) — 11.0 (2025-01-31) Gemini 2.0 Flash (Feb '25) (Google) — 8.9 (2025-02-05) Gemini 2.0 Pro Experimental (Feb '25) (Google) — 8.7 (2025-02-05) Gemini 2.0 Flash-Lite (Preview) (Google) — 7.3 (2025-02-05) DeepHermes 3 - Llama-3.1 8B Preview (Non-reasoning) (Nous Research) — 5.1 (2025-02-13) GPT-4o (ChatGPT) (OpenAI) — 7.2 (2025-02-15) Mistral Saba (Mistral) — 6.5 (2025-02-17) R1 1776 (Perplexity) — 6.4 (2025-02-18) Grok 3 mini Reasoning (high) (SpaceXAI) — 14.6 (2025-02-19) Grok 3 (SpaceXAI) — 12.1 (2025-02-19) Grok 3 Reasoning Beta (SpaceXAI) — 10.4 (2025-02-19) Claude 3.7 Sonnet (Reasoning) (Anthropic) — 17.7 (2025-02-24) Claude 3.7 Sonnet (Non-reasoning) (Anthropic) — 15.3 (2025-02-24) Gemini 2.0 Flash-Lite (Feb '25) (Google) — 7.4 (2025-02-25) Phi-4 Multimodal Instruct (Microsoft) — 5.8 (2025-02-26) GPT-4.5 (Preview) (OpenAI) — 9.6 (2025-02-27) QwQ 32B (Alibaba) — 9.5 (2025-03-05) Jamba 1.6 Large (AI21 Labs) — 6.0 (2025-03-06) Jamba 1.6 Mini (AI21 Labs) — 5.2 (2025-03-06) Reka Flash 3 (Reka AI) — 5.6 (2025-03-10) Gemma 3 27B Instruct (Google) — 4.9 (2025-03-12) Gemma 3 4B Instruct (Google) — 4.8 (2025-03-12) Gemma 3 12B Instruct (Google) — 3.8 (2025-03-12) Command A (Cohere) — 7.0 (2025-03-13) DeepHermes 3 - Mistral 24B Preview (Non-reasoning) (Nous Research) — 6.1 (2025-03-13) OLMo 2 32B (Allen Institute for AI) — 6.0 (2025-03-13) Gemma 3 1B Instruct (Google) — 4.8 (2025-03-13) Mistral Small 3.1 (Mistral) — 7.4 (2025-03-17) Llama 3.3 Nemotron Super 49B v1 (Reasoning) (NVIDIA) — 8.9 (2025-03-18) Llama 3.3 Nemotron Super 49B v1 (Non-reasoning) (NVIDIA) — 7.3 (2025-03-18) o1-pro (OpenAI) — 12.4 (2025-03-19) Gemini 2.5 Pro Preview (Mar' 25) (Google) — 15.0 (2025-03-25) DeepSeek V3 0324 (DeepSeek) — 9.7 (2025-03-25) GPT-4o (March 2025, chatgpt-4o-latest) (OpenAI) — 9.0 (2025-03-27) Llama 4 Maverick (Meta) — 9.3 (2025-04-05) Llama 4 Scout (Meta) — 6.5 (2025-04-05) Llama 3.1 Nemotron Ultra 253B v1 (Reasoning) (NVIDIA) — 7.5 (2025-04-07) GPT-4.1 (OpenAI) — 12.7 (2025-04-14) GPT-4.1 mini (OpenAI) — 10.2 (2025-04-14) GPT-4.1 nano (OpenAI) — 7.8 (2025-04-14) o3 (OpenAI) — 20.2 (2025-04-16) o4-mini (high) (OpenAI) — 16.7 (2025-04-16) Granite 3.3 8B (Non-reasoning) (IBM) — 4.9 (2025-04-16) Gemini 2.5 Flash Preview (Reasoning) (Google) — 11.7 (2025-04-17) Gemini 2.5 Flash Preview (Non-reasoning) (Google) — 8.7 (2025-04-17) Qwen3 235B A22B (Reasoning) (Alibaba) — 9.5 (2025-04-28) Qwen3 235B A22B (Non-reasoning) (Alibaba) — 8.3 (2025-04-28) Qwen3 30B A3B (Reasoning) (Alibaba) — 7.6 (2025-04-28) Qwen3 32B (Non-reasoning) (Alibaba) — 7.3 (2025-04-28) Qwen3 4B (Reasoning) (Alibaba) — 7.2 (2025-04-28) Qwen3 32B (Reasoning) (Alibaba) — 7.2 (2025-04-28) Qwen3 14B (Non-reasoning) (Alibaba) — 6.7 (2025-04-28) Qwen3 30B A3B (Non-reasoning) (Alibaba) — 6.6 (2025-04-28) Qwen3 4B (Non-reasoning) (Alibaba) — 6.6 (2025-04-28) Qwen3 14B (Reasoning) (Alibaba) — 6.4 (2025-04-28) Qwen3 8B (Non-reasoning) (Alibaba) — 6.0 (2025-04-28) Qwen3 1.7B (Reasoning) (Alibaba) — 5.2 (2025-04-28) Qwen3 8B (Reasoning) (Alibaba) — 5.2 (2025-04-28) Qwen3 1.7B (Non-reasoning) (Alibaba) — 4.9 (2025-04-28) Qwen3 0.6B (Non-reasoning) (Alibaba) — 4.8 (2025-04-28) Qwen3 0.6B (Reasoning) (Alibaba) — 4.8 (2025-04-28) Nova Premier (Amazon) — 9.2 (2025-04-30) Gemini 2.5 Pro Preview (May' 25) (Google) — 14.5 (2025-05-06) Mistral Medium 3 (Mistral) — 9.0 (2025-05-07) Gemini 2.5 Flash (Reasoning) (Google) — 13.1 (2025-05-20) Gemini 2.5 Flash (Non-reasoning) (Google) — 9.9 (2025-05-20) Solar Pro 2 (Preview) (Reasoning) (Upstage) — 9.1 (2025-05-20) Solar Pro 2 (Preview) (Non-reasoning) (Upstage) — 7.9 (2025-05-20) Llama 3.1 Nemotron Nano 4B v1.1 (Reasoning) (NVIDIA) — 7.3 (2025-05-20) Gemma 3n E4B Instruct Preview (May '25) (Google) — 5.8 (2025-05-20) Devstral Small (May '25) (Mistral) — 8.7 (2025-05-21) Claude 4 Opus (Reasoning) (Anthropic) — 20.6 (2025-05-22) Claude 4 Sonnet (Reasoning) (Anthropic) — 18.9 (2025-05-22) Claude 4 Opus (Non-reasoning) (Anthropic) — 16.6 (2025-05-22) Claude 4 Sonnet (Non-reasoning) (Anthropic) — 16.6 (2025-05-22) Sarvam M (Reasoning) (Sarvam) — 5.3 (2025-05-23) DeepSeek R1 0528 (May '25) (DeepSeek) — 13.1 (2025-05-28) DeepSeek R1 0528 Qwen3 8B (DeepSeek) — 8.1 (2025-05-29) Gemini 2.5 Pro (Google) — 16.7 (2025-06-05) o3-pro (OpenAI) — 21.9 (2025-06-10) Magistral Medium 1 (Mistral) — 9.1 (2025-06-10) Magistral Small 1 (Mistral) — 8.2 (2025-06-10) MiniMax M1 80k (MiniMax) — 11.7 (2025-06-17) MiniMax M1 40k (MiniMax) — 10.0 (2025-06-17) Gemini 2.5 Flash-Lite (Reasoning) (Google) — 8.5 (2025-06-17) Gemini 2.5 Flash-Lite (Non-reasoning) (Google) — 6.7 (2025-06-17) Mistral Small 3.2 (Mistral) — 7.0 (2025-06-20) Gemma 3n E2B Instruct (Google) — 4.8 (2025-06-26) Gemma 3n E4B Instruct (Google) — 4.8 (2025-06-26) ERNIE 4.5 300B A47B (Baidu) — 7.5 (2025-06-30) Jamba 1.7 Large (AI21 Labs) — 6.1 (2025-07-07) Jamba 1.7 Mini (AI21 Labs) — 5.2 (2025-07-07) Solar Pro 2 (Reasoning) (Upstage) — 7.5 (2025-07-09) Solar Pro 2 (Non-reasoning) (Upstage) — 7.0 (2025-07-09) Grok 4 (SpaceXAI) — 22.5 (2025-07-10) Devstral Medium (Mistral) — 9.0 (2025-07-10) Devstral Small (Jul '25) (Mistral) — 7.6 (2025-07-10) LFM2 1.2B (Liquid AI) — 4.8 (2025-07-10) Kimi K2 (Kimi) — 12.7 (2025-07-11) EXAONE 4.0 32B (Reasoning) (LG AI Research) — 8.2 (2025-07-15) EXAONE 4.0 32B (Non-reasoning) (LG AI Research) — 6.3 (2025-07-15) Exaone 4.0 1.2B (Reasoning) (LG AI Research) — 5.3 (2025-07-15) Exaone 4.0 1.2B (Non-reasoning) (LG AI Research) — 5.2 (2025-07-15) Qwen3 235B A22B 2507 Instruct (Alibaba) — 12.0 (2025-07-21) Qwen3 Coder 480B A35B Instruct (Alibaba) — 11.9 (2025-07-22) Qwen3 235B A22B 2507 (Reasoning) (Alibaba) — 12.7 (2025-07-25) Llama Nemotron Super 49B v1.5 (Reasoning) (NVIDIA) — 9.0 (2025-07-25) Llama Nemotron Super 49B v1.5 (Non-reasoning) (NVIDIA) — 7.4 (2025-07-25) GLM-4.5 (Reasoning) (Z AI) — 12.8 (2025-07-28) GLM-4.5-Air (Z AI) — 11.1 (2025-07-28) Qwen3 30B A3B 2507 Instruct (Alibaba) — 7.5 (2025-07-29) Qwen3 30B A3B 2507 (Reasoning) (Alibaba) — 9.8 (2025-07-30) Qwen3 Coder 30B A3B Instruct (Alibaba) — 9.6 (2025-07-31) Claude 4.1 Opus (Reasoning) (Anthropic) — 22.8 (2025-08-05) Claude 4.1 Opus (Non-reasoning) (Anthropic) — 18.6 (2025-08-05) gpt-oss-120b (high) (OpenAI) — 12.3 (2025-08-05) gpt-oss-120b (low) (OpenAI) — 10.2 (2025-08-05) gpt-oss-20b (low) (OpenAI) — 10.0 (2025-08-05) gpt-oss-20b (high) (OpenAI) — 9.0 (2025-08-05) Qwen3 4B 2507 (Reasoning) (Alibaba) — 8.8 (2025-08-06) Qwen3 4B 2507 Instruct (Alibaba) — 6.7 (2025-08-06) GPT-5 (high) (OpenAI) — 23.0 (2025-08-07) GPT-5 (medium) (OpenAI) — 22.9 (2025-08-07) GPT-5 (low) (OpenAI) — 20.8 (2025-08-07) GPT-5 mini (medium) (OpenAI) — 20.6 (2025-08-07) GPT-5 mini (high) (OpenAI) — 17.4 (2025-08-07) GPT-5 nano (high) (OpenAI) — 13.0 (2025-08-07) GPT-5 nano (medium) (OpenAI) — 12.5 (2025-08-07) GPT-5 (minimal) (OpenAI) — 11.4 (2025-08-07) GPT-5 (ChatGPT) (OpenAI) — 10.4 (2025-08-07) GPT-5 mini (minimal) (OpenAI) — 9.9 (2025-08-07) GPT-5 nano (minimal) (OpenAI) — 7.1 (2025-08-07) GLM-4.5V (Reasoning) (Z AI) — 7.6 (2025-08-11) GLM-4.5V (Non-reasoning) (Z AI) — 6.7 (2025-08-11) Mistral Medium 3.1 (Mistral) — 9.9 (2025-08-12) Gemma 3 270M (Google) — 5.1 (2025-08-14) NVIDIA Nemotron Nano 9B V2 (Reasoning) (NVIDIA) — 7.4 (2025-08-18) NVIDIA Nemotron Nano 9B V2 (Non-reasoning) (NVIDIA) — 6.8 (2025-08-18) Seed-OSS-36B-Instruct (ByteDance Seed) — 12.1 (2025-08-20) DeepSeek V3.1 (Non-reasoning) (DeepSeek) — 13.7 (2025-08-21) DeepSeek V3.1 (Reasoning) (DeepSeek) — 13.5 (2025-08-21) Hermes 4 - Llama-3.1 70B (Reasoning) (Nous Research) — 7.9 (2025-08-27) Hermes 4 - Llama-3.1 405B (Reasoning) (Nous Research) — 7.5 (2025-08-27) Hermes 4 - Llama-3.1 405B (Non-reasoning) (Nous Research) — 7.4 (2025-08-27) Hermes 4 - Llama-3.1 70B (Non-reasoning) (Nous Research) — 6.7 (2025-08-27) Grok Code Fast 1 (SpaceXAI) — 14.1 (2025-08-28) Apertus 70B Instruct (Swiss AI Initiative) — 5.1 (2025-09-02) Apertus 8B Instruct (Swiss AI Initiative) — 4.8 (2025-09-02) Kimi K2 0905 (Kimi) — 15.3 (2025-09-05) Qwen3 Max (Preview) (Alibaba) — 12.6 (2025-09-05) Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning) (Google) — 10.4 (2025-09-08) Ling-mini-2.0 (InclusionAI) — 5.5 (2025-09-09) Qwen3 Next 80B A3B (Reasoning) (Alibaba) — 11.2 (2025-09-11) Qwen3 Next 80B A3B Instruct (Alibaba) — 9.6 (2025-09-11) Magistral Small 1.2 (Mistral) — 8.6 (2025-09-17) Ling-flash-2.0 (InclusionAI) — 7.8 (2025-09-17) Magistral Medium 1.2 (Mistral) — 11.8 (2025-09-18) Grok 4 Fast (Reasoning) (SpaceXAI) — 17.9 (2025-09-19) Grok 4 Fast (Non-reasoning) (SpaceXAI) — 11.1 (2025-09-19) Ring-flash-2.0 (InclusionAI) — 7.2 (2025-09-19) DeepSeek V3.1 Terminus (Reasoning) (DeepSeek) — 15.4 (2025-09-22) DeepSeek V3.1 Terminus (Non-reasoning) (DeepSeek) — 13.9 (2025-09-22) Qwen3 Omni 30B A3B (Reasoning) (Alibaba) — 7.8 (2025-09-22) Granite 4.0 H Small (IBM) — 6.0 (2025-09-22) Qwen3 Omni 30B A3B Instruct (Alibaba) — 6.0 (2025-09-22) Granite 4.0 Micro (IBM) — 5.1 (2025-09-22) GPT-5 Codex (high) (OpenAI) — 24.9 (2025-09-23) Qwen3 Max (Alibaba) — 15.6 (2025-09-23) Qwen3 VL 235B A22B (Reasoning) (Alibaba) — 13.4 (2025-09-23) Qwen3 VL 235B A22B Instruct (Alibaba) — 9.9 (2025-09-23) LFM2 2.6B (Liquid AI) — 5.2 (2025-09-23) Gemini 2.5 Flash Preview (Sep '25) (Reasoning) (Google) — 15.5 (2025-09-25) Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning) (Google) — 12.4 (2025-09-25) Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning) (Google) — 9.3 (2025-09-25) Claude 4.5 Sonnet (Reasoning) (Anthropic) — 21.2 (2025-09-29) Claude 4.5 Sonnet (Non-reasoning) (Anthropic) — 19.3 (2025-09-29) DeepSeek V3.2 Exp (Reasoning) (DeepSeek) — 16.6 (2025-09-29) DeepSeek V3.2 Exp (Non-reasoning) (DeepSeek) — 13.9 (2025-09-29) GLM-4.6 (Reasoning) (Z AI) — 18.5 (2025-09-30) GLM-4.6 (Non-reasoning) (Z AI) — 14.9 (2025-09-30) Apriel-v1.5-15B-Thinker (ServiceNow) — 13.8 (2025-09-30) Qwen3 VL 30B A3B (Reasoning) (Alibaba) — 9.5 (2025-10-03) Qwen3 VL 30B A3B Instruct (Alibaba) — 7.9 (2025-10-03) LFM2 8B A1B (Liquid AI) — 4.9 (2025-10-07) Ling-1T (InclusionAI) — 9.2 (2025-10-08) Jamba Reasoning 3B (AI21 Labs) — 5.7 (2025-10-08) Ring-1T (InclusionAI) — 10.9 (2025-10-13) Qwen3 VL 8B (Reasoning) (Alibaba) — 8.2 (2025-10-14) Qwen3 VL 8B Instruct (Alibaba) — 7.3 (2025-10-14) Qwen3 VL 4B (Reasoning) (Alibaba) — 7.0 (2025-10-14) Qwen3 VL 4B Instruct (Alibaba) — 5.7 (2025-10-14) Claude 4.5 Haiku (Reasoning) (Anthropic) — 17.6 (2025-10-15) Claude 4.5 Haiku (Non-reasoning) (Anthropic) — 15.4 (2025-10-15) Qwen3 VL 32B (Reasoning) (Alibaba) — 11.9 (2025-10-21) Qwen3 VL 32B Instruct (Alibaba) — 8.4 (2025-10-21) MiniMax-M2 (MiniMax) — 18.6 (2025-10-26) NVIDIA Nemotron Nano 12B v2 VL (Reasoning) (NVIDIA) — 7.5 (2025-10-28) NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) (NVIDIA) — 5.8 (2025-10-28) Granite 4.0 H 1B (IBM) — 5.2 (2025-10-28) Granite 4.0 1B (IBM) — 5.0 (2025-10-28) Granite 4.0 350M (IBM) — 4.8 (2025-10-28) Granite 4.0 H 350M (IBM) — 4.8 (2025-10-28) Nova 2.0 Lite (high) (Amazon) — 13.4 (2025-10-29) Nova 2.0 Lite (medium) (Amazon) — 12.5 (2025-10-29) Nova 2.0 Lite (low) (Amazon) — 11.8 (2025-10-29) Nova 2.0 Lite (Non-reasoning) (Amazon) — 8.7 (2025-10-29) Kimi Linear 48B A3B Instruct (Kimi) — 7.3 (2025-10-30) Qwen3 Max Thinking (Preview) (Alibaba) — 16.3 (2025-11-03) Kimi K2 Thinking (Kimi) — 22.0 (2025-11-06) KAT-Coder-Pro V1 (KwaiKAT) — 18.6 (2025-11-11) Doubao Seed Code (ByteDance Seed) — 16.9 (2025-11-11) GPT-5.1 (high) (OpenAI) — 24.7 (2025-11-13) GPT-5.1 Codex (high) (OpenAI) — 23.7 (2025-11-13) GPT-5.1 Codex mini (high) (OpenAI) — 20.4 (2025-11-13) ERNIE 5.0 Thinking Preview (Baidu) — 14.3 (2025-11-13) GPT-5.1 (Non-reasoning) (OpenAI) — 13.3 (2025-11-13) Gemini 3 Pro Preview (high) (Google) — 28.0 (2025-11-18) Gemini 3 Pro Preview (low) (Google) — 22.3 (2025-11-18) Grok 4.1 Fast (Reasoning) (SpaceXAI) — 20.4 (2025-11-19) Grok 4.1 Fast (Non-reasoning) (SpaceXAI) — 11.3 (2025-11-19) Olmo 3 32B Think (Allen Institute for AI) — 6.5 (2025-11-20) Olmo 3 7B Think (Allen Institute for AI) — 5.6 (2025-11-20) Olmo 3 7B Instruct (Allen Institute for AI) — 5.2 (2025-11-20) Claude Opus 4.5 (Reasoning) (Anthropic) — 29.1 (2025-11-24) Claude Opus 4.5 (Non-reasoning) (Anthropic) — 23.7 (2025-11-24) Apriel-v1.6-15B-Thinker (ServiceNow) — 13.4 (2025-11-25) Nova 2.0 Omni (medium) (Amazon) — 13.6 (2025-11-26) Nova 2.0 Omni (low) (Amazon) — 11.1 (2025-11-26) Nova 2.0 Omni (Non-reasoning) (Amazon) — 8.2 (2025-11-26) Nova 2.0 Pro Preview (medium) (Amazon) — 14.2 (2025-11-27) Nova 2.0 Pro Preview (low) (Amazon) — 12.8 (2025-11-27) INTELLECT-3 (Prime Intellect) — 10.6 (2025-11-27) Nova 2.0 Pro Preview (Non-reasoning) (Amazon) — 10.0 (2025-11-27) DeepSeek V3.2 (Reasoning) (DeepSeek) — 21.5 (2025-12-01) DeepSeek V3.2 (Non-reasoning) (DeepSeek) — 16.0 (2025-12-01) DeepSeek V3.2 Speciale (DeepSeek) — 14.5 (2025-12-01) Mistral Large 3 (Mistral) — 9.7 (2025-12-02) Ministral 3 14B (Mistral) — 6.0 (2025-12-02) Ministral 3 8B (Mistral) — 5.5 (2025-12-02) Ministral 3 3B (Mistral) — 4.8 (2025-12-02) Motif-2-12.7B-Reasoning (Motif Technologies) — 9.2 (2025-12-04) K2-V2 (high) (MBZUAI Institute of Foundation Models) — 9.9 (2025-12-05) K2-V2 (medium) (MBZUAI Institute of Foundation Models) — 9.0 (2025-12-05) K2-V2 (low) (MBZUAI Institute of Foundation Models) — 7.3 (2025-12-05) GLM-4.6V (Reasoning) (Z AI) — 11.2 (2025-12-08) GLM-4.6V (Non-reasoning) (Z AI) — 8.4 (2025-12-08) Devstral 2 (Mistral) — 9.4 (2025-12-09) Devstral Small 2 (Mistral) — 8.4 (2025-12-09) GPT-5.2 (xhigh) (OpenAI) — 30.4 (2025-12-11) GPT-5.2 Codex (xhigh) (OpenAI) — 28.5 (2025-12-11) GPT-5.2 (medium) (OpenAI) — 26.5 (2025-12-11) GPT-5.2 (Non-reasoning) (OpenAI) — 17.0 (2025-12-11) Mi:dm K 2.5 Pro (Korea Telecom) — 11.0 (2025-12-11) Molmo2-8B (Allen Institute for AI) — 5.0 (2025-12-11) Olmo 3.1 32B Think (Allen Institute for AI) — 7.1 (2025-12-12) K2 Think V2 (MBZUAI Institute of Foundation Models) — 11.5 (2025-12-15) NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) (NVIDIA) — 8.9 (2025-12-15) NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) (NVIDIA) — 6.8 (2025-12-15) MiMo-V2-Flash (Feb 2026) (Xiaomi) — 22.4 (2025-12-16) MiMo-V2-Flash (Reasoning) (Xiaomi) — 20.8 (2025-12-16) MiMo-V2-Flash (Non-reasoning) (Xiaomi) — 16.0 (2025-12-16) Gemini 3 Flash Preview (Reasoning) (Google) — 26.3 (2025-12-17) Gemini 3 Flash Preview (Non-reasoning) (Google) — 17.9 (2025-12-17) Solar Open 100B (Reasoning) (Upstage) — 10.4 (2025-12-17) GLM-4.7 (Reasoning) (Z AI) — 22.2 (2025-12-22) GLM-4.7 (Non-reasoning) (Z AI) — 17.4 (2025-12-22) MiniMax-M2.1 (MiniMax) — 20.9 (2025-12-23) HyperCLOVA X SEED Think (32B) (Naver) — 11.4 (2025-12-26) K-EXAONE (Reasoning) (LG AI Research) — 14.4 (2025-12-31) K-EXAONE (Non-reasoning) (LG AI Research) — 11.2 (2025-12-31) Falcon-H1R-7B (TII UAE) — 7.8 (2026-01-04) LFM2.5-1.2B-Instruct (Liquid AI) — 5.2 (2026-01-05) LFM2.5-VL-1.6B (Liquid AI) — 4.8 (2026-01-05) Olmo 3.1 32B Instruct (Allen Institute for AI) — 6.5 (2026-01-13) GLM-4.7-Flash (Reasoning) (Z AI) — 14.9 (2026-01-19) GLM-4.7-Flash (Non-reasoning) (Z AI) — 10.6 (2026-01-19) Step3 VL 10B (StepFun) — 7.7 (2026-01-20) LFM2.5-1.2B-Thinking (Liquid AI) — 5.2 (2026-01-20) Qwen3 Max Thinking (Alibaba) — 21.3 (2026-01-26) Kimi K2.5 (Reasoning) (Kimi) — 23.5 (2026-01-27) Kimi K2.5 (Non-reasoning) (Kimi) — 19.4 (2026-01-27) LongCat Flash Lite (LongCat) — 11.5 (2026-01-28) Step 3.5 Flash (StepFun) — 16.6 (2026-02-02) Qwen3 Coder Next (Alibaba) — 10.1 (2026-02-03) GPT-5.3 Codex (xhigh) (OpenAI) — 32.5 (2026-02-05) Claude Opus 4.6 (Adaptive Reasoning, Max Effort) (Anthropic) — 31.9 (2026-02-05) Claude Opus 4.6 (Non-reasoning, High Effort) (Anthropic) — 26.4 (2026-02-05) Tri-21B-think Preview (Trillion Labs) — 9.6 (2026-02-10) Tri-21B-Think (Trillion Labs) — 9.0 (2026-02-10) GLM-5 (Reasoning) (Z AI) — 27.9 (2026-02-11) GLM-5 (Non-reasoning) (Z AI) — 21.8 (2026-02-11) Nanbeige4.1-3B (Nanbeige) — 8.4 (2026-02-11) MiniMax-M2.5 (MiniMax) — 22.8 (2026-02-12) Qwen3.5 397B A17B (Non-reasoning) (Alibaba) — 21.4 (2026-02-16) Qwen3.5 397B A17B (Reasoning) (Alibaba) — 19.1 (2026-02-16) Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) (Anthropic) — 30.5 (2026-02-17) Claude Sonnet 4.6 (Non-reasoning, High Effort) (Anthropic) — 24.7 (2026-02-17) Claude Sonnet 4.6 (Non-reasoning, Low Effort) (Anthropic) — 23.3 (2026-02-17) Tiny Aya Global (Cohere) — 4.8 (2026-02-17) Gemini 3.1 Pro Preview (Google) — 30.4 (2026-02-19) Mercury 2 (Inception) — 11.5 (2026-02-20) Qwen3.5 27B (Reasoning) (Alibaba) — 22.9 (2026-02-24) Qwen3.5 27B (Non-reasoning) (Alibaba) — 19.4 (2026-02-24) Qwen3.5 35B A3B (Reasoning) (Alibaba) — 19.3 (2026-02-24) Qwen3.5 122B A10B (Non-reasoning) (Alibaba) — 17.7 (2026-02-24) Qwen3.5 122B A10B (Reasoning) (Alibaba) — 16.2 (2026-02-24) Qwen3.5 35B A3B (Non-reasoning) (Alibaba) — 15.1 (2026-02-24) LFM2 24B A2B (Liquid AI) — 5.9 (2026-02-25) Qwen3.5 9B (Reasoning) (Alibaba) — 13.7 (2026-03-02) Qwen3.5 9B (Non-reasoning) (Alibaba) — 13.3 (2026-03-02) Qwen3.5 4B (Reasoning) (Alibaba) — 13.1 (2026-03-02) Qwen3.5 4B (Non-reasoning) (Alibaba) — 10.8 (2026-03-02) Qwen3.5 2B (Reasoning) (Alibaba) — 6.9 (2026-03-02) Qwen3.5 2B (Non-reasoning) (Alibaba) — 6.2 (2026-03-02) Qwen3.5 0.8B (Reasoning) (Alibaba) — 6.1 (2026-03-02) Qwen3.5 0.8B (Non-reasoning) (Alibaba) — 5.4 (2026-03-02) Gemini 3.1 Flash-Lite (Google) — 16.0 (2026-03-03) GPT-5.4 (xhigh) (OpenAI) — 39.0 (2026-03-05) GPT-5.4 (low) (OpenAI) — 27.6 (2026-03-05) GPT-5.4 (Non-reasoning) (OpenAI) — 18.2 (2026-03-05) Sarvam 105B (high) (Sarvam) — 8.8 (2026-03-06) Sarvam 30B (high) (Sarvam) — 6.6 (2026-03-06) Grok 4.20 0309 (Reasoning) (SpaceXAI) — 25.2 (2026-03-10) Grok 4.20 0309 (Non-reasoning) (SpaceXAI) — 14.6 (2026-03-10) Nemotron 3 Super 120B A12B (Reasoning) (NVIDIA) — 13.6 (2026-03-11) GLM-5-Turbo (Z AI) — 26.6 (2026-03-15) Mistral Small 4 (Reasoning) (Mistral) — 11.5 (2026-03-16) Mistral Small 4 (Non-reasoning) (Mistral) — 9.0 (2026-03-16) NVIDIA Nemotron 3 Nano 4B (NVIDIA) — 7.4 (2026-03-16) GPT-5.4 mini (xhigh) (OpenAI) — 24.6 (2026-03-17) GPT-5.4 nano (xhigh) (OpenAI) — 21.2 (2026-03-17) GPT-5.4 nano (medium) (OpenAI) — 20.0 (2026-03-17) GPT-5.4 mini (medium) (OpenAI) — 19.7 (2026-03-17) GPT-5.4 nano (Non-Reasoning) (OpenAI) — 11.7 (2026-03-17) GPT-5.4 mini (Non-Reasoning) (OpenAI) — 11.1 (2026-03-17) MiMo-V2-Pro (Xiaomi) — 28.6 (2026-03-18) MiniMax-M2.7 (MiniMax) — 23.2 (2026-03-18) MiMo-V2-Omni (Xiaomi) — 23.9 (2026-03-19) Nemotron Cascade 2 30B A3B (NVIDIA) — 11.7 (2026-03-19) MiMo-V2-Omni-0327 (Xiaomi) — 25.1 (2026-03-27) KAT Coder Pro V2 (KwaiKAT) — 21.7 (2026-03-27) Qwen3.5 Omni Plus (Alibaba) — 20.4 (2026-03-30) Qwen3.5 Omni Flash (Alibaba) — 12.5 (2026-03-30) GLM 5V Turbo (Reasoning) (Z AI) — 23.5 (2026-04-01) Trinity Large Thinking (Arcee AI) — 10.9 (2026-04-01) Qwen3.6 Plus (Alibaba) — 27.0 (2026-04-02) Step 3.5 Flash 2603 (StepFun) — 17.0 (2026-04-02) Gemma 4 26B A4B (Reasoning) (Google) — 16.7 (2026-04-02) Gemma 4 31B (Reasoning) (Google) — 15.4 (2026-04-02) Gemma 4 31B (Non-reasoning) (Google) — 13.9 (2026-04-02) Gemma 4 26B A4B (Non-reasoning) (Google) — 13.1 (2026-04-02) Gemma 4 E2B (Reasoning) (Google) — 7.8 (2026-04-02) Gemma 4 E2B (Non-reasoning) (Google) — 6.5 (2026-04-02) Gemma 4 E4B (Reasoning) (Google) — 8.9 (2026-04-03) Gemma 4 E4B (Non-reasoning) (Google) — 7.5 (2026-04-03) Solar Pro 3 (Upstage) — 7.8 (2026-04-06) GLM-5.1 (Reasoning) (Z AI) — 26.4 (2026-04-07) Grok 4.20 0309 v2 (Reasoning) (SpaceXAI) — 25.7 (2026-04-07) GLM-5.1 (Non-reasoning) (Z AI) — 24.2 (2026-04-07) Grok 4.20 0309 v2 (Non-reasoning) (SpaceXAI) — 14.2 (2026-04-07) Muse Spark (Meta) — 31.3 (2026-04-08) EXAONE 4.5 33B (LG AI Research) — 13.2 (2026-04-09) JT-MINI (China Mobile) — 12.2 (2026-04-15) Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Anthropic) — 40.7 (2026-04-16) Claude Opus 4.7 (Non-reasoning, High Effort) (Anthropic) — 30.9 (2026-04-16) Qwen3.6 35B A3B (Reasoning) (Alibaba) — 18.8 (2026-04-16) Qwen3.6 35B A3B (Non-reasoning) (Alibaba) — 15.2 (2026-04-16) Qwen3.6 Max Preview (Alibaba) — 28.4 (2026-04-20) Kimi K2.6 (Kimi) — 27.5 (2026-04-20) Kimi K2.6 (Non-reasoning) (Kimi) — 23.6 (2026-04-20) Ling 2.6 Flash (InclusionAI) — 9.7 (2026-04-21) MiMo-V2.5-Pro (Xiaomi) — 26.4 (2026-04-22) MiMo-V2.5 (Xiaomi) — 22.3 (2026-04-22) Qwen3.6 27B (Reasoning) (Alibaba) — 21.9 (2026-04-22) Qwen3.6 27B (Non-reasoning) (Alibaba) — 19.8 (2026-04-22) MiMo-V2.5-Pro (Non-reasoning) (Xiaomi) — 18.3 (2026-04-22) GPT-5.5 (xhigh) (OpenAI) — 38.6 (2026-04-23) GPT-5.5 (high) (OpenAI) — 37.3 (2026-04-23) GPT-5.5 (medium) (OpenAI) — 34.2 (2026-04-23) GPT-5.5 (low) (OpenAI) — 30.7 (2026-04-23) GPT-5.5 (Non-reasoning) (OpenAI) — 23.2 (2026-04-23) Hy3-preview (Reasoning) (Tencent) — 22.7 (2026-04-23) Hy3-preview (Non-reasoning) (Tencent) — 17.0 (2026-04-23) Ling-2.6-1T (InclusionAI) — 17.0 (2026-04-23) DeepSeek V4 Pro (Reasoning, Max Effort) (DeepSeek) — 30.9 (2026-04-24) DeepSeek V4 Pro (Reasoning, High Effort) (DeepSeek) — 30.1 (2026-04-24) DeepSeek V4 Flash (Reasoning, High Effort) (DeepSeek) — 24.8 (2026-04-24) DeepSeek V4 Flash (Reasoning, Max Effort) (DeepSeek) — 24.6 (2026-04-24) DeepSeek V4 Pro (Non-reasoning) (DeepSeek) — 20.8 (2026-04-24) DeepSeek V4 Flash (Non-reasoning) (DeepSeek) — 18.9 (2026-04-24) Mistral Medium 3.5 (Mistral) — 14.9 (2026-04-29) Nemotron 3 Nano Omni 30B A3B Reasoning (NVIDIA) — 10.3 (2026-04-29) Granite 4.1 30B (IBM) — 7.4 (2026-04-29) Granite 4.1 8B (IBM) — 6.6 (2026-04-29) Granite 4.1 3B (IBM) — 5.9 (2026-04-29) Grok 4.3 (high) (SpaceXAI) — 25.4 (2026-04-30) Grok 4.3 (medium) (SpaceXAI) — 24.8 (2026-04-30) Grok 4.3 (low) (SpaceXAI) — 24.3 (2026-04-30) Grok 4.3 (Non-reasoning) (SpaceXAI) — 14.5 (2026-04-30) GPT-5.5 Instant (May 2026) (OpenAI) — 22.7 (2026-05-05) Ring-2.6-1T (InclusionAI) — 17.3 (2026-05-08) MiniCPM-V 4.6 1.3B (OpenBMB) — 5.7 (2026-05-11) JT-35B-Flash (China Mobile) — 18.7 (2026-05-14) Gemini 3.5 Flash (medium) (Google) — 33.6 (2026-05-19) Gemini 3.5 Flash (high) (Google) — 33.0 (2026-05-19) Qwen3.7 Max (Alibaba) — 29.9 (2026-05-19) Gemini 3.5 Flash (minimal) (Google) — 23.8 (2026-05-19) Command A+ (Cohere) — 13.9 (2026-05-20) MiniCPM5-1B (Reasoning) (OpenBMB) — 8.8 (2026-05-25) MiniCPM5-1B (Non-reasoning) (OpenBMB) — 8.7 (2026-05-25) HyperNova 60B 2605 (high, based on gpt-oss-120b) (Multiverse Computing) — 11.7 (2026-05-26) Claude Opus 4.8 (Adaptive Reasoning, Max Effort) (Anthropic) — 42.0 (2026-05-28) LFM2.5-8B-A1B (Liquid AI) — 7.2 (2026-05-28) Step 3.7 Flash (StepFun) — 19.5 (2026-05-29) MiniMax-M3 (MiniMax) — 29.6 (2026-06-01) Qwen3.7 Plus (Alibaba) — 25.8 (2026-06-01) Nex-N2-Pro (Nex AGI) — 28.2 (2026-06-02) Gemma 4 12B (Reasoning) (Google) — 14.2 (2026-06-03) Gemma 4 12B (Non-reasoning) (Google) — 9.4 (2026-06-03) Nemotron 3 Ultra 550B A55B (Reasoning) (NVIDIA) — 23.4 (2026-06-04) Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (Anthropic) — 49.7 (2026-06-09) North Mini Code (Cohere) — 12.8 (2026-06-09) DiffusionGemma 26B A4B (Google) — 9.5 (2026-06-10) Kimi K2.7 Code (Kimi) — 26.3 (2026-06-12) GLM-5.2 (max) (Z AI) — 34.0 (2026-06-16) Grok Build 0.1 0616 (SpaceXAI) — 27.2 (2026-06-16) GLM-5.2 (Non-reasoning) (Z AI) — 22.4 (2026-06-16) GPT-5.5 Instant (June 2026) (OpenAI) — 26.8 (2026-06-25) LongCat 2.0 (LongCat) — 19.7 (2026-06-29) Claude Sonnet 5 (Adaptive Reasoning, Max Effort) (Anthropic) — 38.4 (2026-06-30) Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) (Anthropic) — 34.7 (2026-06-30) Claude Sonnet 5 (Adaptive Reasoning, High Effort) (Anthropic) — 32.0 (2026-06-30) Claude Sonnet 5 (Non-reasoning, High Effort) (Anthropic) — 28.9 (2026-06-30) Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) (Anthropic) — 28.4 (2026-06-30) Claude Sonnet 5 (Adaptive Reasoning, Low Effort) (Anthropic) — 24.7 (2026-06-30) Hy3 (Tencent) — 25.8 (2026-07-06) Grok 4.5 (high) (SpaceXAI) — 39.1 (2026-07-08) GPT-5.6 Sol (max) (OpenAI) — 47.1 (2026-07-09) GPT-5.6 Sol (xhigh) (OpenAI) — 44.1 (2026-07-09) GPT-5.6 Sol (high) (OpenAI) — 42.5 (2026-07-09) GPT-5.6 Terra (max) (OpenAI) — 42.3 (2026-07-09) GPT-5.6 Sol (medium) (OpenAI) — 39.5 (2026-07-09) GPT-5.6 Terra (xhigh) (OpenAI) — 38.2 (2026-07-09) GPT-5.6 Luna (max) (OpenAI) — 37.5 (2026-07-09) GPT-5.6 Luna (xhigh) (OpenAI) — 34.8 (2026-07-09) GPT-5.6 Terra (high) (OpenAI) — 34.5 (2026-07-09) Muse Spark 1.1 (xhigh) (Meta) — 34.3 (2026-07-09) GPT-5.6 Sol (low) (OpenAI) — 33.8 (2026-07-09) GPT-5.6 Luna (high) (OpenAI) — 32.4 (2026-07-09) GPT-5.6 Terra (medium) (OpenAI) — 30.4 (2026-07-09) GPT-5.6 Sol (Non-reasoning) (OpenAI) — 28.3 (2026-07-09) GPT-5.6 Terra (low) (OpenAI) — 27.9 (2026-07-09) JT-4.1 Flash 236B A21B (China Mobile) — 27.3 (2026-07-09) GPT-5.6 Luna (medium) (OpenAI) — 25.5 (2026-07-09) GPT-5.6 Terra (Non-reasoning) (OpenAI) — 22.3 (2026-07-09) GPT-5.6 Luna (low) (OpenAI) — 21.5 (2026-07-09) GPT-5.6 Luna (Non-reasoning) (OpenAI) — 16.8 (2026-07-09) Motif 3 (Beta) (Motif Technologies) — 32.3 (2026-07-14) Inkling (xhigh) (Thinking Machines) — 25.5 (2026-07-15) Kimi K3 (max) (Kimi) — 43.8 (2026-07-16) Kimi K3 (low) (Kimi) — 30.5 (2026-07-16) Gemini 3.6 Flash (high) (Google) — 34.3 (2026-07-21) Gemini 3.5 Flash-Lite (Google) — 22.7 (2026-07-21) G9v3-3B (AI9Stars) — 10.8 (2026-07-23) Claude Opus 5 (Adaptive Reasoning, Max Effort) (Anthropic) — 50.7 (2026-07-24) Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) (Anthropic) — 49.7 (2026-07-24) Claude Opus 5 (Adaptive Reasoning, High Effort) (Anthropic) — 48.2 (2026-07-24) Claude Opus 5 (Adaptive Reasoning, Medium Effort) (Anthropic) — 45.1 (2026-07-24) Claude Opus 5 (Adaptive Reasoning, Low Effort) (Anthropic) — 39.8 (2026-07-24) Agnes 2.5 Pro Alpha (Sapiens AI) — 27.8 (2026-07-24) Celeris-1 (Celeris) — 6.3 (2026-07-24) Inkling Small (Thinking Machines) — 26.1 (2026-07-30) DeepSeek V4 Flash 0731 (Reasoning, Max Effort) (DeepSeek) — 34.5 (2026-07-31) Qwen3.8 Max (Alibaba) — 40.3 (2026-08-03) Ling 3.0 Flash (InclusionAI) — 20.6 (2026-08-04) LFM2.5-2.6B (Liquid AI) — 8.4 (2026-08-04) Muse Spark 1.2 (xhigh) (Meta) — 39.8 (2026-08-05) Solar Pro 4 (Upstage) — 28.2 (2026-08-06) Ling 3.0 Tiny (InclusionAI) — 11.9 (2026-08-06) Quasar 438B (max, based on GLM-5.2) (Multiverse Computing) — 27.1 (2026-08-10) Muse Glimmer (high) (Meta) — 18.1 (2026-08-10) Nemotron 3.5 Lightning (NVIDIA) — 13.6 (2026-08-11) Grok 4.6 (high) (SpaceXAI) — 44.4 (2026-08-12) Grok 4.6 (xhigh) (SpaceXAI) — 44.3 (2026-08-12) Grok 4.6 (medium) (SpaceXAI) — 43.0 (2026-08-12) Qwen3.8 2.4T A95B (Alibaba) — 40.0 (2026-08-12) Grok 4.6 (low) (SpaceXAI) — 35.4 (2026-08-12) Motif 3 (Motif Technologies) — 33.6 (2026-08-12) Solar Open2 250B (Upstage) — 24.7 (2026-08-12) A.X-K2 (SK Telecom) — 22.7 (2026-08-12) K-EXAONE 2.0 (LG AI Research) — 19.7 (2026-08-12) Gemini 3.7 Flash (medium) (Google) — 39.6 (2026-08-13) Gemini 3.7 Flash (high) (Google) — 39.4 (2026-08-13) Gemini 3.7 Flash (low) (Google) — 36.9 (2026-08-13) DeepSeek V4 Pro 0813 (Reasoning, Max Effort) (DeepSeek) — 36.3 (2026-08-13) Qwen3.8 27B (xhigh) (Alibaba) — 33.9 (2026-08-14) Qwen3.8 27B (medium) (Alibaba) — 27.8 (2026-08-14) Qwen3.8 27B (low) (Alibaba) — 26.5 (2026-08-14) Qwen3.8 27B (Non-reasoning) (Alibaba) — 22.4 (2026-08-14) GLM-5.3 (max) (Z AI) — 44.9 (2026-08-18) G9v3-39A5B (AI9Stars) — 21.8 (2026-08-20) DeepSeek V4 Flash Vision (Reasoning, Max Effort) (DeepSeek) — 35.0 (2026-08-21) Granite 4.2 30B (IBM) — 14.8 (2026-08-25) Granite 4.2 8B (IBM) — 11.8 (2026-08-25) Granite 4.2 3B (IBM) — 9.1 (2026-08-25) GLM-5.3-Flash (Z AI) — 41.9 (2026-08-26) Qwen3.8-Flash-Next (Alibaba) — 39.9 (2026-08-26) Agnes 2.5 Pro Beta (Sapiens AI) — 35.2 (2026-08-26) Apodex 1.1 (Apodex) — 30.4 (2026-08-30) Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (Anthropic) — 53.4 (2026-09-01) Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (Anthropic) — 53.2 (2026-09-01) Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) (Anthropic) — 51.2 (2026-09-01) Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) (Anthropic) — 49.1 (2026-09-01) Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) (Anthropic) — 47.0 (2026-09-01) Muse Spark 1.3 (max) (Meta) — 48.2 (2026-09-02) Muse Spark 1.3 (xhigh) (Meta) — 45.2 (2026-09-02) Gemini 3.8 Flash (high) (Google) — 41.2 (2026-09-02) Gemini 3.8 Flash (medium) (Google) — 40.0 (2026-09-02) Gemini 3.8 Flash (low) (Google) — 33.8 (2026-09-02) GPT-6 Astra (max) (OpenAI) — 52.8 (2026-09-03) GPT-6 Astra (xhigh) (OpenAI) — 52.5 (2026-09-03) GPT-6 Astra (high) (OpenAI) — 51.0 (2026-09-03) GPT-6 Astra (medium) (OpenAI) — 49.7 (2026-09-03) GPT-6 Astra (low) (OpenAI) — 46.0 (2026-09-03) K2 Horizon 375B A23B (MBZUAI Institute of Foundation Models) — 30.8 (2026-09-03) K2 Horizon MoVA 36B A4B (MBZUAI Institute of Foundation Models) — 25.7 (2026-09-03) K2 Horizon 7B (MBZUAI Institute of Foundation Models) — 21.0 (2026-09-03) K2 Horizon 3.7B (MBZUAI Institute of Foundation Models) — 16.2 (2026-09-03) K2 Horizon 0.9B (MBZUAI Institute of Foundation Models) — 3.0 (2026-09-03) MiniCPM5-2B (OpenBMB) — 13.1 (2026-09-07) DeepSeek V4.1 Flash (Reasoning, Max Effort) (DeepSeek) — 39.5 (2026-09-10) Ling-3.0-flash-VL (InclusionAI) — 24.8 (2026-09-10) Agnes 3.0 Flash (Sapiens AI) — 35.5 (2026-09-11) GPT-3.5 Turbo (OpenAI) — 5.5 (2022-11-30) GPT-4 (OpenAI) — 6.7 (2023-03-14) GPT-4 Turbo (OpenAI) — 7.0 (2023-11-06) Claude 3 Opus (Anthropic) — 8.7 (2024-03-04) o1-preview (OpenAI) — 11.4 (2024-09-12) o1 (OpenAI) — 15.2 (2024-12-05) Claude 3.7 Sonnet (Reasoning) (Anthropic) — 17.7 (2025-02-24) o3 (OpenAI) — 20.2 (2025-04-16) Claude 4 Opus (Reasoning) (Anthropic) — 20.6 (2025-05-22) o3-pro (OpenAI) — 21.9 (2025-06-10) Grok 4 (SpaceXAI) — 22.5 (2025-07-10) Claude 4.1 Opus (Reasoning) (Anthropic) — 22.8 (2025-08-05) GPT-5 (high) (OpenAI) — 23.0 (2025-08-07) GPT-5 Codex (high) (OpenAI) — 24.9 (2025-09-23) Gemini 3 Pro Preview (high) (Google) — 28.0 (2025-11-18) Claude Opus 4.5 (Reasoning) (Anthropic) — 29.1 (2025-11-24) GPT-5.2 (xhigh) (OpenAI) — 30.4 (2025-12-11) GPT-5.3 Codex (xhigh) (OpenAI) — 32.5 (2026-02-05) GPT-5.4 (xhigh) (OpenAI) — 39.0 (2026-03-05) Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Anthropic) — 40.7 (2026-04-16) Claude Opus 4.8 (Adaptive Reasoning, Max Effort) (Anthropic) — 42.0 (2026-05-28) Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (Anthropic) — 49.7 (2026-06-09) Claude Opus 5 (Adaptive Reasoning, Max Effort) (Anthropic) — 50.7 (2026-07-24) Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (Anthropic) — 53.4 (2026-09-01)
RankModel Index PaperCodeYear
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (Anthropic) 외부 53.4 artificialanalysis.ai 2026
2 Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (Anthropic) 외부 53.2 artificialanalysis.ai 2026
3 GPT-6 Astra (max) (OpenAI) 외부 52.8 artificialanalysis.ai 2026
4 GPT-6 Astra (xhigh) (OpenAI) 외부 52.5 artificialanalysis.ai 2026
5 Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) (Anthropic) 외부 51.2 artificialanalysis.ai 2026
6 GPT-6 Astra (high) (OpenAI) 외부 51 artificialanalysis.ai 2026
7 Claude Opus 5 (Adaptive Reasoning, Max Effort) (Anthropic) 외부 50.7 artificialanalysis.ai 2026
8 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (Anthropic) 외부 49.7 artificialanalysis.ai 2026
8 GPT-6 Astra (medium) (OpenAI) 외부 49.7 artificialanalysis.ai 2026
8 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) (Anthropic) 외부 49.7 artificialanalysis.ai 2026
1–10 / 641 다음 → 페이지당 10 20 50 100