paper-with-me

Language Modelling 벤치마크

Language Modelling on Artificial Analysis Intelligence Index

641개 결과 · ⬇ CSV · JSON

Index

3 15.6 28.2 40.8 53.4 2022-11 2026-09 GPT-3.5 Turbo (OpenAI) — 5.5 (2022-11-30) Llama 65B (Meta) — 5.0 (2023-02-24) GPT-4 (OpenAI) — 6.7 (2023-03-14) Claude Instant (Anthropic) — 5.0 (2023-03-14) PALM-2 (Google) — 5.4 (2023-05-10) Claude 2.0 (Anthropic) — 5.5 (2023-07-11) Llama 2 Chat 7B (Meta) — 5.7 (2023-07-18) Llama 2 Chat 70B (Meta) — 5.3 (2023-07-18) Llama 2 Chat 13B (Meta) — 5.3 (2023-07-18) Qwen Chat 14B (Alibaba) — 5.0 (2023-09-25) Mistral 7B Instruct (Mistral) — 5.0 (2023-09-27) GPT-4 Turbo (OpenAI) — 7.0 (2023-11-06) Claude 2.1 (Anthropic) — 5.6 (2023-11-21) DeepSeek LLM 67B Chat (V1) (DeepSeek) — 5.3 (2023-11-29) Qwen Chat 72B (Alibaba) — 5.4 (2023-11-30) Gemini 1.0 Ultra (Google) — 5.8 (2023-12-06) Gemini 1.0 Pro (Google) — 5.3 (2023-12-06) Mistral Medium (Mistral) — 5.5 (2023-12-11) Mixtral 8x7B Instruct (Mistral) — 5.1 (2023-12-11) OpenChat 3.5 (1210) (OpenChat) — 5.3 (2023-12-18) Solar Mini (Upstage) — 6.4 (2024-01-25) Phi-4 Mini Instruct (Microsoft) — 6.3 (2024-02-26) Mistral Large (Feb '24) (Mistral) — 5.8 (2024-02-26) Mistral Small (Feb '24) (Mistral) — 5.5 (2024-02-26) Claude 3 Opus (Anthropic) — 8.7 (2024-03-04) Claude 3 Sonnet (Anthropic) — 5.9 (2024-03-04) Claude 3 Haiku (Anthropic) — 5.6 (2024-03-04) Command-R (Mar '24) (Cohere) — 5.0 (2024-03-12) Grok-1 (SpaceXAI) — 6.3 (2024-03-17) DBRX Instruct (Databricks) — 5.3 (2024-03-27) Command-R+ (Apr '24) (Cohere) — 5.3 (2024-04-04) Mixtral 8x22B Instruct (Mistral) — 5.7 (2024-04-17) Llama 3 Instruct 70B (Meta) — 5.5 (2024-04-18) Llama 3 Instruct 8B (Meta) — 4.8 (2024-04-18) Phi-3 Mini Instruct 3.8B (Microsoft) — 5.8 (2024-04-23) Arctic Instruct (Snowflake) — 5.4 (2024-04-24) Qwen1.5 Chat 110B (Alibaba) — 5.7 (2024-04-25) DeepSeek-V2-Chat (DeepSeek) — 5.5 (2024-05-06) GPT-4o (May '24) (OpenAI) — 7.3 (2024-05-13) Gemini 1.5 Flash (May '24) (Google) — 5.9 (2024-05-14) Gemini 1.5 Pro (May '24) (Google) — 6.4 (2024-05-15) Qwen2 Instruct 72B (Alibaba) — 6.3 (2024-06-07) DeepSeek-Coder-V2 (DeepSeek) — 6.0 (2024-06-17) DeepSeek Coder V2 Lite Instruct (DeepSeek) — 5.3 (2024-06-17) Claude 3.5 Sonnet (June '24) (Anthropic) — 7.2 (2024-06-21) GPT-4o mini (OpenAI) — 6.7 (2024-07-18) Llama 3.1 Instruct 405B (Meta) — 7.3 (2024-07-23) Llama 3.1 Instruct 8B (Meta) — 6.9 (2024-07-23) Llama 3.1 Instruct 70B (Meta) — 6.6 (2024-07-23) Mistral Large 2 (Jul '24) (Mistral) — 6.8 (2024-07-24) GPT-4o (Aug '24) (OpenAI) — 7.7 (2024-08-06) Grok Beta (SpaceXAI) — 6.9 (2024-08-13) Hermes 3 - Llama-3.1 70B (Nous Research) — 6.0 (2024-08-15) Jamba 1.5 Large (AI21 Labs) — 6.0 (2024-08-22) Jamba 1.5 Mini (AI21 Labs) — 5.2 (2024-08-22) DeepSeek-V2.5 (DeepSeek) — 6.6 (2024-09-06) o1-preview (OpenAI) — 11.4 (2024-09-12) o1-mini (OpenAI) — 9.8 (2024-09-12) Mistral Small (Sep '24) (Mistral) — 5.8 (2024-09-17) Qwen2.5 Instruct 72B (Alibaba) — 7.7 (2024-09-19) Qwen2.5 Instruct 32B (Alibaba) — 6.9 (2024-09-19) Qwen2.5 Coder Instruct 7B (Alibaba) — 5.8 (2024-09-19) Gemini 1.5 Pro (Sep '24) (Google) — 7.9 (2024-09-24) Gemini 1.5 Flash (Sep '24) (Google) — 7.1 (2024-09-24) Llama 3.2 Instruct 90B (Vision) (Meta) — 6.4 (2024-09-25) Llama 3.2 Instruct 3B (Meta) — 5.7 (2024-09-25) Molmo 7B-D (Allen Institute for AI) — 5.6 (2024-09-25) Llama 3.2 Instruct 11B (Vision) (Meta) — 5.4 (2024-09-25) Llama 3.2 Instruct 1B (Meta) — 4.8 (2024-09-25) LFM 40B (Liquid AI) — 5.4 (2024-09-30) Gemini 1.5 Flash-8B (Google) — 6.2 (2024-10-03) Reka Flash (Sep '24) (Reka AI) — 6.4 (2024-10-04) Llama 3.1 Nemotron Instruct 70B (NVIDIA) — 6.9 (2024-10-15) Claude 3.5 Haiku (Anthropic) — 8.9 (2024-10-22) Claude 3.5 Sonnet (Oct '24) (Anthropic) — 7.9 (2024-10-22) Qwen2.5 Coder Instruct 32B (Alibaba) — 6.7 (2024-11-11) Mistral Large 2 (Nov '24) (Mistral) — 7.6 (2024-11-18) Pixtral Large (Mistral) — 7.1 (2024-11-18) Qwen2.5 Turbo (Alibaba) — 6.4 (2024-11-18) GPT-4o (Nov '24) (OpenAI) — 8.4 (2024-11-20) OLMo 2 7B (Allen Institute for AI) — 5.6 (2024-11-26) QwQ 32B-Preview (Alibaba) — 7.6 (2024-11-27) Nova Pro (Amazon) — 7.0 (2024-12-03) Nova Lite (Amazon) — 6.7 (2024-12-03) Nova Micro (Amazon) — 5.9 (2024-12-03) o1 (OpenAI) — 15.2 (2024-12-05) Llama 3.3 Instruct 70B (Meta) — 7.7 (2024-12-06) DeepSeek-V2.5 (Dec '24) (DeepSeek) — 6.6 (2024-12-10) Gemini 2.0 Flash (experimental) (Google) — 8.2 (2024-12-11) Grok 2 (Dec '24) (SpaceXAI) — 7.1 (2024-12-12) Phi-4 (Microsoft) — 5.9 (2024-12-12) Gemini 2.0 Flash Thinking Experimental (Dec '24) (Google) — 6.6 (2024-12-19) DeepSeek V3 (Dec '24) (DeepSeek) — 8.5 (2024-12-26) DeepSeek R1 (Jan '25) (DeepSeek) — 11.4 (2025-01-20) DeepSeek R1 Distill Qwen 32B (DeepSeek) — 8.4 (2025-01-20) DeepSeek R1 Distill Llama 70B (DeepSeek) — 7.9 (2025-01-20) DeepSeek R1 Distill Qwen 14B (DeepSeek) — 7.8 (2025-01-20) DeepSeek R1 Distill Llama 8B (DeepSeek) — 6.5 (2025-01-20) DeepSeek R1 Distill Qwen 1.5B (DeepSeek) — 5.5 (2025-01-20) Gemini 2.0 Flash Thinking Experimental (Jan '25) (Google) — 9.4 (2025-01-21) Sonar (Perplexity) — 7.7 (2025-01-21) Sonar Pro (Perplexity) — 7.6 (2025-01-21) Sonar Reasoning Pro (Perplexity) — 11.8 (2025-01-28) Sonar Reasoning (Perplexity) — 8.7 (2025-01-28) Qwen2.5 Max (Alibaba) — 8.0 (2025-01-28) Llama 3.1 Tulu3 405B (Allen Institute for AI) — 7.2 (2025-01-30) Mistral Small 3 (Mistral) — 6.7 (2025-01-30) o3-mini (OpenAI) — 12.5 (2025-01-31) o3-mini (high) (OpenAI) — 11.0 (2025-01-31) Gemini 2.0 Flash (Feb '25) (Google) — 8.9 (2025-02-05) Gemini 2.0 Pro Experimental (Feb '25) (Google) — 8.7 (2025-02-05) Gemini 2.0 Flash-Lite (Preview) (Google) — 7.3 (2025-02-05) DeepHermes 3 - Llama-3.1 8B Preview (Non-reasoning) (Nous Research) — 5.1 (2025-02-13) GPT-4o (ChatGPT) (OpenAI) — 7.2 (2025-02-15) Mistral Saba (Mistral) — 6.5 (2025-02-17) R1 1776 (Perplexity) — 6.4 (2025-02-18) Grok 3 mini Reasoning (high) (SpaceXAI) — 14.6 (2025-02-19) Grok 3 (SpaceXAI) — 12.1 (2025-02-19) Grok 3 Reasoning Beta (SpaceXAI) — 10.4 (2025-02-19) Claude 3.7 Sonnet (Reasoning) (Anthropic) — 17.7 (2025-02-24) Claude 3.7 Sonnet (Non-reasoning) (Anthropic) — 15.3 (2025-02-24) Gemini 2.0 Flash-Lite (Feb '25) (Google) — 7.4 (2025-02-25) Phi-4 Multimodal Instruct (Microsoft) — 5.8 (2025-02-26) GPT-4.5 (Preview) (OpenAI) — 9.6 (2025-02-27) QwQ 32B (Alibaba) — 9.5 (2025-03-05) Jamba 1.6 Large (AI21 Labs) — 6.0 (2025-03-06) Jamba 1.6 Mini (AI21 Labs) — 5.2 (2025-03-06) Reka Flash 3 (Reka AI) — 5.6 (2025-03-10) Gemma 3 27B Instruct (Google) — 4.9 (2025-03-12) Gemma 3 4B Instruct (Google) — 4.8 (2025-03-12) Gemma 3 12B Instruct (Google) — 3.8 (2025-03-12) Command A (Cohere) — 7.0 (2025-03-13) DeepHermes 3 - Mistral 24B Preview (Non-reasoning) (Nous Research) — 6.1 (2025-03-13) OLMo 2 32B (Allen Institute for AI) — 6.0 (2025-03-13) Gemma 3 1B Instruct (Google) — 4.8 (2025-03-13) Mistral Small 3.1 (Mistral) — 7.4 (2025-03-17) Llama 3.3 Nemotron Super 49B v1 (Reasoning) (NVIDIA) — 8.9 (2025-03-18) Llama 3.3 Nemotron Super 49B v1 (Non-reasoning) (NVIDIA) — 7.3 (2025-03-18) o1-pro (OpenAI) — 12.4 (2025-03-19) Gemini 2.5 Pro Preview (Mar' 25) (Google) — 15.0 (2025-03-25) DeepSeek V3 0324 (DeepSeek) — 9.7 (2025-03-25) GPT-4o (March 2025, chatgpt-4o-latest) (OpenAI) — 9.0 (2025-03-27) Llama 4 Maverick (Meta) — 9.3 (2025-04-05) Llama 4 Scout (Meta) — 6.5 (2025-04-05) Llama 3.1 Nemotron Ultra 253B v1 (Reasoning) (NVIDIA) — 7.5 (2025-04-07) GPT-4.1 (OpenAI) — 12.7 (2025-04-14) GPT-4.1 mini (OpenAI) — 10.2 (2025-04-14) GPT-4.1 nano (OpenAI) — 7.8 (2025-04-14) o3 (OpenAI) — 20.2 (2025-04-16) o4-mini (high) (OpenAI) — 16.7 (2025-04-16) Granite 3.3 8B (Non-reasoning) (IBM) — 4.9 (2025-04-16) Gemini 2.5 Flash Preview (Reasoning) (Google) — 11.7 (2025-04-17) Gemini 2.5 Flash Preview (Non-reasoning) (Google) — 8.7 (2025-04-17) Qwen3 235B A22B (Reasoning) (Alibaba) — 9.5 (2025-04-28) Qwen3 235B A22B (Non-reasoning) (Alibaba) — 8.3 (2025-04-28) Qwen3 30B A3B (Reasoning) (Alibaba) — 7.6 (2025-04-28) Qwen3 32B (Non-reasoning) (Alibaba) — 7.3 (2025-04-28) Qwen3 4B (Reasoning) (Alibaba) — 7.2 (2025-04-28) Qwen3 32B (Reasoning) (Alibaba) — 7.2 (2025-04-28) Qwen3 14B (Non-reasoning) (Alibaba) — 6.7 (2025-04-28) Qwen3 30B A3B (Non-reasoning) (Alibaba) — 6.6 (2025-04-28) Qwen3 4B (Non-reasoning) (Alibaba) — 6.6 (2025-04-28) Qwen3 14B (Reasoning) (Alibaba) — 6.4 (2025-04-28) Qwen3 8B (Non-reasoning) (Alibaba) — 6.0 (2025-04-28) Qwen3 1.7B (Reasoning) (Alibaba) — 5.2 (2025-04-28) Qwen3 8B (Reasoning) (Alibaba) — 5.2 (2025-04-28) Qwen3 1.7B (Non-reasoning) (Alibaba) — 4.9 (2025-04-28) Qwen3 0.6B (Non-reasoning) (Alibaba) — 4.8 (2025-04-28) Qwen3 0.6B (Reasoning) (Alibaba) — 4.8 (2025-04-28) Nova Premier (Amazon) — 9.2 (2025-04-30) Gemini 2.5 Pro Preview (May' 25) (Google) — 14.5 (2025-05-06) Mistral Medium 3 (Mistral) — 9.0 (2025-05-07) Gemini 2.5 Flash (Reasoning) (Google) — 13.1 (2025-05-20) Gemini 2.5 Flash (Non-reasoning) (Google) — 9.9 (2025-05-20) Solar Pro 2 (Preview) (Reasoning) (Upstage) — 9.1 (2025-05-20) Solar Pro 2 (Preview) (Non-reasoning) (Upstage) — 7.9 (2025-05-20) Llama 3.1 Nemotron Nano 4B v1.1 (Reasoning) (NVIDIA) — 7.3 (2025-05-20) Gemma 3n E4B Instruct Preview (May '25) (Google) — 5.8 (2025-05-20) Devstral Small (May '25) (Mistral) — 8.7 (2025-05-21) Claude 4 Opus (Reasoning) (Anthropic) — 20.6 (2025-05-22) Claude 4 Sonnet (Reasoning) (Anthropic) — 18.9 (2025-05-22) Claude 4 Opus (Non-reasoning) (Anthropic) — 16.6 (2025-05-22) Claude 4 Sonnet (Non-reasoning) (Anthropic) — 16.6 (2025-05-22) Sarvam M (Reasoning) (Sarvam) — 5.3 (2025-05-23) DeepSeek R1 0528 (May '25) (DeepSeek) — 13.1 (2025-05-28) DeepSeek R1 0528 Qwen3 8B (DeepSeek) — 8.1 (2025-05-29) Gemini 2.5 Pro (Google) — 16.7 (2025-06-05) o3-pro (OpenAI) — 21.9 (2025-06-10) Magistral Medium 1 (Mistral) — 9.1 (2025-06-10) Magistral Small 1 (Mistral) — 8.2 (2025-06-10) MiniMax M1 80k (MiniMax) — 11.7 (2025-06-17) MiniMax M1 40k (MiniMax) — 10.0 (2025-06-17) Gemini 2.5 Flash-Lite (Reasoning) (Google) — 8.5 (2025-06-17) Gemini 2.5 Flash-Lite (Non-reasoning) (Google) — 6.7 (2025-06-17) Mistral Small 3.2 (Mistral) — 7.0 (2025-06-20) Gemma 3n E2B Instruct (Google) — 4.8 (2025-06-26) Gemma 3n E4B Instruct (Google) — 4.8 (2025-06-26) ERNIE 4.5 300B A47B (Baidu) — 7.5 (2025-06-30) Jamba 1.7 Large (AI21 Labs) — 6.1 (2025-07-07) Jamba 1.7 Mini (AI21 Labs) — 5.2 (2025-07-07) Solar Pro 2 (Reasoning) (Upstage) — 7.5 (2025-07-09) Solar Pro 2 (Non-reasoning) (Upstage) — 7.0 (2025-07-09) Grok 4 (SpaceXAI) — 22.5 (2025-07-10) Devstral Medium (Mistral) — 9.0 (2025-07-10) Devstral Small (Jul '25) (Mistral) — 7.6 (2025-07-10) LFM2 1.2B (Liquid AI) — 4.8 (2025-07-10) Kimi K2 (Kimi) — 12.7 (2025-07-11) EXAONE 4.0 32B (Reasoning) (LG AI Research) — 8.2 (2025-07-15) EXAONE 4.0 32B (Non-reasoning) (LG AI Research) — 6.3 (2025-07-15) Exaone 4.0 1.2B (Reasoning) (LG AI Research) — 5.3 (2025-07-15) Exaone 4.0 1.2B (Non-reasoning) (LG AI Research) — 5.2 (2025-07-15) Qwen3 235B A22B 2507 Instruct (Alibaba) — 12.0 (2025-07-21) Qwen3 Coder 480B A35B Instruct (Alibaba) — 11.9 (2025-07-22) Qwen3 235B A22B 2507 (Reasoning) (Alibaba) — 12.7 (2025-07-25) Llama Nemotron Super 49B v1.5 (Reasoning) (NVIDIA) — 9.0 (2025-07-25) Llama Nemotron Super 49B v1.5 (Non-reasoning) (NVIDIA) — 7.4 (2025-07-25) GLM-4.5 (Reasoning) (Z AI) — 12.8 (2025-07-28) GLM-4.5-Air (Z AI) — 11.1 (2025-07-28) Qwen3 30B A3B 2507 Instruct (Alibaba) — 7.5 (2025-07-29) Qwen3 30B A3B 2507 (Reasoning) (Alibaba) — 9.8 (2025-07-30) Qwen3 Coder 30B A3B Instruct (Alibaba) — 9.6 (2025-07-31) Claude 4.1 Opus (Reasoning) (Anthropic) — 22.8 (2025-08-05) Claude 4.1 Opus (Non-reasoning) (Anthropic) — 18.6 (2025-08-05) gpt-oss-120b (high) (OpenAI) — 12.3 (2025-08-05) gpt-oss-120b (low) (OpenAI) — 10.2 (2025-08-05) gpt-oss-20b (low) (OpenAI) — 10.0 (2025-08-05) gpt-oss-20b (high) (OpenAI) — 9.0 (2025-08-05) Qwen3 4B 2507 (Reasoning) (Alibaba) — 8.8 (2025-08-06) Qwen3 4B 2507 Instruct (Alibaba) — 6.7 (2025-08-06) GPT-5 (high) (OpenAI) — 23.0 (2025-08-07) GPT-5 (medium) (OpenAI) — 22.9 (2025-08-07) GPT-5 (low) (OpenAI) — 20.8 (2025-08-07) GPT-5 mini (medium) (OpenAI) — 20.6 (2025-08-07) GPT-5 mini (high) (OpenAI) — 17.4 (2025-08-07) GPT-5 nano (high) (OpenAI) — 13.0 (2025-08-07) GPT-5 nano (medium) (OpenAI) — 12.5 (2025-08-07) GPT-5 (minimal) (OpenAI) — 11.4 (2025-08-07) GPT-5 (ChatGPT) (OpenAI) — 10.4 (2025-08-07) GPT-5 mini (minimal) (OpenAI) — 9.9 (2025-08-07) GPT-5 nano (minimal) (OpenAI) — 7.1 (2025-08-07) GLM-4.5V (Reasoning) (Z AI) — 7.6 (2025-08-11) GLM-4.5V (Non-reasoning) (Z AI) — 6.7 (2025-08-11) Mistral Medium 3.1 (Mistral) — 9.9 (2025-08-12) Gemma 3 270M (Google) — 5.1 (2025-08-14) NVIDIA Nemotron Nano 9B V2 (Reasoning) (NVIDIA) — 7.4 (2025-08-18) NVIDIA Nemotron Nano 9B V2 (Non-reasoning) (NVIDIA) — 6.8 (2025-08-18) Seed-OSS-36B-Instruct (ByteDance Seed) — 12.1 (2025-08-20) DeepSeek V3.1 (Non-reasoning) (DeepSeek) — 13.7 (2025-08-21) DeepSeek V3.1 (Reasoning) (DeepSeek) — 13.5 (2025-08-21) Hermes 4 - Llama-3.1 70B (Reasoning) (Nous Research) — 7.9 (2025-08-27) Hermes 4 - Llama-3.1 405B (Reasoning) (Nous Research) — 7.5 (2025-08-27) Hermes 4 - Llama-3.1 405B (Non-reasoning) (Nous Research) — 7.4 (2025-08-27) Hermes 4 - Llama-3.1 70B (Non-reasoning) (Nous Research) — 6.7 (2025-08-27) Grok Code Fast 1 (SpaceXAI) — 14.1 (2025-08-28) Apertus 70B Instruct (Swiss AI Initiative) — 5.1 (2025-09-02) Apertus 8B Instruct (Swiss AI Initiative) — 4.8 (2025-09-02) Kimi K2 0905 (Kimi) — 15.3 (2025-09-05) Qwen3 Max (Preview) (Alibaba) — 12.6 (2025-09-05) Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning) (Google) — 10.4 (2025-09-08) Ling-mini-2.0 (InclusionAI) — 5.5 (2025-09-09) Qwen3 Next 80B A3B (Reasoning) (Alibaba) — 11.2 (2025-09-11) Qwen3 Next 80B A3B Instruct (Alibaba) — 9.6 (2025-09-11) Magistral Small 1.2 (Mistral) — 8.6 (2025-09-17) Ling-flash-2.0 (InclusionAI) — 7.8 (2025-09-17) Magistral Medium 1.2 (Mistral) — 11.8 (2025-09-18) Grok 4 Fast (Reasoning) (SpaceXAI) — 17.9 (2025-09-19) Grok 4 Fast (Non-reasoning) (SpaceXAI) — 11.1 (2025-09-19) Ring-flash-2.0 (InclusionAI) — 7.2 (2025-09-19) DeepSeek V3.1 Terminus (Reasoning) (DeepSeek) — 15.4 (2025-09-22) DeepSeek V3.1 Terminus (Non-reasoning) (DeepSeek) — 13.9 (2025-09-22) Qwen3 Omni 30B A3B (Reasoning) (Alibaba) — 7.8 (2025-09-22) Granite 4.0 H Small (IBM) — 6.0 (2025-09-22) Qwen3 Omni 30B A3B Instruct (Alibaba) — 6.0 (2025-09-22) Granite 4.0 Micro (IBM) — 5.1 (2025-09-22) GPT-5 Codex (high) (OpenAI) — 24.9 (2025-09-23) Qwen3 Max (Alibaba) — 15.6 (2025-09-23) Qwen3 VL 235B A22B (Reasoning) (Alibaba) — 13.4 (2025-09-23) Qwen3 VL 235B A22B Instruct (Alibaba) — 9.9 (2025-09-23) LFM2 2.6B (Liquid AI) — 5.2 (2025-09-23) Gemini 2.5 Flash Preview (Sep '25) (Reasoning) (Google) — 15.5 (2025-09-25) Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning) (Google) — 12.4 (2025-09-25) Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning) (Google) — 9.3 (2025-09-25) Claude 4.5 Sonnet (Reasoning) (Anthropic) — 21.2 (2025-09-29) Claude 4.5 Sonnet (Non-reasoning) (Anthropic) — 19.3 (2025-09-29) DeepSeek V3.2 Exp (Reasoning) (DeepSeek) — 16.6 (2025-09-29) DeepSeek V3.2 Exp (Non-reasoning) (DeepSeek) — 13.9 (2025-09-29) GLM-4.6 (Reasoning) (Z AI) — 18.5 (2025-09-30) GLM-4.6 (Non-reasoning) (Z AI) — 14.9 (2025-09-30) Apriel-v1.5-15B-Thinker (ServiceNow) — 13.8 (2025-09-30) Qwen3 VL 30B A3B (Reasoning) (Alibaba) — 9.5 (2025-10-03) Qwen3 VL 30B A3B Instruct (Alibaba) — 7.9 (2025-10-03) LFM2 8B A1B (Liquid AI) — 4.9 (2025-10-07) Ling-1T (InclusionAI) — 9.2 (2025-10-08) Jamba Reasoning 3B (AI21 Labs) — 5.7 (2025-10-08) Ring-1T (InclusionAI) — 10.9 (2025-10-13) Qwen3 VL 8B (Reasoning) (Alibaba) — 8.2 (2025-10-14) Qwen3 VL 8B Instruct (Alibaba) — 7.3 (2025-10-14) Qwen3 VL 4B (Reasoning) (Alibaba) — 7.0 (2025-10-14) Qwen3 VL 4B Instruct (Alibaba) — 5.7 (2025-10-14) Claude 4.5 Haiku (Reasoning) (Anthropic) — 17.6 (2025-10-15) Claude 4.5 Haiku (Non-reasoning) (Anthropic) — 15.4 (2025-10-15) Qwen3 VL 32B (Reasoning) (Alibaba) — 11.9 (2025-10-21) Qwen3 VL 32B Instruct (Alibaba) — 8.4 (2025-10-21) MiniMax-M2 (MiniMax) — 18.6 (2025-10-26) NVIDIA Nemotron Nano 12B v2 VL (Reasoning) (NVIDIA) — 7.5 (2025-10-28) NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) (NVIDIA) — 5.8 (2025-10-28) Granite 4.0 H 1B (IBM) — 5.2 (2025-10-28) Granite 4.0 1B (IBM) — 5.0 (2025-10-28) Granite 4.0 350M (IBM) — 4.8 (2025-10-28) Granite 4.0 H 350M (IBM) — 4.8 (2025-10-28) Nova 2.0 Lite (high) (Amazon) — 13.4 (2025-10-29) Nova 2.0 Lite (medium) (Amazon) — 12.5 (2025-10-29) Nova 2.0 Lite (low) (Amazon) — 11.8 (2025-10-29) Nova 2.0 Lite (Non-reasoning) (Amazon) — 8.7 (2025-10-29) Kimi Linear 48B A3B Instruct (Kimi) — 7.3 (2025-10-30) Qwen3 Max Thinking (Preview) (Alibaba) — 16.3 (2025-11-03) Kimi K2 Thinking (Kimi) — 22.0 (2025-11-06) KAT-Coder-Pro V1 (KwaiKAT) — 18.6 (2025-11-11) Doubao Seed Code (ByteDance Seed) — 16.9 (2025-11-11) GPT-5.1 (high) (OpenAI) — 24.7 (2025-11-13) GPT-5.1 Codex (high) (OpenAI) — 23.7 (2025-11-13) GPT-5.1 Codex mini (high) (OpenAI) — 20.4 (2025-11-13) ERNIE 5.0 Thinking Preview (Baidu) — 14.3 (2025-11-13) GPT-5.1 (Non-reasoning) (OpenAI) — 13.3 (2025-11-13) Gemini 3 Pro Preview (high) (Google) — 28.0 (2025-11-18) Gemini 3 Pro Preview (low) (Google) — 22.3 (2025-11-18) Grok 4.1 Fast (Reasoning) (SpaceXAI) — 20.4 (2025-11-19) Grok 4.1 Fast (Non-reasoning) (SpaceXAI) — 11.3 (2025-11-19) Olmo 3 32B Think (Allen Institute for AI) — 6.5 (2025-11-20) Olmo 3 7B Think (Allen Institute for AI) — 5.6 (2025-11-20) Olmo 3 7B Instruct (Allen Institute for AI) — 5.2 (2025-11-20) Claude Opus 4.5 (Reasoning) (Anthropic) — 29.1 (2025-11-24) Claude Opus 4.5 (Non-reasoning) (Anthropic) — 23.7 (2025-11-24) Apriel-v1.6-15B-Thinker (ServiceNow) — 13.4 (2025-11-25) Nova 2.0 Omni (medium) (Amazon) — 13.6 (2025-11-26) Nova 2.0 Omni (low) (Amazon) — 11.1 (2025-11-26) Nova 2.0 Omni (Non-reasoning) (Amazon) — 8.2 (2025-11-26) Nova 2.0 Pro Preview (medium) (Amazon) — 14.2 (2025-11-27) Nova 2.0 Pro Preview (low) (Amazon) — 12.8 (2025-11-27) INTELLECT-3 (Prime Intellect) — 10.6 (2025-11-27) Nova 2.0 Pro Preview (Non-reasoning) (Amazon) — 10.0 (2025-11-27) DeepSeek V3.2 (Reasoning) (DeepSeek) — 21.5 (2025-12-01) DeepSeek V3.2 (Non-reasoning) (DeepSeek) — 16.0 (2025-12-01) DeepSeek V3.2 Speciale (DeepSeek) — 14.5 (2025-12-01) Mistral Large 3 (Mistral) — 9.7 (2025-12-02) Ministral 3 14B (Mistral) — 6.0 (2025-12-02) Ministral 3 8B (Mistral) — 5.5 (2025-12-02) Ministral 3 3B (Mistral) — 4.8 (2025-12-02) Motif-2-12.7B-Reasoning (Motif Technologies) — 9.2 (2025-12-04) K2-V2 (high) (MBZUAI Institute of Foundation Models) — 9.9 (2025-12-05) K2-V2 (medium) (MBZUAI Institute of Foundation Models) — 9.0 (2025-12-05) K2-V2 (low) (MBZUAI Institute of Foundation Models) — 7.3 (2025-12-05) GLM-4.6V (Reasoning) (Z AI) — 11.2 (2025-12-08) GLM-4.6V (Non-reasoning) (Z AI) — 8.4 (2025-12-08) Devstral 2 (Mistral) — 9.4 (2025-12-09) Devstral Small 2 (Mistral) — 8.4 (2025-12-09) GPT-5.2 (xhigh) (OpenAI) — 30.4 (2025-12-11) GPT-5.2 Codex (xhigh) (OpenAI) — 28.5 (2025-12-11) GPT-5.2 (medium) (OpenAI) — 26.5 (2025-12-11) GPT-5.2 (Non-reasoning) (OpenAI) — 17.0 (2025-12-11) Mi:dm K 2.5 Pro (Korea Telecom) — 11.0 (2025-12-11) Molmo2-8B (Allen Institute for AI) — 5.0 (2025-12-11) Olmo 3.1 32B Think (Allen Institute for AI) — 7.1 (2025-12-12) K2 Think V2 (MBZUAI Institute of Foundation Models) — 11.5 (2025-12-15) NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) (NVIDIA) — 8.9 (2025-12-15) NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) (NVIDIA) — 6.8 (2025-12-15) MiMo-V2-Flash (Feb 2026) (Xiaomi) — 22.4 (2025-12-16) MiMo-V2-Flash (Reasoning) (Xiaomi) — 20.8 (2025-12-16) MiMo-V2-Flash (Non-reasoning) (Xiaomi) — 16.0 (2025-12-16) Gemini 3 Flash Preview (Reasoning) (Google) — 26.3 (2025-12-17) Gemini 3 Flash Preview (Non-reasoning) (Google) — 17.9 (2025-12-17) Solar Open 100B (Reasoning) (Upstage) — 10.4 (2025-12-17) GLM-4.7 (Reasoning) (Z AI) — 22.2 (2025-12-22) GLM-4.7 (Non-reasoning) (Z AI) — 17.4 (2025-12-22) MiniMax-M2.1 (MiniMax) — 20.9 (2025-12-23) HyperCLOVA X SEED Think (32B) (Naver) — 11.4 (2025-12-26) K-EXAONE (Reasoning) (LG AI Research) — 14.4 (2025-12-31) K-EXAONE (Non-reasoning) (LG AI Research) — 11.2 (2025-12-31) Falcon-H1R-7B (TII UAE) — 7.8 (2026-01-04) LFM2.5-1.2B-Instruct (Liquid AI) — 5.2 (2026-01-05) LFM2.5-VL-1.6B (Liquid AI) — 4.8 (2026-01-05) Olmo 3.1 32B Instruct (Allen Institute for AI) — 6.5 (2026-01-13) GLM-4.7-Flash (Reasoning) (Z AI) — 14.9 (2026-01-19) GLM-4.7-Flash (Non-reasoning) (Z AI) — 10.6 (2026-01-19) Step3 VL 10B (StepFun) — 7.7 (2026-01-20) LFM2.5-1.2B-Thinking (Liquid AI) — 5.2 (2026-01-20) Qwen3 Max Thinking (Alibaba) — 21.3 (2026-01-26) Kimi K2.5 (Reasoning) (Kimi) — 23.5 (2026-01-27) Kimi K2.5 (Non-reasoning) (Kimi) — 19.4 (2026-01-27) LongCat Flash Lite (LongCat) — 11.5 (2026-01-28) Step 3.5 Flash (StepFun) — 16.6 (2026-02-02) Qwen3 Coder Next (Alibaba) — 10.1 (2026-02-03) GPT-5.3 Codex (xhigh) (OpenAI) — 32.5 (2026-02-05) Claude Opus 4.6 (Adaptive Reasoning, Max Effort) (Anthropic) — 31.9 (2026-02-05) Claude Opus 4.6 (Non-reasoning, High Effort) (Anthropic) — 26.4 (2026-02-05) Tri-21B-think Preview (Trillion Labs) — 9.6 (2026-02-10) Tri-21B-Think (Trillion Labs) — 9.0 (2026-02-10) GLM-5 (Reasoning) (Z AI) — 27.9 (2026-02-11) GLM-5 (Non-reasoning) (Z AI) — 21.8 (2026-02-11) Nanbeige4.1-3B (Nanbeige) — 8.4 (2026-02-11) MiniMax-M2.5 (MiniMax) — 22.8 (2026-02-12) Qwen3.5 397B A17B (Non-reasoning) (Alibaba) — 21.4 (2026-02-16) Qwen3.5 397B A17B (Reasoning) (Alibaba) — 19.1 (2026-02-16) Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) (Anthropic) — 30.5 (2026-02-17) Claude Sonnet 4.6 (Non-reasoning, High Effort) (Anthropic) — 24.7 (2026-02-17) Claude Sonnet 4.6 (Non-reasoning, Low Effort) (Anthropic) — 23.3 (2026-02-17) Tiny Aya Global (Cohere) — 4.8 (2026-02-17) Gemini 3.1 Pro Preview (Google) — 30.4 (2026-02-19) Mercury 2 (Inception) — 11.5 (2026-02-20) Qwen3.5 27B (Reasoning) (Alibaba) — 22.9 (2026-02-24) Qwen3.5 27B (Non-reasoning) (Alibaba) — 19.4 (2026-02-24) Qwen3.5 35B A3B (Reasoning) (Alibaba) — 19.3 (2026-02-24) Qwen3.5 122B A10B (Non-reasoning) (Alibaba) — 17.7 (2026-02-24) Qwen3.5 122B A10B (Reasoning) (Alibaba) — 16.2 (2026-02-24) Qwen3.5 35B A3B (Non-reasoning) (Alibaba) — 15.1 (2026-02-24) LFM2 24B A2B (Liquid AI) — 5.9 (2026-02-25) Qwen3.5 9B (Reasoning) (Alibaba) — 13.7 (2026-03-02) Qwen3.5 9B (Non-reasoning) (Alibaba) — 13.3 (2026-03-02) Qwen3.5 4B (Reasoning) (Alibaba) — 13.1 (2026-03-02) Qwen3.5 4B (Non-reasoning) (Alibaba) — 10.8 (2026-03-02) Qwen3.5 2B (Reasoning) (Alibaba) — 6.9 (2026-03-02) Qwen3.5 2B (Non-reasoning) (Alibaba) — 6.2 (2026-03-02) Qwen3.5 0.8B (Reasoning) (Alibaba) — 6.1 (2026-03-02) Qwen3.5 0.8B (Non-reasoning) (Alibaba) — 5.4 (2026-03-02) Gemini 3.1 Flash-Lite (Google) — 16.0 (2026-03-03) GPT-5.4 (xhigh) (OpenAI) — 39.0 (2026-03-05) GPT-5.4 (low) (OpenAI) — 27.6 (2026-03-05) GPT-5.4 (Non-reasoning) (OpenAI) — 18.2 (2026-03-05) Sarvam 105B (high) (Sarvam) — 8.8 (2026-03-06) Sarvam 30B (high) (Sarvam) — 6.6 (2026-03-06) Grok 4.20 0309 (Reasoning) (SpaceXAI) — 25.2 (2026-03-10) Grok 4.20 0309 (Non-reasoning) (SpaceXAI) — 14.6 (2026-03-10) Nemotron 3 Super 120B A12B (Reasoning) (NVIDIA) — 13.6 (2026-03-11) GLM-5-Turbo (Z AI) — 26.6 (2026-03-15) Mistral Small 4 (Reasoning) (Mistral) — 11.5 (2026-03-16) Mistral Small 4 (Non-reasoning) (Mistral) — 9.0 (2026-03-16) NVIDIA Nemotron 3 Nano 4B (NVIDIA) — 7.4 (2026-03-16) GPT-5.4 mini (xhigh) (OpenAI) — 24.6 (2026-03-17) GPT-5.4 nano (xhigh) (OpenAI) — 21.2 (2026-03-17) GPT-5.4 nano (medium) (OpenAI) — 20.0 (2026-03-17) GPT-5.4 mini (medium) (OpenAI) — 19.7 (2026-03-17) GPT-5.4 nano (Non-Reasoning) (OpenAI) — 11.7 (2026-03-17) GPT-5.4 mini (Non-Reasoning) (OpenAI) — 11.1 (2026-03-17) MiMo-V2-Pro (Xiaomi) — 28.6 (2026-03-18) MiniMax-M2.7 (MiniMax) — 23.2 (2026-03-18) MiMo-V2-Omni (Xiaomi) — 23.9 (2026-03-19) Nemotron Cascade 2 30B A3B (NVIDIA) — 11.7 (2026-03-19) MiMo-V2-Omni-0327 (Xiaomi) — 25.1 (2026-03-27) KAT Coder Pro V2 (KwaiKAT) — 21.7 (2026-03-27) Qwen3.5 Omni Plus (Alibaba) — 20.4 (2026-03-30) Qwen3.5 Omni Flash (Alibaba) — 12.5 (2026-03-30) GLM 5V Turbo (Reasoning) (Z AI) — 23.5 (2026-04-01) Trinity Large Thinking (Arcee AI) — 10.9 (2026-04-01) Qwen3.6 Plus (Alibaba) — 27.0 (2026-04-02) Step 3.5 Flash 2603 (StepFun) — 17.0 (2026-04-02) Gemma 4 26B A4B (Reasoning) (Google) — 16.7 (2026-04-02) Gemma 4 31B (Reasoning) (Google) — 15.4 (2026-04-02) Gemma 4 31B (Non-reasoning) (Google) — 13.9 (2026-04-02) Gemma 4 26B A4B (Non-reasoning) (Google) — 13.1 (2026-04-02) Gemma 4 E2B (Reasoning) (Google) — 7.8 (2026-04-02) Gemma 4 E2B (Non-reasoning) (Google) — 6.5 (2026-04-02) Gemma 4 E4B (Reasoning) (Google) — 8.9 (2026-04-03) Gemma 4 E4B (Non-reasoning) (Google) — 7.5 (2026-04-03) Solar Pro 3 (Upstage) — 7.8 (2026-04-06) GLM-5.1 (Reasoning) (Z AI) — 26.4 (2026-04-07) Grok 4.20 0309 v2 (Reasoning) (SpaceXAI) — 25.7 (2026-04-07) GLM-5.1 (Non-reasoning) (Z AI) — 24.2 (2026-04-07) Grok 4.20 0309 v2 (Non-reasoning) (SpaceXAI) — 14.2 (2026-04-07) Muse Spark (Meta) — 31.3 (2026-04-08) EXAONE 4.5 33B (LG AI Research) — 13.2 (2026-04-09) JT-MINI (China Mobile) — 12.2 (2026-04-15) Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Anthropic) — 40.7 (2026-04-16) Claude Opus 4.7 (Non-reasoning, High Effort) (Anthropic) — 30.9 (2026-04-16) Qwen3.6 35B A3B (Reasoning) (Alibaba) — 18.8 (2026-04-16) Qwen3.6 35B A3B (Non-reasoning) (Alibaba) — 15.2 (2026-04-16) Qwen3.6 Max Preview (Alibaba) — 28.4 (2026-04-20) Kimi K2.6 (Kimi) — 27.5 (2026-04-20) Kimi K2.6 (Non-reasoning) (Kimi) — 23.6 (2026-04-20) Ling 2.6 Flash (InclusionAI) — 9.7 (2026-04-21) MiMo-V2.5-Pro (Xiaomi) — 26.4 (2026-04-22) MiMo-V2.5 (Xiaomi) — 22.3 (2026-04-22) Qwen3.6 27B (Reasoning) (Alibaba) — 21.9 (2026-04-22) Qwen3.6 27B (Non-reasoning) (Alibaba) — 19.8 (2026-04-22) MiMo-V2.5-Pro (Non-reasoning) (Xiaomi) — 18.3 (2026-04-22) GPT-5.5 (xhigh) (OpenAI) — 38.6 (2026-04-23) GPT-5.5 (high) (OpenAI) — 37.3 (2026-04-23) GPT-5.5 (medium) (OpenAI) — 34.2 (2026-04-23) GPT-5.5 (low) (OpenAI) — 30.7 (2026-04-23) GPT-5.5 (Non-reasoning) (OpenAI) — 23.2 (2026-04-23) Hy3-preview (Reasoning) (Tencent) — 22.7 (2026-04-23) Hy3-preview (Non-reasoning) (Tencent) — 17.0 (2026-04-23) Ling-2.6-1T (InclusionAI) — 17.0 (2026-04-23) DeepSeek V4 Pro (Reasoning, Max Effort) (DeepSeek) — 30.9 (2026-04-24) DeepSeek V4 Pro (Reasoning, High Effort) (DeepSeek) — 30.1 (2026-04-24) DeepSeek V4 Flash (Reasoning, High Effort) (DeepSeek) — 24.8 (2026-04-24) DeepSeek V4 Flash (Reasoning, Max Effort) (DeepSeek) — 24.6 (2026-04-24) DeepSeek V4 Pro (Non-reasoning) (DeepSeek) — 20.8 (2026-04-24) DeepSeek V4 Flash (Non-reasoning) (DeepSeek) — 18.9 (2026-04-24) Mistral Medium 3.5 (Mistral) — 14.9 (2026-04-29) Nemotron 3 Nano Omni 30B A3B Reasoning (NVIDIA) — 10.3 (2026-04-29) Granite 4.1 30B (IBM) — 7.4 (2026-04-29) Granite 4.1 8B (IBM) — 6.6 (2026-04-29) Granite 4.1 3B (IBM) — 5.9 (2026-04-29) Grok 4.3 (high) (SpaceXAI) — 25.4 (2026-04-30) Grok 4.3 (medium) (SpaceXAI) — 24.8 (2026-04-30) Grok 4.3 (low) (SpaceXAI) — 24.3 (2026-04-30) Grok 4.3 (Non-reasoning) (SpaceXAI) — 14.5 (2026-04-30) GPT-5.5 Instant (May 2026) (OpenAI) — 22.7 (2026-05-05) Ring-2.6-1T (InclusionAI) — 17.3 (2026-05-08) MiniCPM-V 4.6 1.3B (OpenBMB) — 5.7 (2026-05-11) JT-35B-Flash (China Mobile) — 18.7 (2026-05-14) Gemini 3.5 Flash (medium) (Google) — 33.6 (2026-05-19) Gemini 3.5 Flash (high) (Google) — 33.0 (2026-05-19) Qwen3.7 Max (Alibaba) — 29.9 (2026-05-19) Gemini 3.5 Flash (minimal) (Google) — 23.8 (2026-05-19) Command A+ (Cohere) — 13.9 (2026-05-20) MiniCPM5-1B (Reasoning) (OpenBMB) — 8.8 (2026-05-25) MiniCPM5-1B (Non-reasoning) (OpenBMB) — 8.7 (2026-05-25) HyperNova 60B 2605 (high, based on gpt-oss-120b) (Multiverse Computing) — 11.7 (2026-05-26) Claude Opus 4.8 (Adaptive Reasoning, Max Effort) (Anthropic) — 42.0 (2026-05-28) LFM2.5-8B-A1B (Liquid AI) — 7.2 (2026-05-28) Step 3.7 Flash (StepFun) — 19.5 (2026-05-29) MiniMax-M3 (MiniMax) — 29.6 (2026-06-01) Qwen3.7 Plus (Alibaba) — 25.8 (2026-06-01) Nex-N2-Pro (Nex AGI) — 28.2 (2026-06-02) Gemma 4 12B (Reasoning) (Google) — 14.2 (2026-06-03) Gemma 4 12B (Non-reasoning) (Google) — 9.4 (2026-06-03) Nemotron 3 Ultra 550B A55B (Reasoning) (NVIDIA) — 23.4 (2026-06-04) Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (Anthropic) — 49.7 (2026-06-09) North Mini Code (Cohere) — 12.8 (2026-06-09) DiffusionGemma 26B A4B (Google) — 9.5 (2026-06-10) Kimi K2.7 Code (Kimi) — 26.3 (2026-06-12) GLM-5.2 (max) (Z AI) — 34.0 (2026-06-16) Grok Build 0.1 0616 (SpaceXAI) — 27.2 (2026-06-16) GLM-5.2 (Non-reasoning) (Z AI) — 22.4 (2026-06-16) GPT-5.5 Instant (June 2026) (OpenAI) — 26.8 (2026-06-25) LongCat 2.0 (LongCat) — 19.7 (2026-06-29) Claude Sonnet 5 (Adaptive Reasoning, Max Effort) (Anthropic) — 38.4 (2026-06-30) Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) (Anthropic) — 34.7 (2026-06-30) Claude Sonnet 5 (Adaptive Reasoning, High Effort) (Anthropic) — 32.0 (2026-06-30) Claude Sonnet 5 (Non-reasoning, High Effort) (Anthropic) — 28.9 (2026-06-30) Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) (Anthropic) — 28.4 (2026-06-30) Claude Sonnet 5 (Adaptive Reasoning, Low Effort) (Anthropic) — 24.7 (2026-06-30) Hy3 (Tencent) — 25.8 (2026-07-06) Grok 4.5 (high) (SpaceXAI) — 39.1 (2026-07-08) GPT-5.6 Sol (max) (OpenAI) — 47.1 (2026-07-09) GPT-5.6 Sol (xhigh) (OpenAI) — 44.1 (2026-07-09) GPT-5.6 Sol (high) (OpenAI) — 42.5 (2026-07-09) GPT-5.6 Terra (max) (OpenAI) — 42.3 (2026-07-09) GPT-5.6 Sol (medium) (OpenAI) — 39.5 (2026-07-09) GPT-5.6 Terra (xhigh) (OpenAI) — 38.2 (2026-07-09) GPT-5.6 Luna (max) (OpenAI) — 37.5 (2026-07-09) GPT-5.6 Luna (xhigh) (OpenAI) — 34.8 (2026-07-09) GPT-5.6 Terra (high) (OpenAI) — 34.5 (2026-07-09) Muse Spark 1.1 (xhigh) (Meta) — 34.3 (2026-07-09) GPT-5.6 Sol (low) (OpenAI) — 33.8 (2026-07-09) GPT-5.6 Luna (high) (OpenAI) — 32.4 (2026-07-09) GPT-5.6 Terra (medium) (OpenAI) — 30.4 (2026-07-09) GPT-5.6 Sol (Non-reasoning) (OpenAI) — 28.3 (2026-07-09) GPT-5.6 Terra (low) (OpenAI) — 27.9 (2026-07-09) JT-4.1 Flash 236B A21B (China Mobile) — 27.3 (2026-07-09) GPT-5.6 Luna (medium) (OpenAI) — 25.5 (2026-07-09) GPT-5.6 Terra (Non-reasoning) (OpenAI) — 22.3 (2026-07-09) GPT-5.6 Luna (low) (OpenAI) — 21.5 (2026-07-09) GPT-5.6 Luna (Non-reasoning) (OpenAI) — 16.8 (2026-07-09) Motif 3 (Beta) (Motif Technologies) — 32.3 (2026-07-14) Inkling (xhigh) (Thinking Machines) — 25.5 (2026-07-15) Kimi K3 (max) (Kimi) — 43.8 (2026-07-16) Kimi K3 (low) (Kimi) — 30.5 (2026-07-16) Gemini 3.6 Flash (high) (Google) — 34.3 (2026-07-21) Gemini 3.5 Flash-Lite (Google) — 22.7 (2026-07-21) G9v3-3B (AI9Stars) — 10.8 (2026-07-23) Claude Opus 5 (Adaptive Reasoning, Max Effort) (Anthropic) — 50.7 (2026-07-24) Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) (Anthropic) — 49.7 (2026-07-24) Claude Opus 5 (Adaptive Reasoning, High Effort) (Anthropic) — 48.2 (2026-07-24) Claude Opus 5 (Adaptive Reasoning, Medium Effort) (Anthropic) — 45.1 (2026-07-24) Claude Opus 5 (Adaptive Reasoning, Low Effort) (Anthropic) — 39.8 (2026-07-24) Agnes 2.5 Pro Alpha (Sapiens AI) — 27.8 (2026-07-24) Celeris-1 (Celeris) — 6.3 (2026-07-24) Inkling Small (Thinking Machines) — 26.1 (2026-07-30) DeepSeek V4 Flash 0731 (Reasoning, Max Effort) (DeepSeek) — 34.5 (2026-07-31) Qwen3.8 Max (Alibaba) — 40.3 (2026-08-03) Ling 3.0 Flash (InclusionAI) — 20.6 (2026-08-04) LFM2.5-2.6B (Liquid AI) — 8.4 (2026-08-04) Muse Spark 1.2 (xhigh) (Meta) — 39.8 (2026-08-05) Solar Pro 4 (Upstage) — 28.2 (2026-08-06) Ling 3.0 Tiny (InclusionAI) — 11.9 (2026-08-06) Quasar 438B (max, based on GLM-5.2) (Multiverse Computing) — 27.1 (2026-08-10) Muse Glimmer (high) (Meta) — 18.1 (2026-08-10) Nemotron 3.5 Lightning (NVIDIA) — 13.6 (2026-08-11) Grok 4.6 (high) (SpaceXAI) — 44.4 (2026-08-12) Grok 4.6 (xhigh) (SpaceXAI) — 44.3 (2026-08-12) Grok 4.6 (medium) (SpaceXAI) — 43.0 (2026-08-12) Qwen3.8 2.4T A95B (Alibaba) — 40.0 (2026-08-12) Grok 4.6 (low) (SpaceXAI) — 35.4 (2026-08-12) Motif 3 (Motif Technologies) — 33.6 (2026-08-12) Solar Open2 250B (Upstage) — 24.7 (2026-08-12) A.X-K2 (SK Telecom) — 22.7 (2026-08-12) K-EXAONE 2.0 (LG AI Research) — 19.7 (2026-08-12) Gemini 3.7 Flash (medium) (Google) — 39.6 (2026-08-13) Gemini 3.7 Flash (high) (Google) — 39.4 (2026-08-13) Gemini 3.7 Flash (low) (Google) — 36.9 (2026-08-13) DeepSeek V4 Pro 0813 (Reasoning, Max Effort) (DeepSeek) — 36.3 (2026-08-13) Qwen3.8 27B (xhigh) (Alibaba) — 33.9 (2026-08-14) Qwen3.8 27B (medium) (Alibaba) — 27.8 (2026-08-14) Qwen3.8 27B (low) (Alibaba) — 26.5 (2026-08-14) Qwen3.8 27B (Non-reasoning) (Alibaba) — 22.4 (2026-08-14) GLM-5.3 (max) (Z AI) — 44.9 (2026-08-18) G9v3-39A5B (AI9Stars) — 21.8 (2026-08-20) DeepSeek V4 Flash Vision (Reasoning, Max Effort) (DeepSeek) — 35.0 (2026-08-21) Granite 4.2 30B (IBM) — 14.8 (2026-08-25) Granite 4.2 8B (IBM) — 11.8 (2026-08-25) Granite 4.2 3B (IBM) — 9.1 (2026-08-25) GLM-5.3-Flash (Z AI) — 41.9 (2026-08-26) Qwen3.8-Flash-Next (Alibaba) — 39.9 (2026-08-26) Agnes 2.5 Pro Beta (Sapiens AI) — 35.2 (2026-08-26) Apodex 1.1 (Apodex) — 30.4 (2026-08-30) Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (Anthropic) — 53.4 (2026-09-01) Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (Anthropic) — 53.2 (2026-09-01) Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) (Anthropic) — 51.2 (2026-09-01) Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) (Anthropic) — 49.1 (2026-09-01) Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) (Anthropic) — 47.0 (2026-09-01) Muse Spark 1.3 (max) (Meta) — 48.2 (2026-09-02) Muse Spark 1.3 (xhigh) (Meta) — 45.2 (2026-09-02) Gemini 3.8 Flash (high) (Google) — 41.2 (2026-09-02) Gemini 3.8 Flash (medium) (Google) — 40.0 (2026-09-02) Gemini 3.8 Flash (low) (Google) — 33.8 (2026-09-02) GPT-6 Astra (max) (OpenAI) — 52.8 (2026-09-03) GPT-6 Astra (xhigh) (OpenAI) — 52.5 (2026-09-03) GPT-6 Astra (high) (OpenAI) — 51.0 (2026-09-03) GPT-6 Astra (medium) (OpenAI) — 49.7 (2026-09-03) GPT-6 Astra (low) (OpenAI) — 46.0 (2026-09-03) K2 Horizon 375B A23B (MBZUAI Institute of Foundation Models) — 30.8 (2026-09-03) K2 Horizon MoVA 36B A4B (MBZUAI Institute of Foundation Models) — 25.7 (2026-09-03) K2 Horizon 7B (MBZUAI Institute of Foundation Models) — 21.0 (2026-09-03) K2 Horizon 3.7B (MBZUAI Institute of Foundation Models) — 16.2 (2026-09-03) K2 Horizon 0.9B (MBZUAI Institute of Foundation Models) — 3.0 (2026-09-03) MiniCPM5-2B (OpenBMB) — 13.1 (2026-09-07) DeepSeek V4.1 Flash (Reasoning, Max Effort) (DeepSeek) — 39.5 (2026-09-10) Ling-3.0-flash-VL (InclusionAI) — 24.8 (2026-09-10) Agnes 3.0 Flash (Sapiens AI) — 35.5 (2026-09-11) GPT-3.5 Turbo (OpenAI) — 5.5 (2022-11-30) GPT-4 (OpenAI) — 6.7 (2023-03-14) GPT-4 Turbo (OpenAI) — 7.0 (2023-11-06) Claude 3 Opus (Anthropic) — 8.7 (2024-03-04) o1-preview (OpenAI) — 11.4 (2024-09-12) o1 (OpenAI) — 15.2 (2024-12-05) Claude 3.7 Sonnet (Reasoning) (Anthropic) — 17.7 (2025-02-24) o3 (OpenAI) — 20.2 (2025-04-16) Claude 4 Opus (Reasoning) (Anthropic) — 20.6 (2025-05-22) o3-pro (OpenAI) — 21.9 (2025-06-10) Grok 4 (SpaceXAI) — 22.5 (2025-07-10) Claude 4.1 Opus (Reasoning) (Anthropic) — 22.8 (2025-08-05) GPT-5 (high) (OpenAI) — 23.0 (2025-08-07) GPT-5 Codex (high) (OpenAI) — 24.9 (2025-09-23) Gemini 3 Pro Preview (high) (Google) — 28.0 (2025-11-18) Claude Opus 4.5 (Reasoning) (Anthropic) — 29.1 (2025-11-24) GPT-5.2 (xhigh) (OpenAI) — 30.4 (2025-12-11) GPT-5.3 Codex (xhigh) (OpenAI) — 32.5 (2026-02-05) GPT-5.4 (xhigh) (OpenAI) — 39.0 (2026-03-05) Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Anthropic) — 40.7 (2026-04-16) Claude Opus 4.8 (Adaptive Reasoning, Max Effort) (Anthropic) — 42.0 (2026-05-28) Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (Anthropic) — 49.7 (2026-06-09) Claude Opus 5 (Adaptive Reasoning, Max Effort) (Anthropic) — 50.7 (2026-07-24) Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (Anthropic) — 53.4 (2026-09-01)
RankModel Index PaperCodeYear
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (Anthropic) 외부 53.4 artificialanalysis.ai 2026
2 Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (Anthropic) 외부 53.2 artificialanalysis.ai 2026
3 GPT-6 Astra (max) (OpenAI) 외부 52.8 artificialanalysis.ai 2026
4 GPT-6 Astra (xhigh) (OpenAI) 외부 52.5 artificialanalysis.ai 2026
5 Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) (Anthropic) 외부 51.2 artificialanalysis.ai 2026
6 GPT-6 Astra (high) (OpenAI) 외부 51 artificialanalysis.ai 2026
7 Claude Opus 5 (Adaptive Reasoning, Max Effort) (Anthropic) 외부 50.7 artificialanalysis.ai 2026
8 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (Anthropic) 외부 49.7 artificialanalysis.ai 2026
8 GPT-6 Astra (medium) (OpenAI) 외부 49.7 artificialanalysis.ai 2026
8 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) (Anthropic) 외부 49.7 artificialanalysis.ai 2026
11 Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) (Anthropic) 외부 49.1 artificialanalysis.ai 2026
12 Claude Opus 5 (Adaptive Reasoning, High Effort) (Anthropic) 외부 48.2 artificialanalysis.ai 2026
12 Muse Spark 1.3 (max) (Meta) 외부 48.2 artificialanalysis.ai 2026
14 GPT-5.6 Sol (max) (OpenAI) 외부 47.1 artificialanalysis.ai 2026
15 Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) (Anthropic) 외부 47 artificialanalysis.ai 2026
16 GPT-6 Astra (low) (OpenAI) 외부 46 artificialanalysis.ai 2026
17 Muse Spark 1.3 (xhigh) (Meta) 외부 45.2 artificialanalysis.ai 2026
18 Claude Opus 5 (Adaptive Reasoning, Medium Effort) (Anthropic) 외부 45.1 artificialanalysis.ai 2026
19 GLM-5.3 (max) (Z AI) 외부 44.9 artificialanalysis.ai 2026
20 Grok 4.6 (high) (SpaceXAI) 외부 44.4 artificialanalysis.ai 2026
21 Grok 4.6 (xhigh) (SpaceXAI) 외부 44.3 artificialanalysis.ai 2026
22 GPT-5.6 Sol (xhigh) (OpenAI) 외부 44.1 artificialanalysis.ai 2026
23 Kimi K3 (max) (Kimi) 외부 43.8 artificialanalysis.ai 2026
24 Grok 4.6 (medium) (SpaceXAI) 외부 43 artificialanalysis.ai 2026
25 GPT-5.6 Sol (high) (OpenAI) 외부 42.5 artificialanalysis.ai 2026
26 GPT-5.6 Terra (max) (OpenAI) 외부 42.3 artificialanalysis.ai 2026
27 Claude Opus 4.8 (Adaptive Reasoning, Max Effort) (Anthropic) 외부 42 artificialanalysis.ai 2026
28 GLM-5.3-Flash (Z AI) 외부 41.9 artificialanalysis.ai 2026
29 Gemini 3.8 Flash (high) (Google) 외부 41.2 artificialanalysis.ai 2026
30 Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Anthropic) 외부 40.7 artificialanalysis.ai 2026
31 Qwen3.8 Max (Alibaba) 외부 40.3 artificialanalysis.ai 2026
32 Qwen3.8 2.4T A95B (Alibaba) 외부 40 artificialanalysis.ai 2026
32 Gemini 3.8 Flash (medium) (Google) 외부 40 artificialanalysis.ai 2026
34 Qwen3.8-Flash-Next (Alibaba) 외부 39.9 artificialanalysis.ai 2026
35 Muse Spark 1.2 (xhigh) (Meta) 외부 39.8 artificialanalysis.ai 2026
35 Claude Opus 5 (Adaptive Reasoning, Low Effort) (Anthropic) 외부 39.8 artificialanalysis.ai 2026
37 Gemini 3.7 Flash (medium) (Google) 외부 39.6 artificialanalysis.ai 2026
38 DeepSeek V4.1 Flash (Reasoning, Max Effort) (DeepSeek) 외부 39.5 artificialanalysis.ai 2026
38 GPT-5.6 Sol (medium) (OpenAI) 외부 39.5 artificialanalysis.ai 2026
40 Gemini 3.7 Flash (high) (Google) 외부 39.4 artificialanalysis.ai 2026
41 Grok 4.5 (high) (SpaceXAI) 외부 39.1 artificialanalysis.ai 2026
42 GPT-5.4 (xhigh) (OpenAI) 외부 39 artificialanalysis.ai 2026
43 GPT-5.5 (xhigh) (OpenAI) 외부 38.6 artificialanalysis.ai 2026
44 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) (Anthropic) 외부 38.4 artificialanalysis.ai 2026
45 GPT-5.6 Terra (xhigh) (OpenAI) 외부 38.2 artificialanalysis.ai 2026
46 GPT-5.6 Luna (max) (OpenAI) 외부 37.5 artificialanalysis.ai 2026
47 GPT-5.5 (high) (OpenAI) 외부 37.3 artificialanalysis.ai 2026
48 Gemini 3.7 Flash (low) (Google) 외부 36.9 artificialanalysis.ai 2026
49 DeepSeek V4 Pro 0813 (Reasoning, Max Effort) (DeepSeek) 외부 36.3 artificialanalysis.ai 2026
50 Agnes 3.0 Flash (Sapiens AI) 외부 35.5 artificialanalysis.ai 2026
1–50 / 641 다음 → 페이지당 10 20 50 100