paper-with-me

Language Modelling 벤치마크

Language Modelling on Artificial Analysis Coding Index

258개 결과 · ⬇ CSV · JSON

Index

0.7 20.92 41.15 61.38 81.6 2022-11 2026-09 GPT-3.5 Turbo (OpenAI) — 10.7 (2022-11-30) GPT-4 (OpenAI) — 13.1 (2023-03-14) Claude Instant (Anthropic) — 7.8 (2023-03-14) PALM-2 (Google) — 4.6 (2023-05-10) Claude 2.0 (Anthropic) — 12.9 (2023-07-11) GPT-4 Turbo (OpenAI) — 21.5 (2023-11-06) Claude 2.1 (Anthropic) — 14.0 (2023-11-21) Gemini 1.0 Ultra (Google) — 17.6 (2023-12-06) Phi-4 Mini Instruct (Microsoft) — 3.8 (2024-02-26) Claude 3 Opus (Anthropic) — 19.5 (2024-03-04) GPT-4o (May '24) (OpenAI) — 24.2 (2024-05-13) Gemini 1.5 Pro (May '24) (Google) — 19.8 (2024-05-15) Claude 3.5 Sonnet (June '24) (Anthropic) — 26.0 (2024-06-21) GPT-4o mini (OpenAI) — 11.4 (2024-07-18) Llama 3.1 Instruct 8B (Meta) — 5.4 (2024-07-23) o1-preview (OpenAI) — 34.0 (2024-09-12) Gemini 1.5 Pro (Sep '24) (Google) — 23.6 (2024-09-24) Claude 3.5 Sonnet (Oct '24) (Anthropic) — 30.2 (2024-10-22) Claude 3.5 Haiku (Anthropic) — 15.9 (2024-10-22) o1 (OpenAI) — 39.7 (2024-12-05) Llama 3.3 Instruct 70B (Meta) — 11.9 (2024-12-06) DeepSeek V3 (Dec '24) (DeepSeek) — 23.0 (2024-12-26) DeepSeek R1 (Jan '25) (DeepSeek) — 24.6 (2025-01-20) Gemini 2.0 Flash Thinking Experimental (Jan '25) (Google) — 24.1 (2025-01-21) o3-mini (high) (OpenAI) — 16.3 (2025-01-31) Gemini 2.0 Pro Experimental (Feb '25) (Google) — 25.5 (2025-02-05) Claude 3.7 Sonnet (Reasoning) (Anthropic) — 36.4 (2025-02-24) Gemma 3 27B Instruct (Google) — 10.1 (2025-03-12) Gemma 3 12B Instruct (Google) — 5.8 (2025-03-12) Gemma 3 4B Instruct (Google) — 2.7 (2025-03-12) Mistral Small 3.1 (Mistral) — 26.3 (2025-03-17) Gemini 2.5 Pro Preview (Mar' 25) (Google) — 46.7 (2025-03-25) DeepSeek V3 0324 (DeepSeek) — 21.2 (2025-03-25) Llama 4 Maverick (Meta) — 16.3 (2025-04-05) Llama 4 Scout (Meta) — 8.2 (2025-04-05) GPT-4.1 mini (OpenAI) — 20.2 (2025-04-14) GPT-4.1 nano (OpenAI) — 11.1 (2025-04-14) Qwen3 32B (Reasoning) (Alibaba) — 15.3 (2025-04-28) Qwen3 14B (Reasoning) (Alibaba) — 13.8 (2025-04-28) Qwen3 8B (Reasoning) (Alibaba) — 9.0 (2025-04-28) Claude 4 Sonnet (Reasoning) (Anthropic) — 37.6 (2025-05-22) Gemini 2.5 Pro (Google) — 33.3 (2025-06-05) Mistral Small 3.2 (Mistral) — 12.5 (2025-06-20) Gemma 3n E4B Instruct (Google) — 3.2 (2025-06-26) Qwen3 235B A22B 2507 (Reasoning) (Alibaba) — 22.1 (2025-07-25) Qwen3 30B A3B 2507 (Reasoning) (Alibaba) — 12.1 (2025-07-30) gpt-oss-120b (high) (OpenAI) — 30.4 (2025-08-05) gpt-oss-120b (low) (OpenAI) — 21.2 (2025-08-05) gpt-oss-20b (high) (OpenAI) — 20.7 (2025-08-05) GPT-5 (high) (OpenAI) — 37.8 (2025-08-07) GPT-5 mini (high) (OpenAI) — 15.6 (2025-08-07) Mistral Medium 3.1 (Mistral) — 20.5 (2025-08-12) Qwen3 Next 80B A3B (Reasoning) (Alibaba) — 17.4 (2025-09-11) Magistral Small 1.2 (Mistral) — 14.7 (2025-09-17) Magistral Medium 1.2 (Mistral) — 21.3 (2025-09-18) DeepSeek V3.1 Terminus (Reasoning) (DeepSeek) — 43.5 (2025-09-22) Claude 4.5 Sonnet (Reasoning) (Anthropic) — 52.1 (2025-09-29) GLM-4.6 (Reasoning) (Z AI) — 45.8 (2025-09-30) Claude 4.5 Haiku (Reasoning) (Anthropic) — 43.9 (2025-10-15) Nova 2.0 Lite (high) (Amazon) — 23.0 (2025-10-29) GPT-5.1 (high) (OpenAI) — 49.4 (2025-11-13) Nova 2.0 Pro Preview (medium) (Amazon) — 34.0 (2025-11-27) Nova 2.0 Pro Preview (low) (Amazon) — 25.9 (2025-11-27) Nova 2.0 Pro Preview (Non-reasoning) (Amazon) — 20.9 (2025-11-27) DeepSeek V3.2 (Reasoning) (DeepSeek) — 44.2 (2025-12-01) Mistral Large 3 (Mistral) — 20.1 (2025-12-02) Ministral 3 14B (Mistral) — 14.4 (2025-12-02) Ministral 3 8B (Mistral) — 9.7 (2025-12-02) Ministral 3 3B (Mistral) — 4.8 (2025-12-02) Devstral 2 (Mistral) — 31.3 (2025-12-09) Devstral Small 2 (Mistral) — 29.3 (2025-12-09) K2 Think V2 (MBZUAI Institute of Foundation Models) — 21.0 (2025-12-15) NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) (NVIDIA) — 14.4 (2025-12-15) MiMo-V2-Flash (Non-reasoning) (Xiaomi) — 49.8 (2025-12-16) GLM-4.7 (Reasoning) (Z AI) — 45.3 (2025-12-22) K-EXAONE (Reasoning) (LG AI Research) — 32.1 (2025-12-31) Kimi K2.5 (Reasoning) (Kimi) — 46.8 (2026-01-27) Qwen3 Coder Next (Alibaba) — 36.2 (2026-02-03) Nanbeige4.1-3B (Nanbeige) — 9.6 (2026-02-11) Qwen3.5 397B A17B (Reasoning) (Alibaba) — 48.2 (2026-02-16) Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) (Anthropic) — 63.0 (2026-02-17) Gemini 3.1 Pro Preview (Google) — 68.8 (2026-02-19) Mercury 2 (Inception) — 31.1 (2026-02-20) Qwen3.5 122B A10B (Reasoning) (Alibaba) — 45.7 (2026-02-24) Qwen3.5 122B A10B (Non-reasoning) (Alibaba) — 43.3 (2026-02-24) Qwen3.5 35B A3B (Non-reasoning) (Alibaba) — 37.0 (2026-02-24) Qwen3.5 9B (Reasoning) (Alibaba) — 28.7 (2026-03-02) Qwen3.5 9B (Non-reasoning) (Alibaba) — 23.5 (2026-03-02) Qwen3.5 4B (Reasoning) (Alibaba) — 22.6 (2026-03-02) Qwen3.5 4B (Non-reasoning) (Alibaba) — 20.3 (2026-03-02) Qwen3.5 2B (Reasoning) (Alibaba) — 2.9 (2026-03-02) Qwen3.5 2B (Non-reasoning) (Alibaba) — 2.4 (2026-03-02) Qwen3.5 0.8B (Non-reasoning) (Alibaba) — 1.2 (2026-03-02) Gemini 3.1 Flash-Lite (Google) — 34.7 (2026-03-03) GPT-5.4 (xhigh) (OpenAI) — 71.1 (2026-03-05) Nemotron 3 Super 120B A12B (Reasoning) (NVIDIA) — 37.7 (2026-03-11) Mistral Small 4 (Reasoning) (Mistral) — 26.6 (2026-03-16) NVIDIA Nemotron 3 Nano 4B (NVIDIA) — 8.0 (2026-03-16) GPT-5.4 mini (xhigh) (OpenAI) — 56.1 (2026-03-17) GPT-5.4 nano (xhigh) (OpenAI) — 56.1 (2026-03-17) MiniMax-M2.7 (MiniMax) — 52.6 (2026-03-18) Nemotron Cascade 2 30B A3B (NVIDIA) — 25.3 (2026-03-19) KAT Coder Pro V2 (KwaiKAT) — 59.5 (2026-03-27) Trinity Large Thinking (Arcee AI) — 25.8 (2026-04-01) Qwen3.6 Plus (Alibaba) — 54.5 (2026-04-02) Gemma 4 31B (Reasoning) (Google) — 43.4 (2026-04-02) Gemma 4 26B A4B (Reasoning) (Google) — 39.3 (2026-04-02) Gemma 4 31B (Non-reasoning) (Google) — 33.2 (2026-04-02) Gemma 4 E2B (Reasoning) (Google) — 7.2 (2026-04-02) Gemma 4 E4B (Reasoning) (Google) — 9.4 (2026-04-03) Solar Pro 3 (Upstage) — 16.2 (2026-04-06) GLM-5.1 (Reasoning) (Z AI) — 55.8 (2026-04-07) Muse Spark (Meta) — 58.6 (2026-04-08) EXAONE 4.5 33B (LG AI Research) — 23.6 (2026-04-09) Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Anthropic) — 73.6 (2026-04-16) Qwen3.6 35B A3B (Reasoning) (Alibaba) — 41.9 (2026-04-16) Qwen3.6 35B A3B (Non-reasoning) (Alibaba) — 28.1 (2026-04-16) Kimi K2.6 (Kimi) — 61.8 (2026-04-20) Ling 2.6 Flash (InclusionAI) — 25.3 (2026-04-21) MiMo-V2.5-Pro (Xiaomi) — 60.2 (2026-04-22) MiMo-V2.5 (Xiaomi) — 56.8 (2026-04-22) Qwen3.6 27B (Reasoning) (Alibaba) — 53.7 (2026-04-22) Qwen3.6 27B (Non-reasoning) (Alibaba) — 46.6 (2026-04-22) GPT-5.5 (xhigh) (OpenAI) — 74.9 (2026-04-23) GPT-5.5 (high) (OpenAI) — 71.6 (2026-04-23) GPT-5.5 (medium) (OpenAI) — 71.5 (2026-04-23) GPT-5.5 (low) (OpenAI) — 60.9 (2026-04-23) GPT-5.5 (Non-reasoning) (OpenAI) — 56.5 (2026-04-23) DeepSeek V4 Pro (Reasoning, Max Effort) (DeepSeek) — 59.4 (2026-04-24) DeepSeek V4 Pro (Reasoning, High Effort) (DeepSeek) — 58.7 (2026-04-24) DeepSeek V4 Flash (Reasoning, Max Effort) (DeepSeek) — 56.2 (2026-04-24) DeepSeek V4 Flash (Reasoning, High Effort) (DeepSeek) — 52.0 (2026-04-24) Mistral Medium 3.5 (Mistral) — 46.9 (2026-04-29) Nemotron 3 Nano Omni 30B A3B Reasoning (NVIDIA) — 13.8 (2026-04-29) Granite 4.1 30B (IBM) — 10.4 (2026-04-29) Granite 4.1 8B (IBM) — 9.5 (2026-04-29) Granite 4.1 3B (IBM) — 4.7 (2026-04-29) Grok 4.3 (high) (SpaceXAI) — 42.2 (2026-04-30) Grok 4.3 (Non-reasoning) (SpaceXAI) — 35.2 (2026-04-30) Ring-2.6-1T (InclusionAI) — 42.8 (2026-05-08) MiniCPM-V 4.6 1.3B (OpenBMB) — 0.7 (2026-05-11) Gemini 3.5 Flash (high) (Google) — 70.1 (2026-05-19) Qwen3.7 Max (Alibaba) — 66.0 (2026-05-19) Command A+ (Cohere) — 27.8 (2026-05-20) HyperNova 60B 2605 (high, based on gpt-oss-120b) (Multiverse Computing) — 23.2 (2026-05-26) Claude Opus 4.8 (Adaptive Reasoning, Max Effort) (Anthropic) — 74.3 (2026-05-28) Step 3.7 Flash (StepFun) — 39.6 (2026-05-29) MiniMax-M3 (MiniMax) — 58.6 (2026-06-01) Qwen3.7 Plus (Alibaba) — 55.9 (2026-06-01) Nex-N2-Pro (Nex AGI) — 59.1 (2026-06-02) Gemma 4 12B (Reasoning) (Google) — 31.0 (2026-06-03) Nemotron 3 Ultra 550B A55B (Reasoning) (NVIDIA) — 49.3 (2026-06-04) Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (Anthropic) — 76.5 (2026-06-09) North Mini Code (Cohere) — 36.5 (2026-06-09) DiffusionGemma 26B A4B (Google) — 19.7 (2026-06-10) Kimi K2.7 Code (Kimi) — 60.8 (2026-06-12) GLM-5.2 (max) (Z AI) — 68.8 (2026-06-16) Grok Build 0.1 0616 (SpaceXAI) — 51.5 (2026-06-16) GLM-5.2 (Non-reasoning) (Z AI) — 46.5 (2026-06-16) GPT-5.5 Instant (June 2026) (OpenAI) — 39.4 (2026-06-25) LongCat 2.0 (LongCat) — 45.3 (2026-06-29) Claude Sonnet 5 (Adaptive Reasoning, Max Effort) (Anthropic) — 71.5 (2026-06-30) Claude Sonnet 5 (Non-reasoning, High Effort) (Anthropic) — 66.4 (2026-06-30) Hy3 (Tencent) — 58.8 (2026-07-06) Grok 4.5 (high) (SpaceXAI) — 72.4 (2026-07-08) GPT-5.6 Sol (xhigh) (OpenAI) — 78.3 (2026-07-09) GPT-5.6 Sol (max) (OpenAI) — 77.4 (2026-07-09) GPT-5.6 Sol (high) (OpenAI) — 77.2 (2026-07-09) GPT-5.6 Terra (max) (OpenAI) — 76.7 (2026-07-09) GPT-5.6 Sol (medium) (OpenAI) — 76.3 (2026-07-09) GPT-5.6 Luna (max) (OpenAI) — 71.4 (2026-07-09) Muse Spark 1.1 (xhigh) (Meta) — 71.3 (2026-07-09) GPT-5.6 Terra (xhigh) (OpenAI) — 70.6 (2026-07-09) GPT-5.6 Sol (low) (OpenAI) — 69.7 (2026-07-09) GPT-5.6 Luna (xhigh) (OpenAI) — 68.6 (2026-07-09) GPT-5.6 Terra (high) (OpenAI) — 67.1 (2026-07-09) GPT-5.6 Sol (Non-reasoning) (OpenAI) — 65.1 (2026-07-09) GPT-5.6 Terra (medium) (OpenAI) — 64.7 (2026-07-09) GPT-5.6 Luna (high) (OpenAI) — 63.3 (2026-07-09) GPT-5.6 Terra (low) (OpenAI) — 58.1 (2026-07-09) JT-4.1 Flash 236B A21B (China Mobile) — 52.4 (2026-07-09) GPT-5.6 Terra (Non-reasoning) (OpenAI) — 52.3 (2026-07-09) GPT-5.6 Luna (medium) (OpenAI) — 50.7 (2026-07-09) GPT-5.6 Luna (low) (OpenAI) — 44.2 (2026-07-09) GPT-5.6 Luna (Non-reasoning) (OpenAI) — 39.3 (2026-07-09) Motif 3 (Beta) (Motif Technologies) — 62.0 (2026-07-14) Inkling (xhigh) (Thinking Machines) — 52.1 (2026-07-15) Kimi K3 (max) (Kimi) — 76.2 (2026-07-16) Kimi K3 (low) (Kimi) — 72.0 (2026-07-16) Gemini 3.6 Flash (high) (Google) — 69.2 (2026-07-21) Gemini 3.5 Flash-Lite (Google) — 49.3 (2026-07-21) G9v3-3B (AI9Stars) — 9.9 (2026-07-23) Claude Opus 5 (Adaptive Reasoning, Max Effort) (Anthropic) — 78.0 (2026-07-24) Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) (Anthropic) — 77.0 (2026-07-24) Claude Opus 5 (Adaptive Reasoning, High Effort) (Anthropic) — 76.5 (2026-07-24) Claude Opus 5 (Adaptive Reasoning, Medium Effort) (Anthropic) — 74.3 (2026-07-24) Claude Opus 5 (Adaptive Reasoning, Low Effort) (Anthropic) — 66.9 (2026-07-24) Agnes 2.5 Pro Alpha (Sapiens AI) — 58.8 (2026-07-24) Celeris-1 (Celeris) — 14.4 (2026-07-24) Inkling Small (Thinking Machines) — 52.9 (2026-07-30) DeepSeek V4 Flash 0731 (Reasoning, Max Effort) (DeepSeek) — 69.1 (2026-07-31) Qwen3.8 Max (Alibaba) — 71.8 (2026-08-03) Ling 3.0 Flash (InclusionAI) — 50.6 (2026-08-04) LFM2.5-2.6B (Liquid AI) — 7.7 (2026-08-04) Muse Spark 1.2 (xhigh) (Meta) — 72.2 (2026-08-05) Solar Pro 4 (Upstage) — 52.7 (2026-08-06) Ling 3.0 Tiny (InclusionAI) — 26.5 (2026-08-06) Quasar 438B (max, based on GLM-5.2) (Multiverse Computing) — 61.2 (2026-08-10) Muse Glimmer (high) (Meta) — 49.0 (2026-08-10) Nemotron 3.5 Lightning (NVIDIA) — 26.8 (2026-08-11) Grok 4.6 (high) (SpaceXAI) — 76.8 (2026-08-12) Grok 4.6 (xhigh) (SpaceXAI) — 75.9 (2026-08-12) Grok 4.6 (medium) (SpaceXAI) — 74.4 (2026-08-12) Qwen3.8 2.4T A95B (Alibaba) — 71.9 (2026-08-12) Grok 4.6 (low) (SpaceXAI) — 66.3 (2026-08-12) Motif 3 (Motif Technologies) — 63.5 (2026-08-12) Solar Open2 250B (Upstage) — 45.0 (2026-08-12) K-EXAONE 2.0 (LG AI Research) — 40.6 (2026-08-12) A.X-K2 (SK Telecom) — 38.8 (2026-08-12) Gemini 3.7 Flash (high) (Google) — 76.1 (2026-08-13) Gemini 3.7 Flash (medium) (Google) — 71.5 (2026-08-13) Gemini 3.7 Flash (low) (Google) — 71.0 (2026-08-13) DeepSeek V4 Pro 0813 (Reasoning, Max Effort) (DeepSeek) — 68.8 (2026-08-13) Qwen3.8 27B (xhigh) (Alibaba) — 68.1 (2026-08-14) Qwen3.8 27B (low) (Alibaba) — 58.2 (2026-08-14) Qwen3.8 27B (medium) (Alibaba) — 56.1 (2026-08-14) Qwen3.8 27B (Non-reasoning) (Alibaba) — 44.6 (2026-08-14) GLM-5.3 (max) (Z AI) — 74.8 (2026-08-18) G9v3-39A5B (AI9Stars) — 33.1 (2026-08-20) DeepSeek V4 Flash Vision (Reasoning, Max Effort) (DeepSeek) — 65.0 (2026-08-21) Granite 4.2 30B (IBM) — 29.9 (2026-08-25) Granite 4.2 8B (IBM) — 22.4 (2026-08-25) Granite 4.2 3B (IBM) — 17.5 (2026-08-25) Qwen3.8-Flash-Next (Alibaba) — 73.1 (2026-08-26) GLM-5.3-Flash (Z AI) — 71.5 (2026-08-26) Agnes 2.5 Pro Beta (Sapiens AI) — 62.3 (2026-08-26) Apodex 1.1 (Apodex) — 60.8 (2026-08-30) Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (Anthropic) — 81.6 (2026-09-01) Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (Anthropic) — 80.7 (2026-09-01) Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) (Anthropic) — 79.1 (2026-09-01) Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) (Anthropic) — 77.1 (2026-09-01) Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) (Anthropic) — 75.2 (2026-09-01) Muse Spark 1.3 (xhigh) (Meta) — 76.5 (2026-09-02) Gemini 3.8 Flash (high) (Google) — 76.3 (2026-09-02) Muse Spark 1.3 (max) (Meta) — 75.8 (2026-09-02) Gemini 3.8 Flash (medium) (Google) — 74.1 (2026-09-02) Gemini 3.8 Flash (low) (Google) — 73.5 (2026-09-02) GPT-6 Astra (high) (OpenAI) — 77.1 (2026-09-03) GPT-6 Astra (max) (OpenAI) — 76.9 (2026-09-03) GPT-6 Astra (medium) (OpenAI) — 76.7 (2026-09-03) GPT-6 Astra (xhigh) (OpenAI) — 75.9 (2026-09-03) GPT-6 Astra (low) (OpenAI) — 75.7 (2026-09-03) K2 Horizon 375B A23B (MBZUAI Institute of Foundation Models) — 61.5 (2026-09-03) K2 Horizon 7B (MBZUAI Institute of Foundation Models) — 38.6 (2026-09-03) K2 Horizon 3.7B (MBZUAI Institute of Foundation Models) — 26.1 (2026-09-03) K2 Horizon 0.9B (MBZUAI Institute of Foundation Models) — 3.4 (2026-09-03) MiniCPM5-2B (OpenBMB) — 14.5 (2026-09-07) Ling-3.0-flash-VL (InclusionAI) — 57.0 (2026-09-10) GPT-3.5 Turbo (OpenAI) — 10.7 (2022-11-30) GPT-4 (OpenAI) — 13.1 (2023-03-14) GPT-4 Turbo (OpenAI) — 21.5 (2023-11-06) GPT-4o (May '24) (OpenAI) — 24.2 (2024-05-13) Claude 3.5 Sonnet (June '24) (Anthropic) — 26.0 (2024-06-21) o1-preview (OpenAI) — 34.0 (2024-09-12) o1 (OpenAI) — 39.7 (2024-12-05) Gemini 2.5 Pro Preview (Mar' 25) (Google) — 46.7 (2025-03-25) Claude 4.5 Sonnet (Reasoning) (Anthropic) — 52.1 (2025-09-29) Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) (Anthropic) — 63.0 (2026-02-17) Gemini 3.1 Pro Preview (Google) — 68.8 (2026-02-19) GPT-5.4 (xhigh) (OpenAI) — 71.1 (2026-03-05) Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Anthropic) — 73.6 (2026-04-16) GPT-5.5 (xhigh) (OpenAI) — 74.9 (2026-04-23) Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (Anthropic) — 76.5 (2026-06-09) GPT-5.6 Sol (xhigh) (OpenAI) — 78.3 (2026-07-09) Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (Anthropic) — 81.6 (2026-09-01)
RankModel Index PaperCodeYear
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (Anthropic) 외부 81.6 artificialanalysis.ai 2026
2 Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (Anthropic) 외부 80.7 artificialanalysis.ai 2026
3 Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) (Anthropic) 외부 79.1 artificialanalysis.ai 2026
4 GPT-5.6 Sol (xhigh) (OpenAI) 외부 78.3 artificialanalysis.ai 2026
5 Claude Opus 5 (Adaptive Reasoning, Max Effort) (Anthropic) 외부 78 artificialanalysis.ai 2026
6 GPT-5.6 Sol (max) (OpenAI) 외부 77.4 artificialanalysis.ai 2026
7 GPT-5.6 Sol (high) (OpenAI) 외부 77.2 artificialanalysis.ai 2026
8 GPT-6 Astra (high) (OpenAI) 외부 77.1 artificialanalysis.ai 2026
8 Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) (Anthropic) 외부 77.1 artificialanalysis.ai 2026
10 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) (Anthropic) 외부 77 artificialanalysis.ai 2026
11 GPT-6 Astra (max) (OpenAI) 외부 76.9 artificialanalysis.ai 2026
12 Grok 4.6 (high) (SpaceXAI) 외부 76.8 artificialanalysis.ai 2026
13 GPT-6 Astra (medium) (OpenAI) 외부 76.7 artificialanalysis.ai 2026
13 GPT-5.6 Terra (max) (OpenAI) 외부 76.7 artificialanalysis.ai 2026
15 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (Anthropic) 외부 76.5 artificialanalysis.ai 2026
15 Claude Opus 5 (Adaptive Reasoning, High Effort) (Anthropic) 외부 76.5 artificialanalysis.ai 2026
15 Muse Spark 1.3 (xhigh) (Meta) 외부 76.5 artificialanalysis.ai 2026
18 Gemini 3.8 Flash (high) (Google) 외부 76.3 artificialanalysis.ai 2026
18 GPT-5.6 Sol (medium) (OpenAI) 외부 76.3 artificialanalysis.ai 2026
20 Kimi K3 (max) (Kimi) 외부 76.2 artificialanalysis.ai 2026
1–20 / 258 다음 → 페이지당 10 20 50 100