Live Benchmark Intelligence|Q3 2026

AI Model Leaderboard & Empirical Comparisons

Independent, verifiable rankings of GPT, Claude, Gemini, Llama, DeepSeek, and 45+ multi-modality AI models. Evaluated continuously by Composite TrueSkill, coding benchmarks, output speed, and live API pricing.

45+ Evaluated Models6 AI Modalities100% Verified Specs
Head-to-Head AI Benchmarking & Pareto Analysis
LIVE BENCHMARK EVALQ3 2026
Leads reasoning
GPT-5.6 Sol
94.6% GPQA
Wins at coding
Claude Opus 5.1
2,710 Arena ELO
Cheapest Top 10
DeepSeek-V4 Pro
$0.48 / M tok
Fastest agentic output
Gemini 3.8 Flash
348-620 tok/s
Longest context
Grok 4.6
2.0M Tokens
Best open-weights
Kimi K3
93.5% GPQA

Best AI for Coding

Code generation, debugging & refactoring

Best AI for Writing

Prose, tone matching & creative content

Best AI for Research

Analysis, synthesis & deep logical tasks

Best Image Generation

Text-to-image diffusion & editing

Efficiency Index

Price vs Performance (Pareto Frontier)

Blended token cost (8:1 input/output ratio) plotted against TrueSkill score. Models on the green line are Pareto-efficient.

PARETO EFFICIENT (HIGH ROI)
ChatGPT Astra (GPT-6 Astra) logo
ChatGPT Astra (GPT-6 Astra) ($20/M • 63.5)
Gemini 3.8 Flash logo
Gemini 3.8 Flash ($1.12/M • 56.5)
Claude Opus 5.1 logo
Claude Opus 5.1 ($15/M • 57.2)
Claude Fable 5.1 logo
Claude Fable 5.1 ($12/M • 56)
Muse Spark 1.3 logo
Muse Spark 1.3 ($1.58/M • 54.5)
GPT-5.6 Sol logo
GPT-5.6 Sol ($7.78/M • 56.8)
Claude Opus 5 logo
Claude Opus 5 ($7.22/M • 55.3)
Claude Fable 5 logo
Claude Fable 5 ($14.4/M • 53.5)
Kimi K3 logo
Kimi K3 ($4.33/M • 53.9)
GLM-5.3 logo
GLM-5.3 ($1.73/M • 54.9)
DeepSeek-V4-Pro-0813 logo
DeepSeek-V4-Pro-0813 ($0.48/M • 52)
Qwen3.8 Max logo
Qwen3.8 Max ($0.85/M • 52)
GPT-5.6 Terra logo
GPT-5.6 Terra ($3.11/M • 51.1)
Claude Opus 4.8 logo
Claude Opus 4.8 ($7.22/M • 51.4)
Muse Spark 1.1 logo
Muse Spark 1.1 ($1.58/M • 52.3)
Gemini 3.7 Flash logo
Gemini 3.7 Flash ($1.08/M • 49.9)
Claude Sonnet 5 logo
Claude Sonnet 5 ($2.89/M • 49)
GPT-5.5 logo
GPT-5.5 ($7.78/M • 48.6)
DeepSeek-V4-Flash-Vision-Exp logo
DeepSeek-V4-Flash-Vision-Exp ($0.27/M • 45.3)
Grok 4.5 logo
Grok 4.5 ($2/M • 47.8)
Midjourney v7 logo
Midjourney v7 ($40/M • 57.2)
Recraft V3 (Red_panda) logo
Recraft V3 (Red_panda) ($40/M • 56.5)
FLUX.1 [pro] logo
FLUX.1 [pro] ($40/M • 56.1)
Ideogram 2.0 logo
Ideogram 2.0 ($80/M • 55.8)
Imagen 3 logo
Imagen 3 ($30/M • 55)
FLUX.1 [dev] logo
FLUX.1 [dev] ($25/M • 54.2)
Stable Diffusion 3.5 Large logo
Stable Diffusion 3.5 Large ($35/M • 53)
DALL-E 3 logo
DALL-E 3 ($40/M • 52.4)
Sora v2 logo
Sora v2 ($200/M • 58)
Kling 1.5 Pro logo
Kling 1.5 Pro ($100/M • 57)
Runway Gen-3 Alpha Turbo logo
Runway Gen-3 Alpha Turbo ($50/M • 56.4)
Minimax Hailuo Video-01 logo
Minimax Hailuo Video-01 ($60/M • 55.9)
Luma Dream Machine 1.5 logo
Luma Dream Machine 1.5 ($80/M • 54.8)
Hunyuan Video logo
Hunyuan Video ($40/M • 54)
Pika 2.0 logo
Pika 2.0 ($80/M • 53.2)
CogVideoX-5B logo
CogVideoX-5B ($30/M • 51.8)
ElevenLabs Multilingual v2 logo
ElevenLabs Multilingual v2 ($150/M • 58.2)
Cartesia Sonic logo
Cartesia Sonic ($50/M • 56.9)
OpenAI TTS-1-HD logo
OpenAI TTS-1-HD ($30/M • 55)
Fish Audio v1.4 logo
Fish Audio v1.4 ($20/M • 54)
Deepgram Nova-2 logo
Deepgram Nova-2 ($4.3/M • 57.8)
Whisper Large v3 Turbo logo
Whisper Large v3 Turbo ($6/M • 57)
Groq Whisper Large v3 logo
Groq Whisper Large v3 ($3.3/M • 56.8)
AssemblyAI Conformer-2 logo
AssemblyAI Conformer-2 ($6.5/M • 55.4)
Voyage-3-large logo
Voyage-3-large ($0.12/M • 58.9)
text-embedding-3-large logo
text-embedding-3-large ($0.13/M • 57.5)
Cohere Embed v3.0 logo
Cohere Embed v3.0 ($0.1/M • 56.2)
$0.20 / 1M$0.50$1.00$2.00$5.00$10.00$15.00+ / 1M tokens
Index Ranking

Model Performance vs Blended Price

01
ChatGPT Astra (GPT-6 Astra) logo
ChatGPT Astra (GPT-6 Astra)OpenAI
61.2
$20.00
02
Gemini 3.8 Flash logo
Gemini 3.8 FlashGoogle
59
$1.12
03
Claude Opus 5.1 logo
Claude Opus 5.1Anthropic
58.8
$15.00
04
Claude Fable 5.1 logo
Claude Fable 5.1Anthropic
58.2
$12.00
05
Muse Spark 1.3 logo
Muse Spark 1.3Meta
54.8
$1.58
06
GPT-5.6 Sol logo
GPT-5.6 SolOpenAI
57.4
$7.78
07
Claude Opus 5 logo
Claude Opus 5Anthropic
56.2
$7.22
08
Claude Fable 5 logo
Claude Fable 5Anthropic
56.1
$14.40
09
Claude Mythos Preview logo
Claude Mythos PreviewAnthropic
56
Free
10
Kimi K3 logo
Kimi K3Moonshot AI
54.9
$4.33
Master Matrix

AI Model Comparison Table

Rank Model & Provider Score Reasoning Coding Arena ELO ArchitectureContextSpeed Pricing $/1M Action
1NEW
ChatGPT Astra (GPT-6 Astra) logo
ChatGPT Astra (GPT-6 Astra)
OpenAI
61.263.557.82,695Recurrent Depth (~1.8T Equiv)1.2M95 tok/s$20.00Compare
1NEW
Gemini 3.8 Flash logo
Gemini 3.8 Flash
Google
5956.554.22,190Sparse MoE (~140B Active)1.0M348 tok/s$1.12Compare
2NEW
Claude Opus 5.1 logo
Claude Opus 5.1
Anthropic
58.857.251.52,710Dense (~250B)1.0M64 tok/s$15.00Compare
3NEW
Claude Fable 5.1 logo
Claude Fable 5.1
Anthropic
58.25653.52,160MoE (~380B)1.0M86 tok/s$12.00Compare
1
GPT-5.6 Sol logo
GPT-5.6 Sol
OpenAI
57.456.850.62,134MoE (~1.8T)1.1M102 tok/s$7.78Compare
2
Claude Opus 5 logo
Claude Opus 5
Anthropic
56.255.342.72,668Dense (~220B)1.0M58 tok/s$7.22Compare
3
Claude Fable 5 logo
Claude Fable 5
Anthropic
56.153.548.82,003MoE (~350B)1.0M78 tok/s$14.40Compare
4NEW
Claude Mythos Preview logo
Claude Mythos Preview
Anthropic
5656.846.62,190Research Tier1.0M45 tok/sFree / OpenCompare
5
Kimi K3 logo
Kimi K3
Moonshot AI
54.953.945.91,8162.8T (MoE)1.0M135 tok/s$4.33Compare
8NEW
Muse Spark 1.3 logo
Muse Spark 1.3
Meta
54.854.547.21,840MoE (~110B Active)1.0M245 tok/s$1.58Compare
6NEW
GLM-5.3 logo
GLM-5.3
Zhipu AI
54.754.945.41,780753B (MoE)1.0M142 tok/s$1.73Compare
7NEW
DeepSeek-V4-Pro-0813 logo
DeepSeek-V4-Pro-0813
DeepSeek
54.55244.31,9801.6T (MoE)1.0M199 tok/s$0.48Compare
8NEW
Qwen3.8 Max logo
Qwen3.8 Max
Alibaba Cloud / Qwen Team
53.25242.11,8502.4T (MoE)1.0M160 tok/s$0.85Compare
9
GPT-5.6 Terra logo
GPT-5.6 Terra
OpenAI
52.851.146.41,185MoE (~500B)1.1M119 tok/s$3.11Compare
10
Claude Opus 4.8 logo
Claude Opus 4.8
Anthropic
51.951.443.81,689Dense1.0M125 tok/s$7.22Compare
11
Muse Spark 1.1 logo
Muse Spark 1.1
Meta
51.752.337.81,070Dense (~70B)1.0M229 tok/s$1.58Compare
12NEW
Gemini 3.7 Flash logo
Gemini 3.7 Flash
Google
51.149.938.61,720Sparse MoE1.0M621 tok/s$1.08Compare
13
Claude Sonnet 5 logo
Claude Sonnet 5
Anthropic
49.649401,588Dense (~100B)1.0M59 tok/s$2.89Compare
14
GPT-5.5 logo
GPT-5.5
OpenAI
49.348.641.12,124MoE1.1M49 tok/s$7.78Compare
15NEW
DeepSeek-V4-Flash-Vision-Exp logo
DeepSeek-V4-Flash-Vision-Exp
DeepSeek
48.745.338.51,650Vision MoE1.0M310 tok/s$0.27Compare
16NEW
Grok 4.5 logo
Grok 4.5
xAI
48.247.837.21,540MoE (~300B)2.0M110 tok/s$2.00Compare
Direct Head-to-Head

Popular 1v1 Model Comparisons

Direct head-to-head empirical evaluations across speed, pricing, and verified benchmark scores.

56 Total MatchupsLeaderboard
Showing 1 to 6 of 56 comparisons
Taxonomy Explorer

Browse AI Models by Category

Intelligence Feed

Latest AI Model Research & Releases

All AI Articles