---
title: "RankedAGI - AI Models Ranked by Latest Benchmarks"
description: "Compare benchmarks across different AI models, including coding, reasoning, agentic, math, multimodal, context, cost, and release metadata."
source: "https://rankedagi.com"
---

# RankedAGI Leaderboard

RankedAGI ranks AI models using public benchmark evidence and RankedAGI composite scores. The HTML page is interactive; this Markdown version is a compact agent-readable leaderboard.

| Rank | Model | Organization | Size | Version | Overall | Coding | Reasoning | Agentic | Math | Model page |
| --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- |
| 1 | Claude Fable 5 | Anthropic |  | Latest | 78.5% | 94.2% | 89.0% | 92.9% | 71.7% | https://rankedagi.com/models/claude-fable-5 |
| 2 | Claude Opus 5 | Anthropic |  | Latest | 77.9% | 93.5% | 87.1% | 94.2% | 67.7% | https://rankedagi.com/models/claude-opus-5 |
| 3 | Claude Mythos | Anthropic |  | Preview | 76.4% | 90.1% | 89.1% | 87.4% | 71.4% | https://rankedagi.com/models/claude-mythos-preview |
| 4 | Claude Opus 4.8 | Anthropic |  | Latest | 74.9% | 87.0% | 84.7% | 87.5% | 71.7% | https://rankedagi.com/models/claude-opus-4-8 |
| 5 | GPT 5.5 Pro | OpenAI |  | Latest | 73.6% | 85.4% | 82.6% | 87.3% | 65.5% | https://rankedagi.com/models/gpt-5-5-pro |
| 6 | Gemini 3 Deep Think | Google |  | Latest | 72.5% | 82.6% | 85.7% | 80.5% | 70.4% | https://rankedagi.com/models/gemini-3-deep-think |
| 7 | GPT 5.4 Pro | OpenAI |  | Latest | 72.2% | 81.8% | 81.1% | 85.9% | 66.1% | https://rankedagi.com/models/gpt-5-4-pro |
| 8 | Muse Spark Contemplating | Meta |  | Latest | 72.0% | 83.1% | 81.9% | 83.0% | 66.2% | https://rankedagi.com/models/muse-spark-contemplating |
| 9 | GLM 5.2 | Z.ai |  | Latest | 72.0% | 83.6% | 79.1% | 82.0% | 76.1% | https://rankedagi.com/models/glm-5-2 |
| 10 | GPT 5.6 Sol | OpenAI |  | Preview | 72.0% | 88.1% | 75.3% | 85.1% | 64.1% | https://rankedagi.com/models/gpt-5-6-sol-preview |
| 11 | GPT 5.5 | OpenAI |  | Latest | 71.9% | 85.7% | 84.9% | 74.7% | 72.1% | https://rankedagi.com/models/gpt-5-5 |
| 12 | Claude Sonnet 5 | Anthropic |  | Latest | 71.8% | 83.1% | 80.8% | 81.3% | 71.2% | https://rankedagi.com/models/claude-sonnet-5 |
| 13 | Qwen 3.7 Max | Alibaba |  | Latest | 70.9% | 82.1% | 81.4% | 76.7% | 72.5% | https://rankedagi.com/models/qwen-3-7-max |
| 14 | Grok 4.5 | xAI |  |  | 70.2% | 83.4% | 72.8% | 83.4% | 65.4% | https://rankedagi.com/models/grok-4-5 |
| 15 | Composer 2.5 | Cursor |  | Latest | 69.6% | 83.3% | 70.9% | 82.3% | 66.3% | https://rankedagi.com/models/composer-2-5 |
| 16 | GPT‑5.4 | OpenAI |  | Latest | 68.8% | 77.8% | 77.2% | 74.3% | 76.1% | https://rankedagi.com/models/gpt-5-4 |
| 17 | Claude Opus 4.7 | Anthropic |  | Latest | 68.0% | 82.2% | 70.5% | 73.5% | 71.9% | https://rankedagi.com/models/claude-opus-4-7 |
| 18 | Kimi K2.7 Code | Moonshot |  | Latest | 67.5% | 72.6% | 74.3% | 79.3% | 67.2% | https://rankedagi.com/models/kimi-k2-7-code |
| 19 | Grok 4 Heavy | xAI |  | Latest | 67.2% | 70.9% | 78.0% | 74.0% | 76.1% | https://rankedagi.com/models/grok-4-heavy |
| 20 | MiMo V2.5 Pro | Xiaomi |  | Latest | 66.8% | 73.5% | 72.2% | 75.7% | 71.4% | https://rankedagi.com/models/mimo-v2-5-pro |
| 21 | Claude Opus 4.6 | Anthropic |  | Latest | 66.2% | 74.2% | 76.2% | 66.5% | 75.8% | https://rankedagi.com/models/claude-opus-4-6 |
| 22 | Claude Sonnet 4.6 | Anthropic |  | Latest | 65.6% | 74.8% | 73.9% | 67.0% | 71.1% | https://rankedagi.com/models/claude-sonnet-4-6 |
| 23 | Gemini 3.1 Pro | Google |  | Latest | 65.6% | 74.3% | 77.0% | 64.7% | 72.3% | https://rankedagi.com/models/gemini-3-1-pro |
| 24 | o3 | OpenAI |  | Latest | 65.6% | 74.1% | 70.9% | 71.8% | 70.6% | https://rankedagi.com/models/o3 |
| 25 | Gemini 3.5 Flash | Google |  | Latest | 65.6% | 71.0% | 72.2% | 72.1% | 71.9% | https://rankedagi.com/models/gemini-3-5-flash |
| 26 | Kimi K2.6 | Moonshot |  | Latest | 65.6% | 71.1% | 76.0% | 67.0% | 76.4% | https://rankedagi.com/models/kimi-k2-6 |
| 27 | Muse Spark | Meta |  | Latest | 65.3% | 73.4% | 69.4% | 71.8% | 72.2% | https://rankedagi.com/models/muse-spark |
| 28 | GPT 5.3 Codex | OpenAI |  | Latest | 65.2% | 72.4% | 73.3% | 68.9% | 71.0% | https://rankedagi.com/models/gpt-5-3-codex |
| 29 | DeepSeek V4 Pro | DeepSeek | 1.6T | Latest | 65.1% | 71.1% | 75.1% | 66.5% | 72.8% | https://rankedagi.com/models/deepseek-v4-pro |
| 30 | GLM 5.1 | Z.ai | 754B | Latest | 64.4% | 69.4% | 71.4% | 67.7% | 76.0% | https://rankedagi.com/models/glm-5-1-754b |
| 31 | GPT 5.2 Pro | OpenAI |  | Latest | 64.3% | 70.0% | 70.1% | 68.7% | 76.1% | https://rankedagi.com/models/gpt-5-2-pro |
| 32 | GPT 5.6 Terra | OpenAI |  | Preview | 64.3% | 77.2% | 64.2% | 72.3% | 60.5% | https://rankedagi.com/models/gpt-5-6-terra |
| 33 | Qwen 3.6 Max | Alibaba |  | Preview | 64.2% | 72.4% | 68.2% | 71.5% | 63.4% | https://rankedagi.com/models/qwen-3-6-max-preview |
| 34 | MiMo V2.5 | Xiaomi |  | Latest | 64.0% | 68.3% | 68.1% | 72.7% | 69.3% | https://rankedagi.com/models/mimo-v2-5 |
| 35 | Gemini 2.5 Deep Think | Google |  | Latest | 63.7% | 69.8% | 70.8% | 65.9% | 74.9% | https://rankedagi.com/models/gemini-2.5-deep-think |
| 36 | o3 Pro | OpenAI |  | Latest | 63.7% | 70.4% | 67.2% | 72.0% | 64.5% | https://rankedagi.com/models/o3-pro |
| 37 | Minimax M3 | MiniMax |  | Latest | 63.6% | 69.5% | 71.7% | 66.1% | 68.9% | https://rankedagi.com/models/minimax-m3 |
| 38 | Qwen 3.6 Plus | Alibaba |  | Latest | 63.5% | 68.8% | 70.1% | 66.1% | 76.0% | https://rankedagi.com/models/qwen-3-6-plus |
| 39 | Gemini 3 Pro | Google |  | Preview | 63.4% | 70.0% | 73.7% | 62.1% | 72.4% | https://rankedagi.com/models/gemini-3-pro-preview |
| 40 | DeepSeek V4 Flash | DeepSeek | 284B | Latest | 62.8% | 69.1% | 70.8% | 62.6% | 72.3% | https://rankedagi.com/models/deepseek-v4-flash |
| 41 | GLM 5 | Z.ai | 744B | Latest | 62.6% | 67.4% | 70.1% | 62.8% | 75.1% | https://rankedagi.com/models/glm-5-744b |
| 42 | Gemini 2 Flash Thinking | Google |  | Old | 62.2% | 70.1% | 53.6% | 81.4% | 55.7% | https://rankedagi.com/models/gemini-2-flash-thinking-1219 |
| 43 | GPT 5.2 | OpenAI |  | Latest | 62.0% | 67.5% | 69.7% | 59.4% | 76.9% | https://rankedagi.com/models/gpt-5-2 |
| 44 | Qwen 3.6 | Alibaba | 27B | Latest | 61.6% | 65.7% | 65.5% | 65.4% | 74.2% | https://rankedagi.com/models/qwen-3-6-27b |
| 45 | Grok 4.3 | xAI |  | Latest | 61.5% | 66.9% | 70.2% | 59.5% | 71.3% | https://rankedagi.com/models/grok-4-3 |
| 46 | GPT-5 pro | OpenAI |  | Latest | 61.5% | 64.2% | 69.2% | 62.3% | 75.7% | https://rankedagi.com/models/gpt-5-pro |
| 47 | Claude Opus 4.5 | Anthropic |  | Latest | 61.1% | 71.7% | 64.4% | 57.9% | 72.1% | https://rankedagi.com/models/claude-opus-4-5 |
| 48 | Qwen 3.5 A17B | Alibaba | 397B | Latest | 61.0% | 64.7% | 67.7% | 61.6% | 74.7% | https://rankedagi.com/models/qwen-3-5-a17b-397b |
| 49 | QWQ Max | Alibaba |  | Preview | 60.5% | 68.3% | 60.2% | 67.8% | 59.5% | https://rankedagi.com/models/qwq-max-preview |
| 50 | Claude 4 Opus | Anthropic |  | Latest | 60.4% | 63.7% | 62.0% | 66.6% | 72.2% | https://rankedagi.com/models/claude-4-opus |
| 51 | DeepSeek V3.2 Speciale | DeepSeek | 685B | Latest | 60.3% | 64.6% | 67.4% | 58.6% | 75.5% | https://rankedagi.com/models/deepseek-v3-2-speciale |
| 52 | Grok 4.2 | xAI |  | Latest | 60.2% | 64.2% | 69.2% | 56.4% | 71.8% | https://rankedagi.com/models/grok-4-20 |
| 53 | GPT-5 | OpenAI |  | Latest | 60.2% | 65.1% | 64.2% | 59.6% | 76.8% | https://rankedagi.com/models/gpt-5 |
| 54 | MiMo V2 Pro | Xiaomi |  | Latest | 60.1% | 64.6% | 63.8% | 61.5% | 71.5% | https://rankedagi.com/models/mimo-v2-pro |
| 55 | Kimi K2.5 | Moonshot | 1T | Latest | 60.0% | 64.0% | 70.1% | 54.7% | 76.1% | https://rankedagi.com/models/kimi-k2-5 |
| 56 | GPT 5.4 mini | OpenAI |  | Latest | 59.4% | 62.7% | 65.9% | 57.5% | 71.8% | https://rankedagi.com/models/gpt-5-4-mini |
| 57 | Grok 3 | xAI |  | Latest | 58.4% | 62.7% | 61.5% | 57.3% | 73.1% | https://rankedagi.com/models/grok-3 |
| 58 | MiniMax M2.7 | MiniMax |  | Latest | 58.3% | 57.3% | 63.7% | 62.0% | 68.5% | https://rankedagi.com/models/minimax-m2-7 |
| 59 | o4 mini | OpenAI |  | Latest | 58.3% | 62.4% | 65.9% | 54.1% | 70.7% | https://rankedagi.com/models/o4-mini |
| 60 | MiniMax M2.5 | MiniMax |  | Latest | 58.1% | 65.4% | 60.1% | 56.6% | 69.8% | https://rankedagi.com/models/minimax-m2-5 |
| 61 | GPT 5.2 Codex | OpenAI |  | Latest | 57.9% | 60.2% | 64.1% | 56.8% | 68.2% | https://rankedagi.com/models/gpt-5-2-codex |
| 62 | Grok 4 | xAI |  | Latest | 57.8% | 55.9% | 71.0% | 50.2% | 79.4% | https://rankedagi.com/models/grok-4 |
| 63 | GPT 5.1 | OpenAI |  | Latest | 57.4% | 62.6% | 58.2% | 55.1% | 75.4% | https://rankedagi.com/models/gpt-5-1 |
| 64 | Qwen 3.6 A3B | Alibaba | 35B | Latest | 57.4% | 60.0% | 60.1% | 57.7% | 72.9% | https://rankedagi.com/models/qwen-3-6-a3b-35b |
| 65 | DeepSeek V3.2 | DeepSeek | 685B | Latest | 57.1% | 61.6% | 60.3% | 52.8% | 74.6% | https://rankedagi.com/models/deepseek-v3-2 |
| 66 | Qwen 3.5 | Alibaba | 27B | Latest | 56.9% | 60.6% | 61.8% | 52.9% | 73.5% | https://rankedagi.com/models/qwen-3-5-27b |
| 67 | MiniMax M2.1 | MiniMax |  | Latest | 56.8% | 59.7% | 57.9% | 59.6% | 64.2% | https://rankedagi.com/models/minimax-m2-1 |
| 68 | GPT 5.6 Luna | OpenAI |  | Preview | 56.0% | 64.4% | 52.0% | 59.8% | 56.4% | https://rankedagi.com/models/gpt-5-6-luna |
| 69 | Gemma 4 | Google | 31B | Latest | 55.8% | 59.5% | 58.0% | 52.2% | 70.1% | https://rankedagi.com/models/gemma-4-31b |
| 70 | Claude Opus 4.1 | Anthropic |  | Latest | 55.5% | 59.6% | 58.1% | 52.7% | 67.1% | https://rankedagi.com/models/claude-opus-4.1 |
| 71 | DeepSeek V3.1 | DeepSeek | 840B | Latest | 55.3% | 56.9% | 63.0% | 46.9% | 73.0% | https://rankedagi.com/models/deepseek-v3-1 |
| 72 | MiMo V2 Flash | Xiaomi |  | Latest | 55.2% | 59.8% | 54.6% | 53.7% | 67.6% | https://rankedagi.com/models/mimo-v2-flash |
| 73 | Gemini 2.5 Pro | Google |  | Old | 54.4% | 56.7% | 56.5% | 49.6% | 72.1% | https://rankedagi.com/models/gemini-2.5-pro-preview-03-25 |
| 74 | Claude 4 Sonnet | Anthropic |  | Latest | 54.4% | 56.2% | 62.4% | 47.8% | 63.6% | https://rankedagi.com/models/claude-4-sonnet |
| 75 | o1 Pro | OpenAI |  | Latest | 54.3% | 53.2% | 64.9% | 47.8% | 66.6% | https://rankedagi.com/models/o1-pro |
| 76 | Claude Sonnet 4.5 | Anthropic |  | Latest | 54.0% | 59.9% | 52.9% | 49.6% | 71.3% | https://rankedagi.com/models/claude-sonnet-4.5 |
| 77 | Gemini 2.5 Pro | Google |  | Old | 53.5% | 54.8% | 55.7% | 46.9% | 75.0% | https://rankedagi.com/models/gemini-2.5-pro-preview-05-06 |
| 78 | GPT 5.4 nano | OpenAI |  | Latest | 53.0% | 51.4% | 58.6% | 47.5% | 68.5% | https://rankedagi.com/models/gpt-5-4-nano |
| 79 | Gemini 2.5 Pro | Google |  | Latest | 53.0% | 53.4% | 59.4% | 44.3% | 66.6% | https://rankedagi.com/models/gemini-2.5-pro |
| 80 | Grok 4.1 Fast Reasoning | xAI |  | Latest | 52.8% | 55.5% | 54.4% | 45.4% | 71.2% | https://rankedagi.com/models/grok-4-1-fast-reasoning |
| 81 | Mistral Medium 3.5 | Mistral | 128B | Latest | 52.3% | 55.3% | 51.2% | 47.2% | 68.5% | https://rankedagi.com/models/mistral-medium-3-5-128b |
| 82 | Llama 4 Behemoth | Meta | 2T | Preview | 52.2% | 49.8% | 53.8% | 55.3% | 54.8% | https://rankedagi.com/models/llama-4-behemoth-preview |
| 83 | Gemini Exp 1121 | Google |  | Old | 51.4% | 51.4% | 44.7% | 58.9% | 51.8% | https://rankedagi.com/models/gemini-exp-1121 |
| 84 | DeepSeek R1 | DeepSeek | 685B | Latest | 51.2% | 52.1% | 53.6% | 44.9% | 62.5% | https://rankedagi.com/models/deepseek-r1-1 |
| 85 | Gemini Exp 1206 | Google |  | Old | 51.1% | 51.7% | 46.1% | 56.0% | 50.7% | https://rankedagi.com/models/gemini-exp-1206 |
| 86 | o3 mini | OpenAI |  | Latest | 50.8% | 50.4% | 52.9% | 43.9% | 69.3% | https://rankedagi.com/models/o3-mini |
| 87 | Gemini Exp 1114 | Google |  | Old | 50.7% | 49.9% | 44.5% | 58.0% | 50.4% | https://rankedagi.com/models/gemini-exp-1114 |
| 88 | Qwen 3 A22B | Alibaba | 235B | Latest | 50.7% | 50.5% | 54.7% | 41.5% | 71.9% | https://rankedagi.com/models/qwen-3-a22b-235b |
| 89 | GPT-5 mini | OpenAI |  | Latest | 50.6% | 48.8% | 55.0% | 41.5% | 71.9% | https://rankedagi.com/models/gpt-5-mini |
| 90 | gpt-oss-120b | OpenAI | 120B | Latest | 50.5% | 48.0% | 56.9% | 39.9% | 73.0% | https://rankedagi.com/models/gpt-oss-120b |
| 91 | GPT 4o | OpenAI |  | Old | 50.4% | 49.6% | 44.3% | 57.0% | 48.4% | https://rankedagi.com/models/gpt-4o-2501 |
| 92 | Grok Build 0.1 | xAI |  | Latest | 50.3% | 48.8% | 45.9% | 55.2% | 55.7% | https://rankedagi.com/models/grok-build-0-1 |
| 93 | Qwen 2.5 VL | Alibaba | 32B | Latest | 49.9% | 51.3% | 44.1% | 56.0% | 45.9% | https://rankedagi.com/models/qwen-2.5-vl-32b |
| 94 | EXAONE Deep | LG | 32B | Latest | 49.8% | 46.6% | 50.5% | 47.6% | 68.4% | https://rankedagi.com/models/exaone-deep-32b |
| 95 | Qwen 2.5 Coder | Alibaba | 14B | Latest | 49.3% | 50.5% | 39.3% | 59.0% | 46.8% | https://rankedagi.com/models/qwen-2.5-coder-14b |
| 96 | Qwen 3 | Alibaba | 32B | Latest | 49.3% | 47.9% | 50.9% | 42.9% | 68.5% | https://rankedagi.com/models/qwen-3-32b |
| 97 | Claude Haiku 4.5 | Anthropic |  | Latest | 49.1% | 50.1% | 46.4% | 43.5% | 68.9% | https://rankedagi.com/models/claude-haiku-4-5 |
| 98 | Kimi K2 | Moonshot |  | Latest | 48.8% | 50.1% | 48.8% | 42.1% | 60.6% | https://rankedagi.com/models/kimi-k2 |
| 99 | EXAONE Deep | LG | 7.8B | Latest | 48.7% | 44.7% | 47.9% | 47.5% | 66.7% | https://rankedagi.com/models/exaone-deep-7.8b |
| 100 | o1 | OpenAI |  | Latest | 48.5% | 47.1% | 50.0% | 39.6% | 66.4% | https://rankedagi.com/models/o1 |
| 101 | o1 Preview | OpenAI |  | Old | 48.1% | 47.9% | 48.9% | 40.9% | 56.2% | https://rankedagi.com/models/o1-preview |
| 102 | GPT 4.5 | OpenAI |  | Preview | 48.0% | 48.6% | 47.3% | 41.3% | 55.2% | https://rankedagi.com/models/gpt-4.5-preview |
| 103 | Qwen 3 A3B | Alibaba | 30B | Latest | 48.0% | 45.6% | 51.5% | 38.9% | 65.5% | https://rankedagi.com/models/qwen-3-30b-a3b |
| 104 | Claude 3.7 Sonnet | Anthropic |  | Latest | 47.8% | 52.8% | 40.6% | 45.7% | 47.7% | https://rankedagi.com/models/claude-3.7-sonnet |
| 105 | Gemini 2.5 Flash | Google |  | Preview | 47.8% | 45.4% | 49.3% | 38.2% | 67.9% | https://rankedagi.com/models/gemini-2.5-flash-preview-04-17 |
| 106 | MiniMax M2 | MiniMax |  | Latest | 47.7% | 48.9% | 45.3% | 41.5% | 60.8% | https://rankedagi.com/models/minimax-m2 |
| 107 | Qwen 2.5 | Alibaba | 32B | Latest | 47.5% | 42.9% | 44.5% | 51.3% | 51.7% | https://rankedagi.com/models/qwen-2.5-32b |
| 108 | Grok 3 mini | xAI |  | Latest | 47.5% | 46.0% | 47.1% | 39.2% | 66.7% | https://rankedagi.com/models/grok-3-mini |
| 109 | QwQ Preview | Alibaba | 32B | Preview | 47.4% | 43.2% | 46.5% | 48.0% | 52.1% | https://rankedagi.com/models/qwq-preview-32b |
| 110 | gpt-oss-20b | OpenAI | 20B | Latest | 47.4% | 42.0% | 50.6% | 38.2% | 71.8% | https://rankedagi.com/models/gpt-oss-20b |
| 111 | EXAONE 4.0 | LG | 32B | Latest | 47.3% | 44.5% | 50.4% | 38.2% | 66.4% | https://rankedagi.com/models/exaone-4.0 |
| 112 | EXAONE Deep | LG | 2.4B | Latest | 47.0% | 41.9% | 44.4% | 46.7% | 64.5% | https://rankedagi.com/models/exaone-deep-2.4b |
| 113 | Sky T1 Preview | NovaSky | 32B | Preview | 47.0% | 43.3% | 45.7% | 47.1% | 50.8% | https://rankedagi.com/models/sky-t1-preview-32b |
| 114 | Qwen 3 Coder | Alibaba | 480B | Latest | 47.0% | 49.3% | 44.3% | 39.5% | 57.7% | https://rankedagi.com/models/qwen-3-coder-480b |
| 115 | Gemini 2.5 Flash | Google |  | Latest | 46.6% | 45.5% | 48.1% | 35.1% | 63.0% | https://rankedagi.com/models/gemini-2.5-flash-preview |
| 116 | Mercury Coder Small | Inception Labs |  | Preview | 46.6% | 47.6% | 36.7% | 52.1% | 43.8% | https://rankedagi.com/models/mercury-coder-small-preview |
| 117 | Qwen 2.5 Coder | Alibaba | 7B | Latest | 46.5% | 45.5% | 35.8% | 54.5% | 45.5% | https://rankedagi.com/models/qwen-2.5-coder-7b |
| 118 | QwQ | Alibaba | 32B | Latest | 46.5% | 41.7% | 46.9% | 40.1% | 64.4% | https://rankedagi.com/models/qwq-32b |
| 119 | DeepSeek R1 | DeepSeek | 671B | Latest | 46.4% | 45.5% | 43.9% | 38.4% | 62.1% | https://rankedagi.com/models/deepseek-r1 |
| 120 | R1 Lite Preview | DeepSeek |  | Preview | 46.1% | 44.1% | 45.2% | 41.6% | 54.5% | https://rankedagi.com/models/r1-lite-preview |
| 121 | Deepseek 2.5 | DeepSeek |  | Old | 46.0% | 40.0% | 40.9% | 46.5% | 60.4% | https://rankedagi.com/models/deepseek-2.5-old |
| 122 | R1 Distill Qwen | DeepSeek | 14B | Latest | 46.0% | 44.2% | 45.3% | 39.5% | 58.8% | https://rankedagi.com/models/r1-distill-qwen-14b |
| 123 | Qwen 3 | Alibaba | 4B | Latest | 45.7% | 44.4% | 42.9% | 39.3% | 62.7% | https://rankedagi.com/models/qwen-3-4b-235b |
| 124 | Gemini 2.0 Flash Exp | Google |  | Old | 45.7% | 41.9% | 44.8% | 41.7% | 50.6% | https://rankedagi.com/models/gemini-2.0-flash-exp |
| 125 | GPT-5 nano | OpenAI |  | Latest | 45.6% | 40.3% | 48.2% | 35.4% | 64.7% | https://rankedagi.com/models/gpt-5-nano |
| 126 | Qwen 3 A22B | Alibaba | 235B | Old | 45.3% | 44.0% | 47.4% | 31.5% | 67.4% | https://rankedagi.com/models/qwen-3-235b-a22b-old |
| 127 | SWE-1.6 | Cognition |  | Latest | 45.1% | 43.8% | 36.9% | 47.8% | 45.8% | https://rankedagi.com/models/swe-1-6 |
| 128 | GPT 4.1 | OpenAI |  | Latest | 45.0% | 43.3% | 43.9% | 36.4% | 54.3% | https://rankedagi.com/models/gpt-4.1 |
| 129 | Kimi K2 | Moonshot | 1T | old | 44.9% | 46.1% | 40.6% | 37.9% | 54.3% | https://rankedagi.com/models/kimi-k2-1t |
| 130 | Gemini 2 Flash Thinking | Google |  | Preview | 44.7% | 43.3% | 42.6% | 35.6% | 56.4% | https://rankedagi.com/models/gemini-2-flash-thinking-0121 |
| 131 | Qwen 2.5 Coder | Alibaba | 32B | Latest | 44.4% | 44.2% | 37.0% | 44.4% | 42.6% | https://rankedagi.com/models/qwen-2.5-coder-32b |
| 132 | Qwen 2.5 | Alibaba | 7B | Latest | 44.4% | 41.6% | 32.9% | 51.4% | 46.9% | https://rankedagi.com/models/qwen-2.5-7b |
| 133 | Grok Code Fast 1 | xAI |  | Latest | 44.3% | 44.0% | 41.1% | 37.2% | 54.1% | https://rankedagi.com/models/grok-code-fast-1 |
| 134 | Qwen 2.5 | Alibaba | 14B | Latest | 44.0% | 37.4% | 42.0% | 43.4% | 51.0% | https://rankedagi.com/models/qwen-2.5-14b |
| 135 | Llama 3.2 (Vision) | Meta | 90B | Latest | 43.5% | 38.7% | 40.6% | 42.5% | 45.4% | https://rankedagi.com/models/llama-3.2-(vision)-90b |
| 136 | o1 mini | OpenAI |  | Latest | 43.4% | 41.0% | 41.9% | 34.3% | 52.9% | https://rankedagi.com/models/o1-mini |
| 137 | Pixtral Large | Mistral | 123B | Latest | 43.0% | 36.5% | 42.1% | 39.9% | 47.8% | https://rankedagi.com/models/pixtral-large-123b |
| 138 | Mistral Medium 3 | Mistral |  | Latest | 42.9% | 41.6% | 39.0% | 34.2% | 50.9% | https://rankedagi.com/models/mistral-medium-3 |
| 139 | Nova Lite | Amazon |  | Latest | 42.7% | 35.3% | 40.6% | 41.6% | 41.0% | https://rankedagi.com/models/nova-lite |
| 140 | R1 Distill Llama | DeepSeek | 8B | Latest | 42.6% | 38.7% | 40.7% | 35.5% | 53.7% | https://rankedagi.com/models/r1-distill-llama-8b |
| 141 | Gemini 2.0 Pro | Google |  | Preview | 42.5% | 39.9% | 39.8% | 34.3% | 46.9% | https://rankedagi.com/models/gemini-2.0-pro-exp |
| 142 | R1 Distill Qwen | DeepSeek | 7B | Latest | 42.1% | 38.2% | 40.2% | 33.0% | 57.3% | https://rankedagi.com/models/r1-distill-qwen-7b |
| 143 | Nova Micro | Amazon |  | Latest | 41.9% | 33.0% | 39.7% | 41.6% | 41.0% | https://rankedagi.com/models/nova-micro |
| 144 | Qwen 3 A3B | Alibaba | 30B | old | 41.9% | 37.9% | 44.8% | 26.4% | 62.7% | https://rankedagi.com/models/qwen3-30b-a3b-old |
| 145 | R1 Distill Llama | DeepSeek | 70B | Latest | 41.9% | 40.7% | 39.6% | 29.8% | 58.6% | https://rankedagi.com/models/r1-distill-llama-70b |
| 146 | Gemini 2.0 Flash-Lite | Google |  | Latest | 41.5% | 35.3% | 44.0% | 32.6% | 41.1% | https://rankedagi.com/models/gemini-2.0-flash-lite |
| 147 | DeepSeek V3 | DeepSeek | 685B | Latest | 41.5% | 39.4% | 40.0% | 27.4% | 54.5% | https://rankedagi.com/models/deepseek-3 |
| 148 | Qwen 2.5 Coder | Alibaba | 3B | Latest | 41.4% | 37.1% | 30.7% | 44.4% | 44.2% | https://rankedagi.com/models/qwen-2.5-coder-3b |
| 149 | Deepseek V3 | DeepSeek | 671B | Old | 41.3% | 37.4% | 38.4% | 33.6% | 44.2% | https://rankedagi.com/models/deepseek-3-old |
| 150 | Qwen 2.5 Max | Alibaba |  | Latest | 41.1% | 35.8% | 40.3% | 32.2% | 45.0% | https://rankedagi.com/models/qwen-2.5-max |
| 151 | Mercury Coder Mini | Inception Labs |  | Preview | 41.0% | 37.9% | 33.0% | 40.0% | 42.3% | https://rankedagi.com/models/mercury-coder-mini-preview |
| 152 | Gemini 1.5 Pro 002 | Google |  | Old | 41.0% | 33.7% | 40.8% | 32.6% | 48.9% | https://rankedagi.com/models/gemini-1.5-pro-002 |
| 153 | Claude 3.5 Sonnet | Anthropic |  | Latest | 40.7% | 40.1% | 35.8% | 32.6% | 37.2% | https://rankedagi.com/models/claude-3.5-sonnet |
| 154 | Gemini 2.0 Flash | Google |  | Latest | 40.7% | 35.4% | 39.2% | 31.7% | 44.8% | https://rankedagi.com/models/gemini-2.0-flash |
| 155 | Devstral Small 1.1 | Mistral | 24B | Latest | 40.6% | 36.4% | 36.2% | 33.3% | 49.5% | https://rankedagi.com/models/devstral-small-1.1-24b |
| 156 | Grok 4.1 Fast | xAI |  | Latest | 40.5% | 37.7% | 36.2% | 31.9% | 48.7% | https://rankedagi.com/models/grok-4-1-fast |
| 157 | R1 Distill Qwen | DeepSeek | 32B | Latest | 40.5% | 36.1% | 38.6% | 29.1% | 59.2% | https://rankedagi.com/models/r1-distill-qwen-32b |
| 158 | Gemini 2.5 Flash Lite | Google |  | Latest | 40.5% | 35.3% | 38.1% | 29.8% | 57.6% | https://rankedagi.com/models/gemini-2.5-flash-lite |
| 159 | Phi 4 | Microsoft | 14B | Latest | 40.2% | 33.3% | 39.9% | 31.6% | 49.0% | https://rankedagi.com/models/phi-4-14b |
| 160 | Claude 3.5 Sonnet | Anthropic |  | Old | 40.1% | 33.6% | 40.8% | 29.7% | 46.1% | https://rankedagi.com/models/claude-3.5-sonnet-old |
| 161 | Gemini 1.5 Flash 001 | Google |  | Old | 40.1% | 34.0% | 34.0% | 34.8% | 50.9% | https://rankedagi.com/models/gemini-1.5-flash-001-old |
| 162 | Gemini 1.5 Pro 001 | Google |  | Old | 40.0% | 33.9% | 34.9% | 33.7% | 50.0% | https://rankedagi.com/models/gemini-1.5-pro-001-old |
| 163 | GPT 4.1 mini | OpenAI |  | Latest | 40.0% | 33.7% | 41.3% | 26.2% | 50.5% | https://rankedagi.com/models/gpt-4.1-mini |
| 164 | Gemini 1.5 Flash 002 | Google |  | Old | 40.0% | 31.3% | 40.4% | 31.8% | 45.7% | https://rankedagi.com/models/gemini-1.5-flash-002-old |
| 165 | DeepSeek Coder 2 | DeepSeek | 236B | Latest | 40.0% | 33.1% | 37.5% | 34.0% | 41.4% | https://rankedagi.com/models/deepseek-coder-2-236b |
| 166 | Grok-2 mini | xAI |  | Latest | 39.9% | 31.9% | 39.1% | 32.1% | 44.2% | https://rankedagi.com/models/grok-2-mini |
| 167 | Codestral 25.01 | Mistral |  | Latest | 39.6% | 35.6% | 33.4% | 33.9% | 47.0% | https://rankedagi.com/models/codestral-2501 |
| 168 | Gemma 2 | Google | 27B | Latest | 39.6% | 30.7% | 31.9% | 37.4% | 52.2% | https://rankedagi.com/models/gemma-2-27b |
| 169 | Llama 3.3 | Meta | 70B | Latest | 39.6% | 34.4% | 37.9% | 29.1% | 46.3% | https://rankedagi.com/models/llama-3.3-70b |
| 170 | Llama 4 Maverick | Meta | 400B | Latest | 39.6% | 32.9% | 41.6% | 25.8% | 50.0% | https://rankedagi.com/models/llama-4-maverick-400b |
| 171 | SWE-1.5 | Cognition |  | Latest | 38.9% | 34.0% | 30.0% | 37.4% | 41.0% | https://rankedagi.com/models/swe-1-5 |
| 172 | Mistral Small 3 | Mistral | 24B | Latest | 38.9% | 31.9% | 37.1% | 30.8% | 46.4% | https://rankedagi.com/models/mistral-small-3 |
| 173 | Gemma 2 | Google | 9B | Latest | 38.8% | 30.7% | 30.2% | 37.8% | 50.8% | https://rankedagi.com/models/gemma-2-9b |
| 174 | Devstral Medium | Mistral |  | Latest | 38.8% | 39.5% | 31.7% | 30.5% | 36.4% | https://rankedagi.com/models/devstral-medium |
| 175 | Mistral Large | Mistral | 123B | Old | 38.7% | 31.3% | 38.0% | 28.6% | 44.0% | https://rankedagi.com/models/mistral-large-123b-old |
| 176 | GPT 4o | OpenAI |  | Latest | 38.2% | 34.8% | 31.8% | 25.8% | 49.2% | https://rankedagi.com/models/gpt-4o |
| 177 | Claude 3.5 Haiku | Anthropic |  | Latest | 38.1% | 32.9% | 31.9% | 30.5% | 43.7% | https://rankedagi.com/models/claude-3.5-haiku |
| 178 | Mistral Nemo | Mistral | 12B | Latest | 38.0% | 30.0% | 32.0% | 33.5% | 49.0% | https://rankedagi.com/models/mistral-nemo-12b |
| 179 | Nova Pro | Amazon |  | Latest | 37.8% | 32.7% | 35.0% | 27.1% | 40.1% | https://rankedagi.com/models/nova-pro |
| 180 | Llama 3.1 | Meta | 70B | Old | 37.8% | 28.1% | 38.7% | 26.8% | 43.5% | https://rankedagi.com/models/llama-3.1-70b-old |
| 181 | GPT 4o | OpenAI |  | Old | 37.4% | 30.9% | 33.6% | 27.8% | 38.1% | https://rankedagi.com/models/gpt-4o-old |
| 182 | Grok 2 | xAI |  | Latest | 37.3% | 29.9% | 34.9% | 25.6% | 45.6% | https://rankedagi.com/models/grok-2 |
| 183 | DeepSeek 2.5 | DeepSeek | 236B | Old | 37.3% | 30.6% | 37.3% | 23.9% | 42.0% | https://rankedagi.com/models/deepseek-2.5-236b-old |
| 184 | R1 Distill Qwen | DeepSeek | 1.5B | Latest | 37.2% | 31.1% | 32.3% | 29.6% | 41.3% | https://rankedagi.com/models/r1-distill-qwen-1.5b |
| 185 | Qwen 2.5 Coder | Alibaba | 1.5B | Latest | 36.7% | 29.1% | 27.5% | 34.0% | 43.6% | https://rankedagi.com/models/qwen-2.5-coder-1.5b |
| 186 | GPT 4o | OpenAI |  | Old | 36.5% | 31.2% | 33.0% | 23.9% | 41.2% | https://rankedagi.com/models/gpt-4o-old2 |
| 187 | Qwen 2.5 | Alibaba | 3B | Latest | 36.4% | 30.2% | 27.1% | 31.5% | 44.3% | https://rankedagi.com/models/qwen-2.5-3b |
| 188 | Llama 3.1 | Meta | 405B | Latest | 36.3% | 26.6% | 35.8% | 24.1% | 44.5% | https://rankedagi.com/models/llama-3.1-405b |
| 189 | Llama 3.2 (Vision) | Meta | 11B | Latest | 36.2% | 27.7% | 29.7% | 30.9% | 43.2% | https://rankedagi.com/models/llama-3.2-(vision)-11b |
| 190 | GPT 4.1 nano | OpenAI |  | Latest | 36.1% | 29.0% | 34.3% | 22.5% | 41.0% | https://rankedagi.com/models/gpt-4.1-nano |
| 191 | Mistral Large | Mistral | 123B | Latest | 35.9% | 29.4% | 33.9% | 21.4% | 43.3% | https://rankedagi.com/models/mistral-large-123b |
| 192 | GPT 4o mini | OpenAI |  | Latest | 35.6% | 26.7% | 32.0% | 25.3% | 40.9% | https://rankedagi.com/models/gpt-4o-mini |
| 193 | Llama 4 Scout | Meta | 109B | Latest | 35.4% | 26.9% | 36.9% | 20.3% | 42.8% | https://rankedagi.com/models/llama-4-scout-109b |
| 194 | Claude 3 Opus | Anthropic |  | Latest | 35.4% | 24.0% | 35.6% | 22.3% | 45.0% | https://rankedagi.com/models/claude-3-opus |
| 195 | Mistral Small 3.1 | Mistral | 24B | Latest | 34.8% | 26.6% | 33.0% | 22.4% | 41.3% | https://rankedagi.com/models/mistral-small-3.1-24b |
| 196 | Command A | Cohere | 111B | Latest | 34.8% | 27.8% | 31.3% | 21.4% | 38.6% | https://rankedagi.com/models/command-a |
| 197 | Qwen 2.5 | Alibaba | 72B | Latest | 34.8% | 23.7% | 33.2% | 22.6% | 43.4% | https://rankedagi.com/models/qwen-2.5-72b |
| 198 | Gemma 2 | Google | 2B | Latest | 34.6% | 21.5% | 26.3% | 32.4% | 44.6% | https://rankedagi.com/models/gemma-2-2b |
| 199 | Gemma 3 | Google | 27B | Latest | 34.4% | 24.4% | 29.8% | 23.3% | 40.8% | https://rankedagi.com/models/gemma-3-27b |
| 200 | Gemini 1.5 Flash | Google | 8B | Old | 33.7% | 23.1% | 31.3% | 22.4% | 35.9% | https://rankedagi.com/models/gemini-1.5-flash-8b |
| 201 | Gemma 3 | Google | 12B | Latest | 33.5% | 26.8% | 28.1% | 21.3% | 37.8% | https://rankedagi.com/models/gemme-3-12b |
| 202 | Qwen 2.5 | Alibaba | 1.5B | Latest | 33.4% | 22.8% | 22.8% | 29.8% | 42.9% | https://rankedagi.com/models/qwen-2.5-1.5b |
| 203 | Qwen 2.5 Coder | Alibaba | 0.5B | Latest | 33.4% | 23.1% | 22.7% | 29.8% | 41.0% | https://rankedagi.com/models/qwen-2.5-coder-0.5b |
| 204 | Claude 3 Haiku | Anthropic |  | Old | 31.7% | 19.9% | 26.4% | 20.5% | 37.7% | https://rankedagi.com/models/claude-3-haiku-old |
| 205 | Llama 3.1 | Meta | 8B | Latest | 31.5% | 20.1% | 27.3% | 18.8% | 37.0% | https://rankedagi.com/models/llama-3.1-8b |
| 206 | Gemma 3 | Google | 4B | Latest | 30.8% | 21.9% | 24.6% | 18.1% | 35.3% | https://rankedagi.com/models/gemma-3-4b |
| 207 | Qwen 2.5 | Alibaba | 0.5B | Latest | 30.4% | 17.6% | 18.7% | 25.3% | 40.8% | https://rankedagi.com/models/qwen-2.5-0.5b |
| 208 | Llama 3.2 | Meta | 3B | Latest | 29.0% | 16.2% | 23.7% | 14.9% | 35.0% | https://rankedagi.com/models/llama-3.2-3b |
| 209 | Llama 3.2 | Meta | 1B | Latest | 26.6% | 13.4% | 19.8% | 11.0% | 33.7% | https://rankedagi.com/models/llama-3.2-1b |
| 210 | Gemma 4 | Google | 12B | Latest |  |  |  |  |  | https://rankedagi.com/models/gemma-4-12b |

For methodology, benchmark inclusion, update frequency, and limitations, see https://rankedagi.com/sources.md.
