组成评测等权合成
Skill Capability Index
Agentic Index
衡量模型在工具调用、规划、多步骤执行和面向客户的 Agent 工作流中的表现。
本站保留来源分数,不重新计算
每项权重与组成评测独立列出
来源指数 54 分
SOURCE LEADERBOARD
来源完整榜单
Artificial Analysis Agentic Index,数值越高越好。同名模型的具体推理档位以原始来源为准。
| # | 模型 | 机构 | 能力指数 | 智能指数 | 开放性 | 单任务成本 | 任务耗时 | 输出 Token | 生成速度 | 发布日期 |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol (max)推理模型 | OpenAI | 54.0 | 58.9 | 闭源 | US$2.55 | 6.44 分钟 | 24,526 | 63 Token/s | 2026-07-09 |
| 2 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)推理模型 | Anthropic | 52.8 | 59.9 | 闭源 | US$5.60 | 11.04 分钟 | 45,224 | 68 Token/s | 2026-06-09 |
| 3 | GPT-5.6 Sol (xhigh)推理模型 | OpenAI | 51.8 | 57.7 | 闭源 | US$1.83 | 4.95 分钟 | 17,822 | 60 Token/s | 2026-07-09 |
| 4 | Kimi K3推理模型 | Kimi | 50.1 | 57.1 | 闭源 | US$2.47 | 15.07 分钟 | 35,707 | 39 Token/s | 2026-07-16 |
| 5 | GPT-5.6 Sol (high)推理模型 | OpenAI | 48.5 | 55.9 | 闭源 | US$1.18 | 3.71 分钟 | 12,830 | 58 Token/s | 2026-07-09 |
| 6 | GPT-5.6 Terra (max)推理模型 | OpenAI | 47.4 | 55.0 | 闭源 | US$1.90 | 2.84 分钟 | 25,501 | 150 Token/s | 2026-07-09 |
| 7 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort)推理模型 | Anthropic | 47.2 | 55.7 | 闭源 | US$3.28 | 16.69 分钟 | 59,717 | 60 Token/s | 2026-05-28 |
| 8 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort)推理模型 | Anthropic | 46.7 | 53.4 | 闭源 | US$2.89 | 16.41 分钟 | 73,165 | 74 Token/s | 2026-06-30 |
| 9 | Grok 4.5 (high)推理模型 | SpaceXAI | 45.7 | 53.8 | 闭源 | US$0.85 | 4.33 分钟 | 18,121 | 70 Token/s | 2026-07-08 |
| 10 | GPT-5.6 Luna (max)推理模型 | OpenAI | 45.6 | 51.2 | 闭源 | US$0.38 | 1.81 分钟 | 21,454 | 197 Token/s | 2026-07-09 |
| 11 | GPT-5.5 (xhigh)推理模型 | OpenAI | 44.9 | 54.8 | 闭源 | US$2.20 | 3.25 分钟 | 16,006 | 82 Token/s | 2026-04-23 |
| 12 | GPT-5.6 Terra (xhigh)推理模型 | OpenAI | 44.7 | 51.6 | 闭源 | US$1.16 | 2.27 分钟 | 17,859 | 131 Token/s | 2026-07-09 |
| 13 | GPT-5.6 Sol (medium)推理模型 | OpenAI | 44.5 | 53.6 | 闭源 | US$0.86 | 2.40 分钟 | 8,234 | 57 Token/s | 2026-07-09 |
| 14 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort)推理模型 | Anthropic | 44.4 | 53.5 | 闭源 | US$3.54 | 11.88 分钟 | 37,839 | 53 Token/s | 2026-04-16 |
| 15 | GPT-5.5 (high)推理模型 | OpenAI | 43.5 | 53.1 | 闭源 | US$1.56 | 2.41 分钟 | 11,288 | 78 Token/s | 2026-04-23 |
| 16 | GLM-5.2 (max)推理模型 | Z AI | 43.1 | 51.1 | 开放权重 | US$0.93 | 4.17 分钟 | 49,113 | 196 Token/s | 2026-06-16 |
| 17 | GPT-5.6 Luna (xhigh)推理模型 | OpenAI | 42.9 | 49.1 | 闭源 | US$0.26 | 1.28 分钟 | 15,373 | 200 Token/s | 2026-07-09 |
| 18 | GPT-5.6 Terra (high)推理模型 | OpenAI | 41.3 | 49.0 | 闭源 | US$0.80 | 1.62 分钟 | 12,622 | 130 Token/s | 2026-07-09 |
| 19 | GPT-5.4 (xhigh)推理模型 | OpenAI | 41.1 | 51.4 | 闭源 | — | 3.69 分钟 | 32,985 | 149 Token/s | 2026-03-05 |
| 20 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)推理模型 | Anthropic | 40.8 | 47.2 | 闭源 | US$1.40 | 11.50 分钟 | 37,022 | 54 Token/s | 2026-02-17 |
| 21 | GPT-5.6 Luna (high)推理模型 | OpenAI | 40.1 | 46.1 | 闭源 | US$0.17 | 0.92 分钟 | 10,616 | 193 Token/s | 2026-07-09 |
| 22 | GPT-5.6 Sol (low)推理模型 | OpenAI | 40.0 | 49.4 | 闭源 | US$0.52 | 1.40 分钟 | 4,678 | 56 Token/s | 2026-07-09 |
| 23 | GPT-5.5 (medium)推理模型 | OpenAI | 37.8 | 50.4 | 闭源 | US$1.01 | 1.61 分钟 | 7,194 | 74 Token/s | 2026-04-23 |
| 24 | Muse Spark 1.1 (xhigh)推理模型 | Meta | 37.5 | 50.6 | 闭源 | US$0.40 | 2.36 分钟 | 17,922 | 127 Token/s | 2026-07-09 |
| 25 | Gemini 3.5 Flash (high)推理模型 | 37.4 | 50.2 | 闭源 | US$1.37 | 5.02 分钟 | 52,629 | 175 Token/s | 2026-05-19 | |
| 26 | GPT-5.6 Terra (medium)推理模型 | OpenAI | 37.0 | 45.6 | 闭源 | US$0.40 | 0.77 分钟 | 5,924 | 128 Token/s | 2026-07-09 |
| 27 | DeepSeek V4 Pro (Reasoning, Max Effort)推理模型 | DeepSeek | 36.4 | 44.3 | 开放权重 | US$0.05 | 4.87 分钟 | 20,827 | 71 Token/s | 2026-04-24 |
| 28 | MiniMax-M3推理模型 | MiniMax | 35.4 | 44.4 | 开放权重 | US$0.21 | 3.71 分钟 | 24,061 | 108 Token/s | 2026-06-01 |
| 29 | Motif 3 (Beta)推理模型 | Motif Technologies | 34.9 | 44.1 | 闭源 | — | — | 25,538 | — | — |
| 30 | JT-4.1 Flash 236B A21B非推理模型 | China Mobile | 34.9 | 38.8 | 闭源 | — | — | 24,827 | — | 2026-07-09 |
| 31 | GPT-5.6 Sol (Non-reasoning)非推理模型 | OpenAI | 34.9 | 41.2 | 闭源 | US$0.43 | 1.06 分钟 | 3,591 | 56 Token/s | 2026-07-09 |
| 32 | GLM-5.2 (Non-reasoning)非推理模型 | Z AI | 34.8 | 34.1 | 开放权重 | US$2.28 | 0.31 分钟 | 2,444 | 132 Token/s | 2026-06-16 |
| 33 | DeepSeek V4 Pro (Reasoning, High Effort)推理模型 | DeepSeek | 34.4 | 43.1 | 开放权重 | US$0.04 | 4.17 分钟 | 17,165 | 69 Token/s | 2026-04-24 |
| 34 | Claude Sonnet 5 (Non-reasoning, High Effort)非推理模型 | Anthropic | 33.7 | 41.7 | 闭源 | US$0.69 | 4.03 分钟 | 16,179 | 67 Token/s | 2026-06-30 |
| 35 | Inkling (xhigh)推理模型 | Thinking Machines | 32.3 | 40.7 | 开放权重 | — | — | 18,519 | — | 2026-07-15 |
| 36 | DeepSeek V4 Flash (Reasoning, Max Effort)推理模型 | DeepSeek | 31.1 | 40.3 | 开放权重 | US$0.02 | 2.46 分钟 | 19,661 | 133 Token/s | 2026-04-24 |
| 37 | Nex-N2-Pro推理模型 | Nex AGI | 31.0 | 41.0 | 开放权重 | — | 4.95 分钟 | 40,702 | 137 Token/s | 2026-06-02 |
| 38 | GPT-5.6 Luna (medium)推理模型 | OpenAI | 31.0 | 38.1 | 闭源 | US$0.08 | 0.40 分钟 | 4,714 | 198 Token/s | 2026-07-09 |
| 39 | Hy3推理模型 | Tencent | 30.7 | 41.2 | 开放权重 | US$0.00 | 7.22 分钟 | 25,512 | 59 Token/s | 2026-07-06 |
| 40 | GPT-5.6 Terra (low)推理模型 | OpenAI | 30.6 | 40.5 | 闭源 | US$0.25 | 0.43 分钟 | 3,339 | 130 Token/s | 2026-07-09 |
| 41 | Qwen3.7 Max推理模型 | Alibaba | 30.6 | 46.0 | 闭源 | US$2.61 | 1.36 分钟 | 16,621 | 204 Token/s | 2026-05-19 |
| 42 | GPT-5.5 (low)推理模型 | OpenAI | 30.4 | 43.5 | 闭源 | US$0.51 | 0.63 分钟 | 2,897 | 77 Token/s | 2026-04-23 |
| 43 | Kimi K2.6推理模型 | Kimi | 30.3 | 44.2 | 开放权重 | US$0.45 | 5.85 分钟 | 18,057 | 51 Token/s | 2026-04-20 |
| 44 | GPT-5.4 mini (xhigh)推理模型 | OpenAI | 30.2 | 40.0 | 闭源 | US$0.60 | 5.19 分钟 | 52,097 | 167 Token/s | 2026-03-17 |
| 45 | GLM-5.1 (Reasoning)推理模型 | Z AI | 29.9 | 40.2 | 开放权重 | US$0.37 | 3.98 分钟 | 19,653 | 82 Token/s | 2026-04-07 |
| 46 | Kimi K2.7 Code推理模型 | Kimi | 29.6 | 41.9 | 开放权重 | — | 4.75 分钟 | 13,680 | 48 Token/s | 2026-06-12 |
| 47 | GPT-5.6 Terra (Non-reasoning)非推理模型 | OpenAI | 29.3 | 34.0 | 闭源 | US$0.28 | 0.43 分钟 | 3,261 | 126 Token/s | 2026-07-09 |
| 48 | MiMo-V2.5-Pro推理模型 | Xiaomi | 29.1 | 42.2 | 开放权重 | US$0.03 | 4.30 分钟 | 15,007 | 58 Token/s | 2026-04-22 |
| 49 | Muse Spark推理模型 | Meta | 28.7 | 43.1 | 闭源 | — | — | 9,460 | — | 2026-04-08 |
| 50 | Grok Build 0.1 0616推理模型 | SpaceXAI | 28.0 | 39.8 | 闭源 | US$0.18 | 3.89 分钟 | 20,586 | 88 Token/s | 2026-06-16 |
| 51 | Qwen3.6 Plus推理模型 | Alibaba | 27.6 | 39.6 | 闭源 | US$0.55 | 7.22 分钟 | 22,954 | 53 Token/s | 2026-04-02 |
| 52 | GPT-5.4 nano (xhigh)推理模型 | OpenAI | 27.5 | 38.2 | 闭源 | US$0.23 | 7.26 分钟 | 74,470 | 171 Token/s | 2026-03-17 |
| 53 | Nemotron 3 Ultra 550B A55B (Reasoning)推理模型 | NVIDIA | 27.4 | 37.8 | 开放权重 | US$0.32 | 1.46 分钟 | 18,390 | 209 Token/s | 2026-06-04 |
| 54 | Qwen3.6 27B (Reasoning)推理模型 | Alibaba | 27.0 | 37.1 | 开放权重 | US$0.39 | 5.70 分钟 | 19,582 | 57 Token/s | 2026-04-22 |
| 55 | GPT-5.5 (Non-reasoning)非推理模型 | OpenAI | 25.8 | 35.4 | 闭源 | US$0.38 | 0.50 分钟 | 2,310 | 77 Token/s | 2026-04-23 |
| 56 | GPT-5 (high)推理模型 | OpenAI | 25.7 | 34.7 | 闭源 | US$0.49 | 3.81 分钟 | 21,622 | 95 Token/s | 2025-08-07 |
| 57 | MiniMax-M2.7推理模型 | MiniMax | 25.6 | 38.1 | 开放权重 | — | 3.34 分钟 | 14,933 | 74 Token/s | 2026-03-18 |
| 58 | GPT-5.6 Luna (low)推理模型 | OpenAI | 25.4 | 33.3 | 闭源 | US$0.05 | 0.25 分钟 | 2,960 | 198 Token/s | 2026-07-09 |
| 59 | GLM-4.7 (Reasoning)推理模型 | Z AI | 25.4 | 33.7 | 开放权重 | US$0.45 | 3.05 分钟 | 22,831 | 125 Token/s | 2025-12-22 |
| 60 | Claude 4.5 Sonnet (Reasoning)推理模型 | Anthropic | 24.6 | 36.4 | 闭源 | US$0.63 | 5.26 分钟 | 13,528 | 43 Token/s | 2025-09-29 |
| 61 | Grok 4.3 (high)推理模型 | SpaceXAI | 24.1 | 37.6 | 闭源 | US$0.12 | 1.35 分钟 | 10,217 | 126 Token/s | 2026-04-30 |
| 62 | MiMo-V2.5推理模型 | Xiaomi | 23.7 | 37.2 | 开放权重 | US$0.01 | 3.00 分钟 | 11,331 | 63 Token/s | 2026-04-22 |
| 63 | Qwen3.6 27B (Non-reasoning)非推理模型 | Alibaba | 23.3 | 30.5 | 开放权重 | US$0.52 | 3.67 分钟 | 12,838 | 58 Token/s | 2026-04-22 |
| 64 | Grok 4.3 (Non-reasoning)非推理模型 | SpaceXAI | 22.8 | 24.8 | 闭源 | US$0.14 | 1.31 分钟 | 8,366 | 107 Token/s | 2026-04-30 |
| 65 | GPT-5.6 Luna (Non-reasoning)非推理模型 | OpenAI | 22.0 | 26.6 | 闭源 | US$0.06 | 0.20 分钟 | 2,426 | 203 Token/s | 2026-07-09 |
| 66 | LongCat 2.0推理模型 | LongCat | 21.8 | 33.5 | 开放权重 | — | — | 19,544 | — | 2026-06-29 |
| 67 | Kimi K2.5 (Reasoning)推理模型 | Kimi | 21.7 | 35.4 | 开放权重 | — | 3.47 分钟 | 10,750 | 52 Token/s | 2026-01-27 |
| 68 | Step 3.7 Flash推理模型 | StepFun | 21.5 | 30.3 | 开放权重 | — | 0.87 分钟 | 21,302 | 407 Token/s | 2026-05-29 |
| 69 | Qwen3.6 35B A3B (Reasoning)推理模型 | Alibaba | 21.4 | 31.6 | 开放权重 | US$0.23 | 2.51 分钟 | 22,831 | 151 Token/s | 2026-04-16 |
| 70 | Gemini 3.1 Pro Preview推理模型 | 21.4 | 46.5 | 闭源 | US$0.54 | 1.20 分钟 | 9,336 | 129 Token/s | 2026-02-19 | |
| 71 | GPT-5.1 (high)推理模型 | OpenAI | 21.0 | 36.9 | 闭源 | US$0.39 | 3.96 分钟 | 25,203 | 106 Token/s | 2025-11-13 |
| 72 | Qwen3.7 Plus推理模型 | Alibaba | 20.8 | 39.0 | 闭源 | US$0.25 | 3.42 分钟 | 10,920 | 53 Token/s | 2026-06-01 |
| 73 | Qwen3.5 122B A10B (Reasoning)推理模型 | Alibaba | 20.7 | 32.3 | 开放权重 | US$0.25 | 1.49 分钟 | 11,835 | 132 Token/s | 2026-02-24 |
| 74 | Qwen3.5 397B A17B (Reasoning)推理模型 | Alibaba | 19.8 | 33.7 | 开放权重 | US$0.39 | 3.08 分钟 | 11,607 | 63 Token/s | 2026-02-16 |
| 75 | GPT-5 mini (high)推理模型 | OpenAI | 19.4 | 25.3 | 闭源 | — | 3.61 分钟 | 23,518 | 109 Token/s | 2025-08-07 |
| 76 | Qwen3.6 35B A3B (Non-reasoning)非推理模型 | Alibaba | 19.1 | 24.2 | 开放权重 | US$0.63 | 1.64 分钟 | 19,216 | 195 Token/s | 2026-04-16 |
| 77 | Mistral Medium 3.5推理模型 | Mistral | 19.0 | 29.9 | 开放权重 | US$0.69 | 2.07 分钟 | 15,716 | 127 Token/s | 2026-04-29 |
| 78 | Ring-2.6-1T推理模型 | InclusionAI | 18.9 | 30.6 | 开放权重 | US$0.33 | 2.37 分钟 | 18,607 | 131 Token/s | 2026-05-08 |
| 79 | DeepSeek V3.2 (Reasoning)推理模型 | DeepSeek | 18.3 | 32.0 | 开放权重 | — | — | 12,447 | — | 2025-12-01 |
| 80 | DeepSeek V3.1 Terminus (Reasoning)推理模型 | DeepSeek | 18.1 | 30.4 | 开放权重 | US$2.31 | — | 9,528 | — | 2025-09-22 |
| 81 | GLM-4.6 (Reasoning)推理模型 | Z AI | 17.7 | 28.7 | 开放权重 | US$0.30 | 4.01 分钟 | 11,541 | 48 Token/s | 2025-09-30 |
| 82 | Claude 4 Sonnet (Reasoning)推理模型 | Anthropic | 16.6 | 28.9 | 闭源 | — | — | 9,008 | — | 2025-05-22 |
| 83 | Claude 4.5 Haiku (Reasoning)推理模型 | Anthropic | 16.4 | 29.6 | 闭源 | US$0.22 | 2.27 分钟 | 13,191 | 97 Token/s | 2025-10-15 |
| 84 | Qwen3.5 122B A10B (Non-reasoning)非推理模型 | Alibaba | 15.8 | 27.6 | 开放权重 | US$0.19 | 1.04 分钟 | 9,164 | 146 Token/s | 2026-02-24 |
| 85 | KAT Coder Pro V2非推理模型 | KwaiKAT | 15.5 | 33.7 | 闭源 | — | — | 8,048 | — | 2026-03-27 |
| 86 | Gemma 4 31B (Reasoning)推理模型 | 14.4 | 29.4 | 开放权重 | — | 5.29 分钟 | 11,127 | 35 Token/s | 2026-04-02 | |
| 87 | gpt-oss-120b (high)推理模型 | OpenAI | 13.2 | 23.8 | 开放权重 | US$0.16 | 1.49 分钟 | 27,871 | 312 Token/s | 2025-08-05 |
| 88 | MiMo-V2-Flash (Non-reasoning)非推理模型 | Xiaomi | 12.0 | 24.7 | 开放权重 | — | — | 53,440 | — | 2025-12-16 |
| 89 | Qwen3.5 35B A3B (Non-reasoning)非推理模型 | Alibaba | 11.8 | 24.0 | 开放权重 | US$0.19 | 1.49 分钟 | 13,211 | 147 Token/s | 2026-02-24 |
| 90 | GPT-5.5 Instant (June 2026)推理模型 | OpenAI | 11.0 | 28.9 | 闭源 | US$0.18 | — | 1,319 | — | 2026-06-25 |
| 91 | Gemma 4 26B A4B (Reasoning)推理模型 | 11.0 | 25.7 | 开放权重 | US$0.06 | — | 18,564 | — | 2026-04-02 | |
| 92 | Gemma 4 31B (Non-reasoning)非推理模型 | 11.0 | 21.8 | 开放权重 | US$0.04 | 0.86 分钟 | 3,524 | 69 Token/s | 2026-04-02 | |
| 93 | Devstral 2非推理模型 | Mistral | 10.6 | 19.2 | 开放权重 | US$0.00 | 1.46 分钟 | 6,137 | 70 Token/s | 2025-12-09 |
| 94 | Devstral Small 2非推理模型 | Mistral | 10.5 | 17.4 | 开放权重 | US$0.00 | 1.44 分钟 | 6,716 | 77 Token/s | 2025-12-09 |
| 95 | Mercury 2推理模型 | Inception | 9.6 | 21.4 | 闭源 | US$0.07 | 0.19 分钟 | 11,660 | 1039 Token/s | 2026-02-20 |
| 96 | Command A+推理模型 | Cohere | 9.2 | 22.5 | 开放权重 | US$0.00 | 1.31 分钟 | 13,710 | 174 Token/s | 2026-05-20 |
| 97 | Qwen3 Coder Next非推理模型 | Alibaba | 8.8 | 21.1 | 开放权重 | US$0.19 | 1.77 分钟 | 10,425 | 98 Token/s | 2026-02-03 |
| 98 | NVIDIA Nemotron 3 Super 120B A12B (Reasoning)推理模型 | NVIDIA | 8.7 | 25.4 | 开放权重 | US$0.41 | 1.61 分钟 | 23,678 | 246 Token/s | 2026-03-11 |
| 99 | Qwen3.5 9B (Reasoning)推理模型 | Alibaba | 7.4 | 21.4 | 开放权重 | US$0.26 | 9.89 分钟 | 34,804 | 59 Token/s | 2026-03-02 |
| 100 | Gemini 2.5 Pro推理模型 | 7.1 | 25.8 | 闭源 | US$0.25 | 0.87 分钟 | 7,569 | 144 Token/s | 2025-06-05 | |
| 101 | Nova 2.0 Pro Preview (medium)推理模型 | Amazon | 7.0 | 21.8 | 闭源 | US$0.18 | 1.16 分钟 | 9,134 | 131 Token/s | 2025-11-27 |
| 102 | HyperNova 60B 2605推理模型 | Multiverse Computing | 6.7 | 17.8 | 开放权重 | US$0.05 | 1.91 分钟 | 42,382 | 370 Token/s | 2026-05-26 |
| 103 | Nova 2.0 Pro Preview (low)推理模型 | Amazon | 6.4 | 19.6 | 闭源 | US$0.21 | 0.58 分钟 | 4,520 | 129 Token/s | 2025-11-27 |
| 104 | Gemini 3.1 Flash-Lite推理模型 | 6.2 | 25.0 | 闭源 | US$0.03 | 0.33 分钟 | 6,639 | 335 Token/s | 2026-03-03 | |
| 105 | Mistral Medium 3.1非推理模型 | Mistral | 6.2 | 14.7 | 闭源 | US$0.24 | 0.89 分钟 | 4,692 | 88 Token/s | 2025-08-12 |
| 106 | Qwen3.5 0.8B (Reasoning)推理模型 | Alibaba | 5.7 | 5.5 | 开放权重 | — | — | — | — | 2026-03-02 |
| 107 | Mistral Large 3非推理模型 | Mistral | 5.5 | 15.9 | 开放权重 | US$0.21 | 1.55 分钟 | 4,837 | 52 Token/s | 2025-12-02 |
| 108 | Mistral Small 3.1非推理模型 | Mistral | 5.2 | 14.7 | 开放权重 | US$0.05 | 0.59 分钟 | 5,295 | 149 Token/s | 2025-03-17 |
| 109 | Mistral Small 4 (Reasoning)推理模型 | Mistral | 4.7 | 19.6 | 开放权重 | US$0.06 | 0.69 分钟 | 6,549 | 159 Token/s | 2026-03-16 |
| 110 | Qwen3 235B A22B 2507 (Reasoning)推理模型 | Alibaba | 3.8 | 19.6 | 开放权重 | — | 7.13 分钟 | 27,460 | 64 Token/s | 2025-07-25 |
| 111 | Nova 2.0 Lite (high)推理模型 | Amazon | 3.1 | 18.2 | 闭源 | US$0.07 | 2.14 分钟 | 19,396 | 151 Token/s | 2025-10-29 |
| 112 | North Mini Code推理模型 | Cohere | 3.1 | 19.8 | 开放权重 | US$0.00 | 1.93 分钟 | 13,055 | 112 Token/s | 2026-06-09 |
| 113 | gpt-oss-20b (high)推理模型 | OpenAI | 3.1 | 14.9 | 开放权重 | US$0.05 | 1.97 分钟 | 26,557 | 225 Token/s | 2025-08-05 |
| 114 | DeepSeek R1 (Jan '25)推理模型 | DeepSeek | 3.1 | 18.5 | 开放权重 | US$0.60 | — | 25,750 | — | 2025-01-20 |
| 115 | Nova 2.0 Pro Preview (Non-reasoning)非推理模型 | Amazon | 2.9 | 14.4 | 闭源 | US$0.23 | 0.56 分钟 | 3,792 | 114 Token/s | 2025-11-27 |
| 116 | Solar Pro 3推理模型 | Upstage | 2.7 | 14.1 | 闭源 | — | — | 62,045 | — | 2026-04-06 |
| 117 | NVIDIA Nemotron 3 Nano 4B推理模型 | NVIDIA | 2.3 | 8.7 | 开放权重 | — | — | 11,962 | — | 2026-03-16 |
| 118 | Ling 2.6 Flash非推理模型 | InclusionAI | 2.3 | 14.1 | 开放权重 | — | 1.29 分钟 | 13,959 | 180 Token/s | 2026-04-21 |
| 119 | DiffusionGemma 26B A4B推理模型 | 2.2 | 13.5 | 开放权重 | — | — | 22,197 | — | 2026-06-10 | |
| 120 | Ministral 3 14B非推理模型 | Mistral | 2.2 | 11.1 | 开放权重 | US$0.17 | 1.80 分钟 | 6,662 | 62 Token/s | 2025-12-02 |
| 121 | Qwen3 Next 80B A3B (Reasoning)推理模型 | Alibaba | 2.1 | 16.7 | 开放权重 | US$0.29 | 3.27 分钟 | 35,469 | 181 Token/s | 2025-09-11 |
| 122 | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)推理模型 | NVIDIA | 2.0 | 14.2 | 开放权重 | US$0.06 | 5.47 分钟 | 52,594 | 160 Token/s | 2025-12-15 |
| 123 | Mistral Small 3.2非推理模型 | Mistral | 2.0 | 10.6 | 开放权重 | US$0.24 | 1.21 分钟 | 11,189 | 154 Token/s | 2025-06-20 |
| 124 | Claude 3.5 Haiku非推理模型 | Anthropic | 1.9 | 12.3 | 闭源 | — | — | 2,806 | — | 2024-10-22 |
| 125 | Magistral Medium 1.2推理模型 | Mistral | 1.9 | 17.9 | 闭源 | US$1.35 | 2.81 分钟 | 7,134 | 42 Token/s | 2025-09-18 |
| 126 | K2 Think V2推理模型 | MBZUAI Institute of Foundation Models | 1.8 | 17.3 | 开放权重 | — | — | 13,544 | — | 2025-12-15 |
| 127 | Qwen3 32B (Reasoning)推理模型 | Alibaba | 1.8 | 11.5 | 开放权重 | US$0.21 | 2.71 分钟 | 15,776 | 97 Token/s | 2025-04-28 |
| 128 | Qwen3 30B A3B 2507 (Reasoning)推理模型 | Alibaba | 1.8 | 14.4 | 开放权重 | US$0.11 | 3.43 分钟 | 30,488 | 148 Token/s | 2025-07-30 |
| 129 | Qwen3 14B (Reasoning)推理模型 | Alibaba | 1.8 | 10.4 | 开放权重 | — | 2.22 分钟 | 8,247 | 62 Token/s | 2025-04-28 |
| 130 | GPT-4.1 mini非推理模型 | OpenAI | 1.7 | 14.8 | 闭源 | US$0.16 | 0.68 分钟 | 3,419 | 84 Token/s | 2025-04-14 |
| 131 | o3-mini (high)推理模型 | OpenAI | 1.7 | 15.6 | 闭源 | — | 2.80 分钟 | 38,062 | 227 Token/s | 2025-01-31 |
| 132 | Ministral 3 3B非推理模型 | Mistral | 1.6 | 6.8 | 开放权重 | US$0.10 | 2.39 分钟 | 23,579 | 164 Token/s | 2025-12-02 |
| 133 | DeepSeek V3 (Dec '24)非推理模型 | DeepSeek | 1.6 | 14.2 | 开放权重 | US$0.02 | — | 3,011 | — | 2024-12-26 |
| 134 | DeepSeek V3 0324非推理模型 | DeepSeek | 1.5 | 15.4 | 开放权重 | US$0.09 | — | 2,026 | — | 2025-03-25 |
| 135 | Qwen3 8B (Reasoning)推理模型 | Alibaba | 1.5 | 8.3 | 开放权重 | — | 5.58 分钟 | 13,178 | 39 Token/s | 2025-04-28 |
| 136 | Magistral Small 1.2推理模型 | Mistral | 1.4 | 11.3 | 开放权重 | US$0.50 | 2.68 分钟 | 13,084 | 81 Token/s | 2025-09-17 |
| 137 | MiniCPM-V 4.6 1.3B非推理模型 | OpenBMB | 1.4 | 4.2 | 开放权重 | — | — | 16,557 | — | 2026-05-11 |
| 138 | Llama 4 Maverick非推理模型 | Meta | 1.3 | 14.3 | 开放权重 | US$0.08 | 0.54 分钟 | 3,589 | 112 Token/s | 2025-04-05 |
| 139 | Granite 4.1 30B非推理模型 | IBM | 1.3 | 8.9 | 开放权重 | — | — | 6,514 | — | 2026-04-29 |
| 140 | Ministral 3 8B非推理模型 | Mistral | 1.2 | 9.0 | 开放权重 | US$0.06 | 0.96 分钟 | 6,577 | 114 Token/s | 2025-12-02 |
| 141 | GPT-4.1 nano非推理模型 | OpenAI | 1.2 | 9.6 | 闭源 | US$0.08 | 1.21 分钟 | 14,283 | 196 Token/s | 2025-04-14 |
| 142 | Llama 4 Scout非推理模型 | Meta | 1.1 | 10.0 | 开放权重 | US$0.02 | 0.28 分钟 | 1,407 | 83 Token/s | 2025-04-05 |
| 143 | gpt-oss-120b (low)推理模型 | OpenAI | 1.0 | 14.9 | 开放权重 | US$0.04 | 0.23 分钟 | 4,536 | 332 Token/s | 2025-08-05 |
| 144 | GPT-4o mini非推理模型 | OpenAI | 1.0 | — | 闭源 | US$0.11 | 1.34 分钟 | 6,623 | 83 Token/s | 2024-07-18 |
| 145 | Qwen3.5 2B (Reasoning)推理模型 | Alibaba | 0.8 | 7.6 | 开放权重 | — | — | 30,340 | — | 2026-03-02 |
| 146 | Qwen3.5 2B (Non-reasoning)非推理模型 | Alibaba | 0.8 | 5.6 | 开放权重 | — | — | 34,966 | — | 2026-03-02 |
| 147 | Llama 3.1 Instruct 8B非推理模型 | Meta | 0.5 | 7.6 | 开放权重 | US$0.22 | 1.90 分钟 | 16,750 | 147 Token/s | 2024-07-23 |
| 148 | Granite 4.1 3B非推理模型 | IBM | 0.4 | 4.7 | 开放权重 | — | — | 8,907 | — | 2026-04-29 |
| 149 | Qwen3.5 0.8B (Non-reasoning)非推理模型 | Alibaba | 0.4 | 3.3 | 开放权重 | — | — | 30,662 | — | 2026-03-02 |
| 150 | Llama 3.3 Instruct 70B非推理模型 | Meta | 0.3 | 9.4 | 开放权重 | US$0.12 | 0.44 分钟 | 2,232 | 85 Token/s | 2024-12-06 |
| 151 | Phi-4 Mini Instruct非推理模型 | Microsoft | 0.3 | 6.0 | 开放权重 | US$0.00 | 20.53 分钟 | 55,255 | 45 Token/s | 2024-02-26 |
| 152 | Gemma 3 27B Instruct非推理模型 | 0.3 | 7.4 | 开放权重 | — | — | 11,563 | — | 2025-03-12 | |
| 153 | Gemma 3 12B Instruct非推理模型 | 0.3 | 5.5 | 开放权重 | — | — | 41,195 | — | 2025-03-12 | |
| 154 | Nanbeige4.1-3B推理模型 | Nanbeige | 0.0 | 11.1 | 开放权重 | — | — | 156,464 | — | 2026-02-11 |
本站展示的是 2026-07-21 公开快照,不是医疗、法律或行业产品认证。核验原始榜单 ↗
INDEX BREAKDOWN
指数由什么构成
权重来自 Artificial Analysis 的 Capability Indices Methodology;各底层评测由来源方独立运行。
50%
Agentic Knowledge Work
使用工具规划并完成多步骤真实知识工作。
50%
Agentic Customer Interaction
在知识库和工具支持下完成多轮客户交互。
HOW TO READ
怎样理解这个指数
在来源设定的加权任务组合中,哪些模型整体表现更强,以及优势来自哪些能力维度。
不能直接证明模型适合你的真实工作流,也不是安全性、合规性或专业部署认证。
结合单项评测、成本、速度、上下文、Provider 稳定性和你自己的任务验证。