按职业任务出现频率加权
Industry Capability Index
财务与会计
覆盖会计、公司金融、投资知识、量化推理、长文档分析和工具化工作流。
本站保留来源分数,不重新计算
每项权重与组成评测独立列出
来源指数 55 分
SOURCE LEADERBOARD
来源完整榜单
Artificial Analysis 财务与会计,数值越高越好。同名模型的具体推理档位以原始来源为准。
| # | 模型 | 机构 | 能力指数 | 智能指数 | 开放性 | 单任务成本 | 任务耗时 | 输出 Token | 生成速度 | 发布日期 |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)推理模型 | Anthropic | 54.9 | 59.9 | 闭源 | US$3.01 | 7.00 分钟 | 28,698 | 68 Token/s | 2026-06-09 |
| 2 | GPT-5.6 Sol (max)推理模型 | OpenAI | 50.9 | 58.9 | 闭源 | US$1.36 | 4.53 分钟 | 17,234 | 63 Token/s | 2026-07-09 |
| 3 | GPT-5.6 Sol (xhigh)推理模型 | OpenAI | 49.3 | 57.7 | 闭源 | US$0.87 | 3.21 分钟 | 11,549 | 60 Token/s | 2026-07-09 |
| 4 | Kimi K3推理模型 | Kimi | 48.3 | 57.1 | 闭源 | US$1.24 | 11.57 分钟 | 27,411 | 39 Token/s | 2026-07-16 |
| 5 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort)推理模型 | Anthropic | 47.7 | 55.7 | 闭源 | US$1.74 | 10.15 分钟 | 36,333 | 60 Token/s | 2026-05-28 |
| 6 | GPT-5.6 Sol (high)推理模型 | OpenAI | 47.6 | 55.9 | 闭源 | US$0.57 | 2.30 分钟 | 7,951 | 58 Token/s | 2026-07-09 |
| 7 | GPT-5.5 (xhigh)推理模型 | OpenAI | 46.2 | 54.8 | 闭源 | US$1.02 | 2.48 分钟 | 12,235 | 82 Token/s | 2026-04-23 |
| 8 | GPT-5.6 Sol (medium)推理模型 | OpenAI | 45.9 | 53.6 | 闭源 | US$0.36 | 1.43 分钟 | 4,901 | 57 Token/s | 2026-07-09 |
| 9 | Grok 4.5 (high)推理模型 | SpaceXAI | 45.8 | 53.8 | 闭源 | US$0.30 | 3.23 分钟 | 13,522 | 70 Token/s | 2026-07-08 |
| 10 | GPT-5.5 (high)推理模型 | OpenAI | 45.0 | 53.1 | 闭源 | US$0.68 | 1.75 分钟 | 8,211 | 78 Token/s | 2026-04-23 |
| 11 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort)推理模型 | Anthropic | 44.9 | 53.5 | 闭源 | US$1.88 | 8.12 分钟 | 25,867 | 53 Token/s | 2026-04-16 |
| 12 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort)推理模型 | Anthropic | 43.9 | 53.4 | 闭源 | US$1.75 | 13.57 分钟 | 60,487 | 74 Token/s | 2026-06-30 |
| 13 | GPT-5.6 Terra (max)推理模型 | OpenAI | 43.4 | 55.0 | 闭源 | US$0.97 | 2.14 分钟 | 19,215 | 150 Token/s | 2026-07-09 |
| 14 | Gemini 3.5 Flash (high)推理模型 | 43.4 | 50.2 | 闭源 | US$0.67 | 3.04 分钟 | 31,847 | 175 Token/s | 2026-05-19 | |
| 15 | GPT-5.6 Sol (low)推理模型 | OpenAI | 42.8 | 49.4 | 闭源 | US$0.20 | 0.80 分钟 | 2,696 | 56 Token/s | 2026-07-09 |
| 16 | GPT-5.5 (medium)推理模型 | OpenAI | 42.6 | 50.4 | 闭源 | US$0.42 | 1.10 分钟 | 4,913 | 74 Token/s | 2026-04-23 |
| 17 | GPT-5.6 Terra (xhigh)推理模型 | OpenAI | 41.9 | 51.6 | 闭源 | US$0.57 | 1.48 分钟 | 11,620 | 131 Token/s | 2026-07-09 |
| 18 | Muse Spark 1.1 (xhigh)推理模型 | Meta | 41.5 | 50.6 | 闭源 | US$0.17 | 1.96 分钟 | 14,916 | 127 Token/s | 2026-07-09 |
| 19 | GPT-5.4 (xhigh)推理模型 | OpenAI | 41.3 | 51.4 | 闭源 | US$0.17 | 2.42 分钟 | 21,690 | 149 Token/s | 2026-03-05 |
| 20 | GPT-5.6 Luna (max)推理模型 | OpenAI | 41.3 | 51.2 | 闭源 | US$0.23 | 1.63 分钟 | 19,248 | 197 Token/s | 2026-07-09 |
| 21 | GPT-5.6 Terra (high)推理模型 | OpenAI | 40.0 | 49.0 | 闭源 | US$0.38 | 1.04 分钟 | 8,075 | 130 Token/s | 2026-07-09 |
| 22 | GPT-5.6 Luna (xhigh)推理模型 | OpenAI | 39.7 | 49.1 | 闭源 | US$0.15 | 1.02 分钟 | 12,308 | 200 Token/s | 2026-07-09 |
| 23 | GLM-5.2 (max)推理模型 | Z AI | 39.0 | 51.1 | 开放权重 | US$0.48 | 2.94 分钟 | 34,564 | 196 Token/s | 2026-06-16 |
| 24 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)推理模型 | Anthropic | 38.9 | 47.2 | 闭源 | US$0.88 | 10.11 分钟 | 32,538 | 54 Token/s | 2026-02-17 |
| 25 | Gemini 3.1 Pro Preview推理模型 | 38.7 | 46.5 | 闭源 | US$0.22 | 1.04 分钟 | 8,069 | 129 Token/s | 2026-02-19 | |
| 26 | GPT-5.5 (low)推理模型 | OpenAI | 37.4 | 43.5 | 闭源 | US$0.18 | 0.38 分钟 | 1,730 | 77 Token/s | 2026-04-23 |
| 27 | GPT-5.6 Luna (high)推理模型 | OpenAI | 37.4 | 46.1 | 闭源 | US$0.09 | 0.68 分钟 | 7,861 | 193 Token/s | 2026-07-09 |
| 28 | DeepSeek V4 Pro (Reasoning, Max Effort)推理模型 | DeepSeek | 36.8 | 44.3 | 开放权重 | US$0.03 | 5.52 分钟 | 23,624 | 71 Token/s | 2026-04-24 |
| 29 | Muse Spark推理模型 | Meta | 36.6 | 43.1 | 闭源 | — | — | 7,722 | — | 2026-04-08 |
| 30 | DeepSeek V4 Pro (Reasoning, High Effort)推理模型 | DeepSeek | 36.5 | 43.1 | 开放权重 | US$0.03 | 3.90 分钟 | 16,039 | 69 Token/s | 2026-04-24 |
| 31 | GPT-5.6 Terra (medium)推理模型 | OpenAI | 36.4 | 45.6 | 闭源 | US$0.16 | 0.47 分钟 | 3,609 | 128 Token/s | 2026-07-09 |
| 32 | Grok Build 0.1 0616推理模型 | SpaceXAI | 36.3 | 39.8 | 闭源 | US$0.09 | 3.53 分钟 | 18,668 | 88 Token/s | 2026-06-16 |
| 33 | Inkling (xhigh)推理模型 | Thinking Machines | 36.2 | 40.7 | 开放权重 | US$0.08 | — | 18,049 | — | 2026-07-15 |
| 34 | Qwen3.7 Max推理模型 | Alibaba | 35.4 | 46.0 | 闭源 | US$0.84 | 1.23 分钟 | 15,003 | 204 Token/s | 2026-05-19 |
| 35 | Kimi K2.6推理模型 | Kimi | 34.9 | 44.2 | 开放权重 | US$0.25 | 6.37 分钟 | 19,651 | 51 Token/s | 2026-04-20 |
| 36 | MiniMax-M3推理模型 | MiniMax | 34.3 | 44.4 | 开放权重 | US$0.12 | 2.90 分钟 | 18,792 | 108 Token/s | 2026-06-01 |
| 37 | GPT-5.6 Sol (Non-reasoning)非推理模型 | OpenAI | 33.9 | 41.2 | 闭源 | US$0.18 | 0.57 分钟 | 1,917 | 56 Token/s | 2026-07-09 |
| 38 | Kimi K2.7 Code推理模型 | Kimi | 33.6 | 41.9 | 开放权重 | US$0.06 | 4.80 分钟 | 13,814 | 48 Token/s | 2026-06-12 |
| 39 | Motif 3 (Beta)推理模型 | Motif Technologies | 33.0 | 44.1 | 闭源 | — | — | 27,094 | — | — |
| 40 | Grok 4.3 (high)推理模型 | SpaceXAI | 32.7 | 37.6 | 闭源 | US$0.06 | 1.48 分钟 | 11,184 | 126 Token/s | 2026-04-30 |
| 41 | GPT-5.6 Terra (low)推理模型 | OpenAI | 32.7 | 40.5 | 闭源 | US$0.09 | 0.25 分钟 | 1,979 | 130 Token/s | 2026-07-09 |
| 42 | GPT-5 (high)推理模型 | OpenAI | 32.3 | 34.7 | 闭源 | US$0.23 | 2.31 分钟 | 13,109 | 95 Token/s | 2025-08-07 |
| 43 | MiMo-V2.5-Pro推理模型 | Xiaomi | 32.3 | 42.2 | 开放权重 | US$0.02 | 4.09 分钟 | 14,264 | 58 Token/s | 2026-04-22 |
| 44 | Claude Sonnet 5 (Non-reasoning, High Effort)非推理模型 | Anthropic | 32.0 | 41.7 | 闭源 | US$0.36 | 2.31 分钟 | 9,297 | 67 Token/s | 2026-06-30 |
| 45 | Hy3推理模型 | Tencent | 31.9 | 41.2 | 开放权重 | US$0.00 | 5.69 分钟 | 20,124 | 59 Token/s | 2026-07-06 |
| 46 | GPT-5.6 Luna (medium)推理模型 | OpenAI | 31.9 | 38.1 | 闭源 | US$0.04 | 0.26 分钟 | 3,047 | 198 Token/s | 2026-07-09 |
| 47 | Nex-N2-Pro推理模型 | Nex AGI | 31.8 | 41.0 | 开放权重 | US$0.03 | 3.43 分钟 | 28,191 | 137 Token/s | 2026-06-02 |
| 48 | DeepSeek V4 Flash (Reasoning, Max Effort)推理模型 | DeepSeek | 31.3 | 40.3 | 开放权重 | US$0.01 | 3.33 分钟 | 26,556 | 133 Token/s | 2026-04-24 |
| 49 | GPT-5.1 (high)推理模型 | OpenAI | 31.2 | 36.9 | 闭源 | US$0.20 | 2.29 分钟 | 14,570 | 106 Token/s | 2025-11-13 |
| 50 | GLM-5.1 (Reasoning)推理模型 | Z AI | 30.5 | 40.2 | 开放权重 | US$0.20 | 3.79 分钟 | 18,731 | 82 Token/s | 2026-04-07 |
| 51 | GPT-5.4 mini (xhigh)推理模型 | OpenAI | 30.2 | 40.0 | 闭源 | US$0.29 | 3.49 分钟 | 35,040 | 167 Token/s | 2026-03-17 |
| 52 | Kimi K2.5 (Reasoning)推理模型 | Kimi | 30.1 | 35.4 | 开放权重 | US$0.04 | 3.75 分钟 | 11,630 | 52 Token/s | 2026-01-27 |
| 53 | JT-4.1 Flash 236B A21B非推理模型 | China Mobile | 30.0 | 38.8 | 闭源 | — | — | 18,919 | — | 2026-07-09 |
| 54 | MiniMax-M2.7推理模型 | MiniMax | 29.9 | 38.1 | 开放权重 | US$0.01 | 3.07 分钟 | 13,711 | 74 Token/s | 2026-03-18 |
| 55 | Qwen3.6 Plus推理模型 | Alibaba | 29.9 | 39.6 | 闭源 | US$0.24 | 5.51 分钟 | 17,536 | 53 Token/s | 2026-04-02 |
| 56 | Nemotron 3 Ultra 550B A55B (Reasoning)推理模型 | NVIDIA | 29.6 | 37.8 | 开放权重 | US$0.16 | 1.37 分钟 | 17,196 | 209 Token/s | 2026-06-04 |
| 57 | GPT-5.5 (Non-reasoning)非推理模型 | OpenAI | 28.3 | 35.4 | 闭源 | US$0.13 | 0.25 分钟 | 1,146 | 77 Token/s | 2026-04-23 |
| 58 | GPT-5.4 nano (xhigh)推理模型 | OpenAI | 28.3 | 38.2 | 闭源 | US$0.11 | 4.08 分钟 | 41,839 | 171 Token/s | 2026-03-17 |
| 59 | GPT-5.6 Luna (low)推理模型 | OpenAI | 28.2 | 33.3 | 闭源 | US$0.02 | 0.15 分钟 | 1,798 | 198 Token/s | 2026-07-09 |
| 60 | Claude 4.5 Sonnet (Reasoning)推理模型 | Anthropic | 28.2 | 36.4 | 闭源 | US$0.31 | 4.04 分钟 | 10,395 | 43 Token/s | 2025-09-29 |
| 61 | LongCat 2.0推理模型 | LongCat | 27.6 | 33.5 | 开放权重 | — | — | 19,691 | — | 2026-06-29 |
| 62 | Qwen3.7 Plus推理模型 | Alibaba | 27.5 | 39.0 | 闭源 | US$0.09 | 4.11 分钟 | 13,129 | 53 Token/s | 2026-06-01 |
| 63 | GLM-4.7 (Reasoning)推理模型 | Z AI | 27.3 | 33.7 | 开放权重 | US$0.22 | 3.19 分钟 | 23,820 | 125 Token/s | 2025-12-22 |
| 64 | GLM-5.2 (Non-reasoning)非推理模型 | Z AI | 27.2 | 34.1 | 开放权重 | US$0.34 | 0.17 分钟 | 1,314 | 132 Token/s | 2026-06-16 |
| 65 | MiMo-V2.5推理模型 | Xiaomi | 27.0 | 37.2 | 开放权重 | US$0.01 | 2.75 分钟 | 10,369 | 63 Token/s | 2026-04-22 |
| 66 | Qwen3.6 27B (Reasoning)推理模型 | Alibaba | 26.5 | 37.1 | 开放权重 | US$0.20 | 5.38 分钟 | 18,475 | 57 Token/s | 2026-04-22 |
| 67 | GPT-5.6 Terra (Non-reasoning)非推理模型 | OpenAI | 26.0 | 34.0 | 闭源 | US$0.11 | 0.23 分钟 | 1,750 | 126 Token/s | 2026-07-09 |
| 68 | Qwen3.5 397B A17B (Reasoning)推理模型 | Alibaba | 26.0 | 33.7 | 开放权重 | US$0.18 | 3.07 分钟 | 11,585 | 63 Token/s | 2026-02-16 |
| 69 | DeepSeek V3.2 (Reasoning)推理模型 | DeepSeek | 24.7 | 32.0 | 开放权重 | US$0.01 | — | 10,235 | — | 2025-12-01 |
| 70 | GPT-5 mini (high)推理模型 | OpenAI | 24.3 | 25.3 | 闭源 | US$0.02 | 1.78 分钟 | 11,592 | 109 Token/s | 2025-08-07 |
| 71 | Qwen3.5 122B A10B (Reasoning)推理模型 | Alibaba | 24.0 | 32.3 | 开放权重 | US$0.12 | 1.56 分钟 | 12,423 | 132 Token/s | 2026-02-24 |
| 72 | Qwen3.6 35B A3B (Reasoning)推理模型 | Alibaba | 24.0 | 31.6 | 开放权重 | US$0.12 | 2.50 分钟 | 22,752 | 151 Token/s | 2026-04-16 |
| 73 | GPT-5.5 Instant (June 2026)推理模型 | OpenAI | 23.5 | 28.9 | 闭源 | US$0.08 | — | 746 | — | 2026-06-25 |
| 74 | Step 3.7 Flash推理模型 | StepFun | 23.2 | 30.3 | 开放权重 | US$0.04 | 1.18 分钟 | 28,666 | 407 Token/s | 2026-05-29 |
| 75 | DeepSeek V3.1 Terminus (Reasoning)推理模型 | DeepSeek | 22.7 | 30.4 | 开放权重 | US$0.35 | — | 5,575 | — | 2025-09-22 |
| 76 | Gemini 2.5 Pro推理模型 | 21.9 | 25.8 | 闭源 | US$0.14 | 0.75 分钟 | 6,535 | 144 Token/s | 2025-06-05 | |
| 77 | KAT Coder Pro V2非推理模型 | KwaiKAT | 21.4 | 33.7 | 闭源 | US$0.00 | — | 4,655 | — | 2026-03-27 |
| 78 | Claude 4 Sonnet (Reasoning)推理模型 | Anthropic | 21.2 | 28.9 | 闭源 | US$0.13 | — | 8,713 | — | 2025-05-22 |
| 79 | Ring-2.6-1T推理模型 | InclusionAI | 21.1 | 30.6 | 开放权重 | US$0.14 | 2.11 分钟 | 16,573 | 131 Token/s | 2026-05-08 |
| 80 | GPT-5.6 Luna (Non-reasoning)非推理模型 | OpenAI | 21.1 | 26.6 | 闭源 | US$0.03 | 0.10 分钟 | 1,242 | 203 Token/s | 2026-07-09 |
| 81 | Mistral Medium 3.5推理模型 | Mistral | 21.0 | 29.9 | 开放权重 | US$0.31 | 1.80 分钟 | 13,656 | 127 Token/s | 2026-04-29 |
| 82 | Qwen3.6 27B (Non-reasoning)非推理模型 | Alibaba | 20.9 | 30.5 | 开放权重 | US$0.23 | 2.40 分钟 | 8,388 | 58 Token/s | 2026-04-22 |
| 83 | Claude 4.5 Haiku (Reasoning)推理模型 | Anthropic | 20.7 | 29.6 | 闭源 | US$0.12 | 2.15 分钟 | 12,522 | 97 Token/s | 2025-10-15 |
| 84 | Grok 4.3 (Non-reasoning)非推理模型 | SpaceXAI | 20.7 | 24.8 | 闭源 | US$0.07 | 0.74 分钟 | 4,721 | 107 Token/s | 2026-04-30 |
| 85 | Gemini 3.1 Flash-Lite推理模型 | 20.4 | 25.0 | 闭源 | US$0.02 | 0.30 分钟 | 6,048 | 335 Token/s | 2026-03-03 | |
| 86 | GLM-4.6 (Reasoning)推理模型 | Z AI | 20.1 | 28.7 | 开放权重 | US$0.12 | 3.34 分钟 | 9,634 | 48 Token/s | 2025-09-30 |
| 87 | Gemma 4 31B (Reasoning)推理模型 | 19.8 | 29.4 | 开放权重 | US$0.00 | 3.24 分钟 | 6,811 | 35 Token/s | 2026-04-02 | |
| 88 | Qwen3.6 35B A3B (Non-reasoning)非推理模型 | Alibaba | 18.8 | 24.2 | 开放权重 | US$0.32 | 1.02 分钟 | 11,917 | 195 Token/s | 2026-04-16 |
| 89 | gpt-oss-120b (high)推理模型 | OpenAI | 18.1 | 23.8 | 开放权重 | US$0.06 | 0.92 分钟 | 17,135 | 312 Token/s | 2025-08-05 |
| 90 | NVIDIA Nemotron 3 Super 120B A12B (Reasoning)推理模型 | NVIDIA | 17.9 | 25.4 | 开放权重 | US$0.17 | 1.18 分钟 | 17,445 | 246 Token/s | 2026-03-11 |
| 91 | Gemma 4 26B A4B (Reasoning)推理模型 | 17.9 | 25.7 | 开放权重 | US$0.03 | — | 12,917 | — | 2026-04-02 | |
| 92 | Qwen3.5 122B A10B (Non-reasoning)非推理模型 | Alibaba | 17.8 | 27.6 | 开放权重 | US$0.09 | 0.77 分钟 | 6,787 | 146 Token/s | 2026-02-24 |
| 93 | Command A+推理模型 | Cohere | 15.1 | 22.5 | 开放权重 | US$0.00 | 1.07 分钟 | 11,196 | 174 Token/s | 2026-05-20 |
| 94 | Qwen3.5 35B A3B (Non-reasoning)非推理模型 | Alibaba | 15.0 | 24.0 | 开放权重 | US$0.09 | 1.12 分钟 | 9,896 | 147 Token/s | 2026-02-24 |
| 95 | Mercury 2推理模型 | Inception | 14.9 | 21.4 | 闭源 | US$0.03 | 0.15 分钟 | 9,353 | 1039 Token/s | 2026-02-20 |
| 96 | Qwen3 235B A22B 2507 (Reasoning)推理模型 | Alibaba | 14.1 | 19.6 | 开放权重 | US$0.07 | 4.14 分钟 | 15,923 | 64 Token/s | 2025-07-25 |
| 97 | Gemma 4 31B (Non-reasoning)非推理模型 | 14.1 | 21.8 | 开放权重 | US$0.02 | 0.51 分钟 | 2,087 | 69 Token/s | 2026-04-02 | |
| 98 | DeepSeek R1 (Jan '25)推理模型 | DeepSeek | 13.8 | 18.5 | 开放权重 | US$0.31 | — | 14,962 | — | 2025-01-20 |
| 99 | Nova 2.0 Pro Preview (medium)推理模型 | Amazon | 13.7 | 21.8 | 闭源 | US$0.10 | 0.81 分钟 | 6,349 | 131 Token/s | 2025-11-27 |
| 100 | Qwen3.5 9B (Reasoning)推理模型 | Alibaba | 13.5 | 21.4 | 开放权重 | US$0.15 | 9.48 分钟 | 33,386 | 59 Token/s | 2026-03-02 |
| 101 | Mistral Small 4 (Reasoning)推理模型 | Mistral | 13.5 | 19.6 | 开放权重 | US$0.02 | 0.67 分钟 | 6,430 | 159 Token/s | 2026-03-16 |
| 102 | Nova 2.0 Pro Preview (low)推理模型 | Amazon | 13.4 | 19.6 | 闭源 | US$0.08 | 0.31 分钟 | 2,411 | 129 Token/s | 2025-11-27 |
| 103 | Magistral Medium 1.2推理模型 | Mistral | 13.3 | 17.9 | 闭源 | US$0.66 | 2.66 分钟 | 6,751 | 42 Token/s | 2025-09-18 |
| 104 | Devstral 2非推理模型 | Mistral | 13.2 | 19.2 | 开放权重 | US$0.00 | 0.87 分钟 | 3,674 | 70 Token/s | 2025-12-09 |
| 105 | MiMo-V2-Flash (Non-reasoning)非推理模型 | Xiaomi | 13.2 | 24.7 | 开放权重 | — | — | 31,024 | — | 2025-12-16 |
| 106 | HyperNova 60B 2605推理模型 | Multiverse Computing | 12.3 | 17.8 | 开放权重 | US$0.02 | 1.33 分钟 | 29,612 | 370 Token/s | 2026-05-26 |
| 107 | Mistral Large 3非推理模型 | Mistral | 12.3 | 15.9 | 开放权重 | US$0.07 | 0.80 分钟 | 2,494 | 52 Token/s | 2025-12-02 |
| 108 | Qwen3 Coder Next非推理模型 | Alibaba | 12.2 | 21.1 | 开放权重 | US$0.10 | 1.33 分钟 | 7,864 | 98 Token/s | 2026-02-03 |
| 109 | Nova 2.0 Lite (high)推理模型 | Amazon | 12.0 | 18.2 | 闭源 | US$0.07 | 2.71 分钟 | 24,544 | 151 Token/s | 2025-10-29 |
| 110 | Qwen3 Next 80B A3B (Reasoning)推理模型 | Alibaba | 11.9 | 16.7 | 开放权重 | US$0.15 | 1.67 分钟 | 18,086 | 181 Token/s | 2025-09-11 |
| 111 | K2 Think V2推理模型 | MBZUAI Institute of Foundation Models | 11.8 | 17.3 | 开放权重 | — | — | 12,675 | — | 2025-12-15 |
| 112 | o3-mini (high)推理模型 | OpenAI | 11.7 | 15.6 | 闭源 | US$0.04 | 1.23 分钟 | 16,751 | 227 Token/s | 2025-01-31 |
| 113 | DeepSeek V3 0324非推理模型 | DeepSeek | 11.0 | 15.4 | 开放权重 | US$0.03 | — | 1,031 | — | 2025-03-25 |
| 114 | Mistral Medium 3.1非推理模型 | Mistral | 10.9 | 14.7 | 闭源 | US$0.09 | 0.52 分钟 | 2,759 | 88 Token/s | 2025-08-12 |
| 115 | Devstral Small 2非推理模型 | Mistral | 10.8 | 17.4 | 开放权重 | US$0.00 | 0.87 分钟 | 4,029 | 77 Token/s | 2025-12-09 |
| 116 | Qwen3 30B A3B 2507 (Reasoning)推理模型 | Alibaba | 10.6 | 14.4 | 开放权重 | US$0.06 | 2.12 分钟 | 18,825 | 148 Token/s | 2025-07-30 |
| 117 | North Mini Code推理模型 | Cohere | 10.5 | 19.8 | 开放权重 | US$0.00 | 1.70 分钟 | 11,486 | 112 Token/s | 2026-06-09 |
| 118 | Llama 4 Maverick非推理模型 | Meta | 10.5 | 14.3 | 开放权重 | US$0.04 | 0.32 分钟 | 2,117 | 112 Token/s | 2025-04-05 |
| 119 | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)推理模型 | NVIDIA | 10.3 | 14.2 | 开放权重 | US$0.02 | 2.82 分钟 | 27,078 | 160 Token/s | 2025-12-15 |
| 120 | DeepSeek V3 (Dec '24)非推理模型 | DeepSeek | 10.0 | 14.2 | 开放权重 | US$0.01 | — | 1,310 | — | 2024-12-26 |
| 121 | DiffusionGemma 26B A4B推理模型 | 9.4 | 13.5 | 开放权重 | — | — | 12,887 | — | 2026-06-10 | |
| 122 | Mistral Small 3.1非推理模型 | Mistral | 9.4 | 14.7 | 开放权重 | US$0.01 | 0.31 分钟 | 2,810 | 149 Token/s | 2025-03-17 |
| 123 | Solar Pro 3推理模型 | Upstage | 9.4 | 14.1 | 闭源 | — | — | 36,717 | — | 2026-04-06 |
| 124 | GPT-4.1 mini非推理模型 | OpenAI | 9.3 | 14.8 | 闭源 | US$0.08 | 0.40 分钟 | 2,000 | 84 Token/s | 2025-04-14 |
| 125 | Claude 3.5 Haiku非推理模型 | Anthropic | 9.3 | 12.3 | 闭源 | US$0.01 | — | 1,341 | — | 2024-10-22 |
| 126 | gpt-oss-20b (high)推理模型 | OpenAI | 9.2 | 14.9 | 开放权重 | US$0.02 | 1.24 分钟 | 16,746 | 225 Token/s | 2025-08-05 |
| 127 | Nova 2.0 Pro Preview (Non-reasoning)非推理模型 | Amazon | 9.0 | 14.4 | 闭源 | US$0.09 | 0.28 分钟 | 1,935 | 114 Token/s | 2025-11-27 |
| 128 | gpt-oss-120b (low)推理模型 | OpenAI | 8.6 | 14.9 | 开放权重 | US$0.03 | 0.14 分钟 | 2,814 | 332 Token/s | 2025-08-05 |
| 129 | Qwen3 32B (Reasoning)推理模型 | Alibaba | 7.9 | 11.5 | 开放权重 | US$0.11 | 1.63 分钟 | 9,479 | 97 Token/s | 2025-04-28 |
| 130 | Llama 4 Scout非推理模型 | Meta | 7.8 | 10.0 | 开放权重 | US$0.01 | 0.19 分钟 | 925 | 83 Token/s | 2025-04-05 |
| 131 | Mistral Small 3.2非推理模型 | Mistral | 7.6 | 10.6 | 开放权重 | US$0.14 | 0.71 分钟 | 6,550 | 154 Token/s | 2025-06-20 |
| 132 | Nanbeige4.1-3B推理模型 | Nanbeige | 7.4 | 11.1 | 开放权重 | — | — | 101,307 | — | 2026-02-11 |
| 133 | Llama 3.3 Instruct 70B非推理模型 | Meta | 7.4 | 9.4 | 开放权重 | US$0.07 | 0.29 分钟 | 1,479 | 85 Token/s | 2024-12-06 |
| 134 | Llama 3.1 Instruct 8B非推理模型 | Meta | 7.3 | 7.6 | 开放权重 | US$0.12 | 1.11 分钟 | 9,799 | 147 Token/s | 2024-07-23 |
| 135 | Ling 2.6 Flash非推理模型 | InclusionAI | 7.2 | 14.1 | 开放权重 | US$0.00 | 0.82 分钟 | 8,814 | 180 Token/s | 2026-04-21 |
| 136 | Qwen3 14B (Reasoning)推理模型 | Alibaba | 7.1 | 10.4 | 开放权重 | US$0.01 | 1.50 分钟 | 5,579 | 62 Token/s | 2025-04-28 |
| 137 | GPT-4.1 nano非推理模型 | OpenAI | 7.1 | 9.6 | 闭源 | US$0.04 | 0.72 分钟 | 8,500 | 196 Token/s | 2025-04-14 |
| 138 | Magistral Small 1.2推理模型 | Mistral | 6.6 | 11.3 | 开放权重 | US$0.28 | 1.85 分钟 | 9,047 | 81 Token/s | 2025-09-17 |
| 139 | Ministral 3 14B非推理模型 | Mistral | 6.5 | 11.1 | 开放权重 | US$0.08 | 1.11 分钟 | 4,095 | 62 Token/s | 2025-12-02 |
| 140 | Ministral 3 8B非推理模型 | Mistral | 6.1 | 9.0 | 开放权重 | US$0.03 | 0.62 分钟 | 4,229 | 114 Token/s | 2025-12-02 |
| 141 | Granite 4.1 30B非推理模型 | IBM | 6.0 | 8.9 | 开放权重 | — | — | 3,468 | — | 2026-04-29 |
| 142 | NVIDIA Nemotron 3 Nano 4B推理模型 | NVIDIA | 5.8 | 8.7 | 开放权重 | — | — | 6,120 | — | 2026-03-16 |
| 143 | Ministral 3 3B非推理模型 | Mistral | 5.7 | 6.8 | 开放权重 | US$0.05 | 1.36 分钟 | 13,427 | 164 Token/s | 2025-12-02 |
| 144 | Phi-4 Mini Instruct非推理模型 | Microsoft | 5.6 | 6.0 | 开放权重 | US$0.00 | 12.28 分钟 | 33,034 | 45 Token/s | 2024-02-26 |
| 145 | Qwen3 8B (Reasoning)推理模型 | Alibaba | 5.6 | 8.3 | 开放权重 | US$0.01 | 3.80 分钟 | 8,968 | 39 Token/s | 2025-04-28 |
| 146 | Qwen3.5 2B (Reasoning)推理模型 | Alibaba | 5.4 | 7.6 | 开放权重 | — | — | 42,020 | — | 2026-03-02 |
| 147 | Gemma 3 27B Instruct非推理模型 | 5.2 | 7.4 | 开放权重 | US$0.00 | — | 6,780 | — | 2025-03-12 | |
| 148 | Gemma 3 12B Instruct非推理模型 | 4.2 | 5.5 | 开放权重 | US$0.00 | — | 24,508 | — | 2025-03-12 | |
| 149 | Qwen3.5 0.8B (Reasoning)推理模型 | Alibaba | 4.2 | 5.5 | 开放权重 | — | — | 23,902 | — | 2026-03-02 |
| 150 | Qwen3.5 2B (Non-reasoning)非推理模型 | Alibaba | 3.8 | 5.6 | 开放权重 | — | — | 26,326 | — | 2026-03-02 |
| 151 | MiniCPM-V 4.6 1.3B非推理模型 | OpenBMB | 3.5 | 4.2 | 开放权重 | — | — | 9,562 | — | 2026-05-11 |
| 152 | Granite 4.1 3B非推理模型 | IBM | 3.4 | 4.7 | 开放权重 | — | — | 4,998 | — | 2026-04-29 |
| 153 | Qwen3.5 0.8B (Non-reasoning)非推理模型 | Alibaba | 2.9 | 3.3 | 开放权重 | — | — | 22,799 | — | 2026-03-02 |
本站展示的是 2026-07-21 公开快照,不是医疗、法律或行业产品认证。核验原始榜单 ↗
INDEX BREAKDOWN
指数由什么构成
权重来自 Artificial Analysis 的 Capability Indices Methodology;各底层评测由来源方独立运行。
30%
商业知识
会计、公司金融、经济学和投资领域知识。
30%
Agent 知识工作
操作表格、查询 ERP 或协调多步骤工作流。
20%
推理
估值、敏感性分析和结构化定量推理。
10%
Agent 客户交互
多轮、可调用工具的客户服务工作流。
5%
长上下文
阅读财报、交易文件和长篇研究材料。
5%
非幻觉
避免虚构数字、事实或引用。
HOW TO READ
怎样理解这个指数
在来源设定的加权任务组合中,哪些模型整体表现更强,以及优势来自哪些能力维度。
不能直接证明模型适合你的真实工作流,也不是安全性、合规性或专业部署认证。
结合单项评测、成本、速度、上下文、Provider 稳定性和你自己的任务验证。