这个评测关注什么
覆盖真实职业任务和高经济价值知识工作。
阅读时注意
评测结果受任务集合、评分方法和模型版本影响。本站保留原始口径,不用它生成新的综合排名。
适用场景
用于回答一个明确的问题:模型在这一类任务上的相对表现如何,而不是“哪个模型绝对最好”。
经济价值任务
覆盖真实职业任务和高经济价值知识工作。
| 排名 | 机构 | 模型 | Elo | 95% CI | 发布日期 |
|---|---|---|---|---|---|
| 1 | Anthropic | Claude Fable 5 | 1,760 | -19 / +19 | Jun 2026 |
| 2 | OpenAI | GPT-5.6 Sol (max) | 1,743 | -19 / +19 | Jul 2026 |
| 3 | OpenAI | GPT-5.6 Sol (xhigh) | 1,702 | -20 / +20 | Jul 2026 |
| 4 | Kimi | Kimi K3 | 1,684 | -26 / +26 | Jul 2026 |
| 5 | OpenAI | GPT-5.6 Sol (high) | 1,630 | -19 / +19 | Jul 2026 |
| 6 | Anthropic | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 1,607 | -18 / +18 | Jun 2026 |
| 7 | Anthropic | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | 1,600 | -17 / +17 | May 2026 |
| 8 | OpenAI | GPT-5.6 Luna (max) | 1,584 | -18 / +18 | Jul 2026 |
| 9 | OpenAI | GPT-5.6 Terra (max) | 1,581 | -18 / +18 | Jul 2026 |
| 10 | OpenAI | GPT-5.6 Terra (xhigh) | 1,572 | -19 / +19 | Jul 2026 |
| 11 | OpenAI | GPT-5.6 Sol (medium) | 1,562 | -18 / +18 | Jul 2026 |
| 12 | OpenAI | GPT-5.6 Luna (xhigh) | 1,539 | -20 / +20 | Jul 2026 |
| 13 | SpaceXAI | Grok 4.5 (high) | 1,535 | -23 / +23 | Jul 2026 |
| 14 | Z AI | GLM-5.2 (max) | 1,514 | -16 / +16 | Jun 2026 |
| 15 | OpenAI | GPT-5.6 Terra (high) | 1,513 | -19 / +19 | Jul 2026 |
| 16 | Anthropic | Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) | 1,511 | -18 / +18 | Jun 2026 |
| 17 | Anthropic | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | 1,500 | -16 / +16 | Apr 2026 |
| 18 | OpenAI | GPT-5.5 (xhigh) | 1,493 | -16 / +16 | Apr 2026 |
| 19 | OpenAI | GPT-5.6 Luna (high) | 1,472 | -19 / +19 | Jul 2026 |
| 20 | OpenAI | GPT-5.5 (high) | 1,471 | -17 / +17 | Apr 2026 |
| 21 | OpenAI | GPT-5.6 Sol (low) | 1,445 | -18 / +18 | Jul 2026 |
| 22 | OpenAI | GPT-5.6 Terra (medium) | 1,404 | -18 / +18 | Jul 2026 |
| 23 | Anthropic | Claude Sonnet 5 (Adaptive Reasoning, High Effort) | 1,403 | -18 / +18 | Jun 2026 |
| 24 | MiniMax | MiniMax-M3 | 1,395 | -16 / +16 | Jun 2026 |
| 25 | OpenAI | GPT-5.4 (xhigh) | 1,395 | -16 / +16 | Mar 2026 |
| 26 | Z AI | GLM-5.2 (Non-reasoning) | 1,388 | -24 / +24 | Jun 2026 |
| 27 | OpenAI | GPT-5.6 Sol (Non-reasoning) | 1,384 | -19 / +19 | Jul 2026 |
| 28 | Anthropic | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | 1,377 | -16 / +16 | Feb 2026 |
| 29 | OpenAI | GPT-5.5 (medium) | 1,375 | -18 / +18 | Apr 2026 |
| 30 | Meta | Muse Spark 1.1 (xhigh) | 1,374 | -20 / +20 | Jul 2026 |
| 31 | Anthropic | Claude Sonnet 5 (Non-reasoning, High Effort) | 1,372 | -18 / +18 | Jun 2026 |
| 32 | Gemini 3.5 Flash (high) | 1,349 | -17 / +17 | May 2026 | |
| 33 | DeepSeek | DeepSeek V4 Pro (Reasoning, Max Effort) | 1,307 | -16 / +16 | Apr 2026 |
| 34 | Anthropic | Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) | 1,304 | -17 / +17 | Jun 2026 |
| 35 | DeepSeek | DeepSeek V4 Pro (Reasoning, High Effort) | 1,296 | -24 / +24 | Apr 2026 |
| 36 | Alibaba | Qwen3.7 Max | 1,273 | -16 / +16 | May 2026 |
| 37 | OpenAI | GPT-5.6 Luna (medium) | 1,272 | -17 / +17 | Jul 2026 |
| 38 | Xiaomi | MiMo-V2.5-Pro | 1,265 | -16 / +16 | Apr 2026 |
| 39 | China Mobile | JT-4.1 Flash 236B A21B | 1,265 | -21 / +21 | Jul 2026 |
| 40 | Nex AGI | Nex-N2-Pro | 1,257 | -18 / +18 | Jun 2026 |
| 41 | Z AI | GLM-5.1 (Reasoning) | 1,257 | -16 / +16 | Apr 2026 |
| 42 | OpenAI | GPT-5.6 Terra (low) | 1,249 | -18 / +18 | Jul 2026 |
| 43 | Thinking Machines | Inkling (xhigh) | 1,239 | -21 / +21 | Jul 2026 |
| 44 | OpenAI | GPT-5.6 Terra (Non-reasoning) | 1,239 | -19 / +19 | Jul 2026 |
| 45 | Anthropic | Claude Sonnet 5 (Adaptive Reasoning, Low Effort) | 1,217 | -17 / +17 | Jun 2026 |
| 46 | Tencent | Hy3 | 1,214 | -22 / +22 | Jul 2026 |
| 47 | SpaceXAI | Grok Build 0.1 0616 | 1,211 | -17 / +17 | Jun 2026 |
| 48 | OpenAI | GPT-5.5 (low) | 1,191 | -18 / +18 | Apr 2026 |
| 49 | Kimi | Kimi K2.6 | 1,189 | -16 / +16 | Apr 2026 |
| 50 | DeepSeek | DeepSeek V4 Flash (Reasoning, Max Effort) | 1,189 | -17 / +17 | Apr 2026 |
| 51 | Kimi | Kimi K2.7 Code | 1,187 | -17 / +17 | Jun 2026 |
| 52 | OpenAI | GPT-5.4 mini (xhigh) | 1,171 | -16 / +16 | Mar 2026 |
| 53 | Z AI | GLM-4.7 (Reasoning) | 1,165 | -19 / +19 | Dec 2025 |
| 54 | NVIDIA | Nemotron 3 Ultra 550B A55B (Reasoning) | 1,164 | -16 / +16 | Jun 2026 |
| 55 | MiniMax | MiniMax-M2.7 | 1,158 | -16 / +16 | Mar 2026 |
| 56 | OpenAI | GPT-5.6 Luna (low) | 1,150 | -17 / +17 | Jul 2026 |
| 57 | Xiaomi | MiMo-V2.5 | 1,145 | -22 / +22 | Apr 2026 |
| 58 | Meta | Muse Spark | 1,144 | -16 / +16 | Apr 2026 |
| 59 | Alibaba | Qwen3.6 27B (Reasoning) | 1,140 | -16 / +16 | Apr 2026 |
| 60 | Alibaba | Qwen3.6 Plus | 1,135 | -16 / +16 | Apr 2026 |
| 61 | OpenAI | GPT-5.5 (Non-reasoning) | 1,119 | -17 / +17 | Apr 2026 |
| 62 | Alibaba | Qwen3.6 27B (Non-reasoning) | 1,113 | -19 / +19 | Apr 2026 |
| 63 | OpenAI | GPT-5.4 nano (xhigh) | 1,100 | -16 / +16 | Mar 2026 |
| 64 | SpaceXAI | Grok 4.3 (Non-reasoning) | 1,096 | -16 / +16 | Apr 2026 |
| 65 | SpaceXAI | Grok 4.3 (high) | 1,085 | -16 / +16 | Apr 2026 |
| 66 | OpenAI | GPT-5 (high) | 1,075 | -20 / +20 | Aug 2025 |
| 67 | OpenAI | GPT-5.6 Luna (Non-reasoning) | 1,068 | -19 / +19 | Jul 2026 |
| 68 | Anthropic | Claude 4.5 Sonnet (Reasoning) | 1,052 | -19 / +19 | Sep 2025 |
| 69 | Alibaba | Qwen3.6 35B A3B (Reasoning) | 1,049 | -16 / +16 | Apr 2026 |
| 70 | LongCat | LongCat 2.0 | 1,022 | -19 / +19 | Jun 2026 |
| 71 | Alibaba | Qwen3.6 35B A3B (Non-reasoning) | 1,020 | -23 / +23 | Apr 2026 |
| 72 | StepFun | Step 3.7 Flash | 1,017 | -16 / +16 | May 2026 |
| 73 | Kimi | Kimi K2.5 (Reasoning) | 1,009 | -21 / +21 | Jan 2026 |
| 74 | OpenAI | GPT-5.1 (high) | 987 | -20 / +20 | Nov 2025 |
| 75 | Alibaba | Qwen3.5 122B A10B (Reasoning) | 978 | -16 / +16 | Feb 2026 |
| 76 | Gemini 3.1 Pro Preview | 965 | -17 / +17 | Feb 2026 | |
| 77 | Alibaba | Qwen3.5 397B A17B (Reasoning) | 962 | -17 / +17 | Feb 2026 |
| 78 | OpenAI | GPT-5 mini (high) | 937 | -20 / +20 | Aug 2025 |
| 79 | Alibaba | Qwen3.7 Plus | 936 | -17 / +17 | Jun 2026 |
| 80 | Z AI | GLM-4.6 (Reasoning) | 934 | -20 / +20 | Sep 2025 |
| 81 | Mistral | Mistral Medium 3.5 | 929 | -17 / +17 | Apr 2026 |
| 82 | InclusionAI | Ring-2.6-1T | 919 | -17 / +17 | May 2026 |
| 83 | KwaiKAT | KAT Coder Pro V2 | 908 | -22 / +22 | Mar 2026 |
| 84 | Anthropic | Claude 4.5 Haiku (Reasoning) | 907 | -17 / +17 | Oct 2025 |
| 85 | KwaiKAT | KAT-Coder-Pro V1 | 899 | -18 / +18 | Nov 2025 |
| 86 | DeepSeek | DeepSeek V3.1 Terminus (Reasoning) | 889 | -23 / +23 | Sep 2025 |
| 87 | Alibaba | Qwen3.5 122B A10B (Non-reasoning) | 880 | -21 / +21 | Feb 2026 |
| 88 | DeepSeek | DeepSeek V3.2 (Reasoning) | 865 | -23 / +23 | Dec 2025 |
| 89 | Anthropic | Claude 4 Sonnet (Reasoning) | 861 | -20 / +20 | May 2025 |
| 90 | Xiaomi | MiMo-V2-Flash (Non-reasoning) | 833 | -22 / +22 | Dec 2025 |
| 91 | Gemma 4 31B (Reasoning) | 804 | -18 / +18 | Apr 2026 | |
| 92 | OpenAI | gpt-oss-120b (high) | 799 | -18 / +18 | Aug 2025 |
| 93 | Alibaba | Qwen3.5 35B A3B (Non-reasoning) | 797 | -23 / +23 | Feb 2026 |
| 94 | OpenAI | GPT-5.4 mini (Non-Reasoning) | 784 | -18 / +18 | Mar 2026 |
| 95 | Gemma 4 26B A4B (Reasoning) | 761 | -18 / +18 | Apr 2026 | |
| 96 | Gemma 4 31B (Non-reasoning) | 744 | -22 / +22 | Apr 2026 | |
| 97 | Mistral | Devstral 2 | 739 | -19 / +19 | Dec 2025 |
| 98 | Mistral | Devstral Small 2 | 729 | -19 / +19 | Dec 2025 |
| 99 | OpenAI | GPT-5.5 Instant (June 2026) | 719 | -20 / +20 | Jun 2026 |
| 100 | Cohere | Command A+ | 714 | -20 / +20 | May 2026 |
| 101 | Alibaba | Qwen3 Coder Next | 711 | -21 / +21 | Feb 2026 |
| 102 | NVIDIA | NVIDIA Nemotron 3 Super 120B A12B (Reasoning) | 693 | -18 / +18 | Mar 2026 |
| 103 | Inception | Mercury 2 | 689 | -22 / +22 | Feb 2026 |
| 104 | Amazon | Nova 2.0 Pro Preview (medium) | 676 | -18 / +18 | Nov 2025 |
| 105 | Gemini 2.5 Pro | 665 | -19 / +19 | Jun 2025 | |
| 106 | Multiverse Computing | HyperNova 60B 2605 | 654 | -22 / +22 | May 2026 |
| 107 | Amazon | Nova 2.0 Pro Preview (low) | 645 | -18 / +18 | Nov 2025 |
| 108 | Gemini 3.1 Flash-Lite | 642 | -18 / +18 | Mar 2026 | |
| 109 | Alibaba | Qwen3.5 9B (Reasoning) | 636 | -21 / +21 | Mar 2026 |
| 110 | Mistral | Mistral Large 3 | 633 | -18 / +18 | Dec 2025 |
| 111 | Mistral | Mistral Medium 3.1 | 599 | -20 / +20 | Aug 2025 |
| 112 | Mistral | Mistral Small 3.1 | 590 | -20 / +20 | Mar 2025 |
| 113 | Mistral | Mistral Small 4 (Reasoning) | 588 | -21 / +21 | Mar 2026 |
| 114 | Amazon | Nova 2.0 Lite (high) | 586 | -19 / +19 | Oct 2025 |
| 115 | OpenAI | gpt-oss-20b (high) | 559 | -18 / +18 | Aug 2025 |
| 116 | Amazon | Nova 2.0 Pro Preview (Non-reasoning) | 555 | -18 / +18 | Nov 2025 |
| 117 | Arcee AI | Trinity Large Thinking | 554 | -23 / +23 | Apr 2026 |
| 118 | DiffusionGemma 26B A4B | 547 | -20 / +20 | Jun 2026 | |
| 119 | InclusionAI | Ling 2.6 Flash | 545 | -22 / +22 | Apr 2026 |
| 120 | Alibaba | Qwen3 235B A22B 2507 (Reasoning) | 541 | -22 / +22 | Jul 2025 |
| 121 | Cohere | North Mini Code | 534 | -21 / +21 | Jun 2026 |
| 122 | DeepSeek | DeepSeek R1 (Jan '25) | 525 | -21 / +21 | Jan 2025 |
| 123 | OpenAI | GPT-4.1 mini | 503 | -20 / +20 | Apr 2025 |
| 124 | Upstage | Solar Pro 3 | 493 | -18 / +18 | Apr 2026 |
| 125 | NVIDIA | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | 484 | -19 / +19 | Dec 2025 |
| 126 | Mistral | Ministral 3 14B | 476 | -19 / +19 | Dec 2025 |
| 127 | OpenAI | o3-mini (high) | 468 | -22 / +22 | Jan 2025 |
| 128 | Mistral | Ministral 3 8B | 449 | -19 / +19 | Dec 2025 |
| 129 | Anthropic | Claude 3.5 Haiku | 444 | -20 / +20 | Oct 2024 |
| 130 | IBM | Granite 4.1 30B | 422 | -18 / +18 | Apr 2026 |
| 131 | Mistral | Magistral Medium 1.2 | 403 | -20 / +20 | Sep 2025 |
| 132 | OpenAI | gpt-oss-120b (low) | 397 | -24 / +24 | Aug 2025 |
| 133 | MBZUAI Institute of Foundation Models | K2 Think V2 | 370 | -21 / +21 | Dec 2025 |
| 134 | Alibaba | Qwen3 Next 80B A3B (Reasoning) | 367 | -22 / +22 | Sep 2025 |
| 135 | DeepSeek | DeepSeek V3 0324 | 314 | -21 / +21 | Mar 2025 |
| 136 | Alibaba | Qwen3 30B A3B 2507 (Reasoning) | 308 | -23 / +23 | Jul 2025 |
| 137 | Alibaba | Qwen3 32B (Reasoning) | 275 | -20 / +20 | Apr 2025 |
| 138 | Mistral | Ministral 3 3B | 273 | -20 / +20 | Dec 2025 |
| 139 | Mistral | Magistral Small 1.2 | 248 | -21 / +21 | Sep 2025 |
| 140 | OpenAI | GPT-4o mini | 226 | -22 / +22 | Jul 2024 |
| 141 | Alibaba | Qwen3 14B (Reasoning) | 222 | -21 / +21 | Apr 2025 |
| 142 | OpenAI | GPT-4 | 221 | -20 / +20 | Mar 2023 |
| 143 | DeepSeek | DeepSeek V3 (Dec '24) | 217 | -21 / +21 | Dec 2024 |
| 144 | Alibaba | Qwen3 8B (Reasoning) | 200 | -21 / +21 | Apr 2025 |
| 145 | Alibaba | Qwen3.5 2B (Reasoning) | 199 | -24 / +24 | Mar 2026 |
| 146 | NVIDIA | NVIDIA Nemotron 3 Nano 4B | 192 | -24 / +24 | Mar 2026 |
| 147 | IBM | Granite 4.1 3B | 104 | -23 / +23 | Apr 2026 |
| 148 | Meta | Llama 4 Scout | 90 | -19 / +19 | Apr 2025 |
| 149 | Meta | Llama 3.3 Instruct 70B | 80 | -21 / +21 | Dec 2024 |
| 150 | Mistral | Mistral Small 3.2 | 57 | -22 / +22 | Jun 2025 |
| 151 | OpenAI | GPT-4.1 nano | 41 | -21 / +21 | Apr 2025 |
| 152 | Meta | Llama 4 Maverick | -16 | -19 / +19 | Apr 2025 |
| 153 | NVIDIA | NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) | -94 | -19 / +19 | Dec 2025 |
| 154 | Alibaba | Qwen3.5 0.8B (Non-reasoning) | -97 | -20 / +20 | Mar 2026 |
| 155 | Alibaba | Qwen3.5 2B (Non-reasoning) | -104 | -20 / +20 | Mar 2026 |
| 156 | OpenBMB | MiniCPM-V 4.6 1.3B | -108 | -19 / +19 | May 2026 |
| 157 | Alibaba | Qwen3.5 0.8B (Reasoning) | -111 | -19 / +19 | Mar 2026 |
| 158 | Meta | Llama 3.1 Instruct 8B | -124 | -19 / +19 | Jul 2024 |
| 159 | Nanbeige | Nanbeige4.1-3B | -141 | -19 / +19 | Feb 2026 |
| 160 | Gemma 3 12B Instruct | -144 | -19 / +19 | Mar 2025 | |
| 161 | Gemma 3 27B Instruct | -144 | -19 / +19 | Mar 2025 | |
| 162 | Microsoft | Phi-4 Mini Instruct | -145 | -19 / +19 | Feb 2024 |
覆盖真实职业任务和高经济价值知识工作。
评测结果受任务集合、评分方法和模型版本影响。本站保留原始口径,不用它生成新的综合排名。
用于回答一个明确的问题:模型在这一类任务上的相对表现如何,而不是“哪个模型绝对最好”。