这个评测关注什么
从权重、许可、技术披露和复现条件观察模型开放程度。
阅读时注意
评测结果受任务集合、评分方法和模型版本影响。本站保留原始口径,不用它生成新的综合排名。
适用场景
用于回答一个明确的问题:模型在这一类任务上的相对表现如何,而不是“哪个模型绝对最好”。
透明度与可获得性
从权重、许可、技术披露和复现条件观察模型开放程度。
| 排名 | 机构 | 模型 | 开放性指数 | 智能指数 | 模型可用性 | 模型透明度 | 预训练数据访问 | 预训练数据许可 | 后训练数据访问 | 后训练数据许可 |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Allen Institute for AI | Olmo 3.1 32B Think | 88.89 | 8.09 | 6 | 10 | 3 | 1 | 3 | 1 |
| 2 | Allen Institute for AI | Molmo 7B-D | 88.89 | 3.81 | 6 | 10 | 3 | 1 | 3 | 1 |
| 3 | Allen Institute for AI | Olmo 3 7B Instruct | 88.89 | 2.81 | 6 | 10 | 3 | 1 | 3 | 1 |
| 4 | Allen Institute for AI | Olmo 3.1 32B Instruct | 88.89 | 6.47 | 6 | 10 | 3 | 1 | 3 | 1 |
| 5 | Allen Institute for AI | Olmo 3 7B Think | 88.89 | 3.97 | 6 | 10 | 3 | 1 | 3 | 1 |
| 6 | MBZUAI Institute of Foundation Models | K2 Think V2 | 88.89 | 17.26 | 6 | 10 | 3 | 1 | 3 | 1 |
| 7 | MBZUAI Institute of Foundation Models | K2-V2 (low) | 88.89 | 8.55 | 6 | 10 | 3 | 1 | 3 | 1 |
| 8 | MBZUAI Institute of Foundation Models | K2-V2 (high) | 88.89 | 14.19 | 6 | 10 | 3 | 1 | 3 | 1 |
| 9 | MBZUAI Institute of Foundation Models | K2-V2 (medium) | 88.89 | 12.43 | 6 | 10 | 3 | 1 | 3 | 1 |
| 10 | Swiss AI Initiative | Apertus 8B Instruct | 88.89 | 1 | 6 | 10 | 3 | 1 | 3 | 1 |
| 11 | Swiss AI Initiative | Apertus 70B Instruct | 88.89 | 2.4 | 6 | 10 | 3 | 1 | 3 | 1 |
| 12 | Allen Institute for AI | OLMo 2 7B | 88.89 | 3.85 | 6 | 10 | 3 | 1 | 3 | 1 |
| 13 | Allen Institute for AI | Olmo 3 32B Think | 88.89 | 6.4 | 6 | 10 | 3 | 1 | 3 | 1 |
| 14 | Allen Institute for AI | OLMo 2 32B | 88.89 | 5.01 | 6 | 10 | 3 | 1 | 3 | 1 |
| 15 | NVIDIA | NVIDIA Nemotron 3 Super 120B A12B (Reasoning) | 83.33 | 25.41 | 6 | 9 | 2 | 1 | 2 | 1 |
| 16 | NVIDIA | Nemotron 3 Ultra 550B A55B (Reasoning) | 83.33 | 37.76 | 6 | 9 | 2 | 1 | 2 | 1 |
| 17 | NVIDIA | NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) | 83.33 | 7.39 | 6 | 9 | 2 | 1 | 2 | 1 |
| 18 | NVIDIA | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | 83.33 | 14.18 | 6 | 9 | 2 | 1 | 2 | 1 |
| 19 | OpenBMB | MiniCPM5-1B (Non-reasoning) | 83.33 | 11.74 | 6 | 9 | 3 | 3 | 3 | 3 |
| 20 | OpenBMB | MiniCPM5-1B (Reasoning) | 83.33 | 11.96 | 6 | 9 | 3 | 3 | 3 | 3 |
| 21 | NVIDIA | NVIDIA Nemotron Nano 9B V2 (Reasoning) | 72.22 | 8.84 | 6 | 7 | 2 | 1 | 2 | 1 |
| 22 | NVIDIA | NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) | 72.22 | 4.58 | 6 | 7 | 2 | 1 | 2 | 1 |
| 23 | NVIDIA | NVIDIA Nemotron Nano 9B V2 (Non-reasoning) | 72.22 | 7.38 | 6 | 7 | 2 | 1 | 2 | 1 |
| 24 | NVIDIA | NVIDIA Nemotron Nano 12B v2 VL (Reasoning) | 72.22 | 8.96 | 6 | 7 | 2 | 1 | 2 | 1 |
| 25 | Allen Institute for AI | Molmo2-8B | 72.22 | 2.03 | 6 | 7 | 3 | 1 | 3 | 1 |
| 26 | Kimi | Kimi Linear 48B A3B Instruct | 61.11 | 8.53 | 6 | 5 | 1 | 0 | 1 | 0 |
| 27 | IBM | Granite 4.1 8B | 61.11 | 6.67 | 6 | 5 | 2 | 1 | 2 | 1 |
| 28 | IBM | Granite 4.1 3B | 61.11 | 4.7 | 6 | 5 | 2 | 1 | 2 | 1 |
| 29 | IBM | Granite 4.1 30B | 61.11 | 8.86 | 6 | 5 | 2 | 1 | 2 | 1 |
| 30 | IBM | Granite 4.0 H 350M | 55.56 | 1 | 6 | 4 | 2 | 1 | 2 | 1 |
| 31 | IBM | Granite 4.0 H 1B | 55.56 | 2.66 | 6 | 4 | 2 | 1 | 2 | 1 |
| 32 | IBM | Granite 4.0 350M | 55.56 | 1 | 6 | 4 | 2 | 1 | 2 | 1 |
| 33 | IBM | Granite 4.0 H Small | 55.56 | 5.24 | 6 | 4 | 2 | 1 | 2 | 1 |
| 34 | IBM | Granite 4.0 Micro | 55.56 | 2.37 | 6 | 4 | 2 | 1 | 2 | 1 |
| 35 | IBM | Granite 4.0 1B | 55.56 | 2.07 | 6 | 4 | 2 | 1 | 2 | 1 |
| 36 | Baidu | ERNIE 4.5 300B A47B | 55.56 | 9.02 | 6 | 4 | 0 | 0 | 0 | 0 |
| 37 | Z AI | GLM-4.5-Air | 55.56 | 16.52 | 6 | 4 | 0 | 0 | 0 | 0 |
| 38 | Z AI | GLM-4.5 (Reasoning) | 55.56 | 19.49 | 6 | 4 | 0 | 0 | 0 | 0 |
| 39 | NVIDIA | Llama 3.1 Nemotron Ultra 253B v1 (Reasoning) | 52.78 | 9.08 | 4 | 5.5 | 1 | 0 | 1 | 1 |
| 40 | NVIDIA | Llama Nemotron Super 49B v1.5 (Reasoning) | 52.78 | 12.42 | 4 | 5.5 | 1 | 0 | 1 | 1 |
| 41 | NVIDIA | Llama Nemotron Super 49B v1.5 (Non-reasoning) | 52.78 | 8.68 | 4 | 5.5 | 1 | 0 | 1 | 1 |
| 42 | Xiaomi | MiMo-V2-Flash (Non-reasoning) | 52.78 | 24.67 | 6 | 3.5 | 0 | 0 | 1 | 0 |
| 43 | NVIDIA | Llama 3.3 Nemotron Super 49B v1 (Reasoning) | 52.78 | 12.25 | 4 | 5.5 | 1 | 0 | 1 | 1 |
| 44 | NVIDIA | Llama 3.1 Nemotron Nano 4B v1.1 (Reasoning) | 52.78 | 8.54 | 4 | 5.5 | 1 | 0 | 1 | 1 |
| 45 | NVIDIA | Llama 3.3 Nemotron Super 49B v1 (Non-reasoning) | 52.78 | 8.47 | 4 | 5.5 | 1 | 0 | 1 | 1 |
| 46 | Xiaomi | MiMo-V2-Flash (Reasoning) | 52.78 | 31.2 | 6 | 3.5 | 0 | 0 | 1 | 0 |
| 47 | Z AI | GLM-4.5V (Reasoning) | 52.78 | 9.15 | 6 | 3.5 | 1 | 0 | 0 | 0 |
| 48 | Z AI | GLM-4.5V (Non-reasoning) | 52.78 | 7 | 6 | 3.5 | 1 | 0 | 0 | 0 |
| 49 | Mistral | Magistral Small 1.2 | 50 | 11.29 | 6 | 3 | 0 | 0 | 1 | 1 |
| 50 | DeepSeek | DeepSeek V4 Flash (Reasoning, High Effort) | 50 | 37.36 | 6 | 3 | 0 | 0 | 0 | 0 |
| 51 | DeepSeek | DeepSeek V4 Pro (Reasoning, High Effort) | 50 | 43.11 | 6 | 3 | 0 | 0 | 0 | 0 |
| 52 | DeepSeek | DeepSeek V4 Flash (Non-reasoning) | 50 | 28.65 | 6 | 3 | 0 | 0 | 0 | 0 |
| 53 | DeepSeek | DeepSeek V4 Flash (Reasoning, Max Effort) | 50 | 40.28 | 6 | 3 | 0 | 0 | 0 | 0 |
| 54 | DeepSeek | DeepSeek V4 Pro (Non-reasoning) | 50 | 31.22 | 6 | 3 | 0 | 0 | 0 | 0 |
| 55 | DeepSeek | DeepSeek V4 Pro (Reasoning, Max Effort) | 50 | 44.27 | 6 | 3 | 0 | 0 | 0 | 0 |
| 56 | Microsoft | Phi-4 | 50 | 4.87 | 6 | 3 | 1 | 0 | 1 | 0 |
| 57 | Microsoft | Phi-4 Mini Instruct | 50 | 6.01 | 6 | 3 | 1 | 0 | 1 | 0 |
| 58 | Microsoft | Phi-4 Multimodal Instruct | 50 | 4.53 | 6 | 3 | 1 | 0 | 1 | 0 |
| 59 | Gemma 3 12B Instruct | 50 | 5.51 | 6 | 3 | 0 | 0 | 0 | 0 | |
| 60 | Gemma 3 1B Instruct | 50 | 1 | 6 | 3 | 0 | 0 | 0 | 0 | |
| 61 | Gemma 3 4B Instruct | 50 | 1.12 | 6 | 3 | 0 | 0 | 0 | 0 | |
| 62 | Gemma 3n E2B Instruct | 50 | 1 | 6 | 3 | 0 | 0 | 0 | 0 | |
| 63 | Gemma 3 27B Instruct | 50 | 7.42 | 6 | 3 | 0 | 0 | 0 | 0 | |
| 64 | Gemma 3n E4B Instruct | 50 | 1.19 | 6 | 3 | 0 | 0 | 0 | 0 | |
| 65 | DeepSeek | DeepSeek R1 0528 (May '25) | 50 | 20.08 | 6 | 3 | 0 | 0 | 0 | 0 |
| 66 | StepFun | Step 3.5 Flash | 50 | 25.5 | 6 | 3 | 0 | 0 | 0 | 0 |
| 67 | Z AI | GLM-5 (Reasoning) | 50 | 39.5 | 6 | 3 | 0 | 0 | 0 | 0 |
| 68 | Z AI | GLM-5 (Non-reasoning) | 50 | 32.41 | 6 | 3 | 0 | 0 | 0 | 0 |
| 69 | Alibaba | Qwen3 VL 30B A3B (Reasoning) | 50 | 13.34 | 6 | 3 | 1 | 0 | 1 | 0 |
| 70 | Alibaba | Qwen3 VL 235B A22B (Reasoning) | 50 | 20.6 | 6 | 3 | 1 | 0 | 1 | 0 |
| 71 | Alibaba | Qwen3 VL 235B A22B Instruct | 50 | 14.31 | 6 | 3 | 1 | 0 | 1 | 0 |
| 72 | Alibaba | Qwen3 VL 32B Instruct | 50 | 11.06 | 6 | 3 | 1 | 0 | 1 | 0 |
| 73 | Alibaba | Qwen3 VL 30B A3B Instruct | 50 | 10.02 | 6 | 3 | 1 | 0 | 1 | 0 |
| 74 | Alibaba | Qwen3 VL 8B (Reasoning) | 50 | 10.58 | 6 | 3 | 1 | 0 | 1 | 0 |
| 75 | Alibaba | Qwen3 VL 32B (Reasoning) | 50 | 17.93 | 6 | 3 | 1 | 0 | 1 | 0 |
| 76 | Alibaba | Qwen3 VL 4B Instruct | 50 | 4.09 | 6 | 3 | 1 | 0 | 1 | 0 |
| 77 | Alibaba | Qwen3 VL 4B (Reasoning) | 50 | 7.9 | 6 | 3 | 1 | 0 | 1 | 0 |
| 78 | Alibaba | Qwen3 VL 8B Instruct | 50 | 8.42 | 6 | 3 | 1 | 0 | 1 | 0 |
| 79 | Nous Research | Hermes 4 - Llama-3.1 70B (Non-reasoning) | 47.22 | 6.9 | 4 | 4.5 | 1 | 0 | 2 | 0 |
| 80 | Nous Research | Hermes 4 - Llama-3.1 405B (Non-reasoning) | 47.22 | 8.8 | 4 | 4.5 | 1 | 0 | 2 | 0 |
| 81 | Nous Research | Hermes 4 - Llama-3.1 405B (Reasoning) | 47.22 | 9 | 4 | 4.5 | 1 | 0 | 2 | 0 |
| 82 | Nous Research | Hermes 4 - Llama-3.1 70B (Reasoning) | 47.22 | 9.97 | 4 | 4.5 | 1 | 0 | 2 | 0 |
| 83 | DeepSeek | DeepSeek R1 0528 Qwen3 8B | 47.22 | 10.37 | 6 | 2.5 | 0 | 0 | 1 | 0 |
| 84 | ServiceNow | Apriel-v1.5-15B-Thinker | 47.22 | 21.23 | 6 | 2.5 | 0 | 0 | 1 | 0 |
| 85 | Gemma 3 270M | 44.44 | 2.41 | 6 | 2 | 0 | 0 | 0 | 0 | |
| 86 | TII UAE | Falcon-H1R-7B | 44.44 | 9.79 | 4 | 4 | 1 | 0 | 1 | 0 |
| 87 | NVIDIA | Llama 3.1 Nemotron Instruct 70B | 44.44 | 7.64 | 4 | 4 | 0 | 0 | 1 | 1 |
| 88 | LongCat | LongCat Flash Lite | 44.44 | 17.22 | 6 | 2 | 0 | 0 | 0 | 0 |
| 89 | OpenBMB | MiniCPM-V 4.6 1.3B | 44.44 | 4.19 | 6 | 2 | 0 | 0 | 0 | 0 |
| 90 | Arcee AI | Trinity Large Thinking | 44.44 | 24.47 | 6 | 2 | 0 | 0 | 0 | 0 |
| 91 | Z AI | GLM-5.2 (max) | 44.44 | 51.09 | 6 | 2 | 0 | 0 | 0 | 0 |
| 92 | Alibaba | Qwen3 Omni 30B A3B Instruct | 44.44 | 5.11 | 6 | 2 | 0 | 0 | 0 | 0 |
| 93 | Alibaba | Qwen3 Next 80B A3B (Reasoning) | 44.44 | 16.72 | 6 | 2 | 0 | 0 | 0 | 0 |
| 94 | Alibaba | Qwen3 Next 80B A3B Instruct | 44.44 | 13.72 | 6 | 2 | 0 | 0 | 0 | 0 |
| 95 | Alibaba | Qwen3 Omni 30B A3B (Reasoning) | 44.44 | 9.63 | 6 | 2 | 0 | 0 | 0 | 0 |
| 96 | InclusionAI | Ling-mini-2.0 | 44.44 | 3.75 | 6 | 2 | 0 | 0 | 0 | 0 |
| 97 | Mistral | Devstral Small (Jul '25) | 44.44 | 9.26 | 6 | 2 | 0 | 0 | 0 | 0 |
| 98 | DeepSeek | DeepSeek V3.2 Exp (Non-reasoning) | 44.44 | 21.33 | 6 | 2 | 0 | 0 | 0 | 0 |
| 99 | DeepSeek | DeepSeek V3.2 Exp (Reasoning) | 44.44 | 25.45 | 6 | 2 | 0 | 0 | 0 | 0 |
| 100 | Kimi | Kimi K2 | 44.44 | 19.4 | 4 | 4 | 1 | 0 | 1 | 0 |
| 101 | Z AI | GLM-5.1 (Reasoning) | 44.44 | 40.16 | 6 | 2 | 0 | 0 | 0 | 0 |
| 102 | Z AI | GLM-4.7 (Non-reasoning) | 44.44 | 26.56 | 6 | 2 | 0 | 0 | 0 | 0 |
| 103 | Z AI | GLM-5.1 (Non-reasoning) | 44.44 | 35.37 | 6 | 2 | 0 | 0 | 0 | 0 |
| 104 | Z AI | GLM-4.7-Flash (Non-reasoning) | 44.44 | 15.52 | 6 | 2 | 0 | 0 | 0 | 0 |
| 105 | Z AI | GLM-4.7-Flash (Reasoning) | 44.44 | 22.89 | 6 | 2 | 0 | 0 | 0 | 0 |
| 106 | Z AI | GLM-4.7 (Reasoning) | 44.44 | 33.7 | 6 | 2 | 0 | 0 | 0 | 0 |
| 107 | Z AI | GLM-4.6 (Non-reasoning) | 44.44 | 22.98 | 6 | 2 | 0 | 0 | 0 | 0 |
| 108 | Z AI | GLM-4.6 (Reasoning) | 44.44 | 28.7 | 6 | 2 | 0 | 0 | 0 | 0 |
| 109 | Alibaba | Qwen3 Coder 480B A35B Instruct | 44.44 | 17.98 | 6 | 2 | 0 | 0 | 0 | 0 |
| 110 | Alibaba | Qwen3 235B A22B 2507 (Reasoning) | 44.44 | 19.61 | 6 | 2 | 0 | 0 | 0 | 0 |
| 111 | Alibaba | Qwen3 235B A22B 2507 Instruct | 44.44 | 18.16 | 6 | 2 | 0 | 0 | 0 | 0 |
| 112 | Alibaba | Qwen3 Coder 30B A3B Instruct | 44.44 | 13.61 | 6 | 2 | 0 | 0 | 0 | 0 |
| 113 | Alibaba | Qwen3 30B A3B 2507 Instruct | 44.44 | 9.06 | 6 | 2 | 0 | 0 | 0 | 0 |
| 114 | Alibaba | Qwen3 4B 2507 Instruct | 44.44 | 7.12 | 6 | 2 | 0 | 0 | 0 | 0 |
| 115 | Alibaba | Qwen3 30B A3B 2507 (Reasoning) | 44.44 | 14.44 | 6 | 2 | 0 | 0 | 0 | 0 |
| 116 | Alibaba | Qwen3 4B 2507 (Reasoning) | 44.44 | 11.96 | 6 | 2 | 0 | 0 | 0 | 0 |
| 117 | InclusionAI | Ling-flash-2.0 | 44.44 | 9.74 | 6 | 2 | 0 | 0 | 0 | 0 |
| 118 | InclusionAI | Ling-1T | 44.44 | 12.75 | 6 | 2 | 0 | 0 | 0 | 0 |
| 119 | ByteDance Seed | Seed-OSS-36B-Instruct | 44.44 | 18.34 | 6 | 2 | 0 | 0 | 0 | 0 |
| 120 | Cohere | North Mini Code | 41.67 | 19.8 | 6 | 1.5 | 0 | 0 | 1 | 0 |
| 121 | Alibaba | Qwen3 Coder Next | 41.67 | 21.11 | 6 | 1.5 | 0 | 0 | 1 | 0 |
| 122 | OpenAI | gpt-oss-20b (high) | 38.89 | 14.89 | 6 | 1 | 0 | 0 | 0 | 0 |
| 123 | OpenAI | gpt-oss-120b (high) | 38.89 | 23.83 | 6 | 1 | 0 | 0 | 0 | 0 |
| 124 | Meta | Llama 3.3 Instruct 70B | 38.89 | 9.4 | 4 | 3 | 1 | 0 | 1 | 0 |
| 125 | Meta | Llama 3.1 Instruct 405B | 38.89 | 8.5 | 4 | 3 | 1 | 0 | 1 | 0 |
| 126 | Meta | Llama 3.2 Instruct 90B (Vision) | 38.89 | 6.23 | 4 | 3 | 1 | 0 | 1 | 0 |
| 127 | Meta | Llama 3.2 Instruct 11B (Vision) | 38.89 | 3.33 | 4 | 3 | 1 | 0 | 1 | 0 |
| 128 | Gemma 4 12B (Non-reasoning) | 38.89 | 13.19 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 129 | Gemma 4 31B (Reasoning) | 38.89 | 29.35 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 130 | Gemma 4 26B A4B (Non-reasoning) | 38.89 | 20.1 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 131 | Gemma 4 31B (Non-reasoning) | 38.89 | 21.77 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 132 | Gemma 4 E4B (Reasoning) | 38.89 | 12.5 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 133 | Gemma 4 26B A4B (Reasoning) | 38.89 | 25.69 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 134 | Gemma 4 E4B (Non-reasoning) | 38.89 | 8.91 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 135 | Gemma 4 12B (Reasoning) | 38.89 | 22 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 136 | Gemma 4 E2B (Non-reasoning) | 38.89 | 6.41 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 137 | Gemma 4 E2B (Reasoning) | 38.89 | 9.26 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 138 | Mistral | Mistral Large 3 | 38.89 | 15.93 | 6 | 1 | 0 | 0 | 0 | 0 |
| 139 | Mistral | Mistral Small 4 (Reasoning) | 38.89 | 19.56 | 6 | 1 | 0 | 0 | 0 | 0 |
| 140 | Mistral | Mistral Small 4 (Non-reasoning) | 38.89 | 12.37 | 6 | 1 | 0 | 0 | 0 | 0 |
| 141 | Perplexity | R1 1776 | 38.89 | 6.31 | 6 | 1 | 0 | 0 | 0 | 0 |
| 142 | StepFun | Step 3.7 Flash | 38.89 | 30.27 | 6 | 1 | 0 | 0 | 0 | 0 |
| 143 | Reka AI | Reka Flash 3 | 38.89 | 4.06 | 6 | 1 | 0 | 0 | 0 | 0 |
| 144 | Nous Research | DeepHermes 3 - Mistral 24B Preview (Non-reasoning) | 38.89 | 5.31 | 6 | 1 | 0 | 0 | 0 | 0 |
| 145 | Xiaomi | MiMo-V2.5-Pro | 38.89 | 42.24 | 6 | 1 | 0 | 0 | 0 | 0 |
| 146 | Xiaomi | MiMo-V2.5 | 38.89 | 37.2 | 6 | 1 | 0 | 0 | 0 | 0 |
| 147 | Xiaomi | MiMo-V2.5-Pro (Non-reasoning) | 38.89 | 27.86 | 6 | 1 | 0 | 0 | 0 | 0 |
| 148 | Sarvam | Sarvam 30B (high) | 38.89 | 6.64 | 6 | 1 | 0 | 0 | 0 | 0 |
| 149 | Sarvam | Sarvam 105B (high) | 38.89 | 11.94 | 6 | 1 | 0 | 0 | 0 | 0 |
| 150 | Multiverse Computing | HyperNova 60B 2605 | 38.89 | 17.8 | 6 | 1 | 0 | 0 | 0 | 0 |
| 151 | Deep Cogito | Cogito v2.1 (Reasoning) | 38.89 | — | 6 | 1 | 0 | 0 | 0 | 0 |
| 152 | Nex AGI | Nex-N2-Pro | 38.89 | 40.96 | 6 | 1 | 0 | 0 | 0 | 0 |
| 153 | Cohere | Command A+ | 38.89 | 22.51 | 6 | 1 | 0 | 0 | 0 | 0 |
| 154 | AI21 Labs | Jamba Reasoning 3B | 38.89 | 4.13 | 6 | 1 | 0 | 0 | 0 | 0 |
| 155 | Alibaba | Qwen3.5 397B A17B (Reasoning) | 38.89 | 33.68 | 6 | 1 | 0 | 0 | 0 | 0 |
| 156 | Alibaba | Qwen3.5 397B A17B (Non-reasoning) | 38.89 | 31.98 | 6 | 1 | 0 | 0 | 0 | 0 |
| 157 | Alibaba | Qwen3.6 35B A3B (Non-reasoning) | 38.89 | 24.16 | 6 | 1 | 0 | 0 | 0 | 0 |
| 158 | Alibaba | Qwen3.5 122B A10B (Reasoning) | 38.89 | 32.28 | 6 | 1 | 0 | 0 | 0 | 0 |
| 159 | Alibaba | Qwen3.6 27B (Non-reasoning) | 38.89 | 30.46 | 6 | 1 | 0 | 0 | 0 | 0 |
| 160 | Alibaba | Qwen3.5 0.8B (Reasoning) | 38.89 | 5.48 | 6 | 1 | 0 | 0 | 0 | 0 |
| 161 | Alibaba | Qwen3.5 9B (Reasoning) | 38.89 | 21.44 | 6 | 1 | 0 | 0 | 0 | 0 |
| 162 | Alibaba | Qwen3.5 9B (Non-reasoning) | 38.89 | 20.32 | 6 | 1 | 0 | 0 | 0 | 0 |
| 163 | Alibaba | Qwen3.6 35B A3B (Reasoning) | 38.89 | 31.65 | 6 | 1 | 0 | 0 | 0 | 0 |
| 164 | Alibaba | Qwen3.6 27B (Reasoning) | 38.89 | 37.05 | 6 | 1 | 0 | 0 | 0 | 0 |
| 165 | Alibaba | Qwen3.5 35B A3B (Non-reasoning) | 38.89 | 23.99 | 6 | 1 | 0 | 0 | 0 | 0 |
| 166 | Alibaba | Qwen3.5 4B (Reasoning) | 38.89 | 20.09 | 6 | 1 | 0 | 0 | 0 | 0 |
| 167 | Alibaba | Qwen3.5 122B A10B (Non-reasoning) | 38.89 | 27.6 | 6 | 1 | 0 | 0 | 0 | 0 |
| 168 | Alibaba | Qwen3.5 2B (Non-reasoning) | 38.89 | 5.62 | 6 | 1 | 0 | 0 | 0 | 0 |
| 169 | Alibaba | Qwen3.5 2B (Reasoning) | 38.89 | 7.64 | 6 | 1 | 0 | 0 | 0 | 0 |
| 170 | Alibaba | Qwen3.5 0.8B (Non-reasoning) | 38.89 | 3.31 | 6 | 1 | 0 | 0 | 0 | 0 |
| 171 | Alibaba | Qwen3.5 4B (Non-reasoning) | 38.89 | 16 | 6 | 1 | 0 | 0 | 0 | 0 |
| 172 | InclusionAI | Ling-2.6-1T | 38.89 | 26.05 | 6 | 1 | 0 | 0 | 0 | 0 |
| 173 | InclusionAI | Ling 2.6 Flash | 38.89 | 14.05 | 6 | 1 | 0 | 0 | 0 | 0 |
| 174 | InclusionAI | Ring-flash-2.0 | 38.89 | 8.16 | 6 | 1 | 0 | 0 | 0 | 0 |
| 175 | InclusionAI | Ring-2.6-1T | 38.89 | 30.57 | 6 | 1 | 0 | 0 | 0 | 0 |
| 176 | Mistral | Mistral Small 3.2 | 38.89 | 10.56 | 6 | 1 | 0 | 0 | 0 | 0 |
| 177 | DeepSeek | DeepSeek V3.1 Terminus (Reasoning) | 38.89 | 30.44 | 6 | 1 | 0 | 0 | 0 | 0 |
| 178 | DeepSeek | DeepSeek V3.1 Terminus (Non-reasoning) | 38.89 | 21.41 | 6 | 1 | 0 | 0 | 0 | 0 |
| 179 | Alibaba | Qwen3.5 27B (Reasoning) | 38.89 | 33.78 | 6 | 1 | 0 | 0 | 0 | 0 |
| 180 | Alibaba | Qwen3.5 35B A3B (Reasoning) | 38.89 | 29.26 | 6 | 1 | 0 | 0 | 0 | 0 |
| 181 | Alibaba | Qwen3.5 27B (Non-reasoning) | 38.89 | 29.31 | 6 | 1 | 0 | 0 | 0 | 0 |
| 182 | InclusionAI | Ring-1T | 38.89 | 16.16 | 6 | 1 | 0 | 0 | 0 | 0 |
| 183 | DeepSeek | DeepSeek R1 Distill Llama 70B | 36.11 | 9.93 | 4 | 2.5 | 0 | 0 | 1 | 0 |
| 184 | Mistral | Mistral Medium 3.5 | 33.33 | 29.95 | 5 | 1 | 0 | 0 | 0 | 0 |
| 185 | Liquid AI | LFM2 2.6B | 33.33 | 2.71 | 4 | 2 | 0 | 0 | 0 | 0 |
| 186 | Liquid AI | LFM2 8B A1B | 33.33 | 1.78 | 4 | 2 | 0 | 0 | 0 | 0 |
| 187 | Liquid AI | LFM2.5-8B-A1B | 33.33 | 8.32 | 4 | 2 | 0 | 0 | 0 | 0 |
| 188 | MiniMax | MiniMax-M3 | 33.33 | 44.44 | 4 | 2 | 0 | 0 | 0 | 0 |
| 189 | Kimi | Kimi K2.6 (Non-reasoning) | 33.33 | 34.58 | 4 | 2 | 0 | 0 | 0 | 0 |
| 190 | Nous Research | DeepHermes 3 - Llama-3.1 8B Preview (Non-reasoning) | 33.33 | 2.29 | 5 | 1 | 0 | 0 | 0 | 0 |
| 191 | Tencent | Hy3-preview (Reasoning) | 33.33 | 33.58 | 5 | 1 | 0 | 0 | 0 | 0 |
| 192 | Tencent | Hy3-preview (Non-reasoning) | 33.33 | 26.1 | 5 | 1 | 0 | 0 | 0 | 0 |
| 193 | Cohere | Command A | 33.33 | 7.67 | 3 | 3 | 0 | 0 | 0 | 0 |
| 194 | Liquid AI | LFM2 1.2B | 33.33 | 1.15 | 4 | 2 | 0 | 0 | 0 | 0 |
| 195 | Kimi | Kimi K2.5 (Reasoning) | 33.33 | 35.37 | 4 | 2 | 0 | 0 | 0 | 0 |
| 196 | Kimi | Kimi K2.6 | 33.33 | 44.22 | 4 | 2 | 0 | 0 | 0 | 0 |
| 197 | Kimi | Kimi K2.5 (Non-reasoning) | 33.33 | 29.4 | 4 | 2 | 0 | 0 | 0 | 0 |
| 198 | Naver | HyperCLOVA X SEED Think (32B) | 30.56 | 17.02 | 4 | 1.5 | 1 | 0 | 0 | 0 |
| 199 | Meta | Llama 4 Maverick | 27.78 | 14.27 | 4 | 1 | 0 | 0 | 0 | 0 |
| 200 | Meta | Llama 4 Scout | 27.78 | 10.04 | 4 | 1 | 0 | 0 | 0 | 0 |
| 201 | Mistral | Magistral Medium 1.2 | 27.78 | 17.87 | 2 | 3 | 0 | 0 | 1 | 1 |
| 202 | Liquid AI | LFM2.5-1.2B-Thinking | 27.78 | 2.75 | 4 | 1 | 0 | 0 | 0 | 0 |
| 203 | Liquid AI | LFM2.5-1.2B-Instruct | 27.78 | 2.71 | 4 | 1 | 0 | 0 | 0 | 0 |
| 204 | Liquid AI | LFM2.5-VL-1.6B | 27.78 | 1.01 | 4 | 1 | 0 | 0 | 0 | 0 |
| 205 | Liquid AI | LFM2 24B A2B | 27.78 | 4.95 | 4 | 1 | 0 | 0 | 0 | 0 |
| 206 | Kimi | Kimi K2.7 Code | 27.78 | 41.95 | 4 | 1 | 0 | 0 | 0 | 0 |
| 207 | LG AI Research | Exaone 4.0 1.2B (Reasoning) | 27.78 | 2.9 | 3 | 2 | 0 | 0 | 0 | 0 |
| 208 | LG AI Research | EXAONE 4.0 32B (Non-reasoning) | 27.78 | 6.01 | 3 | 2 | 0 | 0 | 0 | 0 |
| 209 | LG AI Research | K-EXAONE (Non-reasoning) | 27.78 | 16.74 | 4 | 1 | 0 | 0 | 0 | 0 |
| 210 | LG AI Research | EXAONE 4.5 33B | 27.78 | 22.96 | 3 | 2 | 0 | 0 | 0 | 0 |
| 211 | LG AI Research | Exaone 4.0 1.2B (Non-reasoning) | 27.78 | 2.77 | 3 | 2 | 0 | 0 | 0 | 0 |
| 212 | LG AI Research | EXAONE 4.5 33B (Non-reasoning) | 27.78 | — | 3 | 2 | 0 | 0 | 0 | 0 |
| 213 | LG AI Research | K-EXAONE (Reasoning) | 27.78 | 24.7 | 4 | 1 | 0 | 0 | 0 | 0 |
| 214 | LG AI Research | EXAONE 4.0 32B (Reasoning) | 27.78 | 10.59 | 3 | 2 | 0 | 0 | 0 | 0 |
| 215 | MiniMax | MiniMax-M2 | 27.78 | 28.31 | 4 | 1 | 0 | 0 | 0 | 0 |
| 216 | MiniMax | MiniMax-M2.5 | 27.78 | 33.65 | 4 | 1 | 0 | 0 | 0 | 0 |
| 217 | MiniMax | MiniMax-M2.1 | 27.78 | 31.36 | 4 | 1 | 0 | 0 | 0 | 0 |
| 218 | Kimi | Kimi K2 0905 | 27.78 | 23.54 | 4 | 1 | 0 | 0 | 0 | 0 |
| 219 | Kimi | Kimi K2 Thinking | 27.78 | 32.7 | 4 | 1 | 0 | 0 | 0 | 0 |
| 220 | AI21 Labs | Jamba 1.7 Mini | 22.22 | 2.73 | 4 | 0 | 0 | 0 | 0 | 0 |
| 221 | AI21 Labs | Jamba 1.7 Large | 22.22 | 5.3 | 4 | 0 | 0 | 0 | 0 | 0 |
| 222 | MiniMax | MiniMax-M2.7 | 22.22 | 38.13 | 3 | 1 | 0 | 0 | 0 | 0 |
| 223 | Alibaba | Qwen3 Max | 16.67 | 24.01 | 2 | 1 | 0 | 0 | 0 | 0 |
| 224 | Alibaba | Qwen3 Max Thinking (Preview) | 16.67 | 25.03 | 2 | 1 | 0 | 0 | 0 | 0 |
| 225 | Anthropic | Claude 4.5 Haiku (Non-reasoning) | 11.11 | 23.71 | 2 | 0 | 0 | 0 | 0 | 0 |
| 226 | Anthropic | Claude 4.5 Haiku (Reasoning) | 11.11 | 29.58 | 2 | 0 | 0 | 0 | 0 | 0 |
| 227 | Amazon | Nova Micro | 11.11 | 4.74 | 2 | 0 | 0 | 0 | 0 | 0 |
| 228 | Amazon | Nova Premier | 11.11 | 12.73 | 2 | 0 | 0 | 0 | 0 | 0 |
| 229 | Upstage | Solar Pro 2 (Reasoning) | 11.11 | 8.99 | 2 | 0 | 0 | 0 | 0 | 0 |
| 230 | Upstage | Solar Pro 2 (Non-reasoning) | 11.11 | 7.77 | 2 | 0 | 0 | 0 | 0 | 0 |
| 231 | ByteDance Seed | Doubao Seed Code | 11.11 | 25.98 | 2 | 0 | 0 | 0 | 0 | 0 |
| 232 | OpenAI | GPT-5.1 (Non-reasoning) | 11.11 | 20.4 | 2 | 0 | 0 | 0 | 0 | 0 |
| 233 | OpenAI | GPT-5 (ChatGPT) | 11.11 | 15.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 234 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning) | 11.11 | 13.1 | 2 | 0 | 0 | 0 | 0 | 0 | |
| 235 | Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning) | 11.11 | 18.83 | 2 | 0 | 0 | 0 | 0 | 0 | |
| 236 | Anthropic | Claude Opus 4.5 (Non-reasoning) | 11.11 | 34.71 | 2 | 0 | 0 | 0 | 0 | 0 |
| 237 | Anthropic | Claude 4.5 Sonnet (Non-reasoning) | 11.11 | 29.28 | 2 | 0 | 0 | 0 | 0 | 0 |
| 238 | Anthropic | Claude 4.5 Sonnet (Reasoning) | 11.11 | 36.42 | 2 | 0 | 0 | 0 | 0 | 0 |
| 239 | Anthropic | Claude Opus 4.5 (Reasoning) | 11.11 | 40.77 | 2 | 0 | 0 | 0 | 0 | 0 |
| 240 | Mistral | Mistral Medium 3.1 | 11.11 | 14.68 | 2 | 0 | 0 | 0 | 0 | 0 |
| 241 | Mistral | Devstral Medium | 11.11 | 12.4 | 2 | 0 | 0 | 0 | 0 | 0 |
| 242 | SpaceXAI | Grok 3 mini Reasoning (high) | 11.11 | 22.5 | 2 | 0 | 0 | 0 | 0 | 0 |
| 243 | SpaceXAI | Grok 4 Fast (Non-reasoning) | 11.11 | 16.47 | 2 | 0 | 0 | 0 | 0 | 0 |
| 244 | SpaceXAI | Grok 4.1 Fast (Non-reasoning) | 11.11 | 16.88 | 2 | 0 | 0 | 0 | 0 | 0 |
| 245 | Amazon | Nova Pro | 11.11 | 7.67 | 2 | 0 | 0 | 0 | 0 | 0 |
| 246 | Amazon | Nova Lite | 11.11 | 6.92 | 2 | 0 | 0 | 0 | 0 | 0 |
| 247 | OpenAI | o3 | 5.56 | 30.4 | 1 | 0 | 0 | 0 | 0 | 0 |
| 248 | Gemini 2.5 Pro | 5.56 | 25.82 | 1 | 0 | 0 | 0 | 0 | 0 | |
| 249 | OpenAI | GPT-5 nano (minimal) | 5.56 | 8 | 1 | 0 | 0 | 0 | 0 | 0 |
| 250 | OpenAI | GPT-5 mini (high) | 5.56 | 25.31 | 1 | 0 | 0 | 0 | 0 | 0 |
| 251 | OpenAI | GPT-5 (high) | 5.56 | 34.71 | 1 | 0 | 0 | 0 | 0 | 0 |
| 252 | OpenAI | GPT-5.1 (high) | 5.56 | 36.87 | 1 | 0 | 0 | 0 | 0 | 0 |
| 253 | OpenAI | GPT-5 Codex (high) | 5.56 | 36.12 | 1 | 0 | 0 | 0 | 0 | 0 |
| 254 | OpenAI | GPT-5 (medium) | 5.56 | 33.74 | 1 | 0 | 0 | 0 | 0 | 0 |
| 255 | OpenAI | GPT-5 (low) | 5.56 | 31.15 | 1 | 0 | 0 | 0 | 0 | 0 |
| 256 | OpenAI | GPT-5 nano (medium) | 5.56 | 19 | 1 | 0 | 0 | 0 | 0 | 0 |
| 257 | OpenAI | GPT-5 mini (minimal) | 5.56 | 14.25 | 1 | 0 | 0 | 0 | 0 | 0 |
| 258 | OpenAI | GPT-5 mini (medium) | 5.56 | 30.92 | 1 | 0 | 0 | 0 | 0 | 0 |
| 259 | OpenAI | GPT-5 (minimal) | 5.56 | 17.18 | 1 | 0 | 0 | 0 | 0 | 0 |
| 260 | OpenAI | GPT-5 nano (high) | 5.56 | 19.87 | 1 | 0 | 0 | 0 | 0 | 0 |
| 261 | Gemini 3 Pro Preview (high) | 5.56 | 39.55 | 1 | 0 | 0 | 0 | 0 | 0 | |
| 262 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning) | 5.56 | 15.13 | 1 | 0 | 0 | 0 | 0 | 0 | |
| 263 | Gemini 2.5 Flash Preview (Sep '25) (Reasoning) | 5.56 | 23.8 | 1 | 0 | 0 | 0 | 0 | 0 | |
| 264 | SpaceXAI | Grok 4 | 5.56 | 33.28 | 1 | 0 | 0 | 0 | 0 | 0 |
| 265 | SpaceXAI | Grok 4 Fast (Reasoning) | 5.56 | 27.37 | 1 | 0 | 0 | 0 | 0 | 0 |
| 266 | SpaceXAI | Grok Code Fast 1 | 5.56 | 21.61 | 1 | 0 | 0 | 0 | 0 | 0 |
| 267 | SpaceXAI | Grok 4.1 Fast (Reasoning) | 5.56 | 30.62 | 1 | 0 | 0 | 0 | 0 | 0 |
从权重、许可、技术披露和复现条件观察模型开放程度。
评测结果受任务集合、评分方法和模型版本影响。本站保留原始口径,不用它生成新的综合排名。
用于回答一个明确的问题:模型在这一类任务上的相对表现如何,而不是“哪个模型绝对最好”。