AI 模型公开数据观察

独立信息,清晰理解 AI 前沿

聚合模型能力、编码 Agent、媒体生成、成本、速度、Provider 与硬件等公开评测视角,不修改原始分数。

数据快照:2026-07-21查看原始站点

最新变化

模型与评测动态

保留来源的发布日期与事实描述,点击后进入原始文章或模型页面。

  1. 07-20模型评测Motif 3(Beta)加入语言模型评测
  2. 07-17研究文章六家实验室已有模型突破 Intelligence Index 50
  3. 07-17研究文章Kimi K3 位列 Intelligence Index 第三
  4. 07-15模型评测Inkling 成为领先的美国开放权重模型
  5. 07-13成本分析GPT-5.6 Sol、Terra、Luna 的智能与成本对比

智能指数 · 按国家

各国领先 AI 模型

Artificial Analysis Intelligence Index · 数值越高越好

当前显示 28 / 28个模型

  1. Claude Fable 5Anthropic · 🇺🇸 美国
    60
  2. GPT-5.6 Sol(max)OpenAI · 🇺🇸 美国
    59
  3. Kimi K3Kimi · 🇨🇳 中国
    57
  4. Claude Opus 4.8(max)Anthropic · 🇺🇸 美国
    56
  5. GPT-5.6 Terra(max)OpenAI · 🇺🇸 美国
    55
  6. GPT-5.5(xhigh)OpenAI · 🇺🇸 美国
    55
  7. Grok 4.5(high)xAI · 🇺🇸 美国
    54
  8. Claude Sonnet 5(max)Anthropic · 🇺🇸 美国
    53
  9. GPT-5.6 Luna(max)OpenAI · 🇺🇸 美国
    51
  10. GLM-5.2(max)智谱 AI · 🇨🇳 中国
    51
  11. Muse Spark 1.1(xhigh)Meta · 🇺🇸 美国
    51
  12. Gemini 3.5 FlashGoogle · 🇺🇸 美国
    50
  13. Gemini 3.1 Pro PreviewGoogle · 🇺🇸 美国
    46
  14. Qwen3.7 Max阿里巴巴 · 🇨🇳 中国
    46
  15. MiniMax-M3MiniMax · 🇨🇳 中国
    44
  16. DeepSeek V4 Pro(max)DeepSeek · 🇨🇳 中国
    44
  17. Kimi K2.6Kimi · 🇨🇳 中国
    44
  18. MiMo-V2.5-Pro小米 · 🇨🇳 中国
    44
  19. InklingThinking Machines · 🇺🇸 美国
    42
  20. DeepSeek V4 Flash(max)DeepSeek · 🇨🇳 中国
    41
  21. Nemotron 3 UltraNVIDIA · 🇺🇸 美国
    40
  22. Mistral Medium 3.5Mistral AI · 🇫🇷 法国
    38
  23. Claude 4.5 HaikuAnthropic · 🇺🇸 美国
    30
  24. Gemma 4 31BGoogle · 🇺🇸 美国
    30
  25. gpt-oss-120b(high)OpenAI · 🇺🇸 美国
    29
  26. Command A+Cohere · 🇨🇦 加拿大
    24
  27. K2 Think V2MBZUAI · 🇦🇪 阿联酋
    23
  28. Motif 3(Beta)Motif · 🇺🇸 美国
    17
查看表格明细
当前筛选结果明细
模型机构国家指数
Claude Fable 5Anthropic🇺🇸 美国60
GPT-5.6 Sol(max)OpenAI🇺🇸 美国59
Kimi K3Kimi🇨🇳 中国57
Claude Opus 4.8(max)Anthropic🇺🇸 美国56
GPT-5.6 Terra(max)OpenAI🇺🇸 美国55
GPT-5.5(xhigh)OpenAI🇺🇸 美国55
Grok 4.5(high)xAI🇺🇸 美国54
Claude Sonnet 5(max)Anthropic🇺🇸 美国53
GPT-5.6 Luna(max)OpenAI🇺🇸 美国51
GLM-5.2(max)智谱 AI🇨🇳 中国51
Muse Spark 1.1(xhigh)Meta🇺🇸 美国51
Gemini 3.5 FlashGoogle🇺🇸 美国50
Gemini 3.1 Pro PreviewGoogle🇺🇸 美国46
Qwen3.7 Max阿里巴巴🇨🇳 中国46
MiniMax-M3MiniMax🇨🇳 中国44
DeepSeek V4 Pro(max)DeepSeek🇨🇳 中国44
Kimi K2.6Kimi🇨🇳 中国44
MiMo-V2.5-Pro小米🇨🇳 中国44
InklingThinking Machines🇺🇸 美国42
DeepSeek V4 Flash(max)DeepSeek🇨🇳 中国41
Nemotron 3 UltraNVIDIA🇺🇸 美国40
Mistral Medium 3.5Mistral AI🇫🇷 法国38
Claude 4.5 HaikuAnthropic🇺🇸 美国30
Gemma 4 31BGoogle🇺🇸 美国30
gpt-oss-120b(high)OpenAI🇺🇸 美国29
Command A+Cohere🇨🇦 加拿大24
K2 Think V2MBZUAI🇦🇪 阿联酋23
Motif 3(Beta)Motif🇺🇸 美国17

Model Comparison

模型横向比较

完整展示 255 个模型,把智能、上下文、成本、生成速度和响应时间放在同一张表里,并支持搜索、筛选和排序。

查看原始来源 ↗
255 / 255 个模型
模型智能、价格、速度和延迟横向比较
模型上下文机构USDToken/s进一步分析
Claude Fable 5推理模型1MAnthropic60US$2.7565100.91108.61
GPT-5.6 Sol (max)推理模型1MOpenAI59US$1.0463142.61150.52
GPT-5.6 Sol (xhigh)推理模型1MOpenAI58US$0.686052.1860.53
Kimi K3推理模型1.05MKimi57US$0.95
GPT-5.6 Sol (high)推理模型1MOpenAI56US$0.456112.8721.14
Claude Opus 4.8 (max)推理模型1MAnthropic56US$1.806030.8939.25
GPT-5.6 Terra (max)推理模型1MOpenAI55US$0.82150163.1166.44
Grok 4.5 (high)推理模型500kSpaceXAI54US$0.317310.6917.54
GPT-5.6 Sol (medium)推理模型1MOpenAI54US$0.31549.9319.21
Claude Sonnet 5 (max)推理模型1MAnthropic53US$1.5384182.27188.23
GPT-5.6 Terra (xhigh)推理模型1MOpenAI52US$0.4813114.0217.83
GPT-5.6 Luna (max)推理模型1MOpenAI51US$0.2119582.785.26
GLM-5.2 (max)推理模型1MZ AI51US$0.471991.3713.92
Muse Spark 1.1 (xhigh)推理模型1.05MMeta51US$0.261221.2721.81
Gemini 3.5 Flash推理模型1MGoogle50US$0.5916520.3123.33
GPT-5.6 Sol (low)推理模型1MOpenAI49US$0.20533.2112.7
GPT-5.6 Luna (xhigh)推理模型1MOpenAI49US$0.1420831.4933.9
GPT-5.6 Terra (high)推理模型1MOpenAI49US$0.341262.956.92
Gemini 3.1 Pro Preview推理模型1MGoogle46US$0.2912531.7535.74
GPT-5.6 Luna (high)推理模型1MOpenAI46US$0.091927.8910.5
Qwen3.7 Max推理模型1MAlibaba46US$1.032032.4216.75
GPT-5.6 Terra (medium)推理模型1MOpenAI46US$0.181261.345.3
MiniMax-M3推理模型1MMiniMax44US$0.121051.3925.27
DeepSeek V4 Pro (max)推理模型1MDeepSeek44US$0.04721.6869.26
Motif 3 (Beta)推理模型262kMotif Technologies44
DeepSeek V4 Pro (high)推理模型1MDeepSeek43US$0.04721.8236.62
Muse Spark推理模型262kMeta43
MiMo-V2.5-Pro推理模型1MXiaomi42US$0.03593.0645.51
Kimi K2.7 Code推理模型256kKimi42482.9259.86
Claude Sonnet 5 (Non-reasoning)非推理模型1MAnthropic42US$0.37671.218.68
Hy3推理模型256kTencent41US$0.00592.4444.76
GPT-5.6 Sol (Non-reasoning)非推理模型1MOpenAI41US$0.20560.949.79
Nex-N2-Pro推理模型262kNex AGI411431.719.23
Inkling推理模型1MThinking Machines41
GPT-5.6 Terra (low)推理模型1MOpenAI40US$0.151271.325.25
DeepSeek V4 Flash (max)推理模型1MDeepSeek40US$0.021211.2751.7
Qwen3.6 Plus推理模型1MAlibaba40US$0.31532.59117.51
Qwen3.7 Plus推理模型1MAlibaba39US$0.21532.9250.33
JT-4.1 Flash 236B A21B推理模型256kChina Mobile39
GPT-5.6 Luna (medium)推理模型1MOpenAI38US$0.051861.744.43
Nemotron 3 Ultra推理模型262kNVIDIA38US$0.242091.2714.53
MiMo-V2.5推理模型1MXiaomi37US$0.01644.0943.23
Qwen3.6 27B推理模型262kAlibaba37US$0.27573.76112.96
GLM-5.2推理模型1MZ AI34931.556.93
GPT-5.6 Terra (Non-reasoning)非推理模型1MOpenAI34US$0.181260.684.64
KAT-Coder-Pro V2推理模型256kKwaiKAT34
Qwen3.5 397B A17B推理模型262kAlibaba34US$0.33622.5361.57
LongCat 2.0推理模型1MLongCat33
GPT-5.6 Luna (low)推理模型1MOpenAI33US$0.041891.33.94
Qwen3.5 122B A10B推理模型262kAlibaba32US$0.241332.3421.07
Qwen3.6 35B A3B推理模型262kAlibaba32US$0.181512.2441.29
Ring-2.6-1T推理模型262kInclusionAI31US$0.351303.2222.42
Qwen3.6 27B推理模型262kAlibaba30US$0.36583.6712.31
Step 3.7 Flash推理模型262kStepFun303980.857.14
Mistral Medium 3.5推理模型256kMistral30US$0.56602.1443.92
Claude 4.5 Haiku推理模型200kAnthropic30US$0.2410520.1124.88
Gemma 4 31B推理模型256kGoogle29351.1865.08
GPT-5.5 Instant (June 2026)推理模型400kOpenAI29US$0.54
Qwen3.5 122B A10B推理模型262kAlibaba28US$0.181492.45.76
GPT-5.6 Luna (Non-reasoning)非推理模型1MOpenAI27US$0.051990.653.16
Gemini 2.5 Pro推理模型1MGoogle26US$0.2014321.2524.75
Gemma 4 26B A4B推理模型256kGoogle26US$0.03
NVIDIA Nemotron 3 Super推理模型1MNVIDIA25US$0.211921.4714.51
Gemini 3.1 Flash-Lite推理模型1MGoogle25US$0.043335.837.33
Grok 4.3 (Non-reasoning)非推理模型1MSpaceXAI25US$0.291050.955.71
MiMo-V2-Flash推理模型256kXiaomi25
Qwen3.6 35B A3B推理模型262kAlibaba24US$0.601872.274.94
Qwen3.5 35B A3B推理模型262kAlibaba24US$0.231472.115.5
gpt-oss-120b (high)推理模型131kOpenAI24US$0.063120.858.86
Command A+推理模型192kCohere23US$0.001830.4214.11
Gemma 4 31B推理模型256kGoogle22US$0.03661.89.36
Nova 2.0 Pro Preview (medium)推理模型256kAmazon22US$0.1713614.3532.7
Qwen3.5 9B推理模型262kAlibaba21US$0.16581.7744.52
Mercury 2推理模型128kInception21US$0.079213.994.54
Qwen3 Coder Next推理模型256kAlibaba21US$0.331071.175.86
North Mini Code推理模型256kCohere20US$0.001190.3421.34
Nova 2.0 Pro Preview (low)推理模型256kAmazon20US$0.2113110.5829.72
Mistral Small 4推理模型256kMistral20US$0.101660.7515.84
Devstral 2推理模型256kMistral19US$0.00761.417.96
Nova 2.0 Lite (high)推理模型1MAmazon18US$0.2515817.5833.38
Magistral Medium 1.2推理模型128kMistral18US$0.75421.7960.96
HyperNova 60B 2605推理模型131kMultiverse Computing18US$0.023700.867.62
Devstral Small 2推理模型256kMistral17US$0.00781.47.79
K2 Think V2推理模型262kMBZUAI Institute of Foundation Models17
Qwen3 Next 80B A3B推理模型262kAlibaba17US$0.171772.116.25
Mistral Large 3推理模型256kMistral16US$0.06511.1110.91
gpt-oss-120b (low)推理模型131kOpenAI15US$0.023320.868.38
gpt-oss-20b (high)推理模型131kOpenAI15US$0.022220.7912.07
Nova 2.0 Pro Preview推理模型256kAmazon14US$0.251141.15.5
Llama 4 Maverick推理模型1MMeta14US$0.031130.975.39
NVIDIA Nemotron 3 Nano推理模型1MNVIDIA14US$0.021651.1916.34
Solar Pro 3推理模型128kUpstage14
Ling 2.6 Flash推理模型262kInclusionAI141781.113.92
DiffusionGemma 26B A4B推理模型256kGoogle13
Magistral Small 1.2推理模型128kMistral11US$0.25810.9131.7
Nanbeige4.1-3B推理模型256kNanbeige11
Ministral 3 14B推理模型256kMistral11US$0.15630.858.84
Llama 4 Scout推理模型10MMeta10US$0.01880.86.48
Llama 3.3 70B推理模型128kMeta9US$0.08861.627.43
Ministral 3 8B推理模型256kMistral9US$0.181140.775.15
Granite 4.1 30B推理模型131kIBM9
NVIDIA Nemotron 3 Nano 4B推理模型262kNVIDIA9
Qwen3.5 2B推理模型262kAlibaba8
Ministral 3 3B推理模型256kMistral7US$0.131640.63.64
Phi-4 Mini推理模型128kMicrosoft6US$0.00440.8312.09
Qwen3.5 2B推理模型262kAlibaba6
Qwen3.5 0.8B推理模型262kAlibaba5
Granite 4.1 3B推理模型131kIBM5
MiniCPM-V 4.6 1.3B推理模型262kOpenBMB4
Qwen3.5 0.8B推理模型262kAlibaba3
Gemini 3.5 Flash (medium)推理模型1MGoogle17416.4919.36
GPT-5.3 Codex (xhigh)推理模型400kOpenAI14267.1970.72
Claude Opus 4.7 (Non-reasoning, high)非推理模型1MAnthropic471.5612.21
DeepSeek V4 Flash (high)推理模型1MDeepSeek
MiMo-V2-Omni-0327推理模型256kXiaomi
Grok 4.3 (medium)推理模型1MSpaceXAI11311.1215.54
Grok 4.3 (low)推理模型1MSpaceXAI1096.4811.07
MiMo-V2-Omni推理模型256kXiaomi
Gemini 3.5 Flash (minimal)推理模型1MGoogle1700.873.81
Kimi K2.6推理模型256kKimi492.7312.85
Claude Sonnet 4.6 (Non-reasoning, Low Effort)非推理模型1MAnthropic441.3912.84
Hy3-preview推理模型256kTencent1593.0518.75
MiMo-V2-Flash (Feb 2026)推理模型256kXiaomi
Qwen3.5 397B A17B推理模型262kAlibaba632.4910.41
DeepSeek V4 Pro推理模型1MDeepSeek741.738.5
Qwen3.5 Omni Plus推理模型256kAlibaba542.3511.68
o3推理模型200kOpenAI1597.0710.21
DeepSeek V4 Flash推理模型1MDeepSeek1191.295.48
JT-35B-Flash推理模型256kChina Mobile
KAT-Coder-Pro V1推理模型256kKwaiKAT
MiMo-V2.5-Pro推理模型1MXiaomi572.4211.24
Hy3-preview推理模型256kTencent1373.036.67
Ling-2.6-1T推理模型262kInclusionAI
Step 3.5 Flash 2603推理模型256kStepFun28319.82
Doubao Seed Code推理模型256kByteDance Seed
K-EXAONE推理模型256kLG AI Research
Trinity Large Thinking推理模型512kArcee AI2080.9913
Claude 4.5 Haiku推理模型200kAnthropic910.926.41
EXAONE 4.5 33B推理模型262kLG AI Research
Gemma 4 12B推理模型256kGoogle1112.5124.99
ERNIE 5.0 Thinking Preview推理模型128kBaidu
Nemotron Cascade 2 30B A3B推理模型1MNVIDIA
Nova 2.0 Omni (medium)推理模型1MAmazon
Apriel-v1.6-15B-Thinker推理模型128kServiceNow
Qwen3.5 9B推理模型262kAlibaba
Gemma 4 26B A4B推理模型256kGoogle591.189.71
Qwen3.5 4B推理模型262kAlibaba230.79110.92
Nova 2.0 Lite (medium)推理模型1MAmazon17016.230.92
Qwen3.5 Omni Flash推理模型256kAlibaba2431.843.9
JT-MINI推理模型128kChina Mobile
Nova 2.0 Lite (low)推理模型1MAmazon1629.5825.04
LongCat Flash Lite推理模型256kLongCat
HyperCLOVA X SEED Think (32B)推理模型128kNaver
K-EXAONE推理模型256kLG AI Research
Nova 2.0 Omni (low)推理模型1MAmazon
Mi:dm K 2.5 Pro推理模型128kKorea Telecom
Qwen3.5 4B推理模型262kAlibaba150.9334.56
INTELLECT-3推理模型131kPrime Intellect
Solar Open 100B推理模型128kUpstage
Nemotron 3 Nano Omni 30B A3B Reasoning推理模型256kNVIDIA3230.978.72
gpt-oss-20b (low)推理模型131kOpenAI2640.8510.33
K2-V2 (high)推理模型512kMBZUAI Institute of Foundation Models
Qwen3 Next 80B A3B推理模型262kAlibaba1862.154.84
Tri-21B-think Preview推理模型32kTrillion Labs
Gemma 4 12B (Non-reasoning)非推理模型262kGoogle1052.617.37
Motif-2-12.7B推理模型128kMotif Technologies
Nova Premier推理模型1MAmazon272.9821.71
Gemma 4 E4B推理模型128kGoogle
K2-V2 (medium)推理模型512kMBZUAI Institute of Foundation Models
Llama Nemotron Super 49B v1.5推理模型128kNVIDIA1084.427.64
Mistral Small 4推理模型256kMistral1570.83.98
Tri-21B-Think推理模型32kTrillion Labs
MiniCPM5-1B推理模型128kOpenBMB
Sarvam 105B (high)推理模型128kSarvam852.2331.69
Nova 2.0 Lite推理模型1MAmazon1521.034.32
MiniCPM5-1B推理模型128kOpenBMB
EXAONE 4.0 32B推理模型131kLG AI Research
Nova 2.0 Omni推理模型1MAmazon
Hermes 4 70B推理模型128kNous Research901.3529.2
Falcon-H1R-7B推理模型256kTII UAE
Qwen3 Omni 30B A3B推理模型65.5kAlibaba1001.9126.81
Step3 VL 10B推理模型65.5kStepFun
Gemma 4 E2B推理模型128kGoogle
Llama Nemotron Ultra推理模型128kNVIDIA532.3249.5
ERNIE 4.5 300B A47B推理模型131kBaidu
Hermes 4 405B推理模型128kNous Research392.3967.24
Solar Pro 2推理模型65.5kUpstage
NVIDIA Nemotron Nano 12B v2 VL推理模型128kNVIDIA1196.1427.22
Gemma 4 E4B推理模型128kGoogle
NVIDIA Nemotron Nano 9B V2推理模型131kNVIDIA798.9140.65
Hermes 4 405B推理模型128kNous Research362.4116.21
Llama Nemotron Super 49B v1.5推理模型128kNVIDIA1394.848.44
K2-V2 (low)推理模型512kMBZUAI Institute of Foundation Models
Kimi Linear 48B A3B Instruct推理模型1MKimi
Llama 3.1 405B推理模型128kMeta
LFM2.5-8B-A1B推理模型32.8kLiquid AI3352.7510.2
Ring-flash-2.0推理模型128kInclusionAI
Olmo 3.1 32B Think推理模型65.5kAllen Institute for AI
Solar Pro 2推理模型65.5kUpstage
Command A推理模型256kCohere631.79.59
Llama 3.1 Nemotron 70B推理模型128kNVIDIA1134.689.11
NVIDIA Nemotron 3 Nano推理模型1MNVIDIA1200.925.09
NVIDIA Nemotron Nano 9B V2推理模型131kNVIDIA10937.59
Hermes 4 70B推理模型128kNous Research851.397.3
Granite 4.1 8B推理模型131kIBM1210.784.93
Sarvam 30B (high)推理模型65.5kSarvam1671.8416.81
Olmo 3.1 32B Instruct推理模型65.5kAllen Institute for AI
Gemma 4 E2B推理模型128kGoogle
R1 1776推理模型128kPerplexity
Llama 3.2 90B (Vision)推理模型128kMeta
EXAONE 4.0 32B推理模型131kLG AI Research
DeepHermes 3 - Mistral 24B推理模型32kNous Research
Jamba 1.7 Large推理模型256kAI21 Labs561.6310.49
Granite 4.0 H Small推理模型128kIBM40410.2611.49
Qwen3 Omni 30B A3B推理模型65.5kAlibaba971.857.03
LFM2 24B A2B推理模型32.8kLiquid AI
Phi-4推理模型16kMicrosoft
Nova Micro推理模型130kAmazon2960.862.55
NVIDIA Nemotron Nano 12B v2 VL推理模型128kNVIDIA2001.243.74
Phi-4 Multimodal推理模型128kMicrosoft180.7928.36
Jamba Reasoning 3B推理模型262kAI21 Labs
Reka Flash 3推理模型128kReka AI
Olmo 3 7B Think推理模型65.5kAllen Institute for AI
Molmo 7B-D推理模型4.1kAllen Institute for AI
Ling-mini-2.0推理模型131kInclusionAI
Llama 3.2 11B (Vision)推理模型128kMeta20126.23
Exaone 4.0 1.2B推理模型64kLG AI Research
Olmo 3 7B推理模型65.5kAllen Institute for AI
Exaone 4.0 1.2B推理模型64kLG AI Research
LFM2.5-1.2B-Thinking推理模型32kLiquid AI
Jamba 1.7 Mini推理模型258kAI21 Labs
LFM2 2.6B推理模型32.8kLiquid AI
LFM2.5-1.2B-Instruct推理模型32kLiquid AI
Granite 4.0 H 1B推理模型128kIBM
Gemma 3 270M推理模型32kGoogle
Apertus 70B Instruct推理模型65.5kSwiss AI Initiative
Granite 4.0 Micro推理模型128kIBM
DeepHermes 3 - Llama-3.1 8B推理模型128kNous Research
Granite 4.0 1B推理模型128kIBM
Molmo2-8B推理模型36.9kAllen Institute for AI
LFM2 8B A1B推理模型32.8kLiquid AI
LFM2.5-VL-1.6B推理模型32kLiquid AI4142.173.37
Granite 4.0 350M推理模型32.8kIBM
Tiny Aya Global推理模型8.19kCohere
Apertus 8B Instruct推理模型65.5kSwiss AI Initiative
Granite 4.0 H 350M推理模型32.8kIBM
Claude Sonnet 5 (low)推理模型1MAnthropic651.569.24
EXAONE 4.5 33B推理模型262kLG AI Research
Claude Sonnet 5 (xhigh)推理模型1MAnthropic7432.439.15
Gemini 3 Deep Think推理模型128kGoogle
Claude Sonnet 5 (high)推理模型1MAnthropic729.5216.47
Mi:dm K 2.5 Pro Preview推理模型128kKorea Telecom
GPT-5.5 Pro (xhigh)推理模型922kOpenAI
Cogito v2.1推理模型128kDeep Cogito
Claude Sonnet 5 (medium)推理模型1MAnthropic662.339.95

“—”表示当前公开快照中没有该项数据;带 * 的指数来自原始榜单的估算标记。

Coding Agents

编码 Agent 基准

把模型放进真实编码代理 Harness,比较软件工程任务的完成率、API 成本和主动执行时间。

查看原始来源 ↗
数值越高越好 · 当前 44 / 44 组快照 · 来源总榜 44
  1. 0161
  2. 0259
  3. 0359
  4. 0458
  5. 0558
  6. 0657
  7. 0757
  8. 0857
  9. 0955
  10. 1055
  11. 1154
  12. 1253
  13. 1351
  14. 1451
  15. 1550
  16. 1649
  17. 1749
  18. 1849
  19. 1948
  20. 2045
  21. 2145
  22. 2244
  23. 2343
  24. 2442
  25. 2541
  26. 2640
  27. 2739
  28. 2838
  29. 2938
  30. 3036
  31. 3135
  32. 3234
  33. 3334
  34. 3434
  35. 3533
  36. 3633
  37. 3732
  38. 3831
  39. 3929
  40. 4028
  41. 4125
  42. 4223
  43. 4322
  44. 4418

Media & Speech

图像、视频与语音

语言模型之外,分别呈现图像、视频与语音竞技场的原始评价口径,不把不同模态合并成总分。

Arena EloIMAGE

文生图榜单

1,338

GPT Image 2 (high)

来自盲测用户投票的 Text to Image Arena。

进入专题 →
Arena EloVIDEO

文生视频榜单

1,240

Gemini Omni Flash

含音频文生视频竞技场;比较视频质量、提示遵循、运动表现与声音。

进入专题 →
Quality EloSPEECH

文本转语音榜单

1,237

Qwen-Audio-3.0-TTS-Plus

通过音频盲听投票比较语音自然度与质量。

进入专题 →

Evaluation Lens

评测拆分与独立视角

综合指数只是入口。展开组成评测,才能看见知识边界、长期工作、经济价值与开放性。

9 项评测

智能指数拆分

Evaluation relevance拆解模型在知识、推理、编程、工具使用和长上下文上的差异。进入评测页 →

长期知识工作

AA-Briefcase

Elo面向多步骤、长周期知识工作的专有评测。进入评测页 →

知识边界

AA-Omniscience

Omniscience Index同时观察回答正确性与模型是否知道自己不知道。进入评测页 →

经济价值任务

GDPval-AA v2

Leaderboard覆盖真实职业任务和高经济价值知识工作。进入评测页 →

透明度与可获得性

开放性指数

Openness components从权重、许可、技术披露和复现条件观察模型开放程度。进入评测页 →

Economics & Performance

成本、速度与输出

把分数放回实际调用条件中:回答有多长、花多少钱、等多久,以及开始回答后的生成速度。

越低越好

单次 Intelligence 任务成本

低成本组

DeepSeek V4 Flash

按回答、推理、缓存写入、缓存命中与输入拆分。

查看完整数据 ↗
越低越好

单次 Intelligence 任务耗时

1.6 min

Qwen3.7 Max

按各评测权重计算的平均解码时间,不含 TTFT。

查看完整数据 ↗
越高越好

回答生成速度

1,938 Token/s

gpt-oss-120b

模型开始回答后,每秒生成的文本单位数量;数值越高,回答越快。

查看完整数据 ↗
结合任务理解

单次任务回答长度

按 Token 统计

按模型比较

Token 是模型处理文本的基本单位,大致对应一个字、词或词片段。

查看完整数据 ↗

API Provider Performance

API Provider 性能

相同模型由不同 API 服务商提供时,回答速度和价格仍可能相差数倍。以下比较 gpt-oss-120b 开始回答后的生成速度。

查看原始来源 ↗
  1. 01Cerebras1,938 Token/s
  2. 02Fireworks707 Token/s
  3. 03SambaNova700 Token/s
  4. 04Together AI579 Token/s
  5. 05Groq479 Token/s
  6. 06Google Vertex399 Token/s
  7. 07Microsoft Azure349 Token/s
  8. 08DeepInfra (Turbo)347 Token/s
  9. 09Databricks335 Token/s
  10. 10Baseten320 Token/s
  11. 11Nebius308 Token/s
  12. 12Parasail185 Token/s
  13. 13Scaleway173 Token/s
  14. 14Makora133 Token/s
  15. 15Cloudflare116 Token/s
  16. 16Amazon Bedrock116 Token/s
  17. 17Novita111 Token/s
  18. 18CoreWeave86 Token/s
  19. 19DeepInfra49 Token/s

关于数据

如何理解这些公开数据

页面原样展示 Artificial Analysis Intelligence Index v4.1 的公开结果。该指数由 GDPval-AA v2、τ³-Banking、 Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、 CritPt、AA-Omniscience 与 AA-LCR 组成。

不同模块使用不同评价对象和量纲:模型、Agent、媒体竞技场、Provider 与硬件数据不能直接横向合并。本站没有重新计算、归一化或修改来源分数。

阅读 Artificial Analysis 原始方法论