文生图榜单
1,338GPT Image 2 (high)
来自盲测用户投票的 Text to Image Arena。
进入专题 →AI 模型公开数据观察
聚合模型能力、编码 Agent、媒体生成、成本、速度、Provider 与硬件等公开评测视角,不修改原始分数。
最新变化
保留来源的发布日期与事实描述,点击后进入原始文章或模型页面。
智能指数 · 按国家
Artificial Analysis Intelligence Index · 数值越高越好
当前显示 28 / 28个模型
| 模型 | 机构 | 国家 | 指数 |
|---|---|---|---|
| Claude Fable 5 | Anthropic | 🇺🇸 美国 | 60 |
| GPT-5.6 Sol(max) | OpenAI | 🇺🇸 美国 | 59 |
| Kimi K3 | Kimi | 🇨🇳 中国 | 57 |
| Claude Opus 4.8(max) | Anthropic | 🇺🇸 美国 | 56 |
| GPT-5.6 Terra(max) | OpenAI | 🇺🇸 美国 | 55 |
| GPT-5.5(xhigh) | OpenAI | 🇺🇸 美国 | 55 |
| Grok 4.5(high) | xAI | 🇺🇸 美国 | 54 |
| Claude Sonnet 5(max) | Anthropic | 🇺🇸 美国 | 53 |
| GPT-5.6 Luna(max) | OpenAI | 🇺🇸 美国 | 51 |
| GLM-5.2(max) | 智谱 AI | 🇨🇳 中国 | 51 |
| Muse Spark 1.1(xhigh) | Meta | 🇺🇸 美国 | 51 |
| Gemini 3.5 Flash | 🇺🇸 美国 | 50 | |
| Gemini 3.1 Pro Preview | 🇺🇸 美国 | 46 | |
| Qwen3.7 Max | 阿里巴巴 | 🇨🇳 中国 | 46 |
| MiniMax-M3 | MiniMax | 🇨🇳 中国 | 44 |
| DeepSeek V4 Pro(max) | DeepSeek | 🇨🇳 中国 | 44 |
| Kimi K2.6 | Kimi | 🇨🇳 中国 | 44 |
| MiMo-V2.5-Pro | 小米 | 🇨🇳 中国 | 44 |
| Inkling | Thinking Machines | 🇺🇸 美国 | 42 |
| DeepSeek V4 Flash(max) | DeepSeek | 🇨🇳 中国 | 41 |
| Nemotron 3 Ultra | NVIDIA | 🇺🇸 美国 | 40 |
| Mistral Medium 3.5 | Mistral AI | 🇫🇷 法国 | 38 |
| Claude 4.5 Haiku | Anthropic | 🇺🇸 美国 | 30 |
| Gemma 4 31B | 🇺🇸 美国 | 30 | |
| gpt-oss-120b(high) | OpenAI | 🇺🇸 美国 | 29 |
| Command A+ | Cohere | 🇨🇦 加拿大 | 24 |
| K2 Think V2 | MBZUAI | 🇦🇪 阿联酋 | 23 |
| Motif 3(Beta) | Motif | 🇺🇸 美国 | 17 |
Model Comparison
完整展示 255 个模型,把智能、上下文、成本、生成速度和响应时间放在同一张表里,并支持搜索、筛选和排序。
查看原始来源 ↗“—”表示当前公开快照中没有该项数据;带 * 的指数来自原始榜单的估算标记。
Coding Agents
把模型放进真实编码代理 Harness,比较软件工程任务的完成率、API 成本和主动执行时间。
查看原始来源 ↗Capability Indices
同一个模型在不同职业与任务类型下可能表现完全不同。这里保留八个独立能力视角。
查看原始来源 ↗工具使用、规划、多步骤执行与客户交互工作流。
GDPval-AA v2 · τ³-Banking02真实终端操作、编程、科学计算与研究型代码。
Terminal-Bench v2.1 · SciCode03金融知识、量化推理、长文档分析与工具化工作流。
AA-Omniscience · GDPval-AA v2 · HLE · τ³-Banking · AA-LCR04商业知识、运营流程、客户交互、指令遵循与长上下文。
AA-Omniscience · GDPval-AA v2 · τ³-Banking · IFBench · AA-LCR05法律知识、文件分析、长上下文推理与非幻觉能力。
AA-Omniscience · GDPval-AA v2 · HLE · τ³-Banking · AA-LCR06医学知识、临床推理、医疗记录、药物管理与患者交互。
AA-Omniscience · GDPval-AA v2 · HLE · τ³-Banking07工程知识、定量推理、工具化交付与真实终端操作。
AA-Omniscience · HLE · GPQA Diamond · Crit-Pt · GDPval-AA v2 · Terminal-Bench v2.108经济知识、定量分析、Agent 工作流与长报告阅读。
AA-Omniscience · HLE · GDPval-AA v2 · AA-LCREvaluation Lens
综合指数只是入口。展开组成评测,才能看见知识边界、长期工作、经济价值与开放性。
Economics & Performance
把分数放回实际调用条件中:回答有多长、花多少钱、等多久,以及开始回答后的生成速度。
API Provider Performance
相同模型由不同 API 服务商提供时,回答速度和价格仍可能相差数倍。以下比较 gpt-oss-120b 开始回答后的生成速度。
查看原始来源 ↗AA-AgentPerf
从真实长上下文 Agent 轨迹观察系统能支撑多少并发 Agent,而不是只看孤立的合成吞吐测试。
查看原始来源 ↗关于数据
页面原样展示 Artificial Analysis Intelligence Index v4.1 的公开结果。该指数由 GDPval-AA v2、τ³-Banking、 Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、 CritPt、AA-Omniscience 与 AA-LCR 组成。
不同模块使用不同评价对象和量纲:模型、Agent、媒体竞技场、Provider 与硬件数据不能直接横向合并。本站没有重新计算、归一化或修改来源分数。