Methodology

数据与方法说明

模型坐标是公开评测的中文聚合层,不运行评测、不修改原始分数,也不创造新的综合评分。

数据快照:2026-07-21查看原始来源 ↗

我们做什么

收集公开榜单,规范字段名称,提供中文解释、站内检索、横向比较和稳定页面地址。

我们不做什么

不自行运行 benchmark,不调整来源权重,不把能力、价格、速度或开放性合并成本站总分。

数据快照

当前快照日期为 2026-07-21。速度、延迟、价格等运行指标会变化,页面必须连同快照日期和原始来源一起阅读。

缺失值

“—”表示当前公开快照没有可核验结果。缺失不代表性能为零,也不会被本站估算补齐。

名称处理

保留会影响结果的模型版本和推理档位;删除对普通读者没有帮助的冗余描述,但详情页始终提供原始来源供核验。

INTELLIGENCE INDEX v4.1

9 项评测与权重

文本、英文评测;图像、语音和多语言能力在独立榜单中评估。四大类权重为 Agent 34%、编码 24%、科学推理 24%、通用 18%。

Artificial Analysis Intelligence Index v4.1 完整组成
类别评测题目重复回答类型评分权重工具
Agent(34%)GDPval-AA v2220 项任务1Agent 交付文件多裁判成对 Elo;人类专家锚定 100020%
Agent(34%)τ³-Banking975双控制 Agent / 用户模拟后端数据库状态,pass@114%
编码(24%)Terminal-Bench v2.1893终端任务执行测试套件通过,pass@116%
编码(24%)SciCode288 个子问题3Python 代码代码执行,子问题计分8%
通用(18%)AA-LCR1003开放回答LLM 等价性检查,pass@16%
通用(18%)AA-Omniscience6,0001开放回答准确率 8% + 非幻觉率 4%12%
科学推理(24%)Humanity's Last Exam2,1581开放回答LLM 等价性检查,pass@112%
科学推理(24%)GPQA Diamond1985四选一正则提取,pass@16%
科学推理(24%)CritPt705函数、符号和数值答案官方评分服务,pass@16%

EVALUATION PRINCIPLES

四项评测原则

标准化

相同条件、提示策略、温度和评分标准。

尽量无偏

使用明确提示、稳健提取和允许有效表达差异的答案验证。

Zero-shot

不给示例或演示,直接测试模型理解和执行指令的能力。

透明

公开提示模板、评估标准、参数和已知限制。

TESTING PARAMETERS

通用测试参数

生成设置

  • 非推理模型温度 0;推理模型温度 0.6,模型实验室另有推荐时例外。
  • 非推理模型最多输出 16,384 Token;推理模型使用创建者披露的最大输出上限。
  • 代码环境为 Ubuntu 22.04 LTS 与 Python 3.12。

错误与计分

  • API 失败最多自动重试 30 次;持续失败的问题人工复核。
  • 多数评测使用 pass@1;有重复实验时,对全部重复结果求平均。
  • Intelligence Index 成本使用 Provider 报告 Token 数;性能基准另用统一 tokenizer。

ADDITIONAL EVALUATIONS

单独报告、不计入综合指数的评测

覆盖多语言、视觉、数学、专业服务、企业工具和其他能力。

Additional Evaluations
类别评测规模主要形式
AgentAA-Briefcase4 个场景带文件交付的长期 Agent 任务
AgentHarvey LAB-AA120 项任务法律交付物与 rubric 评估
AgentAPEX-Agents-AA452 项任务专业服务任务与本地文件评分
AgentAutomationBench-AA657 项任务SaaS REST API 工作流自动化
AgentITBench-AA59 个场景离线 Kubernetes 事故根因诊断
AgentEnterpriseOps-Gym-AA1,117 项任务8 个领域的多轮 MCP 工具使用
编码LiveCodeBench315Python 代码执行,pass@1
通用IFBench294指令遵循与规则驱动评估
通用MMLU-Pro12,032十选一知识评估
其他Global-MMLU-Lite约 6,00016 种语言的四选一评估
其他MMMU Pro1,730图文多模态十选一评估