Coding Agents

编码 Agent 基准

比较真实编码代理 Harness 中的软件工程任务完成表现、API 成本和主动执行时间。三种指标分开呈现。

数据快照:2026-07-21查看原始来源 ↗
综合指数

衡量编码任务完成表现,数值越高越好。

成本 / 任务

一次评测任务的 API 成本,越低不一定代表能力更强。

执行时间

Agent 主动工作的分钟数,用于理解效率和等待成本。

数值越高越好 · 当前 44 / 44 组快照 · 来源总榜 44
  1. 0161
  2. 0259
  3. 0359
  4. 0458
  5. 0558
  6. 0657
  7. 0757
  8. 0857
  9. 0955
  10. 1055
  11. 1154
  12. 1253
  13. 1351
  14. 1451
  15. 1550
  16. 1649
  17. 1749
  18. 1849
  19. 1948
  20. 2045
  21. 2145
  22. 2244
  23. 2343
  24. 2442
  25. 2541
  26. 2640
  27. 2739
  28. 2838
  29. 2938
  30. 3036
  31. 3135
  32. 3234
  33. 3334
  34. 3434
  35. 3533
  36. 3633
  37. 3732
  38. 3831
  39. 3929
  40. 4028
  41. 4125
  42. 4223
  43. 4322
  44. 4418

ALL 44 RESULTS

完整编码 Agent 数据表

公开页面内嵌的全部 44 组结果;包含三项基准、成本、执行时间、步骤和 Token 组成。

Artificial Analysis Coding Agent Index v1.2 完整公开记录
#Agent / 模型模型机构综合指数DeepSWETerminal-Bench v2SWE-Atlas-QnA成本 / 任务执行时间平均步骤输入 Token缓存 Token输出 Token总 Token缓存命中率
1CodexGPT-5.6 Sol (max)OpenAI61.068.787.726.6US$7.0810.2 分钟1146,812,3906,360,94354,86013,228,19289.9%
2CodexGPT-5.6 Sol (xhigh)OpenAI59.367.086.124.77.4 分钟965,120,7834,781,61538,2889,940,68690.6%
3Claude CodeFable 5 (max)Anthropic59.266.182.529.0US$11.7223.4 分钟1386,969,9426,809,851119,61914,050,77996.3%
4CodexGPT-5.6 Sol (high)OpenAI58.164.982.526.96.3 分钟864,163,5023,893,16628,1998,084,86790.2%
5Grok BuildGrok 4.5 (high)xAI57.959.985.328.5US$2.5916.5 分钟611,820,3201,717,41939,9663,577,70692.5%
6CodexGPT-5.6 Terra (max)OpenAI57.467.084.121.2US$2.768.4 分钟974,843,7554,561,39060,7329,465,87791.4%
7Kimi Code CLIKimi K3Moonshot AI56.863.783.722.8US$3.1823.8 分钟1255,400,2485,130,23688,80610,619,29095.0%
8CodexGPT-5.5 (xhigh)OpenAI56.664.384.121.5US$5.0710.1 分钟1066,203,3116,018,97237,94712,260,23093.9%
9Claude CodeOpus 4.8 (max)Anthropic54.955.879.429.6US$7.7023.1 分钟1668,917,6328,730,314146,16217,971,40996.5%
10CodexGPT-5.6 Sol (medium)OpenAI54.864.077.822.65.2 分钟723,001,1262,797,27719,1155,817,51989.5%
11CodexGPT-5.6 Luna (max)OpenAI53.863.479.818.3US$1.578.0 分钟1157,913,8977,485,09764,94115,463,93691.4%
12CodexGPT-5.6 Terra (xhigh)OpenAI52.758.480.619.1US$1.906.9 分钟753,313,5553,107,17840,1606,460,89290.7%
13CodexGPT-5.6 Terra (high)OpenAI51.360.576.017.5US$1.596.2 分钟672,843,9152,664,43531,6625,540,01290.3%
14CodexGPT-5.6 Luna (xhigh)OpenAI50.556.676.218.8US$1.266.6 分钟966,321,5395,942,04147,11412,310,69490.4%
15CodexGPT-5.5 (medium)OpenAI50.456.675.818.8US$2.756.4 分钟783,525,5493,419,80517,1966,962,55094.8%
16Claude CodeOpus 4.8 (medium)Anthropic48.949.375.422.0US$3.2612.4 分钟933,870,1423,787,94850,7167,786,08396.5%
17CodexGPT-5.6 Sol (low)OpenAI48.853.473.019.93.7 分钟541,641,5471,513,07210,6203,165,23988.4%
18OpencodeMuse Spark 1.1 (xhigh)Meta48.754.373.018.8US$1.4312.6 分钟556,261,2715,948,20834,04212,243,52195.0%
19CodexGPT-5.6 Luna (high)OpenAI47.653.471.817.5US$0.965.7 分钟844,888,0084,581,09432,2739,501,37589.9%
20OpencodeOpus 4.7 (medium)Anthropic45.539.575.421.5US$2.9312.2 分钟543,734,0603,734,00125,7517,561,04096.1%
21Claude CodeOpus 4.7 (max)Anthropic45.240.173.821.8US$5.6315.7 分钟1077,948,8637,818,31359,18315,954,48596.9%
22CodexGPT-5.6 Terra (medium)OpenAI43.945.769.416.7US$0.904.3 分钟511,614,3961,499,91016,0023,130,30889.3%
23Cursor CLIGPT-5.5 (medium)OpenAI42.837.273.417.7US$2.016.6 分钟782,061,6671,916,59211,0443,989,30389.0%
24Claude CodeOpus 4.6 (medium)Anthropic42.470.614.2US$1.288.0 分钟342,234,5102,110,64819,3684,476,73893.6%
25Cursor CLIOpus 4.7 (medium)Anthropic41.231.670.621.5US$2.6813.6 分钟862,819,4802,745,22017,7825,656,58095.9%
26Claude CodeGLM-5.2Z.ai39.828.671.918.8US$6.5125.1 分钟1275,424,0511,052,87740,3106,517,23834.1%
27CodexGPT-5.6 Sol (none)OpenAI39.535.460.722.3US$1.403.4 分钟551,737,3771,670,7767,6633,415,81689.0%
28CodexGPT-5.6 Luna (medium)OpenAI38.436.663.515.1US$0.473.4 分钟582,273,5042,100,88515,1984,389,58687.9%
29Claude CodeOpus 4.7 (medium)Anthropic37.527.471.413.7US$1.686.3 分钟422,279,4932,224,62720,0864,577,65395.8%
30CodexGPT-5.4 (medium)OpenAI35.725.069.812.4US$2.427.1 分钟733,011,1132,895,71018,1495,924,97292.9%
31Claude CodeSonnet 4.6 (medium)Anthropic35.528.964.313.2US$2.0113.5 分钟674,224,6514,102,51854,0208,496,83194.9%
32Cursor CLIComposer 2.5Cursor33.915.967.518.3US$0.089.5 分钟1171,815,5761,747,51917,5313,577,61093.9%
33Cursor CLIComposer 2.5 FastCursor33.915.967.518.3US$0.556.8 分钟1172,148,6922,074,06119,6384,238,24793.6%
34CodexGPT-5.6 Terra (low)OpenAI33.929.857.514.2US$0.482.8 分钟37797,366724,3948,0531,529,81387.7%
35Claude CodeGLM-5.1Z.ai32.918.665.115.1US$4.3319.6 分钟17413,212,12212,620,80650,44725,883,37487.8%
36Cursor CLIGPT-5.4 (medium)OpenAI32.616.765.515.6US$1.558.1 分钟262,130,5741,873,66115,4664,019,70285.5%
37Claude CodeQwen3.7 Plus (thinking)Alibaba Cloud32.519.265.113.2US$6.2310.6 分钟1464,668,4563,995,34132,1278,695,92481.0%
38Claude CodeKimi K2.6Moonshot AI30.816.565.510.5US$1.1941.0 分钟1315,786,1995,631,88336,27511,454,35695.8%
39Gemini CLIGemini 3.1 Pro (high)Google29.214.268.35.1US$2.0010.8 分钟312,448,9992,236,94718,4264,704,37287.0%
40Claude CodeDeepSeek V4 Pro (high)DeepSeek28.58.665.911.0US$0.2717.9 分钟1275,143,0824,638,91041,1539,823,14583.3%
41Cursor CLIComposer 2Cursor25.20.064.711.0US$0.048.6 分钟281,476,1061,419,61514,0072,954,43192.6%
42CodexGPT-5.6 Luna (low)OpenAI23.410.349.610.2US$0.211.9 分钟35798,108699,7156,6991,504,52184.2%
43CodexGPT-5.6 Terra (none)OpenAI21.913.339.313.2US$0.371.8 分钟34587,769523,1115,1711,116,05085.3%
44CodexGPT-5.6 Luna (none)OpenAI17.96.537.39.9US$0.352.5 分钟561,845,6541,712,5677,9363,566,15787.6%

“—”表示来源没有公开可核验数据。Token 为每项任务的平均用量;缓存写入 Token 已保留在数据快照中,但为避免横向表过宽未单列。

INDEX v1.2

综合指数由 3 项公开基准组成

每项基准运行 3 次,使用平均 pass@1;综合指数是三项分数的简单平均。

DeepSWE113 项任务

真实软件工程实现与修复任务,数据来自 Datacurve。

Terminal-Bench v284 项任务

在终端环境中完成多步骤工具调用与软件工程工作流。

SWE-Atlas-QnA124 项任务

代码库理解、技术问答与可部分得分的 rubric 评估。

HARNESS COMPARISON

固定 Claude Opus 4.7,只比较 Agent Harness

同一底层模型放进不同编码工具,综合指数仍会明显变化。

  1. OpenCode · Opus 4.7(medium)
    45
  2. Cursor CLI · Opus 4.7(medium)
    41
  3. Claude Code · Opus 4.7(medium)
    38

这说明模型名不是完整的比较单位:Harness 的提示、工具、上下文管理和执行策略都会改变结果。

TOKEN USAGE

Token 用量要拆成三类

来源同时观察总量、组成、缓存命中率,以及 Token 用量与综合指数的关系。

输入 Token

未命中缓存的提示、指令、工具上下文和任务上下文。

缓存输入 Token

由 Provider 的提示缓存复用、并按缓存价格计费的输入。

输出 Token

模型在任务过程中返回的可见回答和工具调用内容。

缓存命中率受 Provider 路由和后端副本影响。来源没有强制粘性路由,因此成本反映普通配置下观察到的缓存行为,而不是理想化最低成本。

成本如何计算

榜单显示三项基准的平均按量 API 成本,分别使用标准输入价、缓存输入折扣、缓存写入费用和输出价。它不等于订阅计划价格,也不包含部署基础设施、工程和人工监督成本。

因此,成本必须和综合指数一起看:更便宜不等于更强,更高分也不一定值得额外支出。

执行时间如何计算

执行时间指 Agent 进程在每项任务中的平均活跃墙钟时间,包括推理、工具调用、读写文件和等待模型响应。

它不包含环境启动、验证器、裁判和其他 Harness 开销,因此不是端到端产品加载时间。

FAQ

怎样解释编码 Agent 排名

高指数是否代表所有场景都更好?

不是。指数平衡代码库问答、补丁实现和终端工作流;具体选择还要看你的任务类型、IDE 集成、成本、时延和稳定性。

为什么同一个 Agent 会出现多个条目?

模型版本、推理档位和执行设置都会改变表现。榜单比较的是具体 Agent 变体,而不是抽象产品名。

pass@1 是什么?

每个任务首次尝试的 evaluator 得分。不同基准可能是二元通过,也可能允许 rubric 部分得分。

为什么原站图表默认只显示部分结果?

原站图表为了可读性默认选择部分条目,但公开页面数据载荷包含 44 组。本站已把 44 组全部展开到上方数据表,并保留筛选器。