衡量编码任务完成表现,数值越高越好。
Coding Agents
编码 Agent 基准
比较真实编码代理 Harness 中的软件工程任务完成表现、API 成本和主动执行时间。三种指标分开呈现。
一次评测任务的 API 成本,越低不一定代表能力更强。
Agent 主动工作的分钟数,用于理解效率和等待成本。
ALL 44 RESULTS
完整编码 Agent 数据表
公开页面内嵌的全部 44 组结果;包含三项基准、成本、执行时间、步骤和 Token 组成。
| # | Agent / 模型 | 模型机构 | 综合指数 | DeepSWE | Terminal-Bench v2 | SWE-Atlas-QnA | 成本 / 任务 | 执行时间 | 平均步骤 | 输入 Token | 缓存 Token | 输出 Token | 总 Token | 缓存命中率 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | CodexGPT-5.6 Sol (max) | OpenAI | 61.0 | 68.7 | 87.7 | 26.6 | US$7.08 | 10.2 分钟 | 114 | 6,812,390 | 6,360,943 | 54,860 | 13,228,192 | 89.9% |
| 2 | CodexGPT-5.6 Sol (xhigh) | OpenAI | 59.3 | 67.0 | 86.1 | 24.7 | — | 7.4 分钟 | 96 | 5,120,783 | 4,781,615 | 38,288 | 9,940,686 | 90.6% |
| 3 | Claude CodeFable 5 (max) | Anthropic | 59.2 | 66.1 | 82.5 | 29.0 | US$11.72 | 23.4 分钟 | 138 | 6,969,942 | 6,809,851 | 119,619 | 14,050,779 | 96.3% |
| 4 | CodexGPT-5.6 Sol (high) | OpenAI | 58.1 | 64.9 | 82.5 | 26.9 | — | 6.3 分钟 | 86 | 4,163,502 | 3,893,166 | 28,199 | 8,084,867 | 90.2% |
| 5 | Grok BuildGrok 4.5 (high) | xAI | 57.9 | 59.9 | 85.3 | 28.5 | US$2.59 | 16.5 分钟 | 61 | 1,820,320 | 1,717,419 | 39,966 | 3,577,706 | 92.5% |
| 6 | CodexGPT-5.6 Terra (max) | OpenAI | 57.4 | 67.0 | 84.1 | 21.2 | US$2.76 | 8.4 分钟 | 97 | 4,843,755 | 4,561,390 | 60,732 | 9,465,877 | 91.4% |
| 7 | Kimi Code CLIKimi K3 | Moonshot AI | 56.8 | 63.7 | 83.7 | 22.8 | US$3.18 | 23.8 分钟 | 125 | 5,400,248 | 5,130,236 | 88,806 | 10,619,290 | 95.0% |
| 8 | CodexGPT-5.5 (xhigh) | OpenAI | 56.6 | 64.3 | 84.1 | 21.5 | US$5.07 | 10.1 分钟 | 106 | 6,203,311 | 6,018,972 | 37,947 | 12,260,230 | 93.9% |
| 9 | Claude CodeOpus 4.8 (max) | Anthropic | 54.9 | 55.8 | 79.4 | 29.6 | US$7.70 | 23.1 分钟 | 166 | 8,917,632 | 8,730,314 | 146,162 | 17,971,409 | 96.5% |
| 10 | CodexGPT-5.6 Sol (medium) | OpenAI | 54.8 | 64.0 | 77.8 | 22.6 | — | 5.2 分钟 | 72 | 3,001,126 | 2,797,277 | 19,115 | 5,817,519 | 89.5% |
| 11 | CodexGPT-5.6 Luna (max) | OpenAI | 53.8 | 63.4 | 79.8 | 18.3 | US$1.57 | 8.0 分钟 | 115 | 7,913,897 | 7,485,097 | 64,941 | 15,463,936 | 91.4% |
| 12 | CodexGPT-5.6 Terra (xhigh) | OpenAI | 52.7 | 58.4 | 80.6 | 19.1 | US$1.90 | 6.9 分钟 | 75 | 3,313,555 | 3,107,178 | 40,160 | 6,460,892 | 90.7% |
| 13 | CodexGPT-5.6 Terra (high) | OpenAI | 51.3 | 60.5 | 76.0 | 17.5 | US$1.59 | 6.2 分钟 | 67 | 2,843,915 | 2,664,435 | 31,662 | 5,540,012 | 90.3% |
| 14 | CodexGPT-5.6 Luna (xhigh) | OpenAI | 50.5 | 56.6 | 76.2 | 18.8 | US$1.26 | 6.6 分钟 | 96 | 6,321,539 | 5,942,041 | 47,114 | 12,310,694 | 90.4% |
| 15 | CodexGPT-5.5 (medium) | OpenAI | 50.4 | 56.6 | 75.8 | 18.8 | US$2.75 | 6.4 分钟 | 78 | 3,525,549 | 3,419,805 | 17,196 | 6,962,550 | 94.8% |
| 16 | Claude CodeOpus 4.8 (medium) | Anthropic | 48.9 | 49.3 | 75.4 | 22.0 | US$3.26 | 12.4 分钟 | 93 | 3,870,142 | 3,787,948 | 50,716 | 7,786,083 | 96.5% |
| 17 | CodexGPT-5.6 Sol (low) | OpenAI | 48.8 | 53.4 | 73.0 | 19.9 | — | 3.7 分钟 | 54 | 1,641,547 | 1,513,072 | 10,620 | 3,165,239 | 88.4% |
| 18 | OpencodeMuse Spark 1.1 (xhigh) | Meta | 48.7 | 54.3 | 73.0 | 18.8 | US$1.43 | 12.6 分钟 | 55 | 6,261,271 | 5,948,208 | 34,042 | 12,243,521 | 95.0% |
| 19 | CodexGPT-5.6 Luna (high) | OpenAI | 47.6 | 53.4 | 71.8 | 17.5 | US$0.96 | 5.7 分钟 | 84 | 4,888,008 | 4,581,094 | 32,273 | 9,501,375 | 89.9% |
| 20 | OpencodeOpus 4.7 (medium) | Anthropic | 45.5 | 39.5 | 75.4 | 21.5 | US$2.93 | 12.2 分钟 | 54 | 3,734,060 | 3,734,001 | 25,751 | 7,561,040 | 96.1% |
| 21 | Claude CodeOpus 4.7 (max) | Anthropic | 45.2 | 40.1 | 73.8 | 21.8 | US$5.63 | 15.7 分钟 | 107 | 7,948,863 | 7,818,313 | 59,183 | 15,954,485 | 96.9% |
| 22 | CodexGPT-5.6 Terra (medium) | OpenAI | 43.9 | 45.7 | 69.4 | 16.7 | US$0.90 | 4.3 分钟 | 51 | 1,614,396 | 1,499,910 | 16,002 | 3,130,308 | 89.3% |
| 23 | Cursor CLIGPT-5.5 (medium) | OpenAI | 42.8 | 37.2 | 73.4 | 17.7 | US$2.01 | 6.6 分钟 | 78 | 2,061,667 | 1,916,592 | 11,044 | 3,989,303 | 89.0% |
| 24 | Claude CodeOpus 4.6 (medium) | Anthropic | 42.4 | — | 70.6 | 14.2 | US$1.28 | 8.0 分钟 | 34 | 2,234,510 | 2,110,648 | 19,368 | 4,476,738 | 93.6% |
| 25 | Cursor CLIOpus 4.7 (medium) | Anthropic | 41.2 | 31.6 | 70.6 | 21.5 | US$2.68 | 13.6 分钟 | 86 | 2,819,480 | 2,745,220 | 17,782 | 5,656,580 | 95.9% |
| 26 | Claude CodeGLM-5.2 | Z.ai | 39.8 | 28.6 | 71.9 | 18.8 | US$6.51 | 25.1 分钟 | 127 | 5,424,051 | 1,052,877 | 40,310 | 6,517,238 | 34.1% |
| 27 | CodexGPT-5.6 Sol (none) | OpenAI | 39.5 | 35.4 | 60.7 | 22.3 | US$1.40 | 3.4 分钟 | 55 | 1,737,377 | 1,670,776 | 7,663 | 3,415,816 | 89.0% |
| 28 | CodexGPT-5.6 Luna (medium) | OpenAI | 38.4 | 36.6 | 63.5 | 15.1 | US$0.47 | 3.4 分钟 | 58 | 2,273,504 | 2,100,885 | 15,198 | 4,389,586 | 87.9% |
| 29 | Claude CodeOpus 4.7 (medium) | Anthropic | 37.5 | 27.4 | 71.4 | 13.7 | US$1.68 | 6.3 分钟 | 42 | 2,279,493 | 2,224,627 | 20,086 | 4,577,653 | 95.8% |
| 30 | CodexGPT-5.4 (medium) | OpenAI | 35.7 | 25.0 | 69.8 | 12.4 | US$2.42 | 7.1 分钟 | 73 | 3,011,113 | 2,895,710 | 18,149 | 5,924,972 | 92.9% |
| 31 | Claude CodeSonnet 4.6 (medium) | Anthropic | 35.5 | 28.9 | 64.3 | 13.2 | US$2.01 | 13.5 分钟 | 67 | 4,224,651 | 4,102,518 | 54,020 | 8,496,831 | 94.9% |
| 32 | Cursor CLIComposer 2.5 | Cursor | 33.9 | 15.9 | 67.5 | 18.3 | US$0.08 | 9.5 分钟 | 117 | 1,815,576 | 1,747,519 | 17,531 | 3,577,610 | 93.9% |
| 33 | Cursor CLIComposer 2.5 Fast | Cursor | 33.9 | 15.9 | 67.5 | 18.3 | US$0.55 | 6.8 分钟 | 117 | 2,148,692 | 2,074,061 | 19,638 | 4,238,247 | 93.6% |
| 34 | CodexGPT-5.6 Terra (low) | OpenAI | 33.9 | 29.8 | 57.5 | 14.2 | US$0.48 | 2.8 分钟 | 37 | 797,366 | 724,394 | 8,053 | 1,529,813 | 87.7% |
| 35 | Claude CodeGLM-5.1 | Z.ai | 32.9 | 18.6 | 65.1 | 15.1 | US$4.33 | 19.6 分钟 | 174 | 13,212,122 | 12,620,806 | 50,447 | 25,883,374 | 87.8% |
| 36 | Cursor CLIGPT-5.4 (medium) | OpenAI | 32.6 | 16.7 | 65.5 | 15.6 | US$1.55 | 8.1 分钟 | 26 | 2,130,574 | 1,873,661 | 15,466 | 4,019,702 | 85.5% |
| 37 | Claude CodeQwen3.7 Plus (thinking) | Alibaba Cloud | 32.5 | 19.2 | 65.1 | 13.2 | US$6.23 | 10.6 分钟 | 146 | 4,668,456 | 3,995,341 | 32,127 | 8,695,924 | 81.0% |
| 38 | Claude CodeKimi K2.6 | Moonshot AI | 30.8 | 16.5 | 65.5 | 10.5 | US$1.19 | 41.0 分钟 | 131 | 5,786,199 | 5,631,883 | 36,275 | 11,454,356 | 95.8% |
| 39 | Gemini CLIGemini 3.1 Pro (high) | 29.2 | 14.2 | 68.3 | 5.1 | US$2.00 | 10.8 分钟 | 31 | 2,448,999 | 2,236,947 | 18,426 | 4,704,372 | 87.0% | |
| 40 | Claude CodeDeepSeek V4 Pro (high) | DeepSeek | 28.5 | 8.6 | 65.9 | 11.0 | US$0.27 | 17.9 分钟 | 127 | 5,143,082 | 4,638,910 | 41,153 | 9,823,145 | 83.3% |
| 41 | Cursor CLIComposer 2 | Cursor | 25.2 | 0.0 | 64.7 | 11.0 | US$0.04 | 8.6 分钟 | 28 | 1,476,106 | 1,419,615 | 14,007 | 2,954,431 | 92.6% |
| 42 | CodexGPT-5.6 Luna (low) | OpenAI | 23.4 | 10.3 | 49.6 | 10.2 | US$0.21 | 1.9 分钟 | 35 | 798,108 | 699,715 | 6,699 | 1,504,521 | 84.2% |
| 43 | CodexGPT-5.6 Terra (none) | OpenAI | 21.9 | 13.3 | 39.3 | 13.2 | US$0.37 | 1.8 分钟 | 34 | 587,769 | 523,111 | 5,171 | 1,116,050 | 85.3% |
| 44 | CodexGPT-5.6 Luna (none) | OpenAI | 17.9 | 6.5 | 37.3 | 9.9 | US$0.35 | 2.5 分钟 | 56 | 1,845,654 | 1,712,567 | 7,936 | 3,566,157 | 87.6% |
“—”表示来源没有公开可核验数据。Token 为每项任务的平均用量;缓存写入 Token 已保留在数据快照中,但为避免横向表过宽未单列。
INDEX v1.2
综合指数由 3 项公开基准组成
每项基准运行 3 次,使用平均 pass@1;综合指数是三项分数的简单平均。
真实软件工程实现与修复任务,数据来自 Datacurve。
在终端环境中完成多步骤工具调用与软件工程工作流。
代码库理解、技术问答与可部分得分的 rubric 评估。
HARNESS COMPARISON
固定 Claude Opus 4.7,只比较 Agent Harness
同一底层模型放进不同编码工具,综合指数仍会明显变化。
这说明模型名不是完整的比较单位:Harness 的提示、工具、上下文管理和执行策略都会改变结果。
TOKEN USAGE
Token 用量要拆成三类
来源同时观察总量、组成、缓存命中率,以及 Token 用量与综合指数的关系。
未命中缓存的提示、指令、工具上下文和任务上下文。
由 Provider 的提示缓存复用、并按缓存价格计费的输入。
模型在任务过程中返回的可见回答和工具调用内容。
缓存命中率受 Provider 路由和后端副本影响。来源没有强制粘性路由,因此成本反映普通配置下观察到的缓存行为,而不是理想化最低成本。
成本如何计算
榜单显示三项基准的平均按量 API 成本,分别使用标准输入价、缓存输入折扣、缓存写入费用和输出价。它不等于订阅计划价格,也不包含部署基础设施、工程和人工监督成本。
因此,成本必须和综合指数一起看:更便宜不等于更强,更高分也不一定值得额外支出。
执行时间如何计算
执行时间指 Agent 进程在每项任务中的平均活跃墙钟时间,包括推理、工具调用、读写文件和等待模型响应。
它不包含环境启动、验证器、裁判和其他 Harness 开销,因此不是端到端产品加载时间。
FAQ
怎样解释编码 Agent 排名
高指数是否代表所有场景都更好?
不是。指数平衡代码库问答、补丁实现和终端工作流;具体选择还要看你的任务类型、IDE 集成、成本、时延和稳定性。
为什么同一个 Agent 会出现多个条目?
模型版本、推理档位和执行设置都会改变表现。榜单比较的是具体 Agent 变体,而不是抽象产品名。
pass@1 是什么?
每个任务首次尝试的 evaluator 得分。不同基准可能是二元通过,也可能允许 rubric 部分得分。
为什么原站图表默认只显示部分结果?
原站图表为了可读性默认选择部分条目,但公开页面数据载荷包含 44 组。本站已把 44 组全部展开到上方数据表,并保留筛选器。