GB300-NVL72
61,35420 Token/s · 个 Agent / 兆瓦
23,126 · 60 Token/s
查看硬件基准 ↗AA-AgentPerf
从真实长上下文 Agent 轨迹观察系统在给定功耗下可支撑多少并发 Agent,而不是只看孤立芯片峰值。
20 Token/s · 个 Agent / 兆瓦
23,126 · 60 Token/s
查看硬件基准 ↗20 Token/s · 个 Agent / 兆瓦
6,950 · 60 Token/s
查看硬件基准 ↗20 Token/s · 个 Agent / 兆瓦
319 · 60 Token/s
查看硬件基准 ↗20 Token/s · 个 Agent / 兆瓦
1,786 · 60 Token/s
查看硬件基准 ↗SYSTEM LOAD TEST
gpt-oss-120b(high);吞吐和成本均按单查询 100 Token/s 的参考速度比较。
| 硬件与运行时 | 系统输出吞吐 | 单查询峰值速度 | 每百万输入+输出 Token 成本 |
|---|---|---|---|
| 8×B200 · TensorRT-LLM(记录 1) | 40,100 Token/s | 403 Token/s | US$0.19 |
| 8×B200 · TensorRT-LLM(记录 2) | 40,100 Token/s | 403 Token/s | US$0.19 |
| 8×B200 · TensorRT-LLM(记录 3) | 22,200 Token/s | 243 Token/s | US$0.35 |
| 8×H200 · vLLM | 6,360 Token/s | 226 Token/s | US$2.18 |
| 8×H100 · vLLM | 5,830 Token/s | 187 Token/s | US$0.83 |
| 8×MI300X · vLLM | 842 Token/s | 146 Token/s | US$3.93 |
它把上下文长度、服务目标、并发和功耗放在同一系统条件中,更接近部署容量问题。结果不能脱离模型、服务目标和硬件配置单独比较。