AA-AgentPerf

AI 推理硬件

从真实长上下文 Agent 轨迹观察系统在给定功耗下可支撑多少并发 Agent,而不是只看孤立芯片峰值。

数据快照:2026-07-21查看原始来源 ↗

SYSTEM LOAD TEST

AA-SLT 六条系统记录

gpt-oss-120b(high);吞吐和成本均按单查询 100 Token/s 的参考速度比较。

AA System Load Test 完整系统记录
硬件与运行时系统输出吞吐单查询峰值速度每百万输入+输出 Token 成本
8×B200 · TensorRT-LLM(记录 1)40,100 Token/s403 Token/sUS$0.19
8×B200 · TensorRT-LLM(记录 2)40,100 Token/s403 Token/sUS$0.19
8×B200 · TensorRT-LLM(记录 3)22,200 Token/s243 Token/sUS$0.35
8×H200 · vLLM6,360 Token/s226 Token/sUS$2.18
8×H100 · vLLM5,830 Token/s187 Token/sUS$0.83
8×MI300X · vLLM842 Token/s146 Token/sUS$3.93

这个指标与普通芯片跑分的区别

它把上下文长度、服务目标、并发和功耗放在同一系统条件中,更接近部署容量问题。结果不能脱离模型、服务目标和硬件配置单独比较。