长期知识工作

AA-Briefcase

面向多步骤、长周期知识工作的专有评测。

数据快照:2026-07-21查看原始来源 ↗
主要指标Elo
快照日期2026-07-21
49 / 49 个模型
公开评测完整榜单
排名机构模型Elo95% CI发布日期
1AnthropicClaude Fable 51,583-15 / +16Jun 2026
2KimiKimi K31,543-11 / +12Jul 2026
3OpenAIGPT-5.6 Sol (max)1,496-12 / +12Jul 2026
4AnthropicClaude Sonnet 5 (Adaptive Reasoning, Max Effort)1,388-12 / +11Jun 2026
5AnthropicClaude Opus 4.8 (Adaptive Reasoning, Max Effort)1,354-11 / +10May 2026
6SpaceXAIGrok 4.5 (high)1,323-12 / +13Jul 2026
7AnthropicClaude Sonnet 5 (Adaptive Reasoning, Xhigh Effort)1,298-11 / +12Jun 2026
8AnthropicClaude Opus 4.7 (Adaptive Reasoning, Max Effort)1,285-10 / +10Apr 2026
9Z AIGLM-5.2 (max)1,260-10 / +11Jun 2026
10AnthropicClaude Sonnet 5 (Adaptive Reasoning, High Effort)1,199-11 / +11Jun 2026
11OpenAIGPT-5.5 (xhigh)1,154-9 / +8Apr 2026
12MiniMaxMiniMax-M31,110-9 / +10Jun 2026
13OpenAIGPT-5.5 (high)1,103-9 / +9Apr 2026
14AnthropicClaude Opus 4.7 (Non-reasoning, High Effort)1,089-10 / +10Apr 2026
15AnthropicClaude Sonnet 4.6 (Adaptive Reasoning, Max Effort)1,078-9 / +9Feb 2026
16AnthropicClaude Sonnet 5 (Adaptive Reasoning, Medium Effort)1,059-11 / +11Jun 2026
17OpenAIGPT-5.5 (medium)1,000-0 / +0Apr 2026
18Z AIGLM-5.1 (Reasoning)973-10 / +10Apr 2026
19DeepSeekDeepSeek V4 Pro (Reasoning, Max Effort)932-10 / +9Apr 2026
20AnthropicClaude Sonnet 5 (Adaptive Reasoning, Low Effort)926-10 / +10Jun 2026
21AlibabaQwen3.7 Max908-9 / +10May 2026
22XiaomiMiMo-V2.5-Pro873-10 / +9Apr 2026
23NVIDIANemotron 3 Ultra 550B A55B (Reasoning)870-10 / +10Jun 2026
24GoogleGemini 3.5 Flash (medium)869-9 / +10May 2026
25GoogleGemini 3.5 Flash (high)866-10 / +9May 2026
26OpenAIGPT-5.3 Codex (xhigh)864-10 / +10Feb 2026
27MetaMuse Spark 1.1 (xhigh)863-13 / +12Jul 2026
28Thinking MachinesInkling (xhigh)836-11 / +10Jul 2026
29DeepSeekDeepSeek V4 Flash (Reasoning, Max Effort)831-9 / +9Apr 2026
30KimiKimi K2.6816-9 / +9Apr 2026
31AlibabaQwen3.6 27B (Reasoning)806-10 / +10Apr 2026
32SpaceXAIGrok 4.3 (high)752-10 / +9Apr 2026
33OpenAIGPT-5.4 mini (xhigh)707-11 / +9Mar 2026
34MetaMuse Spark631-10 / +11Apr 2026
35AnthropicClaude 4.5 Haiku (Reasoning)603-11 / +11Oct 2025
36KwaiKATKAT-Coder-Pro V1592-12 / +12Nov 2025
37AlibabaQwen3.5 397B A17B (Reasoning)546-11 / +11Feb 2026
38MistralMistral Medium 3.5506-12 / +11Apr 2026
39GoogleGemini 3.1 Pro Preview458-12 / +11Feb 2026
40GoogleGemma 4 31B (Reasoning)364-14 / +13Apr 2026
41CohereCommand A+358-16 / +14May 2026
42CohereNorth Mini Code241-15 / +14Jun 2026
43GoogleGemini 3.1 Flash-Lite221-15 / +14Mar 2026
44UpstageSolar Pro 3128-15 / +14Apr 2026
45MBZUAI Institute of Foundation ModelsK2 Think V250-16 / +14Dec 2025
46OpenAIgpt-oss-120b (high)0-0 / +10Aug 2025
47OpenAIgpt-oss-20b (high)0-0 / +0Aug 2025
48MetaLlama 4 Maverick0-0 / +0Apr 2025
49NVIDIANVIDIA Nemotron 3 Super 120B A12B (Reasoning)0-0 / +0Mar 2026

这个评测关注什么

面向多步骤、长周期知识工作的专有评测。

阅读时注意

评测结果受任务集合、评分方法和模型版本影响。本站保留原始口径,不用它生成新的综合排名。

适用场景

用于回答一个明确的问题:模型在这一类任务上的相对表现如何,而不是“哪个模型绝对最好”。