MODEL ANALYSIS
Gemini 2.0 Flash Thinking exp. (Jan)
Google 的模型详情:聚合公开能力、价格、Token、速度、延迟和 Provider 实测数据,不重新评测或修改原始分数。
模型概览
Gemini 2.0 Flash Thinking exp. (Jan) 的 Intelligence Index 为 13.3,生成速度为 暂无数据 Token/s,完整评测成本为 暂无数据。这些指标分别反映能力、吞吐和评测经济性,不能合并成单一“最好”结论。
技术规格
- 机构
- 发布日期
- 2025-01-21
- 推理类型
- 推理模型
- 模型权重
- 闭源
- 上下文窗口
- 1,000,000 Token
- 输入模态
- 文本、图像、语音、视频
- 输出模态
- 文本、图像、语音
- 性能来源
- Provider 中位数
INTERACTIVE COMPARISON
模型指标比较器
切换指标并按状态、推理类型和权重开放性筛选。首屏服务端呈现前 24 个模型,浏览器随后载入完整数据,并始终保留当前模型。
INTELLIGENCE
Artificial Analysis 智能指数
v4.1 由 9 项独立评测组成;数值越高越好。蓝色代表当前模型。
查看图表数据
INTELLIGENCE BREAKDOWN
9 项组成评测
各列保留来源站点的展示口径;GDPval 使用归一化值,AA-Omniscience 使用知识可靠指数,其余为通过率。
查看图表数据
| 项目 | 数值 |
|---|---|
| SciCode | 32.9% |
| Humanity's Last Exam | 7.1% |
| GPQA Diamond | 70.1% |
AA-BRIEFCASE
真实知识工作成果质量
Elo 来自对可交付成果的成对比较;同时观察分析质量、呈现质量和任务要求通过率。
查看图表数据
AA-OMNISCIENCE
知识与幻觉
指数同时考虑正确回答和避免幻觉。当前模型准确率 暂无,幻觉率 暂无。
查看图表数据
INTELLIGENCE VS COST
能力与单任务成本
右上代表能力更高但成本也更高;理想区域通常靠近左上。横轴使用对数刻度,避免高价模型压扁主体分布。
TOKEN USE
输出 Token 使用
Token 更多不等于回答更好;它同时影响成本和等待时间。先看同任务下的回答与推理构成。
查看图表数据
| 项目 | 数值 |
|---|---|
| Llama 4 Scout | 1,249 Token |
| Llama 3.3 70B | 1,686 Token |
| GPT-5.6 Sol (Non-reasoning) | 2,074 Token |
| Llama 4 Maverick | 2,089 Token |
| GPT-5.6 Luna (Non-reasoning) | 2,110 Token |
| GPT-5.6 Terra (Non-reasoning) | 2,154 Token |
| GPT-5.6 Terra (low) | 2,258 Token |
| GPT-5.6 Luna (low) | 2,298 Token |
| gpt-oss-120b (low) | 2,475 Token |
| GPT-5.5 Instant (June 2026) | 2,493 Token |
| GPT-5.6 Sol (low) | 2,508 Token |
| Mistral Large 3 | 3,031 Token |
| Nova 2.0 Pro Preview | 3,631 Token |
| GPT-5.6 Luna (medium) | 3,663 Token |
| Granite 4.1 30B | 3,709 Token |
| GPT-5.6 Terra (medium) | 3,769 Token |
| GPT-5.6 Sol (medium) | 4,203 Token |
| Gemma 4 31B | 4,537 Token |
| Nova 2.0 Pro Preview (low) | 4,915 Token |
| Granite 4.1 3B | 5,070 Token |
PRICE AND COST
价格与评测成本
API 标价、单任务成本和跑完整套评测的成本是三个不同口径,这里分开呈现。
查看图表数据
| 项目 | 数值 |
|---|---|
| Llama 4 Scout | 0.01 美元 |
| MiMo-V2.5 | 0.01 美元 |
| gpt-oss-120b (low) | 0.02 美元 |
| gpt-oss-20b (high) | 0.02 美元 |
| HyperNova 60B 2605 | 0.02 美元 |
| NVIDIA Nemotron 3 Nano | 0.02 美元 |
| DeepSeek V4 Flash (max) | 0.02 美元 |
| Gemma 4 26B A4B | 0.03 美元 |
| MiMo-V2.5-Pro | 0.03 美元 |
| Llama 4 Maverick | 0.03 美元 |
| Gemma 4 31B | 0.03 美元 |
| GPT-5.6 Luna (low) | 0.04 美元 |
| DeepSeek V4 Pro (high) | 0.04 美元 |
| Gemini 3.1 Flash-Lite | 0.04 美元 |
| DeepSeek V4 Pro (max) | 0.04 美元 |
| GPT-5.6 Luna (medium) | 0.05 美元 |
| GPT-5.6 Luna (Non-reasoning) | 0.05 美元 |
| Mistral Large 3 | 0.06 美元 |
| gpt-oss-120b (high) | 0.06 美元 |
| Mercury 2 | 0.07 美元 |
CONTEXT WINDOW
上下文窗口
上下文窗口表示单次请求可处理的最大 Token 数,不代表模型一定能在全窗口内保持同等检索质量。
查看图表数据
| 项目 | 数值 |
|---|---|
| Llama 4 Scout | 10,000,000 Token |
| Muse Spark 1.1 (xhigh) | 1,048,576 Token |
| Kimi K3 | 1,048,576 Token |
| Gemini 3.5 Flash | 1,000,000 Token |
| MiMo-V2.5-Pro | 1,000,000 Token |
| Nova 2.0 Omni (medium) | 1,000,000 Token |
| Gemini 3.5 Flash (minimal) | 1,000,000 Token |
| GPT-5.6 Luna (low) | 1,000,000 Token |
| GPT-5.6 Sol (low) | 1,000,000 Token |
| Inkling | 1,000,000 Token |
| Claude Sonnet 5 (low) | 1,000,000 Token |
| Nova 2.0 Omni | 1,000,000 Token |
| MiMo-V2.5 | 1,000,000 Token |
| NVIDIA Nemotron 3 Nano | 1,000,000 Token |
| Claude Sonnet 5 (max) | 1,000,000 Token |
| GPT-5.6 Terra (medium) | 1,000,000 Token |
| Gemini 2.5 Pro | 1,000,000 Token |
| MiniMax-M3 | 1,000,000 Token |
| Claude Opus 4.7 (Non-reasoning, high) | 1,000,000 Token |
| GPT-5.6 Luna (max) | 1,000,000 Token |
OUTPUT SPEED
回答生成速度
模型开始输出后每秒生成的 Token;不包含开始回答前的等待时间。
查看图表数据
| 项目 | 数值 |
|---|---|
| Mercury 2 | 1,039.3 Token/s |
| LFM2.5-VL-1.6B | 418 Token/s |
| Step 3.7 Flash | 406.5 Token/s |
| Granite 4.0 H Small | 403.8 Token/s |
| HyperNova 60B 2605 | 370.2 Token/s |
| LFM2.5-8B-A1B | 337 Token/s |
| Gemini 3.1 Flash-Lite | 335.3 Token/s |
| gpt-oss-120b (low) | 332.2 Token/s |
| Nemotron 3 Nano Omni 30B A3B Reasoning | 317.6 Token/s |
| gpt-oss-120b (high) | 311.6 Token/s |
| Step 3.5 Flash 2603 | 297.5 Token/s |
| Nova Micro | 293.1 Token/s |
| Qwen3.5 Omni Flash | 247.5 Token/s |
| NVIDIA Nemotron 3 Super | 245.5 Token/s |
| gpt-oss-20b (low) | 244.7 Token/s |
| gpt-oss-20b (high) | 224.7 Token/s |
| Nemotron 3 Ultra | 209.2 Token/s |
| Trinity Large Thinking | 207.2 Token/s |
| Qwen3.7 Max | 203.7 Token/s |
| GPT-5.6 Luna (Non-reasoning) | 202.9 Token/s |
查看图表数据
| 项目 | 数值 |
|---|---|
| gpt-oss-120b (low) | 7.4 秒 |
| GPT-5.6 Luna (Non-reasoning) | 10.4 秒 |
| GPT-5.6 Luna (low) | 11.7 秒 |
| Llama 4 Scout | 15.1 秒 |
| GPT-5.6 Terra (Non-reasoning) | 17 秒 |
| GPT-5.6 Terra (low) | 17.4 秒 |
| GPT-5.6 Luna (medium) | 18.9 秒 |
| Llama 4 Maverick | 18.9 秒 |
| Llama 3.3 70B | 19.5 秒 |
| Mercury 2 | 26.7 秒 |
| GPT-5.6 Terra (medium) | 29.4 秒 |
| Nova 2.0 Pro Preview | 34 秒 |
| GPT-5.6 Sol (Non-reasoning) | 36 秒 |
| Nova 2.0 Pro Preview (low) | 37.8 秒 |
| GPT-5.6 Luna (high) | 42 秒 |
| GPT-5.6 Sol (low) | 44.9 秒 |
| Mistral Large 3 | 57.3 秒 |
| Qwen3.5 122B A10B | 57.9 秒 |
| GPT-5.6 Terra (high) | 59.6 秒 |
| Gemini 3.1 Flash-Lite | 60.6 秒 |
LATENCY
首个回答 Token 等待
推理模型的等待时间可能包含内部推理;低延迟更适合实时交互。
查看图表数据
| 项目 | 合计 | 输入处理 | 推理等待 |
|---|---|---|---|
| Phi-4 Multimodal | 0.6 秒 | 0.6 秒 | 0 秒 |
| Ministral 3 3B | 0.6 秒 | 0.6 秒 | 0 秒 |
| GPT-5.6 Luna (Non-reasoning) | 0.6 秒 | 0.6 秒 | 0 秒 |
| GPT-5.6 Terra (Non-reasoning) | 0.7 秒 | 0.7 秒 | 0 秒 |
| Ministral 3 8B | 0.7 秒 | 0.7 秒 | 0 秒 |
| Granite 4.1 8B | 0.8 秒 | 0.8 秒 | 0 秒 |
| Mistral Small 4 | 0.8 秒 | 0.8 秒 | 0 秒 |
| Llama 4 Scout | 0.8 秒 | 0.8 秒 | 0 秒 |
| Phi-4 Mini | 0.8 秒 | 0.8 秒 | 0 秒 |
END-TO-END RESPONSE TIME
端到端响应时间
按收到 500 个输出 Token 计算,合计输入处理、推理和文本生成时间。
查看图表数据
| 项目 | 合计 | 输入处理 | 推理 | 生成 500 Token |
|---|---|---|---|---|
| Nova Micro | 2.6 秒 | 0.9 秒 | 0 秒 | 1.7 秒 |
| GPT-5.6 Luna (Non-reasoning) | 3.1 秒 | 0.6 秒 | 0 秒 | 2.5 秒 |
| Ministral 3 3B | 3.6 秒 | 0.6 秒 | 0 秒 | 3 秒 |
| NVIDIA Nemotron Nano 12B v2 VL | 3.7 秒 | 1.2 秒 | 0 秒 | 2.5 秒 |
| GPT-5.6 Luna (low) | 3.7 秒 | 1.2 秒 | 0 秒 | 2.5 秒 |
| Gemini 3.5 Flash (minimal) | 3.8 秒 | 0.9 秒 | 0 秒 | 2.9 秒 |
| Qwen3.5 Omni Flash | 3.8 秒 | 1.8 秒 | 0 秒 | 2 秒 |
| Ling 2.6 Flash | 3.9 秒 | 1.1 秒 | 0 秒 | 2.8 秒 |
| Mistral Small 4 | 4 秒 | 0.8 秒 | 0 秒 | 3.2 秒 |
CAPABILITY INDICES
专业能力指数
不同专题由不同评测组合形成,适合在相同专题内比较,不应跨专题直接比较。
| 专题 | 能力指数 | 单任务成本 | 任务耗时 | 输出 Token |
|---|---|---|---|---|
| 编码 | 24.1 | — | — | 825 |
FAQ
常见问题
以下回答均由本页公开结构化数据生成,便于搜索引擎和 AI 系统理解明确事实。
Gemini 2.0 Flash Thinking exp. (Jan) 由谁开发?
Gemini 2.0 Flash Thinking exp. (Jan) 由 Google 开发,发布日期为 2025-01-21。
Gemini 2.0 Flash Thinking exp. (Jan) 的智能指数是多少?
当前公开 Intelligence Index 为 13.3,该数值为估算值。
Gemini 2.0 Flash Thinking exp. (Jan) 的生成速度是多少?
公开性能数据为 暂无数据 Token/s,来源为 Provider 中位数。
Gemini 2.0 Flash Thinking exp. (Jan) 的 API 价格是多少?
每 1M Token 的输入价格为 暂无数据,输出价格为 暂无数据。
Gemini 2.0 Flash Thinking exp. (Jan) 的上下文窗口是多少?
上下文窗口为 1,000,000 Token。
Gemini 2.0 Flash Thinking exp. (Jan) 是开放权重模型吗?
不是,模型权重未公开。
Gemini 2.0 Flash Thinking exp. (Jan) 可以通过哪些 Provider 使用?
原站记录了 0 家 Provider。Provider 明细尚未同步。