主批次 13 个,后续小米追加批次 1 个
Chinese Evaluation / Fortune Telling
命理年度详解模型横评
同一份匿名 2026 年命理样本下,比较 14 个模型的中文叙事、命理依据、现实信号、行动建议与结构化输出稳定性。
含结构通过与内容可读但结构异常的输出
来自原横评定性结论,本站没有重新评分
匿名 2026 年高机会、高风险年度样本
COMPLETE RESULTS
14 个模型的完整记录
这里没有本站创造的综合分。筛选器只整理原评测结论、API 技术结果、结构状态、延迟与输出长度。
- GLM-5V-Turbo
glm-5v-turboTencentMaaS内容表现较好结构通过JSON 通过 · 字段完整延迟88.4 秒输出2,400 Token原横评认为其文本厚、情景化强,行动提醒清晰,中文可读性最突出。
查看该次原始输出 ↗ - MiniMax-M2.5
minimax-m2.5TencentMaaS内容表现较好结构通过JSON 通过 · 字段完整延迟27.2 秒输出2,045 Token现实落地逻辑强,风险与执行建议的对比鲜明,实操价值突出。
查看该次原始输出 ↗ - DeepSeek-V4-Pro
deepseek-v4-proTencentMaaS内容表现较好结构通过JSON 通过 · 字段完整延迟43.7 秒输出1,616 Token命理锚点明确、结构完整、建议可执行,整体表达稳定。
查看该次原始输出 ↗ - DeepSeek-V4-Flash
deepseek-v4-flashTencentMaaS内容表现较好结构通过JSON 通过 · 字段完整延迟21.5 秒输出1,564 Token开头抓人,逻辑链完整,语言利落,适合直接面向中文用户。
查看该次原始输出 ↗ - DeepSeek-V3.2
deepseek-v3.2TencentMaaS内容表现较好结构通过JSON 通过 · 字段完整延迟39.2 秒输出1,309 Token结构稳定、语义完整,风格更接近传统命理叙事。
查看该次原始输出 ↗ - Hy3 Preview
hy3-previewTencentMaaS内容表现较好结构通过JSON 通过 · 字段完整延迟43.7 秒输出977 Token篇幅较短,但主次清楚、结构紧凑,适合作为轻量版本。
查看该次原始输出 ↗ - MiniMax-M2.7
minimax-m2.7TencentMaaS有条件可用结构异常JSON 未通过 · 字段不完整延迟85.8 秒输出1,872 Token内容质量接近可用,但额外包裹 Markdown 代码围栏,导致结构化解析失败。
查看该次原始输出 ↗ - GLM-5
glm-5TencentMaaS有条件可用结构异常JSON 未通过 · 字段不完整延迟42.5 秒输出2,400 Token原文可读,但 JSON 换行或转义异常且触及输出上限,需要修复后再用。
查看该次原始输出 ↗ - Xiaomi MiMo V2.5 Pro
mimo-v2.5-proXiaomi MiMo Token Plan有条件可用结构通过JSON 通过 · 字段完整延迟61.8 秒*输出1,258 Token第二次调用通过严格 JSON;表达完整但偏模板化,原记录列为二级候选。
查看该次原始输出 ↗ - GLM-5.1
glm-5.1TencentMaaS有条件可用结构异常JSON 通过 · 字段不完整延迟52.1 秒输出2,400 Token可读部分语义质量好,但输出长度截断,必需字段不完整。
查看该次原始输出 ↗ - DeepSeek-V3.0324
deepseek-v3-0324TencentMaaS有条件可用结构异常JSON 未通过 · 字段不完整延迟27.0 秒输出794 Token文本内容仍可读,但额外包裹 Markdown 代码围栏,导致 JSON 解析失败。
查看该次原始输出 ↗ - Kimi K2.5
kimi-k2.5TencentMaaS本轮不可比调用失败延迟—输出—调用参数不兼容:该模型只接受 temperature=1,因此本批次没有可比较输出。
查看该次原始输出 ↗ - Kimi K2.6
kimi-k2.6TencentMaaS本轮不可比调用失败延迟—输出—调用参数不兼容:该模型只接受 temperature=1,因此本批次没有可比较输出。
查看该次原始输出 ↗ - DeepSeek-V3.1
deepseek-v3.1TencentMaaS本轮不可比调用失败延迟—输出—评测时 API 返回模型不存在,本批次没有可比较输出。
查看该次原始输出 ↗
* 小米模型来自后续独立批次,最大输出长度不同,延迟只作记录,不参与同批次比较。
EVALUATION METHOD
原评测看什么
同一份匿名固定样本:事业与财富得分较高、健康得分较低,用于检验模型能否解释高机会与高风险并存的年度状态。
- 01
命理依据是否解释大运、流年、藏干、十神与岁运并临,而不是只堆术语
- 02
是否把事业、财富、关系与健康的强弱翻译成具体体感和现实信号
- 03
中文判词、叙事结构与行动建议是否清晰、具体且适合产品阅读
- 04
JSON 是否可解析,必需字段是否完整,输出是否被截断
LIMITATIONS
这份结果不能说明什么
固定样本很适合复盘产品输出,但不能替代大样本、盲评或长期稳定性测试。
这是单一匿名固定样本,不代表模型在所有命理任务上的平均水平。
内容结论来自该批次人工阅读记录,没有统一数值总分;本站不重新评分。
小米模型来自后续独立批次,最大输出长度不同,因此延迟不宜与主批次直接排名。
本专题评估的是中文产品输出质量与结构稳定性,不验证命理预测是否具有科学有效性。
PROVENANCE
来源与机器数据
所有模型行都能下钻到该次原始输出;结构化镜像保留批次、模型 ID、状态和局限。