Chinese Evaluation / Fortune Telling

命理年度详解模型横评

同一份匿名 2026 年命理样本下,比较 14 个模型的中文叙事、命理依据、现实信号、行动建议与结构化输出稳定性。

数据快照:2026-07-22查看 Kline-star 原始横评 ↗
模型记录14

主批次 13 个,后续小米追加批次 1 个

获得模型输出11

含结构通过与内容可读但结构异常的输出

内容表现较好6

来自原横评定性结论,本站没有重新评分

固定样本1

匿名 2026 年高机会、高风险年度样本

COMPLETE RESULTS

14 个模型的完整记录

这里没有本站创造的综合分。筛选器只整理原评测结论、API 技术结果、结构状态、延迟与输出长度。

显示 14 / 14 个模型

  1. GLM-5V-Turboglm-5v-turboTencentMaaS
    内容表现较好
    结构通过JSON 通过 · 字段完整
    延迟88.4 秒
    输出2,400 Token

    原横评认为其文本厚、情景化强,行动提醒清晰,中文可读性最突出。

    查看该次原始输出 ↗
  2. MiniMax-M2.5minimax-m2.5TencentMaaS
    内容表现较好
    结构通过JSON 通过 · 字段完整
    延迟27.2 秒
    输出2,045 Token

    现实落地逻辑强,风险与执行建议的对比鲜明,实操价值突出。

    查看该次原始输出 ↗
  3. DeepSeek-V4-Prodeepseek-v4-proTencentMaaS
    内容表现较好
    结构通过JSON 通过 · 字段完整
    延迟43.7 秒
    输出1,616 Token

    命理锚点明确、结构完整、建议可执行,整体表达稳定。

    查看该次原始输出 ↗
  4. DeepSeek-V4-Flashdeepseek-v4-flashTencentMaaS
    内容表现较好
    结构通过JSON 通过 · 字段完整
    延迟21.5 秒
    输出1,564 Token

    开头抓人,逻辑链完整,语言利落,适合直接面向中文用户。

    查看该次原始输出 ↗
  5. DeepSeek-V3.2deepseek-v3.2TencentMaaS
    内容表现较好
    结构通过JSON 通过 · 字段完整
    延迟39.2 秒
    输出1,309 Token

    结构稳定、语义完整,风格更接近传统命理叙事。

    查看该次原始输出 ↗
  6. Hy3 Previewhy3-previewTencentMaaS
    内容表现较好
    结构通过JSON 通过 · 字段完整
    延迟43.7 秒
    输出977 Token

    篇幅较短,但主次清楚、结构紧凑,适合作为轻量版本。

    查看该次原始输出 ↗
  7. MiniMax-M2.7minimax-m2.7TencentMaaS
    有条件可用
    结构异常JSON 未通过 · 字段不完整
    延迟85.8 秒
    输出1,872 Token

    内容质量接近可用,但额外包裹 Markdown 代码围栏,导致结构化解析失败。

    查看该次原始输出 ↗
  8. GLM-5glm-5TencentMaaS
    有条件可用
    结构异常JSON 未通过 · 字段不完整
    延迟42.5 秒
    输出2,400 Token

    原文可读,但 JSON 换行或转义异常且触及输出上限,需要修复后再用。

    查看该次原始输出 ↗
  9. Xiaomi MiMo V2.5 Promimo-v2.5-proXiaomi MiMo Token Plan
    有条件可用
    结构通过JSON 通过 · 字段完整
    延迟61.8 秒*
    输出1,258 Token

    第二次调用通过严格 JSON;表达完整但偏模板化,原记录列为二级候选。

    查看该次原始输出 ↗
  10. GLM-5.1glm-5.1TencentMaaS
    有条件可用
    结构异常JSON 通过 · 字段不完整
    延迟52.1 秒
    输出2,400 Token

    可读部分语义质量好,但输出长度截断,必需字段不完整。

    查看该次原始输出 ↗
  11. DeepSeek-V3.0324deepseek-v3-0324TencentMaaS
    有条件可用
    结构异常JSON 未通过 · 字段不完整
    延迟27.0 秒
    输出794 Token

    文本内容仍可读,但额外包裹 Markdown 代码围栏,导致 JSON 解析失败。

    查看该次原始输出 ↗
  12. Kimi K2.5kimi-k2.5TencentMaaS
    本轮不可比
    调用失败
    延迟
    输出

    调用参数不兼容:该模型只接受 temperature=1,因此本批次没有可比较输出。

    查看该次原始输出 ↗
  13. Kimi K2.6kimi-k2.6TencentMaaS
    本轮不可比
    调用失败
    延迟
    输出

    调用参数不兼容:该模型只接受 temperature=1,因此本批次没有可比较输出。

    查看该次原始输出 ↗
  14. DeepSeek-V3.1deepseek-v3.1TencentMaaS
    本轮不可比
    调用失败
    延迟
    输出

    评测时 API 返回模型不存在,本批次没有可比较输出。

    查看该次原始输出 ↗

* 小米模型来自后续独立批次,最大输出长度不同,延迟只作记录,不参与同批次比较。

EVALUATION METHOD

原评测看什么

同一份匿名固定样本:事业与财富得分较高、健康得分较低,用于检验模型能否解释高机会与高风险并存的年度状态。

  1. 01

    命理依据是否解释大运、流年、藏干、十神与岁运并临,而不是只堆术语

  2. 02

    是否把事业、财富、关系与健康的强弱翻译成具体体感和现实信号

  3. 03

    中文判词、叙事结构与行动建议是否清晰、具体且适合产品阅读

  4. 04

    JSON 是否可解析,必需字段是否完整,输出是否被截断

主批次参数

temperature 0.2 · max tokens 2,400 · TencentMaaS · Run ID 2026-05-01T17-27-31-325Z

查看运行记录 ↗

LIMITATIONS

这份结果不能说明什么

固定样本很适合复盘产品输出,但不能替代大样本、盲评或长期稳定性测试。

单一样本

这是单一匿名固定样本,不代表模型在所有命理任务上的平均水平。

不重算分数

内容结论来自该批次人工阅读记录,没有统一数值总分;本站不重新评分。

批次不同

小米模型来自后续独立批次,最大输出长度不同,因此延迟不宜与主批次直接排名。

非科学验证

本专题评估的是中文产品输出质量与结构稳定性,不验证命理预测是否具有科学有效性。

PROVENANCE

来源与机器数据

所有模型行都能下钻到该次原始输出;结构化镜像保留批次、模型 ID、状态和局限。