Chinese Evaluations

中文测评

聚合更依赖中文语境、文化知识和中文产品表达的模型评测。每项测评独立保留来源、样本、指标和局限,不合成为本站总分。

数据快照:2026-07-22查看首项评测项目 ↗

SCOPE

中文能力不是一个分数

语境独立

命理、古诗词、成语、中文写作等任务各自衡量不同能力,不把它们平均成模糊的“中文总分”。

来源独立

本站展示已有评测的原始结论与技术结果,评测设计者仍是口径的解释主体。

样本透明

明确样本数、时间、Prompt 条件和失败原因,让读者知道结论能外推到哪里。

01 / 中文产品任务

命理年度详解

让不同模型解读同一份匿名年度命理样本,比较中文表达、命理依据、现实信号、行动建议与结构化输出稳定性。

14 个模型记录 · 1 个匿名固定样本查看完整评测 →