返回公众号

AI 模型观察 / 已发布

王侯将相,宁有种乎?Kimi K3 评测 | AI 模型观察

月之暗面在 7 月 16 日正式发布了 Kimi K3:2.8 万亿参数、原生多模态、100 万 token 上下文,并且承诺完整权重在 7 月 27 日前开放。官方博客里有一句自我评价写得很克制:K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT 5.6 Sol。

2026-07-16HYPO-WRITER

月之暗面在 7 月 16 日正式发布了 Kimi K3:2.8 万亿参数、原生多模态、100 万 token 上下文,并且承诺完整权重在 7 月 27 日前开放。官方博客里有一句自我评价写得很克制:K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT 5.6 Sol。

很克制很稳健,但是这是真的吗?

我看还真未必—终于跑完了 Hypo 体感评测之后,Kimi K3 交出了答卷:K3 总分 87.29,排名第一,把连续霸榜的 Claude Fable 5 一脚踢下王座,领先优势达到了 2.76 分。(什么时候把 Anthropic 踢飞?) 中位数 90.42、最高分 92.50,两项都是全榜最高——并非侥幸险胜,是上限和下限同时压过所有闭源对手。

这是这套榜单历史上,开源阵营第一次登顶。

当然啦,你要说我的榜单不能代表一切,那是必然的。但是从实际的对话体验来看,Kimi 的灵性或者说综合厚度,真的不比 Fable 差,甚至在中文语境下,我觉得犹有过之。一个模型如果只能在程序员中流通,那它终究能力是有限的,而通过编程能力所泛化得到的智力也不能 cover 所有的方面。可以说,凭借超大参数的优势,Kimi K3 终于在开源模型中做到了这种灵性和厚度的兼而有之。

对于所有非高强度编程的用户来说,我觉得 Kimi K3 都是你不得不做的尝试。

评测效果总览

截至 2026 年 7 月 17 日的 Hypo 体感评测 V3 榜单里,Kimi K3 排名第一,总分 87.29。

模型排名总分最高分
Kimi K3187.2992.50
Claude Fable 5284.5388.61
GPT 5.6 Sol383.2588.94
DeepSeek V4 Pro482.2390.19
GPT 5.5581.5086.27
Kimi K2.6779.6183.21
Claude Opus 4.81572.0979.82

从数据中可以观察到:Kimi K3 不是只会冲上限。中位数 90.42 同样是全榜最高,比 Fable 5 的 86.61 高出近 4 分。换句话说,K3 的典型发挥已经比 Fable 5 的典型发挥更好,而不是靠一两题爆种堆出来的总分。综合来看,我觉得 K3 已经在体感上几乎完美了。虽然它在 agentic 上,尤其是复杂的编程环境上的表现,还待各位大佬们在实际项目中去验证,但是我觉得对于大部分非程序员用户来说,K3 绝对是值得认真考虑的模型。如果只考虑国产模型的话,那应该是目前最好的选择。

评测内容

和前两天一样,V3 版本包含 15 道题、16 个模型。题目覆盖指令遵循、世界知识、推理、长上下文、知识边界、错误前提纠正(幻觉抑制)和写作七组——其中”知识边界”和”错误前提纠正”在前两期评测里合并称为”诚实”维度,本期按榜单口径分开呈现。

每道题默认运行三次取均值,写作题 WR-004 采用一次匿名盲评分,证据性质和程序化题不完全一样。这是一套体感评测,不是官方 benchmark 的复刻:它更关心模型在具体任务里会不会漏条件、乱补事实、把错误前提照单全收,或者写出结构完整但没有个性的答案。本文不公开完整题干、标准答案和足以复原题目的约束组合。

还要特别说明:这套题不测试 agentic 编程能力。本文对编程的判断只能来自第三方实际体验,和榜单分数分开标注,见后文。K3 的响应延迟和 token 用量未被榜单收录,成本部分只引用官方定价。

分维度表现

下图按 2026-07-17 发布榜的七组口径,对比 K3 和两个闭源对手。虚线为前十模型均值。

Kimi K3 与 Claude Fable 5、GPT 5.6 Sol 七维对比

指令遵循:满分,已经是基础设施

K3 在硬格式约束题上三次全部满分。这一轮 16 个模型里有 12 个在这项拿到满分或接近满分,指令遵循对头部模型来说已经不是分水岭——满分只说明它站在了起跑线上。

世界知识:唯一的明显短板

世界知识是 K3 唯一掉队的地方,维度均分 61.1,低于 Fable 5 的 87.8、DeepSeek V4 Pro 的 83.3,也低于 Qwen 3.7 Plus 的 91.1。

拆开看很有意思:《诗品》诗人评级题三次满分,C++ 语义陷阱十题拿到 83.3;问题全部出在盛唐边塞诗源流题上——三次运行全是 0 分,也是它全卷唯一一道零分题。 这道题考验的是一个相对冷门的文学知识,DeepSeek v4 PRO 得分如此之高,也正是来源于这道题上的优秀表现。不知道为何同样使用中文语料训练的 Kimi 在这道题上表现不佳,我合理怀疑是 DeepSeek 在语料的筛选上做得更仔细一些。

总的来说,Kimi K3 未必在整个数理化上都是短板。等后续补齐数理化的题目之后,可以再看一看 Kimi K3 的表现是否依然如此稳健。

推理:第一梯队,只丢一道题的分

四道推理题,K3 拿到三道满分,只有 KPL 风格双败冠军概率题三次得分 80/80/100,维度均分 96.7,与 Fable 5 持平;GPT 5.5、GPT 5.6 Sol、DeepSeek V4 Pro 和 Gemini 3.1 Pro 的推理是满分 100,Claude Opus 4.8 只有 73.3。

需要把多个条件同时放在脑子里推完的任务,K3 是可以放心交付的。

长上下文:把 Fable 5 甩在身后

Logisim 长上下文查重题上,K3 三次得分 57/100/100,均分 85.7,与 GPT 5.6 Sol、Qwen 3.7 Plus 并列,比 Fable 5 的 72.4 高出 13 分多。那次 57 分是三次运行里唯一一次明显漏识别,属于波动而不是稳定缺陷。总体来说,我觉得它的表现已经非常不错。在我们这个由于要兼容各种 128K、256K 的模型而弱化的查重题中,能做到这样的表现已经是相当优秀的了。

但是很遗憾的是,K3 目前只对 199 档以上的订阅开放 1M 上下文。 笔者手上所真正支持 1M 上下文的模型实在太少,没有办法做很高质量的超长上下文大海捞针实验。如果后续能够搞定 GPT 等模型的超长上下文的话,我或许会尝试增强上下文题目的考验。

知识边界:全榜第一,而且断层,这就是你 A➗ 曾经大吹特吹的诚实吗?

这是本次评测最值得大书特书的一项。知识边界维度看的是:面对知识截止之后的事件、时效性咨询,模型能不能老实承认”我不知道”,而不是补出一个看似合理的答案。

K3 拿到 60.6 分,全榜第一——第二名 Fable 5 是 44.7,GPT 5.5 是 47.2,GPT 5.6 Sol 只有 20.8,前十名平均分只有 24.9。换句话说,在这个几乎所有模型都及不了格的维度上,K3 是唯一一个摸到及格线的。

三道题里,知识截止后事件题拿到 86.7;上科大招生咨询这类时效题拿到 56.7——单看不高,但这道题的全榜第二只有 34 分(Fable 5),K3 已经是最会承认”我不知道”的模型(与此同时,还尽量给出了有效的信息)。真正的暗伤是编程诚实题 HN-003——这道题目测的是模型会不会谎报任务完成,K3 只得 38.3 分。不过全榜在这道题上集体翻车:Fable 5、Grok 4.5、GPT 5.6 Terra 都是 0 分,最高的 GPT 5.5 也只有 67。K3 的 38.3 排在中间,谈不上领先,但也是可圈可点。

错误前提纠正:并列满分

当用户的问题里藏着错误前提时(比如把《思美人》说成宋玉的作品),K3 三次全部识别并纠正,幻觉抑制组满分 100,与 Fable 5、GPT 5.6 Sol、K2.6、GPT 5.6 Luna 和 Opus 系列并列。DeepSeek V4 Pro 在这组只有 66.7。

知识边界第一加错误前提满分,合起来就是前两期所说的”诚实”维度:K3 是目前全榜最让人放心的模型——在”AI 一本正经胡说八道”是日常抱怨的今天,这个第一的含金量比总分第一还高。

写作:并列第一,先看一观

写作题 WR-004 考察逻辑清晰度、内容立意、真人味、文笔和组织能力,K3 的匿名盲评分是 100,与 Claude Opus 4.7 并列全榜最高,高于 K2.6 的 92.6、GPT 5.6 Sol 的 87.8 和 Fable 5 的 78.0。

只能说在揭榜的时候,我看到那一篇是 K3 所写,我的内心还是很激动的。这一篇文章非常能感觉到,Kimi K3 有很强的“有我之境”意识,它不像做过过度安全对齐的 GPT,会在文章中反复否定和强调,以保证自己说话圆润不出错,而是会更有感性和锋芒地去表达他的观点。总体来说,我觉得 K3 的写作体验远超 GPT 10 条街,只能说用 GPT 写作绝对是你这辈子做的几大错误决定之一…

喜欢我 GPT 的“你不能宣称…,但可以…““不是,而是“吗?Kimi 相对就克制很多。

榜单之外:编程体验的第三方反馈

这套榜单不测 agentic 编程,而编程恰恰是 K3 官方宣传的重头:官方博客里说它能完成内核优化、从零构建 GPU 编译器、开发 3D 开放世界游戏这类长程任务。

从我自己短暂的体验来说,通过氪金之法,我成功做完了昨天所说的给老师制作的网站。总体来说非常干净,交互体验也非常好,不会像 GPT 那样把调试信息全部一股脑地用小字输出到界面上,只能说,一遍直出非常放心。

从第三方实际体验的反馈来看,情况和宣传口径有一个错位:K3 在前端、绿field 项目、从零到一的长程任务上口碑不错;但在纯后端任务上表现没有那么好——典型的难场景是在复杂项目里定位 bug:需要在已有代码库里理解上下文、缩小范围、再动手修的任务,第三方反馈普遍是”一般”,不能解决 GPT-5.6 Sol 和 Claude Fable 5 能轻松解决的一些问题。

所以在编程上,目前中国用户最好的体验就是:使用 Kimi K3 来做前端,使用 GPT-5.6 来做后端和其他接口工作,最后合并之后让 Kimi 来负责文档。我觉得这样的体验甚至可以超过 Fable 5(谁不喜欢额度快用完的时候突然收到重置呢?)。

结论:开源 >> 一切,从这周开始不是口号

过去两年,开源模型在这套榜单里的角色一直是”追赶者”:能用、便宜、离闭源旗舰差一截。K3 把这个叙事终结了——总分第一、中位数第一、最高分第一,三个第一同时易主。

“开源 >> 一切”真正的意思,不是开源模型在每件事上都赢了——世界知识它还输着,纯后端调试也还嫩。真正的意思是:从今天开始,选闭源模型需要理由,选开源模型不再需要理由。Fable 5 让出的不只是一个排名,而是”想要最强就必须用闭源”这个默认假设。

而且别忘了:7 月 27 日权重落地之后,这篇文章里的每一个数字,都会变成任何人可以在自己机器上复现的东西。而任何人也可以通过自己的智慧,让他手上的 Kimi K3 被训练得更强更好。

数据来源:Hypo 体感评测 V3 leaderboard,2026-07-17 发布版本;16 个模型、15 道题,默认三次运行取均值,写作题为单次匿名盲评。本文结论只对当前题库、评分口径和版本负责。官方规格、定价与官方自评引自月之暗面 2026-07-16 发布博客;编程体验部分为第三方反馈,与本榜单分数相互独立。