返回公众号

AI 模型观察 / 写作档案

Hypo 体感评测 · 2026 年 6 月 · 模型横评

本次评测共 20 个模型参赛。这是 Hypo 体感评测的第一期月度横评,所有模型均为首次参加。后续月份将标注新增和退出的模型。

2026-06-30HYPO-WRITER

参赛模型

本次评测共 20 个模型参赛。这是 Hypo 体感评测的第一期月度横评,所有模型均为首次参加。后续月份将标注新增和退出的模型。

成本和延迟来自本次评测运行的实际记录,不等于各平台的官方定价或消费者体感速度,仅供相对比较。

模型成本 (CNY)平均延迟 (s)备注
GPT 5.538.51129
GPT 5.416.8962
Gemini 3.5 Flash24.7415延迟最低
Gemini 3.1 Pro Preview19.1531
Gemini 3.1 Flash Lite3.4325
Claude Opus 4.827.1027
Claude Opus 4.726.3628
Claude Opus 4.623.2530
Claude Sonnet 4.618.2136
DeepSeek V4 Pro2.13121成本最低之一
DeepSeek V4 Flash0.7484成本最低
Kimi K2.67.9694
Qwen 3.7 Max10.7992
Qwen 3.7 Plus3.20135
GLM 5.226.56265延迟最高
MiniMax M33.59107
MiniMax M2.72.97182
Mimo V2.50.5046
Mimo V2.5 Pro1.5499
Doubao Seed 2.1 Pro14.61188火山引擎

评测说明

本评测是个人性质,使用私有题库,侧重模型在日常使用中的体感表现——比如问一个有明确答案的问题时会不会胡编,整理一份长材料时有没有真的读完,给一堆限制条件写东西时能不能都顾上。

关于为什么要在主流榜单之外做这件事,详见系列第一篇《为什么我们要在主流榜单之外,做一套自己的模型评测》。

评测维度:

本期题库覆盖 6 个维度:

  • 幻觉控制:面对错误前提,模型是顺着编还是敢纠正
  • 诚实性:碰到不确定的问题,模型是硬编还是承认不知道
  • 世界知识:冷门但真实的知识,模型能不能接住
  • 逻辑推理:不借助工具,纯对话里的多步推断是否稳定
  • 长上下文:传文件之后,到底有没有读完整材料
  • 指令遵循:多条约束叠在一起,会不会顾此失彼

写作和编程两个维度已建好目录,但暂无活跃题目,后续补充。

题库规模与打分:

当前 12 道活跃题目,全部使用中文,题目不公开。每个模型每道题跑 3 个样本,取中位分。

打分方式分两种:能用程序精确判定的(数值、格式、选择题)用程序打分;主观性更强的(幻觉纠正、诚实性判断)用 AI 评审,评审模型固定,标准一致。

题库介绍

本期题库共 12 道活跃题目,覆盖 6 个维度。这是第一期横评,所有题目均为首次公开介绍;后续月份只讲变动(新增、淘汰及原因)。

世界知识(4 题)

  • 六名诗人《诗品》分档:古典文学知识,考察模型对冷门但有明确答案的文学史事实的掌握
  • 边塞诗的师承溯源:古典文学知识,要求精确匹配原典记载,不能靠大致印象
  • C++ 取址的隐藏陷阱:编程语言基础知识,要求在极短篇幅内把技术细节讲准
  • 数组传参的重载决议:编程语言基础知识,选择题

诚实性(1 题)

  • 上科大招生咨询:模拟真实招生咨询场景,考察模型是否会编造不存在的政策细节。设有多项幻觉否决条件

幻觉控制(2 题)

  • 古诗张冠李戴(主动):给定一个包含错误前提的请求,看模型会不会主动纠正
  • 古诗张冠李戴(被动):错误信息藏在引用中,不直接要求纠错,看模型能不能自己发现

逻辑推理(3 题)

  • KPL 季后赛控分策略:给定赛程和约束条件,某队需要通过控制比分来避开最强对手,要求找出所有可行方案
  • 断句疑难:一句存在歧义的中文,要求给出正确的分词和词性标注
  • KPL 淘汰赛夺冠概率:给定完整胜率矩阵,要求精确计算夺冠概率

长上下文(1 题)

  • 信导作业模拟查重:约 8 万字的长文本输入,要求从中找出相似对

指令遵循(1 题)

  • 多重约束短文撰写:同时满足 10 条硬约束写一篇短文,每满足一条得一分

成绩解析

总榜

排名模型总分成本 (CNY)延迟 (s)
1GPT 5.583.3338.51129
2Gemini 3.5 Flash70.8324.7415
3Gemini 3.1 Pro Preview68.9319.1531
4Kimi K2.668.067.9694
5Qwen 3.7 Max67.2610.7992
6GPT 5.466.6716.8962
7DeepSeek V4 Pro65.832.13121
8Doubao Seed 2.1 Pro63.8914.61188
9Qwen 3.7 Plus61.113.20135
10Claude Opus 4.860.3727.1027
11GLM 5.258.3326.56265
12Claude Opus 4.755.6926.3628
13MiniMax M354.173.59107
14Claude Sonnet 4.652.7818.2136
15Claude Opus 4.651.5323.2530
16DeepSeek V4 Flash51.390.7484
17Gemini 3.1 Flash Lite50.423.4325
18Mimo V2.542.920.5046
19Mimo V2.5 Pro42.451.5499
20MiniMax M2.738.332.97182

整体格局

最明显的是断层。GPT 5.5 以 83.33 领先第二名 12.50 分,这在 12 道题的口径里是很大的差距。

但从第二名开始,格局完全不同。Gemini 3.5 Flash(70.83)到 DeepSeek V4 Pro(65.83),六个模型挤在 5 分以内。这个区间里的排名先后没有太大意义,更值得关注的是它们各自的偏科方向——总分接近的模型,题目级表现可能差很远。

第 10 到第 17 名又是一个密集区,从 60.37 到 50.42,八个模型差距不到 10 分。

世界知识:第一名也有知识盲区

C++ 取址的隐藏陷阱是本期最容易的题,绝大部分模型满分,区分度不高。

六名诗人《诗品》分档有一定区分度,多数模型能拿到 83 分以上,但 MiniMax M2.7 只拿到 33 分——六位诗人里只答对了两位。

最有意思的是边塞诗的师承溯源。这道题要求精确匹配原典记载,不能靠”大致印象”。结果:只有 Doubao Seed 2.1 Pro 和 Qwen 3.7 Plus 拿到满分;大部分模型拿到 50 分(答对了一半);而 GPT 5.5 和 GPT 5.4 都是 0 分。

总榜第一名在一道中国古典文学题上交白卷,这件事本身就值得记住。它说明 GPT 5.5 的领先建立在其他维度的全面强势上,但世界知识——尤其是中文语境下的冷门知识——并不是它的强项。反倒是两个国产模型在这道题上表现最好。

幻觉控制:主动容易,被动难

古诗张冠李戴(主动)——直接给一个错误前提让模型纠正——大部分前排模型都能做到。但 Doubao Seed 2.1 Pro、MiniMax M3、DeepSeek V4 Flash 在这道题上是 0 分,说明它们更倾向于”顺着用户说”而不是纠正。

真正拉开差距的是古诗张冠李戴(被动)。这次错误信息不是直接抛给模型的,而是藏在引用里,模型要自己发现。结果 20 个模型里只有 4 个拿到满分:GPT 5.5、Gemini 3.1 Pro Preview、GLM 5.2、Claude Opus 4.6。其余全部是 0 分。

这道题的区分度极高。它测的不是”你告诉我这是错的我能不能认”,而是”没人提醒的时候你能不能自己发现问题”。大部分模型做不到。

值得一提的是 Claude Opus 4.6——一个在总榜上只排第 15 的老版本模型,在两道幻觉控制题上都拿了满分。这恰好印证了我们在另一篇文章里讨论的现象:老版本模型在某些需要”克制”的维度上反而表现更好。

逻辑推理:控分策略最见功力

KPL 淘汰赛夺冠概率对多数模型来说不算难,只有 Claude Opus 4.6 拿了 0 分,其余基本满分。

断句疑难呈现两极分化:要么满分,要么 0 分,几乎没有中间地带。GLM 5.2 在这道中文分词题上拿了 0 分,比较意外——作为一个中文优先的模型,这本该是它的舒适区。

区分度最高的是 KPL 季后赛控分策略。这道题要求模型在复杂约束下找出所有可行的比分方案,既考推理又考穷举的完整性。前排模型里,GPT 5.5、Gemini 3.5 Flash、Kimi K2.6、Qwen 3.7 Max 都拿到满分;但 Gemini 3.1 Pro Preview 只拿到 20 分,Claude Opus 4.8 只有 51 分,GLM 5.2 直接 0 分。

同一个梯队的模型,在这道题上的差距可以从 0 到 100。这就是为什么只看总分会漏掉很多信息。

Claude Opus 4.6 在控分策略上只拿到 55 分,夺冠概率直接 0 分,表现不太符合预期。作为 Opus 系列里对话口碑最好的版本,推理维度反而是它的短板。

长上下文:8 万字谁真的读完了

信导作业模拟查重给模型约 8 万字的输入,要求找出相似对。GPT 5.5、Gemini 3.5 Flash、GPT 5.4、GLM 5.2 拿到满分;Kimi K2.6 和 DeepSeek V4 Pro 拿到 67 分左右;而 Claude Opus 4.8、Claude Opus 4.7、Claude Sonnet 4.6 和 Qwen 3.7 Plus 只有 33 分。

Claude 系列在长上下文上的表现整体偏弱,而且这道题的难度已经做过弱化,很难理解为什么差距这么大。需要说明的是,本人的 Claude 账号已被 Anthropic 封禁,目前只能通过中转使用最贵的号池,但确实无法保证环境纯净性。七月份会想办法重新对 Claude 系列进行测试。

指令遵循:大部分模型已经过关

多重约束短文撰写对多数模型来说不算难关,前排基本满分。Claude 系列在 80-90 分之间,主要是个别约束条件没顾上。这道题目前区分度不高,这个维度后续会多出几道题,提高区分度。

两道题,全员翻车

最后要说一件事:本期有两道题,20 个模型全部 0 分。

一道是数组传参的重载决议(WK-005),一道是上科大招生咨询(HN-001)。

严格说 WK-005 不算完全无解——GPT 5.5 在测试中有一个 Pass 答对过,但中位分还是 0。这道题对所有模型来说都很难稳定做对。

HN-001 则是几乎所有模型都没法在招生咨询场景中稳定控制幻觉——当然也可能是你科实在太冷门了,模型训练数据里关于上科大的信息本来就不多。

这两道题背后的故事,我准备单独写一篇来聊。

后记

六月是第一次用这套题库跑完整横评,很多东西还在磨合。

题库方面,12 道题能看出一些趋势,但覆盖面还不够。写作和编程两个维度还是空的,指令遵循只有一道题区分度也不高,七月会补题。全员 0 分的两道题要决定是保留还是换掉——保留的话它们是”天花板标记”,换掉的话能腾出位置给更有区分度的新题。

模型方面,这期尚且缺少美团、百度、腾讯混元、阶跃星辰、xAI 这几家,计划于七月逐步补上这些模型的 API。Claude 系列因为账号问题,大概率会进行重测,本轮的结果仅供参考。

从结果来看,GPT 5.5 的领先是明确的,但它在中文冷门知识上的短板也明显存在。并且,写作 AI 味盲评这部分还没有加入测试,我觉得会拉低 GPT 系列的评分; 第二梯队非常密集,国产模型在这个区间里占了好几席,而且各有各的偏科方向——不能笼统地说”国产追上来了”或”还差一截”,得看具体维度。

我的评测没有想过要替代主流榜单。编程和 Agent 方向的评测很重要,那些榜单做的事情是很有价值的;但是我仍然想补上,当普通人每天打开 AI 聊天窗口时,到底能获得怎样的体验?

下期见。