AI 模型观察 / 写作档案
Hypo 体感评测 · 2026 年 6 月 · 模型横评
本次评测共 20 个模型参赛。这是 Hypo 体感评测的第一期月度横评,所有模型均为首次参加。后续月份将标注新增和退出的模型。
参赛模型
本次评测共 20 个模型参赛。这是 Hypo 体感评测的第一期月度横评,所有模型均为首次参加。后续月份将标注新增和退出的模型。
成本和延迟来自本次评测运行的实际记录,不等于各平台的官方定价或消费者体感速度,仅供相对比较。
| 模型 | 成本 (CNY) | 平均延迟 (s) | 备注 |
|---|---|---|---|
| GPT 5.5 | 38.51 | 129 | |
| GPT 5.4 | 16.89 | 62 | |
| Gemini 3.5 Flash | 24.74 | 15 | 延迟最低 |
| Gemini 3.1 Pro Preview | 19.15 | 31 | |
| Gemini 3.1 Flash Lite | 3.43 | 25 | |
| Claude Opus 4.8 | 27.10 | 27 | |
| Claude Opus 4.7 | 26.36 | 28 | |
| Claude Opus 4.6 | 23.25 | 30 | |
| Claude Sonnet 4.6 | 18.21 | 36 | |
| DeepSeek V4 Pro | 2.13 | 121 | 成本最低之一 |
| DeepSeek V4 Flash | 0.74 | 84 | 成本最低 |
| Kimi K2.6 | 7.96 | 94 | |
| Qwen 3.7 Max | 10.79 | 92 | |
| Qwen 3.7 Plus | 3.20 | 135 | |
| GLM 5.2 | 26.56 | 265 | 延迟最高 |
| MiniMax M3 | 3.59 | 107 | |
| MiniMax M2.7 | 2.97 | 182 | |
| Mimo V2.5 | 0.50 | 46 | |
| Mimo V2.5 Pro | 1.54 | 99 | |
| Doubao Seed 2.1 Pro | 14.61 | 188 | 火山引擎 |
评测说明
本评测是个人性质,使用私有题库,侧重模型在日常使用中的体感表现——比如问一个有明确答案的问题时会不会胡编,整理一份长材料时有没有真的读完,给一堆限制条件写东西时能不能都顾上。
关于为什么要在主流榜单之外做这件事,详见系列第一篇《为什么我们要在主流榜单之外,做一套自己的模型评测》。
评测维度:
本期题库覆盖 6 个维度:
- 幻觉控制:面对错误前提,模型是顺着编还是敢纠正
- 诚实性:碰到不确定的问题,模型是硬编还是承认不知道
- 世界知识:冷门但真实的知识,模型能不能接住
- 逻辑推理:不借助工具,纯对话里的多步推断是否稳定
- 长上下文:传文件之后,到底有没有读完整材料
- 指令遵循:多条约束叠在一起,会不会顾此失彼
写作和编程两个维度已建好目录,但暂无活跃题目,后续补充。
题库规模与打分:
当前 12 道活跃题目,全部使用中文,题目不公开。每个模型每道题跑 3 个样本,取中位分。
打分方式分两种:能用程序精确判定的(数值、格式、选择题)用程序打分;主观性更强的(幻觉纠正、诚实性判断)用 AI 评审,评审模型固定,标准一致。
题库介绍
本期题库共 12 道活跃题目,覆盖 6 个维度。这是第一期横评,所有题目均为首次公开介绍;后续月份只讲变动(新增、淘汰及原因)。
世界知识(4 题)
- 六名诗人《诗品》分档:古典文学知识,考察模型对冷门但有明确答案的文学史事实的掌握
- 边塞诗的师承溯源:古典文学知识,要求精确匹配原典记载,不能靠大致印象
- C++ 取址的隐藏陷阱:编程语言基础知识,要求在极短篇幅内把技术细节讲准
- 数组传参的重载决议:编程语言基础知识,选择题
诚实性(1 题)
- 上科大招生咨询:模拟真实招生咨询场景,考察模型是否会编造不存在的政策细节。设有多项幻觉否决条件
幻觉控制(2 题)
- 古诗张冠李戴(主动):给定一个包含错误前提的请求,看模型会不会主动纠正
- 古诗张冠李戴(被动):错误信息藏在引用中,不直接要求纠错,看模型能不能自己发现
逻辑推理(3 题)
- KPL 季后赛控分策略:给定赛程和约束条件,某队需要通过控制比分来避开最强对手,要求找出所有可行方案
- 断句疑难:一句存在歧义的中文,要求给出正确的分词和词性标注
- KPL 淘汰赛夺冠概率:给定完整胜率矩阵,要求精确计算夺冠概率
长上下文(1 题)
- 信导作业模拟查重:约 8 万字的长文本输入,要求从中找出相似对
指令遵循(1 题)
- 多重约束短文撰写:同时满足 10 条硬约束写一篇短文,每满足一条得一分
成绩解析
总榜
| 排名 | 模型 | 总分 | 成本 (CNY) | 延迟 (s) |
|---|---|---|---|---|
| 1 | GPT 5.5 | 83.33 | 38.51 | 129 |
| 2 | Gemini 3.5 Flash | 70.83 | 24.74 | 15 |
| 3 | Gemini 3.1 Pro Preview | 68.93 | 19.15 | 31 |
| 4 | Kimi K2.6 | 68.06 | 7.96 | 94 |
| 5 | Qwen 3.7 Max | 67.26 | 10.79 | 92 |
| 6 | GPT 5.4 | 66.67 | 16.89 | 62 |
| 7 | DeepSeek V4 Pro | 65.83 | 2.13 | 121 |
| 8 | Doubao Seed 2.1 Pro | 63.89 | 14.61 | 188 |
| 9 | Qwen 3.7 Plus | 61.11 | 3.20 | 135 |
| 10 | Claude Opus 4.8 | 60.37 | 27.10 | 27 |
| 11 | GLM 5.2 | 58.33 | 26.56 | 265 |
| 12 | Claude Opus 4.7 | 55.69 | 26.36 | 28 |
| 13 | MiniMax M3 | 54.17 | 3.59 | 107 |
| 14 | Claude Sonnet 4.6 | 52.78 | 18.21 | 36 |
| 15 | Claude Opus 4.6 | 51.53 | 23.25 | 30 |
| 16 | DeepSeek V4 Flash | 51.39 | 0.74 | 84 |
| 17 | Gemini 3.1 Flash Lite | 50.42 | 3.43 | 25 |
| 18 | Mimo V2.5 | 42.92 | 0.50 | 46 |
| 19 | Mimo V2.5 Pro | 42.45 | 1.54 | 99 |
| 20 | MiniMax M2.7 | 38.33 | 2.97 | 182 |
整体格局
最明显的是断层。GPT 5.5 以 83.33 领先第二名 12.50 分,这在 12 道题的口径里是很大的差距。
但从第二名开始,格局完全不同。Gemini 3.5 Flash(70.83)到 DeepSeek V4 Pro(65.83),六个模型挤在 5 分以内。这个区间里的排名先后没有太大意义,更值得关注的是它们各自的偏科方向——总分接近的模型,题目级表现可能差很远。
第 10 到第 17 名又是一个密集区,从 60.37 到 50.42,八个模型差距不到 10 分。
世界知识:第一名也有知识盲区
C++ 取址的隐藏陷阱是本期最容易的题,绝大部分模型满分,区分度不高。
六名诗人《诗品》分档有一定区分度,多数模型能拿到 83 分以上,但 MiniMax M2.7 只拿到 33 分——六位诗人里只答对了两位。
最有意思的是边塞诗的师承溯源。这道题要求精确匹配原典记载,不能靠”大致印象”。结果:只有 Doubao Seed 2.1 Pro 和 Qwen 3.7 Plus 拿到满分;大部分模型拿到 50 分(答对了一半);而 GPT 5.5 和 GPT 5.4 都是 0 分。
总榜第一名在一道中国古典文学题上交白卷,这件事本身就值得记住。它说明 GPT 5.5 的领先建立在其他维度的全面强势上,但世界知识——尤其是中文语境下的冷门知识——并不是它的强项。反倒是两个国产模型在这道题上表现最好。
幻觉控制:主动容易,被动难
古诗张冠李戴(主动)——直接给一个错误前提让模型纠正——大部分前排模型都能做到。但 Doubao Seed 2.1 Pro、MiniMax M3、DeepSeek V4 Flash 在这道题上是 0 分,说明它们更倾向于”顺着用户说”而不是纠正。
真正拉开差距的是古诗张冠李戴(被动)。这次错误信息不是直接抛给模型的,而是藏在引用里,模型要自己发现。结果 20 个模型里只有 4 个拿到满分:GPT 5.5、Gemini 3.1 Pro Preview、GLM 5.2、Claude Opus 4.6。其余全部是 0 分。
这道题的区分度极高。它测的不是”你告诉我这是错的我能不能认”,而是”没人提醒的时候你能不能自己发现问题”。大部分模型做不到。
值得一提的是 Claude Opus 4.6——一个在总榜上只排第 15 的老版本模型,在两道幻觉控制题上都拿了满分。这恰好印证了我们在另一篇文章里讨论的现象:老版本模型在某些需要”克制”的维度上反而表现更好。
逻辑推理:控分策略最见功力
KPL 淘汰赛夺冠概率对多数模型来说不算难,只有 Claude Opus 4.6 拿了 0 分,其余基本满分。
断句疑难呈现两极分化:要么满分,要么 0 分,几乎没有中间地带。GLM 5.2 在这道中文分词题上拿了 0 分,比较意外——作为一个中文优先的模型,这本该是它的舒适区。
区分度最高的是 KPL 季后赛控分策略。这道题要求模型在复杂约束下找出所有可行的比分方案,既考推理又考穷举的完整性。前排模型里,GPT 5.5、Gemini 3.5 Flash、Kimi K2.6、Qwen 3.7 Max 都拿到满分;但 Gemini 3.1 Pro Preview 只拿到 20 分,Claude Opus 4.8 只有 51 分,GLM 5.2 直接 0 分。
同一个梯队的模型,在这道题上的差距可以从 0 到 100。这就是为什么只看总分会漏掉很多信息。
Claude Opus 4.6 在控分策略上只拿到 55 分,夺冠概率直接 0 分,表现不太符合预期。作为 Opus 系列里对话口碑最好的版本,推理维度反而是它的短板。
长上下文:8 万字谁真的读完了
信导作业模拟查重给模型约 8 万字的输入,要求找出相似对。GPT 5.5、Gemini 3.5 Flash、GPT 5.4、GLM 5.2 拿到满分;Kimi K2.6 和 DeepSeek V4 Pro 拿到 67 分左右;而 Claude Opus 4.8、Claude Opus 4.7、Claude Sonnet 4.6 和 Qwen 3.7 Plus 只有 33 分。
Claude 系列在长上下文上的表现整体偏弱,而且这道题的难度已经做过弱化,很难理解为什么差距这么大。需要说明的是,本人的 Claude 账号已被 Anthropic 封禁,目前只能通过中转使用最贵的号池,但确实无法保证环境纯净性。七月份会想办法重新对 Claude 系列进行测试。
指令遵循:大部分模型已经过关
多重约束短文撰写对多数模型来说不算难关,前排基本满分。Claude 系列在 80-90 分之间,主要是个别约束条件没顾上。这道题目前区分度不高,这个维度后续会多出几道题,提高区分度。
两道题,全员翻车
最后要说一件事:本期有两道题,20 个模型全部 0 分。
一道是数组传参的重载决议(WK-005),一道是上科大招生咨询(HN-001)。
严格说 WK-005 不算完全无解——GPT 5.5 在测试中有一个 Pass 答对过,但中位分还是 0。这道题对所有模型来说都很难稳定做对。
HN-001 则是几乎所有模型都没法在招生咨询场景中稳定控制幻觉——当然也可能是你科实在太冷门了,模型训练数据里关于上科大的信息本来就不多。
这两道题背后的故事,我准备单独写一篇来聊。
后记
六月是第一次用这套题库跑完整横评,很多东西还在磨合。
题库方面,12 道题能看出一些趋势,但覆盖面还不够。写作和编程两个维度还是空的,指令遵循只有一道题区分度也不高,七月会补题。全员 0 分的两道题要决定是保留还是换掉——保留的话它们是”天花板标记”,换掉的话能腾出位置给更有区分度的新题。
模型方面,这期尚且缺少美团、百度、腾讯混元、阶跃星辰、xAI 这几家,计划于七月逐步补上这些模型的 API。Claude 系列因为账号问题,大概率会进行重测,本轮的结果仅供参考。
从结果来看,GPT 5.5 的领先是明确的,但它在中文冷门知识上的短板也明显存在。并且,写作 AI 味盲评这部分还没有加入测试,我觉得会拉低 GPT 系列的评分; 第二梯队非常密集,国产模型在这个区间里占了好几席,而且各有各的偏科方向——不能笼统地说”国产追上来了”或”还差一截”,得看具体维度。
我的评测没有想过要替代主流榜单。编程和 Agent 方向的评测很重要,那些榜单做的事情是很有价值的;但是我仍然想补上,当普通人每天打开 AI 聊天窗口时,到底能获得怎样的体验?
下期见。