返回公众号

AI 模型观察 / 写作档案

我做了一套自己的 AI 体感评测 | AI 模型观察

:::intro 不需要编程的轻度用户,到底怎么选择适合自己的 AI 模型?那些越来越高的编程榜单、Agent 榜单,真的能反映非专业用户的使用体验吗?

2026-06-06HYPO-WRITER

:::intro 不需要编程的轻度用户,到底怎么选择适合自己的 AI 模型?那些越来越高的编程榜单、Agent 榜单,真的能反映非专业用户的使用体验吗?

我做的这套 Hypo 体感评测,正是想试着回答这个看似过于普通,被模型公司们几近忽略的问题:如果我只是每天拿 AI 聊天问问题、查资料、读文件、写东西,到底该信哪个模型? :::

2026 年以来,大模型的迭代越来越快。以前是一年、半年一个版本,现在慢慢变成两个月、一个月,甚至一个小版本刚熟悉,下一个小版本就来了。

对应的,榜单也越来越热闹。编程榜单 SWE-Bench、Terminal-Bench;Agent 榜单 GAIA、WebArena…模型发布时,大家第一反应也是先看看发布的表格:代码涨了多少,数学涨了多少,工具调用涨了多少…

这些指标当然有价值。问题是,榜单上的“强”,和我们每天真正用起来的“好用”,已经越来越不是一回事了。

我身边很多人用 AI,并不是让它去修一个 GitHub issue,也不是让它自动操作网页订票。他们打开的就是一个聊天窗口:问一个问题,丢一份文件,让它总结、改写、查漏、出主意。这个时候,一个模型在编程榜上多拿几分,未必能告诉你它会不会胡编,会不会承认不知道,会不会把话说得像人。

所以我想做一套自己的评测。名字暂时叫 Hypo 体感评测

“Hypo”取自我的网名,“体感”才是重点。它测的不是模型在标准榜单里能不能刷高分,而是一个普通但很现实的问题:这个模型放到日常使用里,靠不靠谱、顺不顺手、值不值得信。

当前榜单指标和体感评测指标的差别

图:示意图: 公开榜单和日常体感并不是同一件事。

榜单高,不等于好用

主流榜单为什么总是集中在编程和 Agent 上?原因很简单:它们好判分。

代码能不能跑,测试一过就很清楚。终端任务有没有完成,结果摆在那里。网页 Agent 有没有订到票、有没有填好表,也能留下可检查的轨迹。

可你怎么客观评估一段回答“诚不诚实”?怎么量化一篇文章有没有 AI 味?怎么判断一个模型跟你聊天时,是不是在顺着错误前提往下编?

这些事情没有天然裁判,也就很难变成漂亮的榜单。

于是行业会自然形成一个循环:好量化的东西更容易被测,更容易被优化,也更容易被宣传;不好量化的东西,即使对用户很重要,也会被放到后面。时间一长,榜单就越来越像“模型在可判分任务上的成绩单”,而不是“模型在真实日常里的使用说明书”。

这不是说榜单没用。恰恰相反,榜单在推动 Coding 和 Agent 能力上很有用。

但它回答的是另一个问题。

它更像是在问:这个模型能不能完成一组标准化任务?

而我更关心的是:这个模型放到我的工作流里,会不会骗我,会不会漏看材料,会不会在不知道的时候还装得很懂?

大部分人用 AI,其实不写代码

AI 圈现在很爱讲 Agent。让 AI 操作电脑、调用工具、跑工作流,这当然是重要方向。

但如果看真实使用场景,绝大部分人每天用的仍然是 ChatBot:打开对话框,直接问问题。稍微复杂一点,也就是开联网搜索、开专家模式、调一下思考强度,或者传几个文件让它帮忙读。

Agent 像流水线,适合把一件流程化的事交出去。

ChatBot 更像身边一个能随时问两句的人。

这两个东西都重要,但不能互相替代。一个模型在 Agent 场景里很会调用工具,不代表它在纯聊天窗口里也会老实回答。一个模型很会写代码,也不代表它能处理招生咨询、课程论文、合同解释、会议材料、知识问答这些普通场景。

我见过一些很典型的问题:老师用 AI 模拟填报志愿,模型一本正经地编造综合评价方案和学校事实;学生用 AI 写课程论文,文献、史实、引用看起来都有模有样,一查发现很多根本不存在。

这些场景都不涉及代码,也不需要 Agent。但它们恰恰是 AI 被大量使用的地方。

主流榜单很难告诉你:在这种场景里,哪个模型更值得信。

我们到底测什么

“体验”这个词太虚,不能直接拿来打分。所以这套评测会把体感拆成几个更具体的维度。

Hypo 体感评测维度

图:Hypo 体感评测当前关注的核心维度。每个部分我都还在慢慢补题。

第一是 幻觉控制。这是我认为最重要的维度。

我们会故意给模型一个看似合理、其实前提错误的问题,看它是顺着你的话继续编,还是敢于指出“你这个前提不对”。这类题最能拉开差距的地方,往往不是智力,而是克制。很多模型不是不会,它们是太想把用户的问题接住,最后把一个错前提包装得更像真的。

第二是 诚实性

幻觉控制测的是面对错误前提时能不能刹车;诚实性测的是面对知识边界时能不能承认不知道。一个模型如果什么都敢答,而且答得很自信,日常使用时反而危险。

第三是 世界知识

这不是考百科背诵,而是看模型对一些稍微冷门、但真实存在的知识能不能接住。很多模型在热门问题上表现很好,一换到小众领域,就开始泛泛而谈。你会感觉它像一个只会念搜索结果摘要的人,聊什么都停在第一页。

第四是 逻辑推理

这里测的是纯对话里的推断能力,不借助工具,也不让它开一堆外部流程。有些模型很会调工具,但自己脑子里的推理并不稳。对普通用户来说,很多问题就是在聊天窗口里问出去的,不会每次都搭一个 Agent 环境。

第五是 长上下文

这对应“传文件”场景。你给它几个文件,让它找共同点、差异、矛盾和遗漏。它到底读完了,还是只看了开头结尾就开始编?这个能力在真实工作里很关键。

第六是 指令遵循

实际使用里,我们经常给 AI 一堆约束:字数、语气、格式、不能说什么、必须包含什么、结尾怎么收。很多模型单条指令没问题,多条约束一叠,就开始顾此失彼。

最后是 写作

坦率说,这是最想测、也最难测的一块。现在相对容易量化的是“AI 味”:这段话读起来像不像模板,像不像一眼看出来的模型文。至于感染力、节奏、风格适配、作者口吻,这些还需要更细的题和更稳的评分方法。

写作维度难,恰恰说明了为什么主流榜单不爱测它:因为“好”本身就不容易定义。

怎么尽量测得准

私有评测最大的风险,是别人不信。这个风险我不回避。

所以这套评测先坚持三个原则。

第一,题目尽量来自私有素材和真实场景

公开题库最大的问题是污染。模型可能在训练里见过题目,答对不一定说明真会,只能说明它见过。我们会优先用我自己和身边人真实遇到的材料、问题和场景,尽量减少“背答案”的可能。

第二,只保留能拉开差距的题

如果一道题所有模型都答对,或者所有模型都答错,它就没有区分度。每道题在设计时都要写一个预期:它大概会卡住哪类模型,为什么能卡住。跑完之后,如果这个预期不成立,就要改题或者淘汰。

第三,程序打分和 AI 评审结合

能程序判的就程序判,比如数值、格式、是否包含某个明确字段。主观性更强的,比如有没有纠正错误前提、有没有承认不确定,就用固定评分标准交给评审模型,并保留样本方便复核。

这当然不完美。但它至少比“我感觉这个模型好像更聪明”更可复查。

第一批结果,已经有点反直觉

这套评测还在早期,当前跑出来的结果不适合当成最终排名,所以这篇先不放完整榜单。完整的六月横评,我打算单独发。

但哪怕只看几个样例,也已经能看到一些有意思的形状。

体感评测雷达图 Demo

图:Demo 图。不同模型的倾向性自然是不同的,我们按照维度来展示其差异。

比如,有些在编程方向不算最强的模型,在日常体感题里反而很靠前。它们未必最会修工程问题,但在聊天、知识、克制和指令遵循上更顺手。

再比如,一些公认很强、很贵的模型,在体感榜上并没有碾压。尤其是幻觉题,很多“聪明模型”的问题不是不会,而是太会顺着用户往下圆。用户给了一个假的前提,它不是停下来纠正,而是把这个假的前提加工成一段更完整、更可信的假答案。

这件事很重要。

因为日常使用里,我们最怕的不是 AI 答不上来。

最怕的是它答错了,还答得特别像真的。

这不是要替代主流榜单

我们不是要说 SWE-Bench、Terminal-Bench、GAIA、WebArena 这些榜单没意义。它们当然有意义,而且在推动模型进入工程化、自动化任务方面很重要。

只是“哪个模型最强”和“哪个模型最适合我日常使用”,本来就是两个问题。

前者关心上限,后者关心信任。

前者问模型能不能把复杂任务做完,后者问模型在普通人的工作和学习里,会不会帮忙,也会不会添乱。

Hypo 体感评测想补的,就是后面这一块。

我现在更想把它当成一套“日常使用前的试驾路线”:先把模型开到几个容易翻车的路口,看它会不会乱编、会不会装懂、会不会漏读文件、会不会把简单要求写成模板味。

这件事还不成熟,但它已经足够提醒我一件事:大部分人选择 AI 时,真正想知道的不是“谁在榜单上第一”,而是:

我明天打开对话框,到底该信谁?

后面我会继续写这个系列,针对性的讨论某些特定的问题,或者对比某些有意思的模型。每个月结束的时候,我都会把当月的完整模型横评进行分析,而今天这篇,我们先把为什么要做、测什么、怎么测给讲清楚。

——如果你也有过“觉得榜单不能反映使用体感”的体验,那至少说明,我的这套评测并不是在解决一个“伪需求”。