benchmark 分数和干活能力,越来越是两回事了
gpt 5.4 发布那天,我把它的 benchmark 成绩翻了一遍,横扫,数字确实漂亮。看完的第一反应是拿个真题去跑一下。过去一年我在 gpt 和 claude 上烧了 30 亿多 token,95% 都是 agentic coding——claude code 和 codex 两边一起用,所以两边的手感我都有。benchmark 考的都是标准化的小题,我想知道的是另一件事:同一个真实的、很乱的、好几个维度搅在一起的产品问题,扔给两个模型,输出到底能差多少。
正好做 Mio 的时候碰到一个关键抉择:是继续走人设角色扮演的路线(每个角色有背景故事、有职业、有作息),还是转成通用的 AI 陪伴。这个不是编程题,是产品战略,要同时做市场研究、竞品分析、心理学、产品设计,还要评估工程上怎么改。
具体的测法大概是这样的:我在 claude code(opus 4.6)和 codex(gpt 5.4)里敲了一模一样的 prompt。中英混杂,开发者自言自语那种风格,很长也很乱——人真的在想难题的时候就是这个样子,没排版,也没有「请结构化回复」。两个模型都能访问 Mio 的 codebase,全部默认设置,同一个问题给两个不同的大脑。
gpt 5.4 在 codex 中的输出
gpt 5.4 在 codex 中的回复——对 codebase 的感知强,市场研究偏浅
先说 gpt 5.4。代码读得很准,引用到了具体文件——docs/PRODUCT.md:25、apps/mobile/app/onboarding/[presetId].tsx:442、apps/server/src/api/chat.ts:482,知道东西在哪,引用也没毛病。大方向的结论也是对的:从「真人 roleplay」走成「AI-native companion」。有一句产品定义我觉得说得挺好:「不是某个地方真实存在的人,是明确为你而存在的 AI companion。」它还提了一个框架,"low human realism + high emotional specificity"(低真人感 + 高情感特异性),挺好用的一个速记。
但紧接着它就开始对冲了,「我唯一保留的不确定性是……」这种。严谨是很严谨,问题是我这个时候要的是决策支撑,保留意见帮不上什么忙。
整体输出以大段文字为主,表格少,数字少,外部来源大概引用了 10 个。代码读得好,但市场研究和心理学这块没往深了做。只能说,gpt 5.4 给的是一个好顾问的第一轮意见。
opus 4.6 在 claude code 中的输出
opus 4.6 在 claude code 中的回复——结构化研究,含市场数据、心理学框架和详细产品规格
opus 走的完全是另一条路。它没急着回答我的问题,自己先跑出去做了一轮调研。
第一个是市场数据,带数字的那种。直接甩了一张对比表出来:
| 指标 | Character.AI(人设模式) | 通用 AI 助手 |
|---|---|---|
| 次日留存 | 50-60% | ~5% |
| 日均使用时长 | 1.5-2.7 小时 | 分钟级 |
| 转化率 | ~25% | 2-5% |
注意这里给的是具体数字,不是「人设类 app 留存通常更好」这种概括。具体数字可以直接拿去做决策,概括性陈述我还得自己再去查一遍。
第二个是 Pi.ai 的前车之鉴。我在考虑的「去人设」方向,Pi.ai 就是现成的前例,opus 自己把它挖了出来,还告诉我它为什么凉了:对话质量的正面评价比 ChatGPT 高 75%,但 Inflection AI 还是被微软收了,Pi 基本没了。没有人格,差异化就不足,留存就撑不住。拿掉 Mio 的人设,等于在 Pi.ai 已经证明「光温暖不够」的市场里再走一遍。这个竞品分析我没要求它做,它自己跑去找的。
第三个是心理学框架。它列了学术研究里人对 AI 产生情感依附的 5 个关键因素:
- 感知到的情感回应性——AI 好像「懂」你
- 无评判的陪伴可用性——随时在,从不批评
- 记忆与连续性——记得你们的对话和过往
- 自我披露的互惠性——也会分享关于「自己」的事
- 可预测性 + 温暖感——一致的人格,让人安心
这个列表里有一点我觉得很关键:以上五条,没有一条需要「她在成都工作,每天早上 9 点起床」。也就是说,不编造虚假身份,这五个因素一个都不会少。
最值钱的是它把决策本身重新拆了一遍:不再是「要人设 vs 不要人设」,而是两个独立的维度——人格(沟通风格、情感模式、温暖感),这个必须保留;现实世界身份(职业、住址、作息、背景故事),这个可以扔掉。两个维度是正交的,你完全可以有一个人格鲜明、情感丰富的角色,同时不假装它是住在成都每天挤地铁的真人。制造违和感的是那个虚构出来的物理存在,人格本身没这个问题。
把「要不要人设」这一个决策拆成两个正交维度:人格保留、现实身份丢掉
这个拆解直接改变了我对 Mio 转型的想法:问题从「该不该保留人设」变成「人设的哪些维度创造依附感,哪些制造违和感」,可操作性完全不一样。
opus 到这儿还没停,后面接着输出了具体的 UI 布局、配色方案(黑/白/深灰)、情感到光球的映射系统、v0 到 v2 的分版本路线图、中国市场的数据(星野 446 万月活),还有 15 个带 URL 的引用来源。代码这边也做了复用分析:哪些模块能复用、哪些要改、哪些能删。
gpt 5.4 不差。方向判断是对的,codebase 读得准,产品直觉也没问题。如果 opus 不存在,我拿到 gpt 的输出会挺满意,直接往下干活了。但两个放在一起看差距挺大,opus 交出来的干脆是另一个品类的输出。
| 维度 | gpt 5.4 | opus 4.6 |
|---|---|---|
| codebase 感知 | 强——引用具体文件和行号 | 强——映射可复用模块 |
| 战略方向 | 正确 | 正确 |
| 市场数据 | 浅——概括性陈述 | 深——表格 + 具体指标 |
| 竞品分析 | 提到了竞品 | 找到精确前例(Pi.ai)及其失败模式 |
| 研究深度 | ~10 个来源 | 15+ 个来源带 URL |
| 心理学支撑 | "情感特异性"(好直觉) | 5 因素学术框架 |
| 结构化思维 | 段落文字 | 表格、框架、正交分解 |
| 可操作性 | "你应该转型" | 具体 UI 规格、配色、路线图、模块映射 |
| 中国市场 | 提到了 | 具体数据(星野 446 万月活) |
然后回头看 benchmark 到底说了什么。gpt 5.4 发布当天的数字确实漂亮:
| benchmark | gpt 5.4 | opus 4.6 | 差值 |
|---|---|---|---|
| OSWorld-Verified(桌面导航) | 75.0% | 72.7% | +2.3 |
| GDPval(知识工作) | 83.0% | 78.0% | +5.0 |
| GPQA Diamond(推理) | 94.4% | 91.3% | +3.1 |
| BigLaw Bench(法律) | 91.0% | 90.2% | +0.8 |
| Toolathlon(工具使用) | 54.6% | 44.8% | +9.8 |
| BrowseComp(网页浏览) | 82.7% | — | — |
| SWE-Bench Verified(编码) | — | 80.8% | — |
| ARC-AGI-2(新颖推理) | — | 68.8% | — |
gpt 5.4 赢了 5 个类别,gemini 3.1 pro 赢 4 个,opus 赢 3 个,纸面上 gpt 5.4 就是 benchmark 冠军。但我上面刚跑完一个真实任务,benchmark 冠军的输出明显更弱。为什么会这样?
跑分榜和真实干活能力正在分叉——纸面冠军 gpt 5.4 反而在真实任务里更弱
我觉得是 benchmark 这套评估方法本身出了问题,不止「特定任务测不到」这么简单。大概有这么几条:
- 考卷已经饱和了。头部模型在 MMLU 上 88%+,GSM8K 上 99%,所有人都考 A+,这张卷子就没有区分度了。
- 分数和实战经常对不上。Stanford HAI 和 Confident AI 的研究发现,评测里 90 多分的 agent,放到生产环境经常掉到 60 多分。代码生成更夸张,合成 benchmark 上表现很好,到真实 codebase 上准确率直接崩到个位数。
- 考题泄露了。有独立分析发现,SWE-bench 大约三分之一的 issue,报告或评论里直接就包含解决方案;另外三分之一的测试不足以检测错误修复。三分之一的题答案就印在旁边,这个分数你能信多少?
- 有现成的反例。gemini 3 pro 在 2025 年 11 月加冕 benchmark 冠军,两个月之内,前沿编码的工作里基本就没人用它了。Nathan Lambert 在 Interconnects 上直接说,这是 benchmark 预测力失败最清晰的案例:纸面上赢了,实战里输了。他这个观察我觉得挺准的。
- 连裁判都不太靠谱。LLM-as-Judge 的模式下,同样的回答互换一下位置,判断一致性只有 6/10;光靠位置操纵,弱模型就能在大多数测试上「击败」强模型。
还有一个 benchmark 表格根本测不到的变量:真正干活的时候,你用的从来是模型 + harness + 工具这一整套系统。在 claude code 里,opus 有 web search、file system、parallel tool execution,加上一整套为 agentic 工作设计的对话架构;在 codex 里,gpt 5.4 拿到的是另一套工具和另一套 orchestration。同一个模型放在不同的 harness 里,产出天差地别。
真正干活的是模型加 harness 加工具这一整套系统——同一个模型换个 harness,产出天差地别
Lambert 预测行业会从比裸模型的分数,转向评估完整系统。我只能说,一线干活的人这个转变早就完成了。我认识的在生产环境跑 AI 的人,没有一个关心 GPQA Diamond 的分数,大家关心的是:把手头最难的问题扔给这个系统,它能不能吐出一个可以直接拿去行动的东西。
那对 builder 来说——就是把 AI 当思考伙伴去处理复杂决策、不只是当代码生成器用的人——我觉得真正重要的是两件事。
第一件,模型会不会主动去查你不知道的东西。opus 跑了 web search,找到学术论文,拉了市场数据,挖出了 Pi.ai 这个前例;gpt 是用已有的知识在回答,答得不错,但少了那一步「让我去查查」。复杂决策里这一步很值钱,最关键的信息(比如 Pi.ai 的死法)往往就藏在这一步里。
第二件,输出有没有形状。有表格、有框架、有正交分解,跟一大段「一方面……另一方面……」的文字,可用性完全不同。真的在做决策的时候,你需要的是能系统性评估权衡的结构,光靠感觉不行。
回头看这次测试,opus 给我的是新东西,直接改变了我对 Mio 转型的想法;gpt 更多是把我大致已经想到的又确认了一遍。
所以我现在的用法是这样的:gpt 5.4 不会停用,代码生成、快速分析、模型已有知识就够用的任务,它干得很好;agentic coding 的工作流里我两个模型都重度在用,日常编码 gpt 完全没问题。但碰到难题——产品战略、架构决策、「帮我想想」这种——我会选 opus。倒不是看 benchmark,纯粹是用了一年攒下来的手感。
行业对 benchmark 的执念我能理解,分数可量化,能放进表格里宣布赢家。如果你也要为真实工作选模型——不是编程谜题也不是问答,是那种很乱、好几个维度、需要调研的问题——建议自己跑一次,把手头最难的问题扔给两个模型比一比。我反正就是这么选出来的。

