软件变成日抛品了
日抛型软件
前几天《晚点聊》放了一期访谈,请的是 MuleRun 的创始人陈宇森,整期都在聊 agent 经济怎么落地。这期出来的时间点对我来说挺微妙,我前三篇刚写完不到一周,里面那些判断基本还停在纸面上推。他是拿真金白银下场撞过的人,所以我听的时候等于是在对答案。听完收获最大的是一个词,「日抛型软件」。这个意思我之前隐约有感觉,但一直没明确说出来。他这个词一出来,我前三篇的好几条线就串起来了。
陈宇森说:「其实现在最强的 general agent 是 claude code。」
这个判断我一点都不意外,因为我每天就泡在 claude code 里干活,早就不把它当编程工具用了。hooks 自动抓学习模式,skills 按需加载 context,agent 团队并行干活。我基本是把它当一个通用操作系统在用,写博客、做研究、管项目,连教它自己变得更好,都在里面做。
他是从创业的角度得出了同一个结论,而且顺着生意的逻辑一直推到了头。既然 claude code 已经是最强的通用 agent,那在它上面套个壳做 coding 产品,就都没有长期护城河,机会在围绕它做生态,比如 skills、runtime 环境、交易市场。
这套架构我在第一篇里从伴侣产品那头推过一遍,记忆 agent、情绪 agent、判断 agent 各管一摊,一起配合干活。换到生产力这边,就是一个够强的 base agent,再加上足够多的 skills 和 runtime,电脑上几乎什么任务都能做。伴侣 agent 和干活的 agent 看着是两个世界,但底下要解决的工程问题是同一批,就是 context 管理、工具调用和记忆持久化。
日抛型软件
整期播客听下来,最有冲击力的就是这个说法。他的原话是:「软件未来其实是日抛型的。代码只是为了执行特定目的而完成。它会被精确地创建、执行、完成、销毁。」
我只能说这个词起得真准。开发效率变高只是表面,再往下想一层,是值钱的东西本身变了。软件建了又删,可 agent 对你的理解、它的记忆、它的人格模型,是一直在往上攒的。代码用完就扔,没什么可惜,但认知是一点点攒出来的,扔不掉。
日抛循环:代码 创建→执行→销毁,认知一直在累积
我在第一篇里说记忆编排是技术护城河,说实话当时多少是凭产品直觉。现在拿「日抛型软件」这个说法再看一遍,这个判断就站得稳多了。代码成了一次性耗材以后,对用户的理解就是唯一替代不了的资产。一段代码几秒钟就能生成,但 agent 想弄懂你做决定时怎么犹豫、你真正在乎什么、你嘴上说的和心里想的差在哪,得靠三个月的对话慢慢堆出来。这种认知没法复制,也没法压缩,只能拿时间换。
他踩的坑,跟我纸面推的对了一遍
我在第三篇里分析过 agent marketplace 的四个难题,分别是重分发、身份验证、信誉系统和对抗性攻击。陈宇森讲了三个他实际踩过的坑,听下来有对上的,也有没对上的。
- 供给稀缺。我当时担心的是 agent 技能被人拿去重分发,现实里问题出在更前面,能做出有价值 agent 的人根本不够多,门槛太高,供给上不来。我推的是怎么防守,他先撞上的是供给不够。
- 货架模式走不通。MuleRun 从「货架电商」转成了「对话式入口」。用户不该在一堆 agent 货架里自己挑,应该直接说需求,让平台去匹配,走入口级 agent 的路子。
- 质量控制,这是个苦活。MuleRun 在做 agent 的 benchmark 和 eval 系统,用来保证完成率。信誉看的是 agent 实际干得怎么样,拿独立验证过的结果代替五星评分。
有一点他想得比我深,就是 skills 的安全审计。agent 的 skill 里是可能被人塞进恶意代码的,一个反弹 shell 就能控制用户的电脑。他是长亭科技做安全出身的,对这类问题比一般人敏感得多。我在第三篇里把沙箱列成基础设施的第二层,但听他讲完我才意识到,skills 这一级的安全审计可能要排在沙箱前面,先保证 skill 本身没问题,再去谈执行环境怎么隔离。这个盲点我得补上。
context 窗口里该放什么
context 窗口是最稀缺的资源:记忆编排和 skills 分层加载都在回答窗口里该放什么
他讲 skills 分层加载那段,我倒没学到新东西,因为我自己的 claude code 配置里就有几十个自定义 skills,从代码审查、数据库优化到 go 语言规范,每个都是精心设计过的上下文包。但在公开场合听人把这件事讲透,这还是头一回。agent 不会一上来就把所有 skills 全加载,它先扫一遍元信息,碰到具体问题再去读完整的指令。这就是 context engineering。context 窗口就那么大,每个 token 都得精打细算。
我在第一篇里写的记忆编排,其实是同一道题的另一面。agent 记不住所有对话,所以要靠记忆编排提炼出「你这个人是什么样的」;agent 也没法同时掌握所有知识,所以要靠 skills 分层加载去判断「此刻我需要哪些能力」。context 窗口是 agent 最稀缺的资源,架构上大部分问题,最后都落到这个窗口里该放什么。
他还提到了木遥的《苦涩的教训的边界》。那篇的观点是,很多事不该让大模型直接做,交给代码更合适。大模型负责判断什么问题该用什么工具,硬算的活留给代码。比较 9.11 和 9.20 哪个大,一行代码就能算准,犯不着占用大模型的推理能力。
我自己的 hooks 系统就是照这个思路搭的。类型检查交给 tsc,抓学习模式交给脚本,context 预算交给自动化,大模型只管思考和判断。伴侣 agent 也一样可以这么分工。记住每句话是数据库的活,但从这些话里看出你为什么反复提到那个同事、你最近语气变了是怎么回事,这种判断才轮得到大模型来做。
为一个人服务,账算得过来了
陈宇森的同事打了个比方,我很有共鸣。他说 agent 对软件来说,就像 3D 打印对工业制造。以前开发软件成本高,得上千人有同样的需求才划得来。AI 把开发成本打到接近零以后,照 10 个人甚至 1 个人的需求去定制 agent,账也算得过来了。
我在第二篇里写过「让每个人享有总裁级待遇」,意思是真正懂你的私人教练和顾问,不该只有 CEO 才有。他讲的是生产力那一边,量身定做的软件工具,不该只有养得起开发团队的公司才有。伴侣经济和 agent 经济是同一场革命的两面,一面对着情感,一面对着生产力。背后推着它们的是同一件事,AI 让「为一个人服务」在经济上行得通了。盘盘猫就是照这个判断做出来的,一个人花 29 天做的产品,服务的是长尾得不能再长尾的需求。
「用心」
播客后半段他讲了自己创业的起起落落。他 22 岁创办长亭科技,一路往上走。后来同时做游戏公司和安全公司,中度焦虑、严重失眠、彻底的自我怀疑,全都经历了一遍。他说创业最重要的两个字,不是努力,也不是聪明,是「用心」,就是不机械地照着做,每个细节都去琢磨怎么做得不一样。第一次创业他太用心了,第二次有了骄傲和傲慢,不够用心,就失败了。
这个词又把我拉回这个系列一直在问的问题,能不能造一个「用心」的 AI?我在第一篇里批评过现在 AI 伴侣的通病,用他的话说就是「不用心」。每条回复都在往「让你开心」上优化,没真的去弄懂你需要什么。它们是在完成任务,谈不上用心。一个用心的 AI 伴侣得看懂问题背后的模式,有时候还得跟你说,你不该这么做。我坚持伴侣系统里必须有一个「判断 agent」,就是这个原因。一个 AI 要是只会顺着你说好话,那它其实是在讨好你,跟用心是两回事。
他自己的故事就是个例子。他在低谷的时候,朋友没说那些千篇一律的安慰话,说的是「我们去网吧打两天游戏吧」。知道对方这会儿需要什么,我想让 AI 伴侣学会的恰恰是这种理解。
非共识的窗口
播客里他还说了句很实在的话:「创业的机会核心是在非共识变成共识之前你把它干出来。」
「claude code 是最强通用 agent」这个判断,几个月前还是非共识,现在快成共识了。Anthropic 出了 Cowork,字节做了 AnyGen,Google 也在布局。那我自己写的那些呢?伴侣经济、agent marketplace、数字分身、可穿戴感知层,前三篇写的这些方向,现在还有多少算非共识?只能说趋势跑得比我想的快,MuleRun 在做 marketplace,Anthropic 自己下场做了 Cowork,字节和 Google 全在跟。
等到「用 agent 造 agent」成了共识,「日抛型软件」成了常态,每个人都能给自己定制干活的 agent,下一步顺理成章就是伴侣 agent。人已经有了帮自己干活的 agent,接下来自然会想要一个懂自己的 agent。这件事我觉得一定会发生,只是看谁先做出来。
下一篇聊个更实际的问题。agent 的能力已经到了,可 99.99% 的人连门在哪儿都不知道,最后一公里才是主战场。