ENZH
和 AI 讨论这篇文章
ChatGPTClaude

软件变成日抛品了

📊 幻灯片

日抛型软件日抛型软件


前几天《晚点聊》放了一期访谈,对象是 MuleRun 的创始人陈宇森,整期都在聊 agent 经济怎么落地。这期对我来说时间点挺微妙的:我前三篇刚写完不到一周,里面那些判断基本还停在纸面推演。他是拿真金白银下场撞过的人,听的时候等于是在对答案。听完收获最大的,是他提了一个我之前隐约有感觉、但没明确说出来的词:「日抛型软件」。这个词一出来,把我前三篇的好几条线都串起来了。

陈宇森说:「其实现在最强的 general agent 是 claude code。」

这个判断我一点都不意外,因为我每天就泡在 claude code 里干活,早就不把它当编程工具用了。hooks 自动捕获学习模式,skills 按需加载 context,agent 团队并行干活。我等于把它当成一个通用操作系统在用,写博客、做研究、管项目,甚至教它自己变得更好,全在里面。

有意思的是他从创业视角得出了同一个结论,而且推到了商业逻辑的终点:既然 claude code 已经是最强的通用 agent,那在它上面套壳做 coding 产品,就都没有长期护城河。机会在围绕它做生态——skills、runtime 环境、交易市场。

这套架构我在第一篇里从伴侣产品的方向推过一遍:记忆 agent、情绪 agent、判断 agent 各管一摊,协同干活。换到生产力场景,就是一个够强的 base agent,加上足够多的 skills 和 runtime,几乎任何电脑上的任务都能做。伴侣 agent 和干活的 agent 看着是两个世界,但底下要解决的工程问题是同一批:context 管理、工具调用、记忆持久化。

日抛型软件

整期播客里最有冲击力的就是这个概念。他的原话是:「软件未来其实是日抛型的。代码只是为了执行特定目的而完成。它会被精确地创建、执行、完成、销毁。」

我只能说这个词起得真的很准。开发效率变高只是表层,往下想一层,值钱的东西本身变了。软件创建了又销毁,agent 对你的理解、它的记忆、人格模型,却是一直在累积的。代码用完就扔没什么可惜的,但认知是攒出来的,扔不掉。

代码在"创建→执行→销毁"的循环里被反复丢弃,认知却一直往上累积代码在"创建→执行→销毁"的循环里被反复丢弃,认知却一直往上累积

日抛循环:代码 创建→执行→销毁,认知一直在累积日抛循环:代码 创建→执行→销毁,认知一直在累积

我在第一篇里说记忆编排是技术护城河,说实话当时多少是产品直觉。放进「日抛型软件」这个框架里再看,这个判断就有了更硬的地基:代码变成一次性耗材之后,对用户的理解就是唯一不可替代的资产。一段代码几秒钟就能生成出来,但 agent 要理解你做决策时候的犹豫模式、你真正在乎什么、你嘴上说的和心里想的差在哪,得靠三个月的对话慢慢堆。这种认知没法复制,也没法压缩,只能拿时间换。

他踩的坑,跟我纸面推的对了一遍

我在第三篇里分析过 agent marketplace 的四个难题:重分发、身份验证、信誉系统、对抗性攻击。陈宇森讲了三个实际踩过的坑,听下来有对上的,也有没对上的。

  1. 供给稀缺。我当时担心的是 agent 技能被重分发的风险,现实里问题出在更前面:根本没有足够多的人能创建出有价值的 agent,门槛太高,供给上不来。我推演的是防守问题,他先碰到的是供给问题。
  2. 货架模式走不通。MuleRun 从「货架电商」转向了「对话式入口」:用户不该在一堆 agent 货架里自己挑,直接说需求,让平台去匹配,走入口级 agent 的路子。
  3. 质量控制,这是桩苦活。MuleRun 在做 agent 的 benchmark 和 eval 系统来确保完成率,信誉靠行为驱动,用独立的结果验证去代替五星评分。

有一个点他想得比我深:skills 的安全审计。agent 的 skill 是可能被注入恶意代码的,一个反弹 shell 就能控制用户的电脑。他是长亭科技做安全出身的,对这类问题的敏感度远超常人。我在第三篇里把沙箱列为基础设施的第二层,但他让我意识到,skills 级的安全审计可能要放在沙箱前面。先确保 skill 本身没问题,再谈执行环境的隔离。这是我需要补的一个盲点。

context 窗口里该放什么

context 窗口是最稀缺的资源:记忆编排和 skills 分层加载都在回答窗口里该放什么context 窗口是最稀缺的资源:记忆编排和 skills 分层加载都在回答窗口里该放什么

他讲 skills 分层加载机制那段,我倒没学到新东西——我自己的 claude code 配置里有几十个自定义 skills,从代码审查到数据库优化到 go 语言规范,每个都是精心设计的上下文包。但这是我头一回听人在公开场合把这件事讲透。agent 不会一上来把所有 skills 全加载,它先扫元信息,遇到具体问题再去读完整指令。这就是 context engineering:context 窗口就那么大,每个 token 都得精打细算。

我在第一篇里写的记忆编排,其实是同一道题的另一面。记忆编排解决的是 agent 记不住所有对话,得提取出「你这个人是什么样的」;skills 分层加载解决的是 agent 没法同时掌握所有知识,得判断「此刻我需要哪些能力」。context 窗口是 agent 最稀缺的资源,架构上大部分问题最后都落在这个窗口里该放什么。

记忆编排和 skills 分层加载都在抢答同一个问题——最稀缺的 context 窗口里该放什么记忆编排和 skills 分层加载都在抢答同一个问题——最稀缺的 context 窗口里该放什么

他还提到木遥的《苦涩的教训的边界》,观点是很多事不该让大模型直接做,交给代码更合适:大模型负责判断用什么工具解决什么问题,硬算的活儿留给代码。比较 9.11 和 9.20 哪个大,一行代码就能精确回答,犯不着占大模型的推理能力。

我自己的 hooks 系统就是这套哲学的实践:类型检查交给 tsc,学习模式捕获交给脚本,context 预算交给自动化,大模型只管思考和判断。这套分工对伴侣 agent 一样适用:记住每句话是数据库的活儿,但从里面看出你为什么反复提到那个同事、最近语气变化意味着什么,这种判断才轮得到大模型来做。

为一个人服务,账算得过来了

陈宇森的同事打了个比方,我很有共鸣:agent 之于软件,就像 3D 打印之于工业制造。过去软件开发成本高,必须服务上千人的共同需求才划得来;AI 把开发成本打到接近零之后,为 10 个人甚至 1 个人的需求定制 agent,账也算得过来。

我在第二篇里写过「让每个人享有总裁级待遇」:真正理解你的私人教练和顾问,不该只属于 CEO。他讲的是生产力那一边:量身定制的软件工具,不该只属于养得起开发团队的公司。伴侣经济和 agent 经济是同一场革命的两个面,一个面向情感,一个面向生产力。底层的推动力是同一个:AI 让「为一个人服务」这件事在经济上可行了。盘盘猫就是这个判断的实践——一个人 29 天构建的产品,服务长尾得不能再长尾的需求。

「用心」

播客后半段他讲了自己的创业起伏:22 岁创办长亭科技,一路上坡。后来同时做游戏公司和安全公司,中度焦虑、严重失眠、彻底的自我怀疑,都经历了一遍。他总结创业最重要的两个字,不是努力也不是聪明,是「用心」——不机械执行,在每个细节上琢磨怎么做到不一样。第一次创业他太用心了;第二次有了骄傲和傲慢,不够用心,就失败了。

这个词把我拉回这个系列一直在问的问题:能不能造一个「用心」的 AI?我在第一篇里批评过现有 AI 伴侣的通病,换成他的语言就是「不用心」:每个回复都在优化「让你开心」,没真的去理解你需要什么。它们在完成任务,谈不上用心。一个用心的 AI 伴侣得理解问题背后的模式,有时候还得告诉你:你不该这么做。我坚持伴侣系统里必须有一个「判断 agent」,原因就在这儿。一个 AI 要是只会顺着你说好话,那其实是在讨好你,和用心是两回事。

他自己的故事就是个例子。低谷的时候,朋友没说那些千篇一律的安慰话,说的是「我们去网吧打两天游戏吧」。知道对方此刻需要什么——这种理解恰恰是我想让 AI 伴侣学会的东西。

非共识的窗口

播客里他还说了句很实在的话:「创业的机会核心是在非共识变成共识之前你把它干出来。」

「claude code 是最强通用 agent」这个判断,几个月前还是非共识,现在快变成共识了:Anthropic 出了 Cowork,字节做了 AnyGen,Google 也在布局。那我自己写的呢?伴侣经济、agent marketplace、数字分身、可穿戴感知层,前三篇写的这些方向,现在还有多少算非共识?只能说趋势比我预想的快:MuleRun 在做 marketplace,Anthropic 自己下场做了 Cowork,字节和 Google 全在跟。

等「用 agent 造 agent」变成共识、「日抛型软件」变成常态、每个人都能定制自己干活的 agent,伴侣 agent 就是顺理成章的下一步:人们已经有了帮自己干活的 agent,接下来自然会想要一个理解自己的 agent。这件事我觉得一定会发生,问题只是谁先做出来。

下一篇聊个更实际的问题:agent 能力到了,可 99.99% 的人连门在哪儿都不知道。最后一公里才是主战场。

和 AI 讨论这篇文章
ChatGPTClaude

订阅更新

新文章发布时发到你的邮箱,不发别的。


© Xingfan Xia 2024 - 2026 · CC BY-NC 4.0