agent 已经够强了,普通人还是用不上
前段时间我大学最好的朋友之一从北京来西雅图出差。他做金融,平时看 deal、写投资研报。这次来除了叙旧,他还有个很明确的目的,就是学会用 AI agent 提高效率。我平时经常跟他分享各种 agent 的 use case,他看到了这些东西的潜力,知道不能再等了。于是我花了一个周末,手把手从零开始教他用 claude code。这个周末我看到的东西,比我之前写的那些推演都直接。讲这个周末之前,先说一下背景,看看 AI 现在到底普及到哪一步了。
AI 使用率可视化——每个小方块代表约 320 万人
全世界 84% 的人从来没跟 AI 对过一次话,16% 用过免费的聊天机器人,每个月给 AI 付钱的大概 0.3%。用编程 agent 的人呢?大概 0.04%,就是图上几乎看不见的那一个红点(数据来源:Noah Epstein)。拿手机比的话,现在大概就是 iPhone 刚出来那会儿,大多数人还在用诺基亚,没人知道移动互联网后面会长成什么样。所以 AI 别说中期了,连中期的开头都还没到,这才刚起步。
背景就是这么个背景。再说我朋友。他大学选过几节 CS 入门课,但那是八年前的事了,基本都还给老师了。他人聪明,学东西快,动机也强。
那个周末我们大概干了这些事。先在 GCP 上部署他自己的 OpenClaw 实例,接上飞书,配好 tunnel;然后用 claude code 去做他真正要做的事,做财务分析、整理数据,还给他的业务场景搭了定制的小工具。
先得过搭环境这一关
上一篇我写过 agent marketplace 的「对话式入口」,意思是用户不该在货架上挑 agent,应该直接说需求,让平台去匹配。这个方向我现在还是信的,但现实是,我朋友还没开始「对话」,就先得跨过一道很大的门槛。
最磨人的就是搭环境。注册 GCP 账号,装 gcloud CLI,配服务器,部署框架,接飞书,配 tunnel 转发,每一步对我来说就是几分钟的事,到他那儿全是问号。他问得最多的一句是:「这是什么?为什么要这样?」这真不怪他,不做技术的人本来就不知道这些东西,也没理由知道。
等环境搭好,情况就完全反过来了。后面几乎所有的事 claude code 都能接过去,写脚本、读文档、调试报错、部署服务,全是它自己来。所以我只能说,问题真的不在 agent 本身,agent 已经够强了。卡人的是从「我想要一个 agent」到「我有一个能用的 agent」中间那段路。
物流行业有个说法叫最后一公里。货从仓库到城市很快,从城市到小区也快,偏偏小区门口到你家那几百米最贵、最慢,花的钱和力气跟这点距离完全不成比例。agent 现在就卡在差不多的地方。模型能力到了,claude code 够强,skills 生态也在长,但普通用户要真正用上,中间这段基本是空的,也没什么人在认真解决。
把物流的最后一公里类比到 agent:模型和工具都到位了,卡住的是从「想要」到「用上」中间那段没人修的路
这个活现在只有工程师干得了
入口这个问题我自己解过一次。用同一套框架,我在 GCP 上给盘盘猫搭了一个全自动的 AI 工程师,接进飞书群。团队成员不用提 bug 报告,也不用写 feature request,直接在群里跟 agent 说话。agent 会自己验证问题、给问题分类,建 GitHub issue,生成任务追踪;简单的 bug 直接提修复 PR,复杂的需求就写一份报告,里面有上下文、分析和建议。挨个收集信息这个活我就不用干了,只需要想事情、做决定。团队成员用 agent,就跟在飞书上找同事聊天一样,在这个场景里入口问题确实解决了。
但搭这套东西的人是我,一个天天泡在 claude code 里的工程师。普通用户走不完这套流程,也不想走,甚至根本不知道还能有这种体验。所以真正卡住的地方,是得有人先替你把环境搭好、把入口做出来,可现在干得了这个活的只有技术人员。绝大多数人身边没有这样一个工程师,更不会有人专门花一个周末帮他弄这些。
Anthropic 显然也看到这件事了。claude code 的作者 Boris Cherny 在访谈里提过,他们内部的设计师、数据科学家、财务团队都在「跳过重重障碍」往终端里装 claude code,非工程师自己去装 Node.js、敲终端命令,就为了用上 agent 级的能力。外部也一样,有人拿它监控番茄苗的生长,有人从坏掉的硬盘里恢复婚礼照片,有人拿它做财务分析。需求是明摆着的,门槛也真的离谱。「想用 AI 交停车罚款」的人,入口就不该是一个终端命令行工具。
所以他们做了 Cowork,把 claude code 包进一个好用的桌面界面里,跑在虚拟机上,还加了删除保护和权限提示。四个工程师十天做出来,代码全是 claude code 自己写的,这件事本身就挺牛的。我看到的产品里,Cowork 是第一个认真要大规模解决这个问题的。agent 能力一点没砍,终端这道门槛直接拿掉了。它当然没解决所有问题,用户还是得学怎么下指令,学会描述需求时说目标,而不是说步骤。但最狠的那道门槛已经拆了,普通人不用先变成工程师,也能开始用这个东西了。
知道归知道,没亲眼见过立不住
我朋友用过 ChatGPT,用过豆包,也用过别的聊天机器人。他对 AI 的理解跟大多数人一样,就是一个比搜索引擎聪明一点的问答工具。我猜 99.99% 的人都是这么理解的。他比大多数人多知道一点,是因为我平时会给他分享那些真实场景,所以他知道这东西应该很厉害。但知道归知道,没在自己的数据上亲眼见过,这种知道是立不住的。
那个周末我们做了三件事:
- 让 claude code 读他的财务数据,建模,生成分析报告,再按他的反馈迭代。一套跑下来是一份完整的财务分析,不是回答几个问题。
- 从零做一个用声音音调控制的 Flappy Bird。一个多小时,从零到能玩,最后就是我们两个人对着电脑喊,用调门控制那只鸟别撞上管子。
- 给他的业务场景搭一个完全定制的工具。这个应用只为他的需求而存在,市面上没有哪个通用软件能替代。
三件事做完,他说了一句:「一个小时前,这些东西都不存在。」
这句话正好对上上一篇讲的「日抛型软件」,给一个人定制软件,技术上完全做得到。可卡住的还是认知,99.99% 的人根本不知道能提这种需求,不知道能提,自然也就不会提。他们没见过 agent 级的能力,用的是免费的、限速的模型,对 AI 的全部印象就是一个聊天框,偶尔能给出点有用的答案。
Boris 有个产品术语我觉得讲得很准,叫 latent demand(潜在需求)。他的说法是:「人只会做已经在做的事。不可能让人去做全新的事。如果人们在试图做一件事,你让它变得更容易,是好主意。但如果试图让他们做不同的事,他们不会做。」
我朋友不是没需求。他天天做财务分析、写报告、做投资决策,需求一直都在,他只是不知道「AI 能让这些事快十倍」。一旦亲眼看到 claude code 在自己的数据上跑起来,潜在需求马上就变成了显性需求。这个规模想想挺吓人的。agent 能改变几十亿信息工作者的活,只是他们还不知道,能帮他们的东西已经有了。
认知瓶颈的翻转:亲眼在自己的数据上看到 agent 跑起来之前,人以为 AI 只是问答框,看到之后潜在需求瞬间变成显性需求
Boris 在访谈里举了几类潜在需求的场景,没有一个是编程:
- 每天都在做的重复的事。交停车罚款、取消订阅服务、汇总团队周报,每个人都有,没人想干。
- 数据分析和研究。从「帮我回答这个数据问题」变成「这是我的数据库,帮我探索一下,找出有意思的规律,写份报告」,跑什么查询、怎么呈现,agent 自己定。
- 为具体场景定制工具,也就是第四篇讲的日抛型软件。不用在市面上找「差不多能用」的通用产品,直接描述需求,agent 给你做一个只为你服务的。
- 学习。从搜索引擎式的「X 是什么」,变成「我想理解 X,我的背景是 Y,用我能理解的方式解释,给我实际例子,然后陪我一步步深入」。agent 会按你的知识水平调解释的深度,相当于一个有无限耐心的私人导师。
最后一个瓶颈:你会不会布置任务
需求到处都是,能力也到位了,剩下的瓶颈就在用的人身上,看你能不能给 agent 布置一个合理的任务。可以做个很简单的思想实验。假设你雇了一个软件工程师,跟他说「给我弄个 XX 软件」,他一个晚上能弄好吗?人能弄好的,AI 大概率也能;人弄不好的,AI 大概率也弄不好。
「给我弄个像微信的即时通讯软件」就是人也做不好的需求,因为太模糊了。服务多少用户?「像微信」是指像微信这么难用,还是指支持语音输入?要不要朋友圈?换个说法,「我有一个公司的中文网站,保持视觉风格不变,把所有内容翻译成英文,做一个一模一样的英文站出来」,验收标准很清楚,就能做得很好。所以不管是人还是 AI,指望一两句话就拿到完美的成果,纯属想多了。人做不到的事,也别指望 AI 能做到。
布置任务这道最后的瓶颈:像好管理者一样,模糊的任务 AI 做不好,验收标准清晰的任务才能交付
所以用 AI 最大的瓶颈,是你能不能像一个好的管理者那样给它布置任务。这个话题我想单独展开讲,第六篇接着聊。