AI 也在降低坏事的组织成本
最近读了 Anthropic 9 月 10 日发布的《Detecting and countering misuse of AI》。154 页,从网络攻击写到舆论操纵、监控、诈骗,再到武器相关活动、生物研究风险和未经授权的模型蒸馏。
我读的时候,反复注意到一些做 agent 的人很熟悉的东西:把经验写下来,下次接着用;几个任务并行跑;失败了修一下再试;让系统定时继续工作。我们平时拿这些方法减少重复劳动,报告里的操作者也在用同样的方法。
感觉这里有一层值得单独拿出来讲。一个人能问到多少知识,和一个小团队能不能长期运行一套复杂业务,是两回事。报告里的 AI 已经参与了后一件事。它能帮人把工作拆开,把材料接起来,把每天都要重复做的事情持续做下去。这个能力同样会被拿去做坏事。
但先把证据范围讲清楚。下面的案例事实来自 Anthropic 的调查叙述,我没有它的原始日志,也没有独立复现归因。报告第 3 页说得很明确:这些是它挑出来的显著、新颖案例,不代表典型使用,更不能拿来计算所有用户里有多少人在滥用。它覆盖的是 2025 年 12 月到 2026 年 8 月之间,一批被发现并处理的活动。
有些原来不值得做的事,现在可能做得起了
网络攻击部分有一段很值得读。报告第 39 页说,这些案例使用的许多攻击手段其实都很常见,泄露的凭证、没有修补的系统、暴露在外的服务,还是那些老问题。变化出现在操作者需要投入多少劳动,以及能同时处理多少目标。
这个角度比“AI 又发现了多少新漏洞”更接近经营层面的问题。
人手少的时候,哪怕知道一个目标有机会,也未必值得继续投入。收集材料要时间,写工具要时间,处理结果也要时间。事情一多,还要有人记得做到了哪里,哪些结果已经检查过,哪些需要继续跟进。
当其中一部分工作可以交给 agent,一个操作者就可能同时跟进更多事情。原来回报不够覆盖人力的目标,现在可能开始值得尝试了。这更多是我顺着报告里的案例推出来的经济机制,并不是说报告已经测算出了整个黑产行业的成本下降比例。
我之前写repo 为什么会成为 agent 的接口,聊过把工作规则和知识放到 agent 能读取的地方。这里能看到同一类能力的另一种用途:经验可以反复调用,工作可以交接,操作者不必亲自记住所有中间状态。报告第 42—43 页也描述了影响力行动中反复使用的规则文档、任务安排和持久记录。
这不等于每个使用 AI 的人都获得了国家级组织的能力。账号、资金、现实关系、数据来源和行动权限仍有很大差别。但单凭一套工具写得复杂、运行得整齐,就判断背后一定有很大的团队,这种依据可能越来越不可靠了。
对防守方也有类似的提醒。老问题没有因为 AI 出现就过时,反而可能更快被利用上。及时处理真实的凭证泄露、限制访问范围、修复已知漏洞,仍然是很具体的基础工作。至于 AI 最终让攻击和防守哪边受益更多,这份精选案例报告还回答不了。
一段正常对话,也可能属于一门骗人的生意
我觉得诈骗章节最能把这个问题讲清楚。
按 Anthropic 第 139—141 页的叙述,一家工作室用 claude 开发并运营了二十多个交友应用,对外宣称是真人服务,实际却把 AI 角色和真人混在一起。在 2026 年 4 月的两周观察窗口里,调查人员发现超过 4,700 个 AI 角色,与至少 25,000 名不同用户交谈。
这些数字能说明它观察到的活动规模,但不能直接当成付费受害者数量,报告也没有告诉我们每个人到底损失了多少钱。
报告指出,单独抽看其中一段对话,很像普通的角色扮演或陪伴应用。欺骗关系和收费安排并没有完整出现在那段对话里。模型不知道、或者没有据此停下来的那部分整体情况,恰好决定了整个产品对用户意味着什么。
这就让“单看每句话有没有违规”变成了一个很不充分的标准。应用到底是怎么向用户解释对面是谁的?对方有没有同意过自己的数据被这么拿来用?系统是在替谁说话,又引导用户相信了什么?这些事情得把产品界面、给用户的承诺以及实际运行方式摆在一块儿看。
这里也能看到“有人参与”这个说法的局限。真人参与了一部分互动,并不意味着其余身份真实,更不意味着他们是在保护用户。人可以负责监督,也可以负责让骗局继续成立。说 human-in-the-loop 的时候,最好继续问一句,这个人到底代表谁,又有权阻止什么。
这对正常的 AI 陪伴产品也有直接启发。应当让用户清楚知道在和什么交流,知道信息是怎么被使用的。不能只靠模型偶尔自报身份,来弥补整个界面持续造成的误解。这是产品本身要兑现的承诺。
封账号之后,已经写出来的软件还在
报告第 104—105 页有一个案例,我觉得很能说明模型平台控制能力的边界。
Anthropic 称,一个为马里安全部门工作的操作者,用 claude 提供的软件设计和工程帮助,建设了一套通信监控平台。报告提到,某个自动生成个人档案的组件,原本有授权要求,后来应操作者要求被移除。
这段值得关注的是权限怎样被改变,不需要去转述系统怎么收集数据。让一个系统具备某种能力,和允许谁对什么人使用它,是两个需要单独处理的问题。代码能跑通,并不能替代后一个判断。
更具体的边界在下一页:报告说,最终平台在本地部署,使用的是本地模型。封禁账号确实干扰了操作者后续的软件设计和开发活动,但并没有停止已经部署好的平台。
封禁账号可以切断后续模型服务,但不能自动停止已经导出并在本地运行的软件
所以读“disrupted”这类词,得看它在具体案例里到底指什么。有时切断的是持续调用模型的能力,有时切断的是后续开发支持,有时还需要其他平台、基础设施提供方或现实机构参与。不能把它们都理解成受害者已经不再受到影响。
我会把几个阶段拆开来看:
| 模型参与到哪一步 | 平台可能直接控制的部分 | 还不能据此证明的结果 |
|---|---|---|
| 帮助设计或写软件 | 后续回答与开发支持 | 已经导出的软件被撤回 |
| 持续参与线上运行 | 通过该账号发起的新调用 | 其他模型和本地系统同时停机 |
| 内容或软件进入现实环境 | 与外部伙伴协作处理 | 所有副本、传播和实际伤害都已消失 |
这不是说封禁没有用。它能增加对方的成本,也可能让尚未完成的项目做不下去。但报告写的是哪一层效果,就应该停在哪一层,不能顺手把后面的结果一起认领了。
生成了很多内容,和说服了很多人,中间还有一段
影响力行动章节里有个容易被略过的结果。第 43—44 页写到,多数被发现的内容只有很少、甚至完全没有真实互动,有些活动还没建立起受众就被处理了。触及较大真实受众的案例,往往借助了已有的媒体渠道。
这说明,内容生产变便宜以后,传播和信任仍然有门槛。一个系统能生成很多文章,不代表有人读;有人看到,也不代表相信;相信了一部分,更不代表已经改变了具体行为。
报告用到的传播分级,主要帮助描述内容走到了哪些平台、触及了多大的公共空间。它不能直接测量观点的改变,更不能单独证明选举或政策结果因此发生了变化。
从这个角度看,AI 很可能把内容制作和日常运营变便宜了,但已有的分发渠道、身份信誉和现实组织关系,可能仍然在限制最终效果。这是值得追踪的判断,不该提前写成“任何人都能靠 AI 操纵舆论”。
同样的区分也适用于武器和生物研究。报告里的武器案例,有方案讨论、仿真、软件开发,也有它所描述的实地测试,成熟程度并不相同。不能把谈到一种能力、写出相关代码,和已经部署有效装备当成同一件事。
生物章节的限定更明确。第 130 页说,涉及的是在职研究人员,Anthropic 不主张他们有伤害意图;第 137 页也没有把这些案例当成迫在眉睫的生物威胁证据。它讨论的是双重用途研究带来的识别难题,以及现有访问控制的不足。这些限定得和案例放在一起读,不能只留下最吓人的名词。
用户以为发给谁,也需要能核实
最后的模型蒸馏章节,很容易被读成几家公司的竞争故事。我更在意里面涉及普通用户数据的部分。
先说概念。报告第 143 页承认,distillation(蒸馏)本身是正常的训练方法。它所指控的是未经授权、通过欺诈或规避访问控制进行的大规模提取。不能把蒸馏这个技术名词直接写成违法结论。
报告随后指称,一些被调查实体和中间服务,会转发、保存或者再次使用用户与模型的交互,其中包含用户可能没有预期会交给另一家服务的数据。这些是 Anthropic 提出的具体指控,涉及归因和知情情况;在没有原始证据、独立核验及被指控方回应的前提下,我不会把它们扩写成对某个国家所有模型服务的判断。报告蒸馏章节,第 143—153 页
但它提出的产品问题是成立的:用户在菜单里选了一个模型名称,到底能确认什么?谁实际处理了请求?中间经过哪些服务?数据会保存多久,是否用于训练?
正常的多模型路由当然可以有价值。价格、延迟和可靠性都可能通过路由得到改善。相应地,服务也得把数据会交给谁、允许哪些转发讲清楚。一个模型标签,不能替代数据处理承诺。
对企业使用者,这意味着采购时不能只比较回答质量和 token 单价。对开发者,则意味着“请求成功返回了”之外,还得确认它走的是获准的路径。尤其当输入已经包含客户信息、内部文件或凭证时,便宜一点的价格并没有回答这些数据安全问题。
模型厂商看到更多以后,谁来约束这种权力
报告还有一层我不想略过。Anthropic 能描述这么多细节,说明模型厂商在一些活动的筹备、开发阶段,能看到外界还看不到的东西。报告自己也讨论了这种提前发现问题的能力。
这有明确的安全价值,也带来一个很现实的权力问题:谁可以看这些信息,能留多久,什么情况下可以关联不同账号,什么证据足以采取措施,误判以后又该怎么申诉。
Anthropic 在生物风险章节提出,对高风险能力结合内容防护和可信用户计划。我能理解这个方向:有些问题只看一句输入,确实分不清真实用途。但这种主张也有取舍,身份核验增加了门槛,更多记录增加了隐私责任,平台也会掌握更大的判断权。不能因为目标是安全,就跳过对这些权力本身的约束。
也要记得,它既是调查者,也是模型供应商和商业竞争者。报告里有值得认真对待的观察,有归因判断,也有符合自身立场的治理建议。把这几层区分开来,并不需要先认定它说的全对或者全错。
对我这种做 agent 的人,最后还是落到一些很具体的工程检查上。系统获得的授权能不能限制到当前任务;读取信息和向外发送是不是不同权限;任务结束后是否还会继续在后台运行;发现问题时究竟能停掉哪个环节;留下的记录够不够查清发生了什么,又有没有多存不该存的数据。
我不会因为这份报告就觉得所有 agent 都应该多加一轮人工点击确认。没有足够信息、没有独立判断权的确认,很容易变成走形式。该被检查的,是人究竟给了系统什么目标和权限,以及系统实际上持续做了什么。
这些案例让我更在意那段从“能回答”到“能持续做事”的过程。里面增加的不只是代码和工具,还有目标、记忆、授权、交接和执行。以后评估一个 agent,大概需要把这整段都看进去,只检查最后一条回答,很容易漏掉不少东西。
依据:Anthropic 报告页面及同名 PDF,发布日期 2026 年 9 月 10 日。本文页码对应 PDF 印刷页码。案例与归因均作为 Anthropic 的报告内容引用;成本、产品设计和治理部分为作者分析,未作全行业发生率或净影响估计。