ENZH
和 AI 讨论这篇文章
ChatGPTClaude

所有 AI 问题,拆到底都是算力问题

算力是一棵大树的根——智能的两条路径都从这里生长算力是一棵大树的根——智能的两条路径都从这里生长

去年做 AI 陪伴产品的时候,被一个很小的功能卡住了。想让角色记住用户说过的话,根据之前的对话调语气。技术上真没什么难度,把历史对话塞进 context 里就完了。问题出在账单上:每次对话带几万 token 的历史,乘上用户数,再乘上对话频率,这个钱根本烧不起。功能就这么压了两个月,后来是两件事凑到了一起——模型变聪明了,同样质量的回复 prompt 可以写得更短;推理成本又砍了一个零——才终于上线。

这件事本身挺普通的,一个功能被成本卡住,成本降了就能上了,做产品的应该都碰到过。我只是后来回头看的时候感觉,那两个月我们其实什么都没做,就是在等推理价格往下走,等它降过某一个点。降过了,这个功能自己就成立了,代码还是那些代码。


后来我拿这个角度去看 AI 圈的每一次「爆发」,发现基本都是同一件事。

agent 今年到处都是,是因为 2023 年根本用不起。GPT-4 当时输入一百万 token 三十美元,输出六十美元,agent 跑一次任务要几十次推理,哪个公司烧得起。十七个月之后,GPT-4 的综合 token 价格从 $36/百万跌到 $4。Andrew Ng 算过这个账,一年降了 79%;a16z 管这个现象叫 LLMflation,同等性能的推理成本大概每年降十倍。成本一过线,agent 就到处都是了。

SaaS 的地基在晃,也是同一个机制:定制方案的成本塌下来了。不会写代码的人拿 claude code 给自己搓个工具,中间要烧几百次推理调用,这个量两年前是天文数字,现在就是日常开销。超级个体这个概念能成立,说白了也是因为并行执行不贵了——你一个人跑十个 agent 线程,推理量就是十倍,token 没便宜到今天这个程度,这笔账怎么算都算不过来。

所以我只能说,不是 AI 圈隔三差五冒出什么新趋势,是同一根成本曲线一直在往下走,走到哪,哪就爆一次。后来我看手头产品的问题也全用这个逻辑:推理太贵?成本还没降到那个点。模型不够聪明?训练算力还没堆够。卡在哪都一样,往底下捅一层,答案就很清楚。说句不太严谨的话,AI 陪伴、日抛软件、人人都是开发者、龙虾热、印刷术时刻,这个博客快两百篇文章聊过的所有话题,全捅到底,全是算力的事。更好的算力让模型更强、推理更便宜,更多事情变得可行,需求就爆,需求爆了更多钱又砸回算力,一个正反馈飞轮。

算力成本下降驱动的正反馈飞轮:更便宜的算力让新应用可行、需求爆发、更多钱砸回算力,循环往复自我加速算力成本下降驱动的正反馈飞轮:更便宜的算力让新应用可行、需求爆发、更多钱砸回算力,循环往复自我加速


这个飞轮的需求端,最近的数字挺吓人的。上周 Jensen Huang 在 GTC 上说,他看到的 GPU 订单需求已经到一万亿美元了,一年前这个数还是五千亿,一年翻倍。一万亿美元,差不多是四个台积电加起来。买家那边也确实在囤:Meta 手上三十五万颗 H100,年底要加到一百三十万;微软那边大概是五十万颗的量。Nvidia 这边,两年卖了大概三百万颗 H100 级别的芯片,新一代 Blackwell 已经卖空到 2026 年中,光积压订单就还有三百六十万颗没交。所以现在一张数据中心 GPU 从下单到到货,最短三十六个星期,长的往五十二周走。小公司和 neocloud 就更别提了,等货名单排几个月,配额压到最低。

不过比缺货更值得琢磨的是成本结构。GPU 在大集群的总成本里其实只占大概四成,剩下六成是网络、电力、冷却、设施。拉一个五年 TCO(总拥有成本)模型就看得很清楚:一百颗 H100 采购价三百万美元,五年实际要花八百六十万,GPU 本身才占三分之一。底下那层基础设施比芯片值钱,也比芯片持久。

持久这一点,跟模型放在一起对比会更明显。模型贬值的 gradient(斜率)挺吓人的:GPT-4 2023 年 3 月刚出来那阵是神一样的存在,所有产品都抢着接它。结果 2024 年 7 月,开源的 Llama 3-405B 在 MMLU 上就超过它了,价格才它的百分之一。到现在,这个名字已经没什么人提了。前沿模型的同等性能成本每年降五到十倍,完全商品化的那一层跌得更狠,四十到九百倍,模型的半衰期越来越短。但数据中心不是这样,当年训 GPT-4 的那批 A100 集群,现在分给一百个小模型跑推理,还在老老实实赚钱。

两条相反的价值曲线:模型价值随时间陡峭贬值,算力基建随时间保值增值——同一时间轴上一条向下一条向上两条相反的价值曲线:模型价值随时间陡峭贬值,算力基建随时间保值增值——同一时间轴上一条向下一条向上

所以我的看法是,硬件更像平台,模型更像跑在平台上的应用。赌某一个模型,跟 1998 年赌某一个网站差不多,押对了赚一笔,押错了就没了;赌算力基建,赌的是整个互联网的骨干网。我们公司做 GPU 融资就是这套逻辑:AI 不管往哪个方向变,最后总得跑在硬件上。

还有一个更大的变化一直在发生,只是没那么显眼。过去几十年价值是堆在应用层的,Office、Salesforce、Oracle,软件吃掉世界;AI 时代钱开始往两头跑:底层的算力基建是一头,另一头我只能叫它认知积累,就是 AI 跟你处得越久越懂你的那部分,这种理解没法复制。中间那层在被慢慢挤扁,代码、SaaS、大部分中低端模型,日子会越来越难过。开源模型在日常任务上已经不输两年前的前沿了;顶级模型像 opus 4.6 在复杂推理上还有明显领先,也还有定价权,但「前沿」这条线一直在重划,今天的前沿,十八个月之后就是白菜价。所以夹在中间的模型这层是在贬值的,反倒是算力,不管钱往哪头跑,都绕不开它。


芯片这边还有一层更有意思的东西,跟钱关系不大。GPU、TPU、ASIC 三条路线在抢市场,表面上是 Nvidia 对 Google 对一帮新玩家,但你仔细看每条路线的取舍,它们赌的东西其实不一样,赌的是「智能到底是什么」。

  1. GPU 这条路,说白了就是认为智能还在变。不知道下一个突破在哪,硬件就得够灵活,什么架构来了都能跑;再加上 CUDA 生态一锁死,就算后面出了更好的芯片,切换成本也高到没人敢动。它背后的判断很简单:智能还在发散,未来不确定,灵活是安全牌。
  2. TPU 赌的是矩阵运算就是机器学习最重要的事。这个时间点其实挺有意思的:Google 2016 年发 TPU v1 的时候,Attention Is All You Need 还没出来,那篇论文是 2017 年 6 月的,所以它立项时赌的只能是矩阵运算本身,后来 Transformer 统治了,刚好踩中。方向对了就往死里优化,定制互联、超大规模、系统级协同。这条路的判断反过来:智能已经在收敛,核心计算形态基本定了,剩下的全是效率问题。
  3. ASIC 不在这个二元对立里,它赌的是推理是主战场、模式已知、值得专门造一颗芯片。前提是计算模式不会再大变,真变了,专用芯片直接报废。三条路里它胆子最大。

GPU、TPU、ASIC 三条芯片路线各押注一种对「智能是什么」的判断:智能还在发散、智能在收敛、智能已经定型GPU、TPU、ASIC 三条芯片路线各押注一种对「智能是什么」的判断:智能还在发散、智能在收敛、智能已经定型

我自己的判断,短期 GPU 赢面还是最大,生态锁得太深,灵活性在当下最值钱。不过 Transformer 从 2017 年统治到现在快十年了,在一个迭代这么快的领域里,这已经算异数,再续上三五年,TPU 那条路只会越来越实。ASIC 风险最高,当前范式其实比大多数人以为的稳,但真来一次范式转移,就全没了。最后谁赢,我觉得关键不在技术,在生态。


有人问过我一个挺直接的问题:你白天做算力基建的 CTO,下了班又自己搓一堆小产品,不会精神分裂吗。我觉得恰恰反过来,两头都摸着,算力这件事在我脑子里才对得上。做 Compute Labs,我能看到成本曲线在往哪个方向走,谁家的芯片在迭代、谁在打价格战、推理需求以什么速度在涨;自己造东西,我知道这条曲线落到地上是什么样,一个功能做不做得起,一个想法是太早了还是刚好到了该做的时候。一边给宏观,一边给微观,缺哪边这张图都拼不完整。

往后三五年,方向其实挺确定的:模型还会变强,训练算力还在指数级地涨;推理还会变便宜,芯片在迭代、蒸馏在进步、价格战在加剧。Deloitte 预测 2026 年推理会吃掉总算力的三分之二,推理芯片市场从两百亿美元跳到五百亿以上,全球 AI 数据中心的资本开支大概四千到四千五百亿美元。GPU 短期还是缺,所以谁能拿到算力、谁能高效地用算力,就是最硬的竞争优势。

反正我现在看 AI 的任何事,都会先捅到算力这一层看一眼。也不是每次都能捅出答案,但大部分时候,答案确实就在那一层。

和 AI 讨论这篇文章
ChatGPTClaude

订阅更新

新文章发布时发到你的邮箱,不发别的。


© Xingfan Xia 2024 - 2026 · CC BY-NC 4.0