速率每翻一倍,铜线能跑的距离就砍一半
上一篇把一个 800G 光模块拆开看了一遍,最后卡在一个问题上,电为什么走不远,铜线到底卡在哪。这一篇就讲这个。但要讲清楚铜为什么不行,得先讲清楚大家为什么非要把速率一直往上推,一直推到铜扛不住。
通信界也有自己的摩尔定律
CPU 的摩尔定律大家都听过,晶体管密度大概每两年翻一倍。通信这边也有自己的一条,它不看晶体管,看的是芯片收发信号有多快。
芯片和外面的世界怎么通信呢?靠一种接口电路,发送端把一堆并行的数据压成一根线上的高速串行流,接收端再把它还原回来。你家 USB 线里就是它,显卡插的那条 PCIe、接电视的 HDMI 线里也都是它。这个东西叫 SerDes,串行器加解串器。数据中心里服务器和交换机之间跑的,也是它。
SerDes 一条通道的速率,从 10G、25G、56G、112G 一路走到现在的 224G,大致每几年翻一倍,而且最近几代明显变快了。10G 到 25G 那一步走了十年以上,后面 25G 到 56G 再到 112G,基本三到五年就是一代。224G 到 2024 年才第一次有芯片演示出来,2026 年才跟着 1.6T 模块开始放量,还算新东西。
交换芯片是另一条线。交换芯片要让几十路、多的时候五六百路数据互相交换,所以它的总容量涨得更快,大概每两年翻一倍。拿博通的 Tomahawk 系列来说,2014 年是 3.2T,然后是 6.4T、12.8T、25.6T,2023 年到了 51.2T,去年又发布了 102.4T 的 Tomahawk 6,博通今年三月发新闻稿说已经量产出货了。顺便说一句,Tomahawk 就是战斧,节目里主持人聊到这儿,还岔到了战斧牛排上。
光模块的速率就跟着这两条线水涨船高。100G 是 2016 年铺开的,400G 在 2020 到 2021 年大规模部署,800G 2023 年放量,1.6T 2025 年开始导入,今年才算放量的头一年。
AI 把节奏换了
按这个节奏本来也还好,几年翻一倍,整个产业链跟得上。但 AI 来了以后就不太一样了,需求涨得比这快多了。
训练大模型要的算力涨得有多快呢?Epoch AI 统计了 2020 年以来的前沿模型,训练算力大概每 5.2 个月翻一倍,比任何一条摩尔定律都快。Kevin 在节目里说,光通信和芯片行业原来是两三年一个周期,AI 的需求差不多把这个节奏提快了一倍。集群从一千张卡涨到十万张卡,也就是这几年的事。
麻烦的是,处理器那边的摩尔定律在放缓。节目里举了个很有体感的例子,二十年前奔腾那会儿,CPU 主频就有两三 GHz 了,今天你电脑里的 i5 最多也就 4GHz 上下。按摩尔定律,本来该到几十 GHz 了,实际上根本没有。一颗芯片的算力扩不上去,想要更多算力就只剩一条路,把很多颗芯片连成一张网。
一连成网,网络带宽本身就成了算力的一部分。训练的时候,不管是数据并行、模型并行还是流水线并行,每一轮迭代所有 GPU 都要互相传中间结果,GPU 越强,卡和卡之间传的东西就越多。带宽跟不上,GPU 就只能干等数据,利用率就掉下来了。这跟存储墙那篇讲的其实是一回事,那边是 GPU 等显存,这边是 GPU 等网络,都是算得快、喂不上,行话叫网络墙。
还有个物理上的问题。上一篇算过这笔账,十万张卡摊开就是上千个机柜、一整个楼层,你不可能把要互相通信的卡都搬进同一个小房间。所以在 AI 集群里,芯片之间怎么连就成了卡脖子的地方,以前根本没人拿它当回事。距离缩不下来,速率还得一直往上推。那铜线到底卡在哪呢?
铜线到底卡在哪
铜线传信号,频率越高,信号在里面衰减得越厉害,而且不是线性地涨,是猛地往上蹿。物理上的原因有两条。
第一条,高速的交变信号在铜导线里传的时候,电流喜欢贴着导线表面走,导线中间那部分基本不干活,等于能导电的截面变小了,电阻也就变大了。频率越高,电流被挤得越贴近表面。这个现象叫趋肤效应。
第二条,铜线外面包着绝缘材料,PCB 板的基材也是绝缘材料,高频信号从旁边过的时候,这些材料会吃掉一部分能量,变成热,频率越高吃得越多。这个叫介质损耗。到了 224G 这一代,损耗里的大头其实是介质损耗,而且就算你把铜表面做得再光滑,趋肤效应那部分也照样在。
具体数字大概是这样。一条通道跑 224G 的 PAM4 信号,奈奎斯特频率大约是 56GHz。在这个频率附近,一条 224G 链路从芯片到芯片,把连接器、封装、线缆全算上,插入损耗能到 40dB 这个量级。40dB 是什么概念呢?发送端发出去的信号,到了接收端,幅度只剩百分之一。
224G 一代的信号走过 1.5 米左右的铜链路损耗可达 40 dB 量级,幅度只剩百分之一,剩下的全靠接收端的 DSP 用均衡算法把信号找回来
剩百分之一的信号,还能用吗
节目里主持人听到这儿直接问了一句,1% 也能恢复?能,靠芯片去还原。接收端有一整套均衡算法,FFE、DFE、MLSE 这些,能把一个已经糊成一团的信号从噪声里捞回来。其中 MLSE 一般是用维特比算法实现的,干的就是这个活。
但这么捞是有代价的,一共三条。第一,均衡做得越强,DSP 越耗电。一个 800G 模块 16W 上下,DSP 自己就占 6 到 8W,差不多一半,模块里没有哪一样比它更耗电。这颗 DSP 第四篇会专门讲,LPO 那条路线就是想把它去掉。
第二,损耗预算越来越紧。OIF 给三代定的目标是,一条通道 56G 的时候,无源铜缆能跑 3 米,112G 缩到 2 米,224G 缩到 1 米。800G 那一代的无源 DAC,最长一般标 2 米,现在卖的 1.6T 无源 DAC 一般只标 0.5 到 1 米。注意这说的是无源铜缆,里面加了 retimer 的有源铜缆能跑远一点,但那又得多耗一份电。
第三,串扰、反射、连接器、封装,损伤一层一层往上叠,误码率的要求却一点没放松。纠错前允许的误码率大概是 2×10⁻⁴ 这个量级,纠错后要压到 1e-12 到 1e-13,速率越高要求越严。Kevin 的原话是,40dB 是现在 SerDes 能恢复信号的极限了。这几个要求是互相打架的。想把功耗压下去,均衡就不能做得太狠,可损耗还摆在那儿,误码率又一分没松。主持人说这就是既要又要还要。
那铜是不是就该退场了
那是不是铜就该退场了?也不是。英伟达的 NVL72 机柜里,72 颗 Blackwell 之间的 NVLink 走的是背板上的铜缆。英伟达管这个叫 direct drive,就是芯片直接驱动线缆,中间不加中继芯片。黄仁勋给的数字是 5,184 根,加起来大约 3.2 公里长,全塞在一个机柜里。英伟达官方说,这套铜缆要是换成光模块,得多出大约 20kW 的功耗。一米之内,铜还是比光划算得多,省电,也基本不会坏。
铜其实一直挺能打,只是能跑的距离一代比一代短。Kevin 管这个叫经济半径,我觉得这个说法挺准。速率每翻一倍,铜能跑的通信半径就少一半。OIF 那三个数是 3 米、2 米、1 米,1.6T 的无源线现在一般只标 0.5 到 1 米了。那光为什么不吃这一套?
光凭什么不怕速率翻倍
光这边只有一点不一样,损耗跟信号速率没关系。光在玻璃里跑,衰减多少看的是材料吸收和散射,标准单模光纤在 1550nm 波长上每公里大约 0.2dB,你把速率翻一倍,这个数也不动。当然,速率高了,信号对色散和非线性效应会更敏感,但那是另一类问题,不是「跑不动」的问题。
每公里 0.2dB 是什么概念呢?光跑 100 公里,衰减大概 20dB,还能透过来 1% 到 2%,比市面上最深那一档墨镜还暗一点,然后中继一下接着跑。再看铜线,一条 224G 链路从芯片到芯片,全算下来就有 40dB 这个量级。
而且光没有串扰,不怕电磁干扰,一根光纤又细又轻。至于能用多少带宽,常规商用的 C 加 L 波段大概有 8 到 10THz,实际在用的网络里,一根光纤跑几十 Tb/s 很平常,实验室里已经做到几百 Tb/s,甚至 Pb/s 级别了。光还能做波分复用,一根光纤里塞好多个波长一起跑,这个第一篇讲 FR4 的时候提过一嘴。
光那笔固定开销是什么
既然光这么好,为什么铜还占着这么多地盘?因为光有一笔固定的转换开销,不管走多远都得先付。
数据在芯片里是电,要上光纤就得先变成光,到了对面再变回电。这一来一回的转换要花钱,而且花多少跟距离没关系,你走 1 米和走 10 公里,付的都一样。Kevin 在节目里拿货船过霍尔木兹海峡打了个比方,不管船走多远,过海峡就得交一次钱。
节目里主持人又追了一句,这笔钱都花在哪了?拆开看有三块,成本、功耗和可靠性。第一块是成本。上一篇拆过的激光器、驱动器、TIA、精密的耦合封装,样样都要钱。第一篇那组价格摆在那儿,同样的速率,模块比无源 DAC 贵了一个数量级还不止。第二块是功耗,转换本身就耗电,前面说的 16W 就是这么来的。而且数据中心的电费不只是设备自己烧掉的那些,散热还要再吃掉一块。按节目里的说法,设备自己烧的和散热大致各占一半,所以你多烧 1W,实际付的不止 1W 的钱。第三块是可靠性,模块里的激光器会老化、会坏,铜线基本不会。
交叉点每代往左挪一步
把两边画到一张图上就清楚了。横轴是距离,纵轴是成本。铜是一条从原点斜着往上走的线,距离越长越贵,速率越高线就越陡。光是一条起点很高、但基本是平的线,起点就是那笔转换开销,后面走多远都不怎么涨。
铜按距离付费、光按端口付费:铜的成本随距离直线上升,光的成本起点高但几乎不随距离涨,两条线的交叉点每升一代速率就往更短的距离挪一步
距离短、速率低的时候,铜那条线还在光下面,为光付那笔固定开销划不来,所以机柜里面、USB、家里的网线,都是铜的天下。距离一长、速率一高,铜那条线就飙上去了,这时候光反而便宜。以太网就是现成的例子,10G 用 Cat6a 网线还能跑满 100 米,到了 25G 以上或者超过 100 米,基本就只能用光纤了。节目的文字稿把这笔账写成铜按距离付费、光按端口付费,我觉得挺准。
但交叉点不是固定的。速率每翻一倍,铜那条线就陡一截,交叉点就往左挪一步,也就是往更短的距离挪。以前要几公里外才换光,现在机柜和机柜之间超过一到三米就上光模块了。每挪一步,原来铜还能跑的那一段就得换成光。处理器那边扩不动了,带宽需求还在往上冲,所以这个交叉点只会接着往左挪。
那这个交叉点是怎么一路挪过来的?从八十年代第一根跨大西洋的海底光缆,一路挪到今天机柜边上的一到三米,这个留到第三篇讲。
本文整理自播客《十分吸引》第 75 期「光与电的游戏:有线通讯史的百年之争」,嘉宾 Kevin(芯片系统工程师),主播石磊、敏姐、孙悦。产业链的这套讲法是 Kevin 的,我只做了主题重编和文字整理,理解有偏差的地方锅在我。节目和本文都不构成任何投资建议,提到的公司只是产业链上的例子。
