ENZH
和 AI 讨论这篇文章
ChatGPTClaude

速率每翻一倍,铜线能跑的距离就砍一半

上一篇把一只 800G 光模块拆开看了一遍,最后卡在一个问题上:电为什么走不远?铜线到底卡在哪?这一篇就讲这个。不过要讲清楚铜为什么不行,得先讲清楚为什么大家非要把速率一直往上推,推到铜扛不住为止。

通信界也有自己的摩尔定律

CPU 的摩尔定律大家都听过,晶体管密度大概每两年翻一倍。通信这边有一条自己的,不看晶体管,看芯片收发信号的速度。

芯片和外面的世界怎么通信呢?靠一种接口电路,发送端把一堆并行的数据压成一根线上的高速串行流,接收端再把它还原回来。你家 USB 线里就是它,显卡插的那条 PCIe、接电视的 HDMI 线里也都是它。这个东西叫 SerDes,串行器加解串器。数据中心里服务器和交换机之间跑的,也是它。

SerDes 一条通道的速率,10G、25G、56G、112G,现在到 224G,大致每几年翻一倍,而且近几代明显在加速。10G 到 25G 那一步跨了十年以上,后面 25G 到 56G 再到 112G,基本三到五年一代。224G 是 2024 年才第一次有芯片演示出来,2026 年才跟着 1.6T 模块开始放量,还算新东西。

交换芯片是另一条线。交换芯片要做的事是让几十路、多的时候五六百路数据互相交换,所以它的总容量涨得更快,大概每两年翻一倍。拿博通的 Tomahawk 系列说,2014 年 3.2T,然后 6.4T、12.8T、25.6T,2023 年 51.2T,去年 102.4T 的 Tomahawk 6 发布,博通今年三月的新闻稿说已经量产出货了。顺便说一句,Tomahawk 就是战斧,节目里主持人聊到这儿还岔到了战斧牛排上。

光模块的速率是跟着这两条线水涨船高的。100G 是 2016 年铺开的,400G 大规模部署在 2020 到 2021 年,800G 2023 年放量,1.6T 2025 年导入、今年才算放量的头一年。

AI 把节奏换了

按这个节奏本来也还好,几年翻一倍,整个产业链跟得上。但 AI 来了以后就不太一样了,需求涨得比这快多了。

训练大模型的算力需求涨得有多快呢?Epoch AI 统计 2020 年以来的前沿模型,训练算力大概每 5.2 个月翻一倍。这比任何一条摩尔定律都快,Kevin 在节目里的说法是,AI 的需求把整个光通信和芯片行业原来两三年一个周期的节奏差不多提快了一倍。集群规模从一千张卡走到十万张卡,也就是这几年的事。

麻烦在于处理器那边的摩尔定律是在放缓的。节目里有个很有体感的例子,二十年前奔腾时代 CPU 主频就是两三 GHz,今天你电脑里的 i5 最多也就 4GHz 上下,按摩尔定律本来该到几十 GHz 了,实际上根本没有。单颗芯片里的算力扩不动,那要更多算力就只剩一条路,把很多颗芯片连成一张网。

一连成网,网络带宽本身就变成了算力的一部分。训练的时候数据并行、模型并行、流水线并行,每一轮迭代所有 GPU 都要互相传中间结果,GPU 越强,卡和卡之间的流量越大。带宽跟不上,GPU 就在那儿等数据,利用率掉下来。这个跟存储墙那篇讲的其实是一回事,那边是 GPU 等显存,这边是等网络,都是算得快喂不上。行话叫网络墙。

还有个物理上的事。上一篇算过这笔账,十万张卡摊开就是上千个机柜、一整个楼层,你不可能把要通信的卡都搬到同一个小房间里去。所以芯片之间怎么连,在 AI 集群里就成了卡脖子的地方,以前根本没人拿它当回事,要跑的距离没法缩,速率还得一直往上推。那铜线到底卡在哪呢?

铜线到底卡在哪

铜线传信号,频率越高,信号在里面衰减得越厉害,而且是急剧上升,不是线性的。物理上的根源有两条。

第一条,高速的交变信号在铜导线里传的时候,电流会倾向于贴着导线表面走,导线中间那部分基本不干活,这就等于有效的导体截面变小了,电阻变大了。频率越高,电流被挤得越贴表面。这个现象叫趋肤效应。

第二条,铜线外面包着绝缘材料,PCB 板的基材也是绝缘材料,高频信号从旁边过的时候,这些材料会把一部分能量吃掉,变成热。频率越高吃得越多。这个叫介质损耗。到了 224G 这一代,介质损耗其实是占主导的那一个,就算你把铜表面做得再光滑,趋肤效应那部分照样在。

数字大概是这样的。一条通道跑 224G 的 PAM4 信号,对应的奈奎斯特频率约 56GHz。在这个频率附近,一条 224G 链路从芯片到芯片,连接器、封装、线缆全算上,插入损耗可以到 40dB 量级。40dB 是什么概念呢?发送端出去的信号,到接收端幅度只剩百分之一。

224G 一代的信号走过 1.5 米左右的铜链路损耗可达 40 dB 量级,幅度只剩百分之一,剩下的全靠接收端的 DSP 用均衡算法把信号找回来224G 一代的信号走过 1.5 米左右的铜链路损耗可达 40 dB 量级,幅度只剩百分之一,剩下的全靠接收端的 DSP 用均衡算法把信号找回来

剩百分之一的信号,还能用吗

节目里主持人听到这儿直接问了一句,1% 也能恢复?能,靠芯片去还原。接收端有一整套均衡算法,FFE、DFE、MLSE 这些,把一个已经糊成一团的信号从噪声里捞回来。MLSE 那个一般是用维特比算法实现的,干的就是这个事。

不过这么捞是有代价的,有三条。

第一,均衡做得越强,DSP 功耗越高。一只 800G 模块 16W 上下,DSP 自己就占 6 到 8W,差不多一半,是模块里最大的单一耗电项。这颗 DSP 的事第四篇会专门讲,LPO 那条路线就是想把它去掉。

第二,损耗预算越来越紧。OIF 给的三代目标是,56G 一条通道无源铜缆能跑 3 米,112G 缩到 2 米,224G 缩到 1 米。800G 时代的无源 DAC 普遍最长标 2 米,现在在售的 1.6T 无源 DAC 普遍只标 0.5 到 1 米。注意这说的是无源铜缆,里面加了 retimer 的有源铜缆能跑得远一点,但那又是另一笔功耗。

第三,串扰、反射、连接器、封装,损伤是一层一层往上加的,误码率那边一点没放松。纠错前允许的误码率大概是 2×10⁻⁴ 这个量级,纠错之后要压到 1e-12 到 1e-13,速率越高越严。40dB 是现在 SerDes 能恢复信号的极限了,Kevin 的原话是这样。这几个要求是互相打架的,想把功耗压下去,均衡就不能做太狠,可损耗还摆在那,误码率又一分没松。主持人说这就是既要又要还要。

那铜是不是就该退场了

那是不是铜就该退场了?也不是。英伟达的 NVL72 机柜,72 颗 Blackwell 之间的 NVLink 走的是背板上的铜缆,英伟达自己的说法是 direct drive,芯片直接驱动线缆,中间不加中继芯片,黄仁勋给的数字是 5,184 根,总长约 3.2 公里,塞在一个机柜里。英伟达官方的说法是这套铜缆要是换成光模块,得额外多出大约 20kW 的功耗。一米之内铜还是比光划算得多,省电,也基本不会坏。

铜其实一直挺能打的,就是能跑的距离一代比一代短。Kevin 管这个叫经济半径,我觉得挺准,速率每翻一倍,铜能跑的通信半径就少一半。OIF 那三个数是 3 米、2 米、1 米,1.6T 的无源线现在普遍只标 0.5 到 1 米了。那光为什么不吃这一套?

光凭什么不怕速率翻倍

光这边不一样的地方就一个,损耗和信号速率没关系。光在玻璃里跑,衰减是材料吸收和散射决定的,标准单模光纤在 1550nm 波长上每公里大约 0.2dB,你把速率翻一倍,这个数字不动。当然速率高了色散和非线性效应会更敏感,但那是另一类问题,不是「跑不动」的问题。

0.2dB 每公里是个什么量级呢?光跑 100 公里,衰减大概 20dB,透过来的还有 1% 到 2%,比市面上最深那一档墨镜还要暗一点,然后中继一下接着跑。对比一下铜线,一条 224G 链路从芯片到芯片全算下来,就是 40dB 量级。

再加上光没有串扰,不受电磁干扰,一根光纤又细又轻。可用带宽这块,常规商用的 C 加 L 波段大概 8 到 10THz,现网里一根光纤跑几十 Tb/s 是常态,实验室里已经到几百 Tb/s 甚至 Pb/s 级别了。还能做波分复用,一根光纤里塞很多个波长并行跑,这个第一篇讲 FR4 的时候提过一嘴。

光那笔固定开销是什么

既然光这么好,为什么铜还占着这么多地盘?因为光有一笔固定的转换开销,不管走多远都得先付。

数据在芯片里是电,要上光纤就得先变成光,到对面再变回电。这一去一回的转换是有成本的,而且这笔开销和距离没关系,是固定的,你走 1 米和走 10 公里,付的一样。Kevin 在节目里拿货船过霍尔木兹海峡打了个比方,船走多远不管,过海峡就得交一次。

节目里主持人追了一句,这笔钱花在哪了?拆开看是三块,成本、功耗、可靠性。第一块是成本。上一篇拆过的那些东西,激光器、驱动器、TIA、精密的耦合封装,都是钱。第一篇那组价格摆在那,同速率下模块比无源 DAC 贵一个数量级往上。第二块是功耗,转换本身就耗电,前面说的 16W 就是这么来的。而且数据中心的电费不止是设备自己烧掉的那部分,散热还要再吃掉一块,节目里给的口径是设备自己烧掉的和散热大致各占一半,你多烧 1W,实际付的不止 1W 的钱。第三块是可靠性,模块里的激光器会老化、会失效,铜线基本不会。

交叉点每代往左挪一步

把两边放到一张图上看就清楚了。横轴是距离,纵轴是成本。铜是一条从原点斜着往上走的线,距离越长越贵,速率越高这条线越陡。光是一条起点很高但基本平的线,起点就是那笔转换开销,往后走多远都不怎么涨。

铜按距离付费、光按端口付费:铜的成本随距离直线上升,光的成本起点高但几乎不随距离涨,两条线的交叉点每升一代速率就往更短的距离挪一步铜按距离付费、光按端口付费:铜的成本随距离直线上升,光的成本起点高但几乎不随距离涨,两条线的交叉点每升一代速率就往更短的距离挪一步

距离短、速率低的时候,铜那条线还在光下面,光那笔固定开销划不来,机柜里面、USB、家里的网线,都是铜的天下。距离一长速率一高,铜那条线就飙上去了,这时候光反而便宜。以太网是个现成的例子,10G 用 Cat6a 网线还能跑满 100 米,到 25G 以上或者超过 100 米,基本就只剩光纤一种介质了。节目的文字稿里把这笔账写成铜按距离付费,光按端口付费,我觉得挺准。

不过交叉点不是固定的。速率每翻一倍,铜那条线就陡一截,交叉点就往左挪一步,往更短的距离挪。以前是几公里外才换光,现在机柜和机柜之间超过一到三米就上光模块了。每挪一步,原来铜还能跑的那一段就得换成光。处理器那边扩不动了,带宽需求还在往上冲,所以这个交叉点只会接着往左挪。

那这个交叉点是怎么一路挪过来的?从八十年代第一根跨大西洋海底光缆,一路挪到今天机柜边上的一到三米,第三篇讲。


本文整理自播客《十分吸引》第 75 期「光与电的游戏:有线通讯史的百年之争」,嘉宾 Kevin(芯片系统工程师),主播石磊、敏姐、孙悦。产业链的这套讲法是 Kevin 的,我只做了主题重编和文字整理,理解有偏差的地方锅在我。节目和本文都不构成任何投资建议,提到的公司只是产业链上的例子。

和 AI 讨论这篇文章
ChatGPTClaude

订阅更新

新文章发布时发到你的邮箱,不发别的。


© Xingfan Xia 2024 - 2026 · CC BY-NC 4.0