ENZH
和 AI 讨论这篇文章
ChatGPTClaude

光模块到底是个什么东西

最近听了《十分吸引》一期讲光通信的,嘉宾 Kevin 是做芯片系统的,博士学的是模拟电路设计。他从家里的光猫一路讲到 CPO,把「为什么数据中心里的网络成了算力的一部分」这件事讲通了。我自己天天看 GPU 集群的账单,GPU 之外那部分钱花在哪,以前只知道个大概,大概就是交换机和一堆光模块吧,具体每一只光模块里面在干什么,其实没细想过。听完才发现这条链和我之前写的存储墙其实是一回事,GPU 在等数据,等内存也好,等隔壁机柜的另一张卡也好,反正是在等。所以把这一期整理成一个系列,这是第一篇,先把光模块这个东西本身说清楚。

你家里就有一只光模块

光模块这个词,大家在新闻里听得挺多的,但好像默认它是个离自己很远的东西吧?其实每家每户都有一只。墙上那个连着一根细光纤、指示灯一闪一闪的小盒子,光猫,它就是一只光模块,只不过是一只低速的。Kevin 在节目里说,它和数据中心里那些高速模块比,速度差几十倍,但里面的基本构造是一样的。

光猫里面是一个单纤双向的光组件。发的方向有一颗激光器 laser,把要发出去的数据变成光;收的方向有一颗光电探测器 PD,把光纤里传过来的光变回电。PD 旁边还挂着一级放大器,叫跨阻放大器 TIA,因为收到的光实在太弱了,PD 出来的电流是微安级的,不先放大后面根本没法处理。收和发共用同一根光纤,靠的是两个波长,上行一个波长,下行一个波长,互相不打架。

这根光纤出了你家门,先在小区里汇到一个无源分光器上。无源的意思就是它不用插电,作用是把几十户的光纤合并成一根,典型的分光比是 1:32 或者 1:64,然后这一根一路通到运营商机房的设备上。从机房到你家,中间全程是光。规模上,中国的固定宽带接入用户 2025 年底是 6.91 亿户;还有个数字,光纤到户的端口占比 2025 年年中已经到 96.6%。这是全球最大的光接入市场。技术也在一代代往上走:最早的 GPON,总带宽 2.5G,几十户分;后来撑起千兆入户的是 10G PON;50G PON 中国移动 2025 年已经在试点,万兆入户在路上。一根光纤上几十户轮流用,每户签的万兆是突发峰值,不是分到手的保证带宽,大家不会同时跑满,所以 50G PON 下面给每户开万兆是成立的,真同时满载就分不过来了。

孙悦聊到 90 年代拨号上网,ADSL、ISDN 那些,走的全是电话线,全是电。节目里接着说,跨大西洋的海底电话电缆 1956 年就有了,第一条 TAT-1 只有 36 路,到七八十年代才做到几千路通话,但最早也都是电的形式,因为从技术门槛和成本上讲一定是电先。光一开始只接到国家骨干网的关键节点上,比如上海会有一个电信骨干网的接口,再往下每个基站、每户人家还都是电。等用户对带宽的要求上来了,最后都不得不转成光,因为光每公里的损耗非常小,跑远了衰减也涨得慢。老旧小区改光纤慢,也是同一笔账,挖沟埋光缆要花钱,运营商愿不愿意干看有没有人买单,石磊说那感觉就像老旧小区加装电梯,有的小区很顺利,有的一直推不动。

节目里还有个说法我觉得挺直观的:整张光通信网络像一套血管系统,光猫这个小盒子就是伸到最末梢的那根毛细血管。那数据中心里插满面板的那些又是个什么量级?

家里墙上的光猫是整张光网络最末梢的毛细血管,数据中心里 leaf 和 spine 之间插满面板的光模块才是主动脉家里墙上的光猫是整张光网络最末梢的毛细血管,数据中心里 leaf 和 spine 之间插满面板的光模块才是主动脉

数据中心里的光模块

先看一个传统的云数据中心。一台服务器,先连到它头顶那台机柜顶上的交换机,这一段通常在三米以内,用的还是铜缆,一种叫 DAC 的直连铜缆。但从这台交换机再往上走,有一层叫 leaf、一层叫 spine 的交换网络,层和层之间就全是光了,100G、400G 的光模块插满面板。数据中心内部,服务器和服务器之间横着交换的流量,也就是所谓东西向流量,节目里的说法是七八成以上,AI 集群里还要更高。

AI 集群这边就更夸张了。训练大模型,成千上万颗 GPU 要连成一张网,行话叫 scale-out 网络。GPU 是并行计算的,节目里打了个比方,相当于很多张大嘴一起吃东西,特别吃带宽,这一点和 HBM 为什么要堆在 GPU 旁边是同一个道理,片内片外都在抢带宽。以前一颗 GPU 配不上那么多光模块,是因为所有的卡都装在一个机柜里,物理距离很近,根本用不着。现在是十万张卡,一个机柜几十张,NVL72 一柜是 72 张,十万张卡就是上千个机柜,占满一整层楼。房间这个角落的一台服务器,要和斜对角那台通信,中间隔着几十米甚至几百米,而且延时还得压得很低,不然大家没法一起协同跑同一个训练任务。这一段就只能走光。

带宽要求高,组网层级又多,Kevin 在节目里给的数字是平均一颗 GPU 要带动两到三只甚至更多的 800G 或者 1.6T 光模块。具体几只,得看你怎么组网,差挺多的,两层网络大概一比一上下,三层 leaf-spine 能到一比六,但方向是对的,反正光模块的需求量现在是直接挂在 GPU 出货量上的。

顺便说一句,这么贵的模块也只有一部分数据中心用得上。孙悦在节目里追问过,一个数据中心面积很大服务器很多,但不做大模型训练,是不是就不需要那么多长距离通信?敏姐说是的,小到一个公司自己的机房,几台机器之间基本全是铜线;做存储的机房也要光模块,但用不着这么高速的。800G、1.6T 这种需求,是 AI 训练和推理带出来的。

拆开一只 800G

现在把一只 800G 光模块拆开看看。Kevin 在节目里真的拿了一只老的多模模块给大家看,黑色的防尘口扒开,一端插光纤,另一端是金手指,插在交换机的面板上。一头进光,另一头出电,Kevin 的原话是,光模块干的事就是光电转换的通信。

里面是一条对称的信号链。先看发射方向,也就是电变光。八路、每路 112G 的 PAM4 电信号从模块尾部的金手指进来。PAM4 是脉冲幅度调制,用四个电压等级分别表示 00、01、10、11 两个比特,所以每路的符号率只有速率的一半。这些信号在主板 PCB 上已经跑了几十厘米,节目里的说法是,如果把 PCB 当成一条路,这条路非常颠簸,到金手指的时候波形已经糊得不成样子了。所以先过 DSP,一颗数字信号处理芯片,先做均衡和重定时,把信号洗干净。然后是驱动器,把干净但微弱的信号放大成能推动激光器的大摆幅。再往后是激光器或者调制器,可能是 EML,一种电吸收调制激光器,也可能是硅光调制器,在这里完成电变光。最后光信号经过发射光组件 TOSA 耦合进光纤,出发。接收方向原路返回:PD 把光变回电流,还是微安级;紧跟着 TIA 把它放大成可用的电压;然后进 DSP 的 ADC 采样、均衡、判决,最后从金手指出去。模块里还有一颗 MCU,一颗小的管理芯片,当体检医生用,实时上报温度、光功率、激光器的偏置电流。如果用的是 EML 激光器,一般还要配一颗半导体制冷器 TEC,把波长稳住,不过不是所有型号都配。

一只 800G 光模块拆开是一条对称的信号链:电从金手指进来,经 DSP 洗干净、激光器变成光进光纤;回来时探测器把光变回电、再经 DSP 从金手指出去一只 800G 光模块拆开是一条对称的信号链:电从金手指进来,经 DSP 洗干净、激光器变成光进光纤;回来时探测器把光变回电、再经 DSP 从金手指出去

这条链现在也不是永远分成四块芯片,新一代的 PAM4 DSP 已经把 TIA 和激光驱动器一起集成进去了。功耗上一只 800G 模块 16 瓦上下,DSP 一颗就占差不多一半,是里面最大的单一耗电来源,这个后面讲封装之战的时候会展开,因为 CPO 要省的就是这块电。

型号怎么看

看型号分两步。先看封装,就是外形。800G 主流是 QSFP-DD 和 OSFP 两种「柜子」,QSFP-DD 宽 18.35 毫米,装机量更大,因为它向下兼容 200G 和 400G;OSFP 宽 22.58 毫米,稍微大一点,散热面积更大,高功耗的 AI 场景会优先用它,1.6T 基本走 OSFP 系,QSFP-DD1600 也有,兼容性更好,但压不住 1.6T 的热。

再看后缀,后缀是方案。SR 是多模短距,850 纳米波长,用 VCSEL 激光器,跑百米以内;DR 是并行单模,500 米;FR 是 2 公里;LR 是 10 公里,这三个都用 1310 纳米的 O 波段;ZR 是相干方案,80 公里以上,用 1550 纳米的 C 波段。后缀里的数字要小心一点,它不总是通道数。DR8、SR8 确实是 8 路并行,8 路 100G,走 8 对光纤;但 FR4、LR4 是 4 路、每路 200G,四个波长复用在一对光纤里,并行和波分复用是两种不同的做法,这两个很容易搞混。组合起来,「800G DR8」就是总共 800G、8 路、每路 100G、走 8 对并行单模光纤、传 500 米,数据中心同楼层互连的主力型号。

那从 800G 到 1.6T 是不是就是路数翻倍啊?孙悦在节目里正好问了这个问题。敏姐的回答是,1.6T 不是 16 路 100G,是 8 路 200G。原因很朴素,面板上能插的光纤就那么多,一股光纤只能把八个集成在一起,面板上的插槽口也有物理尺寸限制,所以只能用相同数量的光纤去承载翻倍的带宽,也就是每一路的速率翻倍。每路翻倍,收发两端的芯片,DSP、驱动器、激光器、TIA,速率和带宽就都得跟着翻倍,所以每升一代模块,里面的芯片基本要重新做一遍设计,敏姐说这里面模拟设计的难度是指数级往上走的。

价格也顺手说一下。第三方的 800G DR8 大概 $900 到 $1200 一只,OEM 品牌的能卖到 $6000 以上;同样 800G 的无源铜缆 DAC,半米到两米长的,$105 到 $300。模块比铜缆贵一个数量级以上。

那电为什么走不远

孙悦在这一段末尾的总结我觉得挺准的,电跑不远,光能跑,所以每次数据要跑远都得把电翻成光。

但这里有个问题一直没说:电为什么走不远?三米以内用铜缆没问题,几十米就必须换光,铜线到底卡在哪?这个下一篇速率每翻一倍,铜线能跑的距离就砍一半细讲。


本文整理自播客《十分吸引》第 75 期「光与电的游戏:有线通讯史的百年之争」,嘉宾 Kevin(芯片系统工程师),主播石磊、敏姐、孙悦。产业链的这套讲法是 Kevin 的,我只做了主题重编和文字整理,理解有偏差的地方锅在我。节目和本文都不构成任何投资建议,提到的公司只是产业链上的例子。

和 AI 讨论这篇文章
ChatGPTClaude
光通信是怎么回事第 1 篇 · 共 5 篇
← 上一篇下一篇 →

订阅更新

新文章发布时发到你的邮箱,不发别的。


© Xingfan Xia 2024 - 2026 · CC BY-NC 4.0