前几天有人问我40G光模块该怎么配,数据中心机柜里要把两台交换机用光纤连起来,预算有限,也不太想一步到位上100G。我脑子里第一个冒出来的就是光特通信的40G QSFP+模块。这个线速率的方案听起来有点“上一代”,但在实际网络里占有率真不低——尤其在ToR接入、存储阵列和园区短距互联场景中,40G依然是性价比极高的高速传输方案之一。
光模块这东西,说到底就是把电信号转成光信号、再把光信号转回电信号。40G光模块的核心,是通过QSFP+封装把4路10G通道并行或复用成一个大带宽出口。如果你正在纠结单模还是多模、AOC还是光模块加裸纤、或者插上交换机后模块不认,这篇内容就是按这些实际需求来的。
估计很多人会跟我一样,选型的时候只看到“40G”三个字就下单,结果同速率下还有SR4、LR4、eSR4、BiDi一大堆种类,距离从30米到10公里各不相同。这篇文章我会从模块内部工作原理讲起,然后按距离和场景拆方案,最后重点讲怎么用诊断工具(包括Mellanox环境下的mlxlink工具)在物理层做故障定位。基础不同也能跟着走,新手看选型逻辑,老手重点看后面的排障部分。
1. 40G高速传输方案的整体设计思路
1.1 40G在当下网络中的定位
很多人觉得40G是过渡产物,直接上100G甚至400G就完事了。但实际工作中,数字不代表一切。二手市场和存量机房里,40G QSFP+端口的数量依然可观,很多跑着业务的交换机就是QSFP+面板,里面插的就是40G模块。再看需求侧,如果想把几十台万兆服务器收敛到核心,用10G口堆端口密度确实很低,直接上100G又显得杀鸡用牛刀。40G刚好是那个不上不下、但非常实用的档位。
40G“高速传输方案”这个词听起来宽泛,落地时其实就解决三件事:带宽、距离、成本。带宽上,40G=4×10G,采用NRZ调制,每条通道只有10.3125Gbps。这在光通信里算是非常“宽容”的电信号速率,对驱动电路、对PCB走线、对激光器的要求都比25G通道低一截。这也是为什么40G方案总给人一种“便宜又皮实”的感觉——它不需要太复杂的均衡算法,也不需要PAM4那种高密度调制带来的链路预算压力。
从应用场景来看,40G主要出现在三类地方:数据中心内部ToR到Leaf的接入和汇聚,存储网络里HBA卡与JBOD之间的高速互联,以及园区网络里服务器集群的备份或虚拟化流量承载。这些地方对带宽和时延有一定要求,但又不至于需要100G那么高的规格。我个人的建议是:如果你明确未来三五年要扩到400G,新投资直接上100G/400G更划算;如果只是现有业务扩容,40G依然是整体TCO更低的选项。
1.2 一条40G物理链路拆开来看
要配一个40G方案,不能只盯着光模块这一个部件。一条完整的40G链路至少有四段:交换机或网卡的QSFP+端口、光模块(或AOC/DAC的收发端)、光纤或线缆、对端设备的光模块及端口。任何一个环节不匹配,链路都起不来。
链路设计里最核心的概念是距离和链路预算。工程上我习惯把链路分成三档来处理:
- 3米以内:直接用DAC高速铜缆,模块和线缆一体,没有光路环节,功耗最低,故障率也最低;
- 3米到100米:多模方案,光模块加OM3/OM4跳纤,或者直接用AOC有源光缆;
- 100米以上:单模方案,LR4或者PSM4模块加OS2单模光纤,最远做到10公里甚至更远。
选型的时候记得反过来确认:先量距离,再定多模还是单模,最后定具体模块型号。不要先买了模块再被距离打脸。这个顺序我踩过不止一次,后面专门用一节来展开。
2. 光模块原理拆解:40G模块内部到底在做什么
2.1 从原理图角度理解模块架构
光模块的终极任务就是“电→光→光→电”的转换。以40G QSFP+模块的原理图为例,发送端从交换机口过来40G电信号,经过driver(驱动电路)放大后去驱动激光器,把电信号调制到光信号上。这个光信号经过耦合透镜进入光纤,传到对端后,接收端的探测器(一般是PIN或APD光电二极管)把光信号变成微弱电流,再通过TIA(跨阻放大器)转成电压信号并放大,最后经过限幅放大器或CDR(时钟数据恢复)整形成干净的数字信号,交给交换芯片。
40G QSFP+封装内部空间非常紧凑,但功能模块很固定。我拆过不少模块看布局,基本就是PCB板上一侧焊着金手指,中间放着驱动芯片和TIA,另一侧是TOSA(发射光组件)和ROSA(接收光组件)。有些模块里是透镜阵列,有些是MPO或LC光口直接嵌在壳子上。
为什么40G模块往往比10G模块技术上更难做?因为40G不是一束光跑40G,而是四路光并行跑10G(SR4/LR4/CWDM4等),甚至双波长复用。发射端要把四路电信号分别驱动四个激光器,还要保证四路之间的串扰、时序、光功率一致性;接收端也要分别接收四路信号再合并。多通道布局比单通道的10G模块复杂得多,这也是“原理图看着简单、实际调试很麻烦”的地方。
2.2 驱动电路与激光器怎么匹配
高速传输方案里,驱动电路和激光器的匹配是决定性的一环。40G各通道速率只有10G,所以多数模块使用NRZ强度调制,直接用驱动电流的大小来改变激光器输出功率,实现0和1的调制。这也是为什么40G时代没有像100G那样引入PAM4——NRZ对信噪比要求低、电路简单、产业链成熟,工程容错性高。
激光器选型直接决定模块的应用边界:
- VCSEL(垂直腔面发射激光器):850nm波段,多模光纤专用,成本低、线性好,适合短距并行传输,40G SR4就是典型;
- DFB(分布反馈激光器):1310nm波段,单模光纤专用,光谱窄、功率高,用于40G LR4/PSM4这类单模场景;
- EML(电吸收调制激光器):一般配合外调制,常见于更高速率或更长距离,40G时代用得不那么多,但100G LR4里你一定会看到它。
驱动电路选型时,激光器的偏置电流和调制电流是两个关键参数。VCSEL的阈值电流通常只有几毫安,DFB则在十几毫安量级。驱动芯片需要提供合适的偏置和调制幅度,同时要能做预加重,补偿封装和走线在高频段的损耗。作为使用方,我们不需要调这些参数,但可以借助DDM信息里的TX Bias Current来判断驱动是否正常工作——这个数值反映了激光器的实际偏置电流状态,如果突然跳变或者归零,通常意味着激光器或者驱动链路出了问题。
2.3 耦合工艺:为什么有的模块四路功率不均匀
“光模块耦合”听起来偏制造端,但它恰恰解释了为什么同样标着40G,有的模块良率高、性能稳,有的模块用一段时间功率就飘。耦合就是把激光器发出来的光精准导入光纤或者进入光路结构里。40G SR4这类并行模块用的是多路透镜阵列,一个透镜组同时对准四路VCSEL和四根多模光纤。多模光纤的纤芯直径有50微米,对准容差大,所以SR4耦合相对容易。
LR4这类单模模块就完全不同了。单模光纤纤芯只有9微米左右,DFB发出的光又要经过透镜整形,光斑和光纤端面的对准精度要到了亚微米级。这个工艺直接影响耦合损耗,也就是模块的插损和发射功率。
工厂里做耦合有有源耦合和无源耦合之分。有源耦合是通着电、开着激光器,一边微调透镜位置一边看光功率计读数,找到最大功率点后点胶固定。无源耦合则靠结构件的机械公差保证精度,速度快但良率控制更难。对40G这种多通道模块来说,四路同时对准的难度是乘数级上升的,所以你会看到有些模块出厂时四路功率总有某一路偏低,根源基本都在耦合环节。
这个知识点对使用方的意义在于:买模块时别只看“能不能亮”,还要看四路TX和RX功率是否均匀。如果某一路明显偏低,大概率是耦合或激光器本身有问题,后续加法兰、加跳线损耗就容易出现误码甚至直接降速。
3. 单模还是多模:40G组网选型的核心判断逻辑
3.1 多模SR4/eSR4与100-400米距离预算
多模方案是40G短距互联的主流,常见型号有SR4和eSR4。40G SR4用850nm VCSEL,4对并行多模光纤,MPO/MTP 12芯接口,OM3跑100米、OM4跑150米。40G eSR4是增强版,OM3跑300米、OM4跑400米,价格略高,但在中距场景能顶替一部分单模需求。
多模方案的关键词是OM3/OM4光纤和MPO接口。OM3和OM4都是激光器优化的多模光纤,支持850nm VCSEL传输;区别在于OM4的有效模式带宽更高,同样速率下能跑更远。选型时有个错误很多人会犯:虽然模块和光纤都写着“多模”,但如果你用的是老旧的OM1/OM2多模光纤,40G SR4大概率起不来——带宽不够。所以先确认手头光纤是OM3还是OM4,再下单。
距离预算怎么算?40G SR4在OM4上的链路预算通常有2.9dB左右,OM4光纤本身在850nm窗口的衰减约为2.5dB/km。以100米链路为例,光纤衰减0.25dB,两个MPO连接器各约0.5dB,总损耗1.25dB,还在预算内。如果链路里有额外的熔接点或法兰盘,记得把损耗逐项加上。
实操中,多模MPO跳线还有个物理细节:MPO接头分公母、分键位(key up/key down)、分极性(Type A/B/C),插反、插错极性是短距链路不通的头号原因。很多工程师第一次接触MPO,拿起来就插,完全没注意端面箭头方向。这个坑我在后面问题排查里专门列出来。
3.2 单模LR4/PSM4与10公里链路预算
单模方案面向的是100米以上的场景,40G对应的主流型号是LR4和PSM4。40G LR4工作在1310nm波段,4路通道分别用不同波长做粗波分复用,通过LC双纤传输,标准距离10公里,是园区和城域互联的主力。40G PSM4则是4路并行单模,MPO接口,标准距离500米到2公里,实际常用于楼宇间布线,价格通常比LR4便宜。
单模方案里,功率预算比距离数字更重要。以40G LR4为例,典型发射光功率范围0~3.5dBm,接收灵敏度约-11.5dBm,中间允许的总损耗就是链路预算,大概11dB以上。假设发射功率-1dBm,2公里光纤在1310nm窗口的衰减约0.4dB(0.2dB/km×2km),两个法兰连接器各0.5dB,那么接收端光功率约为-2.4dBm,距离灵敏度余量还有约9dB,这个链路就是非常稳的。
反过来,如果链路里有熔接点、分光器,或者用了劣质跳线,损耗可能蹭蹭往上走。查这类问题我的习惯是:先用光功率计在接收端实测接收光功率,再和模块DDM上的RX Power读数比对。两个数字偏差不大,说明模块自身监测是准的,问题大概率出在链路损耗上。如果偏差很大,那就要怀疑模块内部的光路或者DDM校准了。
3.3 BiDi单纤双向:老布线改造的省钱方案
除了传统双纤方案,40G还有一种经常被忽略但很实用的形态:BiDi,即单纤双向。光特通信这类厂商一般也会提供对应型号。
40G BiDi模块外观上是双工LC接口,原理是一根光纤里同时传两个方向的光,分别用两个不同波长(比如850nm和900nm附近),另一根光纤再对称传输,这样两根光纤一共提供4路10G通道,等同于SR4的带宽,但线缆只需要两根单纤——比传统MPO的12芯简单得多。
BiDi最大的吸引力在于和老万兆双工LC布线兼容。如果你的机房里布满了LC双工跳线(以前10G时代留下的),用BiDi模块可以直接复用,不需要换MPO预端接布线。在改造工程里,这能省下大量换线的时间和成本。BiDi的距离范围和多模SR4类似,OM3/OM4光纤上一般做到100米到150米。
要注意的是,BiDi对光纤端面质量和洁净度更敏感。它两个方向的光共用同一根纤芯,如果端面脏或者有微裂纹,双向信号都会受影响,容易引发“功率正常但误码率高”的隐蔽问题。所以BiDi链路我会更严格地执行清洁流程,每次拆插都先擦一遍再上。
3.4 DAC、AOC、光模块加裸纤,三种形态怎么挑
这是现场选型时被问得最多的问题。三种形态各有适用边界:
- DAC高速铜缆:距离3米以内(最长到5米),模块集成在线缆两端,无光器件,成本最低、功耗最低、时延最小,适合机柜内ToR到服务器的短直连;
- AOC有源光缆:3到100米,模块集成在线缆两端,内部完成光电转换,用户不需要插拔光模块,省心,但坏了要整根换,没法单独换模块或线;
- 光模块加光纤跳线:最灵活,模块和线缆分开采购,哪里坏了换哪里,还能搭配不同类型的光纤做距离扩展,是最主流的方案。
我个人的偏好是:超过5米就别用DAC;连接数不多、想省预算的话,直接光模块加跳线;链路很多且追求施工速度,AOC确实省事,但贵一些,维护时得备整根线。三种方案的价格会随市场波动,但长期排序基本不变:DAC、光模块加跳线、AOC。
4. 适配各种需求:把40G方案落到具体场景
4.1 按距离和场景选配模块的速查表
这里给出一份我常用的方案表,基本覆盖了常见40G应用场景:
| 场景 | 距离范围 | 推荐方案 | 接口类型 | 备注 |
|---|---|---|---|---|
| 机柜内互联 | 3米以内 | 40G DAC铜缆 | QSFP+ | 零光路故障,功耗最低 |
| 相邻机柜/列间 | 3到100米 | 40G SR4或AOC | MPO/QSFP+ | OM3/OM4,注意MPO极性 |
| 楼层/楼宇内 | 100到400米 | 40G eSR4或PSM4 | MPO/QSFP+ | 预算足用eSR4,要求稳用PSM4 |
| 园区/DCI短距 | 400米到10公里 | 40G LR4 | LC双纤 | 单模OS2光纤,最远10km |
| 纤芯紧张场景 | 100米内 | 40G BiDi | LC双纤 | 兼容老10G布线,注意清洁 |
这张表不是死答案,但现场决策时可以按“距离、光纤类型、端口形态、预算”的顺序往下走。多数情况下,你只需要确认链路距离和现有的光纤类型,就能圈定两三个候选型号,再结合价格做决定。
4.2 兼容性处理与厂商锁码
光模块行业有个绕不开的问题:兼容性。虽然40G QSFP+遵循MSA标准,物理上插得进去就大概率能通,但有些交换机和网卡厂商会在固件里校验光模块的EEPROM信息,包括厂商代码、型号、序列号、DDM能力等。不在白名单里的模块可能直接点不亮、亮黄灯,甚至端口都被禁用。
应对思路很简单:选兼容模块之前先查目标设备的兼容列表。光特通信这类模块厂商通常会给主要设备厂商提供兼容版本,采购时直接问技术支持要一份对应型号的兼容矩阵。如果设备比较小众,宁可买之前先借样品测试,也不要盲买一批。
如果模块插上去不亮,可以先检查模块自身的EEPROM信息是否符合设备要求。在Mellanox网卡环境下,可以借助一个我强烈推荐的工具:mlxlink。它对光模块和线缆的物理层诊断特别专业,比单纯的ethtool -m能看更细的信息,后面专门讲。
4.3 上电验证与DDM监控
新模块到位后,别急着把业务割接上去。我习惯的验证流程是三步:
- 插上模块,看设备侧是否识别到型号和速率,端口状态是否UP;
- 在设备上查看光模块DDM信息,包括温度、电压、TX/RX功率、TX bias,确认四路收发电平在正常范围;
- 做流量打流测试,观察误码和丢包,确认链路质量。
在交换机上这条命令一般是show interface transceiver,在Linux服务器或Mellanox网卡环境下则用ethtool -m或mlxlink。DDM里最值得关注的是RX Power是否靠近灵敏度下限、TX Power四路是否均匀、温度是否过高。有些模块工作温度上限是70°C或85°C,机柜里散热不好就该注意,尤其是那种高密度线卡,模块挨着模块,热量散不出去,夏天很容易报警。
我遇到过不止一次:模块点亮了,链路也UP,但业务一上量就丢包,查下来发现RX Power只有-10dBm,靠近灵敏度极限。这种情况就是“能点亮不代表链路健康”,所以打流测试这一步绝不能省。
5. 常见故障与诊断实战:物理层丢光怎么查
5.1 在Mellanox环境下用mlxlink做物理层诊断
如果你手头的环境是Mellanox(NVIDIA)的ConnectX-4/5/6网卡,且插着40G光模块或线缆,那么mlxlink工具是我实测下来最好用的诊断利器。它专门用来查看和测试端口物理层状态,尤其是光模块的EEPROM信息和线缆的合规性。
先看模块信息,指定网卡设备名:
mlxlink -d mlx5_0 -m-m参数(module)会列出该端口光模块的详细状态,包括模块类型、支持速率、线缆长度等级、激光器类型、DDM支持情况,以及每个通道的收发光功率、温度、电压。如果模块插入后设备不认,这个命令也能直接显示EEPROM读取失败或模块未被识别等错误。
再看线缆和连接状态,用-c参数:
mlxlink -d mlx5_0 -c-c参数(cable)会检查线缆状态、两端的链路信息,以及是否支持相关诊断。如果链路起不来,这个命令通常会给你一个明确的错误类型,比如“线缆问题”“模块问题”还是“对端未接”。
mlxlink比单纯用ethtool -m能看到的信息更深,它能读很多物理层错误计数器,但命令本身是只读诊断,不改配置,所以在排查时怎么折腾都不会把网络弄坏。多数模块故障,比如发送光功率为0、接收光功率为0、EEPROM读取失败,都会被直接列出来,省去不少猜谜时间。
5.2 常见故障速查表
结合我自己踩过的坑,整理一份面向40G链路的常见问题表:
| 现象 | 可能原因 | 排查方向 |
|---|---|---|
| 端口灯不亮、UP不起来 | 模块不兼容、模块损坏、光纤端面脏、极性不对 | 查看DDM是否能读到模块信息,换线/换口/换模块交叉测试 |
| 四路中某一路TX/RX功率异常 | 耦合不良、激光器老化、MPO某一芯断 | 用DDM看每一路的功率,单独比对 |
| 能UP但大量误码 | RX功率过低、光纤过度弯曲、端面污染 | 实测接收光功率,清洁端面,检查光纤转弯半径 |
| 温度警告、模块过热 | 机柜散热不足、模块发射电流过大 | 看DDM温度,加强散热或换低功耗模块 |
| 模块被设备“不认识” | 兼容性问题、EEPROM信息异常 | 换兼容版本、联系厂商核对兼容列表 |
| BiDi链路功率正常但丢包 | 端面污染、双波长串扰 | 用专用清洁笔反复清洁,插拔几次测试 |
排查物理层问题,我的思路永远是“先物理后逻辑”:先用眼睛看端面,再用DDM或命令看数据,最后才考虑协议层。光纤端面污染是最常见的隐形杀手,肉眼根本看不出来,但损耗可能已经加了2到3dB——这也是为什么我常备一根光纤清洁笔,走到哪带到哪。
5.3 一套可复制的现场排查流程
最后分享一套我自己在现场重复使用、几乎没失手的排查流程:
- 确认模块在兼容列表内,必要时换已知正常的模块或线缆做交叉验证;
- 查看DDM模块四个通道的TX/RX功率,判断是发射端问题还是接收端问题;
- 对损伤光纤和连接器进行清洁,用专用清洁笔或一次性光纤清洁布,别用嘴吹;
- 检查线缆端接是否牢固、MPO极性是否正确、光纤弯曲半径是否达标;
- 如果链路距离卡在临界值,换成更高规格的光纤或模块,比如OM4替代OM3、eSR4替代SR4;
- 最后用打流工具验证,确认无误码后再交付。
这套流程听起来朴素,但90%的“疑难杂症”都是在这一步一步排除中解决的。很多人一上来就怀疑交换机配置和路由问题,结果查半天发现就是模块和线缆之间的脏污或极性错误。
我个人在实际操作中的体会是,40G光模块的选型真不是看一个“40G”参数就能定的。有一次在机房里为了赶时间,我直接拿了SR4模块接在长距离的单模光纤上,链路死活不起来,最后查了兼容矩阵才发现距离和光纤类型根本不匹配。从那以后,我给自己定了个规矩:先量距离、再定多模单模、再选具体型号,最后按流程验证。如果你也在搞40G机房互联,拿不准就多问厂商要兼容列表和测试样品,把现场的距离、光纤类型、设备型号一次说全,能少不少来回折腾的时间。