☰
光模块基础知识全解:从SFP到QSFP28、Pin脚定义与故障排查
2026/10/6 6:52:15 网站建设 项目流程

干网络这行,绕不开光模块。不管是数据中心里那几十万个高速互联的光口,还是园区网到城域网的传输链路,甚至家里那根从弱电箱穿出来的光纤,背后都靠光模块在做光电转换。我这些年调试过的设备不算少,SFP、SFP+、XFP、QSFP、QSFP28一路换过来,踩过的坑也攒了一堆,今天索性以"光模块基础知识"为题,把光纤和光模块这对搭档的关系、模块分类、核心参数、QSFP28的Pin脚定义以及日常排查经验,一次性讲透。

这篇内容首发给自己人看,如果你刚进机房没几年的新人,或者正准备做网络改造、架构选型,又或者你已经拿了模块在手却看不懂数据手册里的引脚图,那这篇应该能帮你省不少时间。我尽量把话说明白,不堆术语,遇到必须解释的地方就用大白话拆开讲。先从一个最朴素的问题开始:光模块到底是个什么东西。

1. 光模块到底是什么——先把这个"电-光-电"盒子拆开看

光模块的官方定义很绕,但本质上它就是一台微型"光电转换器"。交换机、服务器网卡内部跑的都是电信号,而光纤里传的是光信号,两者之间必须有这么一个小盒子,把电转成光发出去,把光转成电收进来。你说它是"语言翻译器"也好,说它是"码头装卸工"也好,反正它夹在电接口和光纤中间,负责把两边对接上。这个定位决定了它的所有设计逻辑:一边要匹配铜线接口的1.8V/3.3V逻辑电平,一边要驱动激光器,还要解调从光纤里微弱的、以纳瓦为单位的接收光功率。

模块内部拆开看,发射端主要有三块:激光器(常见的有VCSEL、DFB、EML,各自适用不同距离)、激光器驱动芯片,以及用于功率控制的光控电路。驱动芯片把高速电信号调制成激光器的工作电流,激光器发出的光经过耦合透镜、隔离器,准确注入光纤纤芯。接收端则是一路反向流程:光信号先打到光电探测器上,PIN型探测器适合短距中低速率,APD型探测器带有雪崩增益、适合长距微弱信号;探测器输出的微小电流经过跨阻放大器(TIA)变成电压信号,再经过限幅放大和时钟恢复,还原成交换机芯片能识别的电信号。

很多新手会有个误解,觉得光模块的速率是由光纤决定的,其实光纤只是"公路",模块才是"车"。10G模块插在25G光模块上工作,链路只会跑在10G速率;25G模块插在交换机10G口上,大概率协商不上。关键是谁在发光、谁在收光、双方的速率和编码方式是否匹配。模块里那颗激光器能多快开关,探测器能多快响应,直接决定了这条光链路的速率上限。换句话说,光纤的好坏影响的是光损耗和质量,而速率上限是模块决定的。

我举个例子方便理解。把光纤比作自来水管道,光模块就是泵站加净水厂的结合体。发射端的激光器是泵,负责把水压出去;接收端的探测器是净水仪表,负责看进水的流量和水质。泵的功率、仪表的灵敏度、管道的粗细和长度,三者共同决定了这条链路到底能输送多远、多大流量。单改管道不改泵,或者换个好泵却用细管,都会出问题。这也是为什么后面要花很大篇幅讲"光纤和光模块怎么匹配"。

2. 光纤和光模块的配对:波长、单多模、链路预算怎么算

有了模块还得有光纤,二者是绑定关系。光纤分两大类:多模光纤和单模光纤。多模光纤纤芯粗,常见直径50微米或62.5微米,光线在纤芯里走折线,多个模式同时传播,适合几百米以内的短距;单模光纤纤芯只有9微米左右,光线基本沿直线前进,模式单一,损耗小、带宽高,适合从两三公里到上百公里的场景。判断一根光缆是多模还是单模,最简单的办法是看成缆标志或者护套颜色,传统上多模用橙色或水蓝色护套,单模用黄色护套。当然这不是绝对标准,有些室内混用缆就是统一的黑色护套,最好看印字OVM还是SM。

模块和光纤的匹配,第一步就是波长对齐。数据中心里最常见的短距模块是850纳米波长,配多模光纤,适用范围从10米的跳线到100米、300米不等,取决于光纤等级和模块支持的协议。1310纳米波长通常用于城域和长距单模传输,常见10公里、40公里模块基本都是这个波段。1550纳米受光纤的实际损耗系数影响最小,常配合WDM波分系统做长距传输,比如80公里、120公里的光模块,很多走的就是1550纳米。光模块上标的数字,中心波长是一个参数,传输距离是另一个参数,两者不要看混。

选型时最容易出问题的,是很多人把模块标的"距离"当成硬性要求,觉得模块标10公里就必须用满10公里链路,或者只能用在这条不到2公里的链路上。事实上,决定链路能否正常工作的核心指标是链路预算,也就是发射光功率减去接收灵敏度之后,还能留出多少余量给光纤损耗、熔接点损耗、法兰盘插损和老化余量。举例:某千兆单模模块的发射光功率是-3dBm到-9dBm,接收灵敏度是-20dBm,在最差发射光功率-9dBm的情况下,链路预算大约11dB。如果这一段2公里的光纤实际损耗只有1dB,再加上几个法兰盘总共1dB接口损耗,总共也就2dB左右,那是绰绰有余的。相反,如果链路有45公里,光纤损耗按0.3dB/km都要13.5dB,再加上熔接和法兰损耗,预算就不够了。所以光模块的距离标注只是"参考值",真正要算的是链路预算。

再说一个极容易踩的坑:多模光模块千万别插单模光纤,单模光模块也别插多模光纤。先说前者,多模模块发的是850纳米,耦合进单模光纤后能量会大部分泄漏掉,接收光功率可能直接低于灵敏度,根本不工作。再说后者,单模模块的1310纳米激光打在多模纤芯里,会产生大量的高阶模式,接收端看到的就是一串乱码一样的信号,误码率居高不下。我自己就见过有人把40公里单模模块插在OM3多模跳线上测试,结果链路一跑起来全是错包。查了半天,最后换一根单模跳线,马上正常。这类问题用眼睛看色标最容易定位,黄色单模、橙色多模,别嫌麻烦。

3. 光模块的分类与核心参数:从SFP到QSFP28再到QSFP-DD

光模块的分类维度很多,最常见的分类是按封装类型和速率来分。封装决定了模块的物理形态、金手指定义和适用的设备插槽,速率决定它能跑多快的业务。这两者往往捆绑在一起,比如SFP封装早期承载千兆速率,后来演进到SFP+承载10G;QSFP封装最初做40G,后来QSFP28做100G,再到现在的QSFP-DD做400G。

封装的演进本质上是一场"端口密度"之争。早期10G模块用XFP,体积比SFP大一圈,一块线卡上能插的位数有限。后来大家把4个10G通道塞进同一个小体积里,做成了QSFP+,一个口就是40G,线卡端口密度一下子提升了4倍。QSFP28同理,把4个25G通道挤进QSFP同样的外壳,单端口速率到100G,密度和散热控制又向前迈了一步。现在主流的400G数据中心,要么用QSFP-DD(把8个50G通道塞进去),要么用OSFP,逻辑都是一样的:在有限的面板面积里塞进更多的高速通道。

具体封装和速率的对应关系,我做了一张简表,方便平时查询:

封装通道×速率常见速率典型场景
SFP1×1G千兆企业网接入、语音、管理口
SFP+1×10G10G数据中心接入、园区骨干
XFP1×10G10G早期10G线路,逐步退场
QSFP+4×10G40G汇聚、DCI短距
QSFP284×25G100G数据中心TOR到LEAF、城域100G
CFP/CFP24×25G或10×10G100G/200G传输设备、波分线路侧
QSFP-DD8×50G400G大型数据中心主互连
OSFP8×50G400G新型数据中心,散热优先

选型的时候不能只看封装和速率,还有一组核心参数必须逐条核对,我建议每拿到一款模块都形成这样的参数记录表:

参数含义我的实际判断经验
中心波长850nm/1310nm/1550nm等必须和光纤类型匹配
工作速率1G/10G/25G/100G/400G两端设备口速率必须一致或可协商
最大传输距离100m/10km/40km/80km看链路预算,不是绝对值
接头类型LC/UPC/APC/MPO弯头和研磨方式会影响反射损耗
发射光功率-9dBm~-3dBm等看最小值是否够链路预算
接收灵敏度-20dBm等接收光功率需比该值多留2~3dB余量
功耗1.5W/3.5W/10W不等影响散热设计和供电选型
DDMA功能支持/不支持运维必须选带DDM监测的模块
工作温度商业级0~70℃/工业级-40~85℃室外机柜选宽温,机房用商业级

这里专门说下接口类型。很多模块用的是LC双芯接口,接两个光纤插芯,一收一发。40G/100G SR4这类模块用MPO/MTP多芯接口,一个头带8芯、12芯甚至16芯光纤,里面同时有4对收发通道。MPO接口对插芯的清洁度要求极高,哪怕一个光纤孔里有脏污,整条链路的误码率都会飙上去。所以我做运维时有个习惯,凡是MPO接口的模块,插拔前必用端面检测仪看一遍,绝不偷懒。

还有一类分类是按传输介质协议来的,比如以太网用的10G/25G/100G BASE系列,还有光纤通道FC、InfiniBand NDR/HDR、OTN等。不同协议下的相同速率模块,编码方式和信号电平不完全相同,混插可能造成端口不识别。现实里最常见的是某型号交换机只认自家光电转换协议,别的模块插上去能发光,但就是"不认",这属于兼容性问题,后面章节会用案例专门讲。

4. QSFP28光模块的Pin脚定义详解——拿手册别发怵

很多硬件工程师和运维工程师看到模块的Pin脚定义就头大,图上密密麻麻的引脚名,不知道从哪看起。我以QSFP28为例拆一遍,搞懂这一种,QSFP+、QSFP-DD这类同族封装的理解就顺了大半。QSFP28沿用的是QSFP封装体系,物理上定义了38个金手指触点。这38个pin按功能可以分成三块:电源与地、管理系统接口、高速差分管脚。你可以把这三块理解成一个大楼里的"供电房""保安室"和"办公区"。

电源部分最关键的是Vcc_Tx和Vcc_Rx,模块内部把发射端和接收端的电源分开供电,好处是发射端激光器的突发电流不会干扰到接收端的微弱模拟信号。这是高频设计里非常典型的做法——敏感模拟电路和最脏的数字供电隔离。代价就是你做硬件设计时得注意PCB上的滤波电容布局,不能简单把所有Vcc都并在一起。

管理接口部分有一组I2C总线,就是SDA和SCL,这组信号线从系统侧连接到模块内部的EEPROM和数字诊断芯片,用来读出模块的型号、序列号、光功率、温度、电压等DDM数据。与之配套的还有几个重要的控制信号:ModSelL是片选,系统要访问某个模块时先拉低对应的片选;ModPrsL是模块在位信号,模块插进去后这个引脚被拉低,系统据此判断"有模块";IntL是中断信号,模块检测到异常(比如温度过高、光功率低于告警门限)时主动通知系统;ResetL是复位信号,有效时模块主控被复位;LPMode是低功耗模式,需要降功耗时系统把它拉高。看到LPMode,记得别让模块一直处于高电平,否则正常盒子可能莫名其妙进低功耗,光口down掉。

高速差分管脚总共8对,4对接收RX1±到RX4±,4对发送TX1±到TX4±。这也是QSFP28这个名字的来源:4个通道(Quad),每通道25G,放下一个100G的光口。Pin脚分组我整理了个速查表,方便对图:

Pin功能方向与说明
1, 12, 8, 24, 28GND公共地
2Vcc_Tx发射端电源
7Vcc_Rx接收端电源
3ModPrsL模块在位状态输出,低有效
4SDAI2C数据线
5SCLI2C时钟线
6ResetL复位输入,低有效
9LPMode低功耗模式输入
10IntL中断输出,低有效
11ModSelL片选输入,低有效
13~24RX1±~RX4±4路高速接收差分对,从高到低排列
26~36TX1±~TX4±4路高速发送差分对,从低到高排列

这个表的排列并不是按物理顺序把所有引脚连着走的,我建议看手册时始终先看信号类型,再找对应pin号,别背"几脚是什么功能"这种死数据。因为不同封装修订版本之间存在细微差异,比如后来一些厂商为了兼容4×25G NRZ和100G PAM4信号,对部分管脚的均衡和监测做了改动,虽然物理外形和金手指没变,但内部的HCM(Host Common Mode)管脚定义可能有版本差异。你在做硬件连华不少. 最关键的一点:凡是涉及引脚定义,一定以模块规格书和你自己设备主板原理图为准,网上抄来的表只能当参考,不能当依据。栽在这个上面的案例太多了,画板时少接一个GND,高速信号的回流路径就可能绕一个大圈,眼图开着花。

再教大家一个看差异管脚编号的最快方法。拿到模块后,把金手指朝自己、卡扣朝上,最左边是最小Pin号,从左往右依次增大。一般PDF的手册页会标注"top view"还是"bottom view",注意你面对的是顶部还是底部的引脚图。方向搞反了,把TX成RX,那设计基本就废了。PCB布局时,高速差分对要严格走差分阻抗,QSFP28的差分阻抗是100欧姆,过孔和换层尽量少,长度匹配也要控制好。管脚间距只有0.4mm左右,焊盘旁边塞去耦电容的时候,位置稍偏就可能短路,所以画封装时千万留够余地。

5. 光模块的应用场景与选型实战:数据中心、园区网、城域波分

光模块在不同场景里的选型逻辑差别巨大。先说数据中心。数据中心内部链路通常很短,机架内TOR到服务器网卡一般三五米,跑10G或25G用多模SR模块就行;TOR到LEAF交换机可能用到100米到300米,OM4多模加100G SR4模块是常见组合;跨建筑互联或到城域POP点,距离超过500米,就得切换单模,10km或40km的100G模块派上用场,长距离甚至还要上相干光模块。

数据中心场景最看重的是端口密度和功耗。同样一个面板面积,QSFP28能出4个25G通道,而SFP+只能出1个10G口,差距巨大。功耗方面,一个QSFP28模块动辄3.5W,一张线卡上插满36个模块就是120W以上,风扇和电源余量必须提前算进去。很多人只在选交换机时纠结带宽,忘了上面还挂着上百瓦的光模块功耗,结果放到机柜里发现散热压不住,只能降低端口速率。这都是现实里非常常见的事。

园区网和运营商城域网是另一套逻辑。园区里从汇聚到接入楼栋之间,常见的是1G/10G单模模块,距离从几百米到几公里,用1310nm收发一体模块就足够。城域网里更常见的是把多个10G或100G业务波分到一根光纤里,每个业务波长不同,这时光模块的选择就要跟着波分板卡走,不再是一对一的简单互插。这些场景里我特别强调"兼容性验证"。很多高端交换机、路由器厂商会在设备固件里做白名单校验,非本厂模块可能拒绝启动或只降速运行。我的经验是:选第三方兼容模块时,先让对方提供兼容性测试报告,并留出测试窗口,插上去跑至少24小时大流量,温度、光功率、误码都稳定了再批量买。有时候便宜模块标称功耗很低,但实际工作电流却偏高,多插几块就把机框背板的电源熔丝顶爆了。

还有一个常被忽略的场景是长距传输设备的光模块,也就是通常说的线路侧光模块。这种模块和数通交换机上的"客户端口"模块完全不同,内部往往集成了DSP芯片,使用相干调制技术,信号速率高、接收灵敏度可以达到-20dBm以下甚至更低,能传100公里以上。这类模块的价格通常是普通模块的几倍到几十倍,而且引脚定义、供电要求和机械尺寸差异很大,维修时千万不要拿普通光模块的插槽去硬塞线路侧模块,否则轻则接触不良,重则烧毁接口电路。

6. 日常维护与故障排查:光功率告警、DDM读数、误码判断

光模块故障排查是有规律可循的,我总结了一个"三步定位法":先看灯和告警,再看DDM光功率,最后做端口倒换。第一步,设备面板上光口有LNK灯,不亮说明链路物理层有问题,或者有LOS告警;有时候灯亮但误码率奇高,这种属于信号质量很差,需要看DDM读数。第二步,进入设备命令行或者管理平台,查看模块的温度、电压、发射光功率、接收光功率这四个核心值。第三步,把模块和光纤倒换一下,如果能定位是侧的问题还是链路的问题,问题就缩小了一大半。

读DDM光功率是我最想推荐大家养成习惯的。很多模块的接收光功率不当,会导致严重的错包。健康的链路,接收光功率应该比接收灵敏度高至少2~3dB。比如灵敏度是-18dBm,接收光功率在-15dBm附近通常都是正常的;如果接收光功率已经接近-17dBm,就应该开始关注了;一旦继续恶化到-19dBm,链路基本会出现LOS。当然,光功率也不是越大越好,收端超过过载点(一般-3dBm左右)同样会出符号错误,甚至可能打坏探测器。这就像两个人说话,嗓门太大把对方耳朵震麻了,比听不见还难受。

经验速查表,直接收藏:

现象可能原因排查动作
模块完全无光、设备报LOS模块未供电、LPMode被拉高、兼容性校验失败检查端口配置、供电状态,放LPMode电平,换验证过的模块
接收光功率为-40dBm以下光纤未接好、法兰头松动、光纤断裂、弯度过大重新插拔光纤,光功率计逐段测,检查弯折半径
接收光功率偏高接近过载点使用短跳线但模块是长距模块,或者光纤衰减过小增加固定光衰器,或更换与实际距离匹配的模块
温度告警超50℃通风不良、高密度端口全部满载、模块功耗过大清理防尘网、加装盲插面板、降低转速策略
误码率持续升高但光功率正常光纤端面脏污、连接器反射过大、信号劣化用端面检测仪检查光纤插芯和模块光口,清洁后重测
模块插槽识别不到型号金手指氧化、槽位弹片变形、I2C总线异常重新插拔,检查槽位弹片,尝试换槽位交叉验证

看到接收光功率数值异常,先别怀疑模块坏了。最常见的还是光纤端面脏污,这个问题占了光链路故障里至少一半的比例。我曾经在一个工程现场排查了整整一下午,最终发现是跳线的LC插芯边缘粘了一点灰,用端面检测仪一看,整个端面像撒了芝麻一样。处理办法很简单:用专用的光纤清洁笔或者无尘清洁带,轻轻擦拭插芯端面,注意只能朝一个方向擦,不能来回蹭,否则反而会把脏污磨进插芯。模块的光口比较脆弱,有条件就用一次性清洁棒,插进去转一圈就抽出来,干净利落。

再讲一个兼容性排查案例。某设备插上第三方100G SR4模块,物理链路都是好的,光功率也正常,但端口始终协商不到100G速率,状态反复up/down。用命令行查看,发现模块读取出来的厂商信息为空,DDM数据也不断跳变。判断是I2C通信时序不兼容,模块内部EEPROM读取超时,设备固件无法完成完整的初始化握手。解决方式是先升级设备固件到支持该模块白名单的版本,并且把模块的序列号信息反馈给厂商做二次烧录。这件事也说明了一个道理:很多"模块不识别"不是光学问题,而是管理通道问题。所以调试时不要只盯光功率,也要看主机平台有没有正确读到模块的EEPROM内容。

插拔模块的操作规范也得提一嘴。光模块是热插拔器件,但"可以热插拔"不代表"随便折腾"。正确的做法是先确认模块已解锁、光纤已经从模块上取下或松弛,然后夹住模块的拉手,水平用力慢慢拔出。禁止直接拉着光纤把模块拽出来,这个动作很容易把光纤插芯的陶瓷端面磕碎,一旦端面有破损,光链路瞬间报废,更换的还不只是模块,连跳线也得一起换。加插模块时,注意金手指对准底板导向槽,稍微倾斜插入,到底后再合上卡扣,听见"咔嗒"一声才算到位。

7. 一点个人经验,关于光模块的长期运维

前面把光模块的基础知识、分类、引脚定义和排查方法都说了一遍,最后分享几个我在长期运维中觉得特别有价值的小习惯,都不是什么高深理论,但确实能给你省事。第一个习惯,建一份"光口健康台账"。给每台设备、每个光口建立一条基线记录,包含模块型号、序列号、发射光功率、接收光功率、温度,每月批量采集一次。有基线数据在手,故障时一对比就知道光衰是突发还是渐变,判断问题的效率完全不一样。

第二个习惯,手边常备一个光纤端面检测仪,不贵,但作用极大。不管是新到货的跳线、新拿出的模块,还是准备插回去的光口,一律先看端面再动手。我见过太多团队,折腾了半天链路问题,最后发现不过是跳线端面有一块污渍,白费几个小时。端面干净的习惯养成后,光链路的整体故障率能肉眼可见地降下来,这句话没有夸张成分。

第三个习惯,不要贪图极端便宜去买无DDM功能的光模块。带DDM的模块虽然贵十几块钱,但能实时告诉你温度、电压、光功率,排查故障时这就是你的眼睛和耳朵。省掉这十几块,可能换来一次加班的故障定位时间,极不划算。你自己算算,一次深夜割接的代价,够买多少只正经模块了。最后一个建议,模块报废别随手扔进普通垃圾桶,光模块体积虽小,里面的激光器对某些材质还是有一定要求的,很多设备厂家有回收计划,顺手做回收,省心也环保。

说了这么多,光模块这潭水看着深,实际拆开也就是电、光、管理三件事,把三件事分开对待,任何问题都有脉络可循。下次再遇到光口down或者误码告警,希望你能先想起这篇里那张速查表,多给自己留一点余地,也给设备留一点余量。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询