如果你接触过蛋白质组学,不管是在实验室里跑样品,还是只看过几篇组学文献,质谱这四个字大概是绕不开的。我第一次碰质谱,是研一时候帮师兄做蛋白鉴定,那时候对MALDI-TOF和ESI-MS/MS的概念一头雾水,只知道把靶板推进仪器,等几分钟出一堆峰,然后师兄对着电脑说“这个是某某蛋白”。后来轮到自己接手课题,才慢慢意识到,这些峰背后是一整套从电离、质量分析、碎裂到数据库搜索的逻辑。这篇文章就想把这些基础东西掰开讲清楚:MALDI-TOF和ESI-MS/MS到底在蛋白质组学里扮演什么角色,肽段是怎么被鉴定出来的,定量又是怎么实现的。适合刚进组的同学、想补质谱底子的生物背景研究者,以及所有对蛋白质组学“知其然而不知其所以然”的人。
1. 蛋白质组学为什么绕不开质谱
1.1 蛋白质是功能的执行者,但测起来很麻烦
基因组测序告诉我们“可能有什么”,转录组测序告诉我们在RNA水平“可能正在准备什么”,但真正干活的往往是蛋白质。跑通一条信号通路、催化一个代谢反应、维持细胞骨架,靠的都是蛋白质直接执行。问题在于,蛋白质的丰度、修饰状态和亚细胞定位,和mRNA水平并不是严格对应的关系,有时候mRNA上调了但蛋白根本没变,有时候蛋白被磷酸化修饰激活了但总量一点没变。所以想真正理解一个生物学过程,蛋白层面必须要看。
但蛋白本身不好测。二十种氨基酸排列组合出成千上万的蛋白,没有PCR那样能直接扩增蛋白的手段,抗原抗体反应又只能针对已知靶标。质谱是少有的高通量、无偏方法:它不依赖预先知道你要找什么,而是直接把肽段的质量和碎裂信息变成可计算的数字,再通过这些数字去数据库里匹配出蛋白身份。这也是为什么蛋白质组学里讨论质谱的篇幅永远占大头。
1.2 主流玩法叫Bottom-up,先切成肽段再鉴定
现在做蛋白质组学,绝大多数是Bottom-up策略,中文常叫“自下而上”或“鸟枪法”。思路很直白:完整蛋白太大,而且不同蛋白的溶解性、分子量差异巨大,直接进质谱既难电离又难碎裂,数据库匹配也不现实。所以先把蛋白用蛋白酶(最常用胰蛋白酶)切成十几到几十个氨基酸的肽段,再对这些肽段做质谱分析,最后通过肽段的序列拼回蛋白身份。
肽段做质谱有几个天然优势:分子量小,ESI电离效率高,碎裂模式更规律(主要在肽键处断裂),而且液相色谱能很好地分离它们。整套流程下来,一套体系可以同时鉴定几千甚至上万个蛋白,这在完整蛋白层面几乎做不到。所以理解蛋白质组学质谱,本质上是理解“如何让肽段在质谱里被看见、被测量、被匹配”。
1.3 电离方式是整个故事的起点
质谱里有个核心概念:质谱只能测量气相离子,样品不管原来是什么状态,先进去一定得变成“带电的气体分子”。这一步骤叫电离。蛋白质组学里最常见的两种电离方式,就是MALDI和ESI。名称看起来吓唬人,但本质只解决一个问题:让一个不挥发、不耐热的蛋白或多肽,变成能飞进质量分析器里的离子。
MALDI和ESI的发明者后来都拿了诺贝尔化学奖(2002年,与Fenn和Tanaka相关),足见这一步对整个生命科学领域有多关键。而这两者分别对应了两种完全不同的应用场景:MALDI适合快速、相对简单的样品;ESI则适合和液相色谱联用,做深度、高通量的组学鉴定。搞清楚二者的分工和原理,后面所有内容都好理解。
2. MALDI-TOF实测盘点:它能干什么,不能干什么
2.1 原理级的理解:基质、激光与飞行时间
MALDI全称是基质辅助激光解吸电离,读起来长,拆开就好懂了。样品先和大量的小分子基质(如CHCA或SA)混合,滴在金属靶板上干燥,形成共结晶。然后仪器里一束激光(通常是氮气激光337 nm或固体激光355 nm)打到结晶上。基质的作用是吸收激光能量,它吸收效率远超分析物本身;激光轰击瞬间,基质发生相变和膨胀,把样品“带”到气相,同时完成质子转移,让分析物带上电荷。整个过程是“软电离”,也就是说肽段或蛋白基本不会被打碎,看到的通常是完整的分子离子峰,比如[M+H]+。
TOF是飞行时间质量分析器。原理特别朴素:所有离子先在同一加速电场里获得相同的动能,然后飞过一根一定长度的无场飞行管。质量轻的飞得快,质量重的飞得慢,记录从起始到检测器的时间,换算即可得到质荷比(m/z)。加一个反射器(reflectron)可以纠正初始动能分散,分辨率能显著提升。
信息量很大,但MALDI-TOF操作上有个很直观的体验:把靶板送进仪器,点几个孔,几秒钟出一张质谱图。这也是它“快”的来源。
2.2 MALDI-TOF的几个典型应用场景
在实际工作中,MALDI-TOF最常见的角色不是深度蛋白质组学,而是“快速鉴定已知身份”。几个典型场景我现在都还在用:
- 蛋白纯品验证:表达纯化一个重组蛋白,想知道分子量对不对、有没有降解,MALDI-TOF点一下就能看到主峰,非常省事。相比SDS-PAGE,它还能给出精确的质量偏差。
- 肽质量指纹图谱(PMF):把蛋白胶条切下来酶切,提取肽段,MALDI-TOF测出所有肽段的精确质量,再和理论酶切肽段列表比对。这个方法是早期的蛋白鉴定思路,现在做单个蛋白鉴定仍然有用。
- 微生物鉴定:临床和疾控常用的微生物质谱鉴定,本质上也是MALDI-TOF测微生物蛋白指纹,再和数据库比对,几秒就能定到属/种。这是MALDI-TOF目前商业化最成功的应用之一。
- MALDI成像:组织切片上覆盖基质,逐点扫描,可以绘制某种肽段或蛋白在组织里的空间分布。这个方向很热门,本质还是MALDI在二维空间上的逐点质谱采集。
2.3 为什么组学深度鉴定不能只靠MALDI-TOF
MALDI-TOF虽然快,但有明显的天花板。最大的问题是离子抑制效应:复杂样品里大量组分一起进入离子源时,丰度高的会抑制丰度低的响应,导致低丰度肽段根本看不到。它和液相色谱的联用又不像ESI那么自然,因为MALDI是脉冲式电离,需要一个靶板收集馏分再逐个点样,通量和动态范围都吃亏。
还有一个限制是串联质谱能力相对弱。做序列鉴定时,单纯一个肽段的分子量信息往往不够,需要把肽段进一步碎裂并测碎片离子,而这恰恰是深度组学的核心需求。MALDI-TOF也有TOF/TOF串联模式,但做大规模组学鉴定时,效率和灵敏度还是不如ESI-MS/MS的体系。所以现在主流蛋白质组学实验室里,MALDI-TOF更多是辅助工具,深度鉴定的绝对主力是ESI-MS/MS。
3. ESI-MS/MS工作流一步步拆给你看
3.1 ESI是怎么“软”电离出多电荷离子的
ESI叫电喷雾电离,名字同样直白。肽段溶液通过一根很细的喷针,针尖施加高电压(通常是2-5 kV),溶液在电场中形成泰勒锥,然后在尖端脱出带电液滴。一路辅以加热干燥气或鞘气,液滴不断蒸发变小,表面电荷密度急剧升高,当电荷排斥力超过液滴表面张力时,就会发生“库仑爆炸”变成更小的液滴,重复这个过程,最终溶质以气相离子形式进入质谱。
ESI最妙的一点是它产生的离子经常带多个电荷,比如一个分子量2000 Da的肽段,带2个电荷时m/z只有约1000。这样即使样品分子量再大,也能落在大多数质量分析器可测量的范围里,这也是完整蛋白质也能用ESI测量的原因。另外,ESI是连续进样,天然适合连接液相色谱。色谱在前面按疏水性分离肽段,ESI紧接着把流出的溶液变成离子送进质谱,这一套组合就是LC-MS的基石。
3.2 MS/MS碎裂:b/y离子如何拼出序列
单靠MS1层面测一个多电荷离子质量,只能知道这个肽段的分子量,推不出序列。想要序列信息,得做串联质谱,也就是MS/MS。流程是:第一级质量分析器(比如四极杆)先选一个特定m/z的母离子,把它放进碰撞池,与氮气或氩气碰撞,肽段沿肽键断裂。断裂产物进入第二级质量分析器,得到碎片离子的质谱图。
肽段骨架断裂最典型的是酰胺键断裂。碎片保留N端部分的是b离子,保留C端部分的是y离子。两个相邻b离子或y离子的质量差,正好对应一个氨基酸残基的质量差,所以谱图里由小到大的y离子峰就像一把由短到长的尺子,能“数”出氨基酸序列。实际操作中你不一定手动读谱,但理解了b/y离子的意义,才能理解搜索引擎在干什么。
这个碎裂环节决定了Q-TOF、Q-Orbitrap这类仪器的基本架构。当前主流是用四极杆选择母离子,然后在碰撞池做HCD或CID碎裂,最后用TOF或Orbitrap检测碎片。
3.3 一台LC-MS/MS仪器的典型采集参数
组学实验室里常见的LC-MS/MS平台有Thermo的Orbitrap系列(Exploris、Eclipse等)、布鲁克的timsTOF、SCIEX的TripleTOF、安捷伦的Q-TOF等。不同平台参数细节不同,但核心采集模式类似。以最常见的DDA(数据依赖采集)为例,典型参数是这样一套逻辑:
- 先打一张MS1全扫,比如400-1200 m/z范围,分辨率6万或12万;
- 软件从MS1里挑强度排前10-20的母离子(所以叫Top-N方法,Top20很常见)逐个做碎裂;
- 对每个母离子设定一个隔离窗口,常见1.6-2.0 Da,确保只选到一个同位素峰簇;
- MS/MS的分辨率通常是1.5万或3万,扫描速度越快,单位时间能鉴定的肽段越多;
- 还要设动态排除,比如一个母离子鉴定完后30-60秒内不再重复选它,防止高丰度肽段反复占据采集名额。
实际调参时,源气、喷雾电压、离子传输管温度、碰撞能量(标准化CE,或者对电荷状态做阶梯能量)都会影响响应和谱图质量。我给过一个新手很直观的建议:拿一个标准Bsa酶切肽段先用仪器自带的Optimization流程跑一遍,确认基峰和总离子流图稳定了,再去跑真正的样品。
3.4 蛋白样品上机前的标准前处理
ESI-MS/MS再强,样品前处理不到位也白搭。我们实验室的标准流程大概是:
- 裂解:细胞或组织用含尿素和硫脲的裂解液(或者SDS/RIPA体系)充分裂解,超声或研磨打断核酸和粘稠度,低温离心取上清;
- 还原和烷基化:用DTT或TCEP还原二硫键,再加碘乙酰胺(IAA)把游离巯基烷基化。这一步很关键,不做的话半胱氨酸会形成二硫键,导致肽段酶切位点和状态不统一;
- 酶切:经典选择是Trypsin,37度酶解,常用过夜或高温快速酶切。酶和蛋白质量比一般1:50到1:100,看样品复杂度;
- 脱盐:酶切后的肽段溶液含有大量盐和尿素,直接进质谱会严重影响信号,用C18脱盐柱或StageTip清洗掉极性干扰物,洗脱后真空浓缩;
- 复溶上样:用0.1%甲酸水复溶,调整浓度到0.5-1 μg/μL左右,进LC-MS/MS。
每步都有坑。比如还原烷基化不彻底,你搜库时会看到半胱氨酸的修饰状态混乱,鉴定数直线下降;脱盐不干净,喷雾稳定性差,色谱峰前沿严重。这些我在后面第6章会展开说。
4. 数据库搜索:把MS/MS谱图变成蛋白名单的关键
4.1 搜索引擎怎么“猜”肽段
拿到一堆MS/MS谱图后,下一步不是人眼去读,而是交给数据库搜索引擎。原理可以理解为“对照实验”:我们把样本所属物种的蛋白数据库(比如人类UniProt库)在电脑里用同样的酶切规则(Trypsin)虚拟切一遍,得到所有理论上可能出现的肽段序列,再根据肽段质量算出理论母离子质量和理论碎片离子质量。接下来,用实际每张MS/MS谱图的母离子质量去筛候选肽段,再拿实际碎片离子与理论碎片离子比对,按匹配程度打分,得分最高的就是最可能的肽段序列。
这就像你手里有一把锁(实验谱图),数据库里有一堆钥匙(理论肽段),你不需要去理解钥匙怎么造出来的,只要一把把试,看哪把能打开。搜索引擎的本质就是在做“穷举+匹配打分”。
目前常用的搜索引擎有Mascot、Sequest、Andromeda(内置在MaxQuant里)、MSFragger等。其中MSFragger近年比较火,因为它是“open search”思路,前体离子质量容差可以放宽到几十甚至几百道尔顿,特别适合找带着质量偏移的修饰肽段,运行速度也快得离谱。
4.2 参数设置:容差、酶切规则和修饰
搜索参数设置是新手最头疼的部分,但也是决定结果质量的关键。我列几个每次搜索必须仔细检查的项目:
- 酶切规则:Trypsin通常设定为“K/R后切,但P前不切”;漏切位点数量(missed cleavages)一般设2,允许个别位点酶切不充分;
- 前体离子质量容差(precursor tolerance):高分辨质谱现在普遍设10 ppm以内,甚至5 ppm或更低;碎片离子容差(fragment tolerance)则看仪器,Orbitrap数据常设0.02 Da,Q-TOF数据可设20-50 ppm;
- 固定修饰(fixed modification):半胱氨酸的Carbamidomethyl (C)是烷基化后必须设的;
- 可变修饰(variable modification):最常加的是甲硫氨酸氧化(Oxidation (M))和蛋白N端乙酰化(Acetyl (Protein N-term))。加的修饰越多,搜索空间越大,FDR压力也越大,不要贪多。
一个常见误区是前体容差设太大。你明明用的是Orbitrap,质量精度在ppm级别,却把容差设成1.5 Da,结果就是搜索时间长且假阳性暴增。反过来如果设得太严,因为校准不好导致的系统偏移又会把真阳性的肽段漏掉。
4.3 FDR到底怎么算
谱图匹配分数再高,也可能有随机匹配。怎么判断哪些匹配可信?行业标准做法是“靶-诱饵数据库”策略。
具体操作:把目标蛋白数据库反转或随机化,生成一个诱饵数据库,大小与目标库一致。把实验谱图同时搜目标库和诱饵库。由于诱饵库里的蛋白是随机序列,理论上匹配到诱饵库的肽段都是假阳性。我们可以用诱饵命中数来估计目标库里的假阳性数,然后设定阈值,使肽段层面的FDR(假发现率)低于1%。日常工作里,你会在结果报告里看到“1% FDR”,指的就是这个控制标准。
FDR控制是组学可信度的生命线。有人为了让数据“好看”而把阈值放宽到5%甚至更高,这在发表时会被审稿人直接质疑。我的习惯是:figure里报告的数据都是1% FDR以上,补充材料里可以放更宽的结果,但主结论绝不用。
5. 定量方法选型:SILAC、TMT和LFQ怎么挑
5.1 标记定量:SILAC和TMT的核心差异
鉴定只是第一步,很多课题真正要的回答是“组学水平的差异”。比如疾病组vs对照组,哪些蛋白变了。定量方法可以分成标记定量和非标记定量两大类,我先讲标记。
SILAC(稳定同位素标记氨基酸)是“代谢标记”思路。细胞培养时,把培养基里的必需氨基酸(通常是赖氨酸和精氨酸)换成带稳定同位素的“重”版本。细胞每合成一个新蛋白,就把重赖氨酸/重精氨酸掺入进去。等你在“轻”和“重”两种培养基里分别培养了两种组别,再等量混合后一起处理、酶切、进质谱,同一个肽段会以差8 Da或10 Da的成对峰出现。轻峰和重峰的峰面积比值就代表两个样本里该蛋白的相对丰度。SILAC定量非常准,比如我在研究信号通路时间序列时用过三通道SILAC,同一个肽段的离子流比可以做到非常稳定。
但SILAC有硬伤:它只适合能培养的细胞,不能用于组织样本、临床样本。而且最贵的重标记氨基酸,完全标记需要大约5-6个倍增周期,很耗时。
TMT(串联质谱标签)是“化学标记”思路,用带有不同质量报告基团的试剂,在蛋白或肽段层面化学标记不同样本。标记后的样本等量混合成一个样品进行LC-MS/MS。因为标签的母离子质量设计成一样,不同样本来源的同一个肽段会在MS1中一起出现,但在碎裂后产生不同的报告离子(如126、127、128等)。报告离子强度就是各样本的相对丰度。TMT可以做到10标甚至更多通道,临床样本、组织裂解液都适用,是多组学大样本的主流选择。
5.2 非标记定量和DIA的取舍
非标记定量(LFQ)不需要任何同位素标签,每个样本单独跑一遍LC-MS/MS,然后用MS1层面的色谱峰面积(或MS2强度)来量化每个肽段。不同样本之间通过信号强度归一化来比较。它的优势是操作简单、成本低、适用于任何样本类型;劣势是定量准确性受色谱重现性和仪器稳定性影响大,批次间波动会比较明显。样本量大的多组学项目里,LFQ需要非常严格的QC和批次设计。
DIA(数据非依赖采集)是另一种思路。传统DDA是挑最强离子做MS/MS,DIA则是在整个m/z范围内划分一个个窗口(比如每次扫400-500 Da、500-600 Da),把所有离子都碎裂一遍,无差别记录。好处是采集到的是完整、系统的碎片离子矩阵,数据可追溯性强,重复性高;代价是谱图高度复杂,需要依赖谱图库或DIA-NN这类的软件来做解卷积和定量。现在越来越多的队列研究选择DIA方案,尤其适合大样本差异蛋白筛选。
5.3 定量数据处理里最容易翻车的三个环节
第一个是归一化。LFQ和TMT都要做归一化处理,最常用的是中位数归一化或总强度归一化。如果不做,样本间上样量差异、进样时间漂移都会表现为大规模的系统偏移,直接影响差异蛋白判断。
第二个是缺失值。蛋白质组学数据天生会有很多零值,尤其低丰度蛋白。原因可能是真没表达,也可能是低于检测限。简单地把所有零值删掉会损失大量信息,但盲目把缺失值填补成0也是错的。比较专业的做法是用Perseus这样的工具,按分组信息做基于最小值的imputation,同时报告缺失率,让审稿人知道你是如何处理缺失的。
第三个是ratio compression。这是TMT特有的问题:如果你用普通的HCD MS/MS进行定量,共流出肽段的干扰谱峰会混入报告离子区域,导致真实差异被压缩,比如两个样本实际差异4倍,测出来可能只有1.5倍。改善方法是使用同步母离子选择(SPS)MS3策略,或者在分析时采用更严格的隔离窗口。处理不当的话,TMT结果的差异倍数会严重失真。
6. 质谱实验高频坑位:我踩过的问题与排查
6.1 信号全无怎么办
刚接触质谱的人,第一次上机会很慌,满心期待看到肽段峰,结果基峰图里要么是平的,要么全是乱七八糟的峰。如果总离子流(TIC)几乎为零,优先检查:
- 喷雾是否稳定:看喷雾针尖有没有液滴挂上,是否是稳定泰勒锥。针尖堵了会表现为压力升高且TIC骤降,这时需要超声或换针;
- 离子源参数:喷雾电压是否打开?正离子模式应该加正电压。我见过最离谱的一次是电压根本没给上,检查十分钟才发现软件连接出错;
- 样品问题:高盐、高尿素样本严重抑制电离,先脱盐再试;
- 质谱本身污染:源内累积了太多盐和缓冲液,离子传输效率会大幅下降,定期清洗离子源和Skimmer是必须的。
一个很简单的定位方法:先用标准品(比如5 fmol BSA酶切物)跑一针,如果标准品也什么都没出来,那是仪器/液相端的问题;如果标准品正常但样品不行,那问题大概率在样品制备或进样环节。
6.2 图谱质量差、鉴定数量少
最典型的表现是:仪器看起来正常,搜库也有结果,但鉴定蛋白数只有预期的一半,优质谱图少。这时候我会按顺序排查:
- 酶切效率:还原烷基化有没有做到位?漏切位点比例高不高?如果高,适当增加酶量或延长酶切时间;如果用的是过夜酶切,确认没有因为样品被污染导致酶失活;
- 色谱性能:柱效下降会导致峰宽增大、分辨率下降,从而降低MS/MS采集效率;看看色谱柱柱压是否异常、保护柱有没有堵塞,进样量是否合适;
- 前体质量偏移:如果仪器校准漂移了,母离子m/z对不上,搜索引擎匹配时有效候选会大幅减少;跑一针校准液,看看质量轴偏了多少;
- 采集速度:DDA模式下,如果MS/MS扫描速度太慢,很多中低丰度肽段根本来不及被选中碎裂;现代仪器可以尝试把MS/MS分辨率降到1.5万-3万来换取扫描速度,或用更短的动态排除时间。
另外,鉴定数低可能只是“看起来低”。如果你用的是小物种的数据,而搜索库选择了人的数据库,或数据库里加了太多冗余序列,搜索空间过大会压制有效匹配。用物种特异性数据库或者整理过的reviewed数据库,往往会好很多。
6.3 定量重复性差的排查
定量重复性差有几种常见原因。一是上样量不一致。定量实验的每个样本必须测浓度后统一上样量,最好再跑一管QC样本监控整体平行性。二是液相梯度漂移。保留时间不稳定会导致MS1峰积分不准,特别是LFQ模式;进样针和管路里的气泡也会引起体积偏差,每次进样前做气泡排除。三是样本前处理批次差异大。酶切时间、脱盐方式、复溶体积不一致都会造成系统偏移,尽量同一批处理、同一批上机。
有一次我做TMT实验,前24个样本重复性极好,第25个开始全部偏移,查了半天发现是换了一瓶乙腈,批次间流动相纯度有细微差异,导致梯度改变了。从那以后我所有定量实验都固定试剂批次,并且每天换新流动相时先跑QC针监控。
6.4 质谱实验问题速查表
为了方便日常排查,我把自己常用的检查表放在这里:
| 现象 | 常见原因 | 快速排查方向 |
|---|---|---|
| TIC几乎为零 | 喷针堵塞/电压未开/样品高盐 | 换针、检查电压、脱盐后重试 |
| 基线高、信号飘 | 离子源污染/流动相不干净 | 清洗离子源、换新流动相 |
| 母离子质量偏移 | 仪器校准漂移 | 外标校准,用内标锁定质量 |
| 鉴定数少 | 酶切不完全/搜索库不匹配/柱效低 | 检查漏切率、换数据库、评估色谱柱 |
| 谱图碎片峰稀疏 | 碰撞能量不足/母离子纯度差 | 调整CE或阶梯能量、缩小隔离窗口 |
| 定量批次偏移 | 试剂批次/上样量/色谱漂移 | 固定批次、加QC样本、随机化进样顺序 |
| TMT比值压缩 | 共流出干扰/Ms2定量 | 改用MS3或SPS、缩小隔离窗口 |
这张表现在还在我实验室的SOP里,每次有人跑来问“数据怎么这么奇怪”,我就让他们先对着表做一轮基础排查。
最后再分享一个习惯:质谱数据一定不要只看软件打分。拿到结果后,我会随机抽几十张PSM谱图,手动检查b/y离子匹配是否合理、修饰位点是否有足够侧翼证据支持。这一步不能替代统计质控,但它能帮你建立对数据和软件的判断力,尤其是当你尝试一个新仪器平台或新搜索软件时,手动抽查往往能比任何参数设置指南更快地发现哪里出了问题。