☰
膜蛋白生信分析七库串联:从序列注释到跨膜结构预测
2026/9/28 13:53:43 网站建设 项目流程

做个膜蛋白的生信分析,尤其是在一个课题组里刚接手新蛋白的时候,最常被问的问题就是:“我手上有一条未知序列,怎么知道它是不是转运蛋白?是不是膜蛋白?有没有结构可以看?”

这个问题听起来简单,真正动手做就会发现,单个数据库根本不顶用。你需要在一个完整的链条里来回切换:Uniprot 给序列和功能注释,InterPro 判断家族和结构域,TCDB 给转运蛋白分类,TMHMM 和 SURFY 预测跨膜拓扑,PDB 提供三维结构,OPM 告诉你蛋白在膜里到底是“怎么躺”的。这套组合拳,才是膜蛋白研究真正的地基。

这篇文章就围绕这七个数据库展开,讲清楚它们各自能干什么、怎么用、怎么串联,以及实际操作中会踩到哪些坑。内容面向刚入坑的生信研究生、做膜蛋白功能实验但需要计算辅助的湿实验同学,以及所有想系统梳理膜蛋白分析流程的从业者。

1. 从序列到结构,七个数据库到底怎么串成一条线

1.1 膜蛋白研究为什么麻烦

膜蛋白和可溶性蛋白最大的差别在于:它的一部分埋在脂双层里,一部分暴露在水相环境中,这让它的表达、纯化、结晶都比普通蛋白困难一个量级。结构生物学里那句老话——“可溶性蛋白的晶体能长出来是运气好,膜蛋白的晶体能长出来是烧了高香”——说的就是这个情况。

正因如此,膜蛋白的三维结构数据非常稀缺。PDB 里已经解析的结构超过二十万,但其中膜蛋白占比非常低,尤其是转运蛋白、通道蛋白这类含有复杂跨膜区域的成员,高质量结构往往只有少数几个同源模板可用。这种情况下,从序列出发做精准注释和拓扑预测,就成为大多数实验开展前必须完成的一步。

还有一层麻烦在于,膜蛋白的类型很多样:单次跨膜、七次跨膜、β-桶、外周膜蛋白,每一种的拓扑特征和折叠方式完全不同。你拿一条未知序列上来,如果连“它是几次跨膜”都没搞清,后面做定点突变、做截短表达、设计融合蛋白都会盲目。所以,膜蛋白研究的第一步,永远是“先注释,后预测,再找结构”,而不是直接跳到结构。

1.2 七个数据库的分工和前后顺序

这七个数据库我们可以分成四个功能层:

层级数据库核心功能
序列与注释层Uniprot蛋白序列、功能注释、feature 信息
分类与预测层InterPro / TCDB / TMHMM / SURFY家族分类、转运蛋白分类、跨膜拓扑预测
结构检索层PDB实验解析的三维结构
膜定位层OPM蛋白在脂双层中的方向、深度、跨膜区注释

用大白话说:Uniprot 是你手里的“身份证”,InterPro 和 TCDB 帮你查“家族户口”,TMHMM 和 SURFY 帮你画“蛋白怎么穿过膜”的示意图,PDB 给你看真实的“三维照片”,OPM 最后告诉你“这张照片里蛋白在膜的哪一面、斜着多少度”。

这套链条是有严格顺序的,不要乱。我见过不少同学直接用 TMHMM 预测完拓扑,就跑到 PDB 里搜结构,完全没用 InterPro 和 TCDB 去确认蛋白到底属于哪个家族,结果搜出来的结构根本不是同源蛋白,白白浪费时间。正确做法是:先注释,再分类,再预测,再检索,每走一步都用上一层的结论去约束下一层的搜索范围。

2. 起点是 Uniprot:先给蛋白办一张“身份证明”

2.1 拿到 Uniprot 条目后先看什么

Uniprot 是所有膜蛋白分析的入口。你手里有一条序列或者一个基因 ID,大概率第一步就是在 Uniprot 里检索。打开一个条目后,不要只盯着蛋白名称看,优先确认四个东西:Accession 号、Entry Name、Protein Name 和 Organism。

Accession 号是最稳定的标识符,比如 P08183 是人体 P-glycoprotein 1 的 Uniprot ID,写论文、做数据库交叉检索时都以它为准。Entry Name 是短名称格式,如 ABCB1_HUMAN,虽然也好用,但如果同一蛋白有不同剪接体,Accession 更可靠。Organism 就不用多说了,人类蛋白和酵母蛋白的注释信息可能相差很大,尤其要注意跨物种推断时的风险。

我自己的习惯是,在进入任何数据库之前,先把这个 Accession 复制到一个文本里备用。后续无论去 InterPro 还是 TCDB,输入这个 ID 都比输入一大段序列方便得多,而且不会因为序列版本差异产生歧义。

2.2 Feature Table 里有宝藏:TRANSMEM、TOP_DOM、REGION

Uniprot 条目往下翻,你会看到“Family & Domains”和“Structure”这几个区块,其中最重要的信息藏在 Feature Table(特征表)里。对膜蛋白研究来说,最值得关注的特征类型有这几个:

  • TRANSMEM:表示跨膜区段,通常给出具体的氨基酸区间。比如“TRANSMEM 219 239”说明第 219 到 239 位残基构成一个跨膜螺旋。这个信息在 Uniprot 里一般来自人工注释或跨物种推断,比 TMHMM 的纯预测结果可靠度高不少。
  • TOP_DOM:表示拓扑结构域,会标注胞外(Extracellular)或胞质(Cytoplasmic)。例如“TOP_DOM 675 976 Cytoplasmic”意味着第 675 到 976 位在细胞质一侧。
  • REGION:一些功能重要的区域,比如底物结合位点、磷酸化位点所在的区域。
  • SITE / ACT_SITE / BINDING:活性位点和结合位点,虽然不是膜蛋白特有,但定位到跨膜区附近时很有提示意义。

拿到这些区间后,你可以先和自己后续的 TMHMM 预测结果做对比。如果人工注释和预测结果高度一致,后面的分析会踏实很多;如果差异很大,就得警惕是序列版本问题还是预测参数问题。我在下面第五节会专门讲这个。

2.3 直接用 API 拉取 Uniprot 注释

网页版浏览适合看单条数据,但做批量分析时效率太低。Uniprot 提供 REST API,用 Python 就能直接拿注释。我经常用的一段代码如下:

import requests def fetch_uniprot_entry(accession): url = f"https://rest.uniprot.org/uniprotkb/{accession}.json" resp = requests.get(url, timeout=30) resp.raise_for_status() data = resp.json() # 获取序列 seq = data["sequence"]["value"] # 提取跨膜区和拓扑结构域特征 features = data.get("features", []) trans_mem = [] top_dom = [] for feat in features: if feat["type"] == "Transmembrane": trans_mem.append({ "start": feat["location"]["start"]["value"], "end": feat["location"]["end"]["value"], "description": feat.get("description", "") }) elif feat["type"] == "Topological domain": top_dom.append({ "start": feat["location"]["start"]["value"], "end": feat["location"]["end"]["value"], "description": feat.get("description", "") }) return {"accession": accession, "sequence": seq, "trans_mem": trans_mem, "top_dom": top_dom} result = fetch_uniprot_entry("P08183") print(result["trans_mem"])

这个小脚本能帮你把跨膜区段直接结构化,后续画拓扑图或做区间统计都很方便。注意接口字段名是 Transmembrane 和 Topological domain,别写错了。如果你用的是 UniProt 的旧版 API,字段名不太一样,建议统一走新版 rest.uniprot.org。

3. InterPro:一个蛋白属于哪个家族,在这里找答案

3.1 InterPro 不是单一数据库,是数据库联盟

InterPro 的全称是 InterPro: The Classifier of Protein Families,它本身并不产生原始数据,而是把 Pfam、PRINTS、Prosite、SFLD、PANTHER 等多个数据库的预测结果聚合到一起,形成一个整合型的“蛋白家族身份证”。

你在 InterPro 里输入一个 Uniprot Accession 或序列,它会返回该蛋白匹配到的所有家族、结构域、重复单元和功能位点,并给出一个“Integrated”的综合结果。这个整合结果的可靠性通常优于任何单一数据库,因为它是多个独立方法投票一致得出的结论。

举个例子,如果你输入一个 ABC 转运蛋白的序列,InterPro 结果里大概率会出现 ABC transporter 家族的条目,同时给出核苷酸结合结构域(NBD)和跨膜结构域(TMD)的具体位置。这两个结构域的空间排布直接决定转运蛋白的功能机制,所以看到这些注释,你就能大致判断蛋白的构架。

3.2 膜蛋白家族注释怎样辅助功能判断

膜蛋白的分类和它的跨膜拓扑模式密切相关。以转运蛋白为例,ABC 转运蛋白通常是“4+2”或者“4+4”构架(四个跨膜螺旋构成一个 TMD 单元),而 MFS 超家族通常有 12 个跨膜螺旋。如果你用 InterPro 查到蛋白属于 MFS 超家族,那么合理预期就是它大概率有 12 次跨膜;如果 InterPro 显示属于某个 TetR 家族转录因子(可溶性蛋白),那你就不该指望它有跨膜螺旋,两种结果会引导完全不同的实验设计。

另外,InterPro 还会给出结构域的功能注释。比如一个蛋白既有跨膜区域,又有激酶结构域,那它很可能是一个受体型激酶,信号转导和膜定位同时具备。这种组合注释,单靠 Uniprot 的 feature 很难一眼睛看到。

操作层面,InterPro 网页版支持输入序列、Uniprot Accession 或 InterPro 条目号,结果页左侧是匹配层次列表,右侧是结构域在序列上的分布图。最直观的用法是看那张“蛋白图形”上的彩色方块:灰色条是序列全长,彩色块是匹配到的结构域区间。你可以从这里直接获取区间坐标,和后续 TMHMM 跨膜螺旋位置做重叠分析。

3.3 实用操作建议

用 InterPro 时有三个习惯我建议你养成:

第一,不要只看最高层级的家族条目,往下展开子条目看看具体匹配到哪个 Pfam 或 PANTHER 条目,因为这些子条目往往对应更具体的功能域。第二,留意匹配结果的 E-value 和 score,E-value 太小说明这个匹配非常可靠,E-value 在 0.01 到 1 之间可能是假阳性,不要太当真。第三,InterPro 的“跨条目一致性”很重要,如果 Pfam、PANTHER、SFLD 多个数据库都匹配到同一个家族,你基本可以放心写结论;如果只有某一个数据库匹配到,就要谨慎对待。

我之前遇到一个案例:一个未知蛋白在 InterPro 里只被 Prosite 匹配到一个很短的磷酸化位点模式,Pfam 完全没结果,看起来像“没有结构域”。实际上这个蛋白是一个外分泌毒素,结构域由多个重复单元构成,短模式匹配并不足以揭示它的真实属性。后来我用 HMMER 重新搜了 Pfam 全库,才找到弱匹配的毒素结构域。所以,InterPro 没结果不代表没有结构域,有时候必须换用 HMMER 或 PSI-BLAST 做更敏感的搜索。

4. 转运蛋白专属分类:TCDB 是怎么给蛋白“上户口”的

4.1 TCDB 的 TC 编号体系

TCDB(Transporter Classification Database)是专门做转运蛋白分类的数据库,它最核心的东西是 TC 编号(Transport Classification number)。这套编号有点像酶学的 EC 编号,但结构更细,一共分五级,例如 2.A.1.8.1,其中“2”代表电化学势驱动转运蛋白,“A”代表由 α-螺旋型跨膜蛋白构成的转运系统,“1”代表主要协同转运蛋白超家族,“8”是具体家族,“1”通常指向具体的底物类型。

对做转运蛋白研究的人来说,TC 编号的价值在于它是一种“功能性分类”,不像 InterPro 只从序列和结构域出发。两个蛋白序列相似度不高,但如果 TC 编号前面几级一致,它们很可能采用相同的转运机制。这种分类对功能注释的参考价值极大。

在 TCDB 网站里,你可以输入蛋白序列做 BLAST 搜索,也可以通过 Uniprot Accession 直接检索。搜索结果的页面会显示匹配到的 TC 条目、E-value 和比对信息,以及该家族成员的已知底物和机制描述。

4.2 在 Uniprot 里关联 TCDB ID

还有个更省事的办法:很多转运蛋白在 Uniprot 条目的“Cross-references”区域里会直接列出 TCDB 编号,比如“TCDB 2.A.1.5.3”这样的链接。复制这个编号去 TCDB 主页搜索,就能直接跳到对应家族页面。

这个交叉引用不是随便生成的,通常由数据库维护人员或专业注释流程完成,可信度很高。如果你在 Uniprot 条目里没看到 TCDB 引用,也别急,说明这个蛋白可能还没有被明确归类为转运蛋白,或者分类工作尚未完成。你可以把序列导到 TCDB 本地 BLAST 或用 TCDB 的在线搜索工具,跑一遍看有没有显著匹配。

4.3 判断“是不是转运蛋白”的实操方法

拿到一条序列,怎么判断它到底是不是转运蛋白?

我的流程是三步走:第一步看 Uniprot 的 Protein name 和 Keywords,如果包含“transporter”“channel”“permease”之类的关键词,直接在 TCDB 里搜。第二步用 InterPro 看家族注释,很多转运蛋白家族在 InterPro 里都有对应条目,比如 MFS、ABC transporter、SLC 系列。第三步才是用 TCDB BLAST 做最终确认,因为它比对的是经过专家人工分类的转运蛋白序列库,比通用数据库更聚焦。

注意一点:TCDB 里做 BLAST 的时候,如果匹配到的是“putative transporter”或“uncharacterized protein”,别直接拿来当证据,尽量找有功能验证的成员作为参考,比如 TC 编号里有明确底物描述的条目。这样你后续写论文时,才有底气说“该蛋白属于某转运蛋白家族,推测其可能参与某底物的跨膜运输”。

5. 拓扑预测:TMHMM 和 SURFY 的差别与配合

5.1 TMHMM 的基础原理和输出含义

TMHMM 是最常用的跨膜螺旋预测工具,全称是 TransMembrane Helix Prediction by Hidden Markov Model。它基于隐马尔可夫模型,把蛋白序列的每个残基分成三种状态:跨膜螺旋内部、胞内环、胞外环,然后通过状态转移概率计算最可能的拓扑结构模型。

在 TMHMM 网页版输入 FASTA 序列,点提交后会得到一张跨膜螺旋概率图,以及一段文本结果,例如:

# Sequence length: 1280 # Number of predicted transmembrane helices: 12 # Exp number of AAs in transmembrane helices: 252.0 # Exp number of first 60 AAs: 0.00001 # Total prob of N-in: 0.00001 # POSSIBLE N-term signal sequence

这里“Number of predicted transmembrane helices”就是整条序列预测出的跨膜螺旋数。对 MFS 超家族蛋白,这个数字往往在 12 左右;对 GPCR 则在 7 左右。后面的 N-in 是一种先验概率,表示 N 端位于细胞内侧的可能性,对判断膜拓扑方向很有用。

但 TMHMM 有一个众所周知的局限:它对信号肽非常敏感。如果蛋白 N 端存在信号肽,TMHMM 容易把信号肽区域误判为第一个跨膜螺旋,导致螺旋数多算。所以输出里如果出现“POSSIBLE N-term signal sequence”提示,你需要结合 SignalP 的结果做人工判断,别直接抄数字。

5.2 TMHMM 用哪个版本,参数怎么设置

目前 TMHMM 有两个主要版本:经典的 TMHMM Server v2.0 和新的 DeepTMHMM。

TMHMM v2.0 在绝大多数情况下够用,网页操作简单,输入序列即可。DeepTMHMM 是后来更新的一版,基于深度学习方法,对 beta-barrel 膜蛋白的识别能力更强,也支持批量预测。如果你做的是大肠杆菌外膜蛋白,建议优先用 DeepTMHMM;如果你做的是人类或真核生物的 α-螺旋膜蛋白,直接用 v2.0 问题不大。

关于参数设置,真正会影响结果的参数是“使用哪种序列输入”和“是否经过多序列比对”。TMHMM v2.0 是单序列预测,DeepTMHMM 支持用进化信息增强预测。在条件允许的情况下,把同源蛋白一起做多序列比对后喂给 DeepTMHMM,准确率会有可见提升。不过对大多数用户来说,单序列预测已经足够给出初步拓扑信息,不必过度追求参数调优。

5.3 SURFY 的定位:人工校验 + 多方法融合

SURFY 是专门存储膜蛋白拓扑结构信息及预测结果的数据库,全称是 Surface Protein Topology 相关资源。它跟 TMHMM 不一样的地方在于,SURFY 不只是给你一个预测输出,而是汇总了多种预测工具的结果,并经过人工校验,最终给出一个统一的拓扑注释。

在 SURFY 里,你可以检索蛋白的拓扑模型,看到每一个跨膜区段的精确边界、拓扑方向(N 端胞内还是胞外),以及它对应的“可信度”判断。SURFY 的注释还整合了来自 Uniprot 和 PDB 的已知结构信息,因此对已经有结构解析的同源蛋白,它的拓扑注释会更贴近实验事实。

我个人把 SURFY 当成一种“校正意见”:先用 TMHMM 快速预测,再用 SURFY 查询该蛋白(或同源蛋白)是否有已经人工确认的拓扑注释。如果两者的跨膜区间高度一致,那这个拓扑基本可以放心用;如果差异很大,就需要逐段检查原因,确定是 Uniprot 注释不同版本导致的,还是预测工具本身的偏差。

5.4 两个预测结果冲突时怎么办

预测工具给出不一致的结果非常常见,至少我手上过半的蛋白在 TMHMM 和 SURFY 之间都有或多或少的出入。遇到冲突,按这个优先级来:

  1. 实验解析结构优先。如果 PDB 里有该蛋白或同源蛋白的 α-螺旋结构,直接用 PDB 的真实跨膜区段为准,这远胜于任何计算预测。
  2. 人工注释次之。Uniprot 的 feature 注释和 SURFY 的人工核对结果都是可信度较高的参考。
  3. 最后才看纯预测。TMHMM 和 DeepTMHMM 的预测结果可以作为辅助证据,但不要当最终结论。

有一次我分析一个细菌转运蛋白,TMHMM 预测出 10 个跨膜螺旋,SURFY 给出的是 8 个。我一开始以为是预测差异,后来查了 PDB 里同源蛋白的结构,发现实际只有 8 个螺旋,其中两个预测螺旋实际上位于可溶性结构域中的疏水 patch 上,被算法误判成了跨膜段。这个案例让我养成了一个习惯:拿到任何拓扑预测结果,第一件事就是去 PDB 搜一下有没有同源结构,而不是急着画图。

6. 结构层面:PDB 和 OPM 的联合使用

6.1 PDB 里怎么找膜蛋白结构

PDB 的中文名是蛋白质数据库,全球主要的结构生物学研究中心都会把解析出的三维坐标文件提交到 PDB。膜蛋白结构数量偏少,但也不是完全没有。RCSB PDB 门户里,你可以用蛋白名、Uniprot Accession 或序列搜索。

关键技巧有三点:

第一,用“Membrane protein”这个 keyword 做限定过滤,能快速筛掉一堆可溶性蛋白。第二,看分辨率,实验解析的膜蛋白分辨率通常标注在 1.5 Å 到 4.5 Å 之间,冷冻电镜结构会有“EM”标注。一般 3.5 Å 以上的结构复杂度较高,但如果是刚解析的新结构,哪怕分辨率一般也很有参考价值。第三,下载结构文件时,优先下载 biological assembly(生物学组装体),而不是 asymmetric unit,因为膜蛋白的功能单元往往是寡聚体,如 ABC 转运蛋白是二聚体,看单体坐标文件会漏掉关键相互作用界面。

PDB 文件格式目前新的标准是 PDBx/mmCIF,旧版的 .pdb 格式对大型结构支持不好,遇到大蛋白坐标偏移、残基缺失时别惊讶。下载后建议直接用 PyMOL 或 ChimeraX 打开,检查跨膜区段的空间位置和蛋白质-脂质相互作用。

6.2 AlphaFold DB 和 PDB 的配合

AlphaFold DB 单独拿出来说,是因为它彻底改变了“膜蛋白没有结构”的困境。AlphaFold 预测的结构虽然不是实验坐标,但对大多数单体膜蛋白的跨膜螺旋区段预测得相当准。

实用建议是:先去 PDB 搜实验结构,没有的话就去 AlphaFold DB 拉预测结构,再进行后续分析。AlphaFold DB 的置信度指标是 pLDDT 分数,一般 pLDDT > 90 的区域可信度很高,70 到 90 之间属于中等可靠,低于 50 的区域大概率是柔性环或无规则区。膜蛋白的跨膜螺旋区段 pLDDT 通常偏高,因此用 AlphaFold 结构判断拓扑是可行的。

但有一点必须清楚:AlphaFold 不是无所不能的转运蛋白结构工具。它预测的是蛋白单体的稳定折叠状态,不包含脂类分子、配体、离子,也不包含开放构象和闭合构象的动态转换。所以 AlphaFold 结构可以帮助你确认拓扑,但不适合直接用来推断底物转运机制。

6.3 OPM 数据库怎么读:真正告诉你蛋白在膜里“躺”的姿势

OPM(Orientations of Proteins in Membranes)数据库的核心任务,是把已知结构的膜蛋白放到一个经过计算的脂双层坐标系里,并给出每个蛋白相对于膜的方位信息。

打开一个 OPM 条目,你会看到几个核心数据:

  • Tilt angle:蛋白长轴与脂双层法线之间的夹角。如果这个角度接近 0°,说明蛋白比较“正”地穿过膜;如果偏大,说明蛋白倾斜着插入膜内。
  • z-coordinate:蛋白残基在膜法线方向上的坐标。OPM 会给每个残基标注它在膜内(hydrophobic core)还是在膜界面区域,方便你识别真正的膜结合区。
  • Membrane embedded segments:精确列出跨膜螺旋或其他膜嵌入区段的残基范围。

这些信息可以直接辅助实验设计:你想把荧光蛋白融合到膜蛋白的一端,得先确定这一端是在胞内还是胞外,融合点不能被塞进膜内。OPM 的位置信息比拓扑预测更精确,因为它基于真实三维坐标,而不是从序列推算。

需要特别留意的是,OPM 里每个结构的膜定位方向是通过计算预测的,不是实验测定的。不同蛋白的预测精度有差异,但对大多数 alpha-helical 膜蛋白来说,整体方向基本正确。如果你需要极高的精度,可以参考同源结构在分子动力学模拟中的膜定位数据。

6.4 联合实操建议

PDB 提供结构,OPM 提供方位,二者联合使用才能完整回答“膜蛋白在膜里长什么样、怎么摆放”的问题。我推荐的流程是:

先在 PDB/AlphaFold DB 拿到结构,再把这个结构的 PDB ID 输入 OPM 搜索,最后在 OPM 页面下载处理好的 PDB 文件,里面已包含膜定位坐标系。用 ChimeraX 打开时,可以用 OPM 的 membrane plane 文件可视化脂双层范围,非常直观。

这个联合流程还有个实际价值:做定点突变的位点选择。你要研究底物通道里某个残基是否参与转运,先看 OPM 的膜内区段,再看 PDB 结构里这个残基是否朝向通道内部。如果残基落在膜脂疏水区且侧链朝向外侧,那它很可能只是参与膜锚定,而不是直接参与底物识别,实验优先级得往后放。

7. 一份完整工作流:从未知序列到膜蛋白画像

7.1 操作的先后顺序与具体路径

综合上面所有工具,我把自己跑膜蛋白分析的标准流程列在这里,你可以直接照抄。假设输入只有一条 FASTA 序列:

第一步,去 Uniprot 的 blast 页面做序列检索,找到最相似且有注释的条目,记录 Accession,同时获取该条目的序列比对信息。这一步的目的不是直接下结论,而是确认你研究的蛋白和已知蛋白的关系。

第二步,回到 Uniprot 条目页,记录 Protein name、Keywords、跨膜特征和拓扑结构域,特别是如果有 “Transporter”“Channel” 这类关键词,做好标记。

第三步,去 InterPro 输入 Accession,获取家族和结构域注释,记录所有显著的 Pfam、PANTHER 匹配结果。

第四步,在 Uniprot 的 Cross-references 里找 TCDB ID,如果有就直接跳转查看 TC 分类;如果没有,把序列上传到 TCDB BLAST,查看结果中排名靠前的 TC 条目和 E-value。

第五步,用 TMHMM 或 DeepTMHMM 做跨膜拓扑预测,同时到 SURFY 查询是否有该蛋白或同源蛋白的拓扑注释,比较两者结果的一致性。

第六步,去 PDB 搜索实验结构,限定 “Membrane protein”;如果没有实验结构,去 AlphaFold DB 下载预测结构,检查 pLDDT 分数。

第七步,把找到的 PDB ID 或 AlphaFold 结构导入 OPM,获取蛋白在膜中的方向、Tilt angle 和膜嵌入区段,最后整合所有信息,得出“该蛋白是什么家族、包含几个跨膜螺旋、N 端在哪一侧、是否已有结构、结构里哪些区段嵌入膜”的完整画像。

这个流程熟练操作后,通常半个小时内可以跑完一单蛋白。第一次跑的同学们别怕慢,每一步都在网页端多看看输出细节,积累自己的“数据库感觉”。

7.2 判断结果的几个层次

不是所有蛋白都能轻松走完这七步,结果要分层次判断:

如果七步全部走通,Uniprot 注释明确、InterPro 有家族、TCDB 有分类、TMHMM 和 SURFY 一致、PDB 或 AlphaFold 有结构,那这个蛋白的“画像”已经是教科书级别了,结论基本扎实。

如果中间某一步断裂,比如 TCDB 没有匹配,或者 SURFY 查询不到,不要强行下结论。你可以写“该蛋白推测属于某个家族,但转运功能尚待实验验证”。这种保守说法在论文里完全站得住脚。

最忌讳的是为了讲故事,把每一步的弱证据都硬凑成“铁证”。生信分析的魅力在于它给你一个起点,而不是终点,强扭的结论后期实验一碰就碎。

7.3 我用的验证技巧

最后分享一个我用来验证整套流程的土办法:找一条已知的、功能研究充分的紧密同源蛋白,把它按相同流程跑一遍,看看每一步和我的目标蛋白是否一致。比如我研究人类一个孤儿转运蛋白,我就会找一个已经验证是 MFS 超家族、有晶体结构的同源蛋白,比如 Gleevec 靶向的 hOCT1,整个流程跑下来作为对照。如果对照蛋白每步都能得到理想结果,而目标蛋白某一步明显异常,那我就要重点检查这一步是否存在特殊原因。

这个方法成本低、效果好,相当于给自己建立了一个每次实验都伴随的“阳性对照”。强烈建议所有做膜蛋白注释的同学用起来。

8. 常见问题与避坑指南

8.1 常见问题速查表

问题可能原因解决办法
TMHMM 预测的螺旋数明显多于预期N 端信号肽被误判为跨膜区结合 SignalP 检查,手动剔除信号肽区段
Uniprot 与 TMHMM 跨膜区间不一致序列版本不同或剪接体差异以 Uniprot 最新版本的 feature 为主,核对序列长度
InterPro 无结构域匹配序列太新或结构域高度退化用 HMMER 搜 Pfam 全库,或做 PSI-BLAST
TCDB BLAST 无匹配该蛋白可能不是转运蛋白,或库中无近缘成员用更宽松的 E-value 阈值,扩大比对范围
PDB 中找不到膜蛋白结构蛋白未解析或解析的物种不同尝试同源蛋白、AlphaFold 预测结构、子结构域拆分搜索
OPM 中找不到目标蛋白该结构未纳入 OPM 或结构为非膜蛋白检查 OPM 是否收录同源结构,或手动用 MD 模拟定位

这张表里的问题我基本都实操碰过,特别是“TMHMM 多算螺旋”这条,几乎每个做分泌蛋白或单次跨膜蛋白的同学都会遇到一次。看清楚原因后,解决起来并不难。

8.2 几个我踩过的坑

第一个坑:Uniprot 的 Accession 换版问题。曾经我记录了一个蛋白的 Accession 是 O95150,过了一个月再查,发现序列信息不在了。后来才知道 Uniprot 会把类似序列合并重新编号,旧 Accession 变成 secondary accession。所有用 Accession 做记录的笔记,最好同时保留 Entry Name 和序列长度,否则数据追溯会出问题。

第二个坑:TMHMM 对环区太长或跨膜螺旋太短的蛋白几乎失效。有一个我研究过的细菌外膜蛋白,它的跨膜段不是 α-螺旋而是 β-桶,TMHMM 直接预测为零个跨膜螺旋。这个结果当时差点让我以为它不是一个膜蛋白。后来我查了 UniProt 和 SURFY,才知道用 TMHMM 测 β-桶类蛋白根本不合适。做外膜蛋白的同学,请直接上 DeepTMHMM 或者专门的 β-barrel 数据库。

第三个坑:OPM 和 PDB 中残基编号不一致。PDB 的氨基酸编号往往从表达载体的第一个残基开始,而 Uniprot 的编号是按全长蛋白计算的,两者相差一个固定的偏移量。做位点分析时如果混用两套编号,很容易把对的位置搞错。我通常会写一个小脚本,根据比对结果把 PDB 编号换算成 Uniprot 编号,宁可多花两步也别凭肉眼猜。

8.3 核心结论落在哪一步

其实整个七库流程走下来,你真正要回答的核心问题只有两个:这个蛋白属于什么家族,它的膜拓扑是什么样子。其他所有信息,包括 TCDB 的分类、PDB 的结构、OPM 的方向,都是为了把这两点做得更扎实。所以无论中间步骤多丰富,最后汇报或写论文时,请把结论锚定在这两个核心问题上,不要被一堆数据库的交叉引用带偏。

做了这么多年膜蛋白相关分析,我的体会是:数据库只是工具,真正值钱的是你对每一步输出背后逻辑的理解。你越清楚 Uniprot 的注释可能来自实验还是计算,越清楚 TMHMM 的模型假设是什么,就越不会被一个“漂亮的预测图”误导。回到开头那个学弟的问题,我通常会回一句:先把这七个数据库过一遍,再回来跟我讨论这条序列是不是转运蛋白。走完这套流程,答案基本自己就浮现了。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询