如何读 AlphaFold 置信度:pLDDT 与 PAE 速览
2026/9/11 5:52:57 网站建设 项目流程

如何读 AlphaFold 置信度:pLDDT 与 PAE 速览

【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold

你刚把AlphaFold预测出的ranked_0.pdb拖进 PyMOL。第一眼该看哪里?不是骨架,而是两个置信度指标:pLDDTPAE。pLDDT(predicted Local Distance Difference Test)逐个残基打分,PAE(Predicted Aligned Error)评估成对残基的可靠程度,两者合起来决定你能不能直接拿这套结构干活。

30 秒全局速判:pLDDT 曲线怎么扫

这一节回答:拿到预测结果 30 秒内,怎么判断这套结构整体好不好?

pLDDT 的白话含义是模型给每个氨基酸打的"自评分",取值 0 到 100,越高越可信。输出 notebook 里它画在结构下方的彩带上,在 PyMOL 里对模型按B-factor上色后,同一条彩带会直接裹住骨架——输出文件把每个原子的 pLDDT 写进了 PDB 的 B-factor 列(方向和常规 B-factor 相反,越大越可靠,做分子置换时别混用)。

30 秒速判做三件事:

  1. 扫均值。全部残基的平均 pLDDT:大于 90,整体基本可用;70–90 最常见,可用但要局部核对;低于 70,⚠️ 把这套预测当"拓扑草稿",不要当原子级模型。
  2. 扫低分尾巴。小于 50 的残基占几个百分点属正常;出现整段低于 50,说明这段有问题,原因下一节展开。
  3. 扫两端。蛋白质 N 端、C 端天然更灵活,末端 pLDDT 温和下降不算缺陷,不用紧张。

背后的道理一句话:模型对每个残基输出的不是一个分数,而是一组"距离误差概率分布",pLDDT 是把这个分布取加权期望再乘以 100。所以高分意味着模型"对自己的答案有把握",低分意味着它"拿不准"——置信度本质上是把模型的犹豫程度摆到了桌面上。

pLDDT 四档色标:该信什么、不该信什么

这一节回答:看到蓝、黄、橙三色,分别该信到什么程度。

官方色标把 pLDDT 切成四档,像一组红绿灯:

档位pLDDT 范围解读
Very High90–100骨架与侧链位置都可信,对接、突变、分子置换照常做
Confident70–90骨架走向可靠,个别侧链取向可能有偏差
Low50–70只信二级结构拓扑,原子坐标仅供参考
Very Low0–49按天然无序区域或预测失败处理

看档之余还要追问一句:低分是"生物学特征"还是"模型失误"。低 pLDDT 区域的常见来源:

  • 内在无序区(IDR):序列本身没有稳定结构,低分是模型的诚实;
  • 柔性连接肽:两个结构域之间的连接段,构象随功能变化;
  • 长环区与结构域边界:局部进化信息不足;
  • MSA 覆盖度低的片段:没有同源序列支撑,模型只能压低分数;
  • 功能上瞬态的位点:诱导契合、信号残基往往恰好就是柔性的。

区分办法不复杂:拿无序预测工具(如 IUPred)和文献交叉验证。两边一致,低分区域就是蛋白质的特征;预测说无序而实验文献说该位点是稳定结构域,就该怀疑模型的判断。

换一副眼镜看全局:PAE 区块怎么读

这一节回答:pLDDT 只说"每一块好不好","块与块的相对位置"靠什么保证?

把 PAE 当成一张距离误差热力图来读会容易得多:每个格子回答"把这段区域与真实结构叠合后,残基 i 和残基 j 的相对位置会漂移多少",单位是埃。取值在 0 到max_predicted_aligned_error上界(通常 31.5 Å)之间,越小越放心。

读法三步走:

  1. 看对角带。对角带对应位置相邻的残基,颜色大致等价于 pLDDT 曲线的"全局版",对角带稳定偏暗,说明局部结构可信。
  2. 看非对角区块。多结构域蛋白的 PAE 像一副区块拼图:块内误差越低,模型越确定"这部分和那部分是这么摆的";某个非对角区块发亮,等于模型在承认它对这两个域的相对朝向是猜的。
  3. 用高误差行列定位问题区。某一行或一整列发亮,意味着该残基(或区段)相对于全链其余部分的位置都不可靠——这是 pLDDT 给不出的信号:pLDDT 说"我局部挺好",PAE 说"我在全局里站哪儿没把握"。

对蛋白质复合物,这种读法最实用:界面置信度就是 PAE 矩阵非对角区块的颜色,界面区块发亮,就该怀疑两条链是否真按这个姿势结合。

数学上,每个格子就是概率加权期望:

$$\text{PAE}{ij} = \sum_k p{ijk}, c_k$$

其中 $p_{ijk}$ 是残基对 (i, j) 落入误差桶 k 的概率,$c_k$ 是该桶中心值。PAE 同样属于"模型自评",只是自评的对象从单个残基换成了残基对。

pLDDT 与 PAE 打架:三种情形与应对

这一节回答:两个指标给出的结论不一致时,听谁的。

两者看的对象不同,出现分歧很正常,常见的就三种:

信号组合最可能的情形应对思路
pLDDT 高、局部 PAE 高局部结构好,但相对其余部分的定位不确定该区域单独拿出来做对接和分析,别依赖它对其他部分的取向
pLDDT 低、PAE 低局部坐标粗糙,整体拓扑正确当作"有序但粗糙"的区域,可作后续精细化的起点
pLDDT 高、PAE 高整体折叠可能有误,或输入信息不足检查 MSA 与模板命中,换model_preset重跑

动手读一遍:从 .pdb 到置信度结论的 5 步

这一节回答:从输出目录里的文件出发,怎么一步步走到最终结论。

  1. 打开ranked_0.pdb,这是按 pLDDT 排名第一的结构,B-factor 列即 pLDDT 值。
  2. 在 PyMOL 里执行spectrum by B整条上色,先完成上一节的 30 秒速判:均值、低分尾巴、两端。
  3. 对每个低分区段放大看上下文:是环、连接肽还是末端?再按四档色标判断它更像生物学特征还是失误。
  4. pickle 文件里存着完整模型输出,用下面代码取全局统计:
import pickle r = pickle.load(open('result_model_1.pkl', 'rb')) plddt, pae = r['plddt'], r['predicted_aligned_error']
print(plddt.mean(), (plddt < 50).mean()) print(pae.max(), r['max_predicted_aligned_error'])
  1. 复合物再取pae矩阵看非对角区块,确认界面置信度是否支持你关心的相互作用。

流程走一遍就是这张图:

flowchart LR A[打开 ranked_0.pdb] --> B[spectrum by B 上色] B --> C{30 秒全局速判} C -->|整体高| D[结构可直接使用] C -->|局部低分| E[按四档色标判断是否生物学特征] C -->|整体低| F[回查 MSA 与模板并重跑] E --> G[从 result pkl 读取 PAE]

【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询