如何读 AlphaFold 置信度:pLDDT 与 PAE 速览
【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold
你刚把AlphaFold预测出的ranked_0.pdb拖进 PyMOL。第一眼该看哪里?不是骨架,而是两个置信度指标:pLDDT和PAE。pLDDT(predicted Local Distance Difference Test)逐个残基打分,PAE(Predicted Aligned Error)评估成对残基的可靠程度,两者合起来决定你能不能直接拿这套结构干活。
30 秒全局速判:pLDDT 曲线怎么扫
这一节回答:拿到预测结果 30 秒内,怎么判断这套结构整体好不好?
pLDDT 的白话含义是模型给每个氨基酸打的"自评分",取值 0 到 100,越高越可信。输出 notebook 里它画在结构下方的彩带上,在 PyMOL 里对模型按B-factor上色后,同一条彩带会直接裹住骨架——输出文件把每个原子的 pLDDT 写进了 PDB 的 B-factor 列(方向和常规 B-factor 相反,越大越可靠,做分子置换时别混用)。
30 秒速判做三件事:
- 扫均值。全部残基的平均 pLDDT:大于 90,整体基本可用;70–90 最常见,可用但要局部核对;低于 70,⚠️ 把这套预测当"拓扑草稿",不要当原子级模型。
- 扫低分尾巴。小于 50 的残基占几个百分点属正常;出现整段低于 50,说明这段有问题,原因下一节展开。
- 扫两端。蛋白质 N 端、C 端天然更灵活,末端 pLDDT 温和下降不算缺陷,不用紧张。
背后的道理一句话:模型对每个残基输出的不是一个分数,而是一组"距离误差概率分布",pLDDT 是把这个分布取加权期望再乘以 100。所以高分意味着模型"对自己的答案有把握",低分意味着它"拿不准"——置信度本质上是把模型的犹豫程度摆到了桌面上。
pLDDT 四档色标:该信什么、不该信什么
这一节回答:看到蓝、黄、橙三色,分别该信到什么程度。
官方色标把 pLDDT 切成四档,像一组红绿灯:
| 档位 | pLDDT 范围 | 解读 |
|---|---|---|
| Very High | 90–100 | 骨架与侧链位置都可信,对接、突变、分子置换照常做 |
| Confident | 70–90 | 骨架走向可靠,个别侧链取向可能有偏差 |
| Low | 50–70 | 只信二级结构拓扑,原子坐标仅供参考 |
| Very Low | 0–49 | 按天然无序区域或预测失败处理 |
看档之余还要追问一句:低分是"生物学特征"还是"模型失误"。低 pLDDT 区域的常见来源:
- 内在无序区(IDR):序列本身没有稳定结构,低分是模型的诚实;
- 柔性连接肽:两个结构域之间的连接段,构象随功能变化;
- 长环区与结构域边界:局部进化信息不足;
- MSA 覆盖度低的片段:没有同源序列支撑,模型只能压低分数;
- 功能上瞬态的位点:诱导契合、信号残基往往恰好就是柔性的。
区分办法不复杂:拿无序预测工具(如 IUPred)和文献交叉验证。两边一致,低分区域就是蛋白质的特征;预测说无序而实验文献说该位点是稳定结构域,就该怀疑模型的判断。
换一副眼镜看全局:PAE 区块怎么读
这一节回答:pLDDT 只说"每一块好不好","块与块的相对位置"靠什么保证?
把 PAE 当成一张距离误差热力图来读会容易得多:每个格子回答"把这段区域与真实结构叠合后,残基 i 和残基 j 的相对位置会漂移多少",单位是埃。取值在 0 到max_predicted_aligned_error上界(通常 31.5 Å)之间,越小越放心。
读法三步走:
- 看对角带。对角带对应位置相邻的残基,颜色大致等价于 pLDDT 曲线的"全局版",对角带稳定偏暗,说明局部结构可信。
- 看非对角区块。多结构域蛋白的 PAE 像一副区块拼图:块内误差越低,模型越确定"这部分和那部分是这么摆的";某个非对角区块发亮,等于模型在承认它对这两个域的相对朝向是猜的。
- 用高误差行列定位问题区。某一行或一整列发亮,意味着该残基(或区段)相对于全链其余部分的位置都不可靠——这是 pLDDT 给不出的信号:pLDDT 说"我局部挺好",PAE 说"我在全局里站哪儿没把握"。
对蛋白质复合物,这种读法最实用:界面置信度就是 PAE 矩阵非对角区块的颜色,界面区块发亮,就该怀疑两条链是否真按这个姿势结合。
数学上,每个格子就是概率加权期望:
$$\text{PAE}{ij} = \sum_k p{ijk}, c_k$$
其中 $p_{ijk}$ 是残基对 (i, j) 落入误差桶 k 的概率,$c_k$ 是该桶中心值。PAE 同样属于"模型自评",只是自评的对象从单个残基换成了残基对。
pLDDT 与 PAE 打架:三种情形与应对
这一节回答:两个指标给出的结论不一致时,听谁的。
两者看的对象不同,出现分歧很正常,常见的就三种:
| 信号组合 | 最可能的情形 | 应对思路 |
|---|---|---|
| pLDDT 高、局部 PAE 高 | 局部结构好,但相对其余部分的定位不确定 | 该区域单独拿出来做对接和分析,别依赖它对其他部分的取向 |
| pLDDT 低、PAE 低 | 局部坐标粗糙,整体拓扑正确 | 当作"有序但粗糙"的区域,可作后续精细化的起点 |
| pLDDT 高、PAE 高 | 整体折叠可能有误,或输入信息不足 | 检查 MSA 与模板命中,换model_preset重跑 |
动手读一遍:从 .pdb 到置信度结论的 5 步
这一节回答:从输出目录里的文件出发,怎么一步步走到最终结论。
- 打开
ranked_0.pdb,这是按 pLDDT 排名第一的结构,B-factor 列即 pLDDT 值。 - 在 PyMOL 里执行
spectrum by B整条上色,先完成上一节的 30 秒速判:均值、低分尾巴、两端。 - 对每个低分区段放大看上下文:是环、连接肽还是末端?再按四档色标判断它更像生物学特征还是失误。
- pickle 文件里存着完整模型输出,用下面代码取全局统计:
import pickle r = pickle.load(open('result_model_1.pkl', 'rb')) plddt, pae = r['plddt'], r['predicted_aligned_error']print(plddt.mean(), (plddt < 50).mean()) print(pae.max(), r['max_predicted_aligned_error'])- 复合物再取
pae矩阵看非对角区块,确认界面置信度是否支持你关心的相互作用。
流程走一遍就是这张图:
flowchart LR A[打开 ranked_0.pdb] --> B[spectrum by B 上色] B --> C{30 秒全局速判} C -->|整体高| D[结构可直接使用] C -->|局部低分| E[按四档色标判断是否生物学特征] C -->|整体低| F[回查 MSA 与模板并重跑] E --> G[从 result pkl 读取 PAE]【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考