尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

如何读懂 pLDDT 与 PAE:AlphaFold 置信度评估实战指南

如何读懂 pLDDT 与 PAE:AlphaFold 置信度评估实战指南 如何读懂 pLDDT 与 PAEAlphaFold 置信度评估实战指南【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold你刚跑完 AlphaFold 预测拿到一堆 PDB 文件和一张彩色图这个结构敢不敢直接拿去做对接答案藏在 AlphaFold 的两个核心置信度指标里pLDDT 和 PAE。下面带你按决策流程走一遍——先 30 秒全局判断再逐区细读然后看 PAE 矩阵最后处理冲突与异常。 快速判断用 pLDDT 均值和四档分级定能不能用一句话结论先看 pLDDT 均值再看它的分布——均值决定整体档次曲线决定哪里敢信。先打个比方拿到成绩单你关心的不只是一个总分而是每科的分数。pLDDTpredicted Local Distance Difference Test就是模型给每个氨基酸残基打的单项成绩0 到 100分越高说明模型对这个残基局部结构越有把握。实现上网络先给每个残基输出一组 logits经 softmax 变成概率分布再按距离误差分桶的中心值加权求和# 来源alphafold/common/confidence.py num_bins logits.shape[-1] bin_width 1.0 / num_bins bin_centers np.arange(0.5 * bin_width, 1.0, bin_width) # 各分桶的中心值归一化 0-1 probs scipy.special.softmax(logits, axis-1) # logits → 概率分布 predicted_lddt_ca np.sum(probs * bin_centers, axis-1) # 期望值 return predicted_lddt_ca * 100 # 放大到 0-100白话说输入是每个残基的原始 logits输出就是每个残基的 pLDDT 分。拿到逐残基分数后官方 AlphaFold 置信度分级把它切成四档档位代码分数区间通俗叫法能用到什么程度H90–100非常可靠原子位置基本可信可支撑侧链级工作M70–90良好骨架可信个别侧链朝向可能有偏差L50–70偏低只信拓扑哪块挨着哪块细节别抠D0–50基本无序大概率本征无序别硬把它当静态结构给你的快速判断规则均值 ≥ 80 且没有成片的低分区→ 直接用论文里注明模型版本和 pLDDT 即可均值 60–80→ 别急着下结论进入下一节定位低分区是什么均值 60→ 先别用直接跳到后面的排障手册。完整的判断路径长这样 逐区细看pLDDT 高值、低值与突变点各代表什么一句话结论pLDDT 解读不能只看曲线的高低它的形状比均值信息量更大。持续高值区通常是保守核心和规则二级结构骨架可以照单全收。低值区⚠️ 注意这里低 ≠ 错。它可能是末端柔性、本征无序区IDR、或功能上必需的动态环——模型对本来就晃的区域给低分是诚实的自评估不是故障。突变点陡升陡降高低交界处往往正好落在结构域边界上结合下一节的 PAE 区块再确认一次基本就稳了。单残基突降可能是翻译后修饰位点或结合口袋值得在稿件里单独标注。如果你想要逐残基的 D/L/M/H 归类置信度指标计算源码 里的confidence_json已经直接做掉了不用自己写分类逻辑。️ PAE 怎么看从矩阵里读出结构域边界与亚基界面一句话结论pLDDT 评的是每个残基的单项成绩PAE 画的是一张残基两两之间的距离误差地图——它回答的是这两个区域的相对摆位敢不敢信。正式名称 PAEPredicted Aligned Error是一个 N×N 的矩阵每个格子的数值是假设把预测结构和真实结构对齐到最贴合时残基 i 与残基 j 之间距离偏掉多少的期望值单位 Å。算法和 pLDDT 是同一套期望值思路网络给每对残基在若干误差档位上分配概率最终取概率与档位中心的加权和。打个比方就像估两人站位误差——先问每个误差档的可能性多大再加权求平均$$\text{PAE}{ij} \sum{k} p_{ijk} \cdot c_k$$还是加权平均那句话p 是网络对每个误差档位的概率c 是该档位的中心值把各档加起来就是这对残基预期差多少。# 来源alphafold/common/confidence.py probs scipy.special.softmax(logits, axis-1) # [残基, 残基, 档位] 的概率 bin_centers _calculate_bin_centers(breaks) # 每个误差档位的中心值 pae np.sum(probs * bin_centers, axis-1) # 每对残基的期望距离误差白话说输入是残基 × 残基 × 误差档位的三维 logits 数组输出是每对残基的 PAE 值Å。读矩阵盯三处对角带主对角线附近数值低说明局部结构可信一般和 pLDDT 高分区互相印证非对角区块单链多结构域蛋白两个结构域之间的区块值低代表它们的相对摆位可信值高则整体拓扑可能对、但域间角度不可信复合物预测multimer同一亚基的区块通常偏低亚基之间的区块直接反映界面置信度——如果亚基间区块整体偏高界面可能不稳这条复合物结果就不能直接下结论。顺带一提输出文件里附带的 ptm / ipTM 分数就是从这份 PAE 矩阵推导来的对应predicted_tm_score分别把整体可信度和界面可信度压缩成一个数字方便快速横向比较不同模型。⚡ 两个指标打架时冲突组合对照表一句话结论pLDDT 管局部PAE 管相对两者不一致不是故障而是在告诉你该信哪一层信息。组合pLDDT 表现PAE 表现最可能的解释处理建议A整体高非对角区块低局部与相对位置都稳放心使用B整体高非对角区块高各区域自身结构对但区域间相对摆位不准按结构域分开讨论别引用整体复合物C局部偏低整体低骨架拓扑对个别侧链/环无法钉死做骨架级别的粗粒度研究D高低交替棋盘状区块多结构域蛋白按区块拆分分别标注各域置信度 排障手册整体偏低、局部骤降、矩阵异常各怎么办一句话结论置信度不对劲时先排除输入问题——MSA 质量和比对正确率是最常见的元凶。症状先怀疑下一步动作整体 pLDDT 偏低60MSA 太薄、找不到同源查 MSA 深度与目标序列覆盖率必要时补充数据库或换比对策略仅一段偏低该区域本就柔性/无序对照无序预测工具和 PAE 复核两者都指向低就按生物学特征而非模型故障处理PAE 整体异常高或模式怪输入特征有问题或某次种子运行翻车换多个随机种子对比再核对比对质量最后才怀疑模型本身高分区与已知实验无序区矛盾预测过度自信用交叉验证或实验数据复核别只信 pLDDT 一个数字对特别难的目标官方技术说明 里提到把种子数提高到 20 并适当增加 recycling 次数——置信度不达标时这是第一优先级可以尝试的调参。 进阶动态区域筛查、界面置信度与突变影响一句话结论把两个指标读懂之后置信度数据就不再只是质检数字而是下游问题的筛选器。动态区域识别低 pLDDT 叠加无序预测的低分筛出候选动态区再交给分子动力学验证是找功能柔性环的常用套路界面评估蛋白质-蛋白质相互作用时把 PAE 非对角区块当初筛界面可信度直接看 ipTM两者一致才把复合物推进下一步突变影响分析野生型与突变体并行预测、对比置信度变化突变后局部 pLDDT 塌方往往提示结构失稳这在结构导向设计里很好用展望蛋白质结构预测置信度的研究重心正从能不能预测转向预测结果敢不敢信而 pLDDT 与 PAE 的校准方法就是这条主线上的核心一环。想深挖实现的话两个预测头都在置信度预测头源码里PredictedLDDTHead输出逐残基 logitsPredictedAlignedErrorHead输出逐残基对的三维 logits和上面两段代码正好一一对应。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表