尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

【文献分享】pLAST:基于蛋白家族上下文和词向量的质粒语言分析与搜索工具

【文献分享】pLAST:基于蛋白家族上下文和词向量的质粒语言分析与搜索工具 一、文章介绍细菌质粒是水平基因转移的主要驱动力介导抗生素抗性基因、金属抗性基因和毒力因子的传播在细菌进化和公共卫生中具有重大意义。随着测序技术的普及专门的质粒数据库正快速扩展——PLSDD数据库从2021年的约34,000条非冗余条目增至2025年更新的约72,000条IMG/PR和PlasmidScope等非冗余资源分别包含约700,000和约852,000条质粒序列其中包括从宏基因组中重建的质粒。面对如此庞大的数据量如何快速、准确地搜索和比较质粒成为计算生物学的重要挑战。现有质粒搜索工具主要分为两类。基于DNA的方法如Mash、BLASTn、skani、fastANI通过比较全质粒核苷酸序列评估全局相似性但存在明显局限DNA序列比蛋白质序列进化更快远缘关系的同源信号常低于检测阈值质粒通常具有模块化和嵌合性共享序列常不连续辅助区域和可移动元件会扭曲全局相似性度量此外多数方法未充分考虑质粒的环状特性。基于蛋白质的方法如DIAMOND通过ORF到ORF的比对聚合每个ORF的最佳匹配位分值来比较基因含量对远缘同源性更为鲁棒。然而独立比较ORF会丢弃基因顺序这一进化信息丰富的信号蛋白质水平匹配若不考虑基因组上下文易被旁系同源物混淆且在数十万质粒规模上的全对全ORF比对计算成本高昂。为突破上述瓶颈Kamil Krakowski、Małgorzata Orłowska及其合作者在Bioinformatics上发表了题为“pLAST: plasmid Language Analysis and Search Tool”的应用笔记提出了一个基于自然语言处理词向量模型的质粒搜索工具。pLAST的核心思想是将每个质粒视为“句子”将其ORF视为“单词”每个ORF由其所属的蛋白家族通过MMseqs2聚类获得标识。研究者从PlasmidScope数据库750,000条质粒2,500万个蛋白~1,060万个独特蛋白序列出发用MMseqs2以30%序列同一性和80%覆盖度将蛋白聚类为近200万个独特家族。每个质粒被编码为这些家族ID的序列为消除对任意起始坐标的依赖环状质粒的ORF链在数据集创建时被随机环状置换并以50%概率反转顺序。然后使用Gensim的CBOW架构词向量维度64上下文窗口4min_count2负采样15训练word2vec模型学习每个蛋白家族在其局部基因组邻域中的上下文表示。最终模型有效词汇量为778,475个蛋白家族。质粒的向量表示由其所有ORF嵌入的平均值计算缺失聚类分配或模型中没有对应向量的ORF使用占位符向量所有ORF嵌入的平均值。pLAST的全局质粒相似性通过单位归一化质粒嵌入之间的余弦相似度计算搜索预计算嵌入仅需0.72秒比Mash快40倍。除全局相似性外pLAST还返回逐ORF的质粒-质粒对齐通过计算ORF嵌入之间的余弦相似度识别共享功能模块阈值≥0.6。研究者构建了一个包含1,288个接合型或可移动型质粒的非冗余基准数据库以200个质粒为查询评估各方法检索共享松弛酶类型和交配对形成系统类型的能力——两者分别代表单基因座和多基因功能模块的不同挑战。结果表明pLAST在使用MMseqs2定义的蛋白家族时达到与DIAMOND相当的性能优于BLASTn、Mash、skani和fastANI在检测共享MPF系统类型时pLAST比Mash提高26%在检测共享松弛酶类型时提高24%。对~52,000个RefSeq质粒的UMAP投影显示pLAST嵌入空间形成了功能连贯的群组其可移动基因库与报告的宿主范围一致。在pAMV1与pYEE1质粒的案例分析中pLAST的逐ORF对齐成功识别了共享的甲基营养岛模块并揭示了丝氨酸循环模块的缺失和环状重排。二、算法原理介绍pLAST的算法设计围绕“质粒作为蛋白家族序列 → word2vec上下文嵌入 → 余弦相似度搜索与对齐”三个核心步骤展开。一质粒编码与蛋白家族定义。从PlasmidScope数据库750k质粒中提取所有ORF用MMseqs2以**30%序列同一性和80%覆盖度**聚类为蛋白家族200万家族。每个质粒被编码为家族ID序列P[f1,f2,...,fn]P [f_1, f_2, ..., f_n]P[f1​,f2​,...,fn​]fif_ifi​为第iii个ORF所属家族ID。为处理环状质粒的起始位点任意性问题每个质粒在训练前以50%概率反转方向并进行随机环状置换将任意位置作为序列起点。这一预处理使模型对质粒环状性和方向不敏感。二word2vec训练与蛋白家族嵌入。使用Gensim的**CBOWContinuous Bag-of-Words**架构训练word2vec模型目标为根据上下文蛋白家族预测中心蛋白家族。参数向量维度d64d64d64上下文窗口大小w4w4w4左右各4个家族min_count2出现2次的家族被忽略负采样数15训练30轮。CBOW架构使功能相关的蛋白家族常出现在相似基因组上下文中在嵌入空间中彼此接近。最终模型为每个有效家族fff学习到64维嵌入向量vf∈R64\mathbf{v}_f \in \mathbb{R}^{64}vf​∈R64有效词汇量778,475。未出现在模型中的ORF使用占位符向量vblank1N∑fvf\mathbf{v}_{\text{blank}} \frac{1}{N}\sum_f \mathbf{v}_fvblank​N1​∑f​vf​所有嵌入的平均值。三质粒嵌入与相似度计算。给定质粒PPP其嵌入为所有ORF嵌入的平均值EP1n∑i1nvfi\mathbf{E}_P \frac{1}{n}\sum_{i1}^n \mathbf{v}_{f_i}EP​n1​∑i1n​vfi​​。两质粒PPP和QQQ的相似度定义为单位归一化向量的余弦相似度sim(P,Q)EP⋅EQ∥EP∥∥EQ∥∈[−1,1]\text{sim}(P,Q) \frac{\mathbf{E}_P \cdot \mathbf{E}_Q}{\|\mathbf{E}_P\|\|\mathbf{E}_Q\|} \in [-1,1]sim(P,Q)∥EP​∥∥EQ​∥EP​⋅EQ​​∈[−1,1]。预计算所有质粒嵌入后对查询质粒只需一次点积运算即可排序全数据库搜索~750k质粒1秒。除全局相似度外pLAST还计算逐ORF对齐矩阵对质粒PPP的每个ORFiii和质粒QQQ的每个ORFjjj计算cos⁡(vfi,vfj)\cos(\mathbf{v}_{f_i}, \mathbf{v}_{f_j})cos(vfi​​,vfj​​)。高于阈值默认0.6的配对用连线标记显示两质粒间共享的蛋白家族模块即使整体序列相似性很低。三、总结pLAST是一个基于word2vec的质粒搜索工具通过将质粒编码为蛋白家族序列并训练CBOW模型学习每个蛋白家族的局部基因组上下文嵌入实现快速且功能相关的质粒相似性搜索。其核心创新在于以蛋白家族的共现上下文代替氨基酸序列比对来推断功能相似性使搜索速度比DIAMOND快两个数量级0.72秒 vs 47秒同时在检测共享功能模块MPF类型和松弛酶类型上达到与DIAMOND相当的性能比Mash分别提升26%和24%。pLAST的逐ORF对齐功能使研究者能在整体低相似度的质粒间识别共享的多基因功能岛如甲基营养岛为大规模质粒数据库中功能相关质粒的快速检索、模块检测和进化分析提供了兼具速度和生物学可解释性的解决方案。
返回列表