尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

猪T2T基因组组装全攻略:从三代测序到完整参考基因组

猪T2T基因组组装全攻略:从三代测序到完整参考基因组 项目整体拆解与核心价值分析说实话看到这个标题的时候我先愣了一下。猪的T2T基因组组装这活儿放在几年前想都不敢想。人类T2T联盟T2T Consortium是在2022年才正式发布完整的人类基因组序列紧接着就有团队把猪的基因组也做到了端粒到端粒的水平而且还发表在iMeta这种交叉学科期刊上说明这项工作本身就不是单纯堆测序数据而是集合了群体遗传、功能基因组、生物医学模型等一堆需求。先说清楚这个东西到底是干什么的。猪的参考基因组以前一直用的是Sscrofa11.1这个版本基于Illumina短读长测序组装从头到尾留下了大约上千个空洞gap尤其集中在着丝粒、端粒、核糖体DNArDNA这些高重复区域。T2T组装的任务就是把每条染色体从头到尾拼成一条没有空隙的连续序列覆盖到真正的端粒重复序列TTAGGGn以及着丝粒的卫星DNA阵列让参考基因组不再是“大致完整”而是真正意义上的“完整”。这篇论文由张龙超、王金勇、刘娣、李明洲、印遇龙、王立贤等团队联合完成涉及中国多个生猪育种和遗传改良重点实验室。我个人的理解是这个合作阵容本身就释放了一个信号猪基因组的T2T化不是纯粹的基因组学炫技而是直接奔着育种应用、异种器官移植、人类疾病模型去的。印遇龙团队一直在做猪营养与肉质性状的分子机制李明洲团队在猪脂肪沉积和体型性状的遗传解析上积累很深王立贤和张龙超团队长期扎根猪育种核心群选育刘娣团队在地方猪种质资源保护和利用上有大量材料积累——这些人凑在一起做T2T基本就是把“基础基因组资源—经济性状解析—育种应用”这个链条一次性打通了。从影响范围来说这份参考基因组不只是换了一个更好的“地图”。它首先意味着猪基因组的结构变异、转座子插入、拷贝数变异会被重新注释一遍以前因为短读长比对模糊而被忽略的差异现在都能看清楚了。其次是着丝粒和端粒区域的序列这些区域直接关系到染色体分裂稳定性、表观遗传调控和衰老相关研究。再往下说猪是异种器官移植的重要供体猪内源性逆转录病毒PERV的整合位点以前受限于参考基因组的不完整很多位点找不全T2T版本有助于更全面评估这些风险位点。这篇文章的价值不是把一个物种的数据“做完”而是给后续几乎所有猪相关的组学分析提供了一个新的底座。1. 从“草图”到“T2T”为什么这件事以前这么难1.1 旧参考基因组的“洞”到底有多大要理解T2T组装的难度得先理解旧的参考基因组到底缺了什么。Sscrofa11.1是2017年前后发布的版本基于短读长测序和BAC克隆策略搭建。对基因区、调控区这种序列复杂度较高的区域它已经做得不错了因为基因区域多态性高、重复序列含量相对少短读长也能覆盖到。但问题出在那些“不配合”的区域。着丝粒区域是最大的难题。猪的着丝粒包含大量串联重复的卫星DNA序列单元很短但重复次数极多总长可以达到几兆碱基甚至更长。短读长测序读长只有150bp左右拼接时根本无法判断这些重复单元之间的正确顺序最后只能留下“N”。端粒区域也有类似问题TTAGGG重复序列本身很短但排列几万次之后短读长根本无法跨过中间的重复段。rDNA区域核糖体RNA基因簇同样令人头疼几十到几百个拷贝串联排列拷贝之间存在微小差异短读长拼接直接崩盘。我当时第一次看到人类基因组“仍有大约8%的序列未完成”这个数据时觉得这个数字不算大但实际上这8%包含所有着丝粒和近着丝粒区域对染色体生物学、进化生物学和疾病机制的影响是均匀覆盖的基因区完全无法替代的。猪基因组的情况类似马、牛这些农业动物的参考基因组也同样存在这个问题。1.2 T2T技术路线为什么能弥合这些缺口T2T能成核心是三代测序的突破。PacBio HiFi读长在15kb到25kb左右单碱基精度能到99.9%以上这让它既能跨过短读长跨不掉的短重复单元又能通过自身的高精度直接纠错。ONTOxford Nanopore的超长读长更是离谱可以轻松读到100kb、200kb甚至1Mb以上复制间隔大的重复区域时一条读长直接跨越一个完整着丝粒卫星阵列的一半甚至全部就能把两端的信息锚定起来。猪的T2T组装技术上走的大体是这条路线先用HiFi和超长ONT读长完成初始组装再通过Hi-C把contig锚定到染色体尺度接着对着丝粒、端粒、rDNA这些高难度区域做人工检查和局部修正最后用Bionano光学图谱或者其他技术做拼图校验。这个流程现在听起来简单但每一步踩坑都能让人怀疑人生后面我会详细说。1.3 为什么选猪农业、医学两个轮子一起转猪的基因组之所以值得动用这么大的资源去做T2T是因为它在两个领域同时扮演着不可替代的角色。第一个是农业育种。猪是全球消费量最大的肉类之一中国更是全球最大的生猪生产国和消费国。基因组选择GS技术在国内已经大规模应用但GS的效果极度依赖参考基因组质量——参考基因组不准基因分型芯片的探针设计就会引入偏差结构变异和拷贝数变异的检测更是无从谈起。有了猪的T2T参考基因组育种芯片的位点筛选可以重新优化以前因为探针设计在重复区域而失效的标记可以重新纳入候选这在群体遗传分析和亲缘关系评估上会有直接收益。第二个是生物医学。猪在解剖结构、器官大小、生理代谢上和人高度相似是异种器官移植、心血管疾病模型和新药临床前试验的重要研究对象。2018年之后猪器官移植在基因编辑技术加持下不断突破但异种移植面临免疫排斥、凝血紊乱、PERV再激活等问题。这些问题的分子机制都需要在完整基因组上做精细定位。比如PERV整合位点数目和分布以前用短读长参考基因组统计可能偏差很大T2T基因组能把整合位点看清楚这对基因编辑猪的构建策略有直接影响。2. 核心技术与方案要点T2T组装到底难在哪里2.1 复杂区域的重复序列是真正的“硬骨头”很多人以为基因组组装难在数据量其实数据量反而是最不值钱的部分真正的硬骨头是高复杂度重复序列。端着丝粒区域来举例猪的着丝粒序列由PigSat1和PigSat2两类卫星DNA为主体每一类又有很多变异变体单元之间相似度很高。如果读长不够长拼接软件会把不同的重复单元错误地折叠成同一个导致序列长度压缩、结构错误。以前短读长时代的做法是直接跳过这些区域留作空洞不管。T2T思路则不同是必须用超长读长把这些区域“硬跨”过去。端粒的问题相对简单一些——序列本身只有TTAGGG一个模式但数量巨大而且染色体末端还伴随着亚端粒区域的各种复杂重复。要确认端粒有没有被完全组装出来通常需要做序列特征扫描搜索TTAGGG重复串并且验证它出现在染色体序列的最末端而不是中间某个无关位置。rDNA区域是另一个容易出bug的点。核糖体DNA以串联重复形式分布在特定染色体上猪的rDNA簇主要在13、14、15号染色体短臂拷贝数很多且高度相似。ONT超长读长虽然能跨过部分拷贝但拼接时软件有时会“过度压缩”拷贝数导致rDNA基因簇长度偏差。要解决这个问题通常需要结合分子实验如PFGE、Southern blot来辅助估计拷贝数再手动调整组装结果。2.2 数据组合策略HiFi、ONT、Hi-C三件套缺一不可我见过很多刚入门的组学研究者问做T2T组装是不是只需要ONT超长读长就行答案是远远不够。每个数据源都有无法替代的定位也有不可避免的盲区。PacBio HiFi的核心价值是高精度。HiFi的碱基错误率能控制在0.1%以下这意味着不用靠后续纠错步骤去“猜”序列拼接出的consensus更可靠。ONT超长读长的价值是连续性它解决的是“怎么把长得差不多的重复单元按正确顺序串起来”的问题。Hi-C的核心价值是走向染色体级别它通过染色质三维互作频率来判断两个contig在空间上是否邻近从而把所有contig排列成染色体单位。合理的策略是先做HiFi组装得到高精度但可能断在重度重复区的contig再用ONT超长读长填补间隙并延伸contig最后用Hi-C进行染色体级挂载。这三者的覆盖深度一般建议HiFi在30x到50x之间ONT超长读长则追求读长而不是深度20x到40x左右已经足够Hi-C需要30x以上。注意这些数字要结合具体样品的基因组大小、杂合度和重复序列含量动态调整猪基因组约2.5Gb杂合度较低因为家猪长期近交选育比某些超高杂合的野生物种容易一点但也不能完全掉以轻心。2.3 单倍型解析与样本选择决定下游分析是否“干净”T2T组装还要面临一个关键选择最终输出的“参考基因组”究竟是单倍型的还是双单倍型的。二倍体生物有两套同源染色体如果两套序列之间存在差异组装软件会有两种路线一种是把两套序列分别组装出来形成haplotype-resolved的两个版本另一种是只输出一套“伪单倍型”相当于把两套序列合并装配成一条。对于猪这样一个长期经历过强烈选择的物种不同品种之间的基因组差异很大但如果选用的是高度纯合的个体或近交系两条同源染色体之间的差异会很小合并组装带来的质量损失不明显。T2T项目通常更倾向于使用近交系或高度纯合个体来降低组装难度。一方面低杂合度可以减小两套单倍型在组装中的干扰另一方面后续的注释和比较基因组分析也更容易。但如果目标侧重于品种特异性结构变异检测那么选用杂合个体并做双单倍型组装反而更有价值。这个选择没有绝对的对错取决于项目一开始设定的科学问题。我个人的建议是如果是做农业物种的参考基因组升级优先选用一个亲本来源清晰、近交程度高或者可通过连续回交获得的纯合样本配合家系信息做验证。这样后续做群体重测序找变异时背景噪音会小很多。3. 实操流程与关键环节实现从样本到完整基因组的全链路3.1 第一步样本准备与DNA提取决定一切的老底子很多人在T2T组装上翻车不是组装环节出了问题而是DNA提取阶段就埋了雷。ONT超长读长对DNA完整性极其敏感DNA断裂越少读长就能达到更高。常规的哺乳动物组织提取方法如果用酚氯仿抽提或者某些商业试剂盒得到的DNA片段长度可能在30kb到100kb之间这对于普通的三代组装没问题但想拼T2T就很难拿到足够长的跨重复区读长。实际操作中我见过做得比较好的流程是这样的取少量动物组织比如耳组织或肝组织采用低熔点琼脂糖包埋的方式提取高分子量DNA再通过盐析或磁珠法纯化去除多糖和蛋白质杂质。这个流程需要严格控制切碎组织的力度、离心速度和处理温度。DNA完整性评估不能只看OD260/280还必须用脉冲场凝胶电泳或Qubit配合安捷伦片段分析仪检查DNA片段分布。如果DNA主带集中在100kb以下说明提取过程物理剪切严重需要重新摸索组织用量和匀浆参数。有条件的实验室最好把DNA提取和测序放在同一个场地减少运输过程中反复冻融导致的断裂。相信做过长片段测序的朋友都有体会同一个样本在实验室提完直接上机和打包寄送测序公司再上机得到的读长分布差距可能在一倍以上。3.2 第二步测序数据产出与QC别急着直接上组装测序完成后第一步不是急着拼装而是做严格的数据质量审计。HiFi数据需要检查reads长度的分布情况以及每个ZMW孔的产出是否均衡。质量值Q20以上占比需要重点看如果Q20 read占比低于85%可能说明测序过程中存在系统性问题比如模板损伤或者反应条件控制不佳。ONT数据则要关注read N50和read长度分布同时用测序仪自带的碱基识别模型检查每个read的平均质量值。N50只是平均值分布形态更重要——如果大部分reads集中在20kb左右而缺少100kb以上的长尾对接下来的超长跨域拼装不利。Hi-C数据则要做两件事一是检查有效互作对的比率二是评估染色质互作信号的强度。如果有效互作对占比低于50%很可能说明交联或酶切步骤优化不到位矩阵中的噪声会直接影响挂载的准确性。在把数据推进下游之前我强烈建议先用FastQC、LongQC、MultiQC这类工具做统一的质量汇总报告然后统计覆盖深度、GC偏倚、duplication rate等指标。针对T2T项目还要额外关注是否存在样本污染可以用FastQ Screen或Kraken2做物种来源抽检避免混入其他物种序列造成下游拼接混乱。3.3 第三步工具链选型与组装策略hifiasm与Verkko怎么选目前主流的T2T级组装工具集中在hifiasm、Verkko和HiCanu这三者之间。hifiasm是HiFi数据的首选工具之一它的核心优势是能输出高质量的haplotype-resolved组装。它通过双倍型图dual assembly graph同时处理两个单倍型能有效抵抗杂合位点带来的拼接错误。在猪这类杂合度不高的物种上hifiasm跑完一般能直接得到很长的contig N50通常能达到几十Mb到上百Mb。Verkko是专门为T2T目标设计的工具它的特色是把HiFi和ONT超长读长的信息同时纳入组装图构建在HiFi的高精度基础上借助ONT跨越长重复区。Verkko输出的结果中包含trio-based的phasing信息如果有父母本数据的话非常适合做双单倍型T2T。HiCanu则相对保守优点是兼容性强、稳定性好但对计算资源和内存的消耗比较大。我个人的做法通常是先用hifiasm做一版快速组装得到基线数据用于评估样本质量和覆盖度再根据版本差异决定是否上Verkko做精细修正。如果只有一台机器内存要至少准备256GB以上尤其是Verkko和HiCanu在构建大基因组组装图时内存峰值可以冲到几千GB分布式集群或者高配置服务器几乎是必需品。组装命令细节不展开写了但要重点提醒参数设置一定要参考工具文档中推荐的物种基因组大小和覆盖深度同时保存好每一步运行的日志文件这种大型组装项目一旦某个节点出错回滚排查相当费时。3.4 第四步contig修正、挂载与手工闭合最费人的阶段初始组装出来的contig只能算是半成品接下来要经过一个非常繁琐的修正与验证阶段。首先是序列修正。常用的工具包括Racon用于ONT数据迭代纠错和Medaka用于ONT数据polish如果用的是HiFi组装为主则可以考虑用DeepVariant搭配GATK的HaplotypeCaller做单核苷酸错误位点的识别和修正。整个过程需要把原始reads比对回组装序列比对时建议使用Winnowmap2这类专门处理高重复基因组的比对器普通比对软件在着丝粒区域经常丢reads或者错配导致polish效果大打折扣。然后是染色体尺度挂载。利用Hi-C数据生成的contact map可以清楚看到contig之间的互作矩阵绝大多数情况下可以自动完成挂载但着丝粒区域经常出现互作强度低、信号断裂的情况。这时候需要借助遗传图谱或光学图谱数据来辅助判断contig的位置和方向。到了这个阶段还有一个不可回避的工作是区分真正的“杂合contig”和“错误叠加”。如果样本来自有一定杂合度的个体组装软件可能分别输出两条等位contig对应同源染色体上的同一区域。此时要把它们标记为双单倍型中的不同版本而不是把它们当作不同染色体区域继续挂载否则会人为地制造出错误的“重复区域”。最令人头秃的是着丝粒和rDNA区域的最终闭合。这些区域通常靠ONT超长读长的边缘锚定来尝试穿越如果读长长度不够永远会在中间留下缺口。需要手工查看组装图的局部结构判断是否存在可延伸路径有时要把上百条候选reads翻来覆去地比对找到唯一可能的路径才能闭合。这一步的自动化程度很低即便是经验丰富的团队每闭合一个复杂区域消耗几天时间也很常见。4. 常见问题与排查技巧实录从踩坑到填坑4.1 超长读长太少跨不过重复区怎么办症状很典型组装的contig N50倒是挺高但着丝粒区域留下好几个大缺口怎么都闭不上。查了一圈问题多半出在ONT超长reads的产出上。最常见的原因有三个DNA片段化太严重、测序文库构建中大片段筛选不充分、以及测序芯片上核酸样本加载量过高导致孔内模板拥挤。针对第一个原因我建议回收DNA后立即跑脉冲场电泳如果主带低于50kb就要重新提取针对第二个原因可以调整蓝光切割片段筛选的参数严格保留长片段针对第三个原因减少上样量让芯片上的孔不会过度饱和让单孔产出更长的reads。如果已经进了组装流程才发现问题只能在算法层面补救尝试提高相邻短contig之间的overlap阈值看看能不能用HiFi数据直接桥接短距离缺口或者用Hi-C数据辅助验证contig的相对方向和顺序把可能闭合的区域先排好序等到补测数据到位后再定向闭合。不要在一棵树上吊死先把手头的数据发挥到最大价值。4.2 组装结果里出现人为的重复或缺失有时候组装出的序列长度超过预期或者BUSCO评估显示完整的单拷贝基因变成了多拷贝说明组装过程中出现了人为重复。这种情况在高杂合样本中很常见两个单倍型的差异区段被拼接软件错误识别为基因重复。排查方式是先把组装序列的k-mer分布画出来观察是否存在两个明显的峰值如果是说明单倍型可能没有被正确分开。另一种方式是选择一组已知为单拷贝的基因比对回组装结果若大量出现双拷贝则高度怀疑是haplotype collapse失败。解决思路有两条一是给组装工具提供父母本短读长数据利用trio信息辅助分型二是用purge_dups或purge_haplotigs这类工具把冗余的单倍型叠瓦contig去掉。对于猪这种已有大量品种参考序列的物种还可以把组装结果比对到近缘参考基因组上识别那些异常插入或异常缺失的区域。4.3 Hi-C挂载时着丝粒区域一团乱麻Hi-C挂载失败是T2T项目里最常见的挫败源。打开contact map时染色体内部本来应该呈现清晰的对角线结构但着丝粒区域往往出现一个或多个明显的信号空洞甚至整个染色体被错误地压成两个片段。原因在于着丝粒区域染色质压实程度高、互作频率低加上这个区域本身的序列是重复的导致比对到它上面的Hi-C reads极少正常的聚类算法无法为其分配正确位置。处理办法包括把着丝粒区域的序列单独提取出来与已知的卫星DNA数据库比对确认其真实归属或者利用同源物种的共线性信息将着丝粒区域的相对位置锚定到已知的染色体骨架再或者借助FISH实验数据如果实验室有相关资源对具体染色体进行定位验证。总之着丝粒区域的挂载不能完全自动化人工干预步骤绝对不能省。还有一个容易忽略的问题是Hi-C文库构建时的SNP干扰。如果样本来自杂合个体Hi-C读段中的等位基因信息会影响互作矩阵的聚类可能出现“两个单倍型各自成簇”的现象。这时候可以考虑先把测序数据比对到单倍型参考序列上进行再聚类或者利用HiCExplorer和Juicebox中的手动调整工具进行可视化校正。4.4 服务器内存耗尽和计算流程卡死T2T组装对计算资源的需求远超普通基因组组装。我之前验证过Verkko在2.5Gb基因组上的运行表现初始组装图的构建阶段内存峰值很容易突破500GB如果并行线程数设置过高内存占用还可能进一步飙升。解决办法是摸清工具的并行机制不要盲目追求线程数。很多组装工具默认对每个线程分配独立内存线程一多内存直接爆掉。务必要把内存参数和线程参数联动调整保持每个线程的内存控制在合理范围并在流程中加入监控脚本随时观察内存占用率和磁盘剩余空间。另外T2T组装会生成大量中间文件临时目录必须预留足够空间。建议至少按基因组大小的30到50倍预留磁盘比如猪基因组2.5Gb就要准备约75GB到125GB的临时存储空间。如果集群没有共享存储最好在任务脚本里显式指定一个高速本地盘路径。4.5 常见问题快速排查表问题现象可能原因排查方法解决思路contig N50很高但着丝粒区大量缺口ONT超长reads长度不足查看reads长度分布优化DNA提取补测超长readsBUSCO显示基因大量重复单倍型未分开k-mer分布双峰purging冗余单倍型contigHi-C contact map着丝粒区域空白该区域互作频率低检查Hi-C比对率手工辅助挂载结合遗传图谱组装结果存在单核苷酸错误数据覆盖度不足或polish不充分GQ值分布检查调整比对工具重新polish内存溢出或进程被杀并行参数设置不合理查看系统日志控制线程数与内存比值rDNA拷贝数异常偏差高重复序列压缩或扩展分子实验辅助验证手动调整rDNA组装区域5. 猪T2T基因组带来的下游变革与延伸思考5.1 对猪功能基因定位与育种选择的影响有了T2T级别的参考基因组很多以前只能靠统计推断得到的结果可以真正上升到机制层面。比如拷贝数变异和结构变异在复杂性状中的作用以前受限于重复区域无法准确定位现在可以逐个验证。猪的一些重要经济性状如肌内脂肪含量、背膘厚、饲料转化率已被证实与若干结构变异存在关联但缺乏完整基因组信息限制了因果变异的识别。T2T版本为这类研究提供了统一底座。在育种应用上参考基因组的升级意味着全基因组选择模型中的标记密度和物理图谱准确度会发生质变。一个非常直接的优势是SNP芯片上的探针可以避开过去无法检测的重复区域从而避免无效分型和批次效应。对于从事基因组选择的团队来说T2T版本可以作为重测序数据比对的统一参考大幅减少由于参考基因组缺失带来的比对偏差。5.2 对异种移植和人类疾病模型研究的推动作用猪T2T基因组对生物医学的助推作用主要体现在两个层面。第一是PERV等内源性逆转录病毒的全面注释。以前我们只知道猪基因组中存在几十个PERV拷贝但分布在哪些区域、不同品种之间拷贝数和插入位点的差异如何相关的精确信息并不多。T2T组装之后这些转座子元件的完整插入环境和侧翼序列都可以被识别出来未来通过基因编辑手段系统性清除或失活PERV时可以有更清晰的目标列表。第二是猪作为疾病模型的精细定位能力。研究人员经常在猪上模拟人类的代谢性疾病、心血管疾病和神经退行性疾病通过基因编辑构建模拟人类致病突变的小型猪模型。这一过程中脱靶位点的检测、编辑位点周围序列结构的确认以及后续表型分析中的转录组比对都依赖于参考基因组的质量。T2T版本在这些应用场景下的价值非常直观也更容易被非基因组学背景的临床研究者理解和使用。5.3 对畜禽其他物种T2T组装的启发猪T2T基因组项目的完成给牛、羊、鸡、鸭等畜禽物种的基因组升级提供了清晰的路线图。牛、羊的单倍型结构更复杂杂合度更高可能需要借助家系信息和更深的HiFi覆盖度鸡的微染色体富含高GC区和高重复序列可能需要更激进的超长读长策略。此前人类T2T联盟的路线图虽然详尽但很多方法层面的参数和人源数据高度耦合而猪作为一个农业物种基因组特征和资源条件更接近大多数畜禽。因此这篇论文的意义不只是停留在猪这一个物种上而是为农业动物基因组学的整体水平提升提供了一个可复制的范式。5.4 组装的终点是注释、比较与功能挖掘我最后想强调一点T2T级别的参考基因组组装完成只是起点真正的挑战在后面的注释与挖掘。基因组序列本身没有太多可解读价值必须依托完整的基因、非编码RNA、调控元件、转座子注释才能开展比较基因组和功能基因组研究。猪的基因注释还存在不少争议尤其是一些长非编码RNA和假基因它们在不同品种和不同发育阶段的表达模式差异很大。有了T2T级别的参考基因组这些之前很难精确定位的转录本可以重新注释到染色体上的精确位置。对于做功能研究的团队我建议优先关注着丝粒区域和端粒区域的表观遗传特征。很多研究者习惯了只盯着蛋白编码基因但基因组中占比最高的重复序列可能在维持染色体结构、调控临近基因表达、响应环境应激等方面发挥着远未被理解的功能。猪T2T基因组提供了研究这些区域的机会窗口谁先在这个方向上做出成果谁就能抢占下一轮动物基因组学研究的先机。说点实际的如果你所在的团队正在启动任何一个农业物种的T2T计划千万不要一上来就把所有精力投入到组装环节。先想清楚这个参考基因组要服务哪些下游问题基于这些问题决定样本来源、组装策略和验证手段这是我这几年做基因组项目最大的教训。组装工具不断迭代数据产出成本持续下降但科学问题的定义和实验设计的合理性永远是决定一个基因组项目最终有多少影响力的关键。
返回列表