尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

一文读懂表观遗传:甲基化、组蛋白修饰与染色质调控

一文读懂表观遗传:甲基化、组蛋白修饰与染色质调控 如果你做过转录组测序很可能遇到过这种状况某个基因在两组样本之间表达量差了好几倍但你把相关区域的DNA序列翻来覆去找没有突变、没有拷贝数变化测序深度也正常。新手的第一反应是数据是不是有问题但做表观遗传的同事大概会扫一眼说查查启动子甲基化或者看看组蛋白修饰状态。这就是表观遗传的核心舞台——同样的DNA序列可以有不同的打开方式而且这种打开方式还真的能影响表型甚至在一定程度上传递下去。这篇内容就是写给刚进实验室、被各种术语砸晕的科研新人的目标是把甲基化、组蛋白修饰、染色质重塑、非编码RNA这些概念串成一张清晰的认知地图告诉大家它们是怎么被研究、怎么被验证、又各自在什么场景下真正起作用。无论你是做肿瘤、发育还是神经方向这套基本框架都会反复用到。1. 先搞明白表观两个字的分量——表观遗传不是玄学1.1 一个让新人困惑的现实场景先回到开头那个场景。两个样本DNA序列几乎一模一样但基因表达天差地别。如果你只盯着ATCG四个字母永远解释不了这个问题。而表观遗传学给的答案是DNA的读法受额外信息层的调控——DNA甲基化、组蛋白修饰、染色质的开放程度、RNA层面的调控共同决定了哪些基因被转录、哪些区域保持沉默。难点在于额外信息层这个词听起来很抽象。很多人学表观遗传第一反应是背概念背完之后还是不清楚它和传统遗传学到底边界在哪儿。但边界其实不用划得那么清。我个人的理解是遗传学解决有什么信息表观遗传学解决这个信息被不被用、怎么用、在多长时间里以什么方式持续地用。1.2 一个简单的心智模型剧本和导演把基因组想象成一部完整的剧本里面每一幕、每一句台词都已经写好了。传统遗传突变等于剧本本身写错了字、删了段落这是硬伤。而表观遗传更像导演的调度——同一部剧本A组样本的导演疯狂强调抑癌基因那段戏让它在舞台上反复上演B组样本的导演直接把那段戏的舞台灯光关掉台词一句也听不见。剧本没变但演出效果完全不同。这个类比能解释一个关键点表观遗传状态对同一个体不同组织、不同发育阶段的差异非常敏感。同一套基因组神经元、肝细胞、心肌细胞的表达谱截然不同靠的就是表观层面的编排。对科研新人来说把基因组硬件、表观基因组操作系统作为起步心智模型后面学起来会顺很多。1.3 可遗传到底怎么理解教科书里对表观遗传的定义通常包含可遗传的、不基于DNA序列变化的表型改变。这里的可遗传有两个层次有丝分裂后遗传细胞记忆一个细胞分裂成两个子细胞子细胞必须延续同样的基因表达程序否则一个肝细胞分裂两次就变成乱七八糟的混合细胞了。DNA甲基化和组蛋白修饰在复制后会被相应机制恢复这就是细胞记得自己是谁的基础。减数分裂后遗传跨代遗传指通过配子传递给后代的表观标记。这个领域争议一直不少因为绝大多数表观标记在配子形成和早期胚胎发育中会被大规模擦除重写。对科研新人来说先不急着去趟跨代遗传这潭浑水站稳第一个层次把细胞记忆、发育锁定、疾病中的稳定性理解清楚就已经能解释绝大多数你会在文献里看到的现象了。2. DNA甲基化基因组上的封条与解锁开关2.1 5-甲基胞嘧啶和CpG岛的基本背景DNA甲基化是研究得最充分、也是检测门槛最低的一种表观遗传修饰。核心化学事件是DNA甲基转移酶把甲基基团加到胞嘧啶C的第5位碳原子上生成5-甲基胞嘧啶5mC。在哺乳动物基因组中甲基化几乎只发生在CpG二核苷酸的胞嘧啶上——注意这里的p代表磷酸二酯键即C后面紧跟一个G的位点。基因组上CpG的分布并不均匀大部分零散分布的CpG位点是被甲基化的但某些区域聚集了大量未被甲基化的CpG长度通常大于200bp、GC含量偏高这些区域叫CpG岛CpG island。大约60%-70%的人类基因启动子区域都存在CpG岛这些启动子CpG岛在绝大多数正常细胞里都是低甲基化的允许基因表达一旦这些区域被异常高甲基化基因就像被贴了封条一样转录启动被阻断。2.2 DNMT家族与甲基化的维护逻辑一个很容易混淆的点是DNA甲基化是怎么从亲代细胞传到子代细胞的。关键在于维持性甲基化酶DNMT1。DNA复制时新合成的链一开始是不带甲基化的但DNMT1会识别母链上已甲基化的CpG位点并给新链上对应的CpG补上甲基实现半甲基化位点的复制记忆。与之对应的是从头甲基化酶DNMT3A、DNMT3B它们负责在完全没有甲基化的位点建立新的甲基化模式主要在发育早期、胚胎干细胞分化和某些疾病状态下发挥作用。这里有个值得新人在实验设计中记住的细节如果你想研究某个基因启动子甲基化上升是什么时候出现的可以试着结合DNMT表达水平判断是维护失败导致的被动丢失还是从头建立导致的主动增加两者生物学意义完全不同。2.3 启动子甲基化和基因表达的关系方向没有你想的那么简单教科书通常告诉新人启动子高甲基化→基因沉默。这个结论在大多数场景下成立尤其是在肿瘤抑制基因、印记基因、X染色体失活基因上。但真实数据里你会看到大量例外几个典型情况基因体gene body甲基化基因内部外显子区域的CpG甲基化反而常常与基因高表达相关。具体机制还在争论中可能与抑制基因内部假启动子活性、影响剪接方式有关。增强子甲基化增强子区域的甲基化状态变化往往比启动子更灵敏地反映细胞身份和命运转换这也是近年来的研究热点。别只盯着启动子增强子甲基化往往是更早的事件。转录因子结合位点内的甲基化有些转录因子结合DNA时对甲基化状态敏感结合位点甲基化直接阻碍识别即使启动子整体甲基化水平变化不大单个关键CpG位点也能改变表达。所以做甲基化数据分析时别一看到某个基因启动子区有差异甲基化位点就急着下结论所以它被沉默/激活了最好结合表达数据、增强子注释和已知转录因子结合位点综合判断因果方向也未必是甲基化→表达有可能是表达改变导致区域可及性变化进而影响甲基化状态。2.4 怎么测甲基化从BSP到WGBS/850K芯片对刚进组的新人最常问的问题是甲基化到底怎么检测、前辈为什么选这个方案。这里快速梳理一下主流技术路线和适用场景方法原理适用场景成本与通量BSP亚硫酸盐测序PCR亚硫酸盐处理后直接测序单个克隆或扩增子验证特定区段甲基化水平少量样本低通量金标准qMSP / MS-HRM亚硫酸盐处理后定量PCR快速检测个别位点/区域通量低速度快850K/EPIC芯片亚硫酸盐处理探针杂交大样本、全基因组覆盖但非全测序中等成本RRBS酶切富集CpG密集区后测序中高通量、经济实惠覆盖有偏偏CpG岛WGBS全基因组亚硫酸盐测序全基因组单碱基分辨率高成本数据量大所有基于亚硫酸盐的检测方法都有一个底层逻辑未甲基化的C经亚硫酸盐处理后会脱氨变成UPCR扩增后读成T甲基化的C则被保护读成C。后续分析时C/T比例就是甲基化程度。2.5 一个肿瘤研究里的经典场景以结直肠癌中的抑癌基因启动子甲基化为例很多类型的肿瘤里错配修复基因MLH1的启动子区域会被异常高甲基化导致MLH1蛋白表达丢失DNA错配修复功能丧失。有意思的是这类患者可能没有典型的MLH1点突变但肿瘤里出现大量微卫星不稳定现象。临床检测就是靠甲基化特异性PCR来判断MLH1启动子是否发生了突变样高甲基化这就是表观遗传等于肿瘤里的第二类失活机制的直观呈现。对新人来说从这类简单直接、有临床意义的案例入手比背十个定义都有用。3. 组蛋白修饰核小体外侧的彩色标签3.1 核小体和组蛋白尾巴DNA在细胞核里不是裸奔的它要缠在一串组蛋白上。组蛋白H2A、H2B、H3、H4各两分子组成一个八聚体外绕约147bp DNA这个基本单位叫核小体。链珠样结构再逐级折叠最终形成染色体。组蛋白不是单纯的包装材料它的N端尾巴会伸出核小体外面这些尾巴上的氨基酸残基可以被多种酶添加/去除化学修饰——乙酰化、甲基化、磷酸化、泛素化、巴豆酰化等等。这就是组蛋白修饰的核心核小体上不同位置的氨基酸被贴上不同标签构成一种索引系统供各种蛋白复合物读取从而招募激活或抑制因子影响染色质状态和基因表达。3.2 乙酰化和甲基化两套编码体系新人最容易刷屏的是H3K4me3、H3K27ac这类标记名。拆开看规则很简单H3K4me3组蛋白H3第4位赖氨酸的三甲基化几乎只出现在活跃转录的启动子上。H3K27ac第27位赖氨酸的乙酰化是活跃启动子和增强子的标志。H3K27me3第27位赖氨酸的三甲基化是转录抑制标志由多梳抑制复合物PRC2催化是发育调控和细胞命运锁定的关键标记。H3K9me3第9位赖氨酸三甲基化常出现在着丝粒、端粒等组成性异染色质区域也参与某些基因的长期沉默。H3K36me3标记转录延伸区常在基因体富集与剪接调控有关。乙酰化和甲基化的化学后果不同。乙酰基带有负电荷加到组蛋白赖氨酸上会中和其正电荷削弱组蛋白与DNA之间的静电吸引让染色质局部松弛。因此乙酰化几乎都是激活性的去乙酰化则与沉默相关。甲基化不带电荷不直接改变染色质物理紧密度而是靠招募特定读取器蛋白来发挥功能所以修饰位置和甲基化程度一/二/三甲基有完全不同的语义。3.3 写入器、擦除器、读取器三个角色必懂组蛋白修饰要发挥作用需要三套角色协同写入器加修饰的酶如乙酰转移酶HAT如CBP/p300、甲基转移酶HMT如EZH2、SETD2。擦除器去修饰的酶如去乙酰化酶HDAC、去甲基化酶LSD1、KDM家族。读取器识别修饰的蛋白结构域如识别乙酰化的Bromodomain、识别甲基化的PHD结构域/Chromo/Tudor结构域等。读取器把信号翻译成下游功能。很多抗肿瘤药物就是针对这三个角色的。比如EZH2抑制剂已经被用于某些淋巴瘤治疗HDAC抑制剂如伏立诺他也是表观遗传药物代表。理解这三个角色再做ChIP-seq数据分析、设计干涉实验时就知道该怎么思考了。3.4 怎么看到组蛋白修饰ChIP-seq与CUTTag**染色质免疫共沉淀测序ChIP-seq**是组蛋白修饰检测的经典方法。原理不复杂先用甲醛把蛋白质-DNA复合物交联固定超声打断成几百bp片段然后加入识别某个特定修饰的抗体把带该修饰的核小体其附着的DNA片段一起沉淀下来洗脱、反向交联、纯化DNA、建库测序。比对后就能看到某个修饰在整个基因组上的富集峰。但ChIP-seq对新手有几个不友好的点需要的细胞量往往要百万起步抗体的特异性直接决定实验成败背景噪音也相对高。近些年CUTTag技术越来越主流它靠protein A/G把抗体锚定在细胞核内然后用Tn5转座酶在原位切割抗体结合位点附近的DNA省去了超声和免疫沉淀步骤细胞用量大幅下降到几千甚至几百个信噪比更好。如果你是新入组、要新开展组蛋白修饰实验建议先看看实验室条件是否有CUTTag的建库平台条件允许的话直接上CUTTag省心很多。当然ChIP-seq的数据积累和公共资源更多做泛癌、跨数据整合时仍有不可替代的价值。4. 染色质重塑与非编码RNA表观调控的执行者4.1 ATP依赖的染色质重塑移动或移除核小体的分子机器如果说组蛋白修饰像给核小体贴上标签那么染色质重塑复合物就是直接搬动核小体的机器。它们利用ATP水解产生的能量把核小体沿DNA滑动、把组蛋白二聚体替换成变体如H2A.Z或者把整个核小体从某个区域移走。这一过程可以让转录因子获得结合空间也可以压实特定区域让启动子失去活性。核心家族包括SWI/SNF、ISWI、CHD、INO80四类。其中SWI/SNF复合物哺乳动物中就是BAF复合物和抑癌机制关联非常密切。你搜一下肿瘤基因组数据就会发现SWI/SNF复合物各亚基突变在多种肿瘤中广泛存在。正因为染色质重塑能直接改变基因组局部可及性它和表观遗传标记是双向协作的——重塑复合物暴露或遮蔽DNA组蛋白修饰酶进一步稳定或改变核小体状态。4.2 lncRNA骨架蛋白以外的非编码调控者长链非编码RNAlncRNA是表观遗传调控网络里绕不开的角色但很多新人只停留在lncRNA可以调控基因表达这个模糊印象。真正值得理解的是具体机制Xist雌性哺乳动物X染色体失活的起始因子。Xist从将来失活的X染色体上转录顺式覆盖整条染色体招募PRC2复合物铺上H3K27me3把整条染色体逐步压实为失活的异染色质。这是lncRNA作为全染色体级表观调控者的经典案例。HOTAIR从HOXC基因座转录但能反式招募PRC2到HOXD基因座实现跨位点沉默。这类分子脚手架功能让lncRNA成为表观调控复合物的组装平台。值得注意的是lncRNA注释数量极其庞大但绝大多数lncRNA的功能研究都还没有做透。对科研新人来说与其盲目去抓一个新的lncRNA做功能不如先借助已有数据库如LNCipedia、lncRNAdb、ENCODE找到在目标疾病/组织中差异表达、且有一定已知机制的候选分子再设计敲低/过表达实验验证其表型。4.3 microRNA和piRNA算不算表观遗传这个问题组会上经常被问到。严格地说microRNA主要是转录后调控——结合mRNA的3‘UTR促进降解或抑制翻译并不直接造成DNA序列变化。但在肿瘤表观遗传相关文献里microRNA经常被纳入表观遗传调控网络一方面因为很多microRNA基因本身的启动子受甲基化调控另一方面microRNA可以靶向表观遗传酶比如靶向DNMT或EZH2的miRNA形成调控回路。piRNA则主要存在于生殖细胞中负责沉默转座子。转座子如果不被压制会跳跃、插入并破坏基因组稳定性piRNA介导的DNA甲基化特别是对转座子区域的从头甲基化是维持基因组完整性的重要防线。把这些都装进一个框架里看表观遗传调控不是某一根柱子而是一组相互咬合的系统——DNA甲基化提供稳定的长期标记组蛋白修饰提供动态可读的标签染色质重塑决定物理可及性非编码RNA提供靶向招募和信号整合。做课题时先判断自己的问题是哪个层面的再选合适的检测工具思路就清晰了。4.4 表观基因组作为整体运转的例子细胞分化过程中最常见到的现象是某个关键发育转录因子启动子区域原有的H3K27me3抑制标记逐渐被H3K27ac激活标记替代同时启动子CpG甲基化下降染色质由关闭态转为开放态。这一连串事件不是某个单一机制独立完成的而是受到细胞外信号通路、转录因子和表观遗传酶共同推动。做这类研究时千万不能只取一个时间点。要设计时间梯度或者扰动实验才能看清先后顺序。你可以先做ATAC-seq找到染色质开放区域的变化再做H3K27ac和H3K27me3的CUTTag配合RNA-seq基本能建立一个哪些区域开放、哪些增强子被激活、哪些基因随之转录的完整图谱。5. 基因印迹、X染色体失活与细胞命运表观遗传的记忆功能5.1 基因印迹同一基因爸妈来源不同待遇就不同基因印迹genomic imprinting是我认为最适合给新人讲表观遗传记忆的模型因为它直观、清晰、而且后果明确。在正常二倍体细胞里每个常染色体基因有两个等位基因一个来自父亲、一个来自母亲通常两个拷贝都表达。但印记基因不一样它只表达来自父母一方的拷贝另一个拷贝被表观标记沉默。最经典的例子是IGF2/H19印记区域。这个区域里有一个印记控制区域ICR它的甲基化状态决定了父源和母源染色体的命运父源染色体上ICR被甲基化绝缘子蛋白CTCF无法结合增强子能激活下游IGF2基因母源染色体上ICR未甲基化CTCF结合上去形成绝缘子阻挡增强子激活IGF2改为激活对侧的H19基因。这样同一个DNA序列因为一个甲基化差异走向了完全不同的调控结果。基因印迹的临床意义也很直接如果母源ICR意外高甲基化会导致两份父源拷贝的表达模式出现印迹异常疾病。这类疾病背后没有序列突变纯是表观标记出了错适合作为甲基化决定健康的起步知识点。5.2 X染色体失活随机锁定整个染色体雌性哺乳动物包括人类女性细胞里有两条X染色体如果不处理就会双倍表达X染色体上的基因。解决办法是随机选择一条X染色体使其整条沉默这就是X染色体失活。整个过程由4.2里说的Xist启动随后组蛋白修饰和DNA甲基化逐步巩固让失活状态几乎不可逆转。一旦一个细胞决定了失活的是父源还是母源X其后代所有细胞都会保持同样的选择——所以女性身体是由两种X失活模式不同的细胞克隆拼成的马赛克。这种锁定终身的能力就是细胞记忆的极致体现。对想做发育或干细胞研究的新人X失活还提供了一个绝佳窗口去研究表观遗传如何建立、传播和维持。比如很多实验室研究Xist如何招募各种修饰复合物、如何形成染色体范围的三维结构变化。5.3 iPS重编程把表观状态初始化体细胞如何变成诱导多能干细胞iPSiPSC某种意义上就是一场表观基因组的大改造。Yamanaka因子Oct4、Sox2、Klf4、c-Myc把已经高度特化的成纤维细胞向后推回多能状态这个过程里必须擦除掉成纤维细胞特异的甲基化模式和组蛋白修饰重新建立起胚胎干细胞样的开放染色质景观。但实际重编程效率很低、而且常常擦不干净。研究人员观察到iPS细胞会保留一部分供体细胞类型的表观记忆epigenetic memory更倾向于分化回来源细胞谱系。对理解表观遗传如何在细胞命运中发挥刹车作用iPS系统是一个极好的实验平台。做干细胞方向的新人如果碰到重编程效率问题思路不应该只停留在转录因子表达量够不够还要看组蛋白修饰屏障尤其是H3K9me3和DNA甲基化擦除是否到位。5.4 表观遗传与疾病治疗当记忆可以被药物重写既然表观标记是酶催化写上去的、也可被酶擦除它自然就成了可干预的药物靶点。目前临床上已经有一批表观遗传药物批准上市最典型的是用于骨髓增生异常综合征和急性髓系白血病的去甲基化药物阿扎胞苷、地西他滨以及HDAC抑制剂伏立诺他等。这类药物不是直接杀死肿瘤细胞而是通过改变染色质状态让肿瘤细胞重新暴露沉默的抑癌程序、增强免疫应答。当然目前胞嘧啶核苷类去甲基化药物和HDAC抑制剂的疗效有限、且有较大毒性单独用药在很多实体瘤中效果平平更多是联合化疗或免疫治疗使用。对科研新人来说这段背景帮你理解表观遗传学研究不只是发文章也直接连接药物开发。同时也能帮你警惕表观遗传药物很神奇的过度宣传临床上没那么简单。6. 科研新人避坑指南从选题到实验验证6.1 相关不等于因果甲基化差异和表达差异的先后问题做表观遗传数据分析时最常见的误区是拿到差异甲基化结果就直接解释为甲基化导致基因沉默。实际上基因转录活性下降也可能反过来让启动子区域获得甲基化。要证明因果关系核心实验方法是要么对目标区域特异性编辑甲基化状态比如利用dCas9-DNMT3A或dCas9-TET系统去定点加甲基/去甲基要么用药物处理阻断甲基化酶然后再看表达变化。很多新人写信问我要不要一开始就做定点甲基化编辑。我的建议是先通过相关性分析筛选出几个候选位点再用定点编辑逐一验证不要一上来就对几十个位点做编辑工作量大、假阳性也难控制。6.2 样本异质性和批次效应是表观数据的两大隐形杀手甲基化谱和染色质开放状态对细胞组成非常敏感组织样本里的细胞类型混杂程度会直接影响读数。比如一份肿瘤样本里可能有50%的区域是间质细胞你把整体甲基化差异归因于肿瘤细胞本身结论就可能站不住脚。建议在课题设计阶段就做好准备第一尽量使用流式分选或激光显微切割纯化目标细胞第二对无法分选的样本至少用参考甲基化图谱做细胞类型去卷积如InfinitumPurify、MethylCIBERSORT等工具第三如果涉及多批次测序把批次信息放进统计模型不要只做简单的t检验。6.3 各技术平台最容易踩的坑亚硫酸盐转化不完全如果转化效率低未甲基化的C没有被全部变成T甲基化率会被系统性高估。所以检测试剂盒里自带的转化效率对照一定要用不要省。BSP引物设计亚硫酸盐处理后两个链不再互补引物设计要选好链和方向而且扩增片段内避免过多CpG位点否则引物本身跨CpG会对甲基化敏感。850K芯片的覆盖偏倚EPIC芯片覆盖约85万CpG位点在调控区和CpG岛附近较密集但整体基因组覆盖不均匀。在增强子、基因沙漠区得到负结果时别提这个位点没有甲基化差异更准确说法是该区域在芯片上没有覆盖足够探针。ChIP/qPCR定量问题ChIP结果做qPCR时结果要用Input做归一化新手上机前最好确认Input样品稀释倍数对得上否则富集倍数直接失真。公共数据挖掘的批次效应GEO/TCGA的数据来自不同平台、不同制备批次直接用对照组和实验组做差异分析很可能被平台差异带偏。优先用同一批测序/芯片产生的数据跨批次分析尽量做标准化或采用ComBat等批次校正校正后可视化检查是否有效。6.4 一个推荐的实验验证闭环路径做表观遗传课题一个比较稳妥的验证闭环是用组学手段筛选如果是甲基化研究做WGBS/RRBS/850K如果是组蛋白修饰做CUTTag/ChIP-seq。差异分析后得到候选区域。独立技术平台验证甲基化用BSP或qMSP组蛋白修饰用ChIP-qPCR或CUTTag的独立重复。组学结果不能只靠同一套重复数据自证。功能验证用定点甲基化编辑、药物抑制、基因敲除等方式干预表观酶看目标基因表达和细胞表型是否随之改变。反向验证如果干预后目标区域修饰状态确实改变、表达也确实改变那么再想想这个修饰变化是不是这个表型所必需的——例如用回复实验rescue把目标基因过表达看看能否挽回表型。这套路径走完你的故事才完整。很多高分文章之所以严谨不是因为他们用了多复杂的技术而是把观察到现象—独立验证—因果干预—回补这个闭环做得扎实。6.5 最后分享一个我自己的习惯刚进组做表观遗传时我特别喜欢拿公共数据库中的数据练手——找一套TCGA的甲基化芯片数据把某个癌种的肿瘤样本和正常样本做差异甲基化分析再结合TCGA的转录组数据看候选基因表达相关性。这个过程成本低、不需要湿实验能在几周内帮你建立数据到手怎么走流程、该怎么可视化、哪些区域值得去功能验证的基本手感。等你对这套分析流程足够熟悉了再进实验室做湿实验验证效率会高很多。表观遗传这块内容说难不难说简单也不简单。不难在于核心概念就那么多捋清楚之后骨架立刻清晰不简单在于每套数据、每个实验都有藏在细节里的坑需要靠动手做一遍才能体会。希望这篇基础概念梳理能帮你在起步阶段少走一点弯路。
返回列表