尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

POPGENE实战教程:从数据格式到遗传多样性分析的完整流程

POPGENE实战教程:从数据格式到遗传多样性分析的完整流程 简介POPGENE中文使用教程参照是一份面向遗传学研究人员、生态学与进化生物学师生的软件操作图文指南系统讲解基于Windows的免费物种遗传分析工具POPGENE的核心功能与使用方法。资源共1个PDF文件大小约1.03MB虽是单文件但内容详实覆盖软件窗口菜单、Haploid与Diploid Data Analysis对话框、分层结构设置及常用遗传参数计算流程。文档按功能模块展开从基因频率、等位基因数、多态性位点、基因多样性、Shannon指数到F统计量、基因流、遗传距离、UPGMA树形图、Hardy-Weinberg检验等均有清晰图文说明并给出输入文件格式与示例数据帮助读者快速准备数据、完成分析并解读结果。已有344人学习下载适合需要开展种群遗传分析但软件操作不熟悉的入门与进阶用户作为手边速查与系统学习的参照资料。1. 为什么现在还有人用POPGENE它到底能做什么先说个比较直接的感受每次跟新进实验室的同学介绍POPGENE对方第一反应基本都是这软件界面也太老了。跟现在动辄Web端、可视化拖拽的分析平台比它确实是上世纪九十年代的样子纯菜单操作、输出的是txt文本、图表要靠别的软件二次加工。但真要把群体遗传学里的基础分析跑一遍POPGENE依然是我电脑里留着的那个老伙计。POPGENE全称是Population Genetic Analysis由加拿大Alberta大学开发算是最早一批面向群体遗传学研究者的Windows桌面软件。它最核心的用途就三块一是计算等位基因频率、基因多样性、多态位点比例这些群体遗传参数二是做Hardy-Weinberg平衡检验和F统计量分析三是基于Nei遗传距离、基因分化系数等指标做群体间分化程度评估输出聚类分析用的距离矩阵。对做遗传多样性评估、种质资源鉴定、亲缘关系分析的人来说这几个功能每年开题、结题、写论文都会用到。它的不可替代性在哪首先是轻。整个安装包几兆大小解压就能跑不像R语言那套环境配置动不动就是半天也不像很多在线平台需要把数据一条条按网页表单格式重新录入。其次是稳。我在Windows 10和Windows 11上都跑过兼容性没出过问题。最后是输出格式友好。它生成的文本文件可以直接复制进Excel也可以被MEGA、NTSYS这类软件直接读取分析链路非常成熟。需要说清楚的是它不是万能分析平台。像群体结构分析STRUCTURE、Admixture、系统发育树构建MEGA、PhyML、主成分分析PCA这些高级分析它都不做也不该勉强让它做。正确的用法是用POPGENE完成基础参数的统计和导出再把结果喂给下游软件。所以这篇教程的核心定位就是把POPGENE最常用的三条分析路径讲透——基因型数据文件的准备、群体遗传参数计算、遗传距离与聚类分析的数据导出。教程参考的是网上流传的POPGENE中文说明书同时结合了我自己处理实际课题数据时反复踩坑后积累下来的修订笔记。如果你是第一次接触这个软件按顺序读完就能跑通一个完整的基础分析流程如果你已经用过一段时间重点看第4章和第6章里面有不少参数设置细节和报错排查经验常规文档里基本不会写。2. 软件获取与安装细节都在容易被忽略的地方POPGENE的官方版本是1.31和1.32网上流传的所谓中文版其实是汉化过的1.32版。软件本身是免费软件但官方主页有时候访问不稳定这个情况确实存在。比较靠谱的做法是通过高校生物信息课程镜像站、学术资源聚合站下载或者找实验室之前存好的安装包。这里有一个容易被忽略的问题POPGENE的zip压缩包解压后是一堆exe、dll和帮助文档的混合目录很多人习惯双击exe马上用结果报错DLL缺失。原因是它依赖的VB6运行库文件没有随包带上尤其是Win10以上系统自带的运行库不完整。解决办法很简单把整个文件夹完整解压再以管理员身份运行POPGENE.exe大多数dll报错都能解决。如果还报错去装一个Visual Basic 6.0的运行时库二三十兆的东西装上之后再没出过问题。软件打开之后是经典的三级菜单界面最上面是File、Edit、Genetic Data、Analysis、Display等菜单项。第一次打开会让你选择Data Type这一步很多人直接跳过了其实它是整个流程的分岔口。POPGENE支持三种数据类型共显性标记Codominant、显性标记Dominant、基因频率数据Gene Frequency。选错了后面的分析菜单都是灰的或者跑出来的结果文件数据与实际情况对不上。选型逻辑是这样的做微卫星SSR、SNP、同工酶这类能区分纯合子和杂合子的标记必须选Codominant做RAPD、AFLP、ISSR这类只记有无、区分不了纯合杂合的显性标记选Dominant如果你手里的数据已经是算好的各群体等位基因频率表不想从个体基因型起步那就选Gene Frequency。这三种类型对应的数据文件格式差异很大后面逐个讲。安装路径也建议留个心。尽量不要放在系统盘需要UAC权限的位置比如Program Files目录否则运行时会因为写权限不足导致输出文件生成失败。我习惯在D盘建一个单独的Popgene文件夹路径全英文不带空格后续所有项目文件都放在它下面。这个习惯让我少踩了至少三次文件保存了但找不到的坑。3. 数据文件格式一整晚的辛酸基本都葬送在这一步POPGENE的数据文件格式是新手最容易崩溃的地方。它不像Excel那样所见即所得也不像CSV那么好理解必须严格按固定结构写文本文件。但一旦掌握了规律你会发现这个格式其实很直白就是把一张基因型表格转换成了纯文本。以最常见的共显性标记Codominant数据为例一个完整的POPGENE数据文件长这样POPGENE Data File 2 (计算个体数时的说明这行是可选的注释行) 3 (群体数) Pop1 (第一个群体的名称) 4 (该群体个体数) Ind1 0101 (个体名 两个位点的基因型) Ind2 0102 Ind3 0103 Ind4 0202 Pop2 3 Ind5 0101 Ind6 0102 Ind7 0303 Pop3 2 Ind8 0203 Ind9 0103第一行可以是任意描述第二行开始是群体数。然后是每个群体的Pop起始行群体名可以自定义紧接着下一行写该群体个体数然后逐行列出个体。每行的结构是个体名 空格 各位点基因型基因型之间用空格分隔。最关键的是基因型的编码规则。POPGENE默认每个位点用两位数字表示代表两个等位基因。比如一个SSR位点在某个个体里检测到的是150bp和152bp两个片段那么它在这个位点的数据就记成0101吗不对。这里有个非常绕又特别容易错的地方POPGENE记录的不是片段长度本身而是等位基因编号。也就是说你要先把所有样本在这个位点上出现的等位基因列出来按大小排序编号为01、02、03……然后每个个体写成两个编号的组合。举个例子某个位点所有样本里出现了三个等位基因分别是140bp、150bp、160bp。你先约定14001、15002、16003。那么纯合160/160记作0303杂合140/160记作0103。这个先建等位基因编号表、再录个体基因型的步骤没有现成按钮帮你在软件里自动完成必须自己在Excel里提前整理。这也是为什么很多第一次用POPGENE的人会一次次报错。文件格式错误最常见有两种表现一是软件直接提示Error reading data file——多半是行数对不上某个群体实际个体数量和声明数量不一致或者某行个体名和基因型之间没加空格二是文件能读进去但计算结果明显不对——这个情况多半是等位基因编号规则没有统一有的人用1 2式的单数字有的人用0101式的双数字混在一起软件按固定宽度解析就会读错。鉴于此建议个体名统一用字母加数字、中间不要有空格基因型统一两位数字即等位基因编号01到99不够用的话说明这个位点多态性太高换个标记或者考虑降维处理每一列之间用一个空格隔开不要用Tab软件对Tab的解析在不同系统下表现不一致实测Win11上用Tab偶尔会把两列读成三列。显性标记Dominant的格式相对简单一些每个位点只有0和1两个状态0表示无条带隐性纯合1表示有条带显性不存在00这种写法。每个个体的基因型行是位点1位点2位点3……格式是每两个字符一个位点挨着写中间不用空格Ind1 110010 Ind2 101010至于基因频率数据Gene Frequency格式日常用到的比例不高主要场景是你从文献里拿到了别人公布的各群体等位基因频率表想直接做后续的遗传距离分析。这种格式的核心是按每个位点一组数据来组织组与组之间用空行分隔文件说明头里要写明位点数等等细节较多且不常用建议用到时对照官方示例文件改不建议凭记忆手写。提前把格式整理好是提高效率的关键。我自己的习惯是在Excel里维护原始基因型数据表然后写一个固定的拼接公式把每个个体的基因型拼成0101 0202这种字符串再通过文本编辑器拼装成完整的数据文件。这样既不用手敲也降低了出错概率。4. 核心分析操作等位基因频率、遗传多样性、Hardy-Weinberg检验4.1 从数据导入到参数设置的关键路径数据文件准备好之后打开POPGENE按顺序做这几步。第一次打开软件时会弹出对话框要求选择数据类型如果已经关掉了也可以通过File菜单里的New重新指定。选完类型后选择File-Open Data File加载刚才的文本文件。加载成功的话主窗口左下角会显示群体数、个体数和位点数此时菜单栏里Analysis里的各个分析项会从灰色变成可点击状态。在跑分析之前建议先做一遍数据检查。选择Genetic Data菜单下的List Alleles and Genotypes软件会以文本形式列出所有位点的等位基因种类和每个样本的基因型。这一步相当于格式化前预览如果发现某个位点出现了预料之外的编码比如本该是01~05的编号范围里冒出来个22那就是原始文件里等位基因编号表没统一先回去改数据文件别急着往下跑。这个检查动作虽然不能完全避免后面的坑但能拦截掉大部分低级错误。4.2 遗传多样性参数的计算与解读数据检查通过之后进入Analysis菜单选择Genetic Diversity相关选项。这一步会输出一份包含各位点等位基因数Na、有效等位基因数Ne、观察杂合度Ho、期望杂合度He、多态信息含量PIC、多态位点比例等指标的文本报告。报告会同时输出所有位点平均值和各位点单独结果这两部分在论文里通常都要引用。对于SSR数据Ne的算法是1除以各位点等位基因频率的平方和它反映的是等位基因分布的均匀程度。Ne越接近Na说明各位点等位基因分布越均匀如果Ne明显小于Na说明少数优势等位基因占了主导。至于Ho和He的比较则是判断群体是否存在近交或杂合子缺失的直观指标Ho显著低于He时通常提示群体可能存在近交现象或Wahlund效应。一处容易误解的地方很多刚接触群体遗传学的人把PIC等同于多态性高低其实PIC和He是正相关的但两者计算逻辑不完全一样PIC更偏向标记区分个体能力的评价。SSR标记的PIC在0.5以上属于高多态性标记0.25到0.5之间属于中度多态性低于0.25属于低多态性。如果是种质资源评价类的文章这个数值基本是审稿人必看的。4.3 Hardy-Weinberg平衡检验的细节与卡方值解读接下来是Hardy-Weinberg平衡检验。在Analysis菜单下找到Hardy-Weinberg Equilibrium Test软件会对每个位点、每个群体分别做卡方检验。结果报告里会给出卡方值、自由度和P值。当P值大于0.05时认为该位点在该群体内符合Hardy-Weinberg平衡P值小于0.05时说明偏离平衡遗传漂变、选择、迁移、非随机交配都有可能导致这种偏离。这部分要提醒的是POPGENE的卡方检验默认把所有等位基因纳入计算但当一个位点等位基因数过多比如超过10个时很多基因型的期望频数会小于5卡方检验的可靠性会打折扣。处理办法是罕见等位基因合并把频率低于5%或低于某个阈值的等位基因合并成一个Other类再重新检验。POPGENE界面里没有现成的合并按钮需要你在数据文件里手动改写基因型编码。这个步骤虽然麻烦但在实际论文写作中很有用。另外POPGENE只做每个群体内、每个位点的HWE检验。如果你想做所有位点合并的群体整体偏离检验需要自己把各位点的卡方值和自由度相加再用卡方分布表查总P值。也可以把每个位点的P值做FDR校正后整体判断POPGENE没有内置FDR功能可以用Excel或者在线工具补一步。4.4 F统计量群体分化程度的经典指标F统计量Fis、Fit、Fst在Analysis菜单里单独有一项输出结果同样以文本形式呈现。三个指标的含义分别对应Fis是个体相对于其所在亚群体的近交系数衡量亚群体内杂合子缺失或过剩Fit是个体相对于总群体的近交系数Fst是亚群体间遗传分化系数衡量群体间的分化程度。其中Fst最常被引用按Wright的经验判断标准Fst小于0.05为分化很弱0.05到0.15为中度分化0.15到0.25为高度分化大于0.25表示群体间分化极大。在计算F统计量之前有一件事需要提前准备好POPGENE要求你至少指定两个群体才能跑F统计量如果整个数据只有一个群体这一项菜单是灰的。如果你是想分析一个群体内多个亚群的分化记得在数据文件里把每个亚群按Pop起始行划分开。POPGENE输出的F统计量是基于Weir和Cockerham1984的算法跟Nei的Gst算法在数值上会有差异使用时需要在论文方法部分写清楚用POPGENE基于Weir和Cockerham算法计算了Fst。这个细节如果漏了碰到较真的审稿人会直接质疑方法的可重复性。5. 群体间遗传距离与聚类分析从文本输出到可视化出图的完整链路做完群体内的多样性分析之后下一步往往是群体间的亲缘关系分析。POPGENE在Analysis菜单下提供了Nei遗传距离Nei, 1972、Nei无偏遗传距离Nei, 1978、基因分化系数Gst等选项。选好之后软件会输出一个距离矩阵这个矩阵就是聚类分析和PCA的下游输入。一个常见疑问是Nei1972和Nei1978到底选哪个区别在于Nei1978对样本量做了校正更适合小样本量单个群体样本量少于10-20个个体的情况。如果每个群体样本量都很大比如大于30个个体两者的结果差异通常很小。审稿人一般不纠结具体用哪一个但要求方法部分写清楚。遗传距离矩阵输出后格式是这样的文本表Pop1 Pop2 Pop3 Pop1 0.0000 Pop2 0.1245 0.0000 Pop3 0.3132 0.1876 0.0000得到这个矩阵之后POPGENE本身不做聚类图需要借用其他软件来完成可视化。常用的搭配方案是小规模数据用MEGA的UPGMA或NJ法直接读入距离矩阵需要更灵活的树形展示时用NTSYS或R语言的ape包。我自己常用的路径是把矩阵复制进Excel整理成上三角或下三角矩阵再用MEGA的Distance Matrix导入功能生成NJ树。注意POPGENE输出的矩阵包含上三角全量数据导入MEGA前需要把不需要的部分删除掉只留下下三角否则MEGA会提示矩阵不对称。还有一个比较隐晦但很重要的点POPGENE的距离矩阵顺序与你在数据文件里定义群体的顺序一致。如果你在后续出图时想调整树的显示顺序千万别在Excel里手动交换行和列那样很容易造成上下三角错位导致树形图的分支关系完全错误。正确做法是回数据文件里改Pop起始行的排列顺序再重新跑一遍分析。树形图出来后建议在论文里把分支的bootstrap支持率一并展示。POPGENE不做bootstrap检验MEGA里可以导入原始基因型数据做bootstrap重抽样也可以直接在MEGA里重新读入POPGENE格式的数据文件再做聚类MEGA对POPGENE格式的兼容性一直不错。这里有个经验之谈MEGA直接读入POPGENE数据文件时中间可能有格式提示报错处理方式是先用POPGENE把数据导出为Text Export里的Phylip格式这个功能在File-Export下再用MEGA读取成功率会高很多。6. 显性标记数据分析的特殊处理一个容易算错的功能模块6.1 显性标记与共显性标记的本质差异如果你是做RAPD、AFLP、ISSR这类显性标记的POPGENE专门有对应的计算路径。但这里的分析结果解读逻辑和共显性标记完全不同混着理解容易写出错误的论文结论。显性标记的二进制记录方式0/1决定了它无法区分杂合子和显性纯合子。这意味着你无法直接计算观察杂合度和期望杂合度、无法进行Hardy-Weinberg检验、无法计算Fis。POPGENE在做显性标记分析时会默认假定群体处于Hardy-Weinberg平衡基于这个假定用显性表型频率倒推等位基因频率。这个假定在自交作物、无性繁殖材料、或者有明显群体结构的数据里非常不成立。做显性标记分析前一定要在论文里明确写道显性标记数据基于Hardy-Weinberg平衡假设估计等位基因频率。如果你所在的研究系统明显偏离该假设建议谨慎使用显性标记做频率类指标的分析或者改用其他算法做无偏估计。6.2 显性标记的实操参数调整在导入显性标记数据文件时需要注意个别参数差异。在数据类型选择中选Dominant后打开数据文件的格式会跟共显性标记略有不同每个个体的基因型行不用空格分隔位点而是连续两位字符表示一个位点0表示无条带1表示有条带。此外显性标记分析中多态位点比例的定义需要单独说明一下POPGENE会把所有个体都表现为1所有个体都有条带的位点判定为单态位点不计入多态位点比例。这在生物学上是对的——一个位点在所有个体里都扩增出条带说明该位点不存在可检测的多态性。但对于不同群体之间某个位点在群体A里固定存在所有个体都有条带、在群体B里也固定存在这个位点其实对群体区分没有贡献软件会自动把它排除在多态性计算之外。这点和用共显性标记计算多态位点比例的思路一致不需要额外担心。6.3 显性标记的遗传距离计算选择显性标记群体间分化分析POPGENE提供Nei遗传距离和基于band-based的Jaccard相似系数等方法。对于显性标记的聚类分析我更推荐输出基于Nei遗传距离的矩阵再用MEGA做NJ树不太推荐直接用Jaccard相似系数做UPGMA虽然它被一些文献采用但Jaccard系数是个体间相似性指标不是群体间遗传距离指标用在其场景中容易在审稿环节被质疑。实操中Jaccard系数适合做个体水平的聚类比如种质资源个体亲缘判别而Nei遗传距离适合做群体水平的进化关系推断。做群体分化研究时选对了方法结果顺理成章选错了审稿意见里大概率会出现方法选择不够合理之类的评语。7. 结果解读与导出别让数据死在txt里7.1 生成结果的文本结构认识每次分析跑完POPGENE会弹出一个文本结果窗口里面有详细的统计数据。这个窗口里的内容可以保存成txt文件具体操作是File-Save Output As。保存下来的txt文件结构比较原始没有排版但数据是齐全的。很多人在这一步直接把txt内容复制进论文结果格式很糟糕被导师要求返工。推荐处理流程把txt内容先粘贴进Excel用数据-分列功能按空格或Tab将各列拆开。POPGENE输出文本里各列之间通常用空格对齐直接用分列功能大概率能拆对。拆好后再整理成表或者直接复制到论文表格里。请一定注意不同位点、不同群体的结果在txt里可能是连续输出的段落之间没有明显的分隔标签。整理时建议保留原始的标题行比如Locus: SSR-1这样的标识行否则分列后根本分不清哪行属于哪个位点。我有一个血泪教训有次整理60个位点的输出结果没保留原始标识行分列之后前面几十行全是数字我花了半个小时才按顺序重新对应回位点信息从此之后再也不敢跳过这一步。7.2 各参数结果的对应关系速查为了方便对照整理一份POPGENE常见输出参数与论文描述对照表Na观察等位基因数报告时写平均每群体每个位点的等位基因数为X。Ne有效等位基因数反映等位基因均匀度报告时写有效等位基因数介于X到Y之间。Ho观察杂合度直接由基因型计数得到。He期望杂合度无偏估计基于等位基因频率计算POPGENE默认输出的是Nei的无偏估计值。PIC多态信息含量反映标记区分能力通常在结果表里单独列一行。P值HWEHardy-Weinberg平衡检验的显著性报告时写除位点SSR-2外其余位点均符合Hardy-Weinberg平衡P0.05。Fst群体间分化系数报告时写群体间遗传分化系数Fst为X表明群体间存在中度遗传分化。Nei遗传距离群体间遗传距离矩阵用于聚类分析和主坐标分析。这些参数在论文结果部分的常用呈现方式不是一个一个罗列而是整合成一张各位点遗传多样性统计表或各群体遗传多样性参数表。纵列是参数横列是位点或群体这样审稿人一眼就能看到全貌。7.3 导出为其他软件的衔接操作POPGENE还提供了一些导出接口在File-Export菜单下可以找到导出为Phylip格式、NEXUS格式、GenePop格式等选项。这部分功能知道的人不多但非常实用。Phylip格式适合直接交给MEGA或PHYLIP做系统发育分析不需要手动改矩阵格式。NEXUS格式适合导入PAUP*或MrBayes做贝叶斯分析不过POPGENE生成的NEXUS只包含距离矩阵不包含序列数据使用场景有限。GenePop格式适合导入GenePop软件做种群分化检验比如Fst的精确检验也可以导入R语言的hierfstat包进一步做层次分析。导出功能常见的坑是数据文件里群体名如果包含空格或者特殊符号比如-和.导出时可能出现格式断裂。所以从一开始给群体命名时尽量用简洁的英文字母加数字比如Pop1、GD01这样避免后续导出到其他软件时反复报错。8. 常见报错与异常结果排查按链路找原因而不是瞎试8.1 Error reading data file类错误的定位过程新手最常遇到的报错是Error reading data file或File format error看着很吓人实际原因大多集中在以下几处。第一步排查群体数和个体数的声明是否与实际一致。这是最高频的错误来源。声明3个群体但文件里写了4个Pop起始行声明每个群体4个个体但实际写了5行个体数据都会触发格式报错。通过逐一核对每个Pop起始行下的个体行数大部分问题能解决。第二步排查个体名和基因型之间的分隔符。POPGENE要求个体名后面跟一个或多个空格再加基因型。如果个体名和基因型之间没有空格或者用了全角空格软件解析时会把整行读成一个字段导致行数错乱。建议全程使用英文半角空格可以在文本编辑器里开启显示空格功能逐行校对。第三步排查基因型列的字符数。共显性标记每个位点固定占两个字符如果某个位点是单数字比如1而非01会直接导致列错位后续所有位点读数全乱。这个错误在手动录入时特别容易出现。第四步排查数据文件末尾是否有多余空行或不可见字符。复制粘贴操作很容易带入隐藏的制表符或全角空格推荐用文本编辑器比如Notepad或VS Code打开开启显示所有字符功能就能看到这些隐形杀手。建议在检查完成前不要直接用记事本打开看记事本对格式问题的显示不明显。8.2 能读入但结果明显不对的排查链路如果文件能读入但结果明显异常比如等位基因数爆炸、某个位点频率加起来不等于1优先怀疑等位基因编号规则混乱。这种问题比报错更隐蔽因为它不会打断流程而是让数据以错误的形式进入计算。排查链路从逐位点检查等位基因列表开始打开Genetic Data-List Alleles and Genotypes看每个位点出现的等位基因编号是否在你预期范围内。如果某位点本身只有5个等位基因列表里却出现了编号18、22说明原始文件里该位点的基因型编码与你的编号表不一致。这时候需要回溯到Excel原始表重新核对每一个个体的基因型编码。另一个常见抽风点是数据文件里群体顺序和你在论文里描述的顺序不一致但你没注意导致结果表里群体名和数据对应错位。由于POPGENE是按Pop起始行顺序依次编号群体群体名在数据文件里的位置直接决定输出顺序。如果发现输出顺序与你预期不符请直接修改数据文件里的顺序而不是试图在结果表里做替换。8.3 输出文件中出现NaN或空值遇到过几次输出文件里部分统计量显示NaNNot a Number的情况。多数发生在某个位点在某个群体内是单态位点时——比如所有个体都是0101则期望杂合度计算里等位基因频率平方和为1某些中间变量分母为0产生NaN。POPGENE不会crash直接输出NaN也不提示。这种情形的处理方式该位点在该群体内的Ho和He可以视为0单态位点的杂合度为0在论文表格里填0或-即可并在脚注里说明该位点在XX群体中呈单态。不建议直接照抄NaN进论文表格也不要为了数值好看而把整体结果删除如实标记是最稳妥的做法。另外注意如果多个位点出现大量NaN优先检查是不是整个群体的所有个体在该位点都缺失记录为0000这种全缺失位点在分析前就应该剔除而不是带进计算。POPGENE对全缺失位点的处理逻辑比较粗糙不会自动跳过可能影响多位点平均值相关指标的计算。9. 经典实战案例一份模拟数据的完整分析过程9.1 模拟数据背景与准备为了把上面的操作串起来我用一组模拟数据完整演示一遍分析流程。假设手头有3个群体Pop1、Pop2、Pop3每个群体8个个体共5个SSR位点。随机生成部分基因型但故意在其中埋了两个常见错误后续分析中会排查出来。数据文件的内容如下省略部分个体实际请按此格式补全SSR simulation dataset with 5 loci 3 Pop1 8 Ind1 0101 0102 0203 0103 0202 Ind2 0101 0102 0203 0103 0202 Ind3 0102 0103 0203 0103 0202 ....补齐到8个个体 Pop2 8 Ind9 0101 0101 0303 0101 0202 Ind10 0101 0102 0303 0101 0202 .... Pop3 8 Ind17 0202 0303 0303 0202 0101 Ind18 0203 0303 0303 0202 0101 ....这个数据里故意埋的两个错误是Pop1的某个个体某位点写成020少了一个数字Pop2的个体数声明为8但实际只写了7行。这两个错误分别对应第8.1节里的两步排查。9.2 从报错到排查的完整链路复现打开软件新建数据文件类型选Codominant加载数据后软件提示Error reading data file。按第8.1节的排查链路操作。先核对群体数和个体数发现Pop2那组声明了8个个体但实际只有7行补上缺失的一行后重新加载。但是软件仍然报错。继续排查发现某个个体某一位点的基因型020只有三位字符与两位数字的规则不符。将020改为0202后文件成功读入。这个排查过程看起来不难但实际操作里当数据量有几十行甚至上百行时用肉眼逐行找格式错误非常耗时间。这里分享一个效率工具在Excel里对基因型列做数据验证设置字符数必须等于2的倍数且不含空格可以把格式问题在原始表格阶段就拦截掉。如果数据文件已经生成用文本编辑器的正则表达式搜索非01字符定位异常行这是最快的排查方法。9.3 各分析模块的结果输出与论文表格整理方法文件成功读入并检查等位基因列表无误后按顺序完成遗传多样性计算、HWE检验、F统计量分析和Nei遗传距离计算。得到原始文本输出后把关键参数整理成论文表格。以遗传多样性参数为例最终表格样式通常如下群体NaNeHoHePICHWE_P值Pop12.802.050.520.480.370.20Pop22.401.900.580.420.310.06Pop32.001.700.310.440.280.01表里的每个数值都来自POPGENE输出文件但做了筛选和重排只保留论文需要的参数不直接整个粘过去。另外HWE_P值一列建议标注显著性标记例如在0.01的P值上加一个星号并附注*表示显著偏离Hardy-Weinberg平衡P0.05。Fst矩阵则整理成下三角矩阵Pop1Pop2Pop3Pop1———Pop20.102——Pop30.2210.139—按Wright的判断标准Pop1与Pop2之间Fst为0.102属于中度分化Pop1与Pop3之间Fst为0.221属于高度分化。这个结论可以直接写进论文结果部分。遗传距离矩阵导出后我习惯先用Excel保存一份再导入MEGA绘制NJ树。如果群体数量较少比如少于20个群体NJ树的分支支持率建议用MEGA自带的Bootstrap功能1000次重复来评估这个数值在论文系统发育树图里几乎是标配。10. 一些实操经验之外的思考工具虽老思路要新POPGENE作为一款上世纪90年代开发的软件在今天的科研环境中依然有一席之地根本原因是它解决了一个非常具体的需求快速计算群体遗传学基础参数且不依赖编程和联网环境。可是它的局限也很明显——没有图形界面、结果排版原始、不做高级统计分析。所以在实际项目中我通常把POPGENE定位为基础参数计算器而不是全流程分析平台。一个比较合理的科研分析流程是Excel管理原始数据 - POPGENE计算基础参数和距离矩阵 - MEGA做聚类树 - STRUCTURE或Admixture做群体结构 - R语言做可视化。每步各司其职POPGENE在其中扮演的是可靠且高效的第一步。另外想提醒一点关于可重复性的事。无论用什么软件都要在方法部分写清版本号和参数设置。POPGENE作为免费软件网上版本较杂1.31、1.32、汉化版、英文版分析前务必记录所用版本号。我的一般写法是群体遗传参数使用POPGENE 1.32计算Hardy-Weinberg平衡检验基于卡方检验遗传距离按Nei1972方法计算。这样既严谨又方便后来者复现你的分析。最后分享一个实用的小技巧是这两年做数据分析时养成的习惯把所有分析中生成的txt输出文件以日期_项目名_分析项目.txt的命名规则保存。POPGENE默认输出文件名是Output.txt或模拟的默认名如果不改名多次运行后文件会互相覆盖容易造成结果混乱。这个习惯听起来微不足道但在项目收尾阶段你一定会感谢当时的自己。本文还有配套的精品资源点击获取
返回列表