概述
比较基因组学是对多个物种的基因组序列进行分析,以识别相似性和差异性,从而揭示进化历史、保守的功能元件和谱系特异性适应。通过比对和比较基因组,研究人员可以将自然选择保留下来的序列(因此可能具有功能)与中性漂移的序列区分开来。从细菌到人类,数千个已测序的基因组的可用性使得比较基因组学成为生物发现的强大引擎。它提供了理解基因组结构和功能所必需的进化框架。
方法
核心比较基因组学技术包括全基因组比对,它可以识别物种之间的同线性块和重排。 MUVE、MUMmer 和 LASTZ 等工具可以在不同的尺度上执行对齐操作。 系统基因组学使用全基因组数据而不是单个基因重建进化树,提供强大的物种系统发育。 直系同源分配(使用 OrthoFinder 或 InParanoid 等工具)识别通过物种形成事件而分化的基因,而旁系同源物则源于谱系内的基因重复。 进化速率分析计算 dN/dS 比率以检测正选择或纯化选择下的基因。 跨多个比对的保守追踪分析可精确定位调控元件和功能性非编码 RNA。
应用程序
比较基因组学阐明了生物学的关键方面。它确定了 1% 的人类基因组受到进化限制,并强调了关键的调控区域。它通过比较有毒菌株和无毒菌株来追踪[细菌遗传学](/guides/bacterial-Genetics.html)中致病性的演变。在病毒学中,比较不同家族的[病毒结构和分类](/guides/viral-struct-and-classification.html) 揭示了保守的复制机制。比较方法通过转移经过充分研究的模型生物的知识来支持新测序基因组的注释。随着DNA测序成本持续下降,比较基因组学变得越来越强大,能够对一个物种内的数千个个体进行群体水平甚至全基因组分析。
实用协议
对于两个物种之间的全基因组比对,“MUMmer”通过基于后缀树的最大唯一匹配 (MUM) 提供快速比对。运行“nucmer –maxmatch -p输出reference.fasta query.fasta”以生成增量文件。使用“delta-filter -l 1000 -i 90 output.delta >filtered.delta”进行可靠比对过滤,要求至少 1000 bp 的比对和 90% 的同一性。转换为坐标并使用“mummerplot”进行可视化:“mummerplot -l -p输出过滤.delta -R引用.fasta -Q query.fasta –postscript”。对于染色体水平的同线性分析,请在注释的基因组上使用“MCScanX”。准备来自两个基因组的所有蛋白质对之间的 BLASTP 结果:“blastp -query query.pep -db reference.pep -outfmt 6 -outblast.out”。运行“MCScanX”来识别共线块:“MCScanX ./blast_output”。使用 R 中的“RIdeogram”或 Python 中的“JCVI”检查同线性点图和核型可视化(使用“jcvi.graphics.karyotype”模块)。为了识别保守的非编码元件 (CNE),将基因组与“LASTZ”或“WGA”进行比对,并从比对中提取基因间和内含子区域,过滤超过 5000 万年前分化的物种之间至少 50 bp 具有 >70% 同一性的序列,表明纯化选择。 PHAST 包中的 PhastCons 或 PhyloP 计算多个比对的保护分数:“phastCons –target-coverage 0.3 –expected-coverage 2.5 –msa-format MAFalignment.mafservation.bed”。对于物种内的泛基因组分析,请在细菌基因组上运行“Panaroo”:“panaroo -i *.gff -o pangenome_output –clean-mode strict”并检查核心/辅助基因矩阵。许多基因组的直系同源分配使用“OrthoFinder”:“orthofinder -f proteomes_dir -t 8”。