Skip to content

Article image
基因组组装:方法和应用

May 16, 2026 · Updated: May 25, 2026

概述

基因组组装是从高通量测序平台产生的短 DNA 片段重建整个基因组序列的计算过程。由于测序机一次只能读取数百个碱基对,因此生物信息学家必须将数百万或数十亿个读数拼凑起来,就像解决一个巨大的拼图游戏一样。组装基因组的准确性直接影响从基因预测到比较基因组学的每个下游分析。现代汇编程序使用复杂的基于图形的算法来处理重复区域、测序错误和不同覆盖深度的复杂性。

关键概念

基因组组装存在两种主要策略。 从头组装在没有任何事先参考的情况下构建基因组,依靠重叠布局共识 (OLC) 或 de Bruijn 图方法将读数合并到称为重叠群的连续序列中。 参考引导组装 将读数映射到已知的参考基因组,然后组装未映射的部分,这对于重测序项目特别有用。关键质量指标包括 N50(包含 50% 装配体的重叠群长度)和总装配体大小。组装验证通常涉及对照已知序列进行检查或使用长读技术来闭合间隙。

应用程序

基因组组装是几乎所有基因组学应用的基础。它能够发现新基因、识别结构变异以及表征非编码调控元件。在医学上,从病原体中组装的基因组可以快速追踪疫情并分析抗生素耐药性。农业基因组学依靠高质量的组装来绘制具有经济重要性的性状。现代项目经常将[下一代测序](/guides/next- Generation-sequencing.html)数据与长读长和光学映射结合起来,以经典DNA测序方法为基础,生成染色体级组装。组装还支持功能研究,例如 CRISPR-Cas9 靶标设计,其中脱靶预测取决于准确的参考。

实用协议

对于基于 Illumina 的细菌基因组从头组装,从质量修剪开始:“fastp -i R1.fastq -I R2.fastq -o trimmed_R1.fastq -O trimmed_R2.fastq -q 20 -l 50”。使用多个 k-mer 大小与“SPAdes”进行组装:“spades.py -1 trimmed_R1.fastq -2 trimmed_R2.fastq -o spades_output -k 21,33,55,77 –careful”。 --careful 标志通过运行 MismatchCorrector 来减少不匹配和插入。输出包括 contigs.fastascaffolds.fasta。对于使用 Oxford Nanopore 数据进行长读组装,请使用“Flye”:“flye –nano-raw reads.fastq -o Flye_out -t 8 -g 5m”,其中“-g”提供估计的基因组大小。对于组合短读和长读的混合组装,请使用“Unicycler”:“unicycler -1 Short_R1.fastq -2 Short_R2.fastq -l long_reads.fastq -o Hybrid_Assembly”。使用“QUAST”评估组装质量:“quast.py contigs.fasta -r reference.fasta -ggenes.gff -o quast_output”。关键指标包括 N50(覆盖 50% 组装的重叠群长度)、总组装大小、重叠群数量、基因组分数(覆盖的参考分数)以及错误组装数量。对于完整的细菌基因组,目标是 N50 等于染色体长度和与参考匹配的 GC 含量。使用“BUSCO”对照适当的谱系检查完整性:“busco -i contigs.fasta -lbacteria_odb10 -obusco_out -mgenome”。使用“Pilon”抛光程序集,以使用读取对齐来纠正错误:“pilon –genome contigs.fasta –fragsaligned.bam –output Polished”。对于染色体级支架,使用“Hi-C”数据和“SALSA2”或“3D-DNA”将重叠群排序和定向为染色体规模的假分子。