概述
序列组装是从测序仪产生的数百万或数十亿短 DNA 片段中重建完整基因组或转录组的计算过程。由于测序机一次只能读取 150-300 个碱基对,因此组装算法必须找到读取之间的重叠,将它们合并成更长的连续序列(重叠群),并将重叠群排序到支架中。组装的难度随着基因组大小、重复内容和杂合性的增加而增加。装配质量通过 N50(覆盖 50% 装配的重叠群长度)和重叠群总数等指标来衡量。
方法
存在两种主要的装配范例。 重叠布局共识 (OLC),Canu 和 Flye 用于长读取,计算读取之间的所有成对重叠,构建图表,并解析路径以生成共识序列。 De Bruijn 图 汇编器,例如 SPAdes 和 Velvet,将读取分解为 k-mers 并构建一个图,其中 k-mers 是节点,边代表 k-1 重叠;这种方法可以有效地扩展到具有高覆盖率的大型基因组。混合汇编器将短读取的准确性与长读取的远程信息相结合,以解决重复区域。像 MEGAHIT 这样的宏基因组组装器通过适应不同物种的不同覆盖深度来处理混合微生物群落。
应用程序
从头基因组组装为新测序的生物体(包括细菌、植物和脊椎动物)产生参考基因组。在[下一代测序](/guides/next- Generation-sequencing.html)项目中,组装是注释和分析之前的第一步。 DNA 测序 读取的转录组组装揭示了选择性剪接异构体。 重组 DNA 技术 通过组装克隆插入片段的 Sanger 测序读数来验证质粒构建体。
实用协议
对于使用 Phred/Phrap/Consed 的 Sanger 测序组装,从原始 ABI 跟踪文件 (.ab1) 开始。使用 Phred 进行碱基检出可将迹线转换为具有每个碱基质量分数的高质量序列:“phred -id seqs_dir -qd seqs_phd_dir -sd seqs_fasta_dir”。 Phred 报告 Phred 量表的质量分数 (-10 × log₁₀(error_probability)),其中 Q20 = 99% 准确度,Q30 = 99.9% 准确度。 Assemble 使用 Phrap 读取:phrap seqs_fasta_dir/*.fasta -ace > assembly.log。 Phrap 使用带有质量分数的带状 Smith-Waterman 算法来计算共有序列并将读数组装成重叠群。在 Consed 中查看并手动编辑程序集:consed -acephap ace_file。 Consed 显示与碱基质量颜色编码对齐的读数,突出显示差异,并允许手动编辑共识。导航到 Phrap 标记为高质量差异(红色条)或低质量区域(蓝色突出显示)的问题区域。通过检查每次读取的色谱图、修剪低质量末端并纠正错误的碱基来手动解决差异。生成最终的经过质量检查的共识序列:文件 → 导出共识。对于来自 Illumina 读数的小细菌基因组的从头组装,请使用带有“–isolate”标志的 SPAdes 来获取单菌株数据。通过计算 N50、L50 和 GC 含量,使用 QUAST 评估装配完整性。为了完成整理,使用 CONTIGUATOR 根据紧密相关的参考来订购重叠群,然后通过设计跨重叠群末端的引物进行 PCR 和桑格测序来缩小间隙。通过将读回与 BWA-MEM 对齐并检查覆盖均匀性来验证最终组装。