Skip to content

Article image
多序列比对:比较三个或更多序列

May 16, 2026 · Updated: May 25, 2026

概述

多重序列比对 (MSA) 可比对三个或更多生物序列,以识别整个家族共享的保守区域。成对比对揭示了两个序列之间的相似性,而 MSA 捕获了同源群体的进化深度,突出显示了数百万年以来一直保持的残基。这些保守位置通常对于结构、催化或调节至关重要。 MSA 是系统发育树构建、蛋白质结构域识别以及生成可视化保护模式的序列标识的先决条件。

关键概念

在 Clustal Omega 和 MUSCLE 中实现的渐进对齐通过首先根据成对距离构建引导树,然后迭代对齐最密切相关的序列来构建 MSA。迭代方法通过重新对齐子集来完善初始对齐,以提高总体目标得分。 T-Coffee 等基于一致性的工具结合了针对第三个序列的成对比对信息,以提高准确性。对于非常大的数据集,MAFFT 使用快速傅里叶变换来加速对齐。质量评估指标(例如对总分和列得分)评估对齐可靠性,而修剪工具会在下游分析之前删除对齐不良的区域。

应用程序

MSA 对于[细菌遗传学](/guides/bacterial- Genetics.html) 的比较基因组学是不可或缺的,它可以识别致病菌株中保守的基因。它提高了 DNA 测序 项目中同源性搜索的灵敏度,并揭示了 [蛋白质结构](/guides/ Protein-Sequencing.html) 预测中功能上重要的残基。在进化生物学中,MSA 提供最大似然和贝叶斯系统发育推断所需的多序列输入,从而能够重建祖先序列和确定物种形成事件的年代。

实用协议

对于具有 MAFFT 的蛋白质 MSA,准备同源序列的 FASTA 文件(例如,来自 BLAST 或 OrthoFinder 结果)。使用 L-INS-i 策略运行 MAFFT,对于 <200 个序列最准确:“mafft –localpair –maxiterate 1000 input.fasta >aligned.fasta”。对于较大的数据集(200–1000 个序列),请使用 FFT-NS-2 策略:“mafft –retree 2 –maxiterate 2 input.fasta >aligned.fasta”。对于非常大的数据集(>1000 个序列),请使用 PartTree 算法:“mafft –parttree input.fasta >aligned.fasta”。对于核苷酸比对,请使用“mafft –nuc –adjustdirection input.fasta >aligned.fasta”来处理反向互补链。或者,运行 MUSCLE v5:muscle -align input.fasta -output adjustment.fasta。使用“Jalview”通过目视检查评估对齐质量:加载对齐的 FASTA 文件,按 ClustalX 方案着色(突出显示保守位置),并检查保守直方图。使用“trimAl”修剪对齐不良的区域:“trimal -in adjustment.fasta -out trimmed.fasta -automated1”,它会根据对齐的特征自动选择最佳修剪阈值。对于更严格的修剪,请使用“-gt 0.1”(删除> 10%序列中存在间隙的列)或“-resoverlap 0.75 -seqoverlap 80”用于启发式自动化2方法。使用 HMMER 套件中的“esl-alistat”计算对齐摘要统计数据:“esl-alistataligned.fasta”。使用“WebLogo”或 R 包“ggseqlogo”生成序列徽标,以可视化位置特异性氨基酸保守性。将比对转换为 PHYLIP 格式以进行系统发育推断:sed -e 's/>//'aligned.fasta |粘贴 - - | awk '{print $1, $2}' >aligned.phy。运行 IQ-TREE 进行最大似然树推理:“iqtree -saligned.phy -m MFP -bb 1000 -nt AUTO”。