Skip to content

Article image
系统发育树构建:重建进化历史

May 16, 2026 · Updated: May 25, 2026

概述

系统发育树构建是从分子序列数据推断生物实体(物种、基因或种群)之间进化关系的过程。由此产生的树状结构由在节点(共同祖先)连接的分支(谱系)组成,分支长度通常代表进化变化的量。基本假设是序列相似性反映了共同的祖先。方法范围从简单的基于距离的方法(将成对序列差异转换为进化距离)到更复杂的基于字符的方法(独立评估每个核苷酸或氨基酸位置)。

关键概念

关键的第一步是序列比对,其中同源位置在分类单元之间进行匹配。 基于距离的方法,例如邻接 (NJ),从成对距离矩阵构造树,并且计算速度很快。 基于字符的方法包括最大简约法(最大限度地减少进化变化的总数)以及统计上更严格的方法,例如最大似然法和贝叶斯推理。 引导通过对对齐列重新采样并多次重新计算树来提供置信度估计。常见的文件格式包括 FASTA(输入对齐)和 Newick(树形拓扑)。

实际工作流程

树木的建造遵循标准化的流程。从原始测序读数开始,使用 MAFFT 或 MUSCLE 组装和比对质量修整的序列,并在比对保守块的指导下进行手动精炼。使用 ModelTest-NG 或 jModelTest 执行模型选择,以确定 AIC 或 BIC 标准下的最佳拟合替换模型 - 所选模型指定核苷酸频率、替换率和速率异质性参数。最大似然树推理在 IQ-TREE 或 RAxML-NG 中执行,它们使用最近邻交换 (NNI) 和子树修剪和重新移植 (SPR) 移动来执行快速爬山搜索以导航树空间。 Bootstrap 分析通过重新采样对齐列来评估节点支持:生成 100-1,000 个伪重复,每个伪重复均独立分析,并且每个二分区在重复中出现的频率报告为 Bootstrap 支持值。尽管阈值因研究而异,但 70% 以上的值通常被认为是可靠的。生成的树在 FigTree 或 iTOL 中可视化,其中分支长度代表每个站点的替换,节点标签显示支持值。对于大型数据集,快速树方法(例如带有“-fast”标志的 FastTree 或 IQ-TREE)可以快速提供近似的 ML 树。可以生成基于距离的邻居连接树以进行快速探索性分析,但缺乏最终发布的 ML 方法的统计严谨性。

应用程序

系统发育树在整个生物学中是不可或缺的。它们支持分类学,追踪病原体的起源和传播,并通过揭示药物靶标的进化保守性来指导药物发现。在比较基因组学中,树拓扑有助于识别直向同源物和旁系同源物。这些分析直接建立在基本的DNA测序数据的基础上,并通过绘制菌株关系来补充[细菌遗传学](/guides/bacterial- Genetics.html)的研究。系统发育方法还阐明了病毒的进化历史,有助于[病毒结构和分类](/guides/viral-struct-and-classification.html)工作。


资源: Lab Lexicon 系统发育树查看器