概述
最大似然 (ML) 系统发育学是一种统计框架,可识别最有可能在分子进化的显式模型下产生观察到的序列数据的树拓扑。与将序列信息压缩为每对单个数字的基于距离的方法不同,机器学习评估比对中的每个位点,计算给定树和替换模型的数据的概率。选择具有最高似然得分的树作为进化历史的最佳估计。机器学习方法的计算量很大,但提供了完善的统计特性,包括一致性和比较竞争模型的能力。
关键概念
可能性计算取决于替代模型:一种描述一种核苷酸(或氨基酸)转变为另一种核苷酸(或氨基酸)的速率的马尔可夫过程。常用的模型包括 JC69(等速率)、GTR(具有不等基频的一般时间可逆)以及通过伽玛分布 (G) 和一定比例的不变位点 (I) 建模的速率异质性。 启发式树搜索(例如,子树修剪和重新移植,或 SPR)在可能的拓扑的广阔空间中导航。 模型选择 使用 AIC 或 BIC 等信息标准来确定数据的最佳拟合替代模型。
应用程序
ML 系统发育学广泛应用于分子系统学、病毒系统动力学和比较基因组学。它构成了许多大型物种树的支柱,也是大多数同行评审的系统发育研究的首选方法。该方法通常用于追踪病原体爆发的DNA测序数据,研究[病毒结构和分类](/guides/viral-struct-and-classification.html)的进化动力学,并解决[细菌遗传学](/guides/bacterial- Genetics.html)中的深层关系,其中快速进化可能会掩盖系统发育信号。