Skip to content

Article image
序列分析中的隐马尔可夫模型

May 16, 2026 · Updated: May 25, 2026

概述

隐马尔可夫模型 (HMM) 是一种统计模型,表示由未观察(隐藏)状态的基础序列生成的一系列可观察事件。在生物信息学中,HMM 对生物序列进行建模,其中隐藏状态可能代表外显子/内含子边界、蛋白质二级结构元素或多序列比对中的保守列。 HMM 框架的强大之处在于它能够通过从已知示例中训练的统一概率架构来捕获特定位置的保护模式、插入和删除。

关键概念

HMM 由三组参数定义:隐藏状态之间的转移概率、从每个状态观察符号的发射概率以及初始状态概率。维特比算法找到给定观察的最可能的隐藏状态序列,例如,基因组 DNA 序列最可能的基因结构。前向-后向算法计算每个位置的每个状态的后验概率,可用于评估预测置信度。 Profile HMM,由多个序列比对、模型蛋白质结构域家族构建。 HMMER 软件包使用 Profile HMM 进行灵敏的远程同源性检测,对于不同序列的性能优于 BLAST。

应用程序

HMM 用于原核和真核基因组中的基因预测,识别剪接位点和编码区。 Profile HMM 将蛋白质分为家族和超家族,帮助[蛋白质结构](/guides/ Protein-Structure.html) 预测和功能注释。他们在酶分类和命名 中对底物特异性进行建模,并在DNA 结构和拓扑 中检测调控元件。在宏基因组学中,HMM 将功能角色分配给未知来源的片段。

实用协议

HMMER 软件套件支持构建和搜索配置文件 HMM。要针对 Pfam 域数据库搜索蛋白质查询,请使用“hmmscan”:“hmmscan –cpu 8 –domtbloutdomains.txt Pfam-A.hmm query_ Proteins.fasta”。输出“domtblout”文件报告每个域的命中率、E 值、位分数和对齐坐标。领域E值衡量领域匹配的重要性;值 < 0.01 表示有信心命中。位分数(以 nats 为单位)与数据库大小无关,从而可以进行交叉比较。要从多序列比对构建自定义配置文件 HMM:使用“hmmbuild my_domain.hmmaligned_seqs.sto”构建 HMM,其中输入比对应采用斯德哥尔摩格式。校准 HMM 以进行 E 值计算:“hmmcalibrate –cpu 8 my_domain.hmm”。使用 HMM 搜索序列数据库:“hmmsearch -E 1e-5 –cpu 8 –tblout attempts.txt my_domain.hmm target_sequences.fasta”。 --tblout 表列出了每个目标序列的最佳得分命中。对于迭代同源性检测和对齐,请使用“jackhmmer”:“jackhmmer -N 5 –cpu 8 –tblout jackhmmer_output.txt query.fasta uniprot_sprot.fasta”。 Jackhmmer 迭代搜索数据库,使用每轮的命中数为下一轮构建新的 HMM,通常在 5 次迭代后收敛。解释E值:在HMMER3中,E值占目标数据库的大小和HMM长度; < 0.01 的值被认为对于域识别很重要。为了注释整个宏基因组重叠群,请使用 METABOLIC 或 DRAM 等工具中集成的“hmmer”管道,该管道根据 Pfam、TIGRFAM 和其他 HMM 数据库扫描预测的开放阅读框架以分配功能类别。


资源: Lab Lexicon ORF Finder