Skip to content

Article image
Modelos ocultos de Markov em análise de sequência

May 16, 2026 · Updated: May 25, 2026

Visão geral

Um modelo oculto de Markov (HMM) é um modelo estatístico que representa uma sequência de eventos observáveis como sendo gerados por uma sequência subjacente de estados não observados (ocultos). Em bioinformática, os HMMs modelam sequências biológicas onde os estados ocultos podem representar limites de éxon/íntron, elementos de estrutura secundária de proteínas ou colunas conservadas em um alinhamento de múltiplas sequências. O poder da estrutura HMM reside em sua capacidade de capturar padrões de conservação, inserções e exclusões específicas de posições por meio de uma arquitetura probabilística unificada treinada a partir de exemplos conhecidos.

Conceitos-chave

Um HMM é definido por três conjuntos de parâmetros: probabilidades de transição entre estados ocultos, probabilidades de emissão de observação de um símbolo de cada estado e probabilidades de estado inicial. O algoritmo de Viterbi encontra a sequência mais provável de estados ocultos para uma determinada observação – por exemplo, a estrutura genética mais provável para uma sequência de DNA genômico. O algoritmo forward-backward calcula a probabilidade posterior de cada estado em cada posição, que pode ser usado para avaliar a confiança da previsão. HMMs de perfil, construídos a partir de vários alinhamentos de sequência, modelam famílias de domínios de proteínas. O pacote de software HMMER usa HMMs de perfil para detecção remota sensível de homologia, superando o BLAST para sequências divergentes.

Aplicativos

HMMs são usados para predição genética em genomas procarióticos e eucarióticos, identificando locais de splice e regiões codificantes. Os HMMs de perfil classificam as proteínas em famílias e superfamílias, auxiliando na previsão da estrutura da proteína e na anotação funcional. Eles modelam a especificidade do substrato em classificação e nomenclatura de enzimas e detectam elementos reguladores em estrutura e topologia do DNA. Na metagenômica, os HMMs atribuem papéis funcionais a fragmentos de origem desconhecida.

Protocolo Prático

O conjunto de software HMMER permite construir e pesquisar HMMs de perfil. Para pesquisar uma consulta de proteína em um banco de dados de domínio Pfam, use hmmscan: hmmscan --cpu 8 --domtblout domains.txt Pfam-A.hmm query_proteins.fasta. O arquivo de saída domtblout relata ocorrências por domínio com valores E, pontuações de bits e coordenadas de alinhamento. O valor E do domínio mede a importância de uma correspondência de domínio; valores < 0,01 indicam acertos confiantes. A pontuação de bits (em nats) é independente do tamanho do banco de dados, permitindo comparação cruzada. Para construir um HMM de perfil personalizado a partir de um alinhamento de sequência múltipla: construa o HMM com hmmbuild meu_domínio.hmm alinhado_seqs.sto, onde o alinhamento de entrada deve estar no formato Estocolmo. Calibre o HMM para cálculo do valor E: hmmcalibrate --cpu 8 my_domain.hmm. Pesquise um banco de dados de sequência com seu HMM: hmmsearch -E 1e-5 --cpu 8 --tblout hits.txt my_domain.hmm target_sequences.fasta. A tabela --tblout lista o acerto de melhor pontuação por sequência alvo. Para detecção e alinhamento iterativo de homologia, use jackhmmer: jackhmmer -N 5 --cpu 8 --tblout jackhmmer_output.txt query.fasta uniprot_sprot.fasta. Jackhmmer pesquisa iterativamente no banco de dados, usando os acertos de cada rodada para construir um novo HMM para a próxima rodada, convergindo normalmente após 5 iterações. Interpretando valores E: no HMMER3, o valor E leva em consideração o tamanho do banco de dados de destino e o comprimento do HMM; valores < 0,01 são considerados significativos para identificação do domínio. Para anotar contigs metagenômicos inteiros, use o pipeline hmmer integrado em ferramentas como METABOLIC ou DRAM, que verifica quadros de leitura abertos previstos em Pfam, TIGRFAMs e outros bancos de dados HMM para atribuir categorias funcionais.


recurso: Lab Lexicon ORF Finder