Skip to content

Article image
Modelos ocultos de Markov en análisis de secuencia

May 16, 2026 · Updated: May 25, 2026

Descripción general

Un modelo oculto de Markov (HMM) es un modelo estadístico que representa una secuencia de eventos observables generados por una secuencia subyacente de estados no observados (ocultos). En bioinformática, los HMM modelan secuencias biológicas donde los estados ocultos pueden representar límites exón/intrón, elementos de estructura secundaria de proteínas o columnas conservadas en una alineación de secuencias múltiples. El poder del marco HMM radica en su capacidad para capturar patrones de conservación, inserciones y eliminaciones específicas de la posición a través de una arquitectura probabilística unificada entrenada a partir de ejemplos conocidos.

Conceptos clave

Un HMM se define mediante tres conjuntos de parámetros: probabilidades de transición entre estados ocultos, probabilidades de emisión de observar un símbolo de cada estado y probabilidades de estado inicial. El algoritmo de Viterbi encuentra la secuencia más probable de estados ocultos para una observación determinada; por ejemplo, la estructura genética más probable para una secuencia de ADN genómico. El algoritmo hacia adelante y hacia atrás calcula la probabilidad posterior de cada estado en cada posición, que puede usarse para evaluar la confianza de la predicción. HMM de perfil, creados a partir de múltiples alineamientos de secuencias, modelan familias de dominios de proteínas. El paquete de software HMMER utiliza HMM de perfil para la detección sensible de homología remota, superando a BLAST para secuencias divergentes.

Aplicaciones

Los HMM se utilizan para la predicción de genes en genomas procarióticos y eucariotas, identificando sitios de empalme y regiones codificantes. Los HMM de perfil clasifican las proteínas en familias y superfamilias, lo que ayuda a la predicción de la estructura de las proteínas y a la anotación funcional. Modelan la especificidad del sustrato en clasificación y nomenclatura de enzimas y detectan elementos reguladores en estructura y topología del ADN. En metagenómica, los HMM asignan funciones funcionales a fragmentos de origen desconocido.

Protocolo práctico

El paquete de software HMMER permite crear y buscar HMM de perfil. Para buscar una consulta de proteínas en una base de datos de dominio Pfam, use hmmscan: hmmscan --cpu 8 --domtblout domains.txt Pfam-A.hmm query_proteins.fasta. El archivo de salida domtblout informa aciertos por dominio con valores E, puntuaciones de bits y coordenadas de alineación. El valor E del dominio mide la importancia de una coincidencia de dominio; los valores <0,01 indican aciertos seguros. La puntuación de bits (en nats) es independiente del tamaño de la base de datos, lo que permite la comparación cruzada. Para crear un HMM de perfil personalizado a partir de una alineación de secuencia múltiple: cree el HMM con hmmbuild my_domain.hmm alineado_seqs.sto, donde la alineación de entrada debe estar en formato Estocolmo. Calibre el HMM para el cálculo del valor E: hmmcalibrate --cpu 8 my_domain.hmm. Busque una base de datos de secuencias con su HMM: hmmsearch -E 1e-5 --cpu 8 --tblout hits.txt my_domain.hmm target_sequences.fasta. La tabla --tblout enumera el acierto con mejor puntuación por secuencia objetivo. Para la detección y alineación iterativa de homología, utilice jackhmmer: jackhmmer -N 5 --cpu 8 --tblout jackhmmer_output.txt query.fasta uniprot_sprot.fasta. Jackhmmer busca iterativamente en la base de datos, utilizando los resultados de cada ronda para construir un nuevo HMM para la siguiente ronda, convergiendo normalmente después de 5 iteraciones. Interpretación de los valores E: en HMMER3, el valor E representa el tamaño de la base de datos de destino y la longitud del HMM; los valores < 0,01 se consideran significativos para la identificación del dominio. Para anotar contigs metagenómicos completos, utilice la canalización hmmer integrada en herramientas como METABOLIC o DRAM, que escanean marcos de lectura abiertos pronosticados contra Pfam, TIGRFAM y otras bases de datos HMM para asignar categorías funcionales.


recurso: Lab Lexicon ORF Finder