Skip to content

Article image
Modèles de Markov cachés dans l'analyse de séquence

May 16, 2026 · Updated: May 25, 2026

Aperçu

Un modèle de Markov caché (HMM) est un modèle statistique qui représente une séquence d’événements observables comme étant générés par une séquence sous-jacente d’états non observés (cachés). En bioinformatique, les HMM modélisent des séquences biologiques où les états cachés peuvent représenter des limites exon/intron, des éléments de structure secondaire de protéine ou des colonnes conservées dans un alignement de séquences multiples. La puissance du cadre HMM réside dans sa capacité à capturer des modèles de conservation, des insertions et des suppressions spécifiques à une position grâce à une architecture probabiliste unifiée formée à partir d’exemples connus.

Concepts clés

Un HMM est défini par trois ensembles de paramètres : probabilités de transition entre états cachés, probabilités d’émission d’observation d’un symbole de chaque état et probabilités d’état initial. L’algorithme de Viterbi trouve la séquence d’états cachés la plus probable pour une observation donnée – par exemple, la structure génétique la plus probable pour une séquence d’ADN génomique. L’algorithme avant-arrière calcule la probabilité a posteriori de chaque état à chaque position, qui peut être utilisée pour évaluer la confiance des prédictions. Profil HMM, construits à partir de plusieurs alignements de séquences, modèles de familles de domaines protéiques. Le progiciel HMMER utilise des HMM de profil pour la détection sensible d’homologie à distance, surpassant BLAST pour les séquences divergentes.

### Candidatures

Les HMM sont utilisés pour la prédiction génétique dans les génomes procaryotes et eucaryotes, en identifiant les sites d’épissage et les régions codantes. Les HMM de profil classent les protéines en familles et superfamilles, facilitant ainsi la prédiction de la structure des protéines et l’annotation fonctionnelle. Ils modélisent la spécificité du substrat dans classification et nomenclature des enzymes et détectent les éléments régulateurs dans structure et topologie de l’ADN. En métagénomique, les HMM attribuent des rôles fonctionnels à des fragments d’origine inconnue.

Protocole pratique

La suite logicielle HMMER permet de créer et de rechercher des HMM de profils. Pour rechercher une requête de protéines dans une base de données de domaine Pfam, utilisez hmmscan : hmmscan --cpu 8 --domtblout domains.txt Pfam-A.hmm query_proteins.fasta. Le fichier de sortie domtblout rapporte les résultats par domaine avec les valeurs E, les scores binaires et les coordonnées d’alignement. La valeur E du domaine mesure l’importance d’une correspondance de domaine ; des valeurs < 0,01 indiquent des résultats sûrs. Le score binaire (en nats) est indépendant de la taille de la base de données, ce qui permet une comparaison croisée. Pour créer un HMM de profil personnalisé à partir d’un alignement de séquences multiples : créez le HMM avec hmmbuild my_domain.hmm align_seqs.sto, où l’alignement d’entrée doit être au format Stockholm. Calibrez le HMM pour le calcul de la valeur E : hmmcalibrate --cpu 8 my_domain.hmm. Recherchez une base de données de séquences avec votre HMM : hmmsearch -E 1e-5 --cpu 8 --tblout hits.txt my_domain.hmm target_sequences.fasta. Le tableau --tblout répertorie les meilleurs résultats par séquence cible. Pour la détection et l’alignement itératifs de l’homologie, utilisez jackhmmer : jackhmmer -N 5 --cpu 8 --tblout jackhmmer_output.txt query.fasta uniprot_sprot.fasta. Jackhmmer effectue une recherche itérative dans la base de données, en utilisant les résultats de chaque tour pour créer un nouveau HMM pour le tour suivant, convergeant généralement après 5 itérations. Interprétation des valeurs E : dans HMMER3, la valeur E tient compte de la taille de la base de données cible et de la longueur du HMM ; les valeurs <0,01 sont considérées comme significatives pour l’identification du domaine. Pour annoter des contigs métagénomiques entiers, utilisez le pipeline « hmmer » intégré à des outils tels que METABOLIC ou DRAM, qui analysent les cadres de lecture ouverts prédits par rapport aux Pfam, aux TIGRFAM et à d’autres bases de données HMM pour attribuer des catégories fonctionnelles.


ressource : Lab Lexicon ORF Finder