Skip to content

Article image
Découverte de motifs : trouver des modèles de régulation dans des séquences

May 16, 2026 · Updated: May 25, 2026

Aperçu

La découverte de motifs est l’identification informatique de modèles de séquences courts et récurrents dans des séquences d’ADN, d’ARN ou de protéines qui correspondent à des éléments fonctionnels tels que des sites de liaison aux facteurs de transcription, des jonctions d’épissage, des sites de reconnaissance des protéines de liaison à l’ARN ou des domaines d’interaction protéique. Contrairement à l’alignement global, la découverte de motifs se concentre sur de petites fenêtres – généralement 6 à 20 nucléotides ou 3 à 15 acides aminés – où la conservation de la position est élevée même lorsque la séquence environnante diverge. Ces motifs sont souvent représentés sous forme de matrices de poids de position (PWM) qui capturent la fréquence de chaque nucléotide ou acide aminé à chaque position.

Méthodes

Une gamme d’algorithmes s’attaque à la découverte de motifs. Les méthodes basées sur le consensus énumèrent tous les mots possibles et signalent ceux qui apparaissent plus souvent que prévu par hasard. Les approches probabilistes telles que MEME utilisent la maximisation des attentes pour ajuster un modèle de mélange qui sépare les séquences contenant des motifs des séquences d’arrière-plan. Les méthodes d’échantillonnage de Gibbs, mises en œuvre dans des outils tels que BioProspector, effectuent une recherche stochastique dans l’espace des séquences pour trouver des modèles surreprésentés. L’empreinte phylogénétique exploite la conservation des espèces apparentées pour identifier les éléments régulateurs dans le cadre d’une sélection purificatrice. L’immunoprécipitation de la chromatine suivie du séquençage (ChIP-seq) fournit des régions de pic dérivées expérimentalement qui guident la découverte de motifs vers des loci génomiques pertinents.

### Candidatures

La découverte de motifs est essentielle à la compréhension de la régulation génique et l’épigénétique. Il identifie les sites de liaison des facteurs de transcription qui contrôlent la transcription et le traitement de l’ARN. En biologie synthétique, les motifs découverts sont utilisés pour concevoir des promoteurs synthétiques dotés de forces d’expression prévisibles. L’analyse de Structure et topologie de l’ADN révèle que certains motifs forment préférentiellement des structures secondaires telles que les G-quadruplexes qui régulent la transcription et la réplication.

Protocole pratique

La suite MEME fournit un flux de travail complet de découverte de motifs de novo. Commencez par préparer un fichier FASTA de régions promotrices (par exemple, 500 pb en amont des sites d’initiation de la transcription) pour les gènes co-régulés identifiés à partir des données RNA-seq ou ChIP-seq. Exécutez MEME (Multiple EM for Motif Elicitation) : meme promoteurs.fasta -dna -oc meme_output -mod anr -nmotifs 5 -minw 6 -maxw 20 -revcomp. Paramètres : -mod anr (n’importe quel nombre de répétitions par séquence), -nmotifs 5 (trouver les 5 meilleurs motifs), -minw 6 / -maxw 20 (plage de largeur de motif). MEME génère des motifs sous forme de matrices de poids de position (PWM) avec des valeurs E pour chaque motif. Examinez le rapport HTML MEME montrant les logos des séquences de motifs, les occurrences par séquence et les biais de position. Pour la découverte discriminante de motifs (en comparant deux ensembles de séquences), utilisez DREME : dreme -p positive.fasta -n negative.fasta -dna -oc dreme_output. DREME est plus rapide pour trouver des motifs centraux courts (4 à 8 pb) typiques des sites de liaison des facteurs de transcription. Pour l’analyse d’enrichissement de motifs dans les régions de pic ChIP-seq, utilisez AME (Analysis of Motif Enrichment) : ame --control Peaks_background.fasta Peaks.fasta motif_database.meme -o ame_output. Utilisez une base de données de motifs organisée telle que JASPAR ou HOCOMOCO. Pour analyser les séquences pour les correspondances de motifs connues, utilisez FIMO : fimo --oc fimo_output --thresh 1e-4 JASPAR2022_CORE_non-redundant.meme promoteurs.fasta. FIMO génère toutes les correspondances avec des valeurs p et des valeurs q (corrigées par FDR). Validez les motifs découverts en les comparant aux profils de liaison aux facteurs de transcription connus à l’aide de TomTom : tomtom meme_output/meme.txt known_motifs.meme -o tomtom_output. Tomtom attribue à chaque motif de requête sa correspondance la plus proche dans la base de données avec une valeur E signalée.


ressource : Lab Lexicon Motif Scanner