Skip to content

Article image
Alignement de plusieurs séquences : comparaison de trois séquences ou plus

May 16, 2026 · Updated: May 25, 2026

Aperçu

L’alignement de séquences multiples (MSA) aligne trois séquences biologiques ou plus pour identifier les régions conservées partagées dans une famille entière. Alors que l’alignement par paire révèle une similitude entre deux séquences, le MSA capture la profondeur évolutive d’un groupe homologue, mettant en évidence les résidus qui ont été maintenus pendant des millions d’années. Ces positions conservées sont souvent critiques pour la structure, la catalyse ou la régulation. La MSA est la condition préalable à la construction d’arbres phylogénétiques, à l’identification des domaines protéiques et à la génération de logos de séquences qui visualisent les modèles de conservation.

Concepts clés

L’alignement progressif, implémenté dans Clustal Omega et MUSCLE, construit un MSA en construisant d’abord un arbre guide à partir de distances par paires, puis en alignant de manière itérative les séquences les plus étroitement liées. Les méthodes itératives affinent l’alignement initial en réalignant les sous-ensembles pour améliorer le score objectif global. Les outils basés sur la cohérence comme T-Coffee intègrent des informations provenant d’alignements par paires par rapport à une troisième séquence pour améliorer la précision. Pour les très grands ensembles de données, MAFFT utilise des transformations de Fourier rapides pour accélérer l’alignement. Les mesures d’évaluation de la qualité telles que le score de somme de paires et le score de colonne évaluent la fiabilité de l’alignement, et les outils de découpage suppriment les régions mal alignées avant l’analyse en aval.

### Candidatures

La MSA est indispensable pour la génomique comparative de la génétique bactérienne, où elle identifie les gènes conservés dans les souches pathogènes. Il améliore la sensibilité de la recherche d’homologie dans les projets de séquençage de l’ADN et révèle des résidus fonctionnellement importants dans la prédiction de la structure protéique. En biologie évolutive, MSA fournit l’entrée de séquences multiples requise pour la vraisemblance maximale et l’inférence phylogénétique bayésienne, permettant la reconstruction de séquences ancestrales et la datation des événements de spéciation.

Protocole pratique

Pour une protéine MSA avec MAFFT, préparez un fichier FASTA de séquences homologues (par exemple, à partir des résultats BLAST ou OrthoFinder). Exécutez MAFFT avec la stratégie L-INS-i, la plus précise pour <200 séquences : mafft --localpair --maxiterate 1000 input.fasta > aligné.fasta. Pour les ensembles de données plus volumineux (200 à 1 000 séquences), utilisez la stratégie FFT-NS-2 : mafft --retree 2 --maxiterate 2 input.fasta > aligné.fasta. Pour les très grands ensembles de données (> 1 000 séquences), utilisez l’algorithme PartTree : mafft --parttree input.fasta > aligné.fasta. Pour les alignements de nucléotides, utilisez mafft --nuc --adjustdirection input.fasta > aligné.fasta pour gérer les brins du complément inverse. Vous pouvez également exécuter MUSCLE v5 : muscle -align input.fasta -output aligné.fasta. Évaluez la qualité de l’alignement par inspection visuelle à l’aide de « Jalview » : chargez le fichier FASTA aligné, coloriez par le schéma ClustalX (en mettant en évidence les positions conservées) et examinez l’histogramme de conservation. Coupez les régions mal alignées avec trimAl : trimal -in aligné.fasta -out trimmed.fasta -automated1 qui sélectionne automatiquement le seuil de découpage optimal en fonction des caractéristiques de l’alignement. Pour un découpage plus strict, utilisez -gt 0.1 (supprimez les colonnes avec des espaces dans >10 % des séquences) ou -resoverlap 0.75 -seqoverlap 80 pour la méthode heuristique automatisée2. Calculez les statistiques récapitulatives d’alignement avec esl-alistat de la suite HMMER : esl-alistat aligné.fasta. Générez un logo de séquence avec « WebLogo » ou le package R « ggseqlogo » pour visualiser la conservation des acides aminés spécifiques à la position. Convertissez l’alignement au format PHYLIP pour l’inférence phylogénétique : sed -e 's/>//' aligné.fasta | coller - - | awk '{print $1, $2}' > aligné.phy. Exécutez IQ-TREE pour l’inférence d’arbre à vraisemblance maximale : iqtree -s aligné.phy -m MFP -bb 1000 -nt AUTO.