Skip to content

Article image
Alignement de séquence : comparaison par paires de séquences biologiques

May 16, 2026 · Updated: May 25, 2026

Aperçu

L’alignement de séquences est l’opération fondamentale de la bioinformatique, plaçant deux ou plusieurs séquences biologiques côte à côte pour identifier les régions de similitude qui peuvent refléter des relations fonctionnelles, structurelles ou évolutives. L’alignement par paire compare exactement deux séquences et constitue la base de la recherche dans les bases de données, de la conception d’amorces et de l’inférence phylogénétique. Le problème de l’alignement est résolu par des algorithmes de programmation dynamique – Needleman-Wunsch pour l’alignement global et Smith-Waterman pour l’alignement local – qui trouvent le chemin de notation optimal grâce à une matrice de pénalités de correspondance, d’inadéquation et d’écart.

Concepts clés

Les alignements sont classés comme globaux ou locaux. L’alignement global force l’alignement sur toute la longueur des deux séquences et est plus approprié pour les séquences étroitement liées de longueur similaire. L’alignement local identifie des régions courtes et conservées et est idéal pour détecter les domaines partagés entre des séquences divergentes. Les matrices de substitution telles que BLOSUM62 et PAM250 fournissent des scores de log-cotes pour chaque remplacement possible d’acides aminés, tandis que les alignements d’ADN utilisent généralement de simples scores de correspondance/inadéquation. Les pénalités d’espacement – souvent une combinaison d’une pénalité d’ouverture d’espace et d’une pénalité d’extension d’espace – découragent les insertions ou suppressions excessives. Des outils heuristiques comme BLAST trade garantissaient l’optimalité de la vitesse en ensemençant des alignements avec des correspondances de mots exactes.

### Candidatures L’alignement par paires est utilisé quotidiennement en biologie moléculaire. Il sous-tend la conception d’amorces de réaction en chaîne par polymérase en vérifiant la complémentarité amorce-modèle, valide les résultats de séquençage de l’ADN en alignant les lectures sur les génomes de référence et identifie les résidus conservés dans la prédiction de structure protéique. La génomique comparative s’appuie sur l’alignement pour détecter le transfert horizontal de gènes dans la génétique bactérienne, et la cartographie des sites de restriction utilise l’alignement pour prédire les modèles de digestion enzymatique de restriction.

Protocole pratique

Pour un alignement global par paire à l’aide d’EMBOSS Needle, préparez deux séquences au format FASTA : needle seq1.fasta seq2.fasta -gapopen 10 -gapextend 0.5 -outfile needle_output.txt. La pénalité d’ouverture d’espace (10 pour les protéines, 10 à 15 pour les nucléotides) pénalise l’introduction d’un nouvel espace, tandis que la pénalité d’extension d’espace (0,5 pour les protéines, 0,5 à 1,0 pour les nucléotides) pénalise l’extension d’un espace existant. Des pénalités d’ouverture d’écart plus élevées produisent des écarts moins nombreux et plus longs ; des pénalités plus faibles permettent de nombreux écarts courts. Pour un alignement local avec EMBOSS Water : water seq1.fasta seq2.fasta -gapopen 10 -gapextend 0.5 -outfile water_output.txt. L’eau trouve la région de plus grande similarité entre deux séquences, idéale pour détecter des domaines conservés dans des séquences autrement divergentes. Le résultat inclut l’alignement avec les symboles de correspondance/incompatibilité (| pour identique, : pour conservateur, . pour semi-conservateur, espace pour non conservateur), les scores d’alignement et le pourcentage d’identité. Choisissez judicieusement les matrices de substitution : BLOSUM62 est la valeur par défaut pour la plupart des alignements de protéines et convient aux séquences partageant 30 à 70 % d’identité. BLOSUM80 fonctionne mieux pour les séquences étroitement liées (> 80 % d’identité), tandis que BLOSUM45 est plus sensible pour les relations distantes (<30 % d’identité). Pour l’alignement de l’ADN, utilisez la matrice EDNAFULL avec match=1, mismatch=0 pour les séquences étroitement liées, ou match=1, mismatch=-1 avec des pénalités d’écart plus élevées pour les comparaisons entre espèces. Ajustez les paramètres de manière itérative : si l’alignement n’est pas biologiquement significatif (par exemple, aligner des régions non liées), augmentez les pénalités d’écart. Utilisez la JVM seaweeds ou la plateforme Web Galaxy pour exécuter les outils EMBOSS sans accès à la ligne de commande. Pour les alignements par paires par lots, utilisez les variantes needlem. ou waterm (plusieurs) avec un fichier de séquence de séquences de requêtes sur une seule cible.

ressource : Lab Lexicon Sequence Aligner