Aperçu
L’alignement de séquences est l’opération fondamentale de la bioinformatique, plaçant deux ou plusieurs séquences biologiques côte à côte pour identifier les régions de similitude qui peuvent refléter des relations fonctionnelles, structurelles ou évolutives. L’alignement par paire compare exactement deux séquences et constitue la base de la recherche dans les bases de données, de la conception d’amorces et de l’inférence phylogénétique. Le problème de l’alignement est résolu par des algorithmes de programmation dynamique – Needleman-Wunsch pour l’alignement global et Smith-Waterman pour l’alignement local – qui trouvent le chemin de notation optimal grâce à une matrice de pénalités de correspondance, d’inadéquation et d’écart.
Concepts clés
Les alignements sont classés comme globaux ou locaux. L’alignement global force l’alignement sur toute la longueur des deux séquences et est plus approprié pour les séquences étroitement liées de longueur similaire. L’alignement local identifie des régions courtes et conservées et est idéal pour détecter les domaines partagés entre des séquences divergentes. Les matrices de substitution telles que BLOSUM62 et PAM250 fournissent des scores de log-cotes pour chaque remplacement possible d’acides aminés, tandis que les alignements d’ADN utilisent généralement de simples scores de correspondance/inadéquation. Les pénalités d’espacement – souvent une combinaison d’une pénalité d’ouverture d’espace et d’une pénalité d’extension d’espace – découragent les insertions ou suppressions excessives. Des outils heuristiques comme BLAST trade garantissaient l’optimalité de la vitesse en ensemençant des alignements avec des correspondances de mots exactes.
### Candidatures L’alignement par paires est utilisé quotidiennement en biologie moléculaire. Il sous-tend la conception d’amorces de réaction en chaîne par polymérase en vérifiant la complémentarité amorce-modèle, valide les résultats de séquençage de l’ADN en alignant les lectures sur les génomes de référence et identifie les résidus conservés dans la prédiction de structure protéique. La génomique comparative s’appuie sur l’alignement pour détecter le transfert horizontal de gènes dans la génétique bactérienne, et la cartographie des sites de restriction utilise l’alignement pour prédire les modèles de digestion enzymatique de restriction.