Aperçu
BLAST (Basic Local Alignment Search Tool) est l’algorithme le plus largement utilisé pour comparer une séquence de requête à une base de données de séquences connues. Il identifie rapidement les alignements locaux statistiquement significatifs, fournissant une annotation fonctionnelle pour les nouveaux gènes, détectant l’homologie entre espèces distantes et révélant les relations évolutives. BLAST sacrifie l’optimalité garantie de la programmation entièrement dynamique au profit d’une heuristique suffisamment rapide pour rechercher des bases de données contenant des milliards de résidus. La signification statistique de chaque résultat est rapportée sous forme de valeur E – le nombre attendu d’alignements aléatoires avec un score donné dans une base de données de cette taille.
Concepts clés
BLAST fonctionne d’abord en divisant la requête en mots courts (généralement 3 pour les protéines, 11 pour les nucléotides), en analysant la base de données pour rechercher des correspondances exactes avec ces mots, puis en étendant les correspondances prometteuses dans les deux sens pour créer des alignements plus longs. Les variantes répondent à des cas d’utilisation spécifiques : BLASTP compare les requêtes de protéines aux bases de données de protéines, BLASTN compare les requêtes de nucléotides aux bases de données de nucléotides, BLASTX traduit une requête de nucléotides dans les six cadres de lecture pour une comparaison au niveau des protéines, et PSI-BLAST construit de manière itérative une matrice de scores spécifique à la position pour détecter les homologues distants. MegabLAST est optimisé pour des séquences très similaires, tandis que MegabLAST non contigu gère les comparaisons entre espèces.
### Candidatures BLAST est la première étape de l’annotation des inconnues des projets de séquençage d’ADN. Il attribue une fonction putative à de nouvelles protéines en détectant l’homologie avec les [structures protéiques] caractérisées (/fr/guides/protein-structure.html). Dans génétique bactérienne, BLAST identifie les facteurs de virulence et les gènes de résistance aux antibiotiques. Technologie de l’ADN recombinant utilise BLAST pour vérifier l’intégrité de la construction en alignant les lectures de séquençage sur les séquences vectorielles attendues.
Protocole pratique
Les recherches BLAST standard sont exécutées via l’interface Web NCBI ou la ligne de commande. Pour une requête de protéine sur la base de données nr à l’aide de la ligne de commande BLAST : blastp -query query.fasta -db nr -out results.txt -evalue 1e-5 -num_threads 8 -outfmt "6 qseqid sseqid pident length mismatch gapopen qstart qend sstart send evalue bitscore stitle". Le -outfmt 6 produit une sortie tabulaire idéale pour l’analyse en aval. La valeur E (valeur attendue) représente le nombre de résultats attendus par hasard pour un score donné compte tenu de la taille de la base de données, des valeurs < 1 × 10⁻⁵ pour les protéines ou < 1 × 10⁻¹⁰ pour les nucléotides indiquent une homologie significative. Le score binaire est un score normalisé indépendant de la taille de la base de données, permettant la comparaison entre les recherches ; les scores supérieurs à 50 sont généralement significatifs pour les protéines. Pour une recherche traduite (requête de nucléotides sur une base de données de protéines), utilisez BLASTX : blastx -query ests.fasta -db swissprot -out blastx_results.txt -evalue 1e-5. Pour des séquences très similaires, utilisez MegabLAST : blastn -task megablast -query query.fna -db nt -out megablast_results.txt -evalue 1e-50. Optimiser les paramètres : réduire la taille des mots à 2 (pour les protéines) ou 7 (pour les nucléotides) pour augmenter la sensibilité aux homologues distants ; augmenter le seuil d’extension des hits de seed. Pour une recherche itérative de profil, exécutez PSI-BLAST : psiblast -query seed.fasta -db nr -out psi_results.txt -num_iterations 3 -evalue 1e-3. PSI-BLAST construit une matrice de notation spécifique à la position (PSSM) à partir des coups du premier tour et l’utilise pour les tours suivants, détectant les homologues à distance que le BLAST standard manque. Pour les recherches par lots à grande échelle, utilisez diamond qui est 100 à 1 000 fois plus rapide que BLASTP : diamond blastp -d nr.dmnd -q query.fasta -o diamond_results.txt --outfmt 6 --evalue 1e-5 --threads 16.