Aperçu Général
Le Centre National d’Information Biotechnologique (NCBI) à la Bibliothèque Nationale de Médecine des États-Unis fournit la suite la plus complète au monde de bases de données en biologie moléculaire. GenBank, le référentiel principal de séquences nucléotidiques, accepte les soumissions directes des chercheurs et participe à la Collaboration Internationale des Bases de Données de Séquences Nucléotidiques (INSDC) aux côtés de l’EMBL-EBI et de la DDBJ. RefSeq fournit des séquences de référence organisées et non redondantes pour les génomes, les transcrits et les protéines. Les Archives de Lectures de Séquençage (SRA) stockent les lectures de séquençage brutes des plateformes à haut débit. Ensemble, ces ressources forment l’épine dorsale de l’accès public aux données moléculaires.
Concepts Clés
Les enregistrements GenBank incluent la séquence brute, les annotations biologiques et les métadonnées bibliographiques. Les numéros d’accès (par ex., NM_001234) fournissent des identifiants stables pour la citation. RefSeq diffère de GenBank par son processus de curation : les enregistrements RefSeq sont examinés et maintenus manuellement, offrant une plus grande fiabilité à des fins de référence. SRA archive les lectures de séquençage non traitées dans un format compressé, stockant à la fois les données de lecture et les scores de qualité. Le système de recherche Entrez fournit des requêtes unifiées inter-bases de données sur toutes les ressources NCBI, permettant la récupération d’enregistrements connexes provenant de différentes bases de données via une interface unique.
Applications
Les bases de données NCBI sont utilisées quotidiennement par les chercheurs du monde entier. Les projets de séquençage d’ADN commencent par des recherches BLAST contre GenBank pour identifier des séquences inconnues. Les expériences de séquençage de nouvelle génération déposent les lectures brutes dans SRA et les alignent contre les génomes RefSeq pour la détection de variants. Les études de génétique bactérienne s’appuient sur les génomes RefSeq pour la génomique comparative et l’identification de gènes spécifiques à une espèce et de facteurs de virulence.
Protocole Pratique
La navigation sur le portail NCBI commence à ncbi.nlm.nih.gov, où la barre de recherche donne accès au système de recherche inter-bases de données Entrez. Pour trouver toutes les séquences nucléotidiques pour un organisme donné, saisissez le nom de l’organisme (par ex., “Escherichia coli”) dans la barre de recherche principale, puis utilisez le filtre de base de données “Nucleotide” sur la page des résultats. Pour des requêtes plus précises, utilisez la syntaxe de champ Entrez : “Escherichia coli[Organism] AND 16S ribosomal RNA[Title]” renvoie uniquement les séquences d’ARNr 16S d’E. coli. La liste des résultats affiche les numéros d’accès, les longueurs de séquence et les définitions. Cliquez sur n’importe quel accès (par ex., NR_024570) pour voir l’enregistrement GenBank complet avec les caractéristiques annotées, les séquences codantes et les références. Pour une récupération par lots, cliquez sur “Send to” > “File” > “FASTA” pour télécharger toutes les séquences correspondantes. Comme exemple pratique, un microbiologiste caractérisant un nouvel isolat bactérien pourrait : (1) rechercher dans SRA des lectures brutes d’espèces étroitement apparentées à utiliser comme référence pour l’assemblage, (2) soumettre les contigs assemblés à BLAST contre la base de données de génomes RefSeq pour identifier le parent séquencé le plus proche, (3) télécharger le génome RefSeq de ce parent pour la prédiction de gènes avec des outils comme Prokka, et (4) déposer l’assemblage annoté dans GenBank avec un nouvel accès. L’ensemble du flux de travail, interroger, récupérer, analyser et soumettre, opère au sein de l’écosystème unifié du NCBI, Entrez fournissant une navigation fluide entre les bases de données à chaque étape. Par exemple, une recherche PubMed pour un agent pathogène d’intérêt renvoie directement aux enregistrements Nucleotide de son génome, à SRA pour les données de séquençage disponibles, et à BioProject pour les métadonnées expérimentales, le tout sans quitter le portail NCBI.