Visión General
El Centro Nacional de Información Biotecnológica (NCBI) de la Biblioteca Nacional de Medicina de EE. UU. proporciona la suite más completa del mundo de bases de datos de biología molecular. GenBank, el repositorio principal de secuencias de nucleótidos, acepta envíos directos de investigadores y participa en la Colaboración Internacional de Bases de Datos de Secuencias de Nucleótidos (INSDC) junto con EMBL-EBI y DDBJ. RefSeq proporciona secuencias de referencia curadas y no redundantes para genomas, transcritos y proteínas. El Archivo de Lecturas de Secuenciación (SRA) almacena lecturas de secuenciación crudas de plataformas de alto rendimiento. Juntos, estos recursos forman la columna vertebral del acceso público a datos moleculares.
Conceptos Clave
Los registros de GenBank incluyen la secuencia cruda, las anotaciones biológicas y los metadatos bibliográficos. Los números de acceso (ej., NM_001234) proporcionan identificadores estables para la citación. RefSeq se diferencia de GenBank en su proceso de curación: los registros de RefSeq son revisados y mantenidos manualmente, ofreciendo mayor fiabilidad para fines de referencia. SRA archiva lecturas de secuenciación no procesadas en un formato comprimido, almacenando tanto los datos de lectura como las puntuaciones de calidad. El sistema de búsqueda Entrez proporciona consultas unificadas entre bases de datos en todos los recursos del NCBI, permitiendo la recuperación de registros relacionados de diferentes bases de datos a través de una única interfaz.
Aplicaciones
Las bases de datos del NCBI son utilizadas diariamente por investigadores de todo el mundo. Los proyectos de secuenciación de ADN comienzan con búsquedas BLAST contra GenBank para identificar secuencias desconocidas. Los experimentos de secuenciación de próxima generación depositan lecturas crudas en SRA y las alinean contra genomas de RefSeq para la detección de variantes. Los estudios de genética bacteriana se basan en genomas de RefSeq para genómica comparativa y la identificación de genes específicos de especie y factores de virulencia.
Protocolo Práctico
Navegar por el portal del NCBI comienza en ncbi.nlm.nih.gov, donde la barra de búsqueda proporciona acceso al sistema de búsqueda entre bases de datos Entrez. Para encontrar todas las secuencias de nucleótidos para un organismo dado, introduzca el nombre del organismo (ej., “Escherichia coli”) en la barra de búsqueda principal, luego use el filtro de la base de datos “Nucleotide” en la página de resultados. Para consultas más precisas, use la sintaxis de campo de Entrez: “Escherichia coli[Organism] AND 16S ribosomal RNA[Title]” devuelve solo secuencias de ARNr 16S de E. coli. La lista de resultados muestra números de acceso, longitudes de secuencia y definiciones. Haga clic en cualquier acceso (ej., NR_024570) para ver el registro completo de GenBank con características anotadas, secuencias codificantes y referencias. Para recuperación por lotes, haga clic en “Send to” > “File” > “FASTA” para descargar todas las secuencias coincidentes. Como ejemplo práctico, un microbiólogo que caracteriza un aislado bacteriano novedoso podría: (1) buscar en SRA lecturas crudas de especies estrechamente relacionadas para usar como referencia para el ensamblaje, (2) enviar los contigs ensamblados a BLAST contra la base de datos de genomas RefSeq para identificar el pariente secuenciado más cercano, (3) descargar el genoma RefSeq de ese pariente para la predicción de genes con herramientas como Prokka, y (4) depositar el ensamblaje anotado en GenBank con un nuevo acceso. Todo el flujo de trabajo, consultar, recuperar, analizar y enviar, opera dentro del ecosistema unificado del NCBI, con Entrez proporcionando navegación fluida entre bases de datos en cada paso. Por ejemplo, una búsqueda en PubMed de un patógeno de interés enlaza directamente a los registros Nucleotide de su genoma, a SRA para los datos de secuenciación disponibles, y a BioProject para los metadatos experimentales, todo sin salir del portal del NCBI.