Skip to content

Article image
Bancos de Dados do NCBI: GenBank, RefSeq e SRA

May 16, 2026

Visão Geral

O Centro Nacional de Informação Biotecnológica (NCBI) da Biblioteca Nacional de Medicina dos EUA fornece o conjunto mais abrangente do mundo de bancos de dados de biologia molecular. O GenBank, o repositório primário de sequências de nucleotídeos, aceita submissões diretas de pesquisadores e participa da Colaboração Internacional de Bancos de Dados de Sequências de Nucleotídeos (INSDC) juntamente com EMBL-EBI e DDBJ. O RefSeq fornece sequências de referência curadas e não redundantes para genomas, transcritos e proteínas. O Arquivo de Leituras de Sequenciamento (SRA) armazena leituras de sequenciamento brutas de plataformas de alto rendimento. Juntos, esses recursos formam a espinha dorsal do acesso público a dados moleculares.

Conceitos-Chave

Os registros do GenBank incluem a sequência bruta, as anotações biológicas e os metadados bibliográficos. Os números de acesso (ex., NM_001234) fornecem identificadores estáveis para citação. O RefSeq difere do GenBank em seu processo de curadoria: os registros RefSeq são revisados e mantidos manualmente, oferecendo maior confiabilidade para fins de referência. O SRA arquiva leituras de sequenciamento não processadas em formato compactado, armazenando tanto os dados de leitura quanto as pontuações de qualidade. O sistema de busca Entrez fornece consultas unificadas entre bancos de dados em todos os recursos do NCBI, permitindo a recuperação de registros relacionados de diferentes bancos de dados através de uma única interface.

Aplicações

Os bancos de dados do NCBI são usados diariamente por pesquisadores em todo o mundo. Projetos de sequenciamento de DNA começam com buscas BLAST contra o GenBank para identificar sequências desconhecidas. Experimentos de sequenciamento de próxima geração depositam leituras brutas no SRA e as alinham contra genomas RefSeq para detecção de variantes. Estudos de genética bacteriana dependem de genomas RefSeq para genômica comparativa e identificação de genes específicos de espécie e fatores de virulência.

Protocolo Prático

Navegar pelo portal do NCBI começa em ncbi.nlm.nih.gov, onde a barra de pesquisa fornece acesso ao sistema de busca entre bancos de dados Entrez. Para encontrar todas as sequências de nucleotídeos para um determinado organismo, digite o nome do organismo (ex., “Escherichia coli”) na barra de pesquisa principal, depois use o filtro do banco de dados “Nucleotide” na página de resultados. Para consultas mais precisas, use a sintaxe de campo Entrez: “Escherichia coli[Organism] AND 16S ribosomal RNA[Title]” retorna apenas sequências de rRNA 16S de E. coli. A lista de resultados mostra números de acesso, comprimentos de sequência e definições. Clique em qualquer acesso (ex., NR_024570) para ver o registro completo do GenBank com características anotadas, sequências codificantes e referências. Para recuperação em lote, clique em “Send to” > “File” > “FASTA” para baixar todas as sequências correspondentes. Como exemplo prático, um microbiologista caracterizando um novo isolado bacteriano poderia: (1) pesquisar no SRA leituras brutas de espécies intimamente relacionadas para usar como referência para montagem, (2) submeter os contigs montados ao BLAST contra o banco de dados de genomas RefSeq para identificar o parente sequenciado mais próximo, (3) baixar o genoma RefSeq desse parente para predição de genes com ferramentas como Prokka, e (4) depositar a montagem anotada no GenBank com um novo acesso. Todo o fluxo de trabalho, consultar, recuperar, analisar e submeter, opera dentro do ecossistema unificado do NCBI, com o Entrez fornecendo navegação contínua entre bancos de dados em cada etapa. Por exemplo, uma busca no PubMed por um patógeno de interesse liga diretamente aos registros Nucleotide de seu genoma, ao SRA para dados de sequenciamento disponíveis e ao BioProject para metadados experimentais, tudo sem sair do portal do NCBI.