Skip to content

Article image
Bancos de Dados de Expressão Gênica: GEO e ArrayExpress

May 16, 2026

Visão Geral

Os bancos de dados de expressão gênica fornecem repositórios centralizados para dados de transcriptômica gerados por experimentos de microarranjos e sequenciamento de alto rendimento. Eles garantem que os dados experimentais permaneçam acessíveis após a publicação, permitindo verificação independente, meta-análise e novas descobertas através da reutilização de dados. Os dois maiores repositórios são o Gene Expression Omnibus (GEO) no NCBI e o ArrayExpress no EMBL-EBI. Ambos aceitam dados de perfil de expressão, imunoprecipitação de cromatina e outros ensaios de genômica funcional, e aplicam padrões de relato adotados pela comunidade como o MIAME (Informação Mínima sobre um Experimento de Microarranjo).

Conceitos-Chave

GEO organiza dados em quatro tipos de registro: Series (um experimento completo), Samples (hibridizações individuais ou execuções de sequenciamento), Platforms (o arranjo ou plataforma de sequenciamento usado) e Datasets (coleções curadas para análise). GEO2R fornece uma ferramenta baseada na web para análise de expressão diferencial sem programação. ArrayExpress é a contraparte europeia, interoperável com GEO através de acordos de troca de dados. Ambos os bancos de dados suportam os formatos tabulares MAGE-TAB e MINiML para submissão de metadados. MINSEQE estende os padrões MIAME para cobrir experimentos de expressão baseados em sequenciamento.

Aplicações

Os bancos de dados de expressão pública aceleram a descoberta em muitos campos. Pesquisadores usam o GEO para recuperar conjuntos de dados para meta-análise de estudos de microarranjos de DNA e expressão gênica, validar suas próprias descobertas contra experimentos publicados e identificar biomarcadores de expressão. O design de primers para qPCR se beneficia de dados de expressão que confirmam padrões de abundância de transcritos. Estudos de sequenciamento de RNA arquivam leituras brutas e matrizes de expressão processadas no GEO ou ArrayExpress como condição para publicação.

Protocolo Prático

Para encontrar dados de expressão para um gene de interesse, vá para ncbi.nlm.nih.gov/geo e pesquise com o símbolo do gene e a espécie, por exemplo, “SOX2 AND Homo sapiens[Organism]”. A página de resultados lista as Séries e Datasets correspondentes. Clique em uma entrada de Dataset para ver o resumo do experimento, informações da plataforma e anotações das amostras (tipicamente grupos controle vs. tratamento). Use o botão “Analysis with GEO2R” para iniciar a ferramenta de expressão diferencial baseada na web: selecione grupos de amostras marcando caixas de seleção, atribua-os a grupos experimentais (ex., Grupo 1: não tratado, Grupo 2: tratado), então clique em “Top 250” para classificar os genes por valor de p ajustado e log fold change. A tabela de resultados exibe valores de expressão, estatísticas e um boxplot para qualquer gene. Para comparar a expressão entre condições mais sistematicamente, baixe o arquivo de matriz da série (uma tabela separada por tabulações de valores de expressão normalizados) e carregue-o em R ou Python. Por exemplo, um pesquisador estudando SOX2 em glioblastoma poderia consultar o GEO por “glioblastoma SOX2 expression”, identificar a série GSE123456 contendo 10 amostras de tumor e 10 normais, usar GEO2R para descobrir que SOX2 está 4,2 vezes superexpresso em tumores (p = 0,001), então baixar a matriz completa para correlacionar a expressão de SOX2 com outros marcadores de células-tronco em todas as amostras. O mesmo fluxo de trabalho no ArrayExpress (ebi.ac.uk/arrayexpress) fornece acesso a conjuntos de dados europeus complementares, permitindo meta-análise entre repositórios para fortalecer as descobertas. Esta abordagem é amplamente utilizada na descoberta de biomarcadores, onde a combinação de múltiplos conjuntos de dados GEO para a mesma doença aumenta o poder estatístico e identifica assinaturas de expressão reproduzíveis que sobrevivem à validação em coortes independentes de pacientes.