Visión General
Las bases de datos de expresión génica proporcionan repositorios centralizados para datos de transcriptómica generados por experimentos de microarrays y secuenciación de alto rendimiento. Garantizan que los datos experimentales permanezcan accesibles después de la publicación, permitiendo la verificación independiente, el metaanálisis y nuevos descubrimientos mediante la reutilización de datos. Los dos repositorios más grandes son el Gene Expression Omnibus (GEO) en NCBI y ArrayExpress en EMBL-EBI. Ambos aceptan datos de perfiles de expresión, inmunoprecipitación de cromatina y otros ensayos de genómica funcional, y aplican estándares de informes adoptados por la comunidad como MIAME (Información Mínima sobre un Experimento de Microarrays).
Conceptos Clave
GEO organiza los datos en cuatro tipos de registros: Series (un experimento completo), Muestras (hibridaciones individuales o ejecuciones de secuenciación), Plataformas (la matriz o plataforma de secuenciación utilizada) y Conjuntos de Datos (colecciones curadas para análisis). GEO2R proporciona una herramienta basada en web para análisis de expresión diferencial sin programación. ArrayExpress es la contraparte europea, interoperable con GEO a través de acuerdos de intercambio de datos. Ambas bases de datos admiten los formatos tabulares MAGE-TAB y MINiML para el envío de metadatos. MINSEQE extiende los estándares MIAME para cubrir experimentos de expresión basados en secuenciación.
Aplicaciones
Las bases de datos de expresión pública aceleran el descubrimiento en muchos campos. Los investigadores utilizan GEO para recuperar conjuntos de datos para metaanálisis de estudios de microarrays de ADN y expresión génica, validar sus propios hallazgos contra experimentos publicados e identificar biomarcadores de expresión. El diseño de cebadores para qPCR se beneficia de los datos de expresión que confirman los patrones de abundancia de transcritos. Los estudios de secuenciación de ARN archivan lecturas crudas y matrices de expresión procesadas en GEO o ArrayExpress como condición de publicación.
Protocolo Práctico
Para encontrar datos de expresión para un gen de interés, vaya a ncbi.nlm.nih.gov/geo y busque con el símbolo del gen y la especie, por ejemplo, “SOX2 AND Homo sapiens[Organism]”. La página de resultados lista las Series y Conjuntos de Datos coincidentes. Haga clic en una entrada de Conjunto de Datos para ver el resumen del experimento, la información de la plataforma y las anotaciones de las muestras (típicamente grupos de control vs. tratamiento). Use el botón “Analysis with GEO2R” para lanzar la herramienta de expresión diferencial basada en web: seleccione grupos de muestras marcando casillas, asígnelos a grupos experimentales (ej., Grupo 1: no tratado, Grupo 2: tratado), luego haga clic en “Top 250” para clasificar los genes por valor de p ajustado y cambio logarítmico. La tabla de resultados muestra valores de expresión, estadísticas y un diagrama de caja para cualquier gen. Para comparar la expresión entre condiciones más sistemáticamente, descargue el archivo de matriz de la serie (una tabla delimitada por tabulaciones de valores de expresión normalizados) y cárguelo en R o Python. Por ejemplo, un investigador que estudia SOX2 en glioblastoma podría consultar GEO para “glioblastoma SOX2 expression”, identificar la serie GSE123456 que contiene 10 muestras de tumor y 10 normales, usar GEO2R para encontrar que SOX2 está sobreexpresado 4.2 veces en tumores (p = 0.001), luego descargar la matriz completa para correlacionar la expresión de SOX2 con otros marcadores de células madre en todas las muestras. El mismo flujo de trabajo en ArrayExpress (ebi.ac.uk/arrayexpress) proporciona acceso a conjuntos de datos europeos complementarios, permitiendo un metaanálisis entre repositorios para fortalecer los hallazgos. Este enfoque se utiliza ampliamente en el descubrimiento de biomarcadores, donde la combinación de múltiples conjuntos de datos GEO para la misma enfermedad aumenta el poder estadístico e identifica firmas de expresión reproducibles que sobreviven a la validación en cohortes independientes de pacientes.