Descripción general
El análisis de expresión diferencial (DE) es el núcleo estadístico de la transcriptómica y determina qué genes muestran cambios de expresión significativos entre condiciones experimentales. Ya sea que se comparen células tratadas versus no tratadas, tejido tumoral versus tejido normal o muestras a lo largo del tiempo, el análisis DE transforma los datos de recuento sin procesar en conocimientos biológicos. El desafío radica en distinguir las verdaderas señales biológicas del ruido técnico y al mismo tiempo tener en cuenta la carga de pruebas múltiples inherente a las mediciones de todo el genoma. Los métodos modernos de DE utilizan modelos estadísticos sofisticados que se han comparado ampliamente con conjuntos de datos reales y simulados.
Métodos
El análisis DE normalmente comienza con una matriz de recuento de lecturas por gen por muestra. Los métodos de normalización (TMM, RLE o normalización cuantil) se ajustan al tamaño de la biblioteca y a los sesgos de composición. Las herramientas populares incluyen DESeq2, que modela cuenta con una distribución binomial negativa y utiliza estimación de contracción para la dispersión; edgeR, que utiliza métodos empíricos de Bayes; y limma-voom, que aplica modelos lineales a recuentos logarítmicos transformados con pesos de precisión. Para organismos que no son modelo o experimentos sin [un genoma de referencia, herramientas como Sailfish o Kallisto realizan una cuantificación sin alineación. Los resultados se resumen como cambios de log2 y valores de p ajustados (corrección de Benjamin-Hochberg). El análisis de componentes principales (PCA) y los mapas de calor proporcionan vistas globales de los patrones de expresión.
Aplicaciones
El análisis DE es fundamental para prácticamente todos los estudios de transcriptómica. Identifica biomarcadores para el diagnóstico y pronóstico de enfermedades, revela mecanismos de acción de fármacos y caracteriza las respuestas celulares a estímulos ambientales. En entornos clínicos, el análisis DE de biopsias de pacientes puede estratificar los cánceres para terapia dirigida. El método está estrechamente relacionado con los experimentos de validación de RT-PCR, que confirman genes candidatos, y se basa en técnicas de microarrays de ADN y expresión genética. Los resultados de DE también impulsan el análisis de enriquecimiento de conjuntos de genes (GSEA) para identificar las vías afectadas y las categorías funcionales.
Protocolo práctico
Un análisis DE estándar en R comienza leyendo la matriz de conteo y los metadatos de muestra en un objeto DESeqDataSet: dds <- DESeqDataSetFromMatrix(countData = counts, colData = metadata, design = ~ condition). La fórmula de diseño especifica el modelo experimental; una comparación simple de dos grupos usa “~ condición”, mientras que los diseños corregidos por lotes o emparejados usan “~ lote + condición” o “~ paciente + condición”. Ejecute la canalización DE completa con dds <- DESeq(dds), que realiza normalización, estimación de dispersión y pruebas de Wald. Extraiga los resultados con results(dds, contrast = c("condition", "treatment", "control")), que devuelve una tabla con columnas para baseMean, log2FoldChange, lfcSE, stat, pvalue y padj. La columna “padj” contiene valores p ajustados de Benjamini-Hochberg que representan pruebas múltiples en miles de genes. Un flujo de trabajo alternativo con edgeR usa DGEList, calcNormFactors, estimateDisp y exactTest o glmFit/glmLRT para diseños complejos. Interprete los cambios log2 veces: un valor de 1 significa un aumento de 2 veces en la condición tratada, mientras que -1 significa una disminución de 2 veces. La reducción de los cambios de log2 con lfcShrink(dds, coef = 2, type = "apeglm") mejora la clasificación y elimina el ruido de los genes poco expresados. Filtre los resultados utilizando umbrales como padj < 0.05 y |log2FoldChange| > 1. Visualice con “plotMA” para el gráfico de media-promedio, “plotPCA” en datos estabilizados por varianza para la agrupación de muestras y “pheatmap” en los 50 genes más importantes. El paquete “EnhancedVolcano” produce gráficos de volcanes listos para su publicación que destacan genes significativamente regulados al alza y a la baja.