Descripción general
El análisis de datos de microarrays transforma las intensidades de fluorescencia sin procesar de microarrays hibridados en mediciones significativas de la expresión genética. Aunque RNA-seq ha suplantado en gran medida a los microarrays para estudios basados en descubrimientos, los microarrays siguen utilizándose ampliamente en el diagnóstico clínico, el fitomejoramiento y los estudios de grandes poblaciones debido a su bajo costo, sus protocolos estandarizados y sus líneas de análisis bien establecidas. Un solo microarray puede medir la expresión de decenas de miles de transcripciones simultáneamente aprovechando el emparejamiento de bases complementarias entre la muestra de ADNc y las sondas inmovilizadas. El flujo de trabajo de análisis aborda las características técnicas únicas de los datos de microarrays, incluida la corrección de fondo, la normalización y el resumen a nivel de sonda.
Métodos
El análisis de microarrays comienza con el procesamiento de imágenes para extraer intensidades a nivel de sonda. La corrección de fondo elimina señales no específicas mediante métodos como el promedio robusto de matrices múltiples (RMA) o el ajuste de contenido de GC. La normalización hace que las matrices sean comparables: la normalización cuantil es el enfoque más común para matrices de un color, mientras que la normalización loess se aplica a diseños de dos colores. Resumen de sondas (para matrices Affymetrix, utilizando RMA o PLIER) combina varias sondas por gen en un único valor de expresión. La evaluación de calidad utiliza pseudoimágenes, gráficos NUSE y gráficos RLE para identificar matrices problemáticas. La expresión diferencial se prueba con limma, que utiliza moderación empírica de Bayes para estabilizar las estimaciones de varianza entre genes. Los efectos por lotes se detectan con el análisis de componentes principales y se corrigen utilizando ComBat o removeBatchEffect de limma.
Aplicaciones
A pesar del auge de la secuenciación, los microarrays siguen aportando valor. Las pruebas MammaPrint y Oncotype DX aprobadas por la FDA utilizan micromatrices para el pronóstico del cáncer de mama. Los paneles clínicos microarrays de ADN y expresión genética guían las decisiones de tratamiento en oncología y diagnóstico de enfermedades raras. El análisis de datos de microarrays también respalda la validación de los resultados de qPCR a través de estudios de correlación qPCR y complementa la secuenciación de ADN mediante la creación de perfiles de expresión a escala. En genómica agrícola, los microarrays permiten un mapeo de rasgos rentable y una selección asistida por marcadores en grandes poblaciones reproductoras.
Protocolo práctico
Para el análisis de microarrays de Affymetrix en R/Bioconductor, comience leyendo archivos CEL con el paquete oligo o affy. Cree un ExpressionFeatureSet: datos <- read.celfiles(list.celfiles()). Realice la normalización RMA en un solo paso con eset <- rma(data), que aplica corrección de fondo (convolución de distribuciones de señal y ruido), normalización cuantil entre matrices y resumen a nivel de sonda mediante pulido de mediana. La matriz de expresión resultante contiene valores transformados en log2 listos para el análisis. Evalúe la calidad de la matriz con gráficos NUSE (error estándar normalizado sin escala) y RLE (expresión de registro relativo); se deben marcar las matrices con una mediana NUSE superior a 1,05 o rangos intercuartílicos RLE que se desvían de la norma. Las pruebas de expresión diferencial utilizan limma: primero ajuste un modelo lineal con fit <- lmFit(eset, design) donde design es una matriz modelo creada con model.matrix(~ condition). Luego aplique la moderación empírica de Bayes con fit2 <- eBayes(fit) y extraiga los resultados con topTable(fit2, coef = 2, number = Inf, ajustar = "BH"). El resultado incluye cambios logarítmicos, expresión promedio, estadísticas t moderadas, valores p y valores p ajustados de Benjamini-Hochberg. Para matrices de dos colores, use limma con normalizeWithinArrays (normalización sin pérdida) y normalizeBetweenArrays (normalización de escala). Los efectos de lote identificados en los gráficos PCA se pueden corregir con ComBat(dat, lote) del paquete sva. Visualice los resultados con gráficos de volcanes, mapas de calor de las principales sondas expresadas diferencialmente y gráficos MA para inspeccionar el sesgo dependiente de la intensidad. Anote sondas en genes utilizando el paquete de anotación específico de la plataforma (por ejemplo, hgu133plus2.db para matrices Human Genome U133 Plus 2.0).