Skip to content

Article image
Estudios de asociación de todo el genoma (GWAS)

May 16, 2026 · Updated: May 25, 2026

Descripción general

Los estudios de asociación de todo el genoma (GWAS) son análisis a gran escala que escanean los genomas de miles de individuos para identificar variantes genéticas asociadas con rasgos o enfermedades particulares. Al comparar las frecuencias alélicas entre casos y controles, GWAS puede identificar loci genómicos que contribuyen a fenotipos complejos como la altura, la diabetes o las enfermedades cardiovasculares. El enfoque está libre de hipótesis: examina millones de SNP en todo el genoma sin suposiciones previas sobre qué genes están involucrados. Desde el primer GWAS histórico en 2005, este método ha descubierto decenas de miles de loci asociados a rasgos.

Métodos

Un GWAS típico pasa por varias etapas. Primero, se genotipifica a los participantes del estudio utilizando matrices de SNP o secuenciación de ADN. Después del control de calidad (filtrar los SNP por tasa de llamadas, equilibrio de Hardy-Weinberg y frecuencia de alelos menores), los datos se imputan para inferir variantes no tipificadas utilizando paneles de referencia. Las pruebas de asociación se realizan mediante regresión logística o modelos lineales mixtos que corrigen la estratificación de la población. El estricto umbral de significación de todo el genoma (p <5 × 10⁻⁸) representa múltiples pruebas en millones de SNP. Los resultados se visualizan en gráficos de Manhattan que muestran las posiciones cromosómicas versus la significancia, y los gráficos Q-Q evalúan el sesgo sistemático.

Aplicaciones

GWAS ha transformado nuestra comprensión de la genética de las enfermedades comunes. Ha identificado cientos de loci para la diabetes tipo 2, la enfermedad de las arterias coronarias y los trastornos autoinmunes, muchos de los cuales apuntan a vías biológicas inesperadas. En la investigación del cáncer, los loci GWAS han revelado nuevos genes de susceptibilidad y objetivos potenciales bioquímica del cáncer. Sin embargo, traducir las señales de GWAS en mecanismos causales sigue siendo un desafío, ya que la mayoría de las variantes asociadas se encuentran en regiones no codificantes. Los análisis posteriores al GWAS incluyen mapeo fino, anotaciones funcionales y aleatorización mendeliana para establecer la causalidad y explorar la relevancia de bioquímica clínica.

Protocolo práctico

Un proceso de GWAS comienza con datos de genotipo de matrices de SNP o datos de secuenciación imputados. El control de calidad a nivel de muestra filtra a los individuos con una tasa de llamadas <95 %, valores atípicos de heterocigosidad (±3 DE de la media) y discrepancias de sexo. El control de calidad a nivel de SNP elimina variantes con una tasa de llamada <95 %, equilibrio de Hardy-Weinberg p <1 × 10⁻⁶ (en los controles) y frecuencia de alelo menor (MAF) <1 %. Todo el control de calidad se realiza en PLINK: plink --bfile data --geno 0.05 --hwe 1e-6 --maf 0.01 --mind 0.05 --make-bed --out data_qc. La imputación a un panel de referencia (por ejemplo, 1000 Genomes o TOPMed) utiliza un proceso de dos pasos: fase previa con SHAPEIT4 o Eagle2, luego imputación con Minimac4 o IMPUTE5 en un servidor en la nube como Michigan Imputation Server. Después de la imputación, convierta las dosis en decisiones estrictas y filtre por Rsq > 0,3. La estratificación de la población se evalúa con el análisis de componentes principales: plink --bfile data_qc --pca 10 --out pca_results. Las pruebas de asociación utilizan un modelo lineal mixto implementado en SAIGE o BOLT-LMM para rasgos binarios o cuantitativos, corrigiendo la relación y la estructura de la población: saige --vcf imputed.vcf --traitType binario --pheno phenotype.txt --covar pca_results.eigenvec --output assoc.txt. El umbral de significación de todo el genoma es p <5 × 10⁻⁸. Visualice los resultados con un gráfico de Manhattan utilizando el paquete R qqman: manhattan(gwas, chr="CHR", bp="BP", p="P", snp="SNP", sugestiveline = -log10(1e-5), genomewideline = -log10(5e-8)). Evaluar la inflación con el factor de inflación genómica λ; valores <1,05 indican una estratificación mínima. Mapee loci significativos con “FINEMAP” o “SuSiE” para identificar conjuntos creíbles de variantes causales dentro de regiones asociadas.