Skip to content

Article image
全基因组关联研究(GWAS)

May 16, 2026 · Updated: May 25, 2026

概述

全基因组关联研究 (GWAS) 是一种大规模分析,扫描数千个个体的基因组,以识别与特定性状或疾病相关的遗传变异。通过比较病例和对照之间的等位基因频率,GWAS 可以查明导致身高、糖尿病或心血管疾病等复杂表型的基因组位点。该方法是无假设的,它检查了基因组中数百万个 SNP,而无需事先假设涉及哪些基因。自 2005 年首次具有里程碑意义的 GWAS 以来,这种方法已经发现了数以万计的性状相关基因座。

方法

典型的 GWAS 会经历几个阶段。首先,使用 SNP 阵列或 DNA 测序 对研究参与者进行基因分型。质量控制(通过调用率、Hardy-Weinberg 平衡和次要等位基因频率过滤 SNP)后,使用参考面板对数据进行插补以推断非分型变异。使用逻辑回归或线性混合模型来执行关联测试,以纠正群体分层。严格的全基因组显着性阈值 (p < 5 × 10⁻⁸) 可以对数百万个 SNP 进行多次测试。结果以曼哈顿图可视化,显示染色体位置与显着性的关系,Q-Q 图评估系统偏差。

应用程序

GWAS 改变了我们对常见疾病遗传学的理解。它已经确定了数百个 2 型糖尿病、冠状动脉疾病和自身免疫性疾病的位点,其中许多位点指向了意想不到的生物学途径。在癌症研究中,GWAS 位点揭示了新的易感基因和潜在的癌症生物化学 靶标。然而,将 GWAS 信号转化为因果机制仍然具有挑战性,因为大多数相关变异位于非编码区域。 GWAS 后分析包括精细绘图、功能注释和孟德尔随机化,以建立因果关系并探索临床生物化学 相关性。

实用协议

GWAS 管道始于 SNP 阵列的基因型数据或估算的测序数据。样本级 QC 筛选出检出率 <95%、杂合性异常值(平均值 ±3 SD)和性别不匹配的个体。 SNP 水平 QC 去除检出率 <95%、Hardy-Weinberg 平衡 p < 1×10⁻⁶(在对照中)和次要等位基因频率 (MAF) < 1% 的变异。所有 QC 均在 PLINK 中执行:plink --bfile data --geno 0.05 --hwe 1e-6 --maf 0.01 --mind 0.05 --make-bed --out data_qc。对参考面板(例如 1000 Genomes 或 TOPMed)的插补采用两步过程:使用“SHAPEIT4”或“Eagle2”进行预定相,然后在云服务器(如密歇根插补服务器)上使用“Minimac4”或“IMPUTE5”进行插补。插补后,将剂量转换为硬调用并按“Rsq > 0.3”进行过滤。总体分层通过主成分分析进行评估:“plink –bfile data_qc –pca 10 –out pca_results”。关联测试使用在“SAIGE”或“BOLT-LMM”中实现的线性混合模型来进行二元或数量性状,校正相关性和群体结构:“saige –vcf impulated.vcf –traitType binary –pheno phenotype.txt –covar pca_results.eigenvec –output assoc.txt”。全基因组显着性阈值为 p < 5×10⁻⁸。使用“qqman” R 包通过曼哈顿图可视化结果:“manhattan(gwas, chr=“CHR”, bp=“BP”, p=“P”, snp=“SNP”, suggestiveline = -log10(1e-5),genomewideline = -log10(5e-8))`。用基因组膨胀因子 λ 评估膨胀;值 <1.05 表示最小分层。使用“FINEMAP”或“SuSiE”对重要位点进行精细定位,以识别相关区域内可靠的因果变异集。