概述
差异表达(DE)分析是转录组学的统计核心,确定哪些基因在实验条件下表现出有意义的表达变化。无论是比较经过处理的细胞与未经处理的细胞、肿瘤与正常组织还是时间进程样本,DE 分析都能将原始计数数据转化为生物学见解。挑战在于区分真实的生物信号和技术噪声,同时考虑全基因组测量中固有的多重测试负担。现代 DE 方法使用复杂的统计模型,这些模型已在真实和模拟数据集上进行了广泛的基准测试。
方法
DE 分析通常从每个样本每个基因的读数计数矩阵开始。标准化方法(TMM、RLE 或分位数标准化)根据文库大小和组成偏差进行调整。流行的工具包括DESeq2,它对负二项式分布进行建模,并使用收缩估计来进行分散; edgeR,使用经验贝叶斯方法; limma-voom,它将线性建模应用于用精确权重转换的对数转换计数。对于没有参考基因组的非模型生物或实验,Sailfish 或 Kallisto 等工具可以执行免比对定量。结果总结为 log2 倍数变化和调整后的 p 值(Benjamini-Hochberg 校正)。主成分分析 (PCA) 和热图提供表达模式的全局视图。
应用程序
DE 分析几乎是所有转录组学研究的核心。它识别用于疾病诊断和预后的生物标志物,揭示药物作用机制,并表征细胞对环境刺激的反应。在临床环境中,对患者活检组织进行 DE 分析可以对用于靶向治疗的癌症 进行分层。该方法与 RT-PCR 验证实验密切相关,后者确认候选基因,并建立在 DNA 微阵列和基因表达 技术的基础上。 DE 结果还为基因集富集分析 (GSEA) 提供支持,以识别受影响的途径和功能类别。
实用协议
R 中的标准 DE 分析首先将计数矩阵和样本元数据读入“DESeqDataSet”对象:“dds <- DESeqDataSetFromMatrix(countData = counts, colData =metadata, design = ~ condition)”。设计公式指定实验模型;简单的两组比较使用“条件”,而配对或批量校正设计使用“批次+条件”或“~患者+条件”。使用“dds <- DESeq(dds)”运行完整的 DE 管道,执行归一化、色散估计和 Wald 测试。使用“results(dds,contrast = c(“condition”,“treatment”,“control”))提取结果,该表返回一个包含 baseMean、log2FoldChange、lfcSE、stat、pvalue 和 padj 列的表。 “padj”列包含 Benjamini-Hochberg 调整的 p 值,考虑了数千个基因的多次测试。 “edgeR”的替代工作流程使用“DGEList”、“calcNormFactors”、“estimateDisp”和“exactTest”或“glmFit”/“glmLRT”进行复杂设计。解释 log2 倍数变化:值为 1 表示治疗条件增加 2 倍,而 -1 表示治疗条件减少 2 倍。 log2 倍数的收缩通过 lfcShrink(dds, coef = 2, type = “apeglm”) 进行更改,提高了排名并消除了低表达基因中的噪音。使用“padj < 0.05”和“|log2FoldChange|”等阈值过滤结果> 1.使用“plotMA”可视化均值图,使用“plotPCA”可视化样本聚类的方差稳定数据,使用“pheatmap”可视化前 50 个最重要的基因。 “EnhancedVolcano”包生成可发表的火山图,突出显示显着上调和下调的基因。