概述
通路富集分析确定预定义的基因组(代表生物通路、功能类别或细胞过程)在实验衍生基因列表中是否在统计上被过度代表。这种方法将一长串差异表达基因转化为可解释的生物学主题,帮助研究人员摆脱“哪些基因发生了变化?”的问题。到“哪些进程受到影响?”核心原则是,如果某个通路与所研究的条件相关,则其成员基因将比偶然预期更多地出现在用户的基因列表中。
方法
最广泛使用的方法包括 Fisher 精确检验(或超几何检验),它根据定义的背景评估基因列表和途径基因集之间的重叠。 基因集富集分析 (GSEA) 方法通过差异表达度量对所有基因进行排序并测试通路成员是否聚集在排序列表的顶部或底部,从而避免了任意的显着性阈值。多重测试校正(通常是 Benjamini-Hochberg 错误发现率)至关重要,因为同时评估了数百条路径。 KEGG、Reactome 和 Gene Ontology 等精选通路数据库提供参考基因集。
应用程序
通路富集是转录组学、蛋白质组学和代谢组学研究的常规步骤。它将 DNA 微阵列和基因表达 实验的差异表达结果与功能生物学联系起来。癌症研究人员使用它来识别失调的途径,例如[糖酵解](/guides/grinding.html)或柠檬酸循环,并揭示[基因调控和表观遗传学](/guides/gene-regulation-and-epigenics.html)如何重新连接疾病中的细胞程序。富集分析还通过突出显示患者样本中受到干扰的代谢途径 的常见途径来指导生物标志物发现。
实用协议
对于使用 R 中的 clusterProfiler 进行过度表达分析 (ORA),从差异表达基因列表开始(例如,padj < 0.05,|log2FC| > 1)。加载包并执行GO富集:library(clusterProfiler); ego <-丰富GO(基因= de_genes,OrgDb = org.Hs.eg.db,keyType =“SYMBOL”,ont =“BP”,pAdjustMethod =“BH”,pvalueCutoff = 0.05,qvalueCutoff = 0.2)。 ont 参数可以是“BP”(生物过程)、“MF”(分子功能)或“CC”(细胞成分)。对于 KEGG 通路富集,将基因符号转换为 Entrez ID:ekegg <-enrichKEGG(gene = entrez_ids,organism = "hsa", pvalueCutoff = 0.05)。使用“dotplot(ego, showCategory = 20)”可视化结果,它显示基因比率、调整后的 p 值和每个类别的基因计数。 barplot 函数提供了另一种视图。对于基因集富集分析 (GSEA),准备按 log2 倍数变化排序的排序基因列表:genelist <- sort(results$log2FoldChange,ducing = TRUE);名称(基因列表)<-行名称(结果)。使用 gseGO(geneList =genelist, OrgDb = org.Hs.eg.db, keyType = "SYMBOL", ont = "BP", minGSSize = 10, maxGSSize = 500, pvalueCutoff = 0.05) 运行 GSEA。 GSEA 不需要显着性阈值,使其对路径成员之间协调但适度的变化敏感。 “gseaplot2”函数可视化特定路径的运行富集分数。对于基于 Web 的分析,请使用 Enrichr:将基因列表粘贴到 https://maayanlab.cloud/Enrichr,选择库(KEGG、GO、WikiPathways),然后下载组合分数表。组合得分是对数转换的 p 值和 z 得分的乘积,按显着性和变化方向对路径进行排名。始终将结果导出为 CSV,其中包含路径 ID、描述、基因比率、p 值、调整后的 p 值和重叠基因列表的列。