概述
路径和本体数据库提供生物知识的结构化表示。它们将细胞过程复杂、相互关联的性质转化为可查询、分析和可视化的可计算格式。基因本体 (GO) 提供了一个受控词汇表来描述三个领域的基因产物:细胞成分、分子功能和生物过程。 KEGG(京都基因和基因组百科全书)将基因映射到代谢和信号通路。 Reactome 是一个开源的、精心策划的通路数据库,涵盖人类生物学中的反应。
关键概念
基因本体的结构为有向无环图,其中术语通过父子关系(is-a、part-of、regulates)连接。注释将基因产物与 GO 术语相关联,并由证据代码支持。 KEGG 通路图 是手动绘制的图表,其中节点代表基因、蛋白质或化合物,边缘代表相互作用或反应。 KEGG Orthology (KO) 对跨物种的功能相关基因进行分组。 反应组将路径表示为有序的分子反应集,每个反应都有详细的输入-输出关系,并包括用于组学数据路径分析的工具。
应用程序
本体论和路径数据库可以对实验数据进行高级解释。 GO 术语或 KEGG 通路的富集分析可识别来自代谢通路 研究或差异表达实验的基因列表中过度代表的生物过程。 酶分类和命名法交叉引用被集成到KEGG中以进行代谢重建。 Reactome 中的细胞信号传导和信号转导 通路为磷酸蛋白质组学和微扰筛选提供了机制背景。
实用协议
要使用 KEGG 将差异表达基因列表映射到通路,请导航至 kegg.jp 并单击“KEGG Mapper”>“搜索和颜色通路”。粘贴您的基因列表(使用 Entrez 基因 ID 或 UniProt 种质)并选择目标生物体(例如,“hsa”代表人类)。 KEGG 对每个通路图上的匹配基因进行着色,立即显示哪些通路被富集。要进行更严格的统计分析,请使用基于网络的 KEGG 富集工具或 DAVID (david.ncifcrf.gov):上传您的基因列表,选择物种,然后运行功能注释聚类以获得富集 p 值和错误发现率。对于 GO 富集分析,请使用基因本体资源 (geneontology.org):粘贴您的基因列表,选择证据代码过滤器(例如,排除“IEA”以获得更高的置信度),然后以分层树形图或条形图形式查看富集术语。举一个具体的例子,研究人员对非酒精性脂肪肝病小鼠模型的肝组织进行 RNA 测序,发现了 500 个上调的基因。将这些数据提交给 KEGG Mapper 可以发现“PPAR 信号通路”(p = 10-8)、“脂肪酸代谢”(p = 10-6) 和“氧化磷酸化”(p = 10-4) 的比例过高。 GO 富集证实了“脂质代谢过程”(GO:0006629) 和“线粒体电子传递”(GO:0006120) 的富集,提供了疾病表型基础代谢重编程的系统级视图。因此,结合 GO 和 KEGG 分析提供了互补的观点,GO 揭示了机制细节(例如特定的转运蛋白或酶),而 KEGG 则显示了这些成分如何整合到更大的通路图中。