Skip to content

Article image
多组学集成:结合生物数据层

May 16, 2026 · Updated: May 25, 2026

概述

多组学集成解决了组合不同分子数据类型(基因组、转录组、蛋白质组和代谢组)的挑战,以构建生物系统的连贯的系统级图像。没有一个单一的组学层能够捕获细胞调控的全部复杂性;基因组突变可能不会改变转录本水平,由于翻译后调控,转录本丰度通常与蛋白质丰度不相关,并且代谢物水平反映了所有上游层的综合输出。整合策略旨在弥合这些差距并揭示扰动如何在分子尺度上传播。

方法

集成方法分为三类。 基于串联的方法 将所有组学特征合并到一个矩阵中,以便通过聚类或分类进行联合分析。 基于转换的方法将每个组学数据集转换为中间表示形式(例如核矩阵或网络),然后再将它们组合起来。 基于模型的方法使用概率图形模型或深度学习架构(例如变分自动编码器)来学习跨数据类型的共享潜在表示。 MOFA(多组学因子分析)和 mixOmics 等工具可识别常见的和特定于数据类型的变异模式。数据预处理至关重要:在集成之前必须解决批次效应、缺失值和不同的动态范围。

应用程序

多组学整合根据基因组、转录组和蛋白质组谱组合将患者分为分子亚型,从而推动精准医疗。在癌症研究中,综合分析将DNA 微阵列和基因表达 数据中的拷贝数变化与通过蛋白质组学和质谱 测量的蛋白质水平变化联系起来,并将这些变化映射到中断的代谢途径 上。综合方法还通过将表观遗传标记与转录本和蛋白质丰度相关联来揭示调控机制,从而提供细胞功能的真正整体视图。

实用协议

对于使用 MOFA(多组学因子分析)的多组学集成,从在同一样本上测量的两个或多个组学层的匹配数据矩阵开始。独立预处理每个组学数据集:对于 RNA-seq,使用方差稳定或 TPM 归一化计数;对于蛋白质组学,使用 log2 转换的强度值;对于甲基化,使用 beta 值。删除样本间方差较低的特征(例如,保留转录组学中前 5000 个变异最大的基因)。在 R 中,创建一个 MOFA 对象:library(MOFA2); mofa &lt;- create_mofa(列表(RNA = rna_matrix, 蛋白质 = prot_matrix, 甲基化 = meth_matrix))。定义模型选项:model_opts &lt;- get_default_model_options(mofa); model_opts$num_factors &lt;- 10。训练模型:mofa &lt;- run_mofa(mofa, mofa_opts)。使用“plot_variance_explained(mofa)”检查跨组学层中每个因子解释的方差,它显示哪些因子捕获共享变异与数据类型特定变异。因子载荷(权重)表明哪些特征对每个因子有贡献:“plot_weights(mofa, Factor = 1, nfeatures = 10)”显示驱动第一个因子的主要基因和蛋白质。对于使用 DIABLO 的 mixOmics 方法,创建一个设计矩阵,指定组学层之间的连接:“设计 <- 矩阵(c(0, 0.1, 0.1, 0, 0, 0.1, 0.1, 0, 0), nrow = 3)”。使用“perf.diablo”调整参数并使用“selectVar”选择功能。在按表型着色的因子 1 与因子 2 评分图上可视化样品分离。解释因子负载:给定因子中基因的正负载意味着较高的表达与较高的因子值相关。每个因子具有最高负载量的基因的通路富集揭示了每个因子代表的生物过程。使用箱线图比较临床组之间的因子值,并使用方差分析或 Wilcoxon 检验检验显着性。