Skip to content

Article image
高维生物学的降维

May 16, 2026 · Updated: May 25, 2026

概述

降维将高维数据(其中每个样本都有数千或数万个测量特征)映射到低维空间(通常是二维或三维),以保留重要的结构。这有两个主要目的:可视化,允许研究人员通过眼睛看到模式、聚类和异常值;去噪,消除影响下游分析的不相关变异。从基因表达矩阵到质谱的生物数据本质上是高维的并且通常是冗余的,这使得降维成为重要的预处理步骤。

方法

主成分分析 (PCA) 通过原始特征的线性组合找到最大方差的正交轴。它速度快、确定性强,并且广泛用于初始探索。 t 分布随机邻域嵌入 (t-SNE) 在高维空间中构建成对相似性的概率分布,并将 Kullback-Leibler 散度最小化到低维映射,擅长揭示局部结构和聚类。 统一流形逼近和投影 (UMAP) 基于类似的原理,但更好地保留了全局结构,并且速度明显更快。 自动编码器 使用神经网络来学习非线性嵌入并可以捕获复杂的流形。每种方法都有超参数(t-SNE 的困惑度、UMAP 的 n_neighbors),这些参数强烈影响最终的可视化结果。

实用协议

单细胞 RNA-seq 数据的实用降维工作流程从基因-细胞计数矩阵开始。经过质量过滤、归一化和对数转换后,选择前 2,000 个高度变异的基因。首先应用 PCA 将矩阵从大约 20,000 个维度减少到 50 个主成分,捕获主要变化,同时消除技术噪音。研究人员使用碎石图检查解释的方差,通常保留前 20-30 个成分用于下游分析。这些 PCA 简化坐标用作 UMAP 的输入。设置关键超参数:n_neighbors = 15、min_dist = 0.1 和 n_components = 2。绘制 UMAP 嵌入图,每个单元格根据已知的单元格类型标记、聚类分配或实验条件进行着色。解释该图涉及将不同的细胞群识别为孤立的点云、表明分化途径的连续轨迹以及可能代表双联体或稀有群体的异常细胞。尽管 UMAP 更好地保留了全局关系,但 t-SNE 可以用作更精细局部结构的替代方案。例如,在一项外周血单核细胞研究中,该流程在单次 10 倍基因组学运行中揭示了 22 种不同的免疫细胞类型,其中包括占总细胞数不到 1% 的稀有树突细胞亚群。在癌症研究中,单细胞肿瘤数据的降维发现了具有不同增殖能力和药物敏感性的不同亚克隆群体,指导个性化治疗策略。

应用程序

降维是探索DNA 微阵列和基因表达 数据、在流式细胞术 中可视化细胞群以及检查蛋白质组学和质谱 实验质量的标准做法。单细胞 RNA-seq 分析流程通常使用 PCA 进行初始去噪,然后使用 UMAP 进行可视化,从而能够从转录组数据中发现新的细胞类型和状态。