Skip to content

Article image
生物信息学中的聚类:揭示自然群体

May 16, 2026 · Updated: May 25, 2026

概述

聚类是一种无监督学习技术,它将一组对象划分为多个组,使得同一聚类中的对象彼此之间比其他聚类中的对象更相似。在生物信息学中,聚类解决了不存在真实标签的探索性问题:发现新的疾病亚型、识别共表达的基因模块或检测微生物群落结构。聚类的质量主要取决于所选择的相似性度量和算法,并且结果需要生物学验证而不是纯粹的统计指标。

方法

K-means 通过最小化簇内方差将数据划分为预定义数量的簇,并且快速且可扩展,但假设是球形簇。 分层聚类使用凝聚或分裂策略构建嵌套分组的树状图,其优点是可以在检查后选择聚类的数量。 DBSCAN 将簇识别为由稀疏区域分隔的密集区域,并在检测异常值时处理任意形状。 高斯混合模型提供概率聚类分配,并且可以捕获具有不同大小和方向的聚类。对于高维数据,聚类之前通常先进行降维。当真实情况可用时,内部验证指数(例如轮廓分数)和外部度量(例如调整兰德指数)可以量化集群质量。

实用协议

实用的聚类工作流程从 N 个样本和 P 个基因的标准化基因表达矩阵开始。研究人员首先应用 PCA 对前 20 个主成分进行降维,从而对数据进行去噪并加速下游计算。对于层次聚类,使用欧几里得距离计算距离矩阵,而 Ward 的链接方法在合并分支时最小化簇内方差。检查树状图以确定簇的数量,寻找合并之间的大垂直距离作为自然切点。计算 2 到 10 范围内的 k 的轮廓分数以验证选择 , 最佳 k 最大化平均轮廓宽度。对于 k 均值聚类,算法运行 20 次随机初始化以避免局部极小值,并选择具有最低聚类内平方和的解决方案。结果通过带有行和列树状图的热图可视化,或投影到按聚类分配着色的 UMAP 嵌入上。生物学验证如下:使用 Wilcoxon 秩和检验鉴定簇之间差异表达的基因,并将顶级标记与来自数据库(例如 PanglaoDB 或 CellMarker)的已知细胞类型特征交叉引用。一个具体的例子来自癌症基因组图谱 (TCGA),其中对 33 种癌症类型的 5,000 个肿瘤样本进行共识聚类,确定了具有不同生存结果的新型分子亚型。在单细胞研究中,对来自阿尔茨海默病大脑样本的 50,000 个细胞进行聚类,揭示了一种与疾病相关的新小胶质细胞群体,其具有与神经退行性变相关的独特转录特征。

应用程序

聚类可从DNA 微阵列和基因表达 概况中识别癌症亚型,在流式细胞术 数据中对细胞群进行门控,并根据[细菌遗传学](/guides/bacterial- Genetics.html) 研究中定义微生物群落分析中的操作分类单位。它还揭示了蛋白质-蛋白质相互作用网络中的功能模块,并根据分子特征对患者进行分组,以制定个性化治疗策略。