概述
特征选择是从高维数据集中识别信息量最大的变量子集(基因、蛋白质、代谢物或光谱峰)的过程。生物实验经常从相对较少的样本中测量数万个特征,从而产生“大p,小n”问题,导致过度拟合和泛化不良。特征选择通过删除不相关和冗余的变量、提高模型准确性、减少训练时间以及生成更可解释的模型来突出表型的生物驱动因素来缓解这一问题。
方法
过滤方法 使用单变量统计数据(例如 t 检验、方差分析、互信息或与目标变量的相关性)对每个特征进行独立评分。它们的计算效率很高,但忽略了特征交互。 包装方法通过在每个候选子集上训练和评估模型来评估特征子集;使用支持向量机的递归特征消除(RFE)是一个流行的例子。这些方法捕获相互作用,但计算成本昂贵。 嵌入式方法在模型训练期间执行选择 - L1 正则化 (Lasso) 将不相关系数驱动为零,基于树的模型提供特征重要性分数作为副产品。来自通路数据库的领域知识可以进一步指导选择具有生物学意义的变量。
实用协议
用于生物标志物发现的实用特征选择流程从包含数千个特征(例如 15,000 个基因)的组学数据集开始,这些特征是在适度数量的样本(例如 50 个病例和 50 个对照)中测量的。研究人员首先应用过滤方法:对每个基因进行 t 检验,比较病例与对照,并使用 Benjamini-Hochberg 程序调整 p 值以进行多次测试。调整后的 p 值低于 0.05 且绝对倍数变化大于 1.5 的基因将被保留,通常将候选列表减少到几百个特征。接下来,将 Lasso 逻辑回归等嵌入式方法应用于过滤后的集合。 L1 正则化通过一系列 lambda 值的交叉验证进行调整,选择最小化交叉验证误差的 lambda。选择在最佳 lambda 处具有非零系数的特征,通常会产生 10-30 个基因。为了最终细化,使用支持向量机 (RFE-SVM) 进行递归特征消除,将范围缩小到 5-10 个基因的最小诊断特征。在实际应用中,这种三阶段方法用于识别早期胰腺癌的 8 基因血清生物标志物组,在独立验证队列中实现了 89% 的敏感性和 92% 的特异性。另一个例子来自代谢组学,在炎症性肠病治疗的临床试验中,质谱峰的特征选择识别出 12 种代谢物特征,区分应答者和无应答者,这证明了特征选择在基因组学之外的临床实用性。
应用程序
特征选择对于生物标记物发现至关重要,可以从高维 DNA 微阵列和基因表达 研究中分离出一些诊断或预后标记物。在蛋白质组学和质谱中,它确定了疾病分类的区分性光谱特征。同样的原理也适用于质谱 代谢组学,其中选择方法可精确定位区分治疗组的代谢物,从而能够开发有针对性的临床检测。