Skip to content

Article image
生物信息学中的机器学习:简介

May 16, 2026 · Updated: May 25, 2026

概述

机器学习为生物信息学配备了算法,可以自动识别复杂、高维生物数据中的模式,而无需使用领域规则进行显式编程。中心范式是从示例中学习:给定输入数据集(有时还有相应的输出),算法构建一个模型,该模型可以推广到未见过的数据。生物数据的多样性(序列、结构、表达谱、图像)需要同样多样化的工具包,涵盖监督分类、回归、聚类和降维。

关键概念

特征是用作输入的可测量属性,例如核苷酸组成、峰值强度或图像像素值。 标签是监督环境中的目标结果,例如疾病状态或基因功能。 训练集用于拟合模型参数,验证集用于调整超参数,测试集用于估计泛化误差。当模型记住训练噪声而不是学习真实信号时,就会发生过度拟合,并且可以通过正则化、交叉验证和更简单的模型架构来缓解这种情况。特征缩放、处理缺失值和类不平衡是强烈影响现实世界性能的实际考虑因素。

实际工作流程

生物信息学中的典型机器学习项目遵循结构化流程。考虑从 RNA-seq 表达数据对肿瘤亚型进行分类的任务。首先,对来自转录组学管道的原始计数数据进行标准化和过滤,以去除低表达的基因。研究人员提取特征,表达式值本身或用于降维的前 50 个主成分。标记数据被分为训练集和测试集(80/20),梯度提升树模型(XGBoost)配置为100棵树,最大深度为6,学习率为0.1。该模型使用分层五重交叉验证进行训练和评估,以 ROC 曲线下面积 (AUROC) 作为主要指标。提取特征重要性来识别最具辨别力的基因。一个具体的例子:在一项肺腺癌与正常组织的研究中,该流程在保留的数据上识别出 AUROC > 0.95 的 15 个基因,包括 NKX2-1 和 SFTPC 等已知标记。另一个实际应用是根据全基因组测序数据预测抗菌药物耐药性:根据细菌基因组 k-mer 频率训练的随机森林分类器可以预测对环丙沙星等抗生素的耐药性,准确率超过 90%,从而比基于培养的方法更快地做出临床决策。相同的标准化工作流程适用于肽免疫原性预测、单细胞 RNA-seq 的细胞类型分类以及不同基因组研究中的变异致病性评分。

应用程序

机器学习渗透到现代生物信息学中。它根据DNA 微阵列和基因表达 数据对肿瘤亚型进行分类,根据氨基酸序列预测[蛋白质结构](/guides/ Protein-Structure.html),并在流式细胞术 中执行自动细胞群识别。深度学习变异现在在预测调控元件活性、变异致病性和药物靶点相互作用方面达到了最先进的准确性。随着生物数据集规模和维度的增长,机器学习成为生物信息学家工具包中越来越不可或缺的组成部分。