Skip to content

Article image
生物分类的监督学习

May 16, 2026 · Updated: May 25, 2026

概述

监督学习使用输入输出对的数据集(其中正确答案已知)来训练模型,该模型可以预测新的、未见过的输入的输出。在生物信息学中,这种范式自然地映射到诸如将组织样本分类为癌性或健康、预测遗传变异是否致病或为未表征的蛋白质分配功能等问题。该模型在惩罚预测错误的损失函数的指导下,学习在特征空间中分隔类别的决策边界。

方法

逻辑回归对类别成员的概率进行建模,并仍然是二元分类的基线,尤其是在重视可解释性时。 支持向量机构建具有最大余量的超平面分离器,并且在组学数据典型的高维设置中表现良好。 随机森林聚合了许多在引导样本上训练的决策树,并提供内置的特征重要性度量。 梯度增强树(XGBoost、LightGBM)迭代地纠正前驱错误并经常赢得结构化数据竞赛。 具有隐藏层的神经网络可以学习复杂的非线性边界,但需要更多的数据和仔细的正则化。当类不平衡时,所有方法都受益于类权重调整或重采样。

实用协议

基因表达分类的实用监督学习工作流程从加载表达矩阵开始,其中行代表基因,列代表患者样本。首先使用对数转换的每百万计数 (log-CPM) 或分位数标准化对数据进行标准化。典型的数据集可能包含 100 个样本的 20,000 个基因特征,需要仔细验证。研究人员将数据分为训练集 (70%)、验证集 (15%) 和测试集 (15%),同时通过分层保留类别比例。在训练集上训练具有 500 棵树的随机森林分类器。对训练集的五折交叉验证评估稳定性:模型在四折上进行拟合,并在保留的折上进行评估,重复五次,产生平均交叉验证精度。在确认交叉验证性能可接受后,模型将在完整的训练集上重新训练,并在保留的测试集上评估一次。经过训练的森林的特征重要性得分揭示了哪些基因对类别的区分最强烈。通过 KEGG 或 Reactome 富集分析,根据已知的生物途径检查排名前 20 的基因,以验证机制的合理性。该工作流程已用于开发乳腺癌亚型的多基因预后特征,其中一组 50 个基因将患者分为具有显着不同生存结果的风险组。同样的方法适用于从药物基因组数据集中对药物反应表型进行分类,并从基因组特征预测致病变异。

应用程序

监督学习使用[细菌遗传学](/guides/bacterial- Genetics.html)中的基因组标记对细菌病原体进行分类,在癌症生物化学中预测患者预后,并从DNA微阵列和基因表达数据中识别差异表达的基因。它还通过将患者分为风险组并注释整个基因组的调控元件来为临床决策支持提供支持。