Skip to content

Article image
生物信息学模型评估和验证

May 16, 2026 · Updated: May 25, 2026

概述

模型评估量化了预测模型在未见过的数据上的表现,这是其实际效用的核心衡量标准。在生物信息学中,模型指导临床决策、确定实验的优先顺序或生成生物学假设,严格的评估对于避免过度乐观的主张和不可重复的结果至关重要。根本的挑战是,在训练数据上测量的性能是对真实泛化能力的夸大估计;正确的评估协议可以模拟对真正新数据的预测。

方法

交叉验证将数据划分为互补的子集,对大多数子集进行训练并对保留的折叠进行评估。 K 折交叉验证重复此过程 K 次,提供稳健的性能估计并减少方差。 分层交叉验证保留每次折叠中的类比例,对于不平衡的数据集至关重要。 留一交叉验证适用于非常小的样本量,但方差较高。 引导通过替换对数据进行重新采样,以估计性能指标的置信区间。常见的分类指标包括准确度、精确度、召回率、F1 分数和受试者工作特征曲线下面积 (AUROC)。对于回归,均方误差和 R 平方是标准的。麦克尼马尔检验等统计检验比较两个模型是否具有显着不同的性能。

实用协议

在生物医学数据上训练二元分类器后,实用的模型评估工作流程就开始了。研究人员首先对保留的测试集生成预测,并构建混淆矩阵:真阳性 (TP)、真阴性 (TN)、假阳性 (FP) 和假阴性 (FN)。由此计算灵敏度或召回率 (TP / (TP + FN)) 和特异性 (TN / (TN + FP))。对于少数类别与临床相关的不平衡生物医学数据集,精确回忆曲线优于 ROC 曲线,因为当阴性数量远远多于阳性时,ROC 可能显得过于乐观。精确率-召回率曲线是在所有决策阈值上绘制的,平均精确率 (AP) 分数总结了性能。还会生成 ROC 曲线,并计算曲线下面积 (AUROC) , AUROC 高于 0.9 的模型对于大多数应用来说被认为是优秀的。为了比较两个模型,麦克尼马尔的测试评估了它们的错误率是否存在显着差异。完整的评估报告指标,其置信区间为 95%,通过 2,000 次重新采样的引导进行估计。例如,在评估根据电子健康记录数据预测脓毒症的模型时,尽管 AUROC 为 0.91,但精确回忆曲线显示 AP 为 0.42,这凸显了对罕见事件使用适当指标的重要性。模型校准还应使用可靠性图进行评估;在临床部署之前,可以通过 Platt 缩放或等渗回归来纠正校准不佳的概率。

应用程序

当模型用于根据DNA 微阵列和基因表达 图谱诊断疾病、在癌症生物化学 中预测患者结果或在[细菌遗传学](/guides/bacterial- Genetics.html) 中对细菌菌株进行分类时,严格的评估至关重要。在每种情况下,适当的验证可确保报告的性能反映真实的预测信号,而不是数据泄漏、批次效应或过度拟合的伪影,从而支持可靠地转化为临床或实验室使用。