Skip to content

Article image
处理生物医学研究中的不平衡数据

May 16, 2026 · Updated: May 25, 2026

概述

当一个类别的样本数量远远超过其他类别时,就会出现数据不平衡,这是生物医学研究中普遍存在的挑战。疾病患病率通常较低,因此数据集包含的健康对照远多于病例;药物不良反应很少见;功能基因组元件在整个基因组中是稀疏的。在不平衡数据上训练的标准分类器倾向于支持多数类,通过简单地预测最常见的标签而完全忽略少数类来实现高精度。需要专门的技术来生成检测罕见但重要事件的模型。

方法

数据级方法修改训练集分布。 随机欠采样会删除多数类样本,但有丢弃有用信息的风险。 合成少数过采样技术 (SMOTE) 通过在现有少数实例之间进行插值来生成合成少数样本。算法级方法调整学习过程:类别加权对损失函数中的少数错误分类分配更高的惩罚,而成本敏感学习直接纳入错误分类成本。 平衡随机森林EasyEnsemble 等集成方法将欠采样与装袋相结合。 阈值移动改变训练后的决策边界,以有利于少数人回忆。评估必须依赖于精确率-召回率曲线或平衡准确率,而不是总体准确率,这在不平衡情况下会产生误导。

实用协议

处理不平衡生物医学数据的实用工作流程从评估类别分布开始。在典型的罕见病数据集中,病例可能仅占样本的 5-10%,造成严重的 90:10 或 95:5 不平衡。研究人员首先通过在原始数据上训练一个简单的逻辑回归分类器来建立基线,并使用平衡的准确性和精确回忆曲线而不是整体准确性进行评估,即使所有案例都被遗漏,整体准确性也会显得很高。对于数据级修复,SMOTE 仅应用于训练集:对于每个少数样本,识别其 k 个最近邻居(默认 k = 5),并通过在样本和沿特征空间向量随机选择的邻居之间进行插值来生成合成样本。现在平衡的训练集用于训练具有 500 棵树的随机森林分类器。对于算法补救措施,类别加权分配的权重与类别频率成反比,如果少数类别占数据的 10%,则其权重为 10。通过在验证集上扫描从 0.1 到 0.9 的决策阈值来应用阈值移动,以最大化 F1 分数。在现实世界的例子中,这些技术被应用于根据药物警戒数据预测药物不良反应,其中不良事件仅在 2% 的病例中发生。 SMOTE 与类别加权相结合,将少数类别的召回率从 12% 提高到 78%,同时保持 85% 的精确度,从而能够对罕见药物安全事件进行有效的信号检测。另一个应用是检测宏基因组数据中的抗生素抗性基因,其中抗性决定因素与总基因含量相比很少见,但在临床上识别至关重要。

应用程序

不平衡数据方法对于检测癌症生物化学研究中的罕见癌症亚型、从DNA微阵列和基因表达数据中识别差异表达标记、在[细菌遗传学](/guides/bacterial- Genetics.html)中发现耐药基因以及预测[临床中罕见变异的致病性]是必不可少的。微生物学](/guides/clinical-microbiology.html)。这些技术确保机器学习模型对少数群体保持敏感,从而能够发现真正罕见的生物信号。