Skip to content

Article image
Umgang mit unausgeglichenen Daten in der biomedizinischen Forschung

May 16, 2026 · Updated: May 25, 2026

Übersicht

Unausgeglichene Daten entstehen, wenn die Anzahl der Proben in einer Klasse die der anderen bei weitem übersteigt – eine allgegenwärtige Herausforderung in der biomedizinischen Forschung. Die Krankheitsprävalenz ist in der Regel niedrig, sodass Datensätze weitaus mehr gesunde Kontrollpersonen als Fälle enthalten; unerwünschte Arzneimittelwirkungen sind selten; und funktionelle genomische Elemente sind im gesamten Genom spärlich vorhanden. Auf unausgeglichenen Daten trainierte Standardklassifikatoren tendieren dazu, die Mehrheitsklasse zu bevorzugen. Sie erreichen eine hohe Genauigkeit, indem sie einfach die häufigste Bezeichnung vorhersagen, während die Minderheitsklasse vollständig fehlt. Um Modelle zu erstellen, die seltene, aber wichtige Ereignisse erkennen, sind spezielle Techniken erforderlich.

Methoden

Ansätze auf Datenebene modifizieren die Verteilung des Trainingssatzes. Zufällige Unterabtastung entfernt Stichproben der Mehrheitsklasse, riskiert jedoch, dass nützliche Informationen verworfen werden. Synthetic Minority Over-sampling Technique (SMOTE) generiert synthetische Minderheitsstichproben durch Interpolation zwischen vorhandenen Minderheitsinstanzen. Ansätze auf Algorithmenebene passen den Lernprozess an: Klassengewichtung weist Fehlklassifizierungen von Minderheiten in der Verlustfunktion höhere Strafen zu, und kostensensitives Lernen berücksichtigt Fehlklassifizierungskosten direkt. Ensemble-Methoden wie Balanced Random Forests und EasyEnsemble kombinieren Unterabtastung mit Bagging. Schwellenwertverschiebung verschiebt die Entscheidungsgrenze nach dem Training, um die Erinnerung an Minderheiten zu begünstigen. Die Bewertung muss sich auf Präzisions-Recall-Kurven oder ausgeglichene Genauigkeit und nicht auf Gesamtgenauigkeit stützen, was bei Ungleichgewicht irreführend ist.

Praktisches Protokoll

Ein praktischer Arbeitsablauf für den Umgang mit unausgeglichenen biomedizinischen Daten beginnt mit der Bewertung der Klassenverteilung. In einem typischen Datensatz zu seltenen Krankheiten machen Fälle möglicherweise nur 5–10 % der Proben aus, was zu einem schwerwiegenden Ungleichgewicht von 90:10 oder 95:5 führt. Der Forscher legt zunächst eine Basislinie fest, indem er einen einfachen logistischen Regressionsklassifikator auf die Rohdaten trainiert und mit ausgewogenen Genauigkeits- und Präzisions-Erinnerungskurven auswertet, statt mit Gesamtgenauigkeit, die selbst dann hoch erscheinen würde, wenn alle Fälle übersehen würden. Zur Behebung auf Datenebene wird SMOTE nur auf den Trainingssatz angewendet: Für jede Minderheitsstichprobe werden ihre k nächsten Nachbarn (Standard k = 5) identifiziert und synthetische Stichproben werden durch Interpolation zwischen der Stichprobe und zufällig ausgewählten Nachbarn entlang von Merkmalsraumvektoren generiert. Der nun ausgeglichene Trainingssatz wird verwendet, um einen zufälligen Waldklassifikator mit 500 Bäumen zu trainieren. Bei algorithmischen Abhilfemaßnahmen weist die Klassengewichtung Gewichtungen zu, die umgekehrt proportional zu den Klassenhäufigkeiten sind – eine Gewichtung von 10 für die Minderheitsklasse, wenn sie 10 % der Daten darstellt. Die Schwellenwertverschiebung wird angewendet, indem Entscheidungsschwellenwerte von 0,1 bis 0,9 im Validierungssatz gescannt werden, um den F1-Score zu maximieren. In einem realen Beispiel wurden diese Techniken angewendet, um unerwünschte Arzneimittelwirkungen anhand von Pharmakovigilanzdaten vorherzusagen, wobei unerwünschte Ereignisse nur in 2 % der Fälle auftraten. SMOTE erhöhte in Kombination mit der Klassengewichtung die Erinnerung für die Minderheitsklasse von 12 % auf 78 %, während gleichzeitig eine Präzision von 85 % beibehalten wurde, was eine effektive Signalerkennung für seltene Arzneimittelsicherheitsereignisse ermöglichte. Eine weitere Anwendung ist die Erkennung von Antibiotikaresistenzgenen in metagenomischen Daten, bei denen Resistenzdeterminanten im Vergleich zum Gesamtgengehalt selten sind, deren Identifizierung jedoch klinisch entscheidend ist.

Anwendungen

Unausgewogene Datenmethoden sind unverzichtbar für die Erkennung seltener Krebssubtypen in Studien zur Krebsbiochemie (/de/guides/cancer-biochemistry.html), zur Identifizierung unterschiedlich exprimierter Marker aus Daten zu DNA-Mikroarrays und Genexpression (/de/guides/dna-microarrays-and-gene-expression.html), zur Entdeckung von Resistenzgenen in der bakteriellen Genetik (/de/guides/bacterial-genetics.html) und zur Vorhersage der Pathogenität seltener Varianten in der [klinischen Mikrobiologie] (/de/guides/clinical-microbiology.html). Diese Techniken stellen sicher, dass Modelle des maschinellen Lernens auf die Minderheitenklasse reagieren und so die Entdeckung wirklich seltener biologischer Signale ermöglichen.