Aperçu
Des données déséquilibrées se produisent lorsque le nombre d’échantillons dans une classe dépasse de loin les autres – un défi omniprésent dans la recherche biomédicale. La prévalence de la maladie est généralement faible, de sorte que les ensembles de données contiennent bien plus de contrôles sains que de cas ; les effets indésirables des médicaments sont rares ; et les éléments génomiques fonctionnels sont rares dans le génome. Les classificateurs standards formés sur des données déséquilibrées ont tendance à favoriser la classe majoritaire, atteignant une grande précision en prédisant simplement l’étiquette la plus courante tout en manquant complètement la classe minoritaire. Des techniques spécialisées sont nécessaires pour produire des modèles capables de détecter les événements rares mais importants.
Méthodes
Les approches au niveau des données modifient la distribution de l’ensemble de formation. Le sous-échantillonnage aléatoire supprime les échantillons de la classe majoritaire mais risque de supprimer des informations utiles. La technique de suréchantillonnage des minorités synthétiques (SMOTE) génère des échantillons minoritaires synthétiques par interpolation entre les instances minoritaires existantes. Les approches au niveau de l’algorithme ajustent le processus d’apprentissage : la pondération des classes attribue des pénalités plus élevées aux erreurs de classification minoritaires dans la fonction de perte, et l’apprentissage sensible aux coûts intègre directement les coûts des erreurs de classification. Les méthodes d’ensemble telles que les forêts aléatoires équilibrées et EasyEnsemble combinent le sous-échantillonnage et le bagging. Le déplacement du seuil déplace la limite de décision après la formation pour favoriser le rappel des minorités. L’évaluation doit s’appuyer sur des courbes précision-rappel ou une précision équilibrée plutôt que sur une précision globale, ce qui est trompeur en cas de déséquilibre.
Protocole pratique
Un flux de travail pratique pour gérer des données biomédicales déséquilibrées commence par l’évaluation de la répartition des classes. Dans un ensemble de données typique sur les maladies rares, les cas peuvent constituer seulement 5 à 10 % des échantillons, créant un grave déséquilibre de 90 : 10 ou 95 : 5. Le chercheur établit d’abord une base de référence en entraînant un simple classificateur de régression logistique sur les données brutes et en évaluant avec une précision équilibrée et des courbes précision-rappel plutôt qu’une précision globale, qui semblerait élevée même si tous les cas sont manqués. Pour la correction au niveau des données, SMOTE est appliqué uniquement à l’ensemble d’apprentissage : pour chaque échantillon minoritaire, ses k voisins les plus proches (par défaut k = 5) sont identifiés et des échantillons synthétiques sont générés par interpolation entre l’échantillon et des voisins sélectionnés au hasard le long de vecteurs d’espace de caractéristiques. L’ensemble de formation désormais équilibré est utilisé pour former un classificateur forestier aléatoire comportant 500 arbres. Pour les remèdes algorithmiques, la pondération des classes attribue des poids inversement proportionnels aux fréquences de classe – un poids de 10 pour la classe minoritaire si elle représente 10 % des données. Le déplacement du seuil est appliqué en analysant les seuils de décision de 0,1 à 0,9 sur l’ensemble de validation pour maximiser le score F1. Dans un exemple concret, ces techniques ont été appliquées pour prédire les réactions indésirables aux médicaments à partir des données de pharmacovigilance, où les événements indésirables ne sont survenus que dans 2 % des cas. SMOTE, combiné à la pondération des classes, a augmenté le rappel pour la classe minoritaire de 12 % à 78 % tout en maintenant une précision de 85 %, permettant une détection efficace des signaux pour les événements rares liés à la sécurité des médicaments. Une autre application consiste à détecter les gènes de résistance aux antibiotiques dans les données métagénomiques, où les déterminants de la résistance sont rares par rapport au contenu total des gènes, mais pourtant crucials sur le plan clinique à identifier. ### Candidatures
Des méthodes de données déséquilibrées sont indispensables pour détecter des sous-types de cancer rares dans les études de biochimie du cancer, identifier des marqueurs exprimés différentiellement à partir des données puces à ADN et expression génétique, découvrir des gènes de résistance dans la génétique bactérienne et prédire la pathogénicité de variantes rares dans la microbiologie clinique. Ces techniques garantissent que les modèles d’apprentissage automatique restent sensibles à la classe minoritaire, permettant ainsi la découverte de signaux biologiques vraiment rares.