Skip to content

Article image
Manejo de datos desequilibrados en la investigación biomédica

May 16, 2026 · Updated: May 25, 2026

Descripción general

Los datos desequilibrados se producen cuando el número de muestras de una clase supera con creces a las demás, un desafío generalizado en la investigación biomédica. La prevalencia de la enfermedad suele ser baja, por lo que los conjuntos de datos contienen muchos más controles sanos que casos; las reacciones adversas a los medicamentos son raras; y los elementos genómicos funcionales son escasos en todo el genoma. Los clasificadores estándar entrenados con datos desequilibrados tienden a favorecer a la clase mayoritaria, logrando una alta precisión simplemente prediciendo la etiqueta más común y omitiendo por completo la clase minoritaria. Se requieren técnicas especializadas para producir modelos que detecten eventos raros pero importantes.

Métodos

Los enfoques a nivel de datos modifican la distribución del conjunto de entrenamiento. El submuestreo aleatorio elimina muestras de clases mayoritarias, pero corre el riesgo de descartar información útil. Técnica de sobremuestreo de minorías sintéticas (SMOTE) genera muestras de minorías sintéticas interpolando entre instancias de minorías existentes. Los enfoques a nivel de algoritmo ajustan el proceso de aprendizaje: la ponderación de clase asigna penalizaciones más altas a las clasificaciones erróneas de minorías en la función de pérdida, y el aprendizaje sensible a los costos incorpora directamente los costos de clasificación errónea. Los métodos de conjunto como bosques aleatorios equilibrados y EasyEnsemble combinan submuestreo con embolsado. El movimiento del umbral cambia el límite de decisión después de la capacitación para favorecer el retiro de las minorías. La evaluación debe basarse en curvas de recuperación de precisión o en una precisión equilibrada en lugar de en una precisión general, lo que resulta engañoso en condiciones de desequilibrio.

Protocolo práctico

Un flujo de trabajo práctico para manejar datos biomédicos desequilibrados comienza con la evaluación de la distribución de clases. En un conjunto de datos típico de enfermedades raras, los casos pueden constituir sólo entre el 5% y el 10% de las muestras, lo que crea un desequilibrio grave de 90:10 o 95:5. El investigador primero establece una línea de base entrenando un clasificador de regresión logística simple sobre los datos sin procesar y evaluando con precisión equilibrada y curvas de recuperación de precisión en lugar de precisión general, que parecería alta incluso si se omiten todos los casos. Para la corrección a nivel de datos, SMOTE se aplica solo al conjunto de entrenamiento: para cada muestra minoritaria, se identifican sus k vecinos más cercanos (predeterminado k = 5) y se generan muestras sintéticas interpolando entre la muestra y los vecinos seleccionados aleatoriamente a lo largo de vectores de espacio de características. El conjunto de entrenamiento ahora equilibrado se utiliza para entrenar un clasificador forestal aleatorio con 500 árboles. Para las soluciones algorítmicas, la ponderación de clases asigna ponderaciones inversamente proporcionales a las frecuencias de las clases: una ponderación de 10 para la clase minoritaria si representa el 10% de los datos. El movimiento del umbral se aplica escaneando los umbrales de decisión de 0,1 a 0,9 en el conjunto de validación para maximizar la puntuación F1. En un ejemplo del mundo real, estas técnicas se aplicaron para predecir reacciones adversas a medicamentos a partir de datos de farmacovigilancia, donde los eventos adversos ocurrieron en solo el 2% de los casos. SMOTE, combinado con la ponderación de clases, aumentó la recuperación de la clase minoritaria del 12 % al 78 % y, al mismo tiempo, mantuvo una precisión del 85 %, lo que permitió una detección eficaz de señales para eventos raros de seguridad de medicamentos. Otra aplicación es la detección de genes de resistencia a antibióticos en datos metagenómicos, donde los determinantes de resistencia son raros en comparación con el contenido total de genes, pero su identificación es clínicamente crucial.

Aplicaciones

Los métodos de datos desequilibrados son indispensables para detectar subtipos de cáncer raros en estudios de bioquímica del cáncer, identificar marcadores expresados diferencialmente a partir de datos de microarrays de ADN y expresión genética, descubrir genes de resistencia en genética bacteriana y predecir la patogenicidad de variantes raras en microbiología clínica. Estas técnicas garantizan que los modelos de aprendizaje automático sigan siendo sensibles a la clase minoritaria, lo que permite el descubrimiento de señales biológicas verdaderamente raras.