Skip to content

Article image
Aprendizaje supervisado para la clasificación biológica

May 16, 2026 · Updated: May 25, 2026

Descripción general

El aprendizaje supervisado utiliza un conjunto de datos de pares de entrada y salida (donde se conoce la respuesta correcta) para entrenar un modelo que pueda predecir la salida de entradas nuevas e invisibles. En bioinformática, este paradigma se relaciona naturalmente con problemas como clasificar una muestra de tejido como cancerosa o sana, predecir si una variante genética es patógena o asignar una función a una proteína no caracterizada. El modelo aprende los límites de decisión que separan las clases en el espacio de características, guiado por una función de pérdida que penaliza los errores de predicción.

Métodos

La regresión logística modela la probabilidad de pertenencia a una clase y sigue siendo una base para la clasificación binaria, especialmente cuando se valora la interpretabilidad. Máquinas de vectores de soporte construyen separadores de hiperplano con margen máximo y funcionan bien en entornos de alta dimensión típicos de los datos ómicos. Los bosques aleatorios agregan muchos árboles de decisión entrenados en muestras de arranque y proporcionan medidas integradas de importancia de las características. Los árboles potenciados por gradiente (XGBoost, LightGBM) corrigen de forma iterativa los errores de los predecesores y, a menudo, ganan competiciones de datos estructurados. Las redes neuronales con capas ocultas pueden aprender límites complejos no lineales, pero requieren más datos y una regularización cuidadosa. Todos los métodos se benefician del ajuste de ponderación de clases o del remuestreo cuando las clases están desequilibradas.

Protocolo práctico

Un flujo de trabajo de aprendizaje supervisado práctico para la clasificación de la expresión genética comienza con la carga de la matriz de expresión, donde las filas representan genes y las columnas representan muestras de pacientes. Los datos primero se normalizan utilizando recuentos por millón transformados logarítmicamente (log-CPM) o normalización cuantil. Un conjunto de datos típico puede contener 20.000 características genéticas en 100 muestras, lo que requiere una validación cuidadosa. El investigador divide los datos en conjuntos de entrenamiento (70%), validación (15%) y prueba (15%), preservando al mismo tiempo las proporciones de clase mediante la estratificación. En el conjunto de entrenamiento se entrena un clasificador de bosque aleatorio con 500 árboles. La validación cruzada quíntuple en el conjunto de entrenamiento evalúa la estabilidad: el modelo se ajusta en cuatro pliegues y se evalúa en el pliegue extendido, repetido cinco veces, lo que produce una precisión media validada cruzada. Después de confirmar que el rendimiento de la validación cruzada es aceptable, el modelo se vuelve a entrenar en el conjunto de entrenamiento completo y se evalúa una vez en el conjunto de pruebas retenido. Las puntuaciones de importancia de las características del bosque entrenado revelan qué genes discriminan más fuertemente las clases. Los 20 genes mejor clasificados se inspeccionan comparándolos con rutas biológicas conocidas mediante KEGG o análisis de enriquecimiento Reactome para verificar la plausibilidad mecanística. Este flujo de trabajo se ha utilizado para desarrollar firmas de pronóstico multigénicas para subtipos de cáncer de mama, donde un panel de 50 genes estratificó a los pacientes en grupos de riesgo con resultados de supervivencia significativamente diferentes. El mismo enfoque se aplica a la clasificación de fenotipos de respuesta a fármacos a partir de conjuntos de datos farmacogenómicos y a la predicción de variantes patogénicas a partir de características genómicas.

Aplicaciones

El aprendizaje supervisado clasifica patógenos bacterianos utilizando marcadores genómicos en genética bacteriana, predice el pronóstico del paciente en bioquímica del cáncer e identifica genes expresados diferencialmente a partir de datos de micromatrices de ADN y expresión genética. También potencia el apoyo a las decisiones clínicas al estratificar a los pacientes en grupos de riesgo y anotar elementos regulatorios en todo el genoma.