Skip to content

Article image
Selección de Características en Bioinformática

May 16, 2026

Visión General

La selección de características es el proceso de identificar las variables de entrada más relevantes para la construcción de modelos predictivos. En bioinformática, los conjuntos de datos a menudo contienen decenas de miles de características (genes, variantes, metabolitos) en relativamente pocas muestras, un escenario conocido como la maldición de la dimensionalidad. Reducir este espacio de características mitiga el sobreajuste, acelera el entrenamiento y produce modelos más interpretables que pueden revelar directamente los mecanismos biológicos subyacentes. Las herramientas computacionales implementan una variedad de estrategias de selección que se adaptan a diferentes escalas de datos y objetivos biológicos.

Métodos

Los métodos de filtro clasifican las características independientemente del modelo de aprendizaje utilizando medidas estadísticas como la correlación de Pearson, la información mutua, la prueba χ² o el ANOVA. Los métodos envolventes evalúan subconjuntos de características entrenando y evaluando iterativamente un modelo, empleando búsqueda hacia adelante, eliminación hacia atrás o eliminación recursiva de características. Los métodos integrados realizan la selección de características durante el entrenamiento del modelo a través de la regularización LASSO o Ridge, o mediante puntuaciones de importancia de características derivadas de árboles de decisión. Los enfoques de reducción de dimensionalidad como PCA, t-SNE y UMAP transforman las características originales en un espacio de dimensiones inferiores, a menudo reteniendo la máxima varianza mientras pierden una interpretabilidad directa.

Protocolo Práctico

Un flujo de trabajo de selección de características para datos de expresión génica comienza con una matriz normalizada de 20.000 genes por 200 muestras. El investigador primero filtra los genes con baja varianza, eliminando aquellos con varianza por debajo del percentil 10 en todas las muestras, reduciendo el espacio a aproximadamente 10.000 genes. Se aplica una prueba t moderada o ANOVA de una vía, y los genes se clasifican por valor p. El LASSO con regularización L1 se ejecuta usando validación cruzada de 10 pliegues para seleccionar el valor óptimo de lambda, eligiendo típicamente lambda.1se para obtener un modelo escaso con menos características. Las características seleccionadas, a menudo 30–50 genes, se examinan en busca de relevancia biológica mediante enriquecimiento de ontología génica y comparación con la literatura. Se entrena una máquina de vectores de soporte (SVM) usando solo las características seleccionadas, alcanzando típicamente una precisión de clasificación del 85–90% en datos de validación externos en comparación con el 70–75% cuando se usan todas las características. La eliminación recursiva de características con SVM confirma la clasificación: la precisión comienza a disminuir después de eliminar los 25 genes principales, validando la importancia del subconjunto seleccionado. Las 10 características principales se visualizan en un mapa de calor con anotaciones de grupos, y se calculan las razones de probabilidad para cada característica para proporcionar información procesable a los colaboradores biólogos. Un ejemplo de ello es un estudio de subtipificación del cáncer de mama en el que la selección de características redujo un panel de 500 genes a 14 genes de firma, logrando una sensibilidad y especificidad superiores al 90% en muestras de biopsia independientes. El panel de 14 genes fue validado mediante qPCR en 500 muestras clínicas adicionales, demostrando que los genes seleccionados capturaban vías biológicas clave, proliferación, respuesta inmune y metabolismo de estrógenos, y se correlacionaban con los resultados de supervivencia del paciente.

Aplicaciones

La selección de características identifica paneles de biomarcadores para el diagnóstico de enfermedades a partir de datos de microarrays de ADN y qPCR, prioriza variantes causales en estudios de asociación del genoma completo (GWAS) y reduce las dimensiones de la imagen en el análisis de microscopía e histopatología.