Skip to content

Article image
Agrupamiento en Bioinformática: Descubriendo Grupos Naturales

May 16, 2026

Visión General

El agrupamiento es una técnica de aprendizaje no supervisado que particiona un conjunto de objetos en grupos, de modo que los objetos dentro del mismo grupo son más similares entre sí que con los de otros grupos. En bioinformática, el agrupamiento aborda preguntas exploratorias donde no existen etiquetas de referencia: descubrir nuevos subtipos de enfermedades, identificar módulos de genes coexpresados o detectar estructuras de comunidades microbianas. La calidad del agrupamiento depende críticamente de la medida de similitud y el algoritmo elegidos, y los resultados requieren validación biológica en lugar de métricas puramente estadísticas.

Métodos

K-means particiona los datos en un número predefinido de grupos minimizando la varianza dentro del grupo, es rápido y escalable pero asume grupos esféricos. El agrupamiento jerárquico construye un dendrograma de agrupaciones anidadas usando estrategias aglomerativas o divisivas, con la ventaja de que el número de grupos se puede elegir después de la inspección. DBSCAN identifica grupos como regiones densas separadas por áreas dispersas y maneja formas arbitrarias mientras detecta valores atípicos. Los modelos de mezcla gaussiana proporcionan asignaciones probabilísticas a grupos y pueden capturar grupos con diferentes tamaños y orientaciones. Para datos de alta dimensión, el agrupamiento a menudo va precedido de reducción de dimensionalidad. Los índices de validación interna como la puntuación de silueta y las medidas externas como el índice de Rand ajustado cuantifican la calidad del agrupamiento cuando hay datos de referencia disponibles.

Protocolo Práctico

Un flujo de trabajo práctico de agrupamiento comienza con una matriz de expresión génica normalizada de N muestras por P genes. El investigador primero aplica PCA para reducir la dimensionalidad a los 20 componentes principales principales, lo que elimina el ruido de los datos y acelera el cálculo posterior. Para el agrupamiento jerárquico, se calcula una matriz de distancia usando distancia euclidiana, y el método de enlace de Ward minimiza la varianza dentro del grupo al fusionar ramas. El dendrograma se inspecciona para decidir el número de grupos, buscando grandes distancias verticales entre fusiones como puntos de corte naturales. La puntuación de silueta se calcula para k de 2 a 10 para validar la elección, el k óptimo maximiza el ancho promedio de silueta. Para el agrupamiento k-means, el algoritmo se ejecuta con 20 inicializaciones aleatorias para evitar mínimos locales, y se selecciona la solución con la menor suma de cuadrados dentro del grupo. Los resultados se visualizan mediante un mapa de calor con dendrogramas de filas y columnas, o se proyectan en una incrustación UMAP coloreada por asignación de grupo. Sigue la validación biológica: los genes expresados diferencialmente entre grupos se identifican usando una prueba de suma de rangos de Wilcoxon, y los marcadores principales se comparan con firmas de tipos celulares conocidos de bases de datos como PanglaoDB o CellMarker. Un ejemplo concreto proviene de The Cancer Genome Atlas (TCGA), donde el agrupamiento por consenso de 5,000 muestras de tumores en 33 tipos de cáncer identificó nuevos subtipos moleculares con resultados de supervivencia distintos. En estudios de células individuales, el agrupamiento de 50,000 células de muestras de cerebro con enfermedad de Alzheimer reveló una nueva población de microglía asociada a la enfermedad con una firma transcripcional única vinculada a la neurodegeneración.

Aplicaciones

El agrupamiento identifica subtipos de cáncer a partir de perfiles de microarrays de ADN y expresión génica, delimita poblaciones celulares en datos de citometría de flujo y define unidades taxonómicas operativas en perfiles de comunidades microbianas de estudios de genética bacteriana. También revela módulos funcionales en redes de interacción proteína-proteína y agrupa pacientes por firmas moleculares para estrategias de tratamiento personalizado.