Skip to content

Article image
Reducción de dimensionalidad para biología de alta dimensión

May 16, 2026 · Updated: May 25, 2026

Descripción general

La reducción de dimensionalidad asigna datos de alta dimensión (donde cada muestra tiene miles o decenas de miles de características medidas) en un espacio de baja dimensión, generalmente dos o tres dimensiones, que preserva una estructura importante. Esto tiene dos propósitos principales: visualización, que permite a los investigadores ver patrones, grupos y valores atípicos a simple vista; y eliminación de ruido, eliminando variaciones irrelevantes que degradan el análisis posterior. Los datos biológicos, desde matrices de expresión genética hasta espectros de masas, son inherentemente de alta dimensión y, a menudo, redundantes, lo que hace que la reducción de dimensionalidad sea un paso de preprocesamiento esencial.

Métodos

Análisis de componentes principales (PCA) encuentra ejes ortogonales de máxima varianza a través de combinaciones lineales de las características originales. Es rápido, determinista y ampliamente utilizado para la exploración inicial. Incrustación de vecinos estocásticos distribuidos en t (t-SNE) construye una distribución de probabilidad sobre similitudes por pares en un espacio de alta dimensión y minimiza la divergencia de Kullback-Leibler a un mapa de baja dimensión, sobresaliendo en revelar estructuras y grupos locales. Proyección y aproximación de colector uniforme (UMAP) se basa en principios similares pero preserva mejor la estructura global y es significativamente más rápido. Los codificadores automáticos utilizan redes neuronales para aprender incrustaciones no lineales y pueden capturar variedades complejas. Cada método tiene hiperparámetros (perplejidad para t-SNE, n_neighbors para UMAP) que influyen fuertemente en la visualización resultante.

Protocolo práctico

Un flujo de trabajo práctico de reducción de dimensionalidad para datos de secuenciación de ARN unicelular comienza con una matriz de recuento de genes por células. Después del filtrado de calidad, la normalización y la transformación logarítmica, se seleccionan los 2000 genes más variables. Primero se aplica PCA para reducir la matriz de aproximadamente 20.000 dimensiones a 50 componentes principales, capturando la variación dominante y eliminando el ruido técnico. El investigador inspecciona la varianza explicada mediante un diagrama de pedregal y normalmente retiene los 20 a 30 componentes principales para el análisis posterior. Estas coordenadas reducidas por PCA sirven como entrada para UMAP. Se establecen los hiperparámetros clave: n_neighbors = 15, min_dist = 0,1 y n_components = 2. Se traza la incrustación de UMAP, y cada celda está coloreada según marcadores de tipo de celda conocidos, asignación de agrupamiento o condición experimental. Interpretar la trama implica identificar poblaciones de células distintas como nubes de puntos aisladas, trayectorias continuas que sugieren vías de diferenciación y células atípicas que pueden representar dobletes o poblaciones raras. t-SNE se puede utilizar como una alternativa para una estructura local más fina, aunque UMAP preserva mejor las relaciones globales. Por ejemplo, en un estudio de células mononucleares de sangre periférica, este proyecto reveló 22 tipos distintos de células inmunitarias a partir de una única ejecución de 10x Genomics, incluidos subconjuntos raros de células dendríticas que comprenden menos del 1% de la población total. En la investigación del cáncer, la reducción de la dimensionalidad de los datos de tumores unicelulares ha descubierto poblaciones subclonales distintas con diferentes capacidades proliferativas y sensibilidades a los medicamentos, lo que guía estrategias de tratamiento personalizadas.

Aplicaciones

La reducción de dimensionalidad es una práctica estándar para explorar datos de micromatrices de ADN y expresión genética, visualizar poblaciones celulares en citometría de flujo e inspeccionar la calidad en experimentos de proteómica y espectrometría de masas. Los canales de análisis de secuencia de ARN unicelular utilizan habitualmente PCA para la eliminación de ruido inicial seguido de UMAP para la visualización, lo que permite el descubrimiento de nuevos tipos y estados de células a partir de datos transcriptómicos.