Descripción general
La visualización interactiva permite a los investigadores explorar datos biológicos de forma dinámica en lugar de visualizar gráficas estáticas de forma pasiva. Al permitir hacer zoom, desplazarse, cepillar, filtrar y vistas vinculadas, las herramientas interactivas permiten a los usuarios consultar datos desde múltiples perspectivas en tiempo real. Este enfoque exploratorio es especialmente valioso para conjuntos de datos de gran dimensión y gran escala donde las preguntas no están completamente definidas de antemano. Las tecnologías web modernas (D3.js, Plotly, Bokeh y Shiny) han hecho accesible una interactividad sofisticada sin conocimientos de programación especializados.
Conceptos clave
Vincular y cepillar conecta varias vistas del mismo conjunto de datos: al seleccionar puntos en un diagrama de dispersión se resaltan las filas correspondientes en una tabla o regiones en un mapa de calor. El filtrado dinámico permite a los usuarios subconjuntos de datos estableciendo umbrales de variables numéricas o seleccionando grupos categóricos, y todas las visualizaciones se actualizan al instante. La representación de nivel de detalle maneja datos grandes mostrando representaciones agregadas con un zoom bajo y puntos individuales con un zoom alto. La representación del lado del cliente frente a la del lado del servidor determina la escalabilidad: las herramientas basadas en web, como los navegadores genómicos, a menudo utilizan la representación en mosaico del lado del servidor para conjuntos de datos del genoma completo.
Aplicaciones
La visualización interactiva transforma la forma en que los investigadores trabajan con datos de alto rendimiento. En el análisis de microarrays de ADN y expresión genética, los mapas de calor interactivos permiten a los usuarios agrupar genes y muestras mientras ajustan dinámicamente las escalas de color. Los proyectos de secuenciación de próxima generación se benefician de navegadores genómicos interactivos que superponen múltiples pistas experimentales. La exploración de datos de Proteómica y espectrometría de masas utiliza diagramas de dispersión interactivos y diagramas de volcanes donde los usuarios pueden hacer clic en puntos individuales para recuperar identificaciones de péptidos.
Protocolo práctico
Para crear un diagrama de dispersión interactivo de los resultados de PCA usando Plotly, comience con una matriz de expresión genética como un DataFrame de pandas. Ejecute PCA usando sklearn.decomposition.PCA: ajuste el modelo en la matriz de expresión transpuesta (muestras x genes), luego extraiga los primeros tres componentes principales. Cree un DataFrame con valores de PC1, PC2, PC3 más metadatos de muestra (por ejemplo, condición, lote, tipo de tejido). En Plotly Express, llame a px.scatter_3d(data_frame, x='PC1', y='PC2', z='PC3', color='condition', hover_name='sample_id') para generar un diagrama de dispersión 3D interactivo. El resultado es una visualización totalmente interactiva: los usuarios pueden rotar el gráfico arrastrándolo, pasar el cursor sobre cualquier punto para ver el nombre de la muestra y las coordenadas, y activar o desactivar grupos haciendo clic en la leyenda. Para Bokeh, el equivalente es: from bokeh.plotting import figure, show; p = figure(); p.scatter('PC1', 'PC2', source=data, color='condition'), con show(p) lanzando una página HTML interactiva con información sobre herramientas de desplazamiento, zoom y desplazamiento. Por ejemplo, un conjunto de datos de RNA-seq unicelular de 10.000 células se puede visualizar como un gráfico t-SNE o UMAP interactivo: el investigador colorea las células según el tipo de célula inferido y luego pasa el cursor sobre las células individuales para mostrar los 5 genes expresados principales. Seleccione un grupo de interés utilizando la herramienta de selección de cuadro para dibujar un rectángulo a su alrededor, luego subdivida los datos y vuelva a agruparlos para descubrir subpoblaciones. El cepillado vinculado conecta el diagrama de dispersión con un mapa de calor de genes marcadores: al seleccionar un grupo se actualiza inmediatamente el mapa de calor para mostrar la expresión genética promedio de ese grupo, revelando la firma transcripcional que define cada población celular.