Descripción general
La visualización de datos biológicos cierra la brecha entre los datos cuantitativos sin procesar y la interpretación humana. Las tecnologías modernas de alto rendimiento generan conjuntos de datos con miles o millones de mediciones, lo que hace que la visualización eficaz sea esencial para la generación de hipótesis, el control de calidad y la comunicación. Las buenas visualizaciones revelan patrones, valores atípicos y relaciones que las estadísticas resumidas por sí solas no pueden capturar, mientras que las malas pueden inducir a error y oscurecer. El campo se basa en principios de la psicología de la percepción, el diseño gráfico y la informática para crear representaciones que se alineen con la forma en que el sistema visual humano procesa la información.
Conceptos clave
Relación de tinta de datos y chartjunk son consideraciones de diseño fundamentales. La relación datos-tinta, popularizada por Edward Tufte, mide la proporción de tinta de un gráfico dedicada a mostrar datos versus elementos decorativos. Maximizar esta relación produce cifras más claras. La codificación de colores debe tener en cuenta las deficiencias en la visión del color; herramientas como ColorBrewer ayudan a seleccionar paletas perceptualmente uniformes y accesibles. Escalas y transformaciones (escalas logarítmicas, ejes normalizados y escalamiento multidimensional) pueden revelar estructuras ocultas en mediciones sin procesar. El sobregráfico en diagramas de dispersión densos se aborda mediante transparencia, agrupamiento hexagonal o estimación de la densidad del núcleo.
Aplicaciones
La visualización impregna todas las etapas de la investigación biológica. Durante el análisis exploratorio, los diagramas de dispersión y los mapas de calor de los datos de microarrays de ADN y expresión genética identifican genes expresados diferencialmente. En citometría de flujo, los diagramas de puntos bivariados y los diagramas de densidad revelan poblaciones celulares basadas en marcadores de superficie. Los biólogos estructurales utilizan diagramas de cinta y representaciones de superficies para comunicar estructura proteica. Los datos de alta dimensión procedentes de la secuenciación unicelular y la proteómica se basan cada vez más en gráficos de reducción de dimensionalidad como t-SNE y UMAP para su visualización.
Tipos de trama y mejores prácticas
Para los datos genómicos, los tipos de gráficos más comunes tienen cada uno un propósito específico. Gráficos de volcán muestran resultados de expresión diferencial: el eje x muestra el cambio log2, el eje y muestra el valor p ajustado -log10, con líneas horizontales que marcan los umbrales de significancia y las líneas verticales marcan los límites de cambio. Los puntos por encima de ambos umbrales son genes expresados de manera significativamente diferencial. Se prefieren los gráficos MA (media frente a relación) para los datos de secuencia de ARN porque revelan un sesgo dependiente de la intensidad: el eje x muestra la expresión promedio, el eje y muestra el cambio logarítmico y los genes con expresión promedio baja exhiben una mayor varianza. Los mapas de calor con agrupación jerárquica son ideales para visualizar patrones de expresión entre muestras: las filas son genes, las columnas son muestras y la intensidad del color representa el nivel de expresión (normalmente puntuaciones Z). Anote columnas con metadatos fenotípicos (tratamiento, momento, tejido) y filas con categorías funcionales para revelar patrones específicos de grupo. Para la transcriptómica, los gráficos de barras de recuentos de lecturas normalizados con puntos de datos individuales superpuestos muestran cambios de expresión a nivel genético al tiempo que comunican la variabilidad biológica. En el caso de la genómica, los gráficos de Manhattan muestran los resultados de GWAS en todos los cromosomas, destacando los loci que exceden la línea de significación de todo el genoma. En todos los casos, siga los principios de diseño: utilice la proporción de datos-tinta más pequeña que comunique el resultado, evite efectos 3D que distorsionen la percepción, elija esquemas de color secuenciales para variables continuas y esquemas cualitativos para variables categóricas, y etiquete siempre los ejes claramente con unidades. Un gráfico MA bien diseñado, por ejemplo, debería mostrar puntos rojos para genes significativos, mostrar la media móvil como una curva de loess azul e incluir el número total de genes regulados hacia arriba y hacia abajo en una etiqueta insertada, lo que permitirá al lector evaluar tanto el resultado biológico como la calidad técnica del experimento de un solo vistazo.