概述
生物数据可视化弥合了原始定量数据和人类解释之间的差距。现代高通量技术生成包含数千到数百万个测量值的数据集,使得有效的可视化对于假设生成、质量控制和通信至关重要。良好的可视化可以揭示仅凭汇总统计数据无法捕获的模式、异常值和关系,而较差的可视化可能会产生误导和模糊不清。该领域借鉴感知心理学、图形设计和计算机科学的原理来创建与人类视觉系统处理信息的方式相一致的表示。
关键概念
数据墨水比率和图表垃圾是基本的设计考虑因素。数据墨水比率由爱德华·塔夫特(Edward Tufte)推广,衡量图形墨水中用于显示数据与装饰元素的比例。最大化该比率会产生更清晰的数字。 颜色编码必须考虑色觉缺陷;像 ColorBrewer 这样的工具可以帮助选择视觉上统一且易于访问的调色板。 尺度和变换:对数尺度、归一化轴和多维尺度,可以揭示隐藏在原始测量中的结构。密集散点图中的过度绘制可以通过透明度、六边形分箱或核密度估计来解决。
应用程序
可视化渗透到生物学研究的每个阶段。在探索性分析过程中,DNA 微阵列和基因表达 数据的散点图和热图可识别差异表达的基因。在流式细胞术 中,双变量点图和密度图根据表面标记揭示细胞群。结构生物学家使用带状图和表面表示来表达[蛋白质结构](/guides/ Protein-struct.html)。来自单细胞测序和蛋白质组学的高维数据越来越依赖于 t-SNE 和 UMAP 等降维图来进行可视化。
绘图类型和最佳实践
对于基因组学数据,最常见的绘图类型每种都有特定的用途。 火山图显示差异表达结果:x 轴显示 log2 倍数变化,y 轴显示 -log10 调整后的 p 值,水平线标记显着性阈值,垂直线标记倍数变化截止值。高于两个阈值的点是显着差异表达的基因。 MA 图(平均值与比率)是 RNA-seq 数据的首选,因为它们揭示了强度依赖性偏差:x 轴显示平均表达量,y 轴显示对数倍数变化,平均表达量低的基因表现出较高的方差。 具有层次聚类的热图非常适合可视化跨样本的表达模式:行是基因,列是样本,颜色强度代表表达水平(通常是 Z 分数)。用表型元数据(治疗、时间点、组织)注释列,用功能类别注释行,以揭示特定组的模式。对于转录组学,标准化读取计数与单个数据点重叠的条形图显示基因水平表达变化,同时传达生物变异性。对于基因组学,曼哈顿图显示跨染色体的 GWAS 结果,突出显示超出全基因组显着性线的基因座。在所有情况下,请遵循设计原则:使用传达结果的最小数据墨水比率,避免扭曲感知的 3D 效果,为连续变量选择顺序配色方案,为分类变量选择定性方案,并始终用单位清楚地标记轴。例如,精心设计的 MA 图应显示重要基因的红点,将运行平均值显示为蓝色黄土曲线,并在插图中包含上调和下调基因的总数,使读者能够一目了然地评估实验的生物学结果和技术质量。