DNA 微阵列可以同时测量数千个基因的表达水平,提供细胞转录活动的全基因组视图。它们使研究人员能够比较不同条件、组织或疾病状态之间的基因表达,从而彻底改变了功能基因组学。
微阵列原理
DNA 微阵列由数千个微观点组成,每个点都包含特定 DNA 序列的探针,附着在载玻片或硅芯片等固体表面上。每个探针都设计用于与特定目标 mRNA 或 cDNA 序列杂交。探针的整个集合代表了正在分析的基因组。
基本实验包括从感兴趣的样品中提取 RNA,用逆转录酶将其转化为互补 DNA,用荧光染料标记 cDNA,并将标记的 cDNA 与微阵列杂交。洗掉非特异性结合的物质后,测量每个点的荧光强度,指示原始样品中每种 mRNA 的量。
双色数组
在双色微阵列实验中,两种条件下的 RNA 用不同的荧光染料(通常是 Cy3 和 Cy5)进行标记。将标记的 cDNA 混合并杂交到单个阵列上。每个点的 Cy5 与 Cy3 荧光的比率反映了两种条件下每个基因的相对表达水平。双色设计可以控制点与点之间的变化,但会引入染料偏差,需要进行染料交换实验。
单通道阵列
单通道阵列(例如 Affymetrix GeneChips)使用单一荧光标记。每个样品都与单独的阵列杂交。基因表达以绝对强度测量,并在归一化后在阵列之间进行比较。单通道阵列对于多重比较具有更高的吞吐量,但需要强大的归一化方法来减少阵列之间的差异。 Affymetrix 阵列对每个基因使用多个探针,其中包含完美匹配和错配探针,以区分特定杂交与背景。
数据标准化
微阵列数据需要大量的预处理。背景校正去除非特异性杂交中的信号。标准化根据阵列之间的技术差异进行调整。假设大多数基因没有差异表达,分位数归一化使探针强度的分布在阵列中相同。稳健的多阵列平均值结合了每个基因的多个探针的背景校正、归一化和汇总。
差异表达分析
标准化后,统计测试可识别不同条件下表达发生显着变化的基因。在 limma 包中实现的有调节的 t 检验借用了基因间的信息来稳定方差估计。使用 Benjamini-Hochberg 方法进行多重测试校正控制错误发现率。结果通常报告为调整后的 p 值的倍数变化。倍数变化高于阈值且调整后的 p 值低于 0.05 的基因被视为差异表达。
聚类和分类
无监督聚类根据表达相似性对基因或样本进行分组,无需先验知识。层次聚类产生树状图,其中具有相似表达谱的基因被分组在一起。 K 均值聚类将基因划分为指定数量的簇。这些方法可以揭示共同调控的基因组和新的样本亚型。
监督分类使用已知样本标签来构建可以对未知样本进行分类的预测器。应用支持向量机、随机森林和最近邻分类器。基因表达特征可以对癌症亚型进行分类、预测预后并指导治疗选择。 PAM50 特征将乳腺癌分为具有不同预后的分子亚型。
应用程序
微阵列几乎已应用于生物学的每个领域。癌症研究使用微阵列对肿瘤进行分类、识别预后特征并发现药物靶点。 MammaPrint 和 Oncotype DX 乳腺癌检测使用基因表达特征来预测复发风险。发育生物学研究驱动分化的转录程序。毒理学使用微阵列进行毒物基因组分析。当用于比较基因组杂交时,微阵列还可以检测拷贝数变异。
局限性和向 RNA-Seq 的过渡
微阵列具有局限性,包括依赖预定义的探针序列、有限的动态范围以及无法检测新的转录物或剪接变体。 [RNA 测序](/guides/rna-sequencing.html) 是[下一代测序](/guides/next- Generation-sequencing.html) 的关键应用,已在很大程度上取代了用于基因表达分析的微阵列。 RNA-seq 提供具有更高灵敏度和动态范围的数字计数数据,检测新的转录本和亚型,并且不需要预定义的探针。然而,微阵列对于特征明确的生物体和标准化平台具有优势的临床应用仍然有用。