Skip to content

Article image
微阵列数据分析

May 16, 2026 · Updated: May 25, 2026

概述

微阵列数据分析将杂交微阵列的原始荧光强度转化为有意义的基因表达测量值。尽管 RNA-seq 已在很大程度上取代了基于发现的研究的微阵列,但由于其低成本、标准化方案和完善的分析流程,微阵列仍然广泛应用于临床诊断、植物育种和大群体研究。通过利用样本 cDNA 和固定探针之间的互补碱基配对,单个微阵列可以同时测量数万个转录物的表达。分析工作流程解决了微阵列数据的独特技术特征,包括背景校正、标准化和探针级汇总。

方法

微阵列分析从图像处理开始,以提取探针级强度。 背景校正 使用稳健的多阵列平均 (RMA) 或 GC 含量调整等方法去除非特异性信号。 归一化使数组具有可比性:分位数归一化是单色数组最常见的方法,而 loess 归一化适用于双色设计。 探针汇总(对于 Affymetrix 阵列,使用 RMA 或 PLIER)将每个基因的多个探针组合成单个表达值。 质量评估 使用伪图像、NUSE 图和 RLE 图来识别有问题的阵列。使用 limma 测试差异表达,它使用经验贝叶斯调节来稳定基因之间的方差估计。通过主成分分析检测批次效应,并使用 ComBat 或 limma 的 removeBatchEffect 进行校正。

应用程序

尽管测序兴起,微阵列仍在继续创造价值。 FDA 批准的 MammaPrint 和 Oncotype DX 测试使用微阵列来预测乳腺癌。临床 DNA 微阵列和基因表达 小组指导肿瘤学和罕见疾病诊断的治疗决策。微阵列数据分析还支持通过 qPCR 相关性研究验证 qPCR 结果,并通过大规模分析表达来补充 DNA 测序。在农业基因组学中,微阵列可以在大型育种群体中实现经济高效的性状作图和标记辅助选择。

实用协议

对于 R/Bioconductor 中的 Affymetrix 微阵列分析,首先使用“oligo”或“affy”包读取 CEL 文件。创建一个“ExpressionFeatureSet”:“data <- read.celfiles(list.celfiles())”。使用“eset <- rma(data)”一步执行 RMA 归一化,这会应用背景校正(信号和噪声分布的卷积)、跨阵列的分位数归一化以及通过中值抛光进行探针级汇总。生成的表达矩阵包含可供分析的 log2 转换值。使用“NUSE”(归一化非标度标准误差)和“RLE”(相对对数表达式)图评估阵列质量;应标记 NUSE 中位数高于 1.05 或 RLE 四分位数范围偏离标准的数组。差异表达测试使用“limma”:首先使用“fit <- lmFit(eset, design)”拟合线性模型,其中“design”是使用“model.matrix(~condition)”创建的模型矩阵。然后使用“fit2 <- eBayes(fit)”应用经验贝叶斯调节,并使用“topTable(fit2, coef = 2, number = Inf, adjustment = “BH”)”提取结果。输出包括对数倍数变化、平均表达、调节的 t 统计量、p 值和 Benjamini-Hochberg 调整的 p 值。对于双色数组,将“limma”与“normalizeWithinArrays”(loess 标准化)和“normalizeBetweenArrays”(尺度标准化)结合使用。 PCA 图中识别的批次效应可以使用“sva”包中的“ComBat(dat,batch)”进行校正。使用火山图、顶部差异表达探针的热图和 MA 图可视化结果,以检查强度依赖性偏差。使用特定于平台的注释包对基因探针进行注释(例如,用于人类基因组 U133 Plus 2.0 阵列的“hgu133plus2.db”)。