Skip to content

Article image
蛋白质组学中的质谱数据分析

May 16, 2026 · Updated: May 25, 2026

概述

质谱数据分析是一种计算管道,它将来自质谱仪的原始光谱文件转换为已识别和定量的肽和蛋白质列表。在尝试进行肽鉴定之前,原始数据经过预处理步骤 - 噪声过滤、质心、电荷态分配和峰值选取。最终蛋白质列表的质量和深度主要取决于采集方法和所采用的计算策略。现代蛋白质组学实验通常会生成数百万个光谱,这使得强大的自动化分析流程对于从数据中提取生物学意义至关重要。

方法

数据库搜索将实验串联质谱与从蛋白质序列数据库中通过计算机生成的理论光谱进行匹配。 SEQUEST、Andromeda 和 Comet 等搜索引擎使用互相关或基于概率的评分来对肽谱匹配进行排名。 从头测序无需数据库即可直接从谱图重建肽序列,这对于具有未测序基因组的生物体或识别新肽非常有价值。 光谱库搜索等混合方法与之前识别和验证的光谱相匹配,为已知肽提供更高的灵敏度。所有方法都需要严格的错误发现率估计,通常使用目标诱饵策略。

实用协议

用于无标记定量的实用数据分析流程从 DDA 采集的原始光谱文件开始。第一个预处理步骤使用 ProteoWizard 的 msConvert 工具将供应商特定的原始文件转换为开放格式,例如 mzML。峰值拾取通过识别局部最大值并拟合同位素包络来从剖面模式数据中检测质心峰值。噪声过滤可去除低于信噪比阈值 2 的峰值。电荷态是通过使用 Decon2LS 等算法对同位素模式进行去卷积来分配的。保留时间对齐对于交叉运行定量至关重要:MaxLFQ 算法通过识别运行中的常见肽特征并应用非线性保留时间偏移来对齐色谱图。比对后,建立特征对应关系 - 通过在 10 ppm 和 1 分钟的窗口内匹配其 m/z、电荷和比对保留时间,在所有运行中跟踪相同的肽。缺失值在无标记实验中很常见,使用 k 最近邻插补或左删失插补假设缺失值代表低于检测限的肽来进行插补。使用方差稳定归一化对样品中肽强度的最终矩阵进行归一化,并进行统计测试,例如具有多重测试校正的 limma 或 t 检验。一个真实的例子:该流程用于分析阿尔茨海默病患者的 200 份脑脊液样本的蛋白质组,识别出 50 种持续失调的蛋白质,包括 tau 片段和淀粉样β肽。同样的方法也用于血浆蛋白质组学中,以发现候选生物标志物,以便在大型患者群体中早期检测卵巢癌。

应用程序

质谱数据分析是每个蛋白质组学实验的基础。它支持通过 SDS-PAGE、[毛细管区带电泳](/guides/capillary-zone- electrophoresis) 或 HPLC 分离的蛋白质进行鉴定,并且是现代蛋白质组学和质谱 工作流程背后的计算引擎。临床蛋白质组学依靠这些分析流程来发现候选生物标志物,而质谱仪器的进步继续推动新算法的开发,以实现更快、更准确的数据解释。