Skip to content

Article image
蛋白质组学生物信息学:分析蛋白质数据

May 16, 2026 · Updated: May 25, 2026

概述

蛋白质组学生物信息学是将原始质谱数据转化为有关蛋白质的生物学知识的计算学科。它解决了蛋白质组的巨大复杂性,数千种蛋白质,每种蛋白质都可能携带多种翻译后修饰、剪接变体和降解产物。该领域开发肽鉴定、蛋白质推断、定量和统计验证的算法。通过将光谱信号转换为已识别和定量的蛋白质,蛋白质组生物信息学使研究人员能够提出有关细胞功能、疾病机制和药物反应的系统级问题。

关键概念

该领域的核心是数据库搜索范式,其中将实验串联质谱与源自蛋白质序列数据库的理论光谱进行比较。 SEQUEST、Mascot 和 MS-GF+ 等算法使用考虑碎片离子系列和前体质量的评分函数来分配肽谱匹配 (PSM)。通过目标诱饵搜索进行的错误发现率 (FDR) 估计控制着识别的错误率。 蛋白质推断使用简约原则和贝叶斯方法解决共享肽(多种蛋白质共有的肽)的问题。

实用协议

实用的数据库搜索工作流程首先将原始质谱文件(.raw、.wiff 或 .d)加载到 MaxQuant 或 Proteome Discoverer 中。研究人员指定蛋白质序列数据库,通常是 UniProt 人类或小鼠蛋白质组,附加有角蛋白和胰蛋白酶等常见污染物。胰蛋白酶被设置为消化酶,允许最多两次错过切割。 Orbitrap 数据的母体质量容差设置为 10 ppm,离子阱的碎片质量容差设置为 0.5 Da,Orbitrap 的碎片质量容差设置为 20 ppm。半胱氨酸的脲甲基化被设定为固定修饰;蛋氨酸氧化和 N 末端乙酰化作为可变修饰。使用目标诱饵数据库控制错误发现率:反向序列的诱饵数据库连接到目标数据库,肽谱匹配在肽水平上过滤至 1% FDR。蛋白质推断使用简约原则,报告解释所有已识别肽的最小蛋白质集。无标记定量 (LFQ) 强度是根据指定肽的提取离子电流之和计算的。生成的蛋白质组表可导出,以便在 Perseus 或 R 中进行统计测试。例如,在一项比较健康肝组织和纤维化肝组织的研究中,该管道在六个生物重复中鉴定了 4,500 种蛋白质,完整性为 98%。超过 300 种蛋白质的丰度存在差异,包括使用独立的基于抗体的测定法验证为纤维化生物标志物的细胞外基质蛋白。相同的工作流程通常应用于临床蛋白质组学中,对 FFPE 组织样本的肿瘤亚型进行分类。

应用程序

蛋白质组学生物信息学应用于生物标志物发现,其中挖掘健康组织和患病组织之间的差异蛋白表达以寻找诊断候选物。它通过分析化合物治疗时蛋白质丰度的变化来支持药物靶点识别。该领域还支持翻译后修饰 的表征,并与蛋白质组学和质谱 工作流程集成。 质谱 实验中的数据通过管道进行处理,其中还包含[蛋白质提取和纯化](/guides/ Protein-extraction-and-purification.html) 的结果,以确保最终分析中反映样品质量。