概述
UniProt(通用蛋白质资源)是世界领先的蛋白质序列和功能信息存储库。它由一个联盟维护,该联盟包括欧洲生物信息学研究所 (EMBL-EBI)、瑞士生物信息学研究所 (SIB) 和蛋白质信息资源 (PIR)。 UniProt 整合了来自基因组测序项目、文献整理和计算预测的数据,以提供每种已知蛋白质的单一、全面的视图。它的三个主要组件,UniProtKB、UniRef 和 UniParc,满足不同的分析需求。
关键概念
UniProt 知识库 (UniProtKB) 分为两个部分:Swiss-Prot 包含手动整理、审阅的条目,以及来自文献的详细注释; TrEMBL 包含等待人工审核的计算分析条目。 UniRef 以不同的同一性水平(100%、90%、50%)对蛋白质序列进行聚类,以减少冗余并加速序列相似性搜索。 UniParc 是一个全面的、非冗余的存档,可跟踪主要源数据库中的所有蛋白质序列。每个 UniProtKB 条目包括序列、功能信息、亚细胞位置、翻译后修饰、域和位点以及对其他数据库的交叉引用。
应用程序
UniProt 是大多数生物信息学工作流程的主要蛋白质参考。研究人员使用它来检索序列以进行[蛋白质结构](/guides/ Protein-Structure.html)预测,通过数据库搜索来识别蛋白质组学和质谱实验中的蛋白质,并查找功能注释,例如用于代谢途径研究的酶分类和命名法。
实用协议
要从 UniProtKB 检索特定蛋白质序列,请导航至 uniprot.org 并在搜索栏中输入基因名称、蛋白质名称或登录号(例如 TP53 或 P04637)。结果页面显示带有注释分数的匹配条目。单击条目即可查看完整记录:序列将显示在“序列”部分,只需单击即可使用 FASTA 格式。对于批量检索,请使用“检索/ID 映射”工具 - 粘贴添加或基因名称列表,选择源数据库(例如 UniProtKB AC/ID),然后选择目标格式(FASTA、制表符分隔或 GFF)。该工具还可以映射 200 多个外部数据库中的标识符。对于保守域分析,获取检索到的 FASTA 序列并将其提交给 InterProScan(集成在 UniProt 中)或 NCBI CD-Search。结果将突出显示保守结构域、活性位点和结合区域,甚至为未表征的蛋白质提供功能见解。例如,将宏基因组样本中的假设蛋白质提交给 UniProt BLAST 可能会揭示与已知脂肪酶的同源性,而 InterProScan 会确认 α/β 水解酶折叠和催化三联体 - 立即表明其生化功能。这种检索和分析相结合的工作流程将 UniProt 从静态序列存储库转变为用于新型蛋白质功能注释的发现平台。实际使用:在 COVID-19 大流行期间,研究人员使用 UniProt 快速获取 SARS-CoV-2 刺突蛋白序列并绘制其受体结合域图,加速结构研究和疫苗设计 - 展示了 UniProt 如何成为快速大流行应对研究的关键起点。