概述
生物数据库是生物信息学的基础设施。他们收集、整理、组织和分发现代实验生物学产生的大量分子数据。这些数据库的范围从各个实验室维护的小型专业资源到包含数十亿核苷酸序列的 GenBank 等大型国际存储库。当任何单个数据集存储在公共数据库中时,它的价值都会成倍增加,因为它变得可发现、可重用并且可与其他数据类型集成。数据标准、受控词汇表以及数据库之间的交叉引用实现了这种互操作性。
关键概念
主要数据库存储原始实验数据,原始核苷酸序列、蛋白质序列和三维结构,以最少的解释。 辅助数据库包含通过分析主要数据构建的精选、注释或派生信息。 序列数据库(GenBank、UniProt)存储核苷酸和蛋白质序列。 结构数据库 (PDB) 存档大分子坐标。 功能数据库(GO、KEGG、Reactome)描述生物过程、途径和分子功能。 交叉引用跨数据库连接记录,从而实现集成查询。
应用程序
生物数据库几乎支持分子生物学的每个领域。研究人员使用它们检索DNA测序项目的序列、搜索同源[蛋白质结构](/guides/ Protein-struct.html),并查找酶分类和命名法以进行代谢重建。数据库集成对于系统生物学至关重要,必须结合多个来源的数据来构建细胞行为的预测模型。
实用协议
选择正确的数据库首先要定义您的研究问题。如果您需要原始核苷酸序列,请通过 NCBI 门户使用 GenBank 等主要数据库。对于带注释的参考基因组,请切换到 RefSeq。如果您的问题涉及蛋白质功能,UniProtKB 是合适的资源,而结构问题则指向 PDB。对于典型的基因组学项目(例如,识别细菌基因组中的新基因),常见的工作流程如下:首先,使用生物体名称查询 NCBI 的基因组数据库来定位装配。下载 GenBank 或 FASTA 格式的核苷酸序列。将这些序列提交至 BLASTX,对照 UniProtKB/Swiss-Prot 数据库,以根据同源性预测蛋白质编码区。使用 InterProScan 将生成的注释映射到 GO 术语,以推断分子功能和生物过程。最后,使用KEGG Mapper将注释的基因放置到代谢途径图上,揭示生物体的代谢能力。这种集成方法将原始序列数据转化为可测试的生物学假设。同样的跨数据库策略也适用于人类基因组学:从 RNA-seq 中的差异表达基因列表开始,研究人员可以从 UCSC 检索启动子序列,使用 JASPAR 预测转录因子结合位点,将蛋白质产物映射到 Reactome 途径,并通过 STRING 验证相互作用 - 所有这些都是通过在通过交叉引用链接的适当数据库之间导航来实现的。掌握这种多数据库工作流程是现代生物信息学的核心能力,使研究人员能够从大量公开的生物数据中生成可靠、可重复的发现。