Skip to content

Article image
生物信息学深度学习

May 16, 2026 · Updated: May 25, 2026

概述

深度学习通过堆叠许多隐藏层来扩展经典神经网络,从而能够从原始或最少处理的数据中自动学习分层表示。在生物信息学中,这种方法已被证明对于具有固有空间或顺序结构的数据类型(DNA 序列、蛋白质结构和生物医学图像)具有变革性。深度模型直接从数据中发现相关特征,绕过了传统上主导该领域的手工特征工程的需要。

方法

卷积神经网络 (CNN) 应用滑动滤波器来检测局部模式,例如序列中的转录因子结合基序或蛋白质接触图中的结构特征。 循环神经网络 (RNN) 及其门控变体(LSTM、GRU)模拟顺序依赖性,并用于预测 RNA 二级结构和蛋白质定位。 具有自注意力机制的 Transformer 架构,以 AlphaFold 和 DNABERT 为例,捕获长程相互作用,并在蛋白质结构预测和调控基因组学方面树立了新标准。 图神经网络在分子图上运行以进行药物特性预测。训练这些模型需要大型标记数据集、GPU 加速以及 dropout 和批量归一化等技术来防止过度拟合。

实用协议

基于序列的生物信息学的典型深度学习工作流程从数据预处理开始。对于剪接位点预测任务,研究人员从 ENSEMBL 或 GENCODE 等公共数据库收集一组平衡的真假剪接位点序列(通常以外显子-内含子边界为中心的 200-500 个核苷酸)。每个序列都被 one-hot 编码为形状为 (4,sequence_length) 的二进制矩阵。数据分为训练集、验证集和测试集(例如 70/15/15)。 CNN 模型是在 PyTorch 或 TensorFlow 等框架中构建的:一个与编码序列维度匹配的输入层、两到三个一维卷积层,其中包含 64-128 个内核大小为 8-12 的滤波器和 ReLU 激活,然后是最大池化和 dropout(速率 0.3-0.5)。特征图被展平并在最终的 softmax 输出层之前通过具有 64 个单元的密集层。该模型使用 Adam 优化器(学习率 0.001)进行编译,并使用 32-64 的批量大小进行提前停止的最多 100 个 epoch 的训练。训练后,该模型对保留的测试数据的准确率达到 95% 以上,并且可以在全基因组范围内应用来预测新的剪接位点。这种方法已成功用于识别癌症基因组中的隐秘剪接位点,揭示产生或破坏剪接信号并导致肿瘤发生的突变。相同的架构可推广到使用 ENCODE ChIP-seq 数据和 microRNA 靶位点识别进行转录因子结合位点预测。在一项具有里程碑意义的研究中,研究人员使用 CNN 从 CLIP-seq 数据中预测 RNA 结合蛋白的特异性,获得了高于 0.93 的 AUROC 分数,并揭示了以前未知的与神经系统疾病相关的结合基序。

应用程序

深度学习为 AlphaFold 提供准确的[蛋白质结构](/guides/ Protein-struction.html)预测,解释DNA测序读数以进行变异检测,并对DNA微阵列和基因表达检测中的复杂表达模式进行解卷积。它还支持单细胞分析、药物发现和医学图像诊断,成为现代计算生物学的基石。