Visión General
El aprendizaje profundo extiende las redes neuronales clásicas apilando muchas capas ocultas, permitiendo el aprendizaje automático de representaciones jerárquicas a partir de datos crudos o mínimamente procesados. En bioinformática, este enfoque ha demostrado ser transformador para tipos de datos con estructura espacial o secuencial inherente, secuencias de ADN, estructuras de proteínas e imágenes biomédicas. Los modelos profundos descubren características relevantes directamente de los datos, evitando la necesidad de ingeniería de características manual que tradicionalmente dominaba el campo.
Métodos
Las redes neuronales convolucionales (CNN) aplican filtros deslizantes para detectar patrones locales como motivos de unión de factores de transcripción en secuencias o características estructurales en mapas de contacto de proteínas. Las redes neuronales recurrentes (RNN) y sus variantes con compuertas (LSTM, GRU) modelan dependencias secuenciales y se utilizan para predecir la estructura secundaria del ARN y la localización de proteínas. Las arquitecturas Transformer con mecanismos de autoatención, ejemplificadas por AlphaFold y DNABERT, capturan interacciones de largo alcance y han establecido nuevos estándares en la predicción de estructuras de proteínas y la genómica regulatoria. Las redes neuronales de grafos operan sobre grafos moleculares para la predicción de propiedades de fármacos. El entrenamiento de estos modelos requiere grandes conjuntos de datos etiquetados, aceleración GPU y técnicas como dropout y normalización por lotes para evitar el sobreajuste.
Protocolo Práctico
Un flujo de trabajo típico de aprendizaje profundo para bioinformática basada en secuencias comienza con el preprocesamiento de datos. Para una tarea de predicción de sitios de empalme, el investigador recopila un conjunto balanceado de secuencias de sitios de empalme verdaderos y falsos (típicamente 200–500 nucleótidos centrados en el límite exón-intrón) de bases de datos públicas como ENSEMBL o GENCODE. Cada secuencia se codifica one-hot en una matriz binaria de forma (4, longitud_secuencia). Los datos se dividen en conjuntos de entrenamiento, validación y prueba (ej., 70/15/15). Se construye un modelo CNN en un framework como PyTorch o TensorFlow: una capa de entrada que coincide con las dimensiones de la secuencia codificada, dos o tres capas convolucionales 1D con 64–128 filtros de tamaño de kernel 8–12 y activación ReLU, seguidas de max-pooling y dropout (tasa 0.3–0.5). Los mapas de características se aplanan y pasan a través de una capa densa con 64 unidades antes de una capa de salida softmax final. El modelo se compila con el optimizador Adam (tasa de aprendizaje 0.001) y se entrena hasta 100 épocas con parada temprana, usando tamaños de lote de 32–64. Después del entrenamiento, el modelo alcanza más del 95% de precisión en datos de prueba no vistos y se puede aplicar a todo el genoma para predecir nuevos sitios de empalme. Este enfoque se ha utilizado con éxito para identificar sitios de empalme crípticos en genomas de cáncer, revelando mutaciones que crean o interrumpen señales de empalme y contribuyen a la tumorigénesis. La misma arquitectura se generaliza a la predicción de sitios de unión de factores de transcripción usando datos de ChIP-seq de ENCODE y la identificación de sitios diana de microARN. En un estudio emblemático, los investigadores utilizaron una CNN para predecir especificidades de proteínas de unión a ARN a partir de datos CLIP-seq, logrando puntuaciones AUROC superiores a 0.93 y revelando motivos de unión previamente desconocidos asociados con trastornos neurológicos.
Aplicaciones
El aprendizaje profundo impulsa las predicciones precisas de AlphaFold de estructura de proteínas, interpreta lecturas de secuenciación de ADN para la detección de variantes y deconvoluciona patrones de expresión complejos de ensayos de microarrays de ADN y expresión génica. También permite el análisis de células individuales, el descubrimiento de fármacos y el diagnóstico de imágenes médicas, estableciéndose como una piedra angular de la biología computacional moderna.