Skip to content

Article image
Bioinformática proteómica: análisis de datos de proteínas

May 16, 2026 · Updated: May 25, 2026

Descripción general

La bioinformática proteómica es la disciplina computacional que transforma datos sin procesar de espectrometría de masas en conocimiento biológico sobre proteínas. Aborda la inmensa complejidad del proteoma: miles de proteínas, cada una de las cuales potencialmente porta múltiples modificaciones postraduccionales, variantes de empalme y productos de degradación. El campo desarrolla algoritmos para la identificación de péptidos, inferencia de proteínas, cuantificación y validación estadística. Al convertir señales espectrales en proteínas identificadas y cuantificadas, la bioinformática proteómica permite a los investigadores plantear preguntas a nivel de sistemas sobre la función celular, los mecanismos de las enfermedades y las respuestas a los fármacos.

Conceptos clave

Un elemento central de este campo es el paradigma de búsqueda en bases de datos, donde se comparan espectros de masas experimentales en tándem con espectros teóricos derivados de una base de datos de secuencias de proteínas. Algoritmos como SEQUEST, Mascot y MS-GF+ asignan coincidencias de espectro de péptidos (PSM) utilizando funciones de puntuación que tienen en cuenta las series de iones de fragmentos y la masa de precursores. La estimación de la tasa de descubrimiento falso (FDR) mediante la búsqueda de señuelos de objetivos controla la tasa de error de las identificaciones. La inferencia de proteínas aborda el problema de los péptidos compartidos (péptidos comunes a múltiples proteínas) utilizando principios de parsimonia y enfoques bayesianos.

Protocolo práctico

Un flujo de trabajo práctico de búsqueda de bases de datos comienza con la carga de archivos de espectrometría de masas sin procesar (.raw, .wiff o .d) en MaxQuant o Proteome Discoverer. El investigador especifica la base de datos de secuencias de proteínas, generalmente el proteoma humano o de ratón UniProt al que se le añaden contaminantes comunes como queratinas y tripsina. La tripsina se establece como la enzima de digestión que permite omitir hasta dos escisiones. La tolerancia de masa del precursor se establece en 10 ppm para datos de Orbitrap y la tolerancia de masa de fragmentos en 0,5 Da para trampa de iones o 20 ppm para Orbitrap. La carbamidometilación de cisteína se establece como una modificación fija; oxidación de metionina y acetilación N-terminal como modificaciones variables. La tasa de descubrimiento falso se controla utilizando una base de datos de señuelo objetivo: una base de datos señuelo de secuencias invertidas se concatena a la base de datos objetivo y las coincidencias de espectro de péptido se filtran al 1% de FDR a nivel de péptido. La inferencia de proteínas utiliza el principio de parsimonia: se informa el conjunto mínimo de proteínas que explican todos los péptidos identificados. Las intensidades de cuantificación sin etiquetas (LFQ) se calculan a partir de la suma de las corrientes iónicas extraídas de los péptidos asignados. La tabla de grupos de proteínas resultante se exporta para pruebas estadísticas en Perseus o R. Por ejemplo, en un estudio que compara el tejido hepático sano y fibrótico, esta tubería identificó 4500 proteínas con un 98 % de completitud en seis réplicas biológicas. Más de 300 proteínas eran diferencialmente abundantes, incluidas proteínas de la matriz extracelular validadas como biomarcadores de fibrosis mediante ensayos independientes basados en anticuerpos. El mismo flujo de trabajo se aplica habitualmente en proteómica clínica para la clasificación de subtipos de tumores a partir de muestras de tejido FFPE.

Aplicaciones

La bioinformática proteómica se aplica en el descubrimiento de biomarcadores, donde se extrae la expresión diferencial de proteínas entre tejidos sanos y enfermos en busca de candidatos para el diagnóstico. Apoya la identificación del objetivo del fármaco al perfilar los cambios en la abundancia de proteínas tras el tratamiento con compuestos. El campo también impulsa la caracterización de modificaciones postraduccionales y se integra con los flujos de trabajo de proteómica y espectrometría de masas. Los datos de los experimentos de espectrometría de masas se procesan a través de canales que también incorporan resultados de extracción y purificación de proteínas para garantizar que la calidad de la muestra se refleje en el análisis final.