Descripción general
El análisis de datos de espectrometría de masas es el proceso computacional que convierte archivos espectrales sin procesar de espectrómetros de masas en listas de péptidos y proteínas identificados y cuantificados. Los datos sin procesar se someten a pasos de preprocesamiento (filtrado de ruido, centroide, asignación del estado de carga y selección de picos) antes de intentar la identificación de péptidos. La calidad y profundidad de la lista final de proteínas dependen fundamentalmente tanto del método de adquisición como de la estrategia computacional empleada. Los experimentos proteómicos modernos generan rutinariamente millones de espectros, lo que hace que los sistemas de análisis automatizados y robustos sean esenciales para extraer el significado biológico de los datos.
Métodos
Búsqueda en bases de datos compara espectros de masas en tándem experimentales con espectros teóricos generados in silico a partir de una base de datos de secuencias de proteínas. Los motores de búsqueda como SEQUEST, Andromeda y Comet utilizan correlación cruzada o puntuación basada en probabilidad para clasificar las coincidencias de espectro de péptidos. La secuenciación de novo reconstruye secuencias de péptidos directamente a partir del espectro sin una base de datos, lo cual es valioso para organismos con genomas no secuenciados o para identificar péptidos nuevos. Los enfoques híbridos, como la búsqueda en bibliotecas espectrales, coinciden con espectros previamente identificados y validados, lo que ofrece una mayor sensibilidad para péptidos conocidos. Todos los métodos requieren una estimación rigurosa de la tasa de descubrimiento falso, normalmente utilizando estrategias de señuelo de objetivo.
Protocolo práctico
Un proceso práctico de análisis de datos para la cuantificación sin etiquetas comienza con archivos espectrales sin procesar de una adquisición DDA. El primer paso de preprocesamiento convierte archivos sin formato específicos del proveedor a formatos abiertos como mzML utilizando la herramienta msConvert de ProteoWizard. La selección de picos detecta picos centroides a partir de datos en modo perfil identificando máximos locales y ajustando la envoltura isotópica. El filtrado de ruido elimina los picos por debajo de un umbral de señal a ruido de 2. Los estados de carga se asignan desconvolucionando patrones isotópicos utilizando algoritmos como Decon2LS. La alineación del tiempo de retención es esencial para la cuantificación cruzada: el algoritmo MaxLFQ alinea los cromatogramas identificando características peptídicas comunes en las series y aplicando cambios de tiempo de retención no lineales. Después de la alineación, se establecen correspondencias de características: se rastrea el mismo péptido en todas las ejecuciones haciendo coincidir su m/z, carga y tiempo de retención alineado dentro de ventanas de 10 ppm y 1 minuto. Los valores faltantes, comunes en experimentos sin etiquetas, se imputan mediante la imputación de k vecinos más cercanos o la imputación censurada por la izquierda, asumiendo que los valores faltantes representan péptidos por debajo del límite de detección. La matriz final de intensidades de péptidos en las muestras se normaliza mediante una normalización estabilizadora de la varianza y se somete a pruebas estadísticas como pruebas de limma o t con corrección de pruebas múltiples. Un ejemplo del mundo real: este proceso se aplicó para analizar el proteoma de 200 muestras de líquido cefalorraquídeo de pacientes con enfermedad de Alzheimer, identificando 50 proteínas constantemente desreguladas, incluidos fragmentos de tau y péptidos beta-amiloide. El mismo enfoque se utiliza en proteómica plasmática para descubrir biomarcadores candidatos para la detección temprana del cáncer de ovario en grandes cohortes de pacientes.
Aplicaciones
El análisis de datos de espectrometría de masas es fundamental para todo experimento de proteómica. Admite la identificación de proteínas separadas por SDS-PAGE, electroforesis de zona capilar, o HPLC, y es el motor computacional detrás de la [proteómica y espectrometría de masas] moderna (/guides/proteomics-and-mass-spectrometry.html) flujos de trabajo. La proteómica clínica se basa en estos procesos analíticos para descubrir candidatos a biomarcadores, mientras que los avances en la instrumentación de la espectrometría de masas continúan impulsando el desarrollo de nuevos algoritmos para una interpretación de datos más rápida y precisa.