Visão geral
A análise de dados de espectrometria de massa é o pipeline computacional que converte arquivos espectrais brutos de espectrômetros de massa em listas de peptídeos e proteínas identificados e quantificados. Os dados brutos passam por etapas de pré-processamento – filtragem de ruído, centróide, atribuição de estado de carga e seleção de pico – antes que a identificação do peptídeo seja tentada. A qualidade e a profundidade da lista final de proteínas dependem criticamente tanto do método de aquisição quanto da estratégia computacional empregada. Experimentos proteômicos modernos geram rotineiramente milhões de espectros, tornando essenciais canais de análise robustos e automatizados para extrair significado biológico dos dados.
Métodos
Pesquisa em banco de dados compara espectros de massa experimentais em tandem com espectros teóricos gerados in silico a partir de um banco de dados de sequências de proteínas. Mecanismos de busca como SEQUEST, Andromeda e Comet usam correlação cruzada ou pontuação baseada em probabilidade para classificar correspondências de espectro de peptídeos. Sequenciamento de novo reconstrói sequências peptídicas diretamente do espectro sem um banco de dados, o que é valioso para organismos com genomas não sequenciados ou para identificar novos peptídeos. Abordagens híbridas, como pesquisa de biblioteca espectral, correspondem a espectros previamente identificados e validados, oferecendo maior sensibilidade para peptídeos conhecidos. Todos os métodos exigem estimativa rigorosa de taxa de descoberta falsa, normalmente usando estratégias de alvo-isca.
Protocolo Prático
Um pipeline prático de análise de dados para quantificação sem rótulos começa com arquivos espectrais brutos de uma aquisição DDA. A primeira etapa de pré-processamento converte arquivos brutos específicos do fornecedor em formatos abertos como mzML usando a ferramenta msConvert do ProteoWizard. A coleta de pico detecta picos centralizados a partir de dados de modo de perfil, identificando máximos locais e ajustando o envelope isotópico. A filtragem de ruído remove picos abaixo de um limite de sinal-ruído de 2. Os estados de carga são atribuídos pela desconvolução de padrões isotópicos usando algoritmos como Decon2LS. O alinhamento do tempo de retenção é essencial para a quantificação cruzada: o algoritmo MaxLFQ alinha os cromatogramas identificando características peptídicas comuns entre as execuções e aplicando mudanças não lineares no tempo de retenção. Após o alinhamento, as correspondências de características são estabelecidas - o mesmo peptídeo é rastreado em todas as execuções, combinando seu m/z, carga e tempo de retenção alinhado dentro de janelas de 10 ppm e 1 minuto. Valores faltantes, comuns em experimentos sem rótulo, são imputados usando a imputação de k-vizinhos mais próximos ou imputação censurada à esquerda, assumindo que os valores faltantes representam peptídeos abaixo do limite de detecção. A matriz final de intensidades peptídicas entre amostras é normalizada usando normalização de estabilização de variância e submetida a testes estatísticos, como testes limma ou t com correção de múltiplos testes. Um exemplo do mundo real: este pipeline foi aplicado para analisar o proteoma de 200 amostras de líquido cefalorraquidiano de pacientes com doença de Alzheimer, identificando 50 proteínas consistentemente desreguladas, incluindo fragmentos de tau e peptídeos beta-amilóide. A mesma abordagem é usada na proteômica plasmática para descobrir biomarcadores candidatos à detecção precoce do câncer de ovário em grandes coortes de pacientes.
Aplicativos
A análise de dados de espectrometria de massa é fundamental para todos os experimentos proteômicos. Ele suporta a identificação de proteínas separadas por SDS-PAGE, eletroforese de zona capilar ou HPLC e é o mecanismo computacional por trás da moderna proteômica e massa espectrometria. fluxos de trabalho. A proteômica clínica depende desses pipelines analíticos para descobrir candidatos a biomarcadores, enquanto os avanços na instrumentação da espectrometria de massa continuam a impulsionar o desenvolvimento de novos algoritmos para uma interpretação de dados mais rápida e precisa.