Visão geral
A descoberta do motivo é a identificação computacional de padrões de sequência curtos e recorrentes em sequências de DNA, RNA ou proteínas que correspondem a elementos funcionais, como locais de ligação de fatores de transcrição, junções de splice, locais de reconhecimento de proteínas de ligação a RNA ou domínios de interação de proteínas. Ao contrário do alinhamento global, a descoberta de motivos concentra-se em pequenas janelas – normalmente de 6 a 20 nucleotídeos ou de 3 a 15 aminoácidos – onde a conservação posicional é alta mesmo quando a sequência circundante diverge. Esses motivos são frequentemente representados como matrizes de peso de posição (PWMs) que capturam a frequência de cada nucleotídeo ou aminoácido em cada posição.
Métodos
Uma variedade de algoritmos aborda a descoberta de motivos. Métodos baseados em consenso enumeram todas as palavras possíveis e relatam aquelas que ocorrem com mais frequência do que o esperado por acaso. Abordagens probabilísticas, como MEME, usam maximização de expectativa para ajustar um modelo de mistura que separa sequências contendo motivos das sequências de fundo. Os métodos de amostragem de Gibbs, implementados em ferramentas como o BioProspector, pesquisam estocasticamente o espaço de sequência para encontrar padrões sobre-representados. A pegada filogenética explora a conservação de espécies relacionadas para identificar elementos reguladores sob seleção purificadora. A imunoprecipitação da cromatina seguida de sequenciamento (ChIP-seq) fornece regiões de pico derivadas experimentalmente que orientam a descoberta de motivos para loci genômicos relevantes.
Aplicativos
A descoberta do motivo é fundamental para a compreensão da regulação genética e da epigenética. Ele identifica os locais de ligação para fatores de transcrição que controlam transcrição e processamento de RNA. Na biologia sintética, os motivos descobertos são usados para projetar promotores sintéticos com forças de expressão previsíveis. A análise de estrutura e topologia do DNA revela que certos motivos formam preferencialmente estruturas secundárias, como G-quadruplexes que regulam a transcrição e a replicação.
Protocolo Prático
O MEME Suite fornece um fluxo de trabalho abrangente de descoberta de motivos de novo. Comece preparando um arquivo FASTA de regiões promotoras (por exemplo, 500 pb a montante dos locais de início da transcrição) para genes co-regulados identificados a partir de dados de RNA-seq ou ChIP-seq. Execute MEME (EM múltiplo para elicitação de motivos): meme promoters.fasta -dna -oc meme_output -mod anr -nmotifs 5 -minw 6 -maxw 20 -revcomp. Parâmetros: -mod anr (qualquer número de repetições por sequência), -nmotifs 5 (encontre os 5 principais motivos), -minw 6 / -maxw 20 (faixa de largura do motivo). MEME gera motivos como matrizes de peso de posição (PWMs) com valores E para cada motivo. Examine o relatório HTML MEME mostrando logotipos de sequências de motivos, ocorrências por sequência e tendência posicional. Para descoberta de motivos discriminativos (comparando dois conjuntos de sequências), use DREME: dreme -p positivo.fasta -n negativo.fasta -dna -oc dreme_output. DREME é mais rápido para encontrar motivos centrais curtos (4–8 pb) típicos de locais de ligação de fatores de transcrição. Para análise de enriquecimento de motivos em regiões de pico ChIP-seq, use AME (Analysis of Motif Enrichment): ame --control peaks_background.fasta peaks.fasta motivos_database.meme -o ame_output. Use um banco de dados de motivos selecionados, como JASPAR ou HOCOMOCO. Para digitalizar sequências para correspondências de motivos conhecidos, use FIMO: fimo --oc fimo_output --thresh 1e-4 JASPAR2022_CORE_non-redundant.meme promoters.fasta. FIMO gera todas as correspondências com valores p e valores q (corrigidos por FDR). Valide os motivos descobertos comparando com perfis de ligação de fatores de transcrição conhecidos usando TomTom: tomtom meme_output/meme.txtknown_motifs.meme -o tomtom_output. O Tomtom atribui cada motivo de consulta à sua correspondência mais próxima no banco de dados com um valor E relatado.
recurso: Lab Lexicon Motif Scanner