Descripción general
El descubrimiento de motivos es la identificación computacional de patrones de secuencia cortos y recurrentes en secuencias de ADN, ARN o proteínas que corresponden a elementos funcionales como sitios de unión de factores de transcripción, uniones de empalme, sitios de reconocimiento de proteínas de unión a ARN o dominios de interacción de proteínas. A diferencia del alineamiento global, el descubrimiento de motivos se centra en ventanas pequeñas (normalmente de 6 a 20 nucleótidos o de 3 a 15 aminoácidos) donde la conservación posicional es alta incluso cuando la secuencia circundante diverge. Estos motivos a menudo se representan como matrices de peso de posición (PWM) que capturan la frecuencia de cada nucleótido o aminoácido en cada posición.
Métodos
Una variedad de algoritmos abordan el descubrimiento de motivos. Los métodos basados en consenso enumeran todas las palabras posibles e informan aquellas que aparecen con más frecuencia de lo esperado por casualidad. Los enfoques probabilísticos como MEME utilizan la maximización de expectativas para ajustarse a un modelo de mezcla que separa las secuencias que contienen motivos de las de fondo. Los métodos de muestreo de Gibbs, implementados en herramientas como BioProspector, buscan estocásticamente el espacio de secuencia para encontrar patrones sobrerrepresentados. La huella filogenética aprovecha la conservación de especies relacionadas para identificar elementos reguladores bajo la selección purificadora. La inmunoprecipitación de cromatina seguida de secuenciación (ChIP-seq) proporciona regiones máximas derivadas experimentalmente que guían el descubrimiento de motivos hacia loci genómicos relevantes.
Aplicaciones
El descubrimiento de motivos es fundamental para comprender la regulación genética y la epigenética. Identifica los sitios de unión para los factores de transcripción que controlan la transcripción y el procesamiento de ARN. En biología sintética, los motivos descubiertos se utilizan para diseñar promotores sintéticos con intensidades de expresión predecibles. El análisis de estructura y topología del ADN revela que ciertos motivos forman preferentemente estructuras secundarias como los cuádruplex G que regulan la transcripción y la replicación.
Protocolo práctico
MEME Suite proporciona un flujo de trabajo integral de descubrimiento de motivos de novo. Comience preparando un archivo FASTA de regiones promotoras (por ejemplo, 500 pb aguas arriba de los sitios de inicio de la transcripción) para genes corregulados identificados a partir de datos de RNA-seq o ChIP-seq. Ejecute MEME (EM múltiple para obtención de motivos): meme promotors.fasta -dna -oc meme_output -mod anr -nmotifs 5 -minw 6 -maxw 20 -revcomp. Parámetros: -mod anr (cualquier número de repeticiones por secuencia), -nmotifs 5 (buscar los 5 motivos principales), -minw 6 / -maxw 20 (rango de ancho de motivo). MEME genera motivos como matrices de peso de posición (PWM) con valores E para cada motivo. Examine el informe HTML de MEME que muestra logotipos de secuencias de motivos, apariciones por secuencia y sesgo posicional. Para el descubrimiento de motivos discriminativos (comparando dos conjuntos de secuencias), utilice DREME: dreme -p positivo.fasta -n negativo.fasta -dna -oc dreme_output. DREME es más rápido para encontrar motivos centrales cortos (4 a 8 pb) típicos de los sitios de unión de factores de transcripción. Para el análisis de enriquecimiento de motivos en regiones de picos de ChIP-seq, utilice AME (Análisis de enriquecimiento de motivos): ame --control picos_fondo.fasta picos.fasta motivo_database.meme -o ame_output. Utilice una base de datos de motivos seleccionada como JASPAR o HOCOMOCO. Para escanear secuencias en busca de coincidencias de motivos conocidos, utilice FIMO: fimo --oc fimo_output --thresh 1e-4 JASPAR2022_CORE_non-redundant.meme promotors.fasta. FIMO genera todas las coincidencias con valores p y valores q (corregidos por FDR). Valide los motivos descubiertos comparándolos con perfiles de unión de factores de transcripción conocidos utilizando TomTom: tomtom meme_output/meme.txtknown_motifs.meme -o tomtom_output. Tomtom asigna cada motivo de consulta a su coincidencia más cercana en la base de datos con un valor E informado.
recurso: Lab Lexicon Motif Scanner