Skip to content

Article image
Alineación de secuencias múltiples: comparación de tres o más secuencias

May 16, 2026 · Updated: May 25, 2026

Descripción general

La alineación de secuencias múltiples (MSA) alinea tres o más secuencias biológicas para identificar regiones conservadas compartidas en toda una familia. Mientras que la alineación por pares revela similitud entre dos secuencias, MSA captura la profundidad evolutiva de un grupo homólogo, destacando residuos que se han mantenido durante millones de años. Estas posiciones conservadas suelen ser críticas para la estructura, la catálisis o la regulación. MSA es el requisito previo para la construcción de árboles filogenéticos, la identificación de dominios de proteínas y la generación de logotipos de secuencias que visualizan patrones de conservación.

Conceptos clave

La alineación progresiva, implementada en Clustal Omega y MUSCLE, construye un MSA construyendo primero un árbol guía a partir de distancias por pares y luego alineando iterativamente las secuencias más estrechamente relacionadas. Los métodos iterativos refinan la alineación inicial realineando subconjuntos para mejorar la puntuación del objetivo general. Las herramientas basadas en la coherencia como T-Coffee incorporan información de alineaciones por pares frente a una tercera secuencia para mejorar la precisión. Para conjuntos de datos muy grandes, MAFFT utiliza transformadas rápidas de Fourier para acelerar la alineación. Las métricas de evaluación de calidad, como la puntuación de la suma de pares y la puntuación de la columna, evalúan la confiabilidad de la alineación, y las herramientas de recorte eliminan las regiones mal alineadas antes del análisis posterior.

Aplicaciones

MSA es indispensable para la genómica comparativa de genética bacteriana, donde identifica genes conservados en cepas patógenas. Mejora la sensibilidad de la búsqueda de homología en proyectos de secuenciación de ADN y revela residuos funcionalmente importantes en la predicción de estructura de proteínas. En biología evolutiva, MSA proporciona la información de secuencias múltiples necesaria para la inferencia filogenética bayesiana y de máxima verosimilitud, lo que permite la reconstrucción de secuencias ancestrales y la datación de eventos de especiación.

Protocolo práctico

Para una proteína MSA con MAFFT, prepare un archivo FASTA de secuencias homólogas (por ejemplo, a partir de resultados de BLAST u OrthoFinder). Ejecute MAFFT con la estrategia L-INS-i, la más precisa para <200 secuencias: mafft --localpair --maxiterate 1000 input.fasta > alineado.fasta. Para conjuntos de datos más grandes (200–1000 secuencias), utilice la estrategia FFT-NS-2: mafft --retree 2 --maxiterate 2 input.fasta > alineado.fasta. Para conjuntos de datos muy grandes (>1000 secuencias), utilice el algoritmo PartTree: mafft --parttree input.fasta > alineado.fasta. Para alineamientos de nucleótidos, use mafft --nuc --adjustdirection input.fasta > alineado.fasta para manejar cadenas de complemento inverso. Alternativamente, ejecute MUSCLE v5: muscle -align input.fasta -output alineado.fasta. Evalúe la calidad de la alineación mediante inspección visual utilizando Jalview: cargue el archivo FASTA alineado, coloree según el esquema ClustalX (resaltando las posiciones conservadas) y examine el histograma de conservación. Recorte las regiones mal alineadas con trimAl: trimal -in alineado.fasta -out trimmed.fasta -automated1 que selecciona automáticamente el umbral de recorte óptimo según las características de la alineación. Para un recorte más estricto, utilice -gt 0.1 (elimine las columnas con espacios en >10% de las secuencias) o -resoverlap 0.75 -seqoverlap 80 para el método heurístico automatizado2. Calcule las estadísticas resumidas de alineación con esl-alistat de la suite HMMER: esl-alistat alineado.fasta. Genere un logotipo de secuencia con WebLogo o el paquete R ggseqlogo para visualizar la conservación de aminoácidos de posición específica. Convierta la alineación al formato PHYLIP para inferencia filogenética: sed -e 's/>//' alineado.fasta | pegar - - | awk '{imprimir $1, $2}' > alineado.phy. Ejecute IQ-TREE para obtener una inferencia de árbol de máxima verosimilitud: iqtree -s alineado.phy -m MFP -bb 1000 -nt AUTO.