Descripción general
El alineamiento de secuencias es la operación fundamental de la bioinformática, que consiste en colocar dos o más secuencias biológicas una al lado de la otra para identificar regiones de similitud que pueden reflejar relaciones funcionales, estructurales o evolutivas. La alineación por pares compara exactamente dos secuencias y constituye la base para la búsqueda en bases de datos, el diseño de cebadores y la inferencia filogenética. El problema de alineación se resuelve mediante algoritmos de programación dinámica (Needman-Wunsch para alineación global y Smith-Waterman para alineación local) que encuentran la ruta de puntuación óptima a través de una matriz de penalizaciones de coincidencias, desajustes y brechas.
Conceptos clave
Las alineaciones se clasifican en globales o locales. La alineación global fuerza la alineación en toda la longitud de ambas secuencias y es más apropiada para secuencias estrechamente relacionadas de longitud similar. La alineación local identifica regiones cortas y conservadas y es ideal para detectar dominios compartidos entre secuencias divergentes. Las matrices de sustitución como BLOSUM62 y PAM250 proporcionan puntuaciones de probabilidades logarítmicas para cada posible reemplazo de aminoácidos, mientras que las alineaciones de ADN suelen utilizar puntuaciones simples de coincidencia/no coincidencia. Las penalizaciones por espacios vacíos (a menudo una combinación de una penalización por apertura de espacios y una penalización por extensión de espacios) desalientan las inserciones o eliminaciones excesivas. Las herramientas heurísticas como BLAST trade garantizaban la optimización de la velocidad al sembrar alineaciones con coincidencias exactas de palabras.
Aplicaciones
La alineación por pares se utiliza a diario en biología molecular. Respalda el diseño de cebadores de reacción en cadena de la polimerasa al verificar la complementariedad del cebador y la plantilla, valida los resultados de secuenciación de ADN alineando lecturas con genomas de referencia e identifica residuos conservados en la predicción de estructura de proteínas. La genómica comparada se basa en la alineación para detectar la transferencia horizontal de genes en genética bacteriana, y el mapeo de sitios de restricción utiliza la alineación para predecir patrones de digestión con enzimas de restricción.
Protocolo práctico
Para la alineación global por pares usando EMBOSS Needle, prepare dos secuencias en formato FASTA: needle seq1.fasta seq2.fasta -gapopen 10 -gapextend 0.5 -outfile Needle_output.txt. La penalización por apertura de brecha (10 para proteínas, 10 a 15 para nucleótidos) penaliza la introducción de una nueva brecha, mientras que la penalización por extensión de brecha (0,5 para proteínas, 0,5 a 1,0 para nucleótidos) penaliza la extensión de una brecha existente. Las sanciones por apertura de brechas más altas producen menos brechas y más largas; Las sanciones más bajas permiten muchas brechas cortas. Para alineación local con EMBOSS Water: water seq1.fasta seq2.fasta -gapopen 10 -gapextend 0.5 -outfile water_output.txt. Water encuentra la región de mayor similitud entre dos secuencias, ideal para detectar dominios conservados en secuencias que de otro modo serían divergentes. El resultado incluye la alineación con símbolos de coincidencia/no coincidencia (| para idéntico, : para conservador, . para semiconservador, espacio para no conservador), puntuaciones de alineación y porcentaje de identidad. Elija sabiamente las matrices de sustitución: BLOSUM62 es el valor predeterminado para la mayoría de las alineaciones de proteínas y es adecuado para secuencias que comparten entre un 30% y un 70% de identidad. BLOSUM80 funciona mejor para secuencias estrechamente relacionadas (>80% de identidad), mientras que BLOSUM45 es más sensible para relaciones distantes (<30% de identidad). Para la alineación del ADN, utilice la matriz EDNAFULL con coincidencia=1, falta de coincidencia=0 para secuencias estrechamente relacionadas, o coincidencia=1, falta de coincidencia=-1 con mayores penalizaciones de brecha para comparaciones entre especies. Ajuste los parámetros de forma iterativa: si la alineación no es biológicamente significativa (por ejemplo, alinear regiones no relacionadas), aumente las penalizaciones por brecha. Utilice la JVM de algas o la plataforma web Galaxy para ejecutar herramientas EMBOSS sin acceso a la línea de comandos. Para alineamientos por pares por lotes, utilice las variantes needlem. o waterm (múltiples) con un archivo de secuencia de secuencias de consulta contra un único objetivo.
recurso: Lab Lexicon Sequence Aligner