Skip to content

Article image
Alinhamento de sequências: comparação de pares de sequências biológicas

May 16, 2026 · Updated: May 25, 2026

Visão geral

O alinhamento de sequências é a operação fundamental da bioinformática, colocando duas ou mais sequências biológicas lado a lado para identificar regiões de similaridade que podem refletir relações funcionais, estruturais ou evolutivas. O alinhamento em pares compara exatamente duas sequências e forma a base para pesquisa em banco de dados, design de primers e inferência filogenética. O problema de alinhamento é resolvido por algoritmos de programação dinâmica, Needleman-Wunsch para alinhamento global e Smith-Waterman para alinhamento local, que encontram o caminho de pontuação ideal através de uma matriz de penalidades de correspondência, incompatibilidade e lacuna.

Conceitos-chave

Os alinhamentos são classificados como globais ou locais. Alinhamento global força o alinhamento em todo o comprimento de ambas as sequências e é mais apropriado para sequências estreitamente relacionadas de comprimento semelhante. O alinhamento local identifica regiões curtas e conservadas e é ideal para detectar domínios compartilhados entre sequências divergentes. Matrizes de substituição como BLOSUM62 e PAM250 fornecem pontuações de log-odds para cada possível substituição de aminoácidos, enquanto os alinhamentos de DNA normalmente usam pontuações simples de correspondência/incompatibilidade. As penalidades de lacuna – muitas vezes uma combinação de uma penalidade de abertura de lacuna e de extensão de lacuna – desencorajam inserções ou exclusões excessivas. Ferramentas heurísticas como o BLAST trade garantiram a otimização da velocidade ao semear alinhamentos com correspondências exatas de palavras.

Aplicativos

O alinhamento em pares é usado diariamente em biologia molecular. Ele sustenta o design do primer da reação em cadeia da polimerase verificando a complementaridade do modelo do primer, valida os resultados do sequenciamento de DNA alinhando leituras com genomas de referência e identifica resíduos conservados na previsão da estrutura da proteína. A genômica comparativa depende do alinhamento para detectar transferência horizontal de genes em genética bacteriana, e o mapeamento de locais de restrição usa alinhamento para prever padrões de digestão com enzimas de restrição.

Protocolo Prático

Para alinhamento global pareado usando EMBOSS Needle, prepare duas sequências no formato FASTA: needle seq1.fasta seq2.fasta -gapopen 10 -gapextend 0.5 -outfile Needle_output.txt. A penalidade de abertura de lacuna (10 para proteínas, 10–15 para nucleotídeos) penaliza a introdução de uma nova lacuna, enquanto a penalidade de extensão de lacuna (0,5 para proteínas, 0,5–1,0 para nucleotídeos) penaliza a extensão de uma lacuna existente. Penalidades de abertura de lacunas mais altas produzem lacunas menores e mais longas; penalidades mais baixas permitem muitos intervalos curtos. Para alinhamento local com EMBOSS Water: water seq1.fasta seq2.fasta -gapopen 10 -gapextend 0.5 -outfile water_output.txt. Water encontra a região de maior similaridade entre duas sequências, ideal para detectar domínios conservados em sequências divergentes. A saída inclui o alinhamento com símbolos de correspondência/incompatibilidade (| para idêntico, : para conservador, . para semiconservador, espaço para não conservador), pontuações de alinhamento e porcentagem de identidade. Escolha as matrizes de substituição com sabedoria: BLOSUM62 é o padrão para a maioria dos alinhamentos de proteínas e é adequado para sequências que compartilham 30–70% de identidade. BLOSUM80 funciona melhor para sequências intimamente relacionadas (>80% de identidade), enquanto BLOSUM45 é mais sensível para relacionamentos distantes (<30% de identidade). Para alinhamento de DNA, use a matriz EDNAFULL com correspondência = 1, incompatibilidade = 0 para sequências intimamente relacionadas ou correspondência = 1, incompatibilidade = -1 com penalidades de lacuna mais altas para comparações entre espécies. Ajuste os parâmetros iterativamente: se o alinhamento não for biologicamente significativo (por exemplo, alinhando regiões não relacionadas), aumente as penalidades de lacuna. Use a JVM de algas marinhas ou a plataforma web Galaxy para executar ferramentas EMBOSS sem acesso à linha de comando. Para alinhamentos em pares em lote, use as variantes needlem. ou waterm (múltiplas) com um arquivo de sequência de sequências de consulta em um único destino.


recurso: Lab Lexicon Sequence Aligner