Visão geral
A genômica comparativa é a análise de sequências genômicas de múltiplas espécies para identificar semelhanças e diferenças que revelam a história evolutiva, elementos funcionais conservados e adaptações específicas da linhagem. Ao alinhar e comparar genomas, os investigadores podem distinguir sequências que foram preservadas pela selecção natural – e que são, portanto, provavelmente funcionais – daquelas que derivam de forma neutra. A disponibilidade de milhares de genomas sequenciados, desde bactérias até humanos, tornou a genómica comparativa um poderoso motor para a descoberta biológica. Ele fornece a estrutura evolutiva essencial para a compreensão da estrutura e função do genoma.
Métodos
As principais técnicas de genômica comparativa incluem alinhamento do genoma completo, que identifica blocos sintênicos e rearranjos entre espécies. Ferramentas como MAUVE, MUMmer e LASTZ realizam alinhamentos em diferentes escalas. Filogenômica reconstrói árvores evolutivas usando dados de todo o genoma, em vez de genes únicos, fornecendo filogenias robustas de espécies. Atribuição de ortologia (usando ferramentas como OrthoFinder ou InParanoid) identifica genes que divergiram através de eventos de especiação, enquanto parálogos surgem de duplicações de genes dentro de uma linhagem. Análise de taxa evolutiva calcula proporções dN/dS para detectar genes sob seleção positiva ou purificadora. A análise de rastreamento de conservação em vários alinhamentos identifica elementos reguladores e RNAs não codificantes funcionais.
Aplicativos
A genômica comparativa iluminou aspectos-chave da biologia. Identificou 1% do genoma humano sob restrição evolutiva, destacando regiões reguladoras críticas. Ele traça a evolução da patogenicidade na genética bacteriana comparando cepas virulentas e não virulentas. Em virologia, a comparação da estrutura e classificação viral entre famílias revela mecanismos de replicação conservados. Abordagens comparativas sustentam a anotação de genomas recentemente sequenciados, transferindo conhecimento de organismos modelo bem estudados. À medida que os custos do sequenciamento de DNA continuam a cair, a genômica comparativa se torna cada vez mais poderosa, permitindo análises em nível populacional e até mesmo de pangenoma em milhares de indivíduos dentro de uma espécie.
Protocolo Prático
Para o alinhamento do genoma completo entre duas espécies, o MUMmer fornece alinhamento rápido por meio de correspondências únicas máximas (MUMs) baseadas em árvores de sufixos. Execute nucmer --maxmatch -p output reference.fasta query.fasta para gerar um arquivo delta. Filtre para alinhamentos confiáveis com delta-filter -l 1000 -i 90 output.delta > filtered.delta, exigindo alinhamentos de pelo menos 1000 pb com 90% de identidade. Converta em coordenadas e visualize com mummerplot: mummerplot -l -p saída filtrada.delta -R reference.fasta -Q query.fasta --postscript. Para análise de sintenia no nível cromossômico, use MCScanX em genomas anotados. Prepare os resultados do BLASTP entre todos os pares de proteínas de ambos os genomas: blastp -query query.pep -db reference.pep -outfmt 6 -out blast.out. Execute MCScanX para identificar blocos colineares: MCScanX ./blast_output. Examine gráficos de pontos de sintenia e visualizações de cariótipo com RIdeogram em R ou JCVI em Python (usando o módulo jcvi.graphics.karyotype). Para identificar elementos não codificantes conservados (CNEs), alinhe genomas com LASTZ ou WGA e extraia regiões intergênicas e intrônicas do alinhamento, filtrando sequências com> 70% de identidade em pelo menos 50 pb entre espécies divergiram> 50 milhões de anos atrás, indicando seleção purificadora. PhastCons ou PhyloP do pacote PHAST calcula pontuações de conservação em vários alinhamentos: phastCons --target-coverage 0.3 --expected-coverage 2.5 --msa-format MAF alinhamento.maf conservação.bed. Para análise de pangenoma dentro de uma espécie, execute Panaroo em genomas bacterianos: panaroo -i *.gff -o pangenome_output --clean-mode strict e examine a matriz genética central/acessória. A atribuição de ortologia em muitos genomas usa OrthoFinder: orthofinder -f proteomes_dir -t 8.