Skip to content

Article image
Anotação do Genoma: Identificando Elementos Funcionais

May 16, 2026 · Updated: May 25, 2026

Visão geral

A anotação do genoma é o processo de atribuir significado biológico à sequência bruta de um genoma montado. Ele identifica as localizações dos genes, seus limites exon-íntron, sequências reguladoras, elementos repetitivos e RNAs não codificantes. A anotação preenche a lacuna entre uma sequência de DNA estática e as funções biológicas dinâmicas que ela codifica. Tanto as previsões computacionais quanto as evidências experimentais são integradas para produzir um mapa abrangente das características genômicas. À medida que o sequenciamento do genoma se torna mais rápido e barato, o gargalo da anotação – transformar dados de sequência em informações biológicas – tornou-se cada vez mais crítico.

Métodos

As estratégias de anotação se enquadram em três categorias. A previsão ab initio usa modelos estatísticos de estrutura genética (como modelos ocultos de Markov) para identificar regiões codificantes diretamente da composição da sequência. Anotação baseada em homologia alinha tags de sequência expressas, proteínas ou leituras de RNA-seq da mesma espécie ou de espécies relacionadas para inferir estruturas genéticas. Anotação comparativa aproveita a conservação evolutiva de diversas espécies para identificar elementos funcionais. Pipelines como o NCBI Eukaryotic Genome Annotation Pipeline combinam todas as três abordagens, seguidas de curadoria manual para resolver casos ambíguos. A qualidade é avaliada por meio de métricas como Annotation Edit Distance (AED).

Aplicativos

A anotação precisa é essencial para a interpretação de projetos de sequenciamento. Na investigação biomédica, permite a descoberta de mutações causadoras de doenças, revelando quais regiões genómicas codificam proteínas ou elementos reguladores. A genômica agrícola usa anotação para vincular genes a características como rendimento e tolerância ao estresse. Técnicas como a tecnologia de DNA recombinante dependem de modelos genéticos confiáveis para clonagem e expressão. A anotação também apoia a genética bacteriana, identificando operons e fatores de virulência, enquanto os estudos de regulação genética e epigenética dependem de coordenadas precisas de promotores, intensificadores e outros recursos regulatórios.

Protocolo Prático

O pipeline de anotação MAKER integra previsões ab initio, proteínas e evidências de transcrição em uma anotação unificada. Prepare um arquivo maker_opts.ctl especificando o genoma FASTA, biblioteca de repetição (por exemplo, do RepeatModeler) e alinhamentos EST/proteína de organismos intimamente relacionados. Execute RepeatMasker para repetir a máscara suave: RepeatMasker -species mamífero genoma.fa. Execute o MAKER em três rodadas iterativas: primeiro com apenas EST e evidências de proteínas (maker -g genoma.fa), que gera modelos genéticos iniciais por meio de alinhamentos emendados de transcrições e proteínas. Na segunda rodada, treine preditores genéticos ab initio (AUGUSTUS ou SNAP) em modelos MAKER de alta confiança da primeira rodada: snap -train -c score 1 -gff maker.gff genoma.fa. A terceira rodada executa novamente o MAKER com os preditores treinados habilitados, produzindo a anotação final. BRAKER2 estende esta abordagem para espécies com dados de RNA-seq: alinhe leituras com STAR, execute BRAKER2.pl --genome=genome.fa --bam=aligned.bam --species=species, que treina automaticamente GeneMark-ET e AUGUSTUS. A qualidade da anotação é avaliada com a métrica Annotation Edit Distance (AED): AED < 0,25 indica modelos de alta confiança. A completude do BUSCO em relação à linhagem apropriada é esperada acima de 90% para um genoma bem anotado. Compare sua anotação com as existentes com gffcompare. Para anotação de RNA não codificante, execute Infernal com modelos de covariância Rfam. A anotação funcional de proteínas previstas usa InterProScan: interproscan.sh -i protein.faa -f TSV -dp, que atribui termos de Gene Ontology e anotações de domínio. O arquivo GFF3 final deve ser classificado, validado com genometools gt gff3validator e indexado com tabix.