Descripción general
La anotación del genoma es el proceso de otorgar significado biológico a la secuencia cruda de un genoma ensamblado. Identifica la ubicación de los genes, sus límites exón-intrón, secuencias reguladoras, elementos repetitivos y ARN no codificantes. La anotación cierra la brecha entre una secuencia de ADN estática y las funciones biológicas dinámicas que codifica. Tanto las predicciones computacionales como la evidencia experimental se integran para producir un mapa completo de características genómicas. A medida que la secuenciación del genoma se vuelve más rápida y económica, el cuello de botella de la anotación (transformar los datos de la secuencia en conocimientos biológicos) se ha vuelto cada vez más crítico.
Métodos
Las estrategias de anotación se dividen en tres categorías. La predicción ab initio utiliza modelos estadísticos de la estructura genética (como los modelos ocultos de Markov) para identificar regiones codificantes directamente a partir de la composición de la secuencia. Anotación basada en homología alinea etiquetas de secuencia expresadas, proteínas o lecturas de secuencias de ARN de la misma especie o de especies relacionadas para inferir estructuras genéticas. Anotación comparativa aprovecha la conservación evolutiva de múltiples especies para identificar elementos funcionales. Canalizaciones como la canalización de anotación del genoma eucariota del NCBI combinan los tres enfoques, seguidos de una curación manual para resolver casos ambiguos. La calidad se evalúa a través de métricas como la distancia de edición de anotaciones (AED).
Aplicaciones
La anotación precisa es esencial para interpretar proyectos de secuenciación. En la investigación biomédica, permite descubrir mutaciones que causan enfermedades al revelar qué regiones genómicas codifican proteínas o elementos reguladores. La genómica agrícola utiliza anotaciones para vincular genes con rasgos como el rendimiento y la tolerancia al estrés. Técnicas como la tecnología del ADN recombinante dependen de modelos genéticos confiables para la clonación y la expresión. La anotación también respalda la genética bacteriana mediante la identificación de operones y factores de virulencia, mientras que los estudios de regulación genética y epigenética se basan en las coordenadas precisas de promotores, potenciadores y otras características regulatorias.
Protocolo práctico
El proceso de anotación MAKER integra predicciones ab initio, proteínas y evidencia de transcripción en una anotación unificada. Prepare un archivo maker_opts.ctl que especifique el genoma FASTA, la biblioteca repetida (por ejemplo, de RepeatModeler) y las alineaciones EST/proteínas de organismos estrechamente relacionados. Ejecute RepeatMasker para enmascarar repeticiones: RepeatMasker -species mamífero genome.fa. Ejecute MAKER en tres rondas iterativas: primero con solo EST y evidencia de proteínas (maker -g genome.fa), que genera modelos genéticos iniciales mediante alineaciones empalmadas de transcripciones y proteínas. En la segunda ronda, entrene predictores de genes ab initio (AUGUSTUS o SNAP) en modelos MAKER de alta confianza de la primera ronda: snap -train -c score 1 -gff maker.gff genome.fa. La tercera ronda vuelve a ejecutar MAKER con los predictores entrenados habilitados, lo que produce la anotación final. BRAKER2 amplía este enfoque para especies con datos de RNA-seq: alinee las lecturas con STAR, ejecute BRAKER2.pl --genome=genome.fa --bam=aligned.bam --species=species, que entrena automáticamente a GeneMark-ET y AUGUSTUS. La calidad de la anotación se evalúa con la métrica Distancia de edición de anotación (AED): AED < 0,25 indica modelos de alta confianza. Se espera que BUSCO esté completo frente al linaje apropiado por encima del 90% para un genoma bien anotado. Compare su anotación con las existentes con gffcompare. Para la anotación de ARN no codificante, ejecute “Infernal” con modelos de covarianza Rfam. La anotación funcional de las proteínas predichas utiliza InterProScan: interproscan.sh -i proteínas.faa -f TSV -dp, que asigna términos de ontología genética y anotaciones de dominio. El archivo GFF3 final debe ordenarse, validarse con genometools gt gff3validator e indexarse con tabix.