Skip to content

Article image
Ensamblaje del genoma: métodos y aplicaciones.

May 16, 2026 · Updated: May 25, 2026

Descripción general

El ensamblaje del genoma es el proceso computacional de reconstruir secuencias completas del genoma a partir de fragmentos cortos de ADN producidos por plataformas de secuenciación de alto rendimiento. Debido a que las máquinas secuenciadoras sólo leen cientos de pares de bases a la vez, los bioinformáticos deben reconstruir millones o miles de millones de estas lecturas, como resolver un enorme rompecabezas. La precisión de un genoma ensamblado afecta directamente a todos los análisis posteriores, desde la predicción de genes hasta la genómica comparativa. Los ensambladores modernos manejan las complejidades de las regiones repetitivas, los errores de secuenciación y las diferentes profundidades de cobertura mediante sofisticados algoritmos basados en gráficos.

Conceptos clave

Existen dos estrategias principales para el ensamblaje del genoma. El ensamblaje de novo construye un genoma sin ninguna referencia previa, basándose en enfoques de consenso de diseño de superposición (OLC) o de gráficos de Bruijn para fusionar lecturas en secuencias contiguas llamadas contigs. El ensamblaje guiado por referencia asigna lecturas a un genoma de referencia conocido y luego ensambla las partes no mapeadas, lo cual es particularmente útil para proyectos de resecuenciación. Las métricas de calidad clave incluyen N50 (la longitud del contig en la que está contenido el 50 % del ensamblaje) y el tamaño total del ensamblaje. La validación de ensamblajes a menudo implica comparar secuencias conocidas o utilizar tecnologías de lectura larga para cerrar brechas.

Aplicaciones

El ensamblaje del genoma es fundamental para casi todas las aplicaciones de la genómica. Permite el descubrimiento de nuevos genes, la identificación de variantes estructurales y la caracterización de elementos reguladores no codificantes. En medicina, los genomas ensamblados de patógenos permiten un rápido seguimiento de los brotes y la elaboración de perfiles de resistencia a los antibióticos. La genómica agrícola se basa en ensamblajes de alta calidad para mapear rasgos de importancia económica. Los proyectos modernos frecuentemente combinan datos de secuenciación de próxima generación con lecturas largas y mapeo óptico para producir ensamblajes a nivel de cromosomas, basándose en métodos clásicos de secuenciación de ADN. El ensamblaje también sustenta estudios funcionales como el diseño de objetivos CRISPR-Cas9, donde las predicciones fuera del objetivo dependen de una referencia precisa.

Protocolo práctico

Para el ensamblaje de novo de un genoma bacteriano basado en Illumina, comience con un recorte de calidad: fastp -i R1.fastq -I R2.fastq -o trimmed_R1.fastq -O trimmed_R2.fastq -q 20 -l 50. Ensamble con SPAdes usando múltiples tamaños de k-mer: spades.py -1 trimmed_R1.fastq -2 trimmed_R2.fastq -o spades_output -k 21,33,55,77 --careful. El indicador --careful reduce las discrepancias y los indeles ejecutando MismatchCorrector. La salida incluye contigs.fasta y scaffolds.fasta. Para el ensamblaje de lectura larga con datos de Oxford Nanopore, utilice Flye: flye --nano-raw reads.fastq -o flye_out -t 8 -g 5m, donde -g proporciona el tamaño estimado del genoma. Para un ensamblaje híbrido que combina lecturas cortas y largas, use Unicycler: unicycler -1 short_R1.fastq -2 short_R2.fastq -l long_reads.fastq -o hybrid_assembly. Evalúe la calidad del ensamblaje con QUAST: quast.py contigs.fasta -r reference.fasta -g genes.gff -o quast_output. Las métricas clave incluyen N50 (longitud del contig donde se cubre el 50% del ensamblaje), tamaño total del ensamblaje, número de contigs, fracción del genoma (fracción de referencia cubierta) y número de ensamblajes erróneos. Para un genoma bacteriano completo, busque N50 igual a la longitud del cromosoma y el contenido de GC que coincida con la referencia. Verifique que esté completo con BUSCO con el linaje apropiado: busco -i contigs.fasta -l bacteria_odb10 -o busco_out -m genome. Ensamblajes polacos con Pilon para corregir errores usando alineaciones de lectura: pilon --genome contigs.fasta --frags alineados.bam --output pulido. Para el andamiaje a nivel de cromosoma, utilice datos “Hi-C” con “SALSA2” o “3D-DNA” para ordenar y orientar los contigs en pseudomoléculas a escala de cromosomas.