Skip to content

Article image
Ensamblaje de secuencias: reconstrucción de ADN a partir de fragmentos

May 16, 2026 · Updated: May 25, 2026

Descripción general

El ensamblaje de secuencias es el proceso computacional de reconstruir un genoma o transcriptoma completo a partir de millones o miles de millones de fragmentos cortos de ADN producidos por secuenciadores. Debido a que las máquinas secuenciadoras leen solo entre 150 y 300 pares de bases a la vez, los algoritmos de ensamblaje deben encontrar superposiciones entre lecturas, fusionarlas en secuencias contiguas más largas (contigs) y ordenar los contigs en estructuras. La dificultad de ensamblaje aumenta con el tamaño del genoma, el contenido repetitivo y la heterocigosidad. La calidad del ensamblaje se mide mediante métricas como N50 (la longitud del contig en el que se cubre el 50 % del ensamblaje) y el número total de contigs.

Métodos

Existen dos paradigmas principales de ensamblaje. Overlap-layout-consensus (OLC), utilizado por Canu y Flye para lecturas largas, calcula todas las superposiciones por pares entre lecturas, construye un gráfico y resuelve rutas para producir una secuencia de consenso. Los ensambladores de gráficos de De Bruijn, como SPAdes y Velvet, descomponen las lecturas en k-mers y construyen un gráfico donde los k-mers son nodos y los bordes representan superposiciones k-1; este enfoque se adapta de manera eficiente a genomas grandes con alta cobertura. Los ensambladores híbridos combinan la precisión de las lecturas cortas con la información de largo alcance de las lecturas largas para resolver regiones repetitivas. Los ensambladores metagenómicos como MEGAHIT manejan comunidades microbianas mixtas al adaptarse a diferentes profundidades de cobertura entre especies.

Aplicaciones

El ensamblaje del genoma de novo produce genomas de referencia para organismos recién secuenciados, incluidas bacterias, plantas y vertebrados. En los proyectos de secuenciación de próxima generación, el ensamblaje es el primer paso antes de la anotación y el análisis. El ensamblaje del transcriptoma a partir de lecturas de secuenciación de ADN revela isoformas empalmadas alternativamente. La tecnología de ADN recombinante utiliza el ensamblaje para verificar construcciones de plásmidos mediante el ensamblaje de lecturas de secuenciación de Sanger de inserciones clonadas.

Protocolo práctico

Para el ensamblaje de secuenciación de Sanger utilizando Phred/Phrap/Consed, comience con archivos de seguimiento ABI sin formato (.ab1). La llamada de base con Phred convierte los seguimientos en secuencias de alta calidad con puntuaciones de calidad por base: phred -id seqs_dir -qd seqs_phd_dir -sd seqs_fasta_dir. Phred informa puntuaciones de calidad en la escala de Phred (-10 × log₁₀(probabilidad_error)), donde Q20 = 99 % de precisión y Q30 = 99,9 % de precisión. Ensamble lecturas con Phrap: phrap seqs_fasta_dir/*.fasta -ace > ensamblador.log. Phrap utiliza un algoritmo de Smith-Waterman con bandas con puntuaciones de calidad para calcular secuencias de consenso y ensamblar lecturas en contigs. Vea y edite manualmente el ensamblaje en Consed: consed -acephap ace_file. Consed muestra lecturas alineadas con codificación de colores de calidad base, resalta las discrepancias y permite la edición manual del consenso. Navegue hasta áreas problemáticas marcadas por Phrap como discrepancias de alta calidad (barras rojas) o regiones de baja calidad (resaltadas en azul). Resuelva manualmente las discrepancias examinando los cromatogramas de cada lectura, recortando los extremos de baja calidad y corrigiendo las bases mal llamadas. Genere una secuencia de consenso final con calidad comprobada: Archivo → Exportar consenso. Para el ensamblaje de novo de un pequeño genoma bacteriano a partir de lecturas de Illumina, utilice SPAdes con el indicador “–isolate” para datos de una sola cepa. Evalúe la integridad del ensamblaje con QUAST calculando el contenido de N50, L50 y GC. Para finalizar, ordene los contigs utilizando CONTIGUATOR frente a una referencia estrechamente relacionada, luego cierre las brechas diseñando cebadores en los extremos de los contig para la secuenciación de PCR y Sanger. Verifique el ensamblaje final alineando las lecturas con BWA-MEM y verificando la uniformidad de la cobertura.