Skip to content

Article image
Ensamblaje del transcriptoma: reconstrucción de secuencias de ARN

May 16, 2026 · Updated: May 25, 2026

Descripción general

El ensamblaje del transcriptoma es la reconstrucción computacional de secuencias de transcripción expresadas a partir de lecturas de RNA-seq, realizadas con o sin un genoma de referencia. Para los organismos que carecen de un genoma secuenciado, el ensamblaje del transcriptoma de novo es la única opción, ya que proporciona una primera visión del potencial de codificación de un organismo. Incluso cuando se dispone de un genoma de referencia, el ensamblaje del transcriptoma puede capturar nuevas isoformas, transcripciones de fusión y secuencias de regiones genómicas mal ensambladas. El transcriptoma ensamblado sirve como base para análisis posteriores que incluyen cuantificación de expresión, anotación funcional y estudios comparativos.

Métodos

El ensamblaje del transcriptoma De novo utiliza algoritmos de ensamblaje diseñados para una cobertura desigual y empalmes alternativos. Las herramientas populares incluyen Trinity, que utiliza un enfoque gráfico de De Bruijn con múltiples tamaños de k-mer; rnaSPAdes, adaptado del ensamblaje del genoma; y SOAPdenovo-Trans. Estas herramientas ensamblan lecturas en contigs que representan fragmentos de transcripción, luego agrupan contigs relacionados en grupos de isoformas y resuelven transcripciones completas. Los ensambladores guiados por referencias (StringTie, Cufflinks) aprovechan las alineaciones del genoma que tienen en cuenta el empalme y ensamblan lecturas superpuestas en modelos de transcripción. Las métricas de calidad clave incluyen la integridad del ensamblaje (puntuaciones BUSCO frente a ortólogos conservados), la longitud N50 y la cantidad de transcripciones completas recuperadas. Reducción de la redundancia mediante el uso de transcripciones muy similares de grupos CD-HIT o Corset.

Aplicaciones

El ensamblaje del transcriptoma permite el descubrimiento de genes en organismos no modelo, desde cultivos agrícolas hasta especies marinas poco exploradas. Identifica genes expresados diferencialmente, isoformas específicas de tejido y transcripciones de fusión en el cáncer. La técnica es esencial cuando los datos de secuenciación de ARN provienen de organismos sin una referencia, y se integra profundamente con los flujos de trabajo de secuenciación de próxima generación. Los transcriptomas ensamblados también contribuyen a los estudios evolutivos al permitir comparaciones entre especies de estructura y tipos de ARN. A medida que mejora la secuenciación de lectura larga (Iso-Seq, Oxford Nanopore), las estrategias de ensamblaje híbrido que combinan lecturas cortas y largas están produciendo transcriptomas más completos y precisos que nunca.

Protocolo práctico

Para el ensamblaje del transcriptoma de novo con Trinity, primero asegúrese de que las lecturas de RNA-seq se hayan sometido a un recorte de calidad con Trimmomatic. Ejecute Trinity con el comando: Trinity --seqType fq --max_memory 50G --CPU 8 --left reads_R1.fastq --right reads_R2.fastq --output trinity_out_dir. Trinity opera en tres módulos: Inchworm ensambla gráficos k-mer en contigs, Chrysalis agrupa contigs en gráficos de Bruijn que representan variantes de transcripción completa, y Butterfly traza caminos a través de estos gráficos para reconstruir secuencias de isoformas. El resultado es Trinity.fasta que contiene transcripciones ensambladas. Evalúe la calidad del ensamblaje con BUSCO frente al conjunto de datos de linaje apropiado: busco -i Trinity.fasta -l eukaryota_odb10 -o busco_out -m transcriptome. Una puntuación total de BUSCO superior al 80% indica un montaje de alta calidad. Las métricas adicionales incluyen contig N50 (calculado con TrinityStats.pl Trinity.fasta) y el número de transcripciones ensambladas que coinciden con proteínas conocidas a través de BLASTX contra UniProt. Reduzca la redundancia con CD-HIT-EST -c 0.95 -i Trinity.fasta -o Trinity_nr.fasta para agrupar isoformas con un 95 % de identidad. Para el ensamblaje guiado por referencia con StringTie, primero alinee las lecturas con STAR: stringtie -p 8 -G annotation.gtf -o ensamblador.gtf alineado.bam. StringTie ensambla transcripciones utilizando un algoritmo de flujo de red y se puede ejecutar sin un GTF de referencia para el descubrimiento de transcripciones novedosas. Fusione ensamblajes en muestras con “stringtie –merge” para crear un transcriptoma unificado. Cuantifique la expresión con stringtie -e -B y use prepDE.py para generar una matriz de recuento para el análisis de expresión diferencial.