Skip to content

Article image
转录组组装:重建 RNA 序列

May 16, 2026 · Updated: May 25, 2026

概述

转录组组装是从 RNA-seq 读取中对表达的转录本序列进行计算重建,无论有或没有参考基因组都可以进行。对于缺乏基因组测序的生物体,从头开始转录组组装是唯一的选择,它提供了生物体编码潜力的第一个视图。即使参考基因组可用,转录组组装也可以从组装不良的基因组区域捕获新的亚型、融合转录本和序列。组装的转录组作为下游分析的基础,包括表达定量、功能注释和比较研究。

方法

从头开始转录组组装使用专为不均匀覆盖和选择性剪接而设计的组装算法。流行的工具包括 Trinity,它使用具有多个 k-mer 大小的 de Bruijn 图方法; rnaSPAdes,改编自基因组组装;和 SOAPdenovo-Trans。这些工具将读数组装成代表转录本片段的重叠群,然后将相关重叠群聚类成异构体组并解析全长转录本。参考引导组装程序(StringTie、Cufflinks)利用基因组的剪接感知比对,并将重叠读取组装到转录本模型中。关键质量指标包括组装完整性(针对保守直向同源物的 BUSCO 评分)、N50 长度和恢复的全长转录本数量。使用 CD-HIT 或 Corset 聚类高度相似的转录本来减少冗余。

应用程序

转录组组装能够在非模式生物中发现基因,从农作物到尚未开发的海洋物种。它可以识别癌症中的差异表达基因、组织特异性亚型和融合转录本。当RNA测序数据来自没有参考的生物体时,该技术至关重要,并且它与[下一代测序](/guides/next- Generation-sequencing.html)工作流程深度集成。组装的转录组还可以通过跨物种比较 [RNA 结构和类型](/guides/rna-struct-and-types.html) 为进化研究做出贡献。随着长读长测序(Iso-Seq、Oxford Nanopore)的改进,结合短读长和长读长的混合组装策略正在产生比以往更完整、更准确的转录组。

实用协议

对于使用 Trinity 进行从头转录组组装,首先确保 RNA-seq 读数经过 Trimmomatic 的质量修整。使用以下命令运行 Trinity:“Trinity –seqType fq –max_memory 50G –CPU 8 –leftreads_R1.fastq –rightreads_R2.fastq –output trinity_out_dir”。 Trinity 以三个模块运行:Inchworm 将 k-mer 图组装成重叠群,Chrysalis 将重叠群聚类成代表完整转录本变体的 de Bruijn 图,而 Butterfly 则通过这些图追踪路径以重建异构体序列。输出是包含组装转录本的“Trinity.fasta”。使用“BUSCO”针对适当的谱系数据集评估装配质量:“busco -i Trinity.fasta -l eukaryota_odb10 -o Busco_out -m 转录组”。完整的 BUSCO 分数高于 80% 表明装配质量很高。其他指标包括重叠群 N50(使用“TrinityStats.pl Trinity.fasta”计算)以及通过 BLASTX 与 UniProt 匹配已知蛋白质的组装转录本数量。使用“CD-HIT-EST -c 0.95 -i Trinity.fasta -o Trinity_nr.fasta”减少冗余,以 95% 的同一性对异构体进行聚类。对于使用 StringTie 进行参考引导的组装,首先使用 STAR 对齐读取:“stringtie -p 8 -G comment.gtf -o assembly.gtfaligned.bam”。 StringTie 使用网络流算法组装转录本,并且可以在没有参考 GTF 的情况下运行以发现新的转录本。使用“stringtie –merge”合并样本之间的程序集以创建统一的转录组。使用“stringtie -e -B”量化表达,并使用“prepDE.py”生成用于差异表达分析的计数矩阵。