Skip to content

Article image
Assemblage du transcriptome : reconstruction des séquences d'ARN

May 16, 2026 · Updated: May 25, 2026

Aperçu

L’assemblage du transcriptome est la reconstruction informatique de séquences de transcription exprimées à partir de lectures d’ARN-seq, réalisées avec ou sans génome de référence. Pour les organismes dépourvus de génome séquencé, l’assemblage de novo du transcriptome est la seule option, fournissant la première vue du potentiel de codage d’un organisme. Même lorsqu’un génome de référence est disponible, l’assemblage du transcriptome peut capturer de nouvelles isoformes, des transcrits de fusion et des séquences provenant de régions génomiques mal assemblées. Le transcriptome assemblé sert de base aux analyses en aval, notamment la quantification de l’expression, l’annotation fonctionnelle et les études comparatives.

Méthodes

L’assemblage du transcriptome De novo utilise des algorithmes d’assemblage conçus pour une couverture inégale et un épissage alternatif. Les outils populaires incluent Trinity, qui utilise une approche graphique de De Bruijn avec plusieurs tailles k-mer ; rnaSPAdes, adapté de l’assemblage du génome ; et SOAPdenovo-Trans. Ces outils assemblent les lectures en contigs représentant des fragments de transcription, puis regroupent les contigs associés en groupes isoformes et résolvent les transcriptions complètes. Les assembleurs guidés par référence (StringTie, Cufflinks) exploitent les alignements sensibles aux épissures sur le génome et assemblent les lectures qui se chevauchent dans des modèles de transcription. Les mesures de qualité clés incluent l’exhaustivité de l’assemblage (scores BUSCO par rapport aux orthologues conservés), la longueur N50 et le nombre de transcriptions complètes récupérées. Réduction de la redondance à l’aide de transcriptions hautement similaires de clusters CD-HIT ou Corset.

### Candidatures

L’assemblage du transcriptome permet la découverte de gènes dans des organismes non modèles, des cultures agricoles aux espèces marines sous-explorées. Il identifie les gènes différentiellement exprimés, les isoformes spécifiques aux tissus et les transcrits de fusion dans le cancer. La technique est essentielle lorsque les données de séquençage d’ARN proviennent d’organismes sans référence, et elle s’intègre profondément aux flux de travail de séquençage de nouvelle génération. Les transcriptomes assemblés contribuent également aux études évolutives en permettant des comparaisons inter-espèces de structure et types d’ARN. À mesure que le séquençage à lecture longue (Iso-Seq, Oxford Nanopore) s’améliore, les stratégies d’assemblage hybride combinant des lectures courtes et longues produisent des transcriptomes plus complets et plus précis que jamais.

Protocole pratique

Pour l’assemblage du transcriptome de novo avec Trinity, assurez-vous d’abord que les lectures d’ARN-seq ont subi un découpage de qualité avec Trimmomatic. Exécutez Trinity avec la commande : Trinity --seqType fq --max_memory 50G --CPU 8 --left reads_R1.fastq --right reads_R2.fastq --output trinity_out_dir. Trinity fonctionne en trois modules : Inchworm assemble des graphiques k-mer en contigs, Chrysalis regroupe les contigs en graphiques de Bruijn représentant des variantes de transcription complètes, et Butterfly trace des chemins à travers ces graphiques pour reconstruire des séquences d’isoformes. Le résultat est « Trinity.fasta » contenant les transcriptions assemblées. Évaluez la qualité de l’assemblage avec BUSCO par rapport à l’ensemble de données de lignée approprié : busco -i Trinity.fasta -l eukaryota_odb10 -o busco_out -m transcriptome. Un score BUSCO complet supérieur à 80 % indique un assemblage de haute qualité. Des mesures supplémentaires incluent le contig N50 (calculé avec « TrinityStats.pl Trinity.fasta ») et le nombre de transcrits assemblés correspondant aux protéines connues via BLASTX contre UniProt. Réduisez la redondance avec CD-HIT-EST -c 0.95 -i Trinity.fasta -o Trinity_nr.fasta pour regrouper les isoformes à 95 % d’identité. Pour un assemblage guidé par référence avec StringTie, alignez d’abord les lectures avec STAR : stringtie -p 8 -G annotation.gtf -o assembly.gtf aligné.bam. StringTie assemble des transcriptions à l’aide d’un algorithme de flux réseau et peut être exécuté sans GTF de référence pour la découverte de nouvelles transcriptions. Fusionnez les assemblages entre les échantillons avec stringtie --merge pour créer un transcriptome unifié. Quantifiez l’expression avec stringtie -e -B et utilisez prepDE.py pour générer une matrice de comptage pour l’analyse d’expression différentielle.