Skip to content

Article image
Analyse ARN-Seq : quantification de l'expression des gènes

May 16, 2026 · Updated: May 25, 2026

Aperçu

Le séquençage de l’ARN (RNA-seq) est devenu la méthode standard pour mesurer l’expression des gènes, remplaçant les approches antérieures basées sur l’hybridation. En convertissant les molécules d’ARN en bibliothèque d’ADNc et en séquençant des millions de fragments, RNA-seq fournit à la fois l’identité et l’abondance des transcrits dans un échantillon biologique. Contrairement aux puces à ADN, RNA-seq peut détecter de nouveaux transcrits, des variantes d’épissage et des ARN non codants sans conception préalable de sonde. La technique offre une plage dynamique couvrant plusieurs ordres de grandeur et une résolution à base unique. Les données de séquençage d’ARN sous-tendent la plupart des études transcriptomiques modernes, depuis les organismes modèles jusqu’aux échantillons cliniques.

Concepts clés

Le pipeline d’analyse de séquençage d’ARN commence par des lectures de séquençage brutes, qui sont soumises à un contrôle de qualité (FastQC), à un ajustement de l’adaptateur (Trimmomatic ou Cutadapt) et à un alignement sur un génome de référence à l’aide d’aligneurs sensibles à l’épissage tels que STAR ou HISAT2. La quantification au niveau du gène ou de la transcription est effectuée par des outils tels que featureCounts, RSEM ou Salmon. Les valeurs d’expression sont normalisées en FPKM, RPKM ou TPM pour tenir compte de la profondeur de séquençage et de la longueur de la transcription. La détection des épissages alternatifs et des nouvelles transcriptions nécessite des outils spécialisés tels que Cufflinks ou StringTie, qui assemblent des transcriptions à partir de lectures alignées. Les mesures de qualité incluent les taux de cartographie, la distribution des lectures entre les caractéristiques des gènes et l’analyse de la saturation.

### Candidatures

L’ARN-seq est appliqué dans pratiquement tous les domaines de la biologie. Il profile les changements d’expression génique dans la maladie par rapport aux tissus sains, identifie les biomarqueurs des sous-types de cancer et suit les programmes de développement d’expression génique. En microbiologie, l’ARN-seq révèle des réponses transcriptionnelles aux antibiotiques et au stress environnemental. La technique s’appuie directement sur les méthodes de séquençage d’ARN et est fréquemment intégrée aux flux de travail de séquençage de nouvelle génération. RNA-seq permet également la découverte de nouvelles structures et types d’ARN, y compris de longs ARN non codants et des ARN circulaires, élargissant ainsi notre compréhension de la complexité du transcriptome.

Protocole pratique

Un pipeline de séquençage d’ARN en masse standard commence par les fichiers FASTQ bruts du séquenceur. Tout d’abord, exécutez « FastQC » pour évaluer les mesures de qualité, notamment les scores de qualité par base, le contenu GC, la contamination de l’adaptateur et les séquences surreprésentées. Coupez les bases de mauvaise qualité et les adaptateurs résiduels avec Trimmomatic ou Cutadapt : une commande typique est trimmomatic PE sample_R1.fastq sample_R2.fastq -baseout trimmed.fq ILLUMINACLIP:adapters.fa:2:30:10 LEADING:3 TRAILING:3 SLIDINGWINDOW:4:15 MINLEN:36. Pour un alignement prenant en compte l’épissage, STAR nécessite un index génomique construit avec STAR --runMode genomeGenerate --genomeFastaFiles genome.fa --sjdbGTFfile annotation.gtf. Alignez les lectures avec STAR --runThreadN 8 --genomeDir star_index --readFilesIn trimmed_R1.fastq trimmed_R2.fastq --outSAMtype BAM SortedByCoordonnée. La quantification au niveau des gènes utilise featureCounts -a annotation.gtf -o counts.txt -t exon -g gene_id aligné.bam, produisant une matrice de comptage où les lignes sont des gènes et les colonnes sont des échantillons. Pour la quantification au niveau de la transcription, « Salmon » fournit une estimation sans alignement : « salmon quant -i salmon_index -l A -1 R1.fastq -2 R2.fastq -o quant_output ». Les mesures de contrôle qualité à signaler incluent le pourcentage de lecture cartographié de manière unique (idéalement > 80 %), le taux de cartographie des régions exoniques, le biais 3’ et le niveau de contamination par l’ARNr. Évaluez la complexité de la bibliothèque avec « preseq » pour estimer si un séquençage plus approfondi produirait des gènes détectés supplémentaires. La matrice de comptage finale est chargée dans R pour l’analyse d’expression différentielle avec DESeq2 ou edgeR. Pour une quantification sans alignement, l’approche de quasi-cartographie de Salmon contourne entièrement l’étape d’alignement, offrant un traitement plus rapide tout en conservant la précision : salmon quant -i transcript_index -l A -1 reads_R1.fastq -2 reads_R2.fastq --validateMappings -o quant. L’indicateur --validateMappings améliore la sensibilité des nouvelles transcriptions.