Skip to content

Article image
Assemblage de séquence : reconstruction de l'ADN à partir de fragments

May 16, 2026 · Updated: May 25, 2026

Aperçu

L’assemblage de séquences est le processus informatique de reconstruction d’un génome ou d’un transcriptome complet à partir de millions ou de milliards de fragments d’ADN courts produits par les séquenceurs. Étant donné que les machines de séquençage ne lisent que 150 à 300 paires de bases à la fois, les algorithmes d’assemblage doivent trouver les chevauchements entre les lectures, les fusionner en séquences contiguës plus longues (contigs) et ordonner les contigs en échafaudages. La difficulté d’assemblage augmente avec la taille du génome, le contenu répétitif et l’hétérozygotie. La qualité de l’assemblage est mesurée par des mesures telles que N50 (la longueur du contig à laquelle 50 % de l’assemblage est couvert) et le nombre total de contigs.

Méthodes

Il existe deux principaux paradigmes d’assemblage. Overlap-layout-consensus (OLC), utilisé par Canu et Flye pour les lectures longues, calcule tous les chevauchements par paires entre les lectures, construit un graphique et résout les chemins pour produire une séquence consensus. Les assembleurs De Bruijn graph, tels que SPAdes et Velvet, décomposent les lectures en k-mers et construisent un graphe où les k-mers sont des nœuds et les arêtes représentent des chevauchements k-1 ; cette approche s’adapte efficacement aux grands génomes avec une couverture élevée. Les assembleurs hybrides combinent la précision des lectures courtes avec les informations à longue portée des lectures longues pour résoudre les régions répétitives. Les assembleurs métagénomiques comme MEGAHIT gèrent des communautés microbiennes mixtes en s’adaptant à différentes profondeurs de couverture selon les espèces.

### Candidatures L’assemblage du génome de novo produit des génomes de référence pour les organismes nouvellement séquencés, notamment les bactéries, les plantes et les vertébrés. Dans les projets de séquençage nouvelle génération, l’assemblage est la première étape avant l’annotation et l’analyse. L’assemblage du transcriptome à partir des lectures de [séquençage d’ADN] (/fr/guides/dna-sequencing.html) révèle des isoformes épissées alternativement. Technologie de l’ADN recombinant utilise l’assemblage pour vérifier les constructions plasmidiques en assemblant les lectures de séquençage Sanger des inserts clonés.

Protocole pratique

Pour l’assemblage de séquençage Sanger à l’aide de Phred/Phrap/Consed, commencez par les fichiers de trace ABI bruts (.ab1). L’appel de base avec Phred convertit les traces en séquences de haute qualité avec des scores de qualité par base : phred -id seqs_dir -qd seqs_phd_dir -sd seqs_fasta_dir. Phred rapporte des scores de qualité sur l’échelle Phred (-10 × log₁₀ (error_probability)), où Q20 = 99 % de précision et Q30 = 99,9 % de précision. Assemblez les lectures avec Phrap : phrap seqs_fasta_dir/*.fasta -ace > assembly.log. Phrap utilise un algorithme de Smith-Waterman en bandes avec des scores de qualité pour calculer des séquences consensus et assembler les lectures en contigs. Affichez et modifiez manuellement l’assemblage dans Consed : consed -acephap ace_file. Consed affiche les lectures alignées avec un code couleur de qualité de base, met en évidence les écarts et permet l’édition manuelle du consensus. Accédez aux zones problématiques signalées par Phrap comme des écarts de haute qualité (barres rouges) ou des régions de mauvaise qualité (surlignages bleus). Résolvez manuellement les écarts en examinant les chromatogrammes pour chaque lecture, en coupant les extrémités de mauvaise qualité et en corrigeant les bases mal nommées. Générez une séquence de consensus finale dont la qualité a été vérifiée : Fichier → Exporter le consensus. Pour l’assemblage de novo d’un petit génome bactérien à partir de lectures Illumina, utilisez SPAdes avec l’indicateur --isolate pour les données sur une seule souche. Évaluez l’exhaustivité de l’assemblage avec QUAST en calculant le contenu N50, L50 et GC. Pour la finition, commandez des contigs à l’aide de CONTIGUATOR par rapport à une référence étroitement liée, puis comblez les espaces en concevant des amorces aux extrémités des contigs pour le séquençage PCR et Sanger. Vérifiez l’assemblage final en alignant les lectures avec BWA-MEM et en vérifiant l’uniformité de la couverture.