Aperçu
L’assemblage du génome est le processus informatique de reconstruction de séquences entières du génome à partir de courts fragments d’ADN produits par des plateformes de séquençage à haut débit. Étant donné que les machines de séquençage ne lisent que des centaines de paires de bases à la fois, les bioinformaticiens doivent reconstituer des millions, voire des milliards de ces lectures, un peu comme pour résoudre un énorme puzzle. La précision d’un génome assemblé affecte directement chaque analyse en aval, de la prédiction génétique à la génomique comparative. Les assembleurs modernes gèrent la complexité des régions répétitives, des erreurs de séquençage et des différentes profondeurs de couverture à l’aide d’algorithmes sophistiqués basés sur des graphes.
Concepts clés
Il existe deux stratégies principales pour l’assemblage du génome. L’assemblage de novo construit un génome sans aucune référence préalable, en s’appuyant sur des approches de chevauchement-layout-consensus (OLC) ou de graphes de Bruijn pour fusionner les lectures en séquences contiguës appelées contigs. L’assemblage guidé par référence mappe les lectures sur un génome de référence connu, puis assemble les parties non cartographiées, ce qui est particulièrement utile pour les projets de reséquençage. Les mesures de qualité clés incluent N50 (la longueur du contig à laquelle 50 % de l’assemblage est contenu) et la taille totale de l’assemblage. La validation de l’assemblage implique souvent une vérification par rapport à des séquences connues ou l’utilisation de technologies à lecture longue pour combler les écarts.
### Candidatures
L’assemblage du génome est fondamental pour presque toutes les applications génomiques. Elle permet la découverte de nouveaux gènes, l’identification de variantes structurelles et la caractérisation d’éléments régulateurs non codants. En médecine, les génomes assemblés d’agents pathogènes permettent un suivi rapide des épidémies et un profilage de la résistance aux antibiotiques. La génomique agricole s’appuie sur des assemblages de haute qualité pour cartographier les caractères d’importance économique. Les projets modernes combinent fréquemment des données de séquençage de nouvelle génération avec de longues lectures et une cartographie optique pour produire des assemblages au niveau des chromosomes, en s’appuyant sur les méthodes classiques de séquençage d’ADN. L’assemblage sous-tend également des études fonctionnelles telles que la conception de cibles CRISPR-Cas9, où les prédictions hors cible dépendent d’une référence précise.
Protocole pratique
Pour l’assemblage de novo d’un génome bactérien basé sur Illumina, commencez par un découpage de qualité : fastp -i R1.fastq -I R2.fastq -o trimmed_R1.fastq -O trimmed_R2.fastq -q 20 -l 50. Assemblez avec SPAdes en utilisant plusieurs tailles k-mer : spades.py -1 trimmed_R1.fastq -2 trimmed_R2.fastq -o spades_output -k 21,33,55,77 --careful. L’indicateur --careful réduit les incompatibilités et les indels en exécutant MismatchCorrector. La sortie inclut « contigs.fasta » et « scaffolds.fasta ». Pour un assemblage à lecture longue avec des données Oxford Nanopore, utilisez « Flye » : « flye –nano-raw reads.fastq -o flye_out -t 8 -g 5m », où « -g » fournit la taille estimée du génome. Pour un assemblage hybride combinant des lectures courtes et longues, utilisez Unicycler : unicycler -1 short_R1.fastq -2 short_R2.fastq -l long_reads.fastq -o hybrid_assembly. Évaluez la qualité de l’assemblage avec QUAST : quast.py contigs.fasta -r reference.fasta -g genes.gff -o quast_output. Les mesures clés incluent N50 (longueur du contig où 50 % de l’assemblage est couvert), la taille totale de l’assemblage, le nombre de contigs, la fraction du génome (fraction de référence couverte) et le nombre de mauvais assemblages. Pour un génome bactérien complet, visez N50 égal à la longueur du chromosome et au contenu GC correspondant à la référence. Vérifiez l’exhaustivité avec BUSCO par rapport à la lignée appropriée : busco -i contigs.fasta -lbacter_odb10 -o busco_out -m génome. Polissez les assemblages avec Pilon pour corriger les erreurs à l’aide des alignements de lecture : pilon --genome contigs.fasta --frags aligné.bam --output poli. Pour l’échafaudage au niveau des chromosomes, utilisez les données « Hi-C » avec « SALSA2 » ou « 3D-DNA » pour ordonner et orienter les contigs dans des pseudomolécules à l’échelle des chromosomes.