Skip to content

Article image
Bases de Données de Variation : dbSNP, ClinVar et COSMIC

May 16, 2026

Aperçu Général

Les bases de données de variation cataloguent systématiquement les différences génétiques qui distinguent les individus et déterminent la diversité phénotypique, y compris la susceptibilité aux maladies. À mesure que les technologies de séquençage ont mûri, le nombre de variants génétiques humains connus a augmenté de façon exponentielle, atteignant des centaines de millions d’entrées. Les bases de données de variation remplissent deux fonctions critiques : elles définissent le spectre de base de la variation normale de la population, par rapport auquel les variants associés aux maladies peuvent être identifiés, et elles agrègent les interprétations cliniques qui guident les décisions diagnostiques et thérapeutiques.

Concepts Clés

dbSNP (Base de Données de Polymorphismes Nucléotidiques) catalogue les variants nucléotidiques uniques, les petites insertions et délétions, et les répétitions microsatellites. Chaque variant reçoit un identifiant rs (SNP de référence). Les enregistrements dbSNP incluent des données de fréquence allélique provenant de grandes études de population telles que le Projet 1000 Génomes et gnomAD. ClinVar se concentre sur la relation entre les variants génétiques et la santé humaine, fournissant des classifications de signification clinique (pathogène, bénin, signification incertaine) avec des preuves à l’appui. COSMIC (Catalogue des Mutations Somatiques dans le Cancer) catalogue les mutations somatiques trouvées dans les cancers humains, y compris les mutations ponctuelles, les altérations du nombre de copies et les fusions de gènes.

Applications

Les bases de données de variation sont des outils essentiels en médecine génomique. Les projets de séquençage d’ADN utilisent dbSNP pour filtrer les polymorphismes courants des variants candidats pathogènes. Les pipelines de séquençage de nouvelle génération annotent les variants par rapport à ClinVar pour prioriser les découvertes cliniquement exploitables. La recherche en biochimie du cancer s’appuie sur COSMIC pour identifier les mutations conductrices, tandis que les études de mécanismes de réparation de l’ADN relient les signatures mutationnelles à des déficiences spécifiques des voies de réparation.

Protocole Pratique

Pour interroger ClinVar pour un variant associé à une maladie, allez sur ncbi.nlm.nih.gov/clinvar et recherchez par nom de gène, variant (par ex., “BRCA1 VUS”) ou phénotype. Chaque enregistrement affiche la classification de signification clinique (Pathogène, Probablement Pathogène, Signification Incertaine, Probablement Bénin, Bénin) avec le statut de révision et le nombre de preuves. Pour un flux de travail d’interprétation de variant faux-sens : commencez avec les coordonnées génomiques du variant de votre pipeline de séquençage. Utilisez le rsID dbSNP pour extraire les données de fréquence de la population à partir du tableau “Freq”, les variants avec une fréquence allélique >1% dans gnomAD sont peu susceptibles d’être pathogènes pour les maladies rares. Cliquez sur ClinVar pour évaluer si le variant a été signalé cliniquement. Si le variant est nouveau (pas de rsID), utilisez des outils comme SIFT ou PolyPhen-2 (liés depuis la section “Molecular Consequence” de dbSNP) pour prédire l’impact fonctionnel de la substitution d’acide aminé. Pour un exemple concret, considérez un exome de patient révélant un variant faux-sens dans MYH7 (p.Arg403Trp). L’interrogation de dbSNP montre rs121913652 avec une fréquence rare (0,002% dans gnomAD). ClinVar classe ce variant comme Pathogène pour la cardiomyopathie hypertrophique familiale, soutenu par des études fonctionnelles démontrant une liaison altérée à l’actine. COSMIC confirme que ce résidu n’est pas muté de manière récurrente dans le cancer, affinant le diagnostic différentiel. Ce flux de travail par étapes, filtrage de fréquence, annotation clinique et prédiction fonctionnelle, transforme les appels de variants bruts en informations cliniquement exploitables. Alors que le séquençage clinique devient courant, les pipelines automatisés intègrent de plus en plus ces bases de données pour générer des rapports d’interprétation de variants en temps réel pour les médecins.