Aperçu Général
L’analyse d’enrichissement de voies détermine si des ensembles de gènes prédéfinis, représentant des voies biologiques, des catégories fonctionnelles ou des processus cellulaires, sont statistiquement surreprésentés dans une liste de gènes dérivés expérimentalement. Cette approche transforme une longue liste de gènes exprimés différentiellement en thèmes biologiques interprétables, aidant les chercheurs à passer de “quels gènes ont changé ?” à “quels processus sont affectés ?”. Le principe fondamental est que si une voie est pertinente pour la condition étudiée, davantage de ses gènes membres apparaîtront dans la liste de gènes de l’utilisateur que prévu par le hasard.
Méthodes
Les méthodes les plus utilisées incluent le test exact de Fisher (ou test hypergéométrique), qui évalue le chevauchement entre la liste de gènes et un ensemble de gènes d’une voie par rapport à un fond défini. L’Analyse d’Enrichissement de Jeux de Gènes (GSEA) évite les seuils de signification arbitraires en classant tous les gènes par une métrique d’expression différentielle et en testant si les membres d’une voie se regroupent en haut ou en bas de la liste classée. La correction pour tests multiples, typiquement le taux de fausses découvertes de Benjamini-Hochberg, est essentielle car des centaines de voies sont évaluées simultanément. Des bases de données de voies curées telles que KEGG, Reactome et Gene Ontology fournissent les ensembles de gènes de référence.
Applications
L’enrichissement de voies est une étape de routine dans les études transcriptomiques, protéomiques et métabolomiques. Il relie les résultats d’expression différentielle des expériences de puces à ADN et expression génique à la biologie fonctionnelle. Les chercheurs sur le cancer l’utilisent pour identifier les voies dérégulées telles que la glycolyse ou le cycle de l’acide citrique, et il révèle comment la régulation génique et l’épigénétique reconfigurent les programmes cellulaires dans les maladies. L’analyse d’enrichissement guide également la découverte de biomarqueurs en mettant en évidence les voies communes aux voies métaboliques qui sont perturbées dans les échantillons de patients.
Protocole Pratique
Pour l’analyse de surreprésentation (ORA) utilisant clusterProfiler dans R, commencez par une liste de gènes exprimés différentiellement (ex., padj < 0,05, |log2FC| > 1). Chargez le package et effectuez l’enrichissement GO : library(clusterProfiler); ego <- enrichGO(gene = de_genes, OrgDb = org.Hs.eg.db, keyType = "SYMBOL", ont = "BP", pAdjustMethod = "BH", pvalueCutoff = 0.05, qvalueCutoff = 0.2). Le paramètre ont peut être “BP” (Processus Biologique), “MF” (Fonction Moléculaire) ou “CC” (Composant Cellulaire). Pour l’enrichissement de voies KEGG, convertissez les symboles de gènes en identifiants Entrez : ekegg <- enrichKEGG(gene = entrez_ids, organism = "hsa", pvalueCutoff = 0.05). Visualisez les résultats avec dotplot(ego, showCategory = 20), qui affiche le ratio de gènes, la valeur p ajustée et le nombre de gènes par catégorie. La fonction barplot fournit une vue alternative. Pour l’analyse d’enrichissement de jeux de gènes (GSEA), préparez une liste de gènes classés triés par log2 du changement d’expression : genelist <- sort(results$log2FoldChange, decreasing = TRUE); names(genelist) <- rownames(results). Exécutez GSEA en utilisant gseGO(geneList = genelist, OrgDb = org.Hs.eg.db, keyType = "SYMBOL", ont = "BP", minGSSize = 10, maxGSSize = 500, pvalueCutoff = 0.05). GSEA ne nécessite pas de seuil de significativité, ce qui le rend sensible aux changements coordonnés mais modestes sur l’ensemble des membres d’une voie. La fonction gseaplot2 visualise le score d’enrichissement en cours pour une voie spécifique. Pour l’analyse en ligne, utilisez Enrichr : collez une liste de gènes sur https://maayanlab.cloud/Enrichr, sélectionnez des bibliothèques (KEGG, GO, WikiPathways) et téléchargez le tableau de score combiné. Le score combiné est le produit de la valeur p transformée en log et du z-score, classant les voies à la fois par significativité et par direction du changement. Exportez toujours les résultats en CSV avec des colonnes pour l’ID de voie, la description, le ratio de gènes, la valeur p, la valeur p ajustée et la liste des gènes chevauchants.