Skip to content

Article image
UniProt et les Bases de Données de Séquences Protéiques

May 16, 2026

Aperçu Général

UniProt (Universal Protein Resource) est le principal référentiel mondial d’informations sur les séquences et fonctions protéiques. Il est maintenu par un consortium comprenant l’Institut Européen de Bioinformatique (EMBL-EBI), l’Institut Suisse de Bioinformatique (SIB) et la Protein Information Resource (PIR). UniProt intègre des données provenant de projets de séquençage de génomes, de curation de la littérature et de prédictions informatiques pour fournir une vue unique et complète de chaque protéine connue. Ses trois composants principaux, UniProtKB, UniRef et UniParc, répondent à différents besoins analytiques.

Concepts Clés

UniProt Knowledgebase (UniProtKB) est divisée en deux sections : Swiss-Prot contient des entrées organisées manuellement et révisées avec des annotations détaillées issues de la littérature ; TrEMBL contient des entrées analysées par ordinateur en attente de révision manuelle. UniRef regroupe les séquences protéiques à différents niveaux d’identité (100%, 90%, 50%) pour réduire la redondance et accélérer les recherches de similarité de séquences. UniParc est une archive complète non redondante qui suit toutes les séquences protéiques des principales bases de données sources. Chaque entrée UniProtKB comprend la séquence, les informations fonctionnelles, la localisation subcellulaire, les modifications post-traductionnelles, les domaines et sites, et les références croisées vers d’autres bases de données.

Applications

UniProt sert de référence protéique principale pour la plupart des flux de travail bioinformatiques. Les chercheurs l’utilisent pour récupérer des séquences pour la prédiction de structure de protéines, identifier des protéines dans des expériences de protéomique et spectrométrie de masse via des recherches dans les bases de données, et consulter des annotations fonctionnelles telles que la classification et nomenclature des enzymes pour les études de voies métaboliques.

Protocole Pratique

Pour récupérer une séquence protéique spécifique d’UniProtKB, naviguez vers uniprot.org et saisissez le nom du gène, le nom de la protéine ou l’accession (par ex., TP53 ou P04637) dans la barre de recherche. La page de résultats affiche les entrées correspondantes avec des scores d’annotation. Cliquez sur une entrée pour voir l’enregistrement complet : la séquence apparaît dans la section “Sequence” avec le format FASTA disponible en un clic. Pour une récupération par lots, utilisez l’outil “Retrieve/ID mapping”, collez une liste d’accessions ou de noms de gènes, sélectionnez la base de données source (par ex., UniProtKB AC/ID) et choisissez le format de destination (FASTA, tabulé ou GFF). L’outil mappe également les identifiants vers plus de 200 bases de données externes. Pour l’analyse de domaines conservés, prenez la séquence FASTA récupérée et soumettez-la à InterProScan (intégré dans UniProt) ou NCBI CD-Search. Les résultats mettront en évidence les domaines conservés, les sites actifs et les régions de liaison, fournissant un aperçu fonctionnel même pour les protéines non caractérisées. Par exemple, la soumission d’une protéine hypothétique issue d’un échantillon métagénomique à UniProt BLAST peut révéler une homologie avec une lipase connue, InterProScan confirmant le repliement alpha/bêta hydrolase et la triade catalytique, suggérant immédiatement sa fonction biochimique. Ce flux de travail combiné de récupération et d’analyse transforme UniProt d’un référentiel de séquences statique en une plateforme de découverte pour l’annotation fonctionnelle de nouvelles protéines. Exemple d’utilisation réelle : pendant la pandémie de COVID-19, les chercheurs ont utilisé UniProt pour accéder rapidement à la séquence de la protéine spike du SARS-CoV-2 et cartographier son domaine de liaison au récepteur, accélérant les études structurales et la conception de vaccins, démontrant comment UniProt sert de point de départ critique pour la recherche rapide en réponse aux pandémies.