Visión General
UniProt (Recurso Universal de Proteínas) es el repositorio líder mundial de información sobre secuencias y funciones de proteínas. Es mantenido por un consorcio que incluye el Instituto Europeo de Bioinformática (EMBL-EBI), el Instituto Suizo de Bioinformática (SIB) y el Recurso de Información de Proteínas (PIR). UniProt integra datos de proyectos de secuenciación de genomas, curación de literatura y predicciones computacionales para proporcionar una visión única y completa de cada proteína conocida. Sus tres componentes principales, UniProtKB, UniRef y UniParc, sirven para diferentes necesidades analíticas.
Conceptos Clave
La Base de Conocimientos UniProt (UniProtKB) se divide en dos secciones: Swiss-Prot contiene entradas curadas manualmente y revisadas con anotaciones detalladas derivadas de la literatura; TrEMBL contiene entradas analizadas computacionalmente que esperan revisión manual. UniRef agrupa secuencias de proteínas en varios niveles de identidad (100%, 90%, 50%) para reducir la redundancia y acelerar las búsquedas de similitud de secuencias. UniParc es un archivo completo no redundante que rastrea todas las secuencias de proteínas de las principales bases de datos fuente. Cada entrada de UniProtKB incluye la secuencia, información de función, ubicación subcelular, modificaciones post-traduccionales, dominios y sitios, y referencias cruzadas a otras bases de datos.
Aplicaciones
UniProt sirve como la referencia principal de proteínas para la mayoría de los flujos de trabajo bioinformáticos. Los investigadores lo utilizan para recuperar secuencias para la predicción de estructura de proteínas, identificar proteínas en experimentos de proteómica y espectrometría de masas mediante búsquedas en bases de datos, y consultar anotaciones funcionales como la clasificación y nomenclatura de enzimas para estudios de rutas metabólicas.
Protocolo Práctico
Para recuperar una secuencia de proteína específica de UniProtKB, navegue a uniprot.org e introduzca el nombre del gen, nombre de la proteína o acceso (ej., TP53 o P04637) en la barra de búsqueda. La página de resultados muestra las entradas coincidentes con puntuaciones de anotación. Haga clic en una entrada para ver el registro completo: la secuencia aparece en la sección “Sequence” con formato FASTA disponible con un solo clic. Para recuperación por lotes, use la herramienta “Retrieve/ID mapping”, pegue una lista de accesos o nombres de genes, seleccione la base de datos fuente (ej., UniProtKB AC/ID) y elija el formato de destino (FASTA, separado por tabulaciones o GFF). La herramienta también mapea identificadores en más de 200 bases de datos externas. Para el análisis de dominios conservados, tome la secuencia FASTA recuperada y envíela a InterProScan (integrado dentro de UniProt) o NCBI CD-Search. Los resultados resaltarán los dominios conservados, sitios activos y regiones de unión, proporcionando información funcional incluso para proteínas no caracterizadas. Por ejemplo, enviar una proteína hipotética de una muestra metagenómica a UniProt BLAST puede revelar homología con una lipasa conocida, con InterProScan confirmando el pliegue de alfa/beta hidrolasa y la tríada catalítica, sugiriendo inmediatamente su función bioquímica. Este flujo de trabajo combinado de recuperación y análisis transforma UniProt de un repositorio de secuencias estático en una plataforma de descubrimiento para la anotación funcional de nuevas proteínas. Ejemplo de uso real: durante la pandemia de COVID-19, los investigadores utilizaron UniProt para acceder rápidamente a la secuencia de la proteína espiga del SARS-CoV-2 y mapear su dominio de unión al receptor, acelerando los estudios estructurales y el diseño de vacunas, demostrando cómo UniProt sirve como el punto de partida crítico para la investigación de respuesta rápida a pandemias.