Skip to content

Article image
UniProt e Bancos de Dados de Sequências de Proteínas

May 16, 2026

Visão Geral

O UniProt (Universal Protein Resource) é o principal repositório mundial de informações sobre sequência e função de proteínas. É mantido por um consórcio que inclui o Instituto Europeu de Bioinformática (EMBL-EBI), o Instituto Suíço de Bioinformática (SIB) e o Protein Information Resource (PIR). O UniProt integra dados de projetos de sequenciamento de genomas, curadoria de literatura e predições computacionais para fornecer uma visão única e abrangente de cada proteína conhecida. Seus três componentes principais, UniProtKB, UniRef e UniParc, atendem a diferentes necessidades analíticas.

Conceitos-Chave

UniProt Knowledgebase (UniProtKB) é dividida em duas seções: Swiss-Prot contém entradas curadas manualmente e revisadas com anotações detalhadas derivadas da literatura; TrEMBL contém entradas analisadas computacionalmente aguardando revisão manual. UniRef agrupa sequências de proteínas em vários níveis de identidade (100%, 90%, 50%) para reduzir redundância e acelerar buscas de similaridade de sequências. UniParc é um arquivo abrangente não redundante que rastreia todas as sequências de proteínas dos principais bancos de dados fonte. Cada entrada do UniProtKB inclui a sequência, informações de função, localização subcelular, modificações pós-traducionais, domínios e sítios, e referências cruzadas para outros bancos de dados.

Aplicações

O UniProt serve como a referência primária de proteínas para a maioria dos fluxos de trabalho bioinformáticos. Pesquisadores o utilizam para recuperar sequências para predição de estrutura de proteínas, identificar proteínas em experimentos de proteômica e espectrometria de massas através de buscas em bancos de dados, e consultar anotações funcionais como classificação e nomenclatura de enzimas para estudos de vias metabólicas.

Protocolo Prático

Para recuperar uma sequência de proteína específica do UniProtKB, navegue até uniprot.org e digite o nome do gene, nome da proteína ou acesso (ex., TP53 ou P04637) na barra de pesquisa. A página de resultados exibe as entradas correspondentes com pontuações de anotação. Clique em uma entrada para ver o registro completo: a sequência aparece na seção “Sequence” com formato FASTA disponível com um clique. Para recuperação em lote, use a ferramenta “Retrieve/ID mapping”, cole uma lista de acessos ou nomes de genes, selecione o banco de dados fonte (ex., UniProtKB AC/ID) e escolha o formato de destino (FASTA, separado por tabulações ou GFF). A ferramenta também mapeia identificadores para mais de 200 bancos de dados externos. Para análise de domínios conservados, pegue a sequência FASTA recuperada e submeta-a ao InterProScan (integrado no UniProt) ou NCBI CD-Search. Os resultados destacarão domínios conservados, sítios ativos e regiões de ligação, fornecendo insights funcionais mesmo para proteínas não caracterizadas. Por exemplo, submeter uma proteína hipotética de uma amostra metagenômica ao BLAST do UniProt pode revelar homologia com uma lipase conhecida, com o InterProScan confirmando o dobramento alfa/beta hidrolase e a tríade catalítica, sugerindo imediatamente sua função bioquímica. Este fluxo de trabalho combinado de recuperação e análise transforma o UniProt de um repositório de sequências estático em uma plataforma de descoberta para anotação funcional de novas proteínas. Exemplo de uso real: durante a pandemia de COVID-19, pesquisadores usaram o UniProt para acessar rapidamente a sequência da proteína spike do SARS-CoV-2 e mapear seu domínio de ligação ao receptor, acelerando estudos estruturais e o design de vacinas, demonstrando como o UniProt serve como ponto de partida crítico para pesquisa de resposta rápida a pandemias.