Skip to content

Article image
Búsqueda de bases de datos de secuencias con BLAST

May 16, 2026 · Updated: May 25, 2026

Descripción general

BLAST (Herramienta de búsqueda de alineación local básica) es el algoritmo más utilizado para comparar una secuencia de consulta con una base de datos de secuencias conocidas. Identifica rápidamente alineamientos locales estadísticamente significativos, proporcionando anotaciones funcionales para genes nuevos, detectando homología entre especies distantes y revelando relaciones evolutivas. BLAST sacrifica la optimización garantizada de la programación dinámica completa por una heurística que es lo suficientemente rápida como para buscar bases de datos que contienen miles de millones de residuos. La significación estadística de cada acierto se informa como un valor E: el número esperado de alineaciones probables con una puntuación determinada en una base de datos de ese tamaño.

Conceptos clave

BLAST funciona dividiendo primero la consulta en palabras cortas (normalmente 3 para proteínas, 11 para nucleótidos), escaneando la base de datos en busca de coincidencias exactas con estas palabras y luego extendiendo coincidencias prometedoras en ambas direcciones para construir alineaciones más largas. Las variantes abordan casos de uso específicos: BLASTP compara consultas de proteínas con bases de datos de proteínas, BLASTN compara consultas de nucleótidos con bases de datos de nucleótidos, BLASTX traduce una consulta de nucleótidos en los seis marcos de lectura para comparar el nivel de proteínas y PSI-BLAST construye de forma iterativa una matriz de puntuación de posición específica para detectar homólogos distantes. MegabLAST está optimizado para secuencias muy similares, mientras que MegabLAST no contiguo maneja comparaciones entre especies.

Aplicaciones

BLAST es el primer paso para anotar datos desconocidos de proyectos de secuenciación de ADN. Asigna una función putativa a nuevas proteínas mediante la detección de homología con [estructuras proteicas] caracterizadas (/guides/protein-structure.html). En genética bacteriana, BLAST identifica factores de virulencia y genes de resistencia a los antibióticos. La tecnología de ADN recombinante utiliza BLAST para verificar la integridad de la construcción alineando las lecturas de secuenciación con las secuencias de vectores esperadas.

Protocolo práctico

Las búsquedas BLAST estándar se ejecutan a través de la interfaz web o la línea de comandos del NCBI. Para una consulta de proteínas en la base de datos nr usando la línea de comandos BLAST: blastp -query query.fasta -db nr -out results.txt -evalue 1e-5 -num_threads 8 -outfmt "6 qseqid sseqid pident length mismatch gapopen qstart qend sstart send evalue bitscore stitle". El -outfmt 6 produce una salida tabular ideal para el análisis posterior. El valor E (valor esperado) representa el número de aciertos esperados por casualidad en una puntuación determinada dado el tamaño de la base de datos; los valores <1 × 10⁻⁵ para proteínas o <1 × 10⁻¹⁰ para nucleótidos indican una homología significativa. La puntuación de bits es una puntuación normalizada independiente del tamaño de la base de datos, lo que permite la comparación entre búsquedas; Las puntuaciones superiores a 50 suelen ser significativas para las proteínas. Para una búsqueda traducida (consulta de nucleótidos en la base de datos de proteínas), utilice BLASTX: blastx -query ests.fasta -db swissprot -out blastx_results.txt -evalue 1e-5. Para secuencias muy similares, utilice MegabLAST: blastn -task megablast -query query.fna -db nt -out megablast_results.txt -evalue 1e-50. Optimice los parámetros: reduzca el tamaño de la palabra a 2 (para proteínas) o 7 (para nucleótidos) para aumentar la sensibilidad a homólogos distantes; aumentar el umbral para extender los accesos a semillas. Para una búsqueda de perfil iterativa, ejecute PSI-BLAST: psiblast -query seed.fasta -db nr -out psi_results.txt -num_iterations 3 -evalue 1e-3. PSI-BLAST construye una matriz de puntuación de posición específica (PSSM) a partir de los golpes de la primera ronda y la utiliza para rondas posteriores, detectando homólogos remotos que el BLAST estándar no detecta. Para búsquedas por lotes a gran escala, utilice diamond, que es entre 100 y 1000 veces más rápido que BLASTP: diamond blastp -d nr.dmnd -q query.fasta -o Diamond_results.txt --outfmt 6 --evalue 1e-5 --threads 16.