Visión General
Las bases de datos de variación catalogan sistemáticamente las diferencias genéticas que distinguen a los individuos e impulsan la diversidad fenotípica, incluida la susceptibilidad a enfermedades. A medida que las tecnologías de secuenciación han madurado, el número de variantes genéticas humanas conocidas ha crecido exponencialmente, alcanzando cientos de millones de entradas. Las bases de datos de variación cumplen dos funciones críticas: definen el espectro basal de la variación poblacional normal, contra el cual se pueden identificar variantes asociadas a enfermedades, y agregan interpretaciones clínicas que guían las decisiones diagnósticas y terapéuticas.
Conceptos Clave
dbSNP (Base de Datos de Polimorfismos de Nucleótido Simple) cataloga variantes de un solo nucleótido, pequeñas inserciones y deleciones, y repeticiones de microsatélites. Cada variante recibe un identificador rs (SNP de referencia). Los registros de dbSNP incluyen datos de frecuencia alélica de grandes estudios poblacionales como el Proyecto 1000 Genomas y gnomAD. ClinVar se centra en la relación entre variantes genéticas y la salud humana, proporcionando clasificaciones de significancia clínica (patogénica, benigna, significancia incierta) con evidencia de apoyo. COSMIC (Catálogo de Mutaciones Somáticas en Cáncer) cataloga mutaciones somáticas encontradas en cánceres humanos, incluyendo mutaciones puntuales, alteraciones del número de copias y fusiones génicas.
Aplicaciones
Las bases de datos de variación son herramientas esenciales en medicina genómica. Los proyectos de secuenciación de ADN usan dbSNP para filtrar polimorfismos comunes de variantes candidatas patogénicas. Los pipelines de secuenciación de próxima generación anotan variantes contra ClinVar para priorizar hallazgos clínicamente accionables. La investigación en bioquímica del cáncer se basa en COSMIC para identificar mutaciones conductoras, mientras que los estudios de mecanismos de reparación del ADN conectan firmas mutacionales con deficiencias específicas en rutas de reparación.
Protocolo Práctico
Para consultar ClinVar en busca de una variante asociada a una enfermedad, vaya a ncbi.nlm.nih.gov/clinvar y busque por nombre de gen, variante (ej., “BRCA1 VUS”) o fenotipo. Cada registro muestra la clasificación de significancia clínica (Patogénica, Probablemente Patogénica, Significancia Incierta, Probablemente Benigna, Benigna) junto con el estado de revisión y el recuento de evidencia de apoyo. Para un flujo de trabajo de interpretación de variantes missense: comience con las coordenadas genómicas de la variante de su pipeline de secuenciación. Use el rsID de dbSNP para obtener datos de frecuencia poblacional de la tabla “Freq”, las variantes con frecuencia alélica >1% en gnomAD son poco probables de ser patogénicas para enfermedades raras. Haga clic en ClinVar para evaluar si la variante ha sido reportada clínicamente. Si la variante es nueva (sin rsID), use herramientas como SIFT o PolyPhen-2 (enlazadas desde la sección “Molecular Consequence” de dbSNP) para predecir el impacto funcional de la sustitución de aminoácidos. Para un ejemplo concreto, considere un exoma de paciente que revela una variante missense en MYH7 (p.Arg403Trp). La consulta en dbSNP muestra rs121913652 con una frecuencia rara (0.002% en gnomAD). ClinVar clasifica esta variante como Patogénica para miocardiopatía hipertrófica familiar, apoyada por estudios funcionales que demuestran una unión alterada a la actina. COSMIC confirma que este residuo no está recurrentemente mutado en cáncer, estrechando el diagnóstico diferencial. Este flujo de trabajo escalonado, filtrado de frecuencia, anotación clínica y predicción funcional, convierte llamadas de variantes crudas en información clínicamente accionable. A medida que la secuenciación clínica se vuelve rutinaria, los pipelines automatizados integran cada vez más estas bases de datos para generar informes de interpretación de variantes en tiempo real para los médicos.