Descripción general
La llamada de variantes es el proceso computacional de identificar diferencias entre el genoma de un individuo y un genoma de referencia. Estas diferencias van desde polimorfismos de un solo nucleótido (SNP) y pequeñas inserciones o eliminaciones (indeles) hasta grandes variantes estructurales como cambios en el número de copias y reordenamientos cromosómicos. La detección precisa de variantes es la piedra angular de la genética humana, la medicina de precisión y la biología evolutiva. El proceso requiere un modelado estadístico cuidadoso para distinguir la variación biológica genuina de los errores de secuenciación y los artefactos de alineación.
Conceptos clave
La mayoría de los llamadores de variantes siguen un flujo de trabajo común: las lecturas de secuenciación se alinean primero con un genoma de referencia utilizando herramientas como BWA o Bowtie2, luego los datos alineados se procesan para identificar posiciones donde la secuencia del individuo difiere de la referencia. La línea de mejores prácticas del kit de herramientas de análisis del genoma (GATK) se adopta ampliamente y utiliza un enfoque bayesiano para calcular las probabilidades de genotipo. Las consideraciones clave incluyen la profundidad de la cobertura (una mayor profundidad mejora la confianza), puntuaciones de calidad base y calidad del mapeo. El filtrado de variantes mediante umbrales estrictos o aprendizaje automático (por ejemplo, VQSR) elimina los falsos positivos. La detección de variantes estructurales requiere herramientas especializadas como DELLY o Manta que analizan pares de lecturas discordantes y lecturas divididas.
Aplicaciones
La llamada de variantes impulsa la genómica tanto clínica como de investigación. Identifica mutaciones subyacentes a trastornos genéticos raros e informa la genómica del cáncer al revelar mutaciones somáticas en comparaciones entre tumores normales. Proyectos a escala poblacional como el Proyecto 1000 Genomas han catalogado millones de variantes para mapear la diversidad humana. En las enfermedades infecciosas, las llamadas de variantes rastrean la evolución de los patógenos y la resistencia a los medicamentos. La precisión de las llamadas de variantes depende fundamentalmente de la calidad de los datos de secuenciación de próxima generación y de la plataforma de secuenciación de ADN utilizada.
Protocolo práctico
El flujo de trabajo de mejores prácticas de GATK para el descubrimiento de variantes cortas de línea germinal pasa por varias etapas. Comience con archivos BAM alineados de BWA-MEM: bwa mem -t 8 -R "@RG\tID:sample\tSM:sample\tLB:lib\tPL:ILLUMINA" reference.fa sample_R1.fastq sample_R2.fastq > alineado.sam. Ordene y convierta a BAM con samtools sort. Marque los duplicados usando GATK MarkDuplicates para marcar los duplicados de PCR, luego indexe con samtools index. La recalibración del puntaje de calidad base (BQSR) corrige errores sistemáticos en las calidades base: primero cree un modelo de recalibración con Gatk BaseRecalibrator -R reference.fa -I dedup.bam --known-sites dbsnp.vcf -O recal.table, luego aplíquelo con Gatk ApplyBQSR -R reference.fa -I dedup.bam --bqsr-recal-file recal.table -O recal.bam. La variante que llama a muestras individuales utiliza Gatk HaplotypeCaller -R reference.fa -I recal.bam -O sample.g.vcf -ERC GVCF, lo que produce un gVCF para el genotipado conjunto. Agregue muestras con Gatk GenomicsDBImport y llame conjuntamente con Gatk GenotypeGVCFs -R reference.fa -V cohort.g.vcf -O raw_variants.vcf. El filtrado de variantes utiliza la recalibración del nivel de calidad de variantes (VQSR): Gatk VariantRecalibrator crea un modelo de mezcla gaussiana utilizando sitios de verdad conocidos (HapMap, Omni, 1000G) y Gatk ApplyVQSR aplica un filtro de tramo (normalmente 99,0% de sensibilidad para SNP, 99,5% para indeles). Para la detección de variantes estructurales, ejecute Manta con su script de configuración seguido de la ejecución del flujo de trabajo. Evalúe los conjuntos de llamadas finales con Gatk CollectVariantCallingMetrics y verifique la relación de transición/transversión: un Ti/Tv de alrededor de 2,0 a 2,1 indica alta calidad para los datos del genoma humano completo.