Descripción general
El análisis de K-mer descompone secuencias biológicas en todas las subcadenas posibles de una longitud fija k y cuenta sus frecuencias. Esta técnica simple pero poderosa captura las propiedades de composición de genomas y transcriptomas sin requerir alineación, lo que la hace computacionalmente eficiente y sin referencias. Las distribuciones de frecuencia de K-mer revelan el tamaño del genoma, la heterocigosidad, el contenido repetido y las tasas de error de secuenciación a partir de lecturas sin procesar antes de cualquier paso de ensamblaje. La elección de k implica una compensación: los valores pequeños de k (k < 20) proporcionan recuentos sólidos pero un poder discriminativo limitado, mientras que los valores grandes de k (k > 50) ofrecen una alta especificidad pero una cobertura menor.
Conceptos clave
El espectro de k-mer (un histograma de frecuencias de aparición de k-mer) sigue una distribución similar a Poisson en datos ideales. Los k-mers erróneos debido a errores de secuenciación aparecen como singletons (frecuencia 1), mientras que los k-mers genómicos genuinos forman un pico en la profundidad de cobertura esperada. Las repeticiones genómicas producen picos adicionales a multiplicidades más altas. Herramientas como Jellyfish y KMC cuentan de manera eficiente los k-mers utilizando tablas hash o matrices de sufijos. Más allá del recuento, los métodos basados en k-meros incluyen distancia de k-meros (la fracción de k-meros compartidos entre dos muestras) para la filogenia, cobertura de k-mero para estimar el tamaño del genoma y espectros de k-mero para la corrección de errores eliminando los k-meros por debajo de un umbral de cobertura.
Aplicaciones
El análisis de K-mer es parte integral del control de calidad de la secuenciación de próxima generación, detectando contaminación y estimando la cobertura antes del ensamblaje. En genética bacteriana, los métodos basados en k-mer distinguen las cepas por sus firmas de composición únicas. La agrupación metagenómica utiliza vectores de frecuencia k-mer para agrupar contigs del mismo organismo. Los proyectos de secuenciación de ADN utilizan el recuento de k-mer para corregir errores de secuenciación reemplazando bases erróneas que crean k-mers de baja frecuencia.
Protocolo práctico
Para contar k-mer con Jellyfish, comience desde archivos FASTQ sin formato: jellyfish count -m 21 -s 100M -t 8 -C -o kmers.jf reads.fastq. Parámetros: -m 21 establece el tamaño de k-mer en 21 (un equilibrio predeterminado común de especificidad y cobertura), -s 100M establece el tamaño de hash inicial (aumento para genomas grandes), -C cuenta ambas cadenas (k-mers canónicos), -t 8 usa 8 subprocesos. Para genomas grandes (humanos, ~3 Gb), aumente el tamaño del hash: -s 3G. Genere un histograma de frecuencia k-mer: jellyfish histo -o kmers.histo kmers.jf. Trazar el histograma para visualizar el espectro de k-mer: el primer pico en la frecuencia 1 representa errores de secuenciación (singletons), el pico principal en la profundidad de cobertura esperada representa k-mers genómicos auténticos y los picos adicionales en frecuencias más altas indican secuencias repetitivas. Calcule el tamaño del genoma usando la fórmula: tamaño_genoma = total_k_mers / pico_frecuencia. Por ejemplo, si el pico principal tiene una cobertura de 20 × y el total de k-meros es 60 millones, entonces el tamaño del genoma ≈ 3 millones de pb. Utilice GenomeScope (herramienta web) para ajustar un modelo de espectro k-mer y estimar el tamaño del genoma, la heterocigosidad y el contenido repetido. Para la detección de contaminación, ejecute KMC para conjuntos de datos muy grandes: kmc -k21 -m64 -t8 -ci1 reads.fastq kmc_output workdir. Comparar el espectro k-mer con firmas de referencia conocidas; Los k-meros inesperados de alta frecuencia que no coinciden con el genoma esperado pueden indicar contaminación bacteriana o del adaptador. Para la agrupación metagenómica, calcule los vectores de frecuencia k-mer (normalmente frecuencias de tetranucleótidos, k = 4) en ventanas de 5 kb a lo largo de contigs ensamblados usando seqtk comp o scripts personalizados, luego agrupe los contigs por similitud de composición usando k-means o agrupación jerárquica implementada en MetaBAT2. Para discriminar tensiones, utilice Mash para calcular distancias k-mer entre secuencias de consulta y bases de datos de referencia: mash sketch genome.fasta; mash dist genome.msh reference.msh > distancias.txt. La distancia Mash se aproxima a la tasa de mutación entre genomas.
recurso: Analizador de composición Lab Lexicon K-mer