Visão geral
O sequenciamento de RNA (RNA-seq) tornou-se o método padrão para medir a expressão gênica, substituindo abordagens anteriores baseadas em hibridização. Ao converter moléculas de RNA em uma biblioteca de cDNA e sequenciar milhões de fragmentos, o RNA-seq fornece a identidade e a abundância de transcritos em uma amostra biológica. Ao contrário dos microarranjos, o RNA-seq pode detectar novos transcritos, variantes de splice e RNAs não codificantes sem projeto prévio de sonda. A técnica oferece uma faixa dinâmica que abrange várias ordens de magnitude e resolução de base única. Os dados de RNA-seq sustentam a maioria dos estudos transcriptômicos modernos, desde organismos modelo até amostras clínicas.
Conceitos-chave
O pipeline de análise de RNA-seq começa com leituras de sequenciamento bruto, que passam por controle de qualidade (FastQC), corte do adaptador (Trimmomatic ou Cutadapt) e alinhamento a um genoma de referência usando alinhadores com reconhecimento de splice, como STAR ou HISAT2. A quantificação no nível do gene ou transcrição é realizada por ferramentas como featureCounts, RSEM ou Salmon. Os valores de expressão são normalizados como FPKM, RPKM ou TPM para levar em conta a profundidade do sequenciamento e o comprimento da transcrição. A detecção de splicing alternativo e de novas transcrições requer ferramentas especializadas, como Cufflinks ou StringTie, que montam transcrições a partir de leituras alinhadas. As métricas de qualidade incluem taxas de mapeamento, distribuição de leitura entre características genéticas e análise de saturação.
Aplicativos
O RNA-seq é aplicado em praticamente todas as áreas da biologia. Ele traça o perfil das mudanças na expressão genética na doença versus tecido saudável, identifica biomarcadores para subtipos de câncer e rastreia programas de expressão genética em desenvolvimento. Na microbiologia, o RNA-seq revela respostas transcricionais a antibióticos e ao estresse ambiental. A técnica se baseia diretamente em métodos de sequenciamento de RNA e é frequentemente integrada a fluxos de trabalho de sequenciamento de última geração. O RNA-seq também permite a descoberta de novas estruturas e tipos de RNA, incluindo RNAs não codificantes longos e RNAs circulares, expandindo nossa compreensão da complexidade do transcriptoma.
Protocolo Prático
Um pipeline padrão de RNA-seq em massa começa com arquivos FASTQ brutos do sequenciador. Primeiro, execute FastQC para avaliar métricas de qualidade, incluindo índices de qualidade por base, conteúdo de GC, contaminação do adaptador e sequências super-representadas. Apare bases de baixa qualidade e adaptadores residuais com Trimmomatic ou Cutadapt: um comando típico é trimmomatic PE sample_R1.fastq sample_R2.fastq -baseout trimmed.fq ILLUMINACLIP:adapters.fa:2:30:10 LEADING:3 TRAILING:3 SLIDINGWINDOW:4:15 MINLEN:36. Para alinhamento com reconhecimento de emenda, STAR requer um índice de genoma construído com STAR --runMode genomaGenerate --genomeFastaFiles genoma.fa --sjdbGTFfile annotation.gtf. Alinhe as leituras com STAR --runThreadN 8 --genomeDir star_index --readFilesIn trimmed_R1.fastq trimmed_R2.fastq --outSAMtype BAM SortedByCoorden. A quantificação no nível do gene usa featureCounts -a annotation.gtf -o counts.txt -t exon -g gene_id alinhado.bam, produzindo uma matriz de contagem onde as linhas são genes e as colunas são amostras. Para quantificação em nível de transcrição, Salmon fornece estimativa sem alinhamento: salmon quant -i salmon_index -l A -1 R1.fastq -2 R2.fastq -o quant_output. As métricas de controle de qualidade a serem relatadas incluem porcentagem de leitura mapeada exclusivamente (idealmente> 80%), taxa de mapeamento para regiões exônicas, tendência de 3’ e nível de contaminação de rRNA. Avalie a complexidade da biblioteca com preseq para estimar se um sequenciamento mais profundo produziria genes detectados adicionais. A matriz de contagem final é carregada em R para análise de expressão diferencial com DESeq2 ou edgeR. Para quantificação sem alinhamento, a abordagem de quase mapeamento do Salmon ignora totalmente a etapa de alinhamento, fornecendo processamento mais rápido enquanto mantém a precisão: salmon quant -i transcript_index -l A -1 reads_R1.fastq -2 reads_R2.fastq --validateMappings -o quant. O sinalizador --validateMappings melhora a sensibilidade para novas transcrições.