概述
基因组注释是将生物学意义附加到组装基因组的原始序列上的过程。它识别基因的位置、外显子-内含子边界、调控序列、重复元件和非编码 RNA。注释弥合了静态 DNA 序列与其编码的动态生物功能之间的差距。计算预测和实验证据相结合,生成基因组特征的综合图谱。随着基因组测序变得更快、更便宜,注释瓶颈,将序列数据转化为生物学洞察力,变得越来越重要。
方法
注释策略分为三类。 从头开始预测使用基因结构的统计模型(例如隐马尔可夫模型)直接从序列组成中识别编码区。 基于同源性的注释 比对来自相同或相关物种的表达序列标签、蛋白质或 RNA-seq 读数以推断基因结构。 比较注释利用多个物种的进化保守来查明功能元素。 NCBI 真核基因组注释管道等管道结合了所有三种方法,然后通过手动管理来解决不明确的情况。质量通过注释编辑距离 (AED) 等指标进行评估。
应用程序
准确的注释对于解释测序项目至关重要。在生物医学研究中,它可以通过揭示哪些基因组区域编码蛋白质或调节元件来发现致病突变。农业基因组学使用注释将基因与产量和胁迫耐受性等性状联系起来。 重组 DNA 技术 等技术依赖于可靠的基因模型进行克隆和表达。 Annotation 还通过识别操纵子和毒力因子来支持细菌遗传学,而基因调控和表观遗传学的研究则依赖于启动子、增强子和其他调控特征的精确坐标。
实用协议
MAKER 注释管道将从头开始的预测、蛋白质和转录证据集成到统一的注释中。准备一个“maker_opts.ctl”文件,指定基因组 FASTA、重复库(例如,来自 RepeatModeler)以及密切相关生物体的 EST/蛋白质比对。运行 RepeatMasker 以软掩码重复:“RepeatMasker -species哺乳动物基因组.fa”。在三轮迭代中执行 MAKER:第一轮仅使用 EST 和蛋白质证据(“maker -ggenome.fa”),它通过转录本和蛋白质的剪接比对生成初始基因模型。在第二轮中,在第一轮的高置信度 MAKER 模型上训练从头开始基因预测器(AUGUSTUS 或 SNAP):snap -train -c Score 1 -gffmaker.gffgenome.fa。第三轮在启用经过训练的预测器的情况下重新运行 MAKER,生成最终注释。 BRAKER2 使用 RNA-seq 数据将这种方法扩展到物种:将读数与“STAR”对齐,运行“BRAKER2.pl –genome=genome.fa –bam=aligned.bam –species=species”,它会自动训练 GeneMark-ET 和 AUGUSTUS。注释质量通过注释编辑距离 (AED) 指标进行评估:AED < 0.25 表示高置信度模型。对于注释良好的基因组,针对适当谱系的 BUSCO 完整性预计超过 90%。使用“gffcompare”将您的注释与现有注释进行比较。对于非编码 RNA 注释,请使用 Rfam 协方差模型运行“Infernal”。预测蛋白质的功能注释使用 InterProScan:“interproscan.sh -i Proteins.faa -f TSV -dp”,它分配基因本体术语和域注释。最终的 GFF3 文件应进行排序,使用“genometools gt gff3validator”进行验证,并使用“tabix”进行索引。