概述
基序发现是对 DNA、RNA 或蛋白质序列中短的、重复出现的序列模式的计算识别,这些序列模式对应于转录因子结合位点、剪接点、RNA 结合蛋白识别位点或蛋白质相互作用域等功能元件。与全局比对不同,基序发现侧重于小窗口(通常为 6-20 个核苷酸或 3-15 个氨基酸),即使周围序列存在分歧,位置保守性也很高。这些基序通常表示为位置权重矩阵 (PWM),捕获每个位置的每个核苷酸或氨基酸的频率。
方法
一系列算法解决主题发现问题。 基于共识的方法枚举所有可能的单词并报告那些偶然出现的频率比预期高的单词。 概率方法(例如 MEME)使用期望最大化来拟合混合模型,该模型将包含基序的序列与背景序列分开。 吉布斯采样方法在 BioProspector 等工具中实现,随机搜索序列空间以查找过度代表的模式。系统发育足迹利用相关物种的保护来识别纯化选择下的调控元件。染色质免疫沉淀随后测序 (ChIP-seq) 提供了实验衍生的峰区域,可指导相关基因组位点的基序发现。
应用程序
基序发现对于理解[基因调控和表观遗传学](/guides/gene-regulation-and-epigenics.html) 至关重要。它识别控制转录和 RNA 加工 的转录因子的结合位点。在合成生物学中,发现的基序用于设计具有可预测表达强度的合成启动子。 DNA 结构和拓扑 分析表明,某些基序优先形成二级结构,例如调节转录和复制的 G-四链体。
实用协议
MEME Suite 提供全面的从头主题发现工作流程。首先为从 RNA-seq 或 ChIP-seq 数据中识别的共调控基因准备启动子区域(例如,转录起始位点上游 500 bp)的 FASTA 文件。运行 MEME(用于基序诱导的多个 EM):memepromotes.fasta -dna -oc meme_output -mod anr -nmotifs 5 -minw 6 -maxw 20 -revcomp。参数:“-mod anr”(每个序列的任意重复次数)、“-nmotifs 5”(查找前 5 个基序)、“-minw 6”/“-maxw 20”(基序宽度范围)。 MEME 将主题输出为位置权重矩阵 (PWM),每个主题具有 E 值。检查显示主题序列徽标、每个序列的出现次数和位置偏差的 MEME HTML 报告。对于判别性基序发现(比较两个序列集),请使用 DREME:“dreme -p Positive.fasta -n negative.fasta -dna -oc dreme_output”。 DREME 可以更快地找到典型的转录因子结合位点的短核心基序 (4-8 bp)。对于 ChIP-seq 峰区域中的基序富集分析,请使用 AME(基序富集分析):ame --controlpeaks_background.fastapeaks.fastamotif_database.meme -o ame_output。使用精心策划的主题数据库,例如 JASPAR 或 HOCOMOCO。要扫描已知基序匹配的序列,请使用 FIMO:“fimo –oc fimo_output –thresh 1e-4 JASPAR2022_CORE_non-redundant.memepromotes.fasta”。 FIMO 输出与 p 值和 q 值(经过 FDR 校正)的所有匹配。通过使用 TomTom 与已知的转录因子结合图谱进行比较来验证发现的基序:“tomtom meme_output/meme.txtknown_motifs.meme -o tomtom_output”。 Tomtom 将每个查询主题分配给数据库中最接近的匹配项并报告 E 值。
资源: Lab Lexicon Motif Scanner