表观组学中的Motif研究解说
表观组学中的Motif研究解说
前言
在表观组学中,Motif基序的识别和功能研究对于理解细胞如何在不改变DNA序列的情况下调控基因表达至关重要,它是理解细胞如何通过非遗传序列的方式,如通过化学修饰或者非编码RNA等方式去调控基因表达的重要线索。
· 1.理解Motif基序的含义 ·
Motif基序是DNA、RNA或蛋白质序列中,重复出现的具有特定生物学功能、短而保守的序列。在表观遗传学中,这些基序通常会与特定的蛋白质结合,常见的为转录因子、DNA甲基化转移酶、组蛋白乙酰化酶等,一般来说结合位点并不是随机现象,它有自己的偏好性,所以我们可以通过Motif分析去挖掘这些序列的偏好性。
· 2.Motif分析 ·
在表观组学的研究中,我们把reads覆盖超级多的区域称为peaks。对于ChIPseq/Cut&Tag来说,这些所谓的peaks就是我们的转录因子或各种修饰和DNA互作的区域;对于ATAC-seq来说,这些peaks就是特定条件下的开放染色质区域;对于m6A测序来说,这些peaks就是发生m6A甲基化修饰的RNA区域。
APExBIO目前采用HOMER软件来分析和确定Motif富集程度,使用HOMER软件时,我们需要输入两套序列,分别为背景序列和目标序列,一般目标序列为差异序列或者具有特定功能的序列集,背景序列是某个物种的对应序列(比如mRNA序列),通过计算目标序列在背景序列中的富集程度来判断该Motif是否可信。
· 3.Motif结果解读 ·
Motif文件夹注释

HomerResults文件夹注释
Motif的结果主要有两大类,一类是与已知Motif数据库进行匹配,一类是利用软件进行重头预测。
HOMER软件允许输入已知的Motif数据,随后将富集到的目标序列与已知数据库进行匹配,计算Motif的富集程度,会得到一个已知Motif富集网页版报告,报告内容如下展示:

表头注释:
① Rank:根据P-value对Motif进行排序得到的排名
② Motif:该Motif的序列
③ Name:该Motif对应的转录因子,转录因子(家族)/实验细胞类型/转录因子-实验类型/HOMER软件
④ P-value:Motif富集置信度
⑤ Log Pvalue:P-value以常数e为底取对数
⑥ q-value:Bnejamini模型计算q值
⑦ # Target Sequences with Motif:富集到目标序列的数量
⑧% of Targets Sequences with Motif:富集到目标序列占总序列的百分比
⑨# Background Sequences with Motif:富集到背景序列的数量
⑩ % of Background Sequences with Motif:富集到背景序列占总序列的百分比
⑪ Motif File:Motif文件结果超链接
⑫ SVG:Motif的svg可视化文件
HOMER软件除了能显著匹配到已知数据库的Motif,还能够预测一些匹配到Motif边缘或者脱靶的序列,预测结果如下图展示:

表头注释:
① Rank:根据P-value对Motif进行排序得到的排名
② Motif:该Motif的序列
③ P-value:预测的Motif富集置信度
④ Log Pvalue:P-value以常数e为底取对数
⑤ % of Targets:靶标序列占总denovo序列的百分比
⑥% of Background:背景序列占总denovo序列的百分比
⑦ STD(Bg STD):靶标和背景的序列集出现偏离的标准偏差
⑧ Best Match/Details:最为匹配的结果
⑨ Motif File:Motif文件结果超链接
· 4.如何进行Motif的选择 ·
Motif的选择对于转录因子和靶基因的筛选至关重要,对于目前的分析结果来看,我们不能仅靠一个参数就进行判断。可主要关注两个参数P-value和% of Targets,P-value是对比到已知Motif或预测Motif的置信度,并不是P值越小越好,还需要同步考虑% of Targets值,该值越大代表富集到已知或预测到的Motif越多。对于预测的Motif还需要额外关注两个参数,这两个参数需要点开Best Match/Details列里的More Information,Score 是偏移程度的评分,最好的(偏移程度最小的)为1,Offset偏离量,越小越好。






沪公网安备 31011002003500