跳到主要内容

05 Motif 富集与 HOMER

Peak 本身只是"这里有信号",motif 分析回答的是"什么转录因子可能在这里结合"。思路是:从 peak 序列里统计过表达的短序列模式(motif),和已知 TF motif 数据库比对。

常用工具

工具特点
HOMER一条命令出完整报告(已知 + de novo motif),最常用
MEME Suite学术标准,de novo 发现能力强
motifmatchr + JASPARR 里做 motif scanning,适合和 DiffBind 结果联动

HOMER 典型用法

# 安装 HOMER(一次性)
# http://homer.ucsd.edu/homer/introduction/install.html

# 对 narrowPeak 做 motif 富集
findMotifsGenome.pl peaks.narrowPeak hg38 motif_output/ \
-size 200 -mask -p 8

-size 200 表示取 peak summit 两侧各 100bp 做分析。输出目录里会有:

  • knownResults.html — 已知 motif 的富集排名
  • homerResults.html — de novo 发现的 motif
  • 每个 motif 的 logo 图

R 里做 motif scanning

library(motifmatchr)
library(TFBSTools)
library(JASPAR2020)

# 获取 JASPAR 的人类 TF motif
pfm_list <- getMatrixSet(JASPAR2020, opts = list(species = "Homo sapiens"))

# 在 peak 序列里扫描 motif
library(BSgenome.Hsapiens.UCSC.hg38)
motif_hits <- matchMotifs(pfm_list, peaks_gr, genome = BSgenome.Hsapiens.UCSC.hg38)

# 统计每个 motif 在 DE peaks vs non-DE peaks 里的富集

这种方式的好处是能和 DiffBind 的差异结合结果直接联动:只看"在耐药细胞里 gained 的 peak 富集了什么 motif"。

解读要点

  • 已知 motif 富集:如果你做的是 AR ChIP-seq,排第一的应该是 ARE(androgen response element)。如果不是,说明实验或分析有问题。
  • de novo motif:HOMER 会尝试从头发现新 motif。如果 de novo 结果和已知 motif 高度相似,说明信号很强。
  • 背景选择:默认用随机基因组区域做背景。如果你的 peak 集中在启动子,用"所有启动子"做背景会更严格。

motif 富集的常见误判

motif 分析容易出"看上去显著但其实没意义"的结果。三件事注意一下:

1. 富集 motif 不一定是"驱动" TF

motif 富集只是说"这些 peak 序列上有这种 motif",不等于该 TF 真的在这些 peak 上结合。一个 motif 可能被多个 TF 家族识别(e.g. AP-1 家族),具体哪个亚型起作用要靠 ChIP-seq 验证。

2. 富集结果受背景集严重影响

用全基因组随机区域当背景 → 启动子相关 motif 都会显著(启动子本身就富集 motif);用同等数量的非 DB peak 当背景 → 才能看出"DB 特异的 motif"。设计 motif 分析前先想清楚要回答的问题再选背景

3. CG 含量需要匹配

Peak 的 CG 含量高,富集出的 motif 也会偏向高 CG(CpG 岛特征)。HOMER 的 -mset-bg 选项可以传匹配 CG 含量的背景,避免 GC bias 假阳性。

常见坑

坑 1:HOMER 装在 conda 但参考基因组没下

findMotifsGenome.pl peaks.bed hg38 ... 需要 HOMER 自己下载 hg38 reference (configureHomer.pl -install hg38)。首次跑会卡很久,国内有时下载失败。预先 configureHomer.pl -list 看可用版本。

坑 2:peak 数量太少(< 200)出不来 motif

motif 算法需要足够多的 peak 序列做统计。< 100 个 peak 几乎跑不出有意义的结果。peak 太少时改用 known motif scanning(每个 peak 单独对照已知 motif)。

坑 3:把"motif 富集"和"motif 强度"混淆

"显著富集" = 出现频率高于背景;"motif 强度"= 序列和共识 motif 的相似度。HOMER Motif.Score 是后者,rank by % of Targets 是前者。报告时分清楚。

坑 4:motif logo 图嵌进 PPT 时模糊

HOMER 默认输出的 logo PNG 分辨率低。用 MEME / Tomtom 出 SVG,或直接 R 里 seqLogo 包重画

坑 5:JASPAR / HOCOMOCO / CIS-BP 的 motif 名字不一致

跨数据库比较时 STAT1 在 JASPAR 是 MA0137.3,在 HOMER 是 STAT1(IPR007726)做整合前先 unify 成统一 ID 系统(一般用 TF symbol)。

下一步

接着深入

横向延伸

参考资源

AI 组学实践

让 AI 带我实战这一篇

AI 会读这篇文章后给你 3-5 步学习计划, 逐步带你学完,最后出 1-3 道题验证你掌握得怎么样。 登录后 AI 才能记住你的进度。

静态文件

离线资料下载

手册 HTML / PDF 已在后台预生成,点击后直接下载网站静态资源。