05 Motif 富集与 HOMER
05 Motif 富集与 HOMER
Peak 本身只是"这里有信号",motif 分析回答的是"什么转录因子可能在这里结合"。思路是:从 peak 序列里统计过表达的短序列模式(motif),和已知 TF motif 数据库比对。
常用工具
| 工具 | 特点 |
|---|---|
| HOMER | 一条命令出完整报告(已知 + de novo motif),最常用 |
| MEME Suite | 学术标准,de novo 发现能力强 |
| motifmatchr + JASPAR | R 里做 motif scanning,适合和 DiffBind 结果联动 |
HOMER 典型用法
# 安装 HOMER(一次性)
# http://homer.ucsd.edu/homer/introduction/install.html
# 对 narrowPeak 做 motif 富集
findMotifsGenome.pl peaks.narrowPeak hg38 motif_output/ \
-size 200 -mask -p 8
-size 200 表示取 peak summit 两侧各 100bp 做分析。输出目录里会有:
knownResults.html— 已知 motif 的富集排名homerResults.html— de novo 发现的 motif- 每个 motif 的 logo 图
R 里做 motif scanning
library(motifmatchr)
library(TFBSTools)
library(JASPAR2020)
# 获取 JASPAR 的人类 TF motif
pfm_list <- getMatrixSet(JASPAR2020, opts = list(species = "Homo sapiens"))
# 在 peak 序列里扫描 motif
library(BSgenome.Hsapiens.UCSC.hg38)
motif_hits <- matchMotifs(pfm_list, peaks_gr, genome = BSgenome.Hsapiens.UCSC.hg38)
# 统计每个 motif 在 DE peaks vs non-DE peaks 里的富集
这种方式的好处是能和 DiffBind 的差异结合结果直接联动:只看"在耐药细胞里 gained 的 peak 富集了什么 motif"。
解读要点
- 已知 motif 富集:如果你做的是 AR ChIP-seq,排第一的应该是 ARE(androgen response element)。如果不是,说明实验或分析有问题。
- de novo motif:HOMER 会尝试从头发现新 motif。如果 de novo 结果和已知 motif 高度相似,说明信号很强。
- 背景选择:默认用随机基因组区域做背景。如果你的 peak 集中在启动子,用"所有启动子"做背景会更严格。
motif 富集的常见误判
motif 分析容易出"看上去显著但其实没意义"的结果。三件事注意一下:
1. 富集 motif 不一定是"驱动" TF
motif 富集只是说"这些 peak 序列上有这种 motif",不等于该 TF 真的在这些 peak 上结合。一个 motif 可能被多个 TF 家族识别(e.g. AP-1 家族),具体哪个亚型起作用要靠 ChIP-seq 验证。
2. 富集结果受背景集严重影响
用全基因组随机区域当背景 → 启动子相关 motif 都会显著(启动子本身就富集 motif);用同等数量的非 DB peak 当背景 → 才能看出"DB 特异的 motif"。设计 motif 分析前先想清楚要回答的问题再选背景。
3. CG 含量需要匹配
Peak 的 CG 含量高,富集出的 motif 也会偏向高 CG(CpG 岛特征)。HOMER 的 -mset 或 -bg 选项可以传匹配 CG 含量的背景,避免 GC bias 假阳性。
常见坑
坑 1:HOMER 装在 conda 但参考基因组没下
findMotifsGenome.pl peaks.bed hg38 ... 需要 HOMER 自己下载 hg38 reference (configureHomer.pl -install hg38)。首次跑会卡很久,国内有时下载失败。预先 configureHomer.pl -list 看可用版本。
坑 2:peak 数量太少(< 200)出不来 motif
motif 算法需要足够多的 peak 序列做统计。< 100 个 peak 几乎跑不出有意义的结果。peak 太少时改用 known motif scanning(每个 peak 单独对照已知 motif)。
坑 3:把"motif 富集"和"motif 强度"混淆
"显著富集" = 出现频率高于背景;"motif 强度"= 序列和共识 motif 的相似度。HOMER Motif.Score 是后者,rank by % of Targets 是前者。报告时分清楚。
坑 4:motif logo 图嵌进 PPT 时模糊
HOMER 默认输出的 logo PNG 分辨率低。用 MEME / Tomtom 出 SVG,或直接 R 里 seqLogo 包重画。
坑 5:JASPAR / HOCOMOCO / CIS-BP 的 motif 名字不一致
跨数据库比较时 STAT1 在 JASPAR 是 MA0137.3,在 HOMER 是 STAT1(IPR007726)。做整合前先 unify 成统一 ID 系统(一般用 TF symbol)。
下一步
接着深入:
- 06 ATAC-seq 分析要点 — ATAC 的 peak motif 分析有自己的细节
- 08 表观组与转录组的整合 — motif 富集的 TF 是否在 RNA-seq 里也有差异
横向延伸:
- 03 DiffBind 差异结合分析 — motif 分析最有价值是和 differential peak 联动
- HOMER 官方文档 — 完整的命令行参数手册