04 可视化:火山图、热图与蛋白互作
04 可视化:火山图、热图与蛋白互作
本章把 DEP 差异分析的结果变成能直接用于论文的图。每张图配一个最常见的用途。
配套脚本 prot04_visualization_sci.R 在 UbiLength 数据上输出 6 张可视化成品:
Rscript scripts/proteomics/prot04_visualization_sci.R
每张图看什么
图 1:三个对比(Ubi1/Ubi4/Ubi6 vs Ctrl)的火山图并排。泛素链越长,显著蛋白越多、fold change 越大。一张图同时展示剂量-效应关系。
图 2:Ubi6 vs Ctrl 最显著的 30 个蛋白的 z-score 热图。列按条件排序,行聚类。可以直接看到哪些蛋白在 Ubi6 里一致上调 / 下调。
图 3:Top 6 差异蛋白在 4 个条件下的归一化强度分布。boxplot + jitter 能看到每个重复的值,确认差异不是被个别 outlier 驱动。
图 4:三个对比的 DE 蛋白集合重叠。"Ubi1 + Ubi4 + Ubi6" 共有的蛋白是最稳健的候选;只在 Ubi6 里出现的可能是链长度特异的效应。
图 5:Ubi4 vs Ubi6 的 log2FC 散点。对角线上方的点 = Ubi6 效应更强。高相关性说明两个条件的蛋白组变化方向一致,只是幅度不同。
图 6:按 |LFC| 排序的 top 20 差异蛋白条形图。红色上调、蓝色下调。写论文时直接用来列出"效应最大的候选蛋白"。
下载资源
常见坑
坑 1:热图没做 z-score 标准化
蛋白组强度跨蛋白差异巨大(高丰度蛋白 intensity 比低丰度的高 100 倍)。不做行方向的 z-score 标准化,热图会被少数高丰度蛋白的绝对值主导,其他蛋白的变化模式完全看不出来。
坑 2:火山图标注太多基因导致不可读
标注 padj 最小的 50 个蛋白名,名字互相重叠根本看不清。建议只标注 top 10-15,或者用 ggrepel 自动避让。如果需要展示全部候选,用补充表格而不是往图上堆文字。
坑 3:用 log2FC 排序但忽略了统计显著性
条形图按 |log2FC| 排序 top 20,但其中一些 padj = 0.08。读者会误以为这些都是"显著差异蛋白"。图上应该用颜色或标记区分显著和不显著的蛋白,或者只画 padj < 0.05 的子集。
坑 4:PCA biplot 里的箭头方向被误解
PCA biplot 里变量(蛋白)的箭头方向表示该蛋白对 PC 的贡献方向,长度表示贡献大小。但很多人把箭头尖端误解为"高表达",实际上是"在该 PC 方向上的 loading"。蛋白组 PCA 通常只画 score plot(样本),不画 biplot。
下一步
接着深入:
- 07 STRING 与蛋白互作网络 — 把差异蛋白可视化为互作网络
- 02 DEP 差异蛋白分析 — 回顾可视化的数据来源
横向延伸:
- bulk RNA-seq 04 可视化 — 转录组的热图和火山图技巧同样适用
- R 数据整理与 ggplot2 可视化 — ggplot2 画图的基础和进阶