跳到主要内容

04 可视化:火山图、热图与蛋白互作

本章把 DEP 差异分析的结果变成能直接用于论文的图。每张图配一个最常见的用途。

配套脚本 prot04_visualization_sci.R 在 UbiLength 数据上输出 6 张可视化成品:

Rscript scripts/proteomics/prot04_visualization_sci.R

每张图看什么

Multi-contrast volcano 图 1:三个对比(Ubi1/Ubi4/Ubi6 vs Ctrl)的火山图并排。泛素链越长,显著蛋白越多、fold change 越大。一张图同时展示剂量-效应关系。

Heatmap top 30 DE 图 2:Ubi6 vs Ctrl 最显著的 30 个蛋白的 z-score 热图。列按条件排序,行聚类。可以直接看到哪些蛋白在 Ubi6 里一致上调 / 下调。

Intensity profiles 图 3:Top 6 差异蛋白在 4 个条件下的归一化强度分布。boxplot + jitter 能看到每个重复的值,确认差异不是被个别 outlier 驱动。

DE overlap 图 4:三个对比的 DE 蛋白集合重叠。"Ubi1 + Ubi4 + Ubi6" 共有的蛋白是最稳健的候选;只在 Ubi6 里出现的可能是链长度特异的效应。

LFC scatter 图 5:Ubi4 vs Ubi6 的 log2FC 散点。对角线上方的点 = Ubi6 效应更强。高相关性说明两个条件的蛋白组变化方向一致,只是幅度不同。

Top DE bar 图 6:按 |LFC| 排序的 top 20 差异蛋白条形图。红色上调、蓝色下调。写论文时直接用来列出"效应最大的候选蛋白"。

下载资源

prot04_visualization_sci.R8 KB

下载蛋白组可视化完整脚本

常见坑

坑 1:热图没做 z-score 标准化

蛋白组强度跨蛋白差异巨大(高丰度蛋白 intensity 比低丰度的高 100 倍)。不做行方向的 z-score 标准化,热图会被少数高丰度蛋白的绝对值主导,其他蛋白的变化模式完全看不出来。

坑 2:火山图标注太多基因导致不可读

标注 padj 最小的 50 个蛋白名,名字互相重叠根本看不清。建议只标注 top 10-15,或者用 ggrepel 自动避让。如果需要展示全部候选,用补充表格而不是往图上堆文字。

坑 3:用 log2FC 排序但忽略了统计显著性

条形图按 |log2FC| 排序 top 20,但其中一些 padj = 0.08。读者会误以为这些都是"显著差异蛋白"。图上应该用颜色或标记区分显著和不显著的蛋白,或者只画 padj < 0.05 的子集。

坑 4:PCA biplot 里的箭头方向被误解

PCA biplot 里变量(蛋白)的箭头方向表示该蛋白对 PC 的贡献方向,长度表示贡献大小。但很多人把箭头尖端误解为"高表达",实际上是"在该 PC 方向上的 loading"。蛋白组 PCA 通常只画 score plot(样本),不画 biplot。

下一步

接着深入

横向延伸

参考资源

AI 组学实践

让 AI 带我实战这一篇

AI 会读这篇文章后给你 3-5 步学习计划, 逐步带你学完,最后出 1-3 道题验证你掌握得怎么样。 登录后 AI 才能记住你的进度。

静态文件

离线资料下载

手册 HTML / PDF 已在后台预生成,点击后直接下载网站静态资源。