BioF3 组学数据分析

组学数据分析入门

导出日期:2026年6月27日

组学数据分析入门

如果是第一次接触生物信息学,这篇文章帮你建立一个清晰的认知框架:组学数据为什么需要专门的分析方法、它的整体流程长什么样、第一步该走到哪里。

从一份数据开始

假设手上有一份单细胞 RNA 测序数据:10000 个细胞 × 20000 个基因的表达矩阵,2 亿个数据点。

要回答的问题可能是:

组学分析的核心问题就在这一刻浮现:怎么从这份海量、嘈杂、稀疏的数据里,把生物学意义提取出来

组学之间的关系

理解组学,先理解中心法则把它们分成的几个层次:

DNA  ────────►  RNA  ────────►  蛋白
(基因组)       (转录组)       (蛋白组)
层次 它告诉你 主要技术
基因组(Genomics) 这个个体有什么基因、有什么变异 WGS / WES / Panel 测序
转录组(Transcriptomics) 哪些基因正在表达、表达多少 bulk RNA-seq / scRNA-seq
蛋白组(Proteomics) 哪些蛋白真的被合成出来、丰度多少 质谱
表观组(Epigenomics) 哪些基因被"打开",调控状态如何 ATAC-seq / ChIP-seq / 甲基化

三个关键点:

把组学放进这个框架里,后面学的每一篇教程都能找到自己的位置。

组学数据的四个特点

每个特点都不只是一个描述,它决定了这条数据该怎么处理。

1. 数据量大 → 工具链整体是命令行 + 脚本

一次单细胞实验产生几十 GB 原始数据。Excel 打不开、记事本卡死,靠 GUI 工具点鼠标的工作流不再适用。学组学分析的前提是接受"工具链整体跑在命令行 + 脚本里"这件事。

2. 维度高 → PCA / UMAP 不是装饰,是必经之路

人类编码基因约 2 万,全转录组(含非编码 RNA)4-6 万。这意味着每个样本对应的向量有几万维。人脑无法在几万维里直接找规律,降维(PCA / UMAP / t-SNE)是把数据"翻译"成人能看的形式,不是为了好看。

3. 噪音多 → 永远看分布和重复,别看单点

生物学实验本身有变异(同一组织取两次切片不完全一样),测序技术也有误差(PCR 偏差、批次效应)。任何单一数据点都不可靠,下游分析要靠分布、重复、统计检验才能从噪音里捞出真信号。

4. 稀疏 → 单细胞要专门处理 dropout

单细胞数据里大量基因在大多数细胞中表达量为 0,部分是技术 dropout(基因实际表达但没测到),部分是真实未表达。对这种稀疏矩阵,普通线性方法(CPM / log)会失真,所以才有 SCTransform、scVI 这种专门的方法。

分析流程概览

一份组学项目从原始数据到结论,大致 9 步:

  1. 数据获取:从测序仪下机的 FASTQ 文件,或从 GEO/TCGA 等公共库下载
  2. 质量控制:检查测序质量、过滤低质量 reads(FastQC / MultiQC)
  3. 序列比对:把 reads 比对回参考基因组(Cell Ranger / STAR / BWA)
  4. 表达矩阵构建:统计每个基因在每个样本/细胞里的 reads 数
  5. 数据标准化:去掉测序深度差异(CPM / TPM / SCTransform)
  6. 降维 + 聚类:把高维数据投到 2D 看结构(PCA / UMAP),然后聚类
  7. 差异分析:比较组间表达差异,找标志基因
  8. 功能注释:用 GO / KEGG / GSEA 把基因列表翻译成生物学故事
  9. 可视化:热图、火山图、UMAP 等 — 让结果说话

这 9 步可以分成两段:

学习时这两段可以分开攻:先用现成矩阵跑通第 5-9 步(很多教程数据集自带矩阵),等对结果有感觉了再回头补 1-4 的数据工程。这样能更快建立成就感和判断力。

学习路径建议

第 1 阶段:能跑起来(2-4 周)

选一门主语言(推荐 R 起步,单细胞主流工具用 R),能完成最小可复现的小任务:

强烈建议先看一眼 AI 辅助编程与智能体工具,了解什么时候该让 AI 帮忙、什么时候不该。

第 2 阶段:跑通完整流程(4-8 周)

跟着教程从原始数据走到最终结果。先不深究每个参数为什么这么选,优先把流程跑通一次

推荐 单细胞实践 01-04

第 3 阶段:理解每一步在做什么(2-3 个月)

回过头来看每一步的原理,调参看效果变化,读相关文献和工具文档。

推荐 单细胞实践 05-10

第 4 阶段:独立做项目(持续)

用自己的或公开数据做完整分析。这一阶段标志是:遇到问题不再问"我该用什么工具",而是问"这个生物学问题最适合的方法是什么"。

常见误区

"工具越新越好"

新工具可能引用量很高但默认参数不一定稳。成熟工具(Seurat / DESeq2 / clusterProfiler)经过多年大量数据验证,先用它们建立基线再尝试新方法更稳妥。

"参数复杂 = 严谨"

绝大多数主流工具的默认参数已经是经过精心调过的。盲目调参可能把模型推到训练数据外的区域。理解参数含义比调参更重要

"p < 0.05 就是好结果"

p 值只是统计学显著性,不代表生物学意义。一个 padj=1e-50 但 log2FC=0.1 的基因,统计上极显著,生物学上几乎没区别。要 padj fold change 一起看。

"图越炫越有说服力"

清晰准确比炫酷重要。一张干净的散点图、火山图、热图比 3D 旋转图更能说服审稿人。把图当成证据,不是装饰。

持续学习

下一步

接着深入(按推荐顺序读下去):

  1. 编程基础 — 选定一门主语言,建立最小工作流
  2. 数据与环境准备 — 把后续脚本要的数据和包准备好,避免每次报错都查
  3. 单细胞实践 01:实践数据集与数据获取 — 第一个完整可跑的真实流程

横向延伸(任意时机看):