跳到主要内容

单细胞转录组分析入门指南

· 阅读需 5 分钟
BioF3 团队
生物信息学数据分析专家

单细胞转录组测序(scRNA-seq)把"测一个样本平均表达"提升到"一个样本里每个细胞表达多少"。它让"细胞异质性"、"稀有亚群"、"连续分化状态"这些原来只能靠流式或免疫组化间接看到的现象,第一次能在大规模基因表达层面直接分析。

本文简单讲清它和 bulk RNA-seq 的区别、一条标准分析链有哪些步骤、以及你在 BioF3 里可以按什么顺序学。

和 bulk RNA-seq 比的差别

特性bulk RNA-seqscRNA-seq
分辨率样本平均(一堆细胞混着)每个细胞独立测
能看到细胞异质性吗不能可以
能发现稀有细胞类型吗相对容易
典型数据体积几十 MB 到 GB几 GB 到几十 GB
每样本成本中-高

bulk RNA-seq 至今仍然是很多项目的默认选择:细胞群体信号够强,成本低,统计模型成熟。什么时候要上单细胞? 当你的问题依赖于"细胞层面的差异"——比如肿瘤内异质性、发育轨迹、免疫细胞亚群组成、细胞状态转换等。

一条标准分析链

一个 10x Chromium 项目从下机数据到"一张 UMAP + 细胞类型注释 + 差异基因" 之间大致要走:

  1. 原始数据处理(Cell Ranger / STARsolo):FASTQ → 表达矩阵
  2. 质量控制:过滤空液滴、破损细胞和双细胞
  3. 标准化 + 高变基因选择:LogNormalize 或 SCTransform
  4. 降维(PCA → UMAP)和聚类(Leiden / Louvain)
  5. 细胞类型注释:手动 marker 或 SingleR 自动
  6. 差异表达 + 功能富集:比较感兴趣的簇或条件

对应的工具一半在 R(Seurat 生态)一半在 Python(Scanpy 生态)。两边的分析思路是相通的,切换主要是语法和对象结构。

BioF3 里的学习路径

如果你从 0 开始,建议按这个顺序走:

  1. 基础入门 — 把环境、R/Python、Jupyter、公共数据库这几件事先过一遍(不需要精通,能跑脚本就行)
  2. 模块 01 实践数据集与数据获取 — 下载 PBMC 3k 真实数据
  3. 模块 02 原始数据处理与 Cell Ranger — 理解表达矩阵怎么来的
  4. 模块 03 质量控制、聚类与细胞类型注释 — 最完整的一条主线,学完能自己跑通
  5. 模块 04 多样本数据整合 — 批次效应和整合策略

过了这五节基本就能拿自己的数据上手。再之后是专题分支:轨迹推断、细胞通讯、多模态(CITE-seq)、空间转录组、scATAC-seq,都在后面的 模块 05 到 10

常用公开数据

教学场景里最常用的几份数据:

  • PBMC 3k(约 7 MB)— 10x Genomics 经典教学数据,本站默认数据集
  • 5k PBMC CITE-seq(约 37 MB)— 配套 module07 多模态分析
  • Visium Breast Cancer(约 74 MB)— 配套 module09 空间转录组
  • PBMC scATAC 10k(约 162 MB)— 配套 module10 染色质可及性

下载命令和读取示例都在 模块 01 里。

常见误解

  1. "单细胞测序能测到细胞里所有的 mRNA"。实际上 scRNA-seq 的捕获效率很低,一个细胞里可能有几千种 mRNA 在表达,但测序只能检测到其中一部分。这就是为什么单细胞数据里有大量的零值(dropout),这些零不代表"这个基因没表达",而是"没被捕获到"。理解这一点对后续的归一化和差异分析至关重要。

  2. "UMAP 上距离近的细胞一定相似"。UMAP 是非线性降维,它保留的是局部邻域结构,不是全局距离。两个点在 UMAP 上靠得近,只能说明它们在高维空间里可能是邻居;但两个点距离远,不能说明它们差异大。不要用 UMAP 图上的"远近"做定量判断,聚类和差异分析才是定量工具。

  3. "细胞数越多分析结果越好"。更多细胞确实能发现更稀有的亚群,但也带来更高的计算成本和更复杂的批次效应。对于大多数项目,3000-10000 个高质量细胞就足够完成标准分析。盲目追求 >100k 细胞反而可能引入更多技术噪声(doublet 比例上升、测序深度下降)。关键是细胞质量,不是数量。

进一步