01 实践数据集与数据获取
速答
Q: 单细胞入门用哪份公开数据? A: 10x Genomics PBMC 3k(7.3 MB),2700 个细胞,Seurat 官方教程也用它。够小、够典型、免费下载。
Q: PBMC 3k 之外还需要下哪些数据? A: 按需下:CITE-seq 5k(多模态章)、Visium Breast Cancer(空间章)、PBMC scATAC 10k(scATAC 章)。不要一开始全下完。
Q: 10x 单细胞数据从哪里下载?
A: 10x Genomics 官网 Datasets 页面,或用 wget 直接拉 filtered_feature_bc_matrix.h5。BioF3 脚本默认从 ~/biof3-data/ 读取。
01 实践数据集与数据获取
教程不能只用手造数据。BioF3 单细胞主线用 4 份公开数据集贯穿,每份对应不同章节、不同分析场景。这一篇告诉你:用哪份、什么时候用、怎么下、读进来长什么样。
4 份数据集一览
| 数据集 | 类型 | 大小 | 主要用在 | 建议什么时候下 |
|---|---|---|---|---|
| PBMC 3k | scRNA-seq | 7.3 MB | 02-06 章 | 第一次进入主线时 |
| 5k PBMC CITE-seq | RNA + 蛋白 ADT | 37 MB | 07 章 | 学到多模态分析时 |
| Visium Breast Cancer | 空间转录组 | 74 MB | 09 章 | 学到空间分析时 |
| PBMC scATAC 10k | scATAC-seq | 162 MB | 10 章 | 学到染色质可及性时 |
判断逻辑:先 PBMC 3k 跑通主线(02-06 章用的就是它),再按章节按需下后面三份。不要一开始就把 4 份全下完 — 后三份每份都几十 MB,没用上时占磁盘没意义。
为什么从 PBMC 3k 开始
三个原因:
- 小。7.3 MB,几秒钟下完,笔记本能跑
- 是行业基准。Seurat / Scanpy 官方教程都用它,遇到问题去 Stack Overflow 搜,几乎都有现成答案
- 细胞类型清晰。PBMC 包含 T / B / NK / 单核细胞 / DC 等几个明确类型,聚类后能直接看到结构。这是入门期建立信心的关键
学完 02-06 之后,PBMC 3k 你会摸得很熟。再换其他数据集时就有了一个稳定参考系。
PBMC 3k:下载和读取
数据放进 BioF3 推荐的统一数据目录(参考 数据与环境准备):
mkdir -p ~/biof3-data/pbmc3k
cd ~/biof3-data/pbmc3k
curl -L -O https://cf.10xgenomics.com/samples/cell-exp/1.1.0/pbmc3k/pbmc3k_filtered_gene_bc_matrices.tar.gz
tar -xzf pbmc3k_filtered_gene_bc_matrices.tar.gz
解压后目录结构:
~/biof3-data/pbmc3k/
└── filtered_gene_bc_matrices/
└── hg19/
├── matrix.mtx
├── genes.tsv
└── barcodes.tsv
Seurat 读取:
library(Seurat)
data_dir <- "~/biof3-data/pbmc3k/filtered_gene_bc_matrices/hg19"
counts <- Read10X(data.dir = data_dir)
pbmc <- CreateSeuratObject(counts = counts, project = "PBMC3K")
pbmc
# 输出: 13714 features across 2700 samples within 1 assay
到这一步:13714 个基因 × 2700 个细胞的稀疏矩阵已经在内存里。02 章会接着这一步往下走。
Scanpy 读取(如果走 Python 路线):
import scanpy as sc
adata = sc.read_10x_mtx(
"~/biof3-data/pbmc3k/filtered_gene_bc_matrices/hg19",
var_names="gene_symbols",
cache=True,
)
adata
# 输出: AnnData object with n_obs × n_vars = 2700 × 13714
5k PBMC CITE-seq:什么时候用 {#5k-pbmc-cite-seq}
学到 07 多模态数据分析 时再下。它额外有 32 个抗体的蛋白表达(ADT),让你能在同一群细胞里同时看 RNA 和蛋白。
mkdir -p ~/biof3-data/pbmc5k-citeseq
cd ~/biof3-data/pbmc5k-citeseq
curl -L -O https://cf.10xgenomics.com/samples/cell-exp/3.1.0/5k_pbmc_protein_v3_nextgem/5k_pbmc_protein_v3_nextgem_filtered_feature_bc_matrix.tar.gz
tar -xzf 5k_pbmc_protein_v3_nextgem_filtered_feature_bc_matrix.tar.gz
读取(注意 CITE-seq 输出是双 assay 结构):
library(Seurat)
data_dir <- "~/biof3-data/pbmc5k-citeseq/filtered_feature_bc_matrix"
counts <- Read10X(data.dir = data_dir)
pbmc <- CreateSeuratObject(counts = counts$`Gene Expression`, project = "PBMC5K_CITE")
pbmc[["ADT"]] <- CreateAssayObject(counts = counts$`Antibody Capture`)
pbmc
# 输出: An object of class Seurat
# ... gene 33538 ... ADT feature 32 ... 5247 cells
Read10X 自动识别两种 feature type,分别读进 RNA 和 ADT 两个 assay。
Seurat v5 用户:可以把
CreateAssayObject换成CreateAssay5Object,两者输出兼容,新版有更细粒度的 layer 控制。看你项目的 Seurat 版本。
Visium Breast Cancer:空间转录组
学到 09 空间转录组学 时再下:
mkdir -p ~/biof3-data/visium-breast-cancer
cd ~/biof3-data/visium-breast-cancer
curl -L -O https://cf.10xgenomics.com/samples/spatial-exp/1.1.0/V1_Breast_Cancer_Block_A_Section_1/V1_Breast_Cancer_Block_A_Section_1_filtered_feature_bc_matrix.tar.gz
tar -xzf V1_Breast_Cancer_Block_A_Section_1_filtered_feature_bc_matrix.tar.gz
Visium 完整分析需要 spatial 文件夹。上面这个 _filtered_feature_bc_matrix.tar.gz 只包含表达矩阵,不含组织切片图片和坐标。要做完整空间可视化,还要单独下 _spatial.tar.gz。09 章会讲怎么把矩阵和空间信息拼起来。
PBMC scATAC 10k:染色质可及性 {#pbmc-scatac-10k}
学到 10 scATAC-seq 分析 时再下:
mkdir -p ~/biof3-data/pbmc10k-scatac
cd ~/biof3-data/pbmc10k-scatac
curl -L -O https://cf.10xgenomics.com/samples/cell-atac/2.1.0/10k_pbmc_ATACv2_nextgem_Chromium_Controller/10k_pbmc_ATACv2_nextgem_Chromium_Controller_filtered_peak_bc_matrix.h5
注意:scATAC 完整分析还需要 fragments.tsv.gz 和它的 index 文件,10 章会讲。
不下数据也能体验:云平台
如果你只想先看看 BioF3 是什么,不必先配本地环境。云平台已经把 PBMC 3k 跑完一遍存在那儿了,登录后能:
- 浏览已完成的 QC、聚类、注释结果
- 在线点击不同细胞类型,看 marker 基因
- 一键复制图、参数、Methods 段
详见 单细胞云平台使用指南。
常见坑
坑 1:国内直连 10x 服务器超时
10x 的下载链接在境内有时候慢甚至断流。
避免:
- 用
curl -L --retry 5 --retry-delay 5加重试参数 - 或用
aria2c -x 4多线程 - 实在不行用国内镜像(不少高校 / 测序公司有 PBMC 3k 镜像)
- 完全不行就用云平台:/single-cell 已经把 PBMC 3k 跑完了
坑 2:解压后路径里多一层 filtered_gene_bc_matrices
PBMC 3k 解压后真实的 matrix 文件在 filtered_gene_bc_matrices/hg19/ 里,不是直接在解压根目录。Read10X 路径要指到 hg19 那一层,否则报"file not found"。
坑 3:Seurat 老教程用 hg19,不是 hg38
PBMC 3k 用的参考是 hg19(2017 年的数据)。别尝试把它跟你自己的 hg38 数据合并 — 基因名兼容但坐标不兼容,下游 region 注释会错。
坑 4:把 4 份数据全下完,磁盘占用 280 MB
新手容易"先全下了不浪费",结果 90% 用不上。按章节按需下 — 学到 07 再下 CITE-seq,学到 09 再下 Visium。
坑 5:Visium 只下了表达矩阵,画不出空间图
Visium 数据有两个 tar:_filtered_feature_bc_matrix.tar.gz(表达矩阵)和 _spatial.tar.gz(图片 + 坐标)。两个都要才能在切片上画图。第一次下只下了一个会很困惑。
下一步
接着深入:
- 02 原始数据处理与 Cell Ranger — 想从 FASTQ 走起,了解表达矩阵怎么生成的
- 03 质量控制、聚类与细胞类型注释 — 直接用刚下的 PBMC 3k 矩阵跑完整分析
绝大多数读者推荐先跳过 02、直接进 03:因为 PBMC 3k 已经是处理好的矩阵,02 章讲的 Cell Ranger 流程对入门期不是必须的。等回头有自己的 FASTQ 时再补 02。
横向延伸:
- 单细胞云平台使用指南 — 不想配环境,想直接看结果时
- 公共数据库与数据检索 — 想找其他公开数据集(不只 10x 这 4 份)时