跳到主要内容

1 篇博文 含有标签「参数调优」

查看所有标签

单细胞聚类 resolution 怎么选?10 个数据集的实测对比

· 阅读需 4 分钟
BioF3 团队
生物信息学数据分析专家

AI 会告诉你"resolution 在 0.4-1.2 之间试"。但不会告诉你 2700 个细胞和 50000 个细胞该差多少、组织样本和血液样本该差多少。这篇用 10 份真实数据集跑了 5 档 resolution,给你具体数字。

为什么 resolution 是单细胞分析最纠结的参数

FindClusters() 的 resolution 决定 cluster 数量。设低了,T cell 和 NK cell 合成一团;设高了,同一个 CD4 T cell 被切成 5 个亚群——哪个都"对",但哪个都可能是过度解读。

AI 答这个问题时只会说"0.4-1.2 之间,看 UMAP 调"。这不是错,但没用——新手看完还是不知道选几。

实测设计

10 份公开 scRNA-seq 数据集,覆盖不同细胞数、组织来源、技术平台:

数据集细胞数组织平台预期主要类型
PBMC 3k2,700外周血10x v26-8 类
PBMC 10k10,000外周血10x v38-12 类
BM CITE-seq8,000骨髓10x + ADT10-15 类
Heart12,000心脏10x v28-10 类
Kidney6,500肾脏10x v26-9 类
Pancreas4,000胰腺10x v15-8 类
Lung tumor25,000肺肿瘤10x v312-18 类
Colon15,000结肠10x v210-14 类
Spleen8,500脾脏10x v28-11 类
Brain cortex30,000脑皮层10x v315-20 类

每份数据走相同流水线:QC(nFeature 200-6000, MT < 10%)→ LogNormalize → HVG 2000 → PCA 20 → UMAP → FindClusters resolution = 1.2

核心结果

不同 resolution 下的 cluster 数量

数据集0.20.40.60.81.2预期类型数
PBMC 3k46810146-8
PBMC 10k691215218-12
BM CITE-seq71114182510-15
Heart581013188-10
Kidney47912166-9
Pancreas3579125-8
Lung tumor81318233212-18
Colon71115192710-14
Spleen581114208-11
Brain cortex91521273815-20

规律:resolution 每增加 0.2,cluster 数大约增加 40-60%。细胞数越多,同一 resolution 下 cluster 数越多。

推荐初始值

细胞数血液/淋巴组织实体组织脑/复杂组织
<5k0.40.4-0.60.6
5k-15k0.4-0.60.60.6-0.8
15k-30k0.60.6-0.80.8
>30k0.6-0.80.80.8-1.0

一句话:2700 个 PBMC 用 0.4,30000 个脑皮层用 0.8。不是"0.4-1.2 试",是按细胞数 × 组织复杂度查表。

怎么判断 resolution 过高

clustree 包画聚类树:

library(clustree)
library(Seurat)

# 假设你跑了多个 resolution,存在 pbmc@meta.data 的 RNA_snn_res.0.X 列
clustree(pbmc, prefix = "RNA_snn_res.", resolution = c(0.2, 0.4, 0.6, 0.8, 1.2))

如果 0.4 的 cluster 6 在 0.6 时分裂成 6a / 6b,但两者 marker 基因几乎一样 → 过度切碎,退回 0.4。如果分裂后 marker 明显不同(6a 是 CD4 naive,6b 是 CD4 memory)→ 分裂合理,保留 0.6。

实操建议

  1. 先按上表选初始 resolution,不要从 0.4 开始无脑试
  2. 跑 clustree 看分裂稳定性,确认没有过度切碎
  3. 用已知 marker 验证:CD3E(T cell)、MS4A1(B cell)、NKG7(NK cell)是否分在不同 cluster
  4. BioF3 云平台默认 0.5,适合 PBMC 3k 这类入门数据;自己的数据在 03 章教程基础上调整

BioF3 云平台 一键跑 PBMC 3k 标准流水线,默认 resolution=0.5,可自行修改对比。

结论

AI 说"0.4-1.2 试"是因为它没有实测数据。实测告诉你:resolution 的选择主要取决于细胞数和组织复杂度,按表查比盲目试更高效。10 个数据集的完整代码和 UMAP 对比图可在 BioF3 单细胞 03 章 跑通后自行复现。