公共数据库与数据检索
组学分析常常不从自己测序开始,而是先用公开数据练手 / 验证假设 / 做对照。
这一篇回答两个问题:
- 从哪里找数据 — 主流公开库有哪些、各自擅长什么
- 怎么判断数据合不合适 — 不是任何编号能下到的数据都能用
先看你需要什么类型的数据
不同数据库的产出形态完全不同:
| 你需要 | 优先看哪里 |
|---|---|
| 找某篇论文的配套表达矩阵 | GEO |
| 下载原始 FASTQ | SRA / ENA |
| 浏览已注释的单细胞数据 | CELLxGENE |
| 找人类细胞参考图谱 | HCA Data Portal |
| 查某个基因在哪些组织表达 | Expression Atlas |
| 找癌症基因组 + 临床数据 | TCGA / GDC |
| 找表观调控(peak / motif)数据 | ENCODE |
| 找人类群体遗传变异 | 1000 Genomes / gnomAD |
下文每一个都有最低限度介绍。先确定需求、再选库。"先去 GEO 搜搜"是浪费时间的常见做法。
常见 accession 编号
公开数据通过 accession 编号追踪。每个库有自己的编号体系:
| 编号 | 含义 | 示例 |
|---|---|---|
| GSE | GEO Series,一个研究 | GSE12345 |
| GSM | GEO Sample,一个样本 | GSM123456 |
| GPL | GEO Platform,测序平台 | GPL16791 |
| SRP | SRA Study | SRP123456 |
| SRX | SRA Experiment | SRX123456 |
| SRR | SRA Run,真正能下载 reads 的层级 | SRR1234567 |
| ERP / ERX / ERR | ENA 对应 SRA | ERR1234567 |
| TCGA-XX-XXXX | TCGA case barcode | TCGA-A1-A0SK |
| ENCSR | ENCODE Series | ENCSR000AAA |
最常见的坑:拿到 GSE 直接找 FASTQ 下不到。FASTQ 在 SRR 层级,需要顺着 GSE → GSM → SRX → SRR 追。
主要数据库
GEO(Gene Expression Omnibus)
NCBI 维护,覆盖功能基因组学最广。论文发表时强制要求把数据上传 GEO,所以"找论文配套数据"几乎必经此处。
- 网址:https://www.ncbi.nlm.nih.gov/geo/
- 内容:表达矩阵、样本元数据、平台信息、补充文件
- 一个 GSE 通常包含若干 GSM(样本),每个 GSM 链到 SRA 的 SRR
检索关键词模板:
关键词 + 物种 + 技术 + 组织/疾病
例:
single cell RNA-seq human liver fibrosis
PBMC scRNA-seq healthy donor
SRA / ENA(原始测序数据)
需要 FASTQ 时基本都到这两家。NCBI 的 SRA 和 EBI 的 ENA 内容是镜像的,下载时哪个快用哪个。
下载工具:
# SRA Toolkit(NCBI 官方)
conda install -c bioconda sra-tools
prefetch SRR1234567
fasterq-dump SRR1234567 --split-files -O data/raw/
# 或 ENA 的 ascp / aria2 直接拉 .fastq.gz
注意:
- 一个 SRR 几个 GB 到几十 GB,先确认磁盘空间
- 批量下载前先用一个 SRR 测试网络
- 记录 SRR 列表和下载日期,方便后续溯源
CELLxGENE Discover(单细胞已注释)
CZI(Chan Zuckerberg Initiative)维护,专注单细胞数据的可视化浏览。
- 网址:https://cellxgene.cziscience.com/
- 内容:已注释的 h5ad 文件,含细胞类型、UMAP、基因表达
适合:
- 在下载前先在线看一眼数据(细胞数、注释、是否有你关心的基因)
- 下载
.h5ad直接在 Scanpy 里加载 - 比较"我的数据" vs "公开同类数据"
Human Cell Atlas(HCA Data Portal)
国际合作的人类细胞图谱项目,目标是给所有人体组织 / 器官生成参考图谱。
- 网址:https://data.humancellatlas.org/
- 内容:参考级单细胞 / 多组学数据,处理流程严谨
适合:
- 找参考图谱(比如要做细胞类型注释时的"答案集")
- 接入大型数据整合分析
- 看权威标注的数据
Expression Atlas / Single Cell Expression Atlas
EMBL-EBI 的基因表达查询库。适合"查一个基因",不适合"下大数据集"。
适合:
- 查
TP53在哪些组织高表达 - 做初步假设(这个基因可能在某细胞类型里特异表达)
- 给报告 / 演讲补一张参考图
TCGA / GDC(癌症基因组图谱)
NCI 主导的癌症大队列。包含 33 种癌症约 11000 个样本的基因组、转录组、甲基化、临床信息。
适合:
- 肿瘤研究的对照数据 / 验证集
- 大队列统计分析
- 多组学整合教学
注意 dbGaP 限制 — 部分数据需要授权。
ENCODE(表观调控元件百科全书)
DOE / NIH 主导,主要提供 ChIP-seq / ATAC-seq / DNase-seq / RNA-seq 等 functional 数据。
适合:
- 找 motif / peak 标准数据集
- 表观调控研究的基线
- 跨细胞系 / 跨条件比较
1000 Genomes / gnomAD(人类变异)
群体遗传 / GWAS / 临床变异解读绕不开的两个库。
- 1000 Genomes:https://www.internationalgenome.org/
- gnomAD:https://gnomad.broadinstitute.org/
适合:
- 查变异在群体里的频率
- 临床变异分级时排除常见多态性
- 群体遗传学分析
怎么判断一个数据集合不合适
下载前先用这份清单过一遍,比下完发现不能用强:
1. 物种和参考版本
- 物种是不是你研究的(小鼠 vs 人)
- 参考基因组版本是不是兼容(hg19 vs hg38;mm10 vs mm39)
2. 实验设计
- 样本量够不够(差异分析至少每组 3 个生物学重复)
- 分组是否合理(有没有合适的对照)
- 有没有混淆变量(比如所有处理样本都是同一天测的,批次和处理混在一起)
3. 测序深度和数据规模
- bulk RNA-seq:建议每样本 ≥ 20M reads
- scRNA-seq:每细胞 ≥ 10000 UMI、≥ 1500 genes 是基本线
- WGS:30x;WES:100x
4. 元数据完整度
- 样本元数据有没有列清楚(年龄、性别、处理时间、技术批次)
- 没有元数据的数据基本不能用 — 你不知道每个 SRR 是哪个条件
5. 数据是原始还是处理过的
- 处理过的(已 normalize / 已 batch correct)→ 适合快速 验证假设
- 原始 FASTQ → 适合自己重做流程,但下载和计算成本高
6. License 和使用限制
- 大多数 GEO / SRA 数据是 CC0(自由用)
- TCGA 部分数据需要 dbGaP 授权
- 临床相关数据可能有 IRB 限制
- 写论文前确认是否需要引用 / 获得授权
常见坑
坑 1:拿到 GSE 直接找 FASTQ
GSE 层级常常没有直接的 FASTQ 链接。需要顺着 GSE → GSM → SRX → SRR 找到 run 层级才能下。
避免:在 GEO 页面找 "SRA" 链接,跳到 SRA Run Selector,下载所有 SRR 列表,再批量下。
坑 2:把原始 reads 当成 counts 用
有些教程把 GEO 上的 *_counts.txt.gz 当作可直接喂 DESeq2 的输入。但 GEO 上传的"counts"可能是:raw counts / TPM / RPKM / 已 batch correct / 已 quantile normalize。
避免:每个数据集先看 README 和原始论文,确认是什么形态。DESeq2 要 raw integer counts,不是 TPM。
坑 3:参考基因组版本不一致
下了 GSE 的 BAM 文件,发现是 hg19 比对的;自己的新数据是 hg38。坐标对不上,下游 region 注释全错。
避免:下载前看清版本。需要时用 liftOver 转换,或重新比对原 FASTQ 到一致版本。
坑 4:元数据匹配不上
GEO 元数据里的样本顺序和表达矩阵列名顺序不一致。直接合并会把 sample A 的处理标签贴到 sample B 上。
避免:每次合并元数据和表达矩阵前,显式 join by sample ID,不要依赖默认顺序。
坑 5:忽略数据上传日期
2014 年的 PBMC 单细胞数据用的是 SMART-seq2,跟现在的 10x Chromium 不能直接比。十年前的 ChIP-seq 没有 input control 是常见情况。
避免:注意数据生成年份和当时的技术状态。老数据值得参考但不一定能直接整合。
AI 辅助检索
让 AI 帮你做:解析复杂检索结果 / 把 GSE 元数据整理成表 / 写下载脚本草稿。
不让 AI 做:判断数据集质量 / 决定研究问题 / 替你看论文摘要里的实验细节。
详见 AI 辅助编程与智能体工具。
下一步
接着深入:
- 数据与环境准备 — 下载下来的数据放哪、用什么环境跑
- 单细胞实践 01:实践数据集与数据获取 — 第一个真实流程,配套用 PBMC 3k 公开数据
横向延伸:
- bulk RNA-seq overview — 想从 GEO 上找 bulk 转录组练手时
- 基因组学 overview — 想用 TCGA / 1000 Genomes 时
- AI 辅助编程 — 用 AI 帮你写下载脚本和元数据整理代码
参考资源
- GEO:https://www.ncbi.nlm.nih.gov/geo/
- SRA:https://www.ncbi.nlm.nih.gov/sra/
- ENA:https://www.ebi.ac.uk/ena/
- CELLxGENE:https://cellxgene.cziscience.com/
- Human Cell Atlas:https://data.humancellatlas.org/
- Expression Atlas:https://www.ebi.ac.uk/gxa/
- TCGA / GDC:https://portal.gdc.cancer.gov/
- ENCODE:https://www.encodeproject.org/
- gnomAD:https://gnomad.broadinstitute.org/
离线资料下载
手册 HTML / PDF 已在后台预生成,点击后直接下载网站静态资源。