BioF3 组学数据分析

公共数据库与数据检索

导出日期:2026年6月27日

公共数据库与数据检索

组学分析常常不从自己测序开始,而是先用公开数据练手 / 验证假设 / 做对照。

这一篇回答两个问题:

  1. 从哪里找数据 — 主流公开库有哪些、各自擅长什么
  2. 怎么判断数据合不合适 — 不是任何编号能下到的数据都能用

先看你需要什么类型的数据

不同数据库的产出形态完全不同:

你需要 优先看哪里
找某篇论文的配套表达矩阵 GEO
下载原始 FASTQ SRA / ENA
浏览已注释的单细胞数据 CELLxGENE
找人类细胞参考图谱 HCA Data Portal
查某个基因在哪些组织表达 Expression Atlas
找癌症基因组 + 临床数据 TCGA / GDC
找表观调控(peak / motif)数据 ENCODE
找人类群体遗传变异 1000 Genomes / gnomAD

下文每一个都有最低限度介绍。先确定需求、再选库。"先去 GEO 搜搜"是浪费时间的常见做法。

常见 accession 编号

公开数据通过 accession 编号追踪。每个库有自己的编号体系:

编号 含义 示例
GSE GEO Series,一个研究 GSE12345
GSM GEO Sample,一个样本 GSM123456
GPL GEO Platform,测序平台 GPL16791
SRP SRA Study SRP123456
SRX SRA Experiment SRX123456
SRR SRA Run,真正能下载 reads 的层级 SRR1234567
ERP / ERX / ERR ENA 对应 SRA ERR1234567
TCGA-XX-XXXX TCGA case barcode TCGA-A1-A0SK
ENCSR ENCODE Series ENCSR000AAA

最常见的坑:拿到 GSE 直接找 FASTQ 下不到。FASTQ 在 SRR 层级,需要顺着 GSE → GSM → SRX → SRR 追。

主要数据库

GEO(Gene Expression Omnibus)

NCBI 维护,覆盖功能基因组学最广。论文发表时强制要求把数据上传 GEO,所以"找论文配套数据"几乎必经此处。

检索关键词模板

关键词 + 物种 + 技术 + 组织/疾病

例:

single cell RNA-seq human liver fibrosis
PBMC scRNA-seq healthy donor

SRA / ENA(原始测序数据)

需要 FASTQ 时基本都到这两家。NCBI 的 SRA 和 EBI 的 ENA 内容是镜像的,下载时哪个快用哪个。

下载工具:

# SRA Toolkit(NCBI 官方)
conda install -c bioconda sra-tools

prefetch SRR1234567
fasterq-dump SRR1234567 --split-files -O data/raw/

# 或 ENA 的 ascp / aria2 直接拉 .fastq.gz

注意:

CELLxGENE Discover(单细胞已注释)

CZI(Chan Zuckerberg Initiative)维护,专注单细胞数据的可视化浏览。

适合:

Human Cell Atlas(HCA Data Portal)

国际合作的人类细胞图谱项目,目标是给所有人体组织 / 器官生成参考图谱。

适合:

Expression Atlas / Single Cell Expression Atlas

EMBL-EBI 的基因表达查询库。适合"查一个基因",不适合"下大数据集"

适合:

TCGA / GDC(癌症基因组图谱)

NCI 主导的癌症大队列。包含 33 种癌症约 11000 个样本的基因组、转录组、甲基化、临床信息。

适合:

注意 dbGaP 限制 — 部分数据需要授权。

ENCODE(表观调控元件百科全书)

DOE / NIH 主导,主要提供 ChIP-seq / ATAC-seq / DNase-seq / RNA-seq 等 functional 数据。

适合:

1000 Genomes / gnomAD(人类变异)

群体遗传 / GWAS / 临床变异解读绕不开的两个库。

适合:

怎么判断一个数据集合不合适

下载前先用这份清单过一遍,比下完发现不能用强:

1. 物种和参考版本

2. 实验设计

3. 测序深度和数据规模

4. 元数据完整度

5. 数据是原始还是处理过的

6. License 和使用限制

常见坑

坑 1:拿到 GSE 直接找 FASTQ

GSE 层级常常没有直接的 FASTQ 链接。需要顺着 GSE → GSM → SRX → SRR 找到 run 层级才能下。

避免:在 GEO 页面找 "SRA" 链接,跳到 SRA Run Selector,下载所有 SRR 列表,再批量下。

坑 2:把原始 reads 当成 counts 用

有些教程把 GEO 上的 *_counts.txt.gz 当作可直接喂 DESeq2 的输入。但 GEO 上传的"counts"可能是:raw counts / TPM / RPKM / 已 batch correct / 已 quantile normalize。

避免:每个数据集先看 README 和原始论文,确认是什么形态。DESeq2 要 raw integer counts,不是 TPM。

坑 3:参考基因组版本不一致

下了 GSE 的 BAM 文件,发现是 hg19 比对的;自己的新数据是 hg38。坐标对不上,下游 region 注释全错。

避免:下载前看清版本。需要时用 liftOver 转换,或重新比对原 FASTQ 到一致版本。

坑 4:元数据匹配不上

GEO 元数据里的样本顺序和表达矩阵列名顺序不一致。直接合并会把 sample A 的处理标签贴到 sample B 上。

避免:每次合并元数据和表达矩阵前,显式 join by sample ID,不要依赖默认顺序。

坑 5:忽略数据上传日期

2014 年的 PBMC 单细胞数据用的是 SMART-seq2,跟现在的 10x Chromium 不能直接比。十年前的 ChIP-seq 没有 input control 是常见情况。

避免:注意数据生成年份和当时的技术状态。老数据值得参考但不一定能直接整合。

AI 辅助检索

让 AI 帮你做:解析复杂检索结果 / 把 GSE 元数据整理成表 / 写下载脚本草稿。

不让 AI 做:判断数据集质量 / 决定研究问题 / 替你看论文摘要里的实验细节。

详见 AI 辅助编程与智能体工具

下一步

接着深入

  1. 数据与环境准备 — 下载下来的数据放哪、用什么环境跑
  2. 单细胞实践 01:实践数据集与数据获取 — 第一个真实流程,配套用 PBMC 3k 公开数据

横向延伸

参考资源