跳到主要内容

公共数据库与数据检索

组学分析常常不从自己测序开始,而是先用公开数据练手 / 验证假设 / 做对照。

这一篇回答两个问题:

  1. 从哪里找数据 — 主流公开库有哪些、各自擅长什么
  2. 怎么判断数据合不合适 — 不是任何编号能下到的数据都能用

先看你需要什么类型的数据

不同数据库的产出形态完全不同:

你需要优先看哪里
找某篇论文的配套表达矩阵GEO
下载原始 FASTQSRA / ENA
浏览已注释的单细胞数据CELLxGENE
找人类细胞参考图谱HCA Data Portal
查某个基因在哪些组织表达Expression Atlas
找癌症基因组 + 临床数据TCGA / GDC
找表观调控(peak / motif)数据ENCODE
找人类群体遗传变异1000 Genomes / gnomAD

下文每一个都有最低限度介绍。先确定需求、再选库。"先去 GEO 搜搜"是浪费时间的常见做法。

常见 accession 编号

公开数据通过 accession 编号追踪。每个库有自己的编号体系:

编号含义示例
GSEGEO Series,一个研究GSE12345
GSMGEO Sample,一个样本GSM123456
GPLGEO Platform,测序平台GPL16791
SRPSRA StudySRP123456
SRXSRA ExperimentSRX123456
SRRSRA Run,真正能下载 reads 的层级SRR1234567
ERP / ERX / ERRENA 对应 SRAERR1234567
TCGA-XX-XXXXTCGA case barcodeTCGA-A1-A0SK
ENCSRENCODE SeriesENCSR000AAA

最常见的坑:拿到 GSE 直接找 FASTQ 下不到。FASTQ 在 SRR 层级,需要顺着 GSE → GSM → SRX → SRR 追。

主要数据库

GEO(Gene Expression Omnibus)

NCBI 维护,覆盖功能基因组学最广。论文发表时强制要求把数据上传 GEO,所以"找论文配套数据"几乎必经此处。

  • 网址:https://www.ncbi.nlm.nih.gov/geo/
  • 内容:表达矩阵、样本元数据、平台信息、补充文件
  • 一个 GSE 通常包含若干 GSM(样本),每个 GSM 链到 SRA 的 SRR

检索关键词模板

关键词 + 物种 + 技术 + 组织/疾病

例:

single cell RNA-seq human liver fibrosis
PBMC scRNA-seq healthy donor

SRA / ENA(原始测序数据)

需要 FASTQ 时基本都到这两家。NCBI 的 SRA 和 EBI 的 ENA 内容是镜像的,下载时哪个快用哪个。

下载工具:

# SRA Toolkit(NCBI 官方)
conda install -c bioconda sra-tools

prefetch SRR1234567
fasterq-dump SRR1234567 --split-files -O data/raw/

# 或 ENA 的 ascp / aria2 直接拉 .fastq.gz

注意:

  • 一个 SRR 几个 GB 到几十 GB,先确认磁盘空间
  • 批量下载前先用一个 SRR 测试网络
  • 记录 SRR 列表和下载日期,方便后续溯源

CELLxGENE Discover(单细胞已注释)

CZI(Chan Zuckerberg Initiative)维护,专注单细胞数据的可视化浏览。

适合:

  • 在下载前先在线看一眼数据(细胞数、注释、是否有你关心的基因)
  • 下载 .h5ad 直接在 Scanpy 里加载
  • 比较"我的数据" vs "公开同类数据"

Human Cell Atlas(HCA Data Portal)

国际合作的人类细胞图谱项目,目标是给所有人体组织 / 器官生成参考图谱。

适合:

  • 找参考图谱(比如要做细胞类型注释时的"答案集")
  • 接入大型数据整合分析
  • 看权威标注的数据

Expression Atlas / Single Cell Expression Atlas

EMBL-EBI 的基因表达查询库。适合"查一个基因",不适合"下大数据集"

适合:

  • TP53 在哪些组织高表达
  • 做初步假设(这个基因可能在某细胞类型里特异表达)
  • 给报告 / 演讲补一张参考图

TCGA / GDC(癌症基因组图谱)

NCI 主导的癌症大队列。包含 33 种癌症约 11000 个样本的基因组、转录组、甲基化、临床信息。

适合:

  • 肿瘤研究的对照数据 / 验证集
  • 大队列统计分析
  • 多组学整合教学

注意 dbGaP 限制 — 部分数据需要授权。

ENCODE(表观调控元件百科全书)

DOE / NIH 主导,主要提供 ChIP-seq / ATAC-seq / DNase-seq / RNA-seq 等 functional 数据。

适合:

  • 找 motif / peak 标准数据集
  • 表观调控研究的基线
  • 跨细胞系 / 跨条件比较

1000 Genomes / gnomAD(人类变异)

群体遗传 / GWAS / 临床变异解读绕不开的两个库。

适合:

  • 查变异在群体里的频率
  • 临床变异分级时排除常见多态性
  • 群体遗传学分析

怎么判断一个数据集合不合适

下载前先用这份清单过一遍,比下完发现不能用强:

1. 物种和参考版本

  • 物种是不是你研究的(小鼠 vs 人)
  • 参考基因组版本是不是兼容(hg19 vs hg38;mm10 vs mm39)

2. 实验设计

  • 样本量够不够(差异分析至少每组 3 个生物学重复)
  • 分组是否合理(有没有合适的对照)
  • 有没有混淆变量(比如所有处理样本都是同一天测的,批次和处理混在一起)

3. 测序深度和数据规模

  • bulk RNA-seq:建议每样本 ≥ 20M reads
  • scRNA-seq:每细胞 ≥ 10000 UMI、≥ 1500 genes 是基本线
  • WGS:30x;WES:100x

4. 元数据完整度

  • 样本元数据有没有列清楚(年龄、性别、处理时间、技术批次)
  • 没有元数据的数据基本不能用 — 你不知道每个 SRR 是哪个条件

5. 数据是原始还是处理过的

  • 处理过的(已 normalize / 已 batch correct)→ 适合快速验证假设
  • 原始 FASTQ → 适合自己重做流程,但下载和计算成本高

6. License 和使用限制

  • 大多数 GEO / SRA 数据是 CC0(自由用)
  • TCGA 部分数据需要 dbGaP 授权
  • 临床相关数据可能有 IRB 限制
  • 写论文前确认是否需要引用 / 获得授权

常见坑

坑 1:拿到 GSE 直接找 FASTQ

GSE 层级常常没有直接的 FASTQ 链接。需要顺着 GSE → GSM → SRX → SRR 找到 run 层级才能下。

避免:在 GEO 页面找 "SRA" 链接,跳到 SRA Run Selector,下载所有 SRR 列表,再批量下。

坑 2:把原始 reads 当成 counts 用

有些教程把 GEO 上的 *_counts.txt.gz 当作可直接喂 DESeq2 的输入。但 GEO 上传的"counts"可能是:raw counts / TPM / RPKM / 已 batch correct / 已 quantile normalize。

避免:每个数据集先看 README 和原始论文,确认是什么形态。DESeq2 要 raw integer counts,不是 TPM。

坑 3:参考基因组版本不一致

下了 GSE 的 BAM 文件,发现是 hg19 比对的;自己的新数据是 hg38。坐标对不上,下游 region 注释全错。

避免:下载前看清版本。需要时用 liftOver 转换,或重新比对原 FASTQ 到一致版本。

坑 4:元数据匹配不上

GEO 元数据里的样本顺序和表达矩阵列名顺序不一致。直接合并会把 sample A 的处理标签贴到 sample B 上。

避免:每次合并元数据和表达矩阵前,显式 join by sample ID,不要依赖默认顺序。

坑 5:忽略数据上传日期

2014 年的 PBMC 单细胞数据用的是 SMART-seq2,跟现在的 10x Chromium 不能直接比。十年前的 ChIP-seq 没有 input control 是常见情况。

避免:注意数据生成年份和当时的技术状态。老数据值得参考但不一定能直接整合。

AI 辅助检索

让 AI 帮你做:解析复杂检索结果 / 把 GSE 元数据整理成表 / 写下载脚本草稿。

不让 AI 做:判断数据集质量 / 决定研究问题 / 替你看论文摘要里的实验细节。

详见 AI 辅助编程与智能体工具

下一步

接着深入

  1. 数据与环境准备 — 下载下来的数据放哪、用什么环境跑
  2. 单细胞实践 01:实践数据集与数据获取 — 第一个真实流程,配套用 PBMC 3k 公开数据

横向延伸

参考资源

AI 组学实践

让 AI 带我实战这一篇

AI 会读这篇文章后给你 3-5 步学习计划, 逐步带你学完,最后出 1-3 道题验证你掌握得怎么样。 登录后 AI 才能记住你的进度。

静态文件

离线资料下载

手册 HTML / PDF 已在后台预生成,点击后直接下载网站静态资源。