组学数据分析入门
如果是第一次接触生物信息学,这篇文章帮你建立一个清晰的认知框架:组学数据为什么需要专门的分析方法、它的整体流程长什么样、第一步该走到哪里。
从一份数据开始
假设手上有一份单细胞 RNA 测序数据:10000 个细胞 × 20000 个基因的表达矩阵,2 亿个数据点。
要回答的问题可能是:
- 这些细胞分成几种类型?
- 不同细胞类型的标志基因是什么?
- 细胞之间如何相互作用?
- 某个基因在哪些细胞中高表达?
组学分析的核心问题就在这一刻浮现:怎么从这份海量、嘈杂、稀疏的数据里,把生物学意义提取出来。
组学之间的关系
理解组学,先理解中心法则把它们分成的几个层次:
DNA ────────► RNA ────────► 蛋白
(基因组) (转录组) (蛋白组)
| 层次 | 它告诉你 | 主要技术 |
|---|---|---|
| 基因组(Genomics) | 这个个体有什么基因、有什么变异 | WGS / WES / Panel 测序 |