01 数据类型:WGS vs WES vs Panel
01 数据类型:WGS vs WES vs Panel
基因组测序有三种主要策略,选择取决于研究目的和预算:
| 策略 | 覆盖范围 | 数据量/样本 | 适用场景 |
|---|---|---|---|
| WGS | 全基因组 ~3Gb | 30-60x, ~90GB FASTQ | 结构变异、非编码区、群体遗传 |
| WES | 外显子区 ~60Mb | 100-200x, ~6GB FASTQ | 肿瘤体细胞突变、遗传病诊断 |
| Panel | 几十~几百个基因 | 500-1000x, ~1GB | 临床检测、已知热点突变 |
WGS vs WES 的分析差异
| 维度 | WGS | WES |
|---|---|---|
| 变异类型 | SNV + Indel + SV + CNV | 主要 SNV + Indel |
| 参考区域 | 全基因组 | 需要 BED 文件定义 target 区域 |
| 覆盖度均匀性 | 好 | 受捕获效率影响,边缘区域覆盖低 |
| 数据分析工具 | GATK / DeepVariant | GATK + Mutect2(肿瘤) |
| 下游重点 | 群体遗传、GWAS、SV | 肿瘤驱动突变、maftools、OncoKB |
肿瘤 WES 的特殊性
肿瘤样本通常配对测序(tumor + matched normal),用 Mutect2 做体细胞突变检测。输出的 MAF 文件是 maftools 的标准输入。
# Mutect2 典型调用
gatk Mutect2 \
-R reference.fa \
-I tumor.bam \
-I normal.bam \
-normal normal_sample_name \
-O somatic.vcf.gz
# VCF -> MAF 转换
vcf2maf.pl --input-vcf somatic.vcf.gz --output-maf somatic.maf \
--tumor-id tumor --normal-id normal --ref-fasta reference.fa
怎么选:WGS / WES / Panel 的判断逻辑
实务上的选择标准比 textbook 里复杂。一份决策表:
| 你的目标 | 选哪个 | 理由 |
|---|---|---|
| 找已知热点突变(EGFR、KRAS、BRAF) | Panel | 最便宜,深度最高(>1000x),灵敏度最好 |
| 找未知驱动突变(新癌种、罕见癌) | WES | 编码区全覆盖,能发现新基因 |
| 找结构变异 / CNV 整体重排 | WGS | Panel/WES 看不到非编码区断点 |
| 临床遗传病诊断 | WES | 大部分孟德尔病在编码区 |
| 群体遗传研究 | WGS (或 SNP 芯片) | 需要全基因组覆盖看 LD 和稀有变异 |
| 预算有限但样本量大 | Panel | 单价低,能多测样本 |
| 给非编码 GWAS 信号做精细定位 | WGS | 启动子 / 增强子区域 panel/WES 没覆盖 |
新人最常见错误:用 WES 找结构变异。WES 的捕获 enrichment 让 break point 上的 reads 严重不均匀,CNV / SV 在 WES 上几乎不可靠。
常见坑
坑 1:tumor-only 没有 matched normal
没有配对正常样本时,无法区分体细胞突变和胚系变异。tumor-only 模式可以跑(Mutect2 --tumor-only),但要严格用 gnomAD 频率过滤掉所有 AF > 0.001 的位点,否则结果是肿瘤 + 胚系混合。
坑 2:WES 的 BED 文件版本不一致
不同 WES 试剂盒(Agilent SureSelect / Twist / IDT xGen)有自己的 target BED,用错 BED 会让 70% 的覆盖度统计是假的。BED 必须从厂商网站下载和试剂盒版本对应的那一份。
坑 3:Panel 数据用 WGS 的过滤参数
Panel 测序深度 500-2000x,WGS 30-50x。用 WGS 的 GQ ≥ 20 阈值在 Panel 上会几乎不过滤(Panel 的 GQ 普遍很高),需要用更严格的标准比如 VAF + 链平衡。
坑 4:用错 reference fasta
GATK 要求 reference 必须有 .dict 和 .fai 索引,且染色体顺序匹配。hg19 和 hg38 不能混用,混用会让所有变异坐标错位。
坑 5:Mutect2 跑 tumor-only 不加 PoN
Panel of Normals (PoN) 是从一批正常样本里收集的"看上去像变异但其实是测序伪影"的位点。没 PoN 的 Mutect2 假阳性率会很高,至少要做一份 50-100 个正常样本的 PoN。
下一步
接着深入:
- 02 比对与变异检测流程 — 从 FASTQ 到 VCF 的完整命令行流水线
- 03 VCF 注释与可视化 — VCF 拿到后第一步:注释功能影响
横向延伸:
- 04 maftools 肿瘤突变分析 — 如果是肿瘤项目,看完 02 直接跳这里
- 05 变异过滤与质量评估 — variant filtering 决定结果质量