BioF3 组学数据分析

01 数据类型:WGS vs WES vs Panel

导出日期:2026年6月27日

01 数据类型:WGS vs WES vs Panel

基因组测序有三种主要策略,选择取决于研究目的和预算:

策略 覆盖范围 数据量/样本 适用场景
WGS 全基因组 ~3Gb 30-60x, ~90GB FASTQ 结构变异、非编码区、群体遗传
WES 外显子区 ~60Mb 100-200x, ~6GB FASTQ 肿瘤体细胞突变、遗传病诊断
Panel 几十~几百个基因 500-1000x, ~1GB 临床检测、已知热点突变

WGS vs WES 的分析差异

维度 WGS WES
变异类型 SNV + Indel + SV + CNV 主要 SNV + Indel
参考区域 全基因组 需要 BED 文件定义 target 区域
覆盖度均匀性 受捕获效率影响,边缘区域覆盖低
数据分析工具 GATK / DeepVariant GATK + Mutect2(肿瘤)
下游重点 群体遗传、GWAS、SV 肿瘤驱动突变、maftools、OncoKB

肿瘤 WES 的特殊性

肿瘤样本通常配对测序(tumor + matched normal),用 Mutect2 做体细胞突变检测。输出的 MAF 文件是 maftools 的标准输入。

# Mutect2 典型调用
gatk Mutect2 \
  -R reference.fa \
  -I tumor.bam \
  -I normal.bam \
  -normal normal_sample_name \
  -O somatic.vcf.gz

# VCF -> MAF 转换
vcf2maf.pl --input-vcf somatic.vcf.gz --output-maf somatic.maf \
  --tumor-id tumor --normal-id normal --ref-fasta reference.fa

怎么选:WGS / WES / Panel 的判断逻辑

实务上的选择标准比 textbook 里复杂。一份决策表:

你的目标 选哪个 理由
找已知热点突变(EGFR、KRAS、BRAF) Panel 最便宜,深度最高(>1000x),灵敏度最好
找未知驱动突变(新癌种、罕见癌) WES 编码区全覆盖,能发现新基因
找结构变异 / CNV 整体重排 WGS Panel/WES 看不到非编码区断点
临床遗传病诊断 WES 大部分孟德尔病在编码区
群体遗传研究 WGS (或 SNP 芯片) 需要全基因组覆盖看 LD 和稀有变异
预算有限但样本量大 Panel 单价低,能多测样本
给非编码 GWAS 信号做精细定位 WGS 启动子 / 增强子区域 panel/WES 没覆盖

新人最常见错误:用 WES 找结构变异。WES 的捕获 enrichment 让 break point 上的 reads 严重不均匀,CNV / SV 在 WES 上几乎不可靠。

常见坑

坑 1:tumor-only 没有 matched normal

没有配对正常样本时,无法区分体细胞突变和胚系变异。tumor-only 模式可以跑(Mutect2 --tumor-only),但要严格用 gnomAD 频率过滤掉所有 AF > 0.001 的位点,否则结果是肿瘤 + 胚系混合。

坑 2:WES 的 BED 文件版本不一致

不同 WES 试剂盒(Agilent SureSelect / Twist / IDT xGen)有自己的 target BED,用错 BED 会让 70% 的覆盖度统计是假的。BED 必须从厂商网站下载和试剂盒版本对应的那一份。

坑 3:Panel 数据用 WGS 的过滤参数

Panel 测序深度 500-2000x,WGS 30-50x。用 WGS 的 GQ ≥ 20 阈值在 Panel 上会几乎不过滤(Panel 的 GQ 普遍很高),需要用更严格的标准比如 VAF + 链平衡。

坑 4:用错 reference fasta

GATK 要求 reference 必须有 .dict.fai 索引,且染色体顺序匹配。hg19 和 hg38 不能混用,混用会让所有变异坐标错位。

坑 5:Mutect2 跑 tumor-only 不加 PoN

Panel of Normals (PoN) 是从一批正常样本里收集的"看上去像变异但其实是测序伪影"的位点。没 PoN 的 Mutect2 假阳性率会很高,至少要做一份 50-100 个正常样本的 PoN。

下一步

接着深入

横向延伸

参考资源