跳到主要内容

01 数据类型:WGS vs WES vs Panel

基因组测序有三种主要策略,选择取决于研究目的和预算:

策略覆盖范围数据量/样本适用场景
WGS全基因组 ~3Gb30-60x, ~90GB FASTQ结构变异、非编码区、群体遗传
WES外显子区 ~60Mb100-200x, ~6GB FASTQ肿瘤体细胞突变、遗传病诊断
Panel几十~几百个基因500-1000x, ~1GB临床检测、已知热点突变

WGS vs WES 的分析差异

维度WGSWES
变异类型SNV + Indel + SV + CNV主要 SNV + Indel
参考区域全基因组需要 BED 文件定义 target 区域
覆盖度均匀性受捕获效率影响,边缘区域覆盖低
数据分析工具GATK / DeepVariantGATK + Mutect2(肿瘤)
下游重点群体遗传、GWAS、SV肿瘤驱动突变、maftools、OncoKB

肿瘤 WES 的特殊性

肿瘤样本通常配对测序(tumor + matched normal),用 Mutect2 做体细胞突变检测。输出的 MAF 文件是 maftools 的标准输入。

# Mutect2 典型调用
gatk Mutect2 \
-R reference.fa \
-I tumor.bam \
-I normal.bam \
-normal normal_sample_name \
-O somatic.vcf.gz

# VCF -> MAF 转换
vcf2maf.pl --input-vcf somatic.vcf.gz --output-maf somatic.maf \
--tumor-id tumor --normal-id normal --ref-fasta reference.fa

怎么选:WGS / WES / Panel 的判断逻辑

实务上的选择标准比 textbook 里复杂。一份决策表:

你的目标选哪个理由
找已知热点突变(EGFR、KRAS、BRAF)Panel最便宜,深度最高(>1000x),灵敏度最好
找未知驱动突变(新癌种、罕见癌)WES编码区全覆盖,能发现新基因
找结构变异 / CNV 整体重排WGSPanel/WES 看不到非编码区断点
临床遗传病诊断WES大部分孟德尔病在编码区
群体遗传研究WGS (或 SNP 芯片)需要全基因组覆盖看 LD 和稀有变异
预算有限但样本量大Panel单价低,能多测样本
给非编码 GWAS 信号做精细定位WGS启动子 / 增强子区域 panel/WES 没覆盖

新人最常见错误:用 WES 找结构变异。WES 的捕获 enrichment 让 break point 上的 reads 严重不均匀,CNV / SV 在 WES 上几乎不可靠。

常见坑

坑 1:tumor-only 没有 matched normal

没有配对正常样本时,无法区分体细胞突变和胚系变异。tumor-only 模式可以跑(Mutect2 --tumor-only),但要严格用 gnomAD 频率过滤掉所有 AF > 0.001 的位点,否则结果是肿瘤 + 胚系混合。

坑 2:WES 的 BED 文件版本不一致

不同 WES 试剂盒(Agilent SureSelect / Twist / IDT xGen)有自己的 target BED,用错 BED 会让 70% 的覆盖度统计是假的。BED 必须从厂商网站下载和试剂盒版本对应的那一份。

坑 3:Panel 数据用 WGS 的过滤参数

Panel 测序深度 500-2000x,WGS 30-50x。用 WGS 的 GQ ≥ 20 阈值在 Panel 上会几乎不过滤(Panel 的 GQ 普遍很高),需要用更严格的标准比如 VAF + 链平衡。

坑 4:用错 reference fasta

GATK 要求 reference 必须有 .dict.fai 索引,且染色体顺序匹配。hg19 和 hg38 不能混用,混用会让所有变异坐标错位。

坑 5:Mutect2 跑 tumor-only 不加 PoN

Panel of Normals (PoN) 是从一批正常样本里收集的"看上去像变异但其实是测序伪影"的位点。没 PoN 的 Mutect2 假阳性率会很高,至少要做一份 50-100 个正常样本的 PoN。

下一步

接着深入

横向延伸

参考资源

AI 组学实践

让 AI 带我实战这一篇

AI 会读这篇文章后给你 3-5 步学习计划, 逐步带你学完,最后出 1-3 道题验证你掌握得怎么样。 登录后 AI 才能记住你的进度。

静态文件

离线资料下载

手册 HTML / PDF 已在后台预生成,点击后直接下载网站静态资源。