ClinVar — 全球最大临床变异注释数据库 AI-Ready Wikipedia | 千方病案医数集

变异-表型解读的全球事实标准 · 455 万唯一变异 · 3,512 家提交者

来源 美国国家生物技术信息中心(NCBI)/ 美国国立卫生研究院(NIH) url: https://www.ncbi.nlm.nih.gov/clinvar/发布时间: 2026-09-06最后更新: 2026-09-06 阅读 7

信息速览

数据集名称ClinVar — 全球最大临床变异注释数据库 AI-Ready Wikipedia | 千方病案医数集
数据类型455.7 万唯一变异,695.5 万提交记录,3,512 家提交者,0-4 星评审体系,月度发布,完全免费开放
规模455 万个变异记录
接入方式美国国家生物技术信息中心(NCBI)/ 美国国立卫生研究院(NIH) url: https://www.ncbi.nlm.nih.gov/clinvar/
AI 就绪度

数据集封面

ClinVar — 全球最大临床变异注释数据库 AI-Ready Wikipedia


INFOBOX

数据集名称 ClinVar
英文全称 ClinVar: public archive of interpretations of clinically relevant variants(NCBI)
别名/简称 ClinVar、NCBI ClinVar、ClinVar VCV/RCV/SCV(按 accession 口径)
疾病分类 全疾病谱遗传变异(单基因遗传病 / 遗传性肿瘤 / 药物基因组学 / 肿瘤体细胞)。核心映射:2B90.0 林奇综合征 / BC43.0 肥厚型心肌病 / CA25 囊性纤维化 / 8C70.0 杜氏肌营养不良 / 5C80.0 家族性高胆固醇血症
SNOMED CT 315058005 Lynch syndrome / 45218007 Hypertrophic cardiomyopathy / 190905008 Cystic fibrosis / 19370009 Duchenne muscular dystrophy / 398036000 Familial hypercholesterolemia(详见 §2.2)
数据模态 基因组(变异-表型关系专家注释:SNV / indel / CNV / 结构变异 / 单倍型与基因型)
AI 任务类型 变异致病性预测(分类)、变异效应预测(回归/排序)、命名实体识别与术语映射、冲突检测与证据挖掘、知识图谱构建
样本总数 6,955,361 条提交解读(SCV)/ 4,557,411 条唯一变异记录(VCV),其中 4,307,132 条带分类(NCBI 官方统计,截至 2026-08-22)
数据大小 ~5.85 GB(VCV XML 月度发布,压缩)/ ~184 MB(VCF GRCh38)/ ~442 MB(variant_summary.txt.gz)
数据格式 XML(VCV/RCV,新旧格式)/ VCF(GRCh37、GRCh38)/ TSV(variant_summary 等 10+ 文件)/ E-utilities API(XML/JSON)
许可证 公共领域(US Government work);免费使用,发表时要求署名引用 ClinVar 论文
访问级别 开放(免注册、免申请、FTP/API 直接获取)
DUO 标签 NRES
语言 英文
首发日期 2013-04(正式上线;2012-11 原型)/ 2014-01-01(首篇论文,NAR 数据库专刊)
最后更新 2026-09-03(ClinVarVCVRelease_2026-09 月度发布;网站每周一更新)
发布机构 美国国家生物技术信息中心(NCBI),国家医学图书馆(NLM),美国国立卫生研究院(NIH)
官方主页 https://www.ncbi.nlm.nih.gov/clinvar/
下载地址 https://ftp.ncbi.nlm.nih.gov/pub/clinvar/
DOI 10.1093/nar/gkt1113(2014 主引用论文)
引用次数 4,089+(Landrum 2014,Google Scholar,截至 2026-09);四篇 NAR 主论文合计 8,000+
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— TSV/VCF 开箱即用、月度归档可复现、文档完备;扣分项:无官方 train/test 划分、标签质量分层显著(76.7% 仅 1 星)、训练-评估循环泄漏风险
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、ACMG/AMP 五级分类体系、胚系与体细胞分类术语、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(variant_summary 字段体系、SCV/RCV/VCV 三级 accession)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 NCBI、NLM、NIH、ClinGen 无任何商业利益关联。本页面不销售 ClinVar 数据(该数据为公共领域),仅提供 AI 就绪指南与学术信息服务。编辑者未接受 NCBI、ClinGen 或任何 ClinVar 提交机构的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。特别提示:ClinVar 官方明确声明其内容"不用于直接诊断或医疗决策",任何变异分类须由遗传学专业人员复核后方可用于临床场景。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:ClinVar 为公共领域数据(US Government work),使用无许可限制,但在出版物和网站中分发或引用时,应署名引用 ClinVar 出版物(如 Landrum et al. 2018,PMID: 29165669)。引用具体记录必须带 accession 与版本号(分类会随时间变化)。DUO 标签仅供参考。


§1 数据集概览

§1.0 30 秒速览

ClinVar 是美国 NCBI(隶属 NIH 国家医学图书馆)于 2013 年 4 月推出的临床变异公共档案馆,收集全球临床检测实验室、研究机构和专家面板对"人类基因变异与疾病关系"的解读。截至 2026 年 8 月,它收录了 455.7 万条唯一变异记录、695.5 万条提交解读,来自 3,512 家机构、覆盖 92,938 个基因

它的地位无可替代:这是全球临床遗传学的"共同语言"。当任何一家实验室遇到没见过的变异,第一件事就是查 ClinVar;它独创的 0-4 星评审体系(单提交者 1 星 → 多提交者无冲突 2 星 → 专家面板 3 星 → 执业指南 4 星)让"这条解读有多可信"第一次有了公共刻度。对 AI 领域,它是变异效应预测的标准评测集——AlphaMissense(Science 2023)的 0.940 auROC 就是在 ClinVar 上报告的。

你可以用它来:构建和评测变异致病性预测模型(注意基因级留出防泄漏)、为变异注释流程(VEP/ANNOVAR)提供临床标签源、研究不同实验室间的解读冲突与重分类动态、或做药物基因组学与肿瘤体细胞变异研究。

§1.1 摘要

ClinVar 的核心模型是"提交-聚合"双层架构:任何符合资质的机构都可提交变异解读(SCV 记录,含分类、证据、断言标准);NCBI 不自己做解读,而是按规则把同一变异的多个提交聚合为变异-疾病记录(RCV)和变异级记录(VCV),并计算 0-4 星评审状态。分类术语分三套:胚系变异用 ACMG/AMP 2015 五级(Pathogenic / Likely pathogenic / VUS / Likely benign / Benign);2024 年 1 月起新增体细胞临床影响(AMP/ASCO/CAP 2017,Tier I-IV)与致癌性(ClinGen/CGC/VICC 2022)两类。数据通过网站(每周一更新)、FTP(每周 + 每月第一个周四归档发布,XML/VCF/TSV 三种格式)与 E-utilities API 全量开放,无任何访问门槛。冲突透明化是其灵魂设计:意见相左的解读不掩盖、不仲裁,而是并列展示并打上 “Conflicting classifications of pathogenicity” 标签——截至 2026-08,这样的变异有 165,945 条(占有分类变异的约 3.9%)。

§1.2 战略价值分析

范式开创维度:ClinVar 之前,变异解读锁在各实验室的私有数据库里,同一位患者同一份变异,不同实验室可能给出相反结论且互不知晓。ClinVar 用"公开提交 + 透明聚合 + 冲突可见"三件套打破了这个格局——2015 年 Rehm 等人在 NEJM 披露多实验室解读冲突率高达 17%,直接催生了 ClinGen 标准化运动与实验室间协调机制;到 2017 年 Harrison 等人的四实验室协作研究已把一致率从 88.3% 提升到 91.7%。可以说,ClinVar 把"变异解读"从各家的黑箱手艺变成了可审计的公共科学。

标准锚定维度:ClinVar 是 ACMG/AMP 2015 五级分类体系(Richards et al., Genet Med)落地的最大载体,也是 FDA 认可的人类遗传变异公共数据库参考源。它的星级体系创造了一个精巧的激励机制:实验室想要高星,就必须公开断言标准与证据;专家面板(须经 ClinGen 认可)的 3-4 星解读自动覆盖低星冲突,引导整个行业向专家共识收敛。这套"算法聚合 + 专家覆盖"的治理结构,是后来无数医学知识库模仿的对象。

AI 基础设施维度:在机器学习领域,ClinVar 是变异效应预测(variant effect prediction)这个百亿参数模型竞技场(ESM、EVE、AlphaMissense、GPN-MSA、Evo2、AlphaGenome)的通用评测基准。AlphaMissense 论文用 18,924 个 ClinVar 错义变异报告了 0.940 auROC,并专门讨论了"用 ClinVar 训练再在 ClinVar 上评估"的标签循环陷阱——这一讨论本身已成为该领域的标准警示。月度归档发布(永久保留)又为基准复现提供了版本锚点。

§1.3 横向对比

数据集 规模 性质 访问方式 核心差异化
ClinVar 455.7 万唯一变异 / 695.5 万提交 变异-表型解读的提交聚合档案馆 完全开放(FTP/API) 星级评审 + 冲突透明;全球提交者生态;三套分类术语
HGMD(专业版) 约 40 万+ 致病变异 文献人工策展 商业许可(公共版滞后免费) 策展深度与文献覆盖,但付费墙
gnomAD v4 约 8 亿变异 人群等位基因频率(无致病解读) 完全开放 频率证据库——ClinVar 解读的核心证据来源,非竞品
COSMIC 肿瘤体细胞突变目录 专家策展 学术免费、商业付费 肿瘤体细胞专精;不允许实验室提交未发表数据
CIViC 癌症变异临床解释 专家众包策展 开放 仅肿瘤,证据级策展粒度更细
LOVD 分散的基因座特异数据库 策展 开放 ClinVar 的上游来源之一,单基因深度
OncoKB 肿瘤变异-药物知识库 专家策展 非学术用途付费 治疗可操作性导向

ClinVar 的不可替代性在于三点:唯一接受全球实验室直接提交的开放聚合平台(数据源头优势)、唯一的 0-4 星公共可信度刻度(治理优势)、以及完全免费无门槛的分发(生态优势)。它的短板同样清晰:作为"档案馆"而非"策展库",76.7% 的变异只有单一提交者背书(1 星),标签质量高度分层(详见 §7)。

§1.4 版本演进时间轴

时间 事件
2012-11 原型发布
2013-04 正式上线(NCBI/NLM/NIH)
2014-01 首篇论文发表:Landrum et al., NAR 42(D1):D980-D985(DOI: 10.1093/nar/gkt1113)
2015-05 Rehm et al.(ClinGen)NEJM 372:2235-2242 披露多实验室解读冲突率 17%,触发行业标准化
2015-06 评审状态计算升级,引入"断言标准(assertion criteria)"权重
2016-01 更新论文:Landrum et al., NAR 44(D1):D862-D868(DOI: 10.1093/nar/gkv1222)
2017 Harrison et al.(Genet Med)四实验室协作:一致率 88.3% → 91.7%;Yang et al. 发表冲突来源系统分析
2018-01 VCV 变异中心化架构论文:Landrum et al., NAR 46(D1):D1062-D1067(DOI: 10.1093/nar/gkx1153)
2018-10 五周年:60 万提交记录、1,000 家提交者、43 万唯一变异(Landrum & Kattman, Hum Mutat 39:1623-1630)
2019-04 变异中心化 XML(VCV)生产发布
2020-01 Variation 页面改版:Landrum et al., NAR 48(D1):D835-D844
2023-09 AlphaMissense 以 ClinVar 为核心评测集发表(Science 381:eadg7492)
2024-01-29 体细胞变异提交开放;三分类体系(胚系/体细胞临床影响/致癌性)上线;存量记录自动归为胚系
2024-12 旧版 XML 格式停止支持(ClinicalSignificance 拆分为三个元素)
2025-01 体细胞更新论文:Landrum et al., NAR 53(D1):D1313-D1321(DOI: 10.1093/nar/gkae1090)
2026-08-22 官方统计:455.7 万唯一变异、695.5 万提交、3,512 家提交者

§1.5 典型 AI 应用场景

  1. 变异致病性预测模型训练与评测:以 P/LP vs B/LB 为标签的错义、剪接、非编码变异分类——AlphaMissense、EVE、GPN-MSA 等的标准竞技场(必须基因级留出防泄漏,见 §6.5 坑点 7)。
  2. 临床变异注释管道标签源:作为 VEP/ANNOVAR 的临床注释输入,为 WGS/WES 报告流程提供 ClinSig、星级与冲突标记。
  3. 解读冲突与重分类研究:165,945 条冲突变异 + 完整的提交历史,是研究实验室间一致性、ACMG 准则落地效果、VUS 流转率的天然实验场。
  4. 药物基因组学(PGx):胚系分类中含 drug response 术语的变异(如 DPYD、TPMT、CYP2C19),支撑用药指导模型。
  5. 肿瘤体细胞变异研究:2024 年起新增的体细胞临床影响(Tier I-IV,关联药物)与致癌性分类,为肿瘤精准医疗提供与 CIViC/OncoKB 互补的开放数据源。

§2 医学背景

§2.1 ICD-11 疾病分类锚定

ClinVar 覆盖全疾病谱的遗传变异——从罕见单基因病到常见肿瘤易感、药物反应。库内表型经 MedGen 标准化,以下为代表性高频疾病类别的 ICD-11 锚定:

疾病类别 代表基因 ICD-11 对应 ClinVar 中的地位
遗传性乳腺癌/卵巢癌 BRCA1、BRCA2、PALB2 2C62.Z 乳腺恶性肿瘤(遗传易感背景) 解读最成熟的类别之一,专家面板(ENIGMA)3-4 星密集
林奇综合征与遗传性结直肠癌 MLH1、MSH2、MSH6、PMS2 2B90.0 遗传性非息肉病性结直肠癌 InSiGHT 专家面板坐镇,重分类研究高发区
遗传性心肌病与心律失常 MYH7、MYBPC3、KCNQ1、SCN5A BC43.0 肥厚型心肌病 / BC65 心律失常相关综合征 冲突率最高的领域之一(Yang 2017:心脏科一致性显著低于肿瘤)
囊性纤维化 CFTR CA25.Z 囊性纤维化 CFTR2 专家策展,VUS 管理经典案例
神经肌肉病 DMD、SMN1 8C70.0 杜氏肌营养不良 CNV/外显子缺失占比高
神经遗传病 HTT、APOE 8A01.10 亨廷顿病 动态突变与风险等位基因特例
先天代谢缺陷 PAH、GALT 5C50-5C5Z 先天代谢缺陷 生化验证直接,解读一致率较高
家族性高胆固醇血症 LDLR、APOB、PCSK9 5C80.0 家族性高胆固醇血症 功能实验(LDL 摄取)证据链完整
药物基因组学 DPYD、TPMT、CYP2C19 —(drug response 术语) PharmGKB 提交为主
肿瘤体细胞 BRAF、EGFR、TP53、KRAS 按肿瘤部位编码 2024 年新增体系,增长最快的板块

重要说明:ClinVar 的"疾病"单位不是 ICD 编码而是 MedGen 概念——一个变异可关联多个表型(PhenotypeList),且存在 “not provided”(提交者未给出疾病名)这一特殊取值。做疾病维度统计前必须先做 MedGen → ICD-11 的概念映射(见 §6.5 坑点 8)。

§2.2 SNOMED CT 映射

临床场景 代表基因 ICD-11 SNOMED CT SNOMED CT 术语
林奇综合征 MLH1/MSH2 2B90.0 315058005 Lynch syndrome (disorder)
家族性乳腺癌 BRCA1/2 2C62.Z 254843002 Familial cancer of breast (disorder)
肥厚型心肌病 MYH7/MYBPC3 BC43.0 45218007 Hypertrophic obstructive cardiomyopathy (disorder)
长 QT 综合征 KCNQ1/SCN5A BC65.0 442917000 Long QT syndrome (disorder)
囊性纤维化 CFTR CA25.Z 190905008 Cystic fibrosis (disorder)
杜氏肌营养不良 DMD 8C70.0 19370009 Duchenne muscular dystrophy (disorder)
亨廷顿病 HTT 8A01.10 58756001 Huntington’s chorea (disorder)
家族性高胆固醇血症 LDLR 5C80.0 398036000 Familial hypercholesterolemia (disorder)
遗传性乳腺癌卵巢癌综合征 BRCA1/2 718220005 Hereditary breast and ovarian cancer syndrome (disorder)

§2.3 疾病简介

每个人类基因组携带数百万个变异,其中绝大多数临床意义未知。单基因遗传病全球受累人群约占总人口的 1%,而遗传性肿瘤易感(如 BRCA1/2)与药物基因组学变异影响面更广。临床基因检测的核心瓶颈从来不是测序——而是变异解读:同一个变异,不同实验室依据不同证据与准则可能给出不同结论。ClinVar 正是为解决这一瓶颈而生的公共基础设施:它让任何实验室都能查询全球同行对某个变异的解读、证据与置信度。当前库内带分类的 430.7 万变异中,约半数以上为良性/可能良性(这部分是临床"排除法"的主力证据),意义未明变异(VUS)占约三分之一——VUS 的去留与流转是当代临床遗传学的中心议题。

§2.4 临床任务定义

AI 任务 临床对应 标准参考 在 ClinVar 中的操作化
变异致病性五分类 诊断决策 ACMG/AMP 2015(Richards et al.) ClinicalSignificance ∈ {Pathogenic, Likely pathogenic, Uncertain significance, Likely benign, Benign};ClinSigSimple 提供 0/1 简化
评审置信度分级 证据强度评估 ClinVar review status 规范 ReviewStatus 0-4 星七档文本值
体细胞临床影响分级 肿瘤治疗/诊断/预后 AMP/ASCO/CAP 2017(Li et al., J Mol Diagn) SomaticClinicalImpact(Tier I-IV,治疗相关须附药物)
致癌性五分类 肿瘤发生机制 ClinGen/CGC/VICC 2022(Horak et al.) Oncogenicity ∈
药物反应注释 用药指导 CPIC/PharmGKB 体系 ClinicalSignificance = “drug response” 等术语
冲突检测 质量审计 ClinVar 聚合规则 “Conflicting classifications of pathogenicity” + CLNSIGCONF 明细

§2.5 患者人群特征

ClinVar 不发布患者级数据,其"人群"维度体现为提交者与变异来源结构:

维度 特征
数据来源 3,512 家全球提交机构(截至 2026-08-22):临床检测实验室(GeneDx、Invitae、Ambry、Quest、LMM/Partners 等)、研究机构、ClinGen 认可专家面板、执业指南组、患者登记库、文献策展方(OMIM、PharmGKB 等)
提交规模 6,955,361 条提交解读(SCV),其中 5,961,479 条带断言标准、6,395,879 条带分类(胚系 6,392,209 / 体细胞 3,670)
变异规模 4,557,411 条唯一变异(VCV);4,307,132 条带分类;92,938 个基因被涉及,其中 18,378 个基因有该基因专属变异
变异类型 SNV、indel、CNV、结构变异、单倍型与复合基因型(后者仅 XML 完整表达)
地域与人群 提交机构以美国、欧洲临床实验室为主;变异所来源的被检人群隐含欧美祖源偏倚(无个体祖源字段,见 §7.1)
时间跨度 2013 年至今持续提交;每条 SCV 含 LastEvaluated(提交者最后评估日期),跨度从 1980 年代文献导入到当月
评审结构 带断言标准的变异中:1★ 单提交者 76.7%(3,302,141)/ 2★ 多提交者共识 15.5%(669,245)/ 1★ 冲突 3.8%(165,513)/ 3★ 专家面板 0.5%(22,404)/ 4★ 执业指南 0.02%(663)

§2.6 金标准/参考标准

ClinVar 的金标准是一个分层置信体系而非单一标签——这正是星级(review status)的设计目的:

层级 标注方式 标注者 金标准性质
4★ 执业指南 专业学会指南级解读 如 CFTR2、InSiGHT 等 guideline 组 最高置信;仅 663 条变异
3★ 专家面板 ClinGen 认可的专家面板(VCEP)按基因特异性规则复评 如 ENIGMA(BRCA)、PTEN VCEP、CDH1 VCEP 等 领域专家共识;22,404 条变异;自动覆盖低星冲突
2★ 多提交者无冲突 多家实验室独立解读一致 各临床实验室 交叉验证式置信;669,245 条
1★ 单提交者 单家实验室按公开断言标准解读 各临床实验室/研究组 占绝对多数(76.7%);质量方差最大
1★ 冲突 多家提交但结论存在医学显著分歧 各提交者 需人工审读各 SCV 证据
0★ 无断言标准 未公开解读准则(含部分文献导入与 OMIM 记录) 文献/研究导入 不参与星级计算;AI 训练应默认剔除

聚合规则(AI 使用者必读):VCV/RCV 的聚合分类由规则算法计算,非人工审定。3-4 星解读直接决定聚合值(冲突仍在 SCV 层展示);"冲突"仅当 P/LP 与 VUS/B/LB 之间存在医学显著分歧时标记——VUS vs B/LB 的分歧不算冲突(见 §6.5 坑点 2)。体细胞临床影响的聚合取最高证据等级;致癌性聚合与胚系同规则。


§3 数据集规格

§3.0 版本抉择矩阵

“ClinVar 没有版本号,只有发布时间”——你的第一决策是选文件格式,第二决策是选发布批次

你的需求 推荐文件 大小 理由
变异注释流程(WGS/WES pipeline) vcf_GRCh38/clinvar.vcf.gz(或 GRCh37) ~184 MB 与 bcftools/VEP/ANNOVAR 直接对接;但仅含 rs# 短变异,大 SV 不在内
ML 训练集构建(表格派) tab_delimited/variant_summary.txt.gz ~442 MB 一行一变异,35+ 列覆盖分类、星级、坐标、表型;pandas 直读
提交者级证据分析 / 冲突研究 xml/ClinVarVCVRelease_YYYY-MM.xml.gz ~5.85 GB 最全:SCV 级证据、引用、断言标准、提交历史;月度归档可复现
仅看冲突变异 tab_delimited/summary_of_conflicting_interpretations.txt ~1.8 GB 冲突明细专表
零星变异查询 E-utilities API 免下载;3 req/s(有 API key 10 req/s)
投稿级可复现研究 锁定月度归档(如 ClinVarVCVRelease_2026-08) 同上 月度归档永久保留;weekly 仅保留至下月,勿用于论文锚定

发布节奏:网站每周一更新;XML 每周一更新(仅保留至下月)+ 每月第一个周四月度归档(永久保留);VCF 月度发布 + weekly 子目录;tab_delimited 月度发布;disease_names / gene_condition_source_id 每日更新。

格式选型速查

维度 VCF variant_summary.tsv VCV XML
行单位 基因位点(一位点多变异合并注释) 变异(VariationID 唯一) 变异(VCV)+ 提交(SCV)嵌套
结构变异 ❌ 不含 >10kb SV ✅ 含 ✅ 含(含单倍型/基因型)
提交者级证据 ❌ 仅聚合值 ❌ 仅聚合值 ✅ 完整 SCV
引用文献 ❌(用 var_citations.txt 补充)
适用场景 基因组注释 ML 训练集 证据深挖

§3.1 模态详细说明

ClinVar 的模态是变异-表型关系的专家注释,包含三个层次:

  1. 变异本体:基因组坐标(GRCh37/GRCh38 双组装)、HGVS 标准命名(基因 + cDNA + 蛋白变化)、分子后果(Sequence Ontology 术语)、dbSNP rs# / dbVar nsv 交叉标识。变异类型从单核苷酸变异(SNV)到兆碱基级结构变异、单倍型与复合基因型。
  2. 解读层:三套分类术语——胚系(ACMG/AMP 五级 + drug response / risk factor / protective / association 等扩展术语)、体细胞临床影响(Tier I-IV + 关联药物)、致癌性(五级);每条解读附断言标准(assertion criteria)、证据摘要与文献引用。
  3. 治理层:0-4 星评审状态、提交者身份与方法类型(clinical testing / research / literature only 等)、冲突标记(CLNSIGCONF)、LastEvaluated 时间戳。

§3.2 样本量拆分(三级 accession 口径)

NCBI 官方统计(截至 2026-08-22,https://www.ncbi.nlm.nih.gov/clinvar/docs/statistics/):

A. 提交层(SCV)

指标 数值
提交记录总数 6,955,361
带断言标准 5,961,479
带分类 6,395,879(胚系 6,392,209 / 体细胞 3,670)
提交机构总数 3,512

B. 聚合层(VCV,唯一变异)

指标 数值
唯一变异记录 4,557,411
带分类的唯一变异 4,307,132(胚系 4,305,510 / 体细胞 3,026)
带断言标准的唯一变异 4,159,966
冲突变异 165,945(约 3.9%)
涉及基因 92,938(其中 18,378 个基因有专属变异)

C. 星级分布(带断言标准的唯一变异,4,159,966 条)

星级 含义 数量 占比
★★★★ 执业指南 663 0.02%
★★★ 专家面板 22,404 0.5%
★★ 多提交者无冲突 669,245 16.1%
单提交者 3,302,141 79.4%
多提交者冲突 165,513 4.0%

规模增长的感性参照:2018 年五周年时为 60 万提交 / 43 万唯一变异 / 1,000 家提交者;八年后的 2026 年,提交量增长超过 10 倍,唯一变异数增长超过 10 倍,提交者增长 2.5 倍。第三方月度追踪(Biocodify,2026-05 口径)显示单月新增约 6.9 万变异、约 1.5 万条重分类、约 3.4 万条置信度变化——这是一个高度动态的库

§3.3 数据格式详情

格式 位置 更新 说明
VCV XML(新格式,默认) xml/ClinVarVCVRelease_00-latest.xml.gz + 月度归档 周更 + 月度归档 最全档案;新格式以 GermlineClassification / SomaticClinicalImpact / OncogenicityClassification 三元素替代旧 ClinicalSignificance
RCV XML xml/RCV_release/ 同上 变异-疾病对口径
旧格式 XML xml/VCV_xml_old_format/、xml/RCV_xml_old_format/ 已冻结(支持至 2024 年底) 仅供遗留管道
VCF vcf_GRCh37/、vcf_GRCh38/(含 weekly/) 月度 + 周更 仅 rs# 短变异;INFO 含 CLNSIG/CLNREVSTAT/CLNSIGCONF/SCI/ONC 等
TSV 系列 tab_delimited/ 月度 variant_summary / submission_summary / summary_of_conflicting_interpretations / var_citations / hgvs4variation / gene_specific_summary / organization_summary / cross_references / allele_gene 等
疾病与基因关系 disease_names、gene_condition_source_id 日更 表型与基因-疾病关系
API E-utilities(esearch/esummary/efetch/elink) 与网站同步 XML/JSON;3 req/s(无 key)/ 10 req/s(有 key)

§3.4 存储大小

文件 大小(压缩,2026-09/08 实测) 备注
ClinVarVCVRelease_2026-09.xml.gz ~5.85 GB(5,849,397,646 B) 解压后数十 GB,建议流式解析
clinvar.vcf.gz(GRCh38) ~184 MB + .tbi 索引 ~596 KB
variant_summary.txt.gz ~442 MB pandas 可读,解压约 3-4 GB
submission_summary.txt.gz ~387 MB SCV 口径明细
summary_of_conflicting_interpretations.txt ~1.8 GB 冲突明细专表
hgvs4variation.txt.gz ~522 MB HGVS 全集
var_citations.txt ~230 MB 变异-文献映射

磁盘建议:完整工作区(XML + VCF 双组装 + TSV 全套 + 解压空间)预留 100 GB。

§3.5 标注方式

ClinVar 的标注是专家提交 + 规则聚合双机制:

  1. 提交者标注:各机构按自己的断言标准(绝大多数为 ACMG/AMP 2015 准则及其基因特异性扩展)对变异分类并提交证据。方法类型分为 clinical testing、research、literature only、curation 等。
  2. 专家面板复评:ClinGen 认可的 VCEP(Variant Curation Expert Panel)按基因特异性规则对关键变异给出 3 星解读;执业指南组给出 4 星。
  3. NCBI 规则聚合:对同一 VCV/RCV,按"专家面板/指南优先 → 多提交者共识 2 星 → 单提交者 1 星 → 冲突标记"的规则算法计算聚合分类与星级;体细胞临床影响取最高证据等级。NCBI 明确不做医学仲裁——“档案馆,不评判”(Landrum 2018)。

§3.6 标注者资质

标注者类型 数量/代表 资质机制 一致性证据
临床检测实验室 占提交主体(GeneDx、Invitae、Ambry、LMM、Quest、Mayo、ARUP 等) CLIA/CAP 等临床实验室认证体系;须提交断言标准文档 Harrison 2017:四实验室一致率 88.3%→91.7%(重评后);医学显著分歧仅 2%
专家面板 ClinGen 认可的 VCEP 与 guideline 组 ClinGen 申请审核制;基因特异性准则公开 3-4 星为库内最高置信层,自动覆盖冲突
研究/文献策展 OMIM、PharmGKB、各 LSDB 无临床准则约束(OMIM 明确不按临床标准分类) Yang 2017:此类提交与临床实验室解读不一致率显著更高——0-1 星标签需分层对待
患者登记/表型提交 GenomeConnect 等 提供表型为主(phenotyping only) 不产生分类权重

§3.7 数据采集时间范围

2013 年 4 月至今持续滚动提交;单条 SCV 的 LastEvaluated 字段记录提交者最后评估日期,从早期文献导入(1980-90 年代记录)到当月均有分布。陈旧提交是已知风险——Harrison 2017 显示 36% 的实验室间分歧通过"用现行准则重评旧解读"即可消除(见 §6.5 坑点 4)。

§3.8 地理覆盖

全球 3,512 家机构提交,以美国与欧洲临床实验室为绝对主体;亚洲、大洋洲、拉美实验室参与度逐年上升。注意:机构全球化 ≠ 被检人群全球化——被测序人群仍以欧美祖源为主,这一隐含偏倚会传导至解读结论(见 §7.1)。

§3.9 采集设备规格

不适用单一采集设备概念。上游测序平台涵盖各代 NGS(Illumina 为主)、Sanger 验证、MLPA/微阵列(CNV)等;各 SCV 的 MethodType 字段记录数据捕获类型(clinical testing / research / literature only / curation / provider interpretation / phenotyping only),但不强制记录具体测序平台与版本。

§3.10 深度溯源链

环节 系统/方法 关键转换
1. 临床检测 各实验室 NGS/Sanger/CMA 检测与内部解读流程 变异按各实验室准则分类,产生私有解读
2. 标准对齐 ACMG/AMP 2015 五级 + 基因特异性规则(ClinGen SVI) 2015 后行业逐步统一到公共准则框架
3. 提交 ClinVar 提交门户 / 批量文件 / 提交 API(2024 起支持体细胞) 生成 SCV accession(带版本号);须附断言标准与证据
4. NCBI 标准化 HGVS 命名校验、MedGen 表型映射、dbSNP/dbVar 定位、RefSeq 分子后果计算 提交数据被规范化到公共坐标与术语体系
5. 规则聚合 RCV(变异-疾病对)与 VCV(变异)聚合算法 + 星级计算 生成聚合分类、评审状态与冲突标记;专家面板自动覆盖
6. 分发 网站(周更)+ FTP(周更/月度归档)+ E-utilities API + RefSeq/GTR 注释轨道 月度归档永久保留,构成可复现锚点

§4 数据结构详解

§4.0 目录结构预览

pub/clinvar/
├── xml/
│   ├── ClinVarVCVRelease_00-latest.xml.gz        # 最新 VCV 全量(~5.85 GB,每月第一个周四刷新)
│   ├── ClinVarVCVRelease_2026-09.xml.gz          # 月度归档(永久保留,论文锚定用)
│   ├── weekly_release/                           # 每周一增量(仅保留至下月发布)
│   ├── RCV_release/                              # RCV(变异-疾病对)新格式
│   ├── VCV_xml_old_format/                       # 旧格式(已冻结)
│   ├── RCV_xml_old_format/                       # 旧格式(已冻结)
│   ├── archive/                                  # 历史年度归档
│   └── sample_xml/                               # 样例文件
├── vcf_GRCh37/
│   ├── clinvar.vcf.gz + .tbi                     # GRCh37 VCF + 索引
│   ├── weekly/                                   # 周更
│   └── archive_1.0/ archive_2.0/                 # 历史归档
├── vcf_GRCh38/
│   ├── clinvar.vcf.gz + .tbi                     # GRCh38 VCF(~184 MB)
│   └── weekly/
├── tab_delimited/
│   ├── variant_summary.txt.gz                    # 核心表:一行一变异(~442 MB)
│   ├── submission_summary.txt.gz                 # SCV 提交明细(~387 MB)
│   ├── summary_of_conflicting_interpretations.txt# 冲突明细(~1.8 GB)
│   ├── var_citations.txt                         # 变异-文献映射(~230 MB)
│   ├── hgvs4variation.txt.gz                     # HGVS 全集(~522 MB)
│   ├── gene_specific_summary.txt                 # 基因级汇总
│   ├── organization_summary.txt                  # 提交者汇总
│   ├── cross_references.txt                      # 外部库交叉引用
│   ├── allele_gene.txt.gz                        # 等位基因-基因关系
│   └── archive/
├── disease_names                                 # 疾病名(日更)
├── gene_condition_source_id                      # 基因-疾病关系(日更)
├── release_notes/                                # 发布说明
├── README.txt / README_VCF.txt                   # 官方格式说明
└── ClinGen/                                      # ClinGen 相关文件

§4.1 DAIMS 标准化字段描述表(variant_summary.txt 核心列)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
VariationID INTEGER 变异级(VCV)稳定标识 17661 主键;跨版本追踪 不允许缺失 正整数
AlleleID INTEGER 等位基因标识 18736 单倍型拆解 不允许缺失 正整数
Type TEXT 变异类型 “single nucleotide variant” 分桶评测(必须!见 §6.5 坑点 7) 归类粗 不允许缺失 SNV / indel / CNV / duplication 等
Name TEXT 首选 HGVS 名 “NM_000059.4(BRCA2):c.1310_1313del (p.Lys886fs)” 实体识别与解析 HGVS 规范化歧义 不允许缺失 HGVS 字符串
GeneSymbol TEXT HGNC 基因符号 “BRCA2” 基因级留出划分 多基因变异以分号连接 不允许缺失 HGNC 符号
ClinicalSignificance TEXT 聚合胚系分类 “Pathogenic” 主标签 算法聚合,非人工审定 无分类变异不入主流训练 Pathogenic / Likely pathogenic / Uncertain significance / Likely benign / Benign / Conflicting classifications of pathogenicity / drug response 等
ClinSigSimple INTEGER 二值简化 1 快速二分类标签 简化损失信息 1 = (Likely) Pathogenic;0 = 其他
LastEvaluated DATE 提交者最后评估日期 2023-04-15 陈旧度过滤 提交者自定义 部分为空(新提交/未评估) 日期或空
RS# (dbSNP) INTEGER dbSNP rs 号 80359550 跨库连接 无 rs# 的变异缺失 未分配者为 -1 正整数 / -1
RCVaccession TEXT 变异-疾病聚合 accession “RCV000044500” 连接 RCV 级数据 多个以分号连接 不允许缺失 RCV + 版本号
PhenotypeIDS TEXT 表型数据库 ID “MedGen:C2675520,OMIM:600185” 疾病映射 多源异构 “not provided” 即信息性缺失 分号连接的 来源:ID
PhenotypeList TEXT 表型名列表 “Breast-ovarian cancer, familial 2” 疾病分层 自由文本风格不一 “not provided” 分号连接字符串
Origin TEXT 等位基因来源 “germline” 胚系/体细胞过滤 历史记录混杂 “unknown”/“not provided” germline / somatic / de novo / unknown 等
Assembly TEXT 参考组装 “GRCh38” 坐标系区分 需与管道对齐 未定位记录为空 GRCh37 / GRCh38 / 空
Chromosome / Start / Stop TEXT/INT 坐标 13 / 32338950 / 32338953 基因组操作 与 VCF 坐标口径不同(见坑点 5) 未定位为空 染色体坐标
ReviewStatus TEXT 聚合评审状态 “criteria provided, multiple submitters, no conflicts” 质量分层过滤(核心!) 七档文本值 0 星为 “no assertion criteria provided” practice guideline / reviewed by expert panel / criteria provided, multiple submitters, no conflicts / criteria provided, conflicting classifications / criteria provided, single submitter / no assertion criteria provided / no classification provided
NumberSubmitters INTEGER 提交者数 12 置信特征 含无分类提交 不允许缺失 ≥0
SubmitterCategories TEXT 提交者类别 “clinical testing;expert panel” 提交者类型分析 分号连接 不允许缺失 clinical testing / research / literature only 等组合
SomaticClinicalImpact / Oncogenicity TEXT 体细胞分类(2024 新增列) “Tier I - Strong” / “Oncogenic” 肿瘤任务标签 提交量尚小 胚系变异为空 Tier I-IV / 致癌性五级 / 空

§4.2 标签分布统计

星级分布(带断言标准的 4,159,966 条唯一变异,截至 2026-08-22):

标签维度 分布 说明
1★ 单提交者 79.4%(3,302,141) 绝对主体——ClinVar 的"长尾"
2★ 多提交者共识 16.1%(669,245) AI 训练的高置信主力
1★ 冲突 4.0%(165,513) 默认应剔除或单独研究
3★ 专家面板 0.5%(22,404) 金标准子集
4★ 执业指南 0.02%(663) 极小但权威
0★ 无断言标准 147,166 条(占有分类变异 3.4%) 建议默认剔除

聚合胚系分类分布(社区统计口径,约值):B/LB 约半数、VUS 约三分之一、P/LP 约五分之一;良性类持续增长最快——高频人群变异(gnomAD 证据)不断被归为良性。

月度动态(Biocodify 2026-05 追踪):单月新增约 6.9 万变异、约 1.5 万条重分类(含 433 条 VUS 转为确定分类、472 条冲突解除、4,680 条新增冲突)——标签本身是流动的。

§4.3 关键字段描述性统计

  • 每条带分类变异平均对应约 1.6 条提交(6,395,879 分类提交 / 4,307,132 带分类变异)。
  • 体细胞板块起步中:3,670 条体细胞分类提交 / 3,026 条带体细胞分类变异(截至 2026-08),对照胚系 639 万——体细胞数据量是胚系的约 0.06%,做肿瘤任务时注意样本量。
  • 冲突率全局约 3.9%,但按领域差异巨大:心脏科基因一致性显著低于肿瘤基因(Yang 2017)。
  • 高频活跃基因(2026-05 月度变更榜):TTN、PLEC、FLNC、NF1、CEP290、FLNA、FBN1、BRIP1——大基因与新证据基因是重分类热点。

§4.4 数据层级关系(SCV → RCV → VCV 三级 accession)

SCV(Submission in ClinVar,6,955,361 条)
  │  一变异 × 一疾病 × 一提交者 × 一分类类型 = 一条 SCV(带版本号)
  ▼
RCV(Reference ClinVar record,变异-疾病聚合)
  │  同一变异 + 同一疾病的全部 SCV 聚合;遗传病 RCV 仅含胚系分类,癌症 RCV 仅含体细胞分类
  ▼
VCV(Variation in ClinVar,4,557,411 条)
     同一变异(或单倍型/基因型)的全部 RCV 汇总;可同时携带胚系 + 体细胞临床影响 + 致癌性三类聚合
  • 单倍型与复合基因型:VCV 可表示 “haplotype”,其组成单变异未必各自有解读(XML 中 MeasureSet/@Type="CompoundHeterozygote")。
  • 引用规范:论文中引用记录必须带 accession + 版本号(如 RCV000080903.19)——分类随提交更新而变化。
  • 高频踩坑:variant_summary 的坐标(Start/Stop)是 HGVS 口径,与 PositionVCF/ReferenceAlleleVCF/AlternateAlleleVCF 列的 VCF 口径可能不同(indel 左对齐差异)——跨格式 join 必须用 VCF 口径列(见 §6.5 坑点 5)。

§4.5 缺失值情况与信息性缺失编码

缺失类型 字段示例 缺失原因 信息性缺失编码 对 AI 的影响
语义化缺失 PhenotypeList = “not provided” 提交者未声明疾病 “not provided” 本身即类别(约占相当比例) 疾病维度统计会被污染,须显式处理
结构缺失 LastEvaluated 为空 新提交或提交者未评估 空值 = 无法判断陈旧度 陈旧度过滤策略需单独处理空值
设计性缺失 RS# = -1 dbSNP 尚未分配 -1 = 未分配 跨库 join 会丢记录
组装缺失 Assembly/坐标为空 变异未定位到基因组 空 = unplaced(VCF 不含此类) 用 VCF 作全集会静默丢数据
评审缺失 0★ “no assertion criteria provided” 未公开断言标准 0 星 = 不参与星级 训练集默认剔除
体细胞缺失 SomaticClinicalImpact / Oncogenicity 为空 绝大多数变异无体细胞提交 空 = 未分类(非"良性") 不可将空值当阴性标签

§5 数据划分与使用建议

§5.1 官方数据划分

ClinVar 官方不提供任何 train/validation/test 划分——它是注释库而非基准数据集。社区事实标准做法有三类:

  1. 基因级留出(gene holdout):按基因随机划分,同一基因的全部变异落在同一侧——防止模型靠"基因先验"作弊。AlphaMissense 采用每基因平衡采样(每基因等量 P/B)做 2,526 变异验证集。
  2. 时间级留出(temporal holdout):用旧月度归档训练、新归档中"新增/重分类"的变异做测试——最接近真实部署场景(预测未来的解读)。
  3. 染色体留出:按染色体分组,用于评估跨基因组区域泛化。

§5.2 推荐划分策略

import pandas as pd
from sklearn.model_selection import GroupShuffleSplit

# 前提:已按 §6.1 过滤出 P/LP 与 B/LB、星级 ≥2、排除冲突
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
train_idx, test_idx = next(gss.split(df, groups=df["GeneSymbol"]))
train, test = df.iloc[train_idx], df.iloc[test_idx]
assert set(train["GeneSymbol"]) & set(test["GeneSymbol"]) == set()  # 基因零泄漏

补充建议:

  1. 按变异类型分层后独立评测(missense / synonymous / splice / UTR / noncoding 分开报)——混合类型会虚增总体 auROC(bioRxiv 2025.09.05.674459,见 §6.5 坑点 7)。
  2. 旁系同源基因(paralog)同侧:BRCA1/BRCA2 虽非同源,但如 DMD 与 utrophin 这类功能相似基因应人工归入同侧,避免"类基因"泄漏。
  3. 锁定月度归档(如 ClinVarVCVRelease_2026-08)并在论文方法学注明 release 名——weekly 不保留,无法复现。

§5.3 数据泄漏风险防御

# 泄漏模式 严重程度 防御措施
1 同基因随机划分(模型学"这个基因多为致病") GroupShuffleSplit(groups=GeneSymbol)
2 用 ClinVar 训练的预测分数(REVEL、CADD、ClinPred 等)作特征,又在 ClinVar 上评估 特征黑名单:剔除一切以 ClinVar 为训练集的元预测器分数;AlphaMissense 论文专门讨论此"标签循环"
3 人群频率特征泄漏:良性标签与高频变异强相关 中高 评估时报告"去频率信息"子集性能;或按 MAF 分桶
4 同一位点多变异(VCF 一位点一行)被拆到两侧 以位点为组做二次校验
5 单倍型 VCV 与其组成变异拆分两侧 haplotype 记录与组成 SNV 归入同侧

§5.4 交叉验证建议

  • 标准:5 折基因分组交叉验证(GroupKFold(groups=GeneSymbol))。
  • 稳健性增强:基因分组 × 变异类型分层的双重报告;3-4 星金标准子集单独评估作为"高置信外检"。
  • 时间稳健性:在 N、N-6、N-12 三个月度归档上重复评测,报告标签漂移对性能的影响。

§5.5 外部验证

ClinVar 训练/评测的模型,经典外部验证路径为:MAVE 功能实验数据(ProteinGym,无临床 ascertainment 偏倚)、de novo 变异队列(如 DDD 发育障碍队列)、ClinGen VCEP 专家面板最新复评(3-4 星子集)、以及功能分类学数据(如 BRCA1 饱和突变扫描)。任何"在 ClinVar 上训练又在 ClinVar 上报告 SOTA"的论文都应默认打折看待。


§6 AI 就绪指南

§6.0 云端快速启动

零下载体验:ClinVar 全库免注册、免申请。最轻的上手方式是 NCBI E-utilities API——一行 curl 即可查询"BRCA1 中专家面板级的致病变异":

curl -s "https://eutils.ncbi.nlm.nih.gov/entrez/eutils/esearch.fcgi?db=clinvar&term=BRCA1[gene]+AND+pathogenic[CLNSIG]+AND+reviewed+by+expert+panel[RVSTAT]&retmode=json"

返回 VariationID 列表后,用 esummary/efetch 取详情。无 API key 限 3 req/s,注册 NCBI 账号申请 key 后 10 req/s。

10 分钟本地表格版:直接下载 variant_summary.txt.gz(442 MB)→ pandas 读入 → 按 §6.1 过滤出高置信 P/B 训练集,全程无需数据库。

§6.1 快速上手(构建高置信致病性训练集)

# ========================================
# ClinVar 快速上手 — 高置信胚系致病性训练集构建
# 环境要求: pandas>=2.0
#
# ⚠️ 目录结构预期:
#   ./data/
#   └── variant_summary.txt.gz   # 来自 ftp.ncbi.nlm.nih.gov/pub/clinvar/tab_delimited/
#   首行以 # 开头("#AlleleID"),pandas 读入后建议重命名首列
# ========================================
import pandas as pd

df = pd.read_csv("./data/variant_summary.txt.gz", sep="\t",
                 compression="gzip", low_memory=False)
df = df.rename(columns={"#AlleleID": "AlleleID"})

# 步骤 1:只保留有明确正负标签的胚系五级分类
pos = {"Pathogenic", "Likely pathogenic"}
neg = {"Benign", "Likely benign"}
df = df[df["ClinicalSignificance"].isin(pos | neg)].copy()
df["label"] = df["ClinicalSignificance"].isin(pos).astype(int)

# 步骤 2:质量过滤——星级 ≥2(多提交者共识/专家面板/指南),排除冲突与 0-1 星
keep = {"criteria provided, multiple submitters, no conflicts",
        "reviewed by expert panel", "practice guideline"}
df = df[df["ReviewStatus"].isin(keep)]

# 步骤 3:排除 "not provided" 表型,锁定 GRCh38,取 SNV
df = df[(df["PhenotypeList"] != "not provided")
        & (df["Assembly"] == "GRCh38")
        & (df["Type"] == "single nucleotide variant")]

# 步骤 4:陈旧度过滤(可选但推荐)——剔除 2015 ACMG 准则发布前的旧评估
df["LastEvaluated"] = pd.to_datetime(df["LastEvaluated"], errors="coerce")
df = df[(df["LastEvaluated"].isna()) | (df["LastEvaluated"] >= "2015-01-01")]

print(f"高置信训练集: {len(df):,} 条变异,阳性率 {df['label'].mean():.1%},"
      f"覆盖基因 {df['GeneSymbol'].nunique():,} 个")

§6.2 数据获取流程

获取方式 链接/位置 大小 流程
TSV 全套 https://ftp.ncbi.nlm.nih.gov/pub/clinvar/tab_delimited/ variant_summary ~442 MB 直接 wget,无需任何注册
VCF(GRCh37/38) https://ftp.ncbi.nlm.nih.gov/pub/clinvar/vcf_GRCh38/ ~184 MB 直接 wget + .tbi 索引
XML 月度归档 https://ftp.ncbi.nlm.nih.gov/pub/clinvar/xml/ ~5.85 GB 选 ClinVarVCVRelease_YYYY-MM 永久归档版
E-utilities API https://eutils.ncbi.nlm.nih.gov/entrez/eutils/ esearch → esummary/efetch;建议申请 API key
网页交互查询 https://www.ncbi.nlm.nih.gov/clinvar/ 支持 [gene]、[CLNSIG]、[RVSTAT] 等字段检索语法

合规义务:无 DUA、无培训要求。唯一要求:出版物/网站中分发或引用时署名引用 ClinVar 论文(官方 FAQ 建议 Landrum et al. 2018,PMID: 29165669);引用具体记录带 accession + 版本号。官方免责声明:不得未经遗传学专业人员复核直接用于诊断或医疗决策。

§6.3 预处理 Pipeline

<details>
<summary><b>点击展开完整的 5 步预处理代码(VCF 注释 + 表格构建双路线)</b></summary>

# 路线 A:VCF 注释路线(把自己的变异集打上 ClinVar 标签)
# 命令行(bash):
#   wget https://ftp.ncbi.nlm.nih.gov/pub/clinvar/vcf_GRCh38/clinvar.vcf.gz{,.tbi}
#   bcftools annotate -a clinvar.vcf.gz \
#     -c INFO/CLNSIG,INFO/CLNDN,INFO/CLNREVSTAT,INFO/CLNSIGCONF,INFO/ALLELEID \
#     -o my_annotated.vcf my_variants.vcf
# ⚠️ 必须保证 my_variants.vcf 与 ClinVar VCF 同组装(GRCh38 ↔ GRCh38),
#    且双方 indel 均已按 VCF 规范左对齐(bcftools norm)

# 路线 B:表格路线(接 §6.1 输出,构建错义变异 ML 数据集)
import pandas as pd

# 步骤 1:从 Name 列解析基因、cDNA 变化与蛋白变化(示例:错义)
import re
hgvs = df["Name"].str.extract(
    r"(?P<gene>[\w\-]+)\((?P<transcript>[\w\-]+)\)?:?c\.(?P<cdna>[^ ]+)"
    r" \(p\.(?P<protein>[^)]+)\)")
df = pd.concat([df, hgvs], axis=1)
missense = df[df["protein"].str.match(r"[A-Z][a-z]{2}\d+[A-Z][a-z]{2}", na=False)]

# 步骤 2:融合外部特征(示例:合并 AlphaMissense 分数做特征而非标签)
# ⚠️ 合规要点:AlphaMissense 分数经 ClinVar 校准——若在 ClinVar 上评估,
#    该特征会造成软泄漏,见 §6.5 坑点 7 的特征黑名单讨论

# 步骤 3:基因级划分(同 §5.2 GroupShuffleSplit)

# 步骤 4:按变异类型分桶评测集
buckets = {t: g for t, g in df.groupby("Type")}

# 步骤 5:版本锚定记录
meta = {"release": "variant_summary 2026-08-31 (from ClinVarVCVRelease_2026-08 cycle)",
        "filters": "P/LP vs B/LB; stars>=2; GRCh38; SNV; not_provided removed",
        "n_variants": len(df), "positive_rate": float(df["label"].mean())}
print(meta)

</details>

推荐复用社区成熟管道:Ensembl VEP / ANNOVAR(注释内置 ClinVar 字段)、VarFish(对 ClinVar 星级做了本土化改造的案例)、clinvar-tsv 等社区解析脚本、以及各蛋白语言模型官方仓库中的 ClinVar benchmark 构建脚本(AlphaMissense、EVE、ProteinGym 均公开其 ClinVar 子集构建方式——直接复用可比性最好)。

§6.4 框架加载

import torch
from torch.utils.data import Dataset, DataLoader

class VariantDataset(Dataset):
    """表格特征版:保守性分数 + 群体频率 + 注释向量 → P/B 二分类"""
    def __init__(self, X, y):
        self.X = torch.FloatTensor(X)
        self.y = torch.FloatTensor(y)
    def __len__(self):
        return len(self.y)
    def __getitem__(self, i):
        return self.X[i], self.y[i]

loader = DataLoader(VariantDataset(X_train, y_train), batch_size=256, shuffle=True)
import xgboost as xgb  # 经典基线:REVEL 风格特征 + 梯度提升
dtrain = xgb.DMatrix(X_train, label=y_train)
params = {"objective": "binary:logistic", "eval_metric": "aucpr",
          "scale_pos_weight": (len(y_train) - y_train.sum()) / y_train.sum(),
          "max_depth": 8, "learning_rate": 0.05}
model = xgb.train(params, dtrain, num_boost_round=800)

§6.5 常见坑点

⚠️ 坑点 1:星级 ≠ 准确率——1★ 与 0★ 标签的质量断层(分类:标签理解)

问题:79.4% 的带标准变异只有单一提交者背书(1★),另有 3.4% 为 0★(无断言标准)。Yang et al. 2017(Genet Med)系统证明:OMIM、文献与研究导入类提交与临床实验室解读的不一致率显著更高;0-1 星内部质量方差极大,“有星"不等于"可靠”。

症状:用全量 P/B 标签训练的模型在 3-4 星金标准子集上性能骤降;评测分数虚高但临床同事抽查发现大量"错标"。

解决:训练集默认只取 2★+(多提交者共识/专家面板/指南);0-1 星记录若使用,须降权或作半监督未标样本;始终单独报告 3-4 星子集性能。

参考:Yang S et al. (2017), Genet Med. “Sources of discordance among germ-line variant classifications in ClinVar.” DOI: 10.1038/gim.2017.60

⚠️ 坑点 2:“Conflicting” 口径窄——冲突数量被系统性低估(分类:标签理解)

问题:ClinVar 仅当 P/LP 与 VUS/B/LB 之间存在医学显著分歧时才标记冲突;VUS vs B/LB、Pathogenic vs Likely pathogenic 的分歧都不算冲突。聚合 ClinicalSignificance 显示 “Pathogenic” 的变异,底层可能藏有 VUS 意见。

症状:按 ClinicalSignificance 过滤"无冲突"后,仍发现提交者间意见不一;统计的冲突率(约 3.9%)低于直觉。

解决:需要完整分歧图景时用 VCF 的 CLNSIGCONF 字段或 summary_of_conflicting_interpretations.txt(1.8 GB 明细);做标签清洗时把 “P vs LP”“VUS vs B/LB” 的分歧策略显式化(常见做法:合并 P/LP 与 B/LB 为两档,VUS 全部剔除出训练标签)。

参考:ClinVar review status 官方文档(https://www.ncbi.nlm.nih.gov/clinvar/docs/review_status/)

⚠️ 坑点 3:聚合分类是算法产物,不是人工审定(分类:标签理解)

问题:VCV/RCV 的聚合 ClinicalSignificance 由规则算法计算;专家面板/指南解读会自动覆盖低星冲突,但覆盖逻辑可能使"最新专家共识"与"多数实验室意见"不一致;NCBI 明确声明不验证、不仲裁提交内容。

症状:同一变异在 ClinVar 显示 P,但查看 SCV 明细发现多数实验室报 VUS(因存在一条 3★ P 解读);或聚合显示 B 但有一条 P 提交被"冲突"逻辑吞没。

解决:关键队列(如论文主结果集)逐条回看 SCV 明细;用 submission_summary.txt.gz 做提交者级复核;报告时区分"聚合标签"与"提交者投票分布"两个口径。

参考:Harrison SM et al. (2017), Genet Med 19(10). “Clinical laboratories collaborate to resolve differences in variant interpretations submitted to ClinVar.” DOI: 10.1038/gim.2017.14

⚠️ 坑点 4:陈旧提交无过期标记(分类:评估误用)

问题:提交者没有更新义务,2015 年 ACMG 准则前的旧解读长期留存;Harrison 2017 显示 36% 的实验室间分歧靠"用现行准则重评旧解读"即可消除——也就是说相当比例的"冲突"是陈旧造成的假分歧。库内无任何"已过期"标记。

症状:某变异的冲突记录中,最新提交早已改判,旧提交仍在拉低一致性统计;月度复现研究结论被旧数据污染。

解决:以 LastEvaluated 做陈旧度过滤(常见阈值:2015-01 或近 5 年);分析冲突时按"最新提交年份"分层;训练标签优先取每变异最新高星解读。

参考:Harrison et al. 2017(同上);Yang et al. 2017(旧提交显著更易冲突)

⚠️ 坑点 5:VCF 不是全集 + 坐标口径混乱(分类:预处理陷阱)

问题:VCF 仅含已分配 rs# 的短变异——不含 >10kb 结构变异、未定位记录与单倍型;且 VCF 按"位点"组织(一位点多变异共享注释行)。另有三个坐标口径并存:variant_summary 的 Start/Stop(HGVS 口径)、PositionVCF 列、以及 GRCh37/GRCh38 双组装。跨文件 join 用错列会静默错位。

症状:用 VCF 统计"ClinVar 总变异数"比官方少约 15-20%;indel 类变异注释匹配失败率异常高;GRCh37 流程注释 GRCh38 数据出现大规模"未命中"。

解决:完整性需求用 XML 或 variant_summary;变异匹配前统一 bcftools norm(左对齐 + 拆分多等位);跨文件 join 一律用 PositionVCF/ReferenceAlleleVCF/AlternateAlleleVCF 三列;组装版本在文件名与代码中显式断言。

参考:ClinVar FTP primer 官方文档(VCF 局限性一节);README_VCF.txt

⚠️ 坑点 6:月度/周度发布漂移破坏复现(分类:工程陷阱)

问题:网站每周一更新、FTP 周更仅保留至下月;同一变异的分类会随新证据改变(2026-05 单月约 1.5 万条重分类)。今天构建的训练集,三个月后标签就不同了。

症状:两次运行同一脚本得到不同训练集;论文评审要求复现时,原始数据快照已不可获取。

解决:一律用月度归档(ClinVarVCVRelease_YYYY-MM 或 tab_delimited/archive)并在方法学写明 release 名;引用记录带 accession + 版本号;生产管道固定 release 并建立"重分类监控"(对关键变异定期比对新旧 release)。

参考:ClinVar FAQ——“ClinVar records should be referred to with accession and version numbers”(https://www.ncbi.nlm.nih.gov/clinvar/docs/faq/)

⚠️ 坑点 7:训练-评估循环泄漏 + 变异类型混杂虚增(分类:数据泄漏)

问题:双重陷阱。(a) 大量元预测器(REVEL、CADD、ClinPred、BayesDel 等)用 ClinVar 训练——把它们当特征又在 ClinVar 上评估构成标签循环;AlphaMissense 论文指出在 ClinVar 上直接训练的模型存在"数据泄漏与标签循环",性能不可信。(b) 混合变异类型评测会虚增 auROC——模型可利用"stop-gain 多为致病、同义多为良性"的类型先验,bioRxiv 2025 研究实测分桶后各模型在 stop-gain、splice、5’UTR 上显著退步。

症状:文献 auROC 0.95+ 的模型换到 MAVE/de novo 外部队列跌到 0.8 出头;错义子集性能远低于全量报告值。

解决:特征黑名单剔除一切 ClinVar 训练的分数;评测按 Type 分桶独立报告;外部验证用 ProteinGym MAVE 或 de novo 队列;参考 AlphaMissense 的做法(不用 ClinVar 标签训练,仅用于 early stop 与校准,并在补充材料中讨论循环问题)。

参考:Cheng J et al. (2023), Science 381:eadg7492(补充材料 supplementary note);“Genomic heterogeneity inflates the performance of variant pathogenicity predictions”, bioRxiv 2025.09.05.674459

⚠️ 坑点 8:疾病名称与概念映射混乱 + 库不可当人群变异谱(分类:偏倚陷阱)

问题:(a) 表型为 MedGen/OMIM/Orphanet 多源 ID + 自由文本 PhenotypeList,同一疾病多名、大量 “not provided”;(b) 更深层的陷阱:ClinVar 提交反映的是各实验室的检测范围与报告策略(ascertainment bias),不能用于估计基因的疾病变异谱、外显率或人群流行率——Yang(PSB 2017)专门论证了这一点。

症状:按 PhenotypeList 直接统计"乳腺癌变异"漏掉半数异名记录;用 ClinVar 推出"BRCA1 中 X% 变异致病"这类结论被审稿人拒稿。

解决:疾病映射经 MedGen CUI → UMLS → ICD-11/SNOMED CT 显式对齐,“not provided” 单独成类;任何人群频率/外显率问题改用 gnomAD + 队列研究;在论文局限部分声明 ascertainment bias。

参考:Yang S & Lincoln SE (2017), PSB 22. “Genetic testing and genomic databases: successes and challenges”(psb17/yang.pdf)

版本提示:2024-01-29 是三分类体系分水岭——此前的所有提交自动归为"胚系",其中部分旧记录等位基因来源标记为 “somatic” 的实为体细胞解读(官方已联系提交者更新);旧 XML 格式(单一 ClinicalSignificance 元素)仅支持至 2024 年底。处理历史归档时注意新旧 XML schema 差异。

§6.6 数据增强

✅ 安全增强 ❌ 危险增强(禁止)
多转录本注释融合(同一变异的全部转录本后果作为多视角输入) 把 VUS 当良性/阴性采样——VUS 是"证据不足"而非"倾向良性"(AlphaMissense 经验:未观察变异采样需按 MAF 加权)
保守性/约束分数(phyloP、LOEUF)作特征补充 对 HGVS 文本做"同义改写"式增强(破坏命名语义)
基因/结构域层面 SMOTE 之外的欠采样平衡(每基因等量 P/B,AlphaMissense 方案) 随机过采样罕见基因变异(放大小样本噪声标签)
用月度归档做时间增强(多 release 标签一致性作为样本权重) 合并 GRCh37/GRCh38 坐标而不 liftOver
对频率特征做 MAF 分桶重加权 用元预测器分数(REVEL/CADD)增强标签(标签循环)

§6.7 模型推荐

任务 推荐方案 训练标签来源 预期性能(ClinVar 口径)
错义致病性 AlphaMissense(直接用官方分数) 无需训练 auROC 0.940(18,924 变异);基因内 0.950
错义(可复现基线) EVE / ESM-1v 零样本 无监督 auROC 0.911(EVE,ClinVar 口径)
剪接变异 SpliceAI / AlphaGenome 序列自监督 同义 0.919(AlphaGenome);剪接仍为难点
非编码/调控 GPN-MSA / Evo2 序列自监督 因类型而异;5’UTR、stop-loss 为已知短板
表格特征基线 XGBoost + 保守性/频率特征 2★+ P/B 标签 auROC 0.90-0.95(警惕特征泄漏)
冲突预测 梯度提升 + 提交者特征 冲突标记 研究性任务,无公认基准

§6.8 计算资源需求

硬件 最小配置 推荐配置
磁盘 20 GB(TSV 路线) 120 GB(XML + 双 VCF + 全套 TSV)
内存 16 GB(pandas 读 variant_summary 全表约需 8-12 GB) 64 GB(XML 流式解析 + 特征合并)
GPU CPU 足够(表格模型/零样本打分查表) 1 × 24 GB 显存(自训蛋白 LM 微调)
训练时间 XGBoost 基线约 10-30 分钟(CPU) 蛋白 LM 微调数小时-数天
网络 一次性下载 ~1 GB(TSV+VCF) XML 全量 ~6 GB;API 批量查询注意限速

§6.9 评估指标

from sklearn.metrics import roc_auc_score, average_precision_score

def evaluate_by_bucket(df, score_col, label_col="label"):
    """社区共识:总体 + 基因内 + 变异类型分桶三视角"""
    print(f"Overall auROC: {roc_auc_score(df[label_col], df[score_col]):.4f}")
    print(f"Overall AUPRC: {average_precision_score(df[label_col], df[score_col]):.4f}")
    gene_aucs = [roc_auc_score(g[label_col], g[score_col])
                 for _, g in df.groupby("GeneSymbol")
                 if g[label_col].nunique() == 2 and len(g) >= 20]
    print(f"Per-gene auROC (median): {pd.Series(gene_aucs).median():.4f}")
    for t, g in df.groupby("Type"):
        if g[label_col].nunique() == 2:
            print(f"  {t}: {roc_auc_score(g[label_col], g[score_col]):.4f}")

社区共识指标:总体 auROC + 基因内 auROC(AlphaMissense 双口径)+ AUPRC(阳性率约 20% 的不平衡场景)+ 按变异类型分桶 auROC;阈值化指标参考 EVE/AlphaMissense 的 90% 精度截点方案。

§6.10 MLOps 笔记

  • 版本锁定:方法学必须写明 release(如 “ClinVar tab_delimited 2026-08-31, derived from ClinVarVCVRelease_2026-08”)与访问日期;引用具体变异带 accession + version。
  • 重分类监控:生产系统应建立月度 diff 流程(第三方如 Biocodify 的开源对比脚本可参考),关键变异(报告级)订阅 ClinVar 更新通知。
  • 格式变更预警:2024 年 XML schema 变更是近年最大的 breaking change;关注 ncbi/clinvar GitHub 与 release_notes/ 目录。
  • API 限速:E-utilities 无 key 3 req/s、有 key 10 req/s;批量任务用 FTP 而非 API。
  • 免责声明传递:任何下游产品须保留"未经遗传学专业人员复核不得用于诊断"的声明。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
提交者结构偏倚 美国/欧洲临床实验室主导;部分大型商业实验室历史上不提交或仅经封闭渠道共享(Yang PSB 2017 批评) 结论限定为"提交者覆盖范围";关注 OMIM/文献类与临床实验室类的分层质量
Ascertainment 偏倚 提交内容反映检测范围与报告策略(部分实验室不报良性、CNV 少报),不能代表真实变异谱 人群频率/外显率问题改用 gnomAD + 队列;论文声明该局限
基因覆盖偏倚 92,938 个基因中仅 18,378 个有基因专属变异;BRCA1/2、TTN、心肌/肿瘤基因极度富集 基因内评估 + 罕见基因单独报告
祖源偏倚(隐含) 被检人群以欧美祖源为主,无个体祖源字段;频率证据主要来自 gnomAD 欧美子集 中高 亚人群频率校正;少在临床解读外推时声明
时效偏倚 陈旧提交留存(坑点 4);pre-2015 准则解读混杂 LastEvaluated 过滤;按提交年代分层分析
星级断层偏倚 3-4 星金标准集中于少数"明星基因"(BRCA、PTEN、CDH1 等),大多数基因无专家面板 不把 3-4 星子集的代表性外推全库
冲突定义偏倚 窄口径冲突标记低估分歧(坑点 2) 用 CLNSIGCONF / 冲突明细表补充
文献导入偏倚 OMIM 等导入记录不按临床标准分类且含大量旧数据(Yang 2017) 按 SubmitterCategories 分层或剔除

§7.2 标注质量评估

标注层 可靠性 一致性证据 局限性
4★ 执业指南 最高 学会级流程 仅 663 条,基因覆盖极窄
3★ 专家面板 ClinGen 认可 + 基因特异性规则 22,404 条(0.5%);面板间规则仍有差异
2★ 多提交者共识 较高 Harrison 2017:医学显著分歧仅 2% "共识"可能是同源证据的伪独立
1★ 单提交者 中——方差大 实验室间 88-92% 一致率 占 79.4%;陈旧与准则差异是主要噪声
0★ 无断言标准 低-中 Yang 2017:OMIM/文献类不一致率显著高 3.4% 记录;建议剔除出训练
聚合算法 规则一致 可复现 非人工审定;覆盖逻辑可能掩盖多数意见(坑点 3)

§7.3 泛化性讨论

场景 失效风险 证据
跨变异类型(错义 → 剪接/非编码) bioRxiv 2025:stop-gain、splice、5’UTR 上主流模型显著退步;需分桶评测
跨基因(已知基因 → 新基因) 基因先验是主要捷径;gene-holdout 下性能普遍下降
跨人群(欧美 → 其他祖源) 中高 频率证据的祖源结构传导至解读;亚人群验证是开放问题
跨时间(旧解读 → 新准则) 36% 分歧靠重评消除(Harrison 2017);陈旧标签是主因
跨提交者类型(临床实验室 → 文献/研究导入) 中高 Yang 2017:不一致率显著更高
跨标签体系(胚系 → 体细胞/致癌性) 三套术语不可互换;体细胞数据量仅为胚系 0.06%

§7.4 伦理考量

  1. ClinVar 官方明确声明:内容"不用于直接诊断或医疗决策",须经遗传学专业人员复核——任何下游 AI 系统必须传递这一边界。
  2. NIH 不独立核实提交信息;聚合展示不等于医学背书。冲突变异(16.6 万条)直接对应真实患者的解读分歧,相关研究应保持对患者影响的敏感。
  3. 数据为变异级聚合,无个体级记录;提交者有义务在提交前移除直接患者标识。
  4. 重分类(VUS→P 或 P→LB)会改变真实患者的临床管理;模型若用于辅助解读,须把"标签时效性"作为核心风险项管理。
  5. 部分商业实验室不开放提交,意味着公共库可能系统性缺失某些变异证据——不要把"ClinVar 查不到"当作"变异未见报道"的强证据。

§7.5 公平性评估

from fairlearn.metrics import MetricFrame
from sklearn.metrics import roc_auc_score

# 按星级与基因分层的子群性能审计(ClinVar 无个体祖源字段,
# 公平性分析主要在"标签置信度"与"基因覆盖"两个维度展开)
frame = MetricFrame(
    metrics={"auROC": lambda yt, ys: roc_auc_score(yt, ys)},
    y_true=y_test, y_pred=y_score,
    sensitive_features=test_df["ReviewStatus"]  # 按评审状态分层
)
print(frame.by_group)

已知公平性差异:3-4 星子集富集于欧美人群研究深入的基因;罕见基因与新发基因上标签稀疏,模型置信度校准普遍较差;心脏科等高冲突领域标签噪声显著高于肿瘤领域。

§7.6 数据漂移提示

  • ClinVar 是持续流动的库:单月约 6.9 万新增变异、1.5 万重分类、3.4 万置信度变化(2026-05 口径)。部署模型的标签基准每年都在移动。
  • 监控信号:关键基因的冲突率变化、VUS 流转率(2026-05 单月 433 条 VUS 转确定)、星级分布迁移。
  • 结构性断点:2015-06(assertion criteria 权重)、2018(VCV 架构)、2024-01-29(三分类体系 + XML schema 变更)——跨断点的纵向比较必须显式处理。
  • 建议:生产系统每季度重锚定 release,并保留历史 release 的评测基准以区分"模型变化"与"标签变化"。

§7.7 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 数据为宽格式(每行一个样本/事件) variant_summary 一行一变异(VariationID 唯一);XML 为 SCV/RCV/VCV 规范层级
2 有唯一标识符列 VariationID / AlleleID / SCV / RCV / VCV accession(带版本号)
3 无 Unicode 或特殊字符问题 ⚠️ HGVS 名含括号/下划线/冒号;PhenotypeList 含分号逗号,解析需小心
4 无重复行 ⚠️ 同一变异多提交者为设计特性(非重复);VCF 按位点合并多变异,口径需声明
5 缺失值已识别并编码 ⚠️ “not provided”、-1(rs# 未分配)、空 LastEvaluated 等语义缺失存在但未官方编码说明(本 Wiki §4.5 已整理)
6 标签列被明确标识 ClinicalSignificance / ClinSigSimple / SomaticClinicalImpact / Oncogenicity + ReviewStatus
7 罕见类别已分组 ⚠️ drug response / risk factor / protective / association 等长尾类别未合并;ClinSigSimple 仅提供粗二值
8 偏倚评估已完成 Yang 2017 / Harrison 2017 / Yang PSB 2017 系统性研究;本 Wiki §7.1 八类偏倚
9 有完整数据字典 ClinVarDataDictionary + 各 README(README.txt / README_VCF.txt)
10 信息性缺失有明确解释 ⚠️ 官方未系统文档化;本 Wiki §4.5 补齐
11 采集设备与方法已记录 SCV 级 MethodType(clinical testing/research/literature only 等)记录数据捕获类型
12 已移除完全共线性变量 未执行(档案馆定位,保留全部原始字段)
13 编码映射标准已说明 HGVS 命名、MedGen 表型、dbSNP/dbVar、SO 分子后果、ACMG/AMP 术语全链条标准
14 时间戳处理已明确说明 LastEvaluated(SCV 级)+ 月度归档 release 机制
15 训练/验证/测试划分建议已给出 官方无(注释库定位);社区基因级留出/时间留出惯例补位(§5)
16 数据泄漏风险已被讨论 AlphaMissense 标签循环讨论;本 Wiki §5.3 五种泄漏模式
17 标签分布已被分析 §4.2 星级与分类分布
18 选择性测量偏倚已被讨论 ascertainment bias 文献充分(Yang PSB 2017)
19 外部验证建议已给出 §5.5 MAVE/de novo/VCEP 外检路径
20 数据更新与版本信息已记录 周更/月度归档 + release_notes + 永久归档目录
21 最小必要预处理脚本已提供 ⚠️ 无官方 ML 管道;社区解析工具与模型官方 benchmark 脚本补位
22 合规使用要求已明确 公共领域 + 署名引用要求 + 官方免责声明,FAQ 明示
23 多模态/跨库对齐方法已说明 ⚠️ dbSNP/dbVar/MedGen/Gene 交叉标识齐全,但 ML 就绪的对齐(如 gnomAD 频率、蛋白坐标)需自行完成
24 去标识化方法已被记录 变异级聚合,无个体级数据;提交者移除直接标识义务明确

DAIMS 评分:18.5 / 24

评分解读良好——文档化、标准化与版本治理顶尖;扣分集中在"档案馆基因":标签质量分层、无官方划分、信息性缺失未官方编码。

对你意味着什么:ClinVar 的 15 个 ✅ 项几乎全部来自其基础设施级的工程质量——三级 accession、全链条标准术语、月度永久归档、完整的发布说明体系。扣分项是使用ClinVar 做 AI 时必须自己补的功课:(1) 训练集按星级过滤(≥2★)并对 0-1 星降权;(2) 自行实现基因级留出与变异类型分桶评测;(3) “not provided” 等语义缺失显式编码;(4) 警惕元预测器特征的标签循环。它不是拿来即训的数据集,而是一个需要先理解其治理结构才能正确使用的专家知识库——用好星级体系的人得到的是全球最大变异标签库,无视它的人得到的是噪声放大器。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部测试集变化 关键发现
ProteinGym MAVE(72+ 蛋白功能实验) 多机构(MAVE 联盟) 错义效应预测 AlphaMissense 在 MAVE 基准上同样领先 排序保持、绝对分不可比 无 ascertainment 偏倚的功能实验数据上保持优势,说明未过拟合 ClinVar 标签
DDD 发育障碍 de novo 变异 Deciphering Developmental Disorders 队列 致病 de novo vs 对照 auROC 0.809(AlphaMissense)vs 0.797(PrimateAI) 相对 ClinVar 0.940 显著下降 真实临床新发变异场景难度远高于 ClinVar 平衡测试集
四实验室交叉一致性(ClinGen 试点) Ambry/GeneDx/LMM/UChicago 解读一致性 88.3% → 91.7%(重评后) N/A 临床实验室间一致性本身高;医学显著分歧仅 2%——对"ClinVar 不可靠论"的最强反证
变异类型分桶重评测 bioRxiv 2025 独立研究 分类型致病性预测 同义 AlphaGenome 0.919;stop-gain/splice/5’UTR 各模型明显退步 相对混合口径下降 混合变异类型虚增性能——外审复现推翻了"一刀切 auROC"
ClinGen VCEP 专家复评子集 ClinGen 专家面板 高置信金标准 各模型在 3-4 星子集性能普遍高于全库 上升 星级过滤同时提升标签质量与表观性能——评测报告须注明星级口径

ClinVar 在 2026 年还值得用吗? 它是变异解读领域唯一没有替代选项的基础设施:提交者生态、星级治理、免费开放三者缺一不可。但用法必须进化——从"查一个变异看一个结果"进化为"按星级分层、按 release 锁定、按变异类型分桶、按外部功能数据验证"的工程化使用。对 AI 研究者,它依然是评测变异效应预测的第一选择,前提是你读过并遵守 §6.5 的坑点清单。


§8 基准性能与生态

§8.1 排行榜(变异效应预测,ClinVar 评测口径)

说明:以下数值均为论文自报口径,不可直接横向比较——各工作的 ClinVar 子集(release 版本、星级过滤、变异类型范围、基因平衡方式)各不相同。用 ClinVar 直接训练的模型存在标签循环,表中已标注。

排名 模型 auROC(ClinVar 口径) 年份 关键技术 完整引用 代码
1 AlphaMissense 0.940(18,924 错义测试变异);0.950(612 基因口径) 2023 AlphaFold 衍生 + 蛋白语言模型 + 群体频率弱标签微调;不用 ClinVar 标签训练 Cheng J, Novati G, Pan J, et al. “Accurate proteome-wide missense variant effect prediction with AlphaMissense.” Science 381:eadg7492 (2023). DOI: 10.1126/science.adg7492 https://github.com/google-deepmind/alphamissense
2 EVE 0.911(同口径对比) 2021 深度生成模型(VAE)+ 多序列比对,无监督 Frazer J, Notin P, Dias M, et al. “Disease variant prediction with deep generative models of evolutionary data.” Nature 599:91-95 (2021). DOI: 10.1038/s41586-021-04043-8 https://github.com/OATML-Markslab/EVE
3 AlphaGenome 0.919(同义变异,分桶口径) 2025 长序列基因组模型,多任务 bioRxiv 2025.09.05.674459 对比评测(引自该文 Table 1 口径) https://deepmind.google/models/alphagenome/
4 GPN-MSA 0.882(同义);0.888(stop-loss,最优) 2024 全基因组 MSA 语言模型 同上(bioRxiv 2025 对比评测) https://github.com/songlab-cal/gpn
5 Evo2 0.885(同义) 2025 条斑鬣狗架构基因组基础模型 同上 https://github.com/ArcInstitute/evo2
基线 PhyloP 0.855(同义) 经典 进化保守性 同上

不可比警示:bioRxiv 2025(“Genomic heterogeneity inflates the performance of variant pathogenicity predictions”)证明混合变异类型会系统性虚增 auROC——上表"错义口径"与"同义口径"数字分属不同评测协议。引用任何 ClinVar 基准数字时,必须同时引用其 release、星级过滤与变异类型范围三要素。

§8.2 SOTA 总结与选型建议

如果你… 推荐方案 为什么
只要最好用的错义分数 直接用 AlphaMissense 官方分数(全蛋白质组预计算) 免训练、已校准、3 级阈值(90% 精度)
复现/对比学术研究 EVE 或 AlphaMissense 官方 ClinVar 子集 + 相同过滤 可比性最高
非编码/剪接任务 AlphaGenome / GPN-MSA 分桶评测 错义排行榜对该场景无指导意义
训练自己的模型 2★+ P/B 标签 + 基因级留出 + MAVE 外检 避开标签循环的唯一稳妥路径
临床注释管道 ClinVar VCF + VEP/ANNOVAR,星级与冲突字段全保留 下游可审计

§8.3 官方评测协议

ClinVar 无官方 ML 评测协议。事实标准由两部分构成:(a) 临床侧的 ACMG/AMP 五级分类准则(Richards et al. 2015)与 ClinGen SVI 系列扩展;(b) ML 侧的社区惯例——P/LP vs B/LB 二分类、VUS 剔除、基因级留出、按变异类型分桶、MAVE 外检。AlphaMissense 的评测设置(每基因平衡 + 18,924 错义测试集 + 0.940/0.950 双口径)是当前最常被引用的参照点。

数据集 关系 说明
gnomAD 互补(频率证据) ClinVar 良性判定的核心证据来源;变异效应模型的频率特征源
ClinGen(Allele Registry / VCEP 结论) 治理上游 专家面板认可与基因特异性准则来源;3-4 星标签生产者
dbSNP / dbVar 同机构姊妹库 变异定位与 rs#/nsv 标识来源;ClinVar 与之紧耦合
MedGen 表型层 ClinVar 疾病概念的术语底座
OMIM 上游提交者 文献策展来源;其记录不按临床标准分类(坑点 1)
HGMD 同类商业竞品 文献策展深度互补,许可付费
CIViC / OncoKB / COSMIC 肿瘤体细胞对照 ClinVar 体细胞板块的竞品/互补;三者不接受实验室直接提交
ProteinGym 评测互补 无偏 MAVE 功能实验基准,ClinVar 模型的标准外检
PharmGKB PGx 上游 药物基因组学变异解读来源

§8.5 关键论文 Top 10

  1. Landrum MJ et al. (2014), NAR 42(D1):D980-D985. “ClinVar: public archive of relationships among sequence variation and human phenotype.” — 数据集本体,官方首选引用。DOI: 10.1093/nar/gkt1113
  2. Landrum MJ et al. (2018), NAR 46(D1):D1062-D1067. “ClinVar: improving access to variant interpretations and supporting evidence.” — VCV 变异中心化架构。DOI: 10.1093/nar/gkx1153
  3. Landrum MJ et al. (2025), NAR 53(D1):D1313-D1321. “ClinVar: updates to support classifications of both germline and somatic variants.” — 三分类体系(胚系/体细胞临床影响/致癌性)。DOI: 10.1093/nar/gkae1090
  4. Richards S et al. (2015), Genet Med 17:405-424. ACMG/AMP 变异解读准则——ClinVar 标签体系的语义底座。
  5. Rehm HL et al. (2015), N Engl J Med 372:2235-2242. “ClinGen — the Clinical Genome Resource.” — 披露 17% 解读冲突,定义了 ClinVar 的时代使命。
  6. Harrison SM et al. (2017), Genet Med 19(10). 四实验室协作把一致率从 88.3% 提升到 91.7%——数据共享价值的实证。DOI: 10.1038/gim.2017.14
  7. Yang S et al. (2017), Genet Med. “Sources of discordance among germ-line variant classifications in ClinVar.” — 冲突来源系统分析,使用 ClinVar 前的必读风险评估。DOI: 10.1038/gim.2017.60
  8. Cheng J et al. (2023), Science 381:eadg7492. AlphaMissense——以 ClinVar 为核心评测集的 AI 里程碑,其标签循环讨论同样经典。DOI: 10.1126/science.adg7492
  9. Landrum MJ et al. (2020), NAR 48(D1):D835-D844. “ClinVar: improvements to accessing data.” — Variation 页面与现代检索体系。
  10. Li MM et al. (2017), J Mol Diagn 19:4-23. AMP/ASCO/CAP 体细胞变异解读准则——ClinVar 体细胞临床影响分类的标准来源。

§8.6 社区活跃度

维度 数据
Landrum 2014 引用 4,089+(Google Scholar,截至 2026-09)
Landrum 2018 引用 3,204+(ScholarHub 快照,截至 2026-09)
Landrum 2020 引用 772+(Europe PMC,截至 2026-06)
Landrum 2025 引用 81+(Europe PMC,截至 2026-06)
提交者生态 3,512 家机构(截至 2026-08-22),2018 年为 1,000 家
月度动态 单月约 +6.9 万变异、约 1.5 万重分类(2026-05 第三方追踪)
工具集成 Ensembl VEP、ANNOVAR、SnpEff 等主流注释器内置;UCSC/Ensembl 基因组浏览器官方轨道
监管地位 FDA 认可的遗传变异公共参考数据库之一;ClinGen 生态核心组件

§8.7 生态快照

资源 类型 链接 Star/Fork(截至 2026-09) 为什么值得关注
ClinGen 治理生态 https://clinicalgenome.org/ 专家面板认可机构;ClinVar 3-4 星标签的生产体系
ncbi/clinvar GitHub 官方文档 https://github.com/ncbi/clinvar 活跃 格式变更公告与 XML schema 文档的一手来源
Ensembl VEP 工具库 https://github.com/Ensembl/ensembl-vep 活跃 变异注释事实标准,ClinVar 字段内置
AlphaMissense 预计算分数 https://github.com/google-deepmind/alphamissense 活跃 全蛋白质组错义分数免费下载,含 ClinVar 评测脚本
EVE 工具库 https://github.com/OATML-Markslab/EVE 活跃 无监督错义预测经典,含 ClinVar 对比口径
ProteinGym 基准 https://proteingym.org/ ClinVar 模型的标准外部验证场
gnomAD browser 数据门户 https://gnomad.broadinstitute.org/ 频率证据一站查询,与 ClinVar 交叉链接
VarFish 工具库 https://github.com/varfish-org 活跃 对 ClinVar 星级的工程化改造案例(点制替代星级)
ClinGen Allele Registry 注册服务 https://reg.clinicalgenome.org/ 变异标识规范化(CAid),跨库对接枢纽
Biocodify ClinVar 月度对比 工具/博客 https://biocodify.com/blog 开源 release 对比脚本,月度重分类追踪范本

§9 相关资源与引用

官方资源

BibTeX 引用

% 1) 主引用(官方 FAQ 推荐引用最新综述;2014 为首篇)
@article{landrum2014clinvar,
  title={ClinVar: public archive of relationships among sequence variation and human phenotype},
  author={Landrum, Melissa J and Lee, Jennifer M and Riley, George R and Jang, Wonhee and Rubinstein, Wendy S and Church, Deanna M and Maglott, Donna R},
  journal={Nucleic Acids Research},
  volume={42}, number={D1}, pages={D980--D985}, year={2014},
  doi={10.1093/nar/gkt1113}
}

% 2) VCV 架构更新
@article{landrum2018clinvar,
  title={ClinVar: improving access to variant interpretations and supporting evidence},
  author={Landrum, Melissa J and Lee, Jennifer M and Benson, Mark and Brown, Garth R and others},
  journal={Nucleic Acids Research},
  volume={46}, number={D1}, pages={D1062--D1067}, year={2018},
  doi={10.1093/nar/gkx1153}
}

% 3) 数据访问改进
@article{landrum2020clinvar,
  title={ClinVar: improvements to accessing data},
  author={Landrum, Melissa J and Chitipiralla, Shanmuga and Brown, Garth R and others},
  journal={Nucleic Acids Research},
  volume={48}, number={D1}, pages={D835--D844}, year={2020}
}

% 4) 胚系+体细胞三分类体系
@article{landrum2025clinvar,
  title={ClinVar: updates to support classifications of both germline and somatic variants},
  author={Landrum, Melissa J and Chitipiralla, Shanmuga and Kaur, Kuljeet and others},
  journal={Nucleic Acids Research},
  volume={53}, number={D1}, pages={D1313--D1321}, year={2025},
  doi={10.1093/nar/gkae1090}
}

% 5) ACMG/AMP 分类准则(标签语义来源,建议同引)
@article{richards2015acmg,
  title={Standards and guidelines for the interpretation of sequence variants},
  author={Richards, Sue and Aziz, Nazneen and Bale, Sherri and others},
  journal={Genetics in Medicine},
  volume={17}, number={5}, pages={405--424}, year={2015}
}

引用具体记录:必须带 accession + 版本号(如 “ClinVar RCV000080903.19”),因为分类随提交更新而变化——这是 ClinVar 官方 FAQ 的硬性建议。

教程与学习资源

原始论文

  1. Landrum MJ et al. (2014). NAR 42(D1):D980-D985. DOI: 10.1093/nar/gkt1113. PMID: 24234437. PMCID: PMC3965032.
  2. Landrum MJ et al. (2016). NAR 44(D1):D862-D868. DOI: 10.1093/nar/gkv1222.
  3. Landrum MJ et al. (2018). NAR 46(D1):D1062-D1067. DOI: 10.1093/nar/gkx1153. PMID: 29165669.
  4. Landrum MJ & Kattman BL (2018). “ClinVar at five years: Delivering on the promise.” Hum Mutat 39:1623-1630. DOI: 10.1002/humu.23641.
  5. Landrum MJ et al. (2020). NAR 48(D1):D835-D844. PMID: 31777943.
  6. Landrum MJ et al. (2025). NAR 53(D1):D1313-D1321. DOI: 10.1093/nar/gkae1090. PMID: 39578691. PMCID: PMC11701624.

§10 AI 使用声明卡

§10.1 AI 模型使用

AI 模型 版本 用途
deep-model(WorkBuddy) 2026-09 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建
WebSearch(多源检索) 2026-09-05 6 组检索:官方统计页、星级机制文档、四篇 NAR 论文与引用快照、冲突研究文献、ML 基准文献、FTP 实测文件大小

§10.2 AI 参与范围

AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。

AI 在本页面的工作中负责:(1) 从 NCBI 官方统计页、评审状态文档、FTP primer、四篇 NAR 主论文与 Harrison/Yang/Cheng 等关键文献中整理结构化信息;(2) 实测 FTP 目录获取文件大小与发布节奏;(3) 生成 §6 的 Python/bash 代码示例;(4) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(5) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(6) 构建 §C 统一 JSON-LD @graph。

§10.3 输入来源

  1. NCBI ClinVar 官方统计页(2026-08-22 快照):https://www.ncbi.nlm.nih.gov/clinvar/docs/statistics/
  2. ClinVar review status 官方文档 + assertion criteria 文档
  3. ClinVar FTP primer / maintenance_use / FAQ 官方文档
  4. FTP 目录实测(2026-09-03 月度发布文件大小:xml/、vcf_GRCh38/、tab_delimited/)
  5. Landrum et al. (2014), NAR 42:D980-D985(DOI: 10.1093/nar/gkt1113)+ Google Scholar 引用快照(4,089)
  6. Landrum et al. (2018), NAR 46:D1062-D1067(DOI: 10.1093/nar/gkx1153)+ 引用快照(3,204)
  7. Landrum et al. (2020), NAR 48:D835-D844 + Europe PMC 引用(772,2026-06)
  8. Landrum et al. (2025), NAR 53:D1313-D1321(DOI: 10.1093/nar/gkae1090,PMID: 39578691)+ Europe PMC 引用(81)
  9. Rehm et al. (2015), NEJM 372:2235-2242(ClinGen,17% 冲突)
  10. Harrison et al. (2017), Genet Med 19(10)(DOI: 10.1038/gim.2017.14,88.3%→91.7%)
  11. Yang et al. (2017), Genet Med(DOI: 10.1038/gim.2017.60,冲突来源分析)
  12. Yang & Lincoln (2017), PSB 22(psb17/yang.pdf,ascertainment bias)
  13. Cheng et al. (2023), Science 381:eadg7492(AlphaMissense,0.940 auROC 与标签循环讨论)
  14. “Genomic heterogeneity inflates the performance of variant pathogenicity predictions”, bioRxiv 2025.09.05.674459(分桶评测)
  15. Biocodify ClinVar 月度追踪(2026-05 release 动态数据)
  16. VarFish ClinVar Notes(星级机制批判与改造)
  17. Landrum & Kattman (2018), Hum Mutat 39:1623-1630(五周年口径)

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景(ICD-11/SNOMED CT 映射、三套分类术语、金标准) 千方病案医学编辑部 交叉审核 ✅ 已通过
§3 数据集规格(统计口径、星级分布、版本矩阵) 千方病案医学编辑部 与 NCBI 官方统计页交叉比对 ✅ 已验证
§4 数据结构(字段字典、SCV/RCV/VCV 层级) 千方病案医学编辑部 与官方 README 及 FTP primer 交叉比对 ✅ 已验证
§5 数据划分策略 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与坑点 千方病案医学编辑部 逻辑审查 + 与官方文档交叉比对 ✅ 已通过
§7 质量评估与 DAIMS 评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 排行榜与引用数表述 千方病案医学编辑部 与原文及引用快照交叉比对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 Schema v3.9 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。

§10.6 最后审核

最后一次人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集