DECIPHER — 罕见病基因组变异与表型临床解读库 AI-Ready Wikipedia

Sanger 创立 · EMBL-EBI 托管 · 5 万+病例 · 变异 + HPO 表型双锚定

来源 DECIPHER community(Wellcome Sanger Institute 创立,EMBL-EBI 托管) url: https://www.deciphergenomics.org/发布时间: 2026-09-18最后更新: 2026-09-25 阅读 28
DECIPHER — 罕见病基因组变异与表型临床解读库 AI-Ready Wikipedia

信息速览

数据集名称DECIPHER — 罕见病基因组变异与表型临床解读库 AI-Ready Wikipedia
数据类型52,694 名广泛共享同意患者,>51,000 个变异记录,>172,000 条 HPO 表型,约 40 国 300+ 中心,v11.40(2026-07-08)
规模52,694 名广泛共享同意患者(累计上传 50,000+ 病例)
接入方式DECIPHER community(Wellcome Sanger Institute 创立,EMBL-EBI 托管) url: https://www.deciphergenomics.org/
AI 就绪度

DECIPHER — 罕见病基因组变异与表型临床解读库 AI-Ready Wikipedia


INFOBOX

数据集名称 DECIPHER(DatabasE of genomiC varIation and Phenotype in Humans using Ensembl Resources)
英文全称 DatabasE of genomiC varIation and Phenotype in Humans using Ensembl Resources
别名/简称 DECIPHER;原全称 Database of Chromosomal Imbalance and Phenotype in Humans using Ensembl Resources(创立初期用名)
疾病分类 罕见发育障碍/智力发育障碍谱系(ICD-11:6A00 智力发育障碍 / 6A01 发育性言语或语言障碍 / 6A02 孤独症谱系障碍 / 6A03 发育性学习障碍;另涉 ICD-11 第 20 章「发育异常」各系统结构发育异常,见 §2.1)
SNOMED CT 非原生标准——DECIPHER 表型以 HPO(人类表型本体)原生沉淀,SNOMED CT 对应关系经 HPO 官方交叉映射实现(见 §2.2)
数据模态 患者级基因组变异(SNV/InDel、STR、CNV、大结构变异,含镶嵌与线粒体变异)+ HPO 表型条目 + 定量临床测量 + 家系结构
AI 任务类型 变异致病性解读、基因-表型关联挖掘、表型驱动候选基因优先级排序、患者匹配(Matchmaker Exchange)、罕见病新基因发现、变异分类基准构建
样本总数 52,694 名广泛共享同意患者;累计上传 50,000+ 病例;开放共享口径 >51,000 个变异、>172,000 条 HPO 表型条目(Foreman 2022)
数据大小 在线数据库形态(无整包下载);单患者/单查询 TSV 导出;批量数据经 DAA 加密分发
数据格式 网页浏览 + Ensembl/UCSC Genome Browser track、TSV/CSV 查询导出、REST API(JSON:API v1.0)
许可证 DECIPHER Data Sharing 条款(公开层开放;批量数据需 Data Access Agreement,可视化需 Data Display Agreement)
访问级别 开放浏览(公开同意层)+ 申请审核(批量加密下载需 DAA;API 需 API Agreement;录入需注册中心资质)
DUO 标签 HMB, NPUNCU, PUB(依据官方 DAA 条款整理,以 DECIPHER 协议原文为准)
语言 英文
首发日期 2004 年
最后更新 持续滚动更新(当前版本 v11.40,2026-07-08)
发布机构 DECIPHER 社区(Wellcome Sanger Institute 创立;2023 年 7 月起 EMBL-EBI 托管;Wellcome Trust 资助)
官方主页 https://www.deciphergenomics.org/
下载地址 https://www.deciphergenomics.org/datasharing
DOI 10.1146/annurev-genom-102822-100509(官方推荐引用 Foreman 2023)/ 10.1016/j.ajhg.2009.03.010(Firth 2009 平台论文)
引用次数 2,263+(Google Scholar,Firth 2009 平台论文,截至 2026-09);被 >2,600 篇出版物使用(Foreman 2022,截至发表)
AI 就绪度评分 ⭐⭐(2/5)— 临床策展型数据库而非 ML 数据集:HPO 标准化、API 与 track 导出是加分项;扣分项为无官方划分、无任务标签、表型稀疏、变异分类随版本漂移、CNV 边界精度不一
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 映射、发育障碍临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(患者-变异-表型三级层级、坐标体系)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-18

审核方式:交叉审核

利益冲突声明:千方病案医数集与 Wellcome Sanger Institute、EMBL-EBI、Wellcome Trust 及 DECIPHER 社区成员机构无任何商业利益关联。本页面不销售 DECIPHER 数据本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。DECIPHER 公开层可开放浏览与查询;批量数据需签署 Data Access Agreement(用于可视化另需 Data Display Agreement),API 使用需签署 DECIPHER API Agreement;发表使用数据须经录入中心同意并遵循官方致谢模板。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

这是什么? DECIPHER 是一个把「基因组变异」和「患者表型」绑在一起看的全球社区数据库。全球 300 多个临床遗传中心把罕见病患者的变异检测结果(缺失、重复、点突变等)和用 HPO 标准语言描述的症状录入进来;经患者同意后,这些匿名病例对全世界开放浏览。它由 Wellcome Sanger Institute 的 Nigel Carter 与剑桥 Addenbrooke’s 医院的 Helen Firth 于 2004 年创立,2023 年起由 EMBL-EBI 托管,是罕见病临床遗传学的核心基础设施之一。

为什么重要? 罕见病最缺的不是病例,而是「可比较的病例」。一个医生手里的疑难患者,全球可能还有几十个相似病例散落在各家医院。DECIPHER 把这些病例放到同一套基因组坐标和同一套表型术语下,使「我的患者和谁像」变成可查询的问题——用它促成的新综合征划定(如 17q21.31 微缺失综合征)与 DDD 研究的 41% 分子诊断率,都是这一模式的直接成果。

我能用它做什么? 如果你是临床或遗传学研究者,可以查询患者级变异-表型证据、做病例匹配;如果你是 AI 研究者,可以把「患者 × 变异 × HPO 表型」当作罕见病知识工程的语料,构建基因优先级排序、表型相似度匹配或变异分类基准——但需先理解它的访问协议与数据陷阱(见 §6.5 的 8 个坑点)。

§1.1 摘要

DECIPHER(DatabasE of genomiC varIation and Phenotype in Humans using Ensembl Resources)是一个以 Ensembl 技术栈为底座的患者级临床基因组社区资源:各学术临床遗传中心经 Web 界面或 Deposition API 录入脱敏患者记录,每条记录包含临床级检测(array-CGH、SNP array、WES/WGS)产生的变异(SNV/InDel、STR、CNV、大结构变异,含镶嵌与线粒体变异)、以 HPO 编码的表型条目及定量测量。数据在「中心私有层」与「全球公开层」两级之间流转,公开层截至 2026-09 覆盖 52,694 名同意广泛共享的患者(官网首页),累计上传 50,000+ 病例、来自约 40 国 300+ 中心(About 页);Foreman 2022 报告开放共享记录含 >51,000 个变异与 >172,000 条表型条目(PMID 35143074)。变异分类遵循 ACMG/AMP 标准,表型聚合为基因级摘要;系统作为 Matchmaker Exchange 创始成员提供患者匹配 API。基于 DECIPHER 平台的 DDD 研究对近 13,500 个家庭的 trio 测序取得 41% 分子诊断率(NEJM 2023),是该数据库科学产出的代表性证明。

§1.2 战略价值分析

维度一:临床解读基础设施。 变异致病性判断本质上是证据聚合问题——一个 CNV 在多少无关患者身上以相似表型出现过,直接决定其分类。DECIPHER 把这一证据从「各中心私有」变成「全球可检索」,其基因级表型摘要与 ACMG/AMP 接口让临床遗传学家在分钟级完成过去数周的证据搜集。4,000+ 篇已发表论文(截至 2026-09,官网)与 2014 年 10 月以来 4,500+ 条中心间协作消息(Foreman 2022)表明它已成为事实上的临床工作流组件而非单纯的文献资源。

维度二:罕见病基因发现引擎。 从 Firth 2009 划定 17q21.31 微缺失综合征等新综合征(PMID 19344873),到 DDD 研究以 DECIPHER 为信息学平台发现数十个新发育障碍基因(Nature 2014 报告首批 12 个,DOI 10.1038/nature14135),DECIPHER 证明了「小样本跨中心聚合」在罕见病中的统计威力。对 AI 研究者而言,这种「病例随时间累积、标签随证据演化」的结构,是罕见病领域少见的天然时序语料。

维度三:AI 就绪的表型-基因型配对语料。 相比按变异组织资源的 ClinVar,DECIPHER 以患者为粒度同时给出变异与 HPO 表型,这正是表型驱动算法(Exomiser 等工具即整合 DECIPHER 数据)训练与评测所需的配对结构;HPO 本体的层级语义使「表型相似度」可计算,多中心来源使「同表型异患者」的泛化评测成为可能。

§1.3 横向对比

数据集 主办方 规模量级 模态与粒度 标注体系 与 DECIPHER 的差异化
DECIPHER Sanger 创立/EMBL-EBI 托管 52,694 名广泛共享患者(2026-09) 患者级:变异(CNV/SNV/STR/SV)+ HPO 表型 ACMG/AMP 分类 + HPO 患者为中心、中心驱动录入、病例匹配
ClinVar NCBI 百万级变异记录(持续增长) 变异级:分类与证据提交 星级证据 + ACMG/AMP 变异为中心,无患者表型配对粒度
DDD 研究 Sanger/英国 NHS 近 13,500 个家庭 患者级:trio WES + HPO 严格研究级裁定 深度表型化+同期对照,非持续开放增长
Gene2Phenotype (G2P) Firth/Carter 团队 基因-表型对(专家策展) 基因级:疾病实体关联 专家评审面板 蒸馏后的知识库,DECIPHER 数据经策展汇入
LOVD Leiden 大学医学中心 数十年来基因特异性 LSDB 联盟 基因/变异级 各基因位点专属 基因导向的垂直数据库,横向聚合靠社区

一句话定位:ClinVar 回答「这个变异什么分类」,DECIPHER 回答「哪些患者在类似变异下呈现类似表型」——AI 建模时两者互补而非互替。

§1.4 版本演进时间轴

时间 事件 关键数字/意义
2004 Nigel Carter(Sanger)与 Helen Firth(Addenbrooke’s)创立,Wellcome Trust 资助 原全称 Database of Chromosomal Imbalance…(Sanger 新闻)
2006-2007 经跨中心协作划定新综合征 17q21.3 微缺失(2006)、14q11.2(2007)、19q13.12 等(Firth 2009 图 5)
2009 Firth et al. AJHG 平台论文 约 2,000 患者、约 100 中心(PMID 19344873)
2011 DDD 研究启动,以 DECIPHER 为信息学平台 2011-07-30 快照 10,408 患者、233 中心(hg0814.pdf)
2013 从纯 CNV 扩展至 SNV/InDel >21,000 患者;Bragin et al. NAR 论文(PMC3965078)
2014-10 中心间协作消息机制上线 截至 2022 累计 >4,500 条(Foreman 2022)
2015 加入 Matchmaker Exchange(创始成员);Chatzimichali et al. 论文 MME API v1.0、匹配分 0-1(PMC4832335)
2022 Foreman et al. Hum Mutat 系统综述 >250 项目、约 40 国、>2,600 篇出版物引用(PMID 35143074)
2023-07 数据库与团队迁至 EMBL-EBI 迁移时持有 46,000+ 患者、3,000+ 篇出版物使用(EBI 公告)
2026 v11.38(03-25)→ v11.39(06-10)→ v11.40(07-08) v11.40 引入基于 gnomAD v4.1 的 Regional Nonsense Constraint 与 EpiSign™ 表观签名(官网)

§1.5 典型 AI 应用场景

  • 表型驱动的候选基因优先级排序:以患者 HPO 列表 + 变异集为输入,复现 Exomiser 类算法的排序逻辑(DECIPHER 数据本身即其知识源之一)。
  • 基因-表型关联挖掘:跨患者聚合「同一基因的变异共享哪些 HPO 项」,与 G2P、OMIM 既有知识对比发现增量。
  • 患者匹配与相似病例检索:以 HPO 语义相似度(Resnik/信息量加权)+ 染色体区间重叠构建检索器,对标 Matchmaker Exchange 的匹配分。
  • 变异分类弱监督基准:以 ACMG/AMP 分类的「致病/可能致病/意义未明」为弱标签,评估分类器在新发布快照上的漂移。
  • 罕见病知识图谱补全:患者-基因-表型三元组作为图补全训练/验证语料,与 HPO 本体层级联合建模。

§2 医学背景

§2.1 ICD-11 疾病分类锚定

DECIPHER 收录的患者以儿童期起病的发育障碍谱系为主,表型横跨神经发育、多系统先天异常与染色体结构变异综合征。按 ICD-11(WHO)锚定如下:

ICD-11 编码 中文名称 英文名称 在 DECIPHER 中的对应
6A00 智力发育障碍 Disorders of intellectual development 核心收录人群;DDD 队列主表型维度
6A01 发育性言语或语言障碍 Developmental speech or language disorders 常见伴随表型(HPO:言语发育迟缓等)
6A02 孤独症谱系障碍 Autism spectrum disorder 部分微缺失/微重复综合征的神经行为表型
6A03 发育性学习障碍 Developmental learning disorder 学龄期随访中的高维表型之一
第 20 章(发育异常) 各系统结构发育异常 Developmental anomalies 先天性心脏、肾脏、颅面等多发畸形患者的分类归属

锚定说明:染色体微缺失/微重复综合征在 ICD-11 中多按受累系统与畸形组合归入第 20 章,而非单列「染色体」章节;DECIPHER 自身以 HPO 而非 ICD 组织表型,上表用于帮助 AI 团队把患者群映射到疾病分类轴,编码细节以 WHO ICD-11 官方浏览器为准。

§2.2 SNOMED CT 映射

DECIPHER 的表型原生标准是 HPO(人类表型本体):录入端为临床医生从 HPO 术语树选择,沉淀端以 HPO ID 聚合为基因级表型摘要(Foreman 2022)。DECIPHER 不使用 SNOMED CT 作为原生表型标准;若下游系统需要 SNOMED CT 编码,应经 HPO 官方维护的跨本体交叉映射转换(HPO 与 SNOMED CT 自 2010 年代起提供官方映射文件),避免二次推断引入噪声。下表给出高频表型概念在 ICD-11 与 HPO 中的对应(HPO ID 为 DECIPHER 原生沉淀键):

表型概念 ICD-11 参考编码 HPO ID(DECIPHER 原生) 说明
全面性发育迟缓 6A00 范畴 HP:0001263 儿科首诊最常见录入项;5 岁后常改录为 ID
智力发育障碍(智力残疾) 6A00 HP:0001249 按轻中重度分层的上位术语
癫痫发作 8A61 等 HP:0001250 神经系统伴随表型的高频项
小头畸形 20 章(神经系统发育异常) HP:0000252 头围定量测量支撑的形态学表型
肌张力低下 — HP:0001252 婴儿期软婴综合征的共性体征

映射纪律:以上 HPO ID 为 DECIPHER 社区多年录入中的高频核心项;任何自动化映射(HPO→SNOMED CT/ICD-11)都应锁定映射文件版本并在论文中声明,因为 DECIPHER 的 HPO 沉淀本身随录入实践演化(见坑点 4)。

§2.3 疾病简介

疾病谱:DECIPHER 面向的是「疑似遗传性罕见病」的未分化人群——以发育迟缓(global developmental delay)、智力发育障碍、多发先天异常(multiple congenital anomalies)为主,兼含自闭症样行为、癫痫、生长迟缓等神经发育表型。这一人群的临床共性是:单基因/片段变异异质性强、每项变异在人群中极罕见、单独一家医院的病例量不足以支撑分类判断。

流行病学背景:发育迟缓/智力障碍在儿童中的患病率通常报告为 1%-3% 量级,其中相当比例由基因组结构变异或单核苷酸变异所致;临床遗传实践中,染色体微阵列对既往未确诊的发育迟缓/学习障碍/先天异常患者的诊断贡献约 15%(Firth 2009 时期的临床基线,ScienceDaily 报道)。DDD 研究对近 13,500 个家庭的 trio 测序显示整体分子诊断率 41%,且诊断中 76% 为新发(de novo)变异(NEJM 2023)——这组数字刻画了该领域「检测技术 × 病例聚合」双重决定诊断率的现实。

自然史与临床路径:患儿多在婴幼儿期因发育里程碑落后进入儿科/遗传门诊,经染色体微阵列或外显子组测序发现候选变异后,临床遗传学家需要回答「这个变异是否致病」——DECIPHER 的患者级证据(相似表型患者中出现同区域变异的次数)正是该推理链条的核心输入之一。

§2.4 临床任务定义

任务 定义 DECIPHER 提供的支持 AI 建模形态
变异致病性分类 按 ACMG/AMP 五分类(致病-良性)给出证据等级 患者级变异-表型共现证据 + ClinVar 聚合分类(v11.40 起) 多实例学习/证据加权模型
基因发现 识别新的发育障碍基因 跨中心患者聚合 + DDG2P 基因-表型库(DDD 衍生) 统计聚集检验 + 图神经网络
表型驱动诊断排序 给定 HPO 列表,对候选基因排序 基因级 HPO 摘要 + G2P/OMIM 知识 排序学习(Learning to Rank)
患者匹配 找到相似表型+变异的全球病例 Matchmaker Exchange API v1.0,匹配分 0-1 度量学习/图嵌入
病例检索增强 临床报告中的变异定位到相似已发表病例 全库检索 + Ensembl/UCSC track 语义检索/多模态检索

§2.5 患者人群特征

维度 特征 依据
来源 约 40 国 300+ 学术临床遗传中心;累计上传 50,000+ 病例 About 页、Foreman 2022
时间范围 2004 年至今持续录入;2011-2015 年 DDD 招募为最大单一增量 Foreman 2022;NEJM 2023
年龄结构 以儿科患者为主(发育里程碑评估多在学龄前完成) DDD 队列构成(儿童发育障碍)
地理分布 英欧中心贡献占主导;DDD 承认非欧裔(尤其非洲裔)诊断率更低 GenomeWeb 报道
就医类型 三级转诊的临床遗传门诊/基因组医学服务,非人群筛查 Firth 2009、Bragin 2014 中心性质描述
同意状态 52,694 名患者同意广泛数据共享;其余病例留在中心私有层或私密共享层 官网首页、Chatzimichali 2015

§2.6 金标准/参考标准

DECIPHER 本身是证据聚合平台而非带「金标准标签」的评测集;其领域内的参考基准由 DDD 系列研究确立:

基准 划分 标注方式 标注者 性质
DDD(NEJM 2023) 近 13,500 家庭、trio WES;无官方 train/test 划分(以发现-复现分批) 多学科委员会裁定分子诊断(41%);de novo 状态经三人组验证 Sanger 临床基因组团队 + NHS 临床遗传学家 领域金标准级队列
DDD 基因发现(Nature 2014) 前 1,133 名先证者 12 个新发育障碍基因(de novo 富集 + 表型相似性双重证据) DDD 联盟 新基因发现的参考方法学
DDD 首批诊断率(Lancet 2015) 约 1,130 个发育障碍基因框架 28% 诊断率 DDD 联盟 诊断率的历史基准
DECIPHER 平台论文(AJHG 2009) 2004-2009 病例 CNV 跨患者共现 + 表型对照 录入中心 + 平台团队 平台价值的奠基性证明

AI 建模含义:以 DECIPHER 公开层构建评测时,应把「DDD 裁定的诊断」与「G2P 收录的基因-疾病对」当作外部金标准锚点,把 DECIPHER 自身的 ACMG/AMP 分类当作弱标签——两者可信度不同,混用会导致评测结论失真(见坑点 5)。


§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐获取方式 大小/成本 理由与注意事项
快速探索某基因/区间的病例证据 网页交互查询(免费,公开层无需注册即可浏览) 零成本 GRCh38 展示;支持按基因、染色体区带、HPO 项检索
单个研究问题的批量结构化抽取 查询结果 TSV 导出(免费) 单次导出量级 注意导出快照日期;变异分类随版本漂移(坑点 5)
系统性构建患者级语料/镜像 Deposition/检索 API(JSON:API v1.0,需签 API Agreement) 免费但需协议 双 Key 认证;官方声明 DECIPHER 不应作为主数据存储
大规模再分析/模型训练 批量加密下载(签 Data Access Agreement;可视化另需 DDA) 按协议 需「善意学术研究者」资质;发表须经录入中心同意
复现 2011 年前历史研究 NCBI36 静态档案 零成本 2011-02-16 前沉淀的旧组装数据仅静态存档,不再更新

§3.1 模态详细说明

基因组变异(核心模态)。DECIPHER 覆盖的变异谱在 2013 年从纯 CNV 扩展为全谱系(Bragin 2014,PMC3965078):

  • 序列变异:SNV 与 InDel(2013 年起收录),经 Ensembl 变异效应预测获得功能注释。
  • 短串联重复(STR):后续版本纳入,服务重复扩增疾病的表型-基因型对照。
  • 拷贝数变异(CNV):平台的立身之本——缺失(deletion)与重复(duplication)记录含染色体区带、坐标与拷贝数变化;边界精度受来源芯片平台与探针密度制约(见坑点 3)。
  • 大结构变异(SV):倒位、易位等染色体重排。
  • 特殊变异形态:生殖系变异之外收录镶嵌(mosaic)变异;核基因组之外收录线粒体基因组变异(Foreman 2022)。

HPO 表型(第二锚点)。每名患者以 HPO 术语列表描述临床表型,早期录入基于 Baraitser–Winter Neurogenetics Database,后全部重映射至 HPO;表型辅以定量测量(如头围、身高百分位),并在基因层面聚合为「基因特异性表型摘要」(Foreman 2022)。表型由临床医生人工录入,稀疏与粒度不一致是已知现实(见坑点 4)。

注释与外部整合。变异条目挂接 Ensembl dbSNP、LSDB/LOVD、HGMD 公开部分、专家策展的常见 CNV、ClinVar 与 Gene2Phenotype;变体分类接口遵循 ACMG/AMP 国际标准(Foreman 2022)。v11.40(2026-07-08)引入基于 gnomAD v4.1 exomes 的 Regional Nonsense Constraint、EpiSign™ 表观签名与 NMD 预测更新(官网发布说明)。

协作与匹配模态。Matchmaker Exchange 创始成员,实现 MME API v1.0;匹配分数 0-1(基于 Guo et al. 2006 的相似度度量;Chatzimichali 2015,PMC4832335)。中心间协作消息自 2014 年 10 月累计超 4,500 条(Foreman 2022)。

§3.2 样本量拆分

指标 数值 口径与来源
广泛共享同意患者(公开层) 52,694 官网首页统计,截至 2026-09(官网)
累计上传病例(全库) 50,000+ About 页(含私有层),截至 2026-09
变异记录(开放共享) >51,000 Foreman 2022(PMID 35143074)
HPO 表型条目(开放共享) >172,000 Foreman 2022
项目数 >250 Foreman 2022
贡献国家/地区 约 40 Foreman 2022
贡献中心 300+(2015 年约 250 注册中心) About 页;Chatzimichali 2015
临床遗传学家/诊断科学家 约 1,600 Bragin 2014
DDD 家庭(衍生研究) 近 13,500 NEJM 2023

口径纪律:「52,694」是当前公开层患者数;「50,000+」是含私有层的累计上传量,两者不同层;「>51,000 变异」与「>172,000 表型」是 Foreman 2022 发表时的开放共享口径。引用时必须写明口径与日期,否则跨文献对不齐。

§3.3 数据格式详情

获取形态 格式 说明
网页查询 HTML 表格 + 交互基因组视图 患者页/变异页/基因页三级视图
浏览器 track Ensembl 与 UCSC Genome Browser 轨道 公开层变异直接作为基因组 track 叠加查看
查询导出 TSV/CSV 按患者/变异/基因维度的扁平表
REST API JSON:API v1.0 端点含 /api/patients、/api/patients/:id/variants、/api/patients/:id/phenotypes(API 文档)
批量下载 加密数据包 经 DAA 授权分发,面向善意学术研究者(Bragin 2014)

§3.4 存储大小

DECIPHER 以在线数据库形态提供服务,官方未发布整包数据体量;面向个人的使用单位是「查询级导出」(TSV,通常 MB 量级)与「API 拉取」(分页 JSON)。批量加密下载的体量随授权范围(患者数、变异类型)协商确定。对多数 AI 团队,真实瓶颈不是存储而是协议合规与快照管理——建议按研究问题定义拉取范围并锁定快照日期,而非追求全量镜像(官方亦声明 DECIPHER 不应被用作主数据存储)。

§3.5 标注方式

对象 标注类型 流程
HPO 表型 人工(临床医生) 录入端从 HPO 树选择,沉淀端经 G2P 等知识库聚合为基因级摘要
变异分类 人工 + 标准(ACMG/AMP) 录入中心按国际标准分类;公开层叠加 ClinVar 聚合分类(v11.40 起)
CNV 边界 仪器 + 人工复核 array-CGH/SNP array 平台输出边界,中心人工审校
功能注释 自动(Ensembl VEP 等) SNV/InDel 的效应预测自动化完成
外部资源对齐 自动 + 策展 dbSNP/LOVD/HGMD 公开部分/ClinVar/G2P 定期同步

§3.6 标注者资质

录入与标注主体为学术临床遗传中心的执业临床遗传学家与诊断实验室科学家——Bragin 2014 时期社区规模约 1,600 人,当前贡献中心 300+。DDD 衍生研究中的诊断裁定由 Sanger 与 NHS 临床遗传学家的多学科委员会执行(NEJM 2023)。这意味着:标签质量上限高(专家级),但标注者间一致性无系统公布——同一变异在不同中心可能给出不同分类(见坑点 5)。

§3.7 数据采集时间范围

2004 年至今持续录入。可考的增长里程碑:2009 年约 2,000 患者(约 100 中心);2011-07-30 快照 10,408 患者(5,104 名同意共享)、233 中心;2012 年 17,000+ 患者(30 国);2013 年 >21,000 患者(约 9,000 名同意共享);2023-07 迁移 EMBL-EBI 时 46,000+ 患者;2026-09 公开层 52,694 患者(Sanger 新闻、hg0814.pdf、PMC3459644、EBI 公告)。

§3.8 地理覆盖

贡献中心分布于约 40 个国家或地区(Foreman 2022),以英国与欧洲为主,北美、亚太、中东亦有参与;早期(2013 年)统计显示月独立访客 >10,000、来自 >90 国(Bragin 2014)。数据本身以英文为工作语言;人群基因组背景偏欧裔(见 §7.1 偏倚表与坑点 7)。

§3.9 采集设备规格

DECIPHER 为多中心汇总型资源,检测平台异质是其设计事实而非缺陷:

时期 主导检测 对数据形态的影响
2004-2013 染色体微阵列(array-CGH/SNP array) CNV 为主;边界精度依赖探针密度(kb 至数十 kb 量级)
2013-2018 微阵列 + 外显子组测序并行 SNV/InDel 入库量上升;DDD 招募期 trio WES 为主
2018 至今 WES/WGS 为主 + 微阵列补充 大结构变异、STR、镶嵌与线粒体变异覆盖扩展

§3.10 深度溯源链

溯源链:临床患者 → 录入中心(注册资质)→ 临床级检测(平台/试剂盒,中心内部记录)→ 变异调用与人工审校 → HPO 表型录入 → 中心私有层 →(患者广泛共享同意)→ 全球公开层 →(版本发布)→ 查询/导出/API/批量包。每一环的可见性由录入中心控制;公开层任何一条记录都可回溯到其录入中心与项目(>250 个项目之一),但不可回溯到患者身份。对 AI 团队而言,溯源链的关键字段是「患者所属项目/中心」与「变异的基因组组装版本」——这两项决定了泄漏防控(§5.3)与坐标对齐(坑点 1)。


§4 数据结构详解

§4.0 目录结构预览

DECIPHER 无「解压后目录」;对 AI 团队,建议按以下结构组织自建的拉取快照(以 API/TSV 导出为源):

decipher_snapshot/                 # 自建快照根目录(日期版本化)
├── manifest.txt                   # 快照元信息:拉取日期、版本号(如 v11.40)、获取方式(API/DAA)
├── patients/                      # 患者级表:patient_id、sex、consent_status、project_id
│   ├── patients_part1.tsv
│   └── patients_part2.tsv
├── phenotypes/                    # 患者级 HPO 条目:patient_id、hpo_id、hpo_name、qualifier
│   └── phenotypes.tsv
├── variants/                      # 变异级表:variant_id、patient_id、assembly、chr、start、end
│   ├── snv_indel.tsv              # 序列变异(含功能注释列)
│   ├── cnv.tsv                    # 拷贝数变异(copy_number、边界精度提示)
│   └── structural.tsv             # 大结构变异、STR、镶嵌/线粒体
├── mappings/                      # 下游映射资产
│   ├── hpo_hp.obo                 # HPO 本体版本(锁定日期)
│   └── hpo2snomed_map.tsv         # HPO→SNOMED CT 官方交叉映射(锁定版本)
└── external_anchors/              # 外部金标准锚点(评测用)
    ├── g2p_pairs.tsv              # Gene2Phenotype 基因-疾病对
    └── ddd_diagnoses.tsv          # DDD 已发表诊断(文献级,谨慎使用)

预期结构说明:data_root 即 decipher_snapshot/;最小可用子集是 patients/ + phenotypes/ + variants/snv_indel.tsv 三件套(可完成表型驱动的排序评测雏形)。manifest.txt 是自检关键——DECIPHER 无整包版本号可写,必须自行锁定拉取日期与站点版本。

§4.1 DAIMS 标准化字段描述表

下表按公开层导出/API 字段组织(字段名以官方文档为准,此处为语义等价命名):

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
patient_id Text 脱敏患者唯一标识 平台内部编号 患者级聚合主键 无(系统生成) 不适用 全库唯一
sex Text 生物学性别 M / F 分层变量 录入错误率低 未记录留空 枚举
project_id Text 所属项目(>250 个) 中心项目编号 中心/批次分层、泄漏防控 无 不适用 枚举
hpo_terms List[Text] HPO 表型列表 HP:0001263;HP:0001250 表型相似度输入 稀疏/粒度不一 空列表=未录入表型 HPO 全集
assembly Text 基因组组装版本 GRCh38 / GRCh37 坐标对齐前置键 无 不适用 枚举(NCBI36 仅档案)
chromosome Text 染色体 17 区间索引 无 不适用 1-22/X/Y/MT
start / end Integer 变异区间坐标 44,270,000-44,940,000 区间重叠计算 CNV 边界 kb 级漂移 不适用 组装坐标范围
variant_type Label 变异类型 deletion / SNV / STR / translocation 模态路由 分类粒度随平台异 不适用 受控枚举
copy_number Integer CNV 拷贝数 1(缺失)/3(重复) 剂量敏感建模 镶嵌变异为非整数效应 不适用 0,1,3,4…
classification Label 变异分类(ACMG/AMP 接口) pathogenic / likely pathogenic / VUS / benign 弱标签 随版本与中心漂移 未分类留空 五分类枚举
de_novo_status Label 新发/遗传状态(部分记录) de novo / inherited 遗传模型约束 依赖亲本检测可得性 未做亲本检测留空 枚举
external_xrefs List[Text] 外部资源交叉引用 ClinVar 编号;dbSNP rs 编号 跨库对齐与泄漏排查 同步滞后 无交叉引用留空 多值

§4.2 标签分布统计

变异类型构成:平台起家于 CNV(2004-2013 年为唯一变异类),2013 年扩展 SNV/InDel 后结构变异仍占显著份额;Foreman 2022 报告开放共享 >51,000 个变异与 >172,000 条表型条目,CNV 与序列变异构成两大主类,STR、镶嵌与线粒体变异为小类。分类标签分布:ACMG/AMP 五分类中 VUS(意义未明)占比可观——这正是「分类漂移」坑点(坑点 5)的统计基础;公开层叠加 ClinVar 聚合分类后,致病/可能致病份额提高,但仍有未分类记录。表型分布:发育迟缓(HP:0001263)、智力障碍(HP:0001249)、癫痫(HP:0001250)等神经发育高频项覆盖面广,而免疫、皮肤等专科表型稀疏——以患者间 HPO 相似度建模时,稀疏长尾会系统性压低匹配召回。

§4.3 关键字段描述性统计

  • 患者级表型条目数:均值受录入协议影响,DDD 风格深度表型化项目显著高于历史微阵列时代的简表记录;>172,000 条表型对 5 万+ 患者的总体比值提示人均 HPO 条目为个位数量级——构建多热(multi-hot)向量时务必做 HPO 祖先扩展(见 §6.3)。
  • 患者级变异数:微阵列时代记录常为 1-2 个候选 CNV(诊断导向录入);WES/WGS 时代项目可携带多个候选变异。以「每患者一变异」假设建模是常见错误。
  • 区间长度谱:CNV 跨度从数十 kb 到染色体级;区间重叠计算应按类型分别设参数(见 §6.3 的 pyranges 示例)。
  • 时间分布:录入量随 2011 年 DDD 启动出现台阶式增长;跨时期比较变异构成必须分层(微阵列期 vs 测序期)。

§4.4 数据层级关系

项目(>250 个,中心申办)
└── 患者(52,694 名广泛共享同意 / 累计上传 50,000+)
    ├── HPO 表型条目(>172,000 条,可多对一)
    │   └── 定量测量(头围、身高百分位等,可选)
    └── 基因组变异(>51,000 个,可多对多)
        ├── 序列变异:SNV/InDel(Ensembl 功能注释)
        ├── 结构变异:CNV/SV/STR(坐标 + 拷贝数)
        ├── 特殊形态:镶嵌变异、线粒体变异
        └── 分类与注释:ACMG/AMP 分类、ClinVar 聚合、G2P/OMIM 关联

层级纪律:以患者为分析单元时,变异与表型均为一对多;以基因为分析单元时,同一基因下聚合多患者多变异——两个方向构成不同的评测设计(患者匹配 vs 基因发现),不可混用同一套指标。

§4.5 缺失值情况与信息性缺失编码

缺失形态 信息性含义 处理建议
HPO 列表为空 该中心未录入表型(或录入在私有层),不等于「表型正常」 从表型相似度模型中剔除或单独加权,禁止当「无表型」
classification 留空 中心未给出分类,或分类尚在演化 当作未标注样本;勿把「未分类」并入 VUS
de_novo_status 留空 未做亲本检测(三人组信息不可得) 遗传模型推断中作为缺失协变量处理
CNV 边界宽泛 平台探针密度限制,边界非精确断点 以边界不确定带建模,勿做碱基级重叠假设
external_xrefs 空 与 ClinVar/LOVD 无已知交叉(或同步滞后) 跨库评测前先做 ID 归一化核查

§5 数据划分与使用建议

§5.1 官方数据划分

DECIPHER 无官方 train/validation/test 划分——它是持续演化的临床资源而非固定评测集。唯一接近「官方划分」的结构是:公开层(52,694 名广泛共享同意患者)vs 中心私有/私密共享层,以及按项目(>250 个)与按中心的天然分组。任何论文声称「在 DECIPHER 上训练并测试」时,划分方案皆为作者自定,跨论文不可比。

§5.2 推荐划分策略

  • 基因级切分(默认推荐):按「基因-疾病对」切分,训练集不见目标基因的任何患者变异,模拟「发现新基因」的真实任务。与 G2P 既有基因-疾病对对齐后做 held-out 基因评测。
  • 患者级切分(患者匹配任务):按患者随机切分,但必须保证同一家系成员(如有标注)不跨集合——先证者与亲本分属训练/测试集会人为抬高匹配分。
  • 中心级/项目级切分(稳健性评测):以 project_id 为组做 GroupKFold,检验跨中心泛化;报告「同中心 vs 跨中心」性能差作为分布偏移的量化。
  • 时间切分(漂移评测):锁定快照日期,以早期快照训练、新快照测试,度量分类标签与表型覆盖的演化影响(与坑点 5 联动)。
  • 不建议:按变异条目随机切分——同一患者的多个变异跨集合泄漏,且患者级表型信息同时出现在两侧。

§5.3 数据泄漏风险防御

  1. 患者内泄漏:同一患者的变异与表型必须同侧;患者级 GroupShuffleSplit 是最低配置。
  2. 家系泄漏:同家系成员共享基因型背景,需按家系分组;DDD 衍生数据尤需注意(三人组同录)。
  3. 跨库泄漏:DECIPHER 与 ClinVar、G2P、LOVD 双向同步;若训练集经 G2P 蒸馏、测试集用 DECIPHER 原始记录,同一知识已间接入训。跨库评测必须做重叠剔除并披露。
  4. 时间泄漏:变异分类随版本更新(如 v11.40 的 ClinVar 聚合);用旧快照的分类训练、新快照的分类评测时,先把「分类修订」与「真实泛化」分离。
  5. 匹配任务泄漏:Matchmaker 风格检索中,若训练阶段以全库为目标库做过索引,检索任务已非零样本——目标库必须与训练库隔离。

§5.4 交叉验证建议

  • 排序任务(表型驱动基因优先级):5 折 GroupKFold(按基因分组);指标用 Precision@k / Recall@k(k∈{10, 30, 100})与 MRR;每折报告「目标基因患者数」分布,警惕小样本折。
  • 分类任务(变异分类弱监督):按中心分组的 5×2 折;除 AUC 外报告校准曲线(临床使用关心概率校准)。
  • 患者匹配:以查询患者为轴的留一法抽样(大库下用分层抽样近似);报告 Hit@1/10 与基于 HPO 信息量的相似度分布。
  • 通用纪律:所有折统计先去重(同一患者-变异对可能在多项目出现,见 DAIMS 第 4 项),并以 manifest.txt 锁定数据版本。

§5.5 外部验证

  • DDD 诊断锚点:以 NEJM 2023 报告的 41% 诊断率、76% de novo 构成与 5 倍 trio 优势作为模型产出的现实性上下文;模型「可解释的候选排序」若能把模拟诊断率带入同量级区间,即具初步外部效度。
  • G2P/OMIM 知识锚点:新发现的基因-表型关联先对 G2P(DECIPHER 同源的策展库)与 OMIM 做命中检查——已收录说明复现已知,未收录提示候选新关联(需文献佐证)。
  • ClinVar 交叉验证:分类模型在 ClinVar 提交记录上做独立评测,注意两库共享提交来源(同一实验室),必须按实验室/提交批次去重。
  • Exomiser 基线:Exomiser(Sanger/EBI 系工具)整合 DECIPHER 数据,Genomics England 配置显示其使用 DECIPHER 2015 版数据(配置文档)——以 Exomiser 作为表型排序任务的强基线,但注意其知识库版本与你的快照不同代。

§6 AI 就绪指南

§6.0 云端快速启动

DECIPHER 本身即「云端服务」:公开层查询无需注册即可通过网页完成;程序化访问走 REST API。以下用 curl 验证 API 可达性(需先经官方页面申请 API Key 并签署 API Agreement):

# 前置:在 deciphergenomics.org 完成注册 → 签署 DECIPHER API Agreement → 获取
#       Client API Key 与 Account API Key(双 Key 认证,合规提示见坑点 8)
# 端点清单(JSON:API v1.0):/api/patients、/api/patients/:id/variants、
#                           /api/patients/:id/phenotypes
curl -s "https://www.deciphergenomics.org/api/patients?page[size]=5" \
  -H "Accept: application/vnd.api+json" \
  -H "X-Client-Key: ${DECIPHER_CLIENT_KEY}" \
  -H "X-Account-Key: ${DECIPHER_ACCOUNT_KEY}" | head -c 2000
# 返回为 JSON:API 文档结构;分页参数遵循 page[size]/page[number]

注:以上为端点调用形态示意,认证头名称与字段以 官方 API 文档为准;公开层亦有无需 Key 的匿名浏览配额。

§6.1 快速上手(本地版)

目录结构预期:沿用 §4.0 的 decipher_snapshot/ 布局;data_root 即该目录。最小可用子集:patients/ + phenotypes/phenotypes.tsv + variants/snv_indel.tsv。data_root 拼接关系:所有相对路径均相对 data_root 解析。以下脚本完成「拉取 → 落盘 → 完整性自检」:

import os, requests, pandas as pd

DATA_ROOT = os.environ.get("DECIPHER_ROOT", "decipher_snapshot")
BASE = "https://www.deciphergenomics.org/api"          # 官方 API 根路径
HEADERS = {                                            # 双 Key 认证(变量来自环境)
    "Accept": "application/vnd.api+json",
    "X-Client-Key": os.environ["DECIPHER_CLIENT_KEY"],
    "X-Account-Key": os.environ["DECIPHER_ACCOUNT_KEY"],
}

def pull_all(endpoint: str) -> pd.DataFrame:
    """按分页拉取整个端点;官方声明 DECIPHER 不应作为主数据存储——
    拉取仅限研究快照,且须在 manifest.txt 记录日期与版本。"""
    rows, page = [], 1
    while True:
        r = requests.get(f"{BASE}/{endpoint}",
                         headers=HEADERS,
                         params={"page[size]": 100, "page[number]": page},
                         timeout=60)
        r.raise_for_status()
        doc = r.json()
        rows += doc.get("data", [])
        if not doc.get("links", {}).get("next"):
            break
        page += 1
    return pd.json_normalize(rows)

def main():
    os.makedirs(f"{DATA_ROOT}/raw", exist_ok=True)
    for ep in ["patients", "phenotypes", "variants"]:
        df = pull_all(ep)
        df.to_csv(f"{DATA_ROOT}/raw/{ep}.tsv", sep="\t", index=False)
        print(f"{ep}: {len(df)} rows -> raw/{ep}.tsv")

if __name__ == "__main__":
    main()

自检要点:行数与官网统计量级比对(公开层患者 52,694 量级,截至 2026-09);assembly 列是否同时出现 GRCh38/GRCh37(坑点 1);HPO 空列表比例(信息性缺失,见 §4.5)。

§6.2 数据获取流程

通道 前置条件 输出 适用人群
网页浏览 无 交互式查询 快速案例核查
TSV 导出 无(公开层) 查询级扁平表 单研究问题
REST API 注册 + API Agreement + 双 Key 分页 JSON 程序化快照
批量加密下载 善意学术研究者 + Data Access Agreement 加密数据包 大规模再分析
浏览器 track 无 Ensembl/UCSC 轨道 基因组学可视化

合规要点(源自官方致谢与协议要求):① 使用数据发表论文须在正文使用官方致谢模板(“This study makes use of data generated by the DECIPHER community…”),并注明 DECIPHER 由 EMBL-EBI 托管、Wellcome Trust 资助(grant WT223718/Z/21/Z);② 涉及具体患者/中心的发表须获得录入中心同意;③ 可视化再分发需 Data Display Agreement(数据共享页)。流程上建议把「协议签署 → 快照拉取 → manifest 记录」写进项目 SOP,审批时间按周级预留。

§6.3 预处理 Pipeline

流程:格式统一 → 坐标对齐 → HPO 语义扩展 → 区间索引 → 弱标签清洗。

import pandas as pd
from pyliftover import LiftOver          # pip install pyliftover
from pyranges import PyRanges            # pip install pyranges

ROOT = "decipher_snapshot"

# ---- Step 1: 读取并统一 schema(字段名以官方导出为准,此处为语义等价名)----
def load_variants():
    v = pd.read_csv(f"{ROOT}/raw/variants.tsv", sep="\t", low_memory=False)
    v = v.rename(columns={"chrom": "Chromosome", "start": "Start", "end": "End"})
    v["Start"], v["End"] = v["Start"].astype(int), v["End"].astype(int)
    return v

# ---- Step 2: 坐标对齐——GRCh37 沉淀记录统一 lift 到 GRCh38(坑点 1)----
lo = LiftOver("hg19", "hg38")
def liftover(row):
    if row.get("assembly") == "GRCh38":
        return row["Start"], row["End"]
    c1 = lo.convert_coordinate(f"chr{row['Chromosome']}", row["Start"])
    c2 = lo.convert_coordinate(f"chr{row['Chromosome']}", row["End"])
    if c1 and c2:
        return int(c1[0][1]), int(c2[0][1])
    return None, None                      # lift 失败 → 丢弃并计数,勿静默通过

# ---- Step 3: HPO 祖先扩展(表型稀疏的补救;hpo_hp.obo 版本锁定于 mappings/)----
import obonet
graph = obonet.read_obo(f"{ROOT}/mappings/hpo_hp.obo")
def expand_hpo(hpo_list, keep_original=True):
    out = set(hpo_list) if keep_original else set()
    for t in hpo_list:
        out |= {a for a in graph.predecessors(t) if str(a).startswith("HP:")}
    return out

# ---- Step 4: 区间索引(CNV 重叠计算按类型分参数)----
def build_index(v):
    return {t: PyRanges(v[v["variant_type"] == t]) for t in v["variant_type"].unique()}

# ---- Step 5: 弱标签清洗——分类漂移与「未分类」处理(坑点 5)----
VALID = {"pathogenic", "likely_pathogenic", "uncertain_significance",
         "likely_benign", "benign"}
def clean_labels(v):
    v["label"] = v["classification"].where(v["classification"].isin(VALID), other=None)
    return v                                # 未分类保持 None,绝不并入 VUS

质量控制清单:lift 失败率超过 1% 时停下检查 assembly 混杂;HPO 扩展后维度爆炸时改用「最深 3 层祖先」截断;CNV 重叠阈值按长度分层(小于 100 kb 用高 IoU,染色体级用共现即可)。

§6.4 框架加载

以「表型驱动的患者表示」为例的 PyTorch Dataset:输入为患者 HPO 多热向量(祖先扩展后),输出与变异特征联合用于排序/匹配任务。

import torch
from torch.utils.data import Dataset, DataLoader

class DecipherPatientDataset(Dataset):
    """患者级数据集:每行一个患者(HPO 多热 + 变异摘要特征)。
    预期输入:§4.0 快照结构;hpo_vocab 为锁定版本 HPO 项表(祖先扩展后)。"""
    def __init__(self, patients, phenotypes, variants, hpo_vocab):
        self.ph = phenotypes.groupby("patient_id")["hpo_id"].apply(list).to_dict()
        self.vsum = (variants.assign(length=variants["End"] - variants["Start"])
                             .groupby("patient_id")
                             .agg(n_var=("variant_id", "count"),
                                  mean_len=("length", "mean"),
                                  n_cnv=("variant_type", lambda s: (s == "deletion").sum())))
        self.hpo_idx = {h: i for i, h in enumerate(hpo_vocab)}
        self.pids = patients["patient_id"].tolist()

    def __len__(self):
        return len(self.pids)

    def __getitem__(self, i):
        pid = self.pids[i]
        x_hpo = torch.zeros(len(self.hpo_idx))
        for h in self.ph.get(pid, []):                # 稀疏表型 → 多热
            if h in self.hpo_idx:
                x_hpo[self.hpo_idx[h]] = 1.0
        v = self.vsum.loc[pid] if pid in self.vsum.index else None
        x_var = torch.tensor([v["n_var"], v["mean_len"], v["n_cnv"]] if v is not None
                             else [0.0, 0.0, 0.0], dtype=torch.float32)
        return x_hpo, x_var, pid

loader = DataLoader(DecipherPatientDataset(patients, phenotypes, variants, HPO_VOCAB),
                    batch_size=64, shuffle=True, num_workers=4)

泄漏提醒:DataLoader 之上的划分必须用 §5.2 的分组策略(基因级/患者级/中心级),禁止在 batch 维度随机切分后宣称遵循了划分协议。

§6.5 常见坑点

以下 8 个坑点按「遇到频率 × 损失量级」排序;每条按问题-症状-解决(简单→进阶→SOTA)-参考四段给出,解决措施与 §6.3/§6.4 代码对应。

⚠️ 坑点 1:GRCh38 展示与 GRCh37 沉淀并存——坐标版本混用(分类:工程陷阱)

问题:站点以 GRCh38 为展示坐标,但历史沉淀仍以 GRCh37/hg19 为主,NCBI36 旧数据仅静态存档(2011-02-16 前沉淀);同一研究里网页截图坐标与导出 TSV 坐标可能分属不同组装版本,直接比较会整体错位。

症状:候选区间与已知基因对不上;两个团队各自导出的 CNV 坐标重叠率异常低;liftover 后部分区间「消失」。

解决:

  1. 简单方法:以 assembly 列分组,非 GRCh38 记录统一经 pyliftover 升到 GRCh38,lift 失败样本剔除并报告比例。
  2. 进阶方法:在快照 manifest 中同时记录「原坐标 + 目标坐标」双列,保留可回溯性;对 CNV 边界做 ±10 kb 容差重叠而非精确重叠。
  3. SOTA 方法:区间以「参考基因组版本 + HGVS 归一化锚点」双键索引;跨版本比对全部经比较浏览器(如 UCSC Assembly Hub)二次目检。

参考:Foreman 2022(PMID 35143074);hg0814.pdf。

⚠️ 坑点 2:公开层只是子集——52,694 与 50,000+ 的口径差(分类:偏倚陷阱)

问题:公开层仅含同意广泛共享的患者(52,694 名,2026-09);累计上传 50,000+ 病例中还有大量中心私有与私密共享记录,2015 年口径下公开同意者约 1.8 万、私密共享约 2.5 万(Chatzimichali 2015)。基于公开层训练的模型天然偏向「愿意公开的中心与病种」。

症状:某基因明明文献报告不少病例,DECIPHER 公开层却检索寥寥;以公开层估计的变异人群频率被系统性低估;跨年份统计突然跳变(同意政策变化所致)。

解决:

  1. 简单方法:论文中显式声明「公开层口径 + 检索日期」;避免用公开层数据做任何频率估计。
  2. 进阶方法:以中心/项目为单位做敏感性分析——比较含/不含大中心的结论稳定性;必要时走 DAA 扩大可见层。
  3. SOTA 方法:把「同意状态」作为显式协变量建模(选择偏倚校正,如逆概率加权)。

参考:官网首页;About 页;PMC4832335。

⚠️ 坑点 3:CNV 边界精度依赖平台与探针密度(分类:预处理陷阱)

问题:微阵列来源的 CNV 边界由探针密度决定(kb 到数十 kb 级不确定带),不同平台、不同年代的记录精度不一致;把边界当碱基级真值会污染重叠计算。

症状:同一基因的两个「相邻但不重叠」CNV 被判不共享断点;跨平台统计的「recurrent CNV」位点随阈值漂移;与精细断点文献(WGS 来源)比对时系统性外扩。

解决:

  1. 简单方法:重叠判定统一放宽至区间 IoU ≥ 0.5 或「任一端点距离 ≤ 50 kb」二选一。
  2. 进阶方法:按 variant_type 与区间长度分层设阈值;给每条 CNV 附加「边界置信带」(由长度与年代推断)。
  3. SOTA 方法:以概率区间模型(boundary uncertainty interval)建模边界,重叠概率作为特征而非硬判定;与 WGS 精细断点库做层级融合。

参考:Bragin 2014(PMC3965078);Foreman 2022。

⚠️ 坑点 4:HPO 表型稀疏与录入不一致——表型相似度的天花板(分类:标签理解)

问题:表型由临床医生录入,不同中心、不同项目对「录多细、录多全」没有统一协议;早期录入基于 Baraitser–Winter 数据库后重映射 HPO,历史粒度混杂。>172,000 条表型对 5 万+ 患者的人均条目量提示深度表型化是少数。

症状:两个临床表现几乎相同的患者,HPO 交集接近空集;表型匹配检索的召回率被「高频表型」垄断而失真;直接以原始 HPO 集训练的模型把「录入习惯」当成了「临床特征」。

解决:

  1. 简单方法:HPO 祖先扩展(§6.3 Step 3)+ 以 HPO 信息量(IC 值)加权相似度,抵消高频项垄断。
  2. 进阶方法:按项目/年代分层训练或加入「录入深度」协变量;对空表型患者做独立处理而非当负样本。
  3. SOTA 方法:用 HPO 本体嵌入(phen2gene 类语义嵌入方法)替代多热向量;引入文本侧补偿(从患者自由文本描述抽取增量 HPO 项,人工抽验)。

参考:Bragin 2014(PMC3965078);Foreman 2022。

⚠️ 坑点 5:变异分类随版本漂移——快照之间不可直接比较(分类:评估误用)

问题:ACMG/AMP 分类由各中心给出并随证据演化;公开层叠加 ClinVar 聚合分类(v11.40 起)、约束得分随 gnomAD 版本更新(v11.40 换用 v4.1 exomes)。同一变异在不同快照可能从 VUS 升为致病。

症状:三个月前训练的分类模型在新快照上 AUC 骤降(其实是标签变了);文献间「DECIPHER 中致病性 CNV 数量」对不齐;复现他人结果时数字差一截。

解决:

  1. 简单方法:manifest 锁定快照日期与站点版本;所有引用数字带「截至 YYYY-MM」。
  2. 进阶方法:构建「分类变更日志」——两个快照 diff 出分类翻转的变异集合,单独报告其在评测中的占比。
  3. SOTA 方法:以时间切分评测(旧快照训 → 新快照测)显式度量标签漂移;模型输出用校准曲线而非仅 AUC,区分「校准失效」与「判别失效」。

参考:官网发布说明;Foreman 2022。

⚠️ 坑点 6:与 ClinVar/G2P/LOVD 的重叠——跨库评测泄漏(分类:数据泄漏)

问题:DECIPHER 与 ClinVar、G2P、LOVD 双向同步(Foreman 2022 列举的整合资源);Exomiser 类工具把 DECIPHER 数据编入知识库(Genomics England 配置显示 DECIPHER 2015 版)。若训练集经这些二级资源、测试集用 DECIPHER 原始记录,同一知识已绕道入训。

症状:模型「预测」的基因-疾病对在 G2P 中早已收录却被当作新发现;表型排序任务分数虚高;审稿人以「与 ClinVar 重叠」为由质疑新颖性。

解决:

  1. 简单方法:训练前以 external_xrefs 做跨库 ID 归一化,剔除与评测锚点的直接重叠。
  2. 进阶方法:以「实验室/提交批次」为组去重(两库共享提交来源);held-out 锚点(G2P 对)从训练语料的任何二级来源中一并剔除。
  3. SOTA 方法:构建泄漏审计表(每条测试样本回查全部训练路径:DECIPHER→Exomiser→模型、DECIPHER→G2P→模型……),在附录公开审计结果。

参考:Foreman 2022(PMID 35143074);Genomics England Exomiser 配置。

⚠️ 坑点 7:英欧中心为主的人群偏倚(分类:偏倚陷阱)

问题:贡献中心以英欧为主;DDD 研究明确承认非欧裔(尤其非洲裔)诊断率更低——参考人群基因组背景(如约束得分所用 gnomAD 分布)亦以欧裔为主。模型在跨人群部署时性能与公平性都会受损。

症状:非欧裔患者的候选基因排序明显更差;「致病性」打分对非欧裔变异系统性偏移(因群体频率参考不同);非欧地区中心录得病例在公开层占比远低于其人口占比。

解决:

  1. 简单方法:报告分人群子集性能(如可得);避免把欧裔为主的群体频率特征直接用于跨人群打分。
  2. 进阶方法:以人群特异频率库(如 gnomAD 各 ancestry 组)替换单一频率特征;跨人群评测集引入非欧裔子集做对照。
  3. SOTA 方法:公平性约束训练(group-DRO 类)+ 招募侧长期解(鼓励全球南方中心录入,配合 MME 扩大可见性)。

参考:NEJM 2023 报道;Foreman 2022。

⚠️ 坑点 8:引用、致谢与再发表合规——发表须录入中心同意(分类:工程陷阱)

问题:DECIPHER 数据不是无主资源:发表引用须用官方致谢模板;使用数据发表须获得录入中心同意;API 需签署 API Agreement(双 Key);批量分发需 DAA,可视化需 DDA。合规被当作「下载后小事」是社区内的常见翻车点。

症状:预印本漏致谢被社区指出;把批量数据片段直接打包进开源仓库(违反 DAA);论文数字无法复现因未声明快照版本。

解决:

  1. 简单方法:把官方致谢文本写进项目模板仓库(写入 README),新建论文即复制;快照 manifest 与论文方法节一一对应。
  2. 进阶方法:建立「数据合规检查单」:致谢、快照版本、录入中心同意、协议编号四项逐一核对;开源仓库只放代码与指标,数据经 DAA 独立分发。
  3. SOTA 方法:以 CI 流水线强制检查(论文仓库若无 manifest 与致谢则构建失败);再分析环境用受控访问工作区(数据不出域、只出结果)。

参考:官网致谢模板;datasharing 页;API 文档。

§6.6 数据增强

  • 安全 ✅:HPO 术语扰动(沿本体层级向上/向兄弟节点采样,模拟录入粒度差异);患者特征 dropout(模拟表型稀疏);CNV 区间的长度分桶重采样(平衡长度分布)。
  • 危险 ❌:对 CNV 边界做随机抖动并当真值——边界不确定带是测量属性而非可增强自由度;对「未分类」变异随机赋予五分类标签;跨组装版本混合增强(坐标语义随之改变)。
  • 原则:一切增强不得改变「变异-表型共现」这一核心语义——增强后的样本仍须是「可能真实出现在某中心的记录形态」。

§6.7 模型推荐

任务 推荐模型/工具 理由
表型驱动基因排序 Exomiser(强基线)、Phen2Gene 类 Exomiser 本身整合 DECIPHER 数据,是社区事实基线
患者匹配 Matchmaker Exchange API + 图嵌入度量学习 官方匹配分 0-1,可作为模型输出校准目标
变异分类辅助 ACMG/AMP 证据加权 + CADD/REVEL 类特征 弱监督下可解释性优先
基因-表型关联挖掘 知识图谱补全(TransE/RotatE 类) 患者-基因-表型三元组天然成图
CNV 语义建模 pyranges 区间深度网络 + 长度分层 坑点 3 的边界不确定性需显式建模

§6.8 计算资源需求

阶段 规模 建议配置
API 快照拉取 5 万+ 患者、5 万+ 变异 单机 8 GB 内存即可;注意分页限速
HPO 扩展与多热矩阵 数万患者 × 数千 HPO 项 16 GB 内存、SSD;稀疏矩阵存储
排序/匹配模型训练 表格级特征 单卡(24 GB 显存)数小时量级
全库区间索引 5 万+ 变异 pyranges/bedtools 内存索引,32 GB 内存余量充足

§6.9 评估指标

import numpy as np

def precision_at_k(ranked_genes: list, true_gene: str, k: int = 30) -> float:
    """基因排序任务:目标基因是否进入 Top-k(单目标情形取 0/1)。"""
    return float(true_gene in ranked_genes[:k])

def mrr(ranked_genes: list, true_gene: str) -> float:
    """平均倒数排名:罕见病基因发现的惯用汇总指标。"""
    for i, g in enumerate(ranked_genes, start=1):
        if g == true_gene:
            return 1.0 / i
    return 0.0

def hpo_similarity_ic(hpo_a: set, hpo_b: set, ic: dict) -> float:
    """基于信息量的 HPO 相似度(Resnik 类):取共享祖先的最大 IC。
    ic: {hpo_id: information_content},由锁定版本的 hpo_hp.obo 统计。"""
    if not hpo_a or not hpo_b:
        return 0.0
    common = hpo_a & hpo_b
    return max((ic.get(t, 0.0) for t in common), default=0.0)

def classification_snapshot_report(y_true, y_pred, changed_mask):
    """分类任务快照报告:整体指标 + 分类翻转子集单独报告(坑点 5)。"""
    acc_all = float(np.mean(np.asarray(y_true) == np.asarray(y_pred)))
    idx = np.asarray(changed_mask, dtype=bool)
    acc_changed = (float(np.mean(np.asarray(y_true)[idx] == np.asarray(y_pred)[idx]))
                   if idx.sum() > 0 else None)
    return {"accuracy_all": acc_all, "accuracy_label_changed_subset": acc_changed}

选型纪律:排序任务报 Precision@k/MRR 时同时给出「目标基因患者数」分桶;匹配任务报 Hit@1/10 时注明目标库是否与训练库隔离(坑点 6);分类任务必须附快照版本与分类翻转占比。

§6.10 MLOps 笔记

  • 快照即版本:DECIPHER 无固定数据版本号,manifest.txt(拉取日期、站点版本如 v11.40、获取通道)是唯一可追溯锚点,纳入 git 与实验跟踪系统双记录。
  • 标签漂移监控:每次快照更新后 diff 分类翻转集合,翻转占比超阈值(如 2%)触发重新评测与模型再校准。
  • 合规审计自动化:致谢文本、协议编号、录入中心同意记录作为必填字段进入发布检查单(坑点 8 的 CI 化)。
  • 重识别风险红线:任何「患者级数据 + 公开统计」的组合输出前,做小格抑制;批量数据衍生物的分发遵循 DAA 而非公开仓库。
  • 服务化注意:若把检索/匹配模型做成在线服务,底层知识库须定期与官方版本对齐,并在 API 响应中返回所依据的快照日期。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
地理/人群偏倚 中心集中英欧;非欧裔诊断率更低(DDD) 高 分人群评测;人群特异频率特征;坑点 7 方案
选择偏倚 三级转诊人群(发育异常/发育迟缓),非人群样本;公开层仅广泛同意者 高 明确研究问题边界;选择偏倚建模(坑点 2)
录入深度不均 深度表型化项目 vs 简表记录并存 中 HPO 祖先扩展 + 录入深度协变量(坑点 4)
平台代际偏倚 微阵列期 vs 测序期变异谱不同 中 按年代分层分析;边界置信带(坑点 3)
标签演化偏倚 ACMG/AMP 分类与聚合分类随版本更新 中 快照锁定 + 分类翻转监控(坑点 5)
跨库循环偏倚 与 ClinVar/G2P/LOVD 双向同步,二级工具(Exomiser)回灌 中 泄漏审计(坑点 6)

§7.2 标注质量评估

DECIPHER 的标注质量上限是专家级:约 1,600 名临床遗传学家/诊断实验室科学家参与录入(Bragin 2014),DDD 衍生诊断为多学科委员会裁定。但三重不确定性真实存在:①标注者间一致性未系统公布——同一变异跨中心的分类可能不一致;②HPO 粒度自由裁量——「录到哪一层」无硬性协议;③弱标签属性——公开层的分类本质是「当前证据下的最佳判断」而非真值。AI 使用建议:把分类当弱标签做校准研究,把「多中心一致出现的变异-表型共现」当作高置信子集(内部一致性筛选),并在论文中报告弱标签敏感性分析。

§7.3 泛化性讨论

部署场景 失效风险 证据
跨人群临床部署 排序/分类性能对非欧裔患者下降 DDD 非欧裔诊断率更低(NEJM 2023)
面向成人患者 人群以儿科为主,成人迟发表型覆盖弱 收录人群结构(§2.5)
直接当变异频率参考 公开层有严重选择偏倚,频率被低估 口径分析(§3.2、坑点 2)
低资源地区医院 英文工作语言 + 中心资质门槛 协议与录入机制(§6.2)
全自动临床诊断 弱标签 + 专家裁定缺位不可替代 标注质量分析(§7.2)

§7.4 伦理考量

DECIPHER 的伦理设计围绕「患者同意 + 中心治理」展开:患者(或监护人)同意是数据进入公开层的前提,录入中心对可见性持续负责;发表与再分发须遵循协议链(DAA/DDA/API Agreement)。对 AI 团队的具体要求:①基因组数据属于潜在可识别数据,即便脱敏也应避免把「变异 + 表型 + 中心 + 时间」组合成重识别指纹对外发布;②衍生模型若面向临床,需说明其证据来源包含儿童患者数据(儿科适用性论证);③再识别或协议外分发是对整个社区信任机制的破坏,属于红线。

§7.5 公平性评估

以公开层自建快照为例的公平性体检(框架代码,分组字段以实际导出为准):

import pandas as pd

def fairness_peek(patients: pd.DataFrame, phenotypes: pd.DataFrame) -> dict:
    """三个最低配置的公平性检查:
    1) 中心/项目集中度(HHI);2) 表型录入深度分布;3) 空表型率。"""
    out = {}
    share = patients["project_id"].value_counts(normalize=True)
    out["hhi_projects"] = float((share ** 2).sum())          # 越接近 1 越集中
    depth = phenotypes.groupby("patient_id").size()
    out["hpo_depth_quintiles"] = depth.quantile([0.2, 0.5, 0.8]).to_dict()
    out["empty_phenotype_rate"] = float((depth == 0).mean())
    return out

解读框架:HHI 高 → 结论被少数大中心支配,跨中心泛化存疑;表型深度五分位差距大 → 相似度指标被录入习惯混淆;空表型率高 → 匹配类任务的有效样本远小于名义患者数。这些体检应写入论文的局限性说明与模型卡。

§7.6 数据漂移提示

三类漂移需要显式监控:标签漂移——ACMG/AMP 分类与 ClinVar 聚合分类随版本修订(v11.40 即引入聚合分类与新的约束得分);特征分布漂移——测序技术占比变化使 CNV/SNV 构成持续移动,跨年代模型需重校准;知识库漂移——gnomAD 版本更新改变约束特征(v11.40 换用 v4.1 exomes)、G2P 新增条目改变排序任务的「已知集合」。落地建议:把「站点版本号 + 快照日期」作为模型输入的一部分持久化;每次官方版本公告(如 v11.38→v11.39→v11.40)后跑一次回归评测。

§7.7 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 数据为宽格式(每行一个样本/事件) ❌ 记录型临床数据库,非样本×特征矩阵;需自建患者级表示
2 有唯一标识符列 ✅ 患者/变异两级脱敏标识,跨表可关联
3 无 Unicode 或特殊字符 ✅ 结构化字段以标准编码发布;HPO ID/坐标为规范格式
4 无重复行 ⚠️ 同一变异可经多项目/多患者出现;跨库同步需去重
5 缺失值已识别并编码 ✅ 未录入字段留空语义清晰,枚举型字段有受控词表
6 标签列被明确标识 ⚠️ 无任务式标签;ACMG/AMP 分类与 HPO 可作弱标签
7 已对罕见类别(<3%)进行分组 ✅ HPO 本体层级天然聚合长尾表型;基因级摘要已策展
8 偏倚评估已完成 ✅ §7.1 列出 6 类偏倚与缓解措施
9 有完整的数据字典 ✅ API 文档 + help 文档 + 官方发布说明
10 对「信息性缺失」有明确编码解释 ⚠️ 空表型/未分类的语义可推断但无成文页;见 §4.5
11 数据采集设备和设置已记录 ❌ 多中心平台异质,捕获试剂盒/探针密度不系统公开
12 已移除完全共线性变量 ❌ 临床资源不做共线性清理,保留原始字段
13 对编码的映射标准已说明 ✅ HPO 原生 + ACMG/AMP + 组装版本标注;SNOMED 经官方映射
14 对时间戳的处理已明确说明 ✅ 版本发布说明 + 统计页时间戳成文
15 训练/验证/测试划分建议已给出 ❌ 官方无划分;本条目 §5.2 给出基因级/中心级建议
16 数据泄漏风险已被讨论 ✅ §5.3 五类泄漏模式(患者/家系/跨库/时间/匹配)
17 标签分布已被分析 ✅ §4.2 变异类型/分类/表型分布
18 选择性测量偏倚已被讨论 ✅ 平台代际与边界精度(§7.1、坑点 3)
19 外部验证建议已给出 ✅ §5.5 DDD/G2P/ClinVar/Exomiser 锚点
20 数据更新和版本信息已记录 ✅ v11.x 版本序列 + 官方发布说明完整可溯
21 最小必要预处理脚本已提供 ❌ 官方提供 API/文档,无端到端 ML 预处理脚本
22 合规使用要求已明确 ✅ DAA/DDA/API Agreement + 致谢模板成文
23 多模态对齐方法已说明 ✅ 患者-变异-表型三级对齐是平台核心设计
24 去标识化方法已被记录 ✅ 同意管理 + 中心治理 + 脱敏录入流程成文

DAIMS 评分:17.5 / 24

评分解读:良好偏上——治理面(字典、版本、合规、去标识)是其强项,反映十余年临床基础设施的成熟度;失分集中在「研究性数据集 vs ML 数据集」的结构差异:无宽格式矩阵、无官方划分与任务标签、设备信息与预处理脚本缺位。这些不是缺陷而是性质——它本来就不是 benchmark。

对你意味着什么:

  • 做表型排序/患者匹配:患者-变异-表型的三级对齐开箱即用,重点是 HPO 扩展与快照锁定(§6.3、坑点 4/5)。
  • 做变异分类弱监督:把分类当弱标签,先做校准与翻转监控再谈精度;「未分类」绝不并入 VUS。
  • 做跨库知识工程:泄漏审计是第一优先级(坑点 6),否则新颖性主张站不住。
  • 做频率估计/流行病学:不适用——公开层的选择偏倚使频率类结论不可信,换 gnomAD 类资源。
  • 一句话:把它当带语义对齐的临床证据库而不是现成的 ML 训练集来用,价值最大、风险最小。

§7.8 外部验证矩阵

外部数据集/锚点 来源机构 评估任务 关键结果 相对 DECIPHER 的差异 关键发现
DDD 研究 Sanger/英国 NHS 发育障碍基因发现与诊断率 41% 分子诊断率;76% de novo(NEJM 2023) 深度表型化 + trio 设计 + 委员会裁定 trio 约为单独先证者 5 倍;非欧裔诊断率更低
DDD 首批先证者 同上 新基因发现 前 1,133 先证者 12 个新基因(Nature 2014) 受控队列 vs 社区增长库 诊断率由 28% 升至 31%
DDD 首批诊断率 同上 诊断率基准 28%(约 1,130 基因框架,Lancet 2015) 历史基准 后续随样本与技术演进至 41%
G2P Firth/Carter 团队 基因-表型知识锚点 专家策展的基因-疾病对 蒸馏知识 vs 原始记录 DECIPHER 数据经策展汇入 G2P
Exomiser Sanger/EBI 系 表型驱动排序基线 整合 DECIPHER 2015 版数据(Genomics England 配置) 知识库版本固定 跨库比较须声明知识版本

§8 基准性能与生态

§8.1 排行榜

DECIPHER 无官方算法排行榜(它不是竞赛型评测集);领域内可比的公开基准结果集中于 DDD 系列与 Exomiser 类工具:

排名参考 模型/研究 性能 年份 关键技术 完整引用 代码
诊断率基准 DDD 研究(trio WES 全队列) 41% 分子诊断率 2023 trio 测序 + 委员会裁定 + DECIPHER 平台 Wright CF et al., 2023, N Engl J Med. DOI 10.1056/NEJMoa2209046 未公开全量
新基因发现 DDD 首批先证者 12 个新发育障碍基因;28%→31% 2015 de novo 富集 + 表型相似性 Wright CF et al., 2015, Nature 519. DOI 10.1038/nature14135 未公开全量
诊断率历史基准 DDD 首批队列 28%(约 1,130 基因框架) 2015 阵列+外显子组混合 Wright CF et al., 2015, Lancet 385(9975):1305-1314 未公开全量
平台奠基 DECIPHER 跨中心 CNV 协作 新综合征划定(17q21.3 等) 2009 跨中心病例聚合 Firth HV et al., 2009, Am J Hum Genet 84(4):524-533. DOI 10.1016/j.ajhg.2009.03.010 平台在线

不可直接比较声明:上述四行的研究人群、检测技术、裁定流程与年代均不同(尤其 28%→41% 是样本量与技术演进共同结果),只能作为领域参照系,不能当作同一榜单的名次。

§8.2 SOTA 总结与选型建议

领域现状:表型驱动排序的实用标杆是 Exomiser 系工具(深度整合 DECIPHER/HPO 知识),研究前沿在知识图谱与语言模型融合(把 HPO 自由文本、患者信件与结构化变异联合建模)。选型建议:临床可解释性优先 → ACMG/AMP 证据加权 + Exomiser 基线;研究新颖性优先 → 图嵌入/LLM 增强的患者表示,但必须以 G2P/DDD 为外部锚点评测;工程落地优先 → 先把快照管理与泄漏审计做成基础设施,再迭代模型——DECIPHER 类资源的失败案例几乎都败在数据治理而非模型。

§8.3 官方评测协议

DECIPHER 自身无官方 ML 评测协议;其「协议性」体现为三点:①Matchmaker Exchange API 符合性——接入方须实现 MME API v1.0(匹配分 0-1),这是患者匹配任务的事实协议;②ACMG/AMP 分类接口——分类相关研究须与五分类对齐;③版本与口径纪律——官方发布说明(v11.x)与致谢模板构成事实上的「实验协议」框架。基于公开层自建评测的研究,应参照 §5.2/§6.9 的划分与指标纪律并在论文中完整披露快照版本。

数据集 关系 与 DECIPHER 的互补点
ClinVar 变异分类权威库 变异级分类深度;无患者表型配对
Gene2Phenotype (G2P) 同源策展库(Firth/Carter 团队) 蒸馏后的基因-疾病实体对
DDD 研究 衍生研究(以 DECIPHER 为平台) 深度表型化 trio 队列与裁定诊断
OMIM 叙述性知识库 疾病实体与基因的权威叙述
LOVD 基因特异性 LSDB 联盟 单基因垂直深度
100,000 Genomes Project 英国基因组医学队列 全基因组 + 表型的研究级对照
HPO 表型本体标准 一切表型计算的基础设施

§8.5 关键论文 Top 8

  1. Firth HV et al., 2009, Am J Hum Genet 84(4):524-533. DOI 10.1016/j.ajhg.2009.03.010 — 平台奠基论文:跨中心 CNV-表型协作与 17q21.3 等新综合征划定(Google Scholar 2,263+,截至 2026-09)。
  2. Bragin E et al., 2014, Nucleic Acids Res 42(Database issue). PMID 24150940 — 数据库系统描述:扩展 SNV/InDel 后的架构与约 1,600 名社区用户。
  3. Chatzimichali EA et al., 2015, Hum Mutat. PMID 26220709 — 患者匹配与 MME 接入:API v1.0 与匹配分设计。
  4. Foreman J et al., 2022, Hum Mutat. DOI 10.1002/humu.24340 — 现代化综述:>250 项目、约 40 国、>2,600 篇出版物引用。
  5. Foreman J et al., 2023, Annu Rev Genomics Hum Genet 24:151-176. DOI 10.1146/annurev-genom-102822-100509 — 官方推荐引用的年度综述:定位与展望。
  6. Wright CF et al., 2015, Nature 519. DOI 10.1038/nature14135 — DDD 新基因发现方法学:12 个新发育障碍基因。
  7. Wright CF et al., 2015, Lancet 385(9975):1305-1314 — DDD 首批诊断率 28% 的领域基准。
  8. Wright CF et al., 2023, N Engl J Med. DOI 10.1056/NEJMoa2209046 — DDD 终期报告:41% 诊断率、76% de novo 的领域标杆。

§8.6 社区活跃度

规模指标:300+ 贡献中心(约 40 国)、约 1,600 名临床遗传学家/诊断科学家(Bragin 2014 时期)、累计上传 50,000+ 病例、>250 个项目。协作指标:2014 年 10 月以来中心间协作消息 >4,500 条(Foreman 2022);作为 MME 创始成员持续提供患者匹配。产出指标:2004 年以来 4,000+ 篇相关论文(官网首页,截至 2026-09);迁移 EMBL-EBI 时宣布数据已被 3,000+ 篇出版物使用(EBI 公告)。可见性:2013 年即报告月独立访客 >10,000、来自 >90 国(Bragin 2014)。版本活跃度:2026 年内连续发布 v11.38(03-25)、v11.39(06-10)、v11.40(07-08),功能迭代节奏约每季度一次。

§8.7 生态快照

资源 类型 链接 推荐理由
官方主站 数据库入口 https://www.deciphergenomics.org/ 公开层查询、版本发布说明、致谢模板
About/统计页 元信息 https://deciphergenomics.org/about 规模口径与中心构成
数据共享页 协议入口 https://www.deciphergenomics.org/datasharing DAA/DDA 条款与申请流程
API 文档 技术文档 https://www.deciphergenomics.org/api-docs/patients-patient-id-patch JSON:API v1.0 端点与认证
FAIRsharing 记录 元登记 https://fairsharing.org/10.25504/FAIRsharing.l8Sf5x 许可与资助信息(WT077008 等)
EMBL-EBI 迁移公告 新闻 https://www.ebi.ac.uk/about/news/announcements/decipher-database-for-rare-diseases-joins-embl-ebi 托管沿革与规模快照
Firth 2009 奠基论文 https://pubmed.ncbi.nlm.nih.gov/19344873/ 平台设计的原始动机
Foreman 2023 年度综述 https://doi.org/10.1146/annurev-genom-102822-100509 官方推荐引用

§9 相关资源与引用

官方资源

资源 链接
主站(查询/发布说明) https://www.deciphergenomics.org/
About https://deciphergenomics.org/about
数据共享(DAA/DDA) https://www.deciphergenomics.org/datasharing
API 文档 https://www.deciphergenomics.org/api-docs/patients-patient-id-patch
FAIRsharing https://fairsharing.org/10.25504/FAIRsharing.l8Sf5x
EMBL-EBI 公告 https://www.ebi.ac.uk/about/news/announcements/decipher-database-for-rare-diseases-joins-embl-ebi
Sanger 创立报道 https://sanger.ac.uk/news_item/2009-04-16-deciphering-human-disease/
Ensembl https://www.ensembl.org/
UCSC Genome Browser https://genome.ucsc.edu/

配套标准与工具链

资产 用途 入口
HPO 本体 表型编码与语义计算 https://hpo.jax.org/
ACMG/AMP 分类框架 变异分类对齐 ClinGen/ACMG 官方文件
Matchmaker Exchange 患者匹配协议 https://www.matchmakerexchange.org/
Exomiser 表型驱动排序基线 Sanger/EBI 发布
Gene2Phenotype 基因-疾病策展对 https://www.ebi.ac.uk/gene2phenotype/
ClinVar 变异分类交叉验证 https://www.ncbi.nlm.nih.gov/clinvar/

BibTeX

@article{firth2009decipher,
  title   = {DECIPHER: Web-Based, Community Resource for Mapping, Evaluation of
             Balanced and Unbalanced Chromosome Abnormalities in Individuals
             with Developmental Disorders and Autism},
  author  = {Firth, Helen V. and Richards, Susan M. and Bevan, Andrew P. and
             Clayton, Stephen and Corpas, Manuel and Rajan, Diana and Van Vooren,
             Steven and Moreau, Yves and Pettett, Richard M. and Carter, Nigel P.},
  journal = {The American Journal of Human Genetics},
  volume  = {84},
  number  = {4},
  pages   = {524--533},
  year    = {2009},
  doi     = {10.1016/j.ajhg.2009.03.010}
}

@article{bragin2014decipher,
  title   = {DECIPHER: database for the interpretation of phenotypically
             linked chromosomal imbalances and pathogenic sequence variants},
  author  = {Bragin, Elmira and Chatzimichali, Elisabeth A. and Wright, Caroline F. and
             Hurles, Matthew E. and Firth, Helen V. and Bevan, Andrew P. and
             Swaminathan, Ganesh J.},
  journal = {Nucleic Acids Research},
  volume  = {42},
  number  = {D1},
  year    = {2014},
  note    = {PMID: 24150940}
}

@article{foreman2022decipher,
  title   = {DECIPHER: A community resource for the clinical interpretation of
             rare variants in developmental disorders},
  author  = {Foreman, Johanna and others},
  journal = {Human Mutation},
  year    = {2022},
  doi     = {10.1002/humu.24340}
}

@article{foreman2023decipher,
  title   = {DECIPHER: Community Resource for Clinical Interpretation of
             Rare Variants},
  author  = {Foreman, Johanna and others},
  journal = {Annual Review of Genomics and Human Genetics},
  volume  = {24},
  pages   = {151--176},
  year    = {2023},
  doi     = {10.1146/annurev-genom-102822-100509}
}

@article{wright2015genetic,
  title   = {Genetic diagnosis of developmental disorders in the DDD study:
             a scalable analysis of genome-wide sequence data},
  author  = {Wright, Caroline F. and others},
  journal = {Nature},
  volume  = {519},
  year    = {2015},
  doi     = {10.1038/nature14135}
}

@article{wright2015diagnosis,
  title   = {Genetic diagnosis of developmental disorders in the DDD study},
  author  = {Wright, Caroline F. and others},
  journal = {The Lancet},
  volume  = {385},
  number  = {9975},
  pages   = {1305--1314},
  year    = {2015}
}

@article{wright2023routine,
  title   = {Routine genomic testing of children with intellectual disability
             and other developmental disorders},
  author  = {Wright, Caroline F. and others},
  journal = {New England Journal of Medicine},
  year    = {2023},
  doi     = {10.1056/NEJMoa2209046}
}

引用政策:使用 DECIPHER 数据请引用官方推荐文献(Foreman 2023 年度综述,DOI 10.1146/annurev-genom-102822-100509)及所用数据的对应平台论文;正文必须包含官方致谢模板(“This study makes use of data generated by the DECIPHER community…”),注明 DECIPHER 由 EMBL-EBI 托管、Wellcome Trust 资助(grant WT223718/Z/21/Z);涉及具体患者/中心的发表须获得录入中心同意。

获取 FAQ

  • 问:不签任何协议能用多少数据? 答:公开层的网页浏览、查询与 TSV 导出无协议门槛;批量下载需 DAA(可视化另需 DDA),API 需 API Agreement。
  • 问:引用数以哪个口径为准? 答:平台奠基论文 Firth 2009 按 Google Scholar 2,263+(截至 2026-09);「使用 DECIPHER 的出版物」另有 4,000+ 篇(官网口径)与 >2,600 篇(Foreman 2022 发表时口径)两组数,引用时写明口径与日期。
  • 问:52,694 和 50,000+ 哪个大? 答:口径不同——52,694 是当前「同意广泛共享」的公开层患者数;50,000+ 是含中心私有层的累计上传病例数,两者不可直接相加或比较。
  • 问:能把 DECIPHER 当训练数据全量镜像吗? 答:官方声明 DECIPHER 不应作为主数据存储;批量获取走 DAA 且分发受协议约束,建议快照化自用而非公开镜像。
  • 问:坐标到底信哪个版本? 答:以记录自带 assembly 字段为准,分析前统一 liftover 到目标版本并保留原坐标(坑点 1)。

§10 AI 使用声明卡

§10.1 AI 模型使用

本条目撰写过程中使用大语言模型辅助整理文献事实、生成代码框架与统一术语;全部规模数字、日期、DOI 与协议条款均来自官方站点与已发表论文(检索时间 2026-09),经编辑部交叉核验。

§10.2 AI 参与范围

AI 参与了:事实抽取与归类(依据 FACTS 事实清单)、章节初稿生成、代码示例起草、JSON-LD 序列化。AI 未参与:数据真实性裁定、评分最终决定(DAIMS 17.5/24 经编辑部复核)与合规性判断。

§10.3 输入来源

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景(ICD-11 映射、疾病简介、金标准) 千方病案医学编辑部 交叉审核(ICD-11 编码经 WHO 官方浏览器核对) ✅ 已通过
§3 数据集规格(规模口径、版本矩阵、时间轴) 千方病案医学编辑部 与官网首页/About 页/Foreman 2022 交叉比对 ✅ 已验证
§4 数据结构(层级、字段字典、缺失语义) 千方病案医学编辑部 与 API 文档及导出形态交叉比对 ✅ 已验证
§5 数据划分策略 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与八个坑点 千方病案医学编辑部 逻辑审查 + 与官方文档/协议条款比对 ✅ 已通过
§7 质量评估与 DAIMS 评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 生态与引用数表述 千方病案医学编辑部 与 Google Scholar 快照及官网口径交叉比对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。

§10.6 最后审核

最后一次人工审核日期:2026-09-18

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • clingen — 共享标签:基因组学与多组学 / 测序数据 / 变异与注释 / 罕见病
  • clinvar — 共享标签:基因组学与多组学 / 变异与注释 / 罕见病
  • dbsnp — 共享标签:基因组学与多组学 / 测序数据 / 变异与注释
  • ensembl — 共享标签:基因组学与多组学 / 测序数据 / 变异与注释
  • gnomad — 共享标签:基因组学与多组学 / 变异与注释 / 罕见病
  • hpo — 共享标签:基因组学与多组学 / 变异与注释 / 罕见病
  • gnomad — 共享标签:基因组学与多组学 / 测序数据
  • uniprot — 共享标签:基因组学与多组学 / 测序数据
  • 1000-genomes — 共享标签:基因组学与多组学 / 测序数据
  • encode — 共享标签:基因组学与多组学 / 测序数据

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集