DisGeNET — 基因-疾病关联综合数据库 AI-Ready Wikipedia

113 万+基因-疾病关联,覆盖 21,671 个基因与 30,170 种疾病

来源 name: "GRIB-IMIM/UPF(Barcelona);2020 年起 MedBioinformatics Solutions SL" url: "https://www.disgenet.com/"发布时间: 2026-09-16最后更新: 2026-09-25 阅读 32
DisGeNET — 基因-疾病关联综合数据库 AI-Ready Wikipedia

信息速览

数据集名称DisGeNET — 基因-疾病关联综合数据库 AI-Ready Wikipedia
数据类型["约 113.5 万条 GDA(v7.0)", "30,170 种疾病与性状", "21,671 个基因", "36.9 万条 VDA", "TSV/RDF/API 格式"]
规模无患者级数据;v7.0 覆盖 21,671 基因 / 30,170 疾病 / 194,515 变体
接入方式name: "GRIB-IMIM/UPF(Barcelona);2020 年起 MedBioinformatics Solutions SL" url: "https://www.disgenet.com/"
AI 就绪度

数据集封面

DisGeNET — 基因-疾病关联综合数据库 AI-Ready Wikipedia


INFOBOX

字段 内容
数据集名称 DisGeNET
英文全称 DisGeNET(DisGeNET:Diseases & Genes Network)
别名/简称 DISGENET(2024 年平台统一后的大写品牌写法);DisGeNET-RDF
疾病分类(ICD-11) 覆盖全疾病谱(ICD-11 各章病种,经 UMLS CUI 桥接映射)
SNOMED CT 经 UMLS Metathesaurus 与 SNOMED CT 词汇互连
数据模态 基因-疾病关联知识数据(文本挖掘 + GWAS + 专家策展 + 动物模型整合)
AI 任务类型 疾病基因优先级排序、靶点发现、疾病相似性/共病分析、富集分析、文本挖掘评估
样本总数 1,134,942 条 GDA + 369,554 条 VDA(v7.0)
数据大小 RDF v7.0.0 共 99,057,987 三元组;GDA 主表 1,134,942 行
数据格式 TSV/Excel(平台导出)、RDF/Turtle(v7.0)、REST API(JSON)
许可证 专有许可(免费学术许可 / 商业订阅);DisGeNET-RDF v7.0 为 ODC-ODbL
访问级别 注册后开放(免费学术计划仅 curated 数据;全库需商业订阅)
语言 英语(关联证据来自英文文献与数据库)
首发日期 2010 年(Cytoscape 插件版)
最后更新 季度更新(截至 2026-09,最新发布 v26.2)
发布机构 GRIB-IMIM/UPF(Barcelona);2020 年起 MedBioinformatics Solutions SL
官方主页 disgenet.com
下载地址 平台导出;RDF 端点
DOI 10.1093/nar/gkz1021
引用次数 5,500+(官方披露);第三方聚合口径 8,500+(截至 2026-03)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 结构化 TSV/API + 评分过滤开箱即用;扣分项:无官方 ML 划分、免费学术计划不可下载全库、跨版本口径漂移需自行对齐
页面状态 published

§0 E-E-A-T 审核与免责

本页面由千方病案医学编辑部组织生产。医学审核:千方病案医学编辑部交叉审核 §2 医学背景(疾病分类映射、临床任务定义、临床价值)。数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 数据结构与 DAIMS 字段字典、§5 数据划分策略、§6 预处理 Pipeline 与坑点。审核日期:2026-09-05。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。DisGeNET 采用专有许可体系:免费学术许可仅限非营利学术用途且仅提供 curated 数据,全库访问与任何商业用途需购买商业订阅;官方明令禁止再分发或转售数据库全部或任何部分。使用经 UMLS Metathesaurus 标注的疾病概念时,还须遵守 NLM UMLS 许可协议。具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? DisGeNET 是一张把"哪个基因和哪种疾病有关"系统化整理出来的巨型关系网。它把散落在专家策展数据库(如 UniProt、ClinVar、Orphanet)、GWAS 目录、动物模型数据库和数百万篇科学论文里的证据,统一抽成"基因-疾病关联"(GDA)条目:经典快照 v7.0 收录 1,134,942 条 GDA,连接 21,671 个基因与 30,170 种疾病、性状和异常表型,每条关联都带一个 0 到 1 的证据评分和可回溯的文献出处。

为什么重要? 药物研发最贵的一步是"选错靶点"。要判断一个基因值不值得追,研究者需要把散落在上千篇论文、十几个数据库里的证据一次看全——这正是人工阅读做不到、文本挖掘可以规模化的工作。DisGeNET 是该领域被引用最广的综合资源之一(官方披露 5,500+ 篇学术出版物引用),2018 年被欧洲基础设施 ELIXIR 列为推荐互操作资源。

我能用它做什么? 给一批基因列表(如某个转录组的差异表达基因)做疾病富集分析;为某个疾病优先排序候选基因;把你的文本挖掘系统抽取结果和它对答案;构建疾病相似性网络研究共病;或者作为知识图谱,供大模型与图神经网络做靶点假设生成。注意:它是"证据聚合",不是"临床结论"。

§1.1 技术摘要

DisGeNET 的核心工程问题是异构证据的统一:不同来源用不同命名体系、不同粒度、不同强度陈述"关联"。其解决方案分四层。第一层是证据整合:GDA 证据源分为 Curated(UniProt、ClinVar、Orphanet、PsyGeNET、CLINGEN、GENCC 等专家策展库)、Inferred(GWASCAT、FINNGEN、UKBIOBANK、HPO、PHEWASCAT、CHEMBL 等推断型来源)、Animal models(MGD 小鼠、RGD 大鼠)与 Literature(对 PubMed 文献的命名实体识别与归一化文本挖掘)四类。第二层是标识符标准化:基因统一映射到 NCBI Entrez Gene ID,疾病统一映射到 UMLS CUI,关联关系归入自建的 DisGeNET 关联类型本体(Biomarker、Therapeutic 等大类及其细分)。第三层是证据量化:每条 GDA 赋予 0-1 的 DISGENET 评分(五组件加权和:curated ≤0.70、临床试验 ≤0.10、inferred ≤0.25、动物模型 ≤0.10、文献 ≤0.40),并配套 DSI(疾病特异性指数)、DPI(疾病多效性指数)与 EI(证据一致性指数)。第四层是访问通道:Web 界面、REST API、R 包 disgenet2r、Cytoscape App 与 RDF 端点并行。经典快照 v7.0 含 1,134,942 条 GDA 与 369,554 条 VDA;当前订阅版按季度更新(截至 2026-09 为 v26.2,GDA 已达 2.1M 规模口径,官方文档)。

§1.2 战略价值

维度一:靶点发现与药物研发的"先验证据底座"。 在药物研发管线里,靶点选择的错误代价极高。DisGeNET 把一个基因相关的全部疾病证据(含动物模型与文献线索)按强度排好序,使靶点候选评估从"逐篇读文献"变成"按评分过滤 + 溯源抽查"。对已上市药物,其靶点基因关联的疾病谱还能反向提示重定位(repurposing)机会。对于以 Inferred 类来源(GWAS 目录等)为主的证据,评分体系又区分了"统计关联"与"专家确认",避免把全基因组显著位点直接当作成熟靶点结论。

维度二:生物医学 NLP 与知识图谱工程的事实标准参照系。 DisGeNET 的文本挖掘管道本身就是生物医学 NER 与实体归一化的大规模应用案例(2025 年发布的 v25.2 换用平均 F1 为 0.88 的新 NER 模型,官方文档),其 UMLS CUI 归一化策略、关联类型本体与证据评分设计,是构建任何"文献驱动知识图谱"时最常被对标的参照。对 AI 工程师而言,它既是训练数据源(如疾病基因预测模型的弱监督标签),又是评估标尺(用 curated 子集检验自动抽取系统的精度)。这种"数据 + 评估"双重角色在同类资源中并不多见。

维度三:学术-商业双轨运营的成熟样板。 DisGeNET 的许可架构(免费学术层仅 curated、商业订阅解锁全库、RDF 快照以 ODC-ODbL 开放)展示了生物医学知识库在"可持续运营"与"学术可及"之间的完整折中方案。对国内团队而言,其价值在于:接入前就能从公开 FAQ 明确知道自己能拿到什么、不能拿什么、能发表什么——这种许可透明度本身就是稀缺的工程友好特性,避免了"先下载后合规"的经典翻车路径。

§1.3 同类数据集横向对比

数据集 整合来源 覆盖范围 标注性质 与 DisGeNET 的差异
DisGeNET 策展库 + GWAS + 动物模型 + 文本挖掘 全疾病谱(基因/变体/化学品维度) 证据评分 + 关联类型本体 + 溯源 PMID 本体统一到 UMLS CUI,评分体系成熟,访问分学术/商业双轨
Open Targets Platform 遗传学证据、体细胞突变、药物、表达、通路等 靶点-疾病对(药物研发导向) 按证据类加权的关联总评 更聚焦靶点优先级流程化;DisGeNET 保留更细的溯源文献与关联类型语义
CTD(Comparative Toxicogenomics) 策展 + 文本挖掘 化学-基因、化学-疾病、基因-疾病 人工策展 + 文本挖掘标记 侧重环境化学品毒理维度;DisGeNET 疾病谱更广且带统一评分
ClinVar 提交者申报 + 专家评审 临床意义明确的变异-疾病 星级临床审定 只收临床级变异解释;DisGeNET 覆盖研究级证据并整合 ClinVar
GWAS Catalog 文献策展的 GWAS 统计 SNP-性状关联(p 值阈值) 文献统计量 只收 GWAS 结果;DisGeNET 把 GWAS 作为 Inferred 证据之一并跨源融合

§1.4 版本时间轴

版本/事件 年份 关键数字与变化
Cytoscape 插件首发 2010 以网络可视化插件形态发布,首次提出 GDA 整合框架(Bauer-Mehren et al., 2010)
Database 平台论文 2015 演进为 Web 平台 + REST API + R 包;约 380,000+ GDA、16,000+ 基因、13,000+ 疾病(Piñero et al., 2015)
NAR 首篇数据库专刊论文 2016 整合框架与指标体系正式化(NAR 45:D833-D839)
v4.0 2017 重大扩展:整合 GWAS 目录与动物模型,引入 VDA 数据层
ELIXIR 推荐资源 2018 被欧洲生命科学基础设施 ELIXIR 列为 Recommended Interoperability Resource
v6.0 / NAR 2019 更新论文 2019 论文摘要口径:24,000+ 疾病与性状、17,000 基因、117,000 基因组变异(PMID 31680165)
v7.0(经典公开快照) 2020 前后 1,134,942 GDA(21,671 基因 × 30,170 疾病)+ 369,554 VDA;DisGeNET-RDF v7.0.0 共 99,057,987 三元组(Cytoscape App 论文, 2021)
MedBioinformatics 成立 2020 商业化主体确立,freemium 双轨模式起步;平台用户超 130,000
平台统一 disgenet.com 2024-2025 disgenet.org 与 DISGENET plus 合并为统一平台;学术免费计划只含 curated 数据
v25.2 → v25.4 → v26.2 2025-2026 GDA 2.0M→2.1M,VDA 4.4M→4.8M,出版物 1.6M-1.7M;新 NER(F1 0.88)、My Score、Historical Score、AIDA 助手、MCP Connector(官方文档)

§1.5 典型应用场景

  1. 疾病候选基因优先级排序:以高评分 curated GDA 为正样本、未关联基因为负样本,训练排序模型并按 DISGENET 评分分层验证。入口特征建议直接使用 DSI/DPI/source 构成/n_pmids;评估务必按基因分组划分(§5.3),否则结果虚高到不可用。
  2. 基因列表疾病富集分析:对转录组/蛋白组差异基因列表做疾病维度富集,官方 Web 与 disgenet2r 均内置富集功能(v25.4 增强了可视化导出)。背景集合的选择决定结论:以全库基因为背景 vs 以"至少有一条 curated 关联"的基因为背景,得到的富集疾病列表可能截然不同,务必写明背景定义。
  3. 文本挖掘系统评估:将自建 NER/关系抽取系统输出与 curated 子集对照,估计精度与召回边界。注意 curated 子集是"金标偏低估"——策展滞后意味着系统正确抽取的新发现会被误判为假阳性,误差应分时间片报告。
  4. 疾病相似性与共病网络:利用 DDA(两疾病共享基因/变体,附 Jaccard 指数与 P 值)构建疾病网络,研究共病分子基础。共享基因的质量应加权(只数 curated 共享基因与数全部共享基因会给出两张不同的网络),P 值解释需考虑多重检验。
  5. 药物重定位假设生成:结合化学品-靶点数据,在"药物-靶点基因-疾病"图上枚举重定位候选,再回溯文献证据链核查。临床试验注释属于付费层(§3.5),免费层做重定位必须显式声明未纳入临床试验证据。
  6. LLM 知识注入与 Agent 工具:把高分 GDA 子集作为检索库供 RAG 问答引用,或经 MCP Connector 形态的思路把检索封装为 Agent 工具。生成答案必须带 PMID 溯源(§3.10),无溯源的关联陈述不应进入面向用户的输出。

§2 医学背景

§2.1 疾病分类与 ICD-11 映射

DisGeNET 不限定疾病类型,覆盖从单基因罕见病到常见复杂疾病的全疾病谱。疾病概念统一以 UMLS CUI 表示,可经 UMLS Metathesaurus 桥接至 ICD-11 与 SNOMED CT。下表以本词条代码示例反复使用的代表性病种展示映射关系(编码为公开标准术语编码):

疾病标签 ICD-11 编码 中文名 DisGeNET CUI
Type 2 diabetes mellitus 5A11 2 型糖尿病 C0011860
Alzheimer disease 8A20 阿尔茨海默病 C0002395
Breast carcinoma 2C60 乳腺癌 C0006142
Duchenne muscular dystrophy 8C70.0 杜氏肌营养不良 C0013264
Asthma CA23 哮喘 C0004096

映射方法说明:UMLS CUI 是"中转枢纽"——DisGeNET 只承诺 GDA 挂在 CUI 上,CUI 与 ICD-11/SNOMED CT 的对应关系由 UMLS Metathesaurus 提供。同一临床实体在不同 ontology 中粒度不同(例如 ICD-11 的 5A11 含分型细节,而 umbrella CUI 只到"2 型糖尿病"层级),下游分析合并数据前必须核查粒度一致性。

§2.1b SNOMED CT 映射

疾病标签 ICD-11 SNOMED CT 术语说明
Type 2 diabetes mellitus 5A11 44054006 Diabetes mellitus type 2( disorder)
Alzheimer disease 8A20 26929004 Alzheimer’s disease( disorder)
Breast carcinoma 2C60 254837009 Primary malignant neoplasm of breast
Duchenne muscular dystrophy 8C70.0 353295003 Duchenne muscular dystrophy( disorder)
Asthma CA23 195967001 Asthma( disorder)

使用 SNOMED 码时注意:DisGeNET 原生标识是 CUI,SNOMED 码由 UMLS 映射层间接获得,跨库联合分析时应以 UMLS 最新映射为准,而非硬编码上表。

§2.2 疾病谱系与流行病学背景

DisGeNET 的疾病覆盖来自四个互补面。面一:罕见病与孟德尔病——来自 Orphanet、ClinVar、CLINGEN 等策展库,此类病种基因-疾病关系明确(一个致病基因往往对应一组综合征特征),是 curated 子集质量最高的部分;NAR 2019 论文以杜氏肌营养不良(DMD)为例展示了罕见病覆盖:DisGeNET 将 350 个 DMD 基因变异注释到该病,其中多数为 stop-gained 功能缺失变异(PMID 31680165)。面二:常见复杂疾病——来自 GWAS Catalog、FINNGEN、UKBIOBANK 等统计遗传来源,关联以全基因组显著性统计为依据,单个位点效应量小、多位点累积。面三:精神与神经疾病——PsyGeNET 专库策展精神类药物-基因-疾病证据。面四:文献长尾——文本挖掘从 PubMed 捕捉策展库未及覆盖的新发现,也是噪声的主要来源。

从 UMLS 语义类型看,30,170 个疾病概念并非同质,建模前应认识以下主要类型面:

UMLS 语义类型面 典型形态 对建模的含义
Disease or Syndrome 明确疾病实体(如 2 型糖尿病、马凡综合征) 分类的主体对象,curated 覆盖最全
Neoplastic Process 肿瘤性疾病(如黑色素瘤、胶质瘤) 亚型命名繁杂,CUI 粒度需人工核对
Mental or Behavioral Dysfunction 精神/行为障碍(如重度抑郁、自闭症谱系) PsyGeNET 来源密集,诊断边界本身在演变
Sign or Symptom / 表型 症状与异常表型(如心律失常、HPO 词条) 与疾病实体混在同一 CUI 空间,勿等同为"病"
group / umbrella 概念 综合征级与病组概念(如"心肌病"组) 粒度不均:与具体病种概念存在层级包含关系

从流行病学视角,数据库疾病谱天然偏向研究热度:常见病与高收入国家高发疾病文献多、证据密;被忽视热带病与低资源地区疾病证据稀疏,使用时应意识到这种"文献流行病学"偏差。

§2.3 临床任务定义

临床任务 在 DisGeNET 上的形态 关键指标 证据要求
疾病基因发现(筛查级) 对疾病 CUI 排序关联基因 Hit@k、MRR 高评分 curated + 多源一致才可作假设
靶点选择支持 评估基因的疾病证据强度与类型分布 评分分层、关联类型构成 需 Therapeutic/Biomarker 类型细分核查
药物重定位假设 药物靶点基因的疾病谱反查 富集显著性 临床试验注释(付费层)交叉验证
共病机制研究 DDA 网络(Jaccard + P 值) 共享基因/变体数量与质量 高评分共享基因才具解释力
变异解读支持 VDA 评分与后果类型(VEP 注释) 证据分与文献数 临床级结论必须回到 ClinVar 星级

需要强调:上述任务均为研究性任务。DisGeNET 的关联不等于因果,文本挖掘条目更不等同于专家确认;任何临床落地都必须回溯原始文献并经专家策展流程。

各任务对证据层与许可层的依赖矩阵(动手前自查):

任务 必需证据层 免费学术计划可行性 关键缺口
疾病基因发现 Curated + Literature 交叉 可行(仅 curated 可全量检索,literature 仅少量) 缺 literature 层时召回边界评估受限
靶点选择支持 Curated 为主 可行 临床试验注释缺失,需人工补查
药物重定位 Clinical Trials + 化学品数据 受限(付费层内容) 免费层结论只能到"假设"级
共病机制研究 DDA + Curated 受限(DDA 为订阅版内容) 可用共享 curated 基因自建小型 DDA 替代
变异解读支持 VDA curated 层 部分可行 需与 ClinVar 原库交叉核对

§2.4 实体覆盖(患者人群表的数据库对应形态)

DisGeNET 不含患者级数据,传统"患者人群表"在此转换为实体覆盖表(v7.0 口径):

维度 覆盖值 来源构成
基因 21,671 个 >80% 编码蛋白(近 14,000 个),覆盖约 70% 人类蛋白编码基因的疾病注释
疾病/性状/表型 30,170 种 全疾病谱:罕见病、常见病、症状、异常表型
变异 194,515 个 策展库 + 文献挖掘,VEP 后果注释
关联(GDA) 1,134,942 条 Curated / Animal models / Inferred / Literature 四源
关联(VDA) 369,554 条 Curated + Literature 两源
支持文献 PubMed 收录,逐条溯源 评分计算依赖支持文献数量

使用此表的提醒:上述是"实体覆盖"而非"实体质量"——21,671 个基因中既有证据密集的明星基因也有仅一条文献支撑的长尾基因,任何以"覆盖率"为分母的指标都应先明确证据质量门槛(如"score ≥ 0.3 的关联覆盖了多少基因"),否则覆盖率会被低质长尾灌水。

§2.5 临床价值与边界

DisGeNET 的临床价值体现在知识组织层而非决策层。价值一:把"某基因是否与某病有关"从模糊记忆变成带评分的显式记录,帮助临床遗传学团队在变异解读时快速汇集背景证据(但临床分级须回到 ACMG 框架与 ClinVar)。价值二:为临床试验靶点提供跨源证据全景,减少单一来源盲区。价值三:罕见病诊断中,罕见的基因-疾病对在文献中往往只有一两篇报道,DisGeNET 把这类长尾证据集中可查(官方用户反馈即来自罕见病变异检索场景,disgenet.com)。边界同样清晰:curated 之外的关联未经专家逐一确认;评分不构成临床证据等级;UMLS 概念合并可能让两种临床不同的病共享一个 CUI,临床使用必须逐条溯源。

§2.6 金标准/参考标准

DisGeNET 没有"官方划分"意义上的金标准标签(见 §5.1);其"金标准"是证据层级——不同来源层与专家确认程度天然构成一个可信度金字塔。下游做评测时,应以最高层作为阳性参考、以层级一致作为弱金标。各层性质如下:

数据来源 记录方式 产生者 金标准性质
Curated 层(UNIPROT/CLINVAR/ORPHANET/PSYGENET/CLINGEN/GENCC/CLINPGX/MGD HUMAN/RGD HUMAN) 领域专家逐篇审阅文献后人工写入,附证据文本 上游策展库的专家团队(如 ClinVar 提交者、Orphanet 专家小组) 最接近金标准:专家确认,但各库标准不完全一致,且存在策展滞后
Clinical Trials 层(CLINICALTRIALS) 临床试验干预-基因-疾病的映射 ClinicalTrials.gov 提交者 + 自动映射 强提示性:进入临床干预阶段是强间接证据,非因果关系证明
Inferred 层(GWASCAT/FINNGEN/UKBIOBANK/HPO/PHEWASCAT/CHEMBL) 显著性阈值筛选位点后映射到基因与疾病概念 统计流程自动产生 统计关联标准:受祖先构成与多重检验校正策略影响
Models 层(MGD MOUSE/RGD RAT) 模式生物实验表型与人类疾病的直系同源映射 MGD/RGD 策展者 跨物种外推标准:对人类结论有参考价值但不可直接等同
Literature 层(TEXTMINING HUMAN/MODELS) NER + 归一化自动抽取关联陈述,附文献摘录 自动管道(v25.2 起 NER 平均 F1 = 0.88) 弱金标:噪声最高,仅可作为假设生成素材

推荐的评测金标构建规则:以"Curated 层 ∩ 多源一致(≥2 个证据源)"为高置信阳性集,以"仅 Literature 层且 score < 0.1 且 n_of_pmids = 1"为典型负例素材(而非确定负例——缺乏记录不等于无关联);任何以未收录关联为负样本的设计,都必须按 §7.1 文献热度偏倚做分层,否则模型只学会复现研究热度。


§3 数据集规格

§3.0 版本抉择矩阵

DisGeNET 的"版本"横跨两条产品线:社区可得的经典快照(v7.0 系列)与订阅制季度更新(v24-v26 系列)。动手前先按下表对号入座:

你的需求 推荐版本 获取方式 理由
教学、原型验证、方法对比 v7.0 社区快照(TSV/RDF) 学术免费计划平台导出 curated 部分;RDF v7.0.0 经 rdf.disgenet.org 1,134,942 GDA 完整可溯源,论文复现基准最常用
跟踪最新文献、富集分析 v26.x 订阅版 免费学术计划(仅 curated)或学术订阅 季度更新,NER F1 0.88,含 My Score/Historical Score
全库文本挖掘数据(GDA+VDA 全量) v25.4+ 订阅版 Standard/Advanced 商业或学术付费计划 免费学术计划不含文本挖掘数据,需付费层
图数据库/Linked Data 集成 DisGeNET-RDF v7.0.0 rdf.disgenet.org 99,057,987 三元组,SPARQL 可查,ODC-ODbL 许可
药物-靶点-疾病联合分析 v25.4+(含 12K 化学品) 付费计划 免费层缺 ChemBL 化学品与临床试验注释

§3.1 模态详情

DisGeNET 是"关联知识型"数据集,其"模态"是经过本体统一的多元证据整合层,而非原始测序/影像信号:

  • GDA 层(核心):基因-疾病关联,v7.0 共 1,134,942 条。证据源四类:Curated(UNIPROT、CLINVAR、ORPHANET、PSYGENET、CLINGEN、GENCC、CLINPGX、MGD HUMAN、RGD HUMAN)、Clinical Trials(CLINICALTRIALS)、Inferred(GWASCAT、FINNGEN、UKBIOBANK、HPO、PHEWASCAT、CHEMBL)、Models(MGD MOUSE、RGD RAT)与 Literature(TEXTMINING HUMAN、TEXTMINING MODELS)(官方指标文档)。
  • VDA 层:变体-疾病关联,v7.0 共 369,554 条(194,515 个变体 × 14,155 种疾病),变异后果类型取自 Ensembl VEP。
  • DDA 层:疾病-疾病关联,由共享基因/变体推导,附 Jaccard 指数与 P 值;订阅版已达 28.1M 规模。
  • 证据层:每条关联的支持文献列表(PMID)与文献文本摘录,构成可溯源的证据链。

GDA 评分(SGDA)由五个证据组件加权求和,各组件上限直接决定了每层的"最高可达信度",是理解整个数据集证据结构的最短路径:

证据组件 来源库 分量上限 结构含义
Curated CLINGEN、CLINPGX、CLINVAR、GENCC、MGD HUMAN、RGD HUMAN、ORPHANET、PSYGENET、UNIPROT ≤ 0.70 专家策展是评分的主导来源,封顶 70%
Clinical Trials CLINICALTRIALS ≤ 0.10 临床试验注释为补充信号
Inferred FINNGEN、GWASCAT、HPO、PHEWASCAT、UKBIOBANK、CHEMBL ≤ 0.25 统计推断证据中等权重
Models MGD MOUSE、RGD RAT ≤ 0.10 动物模型证据单独设上限
Literature TEXTMINING HUMAN、TEXTMINING MODELS ≤ 0.40 文本挖掘可叠加至接近半分,但无法单独到达高分

两点评注:其一,任何 score ≥ 0.7 的关联必然含 curated 分量,这使"score 阈值过滤"与"curated 过滤"在高分段近似等价,而在 0.3-0.6 区间则完全不等价——后者可能由多源叠加构成;其二,VDA 的评分构成不同(Curated ≤0.70 + Biobank ≤0.20 + Literature ≤0.40,Biobank 源为 FINNGEN/UKBIOBANK),把 GDA 阈值直接搬到 VDA 上是常见错误(见 §6.5 坑点 3)。

§3.2 按子集的规模明细

子集 v7.0 规模 说明
全部 GDA(ALL) 1,134,942 四源合并后去重
Curated GDA 官方未单独公开行数 以 UNIPROT/CLINVAR/ORPHANET 等为源,评分上限最高(≤0.70 分量 + 其他分量)
文本挖掘 GDA 官方未单独公开行数 占全库大多数,评分上限受 Literature 分量 ≤0.40 约束
全部 VDA 369,554 194,515 变体 × 14,155 疾病
RDF 三元组 99,057,987 Turtle 序列化,GDA + VDA + 元数据 + 外部链接
订阅版当前规模 GDA 2.1M;VDA 4.8M;DDA 28.1M v25.4 口径,官方文档

跨版本对照(引用规模数字时的"版本-年份-数字"三件套):

版本 公开口径 数字
2015 平台版(v2.1 时期) GDA 380,000+(16,000+ 基因、13,000+ 疾病)
v6 时期(NAR 2019 摘要) 疾病/基因/变异 24,000+ 疾病与性状、17,000 基因、117,000 基因组变异
v7.0(经典快照) GDA / VDA 1,134,942 / 369,554
v25.2(订阅版) GDA / VDA / 出版物 2.0M / 4.4M(1.4M 变体)/ 1.7M
v25.4(订阅版) GDA / VDA / DDA / 出版物 2.1M / 4.8M(1.7M 变体)/ 28.1M / 1.6M
官网首页(2026-09 检索) 证据/疾病/基因/变体/DDA 13.3M+ 证据、38.2K+ 疾病、30.4K+ 疾病基因、1.7M+ 疾病变体、24.4M+ DDA

同一时点不同口径的数字可相差一个数量级(如"证据数 13.3M"vs"GDA 2.1M"——前者计文献级证据、后者计归一化后的关联)。写论文、写需求文档、写评测报告时,先写版本与口径,再写数字。

§3.3 数据格式

格式 载体 适用场景
TSV/Excel 平台检索结果导出、API 响应落盘 pandas/R 快速加载,团队内二次分发受限(见许可证)
RDF/Turtle DisGeNET-RDF v7.0.0 SPARQL 查询、Linked Data 融合、图数据库导入
JSON REST API(v1.9.3) 程序化增量获取、流水线集成
Cytoscape 会话 Cytoscape App v8.4 网络可视化与交互分析
R 对象 disgenet2r v1.2.4 R 生态富集分析与评分计算

§3.4 存储大小

RDF 全量 v7.0.0 为 99,057,987 三元组(Turtle 文本);GDA 主表 1,134,942 行、VDA 主表 369,554 行。TSV 文本体量随导出范围变化:curated 子集导出通常在数十 MB 量级,全库导出属于付费计划范围(官方未公开精确文件体积,本词条不给出未核实数字)。本地工作区建议预留 2-5 GB 空间,用于存放多轮导出、中间表与图数据库索引。

落盘工程建议:其一,API 分页导出后立即固化原始 TSV 并写版本清单(版本号 + 导出日期 + 查询参数),因为平台季度更新后同参数重跑会得到不同行集;其二,分析用副本建议转 Parquet/DuckDB——百万行级 TSV 在 pandas 反复全表扫描时内存与耗时都不友好,而按 diseaseType 或 source 列做分区裁剪后,探索效率显著提升;其三,文本摘录字段(evidence 相关)与数值主表分开存放,避免主表加载时被长文本拖慢;其四,禁止把导出副本再分发给无相应许可的第三方(许可条款覆盖"数据库的任何部分",见 §6.2)。

§3.5 标注方式

DisGeNET 的"标注"是证据聚合,按来源性质分三档:

  1. 专家策展(人工):UniProt、ClinVar、Orphanet、PsyGeNET、CLINGEN、GENCC 等来源中,领域专家逐条审阅文献后写入,质量最高、数量有限。
  2. 统计推断(自动):GWAS Catalog、FINNGEN、UKBIOBANK、PHEWASCAT 等以全基因组显著性阈值筛选位点,再映射到基因与疾病概念。
  3. 文本挖掘(自动):命名实体识别 + 归一化从 PubMed 抽取关联陈述;v25.2 起使用平均 F1 0.88 的 NER 模型并引入基于嵌入词典的归一化。证据摘录逐条保留,可人工复核。

§3.6 标注者资质与一致性

上游策展库各自维护专家资质(如 ClinVar 的提交者星级与 ORPHANET 的专家小组),DisGeNET 在整合层不重复评审,而是通过评分权重体现来源可信度(curated 分量 ≤0.70,文本挖掘分量 ≤0.40)。文本挖掘层的一致性以 NER/归一化 F1 度量(v25.2 为 0.88,官方口径),v7.0 时期的管道精度未以单一数字公开,使用旧快照时应默认其文本挖掘子集含更多同义词歧义残留。

由此产生一个使用义务:当你的应用把 curated 与 literature 条目混排时,"标注者是谁"在行级就体现在 source 字段里——下游应把 source 展开为独立特征或分层键,而不是把整库当成"同一标注体系"处理。跨库一致性冲突(如两个策展库对同一基因-疾病对给出不同关联类型)在整合层以多条目并存表达,聚合去重时保留类型明细比强行合并更安全。

§3.7 采集与更新周期

平台自 2010 年起持续运行;2020 年确立季度更新节奏,v25.2、v25.4、v26.2 依次发布(截至 2026-09)。每次季度更新会同步刷新所有数据源并调整评分基数——这意味着同一条 GDA 的评分会随版本漂移,版本号必须与分析结果一起存档。

团队级的版本管理建议:把"数据版本"当作与"代码版本"同级的发布物管理——每季度更新时打数据 tag(含版本号、下载日期、行数指纹),CI 中用指纹校验防止"代码说用 v7.0、数据目录里躺着 v26.2"的静默漂移;跨版本重跑实验前,先 diff 上一版与当前版的核心统计(行数、评分分布、curated 占比),差异巨大时优先排查 UMLS 与上游策展库变更。

§3.8 地域覆盖

数据源为全球文献与数据库,无地理限定。但两个隐性地理偏差需注意:GWAS 队列(UKBIOBANK、FINNGEN)以欧洲血统人群为主,祖先多样性不足;文献覆盖偏向研究产出高的国家与地区。

对面向中国人群的应用,这意味着三点:其一,直接套用欧洲队列衍生的 Inferred 证据做人群风险推断需谨慎标注局限;其二,中文文献与本土队列(如中国人群 GWAS)产出的证据不在库内,重要场景应另行接入本土资源补齐;其三,疾病命名习惯差异(同一疾病的中英文别称体系)在实体对齐时需要专门处理,不能默认 UMLS 覆盖所有中文临床表述。

§3.9 设备规格

不适用。DisGeNET 是关联知识数据库,不含传感器、影像设备或采集仪器的硬件维度;变体后果注释由软件工具(Ensembl VEP)生成,不涉及设备记录字段。若下游应用把 VEP 注释当作"仪器输出"级别的客观测量使用需注意:VEP 版本与其转录本集合会影响后果分类结果,做变异层严格分析时应记录 VEP 版本号(随 DISGENET 版本说明获取)。

§3.10 深度溯源链

每条关联携带四段式溯源:源 1——original source 字段标注原始来源库(如 ClinVar、UniProt);源 2——支持文献的 PMID 列表与数量;源 3——文献中表达该关联的文本摘录;源 4——关联类型本体标签与评分构成。该设计使任何一条 GDA 都可以回溯到"谁在什么文献里说了什么",是 DisGeNET 区别于纯统计聚合库的核心竞争力,也是下游做可信 AI(可解释排序)时的关键依赖。

工程上的用法建议:把四段溯源编译成一个"证据卡片"结构(来源分层、文献数、摘录片段、类型与评分),排序系统的输出页直接挂卡片而非裸分数;摘要字段是长文本,检索与展示分层处理(索引用 PMID 与关键词,展示才取全文)。另外,溯源链本身可作为训练信号——n_pmids、来源构成与 EI 的组合,比单一 score 更能刻画"这条关联有几分可信、可信在哪"。


§4 数据结构

§4.0 本地工作目录树

DisGeNET 无单一压缩包形态;下面给出以"平台/API 导出 + RDF 端点"构成的推荐本地工作目录树(data_root 为你自己设定的根路径):

data_root/
├── raw/
│   ├── tsv/                          # 平台或 API 导出的 TSV(含检索日期与版本号命名)
│   │   ├── disgenet_v7.0_gda_all_2026-09-16.tsv
│   │   ├── disgenet_v7.0_gda_curated_2026-09-16.tsv
│   │   └── disgenet_v7.0_vda_all_2026-09-16.tsv
│   ├── rdf/                          # DisGeNET-RDF v7.0.0(如走 Linked Data 路线)
│   │   └── disgenet_rdf_v7.0.0.ttl
│   └── api/                          # REST API 增量拉取的 JSON
│       └── api_v1.9.3/
├── interim/
│   ├── gda_dedup.parquet             # 同一 (geneId, diseaseId) 多源聚合后
│   └── cui_smores_bridge.parquet     # CUI → ICD-11/SNOMED 桥接表
├── processed/
│   ├── splits/
│   │   ├── gene_group_train.parquet  # 按基因分组的划分(见 §5)
│   │   ├── gene_group_val.parquet
│   │   └── gene_group_test.parquet
│   └── features/
│       └── gene_dsi_dpi.parquet      # 基因级 DSI/DPI 特征
└── meta/
    ├── FACTS.md                      # 版本号、下载日期、评分分布快照
    └── score_histogram.png

关键约定:文件名内嵌版本号与下载日期(如 v7.0 与 2026-09-16);meta/ 固定保存评分分布快照——季度更新会改变评分基数,没有分布快照就无法解释两个月前后两次实验的差异。

§4.1 DAIMS 字段字典(GDA 主表核心字段)

不同导出通道的列名略有差异(API 字段名与 TSV 表头不完全一致),下表按官方文档语义给出核心字段,实际列名以导出文件表头为准:

字段 类型 说明 示例值 AI 用途 观测误差/陷阱 信息性缺失编码 取值范围
geneId Integer NCBI Entrez Gene ID 1793 实体主键之一 基因重命名不影响 ID,但新版可能并入/拆分基因座 无缺失 正整数
geneSymbol Text HGNC 基因符号 OCA2 可读性展示 符号有历史别名,勿作主键 无缺失 字符串
diseaseId Text UMLS CUI C0011860 实体主键之二 CUI 跨版本合并/拆分;umbrella 概念粒度不均 无缺失 C + 7 位数字
diseaseName Text UMLS 概念首选名 Type 2 Diabetes Mellitus 展示与分组 同义概念可能对应多 CUI 无缺失 字符串
score Float DISGENET 证据评分 0.65 过滤/加权/排序 非概率;随版本漂移 无缺失 [0, 1]
associationType Text 关联类型本体标签 Biomarker; Therapeutic 细分任务标签 同一基因-疾病对可有多个类型陈述 无缺失 本体枚举值
source Text 原始来源库列表 UNIPROT;CLINVAR;TEXTMINING HUMAN 证据分层 多源以分号拼接,需拆分统计 无缺失 来源枚举值
ei Float 证据一致性指数(EI) 1.0 文献矛盾检测 仅对文本挖掘与 PsyGeNET 关联有值 空 = 不适用 [0, 1]
el Text 证据等级描述 confirmed 证据强度分层 与 score 联动,勿单独使用 无缺失 枚举值
pmids Text 支持文献 PMID 列表 12345678;87654321 溯源、文献级特征 单文献支撑的条目噪声高 无缺失 数字串拼接
DSI(基因级旁表) Float 疾病特异性指数 0.23(TNF) 基因特征工程 仅关联表型的基因无值 空值 = 仅表型关联 [0.23, 1]
DPI(基因级旁表) Float 疾病多效性指数(MeSH 类跨度) 0.93(APOE) 基因特征工程 同上 空值 = 仅表型或无 MeSH 映射 [0, 1]

§4.2 标签分布

以"关联类型本体"为主标签体系:Biomarker 与 Therapeutic 是两个最高频大类,其下细分如遗传突变、表达改变、翻译后修饰等(Piñero et al., 2015 关联本体)。评分呈右偏分布:curated 高分段(≥0.7 量级)条目稀少而证据扎实;0.1-0.3 区间聚集大量单文献文本挖掘条目。官方未公开 v7.0 各关联类型的精确行数分布,建议在本地导出后统计并固化进 meta/(实践上任何论文引用"类型分布比例"都应注明其版本与导出日期):

# meta/type_distribution.py — 固化本快照的关联类型分布(示例基于本地导出 GDA TSV)
import pandas as pd

gda = pd.read_csv("data/raw/gda_snapshot.tsv", sep="\t", dtype={"geneId": "int64", "diseaseId": "string"})
report = {
    "n_gda": len(gda),
    "by_source": gda["source"].str.split(";").explode().str.strip().value_counts().to_dict(),
    "by_type": gda["associationType"].str.split(";").explode().str.strip().value_counts().to_dict(),
    "score_quantiles": gda["score"].quantile([0.25, 0.5, 0.75, 0.9]).round(4).to_dict(),
}
pd.Series(report).to_json("meta/type_distribution.json", indent=2, force_ascii=False)

固化时的两条纪律:source 与 associationType 字段都是多值分号串,直接 value_counts 会低估多源条目——先 explode 再计数;报告必须携带版本号与导出日期写进文件名或元数据,否则三个月后没人说得清这组比例属于哪个宇宙。

§4.3 关键统计

  • 基因-疾病关系呈长尾幂律:少数明星基因(如 TNF)关联数千种疾病,大量基因只关联一两种疾病。DSI 的两个端点示例即为佐证:TNF 关联 >3,500 种疾病(DSI = 0.23),MOB3A 仅关联 1 种疾病(DSI = 1.00)(官方指标文档)。
  • 多效性同样分层:APOE 的关联横跨 27/29 个 MeSH 疾病类(DPI = 0.93),KCNT1 只落在窄区间(DPI = 0.17)。
  • 超过 80% 的基因编码蛋白,DisGeNET 覆盖约 70% 人类蛋白编码基因的疾病注释(引 Piñero et al. 2015 口径)。
  • 版本间体量对照可用于校准直觉:2015 平台版约 380,000+ GDA → v7.0 1,134,942 → 订阅版 2.1M(v25.4)。同一篇论文隔年引用"DisGeNET 有多少关联"得出不同答案,多数是版本口径未对齐,而非数据被改动。

解读这些统计时的两条提醒:其一,长尾幂律意味着"平均每基因关联数"这类均值指标毫无代表性,用中位数与分位数描述实体覆盖;其二,明星基因的超高关联数会把基于嵌入的图算法的空间拉向热点区,采样或按 DSI 分层是常规对冲。

§4.4 数据层级

DisGeNET 的层级是"概念层级"而非"患者层级":

证据文献(PMID)
    └── 关联陈述(GDA / VDA:基因或变体 ↔ 疾病 CUI,附评分与类型)
            ├── 基因实体(NCBI Gene,附 DSI/DPI 基因级指标)
            ├── 变体实体(dbSNP rsID,附 VEP 后果注释)
            └── 疾病实体(UMLS CUI,向上桥接 ICD-11 / SNOMED CT / MeSH)
                    └── 疾病-疾病关联(DDA:共享基因/变体 + Jaccard + P 值)

读这棵树的三个要点:

  • PMID 是"叶子"也是"根":作为叶子,它是证据的最小单元;作为根,同一 PMID 可支撑多条关联,因此"按文献聚合"与"按关联聚合"是两种不同的统计口径,引用时必须声明。
  • GDA 与 VDA 平行而非包含:同一疾病上"基因级关联"与"变体级关联"各有独立评分与来源,不能从 GDA 推出 VDA 覆盖,反之亦然。
  • CUI 是唯一的疾病枢纽:DDA、富集分析、跨库对齐全都经过 CUI 这一层;CUI 质量问题(合并/拆分/粒度)会沿树向上传染给所有派生结构(§6.5 坑点 5)。

§4.5 缺失值与信息性缺失

字段 缺失形态 含义 处理建议
DSI 空值 该基因仅关联表型,未关联疾病实体 显式编码为独立类别,勿填 0 或均值
DPI 空值 关联疾病未映射到任何 MeSH 类,或仅表型关联 同上;做 MeSH 层分析时过滤并记录比例
ei 空值 非文本挖掘/非 PsyGeNET 关联,无文献矛盾评估 视为"无矛盾评估",勿视为"无矛盾"
pmYear 部分条目缺失 文献年份未解析成功 时间维分析前过滤并记录

DisGeNET 的缺失几乎都是信息性缺失(缺失本身携带语义:“仅表型关联”“无矛盾评估”“无 MeSH 映射”),而非数据事故。因此处理原则与普通表格相反:先理解语义、再决定编码,任何"顺手填 0/均值/向前填充"都会把结构信息抹掉并制造伪模式。建议在预处理脚本里为每个含缺失的字段维护一列布尔标志位(*_is_missing),让模型自己学习缺失模式(§6.4 的 dsi_missing 即此设计的落地)。


§5 数据划分与使用建议

§5.1 官方划分

DisGeNET 不提供官方机器学习 train/val/test 划分——它是知识库而非基准竞赛数据集。官方给出的"分层"是证据分层:curated 子集(专家确认)、inferred 子集(统计推断)、literature 子集(文本挖掘),以及 0-1 的连续评分。任何论文中出现的"DisGeNET benchmark 划分"均为作者自定义,复现时必须读其划分代码而非只读数据版本号。

动手前的划分自查清单:

  • 划分键是什么?(基因分组 / 疾病分组 / 时间切片——至少声明一项)
  • 负样本从哪来、按什么分层?(§5.2 两种流派)
  • 评分过滤阈值是多少、是否在划分前冻结?(§5.3 第三条)
  • 测试折实体数是多少?有无与训练折的实体重叠诊断输出?
  • 版本号 + 下载日期是否写进了实验配置?

§5.2 社区惯例划分

社区在疾病基因优先级任务上形成的惯例是:以某时间点的 curated 高分 GDA 为训练正例,以后续时间点新进入 curated 的 GDA 为测试正例(时间切片划分),或以已知关联基因为正、随机未关联基因为负并按比例采样。两种惯例都要求把划分键、版本号与日期写入实验配置。

时间切片划分的具体操作要点:以训练快照(如 v7.0)中最新的文献年份(pmYear 最大值)为切点,测试正例取"后续版本 curated 层新增、且文献时间晚于切点"的关联;这能部分模拟"模型预测未来确认的关联"这一真实使用场景。其固有局限是确认滞后偏倚——晚进入 curated 的关联偏向证据积累快的明星基因,测试集因此不是全谱系的无偏样本,结论应限定在"模型能否追赶策展前沿"。

负采样惯例则有两个流派:均匀负采样(实现简单,但会被文献热度偏倚支配)与"覆盖度分层负采样"(只在研究充分、覆盖完整的基因/疾病邻域内采样负例,减轻"未记录 ≠ 无关联"的混淆)。同一论文内混合两种策略并分别报告结果,是审稿人日益常见的做法。

§5.3 划分策略建议与泄漏风险(重点)

第一条铁律:按实体分组,不按行划分。 随机打乱 GDA 行会让同一基因(或同一疾病)的关联同时出现在训练集与测试集;模型只需记住"这个基因常见于训练集"就能得高分,评估结果虚高。正确做法是以基因(或疾病)为单位做 GroupShuffleSplit / 分组 K 折,保证测试集里的基因在训练集中完全未出现。

第二条:负样本要分层采样。 未出现在 DisGeNET 中不等于"确定无关"——文本挖掘覆盖不全导致"未记录"与"无关联"混淆。负样本应从高覆盖度基因中采样,并在论文中报告负采样策略。

第三条:评分过滤必须在划分之前完成并冻结。 如果先划分再按 score 过滤测试集,等于用未来信息清洗了测试集。正确顺序:确定阈值 → 过滤 → 划分 → 冻结。

§5.4 交叉验证建议

推荐两级交叉验证:外层按基因分组 5 折(评估对全新基因的泛化),内层在训练折内按疾病分组再分验证折(防止超参调优期间的疾病级泄漏)。报告均值±标准差,并附每折的基因重叠率诊断。

分组 K 折的折间方差在 GDA 上天然偏大:小折里恰好含明星基因时,该折指标会明显偏离均值,这是实体级泛化的真实难度波动,而非代码错误。诊断手段:逐折打印测试折中基因的"训练集出现次数直方图",若某折全为长尾基因,其低分不必过度解读;若希望兼顾疾病级泛化,可在同一实验里追加"按疾病分组"的镜像设置,两种分组下的指标差本身就是有价值的报告项。

§5.5 外部验证建议

最终模型应在一个"时间上晚于训练快照"的 DisGeNET 新版本 curated 增量上验证(模拟真实发现场景),或与 Open Targets、CTD 等独立库的高置信关联交叉对照。两个来源同时支持的关联作为高置信金标准,是文本挖掘系统评估中最稳健的做法。

三种外部验证路径的取舍:

路径 构建 cost 污染风险 适用阶段
时间切片(未来版本 curated 增量) 低 确认滞后偏倚 开发期快速迭代
独立库交叉(Open Targets/CTD 双源一致) 中 标准差异(各库证据标准不同) 论文评估主表
前瞻性案例核查(专家抽查预测头部) 高 低(人工金标) 结论定稿前

§6 AI 就绪指南

§6.0 云端快速启动

DisGeNET 无官方云端沙盒;两条云端路线:其一,REST API 直接在任意环境调用(免费学术计划限 curated 数据,注册后获得 API 凭证);其二,DisGeNET-RDF v7.0.0 可加载到支持 SPARQL 的图数据库(如 Apache Jena Fuseki、GraphDB)做查询分析。本节代码均假设数据已下载到本地 data_root。

§6.1 快速上手

下面的代码假设你已通过平台导出或 API 落盘 GDA TSV 文件。目录结构预期:TSV 位于 data_root/raw/tsv/ 下(见 §4.0 目录树);data_root 拼接关系:所有路径都从 data_root 出发拼接,避免硬编码绝对路径;最小可用子集:只要有一个 GDA TSV 文件即可跑通本节与 §6.3,VDA 与 RDF 层可选。

import os
import pandas as pd

# data_root 指向 §4.0 目录树的根目录
data_root = os.environ.get("DISGENET_DATA_ROOT", "./data_root")

# 最小可用子集:任一 GDA TSV 导出文件(文件名内嵌版本与日期,见 §4.0 约定)
gda_path = os.path.join(
    data_root, "raw", "tsv", "disgenet_v7.0_gda_all_2026-09-16.tsv"
)

# 不同导出通道列名以实际表头为准(见 §4.1)
gda = pd.read_csv(gda_path, sep="\t")

# 评分过滤:curated 高置信层,0.3 是社区常用的初筛阈值
core = gda[gda["score"] >= 0.3].copy()
print(f"全库 GDA: {len(gda):,};score≥0.3: {len(core):,}")

# 溯源抽查:任何分析结论都应能回溯到支持文献
row = core.iloc[0]
print(row[["geneId", "diseaseId", "score", "associationType", "source", "pmids"]])

首次接触建议只做三件事:按评分过滤、按来源拆分统计、抽查 10 条高评分关联的 PMID 原文。这三步能快速建立对数据噪声量级的直觉。

§6.2 数据获取

获取流程与授权分级(详见 §8 授权边界):

通道 前置条件 可得范围 适合谁
免费学术计划(Web/API) 机构邮箱申请,人工审核(约 7 天通知) 仅 curated 数据;检索结果可导出 TSV/Excel;不可下载全库 学生、非营利研究者
学术付费计划(Standard/Advanced) 订阅 全库含文本挖掘、LoF/GOF、临床试验注释 需要程序化全量访问的学术团队
商业订阅(Standard/Advanced/Premium) 付费合同 全库 + 企业级集成(Premium) 企业研发
DisGeNET-RDF v7.0.0 公开端点 99,057,987 三元组,SPARQL 可查 Linked Data / 图分析用户

API 调用示例(Python,凭证自行注册获取;以下以平台导出的文件为主,API 适合增量更新):

import os
import requests

# 免费学术计划凭机制:注册后在账号设置中获取(勿硬编码进代码库)
api_key = os.environ["DISGENET_API_KEY"]

# 示例:查询阿尔茨海默病(CUI C0002395)的 curated 基因关联
resp = requests.get(
    "https://api.disgenet.com/api/v1/gda/disease",
    headers={"Authorization": f"Bearer {api_key}", "Accept": "application/json"},
    params={
        "disease": "C0002395",
        "source": "CURATED",   # 免费学术计划仅开放 curated 来源
        "format": "json",
    },
    timeout=60,
)
resp.raise_for_status()
records = resp.json()
print(f"C0002395 curated GDA 数:{len(records)}")

注意:API 端点与参数随版本演进(v1.9.3 起新增 CURATED 过滤、polarity 过滤等能力),编码前以当时版本的官方文档为准。

§6.3 预处理全流程

从原始导出到建模就绪,分五步:格式规范化 → 概念去重聚合 → 证据分层 → 概念桥接 → 划分冻结。

import pandas as pd

def preprocess_gda(gda: pd.DataFrame) -> pd.DataFrame:
    """GDA 主表预处理:聚合、分层、派生特征。

    输入列名以导出文件表头为准(geneId/diseaseId/score/associationType/source/pmids)。
    """
    # 1) 拆分多值列:source 与 pmids 以分号拼接,拆成列表便于统计
    gda["source_list"] = gda["source"].fillna("").str.split(";")
    gda["n_sources"] = gda["source_list"].apply(len)
    gda["n_pmids"] = gda["pmids"].fillna("").str.split(";").apply(
        lambda xs: len([x for x in xs if x.strip()])
    )

    # 2) 概念去重聚合:同一 (geneId, diseaseId) 在多源出现时保留最高评分行,
    #    并保留证据构成(评分加权求和的逻辑属官方订阅服务,本地只做透明聚合)
    agg = (
        gda.sort_values("score", ascending=False)
        .groupby(["geneId", "diseaseId"], as_index=False)
        .first()
    )

    # 3) 证据分层:curated 优先、模型其次、文本挖掘兜底(评分体系的权重语义见 §3.1)
    def tier(sources):
        s = set(sources)
        if s & {"UNIPROT", "CLINVAR", "ORPHANET", "PSYGENET", "CLINGEN", "GENCC"}:
            return "curated"
        if s & {"MGD MOUSE", "RGD RAT"}:
            return "animal_model"
        return "literature_or_inferred"

    agg["tier"] = agg["source_list"].apply(tier)

    # 4) 单文献噪声标记:文本挖掘独撑且仅 1 篇文献的关联是高噪声区
    agg["weak_evidence"] = (agg["tier"] == "literature_or_inferred") & (agg["n_pmids"] <= 1)

    return agg


core = preprocess_gda(gda)
print(core["tier"].value_counts())
print(f"单文献弱证据占比:{core['weak_evidence'].mean():.1%}")

步骤 5(概念桥接) 建议维护 CUI → ICD-11/SNOMED 映射表(经 UMLS Metathesaurus),合并外部数据时按映射后的标准化概念对齐,而不是按疾病名文本匹配。

§6.4 PyTorch DataLoader

以"疾病基因优先级排序"任务为例:按基因分组划分,正样本为高评分 curated GDA,负样本采样自未关联基因,输出 (基因特征维, 疾病 ID) 对。

import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
from sklearn.model_selection import GroupShuffleSplit


class GDADataset(Dataset):
    """基因-疾病对二分类数据集。

    关键设计:
    1) 划分在数据集构造之前完成(按 geneId 分组),杜绝实体级泄漏;
    2) DSI/DPI 空值显式编码为独立标志位,不填均值(见 §4.5);
    3) score 作为软标签权重保留,供损失函数加权。
    """

    def __init__(self, gda: pd.DataFrame, gene_vocab: dict, disease_vocab: dict):
        self.gene_idx = torch.tensor([gene_vocab[g] for g in gda["geneId"]])
        self.dis_idx = torch.tensor([disease_vocab[d] for d in gda["diseaseId"]])
        self.score = torch.tensor(gda["score"].values, dtype=torch.float32)
        # DSI/DPI 缺失编码:0 = 缺失标志位,值列填 0
        self.dsi = torch.tensor(gda["DSI"].fillna(0).values, dtype=torch.float32)
        self.dpi = torch.tensor(gda["DPI"].fillna(0).values, dtype=torch.float32)
        self.dsi_missing = torch.tensor(gda["DSI"].isna().values, dtype=torch.float32)

    def __len__(self):
        return len(self.score)

    def __getitem__(self, i):
        return {
            "gene": self.gene_idx[i],
            "disease": self.dis_idx[i],
            "dsi": self.dsi[i],
            "dpi": self.dpi[i],
            "dsi_missing": self.dsi_missing[i],
            "weight": self.score[i],
        }


def build_split_loaders(core: pd.DataFrame, batch_size: int = 1024):
    # 按基因分组 80/20 划分:测试集基因在训练集中完全未出现(§5.3 铁律)
    splitter = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
    train_df, test_df = next(
        splitter.split(core, groups=core["geneId"])
    )
    train_df, test_df = core.iloc[train_df], core.iloc[test_df]

    gene_vocab = {g: i for i, g in enumerate(core["geneId"].unique())}
    disease_vocab = {d: i for i, d in enumerate(core["diseaseId"].unique())}

    train_ds = GDADataset(train_df, gene_vocab, disease_vocab)
    test_ds = GDADataset(test_df, gene_vocab, disease_vocab)
    return (
        DataLoader(train_ds, batch_size=batch_size, shuffle=True, num_workers=2),
        DataLoader(test_ds, batch_size=batch_size, shuffle=False, num_workers=2),
        len(gene_vocab),
        len(disease_vocab),
    )

§6.5 八大坑点

⚠️ 坑点 1:同名异库混淆——disgenet.cn 不是 DisGeNET(分类:工程陷阱)

问题:中国境内存在一个同名异库"DisGeNet"(西安电子科技大学团队,疾病为中心的 ncRNA 互作网络数据库,域名 disgenet.cn,发表于 Database (Oxford) 2025)。它与巴塞罗那的 DisGeNET(disgenet.com)毫无关系。自动化采集脚本按域名关键词匹配时极易引入错误数据。
症状:数据统计出现"lncRNA/microRNA 互作"等 DisGeNET 本不该有的记录类型;或引用列表混入 PMID 39797570。
解决:

  1. 简单方法:采集脚本白名单锁定 disgenet.com 与 rdf.disgenet.org 域名。
  2. 进阶方法:在 ETL 元数据里固化"机构 = GRIB-IMIM/UPF, Barcelona"校验字段,加载时断言。
  3. SOTA 方法:以 DOI(10.1093/nar/gkz1021)作为数据集指纹,任何来源无法提供该 DOI 的记录直接拒绝。
    参考:NGDC Database Commons 的同名异库条目

⚠️ 坑点 2:版本口径漂移——1,134,942、2.1M、117,000 说的是三件事(分类:评估误用)

问题:v7.0 的 1,134,942 是 GDA 条数;v25.4 的 2.1M 是订阅版 GDA 条数;NAR 2019 论文摘要的"117,000"是基因组变体数(VDA 相关口径)。论文与文档混引这三个数字做规模对比会全盘错位。
症状:复现论文时发现自家导出行数与论文引用规模对不上;审稿人质疑版本一致性。
解决:

  1. 简单方法:所有规模数字后强制标注版本号与口径(GDA/VDA/变体/出版物)。
  2. 进阶方法:本地导出后立即记录行数与下载日期,写入 meta/FACTS.md,实验配置引用该记录而非网页数字。
  3. SOTA 方法:建立版本回归测试——每次重新拉取数据后,与既有快照做行数与评分分布 diff,漂移超阈值即告警。
    参考:DISGENET 官方文档、NAR 2019 论文摘要

⚠️ 坑点 3:把 score 当概率或临床置信度(分类:标签理解)

问题:DISGENET 评分是证据组件(来源数量与类型、支持文献数)的加权和,取值 0-1,不是概率、不是效应量、更不是临床证据等级。0.4 的关联可能只是"两篇独立文献各自提及",与"40% 可能致病"毫无对应关系。
症状:把 score 直接当 y 概率放进 BCE 损失;或向临床同事报告"该基因致病概率 0.65"。
解决:

  1. 简单方法:把 score 当作排序依据与过滤阈值,仅此而已;报告时称"证据评分"。
  2. 进阶方法:结合 associationType 与 tier(curated/animal/literature)做分层校准分析,观察评分在层间的分布差异。
  3. SOTA 方法:以时间切片外部验证评估评分对"未来进入 curated"的预测力,建立任务专属的校准曲线。
    参考:DISGENET 指标文档

⚠️ 坑点 4:文本挖掘噪声——单文献关联的假阳性海啸(分类:偏倚陷阱)

问题:文献子集占 GDA 大多数,其中大量条目仅由一篇文献支撑,且文本挖掘会把推测句(“may be associated”)、阴性结果句误抽为关联。低分段(<0.3)是重灾区。
症状:富集分析被"明星基因长尾"淹没;以全库为训练标签的模型精度天花板异常低。
解决:

  1. 简单方法:score ≥ 0.3 起步,并叠加 n_pmids ≥ 2 过滤(见 §6.3 的 weak_evidence 标记)。
  2. 进阶方法:只用 curated 层做训练标签,文献层仅作候选扩展;对比两套结果敏感度。
  3. SOTA 方法:训练弱标签去噪模型(如 confident learning),以 curated 层为锚点估计文献层每类的可靠度再重加权。
    参考:官方指标文档的 Literature 分量上限(≤0.40)

⚠️ 坑点 5:UMLS CUI 合并/拆分导致跨版本行数对不上(分类:预处理陷阱)

问题:疾病主键是 UMLS CUI。UMLS 各版本会合并、拆分、废弃概念;同一基因-疾病对在新版可能并入另一 CUI,导致 v7.0 与 v25.x 的 GDA 行数差异并非全部来自新增证据。
症状:跨版本 diff 时出现成片"消失又出现"的关联;按 CUI 统计的疾病规模表前后矛盾。
解决:

  1. 简单方法:跨版本分析锁定单一快照,不做混拼。
  2. 进阶方法:用 UMLS Metathesaurus 的概念历史文件(CUI 变更映射)建立桥接表,diff 前先做概念归并。
  3. SOTA 方法:以疾病语义(名称嵌入 + MeSH 层级)做模糊对齐复核桥接表,把不可映射条目单独成册人工裁决。
    参考:NAR 2019 论文的标准化流程描述

⚠️ 坑点 6:GDA 行随机划分的实体级泄漏(分类:数据泄漏)

问题:GDA 主表以 (基因, 疾病) 对为行。随机按行划分 train/test 时,同一基因或同一疾病的其余关联会同时出现在两侧;模型记忆实体频次即可"作弊",Hit@k 虚高数个百分点。
症状:留一法(按行 mask 单条关联)评估分数极好但真实新基因场景崩溃;不同论文间性能无法复现。
解决:

  1. 简单方法:GroupShuffleSplit 按 geneId 分组划分(§6.4 已实现)。
  2. 进阶方法:双轴分组——分别按基因与按疾病各做一套划分,报告两组结果(最严苛)。
  3. SOTA 方法:时间切片划分——以快照 T1 训练、T1 之后新进入 curated 的关联测试,模拟真实发现。
    参考:领域通行做法,参见 §5.3 的三条铁律

⚠️ 坑点 7:DSI/DPI 空值被静默填 0(分类:预处理陷阱)

问题:仅关联表型的基因没有 DSI/DPI;pandas 默认读入为 NaN,fillna(0) 会把"仅表型关联"与"DSI=0"混淆——前者是信息性缺失(该基因特异性未知),后者并不存在于值域 [0.23, 1]。
症状:以 DSI 为特征的模型把表型关联基因聚成伪簇;论文里出现"DSI 最小值 0"与官方值域 [0.23, 1] 矛盾的描述。
解决:

  1. 简单方法:缺失标志位 + 值列分开(§6.4 的 dsi_missing 设计)。
  2. 进阶方法:树模型直接支持缺失分支,保留 NaN 不填充;线性模型用 indicator 展开。
  3. SOTA 方法:按"是否有 MeSH 映射"分层建模,表型关联子图单独训练。
    参考:官方指标文档对 DSI/DPI 空值的说明

⚠️ 坑点 8:再分发与许可边界踩线(分类:工程陷阱)

问题:官方明确禁止再分发或转售数据库全部或任何部分,免费学术计划又只含 curated 数据。团队把导出 TSV 上传内部 Git LFS、或打包进公开 HuggingFace 数据集,即构成许可违约。
症状:法务/合规审查发现代码库内嵌全量数据副本;公开仓库收到下架要求。
解决:

  1. 简单方法:数据不入 Git;代码库只保存下载脚本与 schema。
  2. 进阶方法:内部数据平台做许可标记(curated/订阅层分离存取),按 license 字段审计访问。
  3. SOTA 方法:发布模型与派生物时只引用"基于 DISGENET v7.0(2026-09-16 导出)训练"的指纹与统计量,不附带原始行数据;对外发布前过一遍再分发审查清单。
    参考:官方许可 FAQ

§6.6 数据增强:安全与危险操作

关联数据没有旋转/裁剪式的增强,"增强"等价于负采样与图谱扩充:

  • ✅ 安全:按基因分组采样的负样本生成(每次 epoch 重新采样);以 DDA 共享基因为中介的图结构扩展;用 MeSH 层级把疾病 CUI 上卷到父类做标签平滑。
  • ✅ 安全:以文献发表年份构造时间特征(pmYear),模拟知识演化。
  • ❌ 危险:把文本挖掘低分关联当作真值扩充正样本(噪声注入)。
  • ❌ 危险:按 CUI 文本相似度"合并"疾病(UMLS 已做专业合并,自创合并会引入语义错误)。
  • ❌ 危险:把动物模型(MGD/RGD)关联无条件映射到人类同源基因当作人类证据(跨物种外推需要显式声明)。

§6.7 模型推荐

模型家族 适用任务 起步建议
图神经网络(R-GCN、CompGCN) 疾病基因优先级、链接预测 把 GDA/VDA/DDA 建成多关系图,关联类型作边类型
双塔/交互式排序器 基因-疾病评分学习 基因侧用序列嵌入(ESM 类),疾病侧用 MeSH/文本嵌入
知识图谱嵌入(TransE/RotatE 系) 链接预测、补全候选 适合大规模负采样训练,注意按实体划分评估
梯度提升树(XGBoost/LightGBM) 基于评分/DSI/DPI/来源数的特征工程路线 小样本、可解释优先时首选
LLM/RAG(AIDA 思路) 证据检索与问答 依托评分过滤 + PMID 溯源构建检索层,防幻觉

§6.8 硬件需求

任务规模 配置建议 说明
TSV 分析/富集(百万级行) 16 GB 内存笔记本 pandas/duckdb 即可
全库图建模(v7.0 图谱) 64 GB 内存 + 单张 24 GB 显卡 全图 GNN 单卡可跑
订阅版全量(GDA 2.1M + VDA 4.8M + DDA 28.1M) 128 GB 内存或图数据库集群 DDA 规模是主要压力源
SPARQL 路线(RDF v7.0.0) 32 GB 内存图数据库实例 99M 三元组 Fuseki 可承载

§6.9 评估指标代码

import numpy as np


def hit_at_k(ranked_genes: list, true_genes: set, k: int) -> float:
    """疾病基因优先级任务的 Hit@k:前 k 个排序结果命中真值基因的比例。"""
    return len(set(ranked_genes[:k]) & true_genes) / min(len(true_genes), k) if true_genes else np.nan


def mrr(ranked_genes: list, true_genes: set) -> float:
    """平均倒数排名(MRR):首个命中真值的排名倒数。"""
    for i, g in enumerate(ranked_genes, start=1):
        if g in true_genes:
            return 1.0 / i
    return 0.0


# 使用约定:ranked_genes 由模型对某疾病的全部候选基因排序产生;
# true_genes 必须来自测试折的 curated 关联(按实体分组划分后的 held-out 基因),
# 严禁使用与训练集同基因的关联充当真值(坑点 6)。

§6.10 MLOps 笔记

  • 版本即配置:数据版本号、下载日期、评分分布快照三者必须进入实验跟踪系统(MLflow/W&B 的 tag)。
  • 再训练触发器:以季度更新为节奏;每次更新后跑行数 diff 与评分分布 KS 检验,漂移超阈值触发模型复评。
  • 溯源审计:线上任何"基因 X 与疾病 Y 有关"的输出都应挂 PMID 溯源链(§3.10),这是合规审查与用户信任的共同需求。
  • 许可合规进 CI:在 CI 中断言仓库内不存在 TSV 原始副本(坑点 8),导出物仅限统计量与指纹。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
文献热度偏倚 研究热度高的基因/疾病证据密集,冷门长尾稀疏 高 按 tier 分层分析;对"未收录"负样本做分层采样
文本挖掘噪声 单文献、推测句误抽为关联,低分段假阳性多 高 score ≥ 0.3 + n_pmids ≥ 2 过滤;curated 层做金标
GWAS 祖先偏倚 UKBIOBANK/FINNGEN 队列以欧洲血统为主 中 跨祖先推断任务不做,或显式声明局限
疾病粒度不均 umbrella CUI(综合征级)与具体病种混杂 中 分析前按 MeSH 层级/概念粒度分层
跨物种外推偏倚 动物模型证据未必转化到人类 中 MGD/RGD 单独成层,不作人类证据直接使用
策展滞后 curated 层更新慢于文献前沿 低 订阅版季度刷新;时间切片评估衡量滞后量
语义合并偏倚 UMLS 将不同临床语境的概念并入同一 CUI,关联被错误聚合 中 对结论性分析做 CUI→原文疾病名回核;跨版本监控 CUI 集合变化
评分构成偏倚 高分 ≈ 多源叠加,而多源 ≈ 研究充分领域,评分与热度部分同源 中 把 source 数量作为协变量而非纯质量信号;分层报告各 source 内指标

关于"文献热度偏倚"再展开一句:它不只是"数据不均",而会直接污染评估——若负样本采自冷门区域而正样本天然在热点区域,模型学到的可能是"区域热度分类器"。检验办法是把负采样限制在与正样本同热度档的基因/疾病内再重评,指标大幅下降即证实此偏倚已接管模型。

§7.2 标注质量

上游策展库(ClinVar 星级、Orphanet 专家组、CLINGEN 基因-疾病临床有效性分类)各自维护质量体系,DisGeNET 在整合层以评分权重表达来源可信度差异。文本挖掘层以 NER/归一化 F1 为质量锚点(v25.2 起公开为 0.88;官方另宣传 F-score 92% accuracy 的平台口径,两者统计口径不同,引用时需注明)。v7.0 时期管道质量未以单一公开数字表述——处理旧快照时建议按 §6.3 的 weak_evidence 流程自估噪声率。

对 0.88 这一数字的正确理解:它是"实体识别"层的指标(基因/疾病提及的边界与类型判断),不等于"关联抽取"的正确率——句子层面把"无关联"误判为"有关联"、或把修饰关系(如"抑制剂"“生物标志物候选”)抹平成"关联"的误差,是 NER F1 无法覆盖的第二层噪声。评估自家文本挖掘系统时,建议对 curated 金标分两层报告:实体层对齐率与关联层精确率。

§7.3 泛化性

场景 失效风险 证据/机制
跨祖先遗传风险预测 高 训练证据的 GWAS 队列以欧洲血统为主,效应位点转移性差
新兴疾病(新发传染病) 高 文献积累不足,curated 更滞后,文本挖掘噪声占比失控
罕见病基因优先级 中低 策展库覆盖好(Orphanet/ClinVar/CLINGEN),但单基因证据量少、依赖单文献
药物重定位 中 需临床试验注释(付费层)交叉验证,免费层证据不完整
表型为主的关联(无 DSI/DPI) 中 值域空缺需专门编码,混入常规训练会引入伪结构

泛化性的一条总原则:DisGeNET 上训练的模型,其"泛化"本质是对文献生成过程分布的泛化,而非对生物学真实分布的泛化。当目标场景的文献生成机制与训练语料差异大(新地区、新病种、新发表模式),无论内部指标多好都应预期性能衰减;上线前用目标域的一小批专家确认关联做校准,是比调参更有效的投入。

§7.4 伦理

DisGeNET 不含患者级数据,无个体隐私风险;其伦理重心在证据公平性与使用边界:文献偏倚可能让 AI 系统系统性低估低资源地区疾病与弱势群体相关研究;基因-疾病关联在就业、保险场景的误用风险要求下游应用遵循遗传隐私与反歧视规范;禁止再分发条款是合同义务而非技术限制,公开派生物时须逐项审查。

另有一条易被忽略的伦理界面:关联数据被 LLM 消化后,"基因 X 与疾病 Y 相关"会以自然语言的确定性口吻输出,评分、来源与文献矛盾信息在转述中最容易丢失。构建生成式应用时应把不确定性原样传递(评分区间、来源分层、文献数),并对临床敏感病种(肿瘤预后、精神疾病)加输出侧护栏。

§7.5 公平性

两大公平性缺口:祖先公平性——GWAS 证据集中欧洲血统,多基因评分类应用对非欧洲人群迁移性差;疾病公平性——被忽视热带病、低收入地区高发疾病的关联证据密度显著低于常见慢病。构建面向全球人群的应用时,应对训练标签按 MeSH 疾病类与祖先可追溯性做覆盖度审计,并在模型卡中披露覆盖缺口。

第三层缺口是语种公平性:文本挖掘证据来自 PubMed 英文文献,非英语期刊发表的临床观察(如中医、传统医学与地区性流行病学研究)几乎不进入证据池。这意味着"某基因-疾病对无记录"在部分疾病域实际上是"英语文献无记录",跨语言证据扩展是降低该缺口的路径,但需自行接入并承担证据质量评估责任。

§7.6 数据漂移

季度更新会同时带来证据增量与评分基数变化:同一 GDA 的 score 在 v25.2 与 v25.4 之间可能因新文献并入而上升;UMLS 概念变更改变 CUI 集合。漂移管理三板斧:每次更新后输出行数与评分分布 diff(KS 检验);关键实体(top 基因/疾病)的证据量监控;版本固定策略——同一研究项目内锁定快照,跨版本结论必须重新验证。

漂移监测的一个低成本信号集:(geneId, diseaseId) 键集合的增删规模、curated/总行数占比的变化、各关联类型占比的季度位移。三者任一发生超阈值跳变(如 curated 占比单季变动超过数个百分点),先查 UMLS 版本与上游策展库变更说明,再考虑模型侧响应——多数"模型性能突然下滑"的根因在数据源侧而非模型侧。

§7.7 DAIMS 24 项评估

# 检查项 状态 说明
1 宽格式 ✅ GDA/VDA 主表均为平面宽表,一行一关联
2 唯一标识 ⚠️ 基因(NCBI ID)与疾病(CUI)各有权威 ID,但 GDA 行无全局唯一主键,多源重复需自行聚合
3 特殊字符 ✅ 文本字段(疾病名、摘录)含少量 Unicode 特殊字符,UTF-8 读取无损
4 重复行 ⚠️ 同一 (geneId, diseaseId) 多源出现属设计使然,需按 source 聚合(§6.3)
5 缺失编码 ✅ 缺失以空值表达,无魔法数字
6 标签标识 ✅ associationType 本体标签语义清晰
7 罕见类分组 ✅ 罕见病经 Orphanet/ClinVar 系统覆盖,无碎片化标签
8 偏倚评估 ✅ 官方文档明示证据源分类与评分构成,文献偏倚可量化分析
9 数据字典 ✅ 官方文档对字段与指标有完整定义(DSI/DPI/EI 公式公开)
10 信息性缺失解释 ⚠️ DSI/DPI/EI 空值含义官方有说明,但需用户自行查阅并正确编码
11 设备记录 ❌ 不适用:无设备维度(知识型数据库)
12 共线性 ✅ 关联表本身无共线性问题;派生特征(DSI/DPI)相关性需自查
13 编码映射 ✅ UMLS CUI ↔ ICD-11/SNOMED CT/MeSH 经 Metathesaurus 可桥接
14 时间戳处理 ⚠️ pmYear 覆盖不完整;无行级更新时间戳,版本差异靠版本号管理
15 划分建议 ⚠️ 官方不提供 ML 划分,分组/时间切片策略需自建(§5)
16 泄漏讨论 ⚠️ 实体级泄漏风险官方未展开讨论,本词条 §5.3 给出完整策略
17 标签分布 ⚠️ 关联类型分布未官方公开精确数字,需本地统计
18 测量偏倚 ⚠️ 文献热度与祖先偏倚存在且可解释,无定量审计文件
19 外部验证建议 ✅ 官方明确支持文本挖掘方法评估用途,curated 层即外部金标
20 版本记录 ✅ 版本发布页详尽(v25.2/25.4/26.2 逐项列变更)
21 预处理脚本 ⚠️ disgenet2r 提供 R 侧分析函数;Python 侧需自建(§6.3 可用起点)
22 合规要求 ⚠️ 学术/商业双轨许可清晰但条款严格:禁止再分发全库或任何部分
23 多模态对齐 ❌ 不适用:单一关联知识模态,无跨模态样本对
24 去标识化 ✅ 无患者数据,天然无隐私风险

DAIMS 评分:16.5 / 24

评分解读:数据字典、版本管理、溯源链与合规透明度是 DisGeNET 的强项,达到一流知识库水准;失分集中在"机器学习工程化配套"——无官方划分、无行级主键、标签分布需自统计、Python 预处理需自建,以及两个结构性"不适用"项(设备记录、多模态对齐)按规则计 0 分。对知识图谱类任务它是即战力;对表格基准复现类任务需要额外工程投入。

对你意味着什么:(1) 拿到数据第一件事是跑 §6.3 预处理,固化 (geneId, diseaseId) 聚合主键与 weak_evidence 标记——这两步解决 24 项里两项 ⚠️;(2) 划分策略照抄 §5.3 三条铁律,可规避最大的评估翻车点;(3) 不要指望官方给你 ML 配套,把 §6.4 的 Dataset/划分代码纳入团队模板库;(4) 合规上把"禁止再分发"写进团队数据手册,CI 里加数据副本断言。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
罕见病案例核查(DMD) NAR 2019 论文(官方) 变异-疾病注释覆盖 350 个 DMD 变体被注释到杜氏肌营养不良 — 多数为 stop-gained 功能缺失变异,与临床遗传学认知一致(PMID 31680165)
NER 管道外部评测 DISGENET v25.2 发布说明 文本挖掘实体识别 平均 F1 = 0.88 — 新 NER 模型按官方口径达到 0.88,为文献层噪声率提供量化锚点(官方文档)
文本挖掘方法评估基准 社区通行用法 抽取系统精度/召回评估 各论文自行报告 不可直接比较 各研究划分与阈值不同,数值不可横向比较;应复用其 curated 金标思路

§8 基准性能与生态

§8.1 基准参考(排行榜替代视图)

DisGeNET 无统一排行榜与官方评测服务。社区以"疾病基因优先级"为主战场,但各论文使用不同版本快照、负采样与划分协议,性能数字不可跨论文直接比较。下表列出可追溯的方法学锚点而非可比 SOTA:

方法学锚点 任务形态 关键技术 完整引用
Cytoscape App 评测生态 网络可视化 + 富集分析 GDA/VDA 二部网络、Cytoscape Automation 可编程流水线 Pinero J, et al., 2021, Computational and Structural Biotechnology Journal. DOI 10.1016/j.csbj.2021.05.015
知识平台整合框架 多源证据统一与优先级 四源分类 + 评分 + 本体(该领域框架的事实标准) Piñero J, et al., 2020, Nucleic Acids Research 48(D1):D845-D855. DOI 10.1093/nar/gkz1021
平台化整合方法 基因-疾病/变体-疾病全谱整合 UMLS 归一化 + 关联类型本体 Piñero J, et al., 2016, Nucleic Acids Research 45(D1):D833-D839
发现平台初始框架 疾病-基因网络探索 评分与 DSI/DPI 指标首发 Piñero J, et al., 2015, Database 2015:bav028. DOI 10.1093/database/bav028

§8.2 SOTA 总结与选型建议

该数据集的正确"选型"不是挑模型刷榜,而是按任务选证据层:做可解释优先级排序 → curated 高分层 + 梯度提升树起步;做图谱补全 → 全库多关系图 + KGE/GNN;做文本挖掘对标 → curated 金标 + 时间切片。声称"在 DisGeNET 上达到 SOTA"的论文,一律检查其快照版本、划分协议与负采样策略后再采信数字。

选型时还应区分"模型复杂度预算"与"证据质量预算"两个独立旋钮:在 curated 高分层上,特征工程(DSI/DPI/source 构成/n_pmids)+ 线性模型或 GBDT 往往已接近该证据层的信息上限,上 GNN 主要在全库多关系场景才有增益。先做"特征 + 浅模型"的基线并检查其错误样本,再决定是否引入图结构——跳过基线直接上图模型,是这个领域复现工作最常见的浪费。

§8.3 评测协议

推荐协议(可直接用于论文方法节):数据固定 v7.0 快照 + 下载日期;过滤 score ≥ 0.3 且 n_pmids ≥ 2;按基因分组 5 折;指标 Hit@k(k=10/50/100)与 MRR;外部时间切片验证(未来版本 curated 增量);全部配置进版本控制。

两条补充纪律:其一,报告中必须同时给出"训练集规模"与"测试折实体数"——GDA 评估数字脱离实体数量级毫无意义(100 个基因的测试折与 2,000 个基因的测试折不可比);其二,所有指标附 Bootstrap 置信区间(按测试折实体重采样),实体级分组数据的折间方差大,点估计不配误差棒会被审稿质疑。

数据集 关系 典型联合用法
GWAS Catalog 证据上游(Inferred 层来源之一) 位点级统计与文献级关联互补
ClinVar 证据上游(Curated 层来源之一) 临床级变异解释与知识库全景互补
Orphanet 证据上游(罕见病策展) 罕见病专项深挖
Open Targets Platform 平行资源(靶点优先级) 双源一致的靶点作高置信候选
CTD 平行资源(毒理维度) 化学-基因-疾病三角补全
PsyGeNET 子集关系(精神疾病专库,同为 GRIB 出品) 精神药理领域深挖,证据与主库 curated 层同源
SPOKE / Hetionet 融合下游 DisGeNET 作为边集并入全景生物医学图

联合使用的工程提醒:各库标识符体系不同(GWAS Catalog 用 rsID 与 EFO 性状、CTD 用 MeSH、Open Targets 用 Ensembl 基因 ID 与 EFO),做双源一致对齐时需要一套 ID 映射中间层,且映射本身会引入误差——对齐率应作为数据质量指标单独报告,不要把映射损耗无声地吞进最终指标。

§8.5 关键论文 Top 6

  1. Piñero J, Ramírez-Anguita JM, Saüch-Pitarch J, Ronzano F, Centeno E, Sanz F, Furlong LI. The DisGeNET knowledge platform for disease genomics: 2019 update. Nucleic Acids Research, 2020, 48(D1):D845-D855. DOI 10.1093/nar/gkz1021 — 平台框架与指标体系的权威描述,官方指定引用文献。
  2. Piñero J, Bravo À, Queralt-Rosinach N, Gutiérrez-Sacristán A, Deu-Pons J, Centeno E, García-García J, Sanz F, Furlong LI. DisGeNET: a comprehensive platform integrating information on human disease-associated genes and variants. Nucleic Acids Research, 2016, 45(D1):D833-D839 — 平台化后的首个 NAR 数据库专刊综述。
  3. Piñero J, Queralt-Rosinach N, Bravo À, Deu-Pons J, Bauer-Mehren A, Baron M, Sanz F, Furlong LI. DisGeNET: a discovery platform for the dynamical exploration of human diseases and their genes. Database, 2015, bav028. DOI 10.1093/database/bav028 — 评分体系与 DSI/DPI 指标的原始出处。
  4. Bauer-Mehren A, Rautschka M, Sanz F, Furlong LI. DisGeNET: a Cytoscape plugin to visualize, integrate, search and analyze gene-disease networks. Bioinformatics, 2010, 26(22):2924-2926 — 项目起点(Cytoscape 插件首发)。
  5. Pinero J, Ramírez-Anguita JM, Saüch-Pitarch J, Ronzano F, Centeno E, Sanz F, Furlong LI. The DisGeNET Cytoscape app: exploring and visualizing disease genomics data. Computational and Structural Biotechnology Journal, 2021. DOI 10.1016/j.csbj.2021.05.015 — v7.0 精确规模数字(1,134,942 GDA / 369,554 VDA)与网络分析工具链。
  6. Bauer-Mehren A, Bundon M, Rautschka M, Furlong LI. Gene-disease network analysis reveals functional modules in Mendelian, complex and environmental diseases. PLOS ONE, 2011, 6(6):e20284 — GDA 网络模块化分析的方法学范例。

§8.6 社区活跃度

官方披露学术出版物引用 5,500+(平台统一公告口径);第三方聚合资料显示截至 2026-03 引用达 8,500+ 篇(口径与统计源不同,两处并列供参考)。平台用户超 130,000,2018 年获 ELIXIR 推荐资源地位。2025-2026 年产品动作密集:v25.2 新 NER、My Score/Historical Score、AIDA AI 助手、DISGENET MCP Connector(AI Agent 原生接入),显示其正快速接入 LLM 工作流(disgenet.com)。

近两年与 AI 工程直接相关的发布节奏(选型与排期参考):

时间 发布 对 AI 工程的意义
v25.2(2025) 新 NER 模型(平均 F1 0.88) 文献层噪声率下降,旧快照与新版不可混比
v25.2 My Score 自定义加权评分 团队可固化自有权重口径,替代硬编码阈值
v25.4 Historical Score、GDA 2.1M 历史评分支持跨版本回溯比较
2025-2026 AIDA 助手(RAG) 平台内自然语言检索,答案带溯源
2026-07 DISGENET MCP Connector Agent 原生接入:LLM 应用可把 DISGENET 作为工具调用
v26.2(2026-06) 季度更新延续 订阅版节奏稳定,锁定快照策略仍是首选

§8.7 生态快照

资源 类型 链接 推荐理由
DISGENET 平台 Web 平台 disgenet.com 检索、导出与富集分析主入口
官方文档 文档 disgenet.com/docs 字段、指标、API 全量说明
指标文档 文档 metrics 页 SGDA/SVDA/DSI/DPI/EI 公式与权重
DisGeNET-RDF Linked Data rdf.disgenet.org v7.0.0 SPARQL 端点与 Turtle 下载(ODC-ODbL)
支持中心 FAQ support.disgenet.com 许可、下载、商业使用边界官方解答
disgenet2r R 包 官方分发 R 生态富集分析与评分计算(v1.2.4)
Cytoscape App 桌面插件 Cytoscape App Store 网络可视化与自动化流水线(v8.4)
AIDA + MCP Connector AI 助手 disgenet.com 自然语言/RAG 访问与 Agent 集成
官方博客 博客 blog.disgenet.com 平台合并公告、学术计划详解与产品动态
版本发布说明 文档 disgenet.com/docs v25.2/25.4/26.2 逐项变更与评分基数调整记录

§9 相关资源与引用

§9.1 官方资源清单

  • 平台主页:disgenet.com — 检索、导出、计划与定价入口(原 disgenet.org 已统一重定向)。
  • 文档中心:disgenet.com/docs — 数据模型、版本发布说明、REST API(v1.9.3)、R 包与 Cytoscape App 更新记录。
  • 指标文档:评分与指标 — SGDA/SVDA 组件权重、DSI/DPI/EI 公式、My Score 自定义评分。
  • 支持中心:support.disgenet.com — 学术许可申请流程、商业使用判定、再分发禁令的官方解答。
  • DisGeNET-RDF:rdf.disgenet.org — v7.0.0 Linked Data 版(99,057,987 三元组,SPARQL 端点,ODC-ODbL 许可)。
  • 学术许可申请:以机构邮箱提交申请表单,人工审核(官方口径约 7 天内通知结果),免费层仅含 curated 数据。
  • 版本发布说明:文档中心内 v25.2 / v25.4 / v26.2 各自的 changes 页 — 追踪评分基数调整、NER 模型升级与新增证据源的第一手出处,做版本决策(§3.0)前必读。
  • 机构背景:GRIB(IMIM-UPF,Barcelona)项目页与 MedBioinformatics Solutions SL 公司信息 — 了解研发主体与商业化主体的对应关系,避免引用张冠李戴。

§9.2 BibTeX 引用

@article{pinero2020disgenet,
  title   = {The {DisGeNET} knowledge platform for disease genomics: 2019 update},
  author  = {Pi{\~n}ero, Janet and Ram{\'i}rez-Anguita, Juan Manuel and Sa{\"u}ch-Pitarch, Josep and Ronzano, Francesco and Centeno, Emilio and Sanz, Ferran and Furlong, Laura I},
  journal = {Nucleic Acids Research},
  volume  = {48},
  number  = {D1},
  pages   = {D845--D855},
  year    = {2020},
  doi     = {10.1093/nar/gkz1021}
}

@article{pinero2021cytoscape,
  title   = {The {DisGeNET} {Cytoscape} app: exploring and visualizing disease genomics data},
  author  = {Pinero, Janet and Ram{\'i}rez-Anguita, Juan Manuel and Sa{\"u}ch-Pitarch, Josep and Ronzano, Francesco and Centeno, Emilio and Sanz, Ferran and Furlong, Laura I},
  journal = {Computational and Structural Biotechnology Journal},
  year    = {2021},
  doi     = {10.1016/j.csbj.2021.05.015}
}

@article{pinero2016disgenet,
  title   = {{DisGeNET}: a comprehensive platform integrating information on human disease-associated genes and variants},
  author  = {Pi{\~n}ero, Janet and Bravo, {\`A}lex and Queralt-Rosinach, N{\'u}ria and Guti{\'e}rrez-Sacrist{\'a}n, Alba and Deu-Pons, Jordi and Centeno, Emilio and Garc{\'i}a-Garc{\'i}a, Javier and Sanz, Ferran and Furlong, Laura I},
  journal = {Nucleic Acids Research},
  volume  = {45},
  number  = {D1},
  pages   = {D833--D839},
  year    = {2016}
}

@article{pinero2015disgenet,
  title   = {{DisGeNET}: a discovery platform for the dynamical exploration of human diseases and their genes},
  author  = {Pi{\~n}ero, Janet and Queralt-Rosinach, N{\'u}ria and Bravo, {\`A}lex and Deu-Pons, Jordi and Bauer-Mehren, Anna and Baron, Martin and Sanz, Ferran and Furlong, Laura I},
  journal = {Database},
  volume  = {2015},
  pages   = {bav028},
  year    = {2015},
  doi     = {10.1093/database/bav028}
}

@article{bauermehren2010disgenet,
  title   = {{DisGeNET}: a {Cytoscape} plugin to visualize, integrate, search and analyze gene-disease networks},
  author  = {Bauer-Mehren, Anna and Rautschka, Martin and Sanz, Ferran and Furlong, Laura I},
  journal = {Bioinformatics},
  volume  = {26},
  number  = {22},
  pages   = {2924--2926},
  year    = {2010}
}

@article{bauermehren2011gda,
  title   = {Gene-disease network analysis reveals functional modules in {Mendelian}, complex and environmental diseases},
  author  = {Bauer-Mehren, Anna and Bundon, Marc and Rautschka, Martin and Furlong, Laura I},
  journal = {PLOS ONE},
  volume  = {6},
  number  = {6},
  pages   = {e20284},
  year    = {2011},
  doi     = {10.1371/journal.pone.0020284}
}

§9.3 引用指南

官方要求:任何使用 DisGeNET 数据的发表物必须引用 NAR 2019 论文(DOI 10.1093/nar/gkz1021),并注明数据版本号(如 DISGENET v7.0 或 v26.2)与下载/检索日期。跨版本对比分析还需注明各版本快照日期。再分发场景(无论商业与否)需先与官方确认授权边界。

实用建议:在论文的 Data Availability 节写清三要素——“数据库名 + 精确版本号 + 获取通道”(如"DISGENET v25.4,REST API,检索于 2026-09-16");使用 RDF 版时另注 ODC-ODbL 许可;使用付费层专有数据(临床试验注释、化学品数据)时声明所属计划,以便他人判断可复现范围。


§10 AI 使用声明卡

§10.1 AI 模型列表

本页面文字内容主要由大语言模型辅助生产(初稿生成、结构化整理、代码示例编写),全稿经人工交叉审核修订。

§10.2 AI 参与范围

AI 参与:初稿撰写、术语统一与排版、代码示例草拟、表格结构生成。人工参与:事实核查与数字溯源(对照 FACTS.md 与官方来源)、医学与数据工程双线审核、许可条款复核、最终定稿发布。数字类内容全部要求有可回溯来源,AI 无法核实的数字一律删除。

边界说明:本页所有"建议"“风险”"缓解措施"类内容(§5 划分铁律、§6 坑点、§7 偏倚)属方法论综合,融合了官方文档明示信息与领域通行工程实践两个层次;前者可溯源,后者标注为通行做法。读者应把两类内容区别对待:前者可直接引用,后者是可复用的工程起点而非官方结论。

§10.3 输入来源列表

  1. Piñero J, et al., 2020, Nucleic Acids Research 48(D1):D845-D855. DOI 10.1093/nar/gkz1021
  2. Pinero J, et al., 2021, Computational and Structural Biotechnology Journal. DOI 10.1016/j.csbj.2021.05.015
  3. Piñero J, et al., 2016, Nucleic Acids Research 45(D1):D833-D839.
  4. Piñero J, et al., 2015, Database 2015:bav028. DOI 10.1093/database/bav028
  5. Bauer-Mehren A, et al., 2010, Bioinformatics 26(22):2924-2926.
  6. Bauer-Mehren A, et al., 2011, PLOS ONE 6(6):e20284.
  7. DISGENET 官方主页(规模计数、学术计划) — disgenet.com
  8. DISGENET 官方文档 v25.4(GDA 2.1M、VDA 4.8M、API 1.9.3、My Score) — disgenet.com/docs
  9. DISGENET 官方文档 v25.2(NER F1 0.88、GDA 2.0M) — disgenet.com/docs?version=25.2
  10. DISGENET 指标文档(SGDA/SVDA 组件权重、DSI/DPI/EI、My Score) — metrics 页
  11. DISGENET 支持中心(学术下载边界) — Can I download the DISGENET database?
  12. DISGENET 支持中心(商业许可与再分发禁令) — Do I need a commercial license?
  13. DISGENET 官方博客(平台统一公告:5,500+ 引用、130,000 用户、MedBioinformatics) — blog.disgenet.com
  14. DISGENET 官方博客(学术许可详解) — DISGENET Academic License
  15. Harmonizome(Harmonizome 收录的 v7.0 规模与引用列表) — maayanlab.cloud
  16. LOD Cloud(DisGeNET-RDF v7.0.0:99,057,987 三元组、ODC-ODbL、IBI Group) — lod-cloud.net
  17. NGDC Database Commons(同名异库 disgenet.cn 区分) — ngdc.cncb.ac.cn
  18. 第三方数据集聚合资料(规模历史:2015 平台版 380,000+ GDA、ELIXIR 2018、8,500+ 引用口径) — reference.org/facts/DisGeNET
  19. 千方病案内部 FACTS.md(全部数字的一手来源索引与种子口径校准记录,检索截至 2026-09-16)

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
INFOBOX 全部字段 千方病案医学编辑部 对照 FACTS.md 与官方来源逐项核对 ✅ 已通过
§1 规模数字与版本时间轴 千方病案医学编辑部 与官方文档/论文摘要逐条比对 ✅ 已通过
§2 疾病映射与临床任务(含 §2.6 金标准表) 千方病案医学编辑部 医学术语与 ICD-11/SNOMED/CUI 编码核对;金标分层描述对照官方来源分层 ✅ 已通过
§4-§6 数据结构与代码 千方病案医学编辑部(数据工程线) 代码逻辑走查 + 字段语义核对 ✅ 已通过
§6.5 坑点 8 项 千方病案医学编辑部(数据工程线) 对照官方 FAQ/文档逐项溯源 ✅ 已通过
§7 DAIMS 24 项与偏倚分析 千方病案医学编辑部 逐项评估并复核评分口径 ✅ 已通过
§8-§9 引用与许可 千方病案医学编辑部 引用条目逐条可访问性检查 ✅ 已通过
种子规模口径校准 千方病案医学编辑部 "117万+"与 v7.0 = 1,134,942 GDA 差异约 3%,判定以检索为准并记入 FACTS.md ✅ 已通过

§10.5 AI 生成章节标注

AI 辅助生成的章节:§1、§3、§4、§5、§6、§7、§8、§9 正文与代码示例;人工主导章节:§0(固定模板)、§10(声明卡本身)。全部 AI 辅助内容均经 §10.4 所列人工校验。

§10.6 最后人工审核日期

最后人工审核日期:2026-09-05(与 §0 审核日期一致)。

复审触发条件(满足任一即应安排复审):DisGeNET 发布重大版本变更(评分体系调整或证据源增删);UMLS 发布影响疾病概念集合的大版本;许可条款变更;本页引用的官方文档 URL 失效。

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • open-targets — 共享标签:基因组学与多组学 / 药物发现与化学 / 知识图谱
  • intact — 共享标签:基因组学与多组学 / 药物发现与化学
  • msigdb — 共享标签:基因组学与多组学 / 药物发现与化学
  • lipid-maps — 共享标签:基因组学与多组学 / 药物发现与化学
  • pharos — 共享标签:基因组学与多组学 / 知识图谱
  • string — 共享标签:基因组学与多组学 / 知识图谱
  • ctd — 共享标签:基因组学与多组学 / 药物发现与化学 / 知识图谱
  • alphafold — 共享标签:基因组学与多组学 / 药物发现与化学
  • alphafold — 共享标签:基因组学与多组学 / 药物发现与化学
  • pdb — 共享标签:基因组学与多组学 / 药物发现与化学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集