DrugBank — 药物与药物靶点知识库 AI-Ready Wikipedia | 千方医数集

1.2万药物 · 140万药物相互作用 · 4900靶点 · 11监管区 · 20年持续运营

来源 University of Alberta & OMx Personal Health Analytics | https://go.drugbank.com发布时间: 2026-08-14最后更新: 2026-08-14 阅读 37

信息速览

数据集名称DrugBank — 药物与药物靶点知识库 AI-Ready Wikipedia | 千方医数集
数据类型约 1.2 万药物条目,约 141 万药物-药物相互作用,约 4900 靶点
规模药物知识库,非患者数据集
接入方式University of Alberta & OMx Personal Health Analytics | https://go.drugbank.com
AI 就绪度

数据集封面

INFOBOX

| 字段 | 值 |
||-|
| 数据集名称 | DrugBank |
| 当前版本 | DrugBank 6.0 (2024 年 1 月) |
| 维护机构 | University of Alberta & OMx Personal Health Analytics, Inc. |
| 首席科学家 | David S. Wishart |
| 数据规模 | 11,891 种药物 / 1,413,413 DDI / 4,939 靶点 / 3,125 通路 |
| 数据类型 | 小分子药物、生物技术药物、靶点/酶/载体/转运蛋白、DDI、DFI、通路、光谱 |
| 监管覆盖 | 11 个国家/地区(FDA/HC/EMA/AIFA/BASG/TITCK/INVIMA/BADAN POM/NPRA/THIS/HSA) |
| DrugCard 字段数 | 200+ 字段 |
| 下载格式 | XML / SDF (2D+3D) / FASTA / CSV |
| API | Clinical Intelligence API(需许可证) |
| 许可证 | CC BY-NC 4.0(详细数据)/ CC0(词汇表+结构) |
| DUO 标签 | NPU(non-profit use only)+ CC0 subset |
| 基金来源 | CIHR / NSERC / Alberta Innovates / Genome Alberta |
| 创建年份 | 2006(DrugBank 1.0) |
| 年访问量 | >3,000 万次页面浏览 |
| 年均引用 | >5,000 次 |
| AI 就绪度评分 | 18/24 ⭐⭐⭐⭐ |
| 千方页面 | /ai-ready-dataset/drugbank/87 |

§0 E-E-A-T 信任声明与免责声明

维度 声明
经验性 (Experience) DrugBank 自 2006 年发布以来持续运营 20 年,经历 6 个主版本迭代,累计引用超过 58,000 次,被全球 1,500+ 研究机构使用
专业性 (Expertise) 由阿尔伯塔大学 David S. Wishart 教授团队与 OMx Personal Health Analytics 专业策展团队维护,策展人员包括生物信息学家、药剂师及药理学/生物化学专家
权威性 (Authorfulness) 被 Nucleic Acids Research 期刊持续收录为数据库专刊条目,是药物-靶点相互作用领域引用最多的知识库之一
可信性 (Trustworthiness) 所有数据可追溯到原始监管文件或文献来源;策展团队遵循数百项标准操作规程(SOPs);每日跟踪美国、加拿大和欧盟的药品标签更新
审核机制 [千方病案医学编辑部]交叉审核:数据集元数据、版本统计数据、许可证信息、技术规格描述
页面状态 published
免责声明 DrugBank 用于研究和学习目的,不构成医疗建议。药物信息可能随时间变化,临床决策请以最新药品说明书为准。

§1 数据集概览

§1.0 📌 30 秒速览

DrugBank 是什么?

DrugBank 是全球公认的药物与药物靶点信息"黄金标准"知识库,由加拿大阿尔伯塔大学 David S. Wishart 教授团队创建并维护。它将详细的药物化学数据与全面的药物靶点信息整合到统一的 DrugCard 条目中,每个条目包含 200+ 数据字段。

为什么对 AI 重要?

DrugBank 的药物-药物相互作用(DDI)网络和药物-靶点关系图谱是 AI 驱动的药物发现领域最广泛使用的训练和基准数据源之一。从传统的 DDI 预测到基于图神经网络(GNN)的药物重定位,DrugBank 数据支撑了大量机器学习研究。

关键数字一览:

指标 数值
药物总数 11,891
FDA 获批药物 4,563(小分子 2,751 + 生物技术 1,601)
药物-药物相互作用 1,413,413
药物-食物相互作用 2,475
唯一靶点 4,939
药物作用通路 404
药物代谢通路 2,721
带光谱数据的药物 9,464 / 11,710 小分子
监管机构覆盖 11 个国家/地区
年页面浏览 >3,000 万

§1.1 数据集摘要

DrugBank 由 David S. Wishart 教授于 2006 年在阿尔伯塔大学创建,最初作为药物发现和药物探索的计算资源发布。经过 20 年发展,DrugBank 已从最初仅包含 841 种 FDA 获准小分子药物的数据库,成长为涵盖 11,891 种药物、140 万药物相互作用、覆盖 11 个国家监管机构数据的综合性药物知识库。

DrugBank 的核心设计理念是将药物化学信息(结构、属性、分类)与药物靶点信息(序列、通路、机制)融合到统一的 DrugCard 条目中。每个 DrugCard 条目包含 200+ 数据字段,涵盖一般信息、物理化学属性、药物分类、适应症、药物相互作用、代谢、光谱数据、通路和序列等完整信息维度。

DrugBank 6.0(2024 年 1 月发布,NAR 2024 数据库专刊)是最新主版本,相较于 2018 年的 DrugBank 5.0 实现了显著扩展:FDA 获批药物增长 72%(2,646→4,563)、药物-药物相互作用增长 286%(365,984→1,413,413)、药物-食物相互作用增长 107%(1,195→2,475)。此外,v6.0 新增了大量色彩丰富、注释详尽的药物作用机制(MOA)和药物代谢(ADME)通路图,以及实验和预测的 MS/MS、1D/2D-NMR、CCS、RT、RI 光谱数据。

§1.2 为什么重要

DrugBank 在药物信息学和 AI 药物发现领域具有不可替代的地位:

  1. 黄金标准:被学术界和制药行业广泛引用为药物-靶点相互作用的权威参考数据源,年均引用 >5,000 次
  2. DDI 预测基石:DrugBank 的 DDI 网络是机器学习 DDI 预测模型最常用的训练和评估数据源,几乎所有 GNN/KG-DDI 基准论文均使用 DrugBank 数据
  3. 药物重定位引擎:多靶点活性谱和药物-疾病关联数据支持系统性的药物重定位研究
  4. 临床决策支持:DDI/DFI 检查器和结构化药物数据被集成到临床决策支持(CDS)平台
  5. 跨学科枢纽:连接化学信息学、生物信息学、药理学和临床医学,是药物数据生态系统的核心节点

§1.3 与相关数据库对比

数据库 规模 数据焦点 许可证 维护机构
DrugBank 1.2 万药物 药物+靶点+DDI+通路 CC BY-NC 4.0 / CC0 阿尔伯塔大学
ChEMBL 250 万化合物 生物活性测量 CC BY-SA 3.0 EMBL-EBI
PubChem 1.19 亿化合物 化学结构和生物实验 公共领域 NIH/NCBI/NLM
KEGG DRUG ~1.2 万药物 药物-通路-基因 自由学术/商业付费 Kanehisa Lab
SuperDRUG2 ~5,000 药物 药物产品信息 自由学术 Humboldt-Universität
DrugCentral ~6,000 药物 药物批准和靶点 CC BY-SA 4.0 UNMC

DrugBank 的差异化优势:唯一将深度药物信息(DDI、代谢、通路、光谱)与药物靶点信息整合到统一 DrugCard 结构的数据库,拥有最丰富的 DDI 数据(140 万 vs 其他数据库通常 <5 万)。

§1.4 发展时间轴

2006 ●  DrugBank 1.0 — 841 FDA 小分子药物 + 113 生物技术药物, 88 字段/DrugCard
     │
2008 ●  DrugBank 2.0 — 新增 ADMET 参数、撤市药物、违禁药物、DDI/DFI, 108 字段
     │
2011 ●  DrugBank 3.0 — 新增转运蛋白、药物通路、药品定价/专利数据, 148 字段
     │
2014 ●  DrugBank 4.0 — 新增药物代谢物结构/反应、光谱、化学分类学, 208 字段
     │
2018 ●  DrugBank 5.0 — 新增研究性药物、药物基因组学、MS/NMR 光谱
     │     ↑ 年均页面浏览突破 3000 万
     │
2024 ●  DrugBank 6.0 — FDA 获批药物 +72%, DDI +286%, 11 监管区域, 光谱+CCS/RT/RI
     │     ↑ 58,000+ 总引用, 1,500+ 机构使用
     │
2025 ●  学术下载暂时暂停(系统升级中)

§1.5 典型使用场景

场景 具体应用 涉及数据
DDI 预测 训练 GNN 预测未知药物对的相互作用 DDI 网络(140 万对)
药物重定位 利用多靶点谱发现新适应症 药物-靶点关系、适应症
药物安全监控 临床决策支持系统中的 DDI/DFI 检查 DDI/DFI 描述、严重性
靶点识别 从基因组数据出发寻找可成药靶点 靶点序列、通路
代谢预测 预测药物在体内的代谢路径和产物 代谢通路、代谢物结构
光谱匹配 LC-MS/GC-MS/NMR 代谢组学化合物鉴定 MS/MS、NMR、CCS/RT/RI

§2 医学背景

§2.1 ATC 分类与药物分类体系

DrugBank 使用 WHO ATC(Anatomical Therapeutic Chemical)分类系统对药物进行多层分类:

ATC 层级 含义 示例
第 1 级 解剖学主组(14 组) C: 心血管系统
第 2 级 治疗主组 C07: β-受体阻滞剂
第 3 级 药理治疗组 C07A: β-受体阻滞剂,单纯
第 4 级 化学亚组 C07AB: β-受体阻滞剂,非选择性
第 5 级 化学物质 C07AB02: 普萘洛尔

DrugBank 6.0 的 151 个治疗类别用于生成药物-药物相互作用规则,另有 254 种窄治疗指数(NTI)药物的内部定义。

§2.2 药物监管状态分类

DrugBank 将药物按监管状态分为以下类别:

类别 数量 (v6.0) 说明
获批小分子 2,751 FDA 或其他监管机构获批的小分子药物
获批生物技术 1,601 蛋白/肽/DNA/细胞疗法/基因治疗/疫苗
研究性 6,231 处于 Phase I/II/III 临床试验
营养保健品 3,438 营养补充剂、天然产物
实验性 6,722 临床前或早期研究阶段
撤市 317 曾获批后因安全性问题撤市
违禁 205 被列为管制/违禁物质

注意:一个药物可能同时属于多个类别(如某获批药物也是营养保健品),上述数字为各类别独立计数。

§2.3 药物-靶点关系网络

DrugBank 的药物-靶点关系网络包含四类生物实体:

实体类型 功能 v6.0 唯一实体数
Targets(靶点) 药物直接作用的目标蛋白/基因 4,939
Enzymes(酶) 参与药物代谢的酶(如 CYP450 家族) 556
Carriers(载体) 血液中的转运蛋白(如白蛋白) 526(获批药物相关)
Transporters(转运蛋白) 跨膜转运蛋白(如 P-gp) 3,408 种药物有数据

新增靶点趋势:v6.0 新增 3,446 个药物-靶点条目和 546 个新生物实体,其中约 33% 为激酶(kinase),反映激酶是过去六年最具价值的药物靶点类别。

§2.4 标准编码映射

标准 用途 DrugBank 中的映射
ATC 药物治疗分类 每种药物标注 1-5 级 ATC 代码
UniProt 蛋白靶点标识 靶点/酶/载体/转运蛋白 → UniProt ID
PubChem CID 化学结构互引 每种药物 → PubChem CID
ChEBI 化学生物学本体 药物 → ChEBI ID
KEGG 通路映射 药物 → KEGG Drug/Compound ID
PDB 蛋白结构 靶点 → PDB 结构
DrugBank ID 内部标识 DB accession(如 DB00390)

§3 数据集规格

§3.0 版本抉择矩阵

版本 发布日期 药物总数 获批药物 DDI DrugCard 字段 适合场景
6.0 2024-01 11,891 4,563 1,413,413 200+ 最新研究、DDI 预测、光谱匹配
5.1.x 2018-2025 9,591+ 2,646+ 365,984+ ~200 2018-2024 论文复现
5.0 2018-01 9,591 2,646 365,984 ~200 早期 ML 论文复现
4.3 2016-02 ~7,713 1,713 14,150 208 2014-2016 历史复现
4.0 2014-01 7,713 1,713 14,150 208 代谢物/光谱研究
3.0 2011-01 6,816 1,556 13,795 148 通路/转运蛋白研究
2.0 2008-01 4,897 1,467 13,242 108 ADMET/DDI 历史研究
1.0 2006-01 3,909 954 88 原始基准复现

版本选择建议

  • 最新研究:始终使用最新版本(当前为 5.1.22 日常更新版或 6.0 学术版)
  • 论文复现:使用论文标注的 DrugBank 版本,不同版本数据差异显著
  • DDI 预测:v5.0 DDI 数据 365,984 → v6.0 DDI 数据 1,413,413,4 倍差距

§3.1 数据模态

DrugBank 是一个多模态知识库,融合以下数据类型:

模态 数据类型 v6.0 规模 格式
化学结构 2D/3D 分子结构 11,710 小分子 SDF / SMILES / InChI
文本描述 适应症、机制、毒性描述 11,891 条目 XML text
关系网络 DDI / DFI / DTI 140 万 + 2,475 + 数十万 XML graph
通路图 MOA + ADME 通路 3,125 通路 PathWhiz 图像
光谱数据 MS/MS, NMR, CCS, RT, RI 9,464 化合物 XML / JSV
蛋白质序列 靶点/酶/载体/转运蛋白 4,939 唯一 FASTA
代谢物 结构化代谢产物 3,037 带结构 SDF
临床数据 临床试验条目 464,870 XML
监管数据 产品批准信息 11 区域 ~500K 产品 XML
分类学 化学分类层级 12,723 药物 XML

§3.2 DrugCard 结构

每个药物在 DrugBank 中以 DrugCard 形式存储,包含 200+ 字段,分为以下主要类别:

类别 关键字段 说明
一般信息 drugbank_id, name, CAS, formula, InChI, SMILES 化学标识和命名
属性 MW, logP, 水溶性, pKa, 预测光谱属性 物理化学性质
分类 ATC, Kingdom, Superclass, Class, Subclass 化学分类学
药物类别 类别标签列表 监管和功能分类
适应症 FDA 批准适应症文本 临床适应症
药理学 机制、毒性、代谢描述 药理作用
相互作用 DDI 列表、DFI 列表 药物相互作用
代谢 代谢反应、代谢物、代谢酶 ADME 数据
光谱 MS/MS, NMR (1D/2D), CCS, RT, RI 实验和预测光谱
通路 MOA 通路、ADME 通路 PathWhiz 通路图
靶点 靶点/酶/载体/转运蛋白列表 蛋白质靶点信息
序列 蛋白序列(FASTA) 靶点序列
产品 产品成分、品牌、混合物 商品信息
外部链接 PubChem, ChEBI, KEGG, Wikipedia 等 跨数据库引用

§3.3 下载格式

格式 文件 大小 许可证 内容
XML full_database.xml ~204 MB CC BY-NC 4.0 完整 DrugCard 数据
SDF (2D) structures_2d.sdf ~11 MB CC BY-NC 4.0 2D 化学结构
SDF (3D) structures_3d.sdf ~14 MB CC BY-NC 4.0 3D 化学结构
FASTA target_sequences.fasta CC BY-NC 4.0 蛋白靶点序列
CSV (Structures) structure_external_links.csv ~2 MB CC0 InChI/SMILES + PubChem CID
CSV (Targets) target_uniprot_links.csv ~468 KB CC0 药物-靶点-UniProt 映射
CSV (Enzymes) enzyme_uniprot_links.csv ~53 KB CC0 药物-酶-UniProt 映射
CSV (Carriers) carrier_uniprot_links.csv ~11 KB CC0 药物-载体-UniProt 映射
CSV (Transporters) transporter_uniprot_links.csv ~31 KB CC0 药物-转运蛋白映射
SDF (Metabolites) metabolite_structures.sdf ~1.6 MB CC BY-NC 4.0 代谢产物结构
Data Library Data Packages / Modules / Submodules varies varies 新一代模块化数据分发

重要说明:所有学术数据下载目前处于暂时暂停状态,DrugBank 正在升级数据分发系统。用户可注册邮件通知以获取恢复信息。

§3.4 采集与策展流程

DrugBank 的数据策展采用手工与自动化结合的混合模式:

策展环节 方法 频率
药物批准数据 手动从监管机构网站提取和更新 每日跟踪 FDA/HC/EMA
DDI/DFI 数据 手动策展 + NLP 辅助文献挖掘 持续
药物代谢通路 手工绘制(PathWhiz 系统) + 文献参考 持续
靶点/酶/载体数据 NLP 模型抓取 PubMed 摘要 → 人工审核 持续
光谱数据 实验测量 + 机器学习预测(RI-Pred, RTPred, AllCCS, DeepCCS) 随版本发布
监管标签更新 自动跟踪美国/加拿大/欧盟标签变更 每日
发布周期 季度数据发布 + 每日网站更新 季度 + 每日

策展团队:由阿尔伯塔大学和 OMx Personal Health Analytics 的生物信息学家、药剂师和药理学/生物化学专家组成。新策展人员需完成约 2 个月的培训周期,从平台学习到高级管理员监督下的小项目,再到独立工作。数百项 SOPs 覆盖具体策展活动。

§3.5 数据来源与监管覆盖

DrugBank 6.0 将监管数据覆盖范围从 3 个地区扩展到 11 个国家/地区:

排名 国家/地区 监管机构 产品数量
1 美国 FDA 240,511
2 意大利 AIFA 124,943
3 加拿大 Health Canada 40,922
4 哥伦比亚 INVIMA 22,452
5 土耳其 TITCK 21,596
6 泰国 THIS 16,448
7 欧盟 EMA 14,629
8 印度尼西亚 BADAN POM 12,690
9 奥地利 BASG 9,516
10 马来西亚 NPRA 9,428
11 新加坡 HSA 6,115

总监管产品:~500,000+ 产品批准记录

§3.6 许可证

DrugBank 采用分层许可证策略:

数据子集 许可证 说明
DrugBank Vocabulary CC0(公共领域) 药物标识符和名称
DrugBank Structures CC0(公共领域) 化学结构 + InChI/SMILES + PubChem 映射
Target-UniProt Links CC0(公共领域) 药物-靶点-UniProt 映射
Enzyme/Carrier/Transporter Links CC0(公共领域) 药物-酶/载体/转运蛋白映射
Full XML Database CC BY-NC 4.0 详细药物信息、DDI、通路、光谱
SDF Structures CC BY-NC 4.0 完整 2D/3D 结构
FASTA Sequences CC BY-NC 4.0 蛋白靶点序列
Website Access 免费 网页浏览免费
Commercial Use 需付费许可证 联系 OMx Personal Health Analytics

关键限制:CC BY-NC 4.0 禁止商业使用。商业用途包括:直接销售或从中获利、内部商业产品开发、作为数据产品的组成部分。资助型学术研究被视为非商业用途,不需要额外许可证。

§3.7 深度溯源链

监管机构 → 药品标签/批准文件
    │
    ├→ 手动提取 → 药物基本信息(名称、CAS、批准状态)
    ├→ NLP 挖掘 → PubMed 文献 → 药物-实体关系 → 人工审核
    ├→ PathWhiz → 手绘通路图 → 文献引用标注
    ├→ ML 模型 → 预测光谱(CCS/RT/RI)→ 实验数据校准
    └→ 每日跟踪 → FDA/HC/EMA 标签更新 → SOP 更新

每个数据字段可追溯到原始来源文献或监管文件

§4 数据结构详解

§4.1 XML 数据模型

DrugBank XML 是一种嵌套结构,核心层级如下:

<drugbank>
  <drug>
    <drugbank-id>DB00390</drugbank-id>
    <name>Digoxin</name>
    <cas-number>20830-75-5</cas-number>
    <groups>
      <group>approved</group>
    </groups>
    <calculated-properties>
      <property>
        <kind>Molecular Weight</kind>
        <value>780.939</value>
      </property>
    </calculated-properties>
    <targets>
      <target>
        <id>BE0000089</id>
        <name>Sodium/potassium-transporting ATPase subunit alpha-1</name>
        <uniprot-id>P05023</uniprot-id>
        <actions>
          <action>inhibitor</action>
        </actions>
      </target>
    </targets>
    <drug-interactions>
      <drug-interaction>
        <drugbank-id>DB00584</drugbank-id>
        <name>Amiodarone</name>
        <description>The serum concentration of Digoxin can be increased...</description>
      </drug-interaction>
    </drug-interactions>
    <pathways>
      <pathway>
        <smpdb-id>SMP00102</smpdb-id>
        <name>Digoxin Action Pathway</name>
      </pathway>
    </pathways>
  </drug>
</drugbank>

§4.2 DAIMS 标准化数据字典

DAIMS 字段 DrugBank 值
dataset_name DrugBank
dataset_version 6.0 (2024-01-05)
dataset_size ~204 MB (XML) / ~11-14 MB (SDF)
data_modality 化学/文本/关系网络/通路/光谱/序列
primary_format XML / SDF / FASTA / CSV
identifier_scheme DrugBank accession (DB#####)
primary_entities drugs (11,891), targets (4,939), DDI (1,413,413)
annotation_protocol 手工策展 + NLP + ML 预测
ground_truth_source 监管批准文件 + 文献
iaag_reported 否(无正式标注者间一致性指标)
version_control 6 个主版本 + 季度发布 + 每日更新
license CC BY-NC 4.0 (full) / CC0 (vocab+structures)
access_mechanism 学术许可证(免费)/ 商业许可证(付费)
citation_requirement 必须,引用最新 NAR 论文

§4.3 DDI 网络统计

DrugBank 6.0 的 DDI 网络是机器学习研究最常用的子集:

指标 数值
总 DDI 对数 1,413,413
涉及药物数 ~3,000+(多为获批药物)
平均每药 DDI 数 ~470
最大 DDI 数(单药) 数千(如氟康唑)
DDI 描述类型 文本描述 + 严重性等级
严重性分级 major / moderate / minor / N/A
治疗类别数(用于 DDI 规则) 151
NTI(窄治疗指数)药物数 254

DDI 网络特点:高度稀疏——大多数药物对没有相互作用,这使得随机分割会导致性能高估(warm-start 问题)。

§4.4 光谱数据覆盖

DrugBank 6.0 新增了多种实验和预测光谱数据:

光谱类型 数据来源 覆盖化合物数
MS/MS 实验 + 预测 ~9,464
1D-NMR 实验 + 预测 ~1,822
2D-NMR 实验 + 预测
CCS (碰撞截面) 实验 + ML 预测 (AllCCS, DeepCCS) ~9,464
RT (保留时间) 实验 + ML 预测 (RTPred) ~9,464
RI (保留指数) 实验 + ML 预测 (RI-Pred) ~9,464
GC-MS 衍生化 计算 ~4,000 化合物 → ~100K 衍生物

§4.5 通路数据

通路类型 v6.0 数量 v5.0 数量 增长
药物作用机制 (MOA) 404 319 +27%
药物代谢 (ADME) 2,721 1,085 +151%
总计 3,125 1,404 +123%

通路图使用 PathWhiz 系统绘制,具有以下特征:

  • 色彩丰富的器官/细胞器/分子图示

  • 详细文本描述和文献引用

  • 药物-受体/细胞/器官的直接相互作用路径

  • 交互式代谢树状视图(v6.0 新增)

§5 数据划分与使用建议

§5.1 ML 训练集构建方式

DrugBank 不提供预定义的训练/验证/测试分割。ML 研究者需要自行构建分割,常见方式如下:

分割策略 方法 适用场景 注意事项
随机分割 随机 80/10/10 基线实验 ⚠️ 高估性能(warm-start)
药物分割 按药物分割 泛化评估 更接近真实场景
时间分割 按版本分割 时间外推 需多版本数据
支架分割 按化学支架 化学泛化 减少结构泄漏
靶点分割 按靶点分割 靶点泛化 罕见但更严格

§5.2 DDI 预测数据构建

DDI 预测是 DrugBank 在 ML 中最主要的应用。标准构建流程:

  1. 提取正样本:从 DrugBank XML 中解析所有 drug-interaction 对
  2. 生成负样本:从未出现在 DDI 列表中的药物对中随机采样
  3. 特征工程:使用 SMILES → 分子指纹 / 分子图 / 蛋白序列
  4. 数据划分:随机 60/20/20(transductive)或按药物划分(inductive)

常见 DDI 基准数据集规模

  • DrugBank DDI 网络:~1,700 药物 × ~640,000 DDI 对(常用子集)
  • TWOSIDES:补充来源,来自 FAERS 不良事件报告

§5.3 使用建议

任务 推荐数据子集 预处理建议
DDI 预测 XML → DDI 网络子集 按药物分割而非随机分割
药物重定位 药物-靶点关系 + 适应症 多靶点活性谱分析
药物性质预测 SDF 结构 + calculated properties 使用 RDKit 解析 SDF
靶点识别 FASTA 序列 + 通路 BLAST 搜索 + 通路映射
光谱匹配 MS/MS + CCS + RT 使用 JSpectraViewer 可视化

§6 AI 就绪指南

§6.0 云端快速启动

# === DrugBank XML 解析与 DDI 网络构建 ===
# 前置:申请学术许可证并下载 XML 文件

import xml.etree.ElementTree as ET
import networkx as nx
from collections import defaultdict

# 1. 解析 DrugBank XML
tree = ET.parse(''''''''''''''''''''''''''''''''drugbank.xml'''''''''''''''''''''''''''''''')
root = tree.getroot()

drugs = {}
ddi_pairs = []

ns = {''''''''''''''''''''''''''''''''db'''''''''''''''''''''''''''''''': ''''''''''''''''''''''''''''''''http://www.drugbank.ca''''''''''''''''''''''''''''''''}

for drug_elem in root.findall(''''''''''''''''''''''''''''''''db:drug'''''''''''''''''''''''''''''''', ns):
    db_id = drug_elem.find(''''''''''''''''''''''''''''''''db:drugbank-id'''''''''''''''''''''''''''''''', ns).text
    name = drug_elem.find(''''''''''''''''''''''''''''''''db:name'''''''''''''''''''''''''''''''', ns).text
    
    # 提取分组
    groups = [g.text for g in drug_elem.findall(''''''''''''''''''''''''''''''''db:groups/db:group'''''''''''''''''''''''''''''''', ns)]
    
    # 提取 SMILES
    props = drug_elem.find(''''''''''''''''''''''''''''''''db:calculated-properties'''''''''''''''''''''''''''''''', ns)
    smiles = None
    if props is not None:
        for prop in props.findall(''''''''''''''''''''''''''''''''db:property'''''''''''''''''''''''''''''''', ns):
            if prop.find(''''''''''''''''''''''''''''''''db:kind'''''''''''''''''''''''''''''''', ns).text == ''''''''''''''''''''''''''''''''SMILES'''''''''''''''''''''''''''''''':
                smiles = prop.find(''''''''''''''''''''''''''''''''db:value'''''''''''''''''''''''''''''''', ns).text
                break
    
    drugs[db_id] = {''''''''''''''''''''''''''''''''name'''''''''''''''''''''''''''''''': name, ''''''''''''''''''''''''''''''''groups'''''''''''''''''''''''''''''''': groups, ''''''''''''''''''''''''''''''''smiles'''''''''''''''''''''''''''''''': smiles}
    
    # 提取 DDI
    interactionevent-blocked= drug_elem.find(''''''''''''''''''''''''''''''''db:drug-interactions'''''''''''''''''''''''''''''''', ns)
    if interactions is not None:
        for inter in interactions.findall(''''''''''''''''''''''''''''''''db:drug-interaction'''''''''''''''''''''''''''''''', ns):
            target_id = inter.find(''''''''''''''''''''''''''''''''db:drugbank-id'''''''''''''''''''''''''''''''', ns).text
            ddi_pairs.append((db_id, target_id))

# 2. 构建 DDI 网络
G = nx.Graph()
G.add_edges_from(ddi_pairs)

print(f"Drugs: {len(drugs)}")
print(f"DDI pairs: {len(ddi_pairs)}")
print(f"Network nodes: {G.number_of_nodes()}")
print(f"Network edges: {G.number_of_edges()}")

§6.1 使用 RDKit 处理化学结构

from rdkit import Chem
from rdkit.Chem import AllChem, DataStructs
import numpy as np

# 加载 SDF
suppl = Chem.SDMolSupplier(''''''''''''''''''''''''''''''''structures_2d.sdf'''''''''''''''''''''''''''''''')
molecules = [m for m in suppl if m is not None]

# 生成 Morgan 指纹
fingerprints = []
for mol in molecules:
    fp = AllChem.GetMorganFingerprintAsBitVect(mol, radius=2, nBits=2048)
    arr = np.zeros((1,), dtype=np.int8)
    DataStructs.ConvertToNumpyArray(fp, arr)
    fingerprints.append(arr)

X = np.array(fingerprints)
print(f"Molecules: {len(molecules)}, Fingerprint dim: {X.shape[1]}")

§6.2 PyTorch DDI 预测 DataLoader

import torch
from torch.utils.data import Dataset, DataLoader
from rdkit import Chem
from rdkit.Chem import AllChem
import numpy as np

class DrugBankDDIDataset(Dataset):
    """DrugBank DDI 预测数据集"""
    
    def __init__(self, drug_pairs, labels, smiles_dict, fp_radius=2, n_bits=2048):
        self.drug_pairs = drug_pairs
        self.labels = labels
        self.smiles_dict = smiles_dict
        self.fp_cache = {}  # 缓存指纹避免重复计算
        
    def _get_fingerprint(self, smiles):
        if smiles not in self.fp_cache:
            mol = Chem.MolFromSmiles(smiles)
            if mol is None:
                self.fp_cache[smiles] = np.zeros(2048, dtype=np.float32)
            else:
                fp = AllChem.GetMorganFingerprintAsBitVect(mol, 2, 2048)
                arr = np.zeros((2048,), dtype=np.float32)
                from rdkit.DataStructs import ConvertToNumpyArray
                ConvertToNumpyArray(fp, arr)
                self.fp_cache[smiles] = arr
        return self.fp_cache[smiles]
    
    def __len__(self):
        return len(self.drug_pairs)
    
    def __getitem__(self, idx):
        drug_a, drug_b = self.drug_pairs[idx]
        fp_a = self._get_fingerprint(self.smiles_dict[drug_a])
        fp_b = self._get_fingerprint(self.smiles_dict[drug_b])
        
        # 特征拼接:[fp_a, fp_b, fp_a * fp_b]
        features = np.concatenate([fp_a, fp_b, fp_a * fp_b])
        
        return (
            torch.FloatTensor(features),
            torch.FloatTensor([self.labels[idx]])
        )

# 使用示例
# dataset = DrugBankDDIDataset(pairs, labels, smiles_map)
# loader = DataLoader(dataset, batch_size=256, shuffle=True, num_workers=4)

§6.3 预处理管道

# DrugBank XML → 结构化 DataFrame
import pandas as pd
import xml.etree.ElementTree as ET

def parse_drugbank_to_dataframe(xml_path):
    """将 DrugBank XML 转换为 pandas DataFrame"""
    tree = ET.parse(xml_path)
    root = tree.getroot()
    ns = {''''''''''''''''''''''''''''''''db'''''''''''''''''''''''''''''''': ''''''''''''''''''''''''''''''''http://www.drugbank.ca''''''''''''''''''''''''''''''''}
    
    records = []
    for drug in root.findall(''''''''''''''''''''''''''''''''db:drug'''''''''''''''''''''''''''''''', ns):
        record = {}
        
        # 基本信息
        record[''''''''''''''''''''''''''''''''drugbank_id''''''''''''''''''''''''''''''''] = drug.find(''''''''''''''''''''''''''''''''db:drugbank-id'''''''''''''''''''''''''''''''', ns).text
        record[''''''''''''''''''''''''''''''''name''''''''''''''''''''''''''''''''] = drug.find(''''''''''''''''''''''''''''''''db:name'''''''''''''''''''''''''''''''', ns).text
        cas = drug.find(''''''''''''''''''''''''''''''''db:cas-number'''''''''''''''''''''''''''''''', ns)
        record[''''''''''''''''''''''''''''''''cas''''''''''''''''''''''''''''''''] = cas.text if cas is not None else None
        
        # 分组
        groups = drug.findall(''''''''''''''''''''''''''''''''db:groups/db:group'''''''''''''''''''''''''''''''', ns)
        record[''''''''''''''''''''''''''''''''groups''''''''''''''''''''''''''''''''] = ''''''''''''''''''''''''''''''''|''''''''''''''''''''''''''''''''.join([g.text for g in groups])
        record[''''''''''''''''''''''''''''''''is_approved''''''''''''''''''''''''''''''''] = ''''''''''''''''''''''''''''''''approved'''''''''''''''''''''''''''''''' in record[''''''''''''''''''''''''''''''''groups'''''''''''''''''''''''''''''''']
        
        # 属性
        props = drug.find(''''''''''''''''''''''''''''''''db:calculated-properties'''''''''''''''''''''''''''''''', ns)
        if props is not None:
            for prop in props.findall(''''''''''''''''''''''''''''''''db:property'''''''''''''''''''''''''''''''', ns):
                kind = prop.find(''''''''''''''''''''''''''''''''db:kind'''''''''''''''''''''''''''''''', ns).text
                value = prop.find(''''''''''''''''''''''''''''''''db:value'''''''''''''''''''''''''''''''', ns).text
                record[f''''''''''''''''''''''''''''''''calc_{kind.lower().replace(" ", "_")}''''''''''''''''''''''''''''''''] = value
        
        # 靶点数
        targets = drug.find(''''''''''''''''''''''''''''''''db:targets'''''''''''''''''''''''''''''''', ns)
        record[''''''''''''''''''''''''''''''''n_targets''''''''''''''''''''''''''''''''] = len(targets.findall(''''''''''''''''''''''''''''''''db:target'''''''''''''''''''''''''''''''', ns)) if targets is not None else 0
        
        # DDI 数
        interactionevent-blocked= drug.find(''''''''''''''''''''''''''''''''db:drug-interactions'''''''''''''''''''''''''''''''', ns)
        record[''''''''''''''''''''''''''''''''n_ddi''''''''''''''''''''''''''''''''] = len(interactions.findall(''''''''''''''''''''''''''''''''db:drug-interaction'''''''''''''''''''''''''''''''', ns)) if interactions is not None else 0
        
        records.append(record)
    
    return pd.DataFrame(records)

# df = parse_drugbank_to_dataframe(''''''''''''''''''''''''''''''''drugbank.xml'''''''''''''''''''''''''''''''')
# print(df[[''''''''''''''''''''''''''''''''drugbank_id'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''name'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''is_approved'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''n_targets'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''n_ddi'''''''''''''''''''''''''''''''']].head())

§6.4 坑点与避雷指南

坑点 1:CC BY-NC 4.0 非商业许可限制

问题:DrugBank 的核心数据(XML、SDF、FASTA)采用 CC BY-NC 4.0 许可证,禁止商业用途。许多 ML 研究者在使用 DrugBank 数据训练模型后,将模型部署到商业产品中,可能违反许可协议。

影响:商业用途包括直接销售、内部商业产品开发、作为数据产品组件。甚至资助型学术研究也需要确认是否符合"非商业"定义。

解决方案

  • 使用 CC0 子集(Vocabulary + Structures + Target/Enzyme/Carrier/Transporter Links)进行商业模型训练
  • 商业部署需联系 OMx 购买商业许可证
  • 明确标注使用了哪个许可证的数据子集
坑点 2:学术下载暂时暂停

问题:截至 2025 年,所有学术数据下载已暂时暂停,DrugBank 正在升级数据分发系统。研究者无法直接下载 XML/SDF 文件。

影响:无法获取最新版本数据进行研究。

解决方案

  • 注册 DrugBank 邮件通知,等待下载恢复
  • 使用已下载的旧版本数据(如 v5.1.x),注意标注版本
  • 使用 CC0 子集(结构/词汇表/靶点映射)替代部分需求
  • 通过 DrugBank 网站界面手动查询特定药物信息
坑点 3:DDI 数据严重不平衡与随机分割高估

问题:DrugBank 包含 140 万 DDI 对,但涉及约 3,000 种药物。如果随机分割训练/测试集,测试集中的药物几乎全部出现在训练集中(warm-start),导致 AUROC/AUPR 高达 0.97-0.99,但泛化能力虚假。

影响:大量 DDI 预测论文报告 AUROC >0.95,但在实际应用中对新药的预测性能大幅下降。

解决方案

  • 使用药物分割而非随机分割
  • 报告 inductive(unseen drug)设定下的性能
  • 参考 DM-DDI、MCFF-MTDDI、SA-DDI 等的 inductive 评估协议
  • 使用时间分割(用旧版本训练,新版本测试)
坑点 4:版本不一致导致结果不可复现

问题:不同 ML 论文使用不同 DrugBank 版本(4.0/5.0/5.1.x/6.0),DDI 数据从 14,150 对(v4.0)到 1,413,413 对(v6.0)差距近 100 倍。论文间性能比较无意义。

影响:2014 年使用 v4.0 的论文报告 AUROC 0.95,2024 年使用 v6.0 的论文也报告 0.95,但数据规模完全不同。

解决方案

  • 论文中必须明确标注使用的 DrugBank 版本号
  • 基准比较时确保使用同一版本
  • 考虑版本差异对结果的影响
  • 引用原始 NAR 论文对应的版本
坑点 5:XML 嵌套结构不适合直接 ML 处理

问题:DrugBank 的 XML 是高度嵌套的结构化文档,包含 DrugCard 的 200+ 字段。直接用 XML 解析器加载后,数据无法直接用于 ML——需要大量预处理。

影响:新手研究者可能在数据预处理上花费大量时间。

解决方案

  • 使用 xml.etree.ElementTreelxml 解析
  • 预先构建 pandas DataFrame 或 NetworkX 图
  • 使用 CC0 CSV 子集作为快速起点(靶点/酶/载体/转运蛋白映射)
  • 参考本百科 §6.3 的预处理代码模板
坑点 6:靶点实体跨版本变更

问题:DrugBank 在不同版本间会合并、拆分或移除靶点实体。某些在 v5.0 中存在的靶点在 v6.0 中可能被合并或删除,导致跨版本比较时出现不一致。

影响:使用 v5.0 训练的模型在 v6.0 数据上评估时,靶点 ID 可能不匹配。

解决方案

  • 使用 UniProt ID 而非 DrugBank 内部 ID 作为靶点标识
  • 在版本迁移时进行靶点 ID 映射
  • 记录训练和评估使用的靶点集合

§6.5 数据增强策略

策略 方法 适用任务
负样本采样 从非 DDI 药物对中采样 DDI 预测
子结构提取 从分子图中提取功能子结构 分子性质预测
SMILES 增强 生成等价 SMILES 表示 分子编码
图增强 边删除/节点遮蔽 GNN 预训练
跨数据集迁移 ChEMBL/PubChem 预训练 → DrugBank 微调 低资源场景
NLP 辅助 PubMed 摘要 → 药物-实体关系 DDI/DTI 扩展

§6.6 模型推荐

任务 推荐方法 关键论文 典型性能
DDI 预测 SSF-DDI (序列+子结构) BMC Bioinformatics 2024 AUC 98.92% (transductive)
DDI 预测 DeepDrug (GNN) BMC Bioinformatics 2023 F1 0.916-0.955, auPRC 0.964-0.987
DDI 预测 KG-DDI (知识图) Comm. Medicine 2024 AUPR 0.978 (knowledge subgraph)
DTI 预测 DeepDTA / GraphDTA Bioinformatics 2018/2020
药物重定位 Network-based
ADR 预测 Decagon Bioinformatics 2018 AUROC 0.87 (polypharmacy)
分子性质 GNN / Transformer

§6.7 硬件需求

任务 数据规模 推荐 GPU 训练时间
DDI 预测(小分子) ~640K 对, 2K 指纹 1× RTX 3080 (10GB) 1-2 小时
DDI 预测(GNN) ~640K 对, 分子图 1× RTX 4090 (24GB) 4-8 小时
DTI 预测 ~100K 对 1× RTX 3090 (24GB) 2-4 小时
全库图谱嵌入 ~12K 药物, ~140 万 DDI 1× A100 (40GB) 8-16 小时

§6.8 评估指标

任务 推荐指标 说明
DDI 预测 AUROC + AUPR + F1 ⚠️ 必须报告 AUPR(类不平衡)
DDI 多分类 micro-F1 + macro-F1 不同交互类型权重不同
DTI 预测 AUROC + AUPR 同 DDI
药物重定位 Hit Rate + Enrichment Factor Top-K 排序质量
分子性质 RMSE / MAE / R² 回归任务
Inductive DDI AUROC + AUPR (unseen drugs) ⚠️ 必须报告 inductive 性能

§7 质量评估与局限性

§7.1 数据偏倚

偏倚类型 描述 影响 缓解策略
发表偏倚 文献数据倾向于阳性结果和已知药物 新药/罕见药覆盖不足 结合 TWOSIDES 等补充来源
小分子主导 11,710 小分子 vs 181 生物技术药物 生物技术药物 DDI 数据不足 分子类型分层分析
获批药物 DDI 集中 ~80% DDI 涉及获批药物 研究性药物 DDI 不足 按药物分组分别评估
西方监管主导 FDA/HC/EMA 产品占多数 亚洲/非洲药品可能缺失 多区域数据互补
激酶靶点增长 v6.0 新增靶点 33% 为激酶 激酶靶点过度代表 靶点类别平衡采样
通路偏倚 通路多为获批药物 研究性药物通路不足

§7.2 标注质量

维度 评估 说明
策展标准 ✅ 高 SOPs 覆盖数百项活动,~2 月培训周期
策展团队 ✅ 高 生物信息学家 + 药剂师 + 药理学专家
NLP 辅助 ✅ 中高 NLP 模型自动挖掘 → 人工审核
质量审核 ✅ 中高 资深策展员审核
正式 IAA ❌ 无 无正式标注者间一致性(Inter-Annotator Agreement)指标报告
可追溯性 ✅ 高 每个数据项可追溯到原始来源

§7.3 泛化性

维度 评估 说明
化学空间覆盖 ⚠️ 中 小分子覆盖广,但偏向已批准和研究性药物
靶点空间覆盖 ⚠️ 中 4,939 靶点覆盖人类蛋白组的一小部分
DDI 覆盖 ⚠️ 中高 140 万 DDI,但高度集中于获批药物
物种覆盖 ⚠️ 低 几乎完全人类药物,兽药覆盖极少
药物类型覆盖 ⚠️ 低 181 生物技术药物 vs 11,710 小分子(极度不平衡)

§7.4 伦理与合规

维度 评估 说明
患者隐私 ✅ N/A 所有数据来自公开监管文件和文献,无患者数据
IRB 审批 ✅ N/A 不涉及人体研究,无需 IRB
数据使用同意 ✅ 合规 CC BY-NC 4.0 / CC0 明确许可条款
商业使用限制 ⚠️ 注意 CC BY-NC 4.0 禁止商业使用,需购买许可证
冲突声明 ✅ 透明 OMx 同时运营商业产品(可能存在利益相关)

§7.5 公平性评估

DrugBank 数据本质上不存在传统 ML 意义上的人口统计学公平性问题(无患者数据)。但存在以下结构性公平性挑战:

公平性维度 状态 说明
药物类型公平 生物技术药物严重低代表(181 vs 11,710)
疾病覆盖公平 ⚠️ 常见病药物覆盖好,罕见病药物不足
监管区域公平 ⚠️ 西方监管数据主导,发展中国家药品不足
靶点类型公平 ⚠️ 激酶类靶点过度增长(v6.0 新增 33%)

§7.6 外部验证

验证维度 验证方法 结果 来源
药物信息准确性 与 FDA 标签交叉验证 ✅ 一致 FDA 官方数据
靶点标注准确性 与 UniProt 交叉验证 ✅ 蛋白质序列匹配 UniProt 映射
化学结构正确性 与 PubChem 交叉验证 ✅ InChI Key 匹配 PubChem CID 映射
DDI 完整性 与 TWOSIDES 交叉验证 ⚠️ 互补但不完全重叠 TWOSIDES (FAERS)
引用影响力 PubMed 引用趋势 ✅ 持续增长 PubMed
行业采纳 1,500+ 机构使用 ✅ 广泛采纳 DrugBank 官方

§7.7 DAIMS 24 项数据就绪度评估

# 评估项 评分 说明
1 数据集标识 清晰的 DrugBank ID + NAR DOI
2 访问机制 学术许可证 + 商业许可证 + CC0 子集
3 数据格式与标准 XML/SDF/FASTA/CSV + ATC/UniProt/PubChem 映射
4 来源溯源 所有数据可追溯到监管文件或文献
5 标注者间一致性 无正式 IAA 指标
6 缺失数据处理 结构化数据字段,缺失字段标注清晰
7 隐私与合规 公开监管数据,无隐私问题
8 人口统计学 N/A 非患者数据集
9 偏倚文档化 论文中讨论了数据来源和增长趋势
10 使用意图 明确用于研究、学习和临床决策支持
11 伦理审查 N/A 公开监管数据,无需 IRB
12 人群代表性 N/A 非患者数据集
13 质量指标 SOPs + 人工审核 + NLP 辅助
14 纵向数据 非纵向数据(按版本快照而非时间序列)
15 版本控制 6 个主版本 + 季度发布 + 每日更新
16 文档化 200+ 字段/DrugCard + 完整文档
17 使用追踪 >3,000 万年浏览量
18 引用追踪 >5,000 年均引用
19 分发权限 CC BY-NC 4.0 + CC0 分层
20 真值质量 监管来源 + 文献验证
21 公平性与代表性 ⚠️ 小分子/获批药物/激酶过度代表
22 数据偏倚评估 偏倚已识别和文档化
23 长期追踪 20 年 6 版本持续运营
24 临床部署 ⚠️ 用于 CDS 但非临床工具本身

DAIMS 评分:18/24 ⭐⭐⭐⭐ (排除 2 个 N/A 项后有效评分 18/22 = 82%)

扣分项

  • #5 IAA:手工策展但无正式标注者间一致性指标(-1 分)
  • #14 纵向数据:按版本快照而非患者时间序列(-1 分)
  • #21 公平性:小分子/获批药物/激酶过度代表(-1 分)
  • #24 临床部署:用于 CDS 但本身非临床工具(-1 分)

评分说明:DrugBank 作为药物知识库而非临床数据集,在数据溯源、版本控制、文档化和引用追踪方面表现卓越。许可证限制(CC BY-NC 4.0)是商业 AI 应用的主要障碍。

§7.8 外部验证矩阵

验证维度 验证方法 结果 来源
药物批准信息 与 FDA Orange Book 交叉验证 ✅ 获批药物信息一致 FDA
靶点标注准确性 与 UniProt 交叉验证 ✅ 蛋白质靶点匹配 UniProt
化学结构正确性 与 PubChem CID 交叉验证 ✅ InChI Key 匹配 PubChem
DDI 完整性 与 TWOSIDES 交叉验证 ⚠️ 互补但不完全重叠 TWOSIDES
通路正确性 与 KEGG 交叉验证 ✅ 通路一致 KEGG
网站可用性 年访问量监控 ✅ >3,000 万年浏览 DrugBank
引用影响力 PubMed 引用趋势 ✅ 持续增长 PubMed

§8 基准性能与生态

§8.1 DDI 预测排行榜

DrugBank DDI 网络是 DDI 预测模型最广泛使用的基准数据集。以下为代表性方法及性能:

Transductive 设定(随机分割,药物在训练集中出现)
排名 方法 年份 AUROC AUPR F1 特征
1 SSF-DDI 2024 0.9892 0.978 序列 + 子结构
2 DGNN-DDI 2023 0.9894 0.967 子结构注意力 GNN
3 DeepDrug 2023 0.988 0.987 0.955 Res-GCN + 序列
4 CLDDI 2023 0.9923 0.9886 对比学习 GCN
5 GMPNN-CS 2023 0.978 0.965 门控信息传递
6 GAT-DDI 2022 0.976 0.960 图注意力网络
7 SSI-DDI 2021 0.972 0.954 子结构交互
8 DeepDDI 2018 0.970 0.942 结构相似性
9 SkipGNN 2020 0.965 0.937 跳跃图网络
10 MR-GNN 2020 0.960 0.930 多分辨率 GNN
Inductive 设定(未见药物,更真实的泛化评估)
排名 方法 年份 AUROC AUPR 设定
1 CLDDI 2023 0.94 0.88 unseen drugs
2 SA-DDI 2022 0.92 0.85 scaffold split
3 DM-DDI 2022 0.88 0.78 unseen drugs
4 MCFF-MTDDI 2023 0.85 0.72 known-new
5 PEB-DDI 2023 0.82 0.68 drug holdout

关键发现:Transductive 性能(AUROC >0.97)与 Inductive 性能(AUROC 0.82-0.94)差距显著,证实了随机分割导致的性能高估问题。

§8.2 DrugBank 在 AI 药物发现中的角色

研究方向 代表方法 使用方式 DrugBank 角色
DDI 预测 DeepDDI, DeepDrug, GNN-based DDI 网络训练 标准训练数据
药物重定位 Network-based, KG-based 多靶点谱分析 药物-靶点关系来源
DTI 预测 DeepDTA, GraphDTA 化合物-靶点对训练 靶点-药物关系
ADR 预测 Decagon 多药副作用预测 DDI + 靶点网络
药物性质预测 ChemBERTa, MolBERT 预训练 + 微调 化学结构来源
临床决策支持 DDI checker 实时 DDI 检查 DDI 描述 + 严重性
代谢组学 LC-MS/GC-MS 匹配 化合物鉴定 光谱数据库

§8.3 关键论文与引用

年份 论文 期刊 意义
2024 DrugBank 6.0: the DrugBank Knowledgebase for 2024 (Knox et al.) Nucleic Acids Research 最新 NAR 论文
2017 DrugBank 5.0: a major update (Wishart et al.) Nucleic Acids Research v5.0 发布
2014 DrugBank 4.0: shedding new light on drug metabolism (Law et al.) Nucleic Acids Research v4.0 代谢数据
2011 DrugBank 3.0: a comprehensive resource for ‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘‘omics’’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’ research (Knox et al.) Nucleic Acids Research v3.0 通路/转运蛋白
2008 DrugBank: a knowledgebase for drugs (Wishart et al.) Nucleic Acids Research v2.0 ADMET
2006 DrugBank: a comprehensive resource for in silico drug discovery (Wishart et al.) Nucleic Acids Research 首次发布 v1.0

§8.4 全球使用统计

指标 数值
年页面浏览量 >30,000,000
年均引用 >5,000
总引用 >58,000
使用机构 1,500+
引用出版物 58,000+
DrugBank 引用 (Google Scholar) ~40,000+ (v6.0 论文)

§8.5 相关数据集与生态系统

资源 描述 关系
HMDB 人类代谢组数据库(40,000+ 代谢物) 同一系列
T3DB 毒素和毒素数据库(3,100 化合物) 同一系列
SMPDB 小分子通路数据库(700+ 通路) 通路来源
FooDB 食品成分数据库(28,000 成分) 同一系列
ChEMBL 生物活性数据库 互引
PubChem 化学结构数据库 互引(PubChem CID)
KEGG DRUG 药物-通路-基因数据库 通路互引
UniProt 蛋白质数据库 靶点映射
TWOSIDES FAERS 不良事件 DDI DDI 互补
DrugCentral 药物批准和靶点 信息互补

§8.6 软件与工具生态

工具 描述 来源
PathWhiz 通路绘制系统 University of Alberta
JSpectraViewer 交互式光谱查看
DrugBank DDI Checker 在线 DDI/DFI 检查器 go.drugbank.com
Data Library 模块化数据分发(Data Package / Module / Submodule) go.drugbank.com
Clinical Intelligence API RESTful API 需许可证
RDKit 化学信息学工具包 rdkit.org
DeepChem 深度学习分子建模 deepchem.io

§8.7 生态快照

                         ┌─────────────────────┐
                         │   DrugBank 核心      │
                         │  11,891 drugs        │
                         │  1.4M DDI            │
                         │  4,939 targets       │
                         │  3,125 pathways      │
                         └────────┬────────────┘
                                  │
          ┌───────────────────────┼───────────────────────┐
          │                       │                       │
  ┌───────▼───────┐    ┌──────────▼──────────┐   ┌───────▼───────┐
  │   数据来源层    │    │   消费者/应用层       │   │  交叉引用层    │
  │                │    │                      │   │               │
  │ • FDA (US)     │    │ • DDI 预测 (GNN)     │   │ • PubChem CID │
  │ • HC (Canada)  │    │ • 药物重定位         │   │ • UniProt     │
  │ • EMA (EU)     │    │ • 靶点识别          │   │ • ChEBI       │
  │ • AIFA (Italy) │    │ • 临床决策支持       │   │ • KEGG        │
  │ • 7 其他机构    │    │ • 光谱匹配          │   │ • ChEMBL      │
  │ • PubMed NLP   │    │ • 药物安全监控       │   │ • PDB         │
  │ • 每日标签跟踪  │    │ • ADR 预测         │   │ • Wikipedia   │
  └────────────────┘    └──────────────────────┘   └───────────────┘

  ┌────────────────┐    ┌──────────────────────┐
  │  同系列数据库   │    │    基础设施层        │
  │                │    │                      │
  │ • HMDB         │    │ • 阿尔伯塔大学       │
  │ • T3DB         │    │ • OMx Health        │
  │ • SMPDB        │    │ • Elasticsearch     │
  │ • FooDB        │    │ • PathWhiz          │
  │                │    │ • JSpectraViewer    │
  └────────────────┘    └──────────────────────┘

§9 相关资源与引用

§9.1 官方资源

资源 URL
DrugBank 主站 https://go.drugbank.com/
DrugBank 下载 https://go.drugbank.com/releases/latest
DrugBank 历史版本 https://go.drugbank.com/downloads/archived
DrugBank 信任中心 https://trust.drugbank.com/
DrugBank FAQ https://go.drugbank.com/guides/faqs
联系邮箱 info@drugbank.ca
Twitter @drugbankdb

§9.2 引用格式

引用 DrugBank 数据库 (NAR 2024):

@article{knox2024drugbank,
  title={DrugBank 6.0: the DrugBank Knowledgebase for 2024},
  author={Knox, Craig and Wilson, Mike and Klinger, Christen M. and 
          Franklin, Mark and Oler, Eponine and Wilson, Alex and 
          Pon, Allison and Cox, Jordan and Chin, Na Eun (Lucy) and 
          Strawbridge, Seth A. and others and Wishart, David S.},
  journal={Nucleic Acids Research},
  volume={52},
  number={D1},
  pages={D1265D1275},
  year={2024},
  doi={10.1093/nar/gkad976}
}

引用历史版本

@article{wishart2018drugbank5,
  title={DrugBank 5.0: a major update to the DrugBank database for 2018},
  author={Wishart, David S. and Feunang, Yannick D. and Guo, An Chi and 
          Lo, Elizabeth J. and Marcu, Ana and Grant, Jason R. and 
          Sajed, Tanvir and Johnson, Daniel and Li, Carin and 
          Sayeeda, Zinat and others},
  journal={Nucleic Acids Research},
  volume={46},
  number={D1},
  pages={D1074D1082},
  year={2018},
  doi={10.1093/nar/gkx1037}
}

§9.3 相关数据库

数据库 关系 比较
ChEMBL 互引 更大规模(250 万化合物)但无 DDI 数据,CC BY-SA 3.0
PubChem 互引 更大规模(1.19 亿化合物),公共领域许可,但无 DDI/通路
KEGG DRUG 通路互引 更强通路-基因映射,但规模较小
TWOSIDES DDI 互补 来自 FAERS 不良事件,不同于 DrugBank 文献策展的 DDI
BindingDB 无直接关系 专注结合亲和力,可与 DrugBank 靶点互补
DrugCentral 信息互补 专注药物批准和靶点,CC BY-SA 4.0

§9.4 推荐阅读

  1. Knox et al. (2024) — “DrugBank 6.0: the DrugBank Knowledgebase for 2024” — NAR 最新论文,全面描述 v6.0 的数据扩展和新功能
  2. Wishart et al. (2018) — “DrugBank 5.0” — v5.0 版本论文,首次引入研究性药物和基因组学数据
  3. Wishart et al. (2006) — “DrugBank: a comprehensive resource for in silico drug discovery and exploration” — 原始论文,奠定 DrugBank 在药物信息学领域的地位
  4. Kastrin et al. (2018) — “Large-scale prediction of drug-drug interactions: a recommendation framework” — DDI 预测基准研究

§10 AI 使用声明卡

§10.1 数据集标识

字段
数据集名称 DrugBank
版本 DrugBank 6.0 (2024-01-05) / 5.1.22 (日常更新版)
DOI https://doi.org/10.1093/nar/gkad976
URL https://go.drugbank.com/
许可证 CC BY-NC 4.0 (full data) / CC0 (vocabulary + structures)
千方页面 https://www.qianfanghub.com/ai-ready-dataset/drugbank/87

§10.2 AI 使用建议

使用方式 建议 注意事项
模型训练数据 ✅ 推荐 使用 XML → DDI/DTI 网络,注意版本一致性
模型验证数据 ✅ 推荐 使用 inductive 设定(unseen drugs)
生产部署 ⚠️ 谨慎 CC BY-NC 4.0 限制商业使用,需购买商业许可证
学术研究 ✅ 推荐 学术许可证免费(暂停中,等待恢复)
商业应用 ⚠️ 注意 仅可使用 CC0 子集(词汇表+结构+靶点映射)
数据再分发 ❌ 禁止 禁止再分发 DrugBank 数据,衍生数据需同许可证

§10.3 已知局限

  1. 学术下载暂停:截至 2025 年,所有学术数据下载已暂时暂停
  2. 许可证限制:CC BY-NC 4.0 禁止商业使用,商业部署需购买许可证
  3. DDI 数据不平衡:大多数药物对无相互作用,随机分割导致性能高估
  4. 版本不一致:不同论文使用不同版本,性能比较无意义
  5. 小分子主导:11,710 小分子 vs 181 生物技术药物,极度不平衡
  6. 无正式 IAA:策展质量高但无正式标注者间一致性指标

§10.4 人工校验表

检查项 状态 说明
数据集基本事实 ✅ 已通过 药物/DDI/靶点/通路数量与 v6.0 NAR 论文一致
许可证信息 ✅ 已通过 CC BY-NC 4.0 (full) / CC0 (vocab+structures) 确认于官方 FAQ
版本统计数据 ✅ 已通过 版本历史与 Wikipedia 和官方下载页面一致
技术规格描述 ✅ 已通过 XML/SDF/FASTA/CSV 格式与官方下载页面一致
基金来源 ✅ 已通过 CIHR/NSERC/Alberta Innovates/Genome Alberta 确认
页面状态 published 无未定稿字样

§10.5 联系与反馈

  • DrugBank 官方帮助:info@drugbank.ca
  • 商业许可咨询:通过 go.drugbank.com 联系销售团队
  • 报告数据错误:通过 DrugBank 网站联系表单
  • 千方病案反馈:如有本百科内容错误,请联系千方病案医学编辑部

千方医数集 | 本页面由千方病案医学编辑部交叉审核 | 页面状态:published | 最后更新:2026-08-10

DrugBank 是 University of Alberta 和 OMx Personal Health Analytics 的产品,主要资金来自 CIHR、NSERC、Alberta Innovates 和 Genome Alberta。本页面不构成医疗建议。使用 DrugBank 数据进行 AI 模型训练时,请遵守 CC BY-NC 4.0 许可证条款,商业用途需联系 OMx 获取许可证。

返回 AI-Ready 数据集