信息速览
# DrugBank — 药物知识库 AI-Ready Wikipedia
— 药物知识库 AI-Ready Wikipedia
INFOBOX
| 属性 | 内容 |
|---|---|
| 全称 | DrugBank(DrugBank Online;旧域 drugbank.ca → go.drugbank.com) |
| 发布方 | University of Alberta + The Metabolomics Innovation Centre(TMIC),David S. Wishart 实验室 |
| 首发/现行 | 2006 首发(v1);现行 v6.0(2024-01-05)——Knox et al., NAR 52:D1265-D1275 |
| 核心规模 | 11,891 个药物条目(FDA 批准 4,563、研究性 6,231);4,939 条非冗余蛋白序列(靶点/酶/转运体/载体) |
| 关系数据 | DDI 1,413,413 条(较 v5.0 +300%);药物-食物相互作用 2,475 条 |
| 光谱资产 | 11,710 小分子中 9,464 个含 MS/MS + 1D/2D-NMR + CCS/RT/RI(实验+预测) |
| 字段密度 | 每个 DrugCard 200+ 数据字段(药物/化学与靶点/蛋白各半) |
| 访问模式 | 网页免费浏览;数据下载/再分发需许可——学术非商业免费/优惠、商业付费(非 CC 开放) |
| 引用义务 | 使用条款强制引用 Knox et al. 2024(DOI 10.1093/nar/gkad976) |
| 影响力 | 年均 3,000 万+ 页面访问;58,000+(官方 2026 口径,早年口径 65,000+) publications 引用;1,500+ 研究机构 |
| 姊妹库 | HMDB(代谢物)、T3DB(毒物)、SMPDB(通路图)、FooDB(食物成分)——Wishart 套件 |
| 本库关联 | chembl(活性测量对照)、 套件 |
| 本库关联 | chembl(活性测量对照)、drugcentral(开源 DDI 对照)、pharmgkb(药物基因组学)、h(开源 DDI 对照)、性测量对照)、drugcentral(开源 DDI 对照)、pharmgkb(药物基因组学)、hmdb(代谢物)、clinicaltri(药物基因组学)、hmdb(代谢物)、照)、pharmgkb(药物基因组学)、hmdb(代谢物)、clinicaltrials-gov(试验)、PDBbind(结合亲和力) |
§0 E(试验)、b(代谢物)、clinicaltrials-gov(试验)、PDBbind(结合亲和力) |
§0 E-E-A-T 信任声明与(结合亲和力) |
§0 E-E-A-T 信任声明与免责声明
本页所有规模数字、版本信息与许可表述均核实自一手来源:DrugBank 6.0 主论文(Knox et al., Nucleic Acids Res 52:D1265-D1275, 2024, DOI 10.1093/nar/gkad976, PMCID PMC10767804)、DrugBank 官网(go.drugbank.com)与 Trust Center(trust.drugbank.com 的引用政策)、HandWiki 对 DrugBank 词条的 2026-08 修订快照,以及历代 NAR 论文(Wishart 2006/2008、Knox 2011、Law 2014、Wishart 2018)。检索核实时间为 2026-09-19。
DrugBank 的数字口径与版本/许可耦合:论文口径(v6.0,2024-01)与维基镜像快照(2026-08)及第三方统计(2026-07)存在差异——本页在各处显式标注口径来源;商用许可细节以官方条款最新版为准。本页为技术参考文档,不构成临床用药建议——DDI 与适应症信息用于研究建模时须由执业药师/医师复核后才能进入临床流程(§8)。
关于内容偏倚:DrugBank 的 DDI/适应症文本主要来自监管标签与文献——上报偏倚与标签时代差异是内容固有的偏倚源,本页在 §6.6 与 §7.4 讨论其对 AI 建模的影响。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:药物的「黄金标准知识库」——每个药物一张 200+ 字段的 DrugCard:结构、药理、机制、靶点、代谢、相互作用、价格、专利、光谱,全部人工策展。
- 体量:11,891 药物 / 141 万 DDI / 4,939 靶点序列 / 9,464 小分子光谱(v6.0 论文口径)。
- 许可:不是开放数据——网页免费,下载按学术(免费/优惠)/商业(付费)许可;引用是条款义务。
- 杀手锏:DDI(141 万条)+ 适应症语义 + 靶点序列绑定——「成药知识」三件套在别处没有同规格的单一来源。
- 适用:DTI/DDI 预测基准、药物重定位、MOA 建模、临床决策支持(DSS)集成、代谢组学鉴定。
- 不适用:大规模活性筛选数据(用 ChEMBL/PubChem)、患者级药物暴露(用 EHR 类)、需要再分发全量衍生物的产品(许可受限)。
§1.1 摘要
2006 年,Wishart 实验室(University of Alberta)发布 DrugBank 时做了一个关键判断:药物研究需要的不是又一个化合物列表,而是把药物当成「知识对象」完整描述——一端是化学(结构、性质、光谱),另一端是临床(适应症、剂量、相互作用、不良反应),中间用靶点蛋白的序列与结构串起来。二十年过去,这个「药片两端」的结构成了行业标准:FDA 用它做标签解析的参照,DSS 厂商拿它的 DDI 做检查器内核,AI 团队把它当 DTI/DDI 预测的监督源。
v6.0(2024-01)的关键增量是对 v5.0(2018)的六年欠账集中还清:FDA 批准药物 2,646 → 4,563(+72%)、DDI 365,984 → 1,413,413(+300%)、食物相互作用 1,195 → 2,475(+200%),并新增 9,464 个小分子的 MS/MS 与 NMR 光谱族数据(含 CCS/RT/RI——代谢组学鉴定的硬通货)。
对 AI 团队,DrugBank 的价值在三个维度:
- 关系监督源:DTI(药物-靶点,含结合常数)、DDI(141 万对)、药物-疾病(适应症)三类关系都有人工确认的「正例」——图神经网络与关系抽取的标注成本被 DrugBank 大幅摊薄。
- 语义密度:200+ 字段的 DrugCard 是「药物的知识画像」——机制文本、ATC 分类、剂量、ADMET 参数可以直接变成多模态特征。
- 光谱-结构绑定:MS/MS/NMR + SMILES 的配对数据是小分子鉴定模型(tandem MS 解谱)的监督源——这在代谢组学 AI 里是稀缺资产。
许可结构必须先说清:DrugBank 不是开放数据——网页浏览免费(注册后可导出检索结果 CSV),但 XML/CSV 全量下载与再分发需要许可;学术非商业免费或优惠、商业(含企业内部使用)付费。这决定了它与 ChEMBL(CC-BY-SA)、PubChem(公有领域)的本质区别:能下载 ≠ 能再分发,项目立项前先核许可(§8.1)。
§1.2 战略价值
- DDI 的唯一同规格来源:141 万条 DDI 是临床决策支持(处方审查)与 DDI 预测模型的规模基座——DrugCentral/FDA 标签可作开源交叉验证,但密度与更新都不及 DrugBank(§1.3 对照)。
- 靶点绑定的完整性:4,939 条非冗余蛋白序列直接链 UniProt/PDB,已知结合常数(Ki/IC50)就地标注——「药物-靶点-结构」三联在一张卡里完成,免跨库拼接。
- 监管语义的规范化:approved/withdrawal/investigational/experimental/nutraceutical/illicit/veterinary 七种状态分组 + ATC 分类——「什么是上市药」的判定有明确口径,避免研究里「批准药物」的各说各话。
- 代谢组学光谱底座:CCS/RT/RI 与 MS/MS 绑定结构——液质代谢组学的鉴定管线(如比对库构建)直接受益,这是药物库里独有的光谱密度。
§1.3 同类数据集横向对比
| 资源 | 定位 | 规模量级 | 与 DrugBank 的关系 |
|---|---|---|---|
| DrugBank | 成药知识全卡(人工策展) | 11,891 药 / 141 万 DDI | — |
| ChEMBL | 生物活性测量库 | 数十万化合物 / 千万级活性值 | 活性数据规模碾压;批准状态/DDI 语义不及 |
| PubChem | 化合物结构仓库 | 亿级化合物 | 结构覆盖广;无临床/药理深度 |
| DrugCentral | 开源药物库(CC-BY?) | 数千药 / 10 万级 DDI | 开源替代;DDI/适应症密度较低——许可敏感项目的备选 |
| PharmGKB | 药物基因组学 | 数百药-基因临床注解 | PGx 深度互补(DrugBank 只有 SNP-药物基础层) |
| RxNorm/NDF-RT | 美国药物术语/标签 | 全美药品规范化 | 术语层标准化;无靶点/光谱 |
| KEGG DRUG | 通路视角药物库 | 万级药物条目 | 通路网络强;DDI/标签弱 |
| SIDER | 药物不良反应 | 数千药 / 十万级 ADR | ADR 专精(从 FAERS/标签抽取)——与 DrugBank ADR 字段互补 |
| FDA 标签(SPL) | 监管原始标签 | 全部 FDA 标签 | DrugBank 的上游来源之一——原始 vs 策展 |
§1.4 版本时间轴
2006 v1 首发(841 FDA 小分子 + 113 生物药 + 2,133 靶点;Wishart NAR 2006)
2009 v2(撤市/非法药、食物-药物与 DDI、ADMET 参数入库)
2011 v3(转运体/通路/价格/专利/制造;>5,000 实验药;Knox NAR 2011)
2014 v4(代谢物结构/反应、分类、光谱、结合常数、合成;Law NAR 2014)
2018 v5.0(结构重整 + 数量翻倍;Wishart NAR 2018)
2024 v6.0(FDA 批准 2,646→4,563;DDI 36.6 万→141.3 万;光谱族 9,464 小分子;Knox NAR 2024)
2026 商业化深化:AI/ML-Ready Datasets + API/MCP 接口;大版本周期继续
§1.5 应用场景矩阵
- 临床 DSS 集成:处方审查引擎的 DDI 内核(机构需商业许可——临床 API 产品线)。
- DTI 预测基准:正例(已知相互作用)+ 负例(无记录)构建——注意「无记录 ≠ 无结合」的采样陷阱(§5.6)。
- 药物重定位:适应症-靶点-通路三重映射找「老药新用」候选。
- MOA 建模:机制文本 + 通路图 + ATC 语义化模型输入。
- 代谢组学鉴定:MS/MS + CCS + RT + RI 与结构绑定——tandem MS 解谱模型训练集。
- 药物警戒研究:ADR 字段 + 上市状态(withdrawal 追踪)做安全信号回顾。
§1.6 组件全景
DrugBank 的七个数据层:
- 药物卡层:11,891 张 DrugCard——200+ 字段覆盖结构(SMILES/InChI/分子量/手性)、药理(机制/适应症/剂量/药代)、商业(价格/专利/厂商)、光谱(MS/NMR/CCS/RT/RI)。
- 靶点层:4,939 条非冗余蛋白(药物靶点/代谢酶/转运体/载体)——UniProt 交叉引用、序列、已知结合药物与常数。
- 相互作用层:DDI 141 万 + 药物-食物 2,475——描述文本(部分含机制归因)。
- 分类层:ATC 编码 + DrugBank 自有分类树——语义检索与分组统计的骨架。
- 光谱层:MS/MS(实验+预测)、1D/2D-NMR、CCS/RT/RI——9,464 小分子。
- 通路层:数千张富注释通路图(与 SMPDB 同源)——MOA 与代谢可视化。
- 产品/API 层:Clinical API(DDI 检查)、Biopharma OS、AI/ML-Ready Datasets——商业化供给形态。
§1.7 许可模式的经济学
DrugBank 的「免费浏览 + 付费下载」是全球数据库少见的混合模式,账要算明白:
- 学术路线:非商业研究申请学术许可(免费或优惠费率)——下载 XML/CSV 全量;条款义务是引用论文 + 不再分发全量数据。多数高校项目零成本。
- 商业路线:企业内部使用也属「商用」(条款原文把 internal use 划入需许可范畴)——费用与 API 产品线(Biopharma OS/Clinical API)挂钩,药企/健康科技公司是主要客户;这笔收入反哺人工策展团队。
- 对策展的再认识:付费换来的不是数据本身(网页都能看)而是结构化 + 机器可读 + 许可确定性——这三样恰恰是 AI 工程最贵的部分,商业模式因此成立。
- 开源替代的定位:预算敏感或需要再分发衍生物的项目 → DrugCentral(开源);需要最高 DDI 密度与策展质量 → DrugBank。两者不是替代关系,是预算-质量曲线上的两点。
§1.8 DrugBank 在药物研发流程中的位置
把 DrugBank 放进药物研发-使用全链条,看它站在哪些环节:
靶点发现(组学/文献)
→ 苗化合物筛选(ChEMBL/PubChem 活性数据) ← DrugBank 提供已知药-靶点对做「老药先行」
→ 先导优化(结构/ADMET)
→ 临床前(机制验证) ← DrugBank MOA/毒性文本做先验
→ 临床试验(I-III) ← clinicaltrials 状态核查;investigational 分组同步
→ 监管批准 ← approved 分组 + 适应症/标签结构化
→ 上市监测(FAERS/药物警戒) ← DDI/ADR 字段支撑安全信号
→ 临床使用(处方/DSS) ← DDI 检查器(Clinical API 商业主场)
三个工程要点:
- DrugBank 是「后端密集」的资源——越靠近临床端(DDI/适应症/标签)字段越独特;越靠近化学端(结构/活性)越要与 PubChem/ChEMBL 分工。
- investigational → approved 的状态迁移本身就是信号——管线跟踪产品(药企 BD)用「状态字段 diff」监控竞争格局。
- 多库接力是常态——DrugBank 没有活性实验数据(ChEMBL 的领地)与试验原始记录(ClinicalTrials 的领地),全链分析必须组合(§9.5)。
§2 医学与科学背景
§2.1 DDI 为什么是临床信息学的硬问题
药物-药物相互作用(DDI)是多重用药时代的核心安全风险:
- 机制谱系:药代动力学 DDI(代谢酶竞争——CYP450 家族是主战场、转运体 P-gp、血浆蛋白结合)与药效学 DDI(同受体/生理系统叠加或拮抗,如 QT 延长组合)——机制归因决定可预测性。
- 规模的含义:11,891 药的两两组合空间约 7,000 万对——141 万条已知 DDI 只是冰山一角;「未知 DDI 预测」因此成为图机器学习的经典问题(正例 = DrugBank DDI,负例构造是全部方法论争议所在)。
- 临床链条:处方审查(实时 DDI 检查)→ 用药重整 → 药物警戒——DSS 产品的核心算法资产就是高质量的 DDI 数据 + 机制标注;DrugBank 的 Clinical API 产品线直接服务此需求。
- 文本本质:多数 DDI 记录是「标签文本」而非定量实验——「可能增加出血风险」级别的语义要靠 NLP 再加工(§7 的四喂法之一)。
§2.2 靶点四类:靶点/酶/转运体/载体
DrugBank 把 4,939 条非冗余蛋白分四类——这个分类本身就是药物作用的知识框架:
- 药物靶点(targets):治疗作用的直接分子(受体/通道/酶活性位点)——MOA 的主角。
- 代谢酶(enzymes):CYP450/UPT/水解酶等——药代动力学的主角,DDI 的机制源头。
- 转运体(transporters):P-gp/OATP/OCT 等——组织分布与排泄的主角,近年 DDI 研究增长最快的一类。
- 载体(carriers):血浆蛋白结合等——分布容积与游离药物浓度的背景变量。
四类的区分直接决定 DDI 机制归因(酶竞争 vs 转运抑制)与建模特征设计——混用会产出「机制不明」的预测器。
§2.3 适应症语义:从标签文本到结构化
- 适应症 vs 用途 vs 试验适应症:DrugCard 区分 approved indication 与 off-label/investigational 用途——重定位研究恰恰在「后者里的高证据者」找机会。
- ICD 映射:适应症文本映射 ICD-10/11——使药物-疾病关系可以与疾病库/医院数据 join。
- 标签来源:FDA/EMA/HC 等监管标签是主要来源——「适应症」的权威性随市场而异(一个药可能在 FDA 批准、EMA 撤回——状态字段要合并读)。
§2.4 光谱族数据:药物库的代谢组学侧翼
v6.0 为 9,464 个小分子(共 11,710 小分子)配备的光谱族(MS/MS、1D/2D-NMR、CCS、RT、RI):
- 用途:液质/气质代谢组学的鉴定管线需要「结构-光谱」参考对——DrugBank 提供的药物及其代谢物光谱填补了 HMDB(内源性代谢物)之外的人为暴露组。
- 实验 vs 预测:预测光谱(CFM-ID 类模型)混入发布——字段里可区分;训练鉴定模型时实验光谱优先,预测光谱做增广。
- CCS 的价值:离子淌度质谱(IM-MS)的碰撞截面是比 RT 更稳定的物理量——CCS+MS/MS 双证据鉴定正在成为标准,DrugBank 是 CCS 参考值的少数公开源之一。
§2.5 药物基因组学的基础层
DrugCard 含 SNP-药物关联(靶点 SNP、代谢酶多态)——但深度有限:临床级 PGx(CPIC 指南、 PharmGKB 分级证据)在 PharmGKB;DrugBank 的角色是「药物-基因关联的字典入口」,深度研究必须接力(§9.5 组合)。
§2.6 与监管标签的关系:策展的护城河
- 上游:监管标签(FDA SPL/EMA)+ 文献 + 专利——人工策展把非结构化标签变成 200+ 字段。
- 护城河:字段 schema 的稳定性(二十年演进但向后兼容)+ 策展一致性——机器解析 FDA 原始标签的成本远高于解析 DrugBank 卡。
- 循环引用风险:DrugBank 曾使用维基百科内容、维基百科又链接 DrugBank——关键事实(尤其罕见药的数字)要回溯源文献/标签,防循环放大(HandWiki 词条本身也提示了这点)。
§2.7 上市状态七分组:口径的锚
approved(含 FDA-approved 小分子与生物药)/ withdrawal(撤市,含撤市原因)/ investigational(临床试验中)/ experimental(临床前) / nutraceutical(营养品)/ illicit(非法药物)/ veterinary(兽药)——引用「批准药物 N 个」时必须声明分组与市场(FDA vs 全球多市场);v6.0 论文口径 4,563 = FDA 批准(小分子 + 生物药),维基镜像 2026-08 口径 4,030 小分子 + 1,601 生物药(后续 release 数字已滚动)。
§2.8 AI 视角的科学定位
对医疗 AI,DrugBank 是「成药知识的监督字典」:DTI/DDI/适应症三类关系提供正例标注,200 字段 DrugCard 提供节点特征,光谱提供结构-物理量绑定。它的局限同样是明确的:负例缺失(DDI 无记录不等于无相互作用)、文本偏倚(标签来源)、许可约束(衍生数据不可随意公开)——§7 的方法论全部围绕这三个局限设计。
§2.9 盐型、产品与活性成分:三个层级
DrugBank 的药物计数歧义大多源于三个层级未区分:
- 活性成分层(drug entry):DrugCard 的主层级——一个 INN 通用名一张卡(含其游离碱/酸形态的结构)。「11,891 药物」指这一层。
- 盐型层(salts):同一活性成分的不同盐(盐酸/钠盐/马来酸盐…)——挂在主卡下的子记录;统计「化合物多样性」时必须折叠回活性成分层(InChIKey 前段去重)。
- 产品层(products):市售产品(品牌、规格、复方)——一卡可对应数百产品;「FDA 批准产品数」与「批准药物数」差一个数量级。
工程规则:建模与多样性统计用活性成分层;采购/处方场景用产品层;跨库对齐用 InChIKey。复方产品(combination drug)另有一层语义——其成分各自链接回活性成分卡,图谱构建时展开而不是把复方当独立节点。
§2.10 药物-疾病证据生态
「某药治某病」的证据在多个库间分层共存,DrugBank 占据其中一段:
- 机制层(DrugBank):药是否作用于疾病机制的靶点/通路——机制文本 + 靶点绑定。
- 监管层(FDA/EMA 标签):适应症是否获批——DrugBank 的 indication 字段即策展版标签。
- 试验层(ClinicalTrials.gov):正在验证什么适应症——investigational 分组的上游。
- 真实世界层(FAERS/EHR):上市后的实际使用与不良事件——SIDER/FAERS 侧翼。
- PGx 层(PharmGKB):谁该用/用多少——基因型分层用药。
研究设计时把「证据在层间的一致性」当特征:机制-监管-试验三层同向 → 高置信重定位候选;只有监管层支持 → 就是没有新意的已知适应症。
§3 数据集规格
§3.1 规格总表
| 维度 | 规格 |
|---|---|
| 当前版本 | v6.0(2024-01-05);大版本约 2 年 + 月度修正 |
| 药物条目 | 11,891(v6.0 论文口径) |
| 状态分组 | FDA 批准 4,563;研究性 6,231;撤市/营养品/非法/兽药/实验药余量 |
| 靶点蛋白 | 4,939 非冗余序列(targets/enzymes/transporters/carriers) |
| DDI | 1,413,413 条(v5.0 为 365,984) |
| 药物-食物 | 2,475 条 |
| 光谱覆盖 | 9,464/11,710 小分子(MS/MS + 1D/2D-NMR + CCS + RT + RI) |
| 字段密度 | DrugCard 200+ 字段 |
| 发布形态 | XML 全量 + CSV 分表(学术许可);网页检索 CSV 导出(免费注册) |
| 访问 | 网页免费;下载许可制(学术免费/优惠、商业付费) |
| 引用义务 | Knox et al. 2024 NAR(条款强制) |
| 坐标/标识 | DrugBank ID(DB/BI/EX 等前缀)+ UniProt/PDB/ATC/ICD 交叉 |
§3.2 v6.0 相对 v5.0 的增量地图
| 指标 | v5.0(2018) | v6.0(2024) | 增幅 |
|---|---|---|---|
| FDA 批准药物 | 2,646 | 4,563 | +72% |
| 研究性药物 | 3,394 | 6,231 | +38% |
| DDI | 365,984 | 1,413,413 | +300% |
| 药物-食物 | 1,195 | 2,475 | +200% |
| 光谱族 | 部分光谱 | 9,464 小分子全套(含 CCS/RT/RI) | 新维度 |
| 通路图 | 数百 | 数千富注释 | 数倍 |
解读:DDI 的三倍增长主要来自标签解析管线的规模化(六年积累 + 抽取工艺升级)——不是「世界上的 DDI 变多了」,而是「记录工艺变强了」;这对建模的含义是「记录密度」与「真实风险」要分开(§6.4)。
§3.3 DAIMS 数据AI就绪度评估
| 维度 D | 数据完整性 | 评分 | 说明 |
|---|---|---|---|
| D1 | 药物覆盖 | 9/10 | 批准药近全覆盖 + 大量研究性/实验药 |
| D2 | 字段深度 | 10/10 | 200+ 字段——药物知识库的最高密度档 |
| D3 | 关系完整性 | 9/10 | DDI/DTI/适应症三类关系同源一致 |
| D4 | 光谱维度 | 8/10 | 9,464 小分子全套(生物药天然缺) |
| A1 | 机器可读 | 9/10 | XML schema 稳定 + CSV 分表 |
| A2 | 文档完备 | 8/10 | schema 文档 + 政策页齐全 |
| A3 | 接入成本 | 6/10 | 学术免费但许可流程存在摩擦;商业成本高 |
| A4 | 更新机制 | 7/10 | 大版本 2 年周期——快节奏研究要盯月度修正 |
| I1 | 指标标准化 | 9/10 | ATC/ICD/UniProt 外部标准对齐 |
| I2 | 可复现性 | 7/10 | 版本锁定可行但再分发受限——复现包需许可声明 |
| M1 | 多模态对齐 | 9/10 | 结构-光谱-文本-蛋白四模态同卡对齐 |
| M2 | 时间序列 | 6/10 | 上市状态变迁可追(withdrawal)但历史版本不开放回溯 |
| S1 | 数据安全 | 9/10 | 无患者数据;策展知识无个体隐私面 |
| S2 | 合规负担 | 5/10 | 许可/引用/再分发三条纪律——开放库没有的负担 |
总分:A- 级(知识密度与多模态对齐顶级;扣分在许可摩擦与再分发限制)
§3.4 存储与计算需求
| 数据件 | 体量 | 最小分析环境 |
|---|---|---|
| XML 全量 | 数 GB | 单机即可 |
| 药物/靶点 CSV 分表 | 数百 MB | pandas 足够 |
| DDI 分表(141 万行) | ~1 GB | 单机 pandas/图库 |
| 光谱包(MS/NMR) | 数十 GB | 单机 + 光谱库(matchms 等) |
| 结构文件(SDF/MOL) | 数 GB | RDKit |
DrugBank 是「单机友好」的资源——没有 Hail/集群需求;工程量在解析与对齐,不在算力。
§3.5 获取流程
- 注册:go.drugbank.com 免费注册 → 网页浏览 + 检索结果 CSV 导出(免费档)。
- 学术许可:Non-commercial/Academic Use 申请(学术邮箱 + 用途声明)→ 批准后从 releases 页下载 XML/CSV 全量。
- 商业许可:联系商务(内部使用属商用)——按产品(数据/API/Workspace)报价。
- 政策阅读:Trust Center 的使用条款 + 引用政策——再分发、衍生数据公开的边界都在条款里,立项前通读。
§3.6 口径对齐表
| 数字 | 出处口径 | 澄清 |
|---|---|---|
| 11,891 | v6.0 论文(2024-01)药物总数 | 论文与维基镜像一致 |
| 4,563 | v6.0 论文 FDA 批准药物 | 小分子 + 生物药合计 |
| 4,030 + 1,601 | 维基镜像 2026-08 快照(FDA 小分子 + 生物药) | 后续 release 滚动后的口径 |
| 19,879 | 第三方 2026-07 统计「总条目」 | 含全部状态分组的新版商业快照——与论文口径不可混用 |
| 1,413,413 | v6.0 论文 DDI | vs v5.0 365,984 |
| 9,464/11,710 | v6.0 论文光谱覆盖 | 小分子口径 |
| 58,000+ / 65,000+ | 官网引用量(2026 两个页面口径) | 引用时用「数万篇」量级表述最稳 |
§3.7 版本与许可的双重纪律
- 版本锁:分析锁定 v6.0(或下载时的 release 编号)——论文方法段写「DrugBank v6.0(2024-01)」。
- 许可锁:项目内「谁能下载/谁能拿到衍生文件」要有一句话制度——学术许可不覆盖商业化成果,转化前重新评估。
- 再分发红线:论文附表(几千行 OK)与全量衍生物(禁止)的界线在条款里——公开基准集要官方允许或用开源替代构建。
§3.8 DrugBank ID 前缀体系
DrugBank ID 的前缀即药物的「出身证明」——数据清洗时的第一道过滤器:
| 前缀 | 类别 | 建模含义 |
|---|---|---|
| DB | 已收录药物(小分子为主 + 部分生物药) | 主战场——结构/靶点/临床字段齐全 |
| BI | 生物药(protein/peptide) | 无小分子 SMILES——模态缺省处理 |
| EX | 实验性药物(未进临床) | 状态分组 experimental 的主要载体 |
| NW | 营养品(nutraceutical) | 临床证据弱——统计时单列 |
| DB+数字 | 常规主键格式 | 版本间 ID 基本稳定(合并/拆分有变更日志) |
清洗规则:① 主表分析默认 DB 全集(BI 按需并入并声明);② EX/NW 在「上市药物」口径里剔除;③ 复方卡与成分卡的父子关系展开后再统计。ID 合并史(两个 DB 合一)在 release notes——跨版本 ID 映射表要自己建(新旧 ID 对齐脚本是一次性投入)。
§4 数据结构
§4.1 下载包目录形态
drugbank_v6.0/
├── drugbank.xml # 全量 XML(DrugCard 树)
├── drugbank_all_drug_targets.csv # 靶点-药物关系
├── drugbank_all_drug_sequences.csv # 靶点蛋白序列
├── drugbank_drug_drug_interactions.csv # DDI 141 万行
├── drugbank_drug_food_interactions.csv # 食物相互作用
├── drugbank_all_drug_admet.csv # ADMET 参数
├── drugbank_all_drug_indications.csv # 适应症(含 ICD 映射)
├── drugbank_all_drug_classification.csv # ATC/分类树
├── drugbank_spectrum_*.csv|msp # 光谱族(版本形态可能不同)
├── drugbank_all_drug_patents.csv # 专利
└── vocabulary/ # 分类词表
(以实际下载包为准——文件名随版本微调,schema 文档在包内/官网 guides。)
§4.2 DrugCard XML 字段地图
DrugCard 的 200+ 字段按六大块组织(XML 路径):
- 识别与分类:
drugbank-id、name、synonyms、groups(七状态)、atc-codes、categories。 - 化学:
calculated-properties(SMILES/InChI/logP/TPSA 等)、experimental-properties(实测水溶性/熔点等)、salts/products(盐型与上市产品分离)。 - 药理:
indication/pharmacodynamics/mechanism-of-action/toxicity/metabolism/absorption等——文本型知识主战场。 - 靶点与相互作用:
targets/enzymes/transporters/carriers(每条含actions(inhibitor/inducer/substrate…)+ 已知Ki/IC50)+drug-interactions。 - PGx 与安全:
snp-effects/snp-adverse-drug-reactions、adverse-effects(部分版本)。 - 商业与谱:
prices/patents/manufacturers、ms-ms-spectra/nmr-spectra(含predicted标志)。
解析建议:用 lxml 迭代 <drug> 节点流式抽取——XML 数 GB,别一次性建树。
§4.3 XML 全量解析代码
#!/usr/bin/env python3
"""DrugBank XML 全量解析:抽取药物主表 + 靶点关系表(流式,内存安全)。"""
from lxml import etree
import pandas as pd
XML = "drugbank.xml"
def parse_drugbank(xml_path: str):
drugs, targets = [], []
for event, drug in etree.iterparse(xml_path, tag="drug", events=("end",)):
did = drug.findtext("./drugbank-id[@primary='true']") or \
drug.findtext("./drugbank-id")
name = drug.findtext("./name")
groups = [g.text for g in drug.findall("./groups/group")]
atc = [a.get("code") for a in drug.findall("./atc-codes/atc-code")]
smiles = None
for prop in drug.findall("./calculated-properties/property"):
if prop.findtext("./kind") == "SMILES":
smiles = prop.findtext("./value")
break
drugs.append({
"drugbank_id": did, "name": name,
"groups": "|".join(groups), "atc": "|".join(atc),
"smiles": smiles,
"indication": (drug.findtext("./indication") or "")[:200],
"moa": (drug.findtext("./mechanism-of-action") or "")[:200],
})
for kind, tag in [("target", "targets"), ("enzyme", "enzymes"),
("transporter", "transporters"), ("carrier", "carriers")]:
for t in drug.findall(f"./{tag}/{kind}"):
targets.append({
"drugbank_id": did,
"role": kind,
"target_id": t.findtext("./id"),
"uniprot": (t.findtext("./polypeptide/uniprot-id") or None),
"action": "|".join(
a.text for a in t.findall("./actions/action") or []),
})
drug.clear()
while drug.getprevious() is not None:
del drug.getparent()[0]
return pd.DataFrame(drugs), pd.DataFrame(targets)
if __name__ == "__main__":
drugs_df, targets_df = parse_drugbank(XML)
drugs_df.to_csv("drugbank_drugs.tsv", sep="\t", index=False)
targets_df.to_csv("drugbank_targets.tsv", sep="\t", index=False)
print(len(drugs_df), "drugs;", len(targets_df), "target links")
§4.4 DDI 图构建代码
#!/usr/bin/env python3
"""DrugBank DDI 分表 → 图统计与子图导出(networkx)。"""
import pandas as pd
import networkx as nx
ddi = pd.read_csv("drugbank_drug_drug_interactions.csv")
G = nx.Graph()
for _, row in ddi.iterrows():
a, b = row["Drug 1 ID"], row["Drug 2 ID"]
if a and b and a != b:
G.add_edge(a, b)
print("节点:", G.number_of_nodes(), "边:", G.number_of_edges())
deg = sorted(dict(G.degree()).values(), reverse=True)
print("Top 度数药物:", deg[:10]) # 多重用药枢纽(如华法林/阿司匹林)
# 提取 ATC 同类的 DDI 子图(药效学 DDI 代理)
drugs = pd.read_csv("drugbank_drugs.tsv", sep="\t")
atc1 = dict(zip(drugs.drugbank_id, drugs.atc.fillna("")))
sub_edges = [
(u, v) for u, v in G.edges
if atc1.get(u, "")[:1] and atc1.get(u, "")[:1] == atc1.get(v, "")[:1]
]
G_sub = nx.Graph(sub_edges)
print("同类 ATC 子图边数:", G_sub.number_of_edges())
§4.5 光谱数据抽取
#!/usr/bin/env python3
"""MS/MS 光谱 → matchms 兼容格式(代谢组学鉴定管线对接)。"""
import pandas as pd
from matchms import Spectrum
from matchms.exporting import save_as_msp
spec = pd.read_csv("drugbank_ms_ms_spectra.csv") # 字段以实际包为准
# 典型字段: drugbank_id, precursor_mz, peak_mz, peak_intensity, collision_energy, predicted
records = []
for did, grp in spec.groupby("drugbank_id"):
meta = {"compound_name": did,
"precursor_mz": grp["precursor_mz"].iloc[0],
"predicted": str(grp["predicted"].iloc[0])}
m = grp["peak_mz"].to_numpy(float)
ints = grp["peak_intensity"].to_numpy(float)
records.append(Spectrum(mz=m, intensities=ints, metadata=meta))
save_as_msp(records, "drugbank_spectra.msp")
§4.6 与外部标识对齐
- UniProt:靶点层的
uniprot-id直连——蛋白特征(结构域/表达组织)从 UniProt/Ensembl join。 - ATC:分类层 WHO ATC——与 KEGG DRUG/Drugs@FDA 的 ATC 交叉验证。
- ICD:适应症映射 ICD-10/11——与 MIMIC/医院数据的诊断编码 join(重定位研究的关键桥)。
- InChIKey:化学层的标准 InChIKey 是跨库去重的第一键(ChEMBL/PubChem/HMDB 对齐全靠它)。
§4.7 元数据与版本指纹
- 版本字符串:XML 头部与 release 页编号(如 5-1-10、6-0-x)——方法段必写。
- 下载日期:月度修正使「同版本不同月」内容有差——复现包记双戳(版本 + 日期)。
- 许可声明:复现包 README 写许可类型与申请号(学术许可有编号)——合作者审计用。
§4.8 完整性清单
- [ ] 版本 + 下载日期双戳(方法段与复现包)
- [ ] 状态分组口径(引用「批准 N 个」时声明分组与市场)
- [ ] 盐型/产品处理(建模用活性成分层,不混产品层)
- [ ] DDI 负例构造策略显式声明(§5.6)
- [ ] 光谱 predicted 标志过滤(训练/评估分离)
- [ ] InChIKey 去重(跨库合并前)
- [ ] 靶点 action 语义(inhibitor vs substrate 别混)
- [ ] 生物药单独处理(SMILES 缺失/不适用)
- [ ] 再分发边界自查(论文附表 vs 全量衍生)
§4.9 数据血缘
监管标签(FDA SPL/EMA/HC)+ 药学文献 + 专利/价格数据
→ 人工策展(Wishart 团队 + 策展平台)→ DrugCard 200+ 字段
→ 化学信息学校验(结构标准化/InChIKey/logP 计算)
→ 靶点整合(UniProt 序列 + 文献结合常数 + action 标注)
→ DDI 抽取(标签文本解析 + 文献策展 → 141 万对)
→ 光谱管线(实验 MS/NMR + CFM-ID 类预测 + CCS/RT/RI)
→ 发布(XML/CSV 全量【许可】 + 网页/API【免费/商业】)
全链中「人工策展」是核心工序——这既是质量来源(权威性)也是瓶颈(2 年大版本周期)与偏倚源(策展焦点偏向常见药/常见 DDI)。
§4.10 适应症-ICD 映射抽取
#!/usr/bin/env python3
"""适应症表 → ICD 编码映射(药物重定位与 EHR join 的桥梁)。
适应症 CSV 通常含 description 与(部分版本)ICD 字段;
无 ICD 字段时按文本规则映射 + 人工抽检。"""
import pandas as pd
import re
ind = pd.read_csv("drugbank_all_drug_indications.csv")
# 1) 有结构化 ICD 字段的直接取用(列名以实际包为准)
if "icd10" in ind.columns:
direct = ind[ind.icd10.notna()][["drugbank_id", "icd10"]]
else:
direct = pd.DataFrame(columns=["drugbank_id", "icd10"])
# 2) 文本规则的补充映射(示例:常见适应症关键词 → ICD-10 前缀)
RULES = {
r"hypertension": "I10", r"type 2 diabetes": "E11",
r"atrial fibrillation": "I48", r"major depressive": "F32",
r"breast cancer": "C50", r"epilepsy": "G40",
}
def map_icd(text: str):
if not isinstance(text, str):
return None
for pat, code in RULES.items():
if re.search(pat, text, re.I):
return code
return None
ind["icd_mapped"] = ind["indication"].map(map_icd)
mapped = ind[ind.icd_mapped.notna()][["drugbank_id", "icd_mapped"]]
# 3) 合并 + 覆盖率报告
all_map = pd.concat([direct, mapped]).drop_duplicates()
cov = all_map.drugbank_id.nunique() / ind.drugbank_id.nunique()
print(f"适应症映射覆盖率: {cov:.1%}(人工抽检 50 条校准规则后再放量)")
all_map.to_csv("drugbank_drug_icd.tsv", sep="\t", index=False)
覆盖率的诚实报告是重定位研究可信度的第一指标——映射覆盖率低于 60% 的分析在审稿中会被追问代表性。
§5 下游分析协议
§5.1 任务×资源速查表
| 任务 | 用哪个数据件 | 关键字段 | 陷阱 |
|---|---|---|---|
| DDI 预测基准 | DDI 分表 + 药物主表 | pair + 文本 | 负例采样策略决定结论 |
| DTI 预测 | 靶点关系 + 序列 | action + Ki/IC50 | 无记录 ≠ 无结合 |
| 药物重定位 | 适应症 + ATC + 靶点 | indication/ICD | off-label 与批准语义混淆 |
| MOA 分类 | 机制文本 + 通路 + ATC | mechanism-of-action | 文本噪声(多机制药) |
| 光谱鉴定 | 光谱族包 | MS/MS + CCS + RT | predicted 混入评估集 |
| 处方审查引擎 | DDI + 主表 | 严重度/描述 | 许可(商业使用须付费) |
| 代谢物鉴定 | 主表 + HMDB 姊妹 | InChIKey | 内源性/外源性边界 |
§5.2 DDI 基准构建协议
构建可发表的 DDI 预测基准(照做可避开审稿高频否决点):
- 正例:DDI 分表全量(去重无向化);带机制文本的子集另存(机制可解释性评估用)。
- 负例:三层策略——① 随机不相连对(易混入未知真 DDI,需标注为「弱负例」);② 同 ATC 类但不相连(更接近真实负例);③ 时间切分负例(v6.0 有而 v5.0 无的对——「新发现」做测试集,模拟预测任务)。
- 切分纪律:按药物节点冷启动切分(新药 DDI 预测是真实场景)而非随机边切分——随机切分高估性能是 DDI 论文最大翻车点。
- 评估:AUROC/AUPR + Top-K 召回(临床关心的是「前 K 候选里有没有真 DDI」)+ 机制归因抽检(预测对解释成 CYP 竞争的命中率)。
- 基线:相似度启发式(ATC/结构/MOA 相似)必须报——图模型的增量要对得起复杂度。
§5.3 DTI 特征工程协议
- 药物侧:Morgan 指纹(RDKit)+ DrugBank 分类(ATC 一键编码)+ 机制文本 TF-IDF/嵌入。
- 靶点侧:UniProt 序列(ESM/ProtBERT 嵌入或传统 PseAAC)+ 靶点四类角色 one-hot。
- 监督标签:action 语义拆分——inhibitor/inducer/substrate/ligand 分头建模比二分类更有信息量;Ki/IC50 有值的子集做回归头(注意实验条件异质,需与 ChEMBL 交叉补全)。
- 负例:同 §5.2 的分层策略 + 「非该靶点家族」约束采样(受体药去配离子通道是低质量负例)。
- 验收:冷启动(新靶点/新药)与热启动双指标;与 BindingDB/PDBbind 交叉验证集(结构已知的对)做外部检验。
§5.4 药物重定位协议
- 候选生成:适应症缺口(疾病 D 无批准药)× 靶点匹配(有药作用该疾病机制靶点)× 通路证据。
- 证据分级:investigational 状态 + 该适应症文献 + 临床试验记录(clinicaltrials-gov 交叉)——三级证据链。
- 安全性预筛:现有 DDI/ADR 负担 + 撤市记录扫描——重定位候选的「安全存量」评估。
- 输出:候选-证据-风险三列表——进入试验设计前的内部排序。
§5.5 成本模型
| 场景 | 技术路线 | 成本量级 |
|---|---|---|
| 单药查询 | 网页/免费注册 CSV 导出 | 零 |
| 学术全量分析 | 学术许可 + 单机解析 | 许可免费;人力 1-2 周 |
| 光谱管线 | 光谱包 + matchms/RDKit | 单机;人力 1 周 |
| DDI 生产系统 | 商业许可 + Clinical API | 商业报价(数万-数十万/年量级,以官方报价为准) |
| 论文复现包 | 附表 + 版本声明 | 零(遵守再分发边界) |
§5.6 失败模式清单
- 负例天真:随机不相连对当真负例——未知真 DDI 混入,性能虚高;必须分层负例 + 冷启动切分。
- action 混淆:substrate 与 inhibitor 当同一标签——酶竞争 DDI 的预测器会系统性错位。
- 盐型重复计数:同一活性成分的多盐型当独立药物——频率统计与多样性全偏。
- predicted 光谱入评估:预测光谱进测试集——鉴定模型的「准确率」变成模型自洽循环。
- 文本当结构:DDI 描述文本直接当结构化特征抽取标签(severity 缺失时拍脑袋补)——文本 NLP 预处理要显式。
- 生物药硬套小分子管线:BI 前缀药无 SMILES——指纹特征全空,混入训练会拖垮特征工程。
- 版本混拼:v5.0 的 DDI 配 v6.0 的药物主表——状态/ID 有漂移,关系表必须同版本。
- 再分发越界:把全量 DDI 图公开挂 GitHub——许可违约风险;公开用 DrugCentral 版本。
§5.7 校准与验证协议
关系预测系统的验证套路(DDI/DTI 通用):
- 金标准抽检:随机抽 200 条正例 + 100 条负例做人工核查(药师/药理学背景)——「记录正确性」的直测;DDI 文本与标签原文比对的一致率报告。
- 时间前向验证:用 v5.0(2018)数据训练 → v6.0(2024)新增 DDI 做测试——「六年后的新发现能不能被旧数据预测」是最接近真实部署的协议。
- 机制归因验证:预测为 CYP 竞争的对——抽检其两药是否确实作用于同一 CYP 同工酶(用靶点表 enzyme 子集自动核对)。
- 流行度分层:按药物对总度数(流行度代理)分桶报告性能——高流行度桶的过拟合要显式暴露。
- 开源交叉:同一基准在 DrugCentral 版本上重跑——两个来源的结论一致才有「数据集稳健性」论据。
§6 实证结果与方法学分析
§6.1 v6.0 论文的核心实证(2024)
Knox et al. NAR 2024 的关键数字与含义:
- 规模跃升的工艺含义:FDA 批准 +72%、DDI +300%——六年的人工策展 + 抽取管线升级;「记录增速 >> 药物增速」说明记录工艺(标签解析)是主要引擎。
- 光谱族的新维度:9,464/11,710 小分子的 MS/MS + NMR + CCS + RT + RI——把 DrugBank 从知识库升级为「知识 + 物理测量」双底座;代谢组学鉴定的公开参考面因此扩容。
- 30M 年访问的引用生态:数万 publications——基准权威性即网络效应:用 DrugBank 的模型结论自带「可比性」。
§6.2 DDI 数据的方法学解剖
- 来源结构:监管标签(结构化抽取主力)+ 文献策展——两源的粒度不同(标签给「等级+文本」,文献给「机制」)。
- 记录偏差:常见药组合被过度记录(处方量大 → 报告多)——DDI 图的度分布反映用药流行度而非药理风险;建模要加流行度协变量。
- 文本语义:大量 DDI 描述是「机制未知的联合注意」——按 CYP/转运体机制归因的子集(约少数)才是机制建模的干净训练集。
§6.3 方法学三层框架(gsm)
- G(Ground layer):结构化事实——药物-靶点对、InChIKey、ATC、序列(低争议)。
- S(Synthesis layer):策展综合——DDI 文本、机制归因、适应症映射(中等争议,依赖来源质量)。
- M(Medical layer):临床判读——严重度、临床处置建议(高争议,必须药师/医师复核)。
审稿时先问「这结论在第几层」——用 G 层数据做 M 层结论是 DDI 研究最常见的越界。
§6.4 接力实验设计
- DrugBank → ChEMBL:DTI 假设 → 活性数据复核(结合实验规模验证)。
- DrugBank → PharmGKB:代谢酶多态 DDI → PGx 证据分级(临床指南层)。
- DrugBank → clinicaltrials-gov:重定位候选 → 试验状态核查(避免重复试验设计)。
- DrugBank → FAERS/SIDER:DDI 假设 → 不良事件报告的共现检验(药物警戒闭环)。
§6.5 八个真实坑点
- 坑点 1:许可误判——「网页免费 = 数据随便用」——条款明确下载/再分发/商用需许可;先读 Trust Center 再开工。
- 坑点 2:负例天真——随机负例混入未知真 DDI——基准性能虚高(§5.2 的三层负例是底线)。
- 坑点 3:随机边切分——同药物的两条边分进训练/测试——泄漏严重;用节点冷启动切分。
- 坑点 4:action 语义合并——substrate/inhibitor/inducer 一锅炖——机制建模系统性错位。
- 坑点 5:盐型/产品混淆——产品层计数当活性成分层——「药物数」虚高且多样性统计失真。
- 坑点 6:predicted 光谱污染——预测光谱进评估集——鉴定性能自吹;
predicted字段是硬过滤器。 - 坑点 7:生物药特征缺失——BI 药无 SMILES/指纹——混合训练时未做模态缺省处理,模型学到「生物药→负类」伪影。
- 坑点 8:版本混拼——跨 release 的 DDI/主表拼盘——ID 漂移与状态漂移双重污染;单版本锁定。
§6.6 审稿人自查清单
- [ ] DrugBank 版本 + 下载日期写进方法段?
- [ ] 「批准药物 N」的分组与市场口径声明?
- [ ] DDI 负例构造与切分策略显式描述(冷启动?)?
- [ ] DTI 的 action 语义分层还是合并?依据?
- [ ] 光谱评估是否排除 predicted?
- [ ] 生物药与小分子的处理差异声明?
- [ ] 复现包的再分发边界与许可声明?
- [ ] 与 ChEMBL/DrugCentral 的交叉验证说明?
§6.7 版本演进的方法学含义
四个大版本各自回答了「数据库能长成什么样」的不同问题:
- v1-v2(2006-2009):验证「知识库」形态——从化合物列表到 DrugCard 的范式确立;DDI/ADMET 入库证明「临床语义」可以结构化。
- v3-v4(2011-2014):证明「组学接口」价值——转运体/通路/代谢物/光谱让 DrugBank 成为 omics 研究的对接层(论文标题从 drug discovery 转向 ‘omics’ research)。
- v5.0(2018):规模与结构的再平衡——数量翻倍同时保持 schema 兼容——向后兼容是十年商用客户信任的技术基础。
- v6.0(2024):记录工艺的集中兑现——六年周期以 DDI 3 倍与光谱族收官;「记录增速 >> 药物增速」确立了策展工艺(而非新药产出)为主要增长引擎的新阶段。
方法学启示:引用旧版本数字时注意「当时口径」——v4 时代的「1,558 FDA 小分子」与 v6.0 的「4,563 FDA 批准」差在收录工艺与市场口径,不是「新批了 3,000 个药」。
§7 AI 就绪指南与应用场景
§7.1 DrugBank 在医疗 AI 中的四种喂法
- 关系监督喂法:DTI/DDI/药物-疾病三类正例做图学习/链接预测训练——DrugBank 是「标注免费」的图基准源。
- 节点特征喂法:DrugCard 200 字段压缩成药物嵌入(结构+文本+分类三模态编码)——下游任意药物任务的预训练表示。
- 文本语料喂法:机制/适应症/毒性文本做领域 NLP(关系抽取、摘要、问答)——监管标签语料的策展版。
- 光谱-结构绑定喂法:MS/MS/CCS/RT 与 SMILES 的配对做小分子鉴定模型(tandem MS 解谱、保留时间预测)——代谢组学 AI 的监督源。
四种喂法与 §6.5 坑点的对应:喂法 1 踩坑 2(负例)与坑 3(切分);喂法 2 踩坑 4(action)与坑 7(生物药);喂法 3 踩坑 8(版本);喂法 4 踩坑 6(predicted)——建模前回读对号。
§7.2 药物多模态嵌入实操配方
#!/usr/bin/env python3
"""DrugCard → 三模态药物嵌入(结构 + 文本 + 分类),供 DTI/DDI 下游。"""
import pandas as pd
import numpy as np
from rdkit import Chem
from rdkit.Chem import AllChem
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.decomposition import TruncatedSVD
drugs = pd.read_csv("drugbank_drugs.tsv", sep="\t") # §4.3 产物
def morgan_fp(smiles: str, n_bits: int = 1024):
mol = Chem.MolFromSmiles(smiles or "")
return (AllChem.GetMorganFingerprintAsBitVect(mol, 2, nBits=n_bits)
if mol else np.zeros(n_bits, dtype=int))
# 1) 结构模态
X_fp = np.vstack([morgan_fp(s) for s in drugs.smiles])
# 2) 文本模态:机制 + 适应症 + 毒性 TF-IDF → SVD 128 维
texts = (drugs.moa.fillna("") + " " + drugs.indication.fillna(""))
tf = TfidfVectorizer(max_features=50000, stop_words="english")
X_txt = TruncatedSVD(128, random_state=0).fit_transform(tf.fit_transform(texts))
# 3) 分类模态:ATC 首位 + 状态分组 one-hot
X_cat = pd.get_dummies(
pd.DataFrame({"atc1": drugs.atc.str[:1],
"grp": drugs.groups.str.split("|").str[0]})
).to_numpy(float)
emb = np.hstack([X_fp, X_txt, X_cat])
np.save("drugbank_embeddings.npy", emb)
print("嵌入矩阵:", emb.shape)
§7.3 模型选型与迁移决策
- DDI 链接预测:图神经网络(R-GCN/CompGCN 类)在冷启动切分下对比特征基线(结构/ATC 相似度)——GNN 增量主要在多药理关系传播;小数据先用 LightGBM + 相似度特征再上 GNN。
- DTI 回归头:结合常数预测用双塔(药物嵌入 × 蛋白嵌入)+ 交叉注意力——Ki/IC50 数据量不足以端到端训练大模型,预训练嵌入 + 轻量头是务实路线。
- 文本任务:机制关系抽取用领域微调(PubMedBERT/BioLinkBERT 起步)——DrugBank 文本量级(万级卡 × 数百词)不够从头训练。
- 光谱模型:MS/MS 解谱用 seq2seq/transformer(结构→峰序列)——9,464 样本 + 预测光谱增广可训中等模型;CCS/RT 预测用轻量 GBDT 即可。
- 许可对齐:商业部署的模型训练数据链要能通过许可审计——衍生嵌入/中间数据的交付范围与许可条款对齐(§8)。
§7.4 公平性与来源偏倚的工程应对
- 记录偏差显式建模:DDI 度分布与处方流行度相关——把「处方量/标签年代」当协变量,评估时按流行度分层报告。
- 语言与市场偏倚:FDA 标签主导——EMA/HC 独有药的覆盖不均;跨市场结论要声明主要市场。
- 生物药 vs 小分子的模态鸿沟:混合训练的分层评估——生物药子集的性能单独报告,不做「平均掩盖」。
- 罕见病药物覆盖:策展焦点偏常见药——罕见病任务的训练覆盖缺口要写进局限。
§7.5 任务×资源速查表
| AI 任务 | DrugBank 数据 | 输出形态 | 验收 |
|---|---|---|---|
| DDI 预测 | DDI 图 + 嵌入 | 链接预测器 | 冷启动 AUPR + Top-K 召回 |
| DTI 预测 | 靶点关系 + 序列 | 双塔模型 | 外部集(BindingDB)交叉 |
| 药物嵌入 | DrugCard 三模态 | 预训练表示 | 下游任务增益消融 |
| 机制抽取 | MOA/毒性文本 | 关系三元组 | 人工抽检精确率 ≥ 80% |
| MS/MS 解谱 | 光谱族 | 结构候选排序 | Top-1/10 命中率(实验光谱) |
| 重定位推荐 | 适应症 + 靶点 + 试验 | 候选排序 | 证据链抽检 + 试验去重 |
§7.6 端到端案例:DDI 机制感知预测器
- 任务:预测药物对的 DDI 存在性 + 机制类别(CYP 竞争/转运体/QT/出血…)。
- 数据:v6.0 DDI 全量正例;机制标注子集(文本规则 + 人工抽检 500 对校准规则);负例三层(§5.2)。
- 特征:药物对(嵌入拼接 + 交互特征)+ 靶点重叠(CYP/转运体家族)+ ATC 同类标志。
- 切分:药物冷启动(20% 药物整体留出)+ 时间切分(v5→v6 新增对做时序验证)。
- 模型:LightGBM 基线 → GNN(R-GCN)+ 机制多头输出。
- 评估:AUROC/AUPR + Top-20 召回 + 机制归因抽检(预测 CYP 类的 200 对人工验证 ≥ 70% 归因正确)。
- 报告:流行度分层性能 + 生物药子集单独口径 + 版本/许可声明三件套。
§7.7 报告模板:方法学段落骨架
药物知识数据来自 DrugBank v6.0(2024-01 发布;11,891 药物条目;1,413,413 条 DDI;4,939 条非冗余靶点序列;Knox et al., NAR 52:D1265-D1275, 2024),经学术非商业许可获取(下载日期 2026-XX-XX)。药物-靶点关系按 action 语义分层(inhibitor/inducer/substrate 分列);DDI 基准采用三层负例策略(随机弱负例 / 同 ATC 强负例 / v5→v6 时间切分负例)与药物冷启动切分(20% 药物整体留出)。光谱分析仅使用实验光谱(predicted 标志剔除)。多盐型按活性成分 InChIKey 去重;生物药(BI 前缀)单独建模并分层报告。模型为药物冷嵌入(结构 Morgan 指纹 + 机制文本 SVD + ATC one-hot 拼接)与 R-GCN 链接预测的对比,评估含 AUROC/AUPR、Top-K 召回与机制归因抽检。数据使用遵循 DrugBank 使用条款,不进行全量数据的再分发。
§7.8 成本与排期模板
| 阶段 | 内容 | 成本构成 | 周期 |
|---|---|---|---|
| 许可 | 学术许可申请 + 下载 | 人力 | 1-2 周(审批寄回) |
| 解析 | XML/CSV 管线 | 人力 | 3-5 天 |
| 特征 | 嵌入 + 对齐(UniProt/ChEMBL) | 人力 + 单机算力 | 1-2 周 |
| 建模 | 基线 → 图模型消融 | GPU 小额 | 2-3 周 |
| 评估 | 冷启动 + 机制抽检 | 领域人力 | 1 周 |
| 发布 | 复现包(许可合规版) | 人力 | 2-3 天 |
学术许可审批是排期上唯一不可控项——项目启动首日提交申请,等审批期间做 DrugCentral 开源预研。
§7.9 端到端案例 2:药物嵌入的消融证据
场景:为机构的多任务药物模型(DTI/DDI/适应症三头)选预训练表示——用消融回答「三模态嵌入值不值」:
- 候选表示:R1 = 仅 Morgan 指纹;R2 = 指纹 + 文本 SVD;R3 = 三模态全量(§7.2 配方);R4 = 商业分子预训练模型嵌入(对比项)。
- 协议:三个下游任务统一冷启动切分 + 同一 LightGBM 头——表示是唯一变量。
- 预期模式:DTI 任务 R2>R1 明显(文本含靶点语义);DDI 任务 R3>R2(ATC 传播药效学相似性);适应症任务文本模态贡献最大。
- 反例检查:生物药子集单独跑——R1/R3 都退化(无 SMILES),退化幅度就是「模态缺省策略」的改进空间。
- 许可审计点:R3 的文本 SVD 嵌入若要交付给合作方——嵌入了 DrugBank 文本语义,按 §8.1 的再分发边界先过法务。
- 验收:R3 相对 R1 在三任务的增益均显著且方向符合机制预期;R4 对比提供「自建 vs 商业」的成本决策依据。
这一案例的产出是「嵌入选型证据表」——比拍脑袋选表示多一天工作量,省一轮审稿质疑。
§8 伦理、许可与合规
§8.1 许可结构精读
- 浏览 vs 数据:DrugBank Online 网页免费(注册可导出检索结果);数据下载与再分发(全部或部分)需许可——学术非商业免费/优惠,商业(含内部使用)付费。
- 学术许可的边界:非商业研究 OK;许可续期与结项销毁义务看条款;合作企业参与的项目(哪怕「研究用途」)建议先书面确认边界。
- 再分发红线:全量 XML/CSV 或其衍生全量(嵌入/图快照)不得公开——论文附表级别的摘录通常可接受(引用 + 说明);公开基准建议官方许可或改用 DrugCentral 构建。
- 引用义务:条款强制引用 Knox et al. 2024(v6.0);用了 v5/v4 数据引对应版本论文——这是 Trust Center 明文要求。
§8.2 临床使用的责任边界
- DSS 场景:DDI 数据进临床流程(处方审查)需医疗质量/药事委员会验证 + 商业许可(Clinical API 产品线正是为此设计)。
- 研究 → 临床的差:研究结论(预测 DDI)≠ 临床建议——分级判读由执业药师复核;预测器的假阴责任链要在部署文档写清。
- 患者数据无:DrugBank 无患者级数据——没有个体隐私面;但与 EHR 联合分析时 EHR 侧合规独立评估。
§8.3 国内合规路径
- 数据性质:境外数据库的许可使用——学术使用一般走机构采购/许可流程;无人类遗传资源问题(无个体数据)。
- 产品化:境内 DSS 产品内嵌 DrugBank DDI 数据属商业使用——许可 + 境内药监(医疗器械软件分类)两条线都要过。
- 红线:不将许可数据伪装成开源再分发;不做「绕过许可的爬取规模化」——条款与robots 伦理都约束。
§8.4 致谢与引用模板
致谢模板(按需裁剪):
Drug information and drug-drug interaction annotations were obtained from
DrugBank v6.0 (Knox C, Wilson M, Klinger CM, et al. DrugBank 6.0: the
DrugBank Knowledgebase for 2024. Nucleic Acids Res 52, D1265-D1275, 2024.
DOI 10.1093/nar/gkad976), accessed under a non-commercial academic license
on YYYY-MM-DD. We thank the DrugBank curation team and contributors.
§8.5 商业使用边界
CC 类「用了就用了」的直觉在 DrugBank 不成立:内部研究(无对外交付)也属商用范畴——药企 AI 平台团队把「DrugBank 许可」当作与 GPU 预算同级的基础设施成本项立项;DSS/患者直连产品走 Clinical API 而非自建许可数据的服务化。
§8.6 合规台账的最小模板
团队接入 DrugBank 后应维护一张三行的合规台账(示例字段):
| 交付物 | 数据源与版本 | 许可/公开判定 | 负责人 |
|---|---|---|---|
| DDI 预测论文 | DrugBank v6.0(2026-03 下载) | 学术许可;附表 2,000 行内可发表 | 数据负责人 |
| 内部药物嵌入库 | DrugBank v6.0 派生 | 仅内部使用;不交付外部 | 平台负责人 |
| 对外演示 Demo | DrugCentral 2024 + 自有数据 | 开源源;可公开 | 产品负责人 |
台账纪律:每个对外交付物在发布前 5 分钟能查到判定依据——法务问询从「一周考古」变成「一封邮件」;许可续期/版本升级时台账就是影响面清单。
§9 谱系与生态
§9.1 药物知识库时间线
2006 DrugBank v1(Wishart;841 FDA 小分子起步)
2008 NAR 更新(v1.x 口径 D901-906)
2009 v2(DDI/ADMET/撤市药入库)
2011 v3(转运体/通路/专利;Knox)
2014 v4(代谢物/光谱/结合常数;Law)
2018 v5.0(NAR gkx1037;FDA 批准 2,646 时代)
2020 DrugCentral 等开源库成熟(开源对照面形成)
2024 v6.0(DDI 141 万 + 光谱族;NAR gkad976)
2026 AI/ML-Ready Datasets + API/MCP 商业化深化
§9.2 术语表
| 术语 | 定义 |
|---|---|
| DrugCard | 单个药物的完整记录(200+ 字段) |
| DrugBank ID | 药物标识(DB 小分子 / BI 生物药 / EX 实验药等前缀) |
| DDI | Drug-Drug Interaction,药物-药物相互作用 |
| DTI | Drug-Target Interaction,药物-靶点相互作用 |
| action | 靶点作用语义(inhibitor/inducer/substrate/ligand…) |
| targets/enzymes/transporters/carriers | 靶点四类(治疗靶/代谢酶/转运体/载体) |
| groups | 药物状态七分组(approved/withdrawal/investigational/experimental/nutraceutical/illicit/veterinary) |
| ATC | WHO 解剖-治疗-化学分类 |
| InChIKey | 化合物标准标识(跨库去重键) |
| ADMET | 吸收/分布/代谢/排泄/毒性参数 |
| CCS | 碰撞截面(离子淌度质谱物理量) |
| RT / RI | 保留时间 / 保留指数 |
| predicted spectra | 计算生成的预测光谱(与实验光谱相对) |
| max-credible… | (对照 gnomAD 语境)——此处不适用;替换为:mechanism-of-action(MOA),作用机制文本 |
| SPL | Structured Product Label,FDA 结构化标签 |
| Trust Center | DrugBank 的条款/引用政策中心 |
§9.3 资源选型决策树
你的需求是什么?
├─ 「查一个药的说明书级信息」
│ → 网页浏览(免费)
├─ 「DDI 预测基准/图建模」
│ → 学术许可 + DDI 分表(负例按 §5.2)
├─ 「DTI/结合预测」
│ → 靶点表 + ChEMBL 活性交叉 + PDBbind 结构验证
├─ 「药物重定位」
│ → 适应症 + 靶点 + clinicaltrials 交叉
├─ 「代谢组学光谱参考」
│ → 光谱族包(实验光谱优先)+ HMDB 内源互补
├─ 「处方审查生产系统」
│ → 商业许可 / Clinical API(合规第一)
├─ 「需要开源再分发」
│ → DrugCentral(开源替代)——公开基准用它
└─ 「大规模活性筛选」
→ ChEMBL / PubChem(DrugBank 不擅长)
§9.4 与本库其他条目的关系
| 条目 | 关系 |
|---|---|
| chembl | 活性测量规模层——DTI 回归的实验数据补充 |
| drugcentral | 开源对照——再分发敏感场景的替代与交叉验证 |
| drugcomb | 联合用药(组合筛选)——DDI 的体外维度 |
| pharmgkb | PGx 深度层——代谢酶多态的临床分级 |
| hmdb | 代谢物姊妹库——内源/外源光谱互补 |
| clinicaltrials-gov | 试验状态层——重定位候选的现实性核查 |
| PDBbind | 结构结合数据——DTI 的结构验证层 |
§9.5 组合使用建议
| 研究设计 | 推荐组合 | 分工 |
|---|---|---|
| DDI 机制预测 | DrugBank(主)+ DrugCentral(交叉)+ PharmGKB(PGx 机制) | 正例 + 验证 + 分级机制 |
| DTI 全链 | DrugBank(关系)+ ChEMBL(活性)+ PDBbind(结构) | 关联 + 强度 + 结构 |
| 药物重定位 | DrugBank(语义)+ clinicaltrials(状态)+ FAERS/SIDER(安全) | 假设 + 现实性 + 风险 |
| 代谢组学鉴定 | DrugBank(药物光谱)+ HMDB(内源)+ KEGG(通路) | 外源 + 内源 + 语境 |
| 临床 DSS | DrugBank(许可数据)+ RxNorm(术语)+ 本地 EHR | 知识 + 规范 + 场景 |
组合纪律:许可边界贯穿组合——组合系统里每个数据源条款不同(DrugBank 许可制 / ChEMBL CC / DrugCentral 开源),衍生数据集的公开范围取最严约束。
§9.6 策展知识库的生态角色
DrugBank 代表「人工策展知识库」这一物种的生存策略:与自动聚合(PubChem 爬取式)相反,它以人力换一致性——在 LLM 时代反而更凸显价值(模型需要高置信监督源做评估锚点)。它的三个生态位:① 基准锚(DTI/DDI 论文的事实标准);② 语义字典(批准状态/适应症的规范口径);③ 商业知识服务(DSS/药企 OS)。自动聚合库与策展库的分工是互补而非替代——前者供料,后者盖章。
§9.7 开源与许可双轨的工程模式
需要「公开可再分发 + DrugBank 质量」的团队有成熟的工程双轨模式:
- 双源管道:DrugCentral(开源)做公开基准与产品底座;DrugBank(许可)做内部高置信验证与增量正例——两者的 DDI 重叠部分是天然的「交叉验证层」。
- 差异披露:论文报告「DrugCentral 口径」与「DrugBank 口径」双结果——重叠结论稳健、差异结论标注来源,审稿人对这种透明度买账。
- 迁移友好设计:特征工程/切分/评估代码以数据源为参数(一套代码两个库)——许可到期或预算变化时数据源可切换,工程资产不报废。
- 边界清册:每个交付物(模型/嵌入/基准)登记「用了哪个源、能否公开」——合规台账 30 分钟能建,违约调查要烧几周。
§10 资源导航与 FAQ
§10.1 官方资源导航
- 官网/浏览 https://go.drugbank.com/;下载与 release https://go.drugbank.com/releases
- Trust Center(条款/引用)https://trust.drugbank.com/
- 开发者文档 https://dev.drugbank.com/(API/guides)
- 学术许可申请入口:releases 页 Non-commercial/Academic Use
- 联系:官网商务表单(许可/产品)
上手指引(第一次接入的推荐顺序):
- 网页查一个熟悉药物(如华法林)——通读 DrugCard 的 DDI/靶点/ADMET 区块。
- 申请学术许可(首日提交)——等审批期间读 Trust Center 条款全文。
- 许可批准后下载 v6.0 包——先跑 §4.3 解析脚本出药物主表。
- 用 DDI 分表复现 §4.4 图统计——感受度分布的流行度偏倚。
- 再决定要不要进光谱/建模阶段——多数项目其实只用主表 + DDI + 靶点三件。
§10.2 关键文献
- Wishart, D.S. et al. DrugBank: a comprehensive resource for in silico drug discovery and exploration. Nucleic Acids Res 34, D668-672 (2006). PMID 16381955
- Wishart, D.S. et al. DrugBank: a knowledgebase for drugs, drug actions and drug targets. Nucleic Acids Res 36, D901-906 (2008). PMID 18048412
- Knox, C. et al. DrugBank 3.0: a comprehensive resource for ‘omics’ research on drugs. Nucleic Acids Res 39, D1035-1041 (2011). PMID 21059682
- Law, V. et al. DrugBank 4.0: shedding new light on drug metabolism. Nucleic Acids Res 42, D1091-1097 (2014). PMID 24203711
- Wishart, D.S. et al. DrugBank 5.0: a major update to the DrugBank database for 2018. Nucleic Acids Res 46, D1074-D1082 (2018). DOI 10.1093/nar/gkx1037
- Knox, C. et al. DrugBank 6.0: the DrugBank Knowledgebase for 2024. Nucleic Acids Res 52, D1265-D1275 (2024). DOI 10.1093/nar/gkad976
§10.3 站内延伸阅读
- ChEMBL — 生物活性数据库:活性测量规模层(本库姊妹条目)
- DrugCentral — 开源药物数据库:开源替代与交叉验证
- PharmGKB — 药物基因组学知识库:PGx 深度层
- HMDB — 人类代谢物数据库:内源代谢物光谱互补
- ClinicalTrials.gov — 临床试验注册库:重定位的现实性核查
- PDBbind — 结合亲和力数据库:结构结合验证层
§10.4 FAQ
Q1:DrugBank 是免费的吗?
A:一半免费——网页浏览与检索免费(注册可导出检索结果 CSV);XML/CSV 全量下载与再分发需许可(学术非商业免费/优惠,商业付费)。
Q2:能把我解析出的 DrugBank 数据集公开吗?
A:全量或大体量衍生数据不建议公开(再分发受限);论文附表级摘录一般可接受。要公开基准就用 DrugCentral 构建。
Q3:11,891 和 19,879 哪个对?
A:都对,口径不同——11,891 是 v6.0 论文药物条目(2024-01);19,879 是第三方对更新商业快照的统计(含全部状态分组)。引用写版本与日期。
Q4:「FDA 批准 4,563」和「4,030 小分子 + 1,601 生物药」矛盾吗?
A:不同时间快照——4,563 是 v6.0 论文(2024-01)口径;4,030+1,601=5,631 是后续 release(2026 维基镜像口径)滚动后的数字。方法段锁定一个口径并注日期。
Q5:DDI 有 141 万条,能当「141 万种真实相互作用」用吗?
A:不能这么表述——多数记录是标签/文献文本(含「机制未知的联合注意」),等级与证据强度不一;建模时按机制归因子集分层。
Q6:DTI 的负例怎么造?
A:没有真负例——用三层弱负例(随机不相连/同 ATC 不相连/时间切分新发现对),并在论文声明负例是「无记录假设」;冷启动切分比负例本身更影响结论。
Q7:Ki/IC50 数据全吗?
A:不全——只有部分药物-靶点对有文献值且实验条件异质;结合强度建模与 ChEMBL(千万级活性值)交叉补全。
Q8:生物药怎么处理?
A:BI 前缀药多为蛋白/多肽——无小分子 SMILES;单独建模、分层报告,别混进指纹特征管线。
Q9:光谱数据是实验的还是算的?
A:混合——字段含 predicted 标志;训练用实验优先,预测光谱只做增广;评估集必须剔除 predicted。
Q10:和 ChEMBL 怎么分工?
A:DrugBank 管「成药知识」(批准状态/适应症/DDI/机制),ChEMBL 管「活性测量」(千万级 Ki/IC50);DTI 研究两个都要。
Q11:商业公司内部研究也要付费吗?
A:是——条款把 internal use 划入商用;药企/健康科技内部平台用 DrugBank 数据需商业许可。
Q12:能接入处方审查系统吗?
A:走 Clinical API 产品线(官方 DDI 检查器)或商业许可 + 本地部署——同时过药事合规;别用学术许可数据做生产系统。
Q13:版本多久更新?
A:大版本约 2 年(v5.0 2018 → v6.0 2024 间隔较长),月度小修正持续——复现包记「版本 + 下载日期」双戳。
Q14:撤市药物有记录吗?
A:有——withdrawal 分组自 v2 起维护(含撤市原因),药物警戒/安全研究直接用该子集。
Q15:ATC 编码覆盖全吗?
A:不全——研究性/实验药的 ATC 缺失率高;分类统计时声明 ATC 覆盖率,缺失组单列。
Q16:怎么把 DrugBank 与 EHR 药嘱对齐?
A:经 RxNorm/通用名 + InChIKey 多级映射——商品名差异与盐型问题是主要摩擦;先在 50 个高频药上人工验证映射规则再放量。
Q17:学术许可多久批下来?
A:通常数个工作日至两周(学术邮箱 + 用途声明)——项目首日申请,等批期间用 DrugCentral 预研。
Q18:引用哪篇?
A:用 v6.0 引 Knox 2024(DOI 10.1093/nar/gkad976)——条款强制;用到历史版本数据(如 v5.0 DDI 时序)加引对应版本论文。
Q19:药物重定位怎么防「假候选」?
A:三道滤网——investigational 状态核对(真在做)、试验记录去重(clinicaltrials 交叉)、安全存量扫描(DDI/撤市史)——三级证据链缺一降级。
Q20:LLM 时代 DrugBank 还重要吗?
A:更重要——LLM 幻觉时代,「策展一致性」成了稀缺资产:评估锚点(模型输出 vs DrugBank 事实)与 RAG 知识源都依赖高置信策展;它的商业 API/MCP 化(2026)正是这个逻辑。
Q21:能与 gnomAD 类人群数据联动吗?
A:间接联动——药物代谢酶(CYP)多态 → PharmGKB/PGx 层 → 人群频率(gnomAD/队列)——「基因型指导用药」研究链的组合拼图(各层各自版本管理)。
Q22:数据质量有第三方评估吗?
A:惯常做法是交叉验证——DDI 与 DrugCentral 重叠率、ATC 与 WHO 对齐率、靶点与 UniProt 一致率;自己抽样 100 条做人工核查是发论文前的标准动作。
Q23:机制文本能直接当标签训练分类器吗?
A:要预处理——MOA 文本常含多机制并列与否定语境;先做句子级拆分 + 机制词表归一(CYP3A4/3A4 抑制…),抽检 200 条标注一致率 ≥ 80% 再进训练集。
Q24: withdrawal 分组能研究「药物为什么失败」吗?
A:可以——撤市原因文本 + ADR 字段 + 时间线构成「失败案例库」;对照 approved 组做对比学习是安全 pharmacology 模型的新颖监督信号(注意样本量小、报告偏倚强)。
Q25:学术许可过期后还能用已下载数据吗?
A:看条款——多数许可条款规定「许可期内获取的数据按许可条款处理」,续期义务与结项销毁条款要逐条读;台账(§8.6)里记许可有效期是最低配置。
Q26:复方药在图建模里当节点还是展开?
A:展开——复方卡链接回各成分卡;DDI 分析以成分为节点(复方的相互作用来自成分),产品统计才把复方当单元。
§10.5 要点回顾
- 许可先于数据:学术/商业/再分发三条边界在开工前定案——这是 DrugBank 与开放库的第一区别。
- 版本 + 日期双戳:大版本 2 年 + 月度修正——复现的最小版本元组。
- 口径三件套:论文口径(2024-01)/镜像快照(2026-08)/第三方统计各不同——引用锁口径。
- 负例与切分决定 DDI 结论:三层负例 + 冷启动——随机边的性能不可信。
- action 语义分层:inhibitor/inducer/substrate 别合并——机制建模的地基。
- predicted 光谱硬过滤:评估集只认实验值。
- 生物药单独走:无 SMILES 模态——分层报告防伪影。
- 组合取最严许可:DrugBank(许可)+ ChEMBL(CC)+ DrugCentral(开源)混用的衍生数据公开范围取最严。
- 引用是义务:Knox 2024 是条款要求不是礼节。
- 策展价值在 LLM 时代上升:高置信事实源是评估锚与 RAG 底座——这是 DrugBank 长期价值的重新定价。
口径存照(数字均注明口径与来源,写入正文前已核对)
- 11,891 药物条目 = DrugBank 6.0 论文口径(Knox et al., NAR 52:D1265-D1275, 2024-01-05, DOI 10.1093/nar/gkad976)
- FDA 批准 2,646 → 4,563(+72%)/ 研究性 3,394 → 6,231(+38%)= 同上论文(v5.0→v6.0)
- DDI 365,984 → 1,413,413(+300%)/ 药物-食物 1,195 → 2,475(+200%)= 同上论文
- 光谱族 9,464/11,710 小分子(MS/MS + 1D/2D-NMR + CCS + RT + RI)= 同上论文
- 4,030 FDA 批准小分子 + 1,601 生物药 + 134 营养品 + 6,722 实验药;4,939 非冗余蛋白序列;200+ 字段 = HandWiki DrugBank 词条 2026-08-18 修订快照(后续 release 滚动口径)
- 19,879 总条目 / 4,815 approved(2026-07)= ProteinIQ 第三方统计(商业快照口径,仅作口径对照)
- 30M+ 年访问 = v6.0 论文;58,000+ publications / 1,500+ 机构 = 官网 2026(trust 页与首页口径略有差异,用「数万篇」量级表述)
- 许可:网页免费 / 下载再分发需许可 / 学术非商业免费或优惠 / 商业含内部使用付费 = DrugBank 官方条款与 FAQ(dev/trust 站)
- 历代版本数字:v1(2006)841 FDA 小分子 + 113 生物药 + 2,133 靶点;v2(2009)1,344+123、3,037 靶点;v3(2011)1,424+132、>4,000 靶点;v4(2014)1,558+155、4,200 靶点 = HandWiki 版本史(源自历代 NAR 论文)
- 六篇 NAR 论文 DOI/PMID 见 §10.2(官方 Citing 页核验)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- davis — 共享标签:药物发现与化学 / 药物-靶点相互作用 / 化学信息学
- chembl — 共享标签:药物发现与化学 / 药物-靶点相互作用 / 化学信息学
- chembl — 共享标签:药物发现与化学 / 药物-靶点相互作用 / 化学信息学
- iuphar-bps — 共享标签:药物发现与化学 / 药物-靶点相互作用 / 化学信息学
- kiba — 共享标签:药物发现与化学 / 药物-靶点相互作用 / 化学信息学
- gdb-17 — 共享标签:药物发现与化学 / 化学信息学
- coconut — 共享标签:药物发现与化学 / 化学信息学
- uspto-50k — 共享标签:药物发现与化学 / 化学信息学
- open-reaction-database — 共享标签:药物发现与化学 / 化学信息学
- zinc — 共享标签:药物发现与化学 / 化学信息学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

