GtoPdb — 专家策展药理学知识库 AI-Ready Wikipedia

3,118 个人类靶点 × 13,591 个配体的专家策展药理学相互作用知识库

来源 国际基础与临床药理学联合会(IUPHAR)与英国药理学会(BPS) url: https://www.guidetopharmacology.org发布时间: 2026-09-13最后更新: 2026-09-25 阅读 52
GtoPdb — 专家策展药理学知识库 AI-Ready Wikipedia

信息速览

数据集名称GtoPdb — 专家策展药理学知识库 AI-Ready Wikipedia
数据类型3,118 个人类靶点,13,591 个配体,24,313 条相互作用,22,064 条定量数据,PostgreSQL/CSV/RDF/JSON
规模非患者数据:3,118 个靶点 / 13,591 个配体(release 2025.4)
接入方式国际基础与临床药理学联合会(IUPHAR)与英国药理学会(BPS) url: https://www.guidetopharmacology.org
AI 就绪度

数据集封面

IUPHAR/BPS Guide to PHARMACOLOGY(GtoPdb) — 专家策展药理学知识库 AI-Ready Wikipedia

INFOBOX

数据集名称 IUPHAR/BPS Guide to PHARMACOLOGY(GtoPdb)
英文全称 The IUPHAR/BPS Guide to PHARMACOLOGY
别名/简称 GtoPdb、Guide to Pharmacology(前身:IUPHAR-DB、BPS Guide to Receptors and Channels)
疾病分类 全疾病谱药物靶点知识库(ICD-11 跨系统:BA00 原发性高血压 / 5A11 2 型糖尿病 / 8A68 癫痫 / 8A00 帕金森病等,详见 §2.1)
SNOMED CT 38341003 Hypertensive disorder / 44054006 Type 2 diabetes mellitus / 84757009 Epilepsy / 195967001 Asthma(详见 §2.1b)
数据模态 结构化药理学数据(配体-靶点相互作用)、化学结构(SMILES/InChI/SDF)、蛋白质靶点注释、临床用途与药理学文本摘要
AI 任务类型 DTI 预测、亲和力回归(pKi/pIC50)、药物重定位、靶点优先级排序、选择性分析、分子生成评估
样本总数 3,118 个人类靶点 / 13,591 个配体 / 24,313 条相互作用 / 48,852 篇参考文献(release 2025.4)
数据大小 完整 PostgreSQL dump + 9 类分表下载(CSV/RDF/SDF/JSON,总体积以官方下载页公布为准)
数据格式 CSV / PostgreSQL dump / RDF(含 SPARQL 端点)/ JSON(REST web services)/ SDF
许可证 数据库:ODbL(Open Data Commons Open Database License);内容:CC BY-SA 4.0
访问级别 开放(2025 年起官方要求商业机构提供财务支持,学术与个人使用保持免费开放)
语言 英文
首发日期 2011-12(前身为 2003 年编制的 IUPHAR-DB 与 BPS《Guide to Receptors and Channels》)
最后更新 2025-12-10(release 2025.4;每年 3-4 次公开发布)
发布机构 国际基础与临床药理学联合会(IUPHAR)与英国药理学会(BPS);策展团队位于爱丁堡大学
官方主页 https://www.guidetopharmacology.org
下载地址 https://www.guidetopharmacology.org/download.jsp
DOI 10.1093/nar/gkaf1067(NAR 2026 数据库论文,官方指定引用凭证)
引用次数 1,460+(NAR 2016 与 2018 两篇数据库论文合计被引,截至 2019,官方论文自述口径)
AI 就绪度评分 ⭐⭐⭐(3/5)— CSV/RDF/JSON 多形态、ID 稳定、文档严谨、可整体下载;扣分项:无官方 ML 划分、无官方预处理脚本、亲和力单位需自行归一化
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、药理学任务定义、金标准策展流程描述)、§7 偏倚分析。

数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典(interactions 表字段体系)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 IUPHAR、英国药理学会(BPS)、爱丁堡大学无任何商业利益关联。本页面不销售 GtoPdb 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 IUPHAR、BPS 或爱丁堡大学的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。GtoPdb 数据库按 ODbL 许可、内容按 CC BY-SA 4.0 许可发布,衍生数据库需遵守署名-相同方式共享要求;官方另请商业使用者提供财务支持。DUO 标签不适用于本数据集(不含人类受试者数据),具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? GtoPdb(IUPHAR/BPS Guide to PHARMACOLOGY)是一本"活页的药理学百科全书":国际基础与临床药理学联合会(IUPHAR)与英国药理学会(BPS)请全球 1,000 多名药理学家分门别类地审定每个药物靶点,再由爱丁堡大学的专业策展团队把文献里的结合数据一条条抄录进数据库。截至 release 2025.4,它收录 3,118 个人类靶点、13,591 个配体和 24,313 条配体-靶点相互作用,其中 22,064 条带 Ki、IC50、EC50 等定量数值,且每条都能追溯到原始论文。

为什么重要? 药物发现 AI 最缺的不是数据量,而是"可信的标签"。ChEMBL、BindingDB 靠文本挖掘和投稿汇聚数据,规模大但噪声也大;GtoPdb 反其道而行——只在确认分子结构、有可引用的作用机制证据和定量数据来源时才收入一条记录,并让 109 个专家亚委员会为每个靶点家族背书。它因此成为 DTI 预测、亲和力回归和药物重定位研究中"高置信标签"的代名词,也是 WHO 基本药物与多国批准药物的权威参照系。

我能用它做什么? 免费下载整库(PostgreSQL dump 或分表 CSV),也可以走 REST API 拿 JSON、走 SPARQL 查 RDF。典型玩法:构建亲和力回归基准(记得把单位统一成 pX 负对数)、给已批准药物找新靶点(用"主靶点"文件)、筛孤儿靶点的化学探针、或者把它的精选相互作用当作其他大规模数据库的校准集。注意:它没有官方训练/测试划分,也没有预处理脚本——这些正是本 Wiki 第 5、6 章要帮你补齐的。

§1.1 技术摘要

GtoPdb 是一个开放获取、专家策展的配体-靶点相互作用知识库,2011 年 12 月由 IUPHAR-DB(2003 年编制,聚焦受体与通道)与 BPS《Guide to Receptors and Channels》合并上线,由 NC-IUPHAR(IUPHAR 命名与标准委员会)提供学术监督。策展标准有三条硬门槛:确认 name-to-structure 关联、有可引用的分子作用机制(MMoA)证据、有定量相互作用数据来源。每条相互作用记录参数类型(Ki/IC50/EC50/Kd 等)与数值,忠实转录自原始文献;release 2025.4 收录 24,313 条相互作用(22,064 条定量)、52,850 个结合常数(release 2025.2 口径)与 48,852 篇参考文献。数据按人、小鼠、大鼠三个物种组织,含直系同源扩展;每年 3-4 次公开发布,发布形态包括完整 PostgreSQL dump、9 类分表 CSV、RDF 平面文件(可载入三元组库做 SPARQL 查询)与 REST JSON web services。配套资源包括姊妹库 GtoImmuPdb(免疫药理学)、GtoMPdb(疟疾药理学)、SynPharm(药物响应蛋白序列域)以及双年出版物《Concise Guide to PHARMACOLOGY》。

release 2025.4 数据快照关键数字:

  • 靶点:3,118 个人类靶点,其中 1,797 个(约 58%)有 curated 定量配体相互作用
  • 配体:13,591 个,其中 9,816 个有定量靶点相互作用;批准药物 2,156 个(1,212 个有定量相互作用)
  • 相互作用:24,313 条(定量 22,064 条);临床用途摘要覆盖 4,169 个配体
  • 文献与结构:48,852 篇参考文献;PubChem 交叉引用 CID/SID 双通道
  • 更新节奏:每年 3-4 次发布,2025.4 单次新增 91 配体 / 106 相互作用

§1.2 战略价值

维度一:标签质量的"金秤砣"。 在 DTI 建模生态里,数据源之间差异巨大:ChEMBL 收录数千万条生物活性记录但混有大量重复测定与不同实验条件;BindingDB 体量大但质量控制依赖投稿方。GtoPdb 的 24,313 条相互作用每条都有策展人背书与原始文献 ID,约 70% 的定量数据点以 pIC50/pKi 形式可直接比较(NAR 2024 论文统计 22,430 个定量点中 15,492 个为 pIC50/pKi)。把它作为训练集的高置信子集或验证集,是提升模型标签可信度的捷径;NAR 2026 论文还专门给出了它与 ChEMBL、BindingDB 的覆盖度对比,方便研究者做数据源融合决策。

维度二:临床与监管语义的桥梁。 GtoPdb 是少数把"药理学数据"与"临床语义"直接焊接起来的资源:2,156 个已批准药物(release 2025.4)带跨监管机构批准标签,其中 1,212 个有定量相互作用;4,169 个配体带临床用途摘要;“approved drugs with primary targets” 文件直接给出药物的分子作用机制主靶点(355 个人类主靶点,release 2025.2 口径)。对药物重定位、适应证预测、药理学约束的分子生成这类任务,这层语义是纯活性数据库不具备的。官方还维护 WHO 基本药物标签(2025 年清单更新即新增 89 个配体),让"临床重要性"可计算。

维度三:AI-Ready 的工程形态。 相比许多"只有网页"的知识库,GtoPdb 的四种发布形态(CSV/SQL/RDF/JSON)覆盖了从笔记本原型到生产系统的全部摄取路径:CSV 分表可直接进 pandas;PostgreSQL dump 适合固定快照的审计与复现;RDF 支持知识图谱联邦查询;REST JSON 支持增量集成。配合稳定主键(ligand_id/target_id)与完整的跨库 ID 映射文件,它可能是"最小摩擦接入大模型流水线"的药理学资源之一——这也是本 Wiki 给出完整 PyTorch 代码(§6.4)的底气。

§1.3 同类数据集横向对比

数据集 规模(定量相互作用) 策展方式 差异化
GtoPdb 24,313 条相互作用 / 22,064 条定量(2025.4) 专家人工策展,NC-IUPHAR 审定,逐条溯源文献 靶点命名权威、主靶点/MMoA 语义、批准药物与 WHO EML 标签、单位忠实转录
ChEMBL(EBI) 数千万条生物活性记录 文本挖掘 + 人工半自动策展 规模最大、含 assay 元数据;条件异质、重复测定多,需重度清洗
BindingDB 约 324 万条结合测量(2026 口径) 投稿汇聚 + 文献提取 结合数据专精、含转录因子等扩展;缺乏 MMoA 与临床语义层
DrugBank 药物-靶点对(多为定性) 人工策展 药物临床信息全面;相互作用常无数值,与定量源合并时需阈值约定
DrugCentral 定量 DTI 子集 人工策展 与 FDA 标签联动;常被用作 DTI 研究的外部验证集(见 §7.8)
PubChem BioAssay 海量筛选记录 提交方自助存档 原始存档价值高;active/inactive 口径不统一,GtoPdb 内容约 2 周内同步入 PubChem
PDSP Ki Database UNC 药理学系 受体结合常数专库 受体药理学专精、口径统一;规模小,常作 Ki 数据补充源

§1.4 版本时间轴

版本/节点 时间 关键变化 来源
IUPHAR-DB 前身 2003 受体与通道数据库首次编制 NAR 2026 论文
GtoPdb 上线 2011-12 IUPHAR-DB 与 BPS Guide to Receptors and Channels 合并发布 NAR 2026 论文 / HandWiki
GtoImmuPdb 2015-2018 Wellcome Trust 资助的免疫药理学姊妹库建成 GtoImmuPdb 论文
GtoMPdb 持续扩展 与 Medicines for Malaria Venture 合作的疟疾药理学门户 NAR 2026 论文
release 2023.2 2023-08 22,430 个定量数据点、约 70% 为 pIC50/pKi;抗菌药扩展(与 AntibioticDB/GARDP 合作) NAR 2024 论文
release 2025.2 2025-06 3,103 靶点 / 13,260 配体 / 19,613 唯一靶点-配体对 / 52,850 结合常数 NAR 2026 论文
release 2025.3 2025-09-10 3,112 靶点 / 13,503 配体;官方启动商业机构财务支持计划 官方发布博客
release 2025.4 2025-12-10 3,118 靶点 / 13,591 配体 / 24,313 相互作用 / 48,852 参考文献;WHO EML 2025 清单同步(+89 配体) 官方发布博客
NAR 2026 论文 2026-01-06(正式出版) 官方指定引用论文(DOI 10.1093/nar/gkaf1067),取代此前全部数据库论文;含 ChEMBL/BindingDB 对比 NAR / Nottingham 机构仓库

§1.5 典型应用场景

  1. 亲和力回归基准构建
    • 输入:interactions.csv 定量子集 + ligands.csv 结构 + targets_and_families.csv 靶点注释
    • 输出:pX 回归模型与"分组/时间"双划分评估报告
    • 验收指标:RMSE/MAE/Pearson r(§6.9);随机划分与分组划分差距须显式报告
  2. 药物重定位与主靶点推理
    • 输入:approved_drugs_with_primary_targets.csv(主靶点/MMoA)+ 全部相互作用
    • 输出:候选"药物→新靶点"对清单及机制解释
    • 验收指标:主靶点命中率、与临床用途摘要的一致性(坑点 4)
  3. 靶点优先级排序 / 孤儿靶点探针发现
    • 输入:靶点家族分类 + 定量覆盖标记(3,118 个靶点中 1,797 个有定量数据)
    • 输出:"暗"靶点清单与化学探针缺口地图
    • 验收指标:定量覆盖缺口按家族分布的合理性(对照 NAR 2026 论文统计)
  4. 多源数据融合的校准集
    • 输入:GtoPdb 高置信子集 + ChEMBL/BindingDB 下载快照
    • 输出:统一单位/阈值口径后的融合训练池
    • 验收指标:跨库重叠对数值一致性(NAR 2026 官方对比作基线)
  5. 药理学教育 / RAG 语料
    • 输入:临床用途摘要(4,169 个配体)+ 家族综述 + Concise Guide 表格
    • 输出:检索增强知识库、问答评测集、教学材料
    • 验收指标:答案可溯源率(每条断言锚定到 target/ligand 页面)

§2 医学背景

§2.1 疾病与治疗领域 ICD-11 映射表

GtoPdb 覆盖全疾病谱的药物靶点。下表按其核心靶点家族与代表药物映射到 ICD-11 主要编码("标签"列为数据库中的策展维度,而非疾病诊断标签):

标签(策展维度) 代表靶点 代表药物 ICD-11 ICD-11 中文名
GPCR-血管活性 β2 肾上腺素受体、血管紧张素 AT1 受体 沙坦类、β 激动剂 BA00 原发性高血压
酶-代谢 SGLT2、DPP-4 恩格列净、西格列汀 5A11 2 型糖尿病
离子通道-神经 电压门控钠通道、GABA_A 受体 卡马西平、苯二氮䓬类 8A68 癫痫
GPCR-神经退行 多巴胺 D2 受体、MAO-B 左旋多巴/苄丝肼、司来吉兰 8A00 帕金森病
酶-炎症 COX-1/COX-2 阿司匹林、塞来昔布 CA23 相关共病 哮喘及气道炎症共病
GPCR-呼吸 β2 肾上腺素受体、毒蕈碱 M3 受体 沙丁胺醇、噻托溴铵 CA23 哮喘
酶-慢阻肺 磷酸二酯酶 4、毒蕈碱 M3 受体 罗氟司特、噻托溴铵 CA22 慢性阻塞性肺疾病
催化受体/激酶-肿瘤 EGFR、HER2、PD-1/PD-L1 吉非替尼、曲妥珠单抗、帕博利珠单抗 2C60 乳腺癌
转运体/酶-感染 神经氨酸酶、HIV 逆转录酶 奥司他韦、替诺福韦 1G40 脓毒症及相关重症感染

§2.1b SNOMED CT 映射表

标签 ICD-11 SNOMED CT 码 SNOMED 术语
高血压相关靶点 BA00 38341003 Hypertensive disorder, systemic arterial (disorder)
2 型糖尿病相关靶点 5A11 44054006 Diabetes mellitus type 2 (disorder)
癫痫相关靶点 8A68 84757009 Epilepsy (disorder)
哮喘相关靶点 CA23 195967001 Asthma (disorder)
慢性阻塞性肺疾病相关靶点 CA22 13645005 Chronic obstructive lung disease (disorder)
帕金森病相关靶点 8A00 18127003 Parkinson’s disease (disorder)
脓毒症相关靶点 1G40 10001005 Septic disorder (disorder)

§2.2 医学背景与流行病学

GtoPdb 本身不是疾病队列,而是"药物作用于什么分子"的知识库;它的医学价值在于为几乎全部主要疾病系统提供靶点层证据。以它覆盖的代表性领域为例:高血压影响全球约三分之一成年人口,其治疗药物(ACEI/ARB/CCB/β 阻滞剂)的分子靶点在 GtoPdb 中均有完整定量数据与主靶点标注;2 型糖尿病患病人数全球超过 5 亿,SGLT2 抑制剂等新机制药物自获批起即由策展团队跟踪录入(2025 年即策展 38 个新批准药物)。需要强调:数据库对"疾病"的建模是间接的——通过临床用途摘要(4,169 个配体)与批准药物标签实现,而非 ICD 诊断编码字段。因此把 GtoPdb 用于疾病相关 AI 任务时,需要像本节这样自行建立靶点↔疾病映射层。

§2.3 临床与 AI 任务定义

  • 筛查/诊断类比任务——DTI 二分类:判断某配体是否作用于某靶点。社区惯例以 Ki/Kd/IC50/EC50 ≤10 μM 为结合阈值(见 §8.3),GtoPdb 提供高置信正样本。
  • 分级/定量任务——亲和力回归:预测 pKi/pIC50 等连续值。GtoPdb 约 70% 定量点已是 pIC50/pKi 形式,其余可由 nM 数值换算(见 §6.3)。
  • 预后/机制任务——主靶点与 MMoA 注释:区分药物的主要作用机制靶点(355 个人类主靶点有批准药物定量相互作用,2025.2 口径)与次要结合,用于机制解释与副作用溯源。
  • 生成任务——药理学约束分子生成:以家族选择性面板(如 GPCR 亚型选择性)为约束评估生成分子。
  • 检索增强——药理学 RAG:以临床用途摘要与靶点注释为语料,构建可溯源的药物问答系统;每条答案可锚定到具体靶点/配体页面。

§2.4 人群与物种覆盖

维度 覆盖情况 说明
人类受试者 无患者层面数据 数据库不含患者记录、影像或基因组个体数据;DUO 标签不适用
物种 人(Homo sapiens)、小鼠(Mus musculus)、大鼠(Rattus norvegicus) 相互作用含直系同源扩展,使用时必须按 target_organism 过滤(见坑点 5)
疾病人群代表性 经由批准药物间接体现 2,156 个批准药物跨 FDA 等多国监管机构策展;WHO 基本药物 305 个(2025.2 口径)
地理/机构 全球文献策展 策展团队位于英国爱丁堡大学,学术监督来自全球 109 个 NC-IUPHAR 亚委员会

§2.5 临床价值

价值维度 内容 典型使用者
机制权威性 批准药物主靶点(MMoA)由 NC-IUPHAR 专家审定,355 个人类主靶点有批准药物定量相互作用(2025.2 口径) 药物警戒、机制解释研究
选择性参照 同一配体跨靶点定量数据构成天然选择性面板,支持脱靶风险评估 药物设计团队
教育/决策支持 临床用途摘要(4,169 个配体)与《Concise Guide to PHARMACOLOGY》广泛用于教学 药学院、临床药师培训
监管语义 批准药物跨 FDA 等多国机构标签 + WHO 基本药物标记 卫生技术评估、政策研究

对 AI 医疗产品而言,GtoPdb 常作为知识先验注入:例如用其靶点-药物图谱约束 LLM 的药理学问答,或在药物警戒信号中核查"靶点是否与已知机制一致"。需要注意其边界:数据库描述的是"分子层药理学",不包含剂量方案、不良事件发生率或患者结局数据,不能替代临床指南与药品说明书。

§2.6 标注(策展)金标准

维度 GtoPdb 的做法
划分 无官方 ML 划分;知识库按季度滚动更新,版本号(如 2025.4)即数据快照标识
标注方式 专家人工策展:确认 name-to-structure + 可引用 MMoA 证据 + 定量数据来源三条硬门槛,全部通过才录入相互作用
标注者 爱丁堡大学全职策展团队 + NC-IUPHAR 109 个亚委员会(累计 1,000+ 科学家,约 325 名活跃贡献者)
标注性质 忠实转录原始文献报告值(Ki/IC50/EC50/Kd + 测定条件),不做测量复现;约 70% 定量点为 pIC50/pKi;被撤稿文献自动带警告标签

§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本 大小/形态 理由
做可复现基准(论文投稿) 固定 release 号(如 2025.4)+ PostgreSQL dump 或分表 CSV GB 级以下 官方要求引用时注明 release 版本号;固定快照可审稿复验
快速原型 / 笔记本实验 分表 CSV(interactions.csv + ligands.csv + targets_and_families.csv) 最小可用子集 无需装数据库,pandas 直接读;见 §6.1
知识图谱 / 语义应用 RDF 平面文件 + SPARQL 端点 视图级 可载入本地三元组库做 SPARQL 联合查询
生产级 API 集成 REST web services(JSON) 按需 计算访问官方接口,无需本地同步;注意版本漂移(坑点 8)
免疫/疟疾专题 GtoImmuPdb / GtoMPdb 门户 同 schema 子库 共享 GtoPdb 数据,附免疫/疟疾专门数据类型
需要引用总量口径 NAR 论文对应 release(2025.2) — 论文表格数字与该发布严格对应,写作引用最稳妥

§3.1 数据模态详情

模态 内容 承载文件/接口 release 2025.4 规模
配体-靶点相互作用 相互作用类型 + 定量参数(Ki/IC50/EC50/Kd/pKi/pIC50 等)+ 原始文献 ID + 测定条件 interactions.csv / REST 24,313 条(定量 22,064)
化学结构 isomeric SMILES、InChI、SDF;PubChem CID/SID 交叉引用 ligands.csv / SDF / ligand_id_mapping.csv 13,591 个配体
靶点注释 NC-IUPHAR 命名、家族层级、UniProt/HGNC/Ensembl 交叉 ID(交互下载含 Ensembl Gene ID) targets_and_families.csv 3,118 个人类靶点
药物语义 批准药物主靶点(MMoA)、多国批准标签、WHO EML 标记、临床用途摘要 approved_drugs_with_primary_targets.csv 等 2,156 个批准药物 / 4,169 个摘要
文本知识 家族综述、药理学评论、策展注释 网页 / REST 全库覆盖
语义图谱 RDF 三元组 + SPARQL;BioSchemas MolecularEntity 标记 RDF 平面文件 / SPARQL 端点 全库

相互作用覆盖细节(release 2025.2,NAR 2026 论文口径):

覆盖指标 数量
有配体相互作用的人类靶点 2,027(定量 1,767)
有批准药物相互作用的人类靶点 757(主靶点 355)
唯一靶点-配体对 19,613
结合常数 52,850
有相互作用/定量相互作用的配体 10,835 / 9,571
有定量相互作用的批准药物 1,191

§3.2 按子集样本数表

靶点类别(人类 UniProtKB 口径,release 2025.2)

靶点类别 数量
GPCR 399
离子通道 278
核受体 48
催化受体 253
转运体 555
酶(含激酶、蛋白酶) 1,315
其他蛋白 278
合计 3,103(2025.4 增至 3,118)

配体类别(release 2025.2,类别间不互斥)

配体类别 数量
合成有机物 9,329
其他肽(含合成肽) 1,545
内源肽 824
代谢物 513
天然产物 521
抗体 447
无机物 39
已批准药物 2,120
撤市药物 116
WHO 基本药物 305
配体总计 13,260(2025.4 增至 13,591)

相互作用覆盖(release 2025.2):有配体相互作用的人类靶点 2,027(定量 1,767);有批准药物相互作用的人类靶点 757(主靶点 355);唯一靶点-配体对 19,613;结合常数 52,850;定量相互作用数据点 21,643(2025.4 增至 22,064)。

§3.3 数据格式表

格式 内容 适用场景
CSV 分表 targets/ligands/interactions/peptides/endogenous 与 natural ligands/approved drugs with primary targets/ligand ID mapping 等 pandas/Python 原型、表格 ML
PostgreSQL dump 完整关系库 生产部署、复杂 SQL、引用固定快照
RDF 平面文件 全库三元组 知识图谱、SPARQL 联邦查询
REST JSON web services 实时访问 在线服务、增量集成
SDF 配体结构文件 分子建模、RDKit 摄取

§3.4 存储大小

官方下载页未公布总体积数值,本页不作臆测;经验量级为"完整库远小于影像类医疗数据集,笔记本可承载"。构建环境建议:安装 PostgreSQL 14+ 并预留 10 GB 以上磁盘(含索引与临时空间),或直接使用 CSV 分表(内存占用数百 MB 量级,见 §6.8 硬件需求表)。RDF 平面文件载入三元组库(如 Apache Jena/Fuseki)时按三元组数量预留 2-4 倍内存映射空间。

§3.5 标注(策展)方式

三层人工流程:① 录入策展(爱丁堡团队)——从同行评审文献(含 medicinal chemistry 与临床期刊、专利、WHO INN 提案列表)提取配体结构、MMoA 与定量数据;② 专家审定(NC-IUPHAR 亚委员会)——每个靶点家族由专门小组选定关键文献并撰写药理学语境注释;③ 质控维护——定期将全部参考文献与 PubMed/EPMC 撤稿标记(约 28,500 条)交叉核对,命中即加警告标签;新型药物模态(抗体、核酸药物、降解剂)若无经典定量数据,信息记录于评论字段而非相互作用表(坑点 6)。

策展准入的三条硬门槛(官方 Curation criteria):

  • name-to-structure:配体名称与化学结构的对应关系必须可确认
  • MMoA:分子作用机制有可引用的证据文献
  • 定量来源:相互作用数值有明确的原始文献支撑

三条同时满足才录入相互作用;这也是它比文本挖掘库"慢而准"的根本原因。

§3.6 标注者资质与一致性

策展由带药理学/化学信息学背景的全职团队执行,学术监督来自 NC-IUPHAR 及其 109 个亚委员会(累计 1,000+ 科学家,当前约 325 名活跃贡献者);官方称其质量标志是"对来源论文与专家引用文献的双重严选"。数据库不发布标注者间一致性系数(如 Cohen’s κ);一致性通过亚委员会共识与用户纠错机制保障(官方鼓励用户提交修订建议)。使用建议:把"亚委员会审定"视为家族层面的共识背书,把单条定量值视为"文献转录值"而非复测真值。

§3.7 采集与更新周期

每年 3-4 次公开发布(2025 年为 2025.1-2025.4 四次);版本号格式为 年份.发布序号。每次发布伴随官方博客说明新增内容(如 2025.4 新增 91 个配体、106 条相互作用)。策划主题按优先级滚动:批准药物跟踪(2025 年策展 38 个)、WHO 基本药物同步、专题协作(抗菌药与 AntibioticDB/GARDP、疟疾与 MMV)。引用与复现时必须注明 release 版本号(官方 About 页可查)。

2025 年已知发布节奏(官方博客):

发布 日期 靶点 配体 相互作用
2025.2(NAR 论文口径) 2025-06 3,103 13,260 19,613 唯一对
2025.3 2025-09-10 3,112 13,503 24,207(定量 21,968)
2025.4 2025-12-10 3,118 13,591 24,313(定量 22,064)

以官方博客为准核对相邻发布间的增量,可作为流水线"漂移监控"的基线(§6.10)。

§3.8 地域与机构覆盖

文献来源为全球期刊;策展实体位于英国爱丁堡大学(PI:Jamie A. Davies 教授);监督机构 IUPHAR(国际)与 BPS(英国);资金来自 IUPHAR、BPS、Wellcome Trust、Medicines for Malaria Venture、GARDP,赞助方包括 ASPET、Servier 与 MedChemExpress。批准药物策展覆盖 FDA 及其他可跟踪的国家批准机构(官方维护批准药物前沿列表)。

§3.9 环境与软硬件要求

无专用设备要求。推荐环境:Python 3.10+(pandas/rdkit/torch)、PostgreSQL 14+(若导入完整 dump,注意历史版本曾要求 UTF-8 四字节 utf8mb4 支持)、或三元组库(Fuseki/GraphDB)用于 RDF。网络访问需可达 guidetopharmacology.org(下载/REST)与 rdf.guidetopharmacology.org/sparql(SPARQL)。

§3.10 深度溯源链

每条定量相互作用的溯源链:GtoPdb 记录 → 原始文献(original_article_id/PMID)→ 文献中的测定方法描述(assay 描述字段)→ 参数与数值(Ki/IC50 等)→ 撤稿状态标记(官方定期核对 PubMed Retraction 标签)。靶点侧溯源:NC-IUPHAR 命名决定 → 亚委员会选定关键文献 → UniProt/HGNC/Ensembl 交叉 ID。化学侧溯源:策展确认的 name-to-structure 关联 → SMILES/InChI → PubChem CID/SID(发布后约 2 周同步)。这条链使每个"金标签"都可被人工复核——这是多数大规模活性数据库不具备的审计能力。

四级溯源检查清单(审计时可逐级下钻):

  1. 记录级:ligand_id + target_id + interaction_type + 参数值
  2. 文献级:original_article_id → PMID → 撤稿标记状态
  3. 结构级:SMILES/InChI → PubChem CID/SID 一致性
  4. 命名级:NC-IUPHAR 命名 → UniProt/HGNC/Ensembl 映射

§4 数据结构

§4.0 目录树

官方下载页解压后的典型文件布局(文件名以官方下载页当期为准):

gtopdb-2025.4/
├── targets_and_families.csv            # 靶点主表:ID、命名、家族层级、交叉 ID
├── ligands.csv                         # 配体主表:ID、名称、类型、SMILES/InChI、批准状态
├── interactions.csv                    # 核心:配体-靶点相互作用(含定量参数与文献 ID)
├── peptides.csv                        # 肽类配体扩展信息(序列等)
├── endogenous_and_natural_ligands.csv  # 内源与天然配体标签
├── approved_drugs_with_primary_targets.csv  # 批准药物及其主靶点(MMoA)
├── ligand_id_mapping.csv               # 配体 ID 映射(PubChem/ChEMBL/UniProt 等)
├── ligand_structures.sdf               # 配体结构 SDF 文件
├── rdf/                                # RDF 平面文件(可载入三元组库)
│   └── *.nt
└── gtopdb_postgres_dump.sql            # 完整 PostgreSQL 数据库 dump

§4.1 DAIMS 字段字典(interactions.csv 核心字段)

下表为官方下载文件中相互作用数据的代表性字段(8 列含义对照;实际列名以当期下载文件表头为准):

字段 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
ligand_id 整数 配体主键(关联 ligands.csv) 整数自增 ID 连接化学结构 无(库内主键) 无 正整数
target_id 整数 靶点主键(关联 targets 主表) 整数自增 ID 连接蛋白注释 无(库内主键) 无 正整数
ligand_name 文本 配体首选名称 药物/分子英文名 可读性、检索 同义词歧义 无 自由文本
target_name 文本 靶点首选名称(NC-IUPHAR 命名) 受体/酶英文名 分组、报告 命名随版本更新 无 自由文本
target_organism 文本 靶点物种 人/小鼠/大鼠名 物种过滤(坑点 5) 直系同源扩展引入跨物种标签 无 三类物种字符串
interaction_type 文本 相互作用性质 激动剂/拮抗剂/抑制剂/放射配体等 多任务标签、MMoA 语义 部分新模态无经典类型 无 受控词表
affinity_units 文本 定量参数类型 Ki/IC50/EC50/Kd/pKi/pIC50 等 决定归一化路径(坑点 1) 参数类型不可互换 非定量记录为空 受控词表
affinity_value 浮点 参数数值(按 affinity_units 解释) 浓度或 pX 值 回归标签 转录自文献,条件异质 空值=该记录非定量 正实数
affinity_high_value 浮点 删失上界(如">"值) 上界浓度 识别右删失(坑点 2) 删失语义易被忽略 空值=非删失 正实数/空
original_article_id 整数 原始文献引用 ID 文献引用记录 ID 溯源、去重 同文多值常见 无 正整数
assay_description 文本 测定条件描述 细胞/膜制备/温度等 条件分层、批次校正 自由文本粒度不一 可为空 自由文本
primary_target 布尔/标签 是否药物主靶点(MMoA) 是/否 重定位任务正样本 仅批准药物语义明确 非药物为空 二值

§4.1b 配体主表(ligands.csv)代表性字段:

字段 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
ligand_id 整数 配体主键 整数自增 ID 全库连接锚点 无 无 正整数
ligand_name 文本 首选名称(多用 INN) 药物英文名 检索、可读性 同义词歧义 无 自由文本
ligand_type 文本 配体大类 合成有机物/肽/代谢物/抗体等 分层采样(坑点 7) 类别间不互斥 无 受控词表
smiles 文本 isomeric SMILES 标准简化分子线性输入规范串 分子特征化 电离/互变异构形态差异 结构未确认时可为空 合法 SMILES
inchi / inchi_key 文本 InChI 标识 标准串 去重与跨库对齐 版本差异 可为空 标准 InChI
approved_drug 标签 是否批准药物 是/否 药物子集筛选 随监管更新 无 二值
pubchem_cid / sid 整数 PubChem 交叉引用 CID 编号 跨库联接(滞后约 2 周) 同步延迟 未收录为空 正整数/空

§4.1c 靶点主表(targets_and_families.csv)代表性字段:

字段 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
target_id 整数 靶点主键 整数自增 ID 全库连接锚点 无 无 正整数
target_name 文本 NC-IUPHAR 首选名称 受体/酶英文名 分组与报告 版本间命名更新 无 自由文本
target_organism 文本 物种 人/小鼠/大鼠名 物种过滤(坑点 5) 直系同源扩展 无 三类物种字符串
uniprot_id 文本 UniProt 接入号 标准接入号 跨库主键锚点 未收录时缺失 无定量覆盖靶点可为空 UniProt 格式
family 层级字段 文本 家族/亚族分类 GPCR→A 类→… 层级特征、分层评估 分类边界随命名法演进 无 受控层级
hgnc_id / ensembl_gene_id 文本 基因交叉 ID 标准 ID 组学与 GtoPdb 对齐 偶有缺失 未映射为空 标准 ID/空

§4.2 标签分布

  • 相互作用类型:由靶点家族决定主导类型——GPCR 以激动剂/拮抗剂/反向激动剂为主,酶与转运体以抑制剂为主,离子通道含阻滞剂/调节剂与放射配体;核受体含激动剂/拮抗剂。官方不公布类型计数总表,建议下载后 value_counts() 自查。
  • 定量参数分布:约 70% 定量点为 pIC50 或 pKi(NAR 2024:22,430 个定量点中 15,492 个)。中位 pIC50 按配体类型分化显著:抗体 9.15、肽类 8.11、合成有机物 7.48、批准药物 7.23、代谢物 6.30、天然产物 6.20——直接混合训练会让模型学到"配体类型→效力"的捷径(坑点 1/7)。
  • 批准药物标签:2,156 个批准药物(2025.4),其中 1,212 个有定量相互作用;WHO 基本药物 305 个(2025.2)。

§4.3 关键统计

  • 3,118 个人类靶点中 1,797 个(约 58%)有 curated 定量相互作用(2025.4)——近半靶点是"无定量标签"的暗靶点,做分类任务时负样本采样策略必须显式(§5.3)。
  • 唯一靶点-配体对 19,613,而定量数据点 21,643(2025.2):同一配体-靶点对常有多条测定记录,去重/聚合策略影响基准结果(坑点 3)。
  • 结合常数 52,850 个;参考文献 47,380 篇(2025.2);平均每个相互作用约 1 条以上引用支撑。
  • UniProt 交叉引用仅收录亲和力 pAffinity ≥6 的靶点(人类 1,664 个 UniProtKB)——弱结合数据不会进入该通道,跨源对齐时注意口径(坑点 8)。
  • 批准药物前沿:2025 年内官方策展 38 个新批准药物(跨 FDA 等机构),2025.4 又收录 21 个 2025 年获批新药——批准状态字段是动态语义,快照内固定。
  • WHO 基本药物标签随清单年度刷新:2025 年同步新增 89 配体、移除 7 配体(含部分抗病毒与抗 HCV 药)。

§4.4 数据层级

发布版本(release 2025.4)
└── 靶点家族(GPCR / 离子通道 / 核受体 / 催化受体 / 酶 / 转运体 / 其他)
    └── 靶点(target_id ↔ UniProt/HGNC/Ensembl)
        └── 相互作用(interaction 记录 ↔ 配体 ligand_id)
            ├── 定量参数(affinity_units + value [+ 高界])
            ├── 测定条件(assay_description)
            └── 原始文献(original_article_id → PMID → 撤稿标记)

§4.5 缺失值与信息性缺失编码表

情形 表现 解读 处理建议
非定量相互作用 affinity_* 字段为空 该记录仅确认结合/调节关系,无数值(新模态常见,坑点 6) 分类任务可用作弱正样本;回归任务剔除
右删失值 存在">"上界(affinity_high 类字段或原文字符串) 真实效力弱于上界,不能当普通数值(坑点 2) 剔除或删失感知损失
同对多记录 同一 ligand-target 对多行 不同文献/条件/参数的重复测定 按对聚合或分层建模(坑点 3)
主靶点为空 primary_target 空 该配体非批准药物或机制未审定 不要默认填 False 参与重定位标签
评论承载信息 相互作用表无行但配体页有注释 抗体/核酸/降解剂等新模态数据(坑点 6) 需访问网页/REST 补充,勿视为"无数据"

§5 数据划分与使用建议

§5.1 官方划分

无。GtoPdb 是持续更新的知识库而非基准数据集,官方不提供 train/val/test 划分,也不发布预处理脚本。可复现的正确姿势是:固定 release 版本号 + 记录下载日期 + 在论文/仓库中公开划分清单。

§5.2 社区惯例划分

  • 阈值二分类惯例:以 Ki/Kd/IC50/EC50 ≤10 μM 且 UniProt reviewed 作为 DTI 正样本(deepDTnet 等研究的标准做法,见 §8.1);负样本多为"未知即负"假设,需谨慎声明。
  • 随机划分(仅作基线):按相互作用行随机切分——最容易得分也最容易高估,因同一配体/靶点跨集泄漏(坑点 3)。
  • 分组划分:按 ligand_id 或 target_id 分组切分,模拟"新化学骨架"或"新靶点"泛化。
  • 骨架划分:基于 SMILES 的 Bemis-Murcko 骨架切分,是化学 ML 社区评估结构泛化的通行做法。

划分协议选择矩阵:

你的问题 推荐协议 警惕
“模型能拟合已知化学空间吗” 随机划分(仅作基线) 结果必然乐观,不可单独汇报
“换个分子还行吗” Bemis-Murcko 骨架 / ligand_id 分组 骨架阈值选择会影响难度
“换个靶点还行吗” target_id 分组 / leave-one-target-out 冷启动下指标大幅下降属正常
“未来发现能被预测吗” 时间切分(按 release 版本) 需多版本快照,工程成本高
“跨库结论稳健吗” GtoPdb 训练 + DrugCentral/BindingDB 外部验证 先统一单位与 ID 口径

§5.3 泄漏风险(重点)

  1. 同一配体跨集:一个配体作用于多个靶点(10,835 个配体有相互作用,2025.2),随机划分让"近邻标签"直接进测试集;应按配体或骨架分组。
  2. 同一靶点跨集:某靶点下所有相互作用同进同出才能考察"新靶点泛化";leave-one-target-out 是冷启动评估的保守选择。
  3. 对内聚合泄漏:19,613 唯一对对应 21,643 个定量点,先聚合后划分 vs 先划分后聚合会得到不同结论——协议必须写死。
  4. 版本泄漏:训练用 2023.2、测试混入 2025.4 新增行(+698 个有相互作用配体),时间上后发生的发现应只出现在测试侧;建议按 release 时间做时间切分验证。

§5.4 交叉验证建议

回归任务建议 5 折 GroupKFold(group=ligand_id 或 Bemis-Murcko 骨架),另跑一组 group=target_id 作对照,两组差距本身就是"记忆 vs 泛化"的诊断指标;二分类 DTI 任务建议在正样本内分组 + 显式负采样协议(固定随机种子),并报告 AUROC 与 AUPRC(类别极不平衡下 AUROC 会显得过于乐观,见 §6.9)。

§5.5 外部验证建议

以 DrugCentral 或 BindingDB 的时间上更晚的子集作外部验证(deepDTnet 即以 DrugCentral 非重叠对作外部验证,见 §7.8)。跨源验证的三步清单:

  1. 统一口径:单位换算与阈值约定先对齐(§6.3),删失值处理策略保持一致
  2. 统一主键:靶点以 UniProt accession 对齐、配体以 InChIKey 或 ligand_id_mapping.csv 对齐
  3. 冻结时间:外部集在时间上必须晚于训练快照,杜绝"未来信息"回流

§6 AI 就绪指南

§6.0 云端快速启动

官方未提供托管 Notebook,但数据轻量,任何云环境 5 分钟内可跑通:Google Colab 直接 pip install rdkit pandas torch 后按 §6.2 下载数据(挂载 Drive 存放);AWS/GCP 则建议小容量 VM(4 vCPU/16 GB)即可完成全库预处理,无需 GPU——本数据集的预处理瓶颈是字符串清洗而非算力。

§6.1 快速上手

目录预期:把下载的分表 CSV 放进同一目录(下称 DATA_ROOT),代码内所有路径按 DATA_ROOT + 文件名 直接拼接。最小可用子集 = interactions.csv + ligands.csv + targets_and_families.csv 三张表;其余文件按需加入。

import pandas as pd

DATA_ROOT = "data/gtopdb-2025.4"  # 分表 CSV 所在目录

itx = pd.read_csv(f"{DATA_ROOT}/interactions.csv")
lig = pd.read_csv(f"{DATA_ROOT}/ligands.csv")
tgt = pd.read_csv(f"{DATA_ROOT}/targets_and_families.csv")

print("interactions:", itx.shape)   # 预期约 2.4 万行(release 2025.4:24,313)
print("ligands:", lig.shape)        # 预期约 1.36 万行
print(itx["affinity_units"].value_counts().head(10))  # 定量参数类型分布

# 三表主键对齐自检
assert itx["ligand_id"].isin(lig["ligand_id"]).all()
assert itx["target_id"].isin(tgt["target_id"]).all()

§6.2 数据获取

方式一:官方下载页(推荐,可固定版本)

文件 内容 格式
interactions.csv 全部配体-靶点相互作用(含定量参数、文献 ID、assay 描述) CSV
targets_and_families.csv 靶点与家族分类 CSV
ligands.csv 配体主表(结构 ID、批准状态) CSV
approved_drugs_with_primary_targets.csv 批准药物 ↔ 主靶点(MMoA) CSV
ligand_id_mapping.csv 配体跨库 ID 映射 CSV
ligand_structures.sdf 化学结构文件 SDF
RDF 平面文件 全库三元组 N-Triples 等
PostgreSQL dump 完整关系库 SQL

获取流程:访问 官方下载页 → 选择文件直接下载(无需注册)→ 记录 release 版本号(About 页)。

方式二:REST web services(JSON,适合增量集成),服务说明见 webServices.jsp。

方式三:PubChem 镜像——发布后约 2 周内可用 PubChem 查询 'IUPHAR/BPS Guide to PHARMACOLOGY'[SourceName] 取回全部 CID 内容。

# 下载后校验行数量级(release 2025.4 预期值)
python3 -c "
import pandas as pd
itx = pd.read_csv('interactions.csv')
assert len(itx) > 23000, f'unexpected row count {len(itx)}'
print('rows:', len(itx))
"

§6.3 预处理全流程

核心是单位归一化:把 Ki/IC50/EC50/Kd 的 nM/µM 混合值统一换算为 pX = -log10(摩尔浓度),并妥善处理删失值与同对多记录。

import numpy as np
import pandas as pd

# 1) 载入并过滤定量子集:仅保留经典参数类型
UNIT_TO_M = {"nM": 1e-9, "µM": 1e-6, "mM": 1e-3, "pM": 1e-12}  # 摩尔换算
QUANT = {"Ki", "IC50", "EC50", "Kd"}                            # 功能/平衡参数(坑点 1:勿跨类型直比)

df = itx[itx["affinity_units"].isin(QUANT)].copy()
df = df[df["affinity_value"].notna()]

# 2) 处理右删失(">"上界):有上界标记的行剔除或单列标记(坑点 2)
censored = df["affinity_high_value"].notna() if "affinity_high_value" in df else False
df = df[~np.asarray(censored, dtype=bool)]

# 3) 单位换算:value × 单位因子 → 摩尔 → pX
factor = df["affinity_units"].map(UNIT_TO_M)
df = df[factor.notna()]
df["pX"] = -np.log10(df["affinity_value"] * factor)

# 4) 同对多记录聚合(坑点 3):先聚合后划分
pair = (df.groupby(["ligand_id", "target_id"])["pX"]
          .median()                     # 中位数对多文献稳健
          .reset_index())

# 5) 物种过滤(坑点 5):默认只留人类靶点
tgt_human = tgt[tgt["target_organism"].str.contains("Human", case=False, na=False)]
pair = pair[pair["target_id"].isin(tgt_human["target_id"])]
print(pair.describe())                  # pX 合理范围约 5-12

§6.4 PyTorch DataLoader(完整可运行)

预期目录:DATA_ROOT 下有 interactions.csv / ligands.csv;特征 = 配体 Morgan 指纹(RDKit)+ 靶点 one-hot(top-K 高频靶点);标签 = pX;划分 = 按 ligand_id 分组 80/10/10,避免配体跨集泄漏(坑点 3)。依赖:pandas numpy torch rdkit。

import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
from rdkit import Chem
from rdkit.Chem import AllChem

DATA_ROOT = "data/gtopdb-2025.4"
QUANT = {"Ki", "IC50", "EC50", "Kd"}
UNIT_TO_M = {"nM": 1e-9, "µM": 1e-6, "mM": 1e-3, "pM": 1e-12}

def build_pair_table(data_root=DATA_ROOT, top_k_targets=2000):
    itx = pd.read_csv(f"{data_root}/interactions.csv")
    lig = pd.read_csv(f"{data_root}/ligands.csv")
    df = itx[itx["affinity_units"].isin(QUANT) & itx["affinity_value"].notna()].copy()
    if "affinity_high_value" in df:                      # 剔除右删失(坑点 2)
        df = df[df["affinity_high_value"].isna()]
    factor = df["affinity_units"].map(UNIT_TO_M)
    df = df[factor.notna()].copy()
    df["pX"] = -np.log10(df["affinity_value"] * factor)
    pair = df.groupby(["ligand_id", "target_id"])["pX"].median().reset_index()
    top_targets = pair["target_id"].value_counts().head(top_k_targets).index
    pair = pair[pair["target_id"].isin(top_targets)].reset_index(drop=True)
    smi = lig.set_index("ligand_id")["smiles"] if "smiles" in lig else lig.set_index("ligand_id").iloc[:, 0]
    pair["smiles"] = pair["ligand_id"].map(smi)
    pair = pair[pair["smiles"].notna()].reset_index(drop=True)
    return pair

def morgan_fp(smiles, radius=2, nbits=2048):
    mol = Chem.MolFromSmiles(str(smiles))
    fp = AllChem.GetMorganFingerprintAsBitVect(mol, radius, nBits=nbits)
    return np.asarray(fp, dtype=np.float32)

class GtoPdbAffinity(Dataset):
    """配体 Morgan 指纹 + 靶点 one-hot → pX 回归。"""
    def __init__(self, pair, target_index):
        self.pair = pair.reset_index(drop=True)
        self.target_index = target_index                      # target_id → 列号
        self.fps = np.stack([morgan_fp(s) for s in self.pair["smiles"]])
        self.toh = np.zeros((len(self.pair), len(target_index)), dtype=np.float32)
        for i, t in enumerate(self.pair["target_id"]):
            self.toh[i, target_index[t]] = 1.0
        self.y = self.pair["pX"].to_numpy(dtype=np.float32)

    def __len__(self):
        return len(self.pair)

    def __getitem__(self, i):
        x = np.concatenate([self.fps[i], self.toh[i]])
        return torch.from_numpy(x), torch.tensor(self.y[i])

def group_split(pair, seed=42):
    rng = np.random.RandomState(seed)
    ligands = pair["ligand_id"].unique()
    rng.shuffle(ligands)
    n = len(ligands)
    tr, va = set(ligands[:int(0.8 * n)]), set(ligands[int(0.8 * n):int(0.9 * n)])
    return (pair["ligand_id"].isin(tr).to_numpy(),
            pair["ligand_id"].isin(va).to_numpy(),
            ~pair["ligand_id"].isin(tr | va).to_numpy())

pair = build_pair_table()
target_index = {t: i for i, t in enumerate(sorted(pair["target_id"].unique()))}
tr, va, te = group_split(pair)
ds_tr = GtoPdbAffinity(pair[tr], target_index)
dl_tr = DataLoader(ds_tr, batch_size=256, shuffle=True, num_workers=2)
dl_va = DataLoader(GtoPdbAffinity(pair[va], target_index), batch_size=512)
dl_te = DataLoader(GtoPdbAffinity(pair[te], target_index), batch_size=512)
print(f"train {len(ds_tr)} | val {va.sum()} | test {te.sum()}")

§6.5 八大坑点

⚠️ 坑点 1:Ki/IC50/EC50/Kd 混在一个标签列里直接回归(分类:标签理解)

问题:interactions.csv 的 affinity_units 含多种参数类型:Ki/Kd 是平衡结合常数,IC50/EC50 是依赖测定条件的功能终点,四者数值不可互换。直接把 22,064 条定量记录当一个回归任务训练,模型学到的是"参数类型 → 数值分布"的混杂而非结构-活性关系。
症状:加入"参数类型"特征后指标暴涨;去掉该特征模型失效;不同论文在同一数据集上 RMSE 相差悬殊。
解决:

  1. 简单方法:单参数建模——只留 Ki(或 IC50)记录训练,最干净。
  2. 进阶方法:全部换算 pX 后把参数类型作为显式协变量或分任务头:pX = -log10(值 × 单位因子)。
  3. SOTA 方法:删失感知 + 条件分层建模,用 assay_description 的文本嵌入校正测定条件效应;如需跨类型桥接,明确声明遵循 Cheng-Prusoff 假设(可逆竞争性单位点结合)再转换。
    参考:IntuitionLabs 单位可比性技术参考;NAR 2024 论文(约 70% 定量点为 pIC50/pKi)。

⚠️ 坑点 2:把">"删失值当普通数值训练(分类:预处理陷阱)

问题:文献常报告">10,000 nM"这类右删失结果;策展团队忠实转录,数据中以上界字段/标记体现。把它们当真实值参与回归,会给弱结合对注入系统性负偏。
症状:弱效力区间(pX < 5)预测值整体偏紧;对"选择性"任务模型几乎失去分辨力。
解决:

  1. 简单方法:删去带删失标记的行(§6.3/§6.4 代码已内置)。
  2. 进阶方法:删失感知损失(如对删失样本只惩罚 pX_pred < 上界的单侧项)。
  3. SOTA 方法:把删失建模为生存分析/序回归问题,保留信息量。
    参考:IntuitionLabs:right-censored bioactivity labels。

⚠️ 坑点 3:同一配体/同一对跨训练测试集泄漏(分类:数据泄漏)

问题:一个配体平均作用于多个靶点(10,835 个配体带相互作用),且唯一对 19,613 个却对应 21,643 个定量点(2025.2)——随机按行切分会让同配体、甚至同一靶点-配体对的重复测定分跨两侧。
症状:随机划分 AUC/RMSE 漂亮,换成骨架或分组划分后性能崩塌;审稿人复现不出结果。
解决:

  1. 简单方法:按 ligand_id GroupKFold。
  2. 进阶方法:Bemis-Murcko 骨架划分 + 同对预聚合(§6.3 步骤 4)。
  3. SOTA 方法:双维度分组(配体与靶点均不跨集)评估冷启动;另跑时间切分(按 release 版本)模拟真实发现顺序。
    参考:Network-Based Methods for DTI Prediction(Frontiers in Pharmacology, 2018)。

⚠️ 坑点 4:把脱靶结合当作药物作用机制(分类:标签理解)

问题:批准药物的相互作用含主靶点(MMoA)与次级/脱靶结合。757 个人类靶点有批准药物相互作用,但仅 355 个是主靶点(2025.2)。做重定位或机制解释时混用两类标签,会把副作用靶点说成"新适应证机制"。
症状:重定位结果大量命中已知副作用靶点;机制解释与药品说明书不符。
解决:

  1. 简单方法:用 approved_drugs_with_primary_targets.csv(官方主靶点文件)过滤。
  2. 进阶方法:interaction 中 primary_target 类字段作为分层标签,主靶点正样本 + 脱靶负/弱样本分开评估。
  3. SOTA 方法:结合临床用途摘要与 ATC 分类做多任务约束。
    参考:NAR 2026 论文 Data Access 与 approved drugs 展示改进章节。

⚠️ 坑点 5:人/小鼠/大鼠数据混合训练(分类:偏倚陷阱)

问题:GtoPdb 覆盖人、小鼠、大鼠三物种,相互作用含直系同源扩展。同源蛋白上配体效力通常相近但不相等,物种混入会让"靶点 one-hot"学到物种偏倚。
症状:按物种分层评估指标差异明显;人类靶点子集表现被非人类数据稀释或抬高。
解决:

  1. 简单方法:按 target_organism 过滤只留人类(§6.3 步骤 5)。
  2. 进阶方法:保留物种作为协变量,用直系同源组(HGNC 映射)对齐建模。
  3. SOTA 方法:物种感知的蛋白表征(序列模型)替代 one-hot。
    参考:HandWiki 条目(Organisms: Human, Mouse, Rat);NAR 2026 论文。

⚠️ 坑点 6:把"相互作用表里没有"当成"没有数据"(分类:工程陷阱)

问题:官方策展标准要求定量数据才入相互作用表;抗体、核酸药物、蛋白降解剂、部分抗菌药等新模态常只有定性信息,记录在评论(comments)字段与网页详情页,而不在 interactions.csv。
症状:统计"某靶点无配体"或"抗体无活性数据",与官网页面矛盾;数据质量报告被同行质疑。
解决:

  1. 简单方法:对缺失对象先查网页/REST 详情再下结论。
  2. 进阶方法:把"非定量但存在相互作用"的记录作为分类任务的弱正样本单独建模。
  3. SOTA 方法:爬取/缓存配体详情页评论文本,构建补充知识字段。
    参考:NAR 2026 论文 Curation criteria 节(明确说明新模态数据"captured in comments rather than in our interaction tables")。

⚠️ 坑点 7:忽略配体类型带来的效力先验(分类:偏倚陷阱)

问题:中位 pIC50 按配体类型系统分化:抗体 9.15、肽类 8.11、合成有机物 7.48、批准药物 7.23、代谢物 6.30、天然产物 6.20(NAR 2024)。合成有机物占 9,329/13,260(2025.2),模型可仅凭配体类型预测大致效力区间。
症状:消融掉结构特征后指标仍不差——模型在背"类型先验"而非学 SAR。
解决:

  1. 简单方法:按配体类型分层评估并分别报告指标。
  2. 进阶方法:类型分层采样保证训练/测试类型分布一致。
  3. SOTA 方法:类型去偏损失或在评估协议中固定类型构成。
    参考:NAR 2024 论文 Interaction data 节(中位 pIC50 表)。

⚠️ 坑点 8:版本漂移与 ID 映射口径(含许可证传染)(分类:工程陷阱)

问题:GtoPdb 每年 3-4 次发布,条目会增删修订(官方明示个别修订可能造成旧版本死链);UniProt 交叉引用仅收 pAffinity ≥6 的靶点(人类 1,664 个),PubChem 同步有约 2 周延迟;同时库按 ODbL、内容按 CC BY-SA 4.0 发布——衍生数据库必须署名且相同方式共享,2025 年起官方还要求商业机构财务支持。忽视任何一条都会造成复现失败或合规风险。
症状:两个月后重跑脚本行数对不上;跨库对齐时"消失"了一批弱结合靶点;公司产品用了衍生数据被要求署名/共享。
解决:

  1. 简单方法:固定 release 版本号 + 记录下载日期,落盘原始文件与校验和。
  2. 进阶方法:以 UniProt 为主键构建映射层,用 ligand_id_mapping.csv 做跨库对齐,弱结合差异单独记录。
  3. SOTA 方法:数据流水线加 DVC/版本化存储;合规侧做 ODbL/CC BY-SA 传染性审查,商业场景与官方联系可持续性支持。
    参考:官方 linking.jsp;NAR 2026 论文 Data Access;2025.3 发布说明(商业支持计划)。

§6.6 数据增强(安全 vs 危险)

操作 判定 说明
SMILES 随机枚举(等价 SMILES 重写) ✅ 安全 不改变分子,等价于输入扰动
手性中心随机翻转 ❌ 危险 对映体效力可差数量级,直接摧毁标签
盐型/电荷规范化(InChI 归一) ✅ 安全 与官方 name-to-structure 策展一致
靶点序列随机掩码 ⚠️ 谨慎 若用序列模型可作正则,但会破坏家族语义
把同类文献重复测定当新样本复制 ❌ 危险 放大同对泄漏(坑点 3)
删失值镜像(把">“翻转成”<") ❌ 危险 无中生有,违反转录语义

§6.7 模型推荐表

任务 推荐模型 起步理由
亲和力回归(指纹+靶点) LightGBM / MLP 表格特征下强基线,可解释性好
DTI 二分类 双塔(SMILES 编码器 + 蛋白序列编码器) 支持冷启动泛化,适配分组划分
图级 SOTA GNN(消息传递)+ 预训练蛋白语言模型嵌入 结构-活性 + 序列语义融合
重定位 异构网络(药物-靶点-疾病图)传播 deepDTnet 范式,外部验证链成熟
蛋白侧表征 ESM 系列嵌入 免训练序列特征,快速上手

§6.8 硬件需求表

阶段 最低配置 建议配置
下载/解压/CSV 预处理 4 vCPU / 8 GB 内存 / 10 GB 磁盘 8 vCPU / 16 GB 内存 / 50 GB 磁盘
PostgreSQL 导入与查询 4 vCPU / 8 GB / SSD 20 GB 8 vCPU / 32 GB / SSD 100 GB
指纹特征构建(约 2 万对) CPU 即可,分钟级 多进程(num_workers=8)
MLP/GNN 训练 单卡 8 GB(如 RTX 3060) 单卡 24 GB(如 RTX 4090)
SPARQL 端点(RDF) 8 GB 内存三元组库 32 GB 内存 Fuseki/GraphDB

§6.9 评估指标代码

import numpy as np

def rmse(y_true, y_pred):
    return float(np.sqrt(np.mean((np.asarray(y_true) - np.asarray(y_pred)) ** 2)))

def mae(y_true, y_pred):
    return float(np.mean(np.abs(np.asarray(y_true) - np.asarray(y_pred))))

def pearson_r(y_true, y_pred):
    return float(np.corrcoef(np.asarray(y_true), np.asarray(y_pred))[0, 1])

def auroc_auprc(y_true, score):
    # 不依赖 sklearn 的 AUROC/AUPRC 秩实现;y_true ∈ {0,1}
    y = np.asarray(y_true); s = np.asarray(score)
    order = np.argsort(-s); y = y[order]
    pos, neg = y.sum(), (1 - y).sum()
    ranks = np.arange(1, len(y) + 1)
    auroc = (ranks[y == 1].sum() - pos * (pos + 1) / 2) / (pos * neg)
    tp = np.cumsum(y); fp = np.cumsum(1 - y)
    recall = tp / max(pos, 1); precision = tp / np.maximum(tp + fp, 1)
    auprc = -np.sum(np.diff(np.concatenate([[0], recall])) *
                    np.maximum.accumulate(np.concatenate([[1], precision]))[:-1])
    return float(auroc), float(auprc)

指标选择:回归报告 RMSE/MAE/Pearson r(pX 量纲);DTI 二分类在正负样本极不平衡下以 AUPRC 为主、AUROC 为辅;分组划分与时间划分各报一组(§5.3/§5.4)。

§6.10 MLOps 笔记

  • 版本钉死:数据路径、配置、README 均写明 release 版本号(如 2025.4)与下载日期;官方引用规范即要求注明版本。
  • 撤稿再校验:官方会为被撤稿文献加警告标签;长生命周期模型建议每次大版本发布后重下载数据并重训/复评。
  • 同步延迟意识:PubChem 镜像滞后约 2 周,跨源流水线不要混用当周数据。
  • 合规即代码:把 ODbL/CC BY-SA 4.0 的署名与相同方式共享要求写入数据卡片与制品发布流程;商业部署前评估官方可持续性支持要求。
  • 监控漂移:跟踪新 release 的 diff(新增配体/相互作用数),突变超过历史节奏(如 2025.4 单次 +91 配体)时触发数据更新评审。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
文献/研究热度偏倚 策展聚焦有定量证据与 MMoA 证据的靶点,3,118 个靶点中仅 1,797 个有定量数据 高 任务限定在"有定量覆盖"子集;把无覆盖靶点显式标记为不可学习
配体类型效力先验 抗体/肽/合成小分子中位 pIC50 系统性不同(9.15/8.11/7.48) 中 分层评估与去偏采样(坑点 7)
监管属地偏倚 批准药物策展以 FDA 等可跟踪机构为主 中 跨区域任务补充本地监管数据源
物种覆盖不均衡 人 >> 小鼠/大鼠;同源扩展引入跨物种标签 中 物种过滤或协变量建模(坑点 5)
新模态覆盖缺口 抗体/核酸/降解剂常无数值,藏在评论字段 中 坑点 6 的补充采集策略
撤稿残留风险 尽管定期核对撤稿标签,仍可能存在未识别的问题文献 低 引用时保留 original_article_id 便于复核
覆盖滚动扩张 相邻发布间新增配体/相互作用改变分布(2025.4 单次 +91 配体) 低 固定快照 + 发布间 diff 监控

§7.2 标注质量

GtoPdb 的"标注"即策展:三条硬门槛(结构确认、MMoA 证据、定量来源)+ 亚委员会审定 + 撤稿交叉核对构成多层质控;这是它区别于文本挖掘库的核心资产。局限是:单条数值忠实转录而非复测,测定条件(温度、缓冲体系、放射配体浓度)跨文献不统一,且数据库不发布标注者一致性统计。使用姿势:把数据库当作"可审计的文献视图"而非"物理真值",对关键结论抽查原始文献(original_article_id 全程可溯源)。

标注质量的三层保障与三层局限:

  • 保障一:策展准入三门槛(§3.5),拦截无证据记录
  • 保障二:亚委员会共识审定,家族层面背书
  • 保障三:撤稿交叉核对,事后纠错机制
  • 局限一:数值为转录值,不保证测定可复现
  • 局限二:assay 条件异质,跨文献可比性有限
  • 局限三:无标注者间一致性统计发布

§7.3 泛化性评估

场景 失效风险 证据/机制
训练集外新靶点(冷启动) 高 58% 靶点无定量数据;one-hot 靶点特征对新靶点无信息
新化学骨架 高 配体级泄漏是最常见高估来源(坑点 3)
新药物模态(降解剂/核酸) 高 经典定量范式不适配,数据藏于评论(坑点 6)
跨物种迁移 中 同源效力近似但非等同(坑点 5)
跨监管区域适应证 中 批准药物策展属地偏倚(§7.1)
时间外推(预测未来发现) 中 版本滚动更新带来分布漂移(§7.6)
跨库迁移(以本库校准他库) 中 单位与 ID 口径差异;NAR 2026 官方覆盖度对比可作先验

§7.4 伦理考量

GtoPdb 不含患者或个人数据,无隐私风险;DUO 标签不适用。伦理注意点有三:① 药理学预测模型可能被用于指导临床决策——输出须标注"研究用途",临床落地需独立验证与监管审批;② 衍生数据集必须遵守 ODbL/CC BY-SA 4.0 的署名与相同方式共享义务,尊重官方对商业使用的财务支持请求;③ 引用撤稿敏感:构建知识产品时应保留文献级溯源,及时响应官方撤稿标签更新。

§7.5 公平性

本数据集不涉及人口统计学属性,传统公平性审计(性别/种族亚组)不适用。相关的"公平性"问题是研究投入公平:全球疾病负担高的热带病靶点覆盖相对有限(疟疾已由 GtoMPdb 专项补齐,其他被忽视热带病覆盖依赖通用策展节奏);用 GtoPdb 训练的模型会继承"研究热度 = 数据密度"的全球科研不平等,部署于低资源地区适应证时应声明该局限。

§7.6 数据漂移

漂移来源有二:① 内容漂移——每年 3-4 次发布持续新增配体与相互作用(2025.4 单次 +91 配体/+106 相互作用),且 WHO EML 等标签会随清单刷新(2025 年同步新增 89 配体、移除 7 配体);② 真值修订——撤稿标签、条目修订会造成历史记录变动(官方明示个别修订可致旧链失效)。缓解:固定快照做研究、生产系统设置 release 差异监控(§6.10)。

发布间监控指标建议:

监控项 基线(2025.3→2025.4) 触发阈值建议
新增配体数 91 单次 >200 或 <10 时人工复核
新增相互作用数 106 同上
靶点数变化 +6 任何变化(靶点级增删罕见)
批准药物数变化 +17 与官方博客批准药物节核对
参考文献数变化 +360 与撤稿公告交叉核对

§7.7 DAIMS 24 项检查表

# 检查项 状态 说明
1 宽格式 ❌ 关系型长表设计(一交互一行),非宽格式;需自行透视
2 唯一标识 ✅ ligand_id/target_id 稳定主键 + UniProt/PubChem 交叉 ID
3 特殊字符 ✅ SMILES/InChI 等编码字段格式规范;UTF-8 支持(历史 dump 曾要求 utf8mb4)
4 重复行 ⚠️ 同一靶点-配体对允许多条测定记录(19,613 对 vs 21,643 定量点),需聚合策略
5 缺失编码 ✅ 非定量记录的定量字段留空,语义清晰
6 标签标识 ✅ interaction_type 与 primary_target 受控语义;配体批准状态标签齐全
7 罕见类分组 ⚠️ 低频相互作用类型与冷门家族样本稀少,需显式分组策略
8 偏倚评估 ⚠️ 官方论文自述覆盖偏倚(策展标准所致),但无定量偏倚审计报告
9 数据字典 ✅ 官网帮助页 + NAR 论文详述各字段语义
10 信息性缺失解释 ⚠️ "无定量数据"可由策展标准解释(坑点 6),但字段层面无显式原因编码
11 设备记录 ❌ 不适用——文献转录数据无设备元数据;仅 assay_description 提供条件文本
12 共线性 ⚠️ 家族层级与类型标签高度相关,建模需防特征共线
13 编码映射 ✅ ligand_id_mapping.csv + UniProt/HGNC/Ensembl/PubChem 全套交叉 ID
14 时间戳处理 ⚠️ 版本号即快照时间(年.序),但记录级无策展时间戳
15 划分建议 ⚠️ 无官方划分;社区惯例存在但需自行实现(§5)
16 泄漏讨论 ⚠️ 同对多记录与配体多靶点结构使泄漏风险真实存在,须主动控制(坑点 3)
17 标签分布 ✅ 靶点类别/配体类别/相互作用覆盖在 NAR 论文有完整计数表
18 测量偏倚 ⚠️ 测定条件跨文献异质且未被标准化,assay_description 可部分缓解
19 外部验证建议 ⚠️ 官方不指定外部集;社区通行用 DrugCentral/BindingDB(§7.8)
20 版本记录 ✅ 每年 3-4 次发布、发布博客详列变更、引用须注明版本号
21 预处理脚本 ❌ 无官方脚本;本 Wiki §6.3/§6.4 提供可运行替代实现
22 合规要求 ✅ 许可清晰(ODbL + CC BY-SA 4.0),商用支持政策公开
23 多模态对齐 ⚠️ 结构(SDF/SMILES)、活性(interactions)、文本(评论)可经 ID 对齐,但文本部分需额外采集
24 去标识化 ✅ 不含人类受试者数据,无去标识化需求

DAIMS 评分:13.5 / 24

评分解读:8 项 ✅(标识、编码映射、版本记录、合规等"库管理"维度接近满分)反映其作为二十余年历史的专业知识库的管理成熟度;11 项 ⚠️ 集中在"ML 适配"维度(划分、泄漏、测量偏倚、漂移)——这些不是数据缺陷,而是知识库原生设计不以基准任务为目标所致;3 项 ❌(宽格式、设备记录、预处理脚本)对其数据形态而言属于固有且大多可解释的不适用/缺失。总体判断:这是一份"标签质量极高、ML 配件缺失"的资源。

对你意味着什么:① 直接可享受的红利——用稳定 ID 与交叉映射搭建跨库流水线,不必担心主键漂移;② 必须自建的三件套——按 §5.2 实现分组/骨架/时间三种划分,按 §6.3 完成单位归一化与删失处理,按 §6.4 建立 DataLoader 并固定 release;③ 评估协议要"双报告"——随机划分结果与分组划分结果同列,给读者泄漏幅度的直观证据;④ 若产品化,先做 ODbL/CC BY-SA 合规审查(坑点 8),再把撤稿再校验排进 MLOps 日历。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
DrugCentral 非重叠 DTI 对 DrugCentral(美国新墨西哥大学等) 药物-靶点识别外部验证 网络模型排序命中率(top-k 验证) 相对内部网络集下降但仍显著优于随机 deepDTnet 以 GtoPdb/ChEMBL/BindingDB 等构建 5,680 条 DTI 网络(732 FDA 药物 × 1,178 人类靶点),DrugCentral 作为时间上更晚的外部验证源,验证了跨库策展数据组合的泛化性

§8 基准性能与生态

§8.1 排行榜(使用 GtoPdb 的代表性研究)

GtoPdb 无官方排行榜(它不是基准数据集)。下表收录以 GtoPdb 为数据源的代表性 DTI 研究;各行的数据版本、阈值与划分协议不同,数值不可直接比较:

排名 模型/研究 数据规模与协议 年份 关键技术 完整引用 代码
1 deepDTnet GtoPdb+ChEMBL+BindingDB+DrugBank/TTD/PharmGKB 合并,Ki/Kd/IC50/EC50 ≤10 μM、UniProt reviewed 过滤,得 5,680 条 DTI(732 FDA 药物 × 1,178 靶点);外部验证用 DrugCentral 2020 异构网络深度学习(图神经网络 + 网络传播) Cheng F, et al., 2020, Chemical Science. DOI 10.1039/C9SC04336E github.com/ChengF-Lab/deepDTnet
2 网络法 DTI 预测综述协议 系统比较 BindingDB/ChEMBL/GtoPdb/PDSP Ki 等定量源的合并与 10 μM 阈值约定 2018 相似性网络/推荐算法/链接预测 Frontiers in Pharmacology, 2018, DOI 10.3389/fphar.2018.01134 —

§8.2 SOTA 总结与选型建议

GtoPdb 在 DTI 生态中的定位是"高置信数据源"而非"刷榜赛道"。选型建议:

  • 方法学论文:用 GtoPdb 构建高置信子集 + 分组/时间划分,先在小而干净的标签上立住结论,再在 ChEMBL 大数据上验证规模化。
  • 产品原型:优先使用主靶点文件(approved_drugs_with_primary_targets)保证机制正确性,活性面板作次级过滤。
  • 规模实验:GtoPdb 作校准/验证集,ChEMBL/BindingDB 作训练池;NAR 2026 论文提供了三库覆盖度对比的官方视角,可作为融合设计依据。
  • 冷启动研究:把 1,321 个无定量数据的人类靶点(3,118-1,797)视为迁移学习/零样本任务的动机声明。

§8.3 评测协议

社区通行协议(以 deepDTnet 为代表):

  1. 合并多库后统一以 UniProt accession 唯一标识人类靶点(target 须 UniProt reviewed)
  2. 以 Ki/Kd/IC50/EC50 ≤10 μM 定义结合正样本
  3. 化学结构以官方 SMILES/DrugBank 结构为准
  4. 外部验证取 DrugCentral 等时间上更晚、非重叠的文献验证对
  5. 记录数据下载日期(如 2017-07)——不同下载时点的库内容不同,不记录则不可复现
数据集 机构 与 GtoPdb 的关系
ChEMBL EMBL-EBI 最大活性数据库;NAR 2026 论文含官方覆盖度对比;融合时作训练池
BindingDB UCSD/NCBI 协作 结合数据专精库;官方对比对象之一
DrugBank Alberta 大学 药物临床信息全面;相互作用多定性,合并需阈值约定
DrugCentral UNM FDA 标签联动;常用外部验证集
PubChem BioAssay NCBI GtoPdb 内容约 2 周内同步(CID/SID 交叉引用)
PDSP Ki Database UNC 受体结合常数专业库
PDBbind 外交学院等 结构复合物亲和力,补结构视角
UniProtKB EBI/SIB/PIR 靶点蛋白权威注释;GtoPdb 靶点主键锚点
GtoImmuPdb IUPHAR 免疫药理学姊妹库,共享 schema 与部分数据
GtoMPdb IUPHAR/MMV 疟疾药理学姊妹库,与 MMV 药物管线联动

§8.5 关键论文 Top 6

  1. Harding SD, Armstrong JF, Faccenda E, Southan C, Alexander SPH, Davenport AP, Spedding M, Davies JA. The IUPHAR/BPS Guide to PHARMACOLOGY in 2026. Nucleic Acids Research, 2026, 54(D1): D1446-D1456. DOI 10.1093/nar/gkaf1067 —— 最新官方引用论文(取代此前所有论文),含 2025.2 口径统计与 ChEMBL/BindingDB 对比。
  2. Harding SD, Armstrong JF, Faccenda E, et al. The IUPHAR/BPS Guide to PHARMACOLOGY in 2024. Nucleic Acids Research, 2024, 52(D1): D1438-D1449. DOI 10.1093/nar/gkad944 —— 定量相互作用数据分布(中位 pIC50 按配体类型)与抗菌药扩展。
  3. Harding SD, Armstrong JF, Faccenda E, et al. The IUPHAR/BPS guide to PHARMACOLOGY in 2022. Nucleic Acids Research, 2022, 50(D1): D1282-D1294. DOI 10.1093/nar/gkab1010 —— COVID-19/疟疾/抗菌药策展与 NC-IUPHAR 网络规模(109 亚委员会、1,000+ 科学家)。
  4. Harding SD, et al. The IUPHAR/BPS Guide to PHARMACOLOGY in 2016. Nucleic Acids Research, 2016(PMC4702778)—— 定量相互作用策展框架与 druggable genome 收录目标、REST/SQL 发布形态奠基。
  5. The IUPHAR Guide to Immunopharmacology. 2019/2020(PMC7160657)—— GtoImmuPdb 姊妹库与用户规模(月 22,000+ 用户)官方统计。
  6. The IUPHAR/BPS Guide to PHARMACOLOGY in 2019. Nucleic Acids Research, 48(D1): D1006 起(OUP 5613677)—— RDF/SPARQL 与 BioSchemas 语义发布路线。

§8.6 社区活跃度

官方统计月访问 22,000+ 用户、118,000+ 页面浏览(2019 年口径);每年 3-4 次发布且每版均有官方博客说明;NC-IUPHAR 109 个亚委员会持续运作(约 325 名活跃贡献者);内容被 PubChem/UniProt 等一级资源交叉引用,并被 ChEMBL、BindingDB 对比研究及药企知识库(如 AstraZeneca Chemistry Connect)集成。2025 年启动商业可持续性计划,反映其长期维护承诺与资金压力并存——长期依赖者应关注官方可持续性公告。

参与与跟踪方式:

  • 用户纠错:官方鼓励用户对内容提修改建议,经核查后常转化为条目更新
  • 发布跟踪:订阅官方博客(blog.guidetopharmacology.org)获取每版变更
  • 商业支持:商业机构可经 gtopdbSustainability.jsp 参与可持续性计划
  • 学术协作: AntibioticDB/GARDP、MMV 等专题协作有专门策展通道

§8.7 生态快照表

资源 类型 链接 推荐理由
GtoPdb 下载页 数据 https://www.guidetopharmacology.org/download.jsp 全部官方文件入口
REST web services API https://www.guidetopharmacology.org/webServices.jsp JSON 计算访问
SPARQL 端点 语义服务 rdf.guidetopharmacology.org/sparql 联邦查询
发布博客 公告 https://blog.guidetopharmacology.org/ 版本变更权威说明
GtoImmuPdb 姊妹库 https://www.guidetoimmunopharmacology.org 免疫药理学专题
GtoMPdb 姊妹库 https://www.guidetomalariapharmacology.org 疟疾药理学专题
SynPharm 工具 synpharm.guidetopharmacology.org 药物响应蛋白序列域检索
RDKit 软件库 rdkit.org SMILES/SDF 特征化的标准工具

§9 相关资源与引用

§9.1 官方资源导航

§9.2 BibTeX 引用

@article{harding2026gtopdb,
  title   = {The IUPHAR/BPS Guide to PHARMACOLOGY in 2026},
  author  = {Harding, Simon D. and Armstrong, Jane F. and Faccenda, Elena and
             Southan, Christopher and Alexander, Stephen P. H. and
             Davenport, Anthony P. and Spedding, Michael and Davies, Jamie A.},
  journal = {Nucleic Acids Research},
  volume  = {54},
  number  = {D1},
  pages   = {D1446--D1456},
  year    = {2026},
  doi     = {10.1093/nar/gkaf1067}
}

@article{harding2024gtopdb,
  title   = {The IUPHAR/BPS Guide to PHARMACOLOGY in 2024},
  author  = {Harding, Simon D. and Armstrong, Jane F. and Faccenda, Elena and
             Southan, Christopher and Alexander, Stephen P. H. and
             Davenport, Anthony P. and Spedding, Michael and Davies, Jamie A.},
  journal = {Nucleic Acids Research},
  volume  = {52},
  number  = {D1},
  pages   = {D1438--D1449},
  year    = {2024},
  doi     = {10.1093/nar/gkad944}
}

@article{harding2022gtopdb,
  title   = {The IUPHAR/BPS guide to PHARMACOLOGY in 2022: curating pharmacology
             for COVID-19, malaria and antibacterials},
  author  = {Harding, Simon D. and Armstrong, Jane F. and Faccenda, Elena and
             Southan, Christopher and Alexander, Stephen P. H. and
             Davenport, Anthony P. and Pawson, Adam J. and Spedding, Michael and
             Davies, Jamie A. and {NC-IUPHAR}},
  journal = {Nucleic Acids Research},
  volume  = {50},
  number  = {D1},
  pages   = {D1282--D1294},
  year    = {2022},
  doi     = {10.1093/nar/gkab1010}
}

§9.3 引用指南

官方要求:首次提及使用全称 IUPHAR/BPS Guide to PHARMACOLOGY(注意大小写与 PHARMACOLOGY 全大写),此后可缩写 GtoPdb。

  • 论文引用:引用 2026 NAR 论文(gkaf1067)而非旧论文——官方明示该论文取代此前所有引用
  • 版本标注:使用数据时必须注明 release 版本号(如 release 2025.4,见 About 页)
  • 页面引用:具体靶点/配体页面的引用建议见官网对应页面
  • 许可义务:衍生数据制品请同时遵守 ODbL(库)与 CC BY-SA 4.0(内容)的署名与相同方式共享条款
  • 商业使用:评估官方可持续性支持政策并在必要时联系官方

§10 AI 使用声明卡

§10.1 本页面使用的 AI 模型

  • 大型语言模型(文本起草与结构化):用于章节起草、表格整理与代码注释撰写;所有事实性断言经检索来源交叉核对(见 §10.3)。
  • Web 检索工具:用于获取官方论文、发布博客与社区资料的原文摘录。

§10.2 AI 参与范围

AI 参与:初稿撰写、结构组织、代码示例编写、表格汇总、语言润色。AI 不参与:事实来源的最终取舍(均须有 §10.3 所列来源支撑)、医学与合规判断、发布决定。所有数字均可回溯至 §10.3 输入来源或页面内链接;查证不到的内容已按规范省略而非填充。

§10.3 输入来源列表

  1. Harding SD, Armstrong JF, Faccenda E, Southan C, Alexander SPH, Davenport AP, Spedding M, Davies JA. The IUPHAR/BPS Guide to PHARMACOLOGY in 2026. Nucleic Acids Research, 2026, 54(D1): D1446-D1456. DOI 10.1093/nar/gkaf1067.
  2. 同上论文全文(PubMed Central):PMC12807616,含 release 2025.2 统计表与策展标准章节。
  3. Harding SD, et al. The IUPHAR/BPS Guide to PHARMACOLOGY in 2024. Nucleic Acids Research, 2024, 52(D1): D1438-D1449. DOI 10.1093/nar/gkad944.
  4. 同上论文全文(PubMed Central):PMC10767925,含定量相互作用分布与中位 pIC50 统计。
  5. Harding SD, et al. The IUPHAR/BPS guide to PHARMACOLOGY in 2022. Nucleic Acids Research, 2022, 50(D1): D1282-D1294. DOI 10.1093/nar/gkab1010.
  6. Database Release 2025.4(官方博客,2025-12-10):https://blog.guidetopharmacology.org/2025/12/10/database-release-2025-4/
  7. Database Release 2025.3(官方博客,2025-09-10):https://blog.guidetopharmacology.org/2025/09/10/database-release-2025-3/
  8. The IUPHAR Guide to Immunopharmacology(PMC7160657):用户规模与 GtoImmuPdb 策展说明。
  9. The IUPHAR/BPS Guide to PHARMACOLOGY in 2016(PMC4702778):下载形态、PubChem 同步与 REST 服务沿革。
  10. The IUPHAR/BPS Guide to PHARMACOLOGY in 2018(PMID 29149325):RDF/SPARQL 与 SynPharm 沿革。
  11. The IUPHAR/BPS Guide to PHARMACOLOGY in 2019(OUP,48(D1): D1006):许可与语义标记沿革。
  12. HandWiki 条目 Biology:Guide to Pharmacology:机构沿革、物种覆盖与 SPARQL 端点信息。
  13. Cheng F, et al. Target identification among known drugs by deep learning from heterogeneous networks. Chemical Science, 2020. DOI 10.1039/C9SC04336E:DTI 研究中 GtoPdb 的使用协议(10 μM 阈值等)。
  14. Network-Based Methods for Prediction of Drug-Target Interactions. Frontiers in Pharmacology, 2018. DOI 10.3389/fphar.2018.01134:定量源合并与阈值问题。
  15. IC50, EC50, Ki, and Kd Units for Machine Learning Datasets. IntuitionLabs, 2026:单位可比性、删失值与 pX 归一化技术参考。
  16. Benchmarking Drug-Target Interaction Prediction(Chemical Genomics Hub 技术指南):DTI 基准的稀疏性/不平衡/冷启动问题。
  17. 官方下载页、About 页、webServices 页、linking.jsp 与可持续性页面(guidetopharmacology.org,访问于 2026-09)。

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
§0 免责声明与利益冲突 千方病案医学编辑部 逐字核对固定文本 ✅ 已通过
§1 概览与版本时间轴 千方病案医学编辑部 对照官方博客与 NAR 论文逐条核对 ✅ 已通过
§2 医学背景与 ICD-11/SNOMED 映射 千方病案医学编辑部 对照 ICD-11/SNOMED CT 官方编码复核 ✅ 已通过
§3 数据集规格(规模数字) 千方病案医学编辑部 对照 release 2025.4/2025.2 官方口径 ✅ 已通过
§4 数据结构与 DAIMS 字段字典 医疗 AI 数据工程师 对照官方下载文件结构核对 ✅ 已通过
§5 划分建议与泄漏分析 医疗 AI 数据工程师 对照社区协议与坑点交叉验证 ✅ 已通过
§6 代码与八大坑点 医疗 AI 数据工程师 代码走查 + 坑点溯源核对 ✅ 已通过
§7 质量评估与 DAIMS 24 项 医疗 AI 数据工程师 逐项状态复核 ✅ 已通过
§8 基准与生态 千方病案医学编辑部 引用完整性核对 ✅ 已通过
§9-§10 引用与声明卡 千方病案医学编辑部 BibTeX 格式与来源清单核对 ✅ 已通过

§10.5 AI 生成章节标注

以下内容以 AI 起草为主、人工复核后发布:

  • §1.1 技术摘要与数据快照关键数字
  • §3 数据集规格各节
  • §4.1-4.1c 字段字典
  • §5 划分建议与协议矩阵
  • §6 全部代码与八大坑点解析
  • §7.7 DAIMS 逐项评注
  • §8.2/§8.3 总结性文字

其余章节为人工起草或人工改写定稿。所有章节的最终事实准确性由 §10.4 所列审核者负责。

§10.6 最后人工审核日期

2026-09-05(与 §0 审核日期一致)

页面状态:published(全部内容已完成审核并发布)


附:结构化数据(JSON-LD)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • chebi — 共享标签:药物发现与化学 / 医疗NLP / 化学信息学 / 知识图谱
  • dgidb — 共享标签:药物发现与化学 / 医疗NLP / 化学信息学 / 知识图谱
  • davis — 共享标签:药物发现与化学 / 化学信息学 / 药物-靶点相互作用
  • drugbank — 共享标签:药物发现与化学 / 化学信息学 / 药物-靶点相互作用
  • ttd — 共享标签:药物发现与化学 / 化学信息学 / 知识图谱
  • reactome — 共享标签:医疗NLP / 化学信息学 / 知识图谱
  • chemdner — 共享标签:药物发现与化学 / 医疗NLP / 化学信息学
  • sider — 共享标签:药物发现与化学 / 医疗NLP / 知识图谱
  • mdad — 共享标签:药物发现与化学 / 化学信息学 / 知识图谱
  • rxnorm — 共享标签:药物发现与化学 / 医疗NLP

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集