信息速览

PDBbind — 蛋白质-配体结合亲和力数据库 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | PDBbind |
| 英文全称 | The PDBbind Database |
| 别名/简称 | PDBbind、PDBbind-CN、PDBbind+、PDBbind v2020 |
| 疾病分类 | 非疾病专病库——覆盖全治疗领域药物靶点。ICD-11 示例映射:2A00–2F9Z 恶性肿瘤(激酶等靶点)/ 1C62 HIV 病(HIV 蛋白酶)/ RA01 COVID-19(SARS-CoV-2 Mpro)/ 5A11 2 型糖尿病(详见 §2.1) |
| SNOMED CT | 363346000 Malignant neoplastic disease / 86406008 HIV infection / 840539006 COVID-19 / 73211009 Diabetes mellitus(详见 §2.2) |
| 数据模态 | 3D 结构(蛋白/口袋/配体原子坐标)+ 结构化数值(实验结合亲和力 Kd/Ki/IC50) |
| AI 任务类型 | 回归预测(亲和力)、排序(ranking)、对接 pose 识别、虚拟筛选、结构基分子生成 |
| 样本总数 | 23,496 个复合物(v2020:蛋白-配体 19,443 / 蛋白-蛋白 2,852 / 蛋白-核酸 1,052 / 核酸-配体 149;refined set 5,316 / core set 285);最新商业版 v2025 达 35,924 |
| 数据大小 | 约 4 GB(v2020 全量 tar.gz);v2020.R1 重处理版约 3.8 GB;v2025 约 7.3 GB |
| 数据格式 | PDB(蛋白/口袋)/ MOL2、SDF(配体)/ 纯文本 index 文件(tar.gz 打包) |
| 许可证 | PDBbind-CN License Agreement(v2020 及更早版本,注册免费);v2021 起为 PDBbind+ 商业订阅 |
| 访问级别 | 注册后开放(v2020 免费)/ 商业许可(v2021+ 付费订阅) |
| DUO 标签 | GRU(v2020 免费版通用研究使用;商业版另受订阅协议约束) |
| 语言 | 英文 |
| 首发日期 | 2004-05(首个公开版本;原始论文 2004-06-03 发表) |
| 最后更新 | 2025-08-06(v2020.R1 免费重处理版)/ 2025-02(v2025 商业版) |
| 发布机构 | 复旦大学药学院王任小团队(2004 年创建于密歇根大学,与王少蒙合作;2005 年后由中科院上海有机化学研究所长期维护) |
| 官方主页 | http://www.pdbbind.org.cn/(PDBbind-CN,免费至 v2020)/ https://www.pdbbind-plus.org.cn/(PDBbind+,商业版) |
| 下载地址 | http://www.pdbbind.org.cn/download.php(注册后下载 v2020);CASF 基准:http://www.pdbbind.org.cn/casf.php |
| DOI | 10.1021/jm030580l(2004 原始论文) |
| 引用次数 | 810+(Wang 2004 论文,OpenAlex,截至 2026-09;系列论文合计 3,450+,详见 §8.6) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 结构文件已标准化处理、CASF 金标准基准、社区生态成熟;扣分项:v2021+ 商业墙、亲和力类型异质、普遍存在的数据泄漏陷阱 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 药物发现背景(靶点-疾病映射、亲和力测定方法学、金标准分层描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(index 文件字段、结构文件组织)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与复旦大学、中科院上海有机化学研究所、上海陶术生物科技有限公司(PDBbind+ 运营方)无任何商业利益关联。本页面不销售 PDBbind 数据本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构任何形式的资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。PDBbind v2020 及更早版本需在 PDBbind-CN 网站注册并同意 License Agreement;v2021 及以后版本为 PDBbind+ 平台商业订阅内容。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
PDBbind 是由王任小团队创建并持续维护的蛋白-配体复合物结合亲和力数据库,系统收集了全球蛋白结构数据库(PDB)中全部四类生物分子复合物的三维结构及其实验测得的结合亲和力(Kd/Ki/IC50)。最后一个免费版本 v2020 收录 23,496 个复合物,最新商业版 v2025 已达 35,924 条。
它的地位一句话概括:结构药物发现领域的"ImageNet 时刻"由它定义——几乎所有打分函数(scoring function)、分子对接与 AI 亲和力预测模型都在 PDBbind 上训练;而它的 core set 就是 CASF 基准(Comparative Assessment of Scoring Functions),是整个领域公认的"金标准考卷"。数据库系列论文在 OpenAlex 合计被引超过 3,450 次(截至 2026-09)。
你可以用它来:训练一个基于 3D 结构的亲和力预测模型(GNN/3D-CNN)、在 CASF-2016 基准上评测自研打分函数的 scoring/ranking/docking/screening 四项能力、或者作为结构基虚拟筛选与分子生成模型的训练语料。
§1.1 摘要
PDBbind 的核心工作流是:每年年初对 PDB 新增结构做系统筛查,识别出蛋白-配体、蛋白-蛋白、蛋白-核酸、核酸-配体四类复合物,然后逐篇核查这些结构的原始文献,人工摘录其中报道的实验结合亲和力(Kd/Ki/IC50)并双重校对(团队宣称累计核查文献超 58,000 篇、准确率 >97%)。每个复合物交付一套标准化结构文件:蛋白(*_protein.pdb)、结合口袋(*_pocket.pdb)、配体(*_ligand.mol2 + *_ligand.sdf),并附纯文本 index 文件记录 PDB 编号、分辨率、发布年份与亲和力数值。蛋白-配体部分进一步按质量分三层:general set(全量)、refined set(v2020 为 5,316 条,分辨率 ≤2.5 Å、仅 Kd/Ki、无共价结合与结构缺陷)、core set(285 条,即 CASF-2016 基准测试集)。数据库 2004 年创建于密歇根大学(王任小、王少蒙),后由中科院上海有机化学研究所长期维护(PDBbind-CN),现依托复旦大学药学院,v2021 起经 PDBbind+ 平台商业化运营;PDBbind-CN 上的 v2020 及更早版本保持注册免费,成为 AI 药物发现社区使用最广的开放版本。
§1.2 战略价值分析
数据范式维度:PDBbind 之前,结构与亲和力是两张彼此孤立的表——PDB 有三维结构但没有系统的亲和力标注,文献中有亲和力数字但散落在数万篇论文里。PDBbind 首次把"结构—能量"两张表在 PDB 全库尺度上缝合起来,并坚持了二十年的人工文献核查。这条"结构 + 实验亲和力"的配对数据正是现代打分函数、AI 对接与结构基生成模型的全部燃料——没有 PDBbind,RF-Score、Pafnucy、OnionNet、PIGNet、DiffDock 这一代方法几乎没有可用的训练集。
评测标准维度:PDBbind 不止给数据,还给了"考卷"。从 CASF-2007(195 题)到 CASF-2013 再到 CASF-2016(285 题),王任小团队定义的 scoring power、ranking power、docking power、screening power 四项能力评测框架,成为全世界打分函数的通用语言——任何新模型论文的表格里几乎都有一行"CASF-2016 Pearson R"。一个数据集同时提供训练语料与标准考卷,这在医疗 AI 数据中极为罕见,也是它二十年不衰的根本原因。
产业影响维度:PDBbind 的开放策略(注册免费 + 处理好的结构文件)直接降低了 AI 药物发现的入门成本,全球 70 多个国家的注册用户中既有高校实验室也有制药企业。2021 年起团队将其商业化(与陶术生物合作运营 PDBbind+),免费版冻结在 v2020——这一"开放核心(open core)"模式本身也成为科学数据可持续运营的标志性案例:v2020 至今仍是绝大多数论文的训练基线,而追求数据增量的工业用户为新版付费。
§1.3 横向对比
| 数据集 | 样本量 | 结构 | 亲和力来源 | 核心差异化 |
|---|---|---|---|---|
| PDBbind v2020 | 23,496 复合物 | ✅ 3D 复合物(已处理) | 原始文献人工核查 | 结构+亲和力配对金标准;refined/core 质量分层;CASF 基准发源地 |
| Binding MOAD | 约 4 万复合物 | ✅ 3D 复合物 | 文献+专利 | 美国侧同类库,含部分专利来源 |
| BindingDB | 300 万+ 条测量 | ❌ 以 2D/序列为主 | 文献+专利+ChEMBL | 规模大但缺复合物 3D 结构 |
| ChEMBL | 2,000 万+ 活性记录 | ❌ 2D + 靶点序列 | 文献 | 药物化学活性百科,非结构库 |
| CSAR / CSAR-NRC HiQ | 数百复合物 | ✅ 3D | 工业界盲测集 | 高质量盲测验证集 |
| PLINDER(2024) | 43 万+ PLI 实例 | ✅ 3D(AI 增强) | 亲和力量化较弱 | 面向蛋白-配体相互作用(PLI)的大规模后浪 |
| PDBbind-koff-2020 | 680 复合物 | ✅ 3D | 文献(koff) | 同团队解离动力学扩展集 |
PDBbind 的不可替代性在于三点:结构与亲和力严格一一对应且经人工核对、refined/core 质量分层与 CASF 评测协议深度绑定、二十年文献积累形成的社区共识——任何新数据集(如 PLINDER)的论文都仍需在 CASF-2016 上报告结果以自证。
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 2004-05 | PDBbind 首个公开版本上线(1,359 个蛋白-配体复合物);论文发表(Wang et al., J Med Chem 47:2977-2980,DOI: 10.1021/jm030580l) |
| 2005 | v2003 版方法与更新论文发表(J Med Chem 48:4111-4119):1,622 条亲和力,首设 refined set(900 条) |
| 2007 | CASF-2007 提出(core set 195 = 65 簇 × 3;Cheng et al. 2009, JCIM 49:1079-1093) |
| 2008 | 起纳入蛋白-蛋白、蛋白-核酸、核酸-配体三大类复合物(v2008:4,300 复合物) |
| 2013 | CASF-2013 发布(195 条;Li et al. 2014, JCIM 54:1700-1716/1717-1736),refined set 筛选标准大幅收紧 |
| 2015 | v2013 全库状态报告发表(Liu et al., Bioinformatics 31:405-412,DOI: 10.1093/bioinformatics/btu626) |
| 2016 | PDBbind core set 即 CASF-2016 基准集冻结为 285 条(57 簇 × 5) |
| 2019 | CASF-2016 评测论文发表(Su et al., JCIM 59:895-913),成为至今最新一代 CASF |
| 2020-01 | v2020 发布:23,496 复合物 / refined 5,316——最后一个免费版本 |
| 2021 | 起数据库商业化:新版本(v2021+)仅在 PDBbind+ 平台以订阅制提供;PDBbind-CN 冻结于 v2020 保持免费 |
| 2022 | 衍生集 PDBbind-koff-2020 发布(680 复合物解离速率常数;ACS Omega 7:26160-26169) |
| 2024-01 | PDBbind+ 平台(pdbbind-plus.org.cn)正式上线,复旦王任小团队 × 陶术生物合作运营 |
| 2025-01 | v2024 发布(约 33,600 复合物,refined plus 7,084) |
| 2025-02 | v2025 发布:35,924 条结合数据(较 v2020 +50%) |
| 2025-08-06 | v2020.R1 免费重处理版发布:v2020 条目用 v2024 新流程重新处理(19,037 个蛋白-配体复合物,PDBbind+ 注册免费下载) |
| 2026-04 | refined set v2025(7,383 条)在 PDBbind+ 上线 |
§1.5 典型 AI 应用场景
- AI 打分函数训练:用 3D 复合物结构预测 pKd/pKi(回归),代表模型谱系 RF-Score → Pafnucy → OnionNet → PIGNet → PLANET,训练集几乎都是 PDBbind refined/general。
- CASF 基准评测:在 core set(285)上报告 scoring power(Pearson R)、ranking power(Spearman ρ)、docking power(Top-1 成功率)与 screening power(EF1%),是打分函数论文的"规定动作"。
- 分子对接与 pose 预测方法开发:DiffDock、EquiBind、TankBind 等深度学习对接模型以 PDBbind 时间划分(≤2019 训练 / 2020 测试)作为标准协议。
- 虚拟筛选与分子生成:以口袋结构为条件的生成模型(如 Pocket2Mol、TargetDiff)以 PDBbind 复合物为训练语料。
- 教学与方法学研究:数据结构简单清晰(一复合物一目录 + 文本 index),是计算化学课程与数据泄漏方法学研究(LP-PDBBind、CleanSplit)的标准教具。
§2 医学背景
§2.1 ICD-11 疾病分类锚定
PDBbind 不是疾病专病库——它覆盖的是全人类药物靶点空间。其价值锚点不在"某种疾病的数据",而在"几乎所有疾病领域的药物发现都可能用到它"。库内高频靶点类别与对应 ICD-11 疾病领域的示例映射如下:
| 库内代表性靶点类别 | 代表靶点/复合物 | 对应治疗领域 | ICD-11 示例锚点 |
|---|---|---|---|
| 蛋白激酶 | EGFR、CDK2、Src、Abl | 肿瘤靶向治疗 | 2A00–2F9Z 恶性肿瘤 |
| 病毒蛋白酶 | HIV-1 蛋白酶、SARS-CoV-2 Mpro(主蛋白酶) | 抗病毒药物 | 1C62 HIV 病 / RA01 COVID-19 |
| 核受体 | 雌激素受体 ERα、PPARγ、糖皮质激素受体 | 内分泌与代谢疾病 | 5A11 2 型糖尿病 / 5A50 甲状腺功能失调 |
| 凝血级联蛋白酶 | 凝血酶(thrombin)、凝血因子 Xa | 抗凝药物 | 8B63 静脉血栓栓塞 |
| 神经递质相关 | 乙酰胆碱酯酶(AChE)、单胺氧化酶 | 神经退行性疾病 | 8A20 阿尔茨海默病 |
| 碳酸酐酶 | CA II、CA IX | 青光眼、肿瘤微环境 | 9C10 青光眼 |
| 二氢叶酸还原酶 | DHFR | 抗感染/化疗 | 1C00–1G4Z 感染性疾病谱 |
使用提示:如果你的研究问题是"某疾病的靶点 X 与配体 Y 的结合",PDBbind 提供的是方法学训练场与基准,而非该疾病的流行病学数据;疾病层面的患者数据请另寻专病数据集。
§2.2 SNOMED CT 映射
| 临床/药理场景 | ICD-11 | SNOMED CT | SNOMED CT 术语 |
|---|---|---|---|
| 恶性肿瘤(激酶抑制剂适应症) | 2A00–2F9Z | 363346000 | Malignant neoplastic disease (disorder) |
| HIV 感染(蛋白酶抑制剂适应症) | 1C62 | 86406008 | Human immunodeficiency virus infection (disorder) |
| COVID-19(Mpro 抑制剂适应症) | RA01 | 840539006 | COVID-19 (disorder) |
| 2 型糖尿病(PPARγ 等靶点) | 5A11 | 73211009 | Diabetes mellitus (disorder) |
| 阿尔茨海默病(AChE 抑制剂适应症) | 8A20 | 26929004 | Alzheimer’s disease (disorder) |
| 静脉血栓栓塞(抗凝药适应症) | 8B63 | 128053003 | Deep venous thrombosis (disorder) |
§2.3 领域简介
小分子药物的起效前提是与其靶蛋白形成足够强且足够特异的结合——结合亲和力(通常以解离常数 Kd、抑制常数 Ki 或半抑制浓度 IC50 量化)因此是药物化学优化的核心指标。计算预测亲和力的方法(打分函数、分子对接、自由能计算、AI 模型)能将早期药物发现的湿实验筛选量压缩数个数量级,但这类方法的训练与验证高度依赖"结构已知 + 亲和力已测"的成对数据。PDBbind 正是这一数据需求的全球性答案:它将 PDB 中散落的结构证据与原始文献中的实验亲和力逐一缝合,二十余年来支撑了从经验打分函数到几何深度学习的整代方法演进。
§2.4 临床任务定义(药物发现语境)
| 药物发现任务 | 定义 | 在 PDBbind 中的操作化 |
|---|---|---|
| 苗头化合物发现(hit finding) | 从大规模库中筛出对靶点有活性的分子 | 虚拟筛选任务;CASF screening power(EF1%)评测 |
| 先导化合物优化(lead optimization) | 在同系物中提升亲和力 | ranking power:同靶点同系列配体的亲和力排序(Spearman ρ) |
| 结合模式预测 | 预测配体在口袋中的三维取向 | docking power:从 ≤100 个 decoy pose 中识别近天然 pose(RMSD < 2 Å) |
| 亲和力定量预测 | 预测 pKd/pKi 数值 | scoring power:预测值 vs 实验值 Pearson R / RMSE |
| 反向找靶(target fishing) | 预测活性分子的潜在靶点 | 利用库内"配体—多靶点"关系(同配体多复合物) |
§2.5 数据谱特征(靶点与配体人群)
| 维度 | 特征 |
|---|---|
| 数据来源 | 全球 Protein Data Bank(wwPDB)收录的实验结构 + 各结构对应的原始文献 |
| 采集时间(结构) | v2020 覆盖 1980 年代至 2019 年底 PDB 释放的结构;v2025 延伸至 2024 年底 |
| 复合物类别(v2020) | 蛋白-配体 19,443(82.7%)/ 蛋白-蛋白 2,852 / 蛋白-核酸 1,052 / 核酸-配体 149 |
| 独特受体/配体规模 | 剔除多肽配体后约 3,000+ 独特受体、12,000+ 独特小分子配体(v2020 蛋白-配体口径,文献统计) |
| 配体类型 | 以 200–600 Da 类药小分子为主;含少量寡肽(配体名以 -mer 结尾)与多配体复合物(&// 连接) |
| 亲和力范围 | 一般集中于 pK 2–12(Kd/Ki 约 1 mM – 1 pM);refined set 剔除极端值(限 1 pM–1 mM) |
| 测定方法 | ITC、SPR、酶抑制实验、荧光偏振、放射性配体竞争等(库内不系统记录测定方法与条件) |
| 结构分辨率 | refined set 要求 ≤ 2.5 Å(X-ray);general set 含更低分辨率与 NMR 结构 |
§2.6 金标准/参考标准
| 数据层 | 产生方式 | 产生者 | 金标准性质 |
|---|---|---|---|
| 3D 复合物结构 | X 射线晶体学为主,少量 NMR / 冷冻电镜 | 全球结构生物学实验室(沉积于 PDB) | 实验结构金标准;晶体 packing、缺失残基、低分辨率为已知局限 |
| 结合亲和力(Kd/Ki/IC50) | ITC / SPR / 酶学实验等湿实验测定 | 原始文献作者 | 实验测量值;不同文献间实验条件(温度、pH、构建体)不统一,跨文献可比性有限 |
| refined set | 按结构质量与数据可靠性规则机器筛选 + 人工复核 | 王任小团队 | 高质量子集(v2020:5,316 条) |
| core set(CASF-2016) | refined set 内按序列聚类 + 亲和力梯度抽样 + 电子密度图人工目检 | 王任小团队 | 评测金标准(285 条,57 靶点簇 × 5) |
| 人工核查流程 | 每条亲和力与原文献逐一对照、双重校对 | PDBbind 团队 | 团队宣称累计核查 >58,000 篇文献、准确率 >97% |
refined set 筛选标准(v2013 起执行,Li et al. 2014):X-ray 分辨率 ≤ 2.5 Å;单一非共价结合配体且无显著空间冲突;仅收录 Kd/Ki(排除 IC50——因其数值依赖实验底物浓度与体系设计,跨文献不可比);配体仅含常见有机元素;配体 8 Å 内无缺失主链/侧链、5 Å 内无非标准氨基酸;亲和力在 1 pM–1 mM 之间;剔除浅结合(配体埋藏表面积 <15%)。
core set 构建规则(CASF-2016,Su et al. 2019):refined set 按蛋白序列相似度(90%)聚类,保留含 ≥5 个复合物的簇,每簇按亲和力梯度抽取 5 个代表(最高、最低、中间均匀 3 个,最高与最低差 ≥100 倍),剔除相同配体与立体异构体,人工目检电子密度图后定型为 57 × 5 = 285 条。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 复现 2016-2025 年间 AI 打分函数/对接论文;零预算 | v2020(PDBbind-CN) | 约 4 GB | 最后一个免费版,绝大多数论文的训练基线;注册即可下载 |
| 要 v2020 内容但更高质量的结构文件 | v2020.R1(PDBbind+ 免费) | 约 3.8 GB | 用 v2024 新流程重处理,结构质量优于原版 v2020;注册免费 |
| 只跑 CASF 基准评测(不做训练) | CASF-2016 基准包 | 小 | 含 285 复合物 + decoy pose + 评测脚本,所有用户免费(pdbbind.org.cn/casf.php) |
| 工业项目需要最新数据(2021-2024 年 PDB 增量) | v2025(PDBbind+ 订阅) | 约 7.3 GB | 35,924 条(较 v2020 +50%),refined set 7,383;付费 |
| 只做教学/管道调试 | v2020 refined set | 约 1.5 GB | 5,316 条高质量子集,体量适中 |
一句话结论:研究与复现用 v2020(或更优的 v2020.R1);评测只用 CASF-2016 官方包;要新数据再考虑订阅 v2025。
v2020 vs v2025 关键差异速查:
| 维度 | v2020(免费) | v2025(商业) |
|---|---|---|
| 总条目 | 23,496 | 35,924(+53%) |
| 蛋白-配体 | 19,443 | 29,000+ |
| refined set | 5,316 | 7,383(refined set plus) |
| 蛋白-蛋白 | 2,852 | 5,000+ |
| 结构处理流程 | 2020 版流程 | 升级版流程(跨分子类型/格式更一致,且对旧条目重处理) |
| 获取 | PDBbind-CN 注册免费 | PDBbind+ 付费订阅 |
| 文献核查 | 累计数万篇 | 累计 >58,000 篇 |
| 平台工具 | 无 | COMET 反向找靶 / PLANET 虚拟筛选 / STELLAR koff 预测 |
§3.1 模态详细说明
PDBbind 包含两类数据模态:
- 3D 复合物结构:每个复合物提供 4 个标准化文件——完整蛋白(
*_protein.pdb,已去水)、结合口袋(*_pocket.pdb,配体周围残基截取)、配体(*_ligand.mol2,含键级与部分电荷;*_ligand.sdf)。这批"开箱即用"的结构文件免去了从 PDB 原始文件自行拆分蛋白/配体/口袋的繁重劳动,是 PDBbind 相对原始 PDB 最直接的工程价值。 - 实验亲和力数值:index 文件为每个复合物记录
-logKd/Ki(pK,回归任务的标准靶标)与原始亲和力字符串(如Kd=10nM、Ki<2uM、IC50~5nM),保留测定类型(Kd/Ki/IC50)与算符(=、>、<、~)信息。
§3.2 样本量拆分
v2020 四大类别(general set 口径):
| 类别 | 复合物数 | 占比 | 说明 |
|---|---|---|---|
| 蛋白-配体(PL) | 19,443 | 82.7% | 核心资产;含 refined/core 分层 |
| 蛋白-蛋白(PP) | 2,852 | 12.1% | 无 refined 分层 |
| 蛋白-核酸(PN) | 1,052 | 4.5% | 无 refined 分层 |
| 核酸-配体(NL) | 149 | 0.6% | 最小类别 |
| 合计 | 23,496 | 100% | — |
蛋白-配体质量分层(v2020):
| 子集 | 复合物数 | 关系 | 典型用途 |
|---|---|---|---|
| general set | 19,443 | 全量(含 IC50、低分辨率、共价结合等) | 大规模训练(须自行清洗) |
| refined set | 5,316 | ⊂ general | 标准训练集(仅 Kd/Ki、≤2.5 Å) |
| core set(CASF-2016) | 285 | ⊂ refined | 测试集专用,切勿入训练 |
| refined minus core | 5,031 | refined − core | 与 CASF 配对的标准训练口径 |
§3.3 数据格式详情
| 文件类型 | 格式 | 说明 |
|---|---|---|
| 蛋白结构 | .pdb |
{pdbid}_protein.pdb,去水,标准化残基处理 |
| 口袋结构 | .pdb |
{pdbid}_pocket.pdb,配体邻近残基 |
| 配体结构 | .mol2 / .sdf |
mol2 含 Tripos 键级与部分电荷;sdf 为通用交换格式 |
| index 索引 | 纯文本 | 表头以 # 注释开头;列:PDB code / resolution / release year / -logKd/Ki / Kd/Ki 原值 / 文献 PDF / 配体名 |
| 打包 | .tar.gz |
按子集分卷(refined、general-minus-refined、PP、PN、NL、index) |
§3.4 存储大小
| 版本/子集 | 大小(压缩包) | 来源 |
|---|---|---|
| v2020 全量(四类 + index) | 约 4 GB | PDBbind-CN 下载页 |
| v2020 refined set | 约 1.5 GB | 同上 |
| v2020.R1 蛋白-配体(19,037 条) | 3.1 GB | PDBbind+ 下载页 |
| v2020.R1 其余三类(PP/PN/NL) | 约 674 MB | 同上 |
| v2025 全量 | 约 7.3 GB | PDBbind+ 下载页(各分卷合计) |
| CASF-2016 基准包 | <1 GB | pdbbind.org.cn/casf.php |
§3.5 标注方式
PDBbind 的"标注"即实验亲和力的人工文献核查,流程为:
PDB 年度新增结构
│
├─ 程序筛查:识别四类复合物(PL/PP/PN/NL)
│
├─ 程序定位每个复合物 PDB 条目的 primary reference
│
├─ 人工逐篇阅读原文:提取 Kd/Ki/IC50 数值与测定类型
│
├─ 人工双重校对:亲和力值与复合物结构逐一对照(宣称准确率 >97%)
│
└─ 结构标准化流水线:拆分蛋白/口袋/配体 → 修复缺失原子/键级/电荷
→ 输出 *_protein.pdb / *_pocket.pdb / *_ligand.mol2 / *_ligand.sdf
§3.6 标注者资质
亲和力数据由 PDBbind 团队(计算化学/药物化学背景的研究人员与研究生)人工从原始文献摘录并交叉复核;结构处理由团队自研流水线完成。v2025 版构建时对全库(含历史条目)重新执行了升级版处理流程。团队累计核查文献超 58,000 篇,对外宣称数据准确率 >97%(PDBbind+ 官方表述)。
§3.7 数据采集时间范围
结构覆盖范围随版本推进:v2020 基于 2020 年 1 月初的 PDB 内容(结构释放年份 1980 年代–2019);v2025 基于 2025 年初 PDB(延伸至 2024 年底)。数据库本身 2004-05 首发,2004-2020 年间每年 1 月年度更新,v2021 起转为商业订阅制继续年度更新。
§3.8 地理覆盖
结构数据来自全球向 wwPDB 沉积的研究成果(以欧美、东亚结构生物学实验室为主);数据库维护方位于中国上海。注册用户遍布 70 多个国家(PDBbind+ 官方表述)。
§3.9 采集设备规格
不适用单一设备口径——库内结构由全球各实验室的 X 射线衍射装置(同步辐射光源为主)、NMR 谱仪与冷冻电镜产生;分辨率、R-factor 等质量指标随条目而异,index 文件仅记录分辨率一项。对质量敏感的应用应优先使用 refined set(≤2.5 Å)。
§3.10 深度溯源链
| 环节 | 系统/方法 | 关键转换 |
|---|---|---|
| 1. 数据源系统 | 全球结构生物学实验(X-ray/NMR/cryo-EM)+ 药理实验室亲和力测定 | 结构与亲和力分别产生于不同实验室、不同时间 |
| 2. 结构归档 | wwPDB(RCSB/PDBe/PDBj/BMRB) | 实验结构统一沉积、分配 PDB 编号、关联 primary reference |
| 3. 复合物识别 | PDBbind 团队程序筛查 | 判定条目是否含四类复合物之一;v2020 从 157,974 个 PDB 条目中识别出 78,460 个候选复合物 |
| 4. 亲和力文献核查 | 人工阅读原文 + 双重校对 | 从 >58,000 篇(累计)文献中摘录 Kd/Ki/IC50,23,496 条成功配对(v2020) |
| 5. 结构标准化 | 自研处理流水线 | 拆分蛋白/口袋/配体;去水;键级与电荷规范化;v2025 起全流程升级并重处理历史条目 |
| 6. 质量分层 | refined 筛选规则 + 聚类抽样 | general → refined(5,316)→ core(285 = CASF-2016) |
| 7. 发布 | PDBbind-CN(免费至 v2020)/ PDBbind+(v2021+ 订阅) | 注册协议下载;CASF 包独立免费发布 |
§4 数据结构详解
§4.0 目录结构预览
pdbbind_v2020/ # 解压后根目录(以蛋白-配体部分为例)
├── index/
│ ├── INDEX_general_PL_data.2020 # general set 全量索引(19,443 行 + # 注释表头)
│ ├── INDEX_general_PL_name.2020 # general set 名称索引(复合物/配体名)
│ ├── INDEX_refined_data.2020 # refined set 索引(5,316 行,含 core 标记注释)
│ ├── INDEX_refined_name.2020 # refined set 名称索引
│ ├── INDEX_general_PP.2020 # 蛋白-蛋白索引
│ ├── INDEX_general_PN.2020 # 蛋白-核酸索引
│ └── INDEX_general_NL.2020 # 核酸-配体索引
├── refined-set/
│ ├── 1a30/ # 每个复合物一个目录,目录名 = PDB 编号
│ │ ├── 1a30_protein.pdb # 完整蛋白(去水)
│ │ ├── 1a30_pocket.pdb # 结合口袋残基
│ │ ├── 1a30_ligand.mol2 # 配体(含键级/部分电荷)
│ │ └── 1a30_ligand.sdf # 配体(SDF 格式)
│ ├── 1a4k/
│ └── ... # 共 5,316 个目录
├── v2020-other-PL/ # general minus refined(14,127 个目录)
│ └── ...
├── PP/ PN/ NL/ # 其余三类复合物目录
└── readme/ # 说明文档
index 文件行格式示例(INDEX_refined_data.2020,空格分隔):
# PDB code, resolution, release year, -logKd/Ki, Kd/Ki, reference, ligand name
2r58 2.00 2007 2.00 Kd=10mM // 2r58.pdf (MLY)
3c2f 2.35 2008 2.00 Kd=10.1mM // 3c2f.pdf (PRP)
1a30 1.90 1992 9.00 Kd=1nM // 1a30.pdf (N1)
§4.1 DAIMS 标准化字段描述表
核心表:INDEX_*_data(每个复合物一行)
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| PDB code | TEXT(4) | PDB 四位编号 | “1a30” | 主键,关联目录与外部库 | 无 | 不允许缺失 | PDB 合法编号 |
| resolution | FLOAT | X-ray 分辨率(Å) | 1.90 | 质量过滤特征 | 无 | NMR 结构留空(非随机缺失) | 0.8–4.0(refined ≤2.5) |
| release year | INT | PDB 释放年份 | 2007 | 时间划分依据 | 无 | 不允许缺失 | 1980s–版本截止年 |
| -logKd/Ki | FLOAT | pK 值,-log₁₀(Kd 或 Ki,摩尔单位) | 9.00 | 回归任务标准靶标 | 实验测定误差 ±0.5–1 pK 量级 | 不允许缺失(有值才入库) | 2–12(refined 限定) |
| Kd/Ki 原值 | TEXT | 原始字符串:类型+算符+数值+单位 | “Ki<2uM” | 测定类型/算符审计 | 跨文献条件异质 | 无 | Kd=/Ki=/IC50=,算符 =/>/< /~ |
| reference | TEXT | 文献 PDF 文件名 | “2r58.pdf” | 溯源 | 无 | 无 | — |
| ligand name | TEXT | 括号内配体三字母码/名称 | “(MLY)” | 配体去重、多配体识别 | 多配体用 & / / 连接;多肽以 -mer 结尾 | 无 | — |
结构文件层(每复合物 4 文件)
| 文件 | 格式 | 说明 | AI 用途 | 观测误差 |
|---|---|---|---|---|
{id}_protein.pdb |
PDB | 完整蛋白坐标(去水) | 图构建/网格体素化 | 缺失残基、alt-loc |
{id}_pocket.pdb |
PDB | 口袋残基坐标 | 口袋级建模 | 同上 |
{id}_ligand.mol2 |
MOL2 | 配体坐标 + 键级 + 部分电荷 | RDKit/图模型输入 | 少数配体 mol2 解析失败(见 §6.5 坑点 4) |
{id}_ligand.sdf |
SDF | 配体坐标 | 通用交换 | 键级感知依赖工具链 |
§4.2 标签分布统计
| 维度 | 分布 | 说明 |
|---|---|---|
| pK(-logKd/Ki) | 约 2–12,峰值在 6–8(nM–μM 区间) | refined set 被规则限制在 2–12;general set 含更多极端值 |
| 亲和力类型 | general set 混合 Kd / Ki / IC50;refined set 仅 Kd/Ki | IC50 仅在 general 中出现,跨体系不可直接比较 |
| 算符 | 绝大多数为 =;少量 >、<、~ |
非等值样本为右/左删失数据,直接当真值会引入偏差 |
| 靶点簇 | CASF-2016 覆盖 57 个蛋白簇 | 激酶、蛋白酶等热门靶点在库中占比显著偏高(见 §7.1) |
| 配体重原子数 | PDBbind v2019 平均约 32;CASF-2016 core 平均约 24 | core set 配体偏小,客观上"更容易" |
| 发布年份 | 2000 年后占大头,2010-2019 为峰区 | 时间划分(≤2019 / =2020)是常用评测协议 |
§4.3 关键字段描述性统计
- v2020 从 157,974 个 PDB 条目中识别出 78,460 个候选复合物,最终 23,496 条成功配对亲和力(配对率约 30%)。
- 蛋白-配体部分剔除多肽配体后约 16,844 条,覆盖约 3,043 个独特受体与 12,908 个独特配体(文献统计口径)。
- refined set 仅占 general set 的 27%(5,316 / 19,443)——多数条目被分辨率、IC50、共价结合或结构缺陷规则挡在门外。
- 同一"受体-配体"组合常有多个 PDB 结构(多分辨率/多批次结晶),库内冗余需自行去重。
§4.4 数据层级关系
PDB(157,974 条目,2020-01 快照)
└─ 候选复合物(78,460,程序识别)
└─ PDBbind general set(23,496,有亲和力)
├─ 蛋白-配体(19,443)
│ └─ refined set(5,316,质量筛选)
│ └─ core set(285 = CASF-2016,聚类抽样)
├─ 蛋白-蛋白(2,852)
├─ 蛋白-核酸(1,052)
└─ 核酸-配体(149)
- 主键:
pdb_id(目录名),index 行、4 个结构文件、外部资源(RCSB、BindingDB、UniProt)均以此关联。 - 高频踩坑:一个 PDB 编号可对应多条 index 记录口径差异(v2020 vs v2020.R1 条目不完全一致,R1 仅保留仍存在于 v2024 的条目);多配体复合物的"哪一个是活性配体"需人工判断。
§4.5 缺失值情况与信息性缺失编码
| 缺失类型 | 字段示例 | 缺失原因 | 信息性缺失编码 | 对 AI 的影响 |
|---|---|---|---|---|
| 结构性缺失 | resolution(NMR 条目) | NMR 无分辨率概念 | 空白 = 非 X-ray 结构 | 按结构方法分层,勿用分辨率均值填充 |
| MNAR_测量 | 算符为 > / < 的亲和力 |
超出实验测定动态范围 | < = 右删失(真实亲和力更强) |
删失样本应剔除或用删失回归处理 |
| 体系缺失 | 测定温度/pH/缓冲液 | 库内不系统记录 | 全部缺失 | 跨文献亲和力可比性受限,pK 噪声下限约 ±0.5–1 |
| 选择性缺失 | 阴性/非结合数据 | 文献极少报道"不结合" | 全库无 decoy | 分类任务必须外接 DUD-E/LIT-PCBA 等阴性集 |
| 结构缺失 | 缺失残基/侧链 | 晶体无序区未解析 | PDB 文件内直接缺行 | refined set 已剔除口袋 8 Å 内缺失;general set 需自查 |
§5 数据划分与使用建议
§5.1 官方数据划分
PDBbind 官方提供的"划分"是质量分层而非机器学习意义上的 train/test split:general ⊃ refined ⊃ core。社区事实标准协议是:
- CASF 协议:core set(285)作为测试集,refined minus core(5,031)或 general minus core 作为训练池——这是打分函数论文最常见的口径。
- 时间协议(time split):以 index 的 release year 划分,EquiBind 提出的 v2020 口径(≤2019 训练、2020 释放的复合物测试)被对接/生成类模型广泛采用。
§5.2 推荐划分策略
- CASF 对照实验:训练 = refined minus core(5,031),测试 = core set(285)。适合与既有文献直接比较,但须自知其泄漏上限(见 §5.3)。
- 时间外推实验:train = release year ≤ 2018,test = 2019-2020 释放复合物。模拟"面向未来"的真实使用场景。
- 靶点外推实验:按蛋白序列聚类(如 30% identity)整体划分——评估对新靶点的泛化,是最严格也最接近工业现实的口径。
- 骨架外推实验:按配体 Bemis-Murcko 骨架划分——评估对新化学型的泛化。
- 泄漏控制训练集:直接使用社区发布的 Leak-Proof PDBBind(LP-PDBBind)或 GEMS CleanSplit(约 12,000 条,剔除与 CASF 高度相似的训练样本)。
import pandas as pd
from rdkit import Chem
from rdkit.Chem.Scaffolds import MurckoScaffold
# 按配体 Bemis-Murcko 骨架划分(骨架外推)
def scaffold_key(mol2_path):
mol = Chem.MolFromMol2File(mol2_path, sanitize=False)
if mol is None:
return None
scaff = MurckoScaffold.MurckoScaffoldSmiles(mol=mol)
return scaff if scaff else Chem.MolToSmiles(mol)
# 同一骨架的复合物整体归入同一侧,集合零交集需断言验证
§5.3 数据泄漏风险防御
| # | 泄漏模式 | 严重程度 | 防御措施 |
|---|---|---|---|
| 1 | core set ⊂ refined set:误把 core 留在训练集 | 极高 | 训练前显式 train = refined - core;断言 pdb_id 零交集 |
| 2 | refined minus core 与 core 存在同蛋白/同配体(序列/化学高相似) | 高(文献证实,见 §6.5 坑点 1) | 用 LP-PDBBind / CleanSplit;或自行按序列+骨架双阈值过滤 |
| 3 | 随机划分:同一受体-配体的多个晶体结构横跨训练/测试 | 高 | 按受体(UniProt/序列簇)分组划分 |
| 4 | 时间划分后仍出现同靶点老药新结构 | 中 | 时间划分 + 靶点簇去重双重控制 |
| 5 | 用 docking pose 训练、用晶体 pose 评测(或反之)混入 | 中 | 明确 pose 来源,CASF 评测严格使用官方包内文件 |
§5.4 交叉验证建议
- 训练集内部做 5 折按靶点簇分组的交叉验证(GroupKFold,组 = 蛋白序列簇),而非随机 KFold。
- 报告 core set 结果时注明训练集口径(refined minus core / general minus core / CleanSplit),否则与文献不可比。
§5.5 外部验证
在 PDBbind 上训练的模型,经典外部验证路径为:CSAR / CSAR-NRC HiQ(工业界盲测集,PIGNet 在其 set 1/2 上报告 R=0.768/0.800)、Astex diverse set(85 条高质量复合物)、Merck FEP 基准集(8 靶点同系物系列,验证 ranking)、PDBbind v2025 新增条目(对 v2020 训练模型构成天然时间外推测试,需订阅)。
§6 AI 就绪指南
§6.0 云端快速启动
零下载体验:PDBbind-CN 网站(pdbbind.org.cn)支持免登录在线浏览每个复合物的 3D 结构与亲和力信息(BROWSE 页);注册后(免费)即可搜索 v2020 并下载全部数据包。PDBbind+(pdbbind-plus.org.cn)注册即为 demo 用户,可搜索 v2020、下载 v2020.R1 重处理版,并试用 COMET/PLANET/STELLAR 在线计算工具(各 10 次)。
最小实验路径建议:先只下载 index 文件(约 500 KB)+ refined set(约 1.5 GB),用 §6.1 代码 30 分钟内完成"pK 分布可视化 + RF 基线"全流程,再决定是否拉取 general set。
§6.1 快速上手
# ========================================
# PDBbind v2020 快速上手 — index 解析 + RF-Score 风格基线
# 环境要求: pandas, rdkit, scikit-learn
#
# ⚠️ 目录结构预期(详见 §4.0):
# ./data/pdbbind_v2020/
# ├── index/INDEX_refined_data.2020
# ├── refined-set/<pdbid>/<pdbid>_protein.pdb 等 4 文件
# └── ...
# data_root 指向 ./data/pdbbind_v2020,pdb_id 即目录名与主键。
# ========================================
import os
import pandas as pd
data_root = "./data/pdbbind_v2020"
# 步骤 1:解析 refined set index(跳过 # 注释表头)
cols = ["pdb_id", "resolution", "year", "pK", "affinity_raw"]
idx = pd.read_csv(
os.path.join(data_root, "index/INDEX_refined_data.2020"),
sep=r"\s+", comment="#", header=None, usecols=range(5), names=cols,
)
# 步骤 2:CASF 协议——core set (285) 拆出做测试集
# core set 名单以 CASF-2016 官方包 core.lst 为准;此处演示从列表文件读取
with open("core_set_285.txt") as f: # 每行一个 pdb_id
core_ids = {ln.strip().lower() for ln in f if ln.strip()}
test_df = idx[idx.pdb_id.isin(core_ids)] # 285 条
train_df = idx[~idx.pdb_id.isin(core_ids)] # 5,031 条
assert not set(train_df.pdb_id) & set(test_df.pdb_id) # 零泄漏断言
# 步骤 3:最简特征(示例:蛋白-配体原子对计数思想可替换为任意指纹)
# 生产环境建议直接采用 RF-Score v3 / OnionNet 等开源实现的特征管道
print(train_df.pK.describe()) # 期望:约 5,031 条,pK 峰值 6-8
§6.2 数据获取流程
| 获取方式 | 链接/位置 | 大小 | 流程 |
|---|---|---|---|
| v2020 全量(免费版) | http://www.pdbbind.org.cn/download.php | 约 4 GB | ① 在 PDBbind-CN 注册(学术与工业用户均免费);② 同意 License Agreement;③ 登录后按子集分卷下载 tar.gz |
| v2020.R1(免费重处理版) | https://www.pdbbind-plus.org.cn/download | 约 3.8 GB | PDBbind+ 注册(免费,自动为 demo 用户)→ DOWNLOAD 页下载 |
| CASF-2016 基准包 | http://www.pdbbind.org.cn/casf.php | <1 GB | 注册用户免费下载(含 285 复合物、decoy pose、评测说明) |
| v2024 / v2025 | https://www.pdbbind-plus.org.cn/ | 约 7 GB | 付费订阅后下载 |
| 第三方再分发(注意许可) | Zenodo(Schrödinger 重处理版 25.8 GB)、ProteinShake、TDC、Atom3D | 各异 | 仅供快速原型;正式研究请核对原始许可并引用原始论文 |
License 核心要点:v2020 及更早版本经注册协议免费使用(学术/工业均可注册);不得未经许可再分发;发表须引用指定论文(见 §9)。v2021+ 为商业订阅,具体条款以 PDBbind+ 订阅协议为准。
§6.3 预处理 Pipeline
<details>
<summary><b>点击展开完整的 5 步预处理代码(Python + RDKit)</b></summary>
# 步骤 1:index 解析(含算符与亲和力类型审计)
import os, re, gzip, tarfile
import pandas as pd
def parse_affinity(raw):
"""'Ki<2uM' -> (type='Ki', op='<', value=2e-6 M)"""
m = re.match(r"(Kd|Ki|IC50)\s*([=<>~])\s*([0-9.eE+-]+)\s*(mM|uM|nM|pM|fM)", raw)
if not m:
return None
scale = {"mM": 1e-3, "uM": 1e-6, "nM": 1e-9, "pM": 1e-12, "fM": 1e-15}
typ, op, val, unit = m.groups()
return typ, op, float(val) * scale[unit]
# 步骤 2:删失样本处理——非 '=' 算符的条目剔除(或做删失回归)
idx = idx[idx.affinity_raw.str.contains("=") & ~idx.affinity_raw.str.contains("[<>~]")]
# 步骤 3:配体读取(mol2 优先,失败回退 sdf;多肽 -mer 与多配体 & // 剔除)
from rdkit import Chem
def load_ligand(data_root, pdb_id):
d = os.path.join(data_root, "refined-set", pdb_id)
mol = Chem.MolFromMol2File(os.path.join(d, f"{pdb_id}_ligand.mol2"), sanitize=False)
if mol is None:
mol = Chem.MolFromMolFile(os.path.join(d, f"{pdb_id}_ligand.sdf"), sanitize=False)
if mol is not None:
try:
mol.UpdatePropertyCache(strict=False)
Chem.SanitizeMol(mol, Chem.SanitizeFlags.SANITIZE_ALL ^
Chem.SanitizeFlags.SANITIZE_KEKULIZE)
except Exception:
return None
return mol
# 步骤 4:口袋原子图构建(配体重原子 6 Å 内蛋白重原子)
def pocket_atoms(protein_pdb, ligand_mol, cutoff=6.0):
# 生产建议用 Biopython/MDAnalysis;此处示意距离过滤逻辑
pass
# 步骤 5:去重与口径固定——同一 (受体序列簇, 配体 InChIKey) 保留分辨率最佳者
idx["InChIKey"] = idx.pdb_id.map(lambda p: inchikey_of(p)) # 自行实现
idx = (idx.sort_values("resolution")
.drop_duplicates(subset=["receptor_cluster", "InChIKey"], keep="first"))
</details>
推荐直接使用社区成熟管道替代手写:RF-Score v3 特征实现、ProteinShake(一键加载 PDBbind 为图/体素张量)、TDC(Therapeutics Data Commons)的 PDBbind 加载器、Atom3D、GEMS(含 CleanSplit 划分文件)。
§6.4 框架加载
# PyTorch + PyTorch Geometric 版口袋图 Dataset
import torch
from torch_geometric.data import Data, Dataset
class PDBbindPocket(Dataset):
def __init__(self, df, data_root):
super().__init__()
self.df = df.reset_index(drop=True)
self.data_root = data_root
def len(self):
return len(self.df)
def get(self, i):
row = self.df.iloc[i]
x, edge_index, edge_attr = build_pocket_graph(self.data_root, row.pdb_id)
return Data(x=x, edge_index=edge_index, edge_attr=edge_attr,
y=torch.tensor([row.pK], dtype=torch.float))
# XGBoost/RF 基线(指纹特征)
from sklearn.ensemble import RandomForestRegressor
from sklearn.metrics import mean_squared_error
rf = RandomForestRegressor(n_estimators=500, n_jobs=-1, random_state=42)
rf.fit(X_train, y_train) # X: ECFP4(配体) + 蛋白描述子拼接
rmse = mean_squared_error(y_test, rf.predict(X_test)) ** 0.5
§6.5 常见坑点
⚠️ 坑点 1:CASF core set 是 refined set 的子集——"标准协议"自带泄漏(分类:数据泄漏)
问题:core set(285)本身来自 refined set;即使训练时用 refined minus core,其中仍有大量与 core 同蛋白(序列相似)或同配体(化学相似)的复合物。多数已发表 MLSF 的 CASF 成绩因此系统性偏高。
症状:CASF-2016 上 Pearson R 很漂亮(0.80+),换到时间外推/新靶点数据骤降至 0.5-0.6(AEV-PLIG 研究:OnionNet 0.83→0.57,Pafnucy 0.76→0.55)。
解决:① 泄漏控制训练集:LP-PDBBind 或 GEMS CleanSplit(~19,500 → ~12,000 条);② 至少做一组靶点簇划分实验作对照;③ 论文中同时报告 CASF 与 OOD 结果;④ 训练前断言训练集与 core set 无相同 pdb_id。
参考:Buttenschoen et al., “Leak Proof PDBBind”, arXiv:2308.09639;GEMS CleanSplit(github.com/camlab-ethz/GEMS);Commun Chem 2025, DOI: 10.1038/s42004-025-01428-y。
⚠️ 坑点 2:Kd、Ki、IC50 混为一谈(分类:标签理解)
问题:general set 混合三种亲和力类型。IC50 依赖底物浓度与实验设计(Cheng-Prusoff 关系),与 Kd/Ki 不具严格可比性;直接混合训练会引入不可消除的标签噪声。
症状:同一配体-靶点对的预测残差呈双峰;与只用 Kd/Ki 的文献结果对不上。
解决:训练主模型用 refined set(官方已排除 IC50);若用 general set 扩量,按 affinity_raw 前缀分层,IC50 条目单独建模或降权;切勿把 IC50 当 Kd 直接取 -log。
参考:Li et al. 2014, JCIM 54:1700-1716(refined 标准);Frontiers fbinf.2022.885983 综述 §3.1。
⚠️ 坑点 3:随机 train/test 划分 = 把同一靶点切开(分类:数据泄漏)
问题:PDBbind 中热门靶点(激酶、蛋白酶)有数十至上百个复合物,随机划分使同一受体的不同配体/结构横跨训练与测试,模型学到"认靶点"而非"学结合"。
症状:随机划分 R 0.85+,按靶点簇划分掉到 0.4-0.6;模型对全新靶点完全失效。
解决:按蛋白序列相似度聚类(30% 或 90% identity)整体划分(GroupKFold by cluster);同时做配体骨架划分考察化学外推;两种口径都报告。
参考:Leak Proof PDBBind(arXiv:2308.09639)§数据泄漏定义;Gabel & Rognan 2014, JCIM 54:2807-2815。
⚠️ 坑点 4:配体 mol2/结构文件解析失败与多配体歧义(分类:工程陷阱)
问题:部分配体 mol2 含非标准键级/电荷导致 RDKit sanitize 失败;多配体复合物(配体名含
&或/)无法确定"哪个是活性配体";多肽配体(名称以-mer结尾)混入小分子任务。症状:批量加载时 1-5% 样本静默丢失;训练集规模莫名比 index 少几百条。
解决:mol2 失败回退 sdf(§6.3 已给出健壮加载代码);多配体与 -mer 条目按 ligand name 显式剔除(约数十至上百条);记录并报告实际可用样本数;质子化状态如需严格统一,自行用 OpenBabel/Dimorphite 重处理(注意这会偏离官方文件)。
参考:mmCIF2BioLiP 技术笔记(github.com/TheWall9/mmCIF2BioLiP);ACS JCIM meta-modeling 文(排除 7 个多配体复合物)。
⚠️ 坑点 5:算符
<、>、~的删失亲和力被当成真值(分类:标签理解)问题:
Ki<2nM表示真实值比 2 nM 更强(右删失),Kd>10mM反之;直接取数值训练会让模型学到被截断的分布。症状:强结合端(pK > 10)与弱结合端(pK < 3)残差系统性单向偏移。
解决:统计 affinity_raw 算符分布;主训练只保留
=样本;若要利用删失样本,采用删失回归(Tobit/有序分箱)或在 loss 中按区间处理。参考:PDBbind index 文件表头说明;ProteinShake affinity_parse 实现。
⚠️ 坑点 6:refined set 的"高质量"≠ 亲和力高精度(分类:评估误用)
问题:refined 规则筛的是结构质量与数据类型(Kd/Ki),但实验亲和力本身仍有跨文献体系差异(温度、pH、构建体、 assay 形式),库内不记录这些条件;pK 的实验间噪声普遍被认为在 ±0.5-1 个对数单位。
症状:模型 RMSE 逼近 1.0 pK 后继续下降困难;不同论文报告的"理论上限"不一致。
解决:把 RMSE ≈ 0.8-1.2 pK 视为该数据的现实噪声地板;追求更高精度时转向同系物 ranking(FEP 类任务)而非绝对值;报告结果时注明"受实验异质性限制"。
参考:Liu et al. 2017, Acc Chem Res 50:302-309(打分函数精度讨论);Kramer et al. 关于实验误差对 QSAR 上限的分析。
⚠️ 坑点 7:版本口径混乱——v2016/v2019/v2020/v2025 的 refined 规模各不相同(分类:工程陷阱)
问题:refined set 随版本增长(v2016 约 4,057、v2020 为 5,316、v2025 达 7,383);不同论文训练集规模不同,CASF 分数表面可比、实则训练数据量与泄漏程度不同;v2021+ 商业墙导致部分团队只能停留在 v2020。
症状:复现他人结果时训练集少几百条;新旧论文横向比较失真。
解决:方法部分固定声明"PDBbind v2020 refined minus core, n=5,031";复现旧文时按其版本重建训练集;使用 v2020.R1 时声明其为重处理版(条目 19,037,与原版 19,443 不完全相同)。
参考:PDBbind+ 下载页各版本条目数;Frontiers fbinf.2022.885983。
⚠️ 坑点 8:晶体 pose 评测 ≠ 真实对接能力(分类:评估误用)
问题:CASF scoring power 用晶体(native)pose 评测,而真实应用中 pose 来自对接采样,含几何误差;scoring power 高的模型 docking/screening power 未必高(CASF-2016 论文已明确指出四能力不相关)。
症状:模型 CASF R 0.8+,但接入真实对接 pipeline 后 enrichment 不如 Vina。
解决:CASF 四项能力分开报告;实用导向的工作增加 decoy pose 上的鲁棒性测试(CASF docking power 或 PoseBusters 检查);生成 pose 与晶体 pose 分开评估。
参考:Su et al. 2019, JCIM 59:895-913(CASF-2016,四能力解耦结论);PIGNet 论文(arXiv:2008.12249)Table 1。
版本提示:引用 CASF 成绩时注明 CASF 代数(2007/2013/2016)与 core set 规模(195/195/285)——三代 core set 构成不同,分数不可跨代比较。
§6.6 数据增强
| ✅ 安全增强 | ❌ 危险增强(禁止) |
|---|---|
| 复合物坐标整体随机旋转/平移(保持 3D 几何不变性) | 对配体-蛋白相对取向做随机扰动(破坏结合模式) |
| 对接生成的多 pose 作为同标签增广样本(标注来源) | 把 decoy pose 标成真 pose 标签 |
| 配体侧链旋转异构采样(能量合理范围内) | 跨复合物拼接口袋与配体(虚构界面) |
| 用 v2025/BindingDB 新数据做外部增广(声明来源) | 对 pK 标签加噪声"平滑"(掩盖实验异质性方向) |
| 蛋白同源结构(同 UniProt 多 PDB)聚合增广 | 修改原子类型/键级后沿用原标签 |
§6.7 模型推荐
| 任务 | 推荐方案 | 特征/输入 | 预期性能(CASF-2016 scoring power) |
|---|---|---|---|
| 快速基线 | RF-Score v3 / XGBoost | 原子对计数 + Vina 项 | R ≈ 0.75-0.80 |
| 标准深度学习 | 3D-CNN(Pafnucy 式) | 口袋体素化 19 通道 | R ≈ 0.76-0.78 |
| 图网络主流 | GIGN / PIGNet / OnionNet-2 | 蛋白-配体图 + 物理归纳偏置 | R ≈ 0.76-0.82 |
| 当前第一梯队 | ResAtom-Score / PLANET v2.0 / ΔVinaRF20 | 3D-CNN 集成 / MDN 统计势 / RF+Vina 项 | R ≈ 0.82-0.85 |
| 对接 pose | DiffDock / TankBind / Gnina | 扩散生成 / 等变 GNN | v2020 交叉对接成功率 82-84% |
| 教学演示 | 逻辑/线性回归 + 配体指纹 | ECFP4 + pK 回归 | R ≈ 0.5-0.6(展示噪声地板用) |
§6.8 计算资源需求
| 硬件 | 最小配置 | 推荐配置 |
|---|---|---|
| 磁盘 | 10 GB(refined + index) | 50 GB(全量 + 派生特征 + pose 库) |
| 内存 | 8 GB | 32 GB(general set 批量特征化) |
| GPU | CPU 足够(RF/XGBoost 基线) | 1 × 16 GB 显存(3D-CNN/GNN) |
| 训练时间 | RF 基线 <1 小时(CPU) | GNN 数小时–1 天;扩散对接模型 1-3 天 |
§6.9 评估指标
import numpy as np
from scipy.stats import pearsonr, spearmanr, kendalltau
def scoring_power(y_true_pK, y_pred):
"""CASF scoring power: Pearson R + RMSE + SD"""
R, _ = pearsonr(y_true_pK, y_pred)
rmse = float(np.sqrt(np.mean((y_true_pK - y_pred) ** 2)))
# CASF 的 SD:对拟合直线残差的标准差(与 RMSE 略不同)
a, b = np.polyfit(y_pred, y_true_pK, 1)
sd = float(np.sqrt(np.mean((y_true_pK - (a * y_pred + b)) ** 2)))
return {"Pearson_R": R, "RMSE": rmse, "SD": sd}
def ranking_power(y_true_by_target, y_pred_by_target):
"""CASF ranking power: 57 个靶点簇内 Spearman ρ 的平均"""
rhos = [spearmanr(t, p).statistic
for t, p in zip(y_true_by_target, y_pred_by_target)]
return {"Spearman_mean": float(np.mean(rhos))}
社区共识:scoring power 报 Pearson R(+RMSE/SD);ranking power 报 57 靶点平均 Spearman ρ(可附 Kendall τ、PI);docking power 报 Top-1/2/3 成功率(RMSD < 2 Å);screening power 报 EF1% 与成功率。四能力分开报,不用单一数字概括模型。
§6.10 MLOps 笔记
- 版本锁定:论文/报告必须注明 “PDBbind v2020”(或 v2020.R1 / v2025)与下载日期;商业版还需注明订阅版本。
- 引用要求:使用 PDBbind 数据须引用其核心论文(至少 Wang 2004 或 Liu 2015;用 CASF 再引 Su 2019),这是 License 与社区惯例的双重要求(见 §9)。
- 数据审计:训练前输出三条审计信息——可用样本数(相对 index 的损耗)、算符分布(
=/>/<)、亲和力类型分布(Kd/Ki/IC50),随模型卡一起存档。 - 泄漏检查流水线化:把"训练集 vs core set 序列/骨架相似度扫描"固化为 CI 步骤(可用 CleanSplit 的相似度脚本)。
- 商业合规:团队/公司场景明确谁持有 PDBbind+ 订阅、数据能否进入共享训练环境——订阅协议对再分发有约束。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 靶点类别偏倚 | 激酶、蛋白酶、核受体等"可结晶 + 热门成药"靶点严重过采样;GPCR、离子通道等膜蛋白稀少 | 高 | 训练按靶点簇分层/重加权;报告按靶点类别分组性能 |
| 强亲和力偏倚 | 发表 SAR 系列偏向 nM 级强结合物;弱结合与中等亲和力样本相对少 | 中高 | 评估分 pK 区间报告;采样时保留 pK 边缘区间 |
| 阳性偏倚(无阴性) | 库内全部是"有报道的结合",无真正的非结合/decoy 数据 | 高(对分类任务) | 分类/筛选任务外接 DUD-E、LIT-PCBA、DEKOIS 阴性集 |
| 发表偏倚 | 仅收录随 PDB 结构发表且文献可得的亲和力;失败实验不存在 | 中 | 认识论层面声明;不可消除 |
| 晶体学偏倚 | 静态晶体 pose:缺水、缺膜环境、缺蛋白柔性;晶体 packing 可能扭曲结合模式 | 中高 | 对接/MD 场景自行加回水与膜;用多结构/系综缓解 |
| 测定条件异质偏倚 | 温度/pH/构建体/assay 形式跨文献不统一且不记录 | 中 | 视为噪声地板(±0.5-1 pK);高精度需求转向同系物 ranking |
| 泄漏偏倚 | core set ⊂ refined set,标准训练池与测试集相似度高 | 高 | LP-PDBBind / CleanSplit / 靶点簇划分(§5.3、坑点 1) |
| core set 难度偏倚 | core set 配体平均更小(约 24 vs 32 重原子)、结构质量更高 | 中 | 报告 CASF 成绩时注明其"偏易"性质 |
§7.2 标注质量评估
| 标注类型 | 可靠性 | 一致性 | 局限性 |
|---|---|---|---|
| 亲和力数值(人工文献核查) | 团队宣称 >97% 准确率(双重校对) | 同一复合物不同文献偶有冲突值 | 核查对象是"文献报道值"而非实验本身;文献错误会被忠实转录 |
| refined set 分层 | 规则明确、多年稳定 | 各版本口径一致(v2013 起) | 规则不评估亲和力实验质量本身 |
| core set(CASF-2016) | 电子密度图人工目检 | 285 条冻结,可复现 | 2016 年后未更新;配体偏小 |
| 结构处理文件 | 标准化流水线,v2024 流程再升级 | v2020.R1 与 v2020 存在处理差异 | 质子化/互变异构非逐条人工确认 |
§7.3 泛化性讨论
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 新靶点(库外蛋白家族) | 高 | 靶点簇划分实验性能常降至 R 0.4-0.6(Leak Proof PDBBind 等) |
| 新化学型(库外骨架) | 中高 | 骨架划分性能显著低于随机划分;Ligand Bias 集上最佳模型仅 R 0.37 |
| 时间外推(2020 后结构) | 中 | AEV-PLIG OOD 研究:CASF 0.83 → OOD 0.57 |
| 跨亲和力类型(Kd/Ki → IC50 体系) | 中 | 类型间不可比是 refined 排除 IC50 的设计原因 |
| 真实对接 pose(非晶体) | 中高 | scoring power 与 docking/screening power 解耦(CASF-2016 结论) |
| 膜蛋白/柔性靶点 | 高 | 晶体学偏倚的直接后果,库内代表性不足 |
§7.4 伦理考量
- PDBbind 不含人体受试者数据——全部条目来自公开 PDB 结构与公开文献,无隐私/知情同意问题。
- 数据再分发受许可约束:v2020 免费版禁止未经许可的再分发,v2021+ 订阅数据不得共享给非订阅方;团队内部共享前应核对协议。
- AI 药物发现模型具有双重用途潜力(如被用于设计有害分子),使用方应遵守所在机构与法域的负责任研究规范。
- 引用原始论文(§9)是 License 义务而非礼貌——大量论文漏引系列论文中的评测部分(Su 2019 CASF-2016),投稿前请核对。
§7.5 公平性评估(化学空间代表性)
结构药物数据没有人口统计学公平性问题,但存在化学/靶点空间代表性公平性——模型对冷门靶点与罕见骨架的系统性低性能:
# 按靶点类别分组报告性能("靶点公平性"审计)
from scipy.stats import pearsonr
audit = (eval_df.groupby("target_class")
.apply(lambda g: pd.Series({
"n": len(g),
"Pearson_R": pearsonr(g.y_true, g.y_pred)[0],
"RMSE": float(np.sqrt(np.mean((g.y_true - g.y_pred) ** 2)))}),
include_groups=False)
.sort_values("n", ascending=False))
print(audit) # 典型现象:kinase/protease R 高,膜蛋白/罕见骨架组 R 低且 n 小
已知差异:热门靶点(n > 100 复合物)上 R 通常比长尾靶点高 0.1-0.3;core set 的 57 簇也不代表库内靶点分布(为梯度亲和力抽样设计)。
§7.6 数据漂移提示
- 部署任何 v2020 训练模型前,应认识其训练分布截止于 2019 年底的 PDB——2020 年后爆发的结构类型(如 SARS-CoV-2 相关复合物、AlphaFold 时代新沉积)不在分布内。
- 监控信号:新数据与训练集的配体 Tanimoto 分布漂移、靶点序列簇覆盖率、pK 分布 PSI。
- 免费版永久冻结于 v2020 意味着"分布新鲜度"是商业版的核心卖点之一;长期项目应规划版本升级或自建增量管线(BioLiP/Q-BioLiP 等可作免费补充源)。
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据为宽格式(每行一个样本/事件) | ✅ | index 每行一个复合物;结构文件每目录一个复合物 |
| 2 | 有唯一标识符列 | ✅ | pdb_id 全局主键 |
| 3 | 无 Unicode 或特殊字符 | ✅ | index 为 ASCII 纯文本;配体名含括号/连字符但规则明确 |
| 4 | 无重复行 | ⚠️ | 同一受体-配体可有多个 PDB 结构(设计性冗余),需自行去重 |
| 5 | 缺失值已识别并编码 | ⚠️ | NMR 分辨率留空等编码未在 README 中系统文档化(本页 §4.5 补全) |
| 6 | 标签列被明确标识 | ✅ | -logKd/Ki 为明确回归靶标,原始字符串保留类型/算符 |
| 7 | 已对罕见类别(<3%)进行分组 | ⚠️ | 长尾靶点未分组;核酸-配体仅 149 条 |
| 8 | 偏倚评估已完成 | ✅ | §7.1 八类偏倚;CASF 泄漏有专文研究 |
| 9 | 有完整的数据字典 | ✅ | README + index 表头注释 + 系列论文 |
| 10 | 对"信息性缺失"有明确编码解释 | ⚠️ | 算符删失、阴性缺失需用户自行理解(本页 §4.5/§6.5 补全) |
| 11 | 数据采集设备和设置已记录 | ⚠️ | 结构来源 PDB 可追溯;亲和力测定条件不系统记录 |
| 12 | 已移除完全共线性变量 | ⚠️ | 原始结构库无变量筛选概念,交由建模方 |
| 13 | 对编码的映射标准已说明 | ✅ | pK = -log₁₀(Kd/Ki, M) 定义明确;配体名映射 PDB 三字母码 |
| 14 | 对时间戳的处理已明确说明 | ✅ | release year 直接可用,时间划分协议成熟 |
| 15 | 训练/验证/测试划分建议已给出 | ⚠️ | 官方仅给质量分层;ML 划分依赖社区协议(CASF/time split/CleanSplit) |
| 16 | 数据泄漏风险已被讨论 | ✅ | 社区文献充分(LP-PDBBind/CleanSplit/OOD),本页 §5.3/坑点 1 |
| 17 | 标签分布已被分析 | ✅ | §4.2 pK/类型/算符/靶点簇分布 |
| 18 | 选择性测量偏倚已被讨论 | ✅ | 阳性偏倚、发表偏倚、测定条件异质(§7.1) |
| 19 | 外部验证建议已给出 | ✅ | §5.5 CSAR/Astex/FEP/v2025 增量 |
| 20 | 数据更新和版本信息已记录 | ✅ | 年度版本 + 各版本条目数公开可查 |
| 21 | 最小必要预处理脚本已提供 | ⚠️ | 官方无代码;社区管道丰富(ProteinShake/TDC/GEMS) |
| 22 | 合规使用要求已明确 | ✅ | 注册协议 + 引用要求;商业版订阅条款明确 |
| 23 | 多模态对齐方法已说明 | ✅ | 结构文件与 index 以 pdb_id 严格一一对应 |
| 24 | 去标识化方法已被记录 | ✅ | 不含人类受试者数据,无需去标识化 |
DAIMS 评分:20 / 24(16 项 ✅ + 8 项 ⚠️)
评分解读:优秀——数据工程规范与社区生态一流,扣分集中在亲和力实验异质性的固有天花板与官方 ML 划分的缺位。
对你意味着什么:PDBbind 的 16 个 ✅ 项来自其二十年打磨的数据工程——一复合物一目录、index 全字段可追溯、质量三层分层、版本条目数全公开。扣分项中有三类需要你在训练前自行补齐:(1) 泄漏控制——官方不给 ML 划分,请直接使用 LP-PDBBind 或 CleanSplit 并断言与 core set 零交集;(2) 标签口径——统一只用 Kd/Ki、剔除非 = 算符样本,IC50 单独处理;(3) 阴性数据——分类/筛选任务必须外接 DUD-E 或 LIT-PCBA。完成这三步,v2020 仍是 2026 年训练 AI 打分函数性价比最高的开放数据集。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源 | 评估任务 | 性能指标 | 相对内部测试集变化 | 关键发现 |
|---|---|---|---|---|---|
| CSAR-NRC HiQ set 1 / set 2 | 加拿大 NRC(工业盲测) | 亲和力回归 | Pearson R 0.768 / 0.800(PIGNet 集成) | 相对 CASF-2016(0.761)持平/略升 | PDBbind 训练模型可迁移到高质量工业盲测集——前提是训练时排除相似复合物 |
| OOD Test(v2020 refined 重构,295 条) | Commun Chem 2025 | 亲和力回归 | OnionNet R 0.57 / Pafnucy R 0.55 / AEV-PLIG R 0.62 | 相对 CASF-2016 下降 0.2-0.26 | 最小化配体/序列/口袋相似度后,所有 SOTA 模型性能骤降——CASF 成绩的外推上限 |
| Ligand Bias 集(365 条,同配体多蛋白) | Durant et al. | 亲和力回归 | 最佳模型 R 0.37(AEV-PLIG) | 大幅下降 | 模型普遍过拟合配体特征、忽视蛋白-配体相互作用 |
| Astex diverse set(85 条) | Astex/剑桥 | 对接 pose + 打分 | 因方法而异 | N/A | 经典正交验证集,常用于 CASF 之外的二次确认 |
| Merck FEP 基准(8 靶点同系物) | Merck | 同系物 ranking | 因方法而异 | N/A | ranking 任务比绝对亲和力更接近工业真实需求 |
| PDBbind v2025 新增条目(2020-2024 PDB) | PDBbind+ | 时间外推回归 | 需订阅验证 | N/A | 免费版模型的天然"未来数据"测试场 |
2026 年还用 v2020 合理吗? 合理——只要你的目标是方法学研究或与既有文献比较,v2020 的事实标准地位(数万篇论文的共同训练集)无可替代;若目标是产业级模型且需要 2021-2024 年新靶点数据,订阅 v2025 或自建 BioLiP/Q-BioLiP 增量管线是正解。两者不冲突:v2020 做基准锚点,新数据做增量训练。
§8 基准性能与生态
§8.1 排行榜(CASF-2016 scoring power)
CASF-2016 是该领域最拥挤的排行榜。以下数值为各论文在晶体 pose、core set 285 条上报告的 Pearson R;训练集口径(refined minus core / general minus core / 泄漏控制集)逐行列出——训练数据不同意味着绝对数值仅近似可比。
| 排名 | 模型 | Pearson R | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | PLANET v2.0 | 0.848 | 2026 | 混合密度网络统计势 + 严格排除训练重叠 | Gao et al., 2026(王任小团队) | PDBbind+ 平台内置 |
| 2 | ResAtom-Score(集成) | 0.833 | 2021 | 3D-CNN 残差网络 + 原子级体素化 | Wang et al., 2021 | — |
| 3 | AEScore | 0.830 | 2020 | 原子环境向量前馈网络 | 见 PIGNet 论文引述 | — |
| 4 | ΔVinaRF20 / OnionNet-2 | 0.816 | 2020/2021 | RF + Vina 原子对项 / 多层接触壳指纹 | Wang & Dokholyan / Wang et al., 2021 | github.com/cchwang/ΔVina 系列 |
| 5 | AK-Score(集成) | 0.812 | 2020 | 3D-CNN 集成 | 见 PIGNet 论文引述 | — |
| 6 | PIGNet(集成) | 0.761 | 2020 | 物理归纳偏置 GNN | Moon et al., 2020, arXiv:2008.12249 | github.com/ACE-KAIST/PIGNet |
| 7 | KDEEP | 0.701 | 2018 | 3D-CNN(8 通道体素) | Jiménez et al., 2018, JCIM 58:287-296 | playmolecule.org |
| 8 | AutoDock Vina(经典基线) | 0.604 | 2010 | 经验打分函数 | Trott & Olson, 2010, J Comput Chem 31:455-461 | github.com/ccsb-scripps/AutoDock-Vina |
| 9 | GlideScore-SP(经典基线) | 0.513 | 2004 | 力场基经验打分 | Friesner et al., 2004, J Med Chem 47:1739-1749 | Schrödinger 商业软件 |
四项能力代表值(同一模型在不同能力上并不一致):
| 能力 | 指标 | 代表模型与数值 |
|---|---|---|
| Scoring | Pearson R | PLANET v2.0 0.848 / ResAtom 0.833 / Vina 0.604 |
| Ranking | 平均 Spearman ρ | PIGNet 0.682 / Vina 0.528 |
| Docking | Top-1 成功率(RMSD<2Å) | DeepRMSD+Vina 95.4% / ΔVinaRF20 89.1% / PIGNet 87.0% / Vina 84.6% |
| Screening | EF1% | PIGNet 19.6 / ChemPLP 11.9 / Vina 7.7 |
阅读排行榜的三个警告:(1) 训练集泄漏程度不同使 0.02-0.05 的 R 差距无统计学意义;(2) CASF-2007/2013/2016 三代 core set 不同,跨代数字不可比;(3) scoring power 高不代表 docking/screening 强——CASF-2016 论文的核心结论正是四能力解耦。
§8.2 SOTA 总结与选型建议
| 如果你… | 推荐方案 | 为什么 |
|---|---|---|
| 写方法学论文需要对标 | refined minus core 训练 + CASF-2016 四项能力全报 | 社区"规定动作",可比性最强 |
| 做能落地的亲和力模型 | CleanSplit/LP-PDBBind 训练 + OOD 测试 + FEP 同系物验证 | 泄漏控制后才接近真实性能 |
| 快速出基线 | ΔVinaRF20 或 RF-Score v3(CPU 可跑) | R 0.80 上下、无需 GPU、代码成熟 |
| 做对接 pose | DiffDock/Gnina + CASF docking power 评测 | 当前 pose 成功率第一梯队 |
| 教学演示 | v2020 refined + §6.1 代码 + RF 基线 | 一节课可跑通完整 pipeline |
§8.3 官方评测协议
CASF-2016 官方协议(Su et al. 2019, JCIM 59:895-913):测试集 = core set 285 条(57 簇 × 5,簇内亲和力差 ≥100 倍);scoring power 用晶体 pose 计算预测分与实验 pKd/pKi 的 Pearson R/SD/RMSE;ranking power 对 57 个靶点分别计算 Spearman ρ 取平均;docking power 用每复合物 ≤100 个 decoy pose,报 Top-1/2/3 中近天然(RMSD < 2 Å)成功率;screening power 对每个靶点用真配体混合随机分子库,报 EF1% 与成功率。基准包(含 decoy 与脚本说明)在 pdbbind.org.cn/casf.php 免费下载。
§8.4 相关数据集
| 数据集 | 关系 | 说明 |
|---|---|---|
| PDBbind v2020.R1 / v2025 | 同库新版 | R1 免费重处理;v2025 商业增量(35,924 条) |
| PDBbind-koff-2020 | 同团队衍生 | 680 复合物解离速率常数 koff(ACS Omega 2022),免费 |
| CASF-2007/2013/2016 | 同库基准 | 195/195/285 条 core set 评测包 |
| Binding MOAD | 同类 | 美国侧结构-亲和力库 |
| BindingDB | 互补 | 大规模亲和力(无复合物 3D) |
| ChEMBL | 互补 | 药物化学活性百科 |
| CSAR / CSAR-NRC HiQ | 外部验证 | 工业盲测集 |
| DUD-E / LIT-PCBA | 互补 | 虚拟筛选阴性/decoy 集 |
| PoseBusters | 互补 | 对接 pose 物理合理性检查集 |
| PLINDER(2024) | 后浪 | 43 万+ 蛋白-配体相互作用实例,带 PLI 标注体系 |
| SKEMPI 2.0 | 邻域 | 蛋白-蛋白突变亲和力 7,085 条 |
§8.5 关键论文 Top 10
- Wang R, Fang X, Lu Y, Wang S (2004), J Med Chem 47:2977-2980. “The PDBbind Database: Collection of Binding Affinities for Protein-Ligand Complexes with Known Three-Dimensional Structures.” — 数据库奠基论文,权威引用入口。DOI: 10.1021/jm030580l
- Wang R, Fang X, Lu Y, Yang C-Y, Wang S (2005), J Med Chem 48:4111-4119. “The PDBbind Database: Methodologies and Updates.” — refined set 概念首立。DOI: 10.1021/jm048957q
- Liu Z et al. (2015), Bioinformatics 31:405-412. “PDB-wide collection of binding data: current status of the PDBbind database.” — 全库方法与状态权威描述。DOI: 10.1093/bioinformatics/btu626
- Liu Z, Su M, Han L, Liu J, Yang Q, Li Y, Wang R (2017), Acc Chem Res 50:302-309. “Forging the basis for developing protein-ligand interaction scoring functions.” — 打分函数数据基础的方法学总结。DOI: 10.1021/acs.accounts.6b00491
- Su M, Yang Q, Du Y, Feng G, Liu Z, Li Y, Wang R (2019), JCIM 59:895-913. “Comparative Assessment of Scoring Functions: The CASF-2016 Update.” — 现行基准定义文,用 CASF 必引。DOI: 10.1021/acs.jcim.8b00545
- Cheng T, Li X, Li Y, Liu Z, Wang R (2009), JCIM 49:1079-1093. “Comparative Assessment of Scoring Functions on a Diverse Test Set.” — CASF 框架开篇(CASF-2007)。DOI: 10.1021/ci800368f
- Li Y, Liu Z, Li J, Han L, Liu J, Zhao Z, Wang R (2014), JCIM 54:1700-1716. CASF-2013 测试集构建文——refined/core 现行筛选规则的完整出处。DOI: 10.1021/ci500081w
- Buttenschoen M et al. (2023), “Leak Proof PDBBind”, arXiv:2308.09639. — 数据泄漏问题的系统量化与重组织训练集。
- Trott O, Olson AJ (2010), J Comput Chem 31:455-461. AutoDock Vina——经典基线与 decoy 事实标准。DOI: 10.1002/jcc.21334
- Ballester PJ, Mitchell JBO (2010), Bioinformatics 26:1169-1175. RF-Score——机器学习打分函数谱系的起点。DOI: 10.1093/bioinformatics/btq112
§8.6 社区活跃度
| 维度 | 数据 |
|---|---|
| Wang 2004 原始论文引用 | OpenAlex 810 / Europe PMC 696(截至 2026-09;Google Scholar 口径更高) |
| 系列论文合计引用(OpenAlex) | 3,450+:Wang 2004(810)+ Wang 2005(651)+ Cheng 2009(414)+ Liu 2015(410)+ Liu 2017(339)+ Su 2019(535)+ Li 2014(294)(截至 2026-09) |
| 注册用户 | 遍布 70+ 国家(PDBbind+ 官方表述) |
| 文献核查量 | 累计 >58,000 篇原始文献(v2025 口径) |
| 使用密度 | 几乎所有 AI 打分函数/对接论文的训练或评测集(RF-Score 至 PLANET 谱系) |
| 年度更新 | 2004-2020 免费年度更新;v2021+ 商业订阅年度更新 |
§8.7 生态快照
| 资源 | 类型 | 链接 | Star/状态(截至 2026-09) | 为什么值得关注 |
|---|---|---|---|---|
| PDBbind-CN | 官方主页 | http://www.pdbbind.org.cn/ | 活跃(冻结于 v2020) | 免费版唯一官方入口;在线浏览 3D 复合物 |
| PDBbind+ | 官方平台 | https://www.pdbbind-plus.org.cn/ | 活跃 | 商业版 + v2020.R1 免费重处理 + COMET/PLANET/STELLAR 在线工具 |
| CASF 基准包 | 排行榜/基准 | http://www.pdbbind.org.cn/casf.php | 免费 | 打分函数评测"标准考卷" |
| GEMS / CleanSplit | 工具库 | https://github.com/camlab-ethz/GEMS | 活跃 | 泄漏控制训练集 + 等变 GNN 实现 |
| LP-PDBBind | 数据集修复 | https://github.com/BioinfoMachineLearning/(见 arXiv:2308.09639) | 活跃 | 泄漏量化论文的配套重划分 |
| ProteinShake | 工具库 | https://github.com/BorgwardtLab/proteinshake | 活跃 | 一键将 PDBbind 转为图/体素/点云张量 |
| TDC | 工具库 | https://github.com/mims-harvard/TDC | 2,000+ | 治疗数据科学统一加载器,含 PDBbind |
| AutoDock Vina / smina / gnina | 对接工具 | github.com/ccsb-scripps/AutoDock-Vina | 4,000+ | 经典基线与 decoy 生成事实标准 |
| PLINDER | 后继数据集 | https://github.com/plinder-org/plinder | 活跃 | 2024 年大规模 PLI 后浪,含泄漏感知划分设计 |
§9 相关资源与引用
官方资源
- PDBbind-CN(免费版 v2020):http://www.pdbbind.org.cn/
- PDBbind-CN 下载页:http://www.pdbbind.org.cn/download.php
- PDBbind+(商业版 + v2020.R1 免费包):https://www.pdbbind-plus.org.cn/
- CASF 基准:http://www.pdbbind.org.cn/casf.php
- PDBbind-koff-2020:PDBbind-CN 下载页(DOI: 10.1021/acsomega.2c02156)
BibTeX 引用
% 1) 数据库原始论文(使用 PDBbind 必引)
@article{wang2004pdbbind,
title={The PDBbind database: collection of binding affinities for
protein-ligand complexes with known three-dimensional structures},
author={Wang, Renxiao and Fang, Xueliang and Lu, Yipin and Wang, Shaomeng},
journal={Journal of Medicinal Chemistry},
volume={47}, number={12}, pages={2977--2980}, year={2004},
doi={10.1021/jm030580l}
}
% 2) 方法与更新(refined set 出处)
@article{wang2005pdbbind,
title={The PDBbind database: methodologies and updates},
author={Wang, Renxiao and Fang, Xueliang and Lu, Yipin and Yang, Chao-Yie and Wang, Shaomeng},
journal={Journal of Medicinal Chemistry},
volume={48}, number={12}, pages={4111--4119}, year={2005},
doi={10.1021/jm048957q}
}
% 3) 全库状态报告(v2013 时代方法权威描述)
@article{liu2015pdbbind,
title={PDB-wide collection of binding data: current status of the PDBbind database},
author={Liu, Zhihai and Li, Yan and Han, Li and Li, Jie and Liu, Jie and Zhao, Zhixiong and Nie, Wei and Liu, Yuchen and Wang, Renxiao},
journal={Bioinformatics},
volume={31}, number={3}, pages={405--412}, year={2015},
doi={10.1093/bioinformatics/btu626}
}
% 4) 使用 CASF-2016 基准必引
@article{su2019casf,
title={Comparative Assessment of Scoring Functions: The CASF-2016 Update},
author={Su, Minyi and Yang, Qifan and Du, Yu and Feng, Guoqin and Liu, Zhihai and Li, Yan and Wang, Renxiao},
journal={Journal of Chemical Information and Modeling},
volume={59}, number={2}, pages={895--913}, year={2019},
doi={10.1021/acs.jcim.8b00545}
}
% 5) 打分函数数据基础方法学(深度引用推荐)
@article{liu2017forging,
title={Forging the basis for developing protein-ligand interaction scoring functions},
author={Liu, Zhihai and Su, Minyi and Han, Li and Liu, Jie and Yang, Qifan and Li, Yan and Wang, Renxiao},
journal={Accounts of Chemical Research},
volume={50}, number={2}, pages={302--309}, year={2017},
doi={10.1021/acs.accounts.6b00491}
}
教程与学习资源
- PDBbind-CN 在线浏览/搜索教程:网站 BROWSE 与 SEARCH 页自带示例
- GEMS 仓库的 PDBbind 数据管道文档(含 CleanSplit 过滤流程):github.com/camlab-ethz/GEMS
- ProteinShake 数据集加载示例:proteinshake.readthedocs.io
- TDC PDBbind loader 文档:tdcommons.ai
原始论文
- Wang R et al. (2004). J Med Chem 47:2977-2980. DOI: 10.1021/jm030580l. PMID: 15163179.
- Wang R et al. (2005). J Med Chem 48:4111-4119. DOI: 10.1021/jm048957q. PMID: 15943484.
- Liu Z et al. (2015). Bioinformatics 31:405-412. DOI: 10.1093/bioinformatics/btu626. PMID: 25301850.
- Liu Z et al. (2017). Acc Chem Res 50:302-309. DOI: 10.1021/acs.accounts.6b00491. PMID: 28182403.
- Su M et al. (2019). JCIM 59:895-913. DOI: 10.1021/acs.jcim.8b00545. PMID: 30481020.
- Liu H, Su M, Lin H-X, Wang R, Li Y (2022). ACS Omega 7:26160-26169(PDBbind-koff-2020). DOI: 10.1021/acsomega.2c02156.
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| deep-model(WorkBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch(多源检索) | 2026-09-05 | 6 组检索:版本规模核实、三集划分、商业化与下载流程、引用量快照、CASF 协议与排行榜、泄漏坑点文献 |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从 PDBbind-CN/PDBbind+ 官方页面、Wang 2004/Liu 2015/Su 2019 等原始论文与社区资源中整理结构化信息;(2) 生成 §6 的 Python/RDKit/PyG 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
§10.3 输入来源
- Wang et al. (2004), J Med Chem 47:2977-2980(DOI: 10.1021/jm030580l;PubMed 摘要核实首版规模 1,359)
- Wang et al. (2005), J Med Chem 48:4111-4119(DOI: 10.1021/jm048957q)
- Liu et al. (2015), Bioinformatics 31:405-412(DOI: 10.1093/bioinformatics/btu626)
- Liu et al. (2017), Acc Chem Res 50:302-309(DOI: 10.1021/acs.accounts.6b00491)
- Su et al. (2019), JCIM 59:895-913(CASF-2016;PMID 30481020)
- PDBbind-CN 官网(pdbbind.org.cn:免费范围、License、下载流程)
- PDBbind+ 官网与下载页(pdbbind-plus.org.cn:v2021+ 商业化、v2020.R1 免费包、v2024/v2025 条目数与文件大小、demo 用户权限)
- PDBbind v2025 发布新闻(2025-02,陶术生物渠道:35,924 条、四大类构成、58,000+ 文献核查、70+ 国家用户)
- Frontiers fbinf.2022.885983 综述(refined/core 筛选标准、CASF 三代演进、v2020 条目数复核)
- Buttenschoen et al., Leak Proof PDBBind(arXiv:2308.09639 / PMC10462179:泄漏量化)
- GEMS / CleanSplit 文档(camlab-ethz/GEMS:泄漏过滤阈值与训练集 19,500→12,000)
- Commun Chem 2025(s42004-025-01428-y:AEV-PLIG OOD 测试与 CASF 污染讨论)
- PIGNet 论文(arXiv:2008.12249:CASF-2016 排行榜 Table 1、CSAR-NRC HiQ 外部验证)
- emergentmind CASF-2016 专题(四能力定义、PLANET v2.0/ResAtom/ΔVinaRF20 数值汇编)
- Rankless / Europe PMC(OpenAlex 引用量快照,截至 2026-09)
- ProteinShake 源码(INDEX_refined_data.2020 表头与 5,316 条目数复核)
- mmCIF2BioLiP 技术笔记(下载文件名与结构文件工程细节)
- bio.tools / Wikipedia PDBbind 条目(历史沿革、2008 四类扩展、注册条款复核)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 药物发现背景(靶点-疾病映射、金标准分层) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(版本条目数、版本矩阵) | 千方病案医学编辑部 | 与 PDBbind-CN/PDBbind+ 官方页面交叉比对 | ✅ 已验证 |
| §4 数据结构(index 字段、目录树) | 千方病案医学编辑部 | 与官方 README 及 ProteinShake 解析实现交叉比对 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与 LP-PDBBind/GEMS 文献比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 排行榜与引用数表述 | 千方病案医学编辑部 | 与原文及 OpenAlex/Europe PMC 快照交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema v3.9 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.1-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
