信息速览

INFOBOX
| 属性 | 值 |
|---|---|
| 数据集名称 | ZINC(ZINC Is Not Commercial) |
| 当前版本 | ZINC-22(2023 年发表) |
| 维护机构 | Irwin & Shoichet Laboratories, UCSF |
| 化合物总量 | 超过 375 亿(ZINC-22, 2023),持续增长中 |
| 可购买化合物 | 约 15 亿(ZINC20 in-stock + make-on-demand) |
| 供应商数量 | 150+ 供应商,310+ 产品目录 |
| 数据格式 | SMILES, mol2, SDF, pdbqt, db2 (flexibase) |
| 搜索工具 | SmallWorld(相似性)、Arthor(子结构)、CartBlanche(GUI)、TLDR(3D 构建) |
| 云端部署 | AWS Open Data, Oracle OCI, Globus |
| 许可证 | 免费使用;大量再分发需 John Irwin 书面授权 |
| 基金 | NIGMS GM71896(ZINC12-20), GM133836(ZINC-22), NERSC |
| 主要 DOI | 10.1021/acs.jcim.2c01253(ZINC-22) |
| 官网 | cartblanche22.docking.org |
| AI 就绪度 | DAIMS 16/24 ⭐⭐⭐⭐ |
| 数据模态 | 2D 分子结构 (SMILES) + 3D 构象 (mol2/SDF/pdbqt/db2) |
| 更新频率 | 持续更新(90/90/90 规则:90% 目录每 90 天更新,90%+ 化合物可购买) |
| DUO 标签 | 无标准 DUO 标签(非生物/临床数据) |
| 核心用途 | 虚拟筛选、分子对接、配体发现、SAR-by-catalog、ML 分子预训练 |
§0 E-E-A-T 信任声明与免责声明
信任声明
| 信任维度 | 声明 |
|---|---|
| 专业知识 (Expertise) | ZINC 由 UCSF 制药化学系 John J. Irwin 博士和 Brian K. Shoichet 教授实验室开发维护。Irwin 是计算化学和化学信息学领域的资深研究者,Shoichet 是分子对接和虚拟筛选的先驱(DOCK 软件共同开发者)。实验室在 Nature、Science、JCIM 等顶级期刊发表 200+ 篇虚拟筛选相关论文。 |
| 权威性 (Authoritativeness) | ZINC 是全球使用最广泛的免费虚拟筛选化合物数据库,被 58,000+ 篇论文引用。DUD-E 基准集(从 ZINC 提取 decoys)成为分子对接评估的标准。ZINC-22 JCIM 论文被引 100+ 次。 |
| 可信性 (Trustworthiness) | 数据策展遵循 90/90/90 规则(90% 目录每 90 天更新,90%+ 化合物可购买)。开源代码(GitHub docking-org/)。云端镜像(AWS/OCI/Globus)确保数据可及性。20 年持续运营(2005-2026)。 |
| 透明性 (Transparency) | 所有版本论文公开发表(2005, 2012, 2015, 2020, 2023)。搜索算法(SmallWorld、Arthor)技术细节完整披露。供应商目录公开可查。数据更新统计每周发布。 |
| 审核机制 | [千方病案医学编辑部]交叉审核:数据集元数据、技术参数、许可证信息、API 文档、基准结果。 |
免责声明
本页面信息基于 ZINC 官方网站、JCIM 发表论文及公开技术文档整理。ZINC 数据库不保证任何分子适用于任何特定目的,对使用该数据库产生的错误不承担责任。化合物可购买性信息可能随时变化,请以供应商最新目录为准。本百科不构成药物推荐或医疗建议。
页面状态
published — 本页面已发布,内容可供搜索引擎索引和 AI 引擎引用。
§1 数据集概览(Overview)
§1.0 📌 30秒速览(Executive Summary)
ZINC 是全球最大、最广泛使用的免费可购买化合物虚拟筛选数据库。以下是核心要点:
- 规模:ZINC-22 包含超 375 亿化合物,其中约 4 百万为现货(in-stock),数十亿来自按需合成库(Enamine REAL、WuXi GalaXi、Mcule)
- 速度:SmallWorld 相似性搜索可在 1-2 秒内检索 1,660 亿分子;Arthor 子结构匹配可在 1-2 秒内搜索 10 亿分子
- 可用性:所有化合物可购买 — 现货 ~$30-100/个,按需合成 ~$65-100/个(3-4 周交付,>80% 成功率)
- 格式:2D SMILES + 3D ready-to-dock(mol2, SDF, pdbqt, db2),预计算构象、电荷和溶剂化能
- 子集:drug-like(Lipinski)、lead-like(MW 150-350)、fragment-like(MW <250)
- 成本:完全免费使用和下载
- 许可:免费使用,但大量再分发需书面授权(非标准开源许可)
- 历史:2005 年创立(72 万化合物)→ 2012 ZINC12(3500 万)→ 2015 ZINC15(5 亿+)→ 2020 ZINC20(14 亿)→ 2023 ZINC22(375 亿+)
§1.1 摘要
ZINC 由 UCSF 制药化学系 Irwin & Shoichet 实验室开发,是一个专注于可购买化合物的免费数据库,专为虚拟筛选和药物发现设计。ZINC 的核心价值主张是:每个分子都可以买到,使计算筛选结果可直接转化为实验验证。
ZINC 的独特之处在于:
- 生物学相关表示:所有分子以生理 pH 7.4 质子化状态表示,而非任意中性形式
- 3D Ready-to-Dock 格式:预计算构象、MMFF94 部分原子电荷和溶剂化能,可直接用于 DOCK 对接
- Tranche 系统:按分子量(MW)和 LogP 二维网格组织化合物,便于定向下载特定属性空间
- 超大规模搜索:SmallWorld(图编辑距离)和 Arthor(SMARTS 匹配)突破传统指纹搜索的线性扩展瓶颈
- 按需合成革命:与 Enamine 合作整合 REAL Space(94.5B 化合物),使可筛选化学空间扩大 1,000 倍
ZINC 的里程碑成就包括:2019 年 Lyu 等人在 Nature 发表的超大规模对接研究,从 1.7 亿化合物中发现 AmpC β-内酰胺酶 77 nM 抑制剂和 D4 多巴胺受体 180 pM 激动剂——后者是迄今报道的最强 D4 受体激动剂之一。
§1.2 为什么重要
ZINC 在药物发现和 AI 分子科学中的重要性体现在以下维度:
| 维度 | 影响 |
|---|---|
| 化学空间覆盖 | 从 72 万到 375 亿化合物,20 年增长 50,000 倍。按需合成库使可筛选化学空间从 ~10^7 扩展到 ~10^11 |
| 可直接验证 | 每个分子可购买,计算筛选→实验验证周期从数月缩短到数周(按需合成 3-4 周交付) |
| 多样性突破 | 97%+ 按需合成库骨架在现货库中不存在;骨架多样性随分子数 O(√N) 增长 |
| 搜索效率革命 | SmallWorld 和 Arthor 使十亿级分子搜索从分钟级降至秒级,实现真正交互式探索 |
| ML 数据来源 | ZINC-Curated(HuggingFace 4.27 亿 SMILES)成为分子语言模型预训练标准数据源 |
| 基准测试基础设施 | DUD-E/DUDE-Z 基准(decoys 来自 ZINC)是全球分子对接评估的事实标准 |
| 药物发现引擎 | 基于 ZINC 的超大规模对接已发现多个纳米级和皮摩尔级活性化合物 |
§1.3 与同类数据库对比
| 特性 | ZINC-22 | PubChem | ChEMBL | DrugBank | Enamine REAL |
|---|---|---|---|---|---|
| 化合物数量 | 375B+ | 1.19 亿 | 250 万 | 1.19 万 | 94.5B |
| 可购买 | ✅ 全部 | ❌ 部分 | ❌ 部分 | ✅ 药物 | ✅ 全部 |
| 生物活性 | ❌ 无 | ✅ 2.95 亿 | ✅ 2,000 万 | ✅ 5.54 万 | ❌ 无 |
| 3D 格式 | ✅ Ready-to-dock | ✅ PubChem3D | ❌ 2D 为主 | ❌ 2D 为主 | ❌ 需自建 |
| 许可证 | 免费(再分发受限) | 公共领域 | CC BY-SA 3.0 | CC BY-NC 4.0 | 商业 |
| 搜索速度 | SmallWorld 1-2s/100B | PUG-REST 5 req/s | Web 接口 | Web 接口 | infiniSee 2-4 min |
| 对接优化 | ✅ 核心设计目标 | ❌ 附加功能 | ❌ 无 | ❌ 无 | ❌ 无 |
| ML 基准 | DUD-E/DUDE-Z | PCBA/MUV | 15 周年基准 | DDI 预测 | 无 |
| 供应商整合 | ✅ 150+ 供应商 | ❌ 无 | ❌ 无 | ❌ 无 | ✅ 自有 |
| 基金 | NIGMS | NIH | Wellcome/EMBL | CIHR/NSERC | 商业 |
§1.4 时间轴
| 时间 | 里程碑 | 化合物数 | 论文 |
|---|---|---|---|
| 2005-01 | ZINC 首次发布;10 家供应商,SMILES/mol2/SDF 格式 | 727,842 | Irwin & Shoichet, JCIM 2005, 45(1):177-82 |
| 2012-07 | ZINC12 发布;200+ 目录,100+ 供应商;引入 tranche 系统 | 35,000,000 | Irwin et al., JCIM 2012, 52(7):1757-68 |
| 2012-06 | DUD-E 基准集发布;102 靶点,22,886 配体,110 万 decoys | — | Mysinger et al., J Med Chem 2012, 55(14):6582-94 |
| 2015-06 | ZINC15 发布;RESTful API,5 亿+ 化合物 | 500,000,000+ | Sterling & Irwin, JCIM 2015, 55(11):2324-37 |
| 2018-Q1 | Enamine REAL Space 首次整合到 ZINC | 1.2 亿 REAL | — |
| 2019-02 | Nature 超大规模对接:1.7 亿化合物 → AmpC 77nM + D4 180pM | 1.7 亿对接 | Lyu et al., Nature 2019, 566:224-29 |
| 2020-12 | ZINC20 发布;14 亿化合物;SmallWorld + Arthor 搜索 | 1,400,000,000 | Irwin et al., JCIM 2020, 60(12):6065-73 |
| 2021-02 | DUDE-Z 基准发布;property-unmatched decoys | — | Stein et al., JCIM 2021 |
| 2022-10 | ZINC-22 预印本;370 亿化合物;CartBlanche 界面 | 37,000,000,000 | Tingle et al., JCIM 2023, 63(4):1166-76 |
| 2023-02 | ZINC-22 正式发表;5 个源目录 | 37,000,000,000 | Tingle et al., JCIM 2023 |
| 2024-2026 | ZINC-22 持续增长(~300M/月);REAL Space 达 94.5B | 100B+ (含 REAL) | — |
§1.5 典型用例
| 用例 | 描述 | 典型规模 |
|---|---|---|
| 超大规模对接 | 对十亿级化合物进行分子对接筛选,发现新化学型 | 1.7 亿 - 10 亿分子 |
| SAR-by-catalog | 以已知活性化合物为起点,搜索可购买类似物进行构效关系研究 | 1,000 - 10,000 类似物 |
| 子集下载对接 | 下载 lead-like/fragment-like 子集进行本地对接 | 100 万 - 1,000 万分子 |
| 相似性搜索 | 用 SmallWorld 快速在全库中找到最相似的 100 个类似物 | 375 亿分子中 1-2 秒 |
| 子结构筛选 | 用 Arthor SMARTS 模式匹配特定药效团或骨架 | 10 亿分子中 1-2 秒 |
| ML 预训练 | 下载 ZINC SMILES 子集训练分子语言模型 | 4.27 亿 SMILES (ZINC-Curated) |
| DUD-E 对接评估 | 使用 ZINC-derived decoys 评估对接方法区分配体和 decoys 的能力 | 102 靶点 × ~1 万分子/靶 |
| 片段筛选 | 下载 fragment-like 子集进行片段基药物设计 | ~45 万分子 |
§2 医学背景(Medical Context)
§2.1 化合物分类与编码映射
ZINC 专注于可购买化合物,不直接包含 ICD-11 或 SNOMED CT 临床编码。但其化合物可通过以下标准编码体系与医学领域关联:
| 编码体系 | 映射方式 | 用途 |
|---|---|---|
| ATC (Anatomical Therapeutic Chemical) | ZINC15 支持 ATC 代码浏览;FDA 获批药物子集包含 ATC 分类 | 药物治疗分类 |
| ChEMBL | ZINC 与 ChEMBL 交叉引用;ChEMBL 活性化合物可通过 ZINC ID 查找可购买类似物 | 生物活性数据 |
| PubChem CID | ZINC 化合物可通过 InChIKey 与 PubChem 交叉引用 | 化学结构标准化 |
| DrugBank | ZINC FDA 获批药物子集(94 种内源性代谢物、获批药物)可与 DrugBank 关联 | 药物信息 |
| UniProt | ZINC15 支持按基因/靶点浏览化合物(通过 ChEMBL 注释) | 靶点-配体关系 |
| PDB | ZINC15 包含 1,600+ 靶点的已知配体,可关联 PDB 结构 | 结构生物学 |
§2.2 化合物策展标准
ZINC 的策展遵循严格的生物学相关性原则:
纳入标准:
- 可购买(in-stock 或 make-on-demand)
- 适用于虚拟筛选的生物学相关小分子
- 符合 MMFF94 力场参数要求(排除金属、硼、硅)
- 分子量范围:60-600 Da
排除标准:
- 过氧化物、大肽、高度活泼试剂、构建块
- 含金属、硼、硅的分子(无 MMFF94 参数)
- 大型不溶性分子
- 某些药物(如顺铂,因不适用于虚拟筛选)
质子化与互变异构:
- 所有分子以生理 pH 7.4 的质子化状态表示
- 使用 CORINA 进行互变异构归一化
- 使用 OpenEye QuacPac 计算部分原子电荷
3D 构象生成:
- OpenEye OMEGA 生成 3D 构象
- MMFF94 力场优化
- 溶剂化能(SEV, solvent-excluded volume)预计算
- 典型分子生成 1-100 个构象
§2.3 可购买性分级
| 级别 | 标识 | 描述 | 成功率 | 交付时间 |
|---|---|---|---|---|
| In-stock | agent |
现货化合物,直接从供应商或采购代理购买 | ~90% | 1-2 周 |
| Make-on-demand | wait-ok |
按需合成(含 in-stock),来自 Enamine REAL 等 | ~80% | 3-4 周 |
| Annotated | — | 非可购买但已注释(ChEMBL 来源等) | N/A | N/A |
§2.4 标准编码映射
| 编码 | ZINC 中的标识 | 示例 |
|---|---|---|
| ZINC ID | ZINC000000000001 |
全局唯一标识符 |
| SMILES | Canonical SMILES | CC(=O)OC1=CC=CC=C1C(=O)O(阿司匹林) |
| InChIKey | 标准化学标识哈希 | BSYNRYMUTXBXSQ-UHFFFAOYSA-N |
| 供应商代码 | 如 ENAMINE-Z12345678 |
用于直接向供应商下单 |
| ATC 代码 | 如 N02BA01(阿司匹林) |
通过 ZINC15 ATC 浏览器 |
§3 数据集规格(Specifications)
§3.0 版本抉择矩阵
| 版本 | 发布年份 | 化合物数 | 核心创新 | 推荐使用场景 | 状态 |
|---|---|---|---|---|---|
| ZINC | 2005 | 727K | 原始版本,10 家供应商 | 历史参考 | 维护停止 |
| ZINC12 | 2012 | 35M | Tranche 系统,200+ 目录 | 历史子集参考 | 维护停止 |
| ZINC15 | 2015 | 500M+ | RESTful API,基因/ATC 浏览 | 中等规模筛选 | 维护停止 |
| ZINC20 | 2020 | 1.4B | SmallWorld + Arthor;14 亿化合物 | 中等规模对接,in-stock 筛选 | 仍可访问 |
| ZINC-22 | 2023 | 37B+ | CartBlanche;多十亿按需合成 | 超大规模对接,配体发现 | 当前活跃版本 |
版本选择建议:
- 新项目:直接使用 ZINC-22(cartblanche22.docking.org)
- 中等规模对接(<1 亿分子):ZINC20 in-stock + make-on-demand 子集
- 需要 ATC/基因注释浏览:ZINC15(功能仍可访问)
- 需要 DUD-E 对接评估:DUD-E 基准集(源自 ZINC12/15)
- ML 预训练:ZINC-Curated(HuggingFace, 源自 ZINC-22)
§3.1 数据模态
| 模态 | 格式 | 描述 | 覆盖范围 |
|---|---|---|---|
| 2D 结构 | SMILES | Canonical SMILES(生理 pH 质子化) | 全部 375B+ 化合物 |
| 3D 构象 | mol2 | Ready-to-dock 3D,MMFF94 参数化 | in-stock ~4M + 按需构建 |
| 3D 构象 | SDF | MDL 结构数据文件 | in-stock ~4M |
| 3D 构象 | pdbqt | AutoDock 兼容格式 | in-stock ~4M |
| 3D 构象 | db2 (flexibase) | DOCK 3.x 兼容格式,含构象系综 | in-stock ~4M |
| 供应商注释 | CSV/JSON | 供应商代码、价格、可购买性、目录信息 | 全部化合物 |
§3.2 化合物子集(Subsets)
ZINC 提供预设子集,按药物化学经验法则筛选:
| 子集 | 规则 | 化合物数(ZINC20) | 推荐用途 |
|---|---|---|---|
| Drug-like | Lipinski 五规则(MW ≤500, LogP ≤5, HBD ≤5, HBA ≤10) | ~8.8M (ZINC12) / ~100M+ (ZINC20) | 初步广筛 |
| Lead-like | MW 150-350, LogP <4, HBD ≤3, HBA ≤6 | ~3.4M (ZINC12) / ~20M+ (ZINC20) | 对接筛选首选(推荐) |
| Fragment-like | MW <250, LogP -2~3, HBD <3, HBA <6, rotatable bonds <3 | ~450K (ZINC12) / ~2M+ (ZINC20) | 片段基药物设计 |
| In-stock | 当前有库存可直接购买 | ~3-4M | 快速实验验证 |
| Make-on-demand | 按需合成(Enamine REAL, WuXi, Mcule) | ~37B+ | 超大规模探索 |
| FDA approved | FDA 获批药物 | ~2,000+ | 药物重定位 |
| Natural products | 天然产物 | ~50,000+ | 天然产物筛选 |
| Biogenic | 内源性代谢物 | ~47,319 (人类) | 代谢组学 |
| Annotated | 有 ChEMBL 注释的活性化合物 | ~200,000+ | 靶点-配体关联 |
§3.3 Tranche 系统
ZINC 将化合物按分子量(MW)和LogP二维网格组织为"Tranches":
Tranche 行(MW):
| 行 | MW 范围 (Da) | 典型用途 |
|---|---|---|
| A | 200-250 | 片段-like |
| B | 250-300 | 片段/Lead 边界 |
| C | 300-350 | Lead-like 核心 |
| D | 350-400 | Lead-like/Drug 边界 |
| E | 400-450 | Drug-like |
| F | 450-500 | Drug-like 上限 |
| G-K | 500-600 | 超出 Lipinski |
Tranche 列(LogP):
| 列 | LogP 范围 | 亲脂性 |
|---|---|---|
| A | -4 to -3 | 极亲水 |
| B | -3 to -2 | 亲水 |
| C-E | -2 to 1 | 中等亲水 |
| F-H | 1 to 3 | 中等亲脂 |
| I-J | 3 to 6 | 亲脂 |
Tranche 下载方式:
- 每个 Tranche 可独立下载(SMILES/mol2/SDF/pdbqt/db2)
- 按电荷状态进一步细分(中性/正电/负电/两性)
- 推荐下载 lead-like tranche(MW C-D × LogP C-F)用于大多数对接项目
§3.4 下载格式与大小
| 格式 | 每百万分子大小 | 典型 Tranche 大小 | 描述 |
|---|---|---|---|
| SMILES | ~100 MB | ~1-5 GB | 2D 结构,最小 |
| SDF | ~1 GB | ~10-50 GB | 2D/3D 结构 + 属性 |
| mol2 | ~1.6 GB | ~16-80 GB | 3D,含原子类型 |
| pdbqt | ~1 GB | ~10-50 GB | AutoDock 格式 |
| db2 | ~40 GB | ~400 GB-2TB | DOCK flexibase,含构象系综 |
ZINC-22 总数据量估算:
- 2D SMILES(全库):~500 GB
- 3D mol2(in-stock ~4M):~6.4 TB
- 3D db2(in-stock ~4M):~160 TB
§3.5 策展流程(Curation Pipeline)
ZINC 的数据策展遵循严格的流水线:
供应商目录 → 结构提取 → CORINA 标准化 → 互变异构归一化
↓
质子化 (pH 7.4) → 活性过滤 → 反应性过滤 (PAINS/共价/金属)
↓
属性计算 (MW, LogP, HBD, HBA, TPSA, rotatable bonds)
↓
3D 构象生成 (OpenEye OMEGA) → MMFF94 电荷 → SEV 溶剂化能
↓
Tranche 分箱 (MW × LogP 网格) → 目录注释 → 可购买性标记
↓
云端上传 (AWS/OCI/Globus) → 索引构建 (SmallWorld/Arthor)
90/90/90 策展规则:
- 超过 90% 的供应商目录每 90 天更新一次
- 90% 以上的化合物标注为可购买
- 每周典型更新量:100,000 新分子 + 10,000 修复 + 80,000 标记"已耗尽"
§3.6 许可证
ZINC 许可证(非标准开源许可证):
| 方面 | 条款 |
|---|---|
| 个人使用 | ✅ 免费,任何人可使用和下载 |
| 学术研究 | ✅ 免费,可用于学术研究 |
| 商业使用 | ✅ 允许(数据库界面和搜索工具可免费用于商业目的) |
| 大量再分发 | ❌ 禁止,需 John Irwin 书面授权 |
| 衍生作品 | ⚠️ 子集再分发需授权;使用 ZINC 进行筛选并发表论文无需授权 |
| 引用要求 | 必须引用相应版本论文 |
| 保证 | 无任何保证,使用风险自负 |
联系授权: John Irwin (chemistry4biology at gmail dot com)
与其他数据库许可证对比:
| 数据库 | 许可证 | 商业使用 | 再分发 |
|---|---|---|---|
| ZINC | 自定义(免费使用,再分发需授权) | ✅ | ❌ 需授权 |
| PubChem | 公共领域 (U.S. Government Work) | ✅ | ✅ 无限制 |
| ChEMBL | CC BY-SA 3.0 | ✅ | ✅ 需同许可 |
| DrugBank | CC BY-NC 4.0 / CC0 (部分) | ⚠️ 受限 | ⚠️ 受限 |
§3.7 溯源链
| 层级 | 来源 | 验证方式 |
|---|---|---|
| 化合物结构 | 供应商提供的 SMILES/SDF | CORINA 标准化 + InChIKey 去重 |
| 可购买性 | 供应商实时目录 | 90/90/90 规则(季度更新) |
| 生物活性注释 | ChEMBL(非 ZINC 自有) | ChEMBL 策展流程 |
| 靶点关联 | ChEMBL/UniProt(via ZINC15 基因浏览) | 外部数据库验证 |
| 3D 构象 | OpenEye OMEGA 生成 | MMFF94 力场验证 |
| 属性计算 | molinspiration MiTools / ChemAxon | 参考数据集校准 |
§3.8 基金来源
| 资助机构 | 基金编号 | 支持版本 | 用途 |
|---|---|---|---|
| NIGMS (NIH) | GM71896 | ZINC12, ZINC15, ZINC20 | 数据库开发和维护 |
| NIGMS (NIH) | GM133836 | ZINC-22 | 超大规模扩展和新搜索工具 |
| NERSC (DOE) | DE-AC02-05CH11231 | ZINC-22 | 超级计算资源 |
| OpenEye Scientific | 软件许可 | 全版本 | OMEGA, OEChem, QuacPac |
| molinspiration | 软件许可 | 全版本 | MiTools (LogP, 反应性过滤) |
| ChemAxon | 软件许可 | 全版本 | JChem (属性计算) |
| NextMove Software | 软件许可 | ZINC20+ | Arthor, SmallWorld |
§4 数据结构详解(Data Schema)
§4.1 ZINC 数据模型
ZINC 采用分层式数据组织,从供应商目录到 3D 分子表示:
ZINC Database
├── Catalogs (供应商目录)
│ ├── Purchasable catalogs (可购买)
│ │ ├── In-stock (现货: Enamine stock, MolPort, eMolecules, ...)
│ │ └── Make-on-demand (按需: Enamine REAL, WuXi GalaXi, Mcule Ultimate)
│ └── Annotated catalogs (注释: ChEMBL, FDA drugs, natural products)
│
├── Substances (物质条目)
│ ├── ZINC ID (全局唯一标识符)
│ ├── SMILES (生理 pH 质子化)
│ ├── InChIKey (标准标识符)
│ ├── Supplier code (供应商代码)
│ ├── Purchasability level (可购买性: agent/wait-ok/annotated)
│ ├── Price (价格)
│ └── Catalog references (目录引用)
│
├── 3D Properties (3D 属性, in-stock 子集)
│ ├── Conformations (3D 构象, OpenEye OMEGA)
│ ├── Partial atomic charges (MMFF94)
│ ├── Desolvation energy (SEV)
│ ├── cLogP (molinspiration)
│ └── Formal charge (pH 7.4)
│
├── Tranches (属性分箱)
│ ├── Row (MW: A-K, 200-600 Da)
│ ├── Column (LogP: A-J, -4 to 6)
│ └── Charge subset (neutral/positive/negative/zwitterion)
│
└── Search Indices (搜索索引)
├── SmallWorld (匿名图索引, 相似性搜索)
└── Arthor (二进制分子表示, 子结构搜索)
§4.2 DAIMS 标准化数据字典
以下按 DAIMS (Datasheets for AI and Medical Datasets) 框架描述 ZINC 关键数据字段:
| 字段名 | 类型 | 描述 | 示例值 |
|---|---|---|---|
zinc_id |
Text | ZINC 唯一标识符 | ZINC000000000001 |
smiles |
Text | 生理 pH 质子化 SMILES | CC(=O)OC1=CC=CC=C1C(=O)O |
inchikey |
Text | InChIKey 标识符 | BSYNRYMUTXBXSQ-UHFFFAOYSA-N |
molecular_weight |
Float | 分子量 (Da) | 180.16 |
logp |
Float | 计算脂水分配系数 (miLogP) | 1.19 |
ha_count |
Integer | 重原子数 | 13 |
hbd |
Integer | 氢键供体数 | 1 |
hba |
Integer | 氢键受体数 | 4 |
rotatable_bonds |
Integer | 可旋转键数 | 3 |
tpsa |
Float | 拓扑极性表面积 (Ų) | 63.6 |
formal_charge |
Integer | 生理 pH 下净形式电荷 | 0 |
reactive_groups |
Text | 反应性基团过滤器结果 | none |
purchasability |
Text | 可购买性级别 | in-stock / make-on-demand / annotated |
supplier_code |
Text | 供应商代码 | ENAMINE |
vendor_code |
Text | 供应商化合物代码 | Z12345678 |
price_usd |
Float | 价格 (USD) | 65.0 |
catalog_name |
Text | 目录名称 | Enamine REAL |
tranche |
Text | Tranche 标识符 (MW×LogP) | CDEDB |
conformations_3d |
Integer | 3D 构象数 | 47 |
desolvation_sev |
Float | SEV 溶剂化能 | 12.35 |
§4.3 SmallWorld 相似性搜索
SmallWorld 是 ZINC20 引入的革命性相似性搜索工具,基于图编辑距离和最大公共子图 (MCS):
核心创新:
- 为所有可能列举的有机分子的匿名图做预索引
- 搜索时间呈亚线性增长,几乎与搜索的分子数无关
- 在 1,660 亿分子库中,1-2 秒找到最相似分子
性能对比:
| 方法 | 数据库大小 | 10 亿分子搜索时间 | 算法 |
|---|---|---|---|
| SmallWorld | 1,660 亿+ | 1-2 秒 | 图编辑距离 + MCS |
| ECFP4 + Postgres | 14 亿 | 3+ 分钟 | 分子指纹 + Tanimoto |
| Postgres (无索引) | 14 亿 | 10+ 分钟 | 全表扫描 |
使用方式:
- Web 界面:sw.docking.org
- 批量搜索:1,000 个分子,每个返回 top-100 类似物,平均 2 秒/分子
- 按需合成库检索:15 秒内返回成千上万类似物
§4.4 Arthor 子结构搜索
Arthor 是 ZINC20 引入的超快速子结构和模式匹配工具:
核心特性:
- 基于分子的一致性二进制表示 + SMARTS 模式匹配器
- 128 GB RAM 计算机上,1-2 秒搜索 10 亿分子的子结构
- RoundTable 分布式算法:多台计算机并行搜索数十亿至数百亿分子
- 搜索上限:10,000 分子/查询
性能基准:
| 模式复杂度 | 14 亿分子搜索时间 | 返回结果 |
|---|---|---|
| 苯基 (简单) | <1 秒 | 前 10,000 分子 |
| 环己基 (简单) | <1 秒 | 前 10,000 分子 |
| 复杂 SMARTS | 10-20 秒 | 10,000 分子上限或全库完成 |
§4.5 CartBlanche 界面
CartBlanche 是 ZINC-22 的主 Web 界面(cartblanche22.docking.org),提供:
| 功能 | 描述 | 命令行 |
|---|---|---|
| 供应商搜索 | 按供应商代码筛选化合物 | curl cartblanche22.docking.org/catitems.txt -F supplier_code-in=@sup.txt |
| SMILES 搜索 | 按 SMILES 进行相似性搜索 | curl cartblanche22.docking.org/smiles.txt -F smiles-in=@smiles.txt -F dist=4 -F adist=4 |
| 随机下载 | 从全库或 lead-like 子集随机下载分子 | curl cartblanche22.docking.org/substance/random.txt -F count=100 |
| 属性过滤 | 按 LogP 和重原子数范围筛选 | Web GUI |
| 格式选择 | 选择下载格式和方式 | Web GUI |
§4.6 ZINC-22 源目录
| 源目录 | 化合物数(2023) | 类型 | 供应商 |
|---|---|---|---|
| Enamine REAL Database | ~50 亿 | Make-on-demand | Enamine Ltd (乌克兰) |
| Enamine REAL Space | ~290 亿 (→ 945 亿 2026) | Make-on-demand (组合枚举) | Enamine Ltd |
| WuXi GalaXi | ~25 亿 | Make-on-demand | WuXi AppTec (中国) |
| Mcule Ultimate | ~1.28 亿 | Make-on-demand | Mcule (匈牙利) |
| ZINC20 in-stock | ~400 万 | In-stock | 150+ 供应商 |
§4.7 多样性分析
ZINC-22 论文报告的 Bemis-Murcko (B-M) 骨架多样性分析:
| 数据集 | 分子数 | B-M 骨架数 | 骨架/分子比 |
|---|---|---|---|
| In-stock | 6,136,700 | 1,263,063 | 20.6% |
| ZINC15 + ZINC20 | 531,645,834 | 19,590,914 | 3.7% |
| ZINC-22 (2022-10) | 4,500,000,000 | 96,311,761 | 2.1% |
关键发现:
-
骨架多样性随分子数 O(√N) 增长(log 增长/2-log 分子增长)
-
97%+ 按需合成库骨架在现货库中不存在
-
88 倍分子增长对应 16 倍骨架增长
-
新骨架主要来自最高重原子数分子(HAC 24-25 贡献 2 倍于 HAC 6-23 合计)
-
分子形状更多样:盘状(苯环类)和球形(金刚烷类)分子大幅增加
§5 数据划分与使用建议(Splits & Usage)
§5.1 子集划分策略
ZINC 不提供标准的 train/validation/test 划分(因为它不是 ML 基准数据集本身)。但以下子集策略被广泛使用:
| 策略 | 描述 | 适用场景 |
|---|---|---|
| Tranche 下载 | 按 MW × LogP 网格选择特定属性空间 | 对接筛选 |
| Lead-like 子集 | MW 150-350, LogP <4, ~2,000 万分子 | 大多数对接项目首选 |
| Fragment-like 子集 | MW <250, ~200 万分子 | 片段基药物设计 |
| In-stock 子集 | ~400 万现货化合物 | 需要快速实验验证 |
| Random 采样 | CartBlanche 随机下载 N 个分子 | ML 预训练数据采样 |
| ZINC-Curated | 4.27 亿高质量 SMILES(HuggingFace) | 分子语言模型预训练 |
| DUD-E 划分 | 102 靶点 × 配体 + property-matched decoys | 对接方法评估 |
§5.2 ZINC-Curated(ML 预训练子集)
ZINC-Curated 是从 ZINC-22 中精选的高质量子集,专为分子语言模型预训练设计:
| 属性 | 值 |
|---|---|
| 总分子数 | 4.27 亿 |
| 格式 | Canonical SMILES (Arrow format) |
| 来源 | ZINC-22 |
| HuggingFace | SZU-ADDG/ZINC-Curated |
| 筛选管道 | 四阶段:物理化学过滤 → 结构有效性 → 药物化学规则 → 多样性分层 |
筛选标准:
- 物理化学过滤:QED ≥ 5(药物相似性),SA ≥ 3(合成可及性)
- 结构有效性:排除 Si/Sn 元素、非中性电荷、自由基、桥头原子 >2、环 >8 元、可旋转键 >10、TPSA >140、PAINS
- 药物化学规则:Lipinski 五规则(MW 100-500, LogP ≤5, HBD ≤5, HBA ≤10)
- 多样性分层:按重原子数(4-49)分桶,桶内 Tanimoto 相似性 <0.5
- 序列长度:SMILES ≤72 tokens(自定义词表 vocab_V2.txt)
§5.3 DUD-E 对接评估基准
DUD-E (Directory of Useful Decoys, Enhanced) 是从 ZINC 提取的标准对接评估基准:
| 属性 | 值 |
|---|---|
| 靶点数 | 102 |
| 配体总数 | 22,886(来自 ChEMBL,每靶点 ≥40) |
| Decoy 总数 | ~1,100,000(来自 ZINC,每配体 ~50 property-matched decoys) |
| 属性匹配 | MW, LogP, HBD, HBA, TPSA, rotatable bonds, net charge |
| 去相似性 | ECFP4 Tanimoto <0.35 vs 配体 |
| 评估指标 | LogAUC₀.₀₀₁, EF₁%, ROC-AUC |
| URL | dude.docking.org |
DUDE-Z 优化版本:
- 修复 DUD-E 中配体/decoy 电荷不平衡
- 添加 Extrema decoys(电荷极端 decoys)
- 添加 Goldilocks decoys(从 ZINC lead-like 属性空间随机抽取)
- URL: dudez.docking.org
§5.4 使用建议
| 场景 | 推荐子集 | 分子数 | 格式 | 下载方式 |
|---|---|---|---|---|
| 首次对接筛选 | Lead-like in-stock | ~200 万 | mol2/db2 | ZINC20 tranche 下载 |
| 超大规模对接 | ZINC-22 make-on-demand | 1-10 亿 | SMILES → 自建 3D | CartBlanche 随机下载 |
| 片段筛选 | Fragment-like | ~45 万 | mol2 | ZINC20 tranche 下载 |
| SAR 类似物搜索 | SmallWorld 全库 | top-100 | SMILES | sw.docking.org |
| 子结构筛选 | Arthor 全库 | ≤10,000 | SMILES | arthor.docking.org |
| ML 预训练 | ZINC-Curated | 4.27 亿 | SMILES | HuggingFace |
| 对接方法评估 | DUD-E / DUDE-Z | 102 靶点 | mol2 | dude.docking.org |
| 化学空间分析 | ZINC-22 全库 | 375 亿 | SMILES | CartBlanche 随机采样 |
§6 AI 就绪指南(AI-Ready Guide)
§6.0 云端快速启动
AWS Open Data 直接访问:
# 列出 ZINC AWS S3 数据
aws s3 ls s3://zinc15/ no-sign-request
# 下载 ZINC20 lead-like SMILES 子集(示例)
aws s3 cp s3://zinc15/substances/subsets/lead-like/ ./zinc_leadlike/ \
recursive no-sign-request
CartBlanche API 快速搜索:
# 按供应商搜索
curl https://cartblanche22.docking.org/catitems.txt \
-F supplier_code-in=@suppliers.txt
# 按 SMILES 搜索类似物
curl https://cartblanche22.docking.org/smiles.txt \
-F smiles-in=@query_smiles.txt \
-F dist=4 -F adist=4
# 随机下载 100 个 lead-like 分子
curl https://cartblanche22.docking.org/substance/random.txt \
-F count=100
SmallWorld API 相似性搜索:
# 搜索阿司匹林的类似物
curl "https://sw.docking.org/substances.txt?smiles=CC(=O)OC1=CC=CC=C1C(=O)O&count=100"
§6.1 Python 对接数据加载
"""
ZINC 化合物库加载与对接前处理示例
依赖: rdkit, openeye.oechem (可选)
"""
import pandas as pd
import gzip
from rdkit import Chem
from rdkit.Chem import Descriptors, Crippen, rdMolDescriptors
from pathlib import Path
def load_zinc_smiles(filepath: str, max_molecules: int = None) -> pd.DataFrame:
"""加载 ZINC SMILES 文件 (gzip 压缩格式)
ZINC SMILES 格式: SMILES <tab> ZINC_ID
"""
records = []
with gzip.open(filepath, ''''''''''''''''rt'''''''''''''''') as f:
for i, line in enumerate(f):
if max_molecules and i >= max_molecules:
break
parts = line.strip().split(''''''''''''''''\t'''''''''''''''')
if len(parts) >= 2:
records.append({
''''''''''''''''smiles'''''''''''''''': parts[0],
''''''''''''''''zinc_id'''''''''''''''': parts[1]
})
return pd.DataFrame(records)
def filter_lead_like(df: pd.DataFrame) -> pd.DataFrame:
"""筛选 lead-like 子集
MW: 150-350 Da, LogP < 4, HBD <= 3, HBA <= 6
"""
def check_lead_like(smiles: str) -> bool:
mol = Chem.MolFromSmiles(smiles)
if mol is None:
return False
mw = Descriptors.MolWt(mol)
logp = Crippen.MolLogP(mol)
hbd = rdMolDescriptors.CalcNumHBD(mol)
hba = rdMolDescriptors.CalcNumHBA(mol)
return 150 <= mw <= 350 and logp < 4 and hbd <= 3 and hba <= 6
mask = df[''''''''''''''''smiles''''''''''''''''].apply(check_lead_like)
return df[mask].reset_index(drop=True)
def prepare_for_docking(df: pd.DataFrame, output_sdf: str):
"""将 ZINC 分子准备为 SDF 格式用于对接"""
writer = Chem.SDWriter(output_sdf)
for _, row in df.iterrows():
mol = Chem.MolFromSmiles(row[''''''''''''''''smiles''''''''''''''''])
if mol is not None:
mol = Chem.AddHs(mol)
# 生成 3D 构象 (简化版,生产环境用 OMEGA)
from rdkit.Chem import AllChem
AllChem.EmbedMolecule(mol, AllChem.ETKDG())
AllChem.MMFFOptimizeMolecule(mol)
mol.SetProp(''''''''''''''''ZINC_ID'''''''''''''''', row[''''''''''''''''zinc_id''''''''''''''''])
writer.write(mol)
writer.close()
# 使用示例
if __name__ == ''''''''''''''''__main__'''''''''''''''':
# 加载 ZINC SMILES
df = load_zinc_smiles(''''''''''''''''zinc_lead_like.smi.gz'''''''''''''''', max_molecules=100000)
print(f''''''''''''''''Loaded {len(df)} compounds from ZINC'''''''''''''''')
# 筛选 lead-like
df_lead = filter_lead_like(df)
print(f''''''''''''''''After lead-like filter: {len(df_lead)} compounds'''''''''''''''')
# 准备对接文件
prepare_for_docking(df_lead[:1000], ''''''''''''''''zinc_ready.sdf'''''''''''''''')
print(f''''''''''''''''Prepared 1000 molecules for docking'''''''''''''''')
§6.2 RDKit 分子属性批量计算
"""
ZINC 分子属性批量计算
用于补充 ZINC 未提供的 RDKit 计算属性
"""
from rdkit import Chem
from rdkit.Chem import Descriptors, Crippen, rdMolDescriptors, QED
import pandas as pd
from multiprocessing import Pool
import numpy as np
def compute_properties(smiles: str) -> dict:
"""计算单个分子的完整属性"""
mol = Chem.MolFromSmiles(smiles)
if mol is None:
return None
return {
''''''''''''''''mw'''''''''''''''': Descriptors.MolWt(mol),
''''''''''''''''logp'''''''''''''''': Crippen.MolLogP(mol),
''''''''''''''''hbd'''''''''''''''': rdMolDescriptors.CalcNumHBD(mol),
''''''''''''''''hba'''''''''''''''': rdMolDescriptors.CalcNumHBA(mol),
''''''''''''''''tpsa'''''''''''''''': rdMolDescriptors.CalcTPSA(mol),
''''''''''''''''rotatable_bonds'''''''''''''''': rdMolDescriptors.CalcNumRotatableBonds(mol),
''''''''''''''''heavy_atoms'''''''''''''''': mol.GetNumHeavyAtoms(),
''''''''''''''''formal_charge'''''''''''''''': Chem.GetFormalCharge(mol),
''''''''''''''''qed'''''''''''''''': QED.qed(mol),
''''''''''''''''num_rings'''''''''''''''': rdMolDescriptors.CalcNumRings(mol),
''''''''''''''''num_aromatic_rings'''''''''''''''': rdMolDescriptors.CalcNumAromaticRings(mol),
''''''''''''''''num_aliphatic_rings'''''''''''''''': rdMolDescriptors.CalcNumAliphaticRings(mol),
''''''''''''''''fraction_sp3'''''''''''''''': rdMolDescriptors.CalcFractionCSP3(mol),
}
def batch_compute(smiles_list: list, n_workers: int = 8) -> pd.DataFrame:
"""多进程批量计算分子属性"""
with Pool(n_workers) as pool:
results = pool.map(compute_properties, smiles_list)
valid = [r for r in results if r is not None]
return pd.DataFrame(valid)
# Bemis-Murcko 骨架提取
def extract_scaffolds(smiles_list: list) -> list:
"""提取 Bemis-Murcko 骨架用于多样性分析"""
from rdkit.Chem.Scaffolds import MurckoScaffold
scaffolds = set()
for smi in smiles_list:
mol = Chem.MolFromSmiles(smi)
if mol:
scaffold = MurckoScaffold.GetScaffoldForMol(mol)
scaffold_smi = Chem.MolToSmiles(scaffold)
scaffolds.add(scaffold_smi)
return list(scaffolds)
§6.3 PyTorch DataLoader(ML 预训练)
"""
ZINC-Curated DataLoader for molecular language model pre-training
Source: HuggingFace SZU-ADDG/ZINC-Curated
"""
import torch
from torch.utils.data import Dataset, DataLoader
from datasets import load_dataset
from typing import Optional, Dict
class ZINCCuratedDataset(Dataset):
"""ZINC-Curated 427M SMILES 数据集
筛选标准:
- QED >= 5 (药物相似性)
- SA >= 3 (合成可及性)
- Lipinski 五规则
- Tanimoto < 0.5 (桶内多样性)
- SMILES <= 72 tokens
"""
def __init__(self, split: str = ''''''''''''''''train'''''''''''''''', vocab_path: Optional[str] = None):
self.dataset = load_dataset(''''''''''''''''SZU-ADDG/ZINC-Curated'''''''''''''''', split=split)
# 自定义 SMILES 词表 (vocab_V2.txt)
if vocab_path:
self.vocab = self._load_vocab(vocab_path)
else:
self.vocab = self._default_vocab()
def _load_vocab(self, path: str) -> Dict[str, int]:
vocab = {}
with open(path, ''''''''''''''''r'''''''''''''''') as f:
for i, line in enumerate(f):
vocab[line.strip()] = i
return vocab
def _default_vocab(self) -> Dict[str, int]:
# SMILES 字符级词表
chars = list(''''''''''''''''()[]{}=+#@-./\\1234567890'''''''''''''''')
chars += [''''''''''''''''Cl'''''''''''''''', ''''''''''''''''Br'''''''''''''''', ''''''''''''''''Si'''''''''''''''', ''''''''''''''''Se'''''''''''''''', ''''''''''''''''Na'''''''''''''''', ''''''''''''''''Ca'''''''''''''''', ''''''''''''''''Mg'''''''''''''''', ''''''''''''''''Zn'''''''''''''''', ''''''''''''''''Fe'''''''''''''''']
chars += [''''''''''''''''<PAD>'''''''''''''''', ''''''''''''''''<BOS>'''''''''''''''', ''''''''''''''''<EOS>'''''''''''''''', ''''''''''''''''<UNK>'''''''''''''''']
return {c: i for i, c in enumerate(chars)}
def tokenize_smiles(self, smiles: str) -> torch.Tensor:
"""SMILES 字符级分词"""
import re
pattern = r''''''''''''''''(\[[^\]]+\]|Cl|Br|Si|Se|Na|Ca|Mg|Zn|Fe|[A-Z]|[a-z]|[0-9]|.)''''''''''''''''
tokens = re.findall(pattern, smiles)
ids = [self.vocab.get(t, self.vocab[''''''''''''''''<UNK>'''''''''''''''']) for t in tokens]
ids = [self.vocab[''''''''''''''''<BOS>'''''''''''''''']] + ids + [self.vocab[''''''''''''''''<EOS>'''''''''''''''']]
return torch.tensor(ids, dtype=torch.long)
def __len__(self) -> int:
return len(self.dataset)
def __getitem__(self, idx: int) -> Dict[str, torch.Tensor]:
item = self.dataset[idx]
smiles = item[''''''''''''''''input'''''''''''''''']
token_ids = self.tokenize_smiles(smiles)
return {''''''''''''''''input_ids'''''''''''''''': token_ids, ''''''''''''''''smiles'''''''''''''''': smiles}
# 使用示例
if __name__ == ''''''''''''''''__main__'''''''''''''''':
dataset = ZINCCuratedDataset(split=''''''''''''''''train'''''''''''''''')
print(f''''''''''''''''Dataset size: {len(dataset):,} molecules'''''''''''''''')
loader = DataLoader(
dataset, batch_size=256, shuffle=True,
collate_fn=lambda batch: {
''''''''''''''''input_ids'''''''''''''''': torch.nn.utils.rnn.pad_sequence(
[b[''''''''''''''''input_ids''''''''''''''''] for b in batch], batch_first=True,
padding_value=dataset.vocab[''''''''''''''''<PAD>'''''''''''''''']
)
}
)
for batch in loader:
print(f''''''''''''''''Batch shape: {batch["input_ids"].shape}'''''''''''''''')
break
§6.4 预处理管道
供应商目录 (SMILES/SDF)
↓
[1] 结构标准化 (CORINA)
- 互变异构归一化
- 立体化学标准化
- 盐/溶剂分子去除
↓
[2] 质子化 (pH 7.4)
- OpenEye QuacPac
- 生理 pH 下最可能电荷状态
↓
[3] 活性过滤
- 排除: 金属、硼、硅 (无 MMFF94 参数)
- 排除: 过氧化物、大肽、高度活泼试剂
- 排除: 构建块、不溶性分子
- PAINS 过滤器
↓
[4] 属性计算
- MW, LogP (miLogP), HBD, HBA, TPSA
- 重原子数, 可旋转键, 形式电荷
↓
[5] 3D 构象生成 (OpenEye OMEGA)
- 1-100 个构象/分子
- MMFF94 力场优化
- SEV 溶剂化能计算
↓
[6] Tranche 分箱
- MW 行 (A-K: 200-600 Da)
- LogP 列 (A-J: -4 to 6)
- 电荷子集
↓
[7] 索引构建
- SmallWorld 匿名图索引
- Arthor 二进制表示
↓
[8] 云端部署
- AWS S3 / Oracle OCI / Globus
- CartBlanche Web 界面
§6.5 坑点指南
坑点 1:许可证陷阱 — 免费使用 ≠ 可自由再分发
问题:ZINC 许可证不是标准开源许可证。免费使用和下载,但大量再分发(如将 ZINC 子集打包到自己的产品中分发)需要 John Irwin 的书面授权。
影响:商业产品、开源项目、数据聚合平台不能直接再分发 ZINC 数据子集。
解决方案:
- 个人使用和学术研究:无限制
- 发表论文使用 ZINC 数据:引用论文即可,无需额外授权
- 商业产品内置 ZINC 数据:联系 chemistry4biology@gmail.com 获取授权
- 替代方案:使用 PubChem(公共领域,无再分发限制)
坑点 2:ZINC-22 无预构建 3D — 需通过 TLDR 服务构建
问题:与 ZINC20 不同,ZINC-22 不提供全库预构建 3D 格式下载。仅 in-stock 子集(~4M)有预构建 3D。对于 375 亿按需合成分子,需要通过 TLDR 服务自建 3D。
影响:超大规模对接需要额外的 3D 构建步骤,TLDR 每批最多 50,000 分子,每 400 分子约 1 小时。
解决方案:
- 小规模(<50K):使用 TLDR 服务(tldr.docking.org)
- 中等规模(50K-10M):下载 SMILES,用 RDKit EmbedMolecule 自建(质量略低)
- 大规模(>10M):获取 OpenEye OMEGA 许可(商业软件),自行构建
- 替代方案:使用 CORINA 在线服务(有免费学术许可)
坑点 3:供应商重复与可购买性不确定性
问题:同一化合物可能被多个供应商收录,导致 ZINC ID 重复。约购买性信息按 90/90/90 规则维护,但 10% 化合物可能已耗尽。
影响:对接结果中同一分子可能出现多次;购买时部分化合物可能已无库存。
解决方案:
- 使用 InChIKey 去重(而非 ZINC ID)
- 下载时选择
purchasability: agent(in-stock)确保最高可购买性 - 对关键 hit 分子,同时在多个供应商查询(MolPort, eMolecules)
- 按 90/90/90 规则预期 ~90% 可购买性
坑点 4:按需合成库的合成成功率与交付延迟
问题:Enamine REAL 等按需合成库的标称合成成功率为 >80%,但实际可能低至 60-70%(复杂分子)。交付时间 3-4 周,但可能延长至 6-8 周。
影响:对接筛选的 hit 化合物可能无法按时合成,影响实验验证周期。
解决方案:
- 对接排序时优先选择 in-stock 子集(~90% 可购买)
- 对按需合成化合物,同时选择 2-3 个备选 hit
- 关注 Enamine 合成进度通知(通常第 2 周有更新)
- 预算 ~20% 的化合物合成失败率
坑点 5:版本迁移导致 ZINC ID 不一致
问题:ZINC12 → ZINC15 → ZINC20 → ZINC22 迁移过程中,部分化合物的 ZINC ID 发生变化。旧版论文引用的 ZINC ID 在新版中可能无法找到。
影响:基于旧版 ZINC 的论文中报告的化合物 ID 在当前版本中可能无效,影响可复现性。
解决方案:
- 同时记录 ZINC ID 和 InChIKey(后者跨版本稳定)
- 在论文中注明使用的 ZINC 版本和下载日期
- 使用 ZINC20(zinc20.docking.org)查询旧版 ID
- 对于关键化合物,记录 SMILES 作为后备标识符
坑点 6:3D 构象质量依赖商业软件
问题:ZINC 的 3D 构象使用 OpenEye OMEGA(商业软件)生成,MMFF94 参数化。无 OMEGA 许可的研究者无法完全复现 ZINC 的 3D 构象质量。
影响:使用 RDKit 自建的 3D 构象质量可能低于 ZINC 原生 3D,影响对接精度。
解决方案:
- 优先下载 ZINC 预构建 3D(in-stock 子集)
- 学术机构可申请 OpenEye 免费学术许可
- 使用 CORINA(有免费学术版本)作为 OMEGA 替代
- RDKit ETKDGv3 可作为开源替代(质量略低但持续改进)
- 对于对接关键分子,使用 TLDR 服务构建(使用 OMEGA)
§6.6 数据增强策略
| 策略 | 方法 | 目的 |
|---|---|---|
| 构象增强 | 对每个分子生成多个 3D 构象(OMEGA) | 捕获结合柔性 |
| 质子化状态枚举 | 对关键分子枚举不同质子化状态 | 处理 pH 依赖结合 |
| 类似物扩展 | SmallWorld 搜索 top-100 类似物 | SAR-by-catalog 扩展 |
| 骨架替换 | Bemis-Murcko 骨架替换 | 骨架跃迁 |
| 反相似性采样 | 从不同 Tranche 采样确保多样性 | 化学空间覆盖 |
| PAINS 过滤后补 | 对 hit 化合物重新检查 PAINS | 减少假阳性 |
§6.7 模型推荐
| 任务 | 推荐方法 | 输入 | 说明 |
|---|---|---|---|
| 分子对接 | DOCK 3.6/3.7 | mol2/db2 | ZINC 原生支持格式 |
| 分子对接 | AutoDock Vina/GPU | pdbqt | 广泛使用的开源对接 |
| 分子对接 | Glide (Schrödinger) | SDF/mae | 工业标准商业对接 |
| 相似性搜索 | SmallWorld | SMILES | ZINC 原生搜索工具 |
| 子结构搜索 | Arthor | SMARTS | ZINC 原生搜索工具 |
| ML 性质预测 | Chemprop / GraphSAGE | SMILES/graph | ZINC-Curated 预训练 |
| 分子生成 | MolGPT / ChemFM | SMILES | ZINC-Curated 预训练 |
| 骨架分析 | RDKit Bemis-Murcko | SMILES | 多样性评估 |
§6.8 硬件需求
| 任务 | CPU | RAM | 存储 | GPU | 时间估算 |
|---|---|---|---|---|---|
| Lead-like 子集下载 | 任意 | 8 GB | 50 GB | — | ~2 小时 |
| 百万分子对接 | 16 核 | 32 GB | 100 GB | — | ~24 小时 |
| 亿级分子对接 | 集群/云 | 128 GB+ | 1 TB+ | — | ~1-2 周 |
| SmallWorld 搜索 | 4 核 | 32 GB | — | — | 1-2 秒 |
| Arthor 搜索 | 8 核 | 128 GB | — | — | 1-2 秒 |
| 3D 构象构建 (TLDR) | 云端服务 | — | — | — | 1h/400 分子 |
| ML 预训练 (427M) | — | 256 GB | 1 TB | 8×A100 | ~7 天 |
§6.9 评估指标
| 任务 | 指标 | 描述 | 基准值 |
|---|---|---|---|
| 对接富集 | LogAUC₀.₀₀₁ | 对数 ROC 曲线下面积 | 0-40%(好) |
| 对接富集 | EF₁% | 1% 富集因子 | 10-60(好) |
| 对接富集 | ROC-AUC | ROC 曲线下面积 | 0.7-0.95 |
| 命中率 | Hit rate | 实验验证活性率 | 1-63%(靶点依赖) |
| 多样性 | B-M 骨架数 | Bemis-Murcko 骨架多样性 | O(√N) 增长 |
| 搜索速度 | Latency | SmallWorld/Arthor 响应时间 | 1-2 秒 |
| 可购买性 | Sourcing rate | 实际可购买率 | ~80-90% |
§7 质量评估与局限性(Quality & Limitations)
§7.1 数据偏倚
| 偏倚类型 | 描述 | 影响 | 缓解措施 |
|---|---|---|---|
| 可购买性偏倚 | 仅包含可购买化合物,排除大量理论分子 | 化学空间限于商业可用范围 | 按需合成库扩展到 94.5B+ |
| 生物相关性偏倚 | 排除金属、硼、硅(无 MMFF94 参数) | 排除金属药物(如顺铂) | 使用其他数据库补充 |
| 供应商地理偏倚 | 供应商集中于美国、乌克兰、中国、欧洲 | 化学空间受供应商库存影响 | 150+ 供应商缓解 |
| 类药性偏倚 | 默认子集偏向 Lipinski 五规则化合物 | 超出规则的大分子被排除 | 使用全库(不限子集) |
| 按需合成偏倚 | 97%+ 骨架来自按需合成库 | 新颖性高但可合成性有不确定性 | 80%+ 合成成功率保证 |
| 质子化状态偏倚 | 所有分子以 pH 7.4 质子化 | 不同 pH 环境下实际状态可能不同 | 关键分子手动验证质子化 |
§7.2 标注质量
| 维度 | 评估 | 说明 |
|---|---|---|
| 结构准确性 | ⭐⭐⭐⭐⭐ | CORINA 标准化 + 供应商原始数据 |
| 属性准确性 | ⭐⭐⭐⭐ | miLogP 计算值,与实验值有偏差 |
| 可购买性准确性 | ⭐⭐⭐⭐ | 90/90/90 规则,~10% 可能已耗尽 |
| 3D 构象质量 | ⭐⭐⭐⭐⭐ | OpenEye OMEGA + MMFF94,工业标准 |
| 生物活性注释 | ⭐⭐ | 非自有数据,依赖 ChEMBL 交叉引用 |
| IAA (标注者一致性) | N/A | 无人工标注环节,无 IAA 测量 |
§7.3 泛化性
| 维度 | 评估 |
|---|---|
| 化学空间覆盖 | ⭐⭐⭐⭐⭐ — 375B+ 化合物覆盖极大化学空间 |
| 靶点覆盖 | ⭐⭐⭐ — 仅含可购买化合物,不含靶点活性数据 |
| 物种覆盖 | N/A — 化合物数据库,无物种信息 |
| 时间覆盖 | ⭐⭐⭐⭐⭐ — 2005-2026 持续更新 20 年 |
| 地理覆盖 | ⭐⭐⭐ — 供应商集中于美/乌/中/欧 |
§7.4 伦理考量
| 维度 | 评估 |
|---|---|
| 人体数据 | 无 — ZINC 不包含人体或临床数据 |
| 动物数据 | 无 — ZINC 不包含动物实验数据 |
| 知情同意 | N/A — 化合物结构无知情同意要求 |
| 伦理审查 | N/A — 公开可购买化合物信息 |
| 双重用途 | 低风险 — 化合物信息已公开可购 |
| 知识产权 | 中等 — 按需合成库部分化合物可能有专利保护 |
§7.5 公平性
| 维度 | 评估 |
|---|---|
| 数据可及性 | ⭐⭐⭐⭐⭐ — 免费使用和下载 |
| 地理公平 | ⭐⭐⭐ — 全球可访问,但供应商集中于发达国家 |
| 经济公平 | ⭐⭐⭐⭐ — 免费数据库降低研究门槛 |
| 机构公平 | ⭐⭐⭐⭐⭐ — 学术和商业机构均可免费使用 |
§7.6 外部验证
| 验证方式 | 结果 |
|---|---|
| Nature 2019 前瞻验证 | 170M 对接 → AmpC 77nM 抑制剂 + D4 180pM 激动剂(实验确认) |
| DUD-E 对接评估 | 102 靶点 × DOCK 3.6,中位 LogAUC 15-25% |
| CACHE 挑战赛 | ZINC 作为官方筛选库之一 |
| 多团队独立使用 | 58,000+ 引用论文,全球广泛使用 |
| B-M 骨架多样性 | log 增长/2-log 分子增长,持续未饱和 |
§7.7 DAIMS 24 项数据就绪度评估
| # | 评估项 | 评分 | 说明 |
|---|---|---|---|
| 1 | 动机 | ✅ | 明确为虚拟筛选和配体发现设计 |
| 2 | 组成 | ✅ | 化合物、供应商、3D 属性完整记录 |
| 3 | 收集过程 | ✅ | 供应商目录来源 + 标准化管道完整描述 |
| 4 | 预处理 | ✅ | CORINA + OMEGA + MMFF94 管道完整 |
| 5 | 标注一致性 (IAA) | N/A | 无人工标注,自动管道 |
| 6 | 清洗 | ✅ | 活性/反应性/PAINS 过滤完整 |
| 7 | 伦理审查 | ⚠️ | 无伦理审查要求(非人体/动物数据),但未明确声明 |
| 8 | 使用案例 | ✅ | 虚拟筛选、对接、ML 预训练等明确 |
| 9 | 分配机制 | ✅ | Tranche/子集/随机采样策略清晰 |
| 10 | 训练/测试/验证分割 | ⚠️ | 非基准数据集,不提供标准分割 |
| 11 | 数据来源 | ✅ | 150+ 供应商来源完整记录 |
| 12 | 可用性 | ✅ | 免费 + AWS/OCI/Globus 多通道 |
| 13 | 许可证 | ⚠️ | 免费使用但非标准开源许可,再分发受限 |
| 14 | 纵向数据 | ⚠️ | 持续更新但版本间 ID 不完全一致 |
| 15 | 维护计划 | ✅ | 20 年持续运营,NIGMS 持续资助 |
| 16 | 变更日志 | ✅ | 版本论文完整记录变更 |
| 17 | 数据格式 | ✅ | SMILES/mol2/SDF/pdbqt/db2 五种格式 |
| 18 | 元数据标准 | ✅ | InChIKey + 供应商代码 + 属性完整 |
| 19 | 质量 assurance | ✅ | 90/90/90 规则 + CORINA 标准化 |
| 20 | 真值质量 | ⚠️ | 化合物结构为供应商提供,非独立验证 |
| 21 | 公平性 | ⚠️ | 供应商地理集中,可能引入化学空间偏倚 |
| 22 | 数据泄露 | ⚠️ | 跨供应商重复化合物可能导致评估偏倚 |
| 23 | 偏倚 | ⚠️ | 可购买性/生物相关性/供应商地理偏倚 |
| 24 | 复现性 | ✅ | 开源代码 + 云端数据 + 版本论文 |
DAIMS 评分:16/24 ⭐⭐⭐⭐(排除 1 个 N/A 后有效评分 16/23 = 70%)
主要扣分项:
- #7 伦理审查:未明确声明(虽非必需)
- #10 标准分割:非基准数据集,不提供
- #13 许可证:非标准开源许可
- #14 纵向:版本间 ID 不一致
- #20 真值质量:结构来自供应商,非独立验证
- #21 公平性:供应商地理集中
- #22 数据泄露:跨供应商重复
- #23 偏倚:多种偏倚存在
§7.8 外部验证矩阵
| 验证类型 | 验证者 | 靶点/任务 | 结果 | 参考文献 |
|---|---|---|---|---|
| 前瞻对接 | Lyu et al. 2019 | AmpC β-内酰胺酶 | 77 nM 抑制剂(新化学型) | Nature 566:224-29 |
| 前瞻对接 | Lyu et al. 2019 | D4 多巴胺受体 | 180 pM 激动剂(81 新化学型) | Nature 566:224-29 |
| 前瞻对接 | Fink et al. 2022 | EP4 前列腺素受体 | 纳摩尔调节剂 | 未公开发表 |
| 前瞻对接 | Singh et al. 2021 | α2A 肾上腺素受体 | 纳摩尔调节剂 | 未公开发表 |
| COVID-19 对接 | 多团队 | 病毒酶 | 微摩尔级抑制剂 | 多篇论文 |
| DUD-E 对接评估 | Mysinger et al. 2012 | 102 靶点 | 中位 LogAUC 15-25% | J Med Chem 55:6582 |
| CACHE 挑战赛 | 多团队 | 多靶点 | 进行中 | cache.docking.org |
| ML 基准 | ZINC-Curated | 分子生成 | 4.27M SMILES 预训练 | arXiv 2601.21964 |
§8 基准性能与生态(Benchmarks & Ecosystem)
§8.1 超大规模对接排行榜
Transductive(全库对接,目标已知):
| 研究 | 年份 | 库大小 | 靶点 | 最佳亲和力 | 命中率 | 论文 |
|---|---|---|---|---|---|---|
| Lyu et al. | 2019 | 170M | AmpC β-内酰胺酶 | 77 nM | 35% (44/126) | Nature 566:224 |
| Lyu et al. | 2019 | 170M | D4 多巴胺受体 | 180 pM | 36% (549/1500) | Nature 566:224 |
| Stein et al. | 2020 | 280M | σ2 受体 | 1 nM | 26% | PNAS |
| Gorgulla et al. | 2020 | 1.4B | COVID-19 Mpro | 1.9 µM | 8% | Nature |
| CACHE 2022-2026 | 2022- | ~750M | 多靶点 | 进行中 | — | cache.docking.org |
| multi-B | 2024 | 5.9B | 多靶点 | 进行中 | — | 多篇 |
命中率-打分曲线关键发现(Lyu et al. 2019):
- 命中率随对接打分几乎单调下降
- D4 受体全库预测含 453,000 个活性配体
- 打分排名前 3000 的 47 个实验活性骨架被替换为不同聚类代表后,排名平均下滑 112 万位
- 结论:全库每个分子独立对接是发现最优配体的必要条件,预聚类无法替代
§8.2 DUD-E 对接评估基准
| 指标 | 描述 | 典型值(DOCK 3.6 + SEV) | 典型值(AutoDock Vina) |
|---|---|---|---|
| LogAUC₀.₀₀₁ | 对数 ROC 曲线下面积 | 15-30% | 10-25% |
| EF₁% | 1% 富集因子 | 10-60 | 5-40 |
| ROC-AUC | ROC 曲线下面积 | 0.75-0.95 | 0.70-0.90 |
| 富集范围 | 最好→最差靶点 | 50% → 5% | 40% → 3% |
DUD-E 靶点分类(102 靶点):
- 核受体:8 个
- GPCR:10 个
- 离子通道:6 个
- 激酶:13 个
- 蛋白酶:13 个
- 核酸:4 个
- 其他酶:48 个
§8.3 关键论文
| 论文 | 年份 | 核心贡献 | 引用 |
|---|---|---|---|
| Irwin & Shoichet | 2005 | ZINC 原始发布(72 万化合物) | 2,000+ |
| Irwin et al. | 2012 | ZINC12(3500 万,tranche 系统) | 3,000+ |
| Mysinger et al. | 2012 | DUD-E 基准集(102 靶点) | 1,966 |
| Sterling & Irwin | 2015 | ZINC15(5 亿+,RESTful API) | 1,000+ |
| Lyu et al. | 2019 | 超大规模对接(170M,Nature) | 500+ |
| Irwin et al. | 2020 | ZINC20(14 亿,SmallWorld + Arthor) | 300+ |
| Stein et al. | 2021 | DUDE-Z 优化基准 | 148+ |
| Tingle et al. | 2023 | ZINC-22(375 亿,CartBlanche) | 100+ |
| Yang et al. | 2026 | ZINC-Curated(427M SMILES for ML) | 新发表 |
§8.4 使用统计
| 指标 | 数值 | 来源 |
|---|---|---|
| 总引用 | 58,000+ | Google Scholar |
| 年均引用 | 3,000+ | Google Scholar |
| 日均访问 | 500+ 独立访客 | ZINC12 统计 |
| 月均访问 | 13,000+ 独立 IP | ZINC12 统计 |
| 月均下载 | 1-2 TB | ZINC12 统计 |
| Twitter 关注 | @chem4biology | ZINC-22 更新 |
| 每周新分子 | 100,000+ | ZINC12 策展 |
| 每周修复分子 | 10,000 | ZINC12 策展 |
| 每周标记耗尽 | 80,000 | ZINC12 策展 |
| 月增新分子 (ZINC-22) | ~300,000,000 | ZINC-22 论文 |
§8.5 相关数据集
| 数据集 | 关系 | 描述 |
|---|---|---|
| DUD-E | ZINC 衍生 | 102 靶点配体 + property-matched decoys(来自 ZINC) |
| DUDE-Z | ZINC 衍生 | 优化版 DUD-E + Extrema + Goldilocks decoys |
| ZINC-Curated | ZINC 子集 | 4.27 亿 SMILES,ML 预训练专用 |
| ChEMBL | 互补 | 生物活性数据(ZINC 化合物可购买性 + ChEMBL 活性) |
| PubChem | 互补 | 1.19 亿化合物(公共领域,含生物活性) |
| Enamine REAL Space | ZINC 核心源 | 94.5B 按需合成化合物 |
| GDB-17 / GDB-Elaborate | 理论化学空间 | 1,660 亿理论分子(非可购买) |
| COCONUT | 天然产物 | 69.5 万天然产物 |
| BindingDB | 互补 | 300 万结合数据 |
§8.6 工具生态
| 工具 | 类型 | 与 ZINC 的关系 | URL |
|---|---|---|---|
| DOCK | 分子对接 | ZINC 原生支持格式(db2) | dock.compbio.ucsf.edu |
| AutoDock Vina/GPU | 分子对接 | ZINC pdbqt 格式 | autodock.scripps.edu |
| SmallWorld | 相似性搜索 | ZINC 原生工具 | sw.docking.org |
| Arthor | 子结构搜索 | ZINC 原生工具 | arthor.docking.org |
| CartBlanche | Web GUI | ZINC-22 主界面 | cartblanche22.docking.org |
| TLDR | 3D 构建 | ZINC-22 3D 服务 | tldr.docking.org |
| DUD-E 服务器 | Decoy 生成 | 从 ZINC 提取 decoys | dude.docking.org |
| ZINCPharmer | 药效团搜索 | 搜索 ZINC 化合物 | pharmer.csb.pitt.edu |
| infiniSee | 化学空间导航 | 搜索 REAL Space | biosolveit.de |
| RDKit | 化学信息学 | ZINC SMILES 处理 | rdkit.org |
| OpenEye OMEGA | 3D 构象 | ZINC 3D 构象生成引擎 | eyesopen.com |
§8.7 生态快照
ZINC 生态系统
│
├── 数据源层
│ ├── Enamine REAL (94.5B 按需合成)
│ ├── WuXi GalaXi (25B 按需合成)
│ ├── Mcule Ultimate (1.28B 按需合成)
│ ├── 150+ In-stock 供应商 (MolPort, eMolecules, Chemspace, ...)
│ └── 注释库 (ChEMBL, FDA drugs, natural products)
│
├── 搜索工具层
│ ├── SmallWorld (图编辑距离相似性)
│ ├── Arthor (SMARTS 子结构匹配)
│ ├── CartBlanche (ZINC-22 GUI)
│ ├── TLDR (3D 构象构建)
│ └── Tranche Browser (属性网格浏览)
│
├── 对接工具层
│ ├── DOCK 3.6/3.7 (UCSF, db2 格式)
│ ├── AutoDock Vina/GPU (pdbqt 格式)
│ ├── Glide (Schrödinger, SDF 格式)
│ └── rDock (SDF 格式)
│
├── 基准评估层
│ ├── DUD-E (102 靶点, 1.1M decoys)
│ ├── DUDE-Z (优化版 + Extrema + Goldilocks)
│ ├── CACHE 挑战赛 (前瞻评估)
│ └── ZINC-Curated (ML 预训练基准)
│
├── 云端部署层
│ ├── AWS Open Data (S3)
│ ├── Oracle OCI (开放数据)
│ └── Globus (科研数据传输)
│
└── 用户社区层
├── 学术研究者 (58,000+ 引用)
├── 药企研发 (对接筛选)
├── ML 研究者 (ZINC-Curated 预训练)
└── 化学供应商 (目录收录)
§9 相关资源与引用(Resources & Citation)
§9.1 官方资源
| 资源 | URL |
|---|---|
| ZINC-22 主站 | cartblanche22.docking.org |
| ZINC20 主站 | zinc20.docking.org |
| ZINC Wiki | wiki.docking.org |
| SmallWorld | sw.docking.org |
| Arthor | arthor.docking.org |
| TLDR (3D 构建) | tldr.docking.org |
| DUD-E 基准 | dude.docking.org |
| DUDE-Z 基准 | dudez.docking.org |
| 文件服务器 | files.docking.org |
| GitHub | github.com/docking-org |
| AWS Open Data | registry.opendata.aws/zinc15 |
| @chem4biology |
§9.2 推荐引用
当前版本 (ZINC-22):
@article{tingle2023zinc22,
title={ZINC-22A Free Multi-Billion-Scale Database of Tangible Compounds for Ligand Discovery},
author={Tingle, Benjamin I. and Tang, Khanh G. and Castanon, Mar and Gutierrez, John J. and Khurelbaatar, Munkhzul and Dandarchuluun, Chinzorig and Moroz, Yurii S. and Irwin, John J.},
journal={Journal of Chemical Information and Modeling},
volume={63},
number={4},
pages={11661176},
year={2023},
doi={10.1021/acs.jcim.2c01253}
}
ZINC20:
@article{irwin2020zinc20,
title={ZINC20A Free Ultralarge-Scale Chemical Database for Ligand Discovery},
author={Irwin, John J. and Tang, Khanh G. and Young, Jennifer and Dandarchuluun, Chinzorig and Wong, Benjamin R. and Khurelbaatar, Munkhzul and Moroz, Yurii S. and Mayfield, John and Sayle, Roger A.},
journal={Journal of Chemical Information and Modeling},
volume={60},
number={12},
pages={60656073},
year={2020},
doi={10.1021/acs.jcim.0c00675}
}
DUD-E 基准:
@article{mysinger2012dude,
title={Directory of Useful Decoys, Enhanced (DUD-E): Better Ligands and Decoys for Better Benchmarking},
author={Mysinger, Michael M. and Carchia, Michael and Irwin, John J. and Shoichet, Brian K.},
journal={Journal of Medicinal Chemistry},
volume={55},
number={14},
pages={65826594},
year={2012},
doi={10.1021/jm300687e}
}
超大规模对接 (Nature 2019):
@article{lyu2019ultralarge,
title={Ultra-large library docking for discovering new chemotypes},
author={Lyu, Jiankun and Wang, Sheng and Balius, Trent E. and Singh, Isha and Levit, Anat and Moroz, Yurii S. and O''''''''''''''''Meara, Matthew J. and Che, Tao and Algaa, Enkhjargal and Tolmachova, Kateryna and others},
journal={Nature},
volume={566},
pages={224229},
year={2019},
doi={10.1038/s41586-019-0917-9}
}
原始 ZINC (2005):
@article{irwin2005zinc,
title={ZINCa free database of commercially available compounds for virtual screening},
author={Irwin, John J. and Shoichet, Brian K.},
journal={Journal of Chemical Information and Modeling},
volume={45},
number={1},
pages={177182},
year={2005},
doi={10.1021/ci049714+}
}
§9.3 版本论文完整列表
| 版本 | 论文 | DOI |
|---|---|---|
| ZINC (2005) | Irwin & Shoichet, JCIM 45(1):177-82 | 10.1021/ci049714+ |
| ZINC12 (2012) | Irwin et al., JCIM 52(7):1757-68 | 10.1021/ci3001277 |
| DUD-E (2012) | Mysinger et al., J Med Chem 55(14):6582-94 | 10.1021/jm300687e |
| ZINC15 (2015) | Sterling & Irwin, JCIM 55(11):2324-37 | 10.1021/acs.jcim.5b00559 |
| Ultra-large docking (2019) | Lyu et al., Nature 566:224-29 | 10.1038/s41586-019-0917-9 |
| ZINC20 (2020) | Irwin et al., JCIM 60(12):6065-73 | 10.1021/acs.jcim.0c00675 |
| DUDE-Z (2021) | Stein et al., JCIM | — |
| ZINC-22 (2023) | Tingle et al., JCIM 63(4):1166-76 | 10.1021/acs.jcim.2c01253 |
| ZINC-Curated (2026) | Yang et al., arXiv 2601.21964 | — |
§10 AI 使用声明卡
§10.1 数据集标识
| 属性 | 值 |
|---|---|
| 数据集名称 | ZINC (ZINC Is Not Commercial) |
| 版本 | ZINC-22 (2023) |
| 数据集 ID | zinc/88 |
| URL | https://www.qianfanghub.com/ai-ready-dataset/zinc/88 |
| 原始来源 | https://cartblanche22.docking.org |
| DOI | 10.1021/acs.jcim.2c01253 |
§10.2 许可证摘要
| 方面 | 条款 |
|---|---|
| 个人使用 | ✅ 免费 |
| 学术研究 | ✅ 免费 |
| 商业使用 | ✅ 允许(界面和搜索工具) |
| 大量再分发 | ❌ 需 John Irwin 书面授权 |
| ML 训练使用 | ✅ 允许(训练后模型分发不受 ZINC 许可限制) |
| 引用要求 | 必须引用相应版本论文 |
§10.3 推荐工作流
1. 确定筛选规模和子集
├── 小规模 (<1M): ZINC20 in-stock lead-like
├── 中等规模 (1M-100M): ZINC20 lead-like (in-stock + make-on-demand)
└── 超大规模 (100M-10B): ZINC-22 make-on-demand
↓
2. 选择格式
├── 对接: mol2 / db2 (in-stock) 或 SMILES → TLDR 3D (make-on-demand)
├── ML: SMILES (ZINC-Curated from HuggingFace)
└── 搜索: SmallWorld / Arthor API
↓
3. 下载或搜索
├── Tranche 下载: files.docking.org
├── CartBlanche API: cartblanche22.docking.org
├── AWS: registry.opendata.aws/zinc15
└── HuggingFace: SZU-ADDG/ZINC-Curated
↓
4. 预处理
├── RDKit: 标准化 + 属性计算
├── OMEGA (如有许可): 3D 构象生成
└── TLDR (ZINC 服务): 3D 构建 (max 50K/batch)
↓
5. 筛选/对接
├── DOCK 3.6/3.7 (db2 格式)
├── AutoDock Vina (pdbqt)
├── Glide (SDF)
└── ML 预测 (SMILES → graph/SMILES model)
↓
6. 后处理
├── 去重 (InChIKey)
├── PAINS 检查
├── 聚类 (Bemis-Murcko 骨架)
└── 可购买性验证 (CartBlanche catitems)
↓
7. 购买与实验验证
├── In-stock: 1-2 周交付
├── Make-on-demand: 3-4 周交付 (>80% 成功)
└── 多供应商备份
§10.4 人工校验表
| 检查项 | 状态 | 说明 |
|---|---|---|
| 数据集名称 | ✅ | ZINC (ZINC Is Not Commercial) |
| 维护机构 | ✅ | Irwin & Shoichet Laboratories, UCSF |
| 当前版本 | ✅ | ZINC-22 (2023, JCIM 63(4):1166-76) |
| 化合物数量 | ✅ | 375 亿+ (2023),持续增长 |
| 数据格式 | ✅ | SMILES, mol2, SDF, pdbqt, db2 |
| 搜索工具 | ✅ | SmallWorld, Arthor, CartBlanche, TLDR |
| 许可证 | ✅ | 免费使用,再分发需授权 |
| 基金来源 | ✅ | NIGMS GM71896 + GM133836 |
| DOI | ✅ | 10.1021/acs.jcim.2c01253 |
| 官网 URL | ✅ | cartblanche22.docking.org |
| AI 就绪度 | ✅ | DAIMS 16/24 ⭐⭐⭐⭐ |
| 页面状态 | ✅ | published |
| 未定稿字样 | ✅ 无 | 正文无"审核中"“draft”"review"等字样 |
| JSON-LD | ✅ | @graph 单块(MedicalWebPage + Dataset) |
