TDC — 治疗科学机器学习基准平台 AI-Ready Wikipedia | 千方病案医数集

66 个数据集 · 22 个学习任务 · 药物发现全管线基准

来源 Harvard Medical School Zitnik Lab & MIT & Stanford 等 url: https://tdcommons.ai发布时间: 2026-09-06最后更新: 2026-09-06 阅读 11

信息速览

数据集名称TDC — 治疗科学机器学习基准平台 AI-Ready Wikipedia | 千方病案医数集
数据类型66 个 AI-ready 数据集,22 个学习任务,29 个公开排行榜,pip 一键安装,3 行代码加载,代码 MIT 许可
规模无患者数据 · 分子/蛋白实体级
接入方式Harvard Medical School Zitnik Lab & MIT & Stanford 等 url: https://tdcommons.ai
AI 就绪度

数据集封面

TDC — 治疗科学机器学习基准平台 AI-Ready Wikipedia


INFOBOX

数据集名称 Therapeutics Data Commons(TDC)
英文全称 Therapeutics Data Commons: Machine Learning Datasets and Tasks for Drug Discovery and Development
别名/简称 TDC、TDC-1、PyTDC(Python 库名)、The Commons、治疗数据公地
疾病分类 覆盖全治疗领域(非单一疾病数据集)。核心治疗领域 ICD-11 映射:2A00–2F9Z 肿瘤(GDSC/DrugSyn)/ 1C62 HIV(HTS-HIV)/ RA01 COVID-19(SARS-CoV-2 数据集)/ BA00–BE2Z 循环系统(hERG 心脏毒性)/ 5A11 2 型糖尿病等(详见 §2.1)
SNOMED CT 703503005 Drug discovery (procedure) / 109989006 HIV infection / 840539006 COVID-19 / 363346000 Malignant neoplastic disease(详见 §2.2)
数据模态 小分子(SMILES/分子图/分子指纹)、生物大分子(蛋白/抗体/多肽/miRNA 序列)、相互作用网络(DTI/DDI/PPI)、单细胞组学与临床试验数据(TDC-2)、化学反应
AI 任务类型 回归预测、二分类/多标签分类、链接预测、序列到序列预测、分子生成与优化、域泛化
样本总数 TDC-1:66 个 AI-ready 数据集 / 22 个学习任务(单数据集 200 至约 200 万样本);TDC-2:1,000+ 多模态数据集 / 约 8,500 万单细胞
数据大小 核心集合约 1 GB 量级(逐数据集数十 KB 至数百 MB,PyTDC 自动下载并缓存于 ~/.tdc
数据格式 CSV/TSV(经 PyTDC 封装为 pandas DataFrame)/ SMILES/SELFIES/分子图/分子指纹(MolConvert 约 15 种格式互转)/ JSON
许可证 代码 MIT License;数据集聚合自公共来源,沿用各上游许可(DrugBank 衍生数据需遵守其学术许可)
访问级别 开放(pip install PyTDC 即取,无需注册)
DUO 标签 GRU;DrugBank 衍生部分 NPUNCU
语言 英文
首发日期 2020-11(GitHub 首发)/ 2021-02-18(arXiv:2102.09548 v1)/ 2021-12(NeurIPS 2021 Datasets and Benchmarks 正式发表)
最后更新 2025-01-20(PyTDC 1.1.8)/ 2024-06-12(TDC-2 预印本 bioRxiv)
发布机构 哈佛大学医学院 Zitnik 实验室(牵头)/ MIT / Stanford / CMU / UIUC / Georgia Tech / IQVIA 等
官方主页 https://tdcommons.ai
下载地址 pip install PyTDC(数据托管于 Harvard Dataverse,首次调用自动下载)
DOI 10.48550/arXiv.2102.09548(论文)/ 10.1101/2024.06.12.598655(TDC-2 预印本)
引用次数 700+(Google Scholar,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 3 行代码加载 + 5 种官方划分 + 29 个排行榜 + 极简依赖;扣分项:基准无版本锁定可静默变化、测试集公开存在过拟合风险、上游许可异质
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(治疗领域 ICD-11 映射、药物研发管线任务定义、实验测定金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(PyTDC 统一三列格式、三层架构)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 Harvard Zitnik Lab、MIT、Stanford 及 TDC 团队无任何商业利益关联。本页面不销售 TDC 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。TDC 数据集用于药物研发的计算方法研究,其预测结果未经实验验证不得用于任何临床或用药决策。数据集的医学描述基于公开发表的文献,未经逐一临床验证。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。TDC 基准数据未做版本锁定,不同时间下载可能得到不同数据副本,使用者应自行记录下载日期与 PyTDC 版本并验证可复现性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:TDC 代码以 MIT 许可发布,但 66 个数据集聚合自 ChEMBL、DrugBank、BindingDB 等公共来源,各自沿用上游许可条款;其中 DrugBank 衍生数据(如 DDI-DrugBank)仅可用于学术研究,商用需向 DrugBank 单独申请授权。DUO 标签仅供参考,具体使用限制以各数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

TDC(Therapeutics Data Commons,治疗数据公地) 是哈佛大学医学院 Marinka Zitnik 实验室牵头,联合 MIT、斯坦福、CMU、UIUC、Georgia Tech 等机构于 2021 年发布的首个覆盖治疗科学全管线的机器学习基准平台(NeurIPS 2021 Datasets and Benchmarks)。它把散落在数十个公共数据库与文献中的药物研发数据,整理成 22 个学习任务、66 个 AI-ready 数据集——从小分子 ADMET 性质、高通量筛选,到药物-靶点相互作用、药物协同,再到分子生成——全部经 PyTDC 库三行代码加载。

它的历史地位在于"第一次把药物发现 ML 组织成一个体系":在 TDC 之前,MoleculeNet 只覆盖少量分子性质任务,而大量有意义的任务(药物协同、抗体亲和力、临床试验结局)根本没有标准化基准。TDC 独创的"问题—任务—数据集"三层架构、5 种贴近真实研发场景的数据划分(scaffold/冷启动/时间外)与 29 个公开排行榜,让它成为 2021 年后药物 AI 论文的事实评测场,论文引用已超 700 次(截至 2026-09),Google 的 TxGemma 治疗学大模型也以它为核心评测基准。

你可以用它来:3 行代码拉起一个 ADMET 性质预测基线并提交官方排行榜、在 scaffold/冷启动划分下检验模型的真实泛化能力、用 17 个 oracle 做分子生成优化研究、或者直接复现药物协同/抗体-抗原亲和力等前沿任务的文献。2024 年发布的 TDC-2 已扩展到单细胞组学(约 8,500 万细胞)与临床试验数据。

§1.1 摘要

TDC 是一个"平台型数据集":它不生产数据,而是把治疗科学中分散的公开数据策展为统一的机器学习基准。其核心设计是三层架构(团队称之为 TDC “中心法则”):第一层为 3 类机器学习问题——单实例预测(single_pred,预测单个分子/蛋白的性质)、多实例预测(multi_pred,预测实体间关系如 DTI/DDI/PPI)、生成(generation,生成具有期望性质的新分子);第二层为 22 个学习任务,从 ADME、毒性、HTS 到药物协同、抗体-抗原亲和力、逆合成,覆盖靶点发现、活性建模、成药性/安全性、生产制造四大研发管线;第三层为 66 个数据集,规模从 200 到约 200 万数据点。平台同时提供 33 个数据函数(评估器、5 种数据划分、分子格式互转 MolConvert、负采样等)、17 个分子生成 oracle 与 29 个公开排行榜,全部通过 pip install PyTDC 获取,数据托管于 Harvard Dataverse。TDC-2(bioRxiv 2024)进一步引入 1,000+ 多模态数据集、约 8,500 万单细胞、TDC-PrimeKG 知识图谱与 7 个情境化新任务,转向 API-first 的多模态设计。

§1.2 战略价值分析

范式开创维度:TDC 之前,药物发现 ML 的评测是"散装"的——MoleculeNet(2018)只覆盖十余个分子性质数据集,且以 random split 为主,无法回答"模型在新骨架上行不行"这个药厂最关心的问题。TDC 首次把"从靶点到生产"的完整研发管线组织成统一的 ML 任务体系,并把 scaffold split、冷启动、时间外验证这些贴近真实研发的评估协议做成了一键调用的数据函数。这相当于为药物 AI 领域建立了"GLUE 式"的共同评测语言:2021 年后,ADMET benchmark group 的 22 端点成绩几乎成为分子性质预测论文的标配表格。

生态推动维度:TDC 的影响力远超一个数据集合——它是一整套基础设施。DeepPurpose(同团队)提供官方基线模型;tdc_hf_interface 打通 HuggingFace 预训练模型;Google 在 2025 年发布 TxGemma 治疗学大模型时,选择 TDC 任务作为核心评测场;2026 年 Receptor.AI 团队对 TDC ADMET 排行榜的系统审计(JCIM 2026)又成为"公开排行榜可信度"讨论的经典案例,并催生了版本锁定的社区快照(Zenodo)。围绕 TDC 形成的"数据—基准—审计—快照"闭环,使它成为观察整个药物 AI 领域方法论成熟度的最佳窗口。

临床与产业影响维度:药物研发周期长达 13-15 年、单分子成本超过 20 亿美元,而 ADMET 性质不佳可解释高达约 50% 的晚期失败。TDC 把 20 余个药厂实际使用的 ADMET 端点(Caco-2、P-gp、CYP 抑制、hERG、DILI 等)从私有服务器和零散文献中解放出来,全部开源——这让学术界的 ML 研究者第一次能直接在产业界真实关心的问题上做方法研究,也让"AI 虚拟筛选前置淘汰不合格分子"的工业范式有了公开的方法学试验田。

§1.3 横向对比

平台 数据集/任务规模 覆盖管线 划分协议 核心差异化
TDC 66 数据集 / 22 任务(+TDC-2 1,000+ 多模态) 全管线:靶点→活性→成药性/安全→生产 5 种:random/scaffold/冷启动/组合/时间外 管线覆盖最全;29 个排行榜;3 行代码加载
MoleculeNet 17 数据集 主要分子性质(QM/理化/生物活性/毒性) 以 random/scaffold 为主 开创者(2018),但管线窄、无排行榜运营
Polaris(2023-) 30+ 基准(持续增长) ADMET/对接/多任务,产业参与 隐藏测试集竞赛式 针对 TDC 公开测试集痛点设计,采用隐藏测试
OpenADMET(2024-) 聚焦 ADMET 成药性单一域 标准化 + 盲测挑战 与药企合作的新数据生成计划
DeepChem 工具库(内含 MoleculeNet 加载器) featurizer/模型框架最全,基准非其主业

TDC 的不可替代性在三点:管线覆盖宽度(22 任务横跨小分子与生物药)、评估协议的真实感(5 种划分模拟研发实际)、以及排行榜运营带来的社区聚焦效应。其主要短板——公开测试集可被过拟合、基准无版本锁定——正是 Polaris/OpenADMET 等新平台的立身之本(详见 §6.5 坑点 1、2 与 §7.8)。

§1.4 版本演进时间轴

时间 事件
2020-11 GitHub 仓库首发(mims-harvard/TDC),约 20+ 任务、70+ 数据集雏形
2021-01-06 IJCAI 2021 教程 “Machine Learning for Drug Development” 首次系统介绍 TDC
2021-02-18 arXiv:2102.09548 v1 挂出(v2 于 2021-08-28)
2021 v0.1.x 密集迭代:0.1.0 分子质量清洗(canonicalize + 去错误分子);0.1.1 替换 VD/Half Life/Clearance 低质数据源并新增 LD50;0.1.2 发布首个排行榜(ADMET);0.1.6 第二个排行榜(药物组合)
2021-12 NeurIPS 2021 Datasets and Benchmarks 正式发表(Huang et al., NeurIPS 34)
2021 v0.2.0 发布 docking 分子生成基准(DRD3)
2022 v0.3.x:代码库重构 + 文档站 tdc.readthedocs.io(0.3.1);调和 KIBA/DAVIS 冲突亲和力、TWOSIDES 标签名、GDSC 基因符号(0.3.2,Issues #98/#121/#122);cold split 多实体扩展(0.3.3,#127)
2022-10 愿景综述 “Artificial Intelligence Foundation for Therapeutic Science” 发表于 Nature Chemical Biology
2023-01-26 v0.3.9:新增 9 个高通量筛选(HTS)数据集
2023-04-17 v0.4.0:tdc_hf_interface 打通 HuggingFace,首批 9 个 DeepPurpose 预训练模型
2023-07-10 v0.4.1:新增临床试验结局预测任务(TrialOutcome)
2024-06-12 TDC-2 预印本发布(bioRxiv 2024.06.12.598655):1,000+ 多模态数据集、约 8,500 万单细胞、Model Hub、7 个情境化新任务
2025-01-20 PyTDC 1.1.8 发布(当前最新版)
2025-04 Google 发布 TxGemma,以 TDC 任务作为核心评测基准
2026-02/07 Receptor.AI 团队发布 TDC ADMET 排行榜系统审计(bioRxiv → JCIM 2026),并冻结 2026-03-24 基准快照(Zenodo)

§1.5 典型 AI 应用场景

  1. ADMET 性质预测与排行榜评测:22 端点 ADMET benchmark group 是分子性质预测的"高考",scaffold split + 5 种子协议,适合 GNN/Transformer 方法对比与投稿。
  2. 药物-靶点相互作用(DTI)与域泛化研究:BindingDB_Kd/IC50、DAVIS、KIBA 支持冷启动划分;DTI-DG 基准以 2013-2018 训练、2019-2021 时间外测试,是 OOD 泛化方法的标准试验场。
  3. 分子生成与优化:MOSES/ZINC/ChEMBL 参考集 + 17 个 oracle(QED、SA、对接分数、DRD3 等),支持分布学习基准与目标导向生成(goal-directed generation)研究。
  4. 大模型评测与微调:TxGemma 等治疗学基础模型以 TDC 任务为评测标准;PyTDC 数据可直接接入 LLM 提示词/微调管线。
  5. 教学与快速原型:3 行代码加载 + 官方教程(101-106)使 TDC 成为化学信息学课程与黑客松的首选素材;生物药任务(抗体-抗原、Peptide-MHC、miRNA)为小众方向提供现成基准。

§2 医学背景

§2.1 ICD-11 治疗领域锚定

TDC 不是患者级临床数据集,而是药物研发管线数据集——它锚定的不是单一疾病,而是**"从靶点到上市"的治疗产品开发全链路**。其数据集覆盖的主要治疗领域与 ICD-11 的对应关系如下:

TDC 数据集/任务 治疗领域 ICD-11 对应
HTS:HIV HIV 感染抗病毒筛选 1C62.Z HIV 病(未提及并发症)
HTS:SARSCoV2_3CLPro_Diamond / SARSCoV2_Vitro_Touret COVID-19 抗病毒筛选 RA01 COVID-19
DrugRes:GDSC1/GDSC2;DrugSyn:OncoPolyPharmacology/DrugComb 肿瘤精准用药与联合用药 2A00–2F9Z 肿瘤(章级)
Tox:hERG / hERG_Karim / hERG_central 药物心脏毒性(QT 间期延长风险) BA00–BE2Z 循环系统疾病(章级);心律失常相关
Tox:DILI 药物性肝损伤 消化系统疾病章药物性肝病相关编码
Tox:Carcinogens_Lagunin / AMES 致癌性与致突变性 2A00–2F9Z 肿瘤(病因学关联)
GDA:DisGeNET 全疾病谱基因-疾病关联 ICD-11 全章节
TrialOutcome(v0.4.1+)/ TDC-2 临床试验数据 临床试验结局(全适应症) ICD-11 全章节

如何理解这种映射:TDC 的"疾病"维度是间接的——化合物和靶点服务于特定治疗领域,但数据集本身不含患者。做治疗领域细分研究时,应先按 ICD-11/ATC 对化合物适应症或靶点疾病关联自行归类(可借助 GDA-DisGeNET 任务中的基因-疾病关联或 DrugBank 适应症字段),再与上表对照。

§2.2 SNOMED CT 映射

TDC 概念 类型 SNOMED CT SNOMED CT 术语
药物发现(平台主题) 过程 703503005 Drug discovery (procedure)
HTS-HIV 数据集 疾病 109989006 Human immunodeficiency virus infection (disorder)
SARS-CoV-2 数据集 疾病 840539006 Disease caused by 2019 novel coronavirus (disorder)
GDSC/DrugSyn 肿瘤任务 疾病 363346000 Malignant neoplastic disease (disorder)
Tox 任务群 临床概念 药物不良反应相关概念(Adverse drug reaction) 用于安全性终点建模

§2.3 领域简介

药物研发是公认的高成本、长周期、高失败率过程:一个新分子实体从发现到上市平均需要 13-15 年、成本超过 20 亿美元;晚期失败中约半数可归因于 ADMET(吸收、分布、代谢、排泄、毒性)性质不佳而非疗效不足。因此"尽早用计算方法淘汰不合格分子"是制药工业的刚需——这正是 TDC 22 个任务背后共同的临床经济学逻辑:ADME/Tox 任务服务于早期成药性过滤,DTI/HTS 服务于苗头化合物发现,DrugSyn/DrugRes 服务于肿瘤精准联合用药,Yields/RetroSyn/Reaction 服务于生产放大,抗体/多肽/miRNA/CRISPR 任务则覆盖生物药与基因治疗这一增长最快的治疗产品板块。

§2.4 临床任务定义(研发管线视角)

TDC 任务 研发管线阶段 解决的实际问题 ML 操作化
ADME(20+ 端点) 成药性评估 口服能否吸收、能否入脑、会被哪个 CYP 代谢 SMILES → 回归/二分类
Tox(hERG/DILI/AMES/LD50 等) 安全性评估 心脏毒性、肝损伤、致突变、急性毒性 SMILES → 二分类/回归
HTS(HIV/SARS-CoV-2/9 个新 assay) 活性筛选 化合物是否对靶点/病毒有活性 SMILES → 二分类(极度不平衡)
DTI(BindingDB/DAVIS/KIBA) 苗头/先导发现 分子与靶点结合亲和力 (SMILES, 蛋白序列) → 亲和力回归
DDI(TWOSIDES/DrugBank) 用药安全 多药联用的不良相互作用 (SMILES, SMILES) → 645 类副作用多标签
DrugSyn(DrugComb/Merck) 联合用药 两药组合是否协同增效 (SMILES, SMILES, 细胞系) → 协同评分回归
DrugRes(GDSC1/2) 精准肿瘤 特定基因组背景的细胞系对药物响应 (SMILES, 基因表达) → IC50 回归
PeptideMHC / AntibodyAff 生物药/疫苗 多肽-MHC 结合、抗体-抗原亲和力 (肽序列, MHC) / (抗体, 抗原) → 亲和力
MolGen / RetroSyn / Reaction 生产与合成 设计新分子、规划合成路线 分布学习 / 序列到序列
CRISPROutcome 基因治疗 gRNA 编辑结局预测 序列 → 结局回归
TrialOutcome(TDC-1 v0.4.1 / TDC-2) 临床开发 临床试验成功概率 分子+疾病+方案 → 结局分类

§2.5 数据实体覆盖特征

TDC 无患者人群概念,其"人口学"是化学与生物实体的覆盖特征:

维度 特征
数据来源 多源聚合:ChEMBL、PubChem、BindingDB、DrugBank、TWOSIDES(源自 FAERS)、GDSC、SAbDab、IEDB、miRTarBase、USPTO、MOSES、ZINC、QM 系列及数十篇期刊补充数据
实体类型 小分子(SMILES 为主)、蛋白(氨基酸序列)、抗体/多肽、miRNA、gRNA、化学反应式、细胞系基因组学特征
规模跨度 单数据集 200(最小)至约 200 万(MOSES/ChEMBL/TWOSIDES 460 万对)数据点
化学空间 以类药性小分子为主(文献报道生物活性分子),向天然产物/类肽延伸有限
生物药覆盖 抗体-抗原(SAbDab)、Peptide-MHC 多等位基因、miRNA-靶点,规模显著小于小分子
时间跨度 上游文献跨越数十年;BindingDB 等含明确时间戳,支持时间外验证(DTI-DG 用 2013-2018/2019-2021 切分)

§2.6 金标准/参考标准

TDC 的标签"金标准"是实验测定值,但测定体系因任务而异、质量分层明显:

标签来源 测定方式 代表数据集 金标准性质
体外 ADME 测定 Caco-2 细胞通透性、肝微粒体/肝细胞清除率、血浆蛋白结合率等标准药代实验 Caco2_Wang、Clearance_*、PPBR_AZ、VDss_Lombardo 实验金标准;但不同实验室间协议差异可致系统误差
CYP450 抑制/底物 Veith et al. 高通量荧光测定(同源协议) CYP2C9/2D6/3A4/2C19_Veith、*_Substrate_CarbonMangels 同一批大规模测定,内部一致性好
高通量筛选 PubChem 确证性筛选(confirmation screen) HIV、SARSCoV2_*、9 个新 HTS(v0.3.9) 实验金标准;阳性率极低,假阴性偏高
结合亲和力 文献与数据库策展(Ki/Kd/IC50) BindingDB_*、DAVIS、KIBA 多源聚合,测量条件不一;TDC v0.3.2 调和了 KIBA/DAVIS 同对冲突值
毒性终点 AMES 致突变实验、DILI 文献审定(FDA DILIrank 体系)、LD50 动物实验、ClinTox 临床试验记录 AMES、DILI、LD50_Zhu、ClinTox 动物→人体外推不确定;DILI 为专家审定标签
药物不良事件 FAERS 自发呈报数据挖掘(TWOSIDES,Tatonetti 2012 校正混杂) DDI-TWOSIDES 观察性信号,非因果金标准
细胞系药敏 GDSC 细胞系 IC50 测定 GDSC1/GDSC2 高通量实验,批次效应已知
结构生物学 SAbDab 抗原-抗体复合物结构 Paratope/Epitope/AntibodyAff 结构金标准,样本量小(数百)
计算模拟 量子化学计算(DFT)、分子对接 QM7/8/9、DRD3 docking oracle 计算参考值,非实验真值

TDC 层面的质量控制:v0.1.0 对 ADME/Tox/HTS 做了分子质量清洗(规范化 + 移除错误结构);v0.1.1 用更高质量来源替换了 VD/Half Life/Clearance 三个数据集;v0.3.2 调和了 KIBA/DAVIS 中同一 DTI 对的不同亲和力值(Issue #98)。这些修复记录是评估标签可信度的重要参照(GitHub 更新日志完整可查)。


§3 数据集规格

§3.0 版本抉择矩阵

TDC 有两代产品与多种接入方式。30 秒选型:

你的需求 推荐方案 体量 理由
做分子性质/DTI/生成等经典基准研究、复现 2021-2025 文献、需要排行榜 TDC-1(PyTDC 1.1.8) 约 1 GB 量级 22 任务 66 数据集、29 个排行榜、教程与基线最成熟;论文引用均基于此代
可复现性敏感的投稿/监管级研究 TDC-1 + Zenodo 冻结快照(ADMET 组 2026-03-24 版) 1.4 MB(ADMET 组) 官方基准无版本锁定(见 §6.5 坑点 1);用 Koleiev et al. 冻结副本可保证与他人结果严格可比
单细胞组学、临床试验、蛋白-肽等前沿多模态任务 TDC-2(API-first) 1,000+ 数据集 / 约 8,500 万细胞 唯一覆盖情境化(context-specific)任务的版本;预印本 2024-06
只想快速看几个分子性质、不想装环境 tdcommons.ai 在线浏览 + HF Space 网页端可看任务定义与排行榜;tdc_hf_interface 提供 9 个 DeepPurpose 预训练模型在线推理
仅需单个原始数据集(不依赖平台) 上游源站直连(ChEMBL/BindingDB/DrugBank 等) 视源而定 绕过 PyTDC;但失去统一划分与评估协议,结果不可与排行榜比较

一句话结论:基准研究用 TDC-1(PyTDC),可复现性敏感场景叠加 Zenodo 快照,单细胞/临床/多模态新课题用 TDC-2。

TDC-1 vs TDC-2 关键差异速查

维度 TDC-1(2021) TDC-2(2024)
规模 66 数据集 / 22 任务 1,000+ 多模态数据集 / 7 个新任务
模态 小分子、蛋白/抗体/肽序列、互作网络、化学反应 新增单细胞表达(约 8,500 万细胞)、临床试验、肽/类肽、3D 结构、细胞类型特异 PPI
接入方式 PyTDC 库(本地 DataFrame) API-first(model-view-controller 范式)+ Model Hub
知识资源 TDC-PrimeKG(4M+ 精准医学知识图谱)
预计算嵌入 5 个单细胞基础模型嵌入(CZ CELLxGENE Census)
代表新任务 情境化 DTI、单细胞扰动响应、蛋白-肽结合、临床试验结局
基准 29 个排行榜 15+ SOTA 模型 × 5+ 新任务基准;首个 context-specific learning 基准
发表状态 NeurIPS 2021(正式) bioRxiv 预印本(2024-06)

§3.1 模态详细说明

TDC-1 包含五大模态:

  1. 小分子结构:以 canonical SMILES 为通用输入格式(每行一个分子);MolConvert 支持 SMILES/SELFIES 与 Graph2D、PyG、DGL、ECFP2-6、MACCS、Daylight、RDKit2D、Morgan、PubChem 等约 15 种 2D 表示互转,3D 任务支持 XYZ/SDF 到 Graph3D/Coulomb Matrix。
  2. 生物大分子序列:蛋白(DTI/PPI 任务中的氨基酸序列)、抗体可变区(SAbDab 衍生)、抗原/多肽(IEDB、MHC 等位基因)、miRNA(miRTarBase)、gRNA(CRISPROutcome)。
  3. 相互作用与网络:DTI/DDI/PPI/GDA/MTI 等实体对数据,多配负采样协议;TDC-2 新增 TDC-PrimeKG 知识图谱与细胞类型特异 PPI。
  4. 细胞系组学特征:GDSC 药物反应数据含细胞系基因表达;TDC-2 扩展为约 8,500 万单细胞的表达图谱与预计算嵌入。
  5. 化学反应与计算数据:USPTO 反应与逆合成、催化剂预测、产率回归;QM7b/8/9 量子化学计算性质;DRD3 对接分数 oracle。

§3.2 样本量拆分(22 任务 66 数据集完整清单)

A. 单实例预测 single_pred(9 任务 / 37 数据集)

任务 管线阶段 代表数据集(规模,官方文档口径) 指标/划分
ADME 成药性 Caco2_Wang 906、HIA_Hou 578、Pgp_Broccatelli 1,212、Bioavailability_Ma 640、Lipophilicity_AstraZeneca 4,200、Solubility_AqSolDB 9,982、BBB_Martins 1,975、PPBR_AZ 1,797、VDss_Lombardo 1,130、Half_Life_Obach 667、Clearance_Hepatocyte_AZ 1,213、Clearance_Microsome_AZ 1,102 MAE/AUROC · scaffold
ADME-CYP 成药性 CYP2C9_Veith 12,092、CYP2D6_Veith 13,130、CYP3A4_Veith 12,328、CYP2C19_Veith 12,665、CYP2C9_Substrate_CarbonMangels 666、CYP2D6_Substrate_CarbonMangels 664、CYP3A4_Substrate_CarbonMangels 667 AUROC/AP · scaffold
Tox 安全性 LD50_Zhu 7,385、hERG 648、AMES 7,255、DILI 475、Skin Reaction 404、Carcinogens_Lagunin 278、ClinTox 1,484、hERG_Karim 13,445、hERG_central(约 30 万) AUROC/MAE · scaffold
Tox-多任务 安全性 Tox21 7,831(12 终点)、ToxCast 8,576(多终点) AUROC · scaffold
HTS 活性筛选 HIV 41,127、SARSCoV2_3CLPro_Diamond 879、SARSCoV2_Vitro_Touret 1,480 + v0.3.9 新增 9 个确证筛选 AUROC/AUPRC · scaffold
QM 物理化学 QM7b 7,211、QM8 21,786、QM9 133,885 MAE · random
Yields 生产制造 Buchwald-Hartwig 3,955、Suzuki 5,760 MAE · random
Paratope / Epitope 生物药 SAbDab 衍生(数百抗体)、IEDB_Jespersen 3,159 AUROC · random
Develop 生物药成药性 抗体成药性(Jain 等,2,414) AUROC · random
CRISPROutcome 基因治疗 Leenay 1,521 回归指标 · random

B. 多实例预测 multi_pred(10 任务 / 24 数据集)

任务 管线阶段 代表数据集(规模,官方文档口径) 指标/划分
DTI 活性建模 BindingDB_Kd 52,284、BindingDB_IC50 991,486、BindingDB_Ki、DAVIS 30,056、KIBA 118,254、BindingDB_Patent MAE/Pearson · cold split(按药物/靶点)
DDI 用药安全 TWOSIDES 4,649,441(645 类副作用)、DrugBank 191,808 AUROC · random/冷启动
PPI 靶点发现 HuRI、Human、Yeast AUROC · random
GDA 靶点发现 DisGeNET 81,746 AUROC · random
DrugRes 精准肿瘤 GDSC1 310,904、GDSC2 126,142 MAE/Pearson · 按细胞系/药物冷启动
DrugSyn 联合用药 DrugComb 659,333、OncoPolyPharmacology(Merck)23,052、DrugCombDB MAE · 组合划分
PeptideMHC 疫苗/免疫 MHC I 类等位基因多数据集(NetMHCPan 体系) AUROC · random
AntibodyAff 生物药 SAbDab(数百复合物) MAE · random
MTI 核酸药物 miRTarBase 51,397 AUROC · random
Catalyst 生产制造 USPTO_Catalyst 721,156 Top-1 准确率 · random

C. 生成 generation(3 任务 / 5 数据集)

任务 管线阶段 数据集(规模,官方文档口径) 指标/划分
MolGen 活性建模 MOSES 1,936,962、ZINC 249,455、ChEMBL 1,961,462 Validity/Uniqueness/Novelty/FCD 等 · 官方划分
RetroSyn 生产制造 USPTO-50K 50,037、USPTO(约 180 万) Top-k 准确率 · 官方划分
Reaction 生产制造 USPTO 反应类别(约 44 万) Top-k 准确率 · 官方划分

注:以上规模数值引自 TDC 论文 Table 2(NeurIPS 2021)与官方文档;个别数据集在后续版本中经质量清洗行数略有出入(如 v0.1.0/v0.3.2 修复),以你本地 PyTDC 版本实际加载为准——这正是 §6.5 坑点 1 的核心教训。

§3.3 数据格式详情

形态 格式 说明
统一接口 pandas DataFrame get_data(format='df');单实例任务为 Drug_ID / Drug / Y 三列,多实例为 X_ID/X/Y_ID/Y/Y 等变体
原始文件 CSV/TSV 托管于 Harvard Dataverse,首次调用自动下载缓存至 ~/.tdc
分子表示 SMILES(默认)/ SELFIES / 分子图 / 指纹 MolConvert 约 15 种格式互转(ECFP、MACCS、RDKit2D、PyG、DGL、Graph3D 等)
序列表示 氨基酸/核酸字符串 DTI/PPI/AntibodyAff/PeptideMHC/MTI/CRISPROutcome
模型接口 tdc_hf_interface v0.4.0 起加载 HuggingFace 预训练模型(首批 9 个 DeepPurpose 模型)
TDC-2 API-first model-view-controller 范式,Model Hub 远程嵌入与预测端点

§3.4 存储大小

形态 大小 备注
TDC-1 核心 66 数据集 约 1 GB 量级 单数据集从数十 KB(Carcinogens 278 行)到数百 MB(TWOSIDES 460 万对)
ADMET benchmark group 快照 1.4 MB(tar.gz) Koleiev et al. Zenodo 冻结版(2026-03-24),22 端点
TDC-2 单细胞嵌入 远端 API 消费为主 约 8,500 万细胞 × 5 模型嵌入,不建议全量本地化
本地缓存位置 ~/.tdc data = ADME(name='Caco2_Wang', path='./data') 可自定义

§3.5 标注方式

TDC 无人工众包标注,标签来源三层(与 §2.6 对应):

  1. 实验测定标签(最可靠):体外 ADME 实验、CYP 高通量测定、HTS 确证筛选、亲和力测定、毒理实验——由原始文献/数据库产生,TDC 做单位与规范化清洗。
  2. 文献与数据库策展标签(有噪声):ChEMBL/BindingDB/DrugBank 聚合的亲和力与相互作用,测量条件异质;DILI 等为专家审定标签。
  3. 数据挖掘信号(观察性):TWOSIDES 的 DDI 副作用信号源自 FAERS 自发呈报,经 Tatonetti 2012 的混杂校正算法产生,属关联信号而非因果标签。

§3.6 标注者资质

不适用传统标注者概念。实验数据产生者为各上游实验室(如 Veith et al. 的 CYP 测定、NCATS/高校 HTS 中心);策展数据由 ChEMBL/BindingDB/DrugBank 等专业数据库团队维护;TDC 团队负责 ML-ready 化清洗(canonicalization、错误结构移除、冲突调和),修复历史完整记录于 GitHub 更新日志与 Issues(#98/#121/#122 等)。

§3.7 数据采集时间范围

上游实验数据跨越数十年公开文献(ChEMBL 等可追溯至 20 世纪中叶的生物活性记录);TDC 平台本身的策展期为 2020-11(GitHub 首发)至 2025-01-20(PyTDC 1.1.8)。含明确时间戳的数据集(BindingDB 专利/文献年份)支持时间外验证,DTI-DG 基准即以 2013-2018/2019-2021 切分。

§3.8 地理覆盖

多源国际聚合——ChEMBL(欧洲生物信息研究所)、DrugBank(加拿大)、BindingDB(美国)、FAERS(美国 FDA)、PubChem(美国 NIH)、GDSC(英美联合)等。无单一地理中心,但也意味着测定协议与人群背景的隐性偏向(详见 §7.1)。

§3.9 实验测定体系

测定体系 来源 覆盖数据集 说明
Caco-2 细胞通透性 Wang et al. 文献 Caco2_Wang log 表观通透系数(cm/s)
CYP450 高通量荧光测定 Veith et al. 2009 CYP*_Veith 系列 同源协议,内部一致性最佳
PubChem 确证筛选(AIDs) NCATS/高校 HIV、SARSCoV2_*、9 个新 HTS 二次确认活性,假阳性低于初筛
表面等离子共振/酶学亲和力 多源文献(BindingDB 策展) BindingDB_*、DAVIS、KIBA Ki/Kd/IC50 异源聚合
量子化学计算(DFT) QM 系列论文 QM7b/QM8/QM9 计算参考值
分子对接 smina/AutoDock 体系 DRD3 docking oracle 计算代理指标
自发呈报系统数据挖掘 FDA FAERS TWOSIDES Tatonetti 2012 校正算法

§3.10 深度溯源链

环节 系统/方法 关键转换
1. 原始实验 各上游实验室体外测定/HTS/毒理实验/计算模拟 实验值以补充材料或数据库条目形式公开
2. 数据库策展 ChEMBL/BindingDB/DrugBank/PubChem/GDSC/SAbDab/FAERS 等 专业策展团队结构化收录,附带测定条件元数据
3. TDC ML-ready 化 PyTDC 清洗管道 分子 canonicalization、错误结构移除(v0.1.0)、低质来源替换(v0.1.1)、冲突值调和(v0.3.2)、统一为三列 DataFrame
4. 任务组织 三层架构(Problem → Task → Dataset) 22 任务 66 数据集;每数据集标注推荐指标与划分
5. 评估协议 5 种数据划分 + 23 种评估策略 + benchmark group scaffold/冷启动/时间外等模拟真实研发场景
6. 公开发布 PyPI(PyTDC)+ Harvard Dataverse + tdcommons.ai 排行榜 三行代码加载;⚠️ 无版本锁定(见 §6.5 坑点 1)

§4 数据结构详解

§4.0 目录结构预览

~/.tdc/                              # PyTDC 默认缓存根目录(可用 path= 自定义)
├── caco2_wang.tab                   # 单实例任务:Drug_ID, Drug, Y 三列
├── hia_hou.tab
├── ld50_zhu.tab
├── bindingdb_kd.tab                 # DTI:X_ID, X(SMILES), Target_ID, Target(序列), Y
├── davis.tab / kiba.tab
├── twosides.tab                     # DDI:药物对 + 645 类副作用标签
├── drugcomb.tab                     # DrugSyn:两药 + 细胞系 + 协同评分
├── gdsc1.tab / gdsc2.tab            # DrugRes:药物 + 细胞系组学 + IC50
├── moses.tab / zinc.tab / chembl.tab # MolGen 参考集
├── uspto50k.tab / uspto.tab         # RetroSyn/Reaction
└── ...(其余数据集按需下载,首次调用时自动获取)

加载后的内存结构(以 ADME 为例):

>>> data = ADME(name='Caco2_Wang')
>>> data.get_data().head(2)
       Drug_ID                Drug           Y
0  CHEMBLxxxxxx  CC(=O)NC1=CC=...    -4.85
1  CHEMBLxxxxxx  COC1=CC=...         -5.10
>>> split = data.get_split(method='scaffold', seed=1, frac=[0.7, 0.1, 0.2])
>>> split.keys()
dict_keys(['train', 'valid', 'test'])   # 三个 pandas DataFrame

§4.1 DAIMS 标准化字段描述表

核心格式 A:单实例预测(single_pred,以 ADME 为例)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
Drug_ID string TDC 化合物标识(可溯 PubChem/ChEMBL ID) “CHEMBL25” ID 溯源、跨数据集对齐 个别历史版本 ID 体系调整 不允许缺失 文本
Drug string canonical SMILES “CC(=O)NC1=CC=C(O)C=C1” 模型输入(可 MolConvert 转图/指纹) v0.1.0 已清洗错误结构;盐/立体化学处理见 §6.5 坑点 5 不允许缺失 ASCII SMILES
Y float/int 端点值:回归为连续测定值(常为 log 单位),分类为 0/1 -4.85(log cm/s)/ 1 预测目标 实验测定误差(±0.2-0.3 log 单位常见) 不允许缺失 因端点而异

核心格式 B:多实例预测(multi_pred,以 DTI 为例)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
X_ID / Drug_ID string 药物标识 “DB00001” 冷启动划分分组键 DrugBank/ChEMBL 双源 ID 注意区分 不允许缺失 文本
X / Drug string 药物 SMILES “CC1=CN…” 模型输入 同 A 不允许缺失 ASCII SMILES
Target_ID string 靶点标识(UniProt 可溯) “P00533” 冷启动划分分组键 不允许缺失 文本
Target string 蛋白氨基酸序列 “MRPSGTAGA…” 模型输入(序列模型/PLM 嵌入) 序列版本差异 不允许缺失 20 字母氨基酸
Y float 亲和力(Kd/IC50/Ki,部分版本做了 log 变换) 7.35 预测目标 异源测定条件差异大;v0.3.2 调和冲突值 不允许缺失 视数据集

核心格式 C:生成任务参考集(generation.MolGen)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
SMILES string 参考分子 SMILES “CN1C=NC2=…” 分布学习训练集 MOSES 已做药用化学过滤 不允许缺失 ASCII
SPLIT string 官方划分标记 “train” 复现 MOSES 基准 不允许缺失 train/test/scaffold_test

§4.2 标签分布统计

数据集/任务 阳性率/分布 说明
HTS-HIV 阳性率约 3.4%(41,127 中约 1,443 活性) 典型 HTS 极度不平衡,必报 AUPRC
SARSCoV2_Vitro_Touret 阳性率约 3-4% 同左
DILI 475 样本,阳性约 50%(专家平衡审定) 人工平衡的小样本
Carcinogens_Lagunin 278 样本,阳性约 55% 最小端点之一,排名噪声大(见 §6.5 坑点 3)
CYP*_Veith 抑制 各端点阳性率约 40-60% 同源测定,分布最规整
TWOSIDES(DDI) 645 类副作用长尾分布 高频事件数千对,低频事件个位数,长尾类别不可单独建模
Tox21 12 终点阳性率各异(多数 <10%) 多标签不平衡
BindingDB_Kd 亲和力 连续值,pKd 约 4-10 回归目标近似正态
GDSC IC50 连续值(log μM) 细胞系间分布差异显著

§4.3 关键字段描述性统计

  • 分子量分布:ADMET 组以 200-600 Da 类药分子为主(Lipinski 空间);ZINC 参考集倾向更小片段样分子。
  • SMILES 长度:多数 20-80 字符;大环/类肽可超 150。
  • 序列长度:DTI 靶点蛋白中位约 500-800 aa;抗体可变区约 110-130 aa;MHC 肽段 8-15 aa。
  • ADMET benchmark group 22 端点中:回归端点 12 个(MAE)、分类端点 10 个(AUROC/AP);官方要求 5 种子均值±标准差报告。

§4.4 数据层级关系(三层架构)

TDC
├── single_pred(单实例预测:预测单个实体性质)
│   ├── ADME / Tox / HTS / QM / Yields
│   ├── Paratope / Epitope / Develop(生物药)
│   └── CRISPROutcome(基因编辑)
├── multi_pred(多实例预测:预测实体间关系)
│   ├── DTI / DDI / PPI / GDA
│   ├── DrugRes / DrugSyn
│   ├── PeptideMHC / AntibodyAff / MTI
│   └── Catalyst
└── generation(生成:产生具有期望性质的新实体)
    ├── MolGen(+ 17 个 oracle:QED/SA/DRD3/对接分数等)
    ├── RetroSyn
    └── Reaction
  • 编程对应:from tdc.<Problem> import <Task><Task>(name='<Dataset>'),三层与 API 一一映射。
  • 高频踩坑:任务名与数据集名容易混淆(ADME 是任务、Caco2_Wang 是数据集);不同任务下可能重名数据集(DrugBank 同时出现在 DTI 与 DDI)。
  • benchmark group 是第四层"组合"概念:BenchmarkGroup(name='ADMET_Group') 聚合 22 个 ADMET 端点子基准,统一 scaffold 划分与评估协议。

§4.5 缺失值情况与信息性缺失编码

缺失类型 场景 缺失原因 对 AI 的影响
结构性完整 绝大多数 TDC-1 数据集 v0.1.0 清洗后 Drug/Y 列无缺失 无需插补;但"未测定"信息已丢失
MAR(测定选择) ChEMBL/BindingDB 类策展数据 活性差的化合物往往未做进一步测定 标签分布偏向活性分子,模型外推到弱活性区间不可靠
MNAR(发表偏倚) HTS/文献生物活性 阴性结果少发表 阳性率被系统性高估(见 §7.1)
多任务矩阵稀疏 Tox21/ToxCast 多终点 并非每个化合物都测了全部终点 多任务学习需掩码损失,不可整行丢弃
版本间行数漂移 同名数据集不同 PyTDC 版本 质量清洗/来源替换 与他人结果比较前必须核对版本(见 §6.5 坑点 1)

§5 数据划分与使用建议

§5.1 官方数据划分

TDC 提供 5 种官方划分data.get_split(method=...)),这是它区别于多数基准的核心资产:

划分 适用任务 模拟的真实场景 调用
Random 全部 基线参照(不考验泛化) method='random'
Scaffold 小分子单实例 全新化学骨架(lead hopping)——药厂实际 method='scaffold'(默认 seed=1, frac=[0.7,0.1,0.2])
Cold-Start DTI/DDI/PPI/DrugRes 测试集含训练中未见的药物/靶点/细胞系 method='cold_split', column_name='Drug'(v0.3.3 起支持多实体)
Combinatorial DrugSyn 测试集为未见过的药物组合(单药均见过) method='combination_split'
Temporal 含时间戳数据集 用过去预测未来(前瞻性验证) DTI-DG 基准内置(2013-2018 → 2019-2021)

关键事实:ADMET benchmark group 的排行榜成绩 = 官方固定 scaffold 划分(seed 1)+ 5 个辅助种子(get_auxiliary_train_valid_split(seed=42, ...))多次训练 + 单次测试集评估的均值±标准差。偏离此协议的成绩不可与排行榜比较。

§5.2 推荐划分策略

  1. 论文投稿/排行榜:严格使用官方 benchmark group 协议,报告 5 种子均值±标准差。
  2. 方法学研究:至少报告 random + scaffold 双口径,二者差值即"骨架泛化代价";DTI 任务必须含 cold split(随机划分下实体泄漏会虚高 10-20 个百分点)。
  3. 前瞻性质:BindingDB 系数据用时间划分(DTI-DG 已内置),这是唯一模拟"未来专利分子"的方式。
  4. 自定义划分get_split 支持修改 seed/frac;改动后须在论文中明示"非官方协议"。

§5.3 数据泄漏风险防御

# 泄漏模式 严重程度 防御措施
1 DTI 用 random split(同药物/同靶点横跨训练与测试) 一律 cold split;官方默认即 cold
2 相似骨架泄漏(random split 下 scaffold 重复) 小分子任务用 scaffold split
3 用测试集做超参搜索/早停(公开测试集) 严格 train/valid 调参,test 只评估一次;参见 Koleiev 2026 审计(§6.5 坑点 2)
4 训练集含测试集同分子的不同测定值(重复条目) 中高 检查 Drug_ID/InChIKey 跨折重复;v0.3.2 已调和 KIBA/DAVIS 冲突,但跨数据集(如 DAVIS vs BindingDB)混用时需自查
5 生成任务中测试集分子进入预训练语料 分子基础模型预训练集与 MOSES/ChEMBL 测试集去重(按 InChIKey)

§5.4 交叉验证建议

  • 官方协议即"5 种子 train/valid 重采样 + 单次 test",本质等价于多次交叉验证;无需另行 K 折。
  • 小样本端点(<1,000)建议附加 bootstrap 置信区间;排名差小于 CI 重叠时不应宣称领先(admet-honest-audit 项目做法)。
  • 骨架簇交叉验证(GroupKFold by Murcko scaffold)是比随机 K 折更严格的内部验证。

§5.5 外部验证

在 TDC 上训练的模型,经典外部验证路径:跨数据集迁移(如 Caco2_Wang 训练 → 其他通透性文献集)、时间外验证(DTI-DG 2019-2021 域)、跨平台对照(MoleculeNet 同端点 random split 成绩通常显著高于 TDC scaffold 口径——这本身即是"划分决定难度"的证据)、湿实验验证(HTS 任务模型的 top-k 化合物做体外复测,为最高级验证)。


§6 AI 就绪指南

§6.0 云端快速启动

零安装体验:TDC 官方教程(101-106)以 Jupyter Notebook 发布于 GitHub,可直接在 Google Colab 打开运行;核心依赖极轻(numpy/pandas/tqdm/scikit-learn/fuzzywuzzy/seaborn),Colab 免费 CPU 环境 pip install PyTDC 后即可在数分钟内完成首个 ADMET 数据集加载、划分与基线评估。

HuggingFace 推理:v0.4.0 起 tdc_hf_interface 可加载托管在 HuggingFace 的 DeepPurpose 预训练模型(首批 9 个,覆盖 BBB 穿透、hERG、CYP3A4 抑制等热门端点),无需训练即可对任意 SMILES 做性质预测。

# Colab 首个单元格(约 2 分钟跑通)
!pip install PyTDC -q
from tdc.single_pred import ADME
data = ADME(name='Caco2_Wang')
split = data.get_split(method='scaffold')
print({k: v.shape for k, v in split.items()})
# {'train': (634, 3), 'valid': (91, 3), 'test': (181, 3)}(官方 seed=1 口径)

§6.1 快速上手

# ========================================
# TDC 快速上手 — 单实例预测 + benchmark group 双模式
# 环境要求: pip install PyTDC(核心依赖仅 numpy/pandas/tqdm/scikit-learn 等)
#           scaffold split 与 oracle 等进阶函数需 RDKit:
#           conda install -c conda-forge pytdc
#
# ⚠️ 数据路径约定:
#   首次调用自动从 Harvard Dataverse 下载并缓存至 ~/.tdc(可用 path='./data' 自定义)
#   无需手动下载任何文件;离线环境需预先拷贝缓存目录
# ========================================

# ---- 模式 1:单数据集三行代码 ----
from tdc.single_pred import ADME
data = ADME(name='Caco2_Wang')              # ① 加载
split = data.get_split(method='scaffold')   # ② 官方划分
train, valid, test = split['train'], split['valid'], split['test']  # ③ 就绪

# ---- 模式 2:ADMET benchmark group(排行榜标准协议)----
from tdc import BenchmarkGroup
group = BenchmarkGroup(name='ADMET_Group', path='data/')
predictions = {}
for benchmark in group:                      # 22 个端点子基准
    name = benchmark['name']
    train, valid, test = benchmark['train'], benchmark['valid'], benchmark['test']
    ## --- 在此训练你的模型 ---
    # predictions[name] = y_pred
# group.evaluate(predictions)               # 自动按各端点指标汇总
# {'caco2_wang': {'mae': 0.234}, 'hia_hou': {'roc-auc': 0.786}, ...}

# 官方 5 种子协议(排行榜要求报告均值±标准差):
out = group.get_auxiliary_train_valid_split(seed=42, benchmark='Caco2_Wang')
train, valid = out['train'], out['valid']   # 用辅助种子重采样做多次训练

§6.2 数据获取流程

获取方式 链接/位置 大小 流程
PyTDC(推荐) pip install PyTDC 按需下载 首次调用自动从 Harvard Dataverse 拉取并缓存 ~/.tdc;无需注册
conda 完整版 conda install -c conda-forge pytdc 含 RDKit 等进阶依赖(scaffold split/oracle 必需)
在线浏览 https://tdcommons.ai 任务定义、数据集说明、排行榜网页版
冻结快照(可复现性敏感) Zenodo 记录 20180944(ADMET 组 2026-03-24) 1.4 MB CC-BY 4.0,含 22 端点 train_val/test 固定副本
TDC-2 https://tdcommons.ai(API-first) 远端 Model Hub API 消费单细胞嵌入与预测端点
HF 预训练模型 huggingface.co/tdc tdc_hf_interface 加载 DeepPurpose 模型

许可提示:代码 MIT;DrugBank 衍生数据(DDI-DrugBank 等)仅限学术研究,商用需向 DrugBank 申请许可(见 §6.5 坑点 8)。

§6.3 预处理 Pipeline

<details>
<summary><b>点击展开完整的 5 步预处理代码(单实例任务,SMILES → 特征)</b></summary>

# 步骤 1:加载与官方划分
from tdc.single_pred import Tox
data = Tox(name='hERG')
split = data.get_split(method='scaffold', seed=1, frac=[0.7, 0.1, 0.2])
train, valid, test = split['train'], split['valid'], split['test']

# 步骤 2:SMILES 规范化自检(去盐/统一 canonical 形式)
from rdkit import Chem
from rdkit.Chem.SaltRemover import SaltRemover
remover = SaltRemover()

def clean_smiles(s):
    mol = Chem.MolFromSmiles(s)
    if mol is None:
        return None                       # 无法解析:剔除并记录
    mol = remover.StripMol(mol)           # 去盐/反离子
    return Chem.MolToSmiles(mol)          # canonical 形式

for part in (train, valid, test):
    part['Drug'] = part['Drug'].map(clean_smiles)
    part.dropna(subset=['Drug'], inplace=True)

# 步骤 3:特征化(Morgan 指纹 + RDKit 2D 描述符双轨)
from tdc.chem_utils import MolConvert
converter = MolConvert(src='SMILES', dst='Morgan')   # 约 15 种格式可选
fps = converter(train['Drug'].tolist())
# RDKit2D:MolConvert(src='SMILES', dst='RDKit2D')

# 步骤 4:不平衡处理(hERG 阳性率低,类别权重)
import numpy as np
pos_weight = (len(train) - train['Y'].sum()) / max(train['Y'].sum(), 1)

# 步骤 5:版本留痕(可复现性关键,见坑点 1)
import tdc, hashlib, pandas as pd
print('PyTDC version:', tdc.__version__)
print('train hash:', hashlib.md5(pd.util.hash_pandas_object(train).values).hexdigest())

</details>

推荐直接使用官方/社区成熟工具替代手写:MolConvert(SMILES↔图/指纹/SELFIES)、tdc.Evaluator(官方指标 3 行调用)、tdc.chem_utils 的 label transform/binarize/molecule filters、DeepPurpose(官方基线模型库)、admet-honest-audit(泄漏检查参考实现)。

§6.4 框架加载

# PyTorch:Morgan 指纹 + MLP(最小可复现基线)
import torch
from torch.utils.data import Dataset, DataLoader

class MolDataset(Dataset):
    def __init__(self, X, y):
        self.X = torch.FloatTensor(np.stack(X))
        self.y = torch.FloatTensor(y.values)
    def __len__(self):
        return len(self.y)
    def __getitem__(self, i):
        return self.X[i], self.y[i]

loader = DataLoader(MolDataset(fps, train['Y']), batch_size=64, shuffle=True)
# DeepPurpose:官方基线库一行训练(GNN/CNN/Transformer 编码器任选)
from DeepPurpose import CompoundPred as models
model = models.model_pretrained(model='MPNN')   # 或自定义 config
# 详细用法见 github.com/kexinhuang12345/DeepPurpose
# PyG 图神经网络接入
from tdc.chem_utils import MolConvert
to_pyg = MolConvert(src='SMILES', dst='PyG')
graphs = to_pyg(train['Drug'].tolist())         # 直接喂 torch_geometric DataLoader

§6.5 常见坑点

⚠️ 坑点 1:基准无版本锁定——同名数据集今天下载与昨天下载可能不同(分类:工程陷阱)

问题:TDC 公开基准未做版本固定,底层数据文件会随 PyTDC 更新静默变化(质量清洗、来源替换、划分调整),不同时间重新下载可能得到不同数据副本,导致旧论文结果无法复现。

症状:按论文报告的行数/划分复核时对不上;同一模型重跑指标漂移;与他人比较的"同基准"实为不同数据副本。

解决:(1) 投稿级研究使用 Koleiev et al. 在 Zenodo 冻结的 ADMET benchmark group 快照(2026-03-24,记录 20180944,CC-BY 4.0);(2) 记录并报告 tdc.__version__ 与下载日期,对训练文件计算哈希留痕(§6.3 步骤 5);(3) 锁定 PyTDC==x.y.z 并随代码分发缓存目录;(4) 论文方法部分写明"数据于 YYYY-MM-DD 经 PyTDC x.y.z 下载"。

参考:Zenodo 记录 20180944(快照说明原文);Koleiev et al. (2026), JCIM, DOI: 10.1021/acs.jcim.6c00819。

⚠️ 坑点 2:排行榜名次 ≠ 模型质量——公开测试集过拟合与上榜模型泄漏(分类:评估误用)

问题:TDC 测试集完全公开,对测试集(有意或无意)调参可显著抬高指标与排名。2026 年 Receptor.AI 对全部 22 个 ADMET 端点 top-3 模型的系统审计发现:仅 3 个模型(CaliciBoost、MapLight、MapLight+GNN)通过环境可复现、无泄漏、超参流程合规的全部检查;MiniMol、GradientBoost、XGBoost 上榜方案存在直接或间接数据泄漏;其余多数存在代码不可得、环境不可复现或方法学缺陷。

症状:复现上榜模型时性能大幅缩水;自己的"诚实"模型排名远低于榜单顶部;同一架构换随机种子后排名大幅跳动。

解决:(1) 把排行榜当作"候选方法清单"而非质量排序,优先复现通过审计的模型;(2) 自家管线严格执行测试集隔离——test 只在模型冻结后评估一次,所有调参用 valid;(3) 报告 bootstrap 置信区间;(4) 评审他人论文时核对"测试集读取次数"。

参考:Koleiev et al. (2026), “An End-User Audit of Reproducibility, Data Leakage, and Overfitting of the Top-Ranked ADMET Prediction Models in TDC Leaderboards”, JCIM, DOI: 10.1021/acs.jcim.6c00819(预印本 bioRxiv 2026.02.26.708193)。

⚠️ 坑点 3:小样本端点的排名差异落在抽样噪声内(分类:评估误用)

问题:ADMET 组含多个小端点(Carcinogens 278、DILI 475、HIA 578、Bioavailability 640、hERG 648、Caco2 906)。scaffold 划分后测试集仅约 60-180 个分子,AUROC 的 95% CI 可宽达 ±0.05 以上——榜单上 ±0.01-0.02 的名次差异没有统计意义。

症状:同一模型换种子排名大幅波动;"第 1 名"与"第 5 名"的 CI 完全重叠;小端点上简单模型反超复杂模型。

解决:(1) 小端点成绩必须附 bootstrap CI 并说明检验功效(如 cyp2d6 测试集约 135 样本/约 37 个少数类正例,不支持高精度排名声明);(2) 多端点结论以"若干端点一致优势"而非单端点名次立论;(3) 内部研发采用更大自采数据验证。

参考:admet-honest-audit 项目(GitHub: deweihu96/admet-honest-audit)的 variance_check 与 novelty-tier gate 设计。

⚠️ 坑点 4:scaffold split 与 random split 混用导致"虚假 SOTA"(分类:标签理解)

问题:同一端点在 random split 下的 AUROC 通常比 scaffold split 高 0.05-0.15(骨架泄漏)。综述或对比实验若混用两种口径,结论完全失真。

症状:复现论文性能远高于官方基线;比较表中本方法(random)"碾压"基线(scaffold)。

解决:(1) 任何对比表注明划分协议,不同口径分行报告;(2) 复现他人工作先核对 get_split(method=...) 与 seed/frac;(3) 小分子泛化声明一律以 scaffold(或更严格的时间/冷启动)口径为准。

参考:TDC 论文 §10 实验(arXiv:2102.09548);MoleculeNet 论文(random 口径)与 TDC(scaffold 口径)数值差异可作直观对照。

⚠️ 坑点 5:SMILES 规范化陷阱——盐、立体化学与 canonicalization 不一致(分类:预处理陷阱)

问题:TDC 在 v0.1.0 做过分子质量清洗,但跨来源 SMILES 的盐形式、互变异构、立体化学标记处理并不统一;不同 RDKit 版本的 canonical SMILES 也可能变化。指纹/图特征对输入形式敏感,同一分子的两种写法会得到不同表征。

症状:同分子重复条目未被去重(InChIKey 相同但 SMILES 不同);升级 RDKit 后特征矩阵全变;预训练模型的 vocab 与本地 token 化不匹配。

解决:(1) 统一经 MolFromSmiles → SaltRemover → MolToSmiles 规范化(§6.3 步骤 2)并以 InChIKey 作为去重与跨表连接键;(2) 锁定 RDKit 版本;(3) 与预训练模型对接时严格复用其官方 tokenization 脚本。

参考:TDC v0.1.0 更新日志(分子质量清洗说明);RDKit 文档(SaltRemover/标准化)。

⚠️ 坑点 6:多实例任务的负采样协议决定指标口径(分类:数据泄漏)

问题:DDI/PPI/GDA/MTI 等任务的负例由采样产生,不同负采样策略(随机、按度分布、按实体)下 AUROC/AUPRC 差异巨大;部分早期文献使用与官方不同的负采样,结果不可比。随机负采样还会把"训练集出现过的实体对"采入测试集造成泄漏。

症状:同数据集的文献 AUROC 从 0.7 到 0.95 不等;复现官方基线对不上某篇论文的数值。

解决:(1) 使用官方数据函数提供的负采样与划分,不自行发明;(2) 论文中写明负采样比例、策略与随机种子;(3) 负例生成必须在划分之后、按折内实体独立进行。

参考:TDC 论文 §8.2(数据函数—负采样);PyTDC neg_sample 文档。

⚠️ 坑点 7:生成任务的 oracle 是代理指标——警惕奖励黑客与分布坍缩(分类:标签理解)

问题:17 个 oracle(QED、SA、DRD3 对接分数等)是真实药物性质的不完美代理。强化学习/优化算法可轻易找到"高分但不像药"的分子(奖励黑客);纯 oracle 优化还会导致生成分布坍缩(多样性归零)。

症状:生成分子 QED 接近 0.95 但结构荒谬(超长链、多环堆积);validity 高但 novelty/uniqueness/FCD 恶化。

解决:(1) 同时报告 MOSES 分布学习指标(Validity/Uniqueness/Novelty/FCD/SNN/Frag/Scaf)与 oracle 分数;(2) 优化目标中加入相似度/多样性约束;(3) 对接分数类 oracle 需用多个靶点交叉验证,防止过拟合单一口袋;(4) 参考 GuacaMol 与 TDC docking 基准(DRD3)的联合协议。

参考:TDC v0.2.0(docking 生成基准);MOSES 论文(Polykovskiy et al. 2020);TDC 论文 Table 5(DRD3 基准)。

⚠️ 坑点 8:上游许可异质——“代码 MIT"不等于"数据可自由商用”(分类:工程陷阱)

问题:PyTDC 代码为 MIT,但 66 个数据集聚合自数十个上游来源,各自保留原许可。DrugBank 衍生数据(如 DDI-DrugBank)仅限学术研究,商用需单独购买许可;ChEMBL 为 CC-BY-SA;个别文献数据集无明确许可。

症状:商业产品中打包 TDC 数据被法务拦截;发表时未按要求引用上游论文。

解决:(1) 逐数据集核对官方文档列出的原始来源与许可;(2) 商业用途避开 DrugBank 衍生数据或取得授权;(3) 引用链完整:TDC 论文 + 各数据集上游论文(§9 给出核心清单)。

参考tdcommons.ai 各数据集页面"Data Source"字段;DrugBank 许可条款(drugbank.com);Koleiev Zenodo 快照的 CC-BY 4.0 授权说明。

版本提示:2021-2022 年发表的论文基于 v0.1-0.3 早期数据副本;v0.1.0(分子清洗)、v0.1.1(VD/Half Life/Clearance 换源)、v0.3.2(KIBA/DAVIS 调和)均改变过数据内容。复现旧论文时请注明 PyTDC 版本并预期轻微数值差异。

§6.6 数据增强

✅ 安全增强 ❌ 危险增强(禁止)
SMILES 枚举(同一分子的多种合法写法,相当于图像翻转) 随机改写原子/键类型生成"伪分子"(破坏化学有效性)
对回归标签添加符合测定误差幅度的高斯噪声(±0.1-0.3 log 单位) 对分类标签做随机翻转
图数据上的原子/边随机掩蔽(自监督预训练) 跨 scaffold 折混合增强(泄漏)
蛋白序列的同义替换(保守氨基酸替换,需领域校验) 对 DDI 标签做插值混合(645 类事件无语义插值)
指纹位随机翻转(模拟测定噪声) 对时间外验证的测试域做任何"分布对齐"

§6.7 模型推荐

任务 推荐 backbone 特征方案 预期性能锚点(官方口径)
快速基线 XGBoost/RandomForest Morgan 指纹(ECFP4) Caco2 MAE 约 0.40-0.45
官方标准基线 MLP / AttentiveFP RDKit2D 描述符 / 分子图 Caco2 MAE 0.393±0.008;HIA AUROC 0.972±0.008(RDKit2D+MLP,DeepPurpose,IJCAI 教程口径)
审计可信 SOTA CaliciBoost / MapLight(+GNN) 描述符+指纹集成 / 描述符+GNN 混合 通过 Koleiev 2026 全部可复现检查(22 端点口径)
DTI CNN-GNN 双塔 / PLM 嵌入 + 下游网络 SMILES + 蛋白序列 DTI-DG 时间外域 Pearson 显著低于同分布域(论文 Table 4)
分子生成 VAE/AAE/RL + oracle 优化 MOSES/ZINC 参考分布 Validity >95% 且 FCD 低为合格线
大模型路线 TxGemma / 分子基础模型 LLM 微调或提示 以 TDC 任务为评测标准(Google 2025)
教学演示 Logistic Regression + ECFP 单端点小数据 30 分钟课堂可完成全流程

§6.8 计算资源需求

硬件 最小配置 推荐配置
磁盘 5 GB(常用数据集缓存) 50 GB(全量 TDC-1 + 模型 checkpoint)
内存 8 GB(ADMET 单端点) 32 GB(TWOSIDES 460 万对/DrugComb 全表)
GPU CPU 足够(指纹+树模型基线) 1 × 16 GB 显存(GNN/Transformer 全 22 端点协议)
训练时间 单端点树模型数分钟(CPU) 全 ADMET 组 GNN 5 种子约数小时(单卡)
大模型 TxGemma 级 LLM 微调需多卡/A100 级
云端替代 Colab 免费版跑通教程与小端点 Colab Pro / 单卡云实例覆盖全基准

§6.9 评估指标

from tdc import Evaluator

# 官方指标三行调用(各端点指标由官方文档指定,常见组合):
evaluator = Evaluator(name='ROC-AUC')      # 分类:ROC-AUC / PR-AUC / AP / F1
auc = evaluator(test['Y'], y_prob)
evaluator = Evaluator(name='MAE')          # 回归:MAE / MSE / R2 / Pearson / Spearman
mae = evaluator(test['Y'], y_pred)

# 生成任务官方评估器(oracle 3 行调用):
from tdc import Oracle
oracle = Oracle(name='GSK3B')
scores = oracle(['CC(C)(C)[C@H]1CCc2c(sc(NC(=O)COc3ccc(Cl)cc3)c2C(N)=O)C1'])
# [0.03]

社区共识:分类端点报 AUROC,极度不平衡端点(HTS)必报 AUPRC/AP;回归端点报 MAE;排行榜成绩报 5 种子均值±标准差;生成任务报 MOSES 全套分布指标 + oracle 分数;DTI 亲和力报 MAE + Pearson,并区分同分布/时间外两个域。

§6.10 MLOps 笔记

  • 版本锁定三件套tdc.__version__ + 下载日期 + 数据文件哈希,缺一不可(坑点 1);投稿建议附 Zenodo 快照或缓存目录 DOI。
  • 测试集纪律:test 仅在模型冻结后读取一次;所有调参走 valid 与 get_auxiliary_train_valid_split
  • 监控维护状态:GitHub 主仓 2025-2026 年提交频率已显著降低(PyTDC 1.1.8 为 2025-01-20 发布),新功能重心转向 TDC-2 API;长期项目应评估自托管数据副本。
  • 引用要求:TDC 论文(NeurIPS 2021)+ 所用数据集的上游论文(§9);使用 DeepPurpose 基线另引其 Bioinformatics 论文。
  • 排行榜提交:经 tdcommons.ai 排行榜通道提交,需附模型说明与代码链接;注意审计后社区对"代码可得性"的要求已实质提高。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
发表偏倚(阳性偏倚) 文献与数据库中活性/阳性结果被过度报道,阴性结果罕见 阴性假设检验时用 HTS 确证筛选数据校准;报告 AUPRC
化学空间偏倚 以类药性小分子为主,天然产物/大环/类肽覆盖不足 外推前做适用域(applicability domain)评估
测定协议偏倚 同一性质在不同实验室/协议下系统偏移(Caco-2、清除率) 中高 单数据集内建模优先于跨数据集合并;合并时做协议分层
类别不平衡偏倚 HTS 阳性率约 3%、Tox21 多终点 <10% 中高 AUPRC/AP 指标 + 类别权重 + 阈值调优
时间漂移偏倚 化学空间随专利与文献年代演化 时间划分(DTI-DG)评估前瞻性能
生物药样本量偏倚 抗体/多肽数据集仅数百至数千,远小于小分子 小样本模型 + 不确定性量化;避免过度参数化
观察性信号偏倚 TWOSIDES 的 DDI 信号源自 FAERS 自发呈报,受报告率与混杂影响 仅作关联研究,不作因果结论;Tatonetti 2012 校正已部分缓解
人群/适应症间接偏倚 无患者数据,真实世界人群代表性无法评估 临床转化前必须经独立前瞻性/湿实验验证

§7.2 标注质量评估

标签类型 可靠性 一致性 局限性
CYP*_Veith(同源高通量测定) 同协议内部一致性最佳 测定条件单一,外推到其他协议需谨慎
体外 ADME(Caco-2/清除率/PPBR) 中高 跨实验室协议差异 ±0.2-0.3 log 单位 不可跨源混训不校准
HTS 确证筛选 高(活性确认) 假阴性偏高 阳性率极低
策展亲和力(BindingDB/DAVIS/KIBA) 异源聚合;v0.3.2 调和了同对冲突值 测量条件(温度/缓冲液/酶型)不统一
DILI/AMES 等专家审定毒性 中高 审定流程文献可查 样本小;动物→人体外推不确定
TWOSIDES DDI 信号 中(关联性) 统计校正后可用 非因果、非临床确诊
QM 计算性质 高(计算口径内) DFT 级别决定精度 计算参考值≠实验真值
对接分数 oracle 低-中 对口袋/构象敏感 仅作相对比较,非结合自由能

§7.3 泛化性讨论

场景 失效风险 证据
跨化学骨架(scaffold 外推) random→scaffold 性能系统性下降(TDC 论文 §10 实验);这正是 scaffold split 的设立动机
跨时间(用历史数据预测未来分子) DTI-DG 基准:2019-2021 时间外域 Pearson 显著低于 2013-2018 同分布域(论文 Table 4)
跨测定协议/实验室 中高 Caco-2 等端点跨实验室系统偏移是药化常识;VD/Half Life/Clearance 曾因来源质量问题整体换源(v0.1.1)
跨实体(新靶点/新药冷启动) cold split 下 DTI 指标远低于 random split;早期文献 random 口径数值不可外推
跨模态(小分子模型 → 生物药) 抗体/肽任务需要序列/结构模型,分子图方法不可直接迁移
跨平台(TDC scaffold 口径 → MoleculeNet random 口径) 同端点数值不可直接比较(见 §6.5 坑点 4)
计算 → 湿实验 任何 TDC 模型用于真实筛选前必须经体外实验验证;排行榜成绩不构成活性证据

§7.4 伦理考量

  1. TDC 不含患者数据与人体受试者信息,无 PHI/PII,不涉及知情同意问题;其伦理责任链条体现在下游使用:模型预测不得用于未经验证的临床或用药决策。
  2. DDI/Tox 等安全性任务的误用风险真实存在:将预测工具当作"毒性证明"或"相互作用排除"属于严重误用,任何安全性结论必须回到实验证据。
  3. 上游许可合规是研究伦理的一部分:DrugBank 衍生数据的商用限制(§6.5 坑点 8)与完整的引用链(§9)是使用者的法定义务。
  4. 分子生成研究存在双重用途(dual-use)讨论空间——毒性 oracle 反向优化可生成潜在有害结构;发布生成模型与命中物时应遵循化学安全审查惯例。
  5. 临床试验结局预测(TrialOutcome/TDC-2)涉及真实试验成败标签,应避免被解读为对特定在研药物的价值判断。

§7.5 公平性评估

TDC 无人口学公平性维度(无患者),其"公平性"对应化学空间与任务间的覆盖均衡

# 适用域评估:测试集分子相对训练集的最近邻 Tanimoto 相似度
from rdkit import Chem, DataStructs
from rdkit.Chem import AllChem
import numpy as np

def max_tanimoto(query_smiles, train_fps):
    mol = Chem.MolFromSmiles(query_smiles)
    fp = AllChem.GetMorganFingerprintAsBitVect(mol, 2, nBits=2048)
    return max(DataStructs.BulkTanimotoSimilarity(fp, train_fps))

# 按相似度分箱报告性能——低相似度箱的指标才是真实泛化能力

已知覆盖失衡:天然产物样大环/类肽在训练分布中稀疏,对应子空间性能显著偏低;生物药任务(数百样本)的不确定性区间远宽于小分子任务,评审时不应与小分子端点同标准要求。

§7.6 数据漂移提示

  • 平台级漂移:PyTDC 各版本间的数据文件变化(v0.1.0 清洗、v0.1.1 换源、v0.3.2 调和)意味着"同名数据集"存在跨版本分布差异——监控 tdc.__version__ 与文件哈希(坑点 1)。
  • 领域级漂移:化学空间随年代演化(新骨架、新模态药物),DTI-DG 时间外域的性能衰减是量化此类漂移的基准。
  • 部署级漂移:将模型用于企业内部化合物库时,库内化学空间与 TDC 训练分布通常存在系统性偏移,需先做适用域评估再决定是否微调。

§7.7 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 数据为宽格式(每行一个样本/事件) 统一三列 DataFrame(Drug_ID/Drug/Y),一行一样本
2 有唯一标识符列 Drug_ID/Target_ID,可溯 PubChem/ChEMBL/DrugBank/UniProt
3 无 Unicode 或特殊字符 SMILES 与序列为 ASCII;特殊符号属语法本身
4 无重复行 ⚠️ v0.3.2 调和了 KIBA/DAVIS 冲突值;跨来源合并时同分子异测定仍可能存在,需按 InChIKey 自查
5 缺失值已识别并编码 ⚠️ 主表经清洗无缺失,但"未测定/未发表"的信息性缺失未系统文档化(§4.5)
6 标签列被明确标识 统一 Y 列,官方文档标注指标与任务类型
7 已对罕见类别(<3%)进行分组 ⚠️ TWOSIDES 645 类长尾事件未合并;Tox21 低阳性终点未处理
8 偏倚评估已完成 §7.1 八类偏倚;TDC 论文含分布偏移实验
9 有完整的数据字典 tdcommons.ai 逐数据集定义 + 论文 Table 2 + readthedocs API 文档
10 对"信息性缺失"有明确编码解释 阴性未发表、未测定等机制未形式化记录
11 数据采集设备和设置已记录 ⚠️ 测定协议引自上游文献(§3.9),TDC 层面未逐一复核
12 已移除完全共线性变量 原始表仅实体+标签,无派生共线变量(特征由下游生成)
13 对编码的映射标准已说明 Drug_ID 可溯 PubChem/ChEMBL/DrugBank;v0.1.4 补齐 DTI 数据 ID
14 对时间戳的处理已明确说明 无时间戳字段;时间外验证用文献/专利年份(DTI-DG 已说明)
15 训练/验证/测试划分建议已给出 5 种官方划分 + benchmark group 固定协议(本项为全场标杆)
16 数据泄漏风险已被讨论 scaffold/cold/combinatorial 划分设计本身 + Koleiev 2026 审计文献
17 标签分布已被分析 官方文档标注各数据集阳性率/分布
18 选择性测量偏倚已被讨论 ⚠️ 发表偏倚在文献中广泛讨论,官方未系统量化
19 外部验证建议已给出 DTI-DG 时间外验证 + 跨平台对照(§5.5/§7.8)
20 数据更新和版本信息已记录 GitHub 更新日志完整,但数据本体无版本锁定、可静默变化——审计批评核心(坑点 1)
21 最小必要预处理脚本已提供 PyTDC 内置 split/evaluator/MolConvert/processor
22 合规使用要求已明确 ⚠️ 代码 MIT 明示;各数据集上游许可异质,无统一许可清单(坑点 8)
23 多模态对齐方法已说明 ⚠️ TDC-1 各数据集相互独立;跨模态对齐在 TDC-2(API-first)才系统化
24 去标识化方法已被记录 无人类受试者数据、无 PHI/PII,去标识化不适用(天然合规)

DAIMS 评分:17.5 / 24

评分解读良好——AI 可用性与评估协议设计为同类标杆,扣分集中在治理维度(无版本锁定、缺失机制未文档化、上游许可异质)。

对你意味着什么:TDC 的 14 个 ✅ 项几乎全部来自其工程化的 ML 就绪设计——统一三列格式、唯一 ID 可溯、5 种官方划分、内置预处理与评估函数,在药物发现基准中无出其右。两个 ❌ 项是同一个主题的两面:可复现性治理——数据本体无版本锁定(坑点 1)与信息性缺失未文档化,意味着"严格复现他人结果"需要你自行补做版本留痕与快照固定(Zenodo 快照是最省事的路径);⚠️ 项集中在数据治理细节(许可清单、长尾类别、测定协议复核),提示你在商业应用跨源合并两个场景必须逐案核查。与 Polaris 等隐藏测试集新平台相比,TDC 的差距不在数据质量而在评测治理——理解这一点,就知道该用什么姿势使用它。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部测试集变化 关键发现
DTI-DG 时间外域(BindingDB 2019-2021) TDC 官方基准(NeurIPS 2021) DTI 亲和力回归(域泛化) Pearson 相关 显著低于 2013-2018 同分布验证域 时间漂移是 DTI 模型部署的真实威胁;论文 Table 4 全模型一致衰减
Koleiev 审计复评(全部 22 端点) Receptor.AI(JCIM 2026) ADMET 排行榜 top-3 模型复现 各端点官方指标 多数上榜模型复现失败或缩水 仅 CaliciBoost/MapLight/MapLight+GNN 通过全部检查;公开测试集调参可显著抬高排名
MoleculeNet 同端点 random split Stanford(Chem. Sci. 2018) 相同分子性质端点 AUROC/MAE random 口径系统性优于 scaffold 口径 "划分协议决定难度"的直接证据;跨平台数值不可直接比较
TxGemma 外部评测(Google,2025) Google 治疗学 LLM 在 TDC 任务上评测 各任务官方指标 作为零样本/微调基线参考 第三方大模型选择 TDC 作为标准评测场,反向印证其基准地位

约束说明:本矩阵仅收录有同行评审论文或权威预印本支撑的外部评估;社区自报数字不予收录。Koleiev 审计同时存在 JCIM 正式版与 bioRxiv 预印本,引用时以 JCIM 版为准。


§8 基准性能与生态

§8.1 排行榜

TDC 运营 29 个公开排行榜(tdcommons.ai 实时更新),核心三组:ADMET benchmark group(22 端点)、DTI-DG(域泛化)、DRD3 docking(分子生成)。

ADMET benchmark group 官方基线(论文/IJCAI 教程口径,5 种子均值±标准差,scaffold split)

排名 模型 Caco2 ↓(MAE) HIA ↑(AUROC) Pgp ↑(AUROC) Bioav ↑(AUROC) Lipo ↓(MAE) AqSol ↓(MAE) 完整引用
官方基线 RDKit2D + MLP(DeepPurpose,633,409 参数) 0.393±0.008 0.972±0.008 0.918±0.021 0.672±0.017 0.574±0.017 0.827±0.047 Huang K et al. “DeepPurpose: a deep learning library for drug-target interaction prediction.” Bioinformatics 36(22-23):5545-5547 (2020). DOI: 10.1093/bioinformatics/btaa1005

审计后可信模型(Koleiev et al. 2026 复现验证,22 端点口径)

模型 审计结论 年份 关键技术 完整引用 代码
CaliciBoost ✅ 通过全部检查 2024-2025 梯度提升集成 + 描述符/指纹 Koleiev I et al. “An End-User Audit of Reproducibility, Data Leakage, and Overfitting of the Top-Ranked ADMET Prediction Models in TDC Leaderboards.” JCIM (2026). DOI: 10.1021/acs.jcim.6c00819 见审计论文
MapLight ✅ 通过全部检查 2023-2024 描述符+指纹混合 同上 github.com/maplightrx/MapLight-TDC
MapLight + GNN ✅ 通过全部检查 2023-2024 描述符集成 + 图神经网络 同上 同上
MiniMol / GradientBoost / XGBoost(上榜方案) ❌ 检出直接或间接数据泄漏 同上(审计发现)

排行榜使用警示:不同论文的绝对数值不可直接比较——原因包括:PyTDC 版本差异(坑点 1)、划分协议口径(scaffold vs random)、种子数与报告方式、以及坑点 2 揭示的测试集污染风险。引用任何榜单名次前,请先读 Koleiev 2026 审计。

DTI-DG 基准协议(论文 Table 4):TDC.BindingDB,In-Dist 域 = 2013-2018(同分布验证),Out-Dist 域 = 2019-2021(时间外测试);指标 Pearson 相关,5 次随机运行报告均值±标准差;所有受测模型在 Out-Dist 域一致衰减,域泛化方法(IRM/DANN 等)相对 ERM 提升有限——这是该基准最重要的科学结论。

DRD3 docking 基准(论文 Table 5):TDC.ZINC 参考分布 + TDC.Docking oracle,目标为生成高 DRD3 对接分数分子;3 次运行报告均值±标准差;同时报告质量过滤通过率与多样性,防止单指标奖励黑客。

§8.2 SOTA 总结与选型建议

如果你… 推荐方案 为什么
投稿 ADMET 性质预测论文 官方 benchmark group 协议 + 报告 5 种子均值±标准差 + 复现 MapLight/CaliciBoost 作对照 审计后唯一被广泛接受的"诚实基线"
快速出可信基线 ECFP4 + XGBoost 或 RDKit2D + MLP(DeepPurpose) 单端点数分钟出结果,与官方基线口径一致
做 OOD/域泛化方法研究 DTI-DG 基准(时间外验证) 药物 AI 中设计最规范的 OOD 评测
训练/评测分子基础模型 TDC 任务套件 + TxGemma 口径对照 大模型时代的标准评测场
教学与黑客松 单端点(Caco2/hERG)+ ECFP + 树模型 30 分钟全流程,官方教程 101-106 直接可用

§8.3 官方评测协议

单数据集:get_split(method=...) 官方划分 → train 训练 / valid 调参 → test 单次评估 → tdc.Evaluator 官方指标。Benchmark group:固定 scaffold 划分(seed 1)+ 4 个辅助种子 train/valid 重采样 → 5 次训练 → 固定 test 评估 → 报告均值±标准差 → tdcommons.ai 排行榜提交(需附模型说明与代码链接)。生成任务:MOSES 分布指标 + oracle 分数双报告;docking 基准 3 次运行。

数据集/平台 关系 说明
MoleculeNet 前身/对照 Wu et al. 2018;TDC 在管线覆盖与评估协议上全面扩展,random 口径数值不可互比
TDC-2 后继 2024 预印本;1,000+ 多模态数据集、单细胞与临床试验扩展、API-first
Polaris 同类新一代 隐藏测试集设计,针对 TDC 公开测试集痛点
OpenADMET 同类新一代 聚焦 ADMET,与药企合作生成新数据 + 盲测挑战
ChEMBL / PubChem / BindingDB / DrugBank 上游来源 TDC 多个数据集的数据源,许可独立
MOSES / GuacaMol 生成任务互补 分子生成分布学习基准,TDC MolGen 内置 MOSES
ZINC / USPTO 生成/合成上游 MolGen 参考集与 RetroSyn/Reaction 数据源
CZ CELLxGENE Census TDC-2 上游 单细胞数据与嵌入来源

§8.5 关键论文 Top 10

  1. Huang K et al. (2021), NeurIPS 34 (Datasets and Benchmarks). “Therapeutics Data Commons: Machine Learning Datasets and Tasks for Drug Discovery and Development.” — 平台本体,权威引用入口。arXiv:2102.09548
  2. Huang K, Fu T, Gao W et al. (2022), Nature Chemical Biology 18:1033-1036. “Artificial intelligence foundation for therapeutic science.” — TDC 的愿景综述与治疗科学 AI 纲领。DOI: 10.1038/s41589-022-01131-3
  3. Velez-Arce A et al. (2024), bioRxiv 2024.06.12.598655. “TDC-2: Multimodal Foundation for Therapeutic Science.” — TDC-2 官方论文:1,000+ 多模态数据集、Model Hub、7 个情境化新任务。DOI: 10.1101/2024.06.12.598655
  4. Huang K et al. (2020), Bioinformatics 36(22-23):5545-5547. “DeepPurpose: a deep learning library for drug-target interaction prediction.” — 官方基线模型库。DOI: 10.1093/bioinformatics/btaa1005
  5. Koleiev I et al. (2026), Journal of Chemical Information and Modeling. “An End-User Audit of Reproducibility, Data Leakage, and Overfitting of the Top-Ranked ADMET Prediction Models in TDC Leaderboards.” — 排行榜可信度系统审计,使用 TDC 排行榜前的必读警示。DOI: 10.1021/acs.jcim.6c00819
  6. Wu Z et al. (2018), Chemical Science 9:513-530. “MoleculeNet: a benchmark for molecular machine learning.” — 前驱基准,理解 TDC 设计动机的必读前史。DOI: 10.1039/C7SC02664A
  7. Zitnik M, Agrawal M, Leskovec J (2018), Bioinformatics 34(13):i457-i466. “Modeling polypharmacy side effects with graph convolutional networks.” — Decagon;TWOSIDES DDI 数据的奠基性工作。DOI: 10.1093/bioinformatics/bty294
  8. Tatonetti NP et al. (2012), Science Translational Medicine 4:125ra31. “Data-driven prediction of drug effects and interactions.” — TWOSIDES 原始数据挖掘论文(FAERS 校正算法)。DOI: 10.1126/scitranslmed.3003377
  9. Gaulton A et al. (2017), Nucleic Acids Research 45:D945-D954. “The ChEMBL database in 2017.” — 上游生物活性主库。DOI: 10.1093/nar/gkw1074
  10. Wishart DS et al. (2018), Nucleic Acids Research 46:D1074-D1082. “DrugBank 5.0: a major update to the DrugBank database.” — 上游药物知识库,注意其许可限制。DOI: 10.1093/nar/gkx1037

§8.6 社区活跃度

维度 数据
Google Scholar 引用(TDC 论文) 700+(截至 2026-09,NeurIPS 版与 arXiv 版口径重叠)
TDC-2 引用 15(截至 2026-09 快照)
GitHub mims-harvard/TDC 1,123 stars / 196 forks(截至 2026-08/09,ossinsight 快照);主语言 Jupyter Notebook
PyPI 安装量 145,000+(TDC-1 累计,截至 2024-06,TDC-2 论文口径)
维护状态 PyTDC 1.1.8(2025-01-20)为当前最新;2025-2026 年主仓提交频率降低,重心转向 TDC-2
大模型采用 Google TxGemma(2025)以 TDC 任务为核心评测基准
第三方审计 Koleiev et al. 2026(JCIM)+ admet-honest-audit 等社区审计项目
教学采用 IJCAI 2021 教程、多所高校化学信息学课程;官方教程 101-106

§8.7 生态快照

资源 类型 链接 Star/Fork(截至 2026-09,约) 为什么值得关注
mims-harvard/TDC 官方代码 https://github.com/mims-harvard/TDC 1,123 / 196 官方仓库:PyTDC 源码、教程 101-106、更新日志与 Issues
tdcommons.ai 官方门户 https://tdcommons.ai 任务/数据集文档、29 个排行榜、TDC-2 入口
tdc.readthedocs.io 官方文档 https://tdc.readthedocs.io API 级文档(0.3.1 起)
kexinhuang12345/DeepPurpose 工具库 https://github.com/kexinhuang12345/DeepPurpose 约 900 / 200 官方基线模型库:DTI/性质预测 15+ 编码器,排行榜基线来源
TDC HuggingFace Space 模型托管 https://huggingface.co/tdc tdc_hf_interface 预训练模型(DeepPurpose 9 个首批)
Zenodo ADMET 快照 数据快照 https://zenodo.org/records/20180944 2026-03-24 冻结副本,可复现性敏感研究的标准锚点
deweihu96/admet-honest-audit 审计工具 https://github.com/deweihu96/admet-honest-audit 活跃 "诚实爬榜"参考实现:测试集隔离、泄漏检查、CI 报告
TxGemma 大模型 Google(2025) 治疗学 LLM,以 TDC 任务为评测标准
Polaris 同类平台 https://polarishub.io 活跃 隐藏测试集新基准,与 TDC 互补
deepchem 工具库 https://github.com/deepchem/deepchem 4,000+ MoleculeNet 加载器与分子 featurizer 生态

§9 相关资源与引用

官方资源

BibTeX 引用

% 1) TDC 平台论文(首选引用)
@inproceedings{huang2021tdc,
  title={Therapeutics Data Commons: Machine Learning Datasets and Tasks for Drug Discovery and Development},
  author={Huang, Kexin and Fu, Tianfan and Gao, Wenhao and Zhao, Yue and Roohani, Yusuf and Leskovec, Jure and Coley, Connor W and Xiao, Cao and Sun, Jimeng and Zitnik, Marinka},
  booktitle={Advances in Neural Information Processing Systems (NeurIPS) Datasets and Benchmarks},
  volume={34},
  year={2021}
}

% 2) TDC-2(如使用 TDC-2 资源)
@article{velezarce2024tdc2,
  title={TDC-2: Multimodal Foundation for Therapeutic Science},
  author={Velez-Arce, Alejandro and Huang, Kexin and Li, Michelle M and Lin, Xiang and Gao, Wenhao and Fu, Tianfan and Kellis, Manolis and Pentelute, Bradley L and Zitnik, Marinka},
  journal={bioRxiv},
  pages={2024.06.12.598655},
  year={2024},
  doi={10.1101/2024.06.12.598655}
}

% 3) 愿景综述(引用治疗科学 AI 纲领时)
@article{huang2022aifoundation,
  title={Artificial intelligence foundation for therapeutic science},
  author={Huang, Kexin and Fu, Tianfan and Gao, Wenhao and others},
  journal={Nature Chemical Biology},
  volume={18},
  pages={1033--1036},
  year={2022},
  doi={10.1038/s41589-022-01131-3}
}

% 4) DeepPurpose(如使用官方基线模型)
@article{huang2020deeppurpose,
  title={DeepPurpose: a deep learning library for drug-target interaction prediction},
  author={Huang, Kexin and Fu, Tianfan and Glass, Lucas M and Zitnik, Marinka and Xiao, Cao and Sun, Jimeng},
  journal={Bioinformatics},
  volume={36},
  number={22-23},
  pages={5545--5547},
  year={2020},
  doi={10.1093/bioinformatics/btaa1005}
}

% 5) 排行榜审计(引用榜单名次时强烈建议同引)
@article{koleiev2026tdcaudit,
  title={An End-User Audit of Reproducibility, Data Leakage, and Overfitting of the Top-Ranked ADMET Prediction Models in TDC Leaderboards},
  author={Koleiev, Ihor and Stratiichuk, Roman and Shevchuk, Nazar and others},
  journal={Journal of Chemical Information and Modeling},
  year={2026},
  doi={10.1021/acs.jcim.6c00819}
}

引用链要求:TDC 论文 + 所用数据集的上游论文(如用 DDI-TWOSIDES 引 Tatonetti 2012 与 Zitnik 2018,用 DrugBank 引 Wishart 2018)——上游许可条款通常对此有硬性要求(坑点 8)。

教程与学习资源

  • 官方教程 101-106(GitHub):数据加载 / 数据函数 / 小分子与生物药数据集漫游 / 15 行代码生成 21 个 ADME 预测器 / 分子生成 oracle / 排行榜提交
  • IJCAI 2021 教程 “Machine Learning for Drug Development”(Zitnik lab 幻灯片)
  • TDC User Group Meetup 录像(2022-01)
  • Nature Chemical Biology 2022 综述(治疗科学 AI 任务全景)
  • admet-honest-audit 仓库(测试集纪律与泄漏检查的工程范式)

原始论文

  1. Huang K et al. (2021). “Therapeutics Data Commons: Machine Learning Datasets and Tasks for Drug Discovery and Development.” NeurIPS 34 (Datasets and Benchmarks). arXiv:2102.09548. DOI: 10.48550/arXiv.2102.09548.
  2. Velez-Arce A et al. (2024). “TDC-2: Multimodal Foundation for Therapeutic Science.” bioRxiv 2024.06.12.598655. DOI: 10.1101/2024.06.12.598655.
  3. Huang K, Fu T, Gao W et al. (2022). “Artificial intelligence foundation for therapeutic science.” Nature Chemical Biology 18:1033-1036. DOI: 10.1038/s41589-022-01131-3.
  4. Koleiev I et al. (2026). “An End-User Audit of Reproducibility, Data Leakage, and Overfitting of the Top-Ranked ADMET Prediction Models in TDC Leaderboards.” JCIM. DOI: 10.1021/acs.jcim.6c00819.
  5. Wu Z et al. (2018). “MoleculeNet: a benchmark for molecular machine learning.” Chemical Science 9:513-530. DOI: 10.1039/C7SC02664A.

§10 AI 使用声明卡

§10.1 AI 模型使用

AI 模型 版本 用途
deep-model(WorkBuddy) 2026-09 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建
WebSearch(多源检索) 2026-09-05 6 组检索:官方主页与论文、TDC-2 预印本、排行榜与审计文献、GitHub/PyPI 元数据、引用量快照、坑点社区讨论

§10.2 AI 参与范围

AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。

AI 在本页面的工作中负责:(1) 从 tdcommons.ai、NeurIPS 2021 论文(arXiv:2102.09548)、TDC-2 预印本(bioRxiv)、GitHub 更新日志与审计文献中整理结构化信息;(2) 生成 §6 的 Python 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。

§10.3 输入来源

  1. Huang et al. (2021), NeurIPS 34 Datasets and Benchmarks — TDC 原始论文(arXiv:2102.09548,含 22 任务 Table 1 与 66 数据集 Table 2)
  2. tdcommons.ai 官方主页与 News 页(TDC-2 发布说明、版本更新史)
  3. GitHub mims-harvard/TDC(README 更新日志:v0.0.8-v0.4.1;Issues #98/#121/#122/#127)
  4. Velez-Arce et al. (2024), bioRxiv 2024.06.12.598655 — TDC-2 预印本全文(含 145,000+ PyPI 安装量)
  5. Koleiev et al. (2026), JCIM — TDC ADMET 排行榜审计(DOI: 10.1021/acs.jcim.6c00819)及 bioRxiv 2026.02.26.708193 预印本
  6. Zenodo 记录 20180944 — ADMET benchmark group 2026-03-24 冻结快照说明(无版本锁定问题原文)
  7. IJCAI 2021 教程幻灯片(zitniklab.hms.harvard.edu)— ADMET 组 6 端点规模与 RDKit2D+MLP 基线数值
  8. ar5iv 版论文全文(22 任务与管线映射表)
  9. ossinsight.io — mims-harvard/TDC star/fork 快照(截至 2026-08/09)
  10. deps.dev — pytdc 1.1.8(2025-01-20)与 MIT 许可核实
  11. Google Scholar 引用快照(TDC 717 / TDC-2 15,截至 2026-09)
  12. deweihu96/admet-honest-audit — 小样本端点方差与测试集纪律工程实践
  13. TxGemma 社区任务对照资料(Google 2025 大模型采用证据)
  14. Zitnik et al. (2018), Bioinformatics 34(13):i457-i466 — TWOSIDES/Decagon 上游
  15. Tatonetti et al. (2012), Science Translational Medicine 4:125ra31 — TWOSIDES 数据挖掘原文

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景(治疗领域映射、任务定义、金标准) 千方病案医学编辑部 交叉审核 ✅ 已通过
§3 数据集规格(22 任务/66 数据集清单、版本矩阵) 千方病案医学编辑部 与 NeurIPS 论文 Table 1/2 及官方文档交叉比对 ✅ 已验证
§4 数据结构(三层架构、DAIMS 字段字典) 千方病案医学编辑部 与 PyTDC 文档及教程交叉比对 ✅ 已验证
§5 数据划分策略 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与坑点 千方病案医学编辑部 逻辑审查 + 与官方文档、审计文献比对 ✅ 已通过
§7 质量评估与 DAIMS 评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 排行榜与引用数表述 千方病案医学编辑部 与原文、教程幻灯片及 Scholar 快照交叉比对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 Schema v3.9 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。

§10.6 最后审核

最后一次人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集