TTD — 治疗靶点数据库 AI-Ready Wikipedia

3,798 个治疗靶点 × 40,398 种药物的药物-靶点-疾病关联知识库

来源 浙江大学药学院 IDRB 组 × 新加坡国立大学 BIDD 组(Innovative Drug Research and Bioinformatics Group / Bioinformatics and Drug Design Group) url: https://idrblab.org/ttd/发布时间: 2026-09-14最后更新: 2026-09-25 阅读 32
TTD — 治疗靶点数据库 AI-Ready Wikipedia

信息速览

数据集名称TTD — 治疗靶点数据库 AI-Ready Wikipedia
数据类型3,798 个治疗靶点,40,398 种药物,306,247 条靶点-疾病关联,44,649 份 FDA 说明书,免注册直接下载
规模3,798 个治疗靶点(疾病关联覆盖 2,912 个靶点)
接入方式浙江大学药学院 IDRB 组 × 新加坡国立大学 BIDD 组(Innovative Drug Research and Bioinformatics Group / Bioinformatics and Drug Design Group) url: https://idrblab.org/ttd/
AI 就绪度

数据集封面

TTD(治疗靶点数据库)— 药物-靶点-疾病关联知识库 AI-Ready Wikipedia

INFOBOX

字段 内容
数据集名称 治疗靶点数据库(TTD)
英文全称 Therapeutic Target Database
别名/简称 TTD;IDRB-TTD
疾病分类(ICD-11) 全疾病谱(疾病注释采用 WHO ICD-11 编码,如 2C12 气管支气管肺恶性上皮肿瘤、5A11 2 型糖尿病、8A00 阿尔茨海默病等多章覆盖)
SNOMED CT 未整合(疾病实体统一采用 ICD-11 编码注释)
数据模态 药物-靶点-疾病三元关联(含靶点序列/结构、药物结构、结合活性、通路、临床开发状态)
AI 任务类型 药物-靶点相互作用(DTI)预测、药物重定位、靶点发现与优先级排序、药理学知识图谱构建
样本总数 3,798 个靶点 + 40,398 种药物 + 306,247 条靶点-疾病关联(2026 版)
数据大小 约 18 个分文件(官方未公布总量,含 FASTA/SDF 大文件)
数据格式 TXT(块格式/TSV)、FASTA、SDF、XLSX
许可证 免费用于研究与教育目的(Free for research and educational purposes)
访问级别 开放(免注册直接下载)
DUO 标签 NRES(无限制研究使用;限定研究与教育用途)
语言 英文
首发日期 2002 年
最后更新 2025-10-09(2026 版)
发布机构 浙江大学药学院 IDRB 组 × 新加坡国立大学 BIDD 组
官方主页 https://idrblab.org/ttd/
下载地址 https://idrblab.org/ttd/full-data-download
DOI 10.1093/nar/gkaf1154(2026 版更新论文)
引用次数 2,000+(Europe PMC,2018-2026 系列 NAR 更新论文累计,截至 2026-07)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 提供分文件下载、UniProt/HGNC/PubChem/ICD-11 标准标识映射与显式临床状态标签;扣分项:P1-01 等主文件为非 CSV 的块格式需自写解析器,无官方数据划分与预处理脚本
页面状态 published

§0 医学与技术审核声明

医学审核者:[千方病案医学编辑部]交叉审核:§2 医学背景(靶点成药性分类、ICD-11 疾病覆盖)、§7 偏倚分析(文献热度偏倚、疾病谱失衡)。

数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。TTD 免注册直接下载,许可限定为研究与教育用途,官网明确声明其仅供合格专业人员与研究用途、不面向患者、不用于临床决策。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

这是什么? TTD(Therapeutic Target Database,治疗靶点数据库)是全球资历最老且持续维护至今的治疗靶点知识库之一:2002 年由浙江大学 IDRB 组与新加坡国立大学 BIDD 组联合启动,2026 版(最近更新 2025-10-09)收录 3,798 个治疗蛋白与核酸靶点、40,398 种药物以及 306,247 条靶点-疾病关联。它回答的核心问题是:某个靶点被药物调节到什么程度了——是已有获批药,还停留在临床试验,或仅见于专利与文献?

为什么重要? 靶点发现是药物研发的第一步,而"一个靶点值不值得做"的第一手证据,恰恰分布在数千篇文献、FDA 批文和临床试验登记里。TTD 把这些证据整理成了带状态标签(成功/临床试验/临床前/专利/文献报道)的机器可读关联网络,并配套成药性特征、扰动谱与 44,649 份 FDA 说明书档案。对 AI 而言,这些显式状态标签是构造"从试验走向批准"这类监督信号的稀缺资源。

我能用它做什么? 三类最常见用途:一是训练药物-靶点相互作用(DTI)预测模型;二是做药物重定位——通过靶点-疾病关联(以 ICD-11 编码注释)把老药引向新病;三是为靶点发现管线提供先验排序与药理学知识图谱构建。免注册直接下载,18 个分文件覆盖从序列、结构到通路与联用的全维度数据。

§1.1 技术摘要

TTD 的数据生产方式是专家人工审编(manual curation)而非自动化文本挖掘:靶点与药物信息取自同行评审文献,已批准药物系统采集自 Drugs@FDA,临床试验药物主要来自 ClinicalTrials.gov 与公司管线报告,试验状态定期同步。2026 版的四层核心扩展包括:① 306,247 条靶点-疾病关联(覆盖 2,912 个靶点),证据整合遗传突变(经 UniProt 变异 API 溯源 ClinVar/dbSNP/ClinGen)与转录组差异表达;② 10,506 条扰动谱(8,047 个遗传修饰 + 2,459 个化学干扰,涉及 2,368 个靶点,源自 CMap/LINCS);③ 17,806 种药物的多维活性景观(16,983 种药物对 5,253 个蛋白的分子级活性、3,221 种药物对 2,367 条疾病细胞系的细胞毒性、1,238 种药物对 803 种微生物的抗菌活性,汇编自 BindingDB/ChEMBL/PubChem);④ 2,234 个已批准药物的 44,649 份有效 FDA 说明书(2,141 份 NDA + 331 份 BLA + 8,889 份 ANDA)。标识体系上,靶点以 UniProt ID 与 HGNC symbol 双重标准化,小分子映射 PubChem CID,疾病注释 WHO ICD-11。2026 版完成了以 Vue3 + Django 为核心的架构重建,所有数据免登录访问。

§1.2 战略价值分析

维度一:全周期状态轴是稀缺监督信号。 多数药物-靶点数据库只回答"是否相互作用",TTD 的差异化在于双侧状态标签:靶点侧五级(成功/临床试验/临床前/专利/文献报道,由对应药物的最高状态定义)、药物侧四级(批准/临床试验/临床前/专利/实验)。这使"靶点晋级"本身可以成为建模对象——例如用 2024 版训练、以 2026 版新增的 34 个成功靶点做前瞻性评估。官方 Table 1 公布了跨版本计数(2026 版:566 成功 / 1,487 临床试验 / 232 临床前/专利 / 1,513 文献报道),为这类纵向分析提供了基准锚点。

维度二:人工审编带来的低噪声标签。 与从文献文本挖掘自动抽取的关联库不同,TTD 由两支团队(浙大 IDRB、NUS BIDD)人工审编并经双通讯复核,其靶点验证数据明确要求三类证据之一:药物对靶点的实验效价、对疾病模型的效力、或靶点敲除/敲低/RNAi 等体内模型的效应。对需要"可信正样本"的 AI 任务(如 DTI 正样本、批准标签回归),这显著降低了标签噪声。2024 版更系统收集了 9 类成药性特征,从分子相互作用/调控、人体系统、细胞表达变异三个视角支撑靶点可药性评估。

维度三:ICD-11 疾病语义层让关联"可对齐"。 靶点-疾病关联以 WHO ICD-11 编码注释(2020 更新起引入),这意味着重定位与流行病学分析可以直接落在国际统一的疾病口径上,而不是一堆积压的自由文本。第三方整合工程(如 BioThings)进一步把 ICD-11 桥接到 MONDO 本体,验证了这一语义层在跨库对齐中的实际可用性。对 AI 项目而言,疾病编码一致性决定了重定位假设能否被流行病学与报销体系"接住"——这是 TTD 相对纯文本挖掘关联库的隐性基础设施优势。

§1.3 同类数据集横向对比

数据集 主办机构 核心内容 与 TTD 的差异化
TTD 浙江大学 IDRB × 新加坡国立大学 BIDD 靶点-药物-疾病关联 + 成药性 + 扰动谱 + FDA 说明书档案 本文主角;双侧临床状态标签最完整
DrugBank Online 阿尔伯塔大学 药物-靶点/酶/转运体/载体细节与药代数据 DrugBank 偏药物级细节与药代属性;TTD 偏靶点级成药性与全周期开发状态
ChEMBL EMBL-EBI 大规模实测生物活性(IC50/Ki 等) ChEMBL 提供原始活性测定记录;TTD 以专家审编的关联与疾病语义为主,活性层为汇编补充
BindingDB 加州大学圣迭戈分校 化合物-蛋白结合亲和力 BindingDB 聚焦亲和力实验数据;TTD 将亲和力证据纳入靶点验证与疾病语境
Guide to Pharmacology IUPHAR/BPS 药理靶点专家注释与配对 GtP 逐条专家注释质量高但规模较小;TTD 规模更大并覆盖试验/专利/文献阶段

§1.4 版本时间轴

版本 发布年 规模要点 NAR 出处 新增能力
首发 2002 首个治疗靶点关联库 — 靶点-药物-疾病基础框架
2014 更新 2014 靶向治疗资源扩展 NAR 42(D1): D1118-D1123 靶向治疗数据扩充
2016 更新 2016 靶点与靶向通路信息 NAR 44(D1): D1069-D1074 靶向通路信息
2018 更新 2018 基础到临床转化资源 NAR 46(D1): D1121-D1127 差异表达谱与可下载数据、多靶点药物与联合治疗
2020 更新 2020 富化早期开发资源 NAR 48(D1): D1031-D1041 靶点调控 miRNA/转录因子、专利药物;引入 ICD-11
2022 更新 2022 比较数据富化 NAR 50(D1): D1398-D1407 34,861 个弱结合物与 12,683 个非结合物、534 对前药-药对、1,127 个共靶点
2024 更新 2024 3,730 靶点 / 39,862 药物 NAR 52(D1): D1465-D1477 9 类成药性特征(三视角)
2026 版 2026 3,798 靶点 / 40,398 药物 NAR 54(D1): D1692-D1701 306,247 靶点-疾病关联、10,506 扰动谱、44,649 份 FDA 说明书、Vue3+Django 架构重建

版本考古补记:2012 更新在第三方档案中亦有记录——彼时库规模从 1,894 个靶点 / 5,028 种药物扩展至 2,025 个靶点 / 17,816 种药物,并为 932 个靶点补充了靶点验证信息(John Snow Labs 档案所引 2012 更新摘要)。由此可勾勒 TTD 二十余年的生长曲线:靶点数十年间翻倍,药物数增长约八倍,扩展重心从"靶点关联"逐步移向"疾病语义与监管档案"。

§1.5 典型应用场景

场景 一句话描述 起步所需最小文件集
DTI 预测模型训练与冷启动评估 以双侧状态标签构造 cold-target / cold-drug 划分 P1-07 + P2-06 + P3-06
药物重定位 经 ICD-11 疾病映射把老药引向新病 P1-05 + P1-06
靶点发现优先级排序 用成药性特征对早期靶点做晋级概率建模 P1-01 + 2024 版成药性数据
联合用药与多靶点策略 利用协同/拮抗记录与共靶点信息设计组合 P5-01 + P1-07
药理学知识图谱构建 作为 KG 的药物-靶点-疾病骨干边(Translator/PharmKG 先例) P1-05 + P1-06 + P1-07 + P1-03

§2 医学背景

§2.1 疾病覆盖与 ICD-11 编码体系

TTD 覆盖全疾病谱,不限定单一疾病领域。自 2020 更新起,数据库整合 WHO 发布的 ICD-11 编码以清晰定义疾病与疾病分类,2026 版中靶点-疾病关联统一以 ICD-11 注释。下表给出代表性靶点-疾病对的 ICD-11 编码示例(编码为 WHO ICD-11 公开编码,用于说明 TTD 的注释粒度):

代表靶点 相关疾病 ICD-11 编码 ICD-11 中文名称
EGFR 非小细胞肺癌 2C12 气管、支气管或肺恶性上皮性肿瘤
ERBB2 乳腺癌 2C60 乳腺恶性上皮性肿瘤
PPARγ(PPARG) 2 型糖尿病 5A11 2 型糖尿病
BACE1 阿尔茨海默病 8A00 阿尔茨海默病
ACE 原发性高血压 BA00 原发性高血压
HMGCR 高胆固醇血症 5C80 高胆固醇血症

关于 SNOMED CT:TTD 未整合 SNOMED CT,疾病实体层统一使用 ICD-11 编码与名称。若下游项目需要 SNOMED CT 对齐,需自行通过 ICD-11 ↔ SNOMED CT 官方映射表转换。这意味着跨库(如与以 SNOMED 为骨架的 EHR 数据)合并时,疾病本体桥接是必要预处理步骤。映射链路总结:

场景 疾病 ID 路径 工具/来源
TTD 内部分析 直接用 ICD11 字段 P1-05/P1-06 原生编码
对接 SNOMED 骨架的 EHR ICD-11 → SNOMED CT 映射表 WHO 官方映射资源
跨库(DisGeNET/Open Targets 等) ICD-11 → MONDO → 各库 ID MONDO 本体(BioThings 先例,坑点 6)
流行病学口径 ICD-11 直接对齐 WHO 统计 ICD-11 官方浏览工具

§2.2 靶点成药性的医学语义

TTD 的靶点分类不是简单的生物学分类,而是临床开发进度的语义编码。靶点按其对应药物的最高状态分为五级:成功靶点(至少一个获批药)、临床试验靶点(无获批药但有试验药)、临床前靶点、专利靶点、文献报道靶点(仅研究性药物)。这一分类直接映射了药物研发漏斗:2026 版的 566 : 1,487 : 232 : 1,513(成功 : 试验 : 临床前/专利 : 文献)比例直观呈现了从文献到获批的衰减结构。

靶点分子类型覆盖蛋白(最常见)、核酸(DNA、mRNA、miRNA、lncRNA 靶点)与其他分子(如尿酸、铁、活性氧);药物类型覆盖小分子、抗体(含 ADC、双抗、抗体融合蛋白)、核酸药(ASO、siRNA、saRNA、miRNA、mRNA)、细胞治疗、基因治疗与疫苗。2024 版进一步为 3,151 个靶点(426 成功 + 1,014 试验 + 212 临床前/专利 + 1,479 文献报道)系统收集了 9 类成药性特征,分属分子相互作用/调控、人体系统、细胞表达变异三个视角。

TTD 收录的靶点验证证据分三类,构成"成功靶点"标签的证据地基:

证据类型 内容 对 AI 的意义
结合效价 药物对其主靶点的实验测定效价 DTI 正样本的定量锚点
疾病模型效力 药物在细胞系/离体/体内疾病模型上的效力 靶点-疾病关联的因果性增强
遗传操作效应 基因敲除、敲低、RNAi、转基因、抗体或反义处理的体内模型效应 靶点因果性的最强证据层

2024 版成药性特征的三个视角及其覆盖:

视角 特征内容举例 支撑任务
分子相互作用/调控 结合口袋、PPI 网络、调节 miRNA/转录因子 靶点可药性打分
人体系统 组织分布、通路参与、微生物组-药物调控 适应症外推与安全先验
细胞表达变异 跨疾病与扰动状态下的细胞表达变化 疾病特异性靶点筛选

§2.3 临床任务定义

在 TTD 语境下,"临床任务"对应计算药理学的四类预测任务:

任务 输入 输出 TTD 支撑字段
靶点发现/优先级排序 靶点属性 是否值得关注(成药性/晋级概率) 成药性 9 类特征、TARGTYPE 状态
DTI 预测 靶点+药物 是否相互作用/亲和力 P1-07 靶点-药物映射、P1-09 活性数据
药物重定位 药物+疾病 新适应症假设 P1-05/P1-06 ICD-11 疾病映射、FDA 说明书档案
联合用药设计 药物对 协同/拮抗关系 P5-01 联用数据、共靶点信息

需要强调:这些任务全部处于研究阶段,官网明确声明 TTD 不面向患者、不用于临床决策——任何临床转化必须经独立前瞻验证与监管审批。

§2.4 证据来源与人类证据层

TTD 不含患者级数据,其"人群"层表现为文献与官方登记中的人类证据汇总。2026 版的证据结构如下:

证据层 来源 覆盖规模 证据性质
遗传突变-疾病关联 UniProt 变异 API + ClinVar/dbSNP/ClinGen 仅保留有临床/实验证据的变异 群体遗传 + 临床变异注释
转录组扰动 CMap/LINCS 8,047 遗传修饰 + 2,459 化学干扰(2,368 个靶点) 批量转录组扰动实验
药物批准 Drugs@FDA 2,234 个获批药、44,649 份说明书 监管审评记录
试验状态 ClinicalTrials.gov + 公司报告 12,214 个临床试验药物 试验登记快照
分子活性 BindingDB/ChEMBL/PubChem 16,983 药物 × 5,253 蛋白 生化测定汇编

§2.5 临床与科研价值

对转化研究而言,TTD 的价值在于把"靶点-药物-疾病"三者的证据链压平为可查询、可下载的表格:靶点验证数据强制要求三类证据(实验效价、疾病模型效力、遗传操作体内效应)之一,避免"纸上靶点";疾病层以 ICD-11 统一,使流行病学口径可与 WHO 统计对齐;FDA 说明书档案将"剂量与给药、不良反应、非临床毒理、药物相互作用、特定人群使用、药效药代"等审评结论结构化,为 AI 辅助的说明书挖掘提供了官方文本锚点。

2026 版说明书档案按单一药物的多标签形态组织:同一药物因剂型不同(口服片、注射剂等)拥有多个标签,不同厂商的品牌名亦各自成档,共为 2,234 个已批准药物收集 44,649 份有效标签(2,141 份 NDA + 331 份 BLA + 8,889 份 ANDA)。每份说明书整合的关键临床信息维度及其 AI 用途如下:

说明书信息维度 内容示例 对下游 AI 的用途
适应症与用法 批准适应症文本与给药方案 重定位对照、适应症抽取
剂量与给药 剂量梯度与给药途径 剂量-靶点覆盖度分析
不良反应 审评确认的 AE 清单 安全信号与靶点外效应挖掘
非临床毒理 动物毒理摘要 转化风险建模
药物相互作用 合并用药禁忌与调整 联合用药先验
特定人群使用 妊娠/儿童/老年调整 人群公平性分析
药效药代 PD/PK 参数 系统药理学特征

§2.6 金标准与标签性质

维度 说明
划分 无官方 train/test 划分(全库单版本发布,见 §5)
标注方式 专家人工审编(非自动文本挖掘),关联证据需可溯源
标注者 浙江大学 IDRB 与 NUS BIDD 两支团队,双通讯(Feng Zhu、Y. Z. Chen)复核
标签性质 弱监督知识库标签:阳性关联 + 临床状态枚举;无系统性负样本
质量锚点 药物批准状态可回溯 Drugs@FDA 官方登记,属于可验证性最高的标签层

§3 数据集规格

§3.0 版本抉择矩阵

TTD 存在"当前主站 + 旧版镜像"两类获取渠道,文件组织差异明显,动手前先对号入座:

你的需求 推荐版本 渠道 理由
训练生产级 DTI/重定位模型 2026 版 idrblab.org/ttd 规模最大(3,798 靶点)、含 FDA 说明书与扰动谱、标识标准化最完整
复现 2024 年成药性论文结果 2024 更新版 主站或 NAR 论文附录 成药性 9 类特征与论文数字(426/1,014/212/1,479 靶点)对应
需要弱结合物/非结合物做负样本 2022 更新版 主站历史数据或论文附录 34,861 poor binders 与 12,683 non-binders 为该版特色
老脚本/旧教程兼容 旧版镜像 ttd.idrblab.cn 保留 v8.x 时代文件编号与块格式布局,但规模旧、不再扩展

§3.1 数据模态详情

TTD 的数据可拆为四个语义层,每层对应不同下载文件:

  1. 关联层:靶点-药物(P1-07,含作用模式与临床状态)、靶点-疾病(P1-06,ICD-11 注释)、药物-疾病(P1-05)、生物标志物-疾病(P1-08)。
  2. 实体层:靶点主文件(P1-01:名称、UniProt、基因、类型、功能、疾病适应症、通路)与药物主文件(P1-02:结构、治疗类别、开发状态)。
  3. 测度层:靶点-化合物活性(P1-09)、药物结构 SDF(P3-01)、SMILES/InChI(P3-06)、靶点序列 FASTA(P2-06)、UniProt 全集(P2-01)。
  4. 扩展层:KEGG 通路(P4-01)、WikiPathways(P4-06)、药物联用协同/拮抗(P5-01)、药物同义词与 ID 交叉引用(P1-03/P1-04)。

四层之间的对齐关系是 TTD 对 AI 最大的友好之处:任何一层拿到的实体都能通过统一 ID(靶点走 TARGETID/UniProt,药物走 DRUGID/PubChem CID,疾病走 ICD-11)路由到其他层,不需要模糊的名字匹配。计划任务时先画清"需要的最小层集合",再下载对应文件即可,不必全量拉取。

§3.2 子集与样本数

子集 计数 说明
靶点总计 3,798 2026 版
— 成功靶点(successful) 566 至少一个获批药
— 临床试验靶点 1,487 无获批药但有试验药
— 临床前/专利靶点 232 最高状态为临床前或专利
— 文献报道靶点 1,513 仅研究性药物
药物总计 40,398 2026 版
— 已批准药物 3,019 含 2,234 个有完整 FDA 说明书档案
— 临床试验药物 12,214 来自 ClinicalTrials.gov 与公司报告
— 临床前/专利药物 5,040
— 实验阶段药物 20,125
靶点-疾病关联 306,247 覆盖 2,912 个靶点
扰动谱 10,506 8,047 遗传修饰 + 2,459 化学干扰
分子级活性对 16,983 药物 × 5,253 蛋白 汇编自多源
FDA 说明书 44,649 对应 2,234 个获批药

§3.3 文件清单与格式

以下清单来自 KG-Registry 对 TTD 产品的登记(来源),下载后请以当版 Help 文档核对(文件编号存在跨版本漂移,见坑点 1):

文件名 内容 格式 解析难度
P1-01-TTD_target_download.txt 靶点主信息(ID/UniProt/基因/类型/功能/疾病/通路) TXT 块格式 高(需状态机解析)
P1-02-TTD_drug_download.txt 药物主信息 TXT 块格式 高
P1-03-Drug_xrefs.txt 药物 ID 交叉引用 TXT 中
P1-04-Drug_synonyms.txt 药物同义词 TXT 中
P1-05-Drug_disease.txt 药物-疾病映射(ICD) TSV 低
P1-06-Target_disease.txt 靶点-疾病映射(ICD) TSV 低
P1-07-Drug-TargetMapping.xlsx 靶点-药物映射(作用模式+状态) XLSX/CSV 低
P1-08-Biomarker_disease.txt 生物标志物-疾病映射(ICD) TSV 低
P1-09-Target_compound_activity.txt 靶点-化合物活性数据 TXT 中
P2-01-TTD_uniprot_all.txt 全部靶点 UniProt ID TXT 低
P2-06-All_target_seq.txt 全部靶点序列 FASTA 低
P3-01-Drug_structure.sdf 全部药物结构 SDF 中(RDKit)
P3-06-Drug_SMILE_InChI.txt 药物 SMILES 与 InChI TXT 低
P4-01-Target_KEGG_pathway.txt 靶点 KEGG 通路 TXT 低
P4-06-Target_wikipathway.txt 靶点 WikiPathways TXT 低
P5-01-Drug_combination_synergism_anti-counteractive.txt 药物联用(协同/拮抗/反相) TXT 中

两种文件形态的结构对照(决定了你的解析策略):

形态 结构约定 典型文件 正确读法
块格式 空行分隔记录;每行为"字段名 + 两个 Tab + 值";同名字段可在一记录内重复多行 P1-01、P1-02 状态机解析(§6.1),禁止 read_csv
TSV/表格 首行为表头,之后逐行一条记录 P1-05、P1-06、P1-07 pandas read_csv/read_excel 直读

§3.4 存储大小

官方未公布 2026 版完整下载包的总量。经验结构上,文本关联文件为十 MB 级,靶点序列 FASTA 与药物结构 SDF 为大文件主体;全库解压后建议预留 1-2 GB 磁盘空间。这是一个"文件数量多但单文件可独立使用"的库——若只做重定位任务,仅下载 P1-05/P1-06 两个 TSV 即可起步。存储规划上还有两个细节:SDF 文件读取建议流式处理(RDKit 的 ForwardSDMolSupplier)避免一次性载入内存;FASTA 解析建议直接产出"靶点 ID → 序列长度"索引表,便于后续按长度过滤异常序列。

§3.5 标注方式

全库采用人工审编:靶点-药物-疾病关联由团队逐条从文献与官方登记中抽取并复核,药物批准状态锚定 Drugs@FDA 官方登记(可验证性最高的标签层),试验状态定期与 ClinicalTrials.gov 同步。靶点验证数据的三类证据(实验效价/疾病模型效力/遗传操作效应)在官方说明中有明确方法论定义。这与自动化文本挖掘库(如某些 NLP 抽取型关联集)形成本质区别:标注率低但精确率高。

审编流水线可以概括为四步:① 证据采集——从文献、Drugs@FDA、ClinicalTrials.gov 与公司管线报告抓取候选记录;② 人工核验——研究团队逐条核对证据等级与状态归类;③ 标识标准化——靶点锚定 UniProt+HGNC、小分子锚定 PubChem CID、疾病锚定 ICD-11;④ 发布——随 NAR 大版本或增量维护上线,并在官网标注更新日期。对使用者而言,这条流水线的含义是:TTD 的字段语义由人工规则保证一致性,但时效性与覆盖率由发布周期决定。

§3.6 标注者资质与一致性

审编由浙江大学药学院 IDRB 组(PI:Feng Zhu)与新加坡国立大学 BIDD 组(共同通讯:Y. Z. Chen)的研究团队完成,团队连续在 NAR 数据库专刊发表 8 轮以上更新论文(2014-2026),方法论经长期同行评审检验。官网提供错误与 Bug 反馈渠道(联系 Dr. Zhang 与 Dr. Zhou)。跨标注者一致性量化指标(如 Kappa)未公布。

§3.7 采集周期与更新机制

年度大版本发布于 NAR 数据库专刊(2014/2016/2018/2020/2022/2024/2026),两次大版本之间进行增量维护:官网标注最近更新为 2025-10-09。核心节的时效性来源为 Drugs@FDA、ClinicalTrials.gov 与公司管线报告。三类内容的具体更新节奏:

内容层 更新载体 节奏
靶点与药物总量 NAR 大版本论文 约两年一轮
获批药与说明书 Drugs@FDA 同步 大版本间增量维护
试验状态 ClinicalTrials.gov 同步 定期刷新

§3.8 地域与物种覆盖

数据内容为全球文献溯源(人类物种为主),维护机构位于中国杭州(浙江大学)与新加坡(新加坡国立大学);Database Commons 登记国家/地区为中国,资助方为国家自然科学基金(82373790)。活性数据汇编源(BindingDB/ChEMBL/PubChem)均为国际公共库。覆盖结构小结:

维度 覆盖 来源
物种 人类为主(靶点级) Database Commons 登记 Homo sapiens
疾病 全疾病谱(ICD-11 多章) P1-06 关联层
机构归属 中国(杭州)/新加坡 两组建制
活性数据源 国际公共库汇编 2026 版论文

§3.9 设备与实验协议记录

TTD 不含原始仪器记录(这不同于影像或生理信号数据集)。活性值来自各源库的二次汇编,原始实验协议(仪器型号、测定条件)需回溯 BindingDB/ChEMBL 等一级源库核查——做活性回归任务时,这一异质性是必须建模的噪声源。

§3.10 深度溯源链

TTD 2026
├── 靶点实体      ← UniProt / HGNC symbol(官方双重标准化)
├── 药物实体      ← PubChem CID(小分子)+ P1-03/P1-04 交叉引用与同义词
├── 疾病实体      ← WHO ICD-11 编码
├── 遗传突变证据  ← UniProt 变异 API → ClinVar / dbSNP / ClinGen
├── 转录组扰动    ← CMap / LINCS(8,047 遗传修饰 + 2,459 化学干扰)
├── 活性汇编      ← BindingDB / ChEMBL / PubChem
├── 批准状态      ← Drugs@FDA(44,649 份说明书:2,141 NDA + 331 BLA + 8,889 ANDA)
└── 试验状态      ← ClinicalTrials.gov + 公司管线报告

§4 数据结构

§4.0 目录树

按官方全量下载页获取后,解压目录典型结构如下(文件编号以当版为准):

ttd_download/
├── P1-01-TTD_target_download.txt          # 靶点主文件(块格式)
├── P1-02-TTD_drug_download.txt            # 药物主文件(块格式)
├── P1-03-Drug_xrefs.txt                   # 药物 ID 交叉引用
├── P1-04-Drug_synonyms.txt                # 药物同义词
├── P1-05-Drug_disease.txt                 # 药物-疾病(ICD-11,TSV)
├── P1-06-Target_disease.txt               # 靶点-疾病(ICD-11,TSV)
├── P1-07-Drug-TargetMapping.xlsx          # 靶点-药物映射(含状态)
├── P1-08-Biomarker_disease.txt            # 生物标志物-疾病(TSV)
├── P1-09-Target_compound_activity.txt     # 靶点-化合物活性
├── P2-01-TTD_uniprot_all.txt              # 全部靶点 UniProt ID
├── P2-06-All_target_seq.txt               # 靶点序列(FASTA)
├── P3-01-Drug_structure.sdf               # 药物结构(SDF)
├── P3-06-Drug_SMILE_InChI.txt             # 药物 SMILES/InChI
├── P4-01-Target_KEGG_pathway.txt          # KEGG 通路
├── P4-06-Target_wikipathway.txt           # WikiPathways
├── P5-01-Drug_combination_synergism_anti-counteractive.txt
└── help/                                  # Help 文档与用户指南

§4.1 DAIMS 字段字典

以核心文件 P1-01(靶点主文件)与 P1-06/P1-07(关联文件)为例的 8 列字段字典(实体计数来自第三方解析器对 v8.1.01 的实测记录,2026 版计数会随更新增长):

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
TARGETID Text TTD 靶点标识,块格式行首字段 EGFR_HUMAN / TTDTARGET00001 实体对齐主键 同基因别名可产生多个靶点实体 无缺失 v8.1.01 实测 4,221 个
UNIPROID Text UniProt AC,可多值 P00533 跨库对齐 UniProt/序列 一个靶点多 AC 时以多行出现 少数缺失 v8.1.01 实测 3,597 个
TARGTYPE Text 靶点临床状态(最高状态定义) Successful target 分类/晋级任务标签 随版本漂移(快照语义) 无 5 类枚举
BIOCLASS Text 蛋白生化分类 Kinase 家族分层评估、泄漏控制 多值多行 可空缺 583 个生化类(8.x 记录)
TARGNAME Text 靶点名称 Epidermal growth factor receptor 展示与检索 同义词歧义 无 自由文本
INDICATI Text 适应症文本描述 Non-small cell lung cancer 重定位监督信号 自由文本歧义、一药多适应症 N.A. 自由文本
ICD11 Text WHO ICD-11 疾病编码 2C12 / 5A11 疾病归一与对齐 部分记录缺失 N.A.(实测 146 条) ICD-11 编码表
STATUS(P1-07) Text 药物-靶点对的开发状态 Approved; Phase III 正样本加权/分层 随版本漂移 无 枚举(批准/各期试验/实验)
SMILES/InChI(P3-06) Text 药物结构线性表示 CC(=O)OC1=CC=CC=C1C(=O)O 分子图特征 盐型/互变异构歧义 空值 合法 SMILES
FASTA 序列(P2-06) Text 靶点氨基酸序列 MGSGS… 序列嵌入/同源性聚类 异构体选择差异 无 标准氨基酸字母表
活性值(P1-09) Float 靶点-化合物实验活性 Ki/IC50 数值 回归任务目标 测定体系跨源异质(§3.9) 空缺 数值+单位(回溯源库核实)
交叉引用(P1-03) Text 药物 ID ↔ 外部库 ID TTD ID ↔ PubChem CID 实体归并主桥 陈旧交叉引用 无 枚举外部库前缀

§4.2 标签分布

靶点侧五级状态分布(2026 版):成功 566(14.9%)、临床试验 1,487(39.2%)、临床前/专利 232(6.1%)、文献报道 1,513(39.8%)。药物侧:已批准 3,019(7.5%)、临床试验 12,214(30.2%)、临床前/专利 5,040(12.5%)、实验阶段 20,125(49.8%)。两个分布都强烈右偏向早期阶段——做"晋级预测"时,正类(成功)仅约 15%,需要重加权或 focal loss;直接用批准率做回归时注意 20,125 个实验阶段药物贡献的类噪声。药物类型维度上,小分子仍是最大类别,抗体(含 ADC、双抗)、核酸药(ASO/siRNA/mRNA)、细胞治疗、基因治疗与疫苗构成增长最快的队列——TARGTYPE/药物类别字段的枚举粒度足以支撑按模态分层建模,但官方未公布各类型的精确计数,需要时可在解析后自行统计。

§4.3 关键统计

  • 靶点-疾病关联密度:306,247 条关联 / 2,912 个有疾病注释的靶点 ≈ 105 条/靶点,但中位数远低于均值——肿瘤相关靶点(EGFR、TP53 类)关联数呈长尾头部。
  • 药物-靶点扇出:3,019 个批准药对应 566 个成功靶点,意味着多药共用靶点是常态(同一靶点平均承载约 5 个批准药),做 cold-target 划分时切靶点即切断整个药物簇。
  • 扰动谱覆盖:10,506 条扰动 / 2,368 个靶点 ≈ 4.4 条/靶点,覆盖不足意味着多数靶点无法做基于扰动签的零样本迁移。
  • 疾病注释缺口:3,798 个靶点中仅 2,912 个(约 76.7%)有疾病关联——做重定位任务前先确认你的靶点池是否落在有注释的子集内。
  • 说明书-药物比:44,649 份 FDA 标签 / 2,234 个获批药 ≈ 20 份/药,反映同一分子跨剂型与厂商的多标签现实,做"药物粒度"分析时必须先按分子归并。
  • 负样本资源:2022 版登记的 34,861 个弱结合物与 12,683 个非结合物是库内唯一的"准阴性"资源,覆盖 1,308 个靶点——负样本策略应优先评估能否用上它们(坑点 4)。

§4.4 数据层级

TTD 的层级不是"患者→检查→切片",而是"数据库版本 → 文件(P1-P5 组) → 记录(块或行) → 字段(字段名+值)"。两个关键层级事实:

  • P1-01/P1-02 的记录以空行分块,块内字段行可重复(多 UniProt、多疾病、多通路各占一行),因此"一条记录"不是一行而是一个块;
  • 关联文件(P1-05/P1-06)才是逐行记录,可直达 pandas;
  • 实体层与关联层的连接键是 TARGETID/DRUGID,实体层与外部库的连接键是 UniProt/PubChem CID/ICD-11(双向桥表见坑点 2 与坑点 7)。

理解这个双层结构是所有下游解析的前提。

§4.5 缺失值与信息性缺失编码

情形 表现 处置建议
ICD-11 缺失 P1-05/P1-06 中 ICD11 字段为 N.A. 实测存在 146 条此类记录(第三方解析记录),应显式计数并隔离,禁止静默丢弃
块格式字段缺行 某靶点无 BIOCLASS 行 解析器需容忍字段缺失,落库为空值而非报错
活性值异构 P1-09 汇编多源,单位与测定体系不一 回归任务前按源库/测定类型分层或删减
疾病名称无编码 INDICATI 自由文本存在但无 ICD11 走文本归一管线(见坑点 6)
多 UniProt 行 同一靶点多条 UNIPROID 行 聚合为 list 或按 UniProt 拆行,策略写入数据卡(坑点 2)

§4.6 块格式样例:一条靶点记录长什么样

对 P1-01 块格式的感性认识是解析器设计的前提。一条记录的典型形态(示意结构,字段集合以当版 Help 文档为准):

TARGETID            EGFR_HUMAN
UNIPROID            P00533
TARGNAME            Epidermal growth factor receptor
TARGTYPE            Successful target
BIOCLASS            Kinase
SYNONYMS            ERBB1
SYNONYMS            HER1
FUNCTION            Receptor tyrosine kinase binding EGF...
DISEASE             Non-small cell lung cancer
DISEASE             Glioblastoma
KEGGPATHWAY         hsa04014
<空行>              ← 记录边界:下一个靶点记录从这里开始

三个关键细节:① UNIPROID、SYNONYMS、DISEASE 等多值字段以同名字段多行的方式呈现(本示例的表示方式;不同历史版本文件在多值细节上可能存在差异,务必以解析结果实测为准);② 每行内字段名与值之间是两个 Tab;③ 记录之间以空行分隔,文件末尾可能无空行——解析器要同时容忍这两种结尾。


§5 数据划分与使用建议

§5.1 官方划分状态

TTD 不提供官方 train/test 划分——它以单版本快照发布。所有划分决策由使用者承担。这不是缺陷而是知识库的常态:划分协议取决于任务(DTI 分类、活性回归、重定位排序各有最佳实践),TTD 的职责是提供干净的关联与状态标签,划分的科学与否是使用者的学术责任。相应地,任何基于 TTD 的性能声明都必须披露完整划分协议(见 §8.3)。

§5.2 社区惯例划分

DTI 文献在 TTD/DrugBank 类库上的三种主流划分:随机划分(按关联行)、cold-target(按靶点实体)、cold-drug(按药物实体)。TTD 的双侧状态标签使第四种成为可能:时间式划分——用旧版本训练、以新版本新增关联测试(例如以 2024 版为训练集,2026 版新增靶点-药物对为测试集),最接近"预测未来批准"的真实任务。四种划分的严格度与适用场景:

划分方式 划分单位 防泄漏力度 适用场景
随机划分 关联行 弱 与既有文献对表的参考基线
cold-target 靶点实体 强 声明"新靶点泛化能力"
cold-drug 药物实体 强 声明"新药泛化能力"
时间式 版本快照 最强(最贴近真实任务) 晋级/批准预测的前瞻评估

§5.3 泄漏风险(重点)

  1. 家族同源泄漏:TTD 覆盖 583 个蛋白生化类,同家族(激酶、GPCR)成员共享口袋结构;随机划分下模型可借家族指纹作弊。缓解:按生化类或按序列同一性聚类(30-40% 阈值)划分。
  2. 多药一靶簇泄漏:一个成功靶点平均承载约 5 个批准药,按行随机划分会把同一靶点的兄弟药物拆进两侧。缓解:group split 以靶点为组。
  3. 版本标签漂移泄漏:跨版本混用数据时,"clinical trial → successful"的翻转会让训练标签污染测试标签。缓解:锁定单一版本快照并在数据卡中记录 last update 日期。
  4. 结构等价泄漏:同一分子以盐型/异构体多种写法散布不同行(坑点 7),随机划分会把"同一个药"拆进两侧。缓解:InChIKey 去重后再划分。

§5.4 交叉验证建议

5 折 CV 必须以"靶点簇"为组(GroupKFold on cluster id);同时报告随机划分结果作为可比性参考,但论文结论应基于 cold split。若算力允许,建议随机划分重复 5 个随机种子取均值±标准差,cold 划分报告全量单次结果并注明簇阈值(30% 或 40% 序列同一性)——两种协议的方差不具可比性,混报会被审稿人抓住。

§5.5 外部验证建议

  • 活性层:与 BindingDB/ChEMBL 同靶点数据交叉核对(TTD 活性即汇编自这些源,注意同源重叠,先按 InChIKey 去重)。
  • 批准预测:以 Drugs@FDA 后续新增批准作为前瞻验证集(时间式划分的监管锚点)。
  • 疾病关联:与 Open Targets 平台的同靶点疾病覆盖做差集审计,识别 TTD 特有盲区与互补覆盖。

§6 AI 就绪指南

§6.0 云端快速启动

TTD 无官方云镜像或 API(2026 版重建后提供网页检索,批量获取以文件下载为准)。Google Colab 用户可直接 wget 下载文件到 /content/ttd/ 后运行本章代码;本地用户的目录约定见 §6.1 注释。

§6.1 快速上手:解析块格式主文件

# ========== 运行前提(务必先读) ==========
# 1. 目录结构预期:
#    data_root/
#    ├── P1-01-TTD_target_download.txt   (靶点主文件,块格式)
#    ├── P1-06-Target_disease.txt        (靶点-疾病,TSV)
#    └── P1-07-Drug-TargetMapping.xlsx   (靶点-药物映射)
# 2. data_root 拼接关系:代码中 DATA_ROOT 环境变量或函数参数直接指向上述目录,
#    文件名硬编码于函数内,改版后请按当版下载页核对文件名。
# 3. 最小可用子集:若只想跑通药物重定位原型,仅需 P1-06(TSV 可直接 read_csv);
#    本节先展示 P1-01 块格式的解析,这是全库唯一需要"状态机"的文件类型。
import os
from pathlib import Path

def parse_block_file(path: str) -> list[dict]:
    """解析 TTD 块格式:空行分隔记录,每行为 字段名 + 两个 Tab + 值。
    同一记录内同名字段可出现多行(多 UniProt / 多疾病 / 多通路),
    本解析器将其聚合为 list。"""
    records, current = [], {}
    with open(path, encoding="utf-8") as fh:
        for line in fh:
            line = line.rstrip("\n")
            if not line.strip():          # 空行 = 记录边界
                if current:
                    records.append(current)
                    current = {}
                continue
            parts = line.split("\t\t", 1)  # 字段名与值之间是两个 Tab
            if len(parts) != 2:
                continue                   # 容忍脏行而非崩溃
            key, val = parts
            if key in current:             # 同字段多行 → 聚合为 list
                if isinstance(current[key], list):
                    current[key].append(val)
                else:
                    current[key] = [current[key], val]
            else:
                current[key] = val
    if current:
        records.append(current)
    return records

DATA_ROOT = Path(os.environ.get("TTD_DATA_ROOT", "./ttd_download"))
targets = parse_block_file(DATA_ROOT / "P1-01-TTD_target_download.txt")
print(f"解析得到 {len(targets)} 条靶点记录")
print(targets[0])  # 抽查首条记录的字段结构

解析器上线前的三步验证:① 计数校验——2026 版靶点记录应为 3,798 量级(旧版约 4,221 个 TARGETID 实测记录可作历史参照);② 抽样校验——挑一个你熟悉的靶点(如 EGFR),人工核对解析出的 UniProt、状态与疾病字段与网页版一致;③ 字段覆盖率——统计每个字段名的出现率,突然消失或新增的字段往往意味着版本漂移或解析 bug。

§6.2 数据获取

步骤 操作 说明
1 访问 idrblab.org/ttd 免注册,无需申请
2 进入 Downloads / Full Data Download 对应 db.idrblab.net/ttd/full-data-download
3 下载所需分文件(P1-P5 组) 单文件独立可用,可按任务裁剪
4 核对当版文件名与 Help 文档 文件编号跨版本会漂移(坑点 1)
5 记录版本快照日期 官网标注 last update(当前 2025-10-09)
6 存档原始文件与校验和 版本复现的第一现场(§6.10)
# 批量下载示例(文件名以当版下载页为准;此命令演示 curl 语法与目录约定)
mkdir -p ttd_download && cd ttd_download
BASE="https://idrblab.org/ttd/downloads"
for f in P1-06-Target_disease.txt P1-07-Drug-TargetMapping.xlsx P2-06-All_target_seq.txt; do
  curl -L -o "$f" "$BASE/$f" && echo "OK $f"
done

引用义务:使用 TTD 数据发表成果时,须按官网要求引用 Zhang et al., Nucleic Acids Research 54(D1): D1692-D1701 (2026), PMID 41243978。

下载与合规检查清单(开工前逐项确认):

  1. 版本快照已记录(版本名 + last update 日期)。
  2. 文件清单与当版下载页核对过(编号漂移,坑点 1)。
  3. 用途落在"研究与教育"许可范围内,不含临床决策场景。
  4. 项目文档中预置了官方引用条目(§9.2 BibTeX 可直接粘贴)。

§6.3 预处理全流程

# 流程:块格式解析 → 实体表构建 → 分子结构标准化 → 疾病归一
import pandas as pd

# 步骤 1:关联文件直接读(TSV 自带表头行)
td = pd.read_csv(DATA_ROOT / "P1-06-Target_disease.txt", sep="\t", dtype=str)
print(td.columns.tolist())          # 先看列名再写后续逻辑
print("ICD11 缺失行数:", (td["ICD11"] == "N.A.").sum())  # 显式计数,勿静默过滤

# 步骤 2:靶点-药物映射(XLSX)
dt_map = pd.read_excel(DATA_ROOT / "P1-07-Drug-TargetMapping.xlsx", dtype=str)
# 关键列通常含:DRUGID、DRUGNAME、TARGETID、STATUS —— 状态字段保留做分层

# 步骤 3:分子结构标准化(以 PubChem CID 为主键思想,TTD 2026 官方即用 CID 映射小分子)
from rdkit import Chem
from rdkit.Chem.MolStandardize import rdMolStandardize

_normalizer = rdMolStandardize.Normalizer()
_reionizer = rdMolStandardize.Reionizer()
_uncharger = rdMolStandardize.Uncharger()

def canon_smiles(smi: str) -> str | None:
    """盐型/电荷态标准化 + 规范化 SMILES 输出(RDKit MolStandardize 标准流程)。"""
    try:
        mol = Chem.MolFromSmiles(smi)
        if mol is None:
            return None
        mol = _normalizer.normalize(mol)
        mol = _reionizer.reionize(mol)
        mol = _uncharger.uncharge(mol)
        return Chem.MolToSmiles(mol, canonical=True)
    except Exception:
        return None

# 步骤 4:以 InChIKey 去重同一分子(见坑点 7)
from rdkit.Chem import inchi
def inchikey(smi: str) -> str | None:
    try:
        mol = Chem.MolFromSmiles(smi)
        return inchi.MolToInchiKey(mol) if mol is not None else None
    except Exception:
        return None

说明:步骤 3 使用 RDKit MolStandardize 的 Normalizer → Reionizer → Uncharger 标准流程,能统一盐型与电荷态写法;步骤 4 的 InChIKey 是去重同一分子的最可靠键(坑点 7)。所有标准化函数都应容错返回 None 并记录失败样本,禁止让单条脏数据中断整库处理。

§6.4 PyTorch DataLoader:DTI 二分类

<details>
<summary>点击展开完整可运行 Dataset + DataLoader 代码(约 60 行)</summary>

# 任务:以 P1-07 靶点-药物映射为正样本,按靶点聚类做 GroupKFold 划分,
# 药物侧用 RDKit 拓扑指纹,靶点侧用预计算序列嵌入(示意用随机初始化占位)。
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
from rdkit import Chem
from rdkit.Chem import rdFingerprintGenerator as rfg

gen = rfg.GetMorganGenerator(radius=2, fpSize=1024)

class TTDDTIDataset(Dataset):
    """每条样本 = (药物 Morgan 指纹, 靶点序列嵌入) → 是否相互作用(1=正)。"""

    def __init__(self, pairs: pd.DataFrame, target_embed: dict, fp_dim: int = 1024):
        # pairs 需含列:DRUGNAME(或 SMILES 来源列)、TARGETID、label
        self.pairs = pairs.reset_index(drop=True)
        self.target_embed = target_embed          # {target_id: np.ndarray}
        self.fp_dim = fp_dim
        self._cache: dict[str, np.ndarray] = {}

    def _drug_fp(self, smi: str) -> np.ndarray:
        if smi not in self._cache:
            mol = Chem.MolFromSmiles(smi)
            fp = gen.GetFingerprint(mol) if mol is not None else np.zeros(self.fp_dim, dtype=np.float32)
            self._cache[smi] = np.asarray(fp, dtype=np.float32)
        return self._cache[smi]

    def __len__(self) -> int:
        return len(self.pairs)

    def __getitem__(self, idx: int):
        row = self.pairs.iloc[idx]
        x_drug = torch.tensor(self._drug_fp(row["smiles"]), dtype=torch.float32)
        x_target = torch.tensor(self.target_embed[row["TARGETID"]], dtype=torch.float32)
        y = torch.tensor(float(row["label"]), dtype=torch.float32)
        return x_drug, x_target, y

def make_loader(pairs, target_embed, batch_size=256, shuffle=True):
    ds = TTDDTIDataset(pairs, target_embed)
    return DataLoader(ds, batch_size=batch_size, shuffle=shuffle,
                      num_workers=4, pin_memory=torch.cuda.is_available())

# 划分原则(防泄漏,见 §5.3 / 坑点 5):
#   正样本 = P1-07 中 STATUS 为 Approved/Clinical trial 的行
#   负样本 = 优先采用 2022 版 poor binders / non-binders(坑点 4),
#            随机负采样仅为对照基线
#   划分   = GroupKFold(n_splits=5) 按 TARGETID 序列聚类簇分组(坑点 5)

</details>

§6.5 八大坑点

⚠️ 坑点 1:块格式不是 CSV——P1-01/P1-02 不能直接 read_csv(分类:预处理陷阱)

问题:靶点与药物主文件采用自创的块格式:记录间以空行分隔,记录内每行为"字段名 + 两个 Tab + 值",且同名字段可在一条记录内重复出现(一个靶点多个 UniProt、多个疾病、多条通路)。直接丢给 pandas.read_csv 会得到整行大字符串列,记录边界信息完全丢失。
症状:read_csv 后每行只剩一列巨型文本;原本文档标注的数千条靶点被拆成数万行;字段名混入数据;下游 groupby 统计对不上官方靶点数。
解决:

  1. 简单方法:按空行切块、逐行 split("\t\t", 1) 的状态机解析(见 §6.1 代码),同字段多行聚合为 list。
  2. 进阶方法:把解析器写成可复用模块并加断言——assert len(records) > 3000(2026 版应为 3,798 条靶点量级),版本升级时断言自动暴露漂移;对每个字段统计出现率,发现新增字段名时告警。
  3. SOTA 方法:直接复用社区已验证的解析成果(如 BioThings_TTD_Dataplugin 的字段级实测记录),并把解析输出缓存为 Parquet,一次解析、多任务复用。
    参考:官方下载页文件说明;DrugClaw TTD skill 的格式文档(明确标注 P1-01/P2-01 为块格式、P1-06/P1-07 为 TSV)。

⚠️ 坑点 2:TTD 靶点 ID 与 UniProt 不是一对一映射(分类:工程陷阱)

问题:TTD 靶点标识存在两种风格(TTDTARGET##### 数字序号与 EGFR_HUMAN 类基因风格),且一个靶点实体可对应多个 UniProt AC。第三方解析实测:v8.1.01 中 TARGETID 4,221 个而 UNIPROID 3,597 个——一对多映射普遍存在。假设"一行一个靶点、一行一个 UniProt"做 join 会静默错配。
症状:merge 后行数暴涨或骤减;同一基因被拆成多个实体;特征矩阵出现重复索引;评估集里同一蛋白既在训练侧又在测试侧。
解决:

  1. 简单方法:用 P2-01-TTD_uniprot_all.txt 建立 TTD ID ↔ UniProt 桥表,join 前先验证键唯一性(df["key"].is_unique)。
  2. 进阶方法:多映射时显式选择聚合策略——以靶点为粒度则 groupby 聚合 UniProt(保实体数),以 UniProt 为粒度则 explode 拆行(保蛋白数),并把选择写进数据卡。
  3. SOTA 方法:以 UniProt 为主键重建实体表,TTD ID 降级为溯源属性;对多对一聚合造成的语义损失(如同一靶点下的多个异构体)单独记录,序列任务改用 P2-06 FASTA 逐异构体建模。
    参考:BioThings 实测计数;TTD 2026 论文的 UniProt+HGNC 标准化策略。

⚠️ 坑点 3:临床状态是"最高状态快照",跨版本必然漂移(分类:标签理解)

问题:TARGTYPE 与药物状态是"发布时刻对应药物的最高状态"快照。官方 Table 1 显示成功靶点从 2024 版的 532 增至 2026 版的 566,临床试验靶点从 1,442 增至 1,487——每轮更新都有一批靶点"晋级"。用旧版本构造的标签在新版本上可能翻转,且官网 last update(如 2025-10-09)与大版本论文年份(2026)并不一致。
症状:跨版本复现的基线数字对不上;同一靶点去年是 clinical trial 今年变 successful;跨版本混训时标签自相矛盾;审稿人质疑"你用的哪个版本的 TTD"。
解决:

  1. 简单方法:锁定单一版本快照,在论文与代码仓库记录"TTD 2026(last update 2025-10-09)"字样,下载文件存档并校验。
  2. 进阶方法:把状态翻转显式建模——对 2024/2026 两版做 diff,生成"晋级事件表"(哪些靶点/药物升了级),即可把标签动力学本身变成研究对象。
  3. SOTA 方法:建立版本化数据管线(DVC 管快照 + 数据卡记录每版 diff 统计),训练时用事件时间(版本)做时间窗划分,模拟真实研发时间线。
    参考:TTD 2026 论文 Table 1 跨版本计数;官网 How to Cite 版本声明。

⚠️ 坑点 4:全库只有阳性关联,随机负样本注入假阴性(分类:偏倚陷阱)

问题:TTD 记录的是已被文献/登记证实的相互作用与关联,没有系统性采样的负样本。若用"未记录配对"当负样本(DTI 任务最常见的偷懒做法),大量真实存在但尚未被研究的相互作用会被错标为负——例如尚未被系统测过组合的老药-新靶点对。
症状:随机负样本模型 AUC 虚高(因为正负在"研究热度"维度天然可分);top-k 预测全被已知热门组合占据;换成实验验证集后精度暴跌。
解决:

  1. 简单方法:使用 2022 更新版专门收录的对照物数据——34,861 个弱结合物(poor binders)与 12,683 个非结合物(non-binders)作为高置信负样本。
  2. 进阶方法:约束负采样空间——只在"同疾病、同开发阶段"的候选内采样,并以实验效价阈值(如 Ki/IC50 > 100 μM)过滤,避免跨分布的平凡负样本。
  3. SOTA 方法:PU learning(positive-unlabeled)框架——把未标注对显式建模为"正+未知"混合分布,配合两阶段正样本风险估计,已在 DTI 文献中成为处理无负样本场景的标准解法。
    参考:TTD 2022 更新论文(NAR 50(D1): D1398-D1407);PU learning 在 DTI 任务的通行协议。

⚠️ 坑点 5:靶点家族同源性导致随机划分高估性能(分类:数据泄漏)

问题:TTD 的靶点覆盖数百个蛋白生化类,同家族成员(如 500+ 个激酶)共享口袋与结构模体。按关联行随机划分时,同家族靶点几乎必然同时出现在训练与测试两侧,模型学到的是"家族指纹"而不是特异性识别。
症状:随机划分 AUC 0.90+,改 cold-target 划分后掉到 0.7 以下;结构相近的同类药物(me-too 药)分散在两侧;模型对全新家族靶点零泛化。
解决:

  1. 简单方法:以靶点实体为组的 GroupKFold——切靶点而非切关联行(一个成功靶点平均承载约 5 个批准药,按行切必泄漏)。
  2. 进阶方法:用 P2-06 序列做 CD-HIT/MMseqs2 聚类(30% 或 40% 序列同一性阈值),按簇划分 cold-cluster,比按家族名划分更严格(同超家族不同亚族也被切开)。
  3. SOTA 方法:双维度 leave-cluster-out——靶点簇与药物骨架簇(Bemis-Murcko)同时外推,报告"随机 / cold-target / cold-drug / 双冷"四档结果区间,以区间下界作为泛化声明。
    参考:DTI 文献的标准划分协议(DeepDTA、GraphDTA 等均强调划分敏感性);TTD 生化类字段 BIOCLASS 可直接作为初版分组键。

⚠️ 坑点 6:ICD-11 注释存在 N.A. 与疾病名歧义(分类:预处理陷阱)
问题:疾病关联文件(P1-05/P1-06)以 ICD-11 编码定义疾病,但并非每条记录都有编码——第三方解析实测存在 146 条 ICD11 为 N.A. 的记录;同时 INDICATI 字段是自由文本,同一疾病有编码与纯文本两种形态,不同写法(含缩写、别名)指向同一实体。
症状:groupby 疾病编码后"N.A."成为最大类;同一疾病以多个文本形态重复计数;与 ICD-11 外部表 join 时命中率偏低。
解决:

  1. 简单方法:解析后立即显式统计并隔离 N.A. 行(保留计数以便论文报告),只用有编码行做编码级分析。
  2. 进阶方法:对无编码记录走文本归一——用 WHO ICD-11 检索 API 或本地 ICD-11 编码表对 INDICATI 文本做匹配,命中则回填编码并标记"推断"。
  3. SOTA 方法:经 MONDO 疾病本体做跨库桥接(BioThings 管线即把 TTD 的 ICD-11 映射到 MONDO),获得跨 DisGeNET/Open Targets 的可对齐疾病 ID 空间。
    参考:BioThings 实测记录(N.A. 146 条、去重 310+17 条);TTD 2026 论文 ICD-11 整合说明。

⚠️ 坑点 7:药物多 ID 体系并存,按名字 join 必出重复(分类:工程陷阱)

问题:同一个小分子同时拥有 TTD 药物 ID(如 D0Y4GH 风格短码)、PubChem CID、CHEBI ID 与多个商品名/同义词(P1-04);ID 交叉引用在 P1-03。第三方解析实测:因 CHEBI/PubChem+UniProt 组合重复,13,659 条记录在整合时被去重。药物主文件与结构文件(SDF/SMILES)之间同样存在同分子多条目。
症状:按药名 join 出一对多;同一分子被当独立药物重复计入数据集;SDF 中相同结构多记录导致分子特征重复采样;盐型与互变异构体被当成不同药。
解决:

  1. 简单方法:以 PubChem CID 为主键(TTD 2026 官方即以 PubChem CID 映射小分子),并用 P1-03 做一次性 ID 归并表。
  2. 进阶方法:RDKit canonical SMILES + InChIKey 双重去重(P3-06 提供现成 SMILES/InChI 列),盐型统一到母体骨架后再计数。
  3. SOTA 方法:Bemis-Murcko 骨架聚类分层——骨架层做划分(防结构泄漏)、分子层做计数(保样本语义),把"去重策略"写进数据卡。
    参考:TTD 2026 论文的 PubChem 标准化策略;BioThings 去重实测。

⚠️ 坑点 8:文献级 AUC 高不等于可转化——热门靶点富集偏倚(分类:评估误用)

问题:TTD 由文献审编而来,热门靶点(EGFR、TP53、激酶家族)与获批药的关联密度天然更高。在"整体随机划分"上报告的 AUC/AUPRC 反映了热度可分性,而不是模型对未知相互作用或未来批准的预测力。官方也没有提供任何基准排行榜来锚定"多少分算好"。
症状:整体 AUPRC 远低于 AUROC(类别不平衡 + 热度分层双影响);对孤儿靶点/罕见病召回接近 0;模型在 2026 版新增关联上的表现远低于在旧版本体上的表现。
解决:

  1. 简单方法:按靶点状态、生化类、ICD-11 疾病章分层报告指标,任何整体数字必须伴随分层明细。
  2. 进阶方法:时间式前瞻评估——以 2024 版为训练、2026 版新增关联为测试(利用版本间 diff),检验模型在"时间上真正未知"的关联上的表现。
  3. SOTA 方法:用 FDA 说明书档案(44,649 份,对应 2,234 个获批药)构造"批准事件"标签做时序验证,并以校准曲线(reliability diagram)替代纯排序指标——临床转化关心的是"预测 0.8 的把握是否真有 80% 成真"。
    参考:TTD 2026 论文 FDA 说明书与临床档案章节;DTI 评估协议中对冷启动与时间划分的通行要求。

§6.6 数据增强策略

策略 判定 说明
SMILES 随机枚举(同一分子的等价写法扰动) ✅ 安全 不改变化学语义,提升分子编码器不变性
盐型/电荷态标准化替代增强 ✅ 安全 属于清洗而非增强,统一到母体
靶点序列随机 mask(token 级) ✅ 安全 序列编码器预训练常用,不改标签
对活性值做插值/外推生成"新样本" ❌ 危险 活性受结合模式非线性支配,插值产生伪标签
对临床状态做标签平滑或随机翻转 ❌ 危险 状态是监管事实,翻转即造假
跨版本混用两版数据互相充数 ❌ 危险 状态漂移(坑点 3)使同实体标签不一致

一句话原则:TTD 的标签是"监管与文献事实",增强手段只能作用于输入表示(分子写法、序列 mask),永远不要触碰标签侧。

§6.7 模型推荐

模型家族 年份 关键技术 与 TTD 的适配性
DeepDTA 2018 药物 SMILES-CNN + 靶点序列-CNN 轻量基线首选;只用文本输入,与 TTD 的 FASTA/SMILES 直接兼容
GraphDTA 2020 分子图神经网络 + 序列 CNN 需要 SMILES→图转换(P3-06 提供结构列),适合中量级实验
MolTrans 2021 交互式分子-蛋白子结构挖掘 + Transformer 适合 cold 场景的子结构泛化;计算开销中高
序列预训练编码器(ESM 家族)+ 分子预训练模型融合 2022 至今 大规模蛋白/分子语言模型微调 靶点侧最强表示;TTD 的 3,798 靶点规模足够微调头部
XGBoost/随机森林 + 手工特征 — 指纹+成药性特征拼接 强可解释基线;可直接利用 TTD 成药性三视角特征

说明:上表为方法选型建议,各方法在 TTD 上的绝对性能因划分协议不同而不可横向比较(见 §8.1)。官方未发布 TTD 专属排行榜。

选型决策的经验法则:数据规模上 TTD 的正样本(P1-07 批准/试验对)量级适中,从头预训练编码器不经济,"预训练编码器 + 轻量头"是性价比最高的路线;若任务重心是重定位或靶点优先级排序,特征工程(成药性三视角 + 状态特征)配合梯度提升树往往优于端到端深度模型,且可解释性更好。

§6.8 硬件需求

层级 配置 适用任务
入门 8 核 CPU / 16 GB 内存 TSV 关联文件分析、重定位原型、XGBoost 基线
标准 单张 24 GB GPU(如 RTX 4090 级) DeepDTA/GraphDTA 训练、序列编码器推理
进阶 多卡(≥4 × 40 GB) 蛋白语言模型微调、全库 DTI 大规模训练

§6.9 评估指标实现

# DTI 任务推荐指标:AUPRC 优先于 AUROC(正类占比低,AUROC 易被海量平凡负样本稀释)
import numpy as np
from sklearn.metrics import roc_auc_score, average_precision_score

def evaluate(y_true: np.ndarray, y_score: np.ndarray, group: np.ndarray) -> dict:
    """group = 靶点簇 ID(坑点 5),用于分层汇报。"""
    overall = {
        "AUROC": roc_auc_score(y_true, y_score),
        "AUPRC": average_precision_score(y_true, y_score),
    }
    per_group = {}
    for g in np.unique(group):
        m = group == g
        if y_true[m].sum() > 0 and (1 - y_true[m]).sum() > 0:   # 组内正负齐备才计算
            per_group[str(g)] = {
                "AUROC": roc_auc_score(y_true[m], y_score[m]),
                "AUPRC": average_precision_score(y_true[m], y_score[m]),
            }
    overall["per_cluster"] = per_group
    return overall

实现要点:① 类不平衡下 AUPRC 是比 AUROC 更诚实的主指标(坑点 8 的热度偏倚会推高 AUROC);② 分层循环里跳过正或负样本为零的簇并记录跳过清单,禁止让单簇异常中断评估;③ 报告时把 overall 与 per_cluster 并排呈现,任何"整体 0.9"都要能回答"孤儿簇上是多少"。

§6.10 MLOps 笔记

  1. 快照即版本:以"TTD 2026(last update 2025-10-09)"作为数据版本单位入库,下载原始文件存档于对象存储并记录校验和。
  2. DVC/数据卡:每次版本升级生成 diff 报告(新增靶点/药物数、状态晋级清单),关联到模型训练 run。
  3. 解析产物缓存:块格式解析结果(§6.1)缓存为 Parquet,解析器本身进版本控制——解析 bug 是 TTD 工程事故的头号来源(坑点 1/2)。
  4. 监控漂移:线上模型定期用新版 TTD 增量关联回测,关注"热门靶点 AUC"与"孤儿靶点召回"的分化趋势(坑点 8)。

MLOps 工具与 TTD 特有风险的映射:

环节 工具 TTD 特有检查点
数据版本 DVC / LakeFS 快照以 last update 日期命名,非论文年份
解析产物缓存 Parquet + Schema 校验 字段名集合断言(漂移检测)
数据卡 模型卡附录 坑点 2/3/4/5/7 五要素披露
回测 定时任务 新版关联增量上的指标退化监控

补充一条质量断言脚本,建议纳入每次数据刷新后的 CI:

# 数据刷新后的最小质量门禁(放在解析产出的 Parquet 之后执行)
def assert_ttd_health(targets: list[dict], td_count: int) -> None:
    n = len(targets)
    assert n > 3000, f"靶点记录数异常:{n}(2026 版应为 3,798 量级)"
    ids = [r.get("TARGETID") for r in targets]
    assert len(ids) == len(set(ids)), "TARGETID 出现重复,解析器可能把记录边界切错了"
    assert td_count > 250_000, f"靶点-疾病关联数异常:{td_count}(2026 版应为 306,247 量级)"
    print(f"健康检查通过:{n} 条靶点记录,{td_count} 条靶点-疾病关联")

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
文献热度偏倚 热门靶点与获批药关联密度远高于孤儿靶点 高 分层评估;对低热度子集单独报告
阳性样本偏倚 只记录已证实关联,无系统性负样本 高 用 poor binders/non-binders 或 PU learning(坑点 4)
疾病谱失衡 肿瘤类关联占比显著高于其他章节 中 按 ICD-11 章分层;跨章迁移前先做覆盖审计
物种偏倚 以人类靶点为主 低-中 跨物种任务需引入其他库补充
活性异质 活性值汇编自多源测定体系 中 回归任务按源库/测定类型分层(§3.9)
版本漂移 状态标签随版本翻转 中 版本快照管理(坑点 3)
热门组合密度 热门靶点 × 获批药组合在关联层密度最高,影响排序类任务 中 基于热度分层采样与评估(坑点 8)

§7.2 标注质量

人工审编 + 双通讯复核 + 长期同行评审出版史(2014-2026 连续 8 轮 NAR 更新)构成 TTD 的质量背书;批准状态层可回溯 Drugs@FDA 官方登记,是全库可验证性最高的部分。未公布标注者间一致性量化指标;文献依赖使标注天然滞后于最新研究(大版本间隔约两年)。

对质量敏感的任务,建议做三个抽查动作后再全量信任标签:① 随机抽 50 个成功靶点回溯其获批药是否存在于 Drugs@FDA;② 抽 20 条靶点-疾病关联核对 ICD-11 编码与疾病名是否匹配;③ 用 P2-01 桥表验证 P1-01 中 UNIPROID 与 TARGETID 的对应关系是否符合坑点 2 的预期。抽查成本一小时以内,却能拦截绝大多数解析层错误。

§7.3 泛化性风险评估

使用场景 失效风险 证据与说明
热门靶点 DTI(如激酶) 低 关联密度高、证据等级高
孤儿靶点/罕见病关联 高 文献稀疏导致覆盖盲区(坑点 8)
新兴靶点(2024 后发表) 中-高 大版本间隔约两年,增量维护有限
非人类物种建模 高 库内容以人类为主(§3.8)
跨疾病章迁移(肿瘤→代谢) 中 疾病谱失衡影响迁移先验

泛化性红线三条:① 任何"对全新靶点家族的预测力"声明必须有 cold-cluster 结果背书;② 罕见病方向的结论需明示 TTD 覆盖盲区;③ 跨物种使用 TTD 标签属于超出数据支撑范围的推断,应明确标注为外推。

§7.4 伦理考量

TTD 不含患者级数据与个人可识别信息,伦理审批要求为空。官方使用条款明确:仅供合格专业人员的研究、教育与信息用途,不构成临床决策依据。基于 TTD 产出的模型进入临床前,仍需独立的伦理与监管流程。值得注意的是,官网首页即置顶了这一非临床声明——在同类药理数据库中,这种"用途边界前置"的合规姿态相当明确,使用者在项目文档中应原样继承该边界声明。

§7.5 公平性

库本身不含人口学属性。间接公平性问题来自疾病与人群的文献覆盖差:若某些人群的疾病研究被系统性低估,关联层会继承该缺失。用 TTD 训练的模型在跨人群部署前,应在目标人群数据上单独验证。FDA 说明书档案中的"特定人群使用"维度(妊娠/儿童/老年用药调整)是库内唯一的人群属性入口,可支撑人群差异性的初步分析,但其覆盖深度取决于说明书本身的记载。

§7.6 数据漂移

漂移类型 触发机制 影响 监控手段
标签漂移 状态晋级(clinical trial → successful) 训练标签与线上输入语义不一致 每版 diff 报告(坑点 3)
覆盖漂移 新版新增靶点/药物(2024→2026 药物 39,862→40,398) 关联密度分布变化,评估基线漂移 版本间分布对比
架构漂移 2026 版 Vue3+Django 重建 下载路径与文件组织变化 下载管线年度回归测试
结构漂移 文件编号跨版本漂移(坑点 1) 自动化脚本解析失败 文件名清单断言

§7.7 DAIMS 24 项检查

# 检查项 状态 说明
1 宽格式 ⚠️ 主文件为块格式、关联文件为 TSV,混合形态需自转换(坑点 1)
2 唯一标识 ✅ 靶点 ID/药物 ID 体系完整,另有 UniProt/HGNC/PubChem/ICD-11 标准映射
3 特殊字符 ⚠️ 药名含希腊字母与连字符变体,文本解析需容忍非 ASCII
4 重复行 ⚠️ 第三方整合实测 13,659 条重复 ID 记录需去重(坑点 7)
5 缺失编码 ⚠️ ICD11 字段存在 N.A.(实测 146 条),无官方说明(坑点 6)
6 标签标识 ✅ 靶点 5 级/药物 4 级状态显式枚举,语义有官方定义
7 罕见类分组 ⚠️ 临床前/专利靶点仅 232 个,小类需重加权或合并
8 偏倚评估 ⚠️ 文献热度与疾病谱偏倚明确存在,官方未提供量化偏倚报告
9 数据字典 ✅ 下载页 + Help 文档提供字段级说明
10 信息性缺失解释 ❌ N.A. 与空字段无官方语义解释
11 设备记录 ❌ 无仪器级记录(活性为二次汇编,属库性质而非缺陷)
12 共线性 ❌ 官方未提供特征相关性检查(关联型数据库不适用,需自行构建特征后检查)
13 编码映射 ✅ UniProt+HGNC/PubChem CID/ICD-11 三向标准映射(2026 版官方策略)
14 时间戳处理 ⚠️ 仅有库级 last update(2025-10-09),无逐条记录时间戳
15 划分建议 ⚠️ 无官方划分;状态字段可派生 cold split(§5)
16 泄漏讨论 ⚠️ 官方未讨论;家族泄漏与多药一靶簇泄漏需使用者自行控制(坑点 5)
17 标签分布 ✅ 论文 Table 1 公布四类状态计数,分布可核
18 测量偏倚 ⚠️ 活性值跨源异质,测定协议未随值发布
19 外部验证建议 ❌ 官方未提供外部验证协议(§5.5 给出社区可行方案)
20 版本记录 ✅ 版本号 + last update 日期 + NAR 论文三位一体,可追溯性优秀
21 预处理脚本 ❌ 无官方解析/预处理脚本(§6.1-§6.4 提供可运行替代)
22 合规要求 ✅ 许可(研究教育用途)、引用格式、非临床声明齐全
23 多模态对齐 ✅ 靶点-药物-疾病-通路-活性以统一 ID 互联,跨文件可 join
24 去标识化 ✅ 无个人信息,天然满足(非脱敏产物,而是不收集)

DAIMS 评分:14.5 / 24(✅×9 + ⚠️×10 + ❌×5)

评分解读:TTD 在"标识体系、版本记录、标签语义、合规声明"四项上达到知识库的一流水准——这四个 ✅ 恰好是知识图谱与关联预测任务最依赖的地基。失分集中在两类:一是"工程友好度"(块格式、无脚本、无划分),这是所有 20 年历史、以论文发布为中心的数据库的共同形态;二是"统计卫生"(缺失编码解释、偏倚量化、泄漏讨论),官方把这部分责任留给了使用者。

对你意味着什么:如果你的任务是重定位或 KG 构建——可以直接开工,ID 映射与状态标签会让你省掉大半清洗工作(预期 1-2 天内可跑通原型)。如果你的任务是 DTI 训练——请把预算的三分之一留给坑点 1/2/4/5:解析器、ID 桥表、负样本策略与 group 划分,任何一项跳过都会让论文数字不可信。如果你的任务涉及活性回归——先做测定体系分层审计(§3.9、坑点 8),否则回归目标本身就是异质的。无论哪条路线,从第一天起就锁定版本快照并记录 last update 日期,这是 TTD 使用者的第一纪律。

§7.8 外部采纳与验证记录

TTD 官方未发布基准验证矩阵。库的"外部有效性"在第三方工程中有可核查的采纳记录,下表只列有登记/工程文档支撑的事实:

外部项目/场景 来源机构 对 TTD 的使用方式 关键发现
KG-Registry 知识图谱生态 kghub(NCATS Translator 生态) TTD 作为聚合器被 PharmKG、Translator 等多个 KG 采纳为主数据源 TTD 的靶点-药物映射(P1-07)与疾病映射(P1-05/P1-06)是 KG 骨干边的常用来源(登记页)
BioThings API 化 第三方(BioThings Dataplugin) 将 TTD v8.1.01 全量 876,046 条记录解析为生物医学 API 实体 完整记录了 TTD 原始数据的重复行、N.A. 与 ID 多映射规模(README)
Database Commons 收录 国家基因组科学数据中心(NGDC) 作为药物类数据库的标准档案收录并跟踪更新 版本 v9.0、最近更新 2025-10-09、可访问性达标(档案页)
NAR 数据库专刊持续收录 Nucleic Acids Research 编辑部 2014-2026 连续 8 轮更新论文通过同行评审 更新方法论(成药性三视角、扰动谱、FDA 说明书档案)经评审认可

§8 基准与生态

§8.1 基准现状与可比性声明

TTD 没有官方性能排行榜:它以单版本快照发布,无固定测试集、无官方划分、无提交协议。DTI 文献中的排行榜大多基于 Davis/KIBA/BindingDB 等亲和力数据集,或基于各自抽取的 TTD/DrugBank 子集——同一名义数据集在不同论文中的样本量、划分与负样本策略都不同。因此任何跨论文的数字都不具备直接可比性。下表改为提供 DTI 方法的选型锚点(完整引用 + 技术定位),供在 TTD 上自建基准时选择骨干:

模型 年份 关键技术 完整引用 代码
DeepDTA 2018 SMILES/序列双通道 CNN Öztürk H., Ozgür A., Ozkirimli E., DeepDTA: deep drug-target binding affinity prediction, Bioinformatics, 34(17): i821-i829, 2018. doi:10.1093/bioinformatics/bty593 GitHub
GraphDTA 2020 分子图神经网络 + 序列 CNN Nguyen T., Le H., Quinn T.P., Nguyen T., Le T.D., Venkatesh S., GraphDTA: predicting drug–target binding affinity with graph neural networks, Bioinformatics, 37(8): 1140-1147, 2021. doi:10.1093/bioinformatics/btaa921 GitHub
MolTrans 2021 子结构交互挖掘 + Transformer Huang K., Xiao C., Glass L.M., Sun J., MolTrans: Molecular Interaction Transformer for drug–target interaction prediction, Bioinformatics, 37(6): 830-836, 2021. doi:10.1093/bioinformatics/btab081 GitHub

在 TTD 上自建基准时,请固定:版本快照、划分协议(建议四档,见坑点 5)、负样本策略(坑点 4)三项,并在论文中全部披露。

§8.2 SOTA 总结与选型建议

DTI 领域的方法演化主线是"表示学习深度":指纹+核方法(2015 前)→ CNN(2018)→ 图+Transformer(2020-2021)→ 大规模蛋白/分子预训练模型(2022 至今)。在 TTD 这样的知识库标签上,纯表示学习的收益递减——瓶颈通常在负样本与划分,而非编码器容量。实践建议:先用 XGBoost+指纹/成药性特征建立强基线,再上预训练编码器,把主要精力花在划分协议与分层评估上。另一个常见误区是把"在 TTD 上表现好"等同于"靶点发现能力强":库标签反映的是文献共识的过去,而非生物学的未来,任何候选都必须回到实验验证闭环。

§8.3 评测协议建议

固定四档划分(随机 / cold-target / cold-drug / 双冷)+ 分层汇报(靶点状态 × 生化类 × ICD-11 章)+ AUPRC 优先。任何单档数字都不构成性能声明。完整的评测协议披露应至少包含六个要素:TTD 版本与 last update 日期、正样本定义(哪些状态计入阳性)、负样本策略(坑点 4)、划分协议与分组键(坑点 5)、去重规则(坑点 7)与评估指标及其分层口径(坑点 8)。六要素齐全的 TTD 基线,才具备被后续工作复现的资格。

数据集 主办方 与 TTD 的互补关系 联用建议
DrugBank Online 阿尔伯塔大学 药物级药代与适应症细节,可补充 TTD 的药物实体层 以 PubChem CID/InChIKey 对齐药物实体
ChEMBL EMBL-EBI 原始活性测定记录,可深化 TTD 活性层的证据粒度 以 UniProt AC 对齐靶点后回填活性值
BindingDB 加州大学圣迭戈分校 亲和力专项库,DTI 回归任务的主力补充 注意与 TTD 活性层同源重叠,去重后再用
Guide to Pharmacology IUPHAR/BPS 高精度药理注释,适合做 TTD 标签的交叉校验 抽样比对 P1-07 的作用模式注释质量
Open Targets Platform Open Targets 联盟 靶点-疾病关联的多源整合打分 与 P1-06 关联层做覆盖差集审计

§8.5 关键论文 Top 5

  1. Zhang Y.T. et al., Therapeutic target database 2026: facilitating targeted therapies and precision medicine, Nucleic Acids Research, 54(D1): D1692-D1701, 2026. doi:10.1093/nar/gkaf1154, PMID 41243978. — 2026 版:306,247 关联、扰动谱、FDA 说明书档案与架构重建。
  2. Zhou Y. et al., TTD: Therapeutic Target Database describing target druggability information, Nucleic Acids Research, 52(D1): D1465-D1477, 2024. doi:10.1093/nar/gkad751, PMID 37713619. — 成药性三视角九类特征。
  3. Zhou Y. et al., Therapeutic target database update 2022: facilitating drug discovery with enriched comparative data of targeted agents, Nucleic Acids Research, 50(D1): D1398-D1407, 2022, PMID 34718717. — 弱结合物/非结合物/前药/共靶点。
  4. Wang Y. et al., Therapeutic target database 2020: enriched resource for facilitating research and early development of targeted therapeutics, Nucleic Acids Research, 48(D1): D1031-D1041, 2020, PMID 31691823. — 靶点调控物、专利药物与 ICD-11 整合。
  5. Li Y.H. et al., Therapeutic target database update 2018: enriched resource for facilitating bench-to-clinic research of targeted therapeutics, Nucleic Acids Research, 46(D1): D1121-D1127, 2018, PMID 29140520. — 基础到临床转化数据扩展。

§8.6 社区活跃度

TTD 的社区形态是"学术引用驱动"而非开源社区驱动:系列 NAR 论文在 Europe PMC 的可查引用累计超过 2,000 次(截至 2026-07)。Database Commons(NGDC)与 NAR 数据库状态档案(nardbstatus)持续跟踪其可用性;KG-Registry 登记 16 个数据产品与多个下游 KG 采纳;第三方工程(BioThings 插件、LLM agent skill)近年出现,反映其在 AI 工具链中的渗透。官网提供错误反馈邮箱,无公开 issue 跟踪。生态渗透的时间线:

时间 生态事件
2002 数据库上线,此后每约两年一轮 NAR 更新
2021(v8.1.01 时代) 第三方 BioThings 将全库 87.6 万条记录 API 化,实测字段与重复问题被系统记录
2023-2024 KG-Registry 登记其 16 个数据产品;多个药理学知识图谱(PharmKG、Translator)将其列为主数据源
2025-2026 Vue3+Django 架构重建、免登录访问;LLM agent 生态出现 TTD 查询 skill

§8.7 生态快照

资源 类型 链接 推荐理由
TTD 主站 数据库门户 idrblab.org/ttd 检索与下载入口,免登录
全量下载页 数据下载 db.idrblab.net/ttd/full-data-download 18 个分文件的获取点
Database Commons 档案 数据库目录 NGDC 档案 版本/更新/资助信息与论文列表
KG-Registry 登记 生态目录 kghub 登记 16 个数据产品的结构化清单
BioThings Dataplugin 第三方解析器 GitHub 字段级实测与去重记录,解析器参考实现
TTD 2026 论文全文 论文 PMC12807707 四层数据的方法学细节
John Snow Labs TTD 档案 第三方历史档案 档案页 2012 更新规模的第三方记录,版本考古用

§9 相关资源与引用

§9.1 官方资源

  • 主站与检索:https://idrblab.org/ttd/(免登录;支持按靶点/药物/ICD-11 疾病类/生物标志物/药物骨架检索)
  • 检索能力明细:① 按靶点或药物名称/ID 全库检索(示例:EGFR、Imatinib);② 按 ICD-11 疾病分类浏览靶点与药物;③ 按生物标志物-疾病关联检索;④ 按药物骨架名称检索骨架族;⑤ 多条目批量检索(多靶点序列或多药物结构批量提交,2022 更新引入的高级检索能力)。
  • 全量下载:https://db.idrblab.net/ttd/full-data-download(18 个分文件,免注册)
  • 镜像与历史版本:db.idrblab.org(镜像)、ttd.idrblab.cn(旧版 v8.x 时代界面)、bidd.group(NUS 侧入口)
  • 镜像使用提示:旧版镜像(ttd.idrblab.cn)的文件编号与新版主站不同(例如 P2-01 在两代文件组织中指向不同内容),跨镜像混用文件前务必核对文件名语义(坑点 1 的变体)。
  • 官方引用要求:使用 TTD 发表成果须引用 Zhang et al., NAR 54(D1): D1692-D1701 (2026), PMID 41243978
  • 错误反馈:官网公示联系渠道(Dr. Zhang 与 Dr. Zhou)
  • 故障备用:2020 更新论文曾提及官方建有镜像站(db.idrblab.org 与 db.idrblab.net),主站访问异常时可尝试镜像;旧版界面另有 ttd.idrblab.cn

§9.2 BibTeX 引用块

@article{Zhang2026TTD,
  title   = {Therapeutic target database 2026: facilitating targeted therapies and precision medicine},
  author  = {Zhang, Y. T. and Zhou, Y. and Xu, H. W. and Jiang, W. H. and Li, B. and Lai, D. Y. and Wan, C. and Wang, S. S. and Zhao, M. X. and Tan, Y. and Lu, S. L. and Fan, T. T. and Liu, X. and Zhu, F. and Chen, Y. Z.},
  journal = {Nucleic Acids Research},
  year    = {2026},
  volume  = {54},
  number  = {D1},
  pages   = {D1692--D1701},
  doi     = {10.1093/nar/gkaf1154},
  pmid    = {41243978}
}

@article{Zhou2024TTD,
  title   = {TTD: Therapeutic Target Database describing target druggability information},
  author  = {Zhou, Y. and Zhang, Y. and Zhao, D. and Yu, X. and Shen, X. and Zhou, Y. and Wang, S. and Qiu, Y. and Chen, Y. and Zhu, F.},
  journal = {Nucleic Acids Research},
  year    = {2024},
  volume  = {52},
  number  = {D1},
  pages   = {D1465--D1477},
  doi     = {10.1093/nar/gkad751},
  pmid    = {37713619}
}

@article{Zhou2022TTD,
  title   = {Therapeutic target database update 2022: facilitating drug discovery with enriched comparative data of targeted agents},
  author  = {Zhou, Y. and Zhang, Y. and Lian, X. and Li, F. and Wang, C. and Zhu, F. and Qiu, Y. and Chen, Y.},
  journal = {Nucleic Acids Research},
  year    = {2022},
  volume  = {50},
  number  = {D1},
  pages   = {D1398--D1407},
  pmid    = {34718717}
}

§9.3 引用指南

  • 数据使用:引用对应版本的 NAR 论文并注明版本与 last update 日期(如"TTD 2026, last update 2025-10-09")。
  • 代码使用:本词条 §6 的解析与训练代码可自由使用,但引用本页面不替代对 TTD 官方论文的引用义务。
  • 口径提示:涉及靶点/药物计数时注明版本,因为跨版本数字不可混用(坑点 3)。
  • 二次分发:向他人转交 TTD 数据时,应附带原始许可声明(研究教育用途)与版本信息,避免脱离语境的数据漂流。

§9.4 数据卡维护模板(建议)

基于 TTD 的特性,建议每个使用它的项目维护如下五要素数据卡:

dataset: TTD
version: "2026"
last_update: "2025-10-09"
download_snapshot: "s3://your-bucket/ttd/2026_2025-10-09/"   # 原始文件存档与校验和
splits: "cold-target (30% identity clusters)"                 # 划分协议(坑点 5)
negative_strategy: "poor-binders + PU learning"               # 负样本策略(坑点 4)
dedup_rule: "PubChem CID + InChIKey"                          # 去重规则(坑点 7)
id_mapping: "TTD ID -> UniProt (P2-01 bridge)"                # ID 桥表(坑点 2)

这五要素分别对应坑点 2/3/4/5/7,是 TTD 项目可复现性的最小闭环。


§10 AI 使用声明卡

§10.1 AI 模型列表

模型 用途 版本信息
大语言模型(CodeBuddy Code 内置模型) 词条初稿撰写、结构组织、代码示例生成 2026-09 生成环境

§10.2 AI 参与范围

AI 完成了:事实检索结果的组织与综合、全部章节初稿撰写、代码示例编写、表格构建。人工完成了:事实核查(4 轮 WebSearch 检索与 FACTS 清单比对)、章节结构审定、代码正确性复核(RDKit 标准化流程、块格式解析器逻辑)、最终校验(check_md.py + 人工复核)。所有规模数字、日期、引用数均来自检索到的公开来源(见 §10.3),未由 AI 推断或生成;检索结果与任务种子信息冲突处(维护方归属、规模更新)以检索来源为准并在文中标注。

§10.3 输入来源列表

  1. Zhang Y.T. et al., Therapeutic target database 2026: facilitating targeted therapies and precision medicine, Nucleic Acids Research, 54(D1): D1692-D1701, 2026. doi:10.1093/nar/gkaf1154. PMID: 41243978.(PMC 全文)
  2. Zhang Y.T. et al., 同上论文的 Oxford Academic 版本页,doi:10.1093/nar/gkaf1154.(出版页)
  3. Zhou Y. et al., TTD: Therapeutic Target Database describing target druggability information, Nucleic Acids Research, 52(D1): D1465-D1477, 2024. doi:10.1093/nar/gkad751. PMID: 37713619.
  4. Zhou Y. et al., Therapeutic target database update 2022, Nucleic Acids Research, 50(D1): D1398-D1407, 2022. PMID: 34718717.
  5. Wang Y. et al., Therapeutic target database 2020, Nucleic Acids Research, 48(D1): D1031-D1041, 2020. PMID: 31691823.
  6. Li Y.H. et al., Therapeutic target database update 2018, Nucleic Acids Research, 46(D1): D1121-D1127, 2018. PMID: 29140520.
  7. Yang H. et al., Therapeutic target database update 2016, Nucleic Acids Research, 44(D1): D1069-D1074, 2016.
  8. Qin C. et al., Therapeutic target database update 2014, Nucleic Acids Research, 42(D1): D1118-D1123, 2014.
  9. TTD 官方主页与 How to Cite 页面.(db.idrblab.net)
  10. TTD Database Commons 档案(NGDC).(档案页)
  11. KG-Registry TTD 资源登记页.(kghub)
  12. BioThings_TTD_Dataplugin README(v8.1.01 字段级解析实测).(GitHub)
  13. NAR 数据库状态跟踪页(nardbstatus.de).(DB1 档案)
  14. DrugClaw TTD skill 格式文档(LobeHub).(格式说明)
  15. Therapeutic Targets Database 词条(开放镜像).(owiki)

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
frontmatter 与 INFOBOX 数字 千方病案医学编辑部 与 FACTS.md 逐条比对 ✅ 已通过/已验证
§1-§2 概览与医学背景 千方病案医学编辑部 来源交叉核对 ✅ 已通过/已验证
§3-§4 规格与数据字典 千方病案医学编辑部 文件清单与实测记录核对 ✅ 已通过/已验证
§6 八大坑点 千方病案医学编辑部 与第三方解析记录比对 ✅ 已通过/已验证
§7 DAIMS 评分 千方病案医学编辑部 24 项逐项复核 ✅ 已通过/已验证
§8-§9 引用与生态 千方病案医学编辑部 DOI/PMID 逐条可点击核验 ✅ 已通过/已验证
check_md.py 自动校验 千方病案工程管线 脚本全绿确认 ✅ 已通过/已验证
行数预算与结构完整性 千方病案医学编辑部 对照宪法 §2 预算逐节核对 ✅ 已通过/已验证

§10.5 AI 生成章节标注

本页面全部章节由 AI 起草,经人工核查事实与结构后发布;§10.3 列出全部事实来源以供追溯。

§10.6 最后人工审核日期

2026-09-05

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • dgidb — 共享标签:药物发现与化学 / 化学信息学 / 知识图谱 / 肿瘤学
  • ctrp-v2 — 共享标签:药物发现与化学 / 化学信息学 / 肿瘤学
  • chebi — 共享标签:药物发现与化学 / 化学信息学 / 知识图谱
  • iuphar-bps — 共享标签:药物发现与化学 / 化学信息学 / 知识图谱
  • mdad — 共享标签:药物发现与化学 / 化学信息学 / 知识图谱
  • prism — 共享标签:药物发现与化学 / 肿瘤学
  • nci-almanac — 共享标签:药物发现与化学 / 肿瘤学
  • nci60 — 共享标签:药物发现与化学 / 化学信息学 / 肿瘤学
  • zinc — 共享标签:药物发现与化学 / 化学信息学
  • pdbbind — 共享标签:药物发现与化学 / 化学信息学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集