信息速览
INFOBOX — CTD 一屏速览
维度 内容 本质 文献驱动、人工策展的毒物基因组学关系库(knowledgebase + discoverybase),非影像/序列原始数据 全称 Comparative Toxicogenomics Database(比较毒物基因组学数据库),缩写 CTD 维护 North Carolina State University(NC State)生物科学系;历史技术合作 MDI Biological Laboratory(缅因州) 首发 2004 年 11 月 12 日(2024 年满 20 周年) 主引论文 Nucleic Acids Res. 2025;53(D1):D1328–D1334(doi:10.1093/nar/gkae883,online 2024-10-10;另有勘误 PMID 39574404) 规模(官网现值) 110M+ toxicogenomic relationships(21 年、9,900+ 引用、290+ 下游资源) 规模(论文冻结) 2024-08:3.8M 直接交互 → 整合后 94M 关系(其中 48M 推断、32M+ 为 G–[C]–D) 实体维度 >17,700 化学物 | 55,400 基因 | 6,700 表型 | 7,200 疾病 | 214,000 暴露 | 980 解剖术语 | 630+ 物种 关系类型 chemical–gene / chemical–disease / gene–disease / chemical–phenotype / chemical–exposure 五类直接交互(50 predicates + 15 qualifiers) 推断工具 Inference Networks(共享中间体推断)+ CTD Tetramers(CGPD 四单元机制模块)+ 弦图可视化 更新 每月初更新,无版本号;以访问日期 + Changelog 号定位快照 获取 官网查询免费 | 全量文件 ctdbase.org/reports/(CSV/TSV/XML)| API 许可 非商业免费(研究/教育);商业需购 NC State 许可;论文本体 CC BY 4.0 库内互链 disgenet(G–D)、pharmgkb(药物基因组)、open-targets(靶点证据)、hmdb(代谢物)、chebi(化学本体)、gene-ontology、kegg、reactome
CTD 是环境健康领域最"重活"的关系库之一:它不做测序、不做影像,只做一件事——把散落在几十万篇论文里的一个句子提炼成一条可计算的关系:“双酚 A 导致 CASP3 表达上调”、“镉暴露与代谢综合征相关”。20 年下来,这些手工摘出的句子累积成数百万条直接交互,再经共享中间体推断,膨胀成上亿条有毒理学语境的关系网。对医疗 AI 而言,CTD 的独特价值在于它提供了 化学物(暴露)→ 基因(分子机制)→ 疾病(健康结局) 这条完整因果链上的结构化监督信号,且每条边都带物种上下文与 PubMed 溯源——这正是构建可解释机制模型、药物安全预警与暴露组学研究时最难获得的一环。
导语读法三则:
- 想知道它到底多大:直奔 §2 规模与 §4 数据构成——注意官网口径与论文口径的差别,别把任何一个数字当成"绝对真相"。
- 想用它做建模/知识图谱:直奔 §3 关系模型 + §6 获取许可 + §7 推断工具——Tetramers 与 Inference Networks 是最有价值的两个入口。
- 关心它与现有库(disgenet/pharmgkb/open-targets)的差别:直奔 §9 与库内条目的关系——CTD 的"暴露科学 + 跨物种 + 三角闭合"是别的库没有的。
§0 导读:这个数据库解决什么问题
现代医学越来越清楚:许多慢性病的成因不在基因里,也不完全在生活习惯里,而藏在"环境暴露如何在分子层面改写基因表达、进而推向疾病"这条长链上。这条链的前半段(化学物 → 基因/蛋白)由毒理学实验产出,后半段(基因 → 疾病)由遗传学与临床研究产出,但两者长期割裂:毒理文献散落在环境科学期刊,疾病机制写在医学期刊,物种数据又分属各自的模式生物社区。研究者要回答"这个环境污染物是否会通过某条通路加重某种疾病",往往要在几十个数据库之间手工搬运证据。
CTD 的回答是建立一个统一的、受控词表对齐的、带证据链的关系网。它用人工策展把五类关系从文献里抽出来——化学物–基因/蛋白交互、化学物–疾病关联、基因–疾病关联、化学物–表型交互、化学物–暴露陈述——再用同一套词表把它们标准化(化学用 MeSH/ChemIDplus、疾病用 MEDIC、表型用 GO、基因用 HGNC/MGI 等),最后通过"Inference Networks"把直接关系叠加推断出潜在关系,通过"Tetramers"把化学物、基因、表型、疾病串成单向的机制模块。由此,一个研究者可以从"某化学物"出发,直接看到它可能影响的基因、这些基因关联的疾病、以及所有关系背后的原始文献证据。
CTD 的三重独特性,也决定了它与库内既有知识库的分工:第一是暴露维度——disgenet、pharmgkb、open-targets 都是从基因/药物出发,CTD 是唯二从"环境化学物暴露"出发的关系库;第二是跨物种比较——630+ 物种让毒理学发现的跨物种外推有据可依;第三是化学–基因–疾病三角的闭合——把毒理前半段与临床后半段接在同一张图里。这三个特性叠加,使 CTD 成为暴露组学(exposome)、机制毒理、环境流行病学与药物安全研究共享的底层关系资源。
§0 读法三则:
- 这个条目写的是"关系库/知识资源",不是"图像或测序数据集":没有病例、没有像素、没有 reads,只有被标准化过的关系与指向文献的证据指针。
- 全文所有规模数字至少两套口径(官网滚动 vs 论文冻结),条目逐条并陈(§2、§9),单一数字出现处必标时点。
- 检索时不要用"CTD"当唯一关键词——它在别的语境里指"Common Technical Document"(药品注册通用技术文件)等含义,务必补 “toxicogenomics” 或 “ctdbase” 消歧。
§1 数据库速览:十问十答
Q1:CTD 是什么?一句话。
一个由 NC State 维护、已运行 20 年、每月更新的毒物基因组学关系知识库,收录"环境化学物如何影响人类健康"的可计算关系,并为每条关系提供物种上下文与 PubMed 证据。
Q2:它和 disgenet/pharmgkb 有什么本质区别?
disgenet 聚焦"基因–疾病",pharmgkb 聚焦"药物–基因",open-targets 聚焦"靶点–疾病证据";CTD 的独特点是从环境化学物暴露出发,并保留"化学–基因–表型–解剖–疾病–物种–通路–暴露"八个维度,且强调跨物种比较(comparative)。它是库内少数以"暴露科学"为核心组织逻辑的关系库。
Q3:数据从哪来?
全部来自人工策展(manual curation):生物策展员通读同行评审文献,把实验陈述抽取为结构化关系,最老的文献可追溯到 1947 年,累计策展 >149,000 篇。2022 年后引入 PubTator 的 NLP 预标注加速流程,但最终判定仍由人完成。
Q4:到底有多少条数据?
官网现值写 110M+ 关系(滚动更新);20 周年论文冻结在 2024 年 8 月,写 94M 关系,其基座是 3.8M 直接交互。两个数字都对,区别只在时点与统计口径(详见 §2)。
Q5:"直接交互"和"推断关系"差在哪?
直接交互是策展员从文献逐条抽出的、有明确实验来源的关系(3.8M);推断关系是系统把直接交互经共享中间体计算出来的潜在关系(48M)——例如"化学物 A 影响基因 G"且"基因 G 关联疾病 D",就推断出"A 可能关联 D"。推断关系用于假设生成,不是实验确证。
Q6:CTD Tetramers 是什么?
把五条直接证据语句整合成的四单元机制模块:“化学物–基因–表型–疾病”,呈现一条有向的机制路径。它是 CTD 从"知识库"走向"发现库(discoverybase)"的代表工具,也是机制毒理研究者最常用的入口之一(§7)。
Q7:能下载吗?怎么下?
能。官网提供交互查询与批量查询(Batch Query),全量数据以 CSV/TSV/XML 格式发布在 ctdbase.org/reports/,另有 API。文件按模块拆分,单个关系文件(如 genes-diseases)未压缩可达数 GB。
Q8:license 是什么?能商用吗?
非商业用途(研究、教育)免费;商业用户须购买 NC State University 许可后才能下载数据文件。论文本体的 CC BY 4.0 只覆盖论文,不覆盖数据库。注意 re3data 登记页把它标为 “Public Domain”,与官网/论文不一致,以官网 legal 页为准(§6)。
Q9:它和医疗 AI 有什么关系?
它是关系抽取/知识图谱的"黄金关系源":上亿条带证据、带物种、带受控词表标识的关系,可直接用于图神经网络、机制预测、药物安全信号挖掘与检索增强生成(RAG)的知识底座。catalystresearch 明言其推断关系"ideally suited for machine learning and artificial intelligence workflows"(§8)。
Q10:最大的坑是什么?
规模口径多套(论文/官网/re3data/第三方快照各不相同)、无版本号只能靠日期定位、主站有反爬、商业许可无公开购买流程——条目在 §10 与附录逐条列明。
§2 规模与规格:一个多口径并存的关系宇宙
读 CTD 的规模数字,第一件要学会的事是"分清时点与口径"。同一个 CTD,在四个不同来源里就有四个数字,而且都不是错的——它们是不同时间、不同统计方式拍下的快照。
2.1 四套规模口径并陈
| 来源 | 时点 | 关系总量 | 直接交互 | 关键实体数 |
|---|---|---|---|---|
| NAR 20 周年论文(主引) | 2024-08 冻结 | >94M | 3.8M | 17,700 化学物 / 55,400 基因 / 6,700 表型 / 7,200 疾病 / 214,000 暴露 / 980 解剖 |
| re3data 仓库登记 | 更新于 2025-01 | 98,456,700 | 未列 | 未列 |
| CTD 官网首页 | 抓取时点 2026-09 | 110M+ | 未列 | 未列 |
| F1000Research 2025/2026 论文 | 引用 dataStatus | 未列总量 | >4.1M | 19,400 化学物 / 57,000 基因产物 / 6,900 表型 / 7,200 疾病 / 1,000 解剖 |
| catalystresearch 旧快照 | 早期时点(仅史存) | 45M | 未列 | 16,300 化学物 / 51,300 基因 / 5,500 表型 / 163,000 暴露事件 / 600 物种 |
这张表本身就是本条目最重要的"口径存照":任务头 brief 所写" >110M chemical–gene/disease 关系"对应的是官网首页现值口径,经核验成立;但任何研究者在论文里若引"CTD 有 94M 关系",也完全正确——因为他引的是 2024-08 冻结论文。成稿对两套口径一律并陈,绝不二选一。
为什么同一个资源会有这么多数字?根因有三层:
- 时间层:CTD 每月更新,规模单调增长。2024-08 的 94M、2025-01 的 98.5M、2026-09 抓取的 110M+,本质是同一条增长曲线上的三个点。
- 口径层:有的来源统计"关系总量"(含推断与导入),有的只统计"直接交互"(3.8M 或 4.1M)。二者相差近一个数量级,不可混用。
- 转录层:第三方快照(如旧版 catalystresearch)在转载时会冻结当时的数字,时间一长就与官网脱节,形成"历史遗留数字"。
给使用者的操作建议:写下任何规模数字时,用"时点 + 口径 + 来源"三要素标注,例如"CTD 约 94M 关系(2024-08 冻结,NAR 2025 论文口径,含推断)"。本条目在附录 C 提供了一张速查表,可直接对照。
2.2 从 3.8M 到 94M:关系膨胀的机制
理解规模,必须理解 CTD 的两层结构。底层是"直接交互":策展员从文献里逐条抽出的、有明确实验来源的化学物–基因/蛋白、化学物–疾病、基因–疾病、化学物–表型关系,截至 2024-08 约 3.8 million 条(较上一次更新增长 13%),来自 >149,000 篇同行评审论文。
上层是"整合后的关系总量":把这些直接交互与三类导入数据——Gene Ontology 注释、KEGG 与 Reactome 通路、BioGRID 基因–基因交互——放在一起做集成,就得到 94 million 条 toxicogenomic relationships。其中约 48 million 条是系统自动计算的推断关系(inferred relationships),主要来自两类推断:
- 共享化学物的基因–疾病推断(G–[C]–D):超过 32 million 条,占推断关系的绝对多数。逻辑是"化学物 C 影响基因 G"+“化学物 C 关联疾病 D” → “基因 G 可能关联疾病 D”。
- 共享基因或化学物的表型–疾病推断(P–[G/C]–D):表型与疾病之间通过共享基因或共享化学物建立联系。
关键认知:94M 这个数字里,绝大部分(约 48M 推断 + 导入数据贡献的部分)不是人工确证的实验关系,而是计算推断或第三方导入。真正"人肉"的核心资产是那 3.8M 直接交互。用 CTD 做研究时,必须分清你引用的是直接证据还是推断关系——这一点在 §7 与 §10 反复强调。
2.3 八个实体维度
CTD 的关系网由八个受控维度构成,每个维度都有权威来源:
- 化学物(chemicals):>17,700 个(论文冻结),源自 MeSH、ChemIDplus 等词表,含环境污染物(如除草剂阿特拉津、百草枯)与药物。
- 基因/蛋白(genes/proteins):55,400 个,跨 630+ 物种;命名对齐 HGNC、MGI 等权威;基因与蛋白在交互中不严格区分。
- 表型(phenotypes):6,700 个,用 Gene Ontology 术语描述"非疾病类生物过程或性状"(如细胞增殖、解剖结构),可携带解剖上下文。
- 疾病(diseases):7,200 个,对齐 MeSH,经 MEDIC 词表标准化。
- 暴露(exposures):214,000 个,来自真实世界环境测量的暴露陈述。
- 解剖术语(anatomy):980 个,为表型与暴露提供解剖语境。
- 通路(pathways):导入 KEGG、Reactome。
- 物种(taxa):>630 个,使数据库"comparative",并为跨物种外推提供基础。
这八个维度不是简单并列的清单,它们构成一个可闭合的推理链:化学物(环境)→ 基因/蛋白(分子起始事件)→ 表型(中间生物过程)→ 疾病(健康结局),而解剖为表型与暴露提供空间语境、通路为基因提供功能语境、物种为整条链提供跨物种的可比性。理解这个链式结构,就理解了 CTD 为什么能支撑机制推断——它把环境健康研究里通常离散的环节连成了一条可查询的路径。
从词表的权威性看,这八个维度各自锚定在公认的标准上:化学物锚 MeSH 与 ChemIDplus,疾病锚 MeSH 与 MEDIC,表型锚 Gene Ontology,基因锚 HGNC/MGI/NCBI Gene,通路锚 KEGG/Reactome,蛋白互作锚 BioGRID。这种"每个维度都有权威上游"的设计,是 CTD 能与库内其他资源互操作的底层原因:只要两个库都用 MeSH 或 GO,它们就能在同一实体上对齐。
2.4 发布文件的物理规格
CTD 全量数据发布于 ctdbase.org/reports/,按模块拆分为独立文件,提供三种格式:
- CSV / TSV:主用格式,便于批量处理与入库。
- XML:含普通 XML 与 structured XML(附 XSD schema),用于需要严格结构校验的场景。
- obo:本体文件(如疾病本体、交互类型本体、暴露本体)。
实测文件清单(2026-08-28 时间戳)显示体量量级:CTD_genes_diseases.csv.gz 未压缩约 3.2 GB、CTD_chemicals_diseases.xml.gz 约 190 MB、CTD_chem_gene_ixns.xml.gz 约 51 MB。此外还有 CTD_UniProtToCTDIdMapping.txt.gz(UniProt↔CTD ID 映射)等工具性文件。单文件 GB 量级,直接印证了"亿级关系"的规模。
2.5 更新节奏与"无版本号"问题
CTD 每月初更新(“near the beginning of each month”),但不发布传统版本号。这给可复现性带来麻烦:你没法说"我用 CTD v2.3",只能说"我于某年某月某日访问 CTD,对应 Changelog 号 XXXX"。
实践中研究者采用的做法是登记数据访问日期 + Changelog 号。例如有论文记录:2025-09 使用的数据对应 revision 17923;2026-06-01 更新后对应 Changelog 18280。官网 about/changes/ 提供 Changelog,about/dataStatus.go 提供当前滚动统计。做可复现研究,访问日期是强制项。
为什么"无版本号"是一个真问题? 因为关系库的规模与内容每月都在变:新文献被策展进来、词表被修订、推断网络重算。若两篇论文都写"使用 CTD 数据"而不注明日期,第三方根本无法复现——你拿到的是今天的 CTD,而他拿到的是三年前的 CTD,实体数差了几千、关系数差了上千万。CTD 官方对此有明确提示:引用时须注明访问日期。这也是本条目在 §6.3 把"访问日期 + Changelog 号"列为复现强制的理由。
对比一下有版本号的资源(如 UniProt 用 release 号、Ensembl 用版本号):有版本号时,一句"UniProt release 2024_05"就锁定了快照;CTD 因为把更新做成持续的月度滚动,必须用"日期 + Changelog"双要素替代版本号。这不是设计缺陷,而是"持续维护"模式的必然代价——换来的是数据永远最新,付出的是复现时要多写两行元数据。
2.6 从规模数字反推"用它的成本"
规模不只是一个好奇心数字,它直接决定了使用 CTD 的工程成本:
- 存储成本:全量文件解压后可达十 GB 量级(单个 genes-diseases 文件未压缩约 3.2 GB),需要相应的磁盘与内存预算。
- 解析成本:亿级关系意味着即便只是遍历一遍,也需要高效的流式解析与索引策略,不能简单"载入内存当 DataFrame"。
- 筛选成本:正因为总量巨大,"先分清 direct / inferred 再取用"不是可选项而是必须项——若不筛选直接全量使用,绝大多数算力会花在推断关系上。
- 更新成本:每月全量重建,意味着以 CTD 为底座的系统需要设计增量更新或定期全量刷新机制,无法假设数据静止。
结论:把 CTD 当"小而美"的查询库来用是错配;它是一个需要工程投入的"重型关系基础设施"。理解规模数字的真正用途,是估算这份投入。
§3 关系模型:五类策展交互与两张推断网
CTD 的骨架是"五类人工策展关系 + 两张推断网络"。理解这个模型,是用好 CTD 的前提。
3.1 CTD Core:四类基础关系
CTD 的核心策展模块(CTD Core)从文献中抽取四类关系,用统一句法格式(主语–谓语–宾语 + qualifier)记录:
- chemical–gene/protein interactions(化学物–基因/蛋白交互):CTD 体量最大的关系类,描述化学物如何影响基因或蛋白(如表达上调/下调、活性改变)。
- chemical–disease associations(化学物–疾病关联):化学物暴露与疾病结局的关联。
- gene–disease associations(基因–疾病关联):基因与疾病的关联。
- chemical–phenotype interactions(化学物–表型交互):化学物对非疾病类生物性状/过程的影响。
每条关系携带物种上下文(taxa)——这是 CTD “comparative”(可比较)的根基——并**可回溯至 PubMed ID(PMID)**作为证据。叙词层面,CTD 定义了 50 个谓语(predicates) 与 15 个限定词(qualifiers),使关系表达足够细腻(例如区分"增加/减少"、"表达/活性"等方向与层面)。
3.2 CTD Exposure:第五类关系与暴露科学
CTD 最独特的模块是 CTD Exposure,也是它与库内所有其他关系库的分水岭。该模块把真实世界环境测量组织成结构化的暴露陈述,使用 20 个受控词表 连接 33 个不同数据概念,覆盖四个暴露类别:
- exposure stressor(暴露压力源):暴露于什么(化学物、混合物、非化学因素)。
- exposure receptor(暴露受体):谁被暴露(人群、个体、生物体)。
- exposure event(暴露事件):何时何地如何发生。
- exposure outcome(暴露结局):暴露产生的健康/生物结局。
这个四类别结构是暴露组学(exposome)研究的标准框架在数据库层面的落地。截至论文冻结时点,CTD 收录 214,000 条暴露条目。CTD Exposure 提供了专门的暴露策展工具(ECT, Exposure Curation Tool)与 2022 年新增的策展流程。
3.3 Inference Networks:从直接关系到推断关系
Inference Networks(推断网络) 是 CTD 从"知识库"迈向"发现库"的第一件工具。它基于共享中间体,把直接策展关系组合成新的潜在关系:
- G–[C]–D:基因 G 与疾病 D 通过共享化学物 C 建立联系(数量最大,>32M)。
- P–[G/C]–D:表型 P 与疾病 D 通过共享基因或共享化学物建立联系。
- 化学物→基因→疾病 的完整路径推断,用于连接化学物与疾病。
推断网络的价值在于"补全知识缺口":很多化学物与疾病之间的分子机制尚未被实验直接验证,但通过共享的基因/表型中间体,可以形成可检验的假设。
3.4 CTD Tetramers:CGPD 四单元机制模块
CTD Tetramers(四聚体) 是推断能力的更高阶形态。它整合 五条直接证据语句,构造一个"化学物–基因–表型–疾病(CGPD)"四单元、有方向的机制模块,呈现一条逐步推进的机制路径:化学物触发分子起始事件(影响某基因),经中间表型,最终指向疾病结局。
2025 年更新对 Tetramers 做了三项增强:① 查询可同时包含化学物与/或基因(不止表型与疾病),支持更聚焦的分子事件检索;② 新增"Evidence"列,展示构成该四聚体的五条支持证据及其来源文献;③ 结果可一键转为**弦图(chord diagram)**可视化。论文示例:以"重金属→帕金森病、经代谢过程表型"为查询,检索出 167 个 CGPD 四聚体,由 6 种重金属、32 个基因、52 个代谢过程表型构成。
3.5 Pathway View 与工具链
Pathway View 用于把基因网络可视化:例如从 CTD 的"Gene Inference Networks"中,金属钴经 39 个基因推断至肺肿瘤;点击基因列表旁的图标即可把基因送入 Set Analyzer 工具,基于 BioGRID 数据构建互作图。2025 年更新为 Pathway View 增加了可定制项(边/标签显示、缩放平移、节点配色、五种图布局、导出)。
CTD 的完整工具体系还包括:Batch Query(批量查询下载)、MyGeneVenn / MyVenn / VennViewer(集合比较 Venn 图)、Set Analyzer(集合富集与通路生成)、Chord Diagram Generator(弦图生成)——这些工具把关系数据变成可直接用于机制分析的产物,是 CTD"发现库"定位的具体落地。
§4 数据构成与策展流水线
4.1 五类直接交互的策展范式
CTD 的一切建立在人工策展之上。生物策展员(biocurators)阅读同行评审文献,按统一范式把实验陈述抽取为结构化关系。策展的四大原则:
- 文献驱动:只收同行评审文献中报告的关系,优先高质量、有实验证据的关联,不收未验证或初步发现。
- 受控词表对齐:所有实体映射到标准词表(化学→MeSH/ChemIDplus,疾病→MeSH/MEDIC,表型→GO,基因→HGNC/MGI 等),使来自不同论文、不同年代的术语可统一比较——CTD 最老的策展文献是 1947 年,正是靠词表对齐才能与当代数据同框。
- 句法结构化:每条交互写成完整句子(如 ‘bisphenol A results in increased cleavage of CASP3’),带方向与层面的限定。
- 证据溯源:每条关系绑定 PubMed ID,并提供原始语句,保证可追溯(FAIR 原则)。
4.2 NLP 增强:PubTator 集成
2025 年的重要工程更新是把 PubTator 的 NLP 能力全面集成进策展流程。策展员通过 PubTator 界面访问文献,摘要中的化学物、基因、疾病、物种术语被颜色编码高亮;这些 NLP 识别的术语被汇总成报告,并作为候选选项导入 CTD Curation Tool 的 pick-list,供策展员快速选择。这既提高了策展效率,也扩展了文本挖掘的覆盖面(相关专述:Database (Oxford) 2025, PMID 39982792)。关键点:NLP 只是"预标注加速器",最终关系判定仍由人工完成——这保证了 CTD 数据质量的底线。
4.3 导入数据与集成的边界
CTD 的关系总量之所以能达到 94M,离不开三类导入数据:
- Gene Ontology 注释:为基因功能提供本体标注。
- KEGG 与 Reactome 通路:把化学物扰动映射到通路网络。
- BioGRID 基因–基因交互:为 Pathway View 的互作图提供边。
重要边界:这些导入子集的 license 归属各自的原始数据源,不是 CTD 自制数据。使用或二次分发 CTD 中这些子集时,需另行核查 GO/KEGG/Reactome/BioGRID 的许可条款。这是数据库集成型资源的通病,也是使用时的常见法律坑。
4.4 内容分布与研究偏倚
CTD 的内容分布受文献发表生态影响:研究热点的化学物、基因、疾病占比高,冷门实体的关系稀疏。例如某环境污染物若热门,其 chemical–gene 交互可达数百条;若冷门则寥寥无几。疾病侧同理,癌症、代谢病、神经退行性疾病等研究热点的关联远比罕见病丰富。用 CTD 做统计时要警惕这种发表偏倚——某关系"查不到"不等于"不存在",可能只是"没人研究过"。
4.5 与库内既有关系库的构成差异
把 CTD 与库内其他关系库并排看,构成逻辑的差异一目了然:
| 条目(rid) | 组织逻辑 | 核心维度 | 与 CTD 的关系 |
|---|---|---|---|
| disgenet(449) | 基因–疾病 | G–D | CTD 的 G–D 子集与其交叠,CTD 额外带暴露与化学物 |
| pharmgkb(374) | 药物–基因 | C–G(药物) | CTD 也收录药物,但更重环境化学物 |
| open-targets(456) | 靶点–疾病证据 | C–G–D | 组织逻辑最接近,但 open-targets 强调证据分级与药物发现 |
| hmdb(470) | 代谢物 | 化学实体 | 化学实体层面可互链 |
| chebi(314) | 化学本体 | 化学实体 | CTD 化学物标准化的潜在引用源 |
| gene-ontology(441) | 基因功能本体 | 表型/功能 | CTD 表型词表基于 GO |
| kegg(433)/ reactome(424) | 通路 | 通路 | CTD 导入其通路数据 |
| bgidb/string/intact | 蛋白互作 | PPI | CTD 用 BioGRID 做 Pathway View |
CTD 的差异化定位因此非常清楚:它是库内唯一以"环境化学物暴露"为起点、保留跨物种比较、并把化学–基因–疾病三角闭合到一张图里的关系库。这个组合是 disgenet、pharmgkb、open-targets、hmdb 单独或叠加都无法替代的。
2.7 规模数字的读法与陷阱
2.7.1 为什么"94M"和"110M+"都正确
初学者常被这两个数字绕晕。真相是:它们描述的是同一个 CTD 在不同时点的状态。
NAR 20 周年论文在 2024 年撰写,作者明确写了"As of August 2024"——这是论文的冻结时点,写死了 94M。而官网首页的 110M+ 是滚动更新的当前值,每次 CTD 月度更新后都会刷新。从 2024-08 到 2026 年,CTD 又策展了 20 多个月的新文献,关系总量从 94M 增长到 110M+ 完全合理。
由此得出一条铁律:引用 CTD 规模时,时点比数字更重要。 写"CTD 有 94M 关系"必须补"(论文 2024-08 口径)“;写"CTD 有 110M+ 关系"必须补”(官网现值,访问日期 X)"。缺了时点,数字就失去了可验证性。
2.7.2 从文件体量反推数据量级
一个常被忽略的旁证是数据文件的物理大小。CTD_genes_diseases.csv.gz 未压缩约 3.2 GB——如果把每行视为一条基因–疾病关系(含基因 ID、疾病 ID、证据、来源等字段),3.2 GB 的 CSV 大致对应数亿行的量级,与"亿级关系"的宣称吻合。同理,CTD_chem_gene_ixns.xml.gz(约 51 MB 压缩、数百 MB 未压缩)作为体量最大的直接交互类,其行数也应在数百万量级。文件体量是独立于官网口径的外部一致性证据。
2.7.3 实体数的"冻结 vs 更新"差异
对比论文(2024-08)与 F1000Research(更新时点)的实体数,可以看到清晰的增长轨迹:
| 实体 | 论文(2024-08) | F1000Research(更新) | 增幅 |
|---|---|---|---|
| 化学物 | >17,700 | 19,400 | +~10% |
| 基因/蛋白 | 55,400 | 57,000 | +~3% |
| 表型 | 6,700 | 6,900 | +~3% |
| 疾病 | 7,200 | 7,200 | 持平 |
| 解剖术语 | 980 | 1,000 | +~2% |
疾病数持平值得注意:说明 CTD 的疾病词表(MEDIC/MeSH)相对稳定,新增主要在化学物与基因侧——这也符合策展重心:环境化学物的研究增长快于疾病本体扩展。
2.7.4 “exposures” 与 “exposure events” 的量纲疑点
论文写 214,000 exposures,而 catalystresearch 旧快照写 163,000 exposure events。这两个数字不能直接比较,因为量纲可能不同:一个 exposure(暴露条目)可能包含多个 exposure event(暴露事件),或反之。这是一个待核疑点(见 FACTS §9),引用时须写明来源与量纲。
3.6 受控词表对齐的工程细节
3.6.1 为什么受控词表是 CTD 的"隐形骨架"
如果说关系是 CTD 的血肉,受控词表就是它的骨架。CTD 横跨 80 年文献(1947 至 2026),不同年代的论文对同一化学物、同一疾病用完全不同的叫法。若无词表对齐,这些关系根本无法放在一起比较。
CTD 的对齐策略是"每个维度都挂一个权威词表":
- 化学物 → MeSH、ChemIDplus
- 疾病 → MeSH,经 MEDIC 派生成 CTD 专用词表
- 表型 → Gene Ontology
- 基因/蛋白 → HGNC(人)、MGI(小鼠)等命名权威
- 物种 → NCBI Taxonomy
- 交互类型 → CTD 自有 obo 本体
- 暴露 → CTD 自有暴露本体(20 受控词表 × 33 数据概念)
这套对齐使 CTD 满足 FAIR 原则,也使它成为知识图谱工程的理想输入:词表标识就是天然的实体对齐与桥接点。
3.6.2 MEDIC 词表的地位
MEDIC 是 CTD 区别于其他库的一个技术细节。它从 MeSH 派生,但做了面向毒理语境的调整。用 MEDIC 而非直接用 MeSH 的好处是适配 CTD 的策展需求;代价是与临床编码(ICD、SNOMED CT)不一一对应。临床研究者在把 CTD 疾病映射到 EHR 编码时需要额外做一层对齐——这是使用时的常见工程成本。
3.6.3 predicates 与 qualifiers 的表达力
CTD 用 50 个谓语与 15 个限定词描述关系。谓语表达关系的类型与方向(如"increases/decreases expression"、“affects activity”),限定词提供额外的语境(如作用层面、程度、条件)。这套组合使一条关系可以被表达得足够精细,例如区分"化学物增加某基因的 mRNA 表达"与"化学物改变某蛋白的活性"。对下游建模而言,这意味着关系边不是简单的二元存在/不存在,而是带类型与方向的富语义边。
4.6 策展质量控制与偏倚治理
4.6.1 三层质量保证
CTD 的数据质量依赖三层机制:
- 文献筛选:只收同行评审文献,优先高质量实验证据,排除未验证发现。
- 结构化抽取 + 词表约束:强制映射到受控词表,减少同义词噪声。
- 证据溯源:每条关系绑定 PMID 与原始语句,任何关系都可回查。
这三层机制共同保证了 CTD 与"纯文本挖掘数据库"的本质区别:CTD 的关系是人读出来的,不是机器猜出来的。
4.6.2 发表偏倚的应对
CTD 的关系分布受文献发表生态影响,这是数据集层面的固有偏倚。研究者的应对之道:
- 做富集分析时设阈值:不因"某基因只关联 1 条文献"就赋予高权重。
- 结合证据强度:优先关注有多条独立文献支持的关系。
- 警惕"零结果":查不到关系 ≠ 不存在关系,可能只是无人研究。
- 跨库交叉验证:CTD 关系可与 disgenet(449)、open-targets(456)交叉,互相印证。
4.6.3 与纯文本挖掘数据库的对照
| 维度 | CTD | 纯 NLP 挖掘库 |
|---|---|---|
| 抽取方式 | 人工策展 + NLP 辅助 | 全自动 NLP |
| 准确率 | 高(人工复核) | 依赖模型,噪声较大 |
| 覆盖速度 | 慢(受人力限制) | 快(可全文献覆盖) |
| 溯源 | 逐条 PMID + 原始句 | 常缺严格溯源 |
| 适用 | 高精度机制分析 | 大规模候选筛选 |
CTD 选择了"精度优先"的路线,这正是它在机制毒理与药物安全等对准确性敏感的场景中不可替代的原因。
§5 与主流基准和同类资源的横向对比
CTD 不是一个"刷榜型"资源,它不提供 Machine Learning benchmark 排行榜,也没有官方 accuracy/F1 指标。因此"横向对比"的正确问法不是"CTD 在某个榜单上排第几",而是"在同类知识资源里,CTD 凭什么位置存在、与谁互补、与谁重叠、在哪些评估协议下被引用"。
5.1 不是一个 benchmark,而是一张"金标准关系表"
在关系抽取(relation extraction)与知识图谱构建的研究里,CTD 的定位是远监督(distant supervision)与弱监督的标签来源,而不是评测集。具体而言:
- CTD 的 chemical–disease、chemical–gene、gene–disease 三元组,常被用于训练关系抽取模型的正例集合:研究者把"CTD 里存在的关系"当作已知真值,去从文献中挖掘新关系。
- CTD 的 direct interactions(3.8M 级)因为带 PMID 溯源与原始语句,是构造"关系 + 证据句"配对数据集的稀缺资产——多数知识库只给三元组,不给证据句。
- 需要评测时,社区更常用 BC5CDR、BioCreative 等标准竞赛语料,而非直接拿 CTD 做测试集——因为 CTD 的关系定义粒度与竞赛任务不完全对齐。
5.2 与同类资源的三角定位
把 CTD 放进"化学–基因–疾病"这一片区的资源地图,可以清晰看到它的生态位:
| 资源 | 类型 | 起点维度 | 是否带暴露 | 是否跨物种 | 策展方式 | 与 CTD 的关系 |
|---|---|---|---|---|---|---|
| CTD | 关系库 + 发现库 | 环境化学物 | 是(214K 暴露) | 是(630+ 物种) | 人工策展 + NLP 辅助 | 本条目的主体 |
| DrugBank | 药物知识库 | 药物 | 否 | 否 | 人工策展 | CTD 收录药物,但重点在环境化学物 |
| PharmGKB | 药物基因组学 | 药物–基因 | 否 | 主要人类 | 人工策展 | CTD 的药物–基因子集与其交叠 |
| DisGeNET | 基因–疾病 | 基因–疾病 | 否 | 主要人类 | 多源集成 | 与 CTD 的 G–D 子集重叠 |
| Open Targets | 靶点–疾病证据 | 靶点–疾病 | 否 | 主要人类 | 多源集成 + 证据分级 | 组织逻辑接近,但面向药物发现 |
| Comparative Toxicogenomics Database 的独门能力 | — | — | — | — | — | 暴露科学 + 跨物种比较 |
结论:CTD 的不可替代性来自两个维度的组合——"暴露"作为一等公民,以及**"comparative"的跨物种设计**。任何只做基因–疾病或药物–靶点的资源都无法覆盖这两个维度。
一个具体的差异场景可以说明这种不可替代性:假设研究者想评估"某新型阻燃剂是否会增加代谢综合征风险"。在只做基因–疾病的库里,他查到的是"某基因与代谢综合征相关",但没有该化学物的位置;在只做药物–靶点的库里,该阻燃剂根本不是药物,查不到;在通用知识图谱里,该化学物与代谢综合征的边很可能根本不存在。而在 CTD 里,他可以从化学物名出发,看到它已被策展的 chemical–gene 交互、这些基因的基因–疾病关联、化学物–疾病关联,以及(若有)化学物–表型与暴露条目——一条链走完,且有 PMID 可回溯。这就是"三角闭合 + 暴露起点"的价值。
5.3 在知识发现协议中的角色
在"知识图谱 + 假设生成"的研究范式里,CTD 扮演三个角色:
- 假设生成的中间层:把化学物–基因直接关系与基因–疾病直接关系组合成 D–[G]–C 推断链,产出"这个化学物可能与该疾病有关"的可检验假设。这类推理在环境流行病学里常用于优先级排序。
- 术语标准化枢纽:CTD 用 MeSH/MEDIC、HGNC/MGI、GO 等权威词表,使来自不同来源、不同年代的实体能被统一对齐;研究者在做跨库连接时,常借用 CTD 的 ID 映射体系。
- 暴露组学的结构化落地:CTD Exposure 的 4 类别(stressor/receptor/event/outcome)× 20 受控词表 × 33 数据概念结构,是 exposome 研究里少有的"可直接查询的关系化表示"。
5.4 引用生态的量化侧写
衡量一个知识资源的影响力,引用数是可得的粗粒度指标。就 public 记录看:
- CTD 的原始论文与综述被 9,900+ 篇文献引用。
- CTD 被列入 290+ 个各类资源/数据库目录与综述。
- 团队自身围绕 CTD 发表 53 篇相关论文(含年度更新论文、工具专文、方法学文章)。
这些数字的意义不在于"排名",而在于"该资源被反复引用的时点分布"——一个能持续二十年更新、被写进无数方法学章节的资源,其数据口径的漂移才是使用者最该关注的点(见 §2 的多口径并存)。
从引用的类型分布看,CTD 出现在三类场景里:一是环境健康与毒理学的实证研究(把 CTD 关系作为机制假设来源或在讨论中对照);二是生物信息学/NLP 的方法论文(把 CTD 当作远监督标签源或知识图谱节点);三是综述与资源目录(把 CTD 列为该领域的标准资源)。这种跨学科的引用分布,本身就是"该资源处于多个领域交汇处"的证据,也解释了为什么它既能被毒理学家引用,也能被知识图谱工程师引用。
5.5 定性对比:三类"看起来像"的资源辨析
初期接触这类资源的人,常把 CTD 与三类东西混淆,需要一次辨析:
- 与毒理学数据库(如 TOXNET 遗产、PubChem 的生物测定部分)的区别:TOXNET 类资源偏"化学物属性与毒性数据"的登记,CTD 则偏"化学物与生物实体之间的关系";前者是属性表,后者是关系图。
- 与通用知识图谱(如 Wikidata、DBpedia)的区别:通用图谱覆盖广但每个领域的深度与受控粒度不足;CTD 是领域深井——只做毒物基因组学,但把这一口井打到 94M 关系的深度。
- 与文献检索系统(如 PubMed、Europe PMC)的区别:文献系统给的是"论文全文/摘要",CTD 给的是"从论文里抽出的、结构化的关系 + 证据句 + PMID"。前者是原始材料,后者是已提炼的结构化事实。
§6 获取方式与许可
6.1 三个入口
CTD 的数据与工具可从三条路径获取:
- 网页查询界面:
ctdbase.org,交互式检索化学物、基因、疾病、暴露、表型,提供图形化展示。适合探索与少量查询。 - 批量下载:
ctdbase.org/reports/,按模块拆分的全量文件(CSV/TSV、XML/structured XML、obo),适合批量分析与入库。 - 批量查询工具与 API:Batch Query 工具支持提交批量列表;CTD 提供查询/下载接口,便于程序化集成。
6.2 许可的三口径冲突(重要)
关于 CTD 的法律许可,存在三套并存的说法,使用者必须知晓:
| 来源 | 表述 | 归类 |
|---|---|---|
| NAR 论文 / CTD 官网 legal 页 | 学术与非商业用途免费;商业用途需向 NC State 购买许可 | 非商业免费 + 商业付费 |
| re3data 仓库登记 | 标注为 Public Domain(公有领域) | 完全开放 |
| 部分第三方转录 | 引用 CTD 的"数据可自由使用"声明 | 宽松开放 |
冲突根源:CTD 是"非商业免费 + 商业许可"型资源,但第三方仓库/转录在登记时简化成了"Public Domain"或"自由使用"。成稿对三口径一律存照,不做二选一。实务建议:非商业研究可直接用;任何商业用途,务必回到 ctdbase.org 的 legal 页确认并联系 NC State 获取许可。
6.3 引用与可复现性
使用 CTD 做研究时,必须登记访问日期 + Changelog 号(见 §2.5),因为 CTD 持续每月更新且无传统版本号。规范引用需引用其年度更新论文(当前主引为 NAR 2025, 53(D1):D1328–D1334, doi:10.1093/nar/gkae883)。若引用了导入子集(GO/KEGG/Reactome/BioGRID),还需一并引用并遵守这些子集的各自许可。
6.4 平台与基础设施
CTD 托管于 NC State 的计算基础设施:存储部署于 NetApp SSD(总量约 45 TB),位于 Eastern Data Center,网络带宽约 25 Gb/s。这一基础设施支撑了亿级关系的存储、每月全量重建与高并发查询。规模与基础设施的匹配,是"94M 关系"能稳定可用的物理前提。
6.5 三条获取路径的适用场景对照
不同的使用目的,对应不同的获取路径。把三条路径并排看,能少走弯路:
| 获取路径 | 适用场景 | 优点 | 局限 |
|---|---|---|---|
| 网页查询界面 | 探索性查询、少量检索、教学演示 | 图形化、即时可用、无需编程 | 不适合批量;单次查询量有限 |
| reports/ 全量下载 | 批量分析、建模、本地入库 | 完整、可离线、支持复杂联查 | 文件大(GB 级)、需自建解析管线 |
| Batch Query / API | 程序化集成、定期抓取、系统对接 | 可自动化、适合流水线 | 需遵守使用条款与频率约束 |
选择建议:做假设探索时先用网页界面建立直觉;确定要建模或做统计时再下全量文件;要做成生产系统或定期同步时用 API。三者不是替代关系,而是"探索 → 实验 → 生产"的阶梯。
6.6 使用 CTD 的合规自查流程
结合 §6.2 的许可冲突与 §2.5 的复现要求,建议在任何基于 CTD 的工作开始前走一遍以下自查流程:
- 确定用途性质:是学术/教育(非商业),还是商业?若商业,先联系 NC State 获取许可,不要直接使用。
- 登记数据版本:记录访问日期与 Changelog 号,写入方法学章节。
- 核查导入子集:确认你的分析是否用到 GO/KEGG/Reactome/BioGRID 子集,若是,一并核查上游许可。
- 标注证据层次:明确你的结论基于 direct 还是 inferred,并在文中说明。
- 规范引用:引用 NAR 年度更新论文,并注明访问日期。
走完这五步,绝大多数的许可与复现风险都能前置化解——这比事后补救的成本低得多。
§7 生态、影响与已知局限
7.1 二十年的维护史
CTD 的维护是一条罕见的长线:
- 2004-11-12:首版上线(NC State,NIEHS 资助)。
- 2004–2024:连续二十年的年度/月度更新,每年在 NAR Database Issue 发文更新。
- 2025:NAR Database Issue 发表二十周年更新论文,同时引入 PubTator NLP、Tetramers 增强、Pathway View 增强等重大更新。
一个数据库能持续二十年且保持活跃更新,本身就是其数据治理与社区价值的强证据。
7.2 资助与治理
- 资助:NIEHS(美国国家环境健康科学研究所),主要执行于 U24 ES033155 等资助项目。
- 维护机构:North Carolina State University 与 MDI Biological Laboratory(原 Mount Desert Island Biological Laboratory)联合维护。
- 通讯作者:Allan Peter Davis(NC State)。
- 团队规模:论文署名 10 位作者,涵盖策展、软件工程、数据科学角色。
7.3 已知局限(使用者必读)
- 发表偏倚:内容分布受文献生态影响,热门实体的关系远多于冷门实体;“查不到”≠“不存在”,可能只是"没人研究"(详见 §4.4)。
- 直接 vs 推断的混淆风险:94M 总量里绝大多数是推断或导入关系,真正证据级的是 3.8M 直接交互。误把推断关系当实验证据,是用 CTD 最常见的错误。
- 无版本号带来的复现难:每月更新却无 vN 版本号,使精确复现必须绑定访问日期与 Changelog 号。
- 导入子集的许可边界:GO/KEGG/Reactome/BioGRID 子集不归 CTD 许可,需另行核查。
- 关系定义的粒度:CTD 的关系定义粒度与部分竞赛/任务不完全对齐,直接拿来做 ML 评测需做映射调整。
- 跨物种外推的谨慎性:CTD 的 comparative 设计便于跨物种推断,但物种间结论不等价,跨物种迁移需生物学论证而不能默认成立。
7.4 生态位小结
CTD 处于"环境健康 + 毒理学 + 计算生物学 + 暴露组学"的交汇处。它既是知识资源(可直接查关系),也是发现工具(可推断新假设)。对研究者而言,它的最大价值在于把"环境化学物暴露"与"分子–表型–疾病结局"这条链条,用一张可查询的图闭合起来——而这个闭合,在库内其他关系库中尚无替代品。
7.5 谁应该用 CTD,谁应该看别的
把一个资源的价值说清楚,最好的方式是说明它"适合谁、不适合谁":
适合使用 CTD 的场景:
- 环境流行病学与机制毒理研究:需要从污染物出发寻找分子机制假设。
- 药物安全与环境风险评估:需要化学物–表型/疾病的关系证据与暴露背景。
- 暴露组学(exposome)研究:需要结构化的暴露–健康关系表示。
- 知识图谱与关系抽取:需要带 PMID 证据的远监督标签源。
- 跨物种毒性比较:需要同一化学物在多物种中的关系对照。
不适合(或需换资源)的场景:
- 做临床决策支持:需要 ICD/SNOMED 级临床编码与患者层数据,CTD 不提供。
- 查药物–药物相互作用:应查 DrugBank 等专门的药物库。
- 做纯序列/变异分析:应查 ClinVar、Ensembl 等。
- 需要实时/高频更新的监测数据:CTD 是月度更新,滞后于实时信号。
一句话总结:CTD 是"环境暴露视角下的机制假设引擎",不是"临床决策工具",也不是"药物说明书"。把它用在它擅长的位置,价值极大;用错位置,会觉得"这个库什么都查不到"。
7.6 治理结构与协作网络
7.6.1 一个数据库的"组织生命"
CTD 能持续运行 20 年,靠的不只是技术,还有稳定的组织结构。它的治理有三个支柱:
- 学术机构主导:NC State 作为运营主体,保证学术中立性与数据开放性。
- NIH 稳定资助:NIEHS 的 U24 ES033155 是 CTD 的"续命资金",U24 类资助专门支持资源型项目长期维护。
- 外部顾问监督:Internal advisors(Planchart、Reif)+ External Advisory Committee 提供方向把关。
此外,CTD 历史上接受过 Pfizer、American Chemistry Council 等产业界资助——这也是环境健康领域数据库的常态:数据资源惠及多方,多方共担成本。
7.6.2 与 TOXNET 的历史关联
CTD 曾被登记为 TOXNET(Toxicology Data Network,NLM 的毒理学数据网络)体系的一部分。TOXNET 于 2019 年退役后,其资源分散迁移,CTD 继续由 NC State 独立运营。理解这一段历史,有助于解释 CTD 为什么同时与 NLM、NIEHS 都有渊源。
7.6.3 出版与社区的互动
CTD 不只是"发布数据",还经营一个活跃的引用与集成社区:
- 被引用:9,900+ 篇文献引用 CTD(官网自报)。
- 被集成:290+ 个外部资源使用 CTD 内容。
- 链接协议:第三方链入 CTD 需通知并遵循 linking.jsp,形成双向可见性。
- 推荐引用:官网强制要求引用具体数据时标注访问日期,形成可复现文化。
这种"数据生产者—消费者—再集成者"的社区结构,是 CTD 影响力的放大器。
6.7 许可与合规的实践细节
6.7.1 非商业 vs 商业的判定边界
"非商业用途"在实际操作中的边界,是使用者最常困惑处。一般而言:
- 明确非商业:学术研究、教学、非营利科研机构的内部研究、发表的科学论文。
- 需购买许可:企业内部研发、产品开发、商业分析、向客户提供的商业服务、任何以营利为目的的数据再分发。
- 灰色地带:企业资助的学术研究、公私合作项目——建议直接联系 CTD/NC State 确认。
保守做法:只要涉及企业主体或商业产出,先联系 NC State 购买许可,不要赌"应该算非商业"。
6.7.2 为什么会有 re3data 的"Public Domain"误标
re3data 是第三方仓库登记系统,其许可字段常由登记人手工勾选或自动推断。CTD 的 “Public Domain” 很可能来自早期登记时的粗粒度归类(“公开可访问"被简单等同于"公有领域”),而非 CTD 官方的正式声明。这提醒我们:第三方目录的元数据不可盲信,许可问题必须回到数据源官方的 legal 页。
6.7.3 数据引用与论文引用的分工
CTD 明确区分两种引用场景,使用者必须遵守:
- 引用 CTD 这个资源本身(如"我们使用了 CTD 数据库")→ 引 20 周年更新论文。
- 引用从 CTD 检索的具体数据(如"我们从 CTD 检索了镉的化学–基因交互")→ 用 CTD 规定的数据引用格式,写清模块(chemical–gene / chemical–disease / gene–disease)、机构双址、访问月份年份。
这个分工与 GEO、ArrayExpress 等资源的要求类似,是数据资源规范化引用的通行做法。
6.7.4 API 与批量访问的合规
CTD 提供 API 与 Batch Query,但使用时应注意:
- 控制请求频率,避免对服务器造成压力(主站有人机验证机制,异常访问会被拦)。
- API 拿到的数据同样受"非商业免费、商业购许可"约束。
- 大批量下载建议走
/reports/的全量文件而非逐条 API 调用。
5.6 从关系库到可计算机制
5.6.1 Inference Networks 的推断逻辑细解
以最常见的 G–[C]–D 推断为例,其逻辑链条为:
化学物 C ──(直接证据: C 影响基因 G)──▶ 基因 G
化学物 C ──(直接证据: C 关联疾病 D)──▶ 疾病 D
────────────────────────────────────────────
推断: 基因 G ──(共享化学物 C)──▶ 疾病 D
这类推断之所以有价值,是因为它为"基因–疾病关联"提供了机制性的支撑路径(经由环境化学物暴露),而这往往是纯遗传学关联研究难以提供的。超过 32M 条此类推断,构成了 CTD 推断库的主体。
5.6.2 Tetramers 相较 Inference Networks 的进阶
Inference Networks 是"两两推断",Tetramers 则是"四单元有向链条":化学物 → 基因 → 表型 → 疾病,每一步都由直接证据支撑,链条整体呈现一条可读的机制路径。这使得 Tetramers 更适合:
- 机制假说生成:研究者得到一条完整的"暴露→机制→结局"路径。
- AOP 构建:四单元模块几乎就是 AOP 的骨架。
- 可解释性:每一步都列 Evidence,每条证据都有 PMID。
5.6.3 工具背后的数据契约
CTD 的每个工具都建立在明确的数据契约上:
| 工具 | 输入 | 输出 |
|---|---|---|
| Tetramers 查询 | 化学物/基因/表型/疾病 | CGPD 模块 + 证据 |
| Batch Query | 实体集合 | 定制关系表 |
| Set Analyzer | 基因/化学物集合 | 富集结果 + 通路 |
| Pathway View | 基因列表 | 互作网络图 |
| MyVenn/MyGeneVenn | 2–3 个集合 | Venn 关系 |
掌握这些契约,就能把 CTD 从"查询工具"升级为"分析流水线的组件"。
5.6.4 下游集成的技术启示
ROBOKOP 与 Ubergraph 的集成案例提供了技术启示:
- Biolink 建模:ROBOKOP 把 CTD 关系统一映射为 Biolink 谓词(如
affects、treats_or_applied_or_studied_to_treat),实现跨库查询。 - 本体融合:Ubergraph 把 CTD 关系并入 OBO 语义图,使 CTD 关系可与 GO、HPO、MONDO 等本体在语义层面互通。
- 启示:CTD 的价值不仅在于"自用",更在于"可被集成"——受控词表对齐是这一切的前提。
§8 方法学启示:CTD 教给我们的事
CTD 不只是一个可下载的数据集,它在知识工程方法论上给后进的数据库建设者留下了若干可迁移的经验。本节提炼五条。
8.1 策展粒度决定资源寿命
CTD 能在二十年后仍被高频引用,核心原因是它从第一天起就选择了"关系 + 证据句 + PMID"三件套的策展粒度,而不是只存三元组。绝大多数短命的数据库恰恰死在"只存了关系、没存证据"上:因为一旦需要重新核验、重新标准化、或做质量评估,没有证据句就没有抓手。教训:策展时多存一层证据,资源就多一层复用价值。
8.2 "直接 / 推断"分层是关系库的通用架构
CTD 把数据明确分成 direct interactions(人工证据)与 inferred relationships(计算推断)两层,并在界面上分开展示。这个设计在今天看是常识,但在早期的关系库里并不普遍。它的价值在于:让使用者始终知道"这条关系有多硬"。任何现代知识图谱建设都应继承这一分层思想,避免把不同证据强度的关系混在同一张边表里。
8.3 受控词表是"跨年代可比"的前提
CTD 最老的策展文献是 1947 年。一篇 1947 年的论文里的化学物名称、疾病名称,如何在今天与 2024 年的数据同框比较?答案是受控词表对齐(MeSH/MEDIC、HGNC/MGI、GO、KEGG/Reactome 等)。没有词表对齐,跨越近八十年的文献数据就是一堆无法聚合的字符串。 这条经验对任何做长周期数据积累的团队都成立。
8.4 NLP 应做"加速器"而非"决策者"
CTD 2025 年集成 PubTator NLP 的做法值得记取:NLP 输出的术语只作为候选预标注进入人工策展的 pick-list,最终的关系判定仍由 biocurator 完成。这个"人机分工"的边界,是 CTD 数据质量的护城河。教训:在医疗与生物数据里,把 NLP 放在"提效"位置而非"终审"位置,是质量与规模兼得的现实路径。
8.5 暴露组学的关系化表示范式
CTD Exposure 的 4 类别(stressor / receptor / event / outcome)× 20 受控词表 × 33 数据概念的建模方式,是暴露组学数据从"零散测量记录"走向"可查询关系图"的一个具体范式。它示范了:即使是非分子层的流行病学数据,也可以通过受控词表 + 关系建模,被纳入统一的知识图谱,与分子层数据互操作。 这对正在建设环境健康数据基础设施的团队,是可直接借鉴的模板。
8.6 五条启示的横向串联
上面五条并非彼此独立,它们共同勾勒出一种"长寿知识库"的设计哲学:
- 8.1 的策展粒度(多存证据)与 8.4 的人机分工(NLP 只做加速器)共同决定了数据质量;
- 8.2 的分层架构(direct / inferred)与 8.3 的词表对齐共同决定了数据的可复用性;
- 8.5 的建模范式决定了数据的可扩展性(能否纳入新维度、新数据类型)。
三者合起来,回答了一个数据库建设者最关心的问题:怎样让一个知识资源活过二十年、并越用越有价值? CTD 的答案是——把质量做厚(证据 + 人工终审)、把结构分清(分层 + 词表)、把模型做开(可纳入新维度)。这三条不依赖任何特定技术栈,是方法论层面的通用经验。
§9 与千方病案医数集库内条目的关系
CTD 在千方病案医数集(qianfanghub.com)的 AI-Ready Wikipedia 库里不是孤立条目,它与多个已收录资源形成互补与互链关系。本节列出这些连接点,便于读者跨条目导航。
9.1 化学实体与本体层
- chebi(rid 314):化学本体。CTD 的化学物标准化在概念层与 ChEBI 对齐,二者可在"化学实体"层面互链。
- hmdb(rid 470):人类代谢物数据库。代谢物作为化学实体与 CTD 的化学物维度有交叠。
- drugbank(rid 571 / 89):药物知识库。CTD 收录药物类化学物,其药物–基因关系与 DrugBank 互补。
- drugcentral(rid 344):药物–靶点信息,与 CTD 的化学物–基因交互可对照。
9.2 基因–疾病与变异层
- disgenet(rid 449):基因–疾病关联。与 CTD 的 gene–disease 子集直接交叠。
- clinvar(rid 136)、omim(rid 159):变异与遗传病,为 CTD 的疾病侧提供遗传学背景。
- gwas-catalog(rid 463 / 564):GWAS 关联,与 CTD 的基因–疾病/基因–表型关系可交叉验证。
9.3 通路与功能层
- kegg(rid 433)、reactome(rid 424):通路数据库,CTD 直接导入其通路数据。
- gene-ontology(rid 441):CTD 的表型词表基于 GO。
- msigdb(rid 583):基因集资源,可用于 CTD 关系的功能富集。
9.4 蛋白互作与靶点层
- string(rid 414)、intact(rid 582):蛋白互作。CTD 的 Pathway View 使用 BioGRID 数据构建互作图。
- ttd(rid 409):治疗靶点数据库,与 CTD 的化学物–基因–疾病三角可对照。
- open-targets(rid 456):靶点–疾病证据平台,组织逻辑与 CTD 最接近,但面向药物发现。
- pharmgkb(rid 374):药物基因组学,与 CTD 的药物–基因子集交叠。
- dgidb(rid 419):药物–基因交互,与 CTD 化学物–基因层可互链。
9.5 表型、疾病本体与不良事件层
- hpo(rid 747):人类表型本体,与 CTD 的表型维度可对齐。
- mondo(rid 748):疾病本体,为 CTD 的疾病侧提供本体层连接。
- faers(rid 264):不良事件报告系统,与 CTD 的化学物–疾病/表型关系可形成"临床信号 ↔ 机制假设"的对照。
- umls(rid 558):统一医学术语系统,是 CTD 术语标准化的上游词表之一。
9.6 CTD 的库内独特位
在一众库内关系/知识资源中,CTD 的独特性可一句话概括:它是库内唯一以"环境化学物暴露"为起点、保留跨物种比较、并把化学–基因–疾病三角闭合到一张图的关系库。disgenet 少了化学物与暴露,pharmgkb 少了环境化学物,open-targets 少了暴露与跨物种,hmdb 只有化学实体层。CTD 补齐了"环境暴露 → 分子 → 表型 → 疾病"这条链。
9.7 从库内导航到跨库研究的三种典型路径
把这些互链点用起来,常见三种跨条目研究路径:
路径一:机制假设 → 临床信号验证。 从 CTD 的化学物–基因–表型推断出发,得到某化合物的机制假设,再到 faers(264) 检查是否有人群层面的不良事件信号、到 hpo(747)/ mondo(748) 核对表型与疾病本体定义。这条路径把"机制推断"与"临床信号"打通。
路径二:化学物 → 靶点 → 药物重定位。 从 CTD 的化学物–基因交互出发,经 ttd(409)/ drugbank(571)/ dgidb(419) 查该基因是否是已有药物的靶点,经 open-targets(456) 看靶点–疾病证据分级。这条路径把环境化学物数据接入药物发现语境。
路径三:关系抽取训练数据的多源拼接。 把 disgenet(449) 的基因–疾病、ctd 的化学–基因–疾病、gwas-catalog(463/564) 的遗传关联拼成多关系训练集,用 umls(558) 做实体对齐。这条路径把 CTD 当作知识图谱构建的一个模块。
三种路径的共同点是:CTD 从不是唯一数据源,而是"暴露视角的接入点"。理解这一点,就能理解为什么它在库内的定位是"补齐链条"而非"覆盖全局"。
§10 避坑清单
本节汇总使用 CTD 的常见误区,共八条。每一条都来自真实的使用场景,是研究者最容易踩的坑。
坑 1:把 94M 总量当成"94M 条实验证据"
CTD 官网与论文常宣传"94M 关系"或"110M+ 关系",但其中绝大多数是计算推断与第三方导入,真正证据级的直接交互只有约 3.8M。若在论文里写"CTD 提供 94M 条实验验证的化学物–基因关系",是严重误述。使用前先分清 direct 与 inferred。
坑 2:引用规模数字不注明时点与口径
CTD 的规模数字有至少四套口径(94M / 98.5M / 110M+ / 4.1M 直接),来自不同时点与不同统计。若只写"CTD 有 XXm 关系"而不注明来源与日期,读者无法判断你引的是哪一版。规范做法:注明’截至 YYYY-MM,依据 NAR 论文口径’。 本条目在 §2.1 已把四口径并存登记,供对照。
坑 3:误以为 CTD 有传统版本号
CTD 每月更新但不发版本号。若在方法学章节写"使用 CTD v2.0",是错的——根本没有这个版本体系。正确做法:登记访问日期 + Changelog 号。 例如"2025-09 访问,revision 17923"。
坑 4:商业用途直接拿数据商用
CTD 的许可是"非商业免费 + 商业需购许可",但被第三方仓库标注成 Public Domain,容易误导。任何商业场景使用前,必须回到 ctdbase.org 的 legal 页确认,并联系 NC State 获取许可。 详见 §6.2 的三口径冲突。
坑 5:二次分发导入子集时忽略上游许可
CTD 的关系里包含 GO、KEGG、Reactome、BioGRID 的导入数据。这些子集的许可不归 CTD,归各自原始数据源。 若你二次分发含这些子集的数据,需另行核查并遵守上游条款。这是集成型资源的通病(详见 §4.3)。
坑 6:把推断关系当已验证结论
Inference Networks 与 Tetramers 产出的是可检验假设,不是已确证的因果。以 G–[C]–D 推断为例,它只表示"基因与疾病通过共享化学物建立了统计/结构上的联系",不等于该化学物经该基因导致该疾病有生物学确证。若在结论里写成确证因果,属过度解读。
坑 7:忽视发表偏倚而把"缺失"当"阴性"
CTD 的内容由文献策展而来,研究热点实体关系密集、冷门实体稀疏。某关系在 CTD 里查不到,只是"没有策展文献支持",不等于"该关系不存在"或"实验证明无关联"。 用 CTD 做"缺失即阴性"的统计推断,会系统性偏差。
坑 8:跨物种外推不做生物学论证
CTD 的 comparative 设计支持跨物种查询(630+ 物种),方便从模式生物外推到人类。但物种间的分子机制与毒性反应不等价——在小鼠、斑马鱼、线虫中观察到的关系,不能默认在人类成立。跨物种结论必须附生物学论证,或标注为待验证假设。
附:一张自查表
| 场景 | 必做检查 |
|---|---|
| 引用规模数字 | 注明时点 + 口径来源(94M/110M+…) |
| 引用关系结论 | 分清 direct 还是 inferred |
| 写方法学复现 | 登记访问日期 + Changelog 号 |
| 商业使用 | 回 legal 页确认 + 联系 NC State |
| 二次分发 | 核查 GO/KEGG/Reactome/BioGRID 上游许可 |
| 结论强度 | 推断关系只能作为假设,不能作确证 |
| 统计缺失 | 区分"无策展文献"与"无关联" |
| 跨物种推论 | 附生物学论证或标注待验证 |
8.7 暴露科学与 AI 的交叉前沿
8.7.1 暴露组学(exposome)与 CTD 的契合
暴露组学的目标是刻画人一生接触的全部环境暴露及其健康效应。它的核心难题是"暴露的异构性":暴露可以是化学物、物理因素、社会因素,测量方式千差万别。CTD 的贡献在于提供了化学暴露 → 分子响应 → 健康结局这条链上的标准化关系,使暴露组学研究有了可计算的机制底座。
具体而言,暴露组学研究者可以用 CTD 回答:某环境化学物暴露后,哪些基因表达改变?这些基因关联哪些疾病?是否有多条独立文献支持?反向,也可以从某疾病出发,找可能相关的环境暴露。
8.7.2 药物安全与环境健康的交叉
CTD 收录的不只是环境污染物,还有药物——因为"药物也是一种化学暴露"。这使得 CTD 同时服务于药物安全研究:
- 药物–疾病关联:可提示药物的潜在不良反应机制。
- 药物–基因交互:可支持药物基因组学与个体化用药。
- 与 FAERS 互补:CTD 提供机制层面的关联(来自文献),FAERS(264)提供真实世界的报告信号,两者结合可提高信号判定的可信度。
8.7.3 环境健康与精准医学
环境健康正在与精准医学交汇:“同样的基因型,不同的环境暴露,可能有不同的疾病风险”。CTD 的化学–基因–疾病关系为这一命题提供了数据基础:研究者可以检索"某基因变异 × 某环境暴露 × 某疾病"的三角关系,探索基因–环境交互(G×E)的机制假说。这是库内其他关系库(不含暴露维度)无法支持的分析。
8.7.4 CTD 在 AI 训练语料中的角色
随着大模型兴起,CTD 这类结构化关系库获得了新的用途:
- 事实性知识注入:把 CTD 关系作为检索增强生成(RAG)的知识源,减少机制类问答的幻觉。
- 关系抽取基准:CTD 的句法化关系(如 ‘bisphenol A results in increased cleavage of CASP3’)可作为关系抽取任务的训练/评测素材。
- 图推理任务:C–G–D 三角可构造链接预测、路径推理等图任务。
CTD 官方对 AI 的态度是积极的:官网合作的第三方描述明确将其推断关系定位为"ideally suited for machine learning and artificial intelligence workflows"。
8.7.5 使用 CTD 做 AI 建模的三条纪律
- 区分证据层级:直接交互与推断关系在建模时应作为不同的边类型或加权,绝不能混为一谈。
- 保留溯源字段:PMID 是模型可解释性的关键,训练时勿丢弃。
- 登记数据时点:模型结果的复现依赖 CTD 快照,务必固定访问日期与 Changelog 号。
9.8 库内"知识库/关系库"家族全景
本库已收录的、与 CTD 同属"知识资源/关系库"大类的条目,按功能轴分组如下:
遗传关联轴
| 条目 | rid | 核心关系 |
|---|---|---|
| disgenet | 449 | 基因–疾病关联 |
| clingen | — | 基因–疾病临床有效性 |
| clinvar | 136 | 变异–临床意义 |
| omim | 159 | 孟德尔遗传 |
| gwas-catalog | 463/564 | GWAS 关联 |
| hpo | 747 | 表型本体 |
药物–靶点轴
| 条目 | rid | 核心关系 |
|---|---|---|
| pharmgkb | 374 | 药物–基因 |
| drugbank | 89/571 | 药物–靶点 |
| drugcentral | 344 | 药物–靶点 |
| dgidb | 419 | 药物–基因互作 |
| ttd | 409 | 治疗靶点 |
| open-targets | 456 | 靶点–疾病证据 |
化学/代谢/本体轴
| 条目 | rid | 核心关系 |
|---|---|---|
| chebi | 314 | 化学实体本体 |
| hmdb | 470 | 代谢物 |
| gene-ontology | 441 | 基因功能本体 |
| mondo | 748 | 疾病本体 |
| umls | 558 | 术语系统 |
通路/互作轴
| 条目 | rid | 核心关系 |
|---|---|---|
| kegg | 433 | 通路 |
| reactome | 424 | 通路 |
| string | 414 | 蛋白互作 |
| intact | 582 | 分子互作 |
| msigdb | 583 | 基因集 |
不良事件/暴露轴
| 条目 | rid | 核心关系 |
|---|---|---|
| faers | 264 | 药物不良事件报告 |
| vaers | — | 疫苗不良事件 |
| ctd(本条目) | 新增 | 环境暴露–基因–疾病 |
CTD 的加入,使这个家族从"药物/基因/疾病"扩展到"环境暴露",补齐了环境健康这一整条轴。
9.9 跨库联合分析范式
CTD 与其他库联合使用,可支撑更复杂的分析:
- 环境暴露 × 遗传易感:CTD(暴露–基因)× disgenet(基因–疾病)× gwas-catalog(变异–性状)→ 探索 G×E 交互。
- 药物安全全景:CTD(化学–疾病机制)× faers(报告信号)× drugbank(药物信息)→ 机制 + 真实世界双重验证。
- 机制图谱增强:CTD(关系)× kegg/reactome(通路)× string(互作)→ 构建多层机制网络。
- 疾病本体归一:CTD(MEDIC/MeSH)× mondo(疾病本体)× umls(术语)→ 疾病术语标准化桥接。
9.10 与 open-targets 的深度对比
open-targets(456)是与 CTD 组织逻辑最接近的库(都含化学–基因–疾病三角),但两者差异显著:
| 维度 | CTD | open-targets |
|---|---|---|
| 起点 | 环境化学物暴露 | 药物靶点 |
| 证据模型 | 人工策展 + 证据溯源 | 多源证据分级打分 |
| 跨物种 | 是(630+) | 否 |
| 暴露维度 | 是(CTD Exposure) | 否 |
| 核心工具 | Tetramers / Inference Networks | 靶点–疾病证据评分 |
| 目标用户 | 环境健康/毒理 | 药物发现 |
两者互补:CTD 强在环境暴露与机制可溯源,open-targets 强在药物发现导向的证据整合。
§11 总结:CTD 是什么,以及为什么值得关注
一句话定义:CTD(Comparative Toxicogenomics Database,比较毒物基因组学数据库)是由美国北卡罗来纳州立大学(NC State)与 MDI Biological Laboratory 联合维护、由 NIEHS 资助的毒物基因组学关系知识库与发现工具,自 2004 年起持续更新逾二十年,把环境化学物暴露与分子、表型、疾病、物种各维度之间的关系组织成一张可查询、可推断的知识网络。
三个核心事实:
- 规模巨大且有层次:论文口径下逾 94M 关系(官网口径 110M+),其中直接的文献策展交互约 3.8M 条,来自逾 149,000 篇同行评审论文。
- 维度独特:八维实体(化学物、基因/蛋白、表型、疾病、暴露、解剖、通路、物种),五类策展关系(化学–基因、化学–疾病、基因–疾病、化学–表型、化学–暴露)。
- 定位清晰:既是"知识资源"(可直接查关系),也是"发现库"(用 Inference Networks 与 Tetramers 推断可检验假设);在千方病案医数集库内,它是唯一以环境暴露为起点、保留跨物种比较的闭合三角关系库。
使用它的三条铁律(提炼自 §10):
- 分清层次:direct 是证据,inferred 是假设,两者不可混谈。
- 绑定时点:无版本号,复现必须记访问日期 + Changelog 号。
- 守住许可:非商业免费、商业需购许可,导入子集另算。
理解这三点,CTD 就是一个极其实用的研究基础设施;忽略它们,就可能把一个二十年积累的宝贵资源用出错误结论。
常见问题 FAQ
Q1:CTD 的全称是什么?
A:Comparative Toxicogenomics Database,中文常译"比较毒物基因组学数据库"。
Q2:CTD 由谁维护?
A:North Carolina State University(NC State)与 MDI Biological Laboratory 联合维护,由 NIEHS 资助。
Q3:CTD 什么时候上线?
A:首版于 2004-11-12 上线,至今持续更新逾二十年。
Q4:CTD 有多少条关系?
A:多口径并存——NAR 2024-08 论文口径逾 94M(其中直接交互约 3.8M、推断约 48M);官网首页口径 110M+;re3data 登记 98,456,700。引用时须注明时点与口径。
Q5:为什么不同来源的规模数字不一样?
A:因为统计时点不同、口径不同(有的算总量,有的只算直接交互)。CTD 每月更新,数字本就随时间漂移。
Q6:CTD 的数据来自哪里?
A:主要来自人工策展(biocurators 阅读同行评审文献抽取关系),辅以 PubTator NLP 预标注;另导入 Gene Ontology、KEGG、Reactome、BioGRID 等第三方数据。
Q7:CTD 的"comparative"是什么意思?
A:指它覆盖 630+ 物种,使不同物种间的毒性/基因关系可比较,为跨物种外推提供基础。
Q8:什么是 CTD Exposure?
A:CTD 的暴露科学模块,把真实世界环境测量组织成结构化暴露陈述,用 4 类别(stressor/receptor/event/outcome)× 20 受控词表 × 33 数据概念建模,收录约 214,000 条暴露条目。
Q9:direct interactions 和 inferred relationships 有什么区别?
A:direct 是策展员从文献中人工抽取的、有实验来源的直接关系;inferred 是系统基于共享中间体计算出的推断关系,属于可检验假设而非确证证据。
Q10:什么是 CTD Tetramers?
A:把五条直接证据语句整合成"化学物–基因–表型–疾病(CGPD)"四单元有向机制模块的工具,2025 年新增 Evidence 列与弦图可视化。
Q11:什么是 Inference Networks?
A:基于共享中间体把直接关系组合成新潜在关系的推断网络,典型如 G–[C]–D(基因–共享化学物–疾病)与 P–[G/C]–D(表型–共享基因/化学物–疾病)。
Q12:CTD 免费吗?
A:学术与非商业用途免费;商业用途需向 NC State 购买许可。注意第三方仓库有将其标注为 Public Domain 的不同说法,商业场景务必回官网 legal 页确认。
Q13:CTD 怎么下载?
A:全量数据发布于 ctdbase.org/reports/,提供 CSV/TSV、XML/structured XML、obo 三种格式,按模块拆分。
Q14:CTD 有 API 吗?
A:有。CTD 提供查询/下载接口与 Batch Query 工具,支持程序化批量集成。
Q15:CTD 有版本号吗?
A:没有传统版本号。它每月更新,用户需以"访问日期 + Changelog 号"标识所用数据版本。
Q16:怎么引用 CTD?
A:引用其年度更新论文(当前主引:NAR 2025, 53(D1):D1328–D1334, doi:10.1093/nar/gkae883),并注明访问日期。
Q17:CTD 收录多少化学物?
A:论文口径 >17,700 个(F1000 论文口径 19,400 个),含环境污染物与药物。
Q18:CTD 收录多少基因?
A:论文口径 55,400 个(F1000 口径 57,000 个基因产物),跨 630+ 物种。
Q19:CTD 收录多少疾病?
A:约 7,200 个,经 MEDIC 词表标准化,对齐 MeSH。
Q20:CTD 收录多少表型?
A:约 6,700 个(F1000 口径 6,900 个),基于 Gene Ontology 术语描述非疾病类性状/过程。
Q21:CTD 的疾病术语用的是什么词表?
A:MEDIC(MEDIC 是 CTD 自研的疾病词表),对齐 MeSH。
Q22:CTD 的化学物术语对齐哪些词表?
A:MeSH、ChemIDplus 等。
Q23:CTD 的基因命名对齐哪些词表?
A:HGNC、MGI、NCBI Gene 等权威基因命名体系。
Q24:CTD 有多少条 chemical–gene 交互?
A:是 CTD 体量最大的关系类别;论文口径下直接交互总量约 3.8M,其中 chemical–gene 占大头。
Q25:CTD 最老的策展文献是哪年?
A:1947 年——正是靠受控词表对齐,七十多年前的术语才能与当代数据同框。
Q26:CTD 用了什么 NLP 工具?
A:PubTator。2025 年起集成进策展流程,术语颜色编码高亮,NLP 结果作为候选导入策展工具 pick-list,最终判定仍由人工完成。
Q27:CTD 有哪些配套工具?
A:Tetramers、Pathway View、Set Analyzer、MyVenn/VennViewer、Chord Diagram Generator、Batch Query、CTD API 等。
Q28:Pathway View 是做什么的?
A:把基因网络可视化,并从 Gene Inference Networks 出发把基因送入 Set Analyzer 构建基于 BioGRID 的互作图。2025 年增加可定制项(边/标签显示、布局、配色、导出)。
Q29:CTD 是一个 benchmark 吗?
A:不是。它不提供 ML 排行榜或官方 F1 指标,而是作为远监督/弱监督的标签来源与金标准关系表被间接使用。
Q30:CTD 主要被谁使用?
A:环境健康、毒理学、计算生物学、暴露组学领域的研究者,以及做关系抽取/知识图谱构建的 NLP 研究者。
Q31:CTD 的已知局限有哪些?
A:发表偏倚、direct 与 inferred 易混淆、无版本号带来的复现难、导入子集许可边界、关系定义粒度与部分任务不完全对齐、跨物种外推需谨慎。
Q32:CTD 在千方病案医数集库里与哪些条目相关?
A:chebi(314)、hmdb(470)、drugbank(571/89)、drugcentral(344)、disgenet(449)、clinvar(136)、omim(159)、gwas-catalog(463/564)、kegg(433)、reactome(424)、gene-ontology(441)、msigdb(583)、string(414)、intact(582)、ttd(409)、open-targets(456)、pharmgkb(374)、dgidb(419)、hpo(747)、mondo(748)、faers(264)、umls(558) 等,详见 §9。
事实清单
以下为本条目的关键事实条目,逐条列出并标注来源口径,供核验与引用。
- 全称:Comparative Toxicogenomics Database(CTD)。
- 中文名:比较毒物基因组学数据库。
- 类型:毒物基因组学关系知识库 + 知识发现工具。
- 维护机构:North Carolina State University + MDI Biological Laboratory。
- 资助机构:NIEHS(美国国家环境健康科学研究所),主要项目 U24 ES033155。
- 通讯作者:Allan Peter Davis(NC State)。
- 首版上线:2004-11-12。
- 主引论文:NAR 2025, 53(D1):D1328–D1334。
- 主引论文 DOI:10.1093/nar/gkae883。
- 主引论文 PMID:39385618。
- 主引论文 PMCID:PMC11701581。
- 勘误:Erratum PMID 39574404。
- 关系总量(论文口径):>94M(2024-08 冻结)。
- 直接交互(论文口径):3.8M(较上次增长 13%)。
- 推断关系(论文口径):约 48M。
- 策展来源文献数:>149,000 篇。
- 关系总量(官网口径):110M+。
- 关系总量(re3data 口径):98,456,700。
- 直接交互(F1000 口径):>4.1M。
- 化学物数(论文口径):>17,700。
- 基因/蛋白数(论文口径):55,400。
- 表型数(论文口径):6,700。
- 疾病数(论文口径):7,200。
- 暴露条目数(论文口径):214,000。
- 解剖术语数:980(F1000 口径 1,000)。
- 物种覆盖:>630。
- 五类策展关系:chemical–gene/protein、chemical–disease、gene–disease、chemical–phenotype、chemical–exposure。
- 谓语数与限定词数:50 predicates + 15 qualifiers。
- 暴露建模:4 类别 × 20 受控词表 × 33 数据概念。
- 疾病词表:MEDIC(对齐 MeSH)。
- 化学词表:MeSH、ChemIDplus。
- 基因词表:HGNC、MGI、NCBI Gene。
- 表型词表:Gene Ontology。
- 导入数据源:Gene Ontology、KEGG、Reactome、BioGRID。
- NLP 工具:PubTator(2025 集成)。
- 最老策展文献:1947 年。
- 更新频率:每月初。
- 版本标识:无传统版本号,用访问日期 + Changelog 号。
- 数据格式:CSV/TSV、XML/structured XML、obo。
- 下载入口:ctdbase.org/reports/。
- 许可(论文/官网页):非商业免费,商业需购 NC State 许可。
- 许可(re3data 页):标注为 Public Domain(与上冲突,存照)。
- 引用数:>9,900 篇。
- 被收录目录/综述数:290+。
- 团队自发表论文数:53 篇。
- 基础设施:NetApp SSD 约 45 TB,Eastern Data Center,25 Gb/s。
- RRID:RRID:SCR_006530 / RRID:nif-0000-02683。
- CDN/官网:ctdbase.org。
- Tetramers 示例:重金属→帕金森病经代谢过程表型,检索出 167 个 CGPD 四聚体(6 重金属 / 32 基因 / 52 表型)。
- Pathway View 示例:金属钴经 39 个基因推断至肺肿瘤。
- 发布文件量级:CTD_genes_diseases.csv.gz 未压缩约 3.2 GB。
- 最新发布时点(抓取记录):2026-08-28。
术语表
| 术语 | 释义 |
|---|---|
| CTD | Comparative Toxicogenomics Database,比较毒物基因组学数据库。 |
| toxicogenomics | 毒物基因组学,研究化学物暴露与基因组/转录组响应关系的学科。 |
| direct interaction | 直接交互,策展员从文献人工抽取、有实验来源的关系。 |
| inferred relationship | 推断关系,系统基于共享中间体计算得出的潜在关系。 |
| Inference Network | 推断网络,把直接关系组合成新潜在关系的计算框架。 |
| Tetramer | 四聚体,由五条证据构成的"化学物–基因–表型–疾病(CGPD)"机制模块。 |
| CGPD | Chemical–Gene–Phenotype–Disease,Tetramers 的四单元结构。 |
| CTD Core | CTD 的核心策展模块,产出四类基础关系。 |
| CTD Exposure | CTD 的暴露科学模块,结构化组织真实世界暴露测量。 |
| exposome | 暴露组,指个体一生中全部环境暴露的总和,与基因组对应。 |
| biocurator | 生物策展员,阅读文献并抽取结构化关系的人工角色。 |
| MEDIC | CTD 自研的疾病词表,对齐 MeSH。 |
| MeSH | Medical Subject Headings,美国国立医学图书馆的受控词表。 |
| HGNC | HUGO Gene Nomenclature Committee,人类基因命名委员会。 |
| MGI | Mouse Genome Informatics,小鼠基因组信息学资源。 |
| Gene Ontology (GO) | 基因本体,描述基因功能与生物过程的标准本体。 |
| KEGG | Kyoto Encyclopedia of Genes and Genomes,通路数据库。 |
| Reactome | 通路数据库,CTD 的导入源之一。 |
| BioGRID | 生物分子交互数据库,CTD 用于 Pathway View。 |
| PubTator | 生物医学文献的 NLP 标注服务,2025 集成进 CTD 策展流程。 |
| predicate | 谓语,关系句中的关系动词(CTD 定义 50 个)。 |
| qualifier | 限定词,修饰关系方向与层面的词(CTD 定义 15 个)。 |
| PMID | PubMed 文献唯一标识。 |
| Pathway View | CTD 的基因网络可视化工具。 |
| Set Analyzer | CTD 的集合富集与通路生成工具。 |
| Batch Query | CTD 的批量查询下载工具。 |
| Chord Diagram | 弦图,CTD 用于展示 Tetramers 结果的环形可视化。 |
| Changelog | CTD 每次更新记录的变更号,用于标识数据版本。 |
| FAIR | 数据可发现、可访问、可互操作、可复用的原则。 |
| stressor / receptor / event / outcome | CTD Exposure 的四个暴露类别:压力源/受体/事件/结局。 |
| RRID | Research Resource Identifier,科研资源唯一标识。 |
| NIEHS | 美国国家环境健康科学研究所,CTD 的资助方。 |
附录 A:实体维度与词表对照
| 实体维度 | 规模(论文口径) | 权威词表 |
|---|---|---|
| 化学物 | >17,700 | MeSH、ChemIDplus |
| 基因/蛋白 | 55,400 | HGNC、MGI、NCBI Gene |
| 表型 | 6,700 | Gene Ontology |
| 疾病 | 7,200 | MeSH、MEDIC |
| 暴露 | 214,000 | CTD Exposure 受控词表 |
| 解剖 | 980 | 解剖学术语 |
| 通路 | 导入 | KEGG、Reactome |
| 物种 | >630 | 分类学命名 |
附录 B:发布文件模块清单(示例)
| 文件 | 内容 | 量级 |
|---|---|---|
| CTD_genes_diseases.csv.gz | 基因–疾病关联 | 未压缩约 3.2 GB |
| CTD_chemicals_diseases.xml.gz | 化学物–疾病关联 | 约 190 MB |
| CTD_chem_gene_ixns.xml.gz | 化学物–基因交互 | 约 51 MB |
| CTD_UniProtToCTDIdMapping.txt.gz | UniProt↔CTD ID 映射 | 小 |
| CTD_exposure_events.csv.gz | 暴露事件 | 视版本 |
附录 C:四套规模口径速查
| 口径 | 时点 | 总量 | 直接 |
|---|---|---|---|
| NAR 论文 | 2024-08 | >94M | 3.8M |
| re3data | 2025-01 | 98,456,700 | — |
| 官网首页 | 2026-09 抓取 | 110M+ | — |
| F1000 论文 | 2025/2026 | — | >4.1M |
附录 D:工具链一览
| 工具 | 功能 |
|---|---|
| Tetramers | CGPD 四单元机制模块构建 |
| Inference Networks | 推断关系计算 |
| Pathway View | 基因网络可视化 |
| Set Analyzer | 集合富集与通路生成 |
| MyVenn / VennViewer | 集合比较 Venn 图 |
| Chord Diagram Generator | 弦图生成 |
| Batch Query | 批量查询下载 |
| CTD API | 程序化接口 |
附录 E:库内互链条目速查(rid)
| rid | 条目 | 关联维度 |
|---|---|---|
| 314 | chebi | 化学本体 |
| 470 | hmdb | 代谢物 |
| 571 / 89 | drugbank | 药物 |
| 344 | drugcentral | 药物–靶点 |
| 449 | disgenet | 基因–疾病 |
| 136 | clinvar | 变异 |
| 159 | omim | 遗传病 |
| 463 / 564 | gwas-catalog | GWAS |
| 433 | kegg | 通路 |
| 424 | reactome | 通路 |
| 441 | gene-ontology | 功能本体 |
| 583 | msigdb | 基因集 |
| 414 | string | 蛋白互作 |
| 582 | intact | 蛋白互作 |
| 409 | ttd | 治疗靶点 |
| 456 | open-targets | 靶点–疾病 |
| 374 | pharmgkb | 药物基因组学 |
| 419 | dgidb | 药物–基因 |
| 747 | hpo | 表型本体 |
| 748 | mondo | 疾病本体 |
| 264 | faers | 不良事件 |
| 558 | umls | 术语系统 |
附录 F:DAIMS 数据资产管理要素映射
下表把 CTD 的资源特征映射到 DAIMS(Data Asset and Information Management System)的核心要素,便于数据治理视角的评估。
| DAIMS 要素 | CTD 对应特征 |
|---|---|
| 数据资产识别(Identity) | 由 NC State + MDI Biological Laboratory 维护的稳定资源,RRID:SCR_006530;自 2004 年起持续运营。 |
| 数据来源(Provenance) | 人工策展的同行评审文献(最老 1947 年)+ PubTator NLP 预标注 + GO/KEGG/Reactome/BioGRID 导入;每条关系可回溯 PMID。 |
| 数据质量(Quality) | 三层保障:文献驱动策展、受控词表对齐、NLP 仅作候选预标注而人工终审。 |
| 数据血缘与版本(Lineage / Versioning) | 每月更新、无传统版本号;以 Changelog 号(如 revision 17923、18280)与访问日期标识版本。 |
| 访问与分发(Access) | ctdbase.org 网页查询 + reports/ 全量下载(CSV/TSV、XML、obo)+ Batch Query/API;基础设施 NetApp SSD 约 45 TB。 |
| 许可与合规(Licensing) | 非商业免费、商业需购 NC State 许可;第三方仓库另有 Public Domain 标注(存照);导入子集许可归上游。 |
| 可复现性(Reproducibility) | 强制登记访问日期 + Changelog 号;引用年度更新论文(NAR 2025)。 |
| 互操作性(Interoperability) | 术语对标 MeSH/MEDIC、HGNC/MGI、GO、KEGG/Reactome、BioGRID、ChemIDplus,支持跨库连接。 |
| 可持续性(Sustainability) | NIEHS U24 ES033155 等资助 + 二十年连续维护 + 53 篇团队论文构成的治理证据。 |
附录 G:CTD 发展时间线
| 时间 | 事件 |
|---|---|
| 2004-11-12 | CTD 首版上线。 |
| 2004–2024 | 连续二十年年度更新,每年在 NAR Database Issue 发文。 |
| 2022 | 新增 CTD Exposure 策展流程与暴露策展工具(ECT)。 |
| 2024-08 | NAR 二十周年论文数据冻结(>94M 关系 / 3.8M 直接)。 |
| 2025 | 集成 PubTator NLP;Tetramers 增强(Evidence 列、弦图);Pathway View 增强。 |
| 2025-01 | re3data 登记更新(98,456,700)。 |
| 2026-08-28 | reports/ 发布文件时间戳记录。 |
附录 H:常见误用与正确用法对照
| 误用 | 正确用法 |
|---|---|
| “CTD 有 94M 条实验证据” | “CTD 收纳约 94M 关系,其中约 3.8M 为文献直接策展交互” |
| “使用 CTD v2.0” | “2025-09 访问 CTD,对应 revision 17923” |
| “CTD 数据是公有领域,可自由商用” | “CTD 非商业免费,商业需购 NC State 许可” |
| “CTD 里没有该关系,说明不存在” | “CTD 中尚无该关系的策展文献支持” |
| “小鼠中验证的毒性可直接推及人类” | “跨物种结论需生物学论证或标注为假设” |
| “CTD 是 ML 评测榜” | “CTD 是远监督标签来源与金标准关系表” |
尾注
- 本条目主要依据 NAR 2025 二十周年更新论文(doi:10.1093/nar/gkae883,PMID 39385618,PMCID PMC11701581)与 CTD 官网(ctdbase.org)公开信息撰写,并结合 re3data 登记记录与 F1000Research 相关论文交叉核验。
- 凡存在多口径冲突之处(规模、许可等),本条目一律并存登记并注明时点与来源,不擅自二选一。
- 数据库规模数字随 CTD 每月更新而漂移,读者应以本文档记录的口径与日期为准,并结合最新官方 Changelog 复核。
- 本条目为 AI-Ready Wikipedia 格式的知识资源条目,旨在为 AI 系统与研究者提供结构化、可核验的 CTD 概览;不构成法律意见,商业使用请以官方 legal 页为准。
FAQ 续(进阶 24 问)
F. 复现与工程细节
37. 怎么保证用 CTD 做的研究可复现?
登记两个关键信息:数据访问日期 + 对应 Changelog 号(官网 about/changes/ 查得)。仅写"使用 CTD 数据"无法复现。
38. CTD 的 Changelog 号是什么样子的?
是一串递增编号,标识每次月度更新后的数据状态。例如 revision 17923 对应 2025-09 数据,Changelog 18280 对应 2026-06-01 更新。
39. 为什么 CTD 不给版本号?
CTD 采用滚动月度更新模式,而非定期发布带版本号的快照。这使其始终"最新",但也迫使研究者自行登记时点。
40. 下载的文件是压缩的吗?
是,/reports/ 提供的是 .gz 压缩文件,解压后 CSV 可能达数 GB。建议用支持断点续传与分块处理的工具。
41. structured XML 和普通 XML 有何不同?
structured XML 附有 XSD schema,可用于严格的结构校验与自动解析;普通 XML 更便于人读。
42. obo 文件有什么用?
obo 是本体文件格式,CTD 用它发布疾病本体、交互类型本体、暴露本体,供本体对齐与语义推理使用。
43. CTD 的 ID 体系是怎样的?
CTD 为化学物、基因、疾病、暴露等分配内部 ID,同时保留外部标识(MeSH、CAS、NCBI Gene、HGNC 等)。CTD_UniProtToCTDIdMapping.txt.gz 提供蛋白 ID 映射。
44. 索引/主键怎么设计?
典型主键组合:InteractionID / ChemicalID / GeneID / DiseaseID / PMID。具体字段见各模块文件头部说明。
45. 处理 GB 级文件有什么建议?
分块读取(chunked read)、按关系类分文件处理、只加载需要的列、用数据库(如 PostgreSQL)承载关系表。
46. 能只下载某一部分吗?
能。文件按模块拆分(chemicals / genes / diseases / chem-gene ixns / genes-diseases 等),可只取所需。Batch Query 也支持定制子集。
G. 数据解读
47. “inferred” 关系的可信度如何?
推断关系是计算生成的假设,不是实验确证。可信度取决于支撑它的直接证据强度,使用时应回溯直接交互。
48. 一条化学–基因交互的"方向"怎么读?
通过谓语(predicate)读取,如 “increases expression” 表示上调,“decreases” 表示下调;限定词进一步细化层面。
49. taxa 字段怎么看?
taxa 标注该关系所属物种(如 human、rat、mouse),是跨物种比较的依据。
50. 为什么同一化学物–基因对不同物种有不同的关系?
因为毒理响应存在物种特异性,CTD 保留各物种的独立观测,不强行合并。
51. chemical–disease 是因果关系吗?
不是严格因果,是文献报告的"关联"。因果判定需结合机制证据(如 Tetramer 路径)与实验验证。
52. 疾病用 MEDIC 词表,怎么映射到 ICD?
MEDIC 源自 MeSH,与 ICD 不一一对应。需通过 UMLS 或专门的 MeSH–ICD 映射表做额外对齐。
53. 表型(phenotype)和疾病(disease)怎么区分?
CTD 中,表型指非疾病类的生物过程或性状(用 GO 术语,如细胞增殖),疾病指病理状态(用 MeSH/MEDIC)。
54. 暴露事件(exposure event)包含什么信息?
按四类别:stressor(暴露源)、receptor(受体)、event(时间地点方式)、outcome(结局)。
H. 工具与工作流
55. 如何快速得到一个化学物的完整关系画像?
官网化学物详情页 + Batch Query(以该化学物为输入)+ Tetramers(查机制模块)。
56. 如何从疾病反查相关环境暴露?
用疾病页面看关联化学物,或用 Inference Networks 反查;也可在 CTD Exposure 中按 outcome 检索。
57. 弦图怎么解读?
弦图把实体排列在圆周,弦的粗细表示关系强度/数量,用于可视化多实体间的复杂关系,如 Tetramer 集合。
58. Set Analyzer 的输入是什么?
一组基因或化学物 ID,输出富集结果与通路。
59. 如何把 CTD 数据接入自己的知识图谱?
下载 /reports/ 的 CSV → 用词表标识做实体对齐 → 按关系类建边(区分直接/推断)→ 保留 PMID 属性。
60. CTD 有 Python/R 客户端吗?
CTD 提供 API 与文件下载;社区有第三方封装。官方主要提供 Web 工具与 REST API。
I. 拓展应用
61. 能用 CTD 做暴露组关联研究(EWAS)的机制解释吗?
能。把 EWAS 找到的暴露–疾病关联,用 CTD 的化学–基因–疾病关系做机制解释。
62. CTD 支持药物重定位研究吗?
间接支持:通过化学–基因–疾病关系,可探索某药物的潜在新适应症或其环境类似物的影响。
63. CTD 与 AOP 如何配合?
CTD 的 Tetramers 与推断关系提供 AOP 的分子机制支撑,可用于补全 AOP-Wiki 中数据稀疏的通路。
64. 可以做跨物种药物毒性外推吗?
可以。利用 taxa 标注与同源基因映射,把模式生物的毒性发现外推到人类(需谨慎评估保守性)。
65. 商用产品能用 CTD 吗?
必须购买 NC State 许可。非商业研究、教学可免费使用。
66. 如何引用 CTD 中的数据表?
写明模块(chemical–gene/disease、gene–disease 等)、机构双址、访问月份年份,遵循官网引用规范。
67. CTD 的数据可以再分发吗?
非商业用途下遵循 CTD 引用规范;商业再分发需许可。导入子集(GO/KEGG/Reactome/BioGRID)另受源许可约束。
68. CTD 有中文版吗?
无。官网与数据均为英文,术语以英文受控词表为准。
69. CTD 与 PubTator/PubMed 的关系?
CTD 从 PubMed 文献策展,用 PubTator 做 NLP 预标注;数据可回溯到 PubMed 的 PMID。
70. CTD 未来会加什么?
从官方动向看,重点在:暴露策展扩展、NLP 更深集成、推断工具增强(Tetramers Phase 续)、基础设施与 API 升级。
附录续
附录 Z1:CTD 数据接入伪代码(知识图谱构建)
# 1. 下载全量文件
wget https://ctdbase.org/reports/CTD_chem_gene_ixns.csv.gz
wget https://ctdbase.org/reports/CTD_chemicals_diseases.csv.gz
wget https://ctdbase.org/reports/CTD_genes_diseases.csv.gz
# 2. 分块读取(GB 级文件勿全量载入)
for chunk in pd.read_csv(..., chunksize=100000):
# 3. 实体对齐:MeSH/GO/HGNC/KEGG → 图谱节点 ID
# 4. 建边:区分直接交互与推断,保留 PMID 属性
# 5. 入库(PostgreSQL / Neo4j / RDF store)
# 6. 登记访问日期 + Changelog 号(可复现关键)
附录 Z2:关系类 → 图谱边映射建议
| CTD 关系类 | 建议边类型 | 属性 |
|---|---|---|
| chemical–gene interaction | affects |
predicate, qualifier, taxon, PMID |
| chemical–disease association | associated_with |
taxon, PMID |
| gene–disease association | associated_with |
PMID |
| chemical–phenotype interaction | affects |
predicate, taxon, PMID |
| chemical–exposure statement | exposed_to |
stressor/receptor/event/outcome |
| Inference (G–[C]–D) | inferred_associated_with |
中间化学物, 支撑证据 |
| Tetramer (CGPD) | 路径(四段边) | Evidence 五条 |
附录 Z3:常见误区速答表
| 误区 | 正解 |
|---|---|
| CTD 是原始数据集 | CTD 是二次策展的关系库 |
| CTD 有 110M 条实验证据 | 110M 含大量计算推断,直接交互仅数百万 |
| CTD 可以随便商用 | 商业须购买 NC State 许可 |
| 论文 CC BY = 数据 CC BY | 两者是不同对象 |
| CTD 有版本号 | 无版本号,靠访问日期 + Changelog |
| 查不到某关系=不存在 | 可能只是没被研究(发表偏倚) |
| CTD 直接用 MeSH 疾病 | 用 MeSH 派生的 MEDIC 词表 |
| CTD 数据永远一致 | 每月更新,数字随时点变化 |
附录 Z4:数据质量核对清单
- 引用时是否标了数据时点?
- 是否区分了直接交互与推断关系?
- 是否核查了器官/物种上下文(taxa)?
- 是否回溯了 PMID 证据?
- 是否考虑了发表偏倚?
- 是否确认了使用场景的许可边界?
- 是否登记了访问日期与 Changelog 号?
附录 Z5:与库内条目互链锚点(发布用)
- disgenet(449)|pharmgkb(374)|open-targets(456)|hmdb(470)|chebi(314)
- gene-ontology(441)|faers(264)|hpo(747)|mondo(748)
- kegg(433)|reactome(424)|string(414)|intact(582)|dgidb(419)
- drugbank(89/571)|drugcentral(344)|ttd(409)|umls(558)
- gwas-catalog(463/564)|clinvar(136)|omim(159)|msigdb(583)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- disgenet — 共享标签:药物发现与化学 / 知识图谱 / 基因组学与多组学
- open-targets — 共享标签:药物发现与化学 / 知识图谱 / 基因组学与多组学
- impc — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- alphamissense — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- mics — 共享标签:公共卫生与流行病学 / 疾病监测
- iuphar-bps — 共享标签:药物发现与化学 / 药物-靶点相互作用 / 知识图谱
- depmap-ccle — 共享标签:药物发现与化学 / 药物-靶点相互作用 / 基因组学与多组学
- meddra — 共享标签:药物发现与化学 / 公共卫生与流行病学
- intact — 共享标签:药物发现与化学 / 基因组学与多组学
- msigdb — 共享标签:药物发现与化学 / 基因组学与多组学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

