信息速览
INFOBOX — MDAD 一屏速览
维度 内容 本质 微生物-药物关联数据库(文献策展型二部图),非影像、非测序原始数据 团队 深圳大学计算机学院(Sun/Cai/Ming/Li)+ 中国矿业大学信控学院(Zhang/Chen),6 作者 论文 Front Cell Infect Microbiol. 2018 Dec 7;8:424(doi:10.3389/fcimb.2018.00424;PMID 30581775) 规模(论文口径) 5,055 entries = 1,388 药物 × 180 微生物,含 824 菌株、993 篇文献(1970s 起) 规模(基准通行) 去冗 2,470 关联 = 1,373 药物 × 173 微生物(后继预测论文的事实标准) 证据结构 每条关联 = 药物 + 微生物 + PubMed ID;附分子式/DrugBank 链接 + Uniprot 靶点 Top 关联 环丙沙星 64 条;金黄色葡萄球菌 662 条(药物侧/微生物侧之最) 主任务 微生物-药物关联预测:173×1373 邻接矩阵上的二分类链接预测,5 折 CV,AUC/AUPR 姊妹基准 aBiofilm(2,884 关联)+ DrugVirus(933 关联)——三件套是领域论文标配 获取 官网已失效(2024 年中起);GitHub Sun-Yazhou/MDAD(MDAD.zip ≈3.2 MB)唯一存活通道许可 论文 CC BY 4.0|数据包无 LICENSE 文件(许可须回溯论文+TTD/DrugBank 条款推定) 引用 Semantic Scholar 117 次(8 次高影响力,2026-09-28 抓取) 库内互链 DrugBank(上游源)、TTD(上游源)、STRING(相似性计算底座)、ChEMBL/DrugCentral(生态对照)
MDAD 是一个"把 993 篇论文里散落的微生物-药物作用证据钉进一张二部图"的数据库工程:6 位计算机科学研究者从 TTD、DrugBank 等数据库与文献中筛出 5,055 条有临床或实验证据支撑的"哪种药对哪种微生物有作用"关联,每条都挂着 PubMed 引用、分子式和 Uniprot 靶点。它发布于 2018 年,此后成为微生物组药物学(pharmacomicrobiomics)方向关联预测任务的默认基准之一——但它的官网已在 2024 年前后静默下线,如今整个数据集只剩 GitHub 上一个 3.2 MB 的 zip 包孤悬。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——官网已死,唯一通道是 GitHub 仓库的 MDAD.zip,且数据包没有 LICENSE 文件,许可问题先读 §6.2。
- 要做关联预测:直奔 §5 基准生态——先弄清 5,055/2,470 两个口径(§4),再决定你的负采样协议,别直接横比别人的 AUC。
- 检索被同名干扰:直奔坑 1——MDAD 还是火星尘暴数据库和驾驶员动作数据集的名字,检索词必须带 microbe/drug 限定。
§0 导读:这个数据集解决什么问题
人体微生物组与药物的相互作用远比"抗生素杀菌"复杂:抗生素扰乱菌群可能导致二重感染与耐药,非抗感染药(如 5-氟尿嘧啶)也能显著抑制特定菌株,而某些微生物反过来修饰药物代谢。要系统性研究这些关系,第一步是把散落在文献与数据库里的"药物 X 对微生物 Y 有作用"证据收拢成结构化数据——这正是 MDAD 的出发点:做一个"clinically or experimentally supported associations between microbes and drugs"的集中资源。
MDAD 的回答分三层。第一层是数据:5,055 条验证关联覆盖 1,388 种药物、180 种微生物(含 824 株菌株),证据来自 TTD、DrugBank 等数据库加 993 篇原始文献,每条关联携带药物名、微生物名、PubMed ID 三要素,再附分子式或 DrugBank 链接(药物侧)与菌株、Uniprot 靶点(微生物侧)。第二层是结构:这些关联天然构成一张二部图——药物节点与微生物节点之间的连边——可以直接折叠为 180×1388 的邻接矩阵,供链接预测算法消费。第三层是社区惯例:2019 年起,预测论文统一采用"去冗 + 物种级折叠"口径(2,470 关联 / 1,373 药物 / 173 微生物),加上姊妹数据集 aBiofilm 与 DrugVirus,构成该领域三件套基准。
§0 读法三则:
- 这个条目是"数据库+基准+已失效的 Web 服务"三合一:数据本体活在 GitHub zip 里,网站已是历史,而 117 篇引用文献中的官网链接全部是死链——引用与抓取策略必须按此现实设计(§6)。
- 全文的规模数字按口径分轨:论文口径 5,055/1,388/180(entries 语义)与基准口径 2,470/1,373/173(去冗邻接矩阵语义)并存,转换规则在 §4 逐条拆解。
- "MDAD 上 AUC 0.98+"这类数字要带协议读:无官方划分、伪负采样自定,1:1 与 10:1 负正比下 AUPR 可差 5 个百分点以上(§5.3)。
§1 数据集速览:十问十答
Q1:MDAD 里到底存了什么?
一句话:三元组证据库。每条记录 = 一种药物 × 一种微生物 × 一篇 PubMed 文献(或数据库来源),表述"该药对该微生物有(抑制/杀灭等)作用"。此外药物侧附分子式或 DrugBank 链接,微生物侧附菌株与 Uniprot 靶点(蛋白或 RNA)。它不是基因表达矩阵,不是影像,也不是病历——是一张带文献指针的二部关联表。
Q2:"5,055"和"2,470"哪个是对的?
都对,语义不同。5,055 是论文口径的 entries(药物-微生物-证据记录,保留重复证据与菌株级细节);2,470 是后继预测论文去冗+物种级折叠后的关联数(1,373 药物 × 173 微生物)。做矩阵类任务直接用 2,470 口径,引用数据库规模时用论文口径并注明(坑 2)。
Q3:数据从哪来?
两条管线:结构化数据库导入(TTD、DrugBank——拿药物-靶点与药物条目信息)+ 文献挖掘(993 篇,从 1970 年代跨度到 2018 年),仅保留有临床或实验证据支撑的关联,去重后入库。
Q4:微生物侧是什么粒度?
论文口径保留到菌株(824 株,不含未指定菌株的微生物),但物种级是主流使用粒度(180 种;去冗后 173 种)。做物种级矩阵时菌株细节被丢弃——想做菌株特异性药敏研究得回溯原始记录(坑 8)。
Q5:谁在用、用来做什么?
关联预测(microbe-drug association prediction):给定邻接矩阵,预测未观测的药物-微生物连边。方法谱系从矩阵补全、相似度核方法(高斯交互谱核 + SIMCOMP 药物结构相似性 + STRING 基微生物功能相似性)一路到图卷积网络(GCNMDA)与集成模型(BRMDA)。Semantic Scholar 计 117 次引用(2026-09-28 抓取)。
Q6:有没有官方的评估协议?
没有。MDAD 只给正样本:无官方训练/测试划分、无负样本、无评估脚本、无 leaderboard。社区惯例是分层 5 折交叉验证 + 伪负采样(1:1 常规),但采样比例、种子、特征构造全由各论文自定——这是所有"SOTA"数字需要带协议读的原因(§5.3)。
Q7:数据现在从哪下?
官网 chengroup.cumt.edu.cn/MDAD 已失效(2024 年 5 月已有用户在 GitHub issue 报告,2026-09-28 实测连接被空回复)。唯一存活通道是 GitHub 仓库 Sun-Yazhou/MDAD 里的 MDAD.zip(约 3.2 MB,2018-10-29 上传)。HuggingFace 与 Zenodo 无官方镜像。
Q8:数据包可以直接商用吗?
谨慎。论文本身 CC BY 4.0 开放获取,但数据包所在仓库没有 LICENSE 文件,README 只有标题一行。许可链需要人工推定:论文声明 → 数据事实来源于 TTD/DrugBank 与文献 → 上游数据库各自条款仍可能约束再分发。商用前建议完成 §6.2 的许可链核对。
Q9:它和 aBiofilm、DrugVirus 什么关系?
姊妹三件套。aBiofilm(2018)收抗生物被膜药物(去冗 2,884 关联 / 1,720 药物 / 140 微生物),DrugVirus(2020)收抗病毒化合物(118 化合物 / 83 病毒)。三者在 GCNMDA(2022)之后成为预测论文的标配评估组合,经常出现在同一张结果表里(§5.4)。
Q10:为什么它对 AI-Ready 重要?
它是"学术上极成功(117 引)、工程上极脆弱(单点 zip、死官网、空 README、无 license 文件)"的反差样本:论文口径与基准口径双轨数字、伪负采样自由度、同名缩写歧义,每一项都是自动化数据管线会踩的坑。它的档案价值在于提示:一个数据集的可获取性可以在作者不发声的情况下静默归零。
§2 数据构成与规格
2.1 数据模型:带证据指针的二部关联表
MDAD 的核心数据模型是一张三元组表加两层注释:
| 层 | 字段 | 说明 |
|---|---|---|
| 关联本体 | drug name | 药物名(与 DrugBank 条目对齐) |
| 关联本体 | microbe name | 微生物名(物种或菌株级) |
| 关联本体 | PubMed ID | 证据文献,超链 PubMed |
| 药物注释 | 分子式或 DrugBank 链接 | 分子形式标注 + 原库跳转 |
| 微生物注释 | strain | 菌株信息(824 株有具体标识) |
| 微生物注释 | microbe target | 药物作用靶点,蛋白或 RNA,挂 Uniprot 链接 |
这张表的图语义是二部图 G=(D∪M, E):D 是 1,388 个药物节点,M 是 180 个微生物节点,E 是 5,055 条验证连边。折叠成邻接矩阵 A 时,A[i,j]∈{0,1} 表示"药物 j 对微生物 i 存在验证关联"。矩阵高度稀疏(2,470 个 1 摊在 173×1,373≈23.7 万格上,密度约 1%),这是后续所有链接预测方法面临的共同结构。
2.2 规模与分布:论文口径全表
| 统计项 | 数值 | 备注 |
|---|---|---|
| 关联 entries | 5,055 | 含证据重复与菌株级拆分 |
| 药物 | 1,388 | 含经典抗菌药与非抗感染药 |
| 微生物 | 180 | 物种级口径(基准去冗后 173) |
| 菌株 | 824 | 仅计有具体菌株标识的记录 |
| 引用文献 | 993 | 时间跨度 1970s 至 2018 |
| 基准通行口径 | 2,470 关联 / 1,373 药物 / 173 微生物 | 后继论文去冗+物种折叠 |
药物侧头部集中度:环丙沙星(ciprofloxacin)以 64 条居首,培氟沙星 61、莫西沙星 46、氧氟沙星 45、依诺沙星 44、加替沙星 44——喹诺酮类几乎包揽头部,反映的既是其广谱抗菌性,也是文献研究量的偏置。值得注意的是 5-氟尿嘧啶(5-fluorouracil,43 条)入榜:它是广谱抗癌药而非抗生素,MDAD 明确把"非抗感染药对微生物的作用"纳入收藏范围,这使它区别于纯药物敏感性数据库。
微生物侧头部:金黄色葡萄球菌(S. aureus)662 条、铜绿假单胞菌(P. aeruginosa)653、流感嗜血杆菌(H. influenzae)588、大肠埃希菌(E. coli)480、白色念珠菌(C. albicans)289、变异链球菌(S. mutans)167。前四位是临床感染与耐药研究的常客,白色念珠菌代表真菌侧,变异链球菌代表口腔微生物组侧——覆盖面横跨人体多个生态位。
2.3 证据标准:什么叫"验证关联"
论文对收录关联的定义是"clinically or experimentally supported"——临床证据或实验证据支撑。操作上由两条管线汇入:
- 数据库导入线:TTD(Therapeutic Target Database)与 DrugBank 提供经策展的药物-微生物作用条目,直接映射为关联并继承其证据指针。
- 文献挖掘线:对数据库未覆盖的文献证据逐条人工收录,挂原始 PubMed ID。
每条入库记录再经历去重(合并同一药物-微生物对的重复证据为 entries 内的多证据或单条目)与注释富集(补分子式/链接/靶点)。论文未公开逐条证据的分级标签(如临床/体外/动物模型的层级标记)——关联"有多硬"要看所挂文献本身,这是引用 MDAD 时需要回溯一手证据的原因。
2.4 技术栈:一个 2018 年的 LAMP 变体
论文原载实现细节:MySQL 存数据,PHP 写查询逻辑,Apache2 做 Web 服务,跑在 Windows Server 2012 的 X86-64 服务器上;前端 HTML/CSS/JavaScript + jQuery + Bootstrap。提供三种使用通道——表格浏览(按药物/微生物浏览)、条目检索、数据下载。论文还自证了服务质量:Pingdom 性能评分 81,页面请求 15 个,加载 4.84 秒,库内查询响应小于 1 秒。
这套技术栈在 2018 年不算落后,但它把数据可用性锚定在一台校园服务器上——六年后服务器失联,三种通道只剩 GitHub 一条(§6.1)。对数据集工程者的启示直白:Web 服务不是数据发布,独立、可镜像的包才是。
2.5 与上游数据库的边界
MDAD 的增量贡献不是原始实验数据,而是跨源聚合 + 微生物视角的统一化:TTD/DrugBank 的主视角是药物与靶点,微生物-药物作用散落在适应症、药敏与文献条目中;MDAD 把"微生物"提为一等公民节点,统一了命名与注释结构,并补齐文献线索。因此引用规范上:数据事实引用 MDAD 论文(Sun et al. 2018),具体药物-靶点细节回溯 DrugBank/Uniprot 原始条目,上游条款随引用链继承。
2.6 规模对照:关联数据库赛道里的位置
| 数据库 | 年份 | 关联/记录规模 | 节点构成 | 定位差异 |
|---|---|---|---|---|
| MDAD | 2018 | 5,055 entries(基准 2,470) | 1,388 药物 × 180 微生物 | 微生物×药物,含菌株与靶点注释 |
| aBiofilm | 2018 | 2,884(去冗) | 1,720 药物 × 140 微生物 | 限定抗生物被膜(anti-biofilm)药物 |
| DrugVirus | 2020 | 933(GCNMDA 补充后) | 175 药物 × 95 病毒 | 限定人病毒与化合物开发状态 |
| DrugBank | 全库 | 数千药物条目 | 药物-靶点为主视角 | 上游源,微生物视角非一等公民 |
| TTD | 全库 | 治疗靶点视角 | 靶点-疾病-药物 | 上游源 |
三件套的分工清晰:MDAD 管"微生物×药物"主战场,aBiofilm 收窄到生物被膜场景,DrugVirus 换成病毒轴。三者合并后的异构图是 GCNMDA 一系方法的输入形态。
2.7 契约边界:MDAD 不承诺的三件事
把论文声明当作"数据集契约"来读,MDAD 承诺的只有那张字段表(§2.1);以下三件事常被使用者误当承诺,实际都不在契约内:
| 误当承诺的事 | 实际状态 | 后果 |
|---|---|---|
| 负样本 | 从未提供——库内只有正关联 | 一切负样本都是使用者的构造物(§7.2) |
| 持续更新 | 2018 年快照,无更新承诺与事实 | 新证据不会出现,管线要自带更新策略 |
| 证据分级 | 无字段区分临床/体外/动物模型 | "验证"只保证有证据,不保证证据同强 |
把契约边界写清楚的动机:对 MDAD 的多数误用(§7.5 四类)源于把"数据库"默认当成"有服务等级协议的数据服务"。它从来没有 SLA——2018 年的论文没有写,2018 年后的仓库也没有任何文本可以更新这个契约。
§3 构建流水线:6 个计算机科学家如何策展 5,055 条证据
3.1 团队与分工结构
MDAD 由两所学校的计算机科学团队完成:深圳大学计算机科学与技术学院四人(Ya-Zhou Sun、Shu-Bin Cai、Zhong Ming、Jian-Qiang Li)与中国矿业大学信息与控制工程学院两人(De-Hong Zhang、Xing Chen)。第一作者 Ya-Zhou Sun 即 GitHub 数据仓库账号(Sun-Yazhou)的持有者。这是一支纯计算机背景队伍做生物数据策展的典型案例——没有署名临床或微生物学合作者,其策展证据完全依赖数据库既有条目与文献原文,而非自行实验验证。
3.2 收录与去重流程
流水线四步:
- 源采集:从 TTD、DrugBank 拉取药物条目与其作用记录;系统检索相关文献。
- 证据过滤:仅保留有临床或实验证据支撑的药物-微生物作用主张——排除纯计算预测、纯综述转述(无一手实验)的条目。
- 去重合并:同一药物-微生物对的多来源证据合并(论文自述"after eliminating duplicate entries");跨源命名冲突对齐到 DrugBank 药物名与微生物学名。
- 注释富集:药物侧挂分子式或 DrugBank 链接;微生物侧挂菌株与靶点(Uniprot);每条记录锁定 PubMed 证据指针。
3.3 与后继"去冗"的关系:两个口径的分叉点
论文口径 5,055 entries 保留了两类冗余:同一药物-微生物对的多条证据记录,以及菌株级拆分(同一物种下不同菌株各占记录)。2019 年起,预测论文(以 GCNMDA 为代表)统一做两步后处理:
- 证据级去冗:按(药物, 微生物)对去重,5,055 entries → 数千对唯一关联;
- 物种级折叠:菌株归并为物种,173 物种 × 1,373 药物 → 2,470 关联。
GCNMDA 论文同时给出"去冗前 5,505 associations / 1,388 drugs / 174 microbes"的转述——注意 5,505 与论文原文 5,055 的易位冲突(坑 2),以及 174 与 180 的微生物数漂移(坑 2)。本条目所有基准语境数字一律采用"去冗后 2,470/1,373/173"三件套。
3.4 Web 服务架构(已逝部分)
站点按"浏览-检索-下载"三通道设计:Browse 菜单按药物或微生物列出条目并在右栏渲染关联列表;条目页通过内部链接把"某药对某菌的作用"与"该药对其他微生物的作用"串成可点击的网络——这本质上是把二部图导航做进了 UI;Download 通道提供整库导出。MySQL 后端 + PHP 查询 + Apache2 服务 + Bootstrap 前端,是标准的学院派 LAMP 变体(Windows 系底座)。
2018 年论文发表时这套服务运转正常;其后服务器下线。社区在 GitHub issue #1(2024-05-08)留下质询"为什么网站现在不再运行了?",至 2026-09-28 该 issue 仍 open 且无作者回应——数据集进入"仅包存活"状态。
3.5 策展方法论的局限
三条结构性局限,使用前须知:
- 无证据分级:临床证据与体外实验在库里同权,不提供"证据强度"字段;下游若需分层,必须回溯每条 PubMed 引用。
- 无阴性对照:库只收正关联。哪些"药物-微生物对"被检测过但无作用,无从得知——这使伪负采样成为协议层面的必选项而非可选项。
- 收录时点固化:2018 年后未更新。此后数年的新药敏数据、新机制研究(含微生物组药物学爆发期)均未纳入——把它当 2018 年快照用,别当活数据库用。
3.6 论文内数字的算术交叉验证
论文披露的头部计数允许几组廉价而有效的自洽检查(全部用已发表数字做算术,不引入新来源):
| 检查 | 计算 | 结论 |
|---|---|---|
| 密度自洽 | 2,470 / (173×1,373) ≈ 1.04% | 矩阵密度约 1%,与"高度稀疏二部图"的定性一致 |
| 头部药物占比 | 前 7 药合计 347 entries / 5,055 ≈ 6.9% | 头部集中但非赢者通吃,长尾存在 |
| 头部微生物占比 | 前 6 微生物合计 2,839 条 drug records / 5,055 ≈ 56% | 微生物侧头部集中度远高于药物侧 |
| 菌株覆盖 | 824 株 / 180 物种 ≈ 4.6 株/物种(上限口径) | 菌株信息是部分覆盖而非全查——物种折叠丢信息是有实据的 |
| 证据强度 | 5,055 entries / 2,470 关联 ≈ 2.05 | 平均每个唯一关联约两条证据记录(跨口径比值,仅作量级参考) |
两点解读:其一,微生物侧 56% 的头部集中度意味着伪负采样时"负对"主要落在长尾微生物上——分层采样(§7.2)因此不只是锦上添花;其二,"2.05 条证据/关联"是置信度代理的粗略上限估计,因为 5,055 含菌株级拆分而不仅是重复证据——精确值需逐条回溯(呼应坑 8 的信息损失)。
§4 双口径解剖:5,055、5,505、2,470 各是什么
4.1 三套数字的谱系树
文献中 MDAD 的规模数字至少有三种形态,各有出处:
| 数字组合 | 语义 | 出处 | 使用场景 |
|---|---|---|---|
| 5,055 / 1,388 / 180 | entries(含证据重复+菌株级) | 论文摘要与正文(PubMed 30581775 原文;Frontiers XML;AGRIS) | 引用数据库本身 |
| 5,505 / 1,388 / 174 | "验证关联"转述 | GCNMDA(Bioinformatics);bio-protocol 2024 写 5,505 配 180 | 方法论文的数据节 |
| 2,470 / 1,373 / 173 | 去冗+物种折叠邻接矩阵 | GCNMDA 起,Frontiers Mic 2024、BRMDA 2026、bio-protocol 2024 等一致沿用 | 关联预测实验 |
三套数字不是错误链而是语义链:5,055 是数据库快照;5,505 是转述漂移(疑似 5,055 的数字易位,bio-protocol 的 5,505×180 是漂移+混拼);2,470 是社区标准化的实验输入。写论文或建管线时的纪律:引用数据库规模用第一套,跑实验用第三套,任何场合不要写第二套。
4.2 entries 与 associations 的语义差
"5,055 entries"的 entry ≠“唯一关联对”。一个 entry 是一条带证据的记录;同一(药物, 微生物)对若有三篇文献支撑且涉及两个菌株,最多可展开为多条 entry。去冗到 associations 后,重复证据被合并、菌株被折叠到物种——信息损失两类:证据多源性(哪对关联证据更强)与菌株特异性(哪株敏感哪株耐药)。
对下游的具体影响:若你的任务需要"关联置信度",2,470 矩阵不携带,需要回 5,055 口径数证据条数;若你的任务涉及菌株差异(如同种不同株的药敏分化),矩阵完全不携带,只能回溯 PubMed 原文。
4.3 物种数漂移:180 → 174 → 173
三个物种数各有所指:
- 180:论文口径,入库微生物物种总数(另含 824 株菌株标识)。
- 174:GCNMDA 去冗后、构建矩阵前的可用物种数(部分物种在去重后无剩余关联)。
- 173:最终矩阵维数——比 174 再少一,源于特征/相似度构造阶段再剔除一物种(GCNMDA 未逐条说明该物种的去留细节,社区直接沿用 173 维矩阵)。
复现实验时以 173×1,373 矩阵为目标形态;引用数据库规模时以 180 为准。把 174 当中间产物记住即可,它在文献中出现频率最低。
4.4 折叠协议的社区惯例
从 5,055 到 2,470 的折叠没有官方脚本,社区实际操作按 GCNMDA 公开描述对齐:
- 去重到(药物, 微生物物种)对;
- 药物侧归一到 1,373(部分无结构信息或无相似度得分的药物被剔除);
- 微生物侧归一到 173;
- 相似度矩阵:药物用 SIMCOMP 结构相似性(后继工作常以高斯交互谱核替代或融合),微生物用 Kamneva 功能相似性(基于 STRING 基因家族网络)或高斯核;
- 评估用分层 5 折 CV,负样本伪采样 1:1。
注意第 2 步:2,470 < 论文 5,055 的主要来源不是去重而是药物/物种的可用性过滤——如果你的特征构造能覆盖更多药物,矩阵维数可以大于 1,373×173,此时你的结果与文献数字不可比。
4.5 一个速查表:读论文时的口径鉴别法
| 论文里写的是 | 它实际在说 | 你该怎么做 |
|---|---|---|
| “MDAD contains 5,055 entries…” | 引用数据库本体 | 正确引用,无需处理 |
| “5,505 associations” | 转述漂移(易位) | 核对后按 5,055 理解(坑 2) |
| “2,470 associations between 1,373 drugs and 173 microbes” | 基准实验口径 | 可与文献结果对标 |
| “1,388 drugs and 180 microbes” | 数据库节点规模 | 引用规模用 |
| 未写明口径只给 AUC | 无法判断 | 查其数据节或放弃横比 |
4.6 漂移的传播链:一个口径错误如何被合法化
口径漂移不是一次性笔误,而是沿引用链繁殖的。用已核实的三个节点画出传播路径:
| 传播站 | 它说了什么 | 漂移机制 | 下游后果 |
|---|---|---|---|
| 论文原文(2018) | 5,055 entries / 1,388 / 180 / 824 / 993 | 无(源头) | 三源一致,锚点 |
| GCNMDA(2022) | “5505 associations…174 microbes” + “2470…1373…173” | 5,055→5,505 易位;180→174 去冗语境混入 | 因其权威性,被后续论文整体继承 |
| bio-protocol(2024) | “5505 validated records…180 microorganisms” | 从两个来源各抄一半(漂移数+原文数混拼) | 协议类文章的可信度让漂移进入实验手册 |
| 后续方法论文 | “2,470…”(多数正确) | 有作者核对过原文则止跌 | 正确口径与漂移口径长期并存 |
三条防波堤,写论文时逐条自检:①数字只从一手源(PubMed 原文)抄,不从综述转引;②每个数字标注口径语义(entries 还是 associations);③见到 5,505/174 的组合,直接判定该文数据节未经核对,其协议描述也要加倍审读——口径漂移与方法学马虎高度相关。
§5 基准生态:MDAD 如何被用作预测考场
5.1 任务定义与输入形态
微生物-药物关联预测的标准形式化:给定邻接矩阵 A∈{0,1}^{173×1373}(1=验证关联),预测未观测对的关联概率。三种常见输入构造:
- 纯矩阵:只用 A 本身,靠矩阵补全/协同过滤类方法(NMF、模糊推理等)。
- 矩阵+相似度核:A 派生高斯交互谱(GIP)相似度,外部相似度用药物结构(SIMCOMP)与微生物功能(Kamneva/STRING、16S 序列等)——主流配置。
- 异构图:药物节点、微生物节点(可扩展疾病节点)+ 多类型边,图神经网络消息传递——GCNMDA(GCN+条件随机场)与 BRMDA(随机游走+集成学习,Frontiers Genetics 2026)代表此线。
5.2 评估协议:社区实际在跑什么
| 协议要素 | 社区惯例 | 官方背书 |
|---|---|---|
| 划分 | 分层 5 折交叉验证 | 无(MDAD 不提供任何官方划分) |
| 负样本 | 伪负采样:从未观测对均匀采 1:1 | 无(库内无负样本) |
| 鲁棒性组 | 负:正 = 3:1 / 5:1 / 10:1 | 无(BRMDA 2026 自设) |
| 指标 | AUC、AUPR、ACC、F1(阈值按训练折 PR 曲线定) | 无 |
| 特征 | GIP 核 + SIMCOMP + Kamneva/STRING | 无(各论文自选) |
| baseline | 相似度核方法、矩阵补全、GCN 系 | 无 |
"无官方"四连是理解这个基准的关键:MDAD 发布的是数据,不是评测服务。对比同级数据集(如 Kaggle 挑战赛有固定划分与 leaderboard),MDAD 上的一切可比性都是文献间的约定俗成——你复现的是某篇论文的协议,不是 MDAD 的协议。
5.3 代表结果与"伪负采样敏感性"
BRMDA(Frontiers Genetics 2026, doi:10.3389/fgene.2026.1757318)给出的负采样比例敏感性是现成的教科书数据:
| 负:正 | AUC | AUPR | F1 | ACC |
|---|---|---|---|---|
| 1:1 | 0.9857 | 0.9792 | 0.9569 | 0.9569 |
| 3:1 | 0.9881 | 0.9614 | 0.9273 | 0.9634 |
| 5:1 | 0.9895 | 0.9497 | 0.9024 | 0.9673 |
| 10:1 | 0.9904 | 0.9232 | 0.8765 | 0.9772 |
三个读数:
- AUC 几乎不动(0.9857→0.9904):排序能力对类别不平衡稳健——但这也意味着 AUC 对这个基准的区分度很低,各方法 AUC 挤在 0.95-0.99 区间,排名靠运气。
- AUPR/F1 显著衰减(0.9792→0.9232 / 0.9569→0.8765):不平衡暴露真实难度。比较方法时 AUPR 权重应高于 AUC。
- ACC 随负样本比例上升:1:1 下 ACC=F1(平衡点),10:1 下 ACC 虚高(多数类效应)——ACC 在此基准上几乎无信息量。
推论:读到"MDAD 上 AUC 0.99"先问三个问题——负:正比例多少?几折?种子几号?三者不同,数字不可比(坑 6)。
5.4 姊妹三件套:MDAD + aBiofilm + DrugVirus
GCNMDA(Bioinformatics,A*Star,2022)把三数据集并行评估固化为领域惯例:
| 数据集 | 去冗规模 | 特点 |
|---|---|---|
| MDAD | 2,470 关联 / 1,373 药物 / 173 微生物 | 主战场,细菌+真菌 |
| aBiofilm | 2,884 关联 / 1,720 药物 / 140 微生物 | 限定抗生物被膜活性 |
| DrugVirus | 933 关联 / 175 药物 / 95 病毒 | 限定人病毒(GCNMDA 手补 57 条临床/实验关联后) |
三件套的意义在于轴正交性:MDAD 覆盖经典抗菌+非抗感染药,aBiofilm 收窄到被膜场景(被膜是耐药与慢性感染的关键机制),DrugVirus 把微生物轴换成病毒。方法若在三套上同时稳健,才谈得上"学到了药物-微生物作用的通用模式"而非单一数据集的采样偏差。GCNMDA 论文对 aBiofilm 的原始口径另有描述(1720 unique anti-biofilm agents、140+ organisms),引用时注意其去冗前后数字同样存在双口径。
5.5 方法学谱系速览
以 MDAD(或三件套)为考场的代表方法线:
- 相似度核时代(2019-2021):高斯交互谱核 + SIMCOMP/Kamneva 特征拼接,配合正则化最小二乘、矩阵补全。
- 图神经网络时代(2022 起):GCNMDA(GCN+CRF 联合推断异构网络)确立 GNN 基线;此后各类注意力 GNN、图自编码器、对比学习陆续刷榜。
- 集成与随机游走时代(2024-2026):BRMDA(高斯核相似度矩阵 + 随机游走 + 集成)代表"回到轻量模型但在协议上更严谨"的反思线——其负采样敏感性实验本身就是对领域刷榜风气的修正。
三条线的共同起点都是那张 173×1373 的矩阵——MDAD 的基准地位不在规模(2,470 个正样本对深度学习而言极小),而在它是这个交叉领域唯一被广泛沿用的人类可读关联快照。
5.6 基准的陈旧性:2018 快照 vs 2026 现实
MDAD 固化于 2018 年,此后微生物组药物学快速发展:新的大规模药敏筛查(含数百株 × 数千药的体外高通量实验)、菌群-药物代谢组学、菌群失调与药物应答的队列证据,都未回灌。用 2026 年的方法刷 2018 年的 2,470 个正样本,存在系统性天花板:榜单饱和(AUC 0.98+)未必是方法强,更可能是数据小且易记。负采样敏感性实验(§5.3)部分缓解了这一担忧,但"新关联发现"类任务的评估仍需体外验证回环,纯计算榜单只宜作筛选工具。
5.7 跨领域对照:与药物-靶点预测基准的结构差异
把 MDAD 放到它最近的"表亲"——药物-靶点相互作用(DTI)基准——旁边,方法学的血缘一目了然:
| 维度 | 微生物-药物(MDAD) | 药物-靶点(DTI 库系) |
|---|---|---|
| 节点轴 | 药物 × 微生物物种 | 药物 × 蛋白靶点 |
| 正样本规模 | 2,470(去冗口径) | 数万至数十万 |
| 负样本惯例 | 伪负采样,全自定 | 伪负采样为主(部分库含实验阴性) |
| 药物侧相似度 | SIMCOMP / 指纹 | 同一套(SIMCOMP / 指纹) |
| 另一轴相似度 | Kamneva/STRING 功能相似性 | 蛋白序列相似性 |
| 官方划分 | 无 | 部分挑战赛有固定划分 |
| 榜单形态 | AUC 0.95-0.99 挤档 | 同样饱和 |
三条读数:
- 方法论整体平移:DTI 领域的"相似度核+伪负采样+分层 5 折 CV"模板被原样搬进微生物-药物任务,连 GIP 核的标签泄漏问题都是同款(§7.3)。读懂 DTI 方法学批判文献的人读 MDAD 榜单几乎无新知门槛。
- 规模差两个数量级:2,470 个正样本对深度学习而言极小,这是 BRMDA 一类轻量模型仍能上榜的结构性原因——不是轻量模型变强了,是数据没大到需要深度模型。
- 迁移成本极低:在 DTI 上验证过的方法改个输入矩阵就能上 MDAD 榜——这是该领域论文高产的结构性原因,也提示读者:方法移植类论文的新颖性要打折扣看。
库内 drugbank(rid 89/571)与 ttd(rid 409)条目可作 DTI 侧的对照阅读面。
§6 获取与许可:一条活路的门怎么进
6.1 四条通道的生死簿
| 通道 | 状态(2026-09-28 实测) | 说明 |
|---|---|---|
| 官网 chengroup.cumt.edu.cn/MDAD | 已失效 | curl 连接空回复(HTTP 000);issue #1 于 2024-05-08 报告失效;117 篇引用文献中的此链接均为死链 |
| GitHub Sun-Yazhou/MDAD | 存活,唯一通道 | MDAD.zip(≈3.2 MB,2018-10-29 上传)+ README(仅一行 “# MDAD”);4 commits;0 star/0 fork/1 open issue |
| HuggingFace | 无官方镜像 | hf-mirror API 检索 “MDAD” 与 “microbe-drug” 均空 |
| Zenodo | 无官方存档 | 检索命中的 Zenodo 7480334 是同名火星尘暴数据集(坑 1),与本条目无关 |
镜像社区实践:因官网死亡+仓库零维护,部分方法论文作者在其 GitHub 仓库内附带自己处理好的 2,470 口径矩阵(常以 Excel/CSV 形式)——使用时须核对 provenance,谨慎对待"二手矩阵"(其去重与折叠协议未必与 GCNMDA 完全一致)。
6.2 许可链:三层推定,无一层是现成的
MDAD 的许可状态是本条目最复杂的部分,逐层拆解:
- 论文层:CC BY 4.0(Crossref license 记录 + Frontiers 开放获取惯例)——这是论文文本的许可,理论上不自动覆盖数据包。
- 数据包层:GitHub 仓库无 LICENSE 文件(GitHub API license=null),README 空壳。数据包在版权法下的默认状态是"保留所有权利"——尽管作者显然无意于此。
- 上游层:数据事实来自 TTD、DrugBank 与文献。DrugBank 内容对学术用途免费、商业用途需授权;TTD 按其自身条款。再分发含 DrugBank 派生字段的 MDAD 全表,严格说需要核对上游条款。
实操建议:学术用途下,引用论文(CC BY 4.0)+ 注明数据源(TTD/DrugBank)+ 使用 GitHub 公开包,是社区通行且风险可控的做法;商业用途(尤其产品化再分发关联数据)建议先联系作者确认——尽管其 GitHub 与 issue 均无活跃迹象,邮件触达可能是唯一正式通道。
6.3 AI-Ready 评估:一个"高学术就绪、低工程就绪"的样本
按库内 AI-Ready 检查单逐项过:
- 机器可读元数据:论文开放获取(CC BY 4.0)+ GitHub 仓库(README 空壳)——论文侧良好,数据侧失分。无 dataset card、无字段字典、无版本号。
- 公开直链:GitHub raw 直链成立(MDAD.zip)——单点、无校验和、无版本管理是硬伤。
- 许可明确性:三层推定链(§6.2)——自动化管线无法从包内读出许可,必须人工裁决。
- 可复现性:数据包 + 论文描述可重建基准矩阵,但折叠协议(§4.4)无官方脚本,重建细节取决于实现者对论文转述的理解——社区内实际存在多个互不完全一致的"MDAD 矩阵"版本。
- 文档自洽:论文内部数字一致;漂移发生在转述链上(5,505、174 等,坑 2)——原文无错,二手文献有错,自动抓取须锚定一手源。
综合:AI-Ready 等级"中下"——学术可见性与引用体量远超均值,工程可获取性(单点、无版本、无许可文件、零维护)拖后腿。它是"数据库型"数据集可获取性衰减的完整标本:从三通道(浏览/检索/下载)到单通道(zip),衰减过程约六年,无任何官方公告。
6.4 与库内可获取性光谱的对照
| 档位 | 库内参照 | MDAD 对应 |
|---|---|---|
| 注册墙 | LMC2 型(注册+审批) | — |
| 请求制 | upon request 型条目 | — |
| 平台托管 | Zenodo 型(TopBrain) | — |
| Registry 收录 | AWS Registry 型 | — |
| 公开直链(多镜像/带版本) | HF/Zenodo 双发布型 | — |
| 公开直链(单点、无版本、无 license 文件) | — | MDAD(GitHub zip 独苗) |
| 死链 | 部分老条目的原始官网 | 原官网 |
MDAD 在光谱上独占"单点 zip"档:比请求制自由(无需作者参与即可下载),比多镜像直链脆弱(仓库一旦删除即全网消失)。对检索者的含义:抓取要趁早、留快照;依赖此数据的管线应把 zip 镜像进自己的对象存储并记录 sha256。
这张光谱还有一条纵向读法:档位越往下,"可获取"与"可信赖"的差距越大。请求制虽慢,但发放行为本身构成一份事实许可记录;多镜像直链虽散,但多副本互证给出完整性。单点 zip 两样都没有——自由下载与零背书同时成立,这正是 MDAD 档位的本质:获取最容易,背书最稀薄。
6.5 下载与校验实操
# 1) 下载(约 3.2 MB)
curl -L -o MDAD.zip "https://github.com/Sun-Yazhou/MDAD/raw/master/MDAD.zip"
# 2) 记录指纹(包无版本号,指纹即版本)
sha256sum MDAD.zip
# 3) 记录抓取时点与来源声明(供数据卡片引用)
# 来源: github.com/Sun-Yazhou/MDAD @ master (commit d12faf9, 2018-10-29)
# 官网 chengroup.cumt.edu.cn/MDAD 已失效,本包为唯一官方存活通道
# 4) 解包核对(论文口径应可复原 5,055 entries / 1,388 drugs / 180 microbes)
unzip MDAD.zip -d MDAD_pkg && find MDAD_pkg -type f | sort
三处提醒:直链在部分网络环境(含本库沙箱)被阻断,需走镜像或浏览器通道;包内结构论文未描述、本条目亦未验证(存照,勿臆断文件清单);commit d12faf9 是数据文件的上传 commit(“Add files via upload”),即事实上的 v1.0 终版。
6.6 给数据集托管者的三条反面教训
从 MDAD 的六年衰变史提炼,供所有准备发布数据集的团队对照自查:
- 包与站点解耦:MDAD 把三通道(浏览/检索/下载)绑在一台校园服务器上,服务器一死通道全灭。数据包应从第一天起托管在独立于作者机构的基础设施(Zenodo/figshare/HF,均可发 DOI),站点只是门面。
- 许可文件是元数据的原子组件:一个 LICENSE 文件的成本接近零,缺失的代价是每一代使用者都要重新推定一遍(§6.2 三层推定)。README 哪怕只写三行——数据是什么、许可是什么、引用什么——也比一行标题强一个量级。
- 衰变要发公告:官网 2024 年死得悄无声息,117 篇引用者无人知晓。一条 issue 回复或 README 置顶公告(“官网已弃用,数据在 GitHub”)就能把僵尸引用转化成有效引流。MDAD 的 issue #1 至今 open——那本可以是最便宜的维护动作。
§7 使用指南:把 MDAD 正确接进你的管线
7.1 五步标准工作流
从"拿到 zip"到"出第一行可对标的结果",社区通行的五步:
| 步 | 动作 | 关键决策点 | 本条目参照 |
|---|---|---|---|
| 1 | 获取与指纹 | 记录 sha256 与抓取时点(包无版本号,指纹即版本) | §6.5 |
| 2 | 解析与清洗 | 字段抽取、PubMed ID 校验、药物/微生物名归一(对齐 DrugBank 名与学名) | §2.1 |
| 3 | 折叠到基准口径 | 按社区惯例去冗+物种折叠到 2,470/1,373/173;或自定口径(则放弃与文献横比) | §4.4 |
| 4 | 特征与负采样 | 选特征菜单(§7.3)与负采样协议(§7.2);固定全部随机种子 | §5.2 |
| 5 | 评估与声明 | 分层 5 折 CV;报告时附协议声明块(§7.4 第 10-12 项) | §5.3 |
三处最常见的第一步就错:直接从方法论文附录抄"处理好的矩阵"而不核对 provenance(坑 7);折叠时忘了药物侧过滤(1,373 < 1,388 的原因,§4.4 第 2 步);解析时把菌株级记录当物种级直接去重导致物种数对不上 173。
7.2 负采样协议:这个基准上最重要的自由度
MDAD 只提供正样本,负样本完全由使用者构造——这是该基准上最大的协议自由度,也是所有数字分歧的第一来源。
三种主流负采样策略对照:
| 策略 | 做法 | 优点 | 风险 |
|---|---|---|---|
| 均匀随机(主流) | 从全部未观测对均匀采样,负:正常取 1:1 | 简单、可复现、社区默认 | 把"未观测"当"无作用",含潜在假负例 |
| 分层采样 | 按药物或微生物的度数分层抽负 | 缓解头部节点主导 | 与主流不可比,需明示 |
| 硬负例挖掘 | 优先采"结构相似但未关联"的对 | 更接近真实发现场景 | 大幅拉低指标绝对值,仅用于方法学对比 |
四条纪律:
- 主结果用 1:1 均匀随机——这是与 GCNMDA/SCSMDA/BRMDA 一脉对标的最低要求。
- 鲁棒性组报 3:1/5:1/10:1(BRMDA 协议)——只报 1:1 的论文在 2026 年审稿环境里已不够格。
- 种子全公开——伪负采样随机性意味着同协议不同种子也能差出小数点后两位,种子不公开则结果不可复核。
- 指标以 AUPR 为主、AUC 为辅——§5.3 已证 AUC 对负采样比例几乎免疫(0.9857→0.9904)而 AUPR 敏感(0.9792→0.9232),AUPR 才是这个基准上的区分度所在。
一个 1:1 的具体算术账(帮你在实现前心里有数):正样本 2,470 个 1 → 均匀采 2,470 个 0 → 全数据共 4,940 对 → 分层 5 折后每折测试集约 988 对(正负各约 494)。GIP 核必须在每折的训练折内重算——全量重算再切折是常见的泄漏实现错误。整轮五折 × 4 个负采样比例 × R 个种子,实验矩阵迅速膨胀:3 个种子起步就是 60 次训练,算力预算照此估。
7.3 特征构造菜单
| 轴 | 特征 | 构造方式 | 使用频率 |
|---|---|---|---|
| 药物-药物相似 | 高斯交互谱核(GIP) | 由邻接矩阵 A 自身派生:药物对在微生物轴上的关联向量过高斯核 | 几乎全员 |
| 药物-药物相似 | SIMCOMP 结构相似性 | 药物 2D 结构的图匹配相似度,GCNMDA 一脉标准配置 | 高 |
| 药物-药物相似 | 分子指纹(MACCS/ECFP) | RDKit 类工具自行计算,指纹余弦/Jaccard | 后继常用,替代 SIMCOMP(后者需ChemDB 授权) |
| 微生物-微生物相似 | Kamneva 功能相似性 | 基于 STRING 基因家族网络的功能相似度工具(Kamneva et al.) | GCNMDA 一脉标准 |
| 微生物-微生物相似 | GIP 核 | 同药物侧,微生物轴派生 | 几乎全员 |
| 微生物-微生物相似 | 16S rRNA 序列相似性 | 直接比对 16S 序列,系统发育近似 | 部分后继工作 |
| 混合 | 多核融合/注意力加权 | 把上述核拼接或学习加权 | GNN 时代常见 |
两条使用注意:其一,GIP 核由 A 自身派生,等于把标签信息泄进特征——这是该领域所有方法"集体高分"的技术根源之一,消融时务必报"无 GIP"组;其二,SIMCOMP 需要 ChemDB 授权账号,很多复现者实际用的是指纹替代,这又是一层未声明的协议分歧。
7.4 复现检查单(12 项)
在 MDAD 上跑实验并写论文前逐项自查:
- 数据包 sha256 与抓取日期已记录(包无版本号)。
- 明确声明使用口径:2,470/1,373/173(对标文献)或自建口径(放弃横比)。
- 折叠脚本与 GCNMDA 描述逐条对齐(§4.4 五步),药物过滤逻辑写明。
- 负采样策略、负:正比例、随机种子全部写明。
- 划分协议:分层 5 折 CV;测试折不参与任何特征构造(GIP 泄漏检查)。
- 指标:AUC + AUPR 必报;ACC/F1 附阈值确定方式。
- 鲁棒性组:至少补 10:1 一档(BRMDA 协议)。
- baseline:至少含一个相似度核方法(如 NMF/最小二乘)与 GCNMDA。
- 不与任何"SOTA"直接横比,除非逐条核对其负采样比例与种子。
- 结果表脚注声明:MDAD 无官方划分、无官方脚本,所有协议为本工作自设。
- 引用规范:数据库事实引 Sun et al. 2018(5,055 口径),实验口径另注 2,470。
- 报告局限段:2018 快照、仅正样本、物种级折叠损失(§3.5、坑 8)。
7.5 何时不该用 MDAD
四类需求请绕道,不要硬套:
- 菌株级药敏研究:物种折叠已丢弃 824 株细节(坑 8),需回溯 PubMed 原文或专门的药敏数据库。
- 需要作用方向与量效:MDAD 的记录字段是"药物×微生物×证据",无抑制/促进方向标签,无 MIC/剂量数值——量效关系研究请用原始实验文献。
- 需要 2018 年后的新证据:收录时点固化(§3.5 第 3 条),微生物组药物学 2018 后的大量高通量药敏筛查未回灌。
- 需要置信度分级的关联:临床证据与体外实验同权入库,无分级字段(§2.3);对关联强度敏感的任务须自行回溯每条 PubMed 引用。
7.6 三个进阶研究设计:MDAD 还能做什么
除了刷关联预测榜,MDAD 的数据形态支撑三类被低估的用法:
- 非抗感染药的微生物互作面:5-氟尿嘧啶(43 条)的入榜暗示库内有一批"非抗生素×微生物"关联。把这些抽出来按 ATC 分类切片,能直接得到"哪些临床常用药的微生物互作已有证据"的图景——药物重定位与不良反应机制研究(如药物对菌群的脱靶作用)的现成起点。论文口径保留的 entries 计数在这里比去冗口径更有用(同药多证据=证据强度代理)。
- 证据网络的文献计量:993 篇文献支撑 5,055 条 entries,金葡菌一家 662 条——按文献聚合可以回答"哪些论文贡献了最多关联证据"“证据的年代分布是否偏斜(1970s 老文献占比)”。这类计量结果既是综述素材,也是评估"证据新鲜度"的输入。
- 数据集生命周期案例:§8.7 的老化模型 + §6 的通道生死簿 + 附录 F 的口径漂移登记表,构成一个完整的"学术型数据集如何静默衰变"案例——适合数据集工程、科研基础设施、AI-Ready 评估方向的教学与研究引用。117 次引用与零维护的剪刀差是这个案例最有冲击力的一张图。
三类用法的共同点:都不需要跑预测模型,都需要 5,055 论文口径而非 2,470 去冗口径——再次印证"先选口径再动手"(§4.5)。
§8 生态与影响:一个"学术热、工程冷"的双面样本
8.1 引用画像:117 次引用的构成
Semantic Scholar 计 117 次引用(influential citations 8,抓取时点 2026-09-28)。构成上大致三堆:
- 方法论文(主体):GCNMDA(Bioinformatics,A*Star)、SCSMDA(Briefings in Bioinformatics 2023,doi:10.1093/bib/bbac634)、BRMDA(Frontiers Genetics 2026,doi:10.3389/fgene.2026.1757318)等关联预测方法——MDAD 是它们的"考场之一",通常与 aBiofilm、DrugVirus 并列出结果。
- 综述与立场文章:微生物组药物学(pharmacomicrobiomics)综述把它当"该领域有这样一个数据库"的注脚引用。
- 方法学协议:bio-protocol 2024 的实验方案把 MDAD 写成标准实验材料——这类引用把 2,470 口径进一步固化成"社区常识"。
一个反差细节:117 次引用中没有产生任何官方维护动作——4 commits 停在 2018-10-29,issue #1 无人回应。学术影响力与数据维护完全脱钩,这正是"引用数不能当数据健康度代理"的活例证。
三堆引用的代表作与各自引用 MDAD 的方式:
| 引用堆 | 代表作 | 它们引用 MDAD 的方式 | 对 MDAD 的实际依赖 |
|---|---|---|---|
| 方法论文 | GCNMDA(2022)/SCSMDA(2023)/BRMDA(2026) | 数据节引 2,470 口径 + 结果表列 MDAD 行 | 深——没有这张矩阵就没有实验 |
| 综述 | 微生物组药物学方向综述 | "已有数据库如 MDAD 收集了…"式提及 | 浅——注脚级 |
| 协议/教程 | bio-protocol 2024 | 把 MDAD 写成实验材料并给使用步骤 | 中——把口径漂移带进了实验手册 |
三堆引用的纵深不同,可维护性触点也不同:方法论文是最可能"顺手镜像数据"的群体(已有作者在自家仓库附矩阵,§6.1);综述引用再多也不产生维护压力;协议文章则会长期放大口径错误——可见漂移治理的最佳杠杆点在协议与方法两类文献的审稿环节。
8.2 方法谱系:三条时代线
| 时代 | 代表方法 | 技术特征 | 与 MDAD 的关系 |
|---|---|---|---|
| 核方法时代(2019-2021) | 高斯核+最小二乘、矩阵补全、NMF 系 | 相似度核拼接,浅模型 | 确立 GIP+SIMCOMP+Kamneva 特征惯例 |
| 图神经网络时代(2022 起) | GCNMDA(GCN+条件随机场,A*Star)、SCSMDA(自对比学习,2023) | 异构图消息传递、对比学习 | 把三件套并行评估固化为领域惯例;GCNMDA 同时固化 2,470 去冗口径 |
| 集成反思线(2024-2026) | BRMDA(随机游走+集成,2026) | 轻量模型+更严谨的协议 | 用负采样敏感性实验对刷榜风气纠偏 |
三条线的共同起点是那张 173×1,373 矩阵。方法迭代六年,考场没换过——这也意味着榜单饱和(AUC 0.98+)更多反映数据规模小(2,470 个正样本)而非方法进步。
8.3 衍生扩展:从 2,470 矩阵长出的异构全家桶
MDAD 的 2,470 关联矩阵在后继工作中被持续扩维成异构图输入。Deng et al. 2022 一系(BRMDA/GCNMDA 共用口径)在社区过滤后保留了这样一组衍生数字:
| 扩展轴 | 规模 | 说明 |
|---|---|---|
| 疾病 | 109 种 | 微生物-药物之外的第三类节点 |
| 微生物 | 73 种 | 异构子图口径(非 MDAD 全集) |
| 药物 | 233 种 | 异构子图口径 |
| 药物-疾病关联 | 1,121 条 | 外部数据库汇入 |
| 微生物-疾病关联 | 402 条 | 外部数据库汇入 |
| 微生物-微生物互作 | 138 条(123 微生物) | 外部数据库汇入 |
| 药物-药物关系 | 5,586 条(1,228 药物) | 外部数据库汇入 |
注意:这组数字不是 MDAD 本体的规模,是后继论文以 MDAD 为种子扩出来的异构工作集——引用时务必区分"MDAD 含 2,470 关联"与"某论文在 MDAD 基础上构造了含 5,586 药物-药物关系的异构图",混写会造成规模数字的又一重漂移(与坑 2 同机理)。
8.4 上游依赖图谱
| 依赖 | 用途 | 依赖方式 | 现状 |
|---|---|---|---|
| TTD | 药物-靶点/治疗条目导入 | 结构化导入,继承证据指针 | 持续维护中 |
| DrugBank | 药物条目、分子式、ID 对齐 | 结构化导入+链接锚定 | 学术免费、商用需授权 |
| Uniprot | 微生物靶点(蛋白/RNA)链接 | 注释富集 | 持续维护中 |
| PubMed | 逐条证据指针 | 993 篇文献引用 | 稳定 |
| STRING | 后继微生物功能相似性计算底座 | 间接(经 Kamneva 工具) | 持续维护中 |
| SIMCOMP/ChemDB | 药物结构相似性 | 后继特征构造 | 需授权账号 |
上游全部健在,唯独中间层(MDAD 自身)失修——这个"上游活、中游死"的形态意味着理论上可从 TTD/DrugBank/文献重建一个 2026 版 MDAD,但没人做:重建的策展成本远低于维护一个旧库的政治成本,这是文献策展型数据库的公共悲剧。
8.5 姊妹数据集可达性对照
| 数据集 | 团队 | 原官网 | 官网现状(本条目抓取时点) |
|---|---|---|---|
| MDAD | Sun et al. 2018(深大/矿大) | chengroup.cumt.edu.cn/MDAD | 已失效(2024-05 报告+实测双证) |
| aBiofilm | Rajput et al. 2018(IMTECH) | bioinfo.imtech.res.in/manojk/abiofilm | 未逐测(存照待核④) |
| DrugVirus | Andersen et al. 2020 | drugvirus.info | 未逐测(存照待核④) |
三件套里的每一个都是"论文+小网站+GitHub 补丁"的同款架构——MDAD 的今天(官网死、zip 独苗)很可能就是它们的明天。做领域综述或基准建设的团队,建议把三件套的 GitHub/Zenodo 镜像一次性做齐。
8.6 论文中的规范表述模板
引用 MDAD 时,三种语境的规范写法(可直接抄进你的论文):
- 引用数据库本体:“MDAD (Sun et al., 2018) is a manually curated database containing 5,055 clinically or experimentally supported microbe-drug associations, covering 1,388 drugs and 180 microbes (824 strains), with 993 references.”——全部数字取论文原文,一个都不要换。
- 描述实验口径:“We used the de-redundant version of MDAD commonly adopted since GCNMDA: 2,470 associations between 1,373 drugs and 173 microbes, represented as a binary adjacency matrix.”——并引 GCNMDA,附你的负采样协议。
- 声明局限:“MDAD is a 2018 snapshot containing only positive associations without evidence grading or strain-level resolution in its matrix form; negative samples were generated by [your protocol].”——这半句话在 2026 年的审稿环境里是加分项,不是示弱。
反面教材(都是真实文献里出现过的写法):“MDAD contains 5,505 associations”(坑 2 转述漂移);“downloaded from the official website”(坑 3 官网已死);“the CC-BY licensed dataset”(坑 4 许可推定,论文和数据包要分开说)。
8.7 数据集老化模型:MDAD 正处于哪一段
把 MDAD 放进一个通用的"数据集生命周期"框架,能给所有策展者一个可复用的诊断工具:
| 阶段 | 特征 | MDAD 对应时点 |
|---|---|---|
| 活跃期 | 内容更新、通道多样、作者响应 | 2018-10 至 2018-12(建仓-发文,仅数周) |
| 冻结期 | 内容停更但服务在线、作者仍在 | 约 2019-2024(引用增长期,官网仍活着的前半段) |
| 衰变期 | 服务组件开始死亡、无公告、引用照旧 | 约 2024 年中官网失效起(issue #1 无回应是标志性事件) |
| 失存期 | 最后一个通道消失 | 未至(GitHub zip 仍可达)——但离它只差一次仓库删除 |
MDAD 的特殊之处在于活跃期极短:仓库 2018-10-29 一天内完成全部 4 个 commits,此后八年无一行改动。它从出生起就是"静态包+展示页"架构,老化曲线从冻结期直接滑向衰变期。对基准使用者的推论:该数据集的"最后有效状态"就是 commit d12faf9,此后的一切变化只会更坏不会更好——镜像要趁早,这不是玩笑是排期建议。
§9 与库内条目的关系
9.1 家族图谱
MDAD 在库内的检索面由"上游源+方法底座+生态对照"三类条目构成:
| 库内条目 | rid | 与 MDAD 的关系 | 互链方向 |
|---|---|---|---|
| drugbank | 89(医数集)/ 571(病案医数集) | 上游数据源:MDAD 药物注释直接挂 DrugBank 链接,1,388 药物与其条目对齐 | MDAD→DrugBank(数据血缘) |
| ttd | 409(病案医数集) | 上游数据源:论文原文点名的结构化导入源 | MDAD→TTD(数据血缘) |
| string | 414(病案医数集) | 方法底座:GCNMDA 一脉微生物功能相似性的计算底座(Kamneva 工具基于 STRING 基因家族网络) | MDAD↔STRING(方法依赖) |
| drugcentral | 344 | 生态位对照:同为"文献策展+关联抽取"范式的药物知识库 | MDAD↔DrugCentral(范式对照) |
| chembl | 572(病案医数集)/ 85(医数集) | 生态位对照:药物发现侧最大策展化学库 | MDAD↔ChEMBL(范式对照) |
| drugcomb | 274 | 生态位对照:药物组合矩阵的策展范式 | MDAD↔DrugComb(范式对照) |
三句话定位:DrugBank/TTD 是 MDAD 的"爹"(数据来源),STRING 是它的"考官工具箱"(下游特征构造),DrugCentral/ChEMBL/DrugComb 是它的"同辈参照"(同为文献策展型,但视角在药物侧而非微生物侧)。库内目前没有第二个"微生物×药物"视角的条目——MDAD 补上的是这个生态位的空格。
9.2 检索路径建议
按研究意图给四条路径:
- 查药物-靶点原始细节:MDAD 条目 → drugbank(rid 89/571)与 ttd(rid 409)——MDAD 只给链接指针,细节在原库条目里。
- 复现关联预测方法:本条目 §5/§7 → string(rid 414,理解相似性底座)→ 附录 E 复现骨架。
- 对比文献策展范式:drugcentral(rid 344)、chembl(rid 572/85)、drugcomb(rid 274)——看同一范式在药物组合、活性计量上的工程化程度差异(它们都有版本化与 API,MDAD 没有)。
- 标签路径:本条目 category_tags(药物发现与化学/化学信息学/知识图谱/微生物组/评测基准)任一标签均可反查到 MDAD;与"基因组学与多组学-微生物组"标签下的条目形成跨域邻接。
9.3 本条目填补的库内空格
slug 查重时 url_name 含 mdad/biofilm/drugvirus/microbe 的记录均为 0 行(FACTS §1)——在本条目入库前,库内药物侧知识库(DrugBank/TTD/ChEMBL/DrugCentral/DrugComb)齐备,但"微生物×药物"视角完全缺位。MDAD 补上的具体是三个空格:
- 节点类型:库内现有条目的"生命体"节点以靶点(蛋白)为主,无微生物物种节点——MDAD 引入 180/173 个微生物节点及其 STRING 相似性语境。
- 任务类型:关联预测/链接预测基准在库内影像、病历、信号条目之外,新增"二部图链接预测"这一任务家族的代表。
- 风险形态:库内可获取性光谱上独占"公开直链(单点、无版本、无 license 文件)"档位(§6.4),为可持续性研究补一个关键样本点。
9.4 数据血缘声明
一图流:TTD(rid 409)+ DrugBank(rid 89/571)→ 结构化导入 → MDAD → 证据指针回指 PubMed → 下游方法(GCNMDA/SCSMDA/BRMDA)以 2,470 矩阵消费 → 微生物相似性计算回依 STRING(rid 414)。
两点提醒:其一,MDAD 对上游是快照关系——2018 年从 TTD/DrugBank 取的条目,今日原库已更新,MDAD 不追踪,所以"MDAD 里的 DrugBank 链接"≠“DrugBank 当前状态”,交叉引用时以原库现值为准;其二,MDAD 对下游是单向漏出——后继论文的衍生矩阵、扩展异构图均未回灌本体,库内引用时不要把 BRMDA 用的扩展数字(5,586 药-药等)写成 MDAD 的内容(§8.3)。
9.5 互链操作建议(给发布管线的可执行清单)
若由发布侧执行条目互链,建议按"关系类型+锚点词"落地:
| 目标条目(rid) | 关系类型 | 建议锚点词(出现在本条目正文的语境) |
|---|---|---|
| drugbank(89/571) | 上游数据源 | “上游数据源”“药物条目对齐”“DrugBank 链接”(§2.5、§9.1) |
| ttd(409) | 上游数据源 | “TTD 结构化导入”“证据指针继承”(§2.3、§3.2) |
| string(414) | 方法底座 | “Kamneva/STRING 功能相似性”“微生物相似度”(§5.2、§7.3) |
| drugcentral(344) | 范式对照 | “文献策展范式”“许可版本化对照”(§6.4、§9.1) |
| chembl(572/85) | 范式对照 | “策展化学库”“工程化程度对照”(§9.2) |
| drugcomb(274) | 范式对照 | “药物组合矩阵”“关联抽取范式”(§9.1) |
反向互链(目标条目指回本条目)建议挂在各条目的"下游/生态"小节,锚点词用"微生物-药物关联基准"“MDAD(2,470 口径)”——避免在 drugbank/ttd 条目里引入规模数字(那里的语境是原库自身,写 5,055 或 2,470 都会引起口径混乱)。
§10 避坑清单:八个已存照的坑
坑 1:MDAD 同名歧义 ×3,检索必串。缩写 MDAD 至少对应三个公开数据集:Microbe-Drug Association Database(本条目)、Mars Dust Activity Database(火星尘暴,Zenodo record 7480334,Battalio et al.)、Multiview and multimodal in-vehicle Driver Action Dataset(车载驾驶动作,Springer LNCS,doi:10.1007/978-3-030-29888-3_42)。检索必须加 microbe/drug 限定词;Zenodo 里搜"MDAD"命中的是火星数据集,别错挂。
坑 2:数字三口径漂移(5,055/5,505/2,470 与 180/174/173)。论文原文 5,055 entries(1,388 药物×180 微生物×824 菌株×993 文献,PubMed/Frontiers XML/AGRIS 三源一致);GCNMDA 转述成"5,505 associations…174 microbes"(疑似 5,055 易位传抄);bio-protocol 2024 更杂交出"5,505 records…180 microorganisms";去冗基准口径 2,470/1,373/173(GCNMDA 与 SCSMDA 双独立互证)。纪律:引规模用 5,055 系,跑实验用 2,470 系,5,505 系不要写。
坑 3:官网死链与"僵尸引用"。官网 chengroup.cumt.edu.cn/MDAD 自约 2024 年中失效(GitHub issue #1 于 2024-05-08 报告,至今 open 无回应;2026-09-28 curl 实测 Empty reply,HTTP 000——对照矿大主域 301 正常,系子域级失效)。论文与 117 篇引用文献中的官网链接全是死链。任何"从官网下载 MDAD"的教程都已过时。
坑 4:许可三层推定,"MDAD 是 CC BY 4.0"只对论文成立。GitHub 仓库无 LICENSE 文件(API license=null)、README 仅一行标题——数据包在版权法默认下"保留所有权利",尽管作者显然无意于此。学术使用通行做法:引论文(CC BY 4.0)+ 注明数据源(TTD/DrugBank 各自条款)+ 用公开包;商用再分发前先联系作者(邮件可能是唯一正式通道)。
坑 5:MDAD.zip 包内结构未经验证。沙箱网络策略阻断 GitHub 直链下载(raw.githubusercontent.com/codeload.github.com 均阻断,仅 WebFetch 可浏览页面),本条目未能解包确认内部是 SQL dump、CSV 还是整站打包——论文也未描述包结构。不得臆断文件清单;解包核对是使用前第一动作(§6.5 第 4 步)。仓库 size 3,263 KB,commit d12faf9(2018-10-29 “Add files via upload”)即事实上的 v1.0 终版。
坑 6:伪负采样自由度让 AUC 不可横比。MDAD 无官方划分、无负样本、无评估脚本、无 leaderboard。BRMDA 实测:负:正从 1:1 拉到 10:1,AUC 几乎不动(0.9857→0.9904)而 AUPR 掉 5.6 个百分点(0.9792→0.9232)。读到"MDAD 上 AUC 0.99"先问负:正比例、几折、种子几号——三者不同,数字不可比。
坑 7:二手矩阵 provenance 陷阱。因官网死亡+仓库零维护,部分方法论文作者在其仓库附带自己处理好的 2,470 矩阵(Excel/CSV 形态)——其去重与折叠协议未必与 GCNMDA 一致,特征覆盖差的论文矩阵维数甚至不是 173×1,373。用二手矩阵前核对 provenance,或从官方 zip 按附录 E 骨架自行折叠。
坑 8:物种级折叠丢失两类信息。从 5,055 entries 折到 2,470 关联损失:证据多源性(同一关联几篇文献支撑——置信度代理信息)与菌株特异性(824 株信息全部丢弃——同种不同株的药敏分化)。需要这两类信息时回 5,055 口径或 PubMed 原文,折叠矩阵里没有。
八坑的使用建议:坑 1-5 属"获取与引用层",发生在你碰数据之前,对策是引用纪律与存照意识;坑 6-8 属"实验与建模层",发生在你跑数字的过程中,对策是协议声明与口径自查。检索者按阶段对号入座即可,不必一次背全——附录 H 的档案表支持按坑号随查随用。
§11 总结
11.1 三句话总结
- MDAD 用 5,055 条带 PubMed 证据的关联把"药物×微生物"钉成二部图,是微生物组药物学关联预测默认三件套之首——学术上极成功(117 引),工程上极脆弱(官网已死、GitHub zip 独苗、无 LICENSE 文件、零维护八年)。
- 它的一切下游数字都带协议指纹:5,055(论文口径)与 2,470(去冗基准口径)并存,负采样比例能让 AUPR 差 5.6 个百分点——不带协议读的"SOTA"都是噪音。
- 它的档案价值是一面镜子:数据集可获取性可以在作者不发声的情况下静默归零,引用数不能当数据健康度的代理。
11.2 适合谁
- 关联预测/链接预测方法开发者:需要与 GCNMDA/SCSMDA/BRMDA 一脉对标的基准矩阵与协议考古。
- 微生物组药物学综述作者:需要一个规模、证据结构、生态位都可直接引用的权威快照。
- 数据集工程与 AI-Ready 研究者:一个"高学术就绪、低工程就绪"的完整标本,可获取性衰减六年全程有存照。
- 数据集策展者:想重建或扩展微生物-药物资源的人——上游(TTD/DrugBank/STRING)全活,重建窗口一直开着。
11.3 不适合谁
- 菌株级药敏或量效关系研究(无方向标签、无 MIC、菌株细节在折叠中丢失)。
- 需要 2018 年后新证据的项目(收录固化,无更新)。
- 需要现成负样本、官方划分或 leaderboard 的团队(一概没有,协议全自建)。
- 期望开箱即用文档与字段字典的工程团队(README 一行,许可须人工推定)。
11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 要跑关联预测并对标文献 | GitHub 下 MDAD.zip(§6.5)→ 按 §4.4 折叠 → 附录 E 骨架 → 协议按 §7.4 检查单 |
| 只想引用数据库规模 | 引 5,055 entries / 1,388 drugs / 180 microbes(Sun et al. 2018),别写 5,505(坑 2) |
| 要做菌株级/量效研究 | 别用 MDAD,回溯 993 篇原文(§7.5) |
| 要商用再分发 | 先过 §6.2 许可三层推定,邮件联系作者 |
| 要做数据集可持续性研究 | 本条目 §6/§8.5 + 附录 F 双口径登记表是现成案例 |
| 要找库内互链 | drugbank(rid 89/571)、ttd(rid 409)、string(rid 414)先行(§9.1) |
11.5 常见误用速查:错误写法与正确写法对照
| 场景 | 错误写法 | 正确写法 |
|---|---|---|
| 引规模 | “MDAD contains 5,505 associations” | “5,055 entries (Sun et al., 2018)” |
| 引规模(物种数) | “…between 1,388 drugs and 174 microbes” | “…1,388 drugs and 180 microbes” |
| 说许可 | “the CC-BY licensed dataset” | “the paper is CC BY 4.0; the data package carries no explicit license” |
| 说获取 | “downloaded from the official website” | “downloaded from the GitHub repository (official website discontinued)” |
| 报结果 | “We achieved SOTA AUC 0.99 on MDAD” | 附负:正比例/折数/种子/AUPR 的完整协议声明(附录 J) |
| 说版本 | “MDAD v2” | “the de-redundant version adopted since GCNMDA (2,470)” |
| 引用扩展 | “MDAD includes 5,586 drug-drug relationships” | “a downstream work built … on top of MDAD” |
| 说能力 | “MDAD provides strain-level susceptibility data” | “strain annotations (824) exist in the raw entries but are lost in the 173-species matrix” |
这张表可直接作为相关论文的审稿对照单——八行里有五行对应 §10 的坑点编号,剩余三行是 §4/§8.3 的口径纪律。
11.6 给三类读者的各一句话
- 给算法研究者:把 MDAD 当一道协议考古题而不是排行榜——你的贡献应在协议严谨性(负采样、泄漏控制、AUPR 报告)上,而非把 AUC 从 0.986 推到 0.988。
- 给数据集策展者:把 MDAD 当一份衰变标本——学的是"包与站点解耦、许可文件前置、衰变要公告"三条教训(§6.6),不是它的数据本身。
- 给临床与转化研究者:把 MDAD 当一张索引——每条关联的价值都在它挂的 PubMed 原文里,任何下游使用都应回溯一手证据后再做医学判断。
FAQ(高频问答 40 问)
A. 基础认知
Q1:MDAD 是数据库还是基准数据集?
两者都是,且身份随时间迁移:2018 年发布时是"网站+数据库"(浏览/检索/下载三通道);2019 年后官网角色萎缩,它的实际身份变成关联预测基准——以 2,470 去冗口径在方法论文中流通。今天说"用 MDAD",多数人指的是那张 173×1,373 矩阵。
Q2:名字 MDAD 展开是什么?
Microbe-Drug Association Database(微生物-药物关联数据库)。注意缩写歧义:它还是火星尘暴数据库(Mars Dust Activity Database)与车载驾驶员动作数据集(Multiview and multimodal in-vehicle Driver Action Dataset)之名——检索必加 microbe/drug 限定词(坑 1)。
Q3:谁做的?
六位计算机科学研究者:深圳大学计算机科学与技术学院四人(Ya-Zhou Sun 一作、Shu-Bin Cai、Zhong Ming、Jian-Qiang Li)+ 中国矿业大学信息与控制工程学院两人(De-Hong Zhang、Xing Chen)。GitHub 数据仓库账号 Sun-Yazhou 与一作同名。通讯作者未从已抓取一手源直接确认(存照 7)——PubMed/Crossref 页面无通讯星标,不虚构。
Q4:发表在哪里?
Frontiers in Cellular and Infection Microbiology 2018 Dec 7;8:424,doi:10.3389/fcimb.2018.00424,PMID 30581775,PMCID PMC6292923。开放获取,论文本体 CC BY 4.0。
Q5:"验证关联"的"验证"指什么?
论文原话 clinically or experimentally supported——有临床或实验证据支撑,每条挂 PubMed ID 指针。注意库内没有证据分级字段:临床证据与体外实验同权入库,"有多硬"要看所挂文献本身(§2.3)。
Q6:它只收抗生素吗?
不。喹诺酮类确实霸榜(环丙沙星 64 条居首),但 MDAD 明确把"非抗感染药对微生物的作用"纳入收藏——广谱抗癌药 5-氟尿嘧啶以 43 条入榜头部,这是它区别于纯药物敏感性数据库的关键设定。
Q7:微生物侧收什么?
细菌与真菌,物种级 180 种(另含 824 株菌株标识);不含病毒——病毒轴由姊妹库 DrugVirus 负责。头部是金葡菌(662 条)、铜绿假单胞菌(653)、流感嗜血杆菌(588)、大肠埃希菌(480)。
Q8:最大的卖点一句话?
把散落在 993 篇文献里的"哪种药对哪种微生物有作用"证据,钉成一张每条都可回溯原文、可直接折叠为邻接矩阵的二部图。
Q9:它自己有什么局限?
论文未自曝、但使用前必须知道的有五条:只收正样本(无负例)、无证据分级、2018 年后固化不更新、物种级折叠丢弃菌株细节、官网已死工程失修。§3.5 与 §7.5 逐条展开。
Q10:开源吗?
数据包公开(GitHub zip 直链,无需注册申请),但严格说不算"开源数据"——仓库无 LICENSE 文件,README 仅一行标题,许可要靠论文 CC BY 4.0 推定(坑 4)。站点代码(MySQL/PHP)按论文描述应打包在 zip 内,未验证。
B. 数据与获取
Q11:数据现在从哪下?
唯一存活通道:GitHub 仓库 Sun-Yazhou/MDAD 的 MDAD.zip(约 3.2 MB,2018-10-29 上传,commit d12faf9)。官网 chengroup.cumt.edu.cn/MDAD 已失效。
Q12:官网还能用吗?
不能。两层证据:2024-05-08 已有用户在 GitHub issue #1 公开报告"网站现在不再运行了"(至今 open 无回应);本条目 2026-09-28 curl 实测 Empty reply(HTTP 000),而矿大主域 301 正常——失效在子域/服务器层面,不是网络误判。
Q13:有镜像吗?
无官方镜像。HuggingFace(hf-mirror API 检索"MDAD"与"microbe-drug"均空)与 Zenodo 均无官方存档——Zenodo 搜"MDAD"命中的 7480334 是火星尘暴数据集,别错拿(坑 1)。部分方法论文作者的仓库里附有自行处理的 2,470 矩阵,属二手货,provenance 自核(坑 7)。
Q14:zip 里到底是什么?
未验证(存照 5)。沙箱网络策略阻断 GitHub 直链下载,本条目未能解包;论文也未描述包结构——预期形态是数据库导出(SQL dump 或扁平表,可能连带站点代码),但以解包实测为准,别按臆断写解析脚本。
Q15:怎么校验拿到的包?
包无版本号、无官方校验和——自己生成 sha256 并记录抓取时点与来源 commit(d12faf9,2018-10-29),指纹即版本(§6.5)。
Q16:能商用吗?
谨慎。三层许可推定(§6.2):论文 CC BY 4.0 只覆盖论文文本;数据包本身"保留所有权利"(默认状态);上游 TTD/DrugBank 各自条款仍可能约束(DrugBank 商用需授权)。商用再分发前建议邮件联系作者确认。
Q17:有版本更新吗?
没有。v1 单版本,4 个 commits 全部停在 2018-10-29。文献里的"2,470 关联版"是后继预测论文自行去冗过滤的产物,不是官方 v2——写成"MDAD v2"是错误(FACTS §2 版本链存照)。
Q18:下载被网络阻断怎么办?
部分网络环境(含本库沙箱)阻断 github 直链下载。可选路径:走代理/镜像通道或浏览器手动下载;下载后先 sha256 再解包。没有任何官方 CDN 或学术镜像可替代。
C. 口径与统计
Q19:"5,055"和"2,470"哪个对?
都对,语义不同。5,055 = 论文口径 entries(药物-微生物-证据记录,含重复证据与菌株级拆分);2,470 = 去冗+物种级折叠后的唯一关联数(1,373 药物 × 173 微生物),基准实验通行口径。引规模用前者,跑实验用后者(坑 2)。
Q20:"5,505"又是哪来的?
转述漂移。GCNMDA(Bioinformatics)把 5,055 转写成 5,505(疑似数字易位),bio-protocol 2024 更杂交出"5,505 records…180 microorganisms"(漂移+混拼)。论文原文三源(PubMed 摘要/Frontiers XML/AGRIS)一致是 5,055——5,505 不要写进你的论文。
Q21:180、174、173 三个微生物数怎么区分?
180 = 论文口径入库物种数;174 = GCNMDA 去冗后、建矩阵前的可用物种数(部分物种去重后无剩余关联);173 = 最终矩阵维数(特征构造阶段再剔除一个,GCNMDA 未逐条说明)。复现对齐 173,引规模用 180,174 当中间产物。
Q22:为什么药物从 1,388 掉到 1,373?
不是去重掉的——是特征/相似度构造阶段的可用性过滤(无结构信息或无相似度得分的药物被剔除)。这意味着如果你的特征能覆盖更多药物,矩阵可以大于 1,373 维,但结果就与文献不可比了(§4.4)。
Q23:头部药物和头部微生物是谁?
药物侧:环丙沙星 64、培氟沙星 61、莫西沙星 46、氧氟沙星 45、依诺沙星 44、加替沙星 44、5-氟尿嘧啶 43。微生物侧:金葡菌 662、铜绿假单胞菌 653、流感嗜血杆菌 588、大肠埃希菌 480、白色念珠菌 289、变异链球菌 167。
Q24:喹诺酮霸榜说明什么?
两层:喹诺酮确实广谱(对多种微生物有验证作用),但更主要是文献研究量偏置——研究得多的药,验证关联自然多。引用"环丙沙星 64 条"这类数字时,注意它是证据记录数而非药效强度排序。
Q25:993 篇文献覆盖到什么时候?
自 1970 年代起至 2018 年收录时点止。此后固化——微生物组药物学 2018 后的高通量药敏筛查、代谢组学与队列证据均未回灌(§8.2 榜单饱和的背景原因之一)。
D. 基准与协议
Q26:标准任务怎么定义?
给定 173×1,373 二值邻接矩阵 A(1 = 验证关联),预测未观测药物-微生物对的关联概率——二分类链接预测。三种输入形态:纯矩阵、矩阵+相似度核(主流)、异构图(GNN 系)。
Q27:官方评估协议是什么?
没有。无官方训练/测试划分、无负样本、无评估脚本、无 leaderboard——"无官方"四连。你复现的永远是某篇论文的协议,不是 MDAD 的协议(§5.2)。
Q28:负样本怎么造?
伪负采样:从未观测对均匀采样。主结果 1:1(社区默认),鲁棒性组补 3:1/5:1/10:1(BRMDA 协议)。采样比例是本基准最大协议自由度——AUPR 在 1:1 与 10:1 间差 5.6 个百分点(§5.3)。
Q29:现在 SOTA 是多少?
这个问题本身是坑。榜单饱和(各方法 AUC 挤在 0.95-0.99),且协议不统一不可横比。BRMDA(2026)1:1 下 AUC 0.9857/AUPR 0.9792 是近年可引的一组,但引用必须连同其负采样比例与划分协议一起引。
E. 生产与库内
Q30:GIP 核有什么问题?
高斯交互谱核由邻接矩阵自身派生,等于把标签信息泄进特征——这是该领域方法"集体高分"的技术根源之一。消融实验必须报"无 GIP"组,否则特征贡献说不清(§7.3)。
Q31:aBiofilm 和 DrugVirus 也有双口径问题吗?
有,同病。aBiofilm 的原始口径与 GCNMDA 转述口径有差(1,720 药物/140 微生物 vs 1720 unique anti-biofilm agents/140+ organisms);DrugVirus 原始 118 化合物/83 病毒,GCNMDA 手工补 57 条后成 933 关联/175 药物/95 病毒。三件套引用时都按"原始口径+使用口径"双轨记。
Q32:本条目与库内 drugbank/ttd/string 条目什么关系?
上游血缘:drugbank(rid 89/571)与 ttd(rid 409)是 MDAD 的数据来源,MDAD 药物注释直接挂它们;方法底座:string(rid 414)支撑下游微生物功能相似性计算;生态对照:drugcentral(344)/chembl(572/85)/drugcomb(274)是同范式不同视角的参照(§9.1)。
F. 数据集工程视角
Q33:官网死了为什么没人管?
结构性原因三连:作者团队无维护义务(论文发表即任务完成,学术激励不含"养库");GitHub 仓库零星与零 star 意味着社区信号为零,作者甚至不知道有多少人在用;117 次引用全是"引用即终点",没有一篇给作者发过维护请求的公开记录。这是学术数据集的激励结构问题,不是这六位作者的个人问题。
Q34:我能自己重建一个 2026 版 MDAD 吗?
技术上完全可行:上游 TTD/DrugBank/STRING 全部健在且活跃,文献检索管线论文已描述(§3.2)。成本在策展:993 篇文献的逐条人工核证是主要工作量,且"clinically or experimentally supported"的判断标准需要微生物学判断力——这正是 2018 年那支纯计算机团队也没有自己解决、只能依赖既有数据库条目的原因。如果你做了,记得给新版本一个独立 DOI 并与 2,470 口径做映射表。
Q35:为什么不直接用 DrugBank/TTD 重建,而要用 MDAD?
因为上游的主视角是药物-靶点,微生物-药物作用散落在适应症与药敏条目里,没有"微生物"一等公民节点(§2.5)。MDAD 的价值恰恰是那次视角统一化——重建的实质就是重做这次统一化。如果你的任务根本不涉及微生物轴,直接用上游库更好。
Q36:有现成的 2,470 矩阵可以直接下载吗?
官方没有——官方包只有原始 zip。GCNMDA/SCSMDA 等方法论文的补充材料或作者仓库常附带处理好的矩阵,但每家的去冗与过滤实现未必逐位一致(坑 7)。要用现成矩阵,先核对 provenance(矩阵维数是否 173×1,373、正样本数是否 2,470、出处 commit/说明是否在案),否则自己折叠(附录 E)更稳。
Q37:5,055 条关联里有后来被撤稿或争议的文献吗?
未逐条核查,无法给出数字(诚实存照)。MDAD 不追踪证据文献的后续状态——这是文献策展型数据库的通病:入库时点之后,撤稿、更正、结论修正都不会反映在库里。对证据强度敏感的任务,应抽查所引 PubMed 文献的当前状态(Retraction Watch/PubMed 评论)。
Q38:为什么下游方法用 STRING/Kamneva 而不直接用 16S 序列相似性?
历史路径依赖:GCNMDA(2022)选了 Kamneva(STRING 基因家族网络),后继为可比性沿用同配置。16S 相似性更直接反映系统发育距离,但换了特征就与既有榜单数字不可比(§7.3 的协议分歧问题再现)。两条路线在方法学上各有道理,报告时说清你用的是哪条即可。
Q39:GCNMDA 为什么要手工补 DrugVirus 57 条关联?
DrugVirus 原始口径只收 118 化合物/83 病毒,规模对深度学习方法太小;GCNMDA 补入 57 条临床/实验关联后成 933 关联/175 药物/95 病毒,让三件套规模大致可比。注意这 57 条是方法论文的手工增补,不是 DrugVirus 官方更新——引用 933 口径必须同时引用这个背景(Q31)。
Q40:如果哪天 GitHub 仓库也消失了怎么办?
那就进入失存期(§8.7),官方通道全灭,只剩:① 各方法论文补充材料里的二手矩阵;② Web Archive 对 GitHub 页面的历史快照(元数据可考,zip 下载未必可存);③ 引用它的论文的数据链接。本条目附录 D 的决策树与 §6.5 的自镜像建议(下载后 sha256 存自己的对象存储)就是为这一天准备的预案。
事实清单(硬事实 45 条)
- MDAD = Microbe-Drug Association Database,Sun et al. 2018,Front Cell Infect Microbiol 8:424。
- doi:10.3389/fcimb.2018.00424;PMID 30581775;PMCID PMC6292923;Crossref published-online 2018-12-07。
- 论文 license CC BY 4.0(Crossref license 记录 + Semantic Scholar openAccessPdf GOLD/CCBY 双证)。
- 作者 6 人:Ya-Zhou Sun、De-Hong Zhang、Shu-Bin Cai、Zhong Ming、Jian-Qiang Li、Xing Chen。
- 双机构:深圳大学计算机科学与技术学院(4 人)+ 中国矿业大学信息与控制工程学院(2 人)。
- GitHub 仓库 Sun-Yazhou/MDAD 创建于 2018-10-29(12:22:54Z),同日最后一次推送(12:40:29Z),共 4 commits。
- 仓库健康度(2026-09-28):0 star / 0 fork / 1 open issue / default branch master。
- 仓库 size 3,263 KB;MDAD.zip 2018-10-29 上传;README 仅一行 “# MDAD”;license 字段 null。
- commit d12faf9 为数据上传 commit(“Add files via upload”),事实上的 v1.0 终版。
- 论文口径:5,055 entries / 1,388 drugs / 180 microbes / 824 strains / 993 references(PubMed+Frontiers XML+AGRIS 三源一致)。
- GCNMDA 转述口径:“5505 associations…174 microbes”(疑似 5,055 易位漂移)。
- bio-protocol 2024 混合口径:“5505 validated records…180 microorganisms”。
- 去冗基准口径:2,470 associations / 1,373 drugs / 173 microbes——GCNMDA 与 SCSMDA(doi:10.1093/bib/bbac634)双独立互证。
- 物种数谱系:180(论文)→ 174(GCNMDA 去冗后)→ 173(最终矩阵维数)。
- 药物侧谱系:1,388(论文)→ 1,373(特征可用性过滤后)。
- Top 药物(entries 计):ciprofloxacin 64、pefloxacin 61、moxifloxacin 46、ofloxacin 45、enoxacin 44、gatifloxacin 44、5-fluorouracil 43。
- Top 微生物(drug records 计):S. aureus 662、P. aeruginosa 653、H. influenzae 588、E. coli 480、C. albicans 289、S. mutans 167。
- 记录字段:drug name / microbe name / PubMed ID / 分子式或 DrugBank 链接 / strain / microbe target(蛋白或 RNA,Uniprot 链接)。
- 上游源:TTD 与 DrugBank 结构化导入 + 文献挖掘两条管线汇入。
- 收录标准:clinically or experimentally supported(临床或实验证据支撑)。
- 无负样本、无证据分级字段、无官方划分、无评估脚本、无 leaderboard。
- 论文自载技术栈:MySQL+PHP+Apache2,Windows Server 2012,前端 jQuery/Bootstrap。
- 论文自载服务质量:Pingdom 性能评分 81,页面请求 15 个,加载 4.84 秒,查询响应 <1 秒。
- 官网 chengroup.cumt.edu.cn/MDAD 约 2024 年中失效:issue #1(2024-05-08,作者 a253324)公开报告,至今 open 无回应。
- 2026-09-28 实测:官网 curl Empty reply(HTTP 000,5s 超时);www.cumt.edu.cn 主域 301 正常——失效系子域层面。
- HuggingFace 无官方镜像(hf-mirror API 检索"MDAD"/"microbe-drug"均空);Zenodo 无官方存档(7480334 为同名火星数据集)。
- 缩写 MDAD 歧义 ×3:本条目、Mars Dust Activity Database(Zenodo 7480334,Battalio et al.)、Multiview and multimodal in-vehicle Driver Action Dataset(doi:10.1007/978-3-030-29888-3_42)。
- Semantic Scholar 引用 117 次(influential 8,抓取时点 2026-09-28);引用增长未带来任何仓库维护动作。
- 主任务:微生物-药物关联预测——A∈{0,1}^{173×1373} 上的二分类链接预测,分层 5 折 CV。
- 主流特征:GIP 高斯交互谱核(由 A 派生)+ SIMCOMP 药物结构相似性 + Kamneva/STRING 微生物功能相似性。
- BRMDA(Frontiers Genetics 2026, doi:10.3389/fgene.2026.1757318)1:1 结果:AUC 0.9857 / AUPR 0.9792 / F1 0.9569 / ACC 0.9569。
- BRMDA 10:1 结果:AUC 0.9904 / AUPR 0.9232 / F1 0.8765 / ACC 0.9772——AUC 对不平衡稳健、AUPR 衰减 5.6 pp。
- GCNMDA(Bioinformatics,A*Star):GCN+条件随机场,确立三数据集并行评估惯例。
- 姊妹库 aBiofilm(Rajput et al. 2018):去冗 2,884 associations / 1,720 drugs / 140 microbes。
- 姊妹库 DrugVirus(Andersen et al. 2020):原始 118 compounds / 83 human viruses;GCNMDA 手补 57 条后 933 associations / 175 drugs / 95 viruses。
- 衍生扩展(Deng et al. 2022 系,BRMDA/GCNMDA 共用):109 diseases / 73 microbes / 233 drugs / 1,121 药-病 / 402 微生物-病 / 138 微生物-微生物(123 微生物)/ 5,586 药-药(1,228 药物)。
- slug 查重:库内 url_name ILIKE ‘%mdad%’ 0 行;‘%biofilm%’/‘%drugvirus%’/‘%microbe%’ 亦 0 行——无撞库。
- 库内互链 rid:drugbank 89/571、ttd 409、string 414、drugcentral 344、chembl 572/85、drugcomb 274。
- MDAD.zip 包内结构未验证(沙箱阻断直链下载,仅 WebFetch 浏览)——不得虚构文件清单。
- 通讯作者未从一手源直接确认(PubMed/Crossref 无通讯星标);GitHub 仓库归属一作 Sun 无疑。
- 矩阵密度算术:2,470/(173×1,373) ≈ 1.04%——高度稀疏二部图的定量注脚。
- 头部集中度算术:前 6 微生物合计 2,839 条 drug records,占 5,055 entries 约 56%——微生物侧集中度远高于药物侧(前 7 药仅约 6.9%)。
- 证据比算术:5,055/2,470 ≈ 2.05——平均每个唯一关联约两条证据记录(跨口径比值,含菌株拆分影响,仅作量级参考)。
- 活跃期算术:仓库 2018-10-29 一天内完成全部 4 commits(12:22 建、12:40 终)——"数据集活跃期"仅数小时,此后八年零改动。
- 衰变时点不可考:官网确切失效日期无人知晓(issue 报告 2024-05-08 晚于实际死亡)——静默衰变使死亡日期本身成为不可考证项。
术语表(38 条)
| 术语 | 释义 |
|---|---|
| 微生物-药物关联(microbe-drug association) | 一种药物对一种微生物有(临床/实验验证的)作用的一条证据记录 |
| 二部图(bipartite graph) | 节点分两组(药物/微生物)、边只跨组的图;MDAD 的天然数学形态 |
| 邻接矩阵(adjacency matrix) | 二部图的矩阵表示,A[i,j]=1 表示药物 j 与微生物 i 存在关联 |
| 关联预测(association prediction) | 给定已知关联,预测未观测药物-微生物对的任务,本领域主任务 |
| 链接预测(link prediction) | 图学习通用任务名,关联预测是其二部图特例 |
| 伪负采样(pseudo-negative sampling) | 把未观测对当负样本的构造法;MDAD 无真负样本时的必选项 |
| 负:正比例 | 采样负样本数与正样本数之比;本基准最大协议自由度(1:1 常规) |
| GIP 核(Gaussian interaction profile kernel) | 由邻接矩阵自身派生的相似度核;便利但有标签泄漏嫌疑 |
| SIMCOMP | 药物 2D 结构图匹配相似度算法,GCNMDA 一脉标准特征;需 ChemDB 授权 |
| Kamneva 功能相似性 | 基于 STRING 基因家族网络的微生物功能相似度工具 |
| 16S rRNA 相似性 | 以 16S 序列比对近似微生物系统发育距离的特征法 |
| 分层 5 折交叉验证(stratified 5-fold CV) | 保持类别比例的五折划分协议,本基准社区默认 |
| AUC | ROC 曲线下面积;本基准上对负采样比例不敏感(区分度低) |
| AUPR | 精确率-召回率曲线下面积;不平衡场景下比 AUC 更有区分度 |
| 菌株(strain) | 物种内的具体分离株;MDAD 收 824 株标识,物种折叠后丢弃 |
| 物种级折叠 | 把菌株记录归并到物种的预处理;2,470 口径的构造步骤之一 |
| 去冗(deduplication) | 合并同一药物-微生物对的多条证据记录;5,055→2,470 的第一步 |
| entries vs associations | 论文记录数(含重复证据)与唯一关联对数两种计数的区分 |
| pharmacomicrobiomics | 微生物组药物学:研究微生物组如何改变药物应答的交叉学科 |
| 生物被膜(biofilm) | 微生物附着表面形成的膜状群落,耐药关键机制;姊妹库 aBioFilm 的主题 |
| TTD | Therapeutic Target Database,治疗靶点数据库,MDAD 上游源之一 |
| DrugBank | 药物条目与靶点数据库,MDAD 上游源之一,药物 ID 对齐锚 |
| Uniprot | 蛋白质序列与功能数据库,MDAD 微生物靶点链接指向处 |
| STRING | 蛋白-蛋白互作/基因家族网络数据库,下游微生物功能相似性底座 |
| GCN(图卷积网络) | 图神经网络基础算子,GCNMDA 的骨干 |
| 条件随机场(CRF) | 序列/结构化预测模型,GCNMDA 用于联合推断 |
| 随机游走(random walk) | 图上游走采样技术,BRMDA 组件之一 |
| 集成学习(ensemble learning) | 多模型融合策略,BRMDA 的方法标签 |
| 自对比学习(self-contrastive learning) | SCSMDA 的方法标签(Briefings in Bioinformatics 2023) |
| CC BY 4.0 | 署名 4.0 国际许可:自由使用/修改/再分发,仅需署名;MDAD 论文本体的许可 |
| LICENSE 缺失 | GitHub 仓库无许可文件的状态——版权默认"保留所有权利",MDAD 数据包即此状态 |
| sha256 指纹 | 文件哈希校验;MDAD.zip 无官方校验和,自算指纹充当版本标识 |
| provenance | 数据出处链;使用二手 MDAD 矩阵前必须核对的处理历史 |
| DAIMS | 可发现性/可获取性/可互操作/元数据/可持续性五维数据集评估框架(本库检查单) |
| 药物重定位(drug repurposing) | 为已上市药寻找新适应症的策略;MDAD 的非抗感染药关联是其微生物组视角的输入 |
| 长尾分布 | 头部少数节点占多数关联、多数节点仅零星关联的分布形态;负采样设计的考量项 |
| 数据集考古 | 对已停更数据集做版本、通道、许可与引用链的系统性复原工作;本条目 §6/§8/附录 S 即一例 |
| DOI | 数字对象唯一标识符;MDAD 论文有而数据包没有——可发现性断裂的典型位置 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | MDAD |
| url_name | mdad |
| 类型 | 数据库+基准数据集(二合一,含已失效 Web 服务) |
| 论文 | Front Cell Infect Microbiol 2018;8:424(doi:10.3389/fcimb.2018.00424) |
| 团队 | 深圳大学(Sun/Cai/Ming/Li)+ 中国矿业大学(Zhang/Chen) |
| 规模(论文口径) | 5,055 entries / 1,388 drugs / 180 microbes / 824 strains / 993 refs |
| 规模(基准口径) | 2,470 associations / 1,373 drugs / 173 microbes |
| 主任务 | 微生物-药物关联预测(173×1,373 二分类链接预测) |
| 获取 | GitHub Sun-Yazhou/MDAD(MDAD.zip ≈3.2 MB);官网已失效 |
| 许可 | 论文 CC BY 4.0;数据包无 LICENSE 文件(推定链见 §6.2) |
| 版本 | v1 单版本(2018-10-29,commit d12faf9),无更新 |
| 抓取时点 | 2026-09-28 |
| 库内互链 | drugbank(89/571)、ttd(409)、string(414)、drugcentral(344)、chembl(572/85)、drugcomb(274) |
| AI-Ready 评级 | 中下(4.8/10,附录 B) |
| 坑点 | 8 则(§10/附录 H),获取层 5 则+实验层 3 则 |
| 条目规模 | 40 问 FAQ / 45 条事实清单 / 38 条术语表 / 19 个附录 |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 7 | 论文开放获取+117 次引用可索引;但同名歧义 ×3 检索必串、无 dataset card |
| A 可获取性 | 4 | GitHub zip 公开直链是唯一通道;官网死、无镜像、无校验和、部分网络直连被阻断 |
| I 可互操作 | 5 | 记录携带 PubMed ID/DrugBank/Uniprot 标准标识符是加分项;但无字段字典、无 API、包内结构未验证 |
| M 元数据质量 | 6 | 论文对数据构造描述完备;README 空壳、转述链漂移严重(5,505/174 满天飞)拖分 |
| S 可持续性 | 2 | 八年零维护、官网死亡无公告、单点 zip、issue 无回应——本维最重失分 |
| 综合评级 | 4.8/10(中下) | 学术可见性远超均值,工程可获取性与可持续性双重拖底——"高学术就绪、低工程就绪"的典型标本 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置/方式 |
|---|---|---|
| 5,055/1,388/180/824/993 | 论文摘要原文 | PubMed 30581775 + Frontiers XML + AGRIS,三源一致 |
| CC BY 4.0(论文) | Crossref license 记录 | creativecommons.org/licenses/by/4.0/;Semantic Scholar GOLD/CCBY 佐证 |
| 2,470/1,373/173 | GCNMDA 数据节 | Bioinformatics 论文(A*Star OAR PDF) |
| 2,470 第二互证 | SCSMDA 数据节 | Briefings in Bioinformatics 2023,doi:10.1093/bib/bbac634 |
| 5505/174 转述 | GCNMDA 原文 | 与 2,470 同段出现(存照 1) |
| 5505×180 混合 | bio-protocol 2024 | 协议文章数据节(存照 1) |
| Top 药物/微生物计数 | 论文正文统计 | Frontiers 全文 |
| 824 strains 定义 | 论文原文 | "not counting microbes without strain info"语义 |
| MySQL/PHP/Apache2/Pingdom 81 | 论文 Web 服务节 | Frontiers 全文 |
| 官网失效 | issue #1 + curl 实测 | GitHub issue(2024-05-08)+ 2026-09-28 HTTP 000 |
| 矿大主域正常(对照) | curl 实测 | www.cumt.edu.cn 301,2026-09-28 |
| 仓库元数据 | GitHub API | created 2018-10-29 / 4 commits / 0 star / license null |
| README 一行 | GitHub 页面 | “# MDAD”(WebFetch 浏览) |
| 引用 117/影响 8 | Semantic Scholar | 2026-09-28 抓取(动态数,存照待核⑤) |
| BRMDA 四行指标 | BRMDA 论文表 | Frontiers Genetics 2026, fgene.2026.1757318 |
| aBiofilm 2,884/1,720/140 | GCNMDA 数据节 | Rajput et al. 2018 为原始出处 |
| DrugVirus 933/175/95 | GCNMDA 数据节 | 原始 118/83 + 手补 57 条 |
| 衍生扩展数字 | Deng et al. 2022 系 | 经 BRMDA/GCNMDA 转述一致 |
附录 D:数据获取决策树
需求是什么?
├── 只想引用数据库规模
│ └── 引 5,055 entries / 1,388 drugs / 180 microbes(Sun et al. 2018)——别写 5,505
├── 要跑关联预测实验
│ ├── 1) GitHub 下 MDAD.zip(sha256 留档)
│ ├── 2) 解包核对(第一动作,包内结构未验证)
│ ├── 3) 按 §4.4 折叠到 2,470/1,373/173
│ └── 4) 协议按附录 J 模板声明
├── 要菌株级/量效/方向性信息
│ └── 不用 MDAD——回溯 993 篇 PubMed 原文(§7.5)
├── 要商用再分发
│ └── 先过 §6.2 三层推定 + 邮件作者确认
└── 要做数据集可持续性案例研究
└── 本条目 §6 + 附录 F 双口径登记表 + 附录 B DAIMS 即案例素材
附录 E:折叠与复现骨架(示意代码)
以下 Python 骨架演示从扁平关联表到 2,470 基准矩阵的折叠流程。字段名是示意——MDAD.zip 包内真实结构未解包验证(存照 5),实际列名以解包为准,骨架的价值在流程而非字段。
# MDAD -> 基准口径折叠骨架(流程示意,字段名以实际解包为准)
import pandas as pd
import numpy as np
# 步骤 0:载入(假设解包后得到关联表,含药物名/微生物名/证据 PMID 列)
# 实际包可能是 SQL dump 或多表——先 find/inspect 再改此处
assoc = pd.read_csv("mdad_associations_flat.csv") # 示意文件名
# 期望原始量级:~5,055 entries(论文口径)
# 步骤 1:记录级清洗——统一命名(对齐 DrugBank 药物名与微生物学名)
assoc["drug"] = assoc["drug_name"].str.strip().str.lower()
assoc["microbe"] = assoc["microbe_name"].str.strip()
# 步骤 2:证据级去冗——按 (药物, 微生物) 对去重(保留证据计数作置信度代理)
dup = assoc.groupby(["drug", "microbe"]).size().rename("evidence_count")
pairs = assoc[["drug", "microbe"]].drop_duplicates().join(dup, on=["drug", "microbe"])
# 步骤 3:菌株->物种折叠(若解包数据含 strain 列,先归并到物种再去重)
# assoc["species"] = species_map[assoc["microbe"]] # 分类映射需自行构建
# 步骤 4:可用性过滤——无结构信息/无相似度得分的药物与无特征物种剔除
# 药物侧 1,388 -> 1,373;微生物侧 -> 173(GCNMDA 口径)
# 此步决定你的矩阵维数:过滤越少维数越大,但与文献不可比
drugs = sorted(pairs["drug"].unique()) # 期望过滤后 ~1,373
microbes = sorted(pairs["microbe"].unique()) # 期望过滤后 ~173
# 步骤 5:构建二值邻接矩阵 A (173 x 1373)
A = pd.crosstab(pairs["microbe"], pairs["drug"]).reindex(
index=microbes, columns=drugs, fill_value=0
).astype(int)
assert A.shape == (173, 1373) or print(
f"口径漂移警告: {A.shape}——与文献 2,470/173x1373 不一致, 检查步骤 2/4"
)
assert A.values.sum() == 2470 or print(
f"关联数漂移警告: {A.values.sum()}——检查去重与折叠粒度"
)
# 步骤 6:特征构造入口(GIP 核示意;SIMCOMP/Kamneva 需外部工具)
def gip_kernel(Y, gamma=1.0):
"""高斯交互谱核:由邻接矩阵自身派生(注意标签泄漏,消融需报无 GIP 组)"""
return np.exp(-gamma * np.square(Y @ Y.T) / Y.shape[1])
K_microbe = gip_kernel(A.values) # 微生物轴相似度
# K_drug: SIMCOMP 或指纹余弦(外部计算后载入)
# 步骤 7:伪负采样(1:1 主结果;种子必须固化并报告)
rng = np.random.default_rng(seed=2026) # 种子进协议声明
zeros = np.argwhere(A.values == 0)
neg_idx = rng.choice(len(zeros), size=int(A.values.sum()), replace=False)
negatives = zeros[neg_idx]
复现要点重申:步骤断言的两处 print 是给自建口径用户的口径漂移警告——保持 173×1,373/2,470 才能对 GCNMDA/SCSMDA/BRMDA 一脉出可对标数字;任何一步放宽(少过滤、多保留菌株)都要在论文里声明并放弃横比。
附录 F:三口径登记表
| 口径 | 关联/entries | 药物 | 微生物 | 菌株 | 文献 | 语义 | 使用场景 |
|---|---|---|---|---|---|---|---|
| 论文原文 | 5,055 | 1,388 | 180 | 824 | 993 | 数据库快照(含重复证据+菌株级) | 引用数据库本体 |
| GCNMDA 转述 | 5,505 | 1,388 | 174 | — | — | 转述漂移(疑似易位) | 不使用;仅存照 |
| bio-protocol 混合 | 5,505 | 1,388 | 180 | — | — | 漂移+混拼 | 不使用;仅存照 |
| 去冗基准 | 2,470 | 1,373 | 173 | — | — | 去冗+物种折叠邻接矩阵 | 关联预测实验、与文献对标 |
| 衍生扩展(Deng 2022 系) | 1,121 药-病 / 402 菌-病 / 138 菌-菌 / 5,586 药-药 | 233(异构子图) | 73(异构子图) | — | — | 异构工作集 | 异构图方法输入;非 MDAD 本体规模 |
附录 G:许可条款细读(三层+上游)
- 论文层(确定):CC BY 4.0——Crossref license 记录与 Semantic Scholar openAccessPdf(GOLD/CCBY)双证。覆盖:论文文本、图表。不自动覆盖:数据包。
- 数据包层(缺失):GitHub API license=null,仓库无 LICENSE 文件,README 仅一行标题。版权默认状态下数据包"保留所有权利"——但结合论文"数据可获得"声明与作者公开上传行为,合理推定作者无意主张限制性权利。此推定的强度:弱(无书面声明)。
- 上游层(继承):数据事实源于 TTD、DrugBank 与 993 篇文献。DrugBank:学术用途免费,商业用途需授权——MDAD 含 DrugBank 链接与条目对齐字段,商用再分发需评估;TTD:按其自身条款;文献事实:事实本身不受版权保护,但表达形式(如逐字摘要)受。
- 实操结论:学术使用=引论文+注数据源+用公开包,社区通行且风险可控;商用=先邮件作者(issue 已证 GitHub 无人值守,邮件是唯一正式通道),同时核上游条款。
附录 H:坑点档案(与 §10 对照)
| 坑 | 一句话 | 详述位置 | 存照证据 |
|---|---|---|---|
| 坑 1 | MDAD 同名歧义 ×3,检索必串 | §10 | FACTS §1;Zenodo 7480334;doi:10.1007/978-3-030-29888-3_42 |
| 坑 2 | 数字三口径漂移 | §4、§10 | FACTS §4/§9 存照 1-2 |
| 坑 3 | 官网死链与僵尸引用 | §6.1、§10 | issue #1(2024-05-08)+ curl HTTP 000(2026-09-28) |
| 坑 4 | 许可三层推定 | §6.2、§10 | GitHub API license=null |
| 坑 5 | zip 包内结构未验证 | §6.5、§10 | 沙箱阻断直链;FACTS §6 存照 5 |
| 坑 6 | 伪负采样致 AUC 不可横比 | §5.3、§10 | BRMDA 四档比例表(AUPR 0.9792→0.9232) |
| 坑 7 | 二手矩阵 provenance | §6.1、§10 | 社区实践观察;无官方脚本 |
| 坑 8 | 物种折叠丢证据强度与菌株细节 | §4.2、§10 | 824 株→173 物种的构造性损失 |
附录 I:检索决策树
你在找什么?
├── "MDAD" + 微生物/药物语境
│ └── 就是本条目:关键词组合 "MDAD" + (microbe OR drug OR association)
├── "MDAD" + 火星/尘暴
│ └── Mars Dust Activity Database(Zenodo 7480334)——与本条目无关
├── "MDAD" + 驾驶/驾驶员
│ └── in-vehicle Driver Action Dataset(doi:10.1007/978-3-030-29888-3_42)——无关
├── 数字核对
│ ├── 5,055/1,388/180/824/993 → 论文原文(PubMed 30581775)
│ └── 2,470/1,373/173 → GCNMDA 或 SCSMDA 数据节
└── 下载
└── GitHub Sun-Yazhou/MDAD(唯一通道)——官网链接均为死链,跳过
附录 J:负采样与协议声明模板
在 MDAD 上做实验的论文,方法节建议包含以下声明块(方括号处按实际填写):
数据与口径:我们使用 MDAD(Sun et al., 2018)的社区标准去冗口径:
2,470 条关联,构成 173 微生物 × 1,373 药物的二值邻接矩阵。
折叠流程遵循 GCNMDA 描述:证据级去重 + 物种级折叠 + 特征可用性过滤。
(若自建口径:我们保留 [N] 条关联 / [N] 药物 / [N] 微生物,
未做 [过滤项],故与文献数字不可直接比较。)
负采样:负样本由未观测对 [均匀随机|分层] 采样,负:正 = [1:1];
鲁棒性组:[3:1 / 5:1 / 10:1]。随机种子 = [种子号],全部实验同种子重跑 [R] 次
报告均值±方差。
划分:分层 [5] 折交叉验证;测试折未参与任何特征构造
(GIP 核在每折训练折内重算,防泄漏)。
指标:AUC 与 AUPR 为主指标;ACC/F1 的阈值由训练折 PR 曲线确定。
我们声明:MDAD 无官方划分、无官方评估脚本,本协议为本文自设;
与其他论文的数字比较仅在协议逐项一致时成立。
附录 K:引文规范(BibTeX)
论文本体(数据事实的正式引用源):
@article{sun2018mdad,
author = {Sun, Ya-Zhou and Zhang, De-Hong and Cai, Shu-Bin and
Ming, Zhong and Li, Jian-Qiang and Chen, Xing},
title = {{MDAD}: A Special Resource for Microbe-Drug Associations},
journal = {Frontiers in Cellular and Infection Microbiology},
volume = {8},
pages = {424},
year = {2018},
doi = {10.3389/fcimb.2018.00424},
note = {PMID: 30581775, PMCID: PMC6292923. Data: github.com/Sun-Yazhou/MDAD}
}
使用去冗口径做实验时,建议并引方法学源头:
@article{gcnmda2022,
author = {{GCNMDA authors (A*Star)}},
title = {{GCNMDA}: Graph convolutional network with conditional random field
for microbe-drug association prediction},
journal = {Bioinformatics},
year = {2022},
note = {2,470/1,373/173 去冗口径与三数据集并行评估协议的固化源头;
作者名单以原文献为准}
}
引用纪律:规模表述引 sun2018mdad(5,055 系);实验口径并引 GCNMDA(2,470 系);不要引用任何写有 5,505 的二手转述作为规模出处。
附录 L:姊妹三件套对照总表
| 维度 | MDAD | aBiofilm | DrugVirus |
|---|---|---|---|
| 年份/团队 | 2018,Sun et al.(深大/矿大) | 2018,Rajput et al.(IMTECH) | 2020,Andersen et al. |
| 主题 | 微生物×药物(广谱) | 抗生物被膜药物 | 抗病毒化合物 |
| 原始口径 | 5,055 entries(1,388 药/180 微物) | 1,720 agents / 140+ organisms | 118 compounds / 83 viruses |
| 去冗口径 | 2,470(1,373/173) | 2,884(1,720/140) | 933(175/95,含手补 57 条) |
| 官网 | chengroup.cumt.edu.cn/MDAD(死) | bioinfo.imtech.res.in/manojk/abiofilm(未逐测) | drugvirus.info(未逐测) |
| 原始论文 license | CC BY 4.0 | 开放获取(Frontiers 系) | 开放获取 |
| 在 GCNMDA 中的角色 | 主考场 | 第二考场 | 第三考场 |
| 共同风险 | 官网单点、零维护、无 dataset card | 同构架构,风险同型 | 同构架构,风险同型 |
三件套的"原始口径 vs 去冗口径"漂移是同构的——引用任何一个都要双轨记(Q31)。
附录 M:本条目生产档案
- 生产代理:agent-b-mdad(写手代理纪律包 v3);派发时间 2026-09-28T13:03:48。
- 租约锁:
writing/mdad/.lock=agent-b-mdad 2026-09-28T13:06:34+08:00。 - 成稿方式:五 part 直写拼接(part1-5,
/tmp/mdad_agent-b-mdad_part*.md唯一化前缀),接缝留空行。 - 研究通道:WebSearch + WebFetch(沙箱阻断 GitHub/curl 直连下载,官网实测用 curl,GitHub 元数据走 WebFetch/API 页面浏览)。
- 事实档案:
writing/mdad/FACTS.md(九节,双口径七存照+五待核)。 - slug 查重:
url_name ILIKE '%mdad%'0 行,无撞库。 - 抓取时点:统一 2026-09-28;引用数 117 为时点动态数。
附录 N:FAIR/AI-Ready 检查单
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 元数据有全局唯一标识 | 部分 | doi(论文)在;数据包无 DOI/无版本标识 |
| F2 数据有全局唯一标识 | 否 | zip 无 DOI;GitHub 仓库 URL 是唯一标识 |
| F3 元数据与数据同源可查 | 部分 | 论文描述在,但 README 空壳、无 dataset card |
| A1 元数据可检索 | 是 | PMC/Semantic Scholar/GitHub 均可索引(同名歧义扣分) |
| A2 数据可访问(协议明确) | 部分 | 直链成立但许可不明(license=null) |
| I1 数据用标准格式 | 待验 | 包内结构未解包确认;标识符(PubMed/Uniprot/DrugBank)标准化好 |
| I2 词汇表可引用 | 部分 | 药物/微生物名对齐 DrugBank/学名,但无字段字典 |
| R1 来源可溯 | 是 | 逐条 PubMed 证据指针——本数据集最强项 |
| R2 结构化 lineage | 部分 | 论文描述了流程,无脚本无版本 |
| R3 与社区标准对齐 | 部分 | 基准口径社区约定俗成,无官方协议 |
| AI-Ready 综合中下 | 4.8/10 | 附录 B DAIMS;可复现实验矩阵但工程环节数项缺失 |
附录 O:缩写速查
| 缩写 | 全称/释义 |
|---|---|
| MDAD | Microbe-Drug Association Database(本条目;另有火星尘暴库与驾驶动作库同名,坑 1) |
| GIP | Gaussian Interaction Profile kernel,高斯交互谱核 |
| SIMCOMP | 药物 2D 结构相似性算法(图匹配) |
| GCN | Graph Convolutional Network,图卷积网络 |
| CRF | Conditional Random Field,条件随机场 |
| GCNMDA | GCN+CRF 的微生物-药物关联预测方法(Bioinformatics,A*Star) |
| SCSMDA | 自对比学习系关联预测方法(Briefings in Bioinformatics 2023) |
| BRMDA | 随机游走+集成学习系方法(Frontiers Genetics 2026) |
| TTD | Therapeutic Target Database,治疗靶点数据库 |
| CV | Cross-Validation,交叉验证 |
| AUC / AUPR | ROC 曲线下面积 / 精确率-召回率曲线下面积 |
| IMTECH | 印度微生物技术研究所(aBiofilm 团队所在) |
| MDA 火星库 | Mars Dust Activity Database(同名异物) |
| DAIMS | 本库数据集五维评估框架(附录 B) |
附录 P:维护计划与触发点
本条目按以下触发点维护(按优先级):
- MDAD.zip 解包:任何用户成功解包后,包内文件清单、字段字典、记录级抽查应回填 §2 与坑 5、附录 E——这是当前最大的信息缺口。
- 仓库异动:GitHub 仓库若出现新 commit、LICENSE 文件或 issue 回应,§6 与坑 3/4 整体改写;若仓库被删除,本条目自动升级为"数据集失存"档案案例。
- 许可声明:作者若发布任何书面许可(LICENSE/README 补充),坑 4 与 §6.2 的推定链立即替换为事实。
- 姊妹库可达性:aBiofilm/DrugVirus 官网逐测后回填 §8.5 表(存照待核④)。
- 引用数漂移:Semantic Scholar 117 为动态数,年度复查即可,不追更。
- 上游重建动向:若社区出现 MDAD 重建/扩展版(TTD/DrugBank 2026 快照),在 §8.4 增补"后继重建"小节并互链。
附录 Q:基于本数据集的研究检查清单(12 项)
- 已解包 MDAD.zip 并核对包内结构与记录总数(对齐 5,055 或声明偏差)。
- 已确定口径(2,470 基准或自建)并在全文一致使用。
- 折叠脚本逐条对照 GCNMDA 描述(§4.4),药物过滤逻辑已写明。
- 负采样策略、比例、种子已固化并写入方法节(附录 J 模板)。
- GIP 泄漏已控制(测试折不参与核构造),消融含"无 GIP"组。
- 主指标 AUPR、辅指标 AUC;阈值确定方式已声明。
- 至少一组非 1:1 的鲁棒性结果(10:1)。
- baseline 含相似度核方法与 GCNMDA 至少各一。
- 未与协议不一致的"SOTA"横比;所有比较已逐项核对协议。
- 引用规范:规模引 Sun et al. 2018(5,055),实验口径并引 GCNMDA。
- 局限段已含:2018 快照、仅正样本、无证据分级、菌株折叠损失。
- 数据指纹(sha256+抓取时点+commit)已留档于研究记录。
附录 R:记录字段预期映射(示意,以解包实测为准)
论文声明字段与本条目预期的存储形态对照——此表是解包前的工作假设,不是对包内真实结构的陈述(存照 5):
| 论文声明字段 | 预期形态 | 解包时验证什么 |
|---|---|---|
| drug name | 文本列,与 DrugBank 名对齐 | 命名规范(大写/盐形) |
| microbe name | 文本列,物种或菌株名 | 学名拼写一致性、菌株列是否独立 |
| PubMed ID | 整数列或超链 | 是否一关联多 PMID(entries 语义的证据) |
| 分子式/DrugBank 链接 | 文本列 | 分子式空缺时是否以链接补位 |
| strain | 文本列或独立表 | 824 株的标识格式(ATCC 编号等) |
| microbe target | 文本列+Uniprot 链接 | 蛋白/RNA 如何区分 |
验证方法:解包后先 find 列文件清单,再对每个表跑 wc -l 与表头抽查,把实测清单回填本表与坑 5(触发点见附录 P 第 1 项)。
附录 S:MDAD 年表(2018-2026)
| 时点 | 事件 | 来源 |
|---|---|---|
| 2018-10-29 12:22 | GitHub 仓库 Sun-Yazhou/MDAD 创建 | GitHub API(FACTS §2) |
| 2018-10-29 12:40 | 最后一次推送(4 commits 全部完成,MDAD.zip 上传,d12faf9) | GitHub API |
| 2018-12-07 | 论文 online(Front Cell Infect Microbiol 8:424) | Crossref |
| 2019-2021 | 相似度核方法时代,MDAD 成为默认考场之一 | §8.2 方法谱系 |
| 2022 | GCNMDA(Bioinformatics,A*Star)固化 2,470 去冗口径与三件套并行评估 | GCNMDA 论文 |
| 2023 | SCSMDA(Briefings in Bioinformatics)独立复述同一口径——第二互证 | doi:10.1093/bib/bbac634 |
| ~2024 年中 | 官网 chengroup.cumt.edu.cn/MDAD 失效,无任何公告 | §6.1 存照 3 |
| 2024-05-08 | 用户在 GitHub issue #1 公开报告官网失效(至今 open 无回应) | GitHub issue |
| 2024 | bio-protocol 发表使用 MDAD 的实验方案(混合口径 5,505×180 入册) | bio-protocol 2024 |
| 2026 | BRMDA(Frontiers Genetics)给出负采样敏感性四档结果 | fgene.2026.1757318 |
| 2026-09-28 | 本条目核验:官网 HTTP 000;仓库 0 star/0 fork/license null;引用 117 | FACTS.md 全文 |
年表的两条骨架读法:数据本体在 2018-10-29 一天内定稿,此后八年唯一的"事件"都是外部世界对它的引用与遗忘;官网死亡(约 2024)与 issue 报告(2024-05)之间隔了不知道多久——没人能说出确切的死亡日期,这正是静默衰变的定义。
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-28,抓取与核验时点见附录 A。事实陈述以论文(Front Cell Infect Microbiol 2018;8:424)、GitHub API/页面实测、Semantic Scholar 与下游方法论文(GCNMDA/SCSMDA/BRMDA)为源;论文口径与基准口径的双轨数字、转述链漂移(5,505/174/180 混拼)、官网死亡与许可缺失等原始文档缺陷已在坑点与附录 F/H 存照。条目与库内 drugbank(rid 89/571)、ttd(rid 409)、string(rid 414)、drugcentral(rid 344)、chembl(rid 572/85)、drugcomb(rid 274)互链,构成"文献策展型药物知识库"家族中微生物视角的完整检索面。后续维护触发点见附录 P。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- pubchem-pcba — 共享标签:药物发现与化学 / 化学信息学 / 评测基准
- tdc — 共享标签:药物发现与化学 / 化学信息学 / 评测基准
- ttd — 共享标签:药物发现与化学 / 化学信息学 / 知识图谱
- chebi — 共享标签:药物发现与化学 / 化学信息学 / 知识图谱
- pcqm4mv2 — 共享标签:药物发现与化学 / 化学信息学 / 评测基准
- dgidb — 共享标签:药物发现与化学 / 化学信息学 / 知识图谱
- moleculenet — 共享标签:药物发现与化学 / 化学信息学 / 评测基准
- lit-pcba — 共享标签:药物发现与化学 / 化学信息学 / 评测基准
- plinder — 共享标签:药物发现与化学 / 化学信息学 / 评测基准
- iuphar-bps — 共享标签:药物发现与化学 / 化学信息学 / 知识图谱
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

