MDAD (mdad) — AI-Ready Wikipedia

微生物-药物关联数据库:5,055 条临床/实验验证的微生物-药物关联(1,388 药物 × 180 微物),深圳大学与中国矿业大学 2018 年构建,引用超百次的微生物组药物学基准,官网已失效、数据仅存 GitHub 单点

来源 TTD 与 DrugBank 等药物数据库 + 993 篇文献的临床/实验验证关联挖掘(1970s 起),逐条附 PubMed ID、药物分子式或 DrugBank 链接、微生物菌株与 Uniprot 靶点注释发布时间: 2026-09-28最后更新: 2026-09-28 阅读 14
MDAD (mdad) — AI-Ready Wikipedia

信息速览

数据集名称MDAD (mdad) — AI-Ready Wikipedia
数据类型5,055 条验证关联,1,388 种药物,180 种微生物,824 株菌株,993 篇文献来源,GitHub 直链下载
规模不涉及患者(非临床影像/病历数据集;为文献策展的微生物-药物关联对,1,388 药物 × 180 微生物物种层面的关联对集合)
接入方式TTD 与 DrugBank 等药物数据库 + 993 篇文献的临床/实验验证关联挖掘(1970s 起),逐条附 PubMed ID、药物分子式或 DrugBank 链接、微生物菌株与 Uniprot 靶点注释
AI 就绪度

INFOBOX — MDAD 一屏速览

维度 内容
本质 微生物-药物关联数据库(文献策展型二部图),非影像、非测序原始数据
团队 深圳大学计算机学院(Sun/Cai/Ming/Li)+ 中国矿业大学信控学院(Zhang/Chen),6 作者
论文 Front Cell Infect Microbiol. 2018 Dec 7;8:424(doi:10.3389/fcimb.2018.00424;PMID 30581775)
规模(论文口径) 5,055 entries = 1,388 药物 × 180 微生物,含 824 菌株、993 篇文献(1970s 起)
规模(基准通行) 去冗 2,470 关联 = 1,373 药物 × 173 微生物(后继预测论文的事实标准)
证据结构 每条关联 = 药物 + 微生物 + PubMed ID;附分子式/DrugBank 链接 + Uniprot 靶点
Top 关联 环丙沙星 64 条;金黄色葡萄球菌 662 条(药物侧/微生物侧之最)
主任务 微生物-药物关联预测:173×1373 邻接矩阵上的二分类链接预测,5 折 CV,AUC/AUPR
姊妹基准 aBiofilm(2,884 关联)+ DrugVirus(933 关联)——三件套是领域论文标配
获取 官网已失效(2024 年中起);GitHub Sun-Yazhou/MDAD(MDAD.zip ≈3.2 MB)唯一存活通道
许可 论文 CC BY 4.0|数据包无 LICENSE 文件(许可须回溯论文+TTD/DrugBank 条款推定)
引用 Semantic Scholar 117 次(8 次高影响力,2026-09-28 抓取)
库内互链 DrugBank(上游源)、TTD(上游源)、STRING(相似性计算底座)、ChEMBL/DrugCentral(生态对照)

MDAD 是一个"把 993 篇论文里散落的微生物-药物作用证据钉进一张二部图"的数据库工程:6 位计算机科学研究者从 TTD、DrugBank 等数据库与文献中筛出 5,055 条有临床或实验证据支撑的"哪种药对哪种微生物有作用"关联,每条都挂着 PubMed 引用、分子式和 Uniprot 靶点。它发布于 2018 年,此后成为微生物组药物学(pharmacomicrobiomics)方向关联预测任务的默认基准之一——但它的官网已在 2024 年前后静默下线,如今整个数据集只剩 GitHub 上一个 3.2 MB 的 zip 包孤悬。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——官网已死,唯一通道是 GitHub 仓库的 MDAD.zip,且数据包没有 LICENSE 文件,许可问题先读 §6.2。
  2. 要做关联预测:直奔 §5 基准生态——先弄清 5,055/2,470 两个口径(§4),再决定你的负采样协议,别直接横比别人的 AUC。
  3. 检索被同名干扰:直奔坑 1——MDAD 还是火星尘暴数据库和驾驶员动作数据集的名字,检索词必须带 microbe/drug 限定。

§0 导读:这个数据集解决什么问题

人体微生物组与药物的相互作用远比"抗生素杀菌"复杂:抗生素扰乱菌群可能导致二重感染与耐药,非抗感染药(如 5-氟尿嘧啶)也能显著抑制特定菌株,而某些微生物反过来修饰药物代谢。要系统性研究这些关系,第一步是把散落在文献与数据库里的"药物 X 对微生物 Y 有作用"证据收拢成结构化数据——这正是 MDAD 的出发点:做一个"clinically or experimentally supported associations between microbes and drugs"的集中资源。

MDAD 的回答分三层。第一层是数据:5,055 条验证关联覆盖 1,388 种药物、180 种微生物(含 824 株菌株),证据来自 TTD、DrugBank 等数据库加 993 篇原始文献,每条关联携带药物名、微生物名、PubMed ID 三要素,再附分子式或 DrugBank 链接(药物侧)与菌株、Uniprot 靶点(微生物侧)。第二层是结构:这些关联天然构成一张二部图——药物节点与微生物节点之间的连边——可以直接折叠为 180×1388 的邻接矩阵,供链接预测算法消费。第三层是社区惯例:2019 年起,预测论文统一采用"去冗 + 物种级折叠"口径(2,470 关联 / 1,373 药物 / 173 微生物),加上姊妹数据集 aBiofilm 与 DrugVirus,构成该领域三件套基准。

§0 读法三则:

  1. 这个条目是"数据库+基准+已失效的 Web 服务"三合一:数据本体活在 GitHub zip 里,网站已是历史,而 117 篇引用文献中的官网链接全部是死链——引用与抓取策略必须按此现实设计(§6)。
  2. 全文的规模数字按口径分轨:论文口径 5,055/1,388/180(entries 语义)与基准口径 2,470/1,373/173(去冗邻接矩阵语义)并存,转换规则在 §4 逐条拆解。
  3. "MDAD 上 AUC 0.98+"这类数字要带协议读:无官方划分、伪负采样自定,1:1 与 10:1 负正比下 AUPR 可差 5 个百分点以上(§5.3)。

§1 数据集速览:十问十答

Q1:MDAD 里到底存了什么?
一句话:三元组证据库。每条记录 = 一种药物 × 一种微生物 × 一篇 PubMed 文献(或数据库来源),表述"该药对该微生物有(抑制/杀灭等)作用"。此外药物侧附分子式或 DrugBank 链接,微生物侧附菌株与 Uniprot 靶点(蛋白或 RNA)。它不是基因表达矩阵,不是影像,也不是病历——是一张带文献指针的二部关联表。

Q2:"5,055"和"2,470"哪个是对的?
都对,语义不同。5,055 是论文口径的 entries(药物-微生物-证据记录,保留重复证据与菌株级细节);2,470 是后继预测论文去冗+物种级折叠后的关联数(1,373 药物 × 173 微生物)。做矩阵类任务直接用 2,470 口径,引用数据库规模时用论文口径并注明(坑 2)。

Q3:数据从哪来?
两条管线:结构化数据库导入(TTD、DrugBank——拿药物-靶点与药物条目信息)+ 文献挖掘(993 篇,从 1970 年代跨度到 2018 年),仅保留有临床或实验证据支撑的关联,去重后入库。

Q4:微生物侧是什么粒度?
论文口径保留到菌株(824 株,不含未指定菌株的微生物),但物种级是主流使用粒度(180 种;去冗后 173 种)。做物种级矩阵时菌株细节被丢弃——想做菌株特异性药敏研究得回溯原始记录(坑 8)。

Q5:谁在用、用来做什么?
关联预测(microbe-drug association prediction):给定邻接矩阵,预测未观测的药物-微生物连边。方法谱系从矩阵补全、相似度核方法(高斯交互谱核 + SIMCOMP 药物结构相似性 + STRING 基微生物功能相似性)一路到图卷积网络(GCNMDA)与集成模型(BRMDA)。Semantic Scholar 计 117 次引用(2026-09-28 抓取)。

Q6:有没有官方的评估协议?
没有。MDAD 只给正样本:无官方训练/测试划分、无负样本、无评估脚本、无 leaderboard。社区惯例是分层 5 折交叉验证 + 伪负采样(1:1 常规),但采样比例、种子、特征构造全由各论文自定——这是所有"SOTA"数字需要带协议读的原因(§5.3)。

Q7:数据现在从哪下?
官网 chengroup.cumt.edu.cn/MDAD 已失效(2024 年 5 月已有用户在 GitHub issue 报告,2026-09-28 实测连接被空回复)。唯一存活通道是 GitHub 仓库 Sun-Yazhou/MDAD 里的 MDAD.zip(约 3.2 MB,2018-10-29 上传)。HuggingFace 与 Zenodo 无官方镜像。

Q8:数据包可以直接商用吗?
谨慎。论文本身 CC BY 4.0 开放获取,但数据包所在仓库没有 LICENSE 文件,README 只有标题一行。许可链需要人工推定:论文声明 → 数据事实来源于 TTD/DrugBank 与文献 → 上游数据库各自条款仍可能约束再分发。商用前建议完成 §6.2 的许可链核对。

Q9:它和 aBiofilm、DrugVirus 什么关系?
姊妹三件套。aBiofilm(2018)收抗生物被膜药物(去冗 2,884 关联 / 1,720 药物 / 140 微生物),DrugVirus(2020)收抗病毒化合物(118 化合物 / 83 病毒)。三者在 GCNMDA(2022)之后成为预测论文的标配评估组合,经常出现在同一张结果表里(§5.4)。

Q10:为什么它对 AI-Ready 重要?
它是"学术上极成功(117 引)、工程上极脆弱(单点 zip、死官网、空 README、无 license 文件)"的反差样本:论文口径与基准口径双轨数字、伪负采样自由度、同名缩写歧义,每一项都是自动化数据管线会踩的坑。它的档案价值在于提示:一个数据集的可获取性可以在作者不发声的情况下静默归零。

§2 数据构成与规格

2.1 数据模型:带证据指针的二部关联表

MDAD 的核心数据模型是一张三元组表加两层注释:

层 字段 说明
关联本体 drug name 药物名(与 DrugBank 条目对齐)
关联本体 microbe name 微生物名(物种或菌株级)
关联本体 PubMed ID 证据文献,超链 PubMed
药物注释 分子式或 DrugBank 链接 分子形式标注 + 原库跳转
微生物注释 strain 菌株信息(824 株有具体标识)
微生物注释 microbe target 药物作用靶点,蛋白或 RNA,挂 Uniprot 链接

这张表的图语义是二部图 G=(D∪M, E):D 是 1,388 个药物节点,M 是 180 个微生物节点,E 是 5,055 条验证连边。折叠成邻接矩阵 A 时,A[i,j]∈{0,1} 表示"药物 j 对微生物 i 存在验证关联"。矩阵高度稀疏(2,470 个 1 摊在 173×1,373≈23.7 万格上,密度约 1%),这是后续所有链接预测方法面临的共同结构。

2.2 规模与分布:论文口径全表

统计项 数值 备注
关联 entries 5,055 含证据重复与菌株级拆分
药物 1,388 含经典抗菌药与非抗感染药
微生物 180 物种级口径(基准去冗后 173)
菌株 824 仅计有具体菌株标识的记录
引用文献 993 时间跨度 1970s 至 2018
基准通行口径 2,470 关联 / 1,373 药物 / 173 微生物 后继论文去冗+物种折叠

药物侧头部集中度:环丙沙星(ciprofloxacin)以 64 条居首,培氟沙星 61、莫西沙星 46、氧氟沙星 45、依诺沙星 44、加替沙星 44——喹诺酮类几乎包揽头部,反映的既是其广谱抗菌性,也是文献研究量的偏置。值得注意的是 5-氟尿嘧啶(5-fluorouracil,43 条)入榜:它是广谱抗癌药而非抗生素,MDAD 明确把"非抗感染药对微生物的作用"纳入收藏范围,这使它区别于纯药物敏感性数据库。

微生物侧头部:金黄色葡萄球菌(S. aureus)662 条、铜绿假单胞菌(P. aeruginosa)653、流感嗜血杆菌(H. influenzae)588、大肠埃希菌(E. coli)480、白色念珠菌(C. albicans)289、变异链球菌(S. mutans)167。前四位是临床感染与耐药研究的常客,白色念珠菌代表真菌侧,变异链球菌代表口腔微生物组侧——覆盖面横跨人体多个生态位。

2.3 证据标准:什么叫"验证关联"

论文对收录关联的定义是"clinically or experimentally supported"——临床证据或实验证据支撑。操作上由两条管线汇入:

  1. 数据库导入线:TTD(Therapeutic Target Database)与 DrugBank 提供经策展的药物-微生物作用条目,直接映射为关联并继承其证据指针。
  2. 文献挖掘线:对数据库未覆盖的文献证据逐条人工收录,挂原始 PubMed ID。

每条入库记录再经历去重(合并同一药物-微生物对的重复证据为 entries 内的多证据或单条目)与注释富集(补分子式/链接/靶点)。论文未公开逐条证据的分级标签(如临床/体外/动物模型的层级标记)——关联"有多硬"要看所挂文献本身,这是引用 MDAD 时需要回溯一手证据的原因。

2.4 技术栈:一个 2018 年的 LAMP 变体

论文原载实现细节:MySQL 存数据,PHP 写查询逻辑,Apache2 做 Web 服务,跑在 Windows Server 2012 的 X86-64 服务器上;前端 HTML/CSS/JavaScript + jQuery + Bootstrap。提供三种使用通道——表格浏览(按药物/微生物浏览)、条目检索、数据下载。论文还自证了服务质量:Pingdom 性能评分 81,页面请求 15 个,加载 4.84 秒,库内查询响应小于 1 秒。

这套技术栈在 2018 年不算落后,但它把数据可用性锚定在一台校园服务器上——六年后服务器失联,三种通道只剩 GitHub 一条(§6.1)。对数据集工程者的启示直白:Web 服务不是数据发布,独立、可镜像的包才是。

2.5 与上游数据库的边界

MDAD 的增量贡献不是原始实验数据,而是跨源聚合 + 微生物视角的统一化:TTD/DrugBank 的主视角是药物与靶点,微生物-药物作用散落在适应症、药敏与文献条目中;MDAD 把"微生物"提为一等公民节点,统一了命名与注释结构,并补齐文献线索。因此引用规范上:数据事实引用 MDAD 论文(Sun et al. 2018),具体药物-靶点细节回溯 DrugBank/Uniprot 原始条目,上游条款随引用链继承。

2.6 规模对照:关联数据库赛道里的位置

数据库 年份 关联/记录规模 节点构成 定位差异
MDAD 2018 5,055 entries(基准 2,470) 1,388 药物 × 180 微生物 微生物×药物,含菌株与靶点注释
aBiofilm 2018 2,884(去冗) 1,720 药物 × 140 微生物 限定抗生物被膜(anti-biofilm)药物
DrugVirus 2020 933(GCNMDA 补充后) 175 药物 × 95 病毒 限定人病毒与化合物开发状态
DrugBank 全库 数千药物条目 药物-靶点为主视角 上游源,微生物视角非一等公民
TTD 全库 治疗靶点视角 靶点-疾病-药物 上游源

三件套的分工清晰:MDAD 管"微生物×药物"主战场,aBiofilm 收窄到生物被膜场景,DrugVirus 换成病毒轴。三者合并后的异构图是 GCNMDA 一系方法的输入形态。

2.7 契约边界:MDAD 不承诺的三件事

把论文声明当作"数据集契约"来读,MDAD 承诺的只有那张字段表(§2.1);以下三件事常被使用者误当承诺,实际都不在契约内:

误当承诺的事 实际状态 后果
负样本 从未提供——库内只有正关联 一切负样本都是使用者的构造物(§7.2)
持续更新 2018 年快照,无更新承诺与事实 新证据不会出现,管线要自带更新策略
证据分级 无字段区分临床/体外/动物模型 "验证"只保证有证据,不保证证据同强

把契约边界写清楚的动机:对 MDAD 的多数误用(§7.5 四类)源于把"数据库"默认当成"有服务等级协议的数据服务"。它从来没有 SLA——2018 年的论文没有写,2018 年后的仓库也没有任何文本可以更新这个契约。

§3 构建流水线:6 个计算机科学家如何策展 5,055 条证据

3.1 团队与分工结构

MDAD 由两所学校的计算机科学团队完成:深圳大学计算机科学与技术学院四人(Ya-Zhou Sun、Shu-Bin Cai、Zhong Ming、Jian-Qiang Li)与中国矿业大学信息与控制工程学院两人(De-Hong Zhang、Xing Chen)。第一作者 Ya-Zhou Sun 即 GitHub 数据仓库账号(Sun-Yazhou)的持有者。这是一支纯计算机背景队伍做生物数据策展的典型案例——没有署名临床或微生物学合作者,其策展证据完全依赖数据库既有条目与文献原文,而非自行实验验证。

3.2 收录与去重流程

流水线四步:

  1. 源采集:从 TTD、DrugBank 拉取药物条目与其作用记录;系统检索相关文献。
  2. 证据过滤:仅保留有临床或实验证据支撑的药物-微生物作用主张——排除纯计算预测、纯综述转述(无一手实验)的条目。
  3. 去重合并:同一药物-微生物对的多来源证据合并(论文自述"after eliminating duplicate entries");跨源命名冲突对齐到 DrugBank 药物名与微生物学名。
  4. 注释富集:药物侧挂分子式或 DrugBank 链接;微生物侧挂菌株与靶点(Uniprot);每条记录锁定 PubMed 证据指针。

3.3 与后继"去冗"的关系:两个口径的分叉点

论文口径 5,055 entries 保留了两类冗余:同一药物-微生物对的多条证据记录,以及菌株级拆分(同一物种下不同菌株各占记录)。2019 年起,预测论文(以 GCNMDA 为代表)统一做两步后处理:

  • 证据级去冗:按(药物, 微生物)对去重,5,055 entries → 数千对唯一关联;
  • 物种级折叠:菌株归并为物种,173 物种 × 1,373 药物 → 2,470 关联。

GCNMDA 论文同时给出"去冗前 5,505 associations / 1,388 drugs / 174 microbes"的转述——注意 5,505 与论文原文 5,055 的易位冲突(坑 2),以及 174 与 180 的微生物数漂移(坑 2)。本条目所有基准语境数字一律采用"去冗后 2,470/1,373/173"三件套。

3.4 Web 服务架构(已逝部分)

站点按"浏览-检索-下载"三通道设计:Browse 菜单按药物或微生物列出条目并在右栏渲染关联列表;条目页通过内部链接把"某药对某菌的作用"与"该药对其他微生物的作用"串成可点击的网络——这本质上是把二部图导航做进了 UI;Download 通道提供整库导出。MySQL 后端 + PHP 查询 + Apache2 服务 + Bootstrap 前端,是标准的学院派 LAMP 变体(Windows 系底座)。

2018 年论文发表时这套服务运转正常;其后服务器下线。社区在 GitHub issue #1(2024-05-08)留下质询"为什么网站现在不再运行了?",至 2026-09-28 该 issue 仍 open 且无作者回应——数据集进入"仅包存活"状态。

3.5 策展方法论的局限

三条结构性局限,使用前须知:

  1. 无证据分级:临床证据与体外实验在库里同权,不提供"证据强度"字段;下游若需分层,必须回溯每条 PubMed 引用。
  2. 无阴性对照:库只收正关联。哪些"药物-微生物对"被检测过但无作用,无从得知——这使伪负采样成为协议层面的必选项而非可选项。
  3. 收录时点固化:2018 年后未更新。此后数年的新药敏数据、新机制研究(含微生物组药物学爆发期)均未纳入——把它当 2018 年快照用,别当活数据库用。

3.6 论文内数字的算术交叉验证

论文披露的头部计数允许几组廉价而有效的自洽检查(全部用已发表数字做算术,不引入新来源):

检查 计算 结论
密度自洽 2,470 / (173×1,373) ≈ 1.04% 矩阵密度约 1%,与"高度稀疏二部图"的定性一致
头部药物占比 前 7 药合计 347 entries / 5,055 ≈ 6.9% 头部集中但非赢者通吃,长尾存在
头部微生物占比 前 6 微生物合计 2,839 条 drug records / 5,055 ≈ 56% 微生物侧头部集中度远高于药物侧
菌株覆盖 824 株 / 180 物种 ≈ 4.6 株/物种(上限口径) 菌株信息是部分覆盖而非全查——物种折叠丢信息是有实据的
证据强度 5,055 entries / 2,470 关联 ≈ 2.05 平均每个唯一关联约两条证据记录(跨口径比值,仅作量级参考)

两点解读:其一,微生物侧 56% 的头部集中度意味着伪负采样时"负对"主要落在长尾微生物上——分层采样(§7.2)因此不只是锦上添花;其二,"2.05 条证据/关联"是置信度代理的粗略上限估计,因为 5,055 含菌株级拆分而不仅是重复证据——精确值需逐条回溯(呼应坑 8 的信息损失)。

§4 双口径解剖:5,055、5,505、2,470 各是什么

4.1 三套数字的谱系树

文献中 MDAD 的规模数字至少有三种形态,各有出处:

数字组合 语义 出处 使用场景
5,055 / 1,388 / 180 entries(含证据重复+菌株级) 论文摘要与正文(PubMed 30581775 原文;Frontiers XML;AGRIS) 引用数据库本身
5,505 / 1,388 / 174 "验证关联"转述 GCNMDA(Bioinformatics);bio-protocol 2024 写 5,505 配 180 方法论文的数据节
2,470 / 1,373 / 173 去冗+物种折叠邻接矩阵 GCNMDA 起,Frontiers Mic 2024、BRMDA 2026、bio-protocol 2024 等一致沿用 关联预测实验

三套数字不是错误链而是语义链:5,055 是数据库快照;5,505 是转述漂移(疑似 5,055 的数字易位,bio-protocol 的 5,505×180 是漂移+混拼);2,470 是社区标准化的实验输入。写论文或建管线时的纪律:引用数据库规模用第一套,跑实验用第三套,任何场合不要写第二套。

4.2 entries 与 associations 的语义差

"5,055 entries"的 entry ≠“唯一关联对”。一个 entry 是一条带证据的记录;同一(药物, 微生物)对若有三篇文献支撑且涉及两个菌株,最多可展开为多条 entry。去冗到 associations 后,重复证据被合并、菌株被折叠到物种——信息损失两类:证据多源性(哪对关联证据更强)与菌株特异性(哪株敏感哪株耐药)。

对下游的具体影响:若你的任务需要"关联置信度",2,470 矩阵不携带,需要回 5,055 口径数证据条数;若你的任务涉及菌株差异(如同种不同株的药敏分化),矩阵完全不携带,只能回溯 PubMed 原文。

4.3 物种数漂移:180 → 174 → 173

三个物种数各有所指:

  • 180:论文口径,入库微生物物种总数(另含 824 株菌株标识)。
  • 174:GCNMDA 去冗后、构建矩阵前的可用物种数(部分物种在去重后无剩余关联)。
  • 173:最终矩阵维数——比 174 再少一,源于特征/相似度构造阶段再剔除一物种(GCNMDA 未逐条说明该物种的去留细节,社区直接沿用 173 维矩阵)。

复现实验时以 173×1,373 矩阵为目标形态;引用数据库规模时以 180 为准。把 174 当中间产物记住即可,它在文献中出现频率最低。

4.4 折叠协议的社区惯例

从 5,055 到 2,470 的折叠没有官方脚本,社区实际操作按 GCNMDA 公开描述对齐:

  1. 去重到(药物, 微生物物种)对;
  2. 药物侧归一到 1,373(部分无结构信息或无相似度得分的药物被剔除);
  3. 微生物侧归一到 173;
  4. 相似度矩阵:药物用 SIMCOMP 结构相似性(后继工作常以高斯交互谱核替代或融合),微生物用 Kamneva 功能相似性(基于 STRING 基因家族网络)或高斯核;
  5. 评估用分层 5 折 CV,负样本伪采样 1:1。

注意第 2 步:2,470 < 论文 5,055 的主要来源不是去重而是药物/物种的可用性过滤——如果你的特征构造能覆盖更多药物,矩阵维数可以大于 1,373×173,此时你的结果与文献数字不可比。

4.5 一个速查表:读论文时的口径鉴别法

论文里写的是 它实际在说 你该怎么做
“MDAD contains 5,055 entries…” 引用数据库本体 正确引用,无需处理
“5,505 associations” 转述漂移(易位) 核对后按 5,055 理解(坑 2)
“2,470 associations between 1,373 drugs and 173 microbes” 基准实验口径 可与文献结果对标
“1,388 drugs and 180 microbes” 数据库节点规模 引用规模用
未写明口径只给 AUC 无法判断 查其数据节或放弃横比

4.6 漂移的传播链:一个口径错误如何被合法化

口径漂移不是一次性笔误,而是沿引用链繁殖的。用已核实的三个节点画出传播路径:

传播站 它说了什么 漂移机制 下游后果
论文原文(2018) 5,055 entries / 1,388 / 180 / 824 / 993 无(源头) 三源一致,锚点
GCNMDA(2022) “5505 associations…174 microbes” + “2470…1373…173” 5,055→5,505 易位;180→174 去冗语境混入 因其权威性,被后续论文整体继承
bio-protocol(2024) “5505 validated records…180 microorganisms” 从两个来源各抄一半(漂移数+原文数混拼) 协议类文章的可信度让漂移进入实验手册
后续方法论文 “2,470…”(多数正确) 有作者核对过原文则止跌 正确口径与漂移口径长期并存

三条防波堤,写论文时逐条自检:①数字只从一手源(PubMed 原文)抄,不从综述转引;②每个数字标注口径语义(entries 还是 associations);③见到 5,505/174 的组合,直接判定该文数据节未经核对,其协议描述也要加倍审读——口径漂移与方法学马虎高度相关。

§5 基准生态:MDAD 如何被用作预测考场

5.1 任务定义与输入形态

微生物-药物关联预测的标准形式化:给定邻接矩阵 A∈{0,1}^{173×1373}(1=验证关联),预测未观测对的关联概率。三种常见输入构造:

  1. 纯矩阵:只用 A 本身,靠矩阵补全/协同过滤类方法(NMF、模糊推理等)。
  2. 矩阵+相似度核:A 派生高斯交互谱(GIP)相似度,外部相似度用药物结构(SIMCOMP)与微生物功能(Kamneva/STRING、16S 序列等)——主流配置。
  3. 异构图:药物节点、微生物节点(可扩展疾病节点)+ 多类型边,图神经网络消息传递——GCNMDA(GCN+条件随机场)与 BRMDA(随机游走+集成学习,Frontiers Genetics 2026)代表此线。

5.2 评估协议:社区实际在跑什么

协议要素 社区惯例 官方背书
划分 分层 5 折交叉验证 无(MDAD 不提供任何官方划分)
负样本 伪负采样:从未观测对均匀采 1:1 无(库内无负样本)
鲁棒性组 负:正 = 3:1 / 5:1 / 10:1 无(BRMDA 2026 自设)
指标 AUC、AUPR、ACC、F1(阈值按训练折 PR 曲线定) 无
特征 GIP 核 + SIMCOMP + Kamneva/STRING 无(各论文自选)
baseline 相似度核方法、矩阵补全、GCN 系 无

"无官方"四连是理解这个基准的关键:MDAD 发布的是数据,不是评测服务。对比同级数据集(如 Kaggle 挑战赛有固定划分与 leaderboard),MDAD 上的一切可比性都是文献间的约定俗成——你复现的是某篇论文的协议,不是 MDAD 的协议。

5.3 代表结果与"伪负采样敏感性"

BRMDA(Frontiers Genetics 2026, doi:10.3389/fgene.2026.1757318)给出的负采样比例敏感性是现成的教科书数据:

负:正 AUC AUPR F1 ACC
1:1 0.9857 0.9792 0.9569 0.9569
3:1 0.9881 0.9614 0.9273 0.9634
5:1 0.9895 0.9497 0.9024 0.9673
10:1 0.9904 0.9232 0.8765 0.9772

三个读数:

  1. AUC 几乎不动(0.9857→0.9904):排序能力对类别不平衡稳健——但这也意味着 AUC 对这个基准的区分度很低,各方法 AUC 挤在 0.95-0.99 区间,排名靠运气。
  2. AUPR/F1 显著衰减(0.9792→0.9232 / 0.9569→0.8765):不平衡暴露真实难度。比较方法时 AUPR 权重应高于 AUC。
  3. ACC 随负样本比例上升:1:1 下 ACC=F1(平衡点),10:1 下 ACC 虚高(多数类效应)——ACC 在此基准上几乎无信息量。

推论:读到"MDAD 上 AUC 0.99"先问三个问题——负:正比例多少?几折?种子几号?三者不同,数字不可比(坑 6)。

5.4 姊妹三件套:MDAD + aBiofilm + DrugVirus

GCNMDA(Bioinformatics,A*Star,2022)把三数据集并行评估固化为领域惯例:

数据集 去冗规模 特点
MDAD 2,470 关联 / 1,373 药物 / 173 微生物 主战场,细菌+真菌
aBiofilm 2,884 关联 / 1,720 药物 / 140 微生物 限定抗生物被膜活性
DrugVirus 933 关联 / 175 药物 / 95 病毒 限定人病毒(GCNMDA 手补 57 条临床/实验关联后)

三件套的意义在于轴正交性:MDAD 覆盖经典抗菌+非抗感染药,aBiofilm 收窄到被膜场景(被膜是耐药与慢性感染的关键机制),DrugVirus 把微生物轴换成病毒。方法若在三套上同时稳健,才谈得上"学到了药物-微生物作用的通用模式"而非单一数据集的采样偏差。GCNMDA 论文对 aBiofilm 的原始口径另有描述(1720 unique anti-biofilm agents、140+ organisms),引用时注意其去冗前后数字同样存在双口径。

5.5 方法学谱系速览

以 MDAD(或三件套)为考场的代表方法线:

  • 相似度核时代(2019-2021):高斯交互谱核 + SIMCOMP/Kamneva 特征拼接,配合正则化最小二乘、矩阵补全。
  • 图神经网络时代(2022 起):GCNMDA(GCN+CRF 联合推断异构网络)确立 GNN 基线;此后各类注意力 GNN、图自编码器、对比学习陆续刷榜。
  • 集成与随机游走时代(2024-2026):BRMDA(高斯核相似度矩阵 + 随机游走 + 集成)代表"回到轻量模型但在协议上更严谨"的反思线——其负采样敏感性实验本身就是对领域刷榜风气的修正。

三条线的共同起点都是那张 173×1373 的矩阵——MDAD 的基准地位不在规模(2,470 个正样本对深度学习而言极小),而在它是这个交叉领域唯一被广泛沿用的人类可读关联快照。

5.6 基准的陈旧性:2018 快照 vs 2026 现实

MDAD 固化于 2018 年,此后微生物组药物学快速发展:新的大规模药敏筛查(含数百株 × 数千药的体外高通量实验)、菌群-药物代谢组学、菌群失调与药物应答的队列证据,都未回灌。用 2026 年的方法刷 2018 年的 2,470 个正样本,存在系统性天花板:榜单饱和(AUC 0.98+)未必是方法强,更可能是数据小且易记。负采样敏感性实验(§5.3)部分缓解了这一担忧,但"新关联发现"类任务的评估仍需体外验证回环,纯计算榜单只宜作筛选工具。

5.7 跨领域对照:与药物-靶点预测基准的结构差异

把 MDAD 放到它最近的"表亲"——药物-靶点相互作用(DTI)基准——旁边,方法学的血缘一目了然:

维度 微生物-药物(MDAD) 药物-靶点(DTI 库系)
节点轴 药物 × 微生物物种 药物 × 蛋白靶点
正样本规模 2,470(去冗口径) 数万至数十万
负样本惯例 伪负采样,全自定 伪负采样为主(部分库含实验阴性)
药物侧相似度 SIMCOMP / 指纹 同一套(SIMCOMP / 指纹)
另一轴相似度 Kamneva/STRING 功能相似性 蛋白序列相似性
官方划分 无 部分挑战赛有固定划分
榜单形态 AUC 0.95-0.99 挤档 同样饱和

三条读数:

  1. 方法论整体平移:DTI 领域的"相似度核+伪负采样+分层 5 折 CV"模板被原样搬进微生物-药物任务,连 GIP 核的标签泄漏问题都是同款(§7.3)。读懂 DTI 方法学批判文献的人读 MDAD 榜单几乎无新知门槛。
  2. 规模差两个数量级:2,470 个正样本对深度学习而言极小,这是 BRMDA 一类轻量模型仍能上榜的结构性原因——不是轻量模型变强了,是数据没大到需要深度模型。
  3. 迁移成本极低:在 DTI 上验证过的方法改个输入矩阵就能上 MDAD 榜——这是该领域论文高产的结构性原因,也提示读者:方法移植类论文的新颖性要打折扣看。

库内 drugbank(rid 89/571)与 ttd(rid 409)条目可作 DTI 侧的对照阅读面。

§6 获取与许可:一条活路的门怎么进

6.1 四条通道的生死簿

通道 状态(2026-09-28 实测) 说明
官网 chengroup.cumt.edu.cn/MDAD 已失效 curl 连接空回复(HTTP 000);issue #1 于 2024-05-08 报告失效;117 篇引用文献中的此链接均为死链
GitHub Sun-Yazhou/MDAD 存活,唯一通道 MDAD.zip(≈3.2 MB,2018-10-29 上传)+ README(仅一行 “# MDAD”);4 commits;0 star/0 fork/1 open issue
HuggingFace 无官方镜像 hf-mirror API 检索 “MDAD” 与 “microbe-drug” 均空
Zenodo 无官方存档 检索命中的 Zenodo 7480334 是同名火星尘暴数据集(坑 1),与本条目无关

镜像社区实践:因官网死亡+仓库零维护,部分方法论文作者在其 GitHub 仓库内附带自己处理好的 2,470 口径矩阵(常以 Excel/CSV 形式)——使用时须核对 provenance,谨慎对待"二手矩阵"(其去重与折叠协议未必与 GCNMDA 完全一致)。

6.2 许可链:三层推定,无一层是现成的

MDAD 的许可状态是本条目最复杂的部分,逐层拆解:

  1. 论文层:CC BY 4.0(Crossref license 记录 + Frontiers 开放获取惯例)——这是论文文本的许可,理论上不自动覆盖数据包。
  2. 数据包层:GitHub 仓库无 LICENSE 文件(GitHub API license=null),README 空壳。数据包在版权法下的默认状态是"保留所有权利"——尽管作者显然无意于此。
  3. 上游层:数据事实来自 TTD、DrugBank 与文献。DrugBank 内容对学术用途免费、商业用途需授权;TTD 按其自身条款。再分发含 DrugBank 派生字段的 MDAD 全表,严格说需要核对上游条款。

实操建议:学术用途下,引用论文(CC BY 4.0)+ 注明数据源(TTD/DrugBank)+ 使用 GitHub 公开包,是社区通行且风险可控的做法;商业用途(尤其产品化再分发关联数据)建议先联系作者确认——尽管其 GitHub 与 issue 均无活跃迹象,邮件触达可能是唯一正式通道。

6.3 AI-Ready 评估:一个"高学术就绪、低工程就绪"的样本

按库内 AI-Ready 检查单逐项过:

  • 机器可读元数据:论文开放获取(CC BY 4.0)+ GitHub 仓库(README 空壳)——论文侧良好,数据侧失分。无 dataset card、无字段字典、无版本号。
  • 公开直链:GitHub raw 直链成立(MDAD.zip)——单点、无校验和、无版本管理是硬伤。
  • 许可明确性:三层推定链(§6.2)——自动化管线无法从包内读出许可,必须人工裁决。
  • 可复现性:数据包 + 论文描述可重建基准矩阵,但折叠协议(§4.4)无官方脚本,重建细节取决于实现者对论文转述的理解——社区内实际存在多个互不完全一致的"MDAD 矩阵"版本。
  • 文档自洽:论文内部数字一致;漂移发生在转述链上(5,505、174 等,坑 2)——原文无错,二手文献有错,自动抓取须锚定一手源。

综合:AI-Ready 等级"中下"——学术可见性与引用体量远超均值,工程可获取性(单点、无版本、无许可文件、零维护)拖后腿。它是"数据库型"数据集可获取性衰减的完整标本:从三通道(浏览/检索/下载)到单通道(zip),衰减过程约六年,无任何官方公告。

6.4 与库内可获取性光谱的对照

档位 库内参照 MDAD 对应
注册墙 LMC2 型(注册+审批) —
请求制 upon request 型条目 —
平台托管 Zenodo 型(TopBrain) —
Registry 收录 AWS Registry 型 —
公开直链(多镜像/带版本) HF/Zenodo 双发布型 —
公开直链(单点、无版本、无 license 文件) — MDAD(GitHub zip 独苗)
死链 部分老条目的原始官网 原官网

MDAD 在光谱上独占"单点 zip"档:比请求制自由(无需作者参与即可下载),比多镜像直链脆弱(仓库一旦删除即全网消失)。对检索者的含义:抓取要趁早、留快照;依赖此数据的管线应把 zip 镜像进自己的对象存储并记录 sha256。

这张光谱还有一条纵向读法:档位越往下,"可获取"与"可信赖"的差距越大。请求制虽慢,但发放行为本身构成一份事实许可记录;多镜像直链虽散,但多副本互证给出完整性。单点 zip 两样都没有——自由下载与零背书同时成立,这正是 MDAD 档位的本质:获取最容易,背书最稀薄。

6.5 下载与校验实操

# 1) 下载(约 3.2 MB)
curl -L -o MDAD.zip "https://github.com/Sun-Yazhou/MDAD/raw/master/MDAD.zip"

# 2) 记录指纹(包无版本号,指纹即版本)
sha256sum MDAD.zip

# 3) 记录抓取时点与来源声明(供数据卡片引用)
#    来源: github.com/Sun-Yazhou/MDAD @ master (commit d12faf9, 2018-10-29)
#    官网 chengroup.cumt.edu.cn/MDAD 已失效,本包为唯一官方存活通道

# 4) 解包核对(论文口径应可复原 5,055 entries / 1,388 drugs / 180 microbes)
unzip MDAD.zip -d MDAD_pkg && find MDAD_pkg -type f | sort

三处提醒:直链在部分网络环境(含本库沙箱)被阻断,需走镜像或浏览器通道;包内结构论文未描述、本条目亦未验证(存照,勿臆断文件清单);commit d12faf9 是数据文件的上传 commit(“Add files via upload”),即事实上的 v1.0 终版。

6.6 给数据集托管者的三条反面教训

从 MDAD 的六年衰变史提炼,供所有准备发布数据集的团队对照自查:

  1. 包与站点解耦:MDAD 把三通道(浏览/检索/下载)绑在一台校园服务器上,服务器一死通道全灭。数据包应从第一天起托管在独立于作者机构的基础设施(Zenodo/figshare/HF,均可发 DOI),站点只是门面。
  2. 许可文件是元数据的原子组件:一个 LICENSE 文件的成本接近零,缺失的代价是每一代使用者都要重新推定一遍(§6.2 三层推定)。README 哪怕只写三行——数据是什么、许可是什么、引用什么——也比一行标题强一个量级。
  3. 衰变要发公告:官网 2024 年死得悄无声息,117 篇引用者无人知晓。一条 issue 回复或 README 置顶公告(“官网已弃用,数据在 GitHub”)就能把僵尸引用转化成有效引流。MDAD 的 issue #1 至今 open——那本可以是最便宜的维护动作。

§7 使用指南:把 MDAD 正确接进你的管线

7.1 五步标准工作流

从"拿到 zip"到"出第一行可对标的结果",社区通行的五步:

步 动作 关键决策点 本条目参照
1 获取与指纹 记录 sha256 与抓取时点(包无版本号,指纹即版本) §6.5
2 解析与清洗 字段抽取、PubMed ID 校验、药物/微生物名归一(对齐 DrugBank 名与学名) §2.1
3 折叠到基准口径 按社区惯例去冗+物种折叠到 2,470/1,373/173;或自定口径(则放弃与文献横比) §4.4
4 特征与负采样 选特征菜单(§7.3)与负采样协议(§7.2);固定全部随机种子 §5.2
5 评估与声明 分层 5 折 CV;报告时附协议声明块(§7.4 第 10-12 项) §5.3

三处最常见的第一步就错:直接从方法论文附录抄"处理好的矩阵"而不核对 provenance(坑 7);折叠时忘了药物侧过滤(1,373 < 1,388 的原因,§4.4 第 2 步);解析时把菌株级记录当物种级直接去重导致物种数对不上 173。

7.2 负采样协议:这个基准上最重要的自由度

MDAD 只提供正样本,负样本完全由使用者构造——这是该基准上最大的协议自由度,也是所有数字分歧的第一来源。

三种主流负采样策略对照:

策略 做法 优点 风险
均匀随机(主流) 从全部未观测对均匀采样,负:正常取 1:1 简单、可复现、社区默认 把"未观测"当"无作用",含潜在假负例
分层采样 按药物或微生物的度数分层抽负 缓解头部节点主导 与主流不可比,需明示
硬负例挖掘 优先采"结构相似但未关联"的对 更接近真实发现场景 大幅拉低指标绝对值,仅用于方法学对比

四条纪律:

  1. 主结果用 1:1 均匀随机——这是与 GCNMDA/SCSMDA/BRMDA 一脉对标的最低要求。
  2. 鲁棒性组报 3:1/5:1/10:1(BRMDA 协议)——只报 1:1 的论文在 2026 年审稿环境里已不够格。
  3. 种子全公开——伪负采样随机性意味着同协议不同种子也能差出小数点后两位,种子不公开则结果不可复核。
  4. 指标以 AUPR 为主、AUC 为辅——§5.3 已证 AUC 对负采样比例几乎免疫(0.9857→0.9904)而 AUPR 敏感(0.9792→0.9232),AUPR 才是这个基准上的区分度所在。

一个 1:1 的具体算术账(帮你在实现前心里有数):正样本 2,470 个 1 → 均匀采 2,470 个 0 → 全数据共 4,940 对 → 分层 5 折后每折测试集约 988 对(正负各约 494)。GIP 核必须在每折的训练折内重算——全量重算再切折是常见的泄漏实现错误。整轮五折 × 4 个负采样比例 × R 个种子,实验矩阵迅速膨胀:3 个种子起步就是 60 次训练,算力预算照此估。

7.3 特征构造菜单

轴 特征 构造方式 使用频率
药物-药物相似 高斯交互谱核(GIP) 由邻接矩阵 A 自身派生:药物对在微生物轴上的关联向量过高斯核 几乎全员
药物-药物相似 SIMCOMP 结构相似性 药物 2D 结构的图匹配相似度,GCNMDA 一脉标准配置 高
药物-药物相似 分子指纹(MACCS/ECFP) RDKit 类工具自行计算,指纹余弦/Jaccard 后继常用,替代 SIMCOMP(后者需ChemDB 授权)
微生物-微生物相似 Kamneva 功能相似性 基于 STRING 基因家族网络的功能相似度工具(Kamneva et al.) GCNMDA 一脉标准
微生物-微生物相似 GIP 核 同药物侧,微生物轴派生 几乎全员
微生物-微生物相似 16S rRNA 序列相似性 直接比对 16S 序列,系统发育近似 部分后继工作
混合 多核融合/注意力加权 把上述核拼接或学习加权 GNN 时代常见

两条使用注意:其一,GIP 核由 A 自身派生,等于把标签信息泄进特征——这是该领域所有方法"集体高分"的技术根源之一,消融时务必报"无 GIP"组;其二,SIMCOMP 需要 ChemDB 授权账号,很多复现者实际用的是指纹替代,这又是一层未声明的协议分歧。

7.4 复现检查单(12 项)

在 MDAD 上跑实验并写论文前逐项自查:

  1. 数据包 sha256 与抓取日期已记录(包无版本号)。
  2. 明确声明使用口径:2,470/1,373/173(对标文献)或自建口径(放弃横比)。
  3. 折叠脚本与 GCNMDA 描述逐条对齐(§4.4 五步),药物过滤逻辑写明。
  4. 负采样策略、负:正比例、随机种子全部写明。
  5. 划分协议:分层 5 折 CV;测试折不参与任何特征构造(GIP 泄漏检查)。
  6. 指标:AUC + AUPR 必报;ACC/F1 附阈值确定方式。
  7. 鲁棒性组:至少补 10:1 一档(BRMDA 协议)。
  8. baseline:至少含一个相似度核方法(如 NMF/最小二乘)与 GCNMDA。
  9. 不与任何"SOTA"直接横比,除非逐条核对其负采样比例与种子。
  10. 结果表脚注声明:MDAD 无官方划分、无官方脚本,所有协议为本工作自设。
  11. 引用规范:数据库事实引 Sun et al. 2018(5,055 口径),实验口径另注 2,470。
  12. 报告局限段:2018 快照、仅正样本、物种级折叠损失(§3.5、坑 8)。

7.5 何时不该用 MDAD

四类需求请绕道,不要硬套:

  1. 菌株级药敏研究:物种折叠已丢弃 824 株细节(坑 8),需回溯 PubMed 原文或专门的药敏数据库。
  2. 需要作用方向与量效:MDAD 的记录字段是"药物×微生物×证据",无抑制/促进方向标签,无 MIC/剂量数值——量效关系研究请用原始实验文献。
  3. 需要 2018 年后的新证据:收录时点固化(§3.5 第 3 条),微生物组药物学 2018 后的大量高通量药敏筛查未回灌。
  4. 需要置信度分级的关联:临床证据与体外实验同权入库,无分级字段(§2.3);对关联强度敏感的任务须自行回溯每条 PubMed 引用。

7.6 三个进阶研究设计:MDAD 还能做什么

除了刷关联预测榜,MDAD 的数据形态支撑三类被低估的用法:

  1. 非抗感染药的微生物互作面:5-氟尿嘧啶(43 条)的入榜暗示库内有一批"非抗生素×微生物"关联。把这些抽出来按 ATC 分类切片,能直接得到"哪些临床常用药的微生物互作已有证据"的图景——药物重定位与不良反应机制研究(如药物对菌群的脱靶作用)的现成起点。论文口径保留的 entries 计数在这里比去冗口径更有用(同药多证据=证据强度代理)。
  2. 证据网络的文献计量:993 篇文献支撑 5,055 条 entries,金葡菌一家 662 条——按文献聚合可以回答"哪些论文贡献了最多关联证据"“证据的年代分布是否偏斜(1970s 老文献占比)”。这类计量结果既是综述素材,也是评估"证据新鲜度"的输入。
  3. 数据集生命周期案例:§8.7 的老化模型 + §6 的通道生死簿 + 附录 F 的口径漂移登记表,构成一个完整的"学术型数据集如何静默衰变"案例——适合数据集工程、科研基础设施、AI-Ready 评估方向的教学与研究引用。117 次引用与零维护的剪刀差是这个案例最有冲击力的一张图。

三类用法的共同点:都不需要跑预测模型,都需要 5,055 论文口径而非 2,470 去冗口径——再次印证"先选口径再动手"(§4.5)。

§8 生态与影响:一个"学术热、工程冷"的双面样本

8.1 引用画像:117 次引用的构成

Semantic Scholar 计 117 次引用(influential citations 8,抓取时点 2026-09-28)。构成上大致三堆:

  1. 方法论文(主体):GCNMDA(Bioinformatics,A*Star)、SCSMDA(Briefings in Bioinformatics 2023,doi:10.1093/bib/bbac634)、BRMDA(Frontiers Genetics 2026,doi:10.3389/fgene.2026.1757318)等关联预测方法——MDAD 是它们的"考场之一",通常与 aBiofilm、DrugVirus 并列出结果。
  2. 综述与立场文章:微生物组药物学(pharmacomicrobiomics)综述把它当"该领域有这样一个数据库"的注脚引用。
  3. 方法学协议:bio-protocol 2024 的实验方案把 MDAD 写成标准实验材料——这类引用把 2,470 口径进一步固化成"社区常识"。

一个反差细节:117 次引用中没有产生任何官方维护动作——4 commits 停在 2018-10-29,issue #1 无人回应。学术影响力与数据维护完全脱钩,这正是"引用数不能当数据健康度代理"的活例证。

三堆引用的代表作与各自引用 MDAD 的方式:

引用堆 代表作 它们引用 MDAD 的方式 对 MDAD 的实际依赖
方法论文 GCNMDA(2022)/SCSMDA(2023)/BRMDA(2026) 数据节引 2,470 口径 + 结果表列 MDAD 行 深——没有这张矩阵就没有实验
综述 微生物组药物学方向综述 "已有数据库如 MDAD 收集了…"式提及 浅——注脚级
协议/教程 bio-protocol 2024 把 MDAD 写成实验材料并给使用步骤 中——把口径漂移带进了实验手册

三堆引用的纵深不同,可维护性触点也不同:方法论文是最可能"顺手镜像数据"的群体(已有作者在自家仓库附矩阵,§6.1);综述引用再多也不产生维护压力;协议文章则会长期放大口径错误——可见漂移治理的最佳杠杆点在协议与方法两类文献的审稿环节。

8.2 方法谱系:三条时代线

时代 代表方法 技术特征 与 MDAD 的关系
核方法时代(2019-2021) 高斯核+最小二乘、矩阵补全、NMF 系 相似度核拼接,浅模型 确立 GIP+SIMCOMP+Kamneva 特征惯例
图神经网络时代(2022 起) GCNMDA(GCN+条件随机场,A*Star)、SCSMDA(自对比学习,2023) 异构图消息传递、对比学习 把三件套并行评估固化为领域惯例;GCNMDA 同时固化 2,470 去冗口径
集成反思线(2024-2026) BRMDA(随机游走+集成,2026) 轻量模型+更严谨的协议 用负采样敏感性实验对刷榜风气纠偏

三条线的共同起点是那张 173×1,373 矩阵。方法迭代六年,考场没换过——这也意味着榜单饱和(AUC 0.98+)更多反映数据规模小(2,470 个正样本)而非方法进步。

8.3 衍生扩展:从 2,470 矩阵长出的异构全家桶

MDAD 的 2,470 关联矩阵在后继工作中被持续扩维成异构图输入。Deng et al. 2022 一系(BRMDA/GCNMDA 共用口径)在社区过滤后保留了这样一组衍生数字:

扩展轴 规模 说明
疾病 109 种 微生物-药物之外的第三类节点
微生物 73 种 异构子图口径(非 MDAD 全集)
药物 233 种 异构子图口径
药物-疾病关联 1,121 条 外部数据库汇入
微生物-疾病关联 402 条 外部数据库汇入
微生物-微生物互作 138 条(123 微生物) 外部数据库汇入
药物-药物关系 5,586 条(1,228 药物) 外部数据库汇入

注意:这组数字不是 MDAD 本体的规模,是后继论文以 MDAD 为种子扩出来的异构工作集——引用时务必区分"MDAD 含 2,470 关联"与"某论文在 MDAD 基础上构造了含 5,586 药物-药物关系的异构图",混写会造成规模数字的又一重漂移(与坑 2 同机理)。

8.4 上游依赖图谱

依赖 用途 依赖方式 现状
TTD 药物-靶点/治疗条目导入 结构化导入,继承证据指针 持续维护中
DrugBank 药物条目、分子式、ID 对齐 结构化导入+链接锚定 学术免费、商用需授权
Uniprot 微生物靶点(蛋白/RNA)链接 注释富集 持续维护中
PubMed 逐条证据指针 993 篇文献引用 稳定
STRING 后继微生物功能相似性计算底座 间接(经 Kamneva 工具) 持续维护中
SIMCOMP/ChemDB 药物结构相似性 后继特征构造 需授权账号

上游全部健在,唯独中间层(MDAD 自身)失修——这个"上游活、中游死"的形态意味着理论上可从 TTD/DrugBank/文献重建一个 2026 版 MDAD,但没人做:重建的策展成本远低于维护一个旧库的政治成本,这是文献策展型数据库的公共悲剧。

8.5 姊妹数据集可达性对照

数据集 团队 原官网 官网现状(本条目抓取时点)
MDAD Sun et al. 2018(深大/矿大) chengroup.cumt.edu.cn/MDAD 已失效(2024-05 报告+实测双证)
aBiofilm Rajput et al. 2018(IMTECH) bioinfo.imtech.res.in/manojk/abiofilm 未逐测(存照待核④)
DrugVirus Andersen et al. 2020 drugvirus.info 未逐测(存照待核④)

三件套里的每一个都是"论文+小网站+GitHub 补丁"的同款架构——MDAD 的今天(官网死、zip 独苗)很可能就是它们的明天。做领域综述或基准建设的团队,建议把三件套的 GitHub/Zenodo 镜像一次性做齐。

8.6 论文中的规范表述模板

引用 MDAD 时,三种语境的规范写法(可直接抄进你的论文):

  1. 引用数据库本体:“MDAD (Sun et al., 2018) is a manually curated database containing 5,055 clinically or experimentally supported microbe-drug associations, covering 1,388 drugs and 180 microbes (824 strains), with 993 references.”——全部数字取论文原文,一个都不要换。
  2. 描述实验口径:“We used the de-redundant version of MDAD commonly adopted since GCNMDA: 2,470 associations between 1,373 drugs and 173 microbes, represented as a binary adjacency matrix.”——并引 GCNMDA,附你的负采样协议。
  3. 声明局限:“MDAD is a 2018 snapshot containing only positive associations without evidence grading or strain-level resolution in its matrix form; negative samples were generated by [your protocol].”——这半句话在 2026 年的审稿环境里是加分项,不是示弱。

反面教材(都是真实文献里出现过的写法):“MDAD contains 5,505 associations”(坑 2 转述漂移);“downloaded from the official website”(坑 3 官网已死);“the CC-BY licensed dataset”(坑 4 许可推定,论文和数据包要分开说)。

8.7 数据集老化模型:MDAD 正处于哪一段

把 MDAD 放进一个通用的"数据集生命周期"框架,能给所有策展者一个可复用的诊断工具:

阶段 特征 MDAD 对应时点
活跃期 内容更新、通道多样、作者响应 2018-10 至 2018-12(建仓-发文,仅数周)
冻结期 内容停更但服务在线、作者仍在 约 2019-2024(引用增长期,官网仍活着的前半段)
衰变期 服务组件开始死亡、无公告、引用照旧 约 2024 年中官网失效起(issue #1 无回应是标志性事件)
失存期 最后一个通道消失 未至(GitHub zip 仍可达)——但离它只差一次仓库删除

MDAD 的特殊之处在于活跃期极短:仓库 2018-10-29 一天内完成全部 4 个 commits,此后八年无一行改动。它从出生起就是"静态包+展示页"架构,老化曲线从冻结期直接滑向衰变期。对基准使用者的推论:该数据集的"最后有效状态"就是 commit d12faf9,此后的一切变化只会更坏不会更好——镜像要趁早,这不是玩笑是排期建议。

§9 与库内条目的关系

9.1 家族图谱

MDAD 在库内的检索面由"上游源+方法底座+生态对照"三类条目构成:

库内条目 rid 与 MDAD 的关系 互链方向
drugbank 89(医数集)/ 571(病案医数集) 上游数据源:MDAD 药物注释直接挂 DrugBank 链接,1,388 药物与其条目对齐 MDAD→DrugBank(数据血缘)
ttd 409(病案医数集) 上游数据源:论文原文点名的结构化导入源 MDAD→TTD(数据血缘)
string 414(病案医数集) 方法底座:GCNMDA 一脉微生物功能相似性的计算底座(Kamneva 工具基于 STRING 基因家族网络) MDAD↔STRING(方法依赖)
drugcentral 344 生态位对照:同为"文献策展+关联抽取"范式的药物知识库 MDAD↔DrugCentral(范式对照)
chembl 572(病案医数集)/ 85(医数集) 生态位对照:药物发现侧最大策展化学库 MDAD↔ChEMBL(范式对照)
drugcomb 274 生态位对照:药物组合矩阵的策展范式 MDAD↔DrugComb(范式对照)

三句话定位:DrugBank/TTD 是 MDAD 的"爹"(数据来源),STRING 是它的"考官工具箱"(下游特征构造),DrugCentral/ChEMBL/DrugComb 是它的"同辈参照"(同为文献策展型,但视角在药物侧而非微生物侧)。库内目前没有第二个"微生物×药物"视角的条目——MDAD 补上的是这个生态位的空格。

9.2 检索路径建议

按研究意图给四条路径:

  1. 查药物-靶点原始细节:MDAD 条目 → drugbank(rid 89/571)与 ttd(rid 409)——MDAD 只给链接指针,细节在原库条目里。
  2. 复现关联预测方法:本条目 §5/§7 → string(rid 414,理解相似性底座)→ 附录 E 复现骨架。
  3. 对比文献策展范式:drugcentral(rid 344)、chembl(rid 572/85)、drugcomb(rid 274)——看同一范式在药物组合、活性计量上的工程化程度差异(它们都有版本化与 API,MDAD 没有)。
  4. 标签路径:本条目 category_tags(药物发现与化学/化学信息学/知识图谱/微生物组/评测基准)任一标签均可反查到 MDAD;与"基因组学与多组学-微生物组"标签下的条目形成跨域邻接。

9.3 本条目填补的库内空格

slug 查重时 url_name 含 mdad/biofilm/drugvirus/microbe 的记录均为 0 行(FACTS §1)——在本条目入库前,库内药物侧知识库(DrugBank/TTD/ChEMBL/DrugCentral/DrugComb)齐备,但"微生物×药物"视角完全缺位。MDAD 补上的具体是三个空格:

  1. 节点类型:库内现有条目的"生命体"节点以靶点(蛋白)为主,无微生物物种节点——MDAD 引入 180/173 个微生物节点及其 STRING 相似性语境。
  2. 任务类型:关联预测/链接预测基准在库内影像、病历、信号条目之外,新增"二部图链接预测"这一任务家族的代表。
  3. 风险形态:库内可获取性光谱上独占"公开直链(单点、无版本、无 license 文件)"档位(§6.4),为可持续性研究补一个关键样本点。

9.4 数据血缘声明

一图流:TTD(rid 409)+ DrugBank(rid 89/571)→ 结构化导入 → MDAD → 证据指针回指 PubMed → 下游方法(GCNMDA/SCSMDA/BRMDA)以 2,470 矩阵消费 → 微生物相似性计算回依 STRING(rid 414)。

两点提醒:其一,MDAD 对上游是快照关系——2018 年从 TTD/DrugBank 取的条目,今日原库已更新,MDAD 不追踪,所以"MDAD 里的 DrugBank 链接"≠“DrugBank 当前状态”,交叉引用时以原库现值为准;其二,MDAD 对下游是单向漏出——后继论文的衍生矩阵、扩展异构图均未回灌本体,库内引用时不要把 BRMDA 用的扩展数字(5,586 药-药等)写成 MDAD 的内容(§8.3)。

9.5 互链操作建议(给发布管线的可执行清单)

若由发布侧执行条目互链,建议按"关系类型+锚点词"落地:

目标条目(rid) 关系类型 建议锚点词(出现在本条目正文的语境)
drugbank(89/571) 上游数据源 “上游数据源”“药物条目对齐”“DrugBank 链接”(§2.5、§9.1)
ttd(409) 上游数据源 “TTD 结构化导入”“证据指针继承”(§2.3、§3.2)
string(414) 方法底座 “Kamneva/STRING 功能相似性”“微生物相似度”(§5.2、§7.3)
drugcentral(344) 范式对照 “文献策展范式”“许可版本化对照”(§6.4、§9.1)
chembl(572/85) 范式对照 “策展化学库”“工程化程度对照”(§9.2)
drugcomb(274) 范式对照 “药物组合矩阵”“关联抽取范式”(§9.1)

反向互链(目标条目指回本条目)建议挂在各条目的"下游/生态"小节,锚点词用"微生物-药物关联基准"“MDAD(2,470 口径)”——避免在 drugbank/ttd 条目里引入规模数字(那里的语境是原库自身,写 5,055 或 2,470 都会引起口径混乱)。

§10 避坑清单:八个已存照的坑

坑 1:MDAD 同名歧义 ×3,检索必串。缩写 MDAD 至少对应三个公开数据集:Microbe-Drug Association Database(本条目)、Mars Dust Activity Database(火星尘暴,Zenodo record 7480334,Battalio et al.)、Multiview and multimodal in-vehicle Driver Action Dataset(车载驾驶动作,Springer LNCS,doi:10.1007/978-3-030-29888-3_42)。检索必须加 microbe/drug 限定词;Zenodo 里搜"MDAD"命中的是火星数据集,别错挂。

坑 2:数字三口径漂移(5,055/5,505/2,470 与 180/174/173)。论文原文 5,055 entries(1,388 药物×180 微生物×824 菌株×993 文献,PubMed/Frontiers XML/AGRIS 三源一致);GCNMDA 转述成"5,505 associations…174 microbes"(疑似 5,055 易位传抄);bio-protocol 2024 更杂交出"5,505 records…180 microorganisms";去冗基准口径 2,470/1,373/173(GCNMDA 与 SCSMDA 双独立互证)。纪律:引规模用 5,055 系,跑实验用 2,470 系,5,505 系不要写。

坑 3:官网死链与"僵尸引用"。官网 chengroup.cumt.edu.cn/MDAD 自约 2024 年中失效(GitHub issue #1 于 2024-05-08 报告,至今 open 无回应;2026-09-28 curl 实测 Empty reply,HTTP 000——对照矿大主域 301 正常,系子域级失效)。论文与 117 篇引用文献中的官网链接全是死链。任何"从官网下载 MDAD"的教程都已过时。

坑 4:许可三层推定,"MDAD 是 CC BY 4.0"只对论文成立。GitHub 仓库无 LICENSE 文件(API license=null)、README 仅一行标题——数据包在版权法默认下"保留所有权利",尽管作者显然无意于此。学术使用通行做法:引论文(CC BY 4.0)+ 注明数据源(TTD/DrugBank 各自条款)+ 用公开包;商用再分发前先联系作者(邮件可能是唯一正式通道)。

坑 5:MDAD.zip 包内结构未经验证。沙箱网络策略阻断 GitHub 直链下载(raw.githubusercontent.com/codeload.github.com 均阻断,仅 WebFetch 可浏览页面),本条目未能解包确认内部是 SQL dump、CSV 还是整站打包——论文也未描述包结构。不得臆断文件清单;解包核对是使用前第一动作(§6.5 第 4 步)。仓库 size 3,263 KB,commit d12faf9(2018-10-29 “Add files via upload”)即事实上的 v1.0 终版。

坑 6:伪负采样自由度让 AUC 不可横比。MDAD 无官方划分、无负样本、无评估脚本、无 leaderboard。BRMDA 实测:负:正从 1:1 拉到 10:1,AUC 几乎不动(0.9857→0.9904)而 AUPR 掉 5.6 个百分点(0.9792→0.9232)。读到"MDAD 上 AUC 0.99"先问负:正比例、几折、种子几号——三者不同,数字不可比。

坑 7:二手矩阵 provenance 陷阱。因官网死亡+仓库零维护,部分方法论文作者在其仓库附带自己处理好的 2,470 矩阵(Excel/CSV 形态)——其去重与折叠协议未必与 GCNMDA 一致,特征覆盖差的论文矩阵维数甚至不是 173×1,373。用二手矩阵前核对 provenance,或从官方 zip 按附录 E 骨架自行折叠。

坑 8:物种级折叠丢失两类信息。从 5,055 entries 折到 2,470 关联损失:证据多源性(同一关联几篇文献支撑——置信度代理信息)与菌株特异性(824 株信息全部丢弃——同种不同株的药敏分化)。需要这两类信息时回 5,055 口径或 PubMed 原文,折叠矩阵里没有。

八坑的使用建议:坑 1-5 属"获取与引用层",发生在你碰数据之前,对策是引用纪律与存照意识;坑 6-8 属"实验与建模层",发生在你跑数字的过程中,对策是协议声明与口径自查。检索者按阶段对号入座即可,不必一次背全——附录 H 的档案表支持按坑号随查随用。

§11 总结

11.1 三句话总结

  1. MDAD 用 5,055 条带 PubMed 证据的关联把"药物×微生物"钉成二部图,是微生物组药物学关联预测默认三件套之首——学术上极成功(117 引),工程上极脆弱(官网已死、GitHub zip 独苗、无 LICENSE 文件、零维护八年)。
  2. 它的一切下游数字都带协议指纹:5,055(论文口径)与 2,470(去冗基准口径)并存,负采样比例能让 AUPR 差 5.6 个百分点——不带协议读的"SOTA"都是噪音。
  3. 它的档案价值是一面镜子:数据集可获取性可以在作者不发声的情况下静默归零,引用数不能当数据健康度的代理。

11.2 适合谁

  • 关联预测/链接预测方法开发者:需要与 GCNMDA/SCSMDA/BRMDA 一脉对标的基准矩阵与协议考古。
  • 微生物组药物学综述作者:需要一个规模、证据结构、生态位都可直接引用的权威快照。
  • 数据集工程与 AI-Ready 研究者:一个"高学术就绪、低工程就绪"的完整标本,可获取性衰减六年全程有存照。
  • 数据集策展者:想重建或扩展微生物-药物资源的人——上游(TTD/DrugBank/STRING)全活,重建窗口一直开着。

11.3 不适合谁

  • 菌株级药敏或量效关系研究(无方向标签、无 MIC、菌株细节在折叠中丢失)。
  • 需要 2018 年后新证据的项目(收录固化,无更新)。
  • 需要现成负样本、官方划分或 leaderboard 的团队(一概没有,协议全自建)。
  • 期望开箱即用文档与字段字典的工程团队(README 一行,许可须人工推定)。

11.4 30 秒决策卡

你的情况 行动
要跑关联预测并对标文献 GitHub 下 MDAD.zip(§6.5)→ 按 §4.4 折叠 → 附录 E 骨架 → 协议按 §7.4 检查单
只想引用数据库规模 引 5,055 entries / 1,388 drugs / 180 microbes(Sun et al. 2018),别写 5,505(坑 2)
要做菌株级/量效研究 别用 MDAD,回溯 993 篇原文(§7.5)
要商用再分发 先过 §6.2 许可三层推定,邮件联系作者
要做数据集可持续性研究 本条目 §6/§8.5 + 附录 F 双口径登记表是现成案例
要找库内互链 drugbank(rid 89/571)、ttd(rid 409)、string(rid 414)先行(§9.1)

11.5 常见误用速查:错误写法与正确写法对照

场景 错误写法 正确写法
引规模 “MDAD contains 5,505 associations” “5,055 entries (Sun et al., 2018)”
引规模(物种数) “…between 1,388 drugs and 174 microbes” “…1,388 drugs and 180 microbes”
说许可 “the CC-BY licensed dataset” “the paper is CC BY 4.0; the data package carries no explicit license”
说获取 “downloaded from the official website” “downloaded from the GitHub repository (official website discontinued)”
报结果 “We achieved SOTA AUC 0.99 on MDAD” 附负:正比例/折数/种子/AUPR 的完整协议声明(附录 J)
说版本 “MDAD v2” “the de-redundant version adopted since GCNMDA (2,470)”
引用扩展 “MDAD includes 5,586 drug-drug relationships” “a downstream work built … on top of MDAD”
说能力 “MDAD provides strain-level susceptibility data” “strain annotations (824) exist in the raw entries but are lost in the 173-species matrix”

这张表可直接作为相关论文的审稿对照单——八行里有五行对应 §10 的坑点编号,剩余三行是 §4/§8.3 的口径纪律。

11.6 给三类读者的各一句话

  • 给算法研究者:把 MDAD 当一道协议考古题而不是排行榜——你的贡献应在协议严谨性(负采样、泄漏控制、AUPR 报告)上,而非把 AUC 从 0.986 推到 0.988。
  • 给数据集策展者:把 MDAD 当一份衰变标本——学的是"包与站点解耦、许可文件前置、衰变要公告"三条教训(§6.6),不是它的数据本身。
  • 给临床与转化研究者:把 MDAD 当一张索引——每条关联的价值都在它挂的 PubMed 原文里,任何下游使用都应回溯一手证据后再做医学判断。

FAQ(高频问答 40 问)

A. 基础认知

Q1:MDAD 是数据库还是基准数据集?
两者都是,且身份随时间迁移:2018 年发布时是"网站+数据库"(浏览/检索/下载三通道);2019 年后官网角色萎缩,它的实际身份变成关联预测基准——以 2,470 去冗口径在方法论文中流通。今天说"用 MDAD",多数人指的是那张 173×1,373 矩阵。

Q2:名字 MDAD 展开是什么?
Microbe-Drug Association Database(微生物-药物关联数据库)。注意缩写歧义:它还是火星尘暴数据库(Mars Dust Activity Database)与车载驾驶员动作数据集(Multiview and multimodal in-vehicle Driver Action Dataset)之名——检索必加 microbe/drug 限定词(坑 1)。

Q3:谁做的?
六位计算机科学研究者:深圳大学计算机科学与技术学院四人(Ya-Zhou Sun 一作、Shu-Bin Cai、Zhong Ming、Jian-Qiang Li)+ 中国矿业大学信息与控制工程学院两人(De-Hong Zhang、Xing Chen)。GitHub 数据仓库账号 Sun-Yazhou 与一作同名。通讯作者未从已抓取一手源直接确认(存照 7)——PubMed/Crossref 页面无通讯星标,不虚构。

Q4:发表在哪里?
Frontiers in Cellular and Infection Microbiology 2018 Dec 7;8:424,doi:10.3389/fcimb.2018.00424,PMID 30581775,PMCID PMC6292923。开放获取,论文本体 CC BY 4.0。

Q5:"验证关联"的"验证"指什么?
论文原话 clinically or experimentally supported——有临床或实验证据支撑,每条挂 PubMed ID 指针。注意库内没有证据分级字段:临床证据与体外实验同权入库,"有多硬"要看所挂文献本身(§2.3)。

Q6:它只收抗生素吗?
不。喹诺酮类确实霸榜(环丙沙星 64 条居首),但 MDAD 明确把"非抗感染药对微生物的作用"纳入收藏——广谱抗癌药 5-氟尿嘧啶以 43 条入榜头部,这是它区别于纯药物敏感性数据库的关键设定。

Q7:微生物侧收什么?
细菌与真菌,物种级 180 种(另含 824 株菌株标识);不含病毒——病毒轴由姊妹库 DrugVirus 负责。头部是金葡菌(662 条)、铜绿假单胞菌(653)、流感嗜血杆菌(588)、大肠埃希菌(480)。

Q8:最大的卖点一句话?
把散落在 993 篇文献里的"哪种药对哪种微生物有作用"证据,钉成一张每条都可回溯原文、可直接折叠为邻接矩阵的二部图。

Q9:它自己有什么局限?
论文未自曝、但使用前必须知道的有五条:只收正样本(无负例)、无证据分级、2018 年后固化不更新、物种级折叠丢弃菌株细节、官网已死工程失修。§3.5 与 §7.5 逐条展开。

Q10:开源吗?
数据包公开(GitHub zip 直链,无需注册申请),但严格说不算"开源数据"——仓库无 LICENSE 文件,README 仅一行标题,许可要靠论文 CC BY 4.0 推定(坑 4)。站点代码(MySQL/PHP)按论文描述应打包在 zip 内,未验证。

B. 数据与获取

Q11:数据现在从哪下?
唯一存活通道:GitHub 仓库 Sun-Yazhou/MDAD 的 MDAD.zip(约 3.2 MB,2018-10-29 上传,commit d12faf9)。官网 chengroup.cumt.edu.cn/MDAD 已失效。

Q12:官网还能用吗?
不能。两层证据:2024-05-08 已有用户在 GitHub issue #1 公开报告"网站现在不再运行了"(至今 open 无回应);本条目 2026-09-28 curl 实测 Empty reply(HTTP 000),而矿大主域 301 正常——失效在子域/服务器层面,不是网络误判。

Q13:有镜像吗?
无官方镜像。HuggingFace(hf-mirror API 检索"MDAD"与"microbe-drug"均空)与 Zenodo 均无官方存档——Zenodo 搜"MDAD"命中的 7480334 是火星尘暴数据集,别错拿(坑 1)。部分方法论文作者的仓库里附有自行处理的 2,470 矩阵,属二手货,provenance 自核(坑 7)。

Q14:zip 里到底是什么?
未验证(存照 5)。沙箱网络策略阻断 GitHub 直链下载,本条目未能解包;论文也未描述包结构——预期形态是数据库导出(SQL dump 或扁平表,可能连带站点代码),但以解包实测为准,别按臆断写解析脚本。

Q15:怎么校验拿到的包?
包无版本号、无官方校验和——自己生成 sha256 并记录抓取时点与来源 commit(d12faf9,2018-10-29),指纹即版本(§6.5)。

Q16:能商用吗?
谨慎。三层许可推定(§6.2):论文 CC BY 4.0 只覆盖论文文本;数据包本身"保留所有权利"(默认状态);上游 TTD/DrugBank 各自条款仍可能约束(DrugBank 商用需授权)。商用再分发前建议邮件联系作者确认。

Q17:有版本更新吗?
没有。v1 单版本,4 个 commits 全部停在 2018-10-29。文献里的"2,470 关联版"是后继预测论文自行去冗过滤的产物,不是官方 v2——写成"MDAD v2"是错误(FACTS §2 版本链存照)。

Q18:下载被网络阻断怎么办?
部分网络环境(含本库沙箱)阻断 github 直链下载。可选路径:走代理/镜像通道或浏览器手动下载;下载后先 sha256 再解包。没有任何官方 CDN 或学术镜像可替代。

C. 口径与统计

Q19:"5,055"和"2,470"哪个对?
都对,语义不同。5,055 = 论文口径 entries(药物-微生物-证据记录,含重复证据与菌株级拆分);2,470 = 去冗+物种级折叠后的唯一关联数(1,373 药物 × 173 微生物),基准实验通行口径。引规模用前者,跑实验用后者(坑 2)。

Q20:"5,505"又是哪来的?
转述漂移。GCNMDA(Bioinformatics)把 5,055 转写成 5,505(疑似数字易位),bio-protocol 2024 更杂交出"5,505 records…180 microorganisms"(漂移+混拼)。论文原文三源(PubMed 摘要/Frontiers XML/AGRIS)一致是 5,055——5,505 不要写进你的论文。

Q21:180、174、173 三个微生物数怎么区分?
180 = 论文口径入库物种数;174 = GCNMDA 去冗后、建矩阵前的可用物种数(部分物种去重后无剩余关联);173 = 最终矩阵维数(特征构造阶段再剔除一个,GCNMDA 未逐条说明)。复现对齐 173,引规模用 180,174 当中间产物。

Q22:为什么药物从 1,388 掉到 1,373?
不是去重掉的——是特征/相似度构造阶段的可用性过滤(无结构信息或无相似度得分的药物被剔除)。这意味着如果你的特征能覆盖更多药物,矩阵可以大于 1,373 维,但结果就与文献不可比了(§4.4)。

Q23:头部药物和头部微生物是谁?
药物侧:环丙沙星 64、培氟沙星 61、莫西沙星 46、氧氟沙星 45、依诺沙星 44、加替沙星 44、5-氟尿嘧啶 43。微生物侧:金葡菌 662、铜绿假单胞菌 653、流感嗜血杆菌 588、大肠埃希菌 480、白色念珠菌 289、变异链球菌 167。

Q24:喹诺酮霸榜说明什么?
两层:喹诺酮确实广谱(对多种微生物有验证作用),但更主要是文献研究量偏置——研究得多的药,验证关联自然多。引用"环丙沙星 64 条"这类数字时,注意它是证据记录数而非药效强度排序。

Q25:993 篇文献覆盖到什么时候?
自 1970 年代起至 2018 年收录时点止。此后固化——微生物组药物学 2018 后的高通量药敏筛查、代谢组学与队列证据均未回灌(§8.2 榜单饱和的背景原因之一)。

D. 基准与协议

Q26:标准任务怎么定义?
给定 173×1,373 二值邻接矩阵 A(1 = 验证关联),预测未观测药物-微生物对的关联概率——二分类链接预测。三种输入形态:纯矩阵、矩阵+相似度核(主流)、异构图(GNN 系)。

Q27:官方评估协议是什么?
没有。无官方训练/测试划分、无负样本、无评估脚本、无 leaderboard——"无官方"四连。你复现的永远是某篇论文的协议,不是 MDAD 的协议(§5.2)。

Q28:负样本怎么造?
伪负采样:从未观测对均匀采样。主结果 1:1(社区默认),鲁棒性组补 3:1/5:1/10:1(BRMDA 协议)。采样比例是本基准最大协议自由度——AUPR 在 1:1 与 10:1 间差 5.6 个百分点(§5.3)。

Q29:现在 SOTA 是多少?
这个问题本身是坑。榜单饱和(各方法 AUC 挤在 0.95-0.99),且协议不统一不可横比。BRMDA(2026)1:1 下 AUC 0.9857/AUPR 0.9792 是近年可引的一组,但引用必须连同其负采样比例与划分协议一起引。

E. 生产与库内

Q30:GIP 核有什么问题?
高斯交互谱核由邻接矩阵自身派生,等于把标签信息泄进特征——这是该领域方法"集体高分"的技术根源之一。消融实验必须报"无 GIP"组,否则特征贡献说不清(§7.3)。

Q31:aBiofilm 和 DrugVirus 也有双口径问题吗?
有,同病。aBiofilm 的原始口径与 GCNMDA 转述口径有差(1,720 药物/140 微生物 vs 1720 unique anti-biofilm agents/140+ organisms);DrugVirus 原始 118 化合物/83 病毒,GCNMDA 手工补 57 条后成 933 关联/175 药物/95 病毒。三件套引用时都按"原始口径+使用口径"双轨记。

Q32:本条目与库内 drugbank/ttd/string 条目什么关系?
上游血缘:drugbank(rid 89/571)与 ttd(rid 409)是 MDAD 的数据来源,MDAD 药物注释直接挂它们;方法底座:string(rid 414)支撑下游微生物功能相似性计算;生态对照:drugcentral(344)/chembl(572/85)/drugcomb(274)是同范式不同视角的参照(§9.1)。

F. 数据集工程视角

Q33:官网死了为什么没人管?
结构性原因三连:作者团队无维护义务(论文发表即任务完成,学术激励不含"养库");GitHub 仓库零星与零 star 意味着社区信号为零,作者甚至不知道有多少人在用;117 次引用全是"引用即终点",没有一篇给作者发过维护请求的公开记录。这是学术数据集的激励结构问题,不是这六位作者的个人问题。

Q34:我能自己重建一个 2026 版 MDAD 吗?
技术上完全可行:上游 TTD/DrugBank/STRING 全部健在且活跃,文献检索管线论文已描述(§3.2)。成本在策展:993 篇文献的逐条人工核证是主要工作量,且"clinically or experimentally supported"的判断标准需要微生物学判断力——这正是 2018 年那支纯计算机团队也没有自己解决、只能依赖既有数据库条目的原因。如果你做了,记得给新版本一个独立 DOI 并与 2,470 口径做映射表。

Q35:为什么不直接用 DrugBank/TTD 重建,而要用 MDAD?
因为上游的主视角是药物-靶点,微生物-药物作用散落在适应症与药敏条目里,没有"微生物"一等公民节点(§2.5)。MDAD 的价值恰恰是那次视角统一化——重建的实质就是重做这次统一化。如果你的任务根本不涉及微生物轴,直接用上游库更好。

Q36:有现成的 2,470 矩阵可以直接下载吗?
官方没有——官方包只有原始 zip。GCNMDA/SCSMDA 等方法论文的补充材料或作者仓库常附带处理好的矩阵,但每家的去冗与过滤实现未必逐位一致(坑 7)。要用现成矩阵,先核对 provenance(矩阵维数是否 173×1,373、正样本数是否 2,470、出处 commit/说明是否在案),否则自己折叠(附录 E)更稳。

Q37:5,055 条关联里有后来被撤稿或争议的文献吗?
未逐条核查,无法给出数字(诚实存照)。MDAD 不追踪证据文献的后续状态——这是文献策展型数据库的通病:入库时点之后,撤稿、更正、结论修正都不会反映在库里。对证据强度敏感的任务,应抽查所引 PubMed 文献的当前状态(Retraction Watch/PubMed 评论)。

Q38:为什么下游方法用 STRING/Kamneva 而不直接用 16S 序列相似性?
历史路径依赖:GCNMDA(2022)选了 Kamneva(STRING 基因家族网络),后继为可比性沿用同配置。16S 相似性更直接反映系统发育距离,但换了特征就与既有榜单数字不可比(§7.3 的协议分歧问题再现)。两条路线在方法学上各有道理,报告时说清你用的是哪条即可。

Q39:GCNMDA 为什么要手工补 DrugVirus 57 条关联?
DrugVirus 原始口径只收 118 化合物/83 病毒,规模对深度学习方法太小;GCNMDA 补入 57 条临床/实验关联后成 933 关联/175 药物/95 病毒,让三件套规模大致可比。注意这 57 条是方法论文的手工增补,不是 DrugVirus 官方更新——引用 933 口径必须同时引用这个背景(Q31)。

Q40:如果哪天 GitHub 仓库也消失了怎么办?
那就进入失存期(§8.7),官方通道全灭,只剩:① 各方法论文补充材料里的二手矩阵;② Web Archive 对 GitHub 页面的历史快照(元数据可考,zip 下载未必可存);③ 引用它的论文的数据链接。本条目附录 D 的决策树与 §6.5 的自镜像建议(下载后 sha256 存自己的对象存储)就是为这一天准备的预案。

事实清单(硬事实 45 条)

  1. MDAD = Microbe-Drug Association Database,Sun et al. 2018,Front Cell Infect Microbiol 8:424。
  2. doi:10.3389/fcimb.2018.00424;PMID 30581775;PMCID PMC6292923;Crossref published-online 2018-12-07。
  3. 论文 license CC BY 4.0(Crossref license 记录 + Semantic Scholar openAccessPdf GOLD/CCBY 双证)。
  4. 作者 6 人:Ya-Zhou Sun、De-Hong Zhang、Shu-Bin Cai、Zhong Ming、Jian-Qiang Li、Xing Chen。
  5. 双机构:深圳大学计算机科学与技术学院(4 人)+ 中国矿业大学信息与控制工程学院(2 人)。
  6. GitHub 仓库 Sun-Yazhou/MDAD 创建于 2018-10-29(12:22:54Z),同日最后一次推送(12:40:29Z),共 4 commits。
  7. 仓库健康度(2026-09-28):0 star / 0 fork / 1 open issue / default branch master。
  8. 仓库 size 3,263 KB;MDAD.zip 2018-10-29 上传;README 仅一行 “# MDAD”;license 字段 null。
  9. commit d12faf9 为数据上传 commit(“Add files via upload”),事实上的 v1.0 终版。
  10. 论文口径:5,055 entries / 1,388 drugs / 180 microbes / 824 strains / 993 references(PubMed+Frontiers XML+AGRIS 三源一致)。
  11. GCNMDA 转述口径:“5505 associations…174 microbes”(疑似 5,055 易位漂移)。
  12. bio-protocol 2024 混合口径:“5505 validated records…180 microorganisms”。
  13. 去冗基准口径:2,470 associations / 1,373 drugs / 173 microbes——GCNMDA 与 SCSMDA(doi:10.1093/bib/bbac634)双独立互证。
  14. 物种数谱系:180(论文)→ 174(GCNMDA 去冗后)→ 173(最终矩阵维数)。
  15. 药物侧谱系:1,388(论文)→ 1,373(特征可用性过滤后)。
  16. Top 药物(entries 计):ciprofloxacin 64、pefloxacin 61、moxifloxacin 46、ofloxacin 45、enoxacin 44、gatifloxacin 44、5-fluorouracil 43。
  17. Top 微生物(drug records 计):S. aureus 662、P. aeruginosa 653、H. influenzae 588、E. coli 480、C. albicans 289、S. mutans 167。
  18. 记录字段:drug name / microbe name / PubMed ID / 分子式或 DrugBank 链接 / strain / microbe target(蛋白或 RNA,Uniprot 链接)。
  19. 上游源:TTD 与 DrugBank 结构化导入 + 文献挖掘两条管线汇入。
  20. 收录标准:clinically or experimentally supported(临床或实验证据支撑)。
  21. 无负样本、无证据分级字段、无官方划分、无评估脚本、无 leaderboard。
  22. 论文自载技术栈:MySQL+PHP+Apache2,Windows Server 2012,前端 jQuery/Bootstrap。
  23. 论文自载服务质量:Pingdom 性能评分 81,页面请求 15 个,加载 4.84 秒,查询响应 <1 秒。
  24. 官网 chengroup.cumt.edu.cn/MDAD 约 2024 年中失效:issue #1(2024-05-08,作者 a253324)公开报告,至今 open 无回应。
  25. 2026-09-28 实测:官网 curl Empty reply(HTTP 000,5s 超时);www.cumt.edu.cn 主域 301 正常——失效系子域层面。
  26. HuggingFace 无官方镜像(hf-mirror API 检索"MDAD"/"microbe-drug"均空);Zenodo 无官方存档(7480334 为同名火星数据集)。
  27. 缩写 MDAD 歧义 ×3:本条目、Mars Dust Activity Database(Zenodo 7480334,Battalio et al.)、Multiview and multimodal in-vehicle Driver Action Dataset(doi:10.1007/978-3-030-29888-3_42)。
  28. Semantic Scholar 引用 117 次(influential 8,抓取时点 2026-09-28);引用增长未带来任何仓库维护动作。
  29. 主任务:微生物-药物关联预测——A∈{0,1}^{173×1373} 上的二分类链接预测,分层 5 折 CV。
  30. 主流特征:GIP 高斯交互谱核(由 A 派生)+ SIMCOMP 药物结构相似性 + Kamneva/STRING 微生物功能相似性。
  31. BRMDA(Frontiers Genetics 2026, doi:10.3389/fgene.2026.1757318)1:1 结果:AUC 0.9857 / AUPR 0.9792 / F1 0.9569 / ACC 0.9569。
  32. BRMDA 10:1 结果:AUC 0.9904 / AUPR 0.9232 / F1 0.8765 / ACC 0.9772——AUC 对不平衡稳健、AUPR 衰减 5.6 pp。
  33. GCNMDA(Bioinformatics,A*Star):GCN+条件随机场,确立三数据集并行评估惯例。
  34. 姊妹库 aBiofilm(Rajput et al. 2018):去冗 2,884 associations / 1,720 drugs / 140 microbes。
  35. 姊妹库 DrugVirus(Andersen et al. 2020):原始 118 compounds / 83 human viruses;GCNMDA 手补 57 条后 933 associations / 175 drugs / 95 viruses。
  36. 衍生扩展(Deng et al. 2022 系,BRMDA/GCNMDA 共用):109 diseases / 73 microbes / 233 drugs / 1,121 药-病 / 402 微生物-病 / 138 微生物-微生物(123 微生物)/ 5,586 药-药(1,228 药物)。
  37. slug 查重:库内 url_name ILIKE ‘%mdad%’ 0 行;‘%biofilm%’/‘%drugvirus%’/‘%microbe%’ 亦 0 行——无撞库。
  38. 库内互链 rid:drugbank 89/571、ttd 409、string 414、drugcentral 344、chembl 572/85、drugcomb 274。
  39. MDAD.zip 包内结构未验证(沙箱阻断直链下载,仅 WebFetch 浏览)——不得虚构文件清单。
  40. 通讯作者未从一手源直接确认(PubMed/Crossref 无通讯星标);GitHub 仓库归属一作 Sun 无疑。
  41. 矩阵密度算术:2,470/(173×1,373) ≈ 1.04%——高度稀疏二部图的定量注脚。
  42. 头部集中度算术:前 6 微生物合计 2,839 条 drug records,占 5,055 entries 约 56%——微生物侧集中度远高于药物侧(前 7 药仅约 6.9%)。
  43. 证据比算术:5,055/2,470 ≈ 2.05——平均每个唯一关联约两条证据记录(跨口径比值,含菌株拆分影响,仅作量级参考)。
  44. 活跃期算术:仓库 2018-10-29 一天内完成全部 4 commits(12:22 建、12:40 终)——"数据集活跃期"仅数小时,此后八年零改动。
  45. 衰变时点不可考:官网确切失效日期无人知晓(issue 报告 2024-05-08 晚于实际死亡)——静默衰变使死亡日期本身成为不可考证项。

术语表(38 条)

术语 释义
微生物-药物关联(microbe-drug association) 一种药物对一种微生物有(临床/实验验证的)作用的一条证据记录
二部图(bipartite graph) 节点分两组(药物/微生物)、边只跨组的图;MDAD 的天然数学形态
邻接矩阵(adjacency matrix) 二部图的矩阵表示,A[i,j]=1 表示药物 j 与微生物 i 存在关联
关联预测(association prediction) 给定已知关联,预测未观测药物-微生物对的任务,本领域主任务
链接预测(link prediction) 图学习通用任务名,关联预测是其二部图特例
伪负采样(pseudo-negative sampling) 把未观测对当负样本的构造法;MDAD 无真负样本时的必选项
负:正比例 采样负样本数与正样本数之比;本基准最大协议自由度(1:1 常规)
GIP 核(Gaussian interaction profile kernel) 由邻接矩阵自身派生的相似度核;便利但有标签泄漏嫌疑
SIMCOMP 药物 2D 结构图匹配相似度算法,GCNMDA 一脉标准特征;需 ChemDB 授权
Kamneva 功能相似性 基于 STRING 基因家族网络的微生物功能相似度工具
16S rRNA 相似性 以 16S 序列比对近似微生物系统发育距离的特征法
分层 5 折交叉验证(stratified 5-fold CV) 保持类别比例的五折划分协议,本基准社区默认
AUC ROC 曲线下面积;本基准上对负采样比例不敏感(区分度低)
AUPR 精确率-召回率曲线下面积;不平衡场景下比 AUC 更有区分度
菌株(strain) 物种内的具体分离株;MDAD 收 824 株标识,物种折叠后丢弃
物种级折叠 把菌株记录归并到物种的预处理;2,470 口径的构造步骤之一
去冗(deduplication) 合并同一药物-微生物对的多条证据记录;5,055→2,470 的第一步
entries vs associations 论文记录数(含重复证据)与唯一关联对数两种计数的区分
pharmacomicrobiomics 微生物组药物学:研究微生物组如何改变药物应答的交叉学科
生物被膜(biofilm) 微生物附着表面形成的膜状群落,耐药关键机制;姊妹库 aBioFilm 的主题
TTD Therapeutic Target Database,治疗靶点数据库,MDAD 上游源之一
DrugBank 药物条目与靶点数据库,MDAD 上游源之一,药物 ID 对齐锚
Uniprot 蛋白质序列与功能数据库,MDAD 微生物靶点链接指向处
STRING 蛋白-蛋白互作/基因家族网络数据库,下游微生物功能相似性底座
GCN(图卷积网络) 图神经网络基础算子,GCNMDA 的骨干
条件随机场(CRF) 序列/结构化预测模型,GCNMDA 用于联合推断
随机游走(random walk) 图上游走采样技术,BRMDA 组件之一
集成学习(ensemble learning) 多模型融合策略,BRMDA 的方法标签
自对比学习(self-contrastive learning) SCSMDA 的方法标签(Briefings in Bioinformatics 2023)
CC BY 4.0 署名 4.0 国际许可:自由使用/修改/再分发,仅需署名;MDAD 论文本体的许可
LICENSE 缺失 GitHub 仓库无许可文件的状态——版权默认"保留所有权利",MDAD 数据包即此状态
sha256 指纹 文件哈希校验;MDAD.zip 无官方校验和,自算指纹充当版本标识
provenance 数据出处链;使用二手 MDAD 矩阵前必须核对的处理历史
DAIMS 可发现性/可获取性/可互操作/元数据/可持续性五维数据集评估框架(本库检查单)
药物重定位(drug repurposing) 为已上市药寻找新适应症的策略;MDAD 的非抗感染药关联是其微生物组视角的输入
长尾分布 头部少数节点占多数关联、多数节点仅零星关联的分布形态;负采样设计的考量项
数据集考古 对已停更数据集做版本、通道、许可与引用链的系统性复原工作;本条目 §6/§8/附录 S 即一例
DOI 数字对象唯一标识符;MDAD 论文有而数据包没有——可发现性断裂的典型位置

附录

附录 A:条目信息速查卡

项 值
条目名 MDAD
url_name mdad
类型 数据库+基准数据集(二合一,含已失效 Web 服务)
论文 Front Cell Infect Microbiol 2018;8:424(doi:10.3389/fcimb.2018.00424)
团队 深圳大学(Sun/Cai/Ming/Li)+ 中国矿业大学(Zhang/Chen)
规模(论文口径) 5,055 entries / 1,388 drugs / 180 microbes / 824 strains / 993 refs
规模(基准口径) 2,470 associations / 1,373 drugs / 173 microbes
主任务 微生物-药物关联预测(173×1,373 二分类链接预测)
获取 GitHub Sun-Yazhou/MDAD(MDAD.zip ≈3.2 MB);官网已失效
许可 论文 CC BY 4.0;数据包无 LICENSE 文件(推定链见 §6.2)
版本 v1 单版本(2018-10-29,commit d12faf9),无更新
抓取时点 2026-09-28
库内互链 drugbank(89/571)、ttd(409)、string(414)、drugcentral(344)、chembl(572/85)、drugcomb(274)
AI-Ready 评级 中下(4.8/10,附录 B)
坑点 8 则(§10/附录 H),获取层 5 则+实验层 3 则
条目规模 40 问 FAQ / 45 条事实清单 / 38 条术语表 / 19 个附录

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 7 论文开放获取+117 次引用可索引;但同名歧义 ×3 检索必串、无 dataset card
A 可获取性 4 GitHub zip 公开直链是唯一通道;官网死、无镜像、无校验和、部分网络直连被阻断
I 可互操作 5 记录携带 PubMed ID/DrugBank/Uniprot 标准标识符是加分项;但无字段字典、无 API、包内结构未验证
M 元数据质量 6 论文对数据构造描述完备;README 空壳、转述链漂移严重(5,505/174 满天飞)拖分
S 可持续性 2 八年零维护、官网死亡无公告、单点 zip、issue 无回应——本维最重失分
综合评级 4.8/10(中下) 学术可见性远超均值,工程可获取性与可持续性双重拖底——"高学术就绪、低工程就绪"的典型标本

附录 C:逐项证据链自证

关键数字 来源 位置/方式
5,055/1,388/180/824/993 论文摘要原文 PubMed 30581775 + Frontiers XML + AGRIS,三源一致
CC BY 4.0(论文) Crossref license 记录 creativecommons.org/licenses/by/4.0/;Semantic Scholar GOLD/CCBY 佐证
2,470/1,373/173 GCNMDA 数据节 Bioinformatics 论文(A*Star OAR PDF)
2,470 第二互证 SCSMDA 数据节 Briefings in Bioinformatics 2023,doi:10.1093/bib/bbac634
5505/174 转述 GCNMDA 原文 与 2,470 同段出现(存照 1)
5505×180 混合 bio-protocol 2024 协议文章数据节(存照 1)
Top 药物/微生物计数 论文正文统计 Frontiers 全文
824 strains 定义 论文原文 "not counting microbes without strain info"语义
MySQL/PHP/Apache2/Pingdom 81 论文 Web 服务节 Frontiers 全文
官网失效 issue #1 + curl 实测 GitHub issue(2024-05-08)+ 2026-09-28 HTTP 000
矿大主域正常(对照) curl 实测 www.cumt.edu.cn 301,2026-09-28
仓库元数据 GitHub API created 2018-10-29 / 4 commits / 0 star / license null
README 一行 GitHub 页面 “# MDAD”(WebFetch 浏览)
引用 117/影响 8 Semantic Scholar 2026-09-28 抓取(动态数,存照待核⑤)
BRMDA 四行指标 BRMDA 论文表 Frontiers Genetics 2026, fgene.2026.1757318
aBiofilm 2,884/1,720/140 GCNMDA 数据节 Rajput et al. 2018 为原始出处
DrugVirus 933/175/95 GCNMDA 数据节 原始 118/83 + 手补 57 条
衍生扩展数字 Deng et al. 2022 系 经 BRMDA/GCNMDA 转述一致

附录 D:数据获取决策树

需求是什么?
├── 只想引用数据库规模
│   └── 引 5,055 entries / 1,388 drugs / 180 microbes(Sun et al. 2018)——别写 5,505
├── 要跑关联预测实验
│   ├── 1) GitHub 下 MDAD.zip(sha256 留档)
│   ├── 2) 解包核对(第一动作,包内结构未验证)
│   ├── 3) 按 §4.4 折叠到 2,470/1,373/173
│   └── 4) 协议按附录 J 模板声明
├── 要菌株级/量效/方向性信息
│   └── 不用 MDAD——回溯 993 篇 PubMed 原文(§7.5)
├── 要商用再分发
│   └── 先过 §6.2 三层推定 + 邮件作者确认
└── 要做数据集可持续性案例研究
    └── 本条目 §6 + 附录 F 双口径登记表 + 附录 B DAIMS 即案例素材

附录 E:折叠与复现骨架(示意代码)

以下 Python 骨架演示从扁平关联表到 2,470 基准矩阵的折叠流程。字段名是示意——MDAD.zip 包内真实结构未解包验证(存照 5),实际列名以解包为准,骨架的价值在流程而非字段。

# MDAD -> 基准口径折叠骨架(流程示意,字段名以实际解包为准)
import pandas as pd
import numpy as np

# 步骤 0:载入(假设解包后得到关联表,含药物名/微生物名/证据 PMID 列)
# 实际包可能是 SQL dump 或多表——先 find/inspect 再改此处
assoc = pd.read_csv("mdad_associations_flat.csv")  # 示意文件名
# 期望原始量级:~5,055 entries(论文口径)

# 步骤 1:记录级清洗——统一命名(对齐 DrugBank 药物名与微生物学名)
assoc["drug"] = assoc["drug_name"].str.strip().str.lower()
assoc["microbe"] = assoc["microbe_name"].str.strip()

# 步骤 2:证据级去冗——按 (药物, 微生物) 对去重(保留证据计数作置信度代理)
dup = assoc.groupby(["drug", "microbe"]).size().rename("evidence_count")
pairs = assoc[["drug", "microbe"]].drop_duplicates().join(dup, on=["drug", "microbe"])

# 步骤 3:菌株->物种折叠(若解包数据含 strain 列,先归并到物种再去重)
# assoc["species"] = species_map[assoc["microbe"]]  # 分类映射需自行构建

# 步骤 4:可用性过滤——无结构信息/无相似度得分的药物与无特征物种剔除
#   药物侧 1,388 -> 1,373;微生物侧 -> 173(GCNMDA 口径)
#   此步决定你的矩阵维数:过滤越少维数越大,但与文献不可比
drugs = sorted(pairs["drug"].unique())    # 期望过滤后 ~1,373
microbes = sorted(pairs["microbe"].unique())  # 期望过滤后 ~173

# 步骤 5:构建二值邻接矩阵 A (173 x 1373)
A = pd.crosstab(pairs["microbe"], pairs["drug"]).reindex(
    index=microbes, columns=drugs, fill_value=0
).astype(int)
assert A.shape == (173, 1373) or print(
    f"口径漂移警告: {A.shape}——与文献 2,470/173x1373 不一致, 检查步骤 2/4"
)
assert A.values.sum() == 2470 or print(
    f"关联数漂移警告: {A.values.sum()}——检查去重与折叠粒度"
)

# 步骤 6:特征构造入口(GIP 核示意;SIMCOMP/Kamneva 需外部工具)
def gip_kernel(Y, gamma=1.0):
    """高斯交互谱核:由邻接矩阵自身派生(注意标签泄漏,消融需报无 GIP 组)"""
    return np.exp(-gamma * np.square(Y @ Y.T) / Y.shape[1])

K_microbe = gip_kernel(A.values)  # 微生物轴相似度
# K_drug: SIMCOMP 或指纹余弦(外部计算后载入)

# 步骤 7:伪负采样(1:1 主结果;种子必须固化并报告)
rng = np.random.default_rng(seed=2026)  # 种子进协议声明
zeros = np.argwhere(A.values == 0)
neg_idx = rng.choice(len(zeros), size=int(A.values.sum()), replace=False)
negatives = zeros[neg_idx]

复现要点重申:步骤断言的两处 print 是给自建口径用户的口径漂移警告——保持 173×1,373/2,470 才能对 GCNMDA/SCSMDA/BRMDA 一脉出可对标数字;任何一步放宽(少过滤、多保留菌株)都要在论文里声明并放弃横比。

附录 F:三口径登记表

口径 关联/entries 药物 微生物 菌株 文献 语义 使用场景
论文原文 5,055 1,388 180 824 993 数据库快照(含重复证据+菌株级) 引用数据库本体
GCNMDA 转述 5,505 1,388 174 — — 转述漂移(疑似易位) 不使用;仅存照
bio-protocol 混合 5,505 1,388 180 — — 漂移+混拼 不使用;仅存照
去冗基准 2,470 1,373 173 — — 去冗+物种折叠邻接矩阵 关联预测实验、与文献对标
衍生扩展(Deng 2022 系) 1,121 药-病 / 402 菌-病 / 138 菌-菌 / 5,586 药-药 233(异构子图) 73(异构子图) — — 异构工作集 异构图方法输入;非 MDAD 本体规模

附录 G:许可条款细读(三层+上游)

  1. 论文层(确定):CC BY 4.0——Crossref license 记录与 Semantic Scholar openAccessPdf(GOLD/CCBY)双证。覆盖:论文文本、图表。不自动覆盖:数据包。
  2. 数据包层(缺失):GitHub API license=null,仓库无 LICENSE 文件,README 仅一行标题。版权默认状态下数据包"保留所有权利"——但结合论文"数据可获得"声明与作者公开上传行为,合理推定作者无意主张限制性权利。此推定的强度:弱(无书面声明)。
  3. 上游层(继承):数据事实源于 TTD、DrugBank 与 993 篇文献。DrugBank:学术用途免费,商业用途需授权——MDAD 含 DrugBank 链接与条目对齐字段,商用再分发需评估;TTD:按其自身条款;文献事实:事实本身不受版权保护,但表达形式(如逐字摘要)受。
  4. 实操结论:学术使用=引论文+注数据源+用公开包,社区通行且风险可控;商用=先邮件作者(issue 已证 GitHub 无人值守,邮件是唯一正式通道),同时核上游条款。

附录 H:坑点档案(与 §10 对照)

坑 一句话 详述位置 存照证据
坑 1 MDAD 同名歧义 ×3,检索必串 §10 FACTS §1;Zenodo 7480334;doi:10.1007/978-3-030-29888-3_42
坑 2 数字三口径漂移 §4、§10 FACTS §4/§9 存照 1-2
坑 3 官网死链与僵尸引用 §6.1、§10 issue #1(2024-05-08)+ curl HTTP 000(2026-09-28)
坑 4 许可三层推定 §6.2、§10 GitHub API license=null
坑 5 zip 包内结构未验证 §6.5、§10 沙箱阻断直链;FACTS §6 存照 5
坑 6 伪负采样致 AUC 不可横比 §5.3、§10 BRMDA 四档比例表(AUPR 0.9792→0.9232)
坑 7 二手矩阵 provenance §6.1、§10 社区实践观察;无官方脚本
坑 8 物种折叠丢证据强度与菌株细节 §4.2、§10 824 株→173 物种的构造性损失

附录 I:检索决策树

你在找什么?
├── "MDAD" + 微生物/药物语境
│   └── 就是本条目:关键词组合 "MDAD" + (microbe OR drug OR association)
├── "MDAD" + 火星/尘暴
│   └── Mars Dust Activity Database(Zenodo 7480334)——与本条目无关
├── "MDAD" + 驾驶/驾驶员
│   └── in-vehicle Driver Action Dataset(doi:10.1007/978-3-030-29888-3_42)——无关
├── 数字核对
│   ├── 5,055/1,388/180/824/993 → 论文原文(PubMed 30581775)
│   └── 2,470/1,373/173 → GCNMDA 或 SCSMDA 数据节
└── 下载
    └── GitHub Sun-Yazhou/MDAD(唯一通道)——官网链接均为死链,跳过

附录 J:负采样与协议声明模板

在 MDAD 上做实验的论文,方法节建议包含以下声明块(方括号处按实际填写):

数据与口径:我们使用 MDAD(Sun et al., 2018)的社区标准去冗口径:
2,470 条关联,构成 173 微生物 × 1,373 药物的二值邻接矩阵。
折叠流程遵循 GCNMDA 描述:证据级去重 + 物种级折叠 + 特征可用性过滤。
(若自建口径:我们保留 [N] 条关联 / [N] 药物 / [N] 微生物,
未做 [过滤项],故与文献数字不可直接比较。)

负采样:负样本由未观测对 [均匀随机|分层] 采样,负:正 = [1:1];
鲁棒性组:[3:1 / 5:1 / 10:1]。随机种子 = [种子号],全部实验同种子重跑 [R] 次
报告均值±方差。

划分:分层 [5] 折交叉验证;测试折未参与任何特征构造
(GIP 核在每折训练折内重算,防泄漏)。

指标:AUC 与 AUPR 为主指标;ACC/F1 的阈值由训练折 PR 曲线确定。
我们声明:MDAD 无官方划分、无官方评估脚本,本协议为本文自设;
与其他论文的数字比较仅在协议逐项一致时成立。

附录 K:引文规范(BibTeX)

论文本体(数据事实的正式引用源):

@article{sun2018mdad,
  author  = {Sun, Ya-Zhou and Zhang, De-Hong and Cai, Shu-Bin and
             Ming, Zhong and Li, Jian-Qiang and Chen, Xing},
  title   = {{MDAD}: A Special Resource for Microbe-Drug Associations},
  journal = {Frontiers in Cellular and Infection Microbiology},
  volume  = {8},
  pages   = {424},
  year    = {2018},
  doi     = {10.3389/fcimb.2018.00424},
  note    = {PMID: 30581775, PMCID: PMC6292923. Data: github.com/Sun-Yazhou/MDAD}
}

使用去冗口径做实验时,建议并引方法学源头:

@article{gcnmda2022,
  author  = {{GCNMDA authors (A*Star)}},
  title   = {{GCNMDA}: Graph convolutional network with conditional random field
             for microbe-drug association prediction},
  journal = {Bioinformatics},
  year    = {2022},
  note    = {2,470/1,373/173 去冗口径与三数据集并行评估协议的固化源头;
             作者名单以原文献为准}
}

引用纪律:规模表述引 sun2018mdad(5,055 系);实验口径并引 GCNMDA(2,470 系);不要引用任何写有 5,505 的二手转述作为规模出处。

附录 L:姊妹三件套对照总表

维度 MDAD aBiofilm DrugVirus
年份/团队 2018,Sun et al.(深大/矿大) 2018,Rajput et al.(IMTECH) 2020,Andersen et al.
主题 微生物×药物(广谱) 抗生物被膜药物 抗病毒化合物
原始口径 5,055 entries(1,388 药/180 微物) 1,720 agents / 140+ organisms 118 compounds / 83 viruses
去冗口径 2,470(1,373/173) 2,884(1,720/140) 933(175/95,含手补 57 条)
官网 chengroup.cumt.edu.cn/MDAD(死) bioinfo.imtech.res.in/manojk/abiofilm(未逐测) drugvirus.info(未逐测)
原始论文 license CC BY 4.0 开放获取(Frontiers 系) 开放获取
在 GCNMDA 中的角色 主考场 第二考场 第三考场
共同风险 官网单点、零维护、无 dataset card 同构架构,风险同型 同构架构,风险同型

三件套的"原始口径 vs 去冗口径"漂移是同构的——引用任何一个都要双轨记(Q31)。

附录 M:本条目生产档案

  • 生产代理:agent-b-mdad(写手代理纪律包 v3);派发时间 2026-09-28T13:03:48。
  • 租约锁:writing/mdad/.lock = agent-b-mdad 2026-09-28T13:06:34+08:00。
  • 成稿方式:五 part 直写拼接(part1-5,/tmp/mdad_agent-b-mdad_part*.md 唯一化前缀),接缝留空行。
  • 研究通道:WebSearch + WebFetch(沙箱阻断 GitHub/curl 直连下载,官网实测用 curl,GitHub 元数据走 WebFetch/API 页面浏览)。
  • 事实档案:writing/mdad/FACTS.md(九节,双口径七存照+五待核)。
  • slug 查重:url_name ILIKE '%mdad%' 0 行,无撞库。
  • 抓取时点:统一 2026-09-28;引用数 117 为时点动态数。

附录 N:FAIR/AI-Ready 检查单

检查项 状态 说明
F1 元数据有全局唯一标识 部分 doi(论文)在;数据包无 DOI/无版本标识
F2 数据有全局唯一标识 否 zip 无 DOI;GitHub 仓库 URL 是唯一标识
F3 元数据与数据同源可查 部分 论文描述在,但 README 空壳、无 dataset card
A1 元数据可检索 是 PMC/Semantic Scholar/GitHub 均可索引(同名歧义扣分)
A2 数据可访问(协议明确) 部分 直链成立但许可不明(license=null)
I1 数据用标准格式 待验 包内结构未解包确认;标识符(PubMed/Uniprot/DrugBank)标准化好
I2 词汇表可引用 部分 药物/微生物名对齐 DrugBank/学名,但无字段字典
R1 来源可溯 是 逐条 PubMed 证据指针——本数据集最强项
R2 结构化 lineage 部分 论文描述了流程,无脚本无版本
R3 与社区标准对齐 部分 基准口径社区约定俗成,无官方协议
AI-Ready 综合中下 4.8/10 附录 B DAIMS;可复现实验矩阵但工程环节数项缺失

附录 O:缩写速查

缩写 全称/释义
MDAD Microbe-Drug Association Database(本条目;另有火星尘暴库与驾驶动作库同名,坑 1)
GIP Gaussian Interaction Profile kernel,高斯交互谱核
SIMCOMP 药物 2D 结构相似性算法(图匹配)
GCN Graph Convolutional Network,图卷积网络
CRF Conditional Random Field,条件随机场
GCNMDA GCN+CRF 的微生物-药物关联预测方法(Bioinformatics,A*Star)
SCSMDA 自对比学习系关联预测方法(Briefings in Bioinformatics 2023)
BRMDA 随机游走+集成学习系方法(Frontiers Genetics 2026)
TTD Therapeutic Target Database,治疗靶点数据库
CV Cross-Validation,交叉验证
AUC / AUPR ROC 曲线下面积 / 精确率-召回率曲线下面积
IMTECH 印度微生物技术研究所(aBiofilm 团队所在)
MDA 火星库 Mars Dust Activity Database(同名异物)
DAIMS 本库数据集五维评估框架(附录 B)

附录 P:维护计划与触发点

本条目按以下触发点维护(按优先级):

  1. MDAD.zip 解包:任何用户成功解包后,包内文件清单、字段字典、记录级抽查应回填 §2 与坑 5、附录 E——这是当前最大的信息缺口。
  2. 仓库异动:GitHub 仓库若出现新 commit、LICENSE 文件或 issue 回应,§6 与坑 3/4 整体改写;若仓库被删除,本条目自动升级为"数据集失存"档案案例。
  3. 许可声明:作者若发布任何书面许可(LICENSE/README 补充),坑 4 与 §6.2 的推定链立即替换为事实。
  4. 姊妹库可达性:aBiofilm/DrugVirus 官网逐测后回填 §8.5 表(存照待核④)。
  5. 引用数漂移:Semantic Scholar 117 为动态数,年度复查即可,不追更。
  6. 上游重建动向:若社区出现 MDAD 重建/扩展版(TTD/DrugBank 2026 快照),在 §8.4 增补"后继重建"小节并互链。

附录 Q:基于本数据集的研究检查清单(12 项)

  1. 已解包 MDAD.zip 并核对包内结构与记录总数(对齐 5,055 或声明偏差)。
  2. 已确定口径(2,470 基准或自建)并在全文一致使用。
  3. 折叠脚本逐条对照 GCNMDA 描述(§4.4),药物过滤逻辑已写明。
  4. 负采样策略、比例、种子已固化并写入方法节(附录 J 模板)。
  5. GIP 泄漏已控制(测试折不参与核构造),消融含"无 GIP"组。
  6. 主指标 AUPR、辅指标 AUC;阈值确定方式已声明。
  7. 至少一组非 1:1 的鲁棒性结果(10:1)。
  8. baseline 含相似度核方法与 GCNMDA 至少各一。
  9. 未与协议不一致的"SOTA"横比;所有比较已逐项核对协议。
  10. 引用规范:规模引 Sun et al. 2018(5,055),实验口径并引 GCNMDA。
  11. 局限段已含:2018 快照、仅正样本、无证据分级、菌株折叠损失。
  12. 数据指纹(sha256+抓取时点+commit)已留档于研究记录。

附录 R:记录字段预期映射(示意,以解包实测为准)

论文声明字段与本条目预期的存储形态对照——此表是解包前的工作假设,不是对包内真实结构的陈述(存照 5):

论文声明字段 预期形态 解包时验证什么
drug name 文本列,与 DrugBank 名对齐 命名规范(大写/盐形)
microbe name 文本列,物种或菌株名 学名拼写一致性、菌株列是否独立
PubMed ID 整数列或超链 是否一关联多 PMID(entries 语义的证据)
分子式/DrugBank 链接 文本列 分子式空缺时是否以链接补位
strain 文本列或独立表 824 株的标识格式(ATCC 编号等)
microbe target 文本列+Uniprot 链接 蛋白/RNA 如何区分

验证方法:解包后先 find 列文件清单,再对每个表跑 wc -l 与表头抽查,把实测清单回填本表与坑 5(触发点见附录 P 第 1 项)。

附录 S:MDAD 年表(2018-2026)

时点 事件 来源
2018-10-29 12:22 GitHub 仓库 Sun-Yazhou/MDAD 创建 GitHub API(FACTS §2)
2018-10-29 12:40 最后一次推送(4 commits 全部完成,MDAD.zip 上传,d12faf9) GitHub API
2018-12-07 论文 online(Front Cell Infect Microbiol 8:424) Crossref
2019-2021 相似度核方法时代,MDAD 成为默认考场之一 §8.2 方法谱系
2022 GCNMDA(Bioinformatics,A*Star)固化 2,470 去冗口径与三件套并行评估 GCNMDA 论文
2023 SCSMDA(Briefings in Bioinformatics)独立复述同一口径——第二互证 doi:10.1093/bib/bbac634
~2024 年中 官网 chengroup.cumt.edu.cn/MDAD 失效,无任何公告 §6.1 存照 3
2024-05-08 用户在 GitHub issue #1 公开报告官网失效(至今 open 无回应) GitHub issue
2024 bio-protocol 发表使用 MDAD 的实验方案(混合口径 5,505×180 入册) bio-protocol 2024
2026 BRMDA(Frontiers Genetics)给出负采样敏感性四档结果 fgene.2026.1757318
2026-09-28 本条目核验:官网 HTTP 000;仓库 0 star/0 fork/license null;引用 117 FACTS.md 全文

年表的两条骨架读法:数据本体在 2018-10-29 一天内定稿,此后八年唯一的"事件"都是外部世界对它的引用与遗忘;官网死亡(约 2024)与 issue 报告(2024-05)之间隔了不知道多久——没人能说出确切的死亡日期,这正是静默衰变的定义。

尾注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-28,抓取与核验时点见附录 A。事实陈述以论文(Front Cell Infect Microbiol 2018;8:424)、GitHub API/页面实测、Semantic Scholar 与下游方法论文(GCNMDA/SCSMDA/BRMDA)为源;论文口径与基准口径的双轨数字、转述链漂移(5,505/174/180 混拼)、官网死亡与许可缺失等原始文档缺陷已在坑点与附录 F/H 存照。条目与库内 drugbank(rid 89/571)、ttd(rid 409)、string(rid 414)、drugcentral(rid 344)、chembl(rid 572/85)、drugcomb(rid 274)互链,构成"文献策展型药物知识库"家族中微生物视角的完整检索面。后续维护触发点见附录 P。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • pubchem-pcba — 共享标签:药物发现与化学 / 化学信息学 / 评测基准
  • tdc — 共享标签:药物发现与化学 / 化学信息学 / 评测基准
  • ttd — 共享标签:药物发现与化学 / 化学信息学 / 知识图谱
  • chebi — 共享标签:药物发现与化学 / 化学信息学 / 知识图谱
  • pcqm4mv2 — 共享标签:药物发现与化学 / 化学信息学 / 评测基准
  • dgidb — 共享标签:药物发现与化学 / 化学信息学 / 知识图谱
  • moleculenet — 共享标签:药物发现与化学 / 化学信息学 / 评测基准
  • lit-pcba — 共享标签:药物发现与化学 / 化学信息学 / 评测基准
  • plinder — 共享标签:药物发现与化学 / 化学信息学 / 评测基准
  • iuphar-bps — 共享标签:药物发现与化学 / 化学信息学 / 知识图谱

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集