信息速览

LIT-PCBA — 真实实验来源的虚拟筛选基准 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | LIT-PCBA |
| 英文全称 | Literature-derived PubChem BioAssay(LIT-PCBA: An Unbiased Data Set for Machine Learning and Virtual Screening) |
| 别名/简称 | LIT-PCBA、LIT PCBA |
| 疾病分类(ICD-11) | 多靶标覆盖:2A00(中枢神经系统肿瘤,IDH1/MAPK1/MTORC1 相关)、2C60(乳腺恶性肿瘤,ERα)、5A11(2 型糖尿病,PPARG)、CA23(哮喘,ADRB2)、MG30(慢性疼痛,OPRK1)等 |
| SNOMED CT | 363346000(恶性肿瘤)、73211009(糖尿病)、195967001(哮喘)、22253000(疼痛)等概念域;LIT-PCBA 标注对象是分子-靶标活性而非疾病实体 |
| 数据模态 | 小分子 2D SMILES + 3D Mol2 构象 + X 射线共晶受体结构(PDB) |
| AI 任务类型 | 二分类虚拟筛选、命中富集排序、机器学习打分函数、分子-靶标活性预测 |
| 样本总数 | 15 个靶标集;7,844 活性 + 407,381 非活性(2020 论文口径) |
| 数据格式 | SMI/SMILES、Tripos Mol2、PDB、官方 train/val 划分文件 |
| 许可证 | 官网数据免费下载(未声明统一数据许可);论文 SI 为 CC BY-NC 4.0 |
| 访问级别 | 开放 |
| DUO 标签 | 不适用(非人类受试者数据;无基因组/临床表型信息) |
| 语言 | 英文 |
| 首发日期 | 2020-04(论文 ACS Web 出版 2020-04-13) |
| 最后更新 | 官网持续维护(2026-09 核对官网当前版本) |
| 发布机构 | Laboratoire d’Innovation Thérapeutique, UMR 7200 CNRS–Université de Strasbourg(法国) |
| 官方主页 | http://drugdesign.unistra.fr/LIT-PCBA/ |
| 下载地址 | http://drugdesign.unistra.fr/LIT-PCBA/(Full data 与 AVE unbiased data 两个包) |
| DOI | 10.1021/acs.jcim.0c00155 |
| 引用次数 | 297+(Google Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 官方提供 AVE 训练/验证划分与多格式结构文件,可直接加载;扣分项:无官方一键预处理脚本、Mol2 存在缺键与重复/立体异构体治理问题,需自行清洗 |
| 页面状态 | published |
§0 E-E-A-T 专家审核声明
- 医学审核者:[千方病案医学编辑部] 交叉审核:§2 医学背景(15 个分子靶标的治疗领域与 ICD-11/SNOMED CT 映射)、§7 偏倚分析(错标活性、表型试验局限)。
- 数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略(AVE)、§6 预处理 Pipeline 和坑点。
- 审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。LIT-PCBA 数据由斯特拉斯堡大学官网免费提供下载,但官网未声明统一的数据许可证;原始论文版权归美国化学会(ACS),补充材料为 CC BY-NC 4.0。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? LIT-PCBA 是一个"从真实实验里来"的药物筛选基准数据集。它没有像此前流行的 DUD-E 那样人工制造"假装没活性的诱饵分子",而是直接从美国国家生物技术信息中心的 PubChem 数据库中,挑出 149 个带剂量-响应曲线的高通量筛选试验,把里面真正测过的活性分子与真正测过没活性的分子成对保留下来,覆盖 15 个药物靶标,约 41.5 万个化合物。
为什么重要? 2019 年前后多项研究发现,DUD-E 等人工基准暗藏"化学捷径"——模型靠分子长相记忆就能拿高分,虚拟筛选方法的真实能力被系统性高估。LIT-PCBA 用真实实验数据加"不对称验证嵌入(AVE)"去偏处理,让基准第一次接近真实制药筛选的场景:命中稀少、化学空间不规整、没有捷径可走。
我能用它做什么? 训练与评测分子活性分类模型(ECFP 指纹 + 随机森林/XGBoost/图神经网络)、评测分子对接与打分函数(每个靶标都配了 X 射线晶体结构和共晶配体)、研究类不平衡学习与去偏方法,以及做基准数据集本身的偏倚审计——2025 年那场关于"数据泄漏 vs 立体异构体折叠"的学术争论,就是围绕它展开的。
§1.1 技术摘要
LIT-PCBA 的构建是一条层层收敛的漏斗:从 PubChem BioAssay 收集 149 个剂量-响应试验 → 清除假阳性与试验伪影(排除已知聚集物诱导剂、荧光素酶抑制剂、自荧光分子,活性分子须满足 Hill 斜率 0.5–2.0 的剂量-响应曲线,元素仅允许 C/H/N/O/P/S 与卤素)→ 收敛到 21 个候选靶标集 → 用三类正交方法(2D 指纹相似性、3D 形状相似性、分子对接)预筛,要求至少一类方法对某靶标的 top 1% 排序化合物能达到不低于 2 倍的真活性富集 → 保留 15 个靶标集 → 对每个靶标的活性/非活性配体施用 AVE(Asymmetric Validation Embedding)嵌入,使训练集与验证集在多维特征空间中互不聚簇,抑制化学系列偏倚与负例选择偏倚。最终 2020 论文口径为 15 个靶标集、7,844 个确认活性与 407,381 个确认非活性化合物(AVE 前 9,780/407,839,官网当前口径 7,761/382,674),按靶标活性比约 1:19 至 1:1,792,模拟真实筛选库的命中率与效力分布(Tran-Nguyen et al., 2020, J Chem Inf Model)。
三个设计决策值得展开:其一,"确认型"标签而非"初筛型"标签——所有活性分子必须呈合格剂量-响应曲线,这与许多直接采用单点 HTS 读出的基准(包括 MoleculeNet 的 PCBA 任务)本质不同;其二,活性与非活性同试验配对——每个靶标的正负例来自同一试验的同一浓度窗口与同一读出体系,消除了"活性来自 A 试验、非活性来自 B 试验"式的条件混杂;其三,双路线资产配套——每个靶标同时发放 2D SMILES(配体路线)与 X 射线结构/共晶配体(结构路线),使一个基准能同时约束两类方法学社区,避免"各玩各的基准"。这三点共同解释了为什么 LIT-PCBA 能在 DUD-E 偏倚被系统揭露后迅速接棒成为事实标准(Huang et al., 2025, arXiv:2507.21404)。
§1.2 战略价值
维度一:方法论价值——"实验来源诱饵"终结人工诱饵时代。 DUD-E 的诱饵分子由程序按理化性质匹配生成,Chen 等人 2019 年证明其隐藏的类似物偏倚会让深度学习模型"靠长相蒙题"(Chen et al., 2019, PLoS ONE)。LIT-PCBA 的全部非活性分子都来自真实实验"测过没活性"的记录,消除了人工诱饵的结构伪影,成为 ML 虚拟筛选论文的事实标准基准(Huang et al., 2025, arXiv:2507.21404)。对研究者而言,在 LIT-PCBA 上的结果比在 DUD-E 上更接近前瞻性真实场景。
维度二:工程价值——一条"难以作弊"的赛道推动评测规范演进。 由于 AVE 去偏 + 真实不平衡比例,任何在 LIT-PCBA 上声称的先进性都必须回答"scaffold 泛化还是记忆"的问题;2025 年的数据完整性审计与后续的立体异构体澄清,直接催生了"canonical SMILES 是否保立体"等评测细节规范。数据集同时提供配体(SMILES/构象)与结构(PDB/共晶配体)两套接口,使配体虚拟筛选、结构打分函数、对比学习检索(如 DrugCLIP、CHEESE 一族)三类方法可在同一基准上横向对话(Yang, Chen & Zhang, 2022, Molecules)。
维度三:教育与审计价值——基准质量研究的活教材。 LIT-PCBA 的生命周期完整呈现了"基准—审计—反驳—规范化"的现代数据治理循环:2025 年审计论文公开泄漏检测脚本,社区复现指出立体化学折叠假象,双方共同沉淀出"类似物感知审计框架"与零参数记忆基线等可复用工具(Huang et al., 2025;Lzicar 复现博客)。对数据科学教育而言,这是讲授"数据泄漏如何伪装成模型进步"的最佳案例库之一;对数据治理团队而言,其审计脚本可直接改造为内部数据集入库前检查器。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 诱饵/非活性来源 | 类不平衡 | 去偏机制 | 与 LIT-PCBA 的差异化 |
|---|---|---|---|---|---|
| LIT-PCBA | 15 靶标;7,844 活性 + 407,381 非活性(论文口径) | 真实 PubChem 试验未命中记录 | 约 1:19 至 1:1,792(按靶标) | AVE 嵌入 + 性质范围匹配 | 实验来源、双路线(配体+结构)、最接近真实筛选 |
| DUD-E | 102 靶标;约 22,886 活性 + 约 140 万诱饵 | 程序生成性质匹配诱饵 | 约 1:50(人为近似平衡) | 性质匹配(仅一维空间) | 靶标多但存在类似物/诱饵偏倚(Chen 2019) |
| MUV | 17 靶标;每组 30 活性 + 15,000 非活性 | 真实 PubChem 试验 | 约 1:500 | 多维特征空间去偏 | 活性极少,主要用于相似性检索评测 |
| DUDE-Z | DUD-E 升级重制版 | 实验验证据与重生成诱饵 | 接近 DUD-E | 改进诱饵生成 | 2023 年后兴起,与 LIT-PCBA 互补但历史数据可比性弱 |
(来源:各数据集原始文献与 Huang et al., 2025 导言综述。)
§1.4 版本时间轴
| 时间 | 版本/事件 | 说明 |
|---|---|---|
| 2020-04-13 | 论文 ACS Web 出版(v1 基准) | 15 靶标;7,844 活性 + 407,381 非活性(AVE 后口径) |
| 2020-04-23 | SI 补充材料于 figshare 发布 | CC BY-NC 4.0 |
| 2020–2021 | 官网提供 Full data 与 AVE unbiased data 两个下载包 | AVE 前口径 9,780/407,839 |
| 2021–2025 | 成为 ML 虚拟筛选事实标准基准 | GNINA、MILCDock、DrugCLIP、SPRINT、DENVIS、CHEESE 等先后在榜 |
| 2025-07/08 | 数据完整性审计论文(arXiv:2507.21404,v1/v2) | 报告跨集重复与类似物冗余;立体异构体折叠争议 |
| 2026-09 | 官网当前口径核对 | 首页显示 7,761 活性 + 382,674 非活性(unique) |
§1.5 典型应用场景
- 机器学习打分函数与活性分类基准:以 ECFP4 指纹 + RF/XGBoost 或图神经网络,按官方 AVE 划分报告 ROC-AUC、PR-AUC 与 EF1%(Shen et al., 2021, Brief Bioinform)。
- 分子对接与打分函数评测:15 个靶标均配 X 射线结构(13/15 有多模板)与共晶配体查询集,可测 GOLD、Glide、Surflex-Dock、GNINA 等的早期富集(Yang, Chen & Zhang, 2022, Molecules)。
- 3D 形状与静电检索:单构象/多构象 ROCS、CHEESE 一类向量空间方法在 query 集上的 EF1% 检索评测。
- 类不平衡与去偏方法研究:1:19 至 1:1,792 的真实比例是研究焦点损失、重采样、校准方法的天然试验场。
- 基准偏倚审计方法论:复现 2025 年审计与立体异构体澄清,开发"类似物感知"的基准质量检查框架(Huang et al., 2025;GitHub: sievestack/LIT-PCBA-audit)。
§2 医学背景
§2.1 靶标-治疗领域 ICD-11 映射
LIT-PCBA 标注的对象是"分子-靶标"活性对,靶标本身关联多个治疗领域。下表给出 15 个靶标集的领域映射与代表性 ICD-11 编码:
| 靶标(官方写法) | 蛋白/功能 | 活性表型 | 关联治疗领域 | 代表性 ICD-11 |
|---|---|---|---|---|
| ADRB2 | β2 肾上腺素受体(GPCR) | 激动剂 | 哮喘与慢性阻塞性气道病、心血管 | CA23 |
| ALDH1 | 醛脱氢酶 1 | 抑制剂 | 肿瘤干细胞标志、多癌种 | 2A00–2F9Z(恶性肿瘤章节) |
| ESR_ago | 雌激素受体 α | 激动剂 | 绝相关疾病、乳腺恶性肿瘤 | 2C60 |
| ESR_antago | 雌激素受体 α | 拮抗剂 | 乳腺恶性肿瘤(内分泌治疗) | 2C60 |
| FEN1 | 瓣状内切核酸酶 1 | 抑制剂 | DNA 修复相关恶性肿瘤 | 2A00–2F9Z |
| GBA | 葡萄糖脑苷脂酶 | 抑制剂 | 溶酶体贮积症与帕金森病相关机制 | 5C56(遗传代谢病章节) |
| IDH1 | 异柠檬酸脱氢酶 1 | 抑制剂 | 神经上皮肿瘤(胶质瘤)代谢治疗 | 2A00 |
| KAT2A | 组蛋白乙酰转移酶 KAT2A(GCN5) | 抑制剂 | 表观遗传相关恶性肿瘤 | 2A00–2F9Z |
| MAPK1 | 丝裂原活化蛋白激酶 1(ERK1) | 抑制剂 | MAPK 通路相关多癌种 | 2A00–2F9Z |
| MTORC1 | 雷帕霉素靶蛋白复合物 1 | 抑制剂 | mTOR 通路恶性肿瘤、代谢 | 2A00–2F9Z;5A11 |
| OPRK1 | κ 阿片受体 | 激动剂 | 疼痛管理、成瘾相关障碍 | MG30 |
| PKM2 | 丙酮酸激酶 M2 同工酶 | 抑制剂 | Warburg 效应相关恶性肿瘤 | 2A00–2F9Z |
| PPARG | 过氧化物增殖物激活受体 γ | 抑制剂 | 代谢性疾病(2 型糖尿病) | 5A11 |
| TP53 | 细胞肿瘤抗原 p53 | 抑制剂(p53-Y220C 稳定界面) | 多癌种抑癌基因靶向 | 2A00–2F9Z |
| VDR | 维生素 D 受体 | 抑制剂 | 骨与矿物质代谢、皮肤疾病 | 5B5(代谢性骨病相关) |
(靶标与表型来自官网 15 个 target sets;领域映射为编辑部基于靶标生物学整理。)
§2.1b SNOMED CT 映射
| 治疗领域标签 | ICD-11 | SNOMED CT | 术语 |
|---|---|---|---|
| 恶性肿瘤(ALDH1/IDH1/KAT2A/MAPK1/MTORC1/PKM2/TP53/FEN1 相关) | 2A00–2F9Z | 363346000 | malignant neoplastic disease(恶性肿瘤) |
| 乳腺恶性肿瘤(ESR_ago/ESR_antago) | 2C60 | 254837009 | malignant tumor of breast(乳腺恶性肿瘤) |
| 2 型糖尿病(PPARG/MTORC1 代谢方向) | 5A11 | 44054006 | diabetes mellitus type 2(2 型糖尿病) |
| 哮喘(ADRB2) | CA23 | 195967001 | asthma(哮喘) |
| 慢性疼痛/镇痛(OPRK1) | MG30 | 22253000 | pain(疼痛) |
| 佝偻病/骨矿化异常(VDR) | 5B5Y(维生素 D 代谢异常相关) | 399269003 | rickets(佝偻病) |
(SNOMED CT 码为国际版概念码;LIT-PCBA 本身不含疾病标注,映射仅供检索与分级使用。)
§2.2 靶标生物学与流行病学背景
15 个靶标横跨 GPCR(ADRB2、OPRK1)、核受体(ESR1、PPARG、VDR)、代谢酶(GBA、IDH1、PKM2、ALDH1)、激酶(MAPK1、MTORC1)、表观与 DNA 修复酶(KAT2A、FEN1)与抑癌蛋白(TP53)五大类。这一组合决定了 LIT-PCBA 的医学覆盖面:乳腺癌内分泌治疗(ERα 激动/拮抗双集合是唯一按表型拆分的靶标)、IDH1 突变胶质瘤的代谢疗法、ERK/MTOR 通路靶向、2 型糖尿病的 PPARγ 药理、镇痛与成瘾领域的 κ 受体调控。PubChem 来源的试验多数为制药公司捐赠的高通量筛选(HTS)与确证试验,化合物库规模从数千到三十万不等,剂量-响应确认使"活性"标签具有浓度-效应证据,而非单点荧光读出(Tran-Nguyen et al., 2020)。
按治疗领域展开:
- 肿瘤相关(8/15 靶标集):IDH1 抑制剂(如艾伏尼布类机制)针对 IDH1 突变胶质瘤的 2-HG 代谢异常;MAPK1(ERK1)与 MTORC1 是 MAPK/PI3K 两条核心增殖通路的节点;TP53 集对应的其实是 p53-Y220C 突变体重稳定剂这一"不可成药"方向;PKM2 关联 Warburg 效应;FEN1 与 KAT2A 分别代表 DNA 修复与表观乙酰化依赖;ALDH1 既是肿瘤干细胞标志也是正常造血与解毒酶系成员。
- 内分泌与代谢(3/15):ESR1 按激动/拮抗拆分双集合,直接对应乳腺癌内分泌治疗与绝经后管理的药理两端;PPARG 与 VDR 是核受体家族中糖尿病与骨代谢的两大经典药靶。
- 神经与心血管(2/15):ADRB2 集为激动剂(对应支气管扩张方向),OPRK1 集亦为激动剂(对应κ受体镇痛/成瘾机制研究);两者都来自 GPCR 药理的 cAMP 读出试验传统。
- 溶酶体贮积(1/15):GBA(葡萄糖脑苷脂酶)抑制剂集服务于戈谢病机制研究与帕金森病风险修饰探索,是 15 个靶标里最"罕见病"色彩的一个。
这种"肿瘤为主、代谢内分泌次之、GPCR 神经心血管点缀"的构成,与其说是刻意设计,不如说是 2010 年代制药 HTS 捐赠试验的自然分布——它也提醒使用者:LIT-PCBA 的靶标谱不能代表全部药物靶标空间(离子通道、抗感染靶标等缺席),跨靶标结论只在该谱系内有效。
§2.3 临床任务定义
LIT-PCBA 对应的临床-转化任务是早期药物发现中的命中发现,而非诊断或预后:
- 虚拟筛选(VS):给定化合物库与靶标(配体或结构信息),将化合物按命中概率排序,目标是让 top 1% 排序中真活性化合物富集倍数(EF1%)尽可能高。
- 二分类建模:以 SMILES/指纹/图为输入预测"该分子对该靶标是否有剂量-响应活性"。
- 打分函数评测:结构路线中,对接程序给"配体-受体复合物"打分,排序恢复实验活性。
与临床 AI 任务(筛查/诊断/分级/预后)的对应关系是"间接类比"而非直接同构:虚拟筛选的"富集排序"在方法论上与筛查任务的"风险排序"同源(两者都关心排序头部 precision 与早期检出),因此类不平衡学习、校准与早期检出指标的方法论可以互通;但标签语义完全不同——LIT-PCBA 的"阳性"是分子-靶标生化作用证据,不是患者疾病状态,任何把两者混为一谈的表述都是医学信息学层面的错误。
在临床转化链条上,它位于"靶标确认之后、先导物优化之前"的起点环节;模型输出的"命中"须经体外活性复测与 ADME/安全性评估才能进入药物开发流程,与任何临床决策无直接接口。
§2.4 数据覆盖人群(化合物来源)
本数据集无患者人群;下表描述化合物试验覆盖:
| 维度 | 覆盖情况 |
|---|---|
| 数据来源 | PubChem BioAssay 公共试验库(149 个剂量-响应试验) |
| 试验类型 | 高通量筛选(HTS)+ 确证剂量-响应试验;多数 primary 试验为细胞表型试验 |
| 化合物规模 | 15 个靶标集合计约 41.5 万个唯一化合物(论文口径) |
| 活性/非活性比 | 按靶标约 1:19 至 1:1,792 |
| 元素范围 | 仅 C/H/N/O/P/S 与卤素的有机分子 |
| 效力分布 | 模拟真实 HTS 库的效力分布(非只含高效力分子) |
§2.5 临床价值与转化路径
对计算药物发现团队,LIT-PCBA 的价值在于以回溯性基准预演前瞻性筛选:在提交数十万化合物的真实筛选预算前,先用该基准量化方法的早期富集能力与失效模式。对医学信息团队,其价值在于把"靶标-化合物-活性证据"标准化为可复算的公开数据,支持药物警戒与再利用分析。需要强调:LIT-PCBA 上的高分数不构成任何临床有效性证据;命中分子须经过体外复测、细胞功能验证与动物模型,方谈得上医学转化。
转化链条上,该基准支撑的模型能力对应三类下游动作:其一,筛选设计——用基准测得的 EF1% 估计"从 N 个化合物里捞出一个真命中"的期望成本,辅助决定虚拟筛选与湿实验筛选的配比;其二,优先级排序——把模型打分作为化合物购买/合成的排序信号,压缩先导发现周期;其三,方法选型——在同一基准上比较自研方法与开源方法(GNINA、指纹 + XGBoost 等),避免重复造轮子。每一步的输出都停留在"候选化合物排序"层面,距离临床决策有完整的新药研发流程之隔。
§2.6 金标准对照(标注方式)
| 划分维度 | LIT-PCBA 的做法 |
|---|---|
| 标注方式 | 实验测定:活性 = 通过全部过滤器且呈合格剂量-响应曲线;非活性 = 同一试验中未检出且通过同一理化过滤器 |
| 标注者 | 原始试验执行机构(制药公司/公共实验室,经 PubChem 收录),构建者做程序化清洗 |
| 标注性质 | 剂量-响应(确认型)为主,非单点初筛 |
| 去偏划分 | AVE 嵌入保证训练/验证互不聚簇;约 3:1 划分(Shen et al., 2021) |
| 查询集 | 各靶标共晶配体(来自 PDB),作为"未见"参照 |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 获取入口 | 理由与注意 |
|---|---|---|---|
| 训练 + 验证 ML 模型(标准协议) | AVE unbiased data | 官网 “Download AVE unbiased data here” | 含官方 train/val 嵌入式去偏划分,社区结果可与 GNINA、Shen 等工作对齐 |
| 自行设计划分/做泄漏审计 | Full data | 官网 “Download Full data here” | 未做 AVE 的全量 9,780/407,839(含跨靶标重复),自由度高但必须自证去偏 |
| 与 2020 论文数字严格对齐 | 论文 SI + 2020 官网存档 | figshare SI(CC BY-NC 4.0) | 官网数字随维护更新(2026-09 为 7,761/382,674),论文口径 7,844/407,381 |
| 复现 2025 审计与修正基线 | audit 仓库校验脚本 | GitHub: sievestack/LIT-PCBA-audit | 含泄漏/重复检测代码与"记忆化基线";注意其立体化学处理争议 |
§3.1 模态详情
- 2D 结构(SMI/SMILES):每个靶标集的 actives 与 inactives 各一份 SMILES 文件,是机器学习建模的主接口;文件按"SMILES 分子标识"逐行组织。
- 3D 构象(Tripos Mol2):为结构/形状路线准备的配体三维构象;audit 论文指出部分 Mol2 缺少键级信息,从 Mol2 反推分子身份需结合 RCSB 手工校正(Huang et al., 2025)。
- 受体结构(PDB):每个靶标至少 1 个、最多 15 个 X 射线共晶结构(13/15 靶标为多模板),直接从 RCSB 可复核;JCC 2022 协议示例使用 5l2m、5ufx、5fv7、2v3d、5mlj、4zzn、4dri、3gr4、3a2j 等条目(JCC 2022)。
- 查询集(query):各靶标共晶配体,用于相似性/形状检索路线的"参照分子";audit 论文提醒个别靶标 query 集近重复比例高(部分靶标超 80% 的 query 配体 Tanimoto ≥ 0.9)。
- 划分文件(AVE 包):官方 train/val 嵌入式去偏划分,约 3:1。
§3.2 按靶标子集构成
15 个靶标集与官方登记信息(官网,2026-09 检索;官网逐集 actives 口径单列,论文 AVE 后合计 7,844 actives / 407,381 inactives):
| # | 靶标集 | 蛋白(官网命名) | 活性表型 | 官网当前 actives 口径 |
|---|---|---|---|---|
| 1 | ADRB2 | Beta2 adrenergic receptor | Agonists | 17 |
| 2 | ALDH1 | Aldehyde dehydrogenase 1 | Inhibitors | 5,363 |
| 3 | ESR_ago | Estrogen receptor alpha | Agonists | 13 |
| 4 | ESR_antago | Estrogen receptor alpha | Antagonists | 88 |
| 5 | FEN1 | Flap endonuclease 1 | Inhibitors | 360 |
| 6 | GBA | Glucocerebrosidase | Inhibitors | 163 |
| 7 | IDH1 | Isocitrate dehydrogenase 1 | Inhibitors | 39 |
| 8 | KAT2A | Histone acetyltransferase KAT2A | Inhibitors | 194 |
| 9 | MAPK1 | Mitogen-activated protein kinase 1 | Inhibitors | 308 |
| 10 | MTORC1 | Mechanistic target of rapamycin | Inhibitors | 97 |
| 11 | OPRK1 | Kappa opioid receptor | Agonists | 24 |
| 12 | PKM2 | Pyruvate kinase muscle isoform 2 | Inhibitors | 546 |
| 13 | PPARG | Peroxisome proliferator-activated receptor gamma | Inhibitors | 24 |
| 14 | TP53 | Cellular tumor antigen p53 | Inhibitors | 64 |
| 15 | VDR | Vitamin D receptor | Inhibitors | 655 |
注意三点:其一,官网首页合计为 7,761 actives / 382,674 unique inactives(官网随维护微调,与论文 7,844/407,381 存在版本差异,引用时须注明口径);其二,多数靶标的活性分子极少(ADRB2、ESR_ago、IDH1、OPRK1、PPARG、MTORC1 均不足百个),Shen 等 2021 年指出 15 个靶标中仅 7 个训练集活性数超过 100(Shen et al., 2021);其三,非活性计数在不同文献中随是否按 unique 去重而不同,比较时务必统一口径。
§3.3 数据格式
| 内容 | 格式 | 说明 |
|---|---|---|
| 配体 2D | .smi(SMILES) | 逐行"SMILES 标识";ML 主接口 |
| 配体 3D | Tripos Mol2 | 对接/形状检索用;注意缺键级问题 |
| 受体 | PDB | X 射线共晶结构,可从 RCSB 交叉核对 |
| 查询集 | Mol2 + SMILES | 共晶配体参照 |
| 划分 | 官方 train/val 文件 | AVE 嵌入式划分(约 3:1) |
§3.4 存储大小
官网下载页未标注分发包总大小;两包分别为 15 个靶标的 2D SMILES 与 3D Mol2 全量结构(Full data)及其 AVE 去偏子集(AVE unbiased data)。实践上本地磁盘预留 1–2 GB(含 Mol2 解压与中间特征缓存)足以完成常规流程;PDB 受体文件另从 RCSB 按需下载。
| 内容物 | Full data 包 | AVE unbiased 包 |
|---|---|---|
| 活性分子 | 9,780(含跨靶标重复) | 7,844(论文口径,官网当前 7,761) |
| 非活性分子 | 407,839(含跨靶标重复) | 407,381(unique) |
| train/val 划分文件 | 无(自行划分) | 有(AVE 约 3:1) |
| 受体 PDB / query 集 | 有(15 靶标) | 有(15 靶标) |
两包差集 = 被 AVE 嵌入调整掉的分子的完整记录;做划分研究(如重新设计 scaffold split)时保留 Full data 包作对照是良好实践。
§3.5 标注方式
- 活性(1):在对应 PubChem 剂量-响应试验中呈合格曲线(Hill 斜率 0.5–2.0),且通过全部"真活性"过滤器:仅含 C/H/N/O/P/S 与卤素、非已知 PubChem 聚集物、非荧光素酶抑制剂、非自荧光分子(JCC 2022 转述)。
- 非活性(0):同一试验中未检测为命中的分子,且通过同一套有机/理化过滤器。注意这是"单次试验未命中"而非"确认无活性"。
- 划分标注:AVE 嵌入把每个靶标的配体分为 train/val(约 3:1),使训练集与验证集在选定特征空间互不聚簇。
§3.6 标注者资质与一致性
标注证据链由原始试验机构(多为制药公司捐赠的 HTS/确证试验与 NIH 系公共试验)产生,经 PubChem 标准化收录;LIT-PCBA 构建者(斯特拉斯堡大学 LIT 实验室)以程序化规则清洗与筛选,无人工逐分子标注环节,因此不存在标注者间一致性系数。数据质量争议集中在试验本身(如细胞表型试验的靶标归因),见 §7。
§3.7 采集周期
底层数据为 PubChem 持续收录的公共/捐赠试验( HTS 与确证剂量-响应试验),数据集在发布前做统一快照处理,论文 2020-04 出版;构建论文未给出各试验的采集年份字段,分子级亦无时间戳,因此严格的时间划分在该数据上不可构造。官网随后进行过小规模维护更新(2026-09 口径与论文有差异)。temporalCoverage 按发布快照记为 2010/2020。
§3.8 地域覆盖
PubChem 公共试验汇聚全球来源,无地域限定字段;spatialCoverage 记为"全球"。
§3.9 结构/试验规格
- 晶体结构分辨率:官网为每靶标列出 PDB 模板,13/15 靶标多模板;下游工作常按分辨率与口袋完整性挑选单模板(JCC 2022 即按高分辨率原则选定)。多模板意味着"模板选择"本身是协议自由度(坑点 5),GNINA 与 Smina 两项工作的同引擎 EF1% 差异即部分源于模板数不同。
- 试验读出:荧光/发光为主(PubChem HTS 常规),这也是过滤器排除荧光素酶抑制剂与自荧光分子的原因。
- 理化性质窗口:活性与非活性配体被约束在相近的分子性质范围(分子量、logP 等)内,防止分类器靠"活性分子更小/更亲脂"这类一维捷径得分——这是 DUD-E 式一维匹配的超集升级。
- 效力分布:活性分子的效力呈 HTS 库典型分布(微摩尔级为主),刻意避免了"只收录纳摩尔级高活性分子"的乐观偏差,使基准的命中难度贴近真实筛选。
§3.10 深度溯源链
| 环节 | 内容 | 可回溯方式 |
|---|---|---|
| 原始证据 | 149 个 PubChem 剂量-响应试验(AID 级) | 按官网登记的 AID 回查 PubChem BioAssay |
| 程序化清洗 | 假阳性清除、性质匹配、21→15 靶标预筛 | 论文方法节与 SI 过滤规则 |
| 去偏划分 | AVE 嵌入 train/val(约 3:1) | AVE 包划分文件 + Wallach & Heifets 2018 算法原文 |
| 分发 | 官网 Full / AVE 双包 | 官网下载记录(无版本号,以下载日期为准) |
| 独立审计 | 泄漏/重复检测、记忆基线 | GitHub: sievestack/LIT-PCBA-audit |
| 社区复现 | 立体异构体折叠澄清 | Lzicar 复现博客与 fork |
每一环均有公开脚本或原始记录可复核;这种"论文规则 + 开源审计"的双层溯源结构在同类基准中少见,也是本页 DAIMS 偏倚评估项能拿满分的原因。
§4 数据结构
§4.0 目录树
解压官网 AVE unbiased data 包后的代表性布局(目录命名以官网当前分发包为准,下同):
lit-pcba/
├── ADRB2/
│ ├── actives.smi # 活性分子 SMILES(2D 主接口)
│ ├── inactives.smi # 非活性分子 SMILES
│ ├── actives_mol2/ # 活性分子 3D 构象(Tripos Mol2)
│ ├── inactives_mol2/ # 非活性分子 3D 构象
│ ├── pdb/ # X 射线受体结构(PDB 条目文件)
│ ├── query/ # 共晶配体查询集
│ ├── train.smi # AVE 去偏训练划分
│ └── val.smi # AVE 去偏验证划分
├── ALDH1/
│ └── (同上结构)
├── ESR_ago/
├── ESR_antago/
├── FEN1/
├── GBA/
├── IDH1/
├── KAT2A/
├── MAPK1/
├── MTORC1/
├── OPRK1/
├── PKM2/
├── PPARG/
├── TP53/
└── VDR/
Full data 包结构相同但不含 AVE train/val 划分文件,且分子数更多(AVE 前口径 9,780 活性/407,839 非活性,含跨靶标重复分子)。
§4.1 DAIMS 字段字典
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| target_id | Text | 靶标集官方短名 | “MAPK1” | 分组训练/评测键 | 无 | 不适用 | 15 个固定枚举值 |
| assay_aid | Integer | 溯源 PubChem 试验号(官网表格登记) | 1030 | 溯源与条件核查 | 无 | 缺省=未公布该行 AID | PubChem AID 空间 |
| smiles | Text | 2D 分子结构(SMILES) | “COC1=CC…” | 指纹/图特征输入 | 无(原始串) | 不适用 | 有效 SMILES 语法 |
| molecule_id | Text | 官网/库内分子标识 | “CID42612” | 唯一键、去重 | 跨靶标可重复 | 不适用 | 字符串 |
| active | Integer | 活性标签(剂量-响应确认口径) | 1 | 分类标签 | 试验测量误差(见 §7.2) | 无(全部显式) | 0/1 |
| split | Text | AVE 划分成员 | “train” | 防泄漏分组 | 无 | 不适用 | train/val/query |
| pdb_id | Text | 受体共晶结构条目 | “5l2m” | 结构路线输入 | 无 | 靶标级多值 | RCSB PDB 条目 |
| phenotype | Text | 活性表型(agonist/inhibitor) | “Inhibitors” | 任务语义解释 | 无 | 不适用 | Agonists/Antagonists/Inhibitors |
| potency_class | Text | 效力分布(试验级,模拟真实 HTS) | “μM 级为主” | 真实性校准 | 试验相关 | 不适用 | 定性分布 |
| elements_ok | Integer | 元素过滤合规(构建期已强制) | 1 | 数据校验 | 无 | 不适用 | 1(全量满足) |
§4.2 标签分布
- 全局(论文口径):7,844 活性(约 1.9%) vs 407,381 非活性(约 98.1%)。
- 按靶标极端分化:ALDH1 接近 1:19(活性 5,363,最"富");而官网口径下 ESR_ago(13)、ADRB2(17)、OPRK1(24)、PPARG(24)、IDH1(39)等活性数仅两位数,个别靶标活性/非活性比高达 1:1,792 量级(Shen et al., 2021)。
- 后果:全局指标(如整体准确率)无意义;ROC-AUC 亦会偏乐观,必须报告 EF1%/BEDROC/PR-AUC(§6.5 坑点 1)。
分层视角下,标签分布呈现"一个巨型靶标 + 若干中型靶标 + 一群微型靶标"的三段结构:
| 层级 | 靶标(官网 actives 口径) | 建模含义 |
|---|---|---|
| 巨型(活性 > 1,000) | ALDH1(5,363) | 监督训练最稳,聚合指标的"压舱石" |
| 中型(100–1,000) | PKM2(546)、VDR(655)、FEN1(360)、MAPK1(308)、KAT2A(194)、GBA(163)、ESR_antago(88) | 常规监督学习区间 |
| 微型(< 100) | TP53(64)、IDH1(39)、MTORC1(97)、ADRB2(17)、OPRK1(24)、PPARG(24)、ESR_ago(13) | 建议降级为检索式评测(坑点 3) |
(层级划分按官网 2026-09 actives 口径;Shen 等 2021 的"训练活性 > 100 的 7 个靶标"口径与之自洽。)
§4.3 关键统计
| 统计项 | 数值 | 口径来源 |
|---|---|---|
| 靶标集数量 | 15(ESR1 拆分 ago/antago 两集) | 官网 2026-09 |
| 候选靶标集(预筛前) | 21 | 论文摘要 |
| 上游试验数 | 149 个剂量-响应 BioAssay | 论文摘要 |
| 活性/非活性(AVE 后,论文) | 7,844 / 407,381 | 论文摘要 |
| 活性/非活性(AVE 前) | 9,780 / 407,839(含跨靶标重复) | GNINA 1.0 论文 |
| 活性/非活性(官网当前) | 7,761 / 382,674(unique) | 官网 2026-09 |
| 训练/验证划分 | 约 3:1 | Shen et al. 2021 |
| 多 PDB 模板靶标数 | 13/15 | GNINA 1.0 论文 |
| Google Scholar 引用 | 297+(截至 2026-09) | Scholar 快照 |
§4.4 数据层级
PubChem BioAssay(AID,149 个试验)
└── 靶标集(target set,15 个)
├── 受体结构(PDB 条目,1–15 个/靶标)
├── 查询集(query,共晶配体,多分子/靶标)
└── 化合物(compound,训练/验证分子)
└── 标签(active 0/1,试验级剂量-响应证据)
层级要点:同一化合物可出现在多个靶标(Full data 中 9,780 活性含跨靶标重复,去重后 7,844);"训练/验证"在化合物层划分,受体/查询集为靶标级资产。
§4.5 缺失值与信息性缺失
- 无传统缺失字段:SMILES、标签、划分成员是完备的;"缺省"仅出现在可选溯源字段(部分 AID 未在官网表格单列)。
- 信息性缺失(语义级):效力数值(IC50/Ki)不随文件分发——"非活性"没有效力记录,"活性"也只有试验级曲线合格性,无逐分子效力值;这意味着基于连续亲和力的回归建模须另接 PDBbind/ChEMBL 数据,LIT-PCBA 本身只支撑二分类/排序。
- 结构级缺口:Mol2 缺键级(audit 论文实测),从 3D 文件反推 2D 拓扑不可靠,须以 SMILES 为拓扑权威、Mol2 仅作坐标来源。
- 试验条件字段缺位:分子级不携带试验时间、读出通道、浓度梯度等条件元数据(只在靶标级隐含绑定一个 AID),混合建模时无法按条件分层——这是第 14 项(时间戳)与第 11 项(设备记录)评分低的根源,也是坑点 7 的结构性原因。
对照处理建议:入库时在数据目录外维护一张"靶标 → AID → 试验类型/读出"侧表(官网登记表可半自动转换),把官方缺失的元数据补回模型管道,而非等数据集本身升级。
§5 划分与使用建议
§5.1 官方划分
官方 AVE unbiased data 提供 train/val 两文件(约 3:1)。AVE(Asymmetric Validation Embedding,由 Wallach & Heifets, 2018, J Chem Inf Model 提出)的做法:在选定分子特征空间中嵌入调整训练集与验证集,使同类不聚簇、两类互嵌,从构造上阻断"记忆邻近分子"的捷径。使用官方划分即获得与社区结果的可比性。
§5.2 社区惯例划分
- query-set 检索协议(相似性/形状路线):以共晶配体为查询,在 actives+inactives 全库排序,报告 EF1%——原论文三类正交方法的评测方式。
- 对接协议:单模板或多模板对接全库,报告 EF1%/ROC-AUC;模板选择显著影响结果(§6.5 坑点 5)。
- 随机/时间划分:仅用于消融实验,不可作为主结果——会重引入 AVE 已消除的偏倚。
三种惯例协议的适用边界对照:
| 协议 | 输入资产 | 主指标 | 适用方法族 | 不可用场景 |
|---|---|---|---|---|
| AVE train/val(官方) | SMILES + 划分文件 | EF1%、PR-AUC | 指纹/图/MLSF 监督学习 | 零样本检索评测 |
| query 检索 | query 集 + 全库 | EF1%、BEDROC | 2D 相似性、3D 形状、对比检索 | 需要训练信号的方法 |
| 结构对接 | PDB 模板 + 3D 配体 | EF1%、AUC | Vina/Smina/GNINA/GOLD | 无口袋结构的靶标 |
选择协议的决定性问题:你的方法是否消费训练信号?消费→AVE 划分;不消费(检索/对接打分)→query 或对接协议。混用协议数字做排行是 LIT-PCBA 论文最常见的方法学错误。
§5.3 划分策略建议与泄漏风险
按风险从高到低:
- 禁用随机划分做主结果:随机划分会把立体异构体、同系列类似物撒进两侧,模型靠记忆拿分(audit 论文实测无参数记忆基线即可匹配深度模型)。
- 跨靶标重复分子必须先去重再划分:Full data 口径 9,780 活性含跨靶标重复,逐靶标独立划分会把同分子放进不同靶标的两侧。
- 规范化必须保留立体化学:用
isomericSmiles=True做去重审计;isomericSmiles=False会把立体异构体折叠成假"重复"(§6.5 坑点 6 的学术争论核心)。 - query 集不是验证集:query 是结构参照,与 train/val 的重叠须显式审计(audit 报告 query 有 3 个泄漏实例:2 个入 train、1 个入 val)。
- 同系列类似物冗余:即使严格按官方划分,ECFP4 Tanimoto ≥ 0.6 的跨集类似物对依然存在(ALDH1 报告 323 对);做泛化结论前建议补充基于 Bemis-Murcko scaffold 的聚类划分做敏感性分析。
§5.4 交叉验证建议
类不平衡 + 分子相似性场景下:使用 GroupKFold(组= Murcko scaffold)替代普通 KFold;组内 stratified 不可行时(部分靶标活性 < 100),改用重复随机划分(≥ 5 seeds)并报告方差;OPRK1、ESR_ago 等极少活性靶标建议只做检索式评测(query 排序),不做监督训练。
两条补充纪律:其一,交叉验证的分组键必须与最终报告的防泄漏口径一致——scaffold 组内交叉验证的结果不能与 AVE 划分结果并列平均,两者回答的是不同泛化问题(同分布内插 vs 跨嵌入泛化);其二,极少活性靶标上的 k 折交叉验证每折可能只有几个正例,任何单折指标都是高方差噪声,此时 bootstrap 重采样整个 query 排序比 k 折划分更能稳定估计区间。
§5.5 外部验证建议
LIT-PCBA 上的模型应延伸验证:其一,跨基准一致性——同一模型在 DUD-E/DUDE-Z 上复测并解释差异(不同 decoy 生态,见 §8.3);其二,跨数据源验证——ChEMBL/ExCAPE-DB 同靶标数据的时间划分外推;其三,前瞻性最小验证——top 命中交体外复测(文献中的标准终局)。Tran-Nguyen & Ballester 2023 提醒:在单一基准(含 AVE 数据集)上比较方法,结论不可无条件外推(Tran-Nguyen & Ballester, 2023, J Chem Inf Model)。
§6 AI 就绪指南
§6.0 云端快速启动
LIT-PCBA 无官方云镜像;任何云环境(Colab/AWS/GCP)只需三步:下载官网 zip → 解压 → 安装 rdkit(conda-forge 或 pip 的 rdkit-pypi)。GPU 仅在训练图神经网络/CNN 打分时需要;指纹 + 梯度提升机路线 CPU 即可,全量 ECFP4 特征化约需 10–30 分钟(单机 8 核)。
# Colab/GPU 实例通用启动脚本(结构路线额外需要 conda 安装 vina 或 gnina)
# pip install rdkit-pypi pandas scikit-learn torch
# conda install -c conda-forge vina # 结构路线:对接
# git clone https://github.com/sievestack/LIT-PCBA-audit tools/audit # 可选:审计脚本
§6.1 快速上手
目录预期:
data_root/lit-pcba/<TARGET>/(见 §4.0 目录树);data_root与子目录名拼接得各文件路径;最小可用子集:MAPK1 或 ALDH1(活性分子数最多、模型训练最稳)。以下代码演示:读取 SMILES → 加载官方划分 → 特征化 → 训练一个基线分类器。
# data_root = "data/lit-pcba" # 官网 AVE 包解压根目录
# 预期布局:data_root/MAPK1/{actives.smi, inactives.smi, train.smi, val.smi, ...}
# 最小子集:MAPK1(546 活性)或 ALDH1(5,363 活性);不建议从 OPRK1/ESR_ago 起步
from pathlib import Path
from rdkit import Chem, RDLogger
import numpy as np
from rdkit.Chem import AllChem
from sklearn.ensemble import RandomForestClassifier
from sklearn.metrics import roc_auc_score, average_precision_score
RDLogger.DisableLog("rdApp.*")
data_root = Path("data/lit-pcba")
target = "MAPK1"
def read_smi(path):
rows = path.read_text().split("\n")
out = []
for line in rows:
parts = line.split()
if len(parts) >= 2:
out.append((parts[0], parts[1])) # (smiles, id)
return out
actives = read_smi(data_root / target / "actives.smi")
inactives = read_smi(data_root / target / "inactives.smi")
def fp(smiles, n_bits=2048):
mol = Chem.MolFromSmiles(smiles)
if mol is None:
return None
return AllChem.GetMorganFingerprintAsBitVect(mol, radius=2, nBits=n_bits)
X, y, ids = [], [], []
for smi, mid in actives + inactives:
v = fp(smi)
if v is None:
continue
X.append(np.array(v)); y.append(1 if (smi, mid) in actives else 0); ids.append(mid)
X, y = np.array(X), np.array(y)
train_ids = {line.split()[1] for line in (data_root / target / "train.smi").read_text().splitlines() if line.strip()}
val_ids = {line.split()[1] for line in (data_root / target / "val.smi").read_text().splitlines() if line.strip()}
tr = np.array([i in train_ids for i in ids])
va = np.array([i in val_ids for i in ids])
clf = RandomForestClassifier(n_estimators=500, n_jobs=-1, class_weight="balanced", random_state=42)
clf.fit(X[tr], y[tr])
proba = clf.predict_proba(X[va])[:, 1]
print(f"[{target}] ROC-AUC={roc_auc_score(y[va], proba):.3f} PR-AUC={average_precision_score(y[va], proba):.3f}")
§6.2 数据获取
| 项目 | 内容 |
|---|---|
| 官方主页 | http://drugdesign.unistra.fr/LIT-PCBA/ |
| 包 1:Full data | 官网 “Download Full data here”(AVE 前全量) |
| 包 2:AVE unbiased data | 官网 “Download AVE unbiased data here”(官方去偏划分,推荐) |
| 论文 SI | figshare:ci0c00155_si_002.pdf(CC BY-NC 4.0) |
| 审计脚本 | github.com/sievestack/LIT-PCBA-audit |
| 费用/申请 | 免费,无注册、无 DUA |
| 大小 | 官网未标注;预留 1–2 GB 磁盘 |
获取流程三步:打开官网 → 点击对应包的下载链接(浏览器直下,无表单无审批)→ 解压到 data/lit-pcba/。与 PhysioNet 类临床数据的最大区别是零门槛:没有注册、没有培训证书、没有协议签署,因此团队内部的数据治理责任完全在使用方——建议入库时把下载 URL、日期与包哈希记入数据台账,作为版本漂移追溯的锚点。
# 官网为静态页,浏览器点击下载;脚本化时以官网页面当前链接为准
# wget http://drugdesign.unistra.fr/LIT-PCBA/<官网当前包文件名>.zip
# unzip lit-pcba.zip -d data/lit-pcba && ls data/lit-pcba # 应见 15 个靶标目录
§6.3 预处理全流程
流程:读取 → 标准化 → 去重 → 特征化 → 划分对齐。关键纪律:标准化保留立体化学;按官方 AVE 划分对齐;效力不平衡保持原样(不要人为平衡到 1:1——那会破坏基准的"真实筛选分布"设定,除非你同时改用与真实部署匹配的校准与指标)。
# 预处理:盐型剥离 + 保留立体的规范化 + 去重(分靶标、分 split)
from rdkit import Chem
from rdkit.Chem.SaltRemover import SaltRemover
from rdkit.Chem.MolStandardize import rdMolStandardize
salt = SaltRemover()
normalizer = rdMolStandardize.Normalizer()
uncharger = rdMolStandardize.Uncharger()
def standardize(smiles: str):
mol = Chem.MolFromSmiles(smiles)
if mol is None:
return None
mol = salt.StripMol(mol, dontRemoveEverything=True)
if mol is None or mol.GetNumAtoms() == 0:
return None
mol = normalizer.normalize(mol)
mol = uncharger.uncharge(mol)
# 关键:isomericSmiles=True 保留立体化学(避免立体异构体被折叠成"重复")
return Chem.MolToSmiles(mol, isomericSmiles=True)
def dedup(rows):
seen, out = {}, []
for smi, mid in rows:
std = standardize(smi)
if std is None:
continue
if std not in seen: # 同一标准化串仅保留首个
seen[std] = mid
out.append((std, mid))
return out
结构路线(对接/形状)额外步骤:从 SMILES 生成质子化态(pH 7.0–7.4)与低能构象(RDKit ETKDG + MMFF 优化,或 OpenEye OMEGA);单分子多构象时按下游打分保留单构象,防"过表达类似物"引入的类似物偏倚(Shen et al. 2021 的做法:仅保留最佳打分异构体/构象)。
# 3D 构象生成(结构路线):pH 7.4 质子化 + ETKDG 构象 + MMFF 优化
from rdkit import Chem
from rdkit.Chem import AllChem, rdDistGeom
from rdkit.Chem.rdMolTransforms import GetDihedralDeg
def make_conformer(smiles: str, max_confs: int = 1, seed: int = 42):
mol = Chem.MolFromSmiles(smiles)
if mol is None:
return None
mol = Chem.AddHs(mol)
params = rdDistGeom.ETKDGv3()
params.randomSeed = seed
params.numConfs = max(10, max_confs) # 先多采,再按能量截断
cids = rdDistGeom.EmbedMultipleConfs(mol, params)
if not list(cids):
return None
# MMFF 能量最小化,仅保留最低能构象(协议自由度须冻结,见坑点 5)
try:
AllChem.MMFFOptimizeMoleculeConfs(mol, maxIters=2000)
except Exception:
pass
props = AllChem.MMFFGetMoleculeProperties(mol)
if props is None:
return mol
energies = [(cid, AllChem.MMFFGetMoleculeForceField(mol, props, confId=cid).CalcEnergy())
for cid in mol.GetConformers()]
best = min(energies, key=lambda t: t[1])[0]
mol_best = Chem.Mol(mol, confId=best) # 单构象输出
Chem.RemoveHs(mol_best)
return mol_best
纪律提醒:
max_confs、质子化 pH、能量窗口这三个旋钮一旦选定,写进协议文件并在论文中披露——不同设置间的分数不可混排(坑点 5 的直接教训)。
§6.4 PyTorch DataLoader 完整代码
以 ECFP4 + MLP 二分类为例(CPU/GPU 通用):
import numpy as np
import torch
from torch.utils.data import Dataset, DataLoader
from rdkit import Chem
from rdkit.Chem import AllChem
class LitPCBADataset(Dataset):
"""rows: [(smiles, mol_id, label, split_tag)];仅取 train/val 成员"""
def __init__(self, rows, split="train", radius=2, n_bits=2048):
self.samples = []
for smi, mid, label, tag in rows:
if tag != split:
continue
mol = Chem.MolFromSmiles(smi)
if mol is None:
continue
fp = AllChem.GetMorganFingerprintAsBitVect(mol, radius=radius, nBits=n_bits)
self.samples.append((np.array(fp, dtype=np.float32), np.float32(label)))
def __len__(self):
return len(self.samples)
def __getitem__(self, idx):
x, y = self.samples[idx]
return torch.from_numpy(x), y
def make_loaders(rows, batch_size=512, num_workers=4):
train_ds = LitPCBADataset(rows, split="train")
val_ds = LitPCBADataset(rows, split="val")
# 类不平衡:按标签频率给 loss 权重(不要重采样到 1:1,保持真实分布评估)
labels = np.array([y for _, y in train_ds.samples])
pos_weight = torch.tensor(float((labels == 0).sum()) / max((labels == 1).sum(), 1))
return (DataLoader(train_ds, batch_size=batch_size, shuffle=True, num_workers=num_workers),
DataLoader(val_ds, batch_size=batch_size, shuffle=False, num_workers=num_workers),
pos_weight)
class MLP(torch.nn.Module):
def __init__(self, n_bits=2048, hidden=512):
super().__init__()
self.net = torch.nn.Sequential(
torch.nn.Linear(n_bits, hidden), torch.nn.ReLU(), torch.nn.Dropout(0.3),
torch.nn.Linear(hidden, 1))
def forward(self, x):
return self.net(x).squeeze(-1)
# 训练循环骨架
device = "cuda" if torch.cuda.is_available() else "cpu"
model = MLP().to(device)
bce = torch.nn.BCEWithLogitsLoss()
opt = torch.optim.AdamW(model.parameters(), lr=1e-3, weight_decay=1e-5)
# train_loader, val_loader, pos_weight = make_loaders(rows) # rows 来自 §6.3 标准化产物
# for epoch in range(30):
# model.train()
# for xb, yb in train_loader:
# xb, yb = xb.to(device), yb.to(device)
# loss = bce(model(xb), yb)
# opt.zero_grad(); loss.backward(); opt.step()
完整训练 + 评估循环(含早停与主指标 EF1%,可直接落地):
import copy
def run_training(train_loader, val_loader, pos_weight, epochs=50, patience=8, device="cpu"):
model = MLP().to(device)
bce = torch.nn.BCEWithLogitsLoss(pos_weight=pos_weight.to(device))
opt = torch.optim.AdamW(model.parameters(), lr=1e-3, weight_decay=1e-5)
best_state, best_score, wait = None, -1.0, 0
for epoch in range(epochs):
model.train()
for xb, yb in train_loader:
xb, yb = xb.to(device), yb.to(device)
loss = bce(model(xb), yb)
opt.zero_grad()
loss.backward()
opt.step()
# 验证:以 EF1% 为主指标(坑点 1),ROC-AUC 仅作参考
model.eval()
ys, ps = [], []
with torch.no_grad():
for xb, yb in val_loader:
ps.append(torch.sigmoid(model(xb.to(device))).cpu())
ys.append(yb)
y_true = torch.cat(ys).numpy()
y_score = torch.cat(ps).numpy()
score = ef1_percent(y_true, y_score)
if score > best_score:
best_state, best_score, wait = copy.deepcopy(model.state_dict()), score, 0
else:
wait += 1
if wait >= patience:
break
model.load_state_dict(best_state)
return model, best_score
要点:早停以 EF1% 为准而非 loss——类不平衡下验证 loss 的下降与"筛选排序变好"常常脱节;pos_weight 让训练看见有效梯度,但不改变验证集的真实比例,两件事不要混为一谈。
§6.5 坑点 8 个
⚠️ 坑点 1:极端类不平衡下 ROC-AUC 虚高,须用早期富集指标(分类:评估误用)
问题:LIT-PCBA 按靶标的活性/非活性比约 1:19 至 1:1,792,且随机负例占绝对多数;在这种分布下 ROC-AUC 对"把少数高分排对"不敏感,一个校准很差的模型也能拿 0.7+ 的 ROC-AUC,而虚拟筛选真正在意的是"合成库里挑前 1% 能不能多捞到真命中"。
症状:ROC-AUC 0.7–0.8 看似不错,换算成 top 1% 命中数后与随机几乎无异;不同模型 ROC-AUC 排序与 EF1% 排序互相矛盾。
解决:
- 简单方法:主指标改报 EF1%(top 1% 内活性富集倍数)与 PR-AUC(average precision);ROC-AUC 降为参考指标。EF 计算见 §6.9。
- 进阶方法:补报 BEDROC(α=20/80.5,对应早期 1%/5% 权重)与 ROC 的早期段(top 5% FPR 内曲线),并与随机基线、2D 相似性基线同表对照——LIT-PCBA 原论文的纳入门槛就是"三类方法至少其一 EF1% ≥ 2"。
- SOTA 方法:报告多靶标中位/均值 + 达标靶标计数(EF1% > 2 的靶标数,如 Molecules 2022 综述对 ΔLin_F9XGB 报 13/15 靶标达标、平均 EF1% = 5.55),并附 bootstrap 置信区间。
参考:Tran-Nguyen et al., 2020;Huang et al., 2025, arXiv:2507.21404;Yang, Chen & Zhang, 2022, Molecules。
⚠️ 坑点 2:单次试验"非活性"不是确认的阴性——假阴性污染标签(分类:标签理解)
问题:非活性标签 = “在对应试验条件下未检出”,受试验浓度窗口、读出干扰、细胞渗透性影响;多数 primary 试验还是细胞表型试验,活性分子未必真正作用于假定靶标(GNINA 论文实测 MAPK1 集内含选择性抑制 EGFR 的错标活性)。
症状:模型对某类"假阴性"骨架系统性打低分;换靶标/换数据源后同一分子标签翻转;表型试验来源的靶标(如 TP53、VDR)结果方差大。
解决:
- 简单方法:把标签理解为"试验证据"而非"化学真相";论文中报告靶标级试验类型(细胞表型 vs 生化)分组结果。
- 进阶方法:训练时用标签噪声鲁棒损失(如对称交叉熵/co-teaching)或对高置信矛盾样本(同分子在 ChEMBL 有活性记录)做白名单校正;正交验证 top 命中时查询 ChEMBL/PubChem 同靶标记录。
- SOTA 方法:弱标签框架(PU learning:把非活性视作"未标注"而非"负例")建模,用两阶段正/未标注学习估计真实负例分布。
参考:Gnina 1.0 论文;JCC 2022。
⚠️ 坑点 3:靶标数量仅 15、半数靶标活性极少——不是跨靶标泛化基准(分类:偏倚陷阱)
问题:15 个靶标集里 8 个训练集活性数 ≤ 100(官网口径下 ESR_ago 13、ADRB2 17、OPRK1 24、PPARG 24、IDH1 39、MTORC1 97 等),Shen 等 2021 只采用 7 个训练集活性 > 100 的靶标做监督建模;用它声称"模型学会了跨靶标通用规律"在统计上站不住。
症状:少活性靶标上训练不收敛或验证指标剧烈波动;聚合 15 个靶标的"平均性能"被两三个大靶标(ALDH1、PKM2)主导。
解决:
- 简单方法:逐靶标报告结果 + 明确标注每个靶标的活性数;聚合时用中位数并给出达标靶标数。
- 进阶方法:只对训练活性 ≥ 100 的靶标做监督学习,其余靶标降级为检索式评测(query 排序);少样本靶标用迁移/少样本学习并在协议里声明。
- SOTA 方法:跨靶标泛化结论改用多基准组合证据(LIT-PCBA + DUD-E/DUDE-Z + ChEMBL 时间划分),单基准不外推。
参考:Shen et al., 2021, Brief Bioinform;官网 15 靶标表。
⚠️ 坑点 4:与 DUD-E 的性能数字不可直接比较(分类:评估误用)
问题:DUD-E 的诱饵是程序生成的性质匹配分子(约 1:50 近平衡、靶标 102 个),LIT-PCBA 的非活性是真实试验记录(1:19 至 1:1,792、靶标 15 个、AVE 去偏);两套基准的难度构造与"作弊面"完全不同,同一模型在两者上的数字没有换算关系。
症状:论文里"DUD-E 上 0.9 vs LIT-PCBA 上 0.65"被解读成"模型退步";复现者按 DUD-E 习惯(随机划分、ROC-AUC 单指标)评测 LIT-PCBA 得出失真结论。
解决:
- 简单方法:任何跨基准比较必须同表注明:decoy 来源、不平衡比、划分协议、指标集合四要素。
- 进阶方法:采用 Chen 2019 的"单特征/配体-only 对照"检验——在 LIT-PCBA 上补做配体-only 基线,确认模型没有退化回化学偏倚利用。
- SOTA 方法:引用 audit 论文的"无参数记忆基线"作为下界对照:若你的模型打不过纯记忆基线,结论须重写。
参考:Chen et al., 2019, PLoS ONE;Huang et al., 2025。
⚠️ 坑点 5:构象生成与对接协议设置直接改写打分数字(分类:预处理陷阱)
问题:Molecules 2022 综述实测:同为 Vina 引擎,GNINA 论文(Sunseri 等)与 Smina 重打分工作(Yang 等)在 LIT-PCBA 上的平均 EF1% 不同,主因是配体构象生成数量、docking box 定义、PDB 模板数量三个协议参数的差异;3D 形状方法对构象覆盖同样敏感。
症状:换一台机器/换一个构象工具,EF1% 波动数个百分点;"复现失败"其实只是协议未冻结。
解决:
- 简单方法:论文附协议清单:构象数上限、RMSD 剪枝阈值、box 尺寸(如共晶配体几何中心 ±10 Å)、每靶标 PDB 模板清单与选择规则。
- 进阶方法:多模板共识——每靶标全部官方模板对接后取最大/中位打分,消除单模板运气;单分子多构象仅保留最佳打分构象并固定该规则。
- SOTA 方法:发布可执行配置(Smina/GNINA 命令行 + 构象脚本),并引用原论文同协议数字对照;跨工作比较时先对齐协议再谈分数。
参考:Yang, Chen & Zhang, 2022, Molecules;JCC 2022。
⚠️ 坑点 6:重复分子、立体异构体与 Mol2 缺键——"重复"的定义决定结论(分类:预处理陷阱)
问题:2025 年审计报告了跨 train/val 的 2,491 个"2D 相同"非活性与集内数千重复;但复现发现这些"重复"绝大多数是立体异构体——审计流程用
isomericSmiles=False规范化,把立体异构体折叠成了假重复;保留立体化学后跨集精确重复归零。同时官方 Mol2 缺少键级信息,从 3D 反推分子身份不可靠。
症状:去重后样本量"莫名"大幅缩水;不同团队报告的重复计数互相矛盾;从 Mol2 读出的分子与 SMILES 对不上号。
解决:
- 简单方法:统一用
Chem.MolToSmiles(mol, isomericSmiles=True)做一切去重与泄漏检查;拓扑权威取 SMILES,Mol2 仅作 3D 坐标。- 进阶方法:双层检查——精确层(isomeric SMILES 精确匹配,应为零)+ 类似物层(ECFP4 Tanimoto ≥ 0.6 跨集对计数,透明披露而非简单删除)。
- SOTA 方法:在消融中同时报告"保立体"与"去立体"两套结果,并在论文里说明选择依据——这正是 2025 审计之争留给社区的评测规范。
参考:Huang et al., 2025;Lzicar 复现博客:立体异构体之争。
⚠️ 坑点 7:跨靶标/跨试验混合训练破坏"同试验同条件"保证(分类:偏倚陷阱)
问题:LIT-PCBA 每个靶标的活性与非活性来自同一试验(同浓度窗口、同读出、同实验室),这是它区别于拼接型数据库的核心设计;一旦把多个靶标的数据混合训练(多任务或统一二分类),不同试验的条件差异(细胞系、底物浓度、读出动态范围)就成了模型可学捷径。
症状:混合模型在"来源试验 A 的分子"上整体打高分/低分;多任务模型出现靶标间系统偏移;换 assay 条件的外部数据上性能崩塌。
解决:
- 简单方法:逐靶标独立建模与评测(LIT-PCBA 的默认协议);多任务时显式加入靶标嵌入并逐靶标报告。
- 进阶方法:把"试验条件"作为协变量(试验 ID embedding 或按条件分层归一化),并做 leave-one-assay-out 验证。
- SOTA 方法:如需大规模混合训练,改用条件对齐的数据库(ExCAPE-DB/ChEMBL33 统一 pAct 口径)并在 LIT-PCBA 上仅做零样本评测,明确声明混合训练与单试验评测的边界。
参考:Molecules 2022 综述;Tran-Nguyen et al., 2020。
⚠️ 坑点 8:scaffold 崩塌让模型记忆而非泛化——audit 之争的教训(分类:数据泄漏)
问题:即使使用官方 AVE 划分,跨集"同骨架不同分子"的类似物依然可观(audit 实测 ALDH1 有 323 对 ECFP4 Tanimoto ≥ 0.6 的活性跨集对;部分靶标 query 集 80% 以上近重复),GNN/对比学习模型完全可以靠记忆近邻拿分——audit 作者用零参数记忆基线复现了与深度模型相当的成绩。
症状:换成 scaffold 聚类划分后性能大幅跳水;query 检索"成绩好"但新颖骨架命中率极低;消融删除交互特征后性能几乎不变(说明学的是配体先验)。
解决:
- 简单方法:主结果之外必报一组 Bemis-Murcko scaffold GroupShuffleSplit 的结果;训练/验证骨架交集比例写进论文。
- 进阶方法:ECFP4 相似度防泄漏过滤——对每个验证分子剔除训练集中 Tanimoto ≥ 0.6 的同类样本后重评(时序/聚类式划分敏感性分析)。
- SOTA 方法:采用类似物感知基准协议(audit 提出的 analog-aware auditing 框架),并用零参数记忆基线做下界对照;报告"泛化带"(scaffold split 与随机 split 的性能区间)而非单点。
参考:Huang et al., 2025, arXiv:2507.21404;sievestack/LIT-PCBA-audit。
§6.6 数据增强:安全与危险操作
| 操作 | 判定 | 说明 |
|---|---|---|
| SMILES 随机等价重写(non-isomeric 等价串) | ✅ 安全 | 不改拓扑,防过拟合字符串编码 |
| 构象扰动(ETKDG 重采样 + MMFF 松弛) | ✅ 安全(3D 模型) | 保持质子化态与手性一致 |
| 互变异构枚举后统一回标准型 | ✅ 安全 | 需固定单一标准型,防标签泄漏 |
| 加盐/脱盐 | ⚠️ 谨慎 | 与 §6.3 盐型处理保持同一规则 |
| 丢弃立体化学(去手性) | ❌ 危险 | 制造伪重复,触发坑点 6 |
| 随机下采样非活性到 1:1 | ❌ 危险 | 破坏真实筛选分布,EF1% 失真 |
| 跨靶标复制分子补数据 | ❌ 危险 | 引入跨试验条件泄漏(坑点 7) |
§6.7 模型推荐
| 模型族 | 代表 | 适配任务 | 上手难度 | 在 LIT-PCBA 的已知表现 |
|---|---|---|---|---|
| 指纹 + 经典 ML | RF、XGBoost | 逐靶标二分类 | 低 | 稳健基线;Shen 2021 显示与 MLSF 各有胜负 |
| 梯度提升 + 对接特征 | ΔLin_F9 + XGBoost | 结构路线重打分 | 中 | 平均 EF1% 5.55,13/15 靶标 EF1%>2(综述汇总) |
| CNN 3D 格点 | GNINA CNN | 对接打分/富集 | 中 | 平均优于经典经验打分,但受配体先验影响 |
| 图神经网络 | GCN/MPNN | 活性分类、迁移 | 中高 | 需 scaffold 划分消融(坑点 8) |
| 对比/检索 | DrugCLIP、CHEESE、SPRINT | query 检索、零样本 | 高 | 报告高 EF1%,但 2025 audit 质疑其受类似物泄漏抬升 |
§6.8 硬件需求
| 任务 | 最低配置 | 推荐配置 | 参考耗时 |
|---|---|---|---|
| 指纹特征化 + RF/XGBoost | 8 核 CPU、16 GB RAM | 16 核 CPU、64 GB RAM | 全量特征化约 10–30 分钟 |
| 构象生成(RDKit ETKDG,全库) | 8 核 CPU | 32 核 CPU | 数小时量级 |
| Vina/Smina 对接(单靶标全库) | 16 核 CPU | 56 核节点(JCC 2022 同量级) | 数小时至一天/靶标 |
| GNN/MLP 训练 | 单卡 8 GB GPU | 单卡 24 GB GPU | 每 epoch 分钟级 |
§6.9 评估指标代码
import numpy as np
from sklearn.metrics import roc_auc_score, average_precision_score
from rdkit.ML.Scoring.Scoring import CalcBEDROC, CalcRIE
def ef1_percent(y_true, y_score):
"""top 1% 排序内的活性富集倍数(LIT-PCBA 主指标)"""
order = np.argsort(-np.asarray(y_score))
y_sorted = np.asarray(y_true)[order]
top_n = max(int(np.ceil(0.01 * len(y_true))), 1)
hit_rate_top = y_sorted[:top_n].mean()
hit_rate_all = np.mean(y_true)
return hit_rate_top / hit_rate_all if hit_rate_all > 0 else np.nan
def early_metrics(y_true, y_score):
"""BEDROC/RIE 采用 RDKit 权威实现;alpha=20/80.5 对应 top 5%/1% 加权惯例"""
return {
"BEDROC(alpha=20)": CalcBEDROC(list(zip(np.asarray(y_score), np.asarray(y_true))), 0, 20.0),
"BEDROC(alpha=80.5)": CalcBEDROC(list(zip(np.asarray(y_score), np.asarray(y_true))), 0, 80.5),
"RIE(alpha=20)": CalcRIE(list(zip(np.asarray(y_score), np.asarray(y_true))), 0, 20.0),
}
def evaluate(y_true, y_score):
return {
"EF1%": ef1_percent(y_true, y_score),
"ROC-AUC": roc_auc_score(y_true, y_score),
"PR-AUC": average_precision_score(y_true, y_score),
"n_actives": int(np.sum(y_true)),
}
实践提示:EF1% 对"恰好第 N 名"敏感,微型靶标(活性 < 100)上建议同时报告 EF0.5% 或改用 BEDROC 平滑早期加权;多靶标聚合时先逐靶标计算再取中位数,并附 bootstrap(≥1,000 次重采样)置信区间。
§6.10 MLOps 笔记
- 数据版本化:以"官网下载日期 + 包类型(Full/AVE)"为版本键入库(如
lit-pcba@2026-09-ave);官网数字随维护变动,模型注册表必须绑定数据快照哈希。 - 协议冻结:坑点 5 的协议清单写进
protocol.yaml,与训练日志同仓提交;任何重跑先 diff 协议。 - 指标门禁:CI 中以 EF1%(非 ROC-AUC)为主门禁;加入"无参数记忆基线"回归测试,防数据泄漏悄悄回归。
- 审计钩子:入库前自动跑 §6.5 坑点 6 的双层泄漏检查(精确匹配应为零 + 类似物对计数披露)。
- 可复现性:固定 RDKit 版本(RDKit 版本影响规范化结果),容器内锁定
rdkit-pypi版本号。 - 实验追踪:逐靶标指标(EF1%/PR-AUC/ROC-AUC 三元组)与靶标活性数一起入库,聚合视图默认展示中位数与达标靶标数而非均值,防止巨型靶标(ALDH1)淹没信号。
- 治理清单:把官网下载日期、license 边界(ACS 论文 + CC BY-NC 4.0 SI)、以及"基准分数 ≠ 筛选成功率"的使用声明写进模型卡,供下游复用者即取即用。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解 |
|---|---|---|---|
| 假阴性标签 | 非活性 = 单试验未检出,非确认阴性 | 高 | PU learning/噪声鲁棒损失;同源数据库正交核查(坑点 2) |
| 靶标归因错标 | 细胞表型试验来源的活性未必作用于假定靶标(MAPK1 集含 EGFR 选择性抑制剂) | 中 | 逐靶标披露试验类型;生化试验子集单独报告 |
| 跨集类似物冗余 | AVE 后仍有 Tanimoto ≥ 0.6 跨集活性对(ALDH1 323 对);query 集近重复比例高 | 高 | scaffold 划分敏感性分析 + 类似物感知审计(坑点 8) |
| 立体化学处理分歧 | 非保立体规范化制造伪重复,跨工作口径不一 | 中 | 强制 isomericSmiles=True 审计(坑点 6) |
| 效力分布截断 | 无逐分子效力值,只有试验级合格性 | 中 | 需要效力回归时另接 PDBbind/ChEMBL |
| 聚集物残留 | 过滤器虽排除已知聚集物,但新的胶体聚集无法全部排除 | 低中 | 命中复测时加去垢剂对照 |
§7.2 标注质量
活性标签的证据等级在同类基准中最高:剂量-响应曲线(Hill 斜率 0.5–2.0)+ 多重假阳性过滤器(聚集物、荧光素酶抑制剂、自荧光、元素范围),显著优于单点 HTS 标签与人工诱饵标签。但两条短板须正视:其一,"未检出"型非活性在浓度窗口外是弱阴性;其二,无标注者一致性可言(程序化清洗),数据质量争议以"可复算脚本"而非"双盲标注"方式解决。
与同类基准的标注质量对比有助于定位其真实水位:DUD-E 的"活性"多为文献摘录的亲和力记录(来源异质、无统一浓度口径),MUV 的活性数量极少(每组 30 个),而 LIT-PCBA 的活性在同一试验内呈合格剂量-响应曲线——三者的证据强度依次为:LIT-PCBA > DUD-E ≈ MUV。代价是规模:确认型标签的漏斗让 LIT-PCBA 只有 15 个靶标,而 DUD-E 以宽松标签换取了 102 个靶标。这是"标签质量 vs 靶标覆盖"的经典权衡,没有免费午餐。
§7.3 泛化性
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 少活性靶标(< 100 训练活性) | 监督训练方差大、不可复现 | 15 靶标中 8 个训练活性 ≤ 100(Shen 2021 只用 7 个) |
| 全新骨架化学空间 | 模型记忆近邻,泛化虚高 | audit:零参数记忆基线匹配深度模型 |
| 跨 assay 条件外推 | 混合训练模型随条件漂移 | 靶标-试验一一绑定的设计特性(坑点 7) |
| 高不平衡真实库 | ROC-AUC 排序与 EF 排序不一致 | 1:19–1:1,792 分布特性(坑点 1) |
| 3D 协议变更 | 构象/box/模板数改变即改写结果 | GNINA 与 Smina 工作的同引擎差异(坑点 5) |
§7.4 伦理
数据为公共试验记录与开源结构,无人类受试者、无个人可识别信息,无伦理审批要求。使用上须注意双重用途伦理:预测毒物/滥用物质活性的下游应用需遵守所在法域规定;数据许可未统一声明,商业使用前应与版权方(论文 © ACS、SI CC BY-NC 4.0、官网数据)确认。
§7.5 公平性
不适用人口学公平性维度(无患者数据)。计算公平性层面:靶标规模极度不均(ALDH1 5,363 活性 vs ESR_ago 13 活性)导致聚合指标系统性偏向大数据靶标,评测协议须逐靶标披露样本量并给达标靶标计数。
§7.6 数据漂移
官网数字自 2020 论文口径(7,844/407,381)至 2026-09(7,761/382,674)的演变即版本漂移实例;PubChem 本身持续重审试验记录(如试验撤回/状态更新),旧快照与当前 PubChem 回查可能不一致。建议每半年重新下载并 diff 靶标级分子清单。
对下游模型而言还有一层"生态漂移":LIT-PCBA 的高频使用正在制造新的偏移——大量新模型在同 15 个靶标上调参,实质构成了对验证集的集体过拟合(基准过拟合)。缓解路径有三:报告时区分"开发期实验"与"冻结后终评";引入 DUDE-Z/ChEMBL 时间划分作第二基准;以及关注社区后续可能发布的类似物感知修正版基准(audit 论文已给出构建新协议的建议)。
§7.7 DAIMS 24 项评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 每靶标单文件逐行组织,一行一分子,可直接读入 DataFrame |
| 2 | 唯一标识 | ⚠️ | 分子标识在靶标内唯一,但跨靶标可重复(Full data 9,780 活性含重复);全局唯一键需"靶标+分子"复合键 |
| 3 | 特殊字符 | ✅ | SMILES 语法规范;无逗号/引号冲突(SMI 空白分隔) |
| 4 | 重复行 | ⚠️ | 立体异构体与跨集类似物构成"语义重复";须按 isomeric SMILES 去重并披露类似物对(坑点 6) |
| 5 | 缺失编码 | ✅ | 核心字段无缺失;"未检出"即显式标签,无隐性缺失码 |
| 6 | 标签标识 | ✅ | active 0/1 二元标签明确,附试验级证据规则(剂量-响应合格性) |
| 7 | 罕见类分组 | ⚠️ | 8/15 靶标训练活性 ≤ 100,少数类极小;建议分组披露并降级为检索评测(坑点 3) |
| 8 | 偏倚评估 | ✅ | 官方 AVE 去偏 + 2025 独立审计 + 社区复现反驳,偏倚证据链完整公开 |
| 9 | 数据字典 | ⚠️ | 官网提供格式说明但无逐字段字典;本页 §4.1 即补全字典 |
| 10 | 信息性缺失解释 | ✅ | 效力值缺省有明确语义(仅分类不回归),见 §4.5 |
| 11 | 设备记录 | ❌ | 无试验仪器/读出设备元数据;仅试验类型可推断 |
| 12 | 共线性 | ✅ | 特征层无预置共线性(指纹由用户构造);标签与试验绑定为 1:1 |
| 13 | 编码映射 | ✅ | 靶标名与 PDB 条目可双向映射至 RCSB/UniProt |
| 14 | 时间戳处理 | ❌ | 分子级无试验时间戳;无法构造时间划分(temporalCoverage 仅库级) |
| 15 | 划分建议 | ✅ | 官方 AVE train/val + 社区检索协议,划分规则公开可复算 |
| 16 | 泄漏讨论 | ✅ | 2025 审计与复现反驳构成公开泄漏讨论;本页坑点 6/8 汇总操作规程 |
| 17 | 标签分布 | ✅ | 全局与靶标级分布明确(§4.2),失衡比 1:19–1:1,792 |
| 18 | 测量偏倚 | ⚠️ | 试验读出(荧光/发光)干扰已过滤但仪器差异无记录;表型试验归因偏倚已知(§7.1) |
| 19 | 外部验证建议 | ✅ | §5.5 给出跨基准/跨数据源/前瞻三级路径 |
| 20 | 版本记录 | ⚠️ | 官网无正式版本号与 changelog;以论文口径 vs 官网口径双轨记录(§1.4) |
| 21 | 预处理脚本 | ❌ | 官方无一键预处理脚本;社区脚本(audit 仓库)可部分替代 |
| 22 | 合规要求 | ✅ | 免费开放、无 DUA;许可边界清晰(论文 ACS 版权 + SI CC BY-NC 4.0) |
| 23 | 多模态对齐 | ⚠️ | 2D SMILES 与 3D Mol2/PDB 属多模态;Mol2 缺键级使 3D→2D 对齐需校验(坑点 6) |
| 24 | 去标识化 | ✅ | 不适用:纯分子数据,无个人敏感信息(rai 字段已声明) |
DAIMS 评分:17.5 / 24
评分解读:17.5/24 处于"科研可用性良好、生产化需补课"区间。强项全部落在证据与协议层:实验来源标签、公开去偏划分、完整的偏倚审计生态(第 6/8/16 项满分);弱项集中在元数据与工具层——无设备记录(11)、无时间戳(14)、无官方预处理脚本(21)、版本管理靠口径约定(20)。对一个 2020 年的学术基准,这是典型且可解释的轮廓:它把资源投入了"标签正确性"而非"数据工程完备性"。
分档看:✅ 14 项、⚠️ 7 项、❌ 3 项。⚠️ 项集中于"需要使用者自行补充口径"(唯一标识、重复行、罕见类、字典、版本、测量偏倚、对齐),意味着数据本身可用但每次使用都要重申口径——这正是学术论文复现差异的主要来源,也是本页用大量篇幅写坑点的原因。
对你意味着什么:若你做方法研究(新模型/新损失/新特征),17.5 分意味着可以直接上手——官方划分 + 详尽审计讨论让你的结果可辩护;但必须自带四件套:isomeric 去重脚本(坑点 6)、scaffold 划分消融(坑点 8)、EF1% 门禁(坑点 1)、协议冻结清单(坑点 5)。若你想把该数据用于生产级筛选模型,第 11/14/21 项的缺位意味着你要自建试验条件元数据、接 ChEMBL 补效力与时间维度,并在上线前完成前瞻性体外验证——不要把基准分数直接当成筛选成功率。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| GOLD 对接(9 靶标子集) | CCDC 协议(JCC 2022) | 结构路线 VS | ROC-AUC | 仅 3/9 靶标 AUC ≥ 0.6(ALDH1 0.63、GBA 0.60、MAPK1 0.59) | 严格协议下经典对接在 LIT-PCBA 上难度远高于 DUD-E 惯常印象 |
| ΔLin_F9XGB 重打分 | Yang 等(Smina,综述汇总) | 结构路线 VS | 平均 EF1% | 5.55;13/15 靶标 EF1% > 2 | ML 重打分超过经典对接;协议参数敏感 |
| GNINA CNN | Sunseri & Koes 2021 | 对接+深度打分 | EF1%/ROC-AUC | 平均优于经验打分 | 受配体-only 先验影响,"结构优势"存疑 |
| 零参数记忆基线 | SieveStack 2025 | 检索/富集 | EF1% | 与深度 SOTA 相当或更高 | 证明类似物泄漏足以伪造 SOTA,警示跨集冗余 |
| SPRINT/DrugCLIP/CHEESE | 各自团队(audit 转述) | query 检索 | EF1% | 声称超越传统对接 | 其高分数被 audit 归因于泄漏利用,结论有争议 |
(所有结果来自同行评审文献或其 arXiv 公开版本;各行列协议不同,数值不可横向直接比较。)
§8 基准性能与生态
§8.1 排行榜
LIT-PCBA 没有官方统一榜单;下表按"评测严格度 + 社区影响力"整理代表性结果。阅读前请记住两条:数值口径互不兼容(协议差异见坑点 5/6);审计争议未决前,对比检索族的高分数应以"有争议的 SOTA"看待。
| 排名 | 模型/方法 | 性能(任务口径) | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | SPRINT / DrugCLIP / CHEESE(对比学习检索族) | 高 EF1%(query 检索;audit 质疑其泄漏抬升) | 2023–2025 | 蛋白-配体对比预训练、3D 形状+静电向量检索 | 汇总见 Huang et al., 2025, arXiv:2507.21404. DOI: 10.48550/arXiv.2507.21404 | 各自仓库;audit 复现 |
| 2 | ΔLin_F9 + XGBoost(Smina 重打分) | 平均 EF1% 5.55;13/15 靶标 > 2 | 2022 | 对接分数线性项 + 梯度提升 | 汇总于 Yang, Chen & Zhang, 2022, Molecules. DOI: 10.3390/molecules27144568 | 随文献 |
| 3 | GNINA CNN | 平均优于经典经验打分(EF1%/AUC 口径) | 2021 | 3D 格点 CNN,亲和+姿态联合训练 | Sunseri & Koes, 2021, Molecules. DOI: 10.3390/molecules260307369 | gnina.org |
| 4 | GOLD(ChemPLP 经典对接) | 仅 3/9 靶标 AUC ≥ 0.6 | 2022 | 遗传算法对接 + ChemPLP 打分 | JCC 2022(ANI-2 应变协议), J Comput Chem. DOI: 10.1002/jcc.27478 | 商业软件 |
| 5 | 无参数记忆基线(audit) | 匹配/超过深度 SOTA | 2025 | 近邻记忆 + 2D 相同查询 | Huang, Knight & Naprienko, 2025, arXiv:2507.21404. DOI: 10.48550/arXiv.2507.21404 | GitHub |
| 6 | 2D 指纹 / 3D 形状 / Surflex-Dock(官方基线) | 纳入门槛:三类至少其一 EF1% ≥ 2 | 2020 | Morgan 指纹、ROCS 类形状、Surflex-Dock | Tran-Nguyen, Jacquemard & Rognan, 2020, J Chem Inf Model. DOI: 10.1021/acs.jcim.0c00155 | 官网协议 |
⚠️ 数值不可直接比较:各行在靶标子集、对接引擎、构象数量、box 定义、PDB 模板数、query 集处理与指标实现上均不同(坑点 5);audit 行数字还受立体化学口径影响(坑点 6)。引用任何一行前请先读其协议。
§8.2 SOTA 总结与选型建议
当前格局:经典对接在严格协议下表现有限(GOLD 仅 3/9 靶标过线),ML 重打分(ΔLin_F9XGB)是结构路线的稳妥升级,对比检索族报告最高 EF1% 但正被审计争议笼罩。选型建议:预算有限时,用 ECFP4 + XGBoost 建立逐靶标基线;结构信息可用时叠加 Smina/GNINA 重打分;对比检索仅作补充证据并在 audit 协议下复测。任何声称 SOTA 的报告,先检查它有没有跑无参数记忆基线。
三条务实结论:
- 方法研究的性价比排序:指纹 + 梯度提升(半天上手、结果稳健)→ 对接重打分(数天、结构可得时收益明确)→ 图神经网络与对比检索(数周起、必须自带防泄漏消融)。Tran-Nguyen & Ballester 2023 的 broader comparison 教训是:简单方法在更严格的比较下常常并不差。
- 指标的优先级:EF1% 与达标靶标数 > PR-AUC > BEDROC > ROC-AUC;只报 ROC-AUC 的 LIT-PCBA 论文结论应默认打折。
- 结论的可信边界:LIT-PCBA 上任何数字的可信表述都是"在该 15 靶标谱、该划分、该协议下";把它写成"通用虚拟筛选能力提升"就是过度外推(坑点 3/4)。
§8.3 评测协议
- 配体路线:加载官方 AVE train/val → isomeric 规范化去重 → ECFP4/图特征 → 逐靶标训练 → 报 EF1% + PR-AUC(主)、ROC-AUC(辅)+ 达标靶标数。
- 结构路线:官方 PDB 模板 → 冻结 box(共晶配体中心 ±10 Å)→ 固定构象协议 → 单模板与多模板共识双报。
- 检索路线:官方 query 集 → 全库排序 → EF1% + BEDROC;披露 query 近重复统计。
- 必做对照:随机森林下界、2D 相似性基线、零参数记忆基线(audit);推荐补充 Murcko scaffold 划分敏感性分析。
协议写作清单(论文/报告中的 LIT-PCBA 方法节应包含的全部要素):
| 要素 | 建议写法示例 |
|---|---|
| 包与日期 | “AVE unbiased data,下载于 2026-09” |
| 规范化 | “isomeric SMILES(RDKit 版本 X),盐型剥离 + Uncharger,逐 split 去重” |
| 划分 | “官方 AVE train/val(约 3:1),未做任何再划分” |
| 特征/构象 | “ECFP4-2048” 或 “ETKDGv3 单最低能构象,MMFF 优化” |
| 对接参数 | “Smina,box = 共晶配体质心 ±10 Å,exhaustiveness = 8” |
| 指标 | “逐靶标 EF1%(主)、PR-AUC、ROC-AUC;聚合报告中位数 + EF1%>2 靶标数 + bootstrap 95% CI” |
| 防泄漏 | “Murcko scaffold 划分敏感性分析 + Tanimoto≥0.6 跨集对计数披露” |
§8.4 相关数据集
| 数据集 | 关系 | 用途建议 |
|---|---|---|
| DUD-E | 前代事实标准,人工诱饵 | 跨基准稳健性检查;解释差异时引 Chen 2019 偏倚分析 |
| DUDE-Z | DUD-E 实验验证重制版 | 结构路线补充证据 |
| MUV | 早期去偏基准(17 靶标) | 相似性检索偏倚的历史对照 |
| PDBbind | 亲和力回归金标准 | 需要效力回归时的补位数据源 |
| ChEMBL / ExCAPE-DB | 大规模活性汇编 | 时间划分外推与标签正交核查 |
| 裸库(ZINC/MolPort) | 前瞻筛选对象库 | 模型上线前的分布漂移检查 |
§8.5 关键论文 Top 8
- Tran-Nguyen VK, Jacquemard C, Rognan D. LIT-PCBA: An Unbiased Data Set for Machine Learning and Virtual Screening. J Chem Inf Model. 2020;60(9):4263-4273. DOI: 10.1021/acs.jcim.0c00155 —— 数据集原始论文:149 试验 → 15 靶标的漏斗构建与三类正交基线。
- Wallach I, Heifets A. Most Ligand-Based Benchmarks Measure Overfitting Rather than Accuracy. J Chem Inf Model. 2018;58(5):916-932. DOI: 10.1021/acs.jcim.7b00403 —— AVE 去偏方法出处,LIT-PCBA 划分的理论基础。
- Chen L, Cruz A, Ramsey S, Dickson CJ, Duca JS, Hornak V, Koes DR, Kurtzman T. Hidden bias in the DUD-E dataset leads to misleading performance of deep learning in structure-based virtual screening. PLoS ONE. 2019;14(8):e0220113. DOI: 10.1371/journal.pone.0220113 —— DUD-E 偏倚实锤,LIT-PCBA 立项的直接动因。
- Sunseri J, Koes DR. Virtual Screening with Gnina 1.0. Molecules. 2021;26(3):7369. DOI: 10.3390/molecules260307369 —— 深度 CNN 打分在 LIT-PCBA 的代表性评测,并披露 MAPK1 错标活性。
- Shen C, Weng G, Zhang X, Leung E, Yao X, Pang J, Chai X, Li D, Wang E, Cao D, Hou T. Accuracy or novelty: what can we gain from target-specific machine-learning-based scoring functions in virtual screening? Brief Bioinform. 2021;22(5):bbaa410. DOI: 10.1093/bib/bbaa410 —— 靶标特异性 MLSF 与 QSAR 的新颖性权衡,确立"仅 7 靶标可监督"的实践口径。
- Yang C, Chen E, Zhang Y. Protein–Ligand Docking in the Machine-Learning Era. Molecules. 2022;27(14):4568. DOI: 10.3390/molecules27144568 —— 汇总四大团队 LIT-PCBA 基线,量化协议参数对结果的影响。
- Tran-Nguyen VK, Ballester PJ. Beware of Simple Methods for Structure-Based Virtual Screening: The Critical Importance of Broader Comparisons. J Chem Inf Model. 2023;63(5):1401-1405. DOI: 10.1021/acs.jcim.3c00071 —— 单基准结论外推的方法论警示。
- Huang A, Knight IS, Naprienko S. Data Leakage and Redundancy in the LIT-PCBA Benchmark. arXiv:2507.21404. 2025. DOI: 10.48550/arXiv.2507.21404 —— 泄漏审计及引发的立体异构体口径之争,基准评测规范演进的分水岭。
§8.6 社区活跃度
- 引用轨迹:Semantic Scholar 269 次(含 37 次高影响力引用)、Google Scholar 297+、Europe PMC 146 篇(截至 2026-09-07 快照),2020 年后年均数十次且持续增长。
- 生态角色:2021 年后几乎所有 ML 虚拟筛选新方法的默认评测场(GNINA、MILCDock、DrugCLIP、SPRINT、DENVIS、CHEESE 均在榜);2025 年审计-反驳-再审计的公开辩论进一步抬高其社区可见度。
- 维护状态:官网持续在线(法国斯特拉斯堡),无正式 issue 渠道;社区讨论主要在相关论文与 GitHub 审计仓库进行。
- 方法学者参与:数据集构建者团队后续持续输出方法论指导(Nat Protoc 2023 的 ML 打分实践指南、2023 年"当心简单方法"的方法论警示),说明原团队仍在积极参与评测规范演进,而非"发布即弃管"。
- 使用者画像:学术 ML/计算化学实验室为主,工业界用作内部方法的公共 sanity check;教学场景下被用作"基准偏倚与泄漏"案例库。
§8.7 生态快照
| 资源 | 类型 | 链接 | Star/热度(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| 官网与下载 | 官方数据主页 | http://drugdesign.unistra.fr/LIT-PCBA/ | 不适用 | 唯一权威分发源(Full + AVE 双包) |
| LIT-PCBA-audit | 审计脚本仓库 | GitHub | 社区新仓库(2025) | 泄漏/重复检测与记忆基线复现 |
| GNINA | 对接+深度打分软件 | GitHub: gnina/gnina | 活跃维护 | 结构路线标准工具 |
| TorchDrug | 深度分子学习库 | GitHub: DeepGraphLearning/TorchDrug | 高热度 | 内置 LIT-PCBA 任务接口 |
| RDKit | 化学信息学基础库 | rdkit.org | 事实标准 | 本页全部代码依赖 |
| bio.tools 注册页 | 语义注册 | bio.tools/lit-pcba | 不适用 | 机器可读元数据入口 |
§9 相关资源与引用
§9.1 官方与社区资源
- 官方主页与下载:drugdesign.unistra.fr/LIT-PCBA(Full data / AVE unbiased data 双包 + 靶标-试验登记表)
- 原始论文(PubMed):PMID 32282202;开放获取全文:HAL hal-03013622
- 论文 SI:figshare 存档(CC BY-NC 4.0)
- 机器可读注册:bio.tools/lit-pcba
- 审计与复现:sievestack/LIT-PCBA-audit;立体异构体争议技术博客
- 结构资源:RCSB PDB(按官网模板清单取受体);PubChem BioAssay(按官网 AID 回查原始试验)
- 实践教程:Tran-Nguyen et al., Nat Protoc 2023——ML 打分函数构建与评测的分步指南,含 LIT-PCBA 式基准的指标建议
- 姊妹工具:GNINA(结构路线)、TorchDrug(图学习接口)、RDKit(规范化与指标)
- 相关基准主页:DUD-E(dude.docking.org)、DUDE-Z(dudez.docking.org)——跨基准比较时按需取用
§9.2 BibTeX 引用
@article{trannguyen2020litpcba,
title = {LIT-PCBA: An Unbiased Data Set for Machine Learning and Virtual Screening},
author = {Tran-Nguyen, Viet-Khoa and Jacquemard, C{\'e}lien and Rognan, Didier},
journal = {Journal of Chemical Information and Modeling},
volume = {60},
number = {9},
pages = {4263--4273},
year = {2020},
doi = {10.1021/acs.jcim.0c00155}
}
@article{wallach2018ave,
title = {Most Ligand-Based Benchmarks Measure Overfitting Rather than Accuracy},
author = {Wallach, Izhar and Heifets, Abraham},
journal = {Journal of Chemical Information and Modeling},
volume = {58},
number = {5},
pages = {916--932},
year = {2018},
doi = {10.1021/acs.jcim.7b00403}
}
@article{chen2019dudehidden,
title = {Hidden bias in the {DUD-E} dataset leads to misleading performance of deep learning in structure-based virtual screening},
author = {Chen, Lieyang and Cruz, Anthony and Ramsey, Steven and Dickson, Callum J. and Duca, Jose S. and Hornak, Viktor and Koes, David R. and Kurtzman, Tom},
journal = {PLoS ONE},
volume = {14},
number = {8},
pages = {e0220113},
year = {2019},
doi = {10.1371/journal.pone.0220113}
}
@article{sunseri2021gnina,
title = {Virtual Screening with {Gnina} 1.0},
author = {Sunseri, Jocelyn and Koes, David Ryan},
journal = {Molecules},
volume = {26},
number = {3},
pages = {7369},
year = {2021},
doi = {10.3390/molecules260307369}
}
@article{shen2021accuracy,
title = {Accuracy or novelty: what can we gain from target-specific machine-learning-based scoring functions in virtual screening?},
author = {Shen, Chao and Weng, Gaoqi and Zhang, Xujun and Leung, Elmer and Yao, Xiaojun and Pang, Jinping and Chai, Xin and Li, Dan and Wang, Ercheng and Cao, Dongsheng and Hou, Tingjun},
journal = {Briefings in Bioinformatics},
volume = {22},
number = {5},
pages = {bbaa410},
year = {2021},
doi = {10.1093/bib/bbaa410}
}
@article{yang2022docking,
title = {Protein--Ligand Docking in the Machine-Learning Era},
author = {Yang, Chao and Chen, Eric and Zhang, Yingkai},
journal = {Molecules},
volume = {27},
number = {14},
pages = {4568},
year = {2022},
doi = {10.3390/molecules27144568}
}
@article{trannguyen2023beware,
title = {Beware of Simple Methods for Structure-Based Virtual Screening: The Critical Importance of Broader Comparisons},
author = {Tran-Nguyen, Viet-Khoa and Ballester, Pedro J.},
journal = {Journal of Chemical Information and Modeling},
volume = {63},
number = {5},
pages = {1401--1405},
year = {2023},
doi = {10.1021/acs.jcim.3c00071}
}
@article{huang2025audit,
title = {Data Leakage and Redundancy in the {LIT-PCBA} Benchmark},
author = {Huang, Amber and Knight, Ian Scott and Naprienko, Slava},
journal = {arXiv preprint arXiv:2507.21404},
year = {2025},
doi = {10.48550/arXiv.2507.21404}
}
§9.3 引用指南
使用 LIT-PCBA 的任何评测结果时:引用原始论文(trannguyen2020litpcba)+ 明确注明所用包版本(Full / AVE)与下载日期;涉及划分与去偏的讨论引用 wallach2018ave;与 DUD-E 比较时引用 chen2019dudehidden;复现审计结论时同时引用 huang2025audit 与立体化学口径的来源,避免单边引用。
§10 AI 使用声明卡
§10.1 本页面使用的 AI 模型
- 大语言模型(本 Wiki 文本起草与结构化);无其他生成式模型参与。
§10.2 AI 参与范围
- 参与:资料检索汇总、章节结构生成、代码示例撰写、表格整理与语言润色。
- 不参与:事实数值的最终裁定(全部来自下方引用文献/官网)、医学与数据工程结论的审核(由人工编辑完成)。
§10.3 输入来源列表
- Tran-Nguyen VK, Jacquemard C, Rognan D. LIT-PCBA: An Unbiased Data Set for Machine Learning and Virtual Screening. J Chem Inf Model. 2020;60(9):4263-4273. DOI: 10.1021/acs.jcim.0c00155
- Wallach I, Heifets A. Most Ligand-Based Benchmarks Measure Overfitting Rather than Accuracy. J Chem Inf Model. 2018;58(5):916-932. DOI: 10.1021/acs.jcim.7b00403
- Chen L, Cruz A, Ramsey S, Dickson CJ, Duca JS, Hornak V, Koes DR, Kurtzman T. Hidden bias in the DUD-E dataset leads to misleading performance of deep learning in structure-based virtual screening. PLoS ONE. 2019;14(8):e0220113. DOI: 10.1371/journal.pone.0220113
- Sunseri J, Koes DR. Virtual Screening with Gnina 1.0. Molecules. 2021;26(3):7369. DOI: 10.3390/molecules260307369
- Shen C, Weng G, Zhang X, Leung E, Yao X, Pang J, Chai X, Li D, Wang E, Cao D, Hou T. Accuracy or novelty: what can we gain from target-specific machine-learning-based scoring functions in virtual screening? Brief Bioinform. 2021;22(5):bbaa410. DOI: 10.1093/bib/bbaa410
- Yang C, Chen E, Zhang Y. Protein–Ligand Docking in the Machine-Learning Era. Molecules. 2022;27(14):4568. DOI: 10.3390/molecules27144568
- Tran-Nguyen VK, Bret G, Rognan D. True Accuracy of Fast Scoring Functions to Predict High-Throughput Screening Data from Docking Poses: The Simpler the Better. J Chem Inf Model. 2021;61(6):2788-2797. DOI: 10.1021/acs.jcim.1c00383
- Tran-Nguyen VK, Junaid M, Simeon S, Ballester PJ. A practical guide to machine-learning scoring for structure-based virtual screening. Nat Protoc. 2023;18(11):3460-3511. DOI: 10.1038/s41596-023-00897-y
- Tran-Nguyen VK, Ballester PJ. Beware of Simple Methods for Structure-Based Virtual Screening: The Critical Importance of Broader Comparisons. J Chem Inf Model. 2023;63(5):1401-1405. DOI: 10.1021/acs.jcim.3c00071
- Caba K, Tran-Nguyen VK, Rahman T, Ballester PJ. Comprehensive machine learning boosts structure-based virtual screening for PARP1 inhibitors. J Cheminform. 2024;16(1):40. DOI: 10.1186/s13321-024-00830-2
- Huang A, Knight IS, Naprienko S. Data Leakage and Redundancy in the LIT-PCBA Benchmark. arXiv:2507.21404. 2025. DOI: 10.48550/arXiv.2507.21404
- LIT-PCBA 官方网站(靶标表、下载入口):http://drugdesign.unistra.fr/LIT-PCBA/
- LIT-PCBA-audit 复现与立体异构体技术博客:http://mireklzicar.com/blog/stereoisomers
- Semantic Scholar / Google Scholar / Europe PMC 引用快照(2026-09-07):https://api.semanticscholar.org/graph/v1/paper/DOI:10.1021/acs.jcim.0c00155
- bio.tools 注册页:https://bio.tools/lit-pcba
§10.4 人工校验
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(靶标-领域映射、ICD-11/SNOMED 对照) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(三个规模口径、版本矩阵) | 千方病案医学编辑部 | 与官网及论文摘要交叉比对 | ✅ 已验证 |
| §4 数据结构(目录树、DAIMS 字段字典) | 千方病案医学编辑部 | 与官网分发说明及 audit 论文交叉比对 | ✅ 已验证 |
| §5 划分策略(AVE 协议、泄漏风险) | 千方病案医学编辑部 | 与 Wallach & Heifets 原文及 Shen 2021 协议交叉比对 | ✅ 已通过 |
| §6 代码示例与 8 个坑点 | 千方病案医学编辑部 | 逻辑审查 + 与 audit 仓库/综述结论比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 排行榜与引用数表述 | 千方病案医学编辑部 | 与 Semantic Scholar API 及文献原文快照比对 | ✅ 已验证 |
§10.5 AI 生成章节标注
- 全部章节由 AI 辅助起草;§2.1/§2.1b 的靶标-疾病映射与 §6 全部代码为 AI 生成内容,已经人工逐项核对(见 §10.4)。
- 数值类内容(规模、比例、EF1%、引用数)逐项回溯至 §10.3 输入来源列表中的原始出处;凡检索不到出处的字段一律省略而非估算。
- 争议性结论(2025 审计 vs 立体异构体反驳)按双方原文并列呈现,未做单边裁决;正文以"审计报告称/复现发现称"的归因句式表述。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
