GDSC — 肿瘤药物敏感性基因组学 AI-Ready Wikipedia

1,000 细胞系 × 数百药物的癌症药理基因组学金标准资源

来源 Wellcome Sanger Institute × Massachusetts General Hospital Cancer Center url: https://www.cancerrxgene.org/发布时间: 2026-09-12最后更新: 2026-09-25 阅读 45
GDSC — 肿瘤药物敏感性基因组学 AI-Ready Wikipedia

信息速览

数据集名称GDSC — 肿瘤药物敏感性基因组学 AI-Ready Wikipedia
数据类型约 1,000 个癌细胞系模型,GDSC1 403 药物 / GDSC2 297 药物,累计 27 万+ 拟合药敏记录,CSV/XLSX 开放下载,突变+表达+甲基化多组学
规模约 1,000 个癌细胞系模型(细胞系资源,非患者队列)
接入方式Wellcome Sanger Institute × Massachusetts General Hospital Cancer Center url: https://www.cancerrxgene.org/
AI 就绪度

数据集封面

GDSC(肿瘤药物敏感性基因组学) — 癌细胞系药敏×多组学金标准 AI-Ready Wikipedia

INFOBOX

字段 内容
数据集名称 GDSC(肿瘤药物敏感性基因组学)
英文全称 Genomics of Drug Sensitivity in Cancer
别名/简称 CancerRxGene、GDSC1000、GDSC1 / GDSC2
疾病分类(ICD-11) 2A00-2F9Z 恶性肿瘤全域(覆盖肺 2C25、乳腺 2C60、结直肠 2B90/2B91 等约 30 种组织学类型)
SNOMED CT 363346000(Malignant neoplastic disease,恶性肿瘤性病变)
数据模态 IC50/AUC 药物敏感性 + 体细胞突变/拷贝数 + 基因表达 + 甲基化
AI 任务类型 回归(药物响应预测)、生物标志物关联发现、药物重定位
样本总数 GDSC1 177,310 对(958 系 × 208 药,TDC 口径);GDSC2 92,703 对(805 系 × 137 药,TDC 口径);官方两代合并 576,758 对(2023-10 版)
数据大小 拟合数据 GDSC1 52MB + GDSC2 38MB(CSV);原始数据 GDSC1 743MB + GDSC2 2.0GB(Release 8.4)
数据格式 CSV、XLSX、ZIP(原始数据包)、PDF(数据说明)
许可证 开放获取(官方声明数据可不受限制自由使用;TDC 镜像标注为 CC BY-NC-ND 2.5)
访问级别 开放(无需注册)
DUO 标签 NRES(无限制使用)/ GRU(通用研究使用)
语言 英语
首发日期 2012(数据库随 Yang et al., Nucleic Acids Res 论文上线)
最后更新 2023-10-27(Release 8.5,截至 2026-09 官网数据已整合进 Sanger DepMap)
发布机构 Wellcome Sanger Institute 与 Massachusetts General Hospital Cancer Center
官方主页 https://www.cancerrxgene.org/
下载地址 https://cellmodelpassports.sanger.ac.uk/downloads
DOI 10.1016/j.cell.2016.06.017
引用次数 2,281+(Google Scholar,截至 2026-09,Iorio et al. 2016 主论文)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 拟合端点 CSV/XLSX 直接可用、字段干净且有官方数据字典,扣分项:无官方训练/测试划分需自行防泄漏设计,GDSC1/GDSC2 同对数值冲突需自行裁决
页面状态 published

§0 E-E-A-T 审核与可信度声明

  • 医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、疾病流行病学)、§7 偏倚分析与局限性。
  • 数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
  • 审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。GDSC 官方声明数据可不受限制地自由获取与使用(Data are freely available without restriction),但使用时应遵守 Wellcome Sanger Institute 官网的最终用户条款并规范引用原始论文。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? GDSC(Genomics of Drug Sensitivity in Cancer,肿瘤药物敏感性基因组学)是一个把"癌细胞对药物的反应"和"癌细胞的基因组画像"配对起来的公共数据库。可以把它想象成一张巨大的对照表:一边是约 1,000 个癌细胞系,另一边是数百种抗肿瘤药物,表格里的每个格子记录这种药对这个细胞系需要多高浓度才能杀灭一半细胞(IC50),而每个细胞系又配有它的突变、基因表达、甲基化等"身份证"。

为什么重要? 肿瘤精准医疗的核心假设是:基因改变决定药物反应。GDSC 用系统性的实验验证了这一假设——例如 BRAF 突变的黑色素瘤细胞系对 BRAF 抑制剂极其敏感,EGFR 突变的肺癌细胞系对 EGFR 抑制剂敏感。这种"基因型 → 药敏"的大规模配对数据是生物标志物发现、药物重定位和响应预测模型的训练基础,其主论文已被引用 2,281+ 次(Google Scholar,截至 2026-09)。

我能用它做什么? 训练"输入细胞系多组学特征 + 药物结构,输出 IC50"的预测模型;验证某个基因突变是否是某药的响应标志;把候选药物的敏感性谱与已知药物对齐做重定位推测;或作为 AI 基准(TDC 已把 GDSC1/GDSC2 收录为标准药敏预测任务)。全部数据开放下载,无需注册。

§1.1 技术摘要

GDSC 由英国 Wellcome Sanger 研究所癌症基因组计划(Cancer Genome Project)与美国麻省总医院(MGH)分子治疗中心联合构建,自 2009 年启动高通量筛选,数据库于 2012 年随 Yang et al.(Nucleic Acids Res, 2013) 论文正式上线。药敏实验采用 72 小时细胞活力测定:GDSC1 阶段(2009-2015,Sanger+MGH)使用 Syto60 荧光 DNA 染料或 Resazurin 代谢法读出,GDSC2 阶段(2015 起,Sanger)升级为 1536 孔板 + 声学移液 + CellTiter-Glo 读出(Sanger DepMap 官方文档)。原始荧光/发光值经 gdscIC50 多水平模型拟合为 IC50 与 AUC 两类端点。基因组维度上,GDSC 与 COSMIC 细胞系计划打通,提供全外显子测序(Agilent SureSelectXT 50Mb 捕获)、Affymetrix U219 阵列 RMA 归一化表达谱(18,562 个位点)、拷贝数与启动子甲基化数据。标志性成果 GDSC1000(Iorio et al., Cell, 2016)将 11,289 例肿瘤中识别的癌症功能事件映射到 1,001 个分子注释细胞系,与 265 种药物的敏感性关联,发现 688 个显著的药物-基因关联。截至 2026-09,官网数据已整合进 Sanger DepMap 平台,最新完整版本为 Release 8.5(2023-10-27)。

§1.2 战略价值

维度一:药敏预测任务的"事实基准"。 在癌症药物响应预测(Drug Response Prediction)这一 AI 任务上,GDSC 是被引次数最多、社区采用最广的训练数据来源之一。Therapeutics Data Commons(TDC)将其收录为标准多模态基准:GDSC1 子集 177,310 对(958 细胞系 × 208 药物)、GDSC2 子集 92,703 对(805 细胞系 × 137 药物),标签为 log IC50,配套基因表达特征与药物 SMILES(TDC 官方文档)。几乎所有近年的深度药敏预测模型(图神经网络、多模态基础模型等)都在 GDSC 上报告结果,形成事实上的算法比较生态。

维度二:生物标志物发现的"湿实验验证底座"。 与仅提供组学数据的资源不同,GDSC 的核心竞争力是带定量的功能性读出(药物敏感性表型)。官方 ANOVA/MANOVA 统计管线直接输出"哪些突变/拷贝数改变与哪些药物显著关联"的现成结果文件(ANOVA_results_GDSC1/GDSC2),研究者可以在动手建模之前先查询已发表的统计证据。GDSC1000 论文发现 688 个显著药物-基因关联,其中包含 MLL2 突变鳞状肺癌对抗雄激素药物 Bicalutamide 敏感等可湿实验验证的新假设(Iorio et al., 2016;EMBO Mol Med 综述)。

维度三:开放许可与生态整合。 官方明确声明"Data are freely available without restriction"(数据可不受限制自由获取),无需注册、无需签署协议,这在临床级医疗数据中极为罕见。GDSC 数据同时被 COSMIC、Sanger Cell Model Passports(编目 2,000+ 细胞模型)、DepMap、PharmacoDB、TDC 等平台吸收整合,形成"一次产出、多平台分发"的生态,便于与 CCLE、CTRPv2、PRISM 等横向数据集做交叉验证。

§1.3 同类数据集横向对比

数据集 细胞系规模 药物规模 药敏标注 组学模态 差异化定位
GDSC(本页) GDSC1 970 / GDSC2 969 个模型(官方口径);四大药敏库中细胞系数最多(1,075,PharmacoDB 口径) GDSC1 403 / GDSC2 297 化合物 IC50 + AUC(多水平模型拟合) WES 突变、CNV、U219 表达、甲基化 基因组注释最深,与 COSMIC 打通,官方 ANOVA 关联分析现成
CTRPv2 数百个(Broad/Novartis 产出) 481 种(四大库中最多) AUC 与敏感性评分 表达、突变、CNV 药物覆盖广,浓缩池条码筛选
PRISM 578 个细胞系 4,518 种化合物 复铜池 log fold-change + 二次剂量确认 条码测序读出 以条码混合池实现药物数最大化
CCLE 约 1,000 个 24 种(2012 首版) IC50/AUC(固定浓度范围) 表达、突变、CNV、甲基化 组学数据全,药敏覆盖窄
gCSI 数百个 数十种 IC50/AUC 基因组 + 药敏 Genentech 产出,用于第三方交叉验证

来源:Sanger DepMap 文档、Gynecologic Oncology 2021 评估研究、EMBO Mol Med 综述。四库的浓度范围、检测方法与拟合口径不同,数值不可直接互比(详见 §7.1)。

§1.4 版本时间轴

时间 版本/事件 说明
2009 筛选启动 Sanger 癌症基因组计划与 MGH 开始 GDSC1 高通量筛选
2012 数据库上线 Garnett et al., Nature 发表首批系统性药敏-基因组分析;Yang et al., Nucleic Acids Res 数据库论文上线(时含约 75,000 次实验、138 药物、近 700 细胞系)
2015 GDSC2 启动 Sanger 独立承担新一代筛选:1536 孔板 + CellTiter-Glo
2016-07 GDSC1000 论文 Iorio et al., Cell:1,001 细胞系 × 265 药物,688 个显著关联
2020-02-25 Release 8.2 GDSC2 数据首版公开发布体系成型
2022-07-24 Release 8.4 拟合数据 CSV/XLSX + 原始数据(GDSC2 原始 2.0GB)+ ANOVA 结果完整发布
2023-10-27 Release 8.5 最新完整版本(GDSC1/GDSC2 拟合数据 27Oct23 文件族)
截至 2026-09 整合进 Sanger DepMap cancerrxgene.org 域名现为迁移通知页,下载入口移至 Cell Model Passports 与 DepMap DataMiner

§1.5 典型应用场景

  1. 药物响应预测模型:以细胞系基因组特征(突变/表达/CNV)+ 药物分子结构(SMILES/指纹)为输入,回归预测 LN_IC50 或 AUC;TDC 基准即为此任务设计。典型工作流:TDC 取数 → 分组划分(§5.3)→ 双塔模型(§6.4)→ 冷启动双指标报告(§6.9)。
  2. 生物标志物验证与发现:查询官方 ANOVA 结果文件验证"基因 X 突变是否与药物 Y 敏感相关",或用弹性网络/逻辑模型发现新的关联(GDSC1000 共报告 688 个显著关联)。典型工作流:下载 ANOVA_results → 按 Q 值筛选 → 与自己的队列突变谱交叉 → 提出湿实验验证假设。
  3. 药物重定位推测:将老药的药敏谱与化合物库比对,发现意外适应症线索(如 MLL2 突变鳞癌对 Bicalutamide 敏感的提示)。典型工作流:取药敏谱向量 → 计算谱相似度 → 结合 TARGET_PATHWAY 注释解释机制。
  4. 多组学融合方法学评测:因为同一批细胞系同时拥有突变、表达、甲基化、CNV 四类特征,GDSC 是评估"哪种模态对药敏预测贡献最大"的理想试验场(Iorio et al. 2016 证明突变 + 组织 lineage 信息贡献最大)。典型工作流:按模态做特征消融 → 按组织分层评估(§6.9)。
  5. 冷肿瘤模型预筛:在缺乏临床样本的罕见癌种上,用 GDSC 中同组织来源细胞系先做药物敏感性摸底,再决定是否推进类器官/PDX 验证。典型工作流:按组织描述符取子集 → 药敏排序 → 优先推进敏感药物与联合假设。

§2 医学背景

§2.1 疾病分类映射

GDSC 覆盖约 30 种组织描述符(GDSC Tissue Descriptor,如 lung_NSCLC_adenocarcinoma、large_intestine、haematopoietic malignancies 等,标签清单见官方文件)。其疾病谱对应 ICD-11 第 02 章"肿瘤性疾病"(2A00-2F9Z 恶性肿瘤全域)。下表为高频组织的映射示例:

疾病标签 ICD-11 编码 SNOMED CT 码 术语(中/英)
肺癌(含 NSCLC 腺癌/鳞癌描述符) 2C25 93880000 肺恶性肿瘤 / Primary malignant neoplasm of lung
乳腺癌 2C60 254837009 乳腺恶性肿瘤 / Primary malignant neoplasm of breast
结直肠癌(large_intestine) 2B90(结肠) 363406000 结肠恶性肿瘤 / Malignant tumor of colon
胃癌(stomach) 2B72 — 胃恶性肿瘤 / Carcinoma of stomach
肝细胞癌(liver) 2C12 — 肝细胞癌 / Hepatocellular carcinoma
胰腺癌(pancreas) 2C10 — 胰腺恶性肿瘤 / Carcinoma of pancreas
卵巢癌(ovary) 2C73 — 卵巢恶性肿瘤 / Carcinoma of ovary
前列腺癌(prostate) 2C82 399068003 前列腺恶性肿瘤 / Malignant tumor of prostate
皮肤黑色素瘤(skin) 2C30 372244006 恶性黑色素瘤 / Malignant melanoma
急性髓系白血病(haematopoietic) 2A60 91861009 急性髓系白血病 / Acute myeloid leukemia

注:ICD-11 母类为 2A00-2F9Z(Malignant neoplasms);SNOMED CT 总类为 363346000(Malignant neoplastic disease)。"—"表示本页未逐项核实该组织对应的 SNOMED 码,使用者应对照 ICD-11/SNOMED 官方浏览器确认。

§2.2 疾病简介与流行病学

癌症是全球第二大死亡原因。据 IARC《全球癌症统计》(GLOBOCAN 2022,Bray et al., CA Cancer J Clin, 2024),2022 年全球新发癌症约 2,000 万例、死亡约 970 万例;肺癌、乳腺癌、结直肠癌与前列腺癌是新发病例最多的四种,均被 GDSC 细胞系面板充分覆盖。GDSC 的疾病背景逻辑是"基因型决定治疗反应":BCR-ABL 融合基因定义了伊马替尼(Imatinib)对慢性髓系白血病的适应症,BRAF V600E 突变定义了维莫非尼(Vemurafenib)对黑色素瘤的适应症,EGFR 激活突变定义了吉非替尼/厄洛替尼对 NSCLC 的适应症——这些教科书级的" genomic biomarker → drug response "关系正是 GDSC 建库的假设原型(Yang et al., 2013)。

细胞系药敏资源在癌症研究中的独特位置在于:它把"分子诊断时代的临床观察"放大为可控、可重复、可全基因组扫描的体外实验。一个临床观察(某患者对靶向药显著响应)往往需要数月且不可复制;而 GDSC 中同一假设可以在数百个细胞系上于同一批实验中检验,并立刻关联到突变、表达与甲基化层面。这正是 2012 年以来药理基因组学(pharmacogenomics)从零散报道转向系统性大科学的前提。

§2.3 临床任务定义

GDSC 服务于精准肿瘤学中的三类核心任务,均属"治疗反应预测"而非"诊断":

临床任务 在 GDSC 中的对应 输出形式
疗效预测/患者分层 用肿瘤活检的基因组特征预测患者肿瘤对候选药物的敏感性 连续 IC50/AUC 预测值 → 敏感/耐药二分类阈值
伴随诊断生物标志发现 官方 ANOVA 检验每个癌症基因突变与每个药物的关联 药物 × 基因关联表(P 值 + 效应方向)
药物重定位 比对化合物敏感性谱与作用机制注释 新适应症假设

需要强调的临床边界:GDSC 测量的是 2D 贴壁/悬浮培养细胞系的体外活力,不能直接外推为患者体内的药代动力学与肿瘤微环境反应;其定位是临床前假设生成(hypothesis generation),而非处方依据。

§2.4 患者人群与模型来源

GDSC 的"样本"是永生化癌细胞系(每个细胞系源自一名患者的肿瘤标本),因此下表描述的是细胞系来源的分布特征:

维度 描述
来源 全球实验室捐献的肿瘤手术/活检标本建立的永生化细胞系,经 Sanger 细胞系计划与 COSMIC 统一测序注释
时间跨度 细胞系建立于数十年间;药敏筛选实验 2009-2015(GDSC1,Sanger+MGH)与 2015-2023(GDSC2,Sanger)
组织分布 约 30 种组织描述符,以肺、乳腺、结直肠、血液系统恶性肿瘤为主,罕见组织(如肾上腺、胆管)细胞系数少
种族/性别 细胞系层面未系统标注供体种族与性别;多数常用细胞系源自欧美人群标本,代表性偏倚需注意
就医类型 不适用(非队列研究;模型为体外细胞)

§2.5 临床价值路径

从 GDSC 数据到患者获益的典型路径是三步式:(1) 在 GDSC 上发现"突变 X 与药物 Y 敏感强关联"并理解机制;(2) 用患者来源类器官、PDX 小鼠或独立细胞系面板(如 gCSI、CCLE)做外部验证;(3) 设计前瞻性生物标志物指导的临床试验(basket trial)。GDSC1000 发现的 688 个关联中已有多个进入后续验证,例如 MLL2(KMT2C)失活突变的鳞状肺癌细胞系对雄激素受体拮抗剂 Bicalutamide 敏感的发现,为表型驱动的老药新用提供了范例(EMBO Mol Med 综述)。对 AI 团队而言,GDSC 上的模型是临床前证据链的第一环,其预测的"敏感/耐药"排序可用于候选药物优先级排序。

§2.6 标注金标准对照

属性 GDSC 的处理方式
划分方式 无官方训练/测试划分;社区惯例为随机划分(TDC)或按细胞系/药物分组的冷启动划分
标注方式 全自动计算标注:原始孔位活力值 → gdscIC50 多水平模型拟合 → IC50(自然对数,µM)与 AUC;官方 ANOVA 统计管线自动生成药物-基因关联
标注者 无人工逐条标注;化合物靶点与通路注释(screened_compounds 的 TARGET/TARGET_PATHWAY)为人工文献整理
标注性质 客观物理量(荧光/发光强度 → 浓度端点),可复算;拟合失败产生缺失值,属信息性缺失
质量控制 每块筛选板设置阴性/阳性对照孔;拟合输出 RMSE 供下游过滤;细胞系经认证并标注错误鉴定信息(Cell Model Passports)

§3 数据集规格

§3.0 版本抉择矩阵

GDSC 同时存在"两代实验(GDSC1/GDSC2)× 多个分发平台(官方 FTP/Cell Model Passports/TDC/DepMap)",动笔建模前先对号入座:

你的需求 推荐版本 大小 理由
快速复现 TDC 药敏预测基准 TDC DrugRes(name='GDSC1'/'GDSC2') 数十 MB 自动缓存 自带 log IC50 标签、RMD 归一化表达、SMILES 与随机划分,开箱即用
训练生产级药敏模型 官方 Release 8.5(27Oct23)拟合数据 GDSC1+GDSC2 拟合 XLSX 约 90MB 数据最新最全(两代合并 576,758 对),字段与官方文档一致
需要原始剂量-反应点做自定义拟合 Release 8.4/8.5 原始数据包 GDSC1 743MB + GDSC2 2.0GB(ZIP/CSV) 含每孔活力值,可用自研曲线拟合替代 gdscIC50
直接查询药物-基因关联证据 ANOVA_results_GDSC1/8.4 XLSX 68MB + 50MB 官方 MANOVA + 弹性网络结果,无需重算
与最新组学联合分析 Cell Model Passports(Data Version 2.15.0) 按数据集选择 组学经统一质控并持续更新,含错误鉴定细胞系标注

§3.1 模态详情

模态一:药物敏感性(核心表型)。 72 小时细胞活力筛选。GDSC1:96/384 孔板,Syto60(DNA 染料)或 Resazurin(代谢活性)读出,9 点 2 倍稀释(256 倍浓度范围)或 5 点 4 倍稀释(256 倍范围);GDSC2:1536 孔板 + Echo555 声学移液,CellTiter-Glo(ATP 发光)读出,7 点半对数稀释(1000 倍范围)或 7 点混合稀释(1024 倍范围)。每块板含阴性对照(无细胞)与阳性对照(无药)孔用于归一化。端点为 IC50(自然对数形式 LN_IC50,单位 µM)与 AUC(曲线下面积)(Sanger DepMap 官方文档)。

模态二:基因组特征。 全外显子测序(Agilent SureSelectXT Human All Exon 50Mb 捕获)提供体细胞突变(错义、移码、无义、剪接等)与拷贝数;拷贝数以焦点扩增/缺失事件表达。原始数据与探针注释存档于 ArrayExpress(表达谱登录号 E-MTAB-3610)与 EGAS00001000978(测序)。

模态三:转录组。 Affymetrix Human Genome U219 阵列板(GeneTitan 仪器),RMA 归一化,报告 18,562 个位点的强度值。

模态四:甲基化。 启动子甲基化数据用于 GDSC1000 的"癌症功能事件"(CFE)定义(体细胞突变 + 焦点拷贝数异常 + 高甲基化启动子三合一),随 Iorio et al. 2016 分发。

§3.2 按子集样本数统计

子集 细胞系数 药物数 药敏记录数 说明
GDSC1(官方筛选口径) 970 个模型 403 化合物 —(原始记录 743MB 文件级规模) 2009-2015,Sanger + MGH
GDSC2(官方筛选口径) 969 个模型 297 化合物 —(原始记录 2.0GB 文件级规模) 2015 起,仅 Sanger
GDSC1(TDC 处理口径) 958 208 177,310 对 log IC50 标签,配套表达 + SMILES
GDSC2(TDC 处理口径) 805 137 92,703 对 同上,实验流程改进版
GDSC 两代合并(2023-10 版) 978 624 576,758 对 MCMVDRP 论文援引的合并统计
建库初期(Yang 2013) 近 700 138 约 75,000 次实验 数据库首发规模

注:不同口径的细胞系/药物数差异源于是否纳入拟合失败记录、是否合并同药异名以及处理管道的过滤规则;建模时应以实际下载文件的行数为准。

口径选择的实操建议:写论文时主表用 TDC 口径(便于与已发表基线对齐),数据探查用官方筛选口径(药物/细胞系覆盖最全);两套口径并存不是矛盾,而是"处理管道"与"原始实验"的映射关系,引用时注明口径即可避免审稿质疑。

§3.3 数据格式

文件 格式 内容
GDSC1/GDSC2_fitted_dose_response_*.csv/xlsx CSV/XLSX 每行一个药物-细胞系对的拟合端点(DATASET、COSMIC_ID、CELL_LINE_NAME、DRUG_ID、DRUG_NAME、LN_IC50、AUC、MAX_CONC、RMSE)
GDSC1/GDSC2_public_raw_data_*.zip/csv ZIP/CSV 原始孔位级剂量-反应数据(含对照孔)
ANOVA_results_GDSC1/2_*.xlsx XLSX 官方 MANOVA 药物-基因关联结果
Cell_Lines_Details.xlsx XLSX 细胞系清单:名称、COSMIC ID、测序可得性(WES/CNV/表达/甲基化)、组织与癌种描述符
screened_compounds_rel_*.csv CSV 化合物注释:DRUG_NAME、DRUG_ID、TARGET、TARGET_PATHWAY、PUBCHEM_ID
GDSC_Fitted/Raw_Data_Description.pdf PDF 官方字段说明文档

§3.4 存储大小

以 Release 8.4(2022-07-24,FTP 直链)为例:GDSC1 拟合数据 52MB(CSV)/28MB(XLSX),GDSC2 拟合数据 38MB/20MB;GDSC1 原始数据 743MB,GDSC2 原始数据 2.0GB;ANOVA 结果 GDSC1 68MB、GDSC2 50MB;细胞系清单 115KB;化合物注释 45KB。Release 8.5(2023-10-27)的 XLSX 拟合包与原始 ZIP(63.34MB 起)经 Cell Model Passports 下载页分发。完整本地归档(拟合 + 原始 + 注释)预留约 5GB 磁盘空间即可。

§3.5 标注方式

药敏标签为全自动计算标注:原始荧光/发光值先经空白孔与阴性/阳性对照归一化,再由 gdscIC50 包以多水平固定效应模型拟合 sigmoid 剂量-反应曲线——形状参数仅在细胞系间变化,位置参数随细胞系与化合物联合调整,跨板联合估计以提高 IC50/AUC 的稳健性(官方拟合方法文档)。拟合同时输出 RMSE 与最大测试浓度 MAX_CONC,供下游识别不可靠曲线。化合物注释(靶点、通路)为人工文献整理,由 Sanger 团队维护并随版本更新。

多水平拟合的数学形态可概括为:对细胞系 i、药物 j、浓度点 c 的相对活力 v:

v_ijk = A_min + (A_max - A_min) · sigmoid(α_i, β_ij · (logC_ijk - μ_ij))
α_i   : 仅随细胞系变化的共享形状参数
β_ij  : 跨板共享的斜率分量
μ_ij  : 位置参数(即拟合 IC50 的来源)

该"形状跨药物共享、位置逐对估计"的设计是小剂量点(5-9 个)下仍能稳定估计端点的关键,也是自研拟合管线时应当对齐的方法学基准。

§3.6 标注者资质与一致性

无人工逐条标注环节,因此不存在标注者间一致性(IAA)问题;质量由实验与统计层面保证:所有筛选板执行严格的板级质控;曲线拟合模型为同行评审方法(Vis 等开发的多水平模型);同药物同细胞系在复测中的重现性曾在 GDSC 复制实验中评估(技术三重复 + 跨天数生物学重复,见 eLife 方法论文)。人工部分仅化合物靶点/通路注释,由 Sanger 药理团队按当前文献理解维护(官方注释说明)。

§3.7 采集周期

筛选实验跨越 2009-2023:GDSC1 于 2009-2015 在 Sanger 与 MGH 两地并行,GDSC2 自 2015 起在 Sanger 持续累积;数据以 release 滚动发布(8.1:2019-10;8.2:2020-02-25;8.4:2022-07-24;8.5:2023-10-27)。截至 2026-09,官网已停止独立版本滚动并将数据整合进 Sanger DepMap 平台。

§3.8 地域覆盖

实验产出地为英国 Hinxton(Wellcome Sanger Institute,Wellcome Genome Campus)与美国波士顿/查尔斯敦(MGH 癌症中心分子治疗中心)。细胞系供体人群以欧美为主、覆盖多地区肿瘤中心来源;GDSC 数据库本身不限制下载者地域。

§3.9 设备与实验规格

环节 GDSC1 GDSC2
培养板 96 孔 / 384 孔 1536 孔
加药方式 移液针头式液体处理 Echo555 声学移液(Beckman)
活力读出 Syto60(DNA 荧光)或 Resazurin(代谢) CellTiter-Glo(ATP 发光)
培养基 各细胞系推荐培养基 + 5%/10% FBS RPMI 或 DMEM/F12 + 10% FBS
化合物保存 -80°C 分装,≤5 次冻融 防潮低氧储藏柜(Roylan Storage Pods)
表达谱 Affymetrix U219 阵列(GeneTitan),RMA 归一化 同左(GDSC1000 面板)
测序 全外显子组,Agilent SureSelectXT 50Mb 同左

§3.10 深度溯源链

数据溯源路径为:患者肿瘤标本 → 永生化细胞系(实验室来源,经 STR 认证与错误鉴定筛查)→ Sanger 细胞系计划统一培养与测序(WES/CNV/表达/甲基化,数据存档 ArrayExpress E-MTAB-3610 与 EGAS00001000978)→ 药敏筛选(GDSC1:Sanger+MGH;GDSC2:Sanger)→ gdscIC50 拟合 → Release 发布(FTP + Cell Model Passports + DepMap 分发)。每一环节均有官方文档或论文支撑;细胞系主键为 COSMIC ID,可回溯至 COSMIC 数据库的突变细节。


§4 数据结构

§4.0 目录树

官方 Release 解压后(以 8.4/8.5 文件族为例):

gdsc_release/
├── GDSC1_fitted_dose_response_27Oct23.xlsx    # GDSC1 拟合端点(亦提供 CSV)
├── GDSC2_fitted_dose_response_27Oct23.xlsx    # GDSC2 拟合端点(亦提供 CSV)
├── GDSC1_public_raw_data_27Oct23.zip          # GDSC1 原始孔位数据
├── GDSC2_public_raw_data_27Oct23.zip          # GDSC2 原始孔位数据
├── ANOVA_results_GDSC1_24Jul22.xlsx           # 官方药物-基因关联(GDSC1)
├── ANOVA_results_GDSC2_24Jul22.xlsx           # 官方药物-基因关联(GDSC2)
├── Cell_Lines_Details.xlsx                    # 细胞系清单与组学可得性
├── screened_compounds_rel_8.5.csv             # 化合物注释(靶点/通路/PubChem ID)
├── GDSC_Fitted_Data_Description.pdf           # 拟合数据字段说明
├── GDSC_Raw_Data_Description.pdf              # 原始数据字段说明
└── GDSCtools_mobems.zip                       # 官方分析小工具

§4.1 DAIMS 核心字段字典

以核心表 GDSC2_fitted_dose_response(8 列风格)为例:

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
DATASET str 数据代际标识 GDSC2 区分两代实验口径 无 —
COSMIC_ID int 细胞系主键(COSMIC 数据库 ID) 740866 关联基因组特征的外键 ID 混用需以官方清单为准 无 官方细胞系清单内
CELL_LINE_NAME str 细胞系名称 A549 人工核查/展示 同名异系需防 无 —
DRUG_ID int 药物编号主键 1040 关联化合物注释 — 无 screened_compounds 内
DRUG_NAME str 药物名称(含同药异名) Erlotinib 语义对齐 PubChem/ChEMBL 大小写/连字符差异 无 —
LN_IC50 float 自然对数 IC50,µM(核心标签) 2.3219 回归标签 拟合 RMSE 伴生 拟合失败为缺失 连续(对数尺度)
AUC float 剂量-反应曲线下面积(备选标签) 0.116 回归标签/跨浓度比较 依赖测试浓度范围 拟合失败为缺失 连续
MAX_CONC float 最大测试浓度 µM 20.0 识别右删失/外推 IC50 — — 按药物定制
RMSE float 曲线拟合残差 0.087 质量过滤阈值 — — ≥ 0

化合物注释表 screened_compounds(每行一种化合物):DRUG_NAME、DRUG_ID、TARGET(名义治疗靶点)、TARGET_PATHWAY(人工整理通路)、PUBCHEM_ID(对接 PubChem 的语义桥梁)。细胞系注释表 Cell_Lines_Details(每行一个细胞系):COSMIC ID、名称、WES/CNV/表达/甲基化可得性标志、GDSC 组织描述符与癌种分类。

两张注释表的 DAIMS 字段字典如下:

screened_compounds:

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
DRUG_ID int 药物主键 1040 与拟合表关联 版本间可能漂移 无 官方注释表内
DRUG_NAME str 药物名称 Erlotinib 展示/检索 大小写与连字符差异 无 —
TARGET str 名义治疗靶点(可能有多个,分号分隔) EGFR 机制分层 名义靶点 ≠ 唯一靶点 无靶点药物为空 —
TARGET_PATHWAY str 人工整理的信号通路 EGFR signaling 通路级聚合分析 人工归类主观性 无 官方通路清单
PUBCHEM_ID str PubChem 物质标识 176870 跨库对齐主键 同分子多 ID 需标准化 未收录为空 PubChem 域
NCI_CODE str NCI 化合物代码(部分有) C1234 对接 NCI 资源 部分缺失 缺失为空 —

Cell_Lines_Details:

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
COSMIC ID int 细胞系主键 740866 全库外键 以官方清单为准 无 COSMIC 域
Cell Line Name str 细胞系名称 A549 展示/检索 同名异系 无 —
Whole Exome Sequencing str(flag) 是否具备 WES 数据 y 模态可得性过滤 — —
Gene Expression str(flag) 是否具备表达谱 y 模态可得性过滤 — —
Methylation str(flag) 是否具备甲基化数据 n 模态可得性过滤 — —
Drug Response str(flag) 是否具备药敏数据 y 样本过滤 — —
GDSC Tissue Descriptor 1 str 一级组织描述符 lung_NSCLC_adenocarcinoma 分层评估/防偏倚 粒度与 TCGA 分类不同 无 约 30 类
Cancer Type (es) str 扩展癌种分类 Lung cancer 疾病映射 与 ICD 映射需人工 无 —

§4.2 标签分布

LN_IC50 与 AUC 均为连续标签,无类别不平衡问题,但存在组织间结构性偏移:同一药物在不同组织 lineage 的 IC50 分布中心差异显著(Iorio et al. 2016 证明 lineage 是药敏预测中贡献最大的特征之一)。实际使用中需注意两点分布现象:(1) 部分药物-细胞系对的曲线在最高测试浓度内无法到达半抑制点,其 IC50 为外推值或缺失(不完整曲线,如卡铂在多个数据库的曲线普遍不完整,见 Gynecologic Oncology 2021);(2) GDSC1 与 GDSC2 对同一药物-细胞系对给出不同数值(平台差异所致),合并训练前必须显式裁决。

§4.3 关键统计

  • 拟合记录总量:GDSC1 177,310 对 + GDSC2 92,703 对(TDC 口径);两代合并 576,758 对(2023-10 版)。
  • 覆盖药物:GDSC1 403 + GDSC2 297 化合物(官方筛选口径),去重后 624 种(2023-10 合并口径);覆盖靶向药(激酶抑制剂等)与细胞毒化疗药两大类。
  • 覆盖细胞系:两代合计 978 个模型(2023-10 口径);四大药敏数据库中细胞系覆盖最广(1,075,PharmacoDB 口径)。
  • 基因组特征覆盖率:GDSC1000 面板 1,001 个细胞系均具备 WES 突变 + CNV + 表达;甲基化用于 CFE 定义。
  • 显著关联产出:GDSC1000 报告 688 个统计学显著的药物-基因关联(Iorio et al., 2016)。

§4.4 数据层级

GDSC 为"细胞系 × 药物"二级实体结构,外加实验批次层级:

Wellcome Sanger Institute / MGH(筛选机构)
└── Release(版本批次,如 8.5)
    └── 细胞系(COSMIC_ID 主键,约 1,000 个模型)
        ├── 基因组层:WES 突变 / CNV / U219 表达 / 甲基化(每系一套)
        └── 药物 × 剂量点(每药 5-9 个浓度)
            └── 孔位活力值(原始数据) → IC50 / AUC(拟合端点)

多模态对齐键为 COSMIC_ID(细胞系侧)与 DRUG_ID/PUBCHEM_ID(药物侧);与 CCLE、DepMap、COSMIC 等外部资源对齐依赖这两个键及官方映射表。

层级结构对建模的直接含义:(1) 拟合端点表是"扁平化的二级实体",任何一行都可以独立作为训练样本;(2) 原始数据在层级上深两层(剂量点 → 孔位),做自定义曲线拟合或不确定性建模时才需要下探;(3) 基因组层与药敏层通过 COSMIC_ID 一对多连接,拼接后特征矩阵是"宽表 + 多标签"形态,天然适配表格学习框架。

§4.5 缺失值与信息性缺失

缺失情形 表现 是否信息性 处理建议
曲线拟合失败 LN_IC50/AUC 缺失(NA) 是(常因活力曲线平坦或质控失败) 直接丢弃该对,勿插补
IC50 外推 曲线在 MAX_CONC 内未达半抑制,IC50 位于测试范围之外 是(不可靠) 过滤 LN_IC50 > log(MAX_CONC) 的行或改用 AUC
未筛选组合 细胞系 × 药物网格稀疏(576,758 / 978×624 ≈ 94.5% 理论覆盖率,但按代际切开远低) 是 预测任务视为自然场景,勿按完整矩阵假设设计
组学缺失 个别细胞系缺甲基化/表达 是 模态可得性表(Cell_Lines_Details)先行过滤

§5 划分与使用建议

§5.1 官方划分

GDSC 不提供官方训练/测试划分。官方发布的是全量筛选数据,划分完全交由下游研究者自行设计;TDC 的标准任务采用随机划分(random split)并以 MAE/Pearson 为指标(TDC 官方文档)。

§5.2 社区惯例划分

划分方式 做法 适用问题
随机划分 按 药物-细胞系对 随机切 8:1:1 快速原型、与 TDC 报告值可比
冷细胞系(cold cell line) 测试集细胞系在训练中完全未见 模拟"新患者样本入组"场景
冷药物(cold drug) 测试集药物在训练中完全未见 模拟"新药筛选"场景,考察化学特征泛化
双冷(cold drug + cold cell line) 二者均未见 最严格,性能显著下降属预期

§5.3 划分策略建议与泄漏风险

GDSC 最大的泄漏陷阱是细胞系跨集重复:同一 COSMIC_ID 的细胞系对几十至数百种药物各有一条记录,随机划分会把该细胞系的基因组特征"背进"训练集再在测试集里"对答案",使指标虚高。建议:以 COSMIC_ID 为组键做 GroupKFold/GroupShuffleSplit;若报告随机划分结果,必须同时补报冷细胞系/冷药物划分结果。药物侧同理:同药异名(不同 DRUG_ID 指向同一 PubChem 分子)会造成药物泄漏,需先按 PubChem ID 去重再划分。两代实验(GDSC1/GDSC2)的同对重复记录若混入训练与测试两侧,也构成版本间泄漏,详见 §6.5 坑点 1 与坑点 3。

按细胞系分组的最小划分实现:

from sklearn.model_selection import GroupShuffleSplit
import pandas as pd

def grouped_split(df, seed=42, test_size=0.15, val_size=0.15):
    """先按细胞系切出测试集,再在剩余组内切验证集;
    保证任一 COSMIC_ID 只出现在一侧。"""
    gss = GroupShuffleSplit(n_splits=1, test_size=test_size, random_state=seed)
    tr_va, te = next(gss.split(df, groups=df["COSMIC_ID"]))
    train_val = df.iloc[tr_va]
    gss2 = GroupShuffleSplit(n_splits=1, test_size=val_size / (1 - test_size),
                             random_state=seed)
    tr, va = next(gss2.split(train_val, groups=train_val["COSMIC_ID"]))
    return train_val.iloc[tr], train_val.iloc[va], df.iloc[te]

§5.4 交叉验证建议

回归任务推荐 5 折分组交叉验证(按细胞系分组)+ 每折内按组织描述符分层,保证罕见组织在每折均有代表;多模态模型另做模态 dropout 消融折。报告指标时给出折间均值 ± 标准差,并固定随机种子与 split 文件随代码发布,保证可复现。

嵌套式评估(模型选择与性能估计分离)的推荐骨架:

from sklearn.model_selection import GroupKFold

outer = GroupKFold(n_splits=5)                    # 外层:性能估计(按细胞系分组)
for k, (tr, te) in enumerate(outer.split(df, groups=df["COSMIC_ID"])):
    tr_df, te_df = df.iloc[tr], df.iloc[te]
    # 内层:在 tr_df 内再做分组划分选超参(勿让外层测试集参与任何选择)
    tr_in, va_in = inner_grouped_split(tr_df)
    model = tune_and_train(tr_in, va_in)
    print(f"fold {k}: ", evaluate(te_df["LN_IC50"], model.predict(te_df)))

避免的两个常见错误:(1) 用外层测试集挑超参(性能估计乐观偏置);(2) 只做一次 8:1:1 切分就下结论(10 万级样本下折间波动虽小但冷启动子集波动很大,必须多折平均)。

§5.5 外部验证建议

训练完成后优先在以下外部资源上验证:(1) CCLE 药敏子集(约 1,000 细胞系 × 24 药,组学与 GDSC 高度对齐);(2) CTRPv2 / PRISM(药物空间更大,但浓度口径不同,需用 adjusted AUC 对齐,见 Pozdeyev et al., 2016);(3) gCSI(Genentech 独立实验,专用于第三方复现检验);(4) PDX/类器官药敏数据用于跨模型层级验证。跨库验证时标签必须统一到公共浓度范围,直接比较 IC50 数值会得到误导性结论(详见 §7.1)。


§6 AI 就绪指南 ⭐

§6.0 云端快速启动

无需申请即可开始:数据完全开放。推荐 4 核 16GB 的 CPU 实例即可完成拟合数据处理与小模型训练;含表达谱的深度模型建议 1 张 16GB 显存 GPU。数据源二选一:Sanger 官方 FTP 直链(无需登录)或 TDC Python 接口(自动缓存)。

§6.1 快速上手

以下代码的目录结构假设:数据放在 data_root = "data/gdsc" 下,data_root 与文件名拼接得到完整路径;最小可用子集是单个 GDSC2_fitted_dose_response 表(一行一个药物-细胞系对),无需基因组数据即可跑通读入与统计。

# 目录预期:
#   data/gdsc/GDSC2_fitted_dose_response_27Oct23.csv   (从官方 Release 下载)
#   data/gdsc/screened_compounds_rel_8.5.csv
#   data/gdsc/Cell_Lines_Details.xlsx
import pandas as pd

DATA_ROOT = "data/gdsc"

# 拟合端点表:每行一个 药物-细胞系对
df = pd.read_csv(f"{DATA_ROOT}/GDSC2_fitted_dose_response_27Oct23.csv")
print(df.shape)                       # (92,703 量级, 9 列)
print(df[["CELL_LINE_NAME", "DRUG_NAME", "LN_IC50", "AUC"]].head())

# 官方核心统计:药物数 / 细胞系数 / 记录数
print("drugs:", df["DRUG_NAME"].nunique())
print("cell lines:", df["COSMIC_ID"].nunique())
print("pairs:", len(df))

§6.2 数据获取

渠道 链接 形式 大小 是否需申请
Cell Model Passports 下载页 cellmodelpassports.sanger.ac.uk/downloads GDSC1/GDSC2 拟合 XLSX + 原始 ZIP + 注释 拟合约 90MB;原始约 2.7GB 否
Sanger FTP 直链 ftp.sanger.ac.uk/pub/project/cancerrxgene/releases/release-8.4/ 全版本文件目录 单目录约 3GB 否
DepMap DataMiner dataminer.depmap.sanger.ac.uk 在线查询/导出 按需 否
TDC Python 包 tdcommons.ai 药敏任务页 自动缓存 DataFrame(含表达+SMILES) 数十 MB 否
# 方式一:官方 FTP 直链(Release 8.4 完整目录)
mkdir -p data/gdsc && cd data/gdsc
wget https://ftp.sanger.ac.uk/pub/project/cancerrxgene/releases/release-8.4/GDSC2_fitted_dose_response_24Jul22.csv
wget https://ftp.sanger.ac.uk/pub/project/cancerrxgene/releases/release-8.4/GDSC1_fitted_dose_response_24Jul22.csv
wget https://ftp.sanger.ac.uk/pub/project/cancerrxgene/releases/release-8.4/Cell_Lines_Details.xlsx
wget https://ftp.sanger.ac.uk/pub/project/cancerrxgene/releases/release-8.4/screened_compounds_rel_8.4.csv

# 方式二:TDC(自动下载缓存,标签为 log IC50,特征含表达 + SMILES)
pip install PyTDC
python -c "
from tdc.multi_pred import DrugRes
d1 = DrugRes(name='GDSC1');  s1 = d1.get_split()   # 177,310 对
d2 = DrugRes(name='GDSC2');  s2 = d2.get_split()   # 92,703 对
print(s1['train'].shape, s2['train'].shape)
"

§6.3 预处理全流程

核心流程:读取 → 版本裁决(GDSC1/GDSC2)→ 质量过滤(RMSE/外推)→ 键值对齐(PubChem ID 去重)→ 特征拼接 → 划分。

<details>
<summary>完整预处理代码(约 45 行,点击展开)</summary>

import numpy as np
import pandas as pd

DATA_ROOT = "data/gdsc"

# 1. 读取两代拟合数据(Release 8.4 CSV)
g1 = pd.read_csv(f"{DATA_ROOT}/GDSC1_fitted_dose_response_24Jul22.csv")
g2 = pd.read_csv(f"{DATA_ROOT}/GDSC2_fitted_dose_response_24Jul22.csv")
g1["DATASET"], g2["DATASET"] = "GDSC1", "GDSC2"

# 2. 版本裁决:同一 (COSMIC_ID, DRUG_ID) 在两代均有值时,默认保留 GDSC2
#    (实验口径更新:1536 孔 + CellTiter-Glo);也可全部保留并加 DATASET 特征
df = pd.concat([g1, g2], ignore_index=True)
df = df.sort_values("DATASET").drop_duplicates(
    subset=["COSMIC_ID", "DRUG_ID"], keep="last")     # GDSC2 优先

# 3. 质量过滤:丢弃拟合失败与明显外推的 IC50
df = df.dropna(subset=["LN_IC50", "AUC"])
if "MAX_CONC" in df.columns:
    df = df[df["LN_IC50"] <= np.log(df["MAX_CONC"].clip(lower=1e-6))]

# 4. 键值对齐:细胞系注释(组织描述符)合并,供分层评估
cl = pd.read_excel(f"{DATA_ROOT}/Cell_Lines_Details.xlsx")
df = df.merge(cl[["COSMIC ID", "GDSC\nTissue Descriptor 1"]]
                .rename(columns={"COSMIC ID": "COSMIC_ID",
                                 "GDSC\nTissue Descriptor 1": "TISSUE"}),
              on="COSMIC_ID", how="left")

# 5. 化合物注释合并 + 按 PubChem ID 去重(防同药异名泄漏)
cmpd = pd.read_csv(f"{DATA_ROOT}/screened_compounds_rel_8.4.csv")
df = df.merge(cmpd[["DRUG_ID", "TARGET_PATHWAY"]], on="DRUG_ID", how="left")

# 6. 分组划分:按细胞系分组,防止跨集泄漏
from sklearn.model_selection import GroupShuffleSplit
gss = GroupShuffleSplit(n_splits=1, test_size=0.15, random_state=42)
tr_idx, te_idx = next(gss.split(df, groups=df["COSMIC_ID"]))
train, test = df.iloc[tr_idx], df.iloc[te_idx]
print(train.shape, test.shape)

</details>

官方 ANOVA 结果文件是"零建模获取生物标志假设"的捷径——每行一个药物 × 基因特征组合,直接给出关联方向与显著性:

# ANOVA_results_GDSC2_24Jul22.xlsx:官方 MANOVA 药物-基因关联表
# 每行 = 某药物 × 某基因组特征(突变/拷贝数/组织)的关联检验结果
import pandas as pd

anova = pd.read_excel("data/gdsc/ANOVA_results_GDSC2_24Jul22.xlsx",
                      sheet_name=0)
cols = [c for c in ["DRUG_NAME", "DRUG_ID", "FEATURE", "MUTANT",
                    "CORRELATION", "P_VALUE", "Q_VALUE", "PEARSON"] if c in anova.columns]
sig = anova[anova["Q_VALUE"] < 0.2].sort_values("PEARSON")   # 官方 FDR 阈值
print(sig[cols].head(10))
# 正 PEARSON → 突变伴随耐药;负 PEARSON → 突变伴随敏感

提示:官方 ANOVA 使用其内置的多重检验校正与显著性阈值,直接采用官方 Q 值阈值可比自算 P 值更贴近论文口径。

§6.4 PyTorch DataLoader 完整代码

任务形态:细胞系基因表达向量 + 药物 Morgan 指纹 → 回归 LN_IC50。表达矩阵可从 Cell Model Passports 或 TDC 缓存获取;此处以 expression.csv(行=细胞系,列=基因)示意。

<details>
<summary>完整 Dataset + DataLoader 代码(约 55 行,点击展开)</summary>

# 目录预期:
#   data/gdsc/GDSC2_fitted_dose_response_27Oct23.csv
#   data/gdsc/expression.csv            (行=COSMIC_ID, 列=基因, RMA/TPM 归一化)
#   data/gdsc/drug_smiles.csv           (列=DRUG_ID, SMILES)
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
from rdkit import Chem
from rdkit.Chem import AllChem

class GDSCDrugResponseDataset(Dataset):
    """一行 = 一个药物-细胞系对;输入 = 表达向量 + 2048 位 Morgan 指纹"""
    def __init__(self, pairs_df, expr_df, smiles_df, fingerprint_bits=2048):
        self.expr = expr_df
        self.smiles = dict(zip(smiles_df["DRUG_ID"], smiles_df["SMILES"]))
        self.pairs = pairs_df.reset_index(drop=True)
        self.bits = fingerprint_bits

    def __len__(self):
        return len(self.pairs)

    def __getitem__(self, idx):
        row = self.pairs.iloc[idx]
        # 细胞系侧:表达向量(z-score 由预处理器保证)
        x_cell = self.expr.loc[row["COSMIC_ID"]].to_numpy(dtype=np.float32)
        # 药物侧:SMILES → Morgan 指纹
        mol = Chem.MolFromSmiles(self.smiles[row["DRUG_ID"]])
        fp = AllChem.GetMorganFingerprintAsBitVect(mol, radius=2, nBits=self.bits)
        x_drug = np.array(fp, dtype=np.float32)
        y = torch.tensor(row["LN_IC50"], dtype=torch.float32)
        return torch.from_numpy(x_cell), torch.from_numpy(x_drug), y

# 实例化(train/test 来自 §6.3 的分组划分)
expr_df = pd.read_csv("data/gdsc/expression.csv", index_col="COSMIC_ID")
expr_df = (expr_df - expr_df.mean()) / (expr_df.std() + 1e-8)   # z-score
smiles_df = pd.read_csv("data/gdsc/drug_smiles.csv")

train_ds = GDSCDrugResponseDataset(train, expr_df, smiles_df)
test_ds  = GDSCDrugResponseDataset(test,  expr_df, smiles_df)
train_loader = DataLoader(train_ds, batch_size=256, shuffle=True, num_workers=4)
test_loader  = DataLoader(test_ds,  batch_size=512, shuffle=False, num_workers=4)

</details>

配套的双塔 MLP 回归器(约 20 行):

import torch.nn as nn

class TwoTowerRegressor(nn.Module):
    def __init__(self, n_genes, fp_bits=2048, hidden=512):
        super().__init__()
        self.cell_tower = nn.Sequential(
            nn.Linear(n_genes, hidden), nn.ReLU(), nn.Dropout(0.2), nn.Linear(hidden, 128))
        self.drug_tower = nn.Sequential(
            nn.Linear(fp_bits, hidden), nn.ReLU(), nn.Dropout(0.2), nn.Linear(hidden, 128))
        self.head = nn.Sequential(nn.ReLU(), nn.Linear(128, 1))

    def forward(self, x_cell, x_drug):
        return self.head(self.cell_tower(x_cell) + self.drug_tower(x_drug)).squeeze(-1)

训练循环(含早停与测试评估,约 35 行):

import torch
import torch.nn as nn

device = "cuda" if torch.cuda.is_available() else "cpu"
model = TwoTowerRegressor(n_genes=expr_df.shape[1]).to(device)
opt = torch.optim.AdamW(model.parameters(), lr=1e-3, weight_decay=1e-4)
loss_fn = nn.MSELoss()

best, patience, bad = float("inf"), 5, 0
for epoch in range(100):
    model.train()
    for x_cell, x_drug, y in train_loader:            # train 来自 §6.3 分组划分
        x_cell, x_drug, y = x_cell.to(device), x_drug.to(device), y.to(device)
        opt.zero_grad()
        loss = loss_fn(model(x_cell, x_drug), y)
        loss.backward()
        opt.step()

    # 验证集早停(val 来自 §6.3 分组划分的 grouped_split)
    model.eval()
    with torch.no_grad():
        va_loss = [
            loss_fn(model(xc.to(device), xd.to(device)).cpu(), y).item()
            for xc, xd, y in val_loader
        ]
    mean_va = sum(va_loss) / len(va_loss)
    if mean_va < best:
        best, bad = mean_va, 0
        torch.save(model.state_dict(), "gdsc_best.pt")
    else:
        bad += 1
        if bad >= patience:
            break                                     # 早停触发

model.load_state_dict(torch.load("gdsc_best.pt"))

§6.5 坑点 8 个(GDSC 真实失败模式)

⚠️ 坑点 1:随机划分导致细胞系泄漏,指标虚高(分类:数据泄漏)

问题:同一细胞系对上百种药物各有一条记录,随机划分会把测试集细胞系的完整基因组画像泄入训练集,模型实际是在"认细胞系"而非"学基因型-药敏规律"。
症状:随机划分的 RMSE 远好于冷细胞系划分(常见数倍差距);换一批新细胞系上线模型后性能骤降。
解决:

  1. 简单方法:以 COSMIC_ID 为组键的 GroupShuffleSplit/GroupKFold,保证每个细胞系只出现在一侧。
  2. 进阶方法:同时报告冷细胞系与冷药物双冷划分;药物侧先按 PubChem ID 合并同药异名再划分,防止"换了 DRUG_ID 的同分子"泄漏。
  3. SOTA 方法:按 TDC 基准协议固定划分文件并随代码发布;对多模态模型补充"仅细胞系侧新样本"与"仅药物侧新分子"的分离评测,分别定位泛化短板。
    参考:TDC 药敏任务文档、TDC 论文(NeurIPS 2021, arXiv:2102.09548)

⚠️ 坑点 2:LN_IC50、AUC 与原始 IC50 三种标签混用(分类:标签理解)

问题:官方 LN_IC50 是自然对数(µM)而非 log10;AUC 依赖每种药物自定的测试浓度范围。三者语义不同,跨库或跨版本直接比较数值必然出错。
症状:把 LN_IC50 当 log10 解释导致 IC50 相差 2.3 倍;跨库比较 AUC 时发现同一药物-细胞系对数值天差地别(如 crizotinib 在 CCLE 2.5-8000 nM 范围 AUC 0.58,GDSC 7.8125-2000 nM 范围仅 0.13)。
解决:

  1. 简单方法:统一标签口径——训练、评估、文档全程只用 LN_IC50(或只用 AUC),并在模型卡中注明单位。
  2. 进阶方法:跨库比较时采用 adjusted AUC,即把各库曲线统一到公共浓度区间再积分(Pozdeyev et al. 2016 实证该指标跨库一致性最佳)。
  3. SOTA 方法:保留原始浓度范围元数据随模型发布;对齐外部库时用区间对齐的重新拟合而非端点换算。

adjusted AUC 的核心思想是把 AUC 的积分下限/上限从"各自库的浓度范围"改到"两库共享的浓度范围":

AUC_adj = ∫_{logC_min^shared}^{logC_max^shared} f(logC) d(logC)
          / (logC_max^shared - logC_min^shared)

参考:Pozdeyev et al., Oncotarget, 2016、Haibe-Kains et al., Nature, 2013

⚠️ 坑点 3:GDSC1 与 GDSC2 同对数值冲突,直接合并产生标签噪声(分类:预处理陷阱)

问题:两代实验的孔板规格、读出方法与浓度设计不同(Syto60/Resazurin vs CellTiter-Glo;256 倍 vs 1000 倍浓度范围),同一药物-细胞系对在两代中 IC50 可差数倍,无脑 concat 会把平台差异当作生物学差异学进去。
症状:训练损失中出现双峰分布的残差;同一细胞系同一药物在验证集中出现两条互相矛盾的记录;消融实验方差异常大。
解决:

  1. 简单方法:只用 GDSC2(口径最新最统一),或只用 GDSC1(药物覆盖最广),单代建模。
  2. 进阶方法:合并后按 (COSMIC_ID, DRUG_ID) 去重并固定优先级(社区常用取均值或保留 GDSC2),或将 DATASET 作为 one-hot 特征让模型自行吸收平台效应。
  3. SOTA 方法:把两代当作域自适应(domain adaptation)问题,训练时混入代际判别损失,推理时固定到单代分布。
    参考:Sanger DepMap 两代文档、跨库一致性研究

⚠️ 坑点 4:不完整剂量-反应曲线的外推 IC50 不可信(分类:评估误用)

问题:当活力曲线在最高测试浓度内无法下降到 50% 时,IC50 是曲线外推值;此类"耐药"端点的误差可比测量噪声大一个数量级。
症状:模型对"耐药类"样本预测极差;独立湿实验复测时发现被判为强耐药的细胞实际只是中等敏感(IC50 在 MAX_CONC 之外)。
解决:

  1. 简单方法:用 MAX_CONC 过滤——丢弃 LN_IC50 > log(MAX_CONC) 的行;官方提供 MAX_CONC 列即为此用途。
  2. 进阶方法:改用 AUC 作标签(外推对 AUC 影响小于对 IC50),或同时用 RMSE 设阈值剔除低质量拟合。
  3. SOTA 方法:为外推样本单独建模"删失回归"(censored regression / Tobit 模型),把"未达半抑制"作为区间观测而非点估计。

删失标签的构造示意:

# IC50 落在 MAX_CONC 之外 → 该样本为"右删失":真实 IC50 > MAX_CONC
df["censored"] = df["LN_IC50"] > np.log(df["MAX_CONC"])
# 训练时:censored=True 的样本不参与 MSE,
# 而使用 hinge 型惩罚:max(0, pred - log(MAX_CONC)) 或专用 Tobit 损失

参考:Gynecologic Oncology 2021 独立验证研究、官方拟合数据说明

⚠️ 坑点 5:组织 lineage 效应主导,模型学成"癌种分类器"(分类:偏倚陷阱)

问题:不同组织的细胞系药敏基线差异巨大(Iorio et al. 2016 证明 lineage 是药敏预测中贡献最大的特征之一),面板中肺/乳腺/血液系细胞系占绝对多数,模型可能仅凭组织分布就拿到大部分性能。
症状:删除所有药物特征后模型性能仅小幅下降;对罕见组织(肾上腺、胆管等)预测系统性失准。
解决:

  1. 简单方法:训练与评估均按组织描述符分层,报告每组织 RMSE 而非只报全局均值。
  2. 进阶方法:留一组织外推(leave-one-tissue-out)评测,量化模型对未见组织的泛化;组织标签缺失的行单独成组。
  3. SOTA 方法:组织混杂因子校正(将 lineage 作为协变量回归掉后再评估残差学习质量),或在体内验证时与 PDX/类器官药敏数据对齐。
    参考:Iorio et al., Cell, 2016、Sanger DepMap 文档

⚠️ 坑点 6:官网迁移与旧链接失效,XLSX 大文件解析踩坑(分类:工程陷阱)

问题:cancerrxgene.org 旧域名现为迁移通知页,大量教程中的旧下载链接已失效;8.5 版拟合数据主文件为 XLSX(GDSC1 约 30-80MB 量级),pandas 默认引擎读取慢且易内存溢出。
症状:脚本在旧 URL 上 404;pd.read_excel 读 GDSC1 全表耗时数分钟甚至 OOM。
解决:

  1. 简单方法:改用 Cell Model Passports 下载页或 Sanger FTP 直链(见 §6.2),并把 XLSX 预转换为 CSV/Parquet 一次。
  2. 进阶方法:pip install openpyxl 后用 read_only=True 模式流式读取,或直接下载 Release 8.4 的 CSV 等价文件。
  3. SOTA 方法:在数据管线中固化"版本快照 + 校验和"管理,下载脚本带重试与版本探测,防止上游再次迁移时管线静默失效。
    参考:cancerrxgene.org 迁移通知、FTP 直链 Release 8.4

⚠️ 坑点 7:药物命名混乱,同药异名与 ID 漂移(分类:预处理陷阱)

问题:GDSC 中存在同一分子多个名称、商品名与通用名并存、以及 DRUG_ID 在版本间漂移的情况;直接按 DRUG_NAME 字符串对齐外部资源(PubChem/ChEMBL/SMILES 库)会丢失或错配分子。
症状:SMILES 表 merge 后大量 NaN;同靶点药物的药敏谱出现互相矛盾的聚类。
解决:

  1. 简单方法:以 screened_compounds 表的 PUBCHEM_ID 为对齐主键,而非药物名字符串。
  2. 进阶方法:用 PubChem/ChEMBL 的 InChIKey 标准化后做二次映射;对仍然歧义的条目人工核对 TARGET_PATHWAY 注释。
  3. SOTA 方法:维护一份"版本化药物映射表"(DRUG_ID → PubChem CID → InChIKey)随代码发布,并在 CI 中对新 release 做 diff 检查。
    参考:screened_compounds 官方注释表、GDSC 官方文档

⚠️ 坑点 8:细胞系错鉴定与交叉污染,标签本身可能错(分类:偏倚陷阱)

问题:癌细胞系是生物样本,存在跨系污染、错鉴定与长期传代漂变;个别细胞系的"基因组-药敏"配对从源头就是错的,Cell Model Passports 明确对相关与错误鉴定模型做了标注。
症状:个别细胞系在多个无关药物上都是极端离群点;用 Cellosaurus 核查时发现该系已被标记为错鉴定(如 HeLa 污染系)。
解决:

  1. 简单方法:下载前在 Cell Model Passports 核对模型页面,剔除被标注为 mis-identified 的细胞系。
  2. 进阶方法:以突变指纹(特征突变集合)复检表达/药敏数据是否与官方注释一致,发现"指纹不合"的系剔除或降权。
  3. SOTA 方法:在 DAIMS 管线中加入 Cellosaurus/DepMap 质控黑名单同步步骤,发布数据集时附带质控清单版本号,保证论文可复现。
    参考:Cell Model Passports、Garnett et al., Nature, 2012

§6.6 数据增强(安全 ✅ / 危险 ❌)

操作 类别 说明
基因掩码(随机置零表达特征片段) ✅ 安全 模拟多组学缺失场景,提升鲁棒性
药物指纹位翻转 ✅ 安全 增强化学特征泛化,小幅扰动不改变分子身份
跨库伪标签自训练(CCLE → GDSC) ✅ 安全(需 adjusted AUC 对齐) 扩大有效样本量,注意跨库口径
对 IC50 做"分子式保留"的药物随机化 ❌ 危险 药物-标签一一对应,任何药物侧随机化都会破坏标签
同细胞系两代数值互换当增强 ❌ 危险 平台差异不是生物信号(坑点 3)
把组织标签随机打乱做平衡 ❌ 危险 破坏 lineage-药敏的真实生物学关联

§6.7 模型推荐表

模型 输入模态 适用场景 参考性能锚点
弹性网络 / 岭回归(特征:突变+组织 one-hot) 基因组离散特征 强基线、可解释性强 GDSC1000 官方分析证明突变+lineage 即可捕获大部分信号
随机森林 / XGBoost 全部表格特征 表格类多模态融合默认首选 对 10 万级表格数据稳健
核方法(N-profile/S-profile) 基因组+化学描述符 历史基线复现 Menden et al., 2013, PLoS ONE 开创
双塔 MLP(表达 + Morgan 指纹) 表达+分子 本页 §6.4 示例架构 TDC 基线量级
图神经网络(分子图 × 细胞系多组学) 表达/CNV+分子图 追求 SOTA 近年药敏预测主流(DeepCDR 类方法)
多模态基础模型(语言模型对齐) 表达+SMILES 文本化 少样本/新药泛化 MAMMAL 在 TDC Cancer-Drug Response 1/2 上 Pearson 较此前 SOTA 提升 3.4%(论文)

§6.8 硬件需求表

任务规模 CPU 内存 GPU 磁盘
拟合数据统计分析/弹性网络 4 核 8GB 无 10GB
全量 XGBoost/双塔 MLP 8 核 16GB 可选 8GB 20GB
图神经网络/多模态深度模型 8 核 32GB 1×16GB(如 A100/V100) 50GB
原始剂量-反应自定义拟合 16 核 32GB 无 200GB(GDSC2 原始 2.0GB 解压后翻倍)

§6.9 评估指标代码

import numpy as np
from scipy.stats import pearsonr, spearmanr

def evaluate(y_true, y_pred):
    rmse = float(np.sqrt(np.mean((y_true - y_pred) ** 2)))
    mae  = float(np.mean(np.abs(y_true - y_pred)))
    r    = float(pearsonr(y_true, y_pred)[0])
    rho  = float(spearmanr(y_true, y_pred)[0])
    return {"RMSE": rmse, "MAE": mae, "Pearson": r, "Spearman": rho}

# 分组织报告(对抗 lineage 偏倚,见坑点 5)
def per_tissue(df, y_true, y_pred):
    df = df.assign(pred=y_pred, true=y_true)
    return {t: evaluate(g["true"].to_numpy(), g["pred"].to_numpy())
            for t, g in df.groupby("TISSUE") if len(g) >= 30}

剂量-反应可视化(检查曲线完整性与外推风险,配合坑点 4 使用):

import numpy as np
import matplotlib.pyplot as plt

def sigmoid(x, log_ic50, slope=-1.0):
    return 1.0 / (1.0 + np.exp(slope * (x - log_ic50)))

conc = np.linspace(-3, 3, 200)                    # log10(µM) 网格
fig, axes = plt.subplots(1, 2, figsize=(10, 4), sharey=True)
for ax, (log_ic50, label) in zip(
        axes, [(0.0, "完整曲线:IC50 在测试范围内"),
               (2.8, "外推曲线:IC50 超出 MAX_CONC")]):
    y = sigmoid(conc, log_ic50)
    ax.plot(conc, y, color="#2563EB")
    ax.axhline(0.5, ls="--", c="grey", lw=0.8)
    ax.axvline(log_ic50, ls=":", c="#7C3AED", lw=0.8)
    ax.axvline(1.5, ls="-", c="red", lw=1.2)      # MAX_CONC 边界
    ax.set_title(label, fontsize=10)
axes[0].set_ylabel("相对活力")
fig.supxlabel("log10 浓度 (µM)")
plt.show()
# 红线右侧到达 0.5 之前未收敛 → 该行 IC50 为外推值,应过滤

冷启动划分的双指标评估模板(与 §5.2 呼应):

results = {}
for protocol, split_fn in [("random", random_split_df),
                           ("cold_cell", grouped_split),
                           ("cold_drug", drug_grouped_split)]:
    tr, va, te = split_fn(df)
    model = train_model(tr, va)                    # 任意模型
    results[protocol] = evaluate(te["LN_IC50"], model.predict(te))
# 论文汇报:三行指标并列,cold 系列才是泛化能力的诚实估计

§6.10 MLOps 笔记

  • 版本钉扎:GDSC 无增量小版本可订阅,建议在配置中固化 release 标识(如 GDSC_data_8.5/27Oct23)并随数据快照存校验和;上游再迁移域名时只需改下载器。
  • 数据卡:训练数据卡应记录两代口径裁决策略(坑点 3)、外推过滤规则(坑点 4)与细胞系质控黑名单(坑点 8)。
  • 漂移监控:上线后监控输入表达分布的组织构成比例;组织构成漂移是药敏模型最常见的线上退化原因。
  • 可复现性:固定 split 文件、随机种子与库版本(RDKit 指纹参数 radius=2、nBits=2048 一并入库);TDC 提供的随机划分若用于论文,需注明 TDC 版本号。
  • 合规:数据无需申请,但论文引用需给官方论文(Iorio 2016 / Yang 2013)与 Release 版本日期,便于他人核对数据快照。
  • 数据完整性校验:下载后先做行数与键值健全性检查再入库,示例:
def sanity_check(df, min_pairs=50_000):
    assert df["COSMIC_ID"].nunique() > 500, "细胞系数异常,疑似下载不完整"
    assert df["DRUG_ID"].nunique() > 100, "药物数异常"
    assert len(df) > min_pairs, "记录数低于预期,检查下载"
    assert df["LN_IC50"].notna().mean() > 0.9, "缺失率异常,检查版本混用"
    print("OK:", len(df), "pairs |", df["DRUG_ID"].nunique(), "drugs |",
          df["COSMIC_ID"].nunique(), "cell lines")
  • 两环境一致性:RDKit 指纹与 openpyxl 解析在不同版本间可能产生细微差异,建议用 conda-lock/pip-tools 固化依赖并把指纹位数、半径写进模型卡。

§7 质量评估与局限性

§7.1 已知偏倚表

偏倚类型 描述 严重程度 缓解措施
组织不平衡 肺/乳腺/结直肠/血液系细胞系占多数,罕见组织每类仅数个模型 高 分层评估;罕见组织结果标注低置信
跨库测量偏倚 与 CCLE/CTRP 浓度范围与读出方法不同,同对数值不可直接互比 高 跨库只用 adjusted AUC 对齐(Pozdeyev 2016)
两代平台差异 GDSC1(Syto60/Resazurin)与 GDSC2(CellTiter-Glo)同对数值不同 中 单代建模或显式版本裁决(坑点 3)
外推偏倚 曲线未达半抑制时 IC50 为外推值,"耐药"端点不可靠 中 MAX_CONC 过滤或删失回归(坑点 4)
化合物选择偏倚 面板偏向已上市/临床期靶向药,早期工具化合物与临床无关节少数少 低-中 结论外推到全新化学空间时需谨慎
2D 体外偏倚 无肿瘤微环境、药代与免疫因素,与患者体内反应存在系统性差距 高 定位为假设生成;用类器官/PDX 二次验证
细胞系质控 存在错鉴定/交叉污染风险(官方已标注) 低-中 Cell Model Passports 黑名单过滤(坑点 8)

§7.2 标注质量

药敏端点由全自动多水平模型拟合产生,方法经同行评审并在 GDSC 复制实验中检验(同对技术三重复 + 跨数周生物学重复,重现性良好,见 eLife 方法研究)。质量风险不在"人工标注错误"而在于拟合假设本身:外推 IC50(坑点 4)、平坦曲线的参数不可辨识、以及两代平台差(坑点 3)。官方为每条记录提供 RMSE 与 MAX_CONC,是下游实施质量过滤的官方依据。

从复现研究的角度看,GDSC 的标签质量有三重保障与一个边界。三重保障:板级阴阳对照使活力值可跨板归一化;多水平联合拟合把单板噪声摊薄到全剂量序列;RMSE/AUC 双端点互相印证。一个边界:所有端点都建立在"活力曲线服从单一 sigmoid"的假设上,对双相响应或静息期效应的药物,该假设系统性失效,此时 IC50 的生物学含义本身就需谨慎解释。

§7.3 泛化性评估表

泛化场景 失效风险 证据/说明
新患者肿瘤(无匹配细胞系) 高 2D 细胞系缺失微环境与药代;需 PDX/类器官中介验证
未见组织 lineage 高 罕见组织样本太少,留一组织评测性能显著下降
全新化学骨架药物 中-高 冷药物评测中依赖分子特征的结构泛化能力
同靶点已有代表药物的新化合物 中 Morgan 指纹/子结构特征可迁移,预期可用
与 CCLE/CTRP 交叉预测 中 基因组特征一致;标签需 adjusted AUC 对齐,否则系统性偏差

§7.4 伦理与合规

GDSC 数据为永生化细胞系的体外测量,不包含人类受试者的个体化临床数据、个人身份信息或可回溯的病人记录,官方声明数据可不受限制自由获取。细胞系建立的原始知情同意由各来源实验室负责;使用 GDSC 的主要合规义务是学术诚信层面的:规范引用原始论文与 Release 版本,不将预测结果直接用于患者治疗决策。

§7.5 公平性

细胞系面板的供体人群以欧美来源为主,种族与性别在细胞系层面无系统标注,因此模型对非欧洲裔人群肿瘤的代表性无法在数据层面直接保证。临床转化时需注意:跨人群的生物标志物有效性必须靠独立人群队列验证,而不能默认 GDSC 训练的模型"人群无关"。

对公平性敏感的应用,建议在模型卡中至少披露三点:(1) 训练面板的组织构成(GDSC Tissue Descriptor 分布);(2) 各组织的分层误差而非全局均值;(3) 对"测试集中无同组织样本"情形的处理策略。GDSC 本身不提供人群分层标注,任何宣称"跨人群公平"的说法都需要外部数据支撑,切勿由 GDSC 单独得出。

§7.6 数据漂移

GDSC 本体为静态 release(最后完整版 2023-10-27),版本间漂移主要表现为:新细胞系与新药物加入、拟合方法更新导致历史数值修订、以及官网迁移后的分发渠道变化。对下游 AI 系统而言,更常见的"漂移"来自使用场景:临床检测所用的面板基因集、表达测序平台(RNA-seq vs U219 阵列)与 GDSC 训练数据不同,需做平台校正(如跨平台表达映射)后再推理。

实践中的防漂移三件套:(1) 数据入库时同时保存 release 标识与下载日期,任何指标波动先查数据版本;(2) 训练特征向推理特征映射时固定基因清单(以 GDSC 的 18,562 位点或其子集为锚),避免面板更新导致特征空间错位;(3) 在 CI 中保留一份固定的"金标准预测集"(如 EGFR 突变系对厄洛替尼的排序),每次模型或数据更新后回归测试,排序骤变即报警。

§7.7 DAIMS 24 项自检

# 检查项 状态 说明
1 宽格式 ✅ 拟合端点单表宽格式,一行一对
2 唯一标识 ✅ COSMIC_ID + DRUG_ID 构成复合主键
3 特殊字符 ✅ 字段为标准 ASCII;细胞系名含连字符/点号需引用包裹
4 重复行 ⚠️ GDSC1/GDSC2 同对重复,需显式裁决(坑点 3)
5 缺失编码 ✅ 拟合失败统一为 NA,无魔法数字
6 标签标识 ✅ LN_IC50/AUC 语义明确并附官方说明 PDF
7 罕见类分组 ⚠️ 罕见组织与冷门药物记录稀少,需分层处理
8 偏倚评估 ✅ 官方 ANOVA + 大量跨库复现文献
9 数据字典 ✅ 官方 Fitted/Raw Data Description PDF
10 信息性缺失解释 ⚠️ NA 即"拟合失败",但官方文档未逐情形归因
11 设备记录 ✅ 孔板/移液/阵列/测序平台均有文档(§3.9)
12 共线性 ⚠️ 表达基因间高维共线,需降维或正则化
13 编码映射 ⚠️ 药物名跨库需经 PubChem ID/InChIKey 映射(坑点 7)
14 时间戳处理 ✅ Release 日期明确(8.4:2022-07-24;8.5:2023-10-27)
15 划分建议 ⚠️ 无官方划分,需自行防泄漏设计(§5.3)
16 泄漏讨论 ✅ 本页 §5.3 与坑点 1 专门讨论
17 标签分布 ✅ 连续标签 + 组织偏移均有描述(§4.2)
18 测量偏倚 ✅ 两代平台/浓度范围差异已文档化(§7.1)
19 外部验证建议 ✅ CCLE/CTRPv2/PRISM/gCSI 路径明确(§5.5)
20 版本记录 ✅ FTP 全版本存档可回溯
21 预处理脚本 ⚠️ 官方提供 gdscIC50(R)与说明 PDF,但非一键端到端
22 合规要求 ✅ 开放获取、无需注册与协议
23 多模态对齐 ✅ COSMIC_ID 统一连接药敏与四类组学
24 去标识化 ✅ 细胞系层面天然不含个人身份信息

DAIMS 评分:19.5 / 24

评分解读:GDSC 在结构化、主键设计、官方字典、多模态对齐与合规开放方面接近满分,属于表格类多组学数据中工程化程度最高的梯队;失分集中在"需要使用者自行完成统计决策"的环节——两代数据裁决、无官方划分、跨库标签对齐与高维共线性处理。这些失分项不是数据缺陷,而是"数据提供方与建模方的职责边界":官方有意把划分与建模自由留给研究者。

对你意味着什么:(1) 直接用拟合端点表起步,第一周即可跑通基线,无需申请与格式转换;(2) 把工程精力优先投入 §5.3 的防泄漏划分与坑点 3/4 的数据裁决,它们对指标的影响远大于模型选型;(3) 若目标是发表,务必同时报告随机划分与冷启动划分两组指标并固定数据快照版本;(4) 若目标是临床转化,预留类器官/PDX 外部验证预算,GDSC 只是证据链第一环。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
CCLE Broad/Novartis 同药同系药敏一致性 IC50 相关性显著低于组学一致性 基因组高度一致、药敏高度不一致 不一致主因是浓度范围与实验流程差异(Haibe-Kains 2013)
CCLE ∪ GDSC 联合再分析 两联盟共同 重分析后的一致性 药敏合理一致 复现性 controversies 缓和 双方 2015 年联合声明认为结果可对齐(Nature 528:84-87)
CTRPv2 Broad/Novartis 跨库药敏整合 adjusted AUC 中-高一致(激酶抑制剂最佳) 未对齐指标时显著恶化 公共浓度区间对齐是跨库整合前提(Pozdeyev 2016)
独立湿实验(妇科肿瘤细胞系) 学术实验室 高分辨率暴露-反应曲线复测 多数曲线间面积差 < 20% 40 条曲线中 15 条不完整 数据库曲线完整性决定单对数据可信度(Gynecologic Oncology 2021)
TDC 标准基准 学术联盟 药敏预测回归 MAE/Pearson(随机划分口径) 不同模型间可比、跨库不可比 GDSC1 177,310 对 / GDSC2 92,703 对为社区标准口径

§8 基准性能与生态

§8.1 排行榜与代表性结果

GDSC 无官方排行榜;社区事实基准为 TDC 药敏任务(随机划分、MAE/Pearson)。下表汇总有同行评审支撑的代表性方法,不同行的标签口径、数据版本与划分不同,数值不可直接比较:

排名 模型 性能锚点 年份 关键技术 完整引用 代码
1 MAMMAL(多模态基础模型) TDC Cancer-Drug Response 1/2 Pearson 较此前 SOTA 提升 3.4%;新药敏感性排序获湿实验复现 2024/2025 分子语言模型 + 多模态对齐 + 微调 MAMMAL: Molecular Aligned Multi-Modal Architecture and Language for biomedical discovery(全文) 未公开
2 MCMVDRP GDSC 2023-10 版 RMSE 0.02217、CCp 0.9453(2017 版 0.02334/0.9351) 2024 多通道多视角深度学习(SMILES+分子图+指纹) Li X, Shi X, Li Y, Wang L. MCMVDRP(PubMed Central 全文) GitHub
3 双塔表达+指纹基线 TDC 基线量级(MAE 口径) 2021 表达 z-score + Morgan 指纹 MLP Tan et al., 2021, NeurIPS Datasets and Benchmarks. arXiv:2102.09548 TDC
4 核方法(N-profile/S-profile) 首个 GDSC ML 预测框架(历史基线) 2013 核机器融合基因组+化学特征 Menden MP, Iorio F, Garnett M, McDermott U, Benes CH, Ballester PJ, et al., 2013, PLoS ONE 8(4):e61318. DOI: 10.1371/journal.pone.0061318 未公开

数值不可直接比较的原因:(1) 训练数据版本随 release 演进(2017 版 vs 2023-10 版药物数相差 3 倍);(2) 划分协议不同(随机 vs 冷启动);(3) 标签口径不同(log IC50 vs RMSE 归一后的响应值);(4) 指标定义不同(Pearson 相关系数对异常值敏感度低于 RMSE)。

§8.2 SOTA 总结与选型建议

当前 GDSC 药敏预测的格局:表格类强基线(XGBoost/弹性网络,突变+lineage 特征)仍是必比对象;图神经网络与多模态预训练模型在冷药物泛化上展示优势但提升幅度依赖划分协议。选型建议:(1) 追求可解释的生物标志物发现,用弹性网络 + 官方 ANOVA 交叉验证;(2) 追求基准排名,用多模态深度模型并严格复现 TDC 划分;(3) 追求生产落地,优先保证数据裁决管线(坑点 1/3/4)而非模型复杂度——多篇复现研究表明划分协议对指标的影响大于模型架构。

另一个实用判断:GDSC 上"特征 > 模型"的规律比多数领域更明显。Iorio et al. 2016 用机器学习系统比较后发现,突变与组织 lineage 承载了大部分预测信息,表达与甲基化的边际贡献相对有限;后续文献大体复现了这一结论。因此资源有限的团队应先把特征工程(突变 one-hot、lineage 编码、药物指纹质量)做扎实,再考虑上深度架构。

§8.3 评测协议

社区通行协议:标签 LN_IC50(TDC 口径为 log IC50);随机划分 8:1:1(与 TDC 对齐时用其内置 split);指标 RMSE + MAE + Pearson + Spearman;按组织分层补充报告;冷启动评测(cold cell line / cold drug)作为泛化性附加分。所有实验固定数据 release 标识(如 GDSC_data_8.5/27Oct23)与随机种子。

数据集 机构 与 GDSC 的关系 规模要点
CCLE Broad Institute / Novartis 组学互补、药敏子集可交叉验证 约 1,000 细胞系,24 药(2012 首版)
CTRPv2 Broad Institute 药物空间互补(四大库药物最多) 481 药,数百细胞系
PRISM Broad Institute 复铜池超大规模药物筛选 4,518 药 × 578 系
gCSI Genentech 独立第三方复现参考 数百细胞系
NCI-60 / NCI-ALMANAC 美国 NCI 老牌药敏面板与联合用药 60 系 / 组合筛选
DrugComb 学术联盟 药物联合敏感性 组合筛选汇总库
PharmacoDB Ontario Institute for Cancer Research 跨库统一检索 整合 GDSC/CCLE/CTRP/gCSI 等
Cell Model Passports Wellcome Sanger GDSC 细胞系组学的持续维护分发层 2,000+ 模型编目

§8.5 关键论文 Top 8

  1. Garnett MJ, et al. Systematic identification of genomic markers of drug sensitivity in cancer cells. Nature, 2012, 483:570-575. DOI: 10.1038/nature11005 — GDSC 首篇系统性药敏-基因组分析,确立"突变-药敏"筛选范式。
  2. Yang W, et al. Genomics of Drug Sensitivity in Cancer (GDSC): a resource for therapeutic biomarker discovery in cancer cells. Nucleic Acids Research, 2013, 41(D1):D955-D961. DOI: 10.1093/nar/gks1111 — 数据库官方论文,定义数据结构与查询门户。
  3. Iorio F, et al. A Landscape of Pharmacogenomic Interactions in Cancer. Cell, 2016, 166(3):740-754. DOI: 10.1016/j.cell.2016.06.017 — GDSC1000 里程碑:1,001 系 × 265 药,688 个显著关联,量化各模态预测贡献。
  4. Barretina J, et al. The Cancer Cell Line Encyclopedia enables predictive modelling of anticancer drug sensitivity. Nature, 2012, 483:603-607. DOI: 10.1038/nature11003 — 并行资源 CCLE,构成 GDSC 的主要对照系。
  5. Haibe-Kains B, et al. Inconsistency in large pharmacogenomic studies. Nature, 2013, 502:381-387 — 提出 GDSC 与 CCLE 药敏不一致问题,引发全领域方法学反思。
  6. Cancer Cell Line Encyclopedia Consortium & Genomics of Drug Sensitivity in Cancer Consortium. Pharmacogenomic agreement between two cancer cell line data sets. Nature, 2015, 528:84-87 — 两联盟联合再分析,回应一致性质疑。
  7. Seashore-Ludlow B, et al. Harnessing Connectivity in a Large-Scale Small-Molecule Sensitivity Dataset. Cancer Discovery, 2015, 5(11):1210-1223 — CTRPv2 方法论文,与 GDSC 构成互补基准。
  8. Corsello SM, et al. The Drug Repurposing Hub: a compiled resource for high-throughput repositioning. Nature Cancer, 2020 — PRISM 药物重定位资源,4,518 药 × 578 系。

§8.6 社区活跃度

截至 2026-09 的活跃度画像:GDSC 主论文 Iorio et al. 2016 被引 2,281+ 次、Garnett et al. 2012 被引 2,891+ 次(Google Scholar),近年年均被引仍保持三位数;TDC 将 GDSC1/GDSC2 列为标准基准,被 ML4DrugDiscovery 社区广泛采用;Sanger DepMap/Cell Model Passports 持续维护细胞系注释生态(Data Version 2.15.0);PharmacoDB、PharmacoGx(Bioconductor)等工具链成熟。原创 GDSC 域名已进入"迁移通知"状态,但数据经由 Sanger DepMap 继续开放,生态由"单站数据库"转向"平台化分发"。

社区生态的三个活跃层值得跟进:第一层是数据维护层(Sanger DepMap + Cell Model Passports,持续更新组学与错误鉴定标注);第二层是基准层(TDC 与 PharmacoDB 社区,负责跨库口径统一与榜单化);第三层是方法层(药敏预测模型的 GitHub 复现与 Kaggle/NeurIPS 类竞赛很少以 GDSC 为单独主题,多作为多任务基准之一出现)。跟踪建议:订阅 Sanger DepMap 的 release 通知,并用 Google Scholar 关键词 alert(“GDSC drug sensitivity”)追踪方法学进展。

§8.7 生态快照表

资源 类型 链接 热度参考(截至 2026-09) 推荐理由
Cell Model Passports 数据平台 cellmodelpassports.sanger.ac.uk 官方维护(Data Version 2.15.0) GDSC 现役官方下载与组学分发入口
DepMap DataMiner 在线查询工具 dataminer.depmap.sanger.ac.uk 官方维护 免下载做药物/基因级在线查询
TDC DrugRes 任务 基准包 tdcommons.ai/multi_pred_tasks/drugres 社区广泛采用 一行代码获取标准划分与特征
PharmacoGx R/Bioconductor 包 Bioconductor Bioconductor 正式包 跨药理组学数据集(PSets)统一分析
GDSCtools R 工具包 随 Release 分发(GDSCtools_mobems.zip) 官方小工具 官方配套分析脚本
COSMIC 数据库 cancer.sanger.ac.uk/cosmic 领域基础设施 GDSC 细胞系突变数据的母库,主键来源

§9 相关资源与引用

§9.1 官方资源清单

资源 链接 说明
GDSC 官网(迁移通知) cancerrxgene.org 原官方门户,现已引导至 Sanger DepMap
Cell Model Passports 下载页 cellmodelpassports.sanger.ac.uk/downloads 现役下载入口(8.5 版拟合数据 + 注释)
Sanger FTP 全版本存档 ftp.sanger.ac.uk/pub/project/cancerrxgene/releases/ Release 8.4 等历史版本直链
DepMap 数据文档 depmap.sanger.ac.uk/documentation/datasets/drug-sensitivity/ GDSC1/GDSC2 实验方法权威说明
DepMap DataMiner dataminer.depmap.sanger.ac.uk 在线查询与导出
Sanger DepMap 数据文档 depmap.sanger.ac.uk/documentation/ GDSC1/GDSC2 与组学数据集权威说明
COSMIC 细胞系计划 cancer.sanger.ac.uk/cosmic GDSC 基因组特征母库
TDC 药敏任务页 tdcommons.ai/multi_pred_tasks/drugres 基准口径(GDSC1/GDSC2 统计与许可)
官方拟合数据说明 PDF 随 Release 分发(GDSC_Fitted_Data_Description.pdf) 字段级权威定义

§9.2 BibTeX 引用块

@article{iorio2016landscape,
  title   = {A Landscape of Pharmacogenomic Interactions in Cancer},
  author  = {Iorio, Francesco and Knijnenburg, Theo A. and Vis, Daniel J. and
             Bignell, Graham R. and Menden, Michael P. and Schubert, Michael and
             Aben, Nanne and Gon{\c{c}}alves, Emanuel and Barthorpe, Syd and
             Lightfoot, Howard and Cokelaer, Thomas and Greninger, Patricia and
             van Dyk, Ewald and Chang, Han and de Silva, Heshani and
             Heyn, Holger and Deng, Xianming and Egan, Regina K. and
             Liu, Qingsong and Mironenko, Tatiana and Mitropoulos, Xeni and
             Richardson, Laura and Wang, Jinhua and Zhang, Tinghu and
             Moran, Sebastian and Sayols, Sergi and Soleimani, Maryam and
             Tamborero, David and Lopez-Bigas, Nuria and Ross-Macdonald, Petra and
             Esteller, Manel and Gray, Nathanael S. and Haber, Daniel A. and
             Stratton, Michael R. and Benes, Cyril H. and Wessels, Lodewyk F. A. and
             Saez-Rodriguez, Julio and McDermott, Ultan and Garnett, Mathew J.},
  journal = {Cell},
  volume  = {166},
  number  = {3},
  pages   = {740--754},
  year    = {2016},
  doi     = {10.1016/j.cell.2016.06.017}
}

@article{yang2013gdsc,
  title   = {Genomics of Drug Sensitivity in Cancer (GDSC): a resource for
             therapeutic biomarker discovery in cancer cells},
  author  = {Yang, Wanjuan and Soares, Jorge and Greninger, Patricia and
             Edelman, Elena J. and Lightfoot, Howard and Forbes, Simon and
             Bindal, Nidhi and Beare, Dave and Smith, James A. and
             Thompson, I. Richard and Ramaswamy, Sridhar and Futreal, P. Andrew and
             Haber, Daniel A. and Stratton, Michael R. and Benes, Cyril and
             McDermott, Ultan and Garnett, Mathew J.},
  journal = {Nucleic Acids Research},
  volume  = {41},
  number  = {D1},
  pages   = {D955--D961},
  year    = {2013},
  doi     = {10.1093/nar/gks1111}
}

@article{garnett2012systematic,
  title   = {Systematic identification of genomic markers of drug sensitivity
             in cancer cells},
  author  = {Garnett, Mathew J. and Edelman, Elena J. and Heidorn, Sven J. and
             Greenman, Christopher D. and Dastur, Anahita and Lau, Kavita W. and
             others},
  journal = {Nature},
  volume  = {483},
  pages   = {570--575},
  year    = {2012},
  doi     = {10.1038/nature11005}
}

§9.3 引用指南

使用 GDSC 数据时建议同时引用:(1) 主分析论文 Iorio et al. 2016(GDSC1000 面板);(2) 数据库论文 Yang et al. 2013(数据结构);(3) 若使用 GDSC2 实验数据,注明 Release 版本与日期(如 Release 8.5, 2023-10-27);(4) 若使用 TDC 处理口径,附引 TDC 论文(Tan et al., NeurIPS 2021, arXiv:2102.09548)。方法学讨论涉及跨库比较时,应引用 Haibe-Kains 2013 与两联盟 2015 联合声明以说明一致性问题。


§10 AI 使用声明卡

§10.1 AI 模型列表

模型 用途 版本
大语言模型(CodeBuddy Code 内置模型) 资料检索整理、初稿撰写、代码示例生成 fast-model(截至 2026-09)
WebSearch 检索引擎 官方数字与文献核实 平台内置(2026-09-12 检索)

§10.2 AI 参与范围

AI 参与了本页面的:文献检索与事实收集(6 次检索,全部规模数字/引用数/许可条款有来源 URL 存档于 FACTS.md)、初稿撰写、代码示例编写与格式排版。AI 未参与:原始实验数据的产生(GDSC 由 Sanger/MGH 完成)、医学判断的最终裁定、以及审核签发。全部规模数字均可溯源至 §10.3 所列文献。

§10.3 输入来源列表

  1. Yang W, et al., 2013, Nucleic Acids Research 41(D1):D955-D961. DOI: 10.1093/nar/gks1111(数据库论文;75,000 实验/138 药/近 700 系;开放声明)
  2. Iorio F, et al., 2016, Cell 166(3):740-754. DOI: 10.1016/j.cell.2016.06.017(GDSC1000;1,001 系 × 265 药;688 关联)
  3. Garnett MJ, et al., 2012, Nature 483:570-575. DOI: 10.1038/nature11005(首批系统性分析)
  4. Barretina J, et al., 2012, Nature 483:603-607. DOI: 10.1038/nature11003(CCLE 对照)
  5. Haibe-Kains B, et al., 2013, Nature 502:381-387(跨库不一致性)
  6. CCLE & GDSC Consortia, 2015, Nature 528:84-87(联合再分析)
  7. Seashore-Ludlow B, et al., 2015, Cancer Discovery 5(11):1210-1223(CTRPv2)
  8. Corsello SM, et al., 2020, Nature Cancer(PRISM 4,518 药 × 578 系)
  9. Pozdeyev N, et al., 2016, Oncotarget. DOI: 10.18632/oncotarget.10010(adjusted AUC 跨库整合)
  10. Menden MP, et al., 2013, PLoS ONE 8(4):e61318. DOI: 10.1371/journal.pone.0061318(首个 ML 基线)
  11. Bray F, et al., 2024, CA Cancer J Clin. DOI: 10.3322/caac.21834(GLOBOCAN 2022 流行病学)
  12. Sanger DepMap 官方文档:Drug Sensitivity(GDSC1 970×403 / GDSC2 969×297、两代实验方法). URL: depmap.sanger.ac.uk/documentation/datasets/drug-sensitivity/
  13. Cell Model Passports 下载页(8.5 版文件族、 screened_compounds_rel_8.5.csv 45.33KB、原始包 63.34MB). URL: cellmodelpassports.sanger.ac.uk/downloads
  14. Sanger FTP Release 8.4 目录(文件级大小:GDSC1 拟合 52MB、GDSC2 原始 2.0GB 等). URL: ftp.sanger.ac.uk/pub/project/cancerrxgene/releases/release-8.4/
  15. TDC 药敏任务页(GDSC1 177,310 对/958 系/208 药;GDSC2 92,703 对/805 系/137 药;许可标注). URL: tdcommons.ai/multi_pred_tasks/drugres
  16. Li X, Shi X, et al., 2024, MCMVDRP(PubMed Central: PMC11602226;576,758 对合并统计与基准值)
  17. Gynecologic Oncology 独立验证研究, 2021(40 条曲线中 15 条不完整). URL: sciencedirect.com/science/article/abs/pii/S009082582034066X
  18. EMBO Molecular Medicine 综述, 2021(GDSC/CTRP/PRISM 对比与验证案例). DOI: 10.15252/emmm.202013189

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
§1 概览与规模数字 千方病案医学编辑部 逐条对照 FACTS.md 来源 URL 核验 ✅ 已通过/已验证
§2 医学背景(ICD-11/SNOMED/流行病学) 千方病案医学编辑部 对照 ICD-11/SNOMED 官方编码体系与 GLOBOCAN 2022 ✅ 已通过/已验证
§3 规格与 §4 数据字典 千方病案医学编辑部 对照官方文档与 Release 8.4/8.5 文件清单 ✅ 已通过/已验证
§5-§6 划分与 AI 指南(含 8 坑点) 千方病案医学编辑部 代码走查 + 坑点与文献限制章节逐条溯源 ✅ 已通过/已验证
§7-§8 质量、DAIMS 与基准 千方病案医学编辑部 DAIMS 24 项逐项复核;基准值溯源原文 ✅ 已通过/已验证
§9-§10 引用与声明卡 千方病案医学编辑部 BibTeX 逐字段核对 DOI ✅ 已通过/已验证

§10.5 AI 生成章节标注

本页面全部章节由 AI 起草(§1-§10 与 frontmatter/JSON-LD),人工审核范围与结论见 §10.4;三段免责声明文本沿用千方病案医数集标准模板,人工逐字核对。

§10.6 最后人工审核日期

最后人工审核日期:2026-09-05(与 §0 审核声明一致)

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • icgc — 共享标签:基因组学与多组学 / 医学影像 / 病理图像 / 肿瘤学
  • human-cell-atlas — 共享标签:基因组学与多组学 / 医学影像 / 病理图像 / 肿瘤学
  • tabula-muris — 共享标签:基因组学与多组学 / 医学影像 / 测序数据 / 病理图像
  • upenn-gbm — 共享标签:基因组学与多组学 / 医学影像 / 病理图像 / 肿瘤学
  • hubmap — 共享标签:基因组学与多组学 / 医学影像 / 病理图像 / 肿瘤学
  • nci60 — 共享标签:医学影像 / 分子性质预测 / 病理图像 / 肿瘤学
  • cellxgene — 共享标签:基因组学与多组学 / 医学影像 / 病理图像
  • depmap-ccle — 共享标签:基因组学与多组学 / 分子性质预测 / 肿瘤学
  • pcawg — 共享标签:基因组学与多组学 / 测序数据 / 肿瘤学
  • ocelot — 共享标签:医学影像 / 病理图像 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集