LINCS L1000 — 扰动转录组参考图谱 AI-Ready Wikipedia

百万级小分子与基因扰动表达谱,重塑药物发现的连接性图谱

来源 NIH LINCS Program / Broad Institute Connectivity Map url: https://clue.io/data发布时间: 2026-09-14最后更新: 2026-09-25 阅读 36
LINCS L1000 — 扰动转录组参考图谱 AI-Ready Wikipedia

信息速览

数据集名称LINCS L1000 — 扰动转录组参考图谱 AI-Ready Wikipedia
数据类型约 300 万扰动表达谱,978 landmark 基因,12,328 基因空间,GCTx/HDF5 格式,免费公开下载
规模不适用(细胞系扰动数据;Phase 1 含 140 万+ 样本实例)
接入方式NIH LINCS Program / Broad Institute Connectivity Map url: https://clue.io/data
AI 就绪度

数据集封面

LINCS L1000 — 扰动转录组参考图谱 AI-Ready Wikipedia


INFOBOX

字段 内容
数据集名称 LINCS L1000(LINCS L1000 扰动转录组数据集)
英文全称 Library of Integrated Network-Based Cellular Signatures — L1000
别名/简称 L1000、CMap-L1000、LINCS CMap、Next-Gen Connectivity Map、CLUE 数据
疾病分类(ICD-11) 非疾病特异性;主要应用领域为 2A00-2F9Z(恶性肿瘤)相关药物发现
SNOMED CT 254837009(乳腺恶性肿瘤)、363358003(肺恶性肿瘤)、363406005(结肠恶性肿瘤)、93143009(白血病)——代表性应用癌种,非数据集内置标注
数据模态 扰动转录组(小分子/CRISPR/shRNA/过表达扰动下的基因表达谱)
AI 任务类型 签名搜索、药物重定位、MoA 推断、化合物相似性学习、基因功能注释
样本总数 Phase 1 约 140 万样本实例/130 万表达谱;LINCS 2020 版超 300 万表达谱、约 170 万签名
数据大小 GSE92742 全套约 275 GB(Level 1 达 1.2 TB;Level 5 压缩后 19.9 GB)
数据格式 GCTx(.gctx,HDF5)、CSV 元数据、LXB 原始荧光
许可证 公开下载(GEO 公共资源;clue.io API key 免费、限非商业用途)
访问级别 开放(GEO 直接下载;clue.io 注册获取 key)
DUO 标签 GRU(通用研究使用)
语言 英文(元数据与文档)
首发日期 2016-12(GSE92742 提交于 2016-12-22)
最后更新 2021-09-08(GSE92742 最近修订);LINCS 2020 版另有独立发布
发布机构 NIH LINCS 计划 / Broad Institute Connectivity Map(CMap)
官方主页 clue.io / broadinstitute.org/connectivity-map-cmap
下载地址 GEO GSE92742 / clue.io/data
DOI 10.1016/j.cell.2017.10.049
引用次数 3,762+(Dimensions 口径,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 五级标准产物 + 官方 API/Notebook 齐备,但无端到端一键训练管线且 GCTx 需专用读取代码
页面状态 published

§0 E-E-A-T 审核声明

  • 医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(细胞系癌种映射、药理学背景)、§7 偏倚分析。
  • 数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
  • 审核日期:2026-09-05
  • 事实核查方式:全部规模数字、技术参数与评分机制经 5 轮 WebSearch 与官方来源(GEO、clue.io/Connectopedia、Broad 官方页)三方交叉核对;种子信息中"300 万+表达谱"已按检索结果修正为"LINCS 2020 版超 300 万(Phase 1 约 130 万)"双口径并列表述。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。LINCS L1000 通过 GEO 公开下载、clue.io 平台 key 注册免费但限非商业用途。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

这是什么? LINCS L1000 是一个"药物-基因反应字典"。研究者把数千种药物、基因敲除试剂加到培养皿中的人类细胞里,再用一种叫 L1000 的低成本技术记录每个基因被"拨动"后的反应方向(升高/降低)。全库累计已生成超过 300 万份这样的表达谱(LINCS 2020 版口径),Phase 1 数据 130 万份,构成迄今最大的公共扰动转录组参考库。

为什么重要? 在它出现之前,想知道一个药物"像什么"必须做全基因组表达芯片;L1000 把单样本成本压低约百倍量级,让"以万为单位的化合物 × 多细胞系 × 多剂量"的系统性扰动地图首次成为可能。它把 CMap 原版约 7,000 条签名的概念验证扩展了三个数量级,是连接性分析的事实标准。

我能用它做什么? 拿一份疾病的上下调基因列表,去库里搜"哪些药物能模拟或逆转这个状态",即可获得药物重定位候选;比较两个化合物的签名相似性可推断共享 MoA;基因敲除签名可用于功能注释与靶点验证。对 AI 研究者,它还是扰动响应预测、表达谱补全等任务的基准语料。

一句话版本:把"细胞被处理后变成什么状态"系统性地测了 300 万遍,让任何研究者的基因列表都能与这几百万份参考答案做比对——比对方向相同叫"模拟"(提示机制),方向相反叫"逆转"(提示治疗候选)。

§1.1 技术摘要

L1000 的核心技术取舍是"测一部分、推全基因组":每个样本直接测量 978 个 landmark 基因(技术上用 500 种颜色的 Luminex 磁珠,每种磁珠颜色锚定识别 2 个转录本,实现"千基因测半盘"的压缩复用),另外再测 80 个控制转录本用于质控。在分析阶段,通过 K-近邻回归把其余转录本从 landmark 空间计算推断出来——原论文证明 81% 的非测量转录本可以被可靠推断。数据经五级流水线(原始荧光→归一化→Z 打分→聚合签名)整理为 GCTx(HDF5)矩阵,Phase 1 发布于 GEO(GSE92742),Level 5 矩阵为 473,647 签名 × 12,328 基因。查询端 connectivity score(tau)将查询签名与参考库比对,返回 -100 至 +100 的标准化连接分。

成本曲线的改变是这项技术的历史意义所在:全基因组表达阵列时代,"数万化合物 × 多细胞系 × 多剂量 × 多时间点"的组合空间无法负担;L1000 的 384 孔板工作流让单板数百个扰动的并行测量成为常规操作,LINCS 计划 2011-2021 十年间由此产出 20 余种检测技术中复用率最高的这一份转录组资产。对 AI 研究者而言,其"测量-推断"双层结构本身就是一个值得研究的问题设定(978 维输入、12,328 维输出)。

§1.2 战略价值

维度一:药物发现范式价值。 传统高通量筛选测"化合物是否杀死细胞",L1000 测"化合物把细胞变成了什么状态",后者信息量显著更高:同一毒性终点可能由完全不同的机制达成,而转录组签名能区分它们。CMap 团队用 171 个高置信扰动类别(PCL)证明,按 MoA 聚类签名能锐化靶点信号,这使 L1000 成为无靶点表型筛选(phenotypic screening)下游机制解释的首选资源,也是 AI 驱动药物重定位研究引用率最高的公共数据集之一。

维度二:AI 基础设施价值。 300 万量级的"扰动→转录响应"配对样本,天然构成分子基础模型与药物响应预测模型的训练语料:输入化合物结构或基因身份,预测 12,328 维转录响应;或学习"签名空间"中的相似性度量。五级数据分级允许研究者在"原始荧光保真"与"即用签名"之间自由选择训练粒度,这在公共数据集中少见。官方还提供 cmapBQ(BigQuery)与 Jupyter 教程仓库,显著降低了进入门槛。

维度三:生态网络效应。 L1000 的签名已被 L2S2、SigCom LINCS、iLINCS、L1000FWD、L1000CDS2 等至少 6 个二级平台重算、索引或可视化,任何提交到 LINCS 生态的查询签名都能获得跨平台的可复现结果;这种"一次测量、多端检索"的生态位使其成为连接疾病组学(GTEx/TCGA 来源查询签名)与药理学空间的枢纽节点——枢纽地位本身即是选择数据集时的重要战略考量。### §1.3 同类数据集横向对比

数据集 规模 模态 标注/产物 与 L1000 的差异
LINCS L1000 超 300 万表达谱(2020 版) 扰动转录组(978 landmark + 推断) 五级 GCTx + tau 查询服务 规模最大、perturbagen 覆盖最广,行业标准
原版 CMap v1(2006/2010) 约 7,000 签名 全基因组 Affymetrix 阵列 已归档 仅 4 细胞系、多为 FDA 已批准药物
Perturb-seq 类(PerturbAtlas/Perturb-seqr) 约 42.5 万上下调基因集 单细胞 CRISPR 扰动 单细胞分辨率 细胞类型覆盖广(约 1,000 种)但扰动剂种类少、成本高
GTEx 数千供体 正常组织 RNA-seq 组织表达参考 无扰动维度,作对照/协变量参考
TCGA 1 万+ 肿瘤样本 肿瘤组织 RNA-seq 多组学 疾病真实但无受控扰动
PRISM 数十万个剂量-活力测量 细胞活力筛选 剂量-活力曲线 无转录维度,与 L1000 互补验证
DepMap(CCLE 等关系型) 千级细胞系 基因依赖性(CRISPR 筛选) 必需基因图谱 与 L1000 的遗传扰动签名同源互补

§1.4 版本时间轴

版本 发布时间 规模 发布渠道 关键变化
CMap v1 2006(Science)/ 2010 归档 约 7,000 签名 broadinstitute.org/cmap Affymetrix 全基因组、4 细胞系概念验证
LINCS Phase 1 L1000(GSE92742) 2016-12 提交,2021-09-08 最后更新 约 130 万 profiles、473,647 条 Level 5 签名 GEO L1000 技术、五级数据、GCTx 格式确立
LINCS Phase 2(GSE70138) 2017 补充扰动剂与重复 GEO 与 Phase 1 合并构成 1.5M+ 官方口径
LINCS 2020 L1000 release 2020(clue.io 持续修订) 超 300 万 profiles clue.io/data-dashboard 新增造血系与非癌系、扩大剂量网格

版本演进的逻辑主线是"扰动剂 × 细胞系覆盖的单调扩张 + 数据产物标准化":从 v1 的 4 细胞系/7 千签名,到 Phase 1 的 9 核心系/47 万签名,再到 2020 版的 248 系(L2S2 口径)/百万签名;而 GCTx 格式、五级流水线与 tau 评分体系自 Phase 1 起保持稳定,这使得 2016 年后的方法学论文可以跨版本复用同一套读取与评估代码——稳定性本身就是该生态最重要的工程资产。

§1.5 典型应用场景

  1. 药物重定位:以疾病签名查询,tau ≤ -90 的逆转化合物为候选(如经典的开创性应用——抗癫痫药托吡酯重定位用于炎症性肠病方向的探索即出自 CMap 框架)。
  2. MoA 推断:新化合物签名与 171 个 PCL 类别比对,预测靶点通路(如 HDAC 抑制剂类、mTOR 抑制剂类聚类)。
  3. 靶点验证:CRISPR/shRNA 敲除签名与化合物签名比对,用遗传学证据支撑药理学假设。
  4. 化合物相似性网络:构建"签名空间"中的结构-活性关系图,供图神经网络预训练。
  5. 扰动响应基准:为"分子→表达谱"生成模型(如 CPA、chemCPA 类方法)提供训练与评测语料。
  6. 化合物/基因签名图谱构建:把全库签名降维成可导航的 2D/3D 空间(L1000FWD 的"烟花图"即此思路),供化学信息学做结构-活性空间探索。
  7. 教学与技能训练:五级数据 + 官方 notebooks 的组合是训练"生物信息 × 机器学习"复合技能的理想教材,GEO 直下免申请。

场景选择的粗略法则:以"检索已知库"为主的任务(1-3、6)优先在线平台,以"学习/生成"为主的任务(4-5、7)优先本地 Level 5 起步;两类任务的评测协议不同,混用时注意 §8.3 的口径对齐。


§2 医学背景

§2.1 ICD-11 编码映射

L1000 本身是非疾病特异性参考数据集,但其覆盖的细胞系与主要应用集中于以下 ICD-11 领域:

应用领域 ICD-11 编码 中文名称 L1000 中的对应资源
恶性肿瘤(总) 2A00-2F9Z 恶性肿瘤 9 大核心细胞系中 8 个为癌源(MCF7、A549、PC3、VCAP、HT29、HEPG2、HCC515、A375)
乳腺癌 2C60 乳腺恶性肿瘤 MCF7 细胞系(雌激素受体阳性,库内签名量最大的细胞系之一)
肺癌 2C25 肺恶性肿瘤 A549(肺腺癌)、HCC515(肺鳞状/大细胞来源)
前列腺癌 2C82 前列腺恶性肿瘤 PC3、VCAP(前列腺癌细胞系)
结直肠癌 2B5B 结直肠恶性肿瘤 HT29 细胞系
肝癌 2C12 肝细胞癌 HEPG2 细胞系
黑色素瘤 2C30 皮肤黑色素瘤 A375 细胞系
血液肿瘤 2A60-2A70 白血病等 2020 版新增造血系细胞(官方口径:hematopoietic cell lines 扩展)

注:编码范围按 ICD-11 生命科学轴(疾病章节)列出,用于把细胞系资源锚定到疾病术语体系;同一细胞系可能跨多行(如 A549 同时服务肺癌与肺毒性研究场景)。此表为应用映射,不代表数据集自带疾病标签。

§2.1b SNOMED CT 映射

术语 ICD-11 SNOMED CT 码 说明
乳腺恶性肿瘤 2C60 254837009 MCF7 签名可支撑乳腺癌靶点/药物研究
肺恶性肿瘤 2C25 363358003 A549、HCC515 对应
结肠恶性肿瘤 2B5B 363406005 HT29 对应
白血病(病) 2A60-2A70 93143009 2020 版造血系扩展对应

注:SNOMED CT 编码用于把 L1000 的应用场景锚定到标准临床术语;数据集本身不携带疾病诊断标签,上述映射为应用层注释。

§2.2 领域背景与流行病学视角

L1000 所服务的核心医学问题是肿瘤药理学与药物重定位。恶性肿瘤是全球第二大致死疾病类别,而新药研发存在著名的"反摩尔定律"困境:靶点确认失败率高、临床前模型与临床转化脱节。转录组层面的扰动响应提供了一个中间层证据:如果一个化合物的转录效应与某致病通路(或某个癌基因敲除)的效应相反,则它具备候选治疗价值——这正是连接性图谱(Connectivity Map)2006 年提出、LINCS 计划在 2011-2021 十年间规模化到 20 余种检测技术、300 万量级样本的原因。

从疾病覆盖看,Phase 1 的 9 大核心细胞系几乎全部为癌源(唯 HA1E 为正常肾上皮来源转化系),因此库内签名天然偏向肿瘤药理学;2020 版新增造血与非癌细胞系后,免疫与炎症方向的应用开始增多。使用者必须意识到:这不是"人群数据集",没有流行病学抽样概念——它反映的是培养皿中的受控生物学。

方法学背景同样值得了解:连接性分析的逻辑基础是"转录组状态守恒"——同一机制(如 HDAC 抑制、TOP1 抑制)在不同化合物身上引发的下游表达变化应当收敛,因此签名相似性可以替代靶点知识作为分组依据。原论文的 recall 分析(1,143 条外部签名、80% 恢复预期连接)与跨细胞系汇总提升(单系均值 45% → 跨系 63%)为这一逻辑提供了定量支撑;而 shRNA 共种子脱靶的发现则划定了该逻辑在遗传扰动上的适用边界(见坑点 5)。

从疾病负担角度补充一点语境:L1000 的细胞系面板覆盖的癌种(乳腺、肺、前列腺、结直肠、肝、皮肤黑色素瘤、血液)恰好是全球发病与死亡负担最重的实体瘤与血液肿瘤类别,这与其公共资助的定位一致——优先服务最大患者群体的药物发现基础设施;但对罕见病、传染病、儿科肿瘤等方向,库内直接可用的细胞背景有限,需借助 2020 版扩展或外接数据。

§2.3 临床任务定义

任务类型 L1000 视角的定义 输入/输出 成熟度
MoA 推断 新化合物签名与参考类别签名的相似性归组 上/下调基因列表 → PCL 归属概率 成熟(官方管线内建)
药物重定位 疾病签名逆转化合物的排名检索 疾病上下调基因 → 化合物 + tau 排名 成熟(大量同行评审案例)
靶点发现 化合物签名与敲除签名正向匹配 化合物 → 候选靶基因 较成熟(需遗传学验证)
药物响应预测建模 从化合物结构/基因身份预测转录响应 分子图/基因 → 12,328 维向量 研究前沿(AI 基准任务)
临床决策支持 直接由签名给出治疗建议 — 不适用(研究用途,非临床决策工具)

表中最值得强调的是"不适用"行:L1000 是研究基础设施而非医疗器械或决策软件,任何把签名检索结果直接包装为临床建议的做法都脱离了数据的设计边界;正确的姿势是把"库内命中"降级为"优先级排序",再交给实验与临床证据完成裁决。

§2.4 数据来源人群(实验体系)画像

维度 Phase 1(GSE92742) LINCS 2020 版
生物来源 人类永生化细胞系(体外) 同左,扩展覆盖
核心细胞系 9 系:A375、A549、HA1E、HCC515、HEPG2、HT29、MCF7、PC3、VCAP 新增造血系与非癌相关系
细胞系总数 约 70-80 系(覆盖度极不均衡) L2S2 口径 248 系
扰动剂 约 19,000-20,000 种化学/遗传扰动 L2S2 口径 33,621 小分子 + 7,508 CRISPR 敲除
时间点/剂量 6 h 与 24 h 为主、多剂量网格 同左,部分扩展
重复策略 推荐 3 生物学重复/处理 同左
种族/性别/年龄 不适用(细胞系无人群属性) 不适用

§2.5 临床价值定位

L1000 不直接产生临床证据等级,但它在临床转化链条中占据"靶点到候选药物"的加速器位置:其一,回顾性研究表明 CMap 框架可在缺少已知靶点的情况下把化合物归入正确机制类别(原论文 recall 分析显示 1,143 条外部签名中 80% 恢复预期连接);其二,GTEx 配对验证(GSE92743)证明 L1000 签名与 RNA-seq 签名可比,为把临床组织数据"翻译"进 L1000 签名空间提供了方法学桥梁;其三,FDA 已批准药物的库内重定位命中可快速进入老药新用的低成本验证路径。使用时应把 L1000 输出当作假设生成器而非效果承诺。

落地路径通常为三级漏斗:库内检索(tau 排名,零成本)→ 正交证据叠加(化合物在疾病相关细胞系的活力/功能数据,如 PRISM 活力谱)→ 实验验证( qPCR/蛋白层面确认签名方向 + 细胞功能实验)。官方教程仓库中的 Compound Dose Response 与 Gene Modulation notebooks 分别对应漏斗第二、三级的常用起点。

§2.6 金标准对照表

维度 L1000 的做法 说明
划分 无官方 ML 划分;按 perturbagen/cell line/dose/time 组织 ML 划分需研究者自定义(见 §5)
标注方式 无人工标签;"标签"即扰动身份与转录响应本身(自监督/弱监督) 连接分(tau)由算法计算
标注者 不适用 算法产物 + 实验设计元数据
性质 参考型参考图谱(reference compendium) 非 benchmark 竞赛数据集
质控金标准 distil_cc_q75 ≥ 0.2 复现性阈值 + 正对照化合物(poscons) 低于阈值的签名应谨慎使用

与典型医学影像/电子病历数据集的金标准对照不同:L1000 没有"标注者间一致性"这类人工标注指标,其质量证据链是"实验设计(重复与正对照)→ 算法聚合(MODZ)→ 统计门槛(q75)→ 外部 recall 验证"的四层递进;理解这一差异有助于把影像领域的质量直觉正确翻译到扰动组学场景。


§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本 大小 理由
跑签名搜索/药物重定位 GSE92742 Level 5(COMPZ.MODZ) 19.9 GB 官方明示"多数用途用 Level 5";已聚合重复、即查即用
训练深度模型、需要样本级粒度 GSE92742 Level 3(INF_mlr12k) 48.8 GB 131.9 万实例 × 12,328 基因,保留样本级方差
复现处理流水线/方法学研究 Level 1-4 全套 1.2 TB+ 从原始荧光起步,可审计每步变换
最新最大覆盖(造血系/非癌系) LINCS 2020 release(clue.io) 约 100 GB 级 超 300 万 profiles,超出 GSE92742 范围
教学演示/原型验证 clue.io 在线查询或 cmapBQ 子集 0 下载 免下载直接查 tau,或 SQL 取切片

矩阵的默认建议:拿不准就从第一行(Level 5)开始——它是官方明确推荐的"多数用途"产物,且升级到 Level 3/4 的代码改动极小(GCTx 同构),而降级重来的成本几乎为零。

§3.1 模态详情

L1000 检测属于缩减表示(reduced representation)转录谱:384 孔板中经小分子/遗传试剂处理后的细胞裂解液,与 500 种颜色的 Luminex 磁珠杂交——每种磁珠颜色通过独特的 24 mer 条码锚定两种转录本的特异性探针,从而用约 500 种珠色测得 978 个 landmark 基因加 80 个控制转录本的丰度(Luminex 多重荧光定量)。选择这 978 个基因的标准是在多个独立数据集上能最大程度代表全转录组变异。随后以 K-近邻回归从 landmark 空间推断其余转录本,最终特征空间为 12,328 个独特基因(978 直接测量 + 11,350 计算推断,其中 9,196 个推断基因有较高置信度)。同板测量保证批内可比性;五级流水线(见 §3.3)把原始荧光逐步转化为签名。

扰动维度覆盖五类:trt_cp(小分子化合物处理)、trt_sh/trt_sh.cgs(shRNA 敲低及其共识签名)、trt_oe(cDNA 过表达)、trt_lig(配体刺激)、trt_crispr(CRISPR 敲除,主要在后续版本与 L2S2 累计口径中)。剂量网格典型为对数梯度(如 0.01-10 μmol/L 的 6-10 点),时间点以 6 h 与 24 h 为主——这两个时间点分别捕捉"直接转录效应"与"次级转录效应",是任务设计时必须显式选择的维度。

§3.2 按子集样本数

子集 样本/签名数 来源口径
Level 1 原始裂解板孔 1,403,502 GSE92742 L1 文件名 n1,403,502
Level 2 归一化 landmark 矩阵 1,269,922 × 978 GSE92742 L2 文件 n1,269,922
Level 2 delta 变体 49,216 × 978 GSE92742 L2 文件 n49,216(与 epsilon 并列的 landmark 归一化矩阵)
Level 3 推断基因空间矩阵 1,319,138 × 12,328 GSE92742 L3 文件
Level 4 差异表达矩阵 1,319,138 × 12,328 GSE92742 L4 文件
Level 5 聚合签名 473,647 × 12,328 GSE92742 L5 文件
小分子扰动剂 约 19,000-33,621(Phase 1 / L2S2 累计) Broad 官方与 L2S2 口径
CRISPR 敲除靶基因 7,508 L2S2
细胞系 约 70-80(Phase 1)/ 248(L2S2 累计) Broad 官方与 L2S2
shRNA 分析覆盖 13,187 条 shRNA / 3,799 个基因 Cell 2017
全库累计表达谱 超 300 万(2020 版) clue.io data-dashboard

注:五个层级的行数并非单调递减(Level 1 的 140 万板孔、Level 2 的 127 万实例、Level 3 的 131.9 万实例、Level 5 的 47.4 万签名),各级含义不同——板孔、过滤后实例、推断空间实例、聚合签名;引用样本量时务必注明层级,这是 L1000 引用混乱的最常见来源。官方 README 对各文件的逐项说明见 GEO 页面附件。

§3.3 数据格式

层级 文件(GSE92742) 尺寸 内容 格式
Level 1 GSE92742_Broad_LINCS_Level1_LXB_n1403502.tar.gz 1.2 TB 原始荧光值(LXB) 自定义文本,tar 打包
Level 2 …Level2_GEX_epsilon_n1269922x978.gctx.gz 2.3 GB landmark 基因归一化(GEX)epsilon 处理 GCTx(HDF5)
Level 3 …Level3_INF_mlr12k_n1319138x12328.gctx.gz 48.8 GB 12,328 基因空间归一化表达(含推断) GCTx
Level 4 …Level4_ZSPCINF_mlr12k_n1319138x12328.gctx.gz 49.6 GB 相对对照的 Z 打分差异表达 GCTx
Level 5 …Level5_COMPZ.MODZ_n473647x12328.gctx.gz 19.9 GB MODZ 聚合签名 GCTx
元数据 cell_info / gene_info / inst_info / pert_info / sig_info / sig_metrics 等 10+ 个 11.5 MB(inst_info)等 实例、基因、扰动、签名的注释 CSV(.txt.gz)
质控指标 sig_metrics 中 distil_cc_q75、distil_ss 等列 — 复现性与质量分 同上

格式的两个全局事实:其一,GCTx 是 Broad CMap 自定的 HDF5 方言,任何能读 HDF5 的语言(Python/h5py、R/Rhdf5、MATLAB、Julia/HDF5.jl)都能零依赖解析,cmapPy 只是封装了语义快捷方式;其二,所有 .txt.gz 元数据都是 tab 分隔——统一用 read_csv(sep="\t"),用默认逗号分隔读到的是"一列整行文本",这是 L1000 新手错误的第一名。

§3.4 存储与传输

全量复现研究需预留约 1.5 TB(Level 1 解压后);标准分析路径只需下载 Level 3/4/5 与元数据,合计约 120 GB(压缩态)。GEO 大文件建议使用 aria2c 等多线程下载器(官方社区教程亦如此建议);clue.io 侧支持通过 API 按 perturbagen/cell line 过滤后取切片,cmapBQ 则把 Level 3/4/5 挂载到 BigQuery 供 SQL 级查询,适合无本地存储的团队。

三类典型存储方案的对比如下:

方案 前期成本 查询延迟 适用团队
本地全量(GEO 下载) 120 GB-1.5 TB 磁盘 + 下载数小时 毫秒级(HDF5 随机读) 大批量建模、复现研究
BigQuery(cmapBQ) 零磁盘、按量计费 秒级(SQL) 探索性分析、无运维团队
clue.io API 零存储 秒级(网络往返) 签名查询、小规模集成

下载完整性务必校验:官方提供 GSE92742_SHA512SUMS.txt.gz 校验和文件,sha512sum -c 一条命令即可防止"下到一半的 GCTx"进入管线——HDF5 文件尾部损坏不会在读取时报错,而是在聚合时产生 NaN,这是非常隐蔽的失败模式。

§3.5 标注方式

L1000 无传统"人工标注":每条记录的"标签"由实验设计决定(扰动剂 ID、剂量、时间点、细胞系),转录响应值由流水线自动计算。算法标注环节包括:epsilon 归一化(L2)、按 12,328 基因空间推断与鲁棒 Z 打分(L3→L4)、MODZ 重复聚合(L4→L5,权重为重复间 Spearman 相关的归一化)。复现性由 distil_cc_q75(Level 4 重复对相关系数的第 75 百分位)量化,官方以 ≥ 0.2 作为金标准签名门槛。

对 AI 任务的映射建议:把 pert/cell/dose/time 四元组当作"条件标注",把 12,328 维响应当作"回归目标",即可把 L1000 无缝表述为一个大规模条件回归/生成数据集——这正是近年扰动响应生成模型(CPA 类)的标准建模方式,也从侧面说明"无人工标注"不等于"无监督信号"。

§3.6 标注者资质与一致性

不适用(算法产物)。一致性由数据自身量化:3 生物学重复设计 + poscons 正对照化合物(已知 MoA、跨细胞系应产生一致签名)双保险;原论文报告 L1000 与 RNA-seq 签名高度可比(GTEx 配对验证,GSE92743)。

若需要"人审等效物":官方 Connectopedia 的术语条目、五级 README 与 SOP 文档承担了"定义一致"的职责,任何对字段语义的疑问都应回溯这三处而非社区转述——这是把"无标注者"体系做出"有人审"可靠度的关键机制。

§3.7 采集周期

Phase 1 实验于 2013-2016 年间在 Broad Institute CMap 实验室批量完成,2016-12-22 整体提交 GEO;此后 GSE92742 于 2021-09-08 做过元数据修订。LINCS 2020 版数据由 clue.io 平台以 release 形式滚动发布。

时间维度对使用者的三个含义:其一,数据是"成熟静态"的——GEO 版内容不会再增长,需要最新覆盖时去 clue.io 而非等待 GEO 更新;其二,2016 发布的 130 万 profiles 是历史上第一批百万级扰动转录组公开数据,同期文献的方法学结论多以此为基准;其三,版本引用纪律——论文中写 “L1000(约 130 万 profiles)” 还是 “LINCS 2020(超 300 万 profiles)” 取决于你实际下载的数据,两者混引是审稿常见扣分点。

§3.8 地域覆盖

不适用。所有数据产自美国 Broad Institute(剑桥, MA)等 LINCS 中心实验室的体外培养细胞系;细胞系来源为 ATCC 等标准库,无地域人群抽样属性。

§3.9 实验设备规格

环节 设备/平台 说明
培养/处理 384 孔板 A1/A2/B1/B2 孔保留为内部对照,不放样品
检测 Luminex 磁珠仪(500 珠色体系) 双转录本/珠色锚定设计
数据处理 Broad CMap 流水线 五级 GCTx 产物,协议公开于 clue.io/sop-L1000.pdf
知识产权 专利 PCT/US2011/031395、PCT/US2011/031232 方法学受专利保护,实验应用需注意条款

实验操作细节(官方 SOP 与 Connectopedia 记载):样品可在 96 或 384 孔格式处理(384 优先);A1/A2/B1/B2(384 孔)或 A1(96 孔)孔位保留给内部对照、放入样品不处理;推荐每处理 3 个生物学重复;优先单细胞系单板设计以避免跨板效应。正对照化合物(poscons,即已知能产生强而一致的表达变化、具备预期 MoA 的化合物)随板运行,用于判定实验是否成功——读数据时若发现同一 poscons 在不同板间签名矛盾,应将该板数据降权。

§3.10 深度溯源链

NIH Common Fund(LINCS 计划 2011-2021)→ LINCS 转录组中心(Broad Institute CMap,即 LINCS Center for Transcriptomics)→ 实验记录与 SOP(clue.io/sop-L1000.pdf)→ 五级数据(GEO GSE92742 / GSE70138 与 clue.io)→ 官方引用:Cell 2017(PMID 29195078)与 GEO 页面列出的配套引用(PMID 33168813)。二级再分发渠道:LINCS Data Portal 2.0、SigCom LINCS、iLINCS、L2S2。

两级引用体系需要区分:数据级引用用 GEO accession(GSE92742/GSE70138),平台与论文引用用 Cell 2017;再分发平台(SigCom/iLINCS 等)各自附带独立的 citation 要求——在二级平台跑出的结果引用二级平台论文而非 Cell 2017,是审稿人常抓的格式问题。


§4 数据结构

§4.0 目录树

GSE92742/                                # GEO 补充文件解压后
├── GSE92742_Broad_LINCS_README.pdf      # 官方数据字典(先读这个)
├── GSE92742_Broad_LINCS_Level5_COMPZ.MODZ_n473647x12328.gctx.gz   # ★ 推荐入口
├── GSE92742_Broad_LINCS_Level4_ZSPCINF_mlr12k_n1319138x12328.gctx.gz
├── GSE92742_Broad_LINCS_Level3_INF_mlr12k_n1319138x12328.gctx.gz
├── GSE92742_Broad_LINCS_Level2_GEX_epsilon_n1269922x978.gctx.gz
├── GSE92742_Broad_LINCS_Level1_LXB_n1403502.tar.gz                # 原始荧光,1.2 TB
├── GSE92742_Broad_LINCS_sig_info.txt.gz        # ★ 473,647 行签名元数据
├── GSE92742_Broad_LINCS_sig_metrics.txt.gz     # ★ 质控指标(distil_cc_q75 等)
├── GSE92742_Broad_LINCS_inst_info.txt.gz       # 130 万+ 实例元数据
├── GSE92742_Broad_LINCS_pert_info.txt.gz       # 扰动剂字典
├── GSE92742_Broad_LINCS_cell_info.txt.gz       # 细胞系字典
├── GSE92742_Broad_LINCS_gene_info.txt.gz       # ★ 12,328 基因字典(pr_is_lm 标记 landmark)
├── GSE92742_Broad_LINCS_gene_info_delta_landmark.txt.gz
├── GSE92742_Broad_LINCS_pert_metrics.txt.gz
├── GSE92742_Broad_LINCS_auxiliary_datasets.tar.gz
└── GSE92742_SHA512SUMS.txt.gz                  # 校验和

GCTx 文件内部为 HDF5:/0/EXPRESSION_MATRIX(行=样本列=基因或反之,依层级)、/0/META/COL(列元数据)、/0/META/ROW(行元数据)。

读取顺序建议:先读 README.pdf(10 分钟)→ gene_info(确认 Entrez ID 轴)→ sig_info/sig_metrics(确定你要的签名子集)→ 最后才打开 GCTx 按 sig_id 切片。直接先开 GCTx 是新手最常走的弯路(见坑点 7)。

§4.1 DAIMS 字段字典

核心表 sig_info.txt(Level 5 签名级,8 列节选):

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
sig_id str 签名唯一标识 REP.A001_A549_24H_X1 主键/对齐 无 无 全库唯一
pert_id str 扰动剂 ID(BRD 编号) BRD-K12345678 分组键 无 无 pert_info 可查
pert_type str 扰动类型 trt_cp(小分子)/trt_sh.cgs/sh/oe/crispr 任务筛选 无 无 枚举
cell_id str 细胞系 MCF7 分层/泛化评估 无 无 cell_info 可查
pert_dose float 剂量(μmol/L) 10.0 剂量响应建模 量程有限 -666(未定义) ≥ 0
pert_dose_unit str 剂量单位 umol/L 单位归一 无 无 枚举
pert_time int 处理时长(h) 24 时序建模 无 无 6/24 等
distil_cc_q75 float 重复一致性(Spearman 75 分位) 0.46 质量过滤 依赖重复数 NaN [-1, 1]

核心表 inst_info.txt(实例级)关键字段:inst_id(主键)、sig_id(外键)、pert_idose("剂量_ID"复合)、pert_itime、cell_iname、is_hiq(高质实例标记)。

辅助字典表体积很小但连接价值高:pert_info.txt(1.1 MB)以 pert_id 为主键给出扰动剂名称、类别与靶点注释(部分化合物仅有 BRD 编号无公开名称,属正常现象);cell_info.txt(2.5 KB)给出 Phase 1 所用细胞系的基本信息(名称与组织来源)。两表与 sig_info 通过 pert_id/cell_id 连接,构成"签名 → 化合物身份 → 细胞背景"的完整注释链。

gene_info.txt:pr_gene_id(Entrez)、pr_gene_symbol、pr_is_lm(1=landmark 直接测量)——pr_is_lm 是全库最重要的一个二值列,任何特征工程都应从它开始。

§4.2 标签分布

"标签"即扰动类型与身份分布(Phase 1 口径):trt_cp(小分子处理)签名占绝对多数;trt_sh.cgs(shRNA 共识敲除)、trt_oe(过表达)、trt_lig(配体)、trt_sh(单 shRNA)等依次递减。细胞系分布严重右偏——MCF7、A549、VCAP 等核心系各贡献数万签名,而大量细胞系仅数十条。任何按细胞系分层的建模都应检查该长尾(可用 sig_info['cell_id'].value_counts() 快速确认)。

分布策略上的两个提醒:其一,扰动类型不可类内混采——把 trt_lig(配体,作用在膜外)与 trt_cp(化合物,通常作用于胞内靶点)混入同一分类任务会让模型学习"类型识别"而非机制;其二,长尾细胞系虽然签名少,但其中包含 2020 版着重补充的非癌上下文,做"细胞类型泛化"研究时它们是唯一的验证资源,不要因为稀少而直接丢弃。

§4.3 关键统计

  • 特征空间:12,328 基因;landmark 978;推断 11,350(其中 9,196 高置信)。
  • Level 5 签名 473,647 条(Phase 1);全库 Level 3 样本约 300 万、Level 5 签名约 100 万(SigCom LINCS 2022 口径)。
  • 复现性:官方金标准阈值为 distil_cc_q75 ≥ 0.2;iLINCS 等二级库直接沿用该阈值过滤。
  • MoA 参考集:171 个高置信扰动类别(PCL)。
  • shRNA 分析基础:13,187 条 shRNA 覆盖 3,799 个基因的脱靶分析(Cell 2017)。
  • 外部验证基准:1,143 条外部签名 recall 80%(909/1,143);仅用 landmark 时召回下降约 20 个百分点;48 条外部签名因不含 landmark 转录本而完全不可分析——这条统计直观展示了推断层的价值边界。
  • 细胞系集中度:绝大多数签名来自 9 核心系(8 癌源 + HA1E),L2S2 全口径 248 系中大量长尾系签名稀疏。

§4.4 数据层级

perturbagen(化合物/基因试剂)
  └── pert_idose(扰动剂_剂量)
        └── sig_id(签名 = MODZ 聚合后的重复集合)      ← Level 5 一行
              └── inst_id(实例 = 板孔级单次测量)       ← Level 2/3/4 一行
                    └── plate/well(384 孔板物理位置)   ← Level 1 原始荧光

ML 使用的关键含义:同一个 perturbagen 的多条签名高度相关,签名级随机划分必然造成近似重复泄漏(详见 §5.3 与坑点 3)。另一个层级细节是 pert_idose 的构造方式:它是"化合物 ID + 剂量字符串"的复合键(如 BRD-K12345678_10.0),解析时注意剂量是字符串格式而非数值,做剂量-响应建模前需先拆解再转 float。

§4.5 缺失值与信息性缺失编码

  • 元数据缺失约定值:-666 / -666.0 表示"未定义"(如某些扰动无有意义剂量),NaN 表示未记录——两种编码语义不同,混用会引入伪缺失。
  • Level 3 矩阵本体无缺失(推断填补已保证稠密),但推断基因的数值置信度不同:gene_info_delta_landmark.txt 提供了 landmark 相关性信息,弱相关基因的推断值方差更大。
  • 剂量字段对遗传扰动(shRNA/CRISPR/oe)天然无意义,统一编码为 -666,不是数据缺陷。
  • 化合物名称缺失(pert_iname 为空但 pert_id 存在)代表"库内未公开命名的研究试剂",工程上以 BRD 编号为唯一事实源即可,不要尝试用名称做主键——同名不同盐/不同批次的化合物在 BRD 体系中可能对应不同 ID。

§5 划分与使用建议

§5.1 官方划分

无。L1000 是参考图谱而非监督基准,官方组织维度为 perturbagen × cell line × dose × time 的网格,并提供 Touchstone 参考集(用于计算 tau 的预计算参考签名库)作为查询基准,但没有 train/val/test 划分。

这不是规范缺失,而是定位使然:Touchstone 本身扮演了"官方评测集"角色(tau 的分位化即在其上完成),任何在其上过拟合的新方法都会失去跨库可比性。自己构造划分时,请把 Touchstone 成员当作"冻结参考"而非训练语料,否则你的评估协议将偏离全生态的校准锚点。

§5.2 社区惯例

  • 签名搜索/重定位评估:以"查询签名 vs 参考库"构造任务,用已知 MoA/靶点配对作为正例(官方 recall 分析范式:1,143 条外部签名、80% 恢复率即为社区引用的基线)。
  • 响应预测建模:按化合物结构聚类划分(scaffold split)或按细胞系留一(leave-one-cell-line-out),避免随机划分。
  • 签名补全/去噪:以 landmark 978 基因为输入、12,328 基因为输出(模仿官方推断任务),按扰动剂划分。
  • 条件生成建模:以(化合物,细胞系,剂量,时间)四元组为条件、12,328 维响应为输出的条件 VAE/扩散模型路线;常用 9 核心系全剂量网格,2020 版造血系作外推测试。

§5.3 泄漏风险(重点)

  1. 重复泄漏:同一 perturbagen 同一细胞系的多条签名(不同重复/批次)若分属 train/test,模型只需记忆"化合物指纹"即可得分。正确做法是以 perturbagen(严格时甚至 perturbagen-family/PCL)为划分单元。
  2. 推断性泄漏:12,328 基因中 11,350 个由 978 landmark 线性组合推断而来——用全特征做"以 landmark 预测非 landmark"类任务时,KNN 推断本身就是强基线,任何模型优势必须与该基线对比(原论文已证明仅用 landmark 会丢 20% 连接,说明推断携带真实信息,但这同时意味着信息高度冗余)。
  3. 时间/批次混杂:批次与扰动剂高度共线(同一化合物的重复多在同板完成),随机划分会把批次效应学成"预测器"。

§5.4 划分策略建议

  • 药物响应预测:scaffold split(按 Bemis-Murcko 骨架聚类)+ 20% 化合物整体留出;报告 OOD(骨架外)性能。
  • MoA 归组:按 PCL 类别分层抽样,保证每个类别在 train/test 均出现(类别数仅 171,注意稀有类)。
  • 细胞系泛化:9 核心系留一法,另设"全新细胞系"(2020 版造血系)作真外推测试集。
  • 时间泛化:留出某一批次/某年份数据作时间验证集(批次信息可从 sig_id 的板号前缀解析)。
  • 任务级消融:报告 landmark-only(978 特征)与全特征(12,328)两套结果,方便与官方口径对齐。

§5.5 交叉验证建议

5 折 × perturbagen 级分组(GroupKFold(group=pert_id));tau 类排名任务的方差大,建议报告配对 bootstrap 置信区间而非单点值。若涉及细胞系混合建模,改用"分组 + 分层"复合策略:每折内保持 pert_type 与 cell_id 的比例一致,防止某折全是小分子而另一折全是 shRNA 导致的折间漂移。

§5.6 外部验证建议

优先用 GSE92743(GTEx 样本的 L1000/RNA-seq 配对数据)做平台间验证;用 L2S2/SigCom LINCS 重新计算的独立签名做时间外验证;生物学结论用已知 MoA 化合物做正对照回收测试(recall ≥ 80% 为原论文基准)。若研究涉及疾病方向,建议再叠加一个独立的疾病队列(TCGA 子集或 GEO 疾病数据集)作为查询签名来源,形成"疾病签名 → L1000 检索 → 正交验证"的闭环证据链。


§6 AI 就绪指南

§6.0 云端快速启动

最快路径是零下载:注册 clue.io(免费、非商业)后用网页或 API 直接查 tau;或用官方 BigQuery 数据集 cmapBQ 在 SQL 中取切片。本地全量分析推荐从 GEO 拉 Level 5 + 元数据(约 45 GB 压缩)起步。

零下载路径的能力边界需要心里有数:网页查询适合单条签名、交互式探索;API 适合批量但受限于 key 的非商业条款;BigQuery 适合 SQL 级探索统计。一旦需要自定义预处理(如重算 MODZ、改过滤阈值)或训练深度模型,就必须回到 GEO 本地数据。三条路径的产出可以在同一套 sig_id 空间对齐,建议早期就把 sig_id 作为所有实验记录的关联主键。

混合策略范例:探索期(第 1-2 周)只用 clue.io/cmapBQ 回答"我的疾病签名有没有强逆转信号";命中后(第 3 周起)下载 Level 5 本地复算与扩展检索;方法定型后再决定是否下沉到 Level 3/4。多数项目走到第二层即可收官,无需为从未使用的层级付费存储。

§6.1 快速上手

目录与数据预期:以下代码假设你已从 GEO 下载 GSE92742 的补充文件并解压到 data_root 指向的目录,目录结构见 §4.0。data_root 拼接关系:os.path.join(data_root, "GSE92742_Broad_LINCS_Level5_COMPZ.MODZ_n473647x12328.gctx.gz")。最小可用子集 = Level 5 GCTx + sig_info.txt + gene_info.txt 三个文件(合计约 45 GB 压缩 / 20 GB 级内存映射读取)。

环境要求:Python 3.9+,pip install cmapPy h5py pandas numpy torch;无 GPU 也可完成本节与 §6.3 的全部操作。首次 parse 全量 Level 5 约需数分钟(HDF5 惰性读取,二次访问显著加快)。

# 最小读取示例:用 cmapPy 官方库解析 GCTx
# pip install cmapPy h5py pandas numpy
import pandas as pd
from cmapPy.pandasGEXpress.parse import parse

DATA_ROOT = "GSE92742"  # 你的解压目录

# 1) 读取 Level 5 签名矩阵(x_chunk 仅取前 2000 签名演示;全量去掉 chunk 参数)
l5 = parse(
    f"{DATA_ROOT}/GSE92742_Broad_LINCS_Level5_COMPZ.MODZ_n473647x12328.gctx.gz",
    x_chunk=2000,
)
print(l5.data_df.shape)          # (2000, 12328) — 行为签名、列为基因(Entrez ID 为列名)

# 2) 签名元数据
sig = pd.read_csv(f"{DATA_ROOT}/GSE92742_Broad_LINCS_sig_info.txt.gz", sep="\t")
print(sig[["sig_id", "pert_id", "cell_id", "pert_dose", "pert_time"]].head())

# 3) 过滤:小分子 + 核心细胞系 + 高复现签名
core9 = ["A375", "A549", "HA1E", "HCC515", "HEPG2", "HT29", "MCF7", "PC3", "VCAP"]
mask = (
    (sig["pert_type"] == "trt_cp")
    & (sig["cell_id"].isin(core9))
    & (sig["distil_cc_q75"] >= 0.2)
)
sel = sig.loc[mask, "sig_id"].tolist()
sub = l5.data_df.loc[l5.data_df.index.intersection(sel)]
print("高置信小分子签名切片:", sub.shape)

§6.2 数据获取

渠道 链接 内容 适用
GEO GSE92742 Phase 1 五级全量 + 10 元数据文件 复现/全量分析
GEO GSE70138 Phase 2 补充扰动剂
clue.io clue.io/data / data-dashboard LINCS 2020 版(>300 万 profiles)、在线查询 最新覆盖、零下载
BigQuery cmapBQ(教程仓库) SQL 级切片 无本地存储团队
二级库 SigCom LINCS / iLINCS / LDP 2.0 预计算签名搜索引擎 快速科学问题
# 命令行下载示例(GEO FTP 直链;大文件建议 aria2 多线程)
aria2c -x 8 -s 8 "https://ftp.ncbi.nlm.nih.gov/geo/series/GSE92nnn/GSE92742/suppl/GSE92742_Broad_LINCS_Level5_COMPZ.MODZ_n473647x12328.gctx.gz"
gunzip GSE92742_Broad_LINCS_Level5_COMPZ.MODZ_n473647x12328.gctx.gz

申请流程:GEO 零申请;clue.io 注册邮箱即得 key(免费限非商业用途);均无 DUA/IRB 要求(细胞系数据,DUO: GRU)。

版本选择与 §3.0 矩阵一致:GEO 侧 GSE92742(Phase 1)+ GSE70138(Phase 2)合并覆盖官方 1.5M+ 口径;需要造血系/非癌扩展与 300 万量级全库则走 clue.io 的 LINCS 2020 release——两条渠道的 sig_id 体系同源,分析代码可复用,但建议在项目中固定单一主渠道避免跨版本 ID 漂移。

§6.3 预处理全流程

# Level 5 → 建模就绪矩阵的标准流程
import numpy as np
import pandas as pd

gene = pd.read_csv(f"{DATA_ROOT}/GSE92742_Broad_LINCS_gene_info.txt.gz", sep="\t")
sig  = pd.read_csv(f"{DATA_ROOT}/GSE92742_Broad_LINCS_sig_info.txt.gz", sep="\t")
met  = pd.read_csv(f"{DATA_ROOT}/GSE92742_Broad_LINCS_sig_metrics.txt.gz", sep="\t")

# 1) 质量过滤:官方金标准复现阈值
keep = met[met["distil_cc_q75"] >= 0.2]["sig_id"]
df = sig[sig["sig_id"].isin(keep)].copy()

# 2) 基因轴对齐:Entrez ID 顺序统一(GCTx 列名即 Entrez)
lm_mask = gene["pr_is_lm"] == 1
landmark_ids = gene.loc[lm_mask, "pr_gene_id"].astype(str).tolist()

# 3) 数值清洗:把 -666 家族的元数据占位挡在矩阵外(矩阵本体无缺失)
X = l5.data_df.replace([-666, -666.0], np.nan)
X = X.dropna(axis=1, how="all")

# 4) 标准化:跨签名做基因维 z-score(若你的下游模型未内建)
mu, sd = X.mean(axis=0), X.std(axis=0).replace(0, 1)
X_z = (X - mu) / sd

# 5) 合并标签(化合物身份 / 剂量 / 时长 / 细胞系)
panel = X_z.join(df.set_index("sig_id")[["pert_id", "cell_id", "pert_dose", "pert_time"]], how="inner")
print(panel.shape)

要点:Level 4+ 的数值是 z-score(大 |值| = 高置信度调节),不是 log2 倍数变化(详见坑点 2);不要对推断基因与 landmark 基因同等加权——按 pr_is_lm 分组处理更稳。

两处容易踩的工程细节:其一,GCTx 的行/列元数据在文件内部自带(/0/META/COL 等),但与外部 sig_info.txt 做连接时要用 sig_id 精确匹配(GEO 版与 clue.io 版的 sig_id 构造规则一致,但顺序不保证一致);其二,distil_cc_q75 存在于 sig_metrics.txt 而非 sig_info.txt,两个文件都要读——只读 sig_info 的人会在过滤步骤拿到空列。

§6.4 PyTorch DataLoader

设计要点:签名级样本直接从 §6.3 的 panel DataFrame 读取,避免在 Dataset 内部重复解析 GCTx;剂量对遗传扰动统一截断为 0(配合 §4.5 的 -666 语义);若做扰动身份预测等自监督任务,可在 __getitem__ 中额外返回 pert_id 的整数编码。

import torch
from torch.utils.data import Dataset, DataLoader

class L1000SignatureDataset(Dataset):
    """签名级数据集:输入扰动上下文,输出 12,328 维响应。
    预期:panel 为 §6.3 产出的 DataFrame(索引=sig_id),
    data_root 目录结构与 §4.0 一致,无需再次解压 GCTx。"""
    def __init__(self, panel: pd.DataFrame, feature_cols):
        self.X = panel[feature_cols].to_numpy(dtype=np.float32)
        self.meta = panel[["pert_id", "cell_id", "pert_dose", "pert_time"]]

    def __len__(self):
        return len(self.X)

    def __getitem__(self, i):
        x = torch.from_numpy(self.X[i])
        row = self.meta.iloc[i]
        dose = torch.tensor([max(row["pert_dose"], 0.0)], dtype=torch.float32)
        time = torch.tensor([float(row["pert_time"])], dtype=torch.float32)
        return x, dose, time

feature_cols = [c for c in panel.columns if c not in {"pert_id", "cell_id", "pert_dose", "pert_time"}]
ds = L1000SignatureDataset(panel, feature_cols)
dl = DataLoader(ds, batch_size=256, shuffle=True, num_workers=4, pin_memory=True)
for x, dose, time in dl:   # 训练循环示意
    ...
    break

§6.5 坑点 8 个

以下 8 个坑点全部来自官方文档、Cell 2017 论文的 limitations 分析与社区复现讨论,是该数据集真实特有的失败模式——每条按"问题/症状/解决(简单→进阶→SOTA)/参考"四段给出可操作动作。

⚠️ 坑点 1:把 12,328 基因全当成"直接测量"(分类:标签理解)

问题:Level 3+ 矩阵包含 11,350 个计算推断基因(占 88% 特征数),它们的数值来自 K-近邻推断而非测量;把推断值当作观测真值会系统性高估数据质量,弱相关基因(推断不可靠域)噪声尤其大。
症状:在非 landmark 基因上训练的模型对测量平台变化极敏感;用 GTEx RNA-seq 验证时非 landmark 维度的相关性显著塌陷;重复实验中推断基因的重复间相关明显低于 landmark。
解决:

  1. 简单方法:只用 978 landmark 基因(gene_info['pr_is_lm']==1)做建模与评估,官方 recall 分析显示这会损失约 20% 连接召回,但保真。
  2. 进阶方法:按推断置信度加权,landmark 维全权重、推断维按 gene_info_delta_landmark.txt 中的相关性度量降权。
  3. SOTA 方法:多任务训练,landmark 维设重建损失主项,推断维设辅助项并学习逐基因不确定性(深度集成/异方差回归)。
    参考:Subramanian et al., Cell 2017(DOI 10.1016/j.cell.2017.10.049);Connectopedia: L1000 基因空间

⚠️ 坑点 2:把 Level 4+ 的 z-score 当 log2FC 解读(分类:预处理陷阱)

问题:LINCS Level 4 起数值是相对对照的 moderated z-score,幅度代表"调节的统计置信度"而非倍数变化大小。z=5 不等于 32 倍表达差异;把它当效应量做通路富集或剂量-效应拟合会得到伪结论。
症状:火山图形状怪异("倍数变化"截尾);富集分析 top 基因总是低方差基因;不同化合物间"效应大小"不可比。
解决:

  1. 简单方法:仅用符号(上调/下调)+ |z| 排序构造上下调基因集(如 top 150),与官方 tau 查询的输入口径一致。
  2. 进阶方法:分析时显式区分"置信度轴"(z)与"幅度轴"(如需幅度,回到 Level 3 归一化表达做差)。
  3. SOTA 方法:用 Characteristic Direction(L1000CDS2 的方法,官方评估称其信噪比优于 MODZ 直读)重算方向向量。
    参考:Connectopedia 数据层级;Duan et al., 2016(DOI 10.1038/npjsba.2016.15)

⚠️ 坑点 3:签名级随机划分造成重复泄漏(分类:数据泄漏)

问题:同一 perturbagen(甚至同一 pert_idose)有多条签名(不同重复、批次、时间点),随机 train/test 分裂会让测试集出现训练集的"近亲",性能虚高。
症状:化合物身份分类/响应回归准确率高达 0.99;留一化合物评估时性能断崖式下跌(常见从 0.9+ 跌到随机水平)。
解决:

  1. 简单方法:GroupKFold(groups=pert_id),保证化合物不跨集。
  2. 进阶方法:按 PCL(171 类)或 Bemis-Murcko 骨架分组,测试"机制外推"与"骨架外推"两种难度。
  3. SOTA 方法:同时报告 scaffold-split 与 leave-one-cell-line-out 两套指标,并对照官方 80% recall 基线校准任务难度。
    参考:Subramanian et al., Cell 2017 recall 分析;本文 §5.3

⚠️ 坑点 4:tau 评分误读(分类:评估误用)

问题:tau 是相对 Touchstone 参考签名集的标准化分位分(-100~+100),不是相关系数、不是概率;95 的含义是"只有约 5% 的参考基因集显示出更强的连接"。用 |tau|>0 之类宽松阈值筛"命中"会得到大量噪声;把两个不同查询的 tau 直接当效应量比较也不严谨。
症状:重定位候选列表塞满弱信号;跨细胞系汇总后 tau 排序漂移,结论不稳。
解决:

  1. 简单方法:按官方口径 |tau| ≥ 90 才视为强假设,负向连接(逆转)才用于重定位筛选。
  2. 进阶方法:组合判定 NP ≤ 0.05 且 FDR ≤ 0.25 且 |tau| ≥ 90(官方高置信定义),再按 PCL 归组锐化列表。
  3. SOTA 方法:跨 9 核心细胞系分别取 tau 后做秩聚合(官方称跨系汇总可把召回从单系 45% 均值提升到 63%)。
    参考:Connectopedia: connectivity scores;Subramanian et al., Cell 2017

⚠️ 坑点 5:忽视 shRNA 种子序列脱靶(分类:偏倚陷阱)

问题:官方对 13,187 条 shRNA 的分析显示,共享 2-8 nt 种子序列的 shRNA 对的签名相似性远超靶向同一基因的 shRNA 对——脱靶效应幅度超过脱靶效应幅度之上的设计效应(on-target)。直接使用单条 shRNA 签名会把"种子偏好"当生物学信号学进去。
症状:同一基因不同 shRNA 的签名相关性仅略高于随机;敲除签名与化合物连接结果不稳定。
解决:

  1. 简单方法:只用官方共识基因签名(CGS,pert_type == 'trt_sh.cgs'),它是跨多条 shRNA 的加权共识。
  2. 进阶方法:自行重算时按种子序列去相关加权(Smith et al. 2017 CGS 方法)。
  3. SOTA 方法:CRISPR 敲除(7,508 个基因,L2S2 口径)优先——CRISPR 无种子脱靶问题,与 CGS 交叉验证靶点结论。
    参考:Subramanian et al., Cell 2017 Figure 3;Smith et al., 2017(CGS 方法)

⚠️ 坑点 6:细胞系长尾与"9 系偏置"(分类:偏倚陷阱)

问题:绝大多数签名集中在 9 个核心细胞系(8 个癌源),其余百余系贡献极稀疏;在小样本系上训练/评估会被核心系主导,模型学到的是"9 系肿瘤药理学"而非普适扰动规律。
症状:按细胞系分层评估时性能极不均衡;对造血系(2020 版新增)等新上下文的预测失效;把结论外推到原代细胞/体内时无证据支撑。
解决:

  1. 简单方法:建模/评估限定 9 核心系,报告口径;非核心系数据仅作定性参考。
  2. 进阶方法:域自适应(细胞系 embedding 作条件输入,如 CPA 类条件 VAE),并用 leave-one-line-out 验证。
  3. SOTA 方法:跨平台迁移——以 GTEx/独立 RNA-seq 数据做外域校准(L1000 与 RNA-seq 可比性已由 GSE92743 配对验证支撑)。
    参考:Subramanian et al., Cell 2017;GSE92743;Stathias et al., NAR 2020(DOI 10.1093/nar/gkz1023)

⚠️ 坑点 7:GCTx/HDF5 大文件内存陷阱(分类:工程陷阱)

问题:Level 3/4 矩阵约 1.3 万 × 131 万,直接 parse() 全量读入会消耗数十 GB 内存并卡死普通笔记本;很多人不知道 GCTx 支持按 chunk/按索引切片读取。
症状:Jupyter 内核 OOM;gzip 解压后磁盘翻倍(48.8 GB→更大);pandas 读元数据用错分隔符报空表。
解决:

  1. 简单方法:parse(path, x_chunk=N) 分块流式读取;元数据用 pd.read_csv(..., sep="\t")(tab 分隔,勿用默认逗号)。
  2. 进阶方法:直接用 h5py 按行切片(GCTx 即 HDF5),只加载需要的 sig_id 子集;内存映射 + Numpy struct。
  3. SOTA 方法:把矩阵导入 BigQuery(cmapBQ)或 DuckDB 做外部内存分析;元数据先在 SQL 端过滤,再回 HDF5 取对应行。
    参考:cmap/lincs-workshop-2020;VanAndelInstitute/slinky

⚠️ 坑点 8:未过滤低复现签名(distil_cc_q75 < 0.2)(分类:预处理陷阱)

问题:Level 5 中相当比例签名的重复间一致性未达官方金标准(distil_cc_q75 ≥ 0.2);iLINCS 等二级库都显式过滤,直接全量训练会把不可重复的噪声签名当真实响应学习。
症状:同一化合物跨批次签名方向矛盾;相似性检索结果包含"所有化合物都像它"的通吃型噪声签名;模型验证集指标抖动大。
解决:

  1. 简单方法:sig_metrics['distil_cc_q75'] >= 0.2 一行过滤(§6.3 步骤 1)。
  2. 进阶方法:过滤 + 按 pert_id 检查幸存签名数量,对仅剩 1-2 条签名的化合物降权或剔除。
  3. SOTA 方法:质量分数作样本权重进入损失函数,而非硬过滤,保留稀疏 perturbagen 信息同时压制噪声。
    参考:iLINCS 文档(DOI 10.1038/s41467-022-32205-3);GSE92742 README

§6.6 数据增强

操作 是否安全 说明
剂量内插(log 线性) ✅ 在相邻剂量网格点内插生成伪样本,物理语义成立
高斯噪声(σ ≤ 0.1×特征 std) ✅ 等效于重复间自然波动量级
同扰动跨细胞系 mixup ✅ 保留扰动语义、混合细胞背景,需配域标签
逐基因独立 shuffle ❌ 破坏基因共调控结构,签名失去生物学意义
跨扰动剂混合 ❌ 破坏"扰动→响应"因果配对,标签污染
landmark 与推断基因混合 mixup ❌ 两类维度量纲与置信度语义不同

原则:任何增强都必须保持"这条签名来自某个特定扰动"的因果语义不被稀释——这是签名数据与自然图像增强直觉最大的不同。

§6.7 模型推荐

任务 推荐起点 理由
签名搜索基线 余弦相似度 / GSEA / Characteristic Direction 官方生态默认,可解释
响应预测(化合物→转录组) 条件 VAE(CPA 类)、图神经网络+ MLP 头 有公开参考实现,社区活跃
MoA 归组 siamese 相似度 + PCL 分类头 类别仅 171,少样本学习合适
签名补全(landmark→全空间) KNN(官方基线)→ 多任务 MLP 必须先跑官方 KNN 基线
剂量-响应曲线建模 Hill 方程拟合 → 神经 ODE/函数式头 剂量网格对数分布,先参数化再端到端
跨平台映射(RNA-seq→L1000 空间) 基因符号/Entrez 对齐 + 线性基线 → 变换自编码器 GSE92743 配对数据可直接监督

选型的通用原则:L1000 的"任务"几乎都是相似度/检索型,而非分类型——先用最简单的余弦相似度建立可解释基线,再验证复杂模型的边际收益;原论文与社区反复证明,在正确分组评估下,复杂模型相对线性/近邻基线的优势经常缩小到个位数百分点。

§6.8 硬件需求

阶段 最低配置 建议
Level 5 分析 32 GB 内存、单卡 GPU 可选 64 GB 内存
Level 3/4 全量 128 GB 内存 + 500 GB 磁盘 h5py 流式读取,256 GB 内存
Level 1 复现 不建议本地 HPC 或云盘阵列(1.5 TB+)

内存估算方法:Level 5 矩阵为 473,647 × 12,328 float32 ≈ 22 GB(float64 翻倍),加上 pandas 索引开销预留 32 GB;Level 3 为 1,319,138 × 12,328,float32 全量 ≈ 62 GB,必须流式或分块。GPU 侧的瓶颈通常不是算力而是 host-to-device 传输——把预处理后的张量转成 memmap 或使用 WebDataset 风格分片可显著提速。

§6.9 评估指标代码

# 连接性任务三件套:recall@k、tau 分位一致性、MoA 归组准确率
import numpy as np

def recall_at_k(query_sigs, ref_sigs, known_pairs, k=100):
    """known_pairs: dict query_sig -> set(expected_ref_sigs)"""
    sims = query_sigs @ ref_sigs.T                      # 归一化后内积
    hits = 0
    for i, q in enumerate(query_sigs.index):
        topk = ref_sigs.index[np.argsort(-sims[i])[:k]]
        hits += len(set(topk) & known_pairs.get(q, set())) > 0
    return hits / len(known_pairs)

def moa_group_accuracy(pred_labels, true_pcl):
    return float(np.mean(np.asarray(pred_labels) == np.asarray(true_pcl)))

def spearman_rank_stability(tau_by_cellline: dict):
    """跨细胞系 tau 排序稳定性:官方跨系汇总提升的证据口径"""
    import pandas as pd
    df = pd.DataFrame(tau_by_cellline)                  # index=化合物, cols=细胞系
    per_pair = df.corr(method="spearman")               # 细胞系间秩相关
    return float(per_pair.values[np.triu_indices_from(per_pair, k=1)].mean())

(官方参照值:外部签名 recall ≈ 80%,仅 landmark ≈ 60%——即丢 20%,跨 9 系汇总可再提升至 63%。)

§6.10 MLOps 笔记

  • 数据版本:GSE92742 内容曾于 2021-09-08 修订,实验配置务必记录 last-modified 与文件 SHA512(官方提供 GSE92742_SHA512SUMS.txt.gz)。
  • 口径声明:所有指标注明 “Phase 1 / LINCS 2020” 与过滤规则(q75 ≥ 0.2 与否),两者混用是复现失败的头号原因。
  • 成本控制:tau 查询直接调 clue.io API;仅在全量建模时下载数据,用 cmapBQ 先做探索性统计。
  • 特征注册:把"是否 landmark"、"推断置信度分层"注册为特征元数据,模型服务化时按同一套特征配置读取,防止线上/线下特征轴错位。
  • 可追溯性:每条预测记录保留输入 sig_id(或查询基因集哈希),便于与库内证据链(§7.2)反向核对。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
细胞系覆盖偏倚 签名高度集中于 9 核心系(8 癌源),248 系中大量长尾 高 限定核心系建模;条件模型 + 外域验证
化合物库偏倚 以肿瘤药与经典工具药为主,2020 版才扩造血/非癌上下文 中 用 2020 版做免疫/非癌研究
平台压缩偏倚 88% 特征为推断值,弱相关基因可靠性差 高 landmark-only 或加权建模(坑点 1)
剂量/时间网格不均 部分化合物剂量密集、部分稀疏 中 建模时按网格分层抽样
shRNA 种子脱靶 脱靶幅度超 on-target 高 仅用 CGS 共识签名(坑点 5)
批次效应 板批次与化合物共线 中 批次内对照归一(Level 4 已处理大部分);划分时按批次分组
时间点窄偏倚 仅 6 h/24 h 为主的快照,缺少慢性处理 中 任务设计限定快照场景;跨时点外推需显式声明
命名不一致 同一化合物在文献/pert_info 中命名法不一 低-中 以 BRD pert_id 为唯一事实源做对齐

偏倚叠加的复合效应值得单独强调:细胞系偏倚、库偏倚与平台压缩偏倚并非独立——核心 9 系恰是测量最深、化合物覆盖最全的子集,三者同向放大"肿瘤主流化"。这意味着"在核心 9 系上表现最好的模型"未必是生物学最好的模型,评估时务必保留非核心子集的旁观指标。

§7.2 标注质量

数据无人工标签;质量由三层机制保障:poscons 正对照化合物(实验级)、3 生物学重复(设计级)、distil_cc_q75 ≥ 0.2 金标准阈值(签名级)。Level 5 签名数量(473,647)明显少于 Level 4 实例数(131.9 万),即为重复未达聚合标准或按 MODZ 收敛的体现。

质量的另一面是"可审计性":五级流水线每一步的变换都有官方 SOP 文档与元数据文件留痕,任何一条 Level 5 签名都可以通过 sig_id → inst_id → plate/well 的外键链回溯到原始板孔与处理参数——这种端到端可追溯性在同等规模的公共数据集中属于稀缺属性,也让"从中间层重算上游"(例如用 Level 3 自定义归一化)成为可行的研究路径。

§7.3 泛化性

场景 失效风险 证据
跨平台(L1000 → RNA-seq 疾病签名) 低-中 GSE92743 配对验证支持签名可比;但推断基因维度相关下降
跨细胞系(核心系 → 稀疏系) 高 长尾系签名少、方差大
跨物种/原代细胞/体内 极高 无同源数据支撑,仅可作假设
时间外推(6/24 h → 慢性处理) 高 库内仅 6 h/24 h 为主
剂量外推(库内网格外) 中 剂量网格不均,外推需剂量响应建模
跨扰动类型(小分子 → 遗传扰动语义) 高 小分子与 shRNA/CRISPR 签名的因果语义不同,迁移需谨慎
跨版本(Phase 1 → 2020 版) 中 细胞系/化合物覆盖变化,需重对齐 ID 空间

泛化矩阵的整体读法:L1000 的强项是"同分布内"的跨平台可比性与检索召回,弱项是"跨生物上下文"的外推——前者有官方定量证据(§7.8),后者只有方向性判断。对外推类结论保持"假设级别"的措辞,是与该数据集长期健康协作的基本礼仪。

§7.4 伦理考量

不涉及人类受试者:细胞系为商品化/机构资源(ATCC 等),无患者标识、无知情同意链条、无隐私风险。使用时注意方法学专利(PCT/US2011/031395、PCT/US2011/031232)与 clue.io 非商业条款对商业化产品的约束。

需要留意的灰色地带是细胞系本身的来源合规(如 HeLa 系的历史知情争议)——L1000 使用的核心系多为商业化细胞模型,但极长尾的系来源各异,若研究结论对特定细胞系高度依赖,建议引用时同时说明细胞系的原始出处与授权状态。

§7.5 公平性

数据无人群维度,传统公平性维度(种族/性别)不适用。但存在"科学公平性"问题:库内化合物与细胞系偏肿瘤主流模型,可能系统性忽视罕见病、非癌适应证的机制空间——2020 版扩展部分缓解了该问题。对 AI 建模者的具体含义:在 L1000 上训练的"药物通用表示"事实上是"肿瘤细胞系药物表示",宣称跨治疗领域泛化前需要外域证据;反之,把罕见病信号强行映射进以肿瘤为主的参考空间,也可能得到方向正确但机制错配的候选。

§7.6 数据漂移

  • 版本间漂移:GSE92742 于 2021-09-08 修订元数据;LINCS 2020 版相对 Phase 1 扩了细胞系与化合物覆盖,跨版本合并需重对齐 pert_id/cell_id。
  • 平台漂移:将查询签名(RNA-seq 时代数据)映射进 L1000 空间时,基因符号/Entrez 版本与标准化方法差异是主要噪声源,建议统一到 Entrez ID + 官方 epsilon 归一思路。
  • 生态漂移:二级平台(SigCom/iLINCS)重算签名时使用的过滤与聚合参数可能随版本微调,跨平台比对同一 sig_id 得分不同属正常现象,以平台各自论文声明的口径为准。

§7.7 DAIMS 数据质量评估

以下 24 项覆盖数据管理(1-5、9-14、17、20、22、24)与机器学习就绪度(6-8、15、16、18、19、21、23)两大类;状态含义:✅ 达标 / ⚠️ 有条件达标(需使用者采取措施)/ ❌ 不达标。

# 检查项 状态 说明
1 宽格式支持 ✅ GCTx 矩阵即宽格式,签名×基因可直接入表
2 唯一标识 ✅ sig_id/inst_id/pert_id(BRD)/pr_gene_id(Entrez)四级主键完整
3 特殊字符处理 ✅ 元数据为受控词表,化合物 ID 规范
4 重复行 ⚠️ 生物重复天然"重复",需按 sig_id 聚合后使用;同名 pert_idose 多签名需注意
5 缺失编码 ✅ -666/NaN 双编码语义清晰(见 §4.5)
6 标签标识 ✅ pert_type 枚举完整(trt_cp/trt_sh/trt_sh.cgs/trt_oe/trt_lig 等)
7 罕见类分组 ⚠️ 长尾细胞系/化合物签名极少,需按 PCL 或扰动剂族聚合
8 偏倚评估 ✅ 官方 recall 分析 + 平台配对验证(GTEx)充分披露
9 数据字典 ✅ README + 10 个 *_info 文件 + Connectopedia 在线字典
10 信息性缺失解释 ✅ 遗传扰动无剂量(-666)官方有解释
11 设备记录 ⚠️ 平台(Luminex 磁珠)明确,但逐板仪器参数不完整公开
12 共线性 ⚠️ 推断基因与 landmark 线性相关,特征共线严重需降维
13 编码映射 ✅ 基因提供 Entrez ID 与符号双映射
14 时间戳处理 ✅ pert_time/pert_itime 标准
15 划分建议 ⚠️ 无官方 ML 划分,需自定义并防泄漏(§5.3)
16 泄漏讨论 ⚠️ 官方未讨论 ML 泄漏(非其目标),社区需自行按 perturbagen 分组
17 标签分布 ✅ sig_info 可直接统计,分布透明
18 测量偏倚 ⚠️ 平台压缩+推断引入结构化偏倚(坑点 1)
19 外部验证建议 ✅ GSE92743 官方配对验证集 + L2S2 独立再计算
20 版本记录 ✅ GEO 提交/修订日期 + clue.io release 仪表板
21 预处理脚本 ✅ 官方 SOP、cmapPy、cmapBQ、教程 notebooks 齐备
22 合规要求 ✅ 开放下载,无 DUA;注意 clue.io 非商业条款
23 多模态对齐 ⚠️ 转录组单模态为主;P100/GCP 等其他 LINCS 模态需经 LDP 对齐
24 去标识化 ✅ 细胞系数据无人类受试者信息,天然无隐私内容

DAIMS 评分:20.0 / 24

评分解读:扣分集中在"机器学习就绪度"而非"数据管理规范"——主键、字典、版本、合规四类硬指标全部达标,这是十年期 NIH 项目的制度化优势;扣分项(重复语义、长尾类、共线、泄漏)全部源于"参考图谱不是监督基准"这一定位,属于任何扰动数据集的共性挑战。状态分布为:✅ 16 项、⚠️ 8 项、❌ 0 项——零"红项"意味着没有致命的结构性缺陷,全部 ⚠️ 项都可以通过本文 §5-§6 的操作策略缓解。

对你意味着什么:可以直接把 L1000 当作高可信的"扰动-响应"语料库接入研究管线,不必担心数据管理与合规问题;但任何监督学习实验都必须自己设计防泄漏划分(按 perturbagen/PCL/骨架分组)、自己过滤低复现签名(q75 ≥ 0.2)、并且优先只信 978 landmark 或加权的特征子集。做到这三条,它就是同类中最好用的公共扰动转录组数据集;做不到,你会得到一个"看起来很准、换个化合物就崩"的模型。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
GTEx 组织样本(GSE92743) Broad/GTEx 联盟 L1000 vs RNA-seq 签名一致性 高度可比(定性,配对实验) — L1000 签名与 RNA-seq 可比,跨平台映射可行
1,143 条公共外部签名(多平台) CMap 团队收集 连接召回(recall) 80%(909/1,143)预期连接恢复 判定标准 NP≤0.05、FDR≤0.25、 tau
仅 landmark 基因消融 同上 同上 召回降约 20%(80%→60%),48 条签名完全不可分析 -20 pp 推断基因对召回有实质贡献
9 细胞系单系 vs 跨系汇总 同上 已知关系召回 单系均值 45%(29%-58%);跨系汇总 63% +18 pp 跨系汇总显著提升稳健性
shRNA 种子序列对比分析 同上 同基因 vs 共种子 shRNA 相似性 共种子相似性显著高于同基因 — shRNA 脱靶幅度超 on-target,必须用 CGS

§8 基准性能与生态

§8.1 排行榜(连接性检索与推理任务)

L1000 生态没有单一 SOTA 排行榜;下表汇总官方与同行评审的关键可复现数值(各行动员不同任务与口径,数值不可直接横向比较):| 排名 | 方法/研究 | 任务与性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|—|—|—|—|—|—|—|
| 1 | CMap-L1000 官方管线 | 外部签名 recall 80% | 2017 | KNN 推断 + MODZ + tau | Subramanian A, et al., Cell. DOI 10.1016/j.cell.2017.10.049 | clue.io |
| 2 | L1000CDS2 | 模仿/逆转签名检索(top 50 候选输出) | 2016 | Characteristic Direction | Duan Q, et al., npj Syst Biol Appl. DOI 10.1038/npjsba.2016.15 | lincscloud |
| 3 | L1000FWD | 16,000+ 小分子签名的交互可视化与检索 | 2018 | 签名 embedding + 烟花图 | Wang Z, et al., Bioinformatics. DOI 10.1093/bioinformatics/bty060 | l1000fwd |
| 4 | iLINCS | 跨组学签名搜索与逆转 | 2022 | limma/MODZ 统一签名库 | Pilarczyk M, et al., Nat Commun 13:4678. DOI 10.1038/s41467-022-32205-3 | ilincs |
| 5 | SigCom LINCS | 百万签名数据+元数据双引擎检索 | 2022 | Web 检索架构 | Evangelista JE, et al., NAR 50(W1):W697. DOI 10.1093/nar/gkac328 | sigcom |

§8.2 SOTA 总结与选型建议

  • 要一个可信的"官方答案":用 clue.io 的 tau 查询(内部即官方管线),recall 80% 是全生态校准锚点。
  • 要批量、可编程的检索:SigCom LINCS 或 iLINCS 的 API,签名库即 L1000 Level 5(MODZ)重算版。
  • 要"逆转/模仿"二分类式的快速筛选:L1000CDS2 的 CD 方法对信噪比更友好。
  • 要可视化探索与 MoA 着色:L1000FWD 的烟花图聚类,适合早期假设生成与结果展示。
  • 自建模型:先复现 KNN 推断基线与 80% recall 范式,再谈超越——大量论文的"显著提升"在正确分组评估下缩水。

选型决策树:能接受在线查询(非商业)→ clue.io;需要 API 批量 → SigCom/iLINCS;需要全库自定义建模 → GEO 本地 Level 5;需要样本级方差或重算流水线 → Level 3/4;需要方法学审计 → 五级全量。

§8.3 评测协议

官方范式:查询签名(up/down 各 top 基因集)→ 与 Touchstone 参考库比对 → 高置信判定 NP ≤ 0.05、FDR ≤ 0.25、|tau| ≥ 90 → 已知正例配对的召回率。复现要点:基因集长度(官方常用 top 150)、过滤规则(q75 ≥ 0.2)、是否跨系汇总,三者任一不同结果即不可比。

协议参数 官方取值 复现注意
查询基因集 up/down 各 top 150(常用) 长度不同召回率不可比
高置信判定 NP ≤ 0.05、FDR ≤ 0.25、\ tau\
签名质量门槛 distil_cc_q75 ≥ 0.2 二级库(iLINCS)沿用此阈值
跨系汇总 9 核心系秩聚合 单系 recall 29%-58%,汇总 63%
正例来源 已知 MoA/靶点配对 正例集不同则数字没有可比性
数据集 关系 用途
GSE92743 L1000 官方配对验证(GTEx) 跨平台校准
CMap v1 前代(约 7,000 签名) 历史对比
LINCS P100/GCP 同计划蛋白/组蛋白修饰模态 多组学对齐
PerturbAtlas/Perturb-seqr 单细胞扰动互补 细胞类型分辨率扩展
GTEx / TCGA 疾病与组织参考 查询签名来源
PRISM 同源活力筛选(CMap 团队) 转录假设的活力验证

§8.5 关键论文 Top 8

  1. Subramanian A, Narayan R, Corsello SM, et al. A Next Generation Connectivity Map: L1000 Platform and the First 1,000,000 Profiles. Cell 171(6):1437-1452.e17, 2017. DOI 10.1016/j.cell.2017.10.049 —— 数据集奠基论文:平台、五级数据、推断与 tau、recall 验证。
  2. Lamb J, et al. The Connectivity Map: Using Gene-Expression Signatures to Connect Small Molecules, Genes, and Disease. Science 313:1929-1935, 2006. DOI 10.1126/science.1132939 —— 连接性分析概念原点(CMap v1)。
  3. Keenan AB, et al. The Library of Integrated Network-Based Cellular Signatures NIH Program: System-Level Cataloging of Human Cells Response to Perturbations. Cell Systems 6(1):13-24, 2018. DOI 10.1016/j.cels.2017.11.001 —— LINCS 计划与 L2S2 资源总览(248 系/33,621 化合物/1.678M 签名)。
  4. Stathias V, et al. LINCS Data Portal 2.0. Nucleic Acids Research 48(D1):D431-D439, 2020. DOI 10.1093/nar/gkz1023 —— 官方数据门户与再分发架构。
  5. Evangelista JE, et al. SigCom LINCS. Nucleic Acids Research 50(W1):W697-W700, 2022. DOI 10.1093/nar/gkac328 —— 百万签名检索引擎(~300 万 Level 3 样本 → ~100 万签名口径出处)。
  6. Pilarczyk M, et al. Connecting omics signatures and revealing biological mechanisms with iLINCS. Nature Communications 13:4678, 2022. DOI 10.1038/s41467-022-32205-3 —— 跨组学签名搜索与 q75 过滤实践。
  7. Duan Q, et al. L1000CDS2: ultra-fast network-based human gene expression signature search. 2016. DOI 10.1038/npjsba.2016.15 —— CD 方向方法与模仿/逆转检索。
  8. Wang Z, et al. L1000FWD: fireworks visualization of drug-induced gene expression profiles. 2018. DOI 10.1093/bioinformatics/bty060 —— 签名空间可视化与 MoA 着色。
  9. Koleti A, et al. Data Portal for the Library of Integrated Network-based Cellular Signatures (LINCS) program. Nucleic Acids Research 46(D1):D558-D566, 2018. DOI 10.1093/nar/gkx1064 —— LINCS 数据门户 1.0,元数据体系与再分发标准。

阅读顺序建议:先 1(平台与数据)→ 2(概念源起)→ 3(计划全景),再按需读 4-9(各二级平台与工具);关注"可复现管线"的读者优先 4、6,关注检索生态的读者优先 5、7、8。

§8.6 社区活跃度

主论文 Dimensions 引用 3,762+(截至 2026-09);官方教程仓库 cmap/lincs-workshop-2020 与 cmapPy 持续可用;clue.io 提供 Connectopedia 知识库与用户指南;学术社区以"药物重定位 + 扰动建模"两条线保持高产出。

引用曲线的语境:Cell 2017 主论文是"数据集论文"中的头部资产(同档位),其中相当比例引用来自药物重定位、MoA 推断与表达谱基础模型三个方向——这预示未来 2-3 年随着扰动基础模型兴起,L1000 作为"响应真值"的引用还会持续增长。对使用者的含义:社区方案多、可参考实现多,但同样意味着"噪声复现"也多——引用高不等于用法正确,仍需回到本文 §6.5 的坑点清单自查。

§8.7 生态快照

下表规模列标注口径与查询日期,引用前请到对应资源页复核最新数值:

资源 类型 链接 Star/规模(截至 2026-09) 推荐理由
clue.io 官方平台 clue.io 300 万+ profiles 在线 官方 tau 查询首选
cmapPy Python 库 GitHub 官方维护 GCTx 事实标准解析器
slinky R 包 GitHub BioConductor 流程友好 HDF5 切片读取封装
cmapBQ BigQuery 教程 SQL 级访问 零本地存储分析
SigCom LINCS 检索引擎 sigcom ~100 万签名 可编程 API
iLINCS 检索引擎 ilincs 跨组学库 疾病签名逆转工作流
LINCS Data Portal 数据门户 LDP LINCS 全模态 元数据权威入口
L1000FWD 可视化检索 l1000fwd 16,000+ 小分子签名 MoA 着色烟花图
L1000CDS2 快速检索 l1000cds2 模仿/逆转二选 CD 方法信噪比好
Connectopedia 知识库 connectopedia 官方术语与协议 数字口径权威出处

生态使用总则:数据层(GEO/clue.io)— 语义层(Connectopedia/README)— 分析层(cmapPy/cmapBQ/slinky)— 检索层(SigCom/iLINCS/L1000FWD/L1000CDS2)四层职责清晰,遇到问题时先定位所属层再找对应资源,可以避免"拿检索层结果质疑数据层口径"这类跨层比较错误。


§9 相关资源与引用

§9.1 官方资源

资源选择的一条主线:所有官方资源的术语定义以 Connectopedia 为最终权威(Connectopedia 明确回答了"什么是 L1000 检测"“如何下载”"如何解读 tau"等高频问题);遇到本文与平台文档不一致时,以官方 Connectopedia 与 GEO README 为准并向编辑部反馈。

§9.2 BibTeX 引用块

@article{subramanian2017next,
  author  = {Subramanian, Aravind and Narayan, Rajiv and Corsello, Steven M. and Peck, David D. and Natoli, Ted E. and Lu, Xiaodong and Gould, Joshua and Davis, John F. and Tubelli, Andrew A. and Asiedu, Jacob K. and others},
  title   = {A Next Generation Connectivity Map: {L1000} Platform and the First 1,000,000 Profiles},
  journal = {Cell},
  volume  = {171},
  number  = {6},
  pages   = {1437--1452.e17},
  year    = {2017},
  doi     = {10.1016/j.cell.2017.10.049}
}

@article{lamb2006connectivity,
  author  = {Lamb, Justin and Crawford, Elizabeth D. and Peck, David and Modell, Joshua W. and Blat, Irene C. and Wrobel, Matthew J. and Lerner, Jim and Brunet, Jean-Philippe and Subramanian, Aravind and Ross, Ken N. and others},
  title   = {The Connectivity Map: Using Gene-Expression Signatures to Connect Small Molecules, Genes, and Disease},
  journal = {Science},
  volume  = {313},
  number  = {5795},
  pages   = {1929--1935},
  year    = {2006},
  doi     = {10.1126/science.1132939}
}

@article{keenan2018lincs,
  author  = {Keenan, Alexandra B. and Jenkins, Sherry L. and Jagodnik, Kathleen M. and Koplev, Simon and He, Eduard and Torre, Denis and Wang, Zichen and Dohlman, Anders B. and Silverstein, Moshe C. and Lachmann, Alexander and others},
  title   = {The Library of Integrated Network-Based Cellular Signatures {NIH} Program: System-Level Cataloging of Human Cells Response to Perturbations},
  journal = {Cell Systems},
  volume  = {6},
  number  = {1},
  pages   = {13--24},
  year    = {2018},
  doi     = {10.1016/j.cels.2017.11.001}
}

@article{stathias2020lincs,
  author  = {Stathias, Vasileios and Turner, John and Koleti, Amar and Vidovi{\'c}, Du{\v s}ica and Cooper, Daniel and Fazel-Najafabadi, Mehdi and Pilarczyk, Marcin and Terryn, Raymond and Chung, Caty and Umeano, Afoma and others},
  title   = {{LINCS} Data Portal 2.0: Next Generation Access Point for Perturbation-Response Signatures},
  journal = {Nucleic Acids Research},
  volume  = {48},
  number  = {D1},
  pages   = {D431--D439},
  year    = {2020},
  doi     = {10.1093/nar/gkz1023}
}

@article{koleti2018portal,
  author  = {Koleti, Amar and Terryn, Raymond and Stathias, Vasileios and Chung, Caty and Cooper, Daniel J. and Turner, John P. and Vidovi{\'c}, Du{\v s}ica and Forlin, Michele and Kelley, Tanya T. and D'Urso, Alessandro and others},
  title   = {Data Portal for the Library of Integrated Network-based Cellular Signatures ({LINCS}) Program: Integrated Access to Diverse Large-scale Cellular Perturbation Response Data},
  journal = {Nucleic Acids Research},
  volume  = {46},
  number  = {D1},
  pages   = {D558--D566},
  year    = {2018},
  doi     = {10.1093/nar/gkx1064}
}

@article{evangelista2022sigcom,
  author  = {Evangelista, John Erol and Clarke, Daniel J. B. and Xie, Zichen and Marcelo, Marcio A. and Lachmann, Alexander and Cheng, Mano S. and Jeon, Marvin and Ma, Avi},
  title   = {SigCom {LINCS}: Data and Metadata Search Engine for a Million Gene Expression Signatures},
  journal = {Nucleic Acids Research},
  volume  = {50},
  number  = {W1},
  pages   = {W697--W700},
  year    = {2022},
  doi     = {10.1093/nar/gkac328}
}

§9.3 引用指南

  • 使用数据本体:引 Subramanian 2017 + GEO accession(GSE92742 或对应版本)。
  • 使用二级检索引擎:对应引 SigCom/iLINCS/L1000FWD/L1000CDS2 原文。
  • 引用规模数字:注明版本口径(Phase 1 约 130 万 profiles;LINCS 2020 超 300 万 profiles),避免混用。
  • 引用评分机制:tau/Touchstone 释义引 Cell 2017 与 Connectopedia;MODZ 与 q75 过滤同样溯源自 Cell 2017。
  • 引用技术原理:978 landmark、磁珠锚定、专利号均出自 Cell 2017 与官方 Connectopedia 条目,勿转引二手综述。
  • 一致性自查:投稿/交付前用本文 §7.7 的 DAIMS 清单与 §8.3 的评测协议参数表核对报告口径,是成本最低的拒稿预防措施。

§10 AI 使用声明卡

§10.1 本页面生产中使用的 AI 模型

  • LLM(检索汇总、结构撰写、代码起草):CodeBuddy Code(fast-model)
  • 无图像生成模型参与正文生产

§10.2 AI 参与范围

AI 执行:WebSearch 事实检索与交叉核对(5 轮)、事实清单整理、章节初稿生成、代码示例起草、格式对齐宪法规范。人工执行:事实抽查、医学与工程表述审核、终审发布(见 §10.4)。AI 不执行:数字的无来源创造(所有规模/日期/引用数均须检索来源支撑,查不到即省略)、对实验结果的主观断言。

§10.3 输入来源列表

  1. Subramanian A, et al., Cell 171(6):1437-1452.e17, 2017. DOI 10.1016/j.cell.2017.10.049
  2. Lamb J, et al., Science 313:1929-1935, 2006. DOI 10.1126/science.1132939
  3. Keenan AB, et al., Cell Systems 6(1):13-24, 2018. DOI 10.1016/j.cels.2017.11.001
  4. Stathias V, et al., NAR 48(D1):D431-D439, 2020. DOI 10.1093/nar/gkz1023
  5. Evangelista JE, et al., NAR 50(W1):W697-W700, 2022. DOI 10.1093/nar/gkac328
  6. Pilarczyk M, et al., Nat Commun 13:4678, 2022. DOI 10.1038/s41467-022-32205-3
  7. Duan Q, et al., npj Syst Biol Appl 2:16015, 2016. DOI 10.1038/npjsba.2016.15
  8. Wang Z, et al., Bioinformatics 34(17):i932-i940, 2018. DOI 10.1093/bioinformatics/bty060
  9. Koleti A, et al., NAR 46(D1):D558-D566, 2018. DOI 10.1093/nar/gkx1064(LDP 1.0)
  10. Getting Started with LINCS Datasets and Tools, 2022. PMID 35876555
  11. GEO GSE92742 官方描述与补充文件清单(identifiers.org/geo:GSE92742)
  12. clue.io Connectopedia(L1000 检测、数据层级、connectivity scores 条目)
  13. Broad Institute CMap 官方页(broadinstitute.org/connectivity-map-cmap)
  14. clue.io/data-dashboard(LINCS 2020 版规模口径)
  15. cmap/lincs-workshop-2020 与 VanAndelInstitute/slinky 仓库文档
  16. biorXiv 2025.09.29(MODZ/共识签名方法学分析,预印本,仅用于方法描述佐证)
  17. VanAndelInstitute/slinky README(clue.io API key 非商业条款、Level 3 文件约 40 GB 的下载提示)
  18. iLINCS 文档(Level 4→Level 5 的 MODZ 聚合与 q75 过滤的工程实现说明)

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
规模数字与版本口径(含"300 万"纠错) 千方病案医学编辑部 对照 GEO/官方页/论文三方交叉 ✅ 已通过
L1000 技术原理与 978 landmark 表述 千方病案医学编辑部 对照 Connectopedia 与 Cell 2017 ✅ 已通过
tau/MODZ/q75 评分机制 千方病案医学编辑部 对照官方 Connectopedia 与 iLINCS 论文 ✅ 已通过
8 个坑点可操作性 数据工程师 逐条核对官方文档与论文证据 ✅ 已验证
代码示例可运行性 数据工程师 依赖声明 + API 口径核对 ✅ 已验证
ICD-11/SNOMED 应用映射 医学审核者 与 ICD-11/SNOMED 标准术语核对 ✅ 已通过
引用与 BibTeX 完整性 编辑部 逐条 DOI 解析 ✅ 已验证

§10.5 AI 生成章节标注

本页各章节均由 AI 起草、人工审核后发布;§2.1b 的 SNOMED 映射与 §6 代码为 AI 起草重点复核区(映射为应用层注释,非数据集内置标签;代码以官方库 API 为准)。§6.5 的 8 个坑点中,坑点 1/2/4/5 的量化细节(81% 推断、z-score 语义、tau 分位含义、共种子脱靶幅度)逐一对照了原始论文表述,属于高置信内容;坑点 3/6/7/8 的操作建议为工程经验与官方工具能力的综合,使用者应按自身环境验证。

§10.6 最后人工审核日期

2026-09-05

审核覆盖说明:本次终审覆盖全部 10 个正文章节与 frontmatter/JSON-LD 结构块,重点复核了规模数字口径(§1.4、§3.2、§8.5)、8 个坑点的可操作性与参考来源(§6.5)、DAIMS 24 项评分一致性(§7.7)三类高风险内容;审核结论为全部通过、页面可发布。

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • hmdb — 共享标签:基因组学与多组学 / 药物发现与化学 / 化学信息学
  • binding-moad — 共享标签:基因组学与多组学 / 药物发现与化学 / 化学信息学
  • plinder — 共享标签:基因组学与多组学 / 药物发现与化学 / 化学信息学
  • jump-cell-painting — 共享标签:基因组学与多组学 / 药物发现与化学 / 化学信息学
  • intact — 共享标签:基因组学与多组学 / 药物发现与化学
  • msigdb — 共享标签:基因组学与多组学 / 药物发现与化学
  • lipid-maps — 共享标签:基因组学与多组学 / 药物发现与化学
  • alphafold — 共享标签:基因组学与多组学 / 药物发现与化学
  • geo — 共享标签:基因组学与多组学 / 转录组
  • zinc — 共享标签:药物发现与化学 / 化学信息学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集