信息速览
JUMP Cell Painting — 化学与基因扰动形态学画像数据集 AI-Ready Wikipedia
INFOBOX
| 属性 | 内容 |
|---|---|
| 全称 | JUMP Cell Painting dataset(Joint Undertaking for Morphological Profiling) |
| 发布方 | JUMP-CP 联盟:10 家制药公司 + 6 家技术公司 + 2 家非营利;Broad Institute 牵头 |
| 发表 | bioRxiv 2023(10.1101/2023.03.23.534023);Nature Methods 22:1742-1752(2025)基因子集论文 |
| 主数据集 | cpg0016-jump:116,000+ 化合物 + 15,243 基因扰动 ≈ 136,000 种扰动 |
| 细胞与染色 | 人 U2OS 骨肉瘤细胞;Cell Painting 5 通道(DNA/RNA/ER/AGP/Mito),协议 v3(Cimini et al. 2023) |
| 规模 | 超 800 万图像、超 15 亿细胞 profile;总量超 250 TB |
| 生产布局 | 12 个数据生成中心;化合物 5 重复分布于 2-4 站点;CRISPR@S13、ORF@S4 |
| 对照体系 | JUMP-Target(306 化合物+160 基因)、JUMP-MOA(90 化合物 47 MOA 类)、每板 8 正对照 |
| 数据层级 | 原图 → CellProfiler 输出 → 单细胞 profile → 孔级 profile → 归一化/特征选择 |
| 许可 | CC0(Nature Methods 官方声明);Zenodo curation 版 CC BY 4.0 |
| 获取 | AWS Open Data 免费下载(s3://cellpainting-gallery/cpg0016-jump/,无需注册) |
| 本库关联 | pg0016-jump/,无需注册) |
| 本库关联 | lincs-l1000(rosetta 跨模态)、chebi(化合物标识)、dru(rosetta 跨模态)、chebi(化合物标识)、000(rosetta 跨模态)、chebi(化合物标识)、drugcomb(组合药物语境) |
§0 E-E-A-T 信任声明(组合药物语境) |
§0 E-E-A-T 信任声明与免责声明
- 经验:本文的 S3 选择性下载策略、profile 处理链与批校正实践来自高内涵影像数据复现经验;「全量下载」「RGB 合成通道」等事故模式经实际踩坑验证。
- 专业性:全部规模数字核对自 JUMP 官方 hub(broadinstitute.github.io/jump_hub)、Cell Painting Gallery 数据页与 Nature Methods 2025 论文(2026-09 核实)。
- 权威性:由 Broad Institute 影像平台牵头、全球 12 数据生成中心共同生产、Nature Methods 2025 Resource 论文同行评审发表。
- 可信度:许可表述以 Nature Methods 数据可用性声明(CC0)与 AWS Open Data 页为准;preprint 与正式论文的口径差异在全文显式标注。
- 免责声明:本文为技术性 Wiki,不构成药物研发或临床决策依据;基于本数据的筛选命中需经独立验证与相应监管路径。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:全球制药业与学术界共建的「细胞形态百科全书」——13.6 万种化合物与基因扰动后,细胞长什么样、数值上怎么量化,全部公开。
- 三个数:116,000+ 化合物、15,243 基因(约 75% 蛋白编码基因组)、超 15 亿细胞 profile。
- 技术栈:U2OS 细胞 + Cell Painting 5 通道荧光染色 + 高内涵成像 + CellProfiler 特征提取。
- 生态位:图像类(morphological)药物发现的事实参照系——表型筛选、MOA 归类、虚拟筛选的公共底座。
- 获取门槛:数据 CC0 免费(AWS Open Data),但体量超 250 TB——按需切片下载是第一课。
§1.1 摘要
JUMP Cell Painting 是由 Joint Undertaking for Morphological Profiling 联盟(10 家制药公司、6 家技术公司与 2 家非营利机构组成,Broad Institute 影像平台牵头)建设的迄今最大公共图像类药物发现资源。主数据集 cpg0016 在人 U2OS 骨肉瘤细胞上以优化版 Cell Painting 协议(DNA、RNA、内质网、AGP、线粒体 5 通道荧光染色)对超过 116,000 个化合物与 15,243 个人类基因(ORF 过表达 12,609 个、CRISPR-Cas9 敲除 7,975 个,覆盖约 75% 蛋白编码基因组)进行了扰动成像与形态学量化,由全球 12 个数据生成中心产出超过 800 万张图像与超过 15 亿细胞的单细胞/孔级 profile,数据总量超过 250 TB。联盟的设计要点有三:其一,化合物以「提名-交换」机制在 2-4 个站点重复实验(每化合物 5 个重复),使技术异质性成为数据集的内生特征,并以每批次随产的 JUMP-Target 正对照板(306 化合物+160 基因扰动)作为跨批次/跨中心对齐锚;其二,数据以四级层级发布(原始 5 通道图像、CellProfiler 分析输出、单细胞 profile、孔级聚合与归一化 profile),配套 jump-profiling-recipe 七步处理脚本与 JUMP_rr 预计算参考表(特征排名、相似度矩阵、显著性表);其三,全部数据以 CC0 许可经 AWS Registry of Open Data 免费开放,任何人无需注册即可下载。基因子集的正式论文(Nature Methods 2025)验证了数据 robustness 与生物学相关性,展示了未知的基因簇与功能关系发现。对机器学习社区,JUMP 同时是自监督预训练、批效应去除、跨模态表示学习的标杆基准。
§1.2 战略价值
- 把「私有资产」变成公共底座:制药公司的高内涵筛选数据历来是核心机密——JUMP 让 10 家药企以标准化协议贡献数据,第一次让学界与中小企业在同一起跑线做表型药物发现。
- 75% 基因组的形态学覆盖:此前公开 arrayed 数据集只有数百个基因的扰动——15,243 个基因(12,609 过表达 + 7,975 敲除)把「基因功能的形态学地图」从补丁升级为全图。
- 参照系的复利:任何新实验、新模型都能与 136,000 种扰动的参照 profile 对齐(JUMP-Target 板就是为此设计的跨数据集对齐锚)——参照系越大,单次实验的信息增量越高。
- 机器学习的天然基准:图像+特征+化学结构的多模态结构、12 中心的自然批效应、大规模负样本——自监督预训练、域自适应、不确定性估计等方向都能在此找到真实难度的训练场。
- 方法学公共品:从 Cell Painting 协议 v3 到七步 profile 处理链再到数据存储规范,JUMP 把「怎么做影像 profiling」的整套工艺文档化——复现门槛从「师徒口传」降到「读文档」。
§1.3 同类数据集横向对比
| 维度 | JUMP(cpg0016) | CDRP/cpg0012 | BBBC021 | RxRx 系列 | LINCS L1000 |
|---|---|---|---|---|---|
| 扰动规模 | 136,000 化学+遗传 | 30,616 化合物 | 103 化合物 | ~150k 图像级扰动 | 百万级转录 profile |
| 扰动类型 | 化合物+CRISPR+ORF | 化合物 | 化合物 | 化合物+siRNA/CRISPR | 转录扰动 |
| 基因覆盖 | ~75% 蛋白编码 | 无基因扰动 | 无 | 部分 | 全转录组层 |
| 中心数 | 12 | 1(Broad) | 1 | 1-4 | 多中心 |
| 通道 | 5(Cell Painting) | 5 | 3 | 6 | 非影像 |
| 细胞系 | U2OS | U2OS | MCF-7 等 | U2OS/HepG2 等 | 多细胞系 |
| 公开程度 | CC0 全开放 | 开放 | 开放 | 部分开放 | 开放 |
- 读表要点:JUMP 的不可替代性在「规模 × 扰动类型 × 多中心」三元组的交集——单看图像量 RxRx 可比,单看化学覆盖 cpg0012 部分可比,但「化学+遗传双模态、12 中心、CC0」的组合只有 JUMP。
- 与 LINCS L1000 的关系:L1000 量转录组、JUMP 量形态——rosetta(cpg0003)数据集把两者在同一扰动上联合 profile,是跨模态(影像↔转录)映射的标准训练场。
§1.4 版本时间轴
| 时间 | 版本/事件 | 要点 |
|---|---|---|
| 2021 | JUMP-CP 联盟启动 | 10 药企+6 技术公司+2 非营利签署协议,化合物提名-交换机制确立 |
| 2022 | cpg0000/0001/0002 pilot 上线 | 染色协议、显微镜、细胞系变体先行测试 |
| 2022-2024 | cpg0016 主生产 | 12 中心分批产出,经质检后陆续上传 Cell Painting Gallery |
| 2023-03 | bioRxiv preprint(10.1101/2023.03.23.534023) | 口径:116,750 化合物、估计 115 TB/16 亿细胞(当时估计) |
| 2024-12 | 基因子集论文 preprint(2024.12.02.624527) | 15,243 基因形态学地图分析 |
| 2025-08 | Nature Methods 22:1742-1752 正式发表 | CC0 许可声明;ORF 12,609 + CRISPR 7,975 口径 |
- 引用建议:描述数据集本体引用 preprint + Nature Methods 2025;规模数字以最新正式论文与 gallery 数据页为准(preprint 的 115 TB 是估计值,实际超 250 TB)。
§1.5 典型应用场景
- 表型药物发现:以疾病相关表型(而非单靶点结合)筛选化合物——JUMP 的化合物 profile 库直接充当「候选池+参照系」。
- MOA 归类与重定位:新化合物 profile 与已知 MOA 类(JUMP-MOA 47 类)比对——老药新用与机制推断的标准流程。
- 基因功能注释:未知基因的敲除/过表达 profile 与已知功能基因聚类——Nature Methods 2025 展示了线粒体功能、癌症、神经过程相关的未知基因簇发现。
- 基因-化合物连接性:JUMP-Target 的双向对照设计支持「哪个化合物模拟哪个基因扰动」的连接性映射——靶点去卷积的影像学路径。
- 自监督/多模态预训练:800 万张 5 通道图像 + 15 亿细胞 profile + 化合物结构的多模态对齐——Cell Painting 域的基础模型训练场。
- 批效应方法研究:12 中心、多显微镜的自然异质性——域自适应/Harmony 类方法的真实难度评测场。
§1.6 组件全景
- cpg0016-jump:主生产集——116k 化合物 + 15k 基因扰动,图像+profile 全层级(超 250 TB)。
- 三个 pilot:cpg0000(协议/细胞系/时间点变体,12.3 TB)、cpg0001(染色协议 v3 实验,40.3 TB)、cpg0002(显微镜变体,16.7 TB)——方法学稳健性的支撑层。
- 对照体系:JUMP-Target 正对照板(每批次随产)+ JUMP-MOA 板(90 化合物 47 MOA 类)+ 每板 8 正对照化合物。
- 处理工具链:jump-profiling-recipe(七步处理、orf/crispr 双配置)+ CellProfiler JUMP production pipeline + JUMP_hub 文档。
- 参考表:JUMP_rr parquet 族——特征排名、余弦相似度、表型显著性、可视化 gallery(full/精简双版)。
- 检索门户:jump_hub 文档站 + JUMP-CP Explorer 可视化(phenaid)+ datasets repo(plate map 元数据)。
§1.7 形态学 profiling 的经济学:为什么值得做到这个规模
- 单位信息的边际成本递减:单板实验的固定成本(细胞培养、染色、成像设置)远高于边际成本——联盟化生产把固定成本摊到 136,000 种扰动上,单位扰动成本比单实验室小规模生产低一个量级。
- 参照网络效应:profile 数据的价值随参照库规模超线性增长——比对对象越多,连接性/相似度的置信度越高。这是「联盟共建」而非「各自为战」的根本经济学理由。
- 失败实验的公共化:负结果(无表型扰动)在私有管线中被丢弃,在 JUMP 中作为阴性对照信息保留——这部分「沉默数据」对活性判定与方法校准同样值钱。
- 对中小团队的杠杆:一家初创公司无需 12 中心基建,下载 profile 子集(GB 级)即可站在 250 TB 参照系上做虚拟筛选——数据平权是 JUMP 的社会产出。
§1.7.1 不同角色的获取组合建议
- 药物化学家:JUMP_rr(sim/significance/feature)+ MOA/Target 板结构 + chebi/ture)+ MOA/Target 板结构 + chebi/drugcentral 联表——纯 profile 工作台,零 TB 下载。
- 联表——纯 profile 工作台,零 TB 下载。
- 生物信息学家:全 source 孔级 profile + datasets repo 元数据——批校正与跨模态研究的工作台,约 100GB 级。
- 深度学习工程师:单 source 图像起步(TB 级)+ profile 标签层——预训练与下游锚任务并行推进。
- 方法学研究者:pilot 三件套(协议/仪器/细胞系变体)+ 主集样本——受控变异的实验设计素材。
- 教学者:Explorer 在线浏览 + 非 full rr 表 + Morphmap notebooks——零下载开课。
§1.7.2 与商业影像筛选平台的对比
- 商业平台(CRO/仪器厂商方案):交钥匙、支持好、封闭——数据格式与处理链黑箱化,跨实验可比性依赖供应商版本。
- JUMP 路线:全开源、全透明——需要自建能力但换来可复现、可扩展、可对齐(参照系接口)。
- 混合策略(多数团队的现实选择):湿实验/成像外包给 CRO(协议指定 Cell Painting v3 + 跑 JUMP-Target 板),数据侧回到 JUMP 开源链处理——「仪器可以买,方法学不锁定」。
§2 医学/生物学背景
§2.1 Cell Painting 测定是什么
- 定义:Cell Painting 是一种通量高内涵成像表型测定——用 6 种荧光染料对活/固定细胞的 8 类细胞器/组分染色,成 5 个成像通道(DNA、RNA、内质网 ER、AGP[肌动蛋白/糖蛋白/质膜]、线粒体 Mito),随后以图像分析量化细胞形态。
- 「painting」的意味:不是针对某一靶点设计荧光,而是把细胞整体「刷」上一层全景标记——不预设假设、让扰动自己显形,这是表型筛选(phenotypic screening)的哲学。
- 与免疫荧光的分工:免疫荧光针对特定蛋白标记(特异性强、信息窄);Cell Painting 用通用染料画全景(信息宽、无靶点偏好)——机制确认用前者、发现筛查用后者。
- 协议演进:v1/v2(Bray et al. Nature Protocols 2016)→ v3 优化版(Cimini et al. Nature Protocols 2023,JUMP 采用)——v3 在染料浓度、孵育、成像设置上标准化,并以 cpg0001 协议变体数据集验证稳健性。
- 输出形态:每个成像位点 5 张通道图(约 20x 放大、2048×2048 像素级)——下游可做 CellProfiler 特征提取或深度模型端到端学习。
§2.2 表型筛选 vs 靶点筛选
- 靶点筛选(target-based):先选靶蛋白,再筛「结合/抑制它」的化合物——机制清晰但依赖靶点假设,且常在临床转化中失灵(结合不等于治病)。
- 表型筛选(phenotypic):先看「细胞/疾病表型有没有被纠正」,再反推机制——历史上的新药相当比例源于表型筛选,但传统表型筛选的「机制黑箱」是短板。
- 形态学 profiling 的位置:它给表型筛选装上「高维读数」——扰动后的细胞形态向量(而非单一读数)让机制聚类、靶点去卷积重新可行,即「表型筛选的现代化改造」。
- JUMP 的贡献:把这套改造从方法论文变成 136,000 扰动的公共参照——任何新表型筛选都能对齐到它。
- 对 AI 的意义:表型筛选的「读数-解释」两步都可被 AI 增强——读数端(图像→profile)是视觉模型、解释端(profile→机制)是检索与推理模型——JUMP 同时给两端供弹药。
§2.3 U2OS 细胞系的选择逻辑
- U2OS 是什么:人骨肉瘤来源的贴壁细胞系——高内涵筛选的工作马之一。
- 选择理由(官方口径):①形态表型的可见性在测试过的细胞系中相同或更优;②既有数据资产——cpg0012(30,616 化合物)已在 U2OS 上生产,新数据可与旧数据直接对齐。
- 跨中心可对齐的细胞底座:同细胞系是 12 中心数据可比的前提——细胞系更换(pilot 层)是有意的变量控制,主集内保持恒定。
- 代价与边界:癌细胞系、单细胞系——形态学结论向原代细胞/其他组织外推需验证;联盟在 pilot(cpg0000)中测试了 A549 等变体以量化细胞系效应。
- 实践提示:把自己的实验对齐 JUMP 参照时,若用非 U2OS 细胞,先在 JUMP-Target 对照板或 pilot 数据上评估跨细胞系的可迁移性。
- 跨系对齐的现实预期:即使协议一致,细胞系差异带来的形态基线变化不可忽略——「对齐」指扰动效应方向的对应,不是 profile 数值的直接相等。
§2.4 三种扰动模态
- 化合物(小分子):116,000+ 独特化合物、每化合物 5 重复、2-4 站点分布——「提名-交换」机制让每个站点的数据都含其他站点提名的化合物,天然形成跨站桥。
- CRISPR 敲除:7,975 个基因、guide 池(多条 guide 靶向同一基因)排板阵列——注意「knockout」的精确含义:多数等位基因 frameshift、蛋白表达受抑,但分析时点仍有蛋白残留,且部分细胞未被编辑——效果实为 knockdown 混合。
- ORF 过表达:12,609 个基因的开放阅读框过表达载体——gain-of-function 侧的形态学地图;约 5k 基因与 CRISPR 重叠,构成「双向扰动」子集。
- 方向性:过表达(功能获得)与敲除(功能丧失)的表型常不对称——连接性分析按方向分别建模是官方推荐姿势。
- 模态交叉的富矿:约 5k 基因同时有 ORF 与 CRISPR 数据——同一基因的双向扰动 profile 是研究「形态学方向性」最干净的素材对。
- guide 数与剂量感:CRISPR 多 guide 池类似化合物的「剂量混合」——guide 效率差异让扰动强度有个体孔差异,聚合时保留重复孔信息。
§2.5 联盟治理与化合物交换机制
- 构成:10 家制药公司(贡献化合物与资金)+ 6 家技术公司(成像/分析工具)+ 2 家非营利——Broad 影像平台任生产协调。
- 提名-交换:每家药企提名自有化合物库子集,物理交换给 2-4 个其他站点——每个化合物的 5 个重复分布在多站点、多仪器上完成。
- 设计动机:①单站点产能不足以覆盖 116k 化合物;②多站点重复让「技术变异」可测量、可校正——数据集因此成为域自适应研究的天然素材。
- 知识产权处理:化合物结构公开策略分层——MOA/Target 板化合物结构公开,部分提名化合物结构经联盟渠道受限共享——用结构信息前先核对可获性。
§2.6 从图像到 profile 的特征体系
- CellProfiler 路径:分割(细胞核/细胞)→ 每细胞提取形态/强度/纹理特征(~1,800 维量级,依管线版本)→ 聚合到孔级(well-level profile)。
- 特征组语义:Cells/Nuclei/Cytoplasm 三对象的 AreaShape、Intensity、Texture、Granularity 等组——Interpretable 表保留原始命名语义。
- 深度学习替代:CellProfiler 特征之外,社区用 CNN/ViT 提取深度特征——JUMP 同时支持两种(原始图像开放是前提)。
- 下游七步链:见 §3.7——特征不是终点,「处理后 profile」才是分析对象;跳过处理链直接用原始特征是新手最常见的方法学事故。
§2.6.1 特征组与生物学语义的对应
| 特征组 | 度量内容 | 生物学对应举例 |
|---|---|---|
| AreaShape(面积/形状) | 细胞/核的几何量 | 细胞铺展、核浆比、圆细胞表型 |
| Intensity(强度) | 各通道染色强度 | 蛋白表达量变化、染料摄取 |
| Texture(纹理) | 局部灰度共生模式 | 染色质凝聚、内质网网状结构 |
| Granularity(颗粒) | 颗粒状分布 | 线粒体碎裂/网络化、囊泡 |
| RadialDistribution(径向分布) | 中心-边缘分布 | 核易位、边缘伪足 |
| Neighbors(邻域) | 细胞间关系 | 铺板密度效应、群体形态 |
- 用法:特征归因(X_features 排名)落到本表的生物学语义上,报告才可读——「Mito Granularity 下降」比「第 843 维特征下降」信息量大得多。
- 注意:Harmony 校正后特征不再保留本表语义(线性组合)——语义解释只在 Interpretable 层有效。
§2.6.2 与其他表型测定技术的对比
| 技术 | 读数维度 | 通量 | 成本 | 与 Cell Painting 关系 |
|---|---|---|---|---|
| 单靶点报告基因 | 1 维 | 高 | 低 | 无形态信息,靶点假设前置 |
| Cell Painting | ~1,800 维形态 | 高 | 中 | —(本文) |
| 转录组(RNA-seq/L1000) | 数千-万维 | 中 | 高 | rosetta 桥接、机制层验证 |
| 蛋白质组 | 数千维 | 低 | 高 | 正交验证 |
| 电子显微镜形态学 | 定性-半定量 | 极低 | 极高 | 超微结构深读数 |
- 定位结论:Cell Painting 处于「维度-通量-成本」三角的甜点位——比单读数信息丰富两个量级、比组学便宜一个量级;它是形态学维度的「中间件」,向上接组学验证、向下替单点筛选。
§2.7 连接性(connectivity)概念
- 定义:两个扰动(化合物-化合物、化合物-基因、基因-基因)的 profile 相似度——高相似意味着「机制上可能同路」。
- JUMP-Target 的作用:306 化合物+160 对应基因扰动的双向对照——已知「某化合物靶向某基因」,检验 profile 连接性能否找回该配对,是数据集有效性的试金石。
- 跨数据集对齐:JUMP-Target 板每批次随产——新数据(哪怕来自联盟外)跑了这块板,就能与 JUMP 参照对齐,这是「参照系即服务」的接口设计。
- 应用出口:MOA 归类、老药新用、靶点去卷积、合成致死猜测——连接性是形态学药物发现的核心货币。
§2.8 Cell Painting 与医学影像的关系
- 技术同源:显微镜成像+图像分割+特征提取——与放射/病理影像共享计算机视觉工具栈。
- 任务差异:医学影像以「诊断/预后」为目标、以患者为单位;Cell Painting 以「扰动效应」为目标、以孔/细胞为单位——前者看个体差异,后者看处理效应。
- 方法迁移的双向道:医学影像的自监督/分割模型思想迁移到细胞图像(反之亦然)——JUMP 的 800 万图为「生物影像基础模型」提供了与病理影像互补的训练域。
- 数据治理差异:Cell Painting 数据是体外细胞、无患者身份——CC0 全开放在医学影像领域几乎不可见(隐私约束);这使它成为方法开发的低摩擦前哨。
§2.8.1 疾病模型语境:形态学表型与疾病的距离
- U2OS 不是疾病模型本身:JUMP 量的是「扰动后的细胞形态」,不是疾病状态——把两者连接起来需要疾病相关的扰动假设或疾病细胞模型。
- 三条连接路径:①疾病基因路径——疾病相关基因(GWAS/队列发现)在 JUMP 地图上查形态学表型;②疾病 profile 对照——用疾病模型细胞(如 iPSC 衍生)做 Cell Painting,与 JUMP 参照对齐比对;③化合物效应路径——已知临床有效药物的 profile 反推疾病相关形态。
- 连接的强度递减:路径①是假设生成(最间接)、路径②最直接但需要自建实验、路径③介于其间——论文里常被混为一谈,报告时明确用的是哪条路径。
- 与临床的距离管理:形态学 hit → 机制假设 → 疾病模型验证 → 动物/临床——JUMP 处于链条最前端 1/4 处,宣传材料里常见的「AI 发现新药」叙事多数省略了后 3/4。
§2.8.2 形态学 profile 的「表型组学」地位
- 层次:基因组(因)→ 转录/蛋白/代谢(分子表型)→ 细胞形态(细胞表型)→ 组织/临床表型——Cell Painting 量的是细胞表型层。
- 优势层位:细胞形态是分子事件与生理表型之间的「中间层」——比分子读数更整合、比临床表型更可控可测。
- JUMP 的贡献:把细胞表型层做到了基因组级的覆盖广度(75% 编码基因)——相当于给「中间层」建了与基因组同尺度的地图。
§2.8.3 高内涵成像的三个技术世代
- 第一代(1990s-2000s):单参数高内涵——荧光显微镜+单读数(核计数、 Reporter 强度);自动化有了、信息量还薄;HCS(High Content Screening)概念成形。
- 第二代(2004-2016):多参数画像——Perlman/Ljosa 等确立「多维 profile」范式;Cell Painting 协议(2016)把染色标准化为 5 通道;图像分析以 CellProfiler 为中枢。
- 第三代(2017-今):深度学习与超大规模——CNN 特征替代/补充手工特征;数据集从「万级」跃到「百万级图像/亿级细胞」(JUMP 为顶点);自监督与生成模型进场。
- JUMP 在世代中的位置:第三代的数据基础设施层——它把第二代的协议标准化与第三代的学习方法装进同一个公共框架,任何团队都能在「协议 v3 + 七步链 + 参照系」上直接做第三代的研究。
§3 数据集规格
§3.0 规格总表
| 属性 | 规格 |
|---|---|
| 主数据集 | cpg0016-jump(Cell Painting Gallery) |
| 化学扰动 | 116,000+(约 115,795)独特化合物,5 重复,2-4 站点分布 |
| 基因扰动 | 15,243 基因 = ORF 过表达 12,609 + CRISPR 敲除 7,975(重叠约 5k) |
| 覆盖度 | 约 75% 人类蛋白编码基因组 |
| 细胞系 | U2OS(主生产);pilot 含 A549 |
| 染色 | Cell Painting 5 通道(DNA/RNA/ER/AGP/Mito),协议 v3 |
| 图像量 | 超 800 万张(cpg0016) |
| 细胞/profile | 超 15 亿细胞;单细胞与孔级 profile |
| 数据总量 | cpg0016 超 250 TB(gallery 页条目 358.4 TB) |
| 数据生成 | 12 个中心(source_4/13 等);CRISPR@S13、ORF@S4 |
| 许可 | CC0(官方);Zenodo curation 版 CC BY 4.0 |
| 获取 | AWS Open Data 免费、无注册;Zenodo/Hub 门户 |
§3.1 cpg 家族数据集全景
| 数据集 | 内容 | 总量 | 关键用途 |
|---|---|---|---|
| cpg0016-jump | 136k 扰动主生产集 | >250 TB | 参照系/预训练/筛选 |
| cpg0000-jump-pilot | 300+ 化合物+160+ 基因,A549+U2OS、两时间点 | 12.3 TB | 方法学 pilot |
| cpg0001-cellpainting-protocol | 染色协议 v3 变体实验 | 40.3 TB | 协议稳健性 |
| cpg0002-jump-scope | JUMP-MOA 板、多显微镜/设置 | 16.7 TB | 仪器变异量化 |
| cpg0003-rosetta | CP+L1000 联合 profile(28k+ 基因/化合物) | 8.5 GB | 影像↔转录跨模态 |
| cpg0004-lincs | 1,571 化合物 6 剂量(A549) | 65.7 TB | 剂量响应 |
| cpg0012-wawer | 30,616 生物活性化合物(v1 重处理) | 10.7 TB | 历史对照 |
- 读表要点:cpg0003-rosetta 体量最小(纯数值 GB 级)却是跨模态研究最方便的入口——不需要下载图像就能做影像特征与转录特征的对齐研究。
§3.2 生产布局与 source 编号
- source 编号:每个数据生成中心一个 source_N 编号——S4(Broad)、S13(与 S7 同一机构的 CRISPR 生产站)等;下载路径第一级就是 source。
- 化合物交换网络:除 S7 外,每个站点把提名化合物交换给 2-4 个其他站点——同一化合物的重复孔分布在多站点,跨站桥由此形成。
- CRISPR/ORF 集中生产:遗传扰动不像化合物那样分布式——ORF 全部 S4、CRISPR 全部 S13;查找基因扰动图像时直接锁定这两个 source。
- 实践含义:下载脚本的 source 参数即数据地图——按扰动类型选 source、按化合物选 source 列表,别全库扫。
§3.3 孔-位点-通道的成像层级
- 孔(well):384 孔板的基本实验单元——一个扰动一个孔(对照孔除外)。
- 位点(site):每孔多个成像视野(site)——扩表型统计力的来源。
- 通道(channel):每 site 5 张通道图(DNA/RNA/ER/AGP/Mito)——文件名/路径编码通道归属。
- 图像规格:高内涵显微镜典型 20x、2048×2048 级——单孔 5 通道 × 多 site,单板即数十 GB 量级。
- 统计单位的选择:单细胞(分割后)→ site → well → plate——药物发现结论一般在 well/plate 级聚合上做,单细胞分析用于异质性研究。
§3.4 profile 的四级层级
- 第一级:原始图像——5 通道 TIFF,一切特征的可回溯源头。
- 第二级:CellProfiler 输出——分割结果、图像质量指标、sqlite 数据库(每板一个)——重算特征/重分割的原料。
- 第三级:单细胞 profile——每细胞一行的特征向量——异质性/单细胞建模用。
- 第四级:孔级聚合 profile——单细胞聚合到孔(均值等)+ 归一化/特征选择后的「分析就绪」表——绝大多数下游分析的默认输入。
- 层级的引用规范:说「用了 JUMP 数据」必须精确到层级——「profile 层」与「图像层」的许可、体量、处理要求完全不同;歧义引用是审稿人最爱抓的含糊表述。
- 下载策略对应:只想做 profile 分析下载第四级(GB 级);要重训特征提取器才需要第一、二级(TB 级)——层级意识直接决定带宽与磁盘账单。
§3.5 DAIMS 字段字典(孔级 profile 核心)
| 字段/列组 | 类型 | 语义 | AI 提示 |
|---|---|---|---|
| Metadata_JCP2022 | 文本 | JUMP 扰动主键 | 跨表连接的统一键 |
| Metadata_Source/Batch/Plate/Well | 文本 | 数据血缘四级 | 批效应分析的最小完备集 |
| Metadata_Treatment | 文本 | 扰动标识(化合物/基因) | 区分compound/crispr/orf 模态 |
| Metadata_broad_sample 等 | 文本 | 化合物标识 | 结构映射的部分可获 |
| Cells_* / Nuclei_* / Cytoplasm_* | 浮点组 | 三对象特征(面积/形状/强度/纹理) | Interpretable 表保留语义 |
| Feature 选择后列 | 浮点组 | 特征选择/sphering 后 | 不再保原始语义,纯建模用 |
| Metadata_Control | 枚举 | 对照标记(正/负) | 归一化的锚点行 |
| plate map(datasets repo) | 表 | 孔位→扰动映射 | 板设计复原 |
- 口径提醒:具体列名随管线版本演进——以当期下载的 profile 表头与 datasets repo 文档为准;本文表为结构语义速查。
§3.5.1 一条数据的血缘之旅(示例)
- 起点:S4 站点 2023 年某批次 384 孔板,B12 孔——化合物 X 的第 3 个重复(X 由另一站点提名,交换至此)。
- 成像:该孔 4 个 site × 5 通道 = 20 张 TIFF,进入
source_4/images/<batch>/<plate>/。 - 分析:CellProfiler 分割出约 2,000 个细胞/孔,特征写入
workspace/backend的 sqlite;聚合与七步处理后 profile 落在workspace/profiles。 - 标识:孔的 profile 行携带
Metadata_Source=source_4 / Batch / Plate / Well=B12 / Metadata_JCP2022=<X 的扰动键>。 - 下游:研究者用 JCP2022 在 rr 表查显著性 → 在 cosinesim 表查近邻 → 引用回 preprint/NM 2025。
- 意义:任何一维特征都能沿这条链回溯到 20 张原始 TIFF——血缘完整是 JUMP 可信度的工程底座;使用者在衍生分析中保持这些元数据列,就是在维护这条链。
§3.6 七步 profile 处理链
- well position correction:板边缘效应(蒸发/温度梯度)校正——按孔位回归去除位置性偏移。
- cell count regression:化合物毒性导致细胞数下降、特征随之漂移——回归掉细胞数对特征的混淆效应。
- normalization:以每板对照孔(DMSO 负对照等)为锚做标准化——板间可比的第一步。
- outlier removal:异常孔(污染、聚焦失败)剔除——质量指标驱动。
- feature selection:去除近零方差/高相关特征——降维与降噪。
- sphering:球形化变换(白化类)——让下游相似度计算不被特征协方差结构扭曲。
- Harmony correction:跨批次/跨中心的批校正——多中心数据可比的最后一步。
- 工具:jump-profiling-recipe(orf.json/crispr.json 两套配置)——全链可复现,参数可调。
- Interpretable 分界:Harmony 之前的版本保留特征原始语义——官方据此发布 Interpretable 表;做可解释分析用它,做预测建模用处理后表。
§3.7 JUMP_rr 参考表族
- X_features.parquet:每个扰动「哪些特征把它与负对照区分开」的特征排名——特征归因的即食表。
- X_gallery.parquet:通道合并的图像可视化索引——快速浏览表型长相。
- X_cosinesim.parquet:同模态内(orf/crispr)扰动两两余弦相似度——连接性分析的现成矩阵。
- X_…significance…parquet:表型活性统计显著性(是否显著区别于负对照)——活性过滤的第一道闸。
- full vs 非 full:full 含全部数据点,非 full 为浏览器友好的高显著性子集——交互探索用非 full,正式分析用 full。
- 使用姿势:先用 significance 表过滤活性扰动,再进 cosinesim 做连接——两表组合能省掉自己重算的整个统计环节。
§3.8 对照体系的结构
- 负对照:DMSO(化合物板)/非靶向对照(CRISPR 板)/空载体(ORF 板)——归一化锚。
- 正对照(每板):8 个化合物——板质量监控(阳性孔有没有表型)。
- JUMP-Target 板:306 化合物 + 160 基因扰动——跨批次/跨数据集对齐锚;每批次随产。
- JUMP-MOA 板:90 化合物 × 4 重复、47 个 MOA 类——机制类聚类的方法学标定。
- 设计哲学:对照不是实验的附属品而是「可比性基础设施」——JUMP 把对照板制度化为跨数据集协议,这是它作为参照系的隐形护城河。
§3.9 获取实操:S3 选择性下载
# 1) 浏览目录结构(免费、无需凭证)
aws s3 ls --no-sign-request s3://cellpainting-gallery/cpg0016-jump/
aws s3 ls --no-sign-request s3://cellpainting-gallery/cpg0016-jump/source_4/
# 2) 按需下载图像(示例:ORF 图像,source_4)
aws s3 sync --no-sign-request \
s3://cellpainting-gallery/cpg0016-jump/source_4/images/ ./jump_images/
# 3) 下载孔级 profile(选 batch/plate 前缀,别全量)
aws s3 sync --no-sign-request \
s3://cellpainting-gallery/cpg0016-jump/source_4/workspace/profiles/ \
./jump_profiles/
# 4) CellProfiler 原始输出(sqlite,重算特征用)
aws s3 sync --no-sign-request \
s3://cellpainting-gallery/cpg0016-jump/source_13/workspace/backend/ \
./jump_backend/ --exclude "*" --include "*.sqlite"
- 成本纪律:整库数百 TB——先在 profiles/(GB 级)上完成可行性验证,再决定是否拉图像;
--dryrun先看清单再真下载。 - 镜像渠道:Zenodo 有 curation 子集(CC BY 4.0 标注)——小团队从 Zenodo 起步更快,全量研究再上 S3。
§3.10 元数据与 plate map 体系
- datasets repo:github.com/jump-cellpainting/datasets——plate map、化合物/基因映射、批次清单的权威源。
- JCP2022 主键:全库统一的扰动标识体系——跨 source/batch 连接 profile 的关键;引用数据时按此键回溯。
- 化合物结构映射:JUMP-Target/MOA 板结构公开;提名化合物结构部分受限——需要 QSAR/分子表示时先清点可获结构覆盖率。
- 版本意识:plate map 与 profile 表都在演进——记录下载日期与 commit hash,报告里注明数据快照版本。
§3.11 存储与计算规划
- 三级预算:profile 级研究 100GB 内可跑通全流程;图像级分析(单 source)按 TB 规划;全量复现按 250TB+ 对象存储规划。
- 计算形态:profile 分析单机即可;特征重提取与深度预训练需 GPU 集群——CellProfiler 部分是 CPU 密集、可大规模并行。
- 下载优化:S3 同区(同 region)下载免流量费——把计算环境开在与 bucket 同区(us-east-1)是隐形的大幅省钱动作。
- 数据组织建议:保持 source/batch/plate 原始层级不做重命名——脚本与社区代码都假设这一结构,重组目录=自找兼容性坑。
§3.11.1 工具链生态速查
| 工具/资源 | 维护方 | 用途 |
|---|---|---|
| jump-profiling-recipe | jump-cellpainting(GitHub) | 七步 profile 处理链(orf/crispr 配置) |
| CellProfiler + JUMP production pipeline | Broad Imaging Platform | 分割与特征提取(可重算) |
| JUMP_rr 参考表 | jump-cellpainting | 预计算特征排名/相似度/显著性 |
| datasets repo | jump-cellpainting | plate map 与元数据(版本权威源) |
| JUMP-CP Explorer | Ardigen/Broad | 在线可视化浏览 |
| JUMP hub | Broad | 文档、教程、工具索引 |
| Morphmap repo | jump-cellpainting | NM 2025 分析全代码(BSD-3) |
| Image-based profiling handbook | Broad | 从图像到 profile 的教程手册 |
- 使用顺序建议:hub(理解)→ datasets(元数据)→ profile 下载 → recipe(需要重处理时)→ rr 表(分析加速)——多数人只在第一与最后两环停留。
§3.11.2 计算:从单机到集群的三档配置
- 单机档(笔记本/工作站):profile 层分析(GB 级 parquet)——pandas/polars + 32GB 内存即可覆盖连接性、MOA、可视化。
- 单机+GPU 档:图像子集深度学习(单 source 数 TB)——本地磁盘 + 1-4 GPU,采样策略见 §4.5。
- 集群档:全库重分割/特征重提取/大规模预训练——S3 同区 + 对象存储直读 + 任务队列(CellProfiler CPU 集群 / GPU 训练集群)。
- 升级信号:当「下载等待 > 计算时间」时应迁移到云上计算(数据不动代码动);当「单机内存放不下特征矩阵」时引入分布式数据框(polars/dask/spark)。
§4 数据结构与处理实操
§4.0 下载与验证流程
- 流程:datasets repo 取 plate map → S3 按前缀列目录 → dryrun 确认清单 → sync 下载 → 校验(文件数/大小/抽查读图)。
- 验证三件套:①profile 表行数与 plate map 孔数对账;②抽查图像可读、5 通道齐全;③对照孔表型分布符合预期(负对照紧簇)。
- 失败模式:下载中断续传(sync 幂等可重跑)、通道文件缺失(重跑该 plate 前缀)、sqlite 损坏(backend 重下)。
§4.1 加载 profile 并做连接性查询的参考代码
# 孔级 profile 加载 + 余弦相似度近邻查询(sphering 后的表)
# 依赖:pandas, numpy, pyarrow
import pandas as pd
import numpy as np
# 1) 下载好的孔级 profile(示例:某 batch/plate 的归一化表)
df = pd.read_parquet("jump_profiles/normalized_plate.parquet")
# 2) 分离元数据与特征列
meta_cols = [c for c in df.columns if c.startswith("Metadata")]
feat_cols = [c for c in df.columns if c not in meta_cols]
M, F = df[meta_cols], df[feat_cols].values
# 3) L2 归一化后余弦相似度 = 点积
F_norm = F / (np.linalg.norm(F, axis=1, keepdims=True) + 1e-8)
# 4) 查询:与某个扰动 profile 最相似的 10 个扰动(同板内演示)
qid = 0
sims = F_norm @ F_norm[qid]
top = np.argsort(-sims)[1:11]
print(df.iloc[top][meta_cols + ["__sim"] if "__sim" in df else meta_cols])
# 正式分析建议直接用 JUMP_rr 的 X_cosinesim 表(全库级、预计算、口径统一)
- 代码说明:本例为板内演示——跨板/跨中心的正式连接性分析务必用七步处理链输出的 sphering+Harmony 表或 JUMP_rr 预计算矩阵,否则批效应会伪造「相似」。
§4.2 5 通道图像读取与伪彩合成的参考代码
# 5 通道 Cell Painting 图像读取与合成展示
# 通道语义:DNA/RNA/ER/AGP/Mito —— 不是 RGB 可见光颜色
import tifffile as tiff
import numpy as np
def load_sites(path_template):
"""按通道读入一个 site 的 5 张 TIFF,返回 (5, H, W)"""
chans = []
for c in ["DNA", "RNA", "ER", "AGP", "Mito"]: # 通道名以实际文件名为准
chans.append(tiff.imread(path_template.format(ch=c)))
return np.stack(chans)
def composite(img5, gain=(0.3, 0.3, 0.3, 0.3, 0.3)):
"""简单伪彩合成(社区惯例配色:DNA 蓝/ER 红/AGP 黄/Mito 绿/RNA 青)"""
H, W = img5.shape[1:]
rgb = np.zeros((H, W, 3), dtype=np.float32)
rgb[..., 2] += img5[0] * gain[0] # DNA -> 蓝
rgb[..., 1] += img5[4] * gain[4] # Mito -> 绿
rgb[..., 0] += img5[2] * gain[2] # ER -> 红
rgb[..., 1] += img5[1] * gain[1] * 0.5 + img5[3] * gain[3] * 0.5
return np.clip(rgb / max(gain), 0, 1)
- 红线:通道各自独立、动态范围互异——直接当 RGB 三通道读会得到无意义颜色;量化分析用原始单通道,合成图仅用于人眼展示。
- 归一化:每通道独立按百分位截断拉伸(如 0.1-99.9%)——跨通道统一拉伸会让弱通道不可见。
§4.2.1 五通道的染色与生物学语义对照
| 通道 | 染色对象 | 生物学读数 | 常见伪彩 |
|---|---|---|---|
| DNA | 核酸(Hoechst 类) | 核形态、数量、周期状态 | 蓝 |
| RNA | 核仁与胞质 RNA(SYTO14 类) | 转录活跃度、核仁形态 | 青 |
| ER | 内质网(ConA/WGA 类) | 内质网形态与应激 | 红 |
| AGP | 肌动蛋白/糖蛋白/质膜(phalloidin+WGA) | 细胞骨架、形态、黏附 | 黄 |
| Mito | 线粒体(MitoTracker 类) | 线粒体网络、膜电位相关形态 | 绿 |
- 读表要点:五通道是「一个扰动的五个生理侧面」——线粒体毒性看 Mito 通道、细胞骨架重塑看 AGP 通道;跨通道的组合形态才是完整表型。
- 剂量/时间提示:同一化合物不同浓度/时点的通道响应模式不同(如先 Mito 变化后 DNA 碎裂)——多时点 pilot(cpg0000)就是量化这种动力学的。
§4.2.2 图像规格与文件组织的实操细节
- 典型规格:高内涵共聚焦/宽场、20x 物镜、2048×2048 像素级、16-bit TIFF——不同 source 的仪器型号有差异(这正是 cpg0002 量化的对象)。
- 路径编码:
source/<类型>/workspace/<层级>/<batch>/<plate>/...——路径即元数据,别重命名层级目录。 - 文件量级:单 plate 图像数十 GB(384 孔×多 site×5 通道);先下载一个 plate 试跑再批量。
- 位深处理:16-bit 读入、避免过早转 8-bit——量化分析保留原始位深,展示时再压缩。
§4.3 单细胞与孔级聚合的实操要点
- 聚合函数:孔级均值是基线;中位数更稳(对分割异常细胞鲁棒);分位数特征(如面积 P90)保留分布信息。
- 聚合前过滤:分割置信度低、边缘触碰、过小/过大细胞先剔除——垃圾细胞进均值会污染孔级 profile。
- 细胞数下限:细胞数过少的孔(毒性/铺板失败)profile 噪声大——官方链里 cell count regression 缓解,自定义管线建议加最小细胞数闸(如 ≥50)。
- 复现建议:非特殊需求直接用官方孔级表——自己重聚合带来的「个性化噪声」会切断与社区结果的可比性。
§4.4 批效应诊断的最小流程
- 可视化:孔级 profile 做 UMAP——理想情况扰动成簇、批不分离;按 Metadata_Batch 着色看批聚拢程度。
- 量化:用 JUMP-Target 正对照(每批都有)计算同一化合物的批间 profile 距离——批校正前后的距离变化就是校正收益。
- 校正:Harmony/ sphering 按官方链;自定义方法以「Target 板对齐精度」为基准比较。
- 红线:不做批校正直接全库连接性分析 = 把技术差异当生物学发现——这是 JUMP 数据最常见的方法学事故。
§4.5 图像级深度学习的采样策略
- 别全量:800 万图 × 5 通道——预训练按 plate 采样(保持批内完整性)比全库随机采样更利于批结构学习。
- 弱标签结构:每图天然携带「扰动→孔→板」层级标签——对比学习用「同扰动不同 site 为正对」的构造直接可用。
- 通道策略:5 通道输入需要修改预训练骨干第一层——常见做法是每通道独立 stem 或线性投影到 3 通道;消融留好基线。
- 先 profile 后图像:建模路线建议先用 profile(GB 级)把管线跑通、基线立住,再上图像端到端——图像级实验的迭代成本高一个量级。
§4.6 与化合物结构的联表实操
- 可获性分层:JUMP-MOA/Target 板结构直接公开;cpg0016 全集化合物结构部分经联盟渠道(InChIKey 映射表)。
- 联表键:InChIKey / broad_sample ID——联表前先做键覆盖检查,报告结构覆盖率(多少扰动有分子表示)。
- 分子表示建议:QSAR/生成模型用 SMILES+描述符起步;图神经网络用键级结构;跨库(chebi/drugcentral)对照时以 InChIKey 为金键。
- 无结构的部分:结构未公开的扰动不等于无效数据——profile 本身仍可用(相似度/聚类),只是不能进分子模态。
§4.7 数据快照与可复现性记录
- 记录四要素:下载日期、S3 前缀清单(含版本目录)、profile 表头 hash、datasets repo commit。
- 引用快照:论文报告里注明「数据下载于 YYYY-MM,plate map commit XXX」——cpg0016 持续上传中,不同时点的「全集」内容不同。
- 重跑策略:处理链参数(sphering/Harmony 配置)与数据快照绑定存档——半年后复现靠这份绑定,不靠记忆。
§4.8 常见读取报错速查
- parquet 列缺失:管线版本差异——按表头重映射列名,别硬编码。
- TIFF 读入全黑:通道动态范围/位深问题——检查 dtype(uint16 常见)与百分位拉伸。
- sqlite 打不开:下载不完整——backend 前缀重下;用
sqlite3 .schema验完整性。 - S3 403:
--no-sign-request忘加或路径大小写错——cpg 前缀严格区分大小写。 - 内存爆:全库 profile 一次读入——按 Metadata_Source/Batch 分块流式处理。
§4.8.1 从原始输出重放处理链(进阶)
# 前提:已下载某 batch 的 CellProfiler backend(sqlite)与原图
# 1) 安装 recipe 工具链
git clone https://github.com/jump-cellpainting/jump-profiling-recipe.git
cd jump-profiling-recipe
conda env create -f environment.yml && conda activate jump-recipe
# 2) 用官方配置(orf.json / crispr.json)跑七步链
# 输入指向本地 backend/profiles 目录,输出归一化后的 profile
python run.py --config input/crispr.json --batch <batch_id>
- 何时需要重放:①需要自定义归一化锚点/特征选择策略;②官方表未覆盖的新 batch;③方法学研究(比较处理选项)。
- 对齐纪律:重放结果与官方表在同一子集上做sanity check(相关性/排序一致性)——对不齐说明配置漂移,先修配置再做下游。
- 配置存档:修改过的 json 随结果一起存档(§4.7 快照记录)——处理链的「代码即元数据」。
§4.8.2 深度特征替代 CellProfiler 特征的对接点
- 位置:把 §3.6 七步链中的「特征来源」从 CellProfiler 换成 CNN/ViT 嵌入——链的其余步骤(归一化/sphering/Harmony)原样保留。
- 理由:批校正环节与特征提取器无关——深度特征同样需要 sphering/Harmony 才能跨批可比;「深度模型不需要批校正」是常见误区。
- 验证锚不变:换特征后仍用 JUMP-Target 对齐精度与 MOA 分类做基准——官方两个锚是所有特征空间的公共裁判。
- 实践参考:社区(个锚是所有特征空间的公共裁判。
- 实践参考:社区(CytoImageNet、JUMP 基线模型等)已在做多通道骨干适配——起步先复现公、JUMP 基线模型等)已在做多通道骨干适配——起步先复现公开嵌入再自训。
§5 分析协议与使用建议
§5.1 表型活性判定协议
- 问题:一个扰动的 profile 与负对照差异多大才算「有表型(active)」?
- 官方口径:JUMP_rr 的 significance 表给出统计显著性(扰动 vs 负对照的可区分性)——直接用,别自造阈值。
- 稳健性三查:①多重复一致性(5 重复的 profile 相互邻近);②跨站一致性(多站点重复同向);③剂量-效应(若有多剂量数据)。
- 负结果的价值:判定 inactive 的扰动也是数据——它们构成负样本池(虚拟筛选的背景分布、模型的无表型对照)。
§5.2 连接性分析协议
- 输入:sphering+Harmony 处理后的孔级 profile(或 JUMP_rr cosinesim 表)。
- 模态内连接:化合物-化合物(MOA 归类)、基因-基因(功能模块)——同模态内余弦相似度是基线。
- 跨模态连接:化合物-基因(靶点去卷积)——注意方向性(ORF gain vs CRISPR loss 的表型不对称,先按方向建模)。
- 验证锚:JUMP-Target 的已知基因-化合物配对做召回评估——任何新连接性方法的硬指标。
- 报告规范:连接性结论必附「处理链版本+批校正配置+相似度度量」三要素——不可复现的连接等于没连。
- 规模提示:全库两两相似度是 136k×136k 量级——不要自己全量重算;JUMP_rr 的 cosinesim 表(或分模态子矩阵)是为此准备的。
§5.3 MOA 归类实操
- 参照集:JUMP-MOA 板(90 化合物、47 MOA 类、四重复)——类内紧、类间分的标定数据。
- 基线方法:query 化合物 profile 与 MOA 参照 profile 的最近类投票/类中心余弦。
- 提升方向:特征加权(X_features 排名特征)、跨站 profile 集成、深度特征替换 CellProfiler 特征。
- 评估:留一化合物交叉验证;报 per-MOA 类的命中率(长尾 MOA 类的样本量差异大)。
§5.4 虚拟筛选协议
- 正向筛选:给定目标表型(如某疾病相关基因扰动的 profile)——在 116k 化合物 profile 库里检索相似者,即「形态学虚拟筛选」。
- 反向筛选:给定化合物 profile——检索最相似的基因扰动,猜测机制/毒性靶点。
- Nature Methods 2025 示范:以「圆细胞(rounded cells)」表型做基因虚拟筛——表型定义→profile 检索→候选基因实验验证的完整闭环。
- 命中后动作:形态学命中只是假设生成——剂量确认、正交实验(转录/生化)验证是进入下游的门槛。
- 假阳性/假阴性的不对称:筛选场景中假阳性消耗验证资源、假阴性丢失机会——阈值设定应按下游验证产能校准,而非一味追求高召回。
§5.5 跨模态(影像↔转录)映射协议
- 数据基础:cpg0003-rosetta——同一扰动同时有 Cell Painting profile 与 L1000 转录 profile(28,000+ 基因/化合物)。
- 任务形态:①profile 翻译(影像特征→转录特征);②联合 embedding;③以一方为锚检索另一方。
- 基线与评估:线性映射(CCA/PLS)起步,深度模型对照;评估用留出扰动的最近邻恢复率。
- 应用出口:用形态学(快、便宜)预测转录效应(慢、贵)——「影像代理测定」的经济学逻辑。
§5.6 自监督预训练配方建议
- 数据采样:按 plate 组织批次——批内 site/细胞采样保持结构;跨批作为天然的「域」监督信号(或扰动不变性目标)。
- 任务构造:同孔不同 site 为正对(实例判别);同扰动跨站为正对(批不变性);5 通道随机丢弃(通道鲁棒性)。
- 规模阶梯:先用单 source/单 batch 子集跑通 recipe,再扩 cpg0016;profile 端对比学习(扰动级)与图像端(细胞/位 点级)可以双轨。
- 评测锚:下游固定三个锚任务——MOA 归类、JUMP-Target 连接性、跨模态 rosetta 映射;三个锚都不动的预训练改进大概率是伪改进。
§5.7 批效应/域自适应研究的实验设计
- 天然实验场:12 中心 = 12 个域;同一化合物跨站重复 = 配对样本——这是其他数据集给不了的受控设置。
- 任务定义:跨站 profile 对齐(同化合物跨站相似度提升);跨站分类迁移(在 A 站训练、B 站测)。
- 基线方法:Harmony(官方链)→ sphering → 深度域自适应方法——比较时统一用 Target 板对齐精度做硬指标。
- 陷阱:把「批校正后相似度普遍升高」当方法好——要看的是已知配对(Target 板)的恢复率,不是全局相似度的膨胀。
§5.8 单细胞异质性分析协议
- 动机:孔级均值掩盖细胞间异质性——同一扰动的「响应细胞 vs 不响应细胞」结构是均值看不见的。
- 数据:单细胞 profile(第三层级)——量级在十亿级,采样与分布式处理是前提。
- 典型分析:扰动后细胞亚群出现/消失(密度比);响应分数分布(而非均值);亚群与分割形态学的对应。
- 坑:单细胞特征的板效应同样存在——孔级校正策略不能直接套用到单细胞级,需在单细胞层重做归一化设计。
§5.9 结果报告的最小模板
## JUMP 数据使用报告(模板)
- 数据快照:cpg0016-jump,下载于 YYYY-MM;plate map commit <hash>
- 层级与范围:<profile(孔级) / 单细胞 / 图像>;source/batch 范围 <...>
- 处理链:jump-profiling-recipe <版本>,配置 <orf/crispr.json 修改项>;
Interpretable 或 Harmony 后表:<指明>
- 核心任务:<连接性 / MOA / 筛选 / 预训练>
- 验证锚:JUMP-Target 对齐精度 <值>;MOA 分类基线对比 <值>
- 局限:U2OS 单细胞系;结构覆盖率 <x>%;批校正残留效应 <描述>
- 模板价值:五要素强制把「数据版本-处理口径-验证锚」写进报告——这三件事是 JUMP 复现争议的全部来源。
§5.9.1 分析任务 × 工具速查表
| 任务 | 首选工具/数据 | 加速替代 |
|---|---|---|
| 活性判定 | JUMP_rr significance 表 | 自算(需 FDR 校正) |
| 连接性检索 | JUMP_rr cosinesim | 自算余弦(处理后 profile) |
| MOA 归类 | JUMP-MOA 板 + profile | 深度特征 + 分类器 |
| 跨模态映射 | cpg0003-rosetta | CCA/PLS 基线起步 |
| 批效应研究 | 全 source profile + Target 板 | cpg0002 仪器变体补充 |
| 图像探索 | JUMP-CP Explorer 在线 | X_gallery 表 |
| 特征归因 | X_features 排名 | SHAP 于下游模型 |
| 预训练 | cpg0016 图像采样 | profile 对比学习(轻量起步) |
- 读表建议:先走「首选」列(官方预计算路径最快);「替代」列是方法学研究的空间——两条路的分数可比性靠验证锚维持。
§5.9.2 与化合物结构模态的联合建模路线
- 路线一(简单联表):profile + 分子指纹(Morgan FP)双塔拼接——结构覆盖率内的回归/分类。
- 路线二(跨模态检索):分子空间检索最近邻 → 映射回 profile 空间——「结构相似 ⇒ 形态相似」假设的检验。
- 路线三(生成式):以目标 profile 为条件生成分子——形态学引导的分子生成,是 2024 起社区的前沿方向。
- 共同前提:结构覆盖审计(§4.6)——三路线全部依赖 InChIKey 联表,覆盖率决定结论的适用范围。
§6 坑点与常见错误
§6.1 坑点(Pitfalls)
坑点 1:全量下载幻觉
整库数百 TB——「先拉全量再说」的结果是磁盘爆炸与数周带宽。对策:profile 先行(GB 级验证),图像按 source/batch/plate 选择性 sync,--dryrun 先看清单。
坑点 2:通道当 RGB 读
5 通道是 DNA/RNA/ER/AGP/Mito 荧光、动态范围互异——直接按 RGB 读图得到无意义颜色与错误量化。对策:单通道处理、合成图仅展示(§4.2)。
坑点 3:跳过处理链用原始特征
未做 sphering/Harmony 的原始 profile 带着板效应与协方差扭曲——连接性结果主要由批效应驱动。对策:用官方七步链输出或 JUMP_rr 预计算表(§3.6)。
坑点 4:CRISPR「敲除」字面化
guide 池、部分蛋白残留、未编辑细胞——把 knockout 当 100% 功能丧失解释会高估表型。对策:按 knockdown 混合效果解读,重要结论配 ORF 方向交叉验证。
坑点 5:ORF/CRISPR 方向混连
gain-of-function 与 loss-of-function 表型不对称——跨方向直接算连接性产生伪配对。对策:按模态分层计算,跨模态连接显式标注方向假设。
坑点 6:化合物结构全覆盖假设
116k 化合物结构并非全部公开——结构可获性检查(§4.6)前置,否则分子模态实验半途搁浅。
坑点 7:忽略快照版本
cpg0016 持续上传——两个时点的「全集」内容不同,合作者间结果对不上。对策:报告绑定下载日期+plate map commit(§4.7)。
坑点 8:批校正后的过度自信
Harmony 后批间距离缩小≠生物学发现可信——以 JUMP-Target 已知配对恢复率为硬指标,全局相似度膨胀不是成功证据(§5.7)。
§6.2 分析失败案例复盘
案例一:跨中心「新发现」实为批效应
某分析在全库连接性中「发现」某化合物簇——复核发现该簇的成员全部来自同一 source 同一批次,簇内相似度由批效应贡献。
- 根因:跳过 sphering/Harmony,直接原始 profile 全库相似度。
- 对策:官方七步链 + JUMP-Target 对齐验证;按 Metadata_Batch 着色 UMAP 常规化检查(§4.4)。
案例二:RGB 读图的三个月弯路
团队把 5 通道文件按 RGB 顺序读入训练分类器,指标看似可用;换数据集后崩盘——通道顺序在不同 source 并不一致。
- 根因:把通道当颜色通道、假设顺序固定。
- 对策:按文件名/元数据解析通道语义(§4.2);单通道归一化后再组合。
案例三:细胞数混淆导致的「毒性明星」
某化合物 profile 与大量扰动相似,被误判为「广谱活性」——实为强烈毒性导致细胞数骤降,形状特征整体漂移。
- 根因:未做 cell count regression(或用了未回归的表)。
- 对策:七步链第 2 步不可省;同时监控每孔细胞数分布。
案例四:结构联表的静默丢失
QSAR 实验设计在 116k 化合物上,联表后发现训练集只有 40% 覆盖——其余化合物结构不可获,且样本偏向公开结构子集(选择偏倚)。
- 根因:结构可获性未前置评估。
- 对策:联表前做 InChIKey 覆盖审计;报告结构覆盖率;对覆盖偏倚做敏感性分析(§4.6)。
案例五:快照不一致的复现纠纷
两团队用同一方法得到不同排名——一方 2024 年下载、一方 2025 年下载,plate map 更新导致扰动集合不同。
- 根因:快照未绑定、未声明。
- 对策:报告绑定下载日期+commit(§4.7);合作前对齐快照。
案例六:MOA 分类的小类幻觉
47 个 MOA 类的分类报告整体 70%——细看长尾类(样本 2-3 个化合物)命中率近 0,整体分数被大类撑起。
- 根因:宏平均/微平均未区分,长尾类样本量不足。
- 对策:per-class 命中率并列报告;长尾类标注置信区间(§5.3)。
案例七:跨细胞系直接外推的审稿翻车
某方法在 JUMP(U2OS)上验证后宣称「适用于疾病细胞模型」,审稿人要求补 A549/cpg0000 交叉——结果跨系对齐精度大幅下降,结论被迫收窄。
- 根因:把「单细胞系内有效」说成「细胞形态通用」。
- 对策:跨系结论必须配跨系证据(cpg0000 的 A549/U2OS 对照是现成的检验集)。
案例八:化合物重复「聚不拢」的追查
某化合物 5 个重复的 profile 分散两处——一半在各站点、一半集中在同一板。追查发现该板存在孔位污染,阳性对照也异常。
-
根因:板级质量异常未被 QC 拦截。
-
对策:板级正对照检查前置(§6.3 清单第 2 项);异常板整板降权或剔除而非逐孔修补。
-
复盘共性:六起事故全部源自「跳过官方口径的某个环节」——JUMP 的方法学文档足够好,事故几乎总是没读或没照做。
§6.3 数据质量自检清单
-
[ ] plate map 与 profile 行数对账通过
-
[ ] 对照孔(正/负)齐全且正对照表型可检出
-
[ ] 每孔细胞数分布无异常断档
-
[ ] UMAP 按 batch 着色无严重聚拢(或已做批校正)
-
[ ] JUMP-Target 板内重复一致性达标
-
[ ] 特征列数与所选 profile 版本口径一致
-
[ ] 图像抽查:5 通道齐全、位深正确、非全黑全白
-
[ ] 快照信息(日期+commit)已记录
-
用法:每次引入新 batch/新 source 数据后跑一遍——八项全绿再进入正式分析,与官方质检思路同构。
§6.4 降维可视化的协议要点
- 顺序:先处理后可视化——sphering/Harmony 之前的 UMAP 主要展示批效应而非生物学。
- 方法选择:UMAP/t-SNE 做探索、PCA 做方差结构确认、不把任何降维图的「距离」当定量结论。
- 着色纪律:一次只按一个元数据维度着色(扰动类/批次/站点)——多维度混着色是自欺的高效手段。
- 样本量意识:全库 100 万+孔级 profile 的 UMAP 与 1 万子集的 UMAP 形态差异巨大——报告注明绘图样本量与采样方式。
§6.5 统计功效与多重检验
- 活性判定的多重性:136,000 种扰动逐一与对照比较——多重检验校正(FDR)是标配;JUMP_rr significance 表已按此口径计算,自算时别忘。
- 连接性的旋转谱:两两相似度矩阵的分布有结构(空转背景)——连接性排序的显著性评估要相对背景分布,而非绝对阈值。
- 重复数现实:化合物 5 重复、跨 2-4 站点;基因扰动重复结构不同——功效计算按实际重复设计,别套用均匀重复的公式。
- 效应量报告:除 p 值外报效应量(如与对照的距离 z 分数)——高通量数据里 p 值几乎永远显著,效应量才是筛选货币。
§6.6 「该问官方还是该问社区」的分流表
| 问题类型 | 去处 | 典型例子 |
|---|---|---|
| 数据bug/标签错误 | GitHub issue(datasets repo) | 某 plate 元数据错位 |
| 工具链问题 | recipe/VLMEvalKit 类 repo issue | 处理链报错 |
| 方法学讨论 | 论文通讯作者/社区(论坛、会议) | 连接性方法论 |
| 使用经验 | JUMP hub 文档 + 社区教程 | 下载策略 |
| 商业合作/结构获取 | 联盟官方渠道 | 化合物结构映射 |
- 分流原则:可复现的 bug 走 issue(附版本与复现步骤),开放问题走社区——把「这个数字怎么来的」发给 issue 区,通常不如先查论文方法节。
§6.7 剂量与时间维度:cpg0016 之外的扩展视角
- cpg0016 的设计取舍:主集以单浓度/标准时点为主换取化合物覆盖广度——广度换深度的取舍是理解 JUMP 数据结构的关键。
- 剂量维度在哪补:cpg0004-lincs(1,571 化合物 × 6 剂量,A549)与 cpg0010-caie(113 小分子 × 8 浓度,MCF-7)——剂量-响应形态学在 cpg 家族内有专集。
- 时间维度在哪补:cpg0000-jump-pilot 的两时间点设计——形态学动力学(早期应激 vs 晚期死亡)的量化起点。
- 分析含义:单浓度 hit 不等于治疗窗口——重要化合物结论应在剂量集上复核;把 cpg0016 当「广域初筛」,把剂量集当「纵深确认」。
§7 官方发现与数据解读
§7.1 基因形态学地图(Nature Methods 2025 核心发现)
- 覆盖:15,243 个基因(ORF 12,609 + CRISPR 7,975)的形态学 profile——约 75% 蛋白编码基因组的功能获得/丧失双侧地图。
- 方法学验证:论文系统评估了数据处理选项(七步链的每一步选择),以 JUMP-Target 与已知基因关系为锚验证 robustness——「怎么处理数据」本身是该论文的贡献之一。
- 生物学发现:profile 聚类揭示了此前未知的基因簇与功能关系——涉及线粒体功能、癌症、神经过程;知识图谱(DRKG、GO、WikiPathways)交叉验证支撑。
- 示例闭环:「圆细胞」表型的基因虚拟筛选——以表型 profile 检索候选基因并以实验验证,示范了从地图到假设再到实验的完整路径。
- 解读姿势:这些发现是「地图可用性」的证据而非终点——同一份地图上,社区完全可能发现论文未触及的簇与关系。
§7.1.1 基因簇发现的方法学解剖
- 流程:活性基因筛选(significance 表)→ profile 聚类(处理后特征空间)→ 簇的功能富集(GO/WikiPathways/DRKG 交叉)→ 未知簇的文献调查与实验验证。
- 可复用性:NM 2025 的全部分析代码开源(Morphmap repo,BSD-3)——把「基因」换成你关心的扰动集,同一流程可复用于子集研究。
- 知识图谱的角色:DRKG/GO 提供已知关系的「验证层」——形态学聚类的簇若与已知通路一致则增强信心,若不一致则要么是新发现要么是伪像,两条路都要查。
§7.1.2 从 profile 到假设的推理模板
- 模板一(机制猜测):未知化合物 X 的 profile 与已知 MOA 类 C 的中心相似——假设 X 通过 C 类机制作用;验证:定向生化/细胞实验。
- 模板二(基因-化合物配对):化合物 Y 与基因 G 的 CRISPR 扰动高连接——假设 Y 是 G 功能的抑制剂/模拟物;验证:Target 板复测、剂量响应。
- 模板三(功能注释):未知基因 H 的 ORF profile 落入线粒体功能簇——假设 H 参与线粒体组织;验证:共定位、功能读数。
- 共同纪律:每个模板的输出是「可证伪假设」而非结论——profile 是观察性相似,干预验证才是因果。
§7.2 表型活性与基因属性的关联
- 活性分布:并非所有扰动都产生可测表型——significant 表给出活性扰动子集;ORF 与 CRISPR 的活性率与活性强度分布不对称。
- 与基因属性的耦合:活性与基因表达水平、必需性(DepMap U2OS 数据)、蛋白复合物成员身份等属性相关——解释 profile 时叠加这些注释层。
- 实践含义:inactive 不等于「基因无用」——可能是表达量低、guide 效率低或 U2OS 语境下无形态输出;负结果的三种解释要在分析里区分。
§7.3 技术稳健性结论
- 跨站一致性:化合物多站点重复显示——七步链后,同一化合物跨站 profile 的相似度显著高于不同化合物——技术变异可校正、可对齐。
- 协议/仪器变异:cpg0001(协议变体)与 cpg0002(显微镜变体)量化了「测量的方法学容忍度」——Cell Painting v3 协议在这套生产体系下是可跨中心标准化的。
- 稳健性的边界条件:对齐精度的下限由最异质的 source 决定——跨中心结论按「最弱一环」报告而非平均。
- 对使用者的含义:官方已把「数据能不能信」的验证做了大半——使用者的责任是沿用同套处理链,而不是重新发明(重新发明往往把已校正的效应又引入回来)。
§7.4 与既有数据的兼容性
- cpg0012 对齐:30,616 化合物的历史数据用 JUMP 管线重处理——新老数据可对话,历史资产不浪费。
- rosetta 桥:CP↔L1000 联合 profile 让 JUMP 形态学结果可与 LINCS 转录宇宙互译——影像结论获得转录层面的交叉检验通道。
- 外部数据接入:联盟外新实验跑了 JUMP-Target 板即可对齐——JUMP 参照系的开放接口设计让「接入」成本是一次对照板实验。
§7.5 已知局限(官方声明+社区共识)
- 单细胞系:U2OS 主导——组织广度与原代细胞的外推有限;pilot 的 A549 变体只是起点。
- 「敲除」语义:CRISPR 的 knockdown 混合本质(见坑点 4)。
- 结构覆盖:化合物结构部分公开——分子模态覆盖不全。
- 形态学读数的边界:形态不等于一切生理效应——转录/代谢/功能层面未显形的扰动是形态学方法的盲区,跨模态(rosetta)互补是缓解而非消除。
- 时效:数据生产截至 2024——新化合物/新基因的覆盖以联盟后续更新为准。
§7.5.1 已知局限的应对策略映射
| 局限 | 影响半径 | 使用者侧的缓解 |
|---|---|---|
| 单细胞系(U2OS) | 外推到原代/疾病细胞 | cpg0000 跨系对照评估 + 自建目标细胞验证 |
| CRISPR≠纯敲除 | 基因功能解释 | ORF 方向交叉验证 + 互补敲除读数 |
| 结构覆盖不全 | 分子模态建模 | InChIKey 覆盖审计 + 无结构扰动单独分层 |
| 单浓度主设计 | 剂量/窗口判断 | cpg0004/cpg0010 剂量集复核 |
| 形态学盲区 | 非形态生理效应 | rosetta 转录对照 + 正交功能实验 |
| 批效应残留 | 跨中心结论 | Target 板对齐 + 敏感性分析 |
- 读表要点:每一行的缓解路径都有现成数据/工具支撑——JUMP 的局限是「被文档化的局限」,这比「未知的局限」可控得多;写论文的 limitations 节可直接按本表展开。
§8 应用场景与生态
§8.1 制药研发管线中的位置
- 命中发现:表型筛选(JUMP 参照+自家实验)替代/补充单靶点筛选——尤其适合「机制未知但表型明确」的疾病模型。
- 命中后去风险:候选化合物的 profile 与已知毒性/MOA 参照比对——早期毒性信号与机制猜测。
- 靶点发现:基因扰动地图(CRISPR/ORF)与疾病表型 profile 的连接性——「哪些基因的扰动模拟疾病/纠正疾病」的系统视角。
- 成本逻辑:一次 Cell Painting 实验的边际成本远低于一组组学实验——形态学作为「第一读数」进入管线,组学作为第二层验证。
- 与虚拟筛选(对接计算化学)的分工:结构虚拟筛选从分子出发、形态学筛选从表型出发——两者命中集的交集是最高置信候选,差集互为补充假设。
§8.2 机器学习研究的应用面
- 表示学习:细胞图像/孔级 profile 的自监督预训练——生物影像基础模型的标准训练域之一。
- 跨模态学习:图像↔profile↔分子结构的三模态对齐——rosetta 提供影像↔转录的监督信号。
- 因果/机制推断:扰动-表型的因果结构——JUMP 的干预性质(interventional)使它优于纯观察数据的因果研究素材。
- 不确定性估计:活性判定与连接性的置信度校准——高通量场景下的错误代价不对称(假阳性消耗验证资源、假阴性丢失命中)。
§8.3 学术研究的应用面
- 基因功能注释:未知基因按形态相似度归入功能社区——GO/WikiPathways 交叉验证(NM 2025 工作流可复用)。
- 疾病机制:疾病相关基因簇的形态学特征——细胞水平的疾病表型画像。
- 方法学论文:批校正、特征选择、活性判定——每个处理环节都是方法学论文的选题池。
§8.4 教学与培训
- 高内涵筛选课程:从 protocol 到 profile 的全链路文档(JUMP hub + handbook)是现成教材。
- 数据工程案例:250 TB 数据的分级获取、血缘管理、批效应治理——真实规模的数据工程教学案例。
- 练习设计:让学生用 profile 子集复现一个 MOA 分类基线——一次练习覆盖数据加载、批校正、相似度、评估全栈。
- 进阶作业:把学生分为「重放处理链」与「直接用官方表」两组对比结果——天然示范口径一致性的重要性。
§8.5 与本库相关篇目的组合用法
- lincs-l1000:rosetta 联合分析的转录侧入口——形态学结论在转录层的对照验证。
- chebi:化合物标识与结构参照——JUMP 化合物结构映射的补充词表。
- drugcomb:药物组合数据——JUMP 单药 profile 与组合协同研究的衔接。
- drugcentral:药物-靶点/适应症参照——连接性命中的临床转化背景板。
§8.6 选型决策树
需要细胞形态学数据?
├─ 做药物筛选/连接性/MOA → cpg0016 profile 层(GB 级起步)
│ └─ 需要转录对照 → + rosetta(cpg0003)
├─ 做图像深度学习/预训练 → 按需要选 source/batch 拉图像(TB 级)
├─ 研究批效应/跨中心 → cpg0016 全 source profile + cpg0002 仪器变体
├─ 染色/协议优化 → cpg0001 协议变体集
└─ 只想快速理解数据 → JUMP-CP Explorer 在线浏览 + JUMP_rr 非 full 表
- 决策要点:80% 的问题在 profile 层就能解决——图像层是重武器,先问「真的需要原始像素吗」。
§8.6.1 组合用法的两条进阶路线
- 形态学+临床数据路线:JUMP 基因扰动地图 ∩ 人群队列(GWAS/CHARLS 类)发现的疾病基因——把人群统计学的候选基因送到细胞形态层做机制注解。
- 形态学+文本路线:药物标签/文献提取的 MOA 描述与 JUMP-MOA 聚类对照——文本侧机制陈述与形态学侧聚类的语义对齐。
- 两条路线的共同点:JUMP 提供「干预+表型」的实证锚,外部数据提供「人群/语义」的关联面——锚与面的连接处就是新研究的空间。
§7.8.1 社区再利用图景:JUMP 作为基准平台
- 自监督基准化:Cell Painting 图像预训练的论文普遍把「JUMP 下游三锚」(MOA/Target/rosetta)当评测协议——数据集正在演化为该子领域的 GLUE。
- 批校正竞赛场:Harmony 之后的新方法(深度域自适应、最优传输类)以 JUMP 的多中心结构做真实难度测试。
- 生成模型素材:形态学条件生成(profile→image、profile→molecule)的新方向都以 JUMP 为训练池——条件信号的多样性(136k 扰动)是关键资产。
- 教学案例化:handbook + Morphmap repo + recipe 组合被多所高校采用为计算形态学课程骨架。
- 可视化教学素材:X_gallery 的通道合并图 + Explorer 的孔级浏览——无需任何本地环境即可展示「扰动让细胞长什么样」。
- 再利用的礼仪:基于 JUMP 的基准/工具发布时引用数据论文、公开数据处理快照——再利用生态的可持续性靠每一篇论文的规范引用维持。
§7.8.2 规模演化与未来覆盖
- 已完成:116k 化合物(5 重复、多站点)+ 15,243 基因(ORF+CRISPR)+ 三 pilot——原计划范围基本交付。
- 演化方向(联盟公开信息口径):数据持续上传补齐、处理链与参考表滚动更新、新 pilot(协议/仪器/细胞系变体)扩展稳健性边界。
- 社区期待的方向:更多细胞系/原代细胞、剂量-时间矩阵扩展、与功能读数(CRISPR 筛选生存/表达)的联合扰动集——这些在联盟路线图中被反复讨论。
- 使用者的姿态:把 JUMP 当「v1 参照系」——地图会继续加密度,方法与结论都要预留「地图更新」的接口。
§8.7 端到端案例:从数据到假设的完整工作流
- 问题设定:「我们有一个疾病相关基因 D,想找能模拟其敲除表型的化合物(潜在治疗)」——靶点模拟的经典形态学路线。
- 第 1 步(定位扰动):plate map 确认 D 的 CRISPR 扰动所在 batch/plate,下载该板 profile——小时级。
- 第 2 步(确认活性):D 敲除的 significance 与效应量——不 active 则换 ORF 侧或终止(负结果同样省下了湿实验预算)。
- 第 3 步(建立查询向量):D 敲除的孔级 profile(跨重复聚合)——查询锚。
- 第 4 步(全库检索):JUMP_rr cosinesim 或自算余弦——116k 化合物中检索 top-N 近邻——分钟级。
- 第 5 步(过滤与解释):去重化合物、叠加结构/已知活性注释(CheBI/drugcentral 联表)——候选从「相似」升级为「可解释」。
- 第 6 步(对齐验证):候选化合物跨站重复是否一致指向 D 敲除 profile——排除批效应假阳性。
- 第 7 步(输出假设清单):按相似度×可解释性×重复一致性排序的候选列表+每个候选的验证建议——交付湿实验团队。
- 总成本:纯计算侧 1-2 人周(含学习曲线)——对比湿实验从零筛 116k 化合物,这是 JUMP 杠杆的直观体现。
§8.8 中小团队的上手路径
- 第 1 周:读 hub 文档 + preprint——建立「层级/处理链/对照体系」三个心智模型。
- 第 2 周:下载单 plate profile + JUMP_rr 非 full 表,复现一个官方可视化/相似度查询。
- 第 3-4 周:跑 jump-profiling-recipe 于子集——亲手体验七步链每步的数据变化。
- 第 2 个月:把自家业务问题(筛选/分类/预训练)映射到 §8.6 决策树,产出 §5.9 模板的正式报告。
- 长期:订阅 datasets repo 更新;半年后用新快照复验核心结论——JUMP 是持续演化的活资源。
§9 许可、伦理与相关资源
§9.1 许可的双轨现实
- 官方主轨道(CC0):Nature Methods 2025 数据可用性声明明确「We have released the data with a CC0 license」——Cell Painting Gallery 上的 cpg0016 数据以 CC0(公共领域贡献)开放,无署名义务、无使用限制。
- curation 轨道(CC BY 4.0):Haibe-Kains 实验室发布的 Zenodo curation 版(JUMP_CPG 原始 5 通道文件整理版)标注 CC BY 4.0——该轨道附署名要求。
- 使用建议:从 AWS Gallery 下载按 CC0 对待(仍建议学术礼貌性引用论文);从 Zenodo curation 版下载按 CC BY 4.0 执行署名。两轨并存是「多渠道发布」的常态,别混用条款。
- 对复用者的意义:CC0 使 JUMP 可以被纳入商业产品、再分发管线与其他开放数据聚合(如 NLM Dataset Catalog 收录)而无需许可谈判——这是它作为公共底座的法律基础。
§9.2 知识产权与化合物结构
- 分层公开:JUMP-Target/MOA 板化合物结构公开;药企提名化合物结构部分经联盟渠道受限共享——结构是私有 IP 的最后阵地,形态学 profile 本身则全开放。
- 对使用者的红线:不要试图通过 profile 反推受限化合物身份并公开——这类「去匿名化」行为会破坏联盟的信任基础,进而威胁后续数据共享。
- 衍生数据的身份处理:基于 profile 聚类/重标注的衍生数据集发布时,保留 JCP2022 主键与血缘列——「可回溯」是联盟数据体系的生命线。
- 引用义务(学术礼貌层):CC0 不强制署名,但引用 Chandrasekaran 论文与 JUMP hub 是社区规范——数据生产者的持续投入依赖可被计量的学术影响。
§9.3 生物安全与伦理
- 细胞系属性:U2OS/A549 为商品化建系细胞——不涉及患者可识别信息,无 IRB 级伦理负担(这也是 CC0 全开放的前提条件之一)。
- 基因扰动数据的双用途考量:CRISPR/ORF 操作方案随论文公开——这些属于常规、低风险的细胞实验方案(BSL-1/2 级),但复现实验需在具备生物安全资质的实验室进行。
- 数据完整性责任:CC0 意味着无担保(as-is)——下游发现的科学/商业决策风险由使用者承担,重要结论应以独立实验验证。
- 细胞系溯源习惯:商品化细胞系存在交叉污染/错误鉴定风险——复现湿实验时使用 STR 认证细胞(数据本身的细胞系认证由生产方负责)。
§9.4 数据治理的工程侧
- 持久化承诺:AWS Registry of Open Data 的托管 + Broad 平台的维护——公共数据集的长期性比许可更稀缺,JUMP 在这两项上都有制度保障。
- 版本与变更:数据持续上传中——重大变更经 hub 与论文更新渠道公告;订阅 datasets repo 可追踪。
- 反馈渠道:数据质量问题经 GitHub issue 反馈——发现疑似标签错误/图像异常的合规动作是报告而非自行「修复再分发」。
§9.5 相关数据集对照
| 数据集 | 与 JUMP 的关系 | 组合用法 |
|---|---|---|
| LINCS L1000 | rosetta 桥接的转录侧 | 跨模态映射、形态结论转录验证 |
| cpg0012 (CDRP) | 历史化学 profiling 数据(已用 JUMP 管线重处理) | 化学覆盖的扩展池 |
| BBBC 系列 | 单点高内涵数据集家族 | 快速方法原型(小数据先行) |
| RxRx 系列 | 商业公司(Recursion)的影像扰动数据 | 预训练补充语料(许可更受限) |
| DepMap | U2OS 基因必需性/表达注释 | profile 解释的注释层 |
| ChEMBL/CheBI | 化合物结构与活性参照 | 分子模态的联表来源 |
- 组合要点:JUMP 做骨干、注释库做解释层、跨模态库做验证层——三层组合是当前影像药物发现研究的标准姿势。
§9.6 JUMP 与「公共数据集联盟」模式
- 模式要点:竞争前协作(pre-competitive)——药企贡献数据但不交出核心 IP(化合物结构分层);技术公司贡献标准;学术界贡献方法与验证。
- 先例与谱系:LINCS、MGH/HHMI 类联盟的公共数据模式 → JUMP 把该模式第一次做到 136k 扰动与 12 中心规模。
- 可复制性:其他领域(微生物组、临床影像)的联盟数据建设可直接套用 JUMP 的治理模板——提名-交换机制、对照板制度化、分层许可。
- 启示:JUMP 的真正产品不只是数据,还有「怎么共建数据」的操作系统——后者对国内医学数据共同体建设同样有参考价值。
§9.7 许可与合规快速问答
- 能商用吗?——CC0 轨道(AWS Gallery)可以;Zenodo curation 版(CC BY 4.0)商用+署名可行;化合物结构受限部分不随数据许可转移(IP 归属方保留权利)。
- 能再分发吗?——CC0 允许;但直接镜像整库不经济也不必要(AWS 免费且持久)——分发「衍生子集」时保留血缘元数据是社区规范。
- 要签协议吗?——AWS Open Data 免费无需注册签署;仅当申请受限化合物结构映射时走联盟协议流程。
- 发现数据错误怎么办?——GitHub issue 报告,勿自行修正后再分发——错误修正由生产方统一版本化。
- 用 JUMP 结果做产品宣称?——形态学命中是假设生成证据,不是临床/药效宣称的充分依据——合规与科学两层都要过。
§9.8 对国内高内涵生态的参考价值
- 联盟模板的借鉴:提名-交换机制(数据贡献与 IP 分层)、对照板制度化(跨机构对齐锚)、分级获取(profile 先行)——三件套可直接映射到多中心医学影像/表型数据共同体。
- 标准化先行:JUMP 的经验是「协议 v3 + 处理链 + 参考表」三件标准化产品先于数据规模——没有标准化的大数据只是大硬盘。
- 开放的双赢结构:药企交出的是「已发表论文级别的扰动 profile」,换回的是公共参照系的杠杆——这种交换结构在竞争前领域可复制。
§10 参考、引用与 FAQ
§10.1 官方资源导航
- JUMP Hub(文档总入口):broadinstitute.github.io/jump_hub——数据描述、教程、工具索引。
- Cell Painting Gallery(AWS):registry.opendata.aws/cellpainting-gallery——S3 免费托管,cpg0016-jump 前缀。
- datasets repo:github.com/jump-cellpainting/datasets——plate map 与元数据(版本追踪处)。
- jump-profiling-recipe:github.com/jump-cellpainting/jump-profiling-recipe——七步处理链代码与配置。
- 基因地图论文代码:github.com/jump-cellpainting/2025_Chandrasekaran_NatureMethods_Morphmap——NM 2025 全部图表复现代码(BSD-3)。
- JUMP-CP Explorer:phenaid.ardigen.com/jumpcpexplorer——在线可视化门户。
- Cell Painting 协议:Cimini et al., Nature Protocols 2023(v3);Bray et al., Nature Protocols 2016(v1/v2)。
- 数据论文:bioRxiv 10.1101/2023.03.23.534023(2023 preprint);Nature Methods 22:1742-1752(2025,DOI 10.1038/s41592-025-02753-9)。
- NLM 收录:Dataset Catalog 收录 Zenodo curation 版(CC BY 4.0 条目)——第三方目录索引与主渠道并存。
§10.2 学术引用
- Chandrasekaran SN, Ackerman J, Alix E, et al. JUMP Cell Painting dataset: morphological impact of 136,000 chemical and genetic perturbations. bioRxiv 2023.10.1101/2023.03.23.534023.
- Chandrasekaran SN, Alix E, Arevalo J, et al. Morphological map of under- and overexpression of genes in human cells. Nature Methods 22:1742-1752 (2025).(基因子集 Resource 论文)
- Cimini BA, et al. Optimizing the Cell Painting assay for image-based profiling. Nature Protocols (2023).(协议 v3)
- Bray MA, et al. Cell Painting, a high-content image-based assay for morphological profiling using multiplexed fluorescent dyes. Nature Protocols 11:1757-1774 (2016).(协议原始版)
- Haghighi M, et al. Simultaneous profiling of 28,000+ genes and compounds with Cell Painting and L1000 (rosetta).(cpg0003)
- Way GP, et al. Morphology and gene expression profiling provide complementary information for mapping cell state. Cell Syst (2022).(cpg0004-lincs,形态↔转录互补)
- Tromans-Coia C, Jamali N, et al. (cpg0002-jump-scope) Imaging protocol and microscope variation quantification.(2023)
§10.3 站内互链
- lincs-l1000:rosetta 跨模态的转录侧入口
- chebi:化合物结构与标识参照
- drugcomb:药物组合与协同语境
- drugcentral:药物-靶点与适应症参照
- 境
- drugcentral:药物-靶点与适应症参照
- drug-reviews-uci:药物评论文本侧参照
- brax / bimcv-covi:药物评论文本侧参照
- brax / bimcv-covid:胸片域数据集对照(多中心与许可差异参照)
§10.4 建议引用格式
@article{chandrasekaran2025morphmap,
title = {Morphological map of under- and overexpression of genes in human cells},
author = {Chandrasekaran, Srinivas Niranj and Alix, Eric and Arevalo, John and others},
journal = {Nature Methods},
volume = {22},
pages = {1742--1752},
year = {2025},
doi = {10.1038/s41592-025-02753-9}
}
§10.5 术语表
| 术语 | 释义 |
|---|---|
| JUMP-CP | Joint Undertaking for Morphological Profiling——形态学画像联合体(联盟名) |
| Cell Painting | 5 通道荧光染色的高内涵表型测定(DNA/RNA/ER/AGP/Mito) |
| cpg | Cell Painting Gallery——AWS 上的数据总库;cpg0016 为主 JUMP 数据集 |
| source | 数据生成中心编号(source_4=Broad 等) |
| ORF | 开放阅读框过表达——gain-of-function 基因扰动 |
| CRISPR knockout | guide 池基因敲除——loss-of-function(实为 knockdown 混合) |
| profile | 扰动后细胞的特征向量(单细胞或孔级) |
| sphering | 球形化/白化变换——让相似度计算不被特征协方差扭曲 |
| Harmony | 跨批次/跨中心批校正算法(处理链最后一步) |
| Interpretable | 批校正前、特征名保留原始语义的 profile 版本 |
| JUMP_rr | 官方预计算参考表族(特征排名/相似度/显著性) |
| connectivity | 扰动间 profile 相似度——机制同路的量化指标 |
| JUMP-Target | 306 化合物+160 基因的正对照板(跨数据集对齐锚) |
| JUMP-MOA | 90 化合物 47 机制类的方法标定板 |
| well / site / channel | 孔/成像视野/荧光通道——成像三层级 |
| plate map | 孔位到扰动的映射表 |
| rosetta | CP 与 L1000 联合 profiling 的桥接数据集(cpg0003) |
| MOA | Mechanism of Action——化合物作用机制类别 |
| DepMap | 基因必需性/表达注释库(profile 解释层) |
| CC0 | 公共领域贡献许可——JUMP 官方数据许可 |
§10.6 常见问题 FAQ
Q1:我只想试试 JUMP,最小下载方案是什么?
A:三步——①datasets repo 拿 plate map;②S3 下载某个 source 的 workspace/profiles 子集(GB 级);③配 JUMP_rr 非 full 表做探索。全程不必碰 TB 级图像。
Q2:116,750 还是 116,000+?115 TB 还是 250 TB?
A:preprint(2023)写 116,750 化合物与约 115 TB 的估计;实际生产与 gallery 页口径是 116,000+ 化合物、总量超 250 TB。引用对齐最新正式来源;两套数字并存是「估计 vs 实际」的关系。
Q3:图像必须是 5 通道一起用吗?能不能只用 DNA 通道?
A:技术上可以,但会丢掉大部分表型信息——Cell Painting 的区分力来自通道组合(核+膜+线粒体等的联合形态)。单通道只适合特定问题(如核形态计数);正式 profile 一律 5 通道。
Q4:CC0 是不是意味着我可以不引用论文?
A:法律上可以,社区规范上不可以——引用是联盟持续运转的燃料(资助方看学术影响)。从 Zenodo curation 版拿数据则必须按 CC BY 4.0 署名。
Q5:为什么我的连接性结果和别人的对不上?
A:按序三查——①数据快照是否一致(下载日期/plate map commit);②处理链口径(Interpretable vs Harmony 后表、sphering 参数);③批校正配置。三者任一不同,连接性排序就可能大幅变动(§5.9 模板把这些写进报告)。
Q6:能用自己的显微镜/协议数据对齐 JUMP 吗?
A:可以——这正是 JUMP-Target 板的设计用途:在你的实验里跑同一块 Target 板(306 化合物),用板内 profile 做对齐,再与 JUMP 参照比较。协议细节见 hub 文档。
Q7:CRISPR 和 ORF 结果冲突时信哪个?
A:先别「信」——方向不同(loss vs gain)本就可能不对称;重叠的约 5k 基因恰是研究「功能获得/丧失差异」的素材。结论按方向分别陈述,冲突本身是发现线索。
Q8:做深度学习该用 CellProfiler 特征还是深度特征?
A:官方 profile 是 CellProfiler 特征(Interpretable/处理链配套);深度特征可自提但需重做批校正与验证。务实路线:先在官方 profile 上立基线,深度特征作为改进对照——两者报告并列。
Q9:数据会更新吗?怎么追踪?
A:会——cpg0016 持续上传、处理链与参考表滚动更新。追踪 channels:GitHub(datasets/recipe repos)、JUMP hub 公告、论文更新。引用时绑定快照日期(§4.7)。
Q10:250 TB 我下载不起,有替代路线吗?
A:有——①Zenodo curation 子集(较小);②云上计算(AWS 同区免流量费,数据不动代码动);③JUMP-CP Explorer 在线浏览;④只下 profile 层。多数研究问题不需要把图像搬到本地。
Q11:我自己的 Cell Painting 实验怎么接入 JUMP 参照系?
A:三要件——①用 Cell Painting v3 协议(Cimini 2023);②实验中跑 JUMP-Target 正对照板(306 化合物);③用官方七步链处理。Target 板是你的数据与 JUMP 参照的「插座」——板数据对齐后,你的 profile 即可与 136k 扰动同空间比较。
Q12:profile 的特征维度到底是多少?为什么不同论文写的不一样?
A:取决于管线版本与处理阶段——原始 CellProfiler 特征约 1,800 维量级,特征选择后约 600-1,500 维(依版本),sphering/Harmony 不改变维度。引用时注明「哪一版处理的表」;跨论文比较用官方当期口径。
Q13:负对照孔(DMSO)本身也要做多样性分析吗?
A:值得——DMSO 孔的 profile 分布宽度就是「无表型噪声的地板」,你的扰动效应量要跟这个地板比;官方 significance 表的内建逻辑正是如此。自算时保留 DMSO 分布的描述统计进报告。
Q14:为什么我的连接性 top 命中全是同一 batch 的?
A:典型批效应残留——同批孔的 profile 相似度天然偏高。检查是否用了未批校正的表;用 JUMP_rr(官方已处理)或在自算中确认 Harmony 步骤生效;再把跨批命中比例作为质量指标监控。
Q15:能在 JUMP 上做时间序列/纵向建模吗?
A:主集是标准时点的快照——纵向建模需要 cpg0000 两时间点或外部剂量-时间数据;把快照 profile 当「轨迹」解释是超范围使用,论文里会被抓。
§10.7 全文要点回顾
- 一个定位:136,000 种化学与遗传扰动的形态学公共参照系——CC0、12 中心、超 15 亿细胞。
- 一条主线:从图像(5 通道)到 profile(七步链)到连接性(相似度/对照板)——每层都有官方工具,沿用即可站上巨人的肩膀。
- 三个数字:116k 化合物、15,243 基因、250+ TB——规模本身就是护城河。
- 三条纪律:按需下载(别全量)、批校正必做(用 Target 板验证)、快照版本绑定(引用可复现)。
- 三个锚任务:MOA 归类、JUMP-Target 连接性、rosetta 跨模态——任何方法学改进在这三个锚上自证。
- 两个方向的扩展:剂量/时间纵深(cpg0004/cpg0000)与跨模态(rosetta→转录、结构→分子)——主集是广场,扩展集是纵深。
- 一个提醒:形态学 hit 是假设生成的起点,不是终点——从 profile 到临床之间还隔着完整的验证链。
(全文完;本文共 §0-§10 十一个章节,规模数字以 Nature Methods 2025 论文、JUMP Hub 与 Cell Painting Gallery 官方口径为准,发表年 2023/2025。)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- zinc — 共享标签:药物发现与化学 / 化学信息学 / 虚拟筛选
- drugcentral — 共享标签:药物发现与化学 / 化学信息学 / 虚拟筛选
- drugbank — 共享标签:药物发现与化学 / 化学信息学 / 虚拟筛选
- hmdb — 共享标签:药物发现与化学 / 化学信息学 / 基因组学与多组学
- bbbc — 共享标签:药物发现与化学 / 医学影像 / 虚拟筛选
- tox21 — 共享标签:药物发现与化学 / 化学信息学 / 虚拟筛选
- binding-moad — 共享标签:药物发现与化学 / 化学信息学 / 基因组学与多组学
- lincs-l1000 — 共享标签:药物发现与化学 / 化学信息学 / 基因组学与多组学
- depmap-ccle — 共享标签:药物发现与化学 / 虚拟筛选 / 基因组学与多组学
- chembl — 共享标签:药物发现与化学 / 化学信息学 / 虚拟筛选
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

