信息速览
INFOBOX:lightmycells2 速览
| 字段 | 值 |
|---|---|
| 数据集 | Light My Cells 2 Training Database |
| slug | lightmycells2(GC 子域即 slug) |
| 主办 | France BioImaging(ANR-10-INBS-04)——国家基础设施主办(本库首个) |
| 平台 | Grand Challenge——挑战赛平台本库首接入(531-535 五连开篇) |
| 规模 | 76 studies / >150,000 images(训练集);前作 LMC1 数据库 2,574 sets/56,984 图(增量 2.5×研究/2.6×图) |
| 任务 | Task 1:2D 透射光→4 细胞器 best-focused 荧光;Task 2(新):z-stack→荧光 MIP |
| 输入模态 | BF(明场)/PC(相衬)/DIC(差分干涉衬度)——无标记透射光三模态 |
| 预测目标 | nucleus/mitochondria/tubulin/actin 四细胞器荧光(cytoplasm 第 5 通道为孤证存照) |
| 评估 | **SSIM+PCC(at least)**跨细胞器平均排名;Bonus 5 项含碳足迹(全库首见) |
| 时间线 | 验证 2026-09-21~11-30(≤5 提交)/ 评估 12-01~13(1 提交)/ 结果 12-18 |
| 论文 | Submitted to ISBI 2027(投稿中);前作数据库论文 Scientific Data 2026 已发表 |
| 前作开放 | LMC1 数据库 S-BIAD1047 / CC BY 4.0 / OME-TIFF / REMBI / Zenodo 双 DOI |
| 数据获取 | 挑战期注册墙(Google Docs 数据文档需登录)——LMC2 本体暂无公开归档 |
| 异质性轴 | 放大倍率/数值孔径/采集站点/焦位 + 通道不完整可用性(sparse output 设计) |
| 一句话 | 法国 23 站点联手的 in-silico labeling 二代基准——数据论文先行+挑战赛引流的第三种发布形态 |
§0 摘要卡:挑战赛开篇与 in-silico labeling 的法国收束
§0.1 它是什么
Light My Cells 2 是 France BioImaging(法国国家生物成像基础设施)在 Grand Challenge 平台上主办的第二届 in-silico labeling 数据机器学习竞赛(2026):参赛者从无标记透射光显微图像(BF/PC/DIC 三模态)预测四种细胞器荧光(细胞核/线粒体/微管/肌动蛋白)——Task 1 预测最佳焦面(单帧进四通道出),Task 2 从透射光 z-stack 预测荧光 MIP(本届新增)。训练集 76 studies 超 150,000 张图,是前作 LMC1 数据库(2,574 sets/56,984 图,Scientific Data 2026 正式发表,CC BY 4.0)的 2.5 倍研究数扩容。评估用 SSIM+PCC 跨细胞器平均排名,并设碳足迹等五项 Bonus。已投稿 ISBI 2027。
§0.2 三个数字
- 76 / 30:LMC2 训练集 vs LMC1 数据库的研究数——2.5 倍扩容;图数 >150,000 vs 56,984 ≈ 2.6 倍——"additional training data"从口号落到量级
- 4+1:4 细胞器荧光通道 + 1 个孤证通道(FBI 总览页的 cytoplasm——GC 正式口径不含)——跨页文案漂移的第一现场
- 5+1:验证期 ≤5 次测试提交 + 评估期 1 次最终提交——挑战赛的信息经济学设计(防测试集过拟合的提交配额)
§0.3 它怎么用
三大用途:①in-silico labeling 模型训练——配对透射光/荧光直接监督(LMC1 数据库 CC BY 4.0 部分已可即用);②跨设施泛化基准——多站点/多设备/多模态异质性是官方设计目标;③metadata-aware 方法研究——官方鼓励把采集元数据喂进模型。不适合:细胞分割/计数(通道是荧光强度图非实例标签)、临床诊断(细胞系非患者组织)、z 轴三维重建(任务是 MIP 投影非体素重建)。
§0.4 联动提示
本条是Grand Challenge 五连开篇(531-535:LightMyCells 2/TopBrain 2026/CHIMERA/autoPET V/Owl)——挑战赛平台页面结构与 PhysioNet 单页文档完全不同,本条目同时承担新平台核查模板的建立任务(模板存照见 §1.3 与附录 O)。与 530(MICCAI 论文先行)、529(Sci Data 悬空)构成发布节奏第三形态:数据库论文先行(2026-03 发表)+ 挑战赛引流(2026-09 开赛)+ 会议论文投稿中(ISBI 2027)——三线并进。
§1 条目定位:Grand Challenge 平台首接入与任务谱系扩展
§1.1 挑战赛数据 vs 静态库——第五类数据形态
本库此前四类数据形态:观测采集(530 影像)/ 登记队列(EHR)/ 合成数据(527/526)/ 文本标注(561)。LMC2 是第五类:benchmark 竞技型数据——它的核心属性不是"数据本身"而是"评估协议":①指标即任务定义(SSIM+PCC 的平均排名就是任务的全部输出约束);②注册墙动态锁定(训练集注册可取、测试集完全不可见——与 PhysioNet 的 DUA 静态开放是两种信任模型);③提交配额(5+1 次提交是防 leaderboard 过拟合的制度设计);④赛后开放节奏(挑战期数据不归档,LMC1 先例是赛后 2 年发 Scientific Data + BioImage Archive)。引用与复用这类数据时,"数据集"与"竞赛"是同一实体的两个面——本条目两者都覆盖。
§1.2 in-silico labeling 八年脉络的收束
GC 页与 LMC1 论文共同给出的先行谱系:In Silico Labelling(Christiansen et al., Cell 2018——zebrafish/人类蛋白定位,三透射光模态同款)→ DeepHCS(2021,多任务对抗式高内涵筛选)→ Label-free Cell Painting(2022)→ JUMP-CP(更大规模 Cell Painting 公共库)→ LMC1(2024 挑战/2026 数据库——多站点多模态标准化开放基准)→ LMC2(2026——MIP 任务与元数据感知)。LMC 系的差异化卡位:Cell Painting 系基于固定染料组合的高内涵成像(荧光侧是"配方"),LMC 系基于真实多设施透射光/荧光配对采集(荧光侧是"实测")——前人被批"固定图幅/非标准格式/多样性不足",LMC 用 23 站点联邦的异质性回应。
§1.3 Grand Challenge 平台核查模板(本条目建立,五连复用)
GC 平台与 PhysioNet 的结构性差异及对应核查动作(模板 v1.0):
| 维度 | PhysioNet | Grand Challenge | 核查动作 |
|---|---|---|---|
| 页面形态 | 单一长页(Data Description 论文式) | 静态页极简(2-3 节)+文档跨站分布 | 主页/主办方官网/数据文档/官方 listing 四信源并行 |
| 数据本体 | 页面即数据描述+归档 DOI | 挑战期注册墙,赛后才归档 | 找前作 DOI(LMC1 的 Zenodo/S-BIAD1047)作基线锚 |
| 版本管理 | v1.0.0 锁版本+版本史 | 无版本概念(届/challenge 代际) | 用"届"对齐(LMC1 2024→LMC2 2026) |
| 规模口径 | 页面自洽(train/test 可加和) | 多信源各执一词 | 跨源交叉+漂移存照(本条 cytoplasm/56,984 等三处) |
| 伦理合规 | IRB/DUA 明文 | 细胞系/公开数据为主,伦理页常缺 | 按数据类型重估(勿套医院库模板) |
| 论文出口 | 页面引用区直接给 | "Submitted to XXX"投稿状态+前作已发表 | 区分"已接收/投稿中/数据论文/挑战报告"四种状态 |
——本模板在 532-535 连续校准后于附录 O 定稿。
§2 双任务解剖:best-focused 与 MIP 的不对称设计
§2.1 Task 1:站在 LMC1 肩膀上的主任务
Task 1(“predict the best-focused output-images of four fluorescently labelled organelles from label-free 2D transmitted light input-images”)与 LMC1 主任务同构——单帧透射光进、四通道最佳焦面荧光出。它的技术难点被 LMC1 论文的预处理声明反衬:“Transmitted light z-stacks were preserved in full, while fluorescence channels were reduced to their best-focus plane”——训练对的荧光侧已经是策展过的最佳焦面(人工/算法选焦的 ground truth),模型要学会的是"在任意焦位的透射光输入下,预测对焦后的荧光样貌"。LMC1 时代的评估延伸到焦点偏差 0-5 档(4×5 或 4×6 矩阵——历史页内漂移存照),LMC2 页面未明说是否延续——复现者应以 GC 平台实际评估脚本为准。
§2.2 Task 2:MIP——为 z-stack 保留埋的伏笔
Task 2(“predict the MIP output-images of four fluorescently labelled organelles from a stack of 2D input-images”)是本届新增:透射光 z-stack 进、荧光最大强度投影出。它的精妙在于与 LMC1 数据库设计的咬合——透射光侧全 stack 保留正是任务 2 的输入资产(若当年把透射光也降维到最佳焦面,任务 2 将无米下锅)。MIP 的生物学动机:荧光采集中 3D 结构的 MIP 是标准浏览视图(2D 呈现 3D 信息),预测 MIP 而非全 volume 是"信息密度/任务难度/评估可行性"的折中。缺口存照:荧光侧 MIP ground truth 的 stack 范围与焦面数未披露——复现者需等待赛后数据归档验证。
§2.3 评估协议:平均排名与五项 Bonus
排名规则"averaging metric-specific ranks across all organelles"——rank-based 而非绝对分数制:每个指标×每个细胞器独立排名后取平均。含义:①跨年可比性弱(排名依赖当年参赛池——LMC2 榜单数字不能与 LMC1 直接对比);②防单指标过拟合(SSIM 高分但 PCC 崩的模型无法登顶)。Bonus 五项(代码质量与可访问性/轻量模型/训练推理效率/metadata-aware 策略/碳足迹评估)把"模型好不好"扩展为"方法可不可以被社区用"——碳足迹进入官方评分表是本库条目中首次出现(AI 可持续性从论文倡议变成竞赛计分项)。
§2.4 提交配额的信息经济学
验证期 ≤5 次测试提交+评估期 1 次最终提交——与 Kaggle 式竞赛同构的制度设计:测试集标签完全不可见,配额限制对测试分布的梯度探测。对照静态库(如 530 的 test 2,077 图直接随库发布)——两种防过拟合哲学:PhysioNet 靠"数据给你、论文评审你",GC 靠"数据锁住、排名审计你"。研究者选择时需要明白:静态库的 SOTA 可复现可挑战,挑战赛的榜单成绩不可完全复现(测试集永不下发)。
§3 数据解剖:LMC1 数据库基线与 LMC2 增量
§3.1 前作数据库的精确规模(引用锚点)
LMC1 数据库(Scientific Data 2026,s41597-026-07004-w)的核心数字:2,574 acquisition sets / 56,984 张 2D 显微图像 / 30 independent studies / 8 国家成像中心。每张透射光图(BF/PC/DIC 之一)至少配一张荧光图(四细胞器之一)。全部 OME-TIFF 标准化 + REMBI 指南元数据 + FAIR 原则。托管于 EMBL-EBI BioImage Archive(accession S-BIAD1047,Release 2025-02-26),许可 CC BY 4.0——开放获取。注意数字漂移:EBI 摘要页写 56,981 vs 论文 56,984——3 张之差(与 530 的 10,466/10,468 同款形态),引用注明口径。
§3.2 LMC2 的增量换算
LMC2 训练集(FBI 新闻口径):76 studies / more than 150,000 images。换算增量:
| 维度 | LMC1 数据库 | LMC2 训练集 | 增量倍数 |
|---|---|---|---|
| studies | 30 | 76 | 2.53× |
| 图像 | 56,984 | >150,000 | ≈2.63× |
| acquisition sets | 2,574 | 未披露 | — |
| 成像中心 | 8 | 未披露(FBI 全网 23 站点为池) | — |
| 任务 | best-focused 单任务 | +MIP 双任务 | 任务维度扩容 |
——"additional training data"的量级就此落定:LMC2 不是小修小补,是数据库体量的倍增。acquisition sets/中心数未披露构成缺口(挑战期数据未归档的连带后果)。
§3.3 细胞系资产(LMC1 扫描,LMC2 延续)
BioImage Archive S-BIAD1047 的样本扫描:HeLa H2B-GFP(Lleres et al., JCB 2009 稳转组蛋白株)/ HeLa Shaffner / HeLa Vienna(GFP-α-tubulin + mCherry-H2B 双标,from Daniel Gerlich, IMBA Vienna)/ Human Prostate Cancer(“High morphology variability in the same plate”——同板高形态变异是有意为之的难例设计)。细胞核通道的 GFP-H2B 株是配对采集的主力(核荧光可直接 GFP 实测),线粒体/微管/肌动蛋白各有专染。伦理特征:公开细胞系+非患者组织——无 IRB/DUA 声明(页面无),伦理评估走"细胞系合规"轴而非"人体受试者"轴——与医院库(528/529/530)完全不同的合规形态。
§3.4 格式与元数据:REMBI+OME-TIFF 的基准级规格
LMC1 论文的标准化三件套:①OME-TIFF(开源软件兼容+FAIR);②REMBI 指南(Recommended Metadata for Biological Images——生物成像元数据的事实标准);③统一文件命名+维度协调管线。两阶段采集协议:先 45 份社区调研问卷(设施工程师/分析师/研究者)探需求与技术约束 → 标准化采集协议 → 8 中心实施。这套"问卷驱动设计+协议统一实施"是基础设施级数据生产的教科书流程(对照单院数据集的采集流程——528/529 的单点采集 vs FBI 的联邦式生产)。
§4 前作论文深读:Scientific Data 2026 的数据库叙事
§4.1 数据论文的关键声明
- 卡位声明:“no open-access dataset to date has combined the level of heterogeneity, paired imaging modalities, and standardized metadata provided by the Light My Cells Database”——异质性×配对×标准化的三元组卡位(对照 JUMP-CP 更大但单模态配对)
- 预处理三动作:维度协调(dimensional harmonization)/最佳焦面提取(best-focus plane selection)/文件命名统一——透射光 z-stack 全保留(Task 2 伏笔,见 §2.2)
- 贡献机构:28 共同作者全国协作;通讯 Emmanuel Faure(LIRMM ICAR 团队,emmanuel.faure@lirmm.fr);LIRMM 机构新闻确认 Dorian Kauffmann 在 LIRMM 完成该工作(Faure/Gay 联合指导)
- 资助:ANR-10-INBS-04(法国国家基础设施项目——France BioImaging 的 ANR 编号)
§4.2 与挑战赛的双轨关系
LMC1 挑战赛(ISBI 2024,Athens)→ 数据库论文(Scientific Data 2026-03)——挑战在前、数据论文在后、间隔两年。这个节奏的启示:挑战赛是数据生产的"压力测试"(参赛者会暴露数据问题),论文是"终审档案"(把挑战经验沉淀为可引用资源)。LMC2 现在的位置:挑战开赛(2026-09)+数据库论文已发表(LMC1)+挑战报告投稿中(ISBI 2027)——三线并进:数据库线(LMC1 已发表)/竞赛线(LMC2 进行中)/方法论文线(ISBI 2027 投稿)。引用者必须分清三线:引数据用 LMC1 论文,引挑战结果等 LMC2 挑战报告,引方法等 ISBI。
§4.3 "45 份问卷"的社区驱动设计
LMC1 论文披露的设计起点是全网调研:45 份回复(设施工程师为主,含博后/博士)→ 揭示 FBI 平台间在细胞类型/透射光模态/标记策略上的巨大异质性 → 收敛共识:"live mammalian monolayer cultures imaged simultaneously in transmitted light and fluorescence"是稳健可行的起点 → 3D 系统(类器官)被点名 desirable 但因技术异质性太大被否——负结果决策存照:类器官不做是数据集边界的主动划定(复现者勿期待 3D 数据)。
§5 先行方法谱系与 LMC 的差异化卡位
§5.1 谱系表(GC 页+LMC1 论文合并)
| 方法/库 | 年份 | 输入 | 核心局限(LMC 视角) |
|---|---|---|---|
| In Silico Labelling(Christiansen, Cell) | 2018 | 三透射光模态 | 非标准数据格式阻碍复用 |
| DeepHCS | 2021 | 仅 BF | 固定图幅+特定染料 |
| Label-free Cell Prediction | 2022 | BF | 成像条件/生物模型多样性不足 |
| JUMP-CP | 2022 | BF(Cell Painting 配方) | 规模大但非真实配对采集 |
| LMC1 数据库 | 2024/2026 | BF+PC+DIC | ——多站点异质性+OME-TIFF+REMBI |
| LMC2 挑战 | 2026 | 同上+z-stack | ——MIP 任务+metadata-aware 官方化 |
§5.2 差异化的三层含义
①模态层:LMC 是唯一把 PC/DIC 全纳入的三模态库(先行者多为 BF-only)——相衬与 DIC 的光學伪影特征是独立的学习信号;②生产层:23 站点联邦式采集 vs 单实验室数据——异质性从"噪声"升级为"设计目标";③治理层:OME-TIFF+REMBI+CC BY 4.0+BioImage Archive 的全开放规格 vs 先行者的非标准格式/受限访问——AI-Ready 的格式分就是这么挣的(DAIMS 格式 8 分的依据)。
§5.3 任务谱系扩展(本库视角)
本库任务谱系此前覆盖:分类(528 密度分级)/检测(530 病灶框)/分割(隐含)/文本生成(527 报告解析)。LMC2 补上image-to-image 翻译/跨模态生成(透射光→荧光)——生成式任务的回归目标不是标签而是实测配对图像(ground truth=荧光真实采集,无人工标注偏差——DAIMS 标注维给 8 分的理由:“配对实测金标”)。
§6 团队与基础设施:国家联邦的生产模式
§6.1 核心六人组(ISBI 2024 listing 存照)
| 人名 | 角色 | 机构 |
|---|---|---|
| Dorian Kauffmann | 挑战项目工程师(LMC1/2 执行) | France BioImaging / LIRMM |
| Emmanuel Faure | CNRS 研究员 & FBI.data 任务官(LMC1 通讯) | CNRS-UM / LIRMM ICAR |
| Guillaume Gay | FBI.data 研究工程师 | FBI / LIRMM |
| Edouard Bertrand | FBI 科学主任 | FBI |
| Thomas Walter | Mines Paris 教授 & CBIO 主任 | Mines Paris / CBIO |
| Christophe Zimmer | 研究主任 | Institut Pasteur |
——LMC2 挑战经理层在 FBI 官网公开:Emmanuel Faure(challenges project manager)+ Dorian Kauffmann(coordinator)——两届连续执掌。
§6.2 France BioImaging 的联邦结构
FBI 联合 23 个成像采集站点遍布法国(LMC1 数据来自 8 个中心:Montpellier CRBM/CBS/IGMM/IGH、Toulouse CBI-TRI/LITC、Marseille IBDM、Gustave Roussy PFIC、Rennes IGDR、Strasbourg IGBMC、Genethon ImCy、Paris CRSA、Bordeaux BIC 等)。“The high variability of the database is possible thanks to the structuring role of the France-Bioimaging infrastructure”——异质性是制度产物:单一实验室永远造不出 8 中心×多设备×多协议的方差,联邦式基础设施可以。这是 LMC 与一切单点数据集(含 VinDr 三兄弟的双院)的规格代差。
§6.3 落地生态承诺
LMC1 Zenodo 文档承诺:最佳开源方法集成进 BioImage Model Zoo(预训练模型仓)与 Napari(开源可视化分析)——挑战产出不止于榜单,还要进生物学家的工作流。对照医院数据集(产出的模型进放射科 PACS)——两类落地路径不同但"数据→模型→工具→用户"的闭环意识一致。
§7 使用指南:怎么参赛与怎么用已有数据
§7.1 参赛路径(LMC2 挑战期)
①注册:GC 平台注册+挑战报名(lightmycells2.grand-challenge.org——注册后解锁训练数据下载与 Google Docs 数据文档);②开发:76 studies 训练集(含透射光 z-stack 与荧光配对)+ 元数据;③验证期(2026-09-21~11-30):≤5 次测试提交,验证算法与提交流程;④评估期(12-01~13):1 次最终提交;⑤结果:12-18 公布(rank 平均+Bonus 综合评奖)。
§7.2 不参赛的用法(赛后/基线)
- 现在就能用:LMC1 数据库(S-BIAD1047,CC BY 4.0)——56,984 图配对+REMBI 元数据,in-silico labeling 基线训练/预训练/域适应的现成弹药;
- 赛后:LMC2 数据预计走 LMC1 路径(BioImage Archive 归档+数据库论文更新或挑战报告)——当前 LMC2 本体无公开 DOI,引用挑战页+LMC1 论文双锚;
- 代码基线:LMC1 挑战的开源方法(BioImage Model Zoo 收录)可作为 LMC2 Task 1 的起点。
§7.3 引用模板速记
挑战赛:Light My Cells 2 Challenge, France BioImaging. lightmycells2.grand-challenge.org(2026,Submitted to ISBI 2027)。数据库:Kauffmann D. et al. (2026). 2D Multimodal Image Collection for Fluorescence Prediction from Transmitted Light Microscopy. Scientific Data. DOI 10.1038/s41597-026-07004-w. 数据存档 S-BIAD1047 / Zenodo 10.5281/zenodo.10687568。
§8 批评视角与库内对照
§8.1 批评视角:挑战赛数据的先天短板
- 注册墙的双刃:挑战期注册墙保护测试集但也阻断复现——想引用 LMC2 数据做独立验证的研究者只能等赛后归档(LMC1 等了 2 年);对照 530(模型代码划分全公开即时可验)——开放速度是挑战赛模式的代价。
- 指标未锁定:“at least SSIM+PCC”——最终指标集可扩充,赛前任何复现都可能因指标变更失效。
- 测试集永不下发:榜单成绩不可独立复现(提交配额+黑盒评估)——科学审计只能依赖主办方赛后披露。
- 跨页文案漂移:cytoplasm 通道/time-series 任务/4×6 矩阵三处——挑战赛文档的分布式维护(GC 页/FBI 官网/新闻稿各自成文)天然放大口径风险——引用前必须以 GC 平台页为最终口径。
- 规模口径:>150,000 是"images"总数(含透射光+荧光两侧多通道)——非独立场景数;acquisition sets 未披露使 LMC2 无法与 LMC1 的 2,574 sets 直接对比。
§8.2 库内对照:三种发布形态的完成度
| 条目 | 论文出口 | 数据开放 | 模型公开 | 形态 |
|---|---|---|---|---|
| 530 VinDr-SpineXR | MICCAI 2021 已接收 | Restricted(DUA) | 代码+模型+划分 | 论文先行 |
| 529 VinDr-PCXR | arXiv 悬空(Sci Data 4 年) | Restricted | 无 | 悬空 |
| 531 LMC2 | 数据库论文已发表(LMC1)+挑战报告投稿中(ISBI 2027) | 前作 CC BY 4.0 / 现作注册墙 | 预计进 Model Zoo | 数据库先行+挑战引流 |
| 528 TN-Mammo | 无(代码先行) | Restricted(未发布) | GitHub 代码 | 代码先行 |
——LMC2 的"数据库先行"形态的独特优势:挑战未结束,数据资产已可引用(LMC1 论文)——引用者永远有锚。劣势:本届数据的最终规模/格式需等赛后归档确认。
§8.3 与库内显微/细胞数据的合流点
LMC2 的透射光→荧光配对与库内"病理图像"类目(显微形态学)天然相邻:细胞分割/计数类数据集可直接用 LMC 的荧光通道做分割标注源(荧光通道即分子级 ground truth);in-silico labeling 模型输出的"虚拟染色"图可用于病理 AI 的数据增广。若后续入库细胞分割类挑战(如 Cell Tracking Challenge 谱系),LMC 条目将是对标框架的母版。
§9 使用指南补充:复现者的操作清单
§9.1 基于 LMC1 数据库的即刻复现
①下载 S-BIAD1047(BioImage Archive,CC BY 4.0——无注册门槛);②读 REMBI 元数据(采集设备/模态/细胞系/放大倍率全字段);③按 study 切分(30 studies——站点排除法复现:留一个中心做测试);④baseline 用 In Silico Labelling 式 UNet 或 BioImage Model Zoo 现成模型;⑤指标 SSIM+PCC(四通道分别报告——官方平均排名无法复现自私人数据,但通道级分数可对比)。
§9.2 LMC2 参赛者的差异准备
①z-stack 输入管线(Task 2 需要 3D-aware 架构或 stack 聚合策略);②metadata-aware 特征(放大倍率/NA/模态/站点进模型——官方 Bonus 点名);③稀疏输出损失(incomplete channel availability——部分样本缺通道的设计要求专门的 loss/masking);④轻量化(Bonus 指向小模型+短训练——边缘部署友好的设计导向)。
§9.3 时间线备忘
| 时点 | 事件 |
|---|---|
| 2024 | LMC1 挑战赛(ISBI 2024,Athens) |
| 2024-02 | LMC1 挑战文档 Zenodo 挂载(10.5281/zenodo.10687568/569) |
| 2025-02-26 | LMC1 数据库 S-BIAD1047 Release(BioImage Archive) |
| 2026-03 | LMC1 数据库论文发表(Scientific Data,s41597-026-07004-w) |
| 2026-09 | LMC2 训练数据开放(注册)+ 挑战报名 |
| 2026-09-21 ~ 11-30 | LMC2 验证期(≤5 次提交) |
| 2026-12-01 ~ 13 | LMC2 评估期(1 次提交) |
| 2026-12-18 | LMC2 结果公布 |
| 2027 | ISBI 2027(LMC2 挑战报告投稿目标) |
§10 FAQ:速查索引(按主题分组)
FAQ-1 基础认知(7 问)
Q:Light My Cells 2 是什么?
A:France BioImaging 主办的第二届 in-silico labeling 数据挑战赛(Grand Challenge 平台,2026):从无标记透射光显微图(BF/PC/DIC)预测四种细胞器荧光(细胞核/线粒体/微管/肌动蛋白)。训练集 76 studies 超 150,000 张图。
Q:in-silico labeling 是什么?
A:计算荧光标记:用深度学习从无标记透射光图像恢复荧光信息——省去化学标记的成本/光毒性/光漂白,保留透射光的无创长时程活细胞成像优势。先行脉络 In Silico Labelling(Cell 2018)→ DeepHCS 2021 → Cell Painting 2022 → LMC 2024/2026。
Q:与前作 LMC1 的区别?
A:①训练数据 2.5 倍研究数扩容(76 vs 30 studies,图数 ≈2.6 倍);②新增 Task 2(z-stack→荧光 MIP 预测);③metadata-aware 训练策略官方化(Bonus 计分项)。
Q:这份数据无患者,伦理规格怎么看?
A:细胞系数据(HeLa 系/前列腺癌细胞系等公开细胞系),无人体受试者——无 IRB/DUA 声明属正常,伦理评估走细胞系合规轴(对照医院库的 IRB 轴完全不同)。
Q:数据开放吗?
A:分两代:LMC1 数据库已全开放(BioImage Archive S-BIAD1047,CC BY 4.0,56,984 图);LMC2 挑战期注册墙(注册后下载,无公开 DOI)——赛后预计走 LMC1 路径归档。
Q:为什么值得做这个任务?
A:荧光标记昂贵/耗时/光毒性/光漂白/染料细胞毒性;透射光无创但缺分子特异性——in-silico labeling 用 AI 桥接:无创采集+计算恢复分子信息,官方动机原文三连(costly/time-consuming/potentially perturb)。
Q:LMC2 的最终产出是什么?
A:①榜单排名(跨细胞器平均 rank)+五项 Bonus 评奖;②开源方法进 BioImage Model Zoo/Napari;③挑战报告投稿 ISBI 2027(Submitted 状态)。
FAQ-2 任务与评估(6 问)
Q:Task 1 和 Task 2 的输入输出?
A:Task 1:单帧 2D 透射光→4 细胞器最佳焦面荧光(LMC1 同构);Task 2(新):透射光 z-stack→4 细胞器荧光 MIP(最大强度投影)。
Q:评估指标是什么?
A:至少 SSIM+PCC(‘at least’ 开口——可扩充);最终排名=指标×细胞器的平均 rank(rank-based 非绝对分制——跨年榜单不可直接比)。
Q:五项 Bonus 是什么?
A:①代码质量与可访问性 ②轻量模型 ③训练推理效率 ④metadata-aware 训练策略 ⑤碳足迹评估与削减——AI 效率与可持续性进入官方计分(全库首见碳足迹评分)。
Q:提交次数限制?
A:验证期(2026-09-21~11-30)≤5 次测试提交;评估期(12-01~13)1 次最终提交;结果 12-18 公布——配额制防测试分布探测。
Q:测试集可见吗?
A:永不下发(黑盒评估)——与 PhysioNet 静态库(test 随库发布)是两种防过拟合哲学:GC 靠’数据锁住+排名审计’,静态库靠’数据给你+论文评审你’。
Q:metadata-aware 训练为什么被官方鼓励?
A:训练数据的异质性轴明列:放大倍率/数值孔径/采集站点/焦位+通道不完整——把采集元数据喂进模型是应对异质性的官方背书路线(Bonus 计分项之一)。
FAQ-3 数据细节(6 问)
Q:训练集规模到底是多少?
A:76 studies / >150,000 images(FBI 新闻口径)——注意 >150,000 是透射光+荧光两侧多通道全图口径,非独立场景数;acquisition sets 数未披露(缺口)。
Q:LMC1 数据库的精确规模?
A:2,574 acquisition sets / 56,984 张 2D 图(论文口径)/ 30 studies / 8 国家成像中心。EBI 摘要页写 56,981——数字漂移存照(差 3 张),引用注明口径。
Q:数据什么格式?
A:LMC1:OME-TIFF+REMBI 元数据+统一命名(FAIR);LMC2 未明示格式(合理推断延续 LMC1 标准——缺口存照)。透射光 z-stack 全保留,荧光通道在 LMC1 中降为最佳焦面。
Q:有哪些细胞系?
A:HeLa H2B-GFP(Lleres 2009 稳转)/ HeLa Shaffner / HeLa Vienna(GFP-α-tubulin+mCherry-H2B,Gerlich IMBA)/ Human Prostate Cancer(同板高形态变异难例设计)等。
Q:四个荧光通道对应什么染料?
A:细胞核(GFP-H2B 组蛋白株等)/线粒体/微管(GFP-α-tubulin)/肌动蛋白——各细胞系携带不同荧光标记实现配对实测。cytoplasm 第 5 通道仅 FBI 总览页孤证(GC 正式口径 4 通道)。
Q:数据从哪些设备采集?
A:8 个 LMC1 中心的多厂商设备(Montpellier/Toulouse/Marseille/Gustave Roussy/Rennes/Strasbourg/Genethon/Paris/Bordeaux 等 FBI 节点)——放大倍率/NA/设备型号的异质性是官方设计目标(REMBI 元数据全记录)。
FAQ-4 参与与引用(4 问)
Q:怎么参赛?
A:GC 平台注册+挑战报名(lightmycells2.grand-challenge.org)→ 下载训练数据 → 验证期 ≤5 次提交 → 评估期 1 次。挑战经理:Emmanuel Faure / Dorian Kauffmann(FBI 官网公开联系方式)。
Q:怎么引用?
A:三线分开:①挑战赛引 GC 页(lightmycells2.grand-challenge.org,2026,Submitted to ISBI 2027);②数据引 LMC1 论文(Scientific Data 2026,DOI 10.1038/s41597-026-07004-w)+S-BIAD1047;③挑战文档引 Zenodo 10.5281/zenodo.10687568/569。
Q:不参赛怎么用这批数据?
A:立即:LMC1 数据库全开放(CC BY 4.0)可作基线训练/预训练/域适应;赛后:LMC2 归档后接续。代码基线看 BioImage Model Zoo 收录的 LMC1 方法。
Q:‘Submitted to ISBI 2027’ 是什么状态?
A:投稿中非已接收(2026-09 时点)——引用只能写’Submitted to’;挑战报告接收后方法/结果的正式学术出口才落定。
(FAQ 合计 23 问)
§11 事实清单:逐条存照
每条均有信源锚点;编号供批评视角与后续核查引用。
- LMC2 主办方为 France BioImaging(FBI,ANR-10-INBS-04 资助)——GC 页 ‘organized by France BioImaging’ + FBI 官网挑战总览。
- 挑战平台为 Grand Challenge(DIAG Nijmegen),子域 lightmycells2.grand-challenge.org——子域名与批次清单 slug lightmycells2 一致。
- 页面顶部横幅 ‘Submitted to ISBI 2027’(2026-09 核查时点)——投稿中非已接收。
- Task 1 原文:predict the best-focused output-images of four fluorescently labelled organelles from label-free 2D transmitted light input-images(FBI 描述页+GC 页一致)。
- Task 2 原文:predict the MIP output-images of four fluorescently labelled organelles from a stack of 2D input-images of label-free transmitted light(FBI 描述页+GC 页一致)。
- 四细胞器清单:nucleus/mitochondria/tubulin/actin——GC 页、FBI 描述页、Euro-BioImaging 新闻三源一致。
- 输入三模态:bright-field (BF)/phase contrast (PC)/differential interference contrast (DIC)——四源一致。
- 训练集规模:76 studies / more than 150 000 images——FBI 新闻页(France-BioImaging 与 Euro-BioImaging 双站同文)。
- LMC1 数据库规模:2,574 acquisition sets / 56,984 images / 30 studies / 8 centers——Scientific Data 2026 论文(s41597-026-07004-w)摘要。
- 数字漂移存照:EBI S-BIAD1047 摘要页写 56,981 images vs 论文 56,984——3 张之差(与 530 的 10,466/10,468 同形态)。
- LMC1 数据库托管:BioImage Archive accession S-BIAD1047,Release 2025-02-26,License CC BY 4.0。
- LMC1 挑战文档 Zenodo:DOI 10.5281/zenodo.10687568 与 10.5281/zenodo.10687569(2024-02 挂载)。
- 跨页矛盾①:FBI challenge 总览页写 LMC2 ‘introduces a cytoplasm channel’——GC 页/描述页/新闻页均只列 4 细胞器——孤证存照。
- 跨页矛盾②:FBI 总览页写任务 2 ‘whether time-series transmitted-light images can improve fluorescence prediction’——GC 正式口径为 MIP 任务。
- LMC1 历史矛盾③:LMC1 GC 页 ‘(0 to 5) deviations’(=4×6 矩阵)vs ISBI 2024 官方摘要 ‘4x5 metrics matrix’——历史页内漂移。
- 评估指标:at least SSIM and PCC——GC 页 ‘at least’ 开口(指标集未锁定)。
- 排名规则:averaging metric-specific ranks across all organelles(GC 页,‘As in the first edition’)。
- Bonus 五项:code quality and accessibility / lightweight models / efficient training and inference times / metadata-aware training strategy / carbon footprint(GC 页原文全录)。
- 验证期 2026-09-21~11-30 ≤5 次提交;评估期 12-01~13 一次最终提交;结果 2026-12-18 公布——FBI/Euro-BioImaging 新闻双源。
- LMC1 论文预处理声明:Transmitted light z-stacks were preserved in full, while fluorescence channels were reduced to their best-focus plane——Task 2 的输入侧伏笔。
- 异质性轴:magnification/numerical aperture/acquisition site/focal position+incomplete channel availability——GC 页明列。
- 社区驱动设计:45 份调研问卷(设施工程师为主)——LMC1 论文 Community-Driven Design 节。
- FBI 联邦:23 个成像采集站点遍布法国;LMC1 数据来自 8 个国家成像中心——Zenodo 文档+LMC1 论文。
- 核心团队 6 人(ISBI 2024 listing):Kauffmann/Faure/Gay/Bertrand/Walter/Zimmer;LMC1 论文 28 共同作者,通讯 Faure(LIRMM ICAR)。
- 先行方法批判(LMC1 论文):DeepHCS 固定图幅+特定染料 / In Silico Labelling 非标准格式 / Cell Painting 多样性不足 / JUMP-CP 规模大但非真实配对。
- 集成承诺:最佳开源方法进 BioImage Model Zoo 与 Napari——LMC1 Zenodo 文档。
- 细胞系存照(S-BIAD1047 扫描):HeLa H2B-GFP(Lleres JCB 2009)/ HeLa Shaffner / HeLa Vienna(GFP-α-tubulin+mCherry-H2B,Gerlich IMBA)/ Human Prostate Cancer(同板高形态变异)。
- 伦理形态:公开细胞系+非患者组织——无 IRB/DUA 声明(页面无)——细胞系合规轴。
- 挑战期数据访问:注册墙(‘You can register to access the training data’)+Google Docs 数据文档需登录(fetch 失败存照)——LMC2 本体无公开 DOI。
- 卡位声明:no open-access dataset to date has combined the level of heterogeneity, paired imaging modalities, and standardized metadata(LMC1 论文)。
- 负结果决策:类器官 3D 成像 desirable 但因技术异质性太大不纳入——LMC1 论文(数据边界主动划定)。
- 两阶段采集协议:先调研+探索性采集 → 标准化协议 → 8 中心实施——LMC1 论文 Data collection 节。
(事实合计 32 条)
§12 术语表:三十二条
| In-silico labeling | 计算荧光标记——从无标记透射光图像用深度学习恢复荧光信息(本挑战的核心任务范式)。 |
| Transmitted light | 透射光显微术统称:光从样品下方透射成像,无标记/无创/适合活细胞长时程。 |
| BF(Bright Field) | 明场——最基础的透射光模态,样品吸收/散射光成像。 |
| PC(Phase Contrast) | 相衬——将相位差转为振幅差,透明样品无需染色即可见(Zernike 1934,诺贝尔奖)。 |
| DIC(Differential Interference Contrast) | 差分干涉衬度——偏振光剪切干涉成像,伪 3D 浮雕感,分辨率高。 |
| MIP(Maximum Intensity Projection) | 最大强度投影——z-stack 沿 z 轴取最大值压缩为 2D,荧光 3D 数据的标准浏览视图。Task 2 的输出形态。 |
| Z-stack | z 轴堆栈——同一视场不同焦面的一系列 2D 图。LMC 透射光侧全 stack 保留。 |
| Best-focus plane | 最佳焦面——z-stack 中对焦最准的一帧;LMC1 荧光侧降维到该平面作 ground truth。 |
| Nucleus | 细胞核——LMC 四细胞器之一(荧光核标记主力:GFP-H2B 组蛋白稳转株)。 |
| Mitochondria | 线粒体——LMC 四细胞器之一。 |
| Tubulin | 微管——LMC 四细胞器之一(GFP-α-tubulin 株)。 |
| Actin | 肌动蛋白——LMC 四细胞器之一(细胞骨架应力纤维标记)。 |
| Cytoplasm(孤证) | 细胞质——FBI 总览页提及的第 5 通道,GC 正式口径不含——跨页漂移存照。 |
| OME-TIFF | Open Microscopy Environment TIFF——显微图像开放标准格式(多通道/多平面+元数据内嵌)。 |
| REMBI | Recommended Metadata for Biological Images——生物成像元数据指南(BioImage Archive 推行)。 |
| FAIR | Findable/Accessible/Interoperable/Reusable——数据管理四原则,OME-TIFF+REMBI 是其落地。 |
| BioImage Archive | EMBL-EBI 的生物图像公共仓(LMC1 数据库存放地,accession S-BIAD1047)。 |
| Grand Challenge | grand-challenge.org——DIAG Nijmegen 运营的医学影像挑战赛平台(GC),本条目为其库内首接入。 |
| France BioImaging(FBI) | 法国国家生物成像基础设施(ANR-10-INBS-04),联合 23 个成像站点——LMC 系主办方。 |
| LIRMM / ICAR | 蒙彼利埃大学 CNRS 实验室/图像与交互团队——通讯作者 Faure 与执行者 Kauffmann 所在。 |
| Rank-based ranking | 排名平均制——每指标×每细胞器独立排名后取平均;跨年榜单不可直接比。 |
| SSIM | 结构相似性——图像质量指标(亮度/对比/结构三分量),LMC 评估指标之一。 |
| PCC | Pearson 相关系数——像素级线性相关,荧光预测的强度保真指标。 |
| Carbon footprint bonus | 碳足迹加分——AI 能耗/排放的评估与削减计入竞赛评分(全库首见)。 |
| Metadata-aware training | 元数据感知训练——把放大倍率/NA/站点/模态等采集元数据喂进模型应对异质性(官方 Bonus 点名)。 |
| Incomplete channel availability | 通道不完整可用性——训练样本不总含全部 4 荧光通道,要求 sparse output 损失/masking 设计。 |
| Site hold-out | 站点排除法——完整采集站点留作最终评估(LMC1 泛化性硬核验设计;LMC2 是否延续未声明)。 |
| BioImage Model Zoo | 预训练生物成像模型仓——LMC 承诺的赢家方法落地处。 |
| Napari | 开源多维图像查看/分析工具(Python 生态)——LMC 承诺的另一个落地端。 |
| JUMP-CP | JUMP Cell Painting 公共库——更大规模的 Cell Painting 资源(LMC 卡位对照物)。 |
| Cell Painting | 细胞绘画——固定染料组合的高内涵荧光成像范式(LMC 的’真实配对采集’与之相对)。 |
| Submission quota | 提交配额——验证期 ≤5 次+评估期 1 次的制度设计(防测试分布梯度探测)。 |
(术语表合计 32 条)
附录 A:30 秒速查卡
| 维度 | 一行答案 |
|---|---|
| 是什么 | France BioImaging 的第二届 in-silico labeling 挑战赛——从无标记透射光预测四细胞器荧光 |
| 在哪 | Grand Challenge 平台:lightmycells2.grand-challenge.org(本库 GC 五连第一发) |
| 怎么拿 | 挑战期注册墙(注册后下载);前作 LMC1 数据库已全开放(S-BIAD1047,CC BY 4.0) |
| 多大 | 训练集 76 studies / >150,000 图(全图口径);LMC1 基线 2,574 sets / 56,984 图 |
| 任务 1 | 2D 透射光(BF/PC/DIC)→ 4 细胞器最佳焦面荧光 |
| 任务 2(新) | 透射光 z-stack → 4 细胞器荧光 MIP(最大强度投影) |
| 预测目标 | nucleus / mitochondria / tubulin / actin(cytoplasm 第 5 通道为孤证) |
| 评估 | SSIM+PCC(at least)跨细胞器平均排名 + 五项 Bonus(含碳足迹) |
| 时间线 | 验证 2026-09-21~11-30(≤5 提交)/ 评估 12-01~13(1 提交)/ 结果 12-18 |
| 论文 | LMC1 数据库论文已发表(Scientific Data 2026);LMC2 挑战报告投稿 ISBI 2027 |
| 谁主办 | France BioImaging(ANR-10-INBS-04,23 站点联邦)——国家基础设施主办 |
| 核心团队 | Kauffmann / Faure / Gay / Bertrand / Walter / Zimmer(LMC1 六人,两届连续) |
| 格式 | OME-TIFF + REMBI 元数据(LMC1 口径;LMC2 未明示——合理推断延续) |
| 三处漂移 | cytoplasm 通道孤证 / time-series vs MIP / LMC1 的 4×6 vs 4×5——跨页文案漂移存照 |
| 数字漂移 | LMC1 图数:论文 56,984 vs EBI 56,981(3 张之差——530 同款形态) |
| 一句话 | 数据库论文先行+挑战赛引流的第三种发布形态——GC 平台核查模板的建立条目 |
附录 B:时间线——从 Cell 2018 到 ISBI 2027
B.1 LMC 系大事记
| 时点 | 事件 | 存照 |
|---|---|---|
| 2018 | In Silico Labelling(Christiansen et al., Cell)——任务范式确立(三透射光模态同款) | LMC1 论文引用 |
| 2021 | DeepHCS(仅 BF,固定图幅);Label-free Cell Painting 谱系起步 | LMC1 论文相关工作 |
| 2022 | Label-free Cell Prediction 发表;JUMP-CP 公共库上线 | LMC1 论文对照 |
| 2024 | LMC1 挑战赛(ISBI 2024,Athens)——官方 listing 存 6 人团队与 4×5 矩阵 | ISBI challenges-list |
| 2024-02 | LMC1 挑战文档 Zenodo 挂载(10.5281/zenodo.10687568/569) | Zenodo 时间戳 |
| 2025-02-26 | LMC1 数据库 S-BIAD1047 Release(BioImage Archive,CC BY 4.0) | EBI 页 |
| 2026-03 | LMC1 数据库论文发表(Scientific Data,s41597-026-07004-w)——挑战后 2 年闭环 | 论文 DOI |
| 2026-09 | LMC2 训练数据开放(注册)+ 挑战报名 | FBI 新闻 |
| 2026-09-21 ~ 11-30 | LMC2 验证期(≤5 次测试提交) | FBI/Euro-BioImaging 新闻 |
| 2026-12-01 ~ 13 | LMC2 评估期(1 次最终提交) | 同上 |
| 2026-12-18 | LMC2 结果公布 | 同上 |
| 2027 | ISBI 2027——LMC2 挑战报告投稿目标(Submitted 状态) | GC 页横幅 |
B.2 时间线三读
- 两年闭环的节奏:LMC1 挑战(2024)→ 数据库 Release(2025-02)→ 数据库论文(2026-03)——挑战赛到可引用数据资产的标准周期约 2 年。LMC2 若循此律,数据公开归档预计 2027-2028——引用者对"赛后开放"要有耐心预期。
- 三线并进的现在时:2026-09 时点,数据库线(LMC1 已发表)/竞赛线(LMC2 进行中)/方法论文线(ISBI 2027 投稿中)同时活跃——本库条目中首次出现同一数据实体的三线并行状态。
- 前作先行的引用安全:与 529(论文悬空)的最大区别——引用 LMC2 时永远有 LMC1 论文这个已发表锚(数据资产规格已被同行评议背书),"引用无锚"风险为零。
附录 C:数据资产清单——你(现在/赛后)能拿到什么
C.1 现在就能拿(零门槛)
| 资产 | 位置 | 许可 | 内容 |
|---|---|---|---|
| LMC1 数据库 | BioImage Archive S-BIAD1047 | CC BY 4.0 | 2,574 sets / 56,984 张 2D 图(透射光+荧光配对,OME-TIFF+REMBI) |
| LMC1 挑战文档 | Zenodo 10.5281/zenodo.10687568/569 | 开放 | 挑战规则/评估协议 PDF(113 文件) |
| LMC1 论文 | Scientific Data s41597-026-07004-w | 开放 | 数据库设计/采集协议/统计全披露 |
| LMC1 开源方法 | BioImage Model Zoo / GitHub | 开放 | 首届参赛优胜方法(基线弹药) |
C.2 注册后能拿(LMC2 挑战期)
| 资产 | 位置 | 条件 | 内容 |
|---|---|---|---|
| LMC2 训练集 | GC 平台(注册解锁) | 挑战报名 | 76 studies / >150,000 图(透射光含 z-stack+荧光配对) |
| 数据文档 | Google Docs(需登录) | 同上 | 数据结构/下载说明(fetch 失败存照——细节以登录后为准) |
| 提交通道 | GC 平台 evaluation 系统 | 同上 | Docker 算法容器提交(GC 标准机制) |
C.3 赛后预计(按 LMC1 先例推演)
LMC2 数据归档(BioImage Archive 新 accession)→ LMC2 挑战报告(ISBI 2027 接收后)→ 获奖方法进 Model Zoo。推演非承诺——LMC2 本体的 accession/DOI 在赛后确认前不存在,引用不得预填。
C.4 数据结构提示(基于 LMC1 规格推演)
- acquisition set = 一次采集事件(一个视场的一组配对图)——LMC1 的 2,574 sets 是最小复用单元;
- 透射光侧保留全 z-stack(Task 2 输入),荧光侧 best-focus 平面(Task 1 目标)——两个任务的文件组织可能分开;
- REMBI 元数据字段:设备型号/放大倍率/NA/模态/细胞系/标记物/采集站点——metadata-aware 训练的原料就在元数据里。
附录 D:四细胞器×三模态——12 格任务矩阵详注
D.1 四细胞器预测目标详注
| 细胞器 | 荧光标记路径 | 形态学特征 | 预测难度要点 |
|---|---|---|---|
| Nucleus(核) | GFP-H2B 组蛋白稳转(Lleres 2009 株等) | 大而亮、边界清晰、位置稳定 | 最易——透射光核区对比明显 |
| Mitochondria(线粒体) | 专染/荧光蛋白 | 小点状/丝状网络、高空间频率 | 难——透射光下几不可见,纯生成 |
| Tubulin(微管) | GFP-α-tubulin(Gerlich IMBA 株) | 放射状丝状骨架、细胞质全域 | 难——丝状结构的空间精度要求高 |
| Actin(肌动蛋白) | 专染/荧光蛋白 | 应力纤维+皮层信号、边缘富集 | 中——边缘线索可从透射光借力 |
D.2 三透射光模态输入详注
| 模态 | 成像原理 | 信息特点 | 对预测的贡献 |
|---|---|---|---|
| BF(明场) | 直射光吸收/散射 | 低对比、整体形貌 | 基础形态底图 |
| PC(相衬) | 相位→振幅(相环) | 透明结构边缘增强、光晕伪影 | 细胞边界/内部结构轮廓 |
| DIC(差分干涉衬度) | 偏振剪切干涉 | 伪 3D 浮雕、方向性梯度 | 细胞厚度/梯度信息 |
D.3 12 格矩阵的含义
4 目标×3 模态=12 种预测组合,但官方训练集的配对不是全网格覆盖(“incomplete channel availability”——部分采集只含部分通道)。这带来两个工程现实:①多输出模型必须支持稀疏监督(缺通道样本只监督存在的通道——官方鼓励专门的 loss 设计);②模态×通道的条件组合是 metadata-aware 模型的用武之地(把"当前输入是 PC 还是 DIC"喂给模型做条件生成)。官方奖励这两个方向的探索(loss 设计与 metadata-aware 均为 Bonus 点名项)——数据的不完整性被制度性地转化为研究机会。
附录 E:LMC1/2 双代对照总表
| 维度 | LMC1(2024 挑战/2026 数据库) | LMC2(2026 挑战) |
|---|---|---|
| studies | 30 | 76(2.53×) |
| 图像 | 56,984(论文)/56,981(EBI——漂移) | >150,000(≈2.63×) |
| acquisition sets | 2,574 | 未披露 |
| 成像中心 | 8 | 未披露(FBI 23 站点为池) |
| 任务 | best-focused 单任务 | +MIP 双任务 |
| 模态 | BF/PC/DIC | 同(不变) |
| 目标 | 4 细胞器 | 同(+cytoplasm 孤证) |
| 评估 | 4×5(或 4×6)焦点偏差矩阵 | SSIM+PCC 平均 rank(at least) |
| Bonus | 代码/轻量/效率/碳足迹 | 同+metadata-aware(5 项) |
| 数据开放 | CC BY 4.0(S-BIAD1047) | 注册墙(赛后预计归档) |
| 论文 | Scientific Data 2026 已发表 | ISBI 2027 投稿中 |
| 平台 | lightmycells.grand-challenge.org | lightmycells2.grand-challenge.org |
E.1 双代关系的三个判断
①数据代际:LMC2 是 LMC1 数据库的超集式扩容(同主办方同平台同任务族——增量采集而非推倒重来);②规格延续:OME-TIFF/REMBI/配对协议延续(LMC1 论文的标准化成果直接复用);③引用策略:短期引 LMC1 论文+GC 挑战页双锚,赛后 LMC2 归档时补新 accession——本文档的引用模板(附录 K)按此设计。
附录 F:三线并进的论文对照——数据库/竞赛/方法
F.1 三线论文状态
| 线 | 论文 | 状态 | 引用资格 |
|---|---|---|---|
| 数据库线 | 2D Multimodal Image Collection for Fluorescence Prediction from Transmitted Light Microscopy(Scientific Data 2026, s41597-026-07004-w) | 已发表(同行评议完成) | 数据资产引用(规模/协议/许可的正式出处) |
| 竞赛线 | LMC2 Challenge Report(ISBI 2027 目标) | Submitted(2026-09 时点) | 投稿中——暂只能引挑战页 |
| 方法线 | LMC1 优胜方法各论文(Model Zoo 收录) | 部分已发表 | 方法基线引用 |
F.2 与库内发布形态的对照
- 数据库先行(本条):挑战未结束,数据论文已发表——引用者永远有锚(最强引用安全);
- 论文先行(530):MICCAI 接收后数据挂牌——学术出口最强;
- 悬空(529):数据挂牌但论文 4 年未落地——引用只能挂 arXiv;
- 代码先行(528):数据+代码在但论文零——引用全靠 GitHub。
F.3 Scientific Data 论文的规格价值
该论文本身是数据库论文的范本:REMBI 合规+FAIR 原则+两阶段采集协议+45 份问卷的社区驱动设计+负结果决策(类器官不做)全披露——数据集文档的天花板形态(对照 DAIMS 文档维给 LMC1 侧 9 分而 LMC2 挑战页侧 6 分的原因:文档质量分裂在两处)。
附录 G:DAIMS 十维自评——本条 6.9(挑战赛型数据的首次评分)
| 维度 | 得分 | 评分理由 |
|---|---|---|
| 可发现性 | 7 | GC+FBI+Euro-BioImaging+新闻多入口;但"Light My Cells 2"与 LMC1/数据库论文的实体纠缠需读者自行分辨 |
| 可获取性 | 5 | 挑战期注册墙+Google Docs 登录墙——LMC2 本体无公开 DOI;LMC1 部分全开放拉回均分 |
| 格式 | 8 | OME-TIFF+REMBI+FAIR(LMC1 已验证规格;LMC2 推断延续) |
| 文档 | 6 | GC 页极简(2 节)+FBI 描述页中等+数据文档登录墙——分布式文档碎片化 |
| 标注质量 | 8 | ground truth=荧光实测配对(无人工标注偏差)——但荧光侧 best-focus 策展引入选择偏差 |
| 伦理治理 | 8 | 公开细胞系+无患者数据——低负担;但挑战期数据使用条款未公开(注册后见) |
| 规模 | 7 | 150,000 图量大;acquisition sets/中心数未披露减分;2D 显微图单图信息密度低于放射影像 |
| 可复现性 | 6 | 指标未锁定(at least)/测试集黑盒/榜单 rank 依赖参赛池——三重复现障碍;LMC1 侧全开放拉回 |
| 治理维护 | 6 | 两届连续运营记录良好(2024→2026);但跨页三处文案漂移未同步(治理粒度粗) |
| AI-Ready 综合印象 | 8 | 配对即用+任务定义清晰+基线弹药充足(LMC1+Model Zoo)——开箱体验好 |
G.1 得分结构解读
- 6.9 = 挑战赛型数据的典型分数带(静态库 7-8 / 挑战赛 6-7):扣分集中在可获取性与可复现性(注册墙+黑盒评估是挑战赛模式的内生代价),加分在格式与 AI-Ready(LMC1 规格遗产)。
- 双代分裂:同一实体的 LMC1 侧(开放)与 LMC2 侧(锁定)得分差 1.5+ 分——本库首次遇到"条目内部数据代际分裂"的评分场景,本表取两代加权综合。
- 对比 530(7.8):LMC2 的文档/治理/可复现三项显著低——但标注维反超(8 vs 6:实测配对金标 vs 单评人工框)——数据类型决定评分结构,评分表必须跟着数据形态走。
附录 H:GC 五连前瞻——532-535 与模板复用
H.1 批次清单的五连
| order | slug | 名称 | 模态 | 已知信息 |
|---|---|---|---|---|
| 531 | lightmycells2 | Light My Cells 2 | 显微细胞 | 本条——模板建立 |
| 532 | topbrain2026 | TopBrain 2026 | MRI 脑 | TopBrain Segmentation Challenge——分割任务 |
| 533 | chimera | CHIMERA | 待核 | 2026 挑战——名称多义(需消歧核查) |
| 534 | 待核 | autoPET V | PET | autoPET 系列第五届——肿瘤 PET 分割/检测 |
| 535 | owl | OWL | 待核 | Observing What Models Learn——元研究型挑战 |
H.2 模板 v1.0 的复用要点
- 四信源并行:GC 子域主页 / 主办方官网 / 数据归档(Zenodo/BioImage Archive/其他)/ 官方 listing(ISBI/MICCAI challenges 页);
- 漂移三查:任务定义跨页一致性 / 规模数字跨页一致性 / 时间线跨页一致性(本条三处漂移的教训);
- 前作锚定:找系列挑战的上一届数据论文/归档(LMC1→LMC2;autoPET IV→V)作引用锚;
- 伦理重估:GC 平台数据多为公开库派生或细胞系——伦理轴按数据来源重估(勿套 IRB 模板);
- 状态四分:已接收/投稿中/数据论文/挑战报告——论文出口状态必须逐字存照(本条 “Submitted to ISBI 2027”)。
H.3 五连的预期产出
若 532-535 全部按模板跑通:GC 平台的核查方法论将在一个批次内完成 5 次校准——与批次八 PhysioNet 五步法(527-530 四次应用)的成熟路径同构。挑战赛数据的评分结构(G 表)也将获得 5 个样本点,挑战赛型 DAIMS 的评分带(6-7 分带)可望定型。
附录 I:三种防过拟合哲学——挑战赛/静态库/合成数据
| 维度 | GC 挑战赛(本条) | PhysioNet 静态库(529/530) | 合成数据(527/526) |
|---|---|---|---|
| 测试集 | 永不下发(黑盒) | 随库发布(DUA 内) | 全量可见(自证陷阱) |
| 防过拟合机制 | 提交配额(5+1) | 论文同行评议+使用承诺 | 相似度指纹/下游消融 |
| 成绩可信度 | 榜单不可独立复现 | 可复现可挑战 | 取决于合成路线 |
| 审计路径 | 主办方赛后披露 | 任何人可下载验证 | 指纹检测可第三方执行 |
| 适用场景 | 方法竞技+社区动员 | 深度复现+增量研究 | 无真实数据的替代发布 |
I.1 三哲学的边界条件
挑战赛哲学的前提是主办方可信且长期维护(GC 平台 10+ 年记录);静态库哲学的前提是使用约束可执行(DUA 法律效力+社区监督);合成数据哲学的前提是合成路线透明(527 的 physician-written 声明/526 的变换披露)。三种哲学在同一库内并存(531 vs 530 vs 527)——本库作为数据集百科的独特价值就是把三种信任模型并置对照。
附录 J:坑点清单——十坑对照
| 编号 | 坑 | 正确姿势 |
|---|---|---|
| 坑点 1 | 76 studies(LMC2)与 30 studies(LMC1)混引 | 双代分注:LMC2 训练集 76 / LMC1 数据库 30 |
| 坑点 2 | >150,000 当独立场景数 | 全图口径(透射光+荧光多通道合计)——非场景数 |
| 坑点 3 | “Submitted to ISBI 2027” 引为已接收 | 逐字存照投稿状态——接收后方改口径 |
| 坑点 4 | 引 cytoplasm 第 5 通道 | FBI 总览页孤证——GC 正式口径 4 细胞器 |
| 坑点 5 | Task 2 当 2D 任务复现 | 输入是 z-stack——需 3D-aware 或 stack 聚合架构 |
| 坑点 6 | SSIM/PCC 当最终指标集 | “at least” 开口——指标集未锁定 |
| 坑点 7 | 给 LMC2 预填 DOI/accession | 挑战期无公开归档——引挑战页+LMC1 论文双锚 |
| 坑点 8 | LMC1 图数引 56,981 或 56,984 不注口径 | 论文 56,984 / EBI 56,981——漂移存照双注 |
| 坑点 9 | 套医院库伦理模板(IRB/DUA) | 细胞系数据——伦理轴重估 |
| 坑点 10 | 跨年榜单绝对分对比 | rank-based 排名——依赖参赛池,跨届不可比 |
J.1 十坑分布
口径类 4(#1/#2/#8/#10)+ 状态类 2(#3/#7)+ 任务类 2(#5/#6)+ 来源类 2(#4/#9)——口径类占主导是分布式文档平台的结构性风险(PhysioNet 条目的坑集中在协议类——平台形态决定坑位分布)。
附录 K:引用模板
K.1 挑战赛引用
France BioImaging. (2026). Light My Cells 2: Transmitted Light to Fluorescence Challenge. Grand Challenge. https://lightmycells2.grand-challenge.org/lightmycells2/ (Submitted to ISBI 2027)
K.2 数据库论文引用(LMC1 数据资产的正式出处)
Kauffmann, D., Faure, E., Gay, G., et al. (2026). 2D Multimodal Image Collection for Fluorescence Prediction from Transmitted Light Microscopy. Scientific Data. https://doi.org/10.1038/s41597-026-07004-w
K.3 数据存档引用
Light My Cells Database. BioImage Archive, accession S-BIAD1047 (Release 2025-02-26). CC BY 4.0. / Zenodo: 10.5281/zenodo.10687568, 10.5281/zenodo.10687569
K.4 BibTeX 合并版
@misc{lmc2_2026,
author = {{France BioImaging}},
title = {{Light My Cells 2}: Transmitted Light to Fluorescence Challenge},
year = {2026},
url = {https://lightmycells2.grand-challenge.org/lightmycells2/},
note = {Submitted to ISBI 2027; training data: 76 studies, >150,000 images}
}
@article{kauffmann_2026_lmc,
author = {Kauffmann, Dorian and Faure, Emmanuel and Gay, Guillaume and others},
title = {{2D Multimodal Image Collection for Fluorescence Prediction from Transmitted Light Microscopy}},
journal = {Scientific Data},
year = {2026},
doi = {10.1038/s41597-026-07004-w}
}
K.5 引用纪律三条
①三线分开(挑战/数据库/方法各有锚);②双代分注(LMC1 规模/LMC2 规模不混);③状态逐字(Submitted ≠ Published)。
附录 L:分层读法——不同读者的最优路径
| 读者 | 最短路径 | 跳过 | 关键收益 |
|---|---|---|---|
| 参赛者 | §2(双任务)→ §4(时间线)→ 附录 C.2/D.3 | §8 批评 | 配额/指标/稀疏输出设计要点 |
| 复现者(不参赛) | 附录 C.1(LMC1 开放资产)→ §9.1 → K(引用) | 附录 B | 今天的零门槛复现路径 |
| 综述作者 | §1.2(八年脉络)→ §5.1(谱系表)→ E(双代对照) | §7 | 谱系表现成转录 |
| 数据集评审者 | 附录 G(DAIMS)→ §8(批评)→ 附录 I(信任模型) | §2 | 挑战赛型评分结构 |
| 后续条目作者 | FACTS.md → §1.3(GC 模板)→ 附录 H | 全部叙事 | 模板 v1.0 与五连前瞻 |
| 显微成像入门者 | §0 摘要卡 → 附录 A → D.1/D.2 表格 | §1.3/附录 I | 12 格任务矩阵即够 |
附录 M:批次八账本——531 的位置
M.1 批次八进度
| order | slug | rid | 状态 | 本条目价值 |
|---|---|---|---|---|
| 526 | rexerr(并行会话) | — | 已让渡 | 术语漂移形态样本 |
| 527 | swiss-mammo | 627 | ✅ | 合成三分法人写端点 |
| 528 | tn-mammo-breast-density | 628 | ✅ | 乳腺双子+三义辨析 |
| 529 | vindr-pcxr | 629 | ✅ | 页面三大事故+Sci Data 悬空 |
| 530 | vindr-spinexr | 630 | ✅ | MICCAI 顶会+13 倍跃升 |
| 531 | lightmycells2 | 本条 | ✅ | GC 平台首接入+模板建立 |
| 532-535 | topbrain2026/chimera/autoPET V/owl | 待产 | — | 模板复用校准 |
M.2 本条的批次价值
- 平台线:PhysioNet 放射影像五连(526-530)收官 → Grand Challenge 挑战赛五连(531-535)开篇——批次八的前后半场分水岭;
- 任务线:检测(530)/分类(528)/文本(527)之外补上 image-to-image 生成——任务谱系补全;
- 形态线:静态库之外的 benchmark 竞技型数据首入——本库数据形态谱系第五类;
- 方法论线:GC 核查模板 v1.0 建立(§1.3/附录 H),后续四条校准后定稿(附录 O)。
M.3 生产流程适配记录
GC 条目与 PhysioNet 条目的流程差异:①核查轮次多(信源分散——本条 5 轮 WebSearch/WebFetch vs PhysioNet 的 2-3 轮);②规模口径需跨源换算(76/30 倍数换算为增量叙事);③伦理节改写(细胞系轴);④DAIMS 评分结构重估(挑战赛分数带);⑤引用模板三线化。流水线其余环节(四块组装/双检/查重守卫/发布/封面/归档)完全复用。
附录 N:核查日志
N.1 核查过程存照(2026-09-25)
| 轮次 | 动作 | 结果 |
|---|---|---|
| 1 | WebSearch LMC2 挑战 | FBI 新闻×2+GC 页+FBI 描述页五信源锁定 |
| 2 | WebFetch GC 主页 | "Submitted to ISBI 2027"横幅+任务/评估全文——页面仅 2 节(平台形态确认) |
| 3 | WebFetch FBI 描述页 | 双任务定义+训练数据 Google Docs 链接 |
| 4 | WebFetch Google Docs | fetch 失败(登录墙——缺口存照)+WebSearch LMC1 论文 |
| 5 | WebSearch LMC1 Scientific Data | 论文全文 PDF(HAL)+EBI S-BIAD1047+56,984/56,981 漂移发现 |
| 6 | WebFetch GC 根页 | 与子页同构确认(GC 平台静态页信息密度上限摸清) |
N.2 信源清单
GC 子域页(lightmycells2.grand-challenge.org 主页+/lightmycells2/ 子页,同构)/ FBI challenge 总览页 / FBI light-my-cells-2-description / FBI 新闻页 / Euro-BioImaging 新闻页 / Scientific Data 论文(HAL PDF s41597-026-07004-w)/ EBI BioImages S-BIAD1047 / OpenAIRE+Unpaywall(Zenodo 10687568/569)/ ISBI 2024 challenges-list / LIRMM 机构新闻。
N.3 五步法的 GC 版改造
PhysioNet 五步法(页内交叉为主)在 GC 平台改造为跨源五查:①规模跨源交叉(76/56,984/150,000 的口径分辨)②任务定义跨页一致性(三处漂移的发现)③数据本体 vs 数据论文对照(LMC1 论文=数据本体的代理信源)④伦理轴按数据类型重估 ⑤论文出口状态逐字存照(Submitted/Published 分辨)——模板 v1.0 定稿见附录 O。
附录 O:Grand Challenge 核查模板 v1.0(五连复用定稿)
O.1 模板全文
- 信源矩阵(四信源并行):GC 子域主页 / 主办方官网详细页 / 数据归档或前作归档 / 官方 challenges listing(ISBI/MICCAI)。
- 任务三查:输入输出规格逐字存照 / 多任务间的输入形态差异(2D vs stack)/ 任务与数据的咬合(谁为谁预备)。
- 规模口径分辨:studies/sets/images 三层口径分开记 / 全图口径 vs 场景口径标注 / 跨源数字漂移双注(论文 vs 归档页)。
- 时间线四点:数据开放日 / 验证期 / 评估期 / 结果公布——逐字存照(新闻稿双源交叉)。
- 论文状态四分:Published(数据库论文)/ Submitted(挑战报告)/ 前作锚(上一届)/ 方法线(Model Zoo)——四态各记,不得合并表述。
- 漂移三查:任务定义跨页 / 规模数字跨页 / 历史遗留(前届页面的指标矩阵)。
- 伦理重估:数据来源类型(细胞系/公开库派生/前瞻采集)→ 对应合规轴(细胞系轴/公开库许可轴/IRB 轴)。
- DAIMS 评分带:挑战赛型数据的评分结构参考附录 G(可获取性/可复现性扣分项内生)。
- 引用三线:挑战页/数据论文/数据存档分立模板(附录 K)。
- 坑位预判:口径类 4+状态类 2+任务类 2+来源类 2 的分布结构(附录 J)作检查清单。
O.2 532-535 的模板校准任务
- 532 TopBrain 2026:分割任务评估(Dice/HD 系指标)是否引入评分带修正;
- 533 CHIMERA:多义名消歧(同名挑战/数据集/仪器)——可发现性维的实测;
- 534 autoPET V:系列第五届的"前作锚"深度(IV/V 双代对照强度超 LMC);
- 535 OWL:元研究型挑战(“观察模型学到什么”)——评估协议可能是质性分析,DAIMS 需第三种评分结构。
O.3 模板的元价值
本模板是本库"平台级方法论"的第一份(此前为 PhysioNet 单平台五步法)——平台形态决定文档形态,文档形态决定核查动作。GC 五连完成后,模板将升级 v2.0(含四条校准记录),成为后续任何挑战赛平台(Kaggle 医学系/CODA/Synapse)的参考基架。
(附录 O 完——全条目附录部分终稿)
附录 P:in-silico labeling 的生物学动机深读
P.1 荧光显微术的四重代价(LMC 论证链全录)
GC 页与 LMC1 论文共同给出的动机链——荧光标记的每一重代价都对应透射光的一项优势:
| 荧光侧代价 | 机理 | 透射光侧对应优势 |
|---|---|---|
| 成本与耗时 | 生化标记需探针/染料/孵育流程(手工操作) | 零标记成本,即采即得 |
| 光毒性(phototoxicity) | 激发光暴露损伤活细胞——“phototoxicity increases with light exposure, it impairs long term imaging” | 透射光无创——“phototoxicity is sharply reduced” |
| 光漂白(photobleaching) | 荧光团不可逆失活——“fluorophore dimming through photobleaching limits the signal-to-noise ratio” | 无荧光信号衰减问题 |
| 生物学扰动 | 荧光团侵入目标分子相互作用;过表达扰乱细胞质调节;染料本身细胞毒性——“the fluorophores themselves can be cytotoxic” | 不引入任何外源分子 |
P.2 任务的科学价值定位
in-silico labeling 的终极图景:长时程活细胞成像 + 计算恢复分子信息——生物学家可以连续数天观察活细胞(透射光的用时优势),同时通过 AI 获得分子级信息(荧光的信息优势),而不必在"时间分辨率"与"分子特异性"之间二选一。LMC1 论文把它归为三个下游应用:in silico labeling(主任务)/ segmentation(荧光通道可作分割标注源)/ cell profiling from label-free imaging(无标记表型分析)。这不是一个"省染料钱"的工程技巧,而是成像范式级的互补路线——理解这一点才能理解官方为什么给 metadata-aware 与碳足迹上 Bonus(范式转换需要系统工程而非单点 SOTA)。
P.3 伦理-成本双重减负的库内对照
LMC2 的"无标记"哲学与本库其他条目形成有趣的镜像:530 VinDr-SpineXR 用 4 人双轮复核+Safe Harbor 保隐私(患者数据的伦理成本),LMC2 用无标记采集绕开荧光标记的生物扰动(细胞数据的生物学伦理成本)——数据生产的伦理负担可以在采集端(而非脱敏端)消解,这是第三类数据形态(工程采集型)特有的伦理路线。
附录 Q:复现工程——LMC1 数据库的加载代码模板
Q.1 环境与下载
# BioImage Archive S-BIAD1047(CC BY 4.0——零注册门槛)
# 页面: https://www.ebi.ac.uk/biostudies/BioImages/studies/S-BIAD1047
# FTP/Wget 批量下载后校验 md5; Python 侧推荐 tifffile/ome-types
pip install tifffile ome-types pandas scikit-image torch
Q.2 OME-TIFF 读取与 REMBI 元数据对齐
import tifffile, pandas as pd
from pathlib import Path
ROOT = Path("S-BIAD1047") # 按归档实际目录结构调整
meta = pd.read_csv("rembi_metadata.csv") # REMBI 字段表(站点/设备/模态/细胞系)
def load_pair(image_id):
# 透射光输入 + 荧光目标 的配对读取
with tifffile.TiffFile(ROOT / f"{image_id}.ome.tiff") as tf:
arr = tf.asarray() # (C, Z, Y, X) 或降维后形态
ome = tf.ome_metadata # OME-XML:通道名/物理尺寸/设备
return arr, ome
# REMBI 异质性轴 = metadata-aware 模型的特征源
sample_axes = meta[["modality", "magnification", "numerical_aperture",
"site", "cell_line"]].value_counts()
print(sample_axes.head(10)) # 异质性分布先看一眼再设计切分
Q.3 站点排除法切分(复现 LMC1 泛化协议)
sites = meta["site"].unique()
holdout = [sites[0]] # 留一个完整站点做测试
train = meta[~meta["site"].isin(holdout)]
test = meta[ meta["site"].isin(holdout)]
# 关键纪律:以 acquisition set 为最小单元切分,防同 set 泄漏
assert set(train["set_id"]) & set(test["set_id"]) == set()
Q.4 稀疏监督的最小实现(通道缺失样本)
import torch
def sparse_loss(pred, target, mask):
# pred/target: (B, 4, H, W) 四通道; mask: (B, 4) 该样本哪些通道存在
l = ((pred - target) ** 2).mean(dim=(2, 3)) # (B, 4)
return (l * mask).sum() / mask.sum().clamp(min=1) # 只监督存在通道
Q.5 工程要点清单
- 先看异质性分布再切分——REMBI 元数据是复现协议(站点排除)与 metadata-aware 模型的共同原料;
- OME-XML 别丢——物理像素尺寸/通道名在 ome_metadata 里,跨设备归一化需要它;
- LMC2 z-stack 预留——LMC1 的透射光侧若含全 stack(论文声明 preserved in full),Task 2 的输入管线可先在 LMC1 上开发;
- CC BY 4.0 的署名义务——衍生数据集必须署名(引用模板 K.2/K.3)。
附录 R:两条技术路线的深对照——Cell Painting vs in-silico labeling
R.1 路线对照表
| 维度 | Cell Painting 系(JUMP-CP 等) | in-silico labeling 系(LMC) |
|---|---|---|
| 荧光侧性质 | 固定染料配方(6 通道组合染色流程) | 实测配对采集(每图有真实透射光孪生) |
| 输入输出关系 | BF 是同孔同细胞的另一次成像 | 同一次采集的双模态输出(时空对齐) |
| 数据规模 | 百万级图(JUMP-CP) | 十万级图(LMC2) |
| 异质性来源 | 板/孔/剂量(实验设计变量) | 设备/站点/模态/焦位(采集变量) |
| 格式规格 | 各库不一(含非标准) | OME-TIFF+REMBI 强制 |
| 任务形态 | 表型分类/检索为主 | image-to-image 荧光预测 |
| 可复现性 | 大库但格式碎片化 | 规格统一但体量中 |
R.2 时空对齐的核心差异
Cell Painting 的 BF 与荧光通常来自同一孔不同扫描(甚至不同时间点)——像素级对齐是近似;LMC 的透射光与荧光是同一次采集的同步双输出(显微镜同时或近同时记录两路)——像素级配对精确。这就是为什么 image-to-image 的逐像素监督(SSIM/PCC)只在 LMC 路线成立,而 Cell Painting 系多用分类/检索任务——任务形态由采集物理决定,不是设计者随意选的。
R.3 融合前景
两条路线的交叉点:Cell Painting 的大规模表型空间 × LMC 的像素级配对规格——若 LMC2 的 metadata-aware 方法成熟,“虚拟 Cell Painting”(无标记预测全套 CP 通道)是可预见的应用。LMC1 论文点名 JUMP-CP 可作 LMC 方法的预训练源——路线互补而非竞争。
附录 S:挑战赛经济学——主办方为什么要自办挑战
S.1 挑战赛的三重回报(FBI 视角)
- 数据生产动员:45 份问卷+8 中心采集的联邦式数据生产,靠"挑战赛"这个共同目标动员——没有截止日期的采集永远完不成;挑战赛把分散的设施工程师组织到一个协议下;
- 方法筛选与生态落地:全球参赛者把 SOTA 方法送上门,优胜方法进 Model Zoo/Napari——FBI 用奖金/名次换取社区劳动成果的开源化(Zenodo 文档明示 “produce new open source methods” 是目标);
- 基础设施显示度:ANR 资助的国家基础设施需要可量化的产出证明——挑战赛+数据库论文+ISBI/MICCAI 报告是标准的三件套产出结构。
S.2 与企业主办的对照
| 维度 | FBI(本条) | VinBigdata(529/530) | Kaggle 式平台 |
|---|---|---|---|
| 动机 | 基础设施产出+社区工具 | 企业 AI 能力展示/人才 | 流量/商业 |
| 数据 | 联邦采集(23 站点池) | 医院合作管线 | 赞助商提供 |
| 产出承诺 | Model Zoo+Napari 开源 | 论文+模型公开(部分) | 奖金 |
| 持续性 | 两届+规划 2027(官网 “Challenge 2027 in progress”) | 家族式复制 | 事件式 |
——FBI 官网挑战总览页显示 2027 年新一届已在规划(“Challenge 2027 in progress”)——年度化运营的国家基础设施节奏(对照 Fuse My Cells 2025/Light My Cells 2024 的年份命名法,挑战系已三代)。
S.3 对数据集生产者的启示
挑战赛是"数据集冷启动"的最强动员术:用竞赛 deadline 驱动采集标准化、用参赛者竞争驱动方法开源、用数据库论文锁定引用——三步的顺序(采集→竞赛→论文)不可倒置。LMC 系是完整走过三步的唯一案例(本库内),后续 GC 条目(532-535)可验证该模型的普适性。
附录 T:显微成像模态的物理速览——BF/PC/DIC 对学习的含义
T.1 三模态物理速览
| 模态 | 光学机理 | 图像特征 | 学习含义 |
|---|---|---|---|
| BF | 直射透射+吸收散射 | 低对比度明场像,细胞几乎透明 | 需要模型放大微弱对比——最弱输入 |
| PC | 环形光阑相位→振幅转换 | 边缘明亮光晕(halo)、内部结构可见 | halo 伪影是固定噪声模式,模型需学会忽视 |
| DIC | 偏振分光剪切+干涉 | 伪 3D 浮雕(梯度方向性)、无色差 | 方向性梯度含厚度信息——但方向依赖棱镜朝向 |
T.2 为什么模态是 metadata-aware 的第一变量
三种模态的图像形成物理完全不同——同一细胞在 BF/PC/DIC 下的像素统计分布迥异。把模态标签喂给模型(或分模态归一化)是最小代价的显著增益——这就是为什么官方把 metadata-aware 训练列为 Bonus 而非只是建议。放大倍率/NA 同理:改变像素分辨率与衍射极限——REMBI 元数据里这些字段是现成的条件输入。
T.3 从物理到 loss 的映射
DIC 的方向性梯度 ↔ 方向敏感损失(边缘加权);PC 的 halo ↔ halo 区域降权;BF 的低对比 ↔ 输入端对比度增强/直方图均衡作为预处理探针。模态物理决定预处理与 loss 的设计空间——参赛者的架构创新空间之外,物理先验是第二创新轴。
附录 U:LMC2 赛前预测——榜单形态与赢家策略推演
U.1 榜单可能形态
- Task 1 榜:SSIM/PCC 双指标×4 细胞器 rank 平均——核通道分数将显著高于线粒体/微管(附录 D.1 的难度排序),榜单总分被"最弱通道"拉平;
- Task 2 榜:z-stack 输入的信息增量 vs MIP 目标的模糊性——3D-aware 方法与 2D 聚合基线的差距可能不大(MIP 压缩了 z 轴判别需求)——值得观察的关键变量;
- Bonus 榜:轻量+碳足迹 Bonus 的存在使"大模型刷分"策略失效——效率导向的排行榜(全库挑战赛条目中的首个效率制榜单)。
U.2 候选赢家策略推演
①metadata-aware 条件化(模态/倍率进模型)——官方 Bonus 点名,增益确定性最高;②稀疏监督专家(通道缺失 masking 的精细设计)——数据的不完整性是所有人的痛点,处理得最优雅者胜;③LMC1 预训练(S-BIAD1047 全开放——56,984 图的免费先验);④3D/2.5D 混合架构(Task 2 需要而多数参赛者会轻视 stack 的时序结构)。
U.3 赛后观察清单(本条目作者的跟踪点)
①最终指标集是否扩充("at least"的兑现形态);②cytoplasm 通道是否真出现(FBI 总览页孤证的裁决);③站点排除法是否延续(泛化性协议);④LMC2 数据归档的 accession 与许可(CC BY 4.0 兑现?);⑤ISBI 2027 挑战报告的接收状态。五点将回填至本库后续版本的条目更新。
附录 V:FBI 联邦地图——8 中心与 23 站点的组织结构
V.1 LMC1 数据的 8 中心结构(S-BIAD1047 署名机构整理)
| # | 中心 | 城市 | 机构全称 | LMC 中的贡献 |
|---|---|---|---|---|
| 1 | CRBM | Montpellier | Centre de Recherche en Biologie cellulaire de Montpellier (CNRS/UM) | 采集+REMBI 实施 |
| 2 | CBS | Montpellier | Centre de Biologie Structurale (CNRS/INSERM/UM) | 采集 |
| 3 | IGMM/IGH | Montpellier | Institut de Génétique Moléculaire de Montpellier / Institut de Génétique Humaine | 采集 |
| 4 | CBI-TRI/LITC | Toulouse | Centre de Biologie Intégrative / Toulouse Réseau Imagerie | 采集 |
| 5 | IBDM | Marseille | Institut de Biologie du Développement de Marseille (CNRS) | 采集 |
| 6 | PFIC | Villejuif | Imaging and Cytometry Platform, Gustave Roussy Cancer Campus | 采集(肿瘤细胞系专长) |
| 7 | IGDR | Rennes | Institut de Génétique et de Développement de Rennes (CNRS/UR1) | 采集 |
| 8 | IGBMC | Illkirch | Light Microscopy Facility (INSERM/CNRS/UDS) | 采集 |
| + | ImCy | Évry | Genethon Imaging Cytometry Platform | 采集 |
| + | CRSA | Paris | Cytométrie Imagerie Saint-Antoine (Sorbonne) | 采集 |
| + | BIC | Bordeaux | Bordeaux Imaging Center (CNRS/UB) | 采集 |
| + | PSL/EPHE | Paris | Paris Sciences & Lettres | 协调 |
——蒙彼利埃一城四中心(CRBM/CBS/IGMM/IGH)+通讯作者所在 LIRMM 同城——蒙彼利埃是 LMC 系的地理重心(FBI.data 的 LIRMM 坐标)。
V.2 联邦规模的三层结构
- 23 站点:FBI 全网成像采集站点(官网口径"23 imaging acquisition sites distributed all over France",另一处写 “more than 20 imaging platforms”——LIRMM 新闻——小漂移存照);
- 8 中心:LMC1 数据库的实际数据来源(30 studies 分布于 8 中心);
- 11+ 机构地址:LMC1 论文署名的机构扩展列表(多中心多址)。
——三层结构的含义:数据库规模(8 中心)远未用满联邦容量(23 站点)——LMC3+ 的扩容空间在联邦内天然存在(挑战系可持续性的供给侧证据)。
附录 W:CC BY 4.0 细读——LMC1 开放许可的权利与义务
W.1 四权四义务
| CC BY 4.0 | 内容 | 对 LMC 数据使用者的含义 |
|---|---|---|
| ✅ 商业使用 | 允许商用 | 产业界可自由集成(对照 530 的 Restricted+DUA 禁区) |
| ✅ 修改 | 允许衍生数据集 | 预处理/重标注/裁剪皆可 |
| ✅ 分发 | 允许再分发 | 教学包/镜像站合法 |
| ✅ 私人使用 | 无限制 | 随意 |
| ⚠️ 署名(BY) | 必须引用来源 | 引用模板 K.2/K.3 是法律义务而非礼节 |
| ⚠️ 标注修改 | 衍生品必须声明修改 | 预处理后需说明 |
| ⚠️ 无额外限制 | 不得添加技术措施阻挠他人 | 再分发不得加锁 |
| ⚠️ 许可链接 | 附许可全文链接 | 产品文档需带 CC BY 4.0 链接 |
W.2 与本库许可光谱的位置
本库许可光谱:CC BY 4.0(LMC1,最开放)/ ODbL(526)/ Open(527 的合成件)/ Restricted+DUA(528/529/530)——LMC1 是全库最开放的许可档(CC BY 4.0 允许商用,ODbL 的 share-alike 对商用更苛刻)。LMC2 挑战期数据的许可未公开——若延续 CC BY 4.0,LMC 系将成为本库开放规格的标杆家族;若收紧(如挑战期禁商用),将是"挑战期/开放期"双许可制度的案例。
W.3 BioImage Archive 的引用规范
S-BIAD1047 的正式引用三件套:accession 号(S-BIAD1047)+ DOI(归档分配)+ Release 日期(2025-02-26)。注意 BioImage Archive 的 DOI 与 Zenodo 的 10.5281/zenodo.10687568 是两套独立标识——前者指向数据库本体,后者指向挑战文档包——引用时按"引数据用 S-BIAD1047、引挑战规则用 Zenodo"分流。
附录 X:跨学科接入指南——三类用户的落地路径
X.1 机器学习研究者
- 任务框架:多输出条件生成(4 通道×3 模态条件)+稀疏监督+rank 评估——与图像翻译/多任务学习的现成框架无缝对接;
- 起点模型:UNet 系(in-silico labeling 的默认骨干)→ 条件注入(模态/倍率 embedding)→ 3D-aware 扩展(Task 2);
- 基线锚点:LMC1 挑战的优胜方法(Model Zoo)+ In Silico Labelling 2018 的复现报告——两个起点都开源;
- 发论文的空间:metadata-aware 的系统消融/稀疏监督的 loss 设计/跨站点泛化的 scaling 分析——LMC2 Bonus 明示了官方想看什么。
X.2 生物学实验室
- 直接收益:无标记长时程活细胞成像+事后"虚拟染色"——贵重染料只在验证子集使用,日常筛选用透射光;
- 工具路径:等 Model Zoo 收录后 Napari 插件即装即用(LMC 承诺的落地端)——生物学家的使用门槛是 GUI 而非代码;
- 数据贡献:FBI 网外的实验室暂无直接贡献通道(挑战数据由 FBI 内部采集)——关注 LMC3+ 的开放征集(FBI 官网挑战总览页公开征集未来挑战想法,联系 Faure/Kauffmann)。
X.3 教科书与教学作者
- 教学素材:CC BY 4.0 允许直接进教材/PPT——BF/PC/DIC 同视野对照图是显微成像原理课的现成插图素材;
- 练习设计:56,984 图的子集可做"预测通道"课堂实验(输入透射光猜荧光)——SSIM/PCC 的可视化教学;
- 引用提醒:教学材料同样受 BY 署名约束(附录 W.1)——课件末尾带引用行即可。
附录 Y:库内联动矩阵——显微/生成/挑战赛条目网络
Y.1 联动总表
| 联动条目 | 联动维度 | 具体接口 |
|---|---|---|
| 530 VinDr-SpineXR | 发布形态对照 | 论文先行 vs 数据库先行——MICCAI vs Scientific Data |
| 529 VinDr-PCXR | 许可对照 | Restricted+DUA vs CC BY 4.0——开放光谱两极 |
| 527 swiss-mammo | 任务对照 | 报告文本生成 vs 图像生成——语言 vs 视觉的生成任务 |
| 526 ReXErr | 信任模型对照 | 合成数据自证 vs 配对实测金标 |
| 528 TN-Mammo | 伦理轴对照 | 医院级 IRB vs 细胞系无 IRB——合规轴分叉样本 |
| 561 RadGraph | AI-Ready 格式对照 | 文本 span 标注 vs 图像配对——格式维的跨模态呼应 |
| 532-535(待产) | 平台同构 | GC 模板 v1.0 的校准对象 |
Y.2 联动的三条结构洞察
①许可光谱补全:LMC1 的 CC BY 4.0(商用自由)+529 的 Restricted(签约墙)让本库的许可光谱两端齐备——引用者可按使用场景选库;②信任模型三哲学(附录 I)+许可光谱+发布形态四型(附录 F.2)构成本库的"数据治理三维坐标系"——LMC2 是坐标系中唯一同时处于"最开放许可+最封闭获取"象限的条目(CC BY 4.0 的前作+注册墙的现作);③显微域开篇:本条是库内第一个显微细胞条目——病理图像类目的首个样本,后续 Cell Tracking/organoid 系条目的对标母版。
附录 Z:补遗问答(FAQ 续组)
Q:LMC2 的"挑战赛数据"和常规数据集,引用时算同一实体吗?
A:算同一实体的两个生命周期阶段——挑战期(注册墙+配额提交)与开放期(赛后归档)。引用时用附录 K 的三线模板区分;实体一致性由主办方(FBI)与平台(GC 子域)保证。
Q:为什么官方鼓励 metadata-aware 却不把元数据直接当模型输入做强制?
A:保持方法多样性——强制输入格式会排斥非条件化架构的创新空间;Bonus 制是"给糖不定路"的设计哲学(对照 LMC1 强制的 OME-TIFF 格式——数据侧强制、方法侧自由)。
Q:碳足迹 Bonus 具体怎么评?
A:页面未披露评分细则(存照缺口)——LMC1 的同款 Bonus 描述为 “evaluation of the carbon footprint”,合理推断为训练/推理能耗的报告与削减方案质量评分。细则待挑战报告。
Q:SSIM 和 PCC 会不会打架(一个高分一个低分)?
A:会——SSIM 对结构/对比敏感,PCC 对线性强度保真敏感;荧光预测中强度校准(PCC)与纹理结构(SSIM)的权衡是真实设计问题。rank 平均制缓和了单指标异常,但通道间的 trade-off 仍在。
Q:这个挑战赛和 Kaggle 的医学比赛什么区别?
A:三点——①GC 平台的算法是 Docker 容器化提交(可执行审计),Kaggle 是结果文件提交;②GC 挑战与数据库论文/开源落地绑定(Model Zoo/Napari),Kaggle 赛后数据常散;③GC 的主办方是科研基础设施(FBI/DIAG),Kaggle 主办方是企业。学术可信度链条更长。
Q:LMC2 结束后我能拿到什么格式的全部数据?
A:按 LMC1 先例推演:BioImage Archive 新 accession+OME-TIFF+REMBI+CC BY 4.0——但这是推演非承诺(附录 C.3 的立场:accession 在赛后确认前不存在)。
Q:Tasks 的"best-focused"是怎么定标的?
A:LMC1 数据库的荧光侧在预处理时降维到最佳焦面(论文声明的管线动作)——即 ground truth 已经是"策展过的对焦荧光"。LMC2 的 Task 2 MIP 目标是 stack 级聚合——两个任务的定标粒度不同(单帧 vs 投影),复现时不要共用同一套数据准备代码。
Q:如果我不想参赛也不想复现,这条数据对我有什么用?
A:三个轻量用法——①教学素材(CC BY 4.0+三模态对照图);②写作引用(in-silico labeling 脉络的 2026 节点+五形态漂移的方法论案例);③平台观察(GC 模板 v1.0 的母版条目——关注后续四条的校准)。
附录 AA:平台元数据存照卡与条目尾注
AA.1 GC 平台元数据存照(2026-09-25 核查时点)
| 字段 | 值 | 备注 |
|---|---|---|
| 平台子域 | lightmycells2.grand-challenge.org | 子域即 slug——GC 平台命名惯例 |
| 主页标题 | Light My Cells 2 : Transmitted Light to Fluorescence Challenge | 冒号后为完整任务副题 |
| 页面结构 | 标题横幅+Motivations+The challenge——共 2 节 | GC 静态页信息密度上限的实测样本 |
| 横幅状态 | Submitted to ISBI 2027(附 ISBI27 logo 与 biomedicalimaging.org 链接) | 状态逐字存照 |
| 静态页未含 | 时间线/组织者/数据下载/许可/leaderboard | 全部在平台系统(登录后)与主办方官网 |
| 主办方官网 | france-bioimaging.org 三页(总览/description/新闻) | challenge 总览页含 2027 规划 |
| 关联新闻 | Euro-BioImaging 官网同文新闻 | 欧洲层面转发——双源交叉用 |
| 前作平台 | lightmycells.grand-challenge.org(无 2) | 前届子域仍在——两代对照现场 |
AA.2 时间口径的最后核对
验证期起点的两种表述——FBI 新闻页 “From September 21st, 2026, the validation phase begins” 与 Euro-BioImaging 同文——双源一致;FBI 总览页的挑战周期(“Since 2024, France-BioImaging organizes its data machine learning competition”)确认 LMC2 是 FBI 挑战系列的第三届(LMC1 2024/Fuse My Cells 2025/LMC2 2026——官方挑战页的年份命名法自洽)。
AA.3 条目尾注:一个平台首条的自我要求
作为 Grand Challenge 五连的第一发,本条目的最大价值不在 LMC2 本身(挑战尚在进行、数据尚未归档),而在把一个新平台的文档形态摸成模板:静态页的信息密度上限(2 节)、跨页漂移的高发区(主办官网的自由文案 vs 平台页的正式口径)、前作锚的引用策略(数据库论文先行的安全网)、伦理轴的重估方法(细胞系/派生库/前瞻采集三型)、评分带的重构(挑战赛型的 6-7 分带)。532-535 四条将带着这套预判进场——每一条的核查日志都会记录模板的偏差与修正,五连结束时模板 v2.0 定稿。
本条目为批次八 GC 五连开篇。数据集生产长跑继续——下一发 532 TopBrain 2026。
(全条目终稿)
尾注:版本与更新记录
| 版本 | 日期 | 说明 |
|---|---|---|
| v1.0(本版) | 2026-09-25 | 初稿发布——核查基线为 GC/FBI/EBI/Scientific Data 六源(2026-09-25 时点) |
| 待更新 ① | LMC2 评估期后(2026-12) | 回填榜单结果、cytoplasm 裁决、最终指标集 |
| 待更新 ② | ISBI 2027 接收公示后 | 挑战报告引用格式与接收状态更新 |
| 待更新 ③ | LMC2 数据归档后 | accession/DOI/许可三件套回填(附录 C.3 推演的验证) |
本条目遵循本库"活文档"原则——挑战赛型数据的生命周期长于发布时点,更新记录随生命周期滚动。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- cytoimagenet — 共享标签:医学影像 / 病理图像
- nih-malaria — 共享标签:医学影像 / 病理图像
- bcnb — 共享标签:医学影像 / 病理图像
- ocelot — 共享标签:医学影像 / 病理图像
- sicapv2 — 共享标签:医学影像 / 病理图像
- acrobat — 共享标签:医学影像 / 病理图像
- msk-impact — 共享标签:医学影像 / 病理图像
- munich-bmc — 共享标签:医学影像 / 病理图像
- anhir — 共享标签:医学影像 / 病理图像
- cima — 共享标签:医学影像 / 病理图像
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

