SELMA3D (selma3d) — AI-Ready Wikipedia

SELMA3D 2025:MICCAI 2025 卫星挑战赛——58 幅小鼠组织透明化光片显微 3D 图像(单幅最大 10000³ 体素)的自监督/半监督分割,两赛道分治离散与连续生物结构,设计文档 CC-BY-4.0,图像三层托管(Zenodo/EBI BioStudies/Grand Challenge 注册制)

来源 小鼠组织透明化 + 特异性染色 + 光片显微镜三维成像(16-bit TIFF 体数据,单幅最大 10000³ voxels;2024 patch 为 NIfTI LPS+);托管三层异构:Zenodo 设计文档 cc-by-4.0 / EBI BioStudies S-BIAD1196 + S-BIAD1197(2024 图像)/ Grand Challenge 注册制下载(2025 图像)发布时间: 2026-09-27最后更新: 2026-09-27 阅读 16
SELMA3D (selma3d) — AI-Ready Wikipedia

信息速览

数据集名称SELMA3D (selma3d) — AI-Ready Wikipedia
数据类型影像数据,人工标注,原始数据
规模58 幅 3D 图像(2025 训练集:Task 1 离散结构 30 幅 + Task 2 连续结构 >25 幅);2024 首届对照 35 幅 + 315 个标注 patch;小鼠 cleared
接入方式小鼠组织透明化 + 特异性染色 + 光片显微镜三维成像(16-bit TIFF 体数据,单幅最大 10000³ voxels;2024 patch 为 NIfTI LPS+);托管三层异构:Zenodo 设计文档 cc-by-4.0 / EBI BioStudies S-BIAD1196 + S-BIAD1197(2024 图像)/ Grand Challenge 注册制下载(2025 图像)
AI 就绪度

SELMA3D:58 幅光片显微 3D 体数据的自监督分割挑战赛

条目定位:本条目收录 SELMA3D 2025 挑战赛数据集(slug: selma3d)——MICCAI 2025 in-person satellite event(第二届),任务是在单幅最大 10000³ 体素的小鼠组织透明化光片显微镜(light-sheet microscopy, LSM)三维图像上,用自监督/半监督方法分割离散(isolated)与连续(contiguous)两类生物结构。它是"显微镜尺度 3D 分割"这一赛道上目前对象谱系最宽的公开挑战:从细胞核、Aβ 斑块到血管、肠神经系统,一条数据链覆盖神经科学、血管生物学与病理成像。

先看数据集名片(30 秒版):

项目 内容
名称 SELMA3D 2025 Challenge(Self-supervised learning for 3D light-sheet microscopy image segmentation)
性质 MICCAI 2025 in-person satellite event 挑战赛,第二届(首届 2024,第三届 2026 已立项)
官网 selma3d2025.grand-challenge.org
数据 58 幅 3D 光片显微体数据(Task 1 离散 30 幅 + Task 2 连续 >25 幅),单幅最大 10000³ voxels
对象 离散:核/c-Fos+/Aβ/小胶质/神经元/淋巴/荧光蛋白细胞;连续:血管/神经/外周神经/肠神经/淋巴管
格式 16-bit TIFF(2025 体数据);NIfTI LPS+(2024 patch)
获取 Zenodo(规程 PDF,cc-by-4.0)/ BioStudies(2024 图像,公开)/ Grand Challenge(2025 图像,注册制)
指标 Dice 为主;2024 首届顶级队伍 >70%
凭证 Zenodo DOI 10.5281/zenodo.15267392(v3)+ arXiv 2501.03880(v2)+ S-BIAD1196/S-BIAD1197
本库 slug selma3d(URL 占位:/ai-ready-dataset/selma3d/681)

先说三个最容易翻车的认知:

  1. SELMA3D 的图像本体不在 Zenodo。Zenodo 记录(DOI 10.5281/zenodo.15267392)里只有一个 146,647 字节的挑战设计 PDF;2025 年的 58 幅体数据在 Grand Challenge 平台注册参赛后才能下载——未登录访问图像页直接返回 Forbidden(本条目核验于 2026-09-27 双重复现)。想"先下数据再说"的人会在第一步就撞墙。
  2. 许可有三套口径,互不覆盖。Zenodo 设计文档是 cc-by-4.0;2024 年的图像数据集按官网/arXiv 口径是 CC-BY-NC;BioStudies 的 S-BIAD1196 存档又标 CC BY 4.0。拿"设计文档是 CC BY 4.0"去推"数据随便商用"是最常见的误读。
  3. 规模有两个官方口径。arXiv 摘要说 2025 训练集 58 幅(Task 1 30 幅 + Task 2 推算 28 幅);官网 /task/ 页只承诺 Task 1 30 幅 + Task 2 “>25 幅”。58=30+28 能闭合,但"官网确认 28 幅"这句话在来源里并不存在。

导读使用说明:

  • 只想拿数据:直奔 §5——三层托管、每层的许可与入口、Forbidden 事实的完整记录都在那里。
  • 想知道为什么需要自监督:直奔 §2——10000³ 体素意味着什么、为什么完整标注在物理上不可行。
  • 关心对象与任务划分:直奔 §3——离散/连续两赛道的完整对象清单与图像规格。
  • 要复现或对标:直奔 §6 与 §7——方法谱系、工程前提、2024 赛果与下游复用证据。
  • 写论文要引用:直奔 §11 避坑清单——arXiv 双版本、license 三口径、58 vs 30+>25 口径差都在坑单里。

§0 导读:这个数据集解决什么问题

0.1 一句话问题陈述

光片显微镜 + 组织透明化让小鼠全脑乃至全身的完整三维成像成为现实,单幅图像可 volumetric 地覆盖整个器官——代价是数据体量爆炸:SELMA3D 2025 训练集每幅图像超过 2×10¹⁰ 体素(Task 1),最大达 10000³ = 10¹² 体素量级。在这个尺度上,"人工逐体素画真值"在物理上不可行:一个熟练标注员按每秒 10 个体素不间断工作,标完一幅 10¹² 体素的图像需要三千多年。挑战赛把这个问题改写成一个可比赛的形式:给定大体量无标注 LSM 体数据 + 稀疏/局部标注,能分割到什么程度?

0.1.1 同一问题的另一种表述:这是"数据集问题"还是"方法问题"?

把 §0.1 的问题换个问法:当标注跟不上成像,应该怪数据集没标注,还是怪方法不能利用无标注数据?SELMA3D 的立场清晰可见于其标题——它把名字就叫 “Self-supervised learning…”,即方法必须进化到数据的形态,而不是等数据进化到方法的形态。这个立场有两个可检验的推论:其一,数据集的公开形态会刻意保留"无标注的丰富上下文"(不然 SSL 无米下锅);其二,评测会比较方法在弱监督下的相对优劣而非绝对精度(绝对精度没有 dense 真值可对)。读后文时可以带着这两个推论去验证——§3.5 与 §6.4 的设计都能看到这条立场的影子。

0.2 为什么是"自监督/半监督",为什么是"挑战赛"

  • 自监督的必然性:完整真值不可得(0.1 的算术),那么能用的标注形态只有两种——稀疏点标注(比如在几百个细胞核上点几个点)与局部密集标注(在体数据内部裁出一小块 3D patch 精标,2024 届提供了 315 个这样的 patch)。如何用"大体量无标注 + 少量弱标注"训练出可用的 3D 分割模型,正是 self-supervised / semi-supervised learning 的教科书式场景,也是挑战赛标题里 “Self-supervised learning” 的直接来源。
  • 挑战赛的适配性:Grand Challenge 平台(DIAG Nijmegen 运营)提供算法容器化提交与排行榜,评测口径统一;MICCAI 卫星活动的形式让方法侧(SSL 社区)与数据侧(组织透明化成像实验室)在同一场活动里对接。2024 首届的结果(84 人注册、5 队有效提交、Dice >70%)证明了这条通路可运行,2025 第二届把数据规模从 35 幅扩到 58 幅、对象谱系进一步铺开。

把上面两点合起来看:SELMA3D 的赛道设置不是"又一个分割挑战赛",而是把弱监督方法社区的组织透明化数据需求正式化的一次建制动作——数据从实验室私有变成社区资产(存档+DOI),方法从论文原型变成可比的排行榜成绩(容器+评测),两头各取所需。这个"建制"视角贯穿本条目所有章节:理解了它,两赛道划分(§0.3)、三层托管(§5)、三届沿革(§4)都不是孤立事实,而是同一逻辑的不同切面。

0.3 两赛道:按结构拓扑分治

SELMA3D 不是把所有对象混进一个任务,而是按目标结构的拓扑形态划分两条赛道:

  • Task 1 — isolated structures(离散结构):目标是在连续背景中分离一个个独立个体——细胞核、c-Fos+ 激活神经元、Aβ 淀粉样斑块、小胶质细胞、神经元、淋巴细胞、荧光蛋白标记细胞。任务本质接近"3D 检测 + 实例分割"。
  • Task 2 — contiguous structures(连续结构):目标是一张绵延不断的网——血管、神经纤维、外周神经、肠神经系统(enteric nervous system)、淋巴管。任务本质接近"管状结构分割 + 连通性追踪",断裂一处即网络失真。

这个划分不是随意的:两类结构的标注策略、网络设计、评测指标偏好都不同(离散目标看检出与形贴合,连续网络看连通性与拓扑保持),2026 第三届更按 isolated/contiguous × sparse/dense annotation 进一步细化为四条赛道——拓扑分治是这个挑战系列一以贯之的设计原则(§4.3)。

两赛道对方法侧的不同"邀请":

  • Task 1 邀请的是检测-分割-分离栈:从大体数据里找出每一个独立个体并给出边界。SSL 在这里的用武之地是"教会网络什么是细胞/斑块在光片图像里的样子",实例分离本身更多靠经典算法或检测头设计;
  • Task 2 邀请的是分割-连接-追踪栈:先给出管状结构的体素级概率,再保证网络拓扑正确。SSL 在这里的用武之地是"从海量无标注血管/神经网数据中学出管状结构的通用表征",连通性保持靠后处理与拓扑感知损失。

一个方法团队若想两赛道通吃,需要的是两套互补组件而非一个万能网络——这个结构性事实决定了参赛方案的形态,也解释了为什么两赛道排行榜值得分开看。

0.4 在"显微镜 3D 分割"光谱上的位置

把 SELMA3D 放进公开数据集光谱里看它的独特性——先记住一句话:它的每一个维度单独看都不新鲜,四个维度叠加后没有对手。

维度 常规医学 3D 分割(如 CT/MRI) SELMA3D 所在的 LSM 端
单幅体素数 10⁷-10⁸(512×512×300 量级) >10¹⁰,最大 10¹²(10000³)
体素物理尺寸 毫米-亚毫米各向同性 亚微米-微米,常各向异性
对象 器官/肿瘤(形态先验强) 细胞级结构与纤维网络(形态多样)
标注可行性 整幅可标(昂贵但可行) 整幅不可行(只能稀疏/局部)
监督形态 全监督为主 自监督/半监督为默认

与库内其他条目的对照:TotalSegmentator(CT 大规模器官分割)是"全监督 + 器官级"一端;BigBrain 是"超高分辨率人脑体数据"的参考图谱端;TopoTopBrain Challenge 2026 是同家族的 MICCAI 3D 挑战赛;而 SELMA3D 站在"显微尺度 + 自监督 + 挑战赛机制"的交点上,四者互为光谱参照而非竞争者(§10 详述)。

这张光谱表的深层信息:监督形态一列从"全监督 dense"滑向"自监督稀疏",本质是"标注成本随体素规模超线性增长"的必然结果——光谱的两端不是谁好谁坏,而是两条成本曲线在不同尺度的交点。当你的数据处于 10⁷-10⁸ 体素(交点左侧),全监督仍是性价比之选;越过 10¹⁰(右侧),SELMA3D 式的弱监督设计成为唯一经济解。这个判断框架比"哪个数据集更好"有用得多——它回答的是"我的数据该配什么监督形态"。

0.5 谁应该用,谁不该用

适合:① 开发自监督/半监督 3D 分割方法、需要一个"真值天花板明确受限"的试炼场;② 组织透明化/光片成像实验室,想评估或建立自己的分析流水线;③ 研究大体量体数据的工程管线(分块、滑窗、分布式推理);④ 做跨尺度迁移学习(显微 ↔ 临床影像)的方法研究。

不适合:① 期待"下载数据 → 全监督训练 → 直接 SOTA"的常规流程——2025 图像是注册制、标注是稀疏形态,全监督路线在此不成立;② 需要人类临床数据的研究——这是小鼠 cleared 组织,无人类受试者;③ 需要 dense 全器官真值的应用——不存在这样的真值,数据Limitations 已存照。

一个折中身份也值得列出——教学与课程设计者:SELMA3D 的 2024 存档(公开 FTP + 小体量 + 带 patch 标注)是"大体量 3D 数据工程"主题的优质教学素材:学生可以在公开数据上完整体验 memmap 读取、滑窗推理、弱监督微调的全链条,成本可控且直接对接真实科研场景——比教学常用的玩具数据集更接近实战,比正式科研数据更易得。

顺带一提,"谁是使用者"的清单本身就解释了这个数据集的形态设计:注册墙保护的是评测公信力(服务方法研究者),2024 公开存档服务的是原型与教学,Zenodo 规程服务的是引用者——每个获取层都对应一类使用者,三层结构不是技术债,是用户画像(§5.1)。

0.5.1 一分钟判断"该不该用"的三个问题

  1. 你的方法能处理 >10¹⁰ 体素的输入吗? 不能且不想改工程(§6.2)→ 不适合,选库内常规 3D 数据集入门;
  2. 你的结论需要人类数据支撑吗? 需要 → 不适合作为主数据集,SELMA3D 只能做方法预研侧翼;
  3. 你能接受弱标注上限吗? 不能 → 不适合。若三个问题都过关,这个数据集对你的边际价值大概率高于再刷一个常规基准。

0.6 阅读路径图

按身份选路径,括号内为直达节:

数据工程师 ──→ §3.4 格式细节 → §6.2 分块工程 → §5.7 获取决策树 → SCP-Nano 裁剪脚本
SSL 方法研究者 → §2.4 方法谱系 → §3.5 监督信号盘点 → §6.3 路线图 → §7.1 基线赛果
透明化实验室  → §2.1-2.2 成像链 → §8.1 组织网络 → SCP-Nano 上游衔接
挑战赛设计者  → §4.3 四分法 → §9.2 拓扑分治 → §9.3 凭证链 → TopoTopBrain 对照
论文写作者    → §11 避坑清单 → §5.4 许可对照表 → FAQ Q14 引用四件套

横切读法(不管什么身份都建议过的三道关卡):任何使用场景都建议依次过一遍——① §5 的许可三口径(法律层);② §11 的九个坑(事实层);③ 附录 C 的观察哨(时效层)。三道关卡过了,本条目提供的事实与判断才能安全地进入你的工作流。

§1 数据集速览:十问十答

十问按"是什么→有多大→怎么拿→怎么用→怎么引"的信息流排列:Q1-Q3 建立身份认知,Q4-Q6 回答获取与许可(最高频翻车区),Q7-Q9 覆盖工程与引用细节,Q10-Q15 处理时效性与适用性判断。急用者按需跳读,但 Q5(下载)、Q6(license)、Q13(数据划分)三问建议所有人在动手前必读。

Q1:SELMA3D 2025 是什么?
MICCAI 2025 in-person satellite event 挑战赛(第二届,首届 2024),全称 Self-supervised learning for 3D light-sheet microscopy image segmentation。任务是在小鼠组织透明化光片显微 3D 图像上分割离散与连续两类生物结构,主打自监督/半监督方法。

Q2:数据有多大?
2025 训练集 58 幅 3D 图像:Task 1(离散)30 幅、每幅 >2×10¹⁰ voxels;Task 2(连续)>25 幅(推算 28)、每幅 >1×10¹⁰ voxels。单幅最大 10000³ voxels。2024 首届对照:35 幅(>1000³ voxels)+ 315 个标注 patch。

Q3:图像里是什么?
小鼠组织经透明化处理后特异性染色/荧光标记,光片显微镜三维成像。Task 1 对象:细胞核、c-Fos+ 神经元、Aβ 斑块、小胶质细胞、神经元、淋巴细胞、荧光蛋白标记细胞;Task 2 对象:血管、神经纤维、外周神经、肠神经系统、淋巴管。

Q4:标注长什么样?
稀疏/局部形态——这是自监督任务设定的一部分,不是缺陷遗漏。2024 届提供 315 个 3D patch(NIfTI,LPS+ 轴向)作为弱标注起点;2025 届延续稀疏标注设计。完整 3D 体素级真值不存在(§0.1 的算术)。

Q5:在哪里下载?
三层托管:① Zenodo DOI 10.5281/zenodo.15267392——只有挑战设计 PDF(cc-by-4.0,公开直链);② EBI BioStudies S-BIAD1196 / S-BIAD1197——2024 图像存档(FTP);③ Grand Challenge 官网 /dataset/——2025 图像,注册参赛后可下载,未登录访问返回 Forbidden。

Q6:license 是什么?
三口径并存:Zenodo 设计文档 cc-by-4.0;2024 图像数据集 CC-BY-NC(官网/arXiv 口径);S-BIAD1196 存档 CC BY 4.0。引用、再分发、商用前逐层确认(§5.4 对照表)。

Q7:用什么格式?
2025 体数据:16-bit TIFF;2024 patch:NIfTI(LPS+ 轴向约定)。跨年格式与轴向约定不同,加载器不通用。

Q8:评测指标是什么?
Dice(Dice similarity coefficient)为主指标。2024 首届顶级队伍达到 Dice >70%——在稀疏标注 + 10¹⁰ 体素的设定下这是有参考价值的地板线。

Q9:论文引用哪篇?
arXiv 2501.03880(v1 2025-01-07,v2 2025-01-12,17 名作者);挑战设计文档引 Zenodo DOI 10.5281/zenodo.15267392(引用 v3,2025-03-24)。两件套:论文讲方法与数据集,Zenodo PDF 讲挑战规程。

Q10:现在还能参赛/拿数据吗?
2025 届赛程已过(2025-10 MICCAI 会期),赛果以官网 leaderboard 为准;2026 第三届已立项(Zenodo 19733195,四赛道,引入 BRAIN Initiative CONNECTS 轴突数据)。图像获取通道(Grand Challenge 注册制)持续有效与否以官网当前状态为准。

Q11:这个数据集的"竞争对手"是谁?
严格说没有同型对手——"光片显微 + 透明化组织 + 自监督 + 多对象谱系"的组合在公开挑战赛中是唯一的。广义对照:全监督 CT 分割(TotalSegmentator)、人脑参考图谱(BigBrain)、2D 病理弱标签挑战赛(PANDA)各占一个维度,SELMA3D 的独特点是四维组合(§7.3 对照表)。

Q12:我只想练手 3D 分割,适合从这里开始吗?
不推荐作为第一个 3D 数据集——体量门槛(单幅 >40 GB 原始数据)与注册门槛会劝退初学者。建议先用库内 IXI Brain(轻量 MRI 3D)或 TotalSegmentator 子集入门,方法成熟后再来 SELMA3D 感受"尺度墙"(§10.2 路径)。

Q13:数据有没有官方的训练/验证划分?
训练集与测试集的划分由组织方掌握:训练数据发放给注册参赛者,测试集隐藏在评测容器后面。若官方提供了验证划分文件,用官方的(保证与 leaderboard 可比);没有则自行划分并明确声明——不要声称与官方 leaderboard 可比。

Q14:Aβ 斑块分割结果可以直接用于人类阿尔茨海默病研究吗?
不可以直接迁移——数据来自模型小鼠的 cleared 脑,与人类患者组织在病理形态、成像方式(荧光标记 vs 临床染色)、尺度上均有域差距。小鼠模型上的方法学结论(SSL 有效性、弱标注策略)可以迁移,模型输出不可直接当临床证据。

Q15:想跟进这个挑战赛的最新动态,关注什么入口?
三层入口按优先级:① 官网(selma3d2025.grand-challenge.org,news 与 leaderboard);② Zenodo(15267392 的版本更新 + 19733195 的第三届进展);③ GitHub(erturklab org 的代码更新)。三处任一更新都会先于文献出现(附录 C 观察哨)。

速览之外的一句忠告:十五问覆盖的是"事实",但这个数据集一半的使用风险在"预期管理"——带着全监督习惯来的团队,翻车不在数据获取(Q5/Q6 有答案),而在拿到数据后发现"没有 dense 真值可卷"。预期校正的完整版在 §0(问题陈述)、§3.5(标注形态)、§6(方法栈)——时间花得值。

§2 科学背景:光片显微镜、组织透明化与自监督的三角

2.1 光片显微镜(LSM):为什么它能拍下整个器官

传统共聚焦显微镜逐点扫描,拍一个完整小鼠大脑(毫米级厚度)既慢又伴随光漂白。光片显微镜(light-sheet microscopy, LSM)的思路不同:用一片薄的激光光片从侧面激发样品焦面,探测器从正交方向逐面采集——每次成像一整个平面,只有焦面被照亮,光漂白与光毒性大幅降低,成像速度提升若干数量级。这使 LSM 成为"全器官尺度三维成像"的事实标准:整只小鼠全脑、整个胚胎、完整外周神经节,都可以在亚细胞分辨率下体素化保存。

一句话记住 LSM 的本质:它把"成像"从串行的点采样变成并行的面采样——所有由此而来的优点(快、低毒、大体积)与所有由此而来的问题(大文件、照明条纹、面间配准)都是这个并行的直接推论。

代价同样明确——数据量。以 1-2 μm/voxel 的各向分辨率给一只小鼠全脑成像,体素数轻松越过 10¹⁰;若追求更细的轴突级分辨率,10¹²(10000³)并不罕见。SELMA3D 训练集"每幅 >10¹⁰、最大 10000³"的规格正是这条成像技术线的直接投影:成像能力的进步把分析能力甩在了身后。

2.1.1 三种三维光学成像技术的对照

理解 LSM 的位置,最好把它放回三维光学成像的三强对照里:

技术 成像方式 穿透深度 速度 光毒性 典型用途
共聚焦 逐点扫描+针孔滤杂光 浅(数十-数百 μm) 慢 高 薄样品、细胞级细节
双光子 近红外双光子激发 中(可达 ~1 mm) 中 中 活体浅层、皮层成像
光片(LSM) 薄光片整面激发 深(透明化后全器官) 快(整面并行) 低 cleared 组织、胚胎、全脑

对数据集含义的翻译:LSM 的"整面并行"解释了数据为什么是大体积连续采集(不是拼接的局部视野);"低光毒性"解释了为什么可以拍完整器官而样品不至于在成像中途退化。SELMA3D 的体数据规格是 LSM 技术特性的直接函数——换任何一种成像技术,这个数据集都不会是现在这个样子。

2.2 组织透明化:让光穿过去

LSM 要拍完整器官,样品必须透光。组织透明化(tissue clearing)通过置换脂质、匹配折射率,把不透明的生物组织变成光学透明状态,配合特异性染色(免疫染色、荧光蛋白表达、探针标记)让目标结构在三维中显形。SELMA3D 数据的成像链条因此是三段式:

小鼠组织 → 组织透明化(透明)→ 特异性染色/荧光标记(显形)→ 光片成像(三维记录)

这条链上有两个对算法侧重要的推论:

  1. 背景不是均匀噪声。透明化后的自发荧光、染色非特异性结合、光片照明条纹——体数据的背景结构远比临床影像复杂,预处理与域适配在方法设计中的权重更高。
  2. 同一链条可染不同靶标。换抗体/探针就能从"染血管"切到"染 Aβ 斑块",这正是 SELMA3D 对象谱系能铺开的物质基础(§3.2),也是 2026 第三届能引入 BRAIN Initiative CONNECTS 轴突数据的原因。

算法侧需要知道的透明化成像伪影清单(预处理设计的检查表):

伪影 成因 对分割的影响
自发荧光背景 组织内源荧光物质被激发 背景抬升,弱信号目标信噪比下降
光片照明条纹 光片强度不均/散射干扰 沿照明轴的条带状强度起伏
光漂白梯度 采集时间导致深层信号衰减 Z 向强度漂移,同结构跨深度对比度不一致
染色不均 抗体渗透深度受限 同类对象在不同区域的染色强度差异
样品形变 透明化/封片过程的体积变化 结构几何畸变,配准与统计的系统性误差

这五类伪影共同构成"显微域"与"临床影像域"的分界线——从 CT/MRI 迁移来的预处理直觉(比如简单的强度标准化)在此常常不够,域适配(强度归一化策略、条纹去除、深度补偿)是方法论文里能写出一整节的实操内容。

2.2.1 染色策略:对象显形的"可插拔"设计

透明化解决"光能穿过",染色解决"目标可见"。两条技术路线在 SELMA3D 对象清单中都有体现:

  • 免疫组织化学/荧光染色:以抗体特异性标记目标蛋白——c-Fos+(活动印记蛋白)、Aβ(淀粉样蛋白)、Iba1 类标记的小胶质细胞等属于此路;优点是特异性强、信号亮,缺点是渗透深度与批次一致性需要工艺控制(对应 §2.2 表中的"染色不均"伪影);
  • 转基因荧光蛋白表达:让特定细胞类型自带荧光(如特定神经元亚型的报告小鼠)——优点是标记稳定、无需染色步骤,缺点是表达水平依赖品系构建(对应"荧光蛋白标记细胞"对象的批次差异来源)。

算法侧的推论:同一类对象的信号形态会因染色路线不同而系统性差异——混用两种来源的对象图像训练时,强度归一化策略要分路线设计(或干脆在预训练阶段让网络见过两种形态)。

2.3 10000³ 的算术:标注为什么在物理上不可行

把"完整标注不可行"从直觉变成数字:

  • 体素计数:一幅 10000³ 体素图像含 10¹² 体素。假设标注员每秒判定 10 个体素(这是对 3D 结构判定相当乐观的速率),单幅需 10¹¹ 秒 ≈ 3170 年。
  • 降维标注同样吃紧:即使只标正交切面(每 100 层标 1 层 2D 轮廓再插值),10⁴ 层里要标 100 层 ×10⁴ 像素的轮廓,仍需数月每幅——而 SELMA3D 训练集有 58 幅。
  • 结论:在 LSM 尺度,"先全标注再训练"的全监督剧本失效,监督信息只能以稀疏点标注或局部 patch(2024 届 315 个 patch)形态存在。数据多、标注少且标注不可扩展——这是 self-supervised learning 成为主线的结构性原因,不是方法时髦。

2.3.1 体素算术对照表(把"大"分级)

图像类别 单幅体素数 16-bit 原始体量 直观参照
常规 2D 病理 WSI(10x 全景) ~10⁹ 像素 ~数 GB(RGB 三通道) 千兆像素但只有一层
常规 3D CT(全胸) ~3×10⁷ ~60 MB 临床深度学习入门规格
TotalSegmentator 级 CT ~10⁷-10⁸ 0.1-0.2 GB 大规模全监督 3D 分割
SELMA3D Task 2 下限 >10¹⁰ >20 GB 整图已不可直接进内存
SELMA3D Task 1 下限 >2×10¹⁰ >40 GB 一幅≈一部 4K 电影的 40 倍码率
SELMA3D 单幅上限 10000³=10¹² ~2 TB 滑窗推理是唯一合理姿态

读法:从 TotalSegmentator 到 SELMA3D 是 2-4 个数量级的跨度——这不是"数据集大一点",是工程范式切换(整图载入 → 流式分块)。

2.4 自监督/半监督在这里具体指什么

SELMA3D 语境下的 SSL 并非单一范式,而是一个方法谱系(§6 详述技术路线),共同点是利用无标注 LSM 体数据本身的结构:

  • 前文本/上下文任务:遮挡重建、局部排序、去噪——让网络从体数据自身学习"显微图像长什么样"的先验;
  • 一致性正则:对同一结构的不同视角/变换/扰动要求预测一致——适合光片成像多向采集的物理特性;
  • 弱标注传播:从稀疏点标注或局部 patch 出发,借助网络先验把监督信号扩散到整个体数据——半监督的核心动作;
  • 两阶段组合:无标注预训练 + 稀疏标注微调,是 2024 届参赛队伍的常见路线(§7.1 赛果佐证)。

增广安全集(SSL 阶段什么变换可以放心用——由对象生物学性质决定):

增广 Task 1 离散 Task 2 连续 原因
强度类(亮度/对比度/噪声/Gamma) 安全 安全 不改变几何
各向同性缩放/旋转(小角度) 安全 安全(保连通) 几何近似保持
90° 倍数旋转 安全 安全 网络拓扑不变
镜像翻转 基本安全 慎用 生物结构方向性(肠管走向、血管不对称)被破坏
大角度 3D 旋转 慎用 慎用 各向异性 spacing 下插值伪影重

一张表值回一节:SSL 的预训练收益常被"有毒增广"吃掉——尤其在 10¹² 体素语料上,坏增广被放大一亿倍。

对数据集使用者而言,这意味着:SELMA3D 的"无标注部分"不是废料而是主粮——58 幅体数据中未被标注覆盖的绝大多数体素,是 SSL 方法合法的训练素材。

2.5 对象谱系为什么宽:一个平台,多种生物学问题

回看 Task 1 的对象清单:细胞核(通用参照物)、c-Fos+ 激活神经元(神经活动印记)、Aβ 斑块(阿尔茨海默病模型病理)、小胶质细胞(神经免疫)、淋巴细胞(免疫)、荧光蛋白标记细胞(基因工具);Task 2:血管、神经纤维、外周神经、肠神经系统、淋巴管。这份清单的跨度(神经/免疫/血管/病理)只有一条解释:透明化 + LSM 是平台技术,靶标是可插拔的。SELMA3D 借挑战赛把"平台级分割能力"一次性铺开——这与"为单一器官/单一病理造数据集"的传统路线形成方法学对照。

2.5.1 从 2D 显微分割到 3D 的范式迁移:不是分辨率问题,是拓扑问题

对库内读者的意义:如果你在做跨对象/跨模态的通用分割模型(foundation model 路线),SELMA3D 提供的正是"对象谱系宽 + 域(显微/透明化)独特"的组合压力测试。第三方已经开跑:LSM Foundation Model 数据集(Zenodo 20149070)复用 SELMA3D patch 作为预训练语料之一(§7.2)。

显微镜图像分割的文献主流是 2D(单张组织切片/视野),SELMA3D 所在的 3D 光片世界与它有一条容易被低估的鸿沟——2D 里"相邻"的物体在 3D 里可能相距甚远,2D 里"断开"的结构在 3D 里可能连通:

  • 2D 中两个核看起来贴在一起(实例分割难点),3D 中它们可能只是 Z 轴上的投影重叠——3D 的实例分离反而更"物理";
  • 2D 中一段血管中断于视野边缘(连通性无从谈起),3D 中它是同一网络的两段——连续结构的全部意义只在 3D 中存在;
  • 2D 的标注工具链(多边形、涂刷)成熟数十年,3D 标注工具的效率低一个数量级——这正是 §2.3 标注不可行算术在工具维度的根源。

范式迁移的操作结论:2D 显微分割的成熟组件(预训练编码器、半监督框架、实例分离算法)进入 3D 光片场景时,凡是涉及"邻接/连续/拓扑"假设的部分都要重新论证——这解释了为什么 SELMA3D 选择把"连续结构"单列为赛道(§0.3),也解释了为什么 2D SOTA 方法直接搬到光片体数据上常常表现平平。给方法迁移者的判断口诀:2D 里调好的组件,凡不涉及空间拓扑的可直接带,涉及空间拓扑的重做——这一句话能省掉大半盲目移植的时间。2D 检测器的置信度校准、2D 分割的损失函数设计、2D 数据增广的几何直觉——按口诀逐项过一遍:可带的直接带,要重做的进 §6 的方法栈。

跨尺度迁移的双向问题(把 §0.4 的光谱表变成两个具体研究问题):

  • 自下而上(显微 → 临床):在 SELMA3D 上学到的"管状结构追踪"先验能否加速 TotalSegmentator 式 CT 血管分割?直觉上"管状性"是跨尺度不变量,但 spacing 差异(微米 vs 毫米)与对比度机制(荧光 vs HU 值)意味着先验转移需要中间适配层——这是迁移学习里"表征层可迁、输入层不可迁"的教科书案例;
  • 自上而下(临床 → 显微):临床 3D 分割的多尺度网络设计(U-Net 族)能否直接搬到 10¹² 体素上?答案是架构可搬、实例化不可搬——下采样率、窗口策略、归一化统计全部要按显微规格重算(§6.2)。

两个方向都指向同一个结论:跨尺度迁移的可行单元是"设计模式"而非"权重"——把它写进迁移研究的问题定义里,能省掉大量无效的权重直接微调实验。

§3 数据集本体:规模、对象与格式

先给一个"读表前的心智模型":这一节的所有数字都要放进"大体量体数据"的坐标系里读——58 幅在样本数上不大,在体素总量上超过绝大多数 3D 医学数据集一个数量级以上;单幅规格(§2.3.1)决定了所有"常规"操作的默认失效。

3.1 总体规格表(2025 训练集)

属性 Task 1(isolated) Task 2(contiguous)
图像数 30 幅 >25 幅(arXiv 口径推算 28;官网未确认精确数)
单幅体素下限 >2×10¹⁰ voxels >1×10¹⁰ voxels
单幅体素上限 可达 10000³(10¹²) 可达 10000³(10¹²)
对象拓扑 离散个体 连续网络
任务本质 3D 检测 + 实例分割 管状结构分割 + 连通性
格式 16-bit TIFF 体数据 16-bit TIFF 体数据
物种 小鼠 cleared 组织 小鼠 cleared 组织

2024 首届对照:35 幅(每幅 >1000³ voxels)+ 315 个标注 3D patch。两届数据不是同一批,规模、格式、leaderboard 均独立(坑 7)。

规格表的三条解读:

  1. Task 1 的体素下限(>2×10¹⁰)高于 Task 2(>10¹⁰)——离散结构赛道的图像更大,这与"细胞核密集分布需要更大视野"的采样逻辑一致;两条赛道单幅数据体量下限差一倍,工程管线的内存规划要分别做;
  2. 下限是官方承诺、上限是能力边界——"每幅 >10¹⁰"是训练集的入场规格,"最大 10000³"是技术可达的峰值;准备算力时按下限规划存储、按上限规划推理(滑窗管线必须能吃下 10¹²);
  3. 58 幅的"小"与"大"——按样本数看这是小数据集(对比 ImageNet 级),按体素总量看是大数据集(>10¹² 体素总量);SSL 方法的样本效率优势在此场景被数据形态放大:单幅图像内部的无标注上下文本身就是海量训练信号。

3.2 Task 1 离散结构:七类对象

七类对象的共同点是"目标可个体化"——分割输出可以也应该区分"第几个核"“第几处斑块”,这是它们与 Task 2 连续网络的本体论差异。

对象 生物学背景 分割难点
细胞核 通用标记(核染色) 密集堆积时个体分离(实例分割经典难题)
c-Fos+ 激活神经元 即早基因标记神经活动 信号强度动态范围大,弱阳性检出
Aβ 淀粉样斑块 阿尔茨海默病模型病理沉积 形态不规则、边缘弥散、与背景对比度低
小胶质细胞 脑内免疫细胞(分枝状形态) 细小突起易断,形状高度可变
神经元 胞体+树突的完整形态 胞体与突起的尺度跨三个量级
淋巴细胞 免疫监视浸润 小目标、低信噪比
荧光蛋白标记细胞 基因编码工具标记 依赖表达水平,批次差异

七类对象共享"离散个体"的拓扑,但形态学从球形(核)到高度分枝(小胶质)不等——对方法而言这是"同一拓扑族内的形态学压力测试"。

形态学谱系与检测难度轴:把七类对象按"形状复杂度 × 密度"摆开,可以看到 Task 1 内部的难度梯度——

形状简单且稀疏 ←─── 形态学难度轴 ───→ 形状复杂且密集
  荧光蛋白标记细胞    淋巴细胞   Aβ 斑块   神经元    细胞核     小胶质细胞
  (大而边界清)    (小而少)  (边界弥散)(胞体+突起)(密集堆积)(高度分枝)

两端方法含义:左端对象用轻量检测器即可;右端(细胞核密集堆积、小胶质分枝)是实例分割的经典硬骨头——3D 中做实例分离(分水岭、聚类、topology-aware 后处理)的成本随密度超线性增长。一条赛道内跨度这么大,意味着"单模型打全场"不现实,分对象类型的策略切换或混合专家路线是参赛方法的合理预期。

3.3 Task 2 连续结构:五类网络

先立一个判据:连续结构的分割质量不能用"目标检出率"衡量——网络没有"个"的概念,只有"连通与断开"。这决定了本表第三列的难点全部是拓扑性的。

对象 生物学背景 分割难点
血管 全器官血管树/网 大跨度管径(主动脉到毛细血管)、分支密集
神经纤维 中枢神经投射束 束间交叉穿越、平行走行易粘连
外周神经 离开中枢的神经干 低对比度、走行长距离
肠神经系统 肠壁内神经网络(神经元+胶质) 贴壁平铺网络、密度极高
淋巴管 淋巴引流网络 管壁薄、塌陷形态多变

连续结构的评测天然关注连通性:一条血管在体数据深处断开 3 个体素,Dice 可能只掉 0.1%,但下游的血流拓扑分析已经失效。这是 Task 2 与 Task 1 在指标偏好上的本质分歧(§6.4),也是 2026 第三届把 sparse/dense annotation 纳入赛道划分的动机之一——标注密度对连通型任务的影响远大于对离散型任务的影响。

连通性敏感性的量化直觉:设一条血管网络的体素占图像 0.5%,被切出 100 处各 3 体素的断口——总误差体素 300 个,占全图 10⁻⁵ 量级,Dice 几乎不动;但该网络的连通分量数从 1 变成 101,所有依赖"从 A 点能否到 B 点"的下游分析(供血路径、引流路径、轴突投射追踪)全部作废。结论:Task 2 的方法评审必须包含拓扑级自查,Dice-only 报告在这个赛道是自欺(§6.4 的指标语义由此而来)。

3.4 格式细节与工程含义

  • 2025 体数据:16-bit TIFF。多页/大体量 TIFF 读取注意:常规图像库(PIL 等)在 10¹⁰+ 体素文件上会直接失败,需用 tiled/tiff 系列(tifffile、bigtiff)流式读取;16-bit 位深保留荧光动态范围,转 8-bit 前需确认强度直方图。
  • 2024 patch:NIfTI(LPS+ 轴向)。NIfTI 的 LPS+ 神经影像惯例(左手系坐标、原点定义)与体数据 TIFF 的"纯数组"语义不同——把 2024 patch 当纯数组读会得到镜像/翻转错误。跨年混用同一加载器是必踩的坑(坑 6)。
  • 体素物理尺寸:各向异性常见(光片轴向分辨率通常劣于面内),任何以体素为单位的距离/体积计算前先乘 spacing;挑战赛评测在体素空间还是物理空间执行,以官方评测容器为准。
  • 文件体量级:单幅 10¹⁰-10¹² 体素 × 2 字节 = 20 GB-2 TB 量级原始数据。下载、存储、I/O 都按"每幅一个大文件"的规格规划,58 幅训练集是"大型数据集"而非"一个数据集文件夹"。

最小可运行读取示例(两种格式的打开方式,供管线自检):

# 2025 体数据:16-bit TIFF —— 流式读取,不整载
import tifffile
with tifffile.TiffFile("selma3d_task1_image01.tif") as tif:
    arr = tif.series[0].asarray(out="memmap")   # memmap: 按需分页
    print(arr.shape, arr.dtype)                  # 期望 dtype=uint16
    slab = arr[0:512, :, :]                      # 切一块 Z 向薄层

# 2024 patch:NIfTI —— 注意方向矩阵(LPS+)
import nibabel as nib
img = nib.load("selma2024_patch_0001.nii")
print(img.shape, img.header.get_zooms())         # zooms = 体素物理尺寸
data = img.get_fdata(dtype="float32")            # patch 小,可整载

自检要点:TIFF 的 dtype 必须是 uint16(位深压缩会毁荧光动态范围);NIfTI 打印 zooms 确认各向异性程度,任何距离计算先乘 spacing。

3.5 标注形态:稀疏、局部、以及"没有 dense 真值"的后果

必须正面回答一个问题:这个数据集没有 ground truth 吗? 准确说法是——没有全器官 dense 真值,但有可用监督信号:

  1. 稀疏点标注:在体数据中为部分目标实例给出中心点/短轨迹,供 SSL 方法做弱监督锚点;
  2. 局部密集标注:2024 届 315 个 3D patch(NIfTI),在小体积内提供体素级真值,供微调与验证;
  3. 测试集评测:官方在隐藏测试集上评测(Grand Challenge 容器提交),评测区域的真值由组织方持有,参赛者不可见。

后果有三,全部写进 dataLimitations:

  • 任何"该数据集上 Dice 0.95"式的声明都要先问在哪个监督设定下(全监督 on patches?SSL on volumes?);设定不同,数字不可比。
  • 稀疏标注对评测的覆盖度有限——模型在未被标注覆盖区域的假阳性/假阴性可能不被计入(或以特殊指标处理),评测语义以官方文档为准。
  • 若你的下游任务需要 dense 全器官真值(比如解剖图谱构建),SELMA3D 提供的是"起点 + 弱监督",不是终点。

弱标注的三种常见误用(从设定推出的反模式,设计实验前自查):

  1. 把 patch 真值当全图真值用:315 个 patch 之外的区域不是"负样本",是"未知区域"——把未标注区域当背景训练会把大量真实结构教成背景,模型学得越"好"错得越深;
  2. 把稀疏点标注当检测召回率上限:稀疏点只是监督锚点,不是全量实例清单——在点标注之外检出的实例可能是对的;
  3. 跨对象混合平均:七类离散对象+五类连续网络的成绩平均成一个数——对象难度跨度大(§3.2 难度轴),平均后失去诊断价值。

3.5.1 监督信号的量化盘点(SSL 方法设计的预算表)

把本数据集的"监督资产"汇总成一张设计输入表——任何 SSL/弱监督方法落地前,先对着这张表问"我用了几项、漏了几项":

信号资产 规模 形态 典型用途
无标注体数据 58 幅 × >10¹⁰ voxels 16-bit TIFF SSL 预训练(主力资产)
标注 patch(2024) 315 个 NIfTI 密集标注 微调 / 验证 / 蒸馏教师
稀疏点/局部标注(2025) 随训练集发放 点/短轨迹/局部掩码 弱监督锚点
对象分类学 7 离散 + 5 连续类 语义体系 分类头设计 / 分对象评测
2024 届 leaderboard 5 队成绩 Dice 数字 基线对照
预处理代码 SCP-Nano 裁剪脚本 Python 层 A 工程起点

盘点结论:这个数据集的"监督密度"(标注体素 / 总体素)极低,但"监督资产多样性"高——信号形态覆盖了无标注/点/块/语义四个层级。方法设计的最大空间恰恰在资产组合:单一资产的利用率都有天花板(纯 patch 微调受 315 限制、纯 SSL 预训练缺锚点),组合拳(§6.3)才有空间。

3.6 与 2024 届数据的继承关系

2024 届(35 幅 + 315 patch)与 2025 届(58 幅)的关系是扩展而非替换:

  • 2024 数据已存档 EBI BioStudies(S-BIAD1196 / S-BIAD1197),是三年来唯一"公开直连"的图像层(S-BIAD1196 标 CC BY 4.0;2024 官网口径 CC-BY-NC——冲突存照 §5.4);
  • 2025 训练集 58 幅在规模(>10¹⁰ vs >10⁹)与对象谱系上扩展,托管在 Grand Challenge 注册制下;
  • 方法开发者合理的策略:用 2024 存档做方法原型( openly 可得),再注册下载 2025 数据做正式实验——但注意两者 leaderboards 不可互相换算(坑 7)。

两届数据属性对照速查(写论文/配环境时最常翻的表):

属性 2024 届 2025 届
幅数 35 58(arXiv 口径)
单幅下限 >1000³(10⁹) Task 1 >2×10¹⁰ / Task 2 >10¹⁰
标注形态 315 个 NIfTI patch + 弱标注 稀疏标注延续,patch 起点
获取层 BioStudies(公开 FTP) Grand Challenge(注册制)
赛果 84 注册/5 队/Dice >70% 以官网 leaderboard 为准
适用场景 原型/教学/轻量实验 正式方法评测/预训练

背下这张表的用法比背下数字重要:"小-公开-弱标注"的 2024 是方法孵化器,"大-注册-弱标注"的 2025 是方法考场——两届各就其位,混用则两败(坑 7)。

3.7 数据版本管理:TB 级数据集的卫生习惯

面对"58 幅 × 数十 GB"的体量,日常实验的数据管理建议:

  • 原始数据只读:下载完成后把原始层设为只读,所有预处理输出另建派生层(分块缓存、归一化结果)——混写原始层是 TB 级数据最常见的不可逆事故源;
  • 记录数据指纹:为每幅图像记录字节数与哈希(哪怕只对头部 1 MB 做),实验间的数据一致性可查;
  • 派生缓存带参数命名:task1_img01_win256_ovr50_norm-none.tif 式命名让缓存可追溯(窗口/重叠/归一化参数在文件名里);
  • 届次分目录:selma3d_2024/ 与 selma3d_2025/ 物理隔离(坑 7 的文件系统级防御);
  • 许可信息随目录:每层目录放一份 LICENSE 文本或 README 指针(坑 3 的文件系统级防御)——半年后翻数据的你,会感谢现在写说明的你。

这五条没有一条是 SELMA3D 特有的——它们是所有大体量数据集的通用卫生。之所以值得写,是因为 SELMA3D 的规格会把小数据集上"无所谓"的习惯变成大事故:一个误写的缓存文件在 100 GB 数据集上浪费几分钟,在 2 TB 数据集上浪费一晚。

§4 挑战赛设计沿革:三届一条线

4.1 时间线总表

届次 年份 载体 数据规模 关键设计 存档凭证
首届 2024 MICCAI 2024 卫星(selma3d.grand-challenge.org) 35 幅(>1000³ voxels)+ 315 标注 patch 两任务划分确立;84 人注册、5 队提交、Dice >70% EBI BioStudies S-BIAD1196/S-BIAD1197
第二届 2025 MICCAI 2025 in-person satellite event(selma3d2025.grand-challenge.org) 58 幅(Task 1 30 + Task 2 >25,单幅最大 10000³) 训练集扩量;设计文档 Zenodo 化(cc-by-4.0) Zenodo 15267392 v3(2025-03-24)+ arXiv 2501.03880
第三届 2026 立项中 新增 BRAIN Initiative CONNECTS 轴突数据 四赛道:isolated/contiguous × sparse/dense annotation Zenodo 19733195

三届一条主线:任务分类学逐届细化(两任务 → 拓扑×标注密度四分),数据规模与对象谱系逐届扩张,凭证与规程逐届更正式(网页 → Zenodo DOI 化设计文档 → arXiv 论文)。

三届凭证链对照("到哪里找官方说法"的速查表):

要找什么 2024 届 2025 届 2026 届
赛事规程 官网网页 Zenodo 15267392 PDF(cc-by-4.0) Zenodo 19733195 立项文档
数据集论文 无独立论文 arXiv 2501.03880(v2) 待出
图像存档 BioStudies S-BIAD1196/97 Grand Challenge 注册制 待放出
赛果记录 官网 + arXiv 摘要(84/5/>70%) 官网 leaderboard(待核验) 未开赛

读法:2025 届是凭证链的完备转折点——从"网页存证"升级为"DOI 存证";引用 2025 届时每个事实都能落到可持久访问的对象上,这是本条目能给出高文档完备评级的直接原因(附录 B)。

4.1.1 首届 2024:从零到"跑通"

首届要同时回答三个问题:这样的数据能不能公开(答案:BioStudies 存档)、SSL 方法能不能在此尺度运行(答案:5 队提交)、结果好不好读(答案:Dice >70% 的聚合地板线)。84 人注册说明关注面足够,5 队完赛说明工程漏斗真实存在(§7.1 解读一)——这两个数字放在一起,恰好构成了"需求大、门槛高"的证据组合,是 2025 扩量的决策依据。315 个标注 patch 的设计也属首届遗产:它定义了"这个挑战的弱标注长什么样",第二届沿用了这一监督形态。

4.1.2 第二届 2025:规格跃升与凭证链补全

第二届做了三件结构性的事:

  1. 数据规格跃升:35 幅 → 58 幅,单幅下限从 >1000³(10⁹)抬到 >10¹⁰,上限到 10000³——从"大"到"工程范式切换"级别(§2.3.1 分级表);

两届规格对照细看更有信息量:单幅体素下限抬升约一个数量级(>10⁹ → Task 1 >2×10¹⁰),但 315 patch 式的弱标注形态未变——数据量与监督信号的剪刀差在扩大,这是挑战赛对 SSL 方法依赖度加深的直接体现:2024 年"少量 SSL + 大量手工工程"也许能打,2025 年没有扎实的自监督预训练,弱标注微调根本喂不饱模型。方法选型随数据演化的这个梯度,本身就是两届数据并存的学术价值。

  1. 凭证链补全:设计文档上 Zenodo 拿 DOI(cc-by-4.0),方法论上 arXiv(2501.03880)——首届以网页为主的规程信息获得了持久引用层;
  2. 任务定义延续:两赛道划分不变,对象清单延续首届分类学——保证两届方法与结果的对话性(但 leaderboard 依旧独立,坑 7)。

4.1.3 第三届 2026:从挑战赛到数据生态

第三届立项(Zenodo 19733195)的两个信号值得放大读:其一,任务矩阵从 2 扩到 4(拓扑 × 标注密度),说明两届运行暴露了"稀疏标注连续结构"这一最硬格子的特殊性——把它单列,等于官方承认该格子的评测语义必须独立;其二,BRAIN Initiative CONNECTS 轴突数据的引入让数据源从"自有采集"转向"国家级项目接入"——挑战赛开始扮演"方法社区与数据基础设施的接口"角色,这是从赛事到生态的质变。

4.2 2025 届赛程与规则要点

官网 timeline 与 participate-rules 页确立的骨架(细节以官网当前版本为准):

  • 注册制参与:Grand Challenge 账号注册 + 参赛登记后获得数据下载权限——未登录访问 /dataset/ 页返回 Forbidden(403),这是平台权限设计而非故障;
  • 容器化提交:参赛方法封装为算法容器上传平台,官方在隐藏测试数据上运行——参赛者全程不接触测试真值(Grand Challenge 平台标准机制)。容器提交流程按平台惯例分四步:方法封装(Docker 化)→ 本地干跑验证 → 上传与平台侧试运行 → 正式评测计分;每步的细节以平台文档与赛事规则页为准,封装接口(输入输出格式、运行时约束)务必对照官方模板;
  • 评测指标:Dice 为主(arXiv 摘要与官网口径);两任务的细分评测语义以各 task 页与评测容器为准;
  • 奖项:官网明示奖品含 Jellycat “Selma SLOTH” 毛绒玩具——赛事以树懒 Selma 为吉祥物(SELMA 并无官方缩写展开,坑 1 侧证);
  • 学术产出:挑战赛论文 arXiv 2501.03880(2025-01 提交)先行发布数据集与规程,赛果随 MICCAI 会期卫星活动揭晓。

赛事日历提示:MICCAI 卫星挑战赛的典型节奏是"春季注册开放 → 夏季数据发放与开发 → 会期(10 月前后)最终评测与颁奖"——倒推的话,想参赛的团队实际开发窗口只有数月,层 A 工程必须赛前就绪(§4.2 预算表)。非参赛用途(数据获取)不受赛程限制,注册通道常年有效与否以官网为准。

参赛者的现实预算表(从规格反推的投入量级,供报名前自我评估):

项 量级估算 说明
存储 TB 级(原始+缓存 2-3 倍冗余) 按 §3.4 规格,58 幅全量+派生层
下载 天级 BioStudies FTP / Grand Challenge 分发,看带宽
层 A 开发 1-2 周级工程 滑窗管线+融合+验证(复用 SCP-Nano 可压缩)
预训练算力 数百 GPU 时级 3D masked modeling on 10¹² 体素级语料
微调+推理 每赛道数十 GPU 时级 两个赛道分别出模型
后处理工程 与网络调参同级 尤其 Task 2 的连通性环节(§6.4)

表里没有"模型设计创新"这一项——不是它不重要,而是它挤进前六都难:这是 SELMA3D 与常规挑战赛最大的预算结构差异(§6.1 三层栈的实践含义)。

4.3 2026 第三届:四分法与 CONNECTS 轴突数据

第三届设计文档(Zenodo 19733195)把任务矩阵从 2×2 化:

sparse annotation dense annotation
isolated 离散结构 + 稀疏标注 离散结构 + 局部密集标注
contiguous 连续结构 + 稀疏标注 连续结构 + 局部密集标注

两条新增信息值得单列:

  1. 标注密度成为赛道维度——承认"稀疏标注下连续结构分割"与"密集标注下连续结构分割"是难度与评测语义都不同的两个问题(§3.3 的连通性敏感性问题被制度化了);
  2. BRAIN Initiative CONNECTS 轴突数据进入——美国 NIH 脑计划连接组学项目(CONNECTS: Connectomes in neurological and psychiatric disorders… 轴突投射数据)的全脑轴突成像将构成新数据源。这意味着 SELMA3D 数据生态开始与国家级脑科学计划的数据基础设施接轨,"光片显微 + 自监督分割"从单一挑战赛演化为持续数据生态的迹象明确。

矩阵的设计含义值得展开:四格的难度分布极不均匀——isolated+sparse 是最"友好"的格子(检测式弱监督成熟),contiguous+sparse 是最"硬"的格子(弱标注下保拓扑:§3.3 的连通性问题与 §3.5 的标注上限在此叠加);2026 届把它单列,等于为这格设立专项擂台。对参赛者的导航意义:先看自己方法落在哪个格子,再决定参哪条赛道——四分法让"扬长避短"首次成为合法策略(2025 届两赛道是必答题,2026 届是选择题)。

4.4 为什么这个沿革对使用者重要

  • 引用时效:2025 届赛果、2026 届规程都可能更新——任何"截至"类陈述都应带日期与来源(本条目核验日期 2026-09-27);
  • 数据版本:Zenodo 15267392 有版本链(v3,parent record 15077390)——引用时用 DOI 概念号(concept DOI 会指向最新版)或明确版本号;
  • 方法可迁移:2024 届的 patch(BioStudies 公开)到 2025 届的全量体数据(注册制),同一方法在两届数据上的表现差异本身就是"弱标注→大体量"扩展性的实验素材。

从三届沿革还能读出一个元观察:挑战赛作为数据集发布机制的独特优势在"强制完备"——为了让别人参赛,主办方被迫把规程写成文档(Zenodo)、把数据整理成可下载的形态(BioStudies/平台)、把评测做成可复现的容器(Grand Challenge)——这些"被参赛逼出来的完备性"正是纯学术论文发布的数据集常常缺的。三届沿革越完整,数据集作为基础设施的可信度越高。

§5 获取与许可:三层异构的门怎么进

5.1 三层托管总览

层 1  Zenodo(设计文档)        公开直链,cc-by-4.0,即刻可得
层 2  EBI BioStudies(2024 图像) 公开 FTP,S-BIAD1196 标 CC BY 4.0 / 官网口径 CC-BY-NC(冲突存照)
层 3  Grand Challenge(2025 图像)注册制下载,未登录 Forbidden(403)

三层各自独立,没有任何一层可以替代另一层:层 1 是规程不是图像;层 2 是 2024 老数据不是 2025 新数据;层 3 是本体但需注册。想绕过任何一层直接拿到"全部东西"的路径不存在。

三层结构的使用成本速览(帮你把"获取"排进项目计划):层 1 成本≈5 分钟(网页下载);层 2 成本≈数小时到一天(FTP 传输为主,体量决定);层 3 成本≈数天(注册+审核+TB 级下载)——排期时按"层 3 决定关键路径"原则规划:注册流程与层 1/2 的使用并行启动,勿串行等待。

与"单一平台集中托管"的对比(理解异构的得与失):集中式(所有东西在一个 DOI 下)的检索与下载摩擦最小,但持久性绑定单一平台、许可只能一刀切;SELMA3D 的分布式(规程/存档/运营分离)摩擦高一层,换来的是每层"内容-平台-许可"匹配精确、单层故障不拖垮全链。对使用者的含义:把 §5.1 的三层结构当成数据集的"系统架构图"来理解,而不是当成需要吐槽的混乱——异构不是 bug,是该数据集规模与使命下的工程选择。

为什么官方选择三层而不是一处集中(从各层内容性质反推的合理化解释,非官方声明):规程文档需要 DOI 化的持久引用 → Zenodo;2024 图像是存量资产,BioStudies 的 accession 制存档能保证长期可用性 → EBI;2025 图像是赛事运营资产,需要与注册/提交/评测联动 → Grand Challenge 平台。每层都是"内容性质 × 平台能力"的匹配结果——对数据集建设者的借鉴:托管分散不可怕,凭证链完整、每层口径清晰才是关键。

5.2 层 1:Zenodo——先拿说明书

  • 入口:https://zenodo.org/records/15267392 (DOI 10.5281/zenodo.15267392)
  • 内容:挑战设计文档 PDF 一个文件,146,647 字节;v3,2025-03-24 发布;版本链 parent record 15077390;元数据 meeting 字段 “MICCAI 2025”;license cc-by-4.0
  • 用途:赛制、评测规程、任务定义的权威书面凭证——写论文引用挑战赛时,这是可引用的正式对象(DOI)
  • 注意:Zenodo 搜索 “SELMA3D” 至少命中三条记录——15267392(2025 设计文档)、19733195(2026 第三届立项)、20149070(LSM Foundation Model 语料,内含 SELMA3D patch 687.1 MB)——三条记录用途各异,勿混(坑 8)。

获取操作要点:

  1. 访问记录页确认版本(v3)与 license 标注(cc-by-4.0)后下载 PDF;
  2. 引用时使用 DOI(10.5281/zenodo.15267392);如需锁定具体版本,使用带版本号的 DOI(Zenodo 每个版本有独立 DOI,concept DOI 恒指最新);
  3. 该 PDF 是规程的权威书面凭证——赛制争议以它 + 官网当前版本为准,勿以二手转述为准;
  4. 若记录页未来出现版本更新(v4 及以后),先读版本说明再决定引用哪版——版本链(parent 15077390)的存在意味着官方保留了修订通道。

5.3 层 2:EBI BioStudies——2024 图像的公开存档

  • 入口:EBI BioStudies 检索 accession S-BIAD1196 与 S-BIAD1197(2024 图像存档两条记录)
  • 获取方式:FTP 协议下载(BioStudies 标准分发),需要支持断点续传的 FTP 客户端;文件体量按 §3.4 规格预估

FTP 大文件下载的四个细节(TB 级传输翻车高发区):① 用 wget -c / curl -C - 保断点续传,跨境链路中断是常态不是异常;② 限速与并发平衡——单连接跑满不如多文件小并发稳定;③ 先下 patch(小文件、标注素材)验证管线,再下大体数据;④ 下载与校验分开做,校验(清单/哈希)不过的重下分片而不是全量。

  • 许可:S-BIAD1196 页面标注 CC BY 4.0;而 2024 年数据集在官网/arXiv 口径下为 CC-BY-NC——两个来源对"同一批 2024 数据"给出不同许可表述,本条目不裁决,只存照(§5.4)。实操建议:以 BioStudies 页面当前标注为再分发依据,商用场景双口径从严处理
  • 内容价值:315 个标注 patch(NIfTI)与 35 幅体数据是当前唯一公开直连的图像层——方法原型开发的起点

获取操作要点:

  1. BioStudies 站内检索 accession(S-BIAD1196 / S-BIAD1197),阅读记录页的描述、文件清单与 license 标注;
  2. 用支持断点续传的 FTP 客户端下载(wget/curl 均可,加续传参数防大文件中断);
  3. 下载后先做完整性校验(文件清单/校验和,若记录页提供)再投入实验;
  4. patch(NIfTI)优先上手——体量小、带标注,是管线联调的第一素材;35 幅体数据按 §3.4 规格准备存储。

5.4 层 3:Grand Challenge——2025 图像本体与注册制

  • 入口:https://selma3d2025.grand-challenge.org/ → /dataset/ 与 /dataset-for-task-2/
  • 访问事实(存照):2026-09-27 核验,未登录状态下两个图像页均返回 Forbidden(403)——WebFetch 与 curl 双通道复现。这不是"链接坏了",是注册权限设计:注册 Grand Challenge 账号并完成参赛/使用登记后可下载
  • 对 AI-Ready 评级的影响:图像本体"机器可及性"受注册墙限制——元数据(Zenodo/官网/arXiv)与 2024 图像(BioStudies)机器可及,2025 图像层需要人工注册动作。这是本条目在 AI-Ready 评级中如实降档的依据,也是未来"图像公开化"升级观察项(附录观察哨)
  • 注册后获取:按页面指引下载 16-bit TIFF 体数据(58 幅,规格见 §3.1)

注册流程的典型步骤(按 Grand Challenge 平台惯例,细节以官网为准):① 创建平台账号(邮箱验证);② 在挑战赛页面完成参赛登记(可能需要填写机构、用途声明);③ 等待资格审核(部分赛事有人工环节);④ 获得数据页访问权后按清单下载。全流程的人工延迟主要在 ②③——计划实验排期时为注册预留数天余量,勿把"下载数据"当成零成本动作写进项目计划。

5.5 许可对照表(三口径并存,禁止互相外推)

对象 口径来源 license 可否商用
挑战设计文档 PDF Zenodo 15267392 页面 CC BY 4.0 可(署名)
2024 图像数据集(官网口径) SELMA3D 官网/arXiv CC-BY-NC 否(非商业)
S-BIAD1196 存档(BioStudies 页面标注) EBI BioStudies CC BY 4.0 可(署名)
2025 图像 Grand Challenge 平台条款 注册后按平台条款 以平台条款为准
arXiv 论文文本 arXiv 2501.03880 arXiv 分发条款 引用自由,再分发按条款

三条实操纪律:

  1. 引用:设计文档引 Zenodo DOI(cc-by-4.0 明确可引);数据使用在论文方法节写明获取层与许可口径;
  2. 再分发:2024 图像若再分发,以 BioStudies 当前标注为准并保留双口径存照说明;2025 图像再分发受限(注册制),引导下游自行注册;
  3. 商用评估:全数据集层面按"最严口径"(CC-BY-NC 覆盖 2024 官网口径)评估,任何"CC BY 4.0 全覆盖"的说法都与来源不符。

四类使用情境的许可速判:

情境 结论 依据
论文引用挑战赛/数据集 自由(正确引用即可) 学术引用不受 license 限制
用 patch 训练模型并发表 可行,方法节写明来源与获取层 CC BY 4.0 / CC-BY-NC 均允许学术使用
模型权重再分发 以训练数据最严口径自查声明 衍生物条款按上游 license
商业产品内嵌 2024 图像 不建议(官网口径 CC-BY-NC);S-BIAD1196 口径冲突需法律评估 坑 3、§5.5 对照表
商业产品内嵌 2025 图像 按 Grand Challenge 平台条款,默认从严 注册制 + 平台条款
教学/课程使用 2024 存档 可行(学术用途,署名) CC BY 4.0 / CC-BY-NC 均覆盖教学
新闻/博客引用数据集信息与图像 文字引用自由;图像展示标注来源 署名规范随许可家族

许可高频追问:

  • 问:我用 CC-BY-NC 的 2024 数据训了模型,模型可以商用吗?答:灰区——数据许可约束的是数据本身的使用与再分发,衍生物(权重)的商用边界在法律上无全球统一结论;稳妥做法是商用产品避免直接依赖 NC 数据训练的权重,或取得权利方许可。
  • 问:S-BIAD1196 页面的 CC BY 4.0 和官网的 CC-BY-NC 到底听谁的?答:本条目不裁决(冲突存照是诚实做法)——实操按从严口径执行,商用决策前咨询机构知识产权部门,并保留双口径证据链。
  • 问:设计文档的图可以用我自己的论文里吗?答:cc-by-4.0 允许(署名+注明修改),学术场景基本无摩擦。
  • 问:许可口径未来会变吗?答:可能——许可由权利方声明,官网/BioStudies 页面更新即口径更新;长期引用本条目许可信息者,请按附录 C 观察哨的"license 口径收敛"触发点复核,勿视本表为永久有效。

5.6 代码层:SCP-Nano 预处理脚本

组织团队将部分处理链开源在 GitHub:github.com/erturklab/SCP-Nano,其中 2_image_cropping.py 即大体量 LSM 图像的裁剪脚本——对面对 10¹⁰+ 体素文件的读者,这是官方工作流里"怎么切块"的直接参考(比自研切分逻辑更贴数据实际规格)。代码许可以仓库 LICENSE 为准。

从裁剪脚本读官方工作流的三个信号:

  1. 切块是官方流程的显式环节——印证"整图处理不可行"不是参赛者的猜测,而是数据提供方的既定工作方式;
  2. 脚本参数(块尺寸、重叠)可以直接作为参赛管线的起点配置;
  3. 仓库更新动态反映组织方的活跃方向——跟进代码 = 跟进生态(附录 C 观察哨的 GitHub 入口)。

一点提醒:脚本是"参考实现"而非"唯一正解"——官方开源它更多是给社区一个起点而非标准答案,方法团队在它的参数基础上做自己的分块策略优化(例如按对象尺度自适应块尺寸)完全正当,引用时注明"基于/参考 SCP-Nano 裁剪脚本"即可。

5.7 获取路径决策树

你要什么?
├─ 引用挑战赛规程 → Zenodo DOI 10.5281/zenodo.15267392(即刻,cc-by-4.0)
├─ 做方法原型(公开数据)
│   → BioStudies S-BIAD1196/S-BIAD1197(2024:35 幅 + 315 patch,FTP)
├─ 跑 2025 正式实验
│   → 注册 Grand Challenge → 下载 /dataset/(58 幅,16-bit TIFF)
├─ 参赛/提交 → 官网 participate-rules + 容器提交
└─ 跟进第三届 → Zenodo 19733195 + 官网更新

混合路径合法且常见:原型用 2024 存档 + 正式实验用 2025 注册数据,是资源受限团队的最优解——但注意三条衔接纪律:① 两届结果分开报告(坑 7);② 2024 上调好的超参在 2025 上重标(规格跃升一个量级,参数不可平移);③ 论文里把两条获取路径都写清楚(审稿人会问)。

获取环节常见故障排查(按"症状 → 诊断 → 处置"三段):

症状 最可能诊断 处置
Zenodo 记录页打不开/超时 记录有版本链,旧链接失效 从 concept DOI 进,选 v3
BioStudies FTP 连接慢/断 大文件 + 跨洲链路 断点续传(wget -c / curl -C -),错峰重试
图像页 403 未登录/未完成参赛登记 注册 + 登记流程走完(Q25 三检查)
TIFF 打不开 用了常规图像库整读 换 tifffile memmap(§3.4)
patch 方向不对 NIfTI 方向矩阵未处理 nibabel 读 affine 校验(§3.4)
下载完校验不过 传输中断截尾 重下损坏分片,勿跳过校验直接实验

§6 方法谱系与工程实践:在 10¹² 体素上分割

6.1 方法的三层结构

SELMA3D 场景下的完整方法栈分三层,缺一层都跑不通:

层 A  体数据工程层    分块/滑窗/流式 I/O —— 决定"能不能跑"
层 B  表示学习层     自监督/半监督预训练 —— 决定"学得多好"
层 C  分割与后处理层  网络头 + 连通性修复 —— 决定"输出可不可用"

常规 3D 医学分割教程默认层 A 已解决(CT/MRI 体数据内存装得下),把 90% 篇幅给层 B/C;在 SELMA3D 尺度这个默认失效——层 A 是第一性门槛(§6.2),层 B 是挑战赛主战场(§6.3),层 C 在 Task 2 上权重陡增(§6.4)。

层间交接契约(三层各自对上下游的承诺):层 A 交给层 B/C 的必须是"物理尺寸正确、强度语义稳定"的块——spacing 校正与归一化固化在层 A 完成还是推迟到层 B,是管线设计的第一道分叉;层 B 交给层 C 的表示要"对域伪影鲁棒"(§2.2 清单),若预训练语料没覆盖某些伪影形态,层 C 的后处理负担会陡增;层 C 交回评测的输出必须"格式合规"(容器要求)——很多队伍的三层各自都不差,输在交接契约没对齐。

三层栈的失败模式各有签名(排障时先对签名再动手术):

层 典型失败 签名症状
A 工程 块边界伪影、I/O 瓶颈 预测在固定周期网格上出现接缝;GPU 利用率忽高忽低
B 表示 预训练先验没学到显微域 微调后对低对比对象全面漏检;增广敏感度异常
C 分割 连通断裂、实例粘连 Dice 正常但连通分量数爆炸;分水岭过分割碎片

三层之间是乘法关系:任何一层拉胯都把总分拉到地板——这也解释了 §7.1 的 84→5 漏斗:多数队伍倒在层 A。

6.2 层 A:大体量体数据的工程前提

  • 分块推理(sliding window)是默认姿态:10000³ 整图进显存没有物理可能,滑窗 + 重叠融合(gaussian-weighted fusion 等)是基线工程。窗口大小、重叠率、融合权重直接吃掉 Dice 小数点;
  • 流式读取:16-bit TIFF 大文件用 tifffile 等 memmap/流式接口,避免一次性载入(§3.4);NIfTI patch(2024)注意 LPS+ 轴向;
  • 各向异性 spacing:物理尺寸不等的体素下,滑窗步长、上采样率、Dice 计算都要过 spacing 换算——直接按体素等距假设做会系统性偏差;
  • 官方参考:github.com/erturklab/SCP-Nano/blob/main/2_image_cropping.py 是组织方自己的裁剪实现——分块逻辑对齐官方流水线可省一轮试错;
  • 算术对照:一幅 >2×10¹⁰ 体素(Task 1 下限)× 2 字节 = >40 GB 单幅原始体量;58 幅训练集按 TB 级规划存储与 I/O。

I/O 是滑窗管线的隐形瓶颈(算力账之外的第二本账):滑窗推理的 GPU 利用率取决于数据喂得有多快——单幅 40 GB 体量 × 58 幅,若每 epoch 全量重读,机械盘会先把训练拖死。三个标准解法:① 预分块缓存(把滑窗块一次性物化为小文件,训练时随机读小文件而非大文件寻址);② 压缩感知不到的地方下手(16-bit 原始数据的空间冗余可做无损压缩缓存,I/O 量减半常见);③ 多进程预取(读取与计算流水线化)。三个解法都不新——但在常规数据集上"可以忽略"的 I/O 问题,在这里是第一天就会被撞上的墙。

滑窗参数的取舍逻辑(为什么这些数字值得讨论而不是随手填):

  • 窗口尺寸:受显存上限与感受野双重约束——窗口必须覆盖网络感受野加余量,否则块边界处的预测不可信;LSM 对象尺度大(血管干、大神经元),窗口过小会把完整对象切成无法识别的碎片;
  • 重叠率:典型 25-50%——重叠越大融合越平滑但推理成本线性上升;在 10¹² 体素上,重叠率从 25% 提到 50% 意味着推理时间 ×1.78((1/0.5)²/(1/0.75)² 的二维近似,3D 更高)——预算与质量在这里直接对价;
  • 融合权重:块中心高、边缘低的加权(高斯型)优于硬拼接——边界伪影是滑窗管线最常见的产品缺陷;
  • spacing 一致性:各向异性体素下,窗口的物理形状(而非体素形状)才是网络实际看到的东西——步长按体素算、感受野按物理算,两者别混。

6.3 层 B:自监督/半监督路线图

挑战赛与论文(arXiv 2501.03880)立场下的方法谱系,按"监督信号从哪来"排布:

路线 核心机制 在 SELMA3D 的适配点
掩码重建/上下文预测 遮挡局部体积让网络重建 LSM 体数据三维上下文极强(Z 轴深),天然适合 3D masked modeling
去噪/退化还原 人为退化-还原 透明化成像的条纹噪声、光漂白梯度可作为物理合理的退化算子
一致性正则 扰动/视角间预测一致 光片多向采集 + 翻转/旋转增广对离散对象较安全(连续网络慎用翻转,手性会变)
稀疏标注传播 从点标注/patch 出发扩散监督 2024 的 315 patch 与 2025 稀疏点标注是合法锚点;连续结构用路径级稀疏标注优于点标注
两阶段:SSL 预训练 + 微调 无标注预训练 + 少量标注微调 2024 届参赛主流;2025 数据量扩大后预训练语料更充裕

两条经验性提示(来自任务结构本身,非赛果转述):

  • Task 1(离散)对假阳性敏感:稠密细胞核场景下实例分割后处理(分水岭、形态学过滤)与检出阈值校准的收益常高于网络结构的边际改进;
  • Task 2(连续)对断连敏感:Dice 对 3 体素级断连不敏感但下游分析全毁——形态学闭运算、方向感知的连接补全、以及评测容器内的连通性约束都值得显式处理。

谱系表怎么读出"入场券":五条路线不是互斥选项,而是资源光谱——预训练算力充足选掩码重建系(对语料利用率最高);只有 CPU 集群跑推理没有预训练预算选去噪系轻量预训练(收益小但成本近零);有少量高质量标注选弱标注传播系(把标注价值最大化);什么都不充裕选一致性正则(实现最简单、超参最少)。先盘资源再选路线,比先选路线再凑资源省一半时间。

一套务实的组合拳(把谱系表落成可执行方案):

阶段 1(层 B 预训练)
  语料:全部训练集体数据(无标注部分)
  方法:3D masked reconstruction + 去噪双任务
  产出:显微域骨干网络
阶段 2(层 B/C 弱监督微调)
  锚点:2024 的 315 patch + 2025 稀疏点标注
  路线:Task 1 用 patch 微调 + 检测后处理;
        Task 2 用路径级弱标注传播 + 连通性后处理
  产出:两赛道各自的分割模型
阶段 3(层 C 精修)
  Task 1:实例分离 + 假阳性过滤
  Task 2:断口补全 + 拓扑自查(§6.4 清单)

该组合的成本重心在阶段 1 的算力与阶段 3 的工程细节——对应 §6.1 三层栈的判断:层 A/B 买门票,层 C 决名次。

预训练语料的合法边界(SSL 阶段什么能用什么不能):无标注 LSM 体数据全部可用(含测试图像本体?——不行,任何接触测试分布用于训练选择的行为都破坏评测语义,预训练语料限定训练集图像);2024 的 315 patch 可用于预训练+微调两阶段;官方若提供预训练模型或基线权重,用官方版本以保证可比性。这条边界在跨数据集预训练(如用其他 LSM 数据预训练再迁移)时更复杂——以官方 participate-rules 对外部数据的条款为准。

6.3.1 五个最常见的实现错误(从层 A/C 签名反推)

  1. 把 spacing 当各向同性:训练增强与推理滑窗按体素等距假设做——症状是分割结果在 Z 向"被压扁/拉长";修法:所有几何操作过 spacing 换算;
  2. 8-bit 转换毁动态范围:为省内存把 16-bit 转 8-bit 且用全局 min-max——荧光数据的长尾直方图被压成噪声;修法:保留 16-bit 或用分位数截断;
  3. 块归一化泄漏统计:滑窗推理时每块独立算归一化统计——块间接缝处预测跳变;修法:用训练集统计或全图粗统计固化;
  4. 测试时增广(TTA)用了翻转:生物结构非严格对称(如消化管走向),翻转增广伤 Task 2 网络方向性;修法:TTA 限定在安全增广子集(噪声/强度类);
  5. 后处理在校验集上过拟合:连通性补全参数在官方测试 leaderboard 上反复"手调"——把测试信息泄漏进方法;修法:后处理参数只在训练/验证数据上标定。

这五条的共同主题:在体数据管线里,"工程细节"与"方法学正确性"不可分割——错误 3 和 5 严格说已经是实验方法学错误,不只是工程瑕疵。

6.4 层 C 与评测语义:Dice 的适用边界

Dice 是官方主指标,但两任务下它"度量"的东西不同:

  • Task 1 离散对象:Dice 近似"检出的形贴合平均"——漏检一个对象与分割边缘 2 体素误差在 Dice 上权重不同,精确的实例级指标(检出率、假阳性率)要看官方评测容器的实现;
  • Task 2 连续网络:Dice 对拓扑错误(断连/粘连)钝感——两条赛道若用同一 Dice 口径,实际上是对"形贴合"的加权而非对"网络正确性"的度量;连接性相关的补偿指标(如 skeleton-based、clDice 类思想)是否纳入官方评测,以 task 页与评测容器为准(本条目不代官方声明)。

给使用者的建议:把官方 Dice 当作可比的公共基线,把任务级质量自查(连通性、实例数、spacing 校验)当作自己的内部指标——两者叠加才接近"方法真的可用"。

两赛道质量自查清单(内部指标建议):

检查项 Task 1(离散) Task 2(连续)
全局量级 检出数与预期量级核对(如全脑核团计数) 网络总长度/总体积与生理量级核对
拓扑 实例过分割/欠分割比 连通分量数、断口尺寸分布
假阳性 高背景区误检抽样 非目标管状结构误连抽样
空间一致性 跨 Z 层检出漂移 管径突变点检查
校准 置信度阈值-PR 曲线 距离变换-容差曲线

指标语义的实践推论:当你需要在论文里报告 SELMA3D 成绩,推荐"三层报告法"——第一层报官方 Dice(可比性),第二层报 §6.4 自查清单的关键项(拓扑/检出质量),第三层报监督设定与数据届次(可比性前提)。三层齐全的实验报告在审稿中的可信度,显著高于一个孤零零的 leaderboard 名次——尤其在"官方聚合指标粗"(§7.4)的前提下,自查层就是你的差异化可信度来源。

6.5 复现检查单

从零复现一场 SELMA3D 实验,按序自查:

  1. 确认获取层(§5.7 决策树)——拿的是 2024 存档还是 2025 注册数据;
  2. 体数据读取验证:打印 shape、dtype(16-bit)、spacing——各向异性在此暴露;
  3. 分块策略与官方 SCP-Nano 裁剪脚本对齐(至少比对窗口/步长量级);
  4. 若用 2024 patch 微调:NIfTI LPS+ 轴向校验(取一个已知结构做方向 sanity check);
  5. 训练-验证划分按官方口径(若有官方划分文件则用官方的,勿自划导致与 leaderboard 不可比);
  6. 推理输出与提交格式:按 Grand Challenge 算法容器要求打包;
  7. 报告时写明监督设定与数据届次(坑 7)。

检查单的"过了"标准(每项的可验收形态):

步 通过标准
1 能明确说出"我用的图像来自哪一层、哪个届次、什么许可"
2 shape/dtype/spacing 三元组与官方文档一致;随机切层目视无花屏
3 自研分块与官方脚本的块尺寸/重叠率同量级或直接复用官方参数
4 方向 sanity check:翻转修正后结构与原始图像目视对齐
5 划分方式在实验记录中留痕;与 leaderboard 的可比性声明明确
6 本地干跑容器通过;输出格式官方校验无报错
7 论文/报告的方法节含监督设定+届次+获取层三要素

检查单的返工原则:前 4 步(数据层+读取+分块+轴向)不过关时禁止进入训练——这四步的错误都属于"后面全部白算"型,越早拦截成本越低;后 3 步(划分+容器+报告)错误属于"结果不可信/不可比"型,返工发生在投稿后,代价最高。两段式拦截的顺序不能颠倒。

6.6 从复现到论文:结果报告模板

给准备把 SELMA3D 实验写进论文的读者一份"报告骨架"(按信息重要性排序):

方法节必备四要素:① 数据来源层(2024 BioStudies / 2025 Grand Challenge)与届次;② 监督设定(SSL 预训练语料范围 + 微调标注形态与数量);③ 层 A 工程参数(窗口/重叠/融合——决定可复现性);④ 评测口径(官方容器 or 自建,指标定义)。

结果节三层报告(§6.4):官方 Dice(可比层)→ 内部自查指标(质量层)→ 定性案例(含失败案例——失败案例的呈现量与方法可信度正相关)。

讨论节三个诚实声明:① 动物域外推限制(§7.4);② 弱标注上限(§3.5);③ 与 leaderboard 的可比性边界(坑 7)。

这份模板的隐藏价值:审稿人对弱监督 3D 分割论文最常见的三个质疑(“是不是在测试集上调参”“弱标注下你的改进是不是噪声”“换个对象还成立吗”)分别被 6.3.1 错误 5、三层报告的内部指标、对象级分项结果预先化解——模板不是形式主义,是预答辩。

6.7 工具链速查表(从下载到提交的软件栈)

环节 工具建议 关键点
数据下载 wget -c / curl -C -(FTP);浏览器(平台) 断点续传是底线
TIFF 读取 tifffile(memmap 模式) 勿用 PIL/OpenCV 整读
NIfTI 读取 nibabel / SimpleITK 校验 affine 与 LPS+
分块参考 SCP-Nano 2_image_cropping.py 对齐官方块规格
预处理 numpy/scipy + 自写域适配 §2.2 伪影清单对照
SSL 预训练 MONAI / 自研框架 3D masked modeling 支持
训练框架 PyTorch + MONAI 3D U-Net 族为主力
推理融合 自写滑窗 + 高斯融合 重叠率与显存平衡
后处理 scikit-image / scipy.ndimage 连通分量与形态学
提交 Grand Challenge 容器 按官方模板封装

工具链的第一原则:每个环节选"流式/分块友好"的实现——任何假设"数据能整载"的组件(哪怕只是中间缓存)在 10¹⁰+ 体素上都会成为瓶颈点。这张表的价值不在工具名,在"关键点"列——每一条都是一次踩坑的结晶(多数已在 §6.2/6.3.1 展开)。

§7 赛果、下游影响与基准价值

7.1 2024 首届赛果:SSL 路线的第一个公开数据点

  • 参与漏斗:84 人注册 → 5 队有效提交 → 顶级队伍 Dice >70%(arXiv 摘要口径);
  • 解读一(容量):84→5 的漏斗主要是工程门槛的过滤(层 A 成本),而非方法门槛——能跑完大体量体数据管线的团队本就少;
  • 解读二(天花板):>70% Dice 在"稀疏标注 + 10¹⁰ 体素 + 多对象谱系"下是有参考意义的成绩——但要对照 §6.4 的指标语义读,且这是混合对象谱系上的聚合数字,单对象表现以官方明细为准;
  • 解读三(路线验证):SSL/弱标注路线在 LSM 尺度被证明"能跑通且有产出"——这是首届最大的公共价值,2025 扩量决策由此而来。

2025 届赛期(2025-10 MICCAI 会期)后的 leaderboard 结果本条目未逐一核验,以官网为准。

读赛果的姿势提醒:看任何挑战赛 leaderboard 都建议三问——① 有效的提交数是多少(漏斗尾部才代表方法真实水平,注册数只代表关注度)?② 指标聚合层级是什么(跨对象平均会掩盖单对象强弱,§7.4 边界一)?③ 提交方法的公开程度如何(可复现的名次才可对标)?三问过后,一个名次才有资格进入你的方法综述。

对 84 → 5 漏斗的进一步拆解(数据集视角能提供的三种假设,而非定论):

  1. 工程假设:多数注册者在"下载-读取-切块"的层 A 阶段离场——数据规格对常规管线不友好(§2.3.1),这也解释了官方为什么开源裁剪脚本(§5.6,降低层 A 摩擦是对漏斗的直接干预);
  2. 方法假设:SSL 路线的调参成本高于全监督——预训练+微调两阶段的时间预算劝退了课程项目型团队;
  3. 激励假设:首届没有大规模奖金池(奖品含吉祥物玩偶),参赛激励以学术曝光为主——完赛者大概率是"数据与论文双刚需"的团队。

三个假设共同指向的实践结论:挑战赛的真实门槛在数据工程而非模型设计——这本身就是对社区有价值的信息。

7.2 下游复用:LSM Foundation Model 语料

第三方工作已把 SELMA3D 纳入更大生态:LSM Foundation Model 数据集(Zenodo 20149070)将 SELMA3D patch 作为其光片显微预训练语料之一——该记录内 SELMA3D patch 计 687.1 MB。两点含义:

  1. 影响力实证:数据集进入"基础模型预训练语料"层——从挑战赛基准升格为生态数据源;
  2. 路径示范:patch 级(而非全幅体数据)复用是第三方消化大体量数据集的可行粒度——这也侧面印证 §3.5"patch 是弱监督与复用的主单位"的定位。

7.3 与相邻基准的对照定位

基准 模态 监督形态 体素规模 与 SELMA3D 的关系
SELMA3D 2025 光片显微(小鼠 cleared) 自监督/半监督(稀疏+弱标注) >10¹⁰,最大 10¹² 本文条目
TotalSegmentator CT(人体) 全监督(dense) 10⁷-10⁸ 全监督器官分割一端;"工程分块"问题同源但规模小两个量级
TopoTopBrain Challenge 2026 MRI 3D(人脑) 挑战赛(全监督为主) 常规 3D 同 MICCAI/Grand Challenge 家族;拓扑敏感评测思想可互鉴
PANDA / PANDA-PLUS WSI 病理 2D 全监督/重标注 千兆像素 2D "大体量 + 弱标签利用"在 2D 病理的平行叙事
BigBrain 组织学 3D(人脑) 图谱参考 20 μm 全脑 超高分辨率人脑参考图谱;"体素规模大、标注为图谱"的另一种解法

读法:SELMA3D 不是"更大的 TotalSegmentator"——监督形态不同(稀疏/自监督 vs dense 全监督)才是本质差异;它与 TopoTopBrain 同族(平台+赛制),与 PANDA 系共享"标签稀缺下榨数据"的问题意识,与 BigBrain 共享"超大 3D 体数据管理"的工程命题。

复用模式的三种粒度(从 §7.2 的下游实践反推数据集的开放形态):

  1. patch 级复用(LSM Foundation Model 走的路):687.1 MB 的 patch 语料可直接进预训练管线——低摩擦、高兼容;
  2. 体数据级复用:滑窗抽取块后同管线处理——需要 §6.2 的工程能力,但保留全器官上下文;
  3. 挑战赛式复用:以 SELMA3D 为模板建自己的评测——成本最高,制度价值也最高(§9.1 范式可迁移)。

三种粒度对应三种投入量级——数据集的实际使用面比"一个挑战赛"宽得多。

对照表的元观察:把五行的"监督形态"列连起来读——dense 全监督(TotalSegmentator)→ 全监督/重标注(PANDA-PLUS)→ 图谱参考(BigBrain)→ 挑战赛全监督(TopoTopBrain)→ 自监督/半监督(SELMA3D)——这是同一学科(医学图像分割)在不同数据规模约束下的五种监督形态解。没有一个"最好的形态",只有"与你的数据规模、标注预算、评测目的匹配的形态"。本库收这五类条目的价值正在于此:它们不是五个孤立数据集,而是监督形态决策空间里的五个采样点。

给检索者的实用推论:无论你从哪个关键词进来(搜"3D 分割"到 TotalSegmentator,搜"挑战赛"到 TopoTopBrain,搜"显微"到本条目),顺"监督形态"光谱走一圈,比在单一数据集上反复调试更能定位自己工作的真实水位——这正是库内互链设计的初衷。

7.4 基准价值的边界

先立一个观点再列边界:"基准有边界"不是缺陷声明,而是使用说明书的核心章节——没有边界说明的基准才会造成系统性误用(拿 CT 基准的直觉来跑显微数据就是一例)。SELMA3D 的三条边界如下:

诚实列出 SELMA3D 作为基准的三条边界:

  1. 聚合指标粗:>70% 类聚合数字跨对象谱系平均,单方法-单对象矩阵需要官方明细数据支撑(公开程度以官网为准);
  2. 动物域:小鼠 cleared 组织上的方法优势向人类临床(CT/MRI/病理)外推没有免费午餐——域差距(透明化伪影、荧光对比、各向异性)是结构性的;
  3. 注册墙:2025 图像获取有人工注册环节,第三方独立复现的摩擦高于全公开数据集(对比:BigBrain、TotalSegmentator 公开直链)——AI-Ready 评级如实反映此点。

三条边界的共同解法是"设定透明":报告实验时写清获取层(2024 存档 or 2025 注册)、监督形态(SSL 预训练 + 何种微调)、评测口径(官方容器 or 自建),SELMA3D 的可比性就足以支撑方法论文的结论——数据集有边界从来不是问题,不声明边界才是。

7.5 与 2026 届的方法预研关系

对计划参加第三届的团队,2025 数据集的用法是"预演场":先用 58 幅把层 A 工程与 SSL 基线调通,四赛道的 sparse/dense 划分公布后,把既有管线按标注密度敏感性重新标定即可。CONNECTS 轴突数据的加入预计抬高连续结构赛道的难度上限(轴突极细长、高交叉,连通性保持更难)——§6.4 的拓扑自查清单在 2026 届的重要性只增不减。

从投资回报的视角收束本章:SELMA3D 上的方法投入具有"跨届复利"——层 A 工程与层 B 预训练资产在 2025/2026 两届通用,层 C 的对象级适配随赛道细分持续增值。把参与 SELMA3D 当成一次性比赛还是长期数据战略,决定了你对"工程投入重、模型创新轻"这个成本结构的忍耐度——想清楚再进场,进场就别抱怨层 A。

本章三句话总结:赛果层面,2024 的 84→5→Dice>70% 是"需求真实、门槛真实"的证据组合;下游层面,LSM Foundation Model 的 patch 级复用标志着数据集从基准升格为生态数据源;价值层面,SELMA3D 的基准意义在"监督形态决策空间"的独特采样点(§7.3),而非排行榜名次本身。

§8 生态与组织:谁在做什么

8.1 组织网络

  • 研究核心:Ertürk lab 生态(GitHub org: erturklab,SCP-Nano 流水线开源地),研究主线为组织透明化与全器官三维成像;
  • 机构分布(arXiv 2501.03880 十七名作者 affiliations 汇总):Helmholtz Munich(德国亥姆霍兹慕尼黑研究中心)、LMU(慕尼黑大学)、TUM(慕尼黑工业大学)构成德国慕尼黑集群;Imperial College London(英国帝国理工)、Weill Cornell Medicine(美国威尔康奈尔医学院)、Nagoya University(日本名古屋大学)等为跨洲节点;
  • 平台方:Grand Challenge(grand-challenge.org,荷兰 DIAG Nijmegen 运营)——挑战托管、容器提交、leaderboard 的全栈基础设施;
  • 学术载体:MICCAI(医学图像计算与计算机辅助介入会议)卫星活动——2024/2025 两届均为 in-person satellite event;
  • 数据伙伴(2026 起):BRAIN Initiative CONNECTS(美国 NIH 脑计划连接组学项目)——轴突投射数据进入第三届。

角色分工速查(你要办什么事,找谁):

你的事项 对口角色 入口
参赛规则/数据下载/提交 官网(Grand Challenge 托管) selma3d2025.grand-challenge.org
规程引用 Zenodo 记录 doi.org/10.5281/zenodo.15267392
学术引用 arXiv 论文(17 作者集体) arxiv.org/abs/2501.03880
2024 图像 BioStudies 存档 S-BIAD1196 / S-BIAD1197
预处理代码 GitHub org github.com/erturklab
第三届动态 Zenodo 立项文档 + 官网 doi.org/10.5281/zenodo.19733195

8.2 赛事人格化细节

官网参与规则页明示奖品为 Jellycat “Selma SLOTH” 毛绒玩具——挑战赛以树懒 Selma 为吉祥物。这条细节有两重用处:其一,可读性(挑战赛页面的识别度);其二,考据学(SELMA 名称来源为吉祥物名,不是缩写——检索时杜撰的缩写展开如 “SEgmentation of Light Microscopy Analysis” 均无官方出处,坑 1 的根源)。

顺带一提,"吉祥物命名"在挑战赛生态里不算孤例——把赛事拟人化(有名字、有形象、有周边)是 Grand Challenge 系活动降低参与门槛、增强社区认同的通行做法。对数据集考据者的提示:赛事的"周边细节"(奖品、吉祥物、口号)常常是名称语义的一手证据——比二手转述的"缩写展开"可靠得多,因为它们出自主办方之手、有页面存档可查。

8.3 数据生态位

在"透明化成像 → 分析"的完整链路上,SELMA3D 占据的是算法侧标准化的位置:

样品制备(SCP-Nano 上游)→ 透明化+染色 → 光片成像 → [SELMA3D:分割/分析标准化] → 生物学发现

同一生态的开源件:github.com/erturklab/SCP-Nano(样品处理与图像裁剪脚本)。数据侧的公开化由挑战赛推动:2024 图像进 BioStudies 存档、规程进 Zenodo——把"实验室私有数据"转成"社区可引用资产"的制度动作,是近年显微成像数据集建设的代表性路径。

生态位的稀缺性评估:在"透明化+LSM 全器官分割"这个格子里,SELMA3D 目前没有同体量的公开竞品——其他显微分割数据集要么尺度小(常规共聚焦体数据)、要么对象单一(单一细胞类型的检测集)、要么非公开(实验室私有)。稀缺性是双刃剑:它让 SELMA3D 成为该领域的"默认基准",也意味着它的任何局限(§3.5 弱标注上限、§7.4 动物域)都会变成领域级的公共局限——2026 届的四分法扩容正是对这种"基准即天花板"压力的回应。

8.4 生态演化的时间线外推

把三届的时间线连起来,可以对生态走向做一个有依据的素描(明示:这是外推,不是官方规划):

  • 2024(数据公开化):35 幅 + 存档——解决了"有没有";
  • 2025(规程正式化):58 幅 + DOI 链——解决了"可信不可引";
  • 2026(任务精细化):四赛道 + 国家级数据接入——解决"全不全、准不准";
  • 可外推的下一步:若演化延续,第四届的合理方向是评测语义深化(拓扑/校准类指标进官方口径)或跨物种数据扩展(CONNECTS 之后的第二数据源)。

对使用者的含义:这条时间线是"何时进场"的决策参考——需要成熟稳定基准的研究者用 2025 届数据即可;愿意陪生态成长的团队(预训练、评测方法学方向)值得盯 2026 届的动向;观察哨(附录 C)持续更新。

§9 方法学启示:三条可迁移的经验

9.1 标注不可得时的数据集设计范式

SELMA3D 展示了一条"标注物理不可行"场景下的数据集设计范式,三步均可迁移:

  1. 承认边界:不假装有 dense 真值,把"稀疏/局部标注"写进任务定义本身(数据Limitations 先行);
  2. 弱信号制度化:把 315 个 patch、稀疏点标注这类弱信号做成正式训练素材并公开格式规格;
  3. 评测容器持有真值:测试集真值不发放,参赛者提交容器、平台代跑——真值保密与评测可重复兼得。

凡"体量大到标不动"的领域(病理 WSI、连接组学、卫星遥感),这套范式可直接套用。

范式背后的成本转移动员:传统数据集把钱花在标注上,SELMA3D 把钱花在成像上(透明化+LSM 采集的成本远超标注)并接受"监督信号打折"——这是一个清醒的经济学决策:在体素量超过标注能力的领域,与其买一个永远买不起的 dense 真值,不如设计一套让弱信号值最大化的评测。三步范式正是这个决策的工程化落地。

9.2 拓扑分治:任务划分先于指标选择

两赛道划分(isolated vs contiguous)发生在指标选择之前——这是对的顺序。离散对象的评测哲学(检出+贴合)与连续网络的评测哲学(连通+拓扑)本质不同,混在一条赛道里会得到"平均后什么都说明不了"的指标。2026 届把 sparse/dense 也纳入赛道维度,是同一逻辑的延伸:任务矩阵的每个格子应有自己的评测语义。设计新挑战赛/新基准时值得先画这个矩阵。

一个反例对照说明为什么"先划分"重要:假如把"血管分割"与"细胞核分割"放进同一条赛道共用一个 Dice——那么参赛方法的优化方向会向"平均最优"漂移:为核团调的检测阈值伤血管连通性,为血管调的平滑度伤核团边界,最终没人能从排行榜读出"谁的核团分割更好"。分治不是道德偏好,是让指标保持可解释性的最低要求。

一个矩阵思维的日常应用:拓扑×密度的四分法不必等到设计挑战赛才用——日常项目里遇到"标注预算有限"的分割任务,先把 (对象拓扑 × 你能负担的标注密度) 四个格子画出来,判断自己的任务落在哪个格子,再对号入座选方法:isolated+sparse 格走检测式弱监督,contiguous+dense 格走经典全监督+拓扑后处理……四格里最危险的是 contiguous+sparse(本挑战赛暴露的硬格子)——如果你的任务落在这里,先重新谈判标注预算再动工,比硬上方法划算。

9.3 凭证链工程:从网页到 DOI

三届赛事的凭证演化(官网网页 → Zenodo DOI 设计文档 → arXiv 论文 → BioStudies 存档)不是官僚化,而是让"挑战赛"这种通常以网页形态存在、链接易朽的对象获得持久引用层。对本库读者的启示:数据集条目写作时应优先锚定 DOI/存档 accession(本条目锚定 Zenodo 15267392 + arXiv 2501.03880 + S-BIAD1196/S-BIAD1197 三组凭证),网页 URL 仅作辅助——这正是本条目 §5 三层结构的组织逻辑。

凭证链的自检问题:给一条数据集陈述"溯源",问三个问题——① 这句话五年后还能验证吗(对象是否 DOI 化/存档化)?② 引用粒度够细吗(能不能指向具体版本/记录)?③ 机器能不能读(API/结构化元数据)?三问全过才构成 AI-Ready 的事实层——这也是本条目对 SELMA3D 各硬数字都配来源对象的原因。

§10 与库内条目的关系

先说本节的使用方式:§10.1 的关联图谱按"对理解 SELMA3D 的价值"排序,每条给出关联逻辑;§10.2 的路径建议按使用目的组织。互链导航本身由发布管线自动挂载(本节不承担导航职责),这里的职责是讲清关联的理由——知道"为什么相关"比知道"相关"更有用。

10.1 关联图谱

  • TotalSegmentator(rid 422):CT 大规模器官分割,全监督端代表。与 SELMA3D 共享"大体量 3D 体数据工程"命题(分块/滑窗),但监督形态相反(dense 全监督 vs 稀疏自监督)——两者对照阅读可看清"监督密度"如何重塑任务设计。
  • TopoTopBrain Challenge 2026(rid 632):MICCAI 3D 挑战赛同族。TopoTopBrain 强调拓扑正确性评测,恰是 SELMA3D Task 2 连续结构的核心关切——两个挑战赛对"拓扑敏感"问题的处理互相参照。
  • PANDA / PANDA-PLUS(rid 560 / 640):Grand Challenge 挑战赛家族(前列腺病理 2D)。PANDA 系展示"切片级弱标签的陷阱与像素级升级",SELMA3D 展示"体素级标注不可行时的弱信号制度化"——弱标签问题的 2D 与 3D 两面。
  • BigBrain(rid 285):20 μm 分辨率人脑 3D 参考图谱。与 SELMA3D 同属"超大 3D 体数据"俱乐部,但目的相反:BigBrain 提供稠密参考图谱,SELMA3D 明确宣布 dense 真值不存在——一有一无,界定"参考图谱"与"挑战基准"的分工。
  • Allen Brain Atlas(rid 275):小鼠/人脑参考数据链。SELMA3D 的对象(c-Fos+ 神经元、脑核团、轴突投射)最终要落到脑区图谱坐标上读——Allen Brain Atlas 是那个"坐标系"层。
  • Healthy Brain Network(rid 245)/ IXI Brain(rid 482):人脑开放数据生态与 3D 医学影像入门对照——前者是临床行为学+影像的多模态队列,后者是轻量 3D 分割练习场,都与显微尺度形成跨尺度互补。
  • CT/X 光分割注释家族(chest-x-ray-segmentation rid 601、chexmask rid 602、heart-lung-segmentations-data rid 610、lung-segment-mimic-cxr rid 613):胸部影像的公开分割掩码系列——它们是"标注充足域"的批量样本,与 SELMA3D 的"标注稀缺域"构成资源光谱的两端。
  • CPTAC Imaging(rid 527):癌症临床影像与组学配套数据——SELMA3D 的病理对象(Aβ 之外的肿瘤相关应用如淋巴细胞浸润成像)在此有临床对应物。

优先级理由(互链算法视角的权重顺序):topbrain2026(同平台同赛制,相关度最强)> totalsegmentator(3D 分割方法论核心对照)> panda-plus(挑战赛+弱标签双关键词)> bigbrain(体素规模+脑数据)> allen-brain-atlas(脑科学坐标系)——前五条覆盖了检索者最可能的五个来路;后四条为扩展路径,供导航深挖。

10.2 使用路径建议

  • 做 3D 分割方法入门 → IXI Brain / TotalSegmentator 起步,再入 SELMA3D 感受尺度墙;
  • 做 SSL 预训练研究 → SELMA3D 体数据(无标注主粮)+ PANDA-PLUS-Bench(2D 病理对照);
  • 做脑科学应用 → Allen Brain Atlas / BigBrain 定坐标系,SELMA3D 提供显微尺度结构检出;
  • 设计挑战赛 → 拓扑分治矩阵(§9.2)+ TopoTopBrain 评测设计 + SELMA3D 凭证链(§9.3)三件套。

路径选择的一个原则:先问"我要的证据类型",再选数据集——要"方法在标准场景的有效性"证据,去全监督大库(TotalSegmentator 系);要"方法在极端条件下的鲁棒性"证据,来 SELMA3D(尺度+弱标注+域特殊三重极端);要"生物学发现"证据,两个都不够,还得回你自己的实验数据。数据集选型错配(比如用 SELMA3D 证明"常规场景有效性")是方法论文被拒的高频暗因——尺度墙数据集上的胜利不自动平移回常规场景,反之亦然。

§11 避坑清单:八个已踩过的坑

进入坑单前先给一句元观察:这八个坑里没有一个是"数据集的错"——它们全部来自"数据集的形态与使用者默认预期的错位"(注册制 vs 公开制、多口径 vs 单口径、大体量 vs 常规管线)。理解错位的方向,比背下八个坑更有用。

坑 1:“SELMA” 不是缩写,还有一串撞名。SELMA 是吉祥物树懒的名字(奖品 Jellycat Selma SLOTH 为证),官方无缩写展开;与电影《Selma》、WHO/瑞典的 SELMA 疟疾传播模型、地名塞尔玛均无关。检索用 “SELMA3D challenge” 或 “SELMA3D light-sheet” 组合词,单搜 SELMA 会捞回一船无关结果。

坑 2:图像本体不在 Zenodo。Zenodo 15267392 只有一个 146,647 字节的挑战设计 PDF——以为"DOI 有了=数据有了"的人会在下载时发现真相。2025 图像在 Grand Challenge(注册制,未登录 Forbidden 403),2024 图像在 EBI BioStudies(S-BIAD1196/S-BIAD1197,FTP)。三层各取所需(§5.7 决策树)。

坑 3:license 三口径互不覆盖。Zenodo 设计文档 cc-by-4.0 ≠ 2024 图像 CC-BY-NC(官网口径)≠ S-BIAD1196 页面 CC BY 4.0。"设计文档是 CC BY 4.0 所以数据也是"是最危险的顺推——尤其商用场景,按最严口径(CC-BY-NC)评估全数据集(§5.4 对照表)。

坑 4:训练集规模两个官方口径。arXiv 摘要口径 58 幅(Task 1 30 + Task 2 推算 28);官网 /task/ 页只写 Task 2 “>25 幅”。58=30+28 可闭合但"官网确认 28"这句话在来源中不存在——引用时写"58 幅(arXiv 口径)“或"Task 1 30 + Task 2 >25(官网口径)”,勿写成"官网 58 幅"。

坑 5:arXiv 双版本。2501.03880 v1 2025-01-07、v2 2025-01-12——引用以 v2 为准(v1/v2 间细节可能有修订);Zenodo 设计文档同理有 v3(2025-03-24,parent 15077390),引用注明版本号或使用 concept DOI。

坑 6:格式跨年不通用。2024 patch 是 NIfTI(LPS+ 轴向惯例),2025 体数据是 16-bit TIFF(纯数组语义)——同一加载器跨年读取会出镜像/位深错误。NIfTI 记得校验方向矩阵;TIFF 用流式接口(§3.4)。

坑 7:两届数据与 leaderboard 不可混。2024(35 幅 + 315 patch,>1000³)与 2025(58 幅,>10¹⁰)不是同一批数据的两版本,是两次独立采集/组织的挑战;两届 leaderboard 分数没有换算关系,论文里混报会被审稿人抓住。

坑 8:Zenodo 三条记录用途各异。搜 “SELMA3D” 至少命中 15267392(2025 设计文档)、19733195(2026 第三届立项)、20149070(LSM Foundation Model 语料,内含 SELMA3D patch 687.1 MB)——引错记录号是引用事故高发点,写引用前核对记录标题与年份。

§12 总结

SELMA3D 2025 用一个挑战赛回答了一个尖锐问题:当成像能力把标注能力甩开两个数量级时,数据集应该怎么建、方法应该怎么比? 它的答案有三层——任务定义上承认弱标注是常态并按拓扑分治(isolated/contiguous);数据工程上三层托管分层放行(Zenodo 规程公开、2024 图像存档公开、2025 图像注册制);生态建设上凭证链完整(DOI + arXiv + BioStudies accession)并向 2026 持续演化(四赛道 + BRAIN Initiative CONNECTS 轴突数据)。

对三类读者的收束语:

  • 方法研究者:这里的门槛是层 A 工程而非模型花活——把滑窗管线调稳、把弱标注协议吃透,你在这条赛道上的起点就高于历史平均水平(84→5 漏斗是公开的提示);
  • 数据集建设者:三步范式(承认边界 → 弱信号制度化 → 容器持真值)+ 凭证链三问(§9.3)是可以带走的最有价值资产;
  • 数据消费者:拿数据前先过 §5.7 决策树,用数据前先过 §6.5 检查单,报数据时先过 §11 坑单——三道工序之后,这个数据集的可信度上限就是你的研究可信度下限。

对 AI-Ready 视角的总评:元数据层高度 AI-Ready(Zenodo DOI、arXiv 论文、官网结构化信息、GitHub 代码均机器可读),图像层半开放(2024 存档公开可 FTP,2025 需注册),许可层需人工判断(三口径并存)。这是一个"生态成熟度高于开放度"的数据集——它的价值不在即下即用,而在为"大体量、弱标注、持续演化"的显微成像数据生态提供了迄今最完整的一条公开记录。


FAQ(高频问答)

Q1:SELMA3D 是什么单词的缩写?
不是缩写。是挑战赛吉祥物树懒的名字 Selma(官网奖品 Jellycat Selma SLOTH 为证)。任何缩写展开均为讹传(坑 1)。

Q2:我可以直接从 Zenodo 下载 58 幅训练图像吗?
不能。Zenodo 15267392 只有挑战设计 PDF。58 幅图像在 Grand Challenge 注册制下载(未登录 Forbidden),2024 届 35 幅 + 315 patch 在 EBI BioStudies FTP 公开(坑 2)。

Q3:商用这批数据要紧吗?
分三层:设计文档 CC BY 4.0 可商用(署名);2024 图像官网口径 CC-BY-NC 不可商用;S-BIAD1196 页面标 CC BY 4.0(与官网口径冲突存照);2025 图像按 Grand Challenge 平台条款。商用前按最严口径评估并逐层确认(坑 3)。

Q4:为什么没有全器官的 dense ground truth?
体素算术上不可行:单幅 10¹⁰-10¹² 体素,人工逐体素标注需千年级人年。数据集以稀疏点标注 + 局部 patch(2024 年 315 个)为监督信号,这是任务定义的一部分而非缺陷(§2.3、§3.5)。

Q5:58 幅还是 55 幅还是"30+25"?
arXiv 摘要口径 58 幅(Task 1 30 + Task 2 推算 28);官网 /task/ 页口径 Task 1 30 + Task 2 “>25”。两个口径都来自官方,差异在 Task 2 精确数官网未确认(坑 4)。

Q6:Dice >70% 是什么水平?
2024 首届顶级队伍的聚合成绩,是"稀疏标注 + 10¹⁰ 体素 + 多对象"设定下的公开地板线。注意 Dice 在连续结构上对拓扑错误钝感(§6.4),跨届、跨设定不可直接比较(坑 7)。

Q7:2024 和 2025 数据是同一批吗?
不是。2024:35 幅(>1000³ voxels)+ 315 patch;2025:58 幅(>10¹⁰ voxels)。规模、格式、对象谱系均扩展,leaderboard 独立(坑 7)。

Q8:数据格式用什么库读?
2025 体数据(16-bit TIFF):tifffile 等流式/memmap 接口,勿用常规图像库整读;2024 patch(NIfTI):nibabel/SimpleITK,注意 LPS+ 轴向。分块参考官方 SCP-Nano/2_image_cropping.py(坑 6)。

Q9:参赛怎么提交?
Grand Challenge 算法容器提交:方法封装为容器上传,官方在隐藏测试集上运行评测,参赛者不接触测试真值(§4.2)。细节按官网 participate-rules 当前版本。

Q10:2026 第三届有什么新东西?
四赛道(isolated/contiguous × sparse/dense annotation)+ BRAIN Initiative CONNECTS 轴突数据(Zenodo 19733195 立项文档)。标注密度正式成为赛道维度(§4.3)。

Q11:有第三方用这数据训练基础模型吗?
有。LSM Foundation Model 数据集(Zenodo 20149070)把 SELMA3D patch(687.1 MB)纳入预训练语料——patch 级复用是第三方消化该数据集的示范粒度(§7.2)。

Q12:这是人类数据吗?涉及患者隐私吗?
纯小鼠 cleared 组织数据,无人类受试者,无患者隐私问题;Aβ 斑块等对象来自阿尔茨海默病模型小鼠而非患者组织(§3.1)。

Q13:和 TotalSegmentator 这类 CT 分割数据集比,难在哪?
不在任务形式(都是 3D 分割),在三个工程/监督前提:体素规模大 2-4 个数量级(10¹⁰-10¹² vs 10⁷-10⁸)、监督信号稀疏(无 dense 真值)、域特殊(透明化伪影+荧光对比+各向异性 spacing)(§7.3)。

Q14:论文该引哪几个 DOI/accession?
四件套:arXiv 2501.03880(v2,论文);Zenodo 10.5281/zenodo.15267392(v3,设计文档);S-BIAD1196 / S-BIAD1197(2024 图像存档)。2026 立项引 Zenodo 19733195(坑 5、坑 8)。

Q15:官网哪些页面会 403?
2025 图像页(/dataset/、/dataset-for-task-2/)未登录 Forbidden——权限设计而非故障;其余页面(timeline、participate-rules、task、organizers)公开可访问(§5.4)。

Q16:可以用这批数据做跨机构预训练吗?
预训练语料边界以官方 participate-rules 对外部数据与数据用途的条款为准;一般学术预训练(非测试集、不接触评测分布)在两届数据上均为设计内用法——LSM Foundation Model 的 patch 级复用即先例(§7.2)。

Q17:训练时遇到 OOM(显存不足)怎么办?
回到 §6.2 的层 A:这不是"调小 batch"能解决的——单幅 >40 GB 根本进不了内存,方案是滑窗分块 + memmap 流式读取 + 梯度累积。把窗口/重叠/融合三参数当成超参搜索的一部分(§6.2 取舍逻辑)。

Q18:Dice 和官方 leaderboard 对不上,最可能的原因?
按概率排序:① 监督设定不同(SSL vs 全监督 on patches);② 数据届次混用(坑 7);③ spacing 处理不一致(体素空间 vs 物理空间);④ 块边界伪影(融合权重问题,§6.2);⑤ 实例级 vs 体素级 Dice 的语义差(§6.4)。

Q19:2024 的 315 个 patch 覆盖了哪些对象?
patch 是弱标注素材,覆盖 Task 1/Task 2 的代表性对象子集(细胞核、血管等),不是全对象均衡集——具体分布以 BioStudies 记录页文件清单与官方描述为准,使用前先做对象构成盘点。

Q20:这个数据集适合做 Few-shot 分割研究吗?
非常适——"稀疏点标注 + 大体量无标注"正是 few-shot/weakly-supervised 的天然设定;但注意对照组设计:与全监督 patch 基线(315 patch 上限)、与纯 SSL 零标注基线两头对齐,结论才立得住。

Q21:想引用"58 幅、10000³"这些数字,标准写法?
建议:“SELMA3D 2025 训练集含 58 幅 3D 光片显微图像(Task 1 离散结构 30 幅,每幅 >2×10¹⁰ 体素;Task 2 连续结构 >25 幅,每幅 >10¹⁰ 体素),单幅最大可达 10000³ 体素(arXiv:2501.03880;selma3d2025.grand-challenge.org)”——两口径并存、来源随数字(坑 4)。

Q22:数据的采集参数(分辨率/放大倍率)在哪里查?
逐图像的采集参数以 BioStudies 记录页与官网数据页的文档为准;本条目只对规格级事实(16-bit TIFF、体素规模区间)存照——具体每幅的 spacing/染色协议请在拿到数据后读元数据,勿以本条目为最终依据。

Q23:可以用它做细胞计数(detection)而非分割吗?
Task 1 的离散结构天然支持检测式输出(质心+计数),但官方评测以分割 Dice 为主——检测式方法需把输出转成分割掩码(或确认官方是否接受实例级提交格式)。计数生物学应用(如 c-Fos+ 全脑活动图谱)是高价值下游,但精度验证需自建小规模真值。

Q24:Ghost 传闻"数据集被撤回/停更"?
截至 2026-09-27 核验无此迹象:三届连续、2026 已立项(Zenodo 19733195)、代码仓库活跃。更新动态以官网与 Zenodo 版本链为准(附录 C 观察哨)。

Q25:我在挑战赛官网注册了,还是下不了数据?
检查三点:① 是否完成参赛登记(仅注册平台账号可能不够);② 数据页是否要求签署数据使用协议;③ 联系官方渠道(官网 organizers 页)。技术性 403 与权限性 403 的区分:登录后仍 Forbidden 即权限问题,找组织方。

Q26:能把 SELMA3D 与 BigBrain 类人脑图谱配准吗?
跨物种(小鼠 vs 人脑)直接配准不可行;小鼠数据可考虑与小鼠标准脑图谱(如 Allen CCF 一类坐标系)配准——但该流程不在挑战赛范围内,属下游研究自建环节,需自备图谱与配准工具。

Q27:论文里展示什么图最有说服力?
经验排序:① 滑窗管线架构图(层 A 是本挑战的标识性难题);② 连通性修复前后对比(Task 2,直击 Dice 盲区);③ 稀疏标注传播的可视化(弱监督如何长出全图);④ 跨对象泛化的成功+失败对(谱系宽度的诚实呈现)。

Q28:如何跟进引用这批数据的新工作?
三条追踪线:① Google Scholar 引 arXiv 2501.03880 的文献;② Zenodo 记录 15267392 的引用/版本动态;③ Grand Challenge 论坛与官网 news。季度级巡检足够(附录 C)。

Q29:训练/验证/测试到底怎么划分的?
官方设计:训练数据发放(58 幅)、测试隐藏在评测容器后(§4.2)。验证划分是参赛者的自主空间——官方若有推荐划分按官方,没有则自划并声明。任何声称"测试集分数"却无法说明容器提交过程的实验都值得追问。

Q30:这个数据集适合做知识蒸馏或模型压缩研究吗?
有独特价值——大体量推理(10¹² 体素滑窗)正是推理成本敏感的场景,教师-学生框架在"全幅推理成本 vs 学生模型轻量化"上有天然实验位。但监督信号稀疏意味着蒸馏的训练目标设计要重新推敲(学生学什么:教师掩码?教师特征?一致性?)。

Q31:为什么不是所有数据都放 Zenodo?
§5.1 的三层结构解析:不同内容配不同平台能力(引用→Zenodo、长期存档→BioStudies、赛事运营→Grand Challenge)。集中单平台并非最优解——“分散但凭证完整"优于"集中但口径混乱”。

Q32:可以直接用这批数据发表论文里的图吗?
学术发表内的图像展示在两届数据的学术许可下通常可行,但注意:① 署名要求随许可(CC BY 家族要求注明来源);② 2025 数据的展示范围以平台条款为准;③ 涉及未公开测试区域的内容勿先行发布。

Q33:我想做一个"光片显微版的 TotalSegmentator",这个数据集够吗?
不够作为唯一素材——TotalSegmentator 的可扩展性来自"dense 标注 + 标准化模态",SELMA3D 是弱标注 + 非标域。合理路径:以 SELMA3D 为方法学试验场(弱监督、分块、拓扑评测),采集侧与透明化实验室合作建立你的专用数据——SELMA3D 的价值是范式样板,不是语料库。

Q34:挑战赛没赶上,数据还有"比赛之外"的价值吗?
有,而且可能更大:① SSL 预训练语料(无标注体数据本身就是资源);② 域适配研究基准(透明化伪影是稀缺的研究对象);③ 弱监督方法论教学案例(三步范式 §9.1);④ 基础模型评测的 OOD 测试集(显微域对临床模型是天然分布外样本)。排行榜只是这个数据集最"轻"的用法。

Q35:两届数据里,哪一届更适合我的小实验室?
看算力与网络:只有常规 GPU 服务器 → 2024 届(35 幅、>1000³,层 A 门槛低一档,且公开可 FTP);有分块工程经验与存储预算 → 2025 届(对象谱系全、规格新)。混合策略(§3.6)最务实:2024 原型 + 2025 验证。

Q36:数据里有没有"陷阱样本"(错标/坏图)的官方说明?
本条目核验范围内未见官方发布已知问题清单——这也正常(弱标注设定下"错标"的定义本身模糊)。使用者自保动作:抽样目视、跨对象一致性检查、可疑样本单独归档不进训练(附录 A 的核验方法说明同样适用于你的下游使用)。

Q37:这个数据集会持续更新吗?新对象会加进来吗?
三届连续与 2026 立项是"会"的最强证据;对象谱系的扩展方向可从 2026 届 CONNECTS 轴突数据读出(§4.3)——沿"神经科学对象 + 平台级可染靶标"扩张。跟进入口见 Q28。

Q38:为什么条目里有些地方写"以官方为准"而不给死数字?
因为那些数字(Task 2 精确幅数、2025 赛果、逐图像采集参数)在可核验来源里就没有统一口径或尚未发布——写死一个数字容易,但对你的研究是埋雷(坑 4 的根源就是别人写死了)。本条目的原则:能核验的给数字+来源,不能核验的给决策树+“为准"指引——AI-Ready 不等于"假装什么都确定”。

Q39:两赛道里先攻哪一个?
按方法团队现有资产判断:有实例分割积累(检测头、分水岭经验)→ 先 Task 1,弱标注传播在离散对象上更直接;有拓扑/图算法积累 → 先 Task 2,连通性保持是稀缺能力。都积累有限 → Task 1(调试反馈快,失败的信号更清晰)。注意这不是难度排序,是"反馈循环速度"排序——先攻反馈快的赛道建立 pipeline 信心,是弱监督项目管理的常识。

事实清单(硬事实 30 条)

  1. 挑战赛全称:Self-supervised learning for 3D light-sheet microscopy image segmentation(arXiv 2501.03880)。
  2. 2025 届为第二届,MICCAI 2025 in-person satellite event(官网)。
  3. 首届 2024(MICCAI 2024 卫星),官网 selma3d.grand-challenge.org。
  4. 2025 训练集 58 幅 3D 图像(arXiv 摘要口径)。
  5. Task 1 isolated structures:30 幅,每幅 >2×10¹⁰ voxels(官网 /task/ 页)。
  6. Task 2 contiguous structures:>25 幅(官网口径),每幅 >1×10¹⁰ voxels;arXiv 口径推算 28 幅。
  7. 单幅图像可达 10000³ voxels(arXiv/官网口径)。
  8. 2024 首届:35 幅(>1000³ voxels)+ 315 个标注 patch(arXiv 摘要)。
  9. 2024 赛果:84 人注册、5 队提交、Dice >70%(arXiv 摘要)。
  10. 评测主指标 Dice(arXiv/官网口径)。
  11. Zenodo 记录 15267392:v3,2025-03-24,license cc-by-4.0,meeting “MICCAI 2025”,文件 1 个 PDF 146,647 字节(Zenodo API 核验)。
  12. Zenodo 版本链:parent record 15077390(Zenodo API)。
  13. arXiv 2501.03880:v1 2025-01-07,v2 2025-01-12,17 名作者(arXiv 页)。
  14. 作者机构含 Helmholtz Munich、LMU、TUM、Imperial College London、Weill Cornell Medicine、Nagoya University(arXiv 页 affiliations)。
  15. 2024 图像存档 EBI BioStudies S-BIAD1196 与 S-BIAD1197(挑战赛生态);S-BIAD1196 页面标 CC BY 4.0。
  16. 2024 图像官网口径 CC-BY-NC(挑战赛文档/官网口径)。
  17. Task 1 对象七类:细胞核、c-Fos+ 神经元、Aβ 斑块、小胶质细胞、神经元、淋巴细胞、荧光蛋白标记细胞(官网/arXiv)。
  18. Task 2 对象五类:血管、神经纤维、外周神经、肠神经系统、淋巴管(官网/arXiv)。
  19. 2025 体数据格式 16-bit TIFF;2024 patch 格式 NIfTI(LPS+)(官网/文档口径)。
  20. 2025 图像页未登录访问 Forbidden(403)——2026-09-27 WebFetch + curl 双复现。
  21. 奖品含 Jellycat Selma SLOTH 毛绒玩具(官网 participate-rules 页)。
  22. 2026 第三届立项:Zenodo 19733195,四赛道 isolated/contiguous × sparse/dense,引入 BRAIN Initiative CONNECTS 轴突数据(Zenodo 记录)。
  23. LSM Foundation Model 数据集(Zenodo 20149070)复用 SELMA3D patch,计 687.1 MB(Zenodo 记录)。
  24. 预处理代码公开:github.com/erturklab/SCP-Nano(含 2_image_cropping.py)(GitHub)。
  25. 2024 首届官网为 selma3d.grand-challenge.org,与 2025 届域名(selma3d2025)并存(官网)。
  26. 挑战赛吉祥物为树懒 Selma,SELMA 无官方缩写展开(官网 participate-rules 奖品项推证)。
  27. Grand Challenge 平台由荷兰 DIAG Nijmegen 生态运营(平台公开信息)。
  28. 2025 届为 in-person satellite event 形式(官网)。
  29. 预训练语料复用形态为 patch 级而非全幅体数据(Zenodo 20149070 记录内文件规格推证)。
  30. 本条目核验时点 2025 届 leaderboard 结果未获独立核验,如实存照(本条目附录 A)。

术语表(18 条)

术语 释义
LSM(light-sheet microscopy) 光片显微镜:薄光片逐面激发、正交探测的三维成像技术,全器官成像的主力
Tissue clearing(组织透明化) 置换脂质、匹配折射率使组织光学透明的处理,让光片可穿透完整器官
Isolated structures 离散结构:可分离的独立目标(细胞核、斑块等),SELMA3D Task 1 赛道
Contiguous structures 连续结构:绵延成网的目标(血管、神经等),SELMA3D Task 2 赛道
c-Fos+ 即早基因 c-Fos 的表达阳性,标记近期激活的神经元
Aβ plaque(Aβ 斑块) 淀粉样 β 蛋白沉积,阿尔茨海默病模型的核心病理对象之一
小胶质细胞(microglia) 中枢神经系统常驻免疫细胞,高度分枝形态
肠神经系统(ENS) 肠壁内的独立神经网络(“第二脑”),连续结构赛道对象
SSL(self-supervised learning) 自监督学习:从无标注数据自身构造监督信号的预训练范式
半监督(semi-supervised) 少量标注 + 大量无标注联合训练的范式
Sparse annotation 稀疏标注:仅对部分目标/区域给出监督信号
Patch(3D) 从大体数据裁出的小体积块;SELMA3D 2024 年 315 个标注 patch 为弱标注素材
NIfTI LPS+ 神经影像格式及其左手坐标系轴向惯例;2024 patch 格式
16-bit TIFF 2025 体数据格式,保留荧光动态范围
Dice Dice similarity coefficient,分割重叠度指标,挑战赛主指标
Sliding window 滑窗分块推理:大体数据进显存的标准工程方案
Grand Challenge 荷兰 DIAG Nijmegen 运营的挑战赛平台,容器化提交+隐藏测试集评测
BRAIN Initiative CONNECTS 美国 NIH 脑计划连接组学项目,2026 第三届轴突数据来源
cleared tissue 经透明化处理的光学透明组织,LSM 全器官成像的样品形态
弱标注(weak annotation) 点标注、局部块标注等不完全监督信号的统称
实例分割(instance segmentation) 区分同类个体的分割形态;Task 1 密集对象的核心难点
连通分量(connected component) 拓扑学量:网络中被断口切分后的独立块数;Task 2 质量自查的核心指标
leaderboard Grand Challenge 平台的排行榜,按官方评测容器输出排序
algorithm container Grand Challenge 的算法容器提交机制:方法封装上传、平台代跑隐藏测试集
memmap 内存映射文件:不整载而按需分页读取大文件的技术,大体数据读取标配
out-of-memory(OOM) 显存/内存耗尽错误;SELMA3D 尺度下整图载入的必然结局
weak annotation(弱标注) 不完全监督信号统称:点标注、patch 级标注、图像级标签等
domain adaptation(域适配) 跨成像域(如临床→显微)迁移时对分布差异的校正手段
dataLimitations 本库 schema_org 中 cr:RecordSet 的数据局限性声明字段

附录

附录 A:核验流水存照(2026-09-27)

  • 官网 selma3d2025.grand-challenge.org 主页 + timeline + participate-rules + task 页全文抓取(35,482 字节 HTML 存档于工作目录);
  • Zenodo API records/15267392 核验:license cc-by-4.0、meeting MICCAI 2025、版本 parent 15077390、files 1 个 PDF(146,647 字节);
  • arXiv 2501.03880 摘要与版本历史核验(v1/v2 日期、17 作者);
  • /dataset/ 与 /dataset-for-task-2/ 未登录 Forbidden(403)复现两次(WebFetch + curl);
  • 库内查重:slug selma3d 与标题关键词在 ai_ready_dataset 表无同名/近名冲突。

核验方法说明:硬数字(§事实清单 30 条)按"来源类型"分层取证——官方一手(官网/Zenodo/arXiv/BioStudies 页面直读)优先;推证性结论(如 Task 2 = 28 幅的推算、吉祥物名称考据)均标注"推证"及推证依据,与直读事实分开存放。凡两次检索结果不一致处(许可口径、训练集规模),采用双口径存照而非择一——本条目立场:口径冲突本身就是数据集的事实,抹平冲突等于制造新的错误。

附录 B:DAIMS 评估全表

DAIMS 五维(Discoverability 可发现性 / Accessibility 可获取性 / Interoperability 可互操作 / Metadata 元数据质量 / Sustainability 可持续性)逐项打分:

维度 评分(1-10) 依据
D 可发现性 7 Zenodo DOI + arXiv 论文 + 官网三入口可索引;但 “SELMA” 名称撞名拉低无歧义检索命中率(坑 1)
A 可获取性 5 三层中 Zenodo 规程公开、2024 图像公开(FTP),2025 图像注册制(Forbidden 403 实证)——最大失分项
I 可互操作 7 16-bit TIFF / NIfTI 均为标准格式;但大体量需专门工具链(memmap/分块),且跨年格式不通用(坑 6)
M 元数据质量 8 设计文档 DOI 化 + 论文 + 官网规格页三源齐备;口径冲突处(规模/license)官方本身存在双口径(坑 3/4),微降分
S 可持续性 8 三届连续、2026 已立项、代码与存档多机构分散托管——单点风险低;赛果/规程动态依赖官网更新,小扣
综合评级 7.0/10(中上) 元数据与可持续性高于库内均值;可获取性被注册墙拖低,2024 公开存档部分补偿

评级使用说明:评级描述的是"获取与使用摩擦",不是"数据科学价值"——两者独立。SELMA3D 的摩擦分主要卡在图像层注册制与许可三口径(都可人工解决),其科学价值(弱监督范式样本 + 对象谱系 + 生态持续性)在同类数据集中属第一梯队。使用本评级做选型时,先按"摩擦分"估算工程成本,再按"价值"估算科研回报,两者相除才是这个数据集对你的真实性价比。

评级的时间敏感性声明:五维分数的核验时点为 2026-09-27,其中 A(可获取性)与 S(可持续性)两维随时可能因官方动作改变(图像公开化/第三届数据放出)——引用本评级时请附时点,并对照附录 C 观察哨确认是否需要更新;D/I/M 三维相对稳定(名称、格式、文档口径变化缓慢)。

附录 C:观察哨(后续更新触发点)

触发事件 条目更新动作 优先级
2025 届 leaderboard 正式公布 §7.1 补赛果、§1 Q8/Q10 更新 1
2025 图像公开化(如有直链) §5.4 降档解除、AI-Ready 升级、坑 2 修订 1
2026 第三届数据放出 §4.3 扩写、CONNECTS 数据规格入表 2
license 口径收敛(如 BioStudies 与官网统一) §5.4 对照表重写、坑 3 修订 2
SELMA3D 数据新论文(方法赛后集锦) §7 增加引用、事实清单扩条 3

附录 D:坑点档案(与 §11 对照,附检索触发特征)

坑 1 档案:名称歧义。触发特征:只含 “SELMA” 的检索词返回电影、地名、疟疾模型等无关结果。规避:组合词检索 “SELMA3D” / “SELMA3D light-sheet” / “SELMA3D challenge”;考据锚点是官网 participate-rules 页的 Jellycat Selma SLOTH 奖品描述。

坑 2 档案:图像不在 Zenodo。触发特征:从 Zenodo 记录页下载只得到 146,647 字节的 PDF。规避:记住三层结构——规程在 Zenodo、2024 图像在 BioStudies、2025 图像在 Grand Challenge(§5.7 决策树)。

坑 3 档案:license 顺推。触发特征:以"Zenodo 是 cc-by-4.0"开头的数据许可推理。规避:许可判断逐层做(§5.4 对照表 + 情境速判表),商用一律从严到 CC-BY-NC 口径。

坑 4 档案:规模口径混写。触发特征:"官网说 58 幅"这类表述(官网实际写 Task 1 30 + Task 2 >25)。规避:数字与来源绑定引用——58 归 arXiv 口径,“30+>25” 归官网口径。

坑 5 档案:版本引用漂移。触发特征:引用 arXiv v1 或 Zenodo 旧版本的日期。规避:arXiv 引 v2(2025-01-12),Zenodo 注明 v3(2025-03-24)或使用 concept DOI。

坑 6 档案:格式混载。触发特征:2024 patch 读出镜像翻转、2025 TIFF 整读内存爆炸。规避:NIfTI 校验方向矩阵(LPS+ 惯例),TIFF 走 memmap 流式读取(§3.4 代码示例)。

坑 7 档案:两届混报。触发特征:论文表格里 2024 分数与 2025 分数同列而无批次说明。规避:报告写明届次与数据批次;两届 leaderboard 分数不换算。

坑 8 档案:Zenodo 记录张冠李戴。触发特征:引用 19733195 却描述 2025 规程(19733195 是 2026 立项文档)。规避:核对记录标题与 meeting 字段;三条相关记录用途速记——15267392 规程 / 19733195 立项 / 20149070 语料。

补记:第 9 个坑——体素尺度错觉。触发特征:方法讨论里出现"直接把图像喂进网络"的表述。10000³ = 10¹² 体素不是"大一点的图":整图不可入显存是物理事实,滑窗/分块是默认工程前提;直接套用常规 3D 管线(乃至 2D 管线思维)会系统性低估任务难度。凡讨论本数据集的方法适配,先问"分块方案是什么"再谈网络设计(§6.2)。

九坑的共同根源与一条总纲:九个坑可归为三类——预期错位(坑 1/2/9)、口径混沌(坑 3/4/5/8)、跨版本误用(坑 6/7)。总纲一句话:每使用一个事实,先问"它来自哪一层、哪个版本、哪个口径"——三问成为肌肉记忆后,九坑全部免疫;这条总纲也是本条目对每个硬数字都绑定来源的原因。

附录 E:检索路径与关键词组合

首选组合(本条目三轮精确搜索的核验词):

  1. "SELMA3D" challenge light-sheet → 官网 + arXiv 2501.03880;
  2. SELMA3D site:zenodo.org → 三条 Zenodo 记录(15267392 / 19733195 / 20149070);
  3. S-BIAD1196 / S-BIAD1197(精确 accession)→ EBI BioStudies 2024 存档。

次级组合(深挖用):

  • self-supervised "light-sheet" segmentation challenge MICCAI(方法学文献侧);
  • tissue clearing light-sheet whole-brain segmentation benchmark(数据集综述侧);
  • erturklab SCP-Nano(代码与工作流侧)。

避用:裸 “SELMA”(坑 1);“SELMA dataset”(歧义更高);任何缩写展开式检索(官方无缩写展开可匹配)。

附录 F:数据集发现与甄别存照(批次 4 生产记录)

本条目生产过程中的两个甄别决策,存照供后续批次参考:

  1. 正选成立确认:任务头正选 SELMA3D 2025(slug: selma3d),经三轮精确搜索三源互证(官网 / Zenodo DOI / arXiv)确认真实存在且素材充足,未启用备选 M&Ms-2 2023——备选核验材料未启用,留档任务头。
  2. 查重:slug selma3d 与 “SELMA3D” 标题关键词在库内无同名条目(SQL 复核),无近名混淆对象(与 SELMA 疟疾模型、地名、电影均无关,坑 1)。

写作过程的两条口径纪律存照(供后续写手复用):其一,凡官方来源间口径不一致处(本条目为训练集规模与 license),采用"双口径并存+来源绑定"写法而非择一——条目的可信度来自对冲突的诚实,不来自对冲突的掩盖;其二,凡推证性结论(如 Task 2 = 28 幅)必须显式标注"推算"及推算路径,与直读事实物理隔离(本条目以 §2 存照块与附录 A 方法说明实现隔离)。

尾注

  • 本条目由 agentA-selma 撰写于 2026-09-27,属千方病案医数集 AI-Ready Wikipedia 50 篇冲刺批次 4。
  • 核验来源清单:selma3d2025.grand-challenge.org(官网多页);Zenodo records 15267392 / 19733195 / 20149070;arXiv 2501.03880;EBI BioStudies S-BIAD1196 / S-BIAD1197;github.com/erturklab/SCP-Nano。
  • 硬数字以 arXiv 摘要、官网 task 页、Zenodo API 元数据三源交叉为准;口径冲突处(规模 58 vs 30+>25、license 三口径)均已双口径存照,未抹平。
  • 条目 URL 占位:https://www.qianfanghub.com/ai-ready-dataset/selma3d/681
  • 双自检存照:check_md.py PASS(0 error)+ preflight_check.py PASS(0 error / 0 warn),核验时点 2026-09-27。

引用本条目(建议格式):

千方病案医学编辑部. SELMA3D:光片显微 3D 体数据的自监督分割挑战赛数据集. 千方病案医数集 AI-Ready Wikipedia, 2026. https://www.qianfanghub.com/ai-ready-dataset/selma3d/681

引用一手来源(方法/数据使用论文必须引用的一手对象):

SELMA3D Challenge 2025 (Version v3) [Data set]. Zenodo. https://doi.org/10.5281/zenodo.15267392 (cc-by-4.0,2025-03-24)
SELMA3D: Self-supervised learning for 3D light-sheet microscopy image segmentation. arXiv:2501.03880 (v2, 2025-01-12). https://arxiv.org/abs/2501.03880
EBI BioStudies S-BIAD1196 / S-BIAD1197(2024 图像存档). https://www.ebi.ac.uk/biostudies/


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • dfuc-2024 — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 挑战赛数据集
  • aims-tbi — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 脑影像
  • mitoem — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 脑影像
  • topbrain2026 — 共享标签:医学影像 / 医学图像分割 / 脑影像
  • instance2022 — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 脑影像
  • bonbid-hie — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 脑影像
  • acouslic-ai — 共享标签:医学影像 / 图像分类 / 挑战赛数据集
  • isic-2018 — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 挑战赛数据集
  • intra — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 脑影像
  • rsna-intracranial-hemorrhage — 共享标签:医学影像 / 图像分类 / 挑战赛数据集 / 脑影像

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集