信息速览
INFOBOX — MITOEM 一屏速览
维度 内容 本质 大规模 3D 线粒体实例分割数据集 + ISBI 2021 挑战赛 + 持续开放的在线评测基准(三合一) 团队 哈佛 SEAS/MCB(Wei、Lin、Lichtman、Pfister 等)+ 西班牙 DIPC/Ikerbasque(Franco-Barranco、Arganda-Carreras),组织委员会 9 人 论文 数据集论文 MICCAI 2020(LNCS 12265:66-76,doi:10.1007/978-3-030-59722-1_7);挑战综述 IEEE TMI 2023;42(12):3956-3971(doi:10.1109/TMI.2023.3320497,CC BY 4.0) 数据 2 卷:MitoEM-H(成人脑皮层)+ MitoEM-R(成年大鼠脑皮层);每卷 1,000×4,096×4,096 voxels @ 8×8×30 nm(32.8×32.8×30 µm) 标注 前 500 slices 实例真值(train 400 + val 100);v1:H 24.5K/R 14.4K 实例 → v2(3 位专家修正):H 19K/R 10.8K;实例 ≥2,000 voxels 难点 MOAS(串珠状线粒体)、多实例缠绕、小线粒体密集、各向异性分辨率 指标 v1:AP-75(体积分组)→ v2:accuracy/F1(cable length 1µm/4µm 分组,2022-07 生效)+ association 六类误差 挑战结果 257 注册 / 14 队提交 / 8 队进综述;accuracy 排名:IIPPR(SJTU)0.770 > VIDAR(USTC)0.678 > EMBL 0.635;baseline U3D-BC 0.643、U2D-BC 0.381 获取 HuggingFace 官方:pytc/EM30(图像,H 23.91GB/R 13.96GB)+ pytc/MitoEM(标签 v2);neuroglancer 在线浏览;grand-challenge 在线评测 许可 数据 HF 卡片 license: mit(GitHub 仓库 LICENSE 文本 2026-09-29 核实一致:MIT, Copyright © 2020 donglai)| 综述论文 CC BY 4.0 | 数据集论文 Springer 版权 版本链 v1(2020-11)→ v2(2021-12 修正标注;2022-03 起在线评估唯一口径) 库内互链 OCELOT(EM 细胞器实例分割)、SELMA3D(3D EM 挑战)、mitos-atypia-14/MIDOG/ROSE(有丝分裂域对照)、NuCLS/Lizard(实例标注方法论)
MITOEM 是一个"把线粒体分割从玩具尺寸拖进工业尺寸"的数据集工程:在它之前,公开线粒体分割基准只有几百个实例、(5 µm)³ 不到的体数据;在它之后,研究者必须在两个各含约两万条线粒体、32.8×32.8×30 µm 的三维电子显微镜栈上证明自己的算法真的能处理串珠状(MOAS)、相互缠绕、形态多变的真实线粒体。它同时是 ISBI 2021 挑战赛的赛题——257 人注册、14 支队伍提交,其中 IIPPR(上海交大)与 VIDAR(中科大)两支中国队伍包揽冠亚军——并且至今仍在 grand-challenge 平台上开放提交与自动评测,是一块"活着的"基准。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——图像在 HF pytc/EM30、标签在 pytc/MitoEM,测试半卷 GT 私有,别找不存在的公开 test 标签。
- 关心评测协议:直奔 §4——AP-75 与 accuracy 两套指标分属 v1/v2 两个时代,引用任何分数前先对版本(坑 4、坑 5)。
- 做算法对比:直奔 §5——8 支参赛方法与 2 条官方 baseline 的完整分数表、误差归因,以及"为什么 top 方法仍搞不定 MOAS"。
§0 导读:这个数据集解决什么问题
线粒体是细胞的能量工厂,也是连接组学、神经退行性疾病研究与细胞生物学定量分析的共同焦点。电子显微镜(EM)能在纳米尺度呈现线粒体的三维几何——但代价是数据规模:一个 32.8×32.8×30 µm 的皮层块按 8×8×30 nm 体素化就是 1,000×4,096×4,096≈168 亿体素,人工逐条标注其中的线粒体既不现实也不可复制。MITOEM 出现之前,该领域的事实标准是 EPFL 的 Lucchi 海马数据集:2048×1536×1065 的栈里只人工标注了约 35%(两个 1024×768×165 子卷),且提供的是二值掩码——线粒体连成一片,无法直接做实例级分析。MITOEM 数据集论文的摘要对此有一句刺痛式的定位:“public mitochondria segmentation datasets only contain hundreds of instances with simple shapes”(公开数据集只有几百个简单形状的实例),“It is unclear if existing methods achieving human-level accuracy on these small datasets are robust in practice”(在小数据集上达到人类水平的既有方法是否稳健,是存疑的)。
MITOEM 的回答分三层。第一层是体量:两个 (30 µm)³ 级别的 EM 栈,人、鼠皮层各一,共约 4 万个真值实例(v1 口径),比既有基准大 3,600 倍(论文摘要口径;相对 Lucchi 单一基准的体素倍数是 1,986 倍——两套口径详见坑 6)。第二层是任务形态:从二值分割升级为实例分割——每条线粒体一个 ID,MOAS 串珠、缠绕接触这些"分割对了也算错"的形态第一次有了系统的真值。第三层是持续评测:挑战赛没有随 ISBI 2021 闭幕而关场,而是把测试半卷真值握在组织者手里,任何人都可以提交预测获得在线评测;赛后组织者还用三轮专家复核修正了 v1 标注的三类系统性错误(v2),并基于对 14 支参赛队伍误差的解剖,把指标从 AP-75 换成了更贴近 bottom-up 方法的 accuracy/F1,实例分组从体积换成骨架缆长(cable length)。这套"数据集+私有测试+指标迭代"的组合,是后来医学挑战赛"持续开放"模式的早期范本。
先立一个时间轴框架:EM 线粒体分割的三个时代。第一个时代是 Lucchi(2012 起)代表的"小栈+二值掩码"时代——问题被提出,但真值形态与体量都撑不起实例级科学问题;第二个时代由 MITOEM(2020)开启——大体量 + 实例级真值 + 持续在线评测,让"每条线粒体"成为可评价的单元,也把 MOAS 这类形态学难点第一次变成可计量的榜单条目;第三个时代正在展开——哈佛 Lichtman 系的 H01(Science 2024,petavoxel 人皮层)把体量推到 PB 级,transformer 与基础模型方法开始进入 EM 分割(STT-UNET 2023 等)。MITOEM 恰好卡在中间承上启下:足够大以暴露方法学短板,又足够小以让实验室级算力可复现(§7.2 有完整的谱系对照表)。
再立三个关键词,全文检索都绕不开它们:
- 实例(instance):MitoEM 的真值不是"哪里有线粒体"的二值图,而是"每一条线粒体是谁"的 ID 图——这决定了它的一切评测协议(§4)。
- 版本(v1/v2):标注有 2020-11 的 v1 与 2021-12 的 v2 两代,实例数差 5.5K/3.6K;在线评测 2022-03-02 起只用 v2。引用任何数字先问版本(坑 4)。
- 口径:30 µm 还是 32.8 µm、3,600× 还是 1,986×、AP-75 还是 accuracy、val 还是 test——同一件事在一级来源里常有多个并存口径,本条目的原则是全部列出、标注出处、不擅自合并(坑 3/坑 5/坑 6)。
§0 读法三则:
- 这个条目是"数据集+挑战赛+评测协议"三合一:本体是两卷 EM 栈与实例真值,赛事是 ISBI 2021(已闭幕但评测开放),协议是 v1 AP-75 / v2 accuracy 双轨——三者纪年与版本各不相同,检索时先对表(§3 时间线与坑 1)。
- 全文硬数字均出自三处一级来源:MICCAI 2020 数据集论文、IEEE TMI 2023 挑战综述、官网 mitoem.grand-challenge.org;两篇论文之间的口径差(3,600× vs 1,986×、30 µm vs 32.8 µm)已在坑 3/坑 6 存照。
- 检索时注意:挑战赛名为 “MitoEM”(官网标题 “MitoEM Challenge”),数据文件以 “EM30” 开头(EM30-H/EM30-R),同一 HF 仓库里的 EM30-M 是小鼠轴突数据(AxonEM),不属于本挑战(坑 8)。
§1 数据集速览:十问十答
Q1:MITOEM 到底包含什么?
两个三维电子显微镜图像栈:MitoEM-H(成人脑皮层组织)与 MitoEM-R(成年大鼠脑皮层组织),每卷 1,000 张连续切片、每张 4,096×4,096 体素,体素分辨率 8×8×30 nm;外加每卷前 500 张切片的线粒体三维实例真值标注(v1/v2 两个版本),以及 grand-challenge 平台上的在线评测服务。
Q2:名字里的 H 和 R 是什么?
Human 和 Rat。MitoEM-H 来自成人脑皮层,MitoEM-R 来自成年大鼠脑皮层——两域是"人 + 大鼠",与 HeLa 细胞系无关(常见误记,坑 2)。二级来源称 MitoEM-R 为大鼠初级视皮层(V1),但一级来源只写 “adult rat brain tissue / cortex”,脑区细分未见于论文。
Q3:训练/验证/测试怎么分?
GT 只覆盖每卷前 500 张切片:0-399 训练(400 slices)、400-499 验证(100 slices);500-999 共 500 张为测试半卷,真值私有,只能通过官网在线评测获得分数。
Q4:标注有多少实例?
v1 口径:MitoEM-H 24.5K、MitoEM-R 14.4K,合计约 38.9K(论文摘要约 40K)。2021 年 12 月三位专家复核后的 v2:H 降为 19K、R 降为 10.8K——降掉的 5.5K/3.6K 主要是误标细胞器与误合并实例。所有真值实例体积 ≥2,000 voxels。注意:当前在线评测只认 v2 口径(2022-03-02 起),引 v1 数字必须写明"v1"。
Q5:为什么这个数据集难?
三个结构性难点。其一,MOAS(mitochondria-on-a-string):多条线粒体由细微管串联成串珠,分割算法极易在细连接处断裂(过分割)或把整串并成一条(欠分割);其二,多实例缠绕纠缠,接触面大;其三,分辨率各向异性(z 向 30 nm 是面内 8 nm 的近 4 倍),沿 z 的形态连续性弱。TMI 综述的结论是:即使冠军方法,MOAS 与复杂形态上的错误依旧大量存在(§5.4 误差解剖)。
Q6:用什么指标评?
两个时代两套指标。v1(ISBI 挑战赛期):AP-75——IoU 0.75 阈值的 3D 平均精度,按实例体积分 small/medium/large 三组。v2(2022-07 起平台口径):accuracy(匹配型指标,IoU>0.75 记 TP),实例按骨架缆长(cable length)1 µm/4 µm 阈值分三组;另配 association metrics 六类误差归因(one-to-one/过分割/欠分割/多对多/漏检/背景)。两套数字不可直接对比(§4.3 有对照速查表)。
Q7:挑战赛战果如何?
257 人注册、14 支队伍提交、6 队参加 ISBI 2021 workshop、综述展示 8 支 top 方法。按 v2 accuracy 重排的最终榜:IIPPR(上海交大)0.770、VIDAR(中科大)0.678、EMBL 0.635 分列前三;官方 3D baseline U3D-BC 0.643(能挤进参赛队前三区间)、2D baseline U2D-BC 仅 0.381。
Q8:数据在哪里下?
HuggingFace 官方渠道:图像在 pytc/EM30(EM30-H-im-pad.zip 23.91GB、EM30-R-im.zip 13.96GB),标签在 pytc/MitoEM(EM30-H-mito-train-val-v2.zip 55.9MB、EM30-R-mito-train-val-v2.zip 66.6MB)。注意 H 卷图像是 padded 版(每侧 zyx 各补 [20,512,512]),对齐标注坐标时要用同一版(坑 7)。
Q9:license 是什么?
官方 HF 数据集卡片标注 license: mit(MIT);GitHub MitoEM-challenge 仓库的 LICENSE 文件经本条目直接抓取核实(2026-09-29)同为标准 MIT License,版权行 “Copyright © 2020 donglai”——两个口径闭合一致。TMI 综述论文 CC BY 4.0;MICCAI 2020 数据集论文为 Springer 版权。三层许可各管各的资产(§6.4 分层表)。
Q10:和库内哪些数据集成套读?
OCELOT(rid 308)——同样是 EM 下的细胞级/细胞器实例分割,模态与任务最近;SELMA3D(rid 681)——3D FIB-SEM 挑战赛数据集,赛事组织模式对照;MiToS/mitos-atypia-14(rid 288)、MIDOG(rid 298)、ROSE(rid 331)——有丝分裂检测任务域(线粒体为分裂供能,域相邻模态不同);NuCLS(rid 248)/Lizard(rid 238)——实例分割标注方法论(多机构多专家 vs MitoEM 少数专家复核)对照。全表见 §9。
§2 数据构成与规格
2.1 两卷两物种:人皮层与大鼠皮层
MITOEM 的本体是两个独立的 3D EM 图像栈。MitoEM-H 采集自成人脑皮层组织(adult human brain tissue),MitoEM-R 采集自成年大鼠脑皮层组织(adult rat brain tissue)——TMI 综述 §II-A 原文明确 “one from adult rat brain tissue (MitoEM-R) and the other from adult human brain tissue (MitoEM-H)”。选择一鼠一人的用意是让基准覆盖跨物种的线粒体形态差异:TMI §II-B 的观察显示人组织中小线粒体远多大鼠组织、而人大组织的线粒体更细——不过论文同时谨慎声明,两卷的物种差异"不可外推泛化",因为得出物种级结论需要更多样本。
这个"小线粒体多"的观察在数据里有直接体现:v2 缆长分组下,人卷 small(<1 µm)实例 5,106 条、占人卷标注实例的多数,而大鼠卷以 medium(1-4 µm)为主(3,832/5,648,§2.5 表)。对应到分数表(§5.1),所有参赛方法在人卷的 accuracy 都低于大鼠卷——"人卷更难"不是玄学,而是与形态学密度一致的系统性现象。
关于具体脑区,一级来源只说 cortex(皮层);第三方整理(HF MedOtter/MitoEM 卡片)称 MitoEM-R 为大鼠 V1(初级视皮层),本条目按一级来源口径写作"脑皮层",V1 细分不写入正文(存照 C7)。供体数量、年龄、性别、固定方案等采集元数据在两篇一级论文中均未逐项披露——这与多数连接组学数据集(如 H01)的披露程度一致,检索者引用时只能落在大脑皮层 EM 这一层。
2.2 体素分辨率与物理尺寸:三个口径的换算
每卷 1,000 张连续切片(z 向),面内 4,096×4,096 体素,体素分辨率 8×8×30 nm(x,y,z)——面内 8 nm 足以分辨线粒体双层膜与嵴,z 向 30 nm 是连续切片的典型步长,这也意味着 z 向的形态连续性弱于面内:一条跨 10 层的线粒体在 z 向只跨越 300 nm。
物理尺寸存在三个并存口径,引用时需注明:
| 口径 | 数值 | 出处 |
|---|---|---|
| 官网 Task 节简写 | two 30x30x30 um datasets | mitoem.grand-challenge.org |
| MICCAI 2020 摘要 | two (30µm)³ volumes | LNCS 12265 摘要 |
| TMI 2023 精确值 | 32.8 × 32.8 × 30 µm | TMI §II-A |
精确值与约数的差异来自面内:4,096 体素 × 8 nm = 32.768 µm ≈ 32.8 µm,而 z 向 1,000 × 30 nm = 30 µm 恰好是整数。"30×30×30"是把面内取整到 30 的营销式简写。体素总数 1,000×4,096×4,096 ≈ 167.8 亿 voxels/卷,两卷合计约 335 亿——HF pytc/MitoEM 卡片的 size_categories 标注 “1B<n<10B” 是按数据集条目(非体素)口径的另一套分档,两数不矛盾但别混用。
官方发布的图像文件有一处工程细节:MitoEM-H 的图像 zip 是 padded 版(文件名 EM30-H-im-pad),在 z/y/x 三个轴的两侧各补 [20, 512, 512],即实际加载出来的数组是 1,040×5,120×5,120 而非 1,000×4,096×4,096。补边目的是给滑动窗口推理留上下文;做标注对齐或指标计算时必须裁回原始坐标(坑 7)。R 卷图像(EM30-R-im.zip)无 padding。
2.3 实例真值:半卷公开、半卷私有
每卷的 GT 覆盖前 500 张切片(z=0-499),以逐切片实例掩码目录分发:**train(0-399,400 slices)**与 **val(400-499,100 slices)**两个子文件夹。每卷剩余的 500-999 共 500 张切片是测试半卷——图像公开(在图像 zip 内),真值私有,只有组织者的在线评测能给出测试分数。这个"半卷公开半卷私有"的设计让本地训练与在线竞赛使用同一份图像分布,也意味着:本地能复现的只有 val 分数,文献里任何 “test set” 数字都来自在线评测(或论文作者与组织者的私下通道,如 MICCAI 2023 STT-UNET 曾应审稿人要求补测)。
实例下限:真值中的每条线粒体至少 2,000 voxels(官网 Dataset 节)。这个下限把碎片化的线粒体"碎屑"排除在真值之外——算法若把碎屑检出来会被计为 FP,所以提交前做体积过滤(size filtering)是参赛队标配后处理(TMI Table I 中 IIPPR 等队明示 “size filtering”)。
标注的物理形态是逐切片 2D 实例掩码:每张切片一个文件,像素值即实例 ID(0 为背景、1 起为实例编号),train/val 两个子目录按切片序号组织。三维实例(一条线粒体跨多张切片共享同一 ID)靠逐切片 ID 沿 z 堆叠获得——这也解释了为什么实例打标方法(连通组件的 2D/3D 邻接定义)会成为提交格式的显式声明项(FAQ Q36)。
2.4 标注版本链:v1 的三类系统性错误与 v2 的专家修正
v1 标注随数据集于 2020-11-26 发布、随挑战赛使用。赛后组织者识别出三类系统性标注错误(TMI Fig.1):
- 相似细胞器误标:其他暗染色细胞结构被误画成线粒体——这是参赛方法 FP 的重要来源(模型"学对了",却被真值惩罚);
- 相邻误合并:紧贴的两条线粒体被并成一条实例;
- MOAS 不完整:串珠状线粒体的细微管连接在标注中时断时续,导致一条 MOAS 被拆成多段。
三类错误有一个共同根源:EM 灰度里的视觉歧义 + 单批标注、无独立复核的流程。暗染色细胞结构 vs 线粒体、紧贴 vs 融合、细微管 vs 切片伪影,这些判别在单视图下没有唯一答案——只有第二个独立读片人交叉验证才能暴露分歧。这不是标注员粗心,而是协议缺位的结构性产物(§8.4 有方法论展开)。
修正不是随手改:组织者请了三位具备 EM 阅片与线粒体形态学功底的神经科学专家,各自独立复核全部标注,再以共识会议收敛分歧,最终合并出修订版。修正后的实例数变化是硬数据(TMI §II-A):
| 卷 | v1 实例数 | v2 实例数 | 降幅 |
|---|---|---|---|
| MitoEM-H | 24.5K | 19K | -5.5K(约 -22%) |
| MitoEM-R | 14.4K | 10.8K | -3.6K(约 -25%) |
v2 于 2021 年 12 月上传 grand-challenge 平台,参赛方法全部按 v2 重评——排行榜名次基本未变(“the overall rankings on the leaderboard remained largely unaltered”),说明 top 方法对标注噪声相对鲁棒。但注意时间线:2022-03-02 起在线评估只使用 v2(官网 Important Note),v1 leaderboard 截图仅作历史存档。引用任何在线分数,先确认是 v1 还是 v2 口径(坑 4)。
组织者同时在官网上公开承认 “The annotation is not perfect”——这不是谦虚而是运营机制:任何使用者发现误标,可邮件 linzudi@g.harvard.edu(主题固定 “[MitoEM Error]”)提交 (x,y,z) 坐标参与众包纠错。这种"真值即服务"的持续维护模式,是 MITOEM 与"下载即冻结"的传统数据集最大的气质差异。
2.5 实例分组:从体积到缆长(cable length)
v1 用体积把实例分 small/medium/large 三组分别评测;v2 改用缆长(cable length = 实例骨架总长,含所有分支,按 8×8×30 nm 轴向分辨率度量,Kimimaro 工具骨架化),阈值 1 µm 与 4 µm。换组的动机是体积分组会把 MOAS 错分:一条 30 µm 长但管径极细的 MOAS 体积可能落进"medium",而它恰恰是最难的形态。新分组下(TMI §II-B):
| 卷 | small(<1 µm) | medium(1-4 µm) | large(>4 µm) |
|---|---|---|---|
| MitoEM-H | 5,106 | 3,608 | 164 |
| MitoEM-R | 1,292 | 3,832 | 524 |
两个立即可读的结构信号:人组织 small 占多数(5,106/8,878),大鼠组织 medium 为主(3,832/5,648);所有 MOAS 在新口径下都归入 large——与直觉一致(串珠必然长)。注意:TMI 原文未注明这组数字对应公开半卷(train+val 500 slices)还是私有测试半卷,本条目不推断(存照 C5)。人组织 large 仅 164 条也提示:对 large 类指标要小心小样本波动。
Kimimaro 是连接组学社区通用的骨架化工具(对 3D 实例掩码提取中心线骨架并计总长);“缆长"的直觉含义是"把这条线粒体拉直有多长”——一条典型球状线粒体缆长 1 µm 上下,一条跨半个视野的 MOAS 可以超过 4 µm。分组阈值取 1 µm/4 µm 正好把"小圆粒/常规管状/长串珠"三档形态分开,让"难例"有了专属榜(§4.2)。
这组分组数字有两种用法,检索者按需取用:
- 设计消融报告:把你自己方法的分数按同口径三组拆开报告——large 组暴露 MOAS 能力、small 组暴露密集小目标能力,比单一总分信息量大得多(top 方法三组间差可达数十个百分点)。
- 估算误差预算:small 组实例基数大(H 卷 5,106 条),每 1% 的 small 组失误影响约 51 条实例;large 组基数小(H 卷 164 条),同样 1% 只影响 1-2 条——但 large 组恰是审稿人最容易盯住的"难例证据"。报告策略上,两组都要单列,别用总分掩盖结构性差异。
2.6 与 Lucchi/Kasthuri 的规模对照:MITOEM 改变了什么
MITOEM 论文的引言把旧基准解剖得很彻底。Lucchi(EPFL 海马,2012 起):完整栈 2048×1536×1065 voxels,但只有约 35% 被人工标注(两个 1024×768×165 子卷),物理尺度 (5 µm)³ 级,不到 0.3 Gigavoxels;且提供的是二值掩码——“instances of mitochondria can be connected to each other”,无法直接出实例级指标。Kasthuri 系列在 3-cylinder 体数据内做了线粒体掩码,Casser 等后来用统一标注协议改良了边界质量,但规模量级未变。
规模倍数有两套口径并存:
- 3,600×(MICCAI 2020 摘要):相对 “previous benchmarks”(复数、泛指),按实例数与数据量的综合口径;
- 1,986×(TMI 2023):相对 Lucchi 单一基准,公式 ((4096×4096×1000)(8×8×30))/((165×1024×768)(5×5×5))≈1986,纯体素×分辨率口径。
两数都对,基准不同。引用时写"比既有基准大约三个数量级(3,600×/1,986× 两种口径,坑 6)"最稳。这个量级跃迁的直接后果是评测协议的迁移:像素级指标(Rand index 类)在 168 亿体素上既慢又依赖完美真值,实例级指标(AP、accuracy + association 误差)成为 MITOEM 之后的默认(§4)。
2.7 各向异性专题:8×8×30 nm 的实际含义
各向异性(an isotropic resolution)是 MitoEM 一切工程决策的暗线,值得单开一节把它说透。
数字上:z 向 30 nm / 面内 8 nm ≈ 3.75 倍。同一物理长度,z 向需要的体素数只有面内的约 1/3.75——一条面内跨 500 体素的线粒体,沿 z 方向可能只跨 100 余层。这带来三个直接后果:
- 跨层连续性弱。相邻切片间的线粒体外观变化大于面内相邻像素的变化,2D 逐切片分割再堆叠的管线(如 U2D-BC)会积累层间错位——这正是 U2D-BC 与 U3D-BC 之间 0.381 vs 0.643 差距的物理学根源之一。
- 重采样陷阱。如果为了"各向同性"把体素重采样到 8×8×8 或 30×30×30,前者体积膨胀近 4 倍且 z 向插值会凭空造出平滑的假细节,后者把面内分辨率打回 30 nm——双层膜与嵴的细节全部丢失。更隐蔽的是:各向同性重采样会改变 MOAS 细微管在 z 向的连通表现,把原本时断时续的连接彻底断开或糊死(附录 AA 第 3 条检查项)。
- patch 设计不对称。3D 滑窗推理的 patch 在 z 向要更薄、面内更大(官方 baseline 管线的典型设计思路),H 卷 padded 版两侧各补 [20,512,512] 正是给这种滑窗留边界上下文——注意 pad 的比例本身就是各向异性的镜像(z 向补得少、面内补得多)。
引用纪律:写论文时报分辨率必须写全 “8×8×30 nm (x,y,z)” 或 “8×8 nm in-plane, 30 nm section thickness”,不要只写 “8 nm”(会被理解为各向同性)——这是检索 MitoEM 相关文献时常见的转述走样。
2.8 MOAS 专题:串珠状线粒体,基准的灵魂难点
MOAS(mitochondria-on-a-string,官网中文可译"串上线粒体"/串珠状线粒体)是 MitoEM 全部叙事的支点:官网 Task 节把它列为首要形态学挑战,TMI 综述引 Zhang et al. 指出 MOAS 是疾病进展与突变累积中富集的表型——它不只是"难分割的形状",而是有生物学意义的对象。
它是什么:多条线粒体由直径极细的微管(tubule)首尾串联,形如一串珠子。三维上看,"珠"是直径数百纳米的椭圆体,"线"是几十纳米级的细管——在 8 nm 面内分辨率下细管只有几个像素宽,且沿 z 向(30 nm 步长)常常只在相邻一两层内可见。
算法为什么栽在它上面——两种对称的失败模式:
- 过分割(over-segmentation):预测在细管处断裂,一条 MOAS 被切成数段。按 IoU>0.75 匹配,只有与真值实例重叠最大的段能记 TP,其余段全部记 FP;同时真值侧这一条因没有完整匹配而记 FN——一个错误同时污染两种计数。
- 欠分割(under-segmentation):预测把相邻线粒体(或整串 MOAS 与邻居)并成一大块,IoU 被大体积稀释,匹配失败;在 association 归因里落进 under-segmentation 或 many-to-many。
基准设计如何回应:v2 把 MOAS 全部归入 large(缆长 >4 µm)组,让这个难点有了专属榜单条目;association 六类误差把过分割/欠分割分开计数,让失败模式可归因(§4.2)。TMI Fig.5 的 3D 可视化直接对比 top-2 方法在单条 MOAS 上的预测与真值——细管断裂与粘连肉眼可见,这是"substantial errors remain unsolved for mitochondria with challenging morphologies"结论的直观证据。
给使用者的实操提示:训练时若发现 large 组分数异常低,先查三件事——细管处的损失权重(边界/轮廓通道)、z 向 patch 是否过薄导致细管跨层证据不足、后处理是否用了会切断细连接的形态学操作。这些是误差解剖(§5.4)与公开复现讨论中反复出现的主题。
2.9 文件与目录组织一览
把两个 HF 仓库的内容下载并解压后,磁盘上的组织形态如下(文件名与大小经 HF API 实测 2026-09-29;目录层级按官方 aux 工具与 PytorchConnectomics 加载器的约定示意,以实际解压结果为准):
MitoEM/
├── EM30-H-im-pad/ # 图像:MitoEM-H(padded 版,zip 23.91GB)
│ └── im/ # 解压后逐切片图像(z=0..1039,含两侧各 20 张 pad)
├── EM30-R-im/ # 图像:MitoEM-R(无 pad,zip 13.96GB)
│ └── im/ # 解压后逐切片图像(z=0..999)
├── EM30-H-mito-train-val-v2/ # 标签 v2:H 卷(zip 55.9MB)
│ ├── train/ # z=0..399 逐切片实例掩码(400 slices)
│ └── val/ # z=400..499 逐切片实例掩码(100 slices)
├── EM30-R-mito-train-val-v2/ # 标签 v2:R 卷(zip 66.6MB)
│ ├── train/
│ └── val/
├── mitoem_R_train_4um_im.h5 # R 卷 4µm 下采样迷你版图像(32.4MB)
└── mitoem_R_train_4um_seg.h5 # 对应下采样标签(0.5MB)
三件加载前必查事项:
- H 卷先裁 pad:图像数组若为 1,040×5,120×5,120,先按每侧 [20,512,512] 裁回 1,000×4,096×4,096,再与标签对齐(坑 7;附录 G 有代码骨架)。
- 标签只到 z=499:train+val 目录不存在 z≥500 的文件——不是下载不全,是设计如此(测试半卷 GT 私有)。
- 同仓不同任务:pytc/EM30 里还有 EM30-M-im-pad.zip(15.21GB)——那是 AxonEM 小鼠轴突卷,不在上面目录树里,别拉进线粒体管线(坑 8、存照 C10)。
§3 挑战赛组织与时间线:一场持续开放的 ISBI 赛事
3.1 纪年三元组:论文 2020 / 挑战 2021 / 综述 2023
检索 MITOEM 最容易踩的坑是纪年。三个年份各有所指,缺一不可:
| 年份 | 事件 | 载体 |
|---|---|---|
| 2020(10 月) | 数据集论文发表 + 挑战被 ISBI 2021 接收(10 月)+ 官网 11-01 上线 | MICCAI 2020(LNCS 12265:66-76,online 2020-09-29) |
| 2021 | 挑战赛正赛:11-08 起注册、11-26 发布数据、2021-02-28 测试提交截止、04-13 ISBI 现场挑战 | IEEE ISBI 2021(2021-04-13~16) |
| 2023(12 月) | 挑战综述论文:8 队方法+误差解剖+指标反思 | IEEE TMI 42(12):3956-3971 |
"MICCAI 2023 的 MitoEM 挑战赛"是不存在的赛事——MICCAI 2023 只是有第三方论文(如 STT-UNET,3D spatio-temporal transformer 分割)把 MitoEM-H/R 当基准用。主会话任务简报曾如此误记,本条目已按一级来源纠正并在此存照(坑 1)。
3.2 完整时间线(官网 Important Dates 逐条)
- 2020-10:挑战被 ISBI 2021 接收(TMI §II-C:“accepted to ISBI 2021 in October 2020”)
- 2020-11-01:挑战官网上线
- 2020-11-08:注册开放
- 2020-11-26:训练/验证/测试图像 + 训练/验证真值发布(测试真值不发布)——两卷图像当日即全部可下,参赛者可立即开工
- 2021-02-28:测试集结果提交截止
- 2021-03-10:优胜队伍 4 页短文提交截止
- 2021-03-15 / 03-20:场外 leaderboard 更新与 top 队伍展示确认(需 ISBI 注册)
- 2021-03-18:ISBI 注册截止
- 2021-04-13:ISBI 2021 现场挑战日(大会整体 04-13~16)
- 2021-12:v2 修正标注上传平台,全部参赛方法重评
- 2022-03-02:起在线评估仅用 v2
- 2022-07:新指标(accuracy + cable length 分组)在平台生效
- 至今:在线提交与自动评测持续开放
时间线里藏着两个容易被忽略的细节:其一,数据发布(11-26)到测试提交截止(02-28)只有约三个月——参赛者的真实窗口期比"挑战赛跨年"的印象短得多,这解释了为什么正赛方法清一色复用成熟骨干(§5.2);其二,赛后维护期(2021-12 v2、2022-03 换口径、2022-07 换指标)比正赛期更长——组织者把主要精力投在了"让基准活得更久"上,这个投入比例在同代挑战赛里罕见(§3.5)。其三,现场日(04-13)是 ISBI 2021 大会(04-13~16)的首日——挑战报告在会议一开幕即举行,top 队伍的 4 页短文(03-10 截止)已提前定稿,赛果公开与论文存档几乎同步。
3.3 参与规模与赛制
TMI 摘要给出参与画像:提交截止时 257 人注册、14 支队伍提交结果、6 队参加 ISBI workshop;综述展示了 8 支 top 方法外加组织者自己的 baseline。257 注册到 14 提交是医学影像挑战赛典型的"注册-提交"衰减漏斗——注册零成本、提交需真实算力与工程投入,约 5% 的转化率让"提交过"本身就是有效信号(这也是为什么 14 队的每一个提交都进了误差解剖样本)。
赛制特点有三:
- 本地训练、在线评测:参赛者在自己的算力上分割(“Participants performed the segmentation on their own computers”),预测以 H5 体积上传——组织者不托管训练,只托管测试评测。
- 提交格式工程化:官方 aux 工具把逐切片预测转成 H5(下采样 2×、连通组件自动打标、LZF 压缩省带宽);也允许其他打标方法但需在提交备注说明。
- 赛后不关场:挑战结束后 leaderboard 继续接受提交——这也是为什么 MitoEM 能持续吸收新方法(如 2023 年的 transformer 系)的基准更新。
3.4 组织者与资助
组织委员会 9 人横跨三个机构群:哈佛 SEAS(Donglai Wei、Zudi Lin、Won-Dong Jang、Hanspeter Pfister)、哈佛 MCB(Xueying Wang、Wenjie Yin、Jeff W. Lichtman)、西班牙 DIPC/Ikerbasque(Daniel Franco-Barranco、Ignacio Arganda-Carreras)。Wei(数据集论文一作)与 Lin(PytorchConnectomics 框架一作)是工程双核;Lichtman(连接组学奠基人之一)与 Pfister(计算成像)提供学术背书;Franco-Barranco 是 TMI 综述一作与误差分析方法主力。
这个人员结构预示了后来的分工演化:挑战综述(TMI 2023)的 27 位作者里,新增的 11 位哈佛系之外作者主要来自参赛队伍转化——USTC(VIDAR)、SJTU(IIPPR)、EMBL 等队成员以共同作者身份参与了误差解剖与方法章节,另有 EMBL/EMBL-EBI 系的 Pape、Conrad、Nightingale、de Folter 等欧洲协作网络。"参赛者变共同作者"是挑战赛社区运营的一种可复制路径。
资助(PubMed Grants 档案):NIH/NCI 75N91019D00024 与 U54 CA225088(美国)、Cancer Research UK FC001999 与 Wellcome Trust FC001999(英国 MRC LMB 侧)。
3.5 三个运营设计选择:私有测试、持续开放、众包纠错
把 §3 前四节的材料压缩成三个"设计选择",它们共同构成了 MitoEM 区别于同代挑战赛的运营签名:
- 测试半卷真值永不公开。代价是本地无法复现 test 分数;收益是测试集永远干净——不随标注泄露、不随时间贬值,在线评测通道因此可以运营多年而不失效。这是"挑战赛→常设基准"转型的前提条件。
- 赛后持续开放提交与自动评测。官网原话 “We keep the online evaluation open for new submissions”;TMI 摘要 “the challenge remains open for submission and automatic evaluation”。大多数会议挑战赛在会后即关场,MitoEM 把 leaderboard 变成了滚动记录——2022-2023 年的新方法(transformer 系)正是通过这个通道进入比较体系,无需组织者另办赛事。
- 众包纠错邮箱。“[MitoEM Error]” 主题 + (x,y,z) 坐标的极简协议,把全球使用者的眼睛变成持续质检网络;v2 修正与这条通道共同构成"标注是活的"的运营承诺。
三个选择的共同哲学:基准的价值随时间增长的前提,是组织方保留一部分"不公开"与"不停机"。这组选择后来被多个后续挑战赛(含库内 SELMA3D 的组织模式)以不同形式借鉴(§9.3)。
§4 评估体系演变:一场由参赛数据反向驱动的指标改革
4.1 v1 指标:AP-75 与它的先天不适配
v1 时代指标沿用数据集论文的设计:AP-75——以 IoU 0.75 为唯一命中阈值的 3D 平均精度,实例按体积分 small/medium/large 三组分别计算再汇总。AP 在 2D 检测(Mask R-CNN 传统)里依赖"每个实例带置信度分数"的前提;但 MitoEM 参赛方法绝大多数是 bottom-up 管线(预测前景+边界,再用分水岭/聚类切实例),天然没有实例置信度。数据集论文的折衷是用实例体积近似置信度(大实例=高置信)——TMI 的回顾直接点名这个近似的恶果:“can lead to unintuitive evaluation results”。
v1 评分的计算流程可以压缩成如下伪代码(示意,帮助理解"体积近似置信度"如何进入排序):
AP-75 计算示意(v1 口径):
1. 对每个预测实例 p,取其体积 V(p) 作为置信度
2. 全部预测按 V 降序排列(大实例优先)
3. 依次取出预测 p:
在未匹配真值中找 IoU(p, g) ≥ 0.75 的 g
若找到 → p 记 TP,g 标记已用
否则 → p 记 FP
4. 遍历结束后,未被匹配的真值 g 记 FN
5. Precision = TP/(TP+FP),Recall = TP/(TP+FN)
6. 按 small/medium/large 三组分别统计后汇总为 AP-75
恶果的具体形态(TMI §V 玩具例解剖):一条 large MOAS 被预测切成数段,其中只有最大的一段能与真值匹配上(IoU≥0.75),其余各段全部记 FP;同时被体积近似的置信度排序把小实例排到最后——当小实例与 medium 实例粘连预测时,小实例先被记 FN。结果就是:AP-75 对 FP 过度宽容、对 MOAS 类实例系统性误罚。综述的回顾性结论之一原话是 “challenge metric was permissive with the false positive predictions”。
用一句话概括 v1 指标的病灶:它假设了一个不存在的东西(实例置信度),然后用一个错误的代理(体积)去填补——排序污染了匹配,匹配又污染了计数。
4.2 v2 指标:accuracy + 缆长分组 + association 误差归因
2022-07 在平台生效的 v2 方案有三件套:
- accuracy(匹配型):预测实例与真值实例以 IoU>0.75 匹配,TP/FN/FP 直接算 accuracy(等价于常见的 instance F1 口径)——不再需要置信度排序,bottom-up 方法公平参赛。这是 v2 leaderboard 的总排名依据。
- 缆长三分组:small(<1 µm)/ medium(1-4 µm)/ large(>4 µm),按骨架缆长而非体积——MOAS 全部归 large,"难例"有了专属榜。
- association metrics(Ka et al. 分类法):把预测-真值的对应关系拆成六类——one-to-one(一一对应)、over-segmentation(过分割)、under-segmentation(欠分割)、many-to-many(多对多)、missing(漏检)、background(背景 FP)——不排名,专供误差归因。
accuracy 的计算流程同样可以压缩成伪代码(注意与 4.1 的差别只在"排序"被拿掉了):
accuracy 计算示意(v2 口径,IoU 阈值 0.75):
1. 对每个真值实例 g:在全部预测中找 IoU(g, p) > 0.75 的 p
恰有一个 → one-to-one(g 记 TP,p 消耗)
有多个 → many-to-many / under-segmentation 归因
没有 → g 记 FN(missing)
2. 未消耗的预测 p:
与任何真值 IoU 均不过阈 → 记 FP(background)
若对应真值被切成数段 → over-segmentation 归因
3. accuracy = TP / (TP + FN + FP) # 等价 instance F1
4. 按 small / medium / large(缆长)三组分别报告
association 六类与失败模式的对应关系(读 TMI 误差图时的解码表):
| 误差类型 | 含义 | 典型成因 |
|---|---|---|
| one-to-one | 预测与真值一一对应 | 正确检出 |
| over-segmentation | 一条真值被切成多段预测 | 细管断裂(MOAS 典型)、边界过敏感 |
| under-segmentation | 多条真值被并成一个预测 | 缠绕区粘连、分水岭欠切 |
| many-to-many | 多对多混杂 | 缠绕+断裂并发 |
| missing | 真值没有任何预测对应 | 漏检(低对比、边缘缺失) |
| background | 预测无真值对应 | FP(暗染结构误检、碎屑未过滤) |
组别实例数(v2 口径,TMI §II-B):H = 5,106/3,608/164,R = 1,292/3,832/524(small/medium/large)。数据集论文同期还给 3D AP 实现做了 45× 加速(稀疏实例+3D IoU 快速近似),让大体积上的实例评测在工程上可行——这也是它对领域的方法论遗产之一。
4.3 两套指标对照速查
引用或复现任何 MitoEM 分数前,先过这张表:
| 维度 | v1(挑战赛期) | v2(2022-07 起平台口径) |
|---|---|---|
| 排名指标 | AP-75 | accuracy(IoU>0.75 匹配,=instance F1) |
| 置信度/排序 | 体积近似置信度排序 | 无需排序 |
| 实例分组 | 体积 small/medium/large | 缆长 <1µm / 1-4µm / >4µm |
| MOAS 归组 | 体积可落 medium(错配) | 全部归 large |
| 误差归因 | 无 | association 六类 |
| 生效期 | 2020-11 至 2022-07(平台侧) | 2022-07 至今 |
| 标注版本 | v1(2021-12 后平台重评用 v2) | v2 |
| leaderboard | v1 截图仅存档(存照 C12) | 当前在线数字全部此口径 |
两个易踩的复合坑:其一,TMI 综述为对比 8 支队伍,用 v2 accuracy 重排了所有方法——表内名次与 2021 年现场公布的原 leaderboard 顺序不同(坑 5);其二,v1 数字若出自 2021 年论文/截图,标注是 v1;若出自 2021-12 后的平台复评,标注已是 v2——同一个"挑战赛分数"标签下可能是两代标注。
口径判别三步法:拿到任何一份 MitoEM 分数,按序问三个问题即可定位口径——
- 看出处时间:2021-11 前的论文/材料 → 大概率 v1 + AP-75;2023-12 之后引用 Table III → v2 + accuracy;在线 leaderboard 截图 → 先确认截图日期在 2022-03-02 前还是后。
- 看指标名:出现 “AP” 或 “average precision” → v1 口径;出现 “accuracy” 且带 small/medium/large → 需再确认分组维度是体积还是缆长(缆长口径会标注 cable length)。
- 看集合:分数旁注 “test” → 只可能来自在线评测(或组织者通道),GT 不公开;注 “val” → 可本地复现,按附录 G4 的示意流程核对。
三问之后仍无法定位的分数,按"来源不明"处理、不入对比表——这比猜一个口径再错引安全得多。
4.4 指标改革的方法论启示
MitoEM 的指标改革有一条可迁移的经验:评测协议要跟着参赛方法的主流形态走。AP 是为 top-down(检测器给置信度)设计的;当赛道主流变成 bottom-up 时,硬套 AP 会产生系统性偏置——而发现这一点的依据不是理论推演,是 14 支队伍提交结果的误差解剖。TMI 综述把这条反思写成了正式结论:metric 的 retroactive 评估(回顾性评估)应该成为挑战赛闭环的一部分。另一个细节同样值得抄:排名口径要显式——TMI Table III 明确标注"按 overall accuracy 重排、与原挑战赛 leaderboard 顺序不同",防止两套排名被混引(坑 5)。
§5 参赛方法与结果:八队画像与两条 baseline
5.1 总分表(TMI Table III,v2 accuracy 口径)
按 overall accuracy 排名(组织者 baseline 带 * 不参与排名;IoU>0.75 匹配):
| Rank | Method | 团队/机构 | H Prec | H Rec | H Acc | R Prec | R Rec | R Acc | Total Acc |
|---|---|---|---|---|---|---|---|---|---|
| 1 | IIPPR | SJTU(上海交大) | 0.814 | 0.913 | 0.755 | 0.824 | 0.943 | 0.785 | 0.770 |
| 2 | VIDAR | USTC(中科大) | 0.785 | 0.926 | 0.739 | 0.638 | 0.948 | 0.616 | 0.678 |
| — | U3D-BC* | 组织者 baseline | 0.706 | 0.916 | 0.663 | 0.663 | 0.913 | 0.623 | 0.643 |
| 3 | EMBL | EMBL Heidelberg | 0.740 | 0.879 | 0.672 | 0.637 | 0.906 | 0.597 | 0.635 |
| 4 | VGG | — | 0.658 | 0.911 | 0.619 | 0.697 | 0.905 | 0.649 | 0.634 |
| 5 | CEM-PDL | — | 0.734 | 0.794 | 0.617 | 0.721 | 0.860 | 0.645 | 0.631 |
| 6 | FCI | London | 0.741 | 0.754 | 0.596 | 0.669 | 0.771 | 0.558 | 0.577 |
| 7 | H2RNet | — | 0.636 | 0.698 | 0.499 | 0.709 | 0.811 | 0.608 | 0.554 |
| 8 | ABCS | — | 0.628 | 0.766 | 0.526 | 0.675 | 0.694 | 0.520 | 0.523 |
| — | U2D-BC* | 组织者 baseline | 0.435 | 0.925 | 0.420 | 0.354 | 0.911 | 0.342 | 0.381 |
三行速读:其一,人卷比鼠卷难——所有方法 H Acc 普遍低于 R Acc(H 侧最高 0.755 vs R 侧最高 0.785),与"人组织小线粒体多"的密度观察一致;其二,3D 上下文是硬门槛——U2D-BC(2D U-Net 管线)recall 不难看(0.925/0.911)但 accuracy 崩到 0.381,2D 逐切片分割在跨层连续性上完全败北;其三,冠军 IIPPR 是唯一在两卷上同时保持 precision/recall 均衡(0.8+ / 0.9+)的队伍。
表格还有两处更细的读法值得指出:VIDAR 的两卷不对称——它在 R 卷 recall 0.948 全场最高、H 卷 recall 0.926 也是前二,但 R 卷 precision 只有 0.638,FP 抑制不足让它丢了把总分推向 0.7+ 的空间;EMBL 与 baseline 的贴身——EMBL 0.635 vs U3D-BC 0.643,只差 0.008,说明"认真训练的 3D U-Net+分水岭"这条公共配方的天花板本身就不低,参赛队要赢 baseline 容易,要赢它 10 个百分点很难。
5.2 方法谱系:八队逐队速写
TMI Table I 对 8 支参赛方法给出了完整技术档案(架构/输入/损失/优化器/连通方法/前后处理)。先给共性画像,再逐队展开:
- 骨干:清一色 CNN U-Net 系(3D 残差 U-Net、5 级 3D U-Net 等),无队伍在正赛使用 transformer——2021 年的赛道时间点使然。
- 实例化路线:主流是 bottom-up 的"前景+边界 → 分水岭"(marker-controlled watershed、mutex watershed、multicut、连通组件、匈牙利算法各有采用);损失函数覆盖 CE/WBCE/MSE/WMSE。
- 前后处理是隐形战场:test-time augmentation、ensemble、Gaussian blending、size filtering(对齐 2,000 voxels 下限)等被 top 队大量使用。
- 代码可得性:VIDAR、IIPPR(复用 U3D-BC 代码)、U3D-BC、U2D-BC 四者开源(Table I Available code 列)。
代表性队伍逐队速写(依据 TMI §V 方法描述与 Table I 抓取内容):
- IIPPR(SJTU,总分 0.770,冠军):集成(ensemble)+ 混合推理(blending inference)+ 体积过滤(size filtering)三板斧;两卷 precision/recall 全场最均衡(H 0.814/0.913、R 0.824/0.943)。均衡不是运气——ensemble 与 blending 平抑单模型噪声,size filtering 消掉碎屑 FP,三个后处理都对准 v2 指标的计分方式。该队成员后转为 TMI 综述共同作者。
- VIDAR(USTC,总分 0.678,亚军):残差 U-Net 骨干 + 体积近邻上下文增强(沿 z 利用相邻体数据补充上下文)+ ensemble 与高斯混合推理;R 卷 recall 0.948 为全场最高。短板同样醒目:R 卷 precision 0.638——把暗染非线粒体结构切了进来。一个"召回冠军、精度短板"的画像,恰好是 v1 AP-75 时代不容易暴露、v2 accuracy 一下就现形的类型(§4.1)。代码开源。
- EMBL(Heidelberg,总分 0.635,季军):5 级 3D U-Net;欧洲团队代表。0.635 与组织者 baseline U3D-BC 的 0.643 几乎持平——既是 baseline 强的证据,也说明该队把公共配方执行得足够扎实。
- FCI(London,总分 0.577):四个独立 CNN 分别预测两卷的前景/边界;训练数据走 crowd-sourced(公民科学标注)路线,其后又在两卷间做序贯微调。这是 8 队里训练数据策略最特殊的一支——用人类标注的可扩展性换初始质量,再用目标域微调补齐。
- VGG(总分 0.634)、CEM-PDL(0.631)、H2RNet(0.554)、ABCS(0.523):四队共享 §5.2 开头的 bottom-up 共性画像,两卷间差距与全体一致(VGG 与 CEM-PDL 都在 0.63 区间)。四队的架构/损失/连通方法逐项档案见 TMI Table I 原表——本条目抓取的表格文本以分数列为主,技术细节列请以综述原文为准,此处在一级来源缺文本的情况下不作转述(宁缺毋错)。
5.3 baseline:U2D-BC 与 U3D-BC
组织者自建的两条 baseline 走的是"前景+contour 概率 → marker-controlled watershed"的标准流水线(TMI Fig.3):U2D-BC 逐切片 2D,U3D-BC 全 3D。两者 7 个百分点的总分差(0.643 vs 0.381)是"3D 实例分割≠2D 分割的堆叠"的最直观注脚。两条 baseline 开源于 PytorchConnectomics 框架(含 MitoEM 教程与训练配置),这也是为什么后续论文几乎都把 U3D-BC 当公共基线。注意本条目抓取时点(2026-09-29)框架文档的 mito 教程 URL 返回 404(文档改版中),GitHub 仓库与 aux 工具仍在(存照 C9)。
baseline 为什么这么强,值得单说一句:U3D-BC 的配方(双头输出+marker-controlled watershed)恰好就是参赛队主流管线的"素颜版"——没有 ensemble、没有 TTA、没有精心调参,但它把 3D 上下文与边界引导两个核心要素都做对了。这解释了两件事:参赛队相对 baseline 的领先幅度普遍不大(冠军也只领先 12.7 个百分点);以及为什么 U3D-BC 成为后续文献的公共参照——它代表的是"方法框架本身的贡献",而非工程加成。
5.4 误差解剖:top 方法还差在哪
TMI §V 的误差分析是这篇综述最有长期价值的部分,三个结论:
- MOAS 仍是无人区:Fig.5 用 3D 可视化对比 top-2 方法(IIPPR、VIDAR)在单条 MOAS 上的表现——细管连接处的断裂/粘连普遍存在;v2 指标把 MOAS 全归 large 组,正是为了让这个弱点持续可见(large 组分数长期是三组最低)。
- 误差类型结构:Fig.6/Fig.8 的 association 误差分布显示欠分割(under-segmentation)与 many-to-many 在缠绕区集中;FP 总量(background)在 R 卷对 VIDAR 类方法显著——低 precision 主要是把暗染非线粒体结构切了进来,与 v1 标注"相似细胞器误标"的噪声互为镜像(v2 修正后才得以区分"模型错"还是"标注错")。
- 规模≠解决:数据集大了三个数量级,但 small 类密集场景(人卷 5,106 条)与 large 类 MOAS 的错误率依旧高——TMI 的原话是 “substantial errors remain unsolved for mitochondria with challenging morphologies”。这是挑战持续开放的理由,也是后续 transformer/基础模型时代仍在用 MitoEM 当试金石的原因。
误差解剖的操作性读法:如果你想复现"误差地图"级别的分析,路径是"本地 val 推理 → 与 v2 标签做 association 六类归因 → 按缆长分组统计 → 按 (x,y,z) 聚类定位误差热点"。六类归因的实现有公开方法学(Ka et al. 分类法)可循;val 半卷足够跑出与 TMI Fig.6/Fig.8 同构的分布图——这是这个数据集对方法研究者最被低估的用法。
5.5 可复用的管线配方与工程共性
把 8 队 + 2 baseline 的技术档案压成一份"2021 年最优实践配方"(每一步都有 Table I/§V 依据):
MitoEM 2021 参赛配方骨架(bottom-up 主流路线):
1. 骨干:3D 残差 U-Net(或 5 级 3D U-Net)
2. 双头输出:前景/线粒体概率 + 边界/轮廓概率
3. 损失:CE 或 WBCE(前景)+ MSE/WMSE(边界),z 向 patch 非对称设计
4. 实例化:marker-controlled watershed(或 mutex watershed / multicut)
5. 推理:TTA + ensemble + Gaussian blending
6. 后处理:size filtering(≥2,000 voxels,对齐真值下限)
7. 提交:aux 工具转 H5(2× 下采样 + 连通组件 + LZF)
这份配方的历史意义在于它的可迁移性:第 1-6 步的组合后来被后续 EM 细胞器分割工作反复借用,第 4 步的实例化选择(分水岭 vs multicut vs 连通组件)则成为论文里最常消融的变量。对今天的研究者,这条配方是理解"前 transformer 时代 3D 实例分割"的最短路径——也是评估 transformer/基础模型增量贡献时应当对齐的 baseline 形态。
配方之外仍留有真实的消融自由度,按 Table I 归纳为四个变量:实例化方法(marker-controlled watershed / mutex watershed / multicut / 连通组件 / 匈牙利匹配——8 队各有采用)、损失组合(CE/WBCE 配 MSE/WMSE 的边界权重)、推理策略(TTA、ensemble、Gaussian blending 的开与合)、后处理强度(size filtering 阈值与形态学操作)。这四个变量的组合空间正是 2021 年那 14 份提交在 0.523-0.770 之间拉开差距的主要来源——架构层面的差异反而次要(骨干清一色 U-Net 系)。今天做消融实验时,这四个变量依然是 3D EM 实例分割最值得扫的组合维度。
§6 获取与许可:三层资产三条许可
6.1 下载地图:一切从 HuggingFace 走
MITOEM 的官方分发渠道是 HuggingFace 两个数据集仓库(组织者 pytc = PytorchConnectomics 团队维护):
| 仓库 | 文件 | 内容 | 实测大小* |
|---|---|---|---|
| pytc/EM30 | EM30-H-im-pad.zip | MitoEM-H 图像(padded 版) | 23.91 GB |
| pytc/EM30 | EM30-R-im.zip | MitoEM-R 图像(无 padding) | 13.96 GB |
| pytc/EM30 | EM30-M-im-pad.zip | EM30-M(小鼠)——属 AxonEM 轴突数据,非 MitoEM 挑战内容 | 15.21 GB |
| pytc/MitoEM | EM30-H-mito-train-val-v2.zip | MitoEM-H 线粒体 GT v2(train+val) | 55.9 MB |
| pytc/MitoEM | EM30-R-mito-train-val-v2.zip | MitoEM-R 线粒体 GT v2(train+val) | 66.6 MB |
| pytc/MitoEM | mitoem_R_train_4um_im.h5 / _seg.h5 | R 卷 4 µm 下采样迷你版(试手用) | 32.4 MB / 0.5 MB |
* 2026-09-29 经 HF API 实测(rfilename + size)。
下载前的磁盘与带宽预算(按用途裁剪,别全拉):
| 用途 | 必下文件 | 下载量 |
|---|---|---|
| 试手/教学 | mitoem_R_train_4um_im.h5 + _seg.h5 | ~33 MB |
| R 卷完整训练 | EM30-R-im.zip + EM30-R-mito-train-val-v2.zip | ~14.0 GB |
| H 卷完整训练 | EM30-H-im-pad.zip + EM30-H-mito-train-val-v2.zip | ~24.0 GB |
| 两卷全部 | 上两行合计 | ~38.0 GB |
| 误下警戒 | EM30-M-im-pad.zip(AxonEM,非 MitoEM) | 15.21 GB 白下 |
解压后磁盘占用大于 zip 体积(逐切片 PNG/图像的压缩率有限),按 1.5-2 倍预留;H 卷解压后是 1,040×5,120×5,120 的栈,转成内存数组单精度约 109 GB——训练时用逐切片/分块流式加载,不要一次性 np.load 全卷(附录 G 的骨架采用流式/裁块思路)。
四个检索者最容易踩的获取坑,一次说清:
- H 卷图像必须用 padded 版。GT 坐标是按原始 1,000×4,096×4,096 发布的;若你拿了 padded 图像(1,040×5,120×5,120)直接对 GT,坐标会错位 [20,512,512] 的偏移量。官方发布的就是 padded 版,所以正确姿势是"加载后裁边"而不是"找无 pad 版"(坑 7)。
- EM30-M 不是 MitoEM。pytc/EM30 仓库里的小鼠卷(EM30-M-im-pad.zip)属于 AxonEM(轴突分割)系列,与 MitoEM 挑战无关——同一团队、同一 EM30 采集系列、不同任务。按文件名搜 “EM30” 下载全部三个 zip 是常见误操作(存照 C10)。
- 测试半卷没有 GT zip 可下。train/val 的 v2 标签加起来才 ~120 MB,因为每卷只有前 500 张切片有标注;后 500 张切片的图像在图像 zip 里,真值只在组织者服务器上。
- 图像是"原始 EM 灰度",无预处理。归一化、裁剪、重采样全部自己来;官方 baseline 的预处理配置在 PytorchConnectomics 的 MitoEM 教程/配置文件里(教程 URL 2026-09-29 404,仓库仍在——坑 8)。
6.2 在线评测通道:赛后不过期
测试半卷的评测通道在 mitoem.grand-challenge.org(grand-challenge.org 平台),挑战赛结束三年多后持续开放提交与自动评测(TMI 摘要原话 “the challenge remains open for submission and automatic evaluation”)。提交格式为 H5 体积:官方 aux 工具链把逐切片 2D 预测堆叠 → 2× 下采样 → 连通组件自动打标 → LZF 压缩;也可用其他打标方法但需在提交备注声明。注册/登录后可反复提交,leaderboard 实时更新——当前在线数字全部是 v2 + accuracy 口径,v1 leaderboard 只存历史截图。
这条"永不下架的赛道"是 MITOEM 的差异化设计:多数 ISBI 挑战赛在会后关场,MitoEM 把自己变成了滚动基准——2023 年 STT-UNET 等 transformer 系方法正是通过这个通道补测并进入文献。
6.3 可视化与配套工具
- neuroglancer 在线浏览:官网挂有 precomputed 版(rhoana.rc.fas.harvard.edu),浏览器里直接翻切片、叠加 GT 轮廓,下载前先在线看数据长什么样;
- PytorchConnectomics(GitHub PytorchConnectomics/PytorchConnectomics):官方 baseline 框架,U2D-BC/U3D-BC 的训练配置、MitoEM 数据加载器、H5 提交工具全在里面;
- MitoEM-challenge 仓库(GitHub PytorchConnectomics/MitoEM-challenge):挑战赛 starter code、aux 工具、文件格式说明,LICENSE 为 MIT(2026-09-29 已核实全文,见 §6.4);
- HF 4 µm 下采样迷你版:mitoem_R_train_4um_im.h5(32.4 MB),适合先在笔记本上跑通全管线再上全量。
工具选型的快速对照:只想看数据 → neuroglancer;想训练 → PytorchConnectomics(配置文件即 baseline);只想提交 → MitoEM-challenge 的 aux 工具足够;想自建管线 → 三者都只当格式参考,重点读 §2.9 目录组织与坑 7 坐标对齐。
6.4 license:三层资产分开看
MITOEM 的许可要按资产分层,不能一句话概括:
| 资产 | 许可 | 依据 |
|---|---|---|
| 图像 + GT 数据(HF pytc/EM30、pytc/MitoEM) | MIT | HF 数据集卡片 license 字段(官方分发渠道) |
| MitoEM-challenge 仓库代码 | MIT | 仓库 LICENSE 文件全文核实(2026-09-29):标准 MIT 条款,“Copyright © 2020 donglai” |
| TMI 2023 综述论文 | CC BY 4.0 | IEEE hybrid OA;本文大量引用其原文即基于此 |
| MICCAI 2020 数据集论文 | Springer 版权(非 OA) | LNCS 12265 |
注意两点:其一,MIT 的两个口径已闭合一致——HF 卡片标注与仓库 LICENSE 文本(2026-09-29 直接抓取核实,存照 C8)均为 MIT;即便如此,若你的使用场景对许可敏感(再分发、商用),仍建议留存两处原文备查。其二,论文许可与数据许可无关——引用 TMI 的图表数字走 CC BY 4.0 注明出处即可,但 Springer 论文里的图不能直接转载。
6.5 引用义务
官方要求同时引用两篇论文:MICCAI 2020 数据集论文(Wei et al., LNCS 12265:66-76, doi:10.1007/978-3-030-59722-1_7)与(建议)TMI 2023 综述(Franco-Barranco et al., IEEE TMI 42(12):3956-3971, doi:10.1109/TMI.2023.3320497)。使用 v2 标注或在线评测分数时,TMI 综述是唯一完整记载口径的来源,建议一并引用。两条 BibTeX 条目见附录 I。
§7 生态与影响:从一个挑战赛到一个评测传统
7.1 学术影响画像
截至抓取时点(2026-09-29),数据集论文 Semantic Scholar 引用 130,TMI 综述 15。数据集论文的引用面覆盖:连接组学分割、细胞器形态分析、弱监督/半监督分割、transformer 分割(STT-UNET 等)、基础模型评测。MITOEM 成为 EM 细胞器实例分割事实上的标准基准之一——原因有三:规模(3,600×)、公开的持续评测(在线 leaderboard)、v2 修正后的标注质量与误差归因体系。
引用画像里有一个值得注意的结构:TMI 综述的引用增速快于数据集论文的后期增速——因为"如何评、误差在哪"比"数据在哪"更常被新论文引用。这印证了 §8 的判断:误差解剖与指标改革是这个数据集被引用的长期引擎。
给"引用 MitoEM 的新论文"画一张使用者画像,大致分四类:基准对比型(把 MitoEM-H/R 排进自己的评测表,最常见)、方法迁移型(用 MitoEM 验证新架构在 EM 实例分割上的泛化,如 transformer 系)、形态学应用型(用 v2 标签做线粒体定量,缆长/MOAS 统计)、协议研究型(研究挑战赛组织/指标设计的论文与综述)。四类引用各自要求的口径不同——前两类必须对齐 v2 accuracy 三要素,第三类要引 Kimimaro 缆长口径,第四类直接引 TMI 的 retroactive 评估结论(§4.4)。
7.2 外部数据集坐标系
把 MITOEM 放进 EM 分割数据集的坐标系里看:
| 数据集 | 模态/规模 | 与 MITOEM 的关系 |
|---|---|---|
| Lucchi(EPFL,2012) | 海马 sTEM,(5 µm)³,~35% 标注,二值掩码 | MITOEM 的直接前身与 1,986× 对照组;实例级评测不可行 |
| Kasthuri++(2015) | 小鼠体感皮层 sTEM,3-cylinder 体数据 | 有线粒体掩码;Casser 等统一协议改良版常作对照 |
| CREMI(2017) | 果蝇脑 FIB-SEM,突触/神经元分割 | 同时代 EM 大栈;任务相邻(神经元 vs 细胞器) |
| MITOEM(2020) | 人+大鼠皮层 EM,每卷 168 亿 voxels,实例 GT | 本条目 |
| AxonEM(2021) | 同一 EM30 系列的人/大鼠/小鼠轴突 GT | 姊妹数据集,HF 同仓库(EM30-M 即小鼠卷) |
| H01(Science 2024) | 人皮层 petavoxel(~1.4 PB),同 Harvard Lichtman 系 | 采集谱系的上游延伸:Lichtman 实验室从 MitoEM 尺度走向 petavoxel 全脑块 |
这条谱系的主线是"EM 数据规模 × 实例级真值"的同步进化:Lucchi 证明了问题、Kasthuri 给了材料、MITOEM 给了规模与评测协议、H01 给了体量极限。MITOEM 卡在中间承上启下的位置——足够大以暴露方法学短板,又足够小以让实验室级算力可复现。
7.3 后续使用例
- STT-UNET(MICCAI 2023,LNCS 978-3-031-43993-3_59):3D spatio-temporal transformer 在 Lucchi/MitoEM-R/MitoEM-H 上做线粒体分割,是"transformer 进 EM 分割"的代表性检验;
- PytorchConnectomics 生态:MitoEM 是框架的旗舰教程数据集,其数据加载器/H5 工具被后续连接组学项目复用;
- 评测协议沿用:"3D AP@0.75 + accuracy/cable-length 分组 + association 六类误差"的组合被后续细胞器分割论文(轴突、突触、细胞核 EM 分割)广泛借用;
- 第三方整理:HF MedOtter/MitoEM 提供了整理版卡片(含引用模板与体量分档标注 1B<n<10B voxels)。
7.4 值得注意的"负结果"传统
TMI 综述用了整节篇幅讲"还没解决的问题"(MOAS、small 密集场景、precision/recall 失衡),官网公开承认标注不完美并运营众包纠错——MITOEM 系列论文是"把失败模式写进正文的少数派"。对数据集工程而言,这种把误差解剖作为一等公民的写作传统,本身就是这个数据集最常被引用的软性贡献。
7.5 挑战赛的"第二生命":一场持续多年的公开赛
把 §3.5 与本节材料合起来看,MitoEM 挑战赛的生命周期分三段:正赛期(2020-11 至 2021-04,257 注册/14 队,产出冠军方法与 ISBI workshop 报告);修正期(2021-12 至 2022-07,v2 标注 + 指标改革 + 全体重评,产出 TMI 综述);公开赛期(2022-07 至今,持续接受提交,吸收 transformer 系新方法)。三段之间没有明确闭幕式——它是"赛事逐渐变成基础设施"的活样本。
对挑战赛主办方的启示是:赛后的两笔投入(v2 修正与指标改革)比正赛本身更能决定这个基准的学术寿命——正赛决定"谁赢了那一年",修正期决定"这个 benchmark 五年后还算不算数"。
§8 方法学启示:MITOEM 教给数据集工程的事
8.1 对数据集构建者
- 标注质量是版本化的资产,不是一次性交付。v1→v2 的三类系统性错误(误标细胞器/误合并/MOAS 不完整)没有藏起来,而是以 Fig.1 + 修正协议 + 实例数变化表的形式完整披露。数据集可以发布后再变好——前提是你敢公开错误分类学。
- 专家共识协议可复制:3 位独立专家逐条复核 → 共识会议 → 合并修订,全程只花了约一年(2020-11 v1 → 2021-12 v2 上传),且只动标注不动图像。这条协议的性价比高于"重新标注"。
- 公开纠错通道把用户变成质检员:“[MitoEM Error]” 邮箱机制成本极低,但把一次性下载关系变成了持续维护关系。
8.2 对评测设计者
- 指标必须匹配方法形态:AP 为 top-down 设计,bottom-up 主流下会产生系统性偏置——这个教训的价值不限于 EM;任何"我们的赛道主流方法没有 X 属性,而指标依赖 X"的场景都适用。
- 分组维度要对准难点:体积分组把 MOAS 错分进 medium,缆长分组把 MOAS 全归 large——换一个分组维度,"难例"才有了专属可见性。
- 误差归因与排名解耦:accuracy 负责排名,association 六类负责归因,两者分开呈现——排行榜数字不再承担它解释不了的信息。
- 排名口径要显式声明:TMI Table III 标注"按 overall accuracy 重排、与原 leaderboard 顺序不同"——两套排名并存时,混引是检索者的常态错误(坑 5)。
8.3 对"AI-Ready 数据集"的具体示范
用本库的评估框架回看 MITOEM 的 AI-ready 特征:
- 可发现性:官网 + HF 双入口,论文 DOI/PMID/PMCID 齐全,grand-challenge 平台自带结构化元数据;
- 可获取性:HF 直链下载(图像 23.91/13.96 GB,标签 ~120 MB),MIT 许可,无注册墙(在线评测才需注册);
- 可互操作:体素分辨率/物理尺寸明确到 nm 级;H5 提交格式有官方工具;neuroglancer precomputed 可在线核验;
- 元数据质量:分辨率/尺寸/划分/实例数/版本链全部有据可查——但采集元数据(供体、固定方案)缺失是明显短板;
- 可持续性:赛后评测通道持续开放 + v2 持续维护是加分项;但 4 µm 迷你版之外无镜像冗余、框架教程 URL 失效提示单点依赖(详见附录 B DAIMS 评估)。
8.4 对标注科学的启示
MitoEM v2 的教训可以压缩成一句话:真值的"正确性"取决于审查协议,而不是标注者的自信。v1 的三类错误不是粗心所致,而是"单批标注 + 无独立复核"流程的结构性产物——相似暗色细胞器在 EM 灰度里的歧义性,只有第二个独立读片人才能发现。这与库内 NuCLS(rid 248,多机构多放射科医生复核)、Lizard(rid 238,多专家核实例分割)的设计形成跨模态互证(§9)。
再补一条 EM 特有的经验:形态学驱动的质量抽检。MitoEM 的三类系统性错误都对应特定形态(暗染结构、紧贴对、串珠)——这意味着质检不必逐条盲审,可以按形态学特征分层抽样复核,用更少的专家工时覆盖最高风险的错误类别。这套"错误分类学→分层抽检"的思路对任何细粒度分割标注都适用。
8.5 一页带走:MitoEM 方法学检查单
把 §8 全部内容压缩成十个可勾选的问题,供数据集/挑战赛设计者自检:
- 测试集真值是否保留在组织方手里(不随数据包流出)?
- 赛后评测通道是否承诺持续开放(有明确运维方)?
- 标注协议里有没有独立复核环节(≥2 名独立标注者/复核者)?
- 已知标注错误是否有公开的错误分类学与修正版本链?
- 用户纠错是否有低成本通道(邮箱/GitHub issue + 定位坐标)?
- 指标是否匹配赛道主流方法形态(top-down vs bottom-up)?
- 实例分组维度是否对准领域公认难点(而非随手按大小组)?
- 排名与误差归因是否解耦呈现?
- 排名口径变化(重排/换指标)是否在所有结果表头显式声明?
- 数据、代码、论文三种资产的许可是否分层声明?
MitoEM 在 1/2/3/4/5/6/7/8/9/10 项上全部可勾——这正是它 DAIMS 综合评级 7.8/10 的"上"档底气(附录 B)。
§9 与库内条目的关系:MITOEM 放进千方病案医数集
以下 rid 均经 DB 实查(2026-09-29,ai_ready_dataset status=1)。先给总览表,再逐组展开读法。
9.1 家族图谱总览
| 互链组 | 条目(rid) | 相似轴 | 建议并读姿势 |
|---|---|---|---|
| 最强互链 | OCELOT(308) | EM + 细胞结构实例分割 + grand-challenge 模式 | 两个尺度极端:MitoEM 大体数据单细胞器,OCELOT 小 FOV 多细胞器+上下文 |
| 赛事模式 | SELMA3D(681) | 3D EM + 实例分割 + 挑战赛运营 | 3D EM 挑战赛设计的两个平行样本(连续切片 vs FIB-SEM) |
| 任务域相邻 | mitos-atypia-14(288)/ MIDOG(298)/ ROSE(331) | 线粒体生物学 ↔ 有丝分裂事件 | 同一生物学对象在不同成像范式下的任务形态对照 |
| 标注方法论 | NuCLS(248)/ Lizard(238)/ CoNSeP(228)/ PanNuke(218) | 实例分割标注协议与质量保障 | 四条标注路线 vs MitoEM 专家共识+众包纠错 |
| 尺度背景 | Human Connectome Project(95)/ 1000 Functional Connectomes(295) | 脑科学数据集全谱系 | 从 fMRI 宏观连接到 EM 纳米细胞器的尺度跨越 |
9.2 最强互链:OCELOT(rid 308)
库内与 MITOEM 模态+任务双重最近的条目:OCELOT 同为电子显微镜下的细胞结构实例分割挑战数据集(Lyngby 采集),同样采用"本地训练+在线评测"的 grand-challenge 模式。读法建议:MITOEM 看三维大规模、OCELOT 看二维跨尺度(细胞与组织两种 FOV 的标注翻转问题);两者共同构成"EM 实例分割挑战赛"的入门组合。差异轴也值得记:MitoEM 的难点在形态(MOAS、缠绕),OCELOT 的难点在上下文(同一结构在不同视野下的标注不一致)——一个逼算法处理几何复杂性,一个逼算法处理语境依赖性。
9.3 挑战赛组织模式对照:SELMA3D(rid 681)
3D FIB-SEM 血小板 EM 实例分割挑战——与 MITOEM 共享"3D EM 体数据 + 实例分割 + 持续开放评测"的全部要素,差异在成像方式(FIB-SEM vs 连续切片)与靶细胞器。适合研究"挑战赛数据集如何组织"的读者并读。对 §3.5 的三个运营设计选择(私有测试/持续开放/众包纠错),SELMA3D 是检验这些选择是否已成"社区范式"的第二个样本——若两场的组织协议呈现共性,即可视为 3D EM 挑战赛的成熟模板。
9.4 任务域相邻:有丝分裂三件套(rid 288 / 298 / 331)
MiToS/mitos-atypia-14(rid 288)、MIDOG(rid 298)、ROSE(rid 331)都是有丝分裂象检测/分类数据集(HE 染色或荧光显微,非 EM)。与 MITOEM 的连接是生物学而非成像:线粒体为细胞分裂供能,分裂活跃区的线粒体密度与形态变化是 MitoEM-H 中 small 实例密集的可能解释之一;TMI 亦引 MOAS 为疾病进展与突变累积中富集的表型。模态不同(2D 光学 vs 3D EM)、任务不同(检测 vs 实例分割),互读价值在"细胞事件×细胞器"的交叉视角——用三件套的数据理解"什么时候线粒体会变多/变形",用 MitoEM 理解"变多变形之后长什么样"。
9.5 标注方法论对照:NuCLS / Lizard / CoNSeP / PanNuke(rid 248 / 238 / 228 / 218)
- NuCLS(rid 248):多机构、多放射科医生、双盲+仲裁的核分割标注协议——与 MitoEM v2 的"3 专家共识"互为对照(病理 2D vs EM 3D);NuCLS 把标注者间一致性作为一等公民数据发布,MitoEM 则以错误分类学披露——两种透明化路径各有所长;
- Lizard(rid 238):多专家实例分割标注(含核实例质量分级)——与 MitoEM 的实例下限(≥2,000 voxels)设计相映:两者都在回答"什么样的实例值得进入真值";
- CoNSeP(rid 228):实例分割+语义分类双任务 GT——MitoEM 的 association 六类是它误差归因思路的 3D 化;
- PanNuke(rid 218):大规模泛癌核实例数据集——与 MitoEM 同属"一个数量级跃迁倒逼指标改革"的案例(PanNuke 之于核分割 ≈ MitoEM 之于线粒体)。
9.6 背景条目:功能连接组对照(rid 95 / 295)
Human Connectome Project(rid 95)与 1000 Functional Connectomes(rid 295)是 MRI 尺度的脑连接数据集。MITOEM 处于同一个"脑"问题域的另一个端点:HCP/FC 看宏观功能连接,MitoEM 看纳米尺度细胞器形态——"从 fMRI 到 EM"的尺度跨越正好展示脑科学数据集的全谱系。库外还有中间层(CREMI 果蝇脑、H01 petavoxel 人皮层,§7.2 谱系表),库内这两条目恰好补上宏观一端。
9.7 检索路径建议
- 检索词组合:“MitoEM”(官网/论文正名)+ “mitochondria instance segmentation”;数据文件检索用 “EM30”(HF 仓);不要用 “MitoEM challenge MICCAI 2023”(纪年错误,坑 1)、不要把 HeLa 当检索词(物种误记,坑 2)。
- 若目标是直接可用数据:HF
pytc/EM30+pytc/MitoEM(MIT 口径)→ 官网 neuroglancer 预览 → PytorchConnectomics starter code。 - 若目标是复现文献分数:本地只到 val 为止;test 分数以 TMI Table III 与在线 leaderboard 为准,引用时注明 v2 accuracy 口径(坑 4/坑 5)。
- 若目标是方法学研究:val 半卷 + association 归因可自建误差地图(§5.4 操作性读法);large 组与 small 组分开报告。
9.8 互链写法约定与建议锚点
本条目在正文与 FAQ 中引用库内条目时统一使用 条目名(rid NNN) 格式;各条目回链本条目时建议使用 MITOEM(MitoEM 挑战赛数据集)。建议的互链锚点:
| 对端条目 | 对端建议锚点 | 链回本条目锚点 |
|---|---|---|
| ocelot(308) | § 任务与标注 | 本条目 §2(数据构成)与 §9.2 |
| selma3d(681) | § 挑战赛组织 | 本条目 §3(时间线)与 §9.3 |
| mitos-atypia-14(288)/ midog(298)/ rose(331) | § 任务背景 | 本条目 §9.4 |
| nucls(248)/ lizard(238) | § 标注协议 | 本条目 §8.4 与 §9.5 |
| consep(228)/ pannuke(218) | § 误差与标注设计 | 本条目 §9.5 |
§10 避坑清单:八个已踩过的坑
坑 1:纪年三元组,别把挑战赛安给 MICCAI 2023。数据集论文 = MICCAI 2020(LNCS 12265:66-76);挑战赛 = ISBI 2021(2021-04-13 现场);综述 = IEEE TMI 2023。“MICCAI 2023 MitoEM challenge"不存在——MICCAI 2023 只是有第三方论文(STT-UNET 等)用 MitoEM 当基准。本库生产任务简报曾误记"MICCAI 2023 挑战赛”,已按官网与两篇论文纠正并存照。踩坑现场:检索 “MitoEM MICCAI” 会命中 2020 论文,检索 “MitoEM challenge” 会命中 2021 官网——两个词各自都对,拼在一起就错。
坑 2:两域是 Human + Rat(大鼠),与 HeLa 无关。MitoEM-H=成人脑皮层、MitoEM-R=成年大鼠脑皮层。"Human/HeLa"是把有丝分裂/细胞系域的物种记忆错误嫁接到了 MitoEM 上(HeLa 是人宫颈癌细胞系,不出现于本数据集任何一级来源)。检索与成稿均按 H/R 口径。踩坑现场:看到 “Human” 就联想到细胞系数据集的读者,请回到 §1 Q2 重读。
坑 3:物理尺寸三口径并存。官网 Task 节 “two 30x30x30 um datasets”;MICCAI 摘要 “(30µm)³”;TMI 精确 “32.8×32.8×30 µm”(4,096×8nm=32.768µm)。正文用精确值并注"官网约写 30 µm";引用摘要数字时别与精确值混排。踩坑现场:reviewer 问"到底是 30 还是 32.8"——答"面内取整 vs 精确值,两者同源"。
坑 4:版本链 v1/v2 与私有 test。v1(2020-11 发布、挑战赛用)→ v2(2021-12 上传,修正三类标注错误;2022-03-02 起在线评估唯一口径)。实例数两版差 5.5K/3.6K;引用分数先对版本。测试半卷(每卷 500-999 slices)GT 永不公开——任何"本地复现 test 分数"的宣称都不可信。踩坑现场:HF 上只有 v2 标签 zip;想下 v1 只能考古 2021 年前的存档,且 v1 leaderboard 仅存截图(存照 C12)。
坑 5:指标双轨不可直比。v1 AP-75(体积分组、体积近似置信度)vs v2 accuracy/F1(缆长 1µm/4µm 分组、2022-07 生效)。TMI Table III 按 overall accuracy 重排,与原始挑战赛 leaderboard 顺序不同——引排名先引口径。踩坑现场:同一支队伍在两套口径下名次可能互换;写 related work 时逐条核对表头。
坑 6:规模倍数两套口径。3,600×(MICCAI 摘要,vs previous benchmarks 泛指)与 1,986×(TMI,vs Lucchi,含公式)。两数都对、基准不同;写"约三个数量级"最稳,写倍数必须带基准。踩坑现场:审稿人拿 3,600× 与 1,986× 互斥质询——给出 §2.6 的两个公式基准即可。
坑 7:H 卷图像是 padded 版。EM30-H-im-pad.zip 在 zyx 每侧 +[20,512,512],加载即 1,040×5,120×5,120;标注坐标对齐原始 1,000×4,096×4,096——先裁 pad 再对齐(或对称 pad 标签)。R 卷无 padding。踩坑现场:训练正常、提交评测分数异常偏低,八成是 H 卷坐标没裁齐——评测侧以原始坐标系为准(附录 G 有裁边代码骨架)。
坑 8:EM30 仓库里的 EM30-M 不是 MitoEM。pytc/EM30 内 EM30-M-im-pad.zip(15.21GB)是小鼠轴突数据(AxonEM 系列,标注目标轴突非线粒体)。同仓不同任务,脚本里按文件名通配 EM30-* 拉数据会把 M 卷误拉进线粒体管线。踩坑现场:下载脚本省事写了 EM30-*.zip——15GB 白下还可能污染训练目录;白名单 EM30-H*|EM30-R*(附录 AA 第 12 条)。
坑点一行记忆卡(打印友好版,详细版见上):
| 坑 | 一行口诀 |
|---|---|
| 1 | 论文 2020 / 挑战 ISBI 2021 / 综述 2023,没有 “MICCAI 2023 挑战赛” |
| 2 | H=Human 人皮层、R=Rat 大鼠皮层,HeLa 无关 |
| 3 | 30 µm 是约数、32.8×32.8×30 µm 是精确值,引用注明口径 |
| 4 | v1→v2 实例数 -5.5K/-3.6K;2022-03-02 起在线评测仅 v2;test GT 永不公开 |
| 5 | AP-75 与 accuracy 不可直比;TMI Table III 是重排序 |
| 6 | 3,600× 泛指旧基准、1,986× 专指 Lucchi,写倍数必带基准 |
| 7 | H 卷 pad +[20,512,512],先裁再对齐;R 卷无 pad |
| 8 | EM30-M 是 AxonEM 轴突,白名单 EM30-H*/EM30-R* |
§11 总结
11.1 三句话总结
MITOEM 用两个约 4 万实例(v1)、168 亿体素/卷的 EM 栈把 3D 线粒体实例分割从玩具基准拉进工业尺度;它以 ISBI 2021 挑战赛开局(257 注册/14 队/中国队伍包揽前二),以持续开放的在线评测与 v2 标注/指标迭代收官成"活基准";它的真正遗产不只是数据,还有"半卷私有+在线评测+误差地图"这套可复制的基准运营范式。
11.2 适合谁
- 做 3D 实例分割算法(分水岭系、transformer 系、基础模型系)需要大体量真值与公开 leaderboard 的研究者;
- 连接组学/细胞生物学需要线粒体形态定量(数量、体积、缆长、MOAS 检出)的团队;
- 设计医学影像挑战赛、想借鉴"指标迭代+误差解剖"运营模式的主办方;
- 教学场景:U2D-BC vs U3D-BC 的 38 分差距是讲"3D 上下文价值"的现成教材。
11.3 不适合谁
- 只想要现成 test 分数复现、无法走在线评测的工作流(test GT 永不公开);
- 需要采集级元数据(供体人口学、固定染色方案、脑区细分)做数据治理审查的项目(一级来源未披露);
- 显存/存储严重受限的快速实验(单卷图像 zip 近 24GB;可先用 4µm 下采样 h5 或 OCELOT 等小块数据)。
11.4 30 秒决策卡
你的需求?
├── 训练/评测 3D 细胞器实例分割
│ └── 是 → HF pytc/EM30 + pytc/MitoEM(MIT)→ U3D-BC 起步 → val 本地评 + test 在线评
├── 线粒体形态学定量(生物问题)
│ └── 是 → 用 v2 标签 + Kimimaro 缆长分析;MOAS 按 large 组口径报告
├── 挑战赛/基准设计研究
│ └── 是 → 读 TMI 综述 §II/§IV/§V(指标改革+误差地图)+ 官网 Important Dates
├── 只要 2D 有丝分裂/细胞检测
│ └── 否 → 本数据集不适用;转 mitos-atypia-14(288)/MIDOG(298)/ROSE(331)
└── EM 多细胞器/细胞上下文分割
└── 是 → 配合 OCELOT(308) 同读;两数据集覆盖两个尺度极端
11.5 给三类读者的最后叮嘱
- 算法研究者:引用分数请带"三要素"(版本/指标/集合,附录 AA 第 1 条);把 large 组与 association 归因写进消融表,你的论文会少一轮 reviewer 质询。
- 数据工程师:管线三件套先落地——H 卷裁 pad、EM30-M 白名单隔离、2,000 voxels 过滤;这三件事出错不会报错,只会让分数静默变差。
- 生物医学读者:MitoEM-H/R 各只有一例供体,形态学观察写"本数据集内";要下物种级结论,需要的是新供体,不是新算法。
11.6 条目反馈与维护
本条目抓取时点为 2026-09-29;一级来源(官网、两篇论文、HF 仓库、在线 leaderboard)的任何更新——标注再修正、指标再变更、链接失效——效力优先于本条目正文。发现数字/口径与一级来源不一致,或一级来源出现新版本,欢迎通过千方病案医数集条目页的反馈通道提出。与 MitoEM 官方的 “[MitoEM Error]” 机制同理:读者反馈是条目保持准确的唯一长期方式。
FAQ(高频问答 49 问)
A. 基础认知
Q1:MitoEM 是什么的缩写?
Mito(mitochondria 线粒体)+ EM(electron microscopy 电子显微镜)。数据文件前缀 EM30 指 30nm z 向步长的 EM 采集系列。
Q2:它是什么时候、在哪发布的?
数据集论文 2020 年 10 月发表于 MICCAI 2020(LNCS 12265:66-76);挑战赛随 IEEE ISBI 2021 举办(2021-04-13 现场日);挑战综述 2023 年 12 月发表于 IEEE TMI 42(12):3956-3971。
Q3:谁做的?
哈佛 SEAS/MCB + 西班牙 DIPC/Ikerbasque 的 9 人组织委员会(Wei、Lin、Jang、Pfister、Wang、Yin、Lichtman、Franco-Barranco、Arganda-Carreras);综述扩至 27 位作者(含参赛队 USTC/SJTU/EMBL 等)。
Q4:这个数据集解决什么此前解决不了的问题?
大规模 3D 线粒体实例分割——此前公开基准只有数百个实例、(5µm)³ 级体数据、且多为二值掩码;MitoEM 提供 4 万实例级真值与 (30µm)³ 级体数据,并首次让"MOAS/缠绕"等复杂形态有了系统基准。
Q5:挑战赛现在还能参加吗?
能。官网明确 “We keep the online evaluation open for new submissions”,在线提交与自动评测持续开放;只有 ISBI 2021 竞赛期的排名是"历史成绩"。
B. 数据与获取
Q6:数据分几部分?
每卷三部分:train(0-399 slices,GT 公开)、val(400-499,GT 公开)、test(500-999,GT 私有);图像 1,000 slices 全公开。
Q7:在哪里下载?
HuggingFace:图像 pytc/EM30(EM30-H-im-pad.zip 23.91GB / EM30-R-im.zip 13.96GB),标签 pytc/MitoEM(v2 两卷 55.9MB/66.6MB);另有 R 卷 4µm 下采样 h5 快速上手。
Q8:为什么 H 卷图像有 padding,怎么处理?
官方 pad 了 zyx 每侧 [20,512,512](为滑窗推理留上下文);与标注对齐前先裁回 1,000×4,096×4,096 原始坐标。
Q9:标签格式是什么?
逐切片 2D 实例掩码(PNG 序列),train/val 子目录组织;实例 ID 从 1 起、0 为背景;提交用 H5(官方 aux 工具:下采样 2×+连通组件+LZF)。
Q10:license 是什么,能商用吗?
HF 官方数据集卡片标 license: mit(MIT),GitHub MitoEM-challenge 仓库 LICENSE 文本(2026-09-29 核实)同为 MIT(Copyright © 2020 donglai),两口径闭合一致,条款宽松;但论文引用义务(两篇都引)是学术规范。商用前自行留存两处 MIT 原文备查即可,无额外限制条款。
Q11:图像是什么显微镜拍的?
一级来源统一表述为 electron microscopy(EM)三维图像栈(连续切片采集,z 步长 30nm);未逐字指明 TEM/FIB-SEM 细分,引用时写"EM"最稳。
Q12:人和大鼠的具体脑区是什么?
一级来源只写"成人/成年大鼠脑皮层(cortex)";二级来源称 MitoEM-R 为 V1,正文不建议采信。
Q13:数据多大?
两卷图像合计约 38GB(23.91+13.96GB,zip 压缩后)、标签约 123MB、体素规模每卷约 168 亿。
Q14:下载后第一件事做什么?
三件事按序:裁 H 卷 pad(若用 H 卷)→ 用 R 卷 4µm 迷你 h5 跑通全管线 → 再上全分辨率。跳过前两步直接训练是最常见的工程返工源。
Q15:v1 标签现在还能下载到吗?
HF 官方渠道只挂 v2 zip;v1 已被官方口径替代(2022-03-02 起在线评测仅 v2),v1 leaderboard 仅存历史截图(存照 C12)。除非做标注版本对比研究,没有理由再找 v1。
C. 标注与版本
Q16:v1 和 v2 差在哪?
v2 由三位专家共识修正了三类系统性错误(相似细胞器误标/相邻误合并/MOAS 不完整),实例数 H 24.5K→19K、R 14.4K→10.8K;v1 leaderboard 仅存档,2022-03-02 起在线评测只用 v2。
Q17:实例的最小尺寸是多少?
≥2,000 voxels——更小的碎屑不入真值;相应地,推理后做体积过滤是标配后处理。
Q18:MOAS 是什么,为什么总被点名?
mitochondria-on-a-string:多条线粒体由细微管串成串珠。分割算法在细连接处极易断裂或误并;v2 指标把 MOAS 全归 large 组让这个难点持续可见;TMI 的误差解剖显示 top 方法在 MOAS 上仍大量出错。
Q19:标注能保证全对吗?
官方原文 “The annotation is not perfect.”——纠错走公开邮箱([MitoEM Error] 主题 + (x,y,z) 坐标)众包机制;引用真值时保留这个限定语。
Q20:v2 的专家复核协议具体怎么走的?
三位具备 EM 阅片与线粒体形态学功底的神经科学专家,各自独立复核全部标注,分歧以共识会议收敛后合并修订——只动标注不动图像,全程约一年(2020-11→2021-12)。协议细节见 §2.4。
D. 评测与结果
Q21:评测指标怎么算?
v2:预测实例与真值 IoU>0.75 记 TP,accuracy(=instance F1 口径)为总排名依据;按缆长 1µm/4µm 分 small/medium/large 三组分别报告;配 association 六类误差归因。v1:AP-75(已弃用于平台排名)。
Q22:为什么从 AP-75 换成 accuracy?
参赛主流是 bottom-up 方法(无实例置信度),v1 用体积近似置信度导致 AP 对 FP 宽容、对 MOAS 误罚;v2 换匹配型指标后无需置信度,且缆长分组修正了体积分组对 MOAS 的错配。
Q23:谁赢了?
按 v2 accuracy:IIPPR(上海交大)0.770、VIDAR(中科大)0.678、EMBL(Heidelberg)0.635;官方 baseline U3D-BC 0.643、U2D-BC 0.381(不参赛)。
Q24:人卷和大鼠卷哪个难?
人卷普遍更难(各队 H Acc 低于 R Acc)——人组织小线粒体更密、大线粒体更细;但 TMI 声明两卷差异不可外推为物种结论(各只有一例供体)。
Q25:本地能算出 test 分数吗?
不能——test GT 私有。本地只有 val(每卷 100 slices);文献里的 test 数字来自在线评测或组织者通道。
Q26:引用分数时最该注意什么?
版本+口径+集合三要素:v1 还是 v2、AP-75 还是 accuracy、val 还是 test。三者缺一即无效引用。
E. 关联与检索
Q27:MitoEM 与 AxonEM 什么关系?
同一 EM30 采集系列与同一 HF 仓库(pytc/EM30)里的姊妹数据:EM30-H/R 是 MitoEM(线粒体),EM30-M 是 AxonEM(小鼠轴突)。同仓不同任务,别混拉。
Q28:和 Lucchi/Kasthuri 什么关系?
继承与取代:Lucchi(EPFL 海马,二值分割、(5µm)³、35% 标注)是前基准,MitoEM 体量是其 1,986×(体素口径)并升级为实例分割;Kasthuri 系列是另一支小规模前基准。三者常被新论文并列为对照。
Q29:和 H01 什么关系?
同为哈佛 Lichtman 系的人脑 EM 产出:H01(Science 2024)是 petavoxel 级人皮层重建,体量与目标不同,但 MitoEM-H 的采集与 H01 的生态同源,适合组合阅读。
Q30:本库内有哪些相关条目?
OCELOT(rid 308,EM 细胞器实例分割)、SELMA3D(rid 681,3D FIB-SEM 挑战)、mitos-atypia-14(rid 288)/MIDOG(rid 298)/ROSE(rid 331,有丝分裂域)、NuCLS(rid 248)/Lizard(rid 238)/CoNSeP(rid 228)/PanNuke(rid 218,实例标注方法论)。
Q31:检索 MitoEM 相关文献,用什么词最稳?
组合拳:“MitoEM” + “instance segmentation” 找方法论文;“EM30” 找数据文件;引挑战赛写 “ISBI 2021 MitoEM challenge”;避坑词见 §9.7(不要 “MICCAI 2023 challenge”、不要 HeLa)。
Q32:除了 MitoEM,还有什么库外资源可以接着读?
TMI 综述(误差解剖与指标改革的一手文献)、PytorchConnectomics 仓库(baseline 实现)、STT-UNET(MICCAI 2023,transformer 路线检验)、Lucchi/Kasthuri/CREMI/H01(§7.2 谱系表里的库外节点)。
F. 复现与工程
Q33:最快的复现路径?
PytorchConnectomics 框架:U3D-BC 配置(前景+contour 双头+分水岭)→ R 卷 4µm h5 先跑通 → 全分辨率训练 → val 本地评。注意 2026-09 框架文档 mito 教程 URL 暂时 404,教程在 GitHub 仓库与历史文档仍可查。
Q34:训练有什么工程坑?
各向异性分辨率(8×8×30nm)勿各向同性重采样(会断 MOAS 微管);实例 ID 用连通组件生成时注意 2D 连通 vs 3D 连通的选择要声明;size filtering 对齐 2,000 voxels 下限;H 卷先裁 pad。
Q35:本地怎么算 val 分数?
用 v2 标签的 val 半卷(每卷 100 slices):按 IoU>0.75 匹配算 accuracy/F1,并按缆长分组与 association 六类归因——口径与平台 v2 一致(§4.2 伪代码)。报告时明确写 “val (v2, accuracy)”,与在线 test 分数分开呈现。
Q36:想提交在线评测,格式怎么准备?
预测逐切片整理 → 官方 aux/convert_images_into_h5.py 转 H5(下采样 2×、连通组件打标、LZF 压缩)→ grand-challenge 平台提交;用其他打标方法需在提交备注声明。
G. 常见误解与快速澄清
Q37:「MitoEM 是 HeLa 数据集」——对吗?
不对。两域是 Human(成人脑皮层)+ Rat(成年大鼠脑皮层),一级来源任何位置都没有 HeLa(人宫颈癌细胞系)。此误记来自有丝分裂/细胞系数据集域的记忆串扰(坑 2)。
Q38:「MitoEM 是二值分割数据集」——对吗?
不对,那是它的前身 Lucchi。MitoEM 的真值是逐切片实例掩码:每条线粒体一个 ID——这正是它评测协议(AP/accuracy/association)成立的前提。
Q39:「MitoEM 挑战赛属于 MICCAI 2023」——对吗?
不对。挑战赛属于 ISBI 2021(2021-04-13 现场);MICCAI 2023 上只有第三方论文(如 STT-UNET)把 MitoEM 当基准用(坑 1)。
Q40:「测试集标签可以申请拿到」——对吗?
一级来源没有任何"申请-发放"机制:测试半卷 GT 私有,唯一通道是在线评测。文献里若出现"本地 test 分数",要么是作者与组织者的私下通道,要么口径有问题——引用前先核对。
Q41:「pytc/EM30 里的三个图像 zip 都是 MitoEM」——对吗?
不对。EM30-H/EM30-R 是 MitoEM;EM30-M(小鼠,15.21GB)是 AxonEM 轴突数据。同仓不同任务(坑 8、存照 C10)。
Q42:「MitoEM 分辨率是 8nm 各向同性」——对吗?
不对。完整口径是 8×8×30 nm(x,y,z)——面内 8 nm、z 向 30 nm,各向异性近 4 倍。只写 “8nm” 会被误读(§2.7)。
H. 数据治理与伦理
Q43:数据涉及人体组织,有供体知情同意信息可查吗?
一级来源(两篇论文与官网)均未披露供体人口学、知情同意与伦理审批细节——这是本数据集元数据披露的主要短板(附录 AA 第 11 条)。做治理审查或发表涉及伦理声明的论文时,需直接联系组织者获取该层信息,不能从公开材料推断。
Q44:用 MitoEM 做物种间线粒体形态比较,结论能外推吗?
不能。H/R 各只有一例供体,TMI 原文声明两卷差异"不可外推泛化"。可写的是"本数据集内观察到的形态差异"(§2.1、§11.5);物种级结论需要跨多供体的新采样。
Q45:再分发 MitoEM 衍生数据要注意什么?
许可为 MIT(HF 卡片与仓库 LICENSE 双处核实一致,存照 C8),再分发在 MIT 条款内允许;但应附许可与出处声明、保留双论文引用义务(§6.5),并注明衍生数据的处理链(如重采样、子集划分)——衍生版本混入口径是检索者最常误引的形态。
Q46:MitoEM 适合做数据治理/元数据标准的教学案例吗?
适合,且是正反兼备的案例:正面——版本链、错误分类学、纠错通道、口径声明一应俱全(§3.5、§8);反面——采集元数据(供体、固定方案、脑区细分)缺失。两者都写进教案才是完整的治理样本。
Q47:MitoEM 数据能用来训练通用 EM 基础模型吗?
规模与许可允许(MIT、168 亿体素/卷),引用面里也确有基础模型评测类工作把 MitoEM 当试金石;但注意它只有两例供体、单一细胞器标注——做预训练语料远不够多样,做评测集(尤其 large/small 分组与 association 归因)才是它的强项。
Q48:本条目对 AI Agent / RAG 检索友好在哪?
条目按 AI-Ready Wikipedia 规范组织:frontmatter 含 schema.org 结构化元数据(Dataset/RecordSet/dataLimitations),正文硬数字集中在 INFOBOX、§1 十问、附录 F 事实清单三处可锚定区段,口径歧义全部显式存照(坑 1-8、附录 C)——检索命中任何一段都能回溯到一级来源与版本口径。
Q49:想引用本条目本身,怎么引?
建议格式:千方病案医数集《MITOEM (mitoem) — AI-Ready Wikipedia》,qianfanghub.com/ai-ready-dataset/mitoem/724,抓取日期 2026-09-29。条目内容以上述一级来源为最终依据;两者不一致时,以 MICCAI 2020 论文、IEEE TMI 2023 综述与官网为准并欢迎反馈。
附录 A:缩写表
| 缩写 | 全称 |
|---|---|
| EM | Electron Microscopy(电子显微镜) |
| GT | Ground Truth(真值标注) |
| MOAS | Mitochondria-On-A-String(串珠状线粒体) |
| AP | Average Precision(平均精度) |
| AP-75 | IoU 阈值 0.75 的 AP |
| IoU | Intersection over Union(交并比) |
| TP/FP/FN | True/False Positive、False Negative |
| Prec./Rec./Acc. | Precision / Recall / Accuracy |
| F1 | Precision 与 Recall 的调和平均(= v2 accuracy 口径) |
| U2D-BC / U3D-BC | 2D/3D U-Net Boundary+Cell-aware baseline(组织者基线) |
| TTA | Test-Time Augmentation(测试时增强) |
| CE / WBCE | (Weighted) Binary Cross-Entropy,(加权)二值交叉熵损失 |
| MSE / WMSE | (Weighted) Mean Squared Error,(加权)均方误差损失 |
| LZF | LZF 压缩算法(H5 文件的轻量压缩选项) |
| H5 | HDF5 层级数据格式(提交与迷你版分发格式) |
| PNG | Portable Network Graphics(逐切片标签图像格式) |
| EM30 | MitoEM 的 EM 采集系列编号(30nm z 步长),文件名前缀 |
| AxonEM | 轴突分割 EM 数据集系列(EM30-M 属之) |
| sTEM | serial Transmission Electron Microscopy(连续切片透射电镜) |
| FIB-SEM | Focused Ion Beam SEM(聚焦离子束扫描电镜) |
| ISBI | IEEE International Symposium on Biomedical Imaging |
| MICCAI | Medical Image Computing and Computer Assisted Intervention |
| TMI | IEEE Transactions on Medical Imaging |
| DIPC | Donostia International Physics Center |
| SJTU / USTC | Shanghai Jiao Tong University / University of Science and Technology of China |
| EMBL | European Molecular Biology Laboratory |
| HF | HuggingFace |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | 官网+两篇论文+HF 官方仓三向可索引;但 “MitoEM/EM30/v1/v2” 多名并存易检索偏航(坑 1/坑 8) |
| A 可获取性 | 9 | HF 官方直链、无注册墙、MIT 口径(HF 卡片与仓库 LICENSE 双核实一致,存照 C8)、图像标签分仓合理;唯一扣分:测试半卷 GT 永不公开 |
| I 可互操作 | 7 | 逐切片 PNG+H5+neuroglancer precomputed+官方转换工具齐备;但无 DICOM/NIfTI 等医学标准格式官方转换,各向异性重采样需自行处理 |
| M 元数据质量 | 7 | 规模/划分/指标文档完备(官网+两论文三层交叉);采集元数据(供体/脑区/固定方案)披露薄;v1/v2 双版本需使用者自行锚定 |
| S 可持续性 | 8 | grand-challenge 平台+HF 双基础设施稳定,官网自 2020-11 持续运维至 2026+,在线评测活体运行;v2 修正与指标迭代证明有维护预算;学术团队长期运维存在人员流动风险 |
| 综合评级 | 7.8/10(上) | 可获取性与运维持续性为本库前列;元数据披露薄与版本双轨是主要扣分点 |
扣分点逐条对应本条目的修复提示:多名并存 → §0 三个关键词与 §9.7 检索路径;GT 不公开 → §6.2 在线评测通道与 Q40 澄清;标准格式缺失 → 附录 G 代码骨架自建加载;采集元数据薄 → §2.1 末段与附录 AA 第 11 条;版本双轨 → §4.3 对照速查表与坑 4。
附录 C:逐项证据链自证
| 关键数字/结论 | 来源 | 位置/方式 |
|---|---|---|
| 两卷 1,000×4,096×4,096 voxels、8×8×30 nm、32.8×32.8×30 µm | TMI 2023 §II-A | 论文全文(IEEE OA PDF 实抓,pdftotext 提取) |
| 官网 “two 30x30x30 um datasets, 1000x4096x4096 in voxels at 30x8x8 nm” | 官网 Task 节 | mitoem.grand-challenge.org(WebFetch 实抓 2026-09-29) |
| train 0-399 / val 400-499 / test 500-999 私有 | 官网 Dataset 节 + TMI §II-A | 双源一致 |
| 实例 ≥2,000 voxels | 官网 Dataset 节 | 原句 “at least 2,000 voxels” |
| v1 H 24.5K→v2 19K;R 14.4K→10.8K | TMI §II-A Improved Annotation | 论文全文 |
| 缆长分组 5,106/3,608/164(H)、1,292/3,832/524(R) | TMI §II-B | 论文全文(子集未注明,存照 C5) |
| 3,600× vs 1,986× | MICCAI 2020 摘要 / TMI §II-A 脚注公式 | Semantic Scholar API + 论文全文 |
| 257 注册 / 14 队 / 6 队 workshop / 8 top 方法 | TMI 摘要 + §II-C | 双源一致 |
| Table III 排名与全部 Prec/Rec/Acc 分数 | TMI Table III | pdftotext -layout 表格提取 |
| IIPPR=SJTU、VIDAR=USTC、EMBL=Heidelberg | TMI §V 方法描述 | 论文全文 |
| 时间线(2020-11-01 至 2021-04-13 逐日) | 官网 Important Dates | WebFetch 实抓 |
| v2 2021-12 上传;2022-03-02 起在线评估用 v2 | 官网 Important Note + TMI §II-A | 双源一致 |
| 新指标 2022-07 生效 | TMI §II-B | 论文全文 |
| 数据 license: mit(HF 卡片) | HF pytc/MitoEM 卡片 | hf-mirror API 实抓 2026-09-29 |
| 代码仓库 LICENSE = MIT, “Copyright © 2020 donglai” | PytorchConnectomics/MitoEM-challenge 仓库 LICENSE 全文 | raw.githubusercontent 实抓 2026-09-29(存照 C8,与 HF 卡片口径闭合一致) |
| 框架文档 mito 教程 URL 404(正文不引用该 URL) | connectomics.readthedocs.io /en/latest/tutorials/mito.html | WebFetch 复核 2026-09-29 返回 “404 Documentation page not found”(存照 C9) |
| 图像/标签文件名与大小(23.91GB/13.96GB/55.9MB/66.6MB 等) | HF API ?blobs=true | hf-mirror 实测 2026-09-29 |
| 组织者 9 人名单与机构 | 官网 Organizing Committee | WebFetch 实抓 |
| 论文书目(LNCS 12265:66-76;TMI 42(12):3956-3971;双 DOI) | Semantic Scholar API + Europe PMC + PubMed | 三源一致(PMID 33283212 / 37768797) |
| TMI 论文 CC BY 4.0 | IEEE openAccessPdf 档案 | Semantic Scholar API |
| 资助(NIH/CRUK/Wellcome 编号) | PubMed Grants 档案 | PubMed 页面实抓 |
附录 D:数据获取决策树
需求是什么?
├── 快速上手/教学
│ └── pytc/MitoEM 的 mitoem_R_train_4um_im.h5 + seg.h5(32.4MB,4µm 下采样)
├── 正经训练 3D 实例分割
│ ├── 1) pytc/EM30 下载 EM30-R-im.zip(13.96GB,无 pad)先行
│ ├── 2) pytc/MitoEM 下载 EM30-R-mito-train-val-v2.zip(66.6MB)
│ ├── 3) PytorchConnectomics U3D-BC 配置起步
│ └── 4) H 卷再下载 EM30-H-im-pad.zip(23.91GB,先裁 pad 再对齐)
├── 只要浏览器看看数据长什么样
│ └── 官网 neuroglancer 链接(MitoEM-H / MitoEM-R 在线 3D 浏览)
├── 要 test 分数
│ └── grand-challenge 在线提交(H5,LZF);本地无 test GT
└── 找的不是 MitoEM
├── 找 EM 多细胞器/细胞 → OCELOT(rid 308)
├── 找 FIB-SEM 3D 挑战 → SELMA3D(rid 681)
├── 找有丝分裂 → mitos-atypia-14(288) / MIDOG(298) / ROSE(331)
└── 找小鼠轴突 EM30-M → AxonEM(本库暂无独立条目)
附录 E:术语表
| 术语 | 释义 |
|---|---|
| 实例分割(instance segmentation) | 逐对象(此处逐条线粒体)给 ID 的分割,区别于二值/语义分割 |
| MOAS(串珠状线粒体) | 多条线粒体由细微管串联成串珠的形态;MitoEM 首要难点 |
| 缆长(cable length) | 实例骨架总长(含分支),Kimimaro 骨架化后按体素分辨率度量;v2 分组维度 |
| 缆长分组 | v2 按 <1 µm / 1-4 µm / >4 µm 把实例分 small/medium/large |
| 体积分组 | v1 按实例体积分三组;会把细长 MOAS 错分进 medium |
| AP-75 | IoU 0.75 阈值下的 3D 平均精度;v1 排名指标(体积近似置信度排序) |
| accuracy(v2) | IoU>0.75 匹配下的 TP/(TP+FP+FN),等价 instance F1;v2 排名指标 |
| association metrics | 把预测-真值对应关系归因为六类误差的方法(Ka et al. 分类法) |
| one-to-one / over-seg / under-seg / many-to-many / missing / background | 六类误差:一一对应 / 过分割 / 欠分割 / 多对多 / 漏检 / 背景 FP |
| bottom-up 管线 | 先预测前景+边界等中间量、再切实例的路线(无实例置信度) |
| top-down 管线 | 检测器直接输出实例+置信度的路线(AP 类指标的前提) |
| marker-controlled watershed | 以前景内局部极值为标记的分水岭;baseline 与多数参赛队的实例化方法 |
| mutex watershed / multicut | 两种基于边约束的全局实例化方法,参赛队各有采用 |
| 连通组件(connected components) | 按邻接定义把预测掩码拆成实例的轻量方法;2D/3D 邻接需显式声明 |
| TTA(test-time augmentation) | 测试时对输入做多组增广再融合预测 |
| ensemble | 多模型/多 checkpoint 预测融合;top 队标配 |
| Gaussian blending | 推理滑窗拼接时按高斯权重混合,减少接缝伪影 |
| size filtering | 按体积过滤小预测(对齐 ≥2,000 voxels 真值下限),消碎屑 FP |
| 各向异性分辨率 | 三轴分辨率不等(此处 8×8×30 nm);影响 patch 设计与重采样决策 |
| padded 版 | H 卷图像两侧各补 [20,512,512] 的发布形态,加载后需裁边对齐 |
| H5 / LZF | 提交格式 HDF5 及其轻量压缩选项(官方 aux 工具链使用) |
| 下采样 2×(提交侧) | aux 工具提交前把数据降采样以省带宽,评测侧约定内处理 |
| neuroglancer | 浏览器端三维体数据查看器;官网挂 precomputed 版在线浏览 |
| precomputed | 预切分好的多分辨率网络数据格式,供 neuroglancer 流式加载 |
| grand-challenge | 医学影像挑战赛托管平台;MitoEM 在线评测所在 |
| leaderboard | 在线排行榜;当前口径 v2 + accuracy,v1 仅存档截图 |
| 私有测试半卷 | 每卷 z=500-999 的图像公开、GT 私有设计 |
| train/val 半卷 | 每卷 z=0-499:train 0-399、val 400-499,GT(v2)公开 |
| EM30 系列 | 同一团队 30nm z 步长 EM 采集系列;H/R 为 MitoEM、M 为 AxonEM |
| 众包纠错 | “[MitoEM Error]” 邮件机制:用户提交 (x,y,z) 坐标参与标注维护 |
| 专家共识修正(v2) | 3 位专家独立复核+共识会议收敛的标注修订协议 |
附录 F:事实清单(硬数字逐条带来源)
以下为本条目全部关键硬数字的集中清单(引用时以一级来源为准):
身份与纪年
- 挑战赛名:MitoEM Challenge;官网 mitoem.grand-challenge.org(官网标题实抓)。
- 数据集论文:MICCAI 2020,LNCS 12265:66-76,doi:10.1007/978-3-030-59722-1_7,PMID 33283212,PMCID PMC7713709(Semantic Scholar + Europe PMC + PubMed 三源)。
- 挑战综述:IEEE TMI 42(12):3956-3971,2023-12,doi:10.1109/TMI.2023.3320497,PMID 37768797,PMCID PMC10753957,CC BY 4.0(同上三源 + IEEE openAccessPdf)。
- 挑战被 ISBI 2021 接收:2020-10;ISBI 2021 大会 2021-04-13~16(TMI §II-C + ISBI 官网档期)。
规模与分辨率
- 两卷:MitoEM-H(成人脑皮层)、MitoEM-R(成年大鼠脑皮层)(TMI §II-A)。
- 每卷 1,000×4,096×4,096 voxels;体素 8×8×30 nm(x,y,z)(TMI §II-A + 官网 Task 节)。
- 物理尺寸 32.8×32.8×30 µm(TMI 精确口径);官网简写 “two 30x30x30 um”;MICCAI 摘要 “(30µm)³”(三口径并存)。
- 每卷体素总数 ≈167.8 亿;两卷合计 ≈335 亿(由 5/6 计算)。
- 规模倍数:3,600×(MICCAI 摘要,泛指旧基准);1,986×(TMI,vs Lucchi,公式见 §2.6)。
- Lucchi 对照:2048×1536×1065 栈、~35% 标注(两个 1024×768×165 子卷)、二值掩码、(5µm)³ 级(MITCAI 论文引言/相关工作 + TMI)。
划分与实例
- train 0-399(400 slices)/ val 400-499(100 slices)/ test 500-999(500 slices,GT 私有)(官网 Dataset 节 + TMI §II-A 双源)。
- 实例下限 ≥2,000 voxels(官网 Dataset 节原句 “at least 2,000 voxels”)。
- v1 实例数:H 24.5K、R 14.4K(TMI §II-A)。
- v2 实例数:H 19K、R 10.8K;降幅 -5.5K(-22%)/-3.6K(-25%)(TMI §II-A)。
- v2 缆长分组实例数:H 5,106/3,608/164、R 1,292/3,832/524(TMI §II-B;对应子集未注明,存照 C5)。
- H 卷图像 padded:每侧 zyx +[20,512,512] → 1,040×5,120×5,120(TMI/官方发布说明;HF 文件名 EM30-H-im-pad 实抓,存照 C11)。
版本链与时间线
- v1 发布:2020-11-26(官网 Important Dates)。
- v2 上传:2021-12;重评后排名 largely unaltered(TMI §II-A)。
- 2022-03-02 起在线评估仅用 v2(官网 Important Note)。
- 新指标生效:2022-07(TMI §II-B)。
- 官网上线 2020-11-01、注册开放 2020-11-08、测试提交截止 2021-02-28、短文截止 2021-03-10、现场挑战 2021-04-13(官网 Important Dates 逐条实抓)。
评测与结果
- 参与:257 注册 / 14 队提交 / 6 队 workshop / 8 支 top 方法进综述(TMI 摘要)。
- v2 accuracy 总榜:IIPPR(SJTU)0.770、VIDAR(USTC)0.678、EMBL 0.635、VGG 0.634、CEM-PDL 0.631、FCI 0.577、H2RNet 0.554、ABCS 0.523(TMI Table III,pdftotext 提取)。
- baseline:U3D-BC 0.643、U2D-BC 0.381(不参与排名)(同上)。
- 分卷最好值:R 卷 recall 最高 VIDAR 0.948;两卷全平衡仅 IIPPR(H 0.814/0.913、R 0.824/0.943)(Table III)。
- 匹配阈值:IoU 0.75(v1 与 v2 同阈值,v2 记 TP 用 >0.75)(数据集论文 + TMI)。
- 数据集论文同期贡献:3D AP 实现加速 45×(MICCAI 2020 论文)。
分发与许可
- HF 图像仓 pytc/EM30:EM30-H-im-pad.zip 23.91GB、EM30-R-im.zip 13.96GB、EM30-M-im-pad.zip 15.21GB(AxonEM,非 MitoEM;存照 C10)(HF API 实测 2026-09-29)。
- HF 标签仓 pytc/MitoEM:EM30-H-mito-train-val-v2.zip 55.9MB、EM30-R-mito-train-val-v2.zip 66.6MB、mitoem_R_train_4um_im.h5 32.4MB + seg 0.5MB(同上)。
- 数据许可:HF 卡片 license: mit(官方分发口径);MitoEM-challenge 仓库 LICENSE 全文 MIT, “Copyright © 2020 donglai”(2026-09-29 实抓,两口径闭合,存照 C8)。
- TMI 综述 CC BY 4.0;MICCAI 2020 论文 Springer 版权(非 OA)(IEEE 档案 + Springer 出版页)。
- 在线评测:持续开放提交与自动评测(官网原话 + TMI 摘要 “the challenge remains open…”)。
- 组织者 9 人:Wei、Lin、Jang、Pfister(SEAS)+ Wang、Yin、Lichtman(MCB)+ Franco-Barranco(DIPC)、Arganda-Carreras(Ikerbasque/UPV-EHU)(官网 Organizing Committee 实抓)。
- 资助:NIH/NCI 75N91019D00024、U54 CA225088;CRUK FC001999、Wellcome FC001999(PubMed Grants 档案)。
- 纠错通道:linzudi@g.harvard.edu,主题 “[MitoEM Error]”,附 (x,y,z) 坐标(官网实抓)。
- neuroglancer 在线浏览:precomputed 版托管于 rhoana.rc.fas.harvard.edu(官网链接实抓)。
- 提交格式细节:H5 + 2× 下采样 + 连通组件打标 + LZF 压缩;其他打标方法需提交备注声明(GitHub aux 工具说明)。
- HF 卡片 size_categories:“1B<n<10B”(HF pytc/MitoEM 卡片;与体素总数口径不同,勿混用——§2.2)。
- 引用画像:数据集论文 Semantic Scholar 引用 130、TMI 综述 15(2026-09-29 实抓,时点数会增长)。
引用优先级声明:以上数字与一级来源冲突时,以 MICCAI 2020 论文、IEEE TMI 2023 综述、官网为准;二级整理(HF MedOtter 卡片等)仅作检索线索不作数字依据(如 V1 脑区说法,存照 C7)。
附录 G:数据加载与对齐代码骨架
以下为通用科学计算栈(h5py/numpy/scipy)的示意骨架,帮助快速落地 §2.9/坑 7 的工程要求;目录与字段名以实际解压结果为准,baseline 训练配置以 PytorchConnectomics 仓库内配置文件为准。
G1 加载 R 卷 4 µm 迷你版(试手)
import h5py
# mitoem_R_train_4um_im.h5 / _seg.h5:R 卷 4µm 下采样迷你版(32.4MB / 0.5MB)
# h5 内部 dataset 命名以文件实际结构为准(先 h5py 逐层查看再取键)
with h5py.File("mitoem_R_train_4um_im.h5", "r") as f:
def _show(name, obj):
print(name, getattr(obj, "shape", None), getattr(obj, "dtype", None))
f.visititems(_show) # 第一步:打印层级结构,确认 dataset 键名
im = f[list(f.keys())[0]][()] # 示意取键,替换为实际键名
with h5py.File("mitoem_R_train_4um_seg.h5", "r") as f:
seg = f[list(f.keys())[0]][()] # 实例 ID:0 为背景,≥1 为线粒体实例
print(im.shape, im.dtype, seg.shape, seg.dtype,
f"instances in mini volume: {seg.max()}")
G2 H 卷裁 pad 与标签对齐(坑 7)
import numpy as np
PAD_ZYX = (20, 512, 512) # 官方 H 卷 padding(每侧)
RAW_SHAPE = (1000, 4096, 4096) # 原始坐标系(GT 发布口径)
def crop_pad(vol: np.ndarray) -> np.ndarray:
"""EM30-H-im-pad 加载后裁回原始坐标;任何与 GT 的对齐都在裁边后进行。"""
assert vol.shape == (1040, 5120, 5120), f"unexpected shape {vol.shape}"
z, y, x = PAD_ZYX
return vol[z:z + RAW_SHAPE[0], y:y + RAW_SHAPE[1], x:x + RAW_SHAPE[2]]
def pad_seg(seg: np.ndarray, fill: int = 0) -> np.ndarray:
"""反向操作:若坚持在 padded 坐标下推理,把标签对称 pad 并以背景填充。"""
z, y, x = PAD_ZYX
out = np.full((1040, 5120, 5120), fill, dtype=seg.dtype)
out[z:z + RAW_SHAPE[0], y:y + RAW_SHAPE[1], x:x + RAW_SHAPE[2]] = seg
return out
G3 逐切片 PNG 标签 → 3D 实例统计(2D/3D 连通声明)
from pathlib import Path
import numpy as np
from scipy import ndimage
def load_seg_dir(seg_dir: str) -> np.ndarray:
"""train/ 或 val/ 目录:逐切片 PNG,像素值=实例 ID(0 背景)。
文件名排序须按切片序号数值序(零填充文件名直接字典序即可)。"""
paths = sorted(Path(seg_dir).glob("*"))
slices = [np.asarray(__import__("PIL.Image", fromlist=["open"]).open(p))
for p in paths]
return np.stack(slices, axis=0) # (Z, Y, X)
def instance_report(seg3d: np.ndarray, voxel_nm=(30, 8, 8)) -> dict:
ids, counts = np.unique(seg3d[seg3d > 0], return_counts=True)
vox_nm3 = float(np.prod(voxel_nm)) # 30*8*8 = 1920 nm^3
vols_um3 = counts * vox_nm3 / 1e9
below_min = int((counts < 2000).sum()) # 与 GT ≥2,000 voxels 口径核对
# 连通性自检:3D 26-邻域下每个实例 ID 应只对应一个连通体;
# 若一个 ID 拆出多个连通体,说明实例跨层 ID 不连续(或标签有空洞)
n_components = sum(
ndimage.label(seg3d == i, structure=np.ones((3, 3, 3)))[1]
for i in ids[:50] # 抽样前 50 个实例即可
)
return {"n_instances": int(ids.size), "min_voxels": int(counts.min()),
"below_2000": below_min, "split_ids_sampled": int(n_components - len(ids[:50]))}
G4 val accuracy 评测示意(v2 口径,IoU>0.75)
import numpy as np
def _bbox_masks(seg: np.ndarray):
"""把 (Z,Y,X) 实例图拆成 {id: 布尔体}(大栈请改用逐实例 bbox 裁剪省内存)。"""
ids = np.unique(seg); ids = ids[ids > 0]
return {int(i): (seg == i) for i in ids}
def iou(a: np.ndarray, b: np.ndarray) -> float:
inter = np.logical_and(a, b).sum()
union = np.logical_or(a, b).sum()
return inter / union if union else 0.0
def val_accuracy(gt: np.ndarray, pred: np.ndarray, thr: float = 0.75) -> dict:
G, P = _bbox_masks(gt), _bbox_masks(pred)
matched_gt, tp = set(), 0
for g_id, g in G.items():
hits = [p_id for p_id, p in P.items()
if p_id not in matched_gt and iou(g, p) > thr]
if len(hits) == 1:
tp += 1; matched_gt.add(hits[0])
fp = len(P) - len(matched_gt) # 未消耗预测(示意口径,不含 over-seg 细分)
fn = len(G) - tp
acc = tp / (tp + fn + fp) if (tp + fn + fp) else 0.0
return {"TP": tp, "FP": fp, "FN": fn, "accuracy(inst-F1)": round(acc, 4)}
# 注意:production 评测应再按缆长分组(Kimimaro)与 association 六类展开(§4.2)。
附录 H:H5 提交流程(在线评测)
在线评测提交的完整流程(命令以仓库 README 为准;本条目抓取时文档站教程 404,仓库仍在——存照 C9):
# 1. 取得官方 aux 工具(MitoEM-challenge 仓库,MIT 许可)
git clone https://github.com/PytorchConnectomics/MitoEM-challenge.git
ls MitoEM-challenge/aux/ # 转换脚本位于 aux/ 目录
# 2. 把逐切片预测整理为转换脚本要求的输入组织
# (逐切片 2D 预测 → 脚本内部做 2x 下采样、连通组件打标、LZF 压缩)
# 具体参数与输入布局以仓库 README / 脚本 docstring 为准
# 3. 在 mitoem.grand-challenge.org 注册/登录后提交 H5
# - 当前在线评测口径:标注 v2 + accuracy(IoU>0.75)+ 缆长三分组
# - 可反复提交;leaderboard 实时更新
三步的文字版(与上面等价):
- 转换:逐切片预测 → aux 工具转 H5(2× 下采样 + 连通组件自动打标 + LZF 压缩)。若用其他实例化方法(如直接输出 3D 实例 ID),需在提交备注显式声明打标方式。
- 上传:grand-challenge 平台账号内提交;预测体积应处于与训练一致的坐标系约定(H 卷记得裁 pad,坑 7)。
- 核对:提交后对照 leaderboard 的分组分数(尤其 large 组)判断是否有坐标/过滤类静默错误——large 组异常偏低时先查 MOAS 断裂与 pad 对齐,再查模型本身。
附录 I:BibTeX 引用条目
按一级来源书目信息整理;官网提供官方 BibTeX 时以官网为准(官网引用页可取)。引键沿用官网口径:
@inproceedings{wei2020mitoem,
author = {Wei, Donglai and Lin, Zudi and Franco-Barranco, Daniel and
Wendt, N. and Liu, X. and Yin, Wenjie and Huang, X. and
Gupta, A. and Jang, Won-Dong and Wang, Xueying and
Arganda-Carreras, Ignacio and Lichtman, Jeff W. and
Pfister, Hanspeter},
title = {MitoEM Dataset: Large-scale 3D Mitochondria Instance
Segmentation from EM Images},
booktitle = {Medical Image Computing and Computer Assisted Intervention
-- MICCAI 2020},
series = {Lecture Notes in Computer Science},
volume = {12265},
pages = {66--76},
year = {2020},
doi = {10.1007/978-3-030-59722-1_7}
}
@article{francocurrentmito2023,
author = {Franco-Barranco, Daniel and Lin, Zudi and Jang, Won-Dong and
Wang, Xueying and Shen, Qijia and Yin, Wenjie and Fan, Yutian and
Li, Mingxing and Chen, Changmin and Xiong, Zhiwei and Xin, Rui and
Liu, Hao and Chen, Huai and Li, Zhili and Zhao, Jie and
Chen, Xuejin and Pape, Constantin and Conrad, Ryan and
Nightingale, Luke and de Folter, Joost and Jones, Martin L. and
Liu, Yanling and Ziaei, Dorsa and Huschauer, Stephan and
Arganda-Carreras, Ignacio and Pfister, Hanspeter and Wei, Donglai},
title = {Current Progress and Challenges in Large-Scale 3D Mitochondria
Instance Segmentation},
journal = {IEEE Transactions on Medical Imaging},
volume = {42},
number = {12},
pages = {3956--3971},
year = {2023},
doi = {10.1109/TMI.2023.3320497}
}
使用说明:使用数据本身(图像/GT)时引 wei2020mitoem;使用 v2 标注、在线评测分数或误差解剖结论时,francocurrentmito2023 是唯一完整记载口径的来源,务必一并引用(官网引用义务,§6.5)。
附录 J:标注纠错邮件模板([MitoEM Error])
发现疑似标注错误时,向 linzudi@g.harvard.edu 发送(主题固定前缀;坐标使用裁 pad 后的原始 1,000×4,096×4,096 坐标系;以下为示意模板,字段以官网说明为准):
To: linzudi@g.harvard.edu
Subject: [MitoEM Error]
Dear MitoEM team,
While using the MitoEM dataset (annotation v2), we found a potential
annotation error:
- Volume: MitoEM-H / MitoEM-R
- Annotation version: v2
- Slice (z): NNN
- Coordinate (x,y,z): (NNNN, NNNN, NNN) # voxel coords, original frame
- Error type: similar-organelle mislabel /
adjacent-instance merge /
MOAS connection incomplete / other
- Description: <一两句说明:所见结构与疑点>
- Attachment: <可选:截图/裁块>
Best regards,
<姓名 / 机构 / 日期>
三条礼仪与实效建议:一次邮件聚焦一处错误(便于逐条核对);同批多处错误可合并附件并在正文列坐标索引;邮件后若被官方修订采纳,标注版本可能再次演进——引用时留意官网是否有 v2 之后的版本公告。
附录 K:常见引用错误与正确写法对照
以下 10 组对照来自 §10 八坑与 §4.3 口径判别的最高频走样形态,供论文/报告写作时逐条自查:
| # | 错误写法 | 问题 | 正确写法 |
|---|---|---|---|
| 1 | “MitoEM challenge (MICCAI 2023)” | 纪年错误(坑 1) | “MitoEM challenge (ISBI 2021)”;数据集论文引 MICCAI 2020 |
| 2 | “MitoEM 包含人源与 HeLa 两域” | 物种误记(坑 2) | “MitoEM-H(成人脑皮层)+ MitoEM-R(成年大鼠脑皮层)” |
| 3 | “两个 30µm×30µm×30µm 体数据” | 混用约数当精确值(坑 3) | “32.8×32.8×30 µm(官网约写 30×30×30 µm)” |
| 4 | “约 4 万条线粒体标注” | 未对版本(坑 4) | “v1 约 38.9K(24.5K+14.4K);v2 修正后 19K+10.8K” |
| 5 | “test 集上 accuracy 0.770” | 缺集合与版本口径 | “测试半卷(在线评测,v2 accuracy 口径)0.770(TMI Table III)” |
| 6 | “冠军方法 AP 0.770” | 指标名错误(坑 5) | “冠军方法 accuracy(IoU>0.75 匹配)0.770” |
| 7 | “数据集比旧基准大 3,600 倍” | 倍数缺基准(坑 6) | “3,600×(vs 泛指旧基准);1,986×(vs Lucchi,体素×分辨率口径)” |
| 8 | “加载 H 卷 1,000×4,096×4,096 图像后直接与 GT 对齐” | 忽略 padded 版(坑 7) | “H 卷加载为 1,040×5,120×5,120,先裁每侧 [20,512,512]” |
| 9 | “下载 pytc/EM30 三个 zip 即可开始训练” | 混入 AxonEM(坑 8) | “仅取 EM30-H-im-pad.zip 与 EM30-R-im.zip;EM30-M 属 AxonEM” |
| 10 | “分辨率 8nm” | 各向异性信息丢失 | “8×8×30 nm(x,y,z):面内 8 nm、切片间 30 nm” |
使用方式:成稿后把对照表左列作为 grep 关键词扫一遍自己的文档——左列任一形态命中即回查对应坑节。
附录 L:名称与别名速查表
MitoEM 生态的名字系统是检索走样的高发区,集中列一次(与坑 1/坑 2/坑 8 联动):
| 名称 | 指什么 | 常见误指 |
|---|---|---|
| MitoEM / MITOEM | 本条目主体:两卷数据集 + ISBI 2021 挑战赛(大小写两种拼法在一级来源并存,检索时通用) | 误当 MICCAI 2023 赛事名 |
| MitoEM-H | 成人脑皮层卷(Human) | 误当 HeLa;误当"Harvard 卷" |
| MitoEM-R | 成年大鼠脑皮层卷(Rat) | 误当"Rabbit/Regional";脑区细分(V1)不采信 |
| EM30 | EM 采集系列编号(30nm z 步长),文件名前缀 | 误当数据集名本身 |
| EM30-H / EM30-R | MitoEM 两卷的图像/标签文件前缀 | — |
| EM30-M | AxonEM 小鼠轴突卷(非 MitoEM) | 误当 MitoEM 第三卷(存照 C10) |
| pytc | HF 组织账号 = PytorchConnectomics 团队 | 误当独立第三方 |
| PytorchConnectomics | GitHub 官方 baseline 框架(含 U2D-BC/U3D-BC) | 与 MitoEM-challenge 仓库混淆 |
| MitoEM-challenge | GitHub 挑战赛 starter code + aux 工具仓(MIT,Copyright © 2020 donglai) | 误当数据存储仓 |
| MitoEM-v1 / MitoEM-v2 | 标注版本链(2020-11 / 2021-12) | 误当两套不同数据集 |
| AxonEM | 姊妹任务数据集系列(轴突) | 误当 MitoEM 的一部分 |
| H01 | 同源(Harvard Lichtman 系)但不同的 petavoxel 数据集(Science 2024) | 误当 MitoEM 的扩展版 |
附录 AA:基于本数据集的研究检查清单(12 项)
- 版本锚定:引用任何实例数/分数,先写 v1 还是 v2、AP-75 还是 accuracy、val 还是 test 三要素。
- 坐标对齐:H 卷 padded 图像先裁 [20,512,512] 再与标签对齐;任何插值后重算指标前恢复原始坐标系。
- 各向异性保真:不做各向同性重采样(8×8×30nm 的 z 压缩会断 MOAS 微管);若必须重采样,缆长计算按原始轴分辨率折算。
- 实例下限对齐:预测后按 ≥2,000 voxels 过滤,与真值口径一致,否则 FP 计数虚高。
- 连通性声明:用连通组件打标时声明 2D 连通/3D 连通与邻接定义(26 邻域 vs 6 邻域会改变实例数)。
- 物种外推纪律:H/R 各一例供体——两卷间的差异写成"本数据集内观察",不写成物种结论(TMI 原文声明)。
- MOAS 报告:large 组(>4µm 缆长)分数单独报告;混淆矩阵或 association 六类误差至少报 under-segmentation 与 many-to-many。
- test 诚信:test 分数只能来自在线评测记录;val 分数标注 “val”;禁止 val 冒充 test。
- 引用双论文:官网明确要求同时引用 wei2020mitoem(MICCAI 2020)与 francocurrentmito2023(TMI 2023),BibTeX 见附录 I。
- 许可证留痕:再分发衍生数据时附 MIT 许可声明(HF 卡片与仓库 LICENSE 双处核实一致,存照 C8);论文引用格式按 Springer/IEEE 各自规范。
- 元数据缺口披露:涉及数据治理/伦理审查时,注明一级来源未披露供体人口学与采集方案——需要该层信息的项目需联系组织者。
- EM30-M 隔离:数据管线按文件名白名单(EM30-H*/EM30-R*)拉取,防止 AxonEM 的 EM30-M 混入。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- instance2022 — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 评测基准 / 脑影像
- ulf-enc — 共享标签:医学影像 / 挑战赛数据集 / 评测基准 / 脑影像
- adam-aneurysm — 共享标签:医学影像 / 医学图像分割 / 评测基准 / 脑影像
- siim-acr-pneumothorax — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 评测基准
- mr-art — 共享标签:医学影像 / 医学图像分割 / 评测基准 / 脑影像
- topbrain2026 — 共享标签:医学影像 / 医学图像分割 / 脑影像
- tus-rec — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
- selma3d — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 脑影像
- intra — 共享标签:医学影像 / 医学图像分割 / 评测基准 / 脑影像
- rsna-intracranial-hemorrhage — 共享标签:医学影像 / 挑战赛数据集 / 评测基准 / 脑影像
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

