信息速览
INFOBOX — ODELIA 一屏速览
维度 内容 本质 EU ODELIA 项目(群学习,swarm learning)主办的 ODELIA Breast MRI Challenge 2025 公开挑战赛数据集 上位项目 Open Consortium for Decentralized Medical Artificial Intelligence(Horizon Europe No 101057091,2023-01-01~2027-12-31,€8,691,755) 数据 741 例乳腺 MRI = 741 名女性,六欧洲中心五国,2006-12~2024-05,多厂商 1.5T/3T 序列 每例 T2 加权 + DCE-T1(1 个 pre + 2~7 个 post 期相)+ 减影图;16-bit NIfTI → parquet 任务 双侧乳房独立三分类:0=无病灶 / 1=良性 / 2=恶性(恶性优先) 标签分布 患者级 291/146/304;乳房级 978/195/309(合计 1,482 侧) 切分 default: train 472 / val 119 / test 150;五折分层交叉验证,患者级无重叠 平台 HuggingFace ODELIA-AI/ODELIA-Challenge-2025(gated=auto)+ grand-challenge.org 评测License CC BY-NC 4.0(署名-非商业) 挑战赛 MICCAI 2025 官方在册(Deep-Breath workshop,2025-09-23 大田);95 注册/24 国,7 队 final;冠军 DivideAndConquer(DKFZ)总分 0.769、AUC 0.897 官方基线 Medical Slice Transformer:In-Distribution Macro AUC 79.0% → 整中心留出(RSH)暴跌至 63.1% 条目导航 引用数字→§2|跑基线→§5/§12|避坑→§10|误判纠正→附录 C
§0 导读:这个数据集解决什么问题
乳腺 MRI(breast MRI)是致密乳腺与高危人群筛查中灵敏度最高的影像手段,EUSOBI(European Society of Breast Imaging,欧洲乳腺影像学会)已推荐其作为补充筛查工具。
但一次检查就是数百层三维体数据,放射科医生读片耗时远超钼靶,这是 MRI 难以大规模进入筛查流程的核心瓶颈——也是 AI 最该补位的地方。
补位的前提是有"对的"训练数据。此前公开的乳腺 MRI 数据集几乎都是单中心、且多数只收癌症病例:拿它们训练出的模型,要么见多不广、要么只会"报癌"不会鉴别。
ODELIA 数据集针对性解决三件事:多中心异构(六中心、多厂商、1.5T 与 3T、各中心自有采集协议,刻意不清洗抹平);三分类完整谱系(恶性、良性、无病灶同场竞技,这是" largest multi-centre public dataset with malignant+benign+non-cancer cases"的官方宣称);双侧独立标注(左乳右乳分别给标签,贴合临床"逐乳判读"的真实工作流)。
它同时是一场已收官的 MICCAI 2025 官方挑战赛(Deep-Breath workshop)的赛题数据:95 支队伍注册、7 队进入决赛、冠军 AUC 0.897——更重要的是,官方基线在同一数据上把"跨中心泛化鸿沟"(cross-centre generalization gap)量化得明明白白:同分布 Macro AUC 79.0%,整中心留出直接跌到 63.1%。
对任何想做多中心医学影像 AI 的团队,这组对照本身就是教材。
§0 读法三则:
- 本条目主体是挑战赛公开数据集本体(HF 仓库),挑战赛记录、官方基线与 EU 项目背景是它的三层上下文——引用数据时认准 §2 的 741 例口径,引用成绩时认准 §4.3 的名次制口径;
- 全文统计数字出自数据论文 v3(arXiv:2506.00474)、GC 官网、HF API 实测与冠军/亚军论文四个一手来源;口径冲突处(741 vs 742、六中心 vs five sites、7 国 vs 8 国)已在坑点 1/2 与 §9 存照;
- 想直接上手跑的读者可跳读 §12 复现实操手册与附录 C 误判对照表——后者是本条目检索期最高频误判的集中纠正。
§1 数据集速览:十问十答
Q1:ODELIA 是数据集名还是项目名?
都是。
ODELIA 先是一个 EU Horizon Europe 项目(全称 Open Consortium for Decentralized Medical Artificial Intelligence,2023-2027,12 家欧洲机构做群学习医疗 AI),本项目在其中牵头产出这个公开乳腺 MRI 数据集并以此举办 ODELIA Breast MRI Challenge 2025。
百科条目 slug=odelia 收录的是挑战赛公开数据集本体。
Q2:数据规模多大?
741 例检查、741 名女性(一妇一检),平均年龄 54±11 岁;采集时间横跨 2006 年 12 月至 2024 年 5 月;六中心各贡献 31~250 例。
Q3:影像内容是什么?
每例含一条 T2 加权(T2-weighted)序列和一条 DCE(dynamic contrast-enhanced,动态对比增强)T1 序列——DCE 含 1 个对比剂前(pre-contrast)期相加 2~7 个对比剂后(post-contrast)期相,另有由 Post_1 减 Pre 生成的减影(subtraction)图。
Q4:标签怎么给?
每例左右乳各一个三分类标签:0=无病灶(no lesion)、1=良性(benign lesion)、2=恶性(malignant lesion);恶性优先(同侧既有良性又有恶性记 2)。
Ground truth 由专家放射科医生基于组织病理(histopathology)或 2 年随访(follow-up)确认。
Q5:从哪下载?
HuggingFace ODELIA-AI/ODELIA-Challenge-2025,gated=auto(登录接受条款后自动审批)。default 与 unilateral 两种 config,parquet 格式,仓库总量约 304.9 GB。
Q6:license 是什么?
CC BY-NC 4.0——署名、非商业。商用需另行授权,论文引用是使用义务。
Q7:挑战赛结果如何?
2025-06-03 数据发布,07-31 截稿,08-15 出分,09-23 在 MICCAI 2025 Deep-Breath workshop(韩国大田)收官。
95 人注册、24 国、7 队 final;冠军 DivideAndConquer(德国癌症研究中心 DKFZ)总分 0.769、AUC 0.897。
Q8:官方基线多强?
Medical Slice Transformer(MST,DINOv3 切片特征+attention 聚合):In-Distribution Macro AUC 79.0%、Micro AUC 87.4%;换成一个从未见过的中心(RSH 整体留出)测试,Macro AUC 掉到 63.1%、Spec@90%Sens 仅 26.7%。
Q9:和库内 duke-breast-mri 什么关系?
Duke(922 例,单中心,仅恶性)是上一代公开乳腺 MRI 的代表;ODELIA 六中心、含良性/无病灶,且冠军方案直接把 Duke 拿来当外部数据做了二值化改造训练。两者是"单中心深度"与"多中心广度"的互补关系。
Q10:一句话说清它最独特的价值?
它是目前唯一同时给出"六中心真实异构 + 三分类全谱系 + 双侧独立标签 + 官方量化跨中心泛化鸿沟 + MICCAI 官方挑战赛闭环"的乳腺 MRI 公开数据集。
§2 数据构成与规格
2.1 规模、来源与机构构成
数据集由六个欧洲临床中心(clinical centres)在 2006 年 12 月至 2024 年 5 月间收集,共 741 例乳腺 MRI 检查、对应 741 名女性(论文明确一妇一检,无重复患者)。
五国分布如下(括号内为数据文件中的机构缩写,也是 HuggingFace 与 split 表的分组键):
| 缩写 | 机构 | 城市 | 国家 | 备注 |
|---|---|---|---|---|
| CAM | Cambridge University Hospitals(剑桥大学医院) | Cambridge | 英国 | 贡献两个子数据集:筛查人群 + 有症状癌症患者 |
| MHA | Mitera Hospital(米特拉医院) | Athens | 希腊 | 私立综合医院 |
| RSH | Ribera Hospital(里贝拉医院) | Valencia | 西班牙 | 属 Ribera Salud 集团 |
| RUMC | Radboud University Medical Center(拉德堡德大学医学中心) | Nijmegen | 荷兰 | 深度学习乳腺影像重镇(Ritse Mann 团队) |
| UKA | University Hospital RWTH Aachen(亚琛工业大学医院) | Aachen | 德国 | 数据论文一作与基线产出地 |
| UMCU | University Medical Center Utrecht(乌得勒支大学医学中心) | Utrecht | 荷兰 | 五国六中心中的第二个荷兰中心 |
每中心贡献量介于 31~250 例之间,刻意保留了数量悬殊的自然分布。CAM 同时覆盖筛查(screening)与症状性(symptomatic)两条临床路径,使数据横跨"体检发现"与"门诊就诊"两种人群构成。
年龄与时间的硬数字:平均年龄 54±11 岁;采集窗口长达 17 年半——这意味着数据里同时存在扫描硬件与协议的多代演化,这是"真实世界异构性"(real-world heterogeneity)的时间维度。
2.2 影像序列构成:T2 + DCE 多期相
每例检查的标准构成:
- T2 加权序列(T2-weighted, T2w):形态学信息(水肿、囊实性判别),1 条;
- DCE-T1 动态序列:1 个对比剂前期相(Pre)+ 2~7 个对比剂后期相(Post_1 到 Post_n,n 不定),观察病灶强化动力学;
- 减影图(subtraction, Sub_1):由 Post_1 − Pre 逐体素相减派生,放大强化信号、抑制本底。
这一构成与临床读片流程同构:放射科医生正是"先看 T2 形态、再看 DCE 强化曲线"来鉴别病灶性质。2~7 个 post 期相的可变长度本身就是数据异构性的一部分——不同中心的采集协议对期相数量与时间分辨率各有惯例,参赛算法必须能处理"有的例 3 个 post、有的例 7 个 post"的现实。
存储与数值规格:原始 DICOM 统一转换为 16-bit 无符号整型 NIfTI(.nii.gz),标准化命名为 Pre.nii.gz / Post_1.nii.gz … Post_n.nii.gz / Sub_1.nii.gz / T2.nii.gz。
HuggingFace 主仓库将图像体数据以 int16 数组形式内嵌进 parquet 分片,并附每例 4×4 float64 的 affine(仿射)矩阵保存空间定位信息。
2.3 两种配置:original 与 unilateral
数据集提供两种图像配置(configuration),工程选型前必须分清:
original(原始配置):保留各中心原始分辨率与视野,仅做 DICOM→NIfTI 转换与标准化命名。它忠实还原各中心 PACS(Picture Archiving and Communication System,影像归档系统)中的原始样貌,适合研究采集协议本身或自建预处理流程。
unilateral(单乳配置):为机器学习优化的统一格式——
- T1w 序列重采样(resample)到 0.7 × 0.7 × 3.0 mm 各向异性体素(T2 重采样到 T1w 网格对齐);
- 沿图像中线把每例切分为左乳、右乳两个独立样本(741 例 → 1,482 侧);
- 用阈值分离背景/前背景,对乳腺区域做中心裁剪或 padding 到固定尺寸 256 × 256 × 32 voxels。
unilateral 配置是论文基线与挑战赛评测的工作格式;GC 平台推理时则把数据以 .mha 文件喂给参赛 Docker 容器,要求算法自行完成"逐乳出预测"。
官方同时开源了由 original 转 unilateral 的预处理脚本(data_to_unilateral_example_script.py),欢迎参赛者替换为自己的方案——冠军团队正是这么做的(自训分割模型代替中线切分,见 §4.5)。
2.4 标签分布:两级口径与不平衡画像
标签按"患者级(例)"与"乳房级(侧)"两套口径统计:
| 口径 | No lesion | Benign | Malignant | 合计 |
|---|---|---|---|---|
| 患者级(例) | 291 | 146 | 304 | 741 |
| 乳房级(侧) | 978 | 195 | 309 | 1,482 |
三个值得注意的结构性事实:
- 恶性占比最高(患者级 41.0%),这是数据采集向临床阳性人群倾斜的结果——部分中心(如 CAM 症状子集)来自确诊转诊流,而非纯筛查人群;
- 良性是最稀缺类:乳房级仅 195/1,482(13.2%),患者级 146/741(19.7%)。三分类里"鉴别良性"恰是临床最微妙、样本又最少的一档,各参赛队的折损几乎都发生在这里(冠军论文专门为"良性没有独立预测路径"的方案做过激进实验,见 §4.5);
- 近三分之二的乳侧没有病灶(978/1,482):单侧阳性的患者其对侧多为无病灶,双侧标签天然强相关——这直接决定了交叉验证必须按患者切(见坑点 5)。
中心维度的分布画像(论文 Figure 3b/4b 文字口径):CAM 贡献了最多的恶性例与无病灶例,UKA 贡献了最多的良性例——良性样本高度集中于单一中心,这为跨中心评测埋下了额外难度。
2.5 HuggingFace 仓库结构与字段
仓库根目录(抓取时点 2026-09-26/27,经 API 核验):
ODELIA-AI/ODELIA-Challenge-2025/
├── data/ # default config parquet 分片(60 片)
├── unilateral/ # unilateral config parquet 分片(train 60 片 + val 15 片)
├── example-case-nii-and-mha/ # NIfTI 与 MHA 示例文件
├── example-algorithm/ # GC 官方示例算法(Docker 模板)
├── evaluation-method/ # 评测方法说明
├── split_default.csv # default 切分表
├── split_unilateral.csv # unilateral 切分表
├── data_to_unilateral_example_script.py # original→unilateral 官方脚本
├── compute_sub_example_script.py 等 # 减影/提交辅助脚本
└── README.md # gated:登录后可见
default config 核心字段(cardData 实测):
| 字段 | 类型 | 含义 |
|---|---|---|
| UID | string | 检查唯一标识,对应图像文件夹名 |
| Fold | int64 | 交叉验证折号 |
| Split | string | train / val / test |
| PatientID | string | 患者唯一标识(一妇一检下与 UID 一一对应) |
| Institution | string | 机构缩写(CAM/MHA/RSH/RUMC/UKA/UMCU) |
| Age | int64 | 检查当日年龄(单位:天) |
| Lesion_Left | int64 | 左乳标签 0/1/2 |
| Lesion_Right | int64 | 右乳标签 0/1/2 |
| Image_Pre / Affine_Pre | int16 4D 数组 / 4×4 float64 | pre-contrast 体数据与仿射矩阵 |
| Image_Post_1 … Image_Post_n(+ 各 Affine) | 同上 | 各 post 期相体数据与仿射 |
split 硬数字(API splits 实测,与论文"64%/16%/20%"口径吻合):
| config | train | val | test | 合计 |
|---|---|---|---|---|
| default(例) | 472 | 119 | 150 | 741 |
| default 字节 | 162.5 GB | 41.3 GB | 52.3 GB | ≈256 GB |
| unilateral(侧) | 944 | 238 | 300 | 1,482 |
| unilateral 字节 | 29.9 GB | 7.5 GB | 9.5 GB | ≈47 GB |
仓库总存储 304,885,769,330 字节 ≈ 304.9 GB;createdAt 2025-05-15,lastModified 2025-10-19(挑战赛收官后追加释放);抓取时点 downloads 475、likes 12。
2.6 在公开乳腺 MRI 数据集景观中的位置
论文 Table 1 的横向对比("研究级事实卡"口径):
| 数据集 | 区域 | 仅癌症 | 标注层级 | 例数 | 中心数 |
|---|---|---|---|---|---|
| AMBL(Advanced-MRI-Breast-Lesions) | 未标 | 部分 | 像素级(仅 200 例) | 632 | 1 |
| DUKE-Breast-Cancer-MRI | 美国 | 是 | 像素级 | 922 | 1 |
| MAMA-MIA | 美国 | 是 | 像素级 | 1,506 | >18(4 数据集聚合) |
| BREAST-DM | 中国 | 否 | 像素级 | 232 | 1 |
| FastMRI Breast | 美国 | 否 | 检查级 | 300 | 1 |
| ODELIA(本条目) | 欧洲 | 否 | 检查级(双侧) | 741 | 6 |
论文的定位宣称:“迄今最大的、同时包含恶性、良性与非癌三类的多中心公开乳腺 MRI 数据集”——注意定语的精确性:论规模它不及 MAMA-MIA(且 MAMA-MIA 是 4 个数据集的聚合、仅收癌症);它赢在"多中心 + 三分类 + 双侧检查级标注"三者同时成立的稀缺组合。
2.7 采集协议与硬件:异构性的参数级解剖
数据论文补充材料(Table S1-S3)给出了逐中心的采集硬件与序列参数——这是"多厂商异构"从口号变成可查参数表的地方。七个影像子数据集(CAM 拆 BRAID1 与 TRICKS 两个子集)的硬件构成:
| 子集 | 厂商 | 机型 | 场强 | 线圈 |
|---|---|---|---|---|
| CAM (BRAID1) | GE | SIGNA Artist | 1.5T | 8 通道乳腺线圈 |
| CAM (TRICKS) | GE | DISCOVER MR750 | 3T | 16 通道乳腺线圈 |
| MHA | Siemens | MAGNETOM Skyra / TrioTim / Prisma_fit / Avanto | 1.5T 与 3T 多台 | — |
| RSH | Philips | Achieva | 1.5T | 双侧乳腺线圈 |
| RUMC | Siemens | — | 1.5T 与 3.0T | 4-18 通道可变(Invivo 等) |
| UKA | Philips | Achieva / Ingenia | — | 双侧乳腺线圈带固定桨(Invivo) |
| UMCU | Philips | Achieva / Ingenia | — | 7 通道专用双侧乳腺线圈 |
三家主流厂商(GE / Siemens / Philips)、两种场强(1.5T 与 3T)同时在场,官方"multiple vendors at both 1.5 and 3 T"的表述在参数表层面坐实。
DCE-T1 序列的参数跨度(Table S2 提炼,高置信度项):
- 序列类型:梯度回波(GR/SPGR)为绝对主流,但 UKA 是唯一采用 2D 采集的中心(3D=No;其 TR 262.7±19.8 ms、翻转角 90°、每卷仅 25~31 层,都是 2D 采集的典型指纹)——这解释了为何 UKA 在冠军论文的 5 折交叉里是行为最独特的一个中心;
- TE 跨度:1.7 ~ 4.6 ms;TR 跨度:4.4 ~ 262.7 ms(UKA 2D 序列拉满上限);
- 翻转角:9.8° ~ 90°;层厚 1 ~ 4 mm;采集矩阵 256~672;FOV 201~427 mm;
- post 期相数逐中心:CAM-BRAID1 约 2、CAM-TRICKS 4~5(view sharing 共 48 期、每 9 期保存一期的特殊协议)、MHA 4(一例仅 3)、RSH 5、RUMC 4~5、UKA 4~5、UMCU 7——"2~7 个 post"的官方区间就是逐中心合计的结果;
- 对比剂:钆布醇(Gadobutrol/Gadovist)、钆特酸(Gadoteric acid/Clariscan)、多它灵(Dotarem)三种并存;注射速率 1~3 mL/s(部分中心静脉条件差时降为 2 mL/s),25~30 mL 生理盐水冲管;
- 采集时序:单期 63~84 秒不等,个别中心用 view sharing(视图共享)提高时间分辨率。
T2 序列(Table S3):全部为自旋回波(SE)家族;除 RSH 外均为 2D;仅 UMCU 常规压脂;TE 从 81 ms 到 365 ms(RSH 的 365±5 ms 是 3D T2 的特征值);层厚 1.5~4 mm。
对使用者的含义:任何在单一中心数据上验证过的预处理假设(如"T2 一定压脂"“DCE 一定 3D”“期相一定 ≥4”)在这个数据集上都可能被单中心反例打破——把它们当超参数而非先验。
2.8 技术验证设计:论文如何自证数据可用
数据论文的 Technical Validation 节给出三层验证设计:
- 切分设计:64%/16%/20% 三分 + 五折交叉,每折对应不同中心组合,患者级无重叠——切分本身把"中心组合"变成了被检验的变量(Fold 1~5 的 Macro AUC 75.0~82.2% 波动即证据);
- ID/OOD 成对实验:RSH 整中心留出(§5),把"训练见过测试中心吗"作为唯一变量隔离;
- 统计卫生:三指标(AUC/Sens@90%Spec/Spec@90%Sens)+ 每标签独立二分类化 + bootstrap 1,000 次重采样给标准差——与挑战赛评测口径同构,方便跨表对读。
这套"数据+基线+验证协议"的打包发布,是 Scientific Data 体例的模板化执行——即便它尚未在期刊正式发表。
2.10 挑战赛公开集 vs 联盟内部数据库的对照
ODELIA 项目交付物 D2.1(2024-12 交付、2025-02 挂网)披露了联盟内部群学习数据库的规模:八家研究机构、共 1,013 名患者的乳腺 MRI——比挑战赛公开的 741 例更大,且从未公开。D2.1 同时记录了内部标准预处理(减影生成、重采样 0.7×0.7×3.0 mm、左右乳分离——与公开集 unilateral 配置同源)与关键发现:各中心本地训练的模型性能差异巨大(site-specific factors),群学习训练使多数站点的结果得到改善。
对公开集使用者的含义:公开 741 例是"联盟内部数据库的一个精选子集",它的选择标准(哪 741 例、如何按中心配额)未详细披露;内部 1,013 例的存在意味着"更大的 ODELIA"理论上存在,公开基准上的方法学结论在联盟内部数据上未必同幅度复现。
§3 标注体系:从五类细写到三分类落地
3.1 Ground truth 的判定规则
每侧乳房的标签由各中心专家放射科医生(expert radiologists)给出,判定依据只有两条硬通道:
- 组织病理(histopathology):活检或手术后病理证实;
- 两年随访(2-year follow-up):影像随访两年无恶性证据,作为"良性/无病灶"的安全垫。
三分类的官方定义(GC 官网与论文一致):
| 标签 | 编码 | 定义 |
|---|---|---|
| No lesion | 0 | 无可见强化病灶 |
| Benign lesion | 1 | 有强化病灶,经活检或两年随访证实为良性 |
| Malignant lesion | 2 | 有强化病灶,经病理或随访证实为恶性;含证实的非肿块强化(non-mass enhancement, NMCE)恶性 |
3.2 五类细标注 → 三分类聚合的取舍
原始标注其实更细,共五类:No lesion / Benign lesion / Malignant lesion (DCIS)(导管原位癌,ductal carcinoma in situ)/ Malignant lesion (Invasive)(浸润性恶性)/ Malignant lesion (Unknown)(类型未明)。
聚合的原因很直白:DCIS、浸润性与类型未明三个亚型的样本量都不足以支撑可靠的细分类,强行保留只会产出噪声。于是恶性三类合并为一类发布。这个取舍给二次研究者留了一条明确的扩展路径:若你的任务恰好需要 DCIS/浸润性分辨,现有公开标签帮不上忙,需要回溯原始中心数据。
3.3 多病灶与侧别规则
两条发布级规则,直接影响标签语义:
- 恶性优先:同一侧乳房既有恶性又有良性病灶时,标签记恶性(malignant)。即标签表达的是"该侧最严重发现"(most severe lesion),不是病灶清单;
- 双侧独立:左右乳各自独立打分(Lesion_Left / Lesion_Right 两列)。一例 = 一个病人 × 两个标签位,这与挑战赛"每侧各出一个预测"的评测设计严格对齐。
3.4 标签与临床工作流的同构性
这套标注体系刻意对齐了乳腺影像的临床报告结构:BI-RADS(Breast Imaging Reporting and Data System)评分类似"每侧一个结论",三分类相当于把 BI-RADS 的核心决策区间压缩为"随访观察 / 良性处理 / 恶性处理"三档。
对模型开发者而言,这意味着输出可直接映射到分诊动作(no action / routine follow-up / biopsy),无需中间设计映射层——这是"检查级标注"相对"像素级分割标注"在筛查场景的工程优势,代价是牺牲了病灶定位能力。
3.5 元数据的边界
除标签外,每例附带的非影像元数据只有三样:患者年龄(天)、机构代码、切分信息。没有:BI-RADS 评分、病灶位置/大小/类型、分子分型、病史、种族/社会经济变量、扫描厂商字段(厂商信息只体现在论文补充材料的采集协议表,未随数据发布)。
做公平性(fairness)或亚组分析的研究者要意识到 Age 与 Institution 是仅有的两个可用协变量。
§3 补遗:伦理与合规逐中心清单
数据论文 Ethics declarations 逐中心公示(引用时可直接落出处):
| 中心 | 伦理批准 |
|---|---|
| CAM | 四个 IRAS 项目号:122652 / 251317 / 143891 / 260281(对应筛查与症状两条路径及历次扩展) |
| MHA | 当地伦理委员会 2023-01-30 信函批准 |
| RSH | Local ID 23/430-E |
| RUMC | Local ID 2024-17192 |
| UKA | Local ID EK 24-087 (23-006) |
| UMCU | 数据完全匿名化后,当地伦理委员会于 2024-03-05 豁免审查 |
三条合规要点:一、伦理批准在各中心分别取得、按当地法规执行(论文原话 “Ethics approval was obtained at each centre individually”)——不存在覆盖全数据集的单一伦理伞;二、UMCU 的豁免以"完全匿名化"为前提,提示其余中心的批准可能带去标识化条件;三、Age(天)与 PatientID 是仅有的个体级字段,PatientID 的粒度足以支持"按患者聚合"的统计但不足以回溯身份——这是发布方在"可复现"与"可识别"之间的明确取舍。
§4 挑战赛全记录:从数据发布到大田收官
4.1 时间线全景
ODELIA Breast MRI Challenge 2025 是 ODELIA 联盟在 EU 项目中期推出的一次性公开挑战赛,被 MICCAI 2025 接纳为官方在册挑战赛(MICCAI challenge 列表 DOI:10.5281/zenodo.15075569),成果在 2025 年 9 月 23 日韩国大田(Daejeon Convention Center)的 Deep-Breath workshop(Radboudumc 主导的乳腺 AI workshop)集中报告。
| 日期 | 事件 |
|---|---|
| 2025-05-15 | HF 仓库创建(API 实测) |
| 2025-05-31 | 数据论文 arXiv:2506.00474 v1 挂出 |
| 2025-06-03 | 训练数据发布 |
| 2025-06-05 | 追加数据 |
| 2025-06-16 | pre-evaluation(预评测)开放 |
| 2025-07-17 | pre-evaluation 截止(一版口径;官网后更新为 07-24) |
| 2025-07-31 | final submission(最终提交)截止 |
| 2025-08-15 | 最终评测与结果公布 |
| 2025-09-23 | Deep-Breath workshop @ MICCAI 2025(大田) |
| 2025-10-19 | HF 仓库最后更新(赛后数据释放) |
| 2025-10-31 | 冠军论文 arXiv:2510.27326 挂出 |
| 2025-11-18 | odelia.ai 发布挑战赛结稿新闻 |
必答题的核验结论(详见 FACTS 与坑点 8):不存在"2023/2024 第一版"。
三轮精确搜索(MICCAI 2024 官方 challenge 列表、GC 平台全量列表、odelia.ai 项目年报)均无 2023/2024 版挑战赛痕迹;2023 年是 EU 项目启动年(当年产出是群学习 MVP 与文档站),2025 挑战赛为首届。
所有"第二版/首届 2023"式表述都应避免。
4.2 评测协议:三指标平均名次制
挑战赛评测在 Grand Challenge 平台(GC)上进行,协议要点:
任务形式:输入 T2 + DCE(1 pre + 若干 post)的 .mha 文件,算法对每侧乳房各输出一个三分类预测;只接受 Docker 容器全自动方法(禁半自动/交互式),容器离线运行。
运行环境:NVIDIA T4 GPU(16 GB 显存);单例处理限时 5 分钟(横跨全部期相)。这个约束实际排除了"超大模型暴力推理"路线,逼参赛者在效率与精度间做工程权衡。
两阶段赛制:
- pre-evaluation(预评测):从 test 集挑 50 例"极端/离群"样本(最大例、最小例、图像质量最异质例等),每队 3 次试跑机会;同时必须提交约 3 页的方法摘要(用了什么外部公开数据、训练结果如何)。通过预评测是进入 final 的门票;
- final submission(最终提交):每队仅 1 次,在完整 test 集上评测。
排名规则:三项指标——AUC、特异度@90%灵敏度(specificity at 90% sensitivity)、灵敏度@90%特异度(sensitivity at 90% specificity)——各自单独排名后取名次平均(average of raw ranks);平局时以 AUC 高者列前。这条规则的临床含义:同时惩罚"漏诊"与"过报"两个方向的失衡,逼模型在临床可用的操作点上双向达标,而不是靠单一 AUC 数字取胜。
开源义务:Top 5 获奖者须向组织方公开代码;官方同时鼓励全员开源。
排名规则的 Toy 示例:假设三支队伍三指标的成绩与名次如下——A 队 AUC 第 1、Sens@90%Spec 第 3、Spec@90%Sens 第 2(名次平均 2.00);B 队三项全部第 2(2.00);C 队 AUC 第 3、另两项第 1(1.67)。C 以 1.67 夺冠;A 与 B 平局,按规则比 AUC——A 的 AUC 第 1 压过 B 的第 2 拿亚军。这个机制解释了为什么"单项刷到极致"不如"三项都不瘸腿"——冠军 DivideAndConquer 的"总分 0.769"即其三指标名次在该机制下的聚合呈现,语义是"平均名次的归一化表述"而非任一指标的数值。
4.3 参与规模与结果
结稿新闻(2025-11-18)口径:95 名注册者、来自 24 个国家;预评测后 7 支队伍提交最终模型并在大田展示。
- 冠军:DivideAndConquer(DKFZ)——主数据集总分 0.769,AUC 0.897,奖金 1,000 欧元;
- 亚军:BCN-AIM(巴塞罗那大学团队,SwinUNETR 方案);
- 季军:agaldran;
- 关键观察:所有模型在 holdout(预留集)上性能全线下降——组织方把含第六中心数据的 231 例扣作 holdout 以检验泛化,结果成为"跨站点异构性"的又一记实锤。
0.769 是三指标名次的平均,不是任何一项指标的直接数值(坑点 7);除冠军外各队的逐项分数未见系统公开(待核,见 §9)。
4.4 冠军方案解剖:MeisenMeister
冠军团队 DKFZ(German Cancer Research Center,德国癌症研究中心,海德堡)医学图像计算分部(Hamm、Kirchhoff、Rokuss、Maier-Hein),论文《MeisenMeister: A Simple Two Stage Pipeline for Breast Cancer Classification on MRI》(arXiv:2510.27326),代码全开源于 GitHub MIC-DKFZ/MeisenMeister。
两阶段 Divide-and-Conquer 流水线:
- 定位阶段:官方提供的单乳裁剪脚本只做中线切分,裁出的子体积仍然太大。冠军团队自训了一个左右乳分割模型(配套论文 arXiv:2507.13830)——先把体数据降采样、跑分割、出每侧乳腺的紧致 bounding box,再回原图按框裁出高分辨率 ROI(region of interest,感兴趣区域);
- 分类阶段:在 ROI 上用 nnU-Net 框架改造的分类器(backbone 主选 ResEncL,ResNet 编码器的加大版)逐乳分类。
四个关键消融发现(5 折交叉、每折留出一个采集中心的 Mean AUROC):
- 输入通道:Pre + Post_1 + Post_2 三个通道最优(0.649);加 T2 反而崩(0.584)——与直觉相反,T2 与 DCE 的跨中心一致性最差,成为噪声源(坑点 6);
- 预训练 + warm-up 微调:在 MAMMA-MIA 数据集上做监督分割预训练,再微调分类任务;带学习率预热的微调(1e-5→1e-3)显著优于 linear probing(0.738 vs 0.651)与全量微调(0.725);
- batch size=1 的正则化红利:batch 4→2→1 单调涨分(0.745→0.740→0.765),小 batch 的梯度噪声成了免费的泛化正则器;
- 背景掩蔽 + 数据增广:用分割掩码把 ROI 外背景置零带来明显增益;增广里高斯噪声(0.851)与缩放(0.843)有效,而 gamma 变换、弹性形变、模拟低分辨率全部掉分——强度类增广会抹掉诊断性强化特征。
外部数据的使用:纳入 AMBL(含恶性+良性)小幅涨分(0.623→0.649);Duke(仅恶性)则被二值化改造使用——把任务改写成"健康 vs 有病灶"二分类训一个模型,推理时把"有病灶"概率拆给恶性、其余给良性。这个方案最终在常规三分类任务面前落败(0.757 vs 0.776),"给良性留预测路径"是更稳的选择。
冠军的自白:论文结论坦承任务的核心瓶颈是数据量与标签噪声而非架构——模型极易过拟合、同配置不同 run 方差很大、复现困难;并点名联邦学习(federated learning)与更高效的标注工具是下一步方向。这段话对二次研究者是非常坦诚的预期管理。
4.5 亚军方案速写
BCN-AIM(巴塞罗那大学数学与信息学系 + Computer Vision Center + ICREA,Joshi/Garrucho/Osuala/Diaz/Lekadir)的方案(arXiv:2508.20621):四通道 MIP(maximum intensity projection,最大密度投影)输入——Post_1、Sub_1、Sub_2、末次减影——用预测的乳腺分割掩码先屏蔽非乳腺组织,SwinUNETR(基于 Swin Transformer 的 3D 医学影像骨干)多通道 DCE 输入 + 集成学习(ensemble)+ 强数据增广,针对类不平衡做了专项处理,最终排行榜第二。
与冠军的"3D 局部 ROI 分类"路线形成方法论对照:亚军用 MIP 压维走 2D 化路线,冠军保 3D 细节走两阶段路线。
§4 补遗:官方规则细则存档
GC 官网 General Rules and Info 页(抓取时点)的参赛约束全文要点,对复现协议与设计同类挑战赛都有参考价值:
- 账号与验证:提交前须完成 Grand Challenge 账号人工验证(manual verification),官方明示"可能耗时,请尽早";
- 完全自动:只接受全自动方法,半自动/交互式方法不得提交;
- 离线运行:所有 Docker 容器在无网环境执行(不能下载/上传任何资源)——模型权重必须打包进镜像;
- 运行时:GC Runtime Environment 标准;推理期给 NVIDIA T4(16 GB 显存);单例全期相处理限时 5 分钟;
- 格式细节:HF 上是 NIfTI 文件的说法与 GC 评测时以 .mha 呈现并存(见坑点 4);
- 外部数据:不禁止公开数据预训练,但必须在 pre-evaluation 的约 3 页摘要中申报(“if any other publicly available data was used”)——冠军用了 AMBL+DUKE 即按此申报;
- 提交次数:pre-evaluation 3 次、final 1 次;
- 开源义务:Top 5 须向组织方交代码;全员被鼓励开源;
- 资格条款:组织方保留随时取消不公平/不诚实参赛者资格的权利;
- 地域限制:全球开放,但 EU 制裁地区(朝鲜、克里米亚等金融限制地区)居民除外——奖金发放需合规 EU 金融规定。
§5 官方基线:Medical Slice Transformer 与泛化鸿沟的官方量化
5.1 模型架构与训练配置
数据论文配套的基线模型是 MST(Medical Slice Transformer)——为 volumetric(体积型)医学影像设计的 transformer:
- 逐切片特征:用 Meta 的 DINOv3 视觉基础模型为每个 axial 切片提特征向量;
- attention 聚合:用注意力机制把全部切片向量聚合成整卷一个预测——与冠军"分割出 ROI 再分类"完全不同的无切割路线;
- 输入:Pre + Sub_1(第一 post 减影)+ T2 三通道(注意:与冠军最优通道配置不同,见坑点 6 的两面性);
- 训练:AdamW、学习率 1e-5、batch size 8、交叉熵损失、约 1 小时单卡 NVIDIA L40S、早停(early stopping)防过拟合;
- 增广:随机旋转、水平/垂直翻转、高斯噪声、224×224×32 随机边距裁窗。
权重与代码双公开:模型权重 HF ODELIA-AI/MST,训练代码 GitHub mueller-franzes/odelia_breast_mri——这是"数据集+基线+权重"三位一体交付的范例。
5.2 两种评测设计:In-Distribution vs Out-of-Distribution
论文设计了成对实验,直接把"跨中心泛化鸿沟"变成可引用的数字:
- In-Distribution(ID,同分布):用除 RSH 外全部中心的数据训练,在同一批中心的 test split 上测——训练与测试中心重叠;
- Out-of-Distribution(OOD,分布外):同一模型,改在整只 RSH 中心(训练时从未见过)上测。
5.2a 指标口径速查:三个数字各在量什么
读结果表之前,先把三个指标的计算口径钉死(挑战赛与论文同口径):
- AUC(Area Under the ROC Curve):ROC 曲线下面积,衡量跨所有阈值的全局判别力,与操作点无关;
- Sens@90%Spec(灵敏度@90%特异度):把特异度固定在 90%(假阳性率 10%)时模型能达到的灵敏度——回答"每 100 个无病者只误报 10 个的前提下,能抓住多少真阳性";
- Spec@90%Sens(特异度@90%灵敏度):把灵敏度固定在 90%(漏诊率 10%)时模型能达到的特异度——回答"几乎不漏诊的前提下,能排除掉多少假警报"。
论文的汇总口径:三分类被拆成三个独立二分类(Lesion vs No、Benign vs Others、Malignant vs Others)分别计算;Macro AUC = 三个二分类 AUC 的算术平均(对三类一视同仁),Micro AUC = 合并全部预测后计算(被多数类主导);bootstrap 1,000 次重采样给出标准差。这套口径与挑战赛"逐乳三指标"的差别:挑战赛按每侧乳房的预测计分并取指标名次平均,论文按标签任务平均——两组数字不可直接互换。
5.3 基线结果硬数字
指标口径:每个标签作为独立二分类任务(Lesion vs No/Benign vs Others/Malignant vs Others)计算后汇总;Sens@90%Spec 与 Spec@90%Sens 同挑战赛定义;bootstrap 1,000 次重采样估标准差。
| 折/设置 | Macro AUC (%) | Micro AUC (%) | Sens@90%Spec (%) | Spec@90%Sens (%) |
|---|---|---|---|---|
| Fold 1 | 81.6 ± 2.3 | 85.9 ± 1.8 | 57.3 ± 5.6 | 61.5 ± 3.7 |
| Fold 2 | 81.5 ± 2.4 | 87.4 ± 1.9 | 66.4 ± 4.7 | 65.8 ± 5.9 |
| Fold 3 | 82.2 ± 2.7 | 91.3 ± 1.5 | 80.1 ± 4.2 | 75.2 ± 6.9 |
| Fold 4 | 75.0 ± 3.2 | 86.2 ± 2.0 | 64.1 ± 6.8 | 62.1 ± 5.3 |
| Fold 5 | 79.8 ± 2.6 | 88.5 ± 1.7 | 68.5 ± 5.5 | 60.8 ± 6.1 |
| Overall(ID) | 79.0 ± 1.3 | 87.4 ± 0.8 | 68.4 ± 2.4 | 63.3 ± 3.2 |
| OOD(RSH 留出) | 63.1 ± 3.5 | 78.3 ± 2.8 | 57.5 ± 7.3 | 26.7 ± 6.9 |
5.4 数字背后的三句话
- 16 个百分点的 Macro AUC 断崖(79.0→63.1):同分布内训练数据已经覆盖了测试中心的扫描风格,换中心即失灵——这不是过拟合的常态表现,而是中心特异伪影(扫描仪、协议、人群)被模型当成了特征;
- Spec@90%Sens 跌到 26.7%:想把灵敏度压在 90% 操作点时,特异度几乎归零——模型在新中心上"人人报警",这恰是筛查场景最不可接受的失效模式;
- Fold 间方差本身就大(75.0~82.2):五个折对应五个不同的中心组合,fold 4 明显偏弱——中心组合的选择已经是性能变量的一部分。
这组官方数字为挑战赛的"三指标平均名次制"提供了设计动机注脚:单中心刷分好看的模型,在这套评测下会现形。它也是任何声称"解决多中心泛化"的新方法最该对齐的对照表。
§5 补遗:读基线数字的四条守则
- ID 与 OOD 不可平均:79.0% 与 63.1% 是两种评测设计的数字,混合平均没有任何意义;引用时必须注明口径;
- Macro 与 Micro 差 8 个百分点是类不平衡信号:87.4% 的 Micro AUC 被多数类(无病灶)撑高,79.0% 的 Macro AUC 才反映三类均衡判别力——引用 Micro 时必须并列 Macro,否则隐性美化;
- Sens/Spec@90% 是操作点指标:它们回答"临床可用的操作点上另一个指标还剩多少",与 AUC 的排序不一定一致(OOD 时 Macro AUC 还有 63.1%,Spec@90%Sens 只剩 26.7%——后者才是筛查场景的痛点);
- Fold 间 7 个百分点的波动是中心效应:Fold 4(75.0%)与 Fold 3(82.2%)的差距不是随机噪声(bootstrap 标准差 2.7~3.2),换中心组合就是换考卷——单折成绩不可作为方法优劣的证据。
§6 获取与许可:gated 之门与 CC BY-NC 4.0
6.1 获取流程实操
数据托管在 HuggingFace:ODELIA-AI/ODELIA-Challenge-2025,门控模式为 gated=auto——登录 HF 账号、阅读并接受数据卡条款后自动获批,无人工审核环节。
实测细节:匿名 curl 拉取 raw README 会被拒(“Access to dataset … is restricted. You must have access to it and be authenticated”),因此任何自动化脚本接入前先在浏览器完成条款接受、配置好 token。
仓库内的资源层次:
- 主数据:data/(default config)与 unilateral/ 两个 parquet 分片组(图像 int16 数组内嵌 + affine 矩阵字段);
- 示例文件:example-case-nii-and-mha/(少量 NIfTI 与 MHA 原始格式样例,用于对齐解析预期);
- 官方工具链:example-algorithm/(GC 参赛 Docker 模板)、evaluation-method/(评测说明)、data_to_unilateral_example_script.py(original→unilateral 转换)、compute_sub_example_script.py(减影计算);
- 配套资产:基线代码 GitHub mueller-franzes/odelia_breast_mri、基线权重 HF ODELIA-AI/MST、冠军代码 GitHub MIC-DKFZ/MeisenMeister、亚军代码 GitHub smriti-joshi/bcnaim-odelia-challenge。
沙箱环境注意:HuggingFace 主站直连可能被网络策略拦截,可走 hf-mirror.com 镜像拉取公开元数据与文件;gated 数据集的鉴权下载仍需 token,镜像对 gated 仓库的支持以实测为准。
复现本条目元数据核验的命令(公开元数据无需登录):
# 数据集元数据(license/splits/大小/时间戳)
curl -sL "https://hf-mirror.com/api/datasets/ODELIA-AI/ODELIA-Challenge-2025"
# 仓库根目录文件树
curl -sL "https://hf-mirror.com/api/datasets/ODELIA-AI/ODELIA-Challenge-2025/tree/main"
# gated 文件本体(需 HF_TOKEN,镜像侧行为以实测为准)
curl -sL -H "Authorization: Bearer $HF_TOKEN" \
"https://huggingface.co/datasets/ODELIA-AI/ODELIA-Challenge-2025/resolve/main/split_default.csv"
6.2 License:CC BY-NC 4.0 的三句话
论文 Usage Notes 与 HF cardData 双源一致:Creative Commons Attribution-NonCommercial 4.0 International。
翻译成使用守则:可以用、可以改、可以再分发,但必须署名(引用数据论文)、不得商用;引用数据论文是使用义务而非礼节。对拟商用团队(影像设备厂商、筛查服务方),需要另行与 ODELIA 联盟洽商授权,公开渠道没有给出门路——这在"AI-Ready 光谱"上属于"学术完全开放、商业需谈判"的常见形态。
6.3 AI-Ready 评估:三视角
- 数据格式视角:parquet 主格式(数组内嵌)+ affine 字段保存空间信息,可被 pandas/Polars/Dask 直接流式读取;HF 库配置了 mlcroissant 元数据,机器可读性到位。但 16 GB 级单分片与 4D 医疗数组意味着"打开就能训"仍不成立——需要自行接 DataLoader、处理变长 post 期相(2~7 个)与两个 config 的选择;
- 任务就绪视角:标签、切分、fold 全部随数据给出,五折交叉协议患者级无重叠——"拿来即 benchmark"的就绪度在医学影像公开集里属于第一梯队;挑战赛评测协议(GC 平台 Docker、.mha 输入、T4 5 分钟)则提供了一条可复现的排行榜路径;
- 任务边界视角:检查级标注意味着分割、定位、病灶级分析等下游任务无监督信号;想做分割需要借冠军团队的左右乳分割模型(arXiv:2507.13830)或外配标注工具。
6.4 版本链与时间线状态
数据版本链:挑战赛期(2025-06 起)公开 511 例 + 231 例 holdout 未释放 → 赛后(HF lastModified 2025-10-19)释放至当前全量 741 例(train 472/val 119/test 150)。
数据论文 v1(2025-05-31)→ v3(2026-05-21)与该过程同步演化。截至抓取时点(2026-09-26/27)未见期刊正式发表版(dblp 仍收 CoRR 口径),arXiv v3 为权威文本。
数据论文三个版本的实质演化对照(引用时认准 v3):
| 版本 | 日期 | 实质变化 |
|---|---|---|
| v1 | 2025-05-31 | 初版;摘要无数例口径(仅"multi-centre dataset");作者 20 人 |
| v2 | 2025-12-24 | 挑战赛收官后修订;加入例数与分布细化 |
| v3 | 2026-05-21 | 定稿口径:741 例、六中心五国、“12 partners from 8 countries”;新增作者 Yuan Gao、Maike Bode(共 21 人);补 Table 1 对比与 OOD 实验 |
§7 生态与影响:一个 EU 项目的数据开放支点
7.1 上位项目:ODELIA 与群学习
ODELIA(Open Consortium for Decentralized Medical Artificial Intelligence)是 Horizon Europe 资助的医疗 AI 项目:2023-01-01 启动、2027-12-31 结束、总预算 €8,691,755、EIBIR(European Institute for Biomedical Imaging Research,欧洲生物医学影像研究所,维也纳)协调、12 家伙伴机构横跨 8 国。
其技术主线是 群学习(swarm learning,SL)——各医院在本地训练模型、只交换模型参数不交换患者数据,借助区块链协调实现去中心化协同,目标是绕开医疗数据"不能出院"的法规墙。
数据集与挑战赛在项目中的角色:为群学习网络提供"共同题库"与"公共基准"。挑战赛产出的参赛模型,按结稿新闻的说法将"被考虑纳入 ODELIA 群学习框架继续训练"——公开挑战赛成为群学习网络的选手选拔与预热机制。项目同时开源了群学习框架(文档站 odelia-ai.github.io)。
联盟内与数据直接相关的机构:UKA(Truhn 团队,基线与数据论文一作)、Cambridge(Gilbert 团队,共同一作与临床侧)、TU Dresden EKFZ(Kather 团队,技术主线)、Radboudumc(Mann 团队与 Deep-Breath workshop 主办)、UMCU、Mitera、Ribera Salud——六个数据中心全部来自联盟内部。
7.2 挑战赛生态位:MICCAI 与 Deep-Breath
ODELIA 2025 是 MICCAI 2025 官方在册挑战赛,挂在 Deep-Breath workshop(乳腺 AI 主题,Radboudumc 牵头)名下,2025-09-23 于大田举行。
同期 MICCAI 在册的乳腺/影像类挑战赛构成它的参照系;其"三指标平均名次 + 预评测门票 + holdout 泛化检验"的协议设计,在医学挑战赛方法论上属于对"单指标刷榜文化"的一次明确纠偏。
7.3 在乳腺影像公开数据集谱系中的位置
以"多中心广度 × 标签谱系"两轴看乳腺影像公开数据:
- 单中心、仅恶性、像素级标注一脉:Duke-Breast-Cancer-MRI(922 例)等——病灶级深度研究的利器;
- 多中心聚合、仅恶性一脉:MAMA-MIA(1,506 例,>18 中心聚合)——分割与治疗响应研究的主战场;
- 多中心、三分类、双侧检查级:ODELIA(741 例)——筛查场景分类器的最贴题语料。
库内另有多个乳腺 X 线(mammography)侧条目(vindr-mammo、cbis-ddsm、inbreast、tn-mammo-breast-density、swiss-mammo、cmmd)与病理侧条目(bach、bracs)——ODELIA 补上了库内"乳腺 MRI 分类"的空位,并与它们构成"跨模态乳腺普查"的检索簇。
7.4 影响力的时点画像
抓取时点(2026-09)的客观信号:HF downloads 475、likes 12;三篇 arXiv 论文(数据集、冠军、亚军)构成引用基座;数据论文 v3(2026-05-21)仍在修订,未见期刊版。
作为 2025 年中发布、单次挑战赛驱动的新数据集,其学术引用的放量期尚未到来——这既是引用它时的如实背景,也是使用者抢先建立方法学占位的窗口期。
7.5 协议设计的溢出影响
ODELIA 2025 的协议设计在医学挑战赛生态里立了三个可被效仿的先例:其一,“预评测用极端子集”——不做随机抽样而刻意选最大/最小/最异质例,专打算法的工程鲁棒性,把"能跑"从默认假设变成被测项;其二,“holdout 泛化检验”——231 例扣发到赛后,让"排行榜分数"与"真实泛化"分开呈现,冠军在 holdout 上的下滑被如实记录而非掩盖;其三,“三指标名次平均”——把临床操作点写进排名公式。后续挑战赛的设计文件里已能看到类似结构,ODELIA 是这条协议演化线上的显性节点。
§8 方法学启示:四条可迁移的经验
8.1 "异构性保留"是一种数据发布伦理
ODELIA 刻意不清洗掉中心间的协议差异(2~7 个 post 期相、多厂商、17 年采集窗口),把"真实世界的乱"作为数据集的核心卖点。这与许多公开集"先 harmonize( harmonization,协调化)再发布"的惯例相反。
它的逻辑:筛查 AI 的 deployment(部署)环境就是乱的,训练语料越"干净",部署落差越大。
8.2 泛化鸿沟要用官方数字量化,而不是口头警告
"跨中心会掉点"人人会说,ODELIA 把它做成了论文表格:同一模型 ID 79.0% vs OOD 63.1%。发布数据集时附"整中心留出"这种自虐式实验,应当成为多中心数据集发布的标准动作——它给后续方法立了明确的对照基线。
8.3 评审指标设计可以反向塑造方法生态
三指标平均名次制 + 预评测极端子集 + 5 分钟单例时限,把"既要灵敏、又要特异、还得跑得快"的压力传导给每个参赛队。冠军方案的每个工程选择(小 batch、背景掩蔽、弃 T2)都是在这套压力下的局部最优。设计挑战赛时,指标即指挥棒——ODELIA 给出了一个把临床操作点写进排名公式的范本。
8.4 双侧独立标签是对临床单元的尊重
一次检查两个标签位(Lesion_Left/Lesion_Right),而非一个 case 级标签,这让"左乳恶性、右乳干净"的患者不再被粗暴压扁成单一标签。
数据结构对齐临床决策单元(per-breast),是"检查级标注"里少见的精细设计;代价是分析时必须记住同患者双标签的相关性,统计检验与数据切分都要按患者聚合(坑点 5)。
§9 与库内条目的关系
9.1 家族图谱
- 直接互动:duke-breast-mri(440)——冠军论文把 Duke 作为外部数据源做二值化改造训练;两数据集构成"单中心深度 vs 多中心广度"的方法学对照组;
- 同模态(乳腺 MRI):i-spy(432)(多时相 DCE 治疗响应);论文 Table 1 对比语境中的 MAMA-MIA、AMBL、BREAST-DM、FastMRI Breast 均暂未入库;
- 同器官跨模态(乳腺 X 线):vindr-mammo(543)、cbis-ddsm(541)、inbreast(542)、tn-mammo-breast-density(628)、swiss-mammo(627)、cmmd(544)、brax(187);
- 同器官病理侧:bach(118)、bracs(138)、breastpathq(268);
- 同类型(挑战赛数据集):库内 reg2026、hecktor2026、topaneu2026、toothfairy2 等 MICCAI/医学挑战赛条目。
互链条目逐条对照(rid 为库内 record_id):
| rid | slug | 关系类型 |
|---|---|---|
| 440 | duke-breast-mri | 冠军外部数据源;单中心/仅恶性的对照组 |
| 432 | i-spy | 同模态多时相 DCE(治疗响应任务) |
| 543 | vindr-mammo | 同器官跨模态(X 线,AI 就绪标注) |
| 541 | cbis-ddsm | 同器官跨模态(X 线,病灶级) |
| 542 | inbreast | 同器官跨模态(X 线,欧洲来源) |
| 628 | tn-mammo-breast-density | 同器官跨模态(X 线,密度标签) |
| 627 | swiss-mammo | 同器官跨模态(X 线,瑞士队列) |
| 544 | cmmd | 同器官跨模态(X 线,分类) |
| 187 | brax | 同器官(X 线报告影像对) |
| 118 | bach | 同器官病理侧(分级) |
| 138 | bracs | 同器官病理侧(分级) |
| 268 | breastpathq | 同器官病理侧(质量评估) |
9.2 检索路径建议
- 查"乳腺 + 分类":本条目(MRI 侧)→ tn-mammo-breast-density(628)(X 线侧密度标签)→ cbis-ddsm(541)(X 线侧病灶级);
- 查"多中心泛化":本条目(官方 ID/OOD 对照)→ 库内多中心 MRI 条目(如 wmh-challenge、isles 系)→ MICCAI 挑战赛协议类条目;
- 查"挑战赛闭环"(数据+榜单+冠军开源):本条目 → topaneu2026、hecktor2026 同构条目;
- 查"EU 资助医疗 AI 项目产出":本条目是库内少数带 Horizon Europe grant number 溯源的条目,可作项目制数据集的检索锚点。
§10 避坑清单:八个已踩过的坑
-
坑点 1:三个"总例数"口径并存,引用一律用 741。论文 v3 与 HF split 实测(472+119+150)= 741;结稿新闻写 511 公开 + 231 holdout = 742。差异来源:挑战赛期 holdout 未释放(新闻的 511 是当时公开口径),赛后释放至 741;742 与 741 的 1 例差无官方解释。直接抄新闻数字会在校验时撞车。
-
坑点 2:“five European sites” 是新闻的公开子集叙事,不是数据集事实。数据集是六中心五国(CAM/MHA/RSH/RUMC/UKA/UMCU);新闻说 511 例来自五个站点、holdout 含第六站点——描述的是"当时可下载的部分",第二名论文甚至写"511 studies from six European centers"。三口径并存时以论文 v3 全量口径为准。
-
坑点 3:gated=auto 也会挡住匿名脚本。HF 虽是自动审批,但匿名 curl/API 拉取 raw 文件直接被拒;必须登录接受条款、配 token 后才能下载,README 全文在未登录时不可见。自动化流水线设计时把这一步算进去。
-
坑点 4:parquet vs NIfTI 的格式口径打架。GC rules 页写"hosted on HuggingFace as NIfTI files",但 HF dataset_info 显示主 config 是 parquet(图像 int16 数组内嵌、affine 单列);仓库另有 example-case-nii-and-mha 示例目录。以 API 实测为准:主数据 parquet,NIfTI 仅示例。GC 推理时输入则是 .mha——三种格式各管一段,别混。
-
坑点 5:双侧标签强相关,切分必须按患者。741 例 → 1,482 侧,同患者左右乳标签高度相关(一侧恶性时对侧多记无病灶但共享风险背景)。unilateral config 的 1,482 侧行若按行随机切分会造成患者泄漏;官方 fold 定义在患者级无重叠,复现实验时沿用官方 split.csv,勿自创按侧行切分。
-
坑点 6:T2 不是免费午餐,输入通道是超参数。冠军消融:Pre+Post_1+Post_2 = 0.649,加 T2 跌到 0.584;但官方基线 MST 的输入偏偏含 T2。两套结论不矛盾——通道选择与模型架构、预处理耦合。别把"T2 必须用/必须弃"写成教条,在自己的流水线里消融。
-
坑点 7:0.769 是"名次的平均",不是 AUC。挑战赛总分 = AUC、Sens@90%Spec、Spec@90%Sens 三项各自名次的平均值(平局比 AUC)。新闻同时给出冠军 AUC 0.897——把 0.769 当 AUC 写进论文是硬伤。同理,该分数只在这 7 支决赛队伍的名次语境下有意义,无法与外部论文的指标值直接换算。
-
坑点 8:acronym 展开与"第一版"幻觉。ODELIA 官方展开 = Open Consortium for Decentralized Medical Artificial Intelligence(CORDIS/PUBDB/D2.1 三源一致);官网口号"Open Source Swarm Learning to Empower Medical AI"是 tagline 不是展开。另外不存在"2023/2024 第一版挑战赛"——2023 是 EU 项目启动年,2025 挑战赛是首届,勿受印象流误导写出"第二版"。
-
坑点 9:view sharing 期相不是等间隔期相。CAM-TRICKS 子集的动态采集用 view sharing(视图共享)——共享 48 期、每 9 期保存一期,时间间隔与常规中心完全不同;把"期相间隔恒定"写死进动力学特征提取,在这个子集上会出错。
-
坑点 10:Split/Fold 的语义随 config 变。default 的 741 行是"例",unilateral 的 1,482 行是"侧";Fold 编号在两 config 下的含义与数量都不同(unilateral 由左右侧共享同一 fold 继承患者归属)。跨 config 混读 split 表会把同一患者读成两个独立样本。
坑点速查表(一句话版,详见上十条):
| # | 一句话版 |
|---|---|
| 1 | 总例数引用 741,别抄新闻的 742 |
| 2 | 六中心是事实,“five sites” 是新闻叙事 |
| 3 | gated=auto 也要登录+token |
| 4 | 主数据 parquet,NIfTI 仅示例,GC 推理用 .mha |
| 5 | 1,482 侧不能按行随机切,按患者聚合 |
| 6 | T2 通道是超参数,加不加要消融 |
| 7 | 0.769 是名次平均不是 AUC |
| 8 | acronym 展开 ≠ 官网口号;无 2023 前版 |
| 9 | view sharing 期相间隔不等距 |
| 10 | 两 config 的 Split/Fold 语义不同 |
§11 总结
11.1 三句话总结
- ODELIA 是 EU 群学习项目产出的六中心 741 例乳腺 MRI 公开数据集,以双侧乳房三分类(无病灶/良性/恶性)与 T2+DCE 多期相真实异构为核心资产,CC BY-NC 4.0 于 HuggingFace gated=auto 发放;
- 它作为 MICCAI 2025 官方挑战赛完成闭环:95 注册/7 队决赛/冠军 AUC 0.897,冠军 DKFZ 两阶段方案与亚军 SwinUNETR 方案全开源,构成两条可复现的方法路线;
- 官方基线把跨中心泛化鸿沟量化为 ID 79.0% → OOD 63.1%(Spec@90%Sens 仅 26.7%),为所有多中心乳腺 AI 工作立下了必须面对的对照基线。
11.2 适合谁
- 做乳腺 MRI 分类/筛查模型、需要含良性谱系训练语料的团队;
- 研究多中心泛化、域自适应(domain adaptation)、测试时训练(test-time adaptation)的方法学者——ID/OOD 官方对照表现成;
- 需要患者级五折协议做严谨 benchmark 的评审型研究;
- 挑战赛方法论研究者(三指标名次制、预评测门票、holdout 设计的案例样本);
- swarm learning/联邦学习团队——这是官方明示的后续整合方向。
11.3 不适合谁
- 需要病灶级分割/定位标注的任务(检查级标注无此信号);
- 需要 DCIS vs 浸润性亚型分辨的研究(五类已聚合为三分类);
- 商用落地(CC BY-NC 4.0 直接挡住);
- 期望大样本量(相对 MAMA-MIA 的 1,506 例,741 例属于中等规模);
- 需要 BI-RADS、分子分型、人口学协变量的公平性研究(元数据只有年龄与机构)。
11.4 30 秒决策卡
| 你的需求 | 判断 |
|---|---|
| 乳腺 MRI 三分类/筛查模型训练 | 直接用,unilateral config 起步 |
| 跨中心泛化方法验证 | 直接用,沿用官方五折 + 复跑 RSH 留出对照 |
| 病灶分割/定位 | 不合适,转 Duke(440)/MAMA-MIA 或自备标注 |
| 商业产品训练 | 不合适,CC BY-NC 4.0 |
| 想拿排行榜成绩 | 挑战赛已收官,新参赛者不再计奖;GC 平台提交通道状态以官网为准 |
| 引用数字 | 741 例/六中心五国/双侧 1,482 侧/CC BY-NC 4.0/arXiv:2506.00474 |
11.5 与相邻研究领域的界面
- 对域自适应/测试时训练研究:六中心天然的 domain gap + 官方 OOD 协议,是比"合成域偏移"更可信的实验床;
- 对群学习/联邦学习研究:数据集是 ODELIA 群学习网络的公共基准层,官方明示参赛模型将纳入 SL 框架继续训练——做 SL 方法对比时可引用其协议;
- 对基础模型评测研究:741 例三分类可作为乳腺域的小样本评测集(MST 已示范 DINOv3 特征 + 轻量聚合的可行组合);
- 对挑战赛方法论研究:三指标名次制、极端子集预评测、holdout 泛化检验三个设计都是可引用的协议样本。
§12 从零到基线:复现实操手册
以下手册按"注册→下载→对齐基线→再开发"四段组织,全部步骤基于官方资源(无第三方依赖)。
12.1 第一步:账号与权限(半小时级)
- 注册 HuggingFace 账号并登录;
- 访问
ODELIA-AI/ODELIA-Challenge-2025数据卡,阅读并接受条款(gated=auto,接受即解锁); - 生成 read token,配置到
~/.cache/huggingface/token或环境变量HF_TOKEN; - (网络受限环境)把 endpoint 指向 hf-mirror.com 镜像;gated 仓库在镜像侧的鉴权行为需实测——若镜像不透传 gated 授权,用主站 + token 下载。
12.2 第二步:数据落盘与结构核验(1 小时级)
- 决定 config:先下 unilateral(约 47 GB)起步——它已是统一 0.7×0.7×3.0 mm、256×256×32 的即用格式;default(约 256 GB)留给需要自定义预处理/完整原分辨率的场景;
- 下载仓库根目录的
split_unilateral.csv(或split_default.csv)先行本地核验:行数应为 1,482(或 741),Split 列 train/val/test 计数 944/238/300(或 472/119/150)——数字对不上说明版本有异,先停下排查; - 拉
example-case-nii-and-mha/的示例文件对照 parquet 数组,确认 int16 体数据 + affine 矩阵的解析方向(affine 决定左右方位与解剖朝向,解析错了模型等于看镜像数据); - 注意 post 期相列是按最长 7 个配置的(Image_Post_1…Image_Post_7),多数例只有部分期相有效——按例判断有效期相数,不要默认补零。
12.3 第三步:对齐官方基线(一天级)
- 拉 GitHub
mueller-franzes/odelia_breast_mri与 HFODELIA-AI/MST权重; - 用官方 split 复跑 MST(输入 Pre+Sub_1+T2;AdamW lr 1e-5、batch 8、交叉熵、L40S 约 1 小时量级);
- 对齐两个锚点:In-Distribution Macro AUC ≈ 79.0%、RSH 留出 OOD Macro AUC ≈ 63.1%;
- 复算指标时按论文口径把三分类拆成三个独立二分类(Lesion vs No、Benign vs Others、Malignant vs Others)再汇总 Macro/Micro——直接用多分类 macro-average 实现会与论文口径有细微出入;
- 对齐失败先查三件事:切分是否用了官方 fold、指标实现是否逐标签二分类化、unilateral 的左右侧标签是否与图像方位对应(Lesion_Left 对应解剖左乳)。
12.4 第四步:复现挑战赛协议(可选,两天级)
- 参考
example-algorithm/与evaluation-method/把推理 Docker 化:输入 .mha(T2 + DCE 全期相)、离线、单例 5 分钟、目标硬件 T4 16GB——打包时把权重编进镜像; - 算法内部自行处理"逐乳预测"(官方不再代切分;可借鉴官方 unilateral 脚本或冠军的分割定位路线);
- 按三指标(AUC、Sens@90%Spec、Spec@90%Sens)自建评测,对照组=MST 基线与冠军自报的内部 5 折 0.776;
- 若要与外部数据联训,申报义务虽随挑战赛结束失效,学术透明仍建议在论文中列明(AMBL、DUKE 是两条被验证过的路径)。
12.5 常见报错与排查
- 401/403 拉取失败:gated 未接受或 token 未配置——回 12.1 第 2 步;
- 内存爆掉:default config 单例是原始分辨率 3D 体 + 最多 9 条序列,别一次性 pin 进内存;用 parquet 流式读取 + 惰性解码;
- 期相数不齐报 shape 错:Image_Post_* 按最长 7 配置、按例有效——动态拼接而不是静态 reshape;
- 左右侧标签对不上:检查 affine 的方向余弦;unilateral 配置虽然已按中线切开,但左/右的解剖学约定(影像左=患者右)在实现里极易搞反——用无病灶对侧 vs 有病灶侧的分布抽查;
- 成绩远好于官方基线:先怀疑泄漏——按侧行切了 unilateral、或 test 集混入训练、或指标实现把多分类 macro 与逐标签二分类混算;官方五折 patient-level 无重叠是底线。
FAQ(高频问答 40 问)
A. 基础认知
Q1:ODELIA 数据集的一句话身份?
EU Horizon Europe 项目"Open Consortium for Decentralized Medical AI"(群学习)产出的公开挑战赛数据集:六欧洲中心 741 例乳腺 MRI,双侧乳房独立三分类(无病灶/良性/恶性),CC BY-NC 4.0,HuggingFace gated=auto 发放。
Q2:它和"ODELIA 挑战赛"是什么关系?
一体两面:数据集是挑战赛的赛题语料,挑战赛(ODELIA Breast MRI Challenge 2025,MICCAI 2025 官方在册)是数据集的方法学验证场。挑战赛已收官,数据集持续开放。
Q3:为什么叫 ODELIA?
项目缩写展开为 Open Consortium for Decentralized Medical Artificial Intelligence(去中心化医学 AI 开放联盟)。
注意官网口号"Open Source Swarm Learning to Empower Medical AI"不是展开式。
Q4:swarm learning(群学习)和这个数据集有什么关系?
群学习是项目的技术主线:各医院本地训练、只换参数不换数据。公开数据集与挑战赛是它的"公共基准层"——参赛模型赛后会被考虑纳入群学习框架继续训练。
Q5:数据集的发表状态?
数据论文 arXiv:2506.00474(v1 2025-05-31 → v3 2026-05-21),截至 2026-09 抓取时点无期刊正式版(dblp 仅 CoRR 口径)。冠军论文 arXiv:2510.27326、亚军论文 arXiv:2508.20621 同为预印本。
Q6:有没有"2023 版"或"第一版"?
没有。三轮精确检索(MICCAI 2024 官方 challenge 列表、Grand Challenge 平台全量列表、odelia.ai 项目年报)均无 2023/2024 挑战赛痕迹;2023 年是 EU 项目启动年,2025 挑战赛为首届。
B. 数据与获取
Q7:数据到底多少例?
741 例检查、741 名女性(一妇一检),乳房级标签 1,482 侧。引用口径以此为准(= 论文 v3 + HF split 实测);新闻口径 511+231=742 属挑战赛期叙事,1 例差未解释。
Q8:六个中心是哪些?
CAM(Cambridge University Hospitals,英国)、MHA(Mitera Hospital,雅典)、RSH(Ribera Hospital,瓦伦西亚)、RUMC(Radboudumc,奈梅亨)、UKA(RWTH Aachen 大学医院)、UMCU(UMC Utrecht)——英、希、西、荷、德五国,每中心 31~250 例。
Q9:采集时间跨多久?为什么这么长?
2006 年 12 月至 2024 年 5 月,约 17 年半。跨越多代扫描设备与协议演化,是"真实世界异构性"的时间维度,也是刻意保留的设计。
Q10:每例影像包含什么序列?
T2 加权 1 条;DCE-T1 含 1 个 pre-contrast 期相 + 2~7 个 post-contrast 期相(期相数不定,中心间协议不同);另有 Post_1−Pre 的减影图 Sub_1。
Q11:从哪里下载、要不要申请?
HuggingFace ODELIA-AI/ODELIA-Challenge-2025,gated=auto:登录接受条款即自动获批。匿名脚本会被 401/403 拒绝。仓库总量约 304.9 GB。
Q12:default 和 unilateral 两种 config 怎么选?
default = 741 例原始分辨率的 parquet 化;unilateral = 重采样 0.7×0.7×3.0 mm、中线切分左右乳、裁剪/padding 到 256×256×32,共 1,482 侧。
跑分类基线用 unilateral;要做自定义预处理(如冠军那样用分割定位)可从 default 出发。
C. 标注与任务
Q13:三分类的精确定义?
0=No lesion(无可见强化病灶);1=Benign lesion(有强化病灶且活检或两年随访证实良性);2=Malignant lesion(强化病灶经病理或随访证实恶性,含恶性非肿块强化 NMCE)。
Q14:Ground truth 由谁、怎么确认?
各中心专家放射科医生,依据组织病理(histopathology)或 2 年影像随访。没有第三种判定通道。
Q15:原始标注是三类吗?
不是,初始五类:No lesion / Benign / Malignant-DCIS / Malignant-Invasive / Malignant-Unknown;发布时三个恶性亚型因样本量不足聚合为一类。
Q16:同侧既有良性又有恶性怎么标?
记恶性(恶性优先)。标签语义是"该侧最严重发现",不是病灶清单。
Q17:双侧标签是独立的吗?
打分独立(Lesion_Left / Lesion_Right 各一列),但统计上强相关——切分与检验必须按患者聚合,防止左右乳泄漏(官方五折即患者级无重叠)。
Q18:附带的临床元数据有哪些?
只有年龄(天)、机构代码、切分/fold 信息。没有 BI-RADS、病灶位置大小、分子分型、病史、人口学变量。
D. 挑战赛
Q19:挑战赛的时间线?
2025-06-03 训练数据发布 → 06-16 pre-evaluation 开放 → 07-31 final 截止 → 08-15 出分 → 09-23 Deep-Breath workshop @ MICCAI 2025(韩国大田)收官。
Q20:赛制怎么设计?
两阶段:pre-evaluation(test 集中 50 例极端子集、3 次试跑、交约 3 页方法摘要)→ final(每队 1 次、完整 test 集)。只收 Docker 全自动方法、离线运行、T4 16GB、单例 5 分钟。
Q21:排名怎么算?
AUC、Sens@90%Spec、Spec@90%Sens 三项各自排名后取名次平均;平局比 AUC。总分 0.769 是名次的平均,不是任何指标的数值。
Q22:多少人参赛、结果如何?
95 名注册者、24 国;预评测后 7 队进入 final。冠军 DivideAndConquer(DKFZ)总分 0.769、AUC 0.897;亚军 BCN-AIM;季军 agaldran;holdout 上所有模型性能下降。
Q23:冠军方案的核心思路?
两阶段 Divide-and-Conquer:降采样 + 自训左右乳分割模型出 bounding box → 高分辨率 ROI 上 nnU-Net 式分类(ResEncL 骨干、MAMMA-MIA 预训练、warm-up 微调、batch size=1、背景掩蔽)。内部五折 0.776。
代码 MIC-DKFZ/MeisenMeister 全开源。
Q24:冠军用外部数据了吗?
用了两个:AMBL(含良性,直接并入,+0.026)与 Duke(仅恶性,改造成二分类任务)。二值化方案最终不如常规三分类(0.757 vs 0.776),说明"给良性留独立预测路径"更稳。
E. 评估与结果
Q25:官方基线是什么模型?
Medical Slice Transformer(MST):DINOv3 逐切片特征 + attention 聚合成卷级预测;输入 Pre+Sub_1+T2;单卡 L40S 约 1 小时训完。
权重 HF ODELIA-AI/MST、代码 GitHub mueller-franzes/odelia_breast_mri 双公开。
Q26:基线成绩?
In-Distribution:Macro AUC 79.0±1.3%、Micro AUC 87.4±0.8%、Sens@90%Spec 68.4±2.4%、Spec@90%Sens 63.3±3.2%。
Out-of-Distribution(RSH 整中心留出):Macro AUC 63.1%、Spec@90%Sens 26.7%。
Q27:泛化鸿沟为什么重要?
它把"跨中心会掉点"从口头警告变成可引用的官方对照表:同分布 79.0% vs 未见中心 63.1%,特异度@90%灵敏度近乎归零(26.7%)——筛查场景"人人报警"式失效的定量标本。
Q28:加 T2 序列一定更好吗?
不。冠军消融显示 Pre+Post_1+Post_2(0.649)优于加 T2(0.584);但官方基线 MST 的输入含 T2。通道配置与架构/预处理耦合,必须自行消融。
Q29:holdout 是什么、结果如何?
组织方扣下 231 例(含第六中心数据)不公开,赛后检验泛化用。结论:所有 final 队伍在 holdout 上性能下降——多站点/多厂商数据 variability 的官方实锤。
Q30:现在还能"参赛"吗?
挑战赛已收官(官网明示新参赛者不再有获奖资格);GC 平台的提交通道状态以官网实时显示为准,复现研究直接用公开数据+官方协议即可。
Q30a:0.769 和 0.897 哪个该写进论文?
两个都写、各标口径:0.769 = 三指标名次平均(挑战赛排名语境),0.897 = 冠军 AUC(指标语境)。只写其一都会被审稿人要求补全。
Q30b:holdout 的 231 例现在公开了吗?
从 HF 当前全量 741 例(472+119+150)与挑战赛期 511 例的差值看,赛后释放的正是原 holdout 部分(test split 150 例已在 API 实测中确认);但"231 例=哪些 UID"的逐例映射官方未给对照表,做严格复刻时需自行用机构字段对齐。
F. 库内与工程
Q31:和库内 duke-breast-mri(440) 怎么互补?
Duke:922 例、单中心、仅恶性、像素级标注——病灶级深研究。ODELIA:741 例、六中心、三分类、检查级——筛查场景分类与泛化研究。冠军论文把 Duke 作外部数据并入训练,示范了两者联合用法。
Q32:库内还有哪些乳腺相关条目可串联?
X 线侧:vindr-mammo(543)、cbis-ddsm(541)、inbreast(542)、tn-mammo-breast-density(628)、swiss-mammo(627)、cmmd(544)、brax(187);病理侧:bach(118)、bracs(138)、breastpathq(268);MRI 侧:i-spy(432)。
Q33:Parquet 接入的技术要点?
图像为 int16 多维数组内嵌 + 4×4 float64 affine 列;post 期相列数按最长 7 配置、缺失期相需按例判断;split_default.csv / split_unilateral.csv 在仓库根目录。
HF 主站不通时可走 hf-mirror.com 镜像(gated 仓库下载需 token 实测)。
Q34:想复现挑战赛协议要做什么?
数据换成 .mha(参考 example-case-nii-and-mha)→ Docker 化推理 → 按 GC 运行时约束(离线、T4 16GB、单例 5 分钟)压测 → 逐乳输出三分类 → 按 AUC/Sens@90%Spec/Spec@90%Sens 三指标计算。
example-algorithm/ 是官方模板起点。
Q35:商用要用怎么办?
公开许可仅 CC BY-NC 4.0(非商业);商用无公开授权通道,需自行联系 ODELIA 联盟(EIBIR 协调方)洽谈。
Q36:一句话给准备入坑的工程师?
先注册 HF 拿 gated 权限、按官方 split 跑 unilateral 三分类基线对齐 MST 的 79.0%/63.1% 两个锚点,再做自己的方法——跳过对齐步骤的"涨点"没有参照系。
FAQ 增补(第七批:采集与工程细节)
Q37:数据里有几种扫描仪厂商?
三家主流厂商并存:GE(CAM 两个子集)、Siemens(MHA、RUMC)、Philips(RSH、UKA、UMCU);场强覆盖 1.5T 与 3T。MHA 一家就有 MAGNETOM Skyra/TrioTim/Prisma_fit/Avanto 四种机型。
Q38:DCE 的 post 期相数为什么是 2~7?
逐中心协议不同:CAM-BRAID1 约 2 期、CAM-TRICKS 4~5 期(view sharing 特殊协议)、MHA 4 期(一例 3 期)、RSH 5 期、RUMC 4~5 期、UKA 4~5 期、UMCU 7 期——合计区间即官方"2~7 个 post"。
Q39:数据里的对比剂有哪些?
钆布醇(Gadobutrol/Gadovist)、钆特酸(Gadoteric acid/Clariscan)、多它灵(Dotarem)三种;注射速率 1~3 mL/s,25~30 mL 盐水冲管——连对比剂种类都未统一,这正是"真实世界"的含义。
Q40:UKA 的数据有什么特殊性?
它是唯一采用 2D DCE 采集的中心(TR 262.7±19.8 ms、翻转角 90°、每卷 25~31 层,与其余中心的 3D GR 截然不同);同时它贡献了最多的良性例。跨中心消融时 UKA 常是最"刺头"的一个折。
Q41:T2 序列各中心一致吗?
不一致:全部为 SE 家族但除 RSH(3D)外均为 2D;仅 UMCU 常规压脂;层厚 1.5~4 mm;RSH 的 TE 365±5 ms 是 3D T2 特征值。这解释了冠军方案"加 T2 反而掉分"的部分原因——T2 的跨中心一致性最差。
Q42:CAM 为什么算两个子集?
CAM 贡献了 BRAID1(GE SIGNA Artist 1.5T,筛查路径)与 TRICKS(GE DISCOVER MR750 3T,症状路径,含 view sharing 动态协议)两个独立采集子集,硬件、场强、协议全部不同——论文 Table S1/S2/S3 都按七列(而非六列)呈现。
Q43:伦理审批是什么状态?
逐中心独立取得:CAM 四个 IRAS 项目号(122652/251317/143891/260281)、MHA 2023-01-30 信函、RSH 23/430-E、RUMC 2024-17192、UKA EK 24-087 (23-006);UMCU 因数据完全匿名化于 2024-03-05 获豁免。
Q44:PatientID 能跨例追踪患者吗?
论文明确一妇一检(741 例=741 名女性),PatientID 实际与 UID 一一对应;它存在的意义是保证切分协议"患者级无重叠"的可执行性,而非纵向研究。
Q45:挑战赛数据与当前 HF 数据是同一份吗?
不完全:挑战赛期公开 511 例(holdout 231 例含第六中心数据未释放);赛后 HF 更新(lastModified 2025-10-19)释放至全量 741 例(train 472/val 119/test 150)。
做"挑战赛复刻"时应按论文口径重切而非直接用当前 test split。
Q46:parquet 里的图像为什么是 int16?
原始 NIfTI 即 16-bit 无符号整型存储;parquet 化只是容器变换、未动数值类型——这与医学影像"保灰阶动态范围、不做 8-bit 压缩"的惯例一致。
Q47:affine 矩阵为什么单独存一列?
NIfTI 的空间定位信息(方向、原点、spacing)在 parquet 化时无法内嵌进图像数组,故拆成 4×4 float64 列(Affine_Pre、Affine_Post_1…);丢失它就丢失解剖方位,左右侧判断会出错。
Q48:有没有官方的参赛代码模板?
有:HF 仓库 example-algorithm/ 是 GC 官方示例算法(Docker 模板),data_to_unilateral_example_script.py 与 compute_sub_example_script.py 是官方预处理/减影脚本;evaluation-method/ 说明评测实现——四件套覆盖"输入格式→预处理→提交→评测"全链路。
G. 快速判断
Q49:我只想跑个 baseline 发论文,选哪条路?
unilateral config + 官方五折 + 复现 MST 锚点(79.0/63.1),方法部分做自己的改动——这是成本最低且审稿人可复核的路径。
Q50:做多中心泛化研究,该拿哪个对照当"靶子"?
RSH 整中心留出的 OOD 设定(63.1%)——它是官方定义好的 hardest split,你的方法打不过 63.1 就没有叙事资格。
Q51:数据量不够想加外部数据,有什么已验证的组合?
冠军验证过 AMBL(+良性谱系)与 DUKE(二值化改造)两条路;注意 DUKE 没有"良性"标签,三分类任务下二值化方案反而略逊(0.757 vs 0.776)。
Q52:这个数据集能做"影像+文本"多模态吗?
不能——没有报告文本发布;库内 brax(187) 等条目才是影像-文本对的正确选择。
事实清单(硬事实 49 条)
- 挑战赛官方名:ODELIA Breast MRI Challenge 2025
- 数据集 HF 官方卡名:ODELIA Challenge Dataset
- 仓库:HuggingFace ODELIA-AI/ODELIA-Challenge-2025
- 数据论文:A European Multi-Center Breast Cancer MRI Dataset,arXiv:2506.00474(v1 2025-05-31 / v2 2025-12-24 / v3 2026-05-21)
- acronym 展开:ODELIA = Open Consortium for Decentralized Medical Artificial Intelligence
- 上位项目:EU Horizon Europe,grant agreement No 101057091,DOI 10.3030/101057091
- 项目期:2023-01-01 至 2027-12-31(EC 签字 2022-11-17)
- 项目总成本 €8,691,755.75,EU 出资 €8,691,755.00
- 协调机构:EIBIR(维也纳,奥地利)
- 联盟规模:12 伙伴机构、8 国(论文 v3 口径;官网首页 7 国为冲突口径)
- 项目协调:Peter Gordebeke(EIBIR);科学协调:Daniel Truhn(UKA)与 Jakob N. Kather(TU Dresden EKFZ)
- 数据规模:741 例检查 = 741 名女性,一妇一检
- 平均年龄 54±11 岁
- 采集窗口:2006-12 至 2024-05
- 六中心:CAM(英)、MHA(希腊)、RSH(西班牙)、RUMC(荷兰)、UKA(德国)、UMCU(荷兰),五国
- 每中心贡献 31~250 例;CAM 含筛查+症状两个子集
- 影像构成:每例 T2w 1 条 + DCE-T1(1 pre + 2~7 post)+ Sub_1 减影
- 存储格式:16-bit 无符号 NIfTI(.nii.gz),标准化命名 Pre/Post_n/Sub_1/T2
- unilateral 配置:重采样 0.7×0.7×3.0 mm,中线分侧,裁剪/padding 至 256×256×32 voxels
- 患者级标签分布:291 无病灶 / 146 良性 / 304 恶性
- 乳房级标签分布:978 无病灶 / 195 良性 / 309 恶性(合计 1,482)
- 标签编码:0=No lesion、1=Benign、2=Malignant(恶性优先)
- 原始五类标注(含 DCIS/浸润/未知亚型)发布前聚合为三类
- ground truth 通道:组织病理或 2 年随访
- HF default config split:train 472 / val 119 / test 150(≈64%/16%/20%)
- unilateral config split:944 / 238 / 300(= 741×2 侧)
- 五折分层交叉验证,患者级无重叠
- 仓库总存储 304,885,769,330 字节 ≈ 304.9 GB;createdAt 2025-05-15;lastModified 2025-10-19
- License:CC BY-NC 4.0(论文 Usage Notes 与 HF cardData 双源一致)
- 获取方式:gated=auto(登录接受条款自动审批)
- 挑战赛数据发布 2025-06-03,final 截止 2025-07-31,出分 2025-08-15,Deep-Breath workshop 2025-09-23(MICCAI 2025,韩国大田)
- MICCAI 官方在册:DOI 10.5281/zenodo.15075569
- 参赛规模:95 注册者 / 24 国;7 队进入 final
- 评测:AUC + Sens@90%Spec + Spec@90%Sens 三指标名次平均;Docker 离线、T4 16GB、单例 5 分钟;pre-evaluation 用 50 例极端子集
- 冠军:DivideAndConquer(DKFZ,MeisenMeister 两阶段流水线),总分 0.769、AUC 0.897,奖金 1,000€;冠军论文 arXiv:2510.27326
- 亚军:BCN-AIM(巴塞罗那,SwinUNETR,arXiv:2508.20621);季军:agaldran;holdout 上全员掉分
- holdout:231 例(含第六中心数据),挑战赛期未公开;新闻公开口径 511 例
- 官方基线:MST(DINOv3+attention),ID Macro AUC 79.0±1.3%、Micro 87.4±0.8%;OOD(RSH 留出)63.1±3.5%、Spec@90%Sens 26.7±6.9%
- 配套资产:基线代码 mueller-franzes/odelia_breast_mri、权重 ODELIA-AI/MST、冠军代码 MIC-DKFZ/MeisenMeister、亚军代码 smriti-joshi/bcnaim-odelia-challenge
- 无期刊正式版(截至 2026-09,dblp 收 CoRR abs/2506.00474);无 2023/2024 前版挑战赛(三轮检索证伪)
- HF default config 图像体数据为 int16 数组内嵌 parquet,affine 4×4 float64 单列
- 每中心 31~250 例;CAM 含 BRAID1(1.5T 筛查)与 TRICKS(3T 症状)两个子集
- UKA 是唯一 2D DCE 采集的中心(TR 262.7±19.8 ms、翻转角 90°)
- 对比剂三种并存:Gadobutrol / Gadoteric acid (Clariscan) / Dotarem;UMCU 注射速率 1 mL/s
- post 期相逐中心:CAM-B ~2 / CAM-T 4-5 / MHA 4 / RSH 5 / RUMC 4-5 / UKA 4-5 / UMCU 7
- 联盟内部群学习数据库 8 机构 1,013 例(D2.1 披露),大于公开集且未公开
- 挑战赛 2025-06-03 数据发布至 2025-08-15 出分约 10 周;pre-evaluation 窗口两版口径 07-17 / 07-24
- Deep-Breath workshop 由 Radboudumc 主导,是 ODELIA 成果在 MICCAI 2025 的展示出口
- HF downloads 475 / likes 12(2026-09-27 抓取),三篇 arXiv 论文(数据集/冠军/亚军)构成引用基座
术语表(40 条)
| 术语 | 全称/原文 | 释义 |
|---|---|---|
| ODELIA | Open Consortium for Decentralized Medical AI | EU 群学习医疗 AI 项目,本数据集上位项目 |
| Swarm Learning (SL) | 群学习 | 各节点本地训练、仅交换参数的去中心化协同训练范式 |
| DCE | Dynamic Contrast-Enhanced | 动态对比增强 MRI:注射对比剂后多时相采集 |
| Pre/Post-contrast | 对比剂前/后 | DCE 期相的时间位置 |
| Subtraction (Sub) | 减影 | Post_1 − Pre 逐体素相减,凸显强化 |
| T2w | T2-weighted | T2 加权序列,形态学与水肿信息 |
| NMCE | Non-Mass Enhancement | 非肿块强化,一种恶性可呈现的强化形态 |
| DCIS | Ductal Carcinoma In Situ | 导管原位癌,恶性亚型之一 |
| No lesion | 无病灶 | 标签 0:无可见强化病灶 |
| Benign lesion | 良性病灶 | 标签 1:经病理/随访证实良性 |
| Malignant lesion | 恶性病灶 | 标签 2:经病理/随访证实恶性 |
| Ground truth | 金标准 | 病理或 2 年随访支撑的专家标签 |
| Unilateral | 单乳配置 | 中线切分左右乳的统一重采样格式 |
| Original | 原始配置 | 保留原始分辨率的标准化命名格式 |
| Affine | 仿射矩阵 | 4×4 矩阵,保存体数据的空间定位 |
| NIfTI | Neuroimaging Informatics Technology Initiative | 医学影像存储格式(.nii.gz) |
| MHA | MetaImage Header | GC 平台推理输入的体数据格式 |
| DICOM | Digital Imaging and Communications in Medicine | 医学影像原始传输/存储标准 |
| PACS | Picture Archiving and Communication System | 医院影像归档系统 |
| Voxels | 体素 | 三维像素,256×256×32 为单乳裁剪目标 |
| MIP | Maximum Intensity Projection | 最大密度投影,3D 压维为 2D 的方法(亚军方案输入) |
| RoI | Region of Interest | 感兴趣区域(冠军方案两阶段裁剪目标) |
| nnU-Net | — | 自配置医学分割/训练框架(冠军分类骨干载体) |
| ResEncL | Residual Encoder Large | nnU-Net 系加大残差编码器骨干(冠军主选) |
| SwinUNETR | Swin Transformer UNETR | 基于 Swin Transformer 的 3D 医学分割/分类骨干(亚军主选) |
| MST | Medical Slice Transformer | 官方基线:DINOv3 切片特征 + attention 聚合 |
| DINOv3 | — | Meta 自监督视觉基础模型(MST 的特征提取器) |
| AUC | Area Under the ROC Curve | ROC 曲线下面积,跨阈值判别力 |
| Sens@90%Spec | Sensitivity at 90% Specificity | 特异度固定 90% 时的灵敏度 |
| Spec@90%Sens | Specificity at 90% Sensitivity | 灵敏度固定 90% 时的特异度 |
| Holdout | 预留集 | 挑战赛期扣发的 231 例泛化检验集 |
| Gated dataset | 门控数据集 | 需登录接受条款后获取的 HF 数据集发布形态 |
| MIP(补) | Maximum Intensity Projection | 3D 体数据沿深度方向取最大值的压维手段 |
| Warm-up | 学习率预热 | 训练初期从小学习率线性升至目标的调度策略 |
| Linear probing | 线性探测 | 冻结骨干、只训线性分类头的迁移评估法 |
| View sharing | 视图共享 | MRI 动态采集的欠采样重建技巧,期相间隔不均 |
| BI-RADS | Breast Imaging Reporting and Data System | 乳腺影像报告与数据系统(0-6 类评估体系) |
| Domain shift | 域偏移 | 训练与部署数据分布不一致的现象(本数据集的核心研究主题) |
| Micro/Macro AUC | — | 多任务 AUC 的两种平均:合并样本(micro)vs 任务均权(macro) |
| Pre-evaluation | 预评测 | 挑战赛 final 前的资格赛阶段(50 例极端子集、3 次机会) |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| slug | odelia |
| 站内 URL | https://www.qianfanghub.com/ai-ready-dataset/odelia/655 |
| 数据集名 | ODELIA Challenge Dataset(ODELIA-AI/ODELIA-Challenge-2025) |
| 数据论文 | arXiv:2506.00474(v3 2026-05-21) |
| 挑战赛官网 | https://odelia2025.grand-challenge.org/ |
| 联盟官网 | https://odelia.ai/ |
| 规模 | 741 例 / 741 女性 / 1,482 乳侧 |
| 任务 | 双侧乳房三分类(0/1/2) |
| License | CC BY-NC 4.0 |
| 获取 | HF gated=auto |
| 基线锚点 | ID Macro AUC 79.0% / OOD 63.1% |
| 榜单锚点 | 冠军 0.769(名次平均)/ AUC 0.897 |
| 收录时点 | 2026-09-26/27 抓取 |
附录 B:DAIMS 评估全表
DAIMS(Data AI-Readiness Assessment for Medical Sets,医学数据集 AI-就绪度评估)五维打分(每维 0-5 分,基于本条目证据):
| 维度 | 得分 | 依据 |
|---|---|---|
| 可获取性 Accessibility | 4 | HF gated=auto 自动审批、免申请费、镜像可达;扣 1 分:需注册+token,README 登录前不可见 |
| 机器可读性 Machine-readability | 4 | Parquet + mlcroissant 元数据 + affine 字段 + 官方 split/fold;扣 1 分:变长 post 期相(2~7)需按例处理、两 config 需人工选型 |
| 任务就绪度 Task-readiness | 5 | 标签/切分/五折齐备,患者级无重叠;基线模型+权重+代码三公开;官方 ID/OOD 对照可直引 |
| 文档完备度 Documentation | 4 | 数据论文 v3 详尽(协议/伦理/统计全给);扣 1 分:期刊版缺位、README gated、挑战赛逐队分数未系统公开 |
| 合规与治理 Compliance | 4 | CC BY-NC 4.0 明确、各中心伦理批号公示、年龄最小化元数据;扣 1 分:商用通道不透明、holdout 演化口径需自行梳理 |
| 总分 | 21/25 | AI-Ready 第一梯队;短板集中在"商业授权路径"与"发布后文档一致性" |
12.6 交付前自检问题清单
- split 计数是否对上(741 / 1,482,或 472-119-150 / 944-238-300)?
- 指标实现是否逐标签二分类化后再 Macro/Micro 汇总?
- 左右侧标签与 affine 方向是否抽查过(无病灶对侧 vs 有病灶侧的分布)?
- fold 是否患者级无重叠(unilateral 侧共享患者的 fold)?
- 复跑成绩是否落在 MST 锚点附近(ID ~79.0 / OOD ~63.1)——好太多先查泄漏?
- 引用数字是否用 741(不是 511/742)、名次制总分是否标注口径?
附录 C:常见误判对照表
| 误判 | 事实 | 出处 |
|---|---|---|
| “ODELIA 数据集有 742 例” | 741 例(新闻 511+231=742 的 1 例差未解释;引用以论文 v3+HF 实测为准) | §4.3 / 坑点 1 |
| “公开数据来自五个中心” | 六中心五国;“five sites” 是挑战赛期公开子集的新闻叙事 | 坑点 2 |
| “联盟 12 伙伴 7 国” | 12 伙伴 8 国(论文 v3 + RWTH 名单可数);官网首页 7 国疑笔误 | §7.1 |
| “第一版挑战赛在 2023/2024” | 2025 为首届;2023 是 EU 项目启动年 | §4.1 / 坑点 8 |
| “总分 0.769 = 冠军 AUC” | 0.769 是三指标名次平均;冠军 AUC 是 0.897 | 坑点 7 |
| “HF 上是 NIfTI 文件” | 主数据 parquet(数组内嵌);NIfTI 仅示例目录;GC 推理输入是 .mha | 坑点 4 |
| “T2 加上总有益” | 冠军消融:加 T2 掉 6.5 个百分点;但基线 MST 用了 T2——通道是超参数 | §4.4 / 坑点 6 |
| “1,482 侧可按行随机切分” | 双侧强相关,必须按患者聚合切分(官方 fold 即患者级) | 坑点 5 |
| “标签含 DCIS/浸润亚型” | 发布版已聚合;五类仅是内部初始标注 | §3.2 |
| “这是分割数据集” | 检查级双侧标签,无分割/定位标注;分割需借冠军配套模型 | §6.3 |
| “gated=auto 意味着免登录” | 自动审批≠免登录;匿名拉取被拒 | 坑点 3 |
| “MAMA-MIA 更小所以 ODELIA 更大” | MAMA-MIA 1,506 例 > ODELIA 741 例;ODELIA 的"最大"限定语是"多中心+三分类+检查级标注"组合 | §2.6 |
附录 D:采集协议全参数速查(数据论文 Table S1/S2/S3 提炼)
DCE-T1w 动态序列逐中心参数(均值±标准差给出时表示该中心例间存在变异):
| 参数 | CAM (BRAID1) | CAM (TRICKS) | MHA | RSH | RUMC | UKA | UMCU |
|---|---|---|---|---|---|---|---|
| 厂商/机型 | GE SIGNA Artist | GE DISCOVER MR750 | Siemens Skyra/TrioTim/Prisma_fit/Avanto | Philips Achieva | Siemens | Philips Achieva/Ingenia | Philips Achieva/Ingenia |
| 场强 | 1.5T | 3T | 1.5T 与 3T | 1.5T | 1.5T 与 3.0T | — | — |
| 序列 | GR | SPGR | GR | GR | GR | GR(2D) | GR |
| 3D 采集 | 是 | 是 | 是 | 是 | 是 | 否 | 是 |
| 压脂 | 是 | 是 | 是 | 否 | 否 | 否 | 是 |
| TE [ms] | 3.4 | 3.8 | 1.7 | 3.2±0.1 | 2.0±0.3 | 4.6±0.1 | 2.1±0.4 |
| TR [ms] | 6.9±0.1 | 7.1 | 4.8 | 5.8 | 5.5±0.2 | 262.7±19.8 | 4.4±0.8 |
| 翻转角 [°] | 10 | 12 | 10 | 18 | 16.0±2.0 | 90 | 9.8±0.6 |
| 层数 | 68-116 | 112 | 104-122 | 110-130 | 144-176 | 25-31 | 106-222 |
| 层厚 [mm] | 2 | 2.8 | 2 | 2 | 1 | 3.1±0.2 | 1.9±0.1 |
| 采集矩阵 | 512 | 512 | 360-456 | 256 | 400-448 | 416-448 | 512-560 / 352-672 |
| FOV [mm] | 350 | 350-380 | 309-392 | 201-250 | 310-387 | 280-400 | 339-427 |
| post 期相数 | ~2 | 4-5(view sharing 48 期取 1/9) | 4(一例 3) | 5 | 4-5 | 4-5 | 7 |
| 单期时长 [s] | 65 | 9.4×48(有效 84) | 63/期 | 70+20,续期 70 | 114×5 | 71.67-205.42 | 83(首期 UF) |
| 对比剂 | Gadobutrol (0.1 mmol/kg) | Gadobutrol (0.1 mmol/kg) | Gadobutrol | Gadoteric acid (Clariscan) | Gadobutrol | Dotarem/Gadobutrol | Gadobutrol (0.1 mmol/kg) |
| 注射速率 | 3 mL/s | 3 mL/s | 3 mL/s | 3 mL/s(静脉差时 2) | 3 mL/s(静脉差时 2) | 3 mL/s | 1 mL/s |
| 盐水冲管 | 25 mL | 25 mL | 30 mL | 30 mL | 30 mL | 30 mL | 30 mL |
T2w 序列逐中心参数(Table S3 提炼):
| 参数 | CAM (BRAID1) | CAM (TRICKS) | MHA | RSH | RUMC | UKA | UMCU |
|---|---|---|---|---|---|---|---|
| 序列 | SE | SE | SE | SE | SE | SE | SE |
| 3D 采集 | 否 | 否 | 否 | 是 | 否 | 否 | 否 |
| 压脂 | 否 | 否 | 否 | 否 | 否 | 否 | 是 |
| TE [ms] | 88±1 | 81±1 | 87±4 | 365±5 | 107±38 | 110 | 87±19 |
| TR [ms] | 5511±1184 | 4939±1216 | 3602±194 | 2000 | 4285±733 | 3980±185 | 5544±616 |
| 翻转角 [°] | 160 | 111 | 120 | 90 | 94±19 | 90 | 90 |
| 层数 | 68-115 | 22-98 | 36-44 | 200-250 | 60 | 33-39 | 31-100 |
| 层厚 [mm] | 2 | 3.7±0.8 | 4 | 1.5 | 2.5 | 3.1±0.2 | 2.2±0.5 |
| 采集矩阵 | 512 | 512 | 416-832 | 432-528 | 320-384 | 512-672 | 256-560 |
| FOV [mm] | 350 | 320-380 | 336-405 | 300-387 | 340-360 | 280-400 | 320-429 |
注:SE = Spin Echo(自旋回波);GR = Gradient Echo(梯度回波);SPGR = Spoiled GR;PDF 双栏排版导致的列对齐风险已在 FACTS.md 存照——本表仅收录高置信度单元格,"-"表示论文未给出可对齐值。
附录 E:三支获奖队伍档案
| 名次 | 队伍 | 机构 | 方案要点 | 论文/代码 |
|---|---|---|---|---|
| 冠军 | DivideAndConquer | DKFZ 海德堡(Hamm/Kirchhoff/Rokuss/Maier-Hein) | 两阶段:分割定位 + nnU-Net 式分类(ResEncL、MAMMA-MIA 预训练、warm-up、batch=1、背景掩蔽);内部五折 0.776 | arXiv:2510.27326 / MIC-DKFZ/MeisenMeister |
| 亚军 | BCN-AIM | 巴塞罗那大学 + CVC + ICREA(Joshi/Garrucho/Osuala/Diaz/Lekadir) | 四通道 MIP + 乳腺掩膜 + SwinUNETR + 集成学习 | arXiv:2508.20621 / smriti-joshi/bcnaim-odelia-challenge |
| 季军 | agaldran | —(方案与机构未见公开论文) | — | 待核 |
附录 F:引用格式速查
引用数据集(数据论文口径):
Müller-Franzes, G., Escudero Sánchez, L., Payne, N. et al. A European Multi-Center Breast Cancer MRI Dataset. arXiv:2506.00474 (2025, v3 2026). https://doi.org/10.48550/arXiv.2506.00474 — Data: ODELIA-AI/ODELIA-Challenge-2025 (HuggingFace), CC BY-NC 4.0.
引用挑战赛(挑战赛方法学口径):
ODELIA Breast MRI Challenge 2025. Grand Challenge. https://odelia2025.grand-challenge.org/ — MICCAI 2025 challenge(DOI 10.5281/zenodo.15075569);结果发布于 Deep-Breath workshop, 2025-09-23, Daejeon.
引用冠军方案:
Hamm, B., Kirchhoff, Y., Rokuss, M., Maier-Hein, K. MeisenMeister: A Simple Two Stage Pipeline for Breast Cancer Classification on MRI. arXiv:2510.27326 (2025). https://github.com/MIC-DKFZ/MeisenMeister
引用上位项目(EU 项目口径):
ODELIA — Open Consortium for Decentralized Medical Artificial Intelligence. Horizon Europe Grant Agreement No 101057091 (2023-2027). https://doi.org/10.3030/101057091
附录 G:HuggingFace cardData 关键字段速查(API 实测)
| 字段 | 值 | 含义 |
|---|---|---|
| id | ODELIA-AI/ODELIA-Challenge-2025 | 仓库全名 |
| private / disabled | false / false | 公开可用 |
| gated | “auto” | 自动审批门控 |
| license | cc-by-nc-4.0 | CC BY-NC 4.0 |
| createdAt | 2025-05-15T12:07:49Z | 仓库创建 |
| lastModified | 2025-10-19T16:27:28Z | 最后更新(赛后释放) |
| downloads / likes | 475 / 12 | 抓取时点热度 |
| usedStorage | 304,885,769,330 B(≈304.9 GB) | 仓库总存储 |
| task_categories | image-classification | HF 任务标签 |
| size_categories | 1K<n<10K | 文件数量级标签 |
| tags | MRI, Breast, Cancer, Medical, 3D, arxiv:2506.00474 | 主题标签(含论文回链) |
| configs | default / unilateral | 双配置 |
| splits (default) | train 472 / val 119 / test 150 | 例级切分 |
| splits (unilateral) | train 944 / val 238 / test 300 | 乳侧级切分 |
| extra_gated_prompt | 存在 | 接受条款时的提示文案 |
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- breastpathq — 共享标签:医学影像 / 图像分类 / 乳腺癌 / 挑战赛数据集
- busi — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
- cbis-ddsm — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
- inbreast — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
- cmmd — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
- prostatex — 共享标签:医学影像 / MRI / 图像分类 / 挑战赛数据集
- camelyon16 — 共享标签:医学影像 / 图像分类 / 乳腺癌 / 挑战赛数据集
- bus-bra — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
- bach — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
- acouslic-ai — 共享标签:医学影像 / 图像分类 / 挑战赛数据集
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

