信息速览

FLARE 2022/2023 — 多中心腹部 CT 器官与泛癌分割挑战数据集 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | FLARE 2022/2023 挑战赛数据集 |
| 英文全称 | FLARE 2022: Fast and Low-resource semi-supervised Abdominal oRgan sEgmentation in CT;FLARE 2023: Fast, Low-resource, and Accurate oRgan and Pan-cancer sEgmentation in Abdomen CT |
| 别名/简称 | FLARE、FLARE22、FLARE23、FLARE Challenge |
| 疾病分类 | 腹部恶性肿瘤为主(ICD-11:2C12 肝细胞癌 / 2C10 胰腺癌 / 2B72 胃癌 / 2B91 结肠癌 / 2C90 肾细胞癌;正常器官标注无疾病编码,详见 §2.1) |
| SNOMED CT | 10200004 Liver / 78961009 Spleen / 15776009 Pancreas / 64033007 Kidney / 55342001 Neoplasm(详见 §2.1b) |
| 数据模态 | 3D 腹部 CT(平扫、动脉期、门脉期、延迟期) |
| AI 任务类型 | 多器官分割、泛癌病灶分割、半监督学习、少标注学习、高效推理(低显存/低耗时) |
| 样本总数 | FLARE22:2,300 例 CT(50 标注 + 2,000 无标注 + 50 验证 + 200 测试);FLARE23:训练 4,000 例(2,200 部分标注 + 1,800 无标注)+ 调优 100 例 + 隐藏测试 400 例 |
| 数据大小 | FLARE22:标注 50 例训练包 1.5 GB(Zenodo);FLARE23:全量训练数据 365 GB |
| 数据格式 | NIfTI(.nii.gz),RAS 方向,保留原始 HU 值 |
| 许可证 | 研究用途(AbdomenCT-1K 衍生标注仅限研究用途;需遵守各源数据集许可) |
| 访问级别 | 竞赛专用/申请审核(注册挑战平台 + 签署 Challenge Rule Agreement,2–4 个工作日发放下载链接) |
| DUO 标签 | NPUNCU(非商业非营利研究用途) |
| 语言 | 不适用(影像数据);挑战赛文档与论文为英文 |
| 首发日期 | 2022-03-15(FLARE22 训练数据发布) |
| 最后更新 | 2023-04-01(FLARE23 数据发布) |
| 发布机构 | FLARE Challenge Consortium(University of Toronto / University Health Network / Vector Institute 等 50+ 临床研究组) |
| 官方主页 | https://flare22.grand-challenge.org/(FLARE22);https://codalab.lisn.upsaclay.fr/competitions/12239(FLARE23) |
| 下载地址 | https://flare22.grand-challenge.org/Dataset/(FLARE22);FLARE23 经 CodaLab 注册 + 邮件申请获取 |
| DOI | 10.5281/zenodo.7860267(FLARE22 标注 50 例训练集) |
| 引用次数 | 239+(Google Scholar,FLARE22 总结论文,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 官方划分清晰、优胜队伍开源完整 pipeline、评测平台长期开放;扣分项:需签署协议申请下载、部分标签需自行设计利用策略、隐藏测试集标签不公开 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(腹部器官解剖定位、腹部常见恶性肿瘤流行病学与 ICD-11/SNOMED CT 映射)、§7 偏倚分析(多中心异质性、小器官与小病灶长尾、外部验证矩阵)。
数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。FLARE 2022/2023 要求用户注册挑战平台、签署 Challenge Rule Agreement 并通过邮件审核后获取数据,同时需遵守 TCIA、LiTS、MSD、KiTS、AbdomenCT-1K 等源数据集的各自许可条款(部分子集仅限研究用途)。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? FLARE(Fast and Low-resource semi-supervised Abdominal oRgan sEgmentation)是挂在 MICCAI 2022 与 MICCAI 2023 之下、由多伦多大学/Vector Institute 团队组织的多中心腹部 CT 分割挑战赛系列数据集。FLARE 22 提供 2,300 例 CT(其中仅 50 例带 13 器官标注、2,000 例完全无标注),FLARE 23 扩展到 4,000 例训练数据并新增泛癌病灶分割任务。它是目前公开可获取的规模最大的腹部器官 + 病灶联合分割基准之一。
为什么重要? 腹部器官分割的临床价值早已明确(器官定量、手术规划、疗效评估),但人工标注一例 CT 的 13 个器官极其耗时。FLARE 的独特之处在于把"如何用极少量标注 + 大量无标注数据"以及"如何在低显存、低耗时约束下部署"变成了官方评测指标——它评测的不只是准不准,还有快不快、省不省。挑战赛总结论文发表于《The Lancet Digital Health》(2024),器官分割中位 DSC 达 90.0%。
我能用它做什么? 训练通用腹部器官/病灶分割模型(如 nnU-Net 变体)、研究半监督与伪标签学习、做标签高效学习实验、在 4 GB 级显存约束下优化推理效率,或把它当作多中心泛化性的"试金石"——官方隐藏测试集专门采自训练中未见过的亚洲中心。
§1.1 摘要
FLARE 2022 于 2022-03-15 启动,任务为 13 个腹部器官的半监督分割:官方提供 50 例高质量标注与 2,000 例无标注训练 CT(初筛 2,332 例、人工剔除低质量后保留 2,000 例),另有 50 例在线验证与 200 例隐藏测试。数据汇集自 20+ 医学机构(挑战赛官网口径;总结论文称跨洲 50+ 临床研究组),评测指标在 DSC、NSD 之外引入运行时间与 GPU 显存-时间曲线下面积。FLARE 2023 于 2023-04-01 在 CodaLab 启动,将训练集扩至 4,000 例(2,200 例部分标注 + 1,800 例无标注),任务升级为 13 器官 + 1 个泛癌病灶类的联合分割,是首个腹部泛癌分割国际竞赛。冠军算法(级联 nnU-Net 框架)在 400 例隐藏测试集上取得器官平均 DSC 92.3%、病灶平均 DSC 64.9%,平均推理耗时 8.58 秒且显存控制在 4 GB 内。两届数据统一为 NIfTI 格式、RAS 方向、保留原始 HU 值;FLARE23 数据下载体积 365 GB。
§1.2 战略价值
维度一:半监督与标签高效学习的标准试验场。 医学影像领域"标注贵、数据多"的矛盾在腹部 CT 上尤为突出。FLARE 22 把 50 标注 vs 2,000 无标注的比例固定下来,形成了可直接对比的半监督基准;《The Lancet Digital Health》总结论文独立验证了"利用无标注数据可带来一致且实质的提升",使这一数据集成为伪标签、均值教师、一致性正则等方法论文中必引的对照基准。对于研究标签高效学习的团队,它提供了其他数据集难以企及的规模与多样性组合。
维度二:临床部署约束下的效率基准。 绝大多数分割挑战赛只评精度,导致论文模型越堆越大。FLARE 系列把"GPU 显存-时间曲线下面积、CPU 利用率-时间曲线下面积、运行时间(容忍 15 秒)与显存(容忍 4 GB)"写入官方排名方案,强制参赛者在精度与效率之间权衡。这使 FLARE 的优胜方案(级联推理、目标 spacing 放大、GPU 插值重采样、轻量学生模型)天然贴近医院实际部署条件,是"可落地模型"研究的一手参考。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标注 | 与 FLARE 的差异化 |
|---|---|---|---|---|
| FLARE 22 | 2,300 例 CT | 腹部 CT | 50 例 13 器官 + 2,000 例无标注 | 半监督设定;效率指标纳入排名 |
| FLARE 23 | 4,000 训练 + 100 调优 + 400 测试 | 腹部 CT | 2,200 例部分标注(13 器官 + 病灶 14 类中的一部分) | 首个泛癌病灶分割基准;隐藏测试来自未见亚洲中心 |
| AMOS 2022 | 500 例 CT + 100 例 MR | 腹部 CT/MR | 15 器官全监督 | 规模小一个量级;含 MR 模态 |
| WORD | 150 例 CT | 腹部 CT | 16 器官全标注 | 规模小;器官粒度更细 |
| AbdomenCT-1K | 1,000+ 例 CT | 腹部 CT | 13 器官(部分子集) | FLARE22 标注来源之一;无病灶、无无标注设定 |
| LiTS | 肝脏 + 肝肿瘤 | 腹部 CT | 肝 + 肝肿瘤 | 单器官单肿瘤;FLARE23 规模约为其 23 倍(论文口径) |
| TotalSegmentator | 大规模全身 CT | 全身 CT | 100+ 结构 | 覆盖广但腹部病灶分割非重点;为 FLARE23 数据源之一 |
§1.4 版本时间轴
| 版本 | 时间 | 关键变化 |
|---|---|---|
| FLARE 2021 | 2021 | 首届:4 个腹部器官、全监督、效率导向评测 |
| FLARE 2022 | 2022-03-15 启动,2022-09-22 公布结果 | 数据扩大 4 倍至 2,300 例;任务改半监督(50 标注 + 2,000 无标注);13 器官;资源指标改为显存-时间/CPU-时间曲线下面积 |
| FLARE 2023 | 2023-04-01 启动,2023-10-08 MICCAI 公布结果 | 训练集 4,000 例(2,200 部分标注 + 1,800 无标注);新增泛癌病灶类(标签 14);评测沿用效率导向 |
| FLARE 2024 | 2024 | 系列延伸(新任务方向),与本条目主体两届数据独立 |
§1.5 典型应用场景
- 通用腹部器官分割模型研发:以 50 例标注起步训练 nnU-Net 系模型,再以 2,000 例无标注做半监督扩展,产出覆盖 13 器官的通用模型。官方与优胜方案证明该路线可达中位 DSC 90.0%,且模型可跨洲迁移。
- 半监督/伪标签算法研究:官方固定了标注/无标注比例,方法对比公平,是 SSL 方向论文的标准对照。伪标签蒸馏、均值教师、一致性正则等主流范式都能在此找到直接可比的基准数字。
- 泛癌病灶分割与长尾学习:FLARE23 的病灶类覆盖肝癌、肾癌、胃癌、胰腺癌、结肠癌等多种腹部癌症,适合研究小目标与长尾分布下的分割;病灶平均 DSC 64.9% 意味着提升空间与研究价值都很大。
- 低资源推理与模型压缩:官方 4 GB 显存 + 15 秒容忍阈值可直接作为模型剪枝、蒸馏、级联设计的验收标准;冠军方案的级联 + 蒸馏组合是现成的工程蓝图。
- 多中心泛化评估:用官方隐藏测试集(未见亚洲中心)或外部数据(AMOS、WORD)检验模型的跨中心稳健性;官方三洲外部验证范式可直接复用到你自己的模型。
- 教学与入门:Zenodo 公开的 50 例标注包(1.5 GB)让课程作业与新手练习零门槛——无需申请即可完整体验"3D 医疗影像加载 → 训练 → 评测"全流程。
§2 医学背景
§2.1 ICD-11 编码表
FLARE 的核心标注对象是正常腹部器官(解剖结构,无疾病编码)与泛癌病灶。与病灶分割任务相关的腹部常见恶性肿瘤 ICD-11 编码如下:
| 病灶来源癌症 | ICD-11 编码 | ICD-11 中文名 |
|---|---|---|
| 肝细胞癌 | 2C12 | 肝细胞癌 |
| 胰腺癌 | 2C10 | 胰腺癌 |
| 胃癌 | 2B72 | 胃癌 |
| 结肠癌 | 2B91 | 结肠癌 |
| 肾细胞癌 | 2C90 | 肾细胞癌 |
说明:FLARE23 官方将病灶类定义为"覆盖各种腹部癌症类型的单一肿瘤类(标签 14)",不区分癌种;上表用于帮助研究者理解数据中病灶的疾病谱,而非数据自带的分类标签。
§2.1b SNOMED CT 映射表
| 标签对象 | ICD-11 关联 | SNOMED CT 码 | SNOMED 术语 |
|---|---|---|---|
| 肝(标签 1) | 2C12 肝细胞癌宿主器官 | 10200004 | Liver structure(肝结构) |
| 右肾(标签 2) | 2C90 肾细胞癌宿主器官 | 64033007 | Kidney structure(肾结构) |
| 脾(标签 3) | — | 78961009 | Spleen structure(脾结构) |
| 胰(标签 4) | 2C10 胰腺癌宿主器官 | 15776009 | Pancreatic structure(胰结构) |
| 主动脉(标签 5) | — | 399812005 | Aortic structure(主动脉结构) |
| 下腔静脉(标签 6) | — | 244414003 | Inferior vena cava structure(下腔静脉结构) |
| 右肾上腺(标签 7) | — | 23451007 | Adrenal structure(肾上腺结构) |
| 左肾上腺(标签 8) | — | 23451007 | Adrenal structure(肾上腺结构) |
| 胆囊(标签 9) | — | 28231004 | Gallbladder structure(胆囊结构) |
| 食管(标签 10) | — | 32849002 | Esophageal structure(食管结构) |
| 胃(标签 11) | 2B72 胃癌宿主器官 | 69695003 | Stomach structure(胃结构) |
| 十二指肠(标签 12) | — | 72050030 | Duodenal structure(十二指肠结构) |
| 左肾(标签 13) | 2C90 肾细胞癌宿主器官 | 64033007 | Kidney structure(肾结构) |
| 泛癌病灶(标签 14,FLARE23) | 2B–2C 腹部恶性肿瘤 | 55342001 | Neoplasm(肿瘤,形态学异常) |
§2.2 疾病简介与流行病学
腹部是多个高发癌种的原发部位。FLARE23 官方指出,结直肠癌与胰腺癌分别是全球第 2 与第 3 大癌症死因;CT 扫描为癌症患者提供重要预后信息,并被广泛用于治疗监测。在临床试验与日常实践中,放射科医师基于二维手工测量(如 RECIST 标准)评估器官与肿瘤,主观性带来显著的观察者间与观察者内变异——这正是自动分割要解决的痛点。从器官维度看:肝、双肾、脾等大器官在 CT 上边界清晰,深度学习已接近人类水平(FLARE23 冠军器官平均 DSC 92.3%);而胰、食管、肾上腺等小器官以及异质性极强的泛癌病灶(64.9%)仍是公认难题。FLARE 的 13 器官选择来自临床需求(如肝切除规划、肾体积评估、放疗靶区勾画),并刻意纳入了形状复杂、表现多变的高难度器官。
逐器官/结构的临床语境:
| 标注对象 | 临床语境 | 分割难度来源 |
|---|---|---|
| 肝 | 肝切除术/移植规划、肝体积定量、肿瘤负荷评估 | 体积大但邻近多器官,病灶挤压致形变 |
| 双肾 | 肾功能体积评估、肾肿瘤手术规划 | 左右对称结构,标签易互换 |
| 脾 | 脾肿大分级、血液病随访 | 体积变异大,切缘与胃/肾毗邻 |
| 胰 | 胰腺癌早筛、手术规划 | 形状多变、边界模糊、小目标 |
| 主动脉/下腔静脉 | 血管钙化评估、介入规划 | 细长管状、走行变异 |
| 双侧肾上腺 | 增值病灶筛查(腺瘤/增生) | 极小(约 4–5 cm³)、形态细碎 |
| 胆囊 | 胆石/胆囊炎评估 | 充盈状态不定,可缺如 |
| 食管 | 放疗 OAR 勾画 | 管壁塌陷、走行长、与 air/组织对比低 |
| 胃 | 胃癌/溃疡评估 | 充盈与内容物差异极大 |
| 十二指肠 | 放疗 OAR、胰十二指肠手术 | 与胰头缠绕、边界难分 |
| 泛癌病灶(标签 14) | RECIST 疗效评估、肿瘤负荷监测 | 多癌种多期相、小病灶长尾 |
§2.3 临床任务定义
- 器官定量与监测:自动体积测量(如肝体积、脾体积)用于肝切除术规划、门脉高压随访;FLARE22 总结论文即以"pan-cancer abdominal organ quantification(泛癌腹部器官定量)"为目标表述。
- 肿瘤疗效评估(RECIST 辅助):病灶自动分割可替代手工二维测量,为 RECIST 评估提供可重复的三维体积与径线测量,降低观察者间变异。
- 放疗靶区与器官危及体积(OAR)勾画:13 器官列表与放疗临床的 OAR 集合高度重合,模型输出可直接接入放疗计划流程做自动勾画预填。
- 筛查与诊断辅助:门脉期/动脉期增强 CT 中的病灶检出(标签 14)可辅助肝、肾、胰腺等占位的初筛,但小病灶漏检风险高(见 §7.3)。
§2.4 患者人群
| 维度 | FLARE 2022 | FLARE 2023 |
|---|---|---|
| 数据来源 | 20+ 医学机构(挑战赛官网);总结论文称跨洲 50+ 临床研究组 | 40+ 国际医疗中心 + 公共数据集(TCIA、LiTS、MSD、KiTS、autoPET、TotalSegmentator、AbdomenCT-1K) |
| 采集时间 | 各源中心历史扫描(具体年份未公开) | 同左,多厂商多期相混合 |
| 年龄分布 | 未公开 | 未公开 |
| 性别分布 | 未公开 | 未公开 |
| 种族/地域 | 跨洲(北美、欧洲、亚洲;外部验证队列按洲划分) | 训练与调优集多中心混合;隐藏测试集来自未见过的亚洲中心 |
| 就医类型 | 综合医院腹部 CT 检查(含肿瘤与非肿瘤病例) | 同左,病灶子集覆盖肝癌、肾癌、胃癌、胰腺癌、结肠癌等 |
数据集以影像为中心发布,未随数据提供患者级人口学元数据(年龄、性别、种族字段不存在于发布文件中),上表"未公开"条目无法从数据本身恢复;进行亚组公平性分析时需依赖外部标注或机构合作。
§2.5 临床价值
FLARE 系列的胜出方案已证明:在仅 50 例标注 + 2,000 例无标注条件下,算法可达到中位 DSC 90.0% 的 13 器官分割精度,并在北美、欧洲、亚洲三个外部队列保持 88.5%–90.0% 的中位 DSC——这一"少标注 + 跨洲稳健"的组合直接指向真实医院场景:新医院无需重新大规模标注即可部署通用腹部分割模型。器官定量结果可服务于肝体积测算、脾肿大分级等场景;泛癌病灶分割则瞄准 RECIST 自动化与肿瘤负荷纵向监测。需要注意:官方总结同时承认小器官与病灶"仍是未解决问题",任何临床转化都必须经过院内自有数据的前瞻验证。
§2.6 金标准参考表
| 划分 | 标注方式 | 标注者 | 性质 |
|---|---|---|---|
| FLARE22 训练标注集(50 例) | 人工逐层勾画 + 公共数据复用(CT 与胰腺标注来自 MSD,其余器官标注来自 AbdomenCT-1K) | 医学专业人员(符合 RTOG 共识专家组指南与 Netter 解剖图谱) | 参考标准 |
| FLARE22/23 器官标注 | 依据 RTOG 共识专家组指南 + Netter 解剖图谱;标注工具含 ITK-SNAP、nnU-Net 辅助、MedSAM 辅助 | 医学专业人员(多中心贡献 + 官方团队清洗) | 参考标准 |
| FLARE23 病灶标注(训练集) | 直接沿用源数据集已有病灶标注(不完整,仅标注部分肿瘤) | 各源数据集标注协议 | 弱参考标准(部分标注) |
| FLARE23 调优/测试集病灶 | 所有可见病灶人工标注 | 1 名资深放射科医师(ITK-SNAP + MedSAM 辅助) | 参考标准 |
| FLARE22/23 隐藏测试集 | 官方持有,不公开标签 | 官方团队 | 盲测参考标准 |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 快速跑通半监督器官分割 baseline | FLARE22(先下载 50 例标注包) | 1.5 GB 起步 | 标注包体积小、标签完整(13 类全标注)、与 AMOS 等基准可比 |
| 研究部分标签/泛癌病灶分割 | FLARE23 | 365 GB | 唯一含泛癌病灶类的公开腹部基准;部分标注结构最具挑战 |
| 标签高效学习(SSL/半监督)方法论文 | FLARE22 | 2,300 例全量 | 标注/无标注比例固定,与《The Lancet Digital Health》结果直接可比 |
| 低资源推理、模型压缩、蒸馏 | FLARE22 或 FLARE23 | 均可 | 官方效率指标(15 s / 4 GB 容忍)提供现成验收标准 |
| 多中心泛化评估 | FLARE23 | 365 GB | 隐藏测试集明确采自未见亚洲中心,泛化设计最激进 |
| 教学演示、课程作业 | FLARE22 标注 50 例包 | 1.5 GB | 免申请(Zenodo 公开)、单卡可训 |
§3.1 模态详情
单模态三维腹部 CT。FLARE23 覆盖 GE、Philips、Siemens、Toshiba 四大厂商设备,期相包含平扫、动脉期、门脉期与延迟期,层厚与重建核各异(体素间距跨度 0.44–8.0 mm,见 §3.9)。所有体数据保留原始 Hounsfield Unit 值,方向统一为 RAS(第一轴左→右、第二轴后→前、第三轴下→上),文件为 NIfTI(.nii.gz)。FLARE22 训练集强度分布(前景全体):中位 123 HU、均值 92 HU、0.5% 分位 −975 HU、99.5% 分位 231 HU,极值 −1,024 至 1,204 HU。
§3.2 按子集样本数
| 子集 | FLARE 2022 | FLARE 2023 |
|---|---|---|
| 训练集(有标注) | 50 例(13 器官完整标注) | 2,200 例(部分标注:器官/病灶子集) |
| 训练集(无标注) | 2,000 例 | 1,800 例 |
| 调优/在线验证集 | 50 例(带标签,在线评测) | 100 例(带标签,在线评测,每日最多 3 次提交) |
| 隐藏测试集 | 200 例 | 400 例(来自未见亚洲中心) |
| 合计 | 2,300 例 | 4,500 例(总结论文口径约 4,650 例) |
§3.3 数据格式
| 项 | 规格 |
|---|---|
| 文件格式 | NIfTI(.nii.gz,单文件压缩) |
| 命名规则 | 影像以 _0000 后缀结尾(如 FLARE22_Tr_0001_0000.nii.gz),标签无后缀(如 FLARE22_Tr_0001.nii.gz) |
| 方向 | RAS(canonical),即第一轴左→右、第二轴后→前、第三轴下→上 |
| 强度 | 原始 HU 保留,官方未做归一化 |
| 标签编码 | FLARE22:0 背景 + 1–13 器官;FLARE23:0 背景 + 1–13 器官 + 14 病灶 |
| 标注文件组织 | images/ 与 labels/ 分目录平行放置 |
§3.4 存储大小
FLARE22 的 50 例标注训练包(FLARE22Train.zip)为 1.5 GB(Zenodo,md5 f6b1a257deb8ad98eb901328b0762cc4);2,300 例全量数据经挑战赛官网发放。FLARE23 训练数据下载体积为 365 GB(官方 CodaLab 页面口径),解压后建议预留至少 500 GB 磁盘(含解压临时空间与预处理缓存)。FLARE23 训练集共 1,241,146 张二维切片,以典型 3D nnU-Net 管线预处理后缓存体积通常与原始数据同量级。
§3.5 标注方式
- 器官标注:人工标注为主,遵循放疗肿瘤学组(RTOG)共识专家组指南与 Netter 解剖图谱;标注与清洗流程结合 ITK-SNAP 手工工具、nnU-Net 与 MedSAM 辅助。FLARE22 的 50 例标注集复用了 MSD 的 CT 与胰腺标注、AbdomenCT-1K 的其余器官标注。
- 病灶标注:FLARE23 训练集的病灶标注直接沿用源数据集(如 LiTS、KiTS 等公共肿瘤标注),不完整——有病灶标注的病例中也只标注了部分肿瘤;调优与测试集的病灶由 1 名资深放射科医师对所有可见病灶人工标注。
- 无标注数据:FLARE22 的 2,000 例无标注 CT 由初筛 2,332 例人工剔除低质量(明显伪影、扫描不全)后保留;官方另为 FLARE23 参赛者提供了 FLARE22 最优算法生成的器官伪标签(可选使用)。
标注工具链一览:
| 环节 | 工具/协议 | 作用 |
|---|---|---|
| 手工勾画 | ITK-SNAP | 器官与测试病灶逐层人工标注 |
| 协议依据 | RTOG 共识专家组指南 + Netter 解剖图谱 | 统一器官边界定义(放疗临床口径) |
| 辅助标注 | nnU-Net、MedSAM | 模型辅助预分割 + 人工修正 |
| 病灶真值(调优/测试) | 资深放射科医师 | 所有可见病灶人工标注 |
| 质量规范 | EQUATOR + BIAS 挑战赛报告规范、MICCAI 提案同行评审 | 流程制度化约束 |
§3.6 标注者资质与一致性
器官标注由医学专业人员按 RTOG 共识指南执行(该指南为放疗临床的器官勾画规范),数据清洗由官方核心团队完成;FLARE23 测试/调优病灶由 1 名资深放射科医师完成。官方未发布逐例标注者数量与标注者间一致性系数统计——这是该数据集标注质量的已知信息缺口,研究者应把小器官(双侧肾上腺实测体积仅约 4–5 cm³)边界视为存在固有不确定性。挑战赛提案经过 MICCAI 同行评审并遵循 EQUATOR 与 BIAS 挑战赛报告规范,整体流程有制度化质量约束。
§3.7 采集周期
数据为多中心历史扫描的汇编:FLARE22 于 2022 年 3 月发布(发布前完成 2,332 → 2,000 例清洗),FLARE23 于 2023 年 4 月发布。逐例扫描日期未随数据公开,无法还原真实采集时间窗;按源数据集推断,最早可追溯至 TCIA/LiTS/MSD 时代的扫描,跨约十年。需要时间维度的纵向研究不适合直接使用本数据集。
§3.8 地域覆盖
跨洲多中心:官方外部验证队列按北美(中位 DSC 89.4%)、欧洲(90.0%)、亚洲(88.5%)三组报告;挑战赛共同体成员机构含中国的多家医院与高校、韩国首尔国立大学医院、荷兰拉德堡德大学医学中心、德国癌症研究中心(DKFZ)等。FLARE23 的隐藏测试集刻意采自训练中未见的亚洲中心,形成最强的跨中心泛化测试。
§3.9 设备规格
| 项 | FLARE 2022 | FLARE 2023 |
|---|---|---|
| 厂商 | 多厂商(未逐例公开) | GE、Philips、Siemens、Toshiba |
| 期相 | 多期相混合 | 平扫、动脉期、门脉期、延迟期 |
| 体素间距(mm) | min (0.64, 0.64, 2.5) / median (0.74, 0.74, 2.5) / max (0.77, 0.77, 5.0) | min (0.44, 0.44, 0.45) / median (0.82, 0.82, 2.5) / max (1.0, 3.0, 8.0) |
| 矩阵尺寸 | 512×512,层数 71–113(中位 97、均值 106) | 中位 512×512×134,最小 (512, 79, 24),最大 (796, 512, 2471) |
§3.10 深度溯源链
- 源医院:40+ 国际医疗中心的腹部 CT 扫描(多厂商、多期相)。
- 公共仓库:TCIA、LiTS、MSD、KiTS、autoPET、TotalSegmentator、AbdomenCT-1K(均在各自许可允许范围内引入)。
- 官方清洗与标准化:FLARE 团队统一转换为 NIfTI、RAS 方向、保留 HU;FLARE22 剔除 332 例低质量数据;器官标注遵循 RTOG 指南。
- 分发渠道:grand-challenge.org(FLARE22)、CodaLab + 邮件审核(FLARE23)、Zenodo(FLARE22 标注 50 例包,DOI 10.5281/zenodo.7860267)。
- 成果链:《The Lancet Digital Health》2024(FLARE22 总结)、arXiv 2408.12534(FLARE23 总结)、LNCS 论文集(Springer,DOI 10.1007/978-3-031-23911-3)。
§4 数据结构
§4.0 目录树
FLARE22 解压后目录结构(官方压缩包):
FLARE2022
├── Training
│ ├── FLARE22_LabeledCase50
│ │ ├── images
│ │ │ ├── FLARE22_Tr_0001_0000.nii.gz
│ │ │ ├── FLARE22_Tr_0002_0000.nii.gz
│ │ │ └── ... (共 50 例)
│ │ └── labels
│ │ ├── FLARE22_Tr_0001.nii.gz
│ │ ├── FLARE22_Tr_0002.nii.gz
│ │ └── ... (共 50 例)
│ ├── FLARE22_UnlabeledCase1-1000
│ │ ├── Case_00001_0000.nii.gz
│ │ └── ... (1,000 例无标注)
│ └── FLARE22_UnlabeledCase1001-2000
│ ├── Case_01001_0000.nii.gz
│ └── ... (1,000 例无标注)
├── Tuning
│ ├── images (FLARETs_0001_0000.nii.gz ... 50 例)
│ └── labels (FLARETs_0001.nii.gz ... 50 例)
└── Testing
├── FLARETs_0001_0000.nii.gz
└── ... (200 例,无标签)
FLARE23 目录结构(训练集为扁平 images/ + labels/):
FLARE23
├── imagesTr
│ ├── FLARE23_Tr_0001_0000.nii.gz
│ └── ... (4,000 例,其中 2,200 例有对应标签)
├── labelsTr
│ ├── FLARE23_Tr_0001.nii.gz (部分标注:仅含该例被标注的类别,其余为 0)
│ └── ... (2,200 例)
├── imagesVal
│ └── ... (100 例调优集影像)
├── labelsVal
│ └── ... (100 例调优集标签)
└── testing
└── ... (400 例隐藏测试影像,标签官方持有)
注意:FLARE23 各例标签文件中"未标注类别写入 0(背景)",与"该类别确认为背景"语义不同——这是部分标注数据集的核心结构特征,详见 §4.5 与坑点 1。
§4.1 DAIMS 字段字典
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| case_id | string | 病例唯一标识(文件名主干) | FLARE22_Tr_0001 | 索引、交叉引用、防泄漏去重 | 无 | 不适用 | FLARE22_Tr_0001–0050;Case_00001–02000;FLARETs_0001–0400 |
| image | 3D 体数据(.nii.gz) | CT 体数据,RAS 方向,保留原始 HU | FLARE22_Tr_0001_0000.nii.gz | 模型输入 | 个别中心含伪影(官方已人工剔除 332 例) | 不适用 | HU 约 −1,024 至 1,204 |
| mask | 3D 标签体(.nii.gz) | 器官/病灶分割标注 | FLARE22_Tr_0001.nii.gz | 监督信号 | 小器官边界不确定性 | 0 = 背景或未标注(见 §4.5) | FLARE22:0–13;FLARE23:0–14 |
| organ_label | 整数类别 | 13 器官类别编码 | 1(肝) | 类别加权、逐类评测 | 类间体积差异极大(肝 3,016 cm³ vs 肾上腺 4 cm³) | 未标注 = 0 | 1–13 |
| lesion_label | 整数类别 | 泛癌病灶类(仅 FLARE23) | 14 | 病灶分割、实例指标评测 | 仅部分肿瘤被标注 | 无病灶标注 ≠ 无病灶 | 14 |
| split | string | 官方划分归属 | Training / Tuning / Testing | 复现官方评测 | 不适用 | 不适用 | 3 个枚举值 |
| spacing | 3×float(mm) | 体素物理间距 | (0.74, 0.74, 2.5) | 重采样目标、各向异性处理 | 厂商/期相间差异大 | 不适用 | FLARE22 轴向 2.5–5.0;FLARE23 0.45–8.0 |
| hu_percentiles | float | 强度分位(0.5%/99.5%) | −975 / 231 | 归一化参数(nnU-Net 风格) | 期相与增强扫描差异 | 不适用 | 前景全体 −1,024 至 1,204 |
§4.2 标签分布
FLARE22 训练标注集(50 例)逐器官覆盖与实测体积:
| 器官(标签值) | 覆盖占比均值 | 实测体积均值(cm³) | 备注 |
|---|---|---|---|
| 肝(1) | 7.14% | 3,016 | 最大器官 |
| 右肾(2) | 3.84% | 1,632 | — |
| 脾(3) | 0.47% | 201 | — |
| 胰(4) | 0.56% | 237 | 形状多变 |
| 主动脉(5) | 0.22% | 94 | 管状结构 |
| 下腔静脉(6) | 0.22% | 94 | 管状结构 |
| 右肾上腺(7) | 0.20% | 86 | 小器官 |
| 左肾上腺(8) | 0.01% | 4–5 | 极小目标 |
| 胆囊(9) | 0.08% | 33 | 可不显影 |
| 食管(10) | 0.04% | 16 | 最难管状结构之一 |
| 胃(11) | 0.82% | 332 | 充盈状态差异大 |
| 十二指肠(12) | 0.18% | 76 | — |
| 左肾(13) | 0.47% | 201 | — |
FLARE23 的 2,200 例部分标注集内部结构(参赛团队逐例统计,OpenReview 技术报告口径):
| 子组 | 例数 | 已标注类别 |
|---|---|---|
| 全标注组 | 250 | 14 类全部(13 器官 + 病灶) |
| 六类组 | 1,062 | 肝、右肾、脾、胰、左肾 + 病灶 |
| 仅病灶组 | 888 | 仅病灶(14) |
| 无标注组 | 1,800 | 无 |
§4.3 关键统计
- FLARE22 训练集体素间距:中位 (0.74, 0.74, 2.5) mm,面内分辨率 0.64–0.77 mm,存在各向异性(层厚/面内约 3–4 倍)。
- FLARE22 前景强度:中位 123 HU、均值 92 HU、标准差 172、0.5%/99.5% 分位 −975/231 HU。
- FLARE23 训练集共 1,241,146 张二维切片;病灶体积与分割精度强相关,体积 <100 的病灶 DSC 高度离散(近 0 至 80%+)。
- FLARE23 冠军算法器官平均 DSC 92.3%、病灶平均 DSC 64.9%——两个任务的难度差距约 27 个百分点。
FLARE22 逐器官 HU 强度统计(50 例标注集,openmedlab 社区统计口径):
| 器官(标签值) | HU 中位数 | HU 均值 | HU 标准差 | HU 99.5% 分位 |
|---|---|---|---|---|
| 肝(1) | 127 | 126 | 23 | 190 |
| 右肾(2) | 183 | 167 | 53 | 247 |
| 脾(3) | 122 | 118 | 27 | 175 |
| 胰(4) | 89 | 83.5 | 35 | 159 |
| 主动脉(5) | 130 | 120 | 46 | 204 |
| 下腔静脉(6) | 107 | 108 | 34 | 190 |
| 右肾上腺(7) | 72 | 68 | 38 | 151 |
| 左肾上腺(8) | 70 | 68 | 36 | 151 |
| 胆囊(9) | 14 | 15 | 22 | 94 |
| 食管(10) | 30 | −13 | 165 | 129 |
| 胃(11) | 42 | −158 | 404 | 157 |
| 十二指肠(12) | 84 | 77 | 39 | 148 |
| 左肾(13) | 187 | 171 | 52 | 248 |
食管与胃的强度离散度极大(含气腔与内容物),归一化时切忌用逐器官统计;主动脉/下腔静脉为强化血管,期相差异直接体现在其 HU 分布上。
§4.4 数据层级
数据层级为 数据集 → 子集(Training/Tuning/Testing)→ 病例(CT 体数据)→ 切片(2D 轴位层)→ 体素。发布数据中不存在"患者 → 多次检查"的显式层级:病例 ID 为扫描级(volume-level),同一患者多次检查或同一检查多期相是否分散在不同子集官方未说明,患者级分组信息不可得。做交叉验证或外部验证时,应假定"扫描级独立"是最乐观假设(见 §5.3 泄漏讨论)。
| 层级 | 标识方式 | 规模(FLARE22 / FLARE23) | 建模含义 |
|---|---|---|---|
| 数据集 | FLARE22 / FLARE23 | 2,300 / 约 4,500 例 | 版本选择(§3.0) |
| 子集 | 目录名(Training/Tuning/Testing) | 见 §3.2 | 复现官方协议 |
| 病例(扫描) | case_id(文件名主干) | 2,300 / 约 4,500 | 独立切分单位(最乐观假设) |
| 切片 | 体数据第三维索引 | 中位 97 / 134 层 | 2D 预训练、伪标签生成粒度 |
| 体素 | (X, Y, Z) 索引 | 512×512 为主 | 损失与指标计算粒度 |
§4.5 缺失值与信息性缺失编码
| 现象 | 编码/表现 | 正确解读 |
|---|---|---|
| 体数据无标注文件(无标注子集) | 仅 images/ 无 labels/ | 设计如此(半监督/SSL 用途),非数据缺陷 |
| 标签体某器官类别全为 0(FLARE23 部分标注) | 该类别未标注,写入背景 | 不等于该器官不存在;不可当作负样本直接训练 |
| 标签体病灶类全为 0(FLARE23 仅器官组) | 病灶未标注 | 不等于无病灶;病灶类别需特殊损失/掩码策略 |
| 测试集无标签 | Testing/ 无 labels 目录 | 盲测设计,标签官方持有 |
| 胆囊个别病例不可见 | 部分病例切除或未显影,标签中无该类 | 生理性缺失;评测按逐类掩码处理 |
§5 划分与使用建议
§5.1 官方划分
| 版本 | 训练 | 调优/验证 | 测试 | 测试特性 |
|---|---|---|---|---|
| FLARE22 | 50 标注 + 2,000 无标注 | 50(在线评测,可见标签) | 200 | 隐藏标签,Docker 提交统一评测 |
| FLARE23 | 2,200 部分标注 + 1,800 无标注 | 100(在线评测,每日 ≤3 次) | 400 | 隐藏标签,且来自训练未见的亚洲中心 |
§5.2 社区惯例与策略建议
- 有标注集内部交叉验证:对 FLARE22 的 50 例或 FLARE23 的 2,200 例部分标注集做 5 折交叉验证是参赛队主流做法(nnU-Net 默认 5 折);报告均值 ± 标准差。
- 验证集采样:从有标注集分层抽 10%–20% 作内部验证,保证每折覆盖全部 13 器官(小器官例数少,需分层而非随机)。
- SSL 评测:固定"50 例标注 + 全部无标注"复现 FLARE22 设定,或按比例抽取标注子集(1%、5%、10%、100%)绘制标签效率曲线。
- 病灶子集训练:FLARE23 常见做法是先在 250 例全标注组训练大模型,为其余病例生成伪器官标签,再与病灶真值合并训练(冠军方案思路)。
§5.3 泄漏风险
- 源数据集重叠:FLARE23 训练集包含 MSD、KiTS、LiTS、TotalSegmentator 的数据。若你在这些数据集上做过预训练,再在 FLARE23 上报告"零样本/少样本"结果,即构成隐性泄漏。缓解:预训练数据与 FLARE23 训练集做 case 级排除,或只用 FLARE 官方提供的伪标签。
- 两代数据重叠:FLARE22 数据是 FLARE23 训练集的子集来源之一。跨代比较(如"在 FLARE22 训练、在 FLARE23 测试")不成立。
- 患者级重复风险:同一患者的多期相扫描或多次检查可能分布在不同子集;做训练/验证切分时建议按"病例组"切分而非随机切切片。
- 调优集过拟合:FLARE23 允许每日 3 次在线提交,频繁按 100 例调优集调参会造成隐性过拟合;官方以 400 例隐藏测试做最终排名正是为此。
§5.4 交叉验证建议
5 折交叉验证 + 按器官覆盖分层;对 FLARE23 建议在全标注组(250 例)内交叉验证后,用最优折模型为部分标注组生成伪标签,最后在全量 2,200 例上微调并保留独立内部测试子集。禁止把 Tuning 集(100 例)当训练数据。
分层切分参考实现:
# 按"是否含病灶标注 + 是否全 14 类标注"分层做 5 折切分(FLARE23 示意)
import numpy as np
from pathlib import Path
from collections import Counter
import nibabel as nib
from sklearn.model_selection import StratifiedKFold
labels_dir = Path("data/FLARE23/labelsTr")
groups = []
for msk_path in sorted(labels_dir.glob("*.nii.gz")):
uniq = set(np.unique(np.asanyarray(nib.load(msk_path).dataobj)).tolist()) - {0}
has_lesion = 14 in uniq
n_organs = len(uniq - {14})
groups.append("full14" if (has_lesion and n_organs == 13)
else ("lesion6" if has_lesion else "lesion_only"))
skf = StratifiedKFold(n_splits=5, shuffle=True, random_state=42)
for fold, (tr, va) in enumerate(skf.split(groups, groups)):
print(fold, Counter(np.array(groups)[va])) # 每折均含三种标注组
§5.5 外部验证建议
推荐外部集:AMOS 2022(CT 部分,500 例,15 器官)、WORD(150 例,16 器官)、AbdomenCT-1K 保留集。外部评测时注意:AMOS 含 MR 模态需剔除;各数据集标签空间与 FLARE 不完全一致(AMOS 15 器官、WORD 16 器官),需先做类别映射矩阵,仅在与 FLARE 13 类一致的类别上计算 DSC,并注明映射规则。
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
FLARE22 标注 50 例训练包(1.5 GB)在 Zenodo 公开,可直接下载到 Colab/Kaggle 单卡环境完整跑通"加载 → 训练 → 评测"闭环,无需申请流程;FLARE23 全量(365 GB)建议在本地工作站或云主机(≥500 GB 磁盘)操作,Kaggle 磁盘上限不足以容纳解压 + 缓存。
# Colab/Kaggle 一键起步:下载 → 校验 → 解压(约 5 分钟)
!pip -q install nibabel
!curl -L -o /content/FLARE22Train.zip "https://zenodo.org/record/7860267/files/FLARE22Train.zip"
!echo "f6b1a257deb8ad98eb901328b0762cc4 /content/FLARE22Train.zip" | md5sum -c -
!unzip -q /content/FLARE22Train.zip -d /content/data/FLARE2022/
# 解压后即可运行 §6.1 的快速上手代码
§6.1 快速上手
# 快速上手:加载 FLARE22 标注 50 例子集并做最小可视化验证
# 目录结构预期(data_root 指向解压后的 FLARE2022 根目录):
# data_root/
# └── Training/FLARE22_LabeledCase50/
# ├── images/FLARE22_Tr_0001_0000.nii.gz ← 影像,文件名 = case_id + "_0000"
# └── labels/FLARE22_Tr_0001.nii.gz ← 标签,文件名 = case_id(无 _0000)
# data_root 拼接关系:image_path = data_root/Training/FLARE22_LabeledCase50/images/{case_id}_0000.nii.gz
# mask_path = data_root/Training/FLARE22_LabeledCase50/labels/{case_id}.nii.gz
# 最小可用子集:仅这 50 例标注即可启动训练(其余 2,000 例无标注供 SSL 进阶使用)
import nibabel as nib
import numpy as np
from pathlib import Path
data_root = Path("data/FLARE2022/Training/FLARE22_LabeledCase50")
case_id = "FLARE22_Tr_0001"
img = nib.load(data_root / "images" / f"{case_id}_0000.nii.gz")
msk = nib.load(data_root / "labels" / f"{case_id}.nii.gz")
img_np = np.asanyarray(img.dataobj) # 形状 (X, Y, Z),原始 HU
msk_np = np.asanyarray(msk.dataobj).astype(np.uint8)
print("影像形状:", img_np.shape, "体素间距:", img.header.get_zooms())
print("标签取值:", np.unique(msk_np)) # 应在 0-13 范围内
print("HU 范围:", img_np.min(), img_np.max()) # 应约 -1024 至数千
# 校验方向为 RAS:仿射矩阵对角线应接近正值
print("仿射矩阵:\n", img.affine)
§6.2 数据获取
| 步骤 | FLARE 2022 | FLARE 2023 |
|---|---|---|
| 平台 | grand-challenge.org | CodaLab |
| 入口 | flare22.grand-challenge.org/Dataset/ | codalab.lisn.upsaclay.fr/competitions/12239 |
| 条件 | 注册账号 + Join 挑战 | 注册 + 签署 Challenge Rule Agreement 发送至 MICCAI.FLARE@aliyun.com |
| 审核时长 | 自动/即时 | 2–4 个工作日 |
| 体积 | 标注 50 例包 1.5 GB(Zenodo 公开镜像);全量经官网 | 365 GB |
| 辅助资格 | Docker 提交资格需先过 playground(Mean DSC > 0.3)+ 录制推理视频 | 每队一个 Entry Number |
下载校验建议(Zenodo 标注包):
# Zenodo 公开的 FLARE22 标注 50 例训练包
curl -L -o FLARE22Train.zip "https://zenodo.org/record/7860267/files/FLARE22Train.zip"
md5sum FLARE22Train.zip # 期望: f6b1a257deb8ad98eb901328b0762cc4
unzip FLARE22Train.zip -d data/FLARE2022/
365 GB 级下载务必使用支持断点续传的工具(如 aria2c -x16),并预先确认磁盘配额;下载中断与文件损坏是社区最高频的工程问题之一(见坑点 8)。
§6.3 预处理全流程
以下流程复刻 FLARE 参赛队伍的标准管线:HU 裁剪 → z-score 归一化 → 各向异性重采样。裁剪与归一化参数取自参赛队论文对 FLARE22 数据的统计(0.5% 分位 −970.0 HU、99.5% 分位 279.0 HU、均值 80.3、标准差 141.4)。
# 预处理:HU 裁剪 + z-score + 各向异性重采样
# 输入输出均为 NIfTI;重采样目标 spacing 依 nnU-Net 自动规划,
# 参赛队实践:attention nnU-Net 面内目标 spacing [0.8164, 0.8164](层厚自动),
# 小型加速模型放大至 [4.0, 1.2, 1.2] mm 牺牲精度换速度(见坑点 6)。
import numpy as np
import nibabel as nib
from scipy.ndimage import zoom
HU_LOW, HU_HIGH = -970.0, 279.0 # FLARE22 数据 0.5%/99.5% 分位(参赛队论文口径)
MEAN, STD = 80.3, 141.4
def preprocess(ct_path: str, out_path: str, target_spacing=(0.8, 0.8, 2.5)):
img = nib.load(ct_path)
data = np.asanyarray(img.dataobj).astype(np.float32) # (X, Y, Z) HU
spacing = np.array(img.header.get_zooms()[:3], dtype=np.float32)
# 1) HU 裁剪:抑制空气/金属极值
data = np.clip(data, HU_LOW, HU_HIGH)
# 2) z-score 归一化(用数据集级统计,非逐例统计)
data = (data - MEAN) / STD
# 3) 各向异性重采样(order=1 线性插值;标签务必用 order=0 最近邻)
scale = spacing / np.array(target_spacing, dtype=np.float32)
data = zoom(data, zoom=scale, order=1)
out = nib.Nifti1Image(data, affine=img.affine)
out.header.set_zooms((*target_spacing,))
nib.save(out, out_path)
return data.shape
preprocess("data/FLARE2022/Training/FLARE22_LabeledCase50/images/FLARE22_Tr_0001_0000.nii.gz",
"cache/FLARE22_Tr_0001_0000.nii.gz")
标签重采样必须用最近邻插值(order=0),否则标签值会被插值成非法浮点类别(见坑点 3)。对无标注子集不做任何标签操作;FLARE23 的部分标注在重采样后仍需保持整数类别。
两阶段伪标签 SSL 管线骨架(复刻冠军方案 aladdin5 / 季军 blackbean 的共同思路):
# 阶段一:在约 250 例全标注组上训练大模型(教师),产出器官伪标签
# 阶段二:器官伪标签 + 病灶真值合并 → 训练第二教师 → 全量 4,000 例伪标签
# 阶段三:小模型(学生)在全量伪标签上训练,满足 4 GB/15 s 部署约束
def build_stage2_dataset(full_label_cases, lesion_cases, organ_teacher):
merged = []
for case_id, mask in lesion_cases: # 有病灶真值的病例
organ_pseudo = organ_teacher.predict(case_id) # 教师补全器官通道
merged.append((case_id, fuse(organ_pseudo, mask))) # 仅缺失通道用伪标签
return merged # 真值通道保持不变
def fuse(organ_pseudo, lesion_gt):
out = organ_pseudo.copy()
out[lesion_gt == 14] = 14 # 病灶真值优先
return out
# 关键纪律:伪标签只填补"缺失通道",绝不覆盖已有真值;
# 病灶伪标签噪声大,官方与多篇参赛报告均建议病灶通道谨慎使用伪标签。
§6.4 PyTorch DataLoader 完整代码
<details>
<summary>完整可运行的 FLARE22 Dataset + DataLoader 代码(点击展开)</summary>
# 依赖: pip install nibabel torch numpy
# 目录预期: data_root/Training/FLARE22_LabeledCase50/{images,labels}
# 最小可用子集: 50 例标注即可训练;unlabeled 目录可自行扩展为 SSL 数据集
import numpy as np
import nibabel as nib
import torch
from torch.utils.data import Dataset, DataLoader
from pathlib import Path
class FLARE22Dataset(Dataset):
"""FLARE22 标注 50 例子集;中心裁剪到固定 patch 尺寸做 3D 分割训练。"""
def __init__(self, data_root: str, patch_size=(96, 96, 96), hu_clip=(-970.0, 279.0)):
self.case_dir = Path(data_root) / "Training" / "FLARE22_LabeledCase50"
self.cases = sorted(p.name.replace("_0000.nii.gz", "")
for p in (self.case_dir / "images").glob("*_0000.nii.gz"))
self.patch = patch_size
self.hu_clip = hu_clip
def __len__(self):
return len(self.cases)
def _load(self, case_id: str):
img = np.asanyarray(nib.load(self.case_dir / "images" / f"{case_id}_0000.nii.gz").dataobj)
msk = np.asanyarray(nib.load(self.case_dir / "labels" / f"{case_id}.nii.gz").dataobj)
img = img.astype(np.float32)
img = (np.clip(img, *self.hu_clip) - 80.3) / 141.4 # 数据集级归一化
return img, msk.astype(np.uint8)
def __getitem__(self, idx: int):
case_id = self.cases[idx]
img, msk = self._load(case_id)
# 中心裁剪 patch;真实训练建议改为随机偏移 + 超界补零
start = [max(0, min(c, s - p)) for c, s, p in
zip([s // 2 for s in img.shape], img.shape, self.patch)]
sl = tuple(slice(start[i], start[i] + self.patch[i]) for i in range(3))
img_p = np.zeros(self.patch, dtype=np.float32)
msk_p = np.zeros(self.patch, dtype=np.uint8)
vi = tuple(slice(0, min(self.patch[i], img.shape[i] - start[i])) for i in range(3))
img_p[vi] = img[sl][vi]
msk_p[vi] = msk[sl][vi]
return torch.from_numpy(img_p[None]), torch.from_numpy(msk_p.astype(np.int64)), case_id
if __name__ == "__main__":
ds = FLARE22Dataset("data/FLARE2022")
print(f"共 {len(ds)} 例标注病例")
loader = DataLoader(ds, batch_size=2, shuffle=True, num_workers=4)
for img_b, msk_b, ids in loader:
print(img_b.shape, msk_b.shape, ids) # torch.Size([2,1,96,96,96]) ...
break
</details>
FLARE23 部分标注的关键配套件——逐例损失掩码(对应坑点 1 的"简单方法"):
# 思路:Dataset 额外返回 present_classes(该例已标注类别集合的 one-hot),
# 损失只在已标注类别 + 背景上计算,未标注类别通道不回传梯度。
import torch
import torch.nn.functional as F
NUM_CLASSES = 15 # 0 背景 + 13 器官 + 14 病灶
def masked_seg_loss(logits, target, present):
"""logits: (B,15,D,H,W);target: (B,D,H,W);present: (B,15) bool,True=该例已标注。"""
# 背景永远参与损失(真背景与未标注都落在 0)
allow = present.clone()
allow[:, 0] = True
# 把"未标注类别"的像素从 cross-entropy 中剔除:将其 target 置为 -100(ignore index)
t = target.clone()
for b in range(t.shape[0]):
unknown = ~allow[b] # (15,) 该例未标注的类别
if unknown.any():
bad = torch.isin(t[b], torch.nonzero(unknown).squeeze(-1))
t[b][bad] = -100 # ignore_index
return F.cross_entropy(logits, t, ignore_index=-100)
# 配套建议:Dice 部分同样按 allow 掩码逐类计算后求均值(citi/冠军队实践的一致思路)。
§6.5 坑点 8 个
⚠️ 坑点 1:把部分标签当完整标签训练,网络学会"只预测已标注类"(分类:标签理解)
问题:FLARE23 的 2,200 例标注为部分标注(约 250 例全 14 类、1,062 例 6 类、888 例仅病灶),未标注类别被写入 0(背景)。直接训练会让模型把"未标注器官"区域学成背景,损失在部分标注上反向传播污染所有类别。
症状:训练损失正常下降,但验证集上未标注器官的 DSC 异常低甚至为 0;模型在"仅器官组"病例上把病灶通道输出为全背景,反之亦然。
解决:
- 简单方法:自定义损失掩码——对每例只在其"已标注类别集合"上计算损失,未标注类别通道不回传梯度(分割头输出 15 通道,损失前按逐例掩码屏蔽)。
- 进阶方法:按已标注类别分组采样 batch(citi 队方案),使同一 batch 内所有病例的已标注类别一致,未标注通道经 max pooling 合并进背景通道;配合不确定性筛选伪标签 + CutMix 从有病灶病例复制病灶区域。
- SOTA 方法:两阶段伪标签蒸馏——在 250 例全标注组训练大模型(如 STU-Net-L),为约 1,497 例有病灶标注病例补全器官伪标签,合并后训练大模型为全量 4,000 例生成完整伪标签,最后训练轻量学生模型(冠军 aladdin5 与季军 blackbean 的共同骨架)。
参考:aladdin5/blackbean/citi 方案总结(arXiv:2408.12534);NVIDIA SegResNet 队报告(openreview.net/pdf?id=O5mvleMVKq)——其明确记载"绕过伪标签直接在部分标注上训练的实验是徒劳的"。
⚠️ 坑点 2:小病灶 DSC 崩塌——体积 <100 的病灶成绩从近 0 到 80% 高度离散(分类:偏倚陷阱)
问题:FLARE23 病灶类呈极端长尾分布,训练集病灶标注本身不完整(仅标注部分肿瘤),小体积病灶样本稀少;冠军算法在体积 <100 的病灶上 DSC 依然从近 0 到 80%+ 剧烈波动,器官与病灶平均 DSC 相差约 27 个百分点(92.3% vs 64.9%)。
症状:整体病灶 DSC 看似尚可,逐例分析发现大量近 0 分病例;实例级 F1 中位数仅 40%(冠军队),灵敏度/特异度此消彼长(部分队伍病灶灵敏度中位数低至 20.0%)。
解决:
- 简单方法:逐例报告 DSC 分布(分位数)而非只报均值;按病灶体积分层评测。
- 进阶方法:病灶中心化采样(提高含病灶 patch 的采样概率)+ 小目标过采样;实例级指标(Precision/Recall/F1/Panoptic Quality)与语义 DSC 并报。
- SOTA 方法:合成病灶增强(官方 limitations 明确建议 synthetic lesion);不确定性驱动的伪标签筛选,剔除低置信病灶伪标签防噪声累积。
参考:arXiv:2408.12534 Fig. 4(病灶体积-DSC 关系、体积预测相关性、失败案例可视化)。
⚠️ 坑点 3:方向与 HU 处理不一致,重采样悄悄破坏评测一致性(分类:预处理陷阱)
问题:官方数据统一为 RAS 方向、保留原始 HU。若你的加载库默认做方向变换、或标签用三线性插值、或自行逐例归一化,与官方/优胜管线偏离后精度差异可达数个百分点且难以排查。
症状:同一模型复现结果比官方基线低 2%–5%;标签可视化出现 0.5 之类的灰色边界值(插值污染)。
解决:
- 简单方法:加载后断言
np.unique(mask)均为整数类别;用nib.as_closest_canonical显式统一方向;标签重采样一律order=0。- 进阶方法:固定数据集级归一化参数(0.5%/99.5% 分位 −970/279 HU,均值 80.3、标准差 141.4)写入配置,禁止逐例 z-score;保留原始 spacing 记录用于结果回写。
- SOTA 方法:直接采用 nnU-Net v2 的自动规划预处理(FLARE23 各优胜队均以其为底座),或 MONAI Auto3DSeg 的 DataAnalyzer 逐例统计已标注类别。
参考:arXiv:2408.12534(数据标准化协议节);arXiv:2310.01159(预处理参数);openreview.net/pdf?id=O5mvleMVKq(MONAI 方案)。
⚠️ 坑点 4:只报 DSC 与官方榜单不可比——排名是"精度 + 效率"的秩聚合(分类:评估误用)
问题:FLARE 官方最终排名对器官精度、病灶精度、运行时间、GPU 显存做 rank-then-aggregate,且效率容忍阈值为 15 秒运行 / 4 GB 显存。论文里只报 DSC 的方法无法与官方榜单名次直接换算;不同队伍的 DSC 差异也可能被效率差异逆转排名。
症状:你的方法 DSC 更高但综合名次低于榜单队伍(或反之);复现榜单名次时对不上号。
解决:
- 简单方法:同时报告 DSC、NSD、运行时间、显存四项,并注明评测硬件(官方为 Ubuntu 20.04 + Xeon W-2133 + Quadro RTX5000 16G + 32G 内存)。
- 进阶方法:复用官方评测脚本(Dice/NSD 计算代码随优胜仓库开源),按官方秩聚合方式自算名次。
- SOTA 方法:按官方协议在 Docker 内固定线程数与插值后端(GPU 插值)再计时,避免 I/O 抖动;bootstrap 重采样(官方用 b=1,000)报告排名稳定性(Kendall τ)。
参考:arXiv:2408.12534(Evaluation protocol 与 Ranking scheme 节)。
⚠️ 坑点 5:FLARE22 与 FLARE23 标签映射混用——器官编码顺序不同、病灶 = 14(分类:标签理解)
问题:FLARE22 的 13 器官标签为 1–13(1 肝、2 右肾、3 脾、4 胰、5 主动脉、6 下腔静脉、7 右肾上腺、8 左肾上腺、9 胆囊、10 食管、11 胃、12 十二指肠、13 左肾);FLARE23 增加病灶类 14。把 AMOS/WORD/BTCV 的类别映射习惯性套用(如把标签 2 当作左肾),会静默产生错位标签。
症状:逐类 DSC 中"右肾/左肾"成绩互换、肾上腺成绩异常;混淆矩阵呈规律性错位。
解决:
- 简单方法:建立常量字典并写单元测试,对每个标签值抽样可视化确认。
- 进阶方法:跨数据集训练时构建标签重映射矩阵(FLARE 13 类 ↔ AMOS 15 类 ↔ WORD 16 类),不一致类别置为忽略索引。
- SOTA 方法:用 MONAI 风格的显式映射 transform 管线化处理,杜绝手工索引;病灶类处理参考参赛队"非 14 → 背景、14 → 1"的二值化惯例。
参考:openmedlab Awesome-Medical-Dataset FLARE2022.md(标签逐值强度统计表证实映射);github.com/zzm3zz/FLARE2023(病灶 = 14 的处理代码)。
⚠️ 坑点 6:nnU-Net 默认配置训练约 120 小时、显存超标——"Fast and Low-resource"名副其实(分类:工程陷阱)
问题:官方数据 2,300–4,500 例、体素间距各向异性(层厚最高 8 mm),nnU-Net 默认 3D 全分辨率管线在 RTX 3090Ti 上训练约 120 小时;直接推理显存也常超 4 GB 官方容忍线。
症状:训练排期失控;Docker 评测时 OOM 或运行时间远超 15 秒;效率秩被拉低淹没精度优势。
解决:
- 简单方法:放大目标 spacing(blackbean 队小型模型用 [4.0, 1.2, 1.2] mm)+ 缩小网络(STU-Net-B 级);关闭 TTA。
- 进阶方法:级联框架——轻量二值模型先做腹腔 ROI 定位,再对裁剪区域分别做器官/病灶高分辨率分割(冠军方案);推理时 GPU 上做插值重采样、多线程预取与并行加载 checkpoint。
- SOTA 方法:大模型生成伪标签 → 小模型蒸馏(large-to-small self-training),精度损失很小而推理时间下降一个量级。
参考:arXiv:2408.12534(Best-performing algorithm 节);github.com/Ziyan-Huang/FLARE23(nnU-Netv2 推理加速前后对比);arXiv:2310.01159(120 小时训练时长记录)。
⚠️ 坑点 7:预训练数据与 FLARE 源子集重叠造成隐性泄漏(分类:数据泄漏)
问题:FLARE23 训练集整合了 TCIA、LiTS、MSD、KiTS、autoPET、TotalSegmentator、AbdomenCT-1K 的公开数据。若你的模型先在 MSD/KiTS/LiTS 上预训练、再在 FLARE23 上评测,同例数据会同时出现在"预训练集"与"评测训练集"中;FLARE22 数据又是 FLARE23 训练集子集。
症状:"少样本微调"精度高得反常;跨数据集方法对比中 FLARE 上的提升幅度与 AMOS/WORD 上不一致。
解决:
- 简单方法:预训练前对语料做 case 排除——以文件名/ID 交集为准剔除重叠例(各源数据集清单见 FLARE 论文补充材料)。
- 进阶方法:只使用官方为参赛者提供的 FLARE22 优胜算法伪标签作为无标注监督,绕开自选预训练集。
- SOTA 方法:报告"预训练语料清单 + 排除规则"作为可复现性附录;外部验证一律使用与 FLARE 无源关系的 AMOS/WORD 保留集。
参考:arXiv:2408.12534(数据来源补充表);openmedlab FLARE2023.md(数据源清单)。
⚠️ 坑点 8:365 GB 下载与协议审核卡脖子,大文件直链下载易损坏(分类:工程陷阱)
问题:FLARE23 数据需先签协议、等 2–4 个工作日审核,再从指定链接下载 365 GB;浏览器直下或无限传工具易中断损坏,NIfTI 损坏常在训练数小时后才暴露。FLARE22 全量同样经官网分卷发放。
症状:解压报错、nib.load读取失败、个别 case 形状异常;训练中途随机 crash。
解决:
- 简单方法:
aria2c -x16 -c断点续传;下载后逐文件 md5/体积校验,再跑一遍全量nib.load冒烟测试。- 进阶方法:下载脚本内嵌"文件数 + 总体积"断言(FLARE23 训练 4,000 例);异常文件自动重下队列。
- SOTA 方法:把校验通过的数据做只读挂载,预处理缓存写独立目录,避免误改源数据;CI 中加最小子集(50 例)回归测试。
参考:codalab.lisn.upsaclay.fr/competitions/12239(获取流程与体积声明);flare22.grand-challenge.org/Dataset/。
§6.6 数据增强
安全增强 ✅(不改变解剖语义):
- 随机翻转(轴位面内左右翻转必须同步交换右肾/左肾、右/左肾上腺标签,其余轴可自由翻转)
- 随机旋转/缩放(仅轴位面内,citi/SegResNet 队实践)
- 随机直方图漂移、随机对比度调整(模拟不同期相/重建核)
- 高斯噪声/模糊、Gamma 变换
- 病灶 CutMix:从有病灶标注病例裁出病灶连同周边上下文,粘贴到无病灶病例(citi 队为缓解病灶标注稀缺采用)
危险增强 ❌:
- 对标签做非最近邻插值(产生非法类别值)
- 左右翻转但不交换左右器官标签(直接制造两类系统性标签噪声)
- 过强弹性形变破坏管状结构(主动脉、下腔静脉、食管)连通性
- 对无标注数据使用需回传梯度的"假标签"增强(应配合一致性正则或伪标签)
§6.7 模型推荐
| 模型 | 类型 | 适用场景 | 关键配置 | 出处 |
|---|---|---|---|---|
| nnU-Net v2(3d_fullres) | 自配置 U-Net | 首选基线/全监督 | 默认 5 折;87% 参赛队用 Dice+CE 损失 | FLARE 各队底座 |
| 级联轻量 nnU-Net | 两阶段级联 | 效率优先部署 | ROI 二值定位 → 器官/病灶双头高分辨分割 | 冠军 aladdin5(arXiv:2408.12534) |
| STU-Net-L/B | 大-小自训练 | 伪标签蒸馏 | 大模型打标 → 小模型部署 | 季军 blackbean |
| SegResNet + Dice-Focal | ResNet 编解码 | MONAI 生态 | Auto3DSeg,5 折集成 | NVIDIA 队(OpenReview) |
| PHTrans + 均值教师 | CNN/Transformer 混合 | 半监督大容量 | 两阶段定位 + mean-teacher | 第四名 hmi306 |
| SegFormer/UNETR 级联 | Transformer | 研究性探索 | 部分卷积 + 自训练 | 第五名 hanglok |
按器官的难度预期与选型建议(基于官方成绩与器官统计):
| 难度档 | 器官/任务 | 现状 | 建议 |
|---|---|---|---|
| 基本解决 | 肝、脾、双肾、主动脉、下腔静脉 | 冠军器官平均 DSC 92.3% 的主要贡献者 | 通用模型直接复用,重点做后处理与效率优化 |
| 有难度 | 胃、胆囊、十二指肠、胰 | 充盈/形状变异导致波动 | 增强针对性采样;保留逐类评测 |
| 高难度 | 双侧肾上腺、食管 | 体积 4–16 cm³,覆盖占比 ≤0.2% | 小目标过采样 + 面内高分辨率头 |
| 开放问题 | 泛癌病灶(14) | 平均 DSC 64.9%,F1 中位 40% | 病灶中心化采样、实例级评测、合成病灶 |
§6.8 硬件需求
| 阶段 | 最低配置 | 推荐配置 | 说明 |
|---|---|---|---|
| FLARE22 标注 50 例训练 | 1×12 GB 显存 GPU,32 GB 内存 | 1×24 GB(如 RTX 4090),64 GB 内存 | 单卡 5 折可过夜 |
| FLARE23 全量训练 | 1×24 GB GPU,500 GB 磁盘 | 2×24 GB GPU,1 TB NVMe | 365 GB 数据 + 预处理缓存翻倍 |
| 官方评测复现 | Quadro RTX5000 16G + Xeon W-2133 + 32G 内存 | 同官方 | 排名可比性依赖同硬件 |
| 推理(达标线) | 4 GB 显存、单例 ≤15 秒 | 同左 | 官方容忍阈值 |
§6.9 评估指标代码
# DSC 与 NSD(Normalized Surface Dice)——FLARE 官方两个精度指标
# NSD 容差依 Metrics Reloaded 建议;病灶另评 Precision/Recall/F1/Panoptic Quality
import numpy as np
def dice(pred: np.ndarray, gt: np.ndarray) -> float:
p, g = pred.astype(bool), gt.astype(bool)
denom = p.sum() + g.sum()
return 1.0 if denom == 0 else 2.0 * (p & g).sum() / denom
def nsd(pred: np.ndarray, gt: np.ndarray, tau_vox: float = 2.0) -> float:
"""表面距离一致性;tau_vox 以体素为单位(按 spacing 换算物理容差)。"""
from scipy.ndimage import distance_transform_edt
p, g = pred.astype(bool), gt.astype(bool)
if not p.any() and not g.any():
return 1.0
if p.any() != g.any():
return 0.0
dp = distance_transform_edt(~p)
dg = distance_transform_edt(~g)
border_p = p & (dg <= tau_vox) # pred 表面落在 gt 容差带内的比例
border_g = g & (dp <= tau_vox)
return 0.5 * (border_p.sum() / max(p.sum(), 1) + border_g.sum() / max(g.sum(), 1))
# 效率指标:运行时间 + GPU 显存-时间曲线下面积(每 0.1 s 采样一次显存)
# 官方容忍:运行时间 15 s、显存 4 GB;最终名次 = 器官/病灶/效率三模块秩平均
§6.10 MLOps 笔记
- 版本化:以"数据版本(FLARE22/FLARE23)+ 标签协议版本(13 类/14 类)+ 预处理配置"三元组管理实验,防止部分标签策略变更后结果不可比。
- 数据校验 CI:入库时断言(病例数、标签值域、方向、spacing 范围),坏例在训练前拦截。
- 评测复现:容器内固定 torch/numpy/scipy 版本与线程数;效率指标对 I/O 敏感,评测机独占。
- 模型注册:按"器官 DSC / 病灶 DSC / 运行时间 / 显存"四字段登记候选模型,映射官方排名口径。
- 漂移监控:上线后按期相/厂商分桶监控 DSC;跨洲部署已被官方证明会带来 1–2 个百分点中位 DSC 波动。
- 复现实验管理:官方与优胜仓库均提供 Docker 工作流(如
docker container run --gpus "device=0" --rm -v $PWD/inputs:/workspace/inputs/ ... sh predict.sh),建议沿用同款容器契约(/workspace/inputs → /workspace/outputs)打包你的模型,方便对接各 MICCAI 挑战赛评测系统。 - 结果存档:每次评测保存"预测 mask + 逐例 DSC/NSD 表 + 硬件与时钟信息",FLARE 社区惯例是 awards 页公开全部提交细节,内部研究建议对齐该透明度。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 地域偏倚 | 训练数据以亚洲(尤中国)中心为主,欧洲/北美为辅;隐藏测试特意设为亚洲中心 | 中 | 用 AMOS/WORD/自有数据做外部验证;按洲分层评测 |
| 设备/期相偏倚 | 四大厂商 × 四期相组合多,但组合分布不均 | 中 | 期相分层采样增强;报告分桶性能 |
| 长尾偏倚 | 小器官(肾上腺约 4–5 cm³)与小病灶样本稀少,病灶体积 <100 的 DSC 高度离散 | 高 | 病灶中心化采样、过采样、合成病灶 |
| 标注偏倚 | FLARE23 病灶标注沿用源数据集且不完整(仅标部分肿瘤) | 高 | 训练时病灶损失掩码;测试集由资深放射科医师重标 |
| 口径偏倚 | 官方统计口径不一(如 FLARE23 合计 4,500 vs 论文 4,650) | 低 | 以官方表格数字为准并注明口径 |
| 元数据缺失 | 无年龄/性别/种族字段,公平性分析受限 | 中 | 与源机构合作补齐或仅做影像层面分析 |
§7.2 标注质量
器官标注遵循 RTOG 共识专家组指南与 Netter 解剖图谱,标注工具链为 ITK-SNAP(手工)+ nnU-Net/MedSAM(辅助),FLARE23 测试与调优病灶由 1 名资深放射科医师完成。官方未公布逐例标注者间一致性(Dice/κ),属已知缺口;但挑战赛提案经 MICCAI 同行评审并采用 BIAS 报告规范,《The Lancet Digital Health》总结论文亦经同行评审,参考标准的整体可信度有制度化保障。使用建议:小器官(双侧肾上腺、食管、十二指肠)与病灶边界视为"软参考",逐类评测时对 <5 cm³ 结构的分数波动保持警惕。
标注质量风险分级:
| 风险等级 | 对象 | 依据 | 使用建议 |
|---|---|---|---|
| 低 | 肝、双肾、脾等大器官 | 边界清晰、协议明确、体积大 | 可作强监督信号 |
| 中 | 胰、胃、胆囊、十二指肠 | 体积中等但边界模糊、变异大 | 监督可用,评测报告逐类分位 |
| 高 | 双侧肾上腺、食管 | 体积 4–16 cm³,人工勾画一致性天然受限 | 分数波动容忍 ±数个百分点 |
| 高 | FLARE23 训练集病灶 | 沿用源数据集且不完整(仅标部分肿瘤) | 当弱标签用;主结果以官方测试集为准 |
| 低(盲测) | 官方隐藏测试集 | 官方持有并统一评测 | 排名与结论的最终权威 |
§7.3 泛化性
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 跨洲部署(亚洲训练 → 欧美部署) | 中位 DSC 下降约 1–2 个百分点 | FLARE22 外部验证:北美 89.4% / 欧洲 90.0% / 亚洲 88.5% |
| 未见中心 + 未见癌种病灶 | 病灶 DSC 大幅下降,小病灶近 0 | FLARE23 隐藏测试(未见亚洲中心)病灶平均 DSC 64.9% |
| 极端体型/伪影/低质量扫描 | 器官边界模糊,小器官漏检 | 官方曾在清洗中剔除 332 例低质量数据,说明此类样本真实存在 |
| 单期相训练 → 多期相推理 | 病灶检出率波动 | FLARE23 覆盖平扫/动脉/门脉/延迟四期相,期相元数据未逐例公开 |
§7.4 伦理
数据来自公开数据集与已在源机构完成脱敏的临床扫描,无个人标识符;使用需签署 Challenge Rule Agreement 并遵守各源数据集许可(AbdomenCT-1K 子集仅限研究用途)。FLARE23 官方明确数据整合"based on the license permission"。二次分发受限——应引导下游用户从官方渠道获取。数据非患者级可识别影像,是否需伦理批准依使用机构规定而定;任何临床转化前需前瞻验证与监管路径。
§7.5 公平性
数据未提供患者级人口学字段,无法直接做年龄/性别/种族亚组公平性分析;地域公平性可代之以"按中心/洲"分层评测(官方外部验证即按北美/欧洲/亚洲报告)。已知风险:小病灶、小器官在长尾中代表性不足,模型对肿瘤负荷小的患者系统性偏保守(部分队伍病灶特异性高、灵敏度中位数仅 20.0%)。
§7.6 数据漂移
CT 设备迭代与扫描协议演变意味着新采集数据的 spacing/期相分布会偏离 2022–2023 年汇编的训练分布。建议:部署管线内置 spacing/期相分布监控;将官方"15 s / 4 GB"效率线作为漂移重训触发评估的一部分;对来自新中心的批量数据先做代表性抽检(分桶 DSC)再全量上线。
漂移监测清单:
| 监控维度 | 触发信号 | 建议动作 |
|---|---|---|
| 体素间距分布 | 新数据 spacing 落在训练分布(0.44–8.0 mm)之外 | 重检重采样配置;补充对应层厚数据微调 |
| 期相构成 | 门脉期占比显著变化(增强协议改变) | 按期相分桶评测病灶任务 |
| 厂商/重建核 | 新厂商进入采购 | 小样本冒烟测试 + 小器官 DSC 抽检 |
| 病灶谱系 | 新癌种/新治疗人群 | 谨慎外推标签 14;必要时人工复核 |
| 精度趋势 | 线上抽检 DSC 周环比下降超阈值 | 触发重训评估,优先补小器官/病灶样本 |
§7.7 DAIMS 数据质量评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 每例一对 image/mask NIfTI 文件,扁平目录,无嵌套表格 |
| 2 | 唯一标识 | ✅ | case_id 全局唯一(FLARE22_Tr_0001、Case_00001、FLARETs_0001 等体系) |
| 3 | 特殊字符 | ✅ | 文件名仅含字母、数字、下划线与连字符 |
| 4 | 重复行 | ✅ | FLARE22 无标注集经人工清洗(2,332 → 2,000);未见重复报告 |
| 5 | 缺失编码 | ⚠️ | 无 NaN;但部分标注把"未标注"编码为背景 0,与真背景不可区分,需语义级区分 |
| 6 | 标签标识 | ✅ | 标签 1–13 器官 + 14 病灶,逐值映射有官方文档与社区强度统计双重证实 |
| 7 | 罕见类分组 | ⚠️ | 肾上腺(约 4–5 cm³)、食管(16 cm³)极小;病灶呈长尾,需分层评测 |
| 8 | 偏倚评估 | ✅ | 官方按洲做外部验证并报告分位区间(Lancet 2024) |
| 9 | 数据字典 | ✅ | 官网 + 论文补充材料给出任务、标签与划分定义 |
| 10 | 信息性缺失解释 | ⚠️ | 部分标注机制官方有说明,但 2,200 例内部逐例分组需自行统计(社区报告 250/1,062/888/1,800) |
| 11 | 设备记录 | ⚠️ | 厂商与期相范围有公开,但逐例设备元数据未随数据发布 |
| 12 | 共线性 | ✅ | 不适用(影像体数据,无表格特征共线性问题) |
| 13 | 编码映射 | ✅ | 器官 ↔ SNOMED CT/ICD-11 映射见 §2.1;标签数值映射官方明确 |
| 14 | 时间戳处理 | ✅ | 不适用(无时间序列字段;逐例扫描日期未公开属已知限制) |
| 15 | 划分建议 | ✅ | 官方训练/调优/测试三划分清晰,测试集盲测 |
| 16 | 泄漏讨论 | ⚠️ | 源数据集重叠与患者级分组风险官方未系统讨论,需研究者自查(见 §5.3) |
| 17 | 标签分布 | ⚠️ | FLARE22 有完整逐器官统计;FLARE23 部分标注分布复杂,分布表需自行生成 |
| 18 | 测量偏倚 | ⚠️ | 标注协议统一(RTOG 指南),但标注者数量与一致性系数未公布 |
| 19 | 外部验证建议 | ✅ | 官方示范了北美/欧洲/亚洲三队列外部验证范式;AMOS/WORD 可作补充 |
| 20 | 版本记录 | ✅ | FLARE21/22/23/24 版本沿革清晰,各届任务与规模变化有案可查 |
| 21 | 预处理脚本 | ✅ | 优胜队伍开源完整 pipeline(nnU-Net 底座),官方评测代码随获奖仓库公开 |
| 22 | 合规要求 | ⚠️ | 需注册 + 签署协议 + 邮件审核获取;多源许可需逐条核对 |
| 23 | 多模态对齐 | ✅ | 不适用(单模态 CT,无跨模态对齐需求) |
| 24 | 去标识化 | ✅ | 源仓库与官方双重脱敏;发布 NIfTI 不含 DICOM 元数据 |
DAIMS 评分:16.0 / 24(✅×16,⚠️×8,❌×0)
评分解读:16/24 属于"高就绪但有结构性陷阱"档位。数据工程质量(标识、格式、划分、脚本、版本)达到顶级挑战赛水准,无硬伤项;8 个 ⚠️ 集中在"部分标注语义、病灶长尾、设备元数据缺失、许可流程"四个领域——全部是使用策略问题而非数据缺陷,均有成熟的社区解法(见坑点 1、2、7、8)。
对你意味着什么:
- 可以直接把它当主力基准投入半监督/部分标签研究,不必担心格式与标识问题——把工程精力花在损失掩码与伪标签策略上。
- 若你的课题依赖逐例设备/人口学元数据或标注者一致性量化,FLARE 无法满足,需要机构合作数据补充。
- 做多中心泛化研究请复用官方三划分 + 洲际外部验证范式;做病灶方向务必按体积分层报告,均值 DSC 会掩盖长尾失败。
- 计划 2–4 个工作日的获取审批与 500 GB 级磁盘,纳入项目排期。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| 北美外部队列 | 北美多中心(Lancet 2024) | 13 器官分割 | 中位 DSC 89.4%(IQR 85.2–91.3) | 较内部 90.0% 微降 0.6 个百分点 | 无标注数据利用的收益在跨洲设置下保持 |
| 欧洲外部队列 | 含 Radboud UMC 等欧洲中心 | 13 器官分割 | 中位 DSC 90.0%(IQR 84.3–93.0) | 与内部持平 | 欧洲队列分布区间更宽,个案波动更大 |
| 亚洲外部队列 | 含首尔国立大学医院等 | 13 器官分割 | 中位 DSC 88.5%(IQR 80.9–91.9) | 较内部降 1.5 个百分点 | IQR 最宽,提示亚洲中心间异质性最大 |
| FLARE23 隐藏测试 | 未见亚洲中心 | 13 器官 + 病灶 | 器官平均 DSC 92.3%;病灶平均 DSC 64.9% | 病灶较器官低约 27 个百分点 | 器官分割接近成熟;泛癌病灶是下一个前沿 |
§8 基准性能与生态
§8.1 排行榜
FLARE 2023 最终排名(测试集 N=400,Docker 统一硬件评测,rank-then-aggregate):
| 排名 | 队伍 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|
| 1 | aladdin5 | 级联 nnU-Net:轻量 ROI 定位 → 器官/病灶双头高分辨分割;FLARE22 最优算法伪标签扩标;GPU 插值 + 多线程推理(器官平均 DSC 92.3%、病灶平均 DSC 64.9%、平均 8.58 s、4 GB 显存内) | Ma, J. et al., 2024, arXiv:2408.12534 | 官方 awards 页开源 |
| 2 | citi | 部分监督 nnU-Net:按已标注类别分组采样、未标注通道 max-pool 入背景、不确定性伪标签筛选、病灶 CutMix | Ma, J. et al., 2024, arXiv:2408.12534 | 官方 awards 页开源 |
| 3 | blackbean | STU-Net-L 自训练:250 例全标注打标 → 约 1,497 例补全 → 全量伪标签 → STU-Net-B 高效部署;大 spacing + 免裁剪 + GPU 重采样 | Ma, J. et al., 2024, arXiv:2408.12534 | github.com/Ziyan-Huang/FLARE23 |
| 4 | hmi306 | 两阶段 PHTrans(CNN/Transformer 混合)+ 均值教师半监督 | Ma, J. et al., 2024, arXiv:2408.12534 | 官方 awards 页 |
| 5 | hanglok | SegFormer + UNETR 级联、部分卷积与自训练 | Ma, J. et al., 2024, arXiv:2408.12534 | 官方 awards 页 |
数值不可直接比较的原因:官方名次综合精度(DSC/NSD)、运行时间与显存三模块秩聚合,且不同队伍的器官/病灶子分数分布差异大;仅比较单一 DSC 会误导选型。FLARE22 届排名为 Docker 效率 + 精度综合,前五名方案均利用无标注数据获得一致提升,决赛中位 DSC 90.0%(IQR 87.4–91.3);逐队分数见挑战赛官网 awards 页与 LNCS 论文集。
两届评测协议演进对照:
| 项 | FLARE 2022 | FLARE 2023 |
|---|---|---|
| 任务 | 13 器官半监督分割 | 13 器官 + 泛癌病灶联合分割 |
| 训练数据 | 50 标注 + 2,000 无标注 | 2,200 部分标注 + 1,800 无标注 + 官方器官伪标签 |
| 提交方式 | Docker + 推理视频,playground 资格审核 | CodaLab 在线调优(每日 ≤3 次)+ Docker 终评 |
| 精度指标 | DSC、NSD | DSC、NSD + 病灶实例指标(P/R/F1/PQ) |
| 效率指标 | 运行时间、GPU 显存-时间曲线下面积、CPU 利用率-时间曲线下面积 | 运行时间(容忍 15 s)、GPU 显存-时间曲线下面积(容忍 4 GB) |
| 测试集 | 200 例隐藏 | 400 例隐藏(未见亚洲中心) |
| 排名方式 | 精度 + 资源综合 | rank-then-aggregate 三模块秩平均 + bootstrap 稳定性 |
§8.2 SOTA 总结与选型建议
- 器官分割(13 类)已接近成熟:冠军 92.3% 平均 DSC,肝/脾等大器官有效"解决";小器官与管状结构(食管)仍有改进空间。选型建议直接从 nnU-Net v2 或冠军级联框架起步。
- 泛癌病灶分割是开放问题:64.9% 平均 DSC、实例 F1 中位 40%;小病灶(体积 <100)是主要失分点。研究价值最高、基线最弱的方向。
- 效率与精度可以兼得:冠军方案证明 8.58 秒 + 4 GB 显存内可取得最高精度;蒸馏(大 → 小)与级联是两条经过验证的技术路线。
- 半监督收益真实:Lancet 论文独立确认无标注数据带来"一致且实质"的提升,是 SSL 方向的强证据。
§8.3 评测协议
官方统一硬件(Ubuntu 20.04,Intel Xeon W-2133 3.60GHz ×12 核,NVIDIA Quadro RTX5000 16G,32G 内存,500G 磁盘)顺序运行全部 Docker;精度指标 DSC + NSD(遵循 Metrics Reloaded),效率指标运行时间 + GPU 显存-时间曲线下面积(0.1 秒采样),病灶另计 Precision/Recall/F1/Panoptic Quality。效率容忍阈值:运行 15 秒、显存 4 GB。最终名次 = 精度 + 效率秩聚合,bootstrap(b=1,000)验证排名稳定性。FLARE23 开发期每日最多 3 次调优集提交 + 5 次 Docker 效率评测,测试期单次提交。
§8.4 相关数据集
| 数据集 | 规模 | 关系 | 获取 |
|---|---|---|---|
| AMOS 2022 | 500 CT + 100 MR,15 器官 | 最常用外部验证集;与 FLARE 独立但任务高度重叠 | Zenodo 公开 |
| WORD | 150 CT,16 器官 | 外部验证补充 | GitHub 公开 |
| AbdomenCT-1K | 1,000+ CT,13 器官 | FLARE22 标注来源;研究用途 | GitHub 申请 |
| MSD(胰腺/肝等任务) | 每任务数百例 | 胰腺等标注来源之一 | 官方注册 |
| LiTS | 肝 + 肝肿瘤 | FLARE23 病灶标注来源 | 官方注册 |
| TotalSegmentator | 大规模全身结构 | FLARE23 数据源;100+ 结构参考标准 | 开源 |
§8.5 关键论文 Top 8
- Ma, J., Zhang, Y., Gu, S., Ge, C., Mae, S., Young, A., Zhu, C., et al. (2024). Unleashing the strengths of unlabelled data in deep learning-assisted pan-cancer abdominal organ quantification: the FLARE22 challenge. The Lancet Digital Health, 6(11), e815–e826. DOI: 10.1016/S2589-7500(24)00154-7 —— FLARE22 官方总结:半监督设定下 13 器官中位 DSC 90.0% 与三洲外部验证。
- Ma, J., Zhang, Y., Gu, S., Ge, C., Wang, E., Zhou, Q., Huang, Z., Lyu, P., He, J., & Wang, B. (2024). Automatic Organ and Pan-cancer Segmentation in Abdomen CT: the FLARE 2023 Challenge. arXiv:2408.12534 —— FLARE23 官方总结:约 4,650 例基准、47 队 37 个有效方案、冠军级联框架与病灶长尾分析。
- Ma, J., et al. (2022). Fast and Low-GPU-memory abdomen CT organ segmentation: the FLARE challenge. Medical Image Analysis, 82, 102616 —— FLARE 系列效率导向评测的方法学奠基。
- Zhuang, J.-X., Luo, L., Chen, Z., & Wu, L. (2023). Iterative Semi-Supervised Learning for Abdominal Organs and Tumor Segmentation. arXiv:2310.01159 —— 迭代 SSL 参赛方案:伪标签双阶段与病灶伪标签噪声的失败教训。
- NVIDIA 团队 (2023). Automated segmentation of organs and tumors from partially labeled 3D CT in MICCAI FLARE 2023 Challenge. OpenReview —— SegResNet + 伪标签补全;250/1,062/888 部分标注子集的最清晰统计。
- Huang, Z., et al. (2023). Exploiting Pseudo-Labeling and nnU-Netv2 Inference Acceleration for Abdominal Multi-Organ and Pan-Cancer Segmentation. GitHub (Ziyan-Huang/FLARE23) —— 季军方案开源:nnU-Netv2 推理加速对比。
- Ma, J., et al. (2021). AbdomenCT-1K: Is Abdominal Organ Segmentation a Solved Problem? IEEE(ieeexplore.ieee.org/document/9497733)—— FLARE22 标注来源数据集与"器官分割是否已解决"之问。
- Antonelli, M., et al. (2022). The Medical Segmentation Decathlon. Nature Communications(arXiv:1902.09063)—— MSD:FLARE22 标注 50 例的 CT 与胰腺标注来源。
§8.6 社区活跃度
FLARE23 吸引 292 名参与者、47 支队伍、37 个有效 Docker 提交;优胜方案代码全部开源,官方 awards 页长期维护代码与论文链接。FLARE22 总结论文发表于《The Lancet Digital Health》并被引 239+(Google Scholar,截至 2026-09),CodaLab 评测平台在赛后保持开放可提交;社区衍生资源包括 openmedlab 数据集百科条目、多个参赛复现仓库与 AMID 等数据集工具链的内置支持(amid FLARE2022 类)。
参与入口与时间投入参考:
| 想做的事 | 入口 | 预期投入 |
|---|---|---|
| 复现官方半监督基准 | FLARE22 官网下载数据 + 优胜仓库 | 单卡数天(含 5 折训练) |
| 在线评测自己模型 | FLARE23 CodaLab 调优集(每日 ≤3 次) | 数据申请审核 2–4 个工作日 + 上传调试 |
| 参加正式排名 | CodaLab 终评 Docker 提交 | 需满足容器契约与效率约束 |
| 引用官方数字做对比 | Lancet 2024 / arXiv:2408.12534 | 直接引用中位/平均 DSC 与 IQR |
§8.7 生态快照
| 资源 | 类型 | 链接 | 活跃度(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| FLARE22 官网 + awards 页 | 挑战赛主页 | https://flare22.grand-challenge.org/ | 持续在线,获奖代码与论文长期维护 | 第一手规则、榜单与下载入口 |
| FLARE23 CodaLab | 评测平台 | https://codalab.lisn.upsaclay.fr/competitions/12239 | 赛后保持可提交 | 在线评测调优集,规则与获取流程权威 |
| FLARE22 标注 50 例包 | 数据镜像 | https://zenodo.org/record/7860267 | 累计下载 31.6 TB | 免申请、1.5 GB、单卡可训的最小可用子集 |
| openmedlab 条目 | 数据集百科 | github.com/openmedlab/Awesome-Medical-Dataset(FLARE2022/2023.md) | 社区维护 | 标签逐值强度统计与目录结构最完整 |
| Ziyan-Huang/FLARE23 | 优胜方案代码 | https://github.com/Ziyan-Huang/FLARE23 | 开源(Apache-2.0) | nnU-Netv2 推理加速 + 伪标签全流程可复现 |
| zzm3zz/FLARE2023 | 参赛方案代码 | https://github.com/zzm3zz/FLARE2023 | 开源 | 知识蒸馏 + 标签融合;病灶二值化处理范例 |
| nnU-Net v2 | 训练框架 | github.com/MIC-DKFZ/nnUNet | 医学分割事实标准 | FLARE 各队共同底座 |
| MONAI Auto3DSeg | 训练框架 | github.com/Project-MONAI/MONAI | 活跃 | DataAnalyzer 逐例统计部分标注类别 |
§9 相关资源与引用
§9.1 官方资源
- FLARE22 挑战赛主页与数据页:https://flare22.grand-challenge.org/(数据页 /Dataset/)
- FLARE23 挑战赛与评测平台:https://codalab.lisn.upsaclay.fr/competitions/12239
- FLARE22 标注 50 例训练包(Zenodo,DOI 10.5281/zenodo.7860267):https://zenodo.org/record/7860267
- FLARE22 挑战赛提案(Zenodo):https://zenodo.org/records/6362374
- FLARE22 总结论文(The Lancet Digital Health):https://doi.org/10.1016/S2589-7500(24)00154-7(预印本 arXiv:2308.05862)
- FLARE23 总结论文:https://arxiv.org/abs/2408.12534
- FLARE22 参赛方法论文集(Springer LNCS):https://link.springer.com/book/10.1007/978-3-031-23911-3
- 联系邮箱:MICCAI.FLARE@aliyun.com(FLARE23 数据申请)
§9.2 社区与第三方资源
- openmedlab Awesome-Medical-Dataset:FLARE2022.md / FLARE2023.md(标签逐值统计、目录树)
- 参赛复现仓库:github.com/Ziyan-Huang/FLARE23、github.com/zzm3zz/FLARE2023
- AMID 数据集工具链(内置 FLARE2022 类):https://neuro-ml.github.io/amid/latest/datasets-api/
- 医学影像挑战赛汇总(medicalimaging.ai FLARE22 条目):https://medicalimaging.ai/?p=2339/
§9.3 BibTeX 引用
@article{FLARE22-LDH2024,
title = {Unleashing the strengths of unlabelled data in deep learning-assisted pan-cancer
abdominal organ quantification: the FLARE22 challenge},
author = {Ma, Jun and Zhang, Yao and Gu, Song and Ge, Cheng and Mae, Shihao and Young, Adamo
and Zhu, Cheng and Yang, Xin and Meng, Kangkang and Huang, Ziyan and Zhang, Fan
and Pan, Yuanke and Huang, Shoujin and Wang, Jiacheng and Sun, Mingze
and Zhang, Rongguo and Jia, Dengqiang and Choi, Jae Won and Alves, Natalia
and de Wilde, Bram and Koehler, Gregor and Lai, Haoran and Wang, Ershuai
and Wiesenfarth, Manuel and Zhu, Qiongjie and Dong, Guoqiang and He, Jian
and the FLARE Challenge Consortium and Wang, Bo},
journal = {The Lancet Digital Health},
volume = {6},
number = {11},
pages = {e815--e826},
year = {2024},
doi = {10.1016/S2589-7500(24)00154-7}
}
@article{FLARE23-arXiv2024,
title = {Automatic Organ and Pan-cancer Segmentation in Abdomen CT: the FLARE 2023 Challenge},
author = {Ma, Jun and Zhang, Yao and Gu, Song and Ge, Cheng and Wang, Ershuai and Zhou, Qin
and Huang, Ziyan and Lyu, Pengju and He, Jian and Wang, Bo},
journal = {arXiv preprint arXiv:2408.12534},
year = {2024}
}
@article{FLARE-MedIA2022,
title = {Fast and Low-GPU-memory abdomen CT organ segmentation: the FLARE challenge},
author = {Ma, Jun and others},
journal = {Medical Image Analysis},
volume = {82},
pages = {102616},
year = {2022}
}
@dataset{FLARE22-labeled-zenodo,
title = {MICCAI FLARE22 Challenge Dataset (50 Labeled Abdomen CT Scans)},
author = {Ma, Jun},
year = {2023},
doi = {10.5281/zenodo.7860267},
url = {https://zenodo.org/record/7860267}
}
@article{FLARE22-arXiv2023,
title = {Unleashing the Strengths of Unlabeled Data in Pan-cancer Abdominal Organ
Quantification: the FLARE22 Challenge},
author = {Ma, Jun and Zhang, Yao and Gu, Song and Ge, Cheng and Ma, Shihao and Young, Adamo
and Zhu, Cheng and Meng, Kangkang and Yang, Xin and Huang, Ziyan and others},
journal = {arXiv preprint arXiv:2308.05862},
year = {2023}
}
§9.4 引用指南
- 使用 FLARE22 数据(含 50 例标注集):引用 FLARE22-LDH2024 与 FLARE22-labeled-zenodo;若使用了 MSD/AbdomenCT-1K 衍生的标注,请同时引用对应源数据集论文。
- 使用 FLARE23 数据:引用 FLARE23-arXiv2024;病灶标注源自 LiTS/MSD/KiTS 等时一并引用源数据集。
- 使用优胜方案代码:请按其仓库 LICENSE(如 Apache-2.0)与论文要求引用对应队伍。
§9.5 许可与合规速查
| 数据 | 许可/获取 | 商业使用 |
|---|---|---|
| FLARE22 标注 50 例(Zenodo) | 公开下载;CT/胰腺标注源自 MSD(署名-同方式共享类),其余器官标注源自 AbdomenCT-1K(仅限研究用途) | 受源数据集约束,默认非商业 |
| FLARE22 全量(官网) | 注册 + Join 挑战 | 研究用途 |
| FLARE23 全量(CodaLab) | 注册 + 签署 Challenge Rule Agreement + 邮件审核(2–4 个工作日) | 研究用途;整合的 TCIA/LiTS/KiTS 等子集需逐条遵守各自许可 |
| 优胜队伍代码 | 仓库 LICENSE(如 Apache-2.0) | 按仓库条款 |
§10 AI 使用声明卡
§10.1 AI 模型列表
| 模型 | 版本 | 用途 |
|---|---|---|
| CodeBuddy Code(fast-model) | 2026-09 | 条目起草、结构编排、代码示例生成 |
§10.2 AI 参与范围
AI 负责资料检索、事实整理、初稿撰写与代码示例编写;所有章节经人工审核后定稿。数字事实全部来自 §10.3 所列公开来源,检索与核对记录见同目录 FACTS.md。
§10.3 输入来源列表
- FLARE 2022 挑战赛官网(任务、规模、时间线):https://flare22.grand-challenge.org/
- FLARE 2022 数据页:https://flare22.grand-challenge.org/Dataset/
- FLARE 2023 CodaLab 竞赛页(任务、4,000 例训练集、365 GB、申请流程):https://codalab.lisn.upsaclay.fr/competitions/12239
- Ma et al. (2024). The Lancet Digital Health 6(11):e815–e826. DOI 10.1016/S2589-7500(24)00154-7(中位 DSC 90.0%、三洲外部验证、50+ 研究组、2,332→2,000 清洗)
- Ma et al. (2023). arXiv:2308.05862(FLARE22 预印本与 BibTeX)
- Ma et al. (2024). arXiv:2408.12534(FLARE23 总结:4,650 例口径、47 队/292 人、评测协议、冠军方案、病灶长尾)
- FLARE22 标注 50 例训练包(Zenodo,DOI 10.5281/zenodo.7860267,1.5 GB,md5,MSD/AbdomenCT-1K 来源声明)
- FLARE22 挑战赛提案(Zenodo record 6362374)
- openmedlab Awesome-Medical-Dataset FLARE2022.md(标签 1–13 映射、强度/覆盖统计、目录树、间距统计)
- openmedlab Awesome-Medical-Dataset FLARE2023.md(4,000 例训练集、数据源清单、1,241,146 切片、间距统计)
- NVIDIA 团队 OpenReport(openreview.net/pdf?id=O5mvleMVKq,250/1,062/888 部分标注子集统计、部分标签训练失败记录)
- Zhuang et al. (2023). arXiv:2310.01159(迭代 SSL、nnU-Net 预处理参数、120 小时训练时长、病灶伪标签噪声)
- github.com/zzm3zz/FLARE2023(病灶 = 14 处理、Docker 提交格式)
- github.com/Ziyan-Huang/FLARE23(STU-Net 伪标签流程、nnU-Netv2 推理加速)
- Springer LNCS 论文集:https://link.springer.com/book/10.1007/978-3-031-23911-3
- The Lancet Digital Health 论文全文 PDF(Radboud 机构库镜像):repository.ubn.ru.nl/bitstream/handle/2066/313494/313494.pdf
- AMID 数据集 API 文档(FLARE2022 类、MedIA 2022 引文):https://neuro-ml.github.io/amid/latest/datasets-api/
- medicalimaging.ai FLARE22 条目(参赛流程、playground 资格、时间线):https://medicalimaging.ai/?p=2339/
- Google Scholar 引用计数页(FLARE22 总结论文被引 239+,截至 2026-09)
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(解剖/肿瘤学表述、ICD-11/SNOMED 映射) | 千方病案医学编辑部 | 逐条比对文献与官方任务定义 | ✅ 已通过 |
| §3–§4 规格与数据结构(规模数字、目录树、字段字典) | 千方病案医学编辑部 | 与官方页面/论文交叉核对 | ✅ 已通过 |
| §5 划分与泄漏分析 | 千方病案医学编辑部 | 数据工程视角复核 | ✅ 已通过 |
| §6 AI 就绪指南(代码示例、8 个坑点) | 千方病案医学编辑部 | 代码走查 + 坑点溯源 | ✅ 已通过 |
| §7 质量评估(偏倚、DAIMS 24 项、外部验证矩阵) | 千方病案医学编辑部 | 对照论文 limitations 与外部验证数据 | ✅ 已通过 |
| §8–§9 基准、生态与引用 | 千方病案医学编辑部 | 引文逐条核验 | ✅ 已通过 |
| §0/§10 合规声明 | 千方病案医学编辑部 | 模板与事实一致性 | ✅ 已通过 |
§10.5 AI 生成章节标注
正文全部章节由 AI 起草;§1.0 速览、§2.2 流行病学叙述、§7.7 评分解读与"对你意味着什么"为 AI 依据来源归纳的评述性内容,已由人工审核确认与来源一致。
§10.6 最后人工审核日期
2026-09-05
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- kits — 共享标签:医学影像 / 医学问答与基准 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- lits — 共享标签:医学影像 / 医学问答与基准 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- sliver07 — 共享标签:医学影像 / 医学问答与基准 / CT / 医学图像分割 / 挑战赛数据集
- btcv — 共享标签:医学影像 / 医学问答与基准 / CT / 医学图像分割 / 挑战赛数据集
- segrap — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- kits23 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- verse-spine — 共享标签:医学影像 / 医学问答与基准 / CT / 医学图像分割 / 挑战赛数据集
- autopet-v — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- hecktor2026 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- trials — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
