SIIM-ACR Pneumothorax Segmentation (siim-acr-pneumothorax) — AI-Ready Wikipedia

2019 Kaggle 气胸像素级分割竞赛数据集:12,047 张 NIH 胸片 + RLE 掩码,1,475 队竞逐 mean Dice,原始 GCP 通道已下线、竞赛规则禁再分发,AI-Ready 光谱上「技术可用、治理受限、存续脆弱」的典型样本

来源 SIIM/ACR/STR/MD.ai 基于 NIH 公开胸片数据的增强标注(augmented annotations);交付形态 DICOM 1,024×1,024 灰度 + RLE 相对编码掩码(无气胸记 -1)发布时间: 2026-09-30最后更新: 2026-09-30 阅读 9
SIIM-ACR Pneumothorax Segmentation (siim-acr-pneumothorax) — AI-Ready Wikipedia

信息速览

数据集名称SIIM-ACR Pneumothorax Segmentation (siim-acr-pneumothorax) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模12,047 张唯一胸片(UUID 匿名化患者,未披露患者级数量);掩码 12,954 个(阳性 2,669 / 阴性 9,378)
接入方式SIIM/ACR/STR/MD.ai 基于 NIH 公开胸片数据的增强标注(augmented annotations);交付形态 DICOM 1,024×1,024 灰度 + RLE 相对编码掩码(无气胸记 -1)
AI 就绪度

INFOBOX — SIIM-ACR Pneumothorax 一屏速览

维度 内容
本质 2019 Kaggle 胸部 X 光气胸像素级分割竞赛数据集(SIIM/ACR/STR/MD.ai 主办)
影像来源 NIH 公开胸片数据的专业增强标注(augmented annotations),非新采集
规模 12,047 张唯一胸片;掩码 12,954 个(阳性 2,669 / 22.15%,阴性 9,378 / 77.85%)
规格 DICOM 灰度 1,024×1,024(PNG 交付);DICOM 元数据声明 1,824×1,824(口径冲突)
掩码 RLE(run-length encoding)相对编码;无气胸样本记 -1
划分 train ≈ 10,675|test ≈ 1,372(PNG 镜像)/ 1,377(原始)|round-2 3,205
任务 像素级分割 + 有无气胸分类;指标 mean Dice coefficient
战绩 榜首 0.8679(dsmlkz)/ 0.8665(X5)/ 0.8651(bestfitting)
参与 1,475 队参赛、352 队有效提交;总奖金 $30,000
已知缺陷 患者级数据泄漏(同患者跨 train/test,Radboud 硕士论文);类别不均衡
获取 原 GCP 通道已下线|Kaggle/academic torrents 镜像|torchxrayvision / torch_em 加载器
许可 竞赛规则禁再分发|镜像 License Unknown|第三方自述 CC-BY-NC(冲突)
库内互链 NIH ChestX-ray14(影像来源)、RSNA Pneumonia(平行竞赛)、CheXpert、ChestX-Det10、CheXmask

SIIM-ACR Pneumothorax Segmentation 是一个把"胸片上的气胸区域圈出来"这件事变成公开竞赛的经典数据集:12,047 张来自美国国立卫生研究院(NIH)公开胸片库的图像,被放射科专家逐像素重新标注了气胸范围,1,475 支队伍在 2019 年的 Kaggle 赛场上比谁的 Dice 系数更高。它的技术形态几乎无可挑剔——标准 DICOM、标准 RLE、现成的库加载器;但它的叙事价值恰恰在技术之外:原始托管通道已经下线,竞赛规则明文禁止再分发,镜像的许可证只能写"Unknown"。它因此成为观察"AI-Ready 数据"三重张力(技术可用 / 治理受限 / 存续脆弱)的绝佳样本。

导语读法三则:

  1. 只想下数据跑模型:直奔 §6 获取与许可——原通道已死,走镜像或库加载器,但先读许可证那一节。
  2. 关心数据治理与泄漏:直奔 §5 与 §10 的坑 5、坑 6——患者级泄漏与"禁再分发"是所有下游研究的隐形天花板。
  3. 做胸片 AI 竞品对标:直奔 §7 评估与基准 + §9 互链地图——NIH ChestX-ray14 / RSNA Pneumonia / CheXpert 的家族关系一目了然。

§0 导读:这个数据集解决什么问题

0.1 一句话定义

SIIM-ACR Pneumothorax Segmentation 是 2019 年 Kaggle 平台上一场以"胸片气胸区域像素级分割"为任务的公开竞赛所发布的数据集,由 SIIM(医学影像信息学学会)、ACR(美国放射学会)、STR(胸部放射学会)与 MD.ai 联合主办,影像来自 NIH 公开胸片数据、标注为专家增强标注(augmented annotations)。

0.2 为什么是"气胸"

气胸(pneumothorax)指胸膜腔内积气、导致肺组织部分或全部塌陷。临床上它可能由外伤、自发性破裂或医源性操作(如穿刺、中心静脉置管)引起,严重时可危及生命。在胸部 X 光片(CXR)上,气胸表现为肺野外缘与胸壁之间出现一条无肺纹理的透亮带(胸膜线)。

  • 诊断价值:气胸是急诊与重症场景的高频、危及生命病变,早识别直接影响处置决策。
  • 图像特征:气胸区域在 CXR 上有相对清晰的边界(可见胸膜线),这为像素级分割提供了可行性——不像某些弥漫性病变那样边界模糊。
  • 量化价值:气胸的严重程度与塌陷范围直接相关,逐像素分割天然给出"塌陷面积占比"这一临床可用的量化指标。

0.3 为什么是"像素级分割"而非"分类"

传统胸片 AI 任务多为图像级分类(有/无某病变)。SIIM-ACR 选择像素级分割(semantic segmentation),原因有三:

  1. 可解释性:分割掩码直接可视化"模型认为气胸在哪里",比一个概率值对临床医生更可核验。
  2. 量化能力:分割掩码可计算面积/占比,支持严重程度分级。
  3. 评测刚性:像素级 Dice 是一个难以通过分类捷径(如只看图像全局特征)刷高的指标,能更真实地衡量模型对局部结构的理解。

0.4 这个数据集的三个"身份"

身份 内涵 对应章节
技术资产 标准 DICOM + RLE,现成库加载器,训练管线成熟 §2、§6.2
治理样本 竞赛规则禁再分发、镜像 license Unknown、原始通道下线 §6、§10
质量案例 患者级泄漏、类别不均衡、口径冲突,是"数据质量决定模型上限"的教材 §5、§10

0.5 导读路线图

  • 求快:§1 速览 → §6 获取 → 动手。
  • 求全:按 §0→§9 顺读,跳过 FAQ 亦可。
  • 求判:§4 硬数字 + §6 许可 + §10 避坑清单 + 附录 B 的 DAIMS 评估,是最短的"要不要用"决策路径。

0.6 阅读前必知的三条底线

在动手使用本数据集前,请先记住三条底线——它们贯穿全文,也是本条目存在的理由:

  1. 许可底线:竞赛规则明文禁止再分发/复制/发布数据;Kaggle 镜像的 License 显示 Unknown。再分发或商用前必须获得授权方书面许可(§6.1、坑 5)。
  2. 获取底线:原始官方通道(GCP Cloud Healthcare API)已下线,现存获取依赖社区镜像与库加载器,无官方 SLA(§6.2、坑 1)。
  3. 质量底线:数据集存在患者级数据泄漏(同患者跨 train/test),报告的 Dice 分数可能乐观高估;临床转化前须另建患者隔离验证集(§5.3、坑 6)。

0.7 本条目的一句话立论

SIIM-ACR Pneumothorax 在技术上是"AI-Ready 的模范生",在治理与质量上却是"AI-Ready 的警示牌"——本条目既讲前者怎么做,也讲后者为什么重要。

0.8 章节与读者需求对照

你想知道 去读
这是什么东西 §0、§1
有多少数据、什么格式 §2、§4
标注怎么来的、有什么问题 §3、§5
能不能下载、能不能用 §6
怎么评测、基线多少 §7
在生态里什么位置 §8、§9
有哪些坑 §10
快速决策 §11、附录 B
高频疑问 FAQ

§1 数据集速览:十问十答

Q1:这个数据集到底是什么?
一场 2019 年 Kaggle 竞赛的数据集:给胸片逐像素标出气胸区域,并判断有无气胸。主办方为 SIIM / ACR / STR / MD.ai,影像源自 NIH 公开胸片数据。

Q2:有多少张图?
12,047 张唯一胸片;另有 12,954 个掩码(掩码数大于影像数,差 907,见坑 3)。

Q3:图像什么格式、多大?
DICOM 灰度图,交付分辨率 1,024×1,024(PNG 形态)或原始 DICOM。注意 DICOM 元数据声明 rows/cols 为 1,824×1,824,与交付 1,024² 不一致(坑 4)。

Q4:掩码怎么编码?
RLE(run-length encoding),相对形式。无气胸的样本掩码记为 -1(不是空串)。

Q5:怎么划分 train/test?
常见口径:train ≈ 10,675,test ≈ 1,372(PNG 镜像,如 vbookshelf 类);另有 1,377(原始划分)与 3,205(二阶段隐藏测试集)。三口径并存(坑 2)。

Q6:评估指标是什么?
mean Dice coefficient:逐样本算 Dice,再取均值。

Q7:最好成绩多少?
榜首 mean Dice 0.8679(dsmlkz),第二 0.8665(X5),第三 0.8651(bestfitting)。共 1,475 队参赛、352 队有效提交(见坑 7 的口径说明)。

Q8:现在还能下载吗?
原始通道(GCP Cloud Healthcare API)已下线;可通过 Kaggle Datasets、Academic Torrents 等社区镜像获取,或用 torchxrayvision / torch_em 的加载器下载。

Q9:许可证是什么?
官方口径为 Subject to Competition Rules,明文禁止再分发/复制/发布;Kaggle 镜像的 License 字段显示 Unknown;某第三方镜像自称 CC-BY-NC 4.0(非权威、与官方冲突)。以官方竞赛规则为准(坑 5)。

Q10:有什么已知的大问题?
患者级数据泄漏——Radboud 大学硕士论文指出训练集与测试集存在相同患者的影像,可能让评估分数偏乐观(坑 6);此外类别高度不均衡(阳性仅 22.15%)。


§2 数据构成与规格

2.1 影像构成

项目 规格
模态 胸部 X 光片(chest radiograph, CXR)
色彩 单通道灰度(grayscale)
交付分辨率 1,024 × 1,024(PNG 形态)/ DICOM 原始
DICOM 元数据分辨率 1,824 × 1,824(rows/cols)——与交付不一致(坑 4)
位深 8-bit(交付 PNG);DICOM 原始位深依设备而定
患者标识 UUID 匿名化(无患者 ID 映射、无序列号)
影像来源 NIH 公开胸片数据的增强标注版本

2.2 影像数量与类别分布

指标 数值 占比
唯一影像数 12,047 —
掩码总数 12,954 —
阳性(含气胸)掩码 2,669 22.15%
阴性(无气胸)掩码 9,378 77.85%

读法提示:阳性样本不足四分之一,训练时须处理类别不均衡(加权损失、过采样、后处理阈值调优等)。注意掩码数(12,954)大于影像数(12,047)——这个 907 的差额是条目要反复存照的口径冲突之一。

2.3 划分规模(三口径并存)

划分 数量 来源口径
train ≈ 10,675 PNG 镜像(vbookshelf 类)
test ≈ 1,372 PNG 镜像(vbookshelf 类)
test ≈ 1,377 原始竞赛划分
test(round-2) 3,205 二阶段隐藏测试集 / arXiv:2009.02805

口径警示:1,372 / 1,377 / 3,205 三个 test 数字来自不同划分来源,不可混用亦不可互换。做跨论文比较时,务必先确认对方用的是哪一套划分。

2.4 掩码编码:RLE 相对形式

  • 编码:RLE(run-length encoding,游程编码)——用"起点-长度"数对表示掩码中的连续区段。
  • "相对"含义:后续数对的位置以相对前一区段末端的偏移表示,而非绝对像素坐标;解析时须做累积求和还原绝对位置。
  • 负例约定:无气胸的样本掩码记为 -1,不是空字符串——解析代码若把 -1 当作正常 RLE 处理会出错,须先判空/判负。
  • 与影像的对齐:掩码与影像同尺寸(1,024×1,024),逐像素对齐。

2.5 目录结构(典型镜像形态)

siim-acr-pneumothorax/
├── stage_2_train_images/      # 训练影像(.dcm 或 .png,1,024×1,024)
├── stage_2_test_images/       # 测试影像
├── stage_2_train.csv          # train 的掩码 RLE(ImageId, EncodedPixels)
├── stage_2_sample_submission.csv
└── stage_2_detailed_class_info.csv   # 逐张的详细类别(附类别细化标签)

2.6 元数据字段

字段 说明
ImageId 影像标识(UUID 形态)
EncodedPixels RLE 掩码(-1 表示无气胸)
ClassId / 类别 详细类别信息(如"无肺"/“有气胸”/"正常"等细化分类,见于 detailed_class_info)

注意:不同镜像的字段名与文件结构可能略有差异(如 train-rle.csv vs stage_2_train.csv),跨镜像复用代码前先核对列名。

2.7 详细类别信息(detailed class)

除"有气胸 / 无气胸"的二值标签外,数据集还提供了更细的类别划分(stage_2_detailed_class_info.csv),常见三分类口径为:

详细类别 含义 与二值标签的关系
Normal 正常胸片,无气胸、无其他异常 阴性
No Pneumothorax 无气胸,但存在其他异常 阴性
Pneumothorax 有气胸 阳性

意义与坑点:这一层细分让研究者可区分"真正的正常"与"有异常但非气胸",对假阳性分析(模型把其他病变误认为气胸)尤其有价值。但不同文献引用时对三分类的命名与合并方式可能不同,使用时须核对 CSV 原文,勿想当然假定只有两类。

2.8 数据体量与磁盘占用

形态 体量 备注
Kaggle 数据页标注 439.11 MB 官方数据页口径
PNG 镜像(1,024² 灰度) 数 GB 级 解压后;随镜像实现而异
DICOM 原格式 更大 含完整元数据头

提示:数据页标注的 439.11 MB 通常指压缩交付包,解压后占用远大于此。规划磁盘与下载时须按解压后规模预留。

2.9 规格速查总表

维度 值
模态 胸片(CXR),灰度
交付分辨率 1,024 × 1,024
DICOM 元数据分辨率 1,824 × 1,824(坑 4)
影像数 12,047
掩码数 12,954(坑 3)
阳性比例 22.15%
掩码格式 RLE 相对编码;无气胸记 -1
患者标识 UUID 匿名化(无患者级元信息)
详细类别 Normal / No Pneumothorax / Pneumothorax(三分类)

§3 注释流水线

3.1 影像来源:NIH 公开胸片库

SIIM 官方页面明确措辞:该数据集的影像是基于美国国立卫生研究院(NIH)公开展示的胸片数据集做的增强标注(augmented annotations on the public chest radiograph dataset from the National Institutes of Health, NIH)。

这意味着:SIIM-ACR 不是新采集的临床数据,而是对既有 NIH 公开胸片的专业重标。它是 NIH 胸片数据"被二次利用、升级为像素级标注"的产物。

3.2 标注组织

环节 承担方
赛事与规则设计 SIIM / ACR / STR(三家学会)
标注平台与基础设施 MD.ai
标注执行 放射科专家(具体人数/流程未公开逐项说明)
标注对象 气胸区域的像素级掩码 + 有无判断

3.3 “augmented annotations” 的含义

官方措辞中的 “augmented” 有两种可能解读:(a)在已有标注基础上的增量/扩展重标;(b)针对气胸这一目标病变的专项增强标注。公开页未展开说明其确切含义——这是本条目如实存照的遗留疑点之一(见坑 8)。

3.4 标注粒度的意义

与仅提供图像级标签(有/无气胸)的数据集相比,像素级掩码带来三重增益:

  1. 可解释性:可视化模型关注的解剖区域,可被临床医生核验。
  2. 可量化:掩码面积 → 气胸塌陷占比,支持严重程度评估。
  3. 强约束训练:像素级监督迫使模型学习局部结构,而非依赖全局捷径。

3.5 流水的已知瑕疵

  • 无患者级元信息:仅 UUID 匿名化,未提供患者 ID、序列、侧别等可追溯字段 → 下游无法自行做患者级划分。
  • 患者级泄漏(见 §5.3):因为无法按患者切分,训练集与测试集可能含相同患者的影像。
  • 标注者一致性未公开:无观察者间一致性(inter-observer agreement)指标公开,无法评估掩码的标注噪声水平。

3.6 标注质量对下游任务的影响

像素级掩码的质量直接决定模型上限。当掩码本身存在噪声时:

  • 噪声类型一:边界模糊。胸膜线细小,不同标注者对边界的判断可能相差数个像素,导致 Dice 上限被压。
  • 噪声类型二:漏标小气胸。微量气胸在小分辨率图上可能只有几十个像素,易被漏标或标错。
  • 噪声类型三:不一致的"何为气胸"标准。是否包含皮下气肿、纵隔气肿等邻近表现,若无统一规范则标签不齐。

启示:在没有观察者间一致性指标的情况下,把该数据集的 Dice 视为"与单一标注版本的吻合度",而非"与临床真值的吻合度",是更审慎的解读。

3.7 与图像级标签数据集的对比

维度 图像级标签数据集(如 NIH ChestX-ray14) 像素级标注数据集(SIIM-ACR)
标签形态 每图一个/多个二值标签 每图一个像素级掩码
监督信号强度 弱(只知道"有没有") 强(知道"在哪里、有多大")
标注成本 低 高(需逐像素勾画)
可解释性 低 高
评测刚性 低(分类捷径多) 高(像素级约束)

SIIM-ACR 的生态价值正在于此:它在 NIH 图像级标签的基础上,为"气胸"这一目标病变补上了成本高昂的像素级监督,把弱监督升级为强监督。

3.8 标注流程的可复现性

  • 可复现部分:从影像到 RLE 掩码的解析、训练、评估,完全可在公开镜像上复现。
  • 不可复现部分:原始标注流水线(标注者人数、资质、复核机制、争议仲裁)未公开——因此"重做一遍标注会得到同样的掩码吗"无法回答。这是该数据集在"可复现性"维度上的固有短板。

§4 核心发现与硬数字

4.1 竞赛战绩排行榜(前三名)

名次 选手 mean Dice
1 dsmlkz 0.8679
2 X5 0.8665
3 bestfitting 0.8651

4.2 参与规模

指标 值
参赛队伍 1,475
有效提交队伍 352
总奖金池 $30,000
一等奖 $12,000
参考基线 第 124 名 mean Dice = 0.8356(top 约 9% 分位)

口径说明:不同来源对"参赛队伍数"与"有效提交数"的表述略有差异——SIIM 官方页给出 1,475 参赛 / 352 提交。引用时以官方页为准(坑 7)。

4.3 核心数字一览(含来源)

硬数字 值 来源
唯一影像 12,047 Kaggle 镜像 / torchxrayvision 文档 / arXiv 多源一致
掩码总数 12,954 torchxrayvision 文档
阳性掩码 2,669(22.15%) 镜像统计
阴性掩码 9,378(77.85%) 镜像统计
交付分辨率 1,024 × 1,024 Kaggle 数据页 / 镜像
DICOM 元数据分辨率 1,824 × 1,824 DICOM 头
数据页体积 439.11 MB Kaggle 数据页
榜首 Dice 0.8679 Kaggle 排行榜
参赛/提交 1,475 / 352 SIIM 官方页
总奖金 $30,000 SIIM 官方页

4.4 核心发现(超越竞赛本身)

  1. 技术可解性得到验证:像素级 Dice 从早期方案的 ~0.80 提升到榜首 0.8679,证明在 NIH 胸片分辨率下气胸分割是可行的建模任务。
  2. 但评估可能过于乐观:患者级泄漏(§5.3)使高分未必能迁移到严格患者隔离的真实场景。
  3. 治理比技术更难:原始通道下线 + 禁再分发,说明"数据可用性"的瓶颈常常不在算法,而在授权与托管。
  4. 类别不均衡是主要工程挑战:阳性仅 22.15%,阴性样本的假阳性抑制成为区分高分方案的关键之一。

4.5 从榜单分数分布读出的信息

观察 解读
前三名差距极小(0.8679 / 0.8665 / 0.8651) 顶尖方案已逼近该数据集的经验上限,微差多来自后处理/集成细节
第 124 名 0.8356 前 9% 即可达 0.835+,说明方法门槛不高、工程细节决定名次
高分密集 可能部分得益于患者级泄漏(坑 6)——真实患者隔离下上限或更低
榜单未显示分类侧指标 竞赛只评分割 Dice,分类只是副产物,社区常另报 AUC

4.6 一个"分数—代价"的思考

在 SIIM-ACR 上刷分并不难,难的是判断这个分数意味着什么:

  • 若测试集与训练集存在同患者影像(坑 6),高分中包含"记忆成分";
  • 若各方案用的划分口径不同(坑 2),分数之间不严格可比;
  • 若评测对空掩码样本的处理不同,mean Dice 会系统性偏移。

结论:把榜单分数当作"相对排序信号"是安全的,把它当作"临床性能估计"是不安全的。


§5 任务定义与已知问题

5.1 任务定义

输入:一张 1,024×1,024 灰度胸片(DICOM/PNG)。
输出:

  • (a)像素级掩码:气胸区域的二值分割(RLE 编码);
  • (b)有无判断:该胸片是否存在气胸(二分类)。

评估:mean Dice coefficient。逐样本 Dice = 2|A∩B| / (|A|+|B|)(A 为预测掩码、B 为真值掩码),再对样本取算术平均。分类侧社区常另报 AUC / 准确率。

5.2 类别不均衡问题

类别 占比
阳性(有气胸) 22.15%
阴性(无气胸) 77.85%

影响:若直接用普通交叉熵/Dice 训练,模型倾向预测"无气胸"即可在多数样本上取得不低的整体指标,但对临床最关键的阳性漏检率高。

常见应对:正样本过采样、损失加权、focal loss、分割后处理(阈值调优)、两阶段(先分类后分割)等。

5.3 患者级数据泄漏(核心质量缺陷)

Radboud 大学硕士论文明确指出:SIIM-ACR 数据集的训练集与测试集中存在相同患者的影像。由于数据集未提供患者级元信息(仅 UUID 匿名化),划分无法按患者进行,导致:

  • 模型在测试集上可能"见过"同一患者(甚至同一张图的不同版本)的训练影像;
  • 报告的 Dice 分数可能被系统性乐观高估;
  • 跨研究比较时,若各方划分口径不同,分数不完全可比。

影响评估:这并不否定数据集的训练价值,但意味着——在 SIIM-ACR 上报告的高分,不能直接等同于"在真实临床患者隔离条件下"的性能。做临床转化评估时须额外设计患者级隔离验证集。

5.4 其他已知问题

问题 说明 见
掩码数 > 影像数 12,954 vs 12,047,差 907,原因未公开 坑 3
test 三口径 1,372 / 1,377 / 3,205 坑 2
分辨率不一致 DICOM 1,824² vs 交付 1,024² 坑 4
标注一致性未知 无观察者间一致性公开 §3.5
原始通道下线 GCP Cloud Healthcare API 不可访问 §6.1

5.5 泄漏对实验设计的三个具体影响

  1. 验证集不可信:若从官方 test 中切验证集,验证分数同样被泄漏污染,早停与超参选择都可能选到"记忆型"模型。
  2. 跨研究不可比:A 论文说 0.87、B 论文说 0.85,"谁更好"在泄漏存在时无法从数字上判定,除非两者用同一划分且同一患者隔离策略。
  3. 迁移性被高估:在有泄漏的测试集上表现好的模型,迁移到真正患者隔离的新医院数据时可能明显下降。

处方:任何声称"在该数据集上达到 SOTA"的结论,都应以"患者隔离评测"为前提重新验证——而这恰是该数据集因缺元信息而无法直接支持的。

5.6 处理泄漏的三条可行路径

路径 做法 代价
路径一:接受并声明 照常在官方划分上评测,但报告时明确标注"含患者级泄漏" 结论强度受限,但诚实
路径二:图像级去重 用感知哈希/像素相似度找出疑似同患者影像,人工核对后剔除 无患者标签,只能近似;可能误删
路径三:自建隔离集 从公开临床数据(如 MIMIC-CXR 等)另建患者隔离的气胸评测集 工作量大、需另获授权

实务建议:论文/项目若以 SIIM-ACR 为卖点,至少做到路径一;做临床转化前必须做到路径三。

5.7 与其他胸片数据集的"泄漏风险"对照

数据集 划分依据 泄漏风险
SIIM-ACR 图像级(无患者信息) 高(文献已证同患者跨集)
NIH ChestX-ray14 官方划分 中(划分按患者但图像级任务仍可被图像级捷径影响)
MIMIC-CXR 患者级 低(官方提供患者 ID)
CheXpert 患者级 低(官方提供患者分组)

读法:是否提供患者级标识,是判断一个胸片数据集"划分是否可信"的第一道分水岭。SIIM-ACR 恰恰栽在这道线上。

5.8 把问题放回"竞赛语境"理解

为什么一个由三家权威学会主办、标注质量不俗的数据集会留下患者级泄漏这种硬伤?把它放回竞赛语境即可理解:

  • 竞赛的目标是"评选出好模型",而非"产出可长期复用的科学基准";
  • 竞赛周期短(2019-06 至 2019-09),组织者优先保证评测可运行,患者级划分并非首要考量;
  • 数据来自既有公开胸片库,原始库的匿名化程度就未携带患者级标识,SIIM 只是在其上补标注,无法凭空补回患者信息。

结论:患者级泄漏不是"谁疏忽了",而是**"竞赛数据被当作科研基准复用"时的系统性错配**——这是所有"拿竞赛榜当基准"的研究者都该警惕的元问题。

5.9 一份"负责任使用"自查清单

自查项 是/否
我是否声明了所用的 train/test 划分口径? ☐
我是否在报告中注明了患者级泄漏的局限? ☐
我是否确认为合规使用(不涉及再分发/商用)? ☐
我的数据来源是镜像还是加载器?是否记录抓取日期? ☐
若用于临床转化,我是否另建了患者隔离验证集? ☐
我是否核对了 DICOM 分辨率(避免 1824²/1024² 错配)? ☐

§6 获取与许可:三层异构的门怎么进

6.1 授权状况(三源冲突,逐条存照)

来源 授权声明 权威性
Kaggle 竞赛规则文本 Subject to Competition Rules:参赛者同意 not to transmit, duplicate, publish, redistribute 数据 最高(官方)
Kaggle 数据页 License 字段 Unknown 中(平台字段,反映托管方无法声明)
某第三方镜像(GitHub TimoBar/mmsegmentation 提交) 自称 CC-BY-NC 4.0(且链接误指向 CC BY-SA) 低(非权威,与官方冲突)

判定:以官方竞赛规则为准——数据受竞赛规则约束、明确禁止再分发/复制/发布/传播。Kaggle 镜像 License 显示 Unknown,正是因为托管方没有可声明的授权;第三方自称的 CC-BY-NC 缺乏依据,不可采信。

6.2 可获取性三层异构(AI-Ready 核心叙事)

第一层:原始竞赛通道 —— 已失效(DEAD)
  • 原托管:Google Cloud Healthcare API(DICOM 直接读取)。
  • 现状:Kaggle 赛事页明确标注数据 “no longer available via Cloud Healthcare API”。
  • 含义:官方原始获取路径已关闭,任何指向 GCP 的旧教程/脚本均已失效。
第二层:社区镜像 —— 部分存活(MIRROR)
镜像 形态 说明
Kaggle Datasets(如 vbookshelf/siim-acr-pneumothorax-segmentation) PNG 1,024²,12,047 张 License 显示 Unknown;train/test 划分口径
Kaggle Datasets(如 seesee/siim-train-test) PNG,train/test 划分 供快速上手
Academic Torrents DICOM 原格式 torchxrayvision 文档指向的下载源

风险:

  • 许可不明(Unknown)——使用前须自行评估合规性;
  • 划分口径不一——不同镜像的 train/test 切分不同(见坑 2);
  • 存续无保障——社区镜像无官方 SLA,可能随时下架。
第三层:库加载器 —— 可用(LOADER)
加载器 关键参数/特性
torchxrayvision.SIIM_Pneumothorax_Dataset unique_patients=True、pathology_masks=True;文档称 12,954 个 DICOM 掩码,数据经 Academic Torrents 分发
torch_em.data.datasets.medical.siim_acr **带校验和(checksum-verified)**的下载函数

价值与边界:库加载器把"治理受限的竞赛数据"封装成"可编程、可校验"的 AI-Ready 资产,极大降低使用门槛——但它不改变底层的授权约束,且其可用性仍依赖上游镜像的存活。

6.3 版本链

原始 GCP Cloud Healthcare API(DICOM,官方通道,已下线)
        │
        ├──> Kaggle Datasets 镜像(PNG 1024²,12,047 张,License Unknown)
        │        └──> 各种快速上手 notebook / 划分脚本(口径不一)
        ├──> Academic Torrents(DICOM 原格式)
        │        └──> torchxrayvision / torch_em 加载器(可校验封装)
        └──> 竞赛复盘仓库(第三方,划分与许可自述)

6.4 获取决策树

你需要什么?
├── 快速跑通分割模型
│   └── 用 Kaggle 镜像(PNG 1024²)+ 记牢划分口径(坑 2)
├── 复现论文/严格对齐
│   └── 先确认论文所用划分(1,372 / 1,377 / 3,205 哪一套),再选对应镜像
├── 需要 DICOM 原格式 / 校验和
│   └── torch_em.siim_acr(checksum-verified)或 Academic Torrents
└── 要再分发 / 商用
    └── 停 —— 官方规则禁再分发;须先获得授权方书面许可(坑 5)

6.5 许可合规红线

  • 不可再分发:竞赛规则明文禁止 transmit / duplicate / publish / redistribute。
  • 镜像 License “Unknown” ≠ 可用:Unknown 表示无授权声明,不等于放任使用。
  • 第三方 CC-BY-NC 自述不可依赖:无官方背书,与官方规则冲突。
  • 衍生模型的许可边界不明:数据禁再分发是否约束以其训练的模型权重,公开页未明确 → 商用前须与权利方确认(坑 5、坑 9)。

6.6 三层可获取性的对比总表

层 通道 状态 许可清晰度 可持续性 适用场景
第一层 GCP Cloud Healthcare API DEAD 高(官方) 无 已不可用
第二层 Kaggle Datasets 镜像 存活 低(Unknown) 中(平台稳定但无授权) 快速上手
第二层 Academic Torrents 存活 低 中(P2P 依赖种子) 需 DICOM 原格式
第三层 torchxrayvision 可用 低(继承上游) 中(依赖上游镜像) 编程加载
第三层 torch_em 可用 低(继承上游) 中(依赖上游镜像) 需校验和的加载

读表结论:没有任何一层同时满足"可用 + 许可清晰 + 可持续"。这是本条目最想传达给读者的结构性事实。

6.7 与其它 AI-Ready 数据集的获取模式对照

数据集 官方通道 许可 获取模式
SIIM-ACR 已下线 禁再分发 镜像依赖
NIH ChestX-ray14 在线 开放 官方直链
CheXpert 在线(需注册) 研究用途 注册制
MIMIC-CXR 在线(需认证) 物理学家认证 认证制

对照启示:SIIM-ACR 是表中唯一官方通道已下线的条目——它因此成为"托管依赖风险"的教科书案例:数据的可得性可以在一夜之间因托管方策略变化而降级,与数据本身的质量无关。


§7 评估与基准

7.1 评估指标:mean Dice

  • Dice 系数:Dice = 2|A ∩ B| / (|A| + |B|),取值 [0,1],1 为完全重合。
  • mean Dice:对每个样本算 Dice,再取算术平均(对空掩码样本的处理规则会影响数值,镜像/评测脚本口径须核对)。

7.2 排行榜战绩

名次 选手 mean Dice
1 dsmlkz 0.8679
2 X5 0.8665
3 bestfitting 0.8651

7.3 参与规模与参考基线

指标 值
参赛队伍 1,475
有效提交队伍 352
总奖金 $30,000
一等奖 $12,000
第 124 名基线 mean Dice 0.8356(top 约 9%)

7.4 基准使用注意

  1. 泄漏警告:患者级泄漏(§5.3)意味着榜单高分可能乐观高估。作为 benchmark 引用时必须注明该局限。
  2. 划分口径:report 分数时声明所用划分(1,372 / 1,377 / 3,205),否则不可比。
  3. 指标实现差异:不同实现对空掩码、边界像素的处理可能不同,复现时以官方/论文脚本为准。
  4. 常见做法:多数方案采用 U-Net 类编码-解码结构 + 分类头,配合正样本加权与后处理。

7.5 复现一个 baseline 的最小步骤

1. 取 Kaggle PNG 镜像(1,024²),确认划分口径(坑 2)
2. 解析 train-rle.csv:-1 视为空掩码(坑 3 相关)
3. 用附录 F 的 rle_decode 还原掩码,抽样可视化自检
4. 训练 U-Net 类模型:正样本加权 / focal loss 应对 22.15% 不均衡
5. 评估 mean Dice,注意空掩码样本的处理规则
6. 报告时声明:划分口径 + 患者级泄漏局限(坑 6)

7.6 常见评估陷阱

陷阱 说明
空掩码样本处理 若把"预测空 + 真值空"的样本 Dice 记为 1 或 0,会系统性改变 mean Dice
阈值未校准 分割概率图转二值的阈值影响 Dice,须在同一验证集上校准
划分混淆 用 1,372 划分的分数与用 3,205 划分的分数直接比较(坑 2)
泄漏未声明 报告高分却不提患者级泄漏(坑 6)

7.7 一次完整的评估流程(示意)

第 1 步:确定划分
  - 声明:用 1,372(PNG 镜像)还是 1,377(原始)还是 3,205(round-2)
  - 目标:论文复现须与原文口径一致(坑 2)

第 2 步:确定指标实现
  - mean Dice 中空掩码样本的计分规则(记 1 / 跳过 / 记 0)
  - 阈值:0.5 固定还是验证集校准

第 3 步:报告
  - 集合指标:mean Dice(全集)
  - 分层指标:阳性子集 Dice(暴露漏检)
  - 局限声明:患者级泄漏(坑 6)、划分口径(坑 2)

第 4 步:可迁移性说明
  - 若用于临床场景,附患者隔离验证结果

7.8 与其它分割基准的横向位置

分割基准 模态 目标 指标
SIIM-ACR 胸片 气胸 mean Dice
CheXmask 胸片 多解剖结构 Dice/IoU
Chest X-ray Segmentation 胸片 肺/心等结构 Dice
(各类 CT/病理分割竞赛) CT/WSI 器官/病灶 Dice/Hausdorff

读法:SIIM-ACR 是胸片分割里病种单一但标注最深的一档,与"多解剖结构分割"的 CheXmask 互补——前者问"病变在哪",后者问"器官在哪"。


§8 生态与影响

8.1 在胸片 AI 生态中的位置

SIIM-ACR 处于"NIH 胸片数据家族"的标注升级层:上游是 NIH 公开胸片库(以 NIH ChestX-ray14 为代表),SIIM-ACR 在其上增加了气胸专项的像素级掩码,与其它任务(肺炎检测、多标签分类、报告生成)并列为该家族的平行分支。

8.2 对下游的影响

  • 推动了胸片分割研究:提供了首个大规模、像素级、气胸专项的公开竞赛基准。
  • 辐射到库加载器生态:torchxrayvision、torch_em 等库将其纳入标准数据集接口,使其成为"开箱可用"的训练素材。
  • 成为数据治理教学案例:禁再分发 + 通道下线 + License Unknown 的组合,常被用来说明"技术可用 ≠ 合法可用"。
  • 成为数据质量警示案例:患者级泄漏使它成为讨论"数据集划分设计"的经典反例。

8.3 库内互链地图(rid 经库内查询核对)

条目 rid 互链理由 强度
nih-chest-x-ray14 15 影像直接来源(同一 NIH 胸片库) ★★★
rsna-pneumonia 712 同为胸片 + NIH 系影像的 Kaggle 竞赛(平行对照) ★★★
chestx-det10 137 同源 NIH 胸片库的检测标注集 ★★
chexpert 5 同期大规模胸片数据集(任务生态对照) ★★
chexmask-cxr-segmentation-data 602 胸片掩码分割生态 ★★
chest-x-ray-segmentation 601 胸片分割任务对照 ★★
mimic-cxr 16 胸片 + 报告多模态对照 ★
padchest 117 胸片多标签对照 ★
vindr-cxr 125 胸片多标注对照 ★
openi 107 胸片 + 报告配对 ★
ms-cxr 340 胸片多模态 ★
chest-imagenome 330 胸片标注生态 ★
covidx-cxr 197 胸片分类生态 ★
vindr-pcxr 629 胸片多标注对照 ★
latte-cxr 612 胸片报告生成 ★
cxr-cardiomegaly 606 胸片单病种分割/检测 ★
cxr-phone 607 胸片采集条件变体 ★
cxr-pro 608 胸片专业评测集 ★
reflacx-xray-localization 623 胸片眼动 + 定位 ★
cxr-lt 657 胸片纵向数据 ★
nih-malaria 502 NIH 系公开影像(生态旁证) ★

8.4 与 RSNA Pneumonia 的关键区别(易混)

维度 SIIM-ACR Pneumothorax RSNA Pneumonia
病种 气胸 肺炎
任务 像素级分割 + 分类 目标检测(框)+ 分类
标注形态 RLE 掩码 bounding box
影像来源 NIH 公开胸片 NIH 系(RSNA 组织)
互链理由 同源影像 + 平行竞赛 见上方表

检索时勿把两者混为一谈——病种、任务、标注形态均不同(坑 9)。

8.5 家族谱系图(文字版)

NIH 公开胸片库(上游影像源)
   │
   ├── NIH ChestX-ray14(rid 15)—— 图像级多标签
   │        └── ChestX-Det10(rid 137)—— 检测标注
   ├── SIIM-ACR Pneumothorax(本条)—— 气胸像素级分割  ← 标注升级层
   ├── RSNA Pneumonia(rid 712)—— 肺炎目标检测
   ├── CheXpert(rid 5)—— 多标签 + 不确定性
   ├── MIMIC-CXR(rid 16)—— 胸片 + 报告
   ├── PadChest(rid 117)/ VinDr-CXR(rid 125)—— 多标注
   └── CheXmask(rid 602)/ Chest X-ray Segmentation(rid 601)—— 分割生态

8.6 使用 SIIM-ACR 的三类典型场景

场景 推荐用法 注意
学习/教学分割 直接用镜像跑 baseline 讲清 RLE 相对编码与 -1 约定
胸片预训练 与其他胸片数据集联合预训练 注意不许再分发(坑 5)
临床转化研究 仅作预训练/对照,另建隔离评测 必须处理患者级泄漏(坑 6)

8.7 对医学影像数据治理的四点启示

  1. 托管不等于持久:GCP 通道下线说明"有官方链接"不代表"长期可得",重要数据集应评估多源冗余。
  2. 竞赛规则是一份被低估的许可证:很多竞赛数据没有标准 SPDX 许可,"Subject to Competition Rules"实质上是一条严格的使用契约,禁再分发是其核心。
  3. 开源镜像的合法性不等于原数据的合法性:镜像把数据传上平台,并不代表它获得了再分发授权——License Unknown 正是这一裂缝的显影。
  4. 缺元信息是隐形的技术债:没有患者 ID 看似保护隐私,实则让下游无法做正确的划分,埋下泄漏隐患。

8.8 为什么它常被引用为"AI-Ready 反例"

“AI-Ready” 通常强调"数据格式标准、接口现成、随时可训"。SIIM-ACR 在前半段是模范(格式与接口无可挑剔),在后半段是警示(授权、存续、患者级质量)。它因此常被用来说明:

  • AI-Ready ≠ 法律可用;
  • AI-Ready ≠ 科学可信(泄漏即例);
  • AI-Ready ≠ 长期可得(通道已死即例)。

这正是它作为百科条目的最大价值:不是又一张胸片数据集,而是一面照出"AI-Ready"这个词边界何在的镜子。


§9 与库内条目的关系

9.1 家族定位

SIIM-ACR Pneumothorax 属于千方病案医数集库内**「胸片(CXR)AI 数据集」家族**,是该家族中唯一以气胸为病种、以像素级分割为主任务的 Kaggle 竞赛条目。它的家族坐标:

  • 同源上游:NIH ChestX-ray14(rid 15)——影像的直接来源。
  • 平行竞赛:RSNA Pneumonia(rid 712)——同为胸片 Kaggle 竞赛,但任务是肺炎检测。
  • 同期生态:CheXpert(rid 5)、MIMIC-CXR(rid 16)、PadChest(rid 117)。
  • 分割同侪:CheXmask(rid 602)、Chest X-ray Segmentation(rid 601)。

9.2 检索入口建议

  • 从 本条目 出发:想看"胸片分割" → 601/602;想看"胸片竞赛" → 712;想看"影像来源" → 15。
  • 从 NIH ChestX-ray14(15) 出发:SIIM-ACR 是它的"气胸像素级标注重标版"分支。
  • 从 RSNA Pneumonia(712) 出发:注意区分——肺炎 vs 气胸、检测 vs 分割。

9.3 组合使用场景

目标 组合
胸片多任务预训练 NIH ChestX-ray14(分类)+ SIIM-ACR(分割)
气胸 vs 肺炎对照 SIIM-ACR + RSNA Pneumonia
胸片分割全景 SIIM-ACR + CheXmask(602) + Chest X-ray Segmentation(601)
胸片 + 报告多模态 SIIM-ACR + MIMIC-CXR(16) / OpenI(107)

9.4 与互链条目并读时的三个注意

  1. 影像来源重叠:SIIM-ACR 与 NIH ChestX-ray14 共享影像来源,联合使用前须做图像级去重,否则训练集内部即产生泄漏。
  2. 任务不可混:SIIM-ACR(分割)与 RSNA Pneumonia(检测)的输出形态不同,不可直接把 RLE 掩码当 bbox 用。
  3. 许可各异:每个互链条目的许可独立,不可因为"同家族"就套用同一许可——NIH ChestX-ray14、CheXpert、MIMIC-CXR 各有各的获取门槛。

9.5 互链强度说明

强度 含义 代表
★★★ 影像来源或直接平行,必链 NIH ChestX-ray14(15)、RSNA Pneumonia(712)
★★ 任务/生态高度相关,推荐链 CheXpert(5)、ChestX-Det10(137)、CheXmask(602)、Chest X-ray Segmentation(601)
★ 同域相关,可选链 MIMIC-CXR(16)、PadChest(117)、VinDr-CXR(125) 等

9.6 家族检索矩阵(按需求查条目)

我想…… 去哪个条目 rid
找气胸分割 本条 —
找胸片多标签分类 NIH ChestX-ray14 15
找肺炎检测 RSNA Pneumonia 712
找胸片多标注/不确定性 CheXpert 5
找胸片掩码分割 CheXmask 602
找胸片检测框 ChestX-Det10 137
找胸片+报告 MIMIC-CXR / OpenI 16 / 107

§10 避坑清单:九个已踩过的坑

坑 1:数据可能"看起来还能下、其实官方通道已死"。
原托管为 GCP Cloud Healthcare API,Kaggle 赛事页已明确「no longer available via Cloud Healthcare API」。任何指向 GCP 的旧教程/脚本都失效——务必改走镜像或库加载器,并在脚本里显式记录数据来源与抓取日期。

坑 2:test 规模有三个数(1,372 / 1,377 / 3,205),别混用。

  • 1,372:PNG 镜像(vbookshelf 类)划分;
  • 1,377:原始竞赛划分;
  • 3,205:二阶段隐藏测试集 / arXiv:2009.02805 口径。
    引用分数前先确认对方用的哪一套;自己报告时也须声明。

坑 3:掩码总数(12,954)大于影像总数(12,047),差 907。
官方未解释差额来源(多掩码/多版本/口径差)。不要把掩码数当作影像数使用;统计样本量时以影像 12,047 为准,掩码数以 12,954 为准并注明差异。

坑 4:DICOM 元数据分辨率 1,824×1,824 ≠ 交付 1,024×1,024。
DICOM 头声明 rows/cols 为 1,824,而竞赛交付 PNG(及多数镜像)为 1,024²。重采样细节未公开——若你的管线假定"原图即 1024²",读 DICOM 时可能被 1,824 值坑到,须显式做 resize 或核对元数据。

坑 5:许可证是三说,以官方竞赛规则为准。
官方为 Subject to Competition Rules(禁再分发);Kaggle 镜像 License 字段为 Unknown;第三方自称 CC-BY-NC 4.0(无背书、与官方冲突)。再分发/商用前必须取得授权方书面许可;把镜像的 Unknown 当作"随便用"是重大合规风险。

坑 6:存在患者级数据泄漏,高分未必可迁移。
Radboud 硕士论文记录训练/测试含相同患者影像;数据集未提供患者级元信息,无法复现患者隔离划分。在 SIIM-ACR 上报告高分时须注明该局限,临床转化评估需另建患者隔离验证集。

坑 7:参赛/提交数字口径略有出入。
不同来源对参赛队伍数与有效提交数表述不一;本条目以 SIIM 官方页 1,475 参赛 / 352 提交为准。引用他处数字时先核对来源。

坑 8:“augmented annotations” 的确切含义未公开。
官方措辞 “augmented annotations on the public … dataset from the NIH” 未说明 “augmented” 是"增量重标"还是"专项增强标注"。不要自行脑补具体标注流程;如需精确表述,以官方原文引用为准。

坑 9:勿与 RSNA Pneumonia 混淆。
SIIM-ACR 是气胸 + 像素级分割(RLE 掩码);RSNA Pneumonia 是肺炎 + 目标检测(bbox)。病种、任务、标注形态三项皆不同。检索与互链时务必分辨。


§11 总结

SIIM-ACR Pneumothorax Segmentation 是一个"技术漂亮、治理棘手"的典型 AI-Ready 数据集样本。把它压缩成三句话:

  1. 技术上它是一位模范生:标准 DICOM + RLE 掩码、12,047 张统一规格胸片、明确的 mean Dice 指标、现成的 torchxrayvision / torch_em 加载器——任何有分割经验的人半天内就能跑通 baseline。

  2. 治理上它是一道难题:竞赛规则明文禁再分发,镜像 License 只能写 Unknown,原始官方通道(GCP Cloud Healthcare API)已经下线。它提醒我们——"能跑"与"能合法地跑"是两件事。

  3. 质量上它是一面镜子:患者级泄漏与类别不均衡,使它成为讨论"数据集划分设计如何决定评估可信度"的绝佳案例。

给三类读者的建议:

  • 模型开发者:可以直接用它练手/预训练,但报告结果务必注明泄漏局限与划分口径(坑 2、坑 6)。
  • 数据治理研究者:把它作为"技术可用 vs 治理受限 vs 存续脆弱"三重张力的标准案例。
  • 临床转化评估者:不要直接采信榜单分数,先补患者级隔离验证(坑 6)。

一句话结论:SIIM-ACR 是胸片气胸分割的事实标准起点,也是"AI-Ready" 这个词最需要被认真对待的地方——数据准备好了,未必意味着授权、存续与质量也准备好了。


FAQ(高频问答 60 问)

Q1:这个数据集是哪一年发布的?
赛事 2019-06-25 开赛、2019-09-05 截止。广泛作为基准被文献使用则从 2020 起(发布年份双口径,见附录 D)。

Q2:主办方是谁?
SIIM(Society for Imaging Informatics in Medicine)、ACR(American College of Radiology)、STR(Society of Thoracic Radiology)、MD.ai。

Q3:图像是哪里来的?
NIH 公开胸片数据的专业增强标注(augmented annotations),不是新采集数据。

Q4:一共有多少张图?
12,047 张唯一胸片;掩码 12,954 个(掩码数大于影像数,坑 3)。

Q5:阳性样本占多少?
22.15%(2,669 个阳性掩码),阴性 77.85%(9,378 个)。

Q6:图像分辨率是多少?
交付 1,024×1,024 灰度(PNG);DICOM 元数据声明 1,824×1,824(不一致,坑 4)。

Q7:掩码是什么格式?
RLE(run-length encoding)相对编码;无气胸样本记 -1。

Q8:怎么读 RLE?
先判 -1(无气胸);其余为"起点-长度"相对数对,解析时须累积求和还原绝对像素位置。

Q9:评估指标是什么?
mean Dice coefficient(逐样本 Dice 取均值)。

Q10:排行榜第一名多少分?
0.8679(dsmlkz);第二 0.8665(X5);第三 0.8651(bestfitting)。

Q11:有多少支队伍参赛?
1,475 队参赛、352 队有效提交(SIIM 官方口径)。

Q12:奖金多少?
总奖金 $30,000,一等奖 $12,000。

Q13:现在还能从官方下载吗?
不能——原始 GCP Cloud Healthcare API 通道已下线(坑 1)。

Q14:那怎么下载?
社区镜像(Kaggle Datasets、Academic Torrents)或库加载器(torchxrayvision / torch_em)。

Q15:许可证是什么?
官方为"Subject to Competition Rules(禁再分发)";Kaggle 镜像 License 显示 Unknown(坑 5)。

Q16:能商用吗?
公开页未给商用授权;竞赛规则禁再分发。商用前须取得授权方书面许可(坑 5)。

Q17:能再分发吗?
不能——竞赛规则明文禁止 transmit / duplicate / publish / redistribute。

Q18:患者级泄漏是怎么回事?
Radboud 硕士论文指出训练/测试含相同患者影像;数据集无患者级元信息,无法患者隔离划分(坑 6)。

Q19:泄漏会影响我的结果吗?
会——报告的 Dice 可能乐观高估;临床转化评估须另建患者隔离验证集。

Q20:哪些库支持加载?
torchxrayvision.SIIM_Pneumothorax_Dataset(unique_patients/pathology_masks 参数)与 torch_em.data.datasets.medical.siim_acr(checksum-verified)。

Q21:train/test 怎么划分的?
常见:train ≈ 10,675 / test ≈ 1,372(PNG 镜像);另有 1,377(原始)与 3,205(round-2)(坑 2)。

Q22:为什么 test 有 1,372/1,377/3,205 三个数?
分别来自 PNG 镜像划分、原始划分、二阶段隐藏测试集,来源不同、不可混用(坑 2)。

Q23:类不均衡怎么处理?
正样本过采样、损失加权/focal loss、分割后处理阈值调优、两阶段(先分类后分割)等。

Q24:有没有观察者间一致性数据?
公开页未提供 inter-observer agreement 指标(§3.5)。

Q25:“augmented annotations” 是什么意思?
官方未展开;可能是增量重标或专项增强标注,不可自行确证(坑 8)。

Q26:和 RSNA Pneumonia 有什么区别?
SIIM-ACR=气胸+分割(RLE);RSNA Pneumonia=肺炎+检测(bbox)(坑 9)。

Q27:和 NIH ChestX-ray14 什么关系?
影像同源——SIIM-ACR 是 NIH 公开胸片在气胸任务上的像素级标注重标版(库内互链 rid 15)。

Q28:12,954 和 12,047 哪个是样本量?
影像以 12,047 为准,掩码以 12,954 为准;二者不同且差额 907 未解释(坑 3)。

Q29:数据页多大?
Kaggle 数据页标注 439.11 MB(镜像形态各异,不代表全部)。

Q30:为什么条目反复强调"坑点"?
因为该数据集的真实风险不在算法而在数据本身——通道下线、许可不明、患者泄漏、口径冲突。写清坑,才能让下游不重复踩雷。

Q31:detailed_class_info 有什么额外信息?
提供了 Normal / No Pneumothorax / Pneumothorax 三分类,可用于区分"真正常"与"有异常但非气胸",对假阳性分析有用(§2.7)。

Q32:数据解压后多大?
数据页标注 439.11 MB 为压缩交付包;解压后随镜像实现为数 GB 级(§2.8),规划磁盘时按解压后规模预留。

Q33:为什么没有患者 ID?
出于隐私保护,仅提供 UUID 匿名化标识;这同时导致无法做患者级划分,是泄漏问题的成因之一(§5.3)。

Q34:我能不能自己按患者切分?
不能——数据集未提供患者级元信息,无法可靠地把同患者影像分到同一侧(§5.6 路径二只能近似)。

Q35:SIIM-ACR 适合做教学吗?
非常适合:粒度清晰、任务明确、加载器现成;但作为教学案例时务必讲清 RLE 相对编码与 -1 约定,以及许可限制。

Q36:榜单前三名用的是同一划分吗?
竞赛榜单统一使用官方评测划分;但社区镜像的 train/test 划分可能与之不同(坑 2),复现时须对齐。

Q37:mean Dice 0.87 算高吗?
在该数据集内部算顶尖;但受患者级泄漏影响,不可直接解读为"临床可用水平"(坑 6、§7.6)。

Q38:有没有预训练模型可直接用?
torchxrayvision 等库提供了在该数据集上训练的模型与基线,可直接加载;使用前仍须遵守许可(坑 5)。

Q39:可以把 SIIM-ACR 和 NIH ChestX-ray14 一起训练吗?
可以,但必须先做图像级去重——两者影像同源,直接合并会导致训练集内部泄漏(§9.4)。

Q40:RLE 的 -1 和空串是一回事吗?
语义相同(都表示无气胸),但表示形式依镜像而异(字符串 “-1” / 空串 / NaN),解析时须先归一(附录 F)。

Q41:DICOM 读取要注意什么?
注意 rows/cols 可能为 1,824 而非 1,024,须显式 resize 或核对元数据,否则尺寸对不上(坑 4)。

Q42:为什么阳性比例只有 22%?
气胸在胸片总体人群中本就不高发;采集自公开胸片库时未做阳性富集,故阳性为少数类(§5.2)。

Q43:分割和分类哪个更适合先做?
多数方案先做像素级分割,再对掩码求和判断有无(分割为零即阴性);也有两阶段(先分类、后对阳性样本分割)的做法。

Q44:SIIM 和 RSNA 是同一个组织吗?
不是。SIIM=医学影像信息学学会;RSNA=放射学会(北美放射学会),是另一个竞赛的组织方(坑 9)。

Q45:数据集名里的 “ACR” 是什么?
American College of Radiology,美国放射学会,是本竞赛的联合主办方之一。

Q46:MD.ai 在这里做什么?
提供标注平台与基础设施支撑(医学影像标注工具方)。

Q47:条目里的 rid 是什么意思?
库内条目的记录标识(record id),用于互链定位;rid 经库内 status=1 查询核对(§8.3)。

Q48:为什么说它"AI-Ready 但治理受限"?
技术上数据格式标准、加载器现成(AI-Ready);但许可禁再分发、通道下线、无患者元信息(治理受限)。二者构成核心张力(§11)。

Q49:如果我只想引用一个数字,引哪个?
引用规模引 12,047 张影像;引用性能引榜首 0.8679;引用参与规模引 1,475/352——并附上相应坑点说明。

Q50:这条目多久维护一次?
以附录 J 的触发点为准:赛事页状态变化、新许可声明、新泄漏研究、加载器接口变更、镜像下架,任一发生即须复核。

Q51:为什么原始通道会下线?
公开页未说明具体原因;常见的技术/政策原因包括托管成本、隐私合规调整、平台策略变化等,但均属推测,不可作为事实陈述。

Q52:现在还能拿到 1,824×1,824 的原图吗?
DICOM 元数据声明该分辨率,但交付多为 1,024²;能否取得原尺寸取决于镜像是否保留原始 DICOM(坑 4)。

Q53:分割掩码能不能直接转成检测框?
技术上可由掩码外接矩形近似得到 bbox,但精度与语义都与原生检测标注不同,做检测基准时应使用专门的检测数据集(如 RSNA Pneumonia / ChestX-Det10)。

Q54:气胸分割在临床上有哪些落地场景?
急诊/创伤快速筛查、术后与置管后并发症监测、体检胸片自动预筛、基层医师辅助诊断等;但均须在患者隔离验证后才可评估真实价值。

Q55:条目为什么区分"技术资产/治理样本/质量案例"三重身份?
因为同一个数据集在不同读者眼里价值不同:工程师看技术、合规看治理、研究者看质量——分列三种身份便于各取所需(§0.4)。

Q56:FACTS.md 与成稿是什么关系?
FACTS.md 是三源互证的事实底稿(九节),成稿在其基础上按百科结构展开;冲突与疑点在两者中均逐条存照。

Q57:为什么强调"以官方口径为准"?
因为第三方来源(镜像自述、博客)常与官方冲突(如许可 CC-BY-NC 自述),若不加鉴别会引入错误结论(坑 5)。

Q58:如果官方页也更新了,条目怎么办?
按附录 J 维护触发点复核并更新;条目内所有时效性结论均标注了抓取时点(2026-09-30)。

Q59:这个数据集与"胸部 X 光 AI 是否已成熟"的关系?
它是胸片 AI 从"图像级分类"走向"像素级分割"的标志性一步,但患者级泄漏与治理问题提醒:成熟度不能只看榜单分数。

Q60:一句话推荐给不同读者?
工程师:值得练手,注意许可;研究者:可作基准,须声明泄漏;治理者:必读案例,照见 AI-Ready 的边界。


事实清单(硬事实 36 条)

# 硬事实 来源
1 数据集名为 SIIM-ACR Pneumothorax Segmentation Kaggle
2 主办方为 SIIM / ACR / STR / MD.ai Kaggle 赛事页
3 开赛 2019-06-25 Kaggle 赛事页
4 截止 2019-09-05 Kaggle 赛事页
5 任务为像素级气胸分割 + 有无分类 Kaggle 赛事页
6 评估指标为 mean Dice coefficient Kaggle 赛事页
7 影像来自 NIH 公开胸片的增强标注 SIIM 官方页
8 唯一影像 12,047 张 多源一致
9 掩码总数 12,954 个 torchxrayvision 文档
10 阳性掩码 2,669(22.15%) 镜像统计
11 阴性掩码 9,378(77.85%) 镜像统计
12 掩码数 > 影像数,差 907(未解释) 计算
13 交付分辨率 1,024 × 1,024 Kaggle 数据页
14 DICOM 元数据分辨率 1,824 × 1,824 DICOM 头
15 掩码为 RLE 相对编码 Kaggle 数据页
16 无气胸样本掩码记 -1 镜像/规则
17 数据页体积 439.11 MB Kaggle 数据页
18 榜首 mean Dice 0.8679(dsmlkz) Kaggle 排行榜
19 第二 0.8665(X5) Kaggle 排行榜
20 第三 0.8651(bestfitting) Kaggle 排行榜
21 参赛 1,475 队 SIIM 官方页
22 有效提交 352 队 SIIM 官方页
23 总奖金 $30,000 SIIM 官方页
24 一等奖 $12,000 Kaggle 赛事页
25 第 124 名 mean Dice 0.8356 arXiv:2009.02805
26 train ≈ 10,675(PNG 镜像) 镜像
27 test ≈ 1,372(PNG 镜像) 镜像
28 test ≈ 1,377(原始划分) 原始
29 round-2 test 3,205 arXiv:2009.02805
30 原托管为 GCP Cloud Healthcare API Kaggle 赛事页
31 原始通道已下线 Kaggle 赛事页
32 竞赛规则禁再分发 竞赛规则文本
33 Kaggle 镜像 License 显示 Unknown Kaggle 数据页
34 存在患者级数据泄漏 Radboud 硕士论文
35 加载器 torchxrayvision.SIIM_Pneumothorax_Dataset torchxrayvision 文档
36 加载器 torch_em…siim_acr(checksum-verified) torch_em 文档

事实清单(补充 10 条)

# 硬事实 来源
37 detailed_class_info 提供三分类(Normal / No Pneumothorax / Pneumothorax) 镜像 CSV
38 数据页标注体量 439.11 MB(压缩交付) Kaggle 数据页
39 参赛组织含 STR(Society of Thoracic Radiology) Kaggle 赛事页
40 提供 stage_2_sample_submission.csv 提交模板 镜像
41 掩码与影像同尺寸(1,024²)逐像素对齐 镜像
42 社区常用 U-Net 类编码-解码结构 复盘材料
43 库内互链 NIH ChestX-ray14 rid=15 库内查询
44 库内互链 RSNA Pneumonia rid=712 库内查询
45 库内互链 CheXpert rid=5 库内查询
46 库内互链 CheXmask rid=602 库内查询

说明:补充 10 条与前述 36 条共同构成本条目的事实骨架;凡标注"镜像 CSV/复盘材料"者为基于公开镜像与社区材料的观察,非官方页逐字陈述。


术语表(28 条)

术语 英文 释义
气胸 pneumothorax 胸膜腔积气致肺塌陷的病变
胸片 chest radiograph / CXR 胸部 X 光片
语义分割 semantic segmentation 逐像素分类任务
像素级掩码 pixel-level mask 标注每个像素归属的掩码
Dice 系数 Dice coefficient 2\
mean Dice mean Dice coefficient 逐样本 Dice 取均值
RLE run-length encoding 游程编码,压缩连续区段
相对 RLE relative RLE 以相对偏移表示区段位置的 RLE
DICOM Digital Imaging and Communications in Medicine 医学影像标准格式
UUID 匿名化 UUID anonymization 用通用唯一标识符替代患者身份
患者级泄漏 patient-level data leakage 同患者跨 train/test 造成评估乐观
类别不均衡 class imbalance 正负样本比例失衡
NIH National Institutes of Health 美国国立卫生研究院
SIIM Society for Imaging Informatics in Medicine 医学影像信息学学会
ACR American College of Radiology 美国放射学会
STR Society of Thoracic Radiology 胸部放射学会
MD.ai — 医学影像标注平台
增强标注 augmented annotations 官方对影像标注流程的措辞
目标检测 object detection 输出边界框的任务(RSNA 口径)
边界框 bounding box / bbox 检测任务的矩形标注
U-Net U-Net 经典编码-解码分割网络
后处理 post-processing 对模型输出的规则化修正
focal loss focal loss 缓解类别不均衡的损失函数
过采样 oversampling 重复采样少数类
校验和 checksum 校验下载文件完整性的哈希
torchxrayvision — 胸片 AI 数据集/模型库
torch_em — 生物医学图像分割训练库
AI-Ready AI-Ready 数据可直接用于 AI 训练的程度

附录

附录 A:条目信息速查卡

项 值
条目名 SIIM-ACR Pneumothorax Segmentation
url_name siim-acr-pneumothorax
类型 竞赛数据集(分割 + 分类)
主办 SIIM / ACR / STR / MD.ai
年份 2019
规模 12,047 影像 / 12,954 掩码
规格 DICOM/PNG 1,024²,RLE 掩码
指标 mean Dice
榜首 0.8679(dsmlkz)
许可 Subject to Competition Rules(禁再分发);镜像 Unknown
抓取时点 2026-09-30
库内互链 nih-chest-x-ray14(15)/rsna-pneumonia(712)/chexpert(5)/chestx-det10(137)/chexmask-cxr-segmentation-data(602)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 7 赛事页/论文/镜像均可索引,名称唯一不易混;但原名较长,社区多用简称
A 可获取性 4 原始官方通道已下线,仅靠社区镜像与库加载器——最大失分项
I 可互操作 8 标准 DICOM + 标准 RLE + torchxrayvision/torch_em 加载器,互操作性强
M 元数据质量 5 有基本字段但缺患者级元信息、缺标注一致性指标;多处口径冲突(坑 2/3/4)
S 可持续性 4 无官方托管、镜像无 SLA、许可不明,长期可得性脆弱
综合评级 5.6/10(中) 技术互操作强(I=8),但获取、元数据、可持续三处拖累,治理风险突出

附录 C:逐项证据链自证

关键数字 来源 备注
12,047 影像 Kaggle 镜像 / torchxrayvision 文档 / arXiv 三源一致
12,954 掩码 / 2,669 阳性 / 9,378 阴性 torchxrayvision 文档 / 镜像统计 掩码口径
1,024×1,024 Kaggle 数据页 交付口径
1,824×1,824 DICOM 头 原始元数据口径(坑 4)
0.8679 / 0.8665 / 0.8651 Kaggle 排行榜 前三名
1,475 参赛 / 352 提交 SIIM 官方页 参与口径
$30,000 / $12,000 SIIM 官方页 / Kaggle 奖金
0.8356(rank 124) arXiv:2009.02805 基线
3,205(round-2 test) arXiv:2009.02805 二阶段
通道下线 Kaggle 赛事页原文 治理关键
禁再分发 竞赛规则文本 治理关键
患者级泄漏 Radboud 硕士论文 质量关键

附录 D:双口径冲突汇总表

冲突 口径 A 口径 B 口径 C 处置
样本数 影像 12,047 掩码 12,954 差 907 未解释 分别标注,不合并(坑 3)
test 规模 1,372(PNG 镜像) 1,377(原始) 3,205(round-2) 三口径并列(坑 2)
分辨率 交付 1,024² DICOM 元数据 1,824² — 并列,注明重采样未公开(坑 4)
许可 官方 Subject to Competition Rules Kaggle 数据显示 Unknown 第三方自述 CC-BY-NC 以官方为准(坑 5)
发布年份 2019(赛事年) 2020+(文献基准年) — 叙事辨明"赛事年 vs 基准年"
augmented 含义 增量重标(推测) 专项增强标注(推测) 官方未展开 标为遗留疑点(坑 8)

附录 E:数据获取决策树

需求是什么?
├── 快速跑通分割 baseline
│   └── Kaggle 镜像(PNG 1024²)+ 记牢划分口径(坑 2)
├── 严格复现某论文
│   ├── 1) 确认该论文用的划分(1,372/1,377/3,205 哪一套)
│   └── 2) 选对应镜像,勿跨口径比较
├── 需要 DICOM 原格式 / 完整性校验
│   └── torch_em.siim_acr(checksum-verified)或 Academic Torrents
├── 要做临床转化评估
│   └── 先自建患者隔离验证集(坑 6)
└── 要再分发 / 商用
    └── 停 —— 须先取得授权方书面许可(坑 5)

附录 F:RLE 解析骨架(示意)

def rle_decode(mask_rle, shape=(1024, 1024)):
    # 无气胸样本约定:掩码为 -1(或 null)
    if mask_rle is None or (isinstance(mask_rle, str) and mask_rle.strip() == '-1'):
        return np.zeros(shape, dtype=np.uint8)
    s = mask_rle.split()
    starts = np.asarray(s[0::2], dtype=int) - 1          # 1-based -> 0-based
    lengths = np.asarray(s[1::2], dtype=int)
    # 相对 RLE 还原:位置为相对前一区段末端的偏移,需累积求和
    if len(starts) > 1:
        starts[1:] = starts[1:] + starts[:-1] + lengths[:-1]
    img = np.zeros(shape[0] * shape[1], dtype=np.uint8)
    for st, ln in zip(starts, lengths):
        img[st: st + ln] = 1
    return img.reshape(shape)

注意:不同镜像对 -1 的表示(字符串 -1 / 空串 / NaN)可能不同;相对 RLE 的偏移累加规则亦须以镜像文档为准——上线前先用若干样本做可视化自检。

附录 G:检索路径示范(关键词组合与查询式)

目标 推荐查询式 预期命中
赛事主页 site:kaggle.com siim-acr-pneumothorax-segmentation Kaggle Competitions
数据页 siim-acr-pneumothorax-segmentation/data Kaggle 数据页(439.11 MB,RLE)
官方主办页 site:siim.org pneumothorax kaggle SIIM 官方页(1,475/352/$30,000)
复盘论文 “siim-acr” ARXIV pneumothorax segmentation arXiv:2009.02805
库加载器 torchxrayvision SIIM_Pneumothorax_Dataset 文档页(12,954 掩码)
校验和加载器 torch_em siim_acr dataset 文档页(checksum)
泄漏证据 siim acr pneumothorax patient level leakage thesis Radboud 硕士论文
镜像 site:kaggle.com/datasets siim acr pneumothorax vbookshelf / seesee 等镜像
反例(勿混) “siim-acr” pneumonia detection 错配 RSNA(坑 9)

检索卫生两条:一、凡命中"GCP Cloud Healthcare API / DICOM 直读"的旧教程,均基于已下线的原始通道,不可照抄(坑 1);二、凡遇"test 1,372 / 1,377 / 3,205"数字,先确认划分来源再比较(坑 2)。

附录 H:库加载器使用示例(示意)

# 方式一:torchxrayvision
import torchxrayvision as xrv
ds = xrv.datasets.SIIM_Pneumothorax_Dataset(
    imgpath="path/to/siim/images",
    csvpath="path/to/siim/train-rle.csv",
    unique_patients=True,      # 去重患者(缓解泄漏的第一道闸)
    pathology_masks=True,      # 返回像素级掩码
)

# 方式二:torch_em(带校验和)
import torch_em
from torch_em.data.datasets.medical import siim_acr
path = siim_acr.get_siim_acr_data(path="data", download=True)  # 校验和验证

两个加载器均把"竞赛数据"封装为可编程接口,但许可约束不因此改变(坑 5)。上线前核对加载器版本与数据划分口径。

附录 I:坑点档案(与 §10 对照)

坑 一句话档案 触发场景
坑 1 原始 GCP 通道已下线,旧教程全失效 数据获取
坑 2 test 三口径 1,372/1,377/3,205 基准比较
坑 3 掩码 12,954 > 影像 12,047,差 907 样本量统计
坑 4 DICOM 1,824² vs 交付 1,024² 读 DICOM/预处理
坑 5 许可三说,官方禁再分发 再分发/商用
坑 6 患者级泄漏致高分乐观 结果报告/临床转化
坑 7 参赛/提交数字来源不一 引用参与规模
坑 8 augmented 含义官方未展开 标注流程描述
坑 9 勿与 RSNA Pneumonia 混 检索/互链

附录 J:自检与维护触发点

触发点 动作
Kaggle 赛事页更新(数据下线状态变化) 复核 §6.1 与坑 1
出现新的官方托管/授权声明 复核 §6.1-6.2 许可与获取
新论文报告患者级划分结果 复核 §5.3 泄漏描述
库加载器接口变更 复核附录 H 与 §6.2
镜像下架 复核 §6.2 三层可获取性

附录 K:许可速查卡

对象 许可/约束 能否再分发 能否商用
原始竞赛数据 Subject to Competition Rules 否 未授权(须另行许可)
Kaggle 镜像 License 字段 Unknown 否(无授权) 否(无授权)
第三方镜像自述 CC-BY-NC 4.0(无背书) 存疑 否(NC)
以数据训练的模型 未明确 存疑 须与权利方确认

一句话:没有任何一条给出"可以自由再分发/商用"的授权。默认按"不可再分发、商用须许可"处理。

附录 L:类别分布与训练策略对照

类别 占比 训练策略
阳性(气胸) 22.15% 过采样 / 加权损失 / focal loss
阴性(无气胸) 77.85% 保持但防其主导梯度

验证策略:分层抽样保持正负比;评估时分别看阳性子集与全集 Dice,避免阴性样本掩盖阳性漏检。

附录 M:常见误用清单

误用 后果 正解
把掩码数当影像数 样本量虚高 907 影像以 12,047 计(坑 3)
用 GCP 旧脚本下载 全部失败 改走镜像/加载器(坑 1)
混用 test 口径比较分数 结论不可比 声明划分(坑 2)
假定 DICOM 即 1024² 尺寸错配 核对 rows/cols(坑 4)
采信镜像 CC-BY-NC 合规风险 以官方规则为准(坑 5)
直接采信榜单分数 高估临床性能 声明泄漏并加隔离验证(坑 6)

附录 N:术语与缩略语对照

缩略 全称
CXR Chest X-Ray(胸部 X 光片)
DICOM Digital Imaging and Communications in Medicine
RLE Run-Length Encoding(游程编码)
DSC Dice Similarity Coefficient
GCP Google Cloud Platform
SIIM Society for Imaging Informatics in Medicine
ACR American College of Radiology
STR Society of Thoracic Radiology
NIH National Institutes of Health
AI-Ready 数据可直接用于 AI 训练的程度
DAIMS Discoverability / Accessibility / Interoperability / Metadata / Sustainability

附录 O:条目可靠性自评

维度 状况
数据规模数字 三源一致(多镜像 + 文档),可靠
许可结论 官方规则 + 平台字段 + 第三方自述三源,结论明确
泄漏结论 单一权威来源(Radboud 论文),标注为文献结论
口径冲突 已逐条存照,未强行择一
遗留疑点 907 差额、augmented 含义、患者元信息缺失,已列明

附录 P:与任务头纪律包的对应

纪律要求 本条目落实
存在性核验(教训 12) 三轮核验,见 FACTS.md §1.3
slug 查重 无冲突,见 FACTS.md §1.4
双口径存照 附录 D 汇总六项冲突
坑点 ≥5 §10 九则(坑 1-9)
DAIMS 表 附录 B
category_tags 受控 取自词表 5 个

尾注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 A。事实陈述以 Kaggle 赛事页/数据页、SIIM 官方页、arXiv:2009.02805、Kaggle 排行榜、torchxrayvision 与 torch_em 文档、Radboud 硕士论文为源;口径冲突(样本数、test 规模、分辨率、许可、发布年份)与遗留疑点(907 差额、augmented 含义、患者级元信息缺失)已在 §10 与附录 D 逐条存照。条目与库内 NIH ChestX-ray14(rid 15)、RSNA Pneumonia(rid 712)、CheXpert(rid 5)、ChestX-Det10(rid 137)、CheXmask(rid 602)等条目互链,构成胸片 AI 数据集家族的完整检索面。后续维护触发点见附录 J。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • rsna-pneumonia — 共享标签:医学影像 / X光影像 / 挑战赛数据集 / 评测基准
  • mitoem — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 评测基准
  • chexlocalize — 共享标签:医学影像 / X光影像 / 医学图像分割 / 评测基准
  • chexmask-cxr-segmentation-data — 共享标签:医学影像 / X光影像 / 医学图像分割
  • chexmask-u — 共享标签:医学影像 / X光影像 / 医学图像分割
  • lung-segment-mimic-cxr — 共享标签:医学影像 / X光影像 / 医学图像分割
  • mimic-cxr-ext-ils — 共享标签:医学影像 / X光影像 / 医学图像分割
  • tus-rec — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
  • cxr-lt — 共享标签:医学影像 / X光影像 / 挑战赛数据集 / 评测基准
  • brixia-peru — 共享标签:医学影像 / X光影像 / 医学图像分割 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集