信息速览
INFOBOX — SIIM-ACR Pneumothorax 一屏速览
维度 内容 本质 2019 Kaggle 胸部 X 光气胸像素级分割竞赛数据集(SIIM/ACR/STR/MD.ai 主办) 影像来源 NIH 公开胸片数据的专业增强标注(augmented annotations),非新采集 规模 12,047 张唯一胸片;掩码 12,954 个(阳性 2,669 / 22.15%,阴性 9,378 / 77.85%) 规格 DICOM 灰度 1,024×1,024(PNG 交付);DICOM 元数据声明 1,824×1,824(口径冲突) 掩码 RLE(run-length encoding)相对编码;无气胸样本记 -1 划分 train ≈ 10,675|test ≈ 1,372(PNG 镜像)/ 1,377(原始)|round-2 3,205 任务 像素级分割 + 有无气胸分类;指标 mean Dice coefficient 战绩 榜首 0.8679(dsmlkz)/ 0.8665(X5)/ 0.8651(bestfitting) 参与 1,475 队参赛、352 队有效提交;总奖金 $30,000 已知缺陷 患者级数据泄漏(同患者跨 train/test,Radboud 硕士论文);类别不均衡 获取 原 GCP 通道已下线|Kaggle/academic torrents 镜像|torchxrayvision / torch_em 加载器 许可 竞赛规则禁再分发|镜像 License Unknown|第三方自述 CC-BY-NC(冲突) 库内互链 NIH ChestX-ray14(影像来源)、RSNA Pneumonia(平行竞赛)、CheXpert、ChestX-Det10、CheXmask
SIIM-ACR Pneumothorax Segmentation 是一个把"胸片上的气胸区域圈出来"这件事变成公开竞赛的经典数据集:12,047 张来自美国国立卫生研究院(NIH)公开胸片库的图像,被放射科专家逐像素重新标注了气胸范围,1,475 支队伍在 2019 年的 Kaggle 赛场上比谁的 Dice 系数更高。它的技术形态几乎无可挑剔——标准 DICOM、标准 RLE、现成的库加载器;但它的叙事价值恰恰在技术之外:原始托管通道已经下线,竞赛规则明文禁止再分发,镜像的许可证只能写"Unknown"。它因此成为观察"AI-Ready 数据"三重张力(技术可用 / 治理受限 / 存续脆弱)的绝佳样本。
导语读法三则:
- 只想下数据跑模型:直奔 §6 获取与许可——原通道已死,走镜像或库加载器,但先读许可证那一节。
- 关心数据治理与泄漏:直奔 §5 与 §10 的坑 5、坑 6——患者级泄漏与"禁再分发"是所有下游研究的隐形天花板。
- 做胸片 AI 竞品对标:直奔 §7 评估与基准 + §9 互链地图——NIH ChestX-ray14 / RSNA Pneumonia / CheXpert 的家族关系一目了然。
§0 导读:这个数据集解决什么问题
0.1 一句话定义
SIIM-ACR Pneumothorax Segmentation 是 2019 年 Kaggle 平台上一场以"胸片气胸区域像素级分割"为任务的公开竞赛所发布的数据集,由 SIIM(医学影像信息学学会)、ACR(美国放射学会)、STR(胸部放射学会)与 MD.ai 联合主办,影像来自 NIH 公开胸片数据、标注为专家增强标注(augmented annotations)。
0.2 为什么是"气胸"
气胸(pneumothorax)指胸膜腔内积气、导致肺组织部分或全部塌陷。临床上它可能由外伤、自发性破裂或医源性操作(如穿刺、中心静脉置管)引起,严重时可危及生命。在胸部 X 光片(CXR)上,气胸表现为肺野外缘与胸壁之间出现一条无肺纹理的透亮带(胸膜线)。
- 诊断价值:气胸是急诊与重症场景的高频、危及生命病变,早识别直接影响处置决策。
- 图像特征:气胸区域在 CXR 上有相对清晰的边界(可见胸膜线),这为像素级分割提供了可行性——不像某些弥漫性病变那样边界模糊。
- 量化价值:气胸的严重程度与塌陷范围直接相关,逐像素分割天然给出"塌陷面积占比"这一临床可用的量化指标。
0.3 为什么是"像素级分割"而非"分类"
传统胸片 AI 任务多为图像级分类(有/无某病变)。SIIM-ACR 选择像素级分割(semantic segmentation),原因有三:
- 可解释性:分割掩码直接可视化"模型认为气胸在哪里",比一个概率值对临床医生更可核验。
- 量化能力:分割掩码可计算面积/占比,支持严重程度分级。
- 评测刚性:像素级 Dice 是一个难以通过分类捷径(如只看图像全局特征)刷高的指标,能更真实地衡量模型对局部结构的理解。
0.4 这个数据集的三个"身份"
| 身份 | 内涵 | 对应章节 |
|---|---|---|
| 技术资产 | 标准 DICOM + RLE,现成库加载器,训练管线成熟 | §2、§6.2 |
| 治理样本 | 竞赛规则禁再分发、镜像 license Unknown、原始通道下线 | §6、§10 |
| 质量案例 | 患者级泄漏、类别不均衡、口径冲突,是"数据质量决定模型上限"的教材 | §5、§10 |
0.5 导读路线图
- 求快:§1 速览 → §6 获取 → 动手。
- 求全:按 §0→§9 顺读,跳过 FAQ 亦可。
- 求判:§4 硬数字 + §6 许可 + §10 避坑清单 + 附录 B 的 DAIMS 评估,是最短的"要不要用"决策路径。
0.6 阅读前必知的三条底线
在动手使用本数据集前,请先记住三条底线——它们贯穿全文,也是本条目存在的理由:
- 许可底线:竞赛规则明文禁止再分发/复制/发布数据;Kaggle 镜像的 License 显示 Unknown。再分发或商用前必须获得授权方书面许可(§6.1、坑 5)。
- 获取底线:原始官方通道(GCP Cloud Healthcare API)已下线,现存获取依赖社区镜像与库加载器,无官方 SLA(§6.2、坑 1)。
- 质量底线:数据集存在患者级数据泄漏(同患者跨 train/test),报告的 Dice 分数可能乐观高估;临床转化前须另建患者隔离验证集(§5.3、坑 6)。
0.7 本条目的一句话立论
SIIM-ACR Pneumothorax 在技术上是"AI-Ready 的模范生",在治理与质量上却是"AI-Ready 的警示牌"——本条目既讲前者怎么做,也讲后者为什么重要。
0.8 章节与读者需求对照
| 你想知道 | 去读 |
|---|---|
| 这是什么东西 | §0、§1 |
| 有多少数据、什么格式 | §2、§4 |
| 标注怎么来的、有什么问题 | §3、§5 |
| 能不能下载、能不能用 | §6 |
| 怎么评测、基线多少 | §7 |
| 在生态里什么位置 | §8、§9 |
| 有哪些坑 | §10 |
| 快速决策 | §11、附录 B |
| 高频疑问 | FAQ |
§1 数据集速览:十问十答
Q1:这个数据集到底是什么?
一场 2019 年 Kaggle 竞赛的数据集:给胸片逐像素标出气胸区域,并判断有无气胸。主办方为 SIIM / ACR / STR / MD.ai,影像源自 NIH 公开胸片数据。
Q2:有多少张图?
12,047 张唯一胸片;另有 12,954 个掩码(掩码数大于影像数,差 907,见坑 3)。
Q3:图像什么格式、多大?
DICOM 灰度图,交付分辨率 1,024×1,024(PNG 形态)或原始 DICOM。注意 DICOM 元数据声明 rows/cols 为 1,824×1,824,与交付 1,024² 不一致(坑 4)。
Q4:掩码怎么编码?
RLE(run-length encoding),相对形式。无气胸的样本掩码记为 -1(不是空串)。
Q5:怎么划分 train/test?
常见口径:train ≈ 10,675,test ≈ 1,372(PNG 镜像,如 vbookshelf 类);另有 1,377(原始划分)与 3,205(二阶段隐藏测试集)。三口径并存(坑 2)。
Q6:评估指标是什么?
mean Dice coefficient:逐样本算 Dice,再取均值。
Q7:最好成绩多少?
榜首 mean Dice 0.8679(dsmlkz),第二 0.8665(X5),第三 0.8651(bestfitting)。共 1,475 队参赛、352 队有效提交(见坑 7 的口径说明)。
Q8:现在还能下载吗?
原始通道(GCP Cloud Healthcare API)已下线;可通过 Kaggle Datasets、Academic Torrents 等社区镜像获取,或用 torchxrayvision / torch_em 的加载器下载。
Q9:许可证是什么?
官方口径为 Subject to Competition Rules,明文禁止再分发/复制/发布;Kaggle 镜像的 License 字段显示 Unknown;某第三方镜像自称 CC-BY-NC 4.0(非权威、与官方冲突)。以官方竞赛规则为准(坑 5)。
Q10:有什么已知的大问题?
患者级数据泄漏——Radboud 大学硕士论文指出训练集与测试集存在相同患者的影像,可能让评估分数偏乐观(坑 6);此外类别高度不均衡(阳性仅 22.15%)。
§2 数据构成与规格
2.1 影像构成
| 项目 | 规格 |
|---|---|
| 模态 | 胸部 X 光片(chest radiograph, CXR) |
| 色彩 | 单通道灰度(grayscale) |
| 交付分辨率 | 1,024 × 1,024(PNG 形态)/ DICOM 原始 |
| DICOM 元数据分辨率 | 1,824 × 1,824(rows/cols)——与交付不一致(坑 4) |
| 位深 | 8-bit(交付 PNG);DICOM 原始位深依设备而定 |
| 患者标识 | UUID 匿名化(无患者 ID 映射、无序列号) |
| 影像来源 | NIH 公开胸片数据的增强标注版本 |
2.2 影像数量与类别分布
| 指标 | 数值 | 占比 |
|---|---|---|
| 唯一影像数 | 12,047 | — |
| 掩码总数 | 12,954 | — |
| 阳性(含气胸)掩码 | 2,669 | 22.15% |
| 阴性(无气胸)掩码 | 9,378 | 77.85% |
读法提示:阳性样本不足四分之一,训练时须处理类别不均衡(加权损失、过采样、后处理阈值调优等)。注意掩码数(12,954)大于影像数(12,047)——这个 907 的差额是条目要反复存照的口径冲突之一。
2.3 划分规模(三口径并存)
| 划分 | 数量 | 来源口径 |
|---|---|---|
| train | ≈ 10,675 | PNG 镜像(vbookshelf 类) |
| test | ≈ 1,372 | PNG 镜像(vbookshelf 类) |
| test | ≈ 1,377 | 原始竞赛划分 |
| test(round-2) | 3,205 | 二阶段隐藏测试集 / arXiv:2009.02805 |
口径警示:1,372 / 1,377 / 3,205 三个 test 数字来自不同划分来源,不可混用亦不可互换。做跨论文比较时,务必先确认对方用的是哪一套划分。
2.4 掩码编码:RLE 相对形式
- 编码:RLE(run-length encoding,游程编码)——用"起点-长度"数对表示掩码中的连续区段。
- "相对"含义:后续数对的位置以相对前一区段末端的偏移表示,而非绝对像素坐标;解析时须做累积求和还原绝对位置。
- 负例约定:无气胸的样本掩码记为
-1,不是空字符串——解析代码若把-1当作正常 RLE 处理会出错,须先判空/判负。 - 与影像的对齐:掩码与影像同尺寸(1,024×1,024),逐像素对齐。
2.5 目录结构(典型镜像形态)
siim-acr-pneumothorax/
├── stage_2_train_images/ # 训练影像(.dcm 或 .png,1,024×1,024)
├── stage_2_test_images/ # 测试影像
├── stage_2_train.csv # train 的掩码 RLE(ImageId, EncodedPixels)
├── stage_2_sample_submission.csv
└── stage_2_detailed_class_info.csv # 逐张的详细类别(附类别细化标签)
2.6 元数据字段
| 字段 | 说明 |
|---|---|
| ImageId | 影像标识(UUID 形态) |
| EncodedPixels | RLE 掩码(-1 表示无气胸) |
| ClassId / 类别 | 详细类别信息(如"无肺"/“有气胸”/"正常"等细化分类,见于 detailed_class_info) |
注意:不同镜像的字段名与文件结构可能略有差异(如
train-rle.csvvsstage_2_train.csv),跨镜像复用代码前先核对列名。
2.7 详细类别信息(detailed class)
除"有气胸 / 无气胸"的二值标签外,数据集还提供了更细的类别划分(stage_2_detailed_class_info.csv),常见三分类口径为:
| 详细类别 | 含义 | 与二值标签的关系 |
|---|---|---|
| Normal | 正常胸片,无气胸、无其他异常 | 阴性 |
| No Pneumothorax | 无气胸,但存在其他异常 | 阴性 |
| Pneumothorax | 有气胸 | 阳性 |
意义与坑点:这一层细分让研究者可区分"真正的正常"与"有异常但非气胸",对假阳性分析(模型把其他病变误认为气胸)尤其有价值。但不同文献引用时对三分类的命名与合并方式可能不同,使用时须核对 CSV 原文,勿想当然假定只有两类。
2.8 数据体量与磁盘占用
| 形态 | 体量 | 备注 |
|---|---|---|
| Kaggle 数据页标注 | 439.11 MB | 官方数据页口径 |
| PNG 镜像(1,024² 灰度) | 数 GB 级 | 解压后;随镜像实现而异 |
| DICOM 原格式 | 更大 | 含完整元数据头 |
提示:数据页标注的 439.11 MB 通常指压缩交付包,解压后占用远大于此。规划磁盘与下载时须按解压后规模预留。
2.9 规格速查总表
| 维度 | 值 |
|---|---|
| 模态 | 胸片(CXR),灰度 |
| 交付分辨率 | 1,024 × 1,024 |
| DICOM 元数据分辨率 | 1,824 × 1,824(坑 4) |
| 影像数 | 12,047 |
| 掩码数 | 12,954(坑 3) |
| 阳性比例 | 22.15% |
| 掩码格式 | RLE 相对编码;无气胸记 -1 |
| 患者标识 | UUID 匿名化(无患者级元信息) |
| 详细类别 | Normal / No Pneumothorax / Pneumothorax(三分类) |
§3 注释流水线
3.1 影像来源:NIH 公开胸片库
SIIM 官方页面明确措辞:该数据集的影像是基于美国国立卫生研究院(NIH)公开展示的胸片数据集做的增强标注(augmented annotations on the public chest radiograph dataset from the National Institutes of Health, NIH)。
这意味着:SIIM-ACR 不是新采集的临床数据,而是对既有 NIH 公开胸片的专业重标。它是 NIH 胸片数据"被二次利用、升级为像素级标注"的产物。
3.2 标注组织
| 环节 | 承担方 |
|---|---|
| 赛事与规则设计 | SIIM / ACR / STR(三家学会) |
| 标注平台与基础设施 | MD.ai |
| 标注执行 | 放射科专家(具体人数/流程未公开逐项说明) |
| 标注对象 | 气胸区域的像素级掩码 + 有无判断 |
3.3 “augmented annotations” 的含义
官方措辞中的 “augmented” 有两种可能解读:(a)在已有标注基础上的增量/扩展重标;(b)针对气胸这一目标病变的专项增强标注。公开页未展开说明其确切含义——这是本条目如实存照的遗留疑点之一(见坑 8)。
3.4 标注粒度的意义
与仅提供图像级标签(有/无气胸)的数据集相比,像素级掩码带来三重增益:
- 可解释性:可视化模型关注的解剖区域,可被临床医生核验。
- 可量化:掩码面积 → 气胸塌陷占比,支持严重程度评估。
- 强约束训练:像素级监督迫使模型学习局部结构,而非依赖全局捷径。
3.5 流水的已知瑕疵
- 无患者级元信息:仅 UUID 匿名化,未提供患者 ID、序列、侧别等可追溯字段 → 下游无法自行做患者级划分。
- 患者级泄漏(见 §5.3):因为无法按患者切分,训练集与测试集可能含相同患者的影像。
- 标注者一致性未公开:无观察者间一致性(inter-observer agreement)指标公开,无法评估掩码的标注噪声水平。
3.6 标注质量对下游任务的影响
像素级掩码的质量直接决定模型上限。当掩码本身存在噪声时:
- 噪声类型一:边界模糊。胸膜线细小,不同标注者对边界的判断可能相差数个像素,导致 Dice 上限被压。
- 噪声类型二:漏标小气胸。微量气胸在小分辨率图上可能只有几十个像素,易被漏标或标错。
- 噪声类型三:不一致的"何为气胸"标准。是否包含皮下气肿、纵隔气肿等邻近表现,若无统一规范则标签不齐。
启示:在没有观察者间一致性指标的情况下,把该数据集的 Dice 视为"与单一标注版本的吻合度",而非"与临床真值的吻合度",是更审慎的解读。
3.7 与图像级标签数据集的对比
| 维度 | 图像级标签数据集(如 NIH ChestX-ray14) | 像素级标注数据集(SIIM-ACR) |
|---|---|---|
| 标签形态 | 每图一个/多个二值标签 | 每图一个像素级掩码 |
| 监督信号强度 | 弱(只知道"有没有") | 强(知道"在哪里、有多大") |
| 标注成本 | 低 | 高(需逐像素勾画) |
| 可解释性 | 低 | 高 |
| 评测刚性 | 低(分类捷径多) | 高(像素级约束) |
SIIM-ACR 的生态价值正在于此:它在 NIH 图像级标签的基础上,为"气胸"这一目标病变补上了成本高昂的像素级监督,把弱监督升级为强监督。
3.8 标注流程的可复现性
- 可复现部分:从影像到 RLE 掩码的解析、训练、评估,完全可在公开镜像上复现。
- 不可复现部分:原始标注流水线(标注者人数、资质、复核机制、争议仲裁)未公开——因此"重做一遍标注会得到同样的掩码吗"无法回答。这是该数据集在"可复现性"维度上的固有短板。
§4 核心发现与硬数字
4.1 竞赛战绩排行榜(前三名)
| 名次 | 选手 | mean Dice |
|---|---|---|
| 1 | dsmlkz | 0.8679 |
| 2 | X5 | 0.8665 |
| 3 | bestfitting | 0.8651 |
4.2 参与规模
| 指标 | 值 |
|---|---|
| 参赛队伍 | 1,475 |
| 有效提交队伍 | 352 |
| 总奖金池 | $30,000 |
| 一等奖 | $12,000 |
| 参考基线 | 第 124 名 mean Dice = 0.8356(top 约 9% 分位) |
口径说明:不同来源对"参赛队伍数"与"有效提交数"的表述略有差异——SIIM 官方页给出 1,475 参赛 / 352 提交。引用时以官方页为准(坑 7)。
4.3 核心数字一览(含来源)
| 硬数字 | 值 | 来源 |
|---|---|---|
| 唯一影像 | 12,047 | Kaggle 镜像 / torchxrayvision 文档 / arXiv 多源一致 |
| 掩码总数 | 12,954 | torchxrayvision 文档 |
| 阳性掩码 | 2,669(22.15%) | 镜像统计 |
| 阴性掩码 | 9,378(77.85%) | 镜像统计 |
| 交付分辨率 | 1,024 × 1,024 | Kaggle 数据页 / 镜像 |
| DICOM 元数据分辨率 | 1,824 × 1,824 | DICOM 头 |
| 数据页体积 | 439.11 MB | Kaggle 数据页 |
| 榜首 Dice | 0.8679 | Kaggle 排行榜 |
| 参赛/提交 | 1,475 / 352 | SIIM 官方页 |
| 总奖金 | $30,000 | SIIM 官方页 |
4.4 核心发现(超越竞赛本身)
- 技术可解性得到验证:像素级 Dice 从早期方案的 ~0.80 提升到榜首 0.8679,证明在 NIH 胸片分辨率下气胸分割是可行的建模任务。
- 但评估可能过于乐观:患者级泄漏(§5.3)使高分未必能迁移到严格患者隔离的真实场景。
- 治理比技术更难:原始通道下线 + 禁再分发,说明"数据可用性"的瓶颈常常不在算法,而在授权与托管。
- 类别不均衡是主要工程挑战:阳性仅 22.15%,阴性样本的假阳性抑制成为区分高分方案的关键之一。
4.5 从榜单分数分布读出的信息
| 观察 | 解读 |
|---|---|
| 前三名差距极小(0.8679 / 0.8665 / 0.8651) | 顶尖方案已逼近该数据集的经验上限,微差多来自后处理/集成细节 |
| 第 124 名 0.8356 | 前 9% 即可达 0.835+,说明方法门槛不高、工程细节决定名次 |
| 高分密集 | 可能部分得益于患者级泄漏(坑 6)——真实患者隔离下上限或更低 |
| 榜单未显示分类侧指标 | 竞赛只评分割 Dice,分类只是副产物,社区常另报 AUC |
4.6 一个"分数—代价"的思考
在 SIIM-ACR 上刷分并不难,难的是判断这个分数意味着什么:
- 若测试集与训练集存在同患者影像(坑 6),高分中包含"记忆成分";
- 若各方案用的划分口径不同(坑 2),分数之间不严格可比;
- 若评测对空掩码样本的处理不同,mean Dice 会系统性偏移。
结论:把榜单分数当作"相对排序信号"是安全的,把它当作"临床性能估计"是不安全的。
§5 任务定义与已知问题
5.1 任务定义
输入:一张 1,024×1,024 灰度胸片(DICOM/PNG)。
输出:
- (a)像素级掩码:气胸区域的二值分割(RLE 编码);
- (b)有无判断:该胸片是否存在气胸(二分类)。
评估:mean Dice coefficient。逐样本 Dice = 2|A∩B| / (|A|+|B|)(A 为预测掩码、B 为真值掩码),再对样本取算术平均。分类侧社区常另报 AUC / 准确率。
5.2 类别不均衡问题
| 类别 | 占比 |
|---|---|
| 阳性(有气胸) | 22.15% |
| 阴性(无气胸) | 77.85% |
影响:若直接用普通交叉熵/Dice 训练,模型倾向预测"无气胸"即可在多数样本上取得不低的整体指标,但对临床最关键的阳性漏检率高。
常见应对:正样本过采样、损失加权、focal loss、分割后处理(阈值调优)、两阶段(先分类后分割)等。
5.3 患者级数据泄漏(核心质量缺陷)
Radboud 大学硕士论文明确指出:SIIM-ACR 数据集的训练集与测试集中存在相同患者的影像。由于数据集未提供患者级元信息(仅 UUID 匿名化),划分无法按患者进行,导致:
- 模型在测试集上可能"见过"同一患者(甚至同一张图的不同版本)的训练影像;
- 报告的 Dice 分数可能被系统性乐观高估;
- 跨研究比较时,若各方划分口径不同,分数不完全可比。
影响评估:这并不否定数据集的训练价值,但意味着——在 SIIM-ACR 上报告的高分,不能直接等同于"在真实临床患者隔离条件下"的性能。做临床转化评估时须额外设计患者级隔离验证集。
5.4 其他已知问题
| 问题 | 说明 | 见 |
|---|---|---|
| 掩码数 > 影像数 | 12,954 vs 12,047,差 907,原因未公开 | 坑 3 |
| test 三口径 | 1,372 / 1,377 / 3,205 | 坑 2 |
| 分辨率不一致 | DICOM 1,824² vs 交付 1,024² | 坑 4 |
| 标注一致性未知 | 无观察者间一致性公开 | §3.5 |
| 原始通道下线 | GCP Cloud Healthcare API 不可访问 | §6.1 |
5.5 泄漏对实验设计的三个具体影响
- 验证集不可信:若从官方 test 中切验证集,验证分数同样被泄漏污染,早停与超参选择都可能选到"记忆型"模型。
- 跨研究不可比:A 论文说 0.87、B 论文说 0.85,"谁更好"在泄漏存在时无法从数字上判定,除非两者用同一划分且同一患者隔离策略。
- 迁移性被高估:在有泄漏的测试集上表现好的模型,迁移到真正患者隔离的新医院数据时可能明显下降。
处方:任何声称"在该数据集上达到 SOTA"的结论,都应以"患者隔离评测"为前提重新验证——而这恰是该数据集因缺元信息而无法直接支持的。
5.6 处理泄漏的三条可行路径
| 路径 | 做法 | 代价 |
|---|---|---|
| 路径一:接受并声明 | 照常在官方划分上评测,但报告时明确标注"含患者级泄漏" | 结论强度受限,但诚实 |
| 路径二:图像级去重 | 用感知哈希/像素相似度找出疑似同患者影像,人工核对后剔除 | 无患者标签,只能近似;可能误删 |
| 路径三:自建隔离集 | 从公开临床数据(如 MIMIC-CXR 等)另建患者隔离的气胸评测集 | 工作量大、需另获授权 |
实务建议:论文/项目若以 SIIM-ACR 为卖点,至少做到路径一;做临床转化前必须做到路径三。
5.7 与其他胸片数据集的"泄漏风险"对照
| 数据集 | 划分依据 | 泄漏风险 |
|---|---|---|
| SIIM-ACR | 图像级(无患者信息) | 高(文献已证同患者跨集) |
| NIH ChestX-ray14 | 官方划分 | 中(划分按患者但图像级任务仍可被图像级捷径影响) |
| MIMIC-CXR | 患者级 | 低(官方提供患者 ID) |
| CheXpert | 患者级 | 低(官方提供患者分组) |
读法:是否提供患者级标识,是判断一个胸片数据集"划分是否可信"的第一道分水岭。SIIM-ACR 恰恰栽在这道线上。
5.8 把问题放回"竞赛语境"理解
为什么一个由三家权威学会主办、标注质量不俗的数据集会留下患者级泄漏这种硬伤?把它放回竞赛语境即可理解:
- 竞赛的目标是"评选出好模型",而非"产出可长期复用的科学基准";
- 竞赛周期短(2019-06 至 2019-09),组织者优先保证评测可运行,患者级划分并非首要考量;
- 数据来自既有公开胸片库,原始库的匿名化程度就未携带患者级标识,SIIM 只是在其上补标注,无法凭空补回患者信息。
结论:患者级泄漏不是"谁疏忽了",而是**"竞赛数据被当作科研基准复用"时的系统性错配**——这是所有"拿竞赛榜当基准"的研究者都该警惕的元问题。
5.9 一份"负责任使用"自查清单
| 自查项 | 是/否 |
|---|---|
| 我是否声明了所用的 train/test 划分口径? | ☐ |
| 我是否在报告中注明了患者级泄漏的局限? | ☐ |
| 我是否确认为合规使用(不涉及再分发/商用)? | ☐ |
| 我的数据来源是镜像还是加载器?是否记录抓取日期? | ☐ |
| 若用于临床转化,我是否另建了患者隔离验证集? | ☐ |
| 我是否核对了 DICOM 分辨率(避免 1824²/1024² 错配)? | ☐ |
§6 获取与许可:三层异构的门怎么进
6.1 授权状况(三源冲突,逐条存照)
| 来源 | 授权声明 | 权威性 |
|---|---|---|
| Kaggle 竞赛规则文本 | Subject to Competition Rules:参赛者同意 not to transmit, duplicate, publish, redistribute 数据 | 最高(官方) |
| Kaggle 数据页 License 字段 | Unknown | 中(平台字段,反映托管方无法声明) |
| 某第三方镜像(GitHub TimoBar/mmsegmentation 提交) | 自称 CC-BY-NC 4.0(且链接误指向 CC BY-SA) | 低(非权威,与官方冲突) |
判定:以官方竞赛规则为准——数据受竞赛规则约束、明确禁止再分发/复制/发布/传播。Kaggle 镜像 License 显示 Unknown,正是因为托管方没有可声明的授权;第三方自称的 CC-BY-NC 缺乏依据,不可采信。
6.2 可获取性三层异构(AI-Ready 核心叙事)
第一层:原始竞赛通道 —— 已失效(DEAD)
- 原托管:Google Cloud Healthcare API(DICOM 直接读取)。
- 现状:Kaggle 赛事页明确标注数据 “no longer available via Cloud Healthcare API”。
- 含义:官方原始获取路径已关闭,任何指向 GCP 的旧教程/脚本均已失效。
第二层:社区镜像 —— 部分存活(MIRROR)
| 镜像 | 形态 | 说明 |
|---|---|---|
Kaggle Datasets(如 vbookshelf/siim-acr-pneumothorax-segmentation) |
PNG 1,024²,12,047 张 | License 显示 Unknown;train/test 划分口径 |
Kaggle Datasets(如 seesee/siim-train-test) |
PNG,train/test 划分 | 供快速上手 |
| Academic Torrents | DICOM 原格式 | torchxrayvision 文档指向的下载源 |
风险:
- 许可不明(Unknown)——使用前须自行评估合规性;
- 划分口径不一——不同镜像的 train/test 切分不同(见坑 2);
- 存续无保障——社区镜像无官方 SLA,可能随时下架。
第三层:库加载器 —— 可用(LOADER)
| 加载器 | 关键参数/特性 |
|---|---|
torchxrayvision.SIIM_Pneumothorax_Dataset |
unique_patients=True、pathology_masks=True;文档称 12,954 个 DICOM 掩码,数据经 Academic Torrents 分发 |
torch_em.data.datasets.medical.siim_acr |
**带校验和(checksum-verified)**的下载函数 |
价值与边界:库加载器把"治理受限的竞赛数据"封装成"可编程、可校验"的 AI-Ready 资产,极大降低使用门槛——但它不改变底层的授权约束,且其可用性仍依赖上游镜像的存活。
6.3 版本链
原始 GCP Cloud Healthcare API(DICOM,官方通道,已下线)
│
├──> Kaggle Datasets 镜像(PNG 1024²,12,047 张,License Unknown)
│ └──> 各种快速上手 notebook / 划分脚本(口径不一)
├──> Academic Torrents(DICOM 原格式)
│ └──> torchxrayvision / torch_em 加载器(可校验封装)
└──> 竞赛复盘仓库(第三方,划分与许可自述)
6.4 获取决策树
你需要什么?
├── 快速跑通分割模型
│ └── 用 Kaggle 镜像(PNG 1024²)+ 记牢划分口径(坑 2)
├── 复现论文/严格对齐
│ └── 先确认论文所用划分(1,372 / 1,377 / 3,205 哪一套),再选对应镜像
├── 需要 DICOM 原格式 / 校验和
│ └── torch_em.siim_acr(checksum-verified)或 Academic Torrents
└── 要再分发 / 商用
└── 停 —— 官方规则禁再分发;须先获得授权方书面许可(坑 5)
6.5 许可合规红线
- 不可再分发:竞赛规则明文禁止 transmit / duplicate / publish / redistribute。
- 镜像 License “Unknown” ≠ 可用:Unknown 表示无授权声明,不等于放任使用。
- 第三方 CC-BY-NC 自述不可依赖:无官方背书,与官方规则冲突。
- 衍生模型的许可边界不明:数据禁再分发是否约束以其训练的模型权重,公开页未明确 → 商用前须与权利方确认(坑 5、坑 9)。
6.6 三层可获取性的对比总表
| 层 | 通道 | 状态 | 许可清晰度 | 可持续性 | 适用场景 |
|---|---|---|---|---|---|
| 第一层 | GCP Cloud Healthcare API | DEAD | 高(官方) | 无 | 已不可用 |
| 第二层 | Kaggle Datasets 镜像 | 存活 | 低(Unknown) | 中(平台稳定但无授权) | 快速上手 |
| 第二层 | Academic Torrents | 存活 | 低 | 中(P2P 依赖种子) | 需 DICOM 原格式 |
| 第三层 | torchxrayvision | 可用 | 低(继承上游) | 中(依赖上游镜像) | 编程加载 |
| 第三层 | torch_em | 可用 | 低(继承上游) | 中(依赖上游镜像) | 需校验和的加载 |
读表结论:没有任何一层同时满足"可用 + 许可清晰 + 可持续"。这是本条目最想传达给读者的结构性事实。
6.7 与其它 AI-Ready 数据集的获取模式对照
| 数据集 | 官方通道 | 许可 | 获取模式 |
|---|---|---|---|
| SIIM-ACR | 已下线 | 禁再分发 | 镜像依赖 |
| NIH ChestX-ray14 | 在线 | 开放 | 官方直链 |
| CheXpert | 在线(需注册) | 研究用途 | 注册制 |
| MIMIC-CXR | 在线(需认证) | 物理学家认证 | 认证制 |
对照启示:SIIM-ACR 是表中唯一官方通道已下线的条目——它因此成为"托管依赖风险"的教科书案例:数据的可得性可以在一夜之间因托管方策略变化而降级,与数据本身的质量无关。
§7 评估与基准
7.1 评估指标:mean Dice
- Dice 系数:
Dice = 2|A ∩ B| / (|A| + |B|),取值 [0,1],1 为完全重合。 - mean Dice:对每个样本算 Dice,再取算术平均(对空掩码样本的处理规则会影响数值,镜像/评测脚本口径须核对)。
7.2 排行榜战绩
| 名次 | 选手 | mean Dice |
|---|---|---|
| 1 | dsmlkz | 0.8679 |
| 2 | X5 | 0.8665 |
| 3 | bestfitting | 0.8651 |
7.3 参与规模与参考基线
| 指标 | 值 |
|---|---|
| 参赛队伍 | 1,475 |
| 有效提交队伍 | 352 |
| 总奖金 | $30,000 |
| 一等奖 | $12,000 |
| 第 124 名基线 | mean Dice 0.8356(top 约 9%) |
7.4 基准使用注意
- 泄漏警告:患者级泄漏(§5.3)意味着榜单高分可能乐观高估。作为 benchmark 引用时必须注明该局限。
- 划分口径:report 分数时声明所用划分(1,372 / 1,377 / 3,205),否则不可比。
- 指标实现差异:不同实现对空掩码、边界像素的处理可能不同,复现时以官方/论文脚本为准。
- 常见做法:多数方案采用 U-Net 类编码-解码结构 + 分类头,配合正样本加权与后处理。
7.5 复现一个 baseline 的最小步骤
1. 取 Kaggle PNG 镜像(1,024²),确认划分口径(坑 2)
2. 解析 train-rle.csv:-1 视为空掩码(坑 3 相关)
3. 用附录 F 的 rle_decode 还原掩码,抽样可视化自检
4. 训练 U-Net 类模型:正样本加权 / focal loss 应对 22.15% 不均衡
5. 评估 mean Dice,注意空掩码样本的处理规则
6. 报告时声明:划分口径 + 患者级泄漏局限(坑 6)
7.6 常见评估陷阱
| 陷阱 | 说明 |
|---|---|
| 空掩码样本处理 | 若把"预测空 + 真值空"的样本 Dice 记为 1 或 0,会系统性改变 mean Dice |
| 阈值未校准 | 分割概率图转二值的阈值影响 Dice,须在同一验证集上校准 |
| 划分混淆 | 用 1,372 划分的分数与用 3,205 划分的分数直接比较(坑 2) |
| 泄漏未声明 | 报告高分却不提患者级泄漏(坑 6) |
7.7 一次完整的评估流程(示意)
第 1 步:确定划分
- 声明:用 1,372(PNG 镜像)还是 1,377(原始)还是 3,205(round-2)
- 目标:论文复现须与原文口径一致(坑 2)
第 2 步:确定指标实现
- mean Dice 中空掩码样本的计分规则(记 1 / 跳过 / 记 0)
- 阈值:0.5 固定还是验证集校准
第 3 步:报告
- 集合指标:mean Dice(全集)
- 分层指标:阳性子集 Dice(暴露漏检)
- 局限声明:患者级泄漏(坑 6)、划分口径(坑 2)
第 4 步:可迁移性说明
- 若用于临床场景,附患者隔离验证结果
7.8 与其它分割基准的横向位置
| 分割基准 | 模态 | 目标 | 指标 |
|---|---|---|---|
| SIIM-ACR | 胸片 | 气胸 | mean Dice |
| CheXmask | 胸片 | 多解剖结构 | Dice/IoU |
| Chest X-ray Segmentation | 胸片 | 肺/心等结构 | Dice |
| (各类 CT/病理分割竞赛) | CT/WSI | 器官/病灶 | Dice/Hausdorff |
读法:SIIM-ACR 是胸片分割里病种单一但标注最深的一档,与"多解剖结构分割"的 CheXmask 互补——前者问"病变在哪",后者问"器官在哪"。
§8 生态与影响
8.1 在胸片 AI 生态中的位置
SIIM-ACR 处于"NIH 胸片数据家族"的标注升级层:上游是 NIH 公开胸片库(以 NIH ChestX-ray14 为代表),SIIM-ACR 在其上增加了气胸专项的像素级掩码,与其它任务(肺炎检测、多标签分类、报告生成)并列为该家族的平行分支。
8.2 对下游的影响
- 推动了胸片分割研究:提供了首个大规模、像素级、气胸专项的公开竞赛基准。
- 辐射到库加载器生态:torchxrayvision、torch_em 等库将其纳入标准数据集接口,使其成为"开箱可用"的训练素材。
- 成为数据治理教学案例:禁再分发 + 通道下线 + License Unknown 的组合,常被用来说明"技术可用 ≠ 合法可用"。
- 成为数据质量警示案例:患者级泄漏使它成为讨论"数据集划分设计"的经典反例。
8.3 库内互链地图(rid 经库内查询核对)
| 条目 | rid | 互链理由 | 强度 |
|---|---|---|---|
| nih-chest-x-ray14 | 15 | 影像直接来源(同一 NIH 胸片库) | ★★★ |
| rsna-pneumonia | 712 | 同为胸片 + NIH 系影像的 Kaggle 竞赛(平行对照) | ★★★ |
| chestx-det10 | 137 | 同源 NIH 胸片库的检测标注集 | ★★ |
| chexpert | 5 | 同期大规模胸片数据集(任务生态对照) | ★★ |
| chexmask-cxr-segmentation-data | 602 | 胸片掩码分割生态 | ★★ |
| chest-x-ray-segmentation | 601 | 胸片分割任务对照 | ★★ |
| mimic-cxr | 16 | 胸片 + 报告多模态对照 | ★ |
| padchest | 117 | 胸片多标签对照 | ★ |
| vindr-cxr | 125 | 胸片多标注对照 | ★ |
| openi | 107 | 胸片 + 报告配对 | ★ |
| ms-cxr | 340 | 胸片多模态 | ★ |
| chest-imagenome | 330 | 胸片标注生态 | ★ |
| covidx-cxr | 197 | 胸片分类生态 | ★ |
| vindr-pcxr | 629 | 胸片多标注对照 | ★ |
| latte-cxr | 612 | 胸片报告生成 | ★ |
| cxr-cardiomegaly | 606 | 胸片单病种分割/检测 | ★ |
| cxr-phone | 607 | 胸片采集条件变体 | ★ |
| cxr-pro | 608 | 胸片专业评测集 | ★ |
| reflacx-xray-localization | 623 | 胸片眼动 + 定位 | ★ |
| cxr-lt | 657 | 胸片纵向数据 | ★ |
| nih-malaria | 502 | NIH 系公开影像(生态旁证) | ★ |
8.4 与 RSNA Pneumonia 的关键区别(易混)
| 维度 | SIIM-ACR Pneumothorax | RSNA Pneumonia |
|---|---|---|
| 病种 | 气胸 | 肺炎 |
| 任务 | 像素级分割 + 分类 | 目标检测(框)+ 分类 |
| 标注形态 | RLE 掩码 | bounding box |
| 影像来源 | NIH 公开胸片 | NIH 系(RSNA 组织) |
| 互链理由 | 同源影像 + 平行竞赛 | 见上方表 |
检索时勿把两者混为一谈——病种、任务、标注形态均不同(坑 9)。
8.5 家族谱系图(文字版)
NIH 公开胸片库(上游影像源)
│
├── NIH ChestX-ray14(rid 15)—— 图像级多标签
│ └── ChestX-Det10(rid 137)—— 检测标注
├── SIIM-ACR Pneumothorax(本条)—— 气胸像素级分割 ← 标注升级层
├── RSNA Pneumonia(rid 712)—— 肺炎目标检测
├── CheXpert(rid 5)—— 多标签 + 不确定性
├── MIMIC-CXR(rid 16)—— 胸片 + 报告
├── PadChest(rid 117)/ VinDr-CXR(rid 125)—— 多标注
└── CheXmask(rid 602)/ Chest X-ray Segmentation(rid 601)—— 分割生态
8.6 使用 SIIM-ACR 的三类典型场景
| 场景 | 推荐用法 | 注意 |
|---|---|---|
| 学习/教学分割 | 直接用镜像跑 baseline | 讲清 RLE 相对编码与 -1 约定 |
| 胸片预训练 | 与其他胸片数据集联合预训练 | 注意不许再分发(坑 5) |
| 临床转化研究 | 仅作预训练/对照,另建隔离评测 | 必须处理患者级泄漏(坑 6) |
8.7 对医学影像数据治理的四点启示
- 托管不等于持久:GCP 通道下线说明"有官方链接"不代表"长期可得",重要数据集应评估多源冗余。
- 竞赛规则是一份被低估的许可证:很多竞赛数据没有标准 SPDX 许可,"Subject to Competition Rules"实质上是一条严格的使用契约,禁再分发是其核心。
- 开源镜像的合法性不等于原数据的合法性:镜像把数据传上平台,并不代表它获得了再分发授权——License Unknown 正是这一裂缝的显影。
- 缺元信息是隐形的技术债:没有患者 ID 看似保护隐私,实则让下游无法做正确的划分,埋下泄漏隐患。
8.8 为什么它常被引用为"AI-Ready 反例"
“AI-Ready” 通常强调"数据格式标准、接口现成、随时可训"。SIIM-ACR 在前半段是模范(格式与接口无可挑剔),在后半段是警示(授权、存续、患者级质量)。它因此常被用来说明:
- AI-Ready ≠ 法律可用;
- AI-Ready ≠ 科学可信(泄漏即例);
- AI-Ready ≠ 长期可得(通道已死即例)。
这正是它作为百科条目的最大价值:不是又一张胸片数据集,而是一面照出"AI-Ready"这个词边界何在的镜子。
§9 与库内条目的关系
9.1 家族定位
SIIM-ACR Pneumothorax 属于千方病案医数集库内**「胸片(CXR)AI 数据集」家族**,是该家族中唯一以气胸为病种、以像素级分割为主任务的 Kaggle 竞赛条目。它的家族坐标:
- 同源上游:NIH ChestX-ray14(rid 15)——影像的直接来源。
- 平行竞赛:RSNA Pneumonia(rid 712)——同为胸片 Kaggle 竞赛,但任务是肺炎检测。
- 同期生态:CheXpert(rid 5)、MIMIC-CXR(rid 16)、PadChest(rid 117)。
- 分割同侪:CheXmask(rid 602)、Chest X-ray Segmentation(rid 601)。
9.2 检索入口建议
- 从 本条目 出发:想看"胸片分割" → 601/602;想看"胸片竞赛" → 712;想看"影像来源" → 15。
- 从 NIH ChestX-ray14(15) 出发:SIIM-ACR 是它的"气胸像素级标注重标版"分支。
- 从 RSNA Pneumonia(712) 出发:注意区分——肺炎 vs 气胸、检测 vs 分割。
9.3 组合使用场景
| 目标 | 组合 |
|---|---|
| 胸片多任务预训练 | NIH ChestX-ray14(分类)+ SIIM-ACR(分割) |
| 气胸 vs 肺炎对照 | SIIM-ACR + RSNA Pneumonia |
| 胸片分割全景 | SIIM-ACR + CheXmask(602) + Chest X-ray Segmentation(601) |
| 胸片 + 报告多模态 | SIIM-ACR + MIMIC-CXR(16) / OpenI(107) |
9.4 与互链条目并读时的三个注意
- 影像来源重叠:SIIM-ACR 与 NIH ChestX-ray14 共享影像来源,联合使用前须做图像级去重,否则训练集内部即产生泄漏。
- 任务不可混:SIIM-ACR(分割)与 RSNA Pneumonia(检测)的输出形态不同,不可直接把 RLE 掩码当 bbox 用。
- 许可各异:每个互链条目的许可独立,不可因为"同家族"就套用同一许可——NIH ChestX-ray14、CheXpert、MIMIC-CXR 各有各的获取门槛。
9.5 互链强度说明
| 强度 | 含义 | 代表 |
|---|---|---|
| ★★★ | 影像来源或直接平行,必链 | NIH ChestX-ray14(15)、RSNA Pneumonia(712) |
| ★★ | 任务/生态高度相关,推荐链 | CheXpert(5)、ChestX-Det10(137)、CheXmask(602)、Chest X-ray Segmentation(601) |
| ★ | 同域相关,可选链 | MIMIC-CXR(16)、PadChest(117)、VinDr-CXR(125) 等 |
9.6 家族检索矩阵(按需求查条目)
| 我想…… | 去哪个条目 | rid |
|---|---|---|
| 找气胸分割 | 本条 | — |
| 找胸片多标签分类 | NIH ChestX-ray14 | 15 |
| 找肺炎检测 | RSNA Pneumonia | 712 |
| 找胸片多标注/不确定性 | CheXpert | 5 |
| 找胸片掩码分割 | CheXmask | 602 |
| 找胸片检测框 | ChestX-Det10 | 137 |
| 找胸片+报告 | MIMIC-CXR / OpenI | 16 / 107 |
§10 避坑清单:九个已踩过的坑
坑 1:数据可能"看起来还能下、其实官方通道已死"。
原托管为 GCP Cloud Healthcare API,Kaggle 赛事页已明确「no longer available via Cloud Healthcare API」。任何指向 GCP 的旧教程/脚本都失效——务必改走镜像或库加载器,并在脚本里显式记录数据来源与抓取日期。
坑 2:test 规模有三个数(1,372 / 1,377 / 3,205),别混用。
- 1,372:PNG 镜像(vbookshelf 类)划分;
- 1,377:原始竞赛划分;
- 3,205:二阶段隐藏测试集 / arXiv:2009.02805 口径。
引用分数前先确认对方用的哪一套;自己报告时也须声明。
坑 3:掩码总数(12,954)大于影像总数(12,047),差 907。
官方未解释差额来源(多掩码/多版本/口径差)。不要把掩码数当作影像数使用;统计样本量时以影像 12,047 为准,掩码数以 12,954 为准并注明差异。
坑 4:DICOM 元数据分辨率 1,824×1,824 ≠ 交付 1,024×1,024。
DICOM 头声明 rows/cols 为 1,824,而竞赛交付 PNG(及多数镜像)为 1,024²。重采样细节未公开——若你的管线假定"原图即 1024²",读 DICOM 时可能被 1,824 值坑到,须显式做 resize 或核对元数据。
坑 5:许可证是三说,以官方竞赛规则为准。
官方为 Subject to Competition Rules(禁再分发);Kaggle 镜像 License 字段为 Unknown;第三方自称 CC-BY-NC 4.0(无背书、与官方冲突)。再分发/商用前必须取得授权方书面许可;把镜像的 Unknown 当作"随便用"是重大合规风险。
坑 6:存在患者级数据泄漏,高分未必可迁移。
Radboud 硕士论文记录训练/测试含相同患者影像;数据集未提供患者级元信息,无法复现患者隔离划分。在 SIIM-ACR 上报告高分时须注明该局限,临床转化评估需另建患者隔离验证集。
坑 7:参赛/提交数字口径略有出入。
不同来源对参赛队伍数与有效提交数表述不一;本条目以 SIIM 官方页 1,475 参赛 / 352 提交为准。引用他处数字时先核对来源。
坑 8:“augmented annotations” 的确切含义未公开。
官方措辞 “augmented annotations on the public … dataset from the NIH” 未说明 “augmented” 是"增量重标"还是"专项增强标注"。不要自行脑补具体标注流程;如需精确表述,以官方原文引用为准。
坑 9:勿与 RSNA Pneumonia 混淆。
SIIM-ACR 是气胸 + 像素级分割(RLE 掩码);RSNA Pneumonia 是肺炎 + 目标检测(bbox)。病种、任务、标注形态三项皆不同。检索与互链时务必分辨。
§11 总结
SIIM-ACR Pneumothorax Segmentation 是一个"技术漂亮、治理棘手"的典型 AI-Ready 数据集样本。把它压缩成三句话:
-
技术上它是一位模范生:标准 DICOM + RLE 掩码、12,047 张统一规格胸片、明确的 mean Dice 指标、现成的 torchxrayvision / torch_em 加载器——任何有分割经验的人半天内就能跑通 baseline。
-
治理上它是一道难题:竞赛规则明文禁再分发,镜像 License 只能写 Unknown,原始官方通道(GCP Cloud Healthcare API)已经下线。它提醒我们——"能跑"与"能合法地跑"是两件事。
-
质量上它是一面镜子:患者级泄漏与类别不均衡,使它成为讨论"数据集划分设计如何决定评估可信度"的绝佳案例。
给三类读者的建议:
- 模型开发者:可以直接用它练手/预训练,但报告结果务必注明泄漏局限与划分口径(坑 2、坑 6)。
- 数据治理研究者:把它作为"技术可用 vs 治理受限 vs 存续脆弱"三重张力的标准案例。
- 临床转化评估者:不要直接采信榜单分数,先补患者级隔离验证(坑 6)。
一句话结论:SIIM-ACR 是胸片气胸分割的事实标准起点,也是"AI-Ready" 这个词最需要被认真对待的地方——数据准备好了,未必意味着授权、存续与质量也准备好了。
FAQ(高频问答 60 问)
Q1:这个数据集是哪一年发布的?
赛事 2019-06-25 开赛、2019-09-05 截止。广泛作为基准被文献使用则从 2020 起(发布年份双口径,见附录 D)。
Q2:主办方是谁?
SIIM(Society for Imaging Informatics in Medicine)、ACR(American College of Radiology)、STR(Society of Thoracic Radiology)、MD.ai。
Q3:图像是哪里来的?
NIH 公开胸片数据的专业增强标注(augmented annotations),不是新采集数据。
Q4:一共有多少张图?
12,047 张唯一胸片;掩码 12,954 个(掩码数大于影像数,坑 3)。
Q5:阳性样本占多少?
22.15%(2,669 个阳性掩码),阴性 77.85%(9,378 个)。
Q6:图像分辨率是多少?
交付 1,024×1,024 灰度(PNG);DICOM 元数据声明 1,824×1,824(不一致,坑 4)。
Q7:掩码是什么格式?
RLE(run-length encoding)相对编码;无气胸样本记 -1。
Q8:怎么读 RLE?
先判 -1(无气胸);其余为"起点-长度"相对数对,解析时须累积求和还原绝对像素位置。
Q9:评估指标是什么?
mean Dice coefficient(逐样本 Dice 取均值)。
Q10:排行榜第一名多少分?
0.8679(dsmlkz);第二 0.8665(X5);第三 0.8651(bestfitting)。
Q11:有多少支队伍参赛?
1,475 队参赛、352 队有效提交(SIIM 官方口径)。
Q12:奖金多少?
总奖金 $30,000,一等奖 $12,000。
Q13:现在还能从官方下载吗?
不能——原始 GCP Cloud Healthcare API 通道已下线(坑 1)。
Q14:那怎么下载?
社区镜像(Kaggle Datasets、Academic Torrents)或库加载器(torchxrayvision / torch_em)。
Q15:许可证是什么?
官方为"Subject to Competition Rules(禁再分发)";Kaggle 镜像 License 显示 Unknown(坑 5)。
Q16:能商用吗?
公开页未给商用授权;竞赛规则禁再分发。商用前须取得授权方书面许可(坑 5)。
Q17:能再分发吗?
不能——竞赛规则明文禁止 transmit / duplicate / publish / redistribute。
Q18:患者级泄漏是怎么回事?
Radboud 硕士论文指出训练/测试含相同患者影像;数据集无患者级元信息,无法患者隔离划分(坑 6)。
Q19:泄漏会影响我的结果吗?
会——报告的 Dice 可能乐观高估;临床转化评估须另建患者隔离验证集。
Q20:哪些库支持加载?
torchxrayvision.SIIM_Pneumothorax_Dataset(unique_patients/pathology_masks 参数)与 torch_em.data.datasets.medical.siim_acr(checksum-verified)。
Q21:train/test 怎么划分的?
常见:train ≈ 10,675 / test ≈ 1,372(PNG 镜像);另有 1,377(原始)与 3,205(round-2)(坑 2)。
Q22:为什么 test 有 1,372/1,377/3,205 三个数?
分别来自 PNG 镜像划分、原始划分、二阶段隐藏测试集,来源不同、不可混用(坑 2)。
Q23:类不均衡怎么处理?
正样本过采样、损失加权/focal loss、分割后处理阈值调优、两阶段(先分类后分割)等。
Q24:有没有观察者间一致性数据?
公开页未提供 inter-observer agreement 指标(§3.5)。
Q25:“augmented annotations” 是什么意思?
官方未展开;可能是增量重标或专项增强标注,不可自行确证(坑 8)。
Q26:和 RSNA Pneumonia 有什么区别?
SIIM-ACR=气胸+分割(RLE);RSNA Pneumonia=肺炎+检测(bbox)(坑 9)。
Q27:和 NIH ChestX-ray14 什么关系?
影像同源——SIIM-ACR 是 NIH 公开胸片在气胸任务上的像素级标注重标版(库内互链 rid 15)。
Q28:12,954 和 12,047 哪个是样本量?
影像以 12,047 为准,掩码以 12,954 为准;二者不同且差额 907 未解释(坑 3)。
Q29:数据页多大?
Kaggle 数据页标注 439.11 MB(镜像形态各异,不代表全部)。
Q30:为什么条目反复强调"坑点"?
因为该数据集的真实风险不在算法而在数据本身——通道下线、许可不明、患者泄漏、口径冲突。写清坑,才能让下游不重复踩雷。
Q31:detailed_class_info 有什么额外信息?
提供了 Normal / No Pneumothorax / Pneumothorax 三分类,可用于区分"真正常"与"有异常但非气胸",对假阳性分析有用(§2.7)。
Q32:数据解压后多大?
数据页标注 439.11 MB 为压缩交付包;解压后随镜像实现为数 GB 级(§2.8),规划磁盘时按解压后规模预留。
Q33:为什么没有患者 ID?
出于隐私保护,仅提供 UUID 匿名化标识;这同时导致无法做患者级划分,是泄漏问题的成因之一(§5.3)。
Q34:我能不能自己按患者切分?
不能——数据集未提供患者级元信息,无法可靠地把同患者影像分到同一侧(§5.6 路径二只能近似)。
Q35:SIIM-ACR 适合做教学吗?
非常适合:粒度清晰、任务明确、加载器现成;但作为教学案例时务必讲清 RLE 相对编码与 -1 约定,以及许可限制。
Q36:榜单前三名用的是同一划分吗?
竞赛榜单统一使用官方评测划分;但社区镜像的 train/test 划分可能与之不同(坑 2),复现时须对齐。
Q37:mean Dice 0.87 算高吗?
在该数据集内部算顶尖;但受患者级泄漏影响,不可直接解读为"临床可用水平"(坑 6、§7.6)。
Q38:有没有预训练模型可直接用?
torchxrayvision 等库提供了在该数据集上训练的模型与基线,可直接加载;使用前仍须遵守许可(坑 5)。
Q39:可以把 SIIM-ACR 和 NIH ChestX-ray14 一起训练吗?
可以,但必须先做图像级去重——两者影像同源,直接合并会导致训练集内部泄漏(§9.4)。
Q40:RLE 的 -1 和空串是一回事吗?
语义相同(都表示无气胸),但表示形式依镜像而异(字符串 “-1” / 空串 / NaN),解析时须先归一(附录 F)。
Q41:DICOM 读取要注意什么?
注意 rows/cols 可能为 1,824 而非 1,024,须显式 resize 或核对元数据,否则尺寸对不上(坑 4)。
Q42:为什么阳性比例只有 22%?
气胸在胸片总体人群中本就不高发;采集自公开胸片库时未做阳性富集,故阳性为少数类(§5.2)。
Q43:分割和分类哪个更适合先做?
多数方案先做像素级分割,再对掩码求和判断有无(分割为零即阴性);也有两阶段(先分类、后对阳性样本分割)的做法。
Q44:SIIM 和 RSNA 是同一个组织吗?
不是。SIIM=医学影像信息学学会;RSNA=放射学会(北美放射学会),是另一个竞赛的组织方(坑 9)。
Q45:数据集名里的 “ACR” 是什么?
American College of Radiology,美国放射学会,是本竞赛的联合主办方之一。
Q46:MD.ai 在这里做什么?
提供标注平台与基础设施支撑(医学影像标注工具方)。
Q47:条目里的 rid 是什么意思?
库内条目的记录标识(record id),用于互链定位;rid 经库内 status=1 查询核对(§8.3)。
Q48:为什么说它"AI-Ready 但治理受限"?
技术上数据格式标准、加载器现成(AI-Ready);但许可禁再分发、通道下线、无患者元信息(治理受限)。二者构成核心张力(§11)。
Q49:如果我只想引用一个数字,引哪个?
引用规模引 12,047 张影像;引用性能引榜首 0.8679;引用参与规模引 1,475/352——并附上相应坑点说明。
Q50:这条目多久维护一次?
以附录 J 的触发点为准:赛事页状态变化、新许可声明、新泄漏研究、加载器接口变更、镜像下架,任一发生即须复核。
Q51:为什么原始通道会下线?
公开页未说明具体原因;常见的技术/政策原因包括托管成本、隐私合规调整、平台策略变化等,但均属推测,不可作为事实陈述。
Q52:现在还能拿到 1,824×1,824 的原图吗?
DICOM 元数据声明该分辨率,但交付多为 1,024²;能否取得原尺寸取决于镜像是否保留原始 DICOM(坑 4)。
Q53:分割掩码能不能直接转成检测框?
技术上可由掩码外接矩形近似得到 bbox,但精度与语义都与原生检测标注不同,做检测基准时应使用专门的检测数据集(如 RSNA Pneumonia / ChestX-Det10)。
Q54:气胸分割在临床上有哪些落地场景?
急诊/创伤快速筛查、术后与置管后并发症监测、体检胸片自动预筛、基层医师辅助诊断等;但均须在患者隔离验证后才可评估真实价值。
Q55:条目为什么区分"技术资产/治理样本/质量案例"三重身份?
因为同一个数据集在不同读者眼里价值不同:工程师看技术、合规看治理、研究者看质量——分列三种身份便于各取所需(§0.4)。
Q56:FACTS.md 与成稿是什么关系?
FACTS.md 是三源互证的事实底稿(九节),成稿在其基础上按百科结构展开;冲突与疑点在两者中均逐条存照。
Q57:为什么强调"以官方口径为准"?
因为第三方来源(镜像自述、博客)常与官方冲突(如许可 CC-BY-NC 自述),若不加鉴别会引入错误结论(坑 5)。
Q58:如果官方页也更新了,条目怎么办?
按附录 J 维护触发点复核并更新;条目内所有时效性结论均标注了抓取时点(2026-09-30)。
Q59:这个数据集与"胸部 X 光 AI 是否已成熟"的关系?
它是胸片 AI 从"图像级分类"走向"像素级分割"的标志性一步,但患者级泄漏与治理问题提醒:成熟度不能只看榜单分数。
Q60:一句话推荐给不同读者?
工程师:值得练手,注意许可;研究者:可作基准,须声明泄漏;治理者:必读案例,照见 AI-Ready 的边界。
事实清单(硬事实 36 条)
| # | 硬事实 | 来源 |
|---|---|---|
| 1 | 数据集名为 SIIM-ACR Pneumothorax Segmentation | Kaggle |
| 2 | 主办方为 SIIM / ACR / STR / MD.ai | Kaggle 赛事页 |
| 3 | 开赛 2019-06-25 | Kaggle 赛事页 |
| 4 | 截止 2019-09-05 | Kaggle 赛事页 |
| 5 | 任务为像素级气胸分割 + 有无分类 | Kaggle 赛事页 |
| 6 | 评估指标为 mean Dice coefficient | Kaggle 赛事页 |
| 7 | 影像来自 NIH 公开胸片的增强标注 | SIIM 官方页 |
| 8 | 唯一影像 12,047 张 | 多源一致 |
| 9 | 掩码总数 12,954 个 | torchxrayvision 文档 |
| 10 | 阳性掩码 2,669(22.15%) | 镜像统计 |
| 11 | 阴性掩码 9,378(77.85%) | 镜像统计 |
| 12 | 掩码数 > 影像数,差 907(未解释) | 计算 |
| 13 | 交付分辨率 1,024 × 1,024 | Kaggle 数据页 |
| 14 | DICOM 元数据分辨率 1,824 × 1,824 | DICOM 头 |
| 15 | 掩码为 RLE 相对编码 | Kaggle 数据页 |
| 16 | 无气胸样本掩码记 -1 | 镜像/规则 |
| 17 | 数据页体积 439.11 MB | Kaggle 数据页 |
| 18 | 榜首 mean Dice 0.8679(dsmlkz) | Kaggle 排行榜 |
| 19 | 第二 0.8665(X5) | Kaggle 排行榜 |
| 20 | 第三 0.8651(bestfitting) | Kaggle 排行榜 |
| 21 | 参赛 1,475 队 | SIIM 官方页 |
| 22 | 有效提交 352 队 | SIIM 官方页 |
| 23 | 总奖金 $30,000 | SIIM 官方页 |
| 24 | 一等奖 $12,000 | Kaggle 赛事页 |
| 25 | 第 124 名 mean Dice 0.8356 | arXiv:2009.02805 |
| 26 | train ≈ 10,675(PNG 镜像) | 镜像 |
| 27 | test ≈ 1,372(PNG 镜像) | 镜像 |
| 28 | test ≈ 1,377(原始划分) | 原始 |
| 29 | round-2 test 3,205 | arXiv:2009.02805 |
| 30 | 原托管为 GCP Cloud Healthcare API | Kaggle 赛事页 |
| 31 | 原始通道已下线 | Kaggle 赛事页 |
| 32 | 竞赛规则禁再分发 | 竞赛规则文本 |
| 33 | Kaggle 镜像 License 显示 Unknown | Kaggle 数据页 |
| 34 | 存在患者级数据泄漏 | Radboud 硕士论文 |
| 35 | 加载器 torchxrayvision.SIIM_Pneumothorax_Dataset | torchxrayvision 文档 |
| 36 | 加载器 torch_em…siim_acr(checksum-verified) | torch_em 文档 |
事实清单(补充 10 条)
| # | 硬事实 | 来源 |
|---|---|---|
| 37 | detailed_class_info 提供三分类(Normal / No Pneumothorax / Pneumothorax) | 镜像 CSV |
| 38 | 数据页标注体量 439.11 MB(压缩交付) | Kaggle 数据页 |
| 39 | 参赛组织含 STR(Society of Thoracic Radiology) | Kaggle 赛事页 |
| 40 | 提供 stage_2_sample_submission.csv 提交模板 | 镜像 |
| 41 | 掩码与影像同尺寸(1,024²)逐像素对齐 | 镜像 |
| 42 | 社区常用 U-Net 类编码-解码结构 | 复盘材料 |
| 43 | 库内互链 NIH ChestX-ray14 rid=15 | 库内查询 |
| 44 | 库内互链 RSNA Pneumonia rid=712 | 库内查询 |
| 45 | 库内互链 CheXpert rid=5 | 库内查询 |
| 46 | 库内互链 CheXmask rid=602 | 库内查询 |
说明:补充 10 条与前述 36 条共同构成本条目的事实骨架;凡标注"镜像 CSV/复盘材料"者为基于公开镜像与社区材料的观察,非官方页逐字陈述。
术语表(28 条)
| 术语 | 英文 | 释义 |
|---|---|---|
| 气胸 | pneumothorax | 胸膜腔积气致肺塌陷的病变 |
| 胸片 | chest radiograph / CXR | 胸部 X 光片 |
| 语义分割 | semantic segmentation | 逐像素分类任务 |
| 像素级掩码 | pixel-level mask | 标注每个像素归属的掩码 |
| Dice 系数 | Dice coefficient | 2\ |
| mean Dice | mean Dice coefficient | 逐样本 Dice 取均值 |
| RLE | run-length encoding | 游程编码,压缩连续区段 |
| 相对 RLE | relative RLE | 以相对偏移表示区段位置的 RLE |
| DICOM | Digital Imaging and Communications in Medicine | 医学影像标准格式 |
| UUID 匿名化 | UUID anonymization | 用通用唯一标识符替代患者身份 |
| 患者级泄漏 | patient-level data leakage | 同患者跨 train/test 造成评估乐观 |
| 类别不均衡 | class imbalance | 正负样本比例失衡 |
| NIH | National Institutes of Health | 美国国立卫生研究院 |
| SIIM | Society for Imaging Informatics in Medicine | 医学影像信息学学会 |
| ACR | American College of Radiology | 美国放射学会 |
| STR | Society of Thoracic Radiology | 胸部放射学会 |
| MD.ai | — | 医学影像标注平台 |
| 增强标注 | augmented annotations | 官方对影像标注流程的措辞 |
| 目标检测 | object detection | 输出边界框的任务(RSNA 口径) |
| 边界框 | bounding box / bbox | 检测任务的矩形标注 |
| U-Net | U-Net | 经典编码-解码分割网络 |
| 后处理 | post-processing | 对模型输出的规则化修正 |
| focal loss | focal loss | 缓解类别不均衡的损失函数 |
| 过采样 | oversampling | 重复采样少数类 |
| 校验和 | checksum | 校验下载文件完整性的哈希 |
| torchxrayvision | — | 胸片 AI 数据集/模型库 |
| torch_em | — | 生物医学图像分割训练库 |
| AI-Ready | AI-Ready | 数据可直接用于 AI 训练的程度 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | SIIM-ACR Pneumothorax Segmentation |
| url_name | siim-acr-pneumothorax |
| 类型 | 竞赛数据集(分割 + 分类) |
| 主办 | SIIM / ACR / STR / MD.ai |
| 年份 | 2019 |
| 规模 | 12,047 影像 / 12,954 掩码 |
| 规格 | DICOM/PNG 1,024²,RLE 掩码 |
| 指标 | mean Dice |
| 榜首 | 0.8679(dsmlkz) |
| 许可 | Subject to Competition Rules(禁再分发);镜像 Unknown |
| 抓取时点 | 2026-09-30 |
| 库内互链 | nih-chest-x-ray14(15)/rsna-pneumonia(712)/chexpert(5)/chestx-det10(137)/chexmask-cxr-segmentation-data(602) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 7 | 赛事页/论文/镜像均可索引,名称唯一不易混;但原名较长,社区多用简称 |
| A 可获取性 | 4 | 原始官方通道已下线,仅靠社区镜像与库加载器——最大失分项 |
| I 可互操作 | 8 | 标准 DICOM + 标准 RLE + torchxrayvision/torch_em 加载器,互操作性强 |
| M 元数据质量 | 5 | 有基本字段但缺患者级元信息、缺标注一致性指标;多处口径冲突(坑 2/3/4) |
| S 可持续性 | 4 | 无官方托管、镜像无 SLA、许可不明,长期可得性脆弱 |
| 综合评级 | 5.6/10(中) | 技术互操作强(I=8),但获取、元数据、可持续三处拖累,治理风险突出 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 备注 |
|---|---|---|
| 12,047 影像 | Kaggle 镜像 / torchxrayvision 文档 / arXiv | 三源一致 |
| 12,954 掩码 / 2,669 阳性 / 9,378 阴性 | torchxrayvision 文档 / 镜像统计 | 掩码口径 |
| 1,024×1,024 | Kaggle 数据页 | 交付口径 |
| 1,824×1,824 | DICOM 头 | 原始元数据口径(坑 4) |
| 0.8679 / 0.8665 / 0.8651 | Kaggle 排行榜 | 前三名 |
| 1,475 参赛 / 352 提交 | SIIM 官方页 | 参与口径 |
| $30,000 / $12,000 | SIIM 官方页 / Kaggle | 奖金 |
| 0.8356(rank 124) | arXiv:2009.02805 | 基线 |
| 3,205(round-2 test) | arXiv:2009.02805 | 二阶段 |
| 通道下线 | Kaggle 赛事页原文 | 治理关键 |
| 禁再分发 | 竞赛规则文本 | 治理关键 |
| 患者级泄漏 | Radboud 硕士论文 | 质量关键 |
附录 D:双口径冲突汇总表
| 冲突 | 口径 A | 口径 B | 口径 C | 处置 |
|---|---|---|---|---|
| 样本数 | 影像 12,047 | 掩码 12,954 | 差 907 未解释 | 分别标注,不合并(坑 3) |
| test 规模 | 1,372(PNG 镜像) | 1,377(原始) | 3,205(round-2) | 三口径并列(坑 2) |
| 分辨率 | 交付 1,024² | DICOM 元数据 1,824² | — | 并列,注明重采样未公开(坑 4) |
| 许可 | 官方 Subject to Competition Rules | Kaggle 数据显示 Unknown | 第三方自述 CC-BY-NC | 以官方为准(坑 5) |
| 发布年份 | 2019(赛事年) | 2020+(文献基准年) | — | 叙事辨明"赛事年 vs 基准年" |
| augmented 含义 | 增量重标(推测) | 专项增强标注(推测) | 官方未展开 | 标为遗留疑点(坑 8) |
附录 E:数据获取决策树
需求是什么?
├── 快速跑通分割 baseline
│ └── Kaggle 镜像(PNG 1024²)+ 记牢划分口径(坑 2)
├── 严格复现某论文
│ ├── 1) 确认该论文用的划分(1,372/1,377/3,205 哪一套)
│ └── 2) 选对应镜像,勿跨口径比较
├── 需要 DICOM 原格式 / 完整性校验
│ └── torch_em.siim_acr(checksum-verified)或 Academic Torrents
├── 要做临床转化评估
│ └── 先自建患者隔离验证集(坑 6)
└── 要再分发 / 商用
└── 停 —— 须先取得授权方书面许可(坑 5)
附录 F:RLE 解析骨架(示意)
def rle_decode(mask_rle, shape=(1024, 1024)):
# 无气胸样本约定:掩码为 -1(或 null)
if mask_rle is None or (isinstance(mask_rle, str) and mask_rle.strip() == '-1'):
return np.zeros(shape, dtype=np.uint8)
s = mask_rle.split()
starts = np.asarray(s[0::2], dtype=int) - 1 # 1-based -> 0-based
lengths = np.asarray(s[1::2], dtype=int)
# 相对 RLE 还原:位置为相对前一区段末端的偏移,需累积求和
if len(starts) > 1:
starts[1:] = starts[1:] + starts[:-1] + lengths[:-1]
img = np.zeros(shape[0] * shape[1], dtype=np.uint8)
for st, ln in zip(starts, lengths):
img[st: st + ln] = 1
return img.reshape(shape)
注意:不同镜像对
-1的表示(字符串-1/ 空串 / NaN)可能不同;相对 RLE 的偏移累加规则亦须以镜像文档为准——上线前先用若干样本做可视化自检。
附录 G:检索路径示范(关键词组合与查询式)
| 目标 | 推荐查询式 | 预期命中 |
|---|---|---|
| 赛事主页 | site:kaggle.com siim-acr-pneumothorax-segmentation | Kaggle Competitions |
| 数据页 | siim-acr-pneumothorax-segmentation/data | Kaggle 数据页(439.11 MB,RLE) |
| 官方主办页 | site:siim.org pneumothorax kaggle | SIIM 官方页(1,475/352/$30,000) |
| 复盘论文 | “siim-acr” ARXIV pneumothorax segmentation | arXiv:2009.02805 |
| 库加载器 | torchxrayvision SIIM_Pneumothorax_Dataset | 文档页(12,954 掩码) |
| 校验和加载器 | torch_em siim_acr dataset | 文档页(checksum) |
| 泄漏证据 | siim acr pneumothorax patient level leakage thesis | Radboud 硕士论文 |
| 镜像 | site:kaggle.com/datasets siim acr pneumothorax | vbookshelf / seesee 等镜像 |
| 反例(勿混) | “siim-acr” pneumonia detection | 错配 RSNA(坑 9) |
检索卫生两条:一、凡命中"GCP Cloud Healthcare API / DICOM 直读"的旧教程,均基于已下线的原始通道,不可照抄(坑 1);二、凡遇"test 1,372 / 1,377 / 3,205"数字,先确认划分来源再比较(坑 2)。
附录 H:库加载器使用示例(示意)
# 方式一:torchxrayvision
import torchxrayvision as xrv
ds = xrv.datasets.SIIM_Pneumothorax_Dataset(
imgpath="path/to/siim/images",
csvpath="path/to/siim/train-rle.csv",
unique_patients=True, # 去重患者(缓解泄漏的第一道闸)
pathology_masks=True, # 返回像素级掩码
)
# 方式二:torch_em(带校验和)
import torch_em
from torch_em.data.datasets.medical import siim_acr
path = siim_acr.get_siim_acr_data(path="data", download=True) # 校验和验证
两个加载器均把"竞赛数据"封装为可编程接口,但许可约束不因此改变(坑 5)。上线前核对加载器版本与数据划分口径。
附录 I:坑点档案(与 §10 对照)
| 坑 | 一句话档案 | 触发场景 |
|---|---|---|
| 坑 1 | 原始 GCP 通道已下线,旧教程全失效 | 数据获取 |
| 坑 2 | test 三口径 1,372/1,377/3,205 | 基准比较 |
| 坑 3 | 掩码 12,954 > 影像 12,047,差 907 | 样本量统计 |
| 坑 4 | DICOM 1,824² vs 交付 1,024² | 读 DICOM/预处理 |
| 坑 5 | 许可三说,官方禁再分发 | 再分发/商用 |
| 坑 6 | 患者级泄漏致高分乐观 | 结果报告/临床转化 |
| 坑 7 | 参赛/提交数字来源不一 | 引用参与规模 |
| 坑 8 | augmented 含义官方未展开 | 标注流程描述 |
| 坑 9 | 勿与 RSNA Pneumonia 混 | 检索/互链 |
附录 J:自检与维护触发点
| 触发点 | 动作 |
|---|---|
| Kaggle 赛事页更新(数据下线状态变化) | 复核 §6.1 与坑 1 |
| 出现新的官方托管/授权声明 | 复核 §6.1-6.2 许可与获取 |
| 新论文报告患者级划分结果 | 复核 §5.3 泄漏描述 |
| 库加载器接口变更 | 复核附录 H 与 §6.2 |
| 镜像下架 | 复核 §6.2 三层可获取性 |
附录 K:许可速查卡
| 对象 | 许可/约束 | 能否再分发 | 能否商用 |
|---|---|---|---|
| 原始竞赛数据 | Subject to Competition Rules | 否 | 未授权(须另行许可) |
| Kaggle 镜像 | License 字段 Unknown | 否(无授权) | 否(无授权) |
| 第三方镜像自述 | CC-BY-NC 4.0(无背书) | 存疑 | 否(NC) |
| 以数据训练的模型 | 未明确 | 存疑 | 须与权利方确认 |
一句话:没有任何一条给出"可以自由再分发/商用"的授权。默认按"不可再分发、商用须许可"处理。
附录 L:类别分布与训练策略对照
| 类别 | 占比 | 训练策略 |
|---|---|---|
| 阳性(气胸) | 22.15% | 过采样 / 加权损失 / focal loss |
| 阴性(无气胸) | 77.85% | 保持但防其主导梯度 |
验证策略:分层抽样保持正负比;评估时分别看阳性子集与全集 Dice,避免阴性样本掩盖阳性漏检。
附录 M:常见误用清单
| 误用 | 后果 | 正解 |
|---|---|---|
| 把掩码数当影像数 | 样本量虚高 907 | 影像以 12,047 计(坑 3) |
| 用 GCP 旧脚本下载 | 全部失败 | 改走镜像/加载器(坑 1) |
| 混用 test 口径比较分数 | 结论不可比 | 声明划分(坑 2) |
| 假定 DICOM 即 1024² | 尺寸错配 | 核对 rows/cols(坑 4) |
| 采信镜像 CC-BY-NC | 合规风险 | 以官方规则为准(坑 5) |
| 直接采信榜单分数 | 高估临床性能 | 声明泄漏并加隔离验证(坑 6) |
附录 N:术语与缩略语对照
| 缩略 | 全称 |
|---|---|
| CXR | Chest X-Ray(胸部 X 光片) |
| DICOM | Digital Imaging and Communications in Medicine |
| RLE | Run-Length Encoding(游程编码) |
| DSC | Dice Similarity Coefficient |
| GCP | Google Cloud Platform |
| SIIM | Society for Imaging Informatics in Medicine |
| ACR | American College of Radiology |
| STR | Society of Thoracic Radiology |
| NIH | National Institutes of Health |
| AI-Ready | 数据可直接用于 AI 训练的程度 |
| DAIMS | Discoverability / Accessibility / Interoperability / Metadata / Sustainability |
附录 O:条目可靠性自评
| 维度 | 状况 |
|---|---|
| 数据规模数字 | 三源一致(多镜像 + 文档),可靠 |
| 许可结论 | 官方规则 + 平台字段 + 第三方自述三源,结论明确 |
| 泄漏结论 | 单一权威来源(Radboud 论文),标注为文献结论 |
| 口径冲突 | 已逐条存照,未强行择一 |
| 遗留疑点 | 907 差额、augmented 含义、患者元信息缺失,已列明 |
附录 P:与任务头纪律包的对应
| 纪律要求 | 本条目落实 |
|---|---|
| 存在性核验(教训 12) | 三轮核验,见 FACTS.md §1.3 |
| slug 查重 | 无冲突,见 FACTS.md §1.4 |
| 双口径存照 | 附录 D 汇总六项冲突 |
| 坑点 ≥5 | §10 九则(坑 1-9) |
| DAIMS 表 | 附录 B |
| category_tags 受控 | 取自词表 5 个 |
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 A。事实陈述以 Kaggle 赛事页/数据页、SIIM 官方页、arXiv:2009.02805、Kaggle 排行榜、torchxrayvision 与 torch_em 文档、Radboud 硕士论文为源;口径冲突(样本数、test 规模、分辨率、许可、发布年份)与遗留疑点(907 差额、augmented 含义、患者级元信息缺失)已在 §10 与附录 D 逐条存照。条目与库内 NIH ChestX-ray14(rid 15)、RSNA Pneumonia(rid 712)、CheXpert(rid 5)、ChestX-Det10(rid 137)、CheXmask(rid 602)等条目互链,构成胸片 AI 数据集家族的完整检索面。后续维护触发点见附录 J。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- rsna-pneumonia — 共享标签:医学影像 / X光影像 / 挑战赛数据集 / 评测基准
- mitoem — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 评测基准
- chexlocalize — 共享标签:医学影像 / X光影像 / 医学图像分割 / 评测基准
- chexmask-cxr-segmentation-data — 共享标签:医学影像 / X光影像 / 医学图像分割
- chexmask-u — 共享标签:医学影像 / X光影像 / 医学图像分割
- lung-segment-mimic-cxr — 共享标签:医学影像 / X光影像 / 医学图像分割
- mimic-cxr-ext-ils — 共享标签:医学影像 / X光影像 / 医学图像分割
- tus-rec — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
- cxr-lt — 共享标签:医学影像 / X光影像 / 挑战赛数据集 / 评测基准
- brixia-peru — 共享标签:医学影像 / X光影像 / 医学图像分割 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

