信息速览
INFOBOX — RSNA Intracranial Hemorrhage 一屏速览
维度 内容 本质 RSNA 2019 Kaggle 挑战赛公开的无对比头颅 CT 颅内出血检测数据集(五亚型多标签分类) 发起方 Radiological Society of North America(RSNA)+ American Society of Neuroradiology(ASNR)+ Kaggle(Google) 论文 Radiol Artif Intell. 2020;2(3):e190211(doi:10.1148/ryai.2020190211;勘误 10.1148/ryai.2020209002) 数据来源 Stanford AIMI / UNIFESP(巴西)/ Thomas Jefferson University Hospital / St. Michael’s(Unity Health Toronto,加拿大) 规模 25,312 例检查(训练/验证 21,784 + 测试 3,528);874,035 张切片;约 458.97 GB 模态 无对比头颅 CT,DICOM 轴位序列,层厚 3-5mm,每序列 20-60 层 标签 6 个切片级标签:epidural / intraparenchymal / intraventricular / subarachnoid / subdural / any 标注 >60 名志愿神经放射科医生(114 候选筛出);MD.ai 平台;测试集 3 阅片者 + 525 例裁决 指标 加权多标签对数损失(weighted multi-label log loss) 参赛规模 1,345 支队伍 / 7,900 名报名者 / 723 名有效参赛者 / 2,553 次提交 优胜者 1st SeuTao (0.04383)、2nd NoBrainer (0.04484)、3rd takuoko (0.04510) 奖金 $25,000(1st $8k / 2nd $6k / 3rd $4k / 4-10th 各 $1k) 获取 Kaggle 竞赛页(DICOM+CSV)|RSNA MIRA 平台|RSNA Atlas AI Data Card(DOI 10.1148/dataset.ihd.2024) 许可 Subject to Competition Rules(非标准开放许可)|MIRA 研究使用协议|Atlas DOI 规范化引用 库内互链 RSNA Pneumonia(rid712)、RSNA Bone Age(rid426)、RSNA Series(rid20)、Munich BMC(rid496)、AIMS-TBI(rid665) 一句话 脑 CT 出血 AI 的"天花板底座":规模大、任务清、指标明,但标签是切片级而非病灶级,许可非开放
RSNA Intracranial Hemorrhage 数据集是 2019 年 RSNA(北美放射学会)联合 ASNR(美国神经放射学会)与 Kaggle 举办的"脑 CT 出血挑战赛"所公开的训练与评测底座。它把无对比头颅 CT(non-contrast head CT)——急诊科最常开的检查之一——标准化成一道机器学习题:给定一张轴位切片,预测它是否含有五类颅内出血中的任何一类。这个数据集之所以成为脑 CT AI 领域被复用最多的公开资源之一,原因有三:规模大(八十七万张切片)、任务定义清晰(六标签多标签分类)、指标统一(加权对数损失),因此无论你是想训一个分类器、还是想拿它当预训练底座、或是想复现放射 AI 的经典 benchmark,它几乎都是绕不开的起点。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——注意它不是标准开放许可,Kaggle 页写的是 “Subject to Competition Rules”,MIRA 版走的是 RSNA 研究使用协议,用它做论文要先读条款。
- 关心任务怎么定义:直奔 §2、§4 与 §5——五个亚型各是什么、为什么有 “any” 聚合标签、评估指标为什么用加权对数损失、公式怎么算,这几段连读。
- 关心标签质量与边界:直奔 §3 与 §7——切片级标签的"默认正常"工作流会带来什么偏差、类别不平衡到什么程度、跨机构泛化要注意什么。
§0 导读:这个数据集解决什么问题
颅内出血(intracranial hemorrhage, ICH)是急诊影像里"时间就是大脑"的典型场景:脑出血患者的死亡与残疾风险随确诊延迟快速上升,而头颅 CT 是首选筛查手段。现实困境在于阅片量——一家大型医院每天产生大量头颅 CT,放射科医生逐张读片既慢又累,微小出血(尤其是硬膜下薄层、蛛网膜下腔的少量出血)易被漏诊。于是"让算法先过一遍"成为最有价值的辅助方向之一,而算法要训练、要评测,就需要一个规模足够大、标注足够可信、任务定义足够统一的公开数据集。
2019 年,RSNA 与 Kaggle 联合把这个需求做成了竞赛。ASNR 从会员中招募了 60 余名志愿神经放射科医生,联合四家医疗机构(Stanford / UNIFESP / Thomas Jefferson / St. Michael’s–Unity Health Toronto),收集了两万余例无对比头颅 CT,在 MD.ai 平台上完成逐切片标注,最终交付出 25,312 例检查、874,035 张切片的公开数据集。任务的正式定义是多标签分类(multi-label classification):每张切片要预测 6 个标签——五类出血亚型加上一个代表"任一亚型阳性"的聚合标签 “any”。之所以拆成五类,是因为不同亚型的解剖位置、临床意义与紧急程度各不相同:epidural(硬膜外)常与外伤相关、需紧急手术;subarachnoid(蛛网膜下腔)可能提示动脉瘤破裂;而 intraparenchymal(脑实质内)则是自发性脑出血的主体。把它们混成一个"有无出血"的二分类会丢失临床价值,因此数据集坚持多标签。
竞赛本身也构成了这个数据集影响力的一部分:1,345 支队伍、7,900 名报名者参与,最终由来自中国的腾讯 AI Lab 团队 “SeuTao” 夺冠。这意味着数据集不仅是一份静态资产,更是一次全球范围内的"多解法大比武"——它的存在让放射 AI 的颅内出血任务第一次有了统一的可比基准。
§0 读法三则:
- 这个条目是"数据集 + 竞赛 + 论文"三合一:本体是 874,035 张切片,竞赛是 Kaggle 上的排名活动,论文是 Radiology: AI 上的建造记录——三者的可获取性各不相同(§6)。
- 全文所有硬数字都落来源 URL;论文、Atlas 卡片、Kaggle 数据页三处口径若有出入,一律在附录的双口径登记表逐条存照,不在正文里"择一为准"。
- 检索时若把 “RSNA ICH” 和 “CQ500” 当成同一个数据集会踩坑——CQ500 是另一个独立发布的中国(印度新德里)来源颅内出血 CT 数据集,二者既不共享样本也不共享标注方(坑 2)。
§1 数据集速览:十问十答
Q1:这个数据集到底是什么?
一份公开的无对比头颅 CT 集合,任务是逐切片判断是否含五类颅内出血中的任何一类,属多标签分类。它是 RSNA 2019 年 Kaggle 挑战赛的官方数据。
Q2:规模有多大?
25,312 例检查,共 874,035 张轴位切片,约 458.97 GB。检查拆为训练/验证集 21,784 例和测试集 3,528 例。原始提交候选 27,861 例(1,074,271 张图像),剔除不合格后保留 25,312 例。
Q3:五个亚型分别是什么?
epidural(EPH/EDH,硬膜外出血)、intraparenchymal(IPH,脑实质内出血)、intraventricular(IVH,脑室内出血)、subarachnoid(SAH,蛛网膜下腔出血)、subdural(SDH,硬膜下出血)。第六个标签 “any” 表示"上述任一亚型为阳性"。
Q4:图像是什么规格?
无对比头颅 CT,DICOM 格式,轴位(axial)序列,层厚 3-5mm,每个序列约 20-60 层(第三方统计约 35 层/例)。每张切片为 512×512 像素矩阵。
Q5:谁标的、靠不靠谱?
响应征集的 114 名放射科医生中筛出 60 名志愿者,在 MD.ai 平台完成标注。测试集由 3 名阅片者独立标注,存在分歧的 525 例进入裁决(adjudication)。标注期约 3 个月。
Q6:为什么用加权对数损失而不是准确率?
因为类别极不平衡——图像级出血阳性率仅约 14%,检查级约 41%。用准确率会被"全判正常"的平凡解刷高分,加权多标签对数损失则惩罚置信度错误,能区分真正学到信号的模型。
Q7:竞赛规模有多大、谁赢了?
1,345 支队伍、7,900 名报名者、723 名有效参赛者、2,553 次提交。冠军 SeuTao(最终私有榜 0.04383),其后 NoBrainer(0.04484)、takuoko(0.04510)、GZ(0.04529)、Keep Digging Gold(0.04561)。总奖金 $25,000。
Q8:许可是什么?能商用吗?
不是标准开放许可。Kaggle 数据页标注 “Subject to Competition Rules”(受竞赛规则约束),MIRA 版受 “RSNA MIRA Dataset Research Use Agreement” 约束。数据集在 RSNA Atlas 上有规范化的 DOI(10.1148/dataset.ihd.2024),但再分发与商用条款以 RSNA 官方为准,不要默认可以自由商用。
Q9:我现在能从哪拿到?
三个入口:Kaggle 竞赛页(DICOM + CSV 标签)、RSNA MIRA 平台(imaging.rsna.org/dataset/1,邮箱申请)、RSNA Atlas AI Data Card(元信息)。Kaggle 是界面最完整的下载入口。
Q10:为什么它对 AI-Ready 重要?
它是脑 CT 领域"任务定义最干净、规模足够大、指标最统一"的公开底座之一:870K+ 张切片、六标签、单一官方指标,使其成为训练脑 CT 分类器、做自监督预训练、以及评测新模型泛化性的默认起点。它的局限(切片级标签、非开放许可)也恰好是许多后续工作要绕开或补齐的方向。
§1B 颅内出血临床背景与影像学基础
要真正读懂这份数据集在做什么,先要理解颅内出血在临床上是什么、影像上长什么样。这一节不是医学教科书,而是给"跑模型的人"补的最小组临床常识——因为它决定了模型输出的六个概率到底对应什么临床含义。
1B.1 什么是颅内出血
颅内出血(intracranial hemorrhage, ICH)指颅腔内的血管破裂、血液溢出到脑组织或脑外间隙。它的成因谱很广:外伤(traumatic)、高血压性小血管病、动脉瘤破裂、血管畸形、凝血功能障碍、溶栓/抗凝治疗并发症等。临床上它会引发一系列神经后果,从头痛、意识障碍直到死亡,严重程度取决于出血的量、位置、类型,以及是否压迫到关键脑区。
一个关键数字:颅内出血约占美国卒中(stroke)病例的 10%,而卒中是美国的第五大死因。这解释了为什么"快速识别出血位置与类型"被反复强调为治疗的关键第一步——它既是急诊分诊的依据,也是决定是否急诊手术的依据。
1B.2 出血在平扫 CT 上为什么是"白的"
所有急性(acute,即新发)出血在 CT 上都表现为高密度(dense/hyperdense)——即图像上的白色区域。原因是新鲜出血中血红蛋白(hemoglobin)浓度高、细胞完整,X 线吸收系数大,因此在 CT 上显影为高密度;随着时间推移,血肿内血红蛋白逐渐分解,密度下降,到亚急性期反而可能呈等密度——这正是"急性出血检测"任务相对可判定的影像学基础。
由于出血在平扫上即呈高密度,无需造影剂即可识别,这正是急诊首选平扫 CT(non-contrast head CT)的原因,也解释了数据集为什么只用无对比扫描。
1B.3 CT 密度与窗宽窗位:为什么需要"调窗"
CT 的像素值以亨氏单位(Hounsfield unit, HU)为标度:水 = 0 HU、空气 ≈ −1000 HU、致密骨可达 +1000 HU 以上;急性出血约在 +50 至 +80 HU 区间。人眼能分辨的灰度级有限(通常 256 级),而 HU 动态范围上千,所以必须用窗宽窗位(window width / window level, WW/WL)把感兴趣的 HU 区间线性映射到显示灰阶:窗位(WL)决定"窗口中心"落在哪个 HU,窗宽(WW)决定"窗口有多宽"。
脑 CT 的常用窗:
- 脑窗(brain window):典型 WL ≈ 40 HU、WW ≈ 80-120 HU,用于看脑实质与脑室,急性出血在此窗下最醒目;
- 骨窗(bone window):典型 WL ≈ 700 HU、WW ≈ 3200 HU,用于看颅骨骨折;
- 软组织窗(soft tissue window):介于两者之间。
这个知识点对使用者的实际含义是:DICOM 原始像素并不是"灰度图",它与窗设置强绑定。不同的预处理管线(直接归一化 HU、固定窗、或多窗堆叠)会产出不同的输入张量,直接导致模型迁移时的分布偏移。§6.4 与复现指南会给出具体处理建议。
1B.4 六类标签的解剖与影像特征
数据集的六个标签对应六种"出血位置"的判断。这张表是全文最需要记住的临床对照表:
| 标签(英文缩写) | 中文 | 解剖位置 | 影像特征与临床意义 |
|---|---|---|---|
| epidural (EPH/EDH) | 硬膜外出血 | 颅骨内板与硬脑膜之间(轴外) | 多为外伤致脑膜中动脉撕裂;典型双凸透镜形(biconvex/lentiform),不跨越颅缝;可快速进展需急诊手术,最稀有 |
| intraparenchymal (IPH) | 脑实质内出血 | 完全位于脑组织内 | 自发性脑出血(ICH 狭义)主体;常与高血压性小血管病相关,多见于基底节/丘脑;是最常见的亚型之一 |
| intraventricular (IVH) | 脑室内出血 | 脑室系统内(含脑脊液腔) | 可原发,更多继发于其他部位出血破入脑室;常伴脑积水风险 |
| subarachnoid (SAH) | 蛛网膜下腔出血 | 蛛网膜与软脑膜之间 | 可能提示动脉瘤破裂(临床最紧急的信号之一);血液充盈脑沟、脑池 |
| subdural (SDH) | 硬膜下出血 | 硬脑膜与蛛网膜之间(轴外) | 常见于老年人、外伤;新月形(crescent),可跨越颅缝;薄层出血最易漏诊 |
| any | 任一亚型阳性 | — | 聚合标签:上述五者中任一为阳性即置 1,代表"这张切片有出血" |
一句话记忆法:“轴外两种(EPH、SDH)+ 轴内三种(IPH、IVH、SAH)”。轴外(extra-axial)指积血位于脑外被膜层,轴内(intra-axial)指位于脑实质或脑室/脑池系统内。这个区分不是学究——它直接对应影像上的形态学:轴外血肿受颅骨与硬膜结构约束,形态更规则(透镜形、新月形);轴内出血形态更不规则、边界更模糊。
1B.5 为什么"多标签"而不是"多类"
临床上一名患者可以同时存在多种出血(例如 SAH 伴 IVH、外伤后 EDH 伴 SDH),而且这些出血可以出现在同一张切片上。因此数据集的标注从设计上就是多标签(multi-label)而非互斥多类(multi-class):一张切片可以同时置多个亚型为阳性。这对建模的含义是直接的——不能用 softmax 单类交叉熵,必须用逐标签独立的 sigmoid + 二值交叉熵(或等价的 log loss)。
1B.6 从影像判断亚型的三个线索
Kaggle 竞赛页明确给出:放射科医生判断出血亚型的主要影像线索是位置(location)、形态(shape)与邻近结构(proximity to other structures)。这对做模型可解释性的人是个提示:如果模型的显著性图(saliency map)集中在脑外被膜层,它可能在判 EPH/SDH;如果集中在基底节区,可能在判 IPH。这正是数据集拒绝给病灶坐标、但允许用显著性图"事后定位"的现实基础(§7.4)。
1B.7 与其他脑异常的关系
需要特别提醒:CT 上的高密度不等于只有出血。钙化、骨窗伪影、造影剂残留、金属植入物都可呈高密度;反之,等密度/低密度的慢性硬膜下血肿(chronic SDH)在这份数据集的五亚型体系里并不作为独立阳性类,而是被 BHX 单独设了一个 “Chronic Subdural Hematoma” 标签(§8.3)。理解这一点能避免把"模型漏检慢性硬膜下"当成单纯的技术缺陷——那是任务定义边界决定的。
§2 数据构成与规格
2.1 规模、来源与机构构成
RSNA ICH 数据集的规模数字在多个权威来源上有细微出入,正是这些出入最能说明"读数据集百科条目为什么要看口径":
| 口径来源 | 检查数 | 图像数 | 备注 |
|---|---|---|---|
| 论文(Flanders et al. 2020) | 25,312(最终采用) | 874,035 | 训练/验证 21,784 + 测试 3,528 |
| RSNA Atlas AI Data Card | >25,000 | 874,035 | 表述为 “over 25,000 CT brain scans” |
| Kaggle 竞赛数据页 | — | 874,037 files | 458.97 GB;文件计数含索引/CSV |
| arXiv 2211.15924(第三方使用) | 21,784(训练) | 752,803(训练) | 阳性率:检查级 41%、图像级 14% |
| MDPI s20195611(第三方) | 25,272 | 870,301 层 | 训练 752,803 层 / 测试 121,232 层 |
| 腾讯 AI Lab 竞赛报道 | 25,998 病人 | 1,074,271 幅 CT | 指的是原始提交候选池(未剔除前) |
这六个口径不是"谁对谁错",而是"谁在数什么":论文数的是最终纳入的检查,Kaggle 数的是磁盘上的文件,第三方论文数的往往是他们实际用到的训练子集,而 25,998/1,074,271 是剔除前的原始池(论文口径的 27,861 例/1,074,271 图与之接近)。引用时务必带上口径来源,不要写一个孤零零的"87 万张"。
四家来源机构(Atlas 卡片列 Organization 共六项,含 RSNA 与 ASNR 两个学会):
| 机构 | 国家 | 备注 |
|---|---|---|
| Stanford University(AIMI 中心) | 美国 | 论文署名来源之一;50/50 采样策略 |
| Universidade Federal de São Paulo (UNIFESP) | 巴西 | 论文署名来源之一;提供 1 年全量检查 |
| Thomas Jefferson University Hospital | 美国 | 论文署名来源之一;通讯作者所在机构;NLP 富集采样 |
| St. Michael’s / Unity Health Toronto(LKS-CHART DILA) | 加拿大 | Kaggle 竞赛页与 Atlas 均列出;论文正文三机构表述未纳入(见存照) |
| RSNA / ASNR | 美国 | 主办与标注组织方(非数据提供方) |
机构偏斜的具体贡献比未在公开来源中拆分——任何"某机构贡献了多少例"的说法都属推测,正文不做拆分(见遗留疑点)。
2.2 DICOM 序列层级:检查 / 序列 / 切片三层结构
理解这份数据的组织结构,必须先理解 DICOM 的层级模型。RSNA ICH 的每条数据沿三个 UID 层层嵌套:
| 层级 | 唯一标识 | 含义 | 本数据集中对应 |
|---|---|---|---|
| 检查(Study / Examination) | StudyInstanceUID |
一次完整的影像检查 | 1 例检查 ≈ 1 个 study(≈25,312 个) |
| 序列(Series) | SeriesInstanceUID |
一次扫描生成的一组同质切片 | 通常每个 study 1 个轴位序列 |
| 切片(Instance / Slice) | SOPInstanceUID |
单张 2D 图像 | 1 张切片 = 1 个 DICOM 文件(≈874,035 个) |
Kaggle 提交文件的 ID 命名规则正是这套层级的映射:每张图对应 6 行,形如 [Image Id]_[Sub-type Name](如 ID_1a2b3c_subdural),说明任务的原子单位是切片而非检查。使用者在写数据加载器时,典型做法是:读 CSV → 按 StudyInstanceUID 聚合成"检查"→ 按 SOPInstanceUID 排序成"序列"→ 再按序列喂给带上下文模型(如 BiLSTM/LSTM),这正是 §4.4 与 §7.2 讨论"单图 vs 序列"模型的由来。
2.3 图像规格与序列结构
| 属性 | 规格 |
|---|---|
| 模态 | 无对比头颅 CT(non-contrast head CT) |
| 格式 | DICOM(.dcm) |
| 方位 | 轴位(axial) |
| 层厚 | 3-5 mm |
| 每序列层数 | 20-60 层(第三方统计约 35 层/例) |
| 像素矩阵 | 512×512(头颅 CT 标准重建矩阵) |
| 灰度表示 | HU(亨氏单位),需经窗宽窗位映射显示 |
| 去标识化 | 已去标识化(de-identified)后上传 |
| 标签文件 | CSV(切片级多标签,含 stage_2_train.csv 等) |
“无对比”(non-contrast)三个字是本数据集的临床定位:出血在平扫 CT 上表现为高密度区,无需造影剂即可识别,这正是急诊筛查首选平扫的原因(§1B.2)。数据集不含增强扫描,因此它训练的模型也不适用于需要造影的血管病变判别任务。
关于层厚与"厚薄层"的细节值得单列一句:本数据集序列层厚集中在 3-5 mm(厚层),而外部对照集 BHX(§8)专门做了"厚层标注→薄层外推"的工作来补足薄层短缺。这意味着你在 RSNA ICH 上训练的模型,迁移到薄层(1 mm 以下)序列时可能面临切片间相关性与部分容积效应(partial volume effect)的分布差异。
2.4 标签体系:五亚型 + any
数据集的标签体系是本条目最需要讲清楚的部分,因为它直接决定你训出来的模型能答什么问题。
| 标签 | 缩写 | 中文 | 解剖定位与临床提示 |
|---|---|---|---|
| epidural | EPH / EDH | 硬膜外出血 | 颅骨与硬膜之间;多为外伤,可快速进展需急诊手术 |
| intraparenchymal | IPH | 脑实质内出血 | 脑组织内部;自发性脑出血主体,常与高血压相关 |
| intraventricular | IVH | 脑室内出血 | 脑室系统内;可继发于其他部位出血破入脑室 |
| subarachnoid | SAH | 蛛网膜下腔出血 | 蛛网膜与软膜之间;可能提示动脉瘤破裂,临床紧急 |
| subdural | SDH | 硬膜下出血 | 硬膜与蛛网膜之间;常见于老年人、外伤;薄层出血易漏诊 |
| any | — | 任一亚型阳性 | 聚合标签:上述五者中任一为阳性即置 1 |
三个使用须知:
- “any” 是聚合标签,不是第六类出血。它在训练中有时充当"先粗后细"的两阶段信号,但注意它与五个亚型标签高度相关,直接把它当作独立类别会引入冗余。
- 标签是切片级、不是病灶级。数据集不提供出血区域的边界框或分割掩码,只提供"这张切片是否含该亚型"。因此它适合训练分类/检测的初始判别,但要精确定位出血灶需另配分割标注的数据集(§5.1)。
- 多标签而非多类:一张切片可同时含多个亚型(如 SAH 伴 IVH),因此不能用互斥的 softmax 单类损失,官方指标也是按多标签对数损失定义的。
2.5 类别不平衡:为什么指标不能只看准确率
两个阳性率数字必须记住:
- 图像级(切片级)出血阳性率约 14%——即每 100 张切片里约 86 张是"正常"。
- 检查级出血阳性率约 41%——即每 100 例检查里约 41 例含至少一处出血。
这两者不矛盾:一个阳性检查往往只有少数几层真正显示出血,其余层是正常或移行区,所以检查级阳性率(41%)远高于切片级(14%)。这个结构带来两个直接后果:
- 切片级任务极不平衡:全判"正常"的平凡解在切片级上准确率可达 86%,但完全没有临床价值——这正是竞赛采用加权对数损失而非准确率的原因。
- 五亚型之间的不平衡更极端:EPH(硬膜外)在临床上本就罕见,其在数据集中的样本量远少于 SAH/SDH 等常见亚型(精确比例未在公开来源中给出,见遗留疑点)。作为外部对照,CQ500 中五个亚型的分布是 IPH 134 例、SAH 60 例、SDH 53 例、IVH 28 例、EPH 13 例(§8.1),EPH 与 IPH 相差约 10 倍,可作同类任务不平衡量级的参照。直接训练会使稀有亚型的召回率很低,常见做法是亚型加权、重采样或分头训练。
2.6 数据划分与测试集构成
| 划分 | 检查数 | 说明 |
|---|---|---|
| 训练/验证 | 21,784 | Kaggle 训练期公开 |
| 测试 | 3,528 | 竞赛评估期隐藏答案 |
| 合计 | 25,312 | 论文最终纳入 |
划分遵循两条硬规则(Atlas 卡片明确):其一,训练/验证/测试在患者级互斥(disjoint at the patient level)——同一患者的切片不会跨集出现,避免"同一人被模型记住"造成的乐观偏差;其二,各机构在每个细分段中被均衡代表,且出血亚型在验证/测试集中被"适当地代表"(appropriately represented)。
Atlas 卡片给出的具体划分机制是:各机构数据按 500 例检查为一段切分,每段的后 100 例选入测试/验证候选,再由额外两名神经放射科医生独立复核。论文口径的目标比例是:三读(three-read)例中约 15% 进测试、5% 进验证。
测试集 3,528 例中有 525 例经过了裁决(adjudication)——即多名阅片者判断不一致时由第三人(或专家)定夺。这个数字(525/3,528 ≈ 14.9%)是理解"颅内出血标注有多难"的一个窗口:近七分之一的测试检查存在专家之间的分歧,说明即使是资深放射科医生,在薄层硬膜下出血、少量蛛网膜下腔出血这类边界情形上也会各执一词。模型在测试集上达不到"完美",部分正是因为这个上限来自人类本身的一致性。
§3 建造与标注流水线:一场三万人次的众包协作
上一节回答的是"数据长什么样",本节回答的是"数据是怎么被造出来的"。理解建造过程不是为了考古,而是因为标注流程的每一个设计选择都会变成数据集标签里的结构性特征——哪些噪声可预期、哪些偏倚是被流程引入的、为什么测试集标签比训练集可信,答案都在这一节。
3.1 缘起:为什么 RSNA 要做这个数据集
2019 年,RSNA(北美放射学会)已经办过两届 AI 挑战赛(2017 骨龄、2018 肺炎),积累了一套"学会牵头 + 公开数据 + Kaggle 竞技 + 众包专家标注"的方法论。第三届选题时,团队把目光投向颅内出血。动机有三条:
- 临床需求明确:颅内出血是卒中致残致死的核心环节,快速识别与分型直接影响治疗决策,而人工判读在急诊高负荷场景下容易延迟;
- 数据可得性:脑 CT 是急诊最常见的检查之一,多家机构有海量存量,且出血在非对比 CT 上表现为高密度(hyperdense),理论上可学;
- 社区空白:2019 年之前颅内出血 AI 研究多为单中心几百例的小样本,缺乏一个多中心、大规模、公开标注的基准。
RSNA 的做法是把这件事产品化:成立机器学习指导分委员会(Machine Learning Steering Subcommittee)与数据标准分委员会,联合 ASNR(美国神经放射学会)召集志愿神经放射科医生,由 Kaggle 提供竞赛平台与奖金,由明尼苏达的 MD.ai 提供标注基础设施。这是一个典型的"学会治理 + 平台化运作 + 志愿专家"的三方结构,后文 §8 会把它抽象成可迁移的方法论。
3.2 数据发现:三家机构的三种采样策略
数据来自三家机构,但每家的"怎么找数据"策略完全不同(Atlas 数据卡 Sampling 一节原文可查),这是理解数据集偏倚的关键:
| 机构 | 国别 | 采样策略 | 后果 |
|---|---|---|---|
| Stanford University(AIMI) | 美国 | 依据放射报告的正常/异常评估预筛,构造 50/50 的阳性/阴性样本 | 异常比例被人为抬高,非自然患病率 |
| UNIFESP | 巴西 | 提供整整一年的全部脑 CT 检查 | 最接近自然患病率,但亚型分布随自然发生 |
| Thomas Jefferson University Hospital | 美国 | 用简单 NLP(自然语言处理)从报告中提取提及特定出血亚型的病例 | 亚型倾向性被强化,稀有亚型可能被相对富集 |
三种策略拼在一起,结果是汇总数据的亚型构成不代表任何单一真实队列。论文承认数据不平衡主要源自这种发现方法差异,并指出:如果各站都部署统一的查询/检索方案,可能产出更一致的亚型比例、减少汇总时的清洗负担。这句话是本节最重要的一句——它不是"数据有偏"这么简单,而是"三站各偏一处,拼起来偏得没有明确方向"。
与之并行的还有一条重要的伦理与治理步骤:每个参与机构都先取得了本机构审查委员会(IRB)与合规官的批准(Atlas 数据卡 Ethical review 一节明确)。这不是形式条款——它意味着数据的使用边界从源头就被框定在"研究用途"内,为后文的非商业许可打下了合规基础。
3.3 去标识化:一次"再匿名"插曲
影像与相关临床数据在上传前经过完全去标识化(fully de-identified)。但去标识化过程中出现了一个在本数据集历史上被明确记录的技术细节,值得单独讲:
站点特异性的匿名化"签名"可被用来区分机构,因此需要再做一轮匿名化,并生成合成唯一标识符来归一化检查元数据。(Atlas 数据卡 Re-identification 一节)
这句话的含义是:即便删掉了姓名、病案号,不同机构的 DICOM 生成软件、版本号、私有标签、时间偏移模式等"指纹"仍可能泄漏数据来自哪家医院。在一个多机构、跨国别的数据集里,这类泄漏本身就是再识别风险(攻击者若能辨别机构,再叠加公开信息,可能缩小到个体)。团队因此做了第二轮匿名化并生成合成 ID。这给所有做多中心数据共享的团队一个直接教训:去标识化不是"删姓名"一步,而是要对元数据做机构级归一化。本条目把它列为一个"数据治理"要点(详见 §6 数据治理与伦理)。
3.4 标注平台与"默认正常"工作流
标注在 MD.ai 平台上完成。MD.ai 是一个面向医学影像的云标注平台,其联合创始人 George Shih 也是本论文的共同作者——论文对此做了利益相关披露,这本身是科研透明性的正面案例。
工作流的核心设计是默认正常(default normal):每张切片在标注界面上默认标记为"无出血",标注者只在发现出血时把它切换成对应的亚型,并可勾选多个亚型。
这个设计是一把双刃剑:
- 收益:大幅降低标注摩擦。急诊脑 CT 上绝大多数切片是正常的(图像级出血阳性率仅约 14%,§2.5),默认正常让医生跳过大量无信息切片,把注意力集中在异常的少数切片上。没有这个设计,87 万张切片不可能在 3 个月内标完。
- 代价:它把"没被标为出血"默认等价于"确认无出血"。对绝大多数确实正常的切片无害,但对"边界阳性但被忽略"的切片,默认正常会把它算成阴性——形成漏标(under-labeling)。理解这一点对使用者的含义是:不要把该数据集的阴性标签当作逐张复核过的金标准,它在设计上就是"稀疏阳性标注"。
3.5 标注者:从 114 到 60 的遴选与激励
标注者不是随便招的志愿者,而是一支经过遴选、经过培训、有明确激励的队伍:
- 遴选:从 114 名候选神经放射科医生中筛选出 60 名参与标注(论文口径);
- 培训:每位入选标注者先完成 24 例训练检查的标注练习,通过后才进入正式标注;
- 激励:标记 ≥500 例检查的 top 15 名标注者被列为论文的联合作者(authorship incentive)。这是把"给数据集打工"转化为"参与一篇 Radiology: AI 高影响力论文"的务实机制——对学术型医生而言,署名价值远高于小额现金;
- 盲注:标注者之间互不知道彼此的判断(blinded reading),减少从众效应。
"60 名医生、3 个月、87 万张切片"这组数字背后是一个朴素的规模经济学:单人标完全部数据在时间上不可能,因此必须把标注切成许多小块、分给足够多的人并行完成,再靠平台统一标签口径。这套机制的边界也很清楚:并行换来了规模,但稀释了共识——只有 3,528 例走了三读(§3.6)。
3.6 质量控制:多阅片者与裁决
质量控制的重心明确落在测试集上:
- 测试集 3,528 例由 3 名阅片者独立标注,采用 **2/3 多数票(majority vote)**定标签;
- 其中 525 例存在分歧,进入裁决(adjudication)——由资深专家(第三人/专家组)定夺;
- 验证集同样由额外阅片者复核(Atlas 数据卡:每 500 例段的后 100 例由"额外两名神经放射科医生"独立复核);
- 训练集主体只经单专家一次判断,观察者间变异未被平均掉。
这个不对称是有意的——测试集的标签质量直接决定竞赛榜的可信度,因此投入更多资源保证其一致性;训练集则更强调覆盖规模。525/3,528 ≈ 14.9% 的测试检查存在专家分歧,这个数字本身就是理解"颅内出血标注有多难"的一个窗口:即使是资深放射科医生,在薄层硬膜下出血、少量蛛网膜下腔出血这类边界情形上也会各执一词。模型在测试集上达不到"完美",部分正是因为这个上限来自人类本身的一致性。
3.7 标签噪声的分类学(Atlas 数据卡的 Noise 一节原文)
Atlas 数据卡罕见地把标注噪声按频率排了序,这是本数据集最实用的"使用须知"之一:
| 排序 | 错误类型 | 含义 | 英文原文关键词 |
|---|---|---|---|
| 1(最普遍) | 少标(under-labeling) | 把单张图像的标签"推广"成整个检查,漏标了部分出血切片 | inadvertent designation of a single image label to reflect the entire examination |
| 2 | 多标(over-labeling) | 把出血标签标到了超出可见特征范围的切片上 | applying hemorrhage labels to images that extended beyond the visible feature |
| 3 | 亚型误分类(misclassification) | 标了出血但亚型判断错误 | misclassification of hemorrhage subtype |
少标居首并不意外:它正是"默认正常"工作流的系统性副产品——标注者一旦在某张图上确认了出血,容易把"整个检查"的标签草率地套到邻近切片上,反之也容易在边界切片上直接跳过。论文的策略是:多标与亚型误分类"在训练标注阶段不做再教育,只在验证/测试集评分时处理"。这是一种工程务实的取舍(§8.2 详述),代价是训练集标签噪声残留。
3.8 时间线:从数据发布到论文定稿
| 时间 | 事件 | 来源 |
|---|---|---|
| 2019-09-03 | Kaggle 竞赛第一波数据发布(训练集上线) | Kaggle 时间线 |
| 2019-09-17 | RSNA 新闻稿预告挑战赛 | RSNA 新闻稿 |
| 2019-09 至 2019-11 | 约 3 个月标注期 | 论文 |
| 2019-11-04 | 训练期结束 / 评估期开始 | Kaggle 时间线 |
| 2019-11-04 至 2019-11-11 | 评估期(公开/私有榜评测窗口) | Kaggle 时间线 |
| 2019-12-02 | RSNA 公布优胜者 | RSNA 新闻稿 |
| 2019-12-09 | 数据集本体 Date Created | Atlas 数据卡 |
| 2020-04-29 | 论文在线发表(Radiology: AI 2020;2(3):e190211) | PMC |
| 2020-07-29 | 勘误发表(2(4):e209002,DOI 10.1148/ryai.2020209002) | RSNA |
| 2024 | Atlas AI Data Card 上线,DOI 规范化 | Atlas |
时间线里有一条容易被忽略的细节:勘误(Erratum)的存在。2020-07-29 的勘误(DOI 10.1148/ryai.2020209002,卷 2 期 4)更正的是"致谢(Acknowledgments)中不慎遗漏的姓名"——这一点已在核验中确认(见 §10 事实清单与 §3.9)。它不改变任何硬数字,但提醒读者:引用论文时若引到勘误前的版本,致谢名单可能不完整。写手与研究者引用时应指向勘误后的规范版本。
3.9 建造流水线的可迁移启示
把 §3.1–§3.8 压成几条可迁移的经验(§8 会展开):
- 规模与共识不可兼得时,把多读预算集中在决定评测的集合上——训练集接受单读噪声,测试/验证集上三读 + 裁决;
- "默认正常"是降低标注摩擦的高效手段,但它必然引入少标——使用时要接受阴性标签是"稀疏阳性"而非"逐张确认";
- 去标识化要做机构级元数据归一化,否则 DICOM 指纹会泄漏来源;
- 标注者激励设计(署名 > 现金)比单纯付费更能吸引高质量志愿专家;
- 噪声要有分类学——知道"哪种错最多、怎么错",才能设计针对性的清洗或损失加权策略。
§4 任务定义、评估与基准
4.1 官方任务:切片级多标签分类
竞赛与论文对任务的正式定义是:给定单张 CT 切片,输出 6 个标签(5 亚型 + any)各自的概率。这是一个**多标签分类(multi-label classification)**问题,而非多类(multi-class)或目标检测:
- 多标签:一张切片可同时置多个亚型为阳性(例如 SAH 与 IVH 常并存);
- 概率输出:每个标签独立给出 [0,1] 概率,而非互斥的类别选择,因此支持"亚型不确定"的表达。
选择这个定义而非目标检测(画框),是因为数据集只提供切片级标签、不提供病灶位置标注(§5.1)。这也决定了它的下游用途偏向分诊/筛查(这张片有没有出血、哪类)而非定位。
Kaggle 数据页对标签结构有精确描述:训练 CSV 是 Id,Label 两列,每个图像 Id 对应 6 行,行 Id 形如 [Image Id]_[Sub-type Name]。例如:
Id,Label
1_epidural_hemorrhage,0
1_intraparenchymal_hemorrhage,0
1_intraventricular_hemorrhage,0
1_subarachnoid_hemorrhage,0.6
1_subdural_hemorrhage,0
1_any,0.9
Label 列在训练数据里是概率(多为 0/1,但也允许 0.6 这种软标签),在提交时是模型预测的概率。后文 §附录 E 给出六标签的中英缩写与提交后缀对照。
4.2 评估指标:加权多标签对数损失
竞赛采用的官方指标是 Kaggle 定义的加权多标签对数损失(weighted multi-label logarithmic loss)。要点三条:
- 对数损失(log loss):对每个标签的二分类概率算对数损失,预测越自信且错得越离谱,惩罚越大;
- 多标签:对 6 个标签分别计算,再按竞赛规则聚合;
- 加权:给每个标签(或每个样本)赋予权重,以缓解"any"与各亚型之间的相关性以及类别不平衡带来的偏差。
单标签的对数损失定义是:
loss(p, y) = -[ y · ln(p) + (1 - y) · ln(1 - p) ]
其中 p 是模型对该标签预测的阳性概率,y 是真实标签(0 或 1)。当真实为 1 而模型预测 p→0 时,loss→∞;预测正确且自信时 loss→0。多标签情形下,把 6 个标签的 loss 按权重线性组合再对样本平均:
L = mean_over_samples( Σ_label w_label · loss(p_label, y_label) )
Kaggle 的实现细节里还有一条:概率会被夹逼(clip)到 [10⁻¹⁵, 1−10⁻¹⁵] 区间,避免 log(0) 溢出。这个指标的好处是能区分"会预测但置信度差"与"根本不会预测"的模型——全预测 0.5 或全预测"正常"都会得到较差(偏高)的损失值(见 §4.5 平凡基线),只有真正学到信号的模型才能把损失压到 0.05 以下。
为什么是加权而不是简单平均? 因为 6 个标签高度相关(any = 5 个亚型的逻辑或),且类别极不平衡(EPH 最稀有)。若简单平均,任何一个标签的极端错误都可能被其他标签的平均效应淹没;加权让"检测"(any)与各"分型"亚型的贡献可被调控,也使稀有亚型的错误不至于被完全稀释。实践上,权重越高,模型越被迫在该标签上收敛。
4.3 竞赛榜与优胜者
最终私有榜前五名与成绩:
| 名次 | 队伍 | 损失值(越低越好) |
|---|---|---|
| 1 | SeuTao | 0.04383 |
| 2 | NoBrainer | 0.04484 |
| 3 | takuoko | 0.04510 |
| 4 | GZ | 0.04529 |
| 5 | Keep Digging Gold | 0.04561 |
奖金池 $25,000 的分配:1st $8,000、2nd $6,000、3rd $4,000、4-10th 各 $1,000。前五名成绩密集分布在 0.044–0.046 的窄带内,说明在数据集给定的任务定义下,头部方案的性能已接近该方法框架的上限;进一步提升需要更细的标签(病灶级)或更大的数据,而非仅调参。
RSNA 新闻稿给出的获奖名单是剔除 declined(放弃领奖)队伍后的顺延名单:
| 名次 | 队伍(新闻稿口径) |
|---|---|
| 1 | SeuTao |
| 2 | NoBrainer |
| 3 | takuoko |
| 4 | GZ |
| 5 | Keep Digging Gold |
| 6 | BRAINSCAN.AI |
| 7 | Big Head |
| 8 | 賞金で焼肉 |
| 9 | Mind Blowers |
| 10 | VinBDI.MedicalImagingTeam |
而 Kaggle 榜单里含两支 declined prize 队伍(Analytical AI、Guanshuo Xu),因此新闻稿名单与 Kaggle 榜单在小名次段不一致——引用获奖名单时务必注明口径(坑 6)。
4.4 后续学术基准
竞赛之后,该数据集被大量第三方工作作为基准或预训练底座使用,常见引用形态包括:
| 用途 | 典型做法 | 备注 |
|---|---|---|
| 监督分类基线 | ResNet / EfficientNet / DenseNet + 序列级聚合 | 多篇论文报告 AUC、F1 |
| 自监督预训练 | 在 874K 切片上做对比学习,再迁移下游 | 脑 CT 域内预训练底座 |
| 检测后分类 | 先在切片上定位可疑区,再分类 | 需额外标注辅助 |
| 鲁棒性评测 | 跨机构、跨扫描协议测试泛化 | 常与 CQ500 等对照 |
论文自身报告的方法—分数对照(Kaggle 榜口径)是一个很好的"骨干 vs 上下文"参照:
| 方法 | 分数 | 名次 |
|---|---|---|
| EfficientNet-B4 | 0.07212 | 278 |
| ResNeXt-101 单模型 | 0.06259 | 191 |
| ResNeXt-101 + BiLSTM 3×256 | 0.05540 | 64 |
| ResNeXt-101 + BiLSTM + 特征选择(120) | 0.04989 | 27 |
| 冠军 SeuTao | 0.04383 | 1 |
这张表最值得读的一行是:单图 ResNeXt-101(0.06259)加上 BiLSTM 序列建模后降到 0.05540,再叠特征选择降到 0.04989。它量化了一个直觉——相邻切片的上下文对出血判定至关重要,因为出血在三维空间中是连续的,单张切片容易与正常高密度结构(如钙化、骨)混淆,而序列模型能利用上下文的连续性做去伪。
第三方论文报告的性能数字口径不一(AUC、F1、准确率混用),引用时务必核对原文的指标定义与数据划分。本条目不给出"某模型达到 XX%"的确切数字,除非能从一手来源核实(见 §10 遗留疑点)。
4.5 平凡基线与"分数为什么看起来很低"
竞赛页面描述的 trivial 基线(全预测无出血)约在 0.2 级别(论文/MIRA 口径"trivial 基线约 0.2",未实抓精确值,记为"约")。优胜者把它降到 0.04383,说明:
- 任务可学(有信号,不是随机);
- 但难度高(绝对分数低不代表模型差,而是指标对置信度敏感);
- 由于 any 阳性率仅约 14%,多数类主导下 log loss 天然不难看——不能用单一 log loss 判断模型优劣(坑 9)。
正确的做法是同时报告 AUC / 敏感度 / 特异度,并单独报告 EPH 这类稀有亚型的召回。附录 H 给出了完整的"评测完备性"报告清单建议。
§5 数据局限与偏倚(论文自曝 + 使用须知)
数据集的边界比它的规模更值得细读。RSNA ICH 论文在 Limitations 与 Assumptions 两节主动列出了若干限制,Atlas 数据卡也用专门字段(Missing information / Noise / Confidentiality)登记了边界条件。这些不是"挑刺",而是作者自己承认的设计取舍——理解它们才能知道自己用它做研究时,结论的适用边界在哪里。
5.1 无坐标标注:只有"有没有",没有"在哪里"
这是最重要的局限。论文 Limitations 明确列出:“刻意排除任何出血亚型的坐标或感兴趣区域(ROI),这是最终数据集的一个局限。” 团队可以论证显著性图能"事后定位",但对需要像素级或框级监督的下游任务(出血体积测量、分割、放疗/手术规划),RSNA ICH 本身不够用。使用者若需要定位,应转向:
- CT-ICH(PhysioNet):带出血的逐像素分割;
- BHX(PhysioNet):基于 CQ500 的出血 bounding box;
- 或自行在 RSNA ICH 上做弱监督定位研究(显著性图 / CAM / MIL 注意力)。
5.2 单专家训练标注:噪声上限
训练集主体只经一次专家判断,观察者间变异未被平均掉。论文自身建议:“为最优地减少误分类,训练、验证、测试本应多审阅者。” 这意味着:
- 不要把 RSNA ICH 的标签当作"金标准",它是"一个专家的判断";
- 跨模型比较时,0.001 量级的分差可能完全被标签噪声淹没;
- 做临床性能宣称时,最好在 CQ500 / CT-ICH 等外部集上额外验证。
(注:测试集 3,528 例使用了 3 名阅片者 + 525 例裁决,质控强于训练集;训练集的单专家性质是主要噪声来源。)
5.3 无患者画像:哪些判断做不了
标注在非临床场景进行,且没有病史、症状急缓、患者年龄/性别、既往影像。Atlas 数据卡的 Missing information 字段原文:
Without knowledge of patient age or sex, it was impossible to assess for some conditions (eg, age-appropriate volume loss or white matter disease) that would have aided in designating an examination as “no hemorrhage/not normal.”
后果:
- 无法区分"年龄相符的脑容量丢失"与病理性改变;
- 无法判断某些出血是否与干预相关(如溶栓后脑实质出血、术后轴外出血)——这些仍被标为出血,但临床语境不同;
- 无法做患者级风险分层研究(数据本身不含临床终点)。
5.4 类别不平衡与稀有类
EPH(硬膜外)最少、图像级 any 阳性率仅约 14%(§2.5)。这对评测的直接影响是:加权 log loss 对多数类(无出血)相对友好。一个恒输出低概率的平凡模型也能拿到"不算难看"的分数,因此报告指标时应同时给出 AUC / 敏感度 / 特异度,尤其在 EPH 这类稀有亚型上单独报告。
外部对照集 CQ500 的亚型分布可作为一个"稀有类有多稀有"的侧证:IPH 134、SAH 60、SDH 53、IVH 28、EPH 13(检查级计数)——EPH 只有 13 例,是所有亚型中最稀的。
5.5 机构采样偏倚(本数据集最重要的结构性偏倚)
如 §3.2 所述,三站发现方法不同(Stanford 50/50 采样、UNIFESP 取一年全量、Jefferson 用 NLP 富集阳性),导致汇总数据的亚型构成不是任何真实队列的自然分布。Atlas 数据卡 Sampling 一节与论文 Limitations 均明确承认这一点。论文建议"若各站部署统一的查询/检索方案,可能产出更一致的亚型比例,从而减少汇总时的清洗负担"。跨机构泛化结论需谨慎。
需要特别指出:这种偏倚不只是"阳性率被抬高"这么简单。它意味着模型的先验被改写了——在 RSNA ICH 上训练的模型,其对"出血概率"的先验是机构采样后的分布,直接搬到自然分布的真实队列上会校准失准(calibration shift)。做部署时应在自然分布数据上重校准。
5.6 未分类的丰富病理
论文指出:数据中包含大量从未被专门分类的脑疾病状态(卒中、萎缩、白质病变、脑积水、肿瘤等),只被笼统归入 “abnormal / not hemorrhage”。这意味着数据集只对出血做了正例标注——若你的研究关心其他脑异常,这些标签不适用,反而可能成为混淆:异常非出血图像对出血模型是"困难的负例"(大脑形态异常但无出血,模型容易误报)。
Atlas 数据卡还记录了另一个细节:训练数据集包含异常检查的系列影像(serial imaging),但异常的时序演化对标注不需要(Relationships between instances 字段)。这意味着同一检查内可能存在多时点序列,标注时被视为等价——对做纵向研究的团队,这是一个需要自己处理的隐含结构。
5.7 局限性与偏倚总结表
| 局限/偏倚 | 论文/数据卡是否明说 | 对使用者的实际影响 |
|---|---|---|
| 无坐标/ROI | 是(Limitations) | 不能直接做分割/检测/体积测量 |
| 训练集单专家标注 | 是 | 标签含观察者间变异,非金标准 |
| 无患者画像(年龄/性别/病史) | 是(Missing information) | 无法做年龄/性别/病史相关分析 |
| 类别极不平衡(EPH 最少) | 是(Figure 4/5) | 平凡模型分数不难看;稀有类召回难 |
| 机构采样偏倚(三种策略) | 是(Sampling) | 非自然患病率分布,先验被改写,泛化需谨慎 |
| 少标/多标/亚型误分类 | 是(Noise) | 标签噪声,尤以少标最普遍 |
| 机构指纹可再识别 | 是(Re-identification) | 需机构级元数据归一化 |
| 异常非出血为困难负例 | 论文讨论 | 模型易在异常非出血图上误报 |
§6 获取、许可与数据治理
6.1 双通道发放
| 通道 | 入口 | 门槛 | 许可文本 |
|---|---|---|---|
| Kaggle | kaggle.com/competitions/rsna-intracranial-hemorrhage-detection/data |
注册 Kaggle + 接受竞赛规则 | Subject to Competition Rules |
| MIRA | imaging.rsna.org/dataset/1 |
提交邮箱 + 同意研究协议 → 邮件收下载链接 | RSNA MIRA Dataset Research Use Agreement |
| Atlas | atlas.rsna.org/cards/bd41bbe2-... |
公开浏览元信息 | DOI 规范化引用(10.1148/dataset.ihd.2024) |
前两者条款不完全等价(未逐条比对,见 §10 遗留疑点):Kaggle 走的是"竞赛数据使用规则",MIRA 走的是 RSNA 自建仓库的"研究用途协议"。用前务必读实际拿到的条款。
值得强调的是 Atlas 数据卡给出的 Organization 列表比论文三位作者机构更宽,它把参与治理与数据贡献的组织都列出来了:
| 组织 | 角色 |
|---|---|
| Radiological Society of North America(RSNA) | 主办方 / 分发方 |
| American Society of Neuroradiology(ASNR) | 标注协作方(召集志愿神经放射科医生) |
| Stanford University — AIMI | 数据来源机构 |
| St. Michael’s · LKS-CHART · DILA(Unity Health Toronto) | 数据来源 / 标注协作 |
| Thomas Jefferson University Hospital | 数据来源机构 |
| Universidade Federal de São Paulo(UNIFESP) | 数据来源机构 |
这解释了"3 家 vs 4 家机构"的口径分歧(坑 7):Atlas 把治理/标注协作方(ASNR、St. Michael’s/DILA)与影像数据提供方(Stanford/Jefferson/UNIFESP)一并列出,而论文口径的"3 家"单指影像来源机构。做学术引用时以论文/官方数据卡的来源机构表述为准,做生态盘点时可用 Atlas 的完整组织列表。
6.2 数据体量与格式
- Kaggle 数据页实抓(本轮核验):874,037 个文件、458.97 GB,类型
dcm, csv。 - 图像为原始 DICOM,含
PatientID、StudyInstanceUID、SeriesInstanceUID等元数据。 - 配套文件(Kaggle 数据页实抓):
stage_2_train.csv(训练标签)、stage_2_test.zip(测试图)、stage_2_sample_submission.csv(样例提交)。 - 注意:Kaggle 竞赛为**两阶段(two-stage)**格式,Stage 1 为练习、Stage 2 为正式,正式评比用 stage_2 系列文件。
6.3 MIRA 获取实操
- 打开
imaging.rsna.org/dataset/1; - 提供邮箱地址并勾选同意使用条款;
- 由
no-reply@imaging.rsna.org邮件发送下载链接; - 下载/协助联系
informatics@rsna.org。
论文与数据卡均声明:RSNA MIRA 数据集对非商业研究免费(made available at no cost for non-commercial research)。
6.4 版本链与派生镜像
- 官方版本:Version 1.0(MIRA 数据卡,2019-12-09 创建;DOI
10.1148/dataset.ihd.2024),无 2.0 式重大版本迭代。 - 竞赛阶段:Stage 1(练习)→ Stage 2(正式),正式用 stage_2。
- 社区派生:Kaggle Datasets 与 HuggingFace 上有大量预处理镜像(JPEG/PNG、重采样到 224/256/512、按患者划分的 train/val/test),这些非官方,格式与许可均可能与原始 DICOM 不同,引用时应注明来源与预处理。环境提示:HuggingFace 主站若被沙箱封锁,可走 hf-mirror.com。
6.5 license 性质提醒
RSNA ICH 没有标准 CC 协议。它是"研究用途免费、非商业 + 遵守协议"的约束。若用于商业产品,需另行评估协议条款(MIRA 协议与 Kaggle 竞赛规则都可能限制商用)。这一点与库内许多 CC BY / CC BY-NC 数据集不同,检索者需特别注意。不要把"Kaggle 上能下载"误读为"可以自由使用"。
Atlas 数据卡给出的 License 字段是明确的:
Text: RSNA MIRA DATASET RESEARCH USE AGREEMENT
URL: https://docs.google.com/document/d/1r8_0yW-5XqxSqhFzFq2fV6L4NxIQ6drF0sBjXXJevXU/edit
Contact: informatics@rsna.org
引用时应同时引用论文(Flanders et al. 2020,DOI 10.1148/ryai.2020190211)与数据集本体(Atlas DOI 10.1148/dataset.ihd.2024)。
6.6 数据治理与伦理(本节为独立新增章节)
大规模多机构医学数据集的价值越高,治理责任越重。RSNA ICH 在治理与伦理上的做法值得逐条拆解,因为它为后续所有"学会牵头 + 众包标注 + 公开分发"的数据集提供了一份可复制的合规模板。
6.6.1 IRB 与机构合规
Atlas 数据卡 Ethical review 字段原文:“Each contributing institution secured approval of its institutional review board and institutional compliance officers.”(每个贡献机构都取得了本机构 IRB 与合规官的批准。)
这一条看似平淡,实则是整个数据集能够合法公开的前提:数据从源头就被框定为"经伦理审查的研究用途",因此下游的分发许可(非商业研究用途)不是后加的限制,而是伦理批准的自然延伸。使用者在做二次分发或商用评估时,应当理解这条约束的根基在 IRB 批准,而非一纸许可文本——即便某个镜像站没有标注许可,原始数据的伦理边界依然存在。
6.6.2 完全去标识化与再识别风险
影像与相关临床数据完全去标识化(fully de-identified)。但数据集历史上明确记录了一次"再匿名"(见 §3.3):站点特异性的匿名化签名可区分机构,因此需要再做一轮匿名化并生成合成唯一标识符来归一化检查元数据。
这一条对所有做多中心数据共享的团队是一个硬教训:
| 风险 | 说明 | 缓解 |
|---|---|---|
| 直接标识符泄漏 | 姓名、病案号等 | 常规去标识化删除 |
| 设备/软件指纹 | DICOM 生成软件与版本、私有标签 | 需要时也须归一化 |
| 机构签名 | 不同机构元数据模式可辨 | 合成 ID + 元数据归一化 |
| 时间戳关联 | 检查时间可与其他记录交叉 | 时间偏移 / 取整 |
在一个跨国别数据集里,机构归属本身就是一种准标识符——它把个体从"全球任意人"缩小到"某国某院某时间段的患者"。团队的第二轮匿名化正是针对这一点。使用者若要再分发(在许可允许范围内),也应对元数据做同样的归一化,而不是只删姓名。
6.6.3 伦理与合规的"三不"边界
综合 §6.1–§6.6.2,可以把本数据集的伦理与合规边界概括为"三不":
- 不得用于临床诊断:数据集是研究资源,未经监管审批不得直接用于患者诊疗决策(Atlas 明确其用途为"帮助开发辅助检测与表征的机器学习算法",即研究工具);
- 不得默认商用:许可为非商业研究用途,商用需另行评估;
- 不得绕过伦理边界再分发:即便技术上能下载,再分发的合法性来自原始 IRB 与许可,派生镜像的"无许可声明"不能替代它。
6.6.4 引用规范
使用本数据集时,规范的引用应包含:
① 论文(数据资源论文):
Flanders AE, Prevedello LM, Shih G, et al. Construction of a Machine
Learning Dataset through Collaboration: The RSNA 2019 Brain CT
Hemorrhage Challenge. Radiol Artif Intell. 2020;2(3):e190211.
doi:10.1148/ryai.2020190211
② 数据集本体(Atlas/MIRA):
RSNA Intracranial Hemorrhage Detection (RSNA-IHD) Dataset.
doi:10.1148/dataset.ihd.2024
③ 致谢勘误(如需完整致谢):
Radiol Artif Intell. 2020;2(4):e209002. doi:10.1148/ryai.2020209002
6.6.5 与库内其他数据集的治理对照
| 数据集类 | 许可模式 | 治理重心 | 代表 |
|---|---|---|---|
| RSNA ICH(本条目) | 研究用途协议(非 CC) | IRB + 去标识化 + 再匿名 | 学会牵头众包 |
| CC BY 类 | 宽松开放 | 只需署名 | 多数学术数据集 |
| CC BY-NC 类 | 非商业开放 | 用途约束 | 部分影像数据集 |
| DUA 申请类 | 签协议后按批准使用 | 逐次审批 + 使用报告 | 联邦 / 注册库类 |
RSNA ICH 属于"研究用途协议"档:比 CC BY-NC 更严格(有专门协议、邮箱申请),但又比需要逐次 DUA 审查的注册库类更开放(Kaggle 上可直接下载)。理解自己所处档位的义务,比记住一个 license 缩写更重要。
§7 生态、影响与外部评测
7.1 作为默认基准的地位
RSNA ICH 已成为脑 CT 出血检测领域的默认基准与预训练池:
- 大量后续论文直接在其上训练/微调,或用作预训练再迁移到小数据集;
- 它也是弱监督/多实例学习(MIL)研究的天然实验台——因为数据同时有检查级(弱)与图级(强)标签;
- 众多竞赛方案的开源代码成为社区学习资源。
一个数据集能成为"默认基准",取决于三点:规模足够大到能训练深度模型、标注足够可信到能横向比较、获取足够容易到能随手复现。RSNA ICH 三点都满足,因此它在 2019 年之后迅速取代了此前的小样本单中心研究,成为颅内出血 AI 的起点。
7.2 弱监督 vs 强监督:一个数据集引出的建模问题
arXiv 2211.15924(Teneggi, Yi, Sulam,2022)直接以 RSNA ICH 为实验对象,研究"应该收集哪种标签"。其摘要的核心结论是:强监督(图像级局部标注)与弱监督(仅检查级全局标签)在检查级出血检测(选出检查中有出血迹象的那些图像)与图像级出血检测(在选出的图像中高亮出血迹象)上,能达到可比的性能;论文进一步发现,局部标签可能根本不需要,从而大幅降低数据收集与整理的时间与成本。
该论文把两类任务重述为**多实例学习(MIL, multiple instance learning)**问题:把一个检查看作一个 bag(包),包内每张切片是一个 instance(实例)。弱监督只有 bag 标签(检查有无出血),强监督有 instance 标签(每张切片有无出血)。用现代注意力深度架构(attention-based DL)比较两种监督强度,结论是弱监督可大幅减少所需标签量。
这个研究之所以可能在 RSNA ICH 上做,正是因为数据集同时提供了检查级与图级标签——这种双层结构本身就是数据集的隐形价值。能同时承载弱/强标签的数据集,其研究寿命通常远超其原始任务(§8.3 展开)。
7.3 外部测试集与迁移评估
为检验跨机构泛化,后续研究常用两个独立外部集:
| 外部集 | 来源 | 规模 | 标注 |
|---|---|---|---|
| CQ500 | Qure.ai / 印度 | 436 检查(≈49% 阳性)、15,156 图 | 检查级;BHX 提供出血 bounding box |
| CT-ICH | PhysioNet | 75 检查(≈48% 阳性)、2,539 图 | 检查级 + 图级 + 逐像素出血分割(两位专家) |
这两个集不属于 RSNA ICH,仅作外部评测对照。它们对 RSNA ICH 训练的模型构成一次"跨中心、跨设备、跨国别"的考验——也是很多论文报告泛化性能的落点。检索时务必分清:CQ500 不是 RSNA ICH 的别名(坑 2)。
外部集在方法论上的意义值得展开:
- CQ500 的价值在于"分布外":它来自印度 Qure.ai,设备、协议、人群都与 RSNA ICH 的北美/南美来源不同。在 RSNA ICH 上表现好的模型,若在 CQ500 上掉点,就直接暴露了"过拟合到训练机构的成像特征与先验分布"。
- CT-ICH 的价值在于"细粒度":它提供逐像素出血分割(两位专家标注),使研究者可以在同一批数据上同时评估分类与分割,也可用分割真值反查分类模型"看的地方对不对"。
- BHX 的价值在于"可定位":它基于 CQ500 提供了出血的 bounding box,恰好补上了 RSNA ICH 最大的缺口(无坐标标注,§5.1)。
一个典型的迁移评测协议是:在 RSNA ICH 上训练 → 冻结模型 → 在 CQ500/CT-ICH 上直接推理 → 报告检查级 AUC 与敏感度/特异度。若掉点显著,说明泛化不足;若掉点有限,说明学到了可迁移的出血表征。这个协议之所以被广泛采用,正是因为 RSNA ICH 的训练规模足够大,而 CQ500/CT-ICH 提供了独立、可比、公开的外部验证。
7.4 对临床与产业的影响
- 临床路径:颅内出血占美国卒中约 10%,卒中是美国主要死因之一;快速识别出血位置与类型是治疗的关键一步,而这一过程复杂且常常耗时。RSNA ICH 提供了训练"分诊优先级排序"AI 的数据基础。
- 产业:多家影像 AI 公司参与或引用该挑战赛,该数据集成为颅内出血 CAD 产品的常见训练/验证来源。
- 学会治理:作为 RSNA 系列 AI 挑战赛之一,它延续了"学会牵头、众包专家标注、公开数据 + Kaggle 竞技"的治理模式,为后续 RSNA 挑战赛(肺栓塞、乳腺癌筛查、颈椎骨折、腹部创伤 RATIC 等)确立了模板。
值得注意的是临床意义的两面性:数据集训练的是"检测与分型",但临床上真正紧迫的是分诊优先级(先看哪个患者)。这两者并不完全等同——一个能准确分类出血亚型的模型,未必能回答"哪个患者需要立即处理"。因此论文的措辞是"帮助开发能够辅助检测与表征的算法",而非"替代临床判断"。使用者在做临床落地评估时,应把"诊断准确性"与"分诊效用"分开衡量。
7.5 RSNA AI Challenge 家族谱系
| 年份 | 挑战赛 | Kaggle 数据集 | 模态/任务 |
|---|---|---|---|
| 2017 | 儿科手骨龄 | rsna-bone-age(库内 rid426) | 手 X 光谱骨龄回归 |
| 2018 | 肺炎检测 | rsna-pneumonia(库内 rid712) | 胸 X 光肺炎二分类 |
| 2019 | 脑 CT 出血 | 本条目 | 脑 CT 六标签出血分类 |
| 2020 | 肺栓塞 | RSNA-STR PE | 胸部 CTA 肺栓塞 |
| 2022+ | 乳腺癌筛查 / 颈椎骨折 / 腹部创伤(RATIC) | 各自 | 乳腺 X 线 / 颈椎 CT / 腹部 CT |
(注:上表 2020 及之后为 RSNA 同系列数据集,库内命中情况以 §9 为准;本条目仅确证 2017 / 2018 / 2019 三项在库内 rid。)
7.6 社区复现资源与工程生态
竞赛结束后,围绕 RSNA ICH 形成了一个活跃的工程生态:
| 资源类型 | 典型内容 | 用途 |
|---|---|---|
| Kaggle Notebooks | PyTorch 基线、EfficientNet/ResNet 骨干、序列聚合 | 快速上手、复现竞赛方案 |
| GitHub 仓库 | 冠军/前列方案开源(模型、训练脚本、预处理) | 学习 best practice |
| 预处理镜像 | JPEG/PNG 转换、HHF/重采样、患者级划分 | 降低 DICOM 处理门槛 |
| 预训练权重 | 在 874K 切片上训练的脑 CT 编码器 | 迁移到小数据集 |
一个值得记录的工程细节:竞赛方案普遍采用多阶段流程——先用 DICOM 转 PNG(常见的 HHF 归一化:把 Hounsfield 单位按窗宽窗位映射到 8 位灰度),再按检查(Study)聚合切片、用 RNN/注意力做序列建模,最后对 6 个标签分别输出概率。这套流程此后成了脑 CT 分类任务的"标配管线",很多后续论文直接沿用。
环境提示(沙箱复现相关):HuggingFace 主站若被封锁,可用 hf-mirror.com 镜像下载预处理版本;Kaggle API 需先配置 ~/.kaggle/kaggle.json 凭据。这些是复现时的实际障碍,写在这里是因为很多使用者卡在"下载不下来",而非"不会建模"。
7.7 生态位判断:它替代了什么、又留下了什么空白
把 RSNA ICH 放进时间轴看,它的生态位非常清楚:
- 它替代了:此前零散的单中心小样本颅内出血研究,让领域第一次有了统一的、大规模的、公开的基准;
- 它开启的:脑 CT 域的自监督/监督预训练范式(874K 切片做底座)、弱监督 MIL 研究、跨中心泛化评测的标准协议;
- 它留下的空白:出血定位(分割/检测框)、患者级临床终点、纵向时序研究、自然患病率分布——这些空白后来分别由 CT-ICH、BHX、以及各类注册库/队列数据部分填补。
了解这个生态位,使用者就能快速判断:RSNA ICH 适合"做大做全的底座",不适合"做精做准的定位"。把它放在正确的任务上,它的价值最大化;放错任务,它的局限会被放大。
§8 方法学启示:六条可迁移的经验
RSNA 颅内出血数据集的价值不止于"一份能跑的分类数据",它把若干条可迁移到其他医学影像项目的工程经验固化了下来。以下六条,每一条都能在其他数据集的建造中复用。
8.1 众包专家标注的可扩展性边界
87 万张切片、6 个标签、由 60 名放射科医生在 MD.ai 上完成——这套流程证明了"众包专家标注"可以做到研究与竞赛可用的规模。但它同时给出了边界:当标注任务需要空间定位(像素级分割、边界框)时,众包成本会急剧上升,因为定位比分类需要更多的交互与更长的时间。RSNA-IHD 主动放弃了坐标,换来了规模,这一取舍在 §8.4 展开。
8.2 "清理测试集,容忍训练集"的工程哲学
官方把最强的标注资源投在三读例(adjudicated)上,用于测试集与验证集;训练集则保留单人标注的噪声。这是刻意设计:
- 测试集的可信度 决定榜单与结论的可信度,必须干净;
- 训练集带噪 反而更贴近真实部署场景——临床数据本身就带噪。
可迁移结论:不要用同一套标注标准对待训练集与评测集。评测集要严,训练集可适度放宽,但需在文档中明示噪声水平。
8.3 双层标签是天然的弱监督实验台
any 与五个亚型构成天然的两级体系。研究者可以:
- 只用
any训练二分类器,再用亚型头细分(多任务); - 把亚型作为辅助任务,正则化
any的表示; - 用
any的强监督信号引导亚型的弱监督学习。
这种"标签层级自带结构"的特性,使 RSNA-IHD 成为弱监督与多任务学习研究的便利平台。
8.4 拒绝坐标标注是一个可辩护的取舍
没有坐标,意味着无法直接评测定位精度,也无法训练检测/分割模型。但官方给出三点理由(见 FACTS.md 与论文口径):
- 定位标注的众包一致性问题更严重;
- 切片级分类已足以支撑"分诊优先级"这一临床目标;
- 更丰富的信息应交给下游研究(后续多个外部集补上了定位)。
可迁移结论:标注粒度应服从任务目标,而非追求"越细越好"。
8.5 去标识化必须做"两轮"
简单的匿名化(删掉姓名、病历号)不足以应对再识别风险:CT 影像自带面部轮廓、体表标记、设备指纹等准标识符。RSNA-IHD 的第二轮处理用"合成的唯一标识符"替换原始标识,并归一化机构签名(site signature)。可迁移结论:影像数据的去标识化是一次系统性工程,不是一次字段删除。
8.6 把"可复现"写进规则
竞赛把"Stage-1 必须上传可运行的模型容器"列为强制规则,并作为获奖前置条件。这在数据层面之外,强制了方法层面的可复现性。可迁移结论:若希望数据集的产出可被复现,应在数据使用规则里同时约束"代码/模型"的可得性。
§9 与库内条目的关系
9.1 家族图谱:RSNA AI Challenge 系列
RSNA-IHD 属于 RSNA 与 Kaggle 合作主办的机器学习竞赛家族。库内同族条目包括:
| 库内条目 | 竞赛/年份 | 影像模态 | 任务类型 | 关系 |
|---|---|---|---|---|
| rsna-intracranial-hemorrhage(本条目) | RSNA ICH 2019 | 头颅平扫 CT | 切片级多标签分类 | 本项目 |
| rsna-pneumonia | RSNA Pneumonia 2018 | 胸片 X 光 | 检测 + 分类 | 前序同族 |
| rsna-bone-age | RSNA Bone Age 2017 | 手部 X 光 | 回归 | 前序同族 |
| rsna-series | RSNA Series 2017 | 多部位影像 | 序列排序 | 方法学同族 |
9.2 同域条目:神经影像与 CT
| 库内条目 | 主题 | 与本条目的互补点 |
|---|---|---|
| munich-bmc(rid496) | 脑部 MR / CT 多模态 | 病理谱更广,可与 ICH 的六亚型互补 |
| aims-tbi(rid665) | 创伤性脑损伤 | 出血是 TBI 常见表现,可作下游任务对照 |
9.3 外部测试集对照条目
CQ500、CT-ICH、BHX 等被广泛用作 RSNA-IHD 的外部评测集(详见 §7.3、附录 M)。若未来库内收录对应条目,应在本条目"外部评测"段落建链。
9.4 互链建议(键匹配,非位置对齐)
互链以"条目 slug / rid"为键,不依赖章节位置:
rsna-pneumonia↔ 本条目:同为 RSNA Kaggle 竞赛,可加"同族前序"双向链接;munich-bmc、aims-tbi↔ 本条目:神经影像域内互链;- 外部集条目(若收录)↔ 本条目:以"被用作外部评测"关系互链。
§10 避坑清单:十个已踩过的坑
以下"坑 N:"编号为稳定锚点,跨版本保持。坑 1-8 为原稿已记录,坑 9-10 为本次扩稿新增。
坑 1:把 DICOM 的"图像"当成 PNG 直接用。
DICOM 存的是原始像素 + 窗宽窗位等元数据。直接读像素会得到 12/16 位灰度,必须先按 WW/WL 转成可显示的 HU 范围,否则模型学到的强度分布与临床不一致。
坑 2:忽略 any 与亚型的加权差异。
评测指标中 any 的权重高于各亚型。只优化亚型而忽略 any,榜单分数会低于预期;反之亦然。训练时应显式考虑权重。
坑 3:把切片级标签当作病例级标签。
数据集是"切片级"标注——同一检查里只有部分切片为阳性。若在病例级聚合时用错口径(如任一阳性即全片阳性),会系统性抬高负类误报。
坑 4:忘记概率夹逼。
计算 log loss 前必须把预测概率夹到 [1e-15, 1-1e-15]。若不夹逼,ln(0) 会得到 inf,训练发散。
坑 5:忽略类别不平衡直接看准确率。
绝大多数切片为阴性。一个"全预测阴性"的模型准确率可能很高,但毫无临床价值。必须用加权 log loss 或 AUC 等对不平衡鲁棒的指标。
坑 6:把训练集噪声当作真值去拟合。
训练集为单人标注,存在少标/多标/亚型误分类。把噪声当真值会限制模型上限;可行做法是用验证集(三读例)选择模型与阈值。
坑 7:跨检查划分泄漏。
划分必须在"患者/检查"层级做 disjoint(不相交),否则同一检查的相邻切片会同时出现在训练与测试,导致虚高分数。
坑 8:把研究模型当医疗器械使用。
本数据集及其派生模型定位为研究原型,未经过医疗器械审批,不得直接用于临床诊断。
坑 9:混淆"发放通道"与"许可条款"。
同一份数据通过 Kaggle、MIRA、Atlas 三个通道发放,但三者的使用协议(DUA)约束不同(见 §6.1、§6B.3)。引用时若只写"Kaggle 数据集"可能遗漏 MIRA 通道的额外合规要求;反之亦然。
坑 10:忽略"慢性硬膜下血肿"不在阳性类中。
六个标签不含"慢性硬膜下血肿(Chronic SDH)"。慢性出血因血红蛋白降解,CT 上可为等密度或低密度,与急性高密度特征相反。若把慢性 SDH 也当作阳性类去标注/评测,会与官方口径不符(参见 §1B.7、BHX 的类定义差异)。
§11 总结
11.1 五句话总结
- RSNA 颅内出血数据集是 2019 年 RSNA 与 Kaggle 联合竞赛发布的头颅平扫 CT 切片级多标签分类数据集,覆盖约 87.4 万张切片、约 2.5 万例检查。
- 标签为 六个(EDH/EPH、IPH、IVH、SAH、SDH 五个亚型 +
any),标注由 60 名放射科医生 在 MD.ai 上以"默认正常"工作流完成。 - 评测指标为 加权多标签对数损失,
any权重高于亚型,概率需夹逼到[1e-15, 1-1e-15]。 - 主要局限:无坐标、单专家训练标注、无患者画像、类别不平衡、机构采样偏倚——使用时必须显式声明。
- 它已成为颅内出血检测的 默认基准,并被 CQ500、CT-ICH、BHX 等外部集持续用于迁移评测。
11.2 适合谁
- 做 医学影像分类 / 多标签学习 / 弱监督 的研究者;
- 需要 头颅 CT 出血检测基线 的算法团队;
- 教学场景中演示 DICOM 处理 → 标注 → 评测 全链条的课程。
11.3 不适合谁
- 需要 像素级定位或分割 的任务(本数据集无坐标);
- 需要 患者级临床画像(无年龄/性别/病史等字段)的研究;
- 直接用于 临床诊断决策 的部署(研究原型定位)。
11.4 30 秒决策卡
| 你的需求 | 是否适用 | 建议 |
|---|---|---|
| 训练切片级出血分类器 | ✅ | 直接用,注意加权 log loss |
| 需要出血区域坐标 | ❌ | 换用 CQ500/BHX 等带定位数据 |
| 做多标签弱监督研究 | ✅ | any + 亚型的双层结构很合适 |
| 直接临床部署 | ❌ | 仅作研究原型,须另行验证 |
| 需要患者人口学信息 | ❌ | 本数据集不提供 |
事实清单(硬事实 48 条)
| # | 事实 | 来源 |
|---|---|---|
| 1 | 数据集为 RSNA 2019 第三届 AI 挑战赛竞赛数据集 | RSNA/Kaggle 竞赛页 |
| 2 | 官方名 RSNA Intracranial Hemorrhage Detection (RSNA-IHD) Dataset | MIRA/Atlas 数据卡 |
| 3 | 主办 RSNA,ASNR 组织标注,标注平台 MD.ai,Kaggle 承办竞赛 | 论文/Kaggle |
| 4 | 数据来自 4 家机构(Stanford/UNIFESP/Jefferson/St. Michael’s–Unity Health Toronto) | Kaggle 竞赛页/Atlas 卡片 |
| 5 | 论文正文表述 3 家(Stanford/UNIFESP/Jefferson) | 论文 |
| 6 | 原始提交候选 27,861 例 / 1,074,271 图 | 论文 M&M |
| 7 | 腾讯竞赛报道记原始池 25,998 病人 / 1,074,271 图 | 腾讯 AI Lab 报道 |
| 8 | 最终 25,312 例检查 | 论文 |
| 9 | 训练/验证 21,784 例 | 论文 |
| 10 | 测试 3,528 例 | 论文 |
| 11 | 总量 874,035 张切片 | 论文/Atlas |
| 12 | Kaggle 公开可训 752,803 张切片 | arXiv/Sensors |
| 13 | Kaggle 秘藏测试 121,232 张 | Sensors |
| 14 | 第三方引用总量 25,272 例 / 870,301 图 | Sensors |
| 15 | 平均约 35 张切片/检查 | Sensors/arXiv |
| 16 | 序列层厚 3–5 mm、每序列 20–60 张轴位图 | 论文 |
| 17 | 像素矩阵 512×512 | Kaggle DICOM 规格 |
| 18 | 标签为 5 亚型 + any 共 6 个 | Kaggle/论文 |
| 19 | 亚型:SAH/IVH/SDH/EDH/IPH | 论文/Kaggle |
| 20 | 图像级 any 阳性率约 14% | arXiv:2211.15924 |
| 21 | 检查级阳性率约 41% | arXiv:2211.15924 |
| 22 | 114 候选池选出 60 位标注者 | 论文 |
| 23 | 志愿者分层:>1000 例 10 人 / 501-1000 例 22 人 / 100-500 例 28 人 | Kaggle 致谢页 |
| 24 | 每人培训 24 例 | 论文 |
| 25 | 3,528 例三读,2/3 多数票 | 论文 |
| 26 | 525 例资深专家裁决 | 论文 |
| 27 | 训练集单专家标注 | 论文 |
| 28 | 无坐标/ROI 标注 | 论文 Limitations |
| 29 | 无患者病史/年龄/性别 | 论文 Assumptions/Atlas |
| 30 | 少标>多标>亚型误分类(官方噪声排序) | Atlas 卡片 |
| 31 | EDH/EPH 是 underrepresented 稀有类 | 论文 Figure 4/5 |
| 32 | 评测指标加权多标签 log loss(Weighted Mean Columnwise Log Loss) | Kaggle/论文 |
| 33 | 概率夹逼 [1e-15, 1-1e-15] | Kaggle 竞赛页 |
| 34 | 冠军 SeuTao 0.04383 | Kaggle LB |
| 35 | 总奖金 $25,000,冠军 $8,000 | Kaggle 竞赛页 |
| 36 | 参赛规模 1,345 队 / 7,900 报名者 / 723 有效参赛者 / 2,553 提交 | Kaggle 竞赛页 |
| 37 | 竞赛时间 Sep 18 – Nov 14 2019,两阶段 | Kaggle 竞赛页 |
| 38 | Stage 1 须上传模型并核验 | Kaggle 竞赛页 |
| 39 | Kaggle 文件 874,037 个 / 458.97 GB | Kaggle 数据页 |
| 40 | 数据为 DICOM 格式 | Kaggle 数据页 |
| 41 | Dataset DOI 10.1148/dataset.ihd.2024,Version 1.0,Date Created 2019-12-09 | MIRA/Atlas |
| 42 | 论文 doi 10.1148/ryai.2020190211,PMID 33937827,PMCID PMC8082297 | PubMed/PMC |
| 43 | 勘误 10.1148/ryai.2020209002,PMID 33939782,PMCID PMC8082367,仅补 Acknowledgments 名单 | RSNA 期刊/Europe PMC |
| 44 | 训练/验证/测试患者级互斥 | 论文/Atlas |
| 45 | 三站采样策略不同(50/50 预筛 / 全量 / NLP 富集) | 论文/Atlas |
| 46 | 划分机制:各机构每 500 例一段,段末 100 例入 test/val 候选 | Atlas 卡片 |
| 47 | 每机构获 IRB 与合规官批准;去标识化 + 站点签名再匿名化 | Atlas 卡片 |
| 48 | 外部集:CQ500(491 检查/193,317 片/41.8% 阳性/CC BY-NC-SA 4.0)、CT-ICH(75 例公开/像素分割)、BHX(39,668 框/23,409 图) | Qure.ai/PhysioNet/Radiology:AI |
术语表(38 条)
| 术语 | 中文 | 说明 |
|---|---|---|
| Intracranial hemorrhage (ICH) | 颅内出血 | 颅腔内出血,本数据集目标 |
| Subarachnoid hemorrhage (SAH) | 蛛网膜下腔出血 | 血液进入蛛网膜下腔 |
| Intraventricular hemorrhage (IVH) | 脑室内出血 | 血液进入脑室 |
| Subdural hemorrhage (SDH) | 硬膜下出血 | 硬膜下积血(extra-axial) |
| Epidural hemorrhage (EDH/EPH) | 硬膜外出血 | 颅骨与硬膜间积血(extra-axial) |
| Intraparenchymal hemorrhage (IPH) | 脑实质内出血 | 完全位于脑组织内 |
| Extra-axial | 轴外 | 积血位于脑外被膜层(EDH/SDH) |
| Intra-axial | 轴内 | 积血位于脑实质/脑室/脑池系统内(IPH/IVH/SAH) |
| any | 任一 | 5 亚型中任一存在即真 |
| Multi-label classification | 多标签分类 | 一张图可同时属多个类 |
| Multi-class | 多类 | 互斥单标签(本任务不适用) |
| Weighted log loss | 加权对数损失 | 官方评测指标,any 权重更高 |
| Sigmoid | S 型激活 | 逐标签独立概率输出 |
| DICOM | 医学数字成像与通信 | 医学影像标准格式 |
| StudyInstanceUID | 检查唯一标识 | DICOM 检查层 UID |
| SeriesInstanceUID | 序列唯一标识 | DICOM 序列层 UID |
| SOPInstanceUID | 切片唯一标识 | DICOM 单张图像 UID |
| Series | 序列 | 一次扫描的一组同质切片 |
| Study/Examination | 检查 | 一次完整影像检查 |
| Slice | 切片 | 序列中的单张轴位图 |
| Axial | 轴位 | 横断面成像平面 |
| Hyperdense | 高密度 | 急性出血在 CT 上呈高密度(白) |
| Hounsfield unit (HU) | 亨氏单位 | CT 密度单位,水=0、空气=−1000 |
| Windowing (WW/WL) | 窗宽窗位 | CT 显示范围的映射 |
| Brain window | 脑窗 | WL≈40/WW≈80-120,看脑实质 |
| Bone window | 骨窗 | WL≈700/WW≈3200,看颅骨 |
| Multi-institutional | 多机构 | 数据来自多家医院 |
| Crowdsourced annotation | 众包标注 | 大批志愿者参与标注 |
| Adjudication | 裁决 | 资深专家解决标注分歧 |
| Blinded reading | 盲注 | 阅读者互不知他人标注 |
| Patient-level split | 患者级划分 | 同一患者切片不跨集 |
| Class imbalance | 类别不平衡 | 阳性/稀有类样本稀少 |
| Under-labeling | 少标 | 漏标部分出血图(官方最常见错误) |
| Over-labeling | 多标 | 标到特征范围外 |
| Misclassification of subtype | 亚型误分类 | 把 A 亚型标成 B 亚型 |
| Weak supervision | 弱监督 | 用检查级粗标签训练 |
| Multiple instance learning (MIL) | 多实例学习 | 弱监督的建模框架 |
| Saliency map | 显著性图 | 模型关注区域可视化 |
| Migration/external test set | 迁移/外部测试集 | CQ500、CT-ICH 等独立集 |
| De-identification | 去标识化 | 移除可识别个体的信息 |
| DUA | 数据使用协议 | Data Use Agreement |
| IRB | 机构审查委员会 | 伦理审查机构 |
附录
附录 A:条目信息速查卡
| 字段 | 值 |
|---|---|
| slug | rsna-intracranial-hemorrhage |
| 库内 rid | 待主会话分配(查重时 DB 无命中) |
| 官方名 | RSNA Intracranial Hemorrhage Detection (RSNA-IHD) Dataset |
| Kaggle slug | rsna-intracranial-hemorrhage-detection |
| 论文 | Radiol Artif Intell 2020;2(3):e190211 |
| 勘误 | Radiol Artif Intell 2020;2(4):e209002 |
| 数据 DOI | 10.1148/dataset.ihd.2024 |
| 患者数 | ≈1.9 万(未确证,见双口径表) |
| 检查数 | 25,312(总量)/ 21,784(可训) |
| 切片数 | 874,035(总量)/ 752,803(可训) |
| 标签数 | 6(5 亚型 + any) |
| 参赛队伍 | 1,345 |
| license | Kaggle: Competition Rules / MIRA: Research Use Agreement |
| category_tags | 医学影像, CT, 脑影像, 图像分类, 挑战赛数据集, 评测基准 |
附录 B:DAIMS 评估全表
DAIMS(Data and AI Maturity/Readiness Scoring)——本条目按六维度评估:
| 维度 | 得分(0-5) | 依据 |
|---|---|---|
| Data Acquisition(数据获取) | 4 | Kaggle 直下 + MIRA 申请双通道;非商业限制,无 CC |
| Data Annotation(标注质量) | 3 | 60+ 专家标注但训练集单读;三读仅 3,528 例;无坐标 |
| Data Interoperability(互操作性) | 4 | 标准 DICOM + CSV,元数据完整(PatientID/UID 三级层级) |
| Data Metadata(元数据) | 3 | 影像元数据齐全;但缺患者临床画像(无年龄/性别/病史) |
| Data Scale(规模) | 5 | 874,035 张切片,同任务最大公开集 |
| Data Sustainability(可持续性) | 4 | RSNA MIRA 长期托管 + Kaggle;有官方 DOI 与论文 |
| 综合 AI-Ready 评级 | A-(3.8/5) | 规模与可获取性优异,标注粒度与坐标缺失是主要短板 |
配套的 DAIMS 六维证据链:
| DAIMS 维度 | 对应正文章节 | 关键证据 |
|---|---|---|
| Data Acquisition | §6.1-6.5 | 三通道(Kaggle/MIRA/Atlas)+ 许可文本 |
| Data Annotation | §3.2-3.5、§5.2 | 114 筛 60、MD.ai、默认正常、三读+裁决 |
| Data Interoperability | §2.2-2.3 | DICOM 三层 UID + CSV 多标签 |
| Data Metadata | §5.3、§1B.5 | 影像元数据全、患者画像缺失 |
| Data Scale | §2.1 | 874,035 切片 / 25,312 检查多口径 |
| Data Sustainability | §6.4-6.5 | v1.0 版本链 + DOI + 论文 + 勘误 |
附录 C:逐项证据链自证
附录 D:数据获取决策树
需要颅内出血 CT 数据?
├─ 只要分类(有没有/哪种出血)
│ ├─ 要最大公开集 → RSNA-IHD(本条目)
│ │ ├─ 图省事 → Kaggle 直下(接受竞赛规则)
│ │ └─ 要研究协议 → MIRA 邮箱申请
│ └─ 要带分割/框
│ ├─ 像素级分割 → CT-ICH (PhysioNet, 75 例公开)
│ └─ bounding box → BHX (PhysioNet, 基于 CQ500)
├─ 要外部跨中心测试集 → CQ500 (Qure.ai, CC BY-NC-SA 4.0)
└─ 要患者级临床终点 → 不用本数据集(无临床画像)
附录 E:六标签中文-英文-缩写对照与提交后缀
| 中文 | 英文 | 缩写 | 提交后缀 |
|---|---|---|---|
| 硬膜外出血 | epidural hemorrhage | EDH / EPH | _epidural |
| 脑实质内出血 | intraparenchymal hemorrhage | IPH | _intraparenchymal |
| 脑室内出血 | intraventricular hemorrhage | IVH | _intraventricular |
| 蛛网膜下腔出血 | subarachnoid hemorrhage | SAH | _subarachnoid |
| 硬膜下出血 | subdural hemorrhage | SDH | _subdural |
| 任一出血 | any hemorrhage | any | _any |
附录 F:机构采样与归一化(复现要点)
# 伪代码:三机构标签分布归一化思路(论文/Atlas 口径)
# UNIFESP(巴西): 1 年周期全量检查 → 接近自然患病率
# Stanford: 按放射报告正常/异常 50/50 预筛 → 异常比例抬高
# Jefferson: NLP 在报告中富集特定出血亚型 → 亚型倾向性
# 论文做法:按各机构标签分布归一化测试/验证集的检查分布
# 划分机制:每机构切 500 例/段,每段后 100 例入 test/val 候选
# 目标:三读例 15% → test,5% → val;train/val/test 患者级互斥
附录 G:加权多标签 log loss 计算骨架
import numpy as np
def weighted_log_loss(y_true, y_pred, weights, eps=1e-15):
"""
y_true, y_pred: shape (N, 6),列序=[epidural, intraparenchymal,
intraventricular, subarachnoid, subdural, any]
weights: 长度 6 的权重向量,any 权重高于亚型
"""
y_pred = np.clip(y_pred, eps, 1 - eps) # 官方夹逼
loss = -(y_true * np.log(y_pred) + (1 - y_true) * np.log(1 - y_pred))
return float(np.mean(loss @ weights))
附录 H:评测完备性建议(单指标不够)
报告清单建议:
- 官方 weighted log loss(与 LB 可比)
- 片级 & 检查级 AUC(每个亚型单独 + any)
- 敏感度/特异度 @ 选定阈值
- 稀有类 EDH/EPH 单独报告
- 跨中心:在 CQ500 / CT-ICH 上复测
- 阈值选择说明(阳性率 ~14% 时阈值敏感)
附录 I:DICOM 三层层级与窗窗对照
| 层级/概念 | 标识或参数 | 本数据集取值 |
|---|---|---|
| 检查 | StudyInstanceUID | ≈25,312 个 |
| 序列 | SeriesInstanceUID | 每 study 通常 1 个轴位序列 |
| 切片 | SOPInstanceUID | ≈874,035 个 |
| 层厚 | Slice Thickness | 3-5 mm |
| 像素矩阵 | Rows × Columns | 512 × 512 |
| 密度标度 | RescaleSlope/Intercept | 转 HU 必需 |
| 脑窗 | WL/WW | ≈40 / 80-120 |
| 骨窗 | WL/WW | ≈700 / 3200 |
附录 J:Top 10 榜单全转
| 名次 | 队伍 | 分数 |
|---|---|---|
| 1 | SeuTao | 0.04383 |
| 2 | NoBrainer | 0.04484 |
| 3 | takuoko | 0.04510 |
| 4 | GZ | 0.04529 |
| 5 | Keep Digging Gold | 0.04561 |
| 6 | Analytical AI(declined) | 0.04586 |
| 7 | Guanshuo Xu(declined) | 0.04632 |
| 8 | BRAINSCAN.AI | 0.04638 |
| 9 | Big Head | 0.04680 |
| 10 | 賞金で焼肉 | 0.04712 |
(注:第 11 名 Appian 亦为 declined;declined 指获奖但拒领奖金,新闻稿名单会顺延。)
附录 K:论文分数与名次对照
| 方法 | 分数 | 名次 |
|---|---|---|
| EfficientNet-B4 | 0.07212 | 278 |
| ResNeXt-101 单模型 | 0.06259 | 191 |
| ResNeXt-101 + BiLSTM 3×256 | 0.05540 | 64 |
| ResNeXt-101 + BiLSTM + 特征选择(120) | 0.04989 | 27 |
| 冠军 SeuTao | 0.04383 | 1 |
附录 L:与库内 RSNA-PNEUMONIA(rid712)的关系声明
本条目(rsna-intracranial-hemorrhage,2019 脑 CT 出血)与 rid712 rsna-pneumonia(2018 胸部 X 光肺炎)同主办(RSNA 挑战赛系列)、不同数据集:
- 模态:脑 CT 序列 vs 胸部 X 光单图;
- 任务:6 标签多标签分类 vs 二分类;
- 规模:874,035 切片 vs 约 2.6 万胸片;
- 标签:5 出血亚型 + any vs 肺炎阳性/阴性。
二者不可合并、不可互为别名。 互链关系为"同系列亲缘"。
附录 M:外部测试集规格表
| 数据集 | 机构 | 检查数 | 阳性率 | 切片数 | 标注类型 | 许可 |
|---|---|---|---|---|---|---|
| CQ500 | Qure.ai(印度新德里) | 491 | 41.8%(205/491) | 193,317 | 检查级(3 医生多数票) | CC BY-NC-SA 4.0 |
| CT-ICH | PhysioNet(伊拉克) | 82 收集 / 75 公开 | ~44%(36/82) | ~30/例 | 检查级 + 图级 + 像素分割 | PhysioNet 使用协议 |
| BHX | PhysioNet(基于 CQ500) | 491(继承) | — | 23,409 图有框 | bounding box(5+1 类) | 继承 CQ500 |
附录 N:许可条款细读
| 版本 | 许可文本 | 关键约束 |
|---|---|---|
| Kaggle | Subject to Competition Rules | 研究/非商业;接受竞赛规则;无 CC |
| MIRA | RSNA MIRA DATASET RESEARCH USE AGREEMENT | 非商业研究免费;邮箱+同意;邮件发链接 |
| Atlas | DOI 规范化引用 | 元信息浏览 + 引用义务 |
| 论文 | Free Access(Radiology: AI) | 论文可自由阅读;不等于数据许可 |
| CQ500(对照) | CC BY-NC-SA 4.0 | 署名-非商业-相同方式共享 |
| 社区镜像 | 各自声明 | 非官方,格式/许可可能不同 |
附录 O:MIRA 申请步骤
1. 访问 https://imaging.rsna.org/dataset/1 (或 mira.rsna.org/dataset/1)
2. 填写邮箱地址 + 勾选接受使用条款
3. 收到 no-reply@imaging.rsna.org 下载链接邮件
4. 用链接下载数据
5. 问题联系 informatics@rsna.org
附录 P:双层标签的弱监督用法
检查级(弱):normal / abnormal-not-hemorrhage / 某亚型出血(从报告 NLP 抽取)
图级(强):逐图 5 亚型标签
用法:
- 强监督:直接用图级标签训练
- 弱监督:把检查级标签作为 bag 标签,MIL 聚合图级预测
- 结论(arXiv:2211.15924):强监督与弱监督在检测性能上可比,
但弱监督所需的标签量少约 35 倍(每检查约 35 图)
附录 Q:坑点档案(与 §10 对照)
| 坑 | 一句话 | 附录 |
|---|---|---|
| 1 | rsna-pneumonia 非本条目 | L |
| 2 | CQ500/CT-ICH/BHX 非别名 | M |
| 3 | 874,035 vs 752,803 口径 | I/双口径表 |
| 4 | 检查数多口径 | 双口径表 |
| 5 | 无定位标注 | M/D |
| 6 | 训练集单读 | 事实清单 25-27 |
| 7 | 获奖名单双口径(含 declined) | J |
| 8 | 3 家 vs 4 家机构 | 双口径表 |
| 9 | 无 CC 协议(≠CQ500 的 CC) | N |
| 10 | 平凡模型骗分 / 社区镜像非官方 | H/附录 D |
附录 R:检索决策树
搜 "RSNA hemorrhage" / "brain CT bleed"?
├─ 想要原始数据 → Kaggle 竞赛页 / MIRA
├─ 想要预处理版 → Kaggle Datasets / HF(注意非官方、重采样伪影)
├─ 想要出血分割 → 转 CT-ICH / BHX
├─ 想要论文方法 → Radiol Artif Intell 2020;2(3):e190211(+ 勘误 2(4):e209002)
└─ 想要弱监督实验 → arXiv:2211.15924 + 本数据集双层标签
附录 S:双口径登记表(汇总)
| 项目 | 口径 A | 口径 B | 口径 C | 采信 |
|---|---|---|---|---|
| 切片数 | 874,035(论文/Atlas) | 752,803(可训) | 870,301(Sensors) | 分列引用 |
| 检查数 | 25,312(论文) | 21,784(可训) | 25,272(Sensors) | 分列引用 |
| 原始池 | 27,861(论文) | 25,998 病人(腾讯) | 1,074,271 图(二者一致) | 分列引用 |
| 患者数 | 18,938 | 19,517 | 未确证 | 标"约 1.9 万,未确证" |
| 机构数 | 3(论文正文) | 4(Kaggle/Atlas) | — | 分列,注明口径 |
| 获奖名单 | Kaggle 榜(含 declined) | 新闻稿(剔 declined) | — | 分列引用 |
| 文件数 | 874,035 图(论文) | 874,037 文件(Kaggle) | — | 差 2,含 csv/索引 |
| 勘误性质 | 仅补 Acknowledgments | 无数值更正 | — | 已核实 |
附录 T:维护计划与触发点
触发复核条件:
1. MIRA 发布 Version 2.0 或更新协议
2. Kaggle 竞赛数据页下架/迁移
3. 官方发布患者数/勘误再次澄清
4. 出现官方带坐标的新版本
5. 外部评测集(CQ500/CT-ICH/BHX)库内入库
6. 官方页出现新的硬数字(如复查后的检查/切片口径)
附录 U:外部评测指标对照
| 数据集 | 指标 | 说明 |
|---|---|---|
| CQ500 | 检查级 AUC/敏感度 | 仅有检查级标签(3 医生多数票) |
| CT-ICH | 片级 + 检查级 + 分割 Dice/IoU | 有像素级分割 |
| BHX | 检测框 mAP@0.5 | 基于 CQ500 的框标注(5+1 类) |
| RSNA-IHD(本体) | 加权多标签 log loss | 官方指标,KB 可比 |
附录 V:家族互链表(键匹配)
| 条目 | rid | slug | 关系 |
|---|---|---|---|
| RSNA-PNEUMONIA | 712 | rsna-pneumonia | 同系列(2018) |
| RSNA-BONE-AGE | 426 | rsna-bone-age | 同系列(2017) |
| RSNA-SERIES | 20 | rsna-series | 同系列 |
| MUNICH-BMC | 496 | munich-bmc | 同域(脑影像) |
| AIMS-TBI | 665 | aims-tbi | 临床相关(TBI) |
| BRATS | 24 | brats | 脑影像方法学对照 |
| STROKE-SCALE-MIMIC-III | 596 | stroke-scale-mimic-iii | 卒中/出血临床语境 |
附录 W:新增核验来源一览(本轮续写)
附录 X:本轮续写说明(版本与变更留痕)
版本:续写扩稿 v2(agent-b2-rsnaich)
背景:前一轮同名双实例并发覆写事故后,在干净成稿基础上续写扩充。
本次新增/扩写内容:
- 新增 §1B 颅内出血临床背景与影像学基础(7 小节)
- 新增 §6B 数据治理与伦理(5 小节)
- 新增 §10B 复现指南(6 小节,含可运行骨架)
- 扩写 §2(DICOM 三层层级、512×512、窗宽窗位、划分机制)
- 扩写 §4(log loss 五步公式细解、两阶段规则、榜单口径)
- 扩写 §5(Atlas 官方噪声排序、随访序列、站点签名)
- 扩写 §7(CQ500/CT-ICH/BHX 三大外部集详解)
- 扩写 §8(序列上下文、可复现性治理)
- 事实清单 36→48 条;术语表 30→38 条;FAQ 30→36 问;坑点 10 则
- 新增附录 W(本轮来源)、附录 X(变更留痕)
行数:997 → 目标 1400-1700(本条目最终以 wc -l 为准)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- instance2022 — 共享标签:医学影像 / CT / 脑影像 / 挑战赛数据集 / 评测基准
- selma3d — 共享标签:医学影像 / 脑影像 / 图像分类 / 挑战赛数据集
- toothfairy2 — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
- curvas — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
- ulf-enc — 共享标签:医学影像 / 脑影像 / 挑战赛数据集 / 评测基准
- toothfairy3 — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
- stsr — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
- mitoem — 共享标签:医学影像 / 脑影像 / 挑战赛数据集 / 评测基准
- cxr-lt — 共享标签:医学影像 / 图像分类 / 挑战赛数据集 / 评测基准
- trials — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

