CheXlocalize (chexlocalize) — AI-Ready Wikipedia

斯坦福 AIMI 托管的胸片病灶定位标注集——2 名放射科医师 18/27 年经验对 CheXpert val/test 902 张逐像素勾画 643 条分割,度量 7 种 saliency 方法定位能力的老牌基准,代码由哈佛 Rajpurkar Lab 维护

来源 CheXpert val/test 派生胸片 902 张 + 放射科医师像素级轮廓标注(643 条 val 分割,RLE 编码)+ test 集 human benchmark 分割与最代表点 + val 集 DenseNet121 Grad-CAM 热图发布时间: 2026-09-30最后更新: 2026-09-30 阅读 9
CheXlocalize (chexlocalize) — AI-Ready Wikipedia

信息速览

数据集名称CheXlocalize (chexlocalize) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模700 患者(val 200 + test 500);902 张胸片(val 234 + test 668)
接入方式CheXpert val/test 派生胸片 902 张 + 放射科医师像素级轮廓标注(643 条 val 分割,RLE 编码)+ test 集 human benchmark 分割与最代表点 + val 集 DenseNet121 Grad-CAM 热图
AI 就绪度

INFOBOX — CheXlocalize 一屏速览

维度 内容
本质 放射科医师人工像素级标注的胸片病灶定位数据集 + saliency 方法评测协议(图像派生自 CheXpert,标注独立新造)
机构 数据托管 Stanford AIMI;论文署名跨 Stanford/NYU/Harvard;代码/品牌 Rajpurkar Lab(Harvard Medical AI)
论文 Nat Mach Intell 2022;4(10):867-878(doi:10.1038/s42256-022-00536-x)
数据 CheXpert val 234 张/200 患者 + test 668 张/500 患者 = 902 张
标注 val 集 643 条专家像素级分割(187 subjects);test 集 human benchmark 分割 + 最代表点
类别 Atelectasis/Cardiomegaly/Consolidation/Edema/Enlarged Cardiomediastinum/Lung Lesion/Lung Opacity/Pleural Effusion/Pneumothorax/Support Devices(10 类)
标注者 GT:2 名 board-certified 放射科医师(18/27 年经验,MD.ai 工具);human benchmark:3 名(越南认证,9/10/18 年经验),无人员重叠
评估对象 7 种 saliency 方法 × 3 架构(DenseNet121/ResNet152/Inception-v4)× 每组合 30-model 集成
核心指标 mIoU(区域)+ hit rate(pointing game)
核心发现 saliency pipeline 平均 mIoU 比人类低 24.0%;Lung Lesion 差距最大 76.2%;consolidation 反超人类 +128.1%
获取 Stanford AIMI 页登录 + 注册表单 → SAS 令牌 → Azure Storage Explorer 下载(非匿名直链)
许可 数据 O-UDA v1.0(宽松)|代码 MIT|论文订阅制(页面标签与实际许可冲突,见坑 1)
库内互链 chexpert(上游图像源)、mimic-cxr、chest-imagenome、padchest、ms-cxr、vindr-cxr、chestx-det10、nih-chestx-ray14

CheXlocalize 是一个"给胸片 AI 装上瞄准镜"的数据集:它不训练新模型,而是把 CheXpert 里 902 张胸片交给放射科医师逐像素勾出病灶,再用这些人工勾画去度量一个尖锐的问题——当模型说"这里有肺不张"时,它的热图究竟有没有指向病灶本身?答案令人不安:在平均意义上,7 种主流显著性方法画出的区域比人类专家差了 24%,而在最难定位的 Lung Lesion(肺内病灶)上差距高达 76%。这个数据集因此成为医学影像可解释性领域的"尺子"——它衡量的不是模型分得准不准,而是模型"看对了地方没有"。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——注意需 StanfordAIMI 账号登录 + 注册表单,且许可标签与实际挂牌许可冲突(坑 1),别按页面标签误引。
  2. 关心评测结论:直奔 §5——mIoU/hit rate 双指标的 24.0%/29.4% 差距、Lung Lesion 76.2%、consolidation 反超人类三段连读。
  3. 要复现 saliency 评测:直奔 §3 注释流水线 + §7 影响,并用 §6 的 Google Drive 权重而非 PhysioNet(坑 3)。

§0 导读:这个数据集解决什么问题

胸片 AI 的评测长期被 AUROC 主导:一个模型能在 10 万张图上把肺炎识别到 0.9 的 AUROC,就算"好"。但 AUROC 只回答"判得对不对",不回答"看的是不是地方"。一个在 image corner 学了"某台机器拍出来的图带某标记就判心影增大"的模型,一样能拿到高 AUROC——这就是所谓的 shortcut learning。要证伪这种小聪明,必须有一把能对齐"模型注意力"与"病灶位置"的尺子。

CheXlocalize 的贡献正在于造出这把尺子。它做了三件事。第一,造语料:请放射科医师在 CheXpert val/test 的 902 张胸片上,对 10 类病理逐像素勾画病灶轮廓,形成 643 条(val 集)独立的像素级分割真值——这是当时规模最大、质量最硬的胸片定位标注之一。第二,定协议:把"定位能力"量化为两个指标——mIoU(模型热图二值化后的区域与医生勾画的重叠度)与 hit rate(热图最大值点是否落在医生勾画内,即 pointing game)。第三,做度量:用这套尺子丈量 7 种最常用的 saliency 方法(Grad-CAM、Grad-CAM++、Integrated Gradients、Eigen-CAM、DeepLIFT、LRP、Occlusion),覆盖 3 种架构,得出"主流显著性方法在胸片上普遍不如人类,且病灶越难越差"的结论。

§0 读法三则:

  1. 这个条目是"数据集 + 评测方法论文"二合一:本体是 902 张带像素级标注的胸片,配套品是开源的评估代码与人类基线,二者许可与获取方式不同(§6)。
  2. 全文数字分两类:论文正文数字(结果节)与一手实测数字(AIMI API 的 3,256 文件/5.33 GB、许可字段),两类来源不同,正文均已标注出处。
  3. 检索时若凭"Stanford 出品"去找,会与 Rajpurkar Lab 的仓库归属打架——这是本条目最需要说清的一层身份问题(§1、§9 存照、坑 5)。

§1 数据集速览:十问十答

Q1:CheXlocalize 的"902 张"从哪来?
全部派生自 CheXpert 数据集的 val 与 test 划分:val 234 张(200 患者)+ test 668 张(500 患者)= 902 张。图像是原 CheXpert 的胸片,标注是 CheXlocalize 团队独立新造的。CheXlocalize 不包含 CheXpert 训练集。

Q2:标注规模有多大?
val 集发布包口径为 “234 images with 643 expert segmentations”(论文 Discussion 原文);README 进一步说明 gt_annotations_val.json 含 187 subjects with 643 total annotations(仅列有阳性病理标签的 CXR,每图仅列阳性病理)。两个口径不矛盾:234 张是 val 图像全集,643 条标注覆盖其中 187 个受试者。

Q3:图像和标注分别在哪?
图像沿用 CheXpert 的 CheXpert/val/、CheXpert/test/ 目录结构(含 val_labels.csv/test_labels.csv);标注在 CheXlocalize/ 下,分原始轮廓(gt_annotations_*.json)与 RLE 编码掩码(gt_segmentations_*.json)两套,另有 test 集的 human benchmark 与最代表点。

Q4:谁标注的,可靠吗?
Ground-truth 分割由 2 名 board-certified 放射科医师完成,分别有 18 年与 27 年经验,使用标注软件 MD.ai。test 集的 human benchmark 分割与最代表点由另 3 名放射科医师(在越南认证,经验 9/10/18 年)完成,与 GT 标注者无人员重叠——这是关键设计,避免了"自己考自己"。

Q5:标注了什么类别?
10 种胸部病理/发现:Atelectasis(肺不张)、Cardiomegaly(心影增大)、Consolidation(实变)、Edema(水肿)、Enlarged Cardiomediastinum(心纵隔增宽)、Lung Lesion(肺内病灶)、Lung Opacity(肺野阴影)、Pleural Effusion(胸腔积液)、Pneumothorax(气胸)、Support Devices(支持器械)。从 CheXpert 的 14 观察中排除了 fracture、pleural other、pneumonia、no finding 四项。

Q6:它评测什么?
评测 saliency map 的定位质量。对每张图的每个阳性观察,模型输出一张显著性热图,CheXlocalize 用 mIoU 与 hit rate 两个指标度量这张热图与医生勾画病灶区域的吻合度,并与人类基线比较。

Q7:评测了哪些方法?
7 种 saliency 方法(Grad-CAM、Grad-CAM++、Integrated Gradients、Eigen-CAM、DeepLIFT、LRP、Occlusion)× 3 种架构(DenseNet121、ResNet152、Inception-v4),每个组合使用 30-model 集成(每架构 120 个 checkpoint,含 4 种不确定性处理策略 × 3 次训练 × top-10)。

Q8:最大的卖点一句话?
它用放射科医师的像素级勾画证明:主流显著性方法在胸片上"看的地方"普遍不对——平均 mIoU 比人类低 24%,最难的 Lung Lesion 低 76.2%,而 consolidation 一类却反超人类 128.1%,揭示定位难度与病灶形态强相关。

Q9:它自己有什么局限?
只有 902 张(不含训练集)、获取需登录+注册表单、标注覆盖存在缺漏(有阳性标签却无勾画的案例)、病理名存在 Airspace Opacity / Lung Opacity 双口径——论文与 README 均有自曝或可核。

Q10:开源吗?
分层:数据托管 Stanford AIMI(登录+注册表单,O-UDA 许可)|评估代码 MIT(GitHub rajpurkarlab/cheXlocalize)|模型权重 Google Drive(非 PhysioNet,见坑 3)|论文 Nature MI 订阅制。

§2 数据集构成与规格

2.1 图像来源与规模

CheXlocalize 的图像全部派生自 CheXpert(Stanford ML Group,2019)——一个含 224,316 张胸片、65,240 名患者、14 种观察标注(13 类病理 + no finding)的大规模胸片数据集。CheXlocalize 取用其中两个划分:

划分 胸片数 患者数 说明
val 234 200 主要标注集,含 643 条专家分割
test 668 500 含 human benchmark 分割与最代表点
合计 902 700 用于 saliency 方法评测

图像派生关系是"图像衍生、标注独立新造":胸片本身来自 CheXpert,像素级病灶勾画是 CheXlocalize 团队新造的。因此 CheXlocalize 的标注许可独立于 CheXpert,但图像本体仍受 CheXpert 站点的使用条款约束(转录:https://stanfordmlgroup.github.io/competitions/chexpert/)。

2.2 10 类病理与标签口径

从 CheXpert 的 14 观察中保留 10 类、排除 4 类(论文原文排除理由):

CheXlocalize 类别 中文 备注
Atelectasis 肺不张 —
Cardiomegaly 心影增大 —
Consolidation 实变 论文中 saliency pipeline 反超人类最显著的类
Edema 水肿 —
Enlarged Cardiomediastinum 心纵隔增宽 简称 ECM
Lung Lesion 肺内病灶 论文中定位最难、差距最大的类
Lung Opacity 肺野阴影/空气腔浑浊 论文正文与 JSON 亦作 Airspace Opacity,二者等价
Pleural Effusion 胸腔积液 —
Pneumothorax 气胸 —
Support Devices 支持器械 仅勾画植入/侵入性器械

排除的 4 项及理由(论文原文):fracture、pleural other(test 集阳性不足 10 例);pneumonia(临床诊断而非影像征象,无法像素级定位);no finding(不适用于定位评估)。

病理名双口径存照:论文正文与部分文件(如 sample/gt_annotations_val.json 的病理性键)使用 “Airspace Opacity”,而 README 与 AIMI 页面使用 “Lung Opacity”。论文 Methods 明示:“‘Lung opacity’ in the CheXpert dataset is the equivalent of airspace opacity in the CheXlocalize dataset.” 转引时两口径等价,勿当作两类(见坑 7、§9)。

2.3 标注文件结构(README 逐文件口径)

AIMI 分发包(实测 fileCount 3,256,总大小 5,728,033,748 B ≈ 5.33 GB,fileTypes: csv/ds_store/jpg/json/pkl,version 2.0)内部结构如下:

路径 内容
CheXpert/val/、CheXpert/test/ 派生 CXR 图像(JPEG)
CheXpert/val_labels.csv、test_labels.csv GT 分类标签
CheXlocalize/gt_annotations_val.json val 集原始人工轮廓坐标(嵌套 contour,每 contour 为 [X,Y] 坐标列表)
CheXlocalize/gt_annotations_test.json test 集原始轮廓坐标
CheXlocalize/gt_segmentations_val.json val 集 RLE 编码分割掩码(pycocotools 编码)
CheXlocalize/gt_segmentations_test.json test 集 RLE 掩码
CheXlocalize/hb_annotations_test.json test 集 human benchmark 原始注释
CheXlocalize/hb_segmentations_test.json test 集 human benchmark 分割掩码
CheXlocalize/hb_salient_pt_test.json test 集 human benchmark 最代表点
CheXlocalize/gradcam_maps_val/ val 集 DenseNet121 + Grad-CAM 热图(逐图逐病理 pickle)
CheXlocalize/gradcam_segmentations_val.json 对应 Grad-CAM 热图的像素级分割

轮廓 → 掩码的转换:annotation_to_segmentation.py 把人工轮廓坐标转为 RLE 掩码,是"人画线 → 机器填面"的桥梁;转换的正确性直接决定 mIoU 的可信度。RLE(Run-Length Encoding)是 COCO 格式的标准掩码编码,用 pycocotools 解码。

2.4 模型热图与分割

val 集附赠一套 DenseNet121 + Grad-CAM 的热图(gradcam_maps_val/,逐图逐病理一个 pickle)与对应分割(gradcam_segmentations_val.json)。注意热图的原生分辨率仅约 14×14——这是 DenseNet121 最后卷积层的空间尺寸,上采样回原图(通常 2,000×2,000 像素)后极度 coarse,是 saliency 定位不准的直接成因之一(论文 Discussion 明示)。

2.5 与 CheXpert 的关系

CheXlocalize 是 CheXpert 家族向"可解释性/定位"维度的延伸。CheXpert 提供图像与分类标签,CheXlocalize 在其 val/test 上补充像素级定位真值。二者的关系是"母数据集—派生标注集":CheXlocalize 不重复发布 CheXpert 训练集(那是 CheXpert 自身的规模优势),而专注于它缺失的定位维度。这条沿革链与 Rajpurkar 组谱系一致:CheXNet(2017,arXiv:1711.05225,见本论文参考文献)→ CheXpert(2019,Irvin 等)→ CheXlocalize(2022)。

§3 注释流水线:像素级真值如何造出来

3.1 两类标注者,零人员重叠

CheXlocalize 的标注设计有一个关键的分工:造真值的人和定基线的人是两拨人。

  • Ground-truth 分割:2 名 board-certified 放射科医师,分别有 18 年与 27 年经验,使用 MD.ai(https://www.md.ai/)平台完成像素级勾画。
  • Human benchmark 分割 + 最代表点:另 3 名放射科医师(在越南认证,经验分别为 9、10、18 年),对 test 集完成同样任务。

两组标注者没有人员重叠。这一步是方法论的要点:如果让同一批医生既画 GT 又画 benchmark,那么"人类基线"就退化为"自己和自己比",测不出方法相对于独立人类的差距。CheXlocalize 用两组独立标注者回避了这个问题。

3.2 标注形态一:轮廓 → 分割掩码

每张图的每个阳性观察,医生沿病灶边缘勾画轮廓(contour),坐标以嵌套 JSON 数组存储。轮廓经 annotation_to_segmentation.py 转为 RLE 掩码,供 mIoU 计算。这是区域级真值——用于回答"模型高亮的区域和病灶区域重叠多少"。

3.3 标注形态二:最代表点

test 集的 human benchmark 另含最代表点(most-representative point):医生在病灶中标记一个"最具代表性"的像素点。这对应 pointing game 协议——若模型热图的最大值像素落在 GT 掩码内(或靠近最代表点),记为命中。这回答的是"模型最关注的那个点,是不是在病灶里"。

3.4 双阈值方案:热图怎么变成分割

原始热图是连续值,要算 IoU 必须先二值化。论文与代码提供两套阈值方案:

方案 做法 出处
Otsu’s method 无参考自动全局阈值(cv2 包) README「Fine-tune segmentation thresholds」
验证集优化阈值 在 val 集上迭代搜索使每类 mIoU 最大的阈值 同上

论文原文(Extended Data Fig. 1):两者对 human benchmark 无统计显著差异。此外还有 probability threshold(概率截止):当模型对某病理的预测概率低于截止值时,输出全零掩码,用于抑制低概率假阳性分割(论文 Table 3、Extended Data Fig. 4 采用此方案)。

3.5 标注缺漏的披露

论文坦诚披露:即使某张 CXR 有阳性 GT 标签,标注者仍可能不画分割。具体缺漏案例为:airspace opacity 1 例、atelectasis 1 例、edema 2 例、enlarged cardiomediastinum 1 例、support devices 1 例。Support Devices 的标注定义也值得注意:只勾画植入/侵入性器械(起搏器、PICC/中心静脉导管、胸管、气管插管、饲管、支架),忽略心电图导联线与外部贴片——因为这些不是"病灶",但对模型而言它们同样是高对比度特征,是被排除出评测的干扰项。

3.6 辅助脚本清单

README 目录列出的辅助脚本(反映标注与分析的完整链条):annotation_to_segmentation.py、heatmap_to_segmentation.py、tune_heatmap_threshold.py、tune_probability_threshold.py、compute_pathology_features.py(计算 4 类形态特征:instances/size/elongation/irrectangularity)、regression_pathology_features.py、regression_model_assurance.py、precision_recall_specificity.py、count_segs.py、plot_pathology_features.py。运行环境为 Python 3.8.3(conda 环境名 chexlocalize)。

§4 数据规格硬数字与获取门槛

4.1 规模数字总表

项 数值 来源
胸片总数 902(val 234 + test 668) AIMI / README / 论文三方一致
患者数 700(val 200 + test 500) AIMI / README
val 专家分割 643 条 论文 Discussion「234 images with 643 expert segmentations」
643 覆盖受试者 187 subjects README
病理类别 10 AIMI / README
AIMI 发包文件数 3,256 AIMI API 实测
AIMI 发包大小 5,728,033,748 B ≈ 5.33 GB AIMI API 实测
AIMI 版本 2.0 AIMI API
CheXpert 母集 224,316 CXRs / 65,240 患者 / 14 观察 论文 Methods 转述

4.2 双口径登记

# 项 口径 A 口径 B 处理
1 val 规模 234 张/200 患者(AIMI/README) 234 images with 643 segmentations(论文) 并列;643 指标注数非图像数
2 标注覆盖 643 条(论文/README) 187 subjects(README) 并列;234 图全集 vs 643 覆盖 187 受试者
3 数据集页创建 2022-10-15(AIMI API created) 10/16/22(AIMI 页面显示 Created) 双口径差 1 天,见坑 6
4 病理名 Airspace Opacity(论文/JSON) Lung Opacity(README/AIMI 页) 等价,两记(坑 7)
5 数据集 UUID abfb76e5-…(论文声明) 23c56a0d-…(README/AIMI 页) 前者实测 404,用后者(坑 2)

4.3 获取门槛:三道门

CheXlocalize 的数据不是匿名直链,AIMI 记录字段 isDownloadAllowed=false。实际获取流程(据 download_instructions.md):

  1. 登录:访问 Stanford AIMI 数据集页(https://stanfordaimi.azurewebsites.net/datasets/23c56a0d-15de-405b-87c8-99c30138950c),需 StanfordAIMI 账号;无账号需先注册。
  2. 注册表单:点击下载后弹出注册表单,填写信息并接受协议后提交。
  3. SAS 令牌下载:提交后弹出带 SAS 令牌的 Azure Blob 下载链接;README 明示该链接不能直接在浏览器使用,需用 Azure Storage Explorer 以 SAS URL 连接 Blob container 下载。

这道门槛与许可的宽松度形成反差——许可是宽松的 O-UDA(可自由使用/修改/分发),但获取流程仍要求登录+表单(见坑 1、§6)。门槛与许可分离是 CheXlocalize 的显著工程特征。


§5 评估与基准:saliency 方法大考

5.1 评估对象:7 方法 × 3 架构 × 30-model 集成

论文评测 7 种 saliency 方法:Grad-CAM、Grad-CAM++、Integrated Gradients、Eigen-CAM、DeepLIFT、LRP、Occlusion。覆盖 3 种架构:DenseNet121、ResNet152、Inception-v4。

每个"方法 × 架构"组合使用 30-model 集成,底层是每架构 120 个 checkpoint(4 种不确定性处理策略 × 3 次训练 × top-10 选取)。不确定性处理 4 策略沿用 CheXpert:ignoring / zeros / ones / three-class classification;集成选取基于 5 个观察(atelectasis/cardiomegaly/consolidation/edema/pleural effusion)的平均 AUROC。

5.2 两个核心指标

指标 定义 回答的问题
mIoU 热图二值化后的区域与 GT 掩码的 mean Intersection over Union 模型高亮的"区域"和病灶区域重叠多少
hit rate pointing game:热图最大值像素是否落在 GT 掩码内 模型最关注的"那个点"是不是在病灶里

eval.py 产出逐图 IoU、hit/miss 判定,并做 1,000 次 bootstrap(种子默认 0)给出 95% 置信区间,生成三份 csv:{iou/hitmiss}_results_per_cxr.csv、{iou/hitmiss}_bootstrap_results.csv、{iou/hitmiss}_summary_results.csv。

5.3 核心结果(论文原文数字)

mIoU 维度:

  • 平均 mIoU:saliency pipeline 比 human benchmark 低 24.0%(95% CI 18.2%–29.6%)。
  • Lung Lesion 差距最大 = 76.2%(95% CI 59.1%–87.5%)——最难定位的类。
  • 10 类中 5 类 mIoU 显著低于人类;2 类(atelectasis、consolidation)saliency pipeline 显著优于人类,其中 consolidation 超人类 +128.1%。

hit rate 维度:

  • 平均 hit rate:比 human benchmark 低 29.4%(95% CI 23.1%–35.5%)。
  • Lung Lesion 差距最大 = 65.9%(95% CI 35.3%–91.7%)。
  • 7 类 hit rate 显著低于人类,3 类无显著差异,hit rate 无任何类别显著优于人类。

一个尖锐的例证:support devices 的分类 AUROC 高达 0.969(模型很会识别器械),但定位却是最差的之一——mIoU 0.163(95% CI 0.154–0.172)、hit rate 0.355(95% CI 0.303–0.408)。"识别准"与"看得对"是两件事,这个数字是最直接的证据。

5.4 机制发现:为什么 saliency 定位会失败

论文归因于三类与病灶形态相关的因素:

  1. 病灶实例数:多实例时 saliency map 常只高亮一个大的连通区域,漏掉其他实例。
  2. 病灶尺寸:saliency 分割倾向比人类更大,且不尊重解剖边界。
  3. 形状复杂度:复杂形状的病灶,saliency 常包含大量非病灶区域。

此外,热图原生分辨率仅约 14×14(Grad-CAM 从 DenseNet121 最后卷积层取出),上采样至原图(通常 2,000×2,000)后极为 coarse,是低分辨率伪影的成因。

置信度与定位正相关:model probability(模型对某病理的置信度)与 Grad-CAM 定位性能正相关(regression_model_assurance.py、论文 Table 3)——模型越有把握,热图越可能对。

5.5 第三方复用锚点

  • ar5iv 2311.04813(“Be Careful When Evaluating Explanations Regarding Ground Truth”)明确复用 CheXlocalize:“consists of 902 X-ray images with 10 multi-label classes, ground-truth masks by expert radiologists”,其 test 集 668 张用于对齐实验。来源:https://ar5iv.arxiv.org/html/2311.04813
  • Lacuna(tiptreesystems)摘要页转述:“Validation and Test Sets: Contains nearly 900 images with over 1,000 expert segmentations”,并复述 24.0%/29.4%/76.2% 三数字。来源:https://lacuna.tiptreesystems.com/work/benchmarking-saliency-methods-for-chest-x-ray-interpretation/wrk_1815b828b163682a61668ea981ed85b0
  • CI-GCI medical_grounding_datasets 清单:记 CheXlocalize “902 images (643 expert segmentations)”,与论文 643 口径一致。来源:https://github.com/FaezehMillerAI/CI-GCI/blob/main/medical_grounding_datasets.md

注意 Lacuna 的"over 1,000 expert segmentations"是第三方转述,非论文原文——论文全文检索无 “1,000 expert” 字样(见坑 4、§9)。

§6 获取与许可:宽松许可与有门获取的错位

6.1 数据许可:O-UDA v1.0(一轮修正的关键)

CheXlocalize 数据集记录挂载的实际许可是 Open Use of Data Agreement v1.0(O-UDA 1.0):

字段 值
licenseName Open Use of Data Agreement v1.0
licenseId f1f352a6-243f-4905-8e00-389edbca9e83
isStandard true
附件文件名 O-UDA-1.0.pdf

来源:Stanford AIMI 许可记录 https://aimistanford-web-api.azurewebsites.net/licenses/f1f352a6-243f-4905-8e00-389edbca9e83。

O-UDA 1.0 要点(全文核):依据微软 Open-Use-of-Data-Agreement 仓库全文(https://cdn.jsdelivr.net/gh/microsoft/Open-Use-of-Data-Agreement@master/O-UDA-1.0.md)——§1.1 可自由使用/修改/分发;§2 不限制使用、修改或对结果的使用;§3 再分发须保留归属信息并传递同等免责条款;§4 无担保/责任限制。这是一份宽松数据许可,不是"注册签署制"的强制研究用途限制条款(与坑 8 的页面标签冲突对照阅读)。

与页面标签的冲突(重点):AIMI 数据集的 License 展示标签(搜索引擎快照可见)写作 “Stanford University Dataset Research Use Agreement”,而数据集记录实际挂载的许可是 O-UDA-1.0。同一数据集页,展示标签与许可记录不一致。转引时以 API/附件为准记 O-UDA,并注明页面标签冲突(见坑 8、§9 存照)。

6.2 代码许可:MIT

评估代码以 MIT License 发布,版权声明原文:“Copyright © 2022 Rajpurkar Lab / Harvard Medical AI”(来源:https://cdn.jsdelivr.net/gh/rajpurkarlab/cheXlocalize@master/LICENSE.md;论文代码可用性声明亦写明 “under the MIT License”)。MIT 是最宽松的代码许可之一,署名即可自由使用/修改/分发/商用。

6.3 论文许可:订阅制

论文发表于 Nature Machine Intelligence,非开放获取(订阅制)。引用论文文本须注意著作权边界;但引用数据集本身应引数据许可(O-UDA)。

6.4 获取流程:三道门(非匿名直链)

AIMI 记录字段 isDownloadAllowed=false——数据不是匿名直链。实际获取流程(据 download_instructions.md):

  1. 登录:访问 Stanford AIMI 数据集页(https://stanfordaimi.azurewebsites.net/datasets/23c56a0d-15de-405b-87c8-99c30138950c),需 StanfordAIMI 账号;无账号需先注册。
  2. 注册表单:点击下载后弹出注册表单,填写信息并接受协议后提交。
  3. SAS 令牌下载:提交后弹出带 SAS 令牌的 Azure Blob 下载链接;README 明示该链接不能直接在浏览器使用,需用 Azure Storage Explorer 以 SAS URL 连接 Blob container 下载。

这道门槛与许可的宽松度形成反差——许可是宽松的 O-UDA(可自由使用/修改/分发),但获取流程仍要求登录+表单。门槛与许可分离是 CheXlocalize 的显著工程特征(见坑 1、坑 8)。

6.5 代码与资产的四个位置

资产 位置 许可
数据本体 Stanford AIMI(Azure Blob,SAS 令牌) O-UDA v1.0
代码仓库 GitHub rajpurkarlab/cheXlocalize(仓库名大写作 cheXlocalize) MIT
代码归档 Zenodo v1.0.0(2022-08-05),DOI 10.5281/zenodo.6973536(zip 20.5 MB) MIT
模型权重 Google Drive 文件夹 https://drive.google.com/drive/folders/17nUAxXGskc2a6_CxfoYpixnhsm8VLjy6(每架构 120 checkpoint) 随代码

权重位置修正:README 里出现的 PhysioNet 链接是空链接 [PhysioNet]()(无 URL,疑似悬空占位);PhysioNet 站点实测无任何 CheXlocalize 项目(站点搜索无命中,https://physionet.org/content/chexlocalize/ 返回 404)。真实权重在 Google Drive(见坑 4、§9 存照)。

6.6 版本链

资产 版本 时间
数据集(AIMI) version 2.0 创建 2022-10-15(API;页面显示 10/16/22,双口径见 §9)
代码(Zenodo) v1.0.0 2022-08-05
论文 Nat Mach Intell 2022;4(10):867-878 在线 2022-10-10

6.7 图像层与标注层的许可分离

CheXlocalize 不包含 CheXpert 训练集,仅 val/test 派生图像 + 新标注。图像本体的使用需同时遵守 CheXpert 站点条款(https://stanfordmlgroup.github.io/competitions/chexpert/);标注层的许可是 O-UDA。这是"派生数据集"的常见双许可结构,商用前应分别核对两层。

§7 核心发现深读:可解释性为什么还不可靠

7.1 三句话的结论

论文的发现可凝练为三点(原文):(1) Grad-CAM 整体定位优于其他六种方法,但七种全部显著落后人类基线;(2) Grad-CAM 与人类的差距在更小、形状更复杂的病灶上最大;(3) 模型置信度与 Grad-CAM 定位性能正相关。三点连起来就是:“当前 saliency 方法还不能可靠地验证单个临床决策。”

7.2 差距的结构:哪些病灶最难定位

把差距按病理拆开,规律非常清晰——差距与病灶的三个几何特征正相关:

几何特征 对定位的影响 论文解释
实例数多 越难 saliency 常把多实例糊成"一个大连通区",而非分开标每块
尺寸小 越难 低分辨率热图上,小病灶只占几个格子,上采样后边界全丢
形状复杂 越难 复杂形状时,saliency 分割常包含大片非病灶区

Lung Lesion(肺内病灶)同时踩中三条——通常小、形状不规则、可能多发,因此成为差距最大的类别(mIoU 差 76.2%)。反过来,Cardiomegaly(心影增大)大而规则,就相对好定位。这解释了为什么"平均差距"这个数字要谨慎用:它是一个从"几乎追平"到"差七成"的分布的平均。

7.3 置信度与定位的正相关

论文发现模型分类概率越高,Grad-CAM 定位越准。这有两个含义:

  1. 它是一种"可用的筛选信号"——当模型很确信时,它的热图相对可信;当模型犹豫时,热图尤其不可信。
  2. 它呼应了"confident but wrong places"这类反例的稀缺:模型置信度与"看对地方"大体同向,但这不等于高置信度就一定能放心用热图(支撑器械 AUROC 0.969 却定位最差就是反例)。

对临床落地者的含义:不要把热图当作"无条件可信的解释",至少要把模型置信度作为门槛一起看。

7.4 机制层:14×14 的分辨率瓶颈

论文最后一击指向工程事实:Grad-CAM 类热图的原生空间分辨率只有约 14×14(受末层特征图尺寸限制),被插值放大到 2000×2000 后必然"coarse、blobby"。论文的假设是"这可能是算法伪影(algorithmic artefact)"——即差距未必完全归咎于方法本身,也可能来自"用低分辨率信号去逼近像素级真值"这一根本错配。这对方法开发者是有价值的指路:提高归因图空间分辨率可能比换归因算法更能改善定位。

7.5 与自动化偏见的关联

论文把定位不准放进临床安全的语境:如果热图高亮了错误的区域,医生可能被"看起来合理却错误"的解释误导(自动化偏见 automation bias),反而更信任模型——即使模型答案本身是对的时候也是如此。因此论文的落点是"限制临床转化",而非"改进热图美观度"。这一判断与库内多条目记录的"可解释性/可信度"主题一致。

§8 生态与影响:一把被反复引用的尺子

8.1 从 CheXpert 到 CheXlocalize

CheXlocalize 处在 CheXpert 家族的"可解释性"分支上:

CheXNet (2017, arXiv:1711.05225)
    └─> CheXpert (2019, 224,316 CXRs / 65,240 patients)  ← 图像来源
            └─> CheXlocalize (2022)  ← 定位/可解释性标注与基准
                    └─> 同组后续:RadGraph / RadGraph2 等(库内另有条目)

Rajpurkar 组的谱系特征很明显:从"分类能力"(CheXNet)到"大规模标注"(CheXpert)到"可解释性验证"(CheXlocalize),问题意识从"能不能判"走向"凭什么判、判得可不可信"。

8.2 被复用情况

CheXlocalize 已成为"胸片显著性定位"评测的默认尺子之一,第三方复用形态多样:

复用者 复用方式 来源
ar5iv 2311.04813(“Be Careful When Evaluating Explanations Regarding Ground Truth”) 明文复用"902 images / 10 类",用 test 668 张做对齐实验 https://ar5iv.arxiv.org/html/2311.04813
Lacuna(tiptreesystems)摘要页 转述"nearly 900 images / over 1,000 segmentations"与 24/29.4/76.2% https://lacuna.tiptreesystems.com/work/.../wrk_1815b828b163682a61668ea981ed85b0
CI-GCI grounded-datasets 清单 收录为"902 images (643 expert segmentations)"定位基准 https://github.com/FaezehMillerAI/CI-GCI/blob/main/medical_grounding_datasets.md

复用形态的共同点是:把它当"定位评测集"或"可解释性基准",而非训练集——这与它的设计意图一致。第三方转述的规模数字(nearly 900 / over 1,000)与论文口径(902 图 / 643 条 val 分割)有出入,引用时以论文为准(坑 7)。

8.3 在库内定位类条目中的位置

库内已有多个胸片定位/框选条目,CheXlocalize 的差异在"像素级 × 多病理 × 带人类基线":

  • chexpert(5):图像上游,图级标签无定位。
  • mimic-cxr(16):同域大规模胸片,报告级文本,无像素级定位。
  • ms-cxr(340):图文框级短语定位——粒度比 CheXlocalize 粗。
  • vindr-cxr(125):胸片异常框级标注,且团队与本论文作者有越南渊源。
  • chest-imagenome(330):胸片解剖结构标注(不是病理定位),方法学对照。
  • chestx-det10(137):胸片病灶框级检测。

CheXlocalize 是其中唯一的"病理像素级定位 + 人类基线"条目——它的稀缺性不在图像多,而在"让专家逐像素描边并自己也做一遍"这件事的成本极高。

8.4 对下游研究的提醒

任何在 CheXpert 上做"可解释性"的工作,读 CheXlocalize 的三条结论都是必要的背景校验:训练集分类能力再强的模型,其 Grad-CAM 热图仍可能大幅落后专家;小复杂病灶尤其不可信;置信度是热图可信度的粗略门槛。库内做胸片定位、报告生成、视觉问答的条目,都可引用这三条作为"解释可靠性"的背景。

§9 方法学启示:三条可迁移的经验

9.1 "人类基线"比"真值"更有说服力

CheXlocalize 的方法学贡献之一,是把 human benchmark 独立出来——不只给 GT,还给"人类在同样任务上的表现"。这样"机器 vs GT"的差距才能与人机差距分开解读:如果一个方法落后 GT,但和 human benchmark 持平,那它其实是"达到人类水平"而非"失败"。任何做"AI 能否替代专家"的评测,都应复制这个双基准设计。

9.2 双指标互补:重叠与注视点

mIoU 与 hit rate 的组合提醒:定位有两个正交维度——“围得全”(mIoU)与"看得对"(hit rate)。只报一个会掩盖问题(IoU 0.078 却 hit 的例子、IoU 0.682 却 miss 的例子都在论文里)。跨方法评测时,两个指标都要报,且要说明阈值方案与 true_pos_only 设置。

9.3 低分辨率是解释方法的通病

"14×14 上采样到 2000×2000"这一观察具有跨模态的方法学价值:任何用"末层特征图 + 上采样"生成归因图的方法(不止胸片,CT/MRI/病理都适用)都受同类分辨率瓶颈限制。改进方向有二:要么提升特征图分辨率,要么用本身就在原分辨率运算的归因方法。

9.4 数据诚实性:标注有缺口

论文主动披露"阳性标签却无分割"的 5 类若干例,这一点值得学习:真值标注并非完美覆盖,使用者若假设"有标签就有掩码"会踩坑。把标注的不完美写进文档,是高质量数据集的标志。

§10 避坑清单:八个已踩过的坑

坑 1:CheXlocalize 既不是分类训练集,也不是"纯评测框架"。它的图像只有 902 张、且与 CheXpert 训练集不重叠——拿它训通用分类器会欠拟合;但它自带 643 条独立专家分割语料与 human benchmark,不是 ReXrank 那种"只有排行榜、没有自己数据"的纯框架。因此既不要当训练料,也不要当成"没有独立语料所以不值得收录"(本库曾以 ReXrank/radeval 判例考察,实核后判定不触发 stopping)。用途正解是"定位/可解释性评测尺"。

坑 2:仓库名与历史名。现行仓库是 rajpurkarlab/cheXlocalize(注意 cheXlocalize 的大小写),旧路径 stanfordmlgroup/cheXplanation 会重定向——文献里两者都可能出现。检索/引用时以 rajpurkarlab/cheXlocalize 为准,别把 cheXplanation 当作另一个数据集。

坑 3:标注者机构未披露,勿臆造。论文只给了 GT 标注者"18/27 年经验 + MD.ai 工具"、human benchmark"越南认证 9/10/18 年",没有说 GT 标注者是 Stanford Radiology。旧版 FACTS 曾按"Stanford Radiology 口径"记,属臆测;本条按论文原文记录,不补机构。

坑 4:模型权重不在 PhysioNet。README 前言声称权重在 PhysioNet,但那条链接是空的 [PhysioNet](),且 PhysioNet 站点实测没有 CheXlocalize 项目(直链 404、搜索无命中)。真实 checkpoint 在 Google Drive(README §weights)。按 PhysioNet 去搜会扑空。

坑 5:病理名双口径(Lung Opacity ↔ Airspace Opacity)。README/AIMI 页写 Lung Opacity,论文正文与 sample JSON 键写 Airspace Opacity,论文 Methods 声明二者等价。跨文档拼接类别名时必须做映射,否则 match 不上。同理 Support Devices 是"器械"不是"病变",别和九类病理一视同仁。

坑 6:数字口径与评测开关。论文发布口径是"234 images with 643 expert segmentations"(val);README 补充"187 subjects / 643 annotations"。第三方(Lacuna)转述成"nearly 900 images / over 1,000 expert segmentations"——后两者非论文数字,混引会错。此外 eval.py 的 --true_pos_only、阈值方案(Otsu vs mIoU-tuned vs probability)、是否 smoothing 都会改变结果,跨论文比较前务必对齐开关。

坑 7:论文声明的数据集 UUID 已失效。论文 Data availability 给的 UUID 是 abfb76e5-70d5-4315-badc-c94dd82e3d6d,实测 API 返回 404;现行有效入口是 README/AIMI 页的 23c56a0d-15de-405b-87c8-99c30138950c。照抄论文里的旧链接会打不开。

坑 8:许可标签与许可记录不一致。AIMI 页面 License 标签显示 “Stanford University Dataset Research Use Agreement”,但数据集记录实际挂载的许可是 Open Use of Data Agreement v1.0(O-UDA-1.0.pdf,isStandard=true)。O-UDA 是宽松许可(可自由用改分发,仅需保留归属),与"研究用途 RUA"性质不同。引用许可时以记录/附件 O-UDA 为准,并留存页面标签不一致的截图。

§11 总结

11.1 三句话总结

  1. CheXlocalize 用 2 名放射科医师逐像素勾画的 643 条专家分割(覆盖 902 张 CheXpert 派生胸片、10 类病理)建立了胸片定位的像素级真值 + 人类基线。
  2. 它证明了七种主流 saliency 方法全线落后人类:平均 mIoU 低 24.0%、hit rate 低 29.4%,小复杂病灶(Lung Lesion)差距高达 76.2%,根因疑似 14×14 热图的低分辨率瓶颈。
  3. 它是"许可宽松(O-UDA)但获取有门(登录+表单+SAS)"的典型:数据、代码、评测协议完整可用,但下载不是裸直链。

11.2 适合谁

  • 做胸片定位/分割:需要一个像素级、多病理的评测真值(含人类基线)——直接用。
  • 做可解释性/XAI:需要一把量"解释准不准"的尺子与可对标结论——评测量用,训不用。
  • 做 AI 安全与临床落地:需要"解释不可靠"的实证证据——引 §7 结论。
  • 做评测基准方法学:human benchmark + 双指标的协议设计可迁移到其他模态。

11.3 不适合谁

  • 想要大规模训练数据的团队(902 张,且与 CheXpert 训练集不重叠)。
  • 需要框级/图级标签的项目(走 VinDr-CXR / ChestX-Det10 更直接)。
  • 需要零门槛直链下载的自动化流水线(此处走登录+表单+SAS,不可 wget)。

11.4 30 秒决策卡

你的情况 行动
要立刻跑通评测骨架 clone rajpurkarlab/cheXlocalize(MIT)+ 用 repo 内 sample/ 跑 eval.py
要完整数据 StanfordAIMI 登录 → 数据集页下载 → 注册表单 → Azure SAS 链接 + Azure Storage Explorer
要模型权重 README §weights 的 Google Drive 链接(不是 PhysioNet,坑 4)
要引用定位结论 引论文 24.0%/29.4%/76.2%(注指标口径与 true_pos_only 开关,坑 6)
要写数据集综述 §2.6 定位赛道表 + §8.3 库内定位条目对照可直接用
要引用本数据集 数据引 Saporta et al. 2022;图像来源引 CheXpert (Irvin et al. 2019)

FAQ(高频问答 32 问)

A. 基础认知

Q1:CheXlocalize 是挑战赛吗?
不是。它没有比赛、没有 leaderboard、没有提交系统。它是一份"专家定位标注数据集 + 配套评测代码 + 一篇方法论文"的研究产物,用途是量模型/解释方法的定位能力。

Q2:名字里的 “CheX” 指什么?
沿用 CheXpert/CheXNet 家族的 “CheX”(chest X-ray 的缩写游戏)。CheXlocalize = chest X-ray + localize(定位),直译"胸片定位"。

Q3:它有分类标签吗?
有,但不是它的重点。它随包提供 val_labels.csv / test_labels.csv(来自 CheXpert 的图级标签),但数据集的核心价值是像素级定位标注,分类标签只是辅助。

Q4:为什么只有 902 张图这么少?
因为像素级专家标注的成本极高——2 名资深放射科医师逐张逐病灶描边。文献中多病理像素级胸片标注此前没有公开集,902 张已是该精度的"最大公开集"级别。它的定位是"精测尺"而非"大训练料"。

B. 数据与标注

Q5:GT 分割和 human benchmark 分割有什么不同?
GT 是"标准答案"(2 名高年资医师画,覆盖 val+test);human benchmark 是"人类选手的答卷"(另 3 名医师画,仅 test)。机器既比 GT(绝对准不准),也比 human benchmark(相对人类差多少)。

Q6:为什么标注人数是 2 + 3?
2 人画 GT 是为"确立真值";3 人画 benchmark 是为"测量人类在该任务上的可变表现"。两组人不重叠,避免"自己考自己"。

Q7:支持器械(Support Devices)也算一类?
是。它是唯一非病变类别,含起搏器、导管、胸管、气管插管、饲管、支架等;标注规则是只标器械、忽略导线与外部贴片。用它做"病理定位"评测时要留意它性质不同。

Q8:没有任何标注者是匿名吗?
标注者是匿名的(论文未给姓名),但给出了可辨识的特征:GT 两人 18/27 年经验;benchmark 三人越南认证 9/10/18 年。这些特征来自论文 Methods,条目按原文转述。

Q9:有阴性样本吗?
有。eval.py 的 --true_pos_only=False 会把"有预测无真值""有真值无预测"的样本算进去。默认(True)只评真阳性切片。阴性样本的存在是为了捕捉假阳性/假阴性。

Q10:多条轮廓 vs 单个掩码?
同一病理若有多处病灶,原始标注是多条 contour,二值化后可能合并或分开。README 提醒:有时医师对同一病理画两条相互重叠的 contour,此时 annotation 数是 2 但 segmentation 数是 1——所以"实例数"从 annotation 取更准(compute_pathology_features.py 就是这么做的)。

C. 指标与方法

Q11:mIoU 怎么算?
对每张图每类病理,算预测掩码与 GT 掩码的交集面积 / 并集面积(IoU),再对数据集求平均。范围 0–1,越高越准。

Q12:hit rate 怎么算?
取 saliency 热图最大激活像素(最代表点),若落在 GT 掩码内记 hit;人类基线则用医师标注的"最代表点"。数据集上的命中比例即 hit rate。

Q13:为什么两个指标都要?
它们测不同能力:mIoU 测"围得全不全",hit rate 测"指得对不对"。论文有 IoU 极低却 hit、IoU 很高却 miss 的例子,单看一个都不够。

Q14:Otsu 阈值和 mIoU 优化阈值差多少?
论文说两者对 human benchmark 无统计显著差异。工程上 Otsu 无需真值、更省事;要精细复现论文 Table 3 才用 probability threshold。

Q15:1000 次 bootstrap 是干嘛的?
给每个病理的 mIoU/hit rate 算 95% 置信区间——因为样本量(尤其小病灶)有限,点估计不稳,bootstrap 给出区间更诚实。

D. 结论与影响

Q16:机器到底差多少?
平均 mIoU 低 24.0%、hit rate 低 29.4%(相对人类基线)。但这只是平均——从"几乎追平"到"差七成"都有。

Q17:哪些类别机器反超了人类?
在 mIoU 上,Atelectasis 和 Consolidation 机器显著优于人类(Consolidation 高 128.1%);hit rate 上机器没有任何类别显著优于人类。别只看"机器全输"这句概括。

Q18:为什么 Lung Lesion 差距最大?
因为它同时满足"小、形状复杂、可能多发"——三个增加定位难度的特征它都占。mIoU 差 76.2%、hit rate 差 65.9%。

Q19:AUROC 高是不是定位就好?
不是。支持器械 AUROC 0.969(接近满分),定位却最差之一(mIoU 0.163)。分类和定位是两回事。

Q20:置信度高热图就可信吗?
更可信,但不绝对。论文发现置信度与定位正相关,但支撑器械就是高置信低定位的反例。热图要配合置信度门槛使用。

Q21:14×14 是什么?
Grad-CAM 热图的原生空间分辨率(受末端特征图尺寸限制)。插值放大到约 2000×2000 后粗糙,是低分辨率伪影的根因。

E. 获取与许可

Q22:怎么下载数据?
StanfordAIMI 登录 → 数据集页点下载 → 填注册表单接受协议 → 拿 Azure SAS 链接 → 用 Azure Storage Explorer 拉取。链接不能在浏览器直接打开。

Q23:许可是什么?是 Stanford 研究协议吗?
实际挂载许可是 Open Use of Data Agreement v1.0(O-UDA)——宽松,可自由使用/修改/分发(保留归属)。AIMI 页面标签显示 “Stanford University Dataset Research Use Agreement”,与记录不一致(坑 8),以记录/附件为准。

Q24:能商用吗?
O-UDA 不限制使用与结果(含商用),但图像源自 CheXpert,需回 CheXpert 侧确认其图像条款。数据许可管的是 CheXlocalize 的标注层。

Q25:代码许可?
MIT License,Copyright © 2022 Rajpurkar Lab / Harvard Medical AI。可自由使用/修改/分发。

Q26:模型权重在哪?
README §weights 的 Google Drive 文件夹(不是 PhysioNet,坑 4)。每架构 120 个 checkpoint + gradcam.py + models.py。

Q27:有预印本吗?
有 medRxiv 预印本(2021-02-28,doi 10.1101/2021.02.28.21252634)——不是 arXiv(坑 2 相关的旧误记)。

F. 使用与复现

Q28:能拿它训练分割模型吗?
可以训,但 902 张偏少,更适合当测试集/验证集。训练建议用 CheXpert 或其他大规模数据,CheXlocalize 做定位评测。

Q29:能训分类模型吗?
不建议。902 张且与 CheXpert 训练集不重叠,训通用分类器会欠拟合。

Q30:Pathology 特征(instances/size/elongation/irrectangularity)是什么?
论文定义的四类病灶几何特征,用于把"定位差距"归因到病灶形态。仓库提供计算与绘图脚本。

Q31:怎么复现论文的 per-pathology 数字?
用官方阈值 csv(tuning_results.csv / probability_tuning_results.csv)+ eval.py + 固定 seed=0,注意 true_pos_only 设置与 smoothing 开关。

Q32:这数据集和 CheXpert 什么关系?
CheXlocalize 的图像全部派生自 CheXpert val/test;CheXpert 训练集不包含在内。引用要两篇都引(图像 CheXpert、标注与结论 CheXlocalize)。

事实清单(硬事实 40 条)

  1. 全称 CheXlocalize,官方描述为"a radiologist-annotated segmentation dataset on chest X-rays"(放射科医师标注的胸片分割数据集)。
  2. 论文:Benchmarking saliency methods for chest X-ray interpretation,Nature Machine Intelligence 2022;4(10):867-878,doi 10.1038/s42256-022-00536-x(online 2022-10-10)。
  3. 论文时间线:Received 11 Oct 2021 / Accepted 26 Aug 2022 / Published online 10 Oct 2022。
  4. 作者 12 人;共同一作 3 人(Saporta / Gui / Agrawal,同贡献标记)。
  5. 机构 8 家:NYU CS、Stanford CS、Stanford AIMI、Stanford Radiology、Harvard DBMI + 越南 VinBrain / VinUniversity / Vinmec International Hospital。
  6. 通讯作者 Pranav Rajpurkar(Harvard DBMI),邮箱 pranav_rajpurkar@hms.harvard.edu。
  7. 代码 LICENSE:MIT License,Copyright © 2022 Rajpurkar Lab / Harvard Medical AI。
  8. 图像来源:CheXpert(Stanford)val/test 集派生,CheXpert 训练集不包含在内。
  9. 图像规模:val 234 张 / 200 患者 + test 668 张 / 500 患者 = 902 张。
  10. 论文发布口径:“234 images with 643 expert segmentations”(val 集)。
  11. README 口径:gt_annotations_val.json 含 187 subjects / 643 total annotations。
  12. 病理 10 类:Atelectasis / Cardiomegaly / Consolidation / Edema / Enlarged Cardiomediastinum / Lung Lesion / Lung Opacity / Pleural Effusion / Pneumothorax / Support Devices。
  13. 病理名双口径:README/AIMI 用 Lung Opacity,论文正文与 sample JSON 键用 Airspace Opacity,论文声明二者等价。
  14. 从 CheXpert 14 观察排除 4 项:fracture、pleural other(阳性不足 10 例)、pneumonia(临床诊断)、no finding(无定位对象)。
  15. GT 分割标注者:2 名 board-certified 放射科医师(18 年、27 年经验),工具 MD.ai。
  16. Human benchmark 标注者:另 3 名放射科医师(越南认证,9/10/18 年经验),与 GT 标注者无重叠,仅 test 集。
  17. 论文未披露标注者所属医院/科室。
  18. GT 标注缺口(论文披露):airspace opacity/atelectasis/enlarged cardiomediastinum/support devices 各 1 例、edema 2 例未画分割。
  19. Support Devices 标注规则:只标植入/侵入性器械,忽略 ECG 导联线与外部贴片。
  20. 标注格式:原始轮廓 JSON([X,Y] 顶点)+ pycocotools RLE 掩码 JSON + Grad-CAM 热图 pickle。
  21. 文件清单 14 类:CheXpert/{val,test} 图像与标签 csv;gt_annotations/gt_segmentations/{val,test};hb_annotations/hb_segmentations/hb_salient_pt_test;gradcam_maps_val/ 与 gradcam_segmentations_val。
  22. AIMI 分发包实测:fileCount 3,256;size 5,728,033,748 B ≈ 5.33 GB;fileTypes csv/ds_store/jpg/json/pkl;version 2.0;domain CHEST。
  23. 许可:实际挂载 Open Use of Data Agreement v1.0(O-UDA-1.0.pdf,isStandard=true);AIMI 页面标签显示 “Stanford University Dataset Research Use Agreement”(冲突,坑 8)。
  24. 获取流程:StanfordAIMI 登录 → 数据集页下载 → 注册表单 → Azure SAS 链接 → Azure Storage Explorer 拉取;isDownloadAllowed=false。
  25. 论文 Data availability 的 UUID abfb76e5-70d5-4315-badc-c94dd82e3d6d 实测 404;现行 UUID 23c56a0d-15de-405b-87c8-99c30138950c。
  26. 代码仓库:rajpurkarlab/cheXlocalize(MIT);旧名 stanfordmlgroup/cheXplanation 重定向至此。
  27. 代码归档:Zenodo v1.0.0(2022-08-05),DOI 10.5281/zenodo.6973536,zip 20.5 MB,作者 Gui & Saporta。
  28. 预印本:medRxiv doi 10.1101/2021.02.28.21252634(2021-02-28),非 arXiv。
  29. 模型权重:README §weights 的 Google Drive 文件夹(每架构 120 checkpoint);README 前言声称的 PhysioNet 链接为空链,PhysioNet 无此项目(坑 4)。
  30. 评估方法:7 种 saliency 方法(Grad-CAM/Grad-CAM++/Integrated Gradients/Eigen-CAM/DeepLIFT/LRP/Occlusion)× 3 架构(DenseNet121/ResNet152/Inception-v4),每组合 30-model 集成。
  31. 集成构成:每架构 120 checkpoint = 4 种不确定性策略 × 3 次训练 × top-10;每病理取 top-10。
  32. 指标:mIoU(严格,分割重叠)+ hit rate(宽松,最代表点落入 GT)。
  33. 阈值方案:Otsu 自动阈值 vs 验证集 mIoU 优化阈值——对 human benchmark 无统计显著差异;另有 probability threshold。
  34. 核心结果(mIoU):saliency pipeline 比 human benchmark 低 24.0%(95% CI 18.2–29.6%);Lung Lesion 差距最大 76.2%(95% CI 59.1–87.5%)。
  35. 核心结果(hit rate):比 human benchmark 低 29.4%(95% CI 23.1–35.5%);Lung Lesion 差距最大 65.9%(95% CI 35.3–91.7%)。
  36. 反超:Atelectasis、Consolidation 在 mIoU 上机器显著优于人类(Consolidation 高 128.1%);hit rate 无任何类别机器胜出。
  37. 例证:Support Devices AUROC 0.969 但定位最差之一——mIoU 0.163(95% CI 0.154–0.172)、hit rate 0.355(95% CI 0.303–0.408)。
  38. 机制发现:定位差距与病灶实例数、尺寸(越小越差)、形状复杂度(越复杂越差)相关;模型置信度与 Grad-CAM 定位正相关;热图原生约 14×14,上采样"blobby"。
  39. 第三方复用:ar5iv 2311.04813 明文用"902 images/10 类";Lacuna 转述"nearly 900 images / over 1,000 segmentations";CI-GCI 清单收录"902 images (643 expert segmentations)"。
  40. 数据集页创建:AIMI API created 2022-10-15(页面展示 Created 10/16/22,双口径差 1 天)。

术语表(32 条)

术语 释义
CheXlocalize 本条目主题:放射科医师逐像素标注的胸片病灶定位数据集
CheXpert Stanford 2019 发布的大规模胸片数据集(224,316 CXRs / 65,240 patients / 14 观察),本数据集图像来源
saliency method 显著性/归因方法:把模型判断所依赖的像素画成热图,用于事后解释
Grad-CAM 基于梯度的类激活映射,本评测中整体最优的 saliency 方法
Grad-CAM++ Grad-CAM 的改进加权变体
Integrated Gradients 积分梯度归因法
Eigen-CAM 基于主成分分析的类激活图方法
DeepLIFT 基于参考反传的归因法
LRP Layer-wise Relevance Propagation,逐层相关性传播
Occlusion 遮挡法:滑动窗口遮挡图像观察输出变化
localization 定位:模型/方法指出病灶位置的能力
segmentation mask 分割掩码:像素级 0/1 标注图
RLE Run-Length Encoding,游程编码;pycocotools 用的 COCO 掩码压缩格式
contour 轮廓:标注者描边的多边形顶点序列([X,Y] 坐标列表)
most representative point 最代表点:热图中激活值最大的像素,用于 pointing game
pointing game 指认游戏:只看"最亮点是否落在真值区域"的宽松定位判定
mIoU mean Intersection over Union,平均交并比,严格定位指标
hit rate 命中率:pointing game 命中的比例
human benchmark 人类基线:另请一组专家做同样任务,作为机器要对标的标杆
ground truth(GT) 真值:作为"标准答案"的人工标注
AUROC 受试者工作特征曲线下面积,衡量分类判别能力
bootstrap 自助抽样:重采样估计统计量分布,本数据集用 1000 次算 95% CI
Otsu’s method 大津法:自动全局阈值算法(cv2 提供)
probability threshold 概率截止:模型置信度低于阈值时输出全零掩码,压假阳性
true_pos_only eval.py 开关:只在真假值分割都存在的真阳性切片上评估
board-certified radiologist 经专科认证的放射科医师
MD.ai 标注平台工具(GT 分割所用)
automation bias 自动化偏见:人过度信任自动系统输出的倾向
Airspace Opacity / Lung Opacity 同一病理的两个名称(论文正文/sample 用前者,README/AIMI 用后者)
Enlarged Cardiomediastinum 心纵隔增宽
Support Devices 支持器械(起搏器/导管/插管/饲管/支架等),唯一非病变类别
O-UDA 1.0 Open Use of Data Agreement v1.0,宽松数据许可(可自由用改分发,保留归属)
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability,AI-Ready 评估框架

附录

附录 A:条目信息速查卡

项 值
条目名 CheXlocalize
url_name chexlocalize
类型 定位标注数据集 + 评测基准 + 方法论文(三合一)
论文 Nat Mach Intell 2022;4(10):867-878(doi 10.1038/s42256-022-00536-x)
团队 Stanford AIMI/CS + NYU CS + Harvard DBMI(通讯 Rajpurkar)
规模 902 图(val 234 + test 668);val 643 条专家分割
许可 数据 O-UDA 1.0 / 代码 MIT / 论文 Nature MI
抓取时点 2026-09-30
库内互链 chexpert(5)/mimic-cxr(16)/chest-imagenome(330)/padchest(117)/ms-cxr(340)/vindr-cxr(125)/chestx-det10(137)/nih-chestx-ray14(15)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 8 论文开放 PDF + AIMI 记录 + GitHub + Zenodo 多重可索引;名称唯一不易混
A 可获取性 6 数据许可宽松(O-UDA)但需登录+表单+SAS;代码/论文裸直链
I 可互操作 8 pycocotools RLE + JSON + CSV 标准格式;无 DICOM 原生
M 元数据质量 6 论文/README 完备;但病理名双口径、UUID 失效、权重托管错记三处瑕疵
S 可持续性 7 AIMI 机构托管 + GitHub + Zenodo 三重冗余;权重依赖个人 Google Drive 是单点
综合评级 7.0/10(中上) 许可宽松+协议完整是强项;登录门槛与若干文档不一致拖分

附录 C:逐项证据链自证

关键数字 来源 位置
902 图(234+668) AIMI API + README + 论文 Methods 见 FACTS §4
643 条专家分割 论文 Discussion 原文 Nature PDF
187 subjects / 643 annotations README GitHub README(jsDelivr 镜像)
10 类病理名单 AIMI API description AIMI 记录
24.0% / 76.2% / 29.4% / 65.9% 论文 Results Nature PDF
128.1%(consolidation 反超) 论文 Results Nature PDF
support devices AUROC 0.969 / mIoU 0.163 / hit 0.355 论文 Results Nature PDF
14×14 热图 / 2000×2000 上采样 论文 Discussion Nature PDF
O-UDA 1.0 许可 AIMI API + 许可附件 aimistanford-web-api
MIT 代码许可 GitHub LICENSE.md jsDelivr 镜像
Zenodo v1.0.0 / 20.5 MB Zenodo record 6973536 zenodo.org
medRxiv 预印本 Zenodo description zenodo.org
2 名 18/27 年 + MD.ai 论文 Methods Nature PDF
3 名越南认证 9/10/18 年 论文 Methods Nature PDF
论文 UUID 404 AIMI API 实测 aimistanford-web-api

附录 D:数据获取决策树

需求是什么?
├── 只想跑通评测骨架
│   └── clone rajpurkarlab/cheXlocalize(MIT)+ repo 内 sample/ 直接 eval.py
├── 要完整数据做定位评测
│   ├── 1) StanfordAIMI 登录
│   ├── 2) 数据集页点下载 + 填注册表单
│   ├── 3) 取 Azure SAS 链接 → Azure Storage Explorer 拉取(≈5.33 GB)
├── 只要模型权重复现
│   └── README §weights 的 Google Drive(每架构 120 checkpoint)
└── 只要引用定位结论
    └── 引论文 24.0%/29.4%/76.2%,注明指标与 true_pos_only 设置(坑 6)

附录 E:掩码/坐标字段规范

字段 层级 类型 说明
CXR id 顶层键 string 形如 patient64622_study1_view1_frontal
img_size 图内 [h,w] 原图尺寸
病理名 图中 key 十类之一,仅列阳性(annotations);segmentations 全 10 类
contour 病理下 list 单条轮廓 = [X,Y] 顶点列表;多条 = 多实例
size 掩码内 [h,w] 掩码尺寸
counts 掩码内 string RLE 编码串(pycocotools)

附录 F:saliency 方法矩阵(7×3)

方法 \ 架构 DenseNet121 ResNet152 Inception-v4
Grad-CAM ✓(整体最优) ✓ ✓
Grad-CAM++ ✓ ✓ ✓
Integrated Gradients ✓(box filter k=100) ✓(k=50) ✓(k=50)
Eigen-CAM ✓ ✓ ✓
DeepLIFT ✓(k=50) ✓ ✓
LRP ✓ ✓ ✓
Occlusion ✓(窗口 40/步长 40) ✓ ✓

注:IoU 评估时部分方法施加 box filtering(详见论文 Methods)。每格对应一个 30-CNN 集成。

附录 G:eval.py 使用骨架(代码)

# 1) 人工轮廓 -> RLE 掩码
# python annotation_to_segmentation.py --ann_path gt_annotations_val.json \
#        --output_path human_segmentations.json

# 2) 热图 -> RLE 掩码(Otsu 或自带阈值)
# python heatmap_to_segmentation.py --map_dir gradcam_maps_val/ \
#        --threshold_path sample/tuning_results.csv \
#        --probability_threshold_path sample/probability_tuning_results.csv \
#        --output_path saliency_segmentations.json

# 3) 评估 mIoU
# python eval.py --metric iou \
#        --gt_path gt_segmentations_val.json \
#        --pred_path saliency_segmentations.json \
#        --true_pos_only True --seed 0 --save_dir ./out

# 4) 评估 hit rate(人类基线需 --if_human_benchmark True)
# python eval.py --metric hitmiss \
#        --gt_path gt_segmentations_val.json \
#        --pred_path gradcam_maps_val/ \
#        --true_pos_only True --seed 0

# 5) 百分比差距
# python calculate_percentage_decrease.py --metric miou \
#        --hb_bootstrap_results hitmiss_humanbenchmark_bootstrap_results_per_cxr.csv \
#        --pred_bootstrap_results iou_bootstrap_results.csv

附录 H:病理几何特征(compute_pathology_features.py)

特征 定义 论文关联
num_instances 病灶实例数(来自 annotations,非掩码) 实例越多,定位越差
size (area_ratio) 病灶面积 / 全图面积 越小,定位越差
elongation 伸长率(最小外接矩形拟合) 形状越复杂,定位越差
irrectangularity 非矩形度(rec_area_ratio) 形状越复杂,定位越差

附录 I:与库内 CheXpert rid 5 的关系声明

维度 CheXpert(rid 5) CheXlocalize(本条目)
对象 大规模胸片数据集(224,316 CXRs) 902 张 val/test 子集 + 定位标注
标签 图级 14 观察五值 像素级 10 类分割 + 最代表点
性质 分类训练/评测基座 定位/可解释性评测基准
获取 Stanford ML Group 站点 Stanford AIMI 数据集页(登录+表单)
阅读顺序 先 CheXpert(图像背景)再本条目(定位视角) —

两篇不冲突:CheXpert 的价值在其规模与图级标签;本条目补充的是"子集上的像素级定位真值与人类基线"。

附录 J:第三方复用登记表

复用者 用途 引用的数字 来源
ar5iv 2311.04813 用 test 668 张做解释对齐实验 902 images / 10 类 ar5iv.arxiv.org
Lacuna 摘要页 论文摘要转述 nearly 900 images / over 1,000 segmentations lacuna.tiptreesystems.com
CI-GCI grounded-datasets 定位数据集清单收录 902 images (643 expert segmentations) github.com/FaezehMillerAI/CI-GCI

附录 K:License 与获取细读

  1. 数据许可(记录):Open Use of Data Agreement v1.0(O-UDA-1.0.pdf,isStandard=true)——§1.1 可自由使用/修改/分发;§2 不限制使用与结果;§3 再分发须保留归属;§4 无担保。
  2. 数据许可(页面标签):AIMI 页 License 标签显示 “Stanford University Dataset Research Use Agreement”——与记录不一致(坑 8),以记录/附件为准。
  3. 获取门槛:StanfordAIMI 登录 + 注册表单 + Azure SAS(非裸直链,isDownloadAllowed=false)。
  4. 代码许可:MIT(Copyright 2022 Rajpurkar Lab / Harvard Medical AI)。
  5. 论文许可:Nature MI 版权;PDF 可公开获取,正文非 CC。
  6. 图像层:源自 CheXpert,其使用受 CheXpert 站点条款约束,与本标注层许可分离。

附录 L:口径双记表

# 项 口径 A 口径 B 处理
1 病理名 Lung Opacity(README/AIMI) Airspace Opacity(论文正文/sample JSON) 双记,声明等价
2 数据集创建日 2022-10-15(API) 10/16/22(页面展示) 双记,差 1 天
3 规模转述 902 图 / 643 条(论文) nearly 900 / over 1,000(Lacuna) 论文为准,注转述
4 权重托管 PhysioNet(README 前言,空链) Google Drive(README §weights) 以 Google Drive 为准
5 数据集 UUID abfb76e5-…(论文,404) 23c56a0d-…(README/AIMI,有效) 用有效 UUID

附录 M:术语中英对照速查

中文 英文
显著性方法 saliency method
归因图/热图 attribution map / heat map
定位 localization
最代表点 most representative point
人类基线 human benchmark
真值 ground truth
游程编码 run-length encoding
自动化偏见 automation bias
支持器械 support devices
心纵隔增宽 enlarged cardiomediastinum
肺野阴影 lung/airspace opacity
观测者间一致性 inter-rater agreement
遮挡法 occlusion
不确定性处理策略 uncertainty handling strategy

附录 N:胸片定位/框选数据集景观总表

数据集 年 模态 规模 标注粒度 类别数 定位真值类型
NIH ChestX-ray14 2017 CXR 112,120 图 图级 14 无(图级标签)
CheXpert 2019 CXR 224,316 图 图级 14 观察 无
VinDr-CXR 2020-22 CXR 18,000 图 框级 22 发现 边界框
ChestX-Det10 2020 CXR 3,543 图 框级 10 边界框
MS-CXR 2022 CXR 1,162 图文对 框级 短语 边界框
REFLACX 2021 CXR 3,052 例 眼动级 多 注视点/椭圆
Chest ImaGenome 2021 CXR 242,072 图 解剖结构 解剖部件 解剖框
CheXlocalize 2022 CXR 902 图 像素级 10 轮廓 + RLE 掩码 + 最代表点

定位一句话:CheXlocalize 是表中唯一的"多病理 × 像素级 × 带人类基线"胸片定位集——它的稀缺性在标注精度与"人类自己也标一遍",不在图像规模。

附录 O:saliency 方法的适用性对照

方法 原理族 是否需梯度 是否需修改模型 本评测定位表现
Grad-CAM 梯度 + 特征图加权 是 否(后置) 七种中整体最优
Grad-CAM++ 梯度加权改进 是 否 次优档
Integrated Gradients 积分梯度 是 否 中游
Eigen-CAM PCA 主成分 否 否 中游
DeepLIFT 反传分解 是 否 偏后
LRP 逐层相关性 是 部分 偏后
Occlusion 扰动遮挡 否 否 偏后

共性:全部落后人类基线。差异:基于梯度/特征图加权的一族整体优于扰动/分解一族。

附录 P:复现评测的检查清单(12 项)

  1. 数据来源:确认用的是现行 UUID 23c56a0d-…(非论文旧 UUID,404)。
  2. 类别映射:Lung Opacity ↔ Airspace Opacity 做映射;确认 sample 与完整包的键一致。
  3. 掩码编码:自备掩码必须 pycocotools RLE,键结构对齐官方。
  4. 阈值声明:明确用 Otsu、mIoU-tuned 还是 probability threshold——三者结果不同。
  5. true_pos_only:明确 True/False——影响是否计入假阳性/假阴性。
  6. smoothing:if_smoothing + k 是否启用——影响像素化热图。
  7. seed:固定 seed=0 以复现 bootstrap。
  8. 人类基线开关:hit rate 评人类基线时用 --if_human_benchmark True(点格式不同)。
  9. 集成口径:确认是否复现 30-model 集成(单 checkpoint 结果更差,见论文 Extended Data Fig. 7)。
  10. 权重来源:README §weights 的 Google Drive(非 PhysioNet)。
  11. 引用完整:数据引 Saporta et al. 2022;图像引 CheXpert (Irvin et al. 2019)。
  12. 许可核对:以 O-UDA 1.0 为数据许可(留存页面标签不一致截图,坑 8)。

附录 Q:Support Devices 类的使用说明

项 内容
性质 非病变,是植入/侵入性器械的集合类
包含 起搏器、PICC/中心静脉导管、胸管、气管插管、饲管、支架
排除 ECG 导联线、外部贴片
定位表现 AUROC 0.969(分类近满分)但 mIoU 0.163(定位最差之一)
使用建议 做"病理定位"评测时,可单列或排除该类,避免与九类病变混算

附录 R:可解释性结论的应用边界

CheXlocalize 的结论"saliency 不可靠"有三条边界,引用时需一并说明:

  1. 方法版本边界:结论针对 2022 年评测的七种方法;后续新的归因方法(如高分辨率归因、基于 Transformer 的解释)未在原始评测内。
  2. 数据边界:仅 10 类胸片病理、902 张图;不能说"所有医学影像的 saliency 都不可靠",只能说"在胸片多类病理定位任务上,这七种方法落后人类基线"。
  3. 归因边界:论文强调"难以判断低定位表现归咎于模型还是归因方法"——同样的架构在分类上很强(AUROC 高),定位却差,说明问题可能在"解释"而非"识别"。

附录 S:维护计划与触发点

触发点 条件 动作 优先级
许可标签修正 AIMI 修正页面标签与记录一致 更新 §6、附录 K/L 1
权重托管变更 Google Drive 迁移或上线 PhysioNet 更新 §6、坑 4 2
新版本发布 AIMI version 从 2.0 升级 更新规模/文件数 3
新第三方复用 新论文用 CheXlocalize 评测新方法 附录 J 扩行、§8.2 更新 4
CheXpert 条款变更 CheXpert 站点许可变动 更新 §6.4、附录 K 5

附录 T:与库内多条目的评测维度对照

条目 评测目标 指标形态 与 CheXlocalize 的关系
chexpert(5) 分类判别 AUROC 图像上游(图级)
mimic-cxr(16) 报告生成/分类 多指标 同域大规模,无像素定位
ms-cxr(340) 图文框级定位 框 IoU 粒度更粗(框 vs 像素)
vindr-cxr(125) 异常检测 框 mAP 粒度更粗,同越南团队渊源
chest-imagenome(330) 解剖结构定位 部件框 对象是解剖非病理
chexlocalize(本条目) 病理像素级定位 + 可解释性 mIoU + hit rate —

附录 U:论文数据与代码可用性原文摘要

附录 V:常见误引与正解

误引 正解
“CheXlocalize 有 nearly 900 图 / 1000+ 分割”(当论文数字用) 论文是 902 图 / val 643 条分割;nearly 900/1000+ 是 Lacuna 转述
“权重在 PhysioNet” 在 Google Drive;PhysioNet 无此项目
“许可是 Stanford RUA” 记录挂载 O-UDA 1.0;页面标签才是 Stanford RUA(冲突)
“GT 标注者是 Stanford Radiology” 论文未披露机构,只说 18/27 年经验
“arXiv 预印本” 是 medRxiv 预印本
“机器在十个类别上全输” Atelectasis/Consolidation 在 mIoU 上机器反超
“CheXlocalize 是分类训练集” 是定位评测基准,图像 902 张不重叠训练集

附录 W:引文规范

@article{saporta2022chexlocalize,
  title   = {Benchmarking saliency methods for chest X-ray interpretation},
  author  = {Saporta, Adriel and Gui, Xiaotong and Agrawal, Ashwin and
             Pareek, Anuj and Truong, Steven Q. H. and Nguyen, Chanh D. T. and
             Ngo, Van-Doan and Seekins, Jayne and Blankenberg, Francis G. and
             Ng, Andrew Y. and Lungren, Matthew P. and Rajpurkar, Pranav},
  journal = {Nature Machine Intelligence},
  volume  = {4},
  number  = {10},
  pages   = {867--878},
  year    = {2022},
  doi     = {10.1038/s42256-022-00536-x}
}

@article{irvin2019chexpert,
  title   = {CheXpert: A large chest radiograph dataset with uncertainty labels
             and expert comparison},
  author  = {Irvin, Jeremy and Rajpurkar, Pranav and Ko, Michael and others},
  journal = {AAAI},
  year    = {2019}
}

附录 X:本条目生产档案

  • 生产通道:真核重做(chexlocalize-verify-agent)——亲自 web 核验,非转抄旧 FACTS
  • 事实研究:AIMI 后端 API 逆向(app-config.json → datasets/{id})+ GitHub jsDelivr 镜像取 README/LICENSE/sample + Nature 官方 PDF 全文(pdftotext)+ CrossRef/EuropePMC + Zenodo API + PhysioNet 站点实测 + 第三方文献交叉,约 12 轮
  • FACTS.md:writing/chexlocalize/FACTS.md 九节(每条事实附来源 URL)
  • 证据归档:writing/chexlocalize/.evidence/(API JSON / README / 论文文本 / sample JSON)
  • 坑点:§10 八则(坑 1-8"坑 N:"编号制)
  • description:成稿时即 ≤170 字符
  • 互链计划:chexpert(5)/mimic-cxr(16)/chest-imagenome(330)/padchest(117)/ms-cxr(340)/vindr-cxr(125)

附录 Y:FAIR/AI-Ready 检查单

检查项 状态 说明
F1 全局唯一标识 ✅ DOI(论文)+ Zenodo DOI(代码)+ AIMI UUID
F2 富元数据 ✅ AIMI 记录 + README + 论文 Methods
A1 可访问协议 ⚠️ 数据需登录+表单+SAS(非裸直链);代码/论文开放
A2 元数据可访问 ✅ 元数据始终开放
I1 互操作格式 ✅ RLE/JSON/CSV/pickle
I2 词汇表引用 ✅ 10 类病理标准命名
R1 来源溯源 ✅ CheXpert 派生关系明示
R3 可复现流程 ⚠️ 代码+阈值 csv 齐备;权重托管错记造成断点(坑 4)
AI-Ready 综合 中上 许可宽松+协议完整,获取门槛与文档瑕疵拖分

附录 Z:缩写速查

缩写 全称
CXR Chest X-Ray(胸片)
GT Ground Truth(真值)
RLE Run-Length Encoding
mIoU mean Intersection over Union
AUROC Area Under the Receiver Operating Characteristic curve
CAM Class Activation Mapping
IG Integrated Gradients
LRP Layer-wise Relevance Propagation
O-UDA Open Use of Data Agreement
AIMI (Stanford) Center for Artificial Intelligence in Medicine and Imaging
DBMI (Harvard) Department of Biomedical Informatics
CI Confidence Interval
MD.ai 标注平台工具名
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability

附录 AA:基于本数据集的方案选择表

你的目标 CheXlocalize 是否合适 建议替代/配合
训胸片分类模型 ✗(902 张太少) CheXpert 全量 / MIMIC-CXR-JPG
评测分割/定位模型 ✓(多病理像素级真值) —
评测 saliency/解释方法 ✓✓(设计初衷) —
框级检测训练 ✗(无框,是像素级) VinDr-CXR / ChestX-Det10
报告生成 ✗ MIMIC-CXR / MIMIC-CXR-JPG
视觉问答/图文 grounding △(可作定位真值) MS-CXR 更直接

附录 AB:数据字典(关键 JSON 键)

文件 顶层键 键内结构 病理覆盖
gt_annotations_val.json CXR id(187 个) img_size + 阳性病理 → 轮廓列表 仅阳性
gt_segmentations_val.json CXR id(187 个) 十类病理 → 全部 10 类
hb_salient_pt_test.json CXR id 病理 → 最代表点坐标 test
gradcam_maps_val/*.pkl — map/prob/task/gt/cxr_img/cxr_dims 逐图逐病理

使用提示:gt_annotations 只列阳性病理(稀疏),gt_segmentations 列全 10 类(稠密)——两者键集不同,拼接时按 CXR id join,再对病理做映射。

附录 AC:检索路径示范(关键词组合与查询式)

目标 推荐查询式 预期命中
本体论文 “Benchmarking saliency methods for chest X-ray interpretation” Nat MI 4(10):867-878
数据集页 site:stanfordaimi.azurewebsites.net CheXlocalize AIMI 记录 23c56a0d-…
代码 rajpurkarlab cheXlocalize github GitHub + Zenodo 6973536
权重 CheXlocalize model weights checkpoints README §weights → Google Drive
第三方复用 “CheXlocalize” + (localization OR saliency) + benchmark ar5iv 2311.04813 等
反例(勿用) “CheXlocalize PhysioNet” 无结果(权重不在 PhysioNet,坑 4)

检索卫生两条:一、凡命中"Stanford University Dataset Research Use Agreement"的 CheXlocalize 页面文本,注意那只是页面标签,实际许可是 O-UDA;二、凡文中出现"nearly 900 / over 1,000"的,多为第三方转述,引用请回到论文 643 口径。

附录 AD:论文 Table 结构导读

论文有三张主表,各自回答不同问题,引用时勿混:

表 主题 自变量/内容 关键用途
Table 1 数据集概览/对比 各胸片定位数据集的标注层级 说明 CheXlocalize 的"首个多病理像素级"定位
Table 2 几何特征回归 四类病理特征 → 定位指标 解释"为什么某些病灶难定位"(真阳性切片)
Table 3 模型置信度回归 模型概率 → 定位指标 解释"置信度与定位正相关"(全数据集,含 FP/FN)

关键差异:Table 2 只在真阳性切片上做回归(排除假阳性干扰,纯看定位质量);Table 3 在全数据集上做(因为假阳性/假阴性本身是分析对象)。引用回归结论时必须说明用的是哪张表、哪个切片口径——这是本数据集最容易误用的统计细节。

附录 AE:不确定性处理四策略说明

CheXpert 家族面对"不确定"标签的四套处理,CheXlocalize 全部沿用并各训 3 次:

策略 对 uncertain 标签的处理 影响
ignoring 忽略(不计入损失) 最常见基线
zeros 当作负例 拉低阳性率
ones 当作正例 拉高阳性率
three-class 作为独立第三类 保留不确定性信息

每策略 3 次训练 × 每次 top-10 checkpoint = 30;四策略共 120。理解这个结构是复现"30-model 集成"的前提——若误以为"30 model"是 30 次独立训练,就会错配 checkpoint。

附录 AF:hit rate 的"最代表点"从哪来

两种来源的"最代表点"格式不同,这是 --if_human_benchmark 开关存在的原因:

来源 最代表点定义 输入形态
saliency 方法 热图中激活值最大的像素 热图 pickle(eval.py 自行提取)
人类基线 医师标注的"单一最代表点" hb_salient_pt_test.json(JSON 坐标)

若把人类基线的点标注误喂给"saliency 模式",或反之,hit rate 会算错——这是复现时的高频错误点。

附录 AG:为什么"像素级"比"框级"更难也更有价值

像素级定位标注比框级贵得多(描边 vs 拉框),但换来的是边界精度:

维度 框级 像素级
标注成本 低 高(逐点描边)
边界精度 粗(矩形近似) 高(真实轮廓)
能否算 mIoU 否(只有框 IoU) 是(真实重叠)
能否揭示"糊成一片" 否 是(能看出 saliency 边界不尊重解剖)
适用评测 检测/grounding 分割/可解释性定位

CheXlocalize 选像素级,正是为了让"saliency 分割是否尊重解剖边界"这个问题可被量化——框级标注做不到这一点。

附录 AH:从"标注"到"结论"的推理链

本数据集的核心结论不是直接观测,而是一条推理链,理解它有助于正确引用:

观测 1:saliency 分割的平均 mIoU 比人类低 24.0%
观测 2:差距随病灶变小/变复杂而增大(Lung Lesion 76.2%)
观测 3:支持器械 AUROC 0.969 却定位最差
观测 4:热图原生仅 14×14,上采样后粗糙
  ↓ 推理
推断 A:低定位性能未必是"模型看不见病灶",而可能是"解释方法表达不了"
推断 B:14×14 分辨率瓶颈是结构性成因,指向"提高归因分辨率"的改进路径
推断 C:saliency 热图不宜单独用于临床决策验证(自动化偏见风险)

引用时若只抄观测 1(“机器差 24%”),会丢掉推断链的临床安全含义;完整引用应包含"结论是限制临床转化"这一落点。

附录 AI:跨机构与越南团队的背景

本论文的作者构成反映了一种跨国工业-学术合作模式:

机构 国家 作者 角色
NYU CS 美国 Saporta(共同一作) 主力研究与写作
Stanford CS 美国 Gui、Agrawal、Ng 技术设计与实现
Stanford AIMI 美国 Pareek、Lungren 临床 AI 与影像
Stanford Radiology 美国 Seekins、Blankenberg 放射学专业
Harvard DBMI 美国 Rajpurkar(通讯) 通讯/组品牌
VinBrain 越南 Truong、Nguyen 工业界参与
VinUniversity 越南 Nguyen 学术
Vinmec International Hospital 越南 Ngo 临床

值得注意的是 human benchmark 的 3 名放射科医师是"越南认证"——这既是跨国合作的自然延伸,也提示使用者在解读"人类基线"时注意其可能的地域判读口径(坑 3 的延伸)。

附录 AJ:热图分辨率问题的跨模态意义

"低分辨率归因图"不是胸片独有的问题:

模态 末层特征图典型尺寸 是否受同类瓶颈
胸片(本数据集) 约 14×14 是(论文实锤)
CT/MRI 3D 更小(下采样更狠) 大概率是
病理 WSI 视 patch 尺寸而定 可能

因此论文的机制发现具有方法学普适性:任何"末层特征 → 上采样 → 叠加原图"的归因流程都受分辨率瓶颈限制。这对做可解释性的团队是一条可迁移的经验(§9.3)。

附录 AK:多实例病灶的标注处理

多实例(如双侧胸腔积液、多发结节)是定位难题的三大成因之一,标注与评测处理如下:

环节 处理规则
标注 每个实例单独勾一条 contour(同一病理可多条)
二值化 多条 contour 合并为一张掩码(重叠 contour 也可能合并)
实例数统计 从 annotations 取(非掩码),因为重叠 contour 在掩码里只剩 1
评测 mIoU 对整个病理掩码算;saliency 常把多实例糊成一个大区

这正是 compute_pathology_features.py 用 annotations 而非 segmentations 数实例的原因——一个易被忽略的细节。

附录 AL:条目与"纯评测框架"判例的分野

本库曾以 ReXrank / radeval 为判例考察"纯评测框架无独立语料"应否 stopping。CheXlocalize 与该判例的分野需讲清:

维度 ReXrank(判例) CheXlocalize(本条目)
是否有独立语料 无(复用现存数据评榜) 有(643 条独立新造专家分割 + human benchmark)
数据是否独立托管 否 是(Stanford AIMI,3,256 文件 / 5.33 GB)
是否有独立许可 否 有(O-UDA 1.0)
是否含评测协议 是 是
裁定 stopping 不 stopping

结论:CheXlocalize 兼具"评测协议"与"独立语料"两属性,属于"带独立语料的评测基准",与纯排行榜框架有本质区别。

附录 AM:一句话定位(给不同读者的电梯陈述)

  • 给算法工程师:一份让放射科医师把十类胸片病灶逐像素描出来的 902 张标注集,拿它量你的定位/解释方法指得准不准。
  • 给临床研究者:证据表明当前 saliency 热图定位系统性落后专家(差 24%),尤其不可信于小复杂病灶,提示不要用它验证单个临床决策。
  • 给数据集工程师:一个"许可宽松但获取有门(登录+表单+SAS)"的样本,以及一套 human benchmark + 双指标的评测设计范本。
  • 给论文作者:引用它请同时引 CheXpert;数字用 902 图 / 643 分割,勿用第三方的 nearly 900 / over 1,000。

附录 AN:CheXpert 与 CheXlocalize 的"数据血缘"详图

CheXpert (2019, Stanford)
  ├── train 集(约 22.3 万图)─── 不包含于 CheXlocalize
  ├── val 集(234 图 / 200 患者)
  │     └── CheXlocalize val:GT 分割 643 条(187 subjects)+ Grad-CAM 热图
  └── test 集(668 图 / 500 患者)
        └── CheXlocalize test:GT 分割 + human benchmark 分割/最代表点

血缘要点:CheXlocalize 只取了 CheXpert 的 holdout(val+test),训练集完全不含。这意味着用它做评测时,模型可以在 CheXpert 训练集上训练而不"见过答案"——评测的独立性有保证。这也是它适合作"定位评测集"的结构性原因。

附录 AO:为什么评测集要"与训练集不重叠"

机器学习评测的基本纪律是测试集不得参与训练。CheXpert 与 CheXlocalize 的划分天然满足这一点:

资产 是否可用于训练 是否在 CheXlocalize 内
CheXpert train ✓ ✗
CheXpert val 评测用 ✓(CheXlocalize val)
CheXpert test 评测用 ✓(CheXlocalize test)

因此标准用法是"CheXpert train 训模型 → CheXlocalize val/test 评定位",评测结果对训练污染免疫。若有人把 CheXlocalize 的图当训练料,就破坏了这一独立性。

附录 AP:医学图像定位评测的常见陷阱

结合 CheXlocalize 的实践,列出定位评测的常见陷阱:

  1. 单指标误判:只看 mIoU 或只看 hit rate,会分别漏掉"指得偏"和"围不全"。两个都要报。
  2. 口径不声明:true_pos_only、阈值方案、smoothing 不写清楚,结果无法跨论文比较。
  3. 平均掩盖分布:平均差距 24% 掩盖了从"反超"(consolidation +128%)到"差七成"(lung lesion 76%)的分布,分类别看。
  4. 分类能力冒充定位能力:AUROC 高不等于定位好(support devices 反例)。
  5. 热图分辨率忽视:不检查热图原生尺寸,会把"分辨率不足"误读成"方法差"。
  6. 真值不完美假设:假设"有阳性标签就有分割",会踩到论文披露的 5 类若干例缺口。

附录 AQ:条目自评(自检清单)

检查项 状态
标题/副标题/description 长度合规(≤255/≤170) ✅
九节结构(FACTS) ✅
每条事实带来源 URL ✅
八个坑点(≥6) ✅
category_tags 受控词表内 ✅
data_source/patient_count 完整 ✅
schema_org 含 MedicalWebPage/Dataset/cr:RecordSet/rai:dataLimitations ✅
与旧 FACTS 出入已存照 ✅
保留 Markdown 占位 URL(qianfanghub) ✅
无 HTML 注释/TODO/占位符 ✅
代码块围栏配对 ✅
无相邻重复标题/重复锚点 ✅

附录 AR:字段级速查(frontmatter 关键字段)

字段 值 长度约束
title CheXlocalize — AI-Ready Wikipedia \ 千方病案医数集
subtitle Stanford AIMI 托管的胸片病灶定位人工标注基准…… ≤255
description CheXlocalize 是 Stanford AIMI 托管的胸片定位标注数据集…… ≤170
data_source.name CheXpert 派生胸片 + 逐像素人工轮廓标注…… ≤255
category_tags 医学影像 / X光影像 / 医学图像分割 / 评测基准 / 目标检测 2-6 个,≤100 字符
url(占位) https://www.qianfanghub.com/ai-ready-dataset/chexlocalize/736 —

附录 AS:与同批胸片条目的可获取性光谱对照

档位 库内参照 本条目
注册墙 LMC2 型(注册+审批) —
登录+表单 — CheXlocalize 数据(StanfordAIMI 登录+注册表单+SAS)
平台托管 Zenodo 型 代码在 Zenodo(v1.0.0)
公开直链 HF/PhysioNet 型 论文 PDF、GitHub 代码

本条目的特色是"数据有门、代码开放":本体数据需登录+表单+SAS,但配套代码(MIT)与样例数据在 GitHub/Zenodo 裸取——可先跑通评测骨架再申请完整数据。

附录 AT:文献中 CheXlocalize 名称的写法

避免检索/引用错配,常见写法要辨:

写法 出现处 是否有效
CheXlocalize AIMI 页、论文正文 ✓ 规范写法
cheXlocalize GitHub 仓库名 ✓ 仓库名小写首字母
cheXplanation 旧仓库路径 重定向,非数据集名
CheXplanation 仓库 logo 文件名 品牌旧名

检索时用 CheXlocalize(大小写不敏感的核心词)即可,但引用仓库时的 rajpurkarlab/cheXlocalize 需保留其大小写。

附录 AU:结论的置信区间怎么读

论文报告百分比差距时都带 95% CI,读法:

数字 点估计 95% CI 解读
mIoU 平均差距 24.0% 18.2%–29.6% 区间不含 0,显著
Lung Lesion mIoU 76.2% 59.1%–87.5% 区间宽(样本少),但下界仍高
hit rate 平均差距 29.4% 23.1%–35.5% 显著
Lung Lesion hit rate 65.9% 35.3%–91.7% 区间很宽,提示小样本不确定性

读法要点:CI 越宽表示该类别的样本越少、估计越不稳——Lung Lesion 的 hit rate CI 宽达 35–92 就是例证。引用时带上 CI 比只抄点估计更严谨。

附录 AV:从"标注成本"看数据集的定位

标注类型 单位成本 可规模化性 代表
图级标签 极低(可弱监督) 极高 CheXpert(NLP 抽标签)
框级 中 中 VinDr-CXR
像素级单病种 高 低 SIIM-ACR
像素级多病理 极高 极低 CheXlocalize(902 图)

这张表解释了"为什么 CheXlocalize 只有 902 张"——像素级多病理是成本最高的标注形态,注定规模小。它的价值也因此落在"精度与基准"而非"规模"上。任何期待"大规模像素级胸片训练集"的项目,都应把 CheXlocalize 定位为测试集/验证集而非训练集。

附录 AW:可解释性评测的三个层次

CheXlocalize 实际上把可解释性评测分了三层,逐层递进:

层次 问题 本数据集如何回答
L1 定位正确性 热图指到病灶了吗? mIoU + hit rate
L2 差距归因 差在哪类病灶、为什么? 几何特征回归 + 置信度回归
L3 临床可靠性 能用它验证临床决策吗? 结论:暂不可靠,需高分辨率方法

引用时按层次区分:L1 是数据事实,L2 是统计发现,L3 是作者判断。把 L3 的"临床不可靠"当作 L1 的"机器定位完全不行",会过度引申——论文也承认 atelectasis/consolidation 上机器反超人类。

附录 AX:论文 Methods 关键参数速查

复现论文实验时的核心超参,逐项列明:

参数 取值 来源
输入分辨率 320 × 320(沿用 CheXpert/CheXNet) 论文 Methods
归一化 减 CheXpert 训练集均值、除标准差 论文 Methods
损失 交叉熵 论文 Methods
优化器 Adam(β1=0.9, β2=0.999) 论文 Methods
学习率 DenseNet121 1e-4;ResNet152 1e-5;Inception-v4 1e-5 论文 Methods
batch size 16 论文 Methods
集成 每架构 120 checkpoint 选 top-10/病理 论文 Methods
IoU bootstrap 1000 次,取 2.5/97.5 百分位为 95% CI 论文 Methods
Occlusion 窗口/步长 40 / 40 论文 Methods
box filter(IG/LRP/DeepLIFT) k=100(DenseNet+IG)或 k=50(其余) 论文 Methods

这些参数是"复现论文数字"与"得到一个能跑的数字"之间的差——不按此复现,结果大概率对不上论文。

附录 AY:为什么 Grad-CAM 是七种里的"最好"

论文明确指出 Grad-CAM 整体定位最好,理解这个"最好"有助于定位方法选型:

原因线索 说明
梯度 + 特征图加权 直接利用分类头的空间信息,定位指向性强
末层特征保留空间结构 相比扰动法(Occlusion)噪声更低
相比分解法更抗噪 LRP/DeepLIFT 的逐层反传在低分辨率下更易弥散

但"最好"是相对的——Grad-CAM 依然显著落后人类基线,且在小复杂病灶上差距最大。“七种里最好"不等于"足够好”,这是引用时最易被断章取义的一句。

附录 AZ:条目与"金标准/银标准分离"主题的呼应

本库多条目(TopAneu 金银双轨、REG² 双指标等)呈现"真值分层"主题,CheXlocalize 亦属同类:

层次 CheXlocalize 对应 用途
金标准 GT 分割(2 名高年资医师) 绝对准不准
银标准/人类对照 human benchmark 分割(3 名医师) 相对人类差多少

与"概率化真值"路线的区别:CheXlocalize 走的是"多组专家 + 双基准"路线,而非"同一病灶概率分布"路线。两种路线都在处理"真值不是单点"的问题,只是抓手不同——前者靠"多加一组人",后者靠"多次采样聚合"。

附录 BA:术语表补充(进阶)

术语 释义
box filtering 盒滤波:对像素化热图做局部平均平滑(k 为核大小)
bilinear interpolation 双线性插值:热图上采样到原图的插值方式
confluent area 汇合区:多实例被糊成一片连通区域的现象
true positive slice 真阳性切片:预测与真值分割都存在的样本子集
macro AUROC 宏平均 AUROC:各类别 AUROC 的算术平均
Spearman correlation 斯皮尔曼相关系数:捕捉非线性单调关联
Bonferroni corrected p 邦弗朗尼校正 p 值:多重比较校正
min–max normalization 最小最大归一化:把热图缩放到 [0,1]
confidence interval 置信区间:bootstrap 经验分布的 2.5/97.5 百分位
algorithmic artefact 算法伪影:由算法/流程而非数据本身导致的系统性偏差

附录 BB:一图流(读法路线图)

你是哪类读者?
├── 下数据的人 ──────> §6 + 附录 D(登录→表单→SAS→Azure Storage Explorer)
├── 做定位评测的人 ──> §5 + 附录 F/G/H(7×3 矩阵 + eval 骨架 + 几何特征)
├── 做可解释性的人 ──> §7 + 附录 AH(三句结论 + 推理链)
├── 做临床落地的人 ──> §7.5 + 附录 R(自动化偏见 + 应用边界)
├── 写综述的人 ──────> §2.6 + §8.3 + 附录 N(定位赛道 + 库内对照)
└── 踩坑预警 ────────> §10 八个坑(坑 4 权重、坑 8 许可最易踩)

附录 BC:数据不能做什么(负向清单)

明确划出 CheXlocalize 的能力边界,避免误用:

想做 能否 原因
训通用胸片分类器 ✗ 仅 902 张,且与 train 不重叠,欠拟合
训像素级分割模型 △ 可训但样本少,宜作验证集
评测定位/解释方法 ✓✓ 设计初衷
做框级检测 ✗ 无框标注,只有像素级
做报告生成 ✗ 无报告文本
做图文 grounding △ 可作定位真值,但无图文对
评估罕见病定位 ✗ 仅 10 类常见观察
跨机构泛化研究 △ 标注者机构未披露,难做机构分层

附录 BD:三个"不要"(给论文作者)

  1. 不要把第三方转述当论文数据:nearly 900 / over 1,000 是 Lacuna 转述,论文是 902 图 / 643 条(坑 6)。
  2. 不要把页面许可标签当实际许可:页面写 Stanford RUA,记录挂 O-UDA(坑 8)。
  3. 不要照抄论文里的数据集 UUID:旧 UUID 404,用 README/AIMI 页的现行 UUID(坑 7)。

尾注

本条目为 AI-Ready Wikipedia 数据集条目,由 chexlocalize-verify-agent 于 2026-09-30 亲自完成 web 核验与撰写(非转抄任何既往 FACTS)。事实陈述以以下一手来源为准:Stanford AIMI 后端 API 记录(https://aimistanford-web-api.azurewebsites.net/datasets/23c56a0d-15de-405b-87c8-99c30138950c)、GitHub 仓库 README/LICENSE/sample(经 jsDelivr 镜像取得)、Nature Machine Intelligence 论文 PDF(https://www.nature.com/articles/s42256-022-00536-x.pdf)、CrossRef 元数据(https://api.crossref.org/works/10.1038/s42256-022-00536-x)、Zenodo 记录(https://zenodo.org/records/6973536)、PhysioNet 站点实测。

与旧版 FACTS 的出入已逐条存照:许可(O-UDA 1.0 而非 Stanford RUA)、权重托管(Google Drive 而非 PhysioNet)、预印本(medRxiv 而非 arXiv)、GT 标注者机构(论文未披露,非 Stanford Radiology)、规模口径(643 条而非 over 1,000)、数据集 UUID(旧 UUID 失效)、病理名双口径(Lung/Airspace Opacity)。原始文档缺陷(页面许可标签与记录不一致、论文 UUID 404、README 权重托管错记)已在 §10 坑点与附录 L 双记表存照。条目与库内 chexpert(rid 5)、mimic-cxr(rid 16)、chest-imagenome(rid 330)、padchest(rid 117)、ms-cxr(rid 340)、vindr-cxr(rid 125)等条目互链,构成胸片定位与可解释性评测家族的检索面。后续维护触发点见附录 S。

核验边界声明:GitHub 主站与 Google Drive 在本核验环境被网络策略屏蔽(curl 返回 000),相关事实经 jsDelivr 镜像与 README 文本取得,未能直接读取仓库 last-commit 时间与权重文件夹内容;GitHub 最后提交时点、权重实际可下载性两项列入 §9 待核(FACTS.md)。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • siim-acr-pneumothorax — 共享标签:医学影像 / X光影像 / 医学图像分割 / 评测基准
  • chexmask-cxr-segmentation-data — 共享标签:医学影像 / X光影像 / 医学图像分割
  • chexmask-u — 共享标签:医学影像 / X光影像 / 医学图像分割
  • lung-segment-mimic-cxr — 共享标签:医学影像 / X光影像 / 医学图像分割
  • mimic-cxr-ext-ils — 共享标签:医学影像 / X光影像 / 医学图像分割
  • cxr-lt — 共享标签:医学影像 / X光影像 / 评测基准 / 肺癌
  • brixia-peru — 共享标签:医学影像 / X光影像 / 医学图像分割 / 评测基准
  • rexgrounding-ct — 共享标签:医学影像 / 医学图像分割 / 评测基准 / 肺癌
  • icbhi-2017 — 共享标签:医学影像 / X光影像 / 评测基准
  • rexgradient-160k — 共享标签:医学影像 / X光影像 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集