信息速览
INFOBOX — CheXlocalize 一屏速览
维度 内容 本质 放射科医师人工像素级标注的胸片病灶定位数据集 + saliency 方法评测协议(图像派生自 CheXpert,标注独立新造) 机构 数据托管 Stanford AIMI;论文署名跨 Stanford/NYU/Harvard;代码/品牌 Rajpurkar Lab(Harvard Medical AI) 论文 Nat Mach Intell 2022;4(10):867-878(doi:10.1038/s42256-022-00536-x) 数据 CheXpert val 234 张/200 患者 + test 668 张/500 患者 = 902 张 标注 val 集 643 条专家像素级分割(187 subjects);test 集 human benchmark 分割 + 最代表点 类别 Atelectasis/Cardiomegaly/Consolidation/Edema/Enlarged Cardiomediastinum/Lung Lesion/Lung Opacity/Pleural Effusion/Pneumothorax/Support Devices(10 类) 标注者 GT:2 名 board-certified 放射科医师(18/27 年经验,MD.ai 工具);human benchmark:3 名(越南认证,9/10/18 年经验),无人员重叠 评估对象 7 种 saliency 方法 × 3 架构(DenseNet121/ResNet152/Inception-v4)× 每组合 30-model 集成 核心指标 mIoU(区域)+ hit rate(pointing game) 核心发现 saliency pipeline 平均 mIoU 比人类低 24.0%;Lung Lesion 差距最大 76.2%;consolidation 反超人类 +128.1% 获取 Stanford AIMI 页登录 + 注册表单 → SAS 令牌 → Azure Storage Explorer 下载(非匿名直链) 许可 数据 O-UDA v1.0(宽松)|代码 MIT|论文订阅制(页面标签与实际许可冲突,见坑 1) 库内互链 chexpert(上游图像源)、mimic-cxr、chest-imagenome、padchest、ms-cxr、vindr-cxr、chestx-det10、nih-chestx-ray14
CheXlocalize 是一个"给胸片 AI 装上瞄准镜"的数据集:它不训练新模型,而是把 CheXpert 里 902 张胸片交给放射科医师逐像素勾出病灶,再用这些人工勾画去度量一个尖锐的问题——当模型说"这里有肺不张"时,它的热图究竟有没有指向病灶本身?答案令人不安:在平均意义上,7 种主流显著性方法画出的区域比人类专家差了 24%,而在最难定位的 Lung Lesion(肺内病灶)上差距高达 76%。这个数据集因此成为医学影像可解释性领域的"尺子"——它衡量的不是模型分得准不准,而是模型"看对了地方没有"。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——注意需 StanfordAIMI 账号登录 + 注册表单,且许可标签与实际挂牌许可冲突(坑 1),别按页面标签误引。
- 关心评测结论:直奔 §5——mIoU/hit rate 双指标的 24.0%/29.4% 差距、Lung Lesion 76.2%、consolidation 反超人类三段连读。
- 要复现 saliency 评测:直奔 §3 注释流水线 + §7 影响,并用 §6 的 Google Drive 权重而非 PhysioNet(坑 3)。
§0 导读:这个数据集解决什么问题
胸片 AI 的评测长期被 AUROC 主导:一个模型能在 10 万张图上把肺炎识别到 0.9 的 AUROC,就算"好"。但 AUROC 只回答"判得对不对",不回答"看的是不是地方"。一个在 image corner 学了"某台机器拍出来的图带某标记就判心影增大"的模型,一样能拿到高 AUROC——这就是所谓的 shortcut learning。要证伪这种小聪明,必须有一把能对齐"模型注意力"与"病灶位置"的尺子。
CheXlocalize 的贡献正在于造出这把尺子。它做了三件事。第一,造语料:请放射科医师在 CheXpert val/test 的 902 张胸片上,对 10 类病理逐像素勾画病灶轮廓,形成 643 条(val 集)独立的像素级分割真值——这是当时规模最大、质量最硬的胸片定位标注之一。第二,定协议:把"定位能力"量化为两个指标——mIoU(模型热图二值化后的区域与医生勾画的重叠度)与 hit rate(热图最大值点是否落在医生勾画内,即 pointing game)。第三,做度量:用这套尺子丈量 7 种最常用的 saliency 方法(Grad-CAM、Grad-CAM++、Integrated Gradients、Eigen-CAM、DeepLIFT、LRP、Occlusion),覆盖 3 种架构,得出"主流显著性方法在胸片上普遍不如人类,且病灶越难越差"的结论。
§0 读法三则:
- 这个条目是"数据集 + 评测方法论文"二合一:本体是 902 张带像素级标注的胸片,配套品是开源的评估代码与人类基线,二者许可与获取方式不同(§6)。
- 全文数字分两类:论文正文数字(结果节)与一手实测数字(AIMI API 的 3,256 文件/5.33 GB、许可字段),两类来源不同,正文均已标注出处。
- 检索时若凭"Stanford 出品"去找,会与 Rajpurkar Lab 的仓库归属打架——这是本条目最需要说清的一层身份问题(§1、§9 存照、坑 5)。
§1 数据集速览:十问十答
Q1:CheXlocalize 的"902 张"从哪来?
全部派生自 CheXpert 数据集的 val 与 test 划分:val 234 张(200 患者)+ test 668 张(500 患者)= 902 张。图像是原 CheXpert 的胸片,标注是 CheXlocalize 团队独立新造的。CheXlocalize 不包含 CheXpert 训练集。
Q2:标注规模有多大?
val 集发布包口径为 “234 images with 643 expert segmentations”(论文 Discussion 原文);README 进一步说明 gt_annotations_val.json 含 187 subjects with 643 total annotations(仅列有阳性病理标签的 CXR,每图仅列阳性病理)。两个口径不矛盾:234 张是 val 图像全集,643 条标注覆盖其中 187 个受试者。
Q3:图像和标注分别在哪?
图像沿用 CheXpert 的 CheXpert/val/、CheXpert/test/ 目录结构(含 val_labels.csv/test_labels.csv);标注在 CheXlocalize/ 下,分原始轮廓(gt_annotations_*.json)与 RLE 编码掩码(gt_segmentations_*.json)两套,另有 test 集的 human benchmark 与最代表点。
Q4:谁标注的,可靠吗?
Ground-truth 分割由 2 名 board-certified 放射科医师完成,分别有 18 年与 27 年经验,使用标注软件 MD.ai。test 集的 human benchmark 分割与最代表点由另 3 名放射科医师(在越南认证,经验 9/10/18 年)完成,与 GT 标注者无人员重叠——这是关键设计,避免了"自己考自己"。
Q5:标注了什么类别?
10 种胸部病理/发现:Atelectasis(肺不张)、Cardiomegaly(心影增大)、Consolidation(实变)、Edema(水肿)、Enlarged Cardiomediastinum(心纵隔增宽)、Lung Lesion(肺内病灶)、Lung Opacity(肺野阴影)、Pleural Effusion(胸腔积液)、Pneumothorax(气胸)、Support Devices(支持器械)。从 CheXpert 的 14 观察中排除了 fracture、pleural other、pneumonia、no finding 四项。
Q6:它评测什么?
评测 saliency map 的定位质量。对每张图的每个阳性观察,模型输出一张显著性热图,CheXlocalize 用 mIoU 与 hit rate 两个指标度量这张热图与医生勾画病灶区域的吻合度,并与人类基线比较。
Q7:评测了哪些方法?
7 种 saliency 方法(Grad-CAM、Grad-CAM++、Integrated Gradients、Eigen-CAM、DeepLIFT、LRP、Occlusion)× 3 种架构(DenseNet121、ResNet152、Inception-v4),每个组合使用 30-model 集成(每架构 120 个 checkpoint,含 4 种不确定性处理策略 × 3 次训练 × top-10)。
Q8:最大的卖点一句话?
它用放射科医师的像素级勾画证明:主流显著性方法在胸片上"看的地方"普遍不对——平均 mIoU 比人类低 24%,最难的 Lung Lesion 低 76.2%,而 consolidation 一类却反超人类 128.1%,揭示定位难度与病灶形态强相关。
Q9:它自己有什么局限?
只有 902 张(不含训练集)、获取需登录+注册表单、标注覆盖存在缺漏(有阳性标签却无勾画的案例)、病理名存在 Airspace Opacity / Lung Opacity 双口径——论文与 README 均有自曝或可核。
Q10:开源吗?
分层:数据托管 Stanford AIMI(登录+注册表单,O-UDA 许可)|评估代码 MIT(GitHub rajpurkarlab/cheXlocalize)|模型权重 Google Drive(非 PhysioNet,见坑 3)|论文 Nature MI 订阅制。
§2 数据集构成与规格
2.1 图像来源与规模
CheXlocalize 的图像全部派生自 CheXpert(Stanford ML Group,2019)——一个含 224,316 张胸片、65,240 名患者、14 种观察标注(13 类病理 + no finding)的大规模胸片数据集。CheXlocalize 取用其中两个划分:
| 划分 | 胸片数 | 患者数 | 说明 |
|---|---|---|---|
| val | 234 | 200 | 主要标注集,含 643 条专家分割 |
| test | 668 | 500 | 含 human benchmark 分割与最代表点 |
| 合计 | 902 | 700 | 用于 saliency 方法评测 |
图像派生关系是"图像衍生、标注独立新造":胸片本身来自 CheXpert,像素级病灶勾画是 CheXlocalize 团队新造的。因此 CheXlocalize 的标注许可独立于 CheXpert,但图像本体仍受 CheXpert 站点的使用条款约束(转录:https://stanfordmlgroup.github.io/competitions/chexpert/)。
2.2 10 类病理与标签口径
从 CheXpert 的 14 观察中保留 10 类、排除 4 类(论文原文排除理由):
| CheXlocalize 类别 | 中文 | 备注 |
|---|---|---|
| Atelectasis | 肺不张 | — |
| Cardiomegaly | 心影增大 | — |
| Consolidation | 实变 | 论文中 saliency pipeline 反超人类最显著的类 |
| Edema | 水肿 | — |
| Enlarged Cardiomediastinum | 心纵隔增宽 | 简称 ECM |
| Lung Lesion | 肺内病灶 | 论文中定位最难、差距最大的类 |
| Lung Opacity | 肺野阴影/空气腔浑浊 | 论文正文与 JSON 亦作 Airspace Opacity,二者等价 |
| Pleural Effusion | 胸腔积液 | — |
| Pneumothorax | 气胸 | — |
| Support Devices | 支持器械 | 仅勾画植入/侵入性器械 |
排除的 4 项及理由(论文原文):fracture、pleural other(test 集阳性不足 10 例);pneumonia(临床诊断而非影像征象,无法像素级定位);no finding(不适用于定位评估)。
病理名双口径存照:论文正文与部分文件(如 sample/gt_annotations_val.json 的病理性键)使用 “Airspace Opacity”,而 README 与 AIMI 页面使用 “Lung Opacity”。论文 Methods 明示:“‘Lung opacity’ in the CheXpert dataset is the equivalent of airspace opacity in the CheXlocalize dataset.” 转引时两口径等价,勿当作两类(见坑 7、§9)。
2.3 标注文件结构(README 逐文件口径)
AIMI 分发包(实测 fileCount 3,256,总大小 5,728,033,748 B ≈ 5.33 GB,fileTypes: csv/ds_store/jpg/json/pkl,version 2.0)内部结构如下:
| 路径 | 内容 |
|---|---|
CheXpert/val/、CheXpert/test/ |
派生 CXR 图像(JPEG) |
CheXpert/val_labels.csv、test_labels.csv |
GT 分类标签 |
CheXlocalize/gt_annotations_val.json |
val 集原始人工轮廓坐标(嵌套 contour,每 contour 为 [X,Y] 坐标列表) |
CheXlocalize/gt_annotations_test.json |
test 集原始轮廓坐标 |
CheXlocalize/gt_segmentations_val.json |
val 集 RLE 编码分割掩码(pycocotools 编码) |
CheXlocalize/gt_segmentations_test.json |
test 集 RLE 掩码 |
CheXlocalize/hb_annotations_test.json |
test 集 human benchmark 原始注释 |
CheXlocalize/hb_segmentations_test.json |
test 集 human benchmark 分割掩码 |
CheXlocalize/hb_salient_pt_test.json |
test 集 human benchmark 最代表点 |
CheXlocalize/gradcam_maps_val/ |
val 集 DenseNet121 + Grad-CAM 热图(逐图逐病理 pickle) |
CheXlocalize/gradcam_segmentations_val.json |
对应 Grad-CAM 热图的像素级分割 |
轮廓 → 掩码的转换:annotation_to_segmentation.py 把人工轮廓坐标转为 RLE 掩码,是"人画线 → 机器填面"的桥梁;转换的正确性直接决定 mIoU 的可信度。RLE(Run-Length Encoding)是 COCO 格式的标准掩码编码,用 pycocotools 解码。
2.4 模型热图与分割
val 集附赠一套 DenseNet121 + Grad-CAM 的热图(gradcam_maps_val/,逐图逐病理一个 pickle)与对应分割(gradcam_segmentations_val.json)。注意热图的原生分辨率仅约 14×14——这是 DenseNet121 最后卷积层的空间尺寸,上采样回原图(通常 2,000×2,000 像素)后极度 coarse,是 saliency 定位不准的直接成因之一(论文 Discussion 明示)。
2.5 与 CheXpert 的关系
CheXlocalize 是 CheXpert 家族向"可解释性/定位"维度的延伸。CheXpert 提供图像与分类标签,CheXlocalize 在其 val/test 上补充像素级定位真值。二者的关系是"母数据集—派生标注集":CheXlocalize 不重复发布 CheXpert 训练集(那是 CheXpert 自身的规模优势),而专注于它缺失的定位维度。这条沿革链与 Rajpurkar 组谱系一致:CheXNet(2017,arXiv:1711.05225,见本论文参考文献)→ CheXpert(2019,Irvin 等)→ CheXlocalize(2022)。
§3 注释流水线:像素级真值如何造出来
3.1 两类标注者,零人员重叠
CheXlocalize 的标注设计有一个关键的分工:造真值的人和定基线的人是两拨人。
- Ground-truth 分割:2 名 board-certified 放射科医师,分别有 18 年与 27 年经验,使用 MD.ai(
https://www.md.ai/)平台完成像素级勾画。 - Human benchmark 分割 + 最代表点:另 3 名放射科医师(在越南认证,经验分别为 9、10、18 年),对 test 集完成同样任务。
两组标注者没有人员重叠。这一步是方法论的要点:如果让同一批医生既画 GT 又画 benchmark,那么"人类基线"就退化为"自己和自己比",测不出方法相对于独立人类的差距。CheXlocalize 用两组独立标注者回避了这个问题。
3.2 标注形态一:轮廓 → 分割掩码
每张图的每个阳性观察,医生沿病灶边缘勾画轮廓(contour),坐标以嵌套 JSON 数组存储。轮廓经 annotation_to_segmentation.py 转为 RLE 掩码,供 mIoU 计算。这是区域级真值——用于回答"模型高亮的区域和病灶区域重叠多少"。
3.3 标注形态二:最代表点
test 集的 human benchmark 另含最代表点(most-representative point):医生在病灶中标记一个"最具代表性"的像素点。这对应 pointing game 协议——若模型热图的最大值像素落在 GT 掩码内(或靠近最代表点),记为命中。这回答的是"模型最关注的那个点,是不是在病灶里"。
3.4 双阈值方案:热图怎么变成分割
原始热图是连续值,要算 IoU 必须先二值化。论文与代码提供两套阈值方案:
| 方案 | 做法 | 出处 |
|---|---|---|
| Otsu’s method | 无参考自动全局阈值(cv2 包) | README「Fine-tune segmentation thresholds」 |
| 验证集优化阈值 | 在 val 集上迭代搜索使每类 mIoU 最大的阈值 | 同上 |
论文原文(Extended Data Fig. 1):两者对 human benchmark 无统计显著差异。此外还有 probability threshold(概率截止):当模型对某病理的预测概率低于截止值时,输出全零掩码,用于抑制低概率假阳性分割(论文 Table 3、Extended Data Fig. 4 采用此方案)。
3.5 标注缺漏的披露
论文坦诚披露:即使某张 CXR 有阳性 GT 标签,标注者仍可能不画分割。具体缺漏案例为:airspace opacity 1 例、atelectasis 1 例、edema 2 例、enlarged cardiomediastinum 1 例、support devices 1 例。Support Devices 的标注定义也值得注意:只勾画植入/侵入性器械(起搏器、PICC/中心静脉导管、胸管、气管插管、饲管、支架),忽略心电图导联线与外部贴片——因为这些不是"病灶",但对模型而言它们同样是高对比度特征,是被排除出评测的干扰项。
3.6 辅助脚本清单
README 目录列出的辅助脚本(反映标注与分析的完整链条):annotation_to_segmentation.py、heatmap_to_segmentation.py、tune_heatmap_threshold.py、tune_probability_threshold.py、compute_pathology_features.py(计算 4 类形态特征:instances/size/elongation/irrectangularity)、regression_pathology_features.py、regression_model_assurance.py、precision_recall_specificity.py、count_segs.py、plot_pathology_features.py。运行环境为 Python 3.8.3(conda 环境名 chexlocalize)。
§4 数据规格硬数字与获取门槛
4.1 规模数字总表
| 项 | 数值 | 来源 |
|---|---|---|
| 胸片总数 | 902(val 234 + test 668) | AIMI / README / 论文三方一致 |
| 患者数 | 700(val 200 + test 500) | AIMI / README |
| val 专家分割 | 643 条 | 论文 Discussion「234 images with 643 expert segmentations」 |
| 643 覆盖受试者 | 187 subjects | README |
| 病理类别 | 10 | AIMI / README |
| AIMI 发包文件数 | 3,256 | AIMI API 实测 |
| AIMI 发包大小 | 5,728,033,748 B ≈ 5.33 GB | AIMI API 实测 |
| AIMI 版本 | 2.0 | AIMI API |
| CheXpert 母集 | 224,316 CXRs / 65,240 患者 / 14 观察 | 论文 Methods 转述 |
4.2 双口径登记
| # | 项 | 口径 A | 口径 B | 处理 |
|---|---|---|---|---|
| 1 | val 规模 | 234 张/200 患者(AIMI/README) | 234 images with 643 segmentations(论文) | 并列;643 指标注数非图像数 |
| 2 | 标注覆盖 | 643 条(论文/README) | 187 subjects(README) | 并列;234 图全集 vs 643 覆盖 187 受试者 |
| 3 | 数据集页创建 | 2022-10-15(AIMI API created) |
10/16/22(AIMI 页面显示 Created) | 双口径差 1 天,见坑 6 |
| 4 | 病理名 | Airspace Opacity(论文/JSON) | Lung Opacity(README/AIMI 页) | 等价,两记(坑 7) |
| 5 | 数据集 UUID | abfb76e5-…(论文声明) | 23c56a0d-…(README/AIMI 页) | 前者实测 404,用后者(坑 2) |
4.3 获取门槛:三道门
CheXlocalize 的数据不是匿名直链,AIMI 记录字段 isDownloadAllowed=false。实际获取流程(据 download_instructions.md):
- 登录:访问 Stanford AIMI 数据集页(
https://stanfordaimi.azurewebsites.net/datasets/23c56a0d-15de-405b-87c8-99c30138950c),需 StanfordAIMI 账号;无账号需先注册。 - 注册表单:点击下载后弹出注册表单,填写信息并接受协议后提交。
- SAS 令牌下载:提交后弹出带 SAS 令牌的 Azure Blob 下载链接;README 明示该链接不能直接在浏览器使用,需用 Azure Storage Explorer 以 SAS URL 连接 Blob container 下载。
这道门槛与许可的宽松度形成反差——许可是宽松的 O-UDA(可自由使用/修改/分发),但获取流程仍要求登录+表单(见坑 1、§6)。门槛与许可分离是 CheXlocalize 的显著工程特征。
§5 评估与基准:saliency 方法大考
5.1 评估对象:7 方法 × 3 架构 × 30-model 集成
论文评测 7 种 saliency 方法:Grad-CAM、Grad-CAM++、Integrated Gradients、Eigen-CAM、DeepLIFT、LRP、Occlusion。覆盖 3 种架构:DenseNet121、ResNet152、Inception-v4。
每个"方法 × 架构"组合使用 30-model 集成,底层是每架构 120 个 checkpoint(4 种不确定性处理策略 × 3 次训练 × top-10 选取)。不确定性处理 4 策略沿用 CheXpert:ignoring / zeros / ones / three-class classification;集成选取基于 5 个观察(atelectasis/cardiomegaly/consolidation/edema/pleural effusion)的平均 AUROC。
5.2 两个核心指标
| 指标 | 定义 | 回答的问题 |
|---|---|---|
| mIoU | 热图二值化后的区域与 GT 掩码的 mean Intersection over Union | 模型高亮的"区域"和病灶区域重叠多少 |
| hit rate | pointing game:热图最大值像素是否落在 GT 掩码内 | 模型最关注的"那个点"是不是在病灶里 |
eval.py 产出逐图 IoU、hit/miss 判定,并做 1,000 次 bootstrap(种子默认 0)给出 95% 置信区间,生成三份 csv:{iou/hitmiss}_results_per_cxr.csv、{iou/hitmiss}_bootstrap_results.csv、{iou/hitmiss}_summary_results.csv。
5.3 核心结果(论文原文数字)
mIoU 维度:
- 平均 mIoU:saliency pipeline 比 human benchmark 低 24.0%(95% CI 18.2%–29.6%)。
- Lung Lesion 差距最大 = 76.2%(95% CI 59.1%–87.5%)——最难定位的类。
- 10 类中 5 类 mIoU 显著低于人类;2 类(atelectasis、consolidation)saliency pipeline 显著优于人类,其中 consolidation 超人类 +128.1%。
hit rate 维度:
- 平均 hit rate:比 human benchmark 低 29.4%(95% CI 23.1%–35.5%)。
- Lung Lesion 差距最大 = 65.9%(95% CI 35.3%–91.7%)。
- 7 类 hit rate 显著低于人类,3 类无显著差异,hit rate 无任何类别显著优于人类。
一个尖锐的例证:support devices 的分类 AUROC 高达 0.969(模型很会识别器械),但定位却是最差的之一——mIoU 0.163(95% CI 0.154–0.172)、hit rate 0.355(95% CI 0.303–0.408)。"识别准"与"看得对"是两件事,这个数字是最直接的证据。
5.4 机制发现:为什么 saliency 定位会失败
论文归因于三类与病灶形态相关的因素:
- 病灶实例数:多实例时 saliency map 常只高亮一个大的连通区域,漏掉其他实例。
- 病灶尺寸:saliency 分割倾向比人类更大,且不尊重解剖边界。
- 形状复杂度:复杂形状的病灶,saliency 常包含大量非病灶区域。
此外,热图原生分辨率仅约 14×14(Grad-CAM 从 DenseNet121 最后卷积层取出),上采样至原图(通常 2,000×2,000)后极为 coarse,是低分辨率伪影的成因。
置信度与定位正相关:model probability(模型对某病理的置信度)与 Grad-CAM 定位性能正相关(regression_model_assurance.py、论文 Table 3)——模型越有把握,热图越可能对。
5.5 第三方复用锚点
- ar5iv 2311.04813(“Be Careful When Evaluating Explanations Regarding Ground Truth”)明确复用 CheXlocalize:“consists of 902 X-ray images with 10 multi-label classes, ground-truth masks by expert radiologists”,其 test 集 668 张用于对齐实验。来源:
https://ar5iv.arxiv.org/html/2311.04813 - Lacuna(tiptreesystems)摘要页转述:“Validation and Test Sets: Contains nearly 900 images with over 1,000 expert segmentations”,并复述 24.0%/29.4%/76.2% 三数字。来源:
https://lacuna.tiptreesystems.com/work/benchmarking-saliency-methods-for-chest-x-ray-interpretation/wrk_1815b828b163682a61668ea981ed85b0 - CI-GCI medical_grounding_datasets 清单:记 CheXlocalize “902 images (643 expert segmentations)”,与论文 643 口径一致。来源:
https://github.com/FaezehMillerAI/CI-GCI/blob/main/medical_grounding_datasets.md
注意 Lacuna 的"over 1,000 expert segmentations"是第三方转述,非论文原文——论文全文检索无 “1,000 expert” 字样(见坑 4、§9)。
§6 获取与许可:宽松许可与有门获取的错位
6.1 数据许可:O-UDA v1.0(一轮修正的关键)
CheXlocalize 数据集记录挂载的实际许可是 Open Use of Data Agreement v1.0(O-UDA 1.0):
| 字段 | 值 |
|---|---|
| licenseName | Open Use of Data Agreement v1.0 |
| licenseId | f1f352a6-243f-4905-8e00-389edbca9e83 |
| isStandard | true |
| 附件文件名 | O-UDA-1.0.pdf |
来源:Stanford AIMI 许可记录 https://aimistanford-web-api.azurewebsites.net/licenses/f1f352a6-243f-4905-8e00-389edbca9e83。
O-UDA 1.0 要点(全文核):依据微软 Open-Use-of-Data-Agreement 仓库全文(https://cdn.jsdelivr.net/gh/microsoft/Open-Use-of-Data-Agreement@master/O-UDA-1.0.md)——§1.1 可自由使用/修改/分发;§2 不限制使用、修改或对结果的使用;§3 再分发须保留归属信息并传递同等免责条款;§4 无担保/责任限制。这是一份宽松数据许可,不是"注册签署制"的强制研究用途限制条款(与坑 8 的页面标签冲突对照阅读)。
与页面标签的冲突(重点):AIMI 数据集的 License 展示标签(搜索引擎快照可见)写作 “Stanford University Dataset Research Use Agreement”,而数据集记录实际挂载的许可是 O-UDA-1.0。同一数据集页,展示标签与许可记录不一致。转引时以 API/附件为准记 O-UDA,并注明页面标签冲突(见坑 8、§9 存照)。
6.2 代码许可:MIT
评估代码以 MIT License 发布,版权声明原文:“Copyright © 2022 Rajpurkar Lab / Harvard Medical AI”(来源:https://cdn.jsdelivr.net/gh/rajpurkarlab/cheXlocalize@master/LICENSE.md;论文代码可用性声明亦写明 “under the MIT License”)。MIT 是最宽松的代码许可之一,署名即可自由使用/修改/分发/商用。
6.3 论文许可:订阅制
论文发表于 Nature Machine Intelligence,非开放获取(订阅制)。引用论文文本须注意著作权边界;但引用数据集本身应引数据许可(O-UDA)。
6.4 获取流程:三道门(非匿名直链)
AIMI 记录字段 isDownloadAllowed=false——数据不是匿名直链。实际获取流程(据 download_instructions.md):
- 登录:访问 Stanford AIMI 数据集页(
https://stanfordaimi.azurewebsites.net/datasets/23c56a0d-15de-405b-87c8-99c30138950c),需 StanfordAIMI 账号;无账号需先注册。 - 注册表单:点击下载后弹出注册表单,填写信息并接受协议后提交。
- SAS 令牌下载:提交后弹出带 SAS 令牌的 Azure Blob 下载链接;README 明示该链接不能直接在浏览器使用,需用 Azure Storage Explorer 以 SAS URL 连接 Blob container 下载。
这道门槛与许可的宽松度形成反差——许可是宽松的 O-UDA(可自由使用/修改/分发),但获取流程仍要求登录+表单。门槛与许可分离是 CheXlocalize 的显著工程特征(见坑 1、坑 8)。
6.5 代码与资产的四个位置
| 资产 | 位置 | 许可 |
|---|---|---|
| 数据本体 | Stanford AIMI(Azure Blob,SAS 令牌) | O-UDA v1.0 |
| 代码仓库 | GitHub rajpurkarlab/cheXlocalize(仓库名大写作 cheXlocalize) |
MIT |
| 代码归档 | Zenodo v1.0.0(2022-08-05),DOI 10.5281/zenodo.6973536(zip 20.5 MB) | MIT |
| 模型权重 | Google Drive 文件夹 https://drive.google.com/drive/folders/17nUAxXGskc2a6_CxfoYpixnhsm8VLjy6(每架构 120 checkpoint) |
随代码 |
权重位置修正:README 里出现的 PhysioNet 链接是空链接 [PhysioNet]()(无 URL,疑似悬空占位);PhysioNet 站点实测无任何 CheXlocalize 项目(站点搜索无命中,https://physionet.org/content/chexlocalize/ 返回 404)。真实权重在 Google Drive(见坑 4、§9 存照)。
6.6 版本链
| 资产 | 版本 | 时间 |
|---|---|---|
| 数据集(AIMI) | version 2.0 | 创建 2022-10-15(API;页面显示 10/16/22,双口径见 §9) |
| 代码(Zenodo) | v1.0.0 | 2022-08-05 |
| 论文 | Nat Mach Intell 2022;4(10):867-878 | 在线 2022-10-10 |
6.7 图像层与标注层的许可分离
CheXlocalize 不包含 CheXpert 训练集,仅 val/test 派生图像 + 新标注。图像本体的使用需同时遵守 CheXpert 站点条款(https://stanfordmlgroup.github.io/competitions/chexpert/);标注层的许可是 O-UDA。这是"派生数据集"的常见双许可结构,商用前应分别核对两层。
§7 核心发现深读:可解释性为什么还不可靠
7.1 三句话的结论
论文的发现可凝练为三点(原文):(1) Grad-CAM 整体定位优于其他六种方法,但七种全部显著落后人类基线;(2) Grad-CAM 与人类的差距在更小、形状更复杂的病灶上最大;(3) 模型置信度与 Grad-CAM 定位性能正相关。三点连起来就是:“当前 saliency 方法还不能可靠地验证单个临床决策。”
7.2 差距的结构:哪些病灶最难定位
把差距按病理拆开,规律非常清晰——差距与病灶的三个几何特征正相关:
| 几何特征 | 对定位的影响 | 论文解释 |
|---|---|---|
| 实例数多 | 越难 | saliency 常把多实例糊成"一个大连通区",而非分开标每块 |
| 尺寸小 | 越难 | 低分辨率热图上,小病灶只占几个格子,上采样后边界全丢 |
| 形状复杂 | 越难 | 复杂形状时,saliency 分割常包含大片非病灶区 |
Lung Lesion(肺内病灶)同时踩中三条——通常小、形状不规则、可能多发,因此成为差距最大的类别(mIoU 差 76.2%)。反过来,Cardiomegaly(心影增大)大而规则,就相对好定位。这解释了为什么"平均差距"这个数字要谨慎用:它是一个从"几乎追平"到"差七成"的分布的平均。
7.3 置信度与定位的正相关
论文发现模型分类概率越高,Grad-CAM 定位越准。这有两个含义:
- 它是一种"可用的筛选信号"——当模型很确信时,它的热图相对可信;当模型犹豫时,热图尤其不可信。
- 它呼应了"confident but wrong places"这类反例的稀缺:模型置信度与"看对地方"大体同向,但这不等于高置信度就一定能放心用热图(支撑器械 AUROC 0.969 却定位最差就是反例)。
对临床落地者的含义:不要把热图当作"无条件可信的解释",至少要把模型置信度作为门槛一起看。
7.4 机制层:14×14 的分辨率瓶颈
论文最后一击指向工程事实:Grad-CAM 类热图的原生空间分辨率只有约 14×14(受末层特征图尺寸限制),被插值放大到 2000×2000 后必然"coarse、blobby"。论文的假设是"这可能是算法伪影(algorithmic artefact)"——即差距未必完全归咎于方法本身,也可能来自"用低分辨率信号去逼近像素级真值"这一根本错配。这对方法开发者是有价值的指路:提高归因图空间分辨率可能比换归因算法更能改善定位。
7.5 与自动化偏见的关联
论文把定位不准放进临床安全的语境:如果热图高亮了错误的区域,医生可能被"看起来合理却错误"的解释误导(自动化偏见 automation bias),反而更信任模型——即使模型答案本身是对的时候也是如此。因此论文的落点是"限制临床转化",而非"改进热图美观度"。这一判断与库内多条目记录的"可解释性/可信度"主题一致。
§8 生态与影响:一把被反复引用的尺子
8.1 从 CheXpert 到 CheXlocalize
CheXlocalize 处在 CheXpert 家族的"可解释性"分支上:
CheXNet (2017, arXiv:1711.05225)
└─> CheXpert (2019, 224,316 CXRs / 65,240 patients) ← 图像来源
└─> CheXlocalize (2022) ← 定位/可解释性标注与基准
└─> 同组后续:RadGraph / RadGraph2 等(库内另有条目)
Rajpurkar 组的谱系特征很明显:从"分类能力"(CheXNet)到"大规模标注"(CheXpert)到"可解释性验证"(CheXlocalize),问题意识从"能不能判"走向"凭什么判、判得可不可信"。
8.2 被复用情况
CheXlocalize 已成为"胸片显著性定位"评测的默认尺子之一,第三方复用形态多样:
| 复用者 | 复用方式 | 来源 |
|---|---|---|
| ar5iv 2311.04813(“Be Careful When Evaluating Explanations Regarding Ground Truth”) | 明文复用"902 images / 10 类",用 test 668 张做对齐实验 | https://ar5iv.arxiv.org/html/2311.04813 |
| Lacuna(tiptreesystems)摘要页 | 转述"nearly 900 images / over 1,000 segmentations"与 24/29.4/76.2% | https://lacuna.tiptreesystems.com/work/.../wrk_1815b828b163682a61668ea981ed85b0 |
| CI-GCI grounded-datasets 清单 | 收录为"902 images (643 expert segmentations)"定位基准 | https://github.com/FaezehMillerAI/CI-GCI/blob/main/medical_grounding_datasets.md |
复用形态的共同点是:把它当"定位评测集"或"可解释性基准",而非训练集——这与它的设计意图一致。第三方转述的规模数字(nearly 900 / over 1,000)与论文口径(902 图 / 643 条 val 分割)有出入,引用时以论文为准(坑 7)。
8.3 在库内定位类条目中的位置
库内已有多个胸片定位/框选条目,CheXlocalize 的差异在"像素级 × 多病理 × 带人类基线":
- chexpert(5):图像上游,图级标签无定位。
- mimic-cxr(16):同域大规模胸片,报告级文本,无像素级定位。
- ms-cxr(340):图文框级短语定位——粒度比 CheXlocalize 粗。
- vindr-cxr(125):胸片异常框级标注,且团队与本论文作者有越南渊源。
- chest-imagenome(330):胸片解剖结构标注(不是病理定位),方法学对照。
- chestx-det10(137):胸片病灶框级检测。
CheXlocalize 是其中唯一的"病理像素级定位 + 人类基线"条目——它的稀缺性不在图像多,而在"让专家逐像素描边并自己也做一遍"这件事的成本极高。
8.4 对下游研究的提醒
任何在 CheXpert 上做"可解释性"的工作,读 CheXlocalize 的三条结论都是必要的背景校验:训练集分类能力再强的模型,其 Grad-CAM 热图仍可能大幅落后专家;小复杂病灶尤其不可信;置信度是热图可信度的粗略门槛。库内做胸片定位、报告生成、视觉问答的条目,都可引用这三条作为"解释可靠性"的背景。
§9 方法学启示:三条可迁移的经验
9.1 "人类基线"比"真值"更有说服力
CheXlocalize 的方法学贡献之一,是把 human benchmark 独立出来——不只给 GT,还给"人类在同样任务上的表现"。这样"机器 vs GT"的差距才能与人机差距分开解读:如果一个方法落后 GT,但和 human benchmark 持平,那它其实是"达到人类水平"而非"失败"。任何做"AI 能否替代专家"的评测,都应复制这个双基准设计。
9.2 双指标互补:重叠与注视点
mIoU 与 hit rate 的组合提醒:定位有两个正交维度——“围得全”(mIoU)与"看得对"(hit rate)。只报一个会掩盖问题(IoU 0.078 却 hit 的例子、IoU 0.682 却 miss 的例子都在论文里)。跨方法评测时,两个指标都要报,且要说明阈值方案与 true_pos_only 设置。
9.3 低分辨率是解释方法的通病
"14×14 上采样到 2000×2000"这一观察具有跨模态的方法学价值:任何用"末层特征图 + 上采样"生成归因图的方法(不止胸片,CT/MRI/病理都适用)都受同类分辨率瓶颈限制。改进方向有二:要么提升特征图分辨率,要么用本身就在原分辨率运算的归因方法。
9.4 数据诚实性:标注有缺口
论文主动披露"阳性标签却无分割"的 5 类若干例,这一点值得学习:真值标注并非完美覆盖,使用者若假设"有标签就有掩码"会踩坑。把标注的不完美写进文档,是高质量数据集的标志。
§10 避坑清单:八个已踩过的坑
坑 1:CheXlocalize 既不是分类训练集,也不是"纯评测框架"。它的图像只有 902 张、且与 CheXpert 训练集不重叠——拿它训通用分类器会欠拟合;但它自带 643 条独立专家分割语料与 human benchmark,不是 ReXrank 那种"只有排行榜、没有自己数据"的纯框架。因此既不要当训练料,也不要当成"没有独立语料所以不值得收录"(本库曾以 ReXrank/radeval 判例考察,实核后判定不触发 stopping)。用途正解是"定位/可解释性评测尺"。
坑 2:仓库名与历史名。现行仓库是 rajpurkarlab/cheXlocalize(注意 cheXlocalize 的大小写),旧路径 stanfordmlgroup/cheXplanation 会重定向——文献里两者都可能出现。检索/引用时以 rajpurkarlab/cheXlocalize 为准,别把 cheXplanation 当作另一个数据集。
坑 3:标注者机构未披露,勿臆造。论文只给了 GT 标注者"18/27 年经验 + MD.ai 工具"、human benchmark"越南认证 9/10/18 年",没有说 GT 标注者是 Stanford Radiology。旧版 FACTS 曾按"Stanford Radiology 口径"记,属臆测;本条按论文原文记录,不补机构。
坑 4:模型权重不在 PhysioNet。README 前言声称权重在 PhysioNet,但那条链接是空的 [PhysioNet](),且 PhysioNet 站点实测没有 CheXlocalize 项目(直链 404、搜索无命中)。真实 checkpoint 在 Google Drive(README §weights)。按 PhysioNet 去搜会扑空。
坑 5:病理名双口径(Lung Opacity ↔ Airspace Opacity)。README/AIMI 页写 Lung Opacity,论文正文与 sample JSON 键写 Airspace Opacity,论文 Methods 声明二者等价。跨文档拼接类别名时必须做映射,否则 match 不上。同理 Support Devices 是"器械"不是"病变",别和九类病理一视同仁。
坑 6:数字口径与评测开关。论文发布口径是"234 images with 643 expert segmentations"(val);README 补充"187 subjects / 643 annotations"。第三方(Lacuna)转述成"nearly 900 images / over 1,000 expert segmentations"——后两者非论文数字,混引会错。此外 eval.py 的 --true_pos_only、阈值方案(Otsu vs mIoU-tuned vs probability)、是否 smoothing 都会改变结果,跨论文比较前务必对齐开关。
坑 7:论文声明的数据集 UUID 已失效。论文 Data availability 给的 UUID 是 abfb76e5-70d5-4315-badc-c94dd82e3d6d,实测 API 返回 404;现行有效入口是 README/AIMI 页的 23c56a0d-15de-405b-87c8-99c30138950c。照抄论文里的旧链接会打不开。
坑 8:许可标签与许可记录不一致。AIMI 页面 License 标签显示 “Stanford University Dataset Research Use Agreement”,但数据集记录实际挂载的许可是 Open Use of Data Agreement v1.0(O-UDA-1.0.pdf,isStandard=true)。O-UDA 是宽松许可(可自由用改分发,仅需保留归属),与"研究用途 RUA"性质不同。引用许可时以记录/附件 O-UDA 为准,并留存页面标签不一致的截图。
§11 总结
11.1 三句话总结
- CheXlocalize 用 2 名放射科医师逐像素勾画的 643 条专家分割(覆盖 902 张 CheXpert 派生胸片、10 类病理)建立了胸片定位的像素级真值 + 人类基线。
- 它证明了七种主流 saliency 方法全线落后人类:平均 mIoU 低 24.0%、hit rate 低 29.4%,小复杂病灶(Lung Lesion)差距高达 76.2%,根因疑似 14×14 热图的低分辨率瓶颈。
- 它是"许可宽松(O-UDA)但获取有门(登录+表单+SAS)"的典型:数据、代码、评测协议完整可用,但下载不是裸直链。
11.2 适合谁
- 做胸片定位/分割:需要一个像素级、多病理的评测真值(含人类基线)——直接用。
- 做可解释性/XAI:需要一把量"解释准不准"的尺子与可对标结论——评测量用,训不用。
- 做 AI 安全与临床落地:需要"解释不可靠"的实证证据——引 §7 结论。
- 做评测基准方法学:human benchmark + 双指标的协议设计可迁移到其他模态。
11.3 不适合谁
- 想要大规模训练数据的团队(902 张,且与 CheXpert 训练集不重叠)。
- 需要框级/图级标签的项目(走 VinDr-CXR / ChestX-Det10 更直接)。
- 需要零门槛直链下载的自动化流水线(此处走登录+表单+SAS,不可
wget)。
11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 要立刻跑通评测骨架 | clone rajpurkarlab/cheXlocalize(MIT)+ 用 repo 内 sample/ 跑 eval.py |
| 要完整数据 | StanfordAIMI 登录 → 数据集页下载 → 注册表单 → Azure SAS 链接 + Azure Storage Explorer |
| 要模型权重 | README §weights 的 Google Drive 链接(不是 PhysioNet,坑 4) |
| 要引用定位结论 | 引论文 24.0%/29.4%/76.2%(注指标口径与 true_pos_only 开关,坑 6) |
| 要写数据集综述 | §2.6 定位赛道表 + §8.3 库内定位条目对照可直接用 |
| 要引用本数据集 | 数据引 Saporta et al. 2022;图像来源引 CheXpert (Irvin et al. 2019) |
FAQ(高频问答 32 问)
A. 基础认知
Q1:CheXlocalize 是挑战赛吗?
不是。它没有比赛、没有 leaderboard、没有提交系统。它是一份"专家定位标注数据集 + 配套评测代码 + 一篇方法论文"的研究产物,用途是量模型/解释方法的定位能力。
Q2:名字里的 “CheX” 指什么?
沿用 CheXpert/CheXNet 家族的 “CheX”(chest X-ray 的缩写游戏)。CheXlocalize = chest X-ray + localize(定位),直译"胸片定位"。
Q3:它有分类标签吗?
有,但不是它的重点。它随包提供 val_labels.csv / test_labels.csv(来自 CheXpert 的图级标签),但数据集的核心价值是像素级定位标注,分类标签只是辅助。
Q4:为什么只有 902 张图这么少?
因为像素级专家标注的成本极高——2 名资深放射科医师逐张逐病灶描边。文献中多病理像素级胸片标注此前没有公开集,902 张已是该精度的"最大公开集"级别。它的定位是"精测尺"而非"大训练料"。
B. 数据与标注
Q5:GT 分割和 human benchmark 分割有什么不同?
GT 是"标准答案"(2 名高年资医师画,覆盖 val+test);human benchmark 是"人类选手的答卷"(另 3 名医师画,仅 test)。机器既比 GT(绝对准不准),也比 human benchmark(相对人类差多少)。
Q6:为什么标注人数是 2 + 3?
2 人画 GT 是为"确立真值";3 人画 benchmark 是为"测量人类在该任务上的可变表现"。两组人不重叠,避免"自己考自己"。
Q7:支持器械(Support Devices)也算一类?
是。它是唯一非病变类别,含起搏器、导管、胸管、气管插管、饲管、支架等;标注规则是只标器械、忽略导线与外部贴片。用它做"病理定位"评测时要留意它性质不同。
Q8:没有任何标注者是匿名吗?
标注者是匿名的(论文未给姓名),但给出了可辨识的特征:GT 两人 18/27 年经验;benchmark 三人越南认证 9/10/18 年。这些特征来自论文 Methods,条目按原文转述。
Q9:有阴性样本吗?
有。eval.py 的 --true_pos_only=False 会把"有预测无真值""有真值无预测"的样本算进去。默认(True)只评真阳性切片。阴性样本的存在是为了捕捉假阳性/假阴性。
Q10:多条轮廓 vs 单个掩码?
同一病理若有多处病灶,原始标注是多条 contour,二值化后可能合并或分开。README 提醒:有时医师对同一病理画两条相互重叠的 contour,此时 annotation 数是 2 但 segmentation 数是 1——所以"实例数"从 annotation 取更准(compute_pathology_features.py 就是这么做的)。
C. 指标与方法
Q11:mIoU 怎么算?
对每张图每类病理,算预测掩码与 GT 掩码的交集面积 / 并集面积(IoU),再对数据集求平均。范围 0–1,越高越准。
Q12:hit rate 怎么算?
取 saliency 热图最大激活像素(最代表点),若落在 GT 掩码内记 hit;人类基线则用医师标注的"最代表点"。数据集上的命中比例即 hit rate。
Q13:为什么两个指标都要?
它们测不同能力:mIoU 测"围得全不全",hit rate 测"指得对不对"。论文有 IoU 极低却 hit、IoU 很高却 miss 的例子,单看一个都不够。
Q14:Otsu 阈值和 mIoU 优化阈值差多少?
论文说两者对 human benchmark 无统计显著差异。工程上 Otsu 无需真值、更省事;要精细复现论文 Table 3 才用 probability threshold。
Q15:1000 次 bootstrap 是干嘛的?
给每个病理的 mIoU/hit rate 算 95% 置信区间——因为样本量(尤其小病灶)有限,点估计不稳,bootstrap 给出区间更诚实。
D. 结论与影响
Q16:机器到底差多少?
平均 mIoU 低 24.0%、hit rate 低 29.4%(相对人类基线)。但这只是平均——从"几乎追平"到"差七成"都有。
Q17:哪些类别机器反超了人类?
在 mIoU 上,Atelectasis 和 Consolidation 机器显著优于人类(Consolidation 高 128.1%);hit rate 上机器没有任何类别显著优于人类。别只看"机器全输"这句概括。
Q18:为什么 Lung Lesion 差距最大?
因为它同时满足"小、形状复杂、可能多发"——三个增加定位难度的特征它都占。mIoU 差 76.2%、hit rate 差 65.9%。
Q19:AUROC 高是不是定位就好?
不是。支持器械 AUROC 0.969(接近满分),定位却最差之一(mIoU 0.163)。分类和定位是两回事。
Q20:置信度高热图就可信吗?
更可信,但不绝对。论文发现置信度与定位正相关,但支撑器械就是高置信低定位的反例。热图要配合置信度门槛使用。
Q21:14×14 是什么?
Grad-CAM 热图的原生空间分辨率(受末端特征图尺寸限制)。插值放大到约 2000×2000 后粗糙,是低分辨率伪影的根因。
E. 获取与许可
Q22:怎么下载数据?
StanfordAIMI 登录 → 数据集页点下载 → 填注册表单接受协议 → 拿 Azure SAS 链接 → 用 Azure Storage Explorer 拉取。链接不能在浏览器直接打开。
Q23:许可是什么?是 Stanford 研究协议吗?
实际挂载许可是 Open Use of Data Agreement v1.0(O-UDA)——宽松,可自由使用/修改/分发(保留归属)。AIMI 页面标签显示 “Stanford University Dataset Research Use Agreement”,与记录不一致(坑 8),以记录/附件为准。
Q24:能商用吗?
O-UDA 不限制使用与结果(含商用),但图像源自 CheXpert,需回 CheXpert 侧确认其图像条款。数据许可管的是 CheXlocalize 的标注层。
Q25:代码许可?
MIT License,Copyright © 2022 Rajpurkar Lab / Harvard Medical AI。可自由使用/修改/分发。
Q26:模型权重在哪?
README §weights 的 Google Drive 文件夹(不是 PhysioNet,坑 4)。每架构 120 个 checkpoint + gradcam.py + models.py。
Q27:有预印本吗?
有 medRxiv 预印本(2021-02-28,doi 10.1101/2021.02.28.21252634)——不是 arXiv(坑 2 相关的旧误记)。
F. 使用与复现
Q28:能拿它训练分割模型吗?
可以训,但 902 张偏少,更适合当测试集/验证集。训练建议用 CheXpert 或其他大规模数据,CheXlocalize 做定位评测。
Q29:能训分类模型吗?
不建议。902 张且与 CheXpert 训练集不重叠,训通用分类器会欠拟合。
Q30:Pathology 特征(instances/size/elongation/irrectangularity)是什么?
论文定义的四类病灶几何特征,用于把"定位差距"归因到病灶形态。仓库提供计算与绘图脚本。
Q31:怎么复现论文的 per-pathology 数字?
用官方阈值 csv(tuning_results.csv / probability_tuning_results.csv)+ eval.py + 固定 seed=0,注意 true_pos_only 设置与 smoothing 开关。
Q32:这数据集和 CheXpert 什么关系?
CheXlocalize 的图像全部派生自 CheXpert val/test;CheXpert 训练集不包含在内。引用要两篇都引(图像 CheXpert、标注与结论 CheXlocalize)。
事实清单(硬事实 40 条)
- 全称 CheXlocalize,官方描述为"a radiologist-annotated segmentation dataset on chest X-rays"(放射科医师标注的胸片分割数据集)。
- 论文:Benchmarking saliency methods for chest X-ray interpretation,Nature Machine Intelligence 2022;4(10):867-878,doi 10.1038/s42256-022-00536-x(online 2022-10-10)。
- 论文时间线:Received 11 Oct 2021 / Accepted 26 Aug 2022 / Published online 10 Oct 2022。
- 作者 12 人;共同一作 3 人(Saporta / Gui / Agrawal,同贡献标记)。
- 机构 8 家:NYU CS、Stanford CS、Stanford AIMI、Stanford Radiology、Harvard DBMI + 越南 VinBrain / VinUniversity / Vinmec International Hospital。
- 通讯作者 Pranav Rajpurkar(Harvard DBMI),邮箱 pranav_rajpurkar@hms.harvard.edu。
- 代码 LICENSE:MIT License,Copyright © 2022 Rajpurkar Lab / Harvard Medical AI。
- 图像来源:CheXpert(Stanford)val/test 集派生,CheXpert 训练集不包含在内。
- 图像规模:val 234 张 / 200 患者 + test 668 张 / 500 患者 = 902 张。
- 论文发布口径:“234 images with 643 expert segmentations”(val 集)。
- README 口径:
gt_annotations_val.json含 187 subjects / 643 total annotations。 - 病理 10 类:Atelectasis / Cardiomegaly / Consolidation / Edema / Enlarged Cardiomediastinum / Lung Lesion / Lung Opacity / Pleural Effusion / Pneumothorax / Support Devices。
- 病理名双口径:README/AIMI 用 Lung Opacity,论文正文与 sample JSON 键用 Airspace Opacity,论文声明二者等价。
- 从 CheXpert 14 观察排除 4 项:fracture、pleural other(阳性不足 10 例)、pneumonia(临床诊断)、no finding(无定位对象)。
- GT 分割标注者:2 名 board-certified 放射科医师(18 年、27 年经验),工具 MD.ai。
- Human benchmark 标注者:另 3 名放射科医师(越南认证,9/10/18 年经验),与 GT 标注者无重叠,仅 test 集。
- 论文未披露标注者所属医院/科室。
- GT 标注缺口(论文披露):airspace opacity/atelectasis/enlarged cardiomediastinum/support devices 各 1 例、edema 2 例未画分割。
- Support Devices 标注规则:只标植入/侵入性器械,忽略 ECG 导联线与外部贴片。
- 标注格式:原始轮廓 JSON([X,Y] 顶点)+ pycocotools RLE 掩码 JSON + Grad-CAM 热图 pickle。
- 文件清单 14 类:CheXpert/{val,test} 图像与标签 csv;gt_annotations/gt_segmentations/{val,test};hb_annotations/hb_segmentations/hb_salient_pt_test;gradcam_maps_val/ 与 gradcam_segmentations_val。
- AIMI 分发包实测:fileCount 3,256;size 5,728,033,748 B ≈ 5.33 GB;fileTypes csv/ds_store/jpg/json/pkl;version 2.0;domain CHEST。
- 许可:实际挂载 Open Use of Data Agreement v1.0(O-UDA-1.0.pdf,isStandard=true);AIMI 页面标签显示 “Stanford University Dataset Research Use Agreement”(冲突,坑 8)。
- 获取流程:StanfordAIMI 登录 → 数据集页下载 → 注册表单 → Azure SAS 链接 → Azure Storage Explorer 拉取;isDownloadAllowed=false。
- 论文 Data availability 的 UUID
abfb76e5-70d5-4315-badc-c94dd82e3d6d实测 404;现行 UUID23c56a0d-15de-405b-87c8-99c30138950c。 - 代码仓库:
rajpurkarlab/cheXlocalize(MIT);旧名stanfordmlgroup/cheXplanation重定向至此。 - 代码归档:Zenodo v1.0.0(2022-08-05),DOI 10.5281/zenodo.6973536,zip 20.5 MB,作者 Gui & Saporta。
- 预印本:medRxiv doi 10.1101/2021.02.28.21252634(2021-02-28),非 arXiv。
- 模型权重:README §weights 的 Google Drive 文件夹(每架构 120 checkpoint);README 前言声称的 PhysioNet 链接为空链,PhysioNet 无此项目(坑 4)。
- 评估方法:7 种 saliency 方法(Grad-CAM/Grad-CAM++/Integrated Gradients/Eigen-CAM/DeepLIFT/LRP/Occlusion)× 3 架构(DenseNet121/ResNet152/Inception-v4),每组合 30-model 集成。
- 集成构成:每架构 120 checkpoint = 4 种不确定性策略 × 3 次训练 × top-10;每病理取 top-10。
- 指标:mIoU(严格,分割重叠)+ hit rate(宽松,最代表点落入 GT)。
- 阈值方案:Otsu 自动阈值 vs 验证集 mIoU 优化阈值——对 human benchmark 无统计显著差异;另有 probability threshold。
- 核心结果(mIoU):saliency pipeline 比 human benchmark 低 24.0%(95% CI 18.2–29.6%);Lung Lesion 差距最大 76.2%(95% CI 59.1–87.5%)。
- 核心结果(hit rate):比 human benchmark 低 29.4%(95% CI 23.1–35.5%);Lung Lesion 差距最大 65.9%(95% CI 35.3–91.7%)。
- 反超:Atelectasis、Consolidation 在 mIoU 上机器显著优于人类(Consolidation 高 128.1%);hit rate 无任何类别机器胜出。
- 例证:Support Devices AUROC 0.969 但定位最差之一——mIoU 0.163(95% CI 0.154–0.172)、hit rate 0.355(95% CI 0.303–0.408)。
- 机制发现:定位差距与病灶实例数、尺寸(越小越差)、形状复杂度(越复杂越差)相关;模型置信度与 Grad-CAM 定位正相关;热图原生约 14×14,上采样"blobby"。
- 第三方复用:ar5iv 2311.04813 明文用"902 images/10 类";Lacuna 转述"nearly 900 images / over 1,000 segmentations";CI-GCI 清单收录"902 images (643 expert segmentations)"。
- 数据集页创建:AIMI API created 2022-10-15(页面展示 Created 10/16/22,双口径差 1 天)。
术语表(32 条)
| 术语 | 释义 |
|---|---|
| CheXlocalize | 本条目主题:放射科医师逐像素标注的胸片病灶定位数据集 |
| CheXpert | Stanford 2019 发布的大规模胸片数据集(224,316 CXRs / 65,240 patients / 14 观察),本数据集图像来源 |
| saliency method | 显著性/归因方法:把模型判断所依赖的像素画成热图,用于事后解释 |
| Grad-CAM | 基于梯度的类激活映射,本评测中整体最优的 saliency 方法 |
| Grad-CAM++ | Grad-CAM 的改进加权变体 |
| Integrated Gradients | 积分梯度归因法 |
| Eigen-CAM | 基于主成分分析的类激活图方法 |
| DeepLIFT | 基于参考反传的归因法 |
| LRP | Layer-wise Relevance Propagation,逐层相关性传播 |
| Occlusion | 遮挡法:滑动窗口遮挡图像观察输出变化 |
| localization | 定位:模型/方法指出病灶位置的能力 |
| segmentation mask | 分割掩码:像素级 0/1 标注图 |
| RLE | Run-Length Encoding,游程编码;pycocotools 用的 COCO 掩码压缩格式 |
| contour | 轮廓:标注者描边的多边形顶点序列([X,Y] 坐标列表) |
| most representative point | 最代表点:热图中激活值最大的像素,用于 pointing game |
| pointing game | 指认游戏:只看"最亮点是否落在真值区域"的宽松定位判定 |
| mIoU | mean Intersection over Union,平均交并比,严格定位指标 |
| hit rate | 命中率:pointing game 命中的比例 |
| human benchmark | 人类基线:另请一组专家做同样任务,作为机器要对标的标杆 |
| ground truth(GT) | 真值:作为"标准答案"的人工标注 |
| AUROC | 受试者工作特征曲线下面积,衡量分类判别能力 |
| bootstrap | 自助抽样:重采样估计统计量分布,本数据集用 1000 次算 95% CI |
| Otsu’s method | 大津法:自动全局阈值算法(cv2 提供) |
| probability threshold | 概率截止:模型置信度低于阈值时输出全零掩码,压假阳性 |
| true_pos_only | eval.py 开关:只在真假值分割都存在的真阳性切片上评估 |
| board-certified radiologist | 经专科认证的放射科医师 |
| MD.ai | 标注平台工具(GT 分割所用) |
| automation bias | 自动化偏见:人过度信任自动系统输出的倾向 |
| Airspace Opacity / Lung Opacity | 同一病理的两个名称(论文正文/sample 用前者,README/AIMI 用后者) |
| Enlarged Cardiomediastinum | 心纵隔增宽 |
| Support Devices | 支持器械(起搏器/导管/插管/饲管/支架等),唯一非病变类别 |
| O-UDA 1.0 | Open Use of Data Agreement v1.0,宽松数据许可(可自由用改分发,保留归属) |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability,AI-Ready 评估框架 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | CheXlocalize |
| url_name | chexlocalize |
| 类型 | 定位标注数据集 + 评测基准 + 方法论文(三合一) |
| 论文 | Nat Mach Intell 2022;4(10):867-878(doi 10.1038/s42256-022-00536-x) |
| 团队 | Stanford AIMI/CS + NYU CS + Harvard DBMI(通讯 Rajpurkar) |
| 规模 | 902 图(val 234 + test 668);val 643 条专家分割 |
| 许可 | 数据 O-UDA 1.0 / 代码 MIT / 论文 Nature MI |
| 抓取时点 | 2026-09-30 |
| 库内互链 | chexpert(5)/mimic-cxr(16)/chest-imagenome(330)/padchest(117)/ms-cxr(340)/vindr-cxr(125)/chestx-det10(137)/nih-chestx-ray14(15) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | 论文开放 PDF + AIMI 记录 + GitHub + Zenodo 多重可索引;名称唯一不易混 |
| A 可获取性 | 6 | 数据许可宽松(O-UDA)但需登录+表单+SAS;代码/论文裸直链 |
| I 可互操作 | 8 | pycocotools RLE + JSON + CSV 标准格式;无 DICOM 原生 |
| M 元数据质量 | 6 | 论文/README 完备;但病理名双口径、UUID 失效、权重托管错记三处瑕疵 |
| S 可持续性 | 7 | AIMI 机构托管 + GitHub + Zenodo 三重冗余;权重依赖个人 Google Drive 是单点 |
| 综合评级 | 7.0/10(中上) | 许可宽松+协议完整是强项;登录门槛与若干文档不一致拖分 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 902 图(234+668) | AIMI API + README + 论文 Methods | 见 FACTS §4 |
| 643 条专家分割 | 论文 Discussion 原文 | Nature PDF |
| 187 subjects / 643 annotations | README | GitHub README(jsDelivr 镜像) |
| 10 类病理名单 | AIMI API description | AIMI 记录 |
| 24.0% / 76.2% / 29.4% / 65.9% | 论文 Results | Nature PDF |
| 128.1%(consolidation 反超) | 论文 Results | Nature PDF |
| support devices AUROC 0.969 / mIoU 0.163 / hit 0.355 | 论文 Results | Nature PDF |
| 14×14 热图 / 2000×2000 上采样 | 论文 Discussion | Nature PDF |
| O-UDA 1.0 许可 | AIMI API + 许可附件 | aimistanford-web-api |
| MIT 代码许可 | GitHub LICENSE.md | jsDelivr 镜像 |
| Zenodo v1.0.0 / 20.5 MB | Zenodo record 6973536 | zenodo.org |
| medRxiv 预印本 | Zenodo description | zenodo.org |
| 2 名 18/27 年 + MD.ai | 论文 Methods | Nature PDF |
| 3 名越南认证 9/10/18 年 | 论文 Methods | Nature PDF |
| 论文 UUID 404 | AIMI API 实测 | aimistanford-web-api |
附录 D:数据获取决策树
需求是什么?
├── 只想跑通评测骨架
│ └── clone rajpurkarlab/cheXlocalize(MIT)+ repo 内 sample/ 直接 eval.py
├── 要完整数据做定位评测
│ ├── 1) StanfordAIMI 登录
│ ├── 2) 数据集页点下载 + 填注册表单
│ ├── 3) 取 Azure SAS 链接 → Azure Storage Explorer 拉取(≈5.33 GB)
├── 只要模型权重复现
│ └── README §weights 的 Google Drive(每架构 120 checkpoint)
└── 只要引用定位结论
└── 引论文 24.0%/29.4%/76.2%,注明指标与 true_pos_only 设置(坑 6)
附录 E:掩码/坐标字段规范
| 字段 | 层级 | 类型 | 说明 |
|---|---|---|---|
| CXR id | 顶层键 | string | 形如 patient64622_study1_view1_frontal |
| img_size | 图内 | [h,w] | 原图尺寸 |
| 病理名 | 图中 | key | 十类之一,仅列阳性(annotations);segmentations 全 10 类 |
| contour | 病理下 | list | 单条轮廓 = [X,Y] 顶点列表;多条 = 多实例 |
| size | 掩码内 | [h,w] | 掩码尺寸 |
| counts | 掩码内 | string | RLE 编码串(pycocotools) |
附录 F:saliency 方法矩阵(7×3)
| 方法 \ 架构 | DenseNet121 | ResNet152 | Inception-v4 |
|---|---|---|---|
| Grad-CAM | ✓(整体最优) | ✓ | ✓ |
| Grad-CAM++ | ✓ | ✓ | ✓ |
| Integrated Gradients | ✓(box filter k=100) | ✓(k=50) | ✓(k=50) |
| Eigen-CAM | ✓ | ✓ | ✓ |
| DeepLIFT | ✓(k=50) | ✓ | ✓ |
| LRP | ✓ | ✓ | ✓ |
| Occlusion | ✓(窗口 40/步长 40) | ✓ | ✓ |
注:IoU 评估时部分方法施加 box filtering(详见论文 Methods)。每格对应一个 30-CNN 集成。
附录 G:eval.py 使用骨架(代码)
# 1) 人工轮廓 -> RLE 掩码
# python annotation_to_segmentation.py --ann_path gt_annotations_val.json \
# --output_path human_segmentations.json
# 2) 热图 -> RLE 掩码(Otsu 或自带阈值)
# python heatmap_to_segmentation.py --map_dir gradcam_maps_val/ \
# --threshold_path sample/tuning_results.csv \
# --probability_threshold_path sample/probability_tuning_results.csv \
# --output_path saliency_segmentations.json
# 3) 评估 mIoU
# python eval.py --metric iou \
# --gt_path gt_segmentations_val.json \
# --pred_path saliency_segmentations.json \
# --true_pos_only True --seed 0 --save_dir ./out
# 4) 评估 hit rate(人类基线需 --if_human_benchmark True)
# python eval.py --metric hitmiss \
# --gt_path gt_segmentations_val.json \
# --pred_path gradcam_maps_val/ \
# --true_pos_only True --seed 0
# 5) 百分比差距
# python calculate_percentage_decrease.py --metric miou \
# --hb_bootstrap_results hitmiss_humanbenchmark_bootstrap_results_per_cxr.csv \
# --pred_bootstrap_results iou_bootstrap_results.csv
附录 H:病理几何特征(compute_pathology_features.py)
| 特征 | 定义 | 论文关联 |
|---|---|---|
| num_instances | 病灶实例数(来自 annotations,非掩码) | 实例越多,定位越差 |
| size (area_ratio) | 病灶面积 / 全图面积 | 越小,定位越差 |
| elongation | 伸长率(最小外接矩形拟合) | 形状越复杂,定位越差 |
| irrectangularity | 非矩形度(rec_area_ratio) | 形状越复杂,定位越差 |
附录 I:与库内 CheXpert rid 5 的关系声明
| 维度 | CheXpert(rid 5) | CheXlocalize(本条目) |
|---|---|---|
| 对象 | 大规模胸片数据集(224,316 CXRs) | 902 张 val/test 子集 + 定位标注 |
| 标签 | 图级 14 观察五值 | 像素级 10 类分割 + 最代表点 |
| 性质 | 分类训练/评测基座 | 定位/可解释性评测基准 |
| 获取 | Stanford ML Group 站点 | Stanford AIMI 数据集页(登录+表单) |
| 阅读顺序 | 先 CheXpert(图像背景)再本条目(定位视角) | — |
两篇不冲突:CheXpert 的价值在其规模与图级标签;本条目补充的是"子集上的像素级定位真值与人类基线"。
附录 J:第三方复用登记表
| 复用者 | 用途 | 引用的数字 | 来源 |
|---|---|---|---|
| ar5iv 2311.04813 | 用 test 668 张做解释对齐实验 | 902 images / 10 类 | ar5iv.arxiv.org |
| Lacuna 摘要页 | 论文摘要转述 | nearly 900 images / over 1,000 segmentations | lacuna.tiptreesystems.com |
| CI-GCI grounded-datasets | 定位数据集清单收录 | 902 images (643 expert segmentations) | github.com/FaezehMillerAI/CI-GCI |
附录 K:License 与获取细读
- 数据许可(记录):Open Use of Data Agreement v1.0(O-UDA-1.0.pdf,isStandard=true)——§1.1 可自由使用/修改/分发;§2 不限制使用与结果;§3 再分发须保留归属;§4 无担保。
- 数据许可(页面标签):AIMI 页 License 标签显示 “Stanford University Dataset Research Use Agreement”——与记录不一致(坑 8),以记录/附件为准。
- 获取门槛:StanfordAIMI 登录 + 注册表单 + Azure SAS(非裸直链,isDownloadAllowed=false)。
- 代码许可:MIT(Copyright 2022 Rajpurkar Lab / Harvard Medical AI)。
- 论文许可:Nature MI 版权;PDF 可公开获取,正文非 CC。
- 图像层:源自 CheXpert,其使用受 CheXpert 站点条款约束,与本标注层许可分离。
附录 L:口径双记表
| # | 项 | 口径 A | 口径 B | 处理 |
|---|---|---|---|---|
| 1 | 病理名 | Lung Opacity(README/AIMI) | Airspace Opacity(论文正文/sample JSON) | 双记,声明等价 |
| 2 | 数据集创建日 | 2022-10-15(API) | 10/16/22(页面展示) | 双记,差 1 天 |
| 3 | 规模转述 | 902 图 / 643 条(论文) | nearly 900 / over 1,000(Lacuna) | 论文为准,注转述 |
| 4 | 权重托管 | PhysioNet(README 前言,空链) | Google Drive(README §weights) | 以 Google Drive 为准 |
| 5 | 数据集 UUID | abfb76e5-…(论文,404) | 23c56a0d-…(README/AIMI,有效) | 用有效 UUID |
附录 M:术语中英对照速查
| 中文 | 英文 |
|---|---|
| 显著性方法 | saliency method |
| 归因图/热图 | attribution map / heat map |
| 定位 | localization |
| 最代表点 | most representative point |
| 人类基线 | human benchmark |
| 真值 | ground truth |
| 游程编码 | run-length encoding |
| 自动化偏见 | automation bias |
| 支持器械 | support devices |
| 心纵隔增宽 | enlarged cardiomediastinum |
| 肺野阴影 | lung/airspace opacity |
| 观测者间一致性 | inter-rater agreement |
| 遮挡法 | occlusion |
| 不确定性处理策略 | uncertainty handling strategy |
附录 N:胸片定位/框选数据集景观总表
| 数据集 | 年 | 模态 | 规模 | 标注粒度 | 类别数 | 定位真值类型 |
|---|---|---|---|---|---|---|
| NIH ChestX-ray14 | 2017 | CXR | 112,120 图 | 图级 | 14 | 无(图级标签) |
| CheXpert | 2019 | CXR | 224,316 图 | 图级 | 14 观察 | 无 |
| VinDr-CXR | 2020-22 | CXR | 18,000 图 | 框级 | 22 发现 | 边界框 |
| ChestX-Det10 | 2020 | CXR | 3,543 图 | 框级 | 10 | 边界框 |
| MS-CXR | 2022 | CXR | 1,162 图文对 | 框级 | 短语 | 边界框 |
| REFLACX | 2021 | CXR | 3,052 例 | 眼动级 | 多 | 注视点/椭圆 |
| Chest ImaGenome | 2021 | CXR | 242,072 图 | 解剖结构 | 解剖部件 | 解剖框 |
| CheXlocalize | 2022 | CXR | 902 图 | 像素级 | 10 | 轮廓 + RLE 掩码 + 最代表点 |
定位一句话:CheXlocalize 是表中唯一的"多病理 × 像素级 × 带人类基线"胸片定位集——它的稀缺性在标注精度与"人类自己也标一遍",不在图像规模。
附录 O:saliency 方法的适用性对照
| 方法 | 原理族 | 是否需梯度 | 是否需修改模型 | 本评测定位表现 |
|---|---|---|---|---|
| Grad-CAM | 梯度 + 特征图加权 | 是 | 否(后置) | 七种中整体最优 |
| Grad-CAM++ | 梯度加权改进 | 是 | 否 | 次优档 |
| Integrated Gradients | 积分梯度 | 是 | 否 | 中游 |
| Eigen-CAM | PCA 主成分 | 否 | 否 | 中游 |
| DeepLIFT | 反传分解 | 是 | 否 | 偏后 |
| LRP | 逐层相关性 | 是 | 部分 | 偏后 |
| Occlusion | 扰动遮挡 | 否 | 否 | 偏后 |
共性:全部落后人类基线。差异:基于梯度/特征图加权的一族整体优于扰动/分解一族。
附录 P:复现评测的检查清单(12 项)
- 数据来源:确认用的是现行 UUID
23c56a0d-…(非论文旧 UUID,404)。 - 类别映射:Lung Opacity ↔ Airspace Opacity 做映射;确认 sample 与完整包的键一致。
- 掩码编码:自备掩码必须 pycocotools RLE,键结构对齐官方。
- 阈值声明:明确用 Otsu、mIoU-tuned 还是 probability threshold——三者结果不同。
- true_pos_only:明确 True/False——影响是否计入假阳性/假阴性。
- smoothing:
if_smoothing+k是否启用——影响像素化热图。 - seed:固定 seed=0 以复现 bootstrap。
- 人类基线开关:hit rate 评人类基线时用
--if_human_benchmark True(点格式不同)。 - 集成口径:确认是否复现 30-model 集成(单 checkpoint 结果更差,见论文 Extended Data Fig. 7)。
- 权重来源:README §weights 的 Google Drive(非 PhysioNet)。
- 引用完整:数据引 Saporta et al. 2022;图像引 CheXpert (Irvin et al. 2019)。
- 许可核对:以 O-UDA 1.0 为数据许可(留存页面标签不一致截图,坑 8)。
附录 Q:Support Devices 类的使用说明
| 项 | 内容 |
|---|---|
| 性质 | 非病变,是植入/侵入性器械的集合类 |
| 包含 | 起搏器、PICC/中心静脉导管、胸管、气管插管、饲管、支架 |
| 排除 | ECG 导联线、外部贴片 |
| 定位表现 | AUROC 0.969(分类近满分)但 mIoU 0.163(定位最差之一) |
| 使用建议 | 做"病理定位"评测时,可单列或排除该类,避免与九类病变混算 |
附录 R:可解释性结论的应用边界
CheXlocalize 的结论"saliency 不可靠"有三条边界,引用时需一并说明:
- 方法版本边界:结论针对 2022 年评测的七种方法;后续新的归因方法(如高分辨率归因、基于 Transformer 的解释)未在原始评测内。
- 数据边界:仅 10 类胸片病理、902 张图;不能说"所有医学影像的 saliency 都不可靠",只能说"在胸片多类病理定位任务上,这七种方法落后人类基线"。
- 归因边界:论文强调"难以判断低定位表现归咎于模型还是归因方法"——同样的架构在分类上很强(AUROC 高),定位却差,说明问题可能在"解释"而非"识别"。
附录 S:维护计划与触发点
| 触发点 | 条件 | 动作 | 优先级 |
|---|---|---|---|
| 许可标签修正 | AIMI 修正页面标签与记录一致 | 更新 §6、附录 K/L | 1 |
| 权重托管变更 | Google Drive 迁移或上线 PhysioNet | 更新 §6、坑 4 | 2 |
| 新版本发布 | AIMI version 从 2.0 升级 | 更新规模/文件数 | 3 |
| 新第三方复用 | 新论文用 CheXlocalize 评测新方法 | 附录 J 扩行、§8.2 更新 | 4 |
| CheXpert 条款变更 | CheXpert 站点许可变动 | 更新 §6.4、附录 K | 5 |
附录 T:与库内多条目的评测维度对照
| 条目 | 评测目标 | 指标形态 | 与 CheXlocalize 的关系 |
|---|---|---|---|
| chexpert(5) | 分类判别 | AUROC | 图像上游(图级) |
| mimic-cxr(16) | 报告生成/分类 | 多指标 | 同域大规模,无像素定位 |
| ms-cxr(340) | 图文框级定位 | 框 IoU | 粒度更粗(框 vs 像素) |
| vindr-cxr(125) | 异常检测 | 框 mAP | 粒度更粗,同越南团队渊源 |
| chest-imagenome(330) | 解剖结构定位 | 部件框 | 对象是解剖非病理 |
| chexlocalize(本条目) | 病理像素级定位 + 可解释性 | mIoU + hit rate | — |
附录 U:论文数据与代码可用性原文摘要
- Data availability 原文(论文):“The CheXlocalize dataset is available here: https://stanfordaimi.azurewebsites.net/datasets/abfb76e5-70d5-4315-badc-c94dd82e3d6d.”(注:该 UUID 实测 404,坑 7)
- Code availability 原文:“The code used to produce our results is available in the following public repository under the MIT License: https://github.com/rajpurkarlab/cheXlocalize. The version used for this publication is available at https://doi.org/10.5281/zenodo.6973536.”
- README 权重原文:“All checkpoints can be found here”(超链接指向 Google Drive 文件夹,非 PhysioNet)。
附录 V:常见误引与正解
| 误引 | 正解 |
|---|---|
| “CheXlocalize 有 nearly 900 图 / 1000+ 分割”(当论文数字用) | 论文是 902 图 / val 643 条分割;nearly 900/1000+ 是 Lacuna 转述 |
| “权重在 PhysioNet” | 在 Google Drive;PhysioNet 无此项目 |
| “许可是 Stanford RUA” | 记录挂载 O-UDA 1.0;页面标签才是 Stanford RUA(冲突) |
| “GT 标注者是 Stanford Radiology” | 论文未披露机构,只说 18/27 年经验 |
| “arXiv 预印本” | 是 medRxiv 预印本 |
| “机器在十个类别上全输” | Atelectasis/Consolidation 在 mIoU 上机器反超 |
| “CheXlocalize 是分类训练集” | 是定位评测基准,图像 902 张不重叠训练集 |
附录 W:引文规范
@article{saporta2022chexlocalize,
title = {Benchmarking saliency methods for chest X-ray interpretation},
author = {Saporta, Adriel and Gui, Xiaotong and Agrawal, Ashwin and
Pareek, Anuj and Truong, Steven Q. H. and Nguyen, Chanh D. T. and
Ngo, Van-Doan and Seekins, Jayne and Blankenberg, Francis G. and
Ng, Andrew Y. and Lungren, Matthew P. and Rajpurkar, Pranav},
journal = {Nature Machine Intelligence},
volume = {4},
number = {10},
pages = {867--878},
year = {2022},
doi = {10.1038/s42256-022-00536-x}
}
@article{irvin2019chexpert,
title = {CheXpert: A large chest radiograph dataset with uncertainty labels
and expert comparison},
author = {Irvin, Jeremy and Rajpurkar, Pranav and Ko, Michael and others},
journal = {AAAI},
year = {2019}
}
附录 X:本条目生产档案
- 生产通道:真核重做(chexlocalize-verify-agent)——亲自 web 核验,非转抄旧 FACTS
- 事实研究:AIMI 后端 API 逆向(app-config.json → datasets/{id})+ GitHub jsDelivr 镜像取 README/LICENSE/sample + Nature 官方 PDF 全文(pdftotext)+ CrossRef/EuropePMC + Zenodo API + PhysioNet 站点实测 + 第三方文献交叉,约 12 轮
- FACTS.md:writing/chexlocalize/FACTS.md 九节(每条事实附来源 URL)
- 证据归档:writing/chexlocalize/.evidence/(API JSON / README / 论文文本 / sample JSON)
- 坑点:§10 八则(坑 1-8"坑 N:"编号制)
- description:成稿时即 ≤170 字符
- 互链计划:chexpert(5)/mimic-cxr(16)/chest-imagenome(330)/padchest(117)/ms-cxr(340)/vindr-cxr(125)
附录 Y:FAIR/AI-Ready 检查单
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 全局唯一标识 | ✅ | DOI(论文)+ Zenodo DOI(代码)+ AIMI UUID |
| F2 富元数据 | ✅ | AIMI 记录 + README + 论文 Methods |
| A1 可访问协议 | ⚠️ | 数据需登录+表单+SAS(非裸直链);代码/论文开放 |
| A2 元数据可访问 | ✅ | 元数据始终开放 |
| I1 互操作格式 | ✅ | RLE/JSON/CSV/pickle |
| I2 词汇表引用 | ✅ | 10 类病理标准命名 |
| R1 来源溯源 | ✅ | CheXpert 派生关系明示 |
| R3 可复现流程 | ⚠️ | 代码+阈值 csv 齐备;权重托管错记造成断点(坑 4) |
| AI-Ready 综合 | 中上 | 许可宽松+协议完整,获取门槛与文档瑕疵拖分 |
附录 Z:缩写速查
| 缩写 | 全称 |
|---|---|
| CXR | Chest X-Ray(胸片) |
| GT | Ground Truth(真值) |
| RLE | Run-Length Encoding |
| mIoU | mean Intersection over Union |
| AUROC | Area Under the Receiver Operating Characteristic curve |
| CAM | Class Activation Mapping |
| IG | Integrated Gradients |
| LRP | Layer-wise Relevance Propagation |
| O-UDA | Open Use of Data Agreement |
| AIMI | (Stanford) Center for Artificial Intelligence in Medicine and Imaging |
| DBMI | (Harvard) Department of Biomedical Informatics |
| CI | Confidence Interval |
| MD.ai | 标注平台工具名 |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability |
附录 AA:基于本数据集的方案选择表
| 你的目标 | CheXlocalize 是否合适 | 建议替代/配合 |
|---|---|---|
| 训胸片分类模型 | ✗(902 张太少) | CheXpert 全量 / MIMIC-CXR-JPG |
| 评测分割/定位模型 | ✓(多病理像素级真值) | — |
| 评测 saliency/解释方法 | ✓✓(设计初衷) | — |
| 框级检测训练 | ✗(无框,是像素级) | VinDr-CXR / ChestX-Det10 |
| 报告生成 | ✗ | MIMIC-CXR / MIMIC-CXR-JPG |
| 视觉问答/图文 grounding | △(可作定位真值) | MS-CXR 更直接 |
附录 AB:数据字典(关键 JSON 键)
| 文件 | 顶层键 | 键内结构 | 病理覆盖 |
|---|---|---|---|
| gt_annotations_val.json | CXR id(187 个) | img_size + 阳性病理 → 轮廓列表 | 仅阳性 |
| gt_segmentations_val.json | CXR id(187 个) | 十类病理 → | 全部 10 类 |
| hb_salient_pt_test.json | CXR id | 病理 → 最代表点坐标 | test |
| gradcam_maps_val/*.pkl | — | map/prob/task/gt/cxr_img/cxr_dims | 逐图逐病理 |
使用提示:gt_annotations 只列阳性病理(稀疏),gt_segmentations 列全 10 类(稠密)——两者键集不同,拼接时按 CXR id join,再对病理做映射。
附录 AC:检索路径示范(关键词组合与查询式)
| 目标 | 推荐查询式 | 预期命中 |
|---|---|---|
| 本体论文 | “Benchmarking saliency methods for chest X-ray interpretation” | Nat MI 4(10):867-878 |
| 数据集页 | site:stanfordaimi.azurewebsites.net CheXlocalize | AIMI 记录 23c56a0d-… |
| 代码 | rajpurkarlab cheXlocalize github | GitHub + Zenodo 6973536 |
| 权重 | CheXlocalize model weights checkpoints | README §weights → Google Drive |
| 第三方复用 | “CheXlocalize” + (localization OR saliency) + benchmark | ar5iv 2311.04813 等 |
| 反例(勿用) | “CheXlocalize PhysioNet” | 无结果(权重不在 PhysioNet,坑 4) |
检索卫生两条:一、凡命中"Stanford University Dataset Research Use Agreement"的 CheXlocalize 页面文本,注意那只是页面标签,实际许可是 O-UDA;二、凡文中出现"nearly 900 / over 1,000"的,多为第三方转述,引用请回到论文 643 口径。
附录 AD:论文 Table 结构导读
论文有三张主表,各自回答不同问题,引用时勿混:
| 表 | 主题 | 自变量/内容 | 关键用途 |
|---|---|---|---|
| Table 1 | 数据集概览/对比 | 各胸片定位数据集的标注层级 | 说明 CheXlocalize 的"首个多病理像素级"定位 |
| Table 2 | 几何特征回归 | 四类病理特征 → 定位指标 | 解释"为什么某些病灶难定位"(真阳性切片) |
| Table 3 | 模型置信度回归 | 模型概率 → 定位指标 | 解释"置信度与定位正相关"(全数据集,含 FP/FN) |
关键差异:Table 2 只在真阳性切片上做回归(排除假阳性干扰,纯看定位质量);Table 3 在全数据集上做(因为假阳性/假阴性本身是分析对象)。引用回归结论时必须说明用的是哪张表、哪个切片口径——这是本数据集最容易误用的统计细节。
附录 AE:不确定性处理四策略说明
CheXpert 家族面对"不确定"标签的四套处理,CheXlocalize 全部沿用并各训 3 次:
| 策略 | 对 uncertain 标签的处理 | 影响 |
|---|---|---|
| ignoring | 忽略(不计入损失) | 最常见基线 |
| zeros | 当作负例 | 拉低阳性率 |
| ones | 当作正例 | 拉高阳性率 |
| three-class | 作为独立第三类 | 保留不确定性信息 |
每策略 3 次训练 × 每次 top-10 checkpoint = 30;四策略共 120。理解这个结构是复现"30-model 集成"的前提——若误以为"30 model"是 30 次独立训练,就会错配 checkpoint。
附录 AF:hit rate 的"最代表点"从哪来
两种来源的"最代表点"格式不同,这是 --if_human_benchmark 开关存在的原因:
| 来源 | 最代表点定义 | 输入形态 |
|---|---|---|
| saliency 方法 | 热图中激活值最大的像素 | 热图 pickle(eval.py 自行提取) |
| 人类基线 | 医师标注的"单一最代表点" | hb_salient_pt_test.json(JSON 坐标) |
若把人类基线的点标注误喂给"saliency 模式",或反之,hit rate 会算错——这是复现时的高频错误点。
附录 AG:为什么"像素级"比"框级"更难也更有价值
像素级定位标注比框级贵得多(描边 vs 拉框),但换来的是边界精度:
| 维度 | 框级 | 像素级 |
|---|---|---|
| 标注成本 | 低 | 高(逐点描边) |
| 边界精度 | 粗(矩形近似) | 高(真实轮廓) |
| 能否算 mIoU | 否(只有框 IoU) | 是(真实重叠) |
| 能否揭示"糊成一片" | 否 | 是(能看出 saliency 边界不尊重解剖) |
| 适用评测 | 检测/grounding | 分割/可解释性定位 |
CheXlocalize 选像素级,正是为了让"saliency 分割是否尊重解剖边界"这个问题可被量化——框级标注做不到这一点。
附录 AH:从"标注"到"结论"的推理链
本数据集的核心结论不是直接观测,而是一条推理链,理解它有助于正确引用:
观测 1:saliency 分割的平均 mIoU 比人类低 24.0%
观测 2:差距随病灶变小/变复杂而增大(Lung Lesion 76.2%)
观测 3:支持器械 AUROC 0.969 却定位最差
观测 4:热图原生仅 14×14,上采样后粗糙
↓ 推理
推断 A:低定位性能未必是"模型看不见病灶",而可能是"解释方法表达不了"
推断 B:14×14 分辨率瓶颈是结构性成因,指向"提高归因分辨率"的改进路径
推断 C:saliency 热图不宜单独用于临床决策验证(自动化偏见风险)
引用时若只抄观测 1(“机器差 24%”),会丢掉推断链的临床安全含义;完整引用应包含"结论是限制临床转化"这一落点。
附录 AI:跨机构与越南团队的背景
本论文的作者构成反映了一种跨国工业-学术合作模式:
| 机构 | 国家 | 作者 | 角色 |
|---|---|---|---|
| NYU CS | 美国 | Saporta(共同一作) | 主力研究与写作 |
| Stanford CS | 美国 | Gui、Agrawal、Ng | 技术设计与实现 |
| Stanford AIMI | 美国 | Pareek、Lungren | 临床 AI 与影像 |
| Stanford Radiology | 美国 | Seekins、Blankenberg | 放射学专业 |
| Harvard DBMI | 美国 | Rajpurkar(通讯) | 通讯/组品牌 |
| VinBrain | 越南 | Truong、Nguyen | 工业界参与 |
| VinUniversity | 越南 | Nguyen | 学术 |
| Vinmec International Hospital | 越南 | Ngo | 临床 |
值得注意的是 human benchmark 的 3 名放射科医师是"越南认证"——这既是跨国合作的自然延伸,也提示使用者在解读"人类基线"时注意其可能的地域判读口径(坑 3 的延伸)。
附录 AJ:热图分辨率问题的跨模态意义
"低分辨率归因图"不是胸片独有的问题:
| 模态 | 末层特征图典型尺寸 | 是否受同类瓶颈 |
|---|---|---|
| 胸片(本数据集) | 约 14×14 | 是(论文实锤) |
| CT/MRI 3D | 更小(下采样更狠) | 大概率是 |
| 病理 WSI | 视 patch 尺寸而定 | 可能 |
因此论文的机制发现具有方法学普适性:任何"末层特征 → 上采样 → 叠加原图"的归因流程都受分辨率瓶颈限制。这对做可解释性的团队是一条可迁移的经验(§9.3)。
附录 AK:多实例病灶的标注处理
多实例(如双侧胸腔积液、多发结节)是定位难题的三大成因之一,标注与评测处理如下:
| 环节 | 处理规则 |
|---|---|
| 标注 | 每个实例单独勾一条 contour(同一病理可多条) |
| 二值化 | 多条 contour 合并为一张掩码(重叠 contour 也可能合并) |
| 实例数统计 | 从 annotations 取(非掩码),因为重叠 contour 在掩码里只剩 1 |
| 评测 | mIoU 对整个病理掩码算;saliency 常把多实例糊成一个大区 |
这正是 compute_pathology_features.py 用 annotations 而非 segmentations 数实例的原因——一个易被忽略的细节。
附录 AL:条目与"纯评测框架"判例的分野
本库曾以 ReXrank / radeval 为判例考察"纯评测框架无独立语料"应否 stopping。CheXlocalize 与该判例的分野需讲清:
| 维度 | ReXrank(判例) | CheXlocalize(本条目) |
|---|---|---|
| 是否有独立语料 | 无(复用现存数据评榜) | 有(643 条独立新造专家分割 + human benchmark) |
| 数据是否独立托管 | 否 | 是(Stanford AIMI,3,256 文件 / 5.33 GB) |
| 是否有独立许可 | 否 | 有(O-UDA 1.0) |
| 是否含评测协议 | 是 | 是 |
| 裁定 | stopping | 不 stopping |
结论:CheXlocalize 兼具"评测协议"与"独立语料"两属性,属于"带独立语料的评测基准",与纯排行榜框架有本质区别。
附录 AM:一句话定位(给不同读者的电梯陈述)
- 给算法工程师:一份让放射科医师把十类胸片病灶逐像素描出来的 902 张标注集,拿它量你的定位/解释方法指得准不准。
- 给临床研究者:证据表明当前 saliency 热图定位系统性落后专家(差 24%),尤其不可信于小复杂病灶,提示不要用它验证单个临床决策。
- 给数据集工程师:一个"许可宽松但获取有门(登录+表单+SAS)"的样本,以及一套 human benchmark + 双指标的评测设计范本。
- 给论文作者:引用它请同时引 CheXpert;数字用 902 图 / 643 分割,勿用第三方的 nearly 900 / over 1,000。
附录 AN:CheXpert 与 CheXlocalize 的"数据血缘"详图
CheXpert (2019, Stanford)
├── train 集(约 22.3 万图)─── 不包含于 CheXlocalize
├── val 集(234 图 / 200 患者)
│ └── CheXlocalize val:GT 分割 643 条(187 subjects)+ Grad-CAM 热图
└── test 集(668 图 / 500 患者)
└── CheXlocalize test:GT 分割 + human benchmark 分割/最代表点
血缘要点:CheXlocalize 只取了 CheXpert 的 holdout(val+test),训练集完全不含。这意味着用它做评测时,模型可以在 CheXpert 训练集上训练而不"见过答案"——评测的独立性有保证。这也是它适合作"定位评测集"的结构性原因。
附录 AO:为什么评测集要"与训练集不重叠"
机器学习评测的基本纪律是测试集不得参与训练。CheXpert 与 CheXlocalize 的划分天然满足这一点:
| 资产 | 是否可用于训练 | 是否在 CheXlocalize 内 |
|---|---|---|
| CheXpert train | ✓ | ✗ |
| CheXpert val | 评测用 | ✓(CheXlocalize val) |
| CheXpert test | 评测用 | ✓(CheXlocalize test) |
因此标准用法是"CheXpert train 训模型 → CheXlocalize val/test 评定位",评测结果对训练污染免疫。若有人把 CheXlocalize 的图当训练料,就破坏了这一独立性。
附录 AP:医学图像定位评测的常见陷阱
结合 CheXlocalize 的实践,列出定位评测的常见陷阱:
- 单指标误判:只看 mIoU 或只看 hit rate,会分别漏掉"指得偏"和"围不全"。两个都要报。
- 口径不声明:true_pos_only、阈值方案、smoothing 不写清楚,结果无法跨论文比较。
- 平均掩盖分布:平均差距 24% 掩盖了从"反超"(consolidation +128%)到"差七成"(lung lesion 76%)的分布,分类别看。
- 分类能力冒充定位能力:AUROC 高不等于定位好(support devices 反例)。
- 热图分辨率忽视:不检查热图原生尺寸,会把"分辨率不足"误读成"方法差"。
- 真值不完美假设:假设"有阳性标签就有分割",会踩到论文披露的 5 类若干例缺口。
附录 AQ:条目自评(自检清单)
| 检查项 | 状态 |
|---|---|
| 标题/副标题/description 长度合规(≤255/≤170) | ✅ |
| 九节结构(FACTS) | ✅ |
| 每条事实带来源 URL | ✅ |
| 八个坑点(≥6) | ✅ |
| category_tags 受控词表内 | ✅ |
| data_source/patient_count 完整 | ✅ |
| schema_org 含 MedicalWebPage/Dataset/cr:RecordSet/rai:dataLimitations | ✅ |
| 与旧 FACTS 出入已存照 | ✅ |
| 保留 Markdown 占位 URL(qianfanghub) | ✅ |
| 无 HTML 注释/TODO/占位符 | ✅ |
| 代码块围栏配对 | ✅ |
| 无相邻重复标题/重复锚点 | ✅ |
附录 AR:字段级速查(frontmatter 关键字段)
| 字段 | 值 | 长度约束 |
|---|---|---|
| title | CheXlocalize — AI-Ready Wikipedia \ | 千方病案医数集 |
| subtitle | Stanford AIMI 托管的胸片病灶定位人工标注基准…… | ≤255 |
| description | CheXlocalize 是 Stanford AIMI 托管的胸片定位标注数据集…… | ≤170 |
| data_source.name | CheXpert 派生胸片 + 逐像素人工轮廓标注…… | ≤255 |
| category_tags | 医学影像 / X光影像 / 医学图像分割 / 评测基准 / 目标检测 | 2-6 个,≤100 字符 |
| url(占位) | https://www.qianfanghub.com/ai-ready-dataset/chexlocalize/736 | — |
附录 AS:与同批胸片条目的可获取性光谱对照
| 档位 | 库内参照 | 本条目 |
|---|---|---|
| 注册墙 | LMC2 型(注册+审批) | — |
| 登录+表单 | — | CheXlocalize 数据(StanfordAIMI 登录+注册表单+SAS) |
| 平台托管 | Zenodo 型 | 代码在 Zenodo(v1.0.0) |
| 公开直链 | HF/PhysioNet 型 | 论文 PDF、GitHub 代码 |
本条目的特色是"数据有门、代码开放":本体数据需登录+表单+SAS,但配套代码(MIT)与样例数据在 GitHub/Zenodo 裸取——可先跑通评测骨架再申请完整数据。
附录 AT:文献中 CheXlocalize 名称的写法
避免检索/引用错配,常见写法要辨:
| 写法 | 出现处 | 是否有效 |
|---|---|---|
| CheXlocalize | AIMI 页、论文正文 | ✓ 规范写法 |
| cheXlocalize | GitHub 仓库名 | ✓ 仓库名小写首字母 |
| cheXplanation | 旧仓库路径 | 重定向,非数据集名 |
| CheXplanation | 仓库 logo 文件名 | 品牌旧名 |
检索时用 CheXlocalize(大小写不敏感的核心词)即可,但引用仓库时的 rajpurkarlab/cheXlocalize 需保留其大小写。
附录 AU:结论的置信区间怎么读
论文报告百分比差距时都带 95% CI,读法:
| 数字 | 点估计 | 95% CI | 解读 |
|---|---|---|---|
| mIoU 平均差距 | 24.0% | 18.2%–29.6% | 区间不含 0,显著 |
| Lung Lesion mIoU | 76.2% | 59.1%–87.5% | 区间宽(样本少),但下界仍高 |
| hit rate 平均差距 | 29.4% | 23.1%–35.5% | 显著 |
| Lung Lesion hit rate | 65.9% | 35.3%–91.7% | 区间很宽,提示小样本不确定性 |
读法要点:CI 越宽表示该类别的样本越少、估计越不稳——Lung Lesion 的 hit rate CI 宽达 35–92 就是例证。引用时带上 CI 比只抄点估计更严谨。
附录 AV:从"标注成本"看数据集的定位
| 标注类型 | 单位成本 | 可规模化性 | 代表 |
|---|---|---|---|
| 图级标签 | 极低(可弱监督) | 极高 | CheXpert(NLP 抽标签) |
| 框级 | 中 | 中 | VinDr-CXR |
| 像素级单病种 | 高 | 低 | SIIM-ACR |
| 像素级多病理 | 极高 | 极低 | CheXlocalize(902 图) |
这张表解释了"为什么 CheXlocalize 只有 902 张"——像素级多病理是成本最高的标注形态,注定规模小。它的价值也因此落在"精度与基准"而非"规模"上。任何期待"大规模像素级胸片训练集"的项目,都应把 CheXlocalize 定位为测试集/验证集而非训练集。
附录 AW:可解释性评测的三个层次
CheXlocalize 实际上把可解释性评测分了三层,逐层递进:
| 层次 | 问题 | 本数据集如何回答 |
|---|---|---|
| L1 定位正确性 | 热图指到病灶了吗? | mIoU + hit rate |
| L2 差距归因 | 差在哪类病灶、为什么? | 几何特征回归 + 置信度回归 |
| L3 临床可靠性 | 能用它验证临床决策吗? | 结论:暂不可靠,需高分辨率方法 |
引用时按层次区分:L1 是数据事实,L2 是统计发现,L3 是作者判断。把 L3 的"临床不可靠"当作 L1 的"机器定位完全不行",会过度引申——论文也承认 atelectasis/consolidation 上机器反超人类。
附录 AX:论文 Methods 关键参数速查
复现论文实验时的核心超参,逐项列明:
| 参数 | 取值 | 来源 |
|---|---|---|
| 输入分辨率 | 320 × 320(沿用 CheXpert/CheXNet) | 论文 Methods |
| 归一化 | 减 CheXpert 训练集均值、除标准差 | 论文 Methods |
| 损失 | 交叉熵 | 论文 Methods |
| 优化器 | Adam(β1=0.9, β2=0.999) | 论文 Methods |
| 学习率 | DenseNet121 1e-4;ResNet152 1e-5;Inception-v4 1e-5 | 论文 Methods |
| batch size | 16 | 论文 Methods |
| 集成 | 每架构 120 checkpoint 选 top-10/病理 | 论文 Methods |
| IoU bootstrap | 1000 次,取 2.5/97.5 百分位为 95% CI | 论文 Methods |
| Occlusion 窗口/步长 | 40 / 40 | 论文 Methods |
| box filter(IG/LRP/DeepLIFT) | k=100(DenseNet+IG)或 k=50(其余) | 论文 Methods |
这些参数是"复现论文数字"与"得到一个能跑的数字"之间的差——不按此复现,结果大概率对不上论文。
附录 AY:为什么 Grad-CAM 是七种里的"最好"
论文明确指出 Grad-CAM 整体定位最好,理解这个"最好"有助于定位方法选型:
| 原因线索 | 说明 |
|---|---|
| 梯度 + 特征图加权 | 直接利用分类头的空间信息,定位指向性强 |
| 末层特征保留空间结构 | 相比扰动法(Occlusion)噪声更低 |
| 相比分解法更抗噪 | LRP/DeepLIFT 的逐层反传在低分辨率下更易弥散 |
但"最好"是相对的——Grad-CAM 依然显著落后人类基线,且在小复杂病灶上差距最大。“七种里最好"不等于"足够好”,这是引用时最易被断章取义的一句。
附录 AZ:条目与"金标准/银标准分离"主题的呼应
本库多条目(TopAneu 金银双轨、REG² 双指标等)呈现"真值分层"主题,CheXlocalize 亦属同类:
| 层次 | CheXlocalize 对应 | 用途 |
|---|---|---|
| 金标准 | GT 分割(2 名高年资医师) | 绝对准不准 |
| 银标准/人类对照 | human benchmark 分割(3 名医师) | 相对人类差多少 |
与"概率化真值"路线的区别:CheXlocalize 走的是"多组专家 + 双基准"路线,而非"同一病灶概率分布"路线。两种路线都在处理"真值不是单点"的问题,只是抓手不同——前者靠"多加一组人",后者靠"多次采样聚合"。
附录 BA:术语表补充(进阶)
| 术语 | 释义 |
|---|---|
| box filtering | 盒滤波:对像素化热图做局部平均平滑(k 为核大小) |
| bilinear interpolation | 双线性插值:热图上采样到原图的插值方式 |
| confluent area | 汇合区:多实例被糊成一片连通区域的现象 |
| true positive slice | 真阳性切片:预测与真值分割都存在的样本子集 |
| macro AUROC | 宏平均 AUROC:各类别 AUROC 的算术平均 |
| Spearman correlation | 斯皮尔曼相关系数:捕捉非线性单调关联 |
| Bonferroni corrected p | 邦弗朗尼校正 p 值:多重比较校正 |
| min–max normalization | 最小最大归一化:把热图缩放到 [0,1] |
| confidence interval | 置信区间:bootstrap 经验分布的 2.5/97.5 百分位 |
| algorithmic artefact | 算法伪影:由算法/流程而非数据本身导致的系统性偏差 |
附录 BB:一图流(读法路线图)
你是哪类读者?
├── 下数据的人 ──────> §6 + 附录 D(登录→表单→SAS→Azure Storage Explorer)
├── 做定位评测的人 ──> §5 + 附录 F/G/H(7×3 矩阵 + eval 骨架 + 几何特征)
├── 做可解释性的人 ──> §7 + 附录 AH(三句结论 + 推理链)
├── 做临床落地的人 ──> §7.5 + 附录 R(自动化偏见 + 应用边界)
├── 写综述的人 ──────> §2.6 + §8.3 + 附录 N(定位赛道 + 库内对照)
└── 踩坑预警 ────────> §10 八个坑(坑 4 权重、坑 8 许可最易踩)
附录 BC:数据不能做什么(负向清单)
明确划出 CheXlocalize 的能力边界,避免误用:
| 想做 | 能否 | 原因 |
|---|---|---|
| 训通用胸片分类器 | ✗ | 仅 902 张,且与 train 不重叠,欠拟合 |
| 训像素级分割模型 | △ | 可训但样本少,宜作验证集 |
| 评测定位/解释方法 | ✓✓ | 设计初衷 |
| 做框级检测 | ✗ | 无框标注,只有像素级 |
| 做报告生成 | ✗ | 无报告文本 |
| 做图文 grounding | △ | 可作定位真值,但无图文对 |
| 评估罕见病定位 | ✗ | 仅 10 类常见观察 |
| 跨机构泛化研究 | △ | 标注者机构未披露,难做机构分层 |
附录 BD:三个"不要"(给论文作者)
- 不要把第三方转述当论文数据:nearly 900 / over 1,000 是 Lacuna 转述,论文是 902 图 / 643 条(坑 6)。
- 不要把页面许可标签当实际许可:页面写 Stanford RUA,记录挂 O-UDA(坑 8)。
- 不要照抄论文里的数据集 UUID:旧 UUID 404,用 README/AIMI 页的现行 UUID(坑 7)。
尾注
本条目为 AI-Ready Wikipedia 数据集条目,由 chexlocalize-verify-agent 于 2026-09-30 亲自完成 web 核验与撰写(非转抄任何既往 FACTS)。事实陈述以以下一手来源为准:Stanford AIMI 后端 API 记录(https://aimistanford-web-api.azurewebsites.net/datasets/23c56a0d-15de-405b-87c8-99c30138950c)、GitHub 仓库 README/LICENSE/sample(经 jsDelivr 镜像取得)、Nature Machine Intelligence 论文 PDF(https://www.nature.com/articles/s42256-022-00536-x.pdf)、CrossRef 元数据(https://api.crossref.org/works/10.1038/s42256-022-00536-x)、Zenodo 记录(https://zenodo.org/records/6973536)、PhysioNet 站点实测。
与旧版 FACTS 的出入已逐条存照:许可(O-UDA 1.0 而非 Stanford RUA)、权重托管(Google Drive 而非 PhysioNet)、预印本(medRxiv 而非 arXiv)、GT 标注者机构(论文未披露,非 Stanford Radiology)、规模口径(643 条而非 over 1,000)、数据集 UUID(旧 UUID 失效)、病理名双口径(Lung/Airspace Opacity)。原始文档缺陷(页面许可标签与记录不一致、论文 UUID 404、README 权重托管错记)已在 §10 坑点与附录 L 双记表存照。条目与库内 chexpert(rid 5)、mimic-cxr(rid 16)、chest-imagenome(rid 330)、padchest(rid 117)、ms-cxr(rid 340)、vindr-cxr(rid 125)等条目互链,构成胸片定位与可解释性评测家族的检索面。后续维护触发点见附录 S。
核验边界声明:GitHub 主站与 Google Drive 在本核验环境被网络策略屏蔽(curl 返回 000),相关事实经 jsDelivr 镜像与 README 文本取得,未能直接读取仓库 last-commit 时间与权重文件夹内容;GitHub 最后提交时点、权重实际可下载性两项列入 §9 待核(FACTS.md)。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- siim-acr-pneumothorax — 共享标签:医学影像 / X光影像 / 医学图像分割 / 评测基准
- chexmask-cxr-segmentation-data — 共享标签:医学影像 / X光影像 / 医学图像分割
- chexmask-u — 共享标签:医学影像 / X光影像 / 医学图像分割
- lung-segment-mimic-cxr — 共享标签:医学影像 / X光影像 / 医学图像分割
- mimic-cxr-ext-ils — 共享标签:医学影像 / X光影像 / 医学图像分割
- cxr-lt — 共享标签:医学影像 / X光影像 / 评测基准 / 肺癌
- brixia-peru — 共享标签:医学影像 / X光影像 / 医学图像分割 / 评测基准
- rexgrounding-ct — 共享标签:医学影像 / 医学图像分割 / 评测基准 / 肺癌
- icbhi-2017 — 共享标签:医学影像 / X光影像 / 评测基准
- rexgradient-160k — 共享标签:医学影像 / X光影像 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

