信息速览
Cardiac Implantable Electronic Devices in Chest X-Rays — AI-Ready 数据集百科
一句话:这是一份为"设备识别"而生的胸片数据集——896 名患者的 13,393 张图像,其中 2,321 张是影像科的正规胸片(金标准),另外 11,072 张是用 5 种手机从显示器上翻拍的。它要解决的真实问题是:基层医院的医生用手机拍下屏幕,能不能自动认出这是什么型号的心脏设备?
INFOBOX
| 属性 | 值 |
|---|---|
| 官方名称 | Dataset for Segmentation and Classification of Cardiac Implantable Electronic Devices in Chest X-Rays |
| 发布方 | PhysioNet |
| 版本 | v1.0.0(2025-03-04 发布) |
| DOI | 10.13026/swv0-cd11 |
| RRID | SCR_007345 |
| 机构 | Charité – Universitätsmedizin Berlin(柏林夏里特大学医学院) |
| 作者 | Keno Bressem, Felix Busch, Andrei Zhukov, Lisa Adams |
| 图像总数 | 13,393 |
| 正规胸片 | 2,321(DICOM→PNG,金标准) |
| 手机翻拍 | 11,072 |
| 患者数 | 896 |
| 设备型号 | 27 个(4 家制造商);model 字段 28 类(含 Other) |
| 手机机型 | 5 种(iPhone 13 mini / Galaxy S4 / iPhone 8 / iPhone 13 / Galaxy S5) |
| 采集期 | 2012-01 至 2022-01(约十年) |
| 标注工具 | 3D Slicer |
| 标注者 | 2 位认证放射科医师(7-9 年经验) |
| 掩码语义 | 0=背景 / 1=PM 或 ICD / 2=事件监测器 |
| 任务 | 设备分割 + 制造商分类 + 型号识别 |
| 划分 | 训练/验证/测试(患者级) |
| 伦理 | IRB 批准 EA4/042/20,知情同意豁免 |
| COI | None |
| 关联论文 | 官方未列(仅方法学背景引用) |
| 代码 | github.com/AndreasZhukov/cied |
| 适合任务 | 设备分割、型号分类、移动端识别、迁移学习 |
§0 速览与信任声明:为什么"认设备"是一个真问题
植入式心脏电子设备(CIED)包括起搏器、植入式除颤器(ICD)、心脏再同步治疗设备(CRT)与植入式心电事件监测器(ICM)。这些设备在胸片上都有可见的影像特征——但它们长得太像了。
三条速览结论:
-
"认不出型号"有真实的临床后果。
- MRI 安全性:不同型号的 MRI 兼容性不同,磁共振检查前必须确认设备型号。认错了可能导致严重伤害;
- 设备召回:厂商召回针对特定型号批次,没有型号就无法判断患者是否受影响;
- 程控与随访:不同型号的程控仪与参数不同;
- 急诊场景:患者昏迷、无病历、只有一张胸片时,型号识别是第一道关卡。
-
这份数据集直面"真实场景的粗糙"。它不只提供干净的 DICOM 胸片,还提供了 11,072 张手机照片——用 5 种不同手机、从显示器上以不同角度拍摄、每张最多拍 5 次。这模拟的是基层医院的真实工作流:没有 PACS、没有 DICOM 工作站,医生拿手机拍下屏幕发给上级或上传系统。这是一个极少有数据集愿意面对的场景,因为手机翻拍会引入透视畸变、摩尔纹、反光、色彩偏移等一系列问题。
-
它把任务分成三层,而不是一个笼统的"分类":
- 分割(像素级:设备在哪里)——三值掩码区分背景、PM/ICD、事件监测器;
- 制造商分类(4 类:哪家厂商);
- 型号识别(27 类:具体哪个型号)。
这三层的难度差异巨大(4 分类 vs 27 分类),分开评测才看得出模型到底学到了什么。
必须立刻说清的边界:
- 官方页面未声明访问级别与许可条款——这是一个必须警惕的规范缺失;
- 官方未列正式关联论文,只有 7 条方法学背景参考文献(均无 DOI/PMID);
- 单中心数据(柏林夏里特),且只覆盖 4 家大厂商;
- 约 10% 图像归入 “Other” 类,稀有设备样本不足。
0.1 名称与范围勘误
- CIED 的定义:Cardiac Implantable Electronic Device,心血管植入式电子设备。包含四类:
- PM(Pacemaker):起搏器
- ICD(Implantable Cardioverter-Defibrillator):植入式心脏复律除颤器
- CRT(Cardiac Resynchronization Therapy):心脏再同步治疗设备(分 CRT-P 与 CRT-D)
- ICM(Insertable Cardiac Monitor):植入式心电事件监测器,如 Reveal LINQ/XT、Confirm Rx、SJM Confirm
- 掩码语义要注意:像素值 1 表示 PM 或 ICD 合并(不细分),2 表示 event monitor。也就是说分割任务只有三个类,不是四类或更多。
- “event monitor” 与 ICM 同义:官方用 event monitor 一词,模型型号列表里对应的产品名是 Reveal LINQ、Reveal XT、Confirm Rx DM3500、SJM Confirm。
0.2 一分钟版本(给赶时间的管理者)
- 这是什么:胸片中的心脏植入设备分割 + 识别数据集;
- 谁做的:柏林夏里特大学医学院影像科;
- 规模多大:896 名患者、13,393 张图像(2,321 张胸片 + 11,072 张手机翻拍);
- 有多少种设备:4 家制造商、27 个型号;
- 数据在哪:PhysioNet(DOI 10.13026/swv0-cd11);
- 最亮的点:手机翻拍子集——直接对应"基层用手机拍屏幕识别设备"的真实需求;
- 最大的坑:官方未声明许可条款;无正式关联论文;单中心;约 10% 归入 Other 类。
0.3 与本系列既有条目的关系
| 条目 | 关系 |
|---|---|
| 496 NIHSS | 496 从文本抽结构化数值;499 从影像做分割与分类——两个"从非结构化到结构化"的平行案例 |
| 497 Health Gym | 497 关注"数据可公开";499 关注"图像识别",但两者都面对"真实场景的粗糙"(合成失真 vs 手机翻拍失真) |
| 498 浙江 EHR | 498 是结构化 EHR;499 是影像——同一患者的两类数据在真实场景中并存(胸片 + 设备随访记录) |
| 其他影像条目 | 499 是唯一的"设备/植入物识别"影像数据(区别于病灶/器官分割) |
§1 背景:从"认出这个盒子"到"移动端床边识别"
1.1 CIED 的临床重要性
心血管植入式电子设备(CIED)是现代心脏病学的支柱。四类设备的适应症各不相同:
| 设备 | 全称 | 主要适应症 |
|---|---|---|
| PM | Pacemaker 起搏器 | 症状性心动过缓、传导阻滞 |
| ICD | Implantable Cardioverter-Defibrillator | 心脏性猝死的一级/二级预防 |
| CRT | Cardiac Resynchronization Therapy | 心衰合并心室失同步(CRT-P 不带除颤、CRT-D 带除颤) |
| ICM | Insertable Cardiac Monitor | 不明原因晕厥、房颤检测 |
设备数量巨大:以参考文献报告的数据,全球每年植入量以百万计(ICD 与 CRT 在美国每年数十万例)。这意味着任何医院的胸片库里都有大量 CIED 影像。
1.2 为什么"识别型号"是刚需
三个真实的临床场景:
场景一:MRI 检查前的安全确认
MRI 强磁场对 CIED 有潜在危险(导线发热、设备移位、程序紊乱)。虽然现代很多型号是 “MRI Conditional”(条件性兼容),但兼容性依型号而不同,且往往要求特定条件(如特定体位、限制 SAR 值)。放射科在安排 MRI 前必须确认设备型号。若患者无病历(如急诊、外院转入),只能靠胸片。
场景二:厂商召回
CIED 召回事件并不罕见(导线断裂、电池提前耗尽、固件缺陷)。召回通告通常针对特定型号甚至特定批次。若无法从影像确认型号,就无法判断患者是否受影响。
场景三:程控与随访
不同厂商、不同型号使用不同的程控仪与软件。识别型号是程控前的第一步。
1.3 为什么人工识别难
对非心电专科的放射科医师或急诊医师而言,区分 27 个型号极其困难:
- 影像特征细微:设备轮廓相似(都是圆角矩形或椭圆形),区别在于尺寸、标记形状、导线接口位置的细节;
- 投照条件影响:体位、曝光、设备与胶片的相对位置都会改变外观;
- 型号繁多:仅本数据集就覆盖 4 厂商 27 型号,现实中更多;
- 知识更新快:新机型不断上市;
- 胸片质量参差:急诊床旁片、旋转体位、曝光不足等。
这正是计算机视觉应该介入的地方——它擅长捕捉人眼难以稳定分辨的细微纹理与形状差异。
1.4 已有研究基础
本数据集的参考文献中列出了几项前期工作,构成领域脉络:
| 研究 | 年份 | 贡献 |
|---|---|---|
| Weinreich et al. | 2019 | 用深度 CNN 在胸片上进行植入设备检测与识别 |
| Howard et al. | 2019 | 用神经网络识别心脏节律设备(JACC Clin Electrophysiol) |
| Kim et al. | 2021 | 深度学习检测与表征 CIED 的 MRI 安全性(Korean J Radiol) |
| Lauzier et al. | 2023 | 用半监督 AI 在大型胸片数据集中检测与识别 CIED(Heart Rhythm) |
这些工作说明:"AI 识别 CIED"已是一个有积累的方向,但普遍缺少公开数据集。499 填补的正是这个空缺——它把数据开放出来,让不同方法可以公平比较。
1.5 为什么智能手机翻拍是关键增量
这是 499 最独特的设计。11,072 张手机照片全部是从显示器上翻拍的——不是打印胶片,不是原始 DICOM,而是对着一块亮着的屏幕拍照。
这个场景的真实性在哪里?
- 基层医院:很多基层机构没有 PACS 终端,医生习惯对着屏幕用手机拍照,然后通过微信等渠道发送给上级医院或同事会诊;
- 会诊与转诊:患者转院时,影像资料常以手机拍照形式传递;
- 教学与讨论:临床病例讨论中,手机拍屏是常见的资料传递方式;
- 远程医疗:移动医疗应用需要处理用户上传的手机照片。
为什么这个场景难?
| 失真类型 | 成因 |
|---|---|
| 透视畸变 | 手机与屏幕不平行 |
| 摩尔纹 | 相机传感器与屏幕像素阵列干涉 |
| 反光与眩光 | 屏幕表面的环境光反射 |
| 色彩偏移 | 屏幕色温与相机白平衡 |
| 分辨率损失 | 屏幕像素密度限制 |
| 边缘裁切 | 拍摄取景不全 |
这六类失真是数据增强难以完全模拟的——最好的办法就是真的拍。499 提供了真实的翻拍数据,使研究者可以:
- 直接在手机上验证模型;
- 研究"翻拍对性能的影响"(对比 originals 子集);
- 做域适应研究(DICOM 域 → 手机域)。
更妙的是手机型号分布本身就是一个变量——5 种机型覆盖了从低端(Galaxy S4,2013 年)到当时的旗舰(iPhone 13,2021 年),跨越 8 年的手机影像技术差异。这使"机型对识别性能的影响"成为一个可研究的课题。
1.6 数据采集的时间与规模
- 时间跨度:2012-01 至 2022-01,约十年;
- 患者数:896;
- 图像数:13,393。
从这些数字可以推算平均每人画像数:
- 2,321 / 896 ≈ 2.6 张原始胸片/患者;
- 11,072 / 2,321 ≈ 4.8 张手机照片/胸片(与"每张最多拍 5 次"的描述一致)。
这个比例设计很有讲究:每一张正规胸片配约 5 张不同手机、不同角度的翻拍。这样可以在"原始图 → 翻拍图"之间建立对应关系,支持成对研究。
1.7 团队与机构
- 机构:Charité – Universitätsmedizin Berlin(柏林夏里特大学医学院)——欧洲最大的大学医院之一,医学影像研究实力强;
- 作者:Keno Bressem(影像 AI 领域活跃研究者)、Felix Busch、Andrei Zhukov(代码仓库维护者)、Lisa Adams;
- 伦理:IRB 批准 EA4/042/20,回顾性匿名化数据豁免知情同意。
1.8 数据的匿名化流程
499 的匿名化流程值得完整记录,因为它包含了烧录信息的处理:
- 稀有 CIED 类型归入不同类别(降低唯一性);
- 中心裁剪去除烧录的患者信息(胸片四角的文字层);
- OCR 算法涂黑残留信息;
- 人工复查并手动删除;
- 重新匹配并用随机新 ID 替换原 ID;
- 删除患者 ID、检查 ID 及所有标识符。
第 2-4 步特别重要:医学影像的烧录信息(burned-in annotation)是隐私泄露的常见途径——胸片角落常印有姓名、ID、日期。检测并移除它是影像去标识化的标准步骤,但OCR + 人工复核的组合是较可靠的做法(纯 OCR 会漏)。
1.9 这份数据的三个任务层级
| 层级 | 任务 | 类别数 | 难度 |
|---|---|---|---|
| 1 | 设备分割(像素级) | 3(背景/PM-ICD/监测器) | 中 |
| 2 | 制造商分类 | 4 | 较低 |
| 3 | 型号识别 | 27(+Other = 28) | 高 |
为什么分层有意义:
- 制造商分类相对容易(同一厂商的产品有家族相似性,如 Medtronic 的圆角矩形、Biotronik 的特定标记);
- 型号识别很难(同厂商内不同型号的差异极细微);
- 中间可能还有"设备类型"层级(PM/ICD/CRT/ICM),这是临床上最有意义的一层(决定 MRI 安全性与治疗功能),但官方未单列为分类标签——这是数据集的语义与官方 structured 标签之间的一个落差(掩码里只分了 PM/ICD 与 monitor)。
1.10 用户画像
| 用户类型 | 典型诉求 | 本数据集能提供 |
|---|---|---|
| 影像 AI 研究者 | 需要分割 + 分类的公开数据 | 13,393 张图像 + 三值掩码 + 两级分类标签 |
| 移动医疗工程师 | 需要真实手机拍摄的影像 | 11,072 张 5 机型翻拍图 |
| 心电生理医师 | 想验证 AI 能否辅助认设备 | 27 型号标签 + 患者级划分 |
| 域适应研究者 | 需要跨域配对数据 | 原始图 + 翻拍图成对 |
| 教学者 | 需要完整的影像 AI 案例 | 分割 + 分类双任务 |
| 医疗设备管理人员 | 关注召回与型号核对 | 型号识别任务 + 临床意义明确 |
1.11 使用前的三条提醒
- 先确认访问级别——官方页面未声明,PhysioNet 上的实际条款可能与其他数据集不同(存照 A);
- 不要期待官方论文——无正式关联论文,方法需要自行设计(存照 D);
- 注意掩码的可视化陷阱——8-bit PNG 中 0 与 2 对比度极小,肉眼看像全黑,必须用 numpy 读(存照 K)。
1.12 阅读本条的路线建议
- 想判断能否用:读 §0.2 + §1.9 三个任务层级 + §3 规格;
- 想装载数据:读 §5 装载与掩码读取(含像素值陷阱);
- 想研究手机翻拍:读 §6.5 + §6.9 域适应;
- 想了解设备类型:读 §2 领域概念;
- 想找数字:读 INFOBOX、§4 划分、§10 存照。
§2 领域概念:CIED 设备、胸片影像与识别任务
2.1 四类设备的外观特征
| 设备类型 | 典型外形 | 影像特征 | 本数据集中的型号举例 |
|---|---|---|---|
| PM(起搏器) | 圆角矩形/椭圆,体积小 | 通常位于锁骨下区,1-2 条导线 | Attesta DR、Enticos 4 DR、Q20 SR、Enticos 4 SR |
| ICD(除颤器) | 比 PM 大,更厚 | 导线更粗(除颤线圈),有时可见 shock coil | Mirro MRI VR、Ellipse VR、Ilivia 7 VR-T、Inogen EL ICD |
| CRT(再同步) | 最大,常有三条导线 | 左室导线走冠状静脉窦,位置特殊 | Serena Quad CRT-P、Compia MRI Quad CRT-D、Charisma X4、Quadra Allure |
| ICM(事件监测器) | 极小,柱状/胶囊状 | 位于胸骨旁皮下,无导线入心 | Reveal LINQ、Reveal XT、Confirm Rx DM3500、SJM Confirm |
"型号识别"的难点在同类内部:同为 Medtronic 的双腔起搏器,Attesta DR 与 Ensura DR 的外观差异极小,区别可能在边缘倒角、标记位置等细节。
2.2 设备命名的密码
理解型号命名有助于理解数据集的类别体系:
| 字段 | 含义 | 例子 |
|---|---|---|
| 系列名 | 厂商起的商品名 | Attesta, Enticos, Reveal |
| 腔数 | SR(单腔)/ DR(双腔) | Enticos 4 DR vs Enticos 4 SR |
| 功能 | VR(心室除颤)/ HF(心衰/CRT) | Ilivia 7 VR-T vs Ilivia 7 HF-T |
| 代数 | 数字 | Enticos 4, Q20 |
| 特性后缀 | MRI SureScan(MRI 兼容)、QP(Quadripolar) | Mirro MRI SureScan |
“MRI SureScan” 是一个重要的标识——它表示该型号通过 MRI 兼容认证,这正是"识别型号"临床价值的直接来源。
2.3 胸片影像的基本解剖
要在胸片上找设备,需先理解胸片的结构:
| 结构 | 位置 | 与设备的关系 |
|---|---|---|
| 锁骨 | 上胸部两侧 | 设备常植于锁骨下 |
| 肺野 | 两侧大片透亮区 | 设备常位于肺野上外侧 |
| 心影 | 中央偏左的致密影 | 导线走向此处 |
| 纵隔 | 中央 | 导线路径 |
| 膈肌 | 下方弧形 | 参考标志 |
设备通常在:左或右锁骨下区(胸大肌下或皮下)。导线从设备出发,经锁骨下静脉、上腔静脉进入右心房/右心室(起搏器与 ICD),或经冠状静脉窦到左心室(CRT 的左室导线)。
2.4 分割任务的语义
499 的分割掩码只有三个像素值:
| 像素值 | 语义 | 说明 |
|---|---|---|
| 0 | 背景 | 除设备外的所有区域 |
| 1 | PM 或 ICD | 合并:起搏器与除颤器不细分 |
| 2 | 事件监测器 | event monitor / ICM |
为什么 PM 与 ICD 合并?
合理推测:两者的影像特征(矩形/椭圆主体 + 导线)在分割任务上相似,且临床上都属于"有导线的植入设备";而 ICM 是无导线的胶囊状物,形态差异明显,值得单列。
这个设计的含义:分割任务实际上是"找出所有设备 + 区分有无导线"——比"区分四类设备"简单,但已能满足"设备在哪里"的需求。
2.5 掩码的可视化陷阱(必须知道的实操细节)
官方明确提示:PNG 为 8-bit,像素值 0 与 2 的差异在肉眼看来几乎不可见。
原因:
- 0 = 纯黑(RGB 0,0,0);
- 2 = 极暗灰(RGB 2,2,2);
- 在 0-255 的灰度范围里,2 与 0 的差异是 0.8%——人眼完全无法分辨。
后果:
- 用图片查看器打开掩码,看到的是"全黑图";
- 会误以为掩码是空的或生成失败;
- 只有像素值 1(RGB 1,1,1)稍微亮一点点,同样几乎不可见。
正确读法:
import numpy as np
from PIL import Image
mask = np.array(Image.open('seg_masks/xxx.png'))
print(np.unique(mask)) # [0 1 2]
print((mask == 1).sum()) # 设备像素数
print((mask == 2).sum()) # 监测器像素数
# 可视化:重映射为可见颜色
vis = np.zeros((*mask.shape, 3), dtype=np.uint8)
vis[mask == 0] = [0, 0, 0] # 背景黑
vis[mask == 1] = [255, 80, 80] # 设备红
vis[mask == 2] = [80, 160, 255] # 监测器蓝
这个陷阱值得单列一节,因为它是使用者第一分钟就会遇到的挫败点——看到一个"全黑的掩码"然后怀疑数据有问题。
2.6 手机翻拍的六类失真
| 失真 | 成因 | 对识别的影响 |
|---|---|---|
| 透视畸变 | 手机与屏幕不平行 | 设备形状变形 |
| 摩尔纹 | 传感器与屏幕像素干涉 | 引入周期性纹理噪声 |
| 反光眩光 | 环境光在屏幕反射 | 局部区域过曝、细节丢失 |
| 色彩偏移 | 屏幕色温 + 白平衡 | 灰度关系改变 |
| 分辨率损失 | 屏幕像素密度限制 | 细节模糊 |
| 边缘裁切 | 取景不全 | 设备可能被部分截断 |
注意第六条的严重性:如果取景时裁掉了一部分设备,那么分割任务的目标就不完整——这可能是翻拍子集的分割性能低于 originals 子集的原因之一。
2.7 域与域适应
在 499 的语境中,"域"有两个:
- 源域(source domain):正规胸片(originals);
- 目标域(target domain):手机翻拍图。
理想的应用是"在源域训练、在目标域工作"(因为标注只在源域可靠)。但域差异会导致性能下降。常用的域适应方法:
| 方法 | 思路 |
|---|---|
| 数据增强 | 模拟翻拍失真(透视变换、噪声、模糊) |
| 风格迁移 | 把源域图像转为目标域风格 |
| 对抗域适应 | 用对抗训练对齐两域的特征分布 |
| 自监督预训练 | 在目标域无标注数据上预训练 |
| 测试时适应 | 推理时根据目标样本调整模型 |
499 的独特价值:它提供成对的源域与目标域数据(每张原始图配约 5 张翻拍图),使域适应研究可以直接量化"域差异有多大"。
2.8 类别不平衡与 “Other”
从划分表可以看出严重的不平衡:
| 型号 | 图像数 |
|---|---|
| Q20 SR MRI SureScan | 342 |
| Attesta DR MRI SureScan | 263 |
| Mirro MRI VR SureScan | 237 |
| Confirm Rx DM3500 | 137 |
| Enticos 4 DR | 111 |
| … | … |
| Etrinsa 8 HF-T | 22 |
| Ilivia 7 HF-T QP | 22 |
| Enitra 6 DR-T | 20 |
| SJM Confirm | 26 |
最多 342 vs 最少 20,相差 17 倍。这对 27 类分类是显著挑战:
- 稀有类别的召回可能极低;
- 模型可能倾向预测高频类;
- 必须报 per-class 指标(不能只报总体准确率)。
此外,“Other” 类是四家厂商各自的兜底类(Medtronic 84、Biotronik 93、Abbott 18、Boston Scientific 39,合计 234),占 2,321 张原始图的约 10%。这类样本本质上是异构的(包含了各种稀有型号),它既难学也难评测——“Other” 内部没有共同特征。
2.9 患者级划分的意义
data.json 的 pat_id 明示是"用于划分数据"。这意味着划分是患者级的——同一患者的所有图像(原始 + 翻拍)都在同一个集合里。
这是正确且必要的做法:
- 若同一患者的图像跨越训练/测试集,模型可能记住该患者的特征(如设备位置、体型)而非学会识别型号;
- 尤其是同一张原始图与其 5 张翻拍图若分处训练与测试,会造成严重的"近重复泄漏"。
499 在划分上做了正确的事,这一点值得肯定(虽然官方未明示各集合的患者数,存照 J)。
2.10 任务评价指标
| 任务 | 主指标 | 说明 |
|---|---|---|
| 分割 | Dice 系数 / IoU | per-class,注意类别极不平衡(背景占绝大多数像素) |
| 制造商分类 | 准确率 + 混淆矩阵 | 4 类,相对平衡 |
| 型号识别 | macro-F1 + per-class F1 | 27-28 类,严重不平衡,macro-F1 优先 |
| 分割+分类端到端 | 型号识别的 macro-F1 | 最终目标 |
为什么型号识别要用 macro-F1:因为类别不平衡时,accuracy 会被高频类主导。macro-F1 对每个类等权,更能反映"对小类的识别能力"——而临床上的罕见型号恰恰是最需要识别的(召回通知中的设备往往是小众型号)。
2.11 名词速查表
| 缩写/术语 | 全称 | 含义 |
|---|---|---|
| CIED | Cardiac Implantable Electronic Device | 心血管植入式电子设备(总称) |
| PM | Pacemaker | 起搏器 |
| ICD | Implantable Cardioverter-Defibrillator | 植入式心脏复律除颤器 |
| CRT | Cardiac Resynchronization Therapy | 心脏再同步治疗(CRT-P 不带除颤,CRT-D 带) |
| ICM | Insertable Cardiac Monitor | 植入式心电事件监测器 |
| SR / DR | Single / Dual chamber | 单腔 / 双腔 |
| VR / HF | Ventricular / Heart Failure | 心室(除颤)/ 心衰(CRT 功能) |
| QP | Quadripolar | 四极导线 |
| MRI SureScan | — | 厂商的 MRI 兼容认证标识 |
| DICOM | Digital Imaging and Communications in Medicine | 医学影像标准格式 |
| Dice | Dice Similarity Coefficient | 分割评价指标(2×交集/并集) |
| IoU | Intersection over Union | 交并比 |
| IRB | Institutional Review Board | 机构审查委员会 |
| SAR | Specific Absorption Rate | 比吸收率(MRI 安全参数) |
| OCR | Optical Character Recognition | 光学字符识别(用于涂黑烧录信息) |
2.12 一个必须澄清的误解
误解:「13,393 张图像,那这个数据集挺大的。」
澄清:要分清图像数与独立样本数。
- 13,393 张图像对应 896 名患者;
- 其中只有 2,321 张是独立的原始胸片(每患者平均 2.6 张);
- 另外 11,072 张是这些胸片的翻拍副本,不提供新的患者信息。
因此:
- 用于训练:13,393 张都有用(增强数据多样性,尤其学"翻拍失真");
- 用于评测泛化:有效的独立样本量接近 2,321(甚至 896 患者);
- 报告的测试集性能,其统计置信区间应按患者数(896)而非图像数计算。
这个区分至关重要——把翻拍图当独立样本会严重低估性能的不确定性。
§3 数据规格与获取:目录结构、元数据与像素级掩码
3.1 目录结构
.
├── README.md # 数据说明
├── originals/ # 2,321 张正规胸片(DICOM→PNG,金标准)
├── galaxys4/ # 1,675 张三星 Galaxy S4 翻拍
├── galaxys5/ # 2,910 张三星 Galaxy S5 翻拍
├── iphone8/ # 2,890 张 iPhone 8 翻拍
├── iphone13/ # 2,902 张 iPhone 13 翻拍
├── iphone13mini/ # 695 张 iPhone 13 mini 翻拍
├── seg_masks/ # 分割掩码(PNG,像素值 0/1/2)
└── data.json # 元数据(pat_id / fname / dataset / manufacturer / model / seg_mask)
3.2 五个手机目录的分布与含义
| 目录 | 机型 | 张数 | 占比 | 发布年 | 影像特性 |
|---|---|---|---|---|---|
| galaxys4 | Samsung Galaxy S4 | 1,675 | 12.5% | 2013 | 低端、低分辨率 |
| galaxys5 | Samsung Galaxy S5 | 2,910 | 21.7% | 2014 | 中端 |
| iphone8 | iPhone 8 | 2,890 | 21.5% | 2017 | 中高端 |
| iphone13 | iPhone 13 | 2,902 | 21.6% | 2021 | 旗舰 |
| iphone13mini | iPhone 13 mini | 695 | 5.2% | 2021 | 旗舰小屏 |
这个分布本身是一个实验设计:机型跨越 2013-2021 共 8 年,覆盖低端到旗舰。这使"机型质量对识别性能的影响"成为可研究的课题——预期低端机(Galaxy S4)的翻拍质量更差,模型的识别性能可能更低。
注意 iPhone 13 mini 只有 695 张(5.2%),明显少于其他四款(均约 2,000-2,900)。这个不均衡可能反映拍摄计划的安排,也可能反映某批数据未纳入。使用时若做"按机型分层评测",mini 的样本量偏少。
3.3 data.json 的六个字段
| 字段 | 类型 | 语义 | 用途 |
|---|---|---|---|
| pat_id | string | 匿名患者 ID | 患者级划分、跨图像关联 |
| fname | string | 图像文件名(SHA256 样式哈希) | 主键 |
| dataset | enum | 来源目录名 | 域标识(originals vs 手机) |
| manufacturer | enum | 制造商(4 类) | 制造商分类标签 |
| model | enum | 型号(27 + Other) | 型号识别标签 |
| seg_mask | string | 对应掩码文件名 | 分割监督 |
fname 使用哈希命名(如 fe40d960c739bbbd3002d1759155bad92d3818b5ec88e459117e64c6df2a0fb2.png)——这是去标识化的一部分:文件名不含患者信息、不含日期、不暗示顺序。
3.4 从 dataset 字段能做的分层分析
dataset 字段天然定义了六个子集,可支持多种分析:
| 分析 | 方法 |
|---|---|
| 域对比 | originals vs 所有手机目录 |
| 机型对比 | 五个手机目录两两比较 |
| 时代对比 | Galaxy S4/S5(2013-14)vs iPhone 13 系列(2021) |
| 平台对比 | 三星 vs 苹果 |
| 增强效果 | 用手机图训练 → 测 originals(反向域适应) |
3.5 分割掩码的技术规格
| 项 | 值 |
|---|---|
| 格式 | PNG(8-bit) |
| 颜色 | 单通道灰度(0/1/2) |
| 命名 | 与对应原图同名(推测) |
| 数值语义 | 0=背景,1=PM/ICD,2=event monitor |
关键实操提示(重复强调):0 与 2 的视觉差异是 0/255 vs 2/255,肉眼不可辨。必须用 numpy 读取。
3.6 访问获取与前置确认
| 步骤 | 动作 | 备注 |
|---|---|---|
| 1 | 访问 PhysioNet 页面 /content/cardiac-implantable-device-cxr/1.0.0/ |
— |
| 2 | 确认访问级别与许可条款 | 页面未声明,须在下载页实际确认(存照 A/B) |
| 3 | 接受条款并下载 | — |
| 4 | 校验文件完整性 | 官方未提供 MD5(与 498 不同) |
第 2 步是本数据集特有的必备步骤。因为官方页面未在正文中声明访问级别,使用者不能假设它是 Open Access——必须到 PhysioNet 的下载界面查看实际条款。
3.7 引用要求
| 层级 | 引用对象 |
|---|---|
| 数据集 | Bressem K, Busch F, Zhukov A, Adams L. PhysioNet. 2025. DOI 10.13026/swv0-cd11 |
| 代码 | github.com/AndreasZhukov/cied |
| 平台 | Pollard T, et al. Nature Health. 2026. DOI 10.1038/s44360-026-00096-z |
| 背景方法(建议) | Howard et al. 2019;Lauzier et al. 2023 |
注意:官方未提供关联论文,因此"引用数据集 + 引用代码仓库 + 引用平台"是主要的引用路径。
3.8 版本锚定
| 锚点 | 值 |
|---|---|
| 数据集版本 | v1.0.0 |
| 数据集 DOI | 10.13026/swv0-cd11 |
| 发布日期 | 2025-03-04 |
| 机构 | Charité – Universitätsmedizin Berlin |
| 代码仓库 | github.com/AndreasZhukov/cied |
| IRB | EA4/042/20 |
3.9 数据对账清单
下载后逐项验证:
- [ ] 七个图像目录存在(originals + 五个手机目录 + seg_masks);
- [ ] originals 下图像数为 2,321;
- [ ] 五个手机目录合计 11,072;
- [ ] 图像总数 13,393;
- [ ] data.json 可解析,含 6 个字段;
- [ ] data.json 中 pat_id 唯一值数为 896;
- [ ] manufacturer 有 4 个取值;
- [ ] model 有 28 个取值(27 型号 + Other);
- [ ] seg_masks 数量与 originals 数量一致(推测)或与有掩码的图一致;
- [ ] 抽样读取掩码,
np.unique返回[0 1 2]的子集。
最后一条是最关键的——它验证了掩码可用(而不是全 0 的空图)。
3.10 与 498 的规范对比
| 项 | 498 浙江 EHR | 499 CIED |
|---|---|---|
| 格式 | CSV | PNG(图像)+ JSON(元数据) |
| 完整性校验 | 提供 MD5 | 未提供 |
| 访问级别 | 明示开放获取 | 未声明 |
| 许可条款 | 未列具体协议 | 未列 |
| 关联论文 | 有(Sci Data 2023) | 无 |
| 数据量 | 3.22 GB | 图像数多,体积视分辨率而定 |
| 划分 | 未提供 | 提供(患者级) |
一个有意思的互补:498 在许可与论文上更规范但缺划分;499 提供了划分但缺许可声明与论文。两者各自补上了对方的短板——这提醒我们:没有一份数据是完美的,使用前必须逐项核查。
3.11 DAIMS 评估:6.2 / 8
| 维度 | 评分 | 依据 |
|---|---|---|
| 文档完备性 | 0.7 | 官方页面给足规模、划分明细表、标注协议、伦理;但缺访问级别、许可、资助、论文 |
| 机器可读性 | 0.7 | PNG 图像 + JSON 元数据,标准格式;但掩码的可视化陷阱增加使用成本 |
| 标签质量透明度 | 0.9 | 标注者资质(2 位放射科医师,7-9 年经验)、工具(3D Slicer)、掩码语义全部公开;缺掩码张数 |
| 可访问性 | 0.6 | 访问级别未声明,使用前需确认;但已发布于 PhysioNet |
| 许可清晰度 | 0.2 | 未声明具体许可条款,是本条目最大短板 |
| 格式标准化 | 0.9 | PNG + JSON 均为标准格式;文件名哈希化规范 |
| 评测协议完备性 | 1.0 | 提供完整的患者级训练/验证/测试划分与逐型号明细,这是最强项 |
| 生态可持续性 | 0.6 | 有 GitHub 代码仓库,但无正式关联论文,学术沉淀较弱 |
| 合计 | 6.2 / 8 | 评测协议与标签透明度是标杆;许可清晰度与生态是短板 |
对比同系列:498(6.7)> 496(6.4)> 497(6.3)> 499(6.2)。499 得分最低的唯一原因是许可条款未声明——这是一个可以通过官方补充轻易修复的短板。
3.12 元数据速查
| 字段 | 值 |
|---|---|
| Title | Dataset for Segmentation and Classification of Cardiac Implantable Electronic Devices in Chest X-Rays |
| Version | 1.0.0 |
| Published | 2025-03-04 |
| DOI | 10.13026/swv0-cd11 |
| RRID | SCR_007345 |
| Authors | Keno Bressem; Felix Busch; Andrei Zhukov; Lisa Adams |
| Institution | Charité - Universitätsmedizin Berlin |
| Code | github.com/AndreasZhukov/cied |
| IRB | EA4/042/20 |
§4 数据结构与划分:27 个型号的全景
4.1 四家制造商的规模与格局
| 制造商 | 图像数 | 占比 | 型号数(含 Other) |
|---|---|---|---|
| Medtronic | 1,218 | 52.5% | 9 |
| Biotronik | 517 | 22.3% | 11 |
| Abbott(含 St. Jude Medical) | 401 | 17.3% | 6 |
| Boston Scientific | 185 | 8.0% | 5 |
| 合计 | 2,321 | 100% | 27 + 4 Other |
Medtronic 一家占了 52.5%——超过一半。这个不平衡有三个含义:
- 反映真实植入量:Medtronic 是全球最大的 CIED 厂商之一,市占率高;
- 对分类的影响:制造商分类任务基线(全猜 Medtronic)能得 52.5% 准确率——因此必须报 macro 指标;
- 对型号识别的影响:Medtronic 内部 9 个型号的区分成为主要挑战。
4.2 各厂商的型号明细与设备类型
Medtronic(1,218 张):
| 型号 | Total | 设备类型 |
|---|---|---|
| Q20 SR MRI SureScan | 342 | 单腔 PM |
| Attesta DR MRI SureScan | 263 | 双腔 PM |
| Mirro MRI VR SureScan | 237 | 单腔 ICD |
| Reveal LINQ | 94 | ICM |
| Serena Quad CRT-P MRI SureScan | 77 | CRT-P |
| Compia MRI Quad CRT-D SureScan | 51 | CRT-D |
| Ensura DR MRI SureScan | 39 | 双腔 PM |
| Reveal XT | 31 | ICM |
| Other | 84 | — |
Biotronik(517 张):
| 型号 | Total | 设备类型 |
|---|---|---|
| Enticos 4 DR | 111 | 双腔 PM |
| Enitra 8 HF-T QP | 79 | CRT-P |
| Enticos 4 SR | 48 | 单腔 PM |
| Ilivia 7 VR-T | 34 | 单腔 ICD |
| Rivacor 5 VR-T DX | 34 | 单腔 ICD |
| Ecuro SR-T | 29 | 单腔 ICD |
| Rivacor 7 HF-T QP | 25 | CRT-D |
| Ilivia 7 HF-T QP | 22 | CRT-D |
| Etrinsa 8 HF-T | 22 | CRT-P |
| Enitra 6 DR-T | 20 | 双腔 PM |
| Other | 93 | — |
Abbott / St. Jude Medical(401 张):
| 型号 | Total | 设备类型 |
|---|---|---|
| Confirm Rx DM3500 | 137 | ICM |
| Ellipse VR | 97 | 单腔 ICD |
| Quadra Allure MP | 84 | CRT-P |
| Quadra Assura MP | 39 | CRT-D |
| SJM Confirm | 26 | ICM |
| Other | 18 | — |
Boston Scientific(185 张):
| 型号 | Total | 设备类型 |
|---|---|---|
| Charisma X4 CRT-D | 64 | CRT-D |
| Valitude X4 CRT-P | 32 | CRT-P |
| Inogen EL ICD VR | 27 | 单腔 ICD |
| Origen Mini ICD | 23 | 单腔 ICD |
| Other | 39 | — |
4.3 设备类型维度的重构
把 27 个型号按设备类型重新归类,得到一个更临床的视角:
| 设备类型 | 涉及型号 | 图像数(估) |
|---|---|---|
| 单腔 PM(SR) | Q20 SR、Enticos 4 SR | ~390 |
| 双腔 PM(DR) | Attesta DR、Ensura DR、Enticos 4 DR、Enitra 6 DR-T | ~433 |
| 单腔 ICD(VR) | Mirro MRI VR、Ellipse VR、Ilivia 7 VR-T、Rivacor 5 VR-T DX、Ecuro SR-T、Inogen EL ICD VR、Origen Mini ICD | ~511 |
| CRT-P | Serena Quad、Enitra 8 HF-T QP、Quadra Allure MP、Valitude X4、Etrinsa 8 HF-T | ~294 |
| CRT-D | Compia Quad、Ilivia 7 HF-T QP、Rivacor 7 HF-T QP、Quadra Assura MP、Charisma X4 | ~201 |
| ICM | Reveal LINQ、Reveal XT、Confirm Rx、SJM Confirm | ~288 |
| Other | 各厂商兜底 | ~234 |
这个重构很有价值:虽然官方未提供"设备类型"标签,但可以从型号名派生。派生后的类型标签在临床上更有意义(MRI 安全性、治疗功能),且类别更平衡(6-7 类 vs 27 类),可以作为中间任务来辅助型号识别(层次分类:先分类型、再分型号)。
4.4 划分的完整数字
| 制造商 | 总计 | 训练 | 验证 | 测试 |
|---|---|---|---|---|
| Medtronic | 1,218 | 849 | 240 | 129 |
| Biotronik | 517 | 373 | 77 | 67 |
| Abbott | 401 | 279 | 78 | 44 |
| Boston Scientific | 185 | 124 | 35 | 26 |
| 合计 | 2,321 | 1,796 | 464 | 295 |
验证比例:1,796 / 464 / 295 ≈ 70% / 18% / 11%。
测试集只有 295 张图像——这是评测的关键约束:
- 27 类上平均每类约 11 张测试图;
- 稀有型号可能只有 1-2 张(如 SJM Confirm 测试集仅 1 张);
- 单张测试样本的 F1 波动极大——一个样本预测对错就改变一个类的 F1 从 0 到 1。
这意味着:报告的 per-class F1 在稀有类上不稳定,应报告置信区间或用 bootstrap 估计。
4.5 患者级划分的证据与含义
官方描述 pat_id 用于划分数据,这确认了划分的患者级性。但未给出各集合的患者数(存照 J)。
实际影响:若 896 名患者按 70/18/11 比例划分,大约是 627 / 161 / 108 名患者。测试集约 108 名患者承载 295 张图。
为什么这在统计上重要:模型性能的真实不确定性取决于独立患者数而非图像数。295 张图若来自 108 名患者,则有效样本量的上限是 108 而非 295。
4.6 型号的命名学分析
从型号名可以读出丰富的产品信息:
| 后缀 | 含义 | 出现次数 |
|---|---|---|
| MRI SureScan | MRI 兼容认证 | 6 个型号(多为 Medtronic) |
| DR / SR | 双腔 / 单腔 | 6 个型号 |
| VR-T / HF-T | 心室除颤 / 心衰(CRT) | 7 个型号 |
| QP | 四极导线 | 3 个型号 |
| Quad | 四极 | 4 个型号 |
“MRI SureScan” 值得特别注意:这是 Medtronic 的 MRI 兼容标识,出现 6 次(几乎全部 Medtronic 型号)。若模型学到了"M 家的多数型号是 MRI 兼容",那么型号识别可以间接推断 MRI 安全性——这正是这个任务临床价值的体现。
4.7 血缘关系图
Charité – Universitätsmedizin Berlin 影像科
2012-01 至 2022-01,896 名 CIED 患者
│
│ 采集正规胸片(DICOM)
▼
2,321 张原始胸片
│
├──→ DICOM→PNG 转换 → originals/
│
└──→ 从显示器翻拍(5 种机型,最多 5 次/张)
▼
11,072 张手机照片(galaxys4/5, iphone8/13/13mini)
│
│ 标注(2 位放射科医师,3D Slicer)
▼
分割掩码(seg_masks,像素值 0/1/2)
│
│ 匿名化(中心裁剪 + OCR + 人工复核 + 随机 ID)
▼
PhysioNet v1.0.0(2025-03-04)+ data.json
4.8 与 496 的"任务结构"对照
| 维度 | 496 NIHSS | 499 CIED |
|---|---|---|
| 输入模态 | 文本(出院小结) | 影像(胸片 / 手机照片) |
| 标注层级 | 实体 + 关系 | 像素掩码 + 类别标签 |
| 任务数 | 2(NER + RE) | 3(分割 + 制造商 + 型号) |
| 类别数 | 15 个条目 + 分数值 | 3(分割)/ 4 / 27 |
| 划分 | 提供(220/92) | 提供(1,796/464/295) |
| 规模小 | 312 患者 | 896 患者 |
| 共同点 | 都是"从原始记录到结构化输出"的标注语料 | 同左 |
两者都是"小规模、高专业度、有人工标注"的资源,只是一个在文本上一个在影像。
§5 装载、掩码处理与评测协议
5.1 最小装载路径
import json, numpy as np
from PIL import Image
import pandas as pd
meta = pd.DataFrame(json.load(open('data.json')))
print(meta.shape) # (13393, 6)
print(meta['pat_id'].nunique()) # 896
print(meta['manufacturer'].value_counts())
print(meta['model'].nunique()) # 28
print(meta['dataset'].value_counts())
# 载入一张原图与其掩码
row = meta[meta['dataset'] == 'originals'].iloc[0]
img = np.array(Image.open(f"originals/{row['fname']}"))
mask = np.array(Image.open(f"seg_masks/{row['seg_mask']}"))
print(img.shape, mask.shape)
print(np.unique(mask)) # [0 1 2] 的子集
5.2 掩码的正确读取与可视化
def load_mask(path):
m = np.array(Image.open(path))
assert m.ndim == 2 or m.shape[2] == 1, "掩码应为单通道"
if m.ndim == 3:
m = m[..., 0]
return m.astype(np.uint8)
def mask_stats(m):
total = m.size
return {
'bg': (m == 0).sum() / total,
'device': (m == 1).sum() / total, # PM / ICD
'monitor': (m == 2).sum() / total, # event monitor
}
def visualize(m):
vis = np.zeros((*m.shape, 3), dtype=np.uint8)
vis[m == 0] = [10, 10, 14]
vis[m == 1] = [255, 90, 90]
vis[m == 2] = [90, 170, 255]
return vis
注意 mask_stats 的一个用途:设备像素占比通常在0.1%-2% 之间(设备相对整张胸片很小)。如果统计出占比很高(如 20%),说明掩码有问题或读取错误。
5.3 分割任务的基线
# Dice 系数(per-class,忽略背景或包含背景需明确说明)
def dice(pred, target, cls):
p = (pred == cls); t = (target == cls)
inter = (p & t).sum()
return 2 * inter / (p.sum() + t.sum() + 1e-8)
分割评测的两个常见错误:
- 包含背景计算 Dice——背景占 98%+ 像素,会让 Dice 虚高到 0.98+,掩盖设备分割的真实性能。应报告前景类(1 与 2)的 Dice;
- 不做 per-class 报告——类别 2(event monitor)的样本远少于类别 1(PM/ICD),合并报告会掩盖类 2 的差性能。
5.4 分类任务的分层评测
from sklearn.metrics import classification_report, confusion_matrix
# 制造商分类
print(classification_report(y_true_mfr, y_pred_mfr, digits=3))
# 型号识别(macro-F1 是关键)
print(classification_report(y_true_model, y_pred_model,
digits=3, zero_division=0))
必须报告的三件事:
- macro-F1(每个类等权);
- per-class F1 表(暴露稀有类的表现);
- 混淆矩阵(分析哪些型号被混淆——通常是同厂商同类型的型号)。
5.5 按机型分层的评测(499 的特色)
for ds in ['iphone13', 'iphone8', 'galaxys5', 'galaxys4', 'iphone13mini']:
sub = test[test['dataset'] == ds]
if len(sub) == 0:
continue
print(ds, len(sub), macro_f1(sub))
这个分析能回答:机型质量对识别性能的影响有多大。预期低端机(Galaxy S4)性能更低——若结果如此,则"基层医院用旧手机拍屏"的场景需要专门的模型优化。
5.6 域适应实验设计
499 提供了理想的域适应实验材料:
| 实验 | 训练 | 测试 | 回答的问题 |
|---|---|---|---|
| A | originals | originals | 上限性能(同域) |
| B | originals | 手机图 | 域差异的实际代价 |
| C | 手机图 | 手机图 | 同域但质量低 |
| D | originals + 手机图 | 手机图 | 混合训练的效果 |
| E | originals(增强模拟) | 手机图 | 增强能否替代真实翻拍 |
实验 B 与 E 的对比特别有价值:它回答"用数据增强模拟翻拍失真,能否达到用真实翻拍数据训练的效果"。如果 E 接近 B,则说明可以省去真实翻拍的成本;如果 E 远差于 B,则说明真实翻拍数据不可替代——这是 499 存在的核心辩护。
5.7 患者级评测的重要性
由于划分是患者级,评测时要注意:
- 不要把同一患者的图像分到不同批次做"多次评测"(会夸大置信度);
- 报告性能时应按患者聚合(如"每患者的平均预测正确率"),而非按图像;
- 置信区间按患者数(约 108)估计,而非图像数(295)。
5.8 层次分类的设计建议
面对 27 类的不平衡,层次分类是有效的策略:
Level 1: 制造商(4 类)
└─ Level 2: 设备类型(PM/ICD/CRT-P/CRT-D/ICM,约 6 类)
└─ Level 3: 具体型号(厂商 × 类型内的型号)
优势:
- 每层内类别更少,样本更平衡;
- 每层的错误可归因(是厂商分错还是型号分错);
- 与临床决策链对齐(先确定厂商 → 再确定功能类型 → 再确定型号)。
劣势:误差逐层传播(与 496 的两步管线同理)。
5.9 常见错误黑名单
- ❌ 用图片查看器看掩码,以为它是空的(存照 K);
- ❌ 包含背景计算 Dice(虚高);
- ❌ 只报 accuracy,不报 macro-F1(被 Medtronic 主导);
- ❌ 把翻拍图当独立样本估计置信区间(高估精度);
- ❌ 忽略 “Other” 类(它占约 10%);
- ❌ 把手机图的标签当作"从手机图识别出的标签"(标签源自 originals 的金标准);
- ❌ 跨患者划分(会泄漏近重复图像);
- ❌ 声称模型可用于临床决策(单中心、无前瞻验证)。
5.10 与 498、496 的联合研究设计
| 联合 | 设计 |
|---|---|
| 499 + 498 | 影像特征(设备型号)+ 结构化随访数据的关联研究(若患者可匹配则更佳,但跨库患者不可匹配) |
| 499 + 496 | 方法对照:496 的"两步管线"(NER → RE)对应 499 的"层次分类"(类型 → 型号) |
| 499 + 497 | 合成失真(497 是数值)vs 真实翻拍失真(499 是影像)——两种"数据质量退化"的对照 |
5.11 部署形态
| 场景 | 可行性 |
|---|---|
| 移动端 App 辅助识别 | ✅ 数据本身就是为这个场景设计的 |
| 医院 PACS 集成 | ✅ 用 originals 子集训练 |
| 基层远程会诊 | ✅ 用翻拍子集训练 |
| 临床决策 | ❌ 需前瞻验证与监管审批 |
| 设备召回筛查 | ⚠️ 可辅助,但需人工复核 |
5.12 复现包清单
发表基于 499 的研究时建议附带:
- [ ] 数据集版本与 DOI;
- [ ] data.json 的处理脚本;
- [ ] 掩码读取与可视化代码(避免他人踩坑);
- [ ] 划分脚本(使用官方 pat_id 划分);
- [ ] 模型架构与超参;
- [ ] per-class 指标与混淆矩阵;
- [ ] 按机型分层的评测结果;
- [ ] 环境依赖。
特别建议公开掩码的可视化工具——这是每个使用者都会卡住的地方(存照 K)。
§6 实证基座:13,393 张图像背后的数字
6.1 三个层级的样本量
理解 499 的数字,必须同时看三个量级:
| 层级 | 数量 | 含义 |
|---|---|---|
| 图像数 | 13,393 | 训练时可用的总样本 |
| 独立影像数 | 2,321 | 原始胸片,每张对应一个真实影像学观察 |
| 患者数 | 896 | 统计推断的基本单位 |
这三个数字的比值是理解数据集的钥匙:
- 13,393 / 2,321 ≈ 5.8(每张原图平均产出约 5.8 张翻拍图,与"最多 5 次"的拍摄计划相符);
- 2,321 / 896 ≈ 2.6(每名患者平均有 2.6 张胸片)。
6.2 为什么"5.8 倍"的膨胀不等于"5.8 倍的信息"
这是 499 最容易误读的地方。把 11,072 张翻拍图当作独立样本会犯两个错误:
错误一:高估数据规模
翻拍图是同一张胸片在不同失真下的版本——它们共享完全相同的临床内容(同一设备、同一患者、同一影像)。模型从中学到的是"翻拍失真下的不变性",而非新的设备特征。
错误二:低估性能的不确定性
如果测试集有 295 张图但只来自 108 名患者,那么性能的真实方差应按 108 计算。按 295 计算会得到一个过窄的置信区间——报告的结果看起来比实际更可靠。
6.3 制造商分布的现实性
| 制造商 | 图像数 | 占比 |
|---|---|---|
| Medtronic | 1,218 | 52.5% |
| Biotronik | 517 | 22.3% |
| Abbott | 401 | 17.3% |
| Boston Scientific | 185 | 8.0% |
Medtronic 超过一半。这与全球 CIED 市场的实际格局大致相符(Medtronic 长期是市场份额第一)。
对评测的影响:
- 制造商分类的"全猜 Medtronic"基线是 52.5%;
- 因此报告 accuracy 时,必须与这个基线对照;
- 更有意义的是 macro-F1 与 balanced accuracy。
若是临床部署:这个分布意味着模型在 Medtronic 设备上有更多训练样本,性能可能更好;而 Boston Scientific(8%)的设备识别可能更差——这是一种来自数据分布的隐性偏差。
6.4 型号不平衡的量化
Top 5 与 Bottom 5 的对比:
| 排名 | 型号 | 图像数 |
|---|---|---|
| 1 | Q20 SR MRI SureScan | 342 |
| 2 | Attesta DR MRI SureScan | 263 |
| 3 | Mirro MRI VR SureScan | 237 |
| 4 | Confirm Rx DM3500 | 137 |
| 5 | Enticos 4 DR | 111 |
| … | … | … |
| 末 5 | SJM Confirm | 26 |
| 末 4 | Rivacor 7 HF-T QP | 25 |
| 末 3 | Origen Mini ICD | 23 |
| 末 2 | Etrinsa 8 HF-T | 22 |
| 末 1 | Ilivia 7 HF-T QP | 22 |
最高 342 vs 最低 22,相差 15.5 倍。
这个不平衡的临床含义:稀有型号恰恰可能是召回的对象(因为样本少说明植入量少,而小批量产品的质量风险不低)。因此**"对小类的识别能力"比"总体准确率"更接近临床价值**。
6.5 手机机型的分布与实验价值
| 机型 | 张数 | 占比 | 发布年 | 定位 |
|---|---|---|---|---|
| Galaxy S4 | 1,675 | 12.5% | 2013 | 低端旧机 |
| Galaxy S5 | 2,910 | 21.7% | 2014 | 中端旧机 |
| iPhone 8 | 2,890 | 21.5% | 2017 | 中高端 |
| iPhone 13 | 2,902 | 21.6% | 2021 | 旗舰 |
| iPhone 13 mini | 695 | 5.2% | 2021 | 旗舰小屏 |
四款机型约 2,900 张(S5/iPhone8/iPhone13),Galaxy S4 稍少(1,675),iPhone 13 mini 明显少(695)。
这个分布支持的可研究问题:
- 时代效应:2013 年的 Galaxy S4 vs 2021 年的 iPhone 13——8 年手机影像技术进步是否显著提升识别性能?
- 平台效应:三星 vs 苹果,成像算法(锐化、色偏)差异是否影响模型?
- 屏幕尺寸效应:iPhone 13 mini(小屏)是否因单张画面信息更少而性能更低?
- 最坏情况:只在 Galaxy S4 上测,性能下限是多少?(对基层场景有直接意义)
6.6 划分的三个数字与统计约束
| 集合 | 图像数 | 占比 | 估计患者数* |
|---|---|---|---|
| 训练 | 1,796 | 77.4% | ~627 |
| 验证 | 464 | 20.0% | ~161 |
| 测试 | 295 | 12.7% | ~108 |
(*患者数为按比例推算,官方未公布;注意占比合计超过 100% 是因为分母口径——训练/验证/测试的比例约为 70/18/11。)
测试集 295 张 / 27 类 ≈ 每类 11 张。
稀有类的测试样本可能是 1-5 张:
| 型号 | 测试数 |
|---|---|
| SJM Confirm | 1 |
| Quadra Assura MP | 6 |
| Ilivia 7 HF-T QP | 2 |
| Enitra 6 DR-T | 2 |
| Rivacor 7 HF-T QP | 5 |
SJM Confirm 只有 1 张测试图——这意味着该型号的 F1 只有 0 或 1 两种可能,毫无统计意义。报告 per-class F1 时必须标注每类的测试样本数,否则读者会误以为 0.0 或 1.0 是可靠估计。
6.7 “MRI SureScan” 的分布与临床推断
从型号名可以数出 MRI 兼容标识的出现:
| 制造商 | MRI SureScan 型号数 |
|---|---|
| Medtronic | 6(Attesta DR、Mirro VR、Serena Quad CRT-P、Compia Quad CRT-D、Ensura DR、Q20 SR) |
| 其他厂商 | 0(Biotronik 用 “ProMRI” 等不同商标,Abbott/BSC 未在型号名中体现) |
这是一个重要的数据特征:MRI 兼容标识不对称地集中在 Medtronic 型号名中。
后果:
- 模型可能学到"M 家 = MRI 兼容"的捷径(spurious correlation);
- 但这在临床上恰好是正确的(Medtronic 的 SureScan 系列确实通过 MRI 兼容认证);
- 因此模型可以间接推断 MRI 安全性——这是有益的捷径,而非有害的偏差。
这个案例很好地说明了:捷径学习(shortcut learning)不总是坏事,取决于捷径与真实目标是否对齐。
6.8 设备类型分布的重构统计
把 27 型号映射到设备类型后:
| 设备类型 | 估计图像数 | 占比 |
|---|---|---|
| 单腔 PM | ~390 | 16.8% |
| 双腔 PM | ~433 | 18.7% |
| 单腔 ICD | ~511 | 22.0% |
| CRT-P | ~294 | 12.7% |
| CRT-D | ~201 | 8.7% |
| ICM | ~288 | 12.4% |
| Other | ~234 | 10.1% |
(基于型号明细表估算,含 Other 分配的不确定性。)
这个重构使类别从 27 类降到 ~7 类,且分布更平衡(最大 22% vs 最小 8.7%)。这对建模很有价值——先做类型分类(易),再做型号分类(难),可以提升整体性能与可解释性。
6.9 域差异的量化预期
虽然官方未报告"域差异有多大",但可以合理预期:
| 对比 | 预期性能变化 |
|---|---|
| originals → originals | 最优(同域) |
| originals → 手机图(同机型) | 明显下降 |
| originals → 手机图(低端机) | 下降更多 |
| 手机图 → 手机图 | 中等(同域但质量受限) |
| originals + 手机图 → 手机图 | 接近同域水平 |
这些预期是 499 使用者应自行验证的核心问题。官方没有给出基线,所以"域差异到底多大"是一个开放问题——第一个给出完整分层评测的人,就为这个数据集建立了基准。
6.10 实际可用的有效样本估算
评估"模型能否泛化到新患者"时,有效样本量应取:
| 用途 | 有效样本量 |
|---|---|
| 学"设备外观" | ~2,321(独立胸片) |
| 学"翻拍不变性" | ~11,072(翻拍图,但信息冗余) |
| 评测泛化 | ~108(测试患者) |
| 评测稀有型号 | 1-10(每类测试图) |
最后一行是最严峻的约束:稀有型号的评测几乎没有统计功效。这意味着:
- 不能声称"模型在稀有型号上表现如何"(样本不够);
- 更诚实的做法是报告"在测试样本 ≥10 的型号上"的性能。
6.11 静态 vs 活跃
| 维度 | 状态 |
|---|---|
| 499 数据集本体 | 静态(v1.0.0,2025-03-04,未见更新) |
| CIED 设备市场 | 活跃(型号持续迭代,新设备不断上市) |
这带来一个尖锐的时效问题:数据集覆盖 2012-2022 年的设备,而 2026 年的市场上已有大量新型号。模型对新型号的识别能力完全未知——而且由于类别是固定的 27 类,新设备只能落到 “Other” 或预测错误。
这提示:CIED 识别系统需要持续更新(新设备 → 新训练数据 → 重训模型)。一次性训练的模型会随设备迭代而衰减。
6.12 家族治理:影像数据集生态位
| 数据集类型 | 代表 | 生态位 |
|---|---|---|
| 病灶/器官分割 | 各类 CT/MRI 分割数据集 | 主流的影像 AI 任务 |
| 疾病分类 | 胸片疾病分类数据集 | 主流 |
| 设备/植入物识别 | 499 | 小众但有明确临床用途 |
| 影像报告文本 | 498 的 ExamReport | 文本侧 |
499 在影像 AI 生态中属于"设备识别"这一小众方向——但正是这种小众性呼应了真实的临床需求(MRI 安全、召回筛查)。
6.13 口径诊断树
数字不符时:
数字不对?
├─ 图像总数不对?
│ ├─ 是否为 2,321 + 11,072?→ 13,393
│ └─ 是否只数了某几个目录?
├─ 患者数不对?
│ └─ 是否把 pat_id 的唯一值数错了?→ 应为 896
├─ 型号数不对?
│ └─ 是 27(型号)还是 28(含 Other)?→ 两个口径都存在
├─ 划分和不对?
│ └─ 各厂商 Train+Val+Test 应等于 Total
└─ 掩码 читае 全 0?
└─ 是否用图片查看器?→ 必须用 numpy(存照 K)
6.14 八个坑点
坑点 1:掩码看起来全黑。 8-bit PNG 中 0 与 2 差异肉眼不可辨。必须用 numpy 读并与 1/2 比较。
坑点 2:把翻拍图当独立样本。 11,072 张翻拍图源自 2,321 张原图,信息高度冗余。样本量与置信区间不能按 13,393 算。
坑点 3:忽略制造商不平衡。 Medtronic 占 52.5%,accuracy 会被主导。必须报 macro 指标。
坑点 4:稀有类测试样本太少。 SJM Confirm 测试集仅 1 张,其 F1 无统计意义。必须标注每类测试样本数。
坑点 5:包含背景算 Dice。 背景占 98%+,会让分割 Dice 虚高。应报前景类 Dice。
坑点 6:忽略 “Other” 类。 约 10% 图像归入 Other,且其内部异构。处理方式(剔除 / 保留 / 单独建模)必须说明。
坑点 7:误以为是"拍胶片"。 手机图是拍显示器,失真特性与拍胶片完全不同(摩尔纹、屏幕反光是拍屏特有的)。
坑点 8:忽视设备迭代。 数据集止于 2022 年,新设备型号识别能力未知。
6.15 自查清单
- [ ] 已确认访问级别与许可条款(官方页面未声明);
- [ ] data.json 可解析,6 字段齐全;
- [ ] pat_id 唯一值 = 896;
- [ ] 图像总数 = 13,393(2,321 + 11,072);
- [ ] 掩码用 numpy 读取,
np.unique返回[0 1 2]子集; - [ ] 掩码可视化已重映射颜色;
- [ ] 使用官方的患者级划分(未自行重划);
- [ ] 分割报前景类 Dice(未含背景);
- [ ] 分类报 macro-F1 与 per-class F1(标注测试样本数);
- [ ] 已做按机型分层的评测;
- [ ] 已处理 Other 类并说明策略;
- [ ] 报告置信区间时按患者数而非图像数;
- [ ] 已引用数据集 + 代码 + 平台来源;
- [ ] 未声称可用于临床决策。
§7 AI 实践指南:把 499 用出价值
7.1 五种用法
| 用法 | 具体做法 | 价值 |
|---|---|---|
| 分割基线 | 训练 U-Net 类模型做设备分割 | 建立像素级基准 |
| 型号识别 | 层次分类或直接 27 类 | 核心任务 |
| 域适应研究 | originals → 手机图 | 利用成对数据 |
| 增强效果验证 | 模拟失真 vs 真实翻拍 | 回答"真实数据是否必要" |
| 移动端部署 | 量化 + 轻量模型 | 落地场景 |
7.2 一个 30 分钟的最小实验
- (5 分钟) 解析 data.json,统计各字段分布,验证 896 / 13,393 / 28 类;
- (10 分钟) 随机抽 5 张掩码,用 numpy 统计各像素值占比,确认设备占比在 0.1%-2% 量级;
- (10 分钟) 用最简单的基线(如"全猜 Medtronic")计算制造商分类的准确率——你会得到约 52%,这就是必须超越的基线;
- (5 分钟) 计算型号识别的"全猜最多类"基线(Q20 SR,342/2321 ≈ 14.7%)。
这个实验能立刻建立"基线感知"——知道一个模型必须超过什么才算有用。
7.3 泄漏防控
| 泄漏类型 | 防控 |
|---|---|
| 患者级泄漏 | 用官方 pat_id 划分(已做) |
| 近重复泄漏 | 同一原图与其翻拍图必须同侧(官方划分已保证) |
| 域泄漏 | 训练/测试的机型分布应报告 |
| 标签泄漏 | 文件名不含类别信息(哈希命名,已验证) |
注意第三条:如果训练集全是 iPhone 13(新机),测试集全是 Galaxy S4(旧机),那测的是"跨机型泛化"而非"同分布泛化"。必须报告训练/测试的机型分布。
7.4 公平性与偏差
| 偏差来源 | 说明 | 影响 |
|---|---|---|
| 厂商不平衡 | Medtronic 52.5% | 小厂商设备识别更差 |
| 型号不平衡 | 15.5 倍差距 | 稀有型号识别差 |
| 机型不平衡 | 5 种手机分布不均 | 低端机场景性能未知 |
| 单中心 | 柏林夏里特 | 跨机构泛化未知 |
| 时代 | 2012-2022 | 新设备未覆盖 |
| 患者构成 | 未报告人口学 | 人群偏差未知 |
最后一项值得注意:官方未报告患者的人口学特征(年龄、性别分布)。这意味着无法评估"训练集是否代表某类人群"——这是一个信息缺口。
7.5 分割模型的推荐架构
| 架构 | 特点 | 适用 |
|---|---|---|
| U-Net | 经典,医学分割标配 | 基线 |
| nnU-Net | 自动配置,强基线 | 追求性能 |
| DeepLabV3+ | 空洞卷积,大感受野 | 若设备占比较大 |
| SegFormer / SAM | 现代 Transformer | 探索 SOTA |
注意类别极不平衡:前景(设备)仅占像素的极小比例。建议:
- 用 Dice loss 或 Focal loss 而非纯交叉熵;
- 做前景过采样或类别加权;
- 报前景 Dice 而非总体像素准确率。
7.6 分类模型的推荐策略
| 策略 | 说明 |
|---|---|
| 骨干 | ResNet / EfficientNet / ConvNeXt |
| 预训练 | ImageNet 预训练(数据量不足时必须) |
| 输入尺寸 | 裁剪至设备区域后分类(提升信噪比) |
| 损失 | 类别加权的交叉熵 / Focal loss |
| 层次 | 先分厂商 → 再分类型 → 再分型号 |
| 集成 | 多模型 + 多尺度 |
"裁剪至设备区域"是一个关键技巧:先用分割模型定位设备,再把设备区域裁剪出来做分类——这比整图分类更有效(信噪比高)。这就是**"分割辅助分类"的两阶段架构**,也是这份数据集同时提供分割与分类标签的原因。
7.7 域适应的实操
# 用真实翻拍数据做域适应(最直接)
train_src = meta[(meta.dataset == 'originals') & (meta.split == 'train')]
train_tgt = meta[(meta.dataset.isin(['iphone13','galaxys5'])) & (meta.split == 'train')]
# 策略 1:混合训练
# 策略 2:源域预训练 + 目标域微调
# 策略 3:对抗域适应(DANN)
# 策略 4:伪标签(用源域模型给目标域打伪标签)
推荐顺序:先做混合训练(最简单),若不足再做对抗域适应。
7.8 "增强能否替代真实翻拍"的实验设计
这是 499 最重要的开放问题之一:
方案 A:originals 训练 → 手机图测试 (不增强)
方案 B:originals + 随机透视/噪声/模糊增强 → 手机图测试
方案 C:originals + 真实手机图 → 手机图测试 (真实数据)
对比 A/B/C 的性能。这个实验的结论对数据收集策略有直接影响:
- 若 B ≈ C,则机构可省去拍摄翻拍数据的成本(用增强代替);
- 若 B ≪ C,则证明真实翻拍数据不可替代——499 的核心价值由此确立。
7.9 弱监督与半监督
- 半监督:大量翻拍图无分割掩码(掩码可能只在 originals 上)→ 可用半监督学习纳入;
- 弱监督:只有图像级标签、无像素掩码时,可用 CAM/Grad-CAM 生成弱定位;
- 自监督:用 13,393 张图做对比学习预训练,再微调。
7.10 成本核算
| 方案 | 数据成本 | 计算成本 | 适合 |
|---|---|---|---|
| 只用 originals | 低(2,321 图) | 中 | 标准影像 AI 研究 |
| 全量训练 | 中(13,393 图) | 高(5.8 倍数据) | 追求鲁棒性 |
| 分割 + 分类两阶段 | 中 | 高(两个模型) | 落地性能 |
| 移动端部署 | 低 | 高(需量化/蒸馏) | 床边应用 |
7.11 部署形态建议
| 场景 | 推荐方案 |
|---|---|
| 院内 PACS 集成 | originals 训练的模型 + 常规推理 |
| 手机 App | 全量训练 + 模型量化(INT8)+ 端侧推理 |
| 远程会诊 | 手机图训练优先 + 服务器推理 |
| 批量筛查 | 分割 + 分类两阶段 + 定期重训 |
7.12 监控与回归(设备迭代问题)
由于设备持续迭代,部署的系统需要:
| 监控项 | 说明 |
|---|---|
| Other 类占比 | 若上升,说明新设备增多,需重训 |
| 置信度分布 | 若整体下降,说明分布漂移 |
| 型号预测分布 | 与训练分布对比 |
| 人工复核结果 | 持续收集新样本 |
"Other 类占比上升"是一个优秀的漂移信号——它直接指示"出现了模型未见过的新设备"。
7.13 三个可立即执行的建议
- 今天:解析 data.json,建立基线(全猜 Medtronic = 52.5%,全猜 Q20 SR = 14.7%);
- 本周:跑通"分割 → 裁剪 → 分类"的两阶段流程,得到第一个端到端 macro-F1;
- 本月:完成"增强 vs 真实翻拍"的对照实验,这是最有科学价值的开放问题。
7.14 三个可发表的研究方向
- “智能手机翻拍胸片中的 CIED 识别:真实域 vs 合成域的对比”——直接验证真实翻拍数据的必要性;
- “层次分类在中美设备识别中的应用:从厂商到型号的级联”——方法学贡献;
- “CIED 型号识别的类别不平衡问题:稀有型号的识别能力评估”——诚实的负面结果也有价值。
7.15 与临床工作流的对接
患者(无病历 / 转院 / 急诊)
│ 拍胸片(或手机拍屏幕)
▼
AI 模型:分割定位设备 → 识别厂商与型号
│
▼
输出:可能的型号候选(Top-3)+ 置信度
│
▼
临床决策
├── MRI 安全性核查(人工确认)
├── 召回筛查(人工确认)
└── 程控准备(人工确认)
关键设计原则:AI 输出的是候选与置信度,不是最终结论。这是医疗 AI 安全部署的通用原则——辅助判断,而非替代判断。
§8 伦理、合规与数据的规范缺口
8.1 三重伦理主体
| 主体 | 责任 |
|---|---|
| 患者 | 影像来自真实患者(896 人),虽已匿名化,仍须防止再识别 |
| 机构与作者 | 数据开放是贡献,使用时须充分引用 |
| 使用者 | 不得误用、不得声称不实结论 |
8.2 烧录信息的处理与残余风险
499 的匿名化流程明确处理了烧录信息(burned-in annotation):
- 中心裁剪;
- OCR 涂黑;
- 人工复查删除。
为什么这很关键:胸片四角常印有姓名、ID、日期。若不处理,这些信息会直接泄露患者身份。"OCR + 人工复核"的组合是当前较可靠的做法(纯 OCR 会漏掉低对比度或手写内容)。
残余风险:即使涂黑,也可能存在:
- 设备影像本身的型号—患者关联(罕见型号可能在小样本中唯一);
- 图像指纹(虽然是胸片,但个体解剖特征具有唯一性);
- 翻拍图的背景(屏幕边框、房间物件可能泄露环境信息)。
因此,再识别尝试仍被禁止。
8.3 访问级别未声明的规范问题
499 最大的规范缺口是官方页面未声明访问级别与许可条款(存照 A/B)。这带来实际困难:
- 使用者不确定能否商用;
- 不确定再分发规则;
- 不确定是否需要 DUA。
应对建议:
- 到 PhysioNet 的下载界面查看实际条款(那里通常会显示);
- 若仍不明确,联系作者(代码仓库可找到联系方式);
- 保守做法:按 PhysioNet 的默认条款使用,并明确引用。
这个缺口本身也是一个观察:数据集在元数据完备性上的短板会直接影响可用性——这不是"小事",而是影响数据能否被合规使用的实质问题。
8.4 医疗影像 AI 的特有伦理问题
| 问题 | 说明 |
|---|---|
| 过度依赖 | 医生可能盲信 AI 输出,尤其在 27 类这种人工难判的任务上 |
| 自动化偏见 | 若 AI 给出错误型号,人工复核可能被"锚定" |
| 责任归属 | AI 建议错误导致 MRI 事故,责任如何划分? |
| 公平性 | 小厂商设备的低性能是否构成对使用该类设备患者的不公平? |
| 设备迭代 | 新设备的识别失败可能导致漏检召回设备 |
第四条尤其值得关注:如果模型对 Boston Scientific(仅 8% 训练样本)设备的识别显著更差,那么使用该厂商设备的患者在 AI 辅助下获得的安全性低于使用 Medtronic 设备的患者——这是一种技术引入的健康不公平。
8.5 使用红线
| 红线 | 说明 |
|---|---|
| ❌ 未经人工确认直接用于 MRI 安全决策 | 必须人工复核 |
| ❌ 声称可替代专科医师判断 | 定位是辅助 |
| ❌ 用于设备召回决策而不复核 | 召回需精确型号 |
| ❌ 尝试再识别患者 | 禁止 |
| ❌ 不报告性能分层 | 必须披露各厂商/机型的性能差异 |
8.6 引用与致谢义务
| 对象 | 是否必引 |
|---|---|
| 数据集(DOI 10.13026/swv0-cd11) | ✅ |
| 代码仓库(github.com/AndreasZhukov/cied) | 建议 |
| PhysioNet 平台论文(2026) | ✅ |
| 前期方法工作(Howard 2019、Lauzier 2023 等) | 建议 |
8.7 与 498 的合规对照
| 维度 | 498 浙江 EHR | 499 CIED |
|---|---|---|
| 访问级别 | 明示开放获取 | 未声明 |
| 许可条款 | 未列具体协议 | 未列 |
| 伦理批号 | QT2022185 | EA4/042/20 |
| 知情同意 | 豁免(回顾性) | 豁免(回顾性匿名化) |
| 匿名化标准 | HIPAA | 中心裁剪 + OCR + 人工复核 |
| 关联论文 | 有 | 无 |
两者共同的短板是"许可条款未明"——这是 PhysioNet 上部分数据集的普遍现象,也是使用者必须自行确认的关键项。
8.8 一个诚实的观察:规范的完备性影响数据价值
对比本系列四篇影像/数据条目的 DAIMS 得分:
| 条目 | DAIMS | 主要短板 |
|---|---|---|
| 498 浙江 EHR | 6.7 | 许可未明 |
| 496 NIHSS | 6.4 | 需 DUA、格式非标准 |
| 497 Health Gym | 6.3 | 许可表述矛盾、无评测协议 |
| 499 CIED | 6.2 | 许可未明、无论文 |
共同规律:技术性维度(格式、机器可读性)普遍得分高,而规范性维度(许可、评测协议、生态)是普遍短板。
这反映了一个现实:数据发布者的注意力集中在"把数据做出来",而对"让数据可被规范使用"投入不足。对使用者而言,这意味着每次使用前都必须自行完成一轮合规核查——这是当前医疗开放数据生态的一个结构性成本。
§9 FAQ:五十问
9.1 关于身份与获取
Q1:官方名称?
Dataset for Segmentation and Classification of Cardiac Implantable Electronic Devices in Chest X-Rays。
Q2:官方 slug?
cardiac-implantable-device-cxr。
Q3:DOI?
10.13026/swv0-cd11。
Q4:版本?
v1.0.0,2025-03-04 发布。
Q5:谁做的?
柏林夏里特大学医学院(Charité)的作者团队。
Q6:有论文吗?
官方未列正式关联论文,仅有方法学背景参考文献。
Q7:要 DUA 吗?
官方页面未声明访问级别,需到下载界面确认。
Q8:怎么下载?
PhysioNet 页面。
Q9:有代码吗?
有,github.com/AndreasZhukov/cied。
Q10:伦理批号?
EA4/042/20。
9.2 关于规模与内容
Q11:有多少张图像?
13,393 张。
Q12:有多少患者?
896 名。
Q13:胸片和手机图各多少?
2,321 张正规胸片 + 11,072 张手机翻拍。
Q14:有多少设备型号?
27 个(来自 4 家制造商);model 字段共 28 类(含 Other)。
Q15:哪四家制造商?
Medtronic、Biotronik、Abbott(含 St. Jude Medical)、Boston Scientific。
Q16:有分割掩码吗?
有,存在 seg_masks 文件夹。
Q17:掩码有多少张?
官方未给出具体数字。
Q18:掩码的像素值含义?
0=背景,1=PM/ICD,2=event monitor。
Q19:为什么掩码打开是全黑的?
因为 8-bit PNG 中 0 与 2 对比度极小,肉眼不可辨。需用 numpy 读取。
Q20:数据采集时间跨度?
2012-01 至 2022-01。
Q21:包含哪些手机型号?
iPhone 13 mini、Galaxy S4、iPhone 8、iPhone 13、Galaxy S5。
Q22:手机图是拍什么?
从显示器上翻拍(不是打印胶片)。
Q23:每张胸片拍几次?
最多 5 次。
Q24:有 CT 或 MRI 吗?
没有,只有胸片与其翻拍。
Q25:有文本数据吗?
没有,纯图像 + JSON 元数据。
9.3 关于任务与标注
Q26:有哪些任务?
设备分割、制造商分类、型号识别。
Q27:分割有几个类?
3 个(背景 / PM-ICD / event monitor)。
Q28:PM 与 ICD 为什么不分开?
官方掩码合并为 1,可能是因两者影像特征相似。
Q29:谁标注的?
2 位认证放射科医师(各 7-9 年图像处理经验)。
Q30:用什么工具标注?
3D Slicer。
Q31:标注一致性有报告吗?
官方未提供 Kappa 或 Dice 一致性指标。
Q32:制造商分类有几类?
4 类。
Q33:型号识别有几类?
27 个型号 + Other = 28 类。
Q34:有设备类型标签(PM/ICD/CRT/ICM)吗?
没有单列,但可从型号名派生。
Q35:有患者人口学信息吗?
没有报告。
9.4 关于划分与评测
Q36:有官方划分吗?
有,训练 1,796 / 验证 464 / 测试 295。
Q37:划分是患者级吗?
是,用 pat_id 划分。
Q38:测试集多大?
295 张图像。
Q39:测试集有多少患者?
官方未给出,按比例推算约 108。
Q40:报告什么指标?
分割报前景 Dice;分类报 macro-F1 与 per-class F1。
Q41:有官方基线吗?
没有。
Q42:全猜 Medtronic 的准确率?
约 52.5%。
Q43:稀有型号测试样本多吗?
很少,SJM Confirm 仅 1 张。
Q44:能用 accuracy 吗?
不建议,会掩盖类别不平衡问题。
Q45:置信区间怎么算?
按患者数(约 108)而非图像数(295)。
9.5 关于使用
Q46:能用于临床吗?
不能直接用于临床决策,需前瞻验证。
Q47:能做移动端部署吗?
可以,这正是数据集的设计目的之一。
Q48:能做域适应研究吗?
可以,成对的 originals/手机图是理想材料。
Q49:能用于 MRI 安全判定吗?
可作为辅助,但需人工确认。
Q50:能识别新上市的设备吗?
不能,数据集止于 2022 年,新设备会被误判或归入 Other。
9.6 进阶问答
Q51:为什么提供手机翻拍数据?
因为真实场景中基层医院常用手机拍屏幕传图,这些数据的失真是增强难以完全模拟的。
Q52:手机翻拍有哪些特有失真?
透视畸变、摩尔纹、屏幕反光、色偏、分辨率损失、边缘裁切。
Q53:增强能替代真实翻拍吗?
这是开放问题,需实验验证(见 §7.8)——若能替代,则 499 的核心价值受挑战;若不能,则 499 不可替代。
Q54:为什么 Medtronic 占一半?
反映真实市场格局。但会导致模型对小厂商设备识别更差。
Q55:如何缓解类别不平衡?
类别加权损失、过采样、层次分类、focal loss。
Q56:什么是层次分类?
先分厂商(4 类)→ 再分设备类型(~6 类)→ 再分型号(组内)。
Q57:分割和分类能联合训练吗?
可以,多任务学习。也可用"分割定位 → 裁剪 → 分类"的两阶段。
Q58:为什么要裁剪后分类?
提升信噪比——设备在整张胸片中占比极小。
Q59:MRI SureScan 是捷径学习吗?
是,但是"有益的捷径"——它与真实目标(MRI 安全性)对齐。
Q60:“Other” 类怎么处理?
三种策略:剔除、保留为第 28 类、或单独建模。必须说明。
Q61:设备类型分布有利于建模吗?
是,~7 类比 27 类更平衡(最大 22% vs 8.7%)。
Q62:跨机型泛化怎么测?
训练用一种机型、测试用另一种,报告性能下降。
Q63:How to handle 屏幕反光?
可在预处理做去眩光,或依赖模型的鲁棒性。
Q64:能否做无监督异常检测?
可以,作为"新设备检测"的辅助任务。
Q65:患者级划分为什么重要?
同一患者的图像高度相似(近重复),跨集划分会泄漏。
Q66:置信区间为什么按患者算?
因为同一患者的图像不独立,有效样本量受患者数限制。
Q67:能和其他胸片数据集合并吗?
可以,但需注意标签体系(型号列表)可能不同。
Q68:这个数据集对设备召回有什么价值?
可辅助筛查疑似受影响的患者,但需人工确认型号。
Q69:能否做联邦学习?
可以,它是理想的"本地站点数据"候选。
Q70:值不值得用?
如果你做医学影像 AI、移动医疗或具体到设备识别,值得——它是这个方向上少有的公开数据。
9.8 番外:三个反问
反问一:一份没有关联论文的数据集,可信吗?
应该区分"缺乏论文"与"缺乏质量"。499 的文档(规模、划分、标注协议、伦理)是完整的,只是缺一篇方法学论文来交代设计动机与基线。这降低了它的"学术可用性"(无法引用基线结果),但不影响数据本身可用。它更像一份"数据交付物"而非"研究产出"。
反问二:11,072 张翻拍图是噱头还是干货?
取决于"增强能否替代真实翻拍"这一实验的结果。如果能替代,那 11,072 张就是冗余;如果不能,那它就是这份数据集的灵魂。在有人做这个实验之前,两种判断都成立——这恰恰说明这个实验值得做。
反问三:设备识别这个任务会不会被通用视觉大模型直接解决?
有可能,但需要验证。SAM 类模型能分割"设备"(因为它是显著的物体),但区分 27 个型号需要领域知识。499 因此也是一个很好的"通用大模型 vs 领域专用模型"的对比赛场。
§10 存照、引文与系列关系
10.1 存照(口径局限与勘误)
存照 A(访问级别未声明):官方页面未明确访问级别(Open Access / Restricted / Credentialed)。使用前须在 PhysioNet 下载界面确认。
存照 B(许可条款未列):页面未列出具体许可协议(ODC/CC 等),是本条目最大规范短板。
存照 C(资助信息缺失):页面未包含资助段落,仅列 COI 为 None。
存照 D(无正式关联论文):页面未列关联论文,仅有 7 条方法学背景参考文献(均无 DOI/PMID)。本条目不为它编造论文。
存照 E(分割掩码数量未给):官方说明存在分割掩码,但未给出具体张数。
存照 F(型号数与类别数不一致):正文称 27 个型号(4 家制造商),model 字段实为 28 类(含 Other)。
存照 G(“Other” 类规模):四家厂商各有 Other 行(84/93/18/39),合计 234,约占原始图的 10%。
存照 H(Boston Scientific 类别笔误):官方表中 Valitude X4 CRT-P 的类别写作 “CRP-P”,应为 “CRT-P”。
存照 I(手机翻拍对象):手机图是从显示器翻拍,非打印胶片亦非原始 DICOM,模拟的是"手机拍电脑屏幕"场景。
存照 J(划分的患者数未给):data.json 的 pat_id 用于划分,确认划分是患者级,但官方未给出各集合的患者数。
存照 K(掩码可视化陷阱):8-bit PNG 中 0(背景)与 2(event monitor)视觉差异仅 0.8%,肉眼看似全黑,必须用 numpy 读标签。
存照 L(标注一致性未报告):页面未提供标注者间一致性指标(如 Dice 或 Kappa)。
存照 M(患者人口学未报告):未给出 896 名患者的年龄、性别等分布,无法评估人群代表性。
存照 N(平台引用义务):PhysioNet 2026 年要求一并引用平台论文(Pollard et al., Nature Health 2026)。
10.2 引文
- Bressem K, Busch F, Zhukov A, Adams L. Dataset for Segmentation and Classification of Cardiac Implantable Electronic Devices in Chest X-Rays (version 1.0.0). PhysioNet. 2025. RRID:SCR_007345. DOI: 10.13026/swv0-cd11.
- Pollard T, Moody BE, Lehman L, et al. PhysioNet as a global platform for biomedical research. Nature Health. 2026;1(8):792-795. DOI: 10.1038/s44360-026-00096-z.
- Howard JP, Fisher L, Shun-Shin MJ, et al. Cardiac rhythm device identification using neural networks. JACC Clin Electrophysiol. 2019;5(5):576-586.
- Kim UH, Kim MY, Kim DJ, et al. Deep learning-based algorithm for detection and characterization of MRI safety of cardiac implantable electronic devices on chest radiographs. Korean J Radiol. 2021;22(11):1918.
- Lauzier PT, et al. Detection and identification of cardiac implantable electronic devices in a large data set of chest radiographs using semi-supervised artificial intelligence. Heart Rhythm. 2023;20(4):642-643.
- Weinreich M, et al. Computer-aided detection and identification of implanted cardiac devices on chest radiography using deep CNNs. J Am Coll Cardiol. 2019;73(9S1):307.
- Goldenberg I, Huang DT, Nielsen JC. The role of implantable cardioverter-defibrillators and sudden cardiac death prevention. Eur Heart J. 2020;41(21):2003-2011.
- Vaduganathan M, Mensah GA, Turco JV, et al. The global burden of cardiovascular diseases and risks. J Am Coll Cardiol. 2022;80(25):2361-2371.
- Cardiac Device Identification [Internet]. GitHub; 2024. github.com/AndreasZhukov/cied.
- Ronneberger O, Fischer P, Brox T. U-Net: Convolutional Networks for Biomedical Image Segmentation. MICCAI 2015.
10.3 与既有条目的系列关系
| 关系 | 说明 |
|---|---|
| 任务平行 | 496(文本抽取)↔ 499(影像分割+分类):两种"非结构化→结构化"的路径 |
| 数据规范对照 | 498(许可未明但提供划分)与 499(提供划分但许可未明)互为补充 |
| 失真对照 | 497(合成失真)↔ 499(真实翻拍失真):两种"数据质量退化" |
| 临床场景 | 499 的识别结果可与 498 的结构化随访数据在概念上互补(虽患者不可匹配) |
| 唯一性 | 499 是本系列唯一的"设备/植入物识别"影像数据集 |
10.4 变更日志
| 日期 | 变更 |
|---|---|
| 2026-09-20 | 初版发布:完成身份核查(PhysioNet v1.0.0)、三段撰写、双检、发布、封面、DB 验证 |
声明:本条目为千方病案医数集 AI-Ready 数据集百科的组成部分,仅整理公开元数据与公开文献信息。本数据集官方未声明访问级别与许可条款,使用者须自行在官方页面确认。**基于本数据集的模型不可直接用于临床决策,型号识别结果须经专业人员复核。**所有数字均标注来源,存疑处列入 §10 存照。
使用须知:本文内容用于研究与信息参考,不构成临床决策依据。任何涉及设备型号确认的临床决策,应由有资质的专业人员依据完整信息作出。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- chest-x-ray-segmentation — 共享标签:医学影像 / 图像分类
- chexpert — 共享标签:医学影像 / 图像分类
- nih-chestx-ray14 — 共享标签:医学影像 / 图像分类
- gastrovision — 共享标签:医学影像 / 图像分类
- rfmid — 共享标签:医学影像 / 图像分类
- oct2017 — 共享标签:医学影像 / 图像分类
- brset — 共享标签:医学影像 / 图像分类
- echonet-lvh — 共享标签:医学影像 / 图像分类
- fetal-planes-db — 共享标签:医学影像 / 图像分类
- image-embeddings-mimic-cxr — 共享标签:医学影像 / 图像分类
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

