CIED 胸片数据集 — 心内植入装置分割与分类 AI-Ready Wikipedia

CIED 胸片数据集:896 名患者 × 13,393 张图像 × 27 个设备型号——2,321 张正规胸片 + 11,072 张手机翻拍,把设备识别从影像科搬到床边

来源 https://physionet.org/content/cardiac-implantable-device-cxr/1.0.0/发布时间: 2026-09-20最后更新: 2026-09-25 阅读 24
CIED 胸片数据集 — 心内植入装置分割与分类 AI-Ready Wikipedia

信息速览

数据集名称CIED 胸片数据集 — 心内植入装置分割与分类 AI-Ready Wikipedia
数据类型13,393 张图像,896 名患者,27 个设备型号,2,321 胸片 + 11,072 手机翻拍,三值分割掩码
规模896 名患者 / 13,393 张图像
接入方式https://physionet.org/content/cardiac-implantable-device-cxr/1.0.0/
AI 就绪度

Cardiac Implantable Electronic Devices in Chest X-Rays — AI-Ready 数据集百科

一句话:这是一份为"设备识别"而生的胸片数据集——896 名患者的 13,393 张图像,其中 2,321 张是影像科的正规胸片(金标准),另外 11,072 张是用 5 种手机从显示器上翻拍的。它要解决的真实问题是:基层医院的医生用手机拍下屏幕,能不能自动认出这是什么型号的心脏设备?

INFOBOX

属性 值
官方名称 Dataset for Segmentation and Classification of Cardiac Implantable Electronic Devices in Chest X-Rays
发布方 PhysioNet
版本 v1.0.0(2025-03-04 发布)
DOI 10.13026/swv0-cd11
RRID SCR_007345
机构 Charité – Universitätsmedizin Berlin(柏林夏里特大学医学院)
作者 Keno Bressem, Felix Busch, Andrei Zhukov, Lisa Adams
图像总数 13,393
正规胸片 2,321(DICOM→PNG,金标准)
手机翻拍 11,072
患者数 896
设备型号 27 个(4 家制造商);model 字段 28 类(含 Other)
手机机型 5 种(iPhone 13 mini / Galaxy S4 / iPhone 8 / iPhone 13 / Galaxy S5)
采集期 2012-01 至 2022-01(约十年)
标注工具 3D Slicer
标注者 2 位认证放射科医师(7-9 年经验)
掩码语义 0=背景 / 1=PM 或 ICD / 2=事件监测器
任务 设备分割 + 制造商分类 + 型号识别
划分 训练/验证/测试(患者级)
伦理 IRB 批准 EA4/042/20,知情同意豁免
COI None
关联论文 官方未列(仅方法学背景引用)
代码 github.com/AndreasZhukov/cied
适合任务 设备分割、型号分类、移动端识别、迁移学习

§0 速览与信任声明:为什么"认设备"是一个真问题

植入式心脏电子设备(CIED)包括起搏器、植入式除颤器(ICD)、心脏再同步治疗设备(CRT)与植入式心电事件监测器(ICM)。这些设备在胸片上都有可见的影像特征——但它们长得太像了。

三条速览结论:

  1. "认不出型号"有真实的临床后果。

    • MRI 安全性:不同型号的 MRI 兼容性不同,磁共振检查前必须确认设备型号。认错了可能导致严重伤害;
    • 设备召回:厂商召回针对特定型号批次,没有型号就无法判断患者是否受影响;
    • 程控与随访:不同型号的程控仪与参数不同;
    • 急诊场景:患者昏迷、无病历、只有一张胸片时,型号识别是第一道关卡。
  2. 这份数据集直面"真实场景的粗糙"。它不只提供干净的 DICOM 胸片,还提供了 11,072 张手机照片——用 5 种不同手机、从显示器上以不同角度拍摄、每张最多拍 5 次。这模拟的是基层医院的真实工作流:没有 PACS、没有 DICOM 工作站,医生拿手机拍下屏幕发给上级或上传系统。这是一个极少有数据集愿意面对的场景,因为手机翻拍会引入透视畸变、摩尔纹、反光、色彩偏移等一系列问题。

  3. 它把任务分成三层,而不是一个笼统的"分类":

    • 分割(像素级:设备在哪里)——三值掩码区分背景、PM/ICD、事件监测器;
    • 制造商分类(4 类:哪家厂商);
    • 型号识别(27 类:具体哪个型号)。

    这三层的难度差异巨大(4 分类 vs 27 分类),分开评测才看得出模型到底学到了什么。

必须立刻说清的边界:

  • 官方页面未声明访问级别与许可条款——这是一个必须警惕的规范缺失;
  • 官方未列正式关联论文,只有 7 条方法学背景参考文献(均无 DOI/PMID);
  • 单中心数据(柏林夏里特),且只覆盖 4 家大厂商;
  • 约 10% 图像归入 “Other” 类,稀有设备样本不足。

0.1 名称与范围勘误

  • CIED 的定义:Cardiac Implantable Electronic Device,心血管植入式电子设备。包含四类:
    • PM(Pacemaker):起搏器
    • ICD(Implantable Cardioverter-Defibrillator):植入式心脏复律除颤器
    • CRT(Cardiac Resynchronization Therapy):心脏再同步治疗设备(分 CRT-P 与 CRT-D)
    • ICM(Insertable Cardiac Monitor):植入式心电事件监测器,如 Reveal LINQ/XT、Confirm Rx、SJM Confirm
  • 掩码语义要注意:像素值 1 表示 PM 或 ICD 合并(不细分),2 表示 event monitor。也就是说分割任务只有三个类,不是四类或更多。
  • “event monitor” 与 ICM 同义:官方用 event monitor 一词,模型型号列表里对应的产品名是 Reveal LINQ、Reveal XT、Confirm Rx DM3500、SJM Confirm。

0.2 一分钟版本(给赶时间的管理者)

  • 这是什么:胸片中的心脏植入设备分割 + 识别数据集;
  • 谁做的:柏林夏里特大学医学院影像科;
  • 规模多大:896 名患者、13,393 张图像(2,321 张胸片 + 11,072 张手机翻拍);
  • 有多少种设备:4 家制造商、27 个型号;
  • 数据在哪:PhysioNet(DOI 10.13026/swv0-cd11);
  • 最亮的点:手机翻拍子集——直接对应"基层用手机拍屏幕识别设备"的真实需求;
  • 最大的坑:官方未声明许可条款;无正式关联论文;单中心;约 10% 归入 Other 类。

0.3 与本系列既有条目的关系

条目 关系
496 NIHSS 496 从文本抽结构化数值;499 从影像做分割与分类——两个"从非结构化到结构化"的平行案例
497 Health Gym 497 关注"数据可公开";499 关注"图像识别",但两者都面对"真实场景的粗糙"(合成失真 vs 手机翻拍失真)
498 浙江 EHR 498 是结构化 EHR;499 是影像——同一患者的两类数据在真实场景中并存(胸片 + 设备随访记录)
其他影像条目 499 是唯一的"设备/植入物识别"影像数据(区别于病灶/器官分割)

§1 背景:从"认出这个盒子"到"移动端床边识别"

1.1 CIED 的临床重要性

心血管植入式电子设备(CIED)是现代心脏病学的支柱。四类设备的适应症各不相同:

设备 全称 主要适应症
PM Pacemaker 起搏器 症状性心动过缓、传导阻滞
ICD Implantable Cardioverter-Defibrillator 心脏性猝死的一级/二级预防
CRT Cardiac Resynchronization Therapy 心衰合并心室失同步(CRT-P 不带除颤、CRT-D 带除颤)
ICM Insertable Cardiac Monitor 不明原因晕厥、房颤检测

设备数量巨大:以参考文献报告的数据,全球每年植入量以百万计(ICD 与 CRT 在美国每年数十万例)。这意味着任何医院的胸片库里都有大量 CIED 影像。

1.2 为什么"识别型号"是刚需

三个真实的临床场景:

场景一:MRI 检查前的安全确认
MRI 强磁场对 CIED 有潜在危险(导线发热、设备移位、程序紊乱)。虽然现代很多型号是 “MRI Conditional”(条件性兼容),但兼容性依型号而不同,且往往要求特定条件(如特定体位、限制 SAR 值)。放射科在安排 MRI 前必须确认设备型号。若患者无病历(如急诊、外院转入),只能靠胸片。

场景二:厂商召回
CIED 召回事件并不罕见(导线断裂、电池提前耗尽、固件缺陷)。召回通告通常针对特定型号甚至特定批次。若无法从影像确认型号,就无法判断患者是否受影响。

场景三:程控与随访
不同厂商、不同型号使用不同的程控仪与软件。识别型号是程控前的第一步。

1.3 为什么人工识别难

对非心电专科的放射科医师或急诊医师而言,区分 27 个型号极其困难:

  • 影像特征细微:设备轮廓相似(都是圆角矩形或椭圆形),区别在于尺寸、标记形状、导线接口位置的细节;
  • 投照条件影响:体位、曝光、设备与胶片的相对位置都会改变外观;
  • 型号繁多:仅本数据集就覆盖 4 厂商 27 型号,现实中更多;
  • 知识更新快:新机型不断上市;
  • 胸片质量参差:急诊床旁片、旋转体位、曝光不足等。

这正是计算机视觉应该介入的地方——它擅长捕捉人眼难以稳定分辨的细微纹理与形状差异。

1.4 已有研究基础

本数据集的参考文献中列出了几项前期工作,构成领域脉络:

研究 年份 贡献
Weinreich et al. 2019 用深度 CNN 在胸片上进行植入设备检测与识别
Howard et al. 2019 用神经网络识别心脏节律设备(JACC Clin Electrophysiol)
Kim et al. 2021 深度学习检测与表征 CIED 的 MRI 安全性(Korean J Radiol)
Lauzier et al. 2023 用半监督 AI 在大型胸片数据集中检测与识别 CIED(Heart Rhythm)

这些工作说明:"AI 识别 CIED"已是一个有积累的方向,但普遍缺少公开数据集。499 填补的正是这个空缺——它把数据开放出来,让不同方法可以公平比较。

1.5 为什么智能手机翻拍是关键增量

这是 499 最独特的设计。11,072 张手机照片全部是从显示器上翻拍的——不是打印胶片,不是原始 DICOM,而是对着一块亮着的屏幕拍照。

这个场景的真实性在哪里?

  • 基层医院:很多基层机构没有 PACS 终端,医生习惯对着屏幕用手机拍照,然后通过微信等渠道发送给上级医院或同事会诊;
  • 会诊与转诊:患者转院时,影像资料常以手机拍照形式传递;
  • 教学与讨论:临床病例讨论中,手机拍屏是常见的资料传递方式;
  • 远程医疗:移动医疗应用需要处理用户上传的手机照片。

为什么这个场景难?

失真类型 成因
透视畸变 手机与屏幕不平行
摩尔纹 相机传感器与屏幕像素阵列干涉
反光与眩光 屏幕表面的环境光反射
色彩偏移 屏幕色温与相机白平衡
分辨率损失 屏幕像素密度限制
边缘裁切 拍摄取景不全

这六类失真是数据增强难以完全模拟的——最好的办法就是真的拍。499 提供了真实的翻拍数据,使研究者可以:

  • 直接在手机上验证模型;
  • 研究"翻拍对性能的影响"(对比 originals 子集);
  • 做域适应研究(DICOM 域 → 手机域)。

更妙的是手机型号分布本身就是一个变量——5 种机型覆盖了从低端(Galaxy S4,2013 年)到当时的旗舰(iPhone 13,2021 年),跨越 8 年的手机影像技术差异。这使"机型对识别性能的影响"成为一个可研究的课题。

1.6 数据采集的时间与规模

  • 时间跨度:2012-01 至 2022-01,约十年;
  • 患者数:896;
  • 图像数:13,393。

从这些数字可以推算平均每人画像数:

  • 2,321 / 896 ≈ 2.6 张原始胸片/患者;
  • 11,072 / 2,321 ≈ 4.8 张手机照片/胸片(与"每张最多拍 5 次"的描述一致)。

这个比例设计很有讲究:每一张正规胸片配约 5 张不同手机、不同角度的翻拍。这样可以在"原始图 → 翻拍图"之间建立对应关系,支持成对研究。

1.7 团队与机构

  • 机构:Charité – Universitätsmedizin Berlin(柏林夏里特大学医学院)——欧洲最大的大学医院之一,医学影像研究实力强;
  • 作者:Keno Bressem(影像 AI 领域活跃研究者)、Felix Busch、Andrei Zhukov(代码仓库维护者)、Lisa Adams;
  • 伦理:IRB 批准 EA4/042/20,回顾性匿名化数据豁免知情同意。

1.8 数据的匿名化流程

499 的匿名化流程值得完整记录,因为它包含了烧录信息的处理:

  1. 稀有 CIED 类型归入不同类别(降低唯一性);
  2. 中心裁剪去除烧录的患者信息(胸片四角的文字层);
  3. OCR 算法涂黑残留信息;
  4. 人工复查并手动删除;
  5. 重新匹配并用随机新 ID 替换原 ID;
  6. 删除患者 ID、检查 ID 及所有标识符。

第 2-4 步特别重要:医学影像的烧录信息(burned-in annotation)是隐私泄露的常见途径——胸片角落常印有姓名、ID、日期。检测并移除它是影像去标识化的标准步骤,但OCR + 人工复核的组合是较可靠的做法(纯 OCR 会漏)。

1.9 这份数据的三个任务层级

层级 任务 类别数 难度
1 设备分割(像素级) 3(背景/PM-ICD/监测器) 中
2 制造商分类 4 较低
3 型号识别 27(+Other = 28) 高

为什么分层有意义:

  • 制造商分类相对容易(同一厂商的产品有家族相似性,如 Medtronic 的圆角矩形、Biotronik 的特定标记);
  • 型号识别很难(同厂商内不同型号的差异极细微);
  • 中间可能还有"设备类型"层级(PM/ICD/CRT/ICM),这是临床上最有意义的一层(决定 MRI 安全性与治疗功能),但官方未单列为分类标签——这是数据集的语义与官方 structured 标签之间的一个落差(掩码里只分了 PM/ICD 与 monitor)。

1.10 用户画像

用户类型 典型诉求 本数据集能提供
影像 AI 研究者 需要分割 + 分类的公开数据 13,393 张图像 + 三值掩码 + 两级分类标签
移动医疗工程师 需要真实手机拍摄的影像 11,072 张 5 机型翻拍图
心电生理医师 想验证 AI 能否辅助认设备 27 型号标签 + 患者级划分
域适应研究者 需要跨域配对数据 原始图 + 翻拍图成对
教学者 需要完整的影像 AI 案例 分割 + 分类双任务
医疗设备管理人员 关注召回与型号核对 型号识别任务 + 临床意义明确

1.11 使用前的三条提醒

  1. 先确认访问级别——官方页面未声明,PhysioNet 上的实际条款可能与其他数据集不同(存照 A);
  2. 不要期待官方论文——无正式关联论文,方法需要自行设计(存照 D);
  3. 注意掩码的可视化陷阱——8-bit PNG 中 0 与 2 对比度极小,肉眼看像全黑,必须用 numpy 读(存照 K)。

1.12 阅读本条的路线建议

  • 想判断能否用:读 §0.2 + §1.9 三个任务层级 + §3 规格;
  • 想装载数据:读 §5 装载与掩码读取(含像素值陷阱);
  • 想研究手机翻拍:读 §6.5 + §6.9 域适应;
  • 想了解设备类型:读 §2 领域概念;
  • 想找数字:读 INFOBOX、§4 划分、§10 存照。

§2 领域概念:CIED 设备、胸片影像与识别任务

2.1 四类设备的外观特征

设备类型 典型外形 影像特征 本数据集中的型号举例
PM(起搏器) 圆角矩形/椭圆,体积小 通常位于锁骨下区,1-2 条导线 Attesta DR、Enticos 4 DR、Q20 SR、Enticos 4 SR
ICD(除颤器) 比 PM 大,更厚 导线更粗(除颤线圈),有时可见 shock coil Mirro MRI VR、Ellipse VR、Ilivia 7 VR-T、Inogen EL ICD
CRT(再同步) 最大,常有三条导线 左室导线走冠状静脉窦,位置特殊 Serena Quad CRT-P、Compia MRI Quad CRT-D、Charisma X4、Quadra Allure
ICM(事件监测器) 极小,柱状/胶囊状 位于胸骨旁皮下,无导线入心 Reveal LINQ、Reveal XT、Confirm Rx DM3500、SJM Confirm

"型号识别"的难点在同类内部:同为 Medtronic 的双腔起搏器,Attesta DR 与 Ensura DR 的外观差异极小,区别可能在边缘倒角、标记位置等细节。

2.2 设备命名的密码

理解型号命名有助于理解数据集的类别体系:

字段 含义 例子
系列名 厂商起的商品名 Attesta, Enticos, Reveal
腔数 SR(单腔)/ DR(双腔) Enticos 4 DR vs Enticos 4 SR
功能 VR(心室除颤)/ HF(心衰/CRT) Ilivia 7 VR-T vs Ilivia 7 HF-T
代数 数字 Enticos 4, Q20
特性后缀 MRI SureScan(MRI 兼容)、QP(Quadripolar) Mirro MRI SureScan

“MRI SureScan” 是一个重要的标识——它表示该型号通过 MRI 兼容认证,这正是"识别型号"临床价值的直接来源。

2.3 胸片影像的基本解剖

要在胸片上找设备,需先理解胸片的结构:

结构 位置 与设备的关系
锁骨 上胸部两侧 设备常植于锁骨下
肺野 两侧大片透亮区 设备常位于肺野上外侧
心影 中央偏左的致密影 导线走向此处
纵隔 中央 导线路径
膈肌 下方弧形 参考标志

设备通常在:左或右锁骨下区(胸大肌下或皮下)。导线从设备出发,经锁骨下静脉、上腔静脉进入右心房/右心室(起搏器与 ICD),或经冠状静脉窦到左心室(CRT 的左室导线)。

2.4 分割任务的语义

499 的分割掩码只有三个像素值:

像素值 语义 说明
0 背景 除设备外的所有区域
1 PM 或 ICD 合并:起搏器与除颤器不细分
2 事件监测器 event monitor / ICM

为什么 PM 与 ICD 合并?
合理推测:两者的影像特征(矩形/椭圆主体 + 导线)在分割任务上相似,且临床上都属于"有导线的植入设备";而 ICM 是无导线的胶囊状物,形态差异明显,值得单列。

这个设计的含义:分割任务实际上是"找出所有设备 + 区分有无导线"——比"区分四类设备"简单,但已能满足"设备在哪里"的需求。

2.5 掩码的可视化陷阱(必须知道的实操细节)

官方明确提示:PNG 为 8-bit,像素值 0 与 2 的差异在肉眼看来几乎不可见。

原因:

  • 0 = 纯黑(RGB 0,0,0);
  • 2 = 极暗灰(RGB 2,2,2);
  • 在 0-255 的灰度范围里,2 与 0 的差异是 0.8%——人眼完全无法分辨。

后果:

  • 用图片查看器打开掩码,看到的是"全黑图";
  • 会误以为掩码是空的或生成失败;
  • 只有像素值 1(RGB 1,1,1)稍微亮一点点,同样几乎不可见。

正确读法:

import numpy as np
from PIL import Image

mask = np.array(Image.open('seg_masks/xxx.png'))
print(np.unique(mask))          # [0 1 2]
print((mask == 1).sum())        # 设备像素数
print((mask == 2).sum())        # 监测器像素数

# 可视化:重映射为可见颜色
vis = np.zeros((*mask.shape, 3), dtype=np.uint8)
vis[mask == 0] = [0, 0, 0]       # 背景黑
vis[mask == 1] = [255, 80, 80]   # 设备红
vis[mask == 2] = [80, 160, 255]  # 监测器蓝

这个陷阱值得单列一节,因为它是使用者第一分钟就会遇到的挫败点——看到一个"全黑的掩码"然后怀疑数据有问题。

2.6 手机翻拍的六类失真

失真 成因 对识别的影响
透视畸变 手机与屏幕不平行 设备形状变形
摩尔纹 传感器与屏幕像素干涉 引入周期性纹理噪声
反光眩光 环境光在屏幕反射 局部区域过曝、细节丢失
色彩偏移 屏幕色温 + 白平衡 灰度关系改变
分辨率损失 屏幕像素密度限制 细节模糊
边缘裁切 取景不全 设备可能被部分截断

注意第六条的严重性:如果取景时裁掉了一部分设备,那么分割任务的目标就不完整——这可能是翻拍子集的分割性能低于 originals 子集的原因之一。

2.7 域与域适应

在 499 的语境中,"域"有两个:

  • 源域(source domain):正规胸片(originals);
  • 目标域(target domain):手机翻拍图。

理想的应用是"在源域训练、在目标域工作"(因为标注只在源域可靠)。但域差异会导致性能下降。常用的域适应方法:

方法 思路
数据增强 模拟翻拍失真(透视变换、噪声、模糊)
风格迁移 把源域图像转为目标域风格
对抗域适应 用对抗训练对齐两域的特征分布
自监督预训练 在目标域无标注数据上预训练
测试时适应 推理时根据目标样本调整模型

499 的独特价值:它提供成对的源域与目标域数据(每张原始图配约 5 张翻拍图),使域适应研究可以直接量化"域差异有多大"。

2.8 类别不平衡与 “Other”

从划分表可以看出严重的不平衡:

型号 图像数
Q20 SR MRI SureScan 342
Attesta DR MRI SureScan 263
Mirro MRI VR SureScan 237
Confirm Rx DM3500 137
Enticos 4 DR 111
… …
Etrinsa 8 HF-T 22
Ilivia 7 HF-T QP 22
Enitra 6 DR-T 20
SJM Confirm 26

最多 342 vs 最少 20,相差 17 倍。这对 27 类分类是显著挑战:

  • 稀有类别的召回可能极低;
  • 模型可能倾向预测高频类;
  • 必须报 per-class 指标(不能只报总体准确率)。

此外,“Other” 类是四家厂商各自的兜底类(Medtronic 84、Biotronik 93、Abbott 18、Boston Scientific 39,合计 234),占 2,321 张原始图的约 10%。这类样本本质上是异构的(包含了各种稀有型号),它既难学也难评测——“Other” 内部没有共同特征。

2.9 患者级划分的意义

data.json 的 pat_id 明示是"用于划分数据"。这意味着划分是患者级的——同一患者的所有图像(原始 + 翻拍)都在同一个集合里。

这是正确且必要的做法:

  • 若同一患者的图像跨越训练/测试集,模型可能记住该患者的特征(如设备位置、体型)而非学会识别型号;
  • 尤其是同一张原始图与其 5 张翻拍图若分处训练与测试,会造成严重的"近重复泄漏"。

499 在划分上做了正确的事,这一点值得肯定(虽然官方未明示各集合的患者数,存照 J)。

2.10 任务评价指标

任务 主指标 说明
分割 Dice 系数 / IoU per-class,注意类别极不平衡(背景占绝大多数像素)
制造商分类 准确率 + 混淆矩阵 4 类,相对平衡
型号识别 macro-F1 + per-class F1 27-28 类,严重不平衡,macro-F1 优先
分割+分类端到端 型号识别的 macro-F1 最终目标

为什么型号识别要用 macro-F1:因为类别不平衡时,accuracy 会被高频类主导。macro-F1 对每个类等权,更能反映"对小类的识别能力"——而临床上的罕见型号恰恰是最需要识别的(召回通知中的设备往往是小众型号)。

2.11 名词速查表

缩写/术语 全称 含义
CIED Cardiac Implantable Electronic Device 心血管植入式电子设备(总称)
PM Pacemaker 起搏器
ICD Implantable Cardioverter-Defibrillator 植入式心脏复律除颤器
CRT Cardiac Resynchronization Therapy 心脏再同步治疗(CRT-P 不带除颤,CRT-D 带)
ICM Insertable Cardiac Monitor 植入式心电事件监测器
SR / DR Single / Dual chamber 单腔 / 双腔
VR / HF Ventricular / Heart Failure 心室(除颤)/ 心衰(CRT 功能)
QP Quadripolar 四极导线
MRI SureScan — 厂商的 MRI 兼容认证标识
DICOM Digital Imaging and Communications in Medicine 医学影像标准格式
Dice Dice Similarity Coefficient 分割评价指标(2×交集/并集)
IoU Intersection over Union 交并比
IRB Institutional Review Board 机构审查委员会
SAR Specific Absorption Rate 比吸收率(MRI 安全参数)
OCR Optical Character Recognition 光学字符识别(用于涂黑烧录信息)

2.12 一个必须澄清的误解

误解:「13,393 张图像,那这个数据集挺大的。」

澄清:要分清图像数与独立样本数。

  • 13,393 张图像对应 896 名患者;
  • 其中只有 2,321 张是独立的原始胸片(每患者平均 2.6 张);
  • 另外 11,072 张是这些胸片的翻拍副本,不提供新的患者信息。

因此:

  • 用于训练:13,393 张都有用(增强数据多样性,尤其学"翻拍失真");
  • 用于评测泛化:有效的独立样本量接近 2,321(甚至 896 患者);
  • 报告的测试集性能,其统计置信区间应按患者数(896)而非图像数计算。

这个区分至关重要——把翻拍图当独立样本会严重低估性能的不确定性。

§3 数据规格与获取:目录结构、元数据与像素级掩码

3.1 目录结构

.
├── README.md              # 数据说明
├── originals/             # 2,321 张正规胸片(DICOM→PNG,金标准)
├── galaxys4/              # 1,675 张三星 Galaxy S4 翻拍
├── galaxys5/              # 2,910 张三星 Galaxy S5 翻拍
├── iphone8/               # 2,890 张 iPhone 8 翻拍
├── iphone13/              # 2,902 张 iPhone 13 翻拍
├── iphone13mini/          #   695 张 iPhone 13 mini 翻拍
├── seg_masks/             # 分割掩码(PNG,像素值 0/1/2)
└── data.json              # 元数据(pat_id / fname / dataset / manufacturer / model / seg_mask)

3.2 五个手机目录的分布与含义

目录 机型 张数 占比 发布年 影像特性
galaxys4 Samsung Galaxy S4 1,675 12.5% 2013 低端、低分辨率
galaxys5 Samsung Galaxy S5 2,910 21.7% 2014 中端
iphone8 iPhone 8 2,890 21.5% 2017 中高端
iphone13 iPhone 13 2,902 21.6% 2021 旗舰
iphone13mini iPhone 13 mini 695 5.2% 2021 旗舰小屏

这个分布本身是一个实验设计:机型跨越 2013-2021 共 8 年,覆盖低端到旗舰。这使"机型质量对识别性能的影响"成为可研究的课题——预期低端机(Galaxy S4)的翻拍质量更差,模型的识别性能可能更低。

注意 iPhone 13 mini 只有 695 张(5.2%),明显少于其他四款(均约 2,000-2,900)。这个不均衡可能反映拍摄计划的安排,也可能反映某批数据未纳入。使用时若做"按机型分层评测",mini 的样本量偏少。

3.3 data.json 的六个字段

字段 类型 语义 用途
pat_id string 匿名患者 ID 患者级划分、跨图像关联
fname string 图像文件名(SHA256 样式哈希) 主键
dataset enum 来源目录名 域标识(originals vs 手机)
manufacturer enum 制造商(4 类) 制造商分类标签
model enum 型号(27 + Other) 型号识别标签
seg_mask string 对应掩码文件名 分割监督

fname 使用哈希命名(如 fe40d960c739bbbd3002d1759155bad92d3818b5ec88e459117e64c6df2a0fb2.png)——这是去标识化的一部分:文件名不含患者信息、不含日期、不暗示顺序。

3.4 从 dataset 字段能做的分层分析

dataset 字段天然定义了六个子集,可支持多种分析:

分析 方法
域对比 originals vs 所有手机目录
机型对比 五个手机目录两两比较
时代对比 Galaxy S4/S5(2013-14)vs iPhone 13 系列(2021)
平台对比 三星 vs 苹果
增强效果 用手机图训练 → 测 originals(反向域适应)

3.5 分割掩码的技术规格

项 值
格式 PNG(8-bit)
颜色 单通道灰度(0/1/2)
命名 与对应原图同名(推测)
数值语义 0=背景,1=PM/ICD,2=event monitor

关键实操提示(重复强调):0 与 2 的视觉差异是 0/255 vs 2/255,肉眼不可辨。必须用 numpy 读取。

3.6 访问获取与前置确认

步骤 动作 备注
1 访问 PhysioNet 页面 /content/cardiac-implantable-device-cxr/1.0.0/ —
2 确认访问级别与许可条款 页面未声明,须在下载页实际确认(存照 A/B)
3 接受条款并下载 —
4 校验文件完整性 官方未提供 MD5(与 498 不同)

第 2 步是本数据集特有的必备步骤。因为官方页面未在正文中声明访问级别,使用者不能假设它是 Open Access——必须到 PhysioNet 的下载界面查看实际条款。

3.7 引用要求

层级 引用对象
数据集 Bressem K, Busch F, Zhukov A, Adams L. PhysioNet. 2025. DOI 10.13026/swv0-cd11
代码 github.com/AndreasZhukov/cied
平台 Pollard T, et al. Nature Health. 2026. DOI 10.1038/s44360-026-00096-z
背景方法(建议) Howard et al. 2019;Lauzier et al. 2023

注意:官方未提供关联论文,因此"引用数据集 + 引用代码仓库 + 引用平台"是主要的引用路径。

3.8 版本锚定

锚点 值
数据集版本 v1.0.0
数据集 DOI 10.13026/swv0-cd11
发布日期 2025-03-04
机构 Charité – Universitätsmedizin Berlin
代码仓库 github.com/AndreasZhukov/cied
IRB EA4/042/20

3.9 数据对账清单

下载后逐项验证:

  • [ ] 七个图像目录存在(originals + 五个手机目录 + seg_masks);
  • [ ] originals 下图像数为 2,321;
  • [ ] 五个手机目录合计 11,072;
  • [ ] 图像总数 13,393;
  • [ ] data.json 可解析,含 6 个字段;
  • [ ] data.json 中 pat_id 唯一值数为 896;
  • [ ] manufacturer 有 4 个取值;
  • [ ] model 有 28 个取值(27 型号 + Other);
  • [ ] seg_masks 数量与 originals 数量一致(推测)或与有掩码的图一致;
  • [ ] 抽样读取掩码,np.unique 返回 [0 1 2] 的子集。

最后一条是最关键的——它验证了掩码可用(而不是全 0 的空图)。

3.10 与 498 的规范对比

项 498 浙江 EHR 499 CIED
格式 CSV PNG(图像)+ JSON(元数据)
完整性校验 提供 MD5 未提供
访问级别 明示开放获取 未声明
许可条款 未列具体协议 未列
关联论文 有(Sci Data 2023) 无
数据量 3.22 GB 图像数多,体积视分辨率而定
划分 未提供 提供(患者级)

一个有意思的互补:498 在许可与论文上更规范但缺划分;499 提供了划分但缺许可声明与论文。两者各自补上了对方的短板——这提醒我们:没有一份数据是完美的,使用前必须逐项核查。

3.11 DAIMS 评估:6.2 / 8

维度 评分 依据
文档完备性 0.7 官方页面给足规模、划分明细表、标注协议、伦理;但缺访问级别、许可、资助、论文
机器可读性 0.7 PNG 图像 + JSON 元数据,标准格式;但掩码的可视化陷阱增加使用成本
标签质量透明度 0.9 标注者资质(2 位放射科医师,7-9 年经验)、工具(3D Slicer)、掩码语义全部公开;缺掩码张数
可访问性 0.6 访问级别未声明,使用前需确认;但已发布于 PhysioNet
许可清晰度 0.2 未声明具体许可条款,是本条目最大短板
格式标准化 0.9 PNG + JSON 均为标准格式;文件名哈希化规范
评测协议完备性 1.0 提供完整的患者级训练/验证/测试划分与逐型号明细,这是最强项
生态可持续性 0.6 有 GitHub 代码仓库,但无正式关联论文,学术沉淀较弱
合计 6.2 / 8 评测协议与标签透明度是标杆;许可清晰度与生态是短板

对比同系列:498(6.7)> 496(6.4)> 497(6.3)> 499(6.2)。499 得分最低的唯一原因是许可条款未声明——这是一个可以通过官方补充轻易修复的短板。

3.12 元数据速查

字段 值
Title Dataset for Segmentation and Classification of Cardiac Implantable Electronic Devices in Chest X-Rays
Version 1.0.0
Published 2025-03-04
DOI 10.13026/swv0-cd11
RRID SCR_007345
Authors Keno Bressem; Felix Busch; Andrei Zhukov; Lisa Adams
Institution Charité - Universitätsmedizin Berlin
Code github.com/AndreasZhukov/cied
IRB EA4/042/20

§4 数据结构与划分:27 个型号的全景

4.1 四家制造商的规模与格局

制造商 图像数 占比 型号数(含 Other)
Medtronic 1,218 52.5% 9
Biotronik 517 22.3% 11
Abbott(含 St. Jude Medical) 401 17.3% 6
Boston Scientific 185 8.0% 5
合计 2,321 100% 27 + 4 Other

Medtronic 一家占了 52.5%——超过一半。这个不平衡有三个含义:

  1. 反映真实植入量:Medtronic 是全球最大的 CIED 厂商之一,市占率高;
  2. 对分类的影响:制造商分类任务基线(全猜 Medtronic)能得 52.5% 准确率——因此必须报 macro 指标;
  3. 对型号识别的影响:Medtronic 内部 9 个型号的区分成为主要挑战。

4.2 各厂商的型号明细与设备类型

Medtronic(1,218 张):

型号 Total 设备类型
Q20 SR MRI SureScan 342 单腔 PM
Attesta DR MRI SureScan 263 双腔 PM
Mirro MRI VR SureScan 237 单腔 ICD
Reveal LINQ 94 ICM
Serena Quad CRT-P MRI SureScan 77 CRT-P
Compia MRI Quad CRT-D SureScan 51 CRT-D
Ensura DR MRI SureScan 39 双腔 PM
Reveal XT 31 ICM
Other 84 —

Biotronik(517 张):

型号 Total 设备类型
Enticos 4 DR 111 双腔 PM
Enitra 8 HF-T QP 79 CRT-P
Enticos 4 SR 48 单腔 PM
Ilivia 7 VR-T 34 单腔 ICD
Rivacor 5 VR-T DX 34 单腔 ICD
Ecuro SR-T 29 单腔 ICD
Rivacor 7 HF-T QP 25 CRT-D
Ilivia 7 HF-T QP 22 CRT-D
Etrinsa 8 HF-T 22 CRT-P
Enitra 6 DR-T 20 双腔 PM
Other 93 —

Abbott / St. Jude Medical(401 张):

型号 Total 设备类型
Confirm Rx DM3500 137 ICM
Ellipse VR 97 单腔 ICD
Quadra Allure MP 84 CRT-P
Quadra Assura MP 39 CRT-D
SJM Confirm 26 ICM
Other 18 —

Boston Scientific(185 张):

型号 Total 设备类型
Charisma X4 CRT-D 64 CRT-D
Valitude X4 CRT-P 32 CRT-P
Inogen EL ICD VR 27 单腔 ICD
Origen Mini ICD 23 单腔 ICD
Other 39 —

4.3 设备类型维度的重构

把 27 个型号按设备类型重新归类,得到一个更临床的视角:

设备类型 涉及型号 图像数(估)
单腔 PM(SR) Q20 SR、Enticos 4 SR ~390
双腔 PM(DR) Attesta DR、Ensura DR、Enticos 4 DR、Enitra 6 DR-T ~433
单腔 ICD(VR) Mirro MRI VR、Ellipse VR、Ilivia 7 VR-T、Rivacor 5 VR-T DX、Ecuro SR-T、Inogen EL ICD VR、Origen Mini ICD ~511
CRT-P Serena Quad、Enitra 8 HF-T QP、Quadra Allure MP、Valitude X4、Etrinsa 8 HF-T ~294
CRT-D Compia Quad、Ilivia 7 HF-T QP、Rivacor 7 HF-T QP、Quadra Assura MP、Charisma X4 ~201
ICM Reveal LINQ、Reveal XT、Confirm Rx、SJM Confirm ~288
Other 各厂商兜底 ~234

这个重构很有价值:虽然官方未提供"设备类型"标签,但可以从型号名派生。派生后的类型标签在临床上更有意义(MRI 安全性、治疗功能),且类别更平衡(6-7 类 vs 27 类),可以作为中间任务来辅助型号识别(层次分类:先分类型、再分型号)。

4.4 划分的完整数字

制造商 总计 训练 验证 测试
Medtronic 1,218 849 240 129
Biotronik 517 373 77 67
Abbott 401 279 78 44
Boston Scientific 185 124 35 26
合计 2,321 1,796 464 295

验证比例:1,796 / 464 / 295 ≈ 70% / 18% / 11%。

测试集只有 295 张图像——这是评测的关键约束:

  • 27 类上平均每类约 11 张测试图;
  • 稀有型号可能只有 1-2 张(如 SJM Confirm 测试集仅 1 张);
  • 单张测试样本的 F1 波动极大——一个样本预测对错就改变一个类的 F1 从 0 到 1。

这意味着:报告的 per-class F1 在稀有类上不稳定,应报告置信区间或用 bootstrap 估计。

4.5 患者级划分的证据与含义

官方描述 pat_id 用于划分数据,这确认了划分的患者级性。但未给出各集合的患者数(存照 J)。

实际影响:若 896 名患者按 70/18/11 比例划分,大约是 627 / 161 / 108 名患者。测试集约 108 名患者承载 295 张图。

为什么这在统计上重要:模型性能的真实不确定性取决于独立患者数而非图像数。295 张图若来自 108 名患者,则有效样本量的上限是 108 而非 295。

4.6 型号的命名学分析

从型号名可以读出丰富的产品信息:

后缀 含义 出现次数
MRI SureScan MRI 兼容认证 6 个型号(多为 Medtronic)
DR / SR 双腔 / 单腔 6 个型号
VR-T / HF-T 心室除颤 / 心衰(CRT) 7 个型号
QP 四极导线 3 个型号
Quad 四极 4 个型号

“MRI SureScan” 值得特别注意:这是 Medtronic 的 MRI 兼容标识,出现 6 次(几乎全部 Medtronic 型号)。若模型学到了"M 家的多数型号是 MRI 兼容",那么型号识别可以间接推断 MRI 安全性——这正是这个任务临床价值的体现。

4.7 血缘关系图

Charité – Universitätsmedizin Berlin 影像科
   2012-01 至 2022-01,896 名 CIED 患者
        │
        │ 采集正规胸片(DICOM)
        ▼
   2,321 张原始胸片
        │
        ├──→ DICOM→PNG 转换 → originals/
        │
        └──→ 从显示器翻拍(5 种机型,最多 5 次/张)
                 ▼
            11,072 张手机照片(galaxys4/5, iphone8/13/13mini)
        │
        │ 标注(2 位放射科医师,3D Slicer)
        ▼
   分割掩码(seg_masks,像素值 0/1/2)
        │
        │ 匿名化(中心裁剪 + OCR + 人工复核 + 随机 ID)
        ▼
   PhysioNet v1.0.0(2025-03-04)+ data.json

4.8 与 496 的"任务结构"对照

维度 496 NIHSS 499 CIED
输入模态 文本(出院小结) 影像(胸片 / 手机照片)
标注层级 实体 + 关系 像素掩码 + 类别标签
任务数 2(NER + RE) 3(分割 + 制造商 + 型号)
类别数 15 个条目 + 分数值 3(分割)/ 4 / 27
划分 提供(220/92) 提供(1,796/464/295)
规模小 312 患者 896 患者
共同点 都是"从原始记录到结构化输出"的标注语料 同左

两者都是"小规模、高专业度、有人工标注"的资源,只是一个在文本上一个在影像。

§5 装载、掩码处理与评测协议

5.1 最小装载路径

import json, numpy as np
from PIL import Image
import pandas as pd

meta = pd.DataFrame(json.load(open('data.json')))
print(meta.shape)                     # (13393, 6)
print(meta['pat_id'].nunique())       # 896
print(meta['manufacturer'].value_counts())
print(meta['model'].nunique())        # 28
print(meta['dataset'].value_counts())

# 载入一张原图与其掩码
row = meta[meta['dataset'] == 'originals'].iloc[0]
img  = np.array(Image.open(f"originals/{row['fname']}"))
mask = np.array(Image.open(f"seg_masks/{row['seg_mask']}"))
print(img.shape, mask.shape)
print(np.unique(mask))                # [0 1 2] 的子集

5.2 掩码的正确读取与可视化

def load_mask(path):
    m = np.array(Image.open(path))
    assert m.ndim == 2 or m.shape[2] == 1, "掩码应为单通道"
    if m.ndim == 3:
        m = m[..., 0]
    return m.astype(np.uint8)

def mask_stats(m):
    total = m.size
    return {
        'bg':        (m == 0).sum() / total,
        'device':    (m == 1).sum() / total,   # PM / ICD
        'monitor':   (m == 2).sum() / total,   # event monitor
    }

def visualize(m):
    vis = np.zeros((*m.shape, 3), dtype=np.uint8)
    vis[m == 0] = [10, 10, 14]
    vis[m == 1] = [255, 90, 90]
    vis[m == 2] = [90, 170, 255]
    return vis

注意 mask_stats 的一个用途:设备像素占比通常在0.1%-2% 之间(设备相对整张胸片很小)。如果统计出占比很高(如 20%),说明掩码有问题或读取错误。

5.3 分割任务的基线

# Dice 系数(per-class,忽略背景或包含背景需明确说明)
def dice(pred, target, cls):
    p = (pred == cls); t = (target == cls)
    inter = (p & t).sum()
    return 2 * inter / (p.sum() + t.sum() + 1e-8)

分割评测的两个常见错误:

  1. 包含背景计算 Dice——背景占 98%+ 像素,会让 Dice 虚高到 0.98+,掩盖设备分割的真实性能。应报告前景类(1 与 2)的 Dice;
  2. 不做 per-class 报告——类别 2(event monitor)的样本远少于类别 1(PM/ICD),合并报告会掩盖类 2 的差性能。

5.4 分类任务的分层评测

from sklearn.metrics import classification_report, confusion_matrix

# 制造商分类
print(classification_report(y_true_mfr, y_pred_mfr, digits=3))

# 型号识别(macro-F1 是关键)
print(classification_report(y_true_model, y_pred_model,
                            digits=3, zero_division=0))

必须报告的三件事:

  1. macro-F1(每个类等权);
  2. per-class F1 表(暴露稀有类的表现);
  3. 混淆矩阵(分析哪些型号被混淆——通常是同厂商同类型的型号)。

5.5 按机型分层的评测(499 的特色)

for ds in ['iphone13', 'iphone8', 'galaxys5', 'galaxys4', 'iphone13mini']:
    sub = test[test['dataset'] == ds]
    if len(sub) == 0:
        continue
    print(ds, len(sub), macro_f1(sub))

这个分析能回答:机型质量对识别性能的影响有多大。预期低端机(Galaxy S4)性能更低——若结果如此,则"基层医院用旧手机拍屏"的场景需要专门的模型优化。

5.6 域适应实验设计

499 提供了理想的域适应实验材料:

实验 训练 测试 回答的问题
A originals originals 上限性能(同域)
B originals 手机图 域差异的实际代价
C 手机图 手机图 同域但质量低
D originals + 手机图 手机图 混合训练的效果
E originals(增强模拟) 手机图 增强能否替代真实翻拍

实验 B 与 E 的对比特别有价值:它回答"用数据增强模拟翻拍失真,能否达到用真实翻拍数据训练的效果"。如果 E 接近 B,则说明可以省去真实翻拍的成本;如果 E 远差于 B,则说明真实翻拍数据不可替代——这是 499 存在的核心辩护。

5.7 患者级评测的重要性

由于划分是患者级,评测时要注意:

  • 不要把同一患者的图像分到不同批次做"多次评测"(会夸大置信度);
  • 报告性能时应按患者聚合(如"每患者的平均预测正确率"),而非按图像;
  • 置信区间按患者数(约 108)估计,而非图像数(295)。

5.8 层次分类的设计建议

面对 27 类的不平衡,层次分类是有效的策略:

Level 1: 制造商(4 类)
   └─ Level 2: 设备类型(PM/ICD/CRT-P/CRT-D/ICM,约 6 类)
        └─ Level 3: 具体型号(厂商 × 类型内的型号)

优势:

  • 每层内类别更少,样本更平衡;
  • 每层的错误可归因(是厂商分错还是型号分错);
  • 与临床决策链对齐(先确定厂商 → 再确定功能类型 → 再确定型号)。

劣势:误差逐层传播(与 496 的两步管线同理)。

5.9 常见错误黑名单

  • ❌ 用图片查看器看掩码,以为它是空的(存照 K);
  • ❌ 包含背景计算 Dice(虚高);
  • ❌ 只报 accuracy,不报 macro-F1(被 Medtronic 主导);
  • ❌ 把翻拍图当独立样本估计置信区间(高估精度);
  • ❌ 忽略 “Other” 类(它占约 10%);
  • ❌ 把手机图的标签当作"从手机图识别出的标签"(标签源自 originals 的金标准);
  • ❌ 跨患者划分(会泄漏近重复图像);
  • ❌ 声称模型可用于临床决策(单中心、无前瞻验证)。

5.10 与 498、496 的联合研究设计

联合 设计
499 + 498 影像特征(设备型号)+ 结构化随访数据的关联研究(若患者可匹配则更佳,但跨库患者不可匹配)
499 + 496 方法对照:496 的"两步管线"(NER → RE)对应 499 的"层次分类"(类型 → 型号)
499 + 497 合成失真(497 是数值)vs 真实翻拍失真(499 是影像)——两种"数据质量退化"的对照

5.11 部署形态

场景 可行性
移动端 App 辅助识别 ✅ 数据本身就是为这个场景设计的
医院 PACS 集成 ✅ 用 originals 子集训练
基层远程会诊 ✅ 用翻拍子集训练
临床决策 ❌ 需前瞻验证与监管审批
设备召回筛查 ⚠️ 可辅助,但需人工复核

5.12 复现包清单

发表基于 499 的研究时建议附带:

  • [ ] 数据集版本与 DOI;
  • [ ] data.json 的处理脚本;
  • [ ] 掩码读取与可视化代码(避免他人踩坑);
  • [ ] 划分脚本(使用官方 pat_id 划分);
  • [ ] 模型架构与超参;
  • [ ] per-class 指标与混淆矩阵;
  • [ ] 按机型分层的评测结果;
  • [ ] 环境依赖。

特别建议公开掩码的可视化工具——这是每个使用者都会卡住的地方(存照 K)。

§6 实证基座:13,393 张图像背后的数字

6.1 三个层级的样本量

理解 499 的数字,必须同时看三个量级:

层级 数量 含义
图像数 13,393 训练时可用的总样本
独立影像数 2,321 原始胸片,每张对应一个真实影像学观察
患者数 896 统计推断的基本单位

这三个数字的比值是理解数据集的钥匙:

  • 13,393 / 2,321 ≈ 5.8(每张原图平均产出约 5.8 张翻拍图,与"最多 5 次"的拍摄计划相符);
  • 2,321 / 896 ≈ 2.6(每名患者平均有 2.6 张胸片)。

6.2 为什么"5.8 倍"的膨胀不等于"5.8 倍的信息"

这是 499 最容易误读的地方。把 11,072 张翻拍图当作独立样本会犯两个错误:

错误一:高估数据规模
翻拍图是同一张胸片在不同失真下的版本——它们共享完全相同的临床内容(同一设备、同一患者、同一影像)。模型从中学到的是"翻拍失真下的不变性",而非新的设备特征。

错误二:低估性能的不确定性
如果测试集有 295 张图但只来自 108 名患者,那么性能的真实方差应按 108 计算。按 295 计算会得到一个过窄的置信区间——报告的结果看起来比实际更可靠。

6.3 制造商分布的现实性

制造商 图像数 占比
Medtronic 1,218 52.5%
Biotronik 517 22.3%
Abbott 401 17.3%
Boston Scientific 185 8.0%

Medtronic 超过一半。这与全球 CIED 市场的实际格局大致相符(Medtronic 长期是市场份额第一)。

对评测的影响:

  • 制造商分类的"全猜 Medtronic"基线是 52.5%;
  • 因此报告 accuracy 时,必须与这个基线对照;
  • 更有意义的是 macro-F1 与 balanced accuracy。

若是临床部署:这个分布意味着模型在 Medtronic 设备上有更多训练样本,性能可能更好;而 Boston Scientific(8%)的设备识别可能更差——这是一种来自数据分布的隐性偏差。

6.4 型号不平衡的量化

Top 5 与 Bottom 5 的对比:

排名 型号 图像数
1 Q20 SR MRI SureScan 342
2 Attesta DR MRI SureScan 263
3 Mirro MRI VR SureScan 237
4 Confirm Rx DM3500 137
5 Enticos 4 DR 111
… … …
末 5 SJM Confirm 26
末 4 Rivacor 7 HF-T QP 25
末 3 Origen Mini ICD 23
末 2 Etrinsa 8 HF-T 22
末 1 Ilivia 7 HF-T QP 22

最高 342 vs 最低 22,相差 15.5 倍。

这个不平衡的临床含义:稀有型号恰恰可能是召回的对象(因为样本少说明植入量少,而小批量产品的质量风险不低)。因此**"对小类的识别能力"比"总体准确率"更接近临床价值**。

6.5 手机机型的分布与实验价值

机型 张数 占比 发布年 定位
Galaxy S4 1,675 12.5% 2013 低端旧机
Galaxy S5 2,910 21.7% 2014 中端旧机
iPhone 8 2,890 21.5% 2017 中高端
iPhone 13 2,902 21.6% 2021 旗舰
iPhone 13 mini 695 5.2% 2021 旗舰小屏

四款机型约 2,900 张(S5/iPhone8/iPhone13),Galaxy S4 稍少(1,675),iPhone 13 mini 明显少(695)。

这个分布支持的可研究问题:

  1. 时代效应:2013 年的 Galaxy S4 vs 2021 年的 iPhone 13——8 年手机影像技术进步是否显著提升识别性能?
  2. 平台效应:三星 vs 苹果,成像算法(锐化、色偏)差异是否影响模型?
  3. 屏幕尺寸效应:iPhone 13 mini(小屏)是否因单张画面信息更少而性能更低?
  4. 最坏情况:只在 Galaxy S4 上测,性能下限是多少?(对基层场景有直接意义)

6.6 划分的三个数字与统计约束

集合 图像数 占比 估计患者数*
训练 1,796 77.4% ~627
验证 464 20.0% ~161
测试 295 12.7% ~108

(*患者数为按比例推算,官方未公布;注意占比合计超过 100% 是因为分母口径——训练/验证/测试的比例约为 70/18/11。)

测试集 295 张 / 27 类 ≈ 每类 11 张。

稀有类的测试样本可能是 1-5 张:

型号 测试数
SJM Confirm 1
Quadra Assura MP 6
Ilivia 7 HF-T QP 2
Enitra 6 DR-T 2
Rivacor 7 HF-T QP 5

SJM Confirm 只有 1 张测试图——这意味着该型号的 F1 只有 0 或 1 两种可能,毫无统计意义。报告 per-class F1 时必须标注每类的测试样本数,否则读者会误以为 0.0 或 1.0 是可靠估计。

6.7 “MRI SureScan” 的分布与临床推断

从型号名可以数出 MRI 兼容标识的出现:

制造商 MRI SureScan 型号数
Medtronic 6(Attesta DR、Mirro VR、Serena Quad CRT-P、Compia Quad CRT-D、Ensura DR、Q20 SR)
其他厂商 0(Biotronik 用 “ProMRI” 等不同商标,Abbott/BSC 未在型号名中体现)

这是一个重要的数据特征:MRI 兼容标识不对称地集中在 Medtronic 型号名中。

后果:

  • 模型可能学到"M 家 = MRI 兼容"的捷径(spurious correlation);
  • 但这在临床上恰好是正确的(Medtronic 的 SureScan 系列确实通过 MRI 兼容认证);
  • 因此模型可以间接推断 MRI 安全性——这是有益的捷径,而非有害的偏差。

这个案例很好地说明了:捷径学习(shortcut learning)不总是坏事,取决于捷径与真实目标是否对齐。

6.8 设备类型分布的重构统计

把 27 型号映射到设备类型后:

设备类型 估计图像数 占比
单腔 PM ~390 16.8%
双腔 PM ~433 18.7%
单腔 ICD ~511 22.0%
CRT-P ~294 12.7%
CRT-D ~201 8.7%
ICM ~288 12.4%
Other ~234 10.1%

(基于型号明细表估算,含 Other 分配的不确定性。)

这个重构使类别从 27 类降到 ~7 类,且分布更平衡(最大 22% vs 最小 8.7%)。这对建模很有价值——先做类型分类(易),再做型号分类(难),可以提升整体性能与可解释性。

6.9 域差异的量化预期

虽然官方未报告"域差异有多大",但可以合理预期:

对比 预期性能变化
originals → originals 最优(同域)
originals → 手机图(同机型) 明显下降
originals → 手机图(低端机) 下降更多
手机图 → 手机图 中等(同域但质量受限)
originals + 手机图 → 手机图 接近同域水平

这些预期是 499 使用者应自行验证的核心问题。官方没有给出基线,所以"域差异到底多大"是一个开放问题——第一个给出完整分层评测的人,就为这个数据集建立了基准。

6.10 实际可用的有效样本估算

评估"模型能否泛化到新患者"时,有效样本量应取:

用途 有效样本量
学"设备外观" ~2,321(独立胸片)
学"翻拍不变性" ~11,072(翻拍图,但信息冗余)
评测泛化 ~108(测试患者)
评测稀有型号 1-10(每类测试图)

最后一行是最严峻的约束:稀有型号的评测几乎没有统计功效。这意味着:

  • 不能声称"模型在稀有型号上表现如何"(样本不够);
  • 更诚实的做法是报告"在测试样本 ≥10 的型号上"的性能。

6.11 静态 vs 活跃

维度 状态
499 数据集本体 静态(v1.0.0,2025-03-04,未见更新)
CIED 设备市场 活跃(型号持续迭代,新设备不断上市)

这带来一个尖锐的时效问题:数据集覆盖 2012-2022 年的设备,而 2026 年的市场上已有大量新型号。模型对新型号的识别能力完全未知——而且由于类别是固定的 27 类,新设备只能落到 “Other” 或预测错误。

这提示:CIED 识别系统需要持续更新(新设备 → 新训练数据 → 重训模型)。一次性训练的模型会随设备迭代而衰减。

6.12 家族治理:影像数据集生态位

数据集类型 代表 生态位
病灶/器官分割 各类 CT/MRI 分割数据集 主流的影像 AI 任务
疾病分类 胸片疾病分类数据集 主流
设备/植入物识别 499 小众但有明确临床用途
影像报告文本 498 的 ExamReport 文本侧

499 在影像 AI 生态中属于"设备识别"这一小众方向——但正是这种小众性呼应了真实的临床需求(MRI 安全、召回筛查)。

6.13 口径诊断树

数字不符时:

数字不对?
├─ 图像总数不对?
│   ├─ 是否为 2,321 + 11,072?→ 13,393
│   └─ 是否只数了某几个目录?
├─ 患者数不对?
│   └─ 是否把 pat_id 的唯一值数错了?→ 应为 896
├─ 型号数不对?
│   └─ 是 27(型号)还是 28(含 Other)?→ 两个口径都存在
├─ 划分和不对?
│   └─ 各厂商 Train+Val+Test 应等于 Total
└─ 掩码 читае 全 0?
    └─ 是否用图片查看器?→ 必须用 numpy(存照 K)

6.14 八个坑点

坑点 1:掩码看起来全黑。 8-bit PNG 中 0 与 2 差异肉眼不可辨。必须用 numpy 读并与 1/2 比较。

坑点 2:把翻拍图当独立样本。 11,072 张翻拍图源自 2,321 张原图,信息高度冗余。样本量与置信区间不能按 13,393 算。

坑点 3:忽略制造商不平衡。 Medtronic 占 52.5%,accuracy 会被主导。必须报 macro 指标。

坑点 4:稀有类测试样本太少。 SJM Confirm 测试集仅 1 张,其 F1 无统计意义。必须标注每类测试样本数。

坑点 5:包含背景算 Dice。 背景占 98%+,会让分割 Dice 虚高。应报前景类 Dice。

坑点 6:忽略 “Other” 类。 约 10% 图像归入 Other,且其内部异构。处理方式(剔除 / 保留 / 单独建模)必须说明。

坑点 7:误以为是"拍胶片"。 手机图是拍显示器,失真特性与拍胶片完全不同(摩尔纹、屏幕反光是拍屏特有的)。

坑点 8:忽视设备迭代。 数据集止于 2022 年,新设备型号识别能力未知。

6.15 自查清单

  • [ ] 已确认访问级别与许可条款(官方页面未声明);
  • [ ] data.json 可解析,6 字段齐全;
  • [ ] pat_id 唯一值 = 896;
  • [ ] 图像总数 = 13,393(2,321 + 11,072);
  • [ ] 掩码用 numpy 读取,np.unique 返回 [0 1 2] 子集;
  • [ ] 掩码可视化已重映射颜色;
  • [ ] 使用官方的患者级划分(未自行重划);
  • [ ] 分割报前景类 Dice(未含背景);
  • [ ] 分类报 macro-F1 与 per-class F1(标注测试样本数);
  • [ ] 已做按机型分层的评测;
  • [ ] 已处理 Other 类并说明策略;
  • [ ] 报告置信区间时按患者数而非图像数;
  • [ ] 已引用数据集 + 代码 + 平台来源;
  • [ ] 未声称可用于临床决策。

§7 AI 实践指南:把 499 用出价值

7.1 五种用法

用法 具体做法 价值
分割基线 训练 U-Net 类模型做设备分割 建立像素级基准
型号识别 层次分类或直接 27 类 核心任务
域适应研究 originals → 手机图 利用成对数据
增强效果验证 模拟失真 vs 真实翻拍 回答"真实数据是否必要"
移动端部署 量化 + 轻量模型 落地场景

7.2 一个 30 分钟的最小实验

  1. (5 分钟) 解析 data.json,统计各字段分布,验证 896 / 13,393 / 28 类;
  2. (10 分钟) 随机抽 5 张掩码,用 numpy 统计各像素值占比,确认设备占比在 0.1%-2% 量级;
  3. (10 分钟) 用最简单的基线(如"全猜 Medtronic")计算制造商分类的准确率——你会得到约 52%,这就是必须超越的基线;
  4. (5 分钟) 计算型号识别的"全猜最多类"基线(Q20 SR,342/2321 ≈ 14.7%)。

这个实验能立刻建立"基线感知"——知道一个模型必须超过什么才算有用。

7.3 泄漏防控

泄漏类型 防控
患者级泄漏 用官方 pat_id 划分(已做)
近重复泄漏 同一原图与其翻拍图必须同侧(官方划分已保证)
域泄漏 训练/测试的机型分布应报告
标签泄漏 文件名不含类别信息(哈希命名,已验证)

注意第三条:如果训练集全是 iPhone 13(新机),测试集全是 Galaxy S4(旧机),那测的是"跨机型泛化"而非"同分布泛化"。必须报告训练/测试的机型分布。

7.4 公平性与偏差

偏差来源 说明 影响
厂商不平衡 Medtronic 52.5% 小厂商设备识别更差
型号不平衡 15.5 倍差距 稀有型号识别差
机型不平衡 5 种手机分布不均 低端机场景性能未知
单中心 柏林夏里特 跨机构泛化未知
时代 2012-2022 新设备未覆盖
患者构成 未报告人口学 人群偏差未知

最后一项值得注意:官方未报告患者的人口学特征(年龄、性别分布)。这意味着无法评估"训练集是否代表某类人群"——这是一个信息缺口。

7.5 分割模型的推荐架构

架构 特点 适用
U-Net 经典,医学分割标配 基线
nnU-Net 自动配置,强基线 追求性能
DeepLabV3+ 空洞卷积,大感受野 若设备占比较大
SegFormer / SAM 现代 Transformer 探索 SOTA

注意类别极不平衡:前景(设备)仅占像素的极小比例。建议:

  • 用 Dice loss 或 Focal loss 而非纯交叉熵;
  • 做前景过采样或类别加权;
  • 报前景 Dice 而非总体像素准确率。

7.6 分类模型的推荐策略

策略 说明
骨干 ResNet / EfficientNet / ConvNeXt
预训练 ImageNet 预训练(数据量不足时必须)
输入尺寸 裁剪至设备区域后分类(提升信噪比)
损失 类别加权的交叉熵 / Focal loss
层次 先分厂商 → 再分类型 → 再分型号
集成 多模型 + 多尺度

"裁剪至设备区域"是一个关键技巧:先用分割模型定位设备,再把设备区域裁剪出来做分类——这比整图分类更有效(信噪比高)。这就是**"分割辅助分类"的两阶段架构**,也是这份数据集同时提供分割与分类标签的原因。

7.7 域适应的实操

# 用真实翻拍数据做域适应(最直接)
train_src = meta[(meta.dataset == 'originals') & (meta.split == 'train')]
train_tgt = meta[(meta.dataset.isin(['iphone13','galaxys5'])) & (meta.split == 'train')]

# 策略 1:混合训练
# 策略 2:源域预训练 + 目标域微调
# 策略 3:对抗域适应(DANN)
# 策略 4:伪标签(用源域模型给目标域打伪标签)

推荐顺序:先做混合训练(最简单),若不足再做对抗域适应。

7.8 "增强能否替代真实翻拍"的实验设计

这是 499 最重要的开放问题之一:

方案 A:originals 训练 → 手机图测试        (不增强)
方案 B:originals + 随机透视/噪声/模糊增强 → 手机图测试
方案 C:originals + 真实手机图 → 手机图测试 (真实数据)

对比 A/B/C 的性能。这个实验的结论对数据收集策略有直接影响:

  • 若 B ≈ C,则机构可省去拍摄翻拍数据的成本(用增强代替);
  • 若 B ≪ C,则证明真实翻拍数据不可替代——499 的核心价值由此确立。

7.9 弱监督与半监督

  • 半监督:大量翻拍图无分割掩码(掩码可能只在 originals 上)→ 可用半监督学习纳入;
  • 弱监督:只有图像级标签、无像素掩码时,可用 CAM/Grad-CAM 生成弱定位;
  • 自监督:用 13,393 张图做对比学习预训练,再微调。

7.10 成本核算

方案 数据成本 计算成本 适合
只用 originals 低(2,321 图) 中 标准影像 AI 研究
全量训练 中(13,393 图) 高(5.8 倍数据) 追求鲁棒性
分割 + 分类两阶段 中 高(两个模型) 落地性能
移动端部署 低 高(需量化/蒸馏) 床边应用

7.11 部署形态建议

场景 推荐方案
院内 PACS 集成 originals 训练的模型 + 常规推理
手机 App 全量训练 + 模型量化(INT8)+ 端侧推理
远程会诊 手机图训练优先 + 服务器推理
批量筛查 分割 + 分类两阶段 + 定期重训

7.12 监控与回归(设备迭代问题)

由于设备持续迭代,部署的系统需要:

监控项 说明
Other 类占比 若上升,说明新设备增多,需重训
置信度分布 若整体下降,说明分布漂移
型号预测分布 与训练分布对比
人工复核结果 持续收集新样本

"Other 类占比上升"是一个优秀的漂移信号——它直接指示"出现了模型未见过的新设备"。

7.13 三个可立即执行的建议

  1. 今天:解析 data.json,建立基线(全猜 Medtronic = 52.5%,全猜 Q20 SR = 14.7%);
  2. 本周:跑通"分割 → 裁剪 → 分类"的两阶段流程,得到第一个端到端 macro-F1;
  3. 本月:完成"增强 vs 真实翻拍"的对照实验,这是最有科学价值的开放问题。

7.14 三个可发表的研究方向

  1. “智能手机翻拍胸片中的 CIED 识别:真实域 vs 合成域的对比”——直接验证真实翻拍数据的必要性;
  2. “层次分类在中美设备识别中的应用:从厂商到型号的级联”——方法学贡献;
  3. “CIED 型号识别的类别不平衡问题:稀有型号的识别能力评估”——诚实的负面结果也有价值。

7.15 与临床工作流的对接

患者(无病历 / 转院 / 急诊)
   │ 拍胸片(或手机拍屏幕)
   ▼
AI 模型:分割定位设备 → 识别厂商与型号
   │
   ▼
输出:可能的型号候选(Top-3)+ 置信度
   │
   ▼
临床决策
   ├── MRI 安全性核查(人工确认)
   ├── 召回筛查(人工确认)
   └── 程控准备(人工确认)

关键设计原则:AI 输出的是候选与置信度,不是最终结论。这是医疗 AI 安全部署的通用原则——辅助判断,而非替代判断。

§8 伦理、合规与数据的规范缺口

8.1 三重伦理主体

主体 责任
患者 影像来自真实患者(896 人),虽已匿名化,仍须防止再识别
机构与作者 数据开放是贡献,使用时须充分引用
使用者 不得误用、不得声称不实结论

8.2 烧录信息的处理与残余风险

499 的匿名化流程明确处理了烧录信息(burned-in annotation):

  1. 中心裁剪;
  2. OCR 涂黑;
  3. 人工复查删除。

为什么这很关键:胸片四角常印有姓名、ID、日期。若不处理,这些信息会直接泄露患者身份。"OCR + 人工复核"的组合是当前较可靠的做法(纯 OCR 会漏掉低对比度或手写内容)。

残余风险:即使涂黑,也可能存在:

  • 设备影像本身的型号—患者关联(罕见型号可能在小样本中唯一);
  • 图像指纹(虽然是胸片,但个体解剖特征具有唯一性);
  • 翻拍图的背景(屏幕边框、房间物件可能泄露环境信息)。

因此,再识别尝试仍被禁止。

8.3 访问级别未声明的规范问题

499 最大的规范缺口是官方页面未声明访问级别与许可条款(存照 A/B)。这带来实际困难:

  • 使用者不确定能否商用;
  • 不确定再分发规则;
  • 不确定是否需要 DUA。

应对建议:

  1. 到 PhysioNet 的下载界面查看实际条款(那里通常会显示);
  2. 若仍不明确,联系作者(代码仓库可找到联系方式);
  3. 保守做法:按 PhysioNet 的默认条款使用,并明确引用。

这个缺口本身也是一个观察:数据集在元数据完备性上的短板会直接影响可用性——这不是"小事",而是影响数据能否被合规使用的实质问题。

8.4 医疗影像 AI 的特有伦理问题

问题 说明
过度依赖 医生可能盲信 AI 输出,尤其在 27 类这种人工难判的任务上
自动化偏见 若 AI 给出错误型号,人工复核可能被"锚定"
责任归属 AI 建议错误导致 MRI 事故,责任如何划分?
公平性 小厂商设备的低性能是否构成对使用该类设备患者的不公平?
设备迭代 新设备的识别失败可能导致漏检召回设备

第四条尤其值得关注:如果模型对 Boston Scientific(仅 8% 训练样本)设备的识别显著更差,那么使用该厂商设备的患者在 AI 辅助下获得的安全性低于使用 Medtronic 设备的患者——这是一种技术引入的健康不公平。

8.5 使用红线

红线 说明
❌ 未经人工确认直接用于 MRI 安全决策 必须人工复核
❌ 声称可替代专科医师判断 定位是辅助
❌ 用于设备召回决策而不复核 召回需精确型号
❌ 尝试再识别患者 禁止
❌ 不报告性能分层 必须披露各厂商/机型的性能差异

8.6 引用与致谢义务

对象 是否必引
数据集(DOI 10.13026/swv0-cd11) ✅
代码仓库(github.com/AndreasZhukov/cied) 建议
PhysioNet 平台论文(2026) ✅
前期方法工作(Howard 2019、Lauzier 2023 等) 建议

8.7 与 498 的合规对照

维度 498 浙江 EHR 499 CIED
访问级别 明示开放获取 未声明
许可条款 未列具体协议 未列
伦理批号 QT2022185 EA4/042/20
知情同意 豁免(回顾性) 豁免(回顾性匿名化)
匿名化标准 HIPAA 中心裁剪 + OCR + 人工复核
关联论文 有 无

两者共同的短板是"许可条款未明"——这是 PhysioNet 上部分数据集的普遍现象,也是使用者必须自行确认的关键项。

8.8 一个诚实的观察:规范的完备性影响数据价值

对比本系列四篇影像/数据条目的 DAIMS 得分:

条目 DAIMS 主要短板
498 浙江 EHR 6.7 许可未明
496 NIHSS 6.4 需 DUA、格式非标准
497 Health Gym 6.3 许可表述矛盾、无评测协议
499 CIED 6.2 许可未明、无论文

共同规律:技术性维度(格式、机器可读性)普遍得分高,而规范性维度(许可、评测协议、生态)是普遍短板。

这反映了一个现实:数据发布者的注意力集中在"把数据做出来",而对"让数据可被规范使用"投入不足。对使用者而言,这意味着每次使用前都必须自行完成一轮合规核查——这是当前医疗开放数据生态的一个结构性成本。

§9 FAQ:五十问

9.1 关于身份与获取

Q1:官方名称?
Dataset for Segmentation and Classification of Cardiac Implantable Electronic Devices in Chest X-Rays。

Q2:官方 slug?
cardiac-implantable-device-cxr。

Q3:DOI?
10.13026/swv0-cd11。

Q4:版本?
v1.0.0,2025-03-04 发布。

Q5:谁做的?
柏林夏里特大学医学院(Charité)的作者团队。

Q6:有论文吗?
官方未列正式关联论文,仅有方法学背景参考文献。

Q7:要 DUA 吗?
官方页面未声明访问级别,需到下载界面确认。

Q8:怎么下载?
PhysioNet 页面。

Q9:有代码吗?
有,github.com/AndreasZhukov/cied。

Q10:伦理批号?
EA4/042/20。

9.2 关于规模与内容

Q11:有多少张图像?
13,393 张。

Q12:有多少患者?
896 名。

Q13:胸片和手机图各多少?
2,321 张正规胸片 + 11,072 张手机翻拍。

Q14:有多少设备型号?
27 个(来自 4 家制造商);model 字段共 28 类(含 Other)。

Q15:哪四家制造商?
Medtronic、Biotronik、Abbott(含 St. Jude Medical)、Boston Scientific。

Q16:有分割掩码吗?
有,存在 seg_masks 文件夹。

Q17:掩码有多少张?
官方未给出具体数字。

Q18:掩码的像素值含义?
0=背景,1=PM/ICD,2=event monitor。

Q19:为什么掩码打开是全黑的?
因为 8-bit PNG 中 0 与 2 对比度极小,肉眼不可辨。需用 numpy 读取。

Q20:数据采集时间跨度?
2012-01 至 2022-01。

Q21:包含哪些手机型号?
iPhone 13 mini、Galaxy S4、iPhone 8、iPhone 13、Galaxy S5。

Q22:手机图是拍什么?
从显示器上翻拍(不是打印胶片)。

Q23:每张胸片拍几次?
最多 5 次。

Q24:有 CT 或 MRI 吗?
没有,只有胸片与其翻拍。

Q25:有文本数据吗?
没有,纯图像 + JSON 元数据。

9.3 关于任务与标注

Q26:有哪些任务?
设备分割、制造商分类、型号识别。

Q27:分割有几个类?
3 个(背景 / PM-ICD / event monitor)。

Q28:PM 与 ICD 为什么不分开?
官方掩码合并为 1,可能是因两者影像特征相似。

Q29:谁标注的?
2 位认证放射科医师(各 7-9 年图像处理经验)。

Q30:用什么工具标注?
3D Slicer。

Q31:标注一致性有报告吗?
官方未提供 Kappa 或 Dice 一致性指标。

Q32:制造商分类有几类?
4 类。

Q33:型号识别有几类?
27 个型号 + Other = 28 类。

Q34:有设备类型标签(PM/ICD/CRT/ICM)吗?
没有单列,但可从型号名派生。

Q35:有患者人口学信息吗?
没有报告。

9.4 关于划分与评测

Q36:有官方划分吗?
有,训练 1,796 / 验证 464 / 测试 295。

Q37:划分是患者级吗?
是,用 pat_id 划分。

Q38:测试集多大?
295 张图像。

Q39:测试集有多少患者?
官方未给出,按比例推算约 108。

Q40:报告什么指标?
分割报前景 Dice;分类报 macro-F1 与 per-class F1。

Q41:有官方基线吗?
没有。

Q42:全猜 Medtronic 的准确率?
约 52.5%。

Q43:稀有型号测试样本多吗?
很少,SJM Confirm 仅 1 张。

Q44:能用 accuracy 吗?
不建议,会掩盖类别不平衡问题。

Q45:置信区间怎么算?
按患者数(约 108)而非图像数(295)。

9.5 关于使用

Q46:能用于临床吗?
不能直接用于临床决策,需前瞻验证。

Q47:能做移动端部署吗?
可以,这正是数据集的设计目的之一。

Q48:能做域适应研究吗?
可以,成对的 originals/手机图是理想材料。

Q49:能用于 MRI 安全判定吗?
可作为辅助,但需人工确认。

Q50:能识别新上市的设备吗?
不能,数据集止于 2022 年,新设备会被误判或归入 Other。

9.6 进阶问答

Q51:为什么提供手机翻拍数据?
因为真实场景中基层医院常用手机拍屏幕传图,这些数据的失真是增强难以完全模拟的。

Q52:手机翻拍有哪些特有失真?
透视畸变、摩尔纹、屏幕反光、色偏、分辨率损失、边缘裁切。

Q53:增强能替代真实翻拍吗?
这是开放问题,需实验验证(见 §7.8)——若能替代,则 499 的核心价值受挑战;若不能,则 499 不可替代。

Q54:为什么 Medtronic 占一半?
反映真实市场格局。但会导致模型对小厂商设备识别更差。

Q55:如何缓解类别不平衡?
类别加权损失、过采样、层次分类、focal loss。

Q56:什么是层次分类?
先分厂商(4 类)→ 再分设备类型(~6 类)→ 再分型号(组内)。

Q57:分割和分类能联合训练吗?
可以,多任务学习。也可用"分割定位 → 裁剪 → 分类"的两阶段。

Q58:为什么要裁剪后分类?
提升信噪比——设备在整张胸片中占比极小。

Q59:MRI SureScan 是捷径学习吗?
是,但是"有益的捷径"——它与真实目标(MRI 安全性)对齐。

Q60:“Other” 类怎么处理?
三种策略:剔除、保留为第 28 类、或单独建模。必须说明。

Q61:设备类型分布有利于建模吗?
是,~7 类比 27 类更平衡(最大 22% vs 8.7%)。

Q62:跨机型泛化怎么测?
训练用一种机型、测试用另一种,报告性能下降。

Q63:How to handle 屏幕反光?
可在预处理做去眩光,或依赖模型的鲁棒性。

Q64:能否做无监督异常检测?
可以,作为"新设备检测"的辅助任务。

Q65:患者级划分为什么重要?
同一患者的图像高度相似(近重复),跨集划分会泄漏。

Q66:置信区间为什么按患者算?
因为同一患者的图像不独立,有效样本量受患者数限制。

Q67:能和其他胸片数据集合并吗?
可以,但需注意标签体系(型号列表)可能不同。

Q68:这个数据集对设备召回有什么价值?
可辅助筛查疑似受影响的患者,但需人工确认型号。

Q69:能否做联邦学习?
可以,它是理想的"本地站点数据"候选。

Q70:值不值得用?
如果你做医学影像 AI、移动医疗或具体到设备识别,值得——它是这个方向上少有的公开数据。

9.8 番外:三个反问

反问一:一份没有关联论文的数据集,可信吗?
应该区分"缺乏论文"与"缺乏质量"。499 的文档(规模、划分、标注协议、伦理)是完整的,只是缺一篇方法学论文来交代设计动机与基线。这降低了它的"学术可用性"(无法引用基线结果),但不影响数据本身可用。它更像一份"数据交付物"而非"研究产出"。

反问二:11,072 张翻拍图是噱头还是干货?
取决于"增强能否替代真实翻拍"这一实验的结果。如果能替代,那 11,072 张就是冗余;如果不能,那它就是这份数据集的灵魂。在有人做这个实验之前,两种判断都成立——这恰恰说明这个实验值得做。

反问三:设备识别这个任务会不会被通用视觉大模型直接解决?
有可能,但需要验证。SAM 类模型能分割"设备"(因为它是显著的物体),但区分 27 个型号需要领域知识。499 因此也是一个很好的"通用大模型 vs 领域专用模型"的对比赛场。

§10 存照、引文与系列关系

10.1 存照(口径局限与勘误)

存照 A(访问级别未声明):官方页面未明确访问级别(Open Access / Restricted / Credentialed)。使用前须在 PhysioNet 下载界面确认。

存照 B(许可条款未列):页面未列出具体许可协议(ODC/CC 等),是本条目最大规范短板。

存照 C(资助信息缺失):页面未包含资助段落,仅列 COI 为 None。

存照 D(无正式关联论文):页面未列关联论文,仅有 7 条方法学背景参考文献(均无 DOI/PMID)。本条目不为它编造论文。

存照 E(分割掩码数量未给):官方说明存在分割掩码,但未给出具体张数。

存照 F(型号数与类别数不一致):正文称 27 个型号(4 家制造商),model 字段实为 28 类(含 Other)。

存照 G(“Other” 类规模):四家厂商各有 Other 行(84/93/18/39),合计 234,约占原始图的 10%。

存照 H(Boston Scientific 类别笔误):官方表中 Valitude X4 CRT-P 的类别写作 “CRP-P”,应为 “CRT-P”。

存照 I(手机翻拍对象):手机图是从显示器翻拍,非打印胶片亦非原始 DICOM,模拟的是"手机拍电脑屏幕"场景。

存照 J(划分的患者数未给):data.json 的 pat_id 用于划分,确认划分是患者级,但官方未给出各集合的患者数。

存照 K(掩码可视化陷阱):8-bit PNG 中 0(背景)与 2(event monitor)视觉差异仅 0.8%,肉眼看似全黑,必须用 numpy 读标签。

存照 L(标注一致性未报告):页面未提供标注者间一致性指标(如 Dice 或 Kappa)。

存照 M(患者人口学未报告):未给出 896 名患者的年龄、性别等分布,无法评估人群代表性。

存照 N(平台引用义务):PhysioNet 2026 年要求一并引用平台论文(Pollard et al., Nature Health 2026)。

10.2 引文

  1. Bressem K, Busch F, Zhukov A, Adams L. Dataset for Segmentation and Classification of Cardiac Implantable Electronic Devices in Chest X-Rays (version 1.0.0). PhysioNet. 2025. RRID:SCR_007345. DOI: 10.13026/swv0-cd11.
  2. Pollard T, Moody BE, Lehman L, et al. PhysioNet as a global platform for biomedical research. Nature Health. 2026;1(8):792-795. DOI: 10.1038/s44360-026-00096-z.
  3. Howard JP, Fisher L, Shun-Shin MJ, et al. Cardiac rhythm device identification using neural networks. JACC Clin Electrophysiol. 2019;5(5):576-586.
  4. Kim UH, Kim MY, Kim DJ, et al. Deep learning-based algorithm for detection and characterization of MRI safety of cardiac implantable electronic devices on chest radiographs. Korean J Radiol. 2021;22(11):1918.
  5. Lauzier PT, et al. Detection and identification of cardiac implantable electronic devices in a large data set of chest radiographs using semi-supervised artificial intelligence. Heart Rhythm. 2023;20(4):642-643.
  6. Weinreich M, et al. Computer-aided detection and identification of implanted cardiac devices on chest radiography using deep CNNs. J Am Coll Cardiol. 2019;73(9S1):307.
  7. Goldenberg I, Huang DT, Nielsen JC. The role of implantable cardioverter-defibrillators and sudden cardiac death prevention. Eur Heart J. 2020;41(21):2003-2011.
  8. Vaduganathan M, Mensah GA, Turco JV, et al. The global burden of cardiovascular diseases and risks. J Am Coll Cardiol. 2022;80(25):2361-2371.
  9. Cardiac Device Identification [Internet]. GitHub; 2024. github.com/AndreasZhukov/cied.
  10. Ronneberger O, Fischer P, Brox T. U-Net: Convolutional Networks for Biomedical Image Segmentation. MICCAI 2015.

10.3 与既有条目的系列关系

关系 说明
任务平行 496(文本抽取)↔ 499(影像分割+分类):两种"非结构化→结构化"的路径
数据规范对照 498(许可未明但提供划分)与 499(提供划分但许可未明)互为补充
失真对照 497(合成失真)↔ 499(真实翻拍失真):两种"数据质量退化"
临床场景 499 的识别结果可与 498 的结构化随访数据在概念上互补(虽患者不可匹配)
唯一性 499 是本系列唯一的"设备/植入物识别"影像数据集

10.4 变更日志

日期 变更
2026-09-20 初版发布:完成身份核查(PhysioNet v1.0.0)、三段撰写、双检、发布、封面、DB 验证

声明:本条目为千方病案医数集 AI-Ready 数据集百科的组成部分,仅整理公开元数据与公开文献信息。本数据集官方未声明访问级别与许可条款,使用者须自行在官方页面确认。**基于本数据集的模型不可直接用于临床决策,型号识别结果须经专业人员复核。**所有数字均标注来源,存疑处列入 §10 存照。

使用须知:本文内容用于研究与信息参考,不构成临床决策依据。任何涉及设备型号确认的临床决策,应由有资质的专业人员依据完整信息作出。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集