心肌灌注显像数据库 — 静息态 SPECT 影像集 AI-Ready Wikipedia

83 名患者 103 幅 CZT 心脏 SPECT:巴西团队带来的第一份核医学分割数据库

来源 Hospital Israelita Albert Einstein 前瞻采集(2023-02/03),GE Discovery NM 530c CZT 相机静息态 SPECT,专家 3D Slicer 手工分割掩码发布时间: 2026-09-24最后更新: 2026-09-25 阅读 24
心肌灌注显像数据库 — 静息态 SPECT 影像集 AI-Ready Wikipedia

信息速览

数据集名称心肌灌注显像数据库 — 静息态 SPECT 影像集 AI-Ready Wikipedia
数据类型影像数据,人工标注,分割掩码
规模83 名患者 / 101 studies / 103 幅 DICOM + 101 卷 NIfTI(含左心室壁掩码,20-90 岁)
接入方式Hospital Israelita Albert Einstein 前瞻采集(2023-02/03),GE Discovery NM 530c CZT 相机静息态 SPECT,专家 3D Slicer 手工分割掩码
AI 就绪度

INFOBOX:myocardial-perfusion-spect 速览

字段 值
数据集 Myocardial perfusion scintigraphy image database v1.0.0
slug myocardial-perfusion-spect
发布 2025-09-09(单版本)|PhysioNet
DOI 10.13026/ce2z-dw74(v1.0.0)/ 10.13026/md6s-re23(latest)
访问 Open Access(ODbL v1.0——数据库 share-alike,与 Credentialed 家族完全不同档)
体量 50.4 MB(解压)/ ZIP 21.5 MB——本库最小级"image database"
规模 83 患者 / 101 studies / 103 DICOM / 101 NIfTI+掩码(2 exams 未分割)
模态 核医学 NM(SPECT)——本库首个核医学影像条目
设备 GE Discovery NM 530c:CZT 半导体 19-pinhole 专用心脏相机
药物/重建 99mTc-MIBI + MLEM(Myovation for Alcyone)
掩码 左心室壁二值掩码(专家 3D Slicer 手工 gold)——nnU-Net Dice 87%/IoU 0.8 的考题
无标签 诊断/缺血/梗死/伪影全无(Future releases 或补充)
论文 PLoS ONE 2025;20(1):e0312257(2025-01-17,先论文后数据 8 个月)
团队 UFG + Einstein 医院 + Coimbra + IFG(数据集 4 人/论文 14 人等贡献)
一句话 巴西核医学的"小而专"开局之作:一台 CZT 心脏相机、两个月、83 个静息相考题

§0 摘要卡:核医学影像的 AI 考卷从零开始

§0.1 它是什么

巴西戈亚斯联邦大学(UFG)与圣保罗 Albert Einstein 医院合作发布的心肌灌注 SPECT 影像数据库:2023 年 2-3 月前瞻采集 83 名患者(20-90 岁,88% 男)的静息态心肌灌注显像,CZT 半导体专用心脏相机(GE Discovery NM 530c)+ 99mTc-MIBI + MLEM 重建,DICOM 原始格式 + NIfTI 处理格式 + 101 份专家手工左心室壁二值掩码。2025-09-09 挂 PhysioNet,Open Access(ODbL v1.0),全程 50.4 MB——它不是大数据集,是核医学 AI 研究的开局考卷。

§0.2 三个数字

  • 83 / 103:83 名患者、103 幅 DICOM(101 份带手工掩码的 NIfTI——2 份未分割,Release Notes 亲自解释的差异)。
  • 87% / 0.8:nnU-Net 在这份考卷上的 Dice 系数与平均 IoU(PLoS ONE 2025 pilot study)——掩码是 gold,nnU-Net 是被评测的答案卷。
  • 50.4 MB:解压后总大小——本库最小级数据集体量,wget 一条命令即全量下载。

§0.3 谁在用、怎么接

分割算法研究者拿它当左心室壁的 SPECT 基准(nnU-Net/3D Slicer/ITK-SNAP 全兼容);核医学工程团队用它做质控与伪影研究的起点(伪影标注要自备);教学用它讲核医学图像处理全链路(原始 DICOM 到重建卷到掩码)。获取零门槛:Open Access,wget 直下,demographics.csv 一张表连人口学与影像。

§0.4 本条目怎么读

§1 身份卡 → §2 核医学语境(MPS 的临床地位与 CZT 技术代际)→ §3 采集协议全参数解剖 → §4 数据组织与掩码工程 → §5 论文成绩单 → §6 生态位(本库第一个 NM 条目)→ §7 AI-Ready 十问 + DAIMS → §8 误解与坑点表 → §9 工作实例 → §10 FAQ 九十问 → 附录 A-H。

§1 身份卡:一张速览

字段 值
全称 Myocardial perfusion scintigraphy image database
slug / 本库编号 myocardial-perfusion-spect / 520
挂牌 2025-09-09(PhysioNet,v1.0.0 单版本)
DOI v1.0.0:10.13026/ce2z-dw74;latest:10.13026/md6s-re23
访问 Open Access——“Anyone can access the files”
License Open Data Commons Open Database License v1.0(ODbL)
体量 解压 50.4 MB / ZIP 21.5 MB
Topics 13 个(nifti/dicom/myocardial perfusion scintigraphy/ventricular walls/CAD/CNN/automated segmentation/AI 等)
Views 323(2026-09,挂牌一年)
文件结构 DICOM/ + NIfTI/ + segmentation_masks/ + demographics.csv
母论文 PLoS ONE 2025;20(1):e0312257
代码 Code Ocean doi:10.24433/CO.8499026.v1 + PhysioNet 软件 capsule
数据来源院 Hospital Israelita Albert Einstein(圣保罗)

身份卡四行补注:

URL 版本陷阱:PhysioNet 大多数内容可用简写版本号访问,本集 /1.0/ 直接 404,必须写全 /1.0.0/——爬取与引用时先试全版本号。

ODbL 与 ODC-BY 的差别:同属 Open Data Commons 家族,但 ODbL 的 share-alike 条款要求衍生数据库以同许可开放(BY 只要求署名)。做衍生数据产品(如再发布的分割集)时先读 ODbL 第 4 章——这是本库 Open Access 档里最"重"的一个许可。

"database"的命名自知:50.4 MB 敢叫 image database,因为它的定位是"结构化数据库"(DICOM+NIfTI+掩码+人口学四件套配套)而非"大语料"——命名与体量的不成比例是定位选择,不是虚标。

核医学版图补全:本库此前影像条目全部集中在 X 光/CT/MRI/超声,本集是第一个 Modality=NM(核医学)条目——影像模态版图的第五块拼图。

§2 背景:MPS 的临床地位与 CZT 的技术代际

§2.1 心肌灌注显像是什么

MPS(Myocardial Perfusion Scintigraphy,亦称 MPI)是无创核医学显像:注射 99mTc-MIBI 后,放射性药物被存活心肌摄取,SPECT 相机重建心肌血流分布——静息相看静息灌注,负荷相看应激储备。临床三大用途:冠心病(CAD)诊断、风险分层、随访。页面 Background 引 ASNC(美国核心脏病学会)指南:对中等验前概率的 CAD 患者或不能做负荷超声者,MPS 仍是一线影像选项。

§2.2 SPECT 读片的三大痛点

页面 Background 点名的三个"主观性来源":衰减伪影(attenuation artifacts——膈肌/乳腺组织吸收光子造成假性缺损)、运动畸变(motion——采集 6 分钟内患者动)、分割协议差异(左室壁手工勾画耗时且观察者间变异大)。三者都指向同一个需求:把"看图"变成"算图"。nnU-Net 等自配置深度学习框架是当前最有力的候选答案。

§2.3 CZT:心脏专用相机的代际跃迁

本集设备 Discovery NM 530c 不是通用 SPECT 加一个准直器,而是CZT(碲锌镉)半导体探测器的专用心脏相机:19 个 pinhole 准直器排成弧阵(32×32 px 矩阵),全部孔径同时对准心脏。CZT 的能量分辨率与灵敏度远超传统 NaI(Tl) 闪烁晶体——同样 6 分钟采集,计数质量更高。对 AI 研究者的含义:这批影像代表新一代硬件的数据分布,用老式 SPECT 数据训的模型迁移过来要重新验证(反之亦然)。

§2.4 为什么只有静息相

MPS 临床标准是"静息+负荷"双相(一天或两天协议),本集明确只收静息相(“No stress-induced acquisitions were performed”)。原因藏在伦理与流程里:负荷相需要运动/药物应激,流程复杂且风险更高;pilot study 的目标是分割左室壁——静息相足以承载。对研究者的限制也在此:灌注储备(stress vs rest 差值)类研究在本集上无从做起。

§2.5 核医学为什么需要自己的数据集

一个朴素的问题:CT/MRI 分割集铺天盖地,为什么核医学要单独造轮子?三个结构原因。一,物理生态不同:γ 光子计数统计(泊松噪声)、低分辨率(本集 4 mm vs CT 0.5-1 mm)、衰减与散射物理——CT 模型的归纳偏置在 SPECT 上未必成立,这正是需要专域考卷的理由。二,临床工作流不同:核医学医生看的是"灌注分布随负荷/静息的差"而非纯解剖——AI 的价值点在功能定量而非形态勾画,左室壁掩码是功能定量的第一步(分区→计数→评分)。三,数据生态更稀薄:X 光有 CheXpert/NIH 级别的大库,核医学没有——83 人的 pilot 已经是"能公开的最好努力"。理解这三个"不同",才能理解这份 50 MB 考卷在生态里的真实位置:不是锦上添花,是雪中送炭。

§3 采集协议:一份可以直接复现的工程记录

§3.1 协议全参数(页面 Methods + Data Description 双段合并)

参数 值
设备 GE Discovery NM 530c(CZT 半导体)
探测器 19-pinhole 弧阵,32×32 px 矩阵,全孔聚焦心脏
准直器 MPH_27_45(Pinhole)
放射药物 ^99mTc-MIBI(体重调整剂量)
协议 one-day,仰卧 feet-first
采集时机 注射后 1 小时(静息相)
扫描时长 6 分钟
能窗 20% @ 140 keV(126.45-154.55 keV)
采集像素 2.46×2.46 mm
重建 Myovation for Alcyone(GE)+ MLEM
重建体素 70×70 px / 层,4.0×4.0 mm 层内,4.0 mm 层厚,50 层/卷
位深/窗 16-bit,window center/width 16383/32767
去标识 DICOM PS3.15 Annex E(codes 113100/113101/113107)

§3.2 两个 pixel 尺寸的口径说明

页面上 2.46 mm 与 4.0 mm 并存不矛盾:2.46×2.46 mm 是 CZT 探测器采集矩阵的像素间距(32×32 弧阵投影域),4.0×4.0×4.0 mm 是 MLEM 重建后 NIfTI 体积的体素间距(70×70×50)。引用体素尺寸用 4.0(做分割/ radiomics 时),引采集硬件规格用 2.46(做设备对比时)——两个阶段两个数,别混。

§3.3 前瞻采集与唯一排除标准

“The sole exclusion criterion was non-consent”——两个月内所有签署 ICF 的 MPS 受检者全部入集,不挑病史(“regardless of coronary artery disease history”)。这是连续纳入(consecutive enrollment),比"挑干净病例"的研究更接近真实临床分布,代价是:诊断异质性完全保留(但因无诊断标签,异质性看不见)。

§3.4 隐私处理的取舍

诊断报告留在院内 PACS(研究组只拿 DICOM 副本),人口学录 REDCap 且"no sensitive clinical data were accessed"——研究组接触的临床信息被刻意最小化。代价是数据集本身没有报告文本可挖(对照 MIMIC-CXR 的影像+报告双全),收益是伦理审批链最短(IIEP CAAE 65628422.7.0000.0071 一件套)+ Open Access 发布。这是"隐私最小化换开放性"的典型取舍——ODbL 开放发布的前提就是这刀切得干净。

§3.5 从采集到开放的 30 个月旅程

把时间线串起来看节奏:2023-02/03 两个月完成采集(60 天 × 83 人 ≈ 日均 1.4 人——专用心脏相机的现实吞吐)→ 3D Slicer 手工分割与质检(月级)→ 2024-04 论文投稿(采集后 13 个月——含建模与写作)→ 2024-10 接收 → 2025-01 见刊 → 2025-09 数据集挂牌(见刊后 8 个月——含数据工程、去标识复核、capsule 打包与伦理复核)。每一环都有真实的时间成本,这正是"公开一个医学数据集"的真实工期表——比多数论文图 1 里的流程图诚实得多。

§4 数据组织:三个目录、一张表、一套命名

§4.1 目录结构与计数账本

目录 内容 数量
DICOM/ 原始 SPECT 影像(*.dcm) 103
NIfTI/ 转换后体积(*.nii.gz) 101
segmentation_masks/ 左心室壁二值掩码(*_mask.nii.gz) 101
demographics.csv 人口学表 83 患者/每行一 study

103 vs 101 的账目:Release Notes 原话——“two of the exams were not segmented”(两份检查未做分割)。所以 DICOM 全量 103,NIfTI+掩码只有 101。用掩码做监督训练时先对账:按文件名 base id 求交集,别假设 DICOM 都有对应掩码。

§4.2 掩码工程:谁是 gold,谁是考生

掩码 = 专家手工 gold。Data Description 原话"binary masks manually generated by clinical experts",论文交叉确认工具链是 3D Slicer 平台手工分割,label 1 = 心肌壁、0 = 背景,仅左心室壁一个结构。

nnU-Net = 被评测的考生。论文流程:手工 gold → nnU-Net 自动分割 → Dice 87%/IoU 0.8。PhysioNet 页面 Usage Notes 那句"The automatic segmentation process was conducted using nnU-Net 2D (fold 0)"说的是配套软件 capsule 里的复现工作流(Docker 环境、fold 0 配置、现成脚本)——不是掩码的生成方式。页面两处表述初读易混,本条目在此存照:手工 gold、模型考生、capsule 是考场。

§4.3 命名系统与对接键

每个文件以 1.2.840.4267.32. 前缀(DICOM UID 根的 Albert Einstein 分支)+ 35-40 位随机后缀命名;同一患者的 DICOM 与 NIfTI 共享 base id;掩码加 _mask.nii.gz 后缀。demographics.csv 的每行对应一个 study,通过 id 直接连影像。对接成本极低——没有跨表 join 的坑,一张 CSV 一套文件名。

§4.4 demographics.csv 的全部内容

字段 说明
patient_id 匿名标识(连影像 base id)
sex M/F——88% 男 / 12% 女
age 20-90 岁
BMI 部分可得(“when available”)

没有更多的了——没有诊断、没有药物信息、没有检查指征。这张表是"隐私最小化"取舍的直接产物。

§5 论文成绩单:nnU-Net 的 87% 与伪影研究的 0.946

§5.1 PLoS ONE pilot study(2025-01-17)

  • 任务:左心室壁自动分割 vs 专家手工 gold
  • 数据:83 exams × 50 slices = 4,150 images(论文口径)
  • 工具链:3D Slicer 手工标注 → nnU-Net 自配置训练(2D,fold 0)
  • 成绩:Dice 系数 87%、平均 IoU 0.8——“high agreement with the manual segmentations produced by experts and surpassing traditional interpretation methods”
  • 等贡献署名:14 位作者全员 ☯ equal contribution

§5.2 UFG 学位论文的第二阶段:伪影检测(2025-06)

同一团队的后续研究(Luz 硕士论文,Calixto/Nogueira 指导)把流程推到了伪影方向:

  • 第一阶段(复现):内验证 Dice 87%±6%;外验证 Dice 88.46%±7.48%(专家外验一致率 ≥80%)
  • 第二阶段(伪影掩码手工标注 + AI 自动分割):优化模型 Dice 0.300-0.940、阈值 0.853、AUC 0.946、全场景完美特异性 + 温和灵敏度(模型倾向不报警部分"伪影-心室交叠"病例)
  • 专家外验:掩码一致率 >60%
  • 注意:第二阶段的伪影标注不在数据集 v1.0.0 里(“Artifact annotations are not available in the current version”)——论文/学位论文的伪影掩码要等后续版本或联系作者

§5.3 成绩单的正确引用姿势

引 87% 必须带三个限定:左心室壁单结构(非全心脏多结构)、CZT 静息相(非通用 SPECT)、该团队的手工 gold(非公共基准)。87% 在 CT/MRI 心脏分割里不算顶尖(nnU-Net 常见 90%+),但 SPECT 分辨率低(4 mm 体素)+ 核医学纹理特性使然——数字要连同模态一起引。

§5.5 定量语境的三个警告(radiomics/剂量学向)

拿本集做定量分析(radiomics、灌注定量)前先想清楚三件事:一,体素值是放射性浓度不是灰度——SPECT 重建值正比于计数统计,CT 的 HU 直觉全部失效,纹理特征(GLCM 等)的物理解释要重建于计数统计;二,重建器指纹——MLEM 迭代次数与正则选择会改变噪声纹理,跨重建器的 radiomics 模型自带偏移,本集单一重建器(Myovation+MLEM)意味着这个偏移无法在集内量化;三,无衰减校正存疑——页面未提 AC,定量绝对值(如标准摄取类比)不可比,相对分析(左室壁内分区对比)更稳。这三条不分条目——是核医学 AI 定量研究的通用纪律,只是本集作为"教材级考卷"最适合把它们写明白。

§6 生态位:本库第一个核医学条目

§6.1 影像模态版图:第五块拼图

模态 本库已有 本集
X 光 16/5/617 等 CXR 家族、610 等 —
CT 509/512/515 等 —
MRI 多条 —
超声 多条 —
PET 个别(如 ADNI 系) —
NM(SPECT) 无 本集

SPECT 与 PET 同属核医学但物理与生态差异大:SPECT 用 γ 相机单光子计数(99mTc 半衰期 6 小时、临床普及度高、便宜),PET 用正电子湮灭符合探测(18F 半衰期 110 分钟、贵、分辨率高)。本集补的是"更普及、更便宜、分辨率更低"的那一半——AI 在核医学的落地主战场。

§6.2 分割条目谱系中的位置

本库分割类条目:613 lung-segment-mimic-cxr(X 光肺分割)、602 chexmask(X 光分割)、Slice-3D 等(CT/MRI)。本集是核医学 SPECT 分割第一个——方法论可跨模态迁移(nnU-Net 是通用框架),但数据分布(低分辨率、γ 计数统计噪声、衰减伪影)自成一体。跨模态迁移研究(“X 光分割模型在 SPECT 上还行吗”)从此有了落点。

§6.3 许可光谱:ODbL 的独特档位

条目 许可 访问
506/510 ODC-BY Open
本集 ODbL v1.0 Open
512 Restricted 申请制
MIMIC 家族 License 1.5.0+DUA Credentialed

本集把本库的 Open 档从 ODC-BY 扩展到 ODbL:衍生数据库 share-alike 要求比 BY 重——做再分发产品时,ODbL 要求衍生数据库(注意是数据库本身而非模型)同许可开放。拿掩码训练模型不受影响(模型不是数据库),做数据增强再发布要守条款。

§6.4 "小而专"的生存逻辑

50.4 MB、83 患者——本库最小级。但它的不可替代性在"三无三有":无诊断标签、无负荷相、无伪影标注(三无),但有 CZT 新硬件数据、有手工 gold 掩码、有 Open Access 零门槛(三有)。核医学 AI 冷启动阶段,一个可复现的基准比一个大而全的数据仓库更稀缺——这也是 ASNC 指南级临床场景里,AI 研究真实缺的东西。

§6.5 与同类"小数据集"的定位对照

本库收录过的小体量条目不少,本集在其中的坐标:

条目 体量级 标注 定位
606 cxr-cardiomegaly(百例级) 小 心影分割掩码 单病种分割
607 cxr-phone(百例级) 小 手机胸片 QC 设备泛化
本集(83 患者) 最小 左室壁手工掩码 核医学冷启动
519 MS-CXR-T(1,326 对) 小-中 时序金标 模态能力评测

共同规律:小体量条目的价值不在规模在独特性——要么模态独一份(本集之 NM),要么任务独一份(607 之手机源),要么标注独一份(606 之心影)。选型时按"我缺什么独特素材"检索,别按大小过滤。

§7 AI-Ready 十问

一问:什么格式? DICOM(原始)+ NIfTI(处理)双格式 + 一个 demographics.csv——医学影像工具链(3D Slicer/ITK-SNAP/nibabel/SimpleITK/pydicom)全兼容。

二问:多大规模? 83 患者/101 studies/103 DICOM/101 掩码卷,50.4 MB 解压——本库最小级,一条 wget 下载完。

三问:标注是什么性质? 左心室壁二值掩码,临床专家 3D Slicer 手工分割(gold);nnU-Net 是被评测的自动流程——掩码-模型关系见 §4.2 存照。仅此一个结构一种标注,无诊断标签。

四问:许可与门槛? Open Access + ODbL v1.0——零门槛获取,但 ODbL 的 share-alike 对衍生数据库有同许可要求(§6.3)。

五问:伦理完备度? IIEP 伦理批件(CAAE 65628422.7.0000.0071)+ 全员 ICF + 连续纳入(唯一排除=不签同意)+ DICOM PS3.15 Annex E 去标识 + 研究组不接触敏感临床数据——闭环完整。

六问:可复现性? Code Ocean capsule(doi:10.24433/CO.8499026.v1)+ PhysioNet 软件 capsule(Dockerfile+nnU-Net 脚本)双份复现件;论文 4,150 images 口径与数据集 103/101 口径的映射清楚(2 份未分割)。

七问:标签的可信边界? 单结构(左室壁)单粒度(体素二值);伪影第二阶段的标注不在集内;BMI 部分缺失;两位专家间一致性未在页面报告(论文仅报告模型 vs gold)。

八问:适合什么任务? 左室壁分割(SPECT 域)、nnU-Net 在核医学的基准复现、跨模态分割迁移研究(X 光/CT 模型→SPECT)、核医学预处理/ harmonization 工作流开发、核医学影像教学。

九问:不适合什么? 缺血/梗死诊断模型(无诊断标签——Usage Notes 列的这个用途其实是"未来工作");灌注储备研究(无负荷相);右室/心房分割(无掩码);伪影检测(标注缺席,需自标);跨设备泛化宣称(单相机单机构)。

十问:一句话定位? 巴西核医学的开局考卷:83 个静息相、101 份手工掩码、50 MB 的"小而专"——AI 进核医学的第一级台阶,而不是终点站。

DAIMS 评估:数据可得性 9(Open Access+ODbL+50 MB+软件 capsule,全库最顺滑档)/ 标注 7(专家手工 gold 单结构,无观察者一致性披露)/ 方法 8(采集协议全参数披露+双份复现 capsule+前瞻连续纳入)/ 影响力 5(2025 新集,Views 323,PLoS ONE 中档)/ 规模 4(83 患者/103 图,本库最小级)——DAIMS:6.6(对照:519 基准型 7.0、613 分割型 7.2、602 掩码集 7.5)。

§8 误解与反直觉

误解一:“50 MB 也叫 image database?” 命名自知之明:它卖的是结构(DICOM+NIfTI+掩码+人口学四件套)与可复现性,不是体量。对照 MIMIC-CXR 的几十 GB——定位一个是"教材库"一个是"考卷"。

误解二:“有掩码就能做缺血诊断。” 掩码只勾左心室壁的解剖边界,不含灌注评分(SRS/SRD/SSS)、不含诊断标签。诊断模型需要报告或标注——本集两者皆无,Usage Notes 里的"自动化缺血检测"是应用愿景不是"拿到即可做"。

误解三:“nnU-Net 掩码是自动生成的,用起来一样。” 不一样——掩码是专家手工 gold,nnU-Net 是被它评卷的考生(§4.2)。拿 nnU-Net 输出当训练标签等于用考生答案当标准答案。

误解四:“SPECT 数据和 CT 差不多,pipeline 直接搬。” γ 光子计数统计噪声、4 mm 体素、衰减伪影、CZT 能谱特性——SPECT 的数据分布自成一体。CT 上 92% 的模型迁移过来多少分,正是本集想让人测的问题。

误解五:“83 人太少,练不了手。” 分割训练的瓶颈是标注量不是患者数——101 卷 × 50 层 = 5,050 个带金标切片,2D 训练足够 nnU-Net 起步(论文就是这么干的)。3D 训练确实紧(101 卷),数据增强或 2D 模式绕行。

误解六:“Open Access 所以什么都能干。” ODbL 的 share-alike 条款对衍生数据库有同许可要求——再分发增强版数据集要守 ODbL;训练模型不受限。这是它与 ODC-BY(506/510)最实质的差别。

误解七:“静息相数据,负荷相以后会有。” 页面只承诺"future releases may incorporate diagnostic labels or artifact annotations"——没提负荷相。负荷采集涉及应激流程(运动/药物)与额外伦理,别把希望寄托在未承诺的更新上。

误解八:“/1.0/ 和 /1.0.0/ 都能访问。” 实测 /1.0/ 是 404——PhysioNet 对本集强制完整版本号。爬虫与引用先写 /1.0.0/。

误解九:“数据集 4 位作者,论文也是 4 位。” 论文 14 人全员等贡献(☯),数据集页面挂 4 位核心——引用论文时按 PLoS ONE 的 14 人名单,引用数据集按 PhysioNet 的 4 人 citation。两份工件两份名单。

误解十:“Dice 87% 说明左室分割已解决。” 87% 是单中心、单相机、单结构、静息相的成绩——泛化到其他相机/多结构/负荷相都是未知数。恰恰因为"未解决",这份考卷才有存在价值。

§8.13 坑点表(八坑)

坑点 典型翻车 绕行姿势
坑点1:掩码当自动输出 拿 nnU-Net 输出训练 掩码=手工 gold;nnU-Net=考生(§4.2)
坑点2:DICOM 全有掩码 103 假设配 103 掩码仅 101——按 base id 求交集(§4.1)
坑点3:URL 用 /1.0/ 404 排查半天 PhysioNet 本集要全版本号 /1.0.0/(§1)
坑点4:pixel 尺寸混用 体素间距写错 采集 2.46 / 重建 4.0 mm(§3.2)
坑点5:当诊断数据集用 缺血模型没法标 无诊断标签——它是分割基准(§7 九问)
坑点6:ODbL 当 BY 用 衍生数据库许可违规 share-alike 只对数据库不训模型(§6.3)
坑点7:3D 全量训练爆显存 101 卷跑不动 2D 切片训练(论文姿势,4,150 切片)
坑点8:性别分布当代表 女性亚组不足 88% 男——女性分析谨慎下结论(§4.4)

§9 工作实例:从 wget 到 nnU-Net 复现

§9.1 全量获取与账目核对(终端三行)

# Open Access:wget 直下(或 ZIP 21.5 MB)
wget -r -N -c -np https://physionet.org/files/myocardial-perfusion-spect/1.0.0/

# 账目核对:DICOM 103 / NIfTI 101 / 掩码 101
find myocardial-perfusion-spect/1.0.0/DICOM -name "*.dcm" | wc -l          # 103
find myocardial-perfusion-spect/1.0.0/NIfTI -name "*.nii.gz" \
     ! -name "*_mask*" | wc -l                                             # 101
find myocardial-perfusion-spect/1.0.0/segmentation_masks -name "*_mask.nii.gz" | wc -l  # 101

§9.2 配对与人口学接入(Python)

import glob, os, re
import pandas as pd
import nibabel as nib

base = 'myocardial-perfusion-spect/1.0.0'
niftis = sorted(glob.glob(f'{base}/NIfTI/*.nii.gz'))
niftis = [p for p in niftis if '_mask' not in p]           # 101 个体积
masks  = {p.replace('/NIfTI/', '/segmentation_masks/').replace('.nii.gz', '_mask.nii.gz')
          for p in niftis}                                  # base id 对应掩码

demo = pd.read_csv(f'{base}/demographics.csv')
print(demo['sex'].value_counts(normalize=True))             # M≈0.88 / F≈0.12
print(demo['age'].min(), demo['age'].max())                 # 20 / 90

img = nib.load(niftis[0]); msk = nib.load(masks.pop())
print(img.shape, img.header.get_zooms())                    # (70,70,50) 4mm 各向同性
print(set(msk.get_fdata().ravel().tolist()))                # {0.0, 1.0} 二值

§9.3 nnU-Net 2D 复现(官方 capsule 姿势)

# PhysioNet 软件 capsule:Dockerfile + nnU-Net 脚本 + 配置(fold 0)
# 1) 按 capsule 的 Dockerfile 构建环境
docker build -t mps-nnunet .
# 2) 目录按 nnU-Net v2 惯例重排(imagesTr/labelsTr/...)
#    掩码二值 -> nnU-Net 标签(背景 0 / 心肌壁 1)
# 3) 训练 + 推理(论文姿势:2D 配置 fold 0)
nnUNetv2_train DATASET_ID 2d 0
nnUNetv2_predict -i INPUT_DIR -o OUTPUT_DIR -d DATASET_ID -c 2d -f 0
# 4) 评测:Dice/IoU vs 手工掩码——目标线 Dice≈0.87 / IoU≈0.8(§5.1)

§9.4 评测与口径清单

from monai.metrics import DiceMetric
# 1. 逐卷 Dice -> 报告 mean±std(论文口径 87%±6 内验 / 88.46%±7.48 外验)
# 2. IoU(Jaccard)并报——论文给了 0.8 的口径
# 3. 切分复现:论文未给显式 split——外验=独立专家外批,内验=交叉验证
#    自行实验要固定 seed 与 split 并披露,别对照 87% 硬比
# 4. 2 exams 无掩码:评测前剔除,勿计入分母

§9.5 一个研究问题的最小闭环

“CT 上训好的左室分割模型,在 SPECT 上掉多少分?”——拿本集 101 卷做外测集 → CT 源域模型推理(重采样到 4 mm 各向同性)→ Dice/IoU 对照本集 nnU-Net 基线(87%/0.8)→ 差值就是跨模态鸿沟的量化 → 加 10 卷微调再测(few-shot 迁移曲线)。全程无需诊断标签,掩码即裁判。

§9.6 常见报错速查

  • ** nibabel 读掩码 shape 不匹配**——先 img.shape == msk.shape 且 img.affine ≈ msk.affine 断言;团队统一转换一般一致,但重采样脚本自造差异会静默错位;
  • nnU-Net 报 “no label 0”——掩码必须含背景 0(uint8 的 {0,1}),浮点 NIfTI 先 np.rint 再转 int;
  • DICOM 部分标签缺失——去标识(Annex E)会抹掉患者敏感字段:代码里别断言 PatientName/ID 存在,用文件名 base id 做主键;
  • 下载不完整——三目录计数对账(103/101/101)失败时用 -N -c 续传或改 ZIP(21.5 MB 一步到位);
  • 对照 87% 差距过大——检查是否把无掩码的 2 卷计入、是否 3D 模式误训、fold 是否为 0、是否自行划分了与论文不同的 split。

§10 FAQ:九十问速查

§10.1 身份与获取(9 问)

Q1:这个数据集是什么?

A:巴西 UFG 与 Albert Einstein 医院合作的静息态心肌灌注 SPECT 影像库:83 患者/103 DICOM/101 NIfTI+左心室壁手工掩码,50.4 MB,Open Access。

Q2:slug 与版本号?

A:slug 为 myocardial-perfusion-spect;PhysioNet URL 必须写全 /1.0.0/(/1.0/ 实测 404)。

Q3:版本情况?

A:单版本 v1.0.0(Release Notes 原话 ‘only one version’,2025-09-09 挂牌)。

Q4:DOI 引哪个?

A:v1.0.0 的 10.13026/ce2z-dw74;latest 是 10.13026/md6s-re23。

Q5:怎么获取?

A:Open Access 零门槛:wget -r -N -c -np physionet.org/files/myocardial-perfusion-spect/1.0.0/ 或下载 21.5 MB ZIP。

Q6:要注册认证吗?

A:不需要——‘Anyone can access the files’(页面 Access Policy 原话),签署/课程全免。

Q7:体量多大?

A:解压 50.4 MB / ZIP 21.5 MB——本库最小级数据集,手机都能装下。

Q8:和论文的 figshare 是同一份数据吗?

A:论文 Data Availability 指向 figshare(10.6084/m9.figshare.27047815)承载研究复现;PhysioNet 是数据库正式发布点——同源双挂载。

Q9:Project Website 指向哪?

A:PLoS ONE 论文页(journals.plos.org…e0312257)——数据集与论文互为门面。

§10.2 数据内容(9 问)

Q10:库里是什么影像?

A:静息态心肌灌注 SPECT(99mTc-MIBI)——DICOM 原始 + NIfTI 重建卷两种格式。

Q11:83 和 101 和 103 分别是什么?

A:83=患者数;103=DICOM 全量;101=NIfTI 卷+掩码数——2 份检查未分割(Release Notes 官方解释)。

Q12:有负荷相(stress)吗?

A:没有——‘No stress-induced acquisitions were performed’,全部为静息相。

Q13:掩码勾的是什么结构?

A:只有左心室壁(left ventricular wall)——二值掩码,label 1=心肌壁、0=背景。

Q14:有诊断标签吗?

A:没有——‘Diagnosis labels: Not provided’;缺血/梗死/报告文本全不在 v1.0.0。

Q15:人口学信息有什么?

A:demographics.csv 四列:patient_id/sex/age/BMI(部分可得)——没有更多临床信息。

Q16:男女比例?

A:88% 男 / 12% 女——女性亚组约 10 人,亚组分析谨慎。

Q17:年龄范围?

A:20-90 岁——覆盖成人全段但分布未披露直方图。

Q18:数据什么时候采的?

A:2023 年 2-3 月,Hospital Israelita Albert Einstein(圣保罗)——两个月前瞻连续采集窗口。

§10.3 掩码与标注(9 问)

Q19:掩码是手工还是自动的?

A:专家手工——Data Description 原话 ‘manually generated by clinical experts’,论文确认为 3D Slicer 平台手工分割。

Q20:那页面说的 nnU-Net 自动分割是什么?

A:是配套软件 capsule 里的复现工作流(fold 0),即被评测的模型——不是掩码生成方式(§4.2 存照)。

Q21:掩码质量怎么保证?

A:论文口径:nnU-Net 对手工 gold 的 Dice 87%——gold 本身的观察者间一致性页面未披露。

Q22:多少份掩码?

A:101 份(103 份检查中 2 份未分割)。

Q23:掩码格式?

A:NIfTI(*_mask.nii.gz),与影像同 base id 命名,二值标签。

Q24:有伪影标注吗?

A:v1.0.0 没有——‘Artifact annotations are not available in the current version’;团队的伪影研究(学位论文)有自标掩码但未入集。

Q25:有右心室或心房掩码吗?

A:没有——‘Segmentations are limited to the left ventricular wall’(Limitations 原话)。

Q26:一位患者多份检查怎么对?

A:83 患者/101 studies——部分患者多次检查;demographics.csv 每行一 study,按 patient_id 可聚患者。

Q27:掩码和 MIMIC 系的掩码数据集一个路数吗?

A:同一思路(专家手工二值掩码+公开考卷),不同模态(SPECT vs X 光)与不同结构(左室壁 vs 肺/病灶)。

§10.4 采集协议(9 问)

Q28:用什么相机?

A:GE Discovery NM 530c——CZT 半导体探测器专用心脏相机,19-pinhole 弧阵(MPH_27_45 准直器)。

Q29:CZT 和传统 SPECT 差在哪?

A:CZT 能量分辨率与灵敏度高、可专用聚焦心脏(全孔对心);传统 NaI(Tl) 通用相机牺牲灵敏度换全身体部覆盖。

Q30:放射药物是什么?

A:99mTc-MIBI(甲氧异腈),体重调整剂量,注射后 1 小时采集。

Q31:一次扫描多久?

A:6 分钟/静息相。

Q32:能窗多少?

A:20% @ 140 keV(126.45-154.55 keV)。

Q33:怎么重建的?

A:GE Myovation for Alcyone 软件 + MLEM(最大似然-期望最大化)迭代重建。

Q34:重建后什么分辨率?

A:70×70 px/层 × 50 层,4.0×4.0×4.0 mm 各向同性体素。

Q35:采集像素 2.46mm 和重建 4.0mm 什么关系?

A:2.46×2.46 mm 是 CZT 采集矩阵像素间距;4.0 mm 是重建后 NIfTI 体素——两个阶段两个数(§3.2)。

Q36:体位与协议?

A:仰卧 feet-first,one-day 标准协议——仅静息相。

§10.5 伦理与许可(9 问)

Q37:伦理批件?

A:Albert Einstein 研究教育院(IIEP)批准,CAAE 65628422.7.0000.0071(巴西 CAAE 体系)。

Q38:知情同意?

A:全员签署 ICF——唯一排除标准就是不签同意(连续纳入)。

Q39:去标识怎么做的?

A:DICOM PS3.15 Annex E Basic Application Level Confidentiality Profile(codes 113100/113101/113107)+ 随机 UID 命名。

Q40:报告文本在吗?

A:不在——诊断报告留院内 PACS,研究组只拿 DICOM 副本,‘no sensitive clinical data were accessed’。

Q41:License 是什么?

A:Open Data Commons Open Database License v1.0(ODbL)——Open Access 档。

Q42:ODbL 对我用数据有什么限制?

A:署名+share-alike:衍生数据库须同许可开放;训练模型、发论文不受影响——再分发数据产品时读一遍 ODbL 第 4 章。

Q43:能商用吗?

A:ODbL 允许商用(含共享条款约束);具体用途自查许可文本。

Q44:COI 声明?

A:作者声明无已知竞争性经济利益(页面原话)。

Q45:谁资助的?

A:FCT 葡萄牙(UIDB/00048/2020)+ CNPq 巴西(301644/2022-5)+ FAPEG 硕士奖学金 + LaMCAD/UFG 计算资源;论文层面另有 PROADI-SUS。

§10.6 论文与复现(9 问)

Q46:主论文是什么?

A:Nogueira et al. ‘AI applied in identifying left ventricular walls in MPS images: Pilot study.’ PLoS ONE 2025;20(1):e0312257(2025-01-17)。

Q47:论文核心成绩?

A:nnU-Net 左室壁分割 Dice 87% / 平均 IoU 0.8(vs 专家手工 gold,4,150 张切片)。

Q48:代码在哪?

A:Code Ocean capsule doi:10.24433/CO.8499026.v1 + PhysioNet 软件 capsule(Dockerfile+nnU-Net 脚本)。

Q49:论文和数据集谁先谁后?

A:论文 2025-01 发表,数据集 2025-09 挂牌——先论文后数据 8 个月。

Q50:论文作者是 4 人吗?

A:论文 14 人(全员 equal contribution ☯);数据集 PhysioNet 页面挂 4 位核心——两份工件两份名单。

Q51:伪影检测研究在哪看?

A:UFG 学位论文(Luz 2025-06):内验 Dice 87%±6%/外验 88.46%±7.48%,伪影模型 AUC 0.946——其伪影标注未入数据集。

Q52:怎么复现 87%?

A:nnU-Net 2D fold 0 + 官方 capsule 环境 + 本集 101 卷(论文用 83 exams×50 slices=4,150 切片)——评测细节看论文与 capsule。

Q53:数据划分是什么?

A:页面/论文未给显式 train/test split——内验=交叉验证、外验=专家外批;自做实验须自定划分并披露。

Q54:有官方 baseline 代码吗?

A:有——capsule 含 nnU-Net 配置与 Docker 环境,‘ready-to-run’。

§10.7 工程实践(9 问)

Q55:推荐的读取库?

A:nibabel/SimpleITK 读 NIfTI,pydicom 读 DICOM——页面 Usage Notes 点名兼容。

Q56:3D Slicer 能直接开吗?

A:能——NIfTI 卷与掩码均为标准格式,3D Slicer/ITK-SNAP 直接加载可视化。

Q57:DICOM 和 NIfTI 怎么配对?

A:同一 base id(1.2.840.4267.32.<随机后缀>)——DICOM 与 NIfTI 共享,掩码加 _mask 后缀。

Q58:DICOM 有原始 2.46mm 信息吗?

A:原始 DICOM 头保留采集几何(70×70 重建矩阵、窗宽窗位 16383/32767)——像素间距字段以实际头信息为准,别硬编码。

Q59:nnU-Net 版本?

A:capsule 用 nnU-Net(2D 配置 fold 0)——按 capsule 的 Dockerfile 锁环境,别自由发挥版本。

Q60:2D 还是 3D 训练?

A:论文姿势 2D(4,150 切片);101 卷做 3D 训练偏紧——先 2D 复现再试 3D。

Q61:体素重采样要注意什么?

A:4.0 mm 各向同性——从 1 mm CT 模型迁移时记得重采样到同网格再推理。

Q62:demographics 怎么和影像连?

A:patient_id ↔ 文件 base id——一张表一套名,无跨表 join。

Q63:怎么核对下载完整性?

A:三目录计数对账:DICOM 103/NIfTI 101/掩码 101(§9.1 脚本)。

§10.8 对比与选型(9 问)

Q64:做左室分割还有哪些数据?

A:SPECT 域公开数据极稀缺(本集立项动机);CT/MRI 心脏分割有 M&Ms、ACDC 等挑战赛集——跨模态对照可用。

Q65:它和 MIMIC-CXR 派生掩码集(613/602)什么关系?

A:不同模态不同结构——方法论同路(手工掩码+公开基准),数据零重叠;本库分割条目谱系的核医学分册。

Q66:要核医学其他任务的数据呢?

A:本库暂无其他 NM 条目——本集是版图第一块;PET 素材另有条目但物理生态不同。

Q67:论文说’检测缺血’,我能直接做吗?

A:不能——无诊断标签;那是 Usage Notes 的应用愿景,需外部标签或自标。

Q68:要伪影数据怎么办?

A:v1.0.0 无伪影标注——等后续版本或联系团队(UFG/IIEP);学位论文的伪影掩码未公开入集。

Q69:女性患者分析能做吗?

A:样本约 10 人——只可做探索性分析,不可下结论(88/12 分布是采集现实)。

Q70:它适合发论文当基准吗?

A:适合的姿势:作为 SPECT 分割的外部验证集/迁移目标域——单相机数据当主训练集说服力弱。

Q71:和 ACDC/M&Ms 心脏 MRI 集比?

A:模态不同(SPECT/MRI)、分辨率不同(4mm/1-1.5mm)、结构不同(左室壁单结构/多结构)——互补不互替。

Q72:一句话选型?

A:核医学分割冷启动第一卷:拿它复现 nnU-Net、测跨模态迁移、教学全链路——诊断与伪影研究要另寻弹药。

§10.9 深度技术(11 问)

Q73:CZT 半导体为什么是代际跃迁?

A:直接转换 γ 光子为电信号(NaI 闪烁体需光电倍增管),能量分辨率约 5-6% vs 传统 10%,灵敏度数倍——心脏专用小孔径设计把增益全部堆到心肌上。

Q74:19-pinhole 弧阵怎么工作?

A:19 个针孔准直器排成弧形,全部对准心脏——多视角同时采集,省去旋转机架,6 分钟内完成静态采集。

Q75:MLEM 重建的特点?

A:基于泊松统计模型的迭代重建——比 FBP 噪声特性更可控,但迭代次数与正则化选择影响最终纹理,AI 训练要意识到重建器指纹。

Q76:140 keV 能窗为什么是 20%?

A:99mTc γ 能峰 140.5 keV 的 ±10% 窗——兼顾散射剔除与计数保持,CZT 高分辨率允许更窄窗但本集沿用标准配置。

Q77:SPECT 的体素值物理含义?

A:重建后数值正比于该体素的放射性浓度(计数)——不是 HU 也不是灰度强度,radiomics 特征解释要带物理语境。

Q78:4 mm 体素对分割意味着什么?

A:左室壁厚 8-12 mm 只有 2-3 个体素厚——掩码边界不确定度天然存在,87% 的 Dice 在这个分辨率下已是高水位。

Q79:衰减校正本集做了吗?

A:页面未提及衰减校正(AC)——重建为 MLEM 无 AC 的口径推断,做定量分析时需自行确认 DICOM 头。

Q80:DICOM 头里还藏着什么?

A:窗宽窗位 16383/32767(16-bit 全域)、采集几何、设备信息——用 pydicom 逐字段核对,别信常识硬编码。

Q81:掩码的 3D 连通性有问题吗?

A:页面未披露 QC 细节——使用前跑一次连通域检查(每卷应为单一心肌壁连通体),异常卷列入 QC 名单。

Q82:NIfTI 转换是谁做的?

A:‘All NIfTI files were generated directly from the DICOM images using a standardized preprocessing process’——团队统一转换,方向矩阵以文件头为准。

Q83:windows 16383/32767 怎么解读?

A:16-bit 无符号全域窗——显示时需自行开窗到计数动态范围,直接线性映射会全黑。

§10.10 叙事与意义(11 问)

Q84:为什么说它是’开局考卷’?

A:核医学 AI 的公开数据生态远落后于 X 光/CT——本集补的是从 0 到 1 的第一块标准化踏板,价值在’有’而非’大’。

Q85:50 MB 的数据凭什么进本库?

A:本库收录标准是 AI-Ready(可复现+可获取+结构化),不是体量——ODbL 开放+四件套结构+双份复现件使它的 AI-Ready 评分反而高。

Q86:巴西团队在核医学 AI 的位置?

A:UFG+Einstein+Coimbra 的葡语轴心组合——南半球临床 AI 资源的代表性质产,数据主权叙事的样本。

Q87:先论文后数据的模式这里为什么成立?

A:pilot study 先用数据发表成果,数据库 8 个月后正式挂牌——学术激励与数据公开的时差是临床数据生态的普遍结构。

Q88:‘database’ 命名的底气?

A:结构完整性:影像双格式+掩码+人口学+元数据+复现件——它卖的是数据工程规格不是体量。

Q89:对核医学科的实用价值?

A:教学全链路素材(采集-重建-分割-评测一站齐)+ 科研起步基准——中小科室搭 AI 工作流的第一块砖。

Q90:它暴露了核医学数据生态什么问题?

A:83 人已是’能公开的最大努力’——单中心、无标签、人工标注成本高;核医学 AI 的数据基建比影像 AI 其他分支落后一代,这不是团队的错是生态的坑。

Q91:未来版本值得等吗?

A:页面承诺方向:诊断标签+伪影标注(‘pending ethical approval and enhanced anonymization’)——若兑现,同一 slug 的 v1.1+ 值得回访。

Q92:本条目对’AI-Ready’定义的启示?

A:AI-Ready ≠ 大 ≠ 全标签:获取摩擦为零、结构可预期、复现件齐备、许可明确——四者齐了 50 MB 也是五分素材。

Q93:一年 323 次浏览意味着什么?

A:新集+窄领域(核医学分割)的正常冷启动——它的引用曲线要跟 PLoS ONE 论文走,PhysioNet 计数器只是副产品。

Q94:如果只记住本集一件事?

A:掩码是手工 gold,nnU-Net 是考生——AI 研究里把’标准答案’和’模型输出’混为一谈,是一切评测事故的起点。

Q94:拿到数据第一步做什么?

A:三目录计数对账(103/101/101,§9.1)→ 读 demographics.csv 盘人口学 → 可视化 2-3 卷(3D Slicer 快速看掩码贴合度)→ 再决定训练协议。

Q95:CZT 半导体为什么是代际跃迁?

A:直接把 γ 光子转换为电信号(传统 NaI 闪烁体要经光电倍增管间接转换),能量分辨率与灵敏度都有代差——专用心脏相机的 19 孔弧阵把增益全部聚焦到心肌。

Q96:SPECT 的体素值物理含义是什么?

A:正比于该体素的放射性浓度(γ 计数统计)——不是 CT 的 HU 也不是灰度强度;radiomics 特征解释必须带计数统计语境。

Q97:左室壁 4mm 分辨率下多厚?

A:解剖上 8-12 mm 的心肌壁只有 2-3 个体素厚——掩码边界不确定度是结构性存在的,这也是 87% Dice 在此分辨率下已属高水位的原因。

Q98:有衰减校正吗?

A:页面未提及 AC——按 MLEM 无 AC 口径推断;定量绝对值分析前先核对 DICOM 头,相对分析(室壁内分区对比)更稳。

Q99:窗宽窗位 16383/32767 怎么用?

A:16-bit 无符号全域窗——直接线性显示会全黑;用 pydicom 读像素后自行开窗到计数动态范围或做百分位截断。

Q100:掩码有 3D 连通性问题吗?

A:页面未披露 QC 细节——用前跑一次连通域检查(每卷应为单一心肌壁连通体),异常卷列 QC 名单并从评测剔除。

Q101:NIfTI 是谁转换的?

A:团队统一转换——“All NIfTI files were generated directly from the DICOM images using a standardized preprocessing process”;方向矩阵以文件头为准。

Q102:为什么说 83 人已是生态最大努力?

A:核医学数据基建落后影像 AI 其他分支一代——单中心、人工标注成本、伦理门槛层层叠加;这是生态的坑不是团队的错,也正是公开考卷稀缺的原因。

Q103:AI-Ready 评级给本集的启示?

A:AI-Ready ≠ 大 ≠ 全标签——获取零摩擦(Open+50MB)、结构可预期(四件套)、复现件齐备(双 capsule)、许可明确(ODbL)——四者齐备 50 MB 也是高分素材。

Q104:如果只记住本集一件事?

A:掩码是手工 gold,nnU-Net 是考生——把"标准答案"和"模型输出"混为一谈,是一切评测事故的起点。

Q105:数据集和掩码谁先产生——论文用的数据就是这份吗?

A:论文 2024 年投稿时用的是同一批采集与掩码(figshare 挂论文版),PhysioNet 版 2025-09 才挂牌——数据先于数据集存在 20 个月,"数据集"是发布的动作而非产生的动作。

Q106:ODbL 数据做出来的模型权重也要开源吗?

A:不需要——ODbL 的 share-alike 约束对象是数据库及其衍生数据库,模型权重不在其列;但用掩码做 benchmark 时引用规范(数据集 DOI+论文)仍是学术礼仪底线。

(FAQ 实际 106 问——九十问速查为栏目名,按组覆盖身份/内容/标注/协议/伦理/复现/工程/选型/技术/叙事十域)

§11 事实清单:核查记录

  1. slug myocardial-perfusion-spect(批次队列同名命中)
  2. URL 版本陷阱:/1.0/ 404,必须 /1.0.0/(实测)
  3. 挂牌 2025-09-09(页面 Published 字段)
  4. 单版本 v1.0.0(Release Notes 原话 ‘only one version’)
  5. DOI v1.0.0 = 10.13026/ce2z-dw74
  6. DOI latest = 10.13026/md6s-re23
  7. Open Access:‘Anyone can access the files’(Access Policy 原话)
  8. License = ODC Open Database License v1.0(ODbL,share-alike)
  9. 文件解压 50.4 MB / ZIP 21.5 MB(页面 Files 段)
  10. wget 直下路径 physionet.org/files/myocardial-perfusion-spect/1.0.0/
  11. Topics 13 个(dicom/nifti/automated segmentation/ventricular walls/CAD 等)
  12. Project Views 323(2026-09 快照,一年)
  13. Project Website = PLoS ONE 论文页
  14. 数据集作者 4 人:Calixto/Nogueira/Luz/Ortiz de Camargo
  15. Calixto 三机构挂名(Coimbra+UFG+IFG)
  16. Nogueira 挂 Hospital Israelita Albert Einstein
  17. 论文作者 14 人全员 equal contribution(☯)
  18. 论文通讯 SAN + WPC
  19. 机构四角:UFG/Einstein/Coimbra/IFG-GCITE
  20. 论文 PLoS ONE 2025;20(1):e0312257
  21. 论文 Received 2024-04-18 / Accepted 2024-10-03 / Published 2025-01-17
  22. 数据集挂牌晚于论文 8 个月(先论文后数据)
  23. 论文 Data Availability = figshare 10.6084/m9.figshare.27047815(双挂载)
  24. 代码 Code Ocean doi:10.24433/CO.8499026.v1(2024)
  25. PhysioNet 附带软件 capsule(Dockerfile+nnU-Net 脚本)
  26. 内容=静息态 MPS SPECT(无负荷相)
  27. 83 患者 / 101 studies / 103 DICOM / 101 NIfTI+掩码
  28. Release Notes 官方解释:2 exams 未分割(103 vs 101)
  29. 论文口径:83 exams × 50 slices = 4,150 images
  30. 设备 GE Discovery NM 530c(CZT 半导体)
  31. 19-pinhole 弧阵 / 32×32 px 矩阵 / 全孔聚焦心脏
  32. 准直器 MPH_27_45(Pinhole)
  33. 药物 99mTc-MIBI(体重调整剂量)
  34. one-day 协议 / 仰卧 feet-first / 注射后 1 小时 / 6 分钟扫描
  35. 能窗 20% @ 140 keV(126.45-154.55 keV)
  36. 重建 Myovation for Alcyone + MLEM
  37. 采集像素 2.46×2.46 mm(CZT 矩阵)
  38. 重建体素 70×70×50 / 4.0×4.0×4.0 mm(NIfTI)
  39. 16-bit / window 16383/32767
  40. 去标识 DICOM PS3.15 Annex E(codes 113100/113101/113107)
  41. 掩码二值:label 1=心肌壁 / 0=背景
  42. 掩码=专家手工(Data Description 原话 + 论文 3D Slicer 确认)
  43. nnU-Net ‘automatic segmentation’=capsule 复现流程非掩码生成(歧义存照)
  44. 无诊断标签(‘Diagnosis labels: Not provided’)
  45. 无伪影标注(v1.0.0;future releases 或补)
  46. 分割仅限左心室壁(Limitations 原话)
  47. demographics.csv:patient_id/sex/age/BMI(部分)
  48. 88% 男 / 12% 女 / 20-90 岁
  49. 采集地 Hospital Israelita Albert Einstein(圣保罗)
  50. 采集窗口 2023-02 至 2023-03(两个月)
  51. 唯一排除标准=非知情同意(连续纳入,不限 CAD 病史)
  52. 全员 ICF;报告留 PACS;人口学录 REDCap
  53. 伦理批件 IIEP CAAE 65628422.7.0000.0071
  54. COI:无已知竞争利益
  55. 论文成绩:nnU-Net Dice 87% / 平均 IoU 0.8
  56. UFG 学位论文(Luz 2025-06-18):内验 Dice 87%±6% / 外验 88.46%±7.48%
  57. 伪影模型:Dice 0.300-0.940 / 阈值 0.853 / AUC 0.946 / 特异性完美灵敏度温和
  58. 伪影专家外验一致率 >60%
  59. Limitations 五条页面自列(无负荷/单机构/无诊断/无伪影/仅左室壁)
  60. Usage Notes 五用途(分割/缺血愿景/伪影 QC/harmonization/教学)
  61. 兼容生态:nnU-Net/3D Slicer/ITK-SNAP/nibabel/SimpleITK/pydicom
  62. 资助 FCT UIDB/00048/2020 + CNPq 301644/2022-5 + FAPEG + LaMCAD/UFG
  63. 论文另有 PROADI-SUS 01/2020 资助
  64. References 3 条:Dorbala 2018 指南 / Nogueira 2025 论文 / Calixto 2024 Code Ocean
  65. 页面瑕疵:掩码来源表述歧义(手工 vs automatic 并存)
  66. 页面瑕疵:pixel 双口径(2.46 采集 vs 4.0 重建)
  67. 页面瑕疵:83/101/103 三层计数需官方解释
  68. 本库首个核医学(NM)影像条目——模态版图第五块
  69. 本库 Open 档首个 ODbL(此前 Open 均为 ODC-BY)
  70. 本库最小体量级数据集(50.4 MB)
  71. 查重:url_name 含 perfusion/spect/scintigra 均 0 行
  72. 发布前 MAX(record_id)=619 → 本条预期 rid 620
  73. 互链候选:613/602(分割谱系)/506/510(Open 许可家族)
  74. CZT 直接转换 vs NaI 闪烁体+光电倍增管——能量分辨率与灵敏度代差
  75. 19-pinhole 无机架旋转——多视角并行静态采集
  76. MLEM 泊松统计模型迭代重建——重建器指纹影响纹理
  77. 能窗物理:99mTc γ 峰 140.5 keV ±10%
  78. SPECT 体素值 ∝ 放射性浓度(非 HU)——radiomics 解释语境
  79. 左室壁厚 8-12 mm ≈ 2-3 个体素(4 mm)——掩码边界不确定度结构性存在
  80. 页面未提及衰减校正(AC)——定量分析前核对 DICOM 头
  81. 窗宽窗位 16383/32767 = 16-bit 全域——显示需自行开窗
  82. NIfTI 由团队统一从 DICOM 转换(‘standardized preprocessing process’)
  83. 掩码 QC 细节未披露——使用前建议连通域自检
  84. ACDC/M&Ms 为 MRI 心脏分割对照生态(互补非互替)
  85. SPECT 公开分割数据稀缺=本集立项核心动机
  86. 核医学 AI 数据基建落后影像 AI 其他分支一代(叙事存照)
  87. AI-Ready ≠ 大:获取零摩擦+结构可预期+复现件齐备+许可明确
  88. ODbL 对模型训练无约束、对衍生数据库 share-alike
  89. 引用规范:论文按 14 人 PLoS 名单/数据集按 4 人 PhysioNet citation
  90. 本集入库后批次七访问光谱补齐:Open-ODbL 档归位
  91. PCA:无 MIMIC 血统——批次七首个非 MIMIC 派生条目(对照 516-519)
  92. 论文投稿时数据已在 figshare(先于 PhysioNet 挂牌 20 个月)
  93. ODbL share-alike 不约束模型权重——只约束数据库及衍生数据库
  94. 日均采集约 1.4 人(60 天 83 人)——专用心脏相机现实吞吐
  95. 采集-投稿间隔 13 个月 / 见刊-挂牌间隔 8 个月——公开数据集真实工期表
  96. 附录 F 定位:本集补分割谱系核医学格(602/613 同路不同模态)
  97. 收尾句:AI-Ready 本质是"拿到数据那一刻离复现论文还有多远"
  98. 页面无 Total Size 之外的下载统计口径——Views 323 为唯一流量指标
  99. 本条目事实清单终稿共 99 条——核查覆盖身份/内容/协议/伦理/论文/工程六域

§12 术语表:五十条

1. MPS/MPI —— 心肌灌注显像——核医学评估心肌血流的金标准成像

2. SPECT —— 单光子发射计算机断层——γ 相机 + 准直器 + 重建

3. CZT —— 碲锌镉半导体探测器——新一代核医学相机核心元件

4. 99mTc-MIBI —— 锝-99m 甲氧异腈——心肌灌注显像标准放射性药物

5. MLEM —— 最大似然-期望最大化迭代重建算法

6. 静息相/负荷相 —— MPS 双相采集:静息灌注 vs 应激储备——本集仅静息

7. 左心室壁 —— 本集唯一分割结构——心肌灌注的评估载体

8. pinhole —— 针孔准直器——本机 19 孔弧阵全聚焦心脏(MPH_27_45)

9. Discovery NM 530c —— GE CZT 专用心脏相机——本集唯一设备

10. 衰减伪影 —— 组织吸收 γ 光子造成假性灌注缺损——核医学 AI 主战场之一

11. DICOM PS3.15 Annex E —— DICOM 去标识保密性框架——本集 Basic Profile

12. CAAE —— 巴西伦理审批编号体系(CEP/CONEP)——65628422.7.0000.0071

13. ICF —— 知情同意书——本集唯一排除标准的判定依据

14. ODbL —— ODC 开放数据库许可 v1.0——share-alike 型开放许可

15. ODC-BY —— ODC 署名许可——506/510 的档位,比 ODbL 轻一档

16. share-alike —— 衍生数据库同许可条款——ODbL 第 4 章核心

17. nnU-Net —— 自配置医学分割框架——本集论文的方法与考生

18. Dice 系数 —— 分割重叠度指标——论文口径 87%

19. IoU/Jaccard —— 交并比——论文口径 0.8

20. fold 0 —— nnU-Net 交叉验证的第 0 折——capsule 配置

21. 3D Slicer —— 开源医学影像平台——掩码手工分割工具

22. ITK-SNAP —— 开源分割查看器——本集兼容生态

23. nibabel/SimpleITK —— Python 医学影像 I/O 库——本集兼容生态

24. pydicom —— Python DICOM 读取库——原始影像解析

25. NIfTI —— 神经影像文件格式——本集处理态载体(.nii.gz)

26. demographics.csv —— 本集唯一表格:patient_id/sex/age/BMI

27. 连续纳入 —— 不设临床门槛的 prospective 招募——唯一排除=不签同意

28. 先论文后数据 —— 研究工件挂载模式——本集晚论文 8 个月

29. figshare —— 论文数据仓储——本集的第二挂载点

30. Code Ocean —— 可复现代码胶囊平台——doi:10.24433/CO.8499026.v1

31. 软件 capsule —— PhysioNet 的配套复现件——Dockerfile+nnU-Net 脚本

32. one-day protocol —— 一日双相采集协议——本集仅执行静息半程

33. 4,150 images —— 论文口径:83 exams × 50 slices

34. 灌注储备 —— 负荷与静息差值——本集无法计算(无负荷相)

35. Pilot study —— 先导研究——PLoS ONE 论文的自我定位

36. 等贡献署名 —— 14 位作者 ☯ equal contribution——论文的不常见署名制

37. Hospital Israelita Albert Einstein —— 圣保罗顶级私立医院——数据来源与伦理主体

38. UFG —— 巴西戈亚斯联邦大学——工程端主力

39. Coimbra —— 葡萄牙科英布拉大学——国际合作端

40. PROADI-SUS —— 巴西统一医疗体系发展计划——论文资助方

41. AUC 0.946 —— 伪影检测模型曲线下面积(学位论文第二阶段)

42. 外部验证 —— 独立专家外批——Dice 88.46%±7.48% 的语境

43. harmonization —— 数据协调预处理——Usage Notes 推荐用途之一

44. radiomics —— 影像组学——缺血检测的候选技术路线(愿景)

45. γ 相机 —— 伽马相机——SPECT 的探测主体

46. 各向同性体素 —— 4.0×4.0×4.0 mm——重建体积的空间属性

47. 跨模态迁移 —— CT/MRI 模型→SPECT 的迁移研究——本集外测用途

48. Modality NM —— 核医学 DICOM 模态码——本库首个 NM 条目

49. 50.4 MB —— 解压总体量——本库最小级

50. 小而专 —— 本集定位:结构完整+可复现优先于体量

附录 A:发布时间线与产出链对照

日期 事件
2018 ASNC SPECT MPI 指南发表(Dorbala et al.,J Nucl Cardiol)——本集临床语境的出处
2023-02/03 Einstein 医院 60 天前瞻采集(83 患者连续纳入)
2024-04-18 论文投稿 PLoS ONE
2024 Code Ocean capsule 挂牌(doi:10.24433/CO.8499026.v1)
2024-10-03 论文接收
2025-01-17 PLoS ONE 论文见刊(20(1):e0312257)
2025-06-18 UFG 硕士学位论文答辩(伪影检测第二阶段)
2025-09-09 数据集 v1.0.0 挂牌 PhysioNet(晚论文 8 个月)
2026-09 Views 323;无版本更新

附录 B:采集协议速查卡(复现用)

域 参数
检查 静息态 MPS(99mTc-MIBI)
设备 GE Discovery NM 530c(CZT)
探头 19-pinhole 弧阵(MPH_27_45)/ 32×32 px
时序 one-day / 注后 1h / 6 min
能窗 20% @ 140 keV(126.45-154.55)
体位 仰卧 feet-first
重建 Myovation for Alcyone / MLEM
几何 采集 2.46 mm → 重建 70×70×50 @ 4.0 mm 等向
位深窗 16-bit / WC-WW 16383/32767
去标识 PS3.15 Annex E(113100/113101/113107)

速查卡使用说明:做复现实验时按行核对——设备与探头行决定数据分布(CZT 特性),时序与药物行决定生理状态(注射后 1 小时的分布期),重建行决定纹理指纹(MLEM 迭代特性),几何行决定预处理管线(4 mm 等向的重采样基准),去标识行决定 DICOM 头可预期内容(敏感字段已抹)。一张卡十行参数,复现论文采集侧的全部信息量都在这里——对照许多论文"相机型号都不给"的披露水平,这份协议记录的完整度本身就是 AI-Ready 的示范。

附录 C:计数账本(三层口径全录)

层 数 说明
患者 83 demographics.csv 的 patient_id 去重
studies 101 一 study 一 NIfTI 卷;部分患者多 study
DICOM 103 2 份无掩码(Release Notes 官方解释)
掩码 101 与 NIfTI 一一同 base id 配对
切片 4,150 论文口径:83×50(论文只用 83 exams 的口径)

注:4,150(论文)与 101×50=5,050(NIfTI 全量)的差异来自"论文拍摄时点 83 exams vs 数据集整理时 101 studies"的扩容——引用切片数时注明口径来源。

附录 D:口径差异存照(并列引用,不仲裁)

项 口径 A 口径 B 处置
掩码来源 手工(Data Description + 论文 3D Slicer) “automatic segmentation…nnU-Net”(Usage Notes) 存照:手工 gold,nnU-Net 为考生与 capsule 流程
像素尺寸 2.46×2.46 mm(采集) 4.0×4.0 mm(重建) 按阶段引用
图像计数 103 DICOM(全量) 101 带掩码 / 4,150 论文切片 按用途引用并注明
作者名单 数据集 4 人 论文 14 人等贡献 按工件对表
访问预判 批次队列未标 实测 Open Access + ODbL 以实测为准
缺血检测 Usage Notes 列为用途 无诊断标签 愿景 vs 现状分开写

三行读法提示:一,掩码来源存照是本集最重要的一行——"gold 与考生"混淆会系统性污染下游评测,任何引用本集的论文都应先把这层关系写清;二,像素双口径是医学影像多阶段处理(采集-重建)的常见形态,本集把两阶段参数都完整披露反而是加分项;三,作者名单差异的尺度(4 vs 14)大于 519 的(15 vs 16)——数据集署名收敛于核心 4 人,论文署名是葡语科研协作网络的全景照,两种署名哲学并存于同一工件族。

附录 E:文件清单与命名规则

myocardial-perfusion-spect/1.0.0/
├── DICOM/                      # 103 × *.dcm(原始 SPECT)
│   └── 1.2.840.4267.32.<35-40 位随机后缀>.dcm
├── NIfTI/                      # 101 × *.nii.gz(重建体积)
│   └── 1.2.840.4267.32.<同 base id>.nii.gz
├── segmentation_masks/         # 101 × *_mask.nii.gz(左室壁二值)
│   └── 1.2.840.4267.32.<同 base id>_mask.nii.gz
├── demographics.csv            # patient_id / sex / age / BMI
└── data_description.txt        # 完整结构说明(页面指引)

附录 F:本库分割类条目谱系(含本集)

条目 模态 结构 掩码来源 访问
602 chexmask-cxr-segmentation-data X 光 肺等 人工+自动混合 Open
613 lung-segment-mimic-cxr X 光 肺 模型+人工审 Open
506/510 等掩码集 CT/X 光 多结构 人工金标 Open/BY
本集(620) SPECT(NM) 左心室壁 专家 3D Slicer 手工 Open/ODbL

本集补的是谱系的核医学格——掩码方法论与 602/613 同路,模态物理与生态自成一体。

附录 G:许可光谱与本集档位

档位 条目 许可 衍生数据库约束
Open-BY 506/510 等 ODC-BY 署名即可
Open-DB(本集) 620 ODbL v1.0 同许可 share-alike
申请制 512 Restricted 协议条款
认证制 MIMIC 家族 License 1.5.0+DUA DUA 条款

ODbL 实务一句话:训练模型=自由,再分发数据=同许可。对照表让选型一秒定位。

补一行格局观察:四档光谱里,Open 档(BY/DB)条目的共同特征是"影像+掩码"型素材(506/510/602/613/本集)——像素级标注数据的公开意愿与可行性都高于报告文本(隐私面小)。核医学考卷选择最重的 ODbL 而不是 BY,可能与数据库作为"整体作品"的定位有关——团队把影像-掩码-元数据当成一件完整的数据库作品来保护,这在临床影像公开里是更谨慎也更欧洲的姿势。

附录 H:批次七生产存照(520 号)

  • 生产序号:批次七 5/10(数据集总序 520;发布后 record_id 620)
  • 核查轮次:3 轮——①PhysioNet v1.0.0 页面全段提取(57,607 B,先排 /1.0/ 404 陷阱);②PLoS ONE e0312257 全文页(Dice/IoU/4,150/figshare/14 人名单/资助全录);③BVS+Paperity 交叉 + UFG 学位论文库(伪影第二阶段 AUC 0.946)+ DB 查重实测
  • 关键修正:访问预判修正(批次队列未标 → 实测 Open Access + ODbL v1.0,非 Credentialed);掩码来源歧义解决(论文交叉:手工 gold)
  • 意外收获:URL 版本号陷阱(/1.0/ 404);50.4 MB 本库最小级;本库首个 NM 条目;论文 14 人等贡献署名制
  • 成品行数:见发布记录(目标 ≥1200)
  • 下一发:521 rad-coreference-resolution(批次七 6/10,医疗 NLP 域回归)

收尾:本集留给后来者的三句话

一,核医学 AI 的第一块公开踏板已经铺好——下一块(多中心、多相机、带标签)仍无人铺,机会属于踩上这块的人。二,"掩码是 gold、模型是考生"的分离纪律适用于所有标注数据集——每当文档里"手工"与"自动"同页出现,先做本条目 §4.2 式的考古再写代码。三,50 MB 敢叫 database 的底气来自结构——AI-Ready 的本质不是数据有多大,而是拿到它的那一刻,你离复现论文还有多远。本集的答案是:一条 wget 的事。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • mms — 共享标签:医学影像 / 医学图像分割 / 心血管疾病
  • echonet-dynamic — 共享标签:医学影像 / 医学图像分割 / 心血管疾病
  • camus — 共享标签:医学影像 / 医学图像分割 / 心血管疾病
  • imagecas — 共享标签:医学影像 / 医学图像分割 / 心血管疾病
  • cardiac-atlas-project — 共享标签:医学影像 / 医学图像分割 / 心血管疾病
  • echonet-pediatric — 共享标签:医学影像 / 医学图像分割 / 心血管疾病
  • acdc — 共享标签:医学影像 / 医学图像分割 / 心血管疾病
  • mms-2 — 共享标签:医学影像 / 医学图像分割 / 心血管疾病
  • cmrxmotion — 共享标签:医学影像 / 医学图像分割 / 心血管疾病
  • lvquant — 共享标签:医学影像 / 医学图像分割 / 心血管疾病

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集