Cardiac Atlas Project — 心脏统计图谱开源库 AI-Ready Wikipedia

全球最早的开源心脏 MRI 统计图谱库:5,000+ 例 CMR 检查

来源 Cardiac Atlas Project(奥克兰大学 & UCLA,NHLBI 资助) url: http://www.cardiacatlas.org/发布时间: 2026-09-18最后更新: 2026-09-25 阅读 24
Cardiac Atlas Project — 心脏统计图谱开源库 AI-Ready Wikipedia

信息速览

数据集名称Cardiac Atlas Project — 心脏统计图谱开源库 AI-Ready Wikipedia
数据类型MESA 2,450 例 + DETERMINE 450 例,DICOM/NIfTI/VTK 多格式,Sunnybrook 子集 CC0 公开域,免费申请获取(需签 DDA)
规模5,000+ 例心脏 CMR 检查(MESA 队列基线 CMR 5,098 名参与者)
接入方式Cardiac Atlas Project(奥克兰大学 & UCLA,NHLBI 资助) url: http://www.cardiacatlas.org/
AI 就绪度

Cardiac Atlas Project(心脏图谱计划)— 心脏统计图谱开源库 AI-Ready Wikipedia


INFOBOX

数据集名称 Cardiac Atlas Project(心脏图谱计划)
英文全称 The Cardiac Atlas Project (CAP)
别名/简称 CAP、cardiacatlas.org、CAP Database
疾病分类 心血管疾病(ICD-11:BE2Z 心力衰竭 / BA41 急性心肌梗死 / BA43 陈旧性心肌梗死 / BA4Z 缺血性心脏病 / BC43 肥厚型心肌病 / LA55 房间隔缺损,详见 §2.1)
SNOMED CT 84114007 Heart failure / 22298006 Myocardial infarction / 53741008 Coronary arteriosclerosis / 89792004 Hypertrophy of left ventricle / 74832004 Atrial septal defect(详见 §2.1b)
数据模态 心脏 cine MRI(GRE 与 SSFP 序列)、晚增强 LGE(DETERMINE)、3D 超声心动图(MITEA)、3D 有限元形状模型与轮廓
AI 任务类型 左心室分割、心脏标志点检测、形状/运动统计建模(PCA/SSM)、心肌梗死分类、灌注运动伪影校正、跨协议域适应
样本总数 5,000+ 例心脏 CMR 检查:MESA 2,450 例(官网托管)+ DETERMINE 450 例 + Sunnybrook 45 例 + SCMR 共识 15 例 + MITEA 134 例 + AIM-ASD 40 例等
数据大小 Sunnybrook 批次约 2.7 GB(5 个 DICOM zip);MESA/DETERMINE 按申请分发(未公布固定体积)
数据格式 DICOM(匿名化)、NIfTI、VTK 网格、XML 模型/轮廓格式
许可证 CC0 1.0(Sunnybrook、AMRG)/ 各贡献者 Data Distribution Agreement(MESA、DETERMINE)/ Mozilla Public License 1.1(配套软件)
访问级别 混合:Sunnybrook 开放下载;MESA/DETERMINE/挑战赛为申请审核(研究提案 + 贡献者批准 + 签署 DDA)
DUO 标签 HMB, IRB, PUB(MESA/DETERMINE 子集);Sunnybrook 公开域子集为 NRES
语言 英文
首发日期 2011-07-06(Fonseca et al. Bioinformatics 在线发表)
最后更新 平台持续更新(DETERMINE 于 2026-09 校验时处于"暂时不可用"续签状态)
发布机构 奥克兰大学生物工程研究所 & UCLA(美国 NHLBI 资助,R01 HL091069 等)
官方主页 http://www.cardiacatlas.org/
下载地址 http://www.cardiacatlas.org/(各子集页面内嵌申请表单)
DOI 10.1093/bioinformatics/btr360(数据集论文)
引用次数 355+(Google Scholar,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐(3/5)— 公开域子集带专家轮廓可即取即用、形状模型生态成熟;扣分项:主力子集(MESA/DETERMINE)无手工轮廓、申请需逐贡献者签 DDA、MESA 为 GRE 遗留协议需域适应
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 双映射、缺血性心脏病与心力衰竭临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。Cardiac Atlas Project 各子集许可不同:Sunnybrook 子集为 Public Domain(CC0 1.0)无需授权;MESA、DETERMINE 等子集需在线提交研究提案、经数据贡献者批准并逐签署 Data Distribution Agreement(DDA),MESA 另附出版审批与合著者要求。DUO 标签仅供参考,具体使用限制以各子集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? 心脏图谱计划(Cardiac Atlas Project,CAP)是一个由美国 NIH 下属心肺血液研究所(NHLBI)资助、奥克兰大学生物工程研究所与 UCLA 联合建设的开源心脏影像数据库与建模平台,自 2011 年论文发表以来持续汇集全球多中心的心脏磁共振(CMR)检查、三维左心室模型和衍生功能分析数据,官网为 cardiacatlas.org。它不是某一个单一扫描项目的产物,而是一个"数据联盟":MESA 人群队列、DETERMINE 临床试验、2009 年 MICCAI 分割挑战数据、STACOM 系列挑战数据、先心病图谱(CHD)、3D 超声(MITEA)与房间隔缺损(AIM-ASD)等各自独立的贡献者,在同一套 DICOM 兼容的存储与建模框架下汇聚成库。其核心口号是"从患者到人群、再回到患者"——把零散的临床影像变成可统计比较的心脏形状与运动图谱。

为什么重要? 在深度学习兴起之前,CAP 就解决了心脏影像研究最痛的两个问题:数据孤岛(各临床试验影像格式不一、无法合并分析)与标注稀缺(专家轮廓昂贵且不一致)。它通过标准化 DICOM 去标识流程、有限元形状模型和 STAPLE 共识算法,把 MESA(2,450 例无症状人群)、DETERMINE(450 例心肌梗死患者)等队列整合到统一坐标系中,使"无症状人群长什么样、心梗后心脏如何变形"第一次可以用同一把统计尺子度量。它是统计形状建模与心脏图谱研究的事实标准数据源,其方法学思路后来被 UK Biobank 等超大型队列直接继承。

我能用它做什么? 训练与评测左心室分割、标志点检测模型;构建人群心脏形状图谱并研究形状与心血管危险因素的关联;做 GRE(遗留协议)到 SSFP(现代协议)的跨协议域适应研究;或直接使用 Sunnybrook(CC0 公开域、45 例带专家轮廓)在半小时内搭建并跑通第一个分割 pipeline。全部配套软件(数据库、CIM 建模客户端、开放数据格式)以 MPL 1.1 开源,官方深度学习管线代码托管在 CardiacAtlasProject GitHub 组织。

§1.1 摘要

CAP 是一项 NIH 赞助的国际协作工程,技术实现上包含三大开源组件:带 Web 界面的影像数据库(MySQL + JBoss + Dcm4chee 三层架构、完全兼容 DICOM,并对 Dcm4chee 做了扩展以支持影像特有属性的检索参数)、用于 3D+时间可视化与形状/运动参数化描述的建模客户端(CIM,Cardiac Image Modeller,奥克兰大学开发),以及开放的心脏模型与标注数据格式(XML,支持语义化表征)。数据经 HIPAA 合规的 LONI De-identification Debabeler(UCLA 计算生物学中心提供)脱敏后入库,仅纳入知情同意与 IRB 批准兼容共享的病例。截至 Fonseca et al. 2011 发表时,库内已有约 3,000 例去标识心脏影像检查;其中 MESA 队列贡献 2,864 例无症状志愿者、DETERMINE 队列贡献 470 例心肌梗死患者(2011 年 SCMR 报道),如今官网分别以 2,450 例与 450 例的口径对申请者开放。MESA 基线共入组 5,098 名无临床心血管病的参与者,其中 5,003 例 MRI 合格,深度学习论文报告其中 2,529 例(50.5%)曾在 CAP 内可用、其余 2,474 例(49.5%)作为独立测试子集验证图谱管线。访问控制同样成体系:研究者在线提交研究提案,经 CAP 指导委员会与各数据贡献者双重把关后逐队列签署 Data Distribution Agreement,出版政策、数据处理与知识产权条款均在 DDA 中约定。配合 STACOM 系列挑战赛(LV 分割、标志点、统计形状、运动跟踪等),CAP 形成了"数据 + 挑战 + 共识 + 工具"的完整生态,配套论文被引 355+ 次(Google Scholar,截至 2026-09)。

§1.2 战略价值

维度一:人群级心脏形状统计的"公共坐标系统"。 CAP 最大的差异化价值不在样本量而在标准化:所有病例通过统一的有限元映射注册到同一心脏坐标系,使不同队列(无症状 vs 心梗)、不同协议(GRE vs SSFP)、不同厂商的影像可以逐点统计比较。PCA 主模式与心室大小、球形度、二尖瓣几何等临床指标对应,Hotelling T2 检验可区分不同梗死部位亚组——这套方法学至今仍是 UK Biobank 等大型队列心脏分析的方法基座。

维度二:稀缺专家共识标注的开放供给。 心脏影像 AI 的瓶颈从来不是原始影像而是可信赖的标注。CAP 以 STAPLE 期望最大化算法聚合 7 个世界级 MR 核心实验室专家与多款自动算法的分割结果,生成比任何单一标注者都更稳定的共识轮廓,并以挑战赛形式持续回收新的自动分割结果来迭代共识——这是一个"越用越准"的标注飞轮,15 例 SCMR 共识轮廓子集更是官方推荐的外部验证金标准。

维度三:跨协议泛化研究的天然试验场。 MESA 的 GRE 遗留序列与现代 SSFP 数据形成的"协议鸿沟",反而使其成为测试模型跨域鲁棒性、协议偏倚校正和迁移学习的高价值基准——现代 SSFP 上训练的分割网络在 MESA 上会直接失效,这一失效模式已被官方论文系统研究并给出可行管线。

§1.3 同类数据集横向对比

数据集 规模 模态/协议 标注 差异化定位
Cardiac Atlas Project 5,000+ 例 CMR(多子集) cine MRI(GRE + SSFP)、LGE、3D 超声 STAPLE 共识轮廓、专家轮廓(子集)、有限元模型 人群级形状统计建模 + 挑战赛生态 + 开源建模工具
Sunnybrook Cardiac Data(CAP 子集) 45 例 cine MRI(2009 挑战) 专家手工 SAX 轮廓 + 3D 模型 CC0 公开域、经典 LV 分割基准
ACDC 100 例患者 cine MRI(1.5T/3T) 全部病例专家分割 心肌病分类与分割、现代 SSFP 协议
M&Ms 345 例 cine MRI(4 厂商 3 中心) 专家分割 多厂商域泛化挑战
UK Biobank 数万例级人群队列 cine MRI(SSFP) 自动 + 质控轮廓 超大人群规模、现代协议

上表中其他数据集的数字为各自文献口径,仅用于量级对比;CAP 独有的组合是"无症状人群(MESA)+ 心梗患者(DETERMINE)+ 遗留 GRE 协议 + 共识标注 + 建模软件"五合一。

§1.4 版本与平台时间轴

时间 事件
2009 Sunnybrook 45 例数据作为 MICCAI 2009 LV 分割挑战数据发布,后以 CC0 入库 CAP
2010 STACOM-CESC 2010 发表 CAP 设计与流程(Fonseca et al., LNCS 36-45);MESA 2,864 例与 DETERMINE 470 例陆续入库
2011-07-06 Fonseca et al. Bioinformatics 论文在线发表,库容约 3,000 例检查
2011 STACOM 2011 双挑战:LV 分割(DETERMINE 200 例)与 Motion Tracking(体模 + 15 例 MRI/3D 超声)
2013-2014 STAPLE 共识分割论文(Suinesiaputra et al. 2014)、GRE→SSFP 协议偏倚校正论文(2013)发表
2017-2018 心肌梗死统计形状分类挑战成果发表于 IEEE JBHI
2021 MESA 遗留数据深度学习管线论文发表(Front Cardiovasc Med),代码开源于 CardiacAtlasProject GitHub 组织
2026-09(校验时点) 官网在售子集:Sunnybrook(开放)、SCMR 共识、DETERMINE(暂不可用、协议续签中)、MESA(2,450 例申请制)、CHD、MITEA、AMRG、AIM-ASD

时间轴读法:CAP 无正式版本号,"版本"即官网子集状态本身;引用规模数字时务必同时给出其所处的时间截面与来源页面。

§1.5 典型应用场景

  1. 左心室分割基准评测:用 Sunnybrook/挑战赛训练集开发,SCMR 15 例共识轮廓做外部验证——官方明示其"完美的外部测试验证集"定位。
  2. 心脏形状图谱与危险因素关联研究:以 MESA 有限元模型 + PCA 主模式分析与年龄、性别、种族、体重指数的关联(Medrano-Gracia et al. 2014 范式)。
  3. 跨协议域适应:MESA(GRE)→ SSFP 的风格迁移、协议偏倚校正建模,直接复用官方 ≤1 ml 容积偏差的校正思路。
  4. 心梗形状重构量化:DETERMINE 梗死亚组 vs MESA 对照的逐点 Hotelling T2 图谱,定位重构区域。
  5. 医学教育:用 CAP 客户端在 3D+时间上可视化心动周期,理解 EF、容积、室壁增厚等指标的计算来源。

§2 医学背景

§2.1 ICD-11 编码映射表

标签/队列 疾病/状态 ICD-11 编码 ICD-11 中文名
MESA 无症状心血管病高危人群筛查 BA4Z 缺血性心脏病,未特指(筛查阴性为主)
Sunnybrook HF-I/HF 心力衰竭(梗死性/非梗死性) BE2Z 心力衰竭
DETERMINE 冠心病伴心肌梗死 BA43 陈旧性心肌梗死
DETERMINE(急性期参考) 急性心肌梗死 BA41 急性心肌梗死
Sunnybrook HYP 左心室肥厚/肥厚型心肌病 BC43 肥厚型心肌病
AIM-ASD / CHD Atlas 房间隔缺损(继发孔型为主) LA55 房间隔缺损
MESA 动脉粥样硬化亚临床病变 BA40 动脉粥样硬化

注:CAP 本身是影像资源而非疾病登记库;上表是按队列病理构成给出的编码映射,用于跨文献检索对齐,个体病例编码以原始研究为准。

§2.1b SNOMED CT 映射表

标签/结构 SNOMED CT 码 术语 用途
心力衰竭 84114007 Heart failure (disorder) DETERMINE/HF 亚组语义对齐
心肌梗死 22298006 Myocardial infarction (disorder) DETERMINE 入选状态
冠状动脉粥样硬化 53741008 Coronary arteriosclerosis (disorder) 冠心病队列映射
左心室肥厚 89792004 Hypertrophy of left ventricle Sunnybrook HYP 组
房间隔缺损 74832004 Atrial septal defect (disorder) AIM-ASD 子集
左心室解剖结构 87878005 Left cardiac ventricle structure 形状模型目标解剖
心脏 MRI 433135000 Magnetic resonance imaging of heart (procedure) 检查模态编码

§2.2 疾病与人群简介

CAP 覆盖两端连续谱:一端是 MESA(Multi-Ethnic Study of Atherosclerosis,动脉粥样硬化多族群研究)的 45-84 岁无症状人群——他们入组时无临床心血管病,但携带高血压、糖尿病、血脂异常等亚临床危险因素,是从"健康"到"亚临床"过渡的研究窗口,共 6,500+ 参与者、白人/非裔/西裔/华裔四个族群。MESA 的研究目标是考察亚临床向临床心血管病发展的表现,因此在基线(2000-2002)对全部参与者行 CMR,此后还设有多时相随访;CAP 托管的是其中的基线影像部分(官网口径 2,450 例)。另一端是 DETERMINE(Defibrillators to Reduce Risk by Magnetic Resonance Imaging Evaluation)临床试验人群:冠心病伴轻中度左心室功能不全(EF 高于传统 ICD 一级预防阈值但心肌梗死面积 ≥15% 左室质量)的患者,研究问题为"这类’中间地带’患者是否能从 ICD 获益"——主要终点为长期生存,次要终点为恶性心律失常致死。试验由 Northwestern、Duke、Johns Hopkins 与 UCLA 的前期工作奠基,每个现场中心对候选患者行功能 cine 成像与晚增强成像。两端人群叠加,使 CAP 同时拥有正常重构谱系与病理性重构(梗死后心室球形扩张、局部运动消失)的完整对照。Sunnybrook 45 例则按 Alfakih et al.(JMRI 2003)标准分四组:健康(N,9 例)、肥厚(HYP,12 例)、心衰无梗死(HF,12 例)、心衰伴梗死(HF-I,12 例),四组的舒张末容积依次为 115.69、114.39、233.67、244.92 ml,射血分数依次为 62.93%、62.72%、33.09%、32.01%、左心室质量依次为 130.27、175.87、193.69、201.32 g,构成小而极端的病理梯度。从流行病学视角看,这一"人群队列 + 临床试验 + 混合病理挑战库"的三源结构,使 CAP 在心脏影像资源中罕见地同时支持人群参照研究与病理机制研究。

§2.3 临床任务定义

任务 输入 输出 临床意义
LV 分割 短轴 cine MRI 序列 心内膜/心外膜轮廓或二值掩膜 EF、容积、心肌质量的量化基础,是所有功能指标的前置步骤
标志点检测 2CH/4CH 长轴 + SAX 二尖瓣铰链点、RV 插入点 界定 LV 模型基底范围与室间隔位置,决定形状模型解剖正确性
形状/运动统计建模 全心动几何 + 时相 PCA 主模式得分、逐点 T2 图 将"心脏是否偏离人群正常范围"量化为标准差距离,服务个体化对照
梗死定位/分类 LV 形状模型 + LGE 评分 梗死部位/透壁程度 无创推断梗死位置与负荷,辅助 ICD 与再血管化决策
运动伪影校正 灌注图像序列 去运动伪影序列 灌注定量分析的前置质控

§2.4 患者人群表

队列 来源/中心 采集时间 年龄 性别/种族 就医类型
MESA(基线) 美国 6 中心(1.5T Siemens/GE) 2000-07 至 2002-07 45-84 岁 男/女;白人、非裔、西裔、华裔 无症状社区人群
DETERMINE 北美多中心临床试验 试验期内(2009 年方案发表) 成人为主 男多于女(冠心病人群特征) 心梗后 ICD 二级预防候选者
Sunnybrook 加拿大多伦多 Sunnybrook 中心 2009 挑战前后 成人 混合病理 混合(健康/肥厚/心衰/心梗)
Motion Tracking(STACOM 2011) 伦敦国王学院 + 乌尔姆大学 2011 前 健康志愿者 + 体模 — 志愿者
CHD Atlas Rady Children’s、UC San Diego、Starship Auckland 持续 成人 + 儿童 先心病各型 专科临床
AIM-ASD 专科中心 — 成人未矫正继发孔型 ASD 23 例患者 + 17 例对照 专科临床

§2.5 临床价值

对临床而言,CAP 类资源的价值是提供"人群参照系":一名患者的左心室形状可以映射到 CAP 人群图谱上,读出其在同年龄、同性别、同病理亚组中的标准差位置,从而把"重构是否异常"从主观判断变为统计推断——官方设想的三类典型用途包括:临床评估(判断个体是否落在正常范围内、偏离多少个标准差,并与病理匹配的 CAP 人群亚组对照)、临床试验(跨研究队列假设检验与元数据查询,用映射变换消除协议偏倚)与医学教育(配合可下载的 CAP 客户端在 3D+时间上理解心功能指标的计算来源)。对试验设计者,GRE→SSFP 协议偏倚校正模型(容积偏差 ≤1 ml)让跨越十余年的新旧影像可以合并分析,避免重采样的巨额成本;对 AI 工程师,STAPLE 共识轮廓提供了比单一标注者更稳定的监督信号,且共识资源持续接受新的自动分割结果回流迭代。这些能力最终指向同一个目标:让心功能量化更早、更便宜、更可重复。

§2.6 金标准表

划分 标注对象 标注方式 标注者 性质
Sunnybrook(45 例) SAX 心内外膜轮廓 手工逐帧 Sunnybrook 核心实验室专家 挑战赛官方 GT(CC0)
SCMR 共识(15 例) LV 心肌轮廓 STAPLE 聚合 7 个世界级核心实验室 7 名专家 多专家共识,外部验证首选
LV 分割挑战(100 训练) LV 心肌掩膜 半自动 in-line automated tracking + STAPLE 共识 算法 + 人工混合 半自动(不得直接当 GT 报告)
LV 分割挑战(100 测试) LV 心肌掩膜 提交后发放 STAPLE 共识 多算法 + 人工混合 迭代共识资源
MESA/DETERMINE 主库 无轮廓 — — 仅影像 + 部分半自动 3D 模型
MESA 全库 图像质量与室壁运动评分 核心实验室主观三级/分级评分 MESA MR 核心实验室读片者 质控元数据,非解剖标注

§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐子集 大小 理由
快速跑通分割 pipeline / 教学 Sunnybrook Cardiac Data 约 2.7 GB CC0 无需申请,带专家轮廓 + 3D 模型 + 容积统计
严格外部验证 SCMR Consensus Contour 小(15 例) 7 核心实验室专家共识,独立性最强
人群形状统计 / 危险因素关联 MESA(2,450 例) 按申请分发 无症状四族群人群,有 DDA 合著者机制约束
心梗重构 / 病理建模 DETERMINE(450 例,2026-09 校验时暂不可用) 按申请分发 SSFP + LGE,梗死位置可对照
运动/多模态方法评测 Motion Tracking 挑战数据 小 体模真值 + MRI/3D 超声多模态,全部开放
多模态超声方法 MITEA(134 例 3D 超声) 按申请分发 scan/re-scan 成对设计,天然可测重复性

§3.1 模态详情

主力模态为心脏 cine MRI 短轴 + 长轴(2CH/4CH)序列,覆盖整个心动周期。MESA 采用 2000 年代初的 GRE(梯度回波) cine 协议:层厚 6 mm、间隙 4 mm、FOV 360-400 mm、矩阵 256×160(最小 192×160)、翻转角 20°、TE 3-5 ms、TR 8-10 ms、每层 20-30 帧(时间分辨率 <50 ms)、像素 1.4-2.5 mm——与当代 SSFP 协议存在系统性对比度与血流依赖差异。DETERMINE 采用回顾性门控 SSFP:层厚 ≤10 mm、间隙 ≤2 mm、TR 30-50 ms、TE 1.6 ms、翻转角 60°、FOV 360 mm、矩阵 128×256、25 帧、屏气 8-15 秒,另含 LGE 晚增强(钆对比剂 0.15-0.2 mmol/kg,注药后 10-20 分钟采集,与 cine 同层面)。挑战赛数据另含 whole-heart SSFP、4D tagged MR(三个正交标记方向 + 融合网格标记体)与 3D 心尖超声容积。MITEA 提供 134 例 3D 超声(每例 scan/re-scan 成对);AIM-ASD 提供高分辨双心房 MRI 与 NIfTI 分割 + VTK 纤维化网格。

§3.1b 两大主力协议参数对照表

参数 MESA(GRE) DETERMINE(SSFP)
序列 梯度回波(GRE)cine 回顾性门控 SSFP cine
场强/厂商 1.5T,Siemens 与 GE 多中心临床级 1.5T 为主
层厚/间隙 6 mm / 4 mm ≤10 mm / ≤2 mm
FOV 360-400 mm 360 mm
矩阵 256×160(最小 192×160) 128×256
翻转角 20° 60°
TE/TR 3-5 ms / 8-10 ms 1.6 ms / 30-50 ms
每层帧数 20-30 帧(时间分辨率 <50 ms) 25 帧(随心率与屏气时长变化)
像素 1.4-2.5 mm —(矩阵与 FOV 推算)
附加序列 主动脉相位对比、主动脉黑血 LGE(0.15-0.2 mmol/kg,注药后 10-20 min,与 cine 同层面)
屏气方式 静息肺容量屏气 每屏气 8-15 秒覆盖一段
采集窗口 2000-07 至 2002-07 试验期内

该表是跨子集建模的"对账单":任何混合 MESA 与 DETERMINE 的分析,都必须先声明用哪一列参数、以及是否做了协议偏倚校正(见 §6.5 坑点 2)。

§3.2 按子集样本数表

子集 病例数 病理构成 轮廓 获取方式
MESA 2,450 例(官网托管;2011 口径 2,864 例入库) 无症状志愿者 无 申请 + DDA + MESA 委员会审批
DETERMINE 450 例(2011 口径 470 例) 冠心病 + 轻中度 LV 功能不全 无(挑战训练集为半自动) 申请 + DDA(2026-09 校验时暂停)
Sunnybrook 45 例 N 9 / HYP 12 / HF 12 / HF-I 12 专家手工 SAX + 3D 模型 直接下载(CC0)
SCMR Consensus 15 例 混合病理、多厂商多中心 7 专家 STAPLE 共识 申请
MITEA 134 例 3D 超声 scan/re-scan 带标签 申请
AIM-ASD 40 例(23 ASD + 17 对照) 继发孔型 ASD 双心房手工分割(NIfTI) 申请
AMRG 1 例 健康受试者 无 直接下载(公开域)
CHD Atlas 未公布总数 成人 + 儿童先心病 含计算模型 申请
LV Segmentation 挑战 200 例(100 训练 + 100 测试) DETERMINE 心梗 训练集半自动掩膜 申请 + 提交结果换共识
LV Statistical Shapes 挑战 200 例(100 MESA + 100 DETERMINE) 无症状 vs 心梗 3D LV 形状 申请
Motion Tracking 挑战 1 体模 + 15 例 健康志愿者 含运动真值 全部开放

§3.3 数据格式表

数据类 格式 说明
影像原始层 匿名化 DICOM 全子集统一,符合 DICOM 标准,兼容 PACS/临床网络
影像研究层 NIfTI 挑战赛与 AIM-ASD 分割提供;社区转换目标格式
网格/运动 VTK tagged MR 融合序列、纤维化表面网格
轮廓 XML / 二值掩膜 Sunnybrook 专家轮廓 XML;挑战赛二值掩膜
3D 模型 XML(有限元) CIM 客户端可读的形状/运动参数化模型
元数据 CSV / PDF Sunnybrook 患者数据表(2.25 KB)、Readme

§3.4 存储大小

官网公开的明确数字仅有 Sunnybrook 子集:5 个 DICOM zip 批次(433.6 / 839.2 / 594.2 / 469.3 / 363.4 MB,合计约 2.7 GB)+ 患者数据 CSV 2.25 KB + LV 模型 zip 2.34 MB + 手工轮廓 zip 1.37 MB——即"45 例病例 + 全套轮廓 + 3D 模型"约 2.7 GB,可作为估算单例体积的锚点(约 60 MB/例)。MESA 与 DETERMINE 完整体积未公布:MESA 2,450 例 GRE cine 按含 10-12 层 × 20-30 帧的 DICOM 序列估算约在 150 GB 量级,DETERMINE 450 例 SSFP + LGE 约数十 GB;申请前建议预留 1 TB 本地存储并规划分批下载窗口。挑战赛数据包(如运动跟踪挑战的多模态 MRI + 3D 超声)体积小、可直接获取,适合作为 CI 环境的固定测试资产。

§3.5 标注方式

CAP 的标注呈"金字塔"结构:塔尖是 Sunnybrook 45 例专家手工轮廓(逐帧手工勾画心内外膜边界,随附基于其拟合的 3D 有限元模型)与 SCMR 15 例多专家共识;塔身是挑战赛产生的 STAPLE 共识掩膜——由 3 个半自动 + 2 个全自动算法与人工输入聚合而成,训练集随附的轮廓实为 Li et al. 2010 的 in-line automated tracking 半自动结果;塔基是 MESA/DETERMINE 主库,官方明确"No manual contours / No clinical diagnosis",仅有部分病例经 CIM 半自动生成的 3D LV 模型(MESA 官网另说明其约 300 例 3D 左心室模型由 CIM 半自动导出)。此外 AIM-ASD 附带专家手工双心房分割(NIfTI)与含纤维化图的 VTK 表面网格,MITEA 的 134 例 3D 超声带标签且 scan/re-scan 成对。使用任何标注前务必核对其在金字塔中的层级,并在论文中如实命名(手工/半自动/共识)。

§3.5b 标注层级速查表
层级 子集 标注类型 能否当 GT
L1 人工 Sunnybrook 45 例 专家手工逐帧 SAX 轮廓 能(附 Radau et al. 2009 引用)
L1 人工 SCMR 共识 15 例 7 实验室 7 专家共识 能(官方推荐外部验证首选)
L2 共识 LV 分割挑战 STAPLE 聚合(3 半自动 + 2 全自动 + 人工) 谨慎——作为"共识资源"引用并注明版本
L3 半自动 挑战训练集掩膜 in-line automated tracking(Li et al. 2010) 不能单独当 GT(官方 FAQ 明文)
L4 模型导出 MESA 约 300 例 3D 模型 CIM 半自动拟合 不能——是形状模型而非像素级标注

判别口诀:先问"这份标注是谁生成的"(人工/共识/算法),再问"官方允许我怎么称呼它"——两问都过关才能写进论文的 ground truth 栏。

§3.6 标注者资质与一致性

SCMR 共识子集的轮廓来自 7 个世界级 MR 核心实验室的 7 名专家读片者,是全库资质最高的标注;共识论文(Suinesiaputra et al. 2014)对 95 例心梗病例量化了 5 个评分者(3 半自动 + 2 全自动)对 STAPLE 共识的一致性:敏感度 0.63-0.85、特异度 0.60-0.98、阳性预测值 0.56-0.94、阴性预测值 0.83-0.92——范围之宽说明即便"专家级"算法之间差异也很大,这正是需要 STAPLE 共识的原因。论文同时给出两条方法论结论:其一,STAPLE 在把感兴趣区限制到评分者分歧区域时能产出高质量共识;其二,"人工 + 自动混合评分者"产出的共识比任何单一评分者(包括含人工输入者)更稳定,且共识质量可用候选自动评分者表现分布的客观度量来维护、随新提交持续改进。MESA 核心实验室另对图像质量做了三级主观评分(1 好 / 2 中 / 3 差),纳入与排除病例质量分布无显著差异(score 1 占比 85.4% vs 86.3%、score 2 占比 14.6% vs 13.5%、score 3 占比 0% vs 0.2%),提示质量偏倚可控。

§3.7 采集周期

数据采集跨约十年:MESA 基线 CMR 集中在 2000-07 至 2002-07;DETERMINE 为 2009 年发表方案的前瞻性多中心试验影像;挑战赛数据(King’s College London、University of Ulm)采集于 2011 年前;MITEA、AIM-ASD、CHD Atlas 为后续持续扩充。库建设与去标识贯穿 2010-2011(Fonseca et al. 2011 收稿于 1 月、修回于 5 月),平台持续运营至今。由此形成三个"时间截面":2000-2002(MESA 采集)、2010-2011(库建设与两大主力队列入库)、2011 之后(挑战迭代与子集扩充)——任何"全库快照式"的描述都必须指明其所处的截面,否则必然陷入坑点 6 的计数混乱。

§3.8 地域覆盖

美国(MESA 6 中心:Winston-Salem、Baltimore、St. Paul、Chicago、New York、Los Angeles;DETERMINE 多中心;UCLA)、加拿大(Sunnybrook,多伦多)、新西兰(奥克兰,含 Starship 儿童医院)、英国(伦敦国王学院)、德国(乌尔姆大学)。MESA 四族群设计(白人、非裔、西裔、华裔)是其人群代表性上少见的刻意均衡,但均为美国居民,外推到其他人群需谨慎。平台归属同样跨国:数据库由奥克兰大学与 UCLA 双方共建(指导委员会含两校研究者、NIH 项目官与各贡献研究代表),KCL 镜像站由英国侧学术合作维护——这种"采集地、托管地、镜像地"三分离的结构在医学影像库中不多见,也意味着引用时应指向 cardiacatlas.org 主站而非镜像。

§3.9 设备规格

MESA:1.5T 磁共振(Siemens 与 General Electric 两厂商),静息肺容量屏气采集;每例含短轴 cine(10-12 层)、单条四腔与单条两腔长轴 cine、主动脉相位对比与主动脉黑血序列。DETERMINE:回顾性门控 SSFP 序列(参数见 §3.1),配分段反演恢复准备的毁损梯度回波 LGE,延迟增强与 cine 同层面采集便于逐区对照。Motion Tracking 挑战:cine SSFP(2CH/4CH/SAX)+ whole-heart SSFP(舒张末/呼气末门控)+ 4D tagged MR(三个正交标记方向并附融合网格标记体)+ 3D 心尖超声容积,全部以匿名 DICOM 提供、标记序列另给 VTK 与 NIfTI。MITEA:3D 超声心尖容积采集,每例 scan/re-scan 成对。AIM-ASD:高分辨心房 GE-MRI。多厂商、多中心、跨十年协议是 CAP 的特色也是其最大的技术变量——任何跨子集模型都必须把"设备/协议"作为显式协变量处理。

§3.10 深度溯源链

原始采集(MESA/DETERMINE 各中心 MRI)→ 各研究核心实验室质控与评分(图像质量三级评分)→ HIPAA 合规脱敏(UCLA LONI De-identification Debabeler)→ CAP ID 重映射与入库(MySQL/JBoss/Dcm4chee,DICOM 兼容)→ CIM 半自动 3D 模型生成(奥克兰大学)→ 挑战赛分发与结果回收 → STAPLE 共识生成与迭代(Suinesiaputra et al. 2014)→ 官网按贡献者条款分发。每一环都有公开文献或官方页面背书,可追溯至 NIH 资助号(R01 HL091069、N01-HC-95159 至 95169 等)。


§4 数据结构

§4.0 目录树

以下为 Sunnybrook(CC0)子集解压后的典型结构,其余子集结构一致但不含 contours/(申请制主库无轮廓):

sunnybrook/
├── DICOM/                              # 匿名 DICOM,5 个 zip 批次解压合并
│   ├── SCD0000101/                     # CAP ID 命名的病例目录
│   │   ├── cine_sax_10-12/             # 短轴 cine 序列(逐帧 DICOM)
│   │   │   ├── SCD0000101-0001.dcm
│   │   │   └── ...
│   │   ├── cine_2ch/                   # 两腔长轴
│   │   └── cine_4ch/                   # 四腔长轴
│   └── ...
├── ManualContours/                     # 专家手工轮廓(zip 1.37 MB)
│   └── SC-HF-I-12/
│       └── SAX_series/
│           ├── contours-manual-original.xml   # 心内外膜逐帧轮廓点
│           └── ...
├── LVModels/                           # 3D 有限元 LV 模型(zip 2.34 MB)
│   └── SC-HF-I-12.xml
├── patient_data.csv                    # CAP ID ↔ 2009 挑战原始 ID 映射 + 分组标签
└── README.pdf

§4.1 DAIMS 字段字典

核心字段(8 列)如下,适用于全部子集:

字段 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
CAP_ID string 去标识后统一病例号 SC-HF-I-12 病例级分组键,防切片泄漏 无 无 官网 CSV 逐例列出
COHORT string 来源子集 MESA / DETERMINE / SCD 协议分层、域适应标签 无 无 官网子集清单
GROUP string 病理分组(仅 Sunnybrook) HF-I 分类任务标签 分组按 Alfakih 2003 标准 无 N/HYP/HF/HF-I
Series string 序列类型 cine_sax / cine_2ch / cine_4ch 视图选择 — 无 SAX/2CH/4CH/LGE 等
SliceLocation float 层位置(DICOM 头) -15.0 3D 堆叠排序 屏气致层间错位 头缺失(见坑点 4) 连续
TriggerTime float 心电触发时间(ms) 450.0 时相排序 心率变异 头缺失(见坑点 4) 0-RR 间期
Frame int 心动周期帧号 17 时相索引(ED/ES 检测) — 无 20-30(MESA GRE)/25(DETERMINE)
ImagePositionPatient float×3 切片 3D 位置(DICOM 头) [-120.0, -135.0, -15.0] 几何法 3D 排序 屏气致层间错位 部分病例缺失(坑点 4) 连续
ContourPoints XML 心内外膜轮廓点坐标 x,y 序列 分割 GT / 形状拟合 观察者间变异(见 §3.6) 主库无此字段 逐层逐帧
ImageQualityScore int 核心实验室三级质量评分(MESA) 1 质控分层、异常样本筛查 主观评分 主库外子集无 1 好 / 2 中 / 3 差
ModelXML XML 3D 有限元 LV 模型参数 节点 + 单元 + 模式系数 形状统计建模直接输入 拟合算法依赖 仅部分病例有 CIM 格式

§4.2 标签分布

有标签子集中,Sunnybrook 四组均衡度良好(N 9 / HYP 12 / HF 12 / HF-I 12),其生理指标构成清晰的病理梯度:EF 从健康 62.93% 递减到 HF-I 32.01%,舒张末容积从 115.69 ml 升至 244.92 ml。LV 分割挑战 200 例全部来自 DETERMINE 心梗人群(100 训练 + 100 测试);LV 统计形状挑战 200 例为 100 例 MESA(无症状)+ 100 例 DETERMINE(心梗)的二分类平衡设计。MESA/DETERMINE 主库本身无病例级标签,仅 MESA 有核心实验室的图像质量三级评分与室壁运动评分。

§4.3 关键统计

  • MESA:2,450 例托管(基线入组 5,098、MRI 合格 5,003、CAP 曾含 2,529 例),四族群、45-84 岁,GRE 协议每例 10-12 层短轴 + 2 条长轴。
  • DETERMINE:450 例托管(2011 口径 470 例),梗死面积 ≥15% 左室质量,SSFP 25 帧/层,LGE 与 cine 同层面采集。
  • Sunnybrook:45 例四组(见 §4.2),EF 极差约 31 个百分点,舒张末容积极差约 129 ml。
  • STAPLE 共信度(95 例心梗、5 评分者):敏感度 0.63-0.85、特异度 0.60-0.98、PPV 0.56-0.94、NPV 0.83-0.92。
  • 协议偏倚:GRE vs SSFP 差异集中于乳头肌与心尖心内膜区,校正后容积偏差 ≤1 ml。
  • 图像质量(MESA 核心实验室评分):纳入病例中 85.4% 为 1 级、14.6% 为 2 级,与排除病例无显著差异(p = 0.4)。
  • 预分析规模(2011 概念验证):300 例 DETERMINE + 200 例 MESA 的 PCA 主模式与心室大小、球形度、二尖瓣几何对应。
§4.3b MESA 图像质量分布表
核心实验室质量评分 纳入病例占比 排除病例占比
1(好) 85.4% 86.3%
2(中) 14.6% 13.5%
3(差) 0% 0.2%

纳入/排除两列的分布差异不显著(Fisher 精确检验 p = 0.4),即 2021 年管线研究的样本排除主要源于 DICOM 头信息缺失而非图像质量差——这再次印证坑点 4 属"记录完整性"问题而非"影像质量"问题。室壁运动评分在纳入/排除组间同样无差异。

§4.4 数据层级

CAP 数据为四级结构:参与者(Participant,MESA 中一人一基线检查;DETERMINE 含随访时相)→ 检查(Study,一次 CMR 扫描,含 SAX + 2CH + 4CH 多序列及 LGE)→ 序列(Series,同一解剖视图的完整采集)→ 帧(Frame,心动周期时相)与层(Slice,空间位置)。关键点是同一参与者跨视图(长轴 + 短轴)、跨时相共享同一解剖状态:长轴视图上勾画的二尖瓣铰链点约束短轴堆叠的基底范围,SAX 各层拼出同一心室;因此划分数据集必须以参与者为粒度,否则长轴与短轴、相邻帧会跨集合泄漏。对 MITEA 还存在第五级"scan/re-scan 成对"结构——同一受试者两次采集构成天然的重测对,适合做重复性评估而非独立样本。

§4.5 缺失值与信息性缺失编码表

缺失情形 表现 信息性含义 处理建议
主库 ContourPoints 缺失 MESA/DETERMINE 无轮廓字段 非随机缺失:标注成本与队列开放策略所致 只在有轮廓子集上做监督训练,主库用于自监督/域适应
DICOM 3D 位置/触发时间缺失 头字段为空,3D 重建失败 设备/协议记录不完整,非随机 按 §6.5 坑点 4 的降级排序策略
临床参数缺失 官网不共享 MESA 临床协变量 数据贡献者条款限制 需临床协变量时应直接向 MESA 官方申请
挑战测试集共识缺失 提交结果前不可得 保持挑战客观性的设计 先提交测试结果再获取共识
帧数离群(非 25 帧 SSFP) 心率/屏气差异致帧数漂移 生理性变异而非数据错误 以病例内周期完整性校验替代帧数硬断言
AMRG 单例 仅 1 例健康受试者 演示性子集 只作格式示例,勿入任何统计

§5 数据划分与使用建议

§5.1 官方划分

CAP 官方唯一成文划分来自挑战赛:LV 分割挑战为 DETERMINE 200 例 = 100 训练(含掩膜)+ 100 测试(无掩膜,须提交结果换取共识);LV 统计形状挑战为 100 MESA + 100 DETERMINE;Motion Tracking 挑战提供含真值的公开集。Sunnybrook 2009 挑战时代的官方训练/测试划分沿用其 MIDAS 论文口径,CAP 官网未重划。MESA 深度学习论文给出的先例划分是 2,529 例训练验证 / 2,474 例独立测试(约 50.5% / 49.5%)。

§5.2 社区惯例

社区在 Sunnybrook 上的常见做法是 5 折交叉验证并报告 Dice 与 Hausdorff 距离;对 MESA/DETERMINE 因数量大、无标签,多用作自监督预训练或形状先验学习语料。跨子集迁移(如 Sunnybrook → ACDC 或 M&Ms)常被用作协议泛化的论文设定;统计形状方向则延续官方范式——以 CIM 或自研管线拟合有限元模型,再对 PCA 模式做下游统计(回归、T2 检验、分类)。另有社区把挑战集的"训练 + 官方托管评测"当作免维护的持续基准:提交测试集分割、由 CAP 按当前共识返回指标,避免自行划分带来的口径之争。

§5.3 泄漏风险(重点)

CAP 的泄漏面有三处:其一,同一病例的 SAX 多层 + 多帧高度相关,按层或帧划分会制造"近重复样本",虚高 5-15% 的 Dice;其二,长轴与短轴描述同一心动周期,必须同集合;其三,挑战赛训练掩膜是半自动生成且算法作者与社区基准重叠,把训练掩膜当 GT 报告会低估人工标注的可提升空间(官方 FAQ 明文警告)。附加两处易被忽视:MESA 的 scan 级图像质量评分若被当作特征参与训练,需防止"质量分层与结果分层混淆"导致的间接泄漏;MITEA 的 scan/re-scan 对若分入不同集合,会把受试者内方差错误地计入泛化性能。所有划分必须以 CAP_ID 为最小粒度。

§5.4 交叉验证建议

有标签子集小(45/15/200 例),推荐分层(按病理组)5 折交叉验证;STAPLE 共识资源是持续演化的,若复现 Suinesiaputra et al. 2014,应注明所用共识版本与参与算法集合。MESA 管线研究(2021)的 50.5%/49.5% 划分可作为大规模无标签划分的参考模板;其方法细节同样值得借鉴——用专家轮廓与解剖标志点做训练真值、以独立子集验证整条"标志点检测 → 分割 → 模型拟合"链路,而非只评分割一个环节。

§5.5 外部验证建议

官方推荐流程是:内部用 Sunnybrook 或挑战训练集开发 → SCMR 15 例共识做独立外部验证(7 实验室专家共识独立性最强)→ 再迁移到本条目对比表中的 ACDC、M&Ms 等现代 SSFP 数据集检验协议泛化。由于 CAP 与 ACDC 等数据集无病例重叠,这种"开发集/验证集"双库设计是低成本高公信力的发表路径。两点提醒:其一,外部验证要报告协议差异(GRE/SSFP、厂商、层厚)并区分"分布外失败"与"任务失败";其二,生理一致性(EF/容积量级)与分割重合度应分别报告——一个在重合度上表现平平的模型可能在生理指标上完全够用,反之亦然,CAP 的官方分析传统恰恰强调后者。


§6 AI 就绪指南

§6.0 云端快速启动

CAP 没有官方一键云镜像,公开域的 Sunnybrook 子集(约 2.7 GB)可直接下载,推荐流程:

# 1) 从官网 Sunnybrook 页面下载 5 个 DICOM zip 批次 + contours + models
# 2) 解压到本地数据根目录(见 §6.1 目录约定)
# 3) 安装最小依赖
pip install pydicom numpy scipy nibabel matplotlib torch torchvision
# 4) 云端(如 Colab)挂载 Google Drive 或对象存储后,把 DATA_ROOT 指向解压目录即可运行 §6.1 代码
# 5) 校验:DICOM 批次解压后应含 45 个 CAP_ID 病例目录(N 9 / HYP 12 / HF 12 / HF-I 12)

两点提示:其一,官网文件链接随页面改版可能变化,下载前以子集页面当日清单为准;其二,云端实验只放 Sunnybrook 与挑战公开数据即可覆盖教学与演示需求,MESA/DETERMINE 属 DDA 管辖,上传到第三方云前须确认协议允许。

§6.1 快速上手

下面的代码假设目录结构为 §4.0 所示:DATA_ROOT/DICOM/<CAP_ID>/...;DATA_ROOT/ManualContours/<CAP_ID>/...。data_root 与相对路径直接拼接即可定位任一病例;最小可用子集是 Sunnybrook 的 45 例(N/HYP/HF/HF-I 四组齐全、带专家轮廓),10 分钟内可完成一次"读 DICOM → 读轮廓 → 可视化"闭环。

import os, glob
import pydicom
import numpy as np
import matplotlib.pyplot as plt

DATA_ROOT = os.environ.get("CAP_DATA_ROOT", "./sunnybrook")  # 与 §4.0 目录树一致
case = "SC-HF-I-12"                                          # 最小可用子集内任一病例

# 读取该病例全部 SAX 切片,按 SliceLocation 排序堆叠
series_dir = os.path.join(DATA_ROOT, "DICOM", case, "cine_sax")
files = sorted(glob.glob(os.path.join(series_dir, "*.dcm")))
slices = [pydicom.dcmread(f) for f in files]

by_loc = {}
for s in slices:
    loc = float(s.SliceLocation)                 # 层位置:3D 轴
    by_loc.setdefault(loc, []).append(s)
vol = []
for loc in sorted(by_loc):                       # 层内按 TriggerTime 排序:时间轴
    frames = sorted(by_loc[loc], key=lambda s: float(s.TriggerTime))
    vol.append([f.pixel_array.astype(np.float32) for f in frames])
vol = np.stack(vol)                              # (n_slices, n_frames, H, W)
print("SAX volume:", vol.shape)

# 读取专家轮廓(XML 内逐帧心内外膜折线)
contour_xml = glob.glob(os.path.join(
    DATA_ROOT, "ManualContours", case, "SAX_series", "*.xml"))
print("contour files:", len(contour_xml))

# 中间层、收缩末期帧可视化
mid = vol.shape[0] // 2
frame = int(np.argmax(vol[mid].sum(axis=(1, 2))))   # 舒张末容积最大帧
plt.imshow(vol[mid, frame], cmap="gray"); plt.axis("off")
plt.savefig("sax_preview.png", dpi=150, bbox_inches="tight")

§6.2 数据获取

子集 入口 前置条件 审批时长
Sunnybrook / AMRG 官网子集页直接下载 无(CC0/公开域) 即时
SCMR 共识 子集页表单 同意条款 + DDA 按贡献者审核节奏
MESA MESA 页面表单 详细研究计划;批准后须遵守 MESA-CAP 分发协议、P&P 审稿、纳 1 名 MESA 合著者 可能 >2 周
DETERMINE 子集页表单 DETERMINE 贡献者审核(2026-09 校验时暂停,协议续签中) 未知
MITEA / CHD Atlas / AIM-ASD 各子集页表单 贡献者审核 + DDA 按审核节奏
挑战赛数据 各挑战页表单 条款 + DDA;测试集共识须提交结果后发放 按提交周期

申请制子集(MESA/DETERMINE/挑战赛)的表单流程可拆为五步:

  1. 明确用途:官网要求申请中写清项目依据、目标与时间线、数据存储安排——CAP 指导委员会以此判断提案是否在其宗旨内(图像分析、临床评估、临床试验、教育四大类)。
  2. 选择子集并读条款:每个贡献者条款不同,需逐页阅读;MESA 页面列出三条硬性前置(分发协议、P&P 审稿、合著者),挑战页面的 DDA 则限定"仅可用于该挑战目的"。
  3. 提交并等待双重审核:先经 CAP 侧确认提案合规,再转交数据贡献者(或其委员会)逐案批准;MESA 明示可能超过 2 周。
  4. 签署 DDA 并获取账号:每个贡献者单独一份 DDA,覆盖出版政策、致谢、数据处理与知识产权;批准后开通登录下载。
  5. 留痕:保存提案文本、审批邮件与 DDA 副本,作为论文投稿与合规审计的证据链(MESA 稿件还需过 P&P 审批,见坑点 8)。
# Sunnybrook 批次下载示例(文件名以官网当日为准)
for i in 1 2 3 4 5; do
  curl -L -o "sunnybrook_batch_${i}.zip" "https://www.cardiacatlas.org/?p=145#batch${i}"
done
unzip -q "sunnybrook_batch_*.zip" -d sunnybrook/   # 约 2.7 GB
# 注意:CAP ID 与 2009 挑战原始 ID 的映射必须用 patient_data.csv(见坑点 8)

§6.3 预处理全流程

从匿名 DICOM 到训练可用张量共四步:序列分组与排序(时空双轴)→ 灰度标准化 → 心时相对齐(可选)→ 转 NIfTI/张量。以下为可运行参考实现:

import pydicom, numpy as np, nibabel as nib, os, glob

def load_cine_series(series_dir):
    """DICOM -> (n_slices, n_frames, H, W);依赖 SliceLocation + TriggerTime 双键排序"""
    ds = [pydicom.dcmread(f) for f in glob.glob(os.path.join(series_dir, "*.dcm"))]
    assert all(hasattr(d, "SliceLocation") and hasattr(d, "TriggerTime") for d in ds), \
        "头部缺 SliceLocation/TriggerTime,需降级策略(坑点 4)"
    by_loc = {}
    for d in ds:
        by_loc.setdefault(float(d.SliceLocation), []).append(d)
    slices = []
    for loc in sorted(by_loc):
        frames = sorted(by_loc[loc], key=lambda d: float(d.TriggerTime))
        slices.append(np.stack([d.pixel_array.astype(np.float32) for d in frames]))
    return np.stack(slices)                       # (S, T, H, W)

def normalize(vol):
    """逐病例 z-score;GRE 与 SSFP 灰度分布不同,严禁跨病例共享强度直方图"""
    mu, sd = vol.mean(), vol.std() + 1e-8
    return (vol - mu) / sd

def detect_ed_es(vol):
    """以 SAX 血池面积近似容积曲线,返回舒张末/收缩末帧号"""
    areas = (vol > (vol.max() * 0.3)).sum(axis=(2, 3))   # (S, T)
    curve = areas.mean(axis=0)
    return int(curve.argmax()), int(curve.argmin())       # ED, ES

vol = load_cine_series("./sunnybrook/DICOM/SC-HF-I-12/cine_sax")
vol_n = normalize(vol)
ed, es = detect_ed_es(vol_n)
arr = vol_n[:, [ed, es]].transpose(2, 3, 0, 1)            # (H, W, S, 2)
nib.save(nib.Nifti1Image(np.ascontiguousarray(arr), None), "case_ED_ES.nii.gz")

要点:GRE(MESA)与 SSFP(DETERMINE/挑战赛)的血流依赖对比度不同,强度标准化策略必须分开记录;心时相对齐若做逐点运动统计,建议直接用官方有限元映射而非自行线性插值(层间屏气错位见坑点 5)。

预处理 QA 清单(建议逐条落进 CI):

  1. 每病例断言序列数与官网口径一致(SAX 10-12 层 + 2CH/4CH 各 1;DETERMINE 另含 LGE)。
  2. 断言帧数落在协议区间(MESA 20-30 帧;DETERMINE 25 帧附近),离群帧数进人工复核清单。
  3. 逐病例输出 ED/ES 检测的容积曲线缩略图,肉眼抽查周期完整性(心律不齐会显性化)。
  4. 记录每例 DICOM 头字段的完整性位图(SliceLocation / TriggerTime / ImagePositionPatient),与坑点 4 的隔离清单联动。
  5. 体素间距从 PixelSpacing 读取并写进预处理 manifest,任何 mm 级指标禁止默认各向同性。
§6.3.1 Sunnybrook 专家轮廓解析(参考实现)

Sunnybrook 的手工轮廓以 XML 存储,文件名区分轮廓类型(original 人工、ivp 半自动等)。解析时注意坐标是图像像素坐标、且逐帧独立存放,需与 DICOM 帧对齐:

import xml.etree.ElementTree as ET
import numpy as np

def parse_contour_xml(path):
    """Sunnybrook 轮廓 XML -> {image_id: (n_points, 2) ndarray}
    每个 Contour 节点对应一帧;ImageZ/点坐标为像素坐标"""
    tree = ET.parse(path)
    contours = {}
    for c in tree.getroot().iter("contour"):
        img_id = c.findtext("image_id") or c.get("image_id")
        pts = []
        for p in c.iter("point"):
            x = float(p.findtext("x")); y = float(p.findtext("y"))
            pts.append([x, y])
        if img_id is not None and pts:
            contours[str(img_id)] = np.asarray(pts, dtype=np.float32)
    return contours

def rasterize_mask(points, hw):
    """轮廓点 -> 二值掩膜(多边形填充,仅供快速可视化;
    严格评测请用带像素间距的栅格化并保留原始折线)"""
    from PIL import Image, ImageDraw
    img = Image.new("L", (hw[1], hw[0]), 0)
    ImageDraw.Draw(img).polygon([tuple(pt) for pt in points], outline=1, fill=1)
    return np.asarray(img, dtype=np.uint8)

# masks = {fid: rasterize_mask(pts, (256, 256))
#          for fid, pts in parse_contour_xml("SC-HF-I-12/SAX/contours-manual-original.xml").items()}

将掩膜与 §6.3 的 cine 体按帧对齐后即可组成(image, mask)对;务必按病例级划分(§5.3),并区分 original(人工)与半自动文件——Sunnybrook 官方说明中两类文件并存。

§6.4 PyTorch DataLoader

<details>
<summary>点击展开完整 Dataset + DataLoader 代码(约 45 行)</summary>

import os, glob, torch
import numpy as np
import pydicom
from torch.utils.data import Dataset, DataLoader

class CAPCineDataset(Dataset):
    """Sunnybrook(CC0)病例级 cine 数据集:一个样本 = 一个病例的 ED+ES 双帧 SAX 体
    目录约定:DATA_ROOT/DICOM/<CAP_ID>/cine_sax/*.dcm
    划分:必须按 CAP_ID 分 train/val/test(见 §5.3 泄漏风险)"""

    def __init__(self, data_root, case_ids, target_hw=(224, 224)):
        self.data_root, self.case_ids = data_root, list(case_ids)
        self.target_hw = target_hw

    def __len__(self):
        return len(self.case_ids)

    def _load_series(self, series_dir):
        ds = [pydicom.dcmread(f) for f in glob.glob(os.path.join(series_dir, "*.dcm"))]
        by_loc = {}
        for d in ds:
            by_loc.setdefault(float(getattr(d, "SliceLocation", 0)), []).append(d)
        out = []
        for loc in sorted(by_loc):
            frames = sorted(by_loc[loc], key=lambda d: float(getattr(d, "TriggerTime", 0)))
            out.append(np.stack([d.pixel_array.astype(np.float32) for d in frames]))
        return np.stack(out)                                  # (S, T, H, W)

    def _ed_es(self, vol):
        areas = (vol > vol.max() * 0.3).sum(axis=(2, 3)).mean(axis=0)
        return int(areas.argmax()), int(areas.argmin())

    def __getitem__(self, idx):
        case = self.case_ids[idx]
        vol = self._load_series(os.path.join(self.data_root, "DICOM", case, "cine_sax"))
        ed, es = self._ed_es(vol)
        two = np.stack([vol[:, ed], vol[:, es]])              # (2, S, H, W)
        two = (two - two.mean()) / (two.std() + 1e-8)
        t = torch.from_numpy(two).unsqueeze(1)                # (2,1,S,H,W)
        t = torch.nn.functional.interpolate(
            t, size=(2, 1, *self.target_hw), mode="trilinear", align_corners=False)
        return {"case": case, "image": t.squeeze(1)}          # (2,S,H,W)

if __name__ == "__main__":
    root = os.environ.get("CAP_DATA_ROOT", "./sunnybrook")
    cases = [os.path.basename(p) for p in sorted(glob.glob(os.path.join(root, "DICOM", "*")))]
    train_ds = CAPCineDataset(root, cases[:36])               # 仅演示:真实场景按组分层划分
    loader = DataLoader(train_ds, batch_size=4, shuffle=True, num_workers=2)
    for batch in loader:
        print(batch["case"], batch["image"].shape)
        break

</details>

§6.5 坑点(8 个)

编号 标题 分类 一句话对策
坑点 1 SSFP 模型直迁 MESA GRE 失效 偏倚陷阱 GRE 域内训练或域适应,勿跨协议直推
坑点 2 协议偏倚被误读为病理信号 偏倚陷阱 先做 GRE→SSFP 形状校正再比组间
坑点 3 主力子集没有手工轮廓 标签理解 监督只用有轮廓子集,主库做自监督
坑点 4 DICOM 头缺 3D 位置/触发时间 工程陷阱 读取前显式校验头字段并隔离异常
坑点 5 屏气层间错位污染 3D 几何 预处理陷阱 用有限元形状拟合吸收层间位移
坑点 6 病例计数口径混乱 评估误用 写作统一注明口径与出处
坑点 7 按切片/帧划分造成泄漏 数据泄漏 一律按 CAP_ID 粒度划分
坑点 8 DDA 条款与 ID 映射雷区 工程陷阱 申请前逐条读条款 + 双 ID 记账

⚠️ 坑点 1:SSFP 上训练的模型直接迁移 MESA GRE 会整体失效(分类:偏倚陷阱)

问题:MESA 是 2000-2002 年采集的 legacy GRE cine,血流依赖对比度与当代 SSFP 截然不同;官方论文明确指出"在现代 SSFP 影像上训练的 CNN 方案应用到 MESA 数据时会失败",官网也在 MESA 页面提醒该协议与现行 SSFP 不兼容。
症状:跨库评测 Dice 从 0.9+ 跌至 0.5 甚至更低;心内膜边界断裂、乳头肌区域误分割;训练/测试曲线无异常,唯跨数据集时崩塌;同一模型在库内各子集间的退化幅度与协议差异(GRE 比例)正相关。
解决:

  1. 简单方法:在目标库(如 ACDC/M&Ms)上做少量微调,冻结 backbone 只调最后几层。
  2. 进阶方法:风格迁移/直方图匹配把 GRE 影像映射到 SSFP 域再推理;官方 MESA 管线(VGGNet 标志点 + U-Net 分割)在 GRE 上从头训练并配合有限元形状拟合,可作为路线图。
  3. SOTA 方法:协议偏倚建模——用 46 名同机双协议志愿者的 GRE/SSFP 配对学习形状域映射(官方论文校正后容积偏差 ≤1 ml),再做下游任务。
    参考:Suinesiaputra et al. Front Cardiovasc Med 2021(DOI: 10.3389/fcvm.2021.807728);Medrano-Gracia et al. JCMR 2013;15:80;cardiacatlas.org/mesa/。

⚠️ 坑点 2:GRE↔SSFP 协议偏倚被误读为病理形状信号(分类:偏倚陷阱)

问题:把 MESA(GRE)对照与 DETERMINE(SSFP)患者直接做逐点形状比较时,协议本身会在心尖心内膜与乳头肌周围制造系统性形状差异;官方论文证明不校正时乳头肌区域会出现"假性显著",即把协议差异当成梗死重构。
症状:组间差异图在乳头肌前后区域异常发红;换协议重复实验后"病灶"位置漂移;容积组间差与临床 EF 差不成比例;把 MESA 当对照、DETERMINE 当病例的形状统计第一次跑就"处处显著",显著性区域恰好是血流依赖对比差异最大的位置。
解决:

  1. 简单方法:分析前把对比集限制在同一协议内部,或以协议为协变量做回归。
  2. 进阶方法:套用官方 GRE→SSFP 形状校正映射后再比较(校正后平均容积偏差 ≤1 ml)。
  3. SOTA 方法:按 AHA 17 节段做逐段 Hotelling T2 并报告校正前后对比图,将协议敏感性写入论文局限性。
    参考:Medrano-Gracia et al. “Atlas-based analysis of cardiac shape and function”, J Cardiovasc Magn Reson 2013;15:80(DOI: 10.1186/1532-429X-15-80)。

⚠️ 坑点 3:主力子集根本没有手工轮廓——别假设 GT 存在(分类:标签理解)

问题:MESA 与 DETERMINE 主库官网明确"No manual contours / No clinical diagnosis";想用 2,450 例 MESA 做监督分割的人会发现无处取 GT。LV 分割挑战训练集随附的掩膜是 Li et al. 2010 半自动 in-line automated tracking 的结果,官方 FAQ 禁止将其描述为 ground truth。
症状:拿到 DDA 下载后遍历目录找不到轮廓;论文里把半自动掩膜写成"专家标注"被审稿人抓住;用主库报"监督分割成绩"无法说明标签来源;对 MESA 期望拿到临床协变量(血压、血脂等)却只在官网读到"我们不共享 MESA 研究的轮廓与其他临床参数"。
解决:

  1. 简单方法:监督训练只使用 Sunnybrook(手工)、SCMR 共识、挑战集;主库用于自监督/域适应/形状先验。
  2. 进阶方法:在主库上做专家交互式补标或用 2021 官方管线自动生成轮廓并明确标注"模型生成"。
  3. SOTA 方法:半监督一致性训练(主库无标签 + 小标注集),或按官方路径提交挑战结果换取 STAPLE 共识。
    参考:cardiacatlas.org/mesa/ 与 /?p=329;cardiacatlas.org/lv-segmentation-challenge/ FAQ;Li B et al. JACC Cardiovasc Imaging 2010;3(8):860-6。

⚠️ 坑点 4:DICOM 头缺 3D 位置/触发时间,3D 堆叠静默失败(分类:工程陷阱)

问题:官方深度学习论文报告,3D 转换失败的主因是 DICOM 头缺失 3D 位置信息或缺排序所需的触发时间信息;这类缺失会让简单排序代码把切片顺序打乱而不报错。
症状:重建出的"短轴体"出现层间跳变或鬼影;某些病例排序结果与其他软件不一致;金字塔式检查时发现个别序列行数对不上;同一病例两次重建的体数据层序不同,训练结果不可复现。
解决:

  1. 简单方法:读取前显式校验 SliceLocation 与 TriggerTime 存在性,缺失病例进隔离清单人工检查。
  2. 进阶方法:用 ImagePositionPatient/ImageOrientationPatient 做几何排序,触发时间缺失时以帧内 InstanceNumber 近似时序并复核。
  3. SOTA 方法:按官方 MESA 管线的图像-轮廓匹配算法处理轮廓与 3D 位置的对应缺失(论文用简单匹配规则即可满足训练数据量)。
    参考:Suinesiaputra et al. 2021(PMC8813768)Methods 节;pydicom 文档。

⚠️ 坑点 5:屏气导致的层间错位(breath-hold misregistration)污染 3D 几何(分类:预处理陷阱)

问题:每层短轴 cine 在不同屏气中采集,膈肌运动使各层相对位置不一致;官方管线专门用有限元形状模型"校正层间屏气错位"。直接把多层当刚性体输入 3D 模型会引入伪形状变异。
症状:3D LV 模型基底面扭曲;逐点统计在基底部出现假显著;与超声/单帧全心序列对比时误差集中在基底层;心室质量随"同一数据不同层序"波动,提示几何未被一致约束。
解决:

  1. 简单方法:只用中层面 2D 分析,绕开 3D 堆叠假设。
  2. 进阶方法:以长轴图像为参照逐层配准(平移校正)后再堆叠。
  3. SOTA 方法:采用官方有限元 LV 形状模型拟合路线——标志点 + 轮廓联合约束,隐式吸收层间位移。
    参考:Suinesiaputra et al. 2021;Young & Frangi, Experimental Physiology 2009;94(5):578。

⚠️ 坑点 6:病例计数一团乱麻:2,864 / 2,450 / 2,529 与 470 / 450(分类:评估误用)

问题:MESA 在不同文献中分别是 2,864(2011 入库口径)、2,450(官网现托管口径)、2,529(2021 深度学习论文可用口径),背景队列则是 5,098 入组 / 5,003 合格;DETERMINE 是 470(2011)vs 450(官网)。混用口径会让复现与元分析对不上数。
症状:论文表格里 MESA 数值前后不一;审稿人问"你到底用了多少例";跨文献引用时数字互相矛盾;把"6,500+ 参与者的 MESA 研究"误当成"CAP 托管了 6,500+ 例影像"导致规模表述失真。
解决:

  1. 简单方法:写作时统一注明口径与出处(入库数 / 托管数 / 研究可用数)。
  2. 进阶方法:复现 2021 管线时按其训练验证(2,529)与独立测试(2,474)划分核对样本流。
  3. SOTA 方法:建立数据谱系表(cohort → 入组 → 合格 → 入库 → 可用),随代码一同发布。
    参考:Fonseca et al. 2011;JCMR 2011;13(Suppl 1):O72;cardiacatlas.org/mesa/;Front Cardiovasc Med 2021;8:807728。

⚠️ 坑点 7:按切片/帧划分数据集,近重复样本泄漏(分类:数据泄漏)

问题:一个病例含 10-12 层 × 20-30 帧,且短轴与长轴描述同一心动周期;任何低于"病例"粒度的划分都会把几乎相同的图像同时放进训练与测试。
症状:Dice 虚高且方差极小;换成病例级划分后指标骤降;模型对"新患者"泛化差但论文里看不出来;Sunnybrook 与 M&Ms 联合训练时同一病例的变体跨库分布。
解决:

  1. 简单方法:按 CAP_ID 哈希划分 train/val/test(70/15/15),一次定型。
  2. 进阶方法:分层(按病理组/队列)多折交叉验证并报告折间方差;Sunnybrook 按四组分层。
  3. SOTA 方法:留一队列外验证(MESA 训 → DETERMINE 测或反向),同时评估协议偏倚贡献(联动坑点 2)。
    参考:§5.3;Suinesiaputra et al. 2014 共识协议设计。

⚠️ 坑点 8:DDA 条款与 ID 映射的使用合规雷区(分类:工程陷阱)

问题:各子集条款不同:MESA 要求项目说明送贡献者审批(可能 >2 周)、稿件须经 MESA P&P 审批并纳 1 名 MESA 合著者;挑战数据 DDA 限定"仅可用于该挑战目的";DETERMINE 在 2026-09 校验时因协议续签整体暂停下载;Sunnybrook 的 CAP ID 与 2009 挑战原始 ID 不同名,映射只存于 patient_data.csv。
症状:复现 2009 挑战榜时 ID 对不上;论文送审时被 MESA 委员会要求修改;挑战数据被用于其他项目违反 DDA;下载中途 DETERMINE 链接失效且无官方公告推送;致谢漏写数据贡献者被要求补正。
解决:

  1. 简单方法:申请前逐条阅读子集页条款,把出版/合著/用途限制写进项目计划。
  2. 进阶方法:建立 ID 映射脚本(读 patient_data.csv),所有结果按双 ID 记录;对暂停子集准备替代子集(如挑战集)。
  3. SOTA 方法:成果发表前预留 MESA 合著者审稿窗口,把条款合规做成 release checklist。
    参考:cardiacatlas.org/mesa/、/?p=329/、/?p=145、/lv-segmentation-challenge/。

§6.6 数据增强

类别 操作 说明
✅ 安全 随机平移/旋转(≤10°)、随机缩放(0.9-1.1)、高斯噪声、随机裁剪含心包 不改变心几何与强度语义
✅ 安全 随机 gamma(小范围)、逐病例 z-score 后微扰 模拟扫描条件漂移
✅ 安全 随机层丢弃(训练时随机去除 1-2 层 SAX) 模拟临床欠覆盖采集,提升层间鲁棒性
✅ 安全 时间抖动(±1 帧的 ED/ES 标注抖动) 对齐帧号歧义,需同步抖动标签
❌ 危险 跨协议强度迁移当"增强"随意施加 会把 GRE/SSFP 域差异当作噪声学掉,破坏协议偏倚研究
❌ 危险 大角度旋转(>15°)与弹性形变 破坏短轴扇形解剖与心室旋转语义
❌ 危险 沿时间轴随机重排/抽帧后直接算 EF 破坏心动周期时序,ED/ES 检测失效
❌ 危险 对标注帧与其邻帧分别增强后混入训练对 制造"同帧异象"近重复对,放大泄漏

§6.7 模型推荐

任务 推荐模型 起点 备注
SAX 分割 nnU-Net / U-Net 变体 Sunnybrook + 挑战集 现代基准;注意 GT 层级(坑点 3)
SAX 分割(小样本) 预训练 encoder + 轻量解码头 ImageNet/心脏预训练权重 45 例量级下避免从头训练
标志点检测 VGGNet 系热图回归 官方 MESA 管线 官方在 GRE 上验证有效
形状/运动建模 有限元 + PCA(官方 CIM 思路) 3D LV 模型 统计形状研究主路线
梗死形状分类 统计形状模型 + 分类器 LV Shapes 挑战(IEEE JBHI 2017) 100 vs 100 平衡设定
跨协议域适应 CycleGAN 风格迁移 / 形状校正映射 MESA ↔ SSFP 库 联动坑点 1、2
灌注去伪影 时序卷积/光流 Motion Correction 挑战 官方任务定义现成
心房分割 3D U-Net 级联 Atria Segmentation 挑战 官方 3D GE-MRI 设定

§6.8 硬件需求

场景 配置 说明
Sunnybrook 2D 分割 单卡 8-12 GB(如 RTX 3060 级) 45 例小数据,批小图小
挑战集 200 例训练 单卡 16 GB nnU-Net 默认配置可跑
MESA 自监督预训练 24 GB 或多卡 2,450 例,建议混合精度
形状模型拟合 CPU 即可(官方客户端路线) CIM/有限元非深度路线

§6.9 评估指标代码

import numpy as np

def dice(pred: np.ndarray, gt: np.ndarray) -> float:
    """逐病例 Dice;注意 GT 层级:Sunnybrook=手工,挑战训练集=半自动(坑点 3)"""
    p, g = pred.astype(bool), gt.astype(bool)
    denom = p.sum() + g.sum()
    return 1.0 if denom == 0 else 2.0 * (p & g).sum() / denom

def jaccard(pred: np.ndarray, gt: np.ndarray) -> float:
    """IoU,与 Dice 单调等价但尺度不同,跨文献对比时勿混用"""
    p, g = pred.astype(bool), gt.astype(bool)
    union = (p | g).sum()
    return 1.0 if union == 0 else (p & g).sum() / union

def hausdorff(pred_pts: np.ndarray, gt_pts: np.ndarray) -> float:
    """轮廓点集对称 Hausdorff(mm),需换算像素间距"""
    d2 = ((pred_pts[:, None, :] - gt_pts[None, :, :]) ** 2).sum(-1)
    return float(max(np.sqrt(d2.min(1)).max(), np.sqrt(d2.min(0)).max()))

def ed_es_error(vol_pred, vol_gt):
    """ED/ES 帧号检测误差(帧);容积曲线法见 §6.3 detect_ed_es"""
    def curve(v):
        a = (v > v.max() * 0.3).sum(axis=(2, 3)).mean(axis=0)
        return int(a.argmax()), int(a.argmin())
    (ed_p, es_p), (ed_g, es_g) = curve(vol_pred), curve(vol_gt)
    return abs(ed_p - ed_g), abs(es_p - es_g)

def group_ef_deviation(pred_volumes, ref_stats):
    """按 §8.1b 参照表校验生理一致性:各组 EF 预测均值与官网参照之差(百分点)
    pred_volumes: {group: [(edv, esv), ...]};ref_stats: {group: ref_ef}"""
    out = {}
    for grp, pairs in pred_volumes.items():
        efs = [100.0 * (1.0 - esv / edv) for edv, esv in pairs if edv > 0]
        if efs and grp in ref_stats:
            out[grp] = sum(efs) / len(efs) - ref_stats[grp]
    return out

§6.10 MLOps 笔记

  • 数据谱系表:以 CAP_ID → 队列 → 协议(GRE/SSFP)→ 标注层级为键建立 manifest,随每次训练快照存档,防坑点 6 的口径漂移。
  • 协议感知版本化:把"GRE 域 / SSFP 域"作为一等公民写入实验命名,任何跨域指标单独分列。
  • 合规流水线:MESA 稿件审批与合著者要求加入发布 checklist(坑点 8);DDA 到期/续签(DETERMINE 暂停事件)设监控提醒。
  • 共识迭代:STAPLE 共识是活的资源,记录所用共识版本;有条件时按官方路径回传分割结果参与共识改进。
  • 评测托管化:优先把 CAP 挑战测试集当"外部评测服务"而非自建测试集,减少划分争议并保证与社区口径可比。
  • 小集防过拟合:Sunnybrook/SCMR 集小,训练脚本应固定随机种子并输出每折逐病例指标,便于人工抽查失败案例。

§7 质量评估与局限性

§7.1 已知偏倚表

偏倚类型 描述 严重程度 缓解
协议偏倚 MESA GRE vs DETERMINE SSFP 在心尖/乳头肌区的系统性形状差异 高 官方校正映射(≤1 ml);同协议内比较
选择偏倚 MESA 为自愿入组的社区人群,健康程度高于一般就诊人群 中 解读为"人群参照"而非"临床分布"
标注偏倚 主库无 GT;挑战掩膜半自动来源 高 分层使用标注;SCMR 共识做外部锚
设备偏倚 多厂商(Siemens/GE)多中心跨十年 中 按厂商分层评估;域适应
人群偏倚 四族群限于美国居民;DETERMINE 冠心病人男多于女 中 外推时声明;按族群亚组分析
时间偏倚 MESA 基线影像跨越 2000-2002 两年窗口,设备软件更新在所难免 低 以采集时间/厂商为协变量稳健性检验
标注层级混淆偏倚 把半自动挑战掩膜当人工 GT 报告 高 按 §3.5 金字塔层级如实命名标注来源
存续偏倚 子集随协议状态变动(DETERMINE 暂停) 低 引用时注明校验日期与子集状态

§7.2 标注质量

金字塔顶端的 SCMR 共识(7 实验室 7 专家)与 Sunnybrook 手工轮廓可信度高;STAPLE 共识整合 5 类评分者后的一致性区间宽(敏感度 0.63-0.85 等),提示共识不是"完美 GT"而是"更稳定的聚合估计"——其论文同时证明共识质量可通过限定差异区域与算法表现分布的客观度量来维护。可操作的量级参照:即便专家级评分者,对 STAPLE 共识的敏感度下限仅 0.63、PPV 下限仅 0.56,说明心梗病例的心肌边界本身存在实质性歧义区(乳头肌、小梁、部分容积效应);因此对 CAP 的任何分割评测都应同时报告轮廓级指标(Hausdorff)与体素级指标(Dice),并附逐病例散点暴露歧义区。使用时:报告所用共识版本、区分人工/半自动/共识三档,并在误差分析中包含观察者间变异量级。

§7.3 泛化性

部署场景 失效风险 证据
现代协议 SSFP 影像 GRE 训练模型直接迁移失败 官方 2021 论文明示失效模式
跨厂商扫描仪 边界对比度漂移、分割退化 多厂商多中心构成的固有变量
心律不齐患者 回顾性门控假设破坏、时相错乱 门控协议设计的适用边界
儿童/先心病 MESA(45-84 岁)与 DETERMINE 成人占绝对主体,CHD 子集量未公布 年龄/病理覆盖缺口
梗死形状推断 协议偏倚制造假性病灶 2013 协议偏倚论文
心律失常患者门控假设 回顾性门控帧数随心率漂移 DETERMINE 协议"25 帧,随心率与屏气变化"的官方说明
灌注定量 呼吸运动伪影未校正即定量 Motion Correction 挑战的官方任务动机

§7.4 伦理

全部病例仅以知情同意与 IRB 批准兼容共享为入库前提;MESA 伦理批件包括约翰霍普金斯大学(NA_00031350)与新西兰多区伦理委员会(MEC/08/04/052);DICOM 经 HIPAA 合规工具(LONI De-identification Debabeler)脱敏、ID 重映射为 CAP 格式。访问端以"研究提案 + 贡献者批准 + DDA"三重把关保护参与者权利,MESA 另有出版审批与合著者条款。使用者不得尝试重识别,不得向未授权第三方再分发。三条操作级红线:

  1. 再分发:DDA 未授权的第三方转存/转传一律禁止,合作者应走独立申请。
  2. 重识别:利用残留头字段或外部数据链接身份既违反条款也违反 HIPAA 精神。
  3. 用途漂移:挑战数据的"仅限本挑战"条款意味着把其挑战集再用于其他论文需另行获批,而非默认继承。

§7.5 公平性

MESA 的四族群设计(白人、非裔、西裔、华裔各占相当比例)在同类影像库中少见,使跨族群形状差异分析成为可能;但所有参与者均为美国居民、45-84 岁,儿童与其他人群依赖 CHD/AIM-ASD 等小子集(总量未公布)。性别上 DETERMINE 冠心病人群男多于女。训练公平性敏感模型时应按族群 × 性别 × 年龄分层报告误差,并注意主库无标签带来的分层评估限制;CAP 相关的族群差异研究(如 MESA 形状变异论文)提供了按族群报告主模式差异的模板。另一个公平性维度是语言与资源:文档全英文、申请流程偏学术化,对非英语团队与临床工程团队构成准入摩擦,引用与复现时应意识到这一选择偏倚。

§7.6 数据漂移

CAP 本身冻结于历史采集(MESA 2000-2002 等),漂移风险主要发生在"部署时":现代扫描仪的 SSFP/compressed sensing 序列与库内 GRE/旧 SSFP 存在协议漂移;心功能临床实践中实时导航、AI 自动定位等新采集习惯也会改变图像分布; clinicians 对层厚与屏气时长的选择偏好随指南演进(SCMR 2020 标准化后处理声明即为例证)。建议以协议元数据为协变量做输入分布监控,并把协议偏倚校正模型作为漂移缓冲层;对长期部署的模型,CAP 的价值是提供"历史锚点"——当新数据分布漂移时,可在 CAP 坐标系中量化漂移幅度而非只报报警。

§7.7 DAIMS 24 项自评

# 检查项 状态 说明
1 宽格式 ⚠️ 影像为主,元数据仅子集级 CSV(如 Sunnybrook patient_data),无统一宽表
2 唯一标识 ✅ CAP_ID 全库统一(Sunnybrook 原始 ID 映射表齐备)
3 特殊字符 ✅ ID/字段命名规范,无分隔符冲突
4 重复行 ✅ 病例级无重复;同病例多层多帧为设计使然而非重复记录
5 缺失编码 ⚠️ 缺失多为"字段整体不存在"(主库无轮廓列),需按 §4.5 显式建模
6 标签标识 ✅ 有标签子集分组字段明确(N/HYP/HF/HF-I、MESA/DETERMINE)
7 罕见类分组 ⚠️ AMRG 仅 1 例、SCMR 仅 15 例,小类无合并指引
8 偏倚评估 ✅ 协议/选择/标注偏倚均有官方文献支撑(§7.1)
9 数据字典 ⚠️ DICOM 标准即字典,但 CAP 专有字段(XML 轮廓/模型)文档分散于论文与 Readme
10 信息性缺失解释 ✅ 无轮廓=开放策略、无共识=挑战设计,均有官方解释(§4.5)
11 设备记录 ✅ DICOM 头含厂商/序列参数;论文级协议参数齐备(§3.1/3.9)
12 共线性 ✅ 标签维度少(组别/队列),无共线性风险
13 编码映射 ⚠️ 提供 ICD-11/SNOMED 映射(§2.1)但非官方附带,需自维护
14 时间戳处理 ⚠️ TriggerTime/SliceLocation 可用,但存在头缺失病例(坑点 4)
15 划分建议 ✅ 官方挑战划分 + 2021 论文 50.5/49.5 先例(§5.1)
16 泄漏讨论 ✅ 官方 FAQ 明示半自动掩膜不得当 GT;本文 §5.3 系统梳理
17 标签分布 ✅ Sunnybrook 四组 + 挑战 100/100 均衡设计(§4.2)
18 测量偏倚 ✅ GRE/SSFP 测量偏倚被官方量化(≤1 ml 校正后)
19 外部验证建议 ✅ 官方推荐 SCMR 共识作外部验证集(§2.6/§5.5)
20 版本记录 ⚠️ 无正式版本号;以官网子集状态为准(DETERMINE 暂停事件)
21 预处理脚本 ✅ 官方管线代码开源于 CardiacAtlasProject GitHub 组织(2021 论文)
22 合规要求 ✅ DDA + MESA 出版条款 + 挑战用途限定,条款体系完整(坑点 8)
23 多模态对齐 ⚠️ Motion Tracking 挑战含 MRI/3D 超声与注册表,但主库内跨模态对齐需自建
24 去标识化 ✅ HIPAA 合规工具 + CAP ID 重映射 + 知情同意/IRB 前置过滤

DAIMS 评分:15.5 / 24

评分解读:标识、去标识化、合规、泄漏与偏倚治理等"制度面"表现优秀(得益于 NIH 级项目管理与同行评审文献链);短板集中在"易用面"——无统一宽表、主库无标签、专有格式文档分散、无正式版本号。这不是粗制数据集,而是"结构化不足、治理过剩"的科研基础设施,AI 工程化需要自建 manifest 层。

对你意味着什么:第一,直接把 CAP 当监督学习语料会碰壁,把 MESA/DETERMINE 定位为预训练与域适应语料、把 Sunnybrook/共识/挑战集定位为监督锚点是正确姿势;第二,开写代码前先花半天建 manifest(ID 映射 + 协议标签 + 标注层级),可避免坑点 6/8 的九成问题;第三,发表路径优先"CAP 开发 + SCMR 共识外部验证",这是官方背书且审稿人认可的组合。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
MESA 独立测试子集(2,474 例) MESA/NHLBI DL 轮廓 vs 专家轮廓驱动的心脏图谱 与危险因素关联强度相当 内部训练验证 2,529 例 ↔ 外部 2,474 例无显著质量差 DL 管线在 GRE 遗留数据上可达人工分析等效
5 评分者 vs STAPLE 共识(95 例心梗) 多机构(挑战参与者) LV 心肌分割 敏感度 0.63-0.85、特异度 0.60-0.98、PPV 0.56-0.94、NPV 0.83-0.92 人工+自动混合共识优于任何单一评分者 共识机制是标注质量的可迭代方案
GRE vs SSFP 双协议志愿者(46 例) 学术中心 协议偏倚量化 校正后容积偏差 ≤1 ml 不校正时乳头肌区假显著 协议偏倚必须建模而非忽略

§8 基准性能与生态

§8.1 排行榜与挑战结果

排名/角色 模型/评分者 性能 年份 关键技术 完整引用 代码
挑战共识基线 STAPLE 共识(5 评分者聚合) 敏感度 0.63-0.85 / 特异度 0.60-0.98(95 例) 2014 期望最大化标签聚合 Suinesiaputra A et al., Med Image Anal 2014;18(1):50-62. DOI: 10.1016/j.media.2013.09.001 官网资源
官方 DL 管线 VGGNet 标志点 + U-Net 分割 + 有限元拟合 与人工图谱等效的危险因素关联 2021 遗留 GRE 域深度学习 Suinesiaputra A et al., Front Cardiovasc Med 2021;8:807728. DOI: 10.3389/fcvm.2021.807728 GitHub CardiacAtlasProject
MI 形状分类挑战 多团队统计形状模型 100 MESA vs 100 DETERMINE 分类(成果见期刊合集) 2017 SSM + 机器学习分类 Suinesiaputra A et al., IEEE J Biomed Health Inform 2017;22(2):503-515 挑战页
运动跟踪基准 多算法基准框架 体模真值 + 15 例多模态 2013 tagged MR + 3D US 基准 Tobon-Gomez C et al., Med Image Anal 2013;17(6):632-648 官网开放

⚠️ 数值不可直接比较:各行任务、数据、指标定义不同(分割敏感度 vs 分类 vs 运动误差),且 STAPLE 共识本身随提交迭代演化;2009 Sunnybrook 挑战成绩请以 MIDAS 论文(Radau et al.)原文口径为准。

§8.1b Sunnybrook 四组生理指标基准表

CAP 官网随 Sunnybrook 公布的四组 LV 生理统计(均值(标准差),按 Alfakih 2003 标准分组)可作为下游模型生理一致性的对照锚点:

指标 N(n=9) HYP(n=12) HF(n=12) HF-I(n=12)
舒张末容积(ml) 115.69(36.89) 114.39(50.46) 233.67(63.21) 244.92(86.02)
收缩末容积(ml) 43.10(14.74) 43.11(24.50) 158.28(56.34) 174.34(90.64)
射血分数(%) 62.93(3.65) 62.72(9.22) 33.09(13.07) 32.01(12.27)
左心室质量(g) 130.27(32.69) 175.87(85.70) 193.69(39.01) 201.32(45.24)

用法:模型自动分割积分得到的 EDV/ESV/EF/LVM 应先在四组上复现上述量级(尤其 EF 的组间极差与 LVM 的肥厚组升高),再谈跨库泛化;偏差集中于某一组往往提示该组几何特例(如心梗后局部膨出)未被模型覆盖。

§8.2 SOTA 总结与选型建议

心脏 cine 分割的现代 SOTA 已由 nnU-Net 类框架在 ACDC/M&Ms 等现代协议库上定义;CAP 的独特基准价值在三个"别人没有"的轴:遗留 GRE 域(2021 官方管线是参照点)、形状/运动统计建模(有限元 + PCA 仍是金方法)、共识标注机制(STAPLE)。选型建议:做协议泛化论文→以 2021 官方管线为 baseline;做分割刷榜→把 CAP 当外部验证而非主战场;做可解释形状分析→直接采用官方形状模型路线。

§8.3 评测协议

分割:Dice + 对称 Hausdorff(mm,需像素间距换算)+ 心内外膜分列报告;ED/ES 帧检测误差(帧)。生理一致性:自动积分的 EDV/ESV/EF/LVM 对照 §8.1b 参照表按组分列。形状统计:PCA 主模式方差解释率 + 逐点 Hotelling T2 图(AHA 17 节段聚合);跨协议比较必须报告校正前后差异。运动评测:以体模真值为绝对基准、健康志愿者数据为相对基准(官方运动跟踪挑战设计)。共识评测:向挑战方提交测试集结果、由官方按当前共识回传指标——这是 CAP 特有的"托管式评测"协议,代价是结果需等待官方处理、且不可自行公开逐例共识。

评测注意事项:其一,挑战训练掩膜为半自动来源,与其比较时应声明"对半自动参考"而非"对专家 GT";其二,Sunnybrook 各批次病例数不均(9/10/10/10/6),跨批次聚合时按病例加权而非按批次平均;其三,不同文献的轮廓级 vs 体素级指标不可互换,复现时优先找原始论文的指标定义附录。

数据集 关系 用法建议
Sunnybrook Cardiac Data CAP 内嵌 CC0 子集 快速起步与教学
ACDC 同任务现代协议库 外部协议验证
M&Ms 多厂商泛化库 厂商域偏移对照
UK Biobank 方法学继承者 超大人群形状统计
MESA 官方数据通道 上游队列 临床协变量需另行申请
STACOM 系列(过去挑战) 同社区挑战生态 补充任务定义与历史基线

§8.5 关键论文 Top 8

  1. Fonseca CG, Backhaus M, Bluemke DA, et al. The Cardiac Atlas Project—an imaging database for computational modeling and statistical atlases of the heart. Bioinformatics, 2011, 27(16): 2288-2295. DOI: 10.1093/bioinformatics/btr360 —— 数据集奠基论文(架构、脱敏、访问协议)。
  2. Fonseca CG, Backhaus M, Do Chung J, et al. The Cardiac Atlas Project: Rationale, Design and Procedures. STACOM-CESC 2010, LNCS, 2010: 36-45. DOI: 10.1007/978-3-642-15835-3_4 —— 设计原理与早期库容(MESA 2,864 + DETERMINE 470)。
  3. Suinesiaputra A, Cowan BR, Al-Agamy AO, et al. A collaborative resource to build consensus for automated left ventricular segmentation of cardiac MR images. Medical Image Analysis, 2014, 18(1): 50-62. DOI: 10.1016/j.media.2013.09.001 —— STAPLE 共识方法论与一致性量化。
  4. Medrano-Gracia P, Cowan BR, Finn JP, et al. Atlas-based analysis of cardiac shape and function: correction of regional shape bias due to imaging protocol for population studies. Journal of Cardiovascular Magnetic Resonance, 2013, 15: 80. DOI: 10.1186/1532-429X-15-80 —— GRE/SSFP 协议偏倚量化与校正。
  5. Suinesiaputra A, Cowan BR, Ambale-Venkatesh B, et al. Deep Learning Analysis of Cardiac MRI in Legacy Datasets: Multi-Ethnic Study of Atherosclerosis. Frontiers in Cardiovascular Medicine, 2021, 8: 807728. DOI: 10.3389/fcvm.2021.807728 —— 遗留数据 DL 管线与代码开源。
  6. Medrano-Gracia P, Cowan BR, Ambale-Venkatesh B, et al. Left ventricular shape variation in asymptomatic populations: the multi-ethnic study of atherosclerosis. Journal of Cardiovascular Magnetic Resonance, 2014, 16: 56 —— MESA 人群形状变异主模式分析。
  7. Suinesiaputra A, Ablin P, Alba X, et al. Statistical shape modeling of the left ventricle: myocardial infarct classification challenge. IEEE Journal of Biomedical and Health Informatics, 2017, 22(2): 503-515 —— 心梗形状分类挑战成果汇总。
  8. Young AA, Frangi AF. Computational cardiac atlases: from patient to population and back. Experimental Physiology, 2009, 94(5): 578-583 —— CAP 的方法学愿景宣言。
  9. Medrano-Gracia P, Cowan BR, Ambale-Venkatesh B, et al. Left ventricular shape variation in asymptomatic populations: the multi-ethnic study of atherosclerosis. Journal of Cardiovascular Magnetic Resonance, 2014, 16: 56 —— MESA 无症状人群 LV 形状变异主模式的系统刻画。
  10. Suinesiaputra A, Bluemke DA, Cowan BR, et al. Quantification of LV function and mass by cardiovascular magnetic resonance: multi-center variability and consensus contours. Journal of Cardiovascular Magnetic Resonance, 2015, 17: 63 —— 多中心容积/质量量化变异与共识轮廓的兼容性验证。

§8.6 社区活跃度

CAP 以"挑战赛 + 共识回收"维持社区参与:STACOM 系列挑战自 2009 年(Sunnybrook)延续至 2011 年(分割/标志点/运动/形状)及后续心房分割等专题,历年挑战数据与结果均沉淀在官网长期可取;其 GitHub 组织持续托管管线代码,2021 年遗留数据深度学习论文的配套实现即发布于此。配套论文群引用表现稳定:数据库论文 355+ 次(Google Scholar,截至 2026-09),共识论文 239 次、多中心量化论文 230 次、MESA 形状变异论文 121 次、心梗形状分类挑战论文 114 次,且 2019 年后仍被 UK Biobank 心脏分析等大项目持续引用。平台官网由奥克兰大学维护、NHLBI 资助,数据贡献者委员会机制保证子集持续扩容(MITEA、AIM-ASD 为近年新增;另设 KCL 镜像站备援)。对社区的真实可用性而言,其"申请制 + 委员会审批"虽慢于 PhysioNet 式凭证化下载,但换来的是逐队列条款的清晰边界,这在长期维护上是加分项。

§8.7 生态快照表

资源 类型 链接 热度(截至 2026-09) 推荐理由
官网 数据门户 http://www.cardiacatlas.org/ 持续运营 子集矩阵 + 申请表单唯一入口
CardiacAtlasProject GitHub 代码组织 https://github.com/orgs/CardiacAtlasProject/repositories 官方维护 MESA DL 管线复现起点
STACOM 挑战页 挑战数据 https://www.cardiacatlas.org/lv-segmentation-challenge/ 长期开放 托管式评测协议
MIMIC-III(对比参照) EHR 数据集 PhysioNet 高引用 重症临床对照研究补充
CIM/CMGUI 建模软件 官网 Tools 页 开源(MPL 1.1) 有限元形状模型官方工具
MESA 研究官网 上游队列门户 https://www.mesa-nhlbi.org/ 长期运营 临床协变量与随访数据的官方渠道

§9 相关资源与引用

§9.1 官方资源清单

  1. 官方主页(数据集矩阵、图谱浏览、申请入口):http://www.cardiacatlas.org/
  2. MESA 子集页(申请条款、GRE 提醒):https://www.cardiacatlas.org/mesa/
  3. DETERMINE 子集页(协议参数、状态公告):https://www.cardiacatlas.org/?p=329/
  4. Sunnybrook 子集页(CC0 下载、批次清单):https://www.cardiacatlas.org/?p=145
  5. LV 分割挑战页(协议、FAQ、条款):https://www.cardiacatlas.org/lv-segmentation-challenge/
  6. Motion Tracking 挑战页(多模态数据说明):https://www.cardiacatlas.org/?p=1072
  7. 官方工具页(CIM/CMGUI、源码仓库指引):http://www.cardiacatlas.org/web/guest/tools
  8. GitHub 组织(官方管线代码):https://github.com/orgs/CardiacAtlasProject/repositories
  9. KCL 镜像站(文档备援):https://cardiacatlasproject.isd.kcl.ac.uk/
  10. STAPLE 共识论文全文(Europe PMC):https://europepmc.org/articles/3840080
  11. 协议偏倚校正论文页(Springer):https://link.springer.com/doi/10.1186/1532-429X-15-80

§9.2 BibTeX 引用块

@article{fonseca2011cardiac,
  author  = {Fonseca, Carissa G. and Backhaus, Michael and Bluemke, David A. and
             Britten, Randall D. and Chung, Jae Do and Cowan, Brett R. and
             Dinov, Ivo D. and Finn, J. Paul and Hunter, Peter J. and
             Kadish, Alan H. and Lee, Daniel C. and Lima, Joao A. C. and
             Medrano-Gracia, Pau and Shivkumar, Kalyanam and
             Suinesiaputra, Avan and Tao, Wenchao and Young, Alistair A.},
  title   = {The Cardiac Atlas Project--an imaging database for computational
             modeling and statistical atlases of the heart},
  journal = {Bioinformatics},
  year    = {2011},
  volume  = {27},
  number  = {16},
  pages   = {2288--2295},
  doi     = {10.1093/bioinformatics/btr360}
}

@article{suinesiaputra2014consensus,
  author  = {Suinesiaputra, Avan and Cowan, Brett R. and Al-Agamy, Ahmed O. and
             Elattar, Mustafa A. and Ayache, Nicholas and Fahmy, Ahmed S. and
             Khalifa, Ayman M. and Medrano-Gracia, Pau and Jolly, Marie-Pierre and
             Kadish, Alan H. and Lee, Daniel C. and Margeta, Jan and
             Warfield, Simon K. and Young, Alistair A.},
  title   = {A collaborative resource to build consensus for automated left
             ventricular segmentation of cardiac {MR} images},
  journal = {Medical Image Analysis},
  year    = {2014},
  volume  = {18},
  number  = {1},
  pages   = {50--62},
  doi     = {10.1016/j.media.2013.09.001}
}

@article{suinesiaputra2021legacy,
  author  = {Suinesiaputra, Avan and others},
  title   = {Deep Learning Analysis of Cardiac {MRI} in Legacy Datasets:
             Multi-Ethnic Study of Atherosclerosis},
  journal = {Frontiers in Cardiovascular Medicine},
  year    = {2021},
  volume  = {8},
  pages   = {807728},
  doi     = {10.3389/fcvm.2021.807728}
}

@inproceedings{fonseca2010rationale,
  author    = {Fonseca, Carissa G. and Backhaus, Michael and Do Chung, Jae and
               Tao, Wenchao and Medrano-Gracia, Pau and Cowan, Brett R. and
               Hunter, Peter J. and Finn, J. Paul and Shivkumar, Kalyanam and
               Lima, Joao A. C. and Bluemke, David A. and Kadish, Alan H. and
               Lee, Daniel C. and Young, Alistair A.},
  title     = {The Cardiac Atlas Project: Rationale, Design and Procedures},
  booktitle = {Statistical Atlases and Computational Models of the Heart
               (STACOM-CESC 2010)},
  series    = {LNCS},
  year      = {2010},
  pages     = {36--45},
  doi       = {10.1007/978-3-642-15835-3_4}
}

@article{radau2009evaluation,
  author  = {Radau, Perry and Lu, Yue and Connelly, Kim and Paul, Gabe and
             Dick, Alexander J. and Wright, Graham A.},
  title   = {Evaluation Framework for Algorithms Segmenting Short Axis Cardiac {MRI}},
  journal = {The MIDAS Journal -- Cardiac MR Left Ventricle Segmentation Challenge},
  year    = {2009},
  url     = {http://hdl.handle.net/10380/3070}
}

@article{medranogracia2013atlas,
  author  = {Medrano-Gracia, Pau and Cowan, Brett R. and Finn, J. Paul and
             Fonseca, Carissa G. and Kadish, Alan H. and Lee, Daniel C. and
             Lima, Joao A. C. and Suinesiaputra, Avan and Young, Alistair A.},
  title   = {Atlas-based analysis of cardiac shape and function: correction of
             regional shape bias due to imaging protocol for population studies},
  journal = {Journal of Cardiovascular Magnetic Resonance},
  year    = {2013},
  volume  = {15},
  pages   = {80},
  doi     = {10.1186/1532-429X-15-80}
}

@article{tobongomez2013benchmark,
  author  = {Tobon-Gomez, Catalina and De Craene, Mathieu and McLeod, Kristin and
             others},
  title   = {Benchmarking framework for myocardial tracking and deformation
             algorithms: An open access database},
  journal = {Medical Image Analysis},
  year    = {2013},
  volume  = {17},
  number  = {6},
  pages   = {632--648}
}

@article{suinesiaputra2017shape,
  author  = {Suinesiaputra, Avan and Ablin, Pierre and Alba, Xavier and
             others},
  title   = {Statistical shape modeling of the left ventricle: myocardial
             infarct classification challenge},
  journal = {IEEE Journal of Biomedical and Health Informatics},
  year    = {2017},
  volume  = {22},
  number  = {2},
  pages   = {503--515}
}

§9.3 引用指南

使用任何 CAP 子集时:首先引用 Fonseca et al. 2011(数据库论文);使用 Sunnybrook 追加 Radau et al. 2009;使用 STAPLE 共识追加 Suinesiaputra et al. 2014;使用挑战数据按各挑战页指定引用(如运动跟踪引 Tobon-Gomez et al. 2013);使用 MESA 数据还须遵守其额外的稿件审批与合著者条款(见坑点 8)。使用协议偏倚校正思路应引 Medrano-Gracia et al. 2013;使用遗留数据深度学习管线应引 Suinesiaputra et al. 2021 并注明代码来源。引用次数等动态数字注明"截至"日期;同一研究中多个子集混用时,建议在方法节列出全部引用清单而非仅引数据库论文,这是 CAP 社区多年形成的惯例,也是审稿环节的高频要求。

§9.4 引用对照速查

使用内容 必引文献
任何 CAP 数据 Fonseca et al. 2011(Bioinformatics)
Sunnybrook 子集 + Radau et al. 2009(MIDAS)
STAPLE 共识 / 分割挑战 + Suinesiaputra et al. 2014(Med Image Anal)
运动跟踪挑战 + Tobon-Gomez et al. 2013(Med Image Anal)
MESA 形状分析 + Medrano-Gracia et al. 2014(JCMR)
协议偏倚校正 + Medrano-Gracia et al. 2013(JCMR 15:80)
遗留数据深度学习管线 + Suinesiaputra et al. 2021(Front Cardiovasc Med)
CAP 设计与流程 + Fonseca et al. 2010(STACOM-CESC, LNCS)

§10 AI 使用声明卡

§10.1 本页面 AI 模型列表

  • 主写作模型:CodeBuddy Code(fast-model),负责资料检索汇总、初稿撰写与结构化排版。
  • 辅助工具:WebSearch(官方页面与同行评审文献检索)、check_md.py(结构合规自检脚本,本地规则校验)。

§10.2 AI 参与范围

AI 完成文献检索结果汇总、章节初稿与表格/代码整理;事实性数字全部锚定检索所得公开来源(官方页面或同行评审文献);医学编码映射、偏倚评估结论、坑点操作建议与整体技术判断由人工复核把关;所有代码为按官方公开协议参数编写的参考实现,未在原始数据上逐行执行验证。AI 未参与任何数据下载、申请提交或与数据方的通信;页面中涉及的许可与条款解读以官方页面原文为准,本页面仅作导航性归纳。

§10.3 输入来源列表

  1. Fonseca CG, Backhaus M, Bluemke DA, et al. The Cardiac Atlas Project—an imaging database for computational modeling and statistical atlases of the heart. Bioinformatics, 2011, 27(16): 2288-2295. DOI: 10.1093/bioinformatics/btr360
  2. Fonseca CG, Backhaus M, Do Chung J, et al. The Cardiac Atlas Project: Rationale, Design and Procedures. STACOM-CESC 2010, LNCS, 2010: 36-45. DOI: 10.1007/978-3-642-15835-3_4
  3. Cardiac Atlas Project 官方主页(数据集矩阵、挑战清单、资助声明)。http://www.cardiacatlas.org/
  4. CAP MESA 子集页(2,450 例、GRE 提醒、申请条款、合著者要求)。https://www.cardiacatlas.org/mesa/
  5. CAP DETERMINE 子集页(450 例、SSFP/LGE 参数、暂时不可用公告)。https://www.cardiacatlas.org/?p=329/
  6. CAP Sunnybrook 子集页(45 例、四组构成、CC0、批次体积、ID 映射说明)。https://www.cardiacatlas.org/?p=145
  7. CAP LV Segmentation Challenge 页(200 例设定、STAPLE 共识、FAQ 条款)。https://www.cardiacatlas.org/lv-segmentation-challenge/
  8. CAP Motion Tracking Challenge 页(体模 + 15 例、多模态与格式、署名政策)。https://www.cardiacatlas.org/?p=1072
  9. Suinesiaputra A, Cowan BR, Al-Agamy AO, et al. A collaborative resource to build consensus for automated left ventricular segmentation of cardiac MR images. Medical Image Analysis, 2014, 18(1): 50-62. DOI: 10.1016/j.media.2013.09.001
  10. Medrano-Gracia P, Cowan BR, Finn JP, et al. Atlas-based analysis of cardiac shape and function: correction of regional shape bias due to imaging protocol for population studies. Journal of Cardiovascular Magnetic Resonance, 2013, 15: 80. DOI: 10.1186/1532-429X-15-80
  11. Suinesiaputra A, et al. Deep Learning Analysis of Cardiac MRI in Legacy Datasets: Multi-Ethnic Study of Atherosclerosis. Frontiers in Cardiovascular Medicine, 2021, 8: 807728. DOI: 10.3389/fcvm.2021.807728(含 5,098/5,003/2,529/2,474 口径、GRE 参数、伦理批件、代码链接)
  12. Medrano-Gracia P, Backhaus M, Bluemke DA, et al. The cardiac atlas project: rationale, design and preliminary results. Journal of Cardiovascular Magnetic Resonance, 2011, 13(Suppl 1): O72. DOI: 10.1186/1532-429X-13-S1-O72(MESA 2,864 / DETERMINE 470、预分析 300+200)
  13. Radau P, Lu Y, Connelly K, et al. Evaluation Framework for Algorithms Segmenting Short Axis Cardiac MRI. The MIDAS Journal, 2009. http://hdl.handle.net/10380/3070
  14. Bild DE, Bluemke DA, Burke GL, et al. Multi-ethnic study of atherosclerosis: objectives and design. American Journal of Epidemiology, 2002, 156(9): 871-881. DOI: 10.1093/aje/kwf113
  15. Kadish AH, Bello D, Finn JP, et al. Rationale and Design for the Defibrillators to Reduce Risk by Magnetic Resonance Imaging Evaluation (DETERMINE) Trial. Journal of Cardiovascular Electrophysiology, 2009, 20(9): 982-987. DOI: 10.1111/j.1540-8167.2009.01503.x
  16. Li B, Liu Y, Occleshaw CJ, Cowan BR, Young AA. In-line automated tracking for ventricular function with magnetic resonance imaging. JACC: Cardiovascular Imaging, 2010, 3(8): 860-866.
  17. Tobon-Gomez C, De Craene M, McLeod K, et al. Benchmarking framework for myocardial tracking and deformation algorithms: An open access database. Medical Image Analysis, 2013, 17(6): 632-648.
  18. Suinesiaputra A, Ablin P, Alba X, et al. Statistical shape modeling of the left ventricle: myocardial infarct classification challenge. IEEE Journal of Biomedical and Health Informatics, 2017, 22(2): 503-515.

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§1 概览与规模数字口径 千方病案医学编辑部 对照官方页面与 2011/2021 论文逐数核对 ✅ 已通过
§2 医学背景与 ICD-11/SNOMED 映射 千方病案医学编辑部(医学背景) 编码表复核 + 临床任务定义审阅 ✅ 已通过
§3-§4 规格与数据结构 千方病案医学编辑部(数据工程) 官网子集参数 + DICOM/NIfTI 格式核对 ✅ 已通过
§6 预处理与 DataLoader 代码 千方病案医学编辑部(数据工程) 逻辑走查 + 与官方协议参数比对 ✅ 已通过
§6.5 坑点 8 项 千方病案医学编辑部(数据工程) 逐条溯源官方页面/论文原文 ✅ 已通过
§7 DAIMS 24 项与偏倚评估 千方病案医学编辑部 对照宪法 24 项清单逐项评分 ✅ 已通过
§8 基准与生态 千方病案医学编辑部 引用完整性 + 数值口径核查 ✅ 已通过
§9-§10 引用与声明卡 千方病案医学编辑部 BibTeX 字段核对 + 来源清点 ✅ 已通过
§C JSON-LD 结构化数据 千方病案医学编辑部(数据工程) 与 frontmatter schema_org 逐节点比对 ✅ 已通过

§10.5 AI 生成章节标注

全部章节初稿由 AI 生成;§0 免责声明、§2 医学编码表、§6.5 坑点操作建议、§7.7 DAIMS 评分结论与"对你意味着什么"为人工重点改写与终审区块;§10.4 所列模块均经人工方式复核后放行。

§10.6 最后人工审核

最后一次人工审核日期:2026-09-05(与 §0 审核日期一致)

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • mms — 共享标签:医学影像 / MRI / 医学图像分割 / 心血管疾病
  • echonet-dynamic — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 心血管疾病
  • acdc — 共享标签:医学影像 / MRI / 医学图像分割 / 心血管疾病
  • echonet-lvh — 共享标签:医学影像 / 图像分类 / 心血管疾病
  • myocardial-perfusion-spect — 共享标签:医学影像 / 医学图像分割 / 心血管疾病
  • atlas-v2 — 共享标签:医学影像 / MRI / 医学图像分割 / 心血管疾病
  • intra — 共享标签:医学影像 / MRI / 医学图像分割 / 图像分类
  • mms-2 — 共享标签:医学影像 / MRI / 医学图像分割 / 心血管疾病
  • cmrxmotion — 共享标签:医学影像 / MRI / 医学图像分割 / 心血管疾病
  • lvquant — 共享标签:医学影像 / MRI / 医学图像分割 / 心血管疾病

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集