orCaScore (orcascore) — 自动冠状动脉钙化评分评测框架 — AI-Ready Wikipedia

MICCAI 2014 波士顿发起的自动冠状动脉钙化评分评测框架——72 例多中心心脏 CT(32 训练/40 测试,四院四厂商),CSCT+CCTA 配对,三级评测(病灶/血管/患者),五个(半)自动方法的独立横评,Grand Challenge 平台托管

来源 四家医院、四种厂商 CT 扫描仪采集的非增强 ECG 触发心脏钙化评分 CT(CSCT)+ 配对增强 CTA(CCTA);参考标准由两名专家独立标注>130 HU、3-D 6-connectivity 连通病灶、LAD/LCX/RCA 血管归属,分歧共识复核;mhd/zraw MetaImage 格式发布时间: 2026-09-30最后更新: 2026-09-30 阅读 9
orCaScore (orcascore) — 自动冠状动脉钙化评分评测框架 — AI-Ready Wikipedia

信息速览

数据集名称orCaScore (orcascore) — 自动冠状动脉钙化评分评测框架 — AI-Ready Wikipedia
数据类型影像数据,专家标注,临床数据
规模72 例患者(32 训练 + 40 测试);每例含 1 对 CSCT+CCTA
接入方式四家医院、四种厂商 CT 扫描仪采集的非增强 ECG 触发心脏钙化评分 CT(CSCT)+ 配对增强 CTA(CCTA);参考标准由两名专家独立标注>130 HU、3-D 6-connectivity 连通病灶、LAD/LCX/RCA 血管归属,分歧共识复核;mhd/zraw MetaImage 格式
AI 就绪度

INFOBOX — orCaScore 一屏速览

维度 内容
本质 自动冠状动脉钙化评分(CAC)评测框架(评测协议 + 公开数据集,非纯数据采集)
发起 MICCAI 2014 workshop,Boston, USA;Grand Challenge 平台托管
论文 Medical Physics. 2016;43(5):2361-2373(doi:10.1118/1.4945696;PMID 27147348)
团队 UMC Utrecht Image Sciences Institute 为主(一作 Wolterink,通讯 Išgum),多机构联合
数据 72 例(32 训练 + 40 测试);每例 CSCT + CCTA 配对;四院四厂商
标注 两专家独立标 >130 HU、3-D 6-connectivity 病灶;LAD/LCX/RCA 归属(左主干归 LAD);分歧共识复核
主任务 非增强 ECG 触发心脏 CT 中自动识别冠脉钙化
评测层级 病灶级 → 血管级 → 患者级(三级)
核心指标 病灶 sensitivity/PPV、F-1(Volume)、血管 ICC、风险分类 kappa/accuracy
五方法横评 病灶检出 52%–94%、PPV 65%–96%、血管归属正确 88%–98%、风险 kappa 0.80–1.00
获取 注册制(Grand Challenge;2025-08 起关闭新注册);测试集标注不公开
许可 官方站未声明规范化开源许可——本条目最大 AI-Ready 缺陷
库内互链 mm-whs(全心分割挑战)、cardiac-atlas-project(心脏图谱)、heart-lung-segmentations-data、ct-rate

抓取与核验时点:2026-09-30。

orCaScore 是一台"给冠状动脉钙化评分算法摆擂台"的评测装置。它不采集新影像,而是把四家医院、四种厂商扫描仪采集的 72 例心脏 CT 汇集起来,为"自动识别冠状动脉钙化(CAC)"这件事定义一套标准化的评测协议——从病灶级、血管级一直算到患者级的心血管风险分类——并在 2014 年 MICCAI 波士顿 workshop 上正式发起挑战,让一批(半)自动方法第一次在同一张考卷上被独立横评。它的核心贡献不是数据量(72 例在今天看来很小),而是"独立方法比较"这件事本身:在它之前,各家算法各说各的分数,缺乏可比性。

导语读法三则:

  1. 只想搞懂它是什么:直奔 §1 十问十答——注意它是评测框架而非普通数据集,规模只有 72 例。
  2. 要用它做实验:直奔 §6 获取与许可——测试集标注不公开、只走官方在线提交,先看清楚再规划。
  3. 关心评测设计:直奔 §5 与 §8——三级评测(病灶/血管/患者)、五方法的错误模式画像(远端漏检、开口假阳性)是可直接迁移的评测工程经验。

§0 导读:这个数据集解决什么问题

冠状动脉钙化(Coronary Artery Calcification, CAC)是心血管事件的强且独立的预测因子。临床常规里,医生在心脏 CT 上量化钙化量(钙化评分,calcium scoring),据此把患者分入不同的心血管风险类别。问题是:这一步在现实里靠手工识别——逐层找钙化、圈病灶、算 Agatston 分数,极其耗时,在大规模临床试验里根本做不完,日常门诊也不现实。于是学界提出了大量自动/半自动方法,但这些方法从未在规模足够大、来源足够多样的影像集合上被验证过鲁棒性——每个人都用自己的小数据集报分数,横向不可比。

orCaScore 要解决的正是这个"缺一把统一尺子"的问题。它做了三件事:第一,汇集一批多中心、多厂商的心脏 CT(四家医院、四种扫描仪),保证数据来源足够多样;第二,制定一套分层评测协议——病灶级看敏感度/PPV,血管级看 ICC,患者级看风险分类的加权 kappa;第三,在 MICCAI 2014 workshop 上发起公开挑战,让方法在同一协议下被独立评测。

它的历史地位在于"第一个公开标准化的 CAC 评测框架"这一宣称:论文结论明确写出 “A publicly available standardized framework for the evaluation of (semi)automatic methods for CAC identification in cardiac CT is described.”——这是它区别于任何单个 CAC 数据集的地方。对 AI-Ready 语境而言,orCaScore 是一个典型的"框架型数据集":数据规模小、但评测协议设计完整、且有公开的持续性评测入口(Grand Challenge 平台),因此它的价值重心落在"评测可复现性"而非"训练数据量"上。

§0 读法三则:

  1. 条目是"评测框架 + 小数据集"的合体:读数据规模时别失望(72 例),真正要看的是评测协议(§5)与五方法横评(§3/§7)。
  2. 全文硬数字均出自官方站 Data 页与 Medical Physics 2016 论文;两者对核心规模(72/32/40、四院四厂商、130 HU、6-connectivity)完全一致。
  3. 检索时若把 “orCaScore” 记成 “ORCAS”,会撞上微软的无关点击日志数据集(坑 1)——两者毫无关系。

§1 数据集速览:十问十答

Q1:orCaScore 是什么?是数据集还是挑战赛?
它是评测框架(evaluation framework),同时也是 datasets+challenge:把多中心心脏 CT 汇集起来、定义标准化评测协议、并在 MICCAI 2014 workshop 上发起方法对比挑战。官方站称 “This evaluation framework was launched at a MICCAI 2014 workshop in Boston, USA”。

Q2:一共多少例?怎么划分?
72 例患者,划分为 32 例训练 + 40 例测试。训练集提供参考标准标注,测试集标注不公开(只经官方在线协议评测)。

Q3:每例包含什么影像?
每例含两幅:1 幅非增强 ECG 触发的心脏钙化评分 CT(CSCT)+ 1 幅配对的冠状动脉 CT 血管造影(CCTA)。CSCT 是主任务对象(因为不加对比剂也能做钙化评分),CCTA 作为补充信息。

Q4:数据从哪来、多样性如何?
来自四家不同医院、使用四种不同厂商的 CT 扫描仪(官方站 Data 页原文:four different CT scanners from four different vendors in four different hospitals)。这种多中心多厂商设计正是为了考验算法对不同设备的鲁棒性。

Q5:参考标注是怎么做的?
两名专家独立标注所有非增强 CT:按商业厂商标准协议高亮 >130 HU 的体素,用 3-D 6-connectivity 识别单个病灶,手工标注血管归属(LAD/LCX/RCA;左主干钙化归为 LAD),标注图中编码 1=LAD、2=LCX、3=RCA。专家意见不一致的病灶重新呈现并共识复核,共识结果即参考标准。

Q6:评测分成哪些层级?
三级:病灶级(per lesion,看 sensitivity 与 PPV)→ 血管级(per artery,看血管归属正确率与 ICC)→ 患者级(per patient,看总钙化量与心血管风险分类的加权 kappa/accuracy)。

Q7:最终评了多少个方法?结果如何?
五个(半)自动方法(4 个用 CSCT+CCTA,1 个只用 CSCT)。病灶检出率 52%–94%、PPV 65%–96%、血管归属正确率 88%–98%、患者风险分类线性加权 Cohen’s kappa 0.80–1.00。

Q8:最容易出错的地方在哪?
远端冠状动脉的病灶最常被漏检;冠状动脉开口(coronary ostia)附近的主动脉钙化是最常见的假阳性来源。但这些歧义位置对最终风险判定影响有限。

Q9:现在还能参加吗?
官方站(2026-09-30 抓取)显示:“As of August 2025, this challenge is closed for new registrations.”——2025 年 8 月起停止新注册,已注册参与者仍可提交结果。

Q10:它为什么对 AI-Ready 重要?
它是"框架型数据集"的典型样本:数据量小,但评测协议完整、普适、可复现,且有公开的持续评测入口。它的 AI-Ready 短板也极具教学意义——官方站未声明规范化开源许可,这一缺位直接限制了数据的合法复用(§6)。

§2 数据构成与规格

2.1 规模与划分

项 数值
患者/检查总数 72
训练集 32(附参考标准标注)
测试集 40(标注不公开,官方在线评测)
每例影像 CSCT + CCTA 共 2 幅
医院数 4
扫描仪厂商数 4(4 台不同厂商扫描仪)
心血管风险类别 4 类(four CVD risk categories)

相比现代大规模数据集,72 例的规模确实小。理解它的定位很关键:orCaScore 不是拿来训练大模型的,而是拿来当"标准化擂台"的——规模小反而是刻意的:它要求每个方法都在同一批、来源多样但数量可控的影像上被评估,以保证评测的公平性与可复现性。论文摘要的诉求是"independent evaluation"(独立评测),而非"largest dataset"。

2.2 患者分布:四类心血管风险分层

论文摘要明确说明,72 例患者分布于四个心血管疾病(CVD)风险类别。这意味着数据集在风险谱上是分层的——从零钙化/低风险到高钙化/高风险都有代表。这一点对评测很重要:如果测试集全是零钙化患者,任何"预测无钙化"的懒惰算法都能得高分;分层设计使风险分类指标(加权 kappa)具有实际区分力。

(各风险类别的确切患者数在论文正文/补充材料中,官方站未列——见坑 4 与 §10 待核。)

2.3 成像与文件规格

属性 规格
模态 非增强 ECG 触发钙化评分 CT(CSCT)+ 增强 CTA(CCTA)
采集方式 标准临床钙化评分参数
设备 四厂商四种扫描仪(名称未披露)
层厚/层距 2.5–3 mm(二次文献口径)
平面内分辨率 0.4–0.5 mm(二次文献口径)
文件格式 mhd + zraw(MetaImage 格式)
读取工具 ITK / SimpleITK 直接可读

MetaImage(.mhd 头 + .zraw 原始数据)是医学影像领域经典格式,ITK/SimpleITK 原生支持,因此互操作性良好——这一点在 DAIMS 的 I(互操作)维度上是加分项。文件命名上,二次加工镜像(GitHub Coronary_Calcium)记录了 TR/TE/VA 字段、V 厂商号、CTAI/CTI/R 等后缀用于区分增强/非增强与标注文件(见坑 7)。

2.4 标注规格与参考标准

参考标准的产生流程(官方站 Data 页原文分步):

  1. 两名专家独立标注所有非增强 CT 图像;
  2. 按商业厂商标准协议,高亮强度 >130 HU 的体素;
  3. 用 3-D 6-connectivity 识别单个独立病灶;
  4. 手工标注每个钙化所属血管:LAD / LCX / RCA;
  5. 左主干的钙化标注为 LAD 钙化;
  6. 参考标注图中钙化编码:1 = LAD,2 = LCX,3 = RCA;
  7. 专家意见分歧的病灶再次呈现、共识(consensus)解决,形成最终参考标准。

这套流程的设计要点有两个:一是双专家独立标注 + 共识复核,用观察者间分歧的显式处理来逼近"金标准";二是阈值 + 连通性的机械规则(>130 HU、6-connectivity),保证病灶定义客观可复现。130 HU 是钙化评分的临床标准阈值(Agatston 原始方法即采用),6-connectivity 则是三维体素邻域的最保守连通定义。

2.5 训练集候选病灶分布(二次文献口径)

orCaScore 测试集不公开,因此没有公开的测试集病灶分布;训练集分布由独立二次文献(Wolterink 组参与的另一篇 Medical Physics 论文 mp.15870,Table 1)给出:

集合 扫描数 LAD LCX RCA 其他钙化 候选病灶/扫描
orCaScore Training 32 103 21 56 138k 3454
orCaScore Test 40 – – – – –(不公开)

其中"候选病灶"定义:连通 3-D 体素(6-connectivity)且强度 > 130 HU;包含冠脉钙化(LAD/LCX/RCA)与其他钙化结构(骨、冠脉外钙化,记作 OTHER_CAC)。可以看到训练集里 LAD 病灶最多(103)、LCX 最少(21)、RCA 居中(56)——这与临床解剖分布一致(LAD 供血范围最广、钙化最常累及)。同时,139k 级的候选病灶里绝大多数是非冠脉的骨与冠脉外钙化,这解释了为什么"把主动脉/骨骼钙化误判为冠脉钙化"是最主要的假阳性来源(§3/§7)。

2.6 与相关队列的规模对照

同一二次文献 Table 1 列出三个可比的钙化评分队列,便于理解 orCaScore 的定位:

数据集 扫描数 性质
DISCHARGE Training 140 大型 RCT 队列(CSCT+CCTA 双标注)
DISCHARGE Test 1047 大型 RCT 队列测试
DISCHARGE Validation 75 大型 RCT 队列验证
orCaScore Training 32 本条目训练集
orCaScore Test 40 本条目测试集(不公开)
CADMAN Test 156 单中心 RCT(CAD-Man),仅 CAC 标注

对照一目了然:orCaScore 是这一族里规模最小但评测协议最正式的一个——DISCHARGE(1047 测试)与 CADMAN(156)规模都更大,但它们的评测口径不如 orCaScore 标准化。这正是"框架"与"队列"的分野:队列提供数据量,框架提供可比性。

§3 挑战任务与结果:五个方法的横评画像

3.1 任务定义

挑战的核心任务:在非增强 ECG 触发心脏 CT(CSCT)中自动识别冠状动脉钙化。为了让方法有更多可用信息,官方同时提供了配对的 CCTA 图像——因此方法分成两派:4 个方法用 CSCT+CCTA 双模态,1 个方法只用 CSCT(论文 Results 原文)。这本身构成一个天然的对照:增强影像到底对钙化识别有没有帮助。

可选任务:团队可以选择进一步标注每个钙化所属的血管(LAD/LCX/RCA)。一旦选择标注血管,评测就增加**血管级(per artery)**维度。这是一个"自愿加码"的设计——不标血管仍可参与病灶级评测,但标了就能拿到更细致的反馈。

3.2 三级评测协议

层级 评测对象 指标
病灶级 单个钙化病灶的检出 sensitivity(敏感度)、PPV(阳性预测值)
血管级 病灶所属血管的正确性 血管归属正确率、ICC(LAD/LCX/RCA/patient)
患者级 每患者总钙化量与风险分类 F-1(Volume)、ICC(Volume/Agatston)、风险分类 kappa/accuracy

这个"病灶 → 血管 → 患者"的逐级聚合设计是 orCaScore 评测思想的核心:一个方法可能在病灶检出上表现一般,但在患者级风险分类上仍然够用——因为个体病灶的漏检/误检未必改变患者的总体风险归属。论文结论正是这个意思:“CAC lesions at ambiguous locations such as the coronary ostia remain challenging, but their detection had limited impact on CVD risk determination.”

3.3 五方法横评结果

指标 取值范围
病灶检出率(sensitivity) 52% – 94%
阳性预测值(PPV) 65% – 96%
血管归属正确率 88% – 98%
患者风险分类线性加权 Cohen’s kappa 0.80 – 1.00

四个观察:

  1. 检出率的跨度极大(52%–94%,相差 42 个百分点):说明当时自动 CAC 方法的能力参差不齐,"独立横评"的价值正在于暴露这种差距——此前各家自己的论文里不会出现这种对比。
  2. PPV 区间(65%–96%)整体高于检出率下限:多数方法的瓶颈在**漏检(sensitivity)**而非误检(PPV),这与后文的"远端病灶最常漏检"的结论一致。
  3. 血管归属正确率(88%–98%)很高:说明"给定一个已检出的病灶,判断它属于哪条血管"比"发现病灶"本身容易得多——血管归属是相对成熟的能力。
  4. 风险分类 kappa 0.80–1.00 很高:即使病灶级检出只有 52%–94%,患者级风险分类仍能达到 0.80 以上的线性加权 kappa——再次印证聚合设计的稳健性,也支撑了论文"automatic per patient CVD risk categorization is feasible"的结论。

3.4 错误模式画像

论文明确了两类系统性错误:

  • 漏检(false negative):远端冠状动脉的病灶最常被漏(“Lesions in distal coronary arteries were most commonly missed”)——远端血管细小、钙化灶小、部分容积效应重,是检出困难区。
  • 误检(false positive):靠近冠状动脉开口(coronary ostia)的主动脉钙化是最常见的假阳性(“aortic calcifications close to the coronary ostia were the most common false positive errors”)——开口处主动脉壁与冠脉起始段的解剖邻接,让算法难以区分血管壁钙化与冠脉钙化。

这两类错误对应于 §2.5 的候选病灶构成:139k 候选里绝大多数是骨与冠脉外钙化,算法必须在其中"挑出"真正的冠脉钙化,因此开口处的主动脉钙化是近邻干扰的天然陷阱。

3.5 关键结论

论文的核心结论有两句:一是"描述了首个公开标准化的 (半)自动 CAC 识别评测框架";二是"在此框架下评测五个方法表明,自动的患者级 CVD 风险分类是可行的(feasible)“。也就是说,这个挑战的结论不是"某方法最好”,而是"整类方法在患者风险分层的目标下已经够用"——这是一个领域级可行性判断,比单方法排名更有分量。

§4 挑战的设计哲学:为什么"评测框架"比"数据集"更重要

4.1 从"各报各分"到"同一张考卷"

在 orCaScore 出现之前,CAC 自动检测领域有一个结构性问题:每个研究组都在自己的私有数据上报性能。数据集不同、参考标准不同、评测指标不同——结果就是论文里的分数彼此不可比,也无法判断"到底哪类方法更靠谱"。这不是能力问题,而是度量学(measurement)问题:缺一把公认的尺子。

orCaScore 的贡献是把"尺子"造了出来。它把评测拆成上游(数据+参考标准)与下游(协议+平台)两部分:上游汇集多中心多厂商 CT 并以双专家共识建立参考标准,下游定义分层指标并托管在 Grand Challenge 上做可复现的在线评测。任何方法只要遵守协议、提交结果,就能进入同一张对照表。这是"benchmark"这个词的原始含义——不是数据集的规模,而是可比的度量基准。

4.2 三级评测的设计逻辑

为什么是"病灶级 + 血管级 + 患者级"三级,而不是只报一个数?因为不同下游需求关心不同层级:

关心的人 关心层级 为什么
算法研究者 病灶级(sensitivity/PPV) 想知道检测器的精度上限与错误类型
解剖/影像研究者 血管级(ICC/归属) 想知道能否按血管分别定量(LAD vs RCA 风险不同)
临床决策 患者级(风险分类 kappa) 只关心患者被分到哪个风险类别,不关心具体病灶

三级聚合在数学上是"粗化"(coarsening):从病灶 → 血管 → 患者,粒度递减、对局部错误的容忍度递增。这就解释了为什么病灶级 52% 检出的方法,患者级仍能有 0.80 的 kappa——因为上层聚合平滑了下层的个别错误。orCaScore 把这个结构显式化,让使用者能按需选取合适的层级,而不是被单一数字误导。

4.3 风险分类为什么用加权 kappa

患者级风险分类是有序多分类(四类风险从低到高)。对这种目标,普通准确率(accuracy)会犯一个错误:把"高风险误判为极高风险"与"高风险误判为低风险"当成同样的错误。而临床上一个"相邻类别"的错分远比"跨三个类别"的错分危害小。

因此 orCaScore 采用 linearly weighted Cohen’s kappa(线性加权)——按类别距离线性惩罚偏差。这就是论文里 kappa 能达到 0.80–1.00 的原因之一:即便有错分,也大多是相邻类别的小偏差。排行榜同时保留 Accuracy(Risk),让两种口径互相参照(见坑 5 关于指标读法的提示)。

4.4 多中心多厂商:鲁棒性的来源

“四家医院、四种厂商"不是凑数,而是刻意制造的分布偏移。不同厂商的 CT 在重建核(reconstruction kernel)、噪声特性、空间分辨率上都有差异;不同医院的采集协议(管电压、层厚、ECG 门控方式)也不同。一台只在单一厂商数据上表现好的算法,在多厂商集合上会暴露出脆弱性——这正是"robustness in large and diverse sets of images"这一挑战动机的落点。官方站的 Purpose 段原文点明:这些算法"have not been evaluated for robustness in large and diverse sets of images”,orCaScore 就是要填补这个空白。

4.5 框架的边界:它不解决什么

诚实地界定边界同样重要。orCaScore 不解决以下问题:

  1. 不提供大规模训练数据——72 例(32 可训练)不足以训练现代深度学习模型,它是评测集不是训练集。
  2. 不做纵向风险预测——它以"当前钙化量→风险类别"为终点,不涉及随时间的事件预测。
  3. 不覆盖非钙化斑块——只针对钙化(>130 HU),软斑块、混合斑块不在任务范围内。
  4. 不保证许可清晰——官方站未声明规范化许可,这是它作为"可复用资产"的硬伤(§6)。

理解这四条边界,才能正确定位 orCaScore:它是评测基础设施,不是数据供给源。

§5 评测指标详解:从病灶到患者的每一把尺子

5.1 病灶级指标

病灶级评测回答:"这个算法找钙化找得准不准?"两个标准指标:

  • sensitivity(敏感度 / 召回率) = 正确检出的病灶数 / 参考标准病灶总数。低敏感度意味着漏检。orCaScore 里五方法为 52%–94%。
  • PPV(阳性预测值 / 精确率) = 正确检出的病灶数 / 算法报告的全部病灶数。低 PPV 意味着误检。orCaScore 里五方法为 65%–96%。

这两个指标天然互相拉扯:调低检测阈值可以提高敏感度但会引入更多误检(降低 PPV),反之亦然。单独报一个是不完整的——必须成对报,才能刻画方法的操作点(operating point)。orCaScore 的横评同时给出两者,正是为了暴露"高敏感度是否靠牺牲 PPV 换来"。

5.2 病灶匹配的判定规则

"什么样才算检出对了?"这需要先定义病灶的匹配规则。orCaScore 沿用钙化评分的标准做法:连通体素组(3-D 6-connectivity)+ 强度阈值(>130 HU)定义候选病灶,再按空间重叠判定算法预测与参考标准是否匹配。部分二次文献进一步以最小体积 1.5 mm³ 定义有效钙化病灶(来源 mp.15870 §2.1.2),过滤掉体素级的噪声小团。

这套规则的关键是"客观可复现":130 HU 是 Agatston 方法的临床标准阈值,6-connectivity 是最保守的三维连通定义(只认面相邻,不认棱/角相邻)。采用机械规则而非人工判断"算不算一个病灶",才可能让不同方法在同一个判定下被比较。

5.3 体积与 F-1(Volume)

除了"数病灶",还要评"算体积/算分数"。F-1(Volume) 是由精确率与召回率合成的体积一致性指标:

F1 = 2 × (precision × recall) / (precision + recall)

相比单纯的检出率,F-1 同时惩罚漏检与误检,适合刻画"病灶总体积估计得准不准"。排行榜里的 F-1 (Volume) 列就是这一维度(见坑 5:排行榜数值未公开抓取)。

5.4 血管级 ICC

对选择了标注血管的方法,评测按血管分别计算 ICC(Intraclass Correlation Coefficient,组内相关系数)——衡量算法估计的血管级钙化量与参考标准的一致性。orCaScore 排行榜对 LAD / LCX / RCA / patient 四个对象分别报 ICC,且每种都分 Volume(体积) 与 Agatston(Agatston 分数) 两个口径。

为什么血管级要用 ICC 而非简单的相关?因为 ICC 同时惩罚系统性偏差(整体高估/低估)与随机误差,比 Pearson 相关系数更能反映"估计值是否可替代参考标准"。四个对象里 LAD 的 ICC 通常最高(病灶多、体积大、易定量),LCX 最低(病灶少而小、解剖变异大)——这与 §2.5 的病灶分布(LCX 仅 21 个)相印证。

5.5 患者级:Agatston 与 Volume

患者级要评"每患者总钙化量算得准不准"。这里有两种钙化量口径:

  • Agatston 分数:临床金标准。对每个钙化灶,按峰值密度加权(130–199 HU 权重 1,200–299 权重 2,300–399 权重 3,≥400 权重 4)再乘以面积。
  • Volume(体积):直接累加钙化体素的物理体积(mm³)。

两者相关但不相等:Agatston 是密度加权,会放大高密度钙化的贡献;Volume 是纯体积。orCaScore 排行榜对两者都报 ICC,使用者可按需比较。注意:Agatston 分数是临床报告里直接使用的数字(医生据此分风险),因此患者级 Agatston 的一致性往往是临床最关心的。

5.6 风险分类:kappa 与 accuracy

患者级的最终临床终点是心血管风险类别归属。orCaScore 采用的四类风险分层与经典 CAC 评分一致:

风险类别 Agatston 分数范围 临床含义
I 0 无钙化
II 1–100 轻度钙化
III 101–300 中度钙化
IV > 300 重度钙化

评测用 linearly weighted Cohen’s kappa(线性加权一致性)与 Accuracy(Risk)(分类准确率)两个指标。加权 kappa 0.80–1.00 意味着算法给出的风险类别与参考标准高度一致(允许相邻类别的小偏差)。这是 orCaScore 横评最重要的一条结论——自动风险分类可行。

5.7 指标速查表

层级 指标 口径/单位 orCaScore 观测范围
病灶级 sensitivity 正确检出/参考标准病灶数 52%–94%
病灶级 PPV 正确检出/算法报告病灶数 65%–96%
体积 F-1(Volume) 精确率与召回率调和平均 (排行榜列,数值未公开)
血管级 ICC LAD/LCX/RCA/patient × Volume/Agatston (排行榜列)
血管级 归属正确率 正确血管归属的检出病灶比例 88%–98%
患者级 风险分类加权 kappa 线性加权,四类有序 0.80–1.00
患者级 Accuracy(Risk) 分类准确率 (排行榜列)

§6 获取与许可:一个"许可缺位"的案例

6.1 许可状态(本条目最大缺陷)

orCaScore 在 Grand Challenge 平台托管,以注册/参赛制提供:研究者需注册参加 challenge,通过后才可取得训练数据。官方站未声明规范化开源许可(如 CC BY、CC0、MIT 等 SPDX 许可)——没有出现任何 license 段落或条款文字。这是一个明确的 AI-Ready 失分项:

  • 使用者无法从公开页面确知"这个数据能不能再分发、能不能商用、要不要署名";
  • 二次文献(mp.15870)明确写 “the orCaScore test set is not public”,即测试集连获取都不开放;
  • 第三方镜像(GitHub zhilothebest/Coronary_Calcium)以"因许可协议"为由不公开分发原始数据——这侧面印证了许可边界的模糊。

(对照库内 panda-plus 条目的三层明确许可,"许可缺位"正是 orCaScore 最具教学意义的短板,见坑 3。)

6.2 获取路径

资产 入口 状态
训练集(32 例 + 标注) Grand Challenge 注册参赛 2025-08 起关闭新注册
测试集(40 例) 仅经官方在线提交协议评测 标注不公开
参考论文 doi:10.1118/1.4945696 付费(Wiley/AAPM);机构库副本见 §9

关键提示:即使成功注册,得到的也是训练集的标注;测试集的参考标准任何人拿不到——只能把算法输出提交给官方平台来获得测试分数。这是"封闭测试集"的经典设计,保证了排行榜不被刷分,但代价是第三方无法本地复现测试结果。

6.3 "关停"状态的现实影响

2025 年 8 月起关闭新注册,意味着新研究者已无法通过正常渠道获取数据。已注册的参与者仍可提交结果,但社区整体的可及性正在收缩。对 AI-Ready 语境的含义:

  • 可发现性:官方站与论文仍可被索引,元数据可访问性保持。
  • 可获取性:新用户实质受阻;数据正在向"历史存档"演变。
  • 可持续性:Grand Challenge 平台作为托管方是稳定的,但挑战本身进入维护/冻结期。

这提示一个普遍问题:挑战赛型数据的生命周期——热度期集中供给,之后若不转入常青的公开直链(如 Zenodo/HF),就会逐渐失去可获取性。orCaScore 目前处于"未归档、未开放、未授权"的三重不确定状态。

6.4 文件格式与互操作性

好消息是格式层面没有障碍:mhd/zraw(MetaImage) 是 ITK 生态的标准格式,SimpleITK/ITK 一句 sitk.ReadImage() 即可读入。因此一旦解决"能不能合法拿到"的问题,技术上的接入成本极低。这也是 DAIMS 中 I(互操作)维度给分较高、而 A(可获取)维度失分的原因——技术开放与法律开放是两回事。

§7 在心脏影像评测生态中的位置

7.1 与相关队列/数据集的对照

数据集 年份 规模 定位 与 orCaScore 的关系
orCaScore 2016(框架论文) 72(32+40) CAC 评测框架+数据集 本条目
DISCHARGE 2015–(试验) 140+1047+75 大型 RCT 心脏 CT 队列 orCaScore 的"放大版战友",规模更大但评测口径非标准化
CADMAN(CAD-Man) — 156 单中心 RCT,仅 CAC 标注 常被用作 orCaScore 之外的附加测试集
CT-RATE(库内 546) 2024 25,692 卷 CT 胸部 CT-报告多模态 现代大规模胸部 CT,规模不可同日而语
MM-WHS(库内 770) 2017 120 全心分割挑战赛 同为心脏影像挑战赛,任务为结构分割而非钙化检测

orCaScore 的独特位置:规模最小、但评测协议最正式。它是"如何把一堆小数据变成一把公认尺子"的范例——这与"如何把海量数据做成一个大训练集"是两种完全不同的工程。

7.2 在 CAC 方法史上的位置

从论文的参考文献可以看出 orCaScore 的坐标系:它站在一批 CAC 自动检测前作的肩膀上——Shahzad 等 2013(Vessel Specific Coronary Artery Calcium Scoring,自动系统)、Saur 等 2008(Automatic Detection of Calcified Coronary Plaques in CT)、Mittal 等(Fast automatic detection of calcified coronary lesions in 3D cardiac CT)。这些论文各自提出方法、各自报分;orCaScore 第一次把它们(及后续方法)放到同一评测框架下横向比较。因此它在方法史上是一个从"提出方法"到"系统评测"的转折点。

7.3 作为"二次基准"被反复复用

orCaScore 的持久影响力体现在它被后续研究当作基准/测试平台反复使用:

  • 多任务主动学习(Medical Physics, doi:10.1002/mp.15870):把 orCaScore 列为三个数据集之一(DISCHARGE/orCaScore/CADMAN),使用其训练集的病灶分布做方法研发。
  • 小病灶分割(arXiv:2502.8675v1,GRCSF):把 orCaScore 当作小病灶分割基准,把 32 例训练再划分为 26 训练 / 5 验证 / 1 测试,并提交官方 40 例测试。
  • 血管标注基准(Artery Labeling on orCaScore benchmark):把 orCaScore 用于冠状/肝血管标注重标任务,report 87.13 的召回。

这种"被反复当作二次基准"的现象,恰是"框架型数据集"成功与否的试金石——数据量不唬人,但大家都在用它的协议对标。

7.4 与库内心脏影像条目的关系

库内条目 rid 关系
mm-whs 770 多模态全心分割挑战赛(120 例 3D 心脏 CT/MRI)——同为 MICCAI 谱系的心脏挑战赛,任务互补(结构分割 vs 钙化检测)
cardiac-atlas-project 521 心脏统计图谱开源库——心脏影像统计建模生态的对照组
heart-lung-segmentations-data 610 心肺手工分割金标准——同为手工标注的胸部影像对照
chest-ct-sepsis-er 600 脓毒症急诊胸部 CT 队列——临床胸部 CT 队列
cardiac-implantable-device-cxr 599 心内植入装置胸片分割——心血管影像 AI 邻域
ct-rate 546 胸部 CT-报告多模态——现代大规模胸部 CT 对照
abdomenct-1k 402 千例腹部 CT 多器官分割——CT 分割大规模板

orCaScore 与 mm-whs(770)的关系最紧密:两者都是 MICCAI 系心脏挑战赛,一个测钙化检测、一个测全心分割。检索心脏影像挑战赛时,二者应互相提示。

§8 方法学启示:框架型数据集的五条经验

8.1 先定义尺子,再收集数据

orCaScore 最重要的经验是评测协议优先。它先想清楚"要评什么、怎么评、怎么算分",再去组织数据与参考标准。相比之下,许多数据集是先攒数据、后拼指标,结果指标随论文漂移、无法跨研究比较。orCaScore 的协议(三级评测 + 130HU/6-connectivity + 加权 kappa)自 2014 定下后保持稳定,这正是它能当"尺子"的前提。

8.2 分层评测优于单一分数

三级评测(病灶/血管/患者)让不同需求的人各取所需,避免了"一个数字掩盖所有信息"。这是一条可直接迁移的设计原则:任何复杂任务的评测都应分层,从细粒度(暴露算法细节)到粗粒度(反映临床/业务终点),并显式说明层间聚合关系。

8.3 封闭测试集是公平性与可复现性的取舍

orCaScore 选择不公开测试集标注,只允许在线提交——这保证了排行榜的公平(无人能预先调参拟合测试集),但牺牲了第三方的本地可复现性。这一取舍在挑战赛设计中普遍存在;库内可对照的是各类采用"封闭测试+在线提交"的挑战赛。经验是:封闭测试集必须配套长期稳定的提交平台,否则一旦平台关停,评测能力随之消失(orCaScore 2025 关停新注册即是警示)。

8.4 多中心多厂商是鲁棒性评测的最低配置

单一机构单一厂商的数据无法暴露跨设备脆弱性。orCaScore 的"四院四厂商"虽然只有 4,但已是"多样性"的最低配置。现代数据集应向更高多样性发展,但 orCaScore 的原则(刻意制造分布偏移来测试泛化)是不过时的。

8.5 许可与元数据应当与数据同等重要

orCaScore 的最大教训恰恰是反面:数据再好,许可不清就等于可复用性残缺。官方站有完整的任务描述、标注协议、论文链接(元数据质量高),却独缺一段 license——这一个缺失,就让 A(可获取性)维度从"良好"跌到"存疑"。对新一代数据集的直接启示:在发布数据的同时,必须用 SPDX 标识符明确声明许可(如 CC BY 4.0),并写清再分发与商用边界。这正是 AI-Ready 检查单把"许可明确性"列为必查项的原因。

§9 逐层解剖:从 Agatston 到风险类别的临床链条

9.1 钙化评分是什么:一条四步链条

要理解 orCaScore 评的是什么,得先看清临床钙化评分的完整链条:

心脏 CT(非增强 ECG 触发)
   ↓ ① 阈值分割:>130 HU 的体素高亮
   ↓ ② 病灶识别:3-D 6-connectivity 连通体素组
   ↓ ③ 血管归属:LAD / LCX / RCA(左主干归 LAD)
   ↓ ④ 定量:Agatston 分数(密度加权面积)与 Volume(体积)
   ↓ ⑤ 分层:按 Agatston 总量映射到 CVD 风险类别 I–IV
临床决策:风险类别→是否启动他汀/进一步检查

orCaScore 的三级评测正好对应这条链条的不同位置:病灶级评① ②、血管级评③、患者级评④ ⑤。因此它不是抽象的游戏,而是对真实临床工作流的逐环节拆解。任何一个环节的误差都会向下游传导,但传导强度递减——这就是为什么患者级 kappa 仍能很高。

9.2 Agatston 分数:为什么按密度分级加权

Agatston 分数的定义(Agatston 1990 原始方法)是:

Agatston = Σ (每病灶的面积 × 密度权重)
密度权重:130–199 HU → 1;200–299 → 2;300–399 → 3;≥400 → 4
面积按最大密度阈值确定,权重按病灶内峰值密度确定

为什么要做密度加权?因为钙化的密度与心血管风险正相关——高密度钙化(致密、稳定斑块)与低密度钙化(松散、进展性斑块)的临床含义不同。简单的体积加总(Volume)会忽略这个差异,所以临床金标准用 Agatston 而非纯体积。这也是 orCaScore 排行榜同时报 Volume 与 Agatston 两套 ICC 的原因——两套口径各自回答不同问题。

9.3 风险类别阈值:为什么是 0 / 100 / 300

风险四分类的阈值(0 / 1–100 / 101–300 / >300)来自大规模流行病学研究的经验切分。它们不是任意数字,而是与心血管事件发生率对应的风险分层:

类别 Agatston 风险解读 常见临床动作
I(0) 0 无可测钙化 通常无需药物干预
II(1–100) 轻度 低-中危 结合其他危险因素评估
III(101–300) 中度 中危 考虑强化危险因素管理
IV(>300) 重度 高危 常建议积极干预

orCaScore 的 72 例患者分布于这四类(论文摘要原文"distributed over four CVD risk categories"),确保评测覆盖全风险谱。对评测设计者而言,这是一个重要提示:风险分层数据集的采样必须覆盖所有类别,否则风险分类指标失真。

9.4 为什么 130 HU 是"钙化"的界限

130 HU(Hounsfield Unit,CT 值单位)是 Agatston 方法沿用的钙化阈值,也是 orCaScore 采用的标准。它的物理含义:CT 值高于 130 HU 的组织密度显著高于血液与软斑块,代表矿化。低于此值的结构(软斑块、纤维、心肌)不判为钙化。选择 130 HU 而非其他数值,是为了与临床金标准对齐——研究者用同一阈值,才能与临床 Agatston 分数直接比较。orCaScore 沿用该阈值,保证了"算法结果"与"临床参考"的同一尺度。

9.5 6-connectivity:为什么要最保守的连通定义

三维体素邻域有三种连通定义:6-连通(只认 6 个面相邻)、18-连通(面 + 12 个棱相邻)、26-连通(面 + 棱 + 8 个角相邻)。orCaScore 采用最保守的 6-connectivity。原因:钙化灶在 CT 里可能因为部分容积效应变成"若即若离"的体素团;用宽松的 26-连通会把本属不同病灶、只是偶尔棱角相触的钙化合并成一个,导致病灶计数与体积失真。6-连通要求"面贴面"才合并,最大化病灶的独立性——这与"病灶级 sensitivity/PPV 要求病灶边界清晰"的评测需求一致。

9.6 血管归属:LAD / LCX / RCA 的临床分量

三条主要冠状动脉的风险含义不同,因此 orCaScore 把血管归属做成可选任务:

  • LAD(Left Anterior Descending,左前降支):供血范围最广(左室前壁、室间隔前部),钙化最常累及,预后意义最重。orCaScore 训练集里 LAD 病灶最多(103)。
  • LCX(Left Circumflex,左回旋支):供血左室侧壁,钙化相对少(训练集 21)。
  • RCA(Right Coronary Artery,右冠状动脉):供血右心室与下壁,钙化居中(训练集 56)。

左主干(LM)的处理:左主干是 LAD 与 LCX 的分叉前主干,解剖短、位置特殊。orCaScore 明确把左主干钙化归入 LAD——这是领域惯例(避免单独一类的稀疏标注),但对使用者是一个必须知道的规则:算法若把左主干钙化单独归为一类,会与参考标准口径不符。

9.7 病灶分布的非对称与评测难点

§2.5 的训练集分布(LAD 103 / LCX 21 / RCA 56)揭示了评测的一个内在难点:三血管的样本量高度不均衡。LAD 病灶是 LCX 的近 5 倍。这意味着血管级 ICC 在 LCX 上最不稳定(样本少)、在 LAD 上最可靠(样本多)。评测报告若只给"平均 ICC"而不分血管,就会掩盖这个不均衡。orCaScore 排行榜对 LAD/LCX/RCA 分别报 ICC,正是对这一问题的设计回应——这也是它评测协议细致的一个体现。

9.8 从实验室到临床:orCaScore 结论的临床含义

orCaScore 的横评给出了一个对临床有直接意义的判断:自动 CAC 评分达到患者级风险分类可行(feasible)。其含义是——即便病灶级检出只有 52%–94%,下游的风险分层仍能达到 0.80+ 的加权 kappa。这对临床部署的启示是:不必追求病灶级的完美检测,只要风险分类够准,自动化就有价值。当然,前提是"漏检/误检不系统性地偏向某一风险类别"——orCaScore 的错误模式分析(远端漏检、开口假阳性)显示这些错误大体是局部的、不改变风险归属的,这正是"feasible"结论的证据基础。

§10 避坑清单:七个已踩过的坑

坑 1:"ORCAS"不是 orCaScore。检索 “orcas” 会大量命中微软的 ORCAS 点击日志数据集(MS MARCO 关联,信息检索领域),与冠状动脉钙化毫无关系。orCaScore 是心脏 CT 钙化评分的专名,首字母大写 C、中间无连字符。精确检索请用 “orCaScore” 并核对 grand-challenge.org 域名。

坑 2:官方站路径大小写敏感。https://orcascore.grand-challenge.org/data/(小写 d)返回 Not Found;正确路径是 https://orcascore.grand-challenge.org/Data/(大写 D)。抓取脚本若忽略大小写会误判"数据页不存在"。同类:/Home/。这一 Gemini 级细节常被爬虫忽略,导致元数据抓取失败。

坑 3:许可缺位——不能假设它是开放许可。官方站未声明任何规范化许可(无 CC、无 SPDX 标识)。第三方 GitHub 镜像明确因"许可协议"而不分发原始数据。因此不能把它当作开放数据集引用;再分发与商用前必须向官方/UMC Utrecht 书面确认。这是本条目最大 AI-Ready 缺陷。

坑 4:医院名与厂商名官方未披露。官方站只说 “four different hospitals”、“four different CT scanners from four different vendors”,未列具体名称与型号。检索本条目时不要凭印象填写具体厂商(如 Siemens/GE/Philips/Toshiba)——历史教训:凭印象必错。四个厂商的存在是事实,身份是未知。

坑 5:排行榜数值未公开抓取。Grand Challenge 排行榜页面需 JavaScript 渲染,静态抓取(WebFetch)返回空表 “Loading…”。因此本条目只登记了排行榜的列名(F-1(Volume)/Sens/PPV/ICC/Accuracy/Kappa 等),未登记具体团队与数值。要获取排行榜请用真实浏览器访问。

坑 6:测试集标注不公开。40 例测试集的参考标注任何人拿不到,只能把预测提交官方平台获取得分。因此无法本地复现测试指标——二次文献(mp.15870)明确 “the orCaScore test set is not public”。规划实验时若以为能下载测试标注,会彻底落空。

坑 7:命名规范与文件后缀易混淆。二次加工镜像(GitHub zhilothebest/Coronary_Calcium)记录了 orCA Score 的命名规范:TR/TE/VA 字段、V 厂商号、CTAI/CTI/R 等文件后缀用于区分增强/非增强与标注。注意其中 “orCA Score” 的写法(C、A 大写)与官方 “orCaScore” 不完全一致——检索时两者都要试,勿因大小写差异漏掉资料。

§11 总结

11.1 三句话总结

  1. orCaScore 是第一个公开标准化的自动冠状动脉钙化评分评测框架(MICCAI 2014 发起),用 72 例多中心多厂商心脏 CT 把 CAC 检测方法第一次放到同一张考卷上横评。
  2. 它的评测协议(病灶/血管/患者三级 + 130HU/6-connectivity + 加权 kappa)证明了自动患者级 CVD 风险分类可行(五方法 kappa 0.80–1.00),尽管病灶级检出仅 52%–94%。
  3. 它的最大短板是许可缺位(官方站无规范化 license)+ 测试集标注不公开 + 2025 年停止新注册——一个"框架一流、可获取性存疑"的典型案例。

11.2 适合谁

  • 心血管影像 AI 研究者:需要标准化评测协议或与历史方法对标的基准。
  • CAC 检测算法开发者:想知道自己的方法相对五个已评测方法的位置。
  • 评测框架设计者:三级评测、封闭测试集、多中心多厂商的设计可直接借鉴。
  • 心脏 CT 数据处理者:了解 mhd/zraw 格式、130HU/6-connectivity 标注口径。

11.3 不适合谁

  • 需要大规模训练数据的深度学习项目(72 例,32 可训练,量级不符)。
  • 需要本地复现测试指标的研究(测试标注不公开)。
  • 要求明确开放许可的商用管线(许可缺位,须另行确认)。
  • 2025 年 8 月之后的新注册者(挑战已关闭新注册)。

11.4 30 秒决策卡

你的情况 行动
想搞懂"什么是 CAC 评测框架" 读本条目 §0/§3/§5
要一个标准化 CAC 评测基线 引论文(doi:10.1118/1.4945696)+ 官方站协议;注意许可(坑 3)
想下载数据做实验 先查 Grand Challenge 注册状态(2025-08 已关闭新注册,坑 6)
要在自己的数据上复现评测 照搬三级协议 + 130HU/6-connectivity(§5/§9),无需官方数据
要引用五方法横评数字 病灶 52%–94%、PPV 65%–96%、血管 88%–98%、kappa 0.80–1.00(§3.3)
要写心脏影像综述 引 §7.1 对照表 + mm-whs(770) 等库内条目

§12 深度对比:orCaScore 与四种"评测型"资产

12.1 四种资产的定位光谱

并非所有"数据集"都以"数据量"取胜。把库内与外部几个代表性资产按"核心价值"排一条光谱:

资产 核心价值 规模 评测协议 许可
orCaScore 评测可比性 72(小) 高度标准化 缺位
DISCHARGE 临床队列规模 1047 测试(大) 非标准化 试验协议
CADMAN 单中心 RCT 数据 156(中) 非标准化 试验协议
CT-RATE(库内 546) 多模态规模 25,692 卷(极大) 非标准化 CC BY-NC-SA
MM-WHS(库内 770) 挑战赛协议 120(中) 挑战赛标准 注册制

orCaScore 在这条光谱上占据**“协议密度最高、数据规模最小”**的一端。这不是缺陷,而是它的自我定位:它要当的是"尺子",不是"矿"。理解这一点,就不会用"才 72 例"来贬低它——因为它的价值恰恰在于让别人的数据/方法能被公平丈量。

12.2 orCaScore vs DISCHARGE:尺子与矿的分工

DISCHARGE(Diagnostic Imaging Strategies for Patients with Stable Chest Pain and Intermediate Risk of Coronary Artery Disease)是一个大型多中心 RCT,其心脏 CT 子队列规模(测试 1047 例)远超 orCaScore。但 DISCHARGE 的评测口径是研究自定的,不提供"任何人都能提交结果"的公开擂台。二者的分工清晰:

  • DISCHARGE 提供矿:数据量支撑现代深度学习训练与统计效力。
  • orCaScore 提供尺:协议支撑跨方法可比与历史对标。

理想实践是两者合用——在 DISCHARGE 这样的大数据上训练,在 orCaScore 这样的标准框架上评测。这正是 orCaScore 被后续论文(mp.15870)当作三个数据集之一并列使用的原因。

12.3 orCaScore vs MM-WHS:心脏挑战赛的两种范式

MM-WHS(库内 rid 770,120 例全心分割挑战赛)与 orCaScore 同属 MICCAI 系心脏挑战赛,但代表了两种范式:

维度 orCaScore MM-WHS
任务性质 检测 + 定量(找钙化、算分数) 分割(勾画结构边界)
评测目标 病灶级检出 + 患者级风险分类 分割重叠度(Dice 等)
难点 局部小灶、开口歧义、跨厂商 结构边界模糊、多模态对齐
共同点 多中心、挑战赛协议、公开擂台 同左

两者不重叠、可互补:一个检索"心脏 CT 挑战赛",二者都应出现,分别指向"定量评测"与"分割评测"两条路。

12.4 orCaScore 的"可迁移三件套"

从 orCaScore 可提取三个可迁移到任何评测项目的设计件:

  1. 分层指标树:把一个临床目标分解成"细粒度→粗粒度"的指标层级(病灶→血管→患者),每层用最合适的指标。
  2. 客观判定规则:用机械阈值(130 HU)+ 拓扑规则(6-connectivity)定义"什么算一个目标",消除人工判断的随意性。
  3. 双专家共识参考标准:用两个独立标注 + 分歧共识来逼近金标准,而不是单专家独断。

这三件套与具体任务无关,任何"检测 + 定量 + 分层"的医学影像评测都可照搬。

12.5 反面教材:许可缺位如何毁掉一个优秀框架

orCaScore 的技术设计堪称范本,但它的许可缺位是一个必须引以为戒的反面教材。一个数据集即使协议完美、格式标准、元数据详尽,只要没有明确许可,它的可复用性就被拦腰截断:

  • 研究者不敢把它的数据放进商用管线(授权不明);
  • 数据无法进入要求许可明确的聚合仓库(如 HF 的 CC 标注体系);
  • 2025 年关闭新注册后,没有许可条款的"冻结数据"实质趋于不可用。

教训一句话:发布数据时,一段 SPDX 许可文字(如 “CC BY 4.0”)的成本几乎为零,但缺失它会让数据的长远价值大打折扣。这是 orCaScore 送给所有数据集发布者的最重要一课。

§13 历史坐标:CAC 自动化二十年的一条时间线

13.1 从手工到自动的动机

冠状动脉钙化的临床价值在上世纪九十年代被确立(Agatston 1990 提出评分方法)。此后二十多年,钙化评分的临床使用"越来越频繁",但识别这一步长期靠手工——论文原文指出这在大规模临床试验中"prohibitive"(不可行)、在日常门诊"impractical"(不实际)。这个矛盾(临床价值高 vs 操作成本高)催生了整个自动 CAC 检测研究领域。

13.2 时间线

年份 事件 意义
1990 Agatston 等提出钙化评分方法 建立临床金标准(130 HU、密度加权)
2008 Saur 等自动检测 CT 钙化斑块 自动检测早期探索
2013 Shahzad 等血管特异自动评分系统 方法趋于成熟
2014 orCaScore 于 MICCAI 波士顿 workshop 发起 首个公开标准化评测框架
2015– DISCHARGE 试验开展 大规模临床队列补充数据量
2016 orCaScore 框架论文发表(Med Phys 43(5)) 五方法横评,确立评测范式
2020s 深度学习 CAC 检测兴起,orCaScore 作为基准被复用 框架的持久影响力
2025-08 orCaScore 关闭新注册 挑战进入冻结期

这条时间线揭示了 orCaScore 的枢纽位置:它出现在"方法已多、但缺比较"的 2014 年,用标准化评测把领域从"各说各话"推向"同台竞技"。此后的深度学习时代,它又转化为"历史对标基准"被反复引用。

13.3 为什么是 2014 年

2014 年前后,CAC 自动检测已经积累了足够多的方法(Saur 2008、Shahzad 2013 等),但横向比较的呼声才开始出现。文献里"Thus far, a comparison of their performance has been lacking."(论文原文)点破了当时的领域痛点。orCaScore 恰逢其时地填补了这个空白——这也说明,评测框架往往诞生于"方法过剩、度量缺失"的临界点。这是把 orCaScore 放进 AI 评测史的好角度:它不是一个孤立事件,而是"方法爆发→需要度量"这一规律的实例。

§14 数据工程实务:拿到 orCaScore 后怎么用

14.1 从 MetaImage 到管线的第一步

拿到 mhd/zraw 文件后,进入 AI 管线的标准流程(假设已解决许可与获取问题):

① 读入:SimpleITK.ReadImage("patientXX_CTI.mhd") → numpy 数组
② 重采样:把不同患者的不同 spacing 统一到各向同性网格
   (注意原始 z 层厚 2.5-3 mm >> x/y 0.4-0.5 mm,各向异性显著)
③ 窗宽窗位:CT 值截断到适合钙化观察的范围(如 [-100, 1000] HU 或更窄)
④ 阈值预分割:>130 HU 粗提取候选 → 6-连通 → 过滤 <1.5 mm³
⑤ 模型:检测/分割网络(病灶级)或分类网络(患者级风险)
⑥ 后处理:按 6-connectivity 重连通 → 血管归属 → Agatston 计算
⑦ 评测:病灶级 sensitivity/PPV;患者级加权 kappa

各向异性是关键坑:orCaScore 的 z 层厚(2.5–3 mm)远大于平面内分辨率(0.4–0.5 mm),若直接做各向同性卷积会失真。多数现代管线会先插值到各向同性(如 1 mm³)再处理——但这会引入插值伪影,需权衡。

14.2 阈值与连通性的工程实现

第 ① ② ③ 步对应 orCaScore 的标注口径(>130 HU、6-连通),实现见附录 G 代码。工程要点:

  • 连通性选择影响病灶数:用 26-连通会把相邻小灶合并,低估病灶数;必须用 6-连通才与参考标准一致。
  • 最小体积阈值:1.5 mm³ 的过滤会去掉部分真实小灶,但可抑制噪声假阳性——报告时必须写明所用阈值。
  • HU 校准:不同厂商的 CT 值可能有细微系统偏差,跨厂商评测前应做 HU 一致性检查。

14.3 患者级评分的聚合逻辑

从病灶到患者级的聚合是 orCaScore 评测的核心,实现时要注意两点:

  1. Agatston 需逐层计算:严格实现要对每个病灶按"每层面积 × 该层峰值密度权重"求和,而非用整体峰值——简化的"整体峰值 × 总面积"会高估。
  2. 风险类别映射用总量:患者所有血管的 Agatston 之和(不是平均)映射到 I–IV 类(附录 H 代码)。

14.4 评测复现清单

若要在自己的数据上复现 orCaScore 式评测:

步骤 要点
参考标准 双专家独立 + 分歧共识(§2.4)
病灶定义 >130 HU + 6-连通 + 最小体积(§5.2)
血管归属 1=LAD/2=LCX/3=RCA,左主干归 LAD(§9.6)
病灶级指标 sensitivity + PPV 成对报(§5.1)
血管级指标 分 LAD/LCX/RCA 报 ICC(§9.7)
患者级指标 加权 kappa + accuracy;Agatston + Volume 双口径(§5.5/§5.6)

§15 常见应用场景:谁在什么情况下用 orCaScore

15.1 场景一:方法对标

需求:你开发了一个新的 CAC 检测算法,想知道它相对已有方法的水平。
用法:在 orCaScore 训练集上开发验证,把测试集预测提交官方平台获得标准指标;或(若无法注册)在文献中找五个已评测方法的区间(52%–94% 等)作为参照带。
注意:许可与注册状态(坑 3/坑 6)。

15.2 场景二:评测协议模板

需求:你要设计一个肾结石/肺结节/骨密度等"检测 + 定量 + 分层"的评测。
用法:直接借用 orCaScore 的分层指标树 + 客观判定规则 + 双专家共识三件套(§12.4),无需它的数据。
价值:这是 orCaScore 最容易被忽略、却最可迁移的价值。

15.3 场景三:心血管影像综述的数据源

需求:写一篇 CAC 检测/心脏 CT 评测综述。
用法:引 orCaScore 作为"首个标准化评测框架"的历史节点(§13),并与其后的 DISCHARGE、深度学习时代数据对比。
注意:五方法区间是 2016 年的结论,引用时点明年代。

15.4 场景四:多中心鲁棒性研究

需求:研究算法在不同 CT 厂商间的泛化。
用法:orCaScore 的"四院四厂商"是最早的跨厂商评测设置之一,可作为方法学先例引用;若需自建多中心数据,参考其采集多样性设计(§4.4)。

15.5 场景五:AI-Ready 教学的对比样本

需求:教学/研究中说明"许可明确性"对数据价值的决定性影响。
用法:把 orCaScore(许可缺位)与库内 panda-plus(三层明确许可)、CT-RATE(CC BY-NC-SA)对比,构成"许可光谱"的活教材(§12.5、坑 3)。

§16 局限性与风险清单

16.1 数据本身的局限

局限 表现 影响
规模小 72 例(32 训练) 不能作训练集;统计效力有限
测试集不公开 40 例标注封闭 无法本地复现,依赖官方平台
厂商/医院未披露 仅知"四院四厂商" 无法做厂商特异性分析
单一时代 2014–2016 采集 CT 技术与重建算法已迭代,代表性受限
仅钙化 不涉软斑块/混合斑块 与其他斑块任务不通用

16.2 使用中的风险

风险 触发条件 缓解
许可违规 未确认许可即再分发/商用 先书面确认(附录 P)
无法获取 2025-08 后新注册被拒 用替代队列(DISCHARGE/CADMAN)
指标误读 只报单一指标或漏报层级 三级指标同报(附录 X)
口径混淆 用 26-连通、错误阈值 严格用 6-连通 + 130 HU(§9.5)
年代错配 把 2016 区间当现状 标注年代,结合新方法(§13)

16.3 与"现代替代品"的关系

深度学习时代,CAC 检测已转向大模型与大数据。orCaScore 的价值不再是"最新数据",而是历史锚点 + 评测范式 + 教学样本。使用者应区分两种需求:要"最新最好的训练数据"→ 看现代大数据集;要"标准化的历史对标 + 评测设计参考"→ orCaScore 仍不可替代。

FAQ(高频问答 26 问)

A. 基础认知

Q1:orCaScore 是数据集还是挑战赛?
两者都是。它是一个评测框架(evaluation framework)+ 公开数据集 + 挑战赛平台的三位一体:汇集数据、定义协议、在 Grand Challenge 上托管评测。

Q2:名字怎么读、怎么写?
官方写法 orCaScore(o-r-C-a-S-c-o-r-e),其中 “Ca” 指 Calcium(钙)。注意与微软的 “ORCAS” 点击日志数据集无关(坑 1)。

Q3:谁做的?
以荷兰 UMC Utrecht(乌得勒支大学医学中心)Image Sciences Institute 为主,一作 Jelmer M. Wolterink,通讯/资深作者 Ivana Išgum;合作方横跨多机构与工业界(Siemens、Toshiba/Canon、Microsoft Research、东南大学等)。

Q4:什么时候发起的?
MICCAI 2014 workshop,Boston, USA(官方站原文)。论文 2016 年 5 月发表于 Medical Physics。

Q5:核心贡献一句话?
第一次把(半)自动 CAC 检测方法放到同一个公开标准化框架下独立横评(此前各报各分、不可比)。

Q6:它最大卖点?
论文结论:“automatic per patient CVD risk categorization is feasible”——用 72 例证明自动风险分类在临床上够用。

Q7:它最大短板?
许可缺位(官方站无规范化 license)、测试集标注不公开、2025-08 起停止新注册——可获取性三重不确定。

Q8:它和库内 mm-whs 什么关系?
同为 MICCAI 系心脏影像挑战赛:mm-whs(rid 770)测全心结构分割,orCaScore 测冠脉钙化检测。任务互补,同属心血管影像评测谱系。

Q9:能商用吗?
**不确定。**官方站未声明许可,无法判断商用授权。商用前必须与官方/UMC Utrecht 书面确认(坑 3)。

Q10:现在还能拿到数据吗?
2025 年 8 月起 Grand Challenge 关闭新注册;已注册参与者仍可提交结果(官方站 2026-09-30 抓取原文)。新用户实质上已无法通过正常渠道获取。

B. 数据与获取

Q11:72 例怎么划分?
32 例训练(含参考标准标注)+ 40 例测试(标注不公开,官方在线评测)。

Q12:每例有几幅影像?
两幅:1 幅非增强 ECG 触发钙化评分 CT(CSCT)+ 1 幅配对 CTA(CCTA)。

Q13:数据来源多样性?
四家不同医院、四种不同厂商扫描仪(名称官方未披露,坑 4)——刻意制造分布偏移以测鲁棒性。

Q14:文件格式是什么?
mhd + zraw(MetaImage),ITK/SimpleITK 原生可读。

Q15:测试集能下载吗?
不能。测试集参考标注不公开(坑 6),只能提交预测给官方平台获取得分。

Q16:许可具体怎么写?
没有写——官方站无 license 段落,无 SPDX 标识。这是本条目反复强调的最大缺陷(坑 3)。

Q17:如果想复现评测怎么做?
数据拿不到时,可照搬其协议(三级评测、130HU/6-connectivity、加权 kappa)在你自己的数据上复现方法学(§5/§9)。

Q18:官方数据页路径?
https://orcascore.grand-challenge.org/Data/(注意大写 D,坑 2;小写 /data/ 返回 Not Found)。

C. 数据规格与标注

Q19:钙化阈值多少?
>130 HU(Hounsfield Unit),沿用 Agatston 临床标准(§9.4)。

Q20:病灶怎么定义?
连通 3-D 体素(6-connectivity)且强度 >130 HU;部分二次文献以最小体积 1.5 mm³ 定义有效病灶(§5.2)。

Q21:血管归属怎么标?
手工标注 LAD/LCX/RCA;标注图中编码 1=LAD、2=LCX、3=RCA;左主干钙化归为 LAD(§9.6)。

Q22:参考标准怎么保证可靠?
两名专家独立标注,分歧病灶重新呈现、共识复核确定最终标准(§2.4)。

Q23:训练集病灶分布?
LAD 103 / LCX 21 / RCA 56;其他钙化 138k;约 3454 候选病灶/扫描(二次文献 mp.15870 Table 1,§2.5)。

Q24:为什么 LAD 病灶最多?
解剖学原因:LAD 供血范围最广、钙化最常累及。LCX 最少(21),导致其血管级 ICC 最不稳定(§9.7)。

D. 评测与结果

Q25:评了几个方法、结果如何?
五个(半)自动方法(4 用 CSCT+CCTA,1 仅用 CSCT):病灶检出 52%–94%、PPV 65%–96%、血管归属正确 88%–98%、患者风险分类线性加权 kappa 0.80–1.00(§3.3)。

Q26:最容易错在哪?
远端冠脉病灶最常漏检;冠状动脉开口附近的主动脉钙化是最常见假阳性(§3.4)。

Q27:为什么病灶检出只有 52% 患者级还能 0.80?
三级聚合的"粗化"效应:局部漏检/误检未必改变患者总体风险归属(§4.2/§9.8)。

Q28:风险分类用什么指标?
Linearly weighted Cohen’s kappa(有序四类的加权一致性)+ Accuracy(Risk)(§5.6)。

Q29:Agatston 和 Volume 有什么区别?
Agatston 是密度加权面积(临床金标准),Volume 是纯体积(mm³)。排行榜对两者都报 ICC(§9.2)。

E. 库内与生产

Q30:本条目为什么立 orcascore 而非别名?
任务头正选候选即 orcascore;库内查重(ILIKE '%orca%'/'%calcium%'/'%coronary%')均为 0 行,无别名撞库;需与微软 ORCAS 区分(坑 1)。

Q31:与库内哪些条目互链?
一级:mm-whs(770)、cardiac-atlas-project(521)、heart-lung-segmentations-data(610)、ct-rate(546);二级:chest-ct-sepsis-er(600)、cardiac-implantable-device-cxr(599)、abdomenct-1k(402)(§7.4)。

Q32:本条目后续会更新什么?
维护触发点:官方许可明确化、排行榜数值补齐、挑战平台状态变化(见附录 T)。

事实清单(硬事实 44 条)

  1. orCaScore 全称 Automatic Coronary Calcium Scoring(Challenge / framework),官方写作 “orCaScore”。
  2. 官方站域名 orcascore.grand-challenge.org,由 Grand Challenge 平台托管。
  3. 该评测框架于 MICCAI 2014 workshop(Boston, USA) 发起(官方站 Purpose 段原文)。
  4. 核心论文:Wolterink JM 等,Medical Physics 2016;43(5):2361-2373,doi 10.1118/1.4945696,PMID 27147348。
  5. 第一作者 Jelmer M. Wolterink,资深/通讯作者 Ivana Išgum,第一机构 UMC Utrecht(Image Sciences Institute)。
  6. 合作者横跨多机构与工业界:含 Siemens(Kelm BM)、Toshiba/Canon(Kondo S)、Microsoft Research(Zheng Yefeng)、东南大学(Shu H/Yang G)等。
  7. 数据规模:72 例患者,划分为 32 例训练 + 40 例测试。
  8. 每例患者含 2 幅影像:1× 非增强 ECG 触发钙化评分 CT(CSCT)+ 1× 配对 CTA(CCTA)。
  9. 影像来自 四家不同医院、使用 四种不同厂商 CT 扫描仪(官方站原文)。
  10. 72 例患者分布于四个心血管疾病(CVD)风险类别(论文摘要)。
  11. 钙化阈值:> 130 HU(Hounsfield Unit)。
  12. 病灶识别:3-D 6-connectivity 连通体素。
  13. 血管归属标注编码:1 = LAD,2 = LCX,3 = RCA。
  14. 左主干(LM)钙化标注为 LAD。
  15. 参考标准流程:两名专家独立标注 → 分歧病灶重新呈现 → 共识(consensus)复核确定标准。
  16. 参考标准工具:自定义工具(custom-built tool),按商业厂商标准协议高亮 >130 HU 体素。
  17. 文件格式:mhd + zraw(MetaImage),ITK/SimpleITK 可读。
  18. 平面内分辨率 0.4–0.5 mm、层厚/层距 2.5–3 mm(二次文献口径)。
  19. 训练集候选病灶分布(二次文献 mp.15870 Table 1):LAD 103 / LCX 21 / RCA 56;其他钙化 138k;3454 候选病灶/扫描。
  20. 候选病灶定义:连通 3-D 体素(6-connectivity)且强度 >130 HU,含冠脉钙化(LAD/LCX/RCA)与冠脉外钙化(OTHER_CAC)。
  21. 部分二次文献以 最小体积 1.5 mm³ 定义有效钙化病灶(mp.15870 §2.1.2)。
  22. 测试集参考标注不公开(二次文献确认 “the orCaScore test set is not public”)。
  23. 评测层级三级:病灶级 → 血管级 → 患者级。
  24. 病灶级指标:sensitivity 与 PPV。
  25. 血管级指标:血管归属正确率 + ICC(LAD/LCX/RCA/patient 分别报)。
  26. 体积指标:F-1(Volume)。
  27. 患者级指标:Agatston 分数、Volume、风险分类 linearly weighted Cohen’s kappa 与 Accuracy(Risk)。
  28. 共评测 五个(半)自动方法:4 个用 CSCT+CCTA,1 个仅用 CSCT(论文 Results)。
  29. 病灶检出率(sensitivity)范围:52% – 94%。
  30. 阳性预测值(PPV)范围:65% – 96%。
  31. 血管归属正确率范围:88% – 98%。
  32. 患者风险分类线性加权 Cohen’s kappa 范围:0.80 – 1.00。
  33. 错误模式:远端冠状动脉病灶最常漏检;冠脉开口附近主动脉钙化是最常见假阳性。
  34. 论文结论:自动 per-patient CVD 风险分类 可行(feasible)。
  35. 论文结论:描述了首个公开标准化的(半)自动 CAC 识别评测框架。
  36. Grand Challenge 官方站状态(2026-09-30 抓取):2025 年 8 月起关闭新注册;已注册参与者仍可提交结果。
  37. 官方站 Data 页路径为 /Data/(大写 D);/data/ 返回 Not Found。
  38. 官方站未声明规范化开源许可(无 CC、无 SPDX 标识)——许可缺位。
  39. 四家医院与四种厂商扫描仪的具体名称/型号官方未披露。
  40. 排行榜列名(已知):F-1(Volume)/Sens(Volume)/PPV(Volume)/Sens(Lesions)/PPV(Lesions)/ICC(LAD,LCX,RCA,patient;Volume 与 Agatston)/Accuracy(Risk)/Kappa(Risk)。
  41. 排行榜具体团队与数值未公开抓取(页面需 JS 渲染)。
  42. 二次加工镜像 GitHub zhilothebest/Coronary_Calcium 记录 orCA Score 命名规范(TR/TE/VA 字段、V 厂商号、CTAI/CTI/R 后缀),因许可协议不公开分发原始数据。
  43. 论文被引(PlumX 抓取时点):81 citations(Scopus 81 / PubMed Central 26 / CrossRef 8)。
  44. 同族相关队列(mp.15870 Table 1):DISCHARGE(140/1047/75)、CADMAN(156)——orCaScore 是其中规模最小但评测协议最正式者。

术语表(32 条)

术语 释义
CAC Coronary Artery Calcification,冠状动脉钙化
Agatston 分数 临床金标准的钙化定量指标,按病灶面积 × 密度权重求和
密度权重 Agatston 中按峰值密度分级:130-199→1,200-299→2,300-399→3,≥400→4
Volume(钙化体积) 钙化体素的物理体积累加(mm³),与 Agatston 互补的定量口径
CSCT non-contrast enhanced calcium scoring CT,非增强钙化评分 CT(主任务模态)
CCTA Coronary CT Angiography,冠状动脉 CT 血管造影(配对的增强影像)
ECG 触发 用心电信号门控采集时相,减少心脏运动伪影
HU Hounsfield Unit,CT 值单位;钙化阈值 >130 HU
130 HU 阈值 Agatston 方法沿用的钙化判定阈值
6-connectivity 三维体素连通性,仅面相邻算连通(最保守定义)
18/26-connectivity 更宽松的三维连通定义(加棱/角相邻),orCaScore 未采用
LAD Left Anterior Descending artery,左前降支(orCaScore 训练集病灶最多)
LCX Left Circumflex artery,左回旋支(训练集病灶最少)
RCA Right Coronary Artery,右冠状动脉
LM(左主干) Left Main coronary artery;其钙化归入 LAD 标注
sensitivity 敏感度/召回率 = 正确检出病灶 / 参考标准病灶
PPV Positive Predictive Value,阳性预测值/精确率
F-1 精确率与召回率的调和平均(orCaScore 报 Volume 版)
ICC Intraclass Correlation Coefficient,组内相关系数,衡量估计值可替代性
Cohen’s kappa 扣除随机一致后的一致性系数
linearly weighted kappa 按类别距离线性惩罚偏差的 kappa,用于有序风险分类
Accuracy(Risk) 风险类别分类准确率
风险类别 I–IV CAC 风险四分层:0 / 1–100 / 101–300 / >300
CVD Cardiovascular Disease,心血管疾病
评测框架 evaluation framework,定义数据+协议+平台的标准化评测装置
per lesion / per artery / per patient 病灶级/血管级/患者级三级评测
参考标准 reference standard,双专家共识标注形成的金标准
共识复核 consensus reading,专家分歧病灶重新呈现并达成一致
闭合测试集 参考标注不公开、仅经在线提交评测的测试集
MetaImage mhd(头文件)+ zraw(原始数据)组成的医学影像格式
SimpleITK / ITK 读取 MetaImage 的开源医学影像工具库
Grand Challenge grand-challenge.org,托管医学影像挑战赛与评测的平台
MICCAI Medical Image Computing and Computer Assisted Intervention,医学影像计算顶会
多中心多厂商 multi-center multi-vendor,用不同医院/设备数据测鲁棒性
分布偏移 distribution shift,训练/测试数据分布不一致,鲁棒性评测的关注对象
部分容积效应 partial volume effect,小结构在体素化时被周围组织稀释的成像伪影
远端漏检 distal miss,远端细血管小钙化灶最常被漏检的错误模式
开口假阳性 ostia false positive,冠脉开口处主动脉钙化被误判为冠脉钙化的错误模式
候选病灶 candidate lesion,>130 HU 且 6-连通的所有体素组(含骨/冠脉外钙化)
OTHER_CAC 冠脉外钙化(骨、主动脉壁等),候选病灶里的非目标结构
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability 五维评估
AI-Ready 数据可被 AI 管线直接、合法、可复现地使用所需的条件集合

附录

附录 A:条目信息速查卡

项 值
条目名 orCaScore
url_name orcascore
类型 评测框架 + 公开数据集 + 挑战赛(三位一体)
论文 Medical Physics 2016;43(5):2361-2373(doi:10.1118/1.4945696)
团队 UMC Utrecht 为主(Wolterink/Išgum)
规模 72 例(32 训练 + 40 测试),每例 CSCT+CCTA
许可 注册制;官方站未声明规范化许可(缺位)
发起 MICCAI 2014 workshop,Boston, USA
抓取时点 2026-09-30
库内互链 mm-whs(770)/cardiac-atlas-project(521)/heart-lung-segmentations-data(610)/ct-rate(546)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 7 官方站+论文可索引;但 “orCaScore” 名易与 ORCAS 混淆,且挑战站路径大小写敏感(坑 1/2)
A 可获取性 3 注册制 + 2025-08 关闭新注册 + 测试集标注不公开 + 许可缺位——最大失分项
I 可互操作 8 mhd/zraw(MetaImage)ITK/SimpleITK 原生可读;格式标准且稳定
M 元数据质量 8 官方站 Data 页标注协议完整(阈值/连通性/血管编码/共识流程);论文表格完备
S 可持续性 5 Grand Challenge 平台稳定,但挑战进入冻结期、无归档直链、无许可,长期可及性存疑
综合评级 6.2/10(中) 评测协议与文档质量高;可获取性与可持续性被许可缺位与注册关闭拖低

附录 C:逐项证据链自证

关键数字 来源 位置
72 例 / 32 训练 / 40 测试 官方站 Data 页 + 论文摘要 orcascore.grand-challenge.org/Data/
每例 CSCT+CCTA 官方站 Data 页 Data 页 “Data” 段
四院四厂商 官方站 Data 页 “four different … vendors”
四类 CVD 风险 论文摘要 Medical Physics 43(5) abstract
>130 HU / 6-connectivity 官方站 Data 页 “Reference standard” 段
1=LAD/2=LCX/3=RCA;LM→LAD 官方站 Data 页 “Reference standard” 段
两专家独立+共识 官方站 Data 页 + 论文摘要 “Reference standard” 段
病灶分布 103/21/56、3454/扫描 二次文献 Table 1 doi:10.1002/mp.15870
0.4–0.5 mm / 2.5–3 mm 二次文献 arXiv:2502.8675v1
52%–94% / 65%–96% / 88%–98% / kappa 0.80–1.00 论文摘要 Results Medical Physics 43(5) abstract
五方法(4 双模态+1 单模态) 论文摘要 Results 同上
远端漏检 / 开口假阳性 论文摘要 Results 同上
2025-08 关闭新注册 官方站 Home 页面顶部提示
测试集不公开 二次文献 doi:10.1002/mp.15870
81 citations PlumX plu.mx/plum/a?doi=10.1118/1.4945696
命名规范 CTI/CTAI/R GitHub 镜像 zhilothebest/Coronary_Calcium

附录 D:数据获取决策树

需求是什么?
├── 只是想理解 CAC 评测框架
│   └── 读本条目 §0/§3/§5/§9(无需数据)
├── 想在标准化基准上评测自己的 CAC 算法
│   ├── 1) 查 Grand Challenge 注册状态(2025-08 已关闭新注册,坑 6)
│   ├── 2) 若可注册:取得训练集标注 → 开发算法 → 官方在线提交测试结果
│   └── 3) 若不可注册:转用 DISCHARGE/CADMAN 等替代队列,或自建数据
├── 想复现 orCaScore 式评测
│   └── 照搬三级协议 + 130HU/6-connectivity + 加权 kappa(§5/§9),在你自己的数据上落地
└── 要引用其横评结论
    └── 引论文摘要 Results(52%–94% 等),注明是 2016 年五方法的结论

附录 E:三级评测指标映射表

层级 临床问题 指标 计算公式/口径
病灶级 钙化找得准吗 sensitivity TP病灶 / (TP+FN)病灶
病灶级 报的钙化对吗 PPV TP病灶 / (TP+FP)病灶
体积 钙化总量准吗 F-1(Volume) 2PR/(P+R)
血管级 归属对吗 归属正确率 正确归属病灶 / 检出病灶
血管级 分血管定量准吗 ICC(LAD/LCX/RCA) 估计量 vs 参考量组内相关
患者级 总钙化准吗 Agatston/Volume ICC 两口径分别计算
患者级 风险分层对吗 加权 kappa + accuracy 线性加权四类有序

附录 F:标注参考标准复现骨架(SOP 模板)

阶段 1 数据聚齐
  - 多中心多厂商非增强 ECG 触发 CSCT + 配对 CCTA
  - 统一匿名化、重编号、格式统一为 mhd/zraw
阶段 2 双专家独立标注
  - 按厂商标准协议:高亮 >130 HU 体素
  - 3-D 6-connectivity 连通 → 单个病灶
  - 手工标注血管归属:1=LAD / 2=LCX / 3=RCA(左主干归 LAD)
阶段 3 分歧处理
  - 列出两专家标注不一致的病灶
  - 重新呈现(带上下文),达成共识
  - 共识结果写入参考标准
阶段 4 评测
  - 病灶级:sensitivity / PPV
  - 血管级:归属正确率 / ICC(LAD/LCX/RCA)
  - 患者级:Agatston / Volume ICC;风险分类加权 kappa / accuracy

附录 G:130 HU 钙化病灶提取骨架(代码)

import SimpleITK as sitk
import numpy as np
from scipy import ndimage

def extract_cac_lesions(image_path, hu_threshold=130, min_volume_mm3=1.5):
    """按 orCaScore 口径提取冠脉钙化候选病灶。
    image_path: CSCT 的 .mhd 文件(MetaImage,含 spacing)
    """
    img = sitk.ReadImage(image_path)
    arr = sitk.GetArrayFromImage(img)          # (z, y, x),单位 HU
    spacing = img.GetSpacing()                 # (sx, sy, sz) mm

    mask = arr > hu_threshold                   # ① 阈值 >130 HU
    # ② 3-D 6-connectivity 连通(scipy 的 1-voxel 结构即面相邻)
    structure = ndimage.generate_binary_structure(rank=3, connectivity=1)
    labels, n = ndimage.label(mask, structure=structure)

    voxel_vol = spacing[0] * spacing[1] * spacing[2]   # 单体素体积 mm³
    lesions = []
    for lid in range(1, n + 1):
        vox = labels == lid
        vol = vox.sum() * voxel_vol
        if vol < min_volume_mm3:                # ③ 过滤 <1.5 mm³ 小团
            continue
        peak_hu = arr[vox].max()
        lesions.append({"label": lid,
                        "volume_mm3": vol,
                        "peak_hu": peak_hu,
                        "weight": agatston_weight(peak_hu)})
    return lesions, spacing

def agatston_weight(peak_hu):
    """Agatston 密度权重:130-199→1,200-299→2,300-399→3,≥400→4。"""
    if peak_hu < 200:
        return 1
    if peak_hu < 300:
        return 2
    if peak_hu < 400:
        return 3
    return 4

附录 H:Agatston 与风险分类计算骨架(代码)

def agatston_score(lesions, spacing):
    """Agatston 分数 = Σ (病灶面积 × 密度权重)。
    面积按每病灶的像素面积(mm²)计,权重按峰值密度。
    """
    sx, sy, _ = spacing
    px_area = sx * sy                  # 每体素层内面积 mm²
    total = 0.0
    for les in lesions:
        # 简化:以病灶层内体素数近似面积(严格实现按最大密度阈值逐层计)
        area_mm2 = les.get("area_voxels", 0) * px_area
        total += area_mm2 * les["weight"]
    return total

def risk_category(agatston):
    """按 Agatston 总量映射到 CVD 风险类别 I–IV。"""
    if agatston == 0:
        return "I"          # 无钙化
    if agatston <= 100:
        return "II"         # 轻度
    if agatston <= 300:
        return "III"        # 中度
    return "IV"             # 重度

def weighted_kappa(y_true, y_pred, weights="linear"):
    """风险分类线性加权 Cohen's kappa(orCaScore 患者级指标)。"""
    from sklearn.metrics import cohen_kappa_score
    return cohen_kappa_score(y_true, y_pred, weights=weights)

附录 I:核心数字与来源对照表

数字 含义 来源
72 患者总数 官方站 Data + 论文
32 / 40 训练 / 测试 官方站 Data + 论文
4 / 4 医院数 / 厂商数 官方站 Data
130 钙化阈值(HU) 官方站 Data + 论文
6 连通性(-connectivity) 官方站 Data
103 / 21 / 56 训练集 LAD/LCX/RCA 病灶数 mp.15870 Table 1
3454 训练集候选病灶/扫描 mp.15870 Table 1
138k 训练集其他钙化数 mp.15870 Table 1
52–94 病灶检出率(%) 论文 Results
65–96 PPV(%) 论文 Results
88–98 血管归属正确率(%) 论文 Results
0.80–1.00 风险分类加权 kappa 论文 Results
5 评测方法数 论文 Results
81 被引数(PlumX) plu.mx

附录 J:风险类别与 Agatston 对照全表

风险类别 Agatston 分数 临床解读 人群占比(一般参考) 临床常见动作
I 0 无可测钙化 约半数中年无症状人群 通常无需药物干预
II 1–100 轻度钙化 约四分之一 结合其他危险因素评估
III 101–300 中度钙化 约 15% 考虑强化危险因素管理
IV > 300 重度钙化 约 10% 常建议积极干预

(人群占比为一般文献参考量级,非 orCaScore 特指;orCaScore 的 72 例分布于四类,具体各例数见坑 4。)

附录 K:五方法横评结果登记表(论文口径)

指标 最小值 最大值 跨度 解读
病灶检出率(sensitivity) 52% 94% 42 pp 方法能力参差,横评价值所在
阳性预测值(PPV) 65% 96% 31 pp 整体高于检出率下限
血管归属正确率 88% 98% 10 pp 归属能力普遍成熟
风险分类加权 kappa 0.80 1.00 0.20 患者级高度一致

注:论文摘要只披露上述区间,未逐方法列名与数值;具体排名见 Grand Challenge 排行榜(数值未公开抓取,坑 5)。

附录 L:错误模式画像

错误类型 表现 解剖原因 临床影响
漏检(FN) 远端冠状动脉病灶最常被漏 远端血管细小、钙化灶小、部分容积效应 有限——远端小灶对总量影响小
误检(FP) 冠脉开口附近主动脉钙化被误判 主动脉壁与冠脉起始段解剖邻接 有限——开口歧义灶对风险分类影响小

论文结论原文:“CAC lesions at ambiguous locations such as the coronary ostia remain challenging, but their detection had limited impact on CVD risk determination.”

附录 M:与库内心脏影像条目的关系声明

维度 orCaScore(本条目) mm-whs(rid 770)
任务 冠脉钙化自动检测与评分 全心结构分割
模态 心脏 CT(CSCT+CCTA) 心脏 CT + MRI
规模 72 例 120 例
评测 病灶/血管/患者三级 分割精度(Dice 等)
谱系 MICCAI 2014 workshop MICCAI 系心脏挑战赛
阅读顺序 钙化定量路线 结构分割路线

两者不冲突、互为互补:同属心血管影像评测家族,任务不同、数据不重叠。

附录 N:心脏 CT 评测数据集景观总表

数据集 年份 规模 模态 任务 评测协议
orCaScore 2016 72(32+40) CSCT+CCTA CAC 检测+评分 三级标准化(本条目)
DISCHARGE 2015– 140+1047+75 CSCT+CCTA CAC+CAR 分割 非标准化(研究自定)
CADMAN — 156 CSCT CAC 检测 非标准化
MM-WHS 2017 120 CT+MRI 全心分割 挑战赛协议
CT-RATE(库内 546) 2024 25,692 卷 胸部 CT 影像-报告多模态 非标准化
Cardiac Atlas Project(库内 521) — — 心脏影像 统计图谱 开源库
heart-lung-segmentations-data(库内 610) — — 胸部 CT 心肺分割 金标准

定位一句话:orCaScore 是表内规模最小、但评测协议最正式者——它是"用协议让小编数据可横向比较"的范例。

附录 O:许可条款细读

  1. 数据本体:Grand Challenge 注册/参赛制提供训练集;官方站无 license 段落、无 SPDX 标识——再分发、商用、署名要求均未声明。
  2. 测试集:参考标注不公开;仅经官方在线提交协议评测(二次文献确认)。
  3. 论文:Medical Physics(Wiley/AAPM),非开放获取(isAccessibleForFree=false);机构库有副本(见附录 U)。
  4. 平台:Grand Challenge(grand-challenge.org)提供托管;平台自身的条款与数据集许可需分别看待。
  5. 引用优先级:引用观点/数字引论文(doi:10.1118/1.4945696);使用数据前先与官方/UMC Utrecht 确认许可。
  6. 商用提示:不可假设可商用——许可缺位意味着默认保守,务必书面确认(坑 3)。

附录 P:与官方/团队联系模板(许可确认用,供参考)

Subject: Inquiry on licensing terms for the orCaScore dataset

Dear orCaScore organizers,

I am [name], [position] at [institution]. We are working on
[one-sentence research use, e.g., automatic coronary calcium
scoring and CVD risk categorization on cardiac CT].

We would like to clarify the licensing terms for the orCaScore
challenge dataset (training set with reference standard). Could
you confirm:
  1) whether redistribution is permitted, and under what terms;
  2) whether commercial use is allowed;
  3) the required attribution/citation format.

We will cite the framework paper (Wolterink et al., Med Phys
2016;43(5):2361-2373; doi:10.1118/1.4945696) in all outputs.

Thank you for your consideration.
[Institutional affiliation + contact]

附录 Q:坑点档案(与 §10 对照)

坑 一句话档案 触发场景
坑 1 “ORCAS” 是微软点击日志数据集,与 orCaScore 无关 检索/别名排查
坑 2 官方站路径大小写敏感(/Data/ 对,/data/ 错) 爬虫/抓取
坑 3 官方站许可缺位,不可假设开放许可 引用/商用/再分发
坑 4 四院四厂商名称官方未披露,勿凭印象填 事实转写
坑 5 排行榜数值未公开抓取(需 JS 渲染) 指标抽取
坑 6 测试集标注不公开,无法本地复现测试指标 实验规划
坑 7 命名规范 CTI/CTAI/R 与 “orCA Score” 大小写差异 资料检索

附录 R:检索决策树

你想找什么?
├── orCaScore 官方站
│   └── https://orcascore.grand-challenge.org/(Data 页注意大写 D,坑 2)
├── orCaScore 论文
│   └── doi:10.1118/1.4945696(Med Phys 43(5):2361-2373, PMID 27147348)
├── 训练集病灶分布
│   └── doi:10.1002/mp.15870 Table 1(103/21/56, 3454/扫描)
├── 排行榜结果
│   └── Grand Challenge Results 页(需浏览器,坑 5)
└── "orcas" 别名?
    └── 多半是微软 ORCAS 点击日志数据集,与心血管无关(坑 1)

附录 S:双口径登记表

# 项 口径 A 口径 B 处理
1 标注者表述 官方站:“two experts” arXiv:“an experienced radiologist and a physician” 同义,双记(§2.4)
2 队列规模对照 orCaScore 72 DISCHARGE 1047 / CADMAN 156 勿混用;注明各自来源(§2.6)
3 文件命名写法 官方:“orCaScore” GitHub 镜像:“orCA Score” 检索两者都试(坑 7)
4 论文年份 2016(Vol 43 Issue 5) — 本条目无双口径(对比 panda-plus)

说明:orCaScore 的年份/卷期口径在所有来源一致(Medical Physics 2016;43(5):2361-2373),不存在 panda-plus 式的年份双口径冲突——这是它文档质量的一项加分。

附录 T:维护计划与触发点

触发点 条件 动作 优先级
许可明确化 官方站或 UMC Utrecht 声明 SPDX 许可 改写 §6、升 AI-Ready 评级 1
排行榜数值公开 抓到 Results 页完整数据 补全 §3.3 与附录 K 的具体方法/数值 2
平台状态变化 Grand Challenge 重新开放注册或归档 更新 §6.3 获取节 3
医院/厂商披露 论文正文/补充材料或官方站列出名称 补全 §2.1/§2.3 4
新二次评测论文 新的方法用 orCaScore 评测 §7.3 生态节扩行 5

附录 U:引文与访问规范

@article{wolterink2016orcascore,
  title   = {An evaluation of automatic coronary artery calcium scoring
             methods with cardiac CT using the orCaScore framework},
  author  = {Wolterink, Jelmer M. and Leiner, Tim and de Vos, Bob D. and
             Coatrieux, Jean-Louis and Kelm, B. Michael and Kondo, Satoshi and
             Salgado, Rodrigo A. and Shahzad, Rahil and Shu, Huazhong and
             Snoeren, Miranda and Takx, Richard A. P. and van Vliet, Lucas J. and
             van Walsum, Theo and Willems, Tineke P. and Yang, Guanyu and
             Zheng, Yefeng and Viergever, Max A. and I\v{s}gum, Ivana},
  journal = {Medical Physics},
  volume  = {43},
  number  = {5},
  pages   = {2361--2373},
  year    = {2016},
  doi     = {10.1118/1.4945696},
  pmid    = {27147348}
}

机构库访问副本:https://repository.ubn.ru.nl/handle/2066/171216(Radboud Repository)。

附录 V:FAIR / AI-Ready 检查单

检查项 状态 说明
F1 全局唯一标识 ✅ DOI(论文)+ 官方站域名
F2 富元数据 ✅ 官方站 Data 页协议完整 + 论文表格
A1 可访问协议 ❌ 注册制 + 2025-08 关闭新注册 + 测试集不公开
A2 元数据可访问 ✅ 官方站与论文可公开访问
A3 许可明确 ❌ 官方站无 license——最大缺陷
I1 互操作格式 ✅ mhd/zraw(MetaImage),ITK/SimpleITK
I2 词汇表引用 ✅ Agatston/LAD/LCX/RCA 等标准术语
R1 来源溯源 ✅ 四院四厂商采集,双专家标注流程明确
R2 参考标准可信 ✅ 双专家独立 + 共识复核
R3 可复现流程 ⚠️ 协议可复现(三级评测),但测试集指标不可本地复现
AI-Ready 综合 中 评测协议一流,可获取性与许可拖后腿

附录 W:缩写速查

缩写 全称
CAC Coronary Artery Calcification(冠状动脉钙化)
CAC scoring Coronary Artery Calcium Scoring(冠状动脉钙化评分)
CSCT Calcium Scoring CT(非增强钙化评分 CT)
CCTA Coronary CT Angiography(冠脉 CT 血管造影)
LAD Left Anterior Descending artery(左前降支)
LCX Left Circumflex artery(左回旋支)
RCA Right Coronary Artery(右冠状动脉)
LM Left Main coronary artery(左主干)
HU Hounsfield Unit(CT 值单位)
PPV Positive Predictive Value(阳性预测值)
ICC Intraclass Correlation Coefficient(组内相关系数)
F-1 F1 score(精确率-召回率调和平均)
CVD Cardiovascular Disease(心血管疾病)
CT Computed Tomography(计算机断层扫描)
MICCAI Medical Image Computing and Computer Assisted Intervention
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability
AI-Ready 可被 AI 管线直接、合法、可复现使用的数据条件
SOP Standard Operating Procedure(标准作业流程)
FN / FP False Negative / False Positive(漏检/误检)
RCT Randomized Controlled Trial(随机对照试验)
CAR Coronary Artery Region(冠状动脉区域)

附录 X:基于本数据集的研究检查清单(12 项)

  1. 许可核对:使用前确认官方许可状态(当前缺位,坑 3);再分发/商用须书面确认。
  2. 获取路径:查 Grand Challenge 注册状态(2025-08 关闭新注册,坑 6);不可注册则考虑替代队列。
  3. 格式处理:用 SimpleITK/ITK 读 mhd/zraw;注意 spacing 与 HU 单位(附录 G)。
  4. 阈值口径:钙化判定用 >130 HU,与临床 Agatston 对齐(§9.4)。
  5. 连通性口径:病灶用 6-connectivity,勿用 26-连通(会合并病灶,§9.5)。
  6. 血管归属:1=LAD/2=LCX/3=RCA;左主干归 LAD(§9.6)。
  7. 最小体积:部分口径以 1.5 mm³ 过滤小灶(坑 2/§5.2),报告时注明所用阈值。
  8. 分层报告:血管级 ICC 必须分 LAD/LCX/RCA 报,勿只报平均(§9.7)。
  9. 风险指标:风险分类用线性加权 kappa(非普通 accuracy),并报 accuracy 作参照(§5.6)。
  10. 聚合解读:患者级分数高不等于病灶级准;三级指标同报(§4.2)。
  11. 引用完整:引论文 doi:10.1118/1.4945696;二次使用其分布数据时引 mp.15870。
  12. 时点存照:许可状态、注册状态、排行榜数值均注明抓取时点(2026-09-30)。

附录 Y:MetaImage 读取与 spacing 速查

import SimpleITK as sitk

img = sitk.ReadImage("patientXX_CTI.mhd")   # 非增强 CSCT
print(img.GetSize())            # (x, y, z) 体素维度
print(img.GetSpacing())         # (sx, sy, sz) mm,注意 z 通常 2.5-3 mm
print(img.GetOrigin(), img.GetDirection())

# HU 值范围自检:钙化应在数百 HU 量级
import numpy as np
arr = sitk.GetArrayFromImage(img)
print(arr.min(), arr.max(), "HU")

命名速查(GitHub 镜像口径):CTI(非增强 CT)、CTAI(增强 CTA)、R(参考/标注);V 后缀指示厂商号;TR/TE/VA 为元数据字段。

附录 Z:心脏 CT 钙化评分的临床落地路径

扫描:非增强 ECG 触发心脏 CT(标准钙化评分协议)
   ↓
算法:自动阈值分割(>130 HU)→ 6-连通病灶 → 血管归属 → Agatston
   ↓
输出:每患者 Agatston 总量 + 风险类别(I–IV)
   ↓
临床:低风险 → 常规随访;中高风险 → 危险因素干预/进一步检查
   ↓
orCaScore 的位置:为"算法"这一段提供标准化评测(横评五个方法)

附录 AA:CAC 相关前作坐标系(论文参考文献脉络)

前作 年份 贡献 与 orCaScore 的关系
Saur 等 2008 自动检测 CT 中钙化冠脉斑块 orCaScore 评测的方法谱系前身
Shahzad 等 2013 血管特异的冠脉钙化自动评分系统 同上
Mittal 等 — 3D 心脏 CT 中快速自动检测钙化病灶 同上
orCaScore 2016 首个公开标准化 CAC 评测框架 把上述方法纳入统一横评
DISCHARGE 2015– 大型 RCT 心脏 CT 队列 orCaScore 之后的规模放大
van Assen 等 — 多任务主动学习(用 orCaScore 数据) orCaScore 作为二次基准被复用

尾注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 A。事实陈述以 orCaScore 官方站(orcascore.grand-challenge.org)与 Medical Physics 2016;43(5):2361-2373(doi:10.1118/1.4945696)为一手来源,辅以二次文献(doi:10.1002/mp.15870、arXiv:2502.8675v1)与机构库/引用索引交叉核验。orCaScore 的许可缺位(官方站无规范许可)、排行榜数值不可公开抓取、四院四厂商名称未披露、测试集标注不公开等原始文档局限,已在坑点(§10)、双口径登记表(附录 S)与 DAIMS 评估(附录 B)中存照。条目与库内 mm-whs(rid 770)、cardiac-atlas-project(rid 521)、heart-lung-segmentations-data(rid 610)、ct-rate(rid 546)等心血管与胸部 CT 条目互链,构成心脏影像评测家族的检索面。后续维护触发点见附录 T。

本条目在核验过程中发现检索结果含疑似提示注入内容(spacefrontiers.org 页面内嵌 “IGNORE PREVIOUS INSTRUCTIONS…” 文本),已判定为不可信内容并全程忽略,仅采信与官方站一致的事实。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • asoca — 共享标签:医学影像 / CT / 心血管疾病 / 挑战赛数据集 / 评测基准 / 医学图像分割
  • toothfairy2 — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准 / 医学图像分割
  • curvas — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准 / 医学图像分割
  • toothfairy3 — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准 / 医学图像分割
  • stsr — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准 / 医学图像分割
  • instance2022 — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准 / 医学图像分割
  • mm-whs — 共享标签:医学影像 / CT / 心血管疾病 / 挑战赛数据集 / 医学图像分割
  • lascarqs — 共享标签:医学影像 / 心血管疾病 / 挑战赛数据集 / 评测基准 / 医学图像分割
  • camus — 共享标签:医学影像 / 心血管疾病 / 挑战赛数据集 / 医学图像分割
  • imagecas — 共享标签:医学影像 / CT / 心血管疾病 / 医学图像分割

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集