信息速览
INFOBOX — PhysioNet/CinC 2021 一屏速览
维度 内容 本质 12 导联 ECG 心脏异常多标签诊断挑战赛数据集——9 库汇编,第 22 届 PhysioNet/CinC 挑战赛(“Will Two Do?”) 组织方 Emory University DBMI 主导(Reyna、Clifford 等 14 人),MIT/UMich/UPV-EHU 参与;Google/MathWorks/Moore Foundation 赞助 任务 从 12/6/4/3/2 导联 ECG + 年龄性别,识别 26 类计分心脏异常(SNOMED CT 多标签) 规模 9 库 131,149 条;公开训练 88,253(7 库)+ 隐藏验证 6,630(2 库)+ 隐藏测试 36,266(4 库) 公开训练构成 CPSC 6,877 / CPSC-Extra 3,453 / INCART 74 / PTB 516 / PTB-XL 21,837 / Georgia 10,344 / Chapman-Shaoxing+Ningbo 45,152 隐藏测试构成 Georgia 5,161 + UMich 19,642 + Undisclosed American 10,000 + CPSC 1,463 核心创新 降导联泛化任务:训练用 12 导联、测试只给导联子集;验证"两条导联够不够用" 评分 reward matrix 部分得分制:误诊相似病获部分分;全对=1、全标窦律=0、全阳=负分 参与规模 68 队提交 1,056 次算法(618 次成功),39 队上榜 冠军 ISIBrno-AIMT(捷克 ISI Brno,Plesinger 组):残差 CNN 集成+注意力,六榜全一,all-lead 0.58 科学结论 降导联与全导联性能差异极小:中位变化 ≤0.036(配对检验 p≥0.50)——“两条确实基本够用” 许可 CC BY 4.0(PhysioNet 官方统一发布,Anyone 可访问);参赛代码默认 BSD 3-Clause 发布 2020-12-24 数据上线(v1.0.0);2021-09-15 CinC Brno 颁奖;2022-01-26 收官 库内互链 cpsc(132)、ptb-xl(70)、Chapman-Shaoxing(143)、cinc-2015(487)、cinc-2018-sleep(493)、cinc-2023(499)
PhysioNet/CinC 2021 挑战赛数据集是一次把"心电图人工智能的泛化焦虑"摆上台面的大规模实验。它的题目"Will Two Do?“直译是"两条导联够不够用”——12 导联心电图(electrocardiogram, ECG)是心脏诊断的黄金标准,但可穿戴与便携设备只能记录 2-6 条导联;这个数据集把 9 个数据库、4 个国家、3 个大洲的 131,149 条 12 导联 ECG 汇编到一起,让参赛算法在训练时看全 12 条导联、在隐藏测试时却只拿到 6/4/3/2 条导联的信号,从而首次在同一口径下量化"降导联到底损失多少诊断能力"。官方答案:中位变化不超过 0.036 分(统计上不显著)——这对便携心电设备行业是一个被 68 支参赛队伍反复验证过的定心丸。
对数据集使用者而言,它同时是三样东西。其一,一份 88,253 条公开带标注的 12 导联 ECG 训练语料:CC BY 4.0、无需注册、直接下载,是 CPSC、PTB-XL、Chapman-Shaoxing 等库的官方统一重编码版——年龄性别做了 HIPAA 兼容一致化、标签近似映射到 SNOMED CT、统一打包为 WFDB 格式。其二,一套 26 类心脏异常的多标签基准任务:SNOMED CT 标签体系 + reward matrix 部分得分制评分代码全开源(BSD 3-Clause),39 支上榜队伍的完整训练代码赛后公开,构成了 ECG 深度学习公开得最彻底的方法学工具箱。其三,一份 挑战赛组织方法学的范本:异构标签映射协议、隐藏集管理规则、"提交完整训练代码"的可复现性门槛,被后续 2022-2025 各届挑战赛直接沿用,成为医学 AI 竞赛的准行业标准。
在进入正文前,先交代条目写作的三条纪律:所有数字只采用官方三源(PhysioNet 内容页、官方项目页、挑战赛论文),第三方转述一律回源核对;所有推算值(如 Ningbo 34,905)显式标注推算属性;所有与官方口径的冲突(论文摘要 vs 正文等)逐条存照到坑点清单与附录 L——这三条纪律与库内其他条目的编辑规范一致,也是本条目"可信度密度"的来源。
三个数字先立住体感:131,149 条记录让它稳居公开 12 导联 ECG 数据集的规模榜首(第二名 PTB-XL 是它的约六分之一);26 类计分标签 + 部分得分制让它区别于一切"准确率定胜负"的基准;0.036 的导联降级中位损失是它留给产业界最重要的一句话结论。
导语读法三则:
- 只想下数据训练模型:直奔 §6 获取与许可——CC BY 4.0 无门禁,7 个公开库可整包或分库下载;注意 9 库采样率与时长异构(§2.5),INCART 是 30 分钟长程库(坑 7)。
- 关心跨机构泛化与标签质量:直奔 §4(标签体系与评分设计)与 §5.4(榜单结果解读)——异构标签是本数据集最大的暗坑,弱标注原样继承(§2.8)。
- 做便携/可穿戴心电产品:直奔 §3(降导联任务设计)与 §5.4——"2 导联 ≈ 12 导联"的官方结论有三条严格适用边界,引用时不可省略。
§0 导读:这个数据集解决什么问题
0.1 问题背景:12 导联的普及性与可及性矛盾
心血管疾病(cardiovascular disease)是全球头号死因,12 导联 ECG 是最普及的心脏诊断工具——但它有一个结构性矛盾:标准 12 导联需要 10 个电极(4 个肢体电极 + 6 个胸前电极)、专业设备与受训操作者,而远程医疗、家庭监护、可穿戴场景只能提供 2-6 条导联。产业与学术界长期各说各话:单导联设备厂商宣称"够用",传统心电学界坚持"不能替代"。2017 年的 CinC 挑战赛用单导联做过房颤分类(physionet-cinc-2017),2020 年用 12 导联做过 27 类异常分类,但没有人用同一批数据、同一个评分、同一批算法严格比较过"12 条导联丢掉 10 条之后诊断能力剩多少"。
这个矛盾在 2020-2021 年变得尤其尖锐:新冠疫情把大量诊疗推到院外,远程心电监测设备出货量激增,而监管与临床指南几乎没有"降导联诊断有效性"的定量依据可引。CinC 2021 的命题设定正是对这个空档的直接回应——组织方在项目页开宗明义:“reduced-lead ECG systems hold promise”(降导联系统前景可期),但需要证据。
0.2 四层回答:数据、任务、评分、复现
CinC 2021 的回答分四层。第一层是数据规模:9 个数据库、131,149 条带临床诊断的 12 导联 ECG,覆盖中国、俄罗斯、德国、美国四国,跨越洲际的人群与设备差异——这是当时最大的公开多库 ECG 汇编。第二层是任务设计:训练集给全 12 导联,验证与测试集按 6/4/3/2 导联四种组合分组发放,把"导联数量"从自然差异变成受控实验变量。第三层是评分创新:reward matrix(奖励矩阵)部分得分制——把"误诊为相似病"与"误诊为完全无关病"区分计分,反映临床现实。第四层是可复现性门槛:参赛必须提交可运行的完整训练代码(默认 BSD 3-Clause 开源),最终 39 支上榜队伍的算法全部公开。
值得留意组织方的延续性:从 2015 届假警报抑制到 2021 届,核心组织者(Clifford、Moody 传承团队)与部分参赛者(Plesinger)横跨两届夺冠与办赛——挑战赛系列的组织记忆使"数据预处理惯例、评分哲学、公告风格"在届际高度连续,这也是为什么库内把六届挑战赛条目做成横链:读懂一届的文档结构,就读懂了全部。
0.3 官方结论与它的三重边界
官方结论:不同导联组合间测试分数中位变化 ≤0.036,两两配对符号秩和检验 p≥0.50——统计上无显著差异。这个结论的正确打开方式带三重边界:它是"算法在完整 12 导联数据上训练"后的表现(不是在降导联数据上重新训练);它是群体层面的统计结论(不保证单个患者、单个诊断类目不发生可感退化);它是 26 类计分口径(不自动外推到 133 类全词表)。§5.4 将逐条展开。
§0 读法三则:
- 这个条目记的是"挑战赛数据集汇编"本体:CPSC、PTB-XL、Chapman-Shaoxing 等子库在库内另有独立条目(§9),本条目不重复子库内部细节,只写汇编版差异、任务与榜单。
- 全文硬数字三源互证(PhysioNet 官方内容页、官方项目页、CinC 论文);论文摘要与正文的总量双口径(131,155 vs 131,149)已在坑 1 存照。
- 检索时注意:本条目 url_name 为
cinc-2021,与 2015/2016/2017/2018/2023 各届条目同系列;"PhysioNet Challenge 2021""CinC Challenge 2021"“Will Two Do” 指同一赛事。
0.4 第一印象:与库内其他心电数据集的一句话对照
在深入细节之前,先给一个定位坐标系——如果你带着"我要找 X"的问题来,以下对照能立刻分流:
- 找规模最大的公开 12 导联多标签语料 → 本条目(88,253 条公开训练,四国人群)。
- 找标签最精细的单国 ECG 库(逐诊断编码树、科研级复审)→ ptb-xl(70) 原库条目。
- 找中国人群心律失常富集样本 → cpsc(132) 原库条目。
- 找ICU 真实监护环境的心电(噪声大、与临床时序联动)→ mimic-iv-ecg(172)。
- 找单导联可穿戴筛查任务的源头 → physionet-cinc-2017(162)。
- 找波形警报/术中监测 → cinc-2015(487)、vitaldb(192)。
本条目的不可替代之处:上述任何单一库都不提供"官方统一编码+跨国人群+权威榜单+开放评分代码"的组合——这正是"挑战赛汇编版"这一形态的价值。
0.5 三个速览表:规模、榜单、许可
规模速览(详见 §2):
| 层级 | 条数 | 库数 | 可得性 |
|---|---|---|---|
| 公开训练 | 88,253 | 7 | CC BY 4.0 直链下载 |
| 隐藏验证 | 6,630 | 2 | 挑战赛期间对参赛者开放,赛后不公开 |
| 隐藏测试 | 36,266 | 4 | 永久隐藏(官方沙箱计分专用) |
| 合计 | 131,149 | 9 | — |
榜单速览(详见 §5):冠军 ISIBrno-AIMT 0.58(六榜全一);亚军 DSAIL SNU 0.57;季军 NIMA 0.56;68 队 1,056 次提交。
许可速览(详见 §6):数据 CC BY 4.0(商用允许+署名义务);评分代码 BSD 3-Clause;参赛算法默认 BSD 3-Clause 开源;隐藏集无许可问题(拿不到)。
§1 数据集速览:十问十答
Q1:131,149 条数据我实际能拿到多少?
公开训练集 88,253 条(7 个库),PhysioNet 直接下载、CC BY 4.0、无需注册资质。剩余 6,630 条验证 + 36,266 条测试为隐藏数据,永远不公开——挑战赛已于 2022 年 1 月收官,隐藏集仅用于官方计分与后续焦点期刊的复评。换句话说,公开部分约占总量的 67%,这个比例在"挑战赛型"数据集中属于厚道的一档(不少赛事公开训练集仅占两三成)。
Q2:公开训练集的 7 个库分别是什么?
CPSC 2018(6,877 条)、CPSC-Extra(3,453)、圣彼得堡 INCART(74)、德国 PTB(516)、PTB-XL(21,837)、美国 Georgia G12EC(10,344)、Chapman-Shaoxing + Ningbo(合计 45,152,其中 Chapman-Shaoxing 10,247、Ningbo 推算 34,905)。前两者与中国数据对应,INCART 来自俄罗斯,PTB 系来自德国物理技术研究院(Physikalisch-Technische Bundesanstalt, PTB),G12EC 代表美国东南部人群,Chapman-Shaoxing/Ningbo 来自中国两所医院。逐库画像见 §2.1。
Q3:这些库和库内已有的独立条目是什么关系?
cpsc(132)、ptb-xl(70)、Chapman-Shaoxing(143) 已有独立条目,记录的是各库原始版本;CinC 2021 用的是官方统一重编码版——年龄性别做了 HIPAA 兼容一致化、标签近似映射到 SNOMED CT、统一 WFDB 格式。数字上与原库可能有出入(如 Ningbo 子集),以挑战赛版为准。mimic-iv-ecg(172) 非 2021 来源,但同属 12 导联大库常被并排比较。
Q4:标签是什么体系?
每条记录带一组心脏异常诊断标签(多标签),合并自 9 库的 133 种诊断,官方近似映射到 SNOMED CT 编码。其中 26 类参与计分(scored labels,如房颤/房扑 nvAF、左束支阻滞 CLBBB/LBBB、室性心动过速等),其余约 107 种出现但不计分。官方明言没有修改各库原始标签,只做了编码层面的映射——这意味着标签噪声原样继承(§2.8)。
Q5:26 类是哪来的?
官方组织的心脏病学专家从 133 种诊断中选出临床重要且各库均有代表的 26 类作为 scored labels,并给出两两之间的"相似度系数"用于部分得分计算。选择逻辑有两层:临床后果的严重度梯度(漏诊室颤与漏诊窦缓不是一个量级)与跨库可评估性(某类若只在单一库出现,跨库泛化评估就失去意义)。完整清单见附录 E。
一个直观感受:26 类几乎覆盖了门诊心电图报告的全部高频结论——从"窦性心律不齐"级的轻微异常到需要急诊处置的恶性节律。这也是为什么它适合做通用心电模型的目标空间:类目少到可以逐类审核,又多到覆盖真实报告分布。
Q6:降导联任务是怎么设计的?
训练集只有 12 导联全信号。验证与测试集按 6 导联(I,II,III,aVR,aVL,aVF)、4 导联(I,II,III,V2)、3 导联(I,II,V2)、2 导联(I,II)四种组合分组——同一算法要在所有导联子集上工作。选择这些组合的原则是最大化独立导联信息(如 2 导联取 I 和 II,因为其余肢体导联都可由 I、II 线性推导)。设计细节与线性代数依据见 §3。
Q7:评分怎么算?
reward matrix 部分得分制:对每条记录,算法输出与真值标签逐对比较,误诊若指向"治疗/结局相似"的诊断(专家判定系数)则得部分分。全对分类器得分 1,全标窦性心律(NSR)得分 0,全阳输出典型为负分。官方 Python/MATLAB 评分代码全开源(BSD 3-Clause)。数值示例见 §4.5。
Q8:比赛结果如何?
68 队提交 1,056 次算法,618 次成功,39 队上榜。冠军 ISIBrno-AIMT(捷克科学院 ISI Brno,Plesinger 组)以残差 CNN 集成+注意力机制在 12/6/4/3/2 导联及综合榜全部第一(all-lead 0.58);亚军 DSAIL SNU(首尔国立大学)0.57;季军 NIMA 0.56。前三名差距仅 0.02——顶级队伍之间比拼的是稳定性的毫厘。
Q9:"两条导联够用"的官方结论是什么?
不同导联组合间测试分数中位变化 ≤0.036,两两配对符号秩和检验 p≥0.50——统计上无显著差异。但注意适用边界:这是"同一算法自适应训练"下的结论,且个别诊断(依赖胸前导联空间信息的类目)仍有可感差异。三重边界的完整表述见 §0.3 与 §5.4。
Q10:为什么它对 AI-Ready 重要?
它是"开放数据+开放评分+开放算法"三件套的模范样本:数据 CC BY 4.0 无门禁,评分代码官方开源,39 支上榜算法全部公开可查——从原始数据到可复现基线的完整链条零门槛。相比之下,同域的 MIMIC 系数据需要凭资质申请,本数据集是心电 AI 入门的最快路径。DAIMS 综合评级 8.2/10(附录 B),为库内心电域最高档。
一分钟总结卡:
| 如果你只有一分钟 | 记住这三行 |
|---|---|
| 数据 | 9 库 131,149 条 12 导联 ECG;88,253 条公开(CC BY 4.0),7 库分取 |
| 任务 | 26 类 SNOMED CT 多标签 × 12/6/4/3/2 导联;训练全导联、测试降导联 |
| 结论 | 降导联性能中位损失 ≤0.036(p≥0.50);冠军 ISIBrno-AIMT 0.58,全套代码公开 |
§2 数据构成与规格
2.1 九库总览:4 国 3 大洲的异构拼图
CinC 2021 汇编了 9 个数据库(论文正文口径 131,149 条),按用途分为三层:公开训练(7 库 88,253 条)、隐藏验证(2 库 6,630 条)、隐藏测试(4 库 36,266 条,其中 2 个库从未在训练/验证中出现——用于真正的分布外泛化测试)。
| 库 | 国家 | 训练 | 验证 | 测试 | 采样率 | 时长 | 合计 |
|---|---|---|---|---|---|---|---|
| CPSC 2018(中国生理信号挑战赛) | 中国 | 6,877 | — | — | 500 Hz | 6-144 s | 6,877 |
| CPSC-Extra(2018 未用数据) | 中国 | 3,453 | — | — | 500 Hz | 6-60 s | 3,453 |
| St Petersburg INCART | 俄罗斯 | 74 | — | — | 257 Hz | 30 min | 74 |
| PTB Diagnostic ECG | 德国 | 516 | — | — | 1000 Hz | 10-120 s | 516 |
| PTB-XL | 德国 | 21,837 | — | — | 500/1000 Hz | 10-120 s | 21,837 |
| Georgia 12-Lead(G12EC) | 美国 | 10,344 | 5,167 | 5,161 | 500 Hz | 5-10 s | 20,672 |
| Chapman-Shaoxing(Chapman 大学/绍兴人民医院) | 中国 | 10,247 | — | — | 500 Hz | 10 s | 10,247 |
| Ningbo(宁波第一医院) | 中国 | 34,905* | — | — | 500 Hz | 10 s | 34,905* |
| UMich(密歇根大学) | 美国 | — | — | 19,642 | 250/500 Hz | 10 s | 19,642 |
| Undisclosed American | 美国 | — | — | 10,000 | — | — | 10,000 |
| 合计 | 4 国 | 88,253 | 6,630 | 36,266 | — | — | 131,149 |
* Ningbo 单库数字为官方合计 45,152(Chapman-Shaoxing+Ningbo)减去 Chapman-Shaoxing 10,247 的推算值;官方项目页未单列(坑 3)。
校验三条线全部闭合:训练层 6,877+3,453+74+22,353(PTB 源)+10,344+45,152 = 88,253;验证层 5,167+1,463(CPSC 测试拆分)= 6,630;测试层 5,161+19,642+10,000+1,463 = 36,266。三层相加恰为论文正文的 131,149。
2.2 逐库画像:每一块拼图的来历与性格
CPSC 2018(6,877 条)。2018 年中国生理信号挑战赛(China Physiological Signal Challenge)的训练集,在南京举办的第七届国际生物医学工程与生物技术会议上发布。标签覆盖 9 类心律失常清单,500 Hz,时长 6-144 秒不等。它的加入为汇编提供了亚洲人群中高度不平衡但标注明确的心律失常样本;其隐藏测试部分在 2021 届被拆分为验证与测试两组(1,463 条),是唯一横跨三个层级的库。
CPSC-Extra(3,453 条)。CPSC 2018 收集但未用于当年挑战赛的余量数据,与主集同源同规格。官方将其并入训练层,等效于给亚洲人群样本扩容近一半;对复现者的意义是"同源双份"——两库记录风格一致,按库分层验证时可将它们视为同一域。
St Petersburg INCART(74 条)。圣彼得堡 12 导联心律失常数据库的挑战赛版,从 32 条 Holter 监护记录中拆出 74 条长程片段,每条 30 分钟、257 Hz。它是整个汇编中唯一的"长程动态心电"样本——其他库都是临床静息短程记录。规模极小(74 条)但信号性质独特:体动伪影、日常活动噪声、非标准记录姿势都是其他库没有的扰动源(坑 7)。
PTB Diagnostic ECG(516 条)。德国 PTB 的经典诊断库,1980-1990 年代采集,包含健康对照与各类心脏患者,1000 Hz 高采样率。规模小但诊断分类精细,是"德国精细标签传统"的源头库。
PTB-XL(21,837 条)。PTB 的 XL 扩展(2019-2020 年整理发布),是汇编中最大的单一来源库,18885 级患者规模、精细的多级标签树。500 或 1000 Hz 双采样率、10-120 秒时长。它为汇编贡献了约四分之一的训练数据与最系统的标签结构;跨库训练时它的患病率分布与 CPSC 系差异显著(PTB-XL 偏临床常规检查人群,CPSC 偏心律失常富集人群)。
Georgia G12EC(20,672 条)。美国东南部单一人群的 12 导联库,挑战赛专属——公开发布仅限挑战赛版。它被官方拆成三份:10,344 条进训练、5,167 条进验证、5,161 条进测试,是唯一跨三层的美国公开库,也是"同库同源跨层评估"的主要载体。500 Hz、5-10 秒,记录偏短。
Chapman-Shaoxing(10,247 条)。Chapman 大学与绍兴人民医院合作库的中国侧数据,500 Hz、整齐的 10 秒记录。原库在库内有独立条目(143),此处为官方重编码版。
Ningbo(推算 34,905 条)。宁波第一医院子库,与 Chapman-Shaoxing 同批发布(官方参考文献 [5][6] 同源),合计 45,152 条。它是公开训练层最大的单一构成——占整个训练层的近 40%。10 秒、500 Hz、规格与 Chapman-Shaoxing 一致。由于官方从未单列其数字,34,905 是减法推算值(坑 3);引用时务必注明。
UMich(19,642 条,仅测试)。密歇根大学急诊医学系的 ECG 库,10 秒、250/500 Hz 混合采样率。它不出现在训练与验证层——官方设计里它是"测试时才见到的陌生机构"之一,专门用于考察算法面对新医院标注习惯与设备链的表现。
Undisclosed American(10,000 条,仅测试)。来源刻意保密的美国数据库。官方不披露其机构、采样率甚至记录时长规格——保密的唯一目的是防止参赛者通过反推来源机构来"适配"测试分布(坑 8)。它在论文里连描述段都只有一句话,是整个数据集神秘感与评估严谨性的双重象征。
2.3 逐库使用注意事项速查
| 库 | 最常见的误用 | 正确姿势 |
|---|---|---|
| CPSC 2018 | 把它与 CPSC-Extra 当独立人群做跨库泛化 | 两库同源,分层验证时应合并为一域 |
| CPSC-Extra | 以为有独立文档 | 无独立文档,规格同 CPSC 主集 |
| INCART | 按 10 秒短程假设读数据 | 30 min 长程,需分段(坑 7) |
| PTB | 与 PTB-XL 混淆记录数 | 516 vs 21,837,两库独立 |
| PTB-XL | 假设全库同一采样率 | 500/1000 Hz 双档,逐记录读 .hea |
| Georgia G12EC | 当作公开独立库去原站找 | 挑战赛专属,仅经 challenge-2021 发布 |
| Chapman-Shaoxing | 与库内条目(143)数字硬对齐 | 挑战赛版做了重编码,口径以挑战赛版为准 |
| Ningbo | 直接引用"官方数字" | 34,905 为推算值(坑 3) |
| UMich | 试图下载 | 仅隐藏测试,不可得 |
| Undisclosed American | 试图识别来源机构 | 官方刻意保密(坑 8) |
2.4 三个隐藏库的设计意图
隐藏测试集里有两个库在训练与验证中完全缺席:UMich(19,642 条)与 Undisclosed American(10,000 条)。这是挑战赛评估哲学的核心:如果测试库全部来自训练库的"同源拆分",排名衡量的只是拟合能力;引入两个全新机构(其中一家连名字都不告诉你),考察的才是算法面对陌生设备、陌生标注习惯、陌生人群时的真实表现。Undisclosed American 的保密理由是防"人肉识别"——若有队伍通过人口学与波形特征反推来源机构,泛化测试就失效了。这也是该库永久不公开的原因。
与 2020 届相比,2021 届隐藏测试的"全新源占比"显著提高(2020 年测试主要来自已见库的拆分),这使得两届榜单分数不可直接比较——同样是 0.5 上下,2021 年的 0.5 更"硬"。
2.5 信号规格:异构是常态,不是缺陷
| 属性 | 规格 |
|---|---|
| 导联 | 标准 12 导联:I, II, III, aVR, aVL, aVF, V1-V6 |
| 采样率 | 257 Hz(INCART)/ 250-500 Hz(UMich)/ 500 Hz(CPSC、Georgia、Chapman-Shaoxing、Ningbo)/ 500-1000 Hz(PTB、PTB-XL) |
| 时长 | 5 s(G12EC 下限)至 30 min(INCART Holter 长程) |
| 格式 | WFDB:.mat 信号 + .hea 头文件(Octave/MATLAB 兼容) |
| 人口学 | 年龄、性别(HIPAA 兼容一致化标识,非原始值) |
| 标签 | SNOMED CT 编码集合(多标签,逐记录 1-N 个) |
与 2015 年挑战赛"统一重采样到 250 Hz"的处理不同,CinC 2021 保留各库原始采样率与时长——官方只在评分代码与示例提交里提供读取与统一处理的建议实现。对复现者的含义:任何跨库训练都需要自己定义重采样/分段协议,而协议选择本身会影响分数;论文与开源示例代码(physionetchallenges GitHub)给出的基线做法是重采样到 500 Hz、按记录整段读取。
WFDB 头文件(.hea)逐记录携带采样率、增益、ADC 分辨率与导联名——同一库内也可能混合规格(如 PTB-XL 的 500/1000 Hz 双档、UMich 的 250/500 Hz 双档),读取代码必须逐记录解析 .hea 而不能写死全局常数。这是本数据集工程侧最常见的翻车点,官方论坛里相关问答贯穿整届赛事。
2.6 与 2020 年挑战赛数据的演进关系
CinC 2021 数据是 2020 年版本的超集扩展:
| 维度 | 2020 届 | 2021 届 |
|---|---|---|
| 来源库 | 6 库(CPSC、CPSC-Extra、INCART、PTB、PTB-XL、G12EC、Chapman-Shaoxing 早期版) | 9 库(新增 Ningbo、UMich、Undisclosed American) |
| 计分类目 | 27 类 | 26 类(调整) |
| 任务 | 纯 12 导联 | 12/6/4/3/2 导联五档 |
| 公开训练规模 | 约 4.3 万条 | 88,253 条 |
| 数据 DOI | 独立(challenge-2020) | 10.13026/g9wd-3j66 等 |
两届数据文件大部分重叠但不完全一致(官方对部分库做了修订),引用时不可把两届数字混写(坑 4)。PhysioNet 上 challenge-2020 与 challenge-2021 是两个独立 DOI 的数据集;本条目所有数字均为 2021 届口径。
文件级差异的三条实操提示:其一,同名记录在两届的标签可能不同(官方做过修订),跨届合并训练前必须做标签 diff;其二,Ningbo 与 UMich 是 2021 届新增,2020 届复现者勿在 2020 届数据里找它们;其三,官方在 2020 届论文中报告的部分质量指标不适用于 2021 届文件——质量自查要重做。
2.7 标签体系:133 种诊断到 26 类计分的两级结构
9 个库的原始标签体系互不相同:PTB-XL 自带精细的诊断编码树,CPSC 用自有异常清单,G12EC 用医院心电图报告词表。官方做的不是"统一重标",而是"近似映射":把各库标签对齐到 SNOMED CT 编码,最终形成 133 种诊断的合并词表;同义与包含关系(如左束支阻滞的两种写法)被合并到同一计分类目(CLBBB/LBBB 同列)。
26 个计分类目(scored labels)覆盖五组临床场景:节律异常(nvAF 房颤/房扑、AFL、STach 窦速、SB 窦缓、Brady 心动过缓)、传导异常(IAVB 房室传导阻滞、IRBBB/CRBBB/RBBB 右束支、CLBBB/LBBB 左束支、NSIVCB 非特异性室内传导阻滞)、电轴与形态(LAD 电轴左偏、RAD 电轴右偏、LAnFB 左前分支阻滞、LQRSV 低 QRS 电压、PR/PRWP 相关类目)、除极/复极异常(TAb T 波异常、TInv T 波倒置、QAb Q 波异常、LQT 长 QT)、与排除性诊断(NSR 正常窦律、PAC/SVPB 室上性早搏、PVC/VPB 室性早搏)。完整 26 类及分组对照见附录 E。
患病率不均衡是标签层的显著特征:正常窦律与 T 波异常类占绝对多数,LQT、LAnFB 等类在部分库中样本极少。官方的应对是把评估收缩到 26 类并采用 reward matrix——但不均衡本身没有矫正,训练时的采样策略由参赛者自担。
SNOMED CT 映射的粒度示例:原库写 “bundle branch block”(束支阻滞)的记录被近似映射到 BBB 大类,再按左右与完全与否细分到 CLBBB/LBBB 与 CRBBB/RBBB 计分列——同一计分列内的不同 SNOMED 码在 reward matrix 中共享行列,即"同分不同码"。理解这一层,才能理解为什么 133 类词表与 26 类计分集之间是多对少的投影关系。
2.8 数据质量边界:官方不改数据的三条推论
官方明言"did not change the data or labels from the original databases except…"(仅做人口学一致化、SNOMED 近似映射、WFDB 编码)。这个保守策略有三条对使用者重要的推论:
- 标签噪声原样继承:各库原始标签的错标、漏标(临床报告驱动的弱标注)不做修正;133 类诊断的患病率在库间高度不均衡,个别类目样本极少。
- 信号质量原样继承:基线漂移、噪声、导联反接等原始缺陷保留——官方在 2020 年论文中已提示部分记录存在质量问题。
- 人口学粒度受限:年龄为整数、性别为二值,且经一致化后无法回溯原始记录;除此之外无临床协变量(无用药、无超声、无结局随访)——它是纯"信号→诊断"数据集,做不了多模态或预后研究。
一句自查:如果你的研究设计里出现了"按患者分组"“按用药分层”"随访结局"中的任何一个词,换数据集——这三个词都不在本数据集的能力圈内。
§3 任务设计:把"导联数量"变成受控变量
3.1 问题的临床与产业背景
12 导联 ECG 的标准采集需要 10 个电极(4 肢端 + 6 胸前),受设备、环境、操作者技能约束;而单导联手持设备、双导联可穿戴、6 导联便携贴片正在快速普及。核心临床问题是:降导联设备记录的信号,到底能支撑多少诊断决策?此前文献要么比较特定疾病(如房颤筛查),要么用小样本;CinC 2021 第一次在 26 类异常、13 万条记录、跨国多库的尺度上给出系统答案。
监管语境放大了这个答案的价值:FDA/CE 对心电软件的审评关注训练数据代表性,而"降导联设备+全导联训练模型"的组合此前没有大规模公开证据——CinC 2021 的榜单与统计检验为这类产品讨论提供了可引用的公共基线(引用时仍须带上 §5.5 的三条件)。
3.2 四种降导联组合的选择逻辑
| 导联组合 | 导联 | 模拟场景 |
|---|---|---|
| 12 导联(全导联) | I, II, III, aVR, aVL, aVF, V1-V6 | 标准临床检查 |
| 6 导联 | I, II, III, aVR, aVL, aVF | 仅肢体导联(部分便携机) |
| 4 导联 | I, II, III, V2 | 肢体三导+单个胸前导联 |
| 3 导联 | I, II, V2 | 简化监护配置 |
| 2 导联 | I, II | 可穿戴/手持设备常见配置 |
组合选择遵循"最大化独立信息"原则:肢体导联之间存在精确的线性关系,因此 2 导联选 I+II 已包含全部肢体导联的线性信息空间;胸前导联单独保留 V2(对前壁信息量最大的导联)。6/4/3/2 的梯度让"信息递减曲线"可以被逐点测量。
3.3 导联线性依赖的推导(为什么 I+II 就"够了"肢体部分)
Einthoven 三角给出肢体导联间的恒等关系:III = II − I(每个心动周期逐样本成立)。加压肢体导联可由 I、II 线性表出:aVR = −(I+II)/2,aVL = I − II/2,aVF = II − I/2。因此 6 个肢体导联的信号空间实际只有 2 个自由度——拿到 I 和 II 就拿到了全部肢体导联的线性信息。6 导联组合(全部肢体导联)与 2 导联(I+II)在"线性信息"意义上等价,差异只来自噪声实现与电极接触质量。真正不可线性恢复的是胸前导联 V1-V6 的空间信息——4/3 导联组合保留 V2 正是为这一层。这个推导同时解释了官方结论的机理:降导联损失的主要是胸前导联的局部空间信息,而 26 类计分中多数类目(节律、传导的肢体导联特征)对胸前空间信息依赖有限。
3.4 训练-测试的不对称设计
参赛者拿到的是:全部 88,253 条训练记录的完整 12 导联信号 + 验证/测试记录的指定导联子集信号 + 所有记录的年龄/性别。官方在挑战赛开始时同步公开验证集信号(6,630 条),供参赛者本地调参;测试集信号在官方提交沙箱中才可见。这个设计的巧妙之处:算法无法"针对导联缺失特判",因为训练时不知道测试会用哪个子集——它必须学到对任意导联组合鲁棒的表征。
3.5 提交与复现门槛
与早年挑战赛"只交结果文件"不同,CinC 2020/2021 起官方要求提交完整可运行的训练代码(entry 内含环境脚本/训练脚本/推理脚本),在官方 Google Cloud 沙箱(参考配置 n1-highmem-8)复跑验证。未指定 license 的提交默认按 BSD 3-Clause 开源;非开源提交可计分但不参与排名。这一"可复现性硬门槛"使 39 支上榜队伍的算法在赛后全部公开,形成本数据集最大的下游资产之一。
3.6 官方导联组合的实现陷阱
把导联组合写进代码时有四个高频翻车点:
- 导联名大小写与写法:WFDB 头里导联名多为 “I”“II”“V2” 罗马数字写法,但部分库(改造自旧系统的)出现 “aVF” 与 “AVF” 混写——对齐函数必须做规范化(附录 G align_leads 的 leads.index 前先 normalize)。
- 缺导联的填充语义:某条验证记录缺 V2 时,填零还是丢弃?官方计分按"提交全记录"走,缺失导联自己处理——但训练时学到的"零导联响应"会污染推理,建议丢记录而不是填零。
- 线性推导的诱惑:既然 III=II−I,能否从 2 导联"恢复"6 导联再喂给 12 导联模型?可以算,但噪声被放大且会引入非物理的相关性——官方算法平均不这么干,复现研究里这样做需要显式声明。
- 组合×库的分组验证:报告降导联性能时,"库 × 导联组合"至少要分 7×4 组看分布——只看总均值会掩盖"某库在 2 导联下崩掉"的局部失效。
§4 评分体系:reward matrix 与临床部分得分
4.1 为什么不用普通 F1
多标签分类的标准指标(micro/macro-F1)有一个临床不合理性:把"房颤误判为房扑"与"房颤误判为正常窦律"同等惩罚。但前者两者都是需要抗凝决策的室上性心律失常,临床后果接近;后者则可能漏掉抗凝指征。CinC 2020 起官方引入 reward matrix(奖励矩阵):由心脏病学专家对 26 类两两打分(0-1 之间的相似度系数),误诊时按系数给部分分。
4.2 评分公式与归一化口径
对每条记录,算法输出一个 26 维二值向量;官方按 reward matrix 计算记录级得分并逐库求和归一化。两个锚点:全对分类器 = 1(每个真标签都被输出、且无错误输出);全标窦性心律(NSR)= 0——不是随机基线,而是"临床最保守错误策略"基线。全阳输出(什么都说阳性)会因误诊惩罚得到负分。这个设计让"宁可错杀"的模型策略在分数上不可存活。
4.3 官方评分代码与本地复现
评分实现开源在 physionetchallenges GitHub(Python 与 MATLAB 双版本),含 26 类 SNOMED CT 码、reward matrix 全表与官方验证集(6,630 条)评分入口。参赛者本地可对验证集复算官方口径分数;测试集(36,266 条)仅限官方沙箱计分。复现提示:官方代码对输出格式(CSV 列序、SNOMED 码写法)有严格校验,格式错误直接判 0——这也是 68 队 1,056 次提交中仅 618 次成功的主要原因之一。
格式校验的五个具体检查点(官方代码视角):记录名清单与官方验证集完全一致(多一行少一行都不行);SNOMED 码必须是官方 classes 文件的原样字符串(不得自行展开层级);输出列序按官方模板;文件编码 UTF-8 无 BOM;每记录必须有输出(缺记录按错误计)。五项全过才算"成功提交"。
4.4 评分哲学的方法学意义
部分得分制后来被 2022(心音图)、2023(心脏骤停神经预后)各届沿用并扩展。它把"临床相似性"显式编码进评估,是对"one-hot 准确率"范式的系统性修正。对本数据集使用者:若在挑战赛版数据上训练并自评,应优先采用官方 reward matrix 口径以保持与 39 支公开算法可比;改用 macro-F1 会导致与榜单数字不可比。
4.5 一个数值小例(读懂 reward 的最小样本)
设某记录真值标签为 {nvAF}(房颤/房扑),算法输出 {nvAF, RBBB}:
- nvAF → nvAF:正确检出,贡献满额正向分;
- RBBB → 非真值:误诊输出,按"真值 nvAF vs 输出 RBBB"的 reward 系数扣减——房颤与右束支阻滞临床后果相去甚远,系数接近 0,扣减接近全额。
再设另一记录真值 {nvAF, AFL},算法输出 {nvAF}:
- nvAF 正确;漏检 AFL——漏检惩罚同样经 reward 系数加权,而 AFL 与 nvAF 的系数很高(两者常并存且治疗相近),因此该漏检的损失远小于漏检室颤类。
4.6 reward matrix 的四个常见误读
- 把部分得分当"部分正确":误诊相似病拿到的部分分是"扣分减轻",不是"也算对"——混淆矩阵里它仍是假阳性/假阴性。
- 把 NSR=0 当随机基线:0 分是"全漏诊策略",随机输出策略的期望分数是负的——报告中"高于随机"的说法要用错锚点。
- 跨类目比分数:记录级得分聚合后,患病率不同的类目对总分的贡献不同;逐类分析要看 per-class 召回而不是总分分解。
- 改指标后硬对标:macro-F1、AUROC 与 reward-score 三者非线性相关——换指标后与榜单 0.58 的任何直接比较都是无效比较(坑 5 的展开)。
两个小例合起来是官方设计的全部意图:分数的分子分母都带临床语义,"错得像"与"错得离谱"在分数上被区分开。
§5 挑战赛执行与榜单
5.1 时间线与参与规模
| 时间 | 事件 |
|---|---|
| 2020-12-24 | 数据集 v1.0.0 上线 PhysioNet(challenge-2021) |
| 2021-02-24 | leaderboard 上线,非官方(unofficial)阶段开跑 |
| 2021-04 中旬 | 非官方阶段截止(CinC 摘要提交同步截止) |
| 2021-09-15 | 捷克 Brno CinC 会议现场公布获奖者 |
| 2021-10 ~ 2022-01 | Physiological Measurement focus issue 收稿窗口 |
| 2022-01-26 | 官方宣布 2020/2021 两届挑战赛收官、最终成绩发布 |
参与规模:68 支队伍、1,056 次算法提交(618 次成功)、39 队获得排名资格。提交成功率约 59%——失败主因是输出格式不符与沙箱复跑超时,这本身就是官方"可复现性门槛"起作用的证据。挑战赛由 Google、MathWorks、Gordon and Betty Moore Foundation 联合赞助,NIH NIBIB 基金 R01EB030362 支持。
两阶段规则:非官方阶段(unofficial phase)用于"beta 测试"数据、分数与提交系统,参赛者可在低风险环境试错;官方阶段(official phase)计入最终排名。这一节奏自 2010 年代中期成为系列惯例,2021 届同样沿用。
5.2 官方最终榜单(全部六个计分维度)
官方 results 页按 12/6/4/3/2 导联与 all-lead(12/3/2 三项均值)六个维度排名。前三名:
| 排名 | 队伍 | all-lead | 3-lead | 2-lead | 方案 |
|---|---|---|---|---|---|
| 1 | ISIBrno-AIMT(捷克科学院 ISI Brno + AIMT) | 0.58 | 0.58 | 0.58 | 残差 CNN 集成 + 注意力机制 |
| 2 | DSAIL SNU(首尔国立大学) | 0.57 | 0.57 | 0.57 | 高泛化性深度网络 |
| 3 | NIMA(Wickramasinghe & Athif) | 0.56 | 0.55 | 0.55 | 深度卷积网络多标签分类 |
排名 4-8(论文/结果页口径,展示中游密度):
| 排名 | 队伍 | 方案主题 |
|---|---|---|
| 4 | cardiochallenger | 通道自注意力深度框架 |
| 5 | CeZIS | 两阶段 1D-CNN + 修改标签 |
| 5(并列区间) | USST_Med | 深度残差 CNN |
| 7 | DataLA_NUS | 任务感知的鲁棒残差网络训练 |
| 8 | SMS+1 | 非对称损失 + 自学习标签校正 |
注:官方 results 页的 rank 在不同导联维度上并列交错(如 CeZIS 6 导联第 3、12 导联第 6),上表以 all-lead 为主序整理;精确逐维度排名以官方 results 页为准。
冠军 ISIBrno-AIMT 的统治力罕见:六个榜全部第一(2/3/4/6/12 导联及综合)。核心成员 Petr Nejedly、Adam Ivora、Ivo Viscor、Zuzana Koscova、Radovan Smisek、Pavel Jurak、Filip Plesinger——其中 Plesinger 也是 2015 年 CinC 挑战赛(ICU 假警报抑制,库内条目 cinc-2015)Event 1 冠军,六年两冠横跨两个十年。冠军论文 “Classification of ECG using Ensemble of Residual CNNs with Attention Mechanism” 随挑战赛论文集公开,残差 CNN 集成的骨干选择与注意力头设计可直接复现。
5.3 中游队伍方案综述(方法学抽样)
官方 results 页对每支上榜队伍附论文链接。从方法谱系看,39 支上榜队伍的技术路线呈三层分布:
| 路线 | 代表队伍 | 特征 |
|---|---|---|
| 残差 CNN 集成 + 注意力 | ISIBrno-AIMT(冠军)、CeZIS(第 5) | 多骨干平均、SE/通道注意力、TTA(测试时增强) |
| 端到端深度网络调优 | DSAIL SNU(亚军)、NIMA(季军)、USST_Med | 单模型为主、重数据增广与损失设计 |
| 特征工程 + 浅层分类器混合 | 部分中游队伍 | 心拍形态学特征 + 梯度提升/线性模型 |
值得注意的共性:几乎全部前排队伍都做了"导联自适应"处理——按输入可用的导联子集动态选择卷积通道或特征分支,而不是训练五个独立模型。这印证了官方任务设计的意图:考察的是表征层面的导联鲁棒性,而非工程上的多模型堆叠。上表第三条路线的最好成绩与深度路线差距明显——在 26 类多标签、10 万条级数据面前,端到端深度学习的规模优势难以撼动。
5.4 分数的三种读法
- 绝对水平:0.58 距离满分 1 很远——这不是模型弱,而是任务本质难:26 类中存在固有诊断模糊(专家之间也不一致),reward matrix 对"相似误诊"给分后,人类专家在同样口径下的分数也未公开测试。
- 队伍间差距:前三名差 0.02,中游队伍密集在 0.45-0.55 区间——单一技巧带来的边际收益有限,规模与集成才是主要增益来源。
- 跨导联稳定性:冠军在 2 导联与 12 导联得分几乎一致(0.58/0.58)——这与官方统计结论(§5.5)相互印证。
5.5 核心科学结论:“两条确实基本够用”
官方论文的统计学答案:不同导联组合间的测试分数中位变化 ≤0.036,两两配对符号秩和检验 p≥0.50(无一组合差异显著);在 CPSC 与 G12EC 验证库上的表现也与测试库一致。三条件读法:
- 条件一:算法在完整 12 导联数据上训练——它学到的是"从可用导联推断缺失信息"的表征,而不是在降导联数据上重新训练。
- 条件二:群体层面统计显著——对单个诊断类目、单个患者,降导联仍有真实风险(尤其依赖胸前导联空间信息的类目,如前壁梗死相关形态)。
- 条件三:26 类计分口径——不自动外推到 133 类全词表中更精细的诊断。
结论的正确表述不是"12 导联可以淘汰",而是"在多数常见异常的筛查场景,降导联信号的信息损失远小于预期"。这一结论被可穿戴心电行业广泛引用,是该数据集在文献之外的最大产业影响。
对产品团队的操作性转译:若你的设备记录 I+II 双导联,直接复用 39 支公开算法作为基线是合规且省力的起点;但上线前必须补三件挑战赛没做的事——按自家设备噪声谱做域适应、对胸前导联依赖型类目设降级提示、并做小规模本地临床复核。挑战赛给的是"信息量上界",产品责任仍在团队。
5.7 与 2020 届榜单的纵向对比
| 维度 | 2020 届 | 2021 届 |
|---|---|---|
| 公开训练规模 | 约 4.3 万条 | 88,253 条 |
| 测试构成 | 已见库拆分为主 | 含两个全新机构库 |
| 计分类目 | 27 类 | 26 类 |
| 榜首分数 | 约 0.55 区间 | 0.58 |
| 榜首队伍 | Team WB | ISIBrno-AIMT |
两届分数不可直接比较的三重原因:数据翻倍、测试更"硬"(新增两个分布外库)、类目数变化。社区常见的"2021 模型比 2020 强 0.03"式比较全部无效——跨届只比方法学趋势,不比绝对分。
5.8 赛后学术产出
Physiological Measurement 2022 年出版 Focus Issue on Classification of Multilead ECGs,收录挑战赛扩展论文(含官方总结论文 “Issues in the automated classification of multilead ECGs using heterogeneous labels and populations”——该文对跨库标签异构的系统性分析是理解本数据集缺陷的必读文献)。CinC 2021 论文本身截至抓取时点被引超 320 次(Google Scholar 口径),是 ECG 深度学习文献的高频引用锚点。
5.3.1 前排方案的技术公约数
跨队伍归纳 39 份公开论文,前排方案共享五项技术决策——它们事实上构成了 2021 年 ECG 多标签分类的"默认配方":
- 残差卷积骨干:ResNet 式一维/二维残差网络几乎是标配;冠军队用集成(ensemble),单模型队伍强调正则。
- 按库分层的数据增广:随机重采样率抖动、基线漂移注入、幅值缩放;跨库泛化目标使增广从"可选项"变成"必需品"。
- 多标签损失的再平衡:非对称损失(asymmetric loss)/focal 变体处理 26 类的极端不平衡;SMS+1 队的自学习标签校正直接对弱标签噪声建模。
- 导联自适应架构:按输入导联数动态启用通道分支或掩码卷积,避免为每个组合训独立模型。
- 验证集对齐官方评分:前排队伍全部本地复算官方 reward score 调参——这再次证明"与官方口径对齐"是榜单竞争的入场券而非加分项。
对后来者的意义:复现 2021 届水平不需要发明新架构,需要的是把上述五件套做扎实;而要超越 2021 届水平,空白点在逐类校准(calibration)与标签噪声建模——39 份论文里系统做这两件事的极少。
§6 获取与许可:全开放的门怎么进
6.1 获取路径
| 资产 | 位置 | 许可 | 门槛 |
|---|---|---|---|
| 数据集本体(v1.0.0) | physionet.org/content/challenge-2021/1.0.0/ | CC BY 4.0 | 无(Anyone,无需注册) |
| 数据集最新版 | physionet.org/content/challenge-2021/(DOI 10.13026/gt86-a263,v1.0.3) | CC BY 4.0 | 无 |
| 公开训练 7 库分库下载 | physionet.org/content/challenge-2021/ 内 Data Access 链接 | 挑战赛版 CC BY 4.0 | 无 |
| 官方评分代码 | github.com/physionetchallenges(Python/MATLAB) | BSD 3-Clause | 无 |
| 39 支上榜算法源码 | 官方 results 页逐队链接 | 各队自选开源许可 | 无 |
| 隐藏验证/测试集 | 不公开 | — | 永久隐藏 |
下载实操:整包 ZIP(数 GB 级)或按库分取;每条记录为 WFDB 对(.mat + .hea)。Python 生态用 wfdb 库直接读取;官方示例提交代码含端到端加载-训练-推理-输出模板,改标签文件即可接入自己的模型。
6.2 版本历史与引用口径
| 版本 | 发布 | DOI | 说明 |
|---|---|---|---|
| v1.0.0 | 2020-12-24 | 10.13026/g9wd-3j66 | 挑战赛原版(官方论文与榜单基于此口径) |
| v1.0.3(最新) | 挑战赛结束后更新 | 10.13026/gt86-a263 | 含 papers 目录与若干修订;分库数字未变 |
引用数据集时,若复现 2021 届榜单结果建议引 v1.0.0 DOI(与论文口径对应);若作为训练语料用最新版 DOI 并注明版本。PhysioNet 数据页对每个版本单独提供 Citation 导出。
双版本引用实例:复现榜单场景写 “(v1.0.0, DOI 10.13026/g9wd-3j66)”;新训练场景写 “(latest, DOI 10.13026/gt86-a263)”——两写法都合法,唯一错误是混用版本却只给一个 DOI。
6.3 许可细读:CC BY 4.0 的三个要点
- 商用允许:CC BY 4.0 允许商用、修改、再分发,唯一义务是署名——引用官方论文与 DOI 即可。这与库内不少"研究用途"数据集(如部分中国医院数据)形成鲜明对比。
- 子库原始许可的层次问题:汇编版以 CC BY 4.0 统一发布,但 CPSC 等库的原始发布许可为 CC BY-NC-SA(非商业)。官方统一重编码版可视为新的发布行为;但引用者在商业场景使用 CPSC 子集时,稳妥做法是同时核对原库许可(坑 6)。
- 论文与网站许可:挑战赛论文开放获取,网站内容 CC BY 4.0;PhysioNet 标准引用(Goldberger 2000)被官方要求一并引用。
6.4 AI-Ready 评估:三件套模范生
| AI-Ready 维度 | 表现 |
|---|---|
| 可发现性 | PhysioNet 官方目录 + DOI + 高引论文锚定,检索无歧义 |
| 可获取性 | 无门禁直链下载,CC BY 4.0——库内心电域最高档 |
| 可互操作性 | WFDB 标准格式 + 官方 Python/MATLAB 读取代码;异构采样率需自处理(微降分) |
| 元数据 | 官方页+论文+项目页三层文档;但患者级元数据仅年龄/性别(弱) |
| 可持续性 | PhysioNet/NIH 长期托管,20+ 年挑战赛系列运营记录——平台风险极低 |
综合:心电域 AI-Ready 光谱的"最开放"端点,适合作为跨库对比的基准锚点。扣分项集中在标签弱复审与隐藏集不可得(结构性限制而非管理缺陷)。DAIMS 全表见附录 B(综合 8.2/10)。
一个与库内对照的细节:库内不少高价值数据集(MIMIC 系、eICU 系)卡在"凭资质申请"这一档,下载前需要完成培训与签署;challenge-2021 则是"点开即下"——同一平台(PhysioNet)上两种获取模式的并存,本身就是理解医学数据治理光谱的最佳教材。检索者从本条目跳转 MIMIC 系条目时,预期管理要相应切换。
6.5 平台背景:PhysioNet 是什么样的托管方
PhysioNet 由 MIT(后扩展至 Emory/BIDMC 体系)于 1999 年创立,受 NIH 资助,是生理信号开放数据的原点机构(Goldberger et al. 2000 的 PhysioBank/PhysioToolkit/PhysioNet 三件套论文是领域基石引用)。对数据集可持续性的含义:20 余年的机构级托管、统一的 WFDB 工具链、每年一届的挑战赛运营节奏、以及"数据页+项目页+论文"三层文档惯例——这些让 challenge-2021 的链接失效风险与文档腐化风险都显著低于个人或商业托管的数据集。库内 PhysioNet 系条目(mit-bih-arrhythmia、ptb-xl、mimic 系等)共享这一平台红利。
§7 生态与影响:挑战赛系列与数据集谱系
7.1 PhysioNet/CinC 挑战赛谱系中的位置
PhysioNet/CinC 挑战赛自 2000 年起每年一届(现名 George B. Moody PhysioNet Challenges),2021 年是第 22 届。库内已收录的同系列条目:cinc-2015(ICU 假警报抑制)、physionet-cinc-2016(心音分类)、physionet-cinc-2017(单导联房颤分类)、cinc-2018-sleep(睡眠 PSG 觉醒检测)、cinc-2023(心脏骤停神经预后)。CinC 2021 在谱系中的特殊性:它是数据规模最大(13 万条级 vs 其他届多为千条级)与唯一以"评估导联信息量"为命题的一届。
系列年表(节选,含 2021 的前后文):
| 届 | 主题 | 与 2021 的关系 |
|---|---|---|
| 2015 | ICU 假心律失常警报抑制 | 冠军 Plesinger 六年后再夺 2021 冠军 |
| 2016 | 正常/异常心音分类 | 部分评分思想萌芽期 |
| 2017 | 单导联房颤分类 | "降导联"命题的前传 |
| 2018 | 睡眠 PSG 觉醒检测(You Snooze You Win) | 同系列大规模波形任务 |
| 2020 | 12 导联 27 类异常分类 | 2021 的直接前作 |
| 2021 | 降导联多标签诊断(本条目) | — |
| 2022 | 心音图先天心脏病检测 | 沿用部分得分制 |
| 2023 | 心脏骤停后神经功能预后 | 沿用隐藏集+复现门槛 |
| 2024 | ECG 图像数字化分类 | 转向图像模态 |
| 2025 | Chagas 病 ECG 检测 | 部分复用 PTB-XL/CODE 系语料 |
7.2 与库内心电数据集的关系网
CinC 2021 的 9 库中 4 个在库内有独立条目(cpsc、ptb-xl、Chapman-Shaoxing、mimic-iv-ecg 隔壁谱系),构成"原始库 ↔ 挑战赛汇编版"的双层结构:
- cpsc(132):原始版 6,877 条(2018 挑战赛训练部分);CinC 2021 用同一批数据并叠加 CPSC-Extra 3,453 条。
- ptb-xl(70):原始版 21,837 条;CinC 2021 版为官方重编码(含 HIPAA 化人口学),标签从原编码树映射到 SNOMED CT 子集。
- Chapman-Shaoxing(143):原始版记录 Chapman 大学与绍兴人民医院数据;CinC 2021 版合并 Ningbo 子库至 45,152 条。
- mimic-iv-ecg(172):非 2021 来源(MIMIC-IV 波形派生),但同属 12 导联 ECG 大库,常被并排比较。
使用建议:做单库深度研究用原始库条目(标签更全、文档更细);做跨库泛化、对标 39 支公开算法、或需要"官方统一口径"时用 cinc-2021 汇编版。
7.3 下游影响:从榜单到行业
三条下游线。其一,学术复现——39 支上榜算法构成 ECG 多标签分类的方法学工具箱(残差 CNN 集成、通道注意力、标签异构处理策略),被后续数百篇论文复用。其二,行业采信——"降导联可行"结论被便携心电设备厂商用于产品论证;官方 reward matrix 成为此类产品临床评估的参考口径。其三,方法学迁移——隐藏集管理、可复现代码门槛、部分得分制被 2022-2025 各届挑战赛与更广泛的医学 AI 竞赛(如 grand-challenge 平台)吸收为标准做法。
三条线的权重随时间推移:学术复现在 2022-2023 年达峰(focus issue + 复现潮);产业采信从 2022 年起持续累积(可穿戴厂商白皮书引用降导联结论);方法学迁移则最深远——到 2025 届,"提交完整训练代码"与"部分得分"已是默认配置而非创新点。引用本数据集时建议按用途选线:训练语料用途引数据 DOI,泛化结论用途引论文+本节边界声明。
7.4 已知局限与批评
官方总结论文(Physiol Meas 2022)自我批评的点:各库标签可信度不均(部分库为报告驱动弱标注);SNOMED CT 映射是"近似"而非审定;26 类的选择有专家主观性;训练/测试的人口学分布差异未系统校正。第三方批评集中于:隐藏集永不公开使社区无法独立复核榜单;Undisclosed American 库的不可知性让泛化结论无法按机构分层解读。这些批评不否定数据价值,但使用者引用"降导联可行"结论时应带上 §5.5 的三条件边界。
7.5 一条组织经济学的观察
挑战赛系列的可持续性来自一个良性循环:大厂出算力与奖金(Google Cloud 沙箱、MathWorks 许可)→ 学术组织方出任务与评分 → 参赛者贡献开源算法 → 算法池反哺下一届的任务设计。CinC 2021 是这个循环里"算法资产沉淀"最厚的一届——39 套可运行代码的价值不下于数据本身。对想复制此模式的中国数据集主办方,可借鉴的三件套是:无门槛数据 + 硬性代码提交 + 永久隐藏集;其中"硬性代码提交"是常常被省略、却决定赛后生态的一环。
§8 方法学启示:四条可迁移的经验
8.1 "训练全信息、测试降信息"是泛化实验的通用模板
CinC 2021 把"导联数量"从自然差异变成受控变量:训练只给全导联,测试按信息量梯度发放。这个模板可平移到任何"信息降级"问题——影像的低剂量/低场强、文本的脱敏版本、基因组的低覆盖测序。关键设计点有二:降级维度要选真实场景关心的梯度(6/4/3/2 对应真实设备谱);训练集必须不含降级标签信息,否则算法会"作弊"(如按导联组合切换专用头)。官方结果的显著性检验(符号秩和检验)同样值得照抄:泛化损失的结论必须带效应量(中位变化 ≤0.036)与检验口径(p≥0.50),不能只说"差不多"。
8.2 标签异构是跨库汇编的第一公民,不是脚注
9 库标签体系各异,官方没有假装它们可比,而是做了三件事:建立 133 类 SNOMED CT 映射词表(承认"近似")、只对 26 类计分(收缩评估范围)、赛后再出专文分析异构影响(Physiol Meas 2022)。对任何"多库合并训练"项目的启示:先声明标签映射的近似层级,再把评估收缩到映射可信的子集,最后把异构本身作为研究对象输出。CinC 2021 的"汇编-映射-收缩-复盘"四步是跨库数据工程的标准作业程序(SOP)。
8.3 部分得分制让评估承接临床语义
reward matrix 把"误诊的临床后果相似度"写进评分函数,使榜单排序与临床价值排序方向一致。可迁移条件:存在专家可判定的"错误严重度"结构(分级任务、鉴别诊断、预后分期均适用);不可迁移场景:类别后果无梯度的问题(如纯检测任务)。实现要点:系数矩阵由专家组独立打分并公开(本例随评分代码开源),否则部分得分会被质疑为"黑箱酌情"。
8.4 可复现性门槛改变参赛行为
"提交完整训练代码+沙箱复跑+默认 BSD 开源"使 1,056 次提交里 438 次因复现/格式问题被拒,但也换来 39 套可运行算法的公开。这是"以牺牲参与便利换生态资产"的设计权衡——对比早期挑战赛(只交结果文件,赛后无可复现遗产),CinC 2020/2021 的开源代码库成为数据集之外的第二资产。对组织者的量化参考:约 40% 的提交会在复现环节被筛掉,赛程设计要为此预留容错与重提交通道。
8.5 隐藏集是承诺机制,不是不信任
68 支队伍接受"永远看不到测试数据"的规则,本质是对组织方的一个承诺机制:排行榜数字因此有了"未经任何本地调参污染"的可信度。医学 AI 领域大量"自划测试集"论文的分数通胀,与挑战赛榜单的克制形成对照。可迁移条件:组织方要有长期机构信誉(PhysioNet/NIH 背景是前提)且愿意承担"赛后无人能复算测试分"的透明度损失。若两者缺一,退而求其次是"测试集托管于第三方、提交接口单向"的设计。
§9 与库内条目的关系
9.1 家族图谱
| 库内条目 | 关系 | 边界声明 |
|---|---|---|
| cpsc(132) | 2021 汇编的数据来源之一 | 独立条目记 CPSC 2018 原赛与原库;本条目只记其 6,877+3,453 条被汇编后的角色 |
| ptb-xl(70) | 2021 汇编的最大训练来源(21,837 条) | 独立条目记 PTB-XL 本体(标签树、实验设计);本条目只记 SNOMED 映射后的汇编口径 |
| Chapman-Shaoxing(143) | 2021 汇编来源(10,247 条 + Ningbo 34,905) | 独立条目记原库;Ningbo 部分仅在本条目语境可得(原库条目无此子集细节) |
| mimic-iv-ecg(172) | 同域并列大库(非 2021 来源) | MIMIC-IV-ECG 为 ICU 波形派生 12 导联,人群与 2021 四国库互补,常并排比较 |
| cinc-2015(487) | 同系列前届(ICU 假警报抑制) | 冠军 Plesinger 2021 再夺冠的谱系关联 |
| physionet-cinc-2016(382) / physionet-cinc-2017(162) / cinc-2018-sleep(493) / cinc-2023(499) | 挑战赛系列横链 | 2017 单导联房颤任务是"降导联"命题的前传 |
| vitaldb(192) | 同域(术中波形) | 非来源关系;同为生理信号大库对照 |
9.2 检索路径建议
找"12 导联 ECG 多标签基准"→ 本条目;找"中国人群 ECG 原库"→ cpsc / Chapman-Shaoxing;找"德国精细标签 ECG 树"→ ptb-xl;找"ICU 场景 ECG"→ mimic-iv-ecg / vitaldb;找"单导联可穿戴筛查"→ physionet-cinc-2017;找"挑战赛评分方法学"→ 本条目 §4 + cinc-2015。
9.3 库内心电数据集六维对比
| 维度 | cinc-2021(本条目) | cpsc(132) | ptb-xl(70) | Chapman-Shaoxing(143) | mimic-iv-ecg(172) |
|---|---|---|---|---|---|
| 记录规模 | 131,149(公开 88,253) | 6,877(+Extra 3,453) | 21,837 | 10,000 级 | 800,000+ 段(ICU 波形派生) |
| 人群 | 中/俄/德/美四国 | 中国 | 德国(欧洲) | 中美合作 | 美国单一 ICU 人群 |
| 标签 | SNOMED CT 133 类(26 计分) | 9 类清单 | 多级诊断树 | 11 类 | 报告派生诊断 |
| 任务形态 | 多标签 × 降导联泛化 | 多分类 | 多标签 | 多分类 | 报告生成/分类原料 |
| 许可 | CC BY 4.0(汇编版) | CC BY-NC-SA | CC BY 4.0 | 开放(挑战赛版) | 凭资质(credentialed) |
| 官方基线 | 39 队公开算法+评分代码 | 2018 赛榜单 | 官方基准脚本 | 挑战赛版口径 | 无统一榜单 |
读表提示:mimic-iv-ecg 的规模数字(80 万段级)是"ICU 波形切段"口径,与"临床诊断检查记录"口径不可直接比——它的单段更短、标签更弱。规模对比只在同口径内成立。
表的第二个用途是给检索系统提供互链特征:五列条目共享"12 导联 ECG"这一信号级特征,但任务形态与许可两列把它们的 AI-Ready 定位区分开——这正是库内互链算法按标签计算相关度时所依赖的维度(category_tags 受控词表的设计动机)。
9.4 库内互链锚文本建议
发布时的互链锚文本(供主会话入库参考):
- 从本条目出发:cpsc(“数据来源库·中国心律失常”)、ptb-xl(“数据来源库·德国精细标签”)、Chapman-Shaoxing(“数据来源库·中国十秒记录”)、mimic-iv-ecg(“同域对照·ICU 场景”)、cinc-2015/2016/2017/2018-sleep/2023(“挑战赛系列”)。
- 反向入口(从其他条目链入本条目):cpsc/ptb-xl/Chapman-Shaoxing 的"衍生与汇编"节、physionet-cinc-2017 的"后续演进"节、cinc-2023 的"评分方法学传承"节。
§10 避坑清单:八个已踩过的坑
坑 1:总量双口径 131,149 vs 131,155。
官方论文正文写 “nine databases with 131,149”,摘要写 “131,155 recordings”——同一篇论文内部差 6 条。分源校验(88,253+6,630+36,266)支持正文口径 131,149。引用时以 131,149 为主、摘要口径双注;检索到第三方论文写 131,155 时不必当错误。同理,看到"over 88,000""more than 100,000"等模糊表述都出自官方原文——88,253 与 131,149 是精确校验值,引用优先。
坑 2:"7 机构"与"9 库"不是同一个数。
摘要说 “seven institutions in four countries”,正文说 “nine databases”。机构 7 家(乔治亚与 Undisclosed American 同为美国但非同机构)、库 9 个(训练 7 + 验证 2 + 测试 4,其中 Georgia 与 CPSC 跨层复用)。写"7 机构 9 库 4 国 3 大洲"才完整。
坑 3:Ningbo 单库数字是推算值。
官方只给 Chapman-Shaoxing+Ningbo 合计 45,152 与 Chapman-Shaoxing 单独 10,247;"Ningbo 34,905"是减法结果,官方文档未直书。第三方引用该数字时须注明推算来源,防止讹传为官方口径。
坑 4:2020 与 2021 数据不可混写。
两届是独立 DOI 的两个数据集;2020 年 27 类、纯 12 导联;2021 年 26 类计分、降导联任务;多数文件重叠但官方有修订。引错届次会导致标签数、记录数、榜单三处全错。
坑 5:26 类计分 ≠ 133 类全词表。
约 107 种诊断"出现但不计分"。在全词表上训练没有问题(官方支持),但与榜单数字可比的评估必须在 26 类 reward matrix 口径下做——用 macro-F1 对 133 类自评后去对标榜单 0.58 是常见的错误姿势。自查方法:若你的评估脚本没有 import 官方 reward matrix,就还没有资格与榜单对话。
坑 6:汇编版 CC BY 4.0 不自动覆盖子库原始许可争议。
CPSC 原库为 CC BY-NC-SA(非商业);CinC 2021 官方以 CC BY 4.0 统一重发布。学术场景无碍;商业场景使用 CPSC 子集前建议同时核对原库许可与官方重发布声明,留好署名与来源证据链。
坑 7:INCART 是 30 分钟长程 Holter 库。
74 条、257 Hz、每条 30 分钟——与其余库"5-120 秒短程记录"完全异构。直接按"每条 10 秒"的默认假设写读取代码会在 INCART 上爆内存或截断信号;长程记录也使其标签分布与其他库不可比。
坑 8:Undisclosed American 永久保密。
10,000 条测试数据的来源机构官方刻意不披露(防反推),不存在"找到它"的可能性——声称"已识别"该库的第三方信息一律不可信。任何按机构分层的泛化分析只能覆盖已披露的库。
§11 总结
11.1 三句话总结
- CinC 2021 是当时最大的公开 12 导联 ECG 多标签诊断数据集(9 库 131,149 条,公开 88,253 条),以 CC BY 4.0 完全开放,是心电 AI 的零门槛入口。
- 它的命题"Will Two Do?"用训练全导联/测试降导联的受控设计,给出了"2 导联与 12 导联诊断能力差异中位 ≤0.036(p≥0.50)"的群体级答案,为便携心电设备提供了被 68 队算法验证过的论据。
- 它的评估遗产——26 类 reward matrix 部分得分制与"完整训练代码+隐藏集"的复现门槛——已成为后续医学 AI 挑战赛的标准配置。
11.2 适合谁
- 需要大规模公开 ECG 数据训练多标签分类/表征学习模型的团队(88,253 条无门禁)。
- 便携/可穿戴心电产品研发者(降导联有效性证据 + 跨国人群验证)。
- 挑战赛组织者与评估方法学研究者(部分得分制、复现门槛的范本)。
- 跨机构泛化研究(4 国 9 库 + 2 个全新隐藏库的分布外设计)。
- 评估方法学教学(reward matrix 是"临床语义进指标"的最完整公开案例)。
11.3 不适合谁
- 需要临床协变量、用药、结局随访的研究——本数据集只有信号+诊断标签+年龄性别。
- 需要统一采样率/时长的即插即用管线——9 库异构需自建预处理协议(§2.5)。
- 需要专家复审级标签质量的研究——标签为各库原始报告的近似映射,弱标注继承(§2.7)。
- 需要患者级长程随访或个体级纵向数据——记录间无患者关联信息。
- 需要逐条审定诊断金标准的研究——标签近似映射的定位是"大规模弱标注",不是金标准库。
11.4 30 秒决策卡
| 你的需求 | 路径 |
|---|---|
| 立刻跑通一个 ECG 分类基线 | 下载 CPSC 或 G12EC 分库 + 官方 Python 示例提交代码,验证集调参 |
| 对标 2021 挑战赛榜单 | 26 类 + reward matrix 官方代码 + 提交格式严格对齐(坑 5) |
| 训练跨库泛化模型 | 9 库合并 + 统一重采样协议(§2.5)+ 按库分层验证 |
| 论证降导联产品可行性 | 引 §5.5 三条件边界 + 官方论文(p≥0.50) |
| 商用某子库 | 先核对 CC BY 4.0 署名义务;CPSC 子集再核原库许可(坑 6) |
| 写数据集综述 | 附录 F 九库总表 + §9.3 六维对比可直接引用 |
FAQ(高频问答 60 问)
A. 基础认知
Q1:CinC 2021 是什么?
PhysioNet 与 Computing in Cardiology 联合举办的年度挑战赛第 22 届,主题 “Will Two Do? Varying Dimensions in Electrocardiography”——从降导联 ECG 识别 26 类心脏异常,同时发布配套的 9 库 131,149 条汇编数据集。
Q2:"Will Two Do"什么意思?
“两条(导联)够不够用”。12 导联是临床标准,便携设备只有 2-6 导联;挑战赛让算法在训练看全 12 导联、测试只拿导联子集,量化信息损失。
Q3:谁组织的?
Emory 大学生物医学信息系(DBMI)主导,Matthew A. Reyna 与 Gari D. Clifford 领衔(14 人组织团队),Michigan 大学、UPV/EHU(西班牙)参与;NIH NIBIB R01EB030362 资助,Google/MathWorks/Moore Foundation 赞助。
Q4:数据在哪发布?
PhysioNet:physionet.org/content/challenge-2021/,v1.0.0(DOI 10.13026/g9wd-3j66,2020-12-24 发布),最新版 DOI 10.13026/gt86-a263。
Q5:比赛结果在哪?
官方 results 页(physionetchallenges.org/2021/results/)有 39 支队伍六维度排名与论文链接;分数口径见挑战赛论文 Table 3。
Q6:和 2020 年挑战赛什么关系?
2021 是 2020 的扩展:加 3 个新库(Ningbo、UMich、Undisclosed American)、加降导联任务、计分从 27 类调整为 26 类。两届数据集在 PhysioNet 是独立 DOI。
Q7:最大的卖点一句话?
在 13 万条、4 国、68 队的尺度上证明"2 导联与 12 导联的诊断差距中位 ≤0.036 且统计不显著"——便携心电设备的第一份大规模定量背书。
Q8:它有什么结构性局限?
标签为跨库近似映射无统一复审、仅年龄性别两个人口学变量、隐藏测试集永不公开、Undisclosed American 来源永久保密。
Q9:开源吗?
数据 CC BY 4.0 无门禁;评分代码 BSD 3-Clause;39 支上榜队伍算法全部公开——三层全开放。
Q10:冠军是谁?
捷克科学院 ISI Brno 与 AIMT 联合队 ISIBrno-AIMT(Nejedly、Plesinger、Jurak 等),残差 CNN 集成+注意力,六个榜全部第一(all-lead 0.58);Plesinger 亦是 2015 届冠军。
B. 数据与获取
Q11:我能下到多少条?
公开训练 88,253 条(7 库)。验证 6,630 条中信号部分在挑战赛期间对参赛者开放过,赛后不公开下载;测试 36,266 条永不公开。
Q12:怎么下载?
PhysioNet 页面整包 ZIP 或按 7 库分取;无需注册。WFDB 格式,Python wfdb 库直接读。
Q13:数据量多大?
整包数 GB 级;单库最小 INCART 74 条,最大 Ningbo 约 34,905 条(推算值)。
Q14:年龄性别怎么用?
挑战赛任务允许使用年龄/性别作为输入特征(官方定义"routine demographic data");已 HIPAA 兼容化,为整数年龄与二值性别。
Q15:采样率不一致怎么处理?
官方示例做法是统一重采样到 500 Hz;建议按最严格奈奎斯特需求(PTB-XL 1000 Hz 原始)评估是否丢失信息;INCART 长程记录需分段策略。
Q16:Ningbo 库的原始文献?
Ningbo 子集随 Chapman-Shaoxing 数据发布体系(官方项目页参考文献 [5][6]),单库细节以挑战赛版口径为准——独立条目在库内不存在,34,905 为推算值(坑 3)。
Q17:商用可以吗?
挑战赛版 CC BY 4.0 允许商用(署名义务);CPSC 子集原库为 CC BY-NC-SA,商用前核对(坑 6)。
Q18:和 MIMIC-IV-ECG 怎么选?
MIMIC-IV-ECG(库内 172)是 ICU 场景、Beth Israel 人群、与临床时序库联动;CinC 2021 是多国人群、含官方榜单基线。研究 ICU 共病用前者,做通用诊断模型与可对比基线用后者。
Q18b:两者能拼在一起用吗?
可以但要做域对齐:MIMIC-IV-ECG 段时长与采样率不同、标签体系不同,直接混合训练会引入来源捷径(模型靠信号特征认库);至少要做按库分层评估与域对抗(domain adversarial)级别的处理,并在论文中如实报告混合比例。
Q19:INCART 只有 74 条还有用吗?
作为长程 Holter 样本有独特价值(体动伪影、日常活动噪声),但规模不足以支撑训练——通常只用于压力测试与鲁棒性抽检;主训练建议跳过。
Q20:有没有 HuggingFace 镜像?
存在多个第三方镜像(ECG 分类复现项目常见),但口径与修订版本不一;生产用途建议以 PhysioNet 原站为准(主站被封锁时经 hf-mirror.com 镜像核验,注意核对版本号)。
C. 标签与评分
Q20b:PhysioNet 页面上"View latest version"点进去有什么不同?
数据内容不变,主要是版本元数据、papers 目录与官方修订记录;引用训练语料建议直接用最新版 DOI。
Q20c:下载前需要注册 PhysioNet 账号吗?
本数据集不需要(Access Policy: Anyone);但若顺路下载 MIMIC 系(凭资质库),则需要单独的 credentialed 申请流程——两者门槛差异本身就是库内"获取光谱"的典型样本。
Q21:133 类和 26 类什么关系?
133 类是 9 库标签 SNOMED CT 映射后的合并词表(训练可全用);26 类是官方计分子集(scored labels)。榜单分数只在 26 类口径有效。
Q22:reward matrix 是什么?
专家判定的 26×26 相似度矩阵:误诊为"治疗/结局相似"的类别得部分分(如房颤↔房扑);全对=1、全标窦律=0、全阳=负分。矩阵全表随评分代码开源。
Q23:为什么全标 NSR 是 0 分而不是负分?
NSR 是"最保守策略"锚点:把所有异常都漏掉的临床后果被定义为基线;更差策略(如把正常都报成异常)才得负分。
Q24:我可以自评后与榜单比较吗?
只在以下条件下可比:26 类口径 + 官方 reward matrix + 隐藏测试集(不可能)或官方验证集(可本地复算)。用自划验证集算的 macro-F1 与榜单 0.58 不可比。
Q25:有基线代码吗?
官方提供 Python/MATLAB 示例提交(含简易 CNN 基线与端到端提交模板);39 支上榜算法源码赛后全部公开,冠军方案(残差 CNN 集成)可直接复现。
Q26:标签可信吗?
各库原始临床报告驱动,无统一复审;SNOMED CT 映射官方自称"approximate"。跨库训练时建议按库分层验证;对标签敏感的任务慎用。
Q27:为什么把 NSR(正常窦律)也列成计分类目?
NSR 是多标签体系里的"排除性输出":正确输出 NSR 表示该记录无任何计分异常。它是全标策略的零分锚点,也是患病率最高的类目——把它排除出指标会造成严重的类别偏倚。
Q28:相似度系数由谁定的?
挑战赛组织方的心脏病学专家团队;系数表随评分代码公开,可审阅可复用,但官方未发布专家间一致性检验。
D. 任务与结论
Q29:降导联结论的适用边界?
三条件:12 导联全量训练、群体统计口径、26 类计分。不外推到:降导联数据重新训练、单个诊断类目、133 类全词表、个体级保证。
Q30:为什么 2 导联选 I 和 II?
肢体导联可由 I、II 线性推导(Einthoven/Goldberger 关系),I+II 已含全部肢体导联信息空间;胸前导联单独保留信息量最大的 V2。
Q31:6/4/3 导联的组合是唯一的吗?
官方选择以"最大化独立导联信息"为原则;研究自定义组合时注意保持"独立信息量递减"的梯度逻辑,否则与官方结论不可比。
Q32:挑战赛允许用模型集成吗?
允许,冠军 ISIBrno-AIMT 即残差 CNN 集成;唯一硬约束是沙箱内复跑通过(计算资源参考 n1-highmem-8)。
Q33:年龄性别特征贡献多大?
官方未单独消融;第三方复现普遍报告人口学特征对少数类目(如电轴偏移类)有小幅增益,对多数节律类目接近无贡献。
Q34:为什么不用同一模型在降导联数据上重新训练作对照?
对照的是"真实使用场景":用户手里只有降导联设备+已在全导联数据上训练好的模型。重新训练的对照组回答的是另一个问题(降导联数据自身的上限),不是部署场景。
Q35:胸前导联信息丢失对哪些类目影响最大?
理论上对依赖 V 导联空间定位的类目(前壁形态学改变相关)影响最大;官方论文未逐类披露,社区复现报告的逐类差异也不一致——该方向仍是开放问题。
E. 工程与复现
Q36:格式坑有哪些?
输出 CSV 列序与 SNOMED 码写法有严格校验(格式错=0 分);WFDB 头文件单位/增益字段各库不一致,读取时须按 .hea 处理;INCART 30 分钟长程记录是最大内存坑(坑 7)。
Q37:训练代码怎么提交的?
挑战赛制:entry 包含环境脚本/训练与推理脚本,官方沙箱先复跑验证再计分;默认 BSD 3-Clause 开源。赛后复现者直接从 results 页拉取队伍代码。
Q38:GPU 需要多少?
挑战赛沙箱以 CPU 为主(n1-highmem-8 参考);训练阶段无官方限制,39 支上榜队伍从 CPU 模型到深度集成均有——榜单前列全部为深度模型。
Q39:验证集为什么赛后不公开?
官方将其保留为复评与 focus issue 评审资源;社区可用的替代是自行分层切分(建议按库分层,避免同患者跨集——但注意记录间无患者 ID)。
Q40:与后续挑战赛的数据有重叠吗?
CinC 2022 用心音图(完全不同信号);2023 用临床时序;2025(Chagas ECG 检测)部分复用 PTB-XL 与 CODE 系数据——引用时按届次区分。
Q41:怎么判断我的重采样协议没有丢信息?
对最高采样率库(PTB-XL 1000 Hz)做降采样前后的一致性检验:逐类诊断一致性变化应在噪声范围内;同时核对 QRS 波形形态学特征(RR 间期、幅度)的相关系数。
Q42:跨库训练的类目不平衡有什么务实对策?
按库分层采样 + 对 26 类做加权损失;避免跨库做过采样合成(SMOTE 类)——波形数据的合成样本在物理上不可信,审稿人也会追问。
F. 库内与引用
Q43:引用规范?
引挑战赛论文 Reyna MA, et al. Computing in Cardiology 2021;48:1-4;引数据集用 PhysioNet DOI(10.13026/g9wd-3j66 或最新版 10.13026/gt86-a263);官方要求同时引用 Physiol Meas 2022 总结论文与 PhysioNet 标准引用(Goldberger 2000)。BibTeX 见附录 M。
Q44:本条目与库内 cpsc/ptb-xl/Chapman-Shaoxing 条目冲突吗?
不冲突:它们记原库本体,本条目记挑战赛汇编版+任务+榜单。检索任一条目应提示另一侧——"原始库"与"官方统一口径"各有用途(§9.2)。
Q45:CinC 2021 和库内"挑战赛数据集"标签的其他条目怎么互链?
同系列六条(2015/2016/2017/2018/2021/2023)按"挑战赛数据集"标签横链;本条目另经数据来源关系与 cpsc/ptb-xl/Chapman-Shaoxing 纵链——横纵两向互链在生理信号域里是本条目的枢纽位置。
Q46:如果只想引用一个数字,引哪个?
公开训练集规模 88,253 条(口径最清晰、来源最直接);131,149 需要同时解释隐藏层构成,131,155 是摘要口径——都不是"一句话引用"的最稳选择。
Q47:条目里的"推算值"会不会有风险?
34,905(Ningbo)是唯一的推算硬数字,已在正文与坑 3 双存照;引用时带上"由官方合计推得"限定语即可安全使用。
Q48:如果我只记住一件事?
"两条导联基本够用"是有史以来被最大规模验证过的心电工程学结论之一——而这个结论的每一分证据,都来自一个 CC BY 4.0、连隐藏库机构都懒得让你知道的数据集。
G. 争议与批评
Q49:对隐藏集永不公开的主要批评是什么?
社区无法独立复核榜单与做逐机构分析;替代方案(本地分层切分)与官方隐藏集分布不同,复现研究分数普遍与榜单有差距——引用榜单数字时应注明这一不可复现性。
Q50:"近似"SNOMED CT 映射被批评的点?
映射过程未逐条审定、部分类目合并口径(如 CLBBB/LBBB 同列)牺牲了诊断粒度;对需要精确诊断边界的下游任务(如束支阻滞分型研究),挑战赛版标签的粒度不够——应回原库。
Q51:26 类计分的选择有争议吗?
主要是"未入选类目"的边缘化:一些在特定人群(如亚洲库)重要的诊断未进计分集,导致优化目标与部分应用场景错位;官方立场是 26 类保证跨库可评估性。
Q52:Undisclosed American 的保密性有反对意见吗?
有,主要集中在"不可审":泛化结论无法按该库人群分层解读,且其 10,000 条占比不小(测试集近三成)。官方权衡是保密带来的防作弊收益大于可解释性损失——这是评估设计中的经典取舍案例。
Q53:标签无患者级关联被诟病吗?
是常见批评:记录间无患者 ID,“同一患者多条记录"是否存在无法排除,严格的患者级防泄漏验证做不了。官方规则只保证"患者不跨训练/验证/测试层”(2020 届论文口径),届内记录级使用时由使用者自担。
Q54:怎么回应"榜单分数太低说明任务有问题"的质疑?
官方立场是 0.58 反映的是任务的内在模糊度(专家间也不完全一致)+ 部分得分制的严苛口径;分数低不是数据缺陷而是"真实临床难度被如实编码"——这个立场与 reward matrix 设计一脉相承。
I. 与库内协同
Q55:我该基于原库还是汇编版做毕业论文级研究?
原库(cpsc/ptb-xl/Chapman-Shaoxing)标签细节更全、患者级信息更多;汇编版胜在统一口径与可比基线。单库深挖选原库,跨库与对标榜单选汇编版——两者并行检索是常态(§9.2)。
Q56:库内已有条目会不会和本条目重复?
不重复:本条目的增量是"汇编差异+降导联任务+榜单+评分方法学";原库条目的采集设备、伦理、人群细节在本条目刻意从略(§9.1 边界声明)。
Q57:从其他条目怎么链进来最自然?
cpsc/ptb-xl/Chapman-Shaoxing 的"衍生与汇编"节、physionet-cinc-2017 的"后续演进"节、cinc-2023 的"方法学传承"节(§9.4)。
Q58:本条目未来会过时吗?哪部分最先过时?
§7.3 下游影响与引用数最先过时(建议发布时标注抓取时点);核心数字(131,149/88,253/0.58)随官方文档锁定,稳定。
Q59:为什么没有写 HuggingFace 上的具体镜像仓库?
镜像版本与修订状态不可控,写进百科条目会造成误导;官方 PhysioNet 直链是唯一权威口径(主站被封锁时经 hf-mirror.com 核验,须核对版本号)。
Q60:如果官方后续修订数据(v1.1+),本条目怎么办?
触发附录 O 维护计划:核对分库数字、更新 DOI 与 §2.1 表;榜单数字不受影响(论文口径锁定在 2021)。
事实清单(硬事实 40 条)
- 挑战赛全称 “Will Two Do? Varying Dimensions in Electrocardiography: The PhysioNet/Computing in Cardiology Challenge 2021”,为系列第 22 届。
- 组织团队 14 人,Emory DBMI 主导;收官作者 Matthew A. Reyna 与 Gari D. Clifford。
- 数据集 v1.0.0 于 2020-12-24 发布 PhysioNet;DOI 10.13026/g9wd-3j66;最新版 DOI 10.13026/gt86-a263(v1.0.3)。
- 汇编 9 库 131,149 条 12 导联 ECG(论文正文口径);摘要口径 131,155 条(坑 1 双口径)。
- 公开训练 88,253 条(7 库):CPSC 6,877 / CPSC-Extra 3,453 / INCART 74 / PTB 516 / PTB-XL 21,837 / G12EC 10,344 / Chapman-Shaoxing+Ningbo 45,152。
- 隐藏验证 6,630 条(Georgia 5,167 + CPSC 拆分 1,463)。
- 隐藏测试 36,266 条(Georgia 5,161 + UMich 19,642 + Undisclosed American 10,000 + CPSC 拆分 1,463)。
- Georgia 库合计 20,672 = 10,344 训练 + 5,167 验证 + 5,161 测试。
- 数据覆盖 7 机构、4 国(中国/俄罗斯/德国/美国)、3 大洲。
- Ningbo 单库 34,905 条为官方合计 45,152 减 Chapman-Shaoxing 10,247 的推算值(坑 3)。
- 信号为标准 12 导联(I, II, III, aVR, aVL, aVF, V1-V6),WFDB 格式(.mat + .hea)。
- 采样率异构:257 Hz(INCART)/ 250-500 Hz(UMich)/ 500 Hz(CPSC、Georgia、Chapman-Shaoxing、Ningbo)/ 500-1000 Hz(PTB、PTB-XL)。
- 时长异构:5 s 至 30 min(INCART 为 32 条 Holter 拆出的 74 条长程记录,257 Hz)。
- 标签为 133 种诊断的 SNOMED CT 近似映射(多标签);官方明言未修改原始数据与标签。
- 26 类 scored labels 参与计分;其余约 107 类出现但不计分。
- 人口学仅年龄/性别,经 HIPAA 兼容一致化。
- 任务:从 12/6/4/3/2 导联 ECG + 年龄性别识别 26 类心脏异常(多标签)。
- 降导联组合:6 导联(肢体六导)、4 导联(I,II,III,V2)、3 导联(I,II,V2)、2 导联(I,II)。
- 训练集仅 12 导联全信号;验证/测试按导联子集发放——算法必须对任意导联组合鲁棒。
- 评分:reward matrix 部分得分制;全对=1、全标 NSR=0、全阳=负分;官方 Python/MATLAB 代码开源(BSD 3-Clause)。
- 参与规模:68 队、1,056 次提交(618 次成功)、39 队上榜。
- 冠军 ISIBrno-AIMT(捷克):六榜全一,all-lead 0.58 / 3-lead 0.58 / 2-lead 0.58;方案为残差 CNN 集成+注意力。
- 亚军 DSAIL SNU 0.57;季军 NIMA 0.56(论文 Table 3)。
- 核心结论:不同导联组合测试分数中位变化 ≤0.036,配对符号秩和检验 p≥0.50——降导联与全导联无统计显著差异。
- 获奖者 2021-09-15 于捷克 Brno CinC 会议公布。
- 数据 license:CC BY 4.0(PhysioNet 官方统一发布);访问策略 Anyone(无注册门槛)。
- 赞助:Google、MathWorks、Gordon and Betty Moore Foundation;NIH NIBIB R01EB030362。
- 官方要求引用三件套:CinC 2021 论文 + Physiol Meas 2022 总结论文 + PhysioNet 标准引用。
- 2020 前作论文:Perez Alday EA, et al. Physiol. Meas. 2021;41(12):124003(27 类、纯 12 导联任务)。
- CinC 2021 论文被引超 320 次(Google Scholar,2026-09 抓取口径)。
- Physiological Measurement 2022 Focus Issue on Classification of Multilead ECGs 收录赛后扩展研究。
- 2022-01-26 官方宣布 2020/2021 两届挑战赛收官。
- 挑战赛沙箱参考配置 n1-highmem-8(Google Cloud 赞助);提交默认 BSD 3-Clause 开源。
- 冠军队核心 Plesinger/Nejedly/Jurak 与 2015 届 Event 1 冠军(ISIBrno)存在人员谱系延续。
- 肢体导联线性关系(III=II−I;aVR/aVL/aVF 可由 I、II 线性表出)是 2 导联组合选择的信息学依据。
- 2021 届隐藏测试含两个训练/验证中从未出现的全新机构库(UMich、Undisclosed American)——分布外评估设计。
- 非官方(unofficial)与官方(official)两阶段提交制;leaderboard 于 2021-02-24 上线。
- UMich 库采样率为 250/500 Hz 混合——单一库内部即存在采样率异构。
- CPSC 2018 是唯一横跨训练/验证/测试三层的来源库(6,877 训练 + 1,463 隐藏拆分)。
- 挑战赛论文报告"在 CPSC 与 G12EC 验证库上的表现与测试库一致"——验证集与测试集分布稳定性被官方确认。
缩写速查表
| 缩写/术语 | 释义 |
|---|---|
| ECG | electrocardiogram,心电图 |
| CinC | Computing in Cardiology,国际计算心脏病学年会(PhysioNet 挑战赛共同主办方) |
| WFDB | WaveForm DataBase,PhysioNet 的信号存储标准(.mat 信号 + .hea 头文件) |
| SNOMED CT | Systematized Nomenclature of Medicine Clinical Terms,医学术语标准编码体系 |
| scored label | 参与挑战赛计分的诊断类目(26 个);其余为 unscored |
| reward matrix | 奖励矩阵:26×26 专家相似度系数矩阵,用于部分得分制评分 |
| NSR | normal sinus rhythm,正常窦性心律(评分的零分锚点) |
| nvAF | 房颤/房扑计分类目(合并计分口径) |
| G12EC | Georgia 12-Lead ECG Challenge Database,美国乔治亚来源库 |
| INCART | St Petersburg INCART 12-lead Arrhythmia Database,俄罗斯长程 Holter 库 |
| PTB / PTB-XL | 德国物理技术研究院(Physikalisch-Technische Bundesanstalt)诊断 ECG 库及其 XL 扩展 |
| UMich | University of Michigan,密歇根大学来源库(仅隐藏测试) |
| CPSC | China Physiological Signal Challenge,中国生理信号挑战赛(2018) |
| all-lead score | 官方综合榜分数 = 12/3/2 导联三项得分的均值 |
| 多标签(multi-label) | 一条记录可同时携带多个诊断标签(区别于互斥多分类) |
| 泛化(generalization) | 模型在陌生人群/机构/设备上的性能保持能力 |
| 隐藏集(hidden/sequestered set) | 官方保留、不公开下载、仅用于官方计分的验证与测试数据 |
| 分布外(out-of-distribution, OOD) | 测试分布与训练分布不同(如全新机构的数据) |
| HIPAA | Health Insurance Portability and Accountability Act,美国医疗隐私法案(人口学一致化的依据) |
| CC BY 4.0 | Creative Commons 署名 4.0 国际许可:允许商用/修改/再分发,义务为署名 |
| BSD 3-Clause | 宽松开源软件许可(参赛代码默认许可) |
| focus issue | 期刊专辑(Physiological Measurement 2022 年多导联 ECG 分类专辑) |
| Einthoven 三角 | 肢体导联间的几何-电学关系模型,III=II−I 等恒等式的来源 |
| 加压导联 | aVR/aVL/aVF 三个加压肢体导联(Goldberger 增强口径) |
| TTA(test-time augmentation) | 测试时增强:对输入做多版本扰动后聚合预测,前排队伍常用 |
| leaderboard | 官方排行榜(2021-02-24 上线,分非官方/官方两阶段) |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | PhysioNet/CinC 2021 挑战赛数据集 |
| url_name | cinc-2021 |
| 类型 | 挑战赛数据集汇编(多库) |
| 官方论文 | Reyna et al., Computing in Cardiology 2021;48:1-4 |
| 数据 DOI | 10.13026/g9wd-3j66(v1.0.0)/ 10.13026/gt86-a263(最新) |
| 组织方 | Emory DBMI 等 14 人团队 |
| 规模 | 9 库 131,149 条;公开训练 88,253 条 |
| 任务 | 26 类心脏异常多标签分类 × 12/6/4/3/2 导联 |
| 许可 | CC BY 4.0(数据)|BSD 3-Clause(代码) |
| 抓取时点 | 2026-09-26 |
| 库内互链 | cpsc(132)/ptb-xl(70)/Chapman-Shaoxing(143)/mimic-iv-ecg(172)/cinc-2015(487)/cinc-2018-sleep(493)/cinc-2023(499)/physionet-cinc-2016(382)/physionet-cinc-2017(162) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 9 | PhysioNet 官方目录 + 独立 DOI + 高引论文锚定;"CinC 2021/Will Two Do"检索直达 |
| A 可获取性 | 9 | CC BY 4.0 无门禁、无注册、直链下载——库内心电域最高档;扣 1 分:验证/测试隐藏为结构性限制 |
| I 可互操作 | 7 | WFDB 标准格式 + 官方双语言读取/评分代码;扣分:采样率/时长异构需自建协议,无官方统一转换层 |
| M 元数据质量 | 7 | 三层官方文档(内容页/项目页/论文)+ 开源代码;扣分:仅年龄/性别两个人口学变量、Ningbo 数字为推算、论文总量双口径 |
| S 可持续性 | 9 | PhysioNet/NIH 20+ 年托管记录;挑战赛系列持续运营至 2026;多镜像生态 |
| 综合评级 | 8.2/10(高) | 开放性与工程生态接近满档;标签弱复审与人口学稀薄是主要失分项,均属任务设计取舍而非管理缺陷 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 131,155 条(摘要口径)/ 7 机构 / 88,253 公开 | 挑战赛论文摘要 | moody-challenge.physionet.org/2021/papers/2021ChallengePaperCinC.pdf |
| 131,149 条(正文口径)/ 9 库 / 6,630 验证 / 36,266 测试 | 挑战赛论文正文 §2 | 同上 PDF |
| 训练 7 库分库数字(6,877/3,453/74/516/21,837/10,344/10,247+34,905) | 官方项目页 Data Access 列表 | physionetchallenges.org/2021/ |
| Georgia 20,672 = 10,344+5,167+5,161;UMich 19,642;Undisclosed 10,000 | 官方项目页 Data Sources 段 | 同上 |
| 采样率/时长(257 Hz INCART、500/1000 Hz PTB 系等) | 官方项目页逐库描述 | 同上 |
| 68 队 / 1,056 次提交 / 618 成功 / 39 队上榜 | 挑战赛论文 §4 | 同上 PDF |
| 26 scored labels + reward matrix | 挑战赛论文 Table 2 | 同上 PDF |
| 冠军分数 0.58/0.57/0.56 | 挑战赛论文 Table 3;官方 results 页排名 | physionetchallenges.org/2021/results/ |
| 中位变化 ≤0.036、p≥0.50 | 挑战赛论文结果段 | 同上 PDF |
| CC BY 4.0 / Anyone 访问 / DOI / 发布日期 2020-12-24 | PhysioNet 官方内容页 Access/Discovery 字段 | physionet.org/content/challenge-2021/1.0.0/ |
| 获奖公布日期 2021-09-15 Brno | 项目页公告 2021-09-20 条目 | physionetchallenges.org/2021/ |
| 133 种诊断 / SNOMED CT 近似映射 / 不改原始数据 | 挑战赛论文 §2 | 同上 PDF |
附录 D:数据获取决策树
- 你要官方榜单可比的评估?→ 只能走官方渠道(挑战赛已收官;focus issue 复评窗口已关闭)→ 现实路径:本地用官方验证集复现协议 + 公开算法代码对照。
- 你要最大规模训练语料?→ 下载全部 7 库(88,253 条)→ 按 §2.4 建统一重采样协议。
- 你要快速跑通第一个基线?→ 只下 CPSC 2018 或 G12EC(规模适中、500 Hz 单一采样率)→ 官方 Python 示例提交代码直接改造。
- 你要长程/动态心电研究?→ INCART 74 条 30 分钟记录仅作补充(规模过小)→ 建议转向库内 vitaldb(192) 或 mimic-iv-waveform(65)。
- 你要中国人群子集?→ CPSC(6,877+3,453)与 Chapman-Shaoxing+Ningbo(45,152)合计约 5.5 万条;原库细节转 cpsc(132)/Chapman-Shaoxing(143) 条目。
- 你要商用?→ CC BY 4.0 署名即可;含 CPSC 子集时核对原库许可(坑 6)。
- 你要教学演示数据集?→ G12EC 或 Chapman-Shaoxing(10 秒整齐记录、500 Hz 单一采样率,最接近"教科书数据"形态)。
- 你要测试流水线健壮性?→ 故意混入 INCART 与 PTB-XL(长程+双采样率),比任何单元测试都能暴露读取层的假设漏洞。
附录 E:26 类计分标签分组导读表
| 组别 | 类目(官方记法) | 中文对照 |
|---|---|---|
| 节律 | nvAF; AFL; STach; SB; Brady | 房颤/房扑(合并口径); 心房扑动; 窦性心动过速; 窦性心动过缓; 心动过缓 |
| 传导 | IAVB; IRBBB; CRBBB/RBBB; CLBBB/LBBB; NSIVCB | 房室传导阻滞; 不完全右束支阻滞; 完全/一般右束支阻滞(同列计分); 完全/一般左束支阻滞(同列计分); 非特异性室内传导阻滞 |
| 轴向/形态 | LAD; RAD; LAnFB; LQRSV; LPR; PRWP | 电轴左偏; 电轴右偏; 左前分支阻滞; 低 QRS 电压; 房室传导延迟(PR 延长口径); PR 缩短(预激相关) |
| 除极/复极 | QAb; TAb; TInv; LQT | Q 波异常; T 波异常; T 波倒置; 长 QT |
| 期前收缩 | PAC/SVPB; PVC/VPB | 室上性早搏; 室性早搏 |
| 排除锚点 | NSR | 正常窦性心律(零分锚点、患病率最高类目) |
注:官方 reward matrix 的 26 列名原文为 nvAF, AFL, BBB, Brady, CLBBB/LBBB, CRBBB/RBBB, IAVB, IRBBB, LAD, LAnFB, LPR, LQRSV, LQT, NSIVCB, NSR, PAC/SVPB, PR, PRWP, PVC/VPB, QAb, RAD, SA, SB, STach, TAb, TInv;同列多写法(如 CLBBB/LBBB)表示不同 SNOMED 码按相同方式计分。最终 SNOMED CT 码对照以开源评分代码内 scored labels 文件为权威。
分组的三条使用提示:
- 节律组的临床权重最高:nvAF/SB/STach/Brady 直接触发抗凝、起搏等决策,是 reward 系数差异最大的组——逐类校准时应优先保证该组的召回。
- 传导组的同列合并:CRBBB/RBBB 与 CLBBB/LBBB 的合并意味着"完全与否"在计分上无差别——做精细分型研究必须回原库(如 PTB-XL 的诊断树),不能用挑战赛版标签。
- NSR 锚点的特殊性:它既是最高患病率类目又是零分锚点,任何"剔除正常类再评估"的做法都会同时改变分数语义与类别平衡——不建议。
附录 F:九库全字段对照总表
| 库 | 国别 | 训练 | 验证 | 测试 | Hz | 时长 | 条均特点 |
|---|---|---|---|---|---|---|---|
| CPSC 2018 | 中国 | 6,877 | — | 1,463(拆分) | 500 | 6-144 s | 9 类异常清单标签 |
| CPSC-Extra | 中国 | 3,453 | — | — | 500 | ≤60 s | 2018 未用余量 |
| INCART | 俄罗斯 | 74 | — | — | 257 | 30 min | 长程 Holter、心律失常密集 |
| PTB | 德国 | 516 | — | — | 1000 | 10-120 s | 经典诊断库、健康对照多 |
| PTB-XL | 德国 | 21,837 | — | — | 500/1000 | 10-120 s | 最大单库、标签树精细 |
| Georgia G12EC | 美国 | 10,344 | 5,167 | 5,161 | 500 | 5-10 s | 美国东南部人群 |
| Chapman-Shaoxing | 中国 | 10,247 | — | — | 500 | 10 s | 绍兴人民医院 |
| Ningbo | 中国 | 34,905* | — | — | 500 | 10 s | 宁波第一医院(推算值) |
| UMich | 美国 | — | — | 19,642 | 250/500 | 10 s | 急诊人群、全新机构 |
| Undisclosed American | 美国 | — | — | 10,000 | 未披露 | 未披露 | 来源保密(坑 8) |
附录 G:加载与预处理骨架(Python)
import wfdb
import numpy as np
LEADS12 = ['I','II','III','aVR','aVL','aVF','V1','V2','V3','V4','V5','V6']
TARGET_HZ = 500.0
def load_record(record_path):
"""读取一条 WFDB 记录,返回 (signal, sample_rate, leads)"""
rec = wfdb.rdrecord(record_path)
sig = rec.p_signal.astype(np.float32) # (n_samples, n_leads)
leads = [s.strip() for s in rec.sig_name]
return sig, rec.fs, leads
def resample_to_target(sig, fs, target=TARGET_HZ):
"""线性插值重采样;生产环境建议用带抗混叠的多相滤波器"""
if fs == target:
return sig
n_out = int(round(sig.shape[0] * target / fs))
idx_in = np.linspace(0, sig.shape[0] - 1, n_out)
return np.stack([np.interp(idx_in, np.arange(sig.shape[0]), sig[:, c])
for c in range(sig.shape[1])], axis=1).astype(np.float32)
def align_leads(sig, leads):
"""把任意导联排列对齐到标准 12 导联顺序"""
col = [leads.index(l) if l in leads else -1 for l in LEADS12]
out = np.zeros((sig.shape[0], 12), dtype=np.float32)
for i, c in enumerate(col):
if c >= 0:
out[:, i] = sig[:, c]
return out
def reduce_leads(sig, combo):
"""按官方降导联组合抽列:combo in {'6','4','3','2'}"""
combos = {
'6': ['I','II','III','aVR','aVL','aVF'],
'4': ['I','II','III','V2'],
'3': ['I','II','V2'],
'2': ['I','II'],
}
leads = LEADS12
keep = [leads.index(l) for l in combos[combo]]
return sig[:, keep]
附录 H:官方评分口径调用骨架
# 官方评分代码:github.com/physionetchallenges/evaluation-2021(Python 版)
# 关键约束:
# 1) 输出 CSV:记录名 + 26 类 SNOMED CT 码 0/1 列(列序与官方 labels 一致)
# 2) 26 类之外标签可输出但不计分
# 3) 格式错误 -> 该次提交记 0 分(挑战赛 618/1056 成功率的主因)
from evaluate_2021 import evaluate_scores, load_rewards
rewards = load_rewards() # 26x26 reward matrix(专家相似度系数)
# classes: 26 个 scored labels 的 SNOMED CT 码(与官方 classes 文件一致)
scores = evaluate_scores(label_files, output_files, classes, rewards)
# scores 含逐库记录级得分;全对=1、全标 NSR=0、全阳=负分
附录 I:跨库泛化实验设计检查单(12 项)
- 重采样协议先定死(目标 Hz、抗混叠滤波器),写进配置而不是代码里。
- 按库分层切分训练/本地验证——不要随机混合切分(同库相邻记录高度相关)。
- 记录间无患者 ID:不能声称"患者级无泄漏",只能声称"记录级无泄漏"。
- 标签评估在 26 类 reward matrix 口径做主指标;133 类全词表指标仅作辅助。
- 报告按库分组的性能(7 库 × 指标),不要只报混合均值。
- 若模拟降导联:从 12 导联信号按官方导联组合抽列(附录 G reduce_leads),不要用第三方降导联重编码数据。
- INCART 单独处理(30 min 长程):决定分段窗口并固定。
- 年龄/性别特征单独消融一次(多数类目增益趋零)。
- 与 39 支公开算法对照时,注明其提交环境(沙箱复跑)与你本地环境的差异。
- 类别极不平衡:报告 reward-score 与 per-class 召回,不只报 macro。
- 引用数字时区分两届:2020(27 类)与 2021(26 类)不混写(坑 4)。
- 商业项目留存 CC BY 4.0 署名证据链;CPSC 子集核原库许可(坑 6)。
附录 J:许可条款细读
| 层 | 许可 | 关键条款 | 使用含义 |
|---|---|---|---|
| 数据集本体 | CC BY 4.0 | 署名 + 变更声明 | 商用/修改/再分发均允许;引用 DOI 与论文即满足 |
| 各子库原始版 | 各异(PTB-XL CC BY 4.0;CPSC CC BY-NC-SA 4.0 等) | 以各原库发布页为准 | 汇编版重发布不追溯修改原库许可语义;商业场景逐库核对 |
| 官方评分代码 | BSD 3-Clause | 保留版权声明 | 可嵌入商业产品 |
| 参赛算法 | 默认 BSD 3-Clause(未声明时) | 各队可自选开源许可 | 使用前查各队 LICENSE 文件 |
| 论文/网站 | 开放获取 / CC BY 4.0 | 标准学术引用 | — |
附录 K:检索决策树
写综述/课程 → 引挑战赛论文 + 本条目 §5.5。
找最大公开 ECG 语料 → 7 库全下(§2.1 表)。
做便携设备论证 → §5.5 三条件 + 论文 p≥0.50。
复现冠军 → results 页 ISIBrno-AIMT 论文 + 代码链接。
做评估方法学研究 → 附录 E/H + Physiol Meas 2022 总结论文。
找中国人群 → cpsc(132)/Chapman-Shaoxing(143) 原库条目优先。
找 ICU 场景 ECG → mimic-iv-ecg(172)。
找单导联前传 → physionet-cinc-2017(162)。
找标签映射方法论 → 本条目 §2.7 + Physiol Meas 2022。
找挑战赛组织模板 → 本条目 §3.5/§8.4 + 官方 GitHub。
附录 L:双口径登记表
| # | 口径 A | 口径 B | 处理 |
|---|---|---|---|
| 1 | 论文正文 131,149 条(9 库) | 论文摘要 131,155 条(7 机构) | 正文采用 131,149(分源校验支持),摘要口径双注(坑 1) |
| 2 | “seven institutions” | “nine databases” | 机构与库是两个维度:7 机构 9 库(坑 2) |
| 3 | Ningbo 34,905(推算) | 官方合计 45,152(Chapman-Shaoxing+Ningbo) | 引用推算值必须注明推算(坑 3) |
| 4 | 2020 届 27 类 | 2021 届 26 类计分 | 按届次分别引用(坑 4) |
| 5 | 汇编版 CC BY 4.0 | CPSC 原库 CC BY-NC-SA | 商用逐库核对(坑 6) |
| 6 | INCART 30 min 长程 | 其余库 5-120 s 短程 | 预处理单独协议(坑 7) |
| 7 | results 页只列 rank | 论文 Table 3 列分数 | 分数引论文口径(0.58/0.57/0.56) |
| 8 | UMich 250/500 Hz 混合 | 其余库单一/双档明确 | 逐记录读 .hea 确定采样率 |
附录 M:引文规范(BibTeX)
@inproceedings{reyna2021will,
title = {Will Two Do? Varying Dimensions in Electrocardiography:
The {PhysioNet/Computing in Cardiology} Challenge 2021},
author = {Reyna, Matthew A and Sadr, Nadi and Perez Alday, Erick A and
Gu, Annie and Shah, Amit J and Robichaux, Chad and
Bahrami Rad, Ali and Elola, Andoni and Seyedi, Salman and
Ansari, Sardar and Ghanbari, Hamid and Li, Qiao and
Sharma, Ashish and Clifford, Gari D},
booktitle = {Computing in Cardiology},
volume = {48},
pages = {1--4},
year = {2021}
}
@misc{challenge2021data,
title = {Will Two Do? Varying Dimensions in Electrocardiography:
The PhysioNet/Computing in Cardiology Challenge 2021 (v1.0.0)},
author = {Reyna, Matthew A and Sadr, Nadi and Perez Alday, Erick A and
Liu, Chengyu and Seyedi, Salman and Clifford, Gari D},
year = {2020},
doi = {10.13026/g9wd-3j66},
url = {https://physionet.org/content/challenge-2021/1.0.0/},
organization = {PhysioNet}
}
附录 N:挑战赛系列年表(2000-2026 节选)
| 年 | 主题 | 备注 |
|---|---|---|
| 2000 | 从 ECG 检测睡眠呼吸暂停 | 系列首屆 |
| 2009 | 急性低血压发作预测 | "低血压预测"主题的真实归属(常见误记为 2015 届) |
| 2012 | ICU 患者死亡预测(MIMIC-II 派生) | EHR 时序域 |
| 2015 | ICU 假心律失常警报抑制 | 库内 cinc-2015;Plesinger Event 1 冠军 |
| 2016 | 正常/异常心音分类 | 库内 physionet-cinc-2016 |
| 2017 | 单导联房颤分类 | 库内 physionet-cinc-2017;"降导联"前传 |
| 2018 | 睡眠 PSG 觉醒检测(You Snooze You Win) | 库内 cinc-2018-sleep |
| 2020 | 12 导联 27 类异常分类 | 2021 直接前作 |
| 2021 | 降导联多标签诊断(本条目) | 规模最大(13 万条级) |
| 2022 | 心音图先天心脏病检测 | CirCor DigiScope 语料 |
| 2023 | 心脏骤停后神经功能预后 | 库内 cinc-2023 |
| 2024 | ECG 图像数字化分类 | 图像模态 |
| 2025 | Chagas 病 ECG 检测 | 部分复用 PTB-XL/CODE 系 |
| 2026 | 睡眠 PSG 认知障碍筛查 | 进行中 |
谱系阅读法三则:其一,看主题迁移——从单一疾病(2000 年睡眠呼吸暂停)到多标签泛化(2021)再到跨模态(2024 图像化),挑战赛系列本身就是医学 AI 任务复杂度的演化史;其二,看评分演化——从准确率到部分得分制,评估哲学日趋临床化;其三,看数据规模——2021 届的 13 万条级是系列的规模峰值之一,此后各届转向"更难的问题"而非"更大的数据"。
附录 O:本条目生产档案与维护计划
生产档案:
- 抓取时点:2026-09-26
- 核验路径:三轮搜索(moody-challenge 官方页/PhysioNet 内容页/论文三源互证)→ slug 查重(psql ILIKE 多轮 + ls writing/)→ 官方项目页与 CinC 论文 PDF 逐数字解析
- 正选改道记录:CinC 2015(撞车 cinc-2015=487)→ 备选 1 CinC 2018(撞车 cinc-2018-sleep=493)→ 备选 2 CPSC(撞车 cpsc=132)→ 就地改道 CinC 2021(slug 未占坑)
- 主要来源:physionet.org/content/challenge-2021/1.0.0/(curl 带 UA 实抓);physionetchallenges.org/2021/(项目页);moody-challenge.physionet.org/2021/papers/2021ChallengePaperCinC.pdf(论文 PDF 逐页解析);physionetchallenges.org/2021/results/(榜单);lcp.csail.mit.edu/challenge(系列背景)
- 环境适配:physionet.org 与 PMC 抓取均使用 curl + User-Agent;未依赖 HuggingFace 数字(若需镜像核验走 hf-mirror.com)
维护计划与触发点:
| 触发事件 | 动作 |
|---|---|
| challenge-2021 数据集出新版本(DOI 变更) | 核对分库数字是否有修订;更新 §2.1 与附录 F |
| 第三方复现出更高榜单外成绩 | 追记至 §7.3 下游影响,注明非官方口径 |
| PhysioNet 公开验证/测试集(低概率) | 全面改写 §1 Q11/§6.1 与 DAIMS A 维度评分 |
| 后续挑战赛复用本数据集 | 扩充 §7.1 谱系与互链 |
| 库内新收录 INCART/UMich 独立条目 | 更新 §9.1 家族图谱 |
附录 P:基于本数据集的研究检查清单(10 项)
- 明确写清所用版本(v1.0.0 或最新)与分库清单——跨论文可复现的第一前提。
- 声明重采样/分段协议并给参数(目标 Hz、滤波器、窗长)。
- 主指标用官方 reward matrix 口径(26 类);附 macro-F1 时单独注明。
- 按库分层报告结果;不给"混合均值唯一论"。
- 降导联实验按官方导联组合抽列,注明"训练全导联"前提。
- 不声称患者级无泄漏(数据无患者 ID)。
- 引用总量时区分 131,149(正文)与 131,155(摘要)口径。
- 引用 Ningbo 数字时注明推算。
- 商用场景附 CC BY 4.0 署名声明;CPSC 子集核原库许可。
- 与榜单对比时声明验证协议差异(隐藏集不可得)。
附录 Q:官方资源链接清单
| 资源 | 链接 | 说明 |
|---|---|---|
| 数据集内容页(v1.0.0) | https://physionet.org/content/challenge-2021/1.0.0/ | license/DOI/引用与数据下载 |
| 数据集最新版 | https://physionet.org/content/challenge-2021/ | DOI 10.13026/gt86-a263 |
| 挑战赛项目页 | https://physionetchallenges.org/2021/ | 规则/数据来源/评分说明/公告 |
| 官方 results 页 | https://physionetchallenges.org/2021/results/ | 39 队排名与逐队论文/代码链接 |
| 挑战赛论文 PDF | https://moody-challenge.physionet.org/2021/papers/2021ChallengePaperCinC.pdf | CinC 2021;48:1-4 全文 |
| 系列总览页 | https://moody-challenge.physionet.org/ | George B. Moody PhysioNet Challenges |
| 系列历史页 | http://lcp.csail.mit.edu/challenge | 2000-2019 各届一览(MIT LCP 存档) |
| 论文收录页(v1.0.3) | https://physionet.org/files/challenge-2021/1.0.3/papers/index.html | 挑战赛与参赛论文清单 |
| 2020 前作论文 | doi.org/10.1088/1361-6579/abc960 | Physiol Meas 41(12):124003 |
注:以上链接为 2026-09-26 抓取时点可达地址;PhysioNet 站内改版可能改变路径,检索时以 physionet.org 站内搜索"challenge-2021"兜底。
附录 R:检索路径示范(关键词组合与查询式)
面向不同检索系统的查询式示范:
| 目标 | Google Scholar / PubMed 式查询 | 说明 |
|---|---|---|
| 挑战赛主论文 | "Will Two Do" PhysioNet Challenge 2021 Reyna |
直接命中 CinC 论文与 PhysioNet 页 |
| 降导联结论 | reduced-lead ECG classification 12-lead comparison PhysioNet 2021 |
找第三方验证与扩展研究 |
| 冠军方案 | ISIBrno-AIMT ECG residual CNN attention Nejedly |
命中冠军论文与代码 |
| 标签异构分析 | "heterogeneous labels" multilead ECG Physiological Measurement Reyna |
命中 Physiol Meas 2022 总结论文 |
| 汇编版数据 | PhysioNet challenge-2021 SNOMED WFDB |
命中官方数据页 |
| 后续应用 | "Challenge 2021" ECG pretrained transfer |
找用本数据预训练/迁移的工作 |
中文检索提示:“PhysioNet 2021 挑战赛”“心电 降导联 多标签”"Will Two Do 挑战赛"均可达中文社区讨论;注意中文文献常把两届数字混写(坑 4),引用前回官方页核对。
附录 S:常见错误用法对照表
| 错误用法 | 后果 | 正确做法 |
|---|---|---|
| 用 133 类 macro-F1 对标榜单 0.58 | 分数不可比、结论失真 | 26 类 + reward matrix(坑 5) |
| 把 2020 届 27 类数字写进 2021 条目 | 三处数字全错 | 按届次区分(坑 4) |
| 全局写死采样率 500 Hz | PTB-XL/INCART/UMich 读取错误 | 逐记录解析 .hea |
| INCART 按 10 秒记录读 | 内存暴涨或信号截断 | 长程分段协议(坑 7) |
| 随机混合切分训练/验证 | 同库相邻记录泄漏、虚高 | 按库分层切分 |
| 声称"患者级无泄漏" | 无法验证的过度声明 | 只可声明记录级 |
| Ningbo 引用不注推算 | 讹传为官方口径 | 带"由官方合计推得"限定(坑 3) |
| 商用 CPSC 子集只引汇编许可 | 原库 CC BY-NC-SA 合规风险 | 双库许可核对(坑 6) |
| 用 12 导联训练却声称测"降导联上限" | 回答了另一个问题 | 分清"部署场景"与"数据上限"两种对照 |
| 把 Undisclosed American 当已披露库分析 | 无法复核、涉嫌臆测 | 按机构分层分析仅限已披露库(坑 8) |
附录 T:WFDB 数据字典(读取必备字段)
| 字段(.hea 头内) | 含义 | 跨库陷阱 |
|---|---|---|
| record name | 记录名(对应 .mat 文件名) | 各库命名空间独立(aNNNN/gNNNN/…),跨库去重不能只靠名字 |
| sampling frequency | 采样率(Hz) | 同库内也可能双档(PTB-XL 500/1000;UMich 250/500) |
| number of signals | 通道数 | 挑战赛版均为 12 导联,但历史派生数据可能不同 |
| lead names | 导联名列表 | 大小写/写法需规范化后再对齐(§3.6) |
| ADC gain / baseline | 物理单位换算系数 | 不同库增益不同,直接比幅值会错;wfdb 库 p_signal 已按增益换算 |
| ADC resolution | 位深 | 8/12/16 位混存;影响量化噪声评估 |
| age / sex(附加行) | 人口学(挑战赛版附加) | HIPAA 一致化后的值,非原始记录 |
| dx(附加行) | SNOMED CT 诊断码列表 | 多标签以分号分隔;26 类之外码不计分 |
读取顺序建议:先读 .hea 判断采样率与导联 → 再读 .mat → 按 §2.5 协议重采样 → 按 §3.6 对齐导联 → 标签按 SNOMED 码对齐官方 26 类清单。
附录 U:FAIR / AI-Ready 检查单
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 元数据有全局唯一标识 | ✅ | 独立 DOI(版本级双 DOI) |
| F2 数据可引用 | ✅ | 官方 Citation 导出 + 附录 M BibTeX |
| F3 元数据含数据描述符 | ✅ | 内容页+项目页+论文三层 |
| A1 元数据可检索 | ✅ | PhysioNet 站内索引 + Google Dataset Search |
| A2 数据标准协议可取 | ✅ | HTTPS 直链,无注册无门槛 |
| I1 数据用开放格式 | ✅ | WFDB(社区标准)+ 开源读取库 |
| I2 使用开放许可 | ✅ | CC BY 4.0 |
| R1 溯源说明 | ✅ | 分库来源+重编码声明(§2.2/§2.8) |
| R2 结构化社区规范 | ✅ | 挑战赛系列 20+ 年惯例 |
| 额外:官方基线代码 | ✅ | 示例提交+评分代码+39 队算法 |
| 额外:患者级元数据 | ⚠️ | 仅年龄/性别(结构性限制) |
| 额外:测试集可得 | ⚠️ | 永久隐藏(评估设计取舍) |
尾注
本条目由写手代理 B(EHR/生理信号域)独立完成:候选核验(三轮三源)→ slug 查重(数据库与文件系统双确认)→ 事实档案(writing/cinc-2021/FACTS.md)→ 成稿 → 双闸门自检。所有硬数字均可溯源至附录 C 证据链自证表所列官方来源;双口径与推算值逐条存照(附录 L 与坑点清单)。发布由主会话串行负责。
数据集本体许可 CC BY 4.0:使用时请署名 Reyna et al. (2021) 与 PhysioNet DOI,并遵循官方引用三件套要求(附录 M)。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- ltafdb — 共享标签:生理信号 / 心电信号 / 挑战赛数据集 / 评测基准 / 心血管疾病
- cinc-2020 — 共享标签:生理信号 / 心电信号 / 挑战赛数据集 / 评测基准 / 心血管疾病
- cinc-2014 — 共享标签:生理信号 / 心电信号 / 挑战赛数据集 / 评测基准 / 心血管疾病
- mit-bih-afdb — 共享标签:生理信号 / 心电信号 / 评测基准 / 心血管疾病
- icentia11k — 共享标签:生理信号 / 心电信号 / 评测基准 / 心血管疾病
- apnea-ecg — 共享标签:生理信号 / 心电信号 / 挑战赛数据集 / 评测基准
- cinc-2013 — 共享标签:生理信号 / 心电信号 / 挑战赛数据集 / 评测基准
- cinc-2011 — 共享标签:生理信号 / 心电信号 / 挑战赛数据集 / 心血管疾病
- mit-bih-arrhythmia — 共享标签:生理信号 / 心电信号 / 评测基准 / 心血管疾病
- chapman-shaoxing — 共享标签:生理信号 / 心电信号 / 评测基准 / 心血管疾病
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

