信息速览
INFOBOX — cinc-2011 一屏速览
维度 内容 本质 第 12 届年度 PhysioNet/CinC 挑战赛数据集:手机采集 ECG 的近实时质量评估(不是 ICU 假警报——那是 2015 届,坑 1) 团队 MIT Laboratory for Computational Physiology:Ikaro Silva、George Moody、Leo Anthony Celi 论文 Computers in Cardiology 2011;38:273-276(IEEE;论文页眉用 Computers,挑战官方名用 Computing,坑 4) 数据 2000 条 12 导联 ECG = Set A 1000(训练)+ Set B 500(公开测试)+ Set C 500(隐藏测试);公开可下载 1500 条 规格 0.05-100 Hz 诊断带宽、500 Hz、16-bit、最短 10 秒;CSV(.txt)+ WFDB(.hea/.dat)双格式 标注 8,327 个众包字母级评分(A/B/C/D/F),每条 3-18 人独立盲评,三分组金标准 赛道 Event 1 闭源+数据 B(accuracy)/ Event 2 开源 Java+数据 B / Event 3 开源+隐藏 C(accuracy×速度) 冠军 Event 1&2:Xiaopeng Zhao 0.932/0.914;Event 3:Dieter Hayn 0.873;共 49 支队伍参战 背景项目 Sana Mobile × Narayana Hrudayalaya(印度)农村远程心电;GSMA 赞助奖金 获取 ZIP 169.7 MB 直下 / wget / AWS S3 开放镜像,无需注册;ODC-BY 1.0 关键坑 Set A 非手机也非 MIMIC-II(坑 2);Set D 从未发布(坑 3);G2 占比双口径 <1% vs 13.4%(坑 5) 库内互链 CinC 年份链 2012-2023 共 10 条(2011 是补齐的唯一缺口)
PhysioNet/Computing in Cardiology Challenge 2011 是"给外行人的 ECG 质量门卫":它假设手机与廉价心电附件终将把心电图送到世界任何一个村庄,而真正稀缺的不是采集设备,是判断这段波形够不够好的能力——病人还躺在电极上,算法必须几秒内告诉他"这次可以"或者"请重测"。为此 PhysioNet 与 Computing in Cardiology 年会搬出 2000 条 12 导联 ECG、8,327 个人工质量评分和三个设计迥异的赛道,让 49 支队伍用 accuracy 和运行速度一决高下。十余年后回看,这个数据集仍是信号质量评估(SQI)领域最常被引用的金标准底座之一,也是库内 CinC 年份链条上补齐的 2011 环节。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——ZIP/wget/AWS 三条路全开放,ODC-BY 1.0,无需注册;但注意公开的只有 1500 条,Set C 500 条永远隐藏(坑 6)。
- 关心标注口径:直奔 §3 标注体系——8,327 评分怎么变成三分组、为什么官方页与 2012 专刊对"不确定组"占比说法差了一个数量级(坑 5)。
- 找 2015 届 ICU 假警报的:你走错片场了——"Reducing False Arrhythmia Alarms in the ICU"是 CinC 2015(库内 cinc-2015,rid 487);本届主题是手机 ECG 质量评估(坑 1)。
§0 导读:这个数据集解决什么问题
心血管疾病是全球头号死因,而 WHO 的口径是82% 的 CVD 死亡发生在中低收入国家。与此同时,ITU 2010 年统计全球有 53 亿移动用户(约全球人口 77%),发展中国家每百人已有 67.6 部手机。把这两条线合在一起,就得到 2011 届挑战赛的全部动机:如果经验不足的农村护士、技师甚至受过简单培训的志愿者,能用手机+附件采出一段心电图并远程传给城市医院判读,偏远地区的 CVD 筛查就可以跳过"每村一个心内科专家"这个不可能的前提。
但这条链路上有一个此前被系统性低估的断点:质量。外行人采的 ECG 大量带着电极错位、接触不良、肌电干扰与运动伪影;判读专家的带宽是稀缺资源,如果每十条里六条是废片,远程筛查模型会在"专家看垃圾"这一步饱和。所以 2011 届把挑战目标定得极其聚焦:不做诊断,只做质量门卫——算法要在数秒内判断一段 ECG 是否"可接受用于诊断",理想情况下还能识别电极错位、接触不良、外部电干扰、运动伪影这四类问题并给出纠正指导。参赛代码被要求能在 Android 手机内近实时运行,这是"质量门卫"物理上必须住的位置。
数据侧的回答是 2000 条 12 导联 ECG(A/B/C 三集 1000/500/500)加一套前所未有的人工质量金标准:8,327 个由 3-18 名标注者独立盲评产生的字母级评分,折算为"可接受/不确定/不可接受"三分组。赛制侧的回答是三个 Event:闭源快跑(Event 1)、开源实机(Event 2)、隐藏数据+速度加权(Event 3),分别考验方法私有性、可部署性与工程效率。最终 49 支队伍参战,Xiaopeng Zhao 拿下 Event 1/2 双冠(0.932/0.914),Dieter Hayn 以速度加权的 0.873 拿下 Event 3。
0.1 三条动线汇成 2011
把 §0 开头两个百分比拆开看,2011 届的诞生其实是三条独立动线在同一年的交汇:
- 疾病动线:WHO 口径下 82% 的 CVD 死亡落在中低收入国家,而这些国家的心内科专家密度与死亡负担呈倒挂——最需要心电筛查的地方最缺会读心电图的人。远程判读(把波形传给城市专家)是唯一不依赖"就地培养专家"的路线。
- 设备动线:ITU 2010 年的 53 亿移动用户、77% 人口覆盖率、发展中国家每百人 67.6 部手机,意味着"传输通道"已经就位。2011 年前后 Android 智能机价格快速下探,手机从通话工具变成可编程的采集-计算-传输三合一终端。
- 方法动线:mHealth 范型在 2009-2011 年成形,MIT 学生运营的 Sana Mobile 等开源远程医疗项目已在印度落地"手机+外接附件+移动网络上传"的完整链路(§7.2)——链路每一环都能跑,唯独没有人在采集现场把关质量。
三条动线各贡献一块拼图:疾病动线给出"为什么值得做",设备动线给出"用什么做",方法动线给出"已经做到哪一步"。2011 届挑战赛把它们钉在同一张任务卡上:为这条链路补上缺失的质量门卫,并让全世界的算法团队公开竞标这个位置。
0.2 "质量"为什么是被系统性低估的断点
在传统医院流程里,ECG 质量是一个隐含保证:采集由受训技师完成、设备定期质检、不合格当场重测——质量从未作为独立变量出现在数据里,因为它被流程兜底了。一旦把采集外包给外行(这正是远程筛查的全部意义所在),这层隐性保证立即失效,而链路上没有任何环节准备好接管它:
- 采集端:外行不知道电极错位和接触不良长什么样,也没有第二双眼睛在旁边复核;
- 传输端:移动网络只保证字节到达,不保证波形可读;
- 判读端:专家带宽是最贵的资源,废片消耗的不是存储空间而是医生时间。
所以质量断点的本质是反馈闭环的断裂:在医院里,"这不行,重测"这句话发生在采集现场、几秒之内;在远程链路里,同样的话可能要等几小时甚至几天才从城市医院传回村庄——病人早已离开,重测成本无限放大。2011 届的全部任务设计(秒级判定、Android 端运行、四类问题识别)都在把这句话重新拉回采集现场。这也是为什么本数据集值得作为"质量本身可以是一个数据集"的教科书案例:它第一次把这条被流程隐藏的质量轴,变成了 8,327 个显式人工评分。
0.3 三合一结构:数据、赛制、标注方法论的阅读地图
cinc-2011 不只是一个数据集,而是三件套咬合的工程整体。按需取用即可,不必通读:
| 你要什么 | 去哪读 | 一句话摘要 |
|---|---|---|
| 数据本体(1500 条公开 ECG) | §2、§6 | A 1000/B 500 双集公开,C 500 永久隐藏(坑 6),规格诊断级 |
| 质量金标准(8,327 评分) | §3 | 字母评级+三分组;注意 G2 双口径(坑 5) |
| 赛制设计(三 Event 矩阵) | §4、§5 | 闭源/开源/隐藏集×速度三探针,49 队成绩全表 |
| 下载与许可实操 | §6 | ODC-BY 1.0、四路直下、无需注册 |
| 历史背景(Sana/GSMA/杭州) | §7 | 全球健康动线与电信业跨界赞助 |
| 方法学迁移(做自己的数据集) | §8 | 四条可复用的设计经验 |
| 踩坑预防 | §10 | 八则已踩过的坑,每则附避开方法 |
§0 读法三则:
- 这个条目是"数据集+赛制设计+金标准标注"三合一:本体是 1500 条公开 ECG 与其评分,赛制是三 Event 双指标,副产品是一套众包质量标注方法论——三者对二次研究者的意义各不相同(§3、§4)。
- 全文硬数字均以官方页(physionet.org,curl 直抓 58,233 字节存档)为第一事实源,与 2011 总结论文、2012 年 IOP 专刊导言三源互证;仅有的两处口径分歧(G2 占比、总量 2000/1500)已在坑 5、坑 6 双口径存照。
- 检索时若把本届当作"ICU 假警报挑战"会完全错位——那是 2015 届;2011 届的关键词是 mobile phone、quality assessment、Sana(坑 1)。
0.4 与 2015 届的三重区分(坑 1 的完整版)
| 区分维度 | 2011 届(本条目) | 2015 届(cinc-2015,rid 487) |
|---|---|---|
| 官方全称 | Improving the Quality of ECGs Collected using Mobile Phones | Reducing False Arrhythmia Alarms in the ICU |
| 问题对象 | 信号质量:这段 ECG 可不可读 | 报警质量:这条报警是不是真的 |
| 数据形态 | 12 导联 10 秒短记录 | ICU 多参数监护波形+报警事件 |
| 场景 | 远程/移动采集现场 | ICU 床旁监护 |
| 共同点 | 都在"减少低质量输入浪费专家带宽"这条线上 | 同左 |
两届在同一条"减少浪费"的线上:2011 届拦在采集端(不让废片进系统),2015 届拦在报警端(不让误报打扰医护)。记住"采集端 2011、报警端 2015",坑 1 永久免疫。
§1 数据集速览:十问十答
Q1:cinc-2011 的"2000 条"是什么口径?
12 导联 ECG 记录(不是受试者数):Set A 1000 条训练集(带参考质量评估)+ Set B 500 条公开测试集 + Set C 500 条隐藏测试集。公开可下载的只有 A+B 共 1500 条;总量 2000 出自 2012 年 IOP 专刊导言的最终金标准口径。
- 追问:为什么会有两个口径并存?因为 Event 3 的赛制需要一个从不公开的隐藏测试集(Set C),它在赛后被计入"全集"账本,但从未随 v1.0.0 发布。引用建议:写数据集规模用"2000(全集)/1500(公开)"双注式,见坑 6。
Q2:这些 ECG 真是手机采的吗?
不是——这是本条目最大的反直觉点。原计划用 Sana Mobile 的手机+蓝牙 ECG 硬件采集,因"一系列事件"(官方页原话:a series of events prevented us from collecting a sufficient number of ECGs with the hardware we had originally planned)未凑足样本,A/B/C 全部改用常规 ECG 机采集。手机元素只保留在:任务愿景、Android 参赛 API、以及 sim/ 目录里用目标手机硬件录制的合成试点数据(坑 2)。
- 追问:对复用者意味着什么?在真手机 ECG 数据分布上直接套用本集训练的 SQI 模型,会遭遇采集设备域差(常规 ECG 机的信号特征与手机附件不同),需要另行域适配或混入手机域数据。
Q3:那和 MIMIC-II 有什么关系?
没有关系。Set A 不是来自 MIMIC-II 波形库——任务头候选 brief 的这个猜测被三源证伪。MIMIC-II 是 2012 届挑战(ICU 死亡率预测)的数据源;2011 届的 A/B/C 是专为本挑战新采集的常规 ECG 机记录。
- 追问:如果想做"MIMIC 波形+2011 质量标注"的迁移研究,合法且常有价值,但论文里必须写明"将 2011 标注迁移到 MIMIC 波形",不能写成"原始标注",否则审稿人一查数据血缘即翻车。
Q4:信号规格是什么?
标准 12 导联(I、II、III、aVR、aVL、aVF、V1-V6)同步记录,全诊断带宽 0.05-100 Hz,采样率 500 Hz,16-bit 分辨率,每条最短 10 秒。每条记录提供 CSV(.txt,兼容挑战 Android API)与 WFDB(.hea+.dat 紧凑二进制)双格式。
- 追问:500 Hz 对 100 Hz 带宽是 5 倍过采样,给参赛者的特征工程留足了插值与重采样余量;双格式的动机是两条路各取所长——CSV 给 Android API 直接读,WFDB 给 PhysioNet 工具链用。
Q5:质量标签怎么来的?
众包+专家混合:每条 ECG 由 3-18 名标注者独立盲评,按字母等级 A(0.95)/B(0.85)/C(0.75)/D(0.60)/F(0) 打分,取平均后三分组:Group 1 可接受(均分 ≥0.70 且至多 1 个 F,约 70%)、Group 2 不确定(<1%)、Group 3 不可接受(<0.70,约 30%)。全程共产生 8,327 个评分。
- 追问:注意"约 70%/<1%/约 30%"是挑战期官方页口径;2012 年专刊的最终账本是 1,733 可决+267 不确定——两套口径差一个数量级,引用前先读 §3.4(坑 5)。
Q6:三个 Event 有什么区别?
Event 1:闭源或开源皆可,只交 Set B 逐条分类结果,指标 accuracy;Event 2:必须开源 Java 代码(官方模板 API+Android 模拟器),主办方在参考 Android 手机上实测,同 Set B 同指标;Event 3:同一份 Event 2 代码改测隐藏 Set C,得分 = accuracy × 运行时间函数(越快越高)。
- 追问:三根探针各测一个维度——方法上限(Event 1)、可部署性(Event 2)、工程效率(Event 3)。这个矩阵是本届赛制设计最有传承价值的部分(§8.3)。
Q7:冠军是谁,分数多少?
Event 1 冠军 Xiaopeng Zhao 0.932(前 10 分数带 0.896-0.932);Event 2 冠军同为 Xiaopeng Zhao 0.914;Event 3 冠军 Dieter Hayn 0.873(Václav Chudáček 0.872 以毫厘之差居亚)。论文摘要口径:Event 1 accuracy 范围 89-93%,Event 2 80-91%,Event 3 参考手机平均执行 <2 秒。
- 追问:这些 accuracy 是"可裁决样本上的 accuracy"——Group 2 已剔除不计(§4.3),与"全集 accuracy"不可直接比较;复现对榜时务必先剔除 G2。
Q8:license 是什么,要注册吗?
数据文件按 ODC-BY 1.0(Open Data Commons Attribution License v1.0)发布,Access Policy 为"Anyone can access"——无需注册、无需签协议;papers/ 目录的 17+1 篇论文按 CC BY 3.0。ZIP 全量 169.7 MB 一键直下,或 wget、AWS S3 开放镜像三选一。
- 追问:ODC-BY 与 CC BY 精神一致(署名即可用含商用),差别在 ODC 系列针对"数据库"这一客体设计。对教学与工业评测来说,这是库内最宽松的一档许可。
Q9:sim/ 目录是什么,能用吗?
是用原计划目标手机硬件录制的合成 ECG 试点数据(sim.tar.gz 5.7 MB,2011-02-16 发布),给参赛者提前熟悉 Android API 输入格式。它不是真实病人数据,做质量评估研究时不能与 set-a/set-b 混用(坑 8)。
- 追问:sim 的三个"不是"——不是真实病人数据、不是常规 ECG 机采集、不参与任何 Event 评分。它是"手机愿景"在数据侧唯一真实落地的部分,恰好因为它是合成的。
Q10:它在库内 CinC 年链里处于什么位置?
2011 是年份链的起点环节(第 12 届年度挑战)。库内已有 2012(rid 660)、2013(662)、2014(666)、2015(487)、2016(382)、2017(162)、2018-sleep(493)、2019(656)、2021(644)、2023(499)十环;2011 是唯一缺口,本次补齐后年链首尾贯通。
- 追问:年链命名有一个历史疙瘩——2016/2017 条目 slug 带 physionet- 前缀而其余不带,检索时两套都要试(§9.2)。
1.1 关键数字速记卡
| 数字 | 含义 | 出处 |
|---|---|---|
| 2000 / 1500 | 全集/公开记录数(A 1000+B 500+C 500) | IOP 导言+官方文件列表 |
| 8,327 | 众包质量评分总数 | IOP 专刊导言 |
| 3-18 | 每条记录的标注者人数区间 | 官方页 |
| 0.70 | 三分组的均值分界线(G1/G3 之间) | 官方页 |
| 约 70% / <1% / 约 30% | 挑战期口径 G1/G2/G3 占比 | 官方页 |
| 1,733 / 267 | 专刊口径可决/不确定条数(267≈13.4%) | IOP 导言 |
| 49 | 参战队伍/个人数 | 官方 top-ten+论文摘要 |
| 0.932 / 0.914 / 0.873 | 三 Event 冠军分(Zhao/Zhao/Hayn) | 官方 top-scores |
| <2 秒 | Event 3 参考手机平均执行时间 | 论文摘要 |
| US$2000 ×4 | 三 Event 奖金各 2000+标注池 2000 | 官方页 |
| 169.7 MB | 全量 ZIP 大小 | 官方文件列表 |
| 2011-04-19 | v1.0.0 Published(至今唯一版本) | 官方页 |
| ODC-BY 1.0 | 数据许可;papers 为 CC BY 3.0 | 官方页 |
1.2 检索别名与常见错位速查
| 你可能搜到的说法 | 实情 | 处理 |
|---|---|---|
| “Computers in Cardiology Challenge 2011” | 出版页眉拼写,官方名是 Computing(坑 4) | 两种拼写都值得搜 |
| “ECG quality challenge 2011” | 正确指向本届 | 直达本条目 |
| “false alarm challenge 2011” | 错位——假警报是 2015 届(坑 1) | 改搜 2015 |
| “MIMIC-II ECG dataset 2011” | 错位——MIMIC-II 属 2012 届(坑 2) | 改搜 cinc-2012 |
| “phone ECG dataset” | 半真——愿景是手机,数据非手机(坑 2) | 读 §2.3 |
| “Sana ECG dataset” | 半真——Sana 是背景项目,数据非其采集 | 读 §7.2 |
| “set D PhysioNet” | 陷阱——set D 从未存在(坑 3) | 读坑 3 |
| “challenge-2011 set-c download” | 陷阱——Set C 不可得(坑 6) | 读坑 6 |
| “PhysioNet Challenge 2012/2013/…” | 年链相邻环 | 见 §9.1 |
| “signal quality index SQI benchmark” | 本集是最常被引用的底座之一 | 本条目+附录 H |
1.3 五分钟叙事版
要一份能口头讲完的版本,按这个顺序说:2011 年,手机已经无处不在(77% 覆盖率)而心内科专家依然稀缺,82% 的心血管死亡发生在最缺专家的中低收入国家。MIT LCP 与 Sana Mobile 在印度的远程心电项目证明链路能跑通,也暴露了最脆的一环——外行采的波形大量不可读,专家时间浪费在废片上。于是第 12 届 PhysioNet/CinC 挑战赛把任务钉死为"质量门卫":算法在手机里、在几秒内、在病人还躺着时判断这段 ECG 能不能送进诊断流程。为此他们采集了 2000 条 12 导联 ECG(原计划手机采集,硬件不足改道常规 ECG 机——这个落差被诚实存照),并动员众包产出了 8,327 个字母级质量评分,聚合为"可接受/不确定/不可接受"三分组。49 支队伍在三个赛道上分别被考了方法上限(0.932)、真机可部署(0.914)、隐藏集+速度(0.873)。比赛结束后,数据集以 ODC-BY 1.0 全量开放,金标准进入其后十余年 SQI 文献的对标清单;赛制的三探针矩阵与"标注先行"次序,则成了挑战赛设计的活教材。这就是 cinc-2011:数据不大,影响很长。
1.4 一次合格的引用长什么样
三条可直接粘贴的引用范式(口径注记已内置):
- 引数据(现役版):Silva I, Moody GB, Celi L. Improving the Quality of ECGs Collected using Mobile Phones: The PhysioNet/Computing in Cardiology Challenge 2011 (version 1.0.0), PhysioNet, 2011. https://physionet.org/content/challenge-2011/1.0.0/(存档 DOI: 10.13026/C26P4C)
- 引论文(出版口径):Silva I, Moody GB, Celi L. Improving the Quality of ECGs Collected Using Mobile Phones: The PhysioNet/Computing in Cardiology Challenge 2011. Computers in Cardiology 2011;38:273-276.(坑 4:出版页眉 Computers)
- 引规模(双注式):基于 2000 条 12 导联 ECG 全集(其中 Set C 500 条隐藏未发布,公开可得 1500 条)与 8,327 个众包质量评分(坑 5/坑 6 口径注记)。
§2 数据构成与规格
2.1 三集结构:A/B/C 与一个从未出生的 D
| 集合 | 规模 | 角色 | 可得性 |
|---|---|---|---|
| Set A | 1000 条 | 训练集,随附参考质量评估(acceptable/unacceptable 预分类清单) | 公开(set-a.tar.gz 102.9 MB,2011-07-20 打包) |
| Set B | 500 条 | Event 1/2 公开测试集,参考评估保密 | 公开(set-b.tar.gz 51.2 MB,2011-04-20 打包) |
| Set C | 500 条 | Event 3 隐藏测试集,仅主办方用于实测提交代码 | 从未公开 |
| Set D | 0 条 | 官方页宣布"将用原计划手机采集流程组装 set D 作为补充发布在 PhysioNet(不用于评分)" | 宣布了但从未发布(坑 3) |
公开可得 = A+B = 1500 条;全集(含隐藏 C)= 2000 条。这两个口径在文献里都常见,引用时必须写明(坑 6)。2012 年 IOP 专刊导言给出的最终账本:2000 条记录共获 8,327 个质量评分,其中 1,733 条被判定为 acceptable/unacceptable、267 条 indeterminate(≈13.4%)。
逐集细读:
- Set A——带着答案的训练集。1000 条记录打包 102.9 MB,是三集中最重的一份。它的独特之处在于随附的参考质量评估:官方以 RECORDS-acceptable 与 RECORDS-unacceptable 两份清单形式公布"哪些记录被预先判为可接受/不可接受",使 A 成为唯一可以"有监督训练"的子集。注意这份清单的粒度是二分类预分类,不是逐条字母评分——后者从未逐条公开。
- Set B——参考答案保密的公开测试集。500 条、51.2 MB,波形文件完全公开,但其参考评估保密:参赛者下载得到波形,却看不到官方判定。这是标准的"公开题面、保密答案"设计,保证 Event 1/2 排行榜在提交时点的公平性。赛后官方页公布了 top-ten 成绩,但 B 的逐条金标准仍未以文件形式放出——复现者只能用 A 的清单训练、以"在 B 上复算 accuracy 是否落在官方分数带"来间接校验。
- Set C——只存在于成绩单里的 500 条。为 Event 3 保留的隐藏测试集,从未发布。它在账本上存在(IOP 导言按 2000 条报总分与评分数),在文件系统里不存在。任何声称下载了 set-c 的资源都应引起警惕(坑 6)。
- Set D——一份只存在于承诺里的目录。官方页在赛果段落宣布将组装 set D 作为补充发布,15 年后 v1.0.0 文件列表与存档页均无实物(坑 3)。它在结构表里占据一行,是为了让检索者知道"这里曾经规划过什么",避免把文献里的 set D 字样当作可得资源。
2.2 信号规格:一台标准诊断级心电图机该有的样子
- 导联体系:标准 12 导联——肢体导联 I、II、III 与加压导联 aVR、aVL、aVF,胸前导联 V1-V6,12 通道同步记录。
- 实务含义:12 导联同步意味着算法可以利用导联间冗余做交叉校验(如 I+III 可重建 II 的幅度关系),这是单导联 SQI 任务不具备的结构性红利(附录 J)。
- 带宽:0.05-100 Hz 全诊断带宽(下限保 ST 段形态,上限保 QRS 切迹与起搏脉冲——这是"诊断级"与"监测级"滤波器组的核心分野)。
- 实务含义:诊断带宽同时意味着噪声也全额进入数据——肌电、工频、基线漂移都未被预处理滤除,质量评估算法面对的是"生"信号。这对 SQI 研究反而是好事:输入分布未被预先"洗白"。
- 采样与量化:500 Hz、16-bit。对 100 Hz 带宽信号有 5 倍过采样裕量。
- 实务含义:16-bit 动态范围远超 8-bit 监护设备,微小低幅成分(如 aVR 的低电压、起搏脉冲)保留完整;5 倍过采样允许在不损失信息的前提下降采样到 250 Hz 省算力——这在 Event 3 的速度赛道上是真金白银的优化空间。
- 时长:每条最短 10 秒(约 10 秒上下的单一节律段,非长程 Holter)。
- 实务含义:10 秒是国际惯例的"标准 ECG 页"时长,够覆盖数个心动周期;SQI 特征(如基线漂移幅度、周期一致性)在此窗口内统计意义充分,又不至于让手机端计算超载。
- 存储:CSV 文本(.txt,逐样本逗号分隔,兼容挑战官方 Android API 的输入约定)与 WFDB 紧凑二进制(.hea 头文件+.dat 样本文件)双格式;PhysioBank ATM 在线工具可将其转为 text、Matlab、EDF 等格式。
- 实务含义:CSV 便于快速原型(pandas 一行读入),WFDB 便于规模化管线;两者内容同源,选一条路走到底即可,不必双份维护。
- 元数据:.hea 文件尾行携带受试者年龄与性别两项;年龄未知记 0、大于 89 记 90(HIPAA 式脱敏惯例)。除此之外不提供任何病史、用药或诊断信息。
- 实务含义:年龄字段里的 0 是"未知"而非"新生儿",90 是">89 截断"而非精确值——把这两个哨兵值当真实数值用会引入系统性偏误(FAQ Q30)。
2.3 采集方式:常规 ECG 机、混合水平的采集者
官方页明确:Set A/B/C 全部用常规 ECG 机采集(坑 2 的事实底座)。采集者构成刻意混合了水平不一的人群——护士、技师与受训程度不一的志愿者,包括仅受最小限度培训的外行。这不是缺陷而是设计:研究目标本来就是"软件辅助外行采心电",采集者水平参差带来的质量方差正是质量评估算法需要面对的真实分布。受试者群体与临床背景未做更细披露;一记录不必然对应唯一受试者。
这个设计里藏着一个值得展开的两难:分布的真实性 vs 归因的模糊性。混合采集者让数据覆盖了从"技师级干净"到"外行级混乱"的完整质量谱,这正是训练通用 SQI 模型想要的;但代价是任何"质量差"都无法归因到具体采集场景(设备型号?培训时长?受试者配合度?)——官方未提供逐记录的采集者画像。复用者的对策是把本集当作"质量谱全覆盖"的黑盒分布来用,而不是当作可控实验设计的数据来用。
2.4 sim/ 目录:给参赛者的"教具",不是真实数据
sim/ 子目录(sim.tar.gz 5.7 MB / sim.zip 5.6 MB,2011-02-16 发布)是用原计划目标手机硬件录制的合成 ECG 试点数据集,以 ecg_*.dat/.hea/.txt 三格式提供,用途是让参赛者在正式数据发布前熟悉 Android API 的输入格式与手机端工程约束。它是合成的、无病人的、不参与评分的;做 SQI 研究时与 set-a/set-b 严格区分(坑 8)。它也是"手机愿景"在本数据集里唯一以手机硬件落地的一角——恰好因为它是合成的。
对今天的读者,sim/ 还有一层史料价值:它是 2011 年"目标硬件在环"开发流程的实物证据——主办方在正式数据就位前先用目标设备造合成数据,把工程接口的坑提前排掉。现代 ML 挑战赛的"smoke test 数据集"(如若干届时先发的 mini split)承袭的正是这个思路。
2.5 与 MIMIC-II 的边界:一纸证伪
任务头候选 brief 曾猜测 Set A 来自 MIMIC-II 波形库。三源核验(官方页数据来源说明、2011 总结论文、IOP 导言)一致否决:本挑战三集均为专采新数据,MIMIC-II 在 CinC 年链里属于 2012 届(“Challenges in mortality prediction”,ICU 死亡率预测,库内 rid 660)。两届主题相邻但数据血缘无关。把 2011 的 ECG 标注套到 MIMIC-II 波形上做迁移研究是合法的二次研究,但必须明确"这是跨库迁移",不能写成"原始标注"。
为什么这个混淆高发?三个原因叠加:① 两届时间相邻(2011/2012)、主办方同一(MIT LCP),年链检索时必然先后出现;② MIMIC-II 的波形附件(Numeric Records)里确有 12 导联 ECG,与本届规格形似;③ 部分文献在引言里把两届并列叙述,转引者容易把"2012 届用 MIMIC-II"错位成"2011 届用 MIMIC-II"。对策是记住一句话:MIMIC 系数据第一次进入挑战赛年链是 2012 届。
2.6 规模横向对照:在 PhysioNet 挑战赛年链里算什么体量
2000 条 10 秒 12 导联记录,按样本量算约为 20,000 导联·秒级片段的体量——在 2020 年代动辄百万级的深度学习数据集面前是侏儒,但在 2011 年,它是第一个以"质量"本身为标注对象的公开 12 导联集合:此前的 PhysioBank 库存以临床波形+诊断标签为主,质量维度要么隐含在选集过程里,要么根本没有。8,327 个独立人工评分的标注密度(平均每条约 4-8 个评分、最多 18 个)在其时其地属于第一梯队。理解这个历史坐标,才能解释为什么此后十余年的 SQI 论文仍不断回到这个基准上对标。
换个角度算标注成本:8,327 个评分若按每条 10 秒波形+判读时间估,标注群体投入的人工小时数以千计——主办方用 US$2000 奖池加上众包的荣誉激励撬动这个规模,是"设计良好的低门槛任务+小额激励"的经典案例。这与 §3.1 的标注者池设计和 §8.2 的方法论总结互为表里。
2.7 RECORDS 清单与逐记录目录结构
PhysioNet 惯例用 RECORDS 纯文本清单索引记录:每行一个记录名,工具按行遍历。本届的清单结构值得单独一节,因为它是所有批量脚本的入口:
- set-a/ 内的清单:RECORDS(全量 1000 行)+ RECORDS-acceptable 与 RECORDS-unacceptable 两份预分类清单(参考质量评估的载体)。训练脚本的骨架是:读 RECORDS 全集 → 用两份预分类清单构造标签 → 对不在两份清单里的记录按未标注处理。
- set-b/ 内的清单:RECORDS(500 行);无预分类清单——参考评估保密是 Set B 的设计前提(§2.1)。
- 逐记录三件套:每个记录名对应同名 .txt(CSV 波形)、.hea(WFDB 头,含导联/采样率/增益与尾行年龄性别)、.dat(WFDB 二进制样本)。
- 批量读取最小循环(示意,记录名以 RECORDS 实际内容为准):
with open("set-a/RECORDS") as f:
names = [ln.strip() for ln in f if ln.strip()]
print(len(names)) # 应为 1000(set-a)
解包后先数 RECORDS 行数是最低成本的完整性校验:set-a 应为 1000 行、set-b 应为 500 行,行数对不上即下载/解包不完整(§6.6)。
2.8 四类质量问题的形态学画像
官方任务陈述点名了四类理想识别目标:电极错位、皮肤-电极接触不良、外部电干扰、运动伪影。官方未提供逐条/逐导联的问题类型标注,但四类问题在一般心电工程里的典型波形签名是稳定的,此处按 SQI 特征工程惯例整理(属编辑备忘而非官方标注口径,附录 J 有逐导联版):
- 电极错位:导联轴几何改变 → 波形形态系统性异常(如 I/III 极性关系破坏、胸前导联 R 波递增规律消失),信号"干净但不像 ECG"——纯噪声指标会漏判,需要形态学先验。
- 接触不良:皮肤-电极阻抗时变 → 基线突变、间歇性断零或大幅阶跃,往往在个别导联突发;导联间同步性检查(同一时刻哪些导联同时崩坏)是高判别力特征。
- 外部电干扰:工频(50/60 Hz)混叠及其谐波 → 规律性细毛刺,频域特征显著;全导联同时出现是"环境性"干扰的指纹,与单导联接触问题相区分。
- 运动伪影:低频大幅基线漂移叠加肌电 → 波形在数秒尺度整体起伏、QRS 淹没其中;时域幅度包络与频域低频能量占比是其主特征。
四类画像的实用价值在于反向校验 SQI 模型的错误模式:一个只在"外部电干扰"上掉分的模型与一个只在"电极错位"上掉分的模型,改进方向完全不同——而本数据集的 8,327 评分不区分问题类型,这类归因需要研究者自行构造子实验(§10 坑 8 之外的常见设计缺口)。
2.9 规格速查:与"诊断级"声明的逐项对账
"诊断级"不是形容词而是清单——对照标准临床 ECG 的技术要求逐项过账:
| 技术项 | 本集取值 | 常规诊断级要求 | 结论 |
|---|---|---|---|
| 导联数 | 12(I/II/III/aVR/aVL/aVF/V1-V6) | 12 | 达标 |
| 带宽 | 0.05-100 Hz | 0.05-100(或更宽)Hz | 达标 |
| 采样率 | 500 Hz | ≥500 Hz | 达标 |
| 量化 | 16-bit | ≥12 bit 常见 | 达标 |
| 时长 | ≥10 秒 | ≥10 秒惯例 | 达标 |
| 同步性 | 12 通道同步 | 要求同步 | 达标 |
| 增益/校准 | .hea 头字段承载 | 要求 | 达标(WFDB 头) |
对账结论:规格层面无短板——SQI 任务因此聚焦在"采集过程引入的质量问题",而不是"设备先天不足",这正是任务定义想要的干净性(§2.8 的四类问题全部属于过程性问题)。
2.10 数据引用的最小规范
引用本集时,三行规范保平安:① 版本写死 v1.0.0(15 年恒定,见 §6.7);② 规模用双注式 2000/1500(坑 6);③ 标注口径声明挑战期或专刊(坑 5)。三行之外的许可义务只有一条:ODC-BY 1.0 的署名。
§3 标注体系:8,327 个评分如何变成金标准
3.1 众包+专家混合的标注者池
标注者由两部分构成:面向公众的开放标注通道(ECG grading 于 2011-03-07 开放,US$2000 奖池按标注贡献分配)与受邀的专业标注者。标注者需自评经验水平;官方文档称标注者群体"在心电判读经验上跨度很大"——这与"外行采集"的任务定位呼应:质量判断(这段波形能不能读)刻意设计成比诊断判断(这段波形说明什么)更低门槛、更可众包的任务。每条 ECG 最终获得 3-18 名标注者的独立盲评。
奖池的分配机制值得一读:US$2000 按"标注贡献"分配而非中彩式抽奖——多标多得,这把激励直接钉在标注量上;而 3-18 人/条的冗余设计则把质量钉在聚合规则上(§3.3)。量与质分别用两套机制兜底,避免"为了奖金刷量"单点失效。开放通道与受邀专家并存还有一层设计意图:两类标注者的分数混合平均,使金标准既不脱离专业底线,又保留"外行眼中可读性"的语义——后者才是任务的真实应用语境。
3.2 字母等级的量化:A 到 F 五档
| 等级 | 数值 | 语义 |
|---|---|---|
| A | 0.95 | 诊断质量优秀 |
| B | 0.85 | 有瑕疵但不碍诊断 |
| C | 0.75 | 明显噪声/瑕疵,勉强可用 |
| D | 0.60 | 质量差,多数导联不可读 |
| F | 0 | 不可用于诊断 |
字母制(而非 0-10 数字制)的选择明显面向非专业标注者:医生一眼能给熟悉的 ABCDF,学习成本近零。数值锚点(0.95/0.85/0.75/0.60/0)把字母映到可平均的量表上。
档位间的非线性间距值得注意:A-B-C-D 依次只降 0.10/0.10/0.15,而 D-F 一步坠 0.60——数值设计在暗示"可读"与"不可读"之间没有渐进地带。这与三分组阈值 0.70 的位置(D 0.60 在线下、C 0.75 在线上)自洽:0.70 恰好落在 D 与 C 之间的鸿沟里,使得"均值掉下 0.70"天然等价于"众包共识认为不可读"。
3.3 三分组规则:金标准的判决逻辑
对每条记录,先算其全部评分的均值,再叠加一个"F 计数"约束:
- Group 1 可接受:均值 ≥0.70 且至多 1 个 F(约 70% 的记录)。"至多 1 个 F"防止一个孤立低分被多数高分稀释——哪怕 17 个人说好,只要有两个人说 F 就进不了 Group 1。
- Group 2 不确定:均值 ≥0.70 但有 ≥2 个 F(官方页口径约 <1%)。这类"多数说好、少数说死刑"的记录被刻意隔离出评估池——挑战评分时 Group 2 剔除不计。
- Group 3 不可接受:均值 <0.70(约 30%)。
这套"均值+否决票"的复合规则是本数据集方法论上最有传承价值的部分:它把众包标注里"多数暴政"与"孤立恶意/失误"两类噪声同时挡在门外。后续众包医学标注研究(含 MIMIC-CXR 类影像报告标注设计)讨论评分聚合时常引此为原型之一。
演算示例(规则示意,非真实记录):设某条记录获 8 个评分——A、B、B、C、B、A、F、B。
- 均值 = (0.95+0.85+0.85+0.75+0.85+0.95+0+0.85)/8 = 6.05/8 ≈ 0.756 ≥ 0.70,均值关通过;
- F 计数 = 1 ≤ 1,否决关通过 → Group 1 可接受。
- 若把其中一个 B 换成 F:均值 = 5.20/8 = 0.65 < 0.70 → Group 3 不可接受(均值关先卡住)。
- 若把两个 B 都换成 F:均值 = 4.35/8 ≈ 0.544 < 0.70,仍走 Group 3;要让记录落到 Group 2,需要"均值 ≥0.70 且 ≥2 个 F"的组合(例如 10 人评分、8 高分+2 F 的特定分布)——这正是它稀少(挑战期口径 <1%)的算术原因。
3.4 双口径警报:Group 2 到底是 <1% 还是 13.4%?
这是本条目最重要的双口径存照(坑 5):
- 口径一(挑战期官方页):Group 1 约 70%、Group 3 约 30%、Group 2 不足 1%。按 2000 条算,G2 <20 条。
- 口径二(2012 年 IOP 专刊导言,最终金标准):1,733 条判定 acceptable/unacceptable,267 条 indeterminate。按 2000 条算 13.35%。
两者相差一个数量级,直接原因是大规则不同:挑战期口径的 G2 定义是"均值 ≥0.70 但 ≥2 个 F"这一极窄切片;而专刊口径的 indeterminate 是最终金标准阶段重审后的宽判定(含评分人数不足、分歧过大无法裁决等情形)。两轮标注、两套裁决逻辑,产物自然不同。
3.5 口径选择决策表
| 你的用途 | 用哪套口径 | 理由 |
|---|---|---|
| 复现 2011 排行榜、对齐历史分数 | 挑战期三分组(G2 剔除) | 排行榜 accuracy 的分母就是挑战期可裁决样本;口径换掉数字全错 |
| SQI 方法学研究、标注聚合设计 | 专刊 1,733+267 账本 | 最终金标准更完整,indeterminate 的宽判定信息量大 |
| 训练 SQI 模型(工程用途) | 建议:G1/G3 训练,G2 类样本剔除或单列 | "不确定"样本进训练集会模糊决策边界;至少要做剔除/保留的消融 |
| 写综述引用占比 | 双口径并列引用 | 单引任何一个都会被另一路的文献"打脸";这是坑 5 的全部教训 |
3.6 标注质量自证与局限
官方页宣称评分"reflecting a high degree of agreement among the annotators"(标注者间高度一致),但未公布逐条的一致性统计量(无 kappa 分布、无逐标注者画像)。局限清单:① 一致性宣称缺乏可复核的统计支撑;② 标注者经验水平自评、未做资格盲测;③ 8,327 评分在 2000 条上的分布不均(3-18 人/条),低评分密度记录的均值估计方差更大;④ 字母数值锚点(0.95 等)的选择本身无消融实验背书。这四点在其时其地可谅解,但 2020 年代复用者应知晓。
把局限翻译成实操建议:复用标签时,把"3-18 人均值"当作带方差的软标签而非确定值——低冗余记录(3-4 人)的组别归属天然更脆;做模型评测时,报告一组"以 ±0.05 均值扰动重算分组"的敏感度区间,是低成本提升结论稳健性的做法。这些现代补丁不改变金标准的历史地位,只是让它更经得起 2020 年代的审问。
3.7 标注管线的现代复刻蓝图
把 §3 全节压缩成一张可执行蓝图,供设计自己的众包标注管线时逐项打勾:
- 任务降维:标注问题必须是标注者能力圈内的问题(可读性≠诊断)。
- 量表设计:低学习成本的锚定量表(字母制五档),档距有意不均(F 一步坠 0.60)以表达"可读/不可读"的鸿沟。
- 冗余度:每条 3-18 人;预算不足时优先保最低 3 人的下限,而不是缩短量表。
- 聚合规则先于数据:均值+否决票式的复合规则在标注开始前写死并公布。
- 不确定区显式化:给"撕裂样本"一个正式出口(G2),不要强行二值化。
- 激励与规则相容:按贡献付酬;刷量行为在聚合规则下无利可图。
- 两轮口径要声明:一旦赛期口径与最终口径不同,两套数字都要保留出处(坑 5 的教训)。
- 一致性统计事后公开:这是 2011 届没做而今天必须做的(§3.6)。
3.8 标注者分歧的三个来源与本届的消解方式
众包评分的分歧不止"噪声"一种,至少三个来源、各有消解路径:① 感知分歧(同一波形,有人看到毛刺有人没注意)→ 冗余平均消解;② 标准分歧(对"勉强可用"的阈值理解不一)→ 字母锚点+档距设计部分消解,残余进 Group 2 式不确定区;③ 策略分歧(刷量/敷衍/恶意低分)→ 否决票与"均值稀释"双向过滤。识别这三个来源后再看 8,327 个评分,就能理解为什么官方敢宣称高度一致而又不必公布 kappa——大部分分歧确实被结构性规则吸收了,但这不等于可以免检(§3.6 局限清单的第①条仍然成立)。
§4 挑战赛设计:三个 Event 的赛制解剖
4.1 任务定义:只判质量,不做诊断
官方任务陈述:开发能在手机(Android)内近实时运行的算法,在非专业人员采集诊断级 ECG 的过程中给出秒级质量反馈。最低要求:患者还在场时,几秒内判断"质量够格/需要重录";理想目标:识别电极错位、皮肤-电极接触不良、外部电干扰、运动伪影四类问题,并补偿其影响或指导采集者纠正。注意任务边界的克制——不做任何节律或形态学诊断,只回答"这段波形够不够格被诊断"。这个聚焦让问题天然适合二分类建模,也让众包标注成为可能。
把任务写成工程契约更清楚:
- 输入:一段 12 导联同步 ECG(最短 10 秒、500 Hz、16-bit),来源为非专业人员现场采集;
- 输出:acceptable / unacceptable 二分类判决(理想情况下附四类问题识别与纠正指导);
- 算力约束:在 2011 年量级的 Android 参考手机内近实时完成——不是"能算出来就行",而是"病人还在电极上时算出来";
- 指标:accuracy(可裁决样本上),Event 3 叠加运行时间项。
这个契约的高明处在于把"质量评估"从研究问题降格为工程问题:不要求理解波形内容,只要求守住可读性底线。降维之后,经典信号处理+浅层分类器就足以站上排行榜——事实也确实如此(§5.5)。
4.2 三个 Event:同一任务的三种考验
| 赛道 | 开源要求 | 测试数据 | 指标 | 提交规则 |
|---|---|---|---|---|
| Event 1 | 闭源或开源皆可 | Set B(500 条,公开) | accuracy | 至多 5 次提交取最高 |
| Event 2 | 必须开源(Java,官方模板 API+Android 模拟器开发) | Set B(500 条,公开) | accuracy(主办方在参考 Android 手机实测) | 单次最终提交 |
| Event 3 | 同 Event 2 代码 | Set C(500 条,隐藏) | accuracy × 运行时间函数(越快越高) | 与 Event 2 同次提交自动参赛 |
三个赛道是三根不同的探针:Event 1 测方法上限(不设工程约束,闭源亦可,看 accuracy 天花板);Event 2 测可部署性(代码必须真在一台 Android 参考机上跑起来,开源使冠军方法可被社区继承);Event 3 测工程效率(在隐藏数据上把 accuracy 与运行时间乘起来——一个又准又快的算法才有意义,"离线屠榜、上线拉胯"的方案在此现形)。
4.3 评分细则:漏答=错答,Group 2 出局
- 输出是 Set B/C 逐条的二分类(acceptable/unacceptable)。不要求每条都给答案,但只有答对的得分——漏答与答错同价,防止"少答少错"的投机策略。
- Group 2 剔除不计:挑战期口径下的不确定组不参与任何赛道的评分。这使 leaderboard 上的 accuracy 是"在可裁决样本上的 accuracy",与"全集 accuracy"不可直接比较——复现者若把 267 条 indeterminate(专刊口径)放回评估池,数字必然对不上文献。
- Event 3 的速度项:accuracy × 运行时间函数,官方未在摘要页公布函数形状;论文口径的参考量纲是"参考手机上平均执行 <2 秒"。这个设计把 SQI 研究从"敢不敢用大模型"的军备竞赛拉回"嵌入式预算内能做多好"的正轨。
"漏答=错答"还有一层隐含的统计含义:它把"模型对自己的不确定性"外化为提交策略——参赛者要么对每条都硬着头皮给答案,要么主动承认部分样本超出能力圈、接受漏答损耗。2011 年没有校准(calibration)这个词的流行语境,但这条规则事实上在逼参赛者做决策阈值的选择,与今天的"代价敏感决策"一脉相通。
4.4 奖金与众包激励的双轨设计
GSMA(全球移动通信系统协会,219 国近 800 家运营商的行业协会)与 CinC 捐助提供奖金:三个 Event 的最优团队各 US$2000(每人/队至多领取一项);另有 US$2000 专项奖池分给数据标注贡献者(与 §3.1 的 ECG grading 通道对应)。用奖金同时激励"解题者"与"造标者",这在 2011 年的挑战赛生态里是少见的闭环设计——没有后者就没有 8,327 个评分。
"每人/队至多领取一项"的小字规则也值得注意:它防止同一强队横扫三赛道奖金,把获奖机会向参与面扩散。以 Xiaopeng Zhao 的实际战绩(Event 1/2 双冠),若无限领规则他可双奖入袋;规则之下奖金流向了更多队伍。赛制的公平性设计不只体现在数据划分上,也藏在这类分配细则里。
4.5 时间线:从公告到杭州颁奖
| 时点 | 事件 |
|---|---|
| 2011-02-16 | sim/ 合成试点数据发布(教具先行) |
| 2011-02-25 | 挑战启动公告(“Improving ECGs collected using mobile phones”) |
| 2011-03-07 | ECG grading 众包标注通道开放(US$2000 奖池) |
| 2011-04-19 | 数据集页 Published(v1.0.0,至今唯一版本);Set B 就位 |
| 2011-04-22 | Event 1 开放提交;2011-04-30(noon GMT)preliminary entry 资格线 |
| 2011-05-01 | CinC 会议摘要截止 |
| 2011-08-05(noon GMT) | 最终提交截止,随后公布最终成绩 |
| 2011-09-18/21 | CinC 2011 年会(中国杭州,浙江大学承办);挑战报告 9 月 20 日、颁奖 9 月 21 日闭幕全会 |
| 2012-02-25 | sim/RECORDS 更新 |
| 2012-09 | Physiological Measurement 33(9) 信号质量专刊(挑战成果的期刊化终点) |
时间线里有一条容易被忽略的暗线:标注通道(03-07)先于正式数据发布(04-19)一个多月开放。这说明众包标注不是赛后补救,而是与比赛并行的主线程——Set A 的预分类清单、以及累积至 8,327 的评分池,都是在比赛进行中滚雪球滚出来的。"数据先行、标注并行、赛果期刊化"三段式,是本届时序管理最值得复刻的部分。
4.6 官方 API 与 Android 工程约束
数据集目录里的 api/ 子目录承载着 Event 2/3 的工程底座:官方 Java 模板 API 与开发约定。要点:
- 语言与运行时:Java——2011 年 Android 开发的事实母语。官方给模板而非空白画布,是为了把参赛者的精力从"搭 Android 工程"解放到"写质量算法"上;
- 输入约定:模板以 CSV(.txt)格式读取 12 导联样本(§2.2 存储双格式里给 Android 的那一轨);
- 开发-测试链:参赛者先在官方 Android 模拟器里开发自测,正式提交后由主办方在参考 Android 手机上实测——模拟器测逻辑,真机测时延,两道关卡对应 Event 2/3 的不同关切;
- 对今日读者的意义:api/ 是"端侧 ML 工程"在 2011 年的样子。对照今天 Android NNAPI/TFLite 的端侧推理栈,能直观看到十五年间"在手机里跑医学算法"这件事的工程化程度变化——而任务本质(秒级、低算力、现场反馈)一点没变。
4.7 Event 1 深读:方法上限的测量仪
Event 1 的设计哲学是先看天花板:去掉一切工程与开源约束,闭源可参赛、提交可迭代(至多 5 次取最高),只问一个问题——给足够自由,accuracy 能到多少?答案很快收敛:前十名挤在 0.896-0.932 的 3.6 个百分点带内(§5.2),说明任务的"容易部分"在无约束条件下被充分吃干,剩余误差集中在金标准边界样本上。
5 次提交规则是一个小而精的机制:它允许参赛者用前几次提交试探金标准的脾气(比如试探 G2 边界附近的样本怎么判),又用"取最高"保护最终成绩。现代复现没有提交次数限制,但要警惕由此产生的方法论退化——在 Set B 上反复调参等于把测试集当验证集用;正规做法是从 Set A 内部切出验证子集(A 自带参考评估清单,具备条件),把 Set B 留作一次性终测。
4.8 Event 2 深读:可部署性的照妖镜
Event 2 把三道门槛一次立起来:代码必须开源(Java)、必须用官方模板 API 开发、必须真机实测。三道门槛各自过滤一类"纸面方法":开源过滤不愿公开者,模板过滤接口不兼容者,真机过滤模拟器里快、真机上慢的幻觉方法。对照 Event 1 同一套 Set B 的成绩(§5.3),可部署的代价被精确量化:
- Zhao 从 0.932(离线)到 0.914(实机)只掉 1.8 个百分点——顶级方法的工程损耗可以极小;
- Hayn 从 0.916 掉到 0.834——因为他把优化资源押向速度项(其 Event 3 夺冠策略),精度为时延让路;
- 主办方成员自测的非官方成绩(George Moody 0.894、Ikaro Silva 0.802)提供了"内部基线"参照:官方班底的方法在实机上也不过 0.8-0.9 一带,反证任务对专家同样有残余难度。
4.9 Event 3 深读:把预算写进评分
Event 3 是三探针里最具前瞻性的一根:同一份 Event 2 代码,改测从未公开的 Set C,得分 = accuracy × 运行时间函数。它的两个设计支点:
- 隐藏集:Set C 从未发布,任何在 B 上过拟合的方法在 C 上现形。这让 Event 3 的 0.873 成为三赛道里"泛化含金量"最高的数字;
- 速度项:运行时间直接进评分函数(越快越高)。官方未公布函数形状,但从结果反推(§5.4):Hayn 夺冠、Zhao 仅列第三,说明速度项的权重足以让"更准但更慢"翻车。
这条设计在 2011 年解决的是 Android 手机的算力焦虑,在 2026 年读来丝毫不显过时:今天的端侧推理、实时流处理、成本敏感的 API 调用,本质都是"accuracy × 预算"的变体——预算从毫秒变成了美元或焦耳。任何要设计算法竞赛的人,Event 3 都是现成的母版(§8.3)。
4.10 参赛工程 checklist(从官方规则反推)
把三个 Event 的规则合成为一张提交前自检表——2011 年的参赛者按它走查,今天复刻赛制的人按它设计:
- 输出是否覆盖全部待判记录?(漏答=错答,§4.3)
- 是否对"不确定"样本有显式策略?(G2 剔除不计,但你的模型仍会在 Set B 上遇到 G2 型样本)
- Event 2 代码是否为 Java+官方模板?(语言与接口硬约束,§4.6)
- 在模拟器之外上过真机吗?(Event 2/3 实测在参考 Android 手机上)
- 10 秒 12 导联的端到端时延是多少?(Event 3 速度项直接计价)
- 提交次数预算怎么分配?(Event 1 至多 5 次、取最高,§4.7)
- 是否在 Set B 之外做了泛化自查?(Event 3 的隐藏集会替你检查)
4.11 三探针矩阵的现代变体
| Event 探针 | 2011 年的形态 | 2026 年的对应物 |
|---|---|---|
| 方法上限(Event 1) | 闭源离线跑 Set B | 云端大模型刷榜(无部署约束的 leaderboard) |
| 可部署性(Event 2) | 开源 Java+参考 Android 真机 | 端侧推理榜:模型体积/量化/加速器适配 |
| 工程效率(Event 3) | accuracy×运行时间(隐藏集) | 实时流榜:accuracy×时延;API 榜:accuracy×美元/千次调用 |
矩阵没有过时,只是"预算"的计量单位从毫秒变成了焦耳与美元——这正是 §8.3 把它称为"母版"的原因。
§5 结果与冠军:49 支队伍的排行榜解剖
5.1 参与规模
49 支队伍/个人(官方页 top-ten 标注 “of 49”+总结论文摘要 “49 teams and individuals” 三源一致)。这个数字在 PhysioNet 挑战赛年史里属中上热度;更重要的参与度指标是开源赛道(Event 2/3)的参赛者规模——它决定冠军方法能否沉淀为社区公共品。
把 49 放进年链坐标:2011 年的 PhysioNet 挑战赛尚未进入 2015 年后的数百队规模,49 是"早期生态"量级——参与者多为学术圈与 PhysioNet 社区熟人(§5.6)。但正因 Event 2 强制开源,这一届的社区沉淀率(可被后来者直接继承的代码比例)反而在年链里位居前列:开源赛道的每一行提交代码都进了公共仓库。
5.2 Event 1 排行榜(accuracy,公开数据 B,闭源可参赛)
| 名次 | 参赛者 | 得分 |
|---|---|---|
| 1 | Xiaopeng Zhao | 0.932 |
| 2 | Gari Clifford | 0.926 |
| 3 | CT Ho | 0.920 |
| 4 | Dieter Hayn | 0.916 |
| 5 | Gabriel Garcia | 0.912 |
| 6 | Nir Kalkstein | 0.912 |
| 7 | Irena Jekova | 0.908 |
| 8 | Sebastian Zaunseder | 0.904 |
| 9 | Kai Noponen | 0.900 |
| 10 | Benjamin Moody | 0.896 |
前 10 名全部挤在 0.896-0.932 的 3.6 个百分点内——任务的"容易答对"部分很快被吃干,剩余误差集中在金标准本身的边界模糊样本上(这是 SQI 任务的典型形状)。名单里 Gari Clifford、Benjamin Moody 等 PhysioNet 核心圈人物下场参赛,也侧面说明任务对专家而言仍有残余难度。
逐档看这条分数带的形状:第 1 名与第 2 名差 0.006(约 3 条记录),第 2-10 名之间每档只差 0.002-0.008——在 500 条的测试集上,相邻名次的分差普遍不足 5 条记录。这意味着 Event 1 的名次表应读作"方法代差很小的顶级行"而非"逐名有本质差异";对复现者,合理的对标目标是"进入 0.896-0.932 带",而不是"复算出某个具体名次的分数"。
5.3 Event 2 排行榜(开源 Java,参考 Android 实测)
| 名次 | 参赛者 | 得分 |
|---|---|---|
| 1 | Xiaopeng Zhao | 0.914 |
| 2 | Benjamin Moody | 0.896 |
| 3 | Lars Johannesen | 0.880 |
| 4 | Philip Langley | 0.868 |
| 5 | Dieter Hayn | 0.834 |
| 6 | Václav Chudáček | 0.833 |
官方页另列非官方成绩:George Moody 0.894、Ikaro Silva 0.802(主办方自测性质)。Zhao 从 0.932 到 0.914 只掉 1.8 个百分点——说明其方法从"离线最优"到"手机实机"的工程损耗极小;而 Hayn 从 0.916 掉到 0.834,恰恰是因为他把资源押注在 Event 3 的速度项上。
这张榜最值得注意的结构是开源赛道的人数塌缩:Event 1 前十有十人,Event 2 榜上仅 6 人。开源+Java 模板+真机实测的三重门槛把参与者筛掉一多半——这正是"方法上限"与"可部署方法"之间的现实落差,也是 Event 2 存在的意义:让社区看清这个落差有多大(本届答案:约 2-8 个百分点,因人而异)。
5.4 Event 3 排行榜(隐藏数据 C,accuracy×速度)
| 名次 | 参赛者 | 得分 |
|---|---|---|
| 1 | Dieter Hayn | 0.873 |
| 2 | Václav Chudáček | 0.872 |
| 3 | Xiaopeng Zhao | 0.845 |
| 4 | Philip Langley | 0.814 |
| 5 | Benjamin Moody | 0.802 |
| 6 | Lars Johannesen | 0.791 |
非官方:Ikaro Silva 0.830、George Moody 0.817。Hayn 与 Chudáček 之间 0.001 的差距是整届挑战赛最戏剧性的瞬间;Zhao 在此仅列第三,说明其 Event 1/2 冠军方法在"每毫秒都要计价"的赛道上并非最优。论文口径:Event 3 提交在参考手机上平均执行 <2 秒——2011 年的 Android 手机做到了 12 导联×10 秒×秒级判决,这正是"质量门卫住在采集端"这一愿景的可行性证明。
把三个 Event 的名次表叠起来看会得到一张"策略矩阵":Zhao(1/1/3)是精度优先型,Hayn(4/5/1)是速度优先型,Moody(10/2/5)与 Johannesen(-/3/6)是均衡型——同一份数据、同一套规则,不同优化目标产生了不同的最优解。这是三探针赛制最有说服力的实证:没有全能冠军,只有赛道匹配的策略。
5.5 方法主题概览与结果解读的三条边界
冠军方法的共同骨架(据挑战报告与专刊论文综合):经典信号处理特征(QRS 检出率、导联间相关性、基线漂移幅度、饱和/平坦段检测)+ 浅层分类器(SVM/决策树类),无人使用深度网络(2011 年时点使然)。读这份排行榜需带三条边界:① 分数是"可裁决样本上的 accuracy",Group 2 已剔除(§4.3);② Event 1 允许闭源,前 10 名方法多数未开源,社区能继承的只有 Event 2/3 的代码;③ 测试集仅 500 条,0.001 量级的名次差在统计上不可过度解读(Hayn vs Chudáček 之差约合半条记录)。
补一句给深度学习时代的读者:这套"经典特征+浅层分类器"骨架在 2011 年是算力约束下的必然,但它并未被时代淘汰——后续多篇 SQI 文献复验过"手工特征在这类 10 秒短片段上与早期深度模型打平"的结论。用本数据集做教学或基线时,从 QRS 检出率+导联相关性起步仍然是最快能进 0.8+ 分数带的路。
5.6 参赛者群像与生态观察
从三张榜的名字构成能读出 2011 年这个生态的几个侧影:
- PhysioNet 核心圈下场参赛:Gari Clifford(2 名)、Benjamin Moody(Event 1 第 10/Event 2 第 2/Event 3 第 5)、主办方成员 George Moody 与 Ikaro Silva 以"非官方"身份提交自测成绩——组织者与参赛者的边界在本届还是"熟人圈"式的松散,这与后来大规模匿名线上赛的组织形态截然不同;
- 国际构成广泛:从中文姓名(Xiaopeng Zhao、CT Ho)到捷克(Chudáček)、德语区(Hayn、Zaunseder)、北欧(Noponen)、以色列(Kalkstein)、保加利亚(Jekova)——一个移动健康议题在 2011 年就撬动了跨大洲的参与;
- 少数多届常客:Clifford、Hayn、Johannesen 等名字在其后数届挑战赛的榜单上反复出现,可见 2011 年前后的 PhysioNet 挑战赛已经形成一个小而稳定的"巡回参赛者"群体。
5.7 历史坐标:成绩放在年链里怎么看
三个冠军数字(0.932/0.914/0.873)的历史分量,要放在年链演化里才看得清:2011 届之后,挑战赛任务迅速复杂化——2012 届转向 ICU 死亡率预测(表格数据),2013 届转向胎儿 ECG(更难的信号),2015 届转向 ICU 假警报(多参数)。越往后,"0.9+ accuracy"越罕见,因为任务从"单模态二分类"逐步走向"多模态多分类+临床结局"。从这个意义上说,2011 届的 0.932 是年链里"任务设定最干净"时期的成绩——它衡量的是一段 10 秒波形可不可读,没有混杂任何下游临床语义。后来者引用 0.932 时应注意:这是 SQI 二分类的分数,不能与后续届次任何任务的分数直接排序。
5.8 结果复用的三个正确姿势
- 对标分数带而非名次:Event 1 前 10 挤在 0.896-0.932,引用时写"对齐 0.89-0.93 带"比"复现第 N 名"更诚实(§5.2 逐档注解)。
- 三榜连读:单榜分数没有策略语义,三榜叠读才能定位你的方法属于精度型/速度型/均衡型(§5.4 策略矩阵)。
- 记住分母口径:所有 accuracy 都是可裁决样本(G2 剔除)上的数字;任何"全集 accuracy"的换算都要自己声明假设(§4.3/坑 5)。
5.9 三张榜各一句话
- Event 1 榜:任务的天花板在哪里——0.93 附近,而且很挤。
- Event 2 榜:把天花板搬到手机上要付多少税——最好的情况下只付 1.8 个点(Zhao 0.932→0.914)。
- Event 3 榜:又准又快谁最强——不一定是准的那个(Zhao 第三、Hayn 第一)。
§6 获取与许可:全开放的三条路
6.1 四种获取途径(无需注册,无需签协议)
# 途径 1:ZIP 全量一键下载(169.7 MB)
# 浏览器直开 https://physionet.org/files/challenge-2011/1.0.0/ 页面右上角 Download zip
# 途径 2:wget 递归镜像(含断点续传)
wget -r -N -c -np https://physionet.org/files/challenge-2011/1.0.0/
# 途径 3:AWS 开放数据镜像(推荐批量用户,免签名)
aws s3 sync --no-sign-request s3://physionet-open/challenge-2011/1.0.0/ DESTINATION
# 途径 4:存档 rsync(archive.physionet.org,challenge-2011 module)
rsync -avz archive.physionet.org::challenge-2011/1.0.0/ DESTINATION
Access Policy 官方口径:Anyone can access。数据文件 license 为 ODC-BY 1.0(Open Data Commons Attribution License v1.0)——署名即可自由使用、分发、商用;这比库内多数医学影像条目的 NC(非商业)限制宽松整整一档,是 SQI 教学与工业评测都能放心引用的根本原因。papers/ 目录 17+1 篇论文单独按 CC BY 3.0 发布。
四条途径的选择指南:
- 途径 1(ZIP):适合一次性、Windows/无命令行环境。优点是浏览器点一下即得全量;缺点是无法增量更新、断点续传依赖浏览器行为。
- 途径 2(wget):适合 Linux/macOS 常规用户。
-r -N -c -np四件套分别管递归、时间戳增量、断点续传、不外逸父目录——是四条路里"参数最自解释"的一条。 - 途径 3(AWS S3):适合批量用户与云上管线。
--no-sign-request免 AWS 账号,带宽稳定,可直接在 EC2/SageMaker 内同步到实例盘——四条路里唯一不消耗本地带宽的。 - 途径 4(rsync 存档):适合需要与 PhysioNet 存档保持镜像一致性的长期归档场景,可反复增量同步。
- 共同提醒:四条路拿到的都是 v1.0.0 同一内容;URL 一律用 files/challenge-2011/1.0.0/ 文件直链或 content/challenge-2011/1.0.0/ 页面,绕开 /challenge/2011/ 的重定向(坑 7)。
6.2 文件清单与目录结构
| 文件/目录 | 大小 | 内容 |
|---|---|---|
| set-a.tar.gz | 102.9 MB | Set A 1000 条(2011-07-20 打包) |
| set-b.tar.gz | 51.2 MB | Set B 500 条(2011-04-20 打包) |
| sim.tar.gz | 5.7 MB | 合成 ECG 试点数据(2011-02-16) |
| top-ten.txt | 100 B | 三 Event 前 10 名成绩单 |
| gsma.jpg | 59.9 KB | GSMA 赞助标识 |
| set-a/ set-b/ | — | 解包后的逐记录目录(.txt+.hea+.dat 三格式) |
| api/ | — | 挑战官方 Android API 与 Java 模板 |
| papers/ | — | 挑战相关论文 17+1 篇(CC BY 3.0) |
| sources/ | — | 数据来源说明 |
三处易被略过的目录补注:api/ 是 Event 2/3 参赛与端侧复现的工程入口(§4.6);papers/ 里的 17+1 篇是"挑战论文包"——17 篇挑战参与者论文加 1 篇总结论文,全部 CC BY 3.0,是仅次于官方页的第二事实源群;sources/ 是数据来源说明,坑 2 的"常规 ECG 机采集"证词即在此。另有存档侧的 Test Sets 页(archive.physionet.org/physiobank/database/challenge/2011/)以 DOI 10.13026/C26P4C 独立存档——引用存档版用此 DOI,引用现役版用 physionet.org/content/challenge-2011/1.0.0/。
6.3 格式与工具链:WFDB 生态的一等公民
WFDB(Waveform Database)格式是 PhysioNet 的母语:.hea 头文件声明导联数、采样率、增益与元数据,.dat 存紧凑二进制样本。配套工具链全开放:wfdb Python 包与 MATLAB 版可读写;PhysioBank ATM 在线工具无需装任何软件即可把任意记录转为 text/Matlab/EDF 或直接画图;lightwfdb/wfdb-io 等社区移植覆盖 Rust/Java。CSV 侧(.txt)逐样本逗号分隔、首列时间戳,pandas 一行读入。对 AI 管线而言,这是"下载即训练"级别的友好度:无 DICOM 之类的重协议、无申请审批、无格式逆工程。
一条 10 分钟跑通路线(从零到第一段波形):
# 1. 取数据(AWS 路,约数分钟)
aws s3 sync --no-sign-request s3://physionet-open/challenge-2011/1.0.0/ ./challenge-2011
# 2. 解包 Set A 并做完整性自检
tar xzf challenge-2011/set-a.tar.gz
wc -l set-a/RECORDS # 应为 1000
# 3. 读第一条记录并目检
import wfdb
rec = wfdb.rdrecord("set-a/" + open("set-a/RECORDS").readline().strip(),
sampto=2500) # 前 5 秒
print(rec.p_signal.shape, rec.fs) # (2500, 12) 500
wfdb.plot_items(signal=rec.p_signal[:, [0, 1]], fs=rec.fs) # 先看 I、II 导联
第 2 步的 wc -l 是四两拨千斤的校验:RECORDS 行数与规模表(set-a 1000/set-b 500)不符,说明 tar 解包不完整或下载中断,后续一切都会在"找不到某条记录"处莫名失败(§6.6)。
6.4 AI-Ready 评估:DAIMS 速览
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | PhysioNet 站内+Google 学界双通道高索引;"challenge-2011"URL 语义直白;但与后继各届共用"CinC Challenge"名,检索时需带年份 |
| A 可获取性 | 9 | 无注册/无协议/无审批,ZIP+wget+AWS+rsync 四路直下;扣 1 分:Set C 永久隐藏,全集 2000 不可复得 |
| I 可互操作 | 8 | WFDB 母语格式+CSV 双轨,ATM/Python/MATLAB 工具链成熟;无官方 ML 就绪打包(如 Parquet/HF)需自行转换 |
| M 元数据质量 | 7 | 官方页文档详尽+RECORDS 清单+头文件年龄/性别;扣分:无逐记录采集设备/采集者画像,标注一致性无统计支撑 |
| S 可持续性 | 8 | PhysioNet/MIT LCP 长期托管+AWS 开放镜像+独立 DOI 存档,15 年版本恒定 v1.0.0;sim/RECORDS 曾有一次更新,维护活跃 |
| 综合评级 | 8.0/10(优) | 可获取性与可持续性接近满分;失分集中在"ML 原生包装缺失"与"元数据深度",均为时代产物而非缺陷(附录 B 全表) |
在库内可获取性光谱上,cinc-2011 位于"完全开放直链"一端(与 MIMIC 系开放层同级),显著开放于请求制条目;其 ODC-BY 1.0 是库内最宽松的数据许可之一。
6.5 复用实操守则四条
- 先定标注口径(§3.4):排行榜对齐用挑战期三分组,方法学研究用专刊 1,733+267 账本,全文一致。
- Set C 不可得:任何声称"在 2000 条全集上训练"的复现都是不实陈述;可用 A 训练+B 测试模拟原赛制,C 只存在于历史成绩单里。
- sim/ 不入池:合成教具与真实数据严格分池(坑 8)。
- 头文件元数据仅两项:年龄性别之外的一切患者信息需从其他库补齐或放弃——做人群亚组分析前先确认这个硬边界。
四条守则的共同底层是同一原则:引用前先声明你用的是哪一版现实——哪套标注口径、哪个记录子集、哪个数据池。本数据集的所有"数字对不上"类纠纷(§10 坑 5/坑 6/坑 8),根源都是复用者混用了不同版本的现实而未声明。
6.6 下载与完整性排查清单
自检项按"出问题概率 × 排查成本"排序:
- RECORDS 行数(成本最低,先做):set-a 应 1000 行、set-b 应 500 行;不符即重新解包或重下(§6.3)。
- URL 重定向:/challenge/2011/ 会 302 到 /content/challenge-2011/1.0.0/,脚本直连时用后者(坑 7)。
- 抓取器空响应:physionet.org 对部分抓取器返回空内容,curl 需带浏览器 User-Agent,或直接走 AWS/rsync 镜像绕开网页层。
- 逐记录三件套抽查:随机抽几条记录确认 .txt/.hea/.dat 同名共存且 .txt 行数 ≥500(10 秒×500 Hz);.dat 损坏时 wfdb 读会抛错,行数抽查能提前暴露截断文件。
- Set C 陷阱:任何下载清单里出现 set-c 或"2000 条全量"字样的第三方资源,直接按坑 6 存疑。
6.7 版本恒定 15 年:一件被低估的好事
v1.0.0 自 2011-04-19 发布至今没有第二版(唯一内容更新是 2012-02-25 的 sim/RECORDS)。这在数据集工程里是一件被低估的好事:跨文献可比性。十五年间任何一篇 SQI 论文说的"challenge-2011"都是同一批字节,基线数字可以直接横比——相比之下,反复 minor-version 迭代的数据集常让"你在用哪一版"成为复现第一坑。代价是文档不随时代升级(无 ML 原生打包、无新式字段),但物理存档+AWS 镜像+DOI 三层冗余让"旧而稳"的优势完整落地。复用建议:把"版本恒定"当作本集的隐含特性写进实验记录——声明 challenge-2011 v1.0.0 即等于锁定了全部数据内容。
6.8 PhysioBank ATM 五步在线流程
不想装任何工具时的零依赖路线:① 打开 PhysioBank ATM 页面(physionet.org 站内从任一记录页可达);② 输入记录名(RECORDS 中的任意一行);③ 选时间窗(默认整条 10 秒);④ 选输出(画图直看 / text / Matlab / EDF);⑤ 导出。适合课堂演示与快速目检——§6.3 十分钟路线的第 3 步可整体替换为 ATM 画图。
6.9 许可三问三答
- 能商用吗? 能。ODC-BY 1.0 唯一义务是署名(§1.4 的引用范式即满足)。
- 能再分发吗? 能。署名+保留许可声明即可;再分发时注明 v1.0.0 与获取日期是好习惯(§6.7)。
- 衍生数据集怎么定许可? ODC-BY 1.0 允许衍生作品;若混合了更严格许可的其他数据,整体许可由最严格成分决定——混合前先做许可盘点。
§7 背景与生态:一部手机、一个村庄、一间ICU 之外的心内科
7.1 全球健康动线:82% 与 77% 的交集
WHO 口径:心血管疾病是全球头号死因,82% 的 CVD 死亡发生在中低收入国家。ITU 2010 口径:全球 53 亿移动用户(≈77% 人口),发展中国家每百人 67.6 部手机。两条曲线的交集地带——手机普及率已经起飞、心内科专家密度极低的中低收入地区——就是本届挑战的战场假设:与其培训百万心电图师,不如把"采集+初筛"外包给普及中的手机与外行者,把稀缺的专家带宽留给真正需要判读的波形。而外行采集的质量方差,正是需要算法先行拦截的部分。
把两个百分比并排读还有一层更深的含义:这两条曲线的交点恰好构成一个"时间窗口"——手机普及先行于专家培养,中间有十几年的落差期,远程筛查是这个窗口里唯一可规模化的人道主义选项。2011 届挑战赛是在窗口刚打开时做的技术储备;十五年后回看,窗口仍在(专家培养周期没有缩短),而技术栈已从"手机+附件"演进到手环、贴片与智能手表——质量门卫的任务却原封不动地传递了下去。
7.2 Sana × Narayana Hrudayalaya:任务的现实原型
Sana(sanamobile.org,MIT 学生运营的开源移动远程医疗组织)与印度一流医疗集团 Narayana Hrudayalaya 合作运行的项目是本挑战的现实原型:让农村的经验不足医护用手机+外接 ECG 附件采集心电、经移动网络传至城市医院由心内科远程判读。链条上的质量瓶颈(外行采集的废片率)催生了"近实时质量门卫"这一任务定义。数据集页作者栏的三人——Ikaro Silva、George Moody(MIT LCP)、Leo Anthony Celi——加上 Sana 的背景,构成了 PhysioNet 年链里罕见的"全球健康驱动"届。
把这条原型链路按四步拆开,能精确定位质量门卫的插桩位置:采集(农村医护,外行,无复核)→ 传输(移动网络,只保字节不保质量)→ 判读(城市心内科,带宽稀缺)→ 反馈(隔日甚至隔周才能回到村庄)。质量门卫插在第一步的末端:在波形离开村庄之前,用一部手机替它把一次关。这个插桩位置决定了任务的全部硬约束——秒级、端侧、无人监督;也决定了为什么 Event 2/3 一定要在真手机上测(§4.8/§4.9):离开采集现场,这个算法就没有存在意义。
7.3 GSMA:把电信业拉进医学数据挑战
奖金赞助方 GSMA 是 219 国近 800 家运营商的全球行业协会。电信业资助医学 ECG 挑战的逻辑自洽:mHealth 业务量直接吃移动网络流量,质量门卫算法跑在手机上,整条价值链都在运营商的地盘。gsma.jpg 至今躺在数据集目录里,是"跨界赞助"的物证。这一模式在其后的挑战赛年链中未再复现同等量级——GSMA 的这 4000 美元(三赛道×2000+标注×2000 中的前者)是年链里唯一一次电信行业冠名。
为什么后无来者?三个因素叠加:① PhysioNet 挑战赛在其后的十年里学术化程度加深,赞助主力回到 NIH/科研机构体系;② mHealth 热潮在 2013 年后退潮,电信业把兴趣转向更直接的流量业务;③ 年链任务转向 ICU/临床 AI 后,与"移动网络"的产业交集变窄。GSMA 冠名因此成为年链里一个孤立的气候样本——记录着 2011 年前后"移动健康将改造一切"的行业预期高度。
7.4 杭州:年链唯一一次落地中国
CinC 2011 年会(第 38 届)于 2011-09-18/21 在中国杭州举行,浙江大学承办——这是 Computing in Cardiology 年会至今唯一一次落地中国大陆;挑战报告 9 月 20 日宣读、颁奖 9 月 21 日闭幕全会举行。2011 届因此自带中文语境线索:检索中文文献时"杭州""浙江大学"是可用的辅助关键词。会议名双口径在此提醒一次:挑战官方名用 Computing in Cardiology,而 2011 及更早的论文出版页眉惯用 Computers in Cardiology 2011——同一会议两个拼写,引用需全篇一致(坑 4)。
杭州落地对中文世界的另一层意义是文献可见性:Event 1 冠军 Xiaopeng Zhao 的中文姓名、年会的中国承办方,使这届挑战在中文文献里的引用密度明显高于"纯海外届次"——做中文综述时,本届是年链里最容易被中文文献提及的一环,也因此更需要本条目这类"把双口径、双拼写、数据血缘一次说清"的锚点文档。
7.5 Set D 的未竟之志:手机采集为什么没来
官方页在结果段明确宣布"将用原计划的手机采集流程组装 set D 作为补充发布在 PhysioNet(不用于评分)"。15 年过去,现役 v1.0.0 文件列表与存档 Test Sets 页均无 set-d 实物——它停留在承诺层(坑 3)。原因链可从官方页的措辞反推:原计划的手机+蓝牙 ECG 硬件本就因"a series of events"未能凑足 A/B/C 所需样本(才改道常规 ECG 机),再用同一硬件补一个纯手机采集集,工程上先天贫血。Set D 的缺席使 2011 届的"手机"二字只剩任务愿景、Android API 与 sim/ 合成教具三个痕迹——真实手机 ECG 的公开质量标注数据集要等到移动医疗生态成熟后的其他项目补课。
对复用者,Set D 的缺席有三条实操含义:① 域差永远存在——本集的"常规 ECG 机"分布与任何手机采集分布之间隔着硬件域差,模型跨域部署需自备目标域数据;② 不要按图索骥——检索到"set D"字样的二手文献描述时,按坑 3 处理;③ 把它当文档学案例——官方页"宣布未兑现"的事实被原样保留 15 年,这本身是对数据集生产者的提醒:承诺要么兑现,要么在版本史里明确注销,不要让它变成二十年后的检索陷阱(§8.4)。
7.6 后续影响:SQI 基准的长尾
本届的直接沉淀:① 冠军与前排方法进入 PhysioNet 开源生态(Event 2/3 代码);② 2012 年 IOP Physiological Measurement 33(9) 信号质量专刊(11 篇,其中 9 篇出自挑战参与者)把赛果期刊化;③ MIT LCP 年表记载 2011 届产出 17 papers + 7 contributed software。长尾影响:其字母评级+三分组金标准被后续 SQI 文献持续用作对标基线;"质量门卫先行于诊断"的任务范式直接进入其后可穿戴 ECG、ECG 自采集研究的设计常识; PhysioNet 挑战赛"数据先行、开源赛道、隐藏测试集"的三件套赛制在此后各届反复迭代。PhysioNet 平台本身的引用格式见 Goldberger AL 等 Circulation 2000;101(23):e215-e220 与 Pollard 等 2026 Nature Health(doi:10.1038/s44360-026-00096-z)。
三层沉淀的时效各有不同,值得分开记:开源代码的直接可运行性衰减最快(Android SDK 迭代数代,2011 年的 Java 模板如今需考古复现);专刊论文的引用半衰期最长——33(9) 专刊至今是 SQI 综述的必引篇目;而最长寿的是方法论本身:字母评级、均值+否决票、三探针赛制,这些设计语言在今天的众包标注平台与 ML 竞赛里仍能直接辨认。数据会过时,设计不会——这是"老"数据集最值得挖的资产。
7.7 三个时间视角下的同一届数据
- 2011 年的视角(当事人):这是一次面向"即将到来的移动健康浪潮"的技术储备——先造质量门卫,等硬件浪潮把采集设备送到每个村庄。sim/、Android API、Set D 承诺都是为"明天"准备的。
- 2015 年前后的视角(承接者):浪潮来了但换了形态——采集端从"手机+附件"变成可穿戴设备,2017 届把单导联异常心律分类做成主打任务,SQI 从"主角"退为"预处理基元"。2011 届的金标准在后台继续服役。
- 2026 年的视角(本次成稿):浪潮的硬件迭代了四五代,质量门卫仍是可穿戴 ECG 的第一道工序;2011 届的数据被反复用作跨代基线。历史价值不在数据量,而在它是这条任务线上第一个公开的锚点——此后每一代 SQI 方法都回头测一次它,以证明自己没漂移。
7.8 一条被验证两次的判断
2011 届的底层判断是"采集民主化的瓶颈在质量而非设备"。十五年后这个判断被第二次验证:可穿戴 ECG 爆发后,消费级设备的采集民主化程度远超 2011 年最大胆的预期,而 SQI 依然是每条 ECG 管线的第一道工序——设备换了四代,门卫没换。对数据集生产者的启示是:当你在 2011 年为一个"还没来的"应用场景储备数据与金标准时,你真正储备的是任务定义本身。场景的硬件会过时,任务定义不会——这是 cinc-2011 在生态位上最深的护城河(§7.7 三个视角的收束)。
§8 方法学启示:四条可迁移的经验
8.1 "质量金标准先行"是任务设计的护城河
多数挑战赛先有数据再想标注,2011 届反过来:先把"什么是可接受质量"用 8,327 个人工评分钉死,再让算法来追。这使排行榜上的每一分都有语义(在人类共识之上/之下的差距),也使数据集在比赛结束后仍有独立生命(SQI 基准)。任何"评估某自动系统是否达标"类数据集工程都可复用这个次序。
这次序的价值在于改变了整个比赛的语义结构:标注先行时,金标准是定义任务的宪法——参赛者、主办方、赛后引用者三方对"什么叫答对"有同一个参照物;标注滞后时,金标准是比赛结束后的补丁——评估口径在赛后反复变动,排行榜的历史可比性随之瓦解。2011 届的排行榜十五年无人翻案,与这个次序直接相关。
操作层面的复刻清单:① 在发布任何训练数据之前,先冻结"标签的定义与聚合规则"(哪怕规则很简单);② 把标注预算列为数据集工程的第一笔支出而非尾款——本届的 US$2000 众包池占总奖金的一半,就是"标注先行"的预算表达;③ 让金标准拥有独立于比赛的文档(本届 IOP 专刊导言的最终账本),使它能在比赛记忆消退后继续服役。
8.2 众包标注可行,但要配"均值+否决票"的聚合规则
本条目证明了相对低门槛的医学信号判断(质量而非诊断)可以众包,且 3-18 人/条的冗余度加上"均值 ≥0.70 且 ≤1 个 F"的复合裁决能产出可用的金标准。可迁移点:把任务降维到众包能力圈之内(判断"能不能读"而非"读出什么");聚合规则同时防多数暴政(孤立 F 否决)与孤立噪声(均值稀释恶意低分);给标注者付酬并透明化奖池。
三个可迁移点各自展开:
- 降维到能力圈:质量判断的语义是"可读性",与阅读者的专业知识弱相关——外行看不懂波形含义,但看得出"这条乱得没法读"。把众包边界划在这里,标注质量才不依赖标注者资历。反之,把"这段是什么心律"交给众包,就是设计事故。
- 复合裁决的双保险结构:单一规则必有盲区——纯均值怕孤立恶意/失误分(17 个 B 里混进一个 F 只掉 0.06),纯否决怕多数暴政(2 个 F 就能绑架全局)。“均值+否决票"让两类噪声互为补集:均值过滤孤立的 F,否决票过滤"多数共识掩盖真实缺陷”。触发 G2 的稀少性(挑战期口径 <1%)恰是双保险生效的证据:只有真正"多数说好、少数说死刑"的撕裂样本才会掉进不确定区。
- 激励透明化:US$2000 按贡献分配、规则公开,标注者对"多标多得"有稳定预期——这比任何质检说教都更能抑制刷量与敷衍(刷量的分数会被复合裁决稀释,多标才有收益,二者激励相容)。
留给 2020 年代读者的衔接题:今天的众包管线常配 LLM 预标注+人工复核。2011 届的方法论在这个新管线里依然成立——预标注相当于"第 19 个标注者",它同样要进均值、同样该有被否决的资格;把模型预标注混进聚合规则而不声明,才是需要警惕的做法。
8.3 三赛道矩阵是赛制设计的母版
Event 1/2/3 分别解耦"方法上限/可部署性/工程效率"三个维度,同一数据集回答三个问题。这个矩阵在 2011 年是创新,在今天仍是算法竞赛设计课的活教材:只要你的任务有"离线能跑"与"线上能跑"的鸿沟(嵌入式、移动端、实时流),就值得复制这根探针。Event 3 的"accuracy×速度"把部署预算写进评分,比任何口号都有效地校准了参赛者的优化方向。
矩阵的精髓是用同一份数据问三个问题——不新增标注成本,只新增评估协议,就获得三条互相正交的信息轴。本届的三张榜叠出的"策略矩阵"(§5.4:Zhao 精度型/Hayn 速度型/Moody 均衡型)就是回报:如果只办 Event 1,社区只会记住一个 0.932,而不会知道"0.932 的方法在真机+速度计价下只值 0.845"。
现代复刻至少有四个现成场景:端侧推理竞赛(accuracy × 模型体积/延迟,今天的边缘 AI 榜单普遍如此);实时流算法(accuracy × 处理时延,临床监护报警场景的天然需求);成本敏感的 API 调用(accuracy × 每千次调用美元);能耗受限的植入式设备(accuracy × 焦耳)。Event 3 的函数形状未公开是本届赛制唯一的小遗憾——复刻时应把预算函数写透明,让参赛者能做有依据的精度-速度权衡,而不是像 Hayn 那样靠赌。
8.4 数据愿景与数据现实的落差要存照
"手机 ECG 质量评估"的愿景与"常规 ECG 机采集"的现实之间隔着一个 Set D 的未竟之志(§7.5)。这提醒数据集生产者:当采集硬件/流程降级时,任务愿景与数据分布的落差本身就是元数据——本届若无官方页那句"a series of events"的坦白,后世复用者会在"为什么手机 SQI 模型在这个集上域不对"上浪费大量时间。诚实地存照降级,是数据集文档的一部分。
本届在文档诚实度上做对了三件事,恰好构成一份"落差存照"的模板:
- 坦白改道:官方页保留"a series of events prevented us from collecting a sufficient number of ECGs with the hardware we had originally planned"原话——不修饰、不粉饰,采集降级直接写进正文;
- 双口径存照:G2 的 <1% 与 13.4% 两个数字都留在各自的原始文献里(官方页与专刊导言),后世读者能自己复原"两轮裁决规则不同"的因果,而不是只拿到一个被抹平的数字;
- 承诺不注销也不粉饰:Set D 的宣布原文留在页面上,没有兑现,也没有被悄悄删除——这让 2026 年的读者能精确知道"2011 年承诺了什么、什么没来"。
对今天的数据集作者,这三件事对应 RAI/FAIR 文档实践里的 limitation 声明、口径变更日志与 roadmap 状态标记。十五年前没有这些名词,但 MIT LCP 用编辑纪律做到了同构的事——工具会过时,编辑纪律不会。
§9 与库内条目的关系
9.1 CinC 年份链:2011 是补齐的缺口环
| 库内条目 | rid | 届次主题 | 与 2011 的关系 |
|---|---|---|---|
| cinc-2011 | 本条目 | 手机 ECG 质量评估 | 起点(第 12 届年度挑战) |
| cinc-2012 | 660 | MIMIC-II ICU 死亡预测 | 数据血缘澄清对象(坑 2:A 非来自 MIMIC-II) |
| cinc-2013 | 662 | 胎儿 ECG | 同为"信号质量敏感"任务,SQI 方法可迁移 |
| cinc-2014 | 666 | 心跳检测/心跳间隔 | 共享 12 导联短记录范式 |
| cinc-2015 | 487 | ICU 假警报抑制 | brief 混淆源(坑 1);"报警质量"与"信号质量"互为上下游 |
| physionet-cinc-2016 | 382 | 生命体征死亡风险预测 | 同属 PhysioNet 挑战序列 |
| physionet-cinc-2017 | 162 | 异常心律分类(单导联) | 单导联 vs 12 导联对照;其 SQI 环节直接沿用 2011 思路 |
| cinc-2018-sleep | 493 | 睡眠障碍呼吸事件 | 年链睡眠分支 |
| cinc-2019 | 656 | 脓毒症预测 | 多时相临床数据 |
| cinc-2021 | 644 | 心房颤动检测(多中心) | 房颤检测前的 SQI 预处理是其文献引用常客 |
| cinc-2023 | 499 | 环境录音心跳监测 | 年链最远端 |
按任务形态给年链分三段,能看出 2011 的"祖庭"位置:信号挑战期(2011-2014)——任务对象是波形本身(质量/胎儿 ECG/心跳间隔),2011 的 SQI 范式在这一段是主角;临床报警与生理预测期(2015-2018)——任务对象转向监护环境(假警报/死亡风险/睡眠事件),SQI 退为隐含的预处理环节(2015 的假警报问题里,信号质量正是误报的上游成因之一);临床 AI 期(2019-2023)——任务对象是临床结局与多模态数据,年链与 2011 的直接交集变薄,但"隐藏测试集+开源赛道"的赛制遗产仍在每一届运行。读年链时带着这个分期,2011 的每一条关系都会更清楚。
9.2 检索路径建议
- 找"ECG 信号质量评估/SQI 基准":本条目为起点 → cinc-2017(单导联 SQI 实战)→ cinc-2021(房颤检测的 SQI 前置)。
- 找"PhysioNet 挑战赛史":年链顺序通读,注意 2016/2017 条目名带 physionet- 前缀而其余不带(slug 命名史差异,检索两套都试)。
- 找"ICU 假警报":直接去 cinc-2015(487),不要停留在本条目(坑 1)。
- 找"MIMIC 波形":2011 与 MIMIC-II 无血缘(坑 2),去 cinc-2012 与 MIMIC 系列条目。
- 找"移动健康/可穿戴的起点文献":本条目 §7 + 库内可穿戴传感类条目;2011 届是"质量门卫"叙事在年链里的唯一主角届。
- 找"众包医学标注案例":本条目 §3 + 库内带众包标注的影像条目;字母评级+复合裁决是跨模态可迁移的设计。
9.3 互链操作建议
- 从年链各条目回链本条目时,建议锚点文本带届次主题(“2011 届手机 ECG 质量评估”),避免只写"CinC 2011"造成坑 1 式主题误读。
- 2015(487)与 2012(660)两条是高频混淆入口,建议在其条目的"易混淆"段落互设指路(坑 1/坑 2 的双向导航)。
- 可穿戴传感类条目引用本集时,建议同时提示"常规 ECG 机采集"的域差(坑 2),防止读者把本集当手机/可穿戴域训练数据。
§10 避坑清单:八个已踩过的坑
坑 1:主题证伪——"ICU 假警报"是 2015 届的。任务头候选 brief 把 2011 届写成"Improving the false alarms in ICU"。三源核验证伪:2011 届官方全称是 Improving the Quality of ECGs Collected using Mobile Phones,主题是手机 ECG 质量评估;ICU 假警报抑制是 2015 届(Reducing False Arrhythmia Alarms in the ICU,库内 rid 487)。两届都带"alarm/quality"味的关键词,检索时务必带年份。
- 怎么避开:检索时把"年份"作为与"挑战赛"同级的关键词;看到 false alarm + Challenge 组合先查届次再看内容;引用库内条目时以 rid 为准(487=2015,本条目 2011)。
坑 2:Set A 不来自手机,更不来自 MIMIC-II。两层误传一并清理:① A/B/C 全部由常规 ECG 机采集(官方页原话承认原计划手机硬件不足);② Set A 与 MIMIC-II 无任何血缘——MIMIC-II 是 2012 届 ICU 死亡预测挑战的数据源。把"手机 ECG 数据集"与"MIMIC 波形"两个标签贴到 2011 届上都会误导检索。
- 怎么避开:记一句话——“MIMIC 系数据第一次进年链是 2012 届”;数据来源以官方 sources/ 说明为准,不用二手转述;需要手机域数据时另行寻找并声明跨域。
坑 3:Set D 宣布了但从未发布。官方页白纸黑字写"将组装 set D 作为补充发布在 PhysioNet",但现役 v1.0.0 文件列表与存档 Test Sets 页均无 set-d 实物。15 年过去它仍是承诺——任何文献若声称使用 set-d,需要独立证据。
- 怎么避开:读到 set-d 字样先去 v1.0.0 文件列表核对;文献里声称用过 set-d 的,要求其给出获取渠道;规划依赖时按"set-d 不存在"设计。
坑 4:会议名双拼写 Computing vs Computers。挑战官方名用 Computing in Cardiology;2011 及更早届的论文出版页眉惯用 Computers in Cardiology 2011。同一会议、两个拼写、两套索引。总结论文按出版口径应引 Computers in Cardiology 2011;38:273-276;写挑战史按官方口径用 Computing。全文一致即可,别混拼。
- 怎么避开:数据集与赛史叙述统一用 Computing;论文引用统一用出版口径 Computers;一篇文档内只用一套并在脚注说明另一拼写。
坑 5:Group 2 占比差了一个数量级。挑战期官方页口径:Group 2 不足 1%(约 70%/30%/<1%);2012 年 IOP 专刊最终金标准口径:267/2000≈13.4% indeterminate。原因是两轮标注裁决规则不同(窄切片 vs 宽判定)。评测对齐排行榜用前者,方法学研究用后者,混用则数字全错。
- 怎么避开:写作时凡引 G2 占比,括注口径出处;实验设计在 §3.5 决策表里对号入座;两套口径的样本清单不可互换使用。
坑 6:总量 2000 vs 公开 1500。2000 = A(1000)+B(500)+C(500) 是全集口径(IOP 导言);公开可下载仅 A+B=1500。C 是永久隐藏的 Event 3 测试集。引用"2000 条"而不注明"其中 500 条不可得"是不实陈述。
- 怎么避开:采用"2000(全集)/1500(公开)"双注式;任何下载资源若声称含 Set C,按坑 6 存疑并核对官方文件列表。
坑 7:官方 URL 重定向同页+反爬。https://physionet.org/challenge/2011/ 与 https://physionet.org/content/challenge-2011/1.0.0/ 是同一页(前者 302 重定向到后者,抓取字节数完全一致 58,233 B);另 physionet.org 对部分抓取器返回空内容,脚本化获取需带浏览器 User-Agent 的 curl 或直用 files/challenge-2011/1.0.0/ 的文件直链。
- 怎么避开:脚本一律直连 content/ 或 files/ 路径;curl 带浏览器 UA;或改走 AWS/rsync 镜像绕开网页层(§6.1/§6.6)。
坑 8:sim/ 是合成教具,不是真实数据。sim.tar.gz(5.7 MB)是目标手机硬件录制的合成 ECG 试点集,用途是熟悉 Android API。它与 set-a/set-b 的真实数据不同源、不同质、不参与评分——做 SQI 研究把它混入训练池,等于给模型喂"永远不存在于现实的分布"。
- 怎么避开:训练/评估管线里显式排除 sim/ 目录;若要做"合成数据辅助 SQI"研究,把 sim/ 单列为对照实验并声明其合成属性。
§11 总结
11.1 三句话总结
- PhysioNet/CinC Challenge 2011 用 2000 条 12 导联 ECG 与 8,327 个人工评分,把"ECG 质量评估"第一次做成带公开金标准的排行榜任务,冠军 accuracy 0.932、开源赛道手机实机 0.914、隐藏集速度加权 0.873。
- 它的标注方法论(字母评级+均值与否决票复合分组)与赛制设计(闭源/开源/隐藏集×速度三探针)比数据本身更有长尾生命力,持续渗透进此后十余年的 SQI 与挑战赛工程。
- 它的"手机"二字是愿景而非现实——A/B/C 全部常规 ECG 机采集、Set D 从未发布——但这层落差被官方页诚实存照,反而成为数据集文档学的正面案例。
11.2 适合谁
- SQI/信号质量研究者:要一个带 8 千级人工评分、可对标排行榜的金标准底座。
- 可穿戴/移动心电工程团队:要"嵌入式预算内质量门卫"的历史基线与特征工程范例。
- 众包医学标注方法论研究者:3-18 人盲评+复合裁决规则的活样本。
- PhysioNet 挑战赛年链研究者:2011 是缺的起环。
11.3 不适合谁
- 要真实手机 ECG 分布的团队(数据是常规 ECG 机采集,手机域需另行适配)。
- 要诊断标签的团队(本集只有质量标签,无任何节律/形态学诊断)。
- 要患者元数据做亚组分析的团队(头文件仅年龄+性别两项)。
- 要大规模训练集的深度学习团队(1500 条公开记录,2020 年代标准下是小数据)。
11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 只想跑通一个 SQI 基线 | AWS 一行 sync 下 set-a/set-b → §6.3 工具链读 WFDB → 对标 0.896-0.932 前十带 |
| 要对齐历史排行榜 | 严格按挑战期三分组剔除 Group 2,测试只用 Set B(坑 5/坑 6) |
| 做众包标注系统设计 | 直读 §3;引用"均值+否决票"规则时注明挑战期/专刊双口径 |
| 在 2015 届假警报或 MIMIC 项目里迷路了 | 坑 1/坑 2 指路:假警报→cinc-2015(487),MIMIC→cinc-2012(660) |
| 要引用数据集 | 现役版引 physionet.org/content/challenge-2011/1.0.0/;存档版引 DOI 10.13026/C26P4C;论文引 Computers in Cardiology 2011;38:273-276(坑 4) |
| 设计自己的挑战赛 | 抄 §4 的三探针矩阵与 §8.1 的标注先行次序;预算函数记得写透明(Event 3 的教训) |
11.5 三个如果(面向未来复用者)
- 如果你只需要一个 SQI 课程作业:取 set-a 前 100 条+预分类清单,一晚可交付(§6.3)。
- 如果你准备发表论文引用本集:先过附录 L 订正表,再按 §1.4 三范式引用。
- 如果你在 2030 年代读到本条目:年链最远端已到 cinc-2023(499),SQI 基线可能已换新王——但 8,327 个评分仍是人类共识的化石层,测"漂移"仍要回到这里。
FAQ(高频问答 47 问)
A. 基础认知
Q1:cinc-2011 是什么?
第 12 届年度 PhysioNet/Computing in Cardiology Challenge 2011 的官方数据集:手机 ECG 近实时质量评估挑战赛,含 2000 条 12 导联 ECG 与 8,327 个人工质量评分。
Q2:谁办的?
PhysioNet(NIH 资助)× Computing in Cardiology 2011 年会(第 38 届,2011-09-18/21,中国杭州,浙江大学承办);数据与论文由 MIT Laboratory for Computational Physiology 维护(Ikaro Silva、George Moody、Leo Anthony Celi)。
Q3:"手机 ECG"体现在哪?
任务要求参赛算法能在 Android 手机内近实时运行;官方提供 Java 模板 API;sim/ 是目标手机硬件录制的合成教具。但正式数据 A/B/C 全部由常规 ECG 机采集(坑 2)。
Q4:它和 ICU 假警报挑战什么关系?
没关系。"Reducing False Arrhythmia Alarms in the ICU"是 2015 届(库内 cinc-2015,rid 487)。brief 式的混淆很常见,认准年份(坑 1)。
B. 数据与获取
Q5:哪里下,要注册吗?
physionet.org/content/challenge-2011/1.0.0/ 页面 ZIP 直下(169.7 MB),或 wget/AWS S3 开放镜像/rsync 存档四选一;Access Policy 为 Anyone can access,无需注册与签协议。
Q6:能下到全部 2000 条吗?
不能。公开的只有 Set A(1000)+Set B(500);Set C(500)是 Event 3 隐藏测试集,从未发布(坑 6)。
Q7:Set D 呢?
官方页宣布过"将发布",但从未有实物(坑 3)。现役与存档页均无 set-d。
Q8:什么格式?
每条记录 CSV(.txt,兼容挑战 Android API)+WFDB(.hea/.dat)双格式;PhysioBank ATM 可在线转 text/Matlab/EDF。
Q9:有患者信息吗?
仅 .hea 尾行的年龄(未知记 0、>89 记 90)与性别。无病史、用药、诊断信息;一记录不必然对应唯一受试者。
Q10:sim/ 能当训练数据吗?
不能与真实数据混用——它是合成 ECG 教具(坑 8)。
Q11:下载后怎么确认完整性?
先数 RECORDS 行数:set-a 应 1000 行、set-b 应 500 行(§6.6);再抽查几条记录的 .txt/.hea/.dat 三件套是否同名共存。
Q12:AWS 镜像下载要注意什么?
用 aws s3 sync --no-sign-request(免 AWS 账号);云上用户直接同步到实例盘可省本地带宽;路径 s3://physionet-open/challenge-2011/1.0.0/。
C. 标注与口径
Q13:质量标签怎么读?
每条 3-18 人盲评,字母 A(0.95)/B(0.85)/C(0.75)/D(0.60)/F(0) 取均值;≥0.70 且 ≤1 个 F 为 Group 1 可接受,≥0.70 但 ≥2 个 F 为 Group 2 不确定,<0.70 为 Group 3 不可接受。
Q14:为什么有的文献说 13.4% indeterminate?
那是 2012 年 IOP 专刊最终金标准口径(267/2000),与挑战期官方页 <1% 是两轮不同裁决规则的产物(坑 5)。引用前先选口径。
Q15:8,327 个评分是怎么数出来的?
2000 条记录 × 每条 3-18 名标注者的独立评分之和,出自 IOP 专刊导言的最终账本;其中 1,733 条判 acceptable/unacceptable、267 条 indeterminate。
Q16:标注者可靠吗?
官方宣称高度一致但未公布逐条统计量;标注者含公众(自评经验)与受邀专家,经验跨度大。方法学研究时应把这层不确定性计入(§3.6 的软标签建议)。
Q17:训练/验证/测试怎么划分?
Set A 自带参考评估清单,可在其内部切训练/验证;Set B 只做一次性终测(对齐 Event 1 赛制);不要在 Set B 上反复调参——等于把测试集当验证集。
D. 赛制与结果
Q18:三个 Event 有什么区别?
Event 1 闭源可参赛+Set B+纯 accuracy;Event 2 强制开源 Java+参考 Android 实机+Set B;Event 3 同 Event 2 代码+隐藏 Set C+accuracy×速度。
Q19:冠军是谁?
Event 1:Xiaopeng Zhao 0.932;Event 2:Xiaopeng Zhao 0.914;Event 3:Dieter Hayn 0.873(以 0.001 险胜 Chudáček 0.872)。49 支队伍参战。
Q20:漏答怎么算?
漏答=错答(只有答对得分),防止"少答少错"投机;Group 2 剔除不计分。
Q21:Event 1 至多 5 次提交怎么用?
官方规则:至多 5 次提交、取最高分(§4.7);前几次试探金标准边界、最后一次定榜。现代复现无次数限制,但方法论上应等效约束。
Q22:奖金多少?
GSMA 与 CinC 捐助:三 Event 最优各 US$2000(每人/队至多领取一项);另 US$2000 分给标注贡献者。
Q23:为什么是 Java?
2011 年 Android 开发的事实母语;官方模板 API 把参赛者从工程搭建中解放出来,专注质量算法(§4.6)。
E. 复用与库内
Q24:现在还能复现比赛评分吗?
可近似不可精确:Set C 不可得,Group 2 口径需自选且官方未公布逐条 2012 版最终分组对照表。用 A 训练+B 测试+挑战期三分组可逼近 Event 1 赛制。
Q25:license 对商用友好吗?
ODC-BY 1.0:署名即可自由使用含商用,是库内最宽松数据许可之一。papers/ 目录单独 CC BY 3.0。
Q26:怎么引用?
数据:physionet.org/content/challenge-2011/1.0.0/(存档 DOI 10.13026/C26P4C);论文:Silva I, Moody GB, Celi L. Computers in Cardiology 2011;38:273-276;平台:Goldberger 等 Circulation 2000 或 Pollard 等 Nature Health 2026。
Q27:深度学习能在这个量级上跑吗?
1500 条公开记录对现代 DL 是小数据,预训练+微调或经典特征工程更现实——2011 年冠军方法本就是经典信号处理+浅层分类器,且至今仍是本集上性价比最高的起点。
Q28:和库内哪些条目互链?
CinC 年链十条:cinc-2012(660)/2013(662)/2014(666)/2015(487)/2016(382)/2017(162)/2018-sleep(493)/2019(656)/2021(644)/2023(499);语义近邻还有可穿戴 ECG 与 MIMIC 系条目。
Q29:RECORDS 文件怎么用?
纯文本、每行一个记录名,批量脚本的遍历入口;set-a 内另有 RECORDS-acceptable/unacceptable 两份预分类清单(§2.7/附录 I)。
Q30:年龄字段里的 0 和 90 怎么处理?
0=未知(不是新生儿),90="大于 89"的截断码(不是精确 90);建议把 0 当缺失值处理、90 当区间右端点(§2.2)。
Q31:想加自己的标注怎么办?
先按 §3.5 决策表选定基线口径,再记录你的新增标注的裁决规则与标注者构成,与 8,327 原始评分分池存放——不要静默覆盖历史金标准。
Q32:一句话安利?
要理解"数据质量本身可以是一个数据集",从这一届开始读最顺——它是库内年链的起点,也是 SQI 方法学最干净的教科书。
Q33:为什么它至今仍是 SQI 对标基线?
三个原因:金标准显式(8,327 评分)、版本恒定(15 年 v1.0.0,跨文献可比,§6.7)、规格诊断级(结论不被设备先天不足污染,§2.9)。
Q34:能把本集用于课程教学吗?
非常适合:规模小(公开 1500 条)、格式简单(WFDB+CSV)、有历史排行榜可对标——§6.3 的 10 分钟路线即课堂演示脚本,ATM 路线(§6.8)可零安装演示。
Q35:官方页有哪些必读区块?
任务定义、Data Description、Grading、三 Event 规则、时间线、top-scores——本条目 §0-§5 与之一一对应(附录 M 的映射表)。
Q36:一句话提醒二次引用者?
写 2000 注明 500 不可得(坑 6)、写 G2 注明口径(坑 5)、写手机注明愿景(坑 2)——三注齐备,引用即安全。
Q37:为什么 2011 届没有后续的手机 ECG 数据集?
原计划硬件采集受挫(§7.5 的原因链),Set D 未兑现;行业采集形态随后转向可穿戴设备,"手机附件"这个窗口本身关闭了。
Q38:Event 3 的速度函数形状官方公布了吗?
没有——官方只给参考量纲(平均执行 <2 秒)与最终榜。这是复刻该赛制时要补的功课:把预算函数写透明(§8.3)。
Q39:能在本集上做跨库迁移研究吗?
可以且常见(如向 MIMIC 波形迁移),但必须声明"跨库迁移"而非"原始标注"(§2.5)。
Q40:本条目证据链的最高准则是什么?
官方页为第一事实源(58,233 B 存档),2011 总结论文与 2012 IOP 专刊导言为互证源;分歧处双口径存照不裁决(坑 5/坑 6)。
Q41:Set A 的预分类清单覆盖全部 1000 条吗?
官方未声明全覆盖;两清单(RECORDS-acceptable/unacceptable)之外的记录按"无预分类"处理(§2.7/附录 I)。
Q42:有导联级质量评分吗?
没有——金标准是记录级分组;导联级判读要点见附录 J(编辑备忘,非官方口径)。
Q43:本集适合测模型鲁棒性吗?
适合且这正是它的特长:采集者水平刻意混合、质量谱全覆盖(§2.3)——从"技师级干净"到"外行级混乱"的分布是天然的鲁棒性测试床。
Q44:为什么说 2011 是年链的"起环"?
它是第 12 届年度挑战、库内年链最早环;其后任务形态三段演化(§9.1),但赛制三件套与 SQI 范式均发端于此。
Q45:代码围栏里的命令可以直接跑吗?
可以——§6.1/§6.3/附录 P 的命令均为标准 AWS/wget/wfdb 用法,仅需替换 DESTINATION 等占位;附录 E 骨架中的 RECORDS_NAME 按 RECORDS 清单实际行替换。
Q46:本条目和同站可穿戴条目怎么分工?
本集是"质量门卫"方法论与金标准的起点(常规 ECG 机域);可穿戴条目管"新采集形态"。跨域引用先读坑 2 与 §7.8。
Q47:FACTS.md 和本条目什么关系?
FACTS.md 是本条目的九节事实档案(证据先行);本条目是其百科化展开——两者冲突时,以 FACTS.md 的来源链为准复核本条目。
事实清单(硬事实 40 条)
| # | 事实 | 来源 |
|---|---|---|
| 1 | 官方全称 Improving the Quality of ECGs Collected using Mobile Phones: The PhysioNet/Computing in Cardiology Challenge 2011 | 官方页标题 |
| 2 | 版本 v1.0.0,Published April 19, 2011,至今唯一版本 | 官方页 |
| 3 | 数据集页作者 Ikaro Silva, George Moody, Leo Anthony Celi(MIT LCP) | 官方页 |
| 4 | 总量 2000 条 12 导联 ECG(A 1000+B 500+C 500) | IOP 导言+官方 HEADER |
| 5 | 公开可下载 1500 条(A+B);Set C 500 隐藏未公开 | 官方文件列表+IOP |
| 6 | Set D 宣布将发布但从未有实物 | 官方页措辞+v1.0.0 文件列表+存档页 |
| 7 | 规格:12 导联(I/II/III/aVR/aVL/aVF/V1-V6)、0.05-100 Hz、500 Hz、16-bit、最短 10 秒 | 官方页 |
| 8 | A/B/C 全部常规 ECG 机采集,原计划手机硬件不足改道 | 官方页原话 |
| 9 | sim/ 为合成 ECG 试点(5.7 MB,2011-02-16),目标手机硬件录制 | 官方页 |
| 10 | .hea 尾行含年龄(未知记 0、>89 记 90)与性别 | 官方页 |
| 11 | 8,327 个众包质量评分 | IOP 导言 |
| 12 | 每条 3-18 名标注者独立盲评 | 官方页 |
| 13 | 字母等级 A0.95/B0.85/C0.75/D0.60/F0 | 官方页 |
| 14 | 三分组:G1 ≥0.70 且 ≤1 F(约 70%)/G2 <1%/G3 <0.70(约 30%) | 官方页 |
| 15 | 专刊口径:1,733 条判可决+267 条 indeterminate(≈13.4%) | IOP 导言 |
| 16 | Event 1 闭源或开源、Set B、accuracy、至多 5 次提交 | 官方页 |
| 17 | Event 2 开源 Java+Android 模拟器、参考手机实测、Set B | 官方页 |
| 18 | Event 3 隐藏 Set C、accuracy×运行时间函数、平均执行 <2 秒 | 官方页+论文摘要 |
| 19 | 漏答=错答;Group 2 剔除不计 | 官方页 |
| 20 | 奖金:三 Event 各 US$2000+标注者池 US$2000,GSMA 与 CinC 捐助 | 官方页 |
| 21 | 49 支队伍/个人参战 | 官方页 top-ten+论文摘要 |
| 22 | Event 1 冠军 Xiaopeng Zhao 0.932;前十 0.896-0.932 | 官方 top-scores |
| 23 | Event 2 冠军 Xiaopeng Zhao 0.914 | 官方 top-scores |
| 24 | Event 3 冠军 Dieter Hayn 0.873,亚军 Chudáček 0.872 | 官方 top-scores |
| 25 | 论文 accuracy 范围:Event 1 89-93%、Event 2 80-91% | 论文摘要 |
| 26 | License:ODC-BY 1.0;papers CC BY 3.0;Anyone can access | 官方页 |
| 27 | 获取:ZIP 169.7 MB/wget/AWS s3://physionet-open/challenge-2011/1.0.0//rsync 存档 | 官方页 |
| 28 | set-a.tar.gz 102.9 MB(2011-07-20)、set-b.tar.gz 51.2 MB(2011-04-20) | 官方文件列表 |
| 29 | 存档 DOI 10.13026/C26P4C(Test Sets 页) | archive.physionet.org |
| 30 | 论文:Silva/Moody/Celi, Computers in Cardiology 2011;38:273-276(IEEE);挑战名与出版名 Computing/Computers 双拼写 | Google Scholar+论文页眉 |
| 31 | ECG grading 众包通道 2011-03-07 开放,US$2000 按标注贡献分配 | 官方页时间线 |
| 32 | 挑战公告 2011-02-25;最终提交截止 2011-08-05(noon GMT) | 官方页 |
| 33 | CinC 2011 年会 2011-09-18/21(杭州,浙江大学承办);报告 09-20、颁奖 09-21 | 官方页 |
| 34 | GSMA:219 国近 800 家运营商行业协会,本届奖金冠名赞助方 | 官方页+gsma.jpg |
| 35 | api/ 目录提供官方 Android API 与 Java 模板(Event 2/3 工程底座) | 官方文件列表 |
| 36 | sim/RECORDS 于 2012-02-25 更新——v1.0.0 生命周期内唯一一次内容更新 | 官方页历史记录 |
| 37 | 理想目标:识别电极错位/接触不良/外部电干扰/运动伪影四类问题并给纠正指导 | 官方页任务陈述 |
| 38 | Sana(sanamobile.org):MIT 学生运营的开源移动远程医疗组织,本届任务的现实原型 | 官方页+挑战叙述 |
| 39 | MIMIC-II 数据血缘属 2012 届(ICU 死亡预测),与 2011 届无关 | MIT LCP 年表+库内 cinc-2012(660) |
| 40 | 冠军方法骨架:经典信号处理特征+浅层分类器,无深度网络 | 挑战报告+专刊综合 |
附录 A:一屏速查
| 项 | 值 |
|---|---|
| 类型 | 挑战赛数据集+金标准质量标注(三合一:数据/赛制/标注方法论) |
| 规模 | 2000 条 12 导联 ECG(公开 1500)+ 8,327 评分 |
| 主办 | PhysioNet × CinC 2011(杭州,浙大承办) |
| 任务 | 手机端近实时 ECG 质量二分类 |
| 许可 | ODC-BY 1.0(数据)/ CC BY 3.0(论文) |
| 抓取时点 | 2026-09-27(curl 直抓官方页 58,233 B 存档) |
| 库内互链 | cinc-2012(660)/2013(662)/2014(666)/2015(487)/2016(382)/2017(162)/2018-sleep(493)/2019(656)/2021(644)/2023(499) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | PhysioNet 站内索引+学界引用长尾 15 年;"challenge-2011"URL 语义直白;同届次共用 CinC Challenge 名需带年份检索;中文语境可加"杭州/浙江大学"辅助词 |
| A 可获取性 | 9 | 无注册/无协议/无审批,ZIP+wget+AWS+rsync 四路直下,ODC-BY 1.0 商用友好;扣 1 分:Set C 永久隐藏、Set D 胎死腹中,全集 2000 不可复得 |
| I 可互操作 | 8 | WFDB 母语+CSV 双轨;PhysioBank ATM/Python wfdb/MATLAB 工具链成熟,ATM 在线转 EDF/Matlab 零安装;扣分:无 ML 原生打包(Parquet/HF/Zarr),转换需自理 |
| M 元数据质量 | 7 | 官方页文档详尽(任务/赛制/评分规则/时间线全透明)+RECORDS 清单+头文件年龄性别;扣分:无采集设备与采集者逐记录画像、标注一致性无统计支撑、G2 双口径需人工裁决 |
| S 可持续性 | 8 | MIT LCP 长期托管+AWS 开放镜像+独立 DOI 存档三层冗余;15 年版本恒定 v1.0.0(仅 2012-02-25 sim/RECORDS 一次更新),维护记录可查 |
| 综合评级 | 8.0/10(优) | 可获取性与可持续性双高;失分项均为 2011 年时代产物(ML 包装、元数据深度)而非管理缺陷;在库内开放光谱上位于"完全开放直链"一端 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 全称与 v1.0.0/Published 2011-04-19 | 官方数据集页标题区 | physionet.org/content/challenge-2011/1.0.0/(curl 58,233 B 存档) |
| A=1000/B=500 | 官方 HEADER+IEEE 引文+IOP 导言三源 | 同上+论文摘要+Physiol Meas 33(9) E01 |
| C=500+总 2000+8,327 评分+1,733/267 | IOP 专刊导言 | iopscience.iop.org/0967-3334/33/9/E01 |
| 规格 12 导联/0.05-100 Hz/500 Hz/16-bit/10 s | 官方页 Introduction+Data Description | 同官方页 |
| "a series of events"改道常规 ECG 机 | 官方页原文 | 同官方页 |
| Set D 宣布未发布 | 官方页结果段+v1.0.0 文件列表+存档 Test Sets 页 | 三处互证 |
| 字母评级与三分组规则 | 官方页 Grading 节 | 同官方页 |
| 49 参赛者 | 官方 top-ten(of 49)+论文摘要 | 官方页+论文 |
| 三冠军 0.932/0.914/0.873 | 官方 top-scores/top-ten.txt(100 B) | 官方页 |
| 89-93%/80-91%/<2 s | 总结论文摘要 | Computers in Cardiology 2011;38:273-276 |
| ODC-BY 1.0/CC BY 3.0/Anyone can access | 官方页 License 与 Access Policy 区 | 同官方页 |
| ZIP 169.7 MB/set-a 102.9 MB/set-b 51.2 MB | 官方文件列表 | 同官方页 |
| DOI 10.13026/C26P4C | 存档 Test Sets 页 | archive.physionet.org |
| 2015 届=ICU 假警报(坑 1 反证) | MIT LCP 挑战年表+库内 cinc-2015(487) | lcp.csail.mit.edu/challenge |
附录 D:数据获取决策树
需求是什么?
├── 只要跑通 SQI 基线
│ └── AWS 一行:aws s3 sync --no-sign-request s3://physionet-open/challenge-2011/1.0.0/ ./
├── 要对齐 2011 排行榜
│ ├── 1) Set A 训练 + Set B 测试
│ ├── 2) 挑战期三分组(G2 剔除)
│ └── 3) 指标 accuracy,对标 0.896-0.932 前十带
├── 做标注方法论研究
│ └── 用 IOP 专刊 1,733+267 账本口径;读 §3 全节
├── 做移动端部署研究
│ └── 读 api/ 目录 Java 模板 + Event 3 速度项设计(§4.2/§4.3)
└── 找 ICU 假警报或 MIMIC
└── 去别处:cinc-2015(487) / cinc-2012(660)+MIMIC 系(坑 1/坑 2)
附录 E:Python 读取骨架
import wfdb # pip install wfdb
# 读取一条 Set A 记录(解包 set-a.tar.gz 后)
record = wfdb.rdrecord("set-a/RECORDS_NAME", sampto=5000) # 500 Hz × 10 s
print(record.p_signal.shape) # (N, 12) —— 12 导联同步
print(record.comments) # 尾行元数据:年龄/性别(未知记 0,>89 记 90)
# CSV 路线(挑战 Android API 兼容格式)
import numpy as np
csv_path = "set-a/RECORDS_NAME.txt"
mat = np.loadtxt(csv_path, delimiter=",") # 首列时间戳,后 12 列导联
# Set A 参考质量评估清单:官方页/RECORDS-acceptable 与 RECORDS-unacceptable
# 复用提醒:三口径守则见 §6.5(标注口径/Set C/sim/元数据边界)
附录 F:时间线与里程碑速查
| 日期 | 里程碑 | 意义 |
|---|---|---|
| 2011-02-16 | sim/ 发布 | 教具先行,Android API 预热 |
| 2011-02-25 | 挑战公告 | 任务定义公开(手机 ECG 质量) |
| 2011-03-07 | 标注通道开放 | 众包金标准启动(US$2000 池) |
| 2011-04-19 | 数据集 v1.0.0 Published | Set B 就位,比赛数据成型 |
| 2011-04-30 | preliminary entry 线 | 资格分水岭 |
| 2011-08-05 | 最终提交截止 | 三 Event 定榜 |
| 2011-09-18/21 | CinC 2011 杭州 | 报告 9-20、颁奖 9-21;年链唯一中国届 |
| 2012-02-25 | sim/RECORDS 更新 | 唯一一次版本内容更新 |
| 2012-09 | IOP 专刊 33(9) | 最终金标准(8,327/1,733/267)期刊化 |
附录 G:BibTeX
@inproceedings{silva2011improving,
author = {Silva, Ikaro and Moody, George B and Celi, Leo Anthony},
title = {Improving the Quality of {ECGs} Collected Using Mobile Phones:
The {PhysioNet/Computing} in Cardiology Challenge 2011},
booktitle = {Computers in Cardiology 2011},
volume = {38},
pages = {273--276},
year = {2011},
publisher = {IEEE}
}
@dataset{physionet_challenge_2011,
author = {Silva, Ikaro and Moody, George B and Celi, Leo Anthony},
title = {Improving the Quality of {ECGs} Collected using Mobile Phones:
The {PhysioNet/Computing} in Cardiology Challenge 2011 (version 1.0.0)},
year = {2011},
url = {https://physionet.org/content/challenge-2011/1.0.0/}
}
附录 H:与 2017 届 SQI 环节的对照
库内 cinc-2017(rid 162,异常心律分类,单导联)是年链里与 2011 届 SQI 血缘最近的一环——单导联任务在正式分类前同样要过"这段波形可不可读"这道门。两届对照(定性对照,数字各以库内对应条目为准):
| 维度 | 2011 届(本条目) | 2017 届 |
|---|---|---|
| 导联 | 12 导联同步 | 单导联 |
| 主任务 | 质量二分类(SQI 即主任务) | 心律分类(SQI 为隐含前置) |
| 质量标注 | 显式:8,327 个众包评分+三分组 | 无显式质量标签,质量语义隐含在数据清洗与参考标签中 |
| 数据来源 | 常规 ECG 机(愿景是手机) | 消费级/临床混合来源的单导联记录 |
| 隐藏测试集 | Set C(Event 3 专用) | 有(赛制三件套已成熟) |
| 对复用者的意义 | SQI 金标准的"原点" | SQI 从主角退为基元的"分水岭" |
读法:把两届连读,能看到"质量评估"这个任务在六年间从显式主任务(2011,专门为它造了 8,327 个评分)退化为隐含预处理(2017,假设数据已够干净或清洗已足够)的完整轨迹——而这道门并没有消失,只是从排行榜搬进了每条管线的第一格。
附录 I:RECORDS 清单使用样例
# 遍历 set-a 全量记录的最小骨架(记录名以 RECORDS 实际内容为准)
import wfdb, pathlib
root = pathlib.Path("set-a")
names = (root / "RECORDS").read_text().split()
# Set A 预分类清单(参考质量评估的载体)
acc = set((root / "RECORDS-acceptable").read_text().split())
unacc = set((root / "RECORDS-unacceptable").read_text().split())
def label_of(name):
if name in acc: return "acceptable" # 预判可接受
if name in unacc: return "unacceptable" # 预判不可接受
return "unlabeled" # 两清单之外:无预分类
# 读前 5 条做抽样自检
for name in names[:5]:
rec = wfdb.rdrecord(str(root / name), sampto=500)
print(name, rec.p_signal.shape, label_of(name))
三条使用纪律:① 预分类清单是二分类粗标签,不等于逐条字母评分——不要把 acceptable 清单当作"G1 金标准"使用;② 两清单之外的记录并非"质量中间档",只是官方未给预分类;③ 自建标签永远分池存放(FAQ Q31),不覆盖官方清单。
附录 J:导联级质量判读要点(特征工程备忘)
官方金标准是记录级(整条 ECG 一个分组),不提供导联级评分。但 SQI 特征工程通常从导联级做起——以下为一般心电工程常识备忘(编辑整理,非官方口径),供从"导联级异常投票"上卷到"记录级判决"的建模路线参考:
- 肢体导联(I/II/III):幅度大、最稳,是基线漂移与饱和检测的首选窗口;I+III 可代数重建 II,三者幅度关系被破坏是电极错位的经典指纹(§2.8)。
- 加压导联(aVR/aVL/aVF):aVR 常态低幅甚至倒置,低电压+噪声环境下最先"淹没",其可用性阈值应单列;aVL/aVF 受呼吸漂移影响明显。
- 胸前导联(V1-V6):电极位置敏感度全组最高——V1/V2 位置偏差即致形态畸变;R 波递增规律(V1-V6 渐变)是位置正确性的强先验,递增规律消失先怀疑胸前电极错位而非心律。
- 导联间同步性:接触不良/运动伪影常仅袭击个别导联,"同一时刻哪些导联同时崩坏"的共崩模式是区分环境干扰(全导联同步毛刺)与局部接触问题的高判别力特征。
- 上卷建议:导联级 SQI 分数 → 记录级判决的最简稳健路线是"可读导联计数+最差导联惩罚"两特征起步,与 2011 冠军方法的"导联间相关性"骨架同路(§5.5)。
附录 K:术语表
| 术语 | 释义 |
|---|---|
| SQI | Signal Quality Index,信号质量指数;对一段波形"可否用于诊断"的量化评估 |
| WFDB | Waveform Database,PhysioNet 母语格式:.hea 头+.dat 样本 |
| PhysioBank ATM | PhysioNet 在线波形工具:免安装预览/格式转换(§6.8) |
| RECORDS | 纯文本记录清单,每行一个记录名,批量处理入口(§2.7) |
| Event 1/2/3 | 本届三赛道:闭源/开源 Java/隐藏集×速度 |
| Set A/B/C/D | 训练 1000/公开测试 500/隐藏测试 500/未发布的手机采集补充集 |
| Group 1/2/3 | 质量三分组:可接受/不确定/不可接受 |
| indeterminate | 专刊口径的"不确定"判定(267 条口径,坑 5) |
| 均值+否决票 | 聚合规则:均分 ≥0.70 且 ≤1 个 F 判可接受(§3.3) |
| ODC-BY 1.0 | Open Data Commons Attribution,数据库署名许可 |
| CC BY 3.0 | papers/ 目录论文许可 |
| mHealth | mobile Health,移动健康 |
| Sana | MIT 学生运营的开源移动远程医疗组织(sanamobile.org) |
| GSMA | 全球移动通信系统协会,本届奖金赞助方(§7.3) |
| 隐藏测试集 | 主办方私有、赛后不发布的评测数据(Set C) |
| preliminary entry | 2011-04-30(noon GMT)资格线 |
| 诊断带宽 | 0.05-100 Hz,保 ST 段与 QRS 细节的滤波器组 |
| 工频干扰 | 50/60 Hz 电源线混入,四类质量问题之一(§2.8) |
| 运动伪影 | 体动引入的低频漂移+肌电,四类之一 |
| 电极错位 | 电极位置偏离标准导联轴,形态学异常,四类之一 |
| 接触不良 | 皮肤-电极阻抗时变,基线突变/断零,四类之一 |
| DAIMS | 本库 AI-Ready 评估框架:可发现/可获取/可互操作/元数据/可持续(§6.4) |
| 双口径 | 同一事实的两个权威数字并存(本集两处:G2 占比、总量) |
| CinC 年链 | 库内 PhysioNet/CinC 挑战赛 2011-2023 条目序列(§9.1) |
附录 L:常见错误说法订正表
| 错误说法 | 订正 | 出处 |
|---|---|---|
| “2011 届是 ICU 假警报挑战” | 假警报是 2015 届;2011 届是手机 ECG 质量评估 | 坑 1 |
| “Set A 来自 MIMIC-II” | A/B/C 为专采新数据;MIMIC-II 属 2012 届 | 坑 2 |
| “这是手机采集的 ECG 数据集” | A/B/C 常规 ECG 机采集;手机是愿景与 sim/ 教具 | 坑 2 |
| “Set D 在 PhysioNet 可下载” | 宣布未兑现,无实物 | 坑 3 |
| "Computers in Cardiology Challenge"是官方名 | 官方名 Computing;Computers 是出版页眉 | 坑 4 |
| “约 1% 的记录质量不确定” | 挑战期口径 <1%;专刊口径 13.4%,先选口径 | 坑 5 |
| “2000 条全部可下载” | 公开 1500,Set C 隐藏 | 坑 6 |
| “sim/ 里是真实手机心电” | 合成教具,非真实非病人数据 | 坑 8 |
| “排行榜 accuracy 就是全集 accuracy” | 可裁决样本(G2 剔除)口径 | §4.3 |
| “0.932 的方法在真机上也是 0.932” | 真机 0.914;速度计价下 0.845 | §5.3/§5.4 |
附录 M:官方页区块存照(58,233 B 快照的骨架)
本次成稿核验用 curl 直抓官方页存档(58,233 字节),其信息区块与本条目章节的映射如下,供后续核验者按图索骥:
| 官方页区块 | 本条目对应章节 |
|---|---|
| 标题区(全称/v1.0.0/Published) | frontmatter/附录 C |
| Summary(任务一句话) | §0/§4.1 |
| Data Description(A/B/C 规格、来源) | §2 |
| Grading(字母评级、三分组) | §3 |
| Events 1-3 规则 | §4 |
| Timeline | §4.5/附录 F |
| Results 与 top-ten/top-scores | §5 |
| Set D 宣布段 | §7.5/坑 3 |
| License/Access Policy | §6.1/§6.4 |
| papers/ 与引用信息 | §6.2/附录 G |
存照声明:58,233 B 快照与 /challenge/2011/ 重定向后的 /content/challenge-2011/1.0.0/ 内容一致(坑 7);本条目全部硬数字可在上述区块复核。
附录 N:八坑核验记录
| 坑 | 核验方式 | 结论 |
|---|---|---|
| 1 主题证伪 | MIT LCP 挑战年表+库内 cinc-2015(487)+2011 官方页标题 | brief 说法不成立 |
| 2 非手机/非 MIMIC | 官方页数据来源说明+sources/+2012 届主题对照 | 双重误传,均证伪 |
| 3 Set D 未发布 | v1.0.0 文件列表+存档 Test Sets 页 | 承诺无实物 |
| 4 双拼写 | 挑战官方名 vs 论文页眉对照 | 两套拼写并存,各守其位 |
| 5 G2 双口径 | 官方页 Grading 节 vs IOP 33(9) E01 导言 | <1% 与 13.4% 并存,裁决规则不同 |
| 6 2000/1500 | 官方文件列表 vs IOP 导言账本 | 公开 1500,全集 2000 |
| 7 重定向/反爬 | curl 对照 /challenge/2011/ 与 /content/ 路径 | 302 同页(58,233 B 一致) |
| 8 sim 合成 | 官方页 sim 说明+文件时间戳 2011-02-16 | 合成教具,不入真实池 |
附录 O:三源文献速览
| 源 | 角色 | 定位 |
|---|---|---|
| 官方数据集页 physionet.org/content/challenge-2011/1.0.0/(58,233 B 存档) | 第一事实源 | 全称/规格/Grading/Event 规则/时间线/license 全在此 |
| 总结论文 Silva, Moody, Celi. Computers in Cardiology 2011;38:273-276 | 赛果互证源 | 49 队、accuracy 带 89-93%/80-91%、参考手机 <2 秒 |
| IOP 专刊导言 Physiological Measurement 33(9) E01(2012-09) | 最终金标准账本 | 8,327 评分、1,733+267、总量 2000 |
三源分工一句话:官方页管"规则与规格",总结论文管"赛果",专刊管"最终账本"——三源一致的数字(如 A=1000/B=500)可直接引用;三源不一致处(G2 占比、总量口径)按坑 5/坑 6 双口径存照,不擅自裁决。
附录 P:本次成稿的核验方法存照
复现本条目核验过程的完整命令(2026-09-27 执行):
# 1. 官方页抓取(带浏览器 UA,绕开抓取器空响应;坑 7)
curl -sL -A "Mozilla/5.0" https://physionet.org/content/challenge-2011/1.0.0/ -o official_2011.html
# 存档字节数:58,233 B;/challenge/2011/ 302 重定向后与之一致
# 2. 库内 slug 查重(只读 SQL)
bash scripts/qf_psql.sh "SELECT rid, slug FROM ds WHERE slug LIKE 'cinc-%' ORDER BY slug;"
# 结果:2012-2023 共十环,无 cinc-2011,slug 可用
# 3. 成稿双闸门自检
python3.11 scripts/check_md.py writing/cinc-2011/cinc-2011_Wikipedia.md
python3.11 scripts/preflight_check.py writing/cinc-2011/cinc-2011_Wikipedia.md
# 通过标准:check_md 0 ERROR 0 WARN;preflight E1/E2/E3 零告警
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- cinc-2021 — 共享标签:生理信号 / 心电信号 / 挑战赛数据集 / 心血管疾病
- icentia11k — 共享标签:生理信号 / 心电信号 / 心血管疾病 / 可穿戴传感
- ltafdb — 共享标签:生理信号 / 心电信号 / 挑战赛数据集 / 心血管疾病
- cinc-2020 — 共享标签:生理信号 / 心电信号 / 挑战赛数据集 / 心血管疾病
- physionet-cinc-2017 — 共享标签:生理信号 / 心电信号 / 心血管疾病 / 可穿戴传感
- cinc-2014 — 共享标签:生理信号 / 心电信号 / 挑战赛数据集 / 心血管疾病
- cpsc — 共享标签:生理信号 / 心电信号 / 挑战赛数据集
- pulsedb — 共享标签:生理信号 / 心电信号 / 可穿戴传感
- mesa-sleep — 共享标签:生理信号 / 心血管疾病 / 可穿戴传感
- mimic-iv-ecg — 共享标签:生理信号 / 心电信号 / 心血管疾病
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

