信息速览

MDVR-KCL — 手机帕金森语音数据集 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | MDVR-KCL |
| 英文全称 | Mobile Device Voice Recordings at King’s College London (MDVR-KCL) from both early and advanced Parkinson’s disease patients and healthy controls |
| 别名/简称 | MDVR-KCL、KCL 手机帕金森语音、Zenodo record 2867216 |
| 疾病分类 | 帕金森病(ICD-11:8A00.00 帕金森病 / MA80.0 构音障碍) |
| SNOMED CT | 49049000 Parkinson’s disease / 87310007 Dysarthria(详见 §2.2) |
| 数据模态 | 手机通话语音(44.1 kHz WAV:朗读 + 自发对话) |
| AI 任务类型 | 帕金森病检测/早期筛查、严重度分级(H&Y 分期、UPDRS 言语条目)、语音生物标记物研究 |
| 样本总数 | 37 名受试者(16 PD + 21 HC);WAV 文件总条数官方未披露 |
| 数据大小 | 606.1 MB(606,144,431 字节,单 ZIP 包) |
| 数据格式 | WAV(PCM 16-bit、44.1 kHz 单声道) |
| 许可证 | CC BY 4.0(开放获取,允许商用,须署名) |
| 访问级别 | 开放获取(Zenodo 直接下载,无需注册或申请) |
| 语言 | 英语(eng) |
| 首发日期 | 2019-05-17(Zenodo 发布) |
| 最后更新 | 2020-01-24(元数据最后修改) |
| 发布机构 | Fraunhofer IAIS(Dept. NetMedia)& 伦敦国王学院(King’s College London) |
| 官方主页 | https://zenodo.org/records/2867216 |
| 下载地址 | https://zenodo.org/records/2867216/files/26_29_09_2017_KCL.zip |
| DOI | 10.5281/zenodo.2867216(版本)/ 10.5281/zenodo.2867215(概念) |
| 引用次数 | 无独立同行评审论文(官方引用 = Zenodo 数据集本身,Jaeger, Trivedi & Stadtschnitzer, 2019) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 开放获取与元数据规范是加分项;扣分项:37 人小队列、性别与标签强混淆、无官方划分、无独立论文 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、帕金森病言语障碍特征、临床任务定义)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(文件名标签解析、字段映射)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 Fraunhofer IAIS、伦敦国王学院、i-PROGNOSIS 项目联盟或 Zenodo 无任何商业利益关联。本页面不销售 MDVR-KCL 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。MDVR-KCL 以 CC BY 4.0 许可在 Zenodo 开放获取,下载无需注册或签署协议,但任何使用(包括商用)都必须注明原始出处并引用官方指定的 Zenodo 记录(Jaeger, Trivedi & Stadtschnitzer, 2019, DOI: 10.5281/zenodo.2867216)。语音本身具有生物特征识别属性,再分发时请继续遵守 CC BY 4.0 的署名要求与相关研究伦理规范。
§1 数据集概览
§1.0 30 秒速览
MDVR-KCL(Mobile Device Voice Recordings at King’s College London)是 Fraunhofer IAIS 与伦敦国王学院(KCL)在 EU H2020 i-PROGNOSIS 项目(grant 690494)资助下,于 2019 年 5 月发布在 Zenodo 的电话场景帕金森语音数据集。37 名受试者——16 名早晚期帕金森病患者与 21 名健康对照——于 2017 年 9 月 26 日至 29 日在伦敦 KCL Hospital(Denmark Hill)一间约 10 平方米、混响约 500 ms 的检查室里,用一部 Motorola Moto G4 手机向测试执行员拨打电话并完成朗读与自发对话任务;手机录制模块(i-PROGNOSIS 应用录制模块的独立版"Toggle Recording App")通过 on-hook/off-hook 通话信号自动触发,将麦克风信号以 44.1 kHz、16-bit WAV 直写 SD 卡——不是经过 GSM 压缩的通话流。
一句话概括:这是目前少有的以"真实打电话"情境采集、直录高质量麦克风信号、并以内嵌 H&Y 与 UPDRS 评分命名的公开 PD 语音语料,CC BY 4.0 全开放。
§1.1 摘要
MDVR-KCL 的官方全称是"Mobile Device Voice Recordings at King’s College London (MDVR-KCL) from both early and advanced Parkinson’s disease patients and healthy controls",由 Hagen Jaeger(Fraunhofer IAIS)、Dhaval Trivedi(KCL)与 Michael Stadtschnitzer(Fraunhofer IAIS)联合署名发布。数据集的定位非常清晰:为 i-PROGNOSIS 项目的"基于智能手机的帕金森早期检测"研究提供电话场景训练语料。
每位受试者的通话包含四个阶段:放松准备 → 拨打测试执行员电话(off-hook 信号触发录制)→ 朗读 “The North Wind and the Sun”(视状况加读一段 BNC 语料片段 “Tech. Engin. Computer applications in geography”)→ 自发对话(随机话题:景点、交通、个人兴趣)→ 告别挂断(on-hook 信号停止录制)。
标注采用专家听音评估:文件名内嵌 Hoehn & Yahr 分期、UPDRS II 第 5 条(言语)与 UPDRS III 第 18 条(言语)三项评分,健康对照同样被评分。数据集无独立同行评审论文——官方引用即 Zenodo 数据集记录本身;截至 2026-09,Zenodo 显示 6,402 次下载(4,022 次独立下载)、15,870 次浏览。
它在帕金森语音数据集版图中的位置:如果说 Sakar 2013(UCI)定义了"持续元音 + 手工特征"的第一代范式、PC-GITA 把语料扩展到多任务多说话人,那么 MDVR-KCL 代表的是"真实通信情境 + 连续语流"的第二代探索——它牺牲了规模(37 人),换取了采集情境的真实性与任务材料(自发对话)的临床相关性。对 2026 年的研究者,它的最佳角色不是主训练集,而是电话情境假设的验证场与跨库泛化的测试锚点。
§1.2 战略价值分析
- 电话场景的真实性:绝大多数 PD 语音集(如 PC-GITA、SAARBRÜCKEN VOICE DB)在安静实验室用专业麦克风录制;MDVR-KCL 模拟"患者在家打电话"的真实远程筛查情境,是电话语音 PD 检测研究中少数可直接对应的训练资源。
- 高质量直录信号:on-hook/off-hook 触发 + 麦克风信号直写 SD 卡,绕开了 GSM 语音编码(约 8 kHz 有效带宽)的失真,44.1 kHz 采样率保留了完整的声学细节——既接近真实信道情境,又不牺牲信号质量。
- 文件名即标签的零摩擦接入:H&Y 与两项 UPDRS 言语评分直接编入文件名,一行正则即可完成标签解析,非常适合快速原型与教学。
- CC BY 4.0 全开放:无需注册、无需申请、允许商用(须署名),是 PD 语音生态中许可最宽松的资源之一——对比 UASpeech 的学术申请制与 TORGO 的学术许可,落地门槛最低。
- 小而真实的基准价值:37 人队列注定不能刷 SOTA,但它是"远程语音 PD 筛查"产品逻辑的最小可行验证场,也是跨数据集泛化实验的理想外部测试集。
§1.3 横向对比
| 数据集 | 规模 | 采集信道 | 任务材料 | 许可 |
|---|---|---|---|---|
| MDVR-KCL | 37 人(16 PD + 21 HC) | 手机通话直录麦克风,44.1 kHz | 朗读(NWS、BNC)+ 自发对话 | CC BY 4.0 |
| Parkinsons-voice-uci(Sakar 2013) | 31 人(23 PD + 8 HC) | 实验室麦克风(土耳其语) | 持续元音 a/o/u | CC BY 4.0 |
| PC-GITA | 100 人(50 PD + 50 HC) | 实验室麦克风(西班牙语) | 元音、句子、朗读、DDK | 学术研究 |
| SAARBRÜCKEN VOICE DB | 73 人 | 实验室麦克风(德语) | 持续元音 /a/ | 学术申请 |
| UASpeech | 32 人(16 构音障碍) | 实验室麦克风 | 词表朗读 | 学术申请 |
| TORGO | 15 人(8 构音障碍 + 7 HC) | 实验室双麦克风 + EMA | 非词、句子、图像描述 | 学术许可 |
MDVR-KCL 的差异化定位在三处:唯一以电话拨打为核心情境(其余均为面对面录制)、唯一把自发对话作为系统任务段(多数 PD 语音集以持续元音为主——这正是它与 Sakar 2013 UCI 数据集最容易被混淆的地方)、以及唯一在文件名内嵌两项 UPDRS 言语条目 + H&Y 三重临床评分。
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 2017-09-26 至 09-29 | 在 KCL Hospital(Denmark Hill, London SE5 9RS)完成 37 名受试者的电话语音采集 |
| 2017-09 | 研究团队在德国神经病学学会会议报告 i-PROGNOSIS 语音采集进展(Zenodo DOI: 10.5281/zenodo.1199554) |
| 2018 | 语音采集方案在 DAGA 2018(DOI: 10.5281/zenodo.3678669)与 ITG 2018(DOI: 10.5281/zenodo.3678641)会议发表 |
| 2019-05-17 | MDVR-KCL 在 Zenodo 正式发布(版本 DOI: 10.5281/zenodo.2867216,概念 DOI: 10.5281/zenodo.2867215),CC BY 4.0 |
| 2020-01-24 | Zenodo 记录元数据最后修改(当前最新版本) |
| 2020 | Chethan et al. 报告基于该数据的 KNN 分类研究(13 特征 85%,优化 9 特征 98%) |
| 2021 | Toye & Kompalli 发表跨语音数据集分析(arXiv:2111.10207) |
| 2022 | 基于 16 名 PD 朗读任务的言语流利度研究(PubMed Central 收录)发表 |
| 2025 | medRxiv 预印本报告 CNN 基准:5 秒 log-mel 分段、73 条连续对话录音,84.7% 准确率 / 87.9% 灵敏度 / 89.4% 特异度(并披露了 37 人的性别构成) |
§1.5 典型 AI 应用场景
- 电话语音 PD 检测/早期筛查原型:以朗读 + 自发对话段训练二分类器,验证"打电话即可筛查"的产品逻辑;medRxiv 2025 的 CNN 基准(84.7% 准确率)提供了第一参照系。
- 严重度建模:文件名内嵌 H&Y 分期与 UPDRS II-5/III-18 评分,可做序数回归或分级任务,研究语音特征与病程严重度的映射。
- 自发语音生物标记物研究:自发对话段(景点、交通、兴趣等随机话题)是研究停顿模式、语流连贯性与言语不确定度的天然材料。
- 跨数据集泛化与信道鲁棒性测试:作为外部测试集评估实验室麦克风模型(在 PC-GITA 等数据上训练)迁移到电话信道的退化程度。
- 教学与快速原型:606.1 MB 单包、CC BY 4.0、一行正则解析标签——从下载到出第一个基线不超过一小时,是语音医学课程理想的练习数据集。
§2 医学背景
§2.1 ICD-11 疾病分类锚定
MDVR-KCL 围绕的核心疾病是帕金森病及其言语障碍表现,对应的 ICD-11 锚定如下:
| ICD-11 编码 | 中文名称 | 与本数据集的关系 |
|---|---|---|
| 8A00.00 | 帕金森病 | 16 名 PD 受试者的诊断锚点(含早期与晚期患者) |
| MA80.0 | 构音障碍 | PD 言语输出的核心症状类别,UPDRS 言语条目评估的对象 |
| 8A06.0 | 痴呆(路易体相关,供扩展研究参考) | 部分 PD 患者晚期可伴认知衰退,自发对话研究的相关背景 |
为什么帕金森病语音研究要同时锚定两个编码:帕金森病本体(8A00.00)定义"谁在说话",而构音障碍(MA80.0)定义"言语出了什么问题"——MDVR-KCL 的 UPDRS II-5/III-18 言语条目评分正是对后者严重度的量化。做严重度建模时,目标变量本质上是 MA80.0 维度的分级,而非 8A00.00 的有无;做检测任务时,两类编码共同构成病例组定义。这一区分直接决定了 §2.4 中"检测"与"分级"两类任务的不同标签语义。
§2.2 SNOMED CT 映射
| 概念 | SNOMED CT 编码 | 说明 |
|---|---|---|
| Parkinson’s disease(帕金森病) | 49049000 | 病例组入组诊断 |
| Dysarthria(构音障碍) | 87310007 | UPDRS 言语条目评估的临床表型 |
| Hoehn & Yahr staging(H&Y 分期) | 临床分期量表(评估性量表概念,非疾病编码) | 文件名 HYR 字段的评分体系 |
在使用 SNOMED CT 做语义互操作时,建议以 49049000 定义队列、以 87310007 检索言语表型相关文献;H&Y 分期作为观察性分期量表另行建模,不应与疾病编码混为一谈。
§2.3 疾病简介
帕金森病是以黑质多巴胺能神经元退行性丢失为核心的神经系统变性疾病,临床以静止性震颤、肌强直、运动迟缓与姿势平衡障碍为四大运动主征。言语系统受累在文献中被称为运动减少型构音障碍(hypokinetic dysarthria),其典型声学与发音特征包括:
- 音量降低(hypophonia):发声强度不足,患者常自感"声音变小了",是家属最早注意到的主诉之一;
- 单音调与单音量(monopitch / monoloudness):基频与强度调节范围收窄,韵律平板化;
- 发音模糊(imprecise articulation):构音器官运动幅度与速度下降,辅音清晰度降低;
- 语速异常与停顿模式改变:可有语速加快(hurried speech)或不恰当停顿,自发语流中尤为明显。
文献普遍报道,随着病程进展,帕金森病患者中出现可感知言语障碍的比例很高——多数患者在病程中会经历不同程度的言语功能下降。正因如此,语音被视为帕金森病进展监测与远程筛查的候选数字生物标记物载体:它采集无创、可在家庭场景完成、且智能手机麦克风即可捕获。MDVR-KCL 的设计——“患者在家/诊室拨打电话即可完成采集”——正是对这一远程筛查假设的直接工程实现。
PD 语音的声学特征谱系(也是解读本数据集模型行为的钥匙):
| 特征域 | 代表参数 | PD 言语中的典型表现 | 在 MDVR-KCL 中的可得性 |
|---|---|---|---|
| 频率扰动 | Jitter(基频周期扰动) | 声带振动不稳定性上升 | 可从元音段直接估计 |
| 振幅扰动 | Shimmer(振幅扰动) | 声强控制不稳 | 可从元音段直接估计 |
| 声学噪声比 | HNR / NHR | 噪声成分占比升高 | 可直接估计 |
| 基频动态 | F0 均值/范围/变异 | 单音调(范围收窄) | 可估计;但与性别强混淆 |
| 韵律与停顿 | 语速、停顿率、停顿时长 | 停顿模式异常、语流平板化 | 连续语流段(尤其自发对话)最富信息 |
| 发音清晰度 | 辅音能量、共振峰位移 | 辅音模糊、共振峰空间收缩 | 需 44.1 kHz 高频信息(勿过早降采样) |
| 时域不稳定 | 语速波动、重复/迟疑 | 运动减少型语流特征 | 自发对话段特有 |
这份谱系解释了 MDVR-KCL 的两个设计选择:其一,44.1 kHz 采样率为辅音高频特征保留了完整信息(坑点 1 的技术根源);其二,自发对话段为韵律/停顿类特征提供了唯一素材——这是它与元音范式数据集(如 Sakar 2013 UCI)科学价值上的核心差异。
§2.4 临床任务定义
MDVR-KCL 支撑的核心 AI 任务分两层:
任务一:帕金森病检测(二分类)。输入受试者的电话语音(朗读段或自发对话段),输出 PD/HC 标签。文件名 HS 字段(pd / hc)即标签。这是该数据集文献中最常见的任务口径,对应"远程语音筛查"的产品假设:如果一段几分钟的电话录音足以提示帕金森风险,筛查成本将从专科门诊降至一通电话。注意 PD 组含早期与晚期患者——官方描述明确"both early and advanced",因此该二分类不是"晚期帕金森识别"任务,早期患者的语音差异可能微妙得多。
任务二:严重度分级/回归(序数任务)。以文件名内嵌的 H&Y 分期(HYR 字段)、UPDRS II 第 5 条(言语,日常生活自评)与 UPDRS III 第 18 条(言语,检查者评估)为目标变量,建模"语音 → 临床严重度"映射。关键细节:健康对照也被同样评分——数据集中有 HC 获得 UPDRS 言语条目 1 分(如 ID31),也有部分 PD 文件言语条目为 0 分,因此临床评分不是 PD 标签的确定性函数,两类任务(检测与分级)的标签语义不可互换(详见 §6.5 坑点 6)。
两类任务的信息流对比:
检测任务(二分类): WAV → 声学特征/表征 → 分类器 → {pd, hc}
标签源:文件名 HS 段
分级任务(序数/回归):WAV → 声学特征/表征 → 回归器 → H&Y(0-5)
→ UPDRS II-5(0-4)
→ UPDRS III-18(0-4)
标签源:文件名 HYR/UPDRS 段
工程含义:检测任务的评估集可以只含全部 37 人;分级任务的模型输入最好同时覆盖 PD 与 HC(HC 的 0 分与亚临床 1 分是量表低端的真实锚点,把它们排除会让回归器在低分段失去监督信号)。
§2.5 患者人群特征
- 构成:37 名受试者 = 16 名帕金森病患者 + 21 名健康对照;官方描述明确覆盖早期与晚期 PD。
- 性别构成:PD 组 5 女 11 男,HC 组 19 女 2 男(此细分来自 2025 年 medRxiv 预印本论文的二手披露,Zenodo 官方元数据未逐项列出)。PD 与 HC 的性别分布几乎相反——这构成数据集最尖锐的混淆变量(详见 §6.5 坑点 2)。
- 年龄分布:官方元数据未披露,引用文献亦无系统报告;使用时请勿假设两组年龄匹配。
- 语言与地域:全体受试者在伦敦完成采集,英语朗读与自发对话;口音构成官方未披露。
- 病程覆盖:官方定位"early and advanced"双覆盖,但每例的具体病程、用药状态(开/关期)官方元数据未逐项披露。
§2.6 金标准/参考标准
MDVR-KCL 的"标签金标准"是专家听音评估的临床量表评分,而非仪器测量:
- Hoehn & Yahr 分期:PD 进程的经典五级(0-5)运动分期,文件名 HYR 字段;
- UPDRS II 第 5 条(言语):日常生活自评维度中的言语清晰度条目,0(正常)-4(完全无法理解);
- UPDRS III 第 18 条(言语):运动检查维度中的言语条目,同为 0-4 分制,由检查者现场评估。
三项评分以"专家听音/临床评估"方式产生,直接编入文件名。需要明确的方法学边界:官方元数据未披露评分者人数、评分者间信度(如加权 kappa)与评估时点细节,这些是使用 UPDRS 标签做回归/分级时必须声明的局限(详见 §7.2)。相对而言,PD/HC 二分类标签的可靠性取决于临床诊断本身,官方未披露具体诊断标准(如 MDS 运动症状标准),引用时应保持"由 KCL 临床团队入组"的表述而非过度演绎。
两个言语条目的语义差异(做严重度建模前必须理解):
| 条目 | 量表维度 | 评估视角 | 分数含义 |
|---|---|---|---|
| UPDRS II 第 5 条 | 日常生活经验(自评) | 患者主观感受 | “他人的声音大到别人能听懂吗”——受自我感知与生活场景影响 |
| UPDRS III 第 18 条 | 运动检查(他评) | 检查者现场评估 | 检查者听到的言语清晰度/音量/韵律——更接近"客观"声学表现 |
两者相关性高但不等同:自评条目受病感缺失(anosognosia,PD 患者并不罕见)与情境适应影响,他评条目更贴近声学测量。回归建模时可做双目标联合训练,用两条目预测差值研究"自我感知偏差"——这是本数据集文件名设计意外支持的一个有趣研究角度。H&Y 分期则与言语条目量纲不同:它是全身运动进程的总分期,言语只是其观测窗口之一,故 H&Y 预测难度高于言语条目预测。
§3 数据集规格
§3.0 版本抉择矩阵
MDVR-KCL 在 Zenodo 采用"概念 DOI + 版本 DOI"双轨发布,但实际只有一个数据版本:
| 引用对象 | DOI | 发布/修改时间 | 使用建议 |
|---|---|---|---|
| 版本 DOI(推荐) | 10.5281/zenodo.2867216 | 2019-05-17 发布,2020-01-24 元数据最后修改 | 论文引用、复现实验一律用它——指向你实际下载的确切版本 |
| 概念 DOI | 10.5281/zenodo.2867215 | 自动聚合所有版本 | 仅在希望"永远指向最新版"的场景使用(如项目主页链接) |
版本抉择要点:数据本体自 2019-05-17 后未再更新(2020-01-24 仅修改元数据),因此"版本漂移"风险接近零;但 Zenodo 记录的统计口径(下载量等)随时间变化,引用时务必注明"截至"时间点(本页面口径:截至 2026-09)。
§3.1 模态详细说明
单一模态——手机通话语音,但有三层技术细节必须区分:
- 物理信号:Motorola Moto G4 手机内置麦克风拾音,直录信号经 Toggle Recording App 以 44.1 kHz、16-bit PCM 写入 WAV 文件。这是"手机作为录音笔"的信号,保真度高。
- 通话上下文:受试者处于真实拨号通话中(对端是测试执行员),on-hook/off-hook 状态作为录制的启停触发器。说话人知道"在打电话",其语音风格(响度策略、语流习惯)贴近真实远程通话,但传输信道不经过电话网络压缩。
- 房间声学:录音地点是 KCL Hospital 一间约 10 平方米、混响时间约 500 ms 的检查室——接近居家/诊室场景,但不是安静声学室。
这三层叠加的结果是:MDVR-KCL 的信号质量接近实验室录音,而情境特征(通话心理状态、任务流程、房间混响)接近真实远程筛查。研究"信道退化"(GSM 编码影响)的论文不能用本数据集直接模拟,须自行叠加信道失真(见 §6.3)。
§3.2 样本量拆分
- 受试者层:37 人,编号 ID00-ID36(从 ID00 起始——ID02 是第三位受试者,解析时勿按 ID01 起始误算);
- 诊断分组:PD 16 人(5 女 11 男)、HC 21 人(19 女 2 男),性别细分来自 medRxiv 2025 二手来源(官方 Zenodo 元数据未逐项列出);
- 文件层:每位受试者一次通话产生一条连续 WAV(从 off-hook 到 on-hook),朗读与对话段嵌于其中;WAV 文件总条数官方未披露——一条通话一个文件还是分段多个文件,需解压后自行核对;
- 任务段:每条通话内含 4 类内容段——放松/准备段、朗读 “The North Wind and the Sun”、(视受试者状况)BNC 片段朗读、自发对话段;并非每位受试者都有 BNC 段。
统计口径警示:文献中的"样本数"有三种口径——受试者数(37)、通话文件数(官方未披露)与"分段实例数"(如 medRxiv 2025 用 5 秒滑窗从 73 条连续对话录音切出实例)。跨论文比较数字时先对齐口径,否则 84.7% 与 98% 这类数字根本没有可比性(详见 §8.1)。
受试者构成汇总表:
| 维度 | PD 组 | HC 组 | 全体 |
|---|---|---|---|
| 人数 | 16 | 21 | 37 |
| 女性 | 5 | 19 | 24 |
| 男性 | 11 | 2 | 13 |
| 病程覆盖 | 早期 + 晚期(官方描述) | — | — |
| 会话数 | 每人 1 次 | 每人 1 次 | 37 次 |
| 编号区间 | ID00-ID36 中的 16 个 | 其余 21 个 | ID00-ID36 |
数字一致性自检:16 + 21 = 37 ✓;5 + 11 = 16 ✓;19 + 2 = 21 ✓。性别构成行来自 medRxiv 2025 二手披露——若你的解压结果显示不同分布(例如某些文件名前缀有变体),请以数据实物为准并在使用报告中说明差异。
§3.3 数据格式详情
| 属性 | 值 |
|---|---|
| 容器 | WAV(Microsoft RIFF) |
| 采样格式 | PCM 16-bit |
| 采样率 | 44.1 kHz |
| 声道 | 单声道 |
| 写入方式 | 录音期间直写手机 SD 卡(非通话流转录) |
| 触发机制 | on-hook(挂断停止)/ off-hook(摘机开始)通话状态信号 |
| 打包 | 26_29_09_2017_KCL.zip,606.1 MB(606,144,431 字节) |
| MD5 | 98c51bdd2b092b93f8bb038dea4505fa |
文件命名模式:SI_HS_HYR_UPDRSII-5_UPDRSIII-18,五段下划线分隔,例如 ID02_pd_1_2_1.wav 表示:受试者 ID02(第三位,ID 从 00 起)、健康状态 pd(帕金森病)、H&Y 分期 1、UPDRS II-5 得分 2、UPDRS III-18 得分 1。完整字段解析见 §4.1。
§3.4 存储大小
官方分发包为单个 ZIP:606.1 MB(606,144,431 字节),MD5 如上。按 16-bit、44.1 kHz 单声道计算,未压缩音频约 88.2 KB/秒,606 MB 对应约 1.9 小时纯音频(ZIP 内 WAV 通常不再压缩)——即 37 人人均约 3 分钟通话素材,这与"一段电话对话"的采集设计吻合(此为基于字节量的推算,非官方披露)。本地预留 1 GB 磁盘(含解压缓冲)即可,无需 GPU 存储规划;云端单节点下载到实验实例通常一分钟内完成。
§3.5 标注方式
标注为专家听音评估的临床量表,非人工转写、非声学自动分析:
| 标注项 | 取值域 | 评估对象 | 文件名字段 |
|---|---|---|---|
| Hoehn & Yahr 分期 | 0-5(0 常用于健康/无症状) | PD 运动病程总体分期 | HYR |
| UPDRS II 第 5 条 | 0-4 | 言语(日常生活自评维度) | UPDRSII-5 |
| UPDRS III 第 18 条 | 0-4 | 言语(运动检查维度) | UPDRSIII-18 |
| 健康状态 | pd / hc | 临床诊断分组 | HS |
三个关键标注事实:① 健康对照同样被评分(HC 的 H&Y 常记 0,但 UPDRS 言语条目可非零——ID31 即 HC 带 UPDRS 1 分);② PD 组也可有 0 分言语条目(部分 PD 文件 UPDRS 为 0),评分反映的是"言语症状严重度"而非诊断;③ 评分嵌入文件名意味着重命名文件会摧毁标签——任何预处理流程必须先解析后重命名(详见 §6.5 坑点 3)。
标注传递链的可靠性分析:评分由临床评估产生 → 编码进文件名 → 随 WAV 一起分发。这条链没有独立的机器可读标注文件,好处是标注与音频"原子绑定"、永不脱钩;代价是标注缺少结构化载体——没有评分日期、评分者 ID 等溯源字段,也无法表达"某文件未评分"这类状态(缺失即无文件名段可解析)。这是"文件名即数据库"范式的典型取舍:接入零摩擦,溯源能力受限。
§3.6 标注者资质
官方 Zenodo 描述将评分归属为研究团队的专家听音/临床评估,KCL 方作者(Dhaval Trivedi)所在机构承担受试者临床评估环节。以下细节官方未披露:评分者人数、是否多人独立评分、评分者间信度指标、评估与录音是否同日。使用 UPDRS/H&Y 标签做回归或分级时,应在论文方法学部分如实声明"single-rater clinical scores, inter-rater reliability not disclosed"。
§3.7 数据采集时间范围
2017-09-26 至 2017-09-29,共四天密集采集。全部受试者在同一时间窗内完成单次会话——无跨日重测、无纵向随访,这意味着数据集天然不支持疾病进展建模,也不存在"同一患者多次会话泄漏"问题(泄漏风险集中在受试者层,见 §5.3)。
§3.8 地理覆盖
英国伦敦,King’s College Hospital(Denmark Hill, London SE5 9RS)。录音房间为约 10 平方米检查室,混响时间约 500 ms。单中心、单房间是数据集的声学指纹——分类器可能学到房间混响特征而非 PD 语音特征(详见 §6.5 坑点 5)。
§3.9 采集设备规格
| 组件 | 规格 |
|---|---|
| 手机 | Motorola Moto G4(2016 年安卓机型) |
| 录制软件 | Toggle Recording App——EU i-PROGNOSIS 项目应用录制模块的独立发布版 |
| 触发信号 | 通话状态 on-hook / off-hook(电话摘机开始录制、挂机停止) |
| 音频规格 | 44.1 kHz、16-bit、单声道 WAV,直写 SD 卡 |
| 信号路径 | 手机内置麦克风直录——非 GSM/VoIP 压缩通话流 |
| 声学环境 | 约 10 平方米检查室,混响约 500 ms |
| 通话对端 | 测试执行员(负责引导流程与自发对话话题) |
单一机型、单一麦克风是双刃剑:设备间变异被消除(利于同集内比较),但模型对"其他手机型号"的泛化无任何数据支撑(见 §7.3)。
§3.10 深度溯源链
完整的资源溯源链条如下,每一环均有可核验的公开锚点:
EU H2020 i-PROGNOSIS 项目(grant agreement 690494)
"Intelligent Parkinson eaRly detection
Guiding NOvel Supportive InterventionS"(H2020-EU.3.1.)
│ 资助:Fraunhofer IAIS(语音采集与分析侧)+ KCL(临床与受试者侧)
▼
伦理审批:London - Dulwich Research Ethics Committee(REC 17/LO/0909;
该批号披露于 2025 年 medRxiv 论文的伦理声明,属二手来源)
│
▼
2017-09-26/29 采集:37 名受试者 × Motorola Moto G4 × KCL Hospital
│
▼
2019-05-17 Zenodo 发布:DOI 10.5281/zenodo.2867216(版本)
/ 10.5281/zenodo.2867215(概念),CC BY 4.0,Hagen Jaeger、
Dhaval Trivedi、Michael Stadtschnitzer 署名
引用链规范:引用数据集用 Zenodo 记录;引用采集方法学用 i-PROGNOSIS 会议论文(DAGA 2018 / ITG 2018);引用项目背景用 i-PROGNOSIS 官网。
§4 数据结构详解
§4.0 目录结构预览
官方 Zenodo 记录提供单个 ZIP 包(26_29_09_2017_KCL.zip),内含按文件名编码规则的 WAV 集合。以下为基于官方命名描述的组织示意(非官方逐文件清单,具体以解压结果为准):
26_29_09_2017_KCL.zip
└── 26_29_09_2017_KCL/
├── ID00_hc_0_0_0.wav # 受试者 ID00:健康对照,H&Y 0,UPDRS 言语条目 0/0
├── ID01_hc_0_0_0.wav # ……以此类推,编号从 00 起
├── ID02_pd_1_2_1.wav # 官方示例:第三位受试者,PD,H&Y 1,UPDRS II-5=2,III-18=1
├── ...
├── ID31_hc_0_1_?.wav # ID31:健康对照,但 UPDRS 言语条目带 1 分(非零 HC 评分实例)
├── ...
└── ID36_*.wav # 末位受试者
三个结构要点:① 文件按受试者编号扁平排列,无子目录分层;② 文件名五段即完整标注(无需伴随 CSV/JSON 清单);③ 示意中的具体数值以实际文件名为准——? 表示该段取值需解压核对,切勿在未核对前写进实验代码。
§4.1 DAIMS 标准化字段描述表
文件名是本数据集的核心元数据载体。按 DAIMS 字段字典规范,五段字段的完整解析如下:
| 字段槽位 | DAIMS 字段名 | 类型 | 取值域 | 示例(ID02_pd_1_2_1) | 语义 |
|---|---|---|---|---|---|
| 第 1 段 SI | participant_id | string | ID00-ID36 | ID02 |
受试者唯一编号,从 00 起始 |
| 第 2 段 HS | health_status | categorical | pd / hc | pd |
诊断分组:帕金森病 / 健康对照 |
| 第 3 段 HYR | hy_stage | ordinal | 0-5 | 1 |
Hoehn & Yahr 分期(专家评估) |
| 第 4 段 | updrs_ii_item5 | ordinal | 0-4 | 2 |
UPDRS part II 第 5 条:言语(自评维度) |
| 第 5 段 | updrs_iii_item18 | ordinal | 0-4 | 1 |
UPDRS part III 第 18 条:言语(检查者评估) |
一行正则完成解析(Python 示例):
import re
PAT = re.compile(
r"^(ID\d{2})_(pd|hc)_(\d)_(\d)_(\d)\.wav$"
)
def parse_name(fname: str) -> dict:
m = PAT.match(fname)
if not m:
raise ValueError(f"unparseable filename: {fname}")
sid, hs, hy, up2, up3 = m.groups()
return {
"participant_id": sid,
"health_status": hs,
"hy_stage": int(hy),
"updrs_ii_item5": int(up2),
"updrs_iii_item18": int(up3),
}
解析防御清单:① 确认 ID 起始为 00(ID02 是第三位受试者);② 保留原始文件名到处理日志,防止重命名后标签丢失;③ HYR 段对 HC 通常为 0,但请以实际文件为准、勿硬编码假设;④ UPDRS 段的 0 分不一定等于"没有言语问题"——评分语义见 §3.5。
§4.2 标签分布统计
- 诊断分组:PD 16(43.2%)vs HC 21(56.8%)——轻度不平衡(约 1:1.3),多数场景可直接用类别加权处理。
- 性别×诊断交叉(medRxiv 2025 二手披露):PD = 5 女 + 11 男,HC = 19 女 + 2 男。性别边缘分布与标签高度相关(卡方意义下强关联):全库 24/37 为女性,其中 19 名女性是 HC;11/16 的 PD 是男性。任何"看似 84% 的准确率"都可能只是学会了分性别(详见 §6.5 坑点 2)。
| 组别 | 人数 | 女性 | 男性 | 女性占比 |
|---|---|---|---|---|
| PD | 16 | 5 | 11 | 31.3% |
| HC | 21 | 19 | 2 | 90.5% |
| 全体 | 37 | 24 | 13 | 64.9% |
直观理解这个混淆的强度:在本数据集上,一个"只看基频猜性别,女性判 HC、男性判 PD"的朴素分类器就能拿到远高于随机水平的表面准确率——这正是坑点 2 要求分性别报告指标的原因。
- UPDRS/H&Y 分布:官方未披露逐例分布;已知孤立事实——ID31(HC)UPDRS 言语条目 1 分、部分 PD 文件言语条目 0 分。这意味着 H&Y 与 UPDRS 字段的取值分布必须解压后自行统计,任何论文中的"平均 H&Y"口径都无法被官方元数据直接支撑。
§4.3 关键字段描述性统计
官方元数据未提供逐文件统计表,以下为可从官方描述与命名规则确定推导的事实:
| 统计项 | 值 | 来源性质 |
|---|---|---|
| 受试者数 | 37 | 官方披露 |
| PD/HC 划分 | 16 / 21 | 官方披露 |
| H&Y 覆盖范围 | 双早期与晚期(具体逐例分布未披露) | 官方描述性声明 |
| HC 的 UPDRS | 可非零(ID31 = 1 分实例) | 官方描述性声明 |
| PD 的 UPDRS | 可为 0(部分文件实例) | 官方描述性声明 |
| WAV 条数 / 总时长 | 未披露(字节量推算约 1.9 小时,见 §3.4) | 推算 |
§4.4 数据层级关系
MDVR-KCL 的数据层级只有两级,极其简单——但每级的语义都要清楚:
受试者层(37 名,ID00-ID36,PD/HC + H&Y + UPDRS 标签挂在此层)
└── 通话层(每受试者一次通话;off-hook 起录,on-hook 停止)
├── 放松/准备段
├── 朗读段 1:The North Wind and the Sun(全员)
├── 朗读段 2:BNC 片段(视受试者状况,非全员)
└── 自发对话段:随机话题(景点 / 交通 / 个人兴趣)
关键含义:标签挂在受试者层(一人一套评分),音频内容分层嵌于通话内。若把一条通话切分为多个实例(如 5 秒滑窗),同一受试者的所有实例共享同一套标签——划分数据集时必须按受试者分组(见 §5.2),否则标签在训练/测试集间双重出现即为泄漏。
§4.5 缺失值情况
- 结构缺失:BNC 朗读段非全员覆盖(官方描述"视状况"执行),自发对话段的话题组合逐人随机——做"按任务段分层分析"时,BNC 段子集存在受试者维度的非随机缺失。
- 标注缺失:官方未披露任何"未评分文件";假设 37 人全套评分可用,但解压后仍应逐文件核对文件名五段完整性。
- 元数据缺失:年龄、病程、用药状态、每例录音时长、精确文件条数——这些字段官方一律未披露,是本数据集元数据层面的主要空洞(详见 §7.7 DAIMS 第 11 项与 §7.1 偏倚讨论)。
结构缺失的健壮性核查脚本(跑一次即可摸清家底):
import collections, soundfile as sf, pathlib
files = sorted(pathlib.Path("mdvr_kcl").rglob("*.wav"))
per_spk = collections.Counter()
durations = {}
for p in files:
sid = p.name.split("_")[0]
per_spk[sid] += 1
durations[p.name] = sf.info(p).duration
print("total files:", len(files)) # 摸清官方未披露的总量
print("files per speaker:", collections.Counter(per_spk.values())) # 每人文件数分布
print("total hours:", sum(durations.values()) / 3600)
short = {k: v for k, v in durations.items() if v < 10}
print("suspiciously short (<10 s):", short) # 排查录音失败的残留文件
把 total files 与 total hours 写进你的实验记录——它们是官方元数据缺失、而任何复现都必须对齐的两个基础口径。
§5 数据划分与使用建议
§5.1 官方数据划分
无。Zenodo 记录只提供音频与文件名标注,不含任何 train/val/test 划分文件、划分协议或基准配置。37 人的规模也使任何"官方划分"失去统计意义——社区文献各自采用随机划分、交叉验证或自定义切分,结果间不可直接比较(见 §8.3)。
§5.2 推荐划分策略
第一原则:说话人独立(speaker-independent)。同一受试者的任何音频实例不得同时出现在训练与评估集合。推荐两套配置:
- 配置 A:GroupKFold(5) 说话人分组交叉验证——37 人分 5 折,每折约 7-8 人;用
participant_id做 group 键。优点是全部数据参与评估、方差可估;注意每折内 PD/HC 比例会波动,可在分组前按诊断分层排序后再分折(分层 + 分组的混合策略)。 - 配置 B:留一说话人(LOSO)——37 折交叉验证,适合小样本下最大化评估稳定性;代价是计算量与"逐折类别不平衡"波动。
- 不推荐:随机按文件/分段划分(几乎必然说话人泄漏);按 70/30 一次切分(37 人的 30% 只有 11 人,评估方差过大,且 PD 子集可能只剩 4-5 人)。
两套推荐配置的对照:
| 维度 | GroupKFold(5) | LOSO(留一说话人) |
|---|---|---|
| 折数 | 5 | 37 |
| 每折评估人数 | 7-8 人 | 1 人 |
| 每折类别风险 | PD/HC 比例波动可控 | 单折内只剩 0-1 个 PD,指标退化 |
| 计算成本 | 低 | 37 次训练 |
| 方差估计 | 折间标准差(较稳定) | 逐折配对(噪声大但信息细) |
| 推荐场景 | 论文主报告 | 稳健性附录 / SSL 探针 |
实践建议:主报告用 GroupKFold(5)(固定 random_state 并发布折索引),附录补 LOSO 佐证——两者结论一致时论证力最强。
性别平衡的第二原则:鉴于性别与标签强混淆(§4.2),建议同时报告两种口径——全量划分口径,与"性别分层评估"口径(分别报告男女亚组的灵敏度/特异度)。若资源允许,可做"性别留出"压力测试(训练集男性 PD + 女性 HC,测试反向)以量化性别捷径依赖。
§5.3 数据泄漏风险防御
本数据集的泄漏面集中在三处:
- 说话人泄漏(最致命):同一 ID 的分段实例分属训练/测试。防御:一切划分以
participant_id为 group 键,划分后断言 ID 集合零交集。 - 分段内容泄漏:朗读段(“The North Wind and the Sun” 是跨数据集通用朗读文本,也出现在其他语音语料中)与对话段的声学差异本身可能被模型利用。若训练用朗读段、测试用对话段,是任务漂移而非泄漏;若同段类型跨集出现但按 ID 分组,已由第 1 条防御覆盖。
- 特征工程泄漏:从全量数据统计归一化参数(均值/方差)再切分,会把测试分布信息泄入训练。防御:归一化参数只在训练折内统计。
§5.4 交叉验证建议
- 主报告:GroupKFold(5) 或 LOSO 的均值 ± 标准差,指标用 accuracy、sensitivity、specificity 三件套(PD 检测文献惯例),并附每折混淆矩阵。
- 严重度任务:UPDRS/H&Y 回归报告 MAE 与 RMSE;序数分级报告加权 kappa。注意 HC 也带评分(ID31 实例),严重度模型的评估集应同时含 PD 与 HC,勿只评估 PD 子集。
- 显著性检验:37 人样本下,任何两模型 2-3 个百分点的差异几乎必然落在随机波动内;建议用置换检验(permutation test)或报告逐折配对差值的置信区间,避免"刷点式"结论。
§5.5 外部验证
MDVR-KCL 作为小型单中心数据集,其结论的外部效度只能靠跨数据集检验建立。可行的外部验证方向:
| 外部数据集 | 验证方向 | 信道差异要点 |
|---|---|---|
| PC-GITA | 朗读 + 元音 PD 检测的跨语言迁移(西班牙语) | 实验室麦克风 → 电话情境;跨语言声学漂移 |
| Sakar 2013 UCI | 持续元音任务对照(土耳其语) | 元音稳态段 vs MDVR-KCL 连续语流的特征域差异 |
| SAARBRÜCKEN VOICE DB | 元音 /a/ 检测的信道鲁棒性(德语) | 实验室录音 vs 手机直录 |
| UASpeech / TORGO | 构音障碍谱系参照(非 PD 特异) | 任务定义不同,适合做特征共性分析而非直接迁移 |
跨数据集验证的正确姿势:在 MDVR-KCL 训练、在上述数据集测试(或反向),报告性能衰减幅度;任何"跨库高精度"结论都应检查是否存在朗读文本重叠(The North Wind and the Sun 在语音学界使用极广)与说话人重叠(几乎可排除,但值得声明)。
§6 AI 就绪指南
§6.0 云端快速启动
在 Google Colab / Kaggle 等云端笔记本中,从下载到听到第一条 PD 语音不超过五分钟:
# Colab:下载 + 校验 + 试听
import urllib.request, hashlib
URL = "https://zenodo.org/records/2867216/files/26_29_09_2017_KCL.zip"
urllib.request.urlretrieve(URL, "26_29_09_2017_KCL.zip")
md5 = hashlib.md5(open("26_29_09_2017_KCL.zip", "rb").read()).hexdigest()
assert md5 == "98c51bdd2b092b93f8bb038dea4505fa", "MD5 mismatch!"
print("download verified:", md5)
# 解压并解析全部文件名标签
import zipfile, re, pandas as pd
zipfile.ZipFile("26_29_09_2017_KCL.zip").extractall("mdvr_kcl")
PAT = re.compile(r"^(ID\d{2})_(pd|hc)_(\d)_(\d)_(\d)\.wav$")
rows = []
import pathlib
for p in sorted(pathlib.Path("mdvr_kcl").rglob("*.wav")):
m = PAT.match(p.name)
if m:
sid, hs, hy, u2, u3 = m.groups()
rows.append({"file": p.name, "path": str(p), "participant_id": sid,
"health_status": hs, "hy_stage": int(hy),
"updrs_ii_item5": int(u2), "updrs_iii_item18": int(u3)})
df = pd.DataFrame(rows)
print(df["health_status"].value_counts()) # 预期 pd=16, hc=21(按文件口径核对)
print(df["participant_id"].nunique(), "speakers") # 预期 37
云上检查点:① MD5 断言必须通过(606.1 MB,一分钟内);② participant_id 去重后应为 37——若不是 37,说明存在无法解析的文件名变体,先打印出来人工核对再继续;③ 文件数 ≥ 37(每受试者至少一条通话)。
§6.1 快速上手(本地加载与波形检视)
# 依赖:pip install soundfile librosa matplotlib
import soundfile as sf
import librosa, numpy as np
import matplotlib.pyplot as plt
wav_path = "mdvr_kcl/26_29_09_2017_KCL/ID02_pd_1_2_1.wav"
y, sr = librosa.load(wav_path, sr=None) # sr=None 保留原生 44.1 kHz
info = sf.info(wav_path)
print(info) # 核对采样率/位深/时长/声道
# 波形 + 语谱图
fig, ax = plt.subplots(2, 1, figsize=(12, 6))
ax[0].plot(np.linspace(0, len(y)/sr, len(y)), y, lw=0.3)
ax[0].set_title("ID02_pd_1_2_1.wav (PD, H&Y=1, UPDRS II-5=2, III-18=1)")
S = librosa.amplitude_to_db(np.abs(librosa.stft(y[:sr*60])), ref=np.max)
librosa.display.specshow(S, sr=sr, x_axis="time", y_axis="hz", ax=ax[1])
plt.tight_layout(); plt.show()
本地观察建议:对照听一条 PD(如 ID02)与一条 HC 的同任务段,重点感受音量波动与停顿模式;这种"人耳先校准"的习惯能帮你在后续特征工程中快速判断模型是否学到了真信号。
§6.2 数据获取流程
- 访问 Zenodo 记录页
https://zenodo.org/records/2867216; - 点击
26_29_09_2017_KCL.zip直接下载——无需注册、无需申请、无需签署协议(CC BY 4.0 开放获取); - 校验 MD5:
md5sum 26_29_09_2017_KCL.zip,应得98c51bdd2b092b93f8bb038dea4505fa; - 解压,按 §4.1 解析文件名建立标签表;
- 在论文/产品中署名引用:Jaeger, H., Trivedi, D., & Stadtschnitzer, M. (2019). Mobile Device Voice Recordings at King’s College London (MDVR-KCL)… Zenodo. DOI: 10.5281/zenodo.2867216。
自动化下载脚本(curl):
curl -L -o 26_29_09_2017_KCL.zip \
"https://zenodo.org/records/2867216/files/26_29_09_2017_KCL.zip?download=1"
md5sum -c <<< "98c51bdd2b092b93f8bb038dea4505fa 26_29_09_2017_KCL.zip"
§6.3 预处理 Pipeline
从原始 44.1 kHz WAV 到模型输入的推荐管线(六步):
步骤 1:标签解析与清单固化。按 §4.1 正则建立 manifest.csv,此后一切操作基于 manifest 而非目录扫描——原始文件重命名风险归零。
步骤 2:重采样决策。现代语音模型(Wav2Vec2/HuBERT/whisper 系)普遍期待 16 kHz:librosa.resample(y, orig_sr=44100, target_sr=16000)。保留原始 44.1 kHz 归档,处理副本降采样;不要删除高频段前先确认你要用的特征(如高频摩擦音能量)不被截断——PD 的发音模糊恰好在辅音高频段有区分信号。
步骤 3:任务段定位与切分。官方未提供逐段时间戳。三条可行路线:① 全通话粗粒度使用(medRxiv 2025 口径:连续对话录音);② 手工标注 3-5 条通话的任务段边界,用对齐外推(工作量小,但需声明近似性);③ 用语音活动检测(VAD,如 Silero)切分语音块,再按静音模式启发式区分朗读/对话段——朗读段停顿规律、对话段含对端人声(可用双工检测辅助)。推荐 ① 用于复现基准、③ 用于特征级研究。
步骤 4:特征化(三条路线任选):
- 手工声学特征:openSMILE(eGeMAPSv02 参数集)或 pysptk 提取 Jitter、Shimmer、HNR、基频统计量——PD 语音文献经典特征域;
- 时频图:log-mel(25 ms 窗、10 ms 步、80 mel 滤波器)→ CNN/ResNet 输入;
- 自监督表征:Wav2Vec2/HuBERT 逐层特征 → 轻量分类头。
手工特征路线的一键命令(openSMILE 命令行版,对 manifest 逐行执行):
# 对单个 WAV 提取 eGeMAPSv02 功能集(88 维功能向量,CSV 输出)
SMILExtract -C config/egemaps/v02/eGeMAPSv02.Functional.conf \
-I mdvr_kcl/26_29_09_2017_KCL/ID02_pd_1_2_1.wav \
-O features/ID02_pd_1_2_1.csv
Python 批量版(与 §6.1 的 manifest 衔接):
import opensmile, pandas as pd
smile = opensmile.Smile(
opensmile.FeatureSet.eGeMAPSv02,
opensmile.FeatureLevel.Functionals,
)
X = pd.DataFrame([
{"file": r["file"], **smile.process_file(r["path"]).iloc[0].to_dict()}
for _, r in df.iterrows()
])
eGeMAPSv02 的 88 维功能向量天然包含 Jitter、Shimmer、HNR、F0 统计量与响度特征——正是 §2.3 声学特征谱系中的核心域,与 PD 语音文献的可解释特征层完全对接。
步骤 5:信道仿真(可选)。若目标是"真实电话信道"部署,对降采样后的信号叠加 8 kHz 电话带通 + μ-law 量化 + 轻噪,训练鲁棒模型;切勿把仿真信道版本与原始版本混入同一训练集而无版本标记。
步骤 6:划分与缓存。按 §5.2 的 GroupKFold 配置生成折索引文件并持久化——37 人数据集的折划分必须可复现(固定 random_state),否则论文结果无法复核。
§6.4 框架加载
# PyTorch Dataset 示例:说话人分组 + 文件名标签 + 按需重采样
import torch
from torch.utils.data import Dataset
import librosa, pandas as pd
class MDVRKCL(Dataset):
def __init__(self, manifest: pd.DataFrame, target_sr=16000):
self.df = manifest.reset_index(drop=True)
self.sr = target_sr
def __len__(self):
return len(self.df)
def __getitem__(self, i):
row = self.df.iloc[i]
y, _ = librosa.load(row["path"], sr=self.sr) # 原生 44.1 kHz → 16 kHz
label = 1 if row["health_status"] == "pd" else 0
return torch.tensor(y, dtype=torch.float32), label, row["participant_id"]
# DataLoader 的 group 键用于构建 GroupKFold 折索引:
from sklearn.model_selection import GroupKFold
gkf = GroupKFold(n_splits=5)
splits = list(gkf.split(df, groups=df["participant_id"]))
Hugging Face 路线:将 manifest 转为 datasets.Dataset(Audio 特征列 + 标签列),再用 Wav2Vec2FeatureExtractor 流水线接入预训练模型——37 人小集上,SSL 特征 + 线性探针通常优于从头训练(见 §6.7)。
§6.5 常见坑点
⚠️ 坑点 1:44.1 kHz 的"电话语音"不是电话信道语音(分类:数据理解)
问题:看到"telephone speech"就按 8 kHz 电话带宽预期处理(降采样到 8 kHz、套 GSM 特征),会摧毁数据的核心价值——MDVR-KCL 是 off-hook 触发的麦克风直录,44.1 kHz 保留了完整声学带宽,电话只是采集"情境"而非信号"信道"。
症状:降采样后高频辅音信息丢失,PD 发音模糊特征(摩擦音能量、辅音清晰度)系统性变弱;论文里声称"电话语音模型"却被审稿人指出信道不真实。
解决:区分三个概念——采集情境(真实拨号)、信号路径(麦克风直写 SD 卡)、传输信道(无);需要真实电话信道退化时自行叠加 8 kHz 带通 + μ-law 仿真并在方法学明确声明;基线请用原生 44.1 kHz(或统一降至 16 kHz 喂 SSL 模型)。
参考:Zenodo 记录官方描述(“microphone signal was recorded… not the GSM-compressed call”);§3.1 模态说明。
⚠️ 坑点 2:性别与标签几乎完全纠缠(分类:偏倚陷阱/评估误用)
问题:PD 组 5 女 11 男、HC 组 19 女 2 男(medRxiv 2025 披露)。基频(F0)本身就是性别强相关特征——一个"80% 准确率"的模型可能只是在按基频猜性别再间接猜标签。
症状:准确率很高但男女亚组表现极端失衡;特征重要性排名 F0 均值一骑绝尘;跨数据集(性别构成不同)验证时性能崩塌。
解决:① 分性别报告指标(男女各自的 sens/spec);② 特征层做性别归一(如按说话人内 F0 z-score 化)或显式加入性别协变量;③ 做性别交叉划分压力测试(训练男 PD+女 HC / 测试女 PD+男 HC)量化捷径依赖;④ 论文结论必须声明该混淆未被消除、只能被诊断。
参考:medRxiv 2025 预印本(性别构成披露);§4.2 标签分布。
⚠️ 坑点 3:标签藏在文件名里——重命名即毁数据(分类:标签理解/工程陷阱)
问题:全部临床标注(PD/HC、H&Y、两项 UPDRS)编码在文件名五段中,没有伴随清单文件。批量重命名("清理"下划线、小写化、加前缀)会静默摧毁标签;ID 从 00 起始还容易被按 01 起始误读。
症状:解析正则匹配率不到 100%;"ID02 是第二个受试者"式 off-by-one;标签表行数对不上文件数。
解决:第一时间把原始文件名快照到 manifest(含 MD5);解析函数对不匹配文件名抛异常而非跳过;一切下游流程只引用 manifest 行 ID;解析规则见 §4.1(含防御清单)。
参考:Zenodo 官方命名描述
SI_HS_HYR_UPDRSII-5_UPDRSIII-18;§4.1 字段表。
⚠️ 坑点 4:37 人无官方划分——随机划分必致说话人泄漏(分类:数据泄漏)
问题:每位受试者一条连续通话,滑窗切分后实例数可达数百;按实例随机划分训练/测试,同一人的语音几乎必然跨集出现——模型认得"这个人的声音"而不是"PD 的语音特征"。小样本下这一泄漏带来的虚高可轻松超过 10 个百分点。
症状:测试集准确率远高于 LOSO/GroupKFold 口径;换一批随机种子结果剧烈波动;加入说话人混淆变量(如说话人 one-hot)后性能反而下降。
解决:一律以
participant_id为 group 键做 GroupKFold(5) 或 LOSO;划分后断言训练/测试 ID 零交集;比较文献数字时先问"是不是说话人独立口径"(多数 98% 级别的报告不是)。参考:§5.2-5.3;medRxiv 2025(其对话录音口径需按条而非按人核对)。
⚠️ 坑点 5:单一房间混响成为捷径特征(分类:偏倚陷阱)
问题:全部录音来自同一间约 10 平方米、混响约 500 ms 的检查室、同一部 Moto G4。房间脉冲响应与设备频响是"全体共享"的常量——理论上不含判别信息,但与采集时段、说话人站位的微小差异耦合后,模型可能学到"这间房里的伪影分布"而非语音病理特征。
症状:跨数据集(不同房间/设备)验证性能骤降;对音频做轻混响/降噪增广后模型性能变化异常敏感。
解决:报告跨库外部验证结果(§5.5);训练加房间仿真增广(随机 RIR 卷积)提升域不变性;解释特征重要性时把"设备/房间相关频段"列入可疑名单。
参考:Zenodo 官方描述(房间尺寸与混响时间);§3.9 设备规格。
⚠️ 坑点 6:HC 也有 UPDRS 分、PD 也能 0 分——评分 ≠ 诊断(分类:标签理解)
问题:官方明确描述 HC 同样被评分:ID31 是健康对照但 UPDRS 言语条目 1 分;部分 PD 文件言语条目 0 分。把"UPDRS > 0"当 PD 判据、或把 UPDRS = 0 的 PD 文件当"标签错误"清洗掉,都是把"言语症状严重度"误当"疾病存在性"。
症状:UPDRS 回归模型在 HC 子集上"意外"出现非零真值而表现失常;数据清洗时错删合法样本;严重度模型评估集只含 PD 导致分布失真。
解决:PD/HC(检测任务)与 UPDRS/H&Y(严重度任务)两套标签严格分开建模与评估;严重度任务的评估集同时含 PD 与 HC;发现"HC 带 1 分"不是 bug 而是"亚临床言语差异"的真实标注。
参考:Zenodo 官方描述(controls were also rated;ID31 实例);§3.5 标注方式。
⚠️ 坑点 7:朗读段与自发对话段口径混比(分类:预处理陷阱/评估误用)
问题:一条通话内混有放松段、NWS 朗读段、(部分人的)BNC 朗读段、自发对话段。文献口径五花八门:medRxiv 2025 用 73 条连续对话录音做 5 秒分段;其他工作用手工特征全集。拿自己的"全通话混合口径"去和"仅对话段口径"的文献数字比高低,结论无效。
症状:复现数字差 5-15 个百分点且找不到 bug;朗读/对话段分别评估时性能差异巨大却无法解释。
解决:复现基准时逐篇核对口径(任务段、分段长度、划分方式);自建实验固定单一口径并显式声明;段级分析用 VAD + 对端人声检测(§6.3 步骤 3)粗分段后做段间消融。
参考:medRxiv 2025(5 秒 log-mel、73 条对话录音口径);§4.4 层级图。
⚠️ 坑点 8:引用与许可的三个易错点(分类:工程陷阱/合规)
问题:① 把 MDVR-KCL 与 Sakar et al. 2013(UCI 土耳其数据集)混淆引用——两者任务、语言、规模全不同,且 MDVR-KCL 无独立论文;② 用概念 DOI(2867215)而非版本 DOI(2867216)引用,复现者找不到具体版本;③ 以为"开放获取 = 禁止商用"(CC BY-NC-SA 的误解),或相反地忘了署名义务。
症状:参考文献指向错误数据集;审稿人要求给出可解析的版本 DOI;商用部署前许可审查卡壳。
解决:官方引用即 Zenodo 记录本身——Jaeger, H., Trivedi, D., & Stadtschnitzer, M. (2019), DOI: 10.5281/zenodo.2867216;方法学引用补 i-PROGNOSIS 会议论文(DAGA 2018 / ITG 2018);许可口径:CC BY 4.0 允许任何用途包括商用,唯一硬性要求是署名;站内对比时切勿引用 Sakar 2013 UCI 的数字当作 MDVR-KCL 的结果。
参考:Zenodo 记录 License 字段(CC BY 4.0);§9 BibTeX 三件套。
版本提示:本数据集自 2019-05-17 发布后数据本体未更新(2020-01-24 仅元数据修改),版本风险极低;引用时统一使用版本 DOI 10.5281/zenodo.2867216 即可,无需像多版本数据集那样做版本对齐。
§6.6 数据增强
| ✅ 安全增强 | ❌ 危险增强(禁止) |
|---|---|
| SpecAugment(时频掩蔽)——SSL/声谱模型标配 | 变调(pitch shift)大幅度处理——F0 是 PD 与性别的双重载体,变调会同时破坏两类信号 |
| 小幅增益抖动与背景噪声叠加(SNR ≥ 15 dB) | 时间拉伸压缩超过 ±10%——语速与停顿模式是 PD 言语核心特征 |
| 随机房间脉冲响应(RIR)卷积——对抗坑点 5 的单房间偏差 | 电话信道仿真与原始信号无标记混用——口径污染 |
| 随机起点滑窗切分(同受试者内) | 跨受试者拼接混合(mixup)——小样本下会把标签语义搅混 |
小样本(37 人)下增广的边际收益通常为正,但一切增广只在训练折内计算,验证/测试折保持原始信号(否则评估的不再是真实分布)。
§6.7 模型推荐
| 路线 | 代表配置 | 适用场景 | 预期表现 |
|---|---|---|---|
| 手工特征 + 经典分类器 | openSMILE eGeMAPSv02 + SVM/逻辑回归 | 可解释性研究、特征消融、基线 | 中等;特征层完全可控 |
| 手工 PD 特征 + KNN/SVM | Jitter/Shimmer/HNR 等扰动特征 | 对齐 Chethan 2020 文献口径 | 文献报告 85%(13 特征)至 98%(优化 9 特征,划分口径存疑) |
| log-mel + CNN | 5 秒分段、2D CNN/ResNet | 对齐 medRxiv 2025 口径 | 文献报告 84.7% acc / 87.9% sens / 89.4% spec |
| SSL 特征 + 轻量头 | Wav2Vec2/HuBERT 冻结特征 + 线性探针或浅层 MLP | 37 人小集的深度学习首选 | 通常优于从头训练;注意 16 kHz 重采样 |
| 端到端微调 | Wav2Vec2 全参微调 + 注意力池化 | 追求上限,务必 LOSO 验证 | 需强正则与早停,过拟合风险最高 |
选型建议:先跑"手工特征 + SVM"与"SSL 线性探针"两条基线——前者给出可解释的特征级洞察,后者给出接近当前范式的性能上限;两者结论(特征重要性 vs 表征探针)互相印证后再决定是否投入端到端微调。
§6.8 计算资源需求
- 特征提取/经典模型:CPU 即可,606 MB 音频的全量 eGeMAPS 提取在普通笔记本上几分钟完成。
- SSL 线性探针:单张消费级 GPU(8 GB 显存)足够;特征可预计算缓存(37 人总量小)。
- 端到端微调:单卡 16 GB(如 V100/T4)可跑 Wav2Vec2-base;建议冻结特征提取器只微调上层。
- 存储:磁盘预留 1 GB(原始 + 解压 + 处理副本);无需分布式或云端 GPU 集群。
§6.9 评估指标
- 检测任务主指标:accuracy、sensitivity(PD 召回——筛查场景的关键指标)、specificity 三件套;类别不平衡下 accuracy 单独使用有误导性(HC 略多)。
- 曲线类:ROC-AUC 与 PR-AUC 并报——小样本下 PR 曲线对 PD 类性能更敏感。
- 严重度任务:UPDRS 回归报 MAE/RMSE(0-4 分制下 MAE 0.5 已很可观);H&Y 分级报加权 kappa。
- 稳健性指标:分性别亚组 sens/spec(坑点 2);跨折标准差;如做跨库迁移,报告相对同分布测试的衰减百分点。
- 统计严谨性:置换检验 p 值或逐折配对 bootstrap 置信区间;37 人下禁止只报单次划分点估计。
三指标 + 分性别评估的最小实现(与 §6.4 的折索引衔接):
from sklearn.metrics import (accuracy_score, recall_score,
confusion_matrix)
def evaluate(y_true, y_pred, gender=None):
acc = accuracy_score(y_true, y_pred)
# PD=1 为正类:sensitivity = PD 召回,specificity = HC 召回
sens = recall_score(y_true, y_pred, pos_label=1)
spec = recall_score(y_true, y_pred, pos_label=0)
out = {"acc": acc, "sens": sens, "spec": spec}
if gender is not None: # 坑点 2 的分性别口径
for g in ("F", "M"):
m = (gender == g)
cm = confusion_matrix(y_true[m], y_pred[m], labels=[1, 0])
out[f"sens_{g}"] = cm[0, 0] / max(cm[0].sum(), 1)
out[f"spec_{g}"] = cm[1, 1] / max(cm[1].sum(), 1)
return out
要点:sensitivity 以 PD 为正类(筛查场景漏检 PD 的代价最高);分性别行在性别构成失衡的本数据集上不是可选项而是必选项。
§6.10 MLOps 笔记
- 数据版本控制:原始 ZIP 的 MD5 写入实验配置;manifest.csv(文件名 + 解析标签 + 路径)纳入 git;折索引文件持久化并版本化——37 人数据集的"实验不可复现"几乎全部源于划分与增广未版本化。
- 许可合规自动化:CC BY 4.0 只要求署名,但衍生数据集再分发时须附带原署名声明;在数据卡(data card)中固化引用条目与 DOI。
- 监控要点(若进入试点部署):输入音频的采样率/位深校验、静音率监控(通话未接通场景)、性别与年龄段性能分层监控(坑点 2 的部署版)。
- 模型卡必填:训练数据口径(任务段、分段、划分)、性别混淆声明、单中心单设备局限、以及"非诊断设备"的定位声明(本数据集规模不足以支撑临床级声称)。
§7 质量评估与局限性
§7.1 已知偏倚
- 性别-诊断混淆(最尖锐):PD 组 5 女 11 男 vs HC 组 19 女 2 男,性别边缘分布与标签几乎反向对齐;基频等声学特征与性别强相关,构成经典的"捷径学习"温床(缓解见 §6.5 坑点 2)。
- 单中心单房间单设备:37 人全部在同一检查室(约 10 平方米、混响约 500 ms)、同一部 Motorola Moto G4 上完成采集,房间与设备伪影无个体变异,跨域泛化无数据支撑。
- 单会话横断面:每人一次通话、四天内完成——无重测信度信息、无纵向进展数据,天然不支持进展建模。
- 样本规模:37 人的任何统计推断(包括性别亚组分析)置信区间都极宽;"84.7% 准确率"这类点估计的 95% 置信区间跨度可能超过 20 个百分点。
- 通话情境偏差:说话人面对"与陌生执行员通话"的实验情境,其语流风格(正式度、情绪状态)未必泛化到真实居家通话。
- 元数据空洞:年龄、病程、用药状态、口音背景未披露——无法检验年龄匹配性、无法做用药状态分层,这些空洞本身构成不可量化的偏倚风险。
§7.2 标注质量评估
优势面:标注采用国际通行的临床量表(H&Y 分期、UPDRS II-5/III-18),评估方式(专家听音)与量表设计初衷一致;标签直接编入文件名,传递过程零转录误差——这比"独立 CSV 清单"更不易出错。
局限面:① 评分者人数、评分者间信度(加权 kappa)未披露,UPDRS 言语条目本身是 0-4 粗粒度序数评分,单评分者的尺度漂移无法被检测;② HC 也被评分带来语义复杂度(亚临床言语差异被如实记录,但要求使用者理解"评分 ≠ 诊断",见坑点 6);③ 临床诊断标准(入组 PD 的具体标准)未披露;④ 评估与录音的时序关系(同日评估还是另行评估)未披露。结论:检测任务(PD/HC)标签可信度较高;严重度任务(UPDRS/H&Y)标签可用但需在方法学中声明信度信息缺失。
§7.3 泛化性讨论
MDVR-KCL 模型的泛化边界有三层:
- 跨设备:训练只见 Moto G4 频响——迁移到其他手机/麦克风需增广或域自适应,无内部证据支撑;
- 跨信道:本集是麦克风直录信号,真实电话网络(GSM/VoIP)的 8 kHz 带宽与编码失真未被覆盖,部署于真实通话链路前必须做信道仿真验证;
- 跨人群与跨语言:伦敦单中心英语人群;迁移到其他语言/口音/医疗体系需重训练——PD 语音的声学标记物(Jitter、Shimmer、HNR、停顿结构)有跨语言证据,但模型级别的迁移不能想当然。
合理的泛化期望:把它当作"电话情境 PD 语音检测假设的最小验证集"而非"产品级训练集"——结论的可迁移性要靠 §5.5 的跨库实验与前瞻采集补全。
§7.4 伦理考量
- 伦理审批:采集在 London - Dulwich Research Ethics Committee 批准下进行(REC 17/LO/0909)——该批号披露于 2025 年 medRxiv 论文的伦理声明,属二手来源,Zenodo 记录本身未附伦理声明文件。
- 资助透明:EU H2020 i-PROGNOSIS 项目(grant 690494)资助,Zenodo 元数据明确标注,无商业资助疑点。
- 开放与隐私的张力:语音兼具"研究数据"与"生物特征标识物"双重属性——CC BY 4.0 意味着任何人都可下载这 37 人的语音。受试者已知情同意开放发布,但使用者应避免尝试重新识别个体,再分发衍生数据时继续遵守署名与伦理规范。
- PD 患者群体的特殊保护:神经退行性疾病患者的认知与沟通能力可能受限,知情同意程序细节未披露——引用时保持对原始采集团队伦理程序的信任边界,勿过度演绎。
§7.5 公平性评估
- 性别:边缘分布严重失衡(24 女 / 13 男)且与标签纠缠(见 §7.1 第 1 条)——这是本数据集公平性评估的头号对象;任何模型必须报告分性别指标。
- 年龄:未披露——公平性分析直接不可行,这是硬性证据缺口。
- 疾病严重度:官方定位"早期 + 晚期"双覆盖,但逐例分布未披露——严重度维度的模型公平性(早期患者是否被漏检)无法在元数据层面核验。
- 社会经济与地域:伦敦单中心,多样性构成未知。
给使用者的公平性清单:报告分性别 sens/spec → 声明年龄盲区 → 不对严重度亚组做未经披露支撑的声称 → 在数据卡中完整复述上述缺口。
§7.6 数据漂移提示
- 设备漂移:Moto G4 是 2016 年机型;当代智能手机的麦克风阵列、降噪算法(尤其通话链路上的 AI 降噪)已发生代际变化——用现代手机采集的通话音频与本集的声学分布存在系统性差异,部署侧需做分布监测。
- 编码漂移:真实电话/VoIP 链路的编解码(AMR、Opus 等)与 AI 降噪会改变声学特征分布;本集不含这些效应。
- 语言与口音漂移:英语内口音分布未披露,跨地域部署(如其他英语国家)存在口音分布漂移风险。
- 时间语义漂移:2017 年采集——PD 诊疗(如用药方案)与"打电话"行为本身(智能机普及率、通话习惯)都在变化,纵向部署需定期校准。
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据为宽格式(每行一个样本/事件) | ✅ | 每 WAV 为一条独立记录,标签内嵌文件名 |
| 2 | 有唯一标识符列 | ✅ | participant_id(ID00-ID36)+ 文件名唯一 |
| 3 | 无 Unicode 或特殊字符 | ✅ | 文件名为纯 ASCII 五段式,机器可读性极佳 |
| 4 | 无重复行 | ⚠️ | 官方未声明去重;WAV 条数未披露,需解压核对 |
| 5 | 缺失值已识别并编码 | ⚠️ | BNC 朗读段非全员覆盖(结构缺失),官方未提供缺失清单 |
| 6 | 标签列被明确标识 | ✅ | 五段文件名即完整标签(PD/HC、H&Y、UPDRS×2) |
| 7 | 已对罕见类别(<3%)进行分组 | ⚠️ | UPDRS 高分段与 H&Y 晚期可能极稀疏,官方未提供分布 |
| 8 | 偏倚评估已完成 | ✅ | 性别混淆、单中心等偏倚本页面 §7.1 系统评估(官方元数据无偏倚声明,为编辑部分) |
| 9 | 有完整的数据字典 | ✅ | 官方命名规则 SI_HS_HYR_UPDRSII-5_UPDRSIII-18 + 本页面 §4.1 字段表 |
| 10 | 对"信息性缺失"有明确编码解释 | ❌ | BNC 段缺失与受试者状况相关,无任何官方编码解释 |
| 11 | 数据采集设备和设置已记录 | ✅ | 机型、App、触发机制、房间尺寸、混响时间一应俱全(官方描述质量高) |
| 12 | 已移除完全共线性变量 | ⚠️ | 原始音频数据集无特征表,该检查不适用且未声明 |
| 13 | 对编码的映射标准已说明 | ✅ | H&Y 与 UPDRS 为国际通行量表,字段语义官方说明清晰 |
| 14 | 对时间戳的处理已明确说明 | ⚠️ | 采集日期窗(2017-09-26/29)披露;逐文件时间戳无 |
| 15 | 训练/验证/测试划分建议已给出 | ❌ | 官方无任何划分;本页面 §5.2 补充了 GroupKFold/LOSO 方案 |
| 16 | 数据泄漏风险已被讨论 | ✅ | 说话人泄漏、分段泄漏、特征泄漏本页面 §5.3/§6.5 系统覆盖 |
| 17 | 标签分布已被分析 | ✅ | PD/HC 与性别交叉分布 §4.2;UPDRS 逐例分布官方未披露(已声明) |
| 18 | 选择性测量偏倚已被讨论 | ✅ | 通话情境、单房间单设备偏差 §7.1/§7.3 |
| 19 | 外部验证建议已给出 | ✅ | §5.5 四条跨库验证路径 |
| 20 | 数据更新和版本信息已记录 | ✅ | Zenodo 版本机制完整,2019-05-17 发布 / 2020-01-24 元数据修改 |
| 21 | 最小必要预处理脚本已提供 | ✅ | 本页面 §6.0-§6.4 提供下载校验、解析、加载、划分全套脚本(官方无脚本) |
| 22 | 合规使用要求已明确 | ✅ | CC BY 4.0 单一许可,义务仅署名,无附加协议 |
| 23 | 多模态对齐方法已说明 | ✅ | 单模态(纯音频),无对齐需求 |
| 24 | 去标识化方法已被记录 | ⚠️ | 受试者以 ID 编码、无直接标识符;但去标识化流程与语音生物特征风险的官方说明缺失 |
DAIMS 评分:19 / 24
评分解读:良好——开放许可、文件名即标签的设计与官方采集文档质量把"接入成本"压到了同类数据集的最低档;扣分全部来自元数据与统计配套的空洞(无划分、无信息性缺失解释、无重复性核查、无去标识化说明)。
对你意味着什么:MDVR-KCL 的 16 个 ✅ 项里有一半靠"设计简单"红利——37 人、单模态、五段文件名,简单性本身就是工程友好度。但不要把就绪度误读为科学成熟度:10 与 15 两个 ❌(信息性缺失无解释、无官方划分)加上 4 与 7 的 ⚠️(总量未披露、稀疏类别未分组)意味着统计严谨性的责任完全落在使用者肩上——你必须自己核对文件清单、自己设计说话人独立划分、自己在论文里补齐官方没说的话。与其他 PD 语音集相比:它的接入门槛比 UASpeech(申请制)与 TORGO(学术许可)低得多,但元数据厚度也薄得多——适合"快速验证想法",不适合"支撑结论性声称"。
§7.8 外部验证矩阵
| 验证场景 | 来源 | 任务设定 | 报告性能 | 关键发现与局限 |
|---|---|---|---|---|
| 同分布内部基准(medRxiv 2025) | medRxiv 预印本 | 5 秒 log-mel 分段 CNN,73 条连续对话录音 | 84.7% acc / 87.9% sens / 89.4% spec | 首个系统基准;口径为对话录音条级,划分方式需原文核对;预印本未经同行评审 |
| 手工特征经典模型(Chethan et al. 2020) | 期刊论文 | 13 特征 KNN vs 优化 9 特征 | 85% → 98% | 98% 的高分与 37 人小集的划分口径强相关,跨库可比性有限 |
| 跨语音数据集分析(Toye & Kompalli 2021) | arXiv:2111.10207 | 多 PD 语音集对比分析 | 分析型工作 | 提供了跨数据集视角,但未建立统一的说话人独立协议 |
为什么没有真正的"外部验证"行:截至 2026-09,尚无公开文献报告"在 PC-GITA/UASpeech 等库训练 → 在 MDVR-KCL 测试"(或反向)的严格说话人独立跨库实验——这个空白本身就是机会,也是使用本数据集做任何结论性声称前必须自己补上的证据链。
§8 基准性能与生态
§8.1 排行榜(口径各异,不可直接比较)
MDVR-KCL 没有统一的社区基准协议,下表汇集代表性工作——各行口径不同,数字不可横向比较,仅供了解方法版图:
| 模型/方法 | 报告性能 | 年份 | 口径要点 | 完整引用 |
|---|---|---|---|---|
| CNN(5 秒 log-mel 分段) | 84.7% acc / 87.9% sens / 89.4% spec | 2025 | 73 条连续对话录音;预印本未终审 | medRxiv 预印本(2025),Zenodo 数据集基准研究 |
| KNN(13 手工特征) | 85% acc | 2020 | 手工声学特征;划分口径未按说话人独立声明 | Chethan, H. et al. (2020),期刊论文 |
| KNN(优化 9 特征) | 98% acc | 2020 | 特征筛选后;小样本 + 划分口径问题使高分需谨慎解读 | 同上 |
| 跨数据集对比分析 | 分析型结论 | 2021 | 多 PD 语音集特征与性能对比 | Toye, A. & Kompalli, S. “Speech analysis on Parkinson’s disease datasets.” arXiv:2111.10207 (2021) |
| 言语流利度研究 | 流利度指标分析 | 2022 | 16 名 PD 朗读任务子集;非全库 | PMC 收录期刊论文(2022) |
| ResNet + 扰动特征 | 见原文 | 中文期刊 | Jitter/Shimmer/HNR 12 特征输入 ResNet | 中文期刊论文(具体篇目见原文检索) |
阅读这类数字的三条纪律:① 先问划分——是否说话人独立(坑点 4);② 再问口径——任务段、分段长度、评估集构成(坑点 7);③ 最后问置信区间——37 人下没有区间暴露的点估计都是不完整的证据。
§8.2 SOTA 总结与选型建议
| 如果你… | 推荐方案 | 为什么 |
|---|---|---|
| 复现第一个深度基准 | medRxiv 2025 口径(5 秒 log-mel CNN + 对话录音) | 唯一提供 sens/spec 三件套的系统报告 |
| 快速出基线(CPU) | eGeMAPS 手工特征 + SVM,GroupKFold(5) | 可解释、零 GPU、与 §6.7 表第一条对齐 |
| 发表方法学论文 | SSL 线性探针 + LOSO + 分性别报告 + 置换检验 | 补齐现有文献的三大缺口(划分、性别、显著性) |
| 做跨库泛化研究 | MDVR-KCL ↔ PC-GITA 双向迁移实验 | 电话情境 × 跨语言 × 信道三重贡献点 |
截至 2026-09 的诚实判断:MDVR-KCL 上不存在"公认 SOTA"——只有口径各异的参考点。把它当方法学练兵场与跨库测试集,比刷点更有科学产出。
§8.3 官方评测协议
无官方协议。Zenodo 记录不含基准配置、划分文件或排行榜。社区文献的隐性惯例是:PD/HC 二分类 + accuracy/sens/spec 三件套 + 手工特征或浅层模型;2025 年起出现 log-mel CNN 的深度基准。任何新实验都应按 §5.2 的说话人独立原则自建协议并完整声明口径。
§8.4 相关数据集
| 数据集 | 语言 | 规模 | 信道 | 与 MDVR-KCL 的关系 |
|---|---|---|---|---|
| Parkinsons-voice-uci(Sakar 2013) | 土耳其语 | 31 人 | 实验室麦克风 | 最常被错误混淆的"近名"数据集;任务为持续元音,与本集互补 |
| PC-GITA | 西班牙语 | 100 人 | 实验室麦克风 | 规模更大的跨语言对照;含朗读与自发语音段 |
| SAARBRÜCKEN VOICE DB | 德语 | 73 人 | 实验室麦克风 | 欧洲早期 PD 语音参考集 |
| UASpeech | 英语 | 32 人 | 实验室麦克风 | 构音障碍(含 PD)词表语料,严重度谱系更细 |
| TORGO | 英语 | 15 人 | 实验室双麦克风 + EMA | 构音运动维度补充(非 PD 特异) |
| Gait-PD | — | PD 队列 | 足底压力/步态传感 | 跨模态对照:运动信号 vs 语音信号的 PD 检测互补 |
| DAPHNET | — | PD 队列 | 穿戴加速度计 | 冻结步态检测——PD 远程监测的另一条传感路线 |
三条组合主线:语音内组合(MDVR-KCL 电话情境 + PC-GITA 实验室情境 = 信道鲁棒性研究);跨模态组合(语音 + Gait-PD/DAPHNET 运动传感 = 多模态 PD 监测);历史脉络组合(Sakar 2013 元音范式 → MDVR-KCL 连续语流范式 = 任务演化叙事)。
§8.5 关键论文
- Jaeger, H., Trivedi, D., & Stadtschnitzer, M. (2019). Mobile Device Voice Recordings at King’s College London (MDVR-KCL) from both early and advanced Parkinson’s disease patients and healthy controls. Zenodo. DOI: 10.5281/zenodo.2867216 —— 官方引用即此条(数据集本身,无独立论文)。
- i-PROGNOSIS 采集方法学:DAGA 2018 报告(DOI: 10.5281/zenodo.3678669)与 ITG 2018 报告(DOI: 10.5281/zenodo.3678641)——录音协议与 Toggle Recording App 的技术细节。
- 项目背景报告:德国神经病学学会 2017 报告(DOI: 10.5281/zenodo.1199554)——采集窗口期的项目进展。
- Chethan, H. et al. (2020)——手工特征 + KNN 的早期基准(85% → 98%)。
- Toye, A. & Kompalli, S. (2021). arXiv:2111.10207——跨 PD 语音数据集的系统对比。
- medRxiv (2025)——log-mel CNN 基准(84.7%/87.9%/89.4%)并披露性别构成;预印本,引用时注明状态。
§8.6 社区活跃度
Zenodo 官方统计(截至 2026-09,经 API 查询):6,402 次下载(其中 4,022 次独立下载)、15,870 次浏览。对一个 37 人规模的单任务语音集而言,六年约 6,400 次下载表明它在 PD 语音社区保持着稳定的"工具箱级"使用频率——体量远不及大型通用语料,但作为开放电话语音 PD 资源,其复用密度可观。无官方维护的排行榜、GitHub 组织或邮件列表;社区问题走 Zenodo 记录页的公开讨论区。
下载统计的使用提醒:Zenodo 统计口径含爬虫与重复下载,4,022 独立下载是更真实的"使用者数量级"估计;浏览/下载比约 2.5:1,属于数据集页面的典型区间。引用这组数字时务必带上"截至 2026-09"——它们随时间单调变化,是流量口径而非质量口径。
§8.7 生态快照
- 托管:Zenodo(CERN 运营),永久 DOI 保证——概念 DOI 10.5281/zenodo.2867215 不会失效。
- 许可生态位:CC BY 4.0 使它成为 PD 语音家族中唯一"零门槛 + 可商用"的成员(对比学术申请制的 UASpeech 与学术许可的 TORGO)。
- 项目遗产:i-PROGNOSIS 项目(2017-2020)产出涵盖早期检测 App、游戏化干预等模块;MDVR-KCL 是其语音检测线的数据遗产。
- 引用生态:无独立论文 → 引用即指向数据集本身,引用清理干净、无歧义;方法学溯源走 i-PROGNOSIS 会议论文。
- 教育价值:文件名即标签 + 606 MB 单包 + 开放许可,使其成为语音医学课程与 Kaggle 式练习的理想入门数据集。
§9 相关资源与引用
官方资源
| 资源 | 地址 |
|---|---|
| Zenodo 数据集记录(推荐入口) | https://zenodo.org/records/2867216 |
| 数据文件直链(606.1 MB ZIP) | https://zenodo.org/records/2867216/files/26_29_09_2017_KCL.zip |
| 概念 DOI(聚合所有版本) | https://doi.org/10.5281/zenodo.2867215 |
| 版本 DOI(推荐引用) | https://doi.org/10.5281/zenodo.2867216 |
| Zenodo API(元数据查询) | https://zenodo.org/api/records/2867216 |
| i-PROGNOSIS 项目官网 | https://www.i-prognosis.eu/ |
BibTeX 引用(三件套)
条目一:数据集本体(必引)
@misc{jaeger2019mdvrkcl,
title = {Mobile Device Voice Recordings at King's College London (MDVR-KCL)
from both early and advanced Parkinson's disease patients and
healthy controls},
author = {Jaeger, Hagen and Trivedi, Dhaval and Stadtschnitzer, Michael},
year = {2019},
publisher = {Zenodo},
doi = {10.5281/zenodo.2867216},
url = {https://zenodo.org/records/2867216},
license = {CC-BY-4.0}
}
条目二:采集方法学(方法学溯源时引用)
@inproceedings{jaeger2018daga,
title = {Speech recordings of Parkinson's disease patients and healthy
controls in a telephone scenario (i-PROGNOSIS)},
author = {Jaeger, Hagen and Stadtschnitzer, Michael and Trivedi, Dhaval},
year = {2018},
organization = {DAGA 2018 (44th Annual Conference on Acoustics)},
doi = {10.5281/zenodo.3678669}
}
条目三:项目背景(可选)
@misc{iprognosis2017dgn,
title = {i-PROGNOSIS: Intelligent Parkinson eaRly detection Guiding
NOvel Supportive InterventionS},
author = {{i-PROGNOSIS Consortium}},
year = {2017},
publisher = {Zenodo},
doi = {10.5281/zenodo.1199554}
}
引用要点:数据集无独立同行评审论文——条目一(Zenodo 记录)即官方指定引用,切勿用 Sakar et al. 2013(UCI 土耳其数据集)的条目替代;方法学细节溯源引用条目二(DAGA 2018 / ITG 2018 两条会议报告均可,ITG 版本 DOI: 10.5281/zenodo.3678641)。
教程与学习资源
- 本页面 §6.0-§6.4:从下载、校验、标签解析到 PyTorch/Hugging Face 加载的全链路脚本,可直接复制运行。
- openSMILE 文档(eGeMAPSv02 参数集):手工特征路线的标准工具,PD 语音文献的特征层通用语。
- Hugging Face Audio Course:Wav2Vec2/HuBERT 微调与音频数据处理的基础范式,适配本页面 §6.7 的 SSL 路线。
- UPDRS 量表原文(Movement Disorder Society 官方修订版):理解 II-5 与 III-18 两个言语条目评分语义的第一手材料。
- The North Wind and the Sun 语料背景:该朗读文本是国际音标标注的传统标准文本(IPA 战后沿用例),在多个语音语料中出现——跨库实验时注意文本重叠。
原始论文
MDVR-KCL 没有独立的同行评审原始论文——这是它区别于大多数学术数据集的结构特征:
- 官方引用对象是 Zenodo 数据集记录本身(Jaeger, Trivedi & Stadtschnitzer, 2019);
- 采集方法学通过 i-PROGNOSIS 项目的会议报告(DAGA 2018、ITG 2018)与项目官网公开;
- Semantic Scholar 未收录该 DOI 的引用统计,故不存在"论文引用次数"口径;
- 后续使用该数据集的研究(Chethan 2020、Toye & Kompalli 2021、medRxiv 2025 等)见 §8.5。
引用本数据集时,请直接使用 §9 BibTeX 条目一,并在方法学中补一句"数据集无独立论文,方法学详见 i-PROGNOSIS 会议报告",即可同时满足引用规范与可追溯性。
§10 AI 使用声明卡
§10.1 AI 模型使用
本页面的初稿由大语言模型辅助生成(千方病案医数集生产管线),生成过程受 WRITER_CONSTITUTION 规范约束;事实性内容逐条溯源至 Zenodo 官方元数据、Zenodo API 查询结果与公开文献(见 §9),未采用任何不可核实的来源。
§10.2 AI 参与范围
| 环节 | AI 参与度 | 人工介入 |
|---|---|---|
| 事实检索与核实 | AI 执行多轮检索与 API 查询 | 人工指定核实清单与采信标准 |
| 事实清单(FACTS.md) | AI 汇总 | 纳入队列勘误人工复核 |
| 正文撰写 | AI 起草全部章节 | 编辑部交叉审核(§0 声明) |
| 代码示例 | AI 编写 | 编辑部复核逻辑与口径 |
| 基准数字 | AI 从文献摘录 | 逐条标注口径与来源性质 |
§10.3 输入来源
- Zenodo 记录页与 Zenodo API(记录 2867216 / 2867215)——数据集全称、作者、许可、文件规格、采集描述、资助信息(一手来源);
- Zenodo 官方统计(下载/浏览量,截至 2026-09 API 查询);
- medRxiv 2025 预印本——性别构成、伦理批号 REC 17/LO/0909、CNN 基准数字(二手来源,已逐处标注);
- Chethan et al. 2020、Toye & Kompalli 2021(arXiv:2111.10207)、PMC 2022 流利度研究——基准与生态信息(二手来源);
- i-PROGNOSIS 会议报告(DAGA 2018 / ITG 2018 / DGNN 2017,Zenodo DOI)——方法学与项目背景。
§10.4 人工校验表
| 校验项 | 状态 | 校验要点 |
|---|---|---|
| 全称与署名 | ✅ | 与 Zenodo 记录逐字核对 |
| 37 人构成(16 PD + 21 HC) | ✅ | 官方元数据确认;性别细分标注二手来源 |
| 44.1 kHz / 16-bit / WAV / 直录 | ✅ | 官方描述确认;"非 GSM 流"已强调 |
| 文件名五段模式与示例 | ✅ | SI_HS_HYR_UPDRSII-5_UPDRSIII-18 与 ID02 示例按官方描述 |
| CC BY 4.0 与 DOI 双轨 | ✅ | API license 字段与 DOI 记录核对 |
| 606.1 MB 与 MD5 | ✅ | Zenodo API 文件字段核对 |
| H2020 资助与批号 | ✅ | Zenodo 元数据 grant 字段核对 |
| 引用归属(非 Sakar / 非 Prince) | ✅ | 已按勘误澄清,官方引用即 Zenodo 记录 |
| NEMO-KCL 相关性 | ✅ | 多轮检索确认不存在该数据集,未编造关联 |
| 基准数字口径 | ✅ | 全部标注"口径不同、不可直接比较" |
§10.5 AI 生成章节标注
本页面全部章节由 AI 辅助起草;其中 §6.5 八大坑点、§5.2-5.3 划分策略与 §7 DAIMS 评估为 AI 基于数据集结构特征的分析性内容(编辑审核确认其推理与事实层一致),非官方文档转述,采用时请注意其建议性质。
§10.6 最后审核
审核日期:2026-09-05
审核方:千方病案医学编辑部(交叉审核)
状态:published
下次复审建议:若 Zenodo 记录新增版本、或 medRxiv 2025 预印本通过同行评审(其基准数字与性别构成披露将以正式论文口径复核),应触发本页面复审。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- coswara — 共享标签:生理信号 / 公共卫生与流行病学 / 语音信号
- pc-gita — 共享标签:生理信号 / 语音信号 / 帕金森病
- CODE-15% — 共享标签:生理信号 / 公共卫生与流行病学 / 卫生服务研究
- parkinsons-voice-uci — 共享标签:生理信号 / 语音信号 / 帕金森病
- HLS-CMDS — 共享标签:生理信号 / 语音信号
- physionet-cinc-2016 — 共享标签:生理信号 / 语音信号
- coughvid — 共享标签:生理信号 / 语音信号
- torgo — 共享标签:生理信号 / 语音信号
- cms-de-synpuf — 共享标签:公共卫生与流行病学 / 卫生服务研究
- Bridge2AI-Voice — 共享标签:生理信号 / 语音信号
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

