信息速览

PC-GITA — 哥伦比亚西语帕金森多任务语音语料库 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | PC-GITA |
| 英文全称 | Parkinson’s speech dataset with multiple types of sound recordings in Colombian Spanish |
| 别名/简称 | PC-GITA、New Spanish speech corpus(LREC 2014 原始命名)、s-PC-GITA(标准版,区别于 e-PC-GITA 扩展版) |
| 疾病分类 | 帕金森病(ICD-11:8A00 帕金森病);运动减少型构音障碍(ICD-11:MA80.2 构音障碍) |
| SNOMED CT | 12710003 Parkinson’s disease(构音障碍相关编码见 §2.1b) |
| 数据模态 | 语音(持续元音、DDK 音节重复、孤立词、句子、阅读文本、独白) |
| AI 任务类型 | PD 二分类检测、构音障碍严重程度分级、语音生物标志物提取、跨语种语音病理迁移学习、语音基座模型微调 |
| 样本总数 | 100 名受试者(50 PD + 50 HC)/ 全库约 6,300 条语音文件(社区统计) |
| 数据大小 | 约 6,300 条 WAV 文件(44.1 kHz/16-bit;总存储量以官方发放为准,官方未公开标称) |
| 数据格式 | WAV(PCM 16-bit) |
| 许可证 | 学术申请制许可(无标准开源许可证,需签署使用协议) |
| 访问级别 | 申请审核(通过官方联系表单提交学术申请) |
| DUO 标签 | IRB(需伦理批准的学术研究用途) |
| 语言 | 哥伦比亚西班牙语(麦德林方言区) |
| 首发日期 | 2014-05(LREC 2014,雷克雅未克) |
| 最后更新 | 2014-05(标准版);扩展版 e-PC-GITA 于 2024 年文献中使用 |
| 发布机构 | 哥伦比亚安蒂奥基亚大学 GITA 研究组(Universidad de Antioquia) |
| 官方主页 | GITA 研究组 |
| 下载地址 | 官方申请入口 |
| DOI | 10.63317/3c643i6hcfzo(LREC 2014 论文) |
| 引用次数 | 268+(Semantic Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 任务结构清晰、文件命名规范、音频格式统一;扣分项:无官方训练/测试划分、元数据需自行整理、需申请获取 |
| 页面状态 | published |
§0 E-E-A-T 审核与免责声明
医学审核:千方病案医学编辑部交叉审核:§2 医学背景(帕金森病与运动减少型构音障碍的临床描述、ICD-11/SNOMED 编码映射、流行病学数据)、§7 偏倚分析(ON 状态录音限制、临床标注口径)。
数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。PC-GITA 通过安蒂奥基亚大学 GITA 研究组的官方申请表单以学术申请制发放,申请者需说明研究目的并获得伦理批准支持。本页面描述的 DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? PC-GITA 是一个哥伦比亚西班牙语的帕金森病(PD)语音语料库:50 名 PD 患者与 50 名年龄、性别匹配的健康对照,在麦德林 Clínica Noel 的隔音环境中完成了一整套语音任务——从持续的元音"a、e、i、o、u",到快速重复的音节序列(/pa-ta-ka/),再到读句子、读短文和即兴独白,共约 6,300 条录音,全部以专业录音设备(44.1 kHz、16-bit)采集来源:LREC 2014 论文。
为什么重要? 约 89% 的帕金森患者会出现言语障碍,而且言语症状常常早于明显运动症状出现来源:LREC 2014 论文。语音采集无创、廉价、可远程,是帕金森筛查与远程监测的理想信号。PC-GITA 是帕金森语音研究中任务覆盖最全、性别与年龄严格配对、临床标注完备(MDS-UPDRS-III、H&Y、确诊年限)的语料库之一,被全球研究者用作 PD 语音检测的基准数据集,截至 2026-09 已累积 268+ 次引用(Semantic Scholar)。
我能用它做什么? 训练 PD 语音分类器(二分类检测)、提取构音/发声维度的语音生物标志物、研究不同语音任务(元音 vs 连续言语)对检测性能的影响、评测 Wav2Vec 2.0/WavLM/HuBERT 等语音基座模型在病理语音上的表征能力,以及作为源域做跨语种(西语→其他语言)迁移学习。
§1.1 技术摘要
PC-GITA 由安蒂奥基亚大学 GITA 研究组与埃尔朗根-纽伦堡大学(FAU)合作构建,原始论文发表于 LREC 2014来源:ACL Anthology。语料库按照语言学、语音医学与神经病学专家共同制定的采集协议设计,同时覆盖 phonation(发声)、articulation(构音)、prosody(韵律)与 intelligibility(可懂度)四个言语维度:每个受试者完成 5 个持续元音(各 3 次重复)及调制音调版本、6 组 DDK 音节序列、45 个孤立词、10 个句子、一段含全部哥伦比亚西班牙语音位的阅读文本与一段独白来源:LREC 2014 论文。50 名 PD 患者全部在服药后 3 小时内的 ON 状态录音,并由同一位神经科专家完成 MDS-UPDRS-III(37.7±18.3)、H&Y 分期(2.2±0.7)与确诊年限评估来源:Comput. Biol. Med. 2025。录音采用 Shure SM63L 动态全向麦克风与 M-Audio Fast Track C400 声卡,44.1 kHz、16-bit WAV 存储来源:Scientific Reports 2022。全库社区统计约 6,300 条语音文件(每人约 63 条)来源:NTNU 2023。数据经官方申请表单以学术申请制发放,衍生分割版(/pa-ta-ka/ 片段)可见社区仓库 alicerueda/PC-GITA-pa-ta-ka。
§1.2 战略价值
维度一:帕金森语音研究的事实基准。 PC-GITA 自 2014 年发布以来,支撑了从手工声学特征(jitter、shimmer、HNR、VTL)到深度学习(CNN、LSTM、Audio Spectrogram Transformer)再到语音基座模型(Wav2Vec 2.0、WavLM、HuBERT)的完整方法演进谱系来源:Interspeech 2024。其严格配对设计(每组 25 男 25 女、年龄匹配)使性别与年龄混淆因素的干扰被系统压低,是少数能让"准确率数字基本可比"的帕金森语音数据集。2024 年 Interspeech 工作进一步发布了真实临床条件录制的扩展集 e-PC-GITA(40 名说话人),为"实验室到真实场景"的泛化研究提供了稀缺的配对基准来源:arXiv 2406.16128。
维度二:多任务录音协议的对照组价值。 相比只含持续元音的早期数据集(如 Oxford/UCI 帕金森语音数据),PC-GITA 在同一批受试者上同时覆盖持续元音、DDK、朗读与自发言语,使研究者能够量化"语音任务选择"对检测性能的影响——这是设计远程筛查产品时最关键的系统决策之一。已有研究利用这一结构发现:连续言语任务对韵律与语言特征更敏感,而持续元音对发声质量指标更敏感,二者结合优于单一任务来源:Artif. Intell. Med. 相关研究。对多语种语音病理研究者而言,PC-GITA(西语)与德语 Saarbrücken、意大利语 PVS、英语 datasets 共同构成跨语种泛化实验的标准语料矩阵。
§1.3 同类数据集横向对比
| 数据集 | 语言 | 规模 | 录音任务 | 临床标注 | 获取方式 |
|---|---|---|---|---|---|
| PC-GITA | 哥伦比亚西语 | 100 人(50 PD + 50 HC) | 持续元音 + 调制元音 + DDK + 词 + 句 + 朗读 + 独白 | MDS-UPDRS-III、H&Y、确诊年限、年龄、性别 | 学术申请制 |
| Neurovoz | 卡斯蒂利亚西语 | 108 人(53 PD + 55 HC) | 持续元音(3 次)+ DDK + 听读句 + 独白 | PD 诊断、人口学 | 数据共享协议 |
| Italian PVS | 意大利语 | 50 人(28 PD + 22 HC) | 持续元音 + 朗读 + 音节重复 + 词 | PD 诊断、人口学 | IEEE DataPort 开放 |
| Oxford/UCI voice | 英语 | 31 人(23 PD + 8 HC) | 持续元音(196 条特征化记录) | UPDRS(回归目标) | 公开下载 |
| Saarbrücken PD db | 德语 | 88 人(44 PD + 44 HC) | 持续元音 + 朗读 + 独白 | PD 诊断 | 学术申请制 |
对比要点:PC-GITA 的差异化优势在于任务覆盖广度与 ON 状态统一录音协议;Oxford/UCI 虽然完全开放但只有元音且无独立受试者维度的丰富标注;Neurovoz 规模略大但任务少一组调制元音来源:多机构对比研究。
§1.4 版本时间轴
| 时间 | 版本/事件 | 说明 |
|---|---|---|
| 2014-05 | PC-GITA 标准版发布 | 随 LREC 2014 论文发布(雷克雅未克),100 名受试者、多任务录音、44.1 kHz/16-bit来源:ACL Anthology |
| 2016–2019 | 特征集与工具生态成型 | DisVoice、Neurospeech 等配套特征提取工具发布,PC-GITA 成为 PD 语音检测默认基准之一来源:UdeA GITA |
| 2022-10 | 社区分割版 PC-GITA-pa-ta-ka | GitHub 社区发布从 PC-GITA 分割的 /pa/、/ta/、/ka/ 音段(44.1→16 kHz)来源:GitHub |
| 2024-09 | e-PC-GITA 扩展集用于研究 | La Quatra et al.(Interspeech 2024)使用 40 名说话人的真实临床条件扩展录音,提出 s-PC-GITA/e-PC-GITA 区分来源:arXiv 2406.16128 |
§1.5 典型应用场景
- PD 语音检测二分类器:以持续元音或连续言语为输入,训练 SVM/CNN/语音基座模型判别 PD 与 HC,是社区最主流用法来源:Sci. Rep. 2022。
- 构音障碍严重程度回归:以 MDS-UPDRS-III 言语项或 m-FDA 分级为回归目标,从语音预测临床严重程度来源:tomesphere/Interspeech。
- 语音任务对比研究:利用多任务结构比较元音、DDK、朗读、独白的判别信息量,为远程筛查产品的任务设计提供依据来源:NTNU 2023。
- 跨语种迁移学习:以西语 PC-GITA 为源域,迁移到德语、英语等目标域,检验病理语音特征的语种无关性来源:medRxiv 2025。
- 语音基座模型评测:评测 Wav2Vec 2.0/WavLM/HuBERT/Whisper 表征在病理语音上的判别力与噪声鲁棒性来源:Interspeech 2024。
§2 医学背景
§2.1 ICD-11 编码映射
| 概念 | ICD-11 编码 | ICD-11 中文名称 | 在本数据集中的角色 |
|---|---|---|---|
| Parkinson’s disease | 8A00 | 帕金森病 | PD 组 50 名受试者的临床诊断(特发性 PD,由神经科专家确认) |
| Dysarthria | MA80.2 | 构音障碍 | PD 组主要言语症状,构成本数据集的检测目标信号 |
编码依据 WHO ICD-11 官方浏览器检索整理(截至 2026-09)。帕金森病的运动减少型构音障碍在 ICD-11 体系中通常作为症状条目记录而非独立诊断,AI 模型输出应视作"言语表型筛查"而非疾病确诊。
§2.1b SNOMED CT 映射
| 标签 | ICD-11 | SNOMED CT | 术语名称 |
|---|---|---|---|
| 帕金森病 | 8A00 | 12710003 | Parkinson’s disease (disorder) |
| 构音障碍 | MA80.2 | —(建议经 SNOMED 浏览器核验具体概念码后使用) | Dysarthria (finding) |
| 言语与语言评估 | — | —(临床量表以 LOINC 编码体系登记为主) | Assessment of speech and language |
SNOMED CT 仅对帕金森病本体概念给出固定编码(12710003);构音障碍作为临床表现型概念在不同扩展中的编码粒度不一,落地时建议以机构术语服务的映射为准。
§2.2 疾病简介与流行病学
帕金森病(PD)是仅次于阿尔茨海默病的第二大常见神经退行性疾病,影响约 1% 的 65 岁以上人群来源:LREC 2014 论文。其病理核心是黑质多巴胺能神经元进行性丢失,临床表现为静止性震颤、肌张力增高、运动迟缓与姿势不稳四大运动症状。约 89% 的 PD 患者会出现不同形式的言语障碍来源:LREC 2014 论文,典型表型为运动减少型构音障碍(hypokinetic dysarthria),其声学与发音学特征包括:
- 发声维度(phonation):音强减弱(hypophonia)、声音嘶哑、气息声加重、基频微扰(jitter)与振幅微扰(shimmer)增大、谐波噪声比(HNR)下降;
- 构音维度(articulation):构音运动幅度不足与速度下降,塞音爆破不充分(如 /p/、/t/、/k/ 的除阻减弱),元音共振峰空间压缩(vowel centralization);
- 韵律维度(prosody):单调语音(monotonicity)、音高与音强的范围缩窄、语速变异减少;
- 呼吸-言语协调:呼吸支持不足导致持续元音时长缩短,这正是 PC-GITA 中部分 /a/ 录音不足 3 秒的临床根源来源:J. Voice 相关研究。
流行病学方面,PD 发病率随年龄显著上升,男性略高于女性。言语症状可早于典型运动症状多年出现,因此语音信号被视为有前景的早期筛查与远程监测生物标志物载体。
运动减少型构音障碍的系统性评估通常按 DARPA 类框架拆为六个维度,PC-GITA 的任务设计恰好逐一对应:呼吸支持(持续元音时长反映呼吸-phonation 协调)、发声(音质与稳定性,元音任务覆盖)、喉部控制(音高调制能力,调制元音任务覆盖)、构音(唇舌腭运动精度,DDK 与词任务覆盖)、韵律(音高/音强变化,句子与朗读任务覆盖)与可懂度(整体 intelligibility,朗读与独白覆盖)。这种"症状维度 × 任务类型"的对应关系是 PC-GITA 区别于单任务语料库的核心设计思想:研究者可以针对某一症状维度选择对应任务子集,也可以跨任务联合建模检验多维互补性来源:LREC 2014 论文;NTNU 2023。
§2.3 临床任务定义
| 任务类型 | 输入 | 输出 | 临床意义 | 在本数据集的支持度 |
|---|---|---|---|---|
| PD 筛查(检测) | 语音(任一任务) | PD / HC 二分类 | 辅助早期识别与转诊 | 50/50 平衡两类,支持充分 |
| 严重程度分级 | 语音 | MDS-UPDRS-III / H&Y / 言语项回归或分级 | 疾病进展监测、疗效评估 | 提供 MDS-UPDRS-III(37.7±18.3)、H&Y(2.2±0.7) |
| 构音障碍分型评估 | DDK / 朗读语音 | m-FDA 各维度分级 | 言语治疗计划制定 | 部分 downstream 研究使用 m-FDA 分级 |
| 纵向监测 | 多时点语音 | 变化率预测 | 家庭远程随访 | 本数据集无纵向数据,仅支持方法学开发 |
| 跨语种迁移 | 多语种语音 | PD / HC | 检验生物标志语言无关性 | 作为源域或目标域均可 |
§2.4 患者人群描述
| 属性 | PD 组 | HC 组 | 来源 |
|---|---|---|---|
| 人数 | 50(男 25 / 女 25) | 50(男 25 / 女 25) | LREC 2014;Sci. Rep. 2022 |
| 年龄范围 | 男 33–77 岁;女 44–75 岁 | 男 31–86 岁;女 43–76 岁 | Health Inf. Sci. Syst. 2021 |
| 年龄均值 | 男 62.2±11.2;女 60.1±7.8 | 男 61.2±11.3;女 60.7±7.7 | Health Inf. Sci. Syst. 2021 |
| MDS-UPDRS-III | 37.7±18.3(组均值) | —(无神经疾病) | Comput. Biol. Med. 2025 |
| H&Y 分期 | 2.2±0.7(男 2.30±0.94 / 女 2.28±0.54) | — | Sci. Rep. 2022 |
| 确诊年限 | 0.4–43 年 | — | arXiv 2404.05160 |
| 用药状态 | 服药后 3 小时内(ON 态) | — | Sci. Rep. 2022 |
| 民族/语言 | 哥伦比亚西班牙语母语者 | 哥伦比亚西班牙语母语者 | LREC 2014 |
| 采集机构 | Clínica Noel,麦德林 | 同左 | Sci. Rep. 2022 |
人群要点:两组在年龄与性别上严格匹配(组间年龄差异检验 p=0.966,PD 组内部男女 H&Y 无显著差异),这使性别与年龄混淆被系统性控制;但 HC 在 60–65 岁段占比略高,年龄分布存在轻微不均衡来源:NTNU 2023。
§2.5 临床价值
PC-GITA 对临床 AI 的核心价值在于把"语音是否携带 PD 疾病信息"这一问题转化为可复现的定量基准。其一,语音采集无创、成本低、可远程重复,适合作为运动门诊之外的高频监测通道;其二,多任务录音协议允许临床研究者比较不同言语维度(发声 vs 构音 vs 韵律)对疾病状态的敏感度,为筛查产品的任务选型提供证据;其三,完备的临床量表标注(MDS-UPDRS-III、H&Y)使模型输出可以与临床分期对齐,支持"严重程度分层"类的应用研究。需要注意,其采集条件(隔音室、专业设备)与真实居家环境差距明显,直接临床落地需配合噪声鲁棒性方案来源:Interspeech 2024。
§2.6 金标准与参考标注
| 划分维度 | 标注方式 | 标注者 | 性质 |
|---|---|---|---|
| PD / HC 二分类 | 神经科临床诊断 | 神经科专家 | 硬标签(二分类金标准) |
| MDS-UPDRS-III | 运动检查部分量表评分 | 同一位神经科专家 | 连续分数(37.7±18.3) |
| UPDRS 言语项 | MDS-UPDRS 第 3.1 项(0–4 分:正常→严重) | 同一位神经科专家 | 有序分级(均值 1.3±0.8) |
| H&Y 分期 | Hoehn & Yahr 功能分期(1–5) | 神经科专家 | 有序分级(2.2±0.7) |
| 确诊年限 | 诊断至录音的时间差 | 病历记录 | 连续变量(0.4–43 年) |
| 人口学 | 年龄、性别、受教育程度匹配 | 研究者记录 | 分层变量 |
§2.7 西班牙语语音学特征与 PD 检测的关系
PC-GITA 选择西班牙语并非偶然。西班牙语只有 5 个纯元音(/a/、/e/、/i/、/o/、/u/),元音空间结构清晰、共振峰定义良好,使得元音空间压缩(vowel centralization)这一 PD 典型构音退化指标易于量化;同时,西语丰富的塞音体系(/p/、/t/、/k/、/b/、/d/、/g/)为 DDK 任务中的爆破除阻分析提供了理想素材——运动减少型构音障碍在塞音上的表现(除阻不充分、塞音化/fricative 化)是构音维度最敏感的指标之一。原论文正是基于这些语音学考量,与语言学、语音医学专家共同设计了采集协议,使同一语料库可同时支撑发声、构音、韵律与可懂度四个维度的分析来源:LREC 2014 论文。对跨语种研究者而言,这意味着 PC-GITA 的元音类结果可以直接与日语、英语等五元音体系语言对比,但在元音数量更多的语言(如德语、英语)上,元音空间指标的基线行为会有所不同。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小/规模 | 理由 |
|---|---|---|---|
| 训练 PD 检测模型(实验室条件) | s-PC-GITA 标准版 | 100 人、约 6,300 条录音 | 干净隔音录音、标注完备、社区基准可比 |
| 真实临床条件泛化评估 | e-PC-GITA 扩展集 | 40 名说话人真实条件录音 | 与 s-PC-GITA 构成干净/噪声配对,专用于泛化测试来源:arXiv 2406.16128 |
| DDK 构音分析快速上手 | PC-GITA-pa-ta-ka 分割版 | 已分割 /pa/、/ta/、/ka/ 音段(16 kHz) | 免去自行分割与重采样,文件命名含标签来源:GitHub |
| 语音基座模型微调 | s-PC-GITA 标准版(重采样至 16 kHz) | 同上 | 与 SSL 预训练采样率对齐,社区主流做法 |
§3.1 模态详情
语音(唯一模态):全库为单声道 WAV 音频,44.1 kHz 采样、16-bit 量化,在隔音环境中以 Shure SM63L 动态全向麦克风(距嘴约 20 cm)配合 M-Audio Fast Track C400 声卡录制来源:Sci. Rep. 2022;Health Inf. Sci. Syst. 2021。录音由言语治疗师现场监督,保证任务执行的一致性来源:Polito 硕士论文。每个任务类型的声学特性与分析要点:
| 任务 | 每人条数 | 语音学维度 | 分析要点 |
|---|---|---|---|
| 持续元音 /a//e//i//o//u/ | 5×3=15 | phonation | jitter/shimmer/HNR、基频稳定性;注意时长常不足 3 秒 |
| 调制音调元音 | 5 | phonation + prosody | 音高控制能力、音域范围 |
| DDK 序列(6 组) | 6 | articulation | 音节速率、节拍规律性、塞音除阻质量 |
| 孤立词(官方 45 词) | 45(部分研究用 25 词子集) | articulation | 词级发音准确度、语图模式 |
| 句子 | 10 | prosody + articulation | 语调轮廓、句内停顿 |
| 阅读文本(对话体,含全部哥伦比亚西语音位) | 1 | intelligibility + prosody | 连贯言语综合评估;常截取前 33 音节做声学指标 |
| 独白(讲平常一天) | 1 | 自发言语 | 自发韵律、语言特征(可接 ASR 做 LLM 分析) |
社区统计每人约 63 条录音(将词按 25 计),全库约 6,300 条来源:NTNU 2023;官方论文口径为 45 个词来源:LREC 2014,两者口径差异见 §6.5 坑点 2。
§3.2 按子集的样本数
| 子集 | 人数 | 性别构成 | 录音条数(约) |
|---|---|---|---|
| PD 组 | 50 | 25 男 / 25 女 | 约 3,150 |
| HC 组 | 50 | 25 男 / 25 女 | 约 3,150 |
| 合计 | 100 | 50 男 / 50 女 | 约 6,300 |
§3.3 数据格式
| 属性 | 规格 |
|---|---|
| 容器/编码 | WAV(PCM 线性量化) |
| 采样率 | 44.1 kHz(社区衍生版有 16 kHz 降采样版本) |
| 位深 | 16-bit |
| 声道 | 单声道 |
| 文件命名 | 含受试者编号与任务信息(如 HC0001_01pa.wav / PD0001_02ta.wav,前缀 HC/PD + 4 位编号 + 片段序号 + 音段标签)来源:GitHub |
| 元数据 | 临床与人口学信息以随库表格/文档形式提供(以官方发放为准) |
§3.4 存储大小
官方未公开标称总存储量。按 44.1 kHz/16-bit/单声道计,每分钟音频约 5.3 MB;以每人 63 条、单条平均数十秒估算,全库原始 WAV 体量在 GB 量级。以实际申请获取后的发放包为准。
§3.5 标注方式
| 标注对象 | 方式 | 说明 |
|---|---|---|
| PD / HC 标签 | 临床诊断(人工) | 神经科专家依据运动症状与临床检查确诊特发性 PD |
| MDS-UPDRS-III | 量表评估(人工) | 同一位神经科专家完成,避免评分者间差异 |
| H&Y 分期 | 量表评估(人工) | 与 MDS-UPDRS-III 同次评估 |
| 确诊年限 | 病历抽取(人工) | 诊断日期与录音日期之差 |
| 年龄/性别 | 登记信息 | 用于分层与配对 |
§3.6 标注者资质与一致性
PD 患者由同一位神经科专家评估,H&Y 与确诊年限在 PD 组内部男女无显著差异(p 值分别为 0.927 与 0.157)来源:Sci. Rep. 2022。单一评分者设计消除了评分者间方差,但也意味着无法报告评分者间信度(如 Kappa/ICC),这一点在跨机构使用时应作为已知局限记录。录音过程由言语治疗师现场监督,确保任务执行一致来源:Polito 硕士论文。
§3.7 采集周期
语料库于 2014 年 5 月随 LREC 2014 论文首次公开发布来源:ACL Anthology;录音采集时间早于论文发表(schema_org 的 temporalCoverage 以 2012/2014 保守标注)。PD 患者统一在晨间服药后 3 小时内录音(ON 态),采集时段集中在临床工作时间内来源:Sci. Rep. 2022。
§3.8 地域覆盖
全部受试者来自哥伦比亚安蒂奥基亚省麦德林都会区,均为哥伦比亚西班牙语母语者;录音地点为麦德林 Clínica Noel来源:Sci. Rep. 2022。单城市、单机构采集是该数据集最重要的外推性约束之一(详见 §7.1)。
§3.9 设备规格
| 设备 | 型号/规格 | 作用 |
|---|---|---|
| 麦克风 | Shure SM63L 动态全向麦克风 | 主拾音(距嘴约 20 cm)来源:Sci. Rep. 2022 |
| 声卡 | M-Audio Fast Track C400 | A/D 转换与监听来源:Health Inf. Sci. Syst. 2021 |
| 录音环境 | 隔音室(noise-controlled booth) | 本底噪声控制来源:IEEE Access 相关研究 |
| 音频参数 | 44.1 kHz / 16-bit / 单声道 WAV | 存储规格来源:Sci. Rep. 2022 |
§3.10 深度溯源链
Universidad de Antioquia (GITA 研究组, Medellín) ← 数据发布与申请审核机构
├── Clínica Noel, Medellín ← 录音采集现场(伦理批准机构之一)
│ ├── 50 名 PD 患者(ON 态录音, MDS-UPDRS-III/H&Y 标注)
│ └── 50 名 HC(年龄/性别/受教育程度匹配)
├── FAU Erlangen-Nürnberg(Elmar Nöth 团队) ← 合作分析单位
└── LREC 2014 论文(ACL Anthology L14-1549) ← 官方引用出口
└── 学术申请发放(gita.udea.edu.co/contact) ← 当前唯一官方获取通道
└── 社区衍生:alicerueda/PC-GITA-pa-ta-ka ← 第三方分割版(引用原论文+分割论文)
§4 数据结构
§4.0 目录树
PC-GITA 官方发放为按受试者组织的 WAV 文件集(目录命名以实际发放为准,以下为典型组织方式的示意预览):
PC-GITA/
├── HC/ # 50 名健康对照
│ ├── HC0001/
│ │ ├── HC0001_a1.wav # 持续元音 /a/ 第 1 次
│ │ ├── HC0001_a2.wav
│ │ ├── HC0001_a3.wav
│ │ ├── HC0001_e1.wav ... # /e/ /i/ /o/ /u/ 各 3 次
│ │ ├── HC0001_ramp1.wav ... # 调制音调元音
│ │ ├── HC0001_pataka1.wav ... # 6 组 DDK
│ │ ├── HC0001_palabra01.wav ... # 孤立词(官方 45 词)
│ │ ├── HC0001_frase01.wav ... # 10 个句子
│ │ ├── HC0001_lectura.wav # 阅读文本
│ │ └── HC0001_monologo.wav # 独白
│ ├── HC0002/
│ └── ...
├── PD/ # 50 名 PD 患者
│ ├── PD0001/
│ └── ...
└── metadata/ # 临床与人口学信息(随库发放)
└── subjects_info # 受试者编号、组别、年龄、性别、
# MDS-UPDRS-III、H&Y、确诊年限
社区分割版 PC-GITA-pa-ta-ka 的组织则按"组别 + 编号 + 片段 + 音段标签"扁平命名(如 HC0001_01pa.wav、PD0001_02ta.wav),文件名本身即携带标签来源:GitHub。
§4.1 DAIMS 字段字典
以下为核心分析维度的字段字典(音频文件字段以文件名解析获得,临床字段以随库元数据为准):
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| subject_id | string | 受试者编号,HC/PD 前缀 + 4 位数字 | HC0001、PD0001 | 分组键、说话人级划分 | 无 | 无 | HC0001–HC0050、PD0001–PD0050 |
| group | category | 组别标签 | PD、HC | 二分类目标 | 无 | 无 | |
| sex | category | 性别 | M、F | 分层评估、公平性分析 | 无 | 无 | {M, F},每组各 25 |
| age_years | integer | 录音时年龄 | 61 | 协变量、年龄偏倚检查 | ±1 岁(登记口径) | 无 | 31–86 |
| mds_updrs_iii | float | MDS-UPDRS 运动检查总分 | 37.7 | 严重程度回归目标 | 量表评分粒度 | 无 | 6–93(组均值 37.7±18.3) |
| updrs_speech_item | float | MDS-UPDRS 第 3.1 项言语评分 | 1.3 | 言语症状分级 | 0–4 整数粒度 | 无 | 0–4(均值 1.3±0.8) |
| hoehn_yahr | float | H&Y 功能分期 | 2.2 | 分期分层评估 | 0.5 级粒度 | 无 | 1–5(均值 2.2±0.7) |
| years_diagnosed | float | 确诊年限 | 8.7 | 病程协变量 | 病历口径 | 无 | 0.4–43 |
| task_type | category | 录音任务类型 | sustained_vowel_a、ddk_pataka | 任务级分析、特征集选择 | 无 | 无 | 7 类(元音/调制/DDK/词/句/朗读/独白) |
| take_number | integer | 同任务重复序号 | 1、2、3 | 重复间稳定性分析 | 无 | 无 | 1–3(元音类)/1(其余) |
| sample_rate | integer | 采样率(Hz) | 44100 | 重采样检查 | 无 | 无 | 44100 |
| audio_path | string | 相对文件路径 | HC/HC0001/HC0001_a1.wav | 数据加载 | 无 | 无 | 路径字符串 |
§4.2 标签分布
| 标签 | 取值 | 计数 | 占比 |
|---|---|---|---|
| group | PD | 50 | 50% |
| group | HC | 50 | 50% |
| group × sex | PD-M / PD-F / HC-M / HC-F | 各 25 | 各 25% |
| H&Y(PD 组,均值 2.2±0.7) | 集中于 2 期附近 | 50 | 早期-中期为主 |
| UPDRS 言语项(均值 1.3±0.8) | 众数 1(轻度) | 50 | 轻度言语受累为主 |
标签要点:二分类完全平衡,准确率可直接比较,无需重采样;PD 严重程度集中于早中期(H&Y 2 期附近),重度患者稀少来源:NTNU 2023。
§4.3b 任务级分析建议
| 任务子集 | 推荐特征族 | 典型指标 | 主要风险 |
|---|---|---|---|
| 持续元音(5×3) | 频谱/微扰类:jitter、shimmer、HNR、CPPS | 元音空间面积、基频稳定性 | 时长不足 3 秒(坑点 4) |
| 调制元音 | 基频轮廓动态特征 | 音域跨度、调制速率 | 无客观参考基线,跨研究难比 |
| DDK(6 组) | 时域节拍 + 频谱爆破类:音节速率、VOT、EMA 类 | 音节规律性、塞音除阻质量 | 需音段级切分,预处理复杂 |
| 孤立词 | 语图模式 + 发音准确度 | 词级正确率、共振峰轨迹 | 词数口径分歧(坑点 2) |
| 句子 | 韵律类:F0/能量轮廓、停顿统计 | 语调范围、语速变异 | 句集差异导致跨库不可比 |
| 阅读文本 | 综合声学 + 可懂度 | AVQI(截取前 33 音节)、清晰度 | 连贯言语需端点检测先行 |
| 独白 | 自发韵律 + 语言特征(ASR+LLM) | 停顿比、词汇多样性 | 转写误差传导至语言特征 |
使用建议:单一研究至少固定一个"主任务 + 一个补充任务"并做任务消融;跨任务联合建模时以 task_type 条件化(坑点 8)。
§4.3 关键统计
| 统计项 | 数值 | 备注 |
|---|---|---|
| 受试者总数 | 100 | 50 PD + 50 HC来源:LREC 2014 |
| 语音文件总数 | 约 6,300 | 社区统计,每人约 63 条来源:NTNU 2023 |
| 任务类型数 | 7 大类 | 元音、调制元音、DDK、词、句、朗读、独白 |
| 持续元音 /a/ ≥3 秒比例 | HC 30.7% / PD 42.0% | AVQI 类指标需注意来源:J. Voice 相关研究 |
| 全体平均年龄 | 61 岁 | 两组几乎一致(PD 61.02 vs HC 60.98)来源:NTNU 2023 |
| MDS-UPDRS-III | 37.7±18.3 | Comput. Biol. Med. 2025 |
§4.4 数据层级
语料库(PC-GITA)
└── 受试者(subject,N=100,唯一键 subject_id)
└── 任务(task,每人 7 大类)
└── 录音条目(utterance,每人约 63 条;元音类含 3 次重复)
层级要点:所有分析单元最终归属于受试者;任何按 utterance 展开的分析都必须在受试者层做划分(详见 §5.3 泄漏风险)。
§4.5 缺失值与信息性缺失
| 字段/情形 | 缺失表现 | 处理建议 |
|---|---|---|
| 临床字段(PD 组独有) | HC 组无 MDS-UPDRS-III/H&Y/确诊年限 | 结构性缺失,非数据质量问题;回归任务仅用 PD 组 |
| 元音时长不足 | 部分受试者 /a/ 不足 3 秒(HC 69.3%、PD 58.0%) | 定长截取前改为依时长条件筛选,或改用短样本稳健指标 |
| 任务执行不完整 | 个别受试者个别任务缺失或重复次数不足 | 加载时按实际文件清单驱动,不硬编码任务×受试者笛卡尔积 |
| 词数口径差异 | 官方 45 词 vs 部分研究 25 词子集 | 以本地发放包实际文件数为准,报告时注明口径 |
§5 数据划分与使用建议
§5.1 官方划分
PC-GITA 不提供官方训练/验证/测试划分。原始论文与多数后续研究采用说话人级交叉验证(10 折为社区主流),每折内训练/测试说话人互斥来源:Sci. Rep. 2022;tomesphere/Interspeech。
§5.2 社区惯例划分
| 划分方式 | 做法 | 使用场景 |
|---|---|---|
| 10 折说话人级交叉验证 | StratifiedKFold 按受试者分组,两类比例逐折保持 | 论文主流,可与历史结果比较 |
| 每人每任务取 1 条 | 避免重复录音跨集泄漏 | 有研究为杜绝泄漏仅取单条来源:Comput. Biol. Med. 2025 |
| 按性别分层评估 | 男女分开训练/报告 | 性别对声学特征影响显著时的稳健性检查 |
| 跨语料库验证 | PC-GITA 训练 → 独立语料测试 | 泛化能力评估(性能通常显著下降) |
§5.3 泄漏风险与划分策略建议
最高优先级风险:受试者级泄漏。 每人约 63 条录音,若按文件随机划分,同一说话人的录音同时出现在训练与测试集,模型只需"记住嗓音"即可获得虚高准确率。任何实验报告前必须验证:训练集与测试集的 subject_id 交集为空。 推荐使用 GroupShuffleSplit 或 GroupKFold(group=subject_id),并对元音类 3 次重复做同样约束。
次级风险:任务级信息泄漏。 将持续元音训练的模型在独白上测试属于跨任务迁移,不属于泄漏但常被误读;报告跨任务结果时应明确标注"跨任务泛化"而非同任务性能。
建议的划分模板(分层 + 分组):
| 折序 | 训练说话人数 | 测试说话人数 | 分层约束 | 验证要点 |
|---|---|---|---|---|
| fold 1–10 各折 | 90 | 10 | PD/HC 各 45/5(±1),男女各半 | subject_id 零交集断言通过 |
| 全流程合计 | 每名受试者恰好在测试折出现 1 次 | — | 类比例逐折保持 | 重复 5 个随机种子 |
from sklearn.model_selection import GroupKFold
import pandas as pd
# df: 一行一条录音,含 subject_id / group / sex / task_type
groups = df["subject_id"]
y_subj = df.groupby("subject_id")["group"].first() # 受试者级标签
gkf = GroupKFold(n_splits=10)
for train_idx, test_idx in gkf.split(df, groups=groups):
train_subj = set(df.iloc[train_idx]["subject_id"])
test_subj = set(df.iloc[test_idx]["subject_id"])
assert len(train_subj & test_subj) == 0 # 说话人级零泄漏断言
# 同折内 PD/HC、性别比例应大致均衡(分层检查略)
§5.4 交叉验证建议
- 10 折 GroupKFold + 分层:以受试者为组、以 group(PD/HC) 为分层变量;元音类重复全部随受试者进入同一折。
- 嵌套 CV 做超参选择:外层评估、内层调参,避免测试折信息泄漏进超参(社区做法之一)来源:tomesphere/Interspeech。
- 重复实验:报告多随机种子的均值±标准差;单次 10 折结果在 100 人规模下方差不可忽略。
- 与历史基准对齐:若要与文献数字比较,尽量复现其折划分协议并在论文中注明差异。
§5.5 外部验证建议
优先级从高到低:(1) e-PC-GITA 扩展集(真实临床条件,40 人)——同语言同任务、声学条件配对的最强泛化测试来源:arXiv 2406.16128;(2) Neurovoz(卡斯蒂利亚西语,108 人)——同语言跨方言区来源:多机构对比研究;(3) Italian PVS(意大利语)与英语语料——跨语种迁移;(4) 自采的居家/手机录音环境——部署前必做。已有证据表明清洁录音训练的模型直接迁移到真实条件会大幅掉点(82.21%→67–68%),语音增强可部分挽回来源:Interspeech 2024。
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
PC-GITA 为申请制数据,无公共云端镜像。获得数据后,建议的云上目录布局:
# 假设数据包已解压至对象存储/本地盘
export PCGITA_ROOT=/data/pc-gita # 根目录:包含 HC/ 与 PD/ 两个子目录
ls $PCGITA_ROOT # 预期输出:HC PD metadata
export PCGITA_META=$PCGITA_ROOT/metadata/subjects_info
§6.1 快速上手
目录结构预期:data_root 下为 HC/HCxxxx/*.wav 与 PD/PDxxxx/*.wav 两级结构;data_root = PCGITA_ROOT,代码内以 os.path.join(data_root, group, subject_id, filename) 拼接。最小可用子集:5 个持续元音(每人 15 条、全库 1,500 条)——任务最简单、标注最干净,适合先跑通 pipeline 再扩展到全任务。
# 环境依赖:pip install soundfile numpy pandas torch torchaudio librosa
import os
import glob
import soundfile as sf
import pandas as pd
data_root = os.environ.get("PCGITA_ROOT", "/data/pc-gita")
def scan_corpus(data_root: str) -> pd.DataFrame:
"""扫描语料库,返回 utterance 级清单。
文件名携带关键信息:组别(HC/PD) + 编号 + 片段序号 + 任务/音段标签。
注意:不同发放批次命名可能不同,先抽样人工检查 5-10 个文件名。"""
rows = []
for wav_path in glob.glob(os.path.join(data_root, "*", "*", "*.wav")):
parts = wav_path.split(os.sep)
group, subject_id = parts[-3], parts[-2]
fname = os.path.splitext(parts[-1])[0]
rows.append({
"audio_path": wav_path,
"subject_id": subject_id,
"group": group, # HC / PD
"filename_stem": fname, # 后续按需解析任务标签
})
df = pd.DataFrame(rows)
# 采样率统一性检查(应为 44.1 kHz;混入 16 kHz 衍生文件需显式处理)
sr_check = sf.info(df["audio_path"].iloc[0]).samplerate
print(f"total utterances: {len(df)}, first file samplerate: {sr_check}")
return df
df = scan_corpus(data_root)
# 最小可用子集:持续元音 /a/(文件名含 'a1'/'a2'/'a3' 等模式的行,按实际命名调整)
vowel_a = df[df["filename_stem"].str.contains(r"_a\d+$", regex=True)]
print(f"sustained vowel /a/ subset: {len(vowel_a)} files") # 预期约 300(100 人 × 3 次)
§6.2 数据获取
| 步骤 | 内容 | 说明 |
|---|---|---|
| 1 | 访问官方申请表单 | GITA 研究组数据请求入口来源:PLOS Digital Health 数据声明 |
| 2 | 填写研究目的、机构与研究者信息 | 学术用途申请;建议附伦理批准材料 |
| 3 | 等待数据方审核与发放 | 获取方式与数据包以回复为准 |
| 4 | 记录获取日期与包版本 | 论文可复现性要求 |
| 替代 | PC-GITA-pa-ta-ka 分割版 | 仅 /pa/、/ta/、/ka/ 音段(16 kHz),可直接下载,引用须包含原论文与分割论文 |
# 下载完成后校验(示例)
import soundfile as sf
info = sf.info(os.path.join(data_root, "HC", "HC0001"))
print(info) # 检查采样率 44100、格式 WAV/PCM_16、声道 1
§6.3 预处理全流程
# 预处理流水线:重采样 → 单声道/幅值规范化 → 静音修剪 → 质量过滤
# 输入:scan_corpus() 产出的 utterance 级 DataFrame
import numpy as np
import librosa
import soundfile as sf
TARGET_SR = 16000 # 多数语音基座模型(Wav2Vec2/HuBERT/WavLM)的目标采样率
MIN_DURATION_S = 0.5 # 过短片段无分析价值
MIN_RMS = 1e-4 # 近似静音阈值
def preprocess_one(path: str, target_sr: int = TARGET_SR) -> np.ndarray:
# 1) 统一重采样:44.1 kHz → 16 kHz(librosa 内部做 polyphase 高质量重采样)
y, sr = librosa.load(path, sr=target_sr, mono=True)
# 2) 峰值规范化到 [-1, 1],消除说话人-麦克风距离差异
peak = np.max(np.abs(y))
if peak > 0:
y = y / peak
return y
def quality_filter(y: np.ndarray, sr: int) -> bool:
dur = len(y) / sr
rms = float(np.sqrt(np.mean(y ** 2)))
return (dur >= MIN_DURATION_S) and (rms >= MIN_RMS)
clean_rows = []
for row in df.itertuples():
try:
y = preprocess_one(row.audio_path)
if not quality_filter(y, TARGET_SR):
continue
out_path = row.audio_path.replace(data_root, f"{data_root}_16k") \
.replace(".wav", "_16k.wav")
os.makedirs(os.path.dirname(out_path), exist_ok=True)
sf.write(out_path, y, TARGET_SR, subtype="PCM_16")
clean_rows.append({**row._asdict(), "clean_path": out_path,
"duration_s": len(y) / TARGET_SR})
except Exception as e:
print(f"[skip] {row.audio_path}: {e}")
clean_df = pd.DataFrame(clean_rows)
# 持续元音时长分布检查:PC-GITA 中 /a/ ≥3 秒者仅 HC 30.7% / PD 42.0%
# (来源:https://ieeexplore.ieee.org/document/10753609/)
va = clean_df[clean_df["filename_stem"].str.contains(r"_a\d+$", regex=True)]
print(va["duration_s"].describe())
任务级切分建议:DDK 与朗读文本需要进一步切分(DDK 提取音节脉冲段;朗读可截取前 33 音节对齐社区惯例);独白建议做 VAD 分段。基座模型特征提取可直接整段输入(模型内部处理),手工声学特征(jitter/shimmer/HNR)则必须先做端点检测。
§6.4 PyTorch DataLoader 完整代码
# Dataset + transform + DataLoader:说话人级划分的端到端可运行示例
import torch
import torchaudio
from torch.utils.data import Dataset, DataLoader
from sklearn.model_selection import GroupShuffleSplit
class PCGitaDataset(Dataset):
""" utterance 级数据集。
预期目录结构:{root}/{HC|PD}/{subject_id}/*.wav(data_root 与清单 df 对应)。
最小可用子集:clean_df 中持续元音行(约 300 条)即可跑通。"""
def __init__(self, df: pd.DataFrame, target_sr: int = 16000,
max_seconds: float = 6.0, resample_from: int = 44100):
self.df = df.reset_index(drop=True)
self.target_sr = target_sr
self.max_samples = int(max_seconds * target_sr)
self.resampler = torchaudio.transforms.Resample(resample_from, target_sr)
def __len__(self):
return len(self.df)
def __getitem__(self, idx):
row = self.df.iloc[idx]
wav, sr = torchaudio.load(row["audio_path"]) # [1, T]
wav = wav.mean(dim=0, keepdim=True) # 单声道
if sr != self.target_sr:
wav = self.resampler(wav)
wav = wav / (wav.abs().max() + 1e-9) # 峰值规范化
if wav.shape[1] > self.max_samples: # 定长截断/补零
wav = wav[:, : self.max_samples]
else:
wav = torch.nn.functional.pad(wav, (0, self.max_samples - wav.shape[1]))
label = 1 if row["group"] == "PD" else 0
return wav.squeeze(0), label, row["subject_id"]
# —— 说话人级划分(防泄漏的关键步骤)——
subj = clean_df.groupby("subject_id").agg(
group=("group", "first"),
sex=("sex", "first") if "sex" in clean_df.columns else ("group", "first"),
).reset_index()
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
tr_idx, te_idx = next(gss.split(subj, groups=subj["subject_id"]))
train_subj, test_subj = set(subj.iloc[tr_idx]["subject_id"]), set(subj.iloc[te_idx]["subject_id"])
assert not (train_subj & test_subj) # 说话人级零泄漏
train_df = clean_df[clean_df["subject_id"].isin(train_subj)]
test_df = clean_df[clean_df["subject_id"].isin(test_subj)]
train_ds = PCGitaDataset(train_df)
test_ds = PCGitaDataset(test_df)
train_dl = DataLoader(train_ds, batch_size=16, shuffle=True, num_workers=4)
test_dl = DataLoader(test_ds, batch_size=16, shuffle=False, num_workers=4)
for wav, label, sid in train_dl: # 冒烟测试一个 batch
print(wav.shape, label[:8], sid[:2])
break
§6.5 坑点清单(8 个)
⚠️ 坑点 1:受试者级数据泄漏——每人约 63 条录音随机划分即虚高(分类:数据泄漏)
问题:PC-GITA 每名受试者贡献约 63 条录音,若按文件(utterance)随机划分训练/测试集,同一说话人的嗓音会同时出现在两侧;模型学习的是"嗓音身份"而非"病理特征",准确率虚高且不可复现。
症状:准确率轻松逼近 99–100%,但换一批新说话人(或换语料库)性能骤降;同任务不同论文数字差距悬殊。
解决:
- 简单方法:以
subject_id为 group 做GroupShuffleSplit/GroupKFold,并在代码中assert len(train_subj & test_subj) == 0。- 进阶方法:受试者级 10 折分层交叉验证(保持 PD/HC 与性别比例);元音的 3 次重复必须与受试者同折。有研究更严格——每人每任务仅取 1 条以彻底规避重复录音泄漏来源:Comput. Biol. Med. 2025。
- SOTA 方法:说话人级划分 + 嵌套 CV(内层调参、外层评估)+ 报告跨语料库(如 e-PC-GITA、Neurovoz)独立测试结果,形成"内部 CV + 外部泛化"双报告。
参考:Ranking pre-trained speech embeddings(Comput. Biol. Med. 2025);本 Wiki §5.3 划分模板代码。
⚠️ 坑点 2:词数口径分歧——官方 45 词 vs 研究常用 25 词子集(分类:工程陷阱)
问题:官方论文描述为 45 个孤立词,而多篇下游研究使用其中 25 个词的子集(社区统计每人 63 条、全库约 6,300 条亦基于 25 词口径)。混用口径会导致样本量对不上、跨论文不可比。
症状:文献综述时发现总文件数(6,300 vs 8,300+ 口径)、词任务条数(每人 25 vs 45)对不上号;复现论文时词任务数据缺失。
解决:
- 简单方法:以本地发放包实际文件数为准,在实验记录与论文中注明"词任务实际可用 N 词"。
- 进阶方法:若复现 25 词口径的论文,按其清单筛选文件;若使用全部 45 词,声明口径差异。
- SOTA 方法:建立 utterance 级清单(含 task_type 与词 ID),任何论文复现前先对清单做 diff。
参考:LREC 2014 官方论文(45 词);Health Inf. Sci. Syst. 2021(25 词口径);NTNU 2023(63 条/人口径)。
⚠️ 坑点 3:清洁录音到真实场景的泛化崩溃——s-PC-GITA 82.21% → e-PC-GITA 67–68%(分类:偏倚陷阱)
问题:s-PC-GITA 全部在隔音室、专业设备下录制;据此训练的模型直接用于真实临床/居家环境(背景噪声、混响、采访者干扰)时性能严重下降,Interspeech 2024 实测从 82.21% 跌至约 67–68%。
症状:论文数字漂亮,试点部署失效;清洁数据上调参越狠,掉得越惨。
解决:
- 简单方法:训练时加入噪声/混响数据增强(加性噪声、room impulse response 卷积)。
- 进阶方法:测试时部署语音增强管线(VAD → 去混响 → 去噪);Interspeech 2024 的三段式增强使 WavLM Base 从 68.58% 恢复到 83.33%来源:arXiv 2406.16128。
- SOTA 方法:多条件训练(clean + simulated noisy + enhanced),并在 e-PC-GITA 类真实扩展集上例行外部验证;WavLM + HuBERT 集成在增强后的 e-PC-GITA 上达 88.33%。
参考:La Quatra et al., Interspeech 2024, DOI 10.21437/Interspeech.2024-522。
⚠️ 坑点 4:持续元音时长不足 3 秒——AVQI 类指标的隐性偏差(分类:预处理陷阱)
问题:PD 患者呼吸支持不足导致持续元音偏短;PC-GITA 中仅 30.7% 的 HC 与 42.0% 的 PD 受试者 /a/ 录音 ≥3 秒,而 AVQI 等声学指标按 3 秒窗定义,直接计算会系统性剔除更多 HC、扭曲组间比较。
症状:计算 AVQI 时样本量骤减且两组不均衡;把"被剔除的受试者"与"被保留的受试者"对比发现 PD 占比反常。
解决:
- 简单方法:对不足 3 秒的样本改用短窗稳健指标(如 CPPS、短时 HNR),不做硬剔除。
- 进阶方法:验证研究支持基于更短 /a/(约 0.8 秒拼接连续语音 33 音节)计算 AVQI 的有效性,可用拼接法保住样本来源:IEEE 相关研究。
- SOTA 方法:直接使用对时长鲁棒的表征(基座模型 embedding)替代定长声学指标,并在论文中报告时长分布。
参考:The Effectiveness of Acoustic Voice Quality Index to Identify People With Parkinson’s Disease(IEEE)。
⚠️ 坑点 5:ON 状态录音——结果不能外推到 OFF 态与药物波动(分类:标签理解)
问题:所有 PD 录音均在晨间服药后 3 小时内(药效 ON 态)完成;模型学到的是"ON 态 PD 语音",对 OFF 态、剂末现象或日内波动场景无直接证据支持。
症状:把模型用于未服药患者或多时点随访时性能与解释均失真;做"药物状态分类"类任务时混淆变量无法拆解。
解决:
- 简单方法:在数据卡与论文 Limitations 中显式声明 ON 态约束;临床解读限定于用药状态。
- 进阶方法:需要 OFF 态研究时,配合含 ON/OFF 双态的语料(如 Viswanathan 数据集含 ON/OFF 录音)做联合分析来源:Sci. Rep. 2022。
- SOTA 方法:多时点纵向采集设计,将用药状态作为协变量建模,而不是忽略。
参考:Pah et al., Sci. Rep. 2022, DOI 10.1038/s41598-022-13865-z。
⚠️ 坑点 6:性别混杂与分层——男女声学基线差异大于病理差异(分类:偏倚陷阱)
问题:基频、声道长度等声学特征存在显著性别差异;若划分或评估不按性别分层,模型可能部分依赖性别线索做判别,掩盖真实的病理特征贡献。
症状:特征重要性分析中基频(F0)等性别相关特征权重异常高;分性别测试时性能明显不对称;跨数据集迁移时性别构成变化导致掉点。
解决:
- 简单方法:利用 PC-GITA 每组 25 男 25 女的平衡结构,报告总体与分性别两套指标。
- 进阶方法:性别作为协变量归一化(F0 z-score 化、说话人内归一化);或按性别分池训练来源:Health Inf. Sci. Syst. 2021。
- SOTA 方法:对抗性去性别化(adversarial removal of sex information)+ 公平性指标(分性别 AUC 差距)纳入模型选择。
参考:An algorithm for Parkinson’s disease speech classification based on isolated words analysis(Health Inf. Sci. Syst. 2021)。
⚠️ 坑点 7:44.1 kHz 与 16 kHz 采样率错配——基座模型输入 silently 失真(分类:工程陷阱)
问题:PC-GITA 原始采样率 44.1 kHz,而 Wav2Vec 2.0/HuBERT/WavLM 等基座模型要求 16 kHz 输入;忘记重采样或重复重采样会让模型输入频谱失真,且错误往往静默发生。
症状:微调性能显著低于文献;同一权重重跑结果不稳定;打印wav.shape发现帧数与预期时长对不上。
解决:
- 简单方法:加载时强制
librosa.load(path, sr=16000)或torchaudio.transforms.Resample(44100, 16000),并在 Dataset 中断言sr == 16000。- 进阶方法:预处理阶段一次性批量降采样落盘(16 kHz PCM_16),训练管线只读 16 kHz 版本,避免每个 epoch 重复计算。
- SOTA 方法:数据版本管理(DVC 类工具)将 44.1 kHz 原始包与 16 kHz 衍生包分版本登记,保证可追溯。
参考:medRxiv 2025(全部信号重采样至 16 kHz 的协议);社区分割版即按 16 kHz 发放。
⚠️ 坑点 8:任务混用与跨任务比较——元音准确率 ≠ 独白准确率(分类:评估误用)
问题:不同语音任务携带不同信息维度与难度:持续元音偏发声质量、DDK 偏构音控制、独白偏自发韵律与语言;把不同任务的准确率直接排序或混合训练不做任务标记,会得出"模型 A 优于模型 B"的伪结论。
症状:文献间同任务数字差异大(如元音任务 84.3%来源:Sci. Rep. 2022 vs 集成模型 99% 的另一口径);混合任务训练后性能反而低于单任务最优。
解决:
- 简单方法:任何实验固定"任务集 + 重复数 + 特征集"三元组并在报告头注明;跨论文比较只对同任务进行。
- 进阶方法:多任务训练时以 task_type 做条件化(任务 embedding 或分头输出),评估按任务分桶报告。
- SOTA 方法:利用任务结构做特征互补(phonation + articulation + prosody 特征级融合),并报告任务消融实验;跨任务迁移单独设协议,不与同任务结果混排。
参考:Feature Representation of Pathophysiology of Parkinsonian Dysarthria(DDK 特征体系);多任务语料对比研究。
§6.6 数据增强
| 增强 | 安全性 | 说明 |
|---|---|---|
| 加性高斯/环境噪声 | ✅ 安全 | 提升噪声鲁棒性(对应坑点 3),SNR 建议 5–20 dB |
| 混响模拟(RIR 卷积) | ✅ 安全 | 模拟真实房间,配合坑点 3 的增强管线 |
| 随机增益/音量抖动 | ✅ 安全 | 消除录音距离差异,幅度限制在 ±6 dB 内 |
| 时间拉伸(±10%) | ⚠️ 慎用 | 轻度拉伸可接受;但 PD 语速本身是病理特征,过度拉伸会破坏病理信息 |
| 音高抖动 | ❌ 危险 | F0 与性别、病理均强相关,音高变换会同时改变性别与病理线索 |
| SpecAugment 掩蔽 | ⚠️ 慎用 | 特征级掩蔽可用于正则,但掩蔽过强会抹掉 PD 微扰特征 |
| 随机裁剪(元音段内) | ✅ 安全 | 元音类任务定长输入的常规做法;避免跨静音边界 |
# 增强:加性噪声与混响的最小实现(训练时在线应用)
import numpy as np
def add_noise(y: np.ndarray, snr_db: float = 10.0, rng=None) -> np.ndarray:
"""加性高斯白噪声增强:按目标 SNR 缩放噪声能量。"""
rng = rng or np.random.default_rng()
sig_power = np.mean(y ** 2)
noise = rng.standard_normal(len(y))
noise_power = np.mean(noise ** 2)
scale = np.sqrt(sig_power / (noise_power * 10 ** (snr_db / 10)))
return y + scale * noise
def apply_rir(y: np.ndarray, rir: np.ndarray) -> np.ndarray:
"""房间脉冲响应(RIR)卷积增强:模拟混响,输出取原信号长度。"""
wet = np.convolve(y, rir)[: len(y)]
peak = np.max(np.abs(wet))
return wet / peak if peak > 0 else wet
增强使用原则:噪声/混响/增益类变换改变"录音条件"而不改变"病理状态",两类标签下均可安全使用;时间与音高类变换会直接修改病理相关的声学证据(语速、基频),PD 语料上必须保守或禁用。
§6.7 模型推荐
| 模型 | 适用任务 | 关键点 |
|---|---|---|
| SVM + 手工声学特征(DisVoice 类) | 元音/DDK 基线 | 可解释性强,与历史文献可比(原论文约 91.3%) |
| 1D-CNN / CRNN(原始波形或梅尔谱) | 单任务检测 | 参数量小,100 人规模不易过拟合 |
| Audio Spectrogram Transformer | 元音与连续言语 | 2024 年在 PC-GITA 报告 91.67%来源:PubMed 39665946 |
| Wav2Vec 2.0 / HuBERT / WavLM(SSL 微调) | 全任务、泛化优先 | WavLM Base 干净集 82.21%;增强后真实条件 83.33%来源:Interspeech 2024 |
| Whisper encoder(监督预训练) | 噪声条件 | 对噪声更稳健,适合真实部署探索来源:Interspeech 2024 |
| ASR + LLM(语言特征路线) | 独白/自发言语 | Whisper 转写后接语言特征,捕捉言语内容维度来源:arXiv 2404.05160 |
§6.8 硬件需求
| 配置档 | GPU/内存 | 适用场景 |
|---|---|---|
| 入门 | CPU / 16 GB RAM | 手工声学特征 + SVM/RF 基线;全库特征提取约数分钟至数十分钟 |
| 标准 | 单卡 8–12 GB(如 RTX 3080 级) | 1D-CNN/CRNN 训练;AST 微调(16 kHz 短序列) |
| 高配 | 单卡 24 GB+(如 A100 级) | Wav2Vec 2.0/WavLM 全量微调(batch 8–16,混合精度) |
§6.9 评估指标代码
# PD 检测标准指标:Accuracy + Sensitivity/Specificity + AUC + MCC
# 类平衡(50/50)下准确率可用,但敏感性/特异性必须分开报告
import numpy as np
from sklearn.metrics import (accuracy_score, balanced_accuracy_score,
roc_auc_score, matthews_corrcoef,
confusion_matrix)
def evaluate(y_true, y_score, threshold: float = 0.5) -> dict:
y_pred = (np.asarray(y_score) >= threshold).astype(int)
tn, fp, fn, tp = confusion_matrix(y_true, y_pred).ravel()
return {
"accuracy": accuracy_score(y_true, y_pred),
"balanced_acc": balanced_accuracy_score(y_true, y_pred),
"sensitivity": tp / (tp + fn), # PD 召回(漏诊率的补)
"specificity": tn / (tn + fp), # HC 召回(误报率的补)
"auc": roc_auc_score(y_true, y_score),
"mcc": matthews_corrcoef(y_true, y_pred),
}
# 回归任务(MDS-UPDRS-III 预测)追加 MAE / RMSE / Pearson r
from scipy.stats import pearsonr
from sklearn.metrics import mean_absolute_error, mean_squared_error
def evaluate_regression(y_true, y_pred) -> dict:
r, p = pearsonr(y_true, y_pred)
return {
"mae": mean_absolute_error(y_true, y_pred),
"rmse": float(np.sqrt(mean_squared_error(y_true, y_pred))),
"pearson_r": r, "pearson_p": p,
}
§6.10 MLOps 笔记
- 数据版本化:原始 44.1 kHz 包与 16 kHz 衍生包分别登记版本;utterance 级清单(含任务标签解析规则)入库并随实验提交。
- 实验追踪:每次运行记录"任务集三元组 + 划分种子 + 分组键",任何指标与运行配置绑定;建议把"训练/测试 subject_id 交集为空"做成 CI 断言。
- 模型卡:记录 ON 态约束、单城市采集、44.1 kHz 设备口径等边界条件(对应 §7.1 偏倚表)。
- 部署前门禁:上线前必须在 e-PC-GITA 类真实条件集或自采噪声数据上复测;清洁集指标不得单独作为发布依据。
- 漂移监控:线上监控输入音频的采样率、时长分布与静音比,漂移超出阈值触发再评估(对应 §7.6)。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 地域偏倚 | 全部受试者来自麦德林单一城市、单一机构,方言与口音多样性受限 | 中 | 跨语料库(Neurovoz 等)外部验证;报告时声明地域边界 |
| 录音条件偏倚 | 隔音室 + 专业设备,与真实环境差距大;清洁集训练模型在真实条件大幅掉点(82.21%→67–68%) | 高 | 噪声/混响增强;测试时语音增强;e-PC-GITA 外部验证 |
| 用药状态偏倚 | PD 组全部 ON 态录音,覆盖不了 OFF 态与日内波动 | 中 | 局限声明;配合 ON/OFF 双态语料研究 |
| 严重程度偏倚 | H&Y 集中于 2 期附近(2.2±0.7),重度患者稀少 | 中 | 分期分层评估;回归任务报告分区间误差 |
| 年龄轻微不均 | HC 在 60–65 岁段占比略高 | 低 | 年龄匹配设计已缓解大部分;分层敏感性分析 |
| 单评分者标注 | 临床量表由同一位神经科专家评定,无评分者间信度 | 低-中 | 引用结果时注明;跨机构使用需复核标注协议 |
| 词数口径分歧 | 官方 45 词 vs 研究常用 25 词子集,影响可比性 | 低 | 清单化管理并注明口径(坑点 2) |
§7.2 标注质量
诊断标签(PD/HC)来自神经科临床确诊,金标准性质明确;MDS-UPDRS-III、H&Y 由同一位专家评定,内部一致性好,但缺少评分者间信度报告。量表覆盖 PD 组全体(50/50),HC 组无临床量表(结构性缺失,见 §4.5)。言语专项标注方面,社区研究补充了 m-FDA(modified Frenchay 构音障碍评估,13 项×0–4,总分 0–52)等构音障碍分级用于严重程度建模来源:tomesphere/Interspeech。总体而言,标注质量足以支撑检测与分级研究,但不支持细粒度症状定位(如具体构音器官维度)的直接训练。
§7.3 泛化性评估
| 部署场景 | 失效风险 | 证据 |
|---|---|---|
| 同机构实验室条件复测 | 低 | 与训练条件同分布,社区基准即可覆盖 |
| 跨机构临床(同语言) | 中 | 方言、设备、流程差异;建议 Neurovoz 类外部验证 |
| 真实病房/居家环境 | 高 | 清洁→真实掉点实测:82.21%→67–68%来源:Interspeech 2024 |
| 跨语种(西语→其他语言) | 中-高 | 语言无关线索存在但性能下降;迁移实验显示方法可行来源:medRxiv 2025 |
| 跨疾病(帕金森以外运动障碍) | 高 | 语料库不含其他疾病对照,鉴别诊断能力无证据支持 |
| OFF 态/药物波动监测 | 高 | 语料库仅覆盖 ON 态(坑点 5) |
§7.4 伦理合规
录音采集遵循赫尔辛基宣言,经麦德林 Clínica Noel 伦理委员会批准来源:Sci. Rep. 2022;同时有文献记录安蒂奥基亚大学医学院伦理委员会批准(批件号 19-63-673)来源:Health Inf. Sci. Syst. 2021。全体受试者签署知情同意书。数据以假名化(受试者编号 HCxxxx/PDxxxx)形式经学术申请发放,不含姓名等直接标识。音频与言语本身属于敏感健康数据:受试者语音可能被熟人以嗓音特征识别,下游研究者不得尝试重新识别受试者身份,不得将数据用于说话人识别类任务。
§7.5 公平性
性别:每组 25 男 25 女,训练分布均衡,但性别相关声学差异仍需分层评估(坑点 6)。年龄:31–86 岁跨度较大、两组匹配,但 60–65 岁段 HC 略多。地域:单一城市,南美西班牙语口音代表性受限;模型在其他西语区(西班牙、墨西哥等)部署前必须复测。残障与共病信息:语料库未系统收录共病与言语治疗史,公平性分析深度受限。建议下游论文按"总体 + 分性别 + 分年龄带"三档报告指标。
§7.6 数据漂移
潜在漂移源:(1) 录音设备漂移——不同发放批次或复刻采集若更换麦克风/声卡,频谱响应差异会直接进入模型输入;(2) 人群漂移——部署地区与麦德林人群的口音、年龄构成差异;(3) 任务执行漂移——远程采集时麦克风距离、环境噪声不可控,元音时长分布会进一步右移;(4) 药物方案漂移——不同医疗中心的 PD 用药方案差异影响 ON 态言语状态。监控建议:对输入流持续统计采样率、时长、静音比与基础声学指标(F0、能量),偏离训练分布时触发告警(详见 §6.10)。
§7.7 DAIMS 24 项检查表
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式数据 | ✅ | utterance 级清单可一表承载(文件路径 + 元数据列) |
| 2 | 唯一标识 | ✅ | subject_id(HCxxxx/PDxxxx)+ 文件名内含编号与片段序号 |
| 3 | 特殊字符处理 | ⚠️ | 西语字符(á é í ó ú ñ)见于文档与部分标注;文件名主体为 ASCII,解析时注意编码声明 |
| 4 | 重复行 | ✅ | 每条录音物理上唯一;元音 3 次重复为设计内重复,需在清单中标记 take_number |
| 5 | 缺失编码 | ✅ | 无缺失哨兵值;HC 组临床字段为结构性缺失(见 §4.5) |
| 6 | 标签标识 | ✅ | group 标签以目录前缀 HC/PD 编码,二分类完全平衡(50/50) |
| 7 | 罕见类分组 | ⚠️ | H&Y 4 期、UPDRS 言语项 0 分等尾部类别样本稀少,需合并分箱或改回归 |
| 8 | 偏倚评估 | ✅ | ON 态、单城市、录音条件、严重程度集中等偏倚已系统梳理(§7.1) |
| 9 | 数据字典 | ⚠️ | 官方随库文档描述任务协议;机器可读数据字典需研究者自建(§4.1 可直接复用) |
| 10 | 信息性缺失解释 | ✅ | HC 组无临床量表、元音时长不足均为信息性缺失,含义明确 |
| 11 | 设备记录 | ✅ | 麦克风(Shure SM63L)、声卡(Fast Track C400)、采样率(44.1 kHz/16-bit)有文献记录 |
| 12 | 共线性 | ⚠️ | 手工声学特征族内共线性强(jitter 各变体、shimmer 各变体),建模前需筛选 |
| 13 | 编码映射 | ✅ | ICD-11/SNOMED 映射已给出(§2.1、§2.1b);量表分值含义见 §2.6 |
| 14 | 时间戳处理 | ⚠️ | 无逐条时间戳;采集年份与确诊年限可用,纵向分析不可行 |
| 15 | 划分建议 | ✅ | 说话人级 GroupKFold 划分模板已给出(§5.3),官方无划分需自建 |
| 16 | 泄漏讨论 | ✅ | 受试者级泄漏为该数据集头号风险,四段式坑点 1 与 §5.3 专门覆盖 |
| 17 | 标签分布 | ✅ | 二分类 50/50;严重程度分布与性别分布已列(§4.2) |
| 18 | 测量偏倚 | ✅ | 麦克风距嘴 20 cm、ON 态、隔音室等测量条件已记录(§3.9) |
| 19 | 外部验证建议 | ✅ | e-PC-GITA、Neurovoz、Italian PVS、跨语种语料优先级已给出(§5.5) |
| 20 | 版本记录 | ⚠️ | 标准版 2014 年后无公开版本号演进;e-PC-GITA 与社区分割版需自行登记版本 |
| 21 | 预处理脚本 | ⚠️ | 无官方预处理脚本;本页 §6.3 提供可运行参考实现 |
| 22 | 合规要求 | ✅ | 学术申请制 + 伦理批准 + 假名化,合规路径清晰(§7.4) |
| 23 | 多模态对齐 | ❌ | 仅音频单模态;与影像/手写等其他模态的数据集不能做样本级对齐 |
| 24 | 去标识化 | ✅ | 受试者编号假名化发放;语音再识别风险需使用者自律(§7.4) |
DAIMS 评分:17.5 / 24(✅ 计 1 分、⚠️ 计 0.5 分、❌ 计 0 分)
评分解读:PC-GITA 在标识体系、标签平衡、偏倚披露与合规路径上表现优秀——这是其能成为社区基准的结构性原因。失分集中在"机器可读性"环节:无官方数据字典与预处理脚本、无官方划分、无版本化演进,意味着研究者需要投入一致性的工程整理工作;单模态限制则是数据集定位使然,无法通过整理弥补。
对你意味着什么:(1) 直接复用本页 §4.1 字段字典与 §6 代码,可把"工程整理"成本从数周压缩到数小时;(2) 任何实验从第一天就采用说话人级划分(§5.3),否则结果不可发表;(3) 若你的目标是发论文,把外部验证(e-PC-GITA / Neurovoz)写进实验设计而不是留作 future work;(4) 若你的目标是产品,清洁集指标只能作为开发参考,上线依据必须来自真实条件测试;(5) 不要尝试在本库上做多模态或纵向建模——先换数据集或明确降级研究问题。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| e-PC-GITA(真实临床条件) | 安蒂奥基亚大学 / NTNU / Politecnico di Torino 等 | PD 检测(DDK/句/独白) | 准确率 67–68%(WavLM Base,未增强) | 较 s-PC-GITA 的 82.21% 下降约 14–15 个百分点 | 清洁→真实泛化差距显著;语音增强后回升至 83.33%,集成达 88.33%来源:Interspeech 2024 |
| 独立含噪西语语料(18 PD + 19 HC) | 与 PC-GITA 同伦理体系的研究合作方 | 孤立词 PD 检测 | 跨语料库性能显著低于库内 | 库内最优显著下降 | 常规房间 + 头戴耳机条件下手工特征方法退化,证实设备/环境偏倚来源:Health Inf. Sci. Syst. 2021 |
| 多语种病理语音(含英语等) | 多机构 | 跨语种 PD 迁移 | Wav2Vec 1.0 Large 在 PC-GITA 仍有竞争力 | 与英语库内相比下降 | 判别 PD 的线索部分语言无关;基座模型跨语种迁移可行来源:medRxiv 2025 |
| 独立 PD 语料(20 PD + 20 HC,含噪) | GPRS(哥伦比亚国立大学)提供 | DDK 任务 PD 检测 | 嵌套 10 折 CV + 盲测 | 盲测集性能低于库内 CV | 多谱分辨率自编码器在真实环境验证,差距可控来源:tomesphere/Interspeech |
§8 基准性能与生态
§8.1 排行榜(同协议内数字不可直接比较)
以下结果来自不同任务、特征与划分协议,仅作能力量级参考:
| 排名 | 模型/方法 | 性能(任务) | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | CNN(过拟合争议结果,谨慎引用) | 准确率 100%(多数据集报告) | 2023 | CNN/LSTM 端到端 | 该结果来自系统综述收录的 2023 年报告,存在说话人泄漏嫌疑,不推荐作为复现目标(见 §6.5 坑点 1) | — |
| 2 | Ensemble of CNNs(迁移学习集成) | 准确率 99%、灵敏度 86.2%、特异度 93.3%、AUC 89.6%(2022 多库报告) | 2022 | 多预训练 CNN 微调集成 | 数值来自系统综述收录报告,协议与划分需复核 | — |
| 3 | AST(Audio Spectrogram Transformer) | 准确率 91.67%(PC-GITA) | 2024 | 频谱图 + 自注意力,16 kHz 标准化预处理 | Lee et al., 2024, J. Voice. DOI 10.1016/j.jvoice.2024.11.016(PubMed 39665946) | — |
| 4 | SVM(原始论文) | 准确率约 91.3%(语音特征) | 2014 | 手工声学特征 + SVM | Orozco-Arroyave et al., 2014, LREC. ACL Anthology L14-1549 | — |
| 5 | WavLM Base + HuBERT Base 集成(增强后 e-PC-GITA) | 准确率 88.33%、灵敏度 85.00%、特异度 91.67%(真实条件) | 2024 | SSL 基座微调 + VAD/去混响/去噪管线 | La Quatra et al., 2024, Interspeech. DOI 10.21437/Interspeech.2024-522(arXiv 2406.16128) | — |
| 6 | VTL 特征 + SVM(持续元音 5 元音) | 准确率 84.3%(/a//e//i//o//u/) | 2022 | 声道长度(VTL)相关特征 | Pah et al., 2022, Sci. Rep. DOI 10.1038/s41598-022-13865-z(全文) | — |
| 7 | Wav2Vec 2.0 Base 微调 | 平均准确率约 80%、AUC 0.8 | 2024 | SSL 表征 + 分类头 | 数值见 medRxiv 2025 引文 | — |
不可直接比较的原因:任务集不同(元音 vs 全任务 vs 真实条件)、划分协议不同(说话人级 CV vs 疑似泄漏的随机划分)、指标口径不同(准确率 vs AUC)。引用任何数字前务必核对原文协议。
§8.2 SOTA 总结与选型建议
当前可复现的稳健量级:清洁条件、说话人级划分下,准确率 80–92% 区间;手工特征 SVM(91.3%)与 AST(91.67%)位于区间上沿,SSL 基座单模型(80–82%)位于中段,但其优势在真实条件下的增强后恢复力(83.33–88.33%)。选型建议:可解释性研究选手工特征 + SVM/RF 路线;追求稳健部署选 WavLM/HuBERT + 语音增强;资源受限选 1D-CNN 轻量路线。100% 类结果应视为泄漏征兆而非 SOTA(坑点 1)。
| 你的目标 | 推荐路线 | 理由 |
|---|---|---|
| 临床可解释研究(哪些声学维度受累) | 手工声学特征(jitter/shimmer/HNR/CPPS)+ SVM/RF + 特征重要性分析 | 与 PD 言语病理学知识直接对应,便于临床解读 |
| 检测性能上限探索(干净条件) | AST 或 CNN 系架构 + 多任务特征融合 | 区间上沿表现;注意说话人级划分 |
| 真实条件部署(家庭/病房) | WavLM/HuBERT 基座 + 训练增强 + 测试时语音增强管线 | 增强后真实条件恢复力最强(83.33–88.33%) |
| 言语内容/语言维度研究 | Whisper 转写 + LLM 语言特征 | 独白任务的语义与句法维度补充声学盲区 |
| 轻量端侧筛查设备 | 1D-CNN + 手工特征混合 | 参数量与算力预算友好 |
§8.3 评测协议
社区主流协议:说话人级 10 折分层交叉验证;每折报告准确率、灵敏度、特异性与 AUC;多次种子重复后报告均值±标准差。严格协议在此基础上叠加:嵌套 CV 调参、每人每任务单条防泄漏、外部语料盲测。复现 Interspeech 2024 协议时注意其使用 DDK、句子与独白任务及三段式语音增强管线来源:Interspeech 2024。
§8.4 相关数据集
| 数据集 | 语言 | 规模 | 与 PC-GITA 的关系 |
|---|---|---|---|
| Neurovoz | 卡斯蒂利亚西语 | 108 人(53 PD + 55 HC) | 同语言外部验证首选来源:多机构对比研究 |
| Italian PVS | 意大利语 | 50 人(28 PD + 22 HC) | IEEE DataPort 开放,跨语种验证常用 |
| Saarbrücken PD db | 德语 | 88 人(44 PD + 44 HC) | 早期经典库,跨语种对照 |
| Oxford/UCI voice | 英语 | 31 人 / 195 条记录 | 开放即下,适合教学与快速原型 |
| Viswanathan dataset | 英语(澳) | 24 PD + 22 HC(ON/OFF 双态) | 药物状态研究的互补语料来源:Sci. Rep. 2022 |
| e-PC-GITA | 哥伦比亚西语 | 40 名说话人(真实条件) | 同语言真实条件扩展,泛化测试首选来源:arXiv 2406.16128 |
§8.5 关键论文 Top 6
- Orozco-Arroyave, J.R., Arias-Londoño, J.D., Vargas-Bonilla, J.F., González-Rátiva, M.C., Nöth, E., 2014, LREC. ACL Anthology L14-1549 — PC-GITA 官方发布论文:协议设计、任务集与元音表征基线。
- La Quatra, M., Turco, M.F., Svendsen, T., Salvi, G., Orozco-Arroyave, J.R., Siniscalchi, S.M., 2024, Interspeech. DOI 10.21437/Interspeech.2024-522(arXiv 2406.16128) — 基座模型 + 语音增强,确立 s-PC-GITA/e-PC-GITA 干净-真实配对协议。
- Pah, N.D., Motin, M.A., Kumar, D.K., 2022, Scientific Reports. DOI 10.1038/s41598-022-13865-z(全文) — 五元音 VTL 特征 + SVM(84.3%),并完整披露 PC-GITA 人口学/临床表。
- Lee, B.-I. et al., 2024, Journal of Voice.(PubMed 39665946) — AST 在 PC-GITA 与 Italian PVS 的跨语种评测(91.67%)。
- Cernak et al. 与 GITA 团队系列工作(DisVoice 工具链),2016–2019 — 手工声学特征标准化提取工具,社区特征基线的事实标准来源:UdeA GITA。
- Rueda, A., Vásquez-Correa, J.C., Orozco-Arroyave, J.R., Nöth, E., Krishnan, S., 2022, Computer Speech and Language. DOI 10.1016/j.csl.2021.101322 — DDK 音段经验模态分解特征;配套分割版数据。
§8.6 社区活跃度
PC-GITA 的社区活跃度主要体现在学术引用与衍生工具上:截至 2026-09,Semantic Scholar 记录 268+ 次引用,覆盖语音病理、深度学习与跨模态融合多个方向;GITA 研究组持续维护 DisVoice、Neurospeech 等配套软件来源:UdeA GITA;GitHub 上存在社区维护的分割版与特征提取仓库(如 PC-GITA-pa-ta-ka、phonet)。数据本体无公开 issue 跟踪,获取与使用问题需直接通过申请表单与数据方沟通。学术活动方面,PC-GITA 相关工作稳定出现在 Interspeech、ICASSP 与 LREC 等语音领域主要会议,2024–2025 年的最新进展集中在语音基座模型评测与跨语种迁移方向。
§8.7 生态快照
| 资源 | 类型 | 链接 | 状态(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| GITA 研究组主页 | 官方站点 | gita.udea.edu.co | 在线 | 数据申请、团队与成果入口 |
| 官方申请表单 | 数据获取 | gita.udea.edu.co/contact | 在线 | 唯一官方获取通道 |
| LREC 2014 论文 | 论文 | ACL Anthology L14-1549 | 开放获取 | 协议与任务集权威描述 |
| PC-GITA-pa-ta-ka | 社区数据 | GitHub | 公开 | 免申请的 DDK 音段子集(16 kHz) |
| DisVoice | 特征工具 | GITA 系列软件 | 公开 | 标准化手工声学特征提取 |
| phonet | 特征工具 | GitHub | 公开 | 爆破音后验等语音学特征提取 |
| Interspeech 2024 论文 | 论文 | NTNU Open 全文 | 开放获取 | 基座模型 + 语音增强协议 |
§9 相关资源与引用
§9.1 官方资源
- GITA 研究组主页 — 数据申请、研究线与团队信息(安蒂奥基亚大学,麦德林)。
- 官方数据申请表单 — PC-GITA 唯一官方获取通道来源:PLOS Digital Health 数据声明。
- LREC 2014 官方论文页 — 协议、任务集与元音表征结果(开放获取 PDF)。
- UdeA 工学院 GITA 介绍页 — 研究组资质(哥伦比亚科学部 A1 类)与配套软件清单。
- PC-GITA-pa-ta-ka 分割版 — 社区维护的 DDK 音段(16 kHz),附引用要求。
- DisVoice / phonet 工具 — 语音学特征提取,与 PC-GITA 同源团队维护。
§9.2 教程与复现资源
- La Quatra et al., Interspeech 2024 全文(NTNU Open) — 基座模型微调与语音增强管线的完整实验协议。
- Pah et al., Sci. Rep. 2022 — 五元音特征统计与 SVM 分类全流程,附 PC-GITA 人口学表。
- Ranking pre-trained speech embeddings(Comput. Biol. Med. 2025) — Wav2Vec 1.0/2.0 对比与多任务、跨语种评测协议。
- Health Inf. Sci. Syst. 2021(孤立词算法) — 完整预处理链(滤波、归一化、去趋势、Praat 分段)。
§9.3 BibTeX 引用
@inproceedings{orozco-arroyave-etal-2014-new,
title = "New {S}panish speech corpus database for the analysis of
people suffering from {P}arkinson's disease",
author = "Orozco-Arroyave, Juan Rafael and Arias-Londo{\~n}o, Juli{\'a}n David
and Vargas-Bonilla, Jes{\'u}s Francisco
and Gonz{\'a}lez-R{\'a}tiva, Mar{\'i}a Claudia and N{\"o}th, Elmar",
editor = "Calzolari, Nicoletta and Choukri, Khalid and Declerck, Thierry
and Loftsson, Hrafn and Maegaard, Bente and Mariani, Joseph
and Moreno, Asuncion and Odijk, Jan and Piperidis, Stelios",
booktitle = "Proceedings of the Ninth International Conference on Language
Resources and Evaluation (LREC'14)",
month = may,
year = "2014",
address = "Reykjavik, Iceland",
publisher = "European Language Resources Association (ELRA)",
pages = "342--347",
url = "https://aclanthology.org/L14-1549/"
}
@inproceedings{laquatra2024exploiting,
title = "Exploiting Foundation Models and Speech Enhancement for
Parkinson's Disease Detection from Speech in Real-World
Operative Conditions",
author = "La Quatra, Moreno and Turco, Maria Francesca and Svendsen, Torbj{\o}rn
and Salvi, Giampiero and Orozco-Arroyave, Juan Rafael
and Siniscalchi, Sabato Marco",
booktitle = "Proceedings of INTERSPEECH 2024",
year = "2024",
doi = "10.21437/Interspeech.2024-522"
}
@article{pah2022phonemes,
title = "Phonemes based detection of parkinson's disease for telehealth applications",
author = "Pah, Nemuel D. and Motin, Mohammod A. and Kumar, Dinesh K.",
journal = "Scientific Reports",
volume = "12",
year = "2022",
doi = "10.1038/s41598-022-13865-z"
}
§9.4 引用指南
使用 PC-GITA 时:(1) 必引 LREC 2014 官方论文(语料库本体出处);(2) 使用社区分割版时须同时引用分割论文(Rueda et al., 2022, Computer Speech and Language, DOI 10.1016/j.csl.2021.101322);(3) 建议在数据声明中注明获取日期与发放批次;(4) 遵守学术用途限制,商业用途需另行与 GITA 研究组协商;(5) 引用本 Wiki 页面时以 qianfanghub.com 页面 URL 为准。
补充提醒:论文数据声明中建议同时披露 —— 数据获取途径(官方申请表单)、伦理批文编号、录音参数(44.1 kHz/16-bit)、用药状态约束(ON 态)与划分协议(说话人级)。这些信息是审稿人评估可复现性的高频检查点。
§10 AI 使用声明卡
§10.1 本页面生产中使用的 AI 模型
| 模型 | 用途 | 阶段 |
|---|---|---|
| CodeBuddy(大语言模型) | 结构化撰写、代码示例生成、格式规范化 | 初稿生成 |
| CodeBuddy(大语言模型) | 事实核对提示与交叉引用检查 | 自检阶段 |
§10.2 AI 参与范围
AI 参与:章节起草、表格整理、代码示例编写、引用格式化、结构与排版检查。AI 不参与:事实审定(全部数字经 WebSearch 检索核实并溯源)、医学审核(由千方病案医学编辑部执行)、最终发布决定。所有检索来源在正文与 FACTS 清单中内联标注,关键数字均可回溯至原始文献。
§10.3 输入来源列表
- Orozco-Arroyave et al., 2014, LREC. ACL Anthology L14-1549
- La Quatra et al., 2024, Interspeech. DOI 10.21437/Interspeech.2024-522(arXiv 2406.16128)
- Pah, Motin, Kumar, 2022, Sci. Rep. DOI 10.1038/s41598-022-13865-z(全文)
- Lee et al., 2024, J. Voice(PubMed 39665946)
- An algorithm for PD speech classification based on isolated words, 2021, Health Inf. Sci. Syst. DOI 10.1007/s13755-021-00162-8
- Ranking pre-trained speech embeddings in PD detection, 2025, Comput. Biol. Med.(ScienceDirect)
- arXiv 2404.05160 — LLM 语言特征检测 PD
- NTNU 2023 硕士论文 — 任务表、样本统计
- 多机构对比研究(Europe PMC) — Neurovoz/Italian PVS 对比
- Representation Learning Strategies(Interspeech 系列工作) — m-FDA 标注与嵌套 CV
- Polito 硕士论文 — 录音设备细节与句子清单
- UdeA 工学院 GITA 介绍页 — 机构与工具链
- Semantic Scholar 条目 — 引用数(268+,截至 2026-09)
- PLOS Digital Health 数据可用性声明 — 官方申请入口
- IEEE:AVQI 与持续元音时长研究 — 时长分布证据
- medRxiv 2025 — Wav2Vec 评测协议与 16 kHz 重采样规范
- Feature Representation of Parkinsonian Dysarthria 海报 — DDK 特征体系
- ar5iv 综述 2505.00525 — 原论文 91.3% 基线与数据集谱系
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景与 ICD-11/SNOMED 映射 | 千方病案医学编辑部 | 逐条对照 ICD-11 官方编码与公开临床文献 | ✅ 已通过/已验证 |
| §3 数据集规格与录音协议 | 千方病案医学编辑部 | 对照 LREC 2014 原文与设备文献交叉核实 | ✅ 已通过/已验证 |
| §4 DAIMS 数据字典 | 千方病案医学编辑部(数据工程师) | 字段与文件命名规则对照社区仓库文档 | ✅ 已通过/已验证 |
| §5 划分策略与泄漏分析 | 千方病案医学编辑部(数据工程师) | 划分模板代码逻辑复核 | ✅ 已通过/已验证 |
| §6 预处理 Pipeline 与 8 坑点 | 千方病案医学编辑部(数据工程师) | 代码可运行性检查 + 坑点文献溯源 | ✅ 已通过/已验证 |
| §7 偏倚与 DAIMS 24 项 | 千方病案医学编辑部 | 偏倚条目逐项与文献证据对齐 | ✅ 已通过/已验证 |
| §8 基准数字与引用 | 千方病案医学编辑部 | 全部性能数字回溯原始论文 | ✅ 已通过/已验证 |
| §9–§10 引用与声明卡 | 千方病案医学编辑部 | BibTeX 与来源列表逐条核对 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
以下章节由 AI 辅助起草并经人工审核:§1.0 速览、§1.1 技术摘要、§2.2 疾病简介、§2.7 西语语音学特征、§3.1 模态详情分析列、§5.3–5.5 划分建议、§6.3–6.4 代码示例、§6.5 坑点整理、§7.1 偏倚表、§8.2 选型建议。其余章节为模板化结构 + 检索事实填装,同样经过上表人工校验流程。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)
本页面为 PC-GITA 的权威中文参考档案,更新将随数据集官方版本演进与重要基准变化同步进行。
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- ua-speech — 共享标签:生理信号 / 神经科学 / 语音信号
- mdvr-kcl — 共享标签:生理信号 / 语音信号 / 帕金森病
- parkinsons-voice-uci — 共享标签:生理信号 / 语音信号 / 帕金森病
- hls-cmds — 共享标签:生理信号 / 语音信号
- physionet-cinc-2016 — 共享标签:生理信号 / 语音信号
- coughvid — 共享标签:生理信号 / 语音信号
- ninapro — 共享标签:生理信号 / 神经科学
- torgo — 共享标签:生理信号 / 语音信号
- bridge2ai-voice — 共享标签:生理信号 / 语音信号
- openneuro — 共享标签:生理信号 / 神经科学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
