信息速览

UA-Speech — 构音障碍语音黄金基准数据集 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | UA-Speech |
| 英文全称 | University of Illinois Urbana-Champaign Dysarthric Speech Database(Dysarthric Speech Database for Universal Access Research) |
| 别名/简称 | UASpeech、UA Speech、Universal Access Speech Corpus |
| 疾病分类 | 脑瘫(ICD-11:LD40,痉挛型 LD40.0);构音障碍(ICD-10:R47.1,作为脑瘫运动症状) |
| SNOMED CT | 91791007 Cerebral palsy / 8938004 Dysarthria(详见 §2.1b) |
| 数据模态 | 构音障碍语音(8 通道多麦克风音频,原始采集含视频通道,分发以音频为主) |
| AI 任务类型 | 构音障碍语音识别(DSR)、言语可懂度评估、严重度分级、说话人自适应、辅助沟通(AAC) |
| 样本总数 | 29 名说话人(16 构音 + 13 对照)/ 每人 765 个孤立词 / 标准划分 99,195 条训练 + 26,520 条测试 |
| 数据大小 | 约 103 小时音频;社区降噪处理版约 11.5 GB(15 说话人,截至 2026-09 Kaggle 镜像) |
| 数据格式 | WAV(PCM),原始录制 48 kHz,分发以 16 kHz 版本为主 |
| 许可证 | UA-Speech 定制学术研究许可(仅限政府与学术研究实验室;禁止商业使用;禁止再分发;详见分发包 LICENSE.txt) |
| 访问级别 | 申请审核(邮件申请 + 云盘交付,需机构邮箱与使用期限声明) |
| DUO 标签 | 不适用(非基因组数据);等效限制:限学术/政府研究、禁商用、禁再分发 |
| 语言 | 英语(美国英语) |
| 首发日期 | 2008-09-22(Interspeech 2008 论文发布,secure FTP 分发) |
| 最后更新 | 分发包随说话人许可动态调整(原 19 名构音说话人中 3 名撤回,当前 16 名;截至 2026-09 官方页未标注固定版本号) |
| 发布机构 | 伊利诺伊大学厄巴纳-香槟分校(UIUC,Beckman Institute) |
| 官方主页 | https://speechtechnology.web.illinois.edu/UASpeech |
| 下载地址 | 邮件申请:uaspeech-requests@lists.illinois.edu(无公开直链) |
| DOI | 10.21437/Interspeech.2008-480(原始论文) |
| 引用次数 | 560+(Google Scholar,截至 2026-09);Semantic Scholar 收录 374 次 |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 有社区公认标准划分(B1/B3 训练、B2 测试)与成熟 Kaldi 基线脚本、五类词任务结构清晰;扣分项:无官方一键预处理脚本、多通道/多采样率口径需自行统一、需邮件申请无直链、无官方机器可读数据字典 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、脑瘫与痉挛型构音障碍临床背景、可懂度金标准定义)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(三块结构、五类词任务、多通道字段)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 UIUC、Beckman Institute、ISCA 无任何商业利益关联。本页面不销售 UA-Speech 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 UIUC 或任何相关机构的资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。UA-Speech 仅限政府与学术研究实验室使用,禁止商业用途与再分发,须通过 uaspeech-requests@lists.illinois.edu 邮件申请并以云盘交付,完整限制以分发包内 LICENSE.txt 为准。DUO 标签不适用,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? UA-Speech 是美国伊利诺伊大学厄巴纳-香槟分校(UIUC)在 2008 年发布、并持续维护至今的构音障碍语音数据库。19 名(现分发 16 名)脑瘫所致痉挛型构音障碍人士与 13 名健康对照,每人对着 8 麦克风阵列朗读 765 个孤立单词——数字、无线电字母、计算机命令、常用词与小说里的生僻词——构成约 103 小时的多通道语音库。每人的言语可懂度由 5 名听者听写评定,从 2% 到 95% 不等。
为什么重要? 健康人语音的识别准确率早已超过 95%,但重度构音障碍者的语音对主流语音助手几乎是"外语"。在 2024 年之前的十多年里,UA-Speech 是全球唯一可分发的较大规模构音障碍语音库,充当该领域的公共考场:同一个测试集上,词错误率从 2008 年的 69.2% 一路降到 2023 年的 17.8%。今天几乎所有残障语音识别论文都要和它比一比。
我能用它做什么? 训练与基准测试构音障碍语音识别(ASR)模型;按可懂度四级分组研究"什么程度的障碍最难识别";做说话人自适应、个性化解码与语音增强实验;为辅助沟通(AAC)设备原型提供词级语音证据。注意:它只允许学术与政府研究使用,不能商用,也不能转手分发。
§1.1 技术摘要
UA-Speech 由 UIUC 的 Heejin Kim、Mark Hasegawa-Johnson、Adrienne Perlman 等七名研究者于 2006-2009 年间在 NIH NIDCD R21 基金(5R21 DC008090)资助下采集,2008 年 9 月以《Dysarthric speech database for universal access research》为名在 Interspeech 2008 发布(Kim et al., 2008, Proc. Interspeech. DOI: 10.21437/Interspeech.2008-480)。语料设计为孤立词识别任务:每名说话人朗读 765 个词,由三个 block 组成,每块含相同的 155 个核心词(10 个数字、26 个国际无线电字母、19 个计算机命令、100 个 Brown 语料库常用词)加 100 个从 Project Gutenberg 小说中以音素覆盖度贪心挑选的非常用词,全库独特词 455 个。录音通过 8 麦克风阵列与 1 台数字摄像机同步完成,原始采样率 48 kHz,分发以 16 kHz 版本为主。可懂度按 5 名美国英语听者的正字转录平均正确率评定,说话人据此分为极重度(0-25%)、重度(26-50%)、中度(51-75%)、轻度(76-100%)四级。社区形成的标准评测协议将 B1+B3 用作训练、B2 用作测试,构音障碍子集词错误率在 2008-2023 年间从 69.2% 降至 17.8%(JSLHR, 2024. DOI: 10.1044/2024_JSLHR-24-00122)。
§1.2 战略价值
维度一:残障语音 AI 的公共基准与放大器。 在 UA-Speech 出现之前,构音障碍语音研究受限于 Nemours(11 名男声、74 个句子)等规模极小、无统一划分的语料,方法学进展难以相互比较。UA-Speech 提供了"同一批说话人、同一套词表、同一套可懂度分层"的可重复考场,使 2008-2023 年间中、德、英、美多国团队的十五次以上改进得以在同一条线上竞逐(JSLHR, 2024)。UIUC 官方估计,得益于该语料及其后继工作,脑瘫人群语音识别错误率已降至原有水平的约三分之一(Kim 项目页)。对产品团队而言,这是评估"我的 ASR 对障碍语音还差多少"的最低成本入口。
维度二:可懂度分层使它同时是"识别"与"评估"两个问题的数据源。 五类词任务(数字/字母/命令/常用词/生僻词)与四级可懂度分层正交组合,让研究者既能训练词级分类器,也能研究"识别难度如何随可懂度变化":2022 年的 SOTA 系统在轻度组 WER 约 2.6%,在极重度组仍高达约 55.6%(arXiv:2202.10290),这一巨大的组间差距本身就是障碍语音研究最核心的科学事实之一。对医工交叉团队,它还是自动严重度分级(可懂度回归/分级)的标准输入,直接对接言语康复评估的临床场景。
§1.3 同类数据集横向对比
| 数据集 | 构音障碍规模 | 对照组 | 语料形态 | 时长/体量 | 可懂度分层 | 差异化特点 |
|---|---|---|---|---|---|---|
| UA-Speech | 19 人原始 / 16 人现分发(脑瘫痉挛型) | 13 人(年龄、性别匹配) | 765 孤立词/人,五类词任务 | 约 103 小时、8 通道 | 四级(5 听者转录) | 规模最大、可懂度分层最完整、基准历史最长 |
| TORGO | 8 人(脑瘫或 ALS) | 7 人 | 孤立词 + 受限/自由句 + 非词 | 约 13.5 小时 | 三级 | 含发音器官(发音运动)同步数据,可做多模态 |
| Nemours | 11 名男性 | 无 | 74 个"X is Ying the Z"句式 | 约 1 小时级 | 无 | 最早公开发布之一,句级但仅男声 |
| EasyCall(意大利语) | 31 人(多病因) | 24 人 | 37 条命令 + 30 条非命令 | 短语音为主 | 5 级(神经科评定) | 多病因(帕金森、ALS 等)、非英语 |
| Speech Accessibility Project | 目标数百人/病种队列扩展中 | 含对照 | 自发+朗读(200 样本/人起) | 10 万+ 样本已交付 | 按病种组织 | 2023 年起的后继项目,但仅向受资助方/审核通过方分发 |
§1.4 版本时间轴
| 时间 | 版本/事件 | 说明 |
|---|---|---|
| 2006-2009 | 采集期 | NIH NIDCD 资助 5R21 DC008090,University of Illinois IRB 批准,UIUC 校园内实验室采集 |
| 2008-09 | 首发 | Interspeech 2008 论文发布,19 名构音说话人 + 对照,secure FTP 分发 |
| 2008-2024 | 持续分发 | 向全球研究机构分发,数百篇论文使用;UIUC 称其为当时可分发的最大构音障碍语音库 |
| 分发期内 | 说话人撤回 | 原 19 名构音说话人中 3 名撤回许可/数据损坏,官方分发包收敛为 16 名构音 + 13 名对照;历史文献中 15 人口径与之并存 |
| 2023 起 | 后继项目 | UIUC Speech Accessibility Project(Amazon、Apple、Google、Meta、Microsoft 资助)接棒大规模采集,UA-Speech 仍作为经典基准继续使用 |
§1.5 典型应用场景
| 场景 | 输入/任务 | 为什么用 UA-Speech | 落地提示 |
|---|---|---|---|
| 构音障碍 ASR 基准 | 765 词/人词级识别,B1+B3 训练 / B2 测试 | 唯一有 15 年 WER 历史曲线可对话的公开考题 | 锁定 mic06 + 16 kHz 口径 |
| 可懂度自动评估 | 词音频 → 四级分级 / 可懂度回归 | 每名说话人有 5 听者感知评定金标签 | 宏平均 + 分组说话人数必须报告 |
| 说话人自适应研究 | 每人 765 词的个性化建模 | 说话人内数据量足以支撑 LHUC/SAT 类技术 | 严格区分说话人依赖/独立增强 |
| AAC 词级命令原型 | 数字/字母/命令三子集 | 词表天然对应拼读与桌面控制任务 | 端侧轻量模型(CNN-GRU)起步 |
| 前端与增强研究 | 8 通道录音去噪/波束成形 | 多通道同步录制,可做通道消融 | 单通道基线并列报告 |
- 构音障碍 ASR 基准测试:按社区标准协议(B1+B3 训练 / B2 测试)报告词错误率,与 2008-2023 年的 SOTA 曲线直接对话。
- 可懂度自动评估原型:以四级可懂度标签训练分级/回归模型,为言语康复科提供自动筛查工具的研究基础。
- 说话人自适应与个性化研究:利用每名说话人 765 词的数据量,研究 LHUC、i-Vector、SAT 等个性化技术在极端口音差异下的表现。
- 辅助沟通(AAC)词级命令识别:数字、字母与计算机命令词表天然构成"桌面控制/拼读输入"的原型任务。
- 语音增强与前端处理研究:多通道 8 麦克风录音支持去噪、波束成形与频带扩展等前端算法在障碍语音上的验证。
§2 医学背景
§2.1 ICD-11 编码映射
| 标签 | ICD-11 编码 | 中文名称 | 在本数据集中的体现 |
|---|---|---|---|
| Cerebral palsy | LD40 | 脑瘫 | 全部构音障碍说话人的基础病因(痉挛型为主) |
| Cerebral palsy, spastic | LD40.0 | 痉挛型脑瘫 | UA-Speech 构音说话人的主要临床亚型(痉挛性构音障碍) |
| 言语相关症状 | ICD-10 R47.1(对照) | 构音障碍 | 脑瘫的运动症状在言语维度的表现;ICD-11 中作为 LD40 症状维度处理 |
说明:构音障碍(dysarthria)在 ICD-11 体系中通常作为潜在神经疾病的症状维度编码(本数据集语境下即脑瘫 LD40),而 ICD-10 使用独立症状码 R47.1。本页面以 ICD-10/ICD-11 官方浏览器公开编码为准,仅列与本数据集直接相关的条目。
§2.1b SNOMED CT 映射
| 标签 | ICD-11/ICD-10 | SNOMED CT 码 | 术语 |
|---|---|---|---|
| 脑瘫 | LD40 / G80(ICD-10) | 91791007 | Cerebral palsy (disorder) |
| 痉挛型脑瘫 | LD40.0 / G80.1(ICD-10 僵直型对照) | 39912003 | Spastic cerebral palsy (disorder) |
| 构音障碍 | LD40 症状维度 / R47.1(ICD-10) | 8938004 | Dysarthria (disorder) |
§2.2 疾病简介与流行病学
脑瘫(cerebral palsy, CP) 是一组由发育中大脑的非进行性损伤引起的运动与姿势发育永久性障碍综合征,是儿童期最常见的运动致残性疾病(UIUC Speech Accessibility Project)。全球患病率通常报告为每 1,000 活产约 2-3 例,不同地区与统计口径存在差异。按运动体征分型,痉挛型(spastic)最常见,其次为运动障碍型(dyskinetic)与共济失调型(ataxic)。
构音障碍(dysarthria) 是脑瘫最常见的伴随症状之一:中枢神经肌肉控制受损导致发音不精确、音量与音调单调或过度波动、语速异常(Kim et al., 2008)。按 Darley 等经典分类,脑瘫所致者以痉挛型构音障碍为主——这也是 UA-Speech 项目组最初聚焦痉挛型的原因:重度先天性构音障碍常由脑瘫引起,而痉挛型是构音障碍最常见的类型(Kim 项目页, UIUC)。UA-Speech 官方描述明确指出,所有构音说话人具有相同的临床诊断——痉挛型脑瘫相关的痉挛性构音障碍,语料内临床变量单一,仅可懂度存在个体差异(ScienceDirect, 2013)。
对日常生活的直接影响是沟通效率:语音识别技术对健康人语音可达 95%-99% 准确率,但对重度构音障碍者几乎不可用,使依赖语音交互的设备对这一群体形同虚设(Kim et al., 2008)。部分 UA-Speech 参与者的语音"完全可懂",也有人"自认基本无言语能力但同意录制其尽力朗读的录音"(Hasegawa-Johnson, UIUC)——这正是可懂度连续统的真实临床图景。
§2.2b 构音障碍类型学与 UA-Speech 的位置
经典感知分类将构音障碍按神经受损模式分为若干类型,其声学-言语特征直接决定 ASR 难度:
| 构音障碍类型 | 神经机制 | 典型言语特征 | UA-Speech 覆盖情况 |
|---|---|---|---|
| 痉挛型(spastic) | 上运动神经元损伤(双侧),肌张力增高 | 辅音发音用力、元音扭曲、音调单调偏 | ✅ 全部构音说话人为此型(痉挛型脑瘫所致) |
| 弛缓型(flaccid) | 下运动神经元/颅神经损伤 | 鼻音过重、辅音无力、气息声 | ❌ 未覆盖 |
| 共济失调型(ataxic) | 小脑损伤 | 节律失调、重音过度、元音畸变 | ❌ 未覆盖 |
| 运动亢进/减退型(hyper/hypokinetic) | 锥体外系(如帕金森) | 声量衰减、语速失控 | ❌ 未覆盖 |
| 混合型 | 多系统 | 视病灶组合而定 | ❌ 未覆盖(痉挛型脑瘫个体内可有混合体征,但库内临床诊断单一) |
这一"同质病因 + 广谱可懂度(2%-95%)"的设计是刻意的:项目组在论文中说明,聚焦痉挛型是因为重度先天性构音障碍常由脑瘫引起、且痉挛型最常见;把临床变量压平后,库内识别难度差异可以干净地归因于可懂度而非病因混杂(ScienceDirect, 2013)。代价是:任何"跨病因泛化"的结论都不能仅凭本库得出。
§2.2c 言语可懂度评估的方法学定位
| 方法 | 做法 | 优缺点 | UA-Speech 采用 |
|---|---|---|---|
| 感知转录法(SSM 传统) | 听者听写正确率 | 临床金标准、生态效度高;耗时、听者间变异 | ✅ 5 听者正字转录取平均 |
| 仪器化发音测量 | MRI/EMA 等记录发音运动 | 精确;设备昂贵、不可及 | ❌(TORGO 含发音数据) |
| 自动估计 | 模型直接预测可懂度 | 可扩展;需感知标签做监督 | 本库正是该任务的标准训练源 |
§2.3 临床任务定义
| 任务 | 定义 | 本数据集支撑 | 对应 AI 任务 |
|---|---|---|---|
| 可懂度评定 | 听者对障碍语音正确转录的百分比(感知法金标准) | 每名说话人 5 听者转录平均正确率(2%-95%) | 回归/四级分类 |
| 严重度分级 | 按可懂度区间划分障碍程度 | 极重度(0-25%)、重度(26-50%)、中度(51-75%)、轻度(76-100%) | 有监督分级 |
| 辅助语音识别 | 将障碍语音转为文本 | 765 词/人词级对齐音频 + 文本 | 词级/子词级 ASR |
| AAC 原型 | 用词命令驱动设备 | 数字、字母、计算机命令词表 | 关键词识别 |
§2.4 患者人群表
| 维度 | 内容 |
|---|---|
| 来源 | UIUC 所在的伊利诺伊州香槟-厄巴纳社区招募(含部分前期研究参与者) |
| 采集时间 | 2006-2009(NIH R21 资助期) |
| 年龄 | 18-58 岁 |
| 性别 | 构音组 4 女 11 男 / 对照组 4 女 9 男(15 构音说话人常用口径) |
| 病因构成 | 痉挛型脑瘫所致痉挛性构音障碍(临床诊断同质) |
| 就医类型 | 科研招募志愿者(非临床就诊队列) |
| 可懂度 | 2%-95%,四级分层 |
§2.5 临床价值
UA-Speech 的临床价值链有三级。第一级是评估:以自动可懂度分级替代耗时的听者感知评定,可为言语治疗提供可重复的量化基线,研究已证明预训练自监督模型(wav2vec 2.0)可在该库上做说话人无关的严重度分级(PLOS Digital Health, 2023. DOI: 10.1371/journal.pdig.0001076)。第二级是辅助沟通:词级识别(尤其字母与数字)直接服务拼读式 AAC 交互,UIUC 估计其 ASR 研究使脑瘫人群识别错误率降至原来约三分之一(Kim 项目页)。第三级是机制研究:构音错误并非随机,多数可归入少数替代错误类型(Kent 等声学研究传统),该库支持发音错误模式的声学分析与言语训练方案验证。
§2.5b 从数据集到临床闭环的映射
| 临床环节 | 传统做法 | UA-Speech 支撑的 AI 化路径 | 成熟度 |
|---|---|---|---|
| 初筛 | SLP 人工问诊 + 感知评定 | 词级音频 → 四级可懂度自动分级 | 研究原型(该库可训练) |
| 定期随访 | 到院评定,主观复测 | 家庭录音 → 可懂度纵向追踪 | 需信道适应研究 |
| AAC 配置 | 手工选词表与界面 | 数字/字母/命令词识别直接驱动桌面 | 接近可用 |
| 机制研究 | 声学个案分析 | 大规模构音错误模式统计 | 成熟 |
§2.6 金标准对照表
| 维度 | 内容 |
|---|---|
| 划分方式 | 感知评定(perceptual rating),非仪器测量 |
| 标注方式 | 5 名母语美国英语听者对障碍语音做正字转录,按正确转录词百分比计算 |
| 标注者资质 | 母语美国英语听者(听写任务,非临床医师) |
| 标注结果 | 说话人级可懂度百分比;每块 100 个非常用词从 Project Gutenberg 小说中按稀有双音素覆盖度贪心选取 |
| 性质 | 可懂度评定为该领域临床研究常用金标准(SSM 感知法传统);无仪器化发音测量 |
§3 数据集规格
§3.0 版本抉择矩阵
UA-Speech 不存在多版本发布页,但存在三种需要主动抉择的"口径版本"。选错口径是与历史论文不可比的头号原因。
| 你的需求 | 推荐口径 | 体量 | 理由 |
|---|---|---|---|
| 与 2008-2023 SOTA 曲线(WER 排行榜)对比 | 16 构音 + 13 对照分发包,B1+B3 训练 / B2 测试,16 kHz | 99,195 训练 + 26,520 测试条 | CUHK 系近年系统与 2025 年 SSL/LLM 工作均沿用此口径 |
| 与 2018-2019 年早期深度学习论文对比 | 15 构音说话人常用口径 | 每人 765 词 | 早期公开分发与多数 CNN/复现研究基于 15 构音 + 13 对照 |
| 与 2008 原始论文或引用数核对 | 19 名构音说话人(原始发布口径) | — | Interspeech 2008 论文摘要口径;其中 3 人后续撤回/损坏 |
| 只需快速跑通流程 | 社区 Hugging Face 衍生集(16 kHz 单通道) | 约 4.2 GB / 38,656 条 | 免申请,但非官方、划分与通道口径需自查 |
§3.1 模态详情
| 模态 | 细节 | 状态 |
|---|---|---|
| 音频(主模态) | 8 麦克风同步录制:1 路近讲/同步通道 + 7 路阵列(麦克风间距 1.5 英寸,顶置于笔记本电脑上方) | 分发包主通道为 16 kHz WAV;社区研究常用第 6 号麦克风 |
| 视频 | 1 台数字摄像机同步录制(原始采集含视频模态,支持未来音视频联合研究) | 标准音频分发包通常不含视频 |
| 文本 | 每词提示词文本 + 转录;可懂度评定文件 | 随分发提供 |
| 发音生理数据 | 无(TORGO 才含发音运动数据) | 不适用 |
§3.2 按子集样本数表
| 子集 | 说话人数 | 每人朗读词数 | 独特词数 | 说明 |
|---|---|---|---|---|
| 构音障碍组(原始发布) | 19 | 765 | 455 | 2008 论文口径 |
| 构音障碍组(当前分发) | 16 | 765 | 455 | 3 名说话人撤回许可/数据损坏 |
| 构音障碍组(早期公开口径) | 15 | 765 | 455 | 4 女 11 男,多被 2018-2022 复现研究采用 |
| 健康对照组 | 13 | 765 | 455 | 年龄、性别匹配,4 女 9 男 |
| 全库合计(当前分发) | 29 | — | — | 约 103 小时;标准划分 99,195 训练 + 26,520 测试条 |
§3.2b 词任务构成明细
每名说话人的 765 次朗读 = 5 类词 × 3 个 block 的正交组合,五类词的选取规则各不相同:
| 词类别 | 简写 | 每块词数 | 每人累计 | 词源与选取规则 | 识别意义 |
|---|---|---|---|---|---|
| 数字 | D | 10 | 30 | zero 至 nine | 短高频指令,AAC 最易落地 |
| 国际无线电字母 | L | 26 | 78 | alpha、bravo… | 拼读交互,含罕见音节结构 |
| 计算机命令 | CC | 19 | 57 | enter、delete 等桌面命令 | 桌面控制场景 |
| 常用词 | CW | 100 | 300 | Brown 语料库最高频 100 词 | 语言模型先验最强 |
| 非常用词 | UW | 100 | 300 | Project Gutenberg 小说中按稀有双音素覆盖度贪心选取 | 音素覆盖最大化,识别最难 |
§3.2c 严重度四级分布与不平衡
| 可懂度组 | 区间 | 等效严重度 | 说话人数(15 人口径) | 建模影响 |
|---|---|---|---|---|
| Very Low intelligibility | 0-25% | 极重度(very severe) | 数名(最多组) | 声学严重失真,WER 主导项 |
| Low intelligibility | 26-50% | 重度(severe) | 约 2 人 | 组级指标方差极大 |
| Medium intelligibility | 51-75% | 中度(moderate) | 约 2 人 | 组级指标方差极大 |
| High intelligibility | 76-100% | 轻度(mild) | 数名(含接近正常者) | 与对照组差距最小 |
分组人数以 PLOS Digital Health 2023 的 Table 1 口径为准(Low 与 Medium 各约 2 人);全库可懂度横跨 2%-95%,两头组人数相对较多、中间组极少,构成"沙漏形"不平衡(PLOS Digital Health, 2023;Nature Sci Rep, 2024)。
§3.3 数据格式表
| 内容 | 格式 | 说明 |
|---|---|---|
| 音频 | WAV(PCM 16-bit) | 16 kHz 为主流分发版本;原始录制 48 kHz |
| 词表/提示 | 文本文件 | 按 block 组织,含五类词类别 |
| 可懂度评定 | 文本/表格 | 说话人级百分比与四级分组 |
| 许可文件 | LICENSE.txt | 定制学术许可全文 |
| 社区衍生 | Hugging Face Dataset(parquet)、Kaggle 降噪 WAV | 非官方,口径需自查 |
§3.4 存储大小
官方分发包大小未在公开页面标注固定数值;可核实的参考锚点:全库约 103 小时音频(arXiv:2508.08027);去静音后训练 30.6 小时 + 测试 9 小时(CUHK 综述);Kaggle 社区降噪版(15 说话人单通道)约 11.53 GB(Kaggle);Hugging Face 衍生训练集约 4.16 GB / 38,656 条(HF 镜像)。申请时预留 20-30 GB 磁盘可覆盖 16 kHz 多通道分发与展开。
§3.5 标注方式
| 标注层 | 方式 | 说明 |
|---|---|---|
| 提示词文本 | 实验设计生成 | 词表由实验者设计,无标注歧义 |
| 转录 | 提示词即转录(孤立词朗读) | 障碍语音可能存在未发出的目标词内容,与误读构成天然噪声 |
| 可懂度 | 人工感知评定 | 5 名听者正字转录,正确率取平均 |
| 严重度分组 | 规则派生 | 按可懂度区间四分 |
§3.6 标注者资质与一致性
可懂度评定由 5 名母语美国英语听者完成,每人对每名构音说话人的转录正确率取平均得到说话人级评分(arXiv:2103.06157)。官方文档未公开听者间信度系数(如组内相关系数)的数值,该信息缺失意味着做"以可懂度为金标签"的回归研究时需自带这一局限声明。
§3.7 采集周期
采集于 2006-2009 年 NIH NIDCD R21 资助期内在 UIUC 实验室完成(官方页);2008 年 9 月论文首发。每人 765 词分三个 block 录制,块间安排休息(arXiv:2103.06157)。
§3.8 地域覆盖
美国伊利诺伊州厄巴纳-香槟单一社区;所有说话人为美国英语使用者。语言多样性为零是该库的已知边界,跨语言泛化需配合 EasyCall(意大利语)等异语言库。
§3.9 设备规格
| 设备 | 规格 |
|---|---|
| 麦克风阵列 | 8 麦克风阵列,间距 1.5 英寸,顶置笔记本电脑;含 1 路同步/近讲通道 |
| 音频接口 | MOTU 多通道声卡 |
| 摄像机 | 1 台数字视频摄像机(同步录制) |
| 采样率 | 原始 48 kHz;主流分发 16 kHz |
| 环境 | 受控实验室安静环境 |
§3.9b 采集流程细节
| 环节 | 做法 | 出处 |
|---|---|---|
| 提示呈现 | 词逐个显示在电脑屏幕上,说话人朗读 | Interspeech 2008 |
| 分块与休息 | 765 词均分为 B1/B2/B3 三块(各 255 词),块间安排休息以缓解疲劳 | arXiv:2103.06157 |
| 阵列摆放 | 麦克风阵列顶置于笔记本电脑上方,8 麦克风间距 1.5 英寸 | IEEE 10508947 |
| 同步 | MOTU 多通道声卡统一采集 8 路音频并同步摄像机 | Interspeech 2008 |
| 前期研究说话人 | 论文图示注明 4 名说话人来自前期研究(preliminary study) | Interspeech 2008 |
§3.10 深度溯源链
| 环节 | 主体 | 可核实出处 |
|---|---|---|
| 立项与资助 | NIH NIDCD,5R21 DC008090,2006-2009 | 官方页 |
| 伦理审批 | University of Illinois IRB,项目"Audiovisual Description and Recognition of Audible and Visible Dysarthric Phonology" | 官方页 |
| 采集执行 | UIUC Beckman Institute / ECE / Speech and Hearing Science / DRES 四部门团队 | Interspeech 2008 论文 |
| 词表设计 | 100 常用词取自 Brown 语料库;300 非常用词取自 Project Gutenberg 小说按稀有双音素贪心选取 | arXiv:2103.06157 |
| 可懂度评定 | 5 名母语听者感知转录 | arXiv:2103.06157 |
| 分发维护 | UIUC Statistical Speech Technology Group,邮件申请制 | 官方页 |
§4 数据结构
§4.0 目录树
官方分发包以说话人目录组织,每个说话人目录下按 block 与通道存放 WAV;以下树形为 16 kHz 分发口径的典型结构(不同批次目录命名略有差异,以随包 README 为准):
UASpeech/
├── LICENSE.txt # 定制学术许可全文
├── transcripts.txt # 全库词级提示词与转录索引
├── intelligibility.txt # 说话人可懂度与四级分组
├── 16kHz/ # 16 kHz 分发版本
│ ├── F02/ # 女性构音说话人(匿名编号)
│ │ ├── B1/ # Block 1(155 共同词 + 100 非常用词)
│ │ │ ├── mic01/ # 通道 1(近讲/同步)
│ │ │ │ ├── F02_B1_UW50_1001.wav
│ │ │ │ └── ...
│ │ │ ├── mic02/ ... mic07/ # 阵列通道 2-7
│ │ ├── B2/ # Block 2(测试块)
│ │ └── B3/ # Block 3
│ ├── F03/ F04/ F05/ # 其余女性构音说话人
│ ├── M01/ M04/ M05/ M07/ # 男性构音说话人
│ │ └── ...(M01 等存在部分录音/通道缺失,文件数少于 765×7)
│ ├── M08/ M09/ M10/ M11/ M12/ M14/ M16/
│ └── CF02/ CM04/ ... # 对照说话人(编号以 C 前缀区分)
└── 48kHz/ # 原始采样率版本(视批次提供)
文件命名编码为 {说话人}_{Block}_{词类别及序号}_{序号}.wav(如 F02_B1_UW50_1001.wav),目标词文本由随包 transcripts.txt 提供"utterance_id → 词"映射,社区 Kaldi 脚本均按此解析,不应假设文件名内含词文本。注意:社区镜像中每说话人文件数在 2,805-5,355 之间不等(765 词 × 7 通道 = 5,355 为满额),与官方"部分数据损坏"的说明一致,加载器必须容忍缺文件。
transcripts 索引(社区 Kaldi 脚本通行的解析格式:每行"文件名 词文本",以空格分隔):
# transcripts.txt 片段(示例格式:utterance_id prompt)
F02_B1_CW1_1001 yes
F02_B1_D1_1002 zero
F02_B1_L1_1003 alpha
F02_B1_CC1_1004 enter
F02_B1_UW1_1005 butterflies
§4.1 DAIMS 字段字典
以下为从文件名与官方文档解析出的核心字段(建议入库时物化为 utterances 与 speakers 两张表):
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差/陷阱 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| speaker_id | string | 说话人匿名编号,性别前缀 | M16、F02、CM04 | 分层划分/说话人自适应键 | 历史论文 15/16/19 人口径不同 | 无 | 29 个值(现分发) |
| block | int | 录制块序号 | 2 | 标准划分键(B2 为测试) | 无 | 无 | |
| word_category | string | 五类词任务 | D/L/CC/CW/UW | 词类分层评估 | 简写需解码 | 无 | 5 个枚举 |
| prompt | string | 目标词文本 | butterflies、enter | ASR 标签 | 无 | 无 | 455 独特词 |
| audio_path | string | 相对路径含通道 | 16kHz/M16/B2/mic06/… | 加载定位 | 通道选择影响可比性 | 文件可能缺失 | — |
| microphone_channel | int | 麦克风通道号 | 6 | 前端处理/多通道融合 | 各论文用不同通道 | 无 | |
| intelligibility_pct | float | 说话人级可懂度 | 12.3 | 分级标签/分组 | 5 听者感知均值,无信度公开 | 无 | 2-95 |
| severity_group | string | 四级分组 | Very Low | 分层评估/采样 | 区间边界各文献略有出入(25/50/75) | 无 | |
| utterance_id | string | 说话人+block+词类别序号+序号唯一键 | F02_B1_UW50_1001 | 主键 | — | 无 | 唯一 |
§4.2 标签分布
| 维度 | 分布 |
|---|---|
| 词类别(每人 765 词) | 数字 10×3 = 30;字母 26×3 = 78;命令 19×3 = 57;常用词 100×3 = 300;非常用词 100×3 = 300 |
| 严重度四级 | Very Low / Low / Medium / High;Low 与 Medium 组各仅约 2 名说话人(类别极不平衡) |
| 性别(构音组,15 人口径) | 女 4 / 男 11 |
| 组别 | 构音 16 / 对照 13(现分发) |
五类词的典型示例(选词规则详见 §3.2b):
| 词类别 | 示例词 |
|---|---|
| 数字 D | zero、one、two … nine |
| 字母 L | alpha、bravo、charlie … x-ray |
| 命令 CC | command、line、enter、delete 等 19 个桌面命令 |
| 常用词 CW | yes、no 等 Brown 语料库最高频 100 词 |
| 非常用词 UW | butterflies、convulsion 等按稀有双音素选出的 300 词 |
§4.3 关键统计
| 统计项 | 数值 | 来源 |
|---|---|---|
| 总时长 | 约 103 小时(29 说话人) | arXiv:2508.08027 |
| 标准训练集(B1+B3,29 人) | 69.1 小时 / 99,195 条;去静音后 30.6 小时 | arXiv:2202.10290 |
| 标准测试集(B2,16 构音) | 22.6 小时 / 26,520 条;去静音后 9 小时 | arXiv:2202.10290 |
| 速度扰动增强后训练集 | 130.1 小时 / 399,110 条(双向扰动);仅构音扰动 65.9 小时 | arXiv:2202.10290 |
| 独特词表 | 455(若剔除 6 个跨块重复非常用词则 449) | arXiv:2103.06157 |
| 可懂度范围 | 2%-95% | Nature Sci Rep, 2024 |
§4.4 数据层级
数据集(29 说话人)
└── 说话人(speaker_id,16 构音 + 13 对照)
└── Block(B1/B2/B3,各 255 词)
└── 词类别(D/L/CC/CW/UW)
└── 通道(mic01-mic08)
└── 单条孤立词音频(utterance)
每一层都是合法的建模单元:说话人层做自适应,Block 层做划分,通道层做前端,utterance 层做训练样本。
§4.5 缺失值与信息性缺失
| 缺失情形 | 表现 | 处理建议 |
|---|---|---|
| 说话人整体缺失 | 19 → 16 口径差(3 人撤回/损坏) | 明确声明使用口径;不引用撤回说话人 |
| 通道/录音缺失 | 每说话人文件数 2,805-5,355 不等 | 加载器按文件存在性遍历,勿假设满额 765×7 |
| 听者间信度未公开 | 无 ICC/一致性系数字段 | 论文中显式声明该局限 |
| 视频模态 | 标准音频分发不含视频 | 多模态研究需另行联系官方 |
§5 数据划分与使用建议
§5.1 官方划分
官方未提供机器可读划分文件;划分事实体现在语料的三块结构中(每块 155 共同词 + 100 独特非常用词,块间休息录制)。
§5.2 社区惯例划分(事实标准)
CUHK 系列工作确立并被广泛沿用的协议(arXiv:2202.10290、arXiv:2203.10274):
| 集合 | 说话人 | Block | 规模 |
|---|---|---|---|
| 训练 | 全部 29 人(16 构音 + 13 对照) | B1 + B3 | 69.1 小时 / 99,195 条 |
| 测试 | 仅 16 名构音说话人 | B2 | 22.6 小时 / 26,520 条 |
关键性质:这是说话人相关(speaker-dependent)的块级划分——测试说话人的 B1/B3 出现在训练集中。它衡量的是"系统在见过的说话人身上处理未见过的词"的能力。任何声称该划分为 speaker-independent 的表述都是错误的。
§5.3 划分策略建议与泄漏风险
- 复现排行榜:严格使用 B1+B3/B2 协议,并在论文中写明"block-wise speaker-dependent"。
- 说话人无关评估:按 speaker_id 分组划分(如 16 名构音说话人留出 5-6 人做测试),不得与 B2 协议混淆报告。
- 泄漏清单:同一说话人的多通道音频不得跨集合拆分;速度扰动增强必须区分"说话人依赖/独立"方向(详见坑点 8);对照组(13 人)是否入训需显式声明——部分协议将对照数据用于定向增强(arXiv:2401.00662)。
- 词表泄漏:B2 的 100 个非常用词不在训练集中,是设计特性而非缺陷(见坑点 2)。
§5.4 交叉验证建议
按说话人分组做 leave-several-speakers-out 交叉验证(如 16 人分 4 折);避免普通 K 折——同一说话人的 utterance 落入训练与验证会造成可懂度特征直接泄漏,使严重度分级指标虚高。
§5.5 外部验证建议
词级泛化可对接 TORGO(英语,8 人)与 EasyCall(意大利语,31 人)做跨库测试;跨病因(ALS、帕金森)需 Speech Accessibility Project 类新库。任何跨库结论都应报告说话人无关口径。
§5.6 口径与可重现性清单
把下面 6 项写进实验配置,是 UA-Speech 上"结果可复现"的最低配置:
| # | 口径项 | 推荐取值 | 不一致后果 |
|---|---|---|---|
| 1 | 说话人版本 | 16 构音 + 13 对照(当前分发) | 与 15/19 人口径论文不可比 |
| 2 | 划分协议 | B1+B3 训练 / B2 测试(block-wise speaker-dependent) | 误称 speaker-independent 致结论高估 |
| 3 | 通道 | mic06(或全通道消融表) | 通道间声学条件不同 |
| 4 | 采样率 | 16 kHz 分发版 | 48 kHz 原始版频带更宽 |
| 5 | 静音处理 | 强制对齐或能量 VAD(top_db=30) | 未剥离时训练时长虚高一倍 |
| 6 | 增强方向 | 构音说话人独立 SP + 对照说话人依赖 SP | 方向反了引入泄漏 |
§6 AI 就绪指南
§6.0 云端快速启动
UA-Speech 无官方云端镜像(邮件申请制)。三条务实路径:
- 正式研究:按 §6.2 邮件申请,下载后上传至自有对象存储(S3/OSS/COS)并设私有桶。
- 快速验证想法:使用 Hugging Face 社区衍生集(如 16 kHz 单通道训练集,约 4.2 GB)先行跑通 pipeline,获得正式分发包后再切换口径。
- CI 冒烟测试:用 1-2 名说话人的子集缓存到测试镜像中(遵守许可:内部测试环境、不转发第三方)。
§6.1 快速上手与目录预期
# 目录结构预期(data_root 指向解压后的 UASpeech 根目录):
# data_root/
# 16kHz/<speaker_id>/B{1,2,3}/mic{1..8}/*.wav # 文件名如 F02_B1_UW50_1001.wav
# transcripts.txt # "utterance_id 词文本" 映射(社区通行解析格式)
# intelligibility.txt # 说话人级可懂度与四级分组
# 最小可用子集:任一说话人的 B1 目录 mic06 通道即可跑通词级分类;
# data_root 与代码中所有路径均以 os.path.join(data_root, ...) 拼接。
import os, re
from pathlib import Path
DATA_ROOT = Path(os.environ.get("UASPEECH_ROOT", "/data/UASpeech"))
AUDIO_ROOT = DATA_ROOT / "16kHz"
PREFERRED_MIC = "mic06" # 社区常用通道;换通道将影响与文献的可比性
UTT_RE = re.compile(r"^(?P<sid>[FC]M?\w+?)_(?P<block>B\d)_(?P<cat>D|L|CC|CW|UW)\d*_\d+$")
def load_transcripts() -> dict:
"""解析 transcripts.txt:每行 'utterance_id prompt',空格分隔。"""
out = {}
for line in (DATA_ROOT / "transcripts.txt").read_text().splitlines():
parts = line.strip().split(maxsplit=1)
if len(parts) == 2 and UTT_RE.match(parts[0]):
out[parts[0]] = parts[1]
return out
def list_utterances(transcripts: dict, speaker: str, block: str):
"""枚举某说话人某块的 utterance:元数据来自文件名 + transcripts 映射。"""
rows = []
for wav in sorted((AUDIO_ROOT / speaker / block / PREFERRED_MIC).glob("*.wav")):
utt_id = wav.stem
if utt_id in transcripts:
m = UTT_RE.match(utt_id)
rows.append({"audio_path": str(wav), "utterance_id": utt_id,
"prompt": transcripts[utt_id],
"speaker_id": m.group("sid"), "block": m.group("block"),
"word_category": m.group("cat")})
return rows
要点:词文本一律来自 transcripts.txt 映射而非文件名;永远通过 glob 探测真实存在的文件,因为部分说话人存在通道/录音缺失。
§6.2 数据获取
| 步骤 | 内容 |
|---|---|
| 1 | 向 uaspeech-requests@lists.illinois.edu 发送申请邮件 |
| 2 | 注明:姓名、机构(学校/政府机构)、预期用途、机构邮箱、可接收交付的云盘账号(Google/iCloud/OneDrive)、所需访问时长 |
| 3 | 等待官方通过云盘共享链接交付(secure 交付,无公开直链) |
| 4 | 校验 LICENSE.txt 与数据完整性;不得再分发、不得商用 |
§6.2b 申请与交付常见问题
| 问题 | 官方口径/社区经验 |
|---|---|
| 谁能申请? | 政府与学术研究实验室的研究人员;商业机构申请不在同意条款内 |
| 交付方式? | 通过 Google/iCloud/OneDrive 云盘共享,无公开直链、无种子 |
| 需要提供什么? | 姓名、机构、预期用途、机构邮箱、云盘账号、所需访问时长 |
| 能否转交同事? | 不得再分发;同事应通过同一实验室另行申请 |
| 发表论文要做什么? | 引用 Kim et al. 2008(Interspeech)并遵守 LICENSE.txt;无强制 PUB 标签但学术惯例需致谢 |
| 能否上传衍生特征到公有云? | 许可要求防窃取保护;衍生数据应保持访问限制,避免公开分发 |
# 申请邮件模板(正文)
subject = "UA-Speech corpus access request"
body = """
Name: <your name>
Institution: <university / government lab>
Intended use: <e.g. dysarthric ASR benchmarking for a peer-reviewed study>
Institutional e-mail: <you@university.edu>
Delivery account: <Google Drive / iCloud / OneDrive address>
Access period: <e.g. 12 months>
"""
§6.3 预处理全流程
# 预处理四步:加载 → 重采样/单化 → 能量 VAD 静音剥离 → 特征/转录对齐
# 依赖:pip install librosa soundfile jiwer
import librosa, numpy as np, soundfile as sf
TARGET_SR = 16000
def strip_silence(y: np.ndarray, top_db: int = 30,
frame: int = 2048, hop: int = 512) -> np.ndarray:
"""孤立词首尾静音占比过半(69.1h -> 去静音后 30.6h),必须剥离。"""
rms = librosa.feature.rms(y=y, frame_length=frame, hop_length=hop)[0]
mask = librosa.effects.split(y, top_db=top_db, frame_length=frame, hop_length=hop)
return np.concatenate([y[s:e] for s, e in mask], axis=0)
def load_utterance(path: str) -> np.ndarray:
y, sr = librosa.load(path, sr=TARGET_SR, mono=True) # 官方 16 kHz 版可直接加载
return strip_silence(y)
def to_log_mel(y: np.ndarray, n_mels: int = 80) -> np.ndarray:
m = librosa.feature.melspectrogram(y=y, sr=TARGET_SR, n_mels=n_mels)
return librosa.power_to_db(m).T # (T, n_mels)
设计依据:社区基线在 HTK GMM-HMM 强制对齐去静音后,训练集从 69.1 小时收缩到 30.6 小时(CUHK 综述);能量 VAD 是无对齐工具时的近似替代。
§6.4 PyTorch DataLoader
# 完整可运行:词级分类 Dataset(数字/字母等短指令任务的最小闭环)
# 目录预期见 §6.1;CSV 由 §4.1 字段字典物化(speaker_id, block, word_category,
# prompt, audio_path)。标准协议:训练=B1+B3 全 29 人;测试=B2 16 构音说话人。
import pandas as pd, torch
from torch.utils.data import Dataset, DataLoader
class UASpeechWordDataset(Dataset):
def __init__(self, meta_csv: str, label_col: str = "prompt",
train_blocks: tuple = ("B1", "B3"), test_block: str = "B2",
dysarthric_only_test: bool = True):
self.df = pd.read_csv(meta_csv, dtype=str)
if train_blocks:
self.df = self.df[self.df["block"].isin(train_blocks)]
elif test_block:
self.df = self.df[self.df["block"] == test_block]
if dysarthric_only_test: # B2 协议不含对照说话人
self.df = self.df[~self.df["speaker_id"].str.startswith("C")]
self.labels = sorted(self.df[label_col].unique())
self.label2id = {w: i for i, w in enumerate(self.labels)}
def __len__(self):
return len(self.df)
def __getitem__(self, idx):
row = self.df.iloc[idx]
feat = to_log_mel(load_utterance(row["audio_path"])) # (T, 80)
x = torch.from_numpy(feat).float()
return x, self.label2id[row[label_col]]
def collate(batch):
xs, ys = zip(*batch)
lengths = torch.tensor([x.shape[0] for x in xs])
xs = torch.nn.utils.rnn.pad_sequence(xs, batch_first=True) # (B, T_max, 80)
return xs.permute(0, 2, 1), torch.tensor(ys), lengths # (B, 80, T)
ds = UASpeechWordDataset("uaspeech_train.csv") # B1+B3
dl = DataLoader(ds, batch_size=16, shuffle=True, num_workers=4,
collate_fn=collate, pin_memory=True)
# CTC 词级 ASR 变体(子词/字母建模,规避训练词表不覆盖测试词的问题,见坑点 2)
import torch.nn as nn
class TinyCTC(nn.Module):
def __init__(self, n_mels: int = 80, vocab: int = 30, hidden: int = 256):
super().__init__()
self.conv = nn.Sequential(
nn.Conv1d(n_mels, hidden, 5, padding=2), nn.ReLU(),
nn.Conv1d(hidden, hidden, 5, padding=2), nn.ReLU())
self.rnn = nn.GRU(hidden, hidden, 2, batch_first=True, bidirectional=True)
self.out = nn.Linear(hidden * 2, vocab)
def forward(self, x): # x: (B, 80, T)
z = self.conv(x) # (B, H, T)
z, _ = self.rnn(z.transpose(1, 2)) # (B, T, 2H)
return self.out(z).log_softmax(-1) # (B, T, V),配合 CTCLoss
# CTC 训练循环骨架(字母表目标,规避词表外泄漏;与 §6.4 Dataset 配合)
import torch
BLANK = 0
LETTERS = "_abcdefghijklmnopqrstuvwxyz"
tokenizer = {c: i for i, c in enumerate(LETTERS)}
def encode_word(word: str) -> torch.Tensor:
return torch.tensor([tokenizer[c] for c in word.lower() if c in tokenizer])
model = TinyCTC(vocab=len(LETTERS))
ctc = nn.CTCLoss(blank=BLANK, zero_infinity=True)
opt = torch.optim.Adam(model.parameters(), lr=3e-4)
for epoch in range(20):
model.train()
for x, word_batch, lengths in dl: # 词级 Dataset 的 batch
ys = [encode_word(w) for w in word_batch]
y_flat = torch.cat(ys)
y_lens = torch.tensor([len(y) for y in ys])
logp = model(x) # (B, T', V)
in_lens = (x.shape[-1] // 4).clamp(min=1).repeat(len(x)) # 下采样率按网络调整
loss = ctc(logp.transpose(0, 1), y_flat, in_lens, y_lens)
opt.zero_grad(); loss.backward()
torch.nn.utils.clip_grad_norm_(model.parameters(), 5.0)
opt.step()
§6.5 坑点 8 个
⚠️ 坑点 1:把 B1+B3/B2 块级划分误当作说话人无关划分(分类:数据泄漏)
问题:测试说话人的 B1/B3 在训练集中,B2 协议衡量的是"见过的说话人、没见过的词";若在论文或产品评估中写成 speaker-independent,结论会被系统性高估。
症状:按说话人分组重新划分后 WER 大幅恶化(常见翻倍以上),且远差于文献报告;评审指出"speaker-independent"表述错误。
解决:
- 简单方法:报告任何数字时显式写明 “block-wise speaker-dependent (B1&B3 train / B2 test)”。
- 进阶方法:另做 speaker_id 分组划分(
GroupKFold按 speaker_id),两套指标并列报告。- SOTA 方法:参照 CUHK 协议同时报告四档可懂度分组的 WER(Very Low/Low/Medium/High),用 MAPSSWE 显著性检验(α=0.05)支持组间结论(arXiv:2202.10290)。
参考:arXiv:2203.10274;arXiv:2508.08027(该文将此划分误述为 speaker-independent,是反向例证)
⚠️ 坑点 2:训练词表不覆盖测试词,词级端到端模型直接失效(分类:标签理解)
问题:B2 测试含 100 个训练集中从未出现的非常用词,声学到词(acoustic-to-word)的端到端模型在测试时无法输出这些词。
症状:CTC/Seq2Seq 在 B2 上输出大量<unk>或 OOV 词,WER 异常高;训练-验证指标正常、测试崩塌。
解决:
- 简单方法:改用字母/音素级 CTC + 词格或 n-gram 语言模型解码。
- 进阶方法:用 G2P 生成测试词发音,构建音素词格让解码器在测试词表内搜索。
- SOTA 方法:子词(BPE)或 grapheme 目标 + LM 重打分/两遍重排;CUHK 明确指出该库"不适合直接声学到词建模"(CUHK 综述)。
参考:arXiv:2203.10274
⚠️ 坑点 3:可懂度区间与严重度命名的反向陷阱(分类:标签理解)
问题:UA-Speech 的四级分组以可懂度命名(Very Low intelligibility = 0-25% 可懂 = 极重度构音障碍),而部分论文误写为"very low severity (76-100%)",方向完全相反。
症状:跨论文比较"Very Low 组 WER"时出现 55% 与 3% 两类矛盾数字;严重度分布表对不上。
解决:
- 简单方法:永远以"intelligibility 区间"为准记录分组:0-25% ↔ very severe,26-50% ↔ severe,51-75% ↔ moderate,76-100% ↔ mild(Comparative Study, 2023)。
- 进阶方法:入库时同时物化
intelligibility_pct与severity_label两个字段,并以区间约束校验一致性。- SOTA 方法:不做离散分组,直接对
intelligibility_pct做回归/秩相关评估,规避命名歧义。
参考:PLOS Digital Health, 2023(其正文即出现反向命名,引以为戒)
⚠️ 坑点 4:严重度分组类别不平衡,组级指标方差极大(分类:偏倚陷阱)
问题:Low 与 Medium 可懂度组各仅约 2 名说话人,组级 WER/准确率由一两个人决定,随机波动巨大。
症状:不同随机种子下组级指标跳动数个百分点;分组排名在论文间不一致。
解决:
- 简单方法:报告宏平均(macro-average)并附每组说话人数;避免对 2 人组做单点结论。
- 进阶方法:对说话人做 bootstrap 重采样,报告组级指标的置信区间。
- SOTA 方法:合并相邻组(如 Very Low vs 其余)做二分评估,或以可懂度连续值做相关性分析(PLOS Digital Health, 2023)。
参考:PLOS Digital Health, 2023
⚠️ 坑点 5:多通道与采样率口径不一致,数字不可直接比较(分类:评估误用)
问题:每条词有 8 通道录音;社区研究用第 6 号麦克风 + 16 kHz,另有工作用全部通道、波束成形或 48 kHz 原始率。通道/采样率不同,声学条件不同,WER 不可横比。
症状:同样协议下复现值偏差数个百分点;多通道融合"涨点"可能只是信息量增加而非算法优势。
解决:
- 简单方法:全流程固定 mic06 + 16 kHz 并写入实验配置。
- 进阶方法:做通道消融(每通道单独报告),区分通道增益与模型增益。
- SOTA 方法:多通道前端(延迟-求和/掩码波束成形)与单通道基线并列成表,明确声明通道数(IEEE 10508947)。
参考:IEEE Xplore, 2024;Nature Sci Rep, 2024
⚠️ 坑点 6:孤立词首尾静音膨胀,训练时间与统计被静音支配(分类:预处理陷阱)
问题:障碍说话人反应与发音起始慢,原始录音含大量首尾静音:69.1 小时训练音频去静音后仅 30.6 小时(>55% 为静音)。
症状:训练轮数翻倍、显存浪费;统计窗口被静音帧淹没,序列模型学到"等待"而非"语音"。
解决:
- 简单方法:能量 VAD 剥离首尾静音(见 §6.3 代码,top_db≈30)。
- 进阶方法:HTK/Kaldi GMM-HMM 强制对齐后按词边界裁剪(社区基线 /s5_segment 的做法)。
- SOTA 方法:保留少量静音上下文(前后 100-200 ms)以保留音色线索,并按去静音时长重新标定 batch 时长与学习率(ffxiong/uaspeech)。
参考:CUHK 综述;ffxiong/uaspeech
⚠️ 坑点 7:说话人口径漂移(19/16/15),跨论文比较失真(分类:评估误用)
问题:原发布 19 名构音说话人;3 名撤回许可/数据损坏后现分发 16 名;早期公开分发与多数复现研究基于 15 名。三者不可混用。
症状:汇总表里"16 人结果"与"15 人结果"直接比大小;引用 2008 论文摘要的 19 人却下载不到对应数据。
解决:
- 简单方法:每次报告数字都注明说话人版本与来源(论文口径/当前分发口径)。
- 进阶方法:复现时只与"同口径"论文比;建立实验登记表记录实际加载的 speaker_id 列表。
- SOTA 方法:以 16 构音 + 13 对照 + B1&B3/B2 为引用锚(2022-2025 主流),历史 15 人口径结果仅作趋势引用。
参考:官方页;IEEE 10508947
⚠️ 坑点 8:速度扰动增强的方向性泄漏与对照语音定向增强(分类:工程陷阱)
问题:SOTA 增强对构音语音做说话人独立扰动、对对照语音做说话人依赖扰动并定向加入训练(65.9 h → 130.1 h)。若测试集说话人的数据被"说话人依赖"增强波及,或对照语音方向搞反,会引入泄漏或无效增强。
症状:增强后 WER 提升不可复现;审稿质疑测试信息泄露。
解决:
- 简单方法:对构音测试说话人只做说话人独立(全局)扰动。
- 进阶方法:严格按 arXiv:2202.10290 方向实现:构音说话人独立 SP + 控制说话人依赖 SP,并显式排除对照 B2。
- SOTA 方法:在增强配方登记表记录 399,110 条增强集的构造规则;用 MAPSSWE 检验增强增益显著性。
参考:arXiv:2401.00662;arXiv:2202.10290
§6.6 数据增强(安全与危险)
| 类别 | 技术 | 说明 |
|---|---|---|
| ✅ 安全 | 速度扰动(说话人独立方向)、SpecAugment(时间/频率掩蔽)、加性噪声(真实环境噪声) | 保留障碍语音的发音错误模式,SOTA 标准做法 |
| ✅ 安全 | 通道随机选择(训练时在 8 通道内抖动) | 提升前端鲁棒性,前提是评估通道固定 |
| ❌ 危险 | 对测试说话人做说话人依赖扰动;把对照语音加速扰动后混入构音测试词表 | 引入测试信息泄漏 |
| ❌ 危险 | 音高/共振峰强变换(≥±2 半音) | 破坏障碍语音的音色诊断特征,可懂度标签随之失真 |
| ❌ 危险 | 跨说话人拼接伪造"混合口音" | 制造自然界不存在的发音模式,损伤可懂度分组结论 |
# SOTA 方向的安全速度扰动(SOX 实现):构音=说话人独立(全局速率池),
# 对照=说话人依赖(每说话人专属速率池);测试说话人的 B2 永不扰动入训。
import subprocess, random
GLOBAL_RATES = [0.9, 1.0, 1.1] # 构音说话人独立方向
SPEAKER_RATES = {"CM04": [0.85, 1.0, 1.15]} # 对照说话人依赖方向(示例)
def speed_perturb(src: str, dst: str, rate: float):
subprocess.run(["sox", src, "-r", "16000", dst, "tempo", str(rate)], check=True)
def make_augmented_pair(speaker: str, is_dysarthric: bool):
rates = GLOBAL_RATES if is_dysarthric else SPEAKER_RATES[speaker]
return random.choice(rates)
§6.7 模型推荐
| 场景 | 推荐模型 | 理由 |
|---|---|---|
| 词级分类(数字/字母/命令) | CNN-GRU / Conformer 轻量头 | 数据量小、类别少,端侧可部署(PMC9602047) |
| 词级 ASR(全词表) | wav2vec 2.0 / HuBERT 微调 + 字母 CTC | SSL 特征对障碍语音最稳健,文献最丰富 |
| 带语言模型的 SOTA | TDNN/LHUC-SAT 混合系统或 Conformer + LM 重排 | 历史最低 WER 均出自该路线(JSLHR, 2024) |
| 严重度分级 | wav2vec 2.0 + 说话人无关正则(SALR) | 防止过拟合 15-16 名说话人(PLOS Digital Health, 2023) |
| LLM 时代探索 | Whisper large v2 + LLM 解码纠错(如 Vicuna/BART) | 2025 年基线:Whisper 直接微调 WER 约 0.40,加 LLM 解码约 0.26(arXiv:2508.08027) |
§6.8 硬件需求
| 任务 | 最低配置 | 推荐配置 |
|---|---|---|
| 词级分类复现 | 1× GPU(11 GB 显存) | 1× GPU(24 GB) |
| 字母 CTC 全词表 | 1× GPU(24 GB) | 2× GPU(数据并行) |
| SSL 微调(wav2vec 2.0/HuBERT) | 1× GPU(32 GB,批长裁剪) | 4× A100 40 GB(大 SSL 模型微调参照 arXiv:2508.08027) |
| 存储 | 30 GB | 100 GB(含增强集) |
§6.9 评估指标代码
# WER 与按可懂度分组报告;对齐 SOTA 文献口径
import jiwer, pandas as pd
def wer_table(refs: list, hyps: list, meta: pd.DataFrame) -> pd.DataFrame:
df = meta.copy()
df["wer"] = [jiwer.wer(r, h) for r, h in zip(refs, hyps)]
overall = df["wer"].mean()
by_group = df.groupby("severity_group")["wer"].mean() # Very Low/Low/Medium/High
out = by_group.to_frame("WER").T
out.loc["Average", "WER"] = overall
return out # 列顺序应排为 Very Low, Low, Medium, High
# 分组差异显著性:对系统 A/B 的逐句 WER 做 MAPSSWE 近似(配对置换检验替代)
import numpy as np
def paired_permutation(wer_a: np.ndarray, wer_b: np.ndarray, n: int = 10000) -> float:
"""返回系统 A 显著优于 B 的双侧近似 p 值(MAPSSWE 的轻量替代,
论文级结论请使用 HTK/SCTK 官方实现)。"""
diff = wer_a - wer_b
obs = abs(diff.mean())
pooled = np.concatenate([diff, -diff])
rng = np.random.default_rng(0)
count = 0
for _ in range(n):
sample = rng.choice(pooled, size=len(diff), replace=False)
if abs(sample.mean()) >= obs:
count += 1
return count / n
# 说话人级 bootstrap 置信区间(应对坑点 4 的组级小样本波动)
def group_ci(df: pd.DataFrame, group: str, n: int = 2000) -> tuple:
vals = df[df["severity_group"] == group]["wer"].values
rng = np.random.default_rng(0)
boots = [rng.choice(vals, size=len(vals), replace=True).mean() for _ in range(n)]
return float(np.percentile(boots, 2.5)), float(np.percentile(boots, 97.5))
注意:标准协议按句(词)平均 WER,不按说话人平均后再平均;报告时同时给出 Overall 与四组数值,并注明说话人版本(16 构音)与通道(mic06、16 kHz)。
§6.10 MLOps 笔记
- 口径登记:把"说话人版本、划分协议、通道、采样率、增强方向"写入实验配置文件并随 checkpoint 存档,任何一项变化都视为新实验。
- 许可红线进 CI:在数据加载测试中校验 LICENSE.txt 存在,禁止把原始音频写入可公开访问的存储或日志。
- 数据版本化:以 speaker_id 清单哈希作为数据集指纹,复现问题时先比对指纹再排查代码。
# experiment.yaml 模板:与 checkpoint 一同存档的口径登记
dataset:
name: UA-Speech
speaker_version: "16 dysarthric + 13 controls (current distribution)"
split_protocol: "B1+B3 train / B2 test (block-wise speaker-dependent)"
microphone: mic06
sampling_rate_hz: 16000
silence_strip: {method: energy_vad, top_db: 30}
augmentation:
speed_perturbation:
dysarthric: speaker_independent # [0.9, 1.0, 1.1]
control: speaker_dependent
evaluation:
metric: WER
significance: {test: MAPSSWE, alpha: 0.05}
grouping: [Very Low, Low, Medium, High]
license:
files_check: ["LICENSE.txt"]
forbid: [commercial_use, redistribution]
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 病因单一 | 全部构音说话人为痉挛型脑瘫,无 ALS/帕金森/卒中病因 | 高 | 跨病因结论需外部库(TORGO/EasyCall/SAP)验证 |
| 地域单一 | 单一美国中西部社区、全部美国英语 | 高 | 跨语言/地域研究需多库联合 |
| 严重度不平衡 | Low/Medium 组各仅约 2 人 | 中 | 宏平均、bootstrap 置信区间、连续值回归 |
| 性别失衡 | 构音组男 11 : 女 4(15 人口径) | 中 | 分性别评估需合并小样本,谨慎解释 |
| 标注者少 | 可懂度仅 5 听者均值,无公开信度 | 中 | 声明局限;避免把可懂度当完美金标签 |
| 孤立词任务 | 无句子/自发语音,词级结论难外推连续语音 | 高 | 句级研究需 TORGO/SAP |
§7.2 标注质量
提示词即标签(实验设计生成),无转录歧义;真正的质量风险在可懂度标注:5 名听者的感知评定是该领域金标准,但个体听者差异未量化公开。障碍语音的"未发出目标内容"(如重度者只发出部分音段)会同时进入音频与标签,这是任务设计特性而非错误,但对误读率敏感的模型需知晓。
| 标注层 | 质量属性 | 已知信息 | 对建模的含义 |
|---|---|---|---|
| 提示词标签 | 确定性高 | 实验设计生成,逐词唯一 | ASR 监督信号可靠 |
| 可懂度评分 | 感知评定 | 5 听者平均、2%-95% | 回归目标带噪声,宜做鲁棒损失 |
| 听者间信度 | 未公开 | 无 ICC/Kappa 数值 | 论文局限性必写项 |
| 严重度分组 | 派生规则 | 25/50/75 分界(个别文献 25/50/75 有出入) | 入库时统一边界并记录 |
§7.3 泛化性评估
| 目标场景 | 失效风险 | 证据 |
|---|---|---|
| 连续语音/自发语音识别 | 高:全库为孤立词朗读 | 语料设计即孤立词任务(Interspeech 2008) |
| 非痉挛型构音障碍(弛缓/运动亢进等) | 高:病因分布单一 | 官方声明所有说话人为痉挛型(ScienceDirect, 2013) |
| 非美国英语语言 | 高:零语言多样性 | 采集地域单一 |
| 儿童/老年障碍语音 | 中-高:仅 18-58 岁成人 | 人群表(§2.4) |
| 消费级设备现场部署 | 中:实验室安静环境录音 | 采集环境见 §3.9 |
§7.4 伦理
采集经 University of Illinois IRB 批准(NIH NIDCD 5R21 DC008090),参与者知情同意并附加约束条款:仅限政府与学术研究实验室使用、禁止商用、禁止再分发、须防盗保护。原 19 人中 3 人撤回许可即从分发中移除,体现"随时可撤回"的伦理承诺。说话人以匿名编号(F02、M16 等)出现,分发不含姓名、医疗记录与视频。
§7.5 公平性
四级可懂度分组的性能落差是本库最重要的公平性事实:同一系统 WER 从轻度组约 2.6% 到极重度组约 55.6%(arXiv:2202.10290),差距约 20 倍——模型再好,最重度的说话人依然近乎无法被识别。性别(女 4/男 11)与年龄段(18-58 岁为主)的分布限制了对细分人群公平性的统计功效;官方文档未提供种族等更多人口学维度,跨群体偏差审计的分辨率有限。
| 公平性维度 | 库内分布 | 审计可行性 | 已知风险 |
|---|---|---|---|
| 可懂度(核心维度) | 2%-95%,四组沙漏形分布 | ✅ 高(有金标签) | 极重度组系统近乎失效 |
| 性别 | 构音组 4 女 / 11 男 | ⚠️ 中(女声样本少) | 女声子集指标置信区间宽 |
| 年龄 | 18-58 岁 | ⚠️ 中(无官方分箱) | 未成年人/老年外推无据 |
| 病因 | 仅痉挛型脑瘫 | ❌ 低(单值) | 跨病因公平性结论不可得 |
| 种族/方言 | 官方未提供 | ❌ 低(字段缺失) | 无法开展分层审计 |
§7.6 数据漂移
UA-Speech 为静态历史库(2006-2009 采集),无持续追加;风险主要来自"使用环境漂移":现代麦克风阵列、远场拾音与消费设备信道与实验室顶置阵列差异显著,模型在生产前应做信道适应。2023 年起的 Speech Accessibility Project 采集设备、口音与病种构成更接近当代产品环境,可作为漂移对照源。
§7.7 DAIMS 24 项检查
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式可用 | ✅ | 文件名即元数据,可解析为宽表 |
| 2 | 唯一标识 | ✅ | 说话人匿名编号 + 文件名唯一键 |
| 3 | 特殊字符安全 | ✅ | 词文本 ASCII,路径无空格 |
| 4 | 重复行处理 | ⚠️ | 6 个非常用词跨块重复,独特词 455/449 两口径并存 |
| 5 | 缺失编码 | ✅ | 缺失以文件不存在体现,无魔法值 |
| 6 | 标签标识 | ✅ | 五类词类别与四级分组明确 |
| 7 | 罕见类分组 | ⚠️ | Low/Medium 组各约 2 人,分组统计不稳定 |
| 8 | 偏倚评估 | ⚠️ | 官方未提供偏倚分析文档,需研究者自查 |
| 9 | 数据字典 | ⚠️ | 无官方机器可读字典;本页 §4.1 为社区重构版 |
| 10 | 信息性缺失解释 | ⚠️ | 通道缺失未逐条官方解释(与"数据损坏"声明相关) |
| 11 | 设备记录 | ✅ | 阵列构型、间距、声卡、采样率有论文级记录 |
| 12 | 共线性检查 | ✅ | 不适用(无多元临床变量表) |
| 13 | 编码映射 | ✅ | 词类别简写规则明确(D/L/CC/CW/UW) |
| 14 | 时间戳处理 | ✅ | 不适用(非时序 EHR) |
| 15 | 划分建议 | ⚠️ | 官方无划分文件;社区协议强但需自行实现 |
| 16 | 泄漏讨论 | ✅ | 块结构与通道结构使泄漏面可枚举(本页坑点 1/8) |
| 17 | 标签分布 | ✅ | 可懂度 2%-95% 与四级分布可核对 |
| 18 | 测量偏倚 | ⚠️ | 5 听者感知评定无公开信度 |
| 19 | 外部验证建议 | ✅ | TORGO/EasyCall 等成熟对接路径存在 |
| 20 | 版本记录 | ❌ | 无公开版本号/变更日志,说话人撤回只散见官方页文字 |
| 21 | 预处理脚本 | ⚠️ | 社区 Kaldi 基线(非官方维护)存在 |
| 22 | 合规要求 | ✅ | 许可、申请流程、IRB/NIH 信息完整公开 |
| 23 | 多模态对齐 | ⚠️ | 原始含视频,标准分发不含,音视频对齐不可得 |
| 24 | 去标识化 | ✅ | 匿名编号、无姓名/病历/视频分发 |
DAIMS 评分:17.5 / 24(✅ 计 1 分 × 14 项,⚠️ 计 0.5 分 × 7 项,❌ 计 0 分 × 1 项)
评分解读:17.5 分落在"结构清晰、契约明确,但工具链与元数据服务缺位"区间。UA-Speech 的任务设计、标识体系与合规透明度达到黄金基准水准;失分集中在工程配套——无官方数据字典、无版本号、无划分文件、信度未公开,这些缺口意味着每个团队都要自行重造一遍"口径管理"。
对你意味着什么:第一,入库前先把文件名解析脚本、词类别解码表和说话人清单固化为代码资产(本页 §4.1/§6.1 可直接复用),不要依赖任何"官方 CSV"。第二,实验登记表必须记录说话人版本(16/15/19)、划分协议、通道与采样率四项口径,这是复现与评审的生命线。第三,涉及可懂度标签的研究,把"5 听者、无公开信度"写进局限性;涉及分组比较的研究,报宏平均与置信区间而非单组数字。第四,若需要视频或句子语料,本库不提供,直接评估 TORGO 或 Speech Accessibility Project 的可得性。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| TORGO | 多伦多大学 | 说话人无关词/句 ASR | WER 显著高于 UA-Speech 口径 | 更差 | TORGO 无清晰可懂度分层,句级任务更难(arXiv:2202.10290) |
| 健康对照子集(本库 B1&B3) | UIUC | 同一系统词识别 | WER 约 2.6%-3.0% | 相对构音组约 1/8 | 量化障碍语音差距:SOTA 构音平均约 20%-21%(arXiv:2401.00662) |
| EasyCall(意大利语) | 意大利机构 | 跨语言构音检测 | wav2vec2 特征跨库可迁移 | 可迁移但性能降 | 微调后的 SSL 特征在语言无关检测中优于未微调(IEEE 10508947) |
| Switchboard/LibriSpeech(健康语音基准) | 公开基准 | 同期 ASR 进步对照 | 错误率 2008-2023 降约 5 倍 | 健康语音进步更快 | 构音障碍错误率同期仅降约 3 倍,差距扩大(JSLHR, 2024) |
§8 基准性能与生态
§8.1 排行榜(B2 测试,16 构音说话人,WER)
以下成绩单来自 JSLHR 2024 综述对 UA-Speech 标准测试词错误率历史的整理(DOI: 10.1044/2024_JSLHR-24-00122)。数值不可直接比较:各年代系统的说话人版本(15/16/19)、通道与采样率、语言模型与增强配方不同,只能作为趋势线阅读。
| 排名(时间序) | 模型/团队 | WER | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | Geng et al.(CUHK 系) | 17.8% | 2023 | SSL + 说话人自适应 | Geng et al., 2023(转引自 JSLHR 2024) | 未公开 |
| 2 | Baskar et al. | 22.5% | 2022 | 系统融合 | Baskar et al., 2022(转引自同上) | 未公开 |
| 3 | Liu et al. | 25.2% | 2021 | 混合/端到端组合 | Liu et al., 2021(转引自同上) | 未公开 |
| 4 | Liu et al. | 26.6% | 2020 | LHUC-SAT 系 | Liu et al., 2020(转引自同上) | 未公开 |
| 5 | Xiong et al. | 27.9% | 2019 | 发音节奏分析 + 迁移 | Xiong, Barker, Yue & Christensen, 2019, IEEE ICASSP(arXiv 配套代码) | 部分(Kaldi 基线) |
| 6 | Yu et al. | 32.2% | 2018 | 源域选择迁移 | Yu et al., 2018(转引自同上) | 未公开 |
| 7 | Sehgal & Cunningham | 34.9% | 2015 | 深度学习早期改进 | Sehgal & Cunningham, 2015(转引自同上) | 未公开 |
| 8 | Christensen et al. | 40.5% | 2014 | 深度学习首代 | Christensen et al., 2014(转引自同上) | 未公开 |
| 9 | Sharma(UIUC) | 58.7% | 2012 | 背景插值自适应 | Sharma, 2012(转引自同上) | 未公开 |
| 10 | Sharma(UIUC,首报) | 69.2% | 2008 | GMM-HMM 基线 | Sharma, 2008(转引自同上) | 未公开 |
补充锚点:2022 年 CUHK 系统按可懂度分组 WER 为 Very Low 约 55.6%、Low 约 23.3%、Medium 约 12.5%、High 约 2.6%(arXiv:2202.10290);2025 年 Whisper large v2 直接微调 WER 约 0.40,叠加 LLM 解码(Whisper-Vicuna)约 0.26(arXiv:2508.08027)。
§8.2 SOTA 总结与选型建议
2008-2023 年最佳 WER 降至首报的约四分之一(69.2% → 17.8%),但同期健康语音错误率降幅(约 5 倍)更大,障碍语音识别的绝对差距仍在扩大(JSLHR, 2024)。选型建议:追求排行榜复现选混合 TDNN/Conformer + LHUC-SAT + LM 重排;追求工程落地与迭代速度选 SSL(wav2vec 2.0/HuBERT)字母 CTC 微调;追求临床评估选说话人无关正则的分级框架。
| 你的目标 | 推荐路线 | 参考成绩/出处 | 主要权衡 |
|---|---|---|---|
| 复现排行榜(最低 WER) | 混合 TDNN/Conformer + LHUC-SAT + LM 重排 + 双向速度扰动 | 平均约 20%-22%,2023 年最好 17.8%(JSLHR, 2024) | pipeline 复杂、增强配方敏感 |
| 快速 SSL 基线 | wav2vec 2.0/HuBERT + 字母 CTC 微调 | HuBERT-CTC 约 0.54、Whisper 约 0.40 WER(arXiv:2508.08027) | 绝对 WER 高于混合系统,但工程简单 |
| 自动可懂度分级 | SSL + 说话人无关正则(SALR) | 宏平均 F1 提升且可跨库评估(PLOS Digital Health, 2023) | 说话人过拟合是主要风险 |
| LLM 时代探索 | Whisper + LLM 解码纠错 | Whisper-Vicuna 约 0.26 WER(arXiv:2508.08027) | 推理成本高,端侧不友好 |
§8.3 评测协议
- 训练 = B1+B3(全部 29 人);测试 = B2(仅 16 构音说话人);报告按四档可懂度分组 + 总体 WER。
- 静音处理:HTK GMM-HMM 强制对齐裁剪(或能量 VAD 近似),训练 30.6 h / 测试 9 h。
- 显著性:MAPSSWE,α=0.05(arXiv:2202.10290)。
- 通道与采样率:mic06、16 kHz 为主流口径;变更需声明并做通道消融。
§8.3b 协议配置速查卡
| 配置项 | 标准值 | 替代口径(需声明) |
|---|---|---|
| 训练集 | B1+B3,29 人,99,195 条(去静音 30.6 h) | 加增强后 130.1 h / 399,110 条 |
| 测试集 | B2,16 构音,26,520 条(去静音 9 h) | 含对照 B2(非标准,需注明) |
| 声学特征 | 80 维 Mel FBank + delta,9 帧上下文 | fMLLR(GMM 时代) |
| 划分性质 | block-wise speaker-dependent | speaker_id 分组(独立设定) |
| 显著性检验 | MAPSSWE,α=0.05 | 配对置换检验(近似) |
| 语言模型 | 统一词面语法网络 | 字母/音素 4-gram + 词格重排 |
§8.4 相关数据集
| 数据集 | 构音/对照 | 语言 | 语料 | 许可与获取 | 与 UA-Speech 关系 |
|---|---|---|---|---|---|
| TORGO | 8/7 | 英语 | 词+句+非词+发音运动 | 学术公开 | 含发音器官数据,可做多模态延伸 |
| Nemours | 11/0 | 英语 | 74 句/人 | 公开 | 句级早期库,仅男声 |
| EasyCall | 31/24 | 意大利语 | 命令+非命令 | 申请 | 多病因跨语言验证源 |
| Speech Accessibility Project | 数百人(扩展中)/含对照 | 英语 | 朗读+自发样本 | 受控分发 | UA-Speech 的当代后继,病种队列制 |
| Whispers of MDRAM 等 | 视项目 | 多语 | 视项目 | 视项目 | 低资源构音库补充 |
§8.5 关键论文 Top 10
- Kim, H., Hasegawa-Johnson, M., Perlman, A., Gunderson, J., Huang, T.S., Watkin, K., & Frame, S. (2008). Dysarthric speech database for universal access research. Proc. Interspeech 2008, 1741-1744. DOI: 10.21437/Interspeech.2008-480 — 数据集原始论文,定义语料结构与采集协议。
- Hasegawa-Johnson, M., et al. (2024). Community-Supported Shared Infrastructure in Support of Speech Accessibility. Journal of Speech, Language, and Hearing Research. DOI: 10.1044/2024_JSLHR-24-00122 — 整理 UA-Speech WER 完整历史与三库生态,基准史权威综述。
- Geng, M., Xie, X., Liu, X., et al. (2022). Speaker Adaptation Using Spectro-Temporal Deep Features for Dysarthric and Elderly Speech Recognition. arXiv:2202.10290(全文)— 系统化 UA-Speech 协议、增强方向与 LHUC 自适应细节。
- Geng, M., et al. (2022). Cross-Domain Inverted Articulatory Features for Dysarthric ASR. arXiv:2203.10274(全文)— 明确 B1+B3/B2 数据规模口径(99,195/26,520 条)与发音特征融合。
- Xiong, F., Barker, J., & Christensen, H. (2019-2020). Phonetic Analysis of Dysarthric Speech Tempo / Source Domain Data Selection for Improved Transfer Learning. IEEE ICASSP(配套 Kaldi 基线)— Sheffield 团队开源基线与节奏分析。
- Hernandez, A., et al. (2023). Speaker-independent dysarthria severity classification using self-supervised transformers and multi-task learning. PLOS Digital Health. DOI: 10.1371/journal.pdig.0001076 — wav2vec 2.0 + SALR 做说话人无关严重度分级的代表作。
- Nature Scientific Reports (2024). Enhancing dysarthric speech recognition through SepFormer and hierarchical attention network models with multistage transfer learning. DOI: 10.1038/s41598-024-80764-w(全文)— 多阶段迁移学习与数据集整体视图(66,280 条预处理口径)。
- IEEE (2024). Exploring the Impact of Fine-Tuning the Wav2vec2 Model in Database-Independent Detection of Dysarthric Speech.(Xplore 10508947)— 跨库(UA-Speech/TORGO/EasyCall)SSL 特征检测。
- arXiv (2024). Enhancing Pre-trained ASR System Fine-Tuning for Dysarthric Speech Recognition Using Adversarial Data Augmentation. arXiv:2401.00662(全文)— 对照语音定向增强与系统融合细节。
- arXiv (2025). Bridging ASR and LLMs for Dysarthric Speech Recognition: Benchmarking Self-Supervised and Generative Approaches. arXiv:2508.08027(全文)— LLM 解码时代的新基线与协议对照。
§8.6 社区活跃度
UA-Speech 无独立用户社区,讨论散布于使用团队仓库与邮件列表:申请入口为 uaspeech-requests@lists.illinois.edu;Sheffield 团队的 ffxiong/uaspeech 是最常被引用的 Kaldi 基线仓库;UIUC Speech Accessibility Project 与 Statistical Speech Technology Group 页面承担事实上的"官方发布"职能。截至 2026-09,原论文 Google Scholar 引用 560+ 次,且每年仍有数十篇新论文沿用其测试协议。
§8.7 生态快照
| 资源 | 类型 | 链接 | 热度(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| 官方数据页 | 分发入口 | speechtechnology.web.illinois.edu/UASpeech | 官方唯一 | 许可与申请的唯一权威来源 |
| Interspeech 2008 论文页 | 原始论文 | ISCA Archive | 560+ 引用 | 语料设计与引用格式权威页 |
| ffxiong/uaspeech | Kaldi 基线 | GitHub | 社区常用 | 复现 WER 排行榜的起步代码 |
| JSLHR 2024 综述 | 基准史 | ASHA | 权威 | 十五年 WER 曲线与三库对比 |
| Kaggle 降噪镜像 | 社区衍生 | Kaggle | 11.53 GB 镜像 | 免申请跑通流程(非官方) |
| HF 衍生训练集 | 社区衍生 | HF 镜像 | 38,656 条 | CI 冒烟测试便利 |
§9 相关资源与引用
§9.1 官方资源清单
- 官方数据页与申请:https://speechtechnology.web.illinois.edu/UASpeech(许可条款、申请邮箱、IRB/资助信息)
- 历史数据页:http://www.isle.illinois.edu/sst/data/UASpeech/(旧版页面,部分论文仍引用)
- 项目主页(第一作者视角):UIUC Heejin Kim 项目页
- 后继项目:Speech Accessibility Project
- 社区 Kaldi 基线:github.com/ffxiong/uaspeech
§9.2 BibTeX 引用
@inproceedings{kim08c_interspeech,
author = {Heejin Kim and Mark Hasegawa-Johnson and Adrienne Perlman and
Jon Gunderson and Thomas S. Huang and Kenneth Watkin and Simone Frame},
title = {{Dysarthric speech database for universal access research}},
year = 2008,
booktitle = {Proc. Interspeech 2008},
pages = {1741--1744},
doi = {10.21437/Interspeech.2008-480}
}
@article{hasegawajohnson2024shared,
author = {Mark Hasegawa-Johnson and others},
title = {Community-Supported Shared Infrastructure in Support of Speech Accessibility},
journal = {Journal of Speech, Language, and Hearing Research},
year = {2024},
doi = {10.1044/2024_JSLHR-24-00122}
}
@article{hernandez2023salr,
author = {Alvaro Hernandez and others},
title = {Speaker-independent dysarthria severity classification using
self-supervised transformers and multi-task learning},
journal = {PLOS Digital Health},
year = {2023},
doi = {10.1371/journal.pdig.0001076}
}
@misc{geng2022spectrotemporal,
author = {Mengzhe Geng and Zi Ye and Tianzi Wang and Guinan Li and Shujie Hu and
Xurong Xie and Xunying Liu and Helen Meng},
title = {Speaker Adaptation Using Spectro-Temporal Deep Features for
Dysarthric and Elderly Speech Recognition},
year = {2022},
howpublished = {arXiv:2202.10290}
}
§9.3 引用指南
引用本数据集时:研究性论文必须引用 Kim et al. 2008(数据集)并在方法节注明说话人版本(16 构音 + 13 对照)、划分协议(B1+B3/B2)、通道与采样率(mic06、16 kHz);若使用社区衍生集,还需注明衍生来源并仍遵守原始许可(禁商用、禁再分发);比较历史 WER 时建议同时引用 JSLHR 2024 综述以保证基准史的准确性。
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| fast-model(CodeBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch(多源检索) | 2026-09-15 | 6 组检索:官方分发页、Interspeech 2008 论文、基准综述、协议与数据规模、社区镜像与许可证交叉验证 |
§10.2 AI 参与范围
AI 完成检索汇总、事实表格化、初稿撰写与代码起草;所有关键数字(说话人规模、词表结构、时长、划分条数、WER 历程、许可条款)均回溯至 §10.3 列出的来源并由编辑部交叉核对;医学编码映射(ICD-11/SNOMED)仅收录可公开核验条目;代码示例经结构性检查但未在真实分发包上端到端执行(分发为邮件申请制),使用者应按 §6 自行验证。
§10.3 输入来源列表
- Kim, H., Hasegawa-Johnson, M., Perlman, A., Gunderson, J., Huang, T.S., Watkin, K., & Frame, S. (2008). Dysarthric speech database for universal access research. Proc. Interspeech 2008, 1741-1744. DOI: 10.21437/Interspeech.2008-480 — https://www.isca-speech.org/archive/interspeech_2008/kim08c_interspeech.html
- UIUC Statistical Speech Technology Group, UASpeech 官方分发页 — https://speechtechnology.web.illinois.edu/UASpeech
- Hasegawa-Johnson, M., et al. (2024). Community-Supported Shared Infrastructure in Support of Speech Accessibility. JSLHR. DOI: 10.1044/2024_JSLHR-24-00122 — https://pubs.asha.org/doi/full/10.1044/2024_JSLHR-24-00122
- Kim, H., et al. (2008) 论文全文(ResearchGate 镜像,含作者机构与设备图) — https://www.researchgate.net/publication/221481038_Dysarthric_speech_database_for_universal_access_research
- UIUC Heejin Kim 项目页(UA-Speech 研发历程与分发史) — https://publish.illinois.edu/hkim17/universal-access-ua-speech-corpus-development-universal-access-automatic-speech-recognition-project-for-talkers-with-dysarthria/
- Google Scholar 引用快照(560 次,截至 2026-09) — https://scholar.google.ae/citations?citation_for_view=18O0OAwAAAAJ%3AYsMSGLbcyi4C
- Semantic Scholar 作者页(374 次收录) — https://semanticscholar.org/author/Heejin-Kim/2108984493
- Geng, M., et al. (2022). Speaker Adaptation Using Spectro-Temporal Deep Features… arXiv:2202.10290 — https://arxiv.org/html/2202.10290v3
- Geng, M., et al. (2022). Cross-Domain Inverted Articulatory Features… arXiv:2203.10274 — http://export.arxiv.org/pdf/2203.10274
- CUHK 构音语音识别进展综述(数据规模与协议口径) — https://www1.se.cuhk.edu.hk/~hccl/publications/pub/Recent.pdf
- arXiv:2103.06157 Automatic Speaker Independent Dysarthric Speech Intelligibility Assessment System(词表/块结构/可懂度评定细节) — https://ar5iv.arxiv.org/html/2103.06157
- Enhancing dysarthric speech recognition through SepFormer and HAN… Sci Rep 14, 2024 — https://www.nature.com/articles/s41598-024-80764-w
- Exploring the Impact of Fine-Tuning the Wav2vec2 Model in Database-Independent Detection of Dysarthric Speech. IEEE Xplore 10508947 — https://xplorestaging.ieee.org/document/10508947/metrics
- Hernandez, A., et al. (2023). Speaker-independent dysarthria severity classification… PLOS Digital Health — https://dx.doi.org/10.1371/journal.pdig.0001076
- Dysarthria Speech Detection Using CNN with GRU(15+13 人口径与年龄区间) — https://pmc.ncbi.nlm.nih.gov/articles/PMC9602047
- Bridging ASR and LLMs for Dysarthric Speech Recognition. arXiv:2508.08027 — https://ar5iv.labs.arxiv.org/html/2508.08027
- Enhancing Pre-trained ASR System Fine-Tuning… Adversarial Data Augmentation. arXiv:2401.00662 — https://www.arxiv.org/pdf/2401.00662
- Dysarthric Speech Recognition: A Comparative Study(三库对比与严重度命名口径) — https://www.researchgate.net/publication/375683400_Dysarthric_Speech_Recognition_A_Comparative_Study
- ffxiong/uaspeech Kaldi 基线仓库 README(Sheffield) — https://github.com/ffxiong/uaspeech/blob/master/README.md
- Kaggle 降噪社区镜像(目录结构与文件数统计) — https://www.kaggle.com/code/somnathchattaraj/ua-speech-final/input
- Speech Accessibility Project 脑瘫招募公告(UA-Speech 历史定位与后继项目) — https://speechaccessibilityproject.beckman.illinois.edu/article/2024/01/09/voice-recognition-project-recruiting-adults-with-cerebral-palsy
- Acoustic model adaptation using in-domain background models… Speech Communication(痉挛型同质诊断说明) — https://www.sciencedirect.com/science/article/pii/s0885230812000848
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| INFOBOX 与 §1 概览数字 | 千方病案医学编辑部 | 与官方页/原始论文逐项对照 | ✅ 已通过/已验证 |
| §2 医学背景与 ICD-11/SNOMED 映射 | 千方病案医学编辑部 | ICD-10/11 与 SNOMED 公开码核对 | ✅ 已通过/已验证 |
| §4 数据结构与 §5 划分口径 | 千方病案医学编辑部 | 与 CUHK 协议文献逐数核对 | ✅ 已通过/已验证 |
| §6 代码与 8 坑点 | 千方病案医学编辑部 | 结构检查 + 坑点溯源(每坑有文献或仓库依据) | ✅ 已通过/已验证 |
| §7 DAIMS 24 项与外部验证矩阵 | 千方病案医学编辑部 | 逐项评级复核 + 矩阵来源核对 | ✅ 已通过/已验证 |
| §8 基准数字与 §9 BibTeX | 千方病案医学编辑部 | 与 JSLHR 2024 / ISCA 档案页对照 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
全篇正文由 AI 起草,经编辑部交叉审核修订后发布;所有带链接的数字与结论均可在 §10.3 来源中回溯。免责声明三段为编辑部固定模板文本。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
§C 结构化数据(JSON-LD)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- torgo — 共享标签:生理信号 / 语音信号 / 步态与运动
- ninapro — 共享标签:生理信号 / 神经科学 / 步态与运动
- pc-gita — 共享标签:生理信号 / 神经科学 / 语音信号
- eegmmidb — 共享标签:生理信号 / 神经科学 / 步态与运动
- HLS-CMDS — 共享标签:生理信号 / 语音信号
- ppg-dalia — 共享标签:生理信号 / 步态与运动
- physionet-cinc-2016 — 共享标签:生理信号 / 语音信号
- coughvid — 共享标签:生理信号 / 语音信号
- Bridge2AI-Voice — 共享标签:生理信号 / 语音信号
- OpenNeuro — 共享标签:生理信号 / 神经科学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
