信息速览

TORGO — 构音障碍语音与 EMA 构音轨迹数据库 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | TORGO Database of Dysarthric Articulation |
| 英文全称 | Toronto Neuro Speech and Articulation dataset |
| 别名/简称 | TORGO、TORGO database of dysarthric articulation、LDC2012S02 |
| 疾病分类 | 构音障碍(ICD-11:MA80.0 构音障碍 / 8D20 脑瘫 / 8A60.0 肌萎缩侧索硬化) |
| SNOMED CT | 87310007 Dysarthria / 129070008 Cerebral palsy / 86044005 Amyotrophic lateral sclerosis |
| 数据模态 | 语音声学(16 kHz WAV)+ EMA 三维构音运动轨迹(AG500)+ 正字转写 |
| AI 任务类型 | 构音障碍语音识别(ASR)、声学-构音倒置(AAI)、构音障碍检测、严重度分级、辅助沟通输入 |
| 样本总数 | 15 名说话人 / 约 23 小时英语语音 / 16,552 句(Hugging Face 口径) |
| 数据大小 | 约 18 GB(未压缩,官方 4 个 tar.bz2 分包) |
| 数据格式 | WAV(PCM 16 bit 单声道 16 kHz)、AG500 pos 专有二进制、TXT 转写、XLS 记录 |
| 许可证 | 学术(非营利)用途免费,须引用至少一篇官方指定论文 |
| 访问级别 | 开放(官网直接下载,无需注册或协议签署) |
| DUO 标签 | NPUNCU(非商业非营利使用) |
| 语言 | 英语(加拿大) |
| 首发日期 | 2012-01-19(LDC2012S02 正式发布) |
| 最后更新 | 2012-01-19(数据录制期 2008–2010,发布后未再更新) |
| 发布机构 | 多伦多大学计算机系 & 言语语言病理学系 & Holland Bloorview 儿童康复医院 |
| 官方主页 | https://www.cs.toronto.edu/~complingweb/data/TORGO/torgo.html |
| 下载地址 | https://www.cs.toronto.edu/~complingweb/data/TORGO/torgo.html(F / FC / M / MC 四个 tar.bz2) |
| DOI | 10.35111/cp5y-9z47(LDC 数据集)/ 10.1007/s10579-011-9145-0(论文) |
| 引用次数 | 494+(Semantic Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 声学与转写开箱即用、社区基准成熟;扣分项:EMA 为专有二进制格式需 MATLAB 工具解析、无官方划分、无预处理脚本 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、构音障碍病因谱与临床任务定义、FDA 金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与多伦多大学、Holland Bloorview 儿童康复医院、LDC 无任何商业利益关联。本页面不销售 TORGO 数据集本身,仅提供 AI 就绪指南与学术信息服务。
信息边界:本页面基于截至 2026-09 的公开资料撰写,未访问 TORGO 数据本体;所有统计数字均可溯源至 §10.3 所列来源,官方未披露的字段(如转写者间一致性)以"未公布"处理。数据集若在未来更新,请以官方页面为最终依据。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。TORGO 官方要求仅限学术(非营利)用途使用,且任何公开成果必须引用至少一篇官方指定论文(见 §9)。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? TORGO 是全球首个同时发布"声音"和"发音器官运动"的构音障碍语音库。15 名志愿者(8 名脑瘫或 ALS 导致的构音障碍者,7 名健康对照)在多伦多大学朗读单词、句子并描述图片,录音的同时,一台 Carstens AG500 电磁发音记录仪以贴在舌头、嘴唇和下颌上的微型线圈,逐帧记录每个发音器官在三维空间中的运动轨迹。
为什么重要? 通用语音识别模型对构音障碍语音的错误率可高达 45%–74%,而这类患者往往因为肢体障碍同样难以使用键盘和触屏——"说不出又被听不懂"是辅助沟通(AAC)领域的核心痛点。TORGO 用约 23 小时的对齐数据,让研究者第一次能直接观察"发音器官怎么动"与"声音变成什么样"之间的对应关系,为医学级的可懂度评估与个性化语音识别提供物理基础。
我能用它做什么? 典型任务包括:为 Whisper 等大模型做构音障碍适配微调;训练声学→构音轨迹的倒置模型(AAI);构建构音障碍检测与轻/中/重严重度分级器;以及研究 CP 与 ALS 人群发音运动的共性偏差。如果你做医疗语音可及性(speech accessibility)方向,它几乎是必读的入门语料。
§1.1 摘要
TORGO 由多伦多大学计算机系与言语语言病理学系联合 Holland Bloorview 儿童康复医院于 2008–2010 年在多伦多录制,采集方法为:每名参与者从 19 英寸 LCD 屏幕朗读非词、短词、限制句(含 Yorkston–Beukelman 可懂度评估的 162 句与 TIMIT 衍生句 460 句)并自发描述 30 张图片,每人累计约 3 小时。声学通道采用头戴式与定向式双麦克风并统一降采样至 16 kHz 单声道 PCM;构音运动通道采用 Carstens AG500 三维电磁发音记录仪,在舌尖、舌中、舌背、下颌、上唇、下唇与嘴角贴附接收线圈,每次会话前执行全自动校准。8 名构音障碍者均由言语语言病理学家按 Frenchay Dysarthria Assessment(FDA)完成标准化运动功能评估。数据按"说话人/会话"两级目录组织,附正字转写、头部归一化与原始两版 EMA 位置文件、录制错误记录与线圈位置图。数据以 4 个 tar.bz2 分包免费发布(学术非营利用途),合计约 18 GB(未压缩);LDC 同步发行镜像版本 LDC2012S02。原始论文发表于 Language Resources and Evaluation(46 卷 4 期),截至 2026-09 已累积 494+ 次引用(Semantic Scholar)。
§1.2 战略价值分析
多模态稀缺性价值:在构音障碍语音资源中,同时提供"声学 + 构音运动学"双模态的公开数据集极为罕见——主流的 UASpeech 只有声学,MOCHA-TIMIT 虽有 EMA 但只含 1 名构音障碍者。TORGO 的 15 人双模态规模使其成为"声学→构音倒置(AAI)"与"构音增强 ASR"两个方向事实上的标准语料。近年 TU Delft 团队开源的声学-EMA 融合 ASR 流水线、以及多篇 SSL 特征 AAI 论文均直接以 TORGO 为实验平台,复现路径清晰。
临床公平与 AAC 价值:语音技术红利长期绕开言语障碍人群——大模型在 LibriSpeech 上约 5% 的词错率与在重度构音障碍语音上 45%–74% 的词错率形成刺眼对比。TORGO 同时覆盖轻度至极重度说话人(FDA 总分 32.8–61.6),且包含自发图片描述这类"贴近真实 AAC 使用场景"的非提示语料,是衡量语音技术"医疗公平性"与开发个性化 AAC 输入引擎的少数量化基准。对医疗 AI 团队而言,它还是构建"可懂度自动评估"临床工具的起点。
基准生态价值:TORGO 是少数"数据冻结但基准持续更新"的临床语料——从 2012 年的 GMM/HMM 时代到 2026 年的 Whisper LoRA,同一批数据上的方法演进构成了完整的纵向基准线。对新方法(如语音大模型的临床适配、参数高效微调、多模态融合)而言,在 TORGO 上与这条基准线对话,比在持续变动的新语料上更能隔离"方法本身"的贡献。494+ 次引用(截至 2026-09,Semantic Scholar)积累出的可复现实验协议与失败案例,进一步降低了后来者的试错成本。
§1.3 横向对比
| 数据集 | 规模 | 模态 | 标注 | 与 TORGO 的差异化 |
|---|---|---|---|---|
| TORGO | 15 人 / 约 23 小时 | 16 kHz 声学 + AG500 EMA 三维轨迹 | 正字转写 + FDA 评估 | 唯一"多人 + 声学/EMA 双模态"构音障碍库 |
| UASpeech | 32 人(19 患者 + 13 对照)/ 约 8 小时 | 声学 | 单词级可懂度 | 规模更大但仅孤立词,无运动学通道 |
| MOCHA-TIMIT | 1 患者 + 1 对照 / 约 1 小时 | 声学 + EMA | 音素级对齐 | 有 EMA 但患者样本量过小 |
| SSNCE(LDC2021S04) | 泰米尔语构音障碍语音 | 声学 | 转写 | 低资源语言,无 EMA |
| Speech Accessibility Project | 数百人(持续扩充) | 声学 | 转写 + 元数据 | 规模领先但需申请、无运动学 |
这张表决定了 TORGO 的生态位:追求"规模 × 孤立词可控条件"选 UASpeech,追求"多说话人真实语流"选 Speech Accessibility Project,而只要研究问题涉及"发音器官层面发生了什么",TORGO 几乎没有替代品。三者组合使用(TORGO 做机制分析、UASpeech 做规模验证、SAP 做现代部署检验)是当前该领域的主流研究设计。
§1.4 版本演进时间轴
TORGO 数据本体自 2012 年发布后冻结未变,此后的"演进"都发生在社区生态层:
| 时间 | 事件 |
|---|---|
| 2008–2010 | 多伦多大学完成全部受试者录制(AG500 EMA + 双麦克风声学) |
| 2011-03-26 | LRE 论文在线发表(Rudzicz, Namasivayam & Wolff) |
| 2012-01-19 | LDC 发布镜像版本 LDC2012S02(DOI 10.35111/cp5y-9z47) |
| 2012-08 | JSLHR 论文发表(声带表征与脑瘫语音识别,55 卷 4 期) |
| 2012-12 | LRE 46(4):523–541 正式出刊,附发音错误统计分析 |
| 2023–2026 | 社区出现 Hugging Face 派生集(约 13.5 小时 / 16,552 句口径)、Whisper LoRA 适配与声学-EMA 融合 ASR 开源流水线,数据本身未再更新 |
§1.5 典型 AI 应用场景
- 构音障碍 ASR 适配:对 Whisper、wav2vec2 等预训练模型做 LoRA / 全参微调,构建个性化 AAC 语音输入引擎;说话人独立评估下词错率可从 31.60% 降至 16.87%(见 §8.1)。
- 声学→构音倒置(AAI):以 16 kHz 声学特征回归 12–24 维构音轨迹(6 线圈 × X/Y 方向 ± 速度/加速度),用于发音训练反馈与语音可视化。
- 构音障碍检测与严重度分级:二分类(患者/对照)与低/中/高三级严重度分类,说话人独立设定下三分类最高准确率约 73.53%。
- 发音运动学研究:对比 CP 与 ALS 说话人的舌体运动幅度、速度剖面与代偿策略,服务言语康复治疗方案设计。
- 多模态融合建模:声学 + EMA 早期/晚期融合,验证构音特征对低资源临床语音识别的增益。
从工程视角看,前三个场景已有公开参考实现与明确指标体系,属于"低风险高确定性"任务,适合作为团队进入医疗语音领域的切入点;后两个场景则涉及 EMA 数据处理链,工程成本更高,但构成的论文贡献与差异化也更显著。无论选择哪条路径,都建议以 §5.2 的说话人独立协议为默认评测框架,避免在起步阶段就引入泄漏。
§1.4b 版本口径差异说明
引用 TORGO 规模时存在三种常见口径,务必区分:官方完整发布(4 个 tar.bz2,约 18 GB 未压缩,LDC 登记约 14.5 GiB,含全部会话与 EMA 文件);LDC 叙述口径(“approximately 23 hours”,覆盖全部音频含空白与静音段);Hugging Face 派生口径(abnerh/TORGO-database,约 13.5 小时 / 16,552 句,仅统计有转写参考的有效语音段)。做基准对比时,先确认对方的数字来自哪种口径,否则"句数"与"时长"完全不可比。
§2 医学背景
§2.1 ICD-11 疾病分类锚定
| 标签 | ICD-11 编码 | 中文名称 | 说明 |
|---|---|---|---|
| Dysarthria | MA80.0 | 构音障碍 | 神经运动接口紊乱导致的发音运动障碍,本数据集核心表型 |
| Cerebral palsy | 8D20 | 脑瘫 | TORGO 构音障碍组主要病因(6/8 名说话人) |
| Amyotrophic lateral sclerosis | 8A60.0 | 肌萎缩侧索硬化 | TORGO 构音障碍组次要病因(2/8 名说话人) |
| Speech and voice disturbance | MA80 | 言语和语音障碍 | 上述编码的上级章节 |
编码锚定的意义在于把语音数据接回疾病术语体系:构音障碍在 ICD-11 中位于症状体征章节(MA80.0),而其两大病因分属神经系统疾病章节(8D20、8A60.0),三者构成"表型 + 病因"的星形结构。检索或建模时建议以 MA80.0 为入口、以病因码做分层,与 §2.4 的人群表和 §4.2 的标签分布保持同构,便于下游把模型输出映射回临床术语。
§2.1b SNOMED CT 映射
| 标签 | ICD-11 | SNOMED CT 码 | 术语 |
|---|---|---|---|
| Dysarthria | MA80.0 | 87310007 | Dysarthria (finding) |
| Cerebral palsy | 8D20 | 129070008 | Cerebral palsy (disorder) |
| Amyotrophic lateral sclerosis | 8A60.0 | 86044005 | Amyotrophic lateral sclerosis (disorder) |
§2.2 疾病简介与流行病学
构音障碍(dysarthria) 是一组由神经运动通路损伤引起的运动性言语障碍:运动指令在神经-肌肉接口处被扭曲,导致唇、舌、下颌等发音器官的运动幅度、速度与协调性异常,产出含糊、费力或不可懂的语音(Kent, 2000)。它不是语言加工障碍(区别于失语症),而是"执行层"的输出障碍。脑瘫(CP)与 ALS 是言语致残最常见的两大病因(Kent & Rosen, 2004):CP 起病于发育期,全球患病率约每千名活产 2–3 例(Oskoui 等, 2013, Dev Med Child Neurol 系统综述);ALS 为成年起病的进行性运动神经元病,全球患病率约 4.4/10 万(Arthur 等, 2016, Nat Commun 元分析),延髓型患者早期即出现构音障碍,绝大多数患者病程中将失去可懂言语能力。
对构音障碍者而言,语音识别失败直接剥夺其数字世界入口:肢体伴随障碍常使键盘、触屏同样不可用(Hosom 等, 2003)。因此,可懂语音输入是 AAC 设备的核心需求,而量化"构音运动如何偏离常态"正是康复医学评估(如 FDA)与 AI 模型的共同目标。TORGO 中 8 名构音障碍者均经 FDA 标准化评估,覆盖痉挛型、手足徐动型与共济失调型 CP 及 ALS,构成从轻度到极重度的严重度谱系。
从疾病纵向过程看,两大病因还构成了一组天然对照:CP 为静态性损伤(病灶不进展,构音模式相对稳定),ALS 为进行性退行(构音能力随病程持续下滑)。静态病因适合研究"稳定的异常构音模式",进行性病因适合研究"运动能力梯度"——TORGO 把两类放在一起,为"跨病程构音建模"提供了难得的跨度,但 ALS 样本只有 2 人,纵向建模的统计功效远远不足,这再次限定了该语料的结论层级。
§2.2b FDA 评估维度构成
TORGO 全部 8 名构音障碍者均按 Frenchay Dysarthria Assessment(Enderby, 1983)完成评估。FDA 从 8 大功能类别中各取数个感知维度,合计 28 个维度,每维按 8 分制打分(8 = 正常,1 = 极重度受损):
| FDA 类别 | 评估对象 | 与 EMA 线圈的对应关系 |
|---|---|---|
| Reflex(反射) | 咳嗽、吞咽、流涎 | 间接关联 |
| Respiration(呼吸) | 静息与发声时的呼吸支持 | 无直接线圈 |
| Lips(唇) | 唇运动范围与交替速度 | 上唇 / 下唇线圈 |
| Jaw(下颌) | 下颌运动范围与交替速度 | 下颌线圈(下切牙牙模) |
| Soft palate(软腭) | 腭咽闭合 | 无直接线圈 |
| Laryngeal(喉功能) | 音高与音量控制 | 无直接线圈 |
| Tongue(舌) | 舌运动范围与交替速度 | 舌尖 / 舌中 / 舌背线圈 |
| Intelligibility(可懂度) | 单词级与句子级可懂度 | 全通道综合 |
这一结构使 TORGO 成为"感知评分 ↔ 运动学参数"映射研究的理想平台:舌、唇、下颌三大类评分可分别与对应线圈的轨迹统计量(运动幅度、峰值速度、轨迹时长)直接对照,为超越主观听感的定量构音评估提供监督信号。
§2.2c 构音障碍类型学与 TORGO 覆盖
临床语言学将构音障碍按病灶与运动病理分为痉挛型(上运动神经元,常见于 CP)、弛缓型(下运动神经元)、共济失调型(小脑损伤,CP 中的 ataxic 型即属此类)、运动减少型(帕金森系)、运动过多型(锥体外系不自主运动,CP 中的 athetoid 型相关)与混合型。TORGO 的 CP 覆盖了痉挛型、手足徐动型与共济失调型三种运动病理,ALS 样本则代表进行性神经退行性病变谱——两者在发音运动上的差异(如 CP 的协同收缩模式 vs ALS 的进行性无力)为"病因鉴别"任务提供了雏形,但每类仅 2–3 人的规模决定了结论只能停留在假设生成阶段。
§2.3 临床任务定义
TORGO 可支撑的临床任务横跨"筛查—分级—评估—鉴别—交互"五层,各任务的标签来源与可行深度不同:
| 临床任务 | 定义 | TORGO 支持方式 |
|---|---|---|
| 筛查/检测 | 判定说话人是否存在构音障碍(患者 vs 对照二分类) | 15 人双组标签,Kaggle 派生集提供 CSV 标签 |
| 严重度分级 | 将构音障碍划为轻度/中度/重度(或低/中/高) | FDA 总分 32.8–61.6 可作伪标签;多篇论文采用三分类 |
| 可懂度评估 | 量化言语可被听者理解的比例 | Yorkston–Beukelman 限制句语料即临床评估原句 |
| 鉴别/运动学分析 | 区分 CP 与 ALS 的发音运动模式 | EMA 轨迹 + 诊断元数据 |
| 辅助沟通 | 将含糊语音转写为文本以驱动 AAC 设备 | 自发图片描述 + 转写 |
§2.4 患者人群特征
| 属性 | 构音障碍组 | 对照组 |
|---|---|---|
| 人数 | 8(F01、F03、F04、M01–M05;F02 编号未发布) | 7(FC01–FC03、MC01–MC04) |
| 性别 | 3 女 + 5 男 | 3 女 + 4 男 |
| 病因 | 脑瘫(痉挛型/手足徐动型/共济失调型)或 ALS | 无言语障碍 |
| 年龄 | CP 患者实验子集为 16–50 岁(JSLHR 论文口径) | 与患者按年龄、性别匹配 |
| FDA 总分(8 分制各维求和) | F01 37.1 / F03 61.3 / F04 61.3 / M01 37.8 / M02 37.8 / M03 61.6 / M04 32.8 / M05 39.8 | 不适用 |
| 评估者 | Holland Bloorview 与多伦多大学 SLP 按 FDA(Enderby, 1983)评估 | 不适用 |
| 人均产出 | 约 500 句 / 约 3 小时 | 约 1,000 句 / 约 3 小时 |
人群表的三个落点:FDA 总分呈明显的双峰分布(32.8–39.8 与 61.3–61.6 两个簇),中间段空虚,意味着"中度"样本天然稀缺,三分类任务实际是在"两个簇 + 少数过渡个体"上运行;年龄匹配设计(16–50 岁 CP 子集)排除了显著的老龄混杂,但 ALS 患者(通常 40 岁以上起病)的年龄结构与之不同,跨病因比较时应把年龄作为协变量;对照组与患者按年龄性别匹配,是"差异研究"(组间对比)而非"预测研究"(自然发病率)的设计——用 TORGO 做流行病学推断属于范畴错误。
§2.5 临床价值
TORGO 的临床价值链条是"运动学→可懂度→辅助决策":其一,EMA 轨迹让研究者能将 FDA 各维度评分(舌功能、唇功能、可懂度)与具体器官运动参数对应,发展超越主观听感的定量评估;其二,以 TORGO 训练的严重度分级器(三分类最高 73.53% 说话人独立准确率)可辅助 SLP 快速分诊与疗效随访;其三,构音适配 ASR 使重度患者(如 M04)的语音从"几乎不可懂"(基线 WER 145.56%)改善至可用水平(65.29%),直接扩大 AAC 设备适用人群。这些用途均以研究为限,临床部署需独立验证。
对言语康复研究还有一层价值:FDA 感知评分与 EMA 运动学参数在时间上同步采集,使"评分变化是否可由运动参数解释"这一类机制问题变得可回答——例如舌功能评分低的说话人,其舌尖线圈轨迹幅度与峰值速度是否系统性降低。这类分析是把"数据集"升级为"评估科学证据"的关键,也是 TORGO 区别于纯声学语料的不可替代之处。
§2.6 金标准/参考标准
| 维度 | 内容 |
|---|---|
| 划分依据 | 说话人级:8 构音障碍 vs 7 对照(按性别匹配分层:F/FC 与 M/MC 各成一对分包) |
| 标注方式 | 人工正字转写(prompts 目录);FDA 28 感知维度 8 分制评估 |
| 标注者 | 言语语言病理学家(Holland Bloorview 儿童康复医院与多伦多大学) |
| 标准性质 | FDA 为国际通行的构音障碍临床评估量表(Enderby, 1983);限制句取自 Yorkston–Beukelman 可懂度评估,兼具临床效度 |
作为对照标准的补充说明:语料中的限制句(162 句 Yorkston–Beukelman + 460 句 TIMIT 衍生)本身就是临床可懂度评估的标准刺激材料,因此在"临床评估复现"类研究中,TORGO 的参考标准是双重的——说话人层面的 FDA 感知评分与刺激材料层面的临床评估原句,两者共同构成从材料到个体的完整效度链条。
§3 数据集规格
§3.0 版本抉择矩阵
TORGO 没有严格意义上的"多版本",但存在"官方完整发布 + LDC 镜像 + 社区派生"三种获取路径,内容口径差异显著,选错路径是新手最常见的第一个坑:
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 多模态研究(需要 pos/rawpos/ERRORS.xls 全量文件) | 官网 4 个 tar.bz2 | 约 18 GB(解压后) | 官方完整发布,含 AG500 专有文件与辅助记录 |
| 仅做 ASR 基准对比 | Hugging Face 派生集(abnerh/TORGO-database 口径) | 约 13.5 小时 / 16,552 句 | 已整理为音频+转写,上手最快,但注意口径与官方不完全一致 |
| 合规存档与正式引用 | LDC2012S02 | 约 14.5 GB | 有 DOI 与 ISBN,机构级分发与许可文本清晰 |
| 教学演示/快速分类实验 | Kaggle Dysarthria Detection 派生集 | 2,000 样本 CSV | 已平衡为 4×500 样本,含 is_dysarthria/gender 标签列 |
§3.1 模态详细说明
声学模态:每句提供多套 WAV——头戴式与定向式麦克风通道(wav_* 目录,16 bit 单声道 PCM 16 kHz),以及 wavall 立体声文件(一声道为混合声学,另一声道为 AG500 扫描信号模拟峰值,用于硬件级同步)。官方说明所有声学已降采样至 16 kHz。
EMA 构音运动模态:AG500 通过 6 枚发射线圈(7.5–13.75 kHz 交替电磁场,亚克力立方体 58.4×53.3×49.5 cm)对接收线圈逐帧定位。接收线圈贴附于舌尖(解剖舌尖后 1 cm)、舌中(舌尖线圈后 3 cm)、舌背(舌中线圈后约 2 cm)、下颌(下切牙定制牙模)、上唇、下唇与左右嘴角;前额、鼻梁与双耳乳突上方另置参考线圈用于头动补偿。pos 目录为头部归一化版本,rawpos 为原始版本,各线圈位置、速度与姿态逐帧存储于专有二进制文件(采样 200 Hz,与设备规格一致)。
EMA 数据质量有两个工程上必须知道的特性:其一,定位精度在立方体中心最高、边缘显著变差(Yunusova 等, 2009 的系统评估),因此靠近立方体边缘的发音动作(如张大口的元音)轨迹可信度略低;其二,左右嘴角线圈不在正中矢状面内,而其余构音线圈基本位于矢状面,做二维简化(X/Y)分析时应默认丢弃嘴角的两维或单独建模,AAI 论文的 12 维惯例(UL/LL/JAW/TT/TB/TD × X/Y)正是基于这一考虑。
文本与元数据模态:prompts 目录存正字转写;session_contents.tsv 列出各会话子目录与元数据;ERRORS.xls 记录逐试次录制错误(多为技术问题);CoilLocations.pdf 给出线圈贴附顺序图;EMA/VIDEO 标记文件区分会话采集系统(约 1/3 会话为双目视频重建,视频本体未发布)。
§3.2 按子集样本数
官方按"性别 × 组别"把数据切分为四个 tar.bz2 分包,每个分包内部再按说话人/会话两级组织。这一设计让"只要对照"或"只要某一性别"的研究可以按需下载,但也意味着完整的 15 人实验必须下载全部四包:
| 子集(tar.bz2 分包) | 说话人 | 人数 | 说明 |
|---|---|---|---|
| F.tar.bz2 | F01、F03、F04 | 3 | 女性构音障碍 |
| FC.tar.bz2 | FC01–FC03 | 3 | 女性对照 |
| M.tar.bz2 | M01–M05 | 5 | 男性构音障碍(F02 缺位,M04/M05 为 ALS 相关重度样本) |
| MC.tar.bz2 | MC01–MC04 | 4 | 男性对照 |
| 合计 | 15 | 15 | 约 23 小时(LDC 口径);HF 派生口径 16,552 句 / 约 13.5 小时 |
说话人级产出明细(不同研究口径,注意区分):
| 说话人 | 组别 | TIMIT 句任务产出(AAI 论文口径) | HF 口径句数(LoRA 模型卡) |
|---|---|---|---|
| MC01 | 对照 | 8,186 句 / 1,032.33 s | — |
| MC04 | 对照 | 6,884 句 / 774.97 s | — |
| MC03 | 对照 | — | 1,667 句 |
| FC02 | 对照 | — | 2,187 句 |
| F03 | 构音障碍 | 3,534 句 / 385.57 s | 1,084 句 |
| F04 | 构音障碍 | 2,599 句 / 298.96 s | — |
| M04 | 构音障碍(重度) | — | 666 句 |
| 其余说话人 | — | 未单独披露 | 未单独披露 |
产出量差距直观呈现了"采集难度梯度":贴附线圈与重度构音障碍都显著压缩了单次可录制语料,这正是对照 1,000 句 vs 患者 500 句人均差距的来源(JSLHR 论文口径),也是分级任务中重度类样本稀缺的根源。
§3.3 数据格式详情
| 内容 | 格式 | 说明 |
|---|---|---|
| 声学 | RIFF WAVE,PCM 16 bit 单声道 16 kHz | wav_* 目录;wavall 为立体声(含同步峰) |
| EMA 位置 | AG500 专有二进制(pos / rawpos) | 需 TAPADM toolbox 的 loaddata.m(MATLAB,GPL)或社区解析器 |
| 转写 | TXT | prompts 目录,正字转写 |
| 会话清单 | TSV | session_contents.tsv |
| 错误记录 | XLS | ERRORS.xls,逐试次技术问题 |
| 打包 | tar.bz2 × 4 | 按性别 × 组别分包 |
§3.4 存储大小
官网 4 个分包解压后合计约 18 GB;LDC 镜像登记 Corpus size 为 15,209,372 KB(约 14.5 GiB)。建议预留 40 GB 磁盘(含解压中间态与派生特征)。空间大头是声学 WAV(约 23 小时 16 kHz PCM 约占 2.6 GB)与 EMA pos/rawpos 双版本逐帧二进制(线圈多、帧率高,随会话数线性增长);tar.bz2 压缩包本身的下载体积小于解压后体积,批量下载前确认磁盘与带宽余量。若仅需声学+转写做 ASR,可只解压 4 包中的 wav/prompts 子目录以节约空间。
§3.5 标注方式
转写为人工正字转写(非音素级对齐);诊断与严重度来自 FDA 标准化人工评估;发音错误类型(如塞音浊化替代、词尾塞音/塞擦音脱落)由研究团队在论文中离线标注分析,未随数据发布逐句标注文件。不存在弱监督或自动标注通道。
由此带来的下游影响:ASR 训练可直接使用转写,但音素级任务(对齐、发音错误检测)需自行强制对齐(如用 MFA/CTC 工具);严重度分级需依赖论文级 FDA 分数做说话人级伪标签,句级严重度不可得;发音错误标注只能引用论文的聚合统计,无法做句级监督。规划任务时应在数据流设计阶段就明确"标注粒度上限 = 句级正字文本 + 说话人级 FDA 分数"。
§3.6 标注者资质
FDA 评估由隶属于 Holland Bloorview 儿童康复医院与多伦多大学的言语语言病理学家(SLP)执行;转写由项目团队完成。官方未公布转写者间一致性(IRR)数字,引用时不应臆断。SLP 主导的临床评估(FDA)与研究者主导的转写在可信度性质上不同:前者有标准化量表背书,后者依赖人工听写质量——两类标注在管线中应分别对待,前者可直接作为弱标签,后者建议保留原始大写正字文本以便复核。
§3.7 数据采集时间范围
2008–2010 年,全程在多伦多录制;官方强调发布内容代表该项目的绝大部分数据,pilot 数据与清洗版声学未收录。三年采集窗口横跨每位受试者的多个会话(每人数个 session),因此"说话人内时间跨度"是存在的——这对研究构音稳定性是资源,对划分策略则是又一处需要按会话分组的理由。
§3.8 地域覆盖
加拿大安大略省多伦多市单一实验室(多伦多大学);所有受试者为加拿大英语环境下的年龄-性别匹配人群。单一地域意味着语料内部不存在地理异质性——这对机制研究是优点(控制了方言与口音变量),对部署研究是缺点(模型无法从数据中学到口音鲁棒性),两方面的权衡都应写进研究设计的局限声明。
§3.9 采集设备规格
| 设备 | 规格 | 用途 |
|---|---|---|
| Carstens AG500 | 3D 电磁发音记录仪;6 发射线圈 7.5–13.75 kHz;每会话前 ≥3 小时预热后全自动校准;立方体中心定位误差最小(Yunusova 等, 2009) | 构音轨迹 |
| 头戴式麦克风 + 定向式麦克风 | 双通道;部分会话受电磁场高斯干扰 | 声学 |
| 双数码相机 | 双目 3D 表面重建 | 约 1/3 会话替代 EMA(视频未发布) |
| 19 英寸 LCD | 提示屏 | 语料呈现 |
设备组合的解读:AG500 与双麦克风是"机制研究"配置(线圈级构音轨迹 + 干净近讲声学),而双目视频系统是为减轻受试者负担引入的轻量替代(贴线圈费时且不适)。这意味着 TORGO 的声学数据质量整体高于其年代平均值,但也埋下了 §6.5 坑点 5 与坑点 8 的结构性问题——同一数据集内存在两套采集系统与两套噪声特性,任何跨会话建模都必须把设备变量显式纳入设计。
§3.10 深度溯源链
原始录制(多伦多大学,2008–2010)→ 官方网站发布 4 个 tar.bz2(学术免费,须引用指定论文)→ LDC 同步发行 LDC2012S02(DOI 10.35111/cp5y-9z47,2012-01-19)→ 原始论文 LRE 46(4):523–541(DOI 10.1007/s10579-011-9145-0)→ 社区派生(Hugging Face abnerh/TORGO-database 约 13.5 小时口径、Kaggle 2,000 样本平衡集)。资助方:Bell University Labs、NSERC、多伦多大学;设备由 Canada Foundation for Innovation、Ontario Innovation Trust 与 Ontario Ministry of Research and Innovation 资助。
溯源链上的关键控制点:录制环节的会话级校准文件与 ERRORS.xls 提供过程质量记录;发布环节官网与 LDC 文档互为校验(四包清单、目录结构、许可文本一致);社区派生环节口径变化最大,任何严肃工作都应回到官网或 LDC 原始包建立自己的数据血缘,而不是直接基于派生集做最终结论。
§4 数据结构详解
§4.0 目录结构预览
以下树形结构综合官方页面与 LDC 文档绘制,展示数据解压后的组织方式;实际目录中每个会话还包含校准 txt、.log 与 .calset 等辅助文件,此处只列对 AI 工程最有意义的层级:
torgo/ # 数据根目录(4 个 tar.bz2 解压合并后)
├── F01/ # 说话人目录:F=女,M=男;C 后缀=对照(如 FC01/MC01)
│ ├── session_1/ # 会话目录(每人数个,编号递增)
│ │ ├── EMA # 标记文件:本会话由 AG500 采集(VIDEO 则为双目视频会话)
│ │ ├── audio/ # 声学通道
│ │ │ ├── headmounted_0001.wav # 头戴式麦克风,16 kHz PCM 单声道
│ │ │ ├── directional_0001.wav # 定向式麦克风
│ │ │ └── wavall_0001.wav # 立体声:声学 + AG500 扫描同步峰
│ │ ├── pos/ # 头部归一化 EMA 位置/速度/姿态(专有二进制)
│ │ ├── rawpos/ # 未做头部归一化的原始 EMA
│ │ ├── prompts/ # 正字转写 TXT
│ │ └── april232008cal2.txt # 该会话校准响应记录(文件名为日期)
│ └── session_2/
├── F03/
├── F04/
├── M01/ ... M05/ # F02 编号未发布,目录断档
├── FC01/ ... FC03/
├── MC01/ ... MC04/
├── session_contents.tsv # 全部会话的子目录与元数据清单
├── ERRORS.xls # 逐试次录制错误(技术问题为主)
└── CoilLocations.pdf # 线圈贴附顺序示意图
§4.1 DAIMS 标准化字段描述表
下表把 TORGO 的文件系统组织抽象为"逻辑字段",使无文件系统经验的读者也能像查数据库字典一样理解数据;观测误差列综合官方文档与 Yunusova 等 2009 的设备精度评估:
| 字段 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| speaker_code | string | 说话人编码:性别首字母+C(对照)+两位招募序号 | M04 | 分组/分层抽样 | 无 | 无缺位者直接无目录 | F01–MC04 共 15 个 |
| session_id | string | 会话目录(每人多个) | session_1 | 会话级去泄漏 | 无 | 无 | 每人 1–N 个 |
| wave_file | file | 16 bit 单声道 PCM WAV,16 kHz | headmounted_0001.wav | ASR 输入 | EMA 场致高斯噪声(部分会话) | 受扰严重的会话未收录 | 16 kHz 全域 |
| wavall_file | file | 立体声:声道 1 声学,声道 2 AG500 扫描峰 | wavall_0001.wav | 声学-EMA 硬件同步 | — | 无 | 2 声道 |
| pos_file | binary | 头部归一化 EMA 线圈位置/速度/姿态 | pos 文件 | AAI 目标 | 立方体边缘定位误差增大(Yunusova 2009) | VIDEO 会话无此文件 | 6+ 构音线圈 × 3D |
| rawpos_file | binary | 未归一化 EMA 原始帧 | rawpos 文件 | 头动分析 | 同上 | 同上 | 同上 |
| transcript | text | 正字转写 | 受试提示句 | ASR 参考 | 无音素对齐 | 非文本任务转写为自发语句 | — |
| task_type | string | 非词/短词/限制句/无限制句(由 prompts 推断) | restricted | 任务分层评估 | 需人工推断 | 无 | 4 类 |
| fda_total | float | FDA 各维 8 分制求和(仅构音障碍组,论文口径) | 32.8–61.6 | 严重度伪标签 | 感知评估固有误差 | 对照组不适用 | 8–64 |
| acquisition_system | file | EMA 或 VIDEO 标记文件 | EMA | 多模态过滤 | 无 | 无 | 2 值 |
| calibration_file | text | 会话级校准响应(日期命名) | april232008cal2.txt | EMA 质量核验 | 无 | 无 | 每会话 1+ 个 |
| errors_log | file | 逐试次录制错误记录 | ERRORS.xls | 敏感性分析 | 人工记录粒度粗 | 无 | 会话级附录 |
字段字典的读取顺序建议:先以 speaker_code + session_id 建立索引骨架,再挂接 wave/transcript/pos 三类内容文件,最后用 acquisition_system 与 errors_log 做质量过滤。这一顺序能把 §4.5 的四类缺失全部转化为显式的过滤规则,而不是散落在各处脚本里的特判。
§4.2 标签分布统计
| 维度 | 分布 |
|---|---|
| 组别 | 构音障碍 8 / 对照 7(53.3% / 46.7%) |
| 性别 | 女 6 / 男 9 |
| 病因 | CP 6 / ALS 2(构音障碍组内) |
| 严重度(FDA 求和) | 重度带(32.8–39.8)4 人:F01、M04、M05、M01/M02 边缘;轻度带(61.3–61.6)3 人:F03、F04、M03 |
| 产出量 | 对照约 1,000 句/人 vs 构音障碍约 500 句/人(HF 口径下个别说话人 666–2,187 句不等) |
标签分布的两个关键提示:其一,组别与性别基本平衡(53.3%/46.7% 与 6 女/9 男),但病因与严重度高度不均——CP 6 人对 ALS 2 人、重度带 4 人对轻度带 3 人,任何"按病因"或"按严重度"的子分析都要直面小样本方差;其二,产出量与标签相关(对照说得更多),意味着简单合并训练时模型会隐式偏向对照分布,二分类任务的先验校正与加权采样不是可选项而是必需品。
§4.3 关键字段描述性统计
| 统计项 | 数值 | 来源口径 |
|---|---|---|
| 声学规格 | 16 kHz / 16 bit / 单声道 PCM | 官方 |
| 总时长 | 约 23 小时(LDC)/ 约 13.5 小时(HF 有效语音口径) | LDC / HF |
| 总句数 | 16,552 句(HF 口径) | HF |
| EMA 特征维度 | 6 构音线圈 × 3D;AAI 惯例 12 维(X/Y)或 24 维(+速度/加速度) | AAI 论文 |
| EMA 采样率 | 200 Hz(AG500 设备规格) | Carstens 规格 |
| TIMIT 子任务句级时长 | MC01 1,032.33 s(8,186 句)、MC04 774.97 s(6,884 句)、F03 385.57 s(3,534 句)、F04 298.96 s(2,599 句) | AAI 论文 |
| 人均录制时长 | 约 3 小时 | JSLHR 论文 |
§4.4 数据层级关系
数据集(15 人)
└── 说话人(15)
└── 会话(session_N,每人数个)
└── 任务块(非词 / 短词 / 限制句 / 图片描述)
└── 句(wav 文件 ↔ prompts 转写 ↔ pos 帧)
└── EMA 采样帧(200 Hz,逐线圈 3D 坐标)
五级层级对应五种分析粒度:数据集级做总览统计,说话人级做个性化建模与分层评估,会话级做质量过滤与防泄漏分组,任务块级做场景拆分(朗读 vs 自发),句级与帧级才是模型训练的输入输出粒度。实践中最常见的粒度错配是"用句级指标做说话人级结论"——15 人语料下,句级平均数会被高产说话人主导,务必先聚合到目标层级再计算结论。
§4.5 缺失值情况与信息性缺失编码
TORGO 没有"行级 NULL",缺失以文件系统层缺位表达,且大多是信息性的:
| 缺失情形 | 位置 | 信息含义 | 处理建议 |
|---|---|---|---|
| F02 目录不存在 | 构音障碍组 | 官方未发布该受试者 | 清点说话人时勿硬编码 8 个连续编号 |
| VIDEO 会话无 pos/rawpos | 约 1/3 会话 | 该会话由双目视频系统采集 | 多模态实验前按 EMA 标记文件过滤 |
| 受扰声学整段缺席 | 部分会话 | EMA 电磁场干扰过重被官方剔除 | 视为有意缺失,勿自行"补齐" |
| 对照组无 FDA 分数 | 元数据 | FDA 仅对患者施测 | 分级任务中对照组单独处理 |
处理原则一句话概括:先判定缺失是否"信息性"——由采集系统或剔除规则造成的缺失(上表前四行全部属于此类)本身就携带质量信号,正确做法是把它转化为过滤与分层变量;任何插补、复制或"用相邻会话顶替"的操作都会污染这层信号。
§5 数据划分与使用建议
§5.1 官方数据划分
官方未提供任何 train/dev/test 划分,仅按说话人与会话组织数据。发布说明与 LDC 文档均未含划分文件;这是使用者必须自行设计的第一道工序。
这不是疏忽而是一种结构性现实:15 名说话人的语料不存在统计意义上稳定的随机划分,任何划分协议都是研究设计的一部分。官方把组织粒度停在"说话人/会话",恰好为说话人级与会话级两种防泄漏划分留出了干净的操作空间——前提是使用者主动选择正确的划分键(见 §5.3)。
§5.2 推荐划分策略
社区已形成三种主流惯例,分别对应"固定基准对比""增量适配研究"与"小样本统计稳健"三种需求:
社区已形成三种主流惯例:其一,说话人独立划分(speaker-independent)——如 Whisper LoRA 评估选 F03/FC02/M04/MC03 四人做测试,其余训练,避免任何说话人跨集;其二,EMNLP 2025 适配研究将 482 个唯一提示按 80/20 随机分为 385 训练/97 测试,再在训练内 80/20 切出验证集,同时保证跨说话人的提示互斥;其三,留一说话人交叉验证(LOOCV)用于小样本设定。对严重度分级任务,应按 FDA 分层抽样,保证每折覆盖重/中/轻三档。
§5.3 数据泄漏风险防御
- 说话人跨集泄漏(最高风险):同一说话人的相邻句子声学高度相似,随机按句划分可虚高数十分百分点。防御:划分键必须是 speaker_code。
- 会话泄漏:同会话内的音区/信噪特性一致。进阶做法:按"说话人 + 会话"双键分组划分(GroupShuffleSplit)。
- 提示文本泄漏:同一提示句若在训练与测试中同时出现,语言模型可"背诵"答案。防御:以唯一提示文本为划分单元(EMNLP 2025 做法)。
- 严重度伪标签泄漏:FDA 分数源自全量会话评估,若用于训练分级器,注意勿把同会话语句同时用于调参与测试。
四类风险的重要性排序与语料规模成反比——语料越小,"个体重复出现"带来的信息增益越大,泄漏的危害也越大;15 人的 TORGO 处于泄漏敏感度最高的区间,上述四项全部按硬约束执行。
§5.4 交叉验证建议
15 人小样本下推荐分层 LOOCV 或 5 折说话人分组交叉验证:每折 12 人训练/3 人验证,按组别(患者/对照)与性别分层;EMNLP 2025 的 LOOCV 与混合"群体-个体"范式提供了可复用的模板。报告结果时应同时给出说话人独立与说话人依赖两种口径。
分组划分的参考实现(与 §6.4 的 Dataset 清单联动):
# 按"说话人+会话"双键分组划分,杜绝会话泄漏;严重度分层由人工分桶保证
import numpy as np
from sklearn.model_selection import GroupShuffleSplit
sessions = [(spk, sess) for spk in speakers_all for sess in ["session_1", "session_2"]]
groups = np.array([spk for spk, _ in sessions]) # 划分键 = 说话人
sev = np.array([1 if spk in {"F01","M01","M04","M05"} else 0
for spk, _ in sessions]) # FDA 重度桶标记
gss = GroupShuffleSplit(n_splits=1, test_size=0.25, random_state=42)
train_idx, test_idx = next(gss.split(sessions, groups=groups, y=sev))
train_sessions = [sessions[i] for i in train_idx] # 训练/验证集会话清单
test_sessions = [sessions[i] for i in test_idx] # 测试集会话清单
§5.5 外部验证
跨语料验证首选 UASpeech(同为英语构音障碍、孤立词为主),可检验模型对"任务类型迁移"的鲁棒性;面向真实部署应评估 Speech Accessibility Project 等新采集人群(方言、设备、年龄结构差异更大)。已有工作显示跨语料 AAI/ASR 性能显著下降,迁移学习与说话人自适应嵌入(如 x-vector 条件化)是常用缓解手段。
设计外部验证时的对照梯度建议从"近"到"远"逐级推开:第一级 UASpeech(同语言同疾病、不同任务与设备),第二级 AphasiaBank 等其他临床人群(Whisper-Clinical 项目已示范),第三级 Speech Accessibility Project(现代设备、大规模人群)。每级报告性能衰减幅度并归因到具体差异维度(任务/人群/设备),比单一跨语料数字更有诊断价值。
§6 AI 就绪指南
§6.0 云端快速启动
TORGO 无需注册,任何能联网的 Colab/云主机都可直接从官网拉取数据:
# Colab 一行获取(约 18 GB 解压后,建议挂载 Google Drive)
!wget -q --show-progress https://www.cs.toronto.edu/~complingweb/data/TORGO/MC.tar.bz2 -P /content/torgo/
!tar -xjf /content/torgo/MC.tar.bz2 -C /content/torgo/
注意:官方未提供 rsync/对象存储镜像,四包需逐一下载;Hugging Face 上的派生集(abnerh/TORGO-database)体积更小(约 13.5 小时口径),适合快速验证但与官方完整包不完全等价。
云端环境选择建议:仅做声学任务(ASR/检测/分级)时 Colab T4 免费额度即可完成 Whisper Small + LoRA 级别的实验(社区参考实现实测显存峰值约 5.6 GB);涉及 EMA 解析与多模态训练时,建议使用带持久磁盘的按需实例,把 pos 解析产物缓存到持久卷,避免重复解析。无论哪种环境,都应把 §6.2 的完整性校验脚本放在管线第一步。
§6.1 快速上手
下面的最小示例假设你已将 4 个包解压到 data_root,目录形如 data_root/{speaker}/{session}/...。最小可用子集是"任意一名对照说话人的一个 EMA 会话"——它同时包含音频、转写与 pos 文件,足以跑通端到端管线。
运行后预期输出:采样率 16000、声道 1、位深 2(2 字节 = 16 bit),以及一条大写正字转写。若 read_transcript 抛出 FileNotFoundError,优先排查文件名对应关系——部分会话使用 directional 而非 headmounted 前缀,替换映射时保持"/audio/…/ 与 /prompts/"的双目录结构即可。跑通最小子集后,再按 §6.2 的 manifest 脚本扩展到全量 15 人。
# 目录结构预期:data_root/F01/session_1/audio/*.wav 与 data_root/F01/session_1/prompts/*.txt
# data_root 即 tar 包解压根目录;prompts 与 audio 文件名一一对应
import os, wave, glob
data_root = "/content/torgo" # ← 替换为你的解压根目录
speaker = "FC01" # 最小可用子集:一名对照说话人
wav_paths = sorted(glob.glob(f"{data_root}/{speaker}/*/audio/headmounted_*.wav"))
def read_transcript(wav_path: str) -> str:
# prompts 文件与 wav 文件名对应(同名不同目录)
prompt_path = wav_path.replace("/audio/headmounted_", "/prompts/")
with open(prompt_path, encoding="utf-8") as f:
return f.read().strip()
with wave.open(wav_paths[0], "rb") as w:
print("采样率:", w.getframerate(), "声道:", w.getnchannels(), "位深:", w.getsampwidth())
print("转写示例:", read_transcript(wav_paths[0]))
§6.2 数据获取
四个分包对应 §3.2 的四个子集,官方下载无需注册:
| 分包 | 内容 | 说话人 | 官方大小口径 |
|---|---|---|---|
| F.tar.bz2 | 女性构音障碍 | F01、F03、F04 | 合计约 18 GB(未压缩,四包合计) |
| FC.tar.bz2 | 女性对照 | FC01–FC03 | 同上 |
| M.tar.bz2 | 男性构音障碍 | M01–M05 | 同上 |
| MC.tar.bz2 | 男性对照 | MC01–MC04 | 同上 |
# 完整下载四包并解压(官方免费,学术非营利用途,须引用指定论文)
BASE=https://www.cs.toronto.edu/~complingweb/data/TORGO
mkdir -p torgo && cd torgo
for pkg in F FC M MC; do
wget -c "${BASE}/${pkg}.tar.bz2" && tar -xjf "${pkg}.tar.bz2"
done
ls -d */ # 应见 F01 F03 F04 M01 M02 M03 M04 M05 FC01 FC02 FC03 MC01 MC02 MC03 MC04
许可要点:学术(非营利)用途永久免费;任何公开成果须引用 Rudzicz 等 2012(LRE)等官方指定论文;数据按"as-is"提供,多伦多大学对使用后果不担责(详见 §9)。
下载后完整性校验(对齐坑点 2,在进入任何训练前先跑一遍):
# 说话人清单断言:以实际目录为准,禁止范围假设(F02 断档)
import os
EXPECTED = {"F01", "F03", "F04", "M01", "M02", "M03", "M04", "M05",
"FC01", "FC02", "FC03", "MC01", "MC02", "MC03", "MC04"}
actual = {d for d in os.listdir(data_root)
if os.path.isdir(os.path.join(data_root, d)) and not d.startswith(".")}
assert actual == EXPECTED, f"说话人清单异常: 缺 {EXPECTED - actual}, 多 {actual - EXPECTED}"
# 会话级 manifest:标记 EMA/VIDEO 会话,多模态管线据此过滤(坑点 5)
manifest = []
for spk in sorted(EXPECTED):
for sess in sorted(os.listdir(os.path.join(data_root, spk))):
sess_dir = os.path.join(data_root, spk, sess)
if not os.path.isdir(sess_dir):
continue
system = "EMA" if os.path.exists(os.path.join(sess_dir, "EMA")) else "VIDEO"
manifest.append({"speaker": spk, "session": sess, "system": system})
print(f"共 {len(manifest)} 个会话;EMA 会话 "
f"{sum(1 for m in manifest if m['system'] == 'EMA')} 个")
§6.3 预处理全流程
六步流程按依赖顺序排列:声学统一化与 manifest 构建(第一步 + §6.2 校验)是纯声学任务的全部前置;EMA 解析(第二步)与时间对齐(第三步)只服务于多模态任务;文本规范化与伪标签注入(第四、五步)影响训练目标;特征提取(第六步)输出模型输入。单模态团队可跳过二、三步直达训练。
第一步:声学读取与统一化。16 kHz 单声道 PCM 可直接进特征提取器;定向式与头戴式双通道可在训练前做通道选择或简单融合。
import librosa
def load_mono(path: str, sr: int = 16000):
wav, _ = librosa.load(path, sr=sr, mono=True) # 官方已降采样,此处仅保证一致性
return wav
第二步:EMA pos 二进制解析。这是 TORGO 唯一的"硬门槛":AG500 输出专有二进制格式,官方推荐 MATLAB TAPADM toolbox 的 loaddata.m(GPL)读取;Python 用户可使用社区解析器或按下述框架自行实现(帧布局务必与 TAPADM 文档核对)。
# 思路示例:AG500 pos 文件为 header + 定长帧流,帧内按线圈×维度交错存 float
# 通道数/字节序/每帧样本数请以 TAPADM loaddata.m 为准,此处为教学框架
import numpy as np
def read_pos(path: str, n_coils: int = 12, n_dims: int = 3, header_bytes: int = 40):
raw = np.fromfile(path, dtype=np.float32, offset=header_bytes) # ← header 大小需按官方文档校准
frames = raw.reshape(-1, n_coils * n_dims) # 每帧 = 线圈 × 三维坐标
return frames # 典型采样率 200 Hz(AG500 规格)
# 校验建议:读出的轨迹应平滑连续;若出现周期性跳变,先检查 header/通道布局是否匹配
第三步:声学-EMA 时间对齐。两种策略:简单法直接按 wavall 第二声道的扫描峰定位 EMA 帧起点后线性映射 200 Hz→16 kHz 时间轴;进阶法用扫描峰序列做逐帧重采样对齐(见坑点 4)。
第四步:文本规范化与任务过滤。转写已为大写正字文本,ASR 训练前统一小写、去标点(参考 LoRA 评估流程:lowercase + 去 Unicode 标点 + NFKD);图片描述与非词任务若无参考转写需求,先按坑点 7 过滤。
第五步:严重度伪标签注入。将 §2.4 的 FDA 求和分数作为说话人级元数据,映射为三档(如 <40 重度、40–55 中度、>55 轻度)供分层抽样与分级任务使用。
第六步:特征提取。两条主流路线:传统 FBank/MFCC(Kaldi/ESPnet 流水线,与 TU Delft 融合实验兼容)与预训练 SSL 特征(WavLM/HuBERT/wav2vec2,严重度分级 SOTA 与 AAI 研究均采用)。
import torch, torchaudio
wav, sr = torchaudio.load("/content/torgo/FC01/session_1/audio/headmounted_0001.wav")
# 路线 A:80 维 FBank(ESPnet 惯例,与 Conformer/融合 ASR 兼容)
fbank = torchaudio.compliance.kaldi.fbank(wav, num_mel_bins=80, sample_frequency=sr)
# 路线 B:SSL 特征(WavLM-large 逐层输出,供层级探测/分级任务使用)
bundle = torchaudio.pipelines.WAVLM_LARGE
model = bundle.get_model().eval()
with torch.no_grad():
features, _ = model(wav) # 输出形状 (T, D),供 PCA 降维或直接分类
§6.4 PyTorch DataLoader
以下 Dataset 同时承担"数据加载"与"泄漏防御"两个职责:说话人清单由构造参数显式传入,训练集与测试集的说话人集合永不相交,划分逻辑从数据结构层面被固定下来。
# TORGO ASR Dataset:说话人独立划分由 speaker_split 保证
# 预期目录:data_root/{speaker}/{session}/audio/headmounted_*.wav + prompts/*.txt
import glob, os, random
import torch
import librosa
from torch.utils.data import Dataset, DataLoader
class TorgoASRDataset(Dataset):
def __init__(self, data_root: str, train_speakers: list, sr: int = 16000,
max_seconds: float = 20.0):
self.sr, self.max_len = sr, int(sr * max_seconds)
self.items = []
for spk in train_speakers: # 划分键 = 说话人(防泄漏核心)
for wav in glob.glob(f"{data_root}/{spk}/*/audio/headmounted_*.wav"):
txt = wav.replace("/audio/headmounted_", "/prompts/")
if os.path.exists(txt):
self.items.append((wav, txt))
def __len__(self):
return len(self.items)
def __getitem__(self, idx: int):
wav_path, txt_path = self.items[idx]
wav, _ = librosa.load(wav_path, sr=self.sr, mono=True)
if len(wav) > self.max_len: # 长音频截断(自发描述可能很长)
wav = wav[: self.max_len]
with open(txt_path, encoding="utf-8") as f:
text = f.read().strip().lower() # 统一小写与去标点在 collate 前完成
return torch.from_numpy(wav), text
def collate(batch):
wavs, texts = zip(*batch)
lengths = torch.tensor([len(w) for w in wavs])
padded = torch.nn.utils.rnn.pad_sequence(wavs, batch_first=True)
return padded, lengths, list(texts)
speakers_all = ["F01", "F03", "F04", "M01", "M02", "M03", "M04", "M05",
"FC01", "FC02", "FC03", "MC01", "MC02", "MC03", "MC04"]
random.seed(42) # 固定随机种子保证划分可复现
test_spk = ["F03", "FC02", "M04", "MC03"] # 社区常用说话人独立测试组
train_spk = [s for s in speakers_all if s not in test_spk]
train_ds = TorgoASRDataset("/content/torgo", train_spk)
loader = DataLoader(train_ds, batch_size=8, shuffle=True,
collate_fn=collate, num_workers=4)
声学→构音倒置(AAI)Dataset:以 12 维构音轨迹(6 线圈 × X/Y 方向)为回归目标,速度与加速度由一阶差分得到(合计 24 维,与 AAI 论文口径一致):
# AAI Dataset:依赖已由 TAPADM 或社区解析器导出的 EMA 帧(每帧 12 维 X/Y)
# 预期文件:{session}/pos_export/{utt_id}.npy,帧率 200 Hz;音频 16 kHz
import numpy as np
class TorgoAAIDataset(Dataset):
def __init__(self, pairs: list, fps: int = 200, sr: int = 16000):
self.pairs = pairs # [(wav_path, ema_npy_path), ...]
self.fps, self.sr = fps, sr
def __getitem__(self, idx: int):
wav_path, ema_path = self.pairs[idx]
wav, _ = librosa.load(wav_path, sr=self.sr, mono=True)
ema = np.load(ema_path) # (T_frames, 12)
vel = np.gradient(ema, axis=0) # 速度(一阶差分)
acc = np.gradient(vel, axis=0) # 加速度
target = np.concatenate([ema, vel, acc], axis=1) # (T_frames, 24)
return torch.from_numpy(wav), torch.from_numpy(target).float()
§6.5 坑点 8 个
以下 8 个坑点全部源自 TORGO 的真实结构(官方文档、论文 limitation、社区模型卡与开源项目),按"出现频率 × 破坏力"排序;每个坑点给出简单方法、进阶方法与 SOTA 方法三级解决路径:
⚠️ 坑点 1:随机按句划分制造说话人泄漏(分类:数据泄漏)
问题:15 人的小语料若按句随机划分训练/测试,同一说话人将同时出现在两侧;构音障碍语音的个体 signatures(基频、发音习惯)极强,模型只需"认人"即可得高分,评估结果虚高且不可复现于新用户。
症状:说话人依赖划分的 WER/准确率显著优于文献报告的说话人独立结果;换一名新说话人测试时性能断崖式下跌;不同论文间数字无法互比。
解决:
- 简单方法:以 speaker_code 为划分键,固定测试说话人组合(社区常用 F03/FC02/M04/MC03)。
- 进阶方法:GroupShuffleSplit(组 = 说话人 + 会话)+ 分层(组别 × FDA 严重度档)抽样;参考 EMNLP 2025 以"唯一提示文本"为第二划分单元。
- SOTA 方法:留一说话人交叉验证(LOOCV)+ 混合"群体-个体"(hybrid cohort-idiosyncratic)训练,同时报告两套指标。
参考:EMNLP 2025 适配研究(arXiv:2509.16718);Whisper-Clinical LoRA 模型卡
⚠️ 坑点 2:F02 编号断档与说话人清点错误(分类:工程陷阱)
问题:发布语料中 F02 目录不存在(官方未收录该受试者),但大量代码默认"8 名构音障碍者编号连续"。遍历 F01–F08 或解析论文说话人列表时容易拼出不存在的路径,甚至把重复的 M05 当作两人(部分论文作者笔误连写两次 M05)。
症状:FileNotFoundError 指向 F02;统计的说话人数与 15 对不上;日志中出现空说话人桶。
解决:
- 简单方法:以
ls -d */的实际目录为准动态构建说话人清单,不做范围假设。- 进阶方法:启动时断言清单 == {F01,F03,F04,M01…M05,FC01…FC03,MC01…MC04},缺失即报警。
- SOTA 方法:在数据卡中固化 canonical speaker registry,所有下游脚本从单一配置文件读取。
参考:官方下载页四包说明;EMNLP 2025 论文对 F02 缺席的注释
⚠️ 坑点 3:AG500 pos 专有二进制无法直接读取(分类:预处理陷阱)
问题:EMA 轨迹存于 AG500 专有二进制(pos/rawpos),header 与帧布局非自描述;直接
np.fromfile按想当然的通道数/字节序解析会得到错位甚至镜像的轨迹,而错误轨迹在肉眼检查下仍"看起来像运动曲线"。
症状:构音轨迹出现周期性跳变或线圈互换;AAI 模型损失不收敛;同一会话 pos 与 rawpos 坐标系对不上。
解决:
- 简单方法:用 MATLAB 运行官方推荐的 TAPADM toolbox
loaddata.m(GPL)导出 CSV/.mat,再进 Python。- 进阶方法:移植/复用社区 Python 解析器;先用校准文件(日期命名的 txt)验证解析出的静态线圈位置与 CoilLocations.pdf 一致。
- SOTA 方法:解析后做物理合理性校验(运动平滑性、最大速度阈值、参考线圈漂移监测),并固定 pos(头部归一化)为默认输入。
参考:官方数据说明(TAPADM 指引);OLAC/LDC 文档目录说明
⚠️ 坑点 4:EMA 与音频的时间轴没有现成对齐(分类:工程陷阱)
问题:声学 16 kHz 与 EMA 200 Hz 是两个独立时间轴;AG500 依赖扫描信号同步,其模拟峰记录在 wavall 第二声道。忽视同步直接"从头对齐"会引入数十毫秒级漂移,对塞音等快变构音事件足以毁掉倒置模型的监督信号。
症状:AAI 模型预测轨迹系统性滞后/超前;按句对齐时越长音频漂移越大;wavall 第二声道能量未被利用。
解决:
- 简单方法:检测 wavall 第二声道扫描峰起点作为 EMA t0,随后按 200 Hz 帧率线性映射到 16 kHz 时间轴。
- 进阶方法:以扫描峰序列为锚点做逐帧重采样(
scipy.interpolate),校正会话内时钟漂移。- SOTA 方法:对齐后在慢变构音通道上加 ±30 ms 平滑窗做鲁棒性检验,报告对齐残差作为质量指标。
参考:OLAC 目录文档(wavall 第二声道说明);AG500 精度评估:Yunusova et al., 2009, JSLHR 52:547–555
⚠️ 坑点 5:约 1/3 会话根本没有 EMA 数据(分类:预处理陷阱)
问题:官方说明约 1/3 会话由双目视频系统采集(VIDEO 标记),视频本体未发布,这些会话只有声学与转写。多模态管线若不区分会话类型,会在加载 pos 时静默丢样本或因缺文件崩溃。
症状:多模态 DataLoader 样本数远小于音频总数;随机抽查发现部分会话无 pos 目录;论文里"EMA 子集"规模各不相同。
解决:
- 简单方法:扫描每个会话的 EMA/VIDEO 标记文件,构建会话级 manifest 后再实例化 Dataset。
- 进阶方法:为纯声学样本设计双分支训练(有声学-EMA 联合损失 + 仅声学损失),最大化数据利用。
- SOTA 方法:按"会话类型"分层报告结果,明确区分 acoustic-only 与 acoustic+EMA 两个评测轨道。
参考:官方发布说明(视频数据未含);AAI 研究(arXiv:2309.01108)仅选用有完整并行数据的说话人
⚠️ 坑点 6:严重度异质与说话人产出不均衡(分类:偏倚陷阱)
问题:FDA 求和分横跨 32.8(M04,极重度)到 61.6(M03,轻度),且对照说话人产出约为患者两倍(HF 口径个别说话人 666–2,187 句)。合并训练时重度样本被淹没,宏平均与微平均可能相差数十个百分点。
症状:整体 WER 被轻度说话人拉低(如 FC02 WER 约 10% vs M04 基线 145.56%);分级任务中重度类召回率接近 0;按说话人分解后指标方差巨大。
解决:
- 简单方法:按说话人加权采样,使每人在每个 epoch 出现频次相近;按 FDA 档分层评估。
- 进阶方法:报告 per-speaker 指标表 + 宏平均;分级任务用分层 5 折说话人交叉验证。
- SOTA 方法:说话人自适应嵌入(x-vector 条件化)或 encoder-only 适配,缓解重度个体的建模难度。
参考:Whisper LoRA 模型卡 per-speaker 结果;EMNLP 2025 FDA 评分表
⚠️ 坑点 7:非文本任务(图片描述/非词)没有"标准答案"(分类:标签理解)
问题:无限制句由受试者自发描述图片产生,转写是"实际说了什么",无法与图片内容对齐;非词任务考察音位对比,转写为约定俗成的音串。把它们与朗读句混入同一训练集而不加区分,评估将包含不可归约的参考不确定性。
症状:自发描述样本的 WER 分布长尾(语法重构、犹豫、自我修正);同一段音频不同论文报告的参考文本不一致;非词样本把语言模型分数拉崩。
解决:
- 简单方法:按 prompts 内容区分任务类型,ASR 评估默认只用限制句/短词(有明确提示文本)。
- 进阶方法:自发语音单独设轨道,采用 SemScore(句嵌入余弦相似度)等语义指标补充 WER。
- SOTA 方法:在数据卡中登记 task_type 并对非文本样本使用可懂度人工重评(如需要)。
参考:EMNLP 2025 清理流程(移除图片与非词提示);Whisper LoRA 模型卡 SemScore 定义
⚠️ 坑点 8:EMA 电磁场污染声学通道(分类:评估误用)
问题:AG500 电磁场会干扰头戴式(部分波及定向式)麦克风产生高斯噪声;官方已剔除过重者,但轻中度干扰仍在数据里。两个麦克风通道噪声特性不同,随意选通道或混合训练会引入通道相关偏差。
症状:同一句子头戴与定向通道的 SNR/识别结果差异明显;wavall(混合通道)性能异常;谱特征中出现与 EMA 扫描频率相关的谱线。
解决:
- 简单方法:全流程固定使用同一麦克风通道(多数论文用头戴式),禁止跨通道混入同一训练集。
- 进阶方法:对受扰会话做谱减/多麦克风增强预处理(官方未发布其内部清洗版,需自行复现)。
- SOTA 方法:训练时加入通道标签作为辅助输入,或用通道判别损失做域自适应;评估按 ERRORS.xls 标记的技术问题试次做敏感性分析。
参考:官方发布说明(电磁干扰与剔除策略);ERRORS.xls 逐试次记录
§6.6 数据增强
| 策略 | 安全性 | 说明 |
|---|---|---|
| SpecAugment(时间/频率遮蔽) | ✅ | 与构音语义弱耦合,临床语音上表现稳定 |
| 速度扰动(0.9–1.1×) | ✅ | 模拟语速差异;EMA 通道需同步重采样 |
| 加性噪声(环境噪声) | ✅ | 提升鲁棒性;注意勿掩盖已有电磁干扰特征 |
| 音高变换(pitch shift) | ❌ | 构音障碍的音高异常本身就是诊断线索,人为改写会破坏标签语义 |
| EMA 通道随机镜像/缩放 | ❌ | 构音坐标有解剖学约束,随意变换产生生理不可能轨迹 |
| 跨说话人语音拼接 | ❌ | 生成"不存在的构音障碍者",临床效度存疑 |
增强策略的取舍原则与临床语义强相关:构音障碍语音中许多"异常"(音高压低、语速拖长、元音歪斜)正是模型需要识别或保留的信号,凡是会抹平这些异常的增强手段都可能把诊断相关特征当成噪声洗掉。多模态管线中还要保证声学与 EMA 增强的时间一致性——对音频做速度扰动而 EMA 不动,等于亲手制造对齐错误。
§6.7 模型推荐
推荐表的每一行都对应一条已被公开实现验证过的路径,按"工程成本从低到高"排序:
| 任务 | 推荐模型 | 起点 | 备注 |
|---|---|---|---|
| 构音障碍 ASR | Whisper Small + LoRA(decoder 或 encoder 分支微调) | 基线 WER 31.60% → 16.87% | 说话人独立;LoRA 仅 1.77M 可训练参数 |
| 构音障碍 ASR(重度) | Whisper 微调 + 说话人自适应 | M04 基线 145.56% → 65.29% | encoder-only 微调证据更优(EMNLP 2025) |
| 严重度分级 | SSL(WavLM/HuBERT)层级特征 + PCA + 轻量分类器 | 三分类最高 73.53% | 说话人独立 |
| AAI | BLSTM / Transformer,输入 MFCC 或 SSL 特征 | 12–24 维构音轨迹回归 | x-vector 条件化可保留说话人个性 |
| 多模态 ASR | Conformer + 声学-EMA 特征拼接 | TU Delft 开源流水线 | ESPnet/Kaldi 复现 |
三条选型路径:纯声学快速路线(Whisper Small + LoRA,单卡数小时出基线,硬件门槛最低);研究极值路线(Whisper Large-v3 + encoder-only 适配 + LOOCV 逐说话人分析,复现 EMNLP 2025 结论);运动学深挖路线(先解决 pos 解析与对齐,再进 BLSTM/Conformer 多模态,工期最长但能做病因级分析)。三条路线互不排斥,建议按"先跑通、再对齐、后融合"的次序推进。
§6.8 硬件需求
| 场景 | 最低配置 | 推荐配置 |
|---|---|---|
| 数据解析与统计 | CPU 4 核 / 16 GB RAM / 40 GB 磁盘 | CPU 8 核 / 32 GB RAM / 100 GB SSD |
| LoRA 微调(Whisper Small) | 单卡 8 GB VRAM(fp16,实测峰值约 5.6 GB) | 单卡 24 GB VRAM |
| 全参微调 / Conformer 多模态 | 单卡 24 GB VRAM | 2× A100 40 GB |
| SSL 特征提取(WavLM-large) | 单卡 16 GB VRAM | 单卡 24 GB VRAM + bf16 |
上表按社区公开实现的实测数据整理(Whisper LoRA 显存峰值约 5.6 GB 来自模型卡训练配置);整体规律是 TORGO 规模小到"数据加载不再是瓶颈",成本主要产生在模型前向/反向与 SSL 特征提取,磁盘与 CPU 需求主要来自 EMA 解析中间产物。
§6.9 评估指标代码
ASR 主指标为 WER(文本规范化后),辅以 SemScore 捕捉"语义正确但表面形式不同"的重度构音样本:
# WER(规范化:小写 + NFKD + 去标点)与 SemScore(语义相似度)双指标
# 与 Whisper LoRA 模型卡评估口径一致,便于横向对比
import re, unicodedata
import jiwer
def normalize(text: str) -> str:
text = unicodedata.normalize("NFKD", text).lower()
return re.sub(r"[^\w\s]", "", text)
def wer(refs: list, hyps: list) -> float:
return jiwer.wer([normalize(r) for r in refs],
[normalize(h) for h in hyps])
def semscore(refs: list, hyps: list, model_name: str = "all-MiniLM-L6-v2") -> float:
from sentence_transformers import SentenceTransformer, util
model = SentenceTransformer(model_name)
emb_r = model.encode([normalize(r) for r in refs], convert_to_tensor=True)
emb_h = model.encode([normalize(h) for h in hyps], convert_to_tensor=True)
return util.cos_sim(emb_r, emb_h).diagonal().mean().item()
AAI 任务额外报告逐维 Pearson 相关系数(PCC)与轨迹级 RMSE(毫米),并按线圈分组(舌尖/舌背/唇/下颌)分解:
# AAI 评估:逐维度 PCC 与 RMSE(构音轨迹回归的标准指标)
import numpy as np
def aai_metrics(pred: np.ndarray, gold: np.ndarray) -> dict:
# pred/gold: (T_frames, 24),前 12 维为位置,后 12 维为速度/加速度
pcc, rmse = {}, {}
for d in range(gold.shape[1]):
g, p = gold[:, d], pred[:, d]
pcc[d] = np.corrcoef(g, p)[0, 1]
rmse[d] = float(np.sqrt(np.mean((g - p) ** 2)))
return {"mean_pcc": float(np.mean(list(pcc.values()))),
"pos_pcc": float(np.mean([pcc[d] for d in range(12)])),
"pos_rmse_mm": float(np.mean([rmse[d] for d in range(12)]))}
§6.10 MLOps 笔记
TORGO 的工程风险集中在"数据处理链长、外部依赖多"(TAPADM、社区解析器、划分协议),以下清单针对这些风险点:
- 数据版本化:官方无版本号,建议以"下载日期 + 分包 MD5"作为数据集版本指纹入库(DVC/LakeFS)。
- 划分即代码:说话人清单与测试组合写入配置文件并在 CI 断言,杜绝"调参时漂移的划分"。
- 评估分层:任何汇报默认附 per-speaker 与 per-task 两个维度;把 M04 类重度样本单列敏感性分析。
- 可复现性:pos 解析依赖 TAPADM/社区解析器版本,锁定依赖并随产物保存解析器哈希。
- 合规审计:记录每次使用遵循学术非营利条款与论文引用义务,商业意图(如产品化 AAC)需另行获得权利人许可。
- 特征血缘管理:EMA 解析→归一化→对齐→特征化的每一步都落盘中间产物并登记参数(帧率、坐标基准、对齐残差),使 24 维特征可回溯到原始 pos 文件。
- 模型卡义务:面向构音障碍人群的模型发布时应附说话人级失败案例说明与 FDA 严重度分层性能,参照 Whisper-Clinical 模型卡的披露粒度。
§7 质量评估与局限性
§7.1 已知偏倚
下表按"严重程度 × 可缓解性"汇总 TORGO 的已知偏倚;这些偏倚均来自数据集的结构性设计或采集现实,而非标注事故:
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 小样本偏倚 | 15 人总量、ALS 仅 2 人,难以支撑疾病亚型泛化 | 高 | 说话人交叉验证;与 UASpeech 合并训练 |
| 地域/语言偏倚 | 全部来自多伦多单一实验室,加拿大英语 | 中 | 外部验证用 Speech Accessibility Project |
| 病因构成偏倚 | CP 6 人 vs ALS 2 人,重度集中在 M04/M05 | 高 | 分病因分层报告;避免亚型结论 |
| 产出量不均衡 | 患者约 500 句 vs 对照约 1,000 句/人 | 中 | 加权采样;宏平均指标 |
| 设备单一偏倚 | 单一 AG500 + 固定麦克风链路 | 中 | 数据增强;跨语料迁移评估 |
| 任务构成偏倚 | 限制句/朗读占比高,自发语音较短 | 低 | 单列自发语音评测轨道 |
| 采集年代偏倚 | 2008–2010 录制,声学前端与当代设备不同 | 中 | §7.6 漂移监控;现代设备数据校准 |
这些偏倚并非 TORGO 独有,而是小样本临床语料的结构性宿命;其相对可控之处在于偏倚方向都可预判(患者产出少、ALS 稀缺、单实验室),因此缓解手段明确且成本低——加权采样、分层报告与外部验证三件套即可覆盖大部分场景。真正的红线是不要把"TORGO 上的 SOTA"表述为"对构音障碍人群有效"。
§7.2 标注质量
转写为人工正字文本,无音素级对齐文件发布;FDA 评估由 SLP 依标准化流程执行(Enderby, 1983,28 感知维度 8 分制),但官方未公布转写者间一致性或 FDA 重测信度数字。论文层面提供了发音错误分布分析(塞音替代几乎全为浊化错误,如 /d/ 替代 /t/;词尾塞音/塞擦音脱落集中于齿龈音),可作为标注可靠性的旁证,但逐句错误标注并未随数据发布。
对重度说话人(如 M04),转写的不确定性本身构成"标签噪声":同一句音频在听者间可能得到不同转写,这解释了为何其基线 WER 可超过 100%——并非模型输出比参考"更差",而是参考与实际发音的偏差已超出可懂边界。使用此类样本做训练时,建议引入多参考或语义级指标(SemScore)弱化精确匹配的惩罚。
§7.3 泛化性评估
| 部署场景 | 失效风险 | 证据 |
|---|---|---|
| 新说话人(未见者)ASR | 高——个体构音差异大 | Whisper Large-v3 零样本 WER 45%–74%;LoRA 适配后仍依说话人显著波动 |
| 新方言/非北美英语 | 高——语料地域单一 | 数据集全部为多伦多录制 |
| 噪声环境 AAC | 中——实验室安静环境录制 | 官方仅提供实验室条件,无噪声通道 |
| 跨病因(构音障碍亚型外推) | 高——ALS 仅 2 人 | §7.1 病因构成偏倚 |
| 其他临床人群(失语症等) | 高——人群不匹配 | Whisper-Clinical 项目在 AphasiaBank 上另行交叉评估 |
失效风险的共同根源是"个体变异 >> 语料覆盖",这在构音障碍领域尤其突出——每位患者的构音异常组合近乎唯一。因此工程上的安全假设是:TORGO 训练的模型对其 15 名说话人风格的"邻域"有效,覆盖半径随个体偏离训练分布的程度衰减;任何新用户接入 AAC 产品前,先采集 5–10 分钟样本做域内验证(参考 EMNLP 2025 的 16→128 条提示增量实验),再决定是否启用个体化适配。
§7.4 伦理合规
数据采集在多伦多大学与 Holland Bloorview 儿童康复医院的机构审查框架下进行,受试者以编码标识(无姓名、无直接标识符),诊断信息仅保留病因类别与 FDA 评分(见原始论文与 LRE 论文的伦理声明)。官方许可仅限学术(非营利)用途,发布时剔除了部分可识别性内容;衍生研究如涉及再分发,须遵守原始许可并避免重识别。DUO 建议标注 NPUNCU。
从数据保护角度还需注意三点:其一,语音本身即生物特征,即使元数据脱敏,声纹与构音模式在理论上仍具可识别性,不应在公开演示中播放可对应到个体的长段落;其二,FDA 评分属于健康相关信息,合成或再发布的说话人级表格应视同敏感数据处理;其三,医疗 AI 模型若以 TORGO 训练并拟用于临床,除许可义务外还需满足相应监管路径的独立验证要求(见 §0 医疗免责声明)。
§7.5 公平性
性别构成较均衡(6 女/9 男),对照组按年龄与性别与患者匹配;但残障人群内部多样性不足(无种族分布披露、单一地域)、ALS 样本过少,可能导致模型对"非 CP 型重度构音障碍者"与少数群体表现不一致。使用时应报告按性别与严重度分层的性能,并避免在未验证人群上宣称临床等效。
值得肯定的是,TORGO 的匹配对照设计在 2012 年的同类语料中属于前瞻性做法;公平性短板主要源于时代局限(当年临床语音采集的通行标准),应结合 Speech Accessibility Project 等新近语料的特点来理解,而非苛求历史数据集满足当代标准。
§7.6 数据漂移
数据冻结于 2010 年前后:录音链路(AG500、头戴麦克风)与现代 AAC 设备的麦克风阵列差异显著;2008–2010 年的发音习惯与当代语音助手交互语境不同。将 TORGO 模型迁移到今天的产品语音输入时,需评估麦克风通道与声学前端漂移,必要时用新采集数据校准(Speech Accessibility Project 是合适的外部锚点)。
漂移风险可分解为三层监控对象:声学前端漂移(16 kHz 单声道 vs 现代设备多麦克风波束成形)用通道归一化缓解;人群漂移(TORGO 队列年龄、地域结构固定)用外部验证集监控性能衰减;任务漂移(朗读句 vs 真实对话式交互)用自发语音轨道单独评测。三层都应在 MLOps 流水线中设置各自的性能基线与告警阈值,而非只看总体 WER。
§7.7 DAIMS 24 项评估
DAIMS(Data-centric AI Metadata Standard 的工程化检查表)逐项审查 TORGO 的数据治理水平;评估基于本页面的文档分析与官方公开资料,状态含义:✅ 满足 / ⚠️ 部分满足或需自建 / ❌ 不满足。
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式可分析 | ✅ | session_contents.tsv 提供会话级宽表清单 |
| 2 | 唯一标识符 | ✅ | 说话人/会话/文件三级命名唯一 |
| 3 | 特殊字符处理 | ✅ | 文件名 ASCII 安全,转写为标准正字 |
| 4 | 重复行检测 | ✅ | 无重复样本;试次重录以 ERRORS.xls 记录区分 |
| 5 | 缺失值编码 | ⚠️ | 缺失以目录缺位表达,无显式编码列 |
| 6 | 标签标识清晰 | ⚠️ | 组别/性别隐含在编码中,FDA 分数仅在论文 |
| 7 | 罕见类分组 | ⚠️ | ALS 仅 2 人,亚型不可分 |
| 8 | 偏倚评估支持 | ⚠️ | 无官方偏倚声明,需自建分层评估 |
| 9 | 数据字典完备 | ✅ | 官方页面 + LDC 文档详细描述目录与格式 |
| 10 | 信息性缺失解释 | ✅ | 官方明确说明剔除原因(电磁干扰/视频未含/pilot) |
| 11 | 设备元数据记录 | ✅ | 校准文件 + CoilLocations.pdf + 会话标记 |
| 12 | 共线性提示 | ⚠️ | 舌尖/舌中/舌背轨迹高度相关,需降维处理 |
| 13 | 编码映射表 | ✅ | 说话人编码规则文档化(F/M + C + 序号) |
| 14 | 时间戳处理 | ⚠️ | 会话日期以文件名存(如 april232008cal2.txt),非结构化 |
| 15 | 划分建议 | ⚠️ | 无官方划分;社区惯例明确但需自行实现 |
| 16 | 泄漏讨论 | ✅ | 本页面 §5.3 给出系统防御方案 |
| 17 | 标签分布统计 | ✅ | §4.2 提供组别/性别/严重度分布 |
| 18 | 测量偏倚说明 | ⚠️ | EMA 电磁干扰、立方体边缘误差增大(Yunusova 2009) |
| 19 | 外部验证建议 | ✅ | §5.5 与 §7.8 给出跨语料路径 |
| 20 | 版本记录 | ⚠️ | 数据冻结无版本号体系,仅 LDC 编号 |
| 21 | 预处理脚本 | ❌ | 无官方 Python 脚本;仅第三方 MATLAB TAPADM |
| 22 | 合规要求明确 | ✅ | 学术免费 + 引用义务,条款清晰 |
| 23 | 多模态对齐说明 | ⚠️ | wavall 扫描峰同步需自行实现对齐 |
| 24 | 去标识化验证 | ✅ | 编码标识,无直接标识符发布 |
DAIMS 评分:18.0 / 24(✅ 13 项 × 1.0 + ⚠️ 10 项 × 0.5 + ❌ 1 项 × 0)
评分解读:18.0 属于"中等偏上、可研究级就绪"水平。数据组织、标识体系与文档完备性达到优秀水准(这是 2012 年语料中少见的),主要短板集中在"工程可用性"——无官方划分、无 Python 预处理脚本、EMA 专有格式与多模态对齐缺位。与同类语料对比,其 ⚠️ 项多数可以通过一次性工程投入转化为 ✅(例如自建 manifest 与划分配置),而 ❌ 项(预处理脚本缺位)则需要持续维护一个内部解析库来补足,这两类工作的性质不同,应分别排期。
对你意味着什么:
- 若你的目标是声学-only 任务(ASR/分级/检测),TORGO 几乎开箱即用:照 §5.2 的说话人独立划分 + §6.4 的 DataLoader 即可启动,注意坑点 1/2/6。
- 若涉及 EMA 轨迹(AAI/多模态),预留 1–2 周工程期处理 pos 解析(坑点 3)、时间对齐(坑点 4)与会话过滤(坑点 5),并以 TAPADM 输出做交叉校验。
- 所有结论必须以说话人独立口径汇报并附 per-speaker 分解;任何声称"对构音障碍人群有效"的模型,先在 UASpeech 或更新采集数据上做外部验证再说。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| Whisper Small + LoRA(说话人独立测试组) | Whisper-Clinical 项目(HF) | 构音障碍 ASR | WER 16.87%(整体) | 基线 31.60% → 相对改善 46.6% | decoder LoRA 在临床语音上有效;M04 重度仍余 65.29% |
| Whisper Large-v3 零样本 | Whisper-Clinical 项目 | 构音障碍 ASR | WER 45%–74% | 对比 LibriSpeech 约 5% | 临床人群与通用域差距悬殊,凸显适配必要性 |
| EMNLP 2025 适配协议 | EMNLP 2025 主会 | ASR 适配消融 | encoder-only 优于 decoder-only | LOOCV 设定 | 语言模型解码头微调可能反噬,编码器特化是更优范式 |
| SSL 层级特征分级 | Speech Communication(2025) | 严重度三分类 | 准确率 73.53% | 相对 MFCC 基线 55.16% | SSL + 手工特征融合设定新 SOTA(说话人独立) |
| UASpeech 跨语料 | UASpeech 社区 | AAI/ASR 迁移 | 性能显著下降 | 跨语料迁移普遍退化 | 孤立词 vs 连续语料任务差异是主要鸿沟 |
这张矩阵的读法:横向看"评估任务"列可发现 TORGO 的外部验证集中在 ASR 与分级两类,AAI 与多模态融合的外部验证仍以论文内部分析为主;纵向看"相对内部变化"列,所有跨设定验证都显示性能从内部基准显著回落,这再次印证 §5.3 的泄漏防御与 §7.1 的偏倚管理是结论可信度的前提,而非锦上添花。
§8 基准性能与生态
§8.1 排行榜
TORGO 上的公开基准分散在论文、模型卡与开源仓库中,下表收录有完整来源支撑的代表性结果;排名仅按说话人独立性严格程度与任务难度示意,数值之间不可直接比较:
| 排名 | 模型 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | Whisper Small + LoRA(说话人独立) | WER 16.87% | 2026 | decoder LoRA、SemScore 联合评估、说话人独立划分 | Barbera, D., 2026, Whisper-Clinical(HF 模型卡), https://huggingface.co/dbarbera/whisper-small-torgo-dysarthria-lora | ✅ GitHub |
| 2 | Whisper Small 适配(encoder-only,LOOCV) | 逐说话人报告 | 2025 | 混合群体-个体学习、encoder 特化 | Idiosyncratic Versus Normative Modeling of Atypical Speech Recognition, 2025, EMNLP Main(arXiv:2509.16718) | 论文 |
| 3 | SSL+PCA+手工特征融合 | 严重度三分类 73.53% | 2025 | WavLM/HuBERT 层级探测、分层融合 | Sapkota, P., et al., 2025, Speech Communication, https://www.sciencedirect.com/science/article/pii/S0167639325001414 | 论文 |
| 4 | CNN-GRU(说话人依赖) | 严重度分级验证准确率 97.00% | 2025 | STFT 谱图 + CNN-GRU | Enhancing dysarthria severity classification, 2025, Discover Applied Sciences, https://doi.org/10.1007/s42452-025-07260-2 | 论文 |
| 5 | ResNet 谱图检测(说话人依赖) | 检测验证准确率 98.22% | 2025 | 短语段 STFT + ResNet | 同上(第 4 行论文) | 论文 |
⚠️ 数值不可直接比较:第 1–3 行为说话人独立或 LOOCV 口径,第 4–5 行未明确声明说话人独立、其高准确率受说话人泄漏影响的可能性无法排除;WER 与准确率属于不同任务;各工作文本规范化方式亦有差异。
§8.2 SOTA 总结与选型建议
构音障碍 ASR 的当前最佳实践是"预训练大模型 + 轻量适配":Whisper Small 加 LoRA 已把说话人独立 WER 压到 16.87%,而 EMNLP 2025 的消融进一步指出编码器特化比解码器微调更稳。选型建议:起步用 Whisper Small + LoRA(硬件门槛低、有开源参照);追求极致用 Whisper Large-v3 + encoder 适配 + 说话人自适应嵌入;分级任务直接采用 SSL 层级特征范式;涉及 EMA 的研究优先复用 TU Delft 融合流水线。
评测层面的两点提醒:其一,TORGO 上报告的 WER 存在"通道选择 × 划分协议 × 文本规范化"三重自由度,引用任何数字前先确认三者的设定(本文 §8.3 给出了核对清单);其二,重度说话人(M04 级别)的指标波动主导总体方差,团队内部迭代时应冻结测试协议并对 per-speaker 结果做显著性检验,防止把随机波动当作改进。严重度分级方向,SSL 层级特征 + 轻量分类器(73.53%)仍是最佳起点,其优势在于几乎不增加推理成本即可获得超过手工特征基线 18 个百分点的增益。
§8.3 评测协议
标准协议为说话人独立评估(固定测试说话人或 LOOCV)+ 文本规范化(小写、去标点、NFKD)+ WER 主指标;自发语音辅以 SemScore。严重度分级采用 FDA 三档伪标签 + 分层说话人交叉验证。跨论文比较时必须核对:划分说话人集合、通道选择(头戴 vs 定向)、是否过滤非文本任务。
两种评测设定的系统对比:
| 协议要素 | 说话人依赖设定 | 说话人独立设定(推荐) |
|---|---|---|
| 划分单位 | 句(允许同说话人跨集) | 说话人或"说话人 + 会话" |
| 典型测试组合 | 随机句级 80/20 | F03/FC02/M04/MC03 或 LOOCV |
| 报告方式 | 总体准确率/WER | 总体 + per-speaker + 宏平均 |
| 适用场景 | 个性化 AAC(用户特定模型) | 泛化能力评估、论文基准 |
| 主要风险 | 严重高估泛化性能 | 小样本方差大,需显著性检验 |
个性化部署(单用户 AAC)建议两阶段:先以 TORGO 全量做说话人独立预适配,再用目标用户少量数据(EMNLP 2025 实验显示 128 条提示已有可观收益)做个体化继续训练。
无论选择哪种设定,都建议在项目启动时把评测协议写成一张固定的配置卡片(测试说话人列表、通道、文本规范化规则、任务过滤规则),并在每次汇报结果时原样附上——这比任何单点数字都更能保证跨实验可比性。
§8.4 相关数据集
与 TORGO 构成互补或竞争关系的语料如下表;"互补"主要指任务与模态维度,"竞争"主要指同类临床 ASR 基准:
| 数据集 | 语言 | 规模 | 模态 | 获取 |
|---|---|---|---|---|
| UASpeech | 英语 | 32 人 / 约 8 小时 | 声学 | UIUC 官网申请 |
| MOCHA-TIMIT | 英语 | 1 患者 + 1 对照 | 声学 + EMA | 学术许可 |
| SSNCE LDC2021S04 | 泰米尔语 | 构音障碍语音 | 声学 | LDC |
| C2SI | 法语 | 头颈癌语音 | 声学 | 学术申请 |
| Speech Accessibility Project | 英语 | 数百人持续扩充 | 声学 | 申请审核 |
选择相关数据集时的两条主线:做"方法学研究"(模型结构、训练策略)宜双库并行——TORGO 提供自发语流与严重度谱系,UASpeech 提供可控条件与大患者规模,两者结论互证;做"产品化探索"则以 Speech Accessibility Project 为外部队列评估终点,因为它在采集年代、设备多样性与人群规模上最接近部署现实。
§8.5 关键论文 Top 8
以下 8 篇构成 TORGO 研究的完整阅读路径:前三篇是数据集与方法的奠基工作(官方必引),第四篇是设备精度依据,后四篇是 2023–2026 年 SSL 时代的方法演进。
- Rudzicz, F., Namasivayam, A. K., & Wolff, T. (2012). The TORGO database of acoustic and articulatory speech from speakers with dysarthria. Language Resources and Evaluation, 46(4), 523–541. DOI: 10.1007/s10579-011-9145-0 —— 数据集原始论文,含发音错误统计分析。
- Rudzicz, F., Hirst, G., & van Lieshout, P. (2012). Vocal tract representation in the recognition of cerebral palsied speech. Journal of Speech, Language, and Hearing Research, 55(4), 1190–1207 —— EMA 表征对 CP 语音识别的增益验证。
- Rudzicz, F. (2012). Using articulatory likelihoods in the recognition of dysarthric speech. Speech Communication, 54(3), 430–444 —— 构音似然融入识别器的开山工作。
- Yunusova, Y., Green, J. R., & Mefferd, A. (2009). Accuracy assessment for AG500, electromagnetic articulograph. Journal of Speech, Language, and Hearing Research, 52(2), 547–555 —— AG500 定位误差基准,EMA 质量评估的依据。
- Acoustic-to-articulatory inversion for dysarthric speech: Are pre-trained self-supervised representations favorable? (2023). arXiv:2309.01108 —— SSL 特征用于低资源 AAI 的系统消融。
- Idiosyncratic Versus Normative Modeling of Atypical Speech Recognition: Dysarthric Case Studies. (2025). EMNLP 2025 Main(arXiv:2509.16718) —— encoder/decoder 适配消融与 FDA 分层。
- Sapkota, P., Srivastava, H., Kathania, H. K., Narayanan, S., & Kadiri, S. R. (2025). Do all features matter? Layer-wise feature probing of self-supervised speech models for dysarthria severity classification. Speech Communication —— 严重度三分类 73.53% SOTA。
- Barbera, D. (2026). Whisper-Clinical: Parameter-Efficient Fine-Tuning for Dysarthric Speech Recognition. HF 模型卡 + GitHub(MIT) —— 说话人独立 LoRA 基准与开源复现。
§8.6 社区活跃度
TORGO 无官方维护团队(数据冻结),但社区生态持续活跃:Hugging Face 存在多个派生数据集与微调模型(如 abnerh/TORGO-database、whisper-small-torgo-dysarthria-lora);Kaggle 有 2,000 样本检测竞赛集;TU Delft 与 Whisper-Clinical 等开源项目提供端到端复现;EMNLP 2025 与 Speech Communication 等近期论文仍在以它为标准基准。截至 2026-09,原始论文引用 494+(Semantic Scholar)且逐年上升。
对使用者而言,活跃的社区意味着两件事:其一,常见工程问题(pos 解析、划分协议、通道选择)大多已有公开参考实现,动手前先检索 HF/GitHub 可显著降低试错成本;其二,社区派生集的口径差异(句数、时长、过滤规则)也比官方版更复杂,跨论文比较时务必回溯到 §1.4b 的口径定义。
§8.7 生态快照
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| 官方下载页 | 数据 | https://www.cs.toronto.edu/~complingweb/data/TORGO/torgo.html | 唯一权威来源,含许可与 TAPADM 指引 |
| LDC2012S02 | 数据镜像 | https://catalog.ldc.upenn.edu/LDC2012S02 | 有 DOI 与正式文档,适合机构存档 |
| abnerh/TORGO-database | HF 派生集 | https://huggingface.co/datasets/abnerh/TORGO-database | 16,552 句口径,快速上手 |
| Whisper-Clinical | 代码 | https://github.com/DavidBarbera/whisper-clinical-speech | LoRA 微调/评估全流程(MIT) |
| Acoustic-EMA_ADSR | 代码 | https://github.com/TU-Delft-Speech-Group/Acoustic-EMA_ADSR | 声学-EMA 融合 ASR 官方实现(ESPnet/Kaldi) |
| TAPADM toolbox | 工具 | 见官方页面指引 | AG500 pos 文件解析(MATLAB,GPL) |
| Kaggle Dysarthria Detection | 派生集 | https://www.kaggle.com/datasets/iamhungundji/dysarthria-detection | 平衡 4×500 样本,适合教学 |
生态快照的使用建议:把官网 + LDC 设为"事实源",把两个参考实现设为"工程基线",把派生集仅用于快速实验——三层资源各司其职,可以同时保证结论权威性与开发效率。
§9 相关资源与引用
以下资源分为三组:官方资源是事实与许可的最终依据;BibTeX 块可直接粘贴至论文或技术报告;引用指南给出引用义务与工程引用的边界。
§9.1 官方资源
- 官方主页与下载(含许可条款、TAPADM 指引、ERRORS.xls/CoilLocations.pdf 说明):The TORGO Database
- LDC 正式发行页(DOI、ISBN、文档):LDC2012S02
- LDC 完整目录文档(目录结构与文件类型权威说明):OLAC 条目
- 数据集论文全文页:LRE 46(4):523–541(Springer)
- JSLHR 2012 论文 PDF(多伦多大学公开镜像):Rudzicz et al. 2012
- 社区快速通道:HF 派生集 abnerh/TORGO-database、Kaggle Dysarthria Detection
- 参考实现:Whisper-Clinical(LoRA 微调/评估全流程)、TU Delft Acoustic-EMA_ADSR(融合 ASR)
- 联系与勘误:官方页面指定联系 Frank Rudzicz(多伦多大学计算机系),欢迎更正与补充
- 发布公告:ISCA 公告(学术永久免费)
§9.2 BibTeX 引用块
@article{rudzicz2012torgo,
title = {The TORGO database of acoustic and articulatory speech from speakers with dysarthria},
author = {Rudzicz, Frank and Namasivayam, Aravind Kumar and Wolff, Talya},
journal = {Language Resources and Evaluation},
volume = {46},
number = {4},
pages = {523--541},
year = {2012},
doi = {10.1007/s10579-011-9145-0},
publisher = {Springer}
}
@article{rudzicz2012vocal,
title = {Vocal tract representation in the recognition of cerebral palsied speech},
author = {Rudzicz, Frank and Hirst, Graeme and van Lieshout, Pascal},
journal = {Journal of Speech, Language, and Hearing Research},
volume = {55},
number = {4},
pages = {1190--1207},
year = {2012}
}
@article{rudzicz2012articulatory,
title = {Using articulatory likelihoods in the recognition of dysarthric speech},
author = {Rudzicz, Frank},
journal = {Speech Communication},
volume = {54},
number = {3},
pages = {430--444},
year = {2012}
}
@misc{barbera2026whisper,
title = {Whisper-Clinical: Parameter-Efficient Fine-Tuning for Dysarthric Speech Recognition},
author = {Barbera, David},
year = {2026},
howpublished = {\url{https://huggingface.co/dbarbera/whisper-small-torgo-dysarthria-lora}},
note = {LoRA adapter for OpenAI Whisper Small trained on TORGO}
}
§9.3 引用指南
使用 TORGO 的任何公开成果必须至少引用 Rudzicz 等 2012(LRE,数据集论文,官方标注"This may be the most informative");涉及构音运动学建模建议加引 JSLHR 2012 与 Yunusova 等 2009;数据许可为学术(非营利)免费,商业用途需联系权利方获得单独授权。
引用实践中的三个细节:其一,LDC 发行页与官网是两个不同的"版本身份",机构存档引 LDC DOI(10.35111/cp5y-9z47),直接从官网下载则在脚注注明下载日期与官网 URL;其二,引用使用量数字(如 16,552 句)时必须注明派生口径来源,不可混用官方与 HF 口径;其三,若成果同时使用了社区预处理工具(TAPADM、Whisper-Clinical 等),工程引用与数据引用分开列出,便于他人区分数据贡献与方法贡献。
§10 AI 使用声明卡
§10.1 AI 模型列表
| 模型 | 版本 | 用途 |
|---|---|---|
| 大语言模型(生产写手) | fast-model | 初稿生成、结构编排、代码示例撰写 |
本页面生产过程中仅使用上述单一模型,未使用多模型投票或自动事实核查流水线;所有外部事实的最终裁判是 §10.3 所列的原始来源,而非模型自身知识。
§10.2 AI 参与范围
AI 负责初稿撰写、格式统一与代码骨架生成;全部事实性数字经 WebSearch 与 Semantic Scholar API 核实并记录于 FACTS.md;章节结构与 DAIMS 评估框架由写作宪法规定;最终内容经人工交叉审核。
参与边界的具体划分:AI 生成内容覆盖 14 个正文章节与 JSON-LD 块的全部文字;人类审核者负责事实核验(15 人构成、FDA 分数、许可条款、基准数字逐项比对来源)、代码逻辑复核(对齐官方目录结构与开源实现)、医学表述把关(ICD-11/SNOMED 映射与疾病描述)以及本声明卡的真实性维护。AI 未访问 TORGO 数据本体,文中全部数字来源于公开检索结果而非数据实测。
§10.3 输入来源列表
本页面全部事实性内容基于以下 15 项公开来源交叉核实:
- 官方数据页(多伦多大学)
- LDC2012S02 目录页
- OLAC/LDC 目录与文档
- LRE 2012 论文页(Springer)
- JSLHR 2012 论文 PDF(多伦多大学)
- ISCA 发布公告
- EMNLP 2025 适配研究(arXiv:2509.16718)
- AAI SSL 研究(arXiv:2309.01108)
- Whisper LoRA 模型卡(HF)
- Whisper-Clinical GitHub
- 严重度分级 SOTA(Speech Communication 2025)
- CNN-GRU 分级论文(DOI 10.1007/s42452-025-07260-2)
- TU Delft Acoustic-EMA_ADSR
- Kaggle Dysarthria Detection
- Semantic Scholar 引用 API
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED 映射、FDA 金标准) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(15 人构成、设备参数、时间线) | 千方病案医学编辑部 | 与官方页面、LDC 目录页交叉比对 | ✅ 已验证 |
| §4 数据结构(目录树、DAIMS 字段字典) | 千方病案医学编辑部 | 与 OLAC/LDC 文档交叉比对 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与开源实现比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 基准数字 | 千方病案医学编辑部 | 与模型卡/论文原文逐项核对 | ✅ 已验证 |
§10.5 AI 生成章节标注
本页面全部章节由 AI 生成初稿,经人工交叉审核后发布;§6.5 坑点基于官方文档、论文与开源项目公开讨论提炼,§8.1 排行榜数字逐项溯源至对应链接。AI 生成过程中未对 TORGO 数据本体执行任何访问或实测,文中全部统计数字的来源清单见 §10.3;凡检索无法核实的字段(如官方未披露的转写者间一致性数字)一律以"未公布"处理或整行省略,不存在推断补齐的内容。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)。若数据集官方页面或社区口径发生实质变化(如新增说话人、许可调整),本页面应触发复审并更新 §0 审核日期与 §10.4 校验表。
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- ua-speech — 共享标签:生理信号 / 语音信号 / 步态与运动
- HLS-CMDS — 共享标签:生理信号 / 语音信号
- ppg-dalia — 共享标签:生理信号 / 步态与运动
- physionet-cinc-2016 — 共享标签:生理信号 / 语音信号
- coughvid — 共享标签:生理信号 / 语音信号
- Bridge2AI-Voice — 共享标签:生理信号 / 语音信号
- pamap2 — 共享标签:生理信号 / 步态与运动
- mhealth — 共享标签:生理信号 / 步态与运动
- ninapro — 共享标签:生理信号 / 步态与运动
- coswara — 共享标签:生理信号 / 语音信号
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
