信息速览

COVID-19 Sounds(剑桥新冠声音) — 众包呼吸音频筛查 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | COVID-19 Sounds(剑桥新冠声音) |
| 英文全称 | COVID-19 Sounds App dataset(University of Cambridge) |
| 别名/简称 | COVID-19 Sounds、Cambridge COVID-19 Sounds dataset、Cambridge KDD 子集 / Cambridge npj 子集 |
| 疾病分类 | COVID-19 及呼吸道症状谱(ICD-11:RA01 2019 冠状病毒病 / CA27 咳嗽 / MG26 发热,详见 §2.1) |
| SNOMED CT | 840539006 Disease caused by SARS-CoV-2 / 49727002 Cough / 386661006 Fever(详见 §2.1b) |
| 数据模态 | 咳嗽 / 呼吸 / 朗读语音音频(网页 + Android 应用采集)+ 症状与病史自报问卷 |
| AI 任务类型 | COVID-19 检测、呼吸道症状预测、纵向进展预测、声音生物标志物挖掘、自监督表征预训练 |
| 样本总数 | 53,449 条音频样本 / 36,116 名参与者 / 2,106 条自报阳性样本 |
| 数据大小 | 逾 552 小时音频 + CSV 元数据与 Excel 格式说明 |
| 数据格式 | WAV 音频、CSV 元数据、XLSX 数据格式说明 |
| 许可证 | 自定义学术许可(与剑桥大学签署 Data Transfer Agreement 后使用) |
| 访问级别 | 申请审核(仅限学术机构:邮件申请 + 法人与学术人员双签 DTA + Google Drive 交付) |
| DUO 标签 | NPUNCU(非商业非营利), IRB(需伦理批准) |
| 语言 | 英语为主(评测子集 77.7% 为英语使用者),应用界面多语言 |
| 首发日期 | 2020-04(应用上线)/ 2021-11-20(53,449 样本正式发布) |
| 最后更新 | 2021-11-20(NeurIPS 2021 发布版,此后无公开全量更新) |
| 发布机构 | 剑桥大学计算机科学与技术系移动系统实验室(Cecilia Mascolo 团队) |
| 官方主页 | https://www.covid-19-sounds.org/en/ |
| 下载地址 | 邮件申请 covid-19-sounds@cl.cam.ac.uk(流程见官方发布页 https://www.covid-19-sounds.org/blog/neurips_dataset ) |
| 引用次数 | 114+(Google Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 有官方 benchmark 子集与参与者独立划分基线、字段说明齐备;扣分项:须签 DTA 申请、无一键运行脚本、全量无人工音频质量标注 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、COVID-19 与呼吸道症状临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(双层级主键与自报标签编码)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与剑桥大学、NeurIPS 或 Nature Portfolio 无任何商业利益关联。本页面不销售 COVID-19 Sounds 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受剑桥大学的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。COVID-19 Sounds 要求用户以学术机构身份邮件申请,并由机构法定代表人与学术人员共同签署数据传输协议(Data Transfer Agreement, DTA),数据仅限学术研究用途。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? 2020 年 4 月疫情最紧急的时刻,剑桥大学团队上线了一个网页与 Android 应用:任何人都能在手机上完成一份症状与病史问卷,然后对着麦克风深呼吸 5 次、咳嗽 3 声、朗读一句话 3 遍。到 2021 年 11 月正式发布时,这套系统收到了来自 36,116 名参与者的 53,449 条音频(逾 552 小时),其中 2,106 条样本来自自报新冠检测阳性者——这是迄今规模最大的多模态新冠众包声音数据集(官方发布页)。
为什么重要? 它把"用声音筛病"从医院里的听诊器搬到了全球几十万部手机上:数据覆盖真实世界的嘈杂环境、异构设备与多样人群,官方团队还发表了对偏倚与数据划分陷阱的系统解剖(npj Digital Medicine 2022),是声音健康领域"如何做诚实的众包医学 AI"的方法论范本(论文)。
我能用它做什么? 训练 COVID-19 检测与呼吸道症状预测模型(官方提供参与者独立划分的 benchmark 子集与 ROC-AUC 0.7+ 基线);做呼吸音频的自监督表征预训练(53,449 条无标注依赖音频是天然语料);研究标签噪声、设备偏倚、说话人泄漏在医学音频中的真实影响。注意:数据须由学术机构签署 DTA 后申请,且标签为自报口径,定位是筛查研究而非诊断。
§1.1 技术摘要
COVID-19 Sounds 由剑桥大学移动系统实验室(Cecilia Mascolo 团队)建设,获剑桥大学计算机科学与技术系伦理委员会批准(ID #722)。采集端为网页应用(仅支持 Chrome/Firefox)与 Android 应用,参与者填写人口学(性别、年龄分箱)、17 项病史多选、吸烟分级、11 项症状多选与自报 COVID 检测状态(未测 / 14 天内阳性 / 14 天前阳性 / 不愿透露),随后按提示录制三类音频:用嘴深呼吸 5 次、咳嗽 3 声、朗读固定句子"I hope my data can help to manage the virus pandemic."3 遍(官方 App 页面)。正式发布版含 53,449 条音频(逾 552 小时)、36,116 名参与者、2,106 条自报阳性样本,交付包包含元数据 CSV、全部音频、benchmark 子集与 Excel 格式说明(发布页)。官方在两个基准任务(呼吸道症状预测、COVID-19 预测)上以 openSMILE+SVM 与 VGGish(冻结/微调)三类基线报告 ROC-AUC 超过 0.7(同上)。后续 npj Digital Medicine 论文在 5,240 样本、2,478 名参与者的精选子集上,采用参与者独立划分与 TRIPOD 报告规范,给出无偏 AUC-ROC 0.71(95% CI 0.65-0.77)的真实性能锚点,并实证了样本级划分可将 AUC 虚高至 0.90(论文)。
§1.2 战略价值
维度一:真实世界声音健康研究的"方法学试验田"。 多数新冠音频数据集规模在数千条以内且常缺元数据;COVID-19 Sounds 以 53,449 条音频、完整问卷与官方偏倚研究独树一帜。官方团队主动发表"负面结果"——去偏后性能回落、无症状灵敏度仅 0.50、性别偏倚可让性别成为伪预测因子——这使其成为研究标签噪声、分布偏移与公平性的最佳沙盒(npj 论文)。对工程团队而言,在这些数据上磨出来的防泄漏与去偏流程可以直接迁移到任何众包医学音频项目。
维度二:多模态对齐的纵向声音语料。 同一次提交内三类音频(呼吸/咳嗽/语音)与同一份问卷严格对齐,且应用允许同一参与者至多每两天复访录音,形成天然的纵向结构——官方与后续团队已用其做疾病进展的序列深度学习预测(JMIR 2022)。NeurIPS 2024 的 OPERA 呼吸音预训练基准也将其纳入核心语料,说明它已成为表征学习方向的标准资产(OPERA 附录)。
维度三:合规获取流程的参照系。 从邮件申请、DTA 双签、Google Drive 交付到强制引用,该数据集展示了敏感健康音频"受控开放"的完整链路,为同类数据(UK COVID-19 Vocal Audio 等)的获取协议提供了模板。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标签机制 | 与 COVID-19 Sounds 的差异化 |
|---|---|---|---|---|
| COVID-19 Sounds(剑桥) | 53,449 条音频 / 36,116 人 | 咳嗽+呼吸+朗读语音+问卷 | 自报检测状态+症状问卷 | 规模最大、模态最全、官方偏倚研究最系统;须签 DTA |
| Coswara(IISc 印度) | 数千名参与者 | 浅/深咳嗽+浅/深呼吸+数数+元音+问卷 | 自报 | 采集协议更细(分浅深/数数),完全 GitHub 开放,但规模小一个量级 |
| COUGHVID(EPFL) | 25,000+ 条众包咳嗽 | 仅咳嗽 | 专家标注子集+咳嗽检测器 | 单模态但提供专家质量标注;Zenodo CC BY 4.0 开放 |
| UK COVID-19 Vocal Audio(UKHSA) | 数千名参与者 | 咳嗽+呼气+语音 | PCR 参照(Test and Trace 关联) | 标签金标准最高(PCR 关联),但采集于 Alpha/Omicron 时代、场景单一 |
| ICBHI | 6,898 条呼吸音 | 电子听诊器肺音 | 专家标注喘鸣/爆裂音 | 设备受控临床采集,标签确定,但与 COVID 无关、规模小 |
(来源:各官方发布页与 Coswara Scientific Data 2023、UK 数据集 Scientific Data 2024、OPERA 附录)
§1.4 版本时间轴
| 时间 | 版本/事件 | 规模与说明 |
|---|---|---|
| 2020-04 | 应用上线 | 网页 + Android 双通道开始全球众包采集 |
| 2020-05-22 | 首批学术共享 | 459 条咳嗽+呼吸样本 / 378 名用户 / 62 名自报阳性用户贡献 141 条(共享公告) |
| 2020-08 | KDD 2020 论文 | 约 7,000 名用户 / 约 10,000 条样本 / 200+ 自报阳性;三任务 AUC 80%-82%(论文) |
| 2021-04 | npj 论文数据快照 | 逾 36,000 名参与者、约 75,000 次总提交、2,080 条阳性样本(arXiv 版) |
| 2021-11-20 | NeurIPS 2021 正式发布 | 53,449 条音频 / 36,116 名参与者 / 2,106 条阳性样本 / 552+ 小时(发布页) |
| 2022-01-28 | npj Digital Medicine 论文 | 5,240 样本 / 2,478 名参与者的评测子集与无偏基准(论文) |
§1.5 典型应用场景
- COVID-19 声音筛查研究:以官方 benchmark 子集与用户独立划分为起点,复现 AUC 0.7+ 基线并推进(NeurIPS 2021)。
- 呼吸音频自监督预训练:552 小时众包音频用于预训练 cough/breath 编码器,再迁移至小标注数据集(OPERA 基准即此范式,NeurIPS 2024)。
- 偏倚与公平性方法论研究:官方公开了性别/年龄偏倚注入实验的设计,可复用为医学音频公平性课程的实训素材(npj 论文)。
- 纵向声音生物标志物:利用同一参与者多次提交构造序列模型,研究感染-恢复轨迹(JMIR 2022)。
- 语音/呼吸跨模态对比:同一人三类音频并存,支持"哪种模态携带更多疾病信息"的对照研究。
§2 医学背景
§2.1 ICD-11 编码映射
本数据集的标签体系由自报症状与自报检测状态构成,映射到 ICD-11 如下(编码依据 WHO ICD-11 MMS 浏览器):
| 数据集标签/概念 | ICD-11 编码 | ICD-11 中文名 | 说明 |
|---|---|---|---|
| COVID-19 检测阳性(自报) | RA01 | 2019 冠状病毒病 | 主任务正类;采集期为原始株主导流行期 |
| 干咳 / 湿咳(症状多选) | CA27 | 咳嗽 | 应用问卷将干咳与湿咳分开勾选 |
| 发热(症状多选) | MG26 | 其他或未知原因发热 | 11 项症状之一 |
| 味觉嗅觉丧失(症状多选) | CA0A | 嗅觉缺失 | 原始株感染的特征性症状 |
| 呼吸困难(症状多选) | MD11.0 | 呼吸困难 | 呼吸音分析的核心目标症状 |
| 哮喘(病史多选,对照组) | CA23 | 哮喘 | KDD 2020 用于构造"哮喘 vs COVID 咳嗽"鉴别任务 |
| COPD/肺气肿(病史多选,对照组) | CA22 | 慢性阻塞性肺疾病 | 17 项病史多选之一,构成合并症偏倚来源 |
§2.1b SNOMED CT 映射
| 数据集标签/概念 | SNOMED CT 编码 | 术语名称 | 用途 |
|---|---|---|---|
| COVID-19 检测阳性 | 840539006 | Disease caused by SARS-CoV-2 | 主标签的规范临床编码 |
| 咳嗽 | 49727002 | Cough | 症状标签主概念 |
| 发热 | 386661006 | Fever | 症状标签 |
| 嗅觉缺失 | 44169009 | Anosmia | 特征性症状标签 |
| 呼吸困难 | 267036007 | Dyspnea | 症状标签 |
| 哮喘 | 195967001 | Asthma | 对照人群病史标签 |
| 慢性阻塞性肺疾病 | 13645005 | Chronic obstructive lung disease | 对照人群病史标签 |
§2.2 疾病简介与声音病理机制
COVID-19 由 SARS-CoV-2 引起,以上呼吸道感染起病,特征性表现包括发热、干咳、味觉嗅觉丧失与呼吸困难;多数为轻症,但部分患者进展为下呼吸道受累(WHO 与临床文献综述口径)。声音之所以可能携带感染信号,机制上有三条通路:
| 通路 | 病理基础 | 声学表现 | 对应模态 |
|---|---|---|---|
| 声门与声道改变 | 喉部与上呼吸道黏膜炎症改变声带质量与振动特性 | 基频抖动、元音共振峰漂移、发声粗糙度上升 | 朗读语音 |
| 咳嗽形态改变 | 气道炎症与分泌物改变咳嗽反射的时频形态 | 干咳与湿咳在频谱能量分布、事件时长上可分离 | 咳嗽 |
| 呼吸模式改变 | 肺实质与气道受累改变呼吸频率、深浅与呼气相杂音 | 呼吸相包络异常、哮鸣/湿啰音样成分 | 呼吸 |
流行病学上,本数据集的采集期(2020-04 至 2021-08 快照)恰为原始株及其早期变异株主导的全球大流行期:大规模 PCR/抗原检测普及使参与者能够方便地获知并自报检测结果,而应用问卷将"最近 14 天内阳性"独立设档,正是为了利用检测窗口与录音时点的贴近性压低标签时滞误差(官网 App 页面)。同一时期味觉嗅觉丧失被确立为原始株的特征性症状并纳入问卷多选项,这解释了症状任务在该库上的可学习性——但也意味着结论对后续变异株时代(症状谱与声学表现已变化)的外推需要谨慎(§7.3)。
从任务设计角度,该库还内嵌了一个天然对照组:问卷的 17 项病史多选中显式采集哮喘与 COPD,使"COVID 咳嗽 vs 哮喘咳嗽"这类特异性鉴别任务成为可能——KDD 2020 论文证明其 AUC 约 80%,说明模型捕捉的不只是"生病的声音",而具有走向疾病特异性的潜力(KDD 论文)。
§2.3 临床任务定义
本数据集支持的临床任务均为**筛查(pre-screening)**而非诊断:
| 任务 | 输入 | 输出 | 临床定位 |
|---|---|---|---|
| COVID-19 检测(官方基准任务二) | 呼吸+咳嗽+语音特征 | 阳性/阴性二分类 | 大规模数字初筛,提示是否需要 PCR/抗原确认 |
| 呼吸道症状预测(官方基准任务一) | 三模态音频特征 | 健康 vs 存在任一呼吸道症状(干咳、湿咳、发热、咽痛、气短、流涕、头痛、头晕、胸闷等) | 症状负担的无接触评估 |
| COVID-19 vs 哮喘鉴别(KDD 2020 任务三) | 咳嗽/呼吸音频 | 阳性有咳嗽 vs 哮喘有咳嗽 | 特异度导向的鉴别研究 |
| 疾病进展预测(纵向) | 同一参与者时序音频序列 | 感染-恢复轨迹 | 病程监测研究(JMIR 2022) |
§2.4 患者人群特征
| 维度 | 全量发布版 | npj 评测子集 | 来源 |
|---|---|---|---|
| 来源/场景 | 全球众包,网页 + Android 应用自采 | 同左,经质量筛选与 14 天检测窗口约束 | 发布页、npj |
| 时间跨度 | 2020-04 起至 2021-11 发布快照 | 截至 2021-04 快照 | 同上 |
| 样本/人数 | 53,449 条音频 / 36,116 名参与者 | 5,240 样本 / 2,478 名参与者(514 阳性、1,964 阴性参与者) | 同上 |
| 性别 | 未在发布摘要中披露全量口径 | 约 56% 男性、43% 女性、1% 不愿透露 | ar5iv npj |
| 年龄 | 分箱采集(Under 20 至 90+) | 20-59 岁逾 87%,60 岁以上代表不足 | 同上 |
| 吸烟状态 | 九档分级问卷 | 过半从不吸烟 | 同上 |
| 种族 | 问卷未收集种族字段(官网问卷确认) | 未报告 | 官网 App 页面 |
| 就医类型 | 社区人群为主,问卷含"是否正在住院"字段 | 多数非住院 | 同上 |
| 地域 | 主要来自美国、英国及欧洲其他国家 | 仅保留英语使用者(77.7% 的全量参与者) | ar5iv npj |
§2.5 临床价值与定位
对公共卫生场景,声音筛查的价值在于零成本、非接触、可大规模部署:官方估计框架可在智能手机上实现"录 30 秒、出结果"的数字初筛,用于决定是否进入 PCR 流程(npj 论文讨论)。但必须强调三个定位边界:第一,AUC 0.71 的无偏性能意味着单模态声音不足以替代抗原/PCR 检测,其合理用途是前置分诊与疫情监测;第二,无症状者灵敏度仅 0.50,不能作为排除依据;第三,标签为自报且未区分 PCR 与抗原检测,任何临床声明都需在 PCR 参照数据(如 UK COVID-19 Vocal Audio)上复验。
§2.6 金标准与参考标准描述
| 维度 | 本数据集的做法 | 含义与强度 |
|---|---|---|
| 标签划分 | 自报"最近 14 天内阳性 / 超过 14 天前阳性 / 从未阳性 / 不愿透露"四档 | 弱标签;主任务使用 14 天内阳性 vs 阴性对照 |
| 标注方式 | 参与者在应用内自报检测结果(RT-PCR 或 lateral flow)与症状多选 | 无人工音频听诊标注,属弱监督 |
| 标注者 | 参与者本人(非盲:多数人录音时已知自身检测结果) | 引入知情偏倚与报告偏差(Coppock et al.) |
| 参考标准性质 | 自报检测状态,检测类型未系统记录 | 与 PCR 参照数据集相比标签上限较低;官方 npj 论文以参与者独立划分与 TRIPOD 规范作为方法学补偿 |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 规模 | 理由 |
|---|---|---|---|
| 公平复现 COVID 检测基准 | npj 评测子集(官方 benchmark 子集交付) | 5,240 样本 / 2,478 名参与者 | 官方用户独立划分+去偏设计,与已发表数字直接可比 |
| 预训练 / 表征学习 / 规模效应 | NeurIPS 2021 全量发布版 | 53,449 条音频 / 36,116 名参与者 | 552+ 小时音频最大化自监督语料量 |
| 历史 KDD 结果复现 / 方法演进研究 | KDD 2020 早期子集 | 459 样本 / 378 名用户(首版共享) | 与 2020-2021 早期文献可比,但规模小、平台构成偏 Android |
| 阳性标签质量优先 | 转用 UK COVID-19 Vocal Audio | PCR 参照 | 本数据集标签为自报,金标准需求者应换库或双库互证 |
§3.1 模态详情
| 模态 | 采集指令 | 单次提交 | 声学特点与用途 |
|---|---|---|---|
| 呼吸 | “用嘴尽可能深地吸气和呼气 5 次” | 1 段连续录音 | 呼吸相包络与杂音;对肺部受累敏感 |
| 咳嗽 | “咳嗽 3 声” | 1 段连续录音(含 3 次咳嗽事件) | 短促瞬态;干/湿咳频谱差异;最常用的单模态 |
| 语音 | 朗读固定英文句子 3 遍,句间呼吸 | 1 段连续录音 | 声门与声道特征;朗读文本固定保证跨参与者可比 |
(采集协议来源:官方 App 页面;每次提交含 3 段自愿咳嗽、3-5 段呼吸与 3 段朗读的动态范围见 npj 论文——应用迭代期协议略有调整,以包内 Excel 说明为准)
§3.2 按子集样本数
| 子集 | 音频/样本数 | 参与者 | 阳性规模 | 来源 |
|---|---|---|---|---|
| NeurIPS 2021 全量发布 | 53,449 条(552+ 小时) | 36,116 | 2,106 条阳性样本 | 发布页 |
| npj 评测子集 | 5,240 样本 | 2,478(514 阳性 / 1,964 阴性参与者) | 514 名阳性参与者 | npj |
| npj 数据快照 | 约 75,000 次总提交 | 36,000+(约 5,600 人有 14 天内检测结果) | 2,080 条阳性样本 | ar5iv npj |
| KDD 2020 论文分析集 | 约 10,000 条 | 约 7,000 | 200+ 自报阳性用户 | KDD 论文 |
| KDD 首批共享版 | 459 条(咳嗽+呼吸) | 378 | 62 名阳性用户 / 141 条 | 共享公告 |
| ComParE 2021 CCS 咳嗽子集 | 725 条(158 阳 / 567 阴) | — | 158 | Frontiers 综述 |
| ComParE 2021 CSS 语音子集 | 893 条(308 阳 / 585 阴) | — | 308 | 同上 |
§3.3 数据格式
| 内容 | 格式 | 说明 |
|---|---|---|
| 音频样本 | WAV | 官方交付包主体;评测子集文献口径为 16 kHz / 16-bit(KDD 子集分析) |
| 元数据 | CSV | 参与者级与提交级问卷表;具体文件划分以包内说明为准 |
| 数据格式说明 | XLSX | 官方 Excel 表逐列解释字段含义与取值 |
| benchmark 子集 | CSV 划分索引 + 对应音频 | 两个基准任务的官方参与样本列表与用户独立划分 |
§3.4 存储大小
官方口径为"逾 552 小时"音频总量(发布页)。按 16 kHz / 16-bit 单声道估算,原始 WAV 约在数十 GB 量级;官方未披露交付包的精确体积,申请前建议预留 100 GB 磁盘并向团队确认实际大小。
§3.5 标注方式
标注全部来自参与者自报,属弱监督,三个来源的标签功能如下:
| 标签来源 | 内容 | 服务任务 | 可信度设计 |
|---|---|---|---|
| 自报检测状态 | 未测 / 最近 14 天内阳性 / 超过 14 天前阳性 / 不愿透露 | COVID 检测主任务 | 14 天窗口压缩标签时滞;"不愿透露"显式隔离 |
| 症状问卷 | 11 项症状多选(干咳/湿咳分开) | 呼吸道症状预测任务 | 与检测状态正交,支持双任务隔离建模 |
| 病史与吸烟问卷 | 17 项病史多选 + 九档吸烟分级 | 混杂控制、鉴别任务(哮喘/COPD 对照) | 提供协变量供分层与重加权 |
(问卷条目来源:官网 App 页面)
全量数据不含人工听诊式音频标注(咳嗽事件切分、质量分级等需自行构造或参考 COUGHVID/Coswara 的做法)。官方在构建评测子集时执行了两道质量控制:英语使用者限定与音频质量检查(剔除不完整或高噪样本)(ar5iv npj)。
§3.6 标注者资质与一致性
标注者为参与者本人,无医学资质约束;检测结果的真实性未经中心化核验,检测类型(PCR/抗原)未系统记录(Coppock et al. 2021)。因无重复标注者,不存在标注者间一致性指标(如 Kappa)可报告——这是自报式众包数据集的结构性空白,使用时应以灵敏度分析(标签翻转扰动、子集一致性检验)替代。
§3.7 采集周期
应用于 2020-04 上线,持续开放采集;NeurIPS 发布版数据截至 2021 年(发布于 2021-11-20),npj 论文快照截至 2021-04(发布页、ar5iv npj)。应用支持同一参与者至多每两天提交一次,形成纵向观测流(KDD 2020)。
§3.8 地域覆盖
全球众包,参与者主要来自美国、英国及欧洲其他国家;应用为多语言界面,评测子集仅保留英语使用者(占全量 77.7%)以避免语言混淆(ar5iv npj)。应用同时采集一条近似地理位置(可选授权),可用于国家级分层分析。
§3.9 设备规格
| 通道 | 说明 |
|---|---|
| Web 应用 | 浏览器录音,官方明确仅支持 Chrome 与 Firefox(App 页面) |
| Android 应用 | 原生录音;KDD 时期文献口径 16 kHz / 16-bit(arXiv 2012.14553) |
| iOS | 存在 iOS 版本,但因录音不兼容未对数据集构成贡献(同上) |
| 设备型号 | 官方元数据未记录具体手机型号;采样率差异成为已知偏倚源(§7.1) |
§3.10 深度溯源链
参与者(全球志愿者)→ 网页/Android 应用(问卷 + 三段录音,含知情同意)→ 剑桥大学移动系统实验室服务器(质量检查与预处理)→ DTA 签署的学术机构(Google Drive 交付:元数据 CSV + 全部音频 + benchmark 子集 + Excel 格式说明)。伦理链:剑桥大学计算机科学与技术系伦理委员会批准 ID #722(NeurIPS 海报)。
§4 数据结构
§4.0 目录树
官方通过 Google Drive 交付的数据文件夹包含四类内容:元数据 CSV、全部音频样本、benchmark 子集与 Excel 格式说明(发布页)。解压后的结构示意如下(具体文件名以包内 Excel 说明为准):
covid19-sounds/
├── metadata/ # 问卷与标签元数据 CSV
│ ├── demographics_and_history.csv # 参与者级:性别/年龄/病史/吸烟
│ ├── symptoms_and_status.csv # 提交级:症状多选/检测状态/住院
│ └── audio_manifest.csv # 音频清单:文件路径与模态映射
├── audio/
│ ├── breathing/ # 深呼吸 5 次录音
│ ├── cough/ # 咳嗽 3 声录音
│ └── voice/ # 朗读句子 3 遍录音
├── benchmark_subsets/ # 官方两个基准任务的样本列表与用户独立划分
│ ├── symptom_prediction/
│ └── covid_prediction/
└── data_format_introduction.xlsx # 官方字段格式说明(首要阅读)
§4.1 DAIMS 字段字典
下表按官方问卷与发布描述整理核心字段;字段名以包内 Excel 格式说明为最终依据:
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| participant_id | 文本 | 参与者匿名唯一 ID | an anonymous app-assigned ID | 分组主键(防泄漏) | 无 | 无 | 系统生成 |
| sample_id | 文本 | 单条音频文件标识 | 文件级 ID | 样本主键 | 无 | 无 | 系统生成 |
| modality | 分类型 | 音频模态 | breathing / cough / voice | 多模态路由 | 应用迭代期协议差异 | 无 | 3 类 |
| created_at | 日期时间 | 提交时间戳 | 2020-06-14 | 时间分层/漂移分析 | 服务器时钟 | 无 | 2020-04 起 |
| gender | 分类型 | 生物学性别 | Male / Female / Other / Prefer not to say | 公平性分层 | 自报 | Prefer not to say | 4 类 |
| age | 分类型 | 年龄分箱 | 30-39 | 年龄偏倚控制 | 分箱损失精度 | Prefer not to say | 10 档 |
| medical_conditions | 多选集合 | 17 项病史(哮喘/COPD/糖尿病/癌症等) | Asthma | 混杂控制、鉴别任务 | 自报漏报 | None / Prefer not to say | 17 项 |
| smoking | 有序分型 | 吸烟状态九档 | Never smoked / Ex-smoker / 每日分档 | 混杂控制 | 自报 | Prefer not to say | 9 档 |
| symptoms | 多选集合 | 11 项症状(干咳/湿咳/发热/嗅觉丧失等) | Dry cough; Fever | 症状预测任务标签 | 自报、知情偏倚 | None / Prefer not to say | 11 项 |
| covid_test_positive | 分类型 | 自报检测状态四档 | In the last 14 days | 主任务标签 | 自报、检测类型未记 | Prefer not to say | 4 档 |
| hospital_now | 分类型 | 是否正在住院 | No | 严重度代理 | 自报 | Prefer not to say | 3 类 |
| location | 地理 | 一条近似地理位置(可选授权) | 国家/地区级 | 地域分层 | 设备定位精度 | 未授权即缺失 | 自由 |
| audio_path | 文本 | 音频文件相对路径 | audio/cough/xxx.wav | 数据装载 | 无 | 无 | 包内相对路径 |
§4.2 标签分布
- 主任务(COVID 检测):全量发布中阳性样本 2,106 / 53,449 ≈ 3.9%,类别高度不平衡(发布页)。npj 评测子集经筛选后达到 514 / 2,478 名参与者阳性(约 20.7%),注意这是精选后的分布而非自然流行率(npj)。
- 症状任务:评测子集中 84% 的阳性参与者报告症状(16% 无症状),49% 的阴性参与者报告至少一种症状——症状与感染并不对齐,构造任务标签时必须显式处理这一交叉(ar5iv npj)。
§4.3 关键统计
| 统计项 | 数值 | 来源 |
|---|---|---|
| 音频总时长 | 逾 552 小时 | 发布页 |
| 阳性样本占比(全量) | 约 3.9%(2,106/53,449) | 同上 |
| 评测子集英语占比 | 77.7%(全量参与者口径) | ar5iv npj |
| 有检测结果参与者 | 约 5,600 人提交过 14 天内结果样本 | 同上 |
| 单文件时长量级 | 秒级到十数秒(KDD 子集均值 9.96 秒、标准差 6.02 秒口径) | arXiv 2012.14553 |
§4.4 数据层级
参与者 participant(36,116)
└── 提交 submission(同一参与者可多次,至多每两天一次)
├── 问卷(症状/检测状态/住院)
└── 音频 sample(至多 3 条:breathing / cough / voice)
层级要点:标签挂在提交(问卷)上,音频挂在提交下的模态上;任何参与者级分析必须先按 participant_id 聚合,任何模型评估必须按参与者划分(§5.3)。
这一层级还决定了三条工程红线:统计口径先声明层级("53,449 条音频"是样本级、"36,116 名参与者"是参与者级,混用会得出矛盾的规模数字);建模单元与评估单元分离(样本级训练、参与者级评估);纵向任务在提交级之上再加时间轴(§6.5 坑点 8)。
§4.5 缺失值与信息性缺失
| 缺失模式 | 编码/表现 | 处理建议 |
|---|---|---|
| 敏感问题拒答 | 显式选项 Prefer not to say | 保留为独立类别,勿并入阴性或均值插补 |
| 未检测 | 自报状态为"从未检测"(Never) | 主任务中排除,不作为阴性对照 |
| 地理位置未授权 | 字段缺失 | 记录缺失掩码;勿用众数填充 |
| 音频未完成/损坏 | 质量检查后剔除(官方已过滤不完整与高噪样本于评测子集) | 装载时校验文件存在性与时长 |
| "不愿透露"与"无"混同风险 | None 与 Prefer not to say 是两个不同选项 | 构造信息性缺失指示变量参与建模 |
§4.6 数据质量快速审计
拿到交付包后、建模前,建议先跑一遍以下审计脚本,把坑点 4(不平衡)、坑点 8(主键错配)的风险量化出来:
import glob
import librosa
import pandas as pd
def audit_covid19_sounds(data_root: str, sample_n: int = 200) -> dict:
"""对 DTA 交付包做首次体检,输出决策依据。"""
report = {}
manifest = pd.read_csv(f"{data_root}/metadata/audio_manifest.csv")
# 1) 规模对账:样本行数应与官方 53,449 口径可解释(全量 vs 子集)
report["manifest_rows"] = len(manifest)
# 2) 参与者级完整性:一人多录的分布(纵向信号强度)
per_user = manifest.groupby("participant_id").size()
report["participants"] = per_user.size()
report["multi_submission_users_pct"] = float((per_user > 1).mean())
# 3) 标签分布:阳性占比应接近 3.9%(全量口径)
status = pd.read_csv(f"{data_root}/metadata/symptoms_and_status.csv")
report["positive_rate"] = float(status["covid_test_positive"].eq(
"In the last 14 days").mean())
# 4) 抽样检查音频可读性与采样率异质性(坑点 3 前哨)
paths = manifest["audio_path"].dropna().sample(min(sample_n, len(manifest)),
random_state=42)
srs = []
for p in paths:
try:
_, sr = librosa.load(f"{data_root}/{p}", sr=None, duration=1.0)
srs.append(sr)
except Exception:
report.setdefault("unreadable_files", 0)
report["unreadable_files"] += 1
report["sample_rate_counts"] = pd.Series(srs).value_counts().to_dict()
return report
if __name__ == "__main__":
from pprint import pprint
pprint(audit_covid19_sounds("covid19-sounds"))
审计要点:multi_submission_users_pct 越高,坑点 1 的泄漏风险越真实;sample_rate_counts 出现多个峰值即确认设备异质,训练前必须重采样统一;unreadable_files 大于零时先修复装载路径再谈建模。
§5 划分与使用建议
§5.1 官方划分
官方 benchmark 子集为两个任务(呼吸道症状预测、COVID-19 预测)提供参与者独立的训练/验证/测试划分,即同一参与者的所有样本只出现在一个集合中(NeurIPS 2021)。npj 论文进一步将开发与验证在人群层面隔离,并遵循 TRIPOD 报告规范(npj)。
§5.2 社区惯例划分
- ComParE 2021 CCS/CSS:从本数据集抽取的咳嗽/语音子集,自带官方 train/dev/test 划分,UAR 为该社区标准指标(Frontiers 综述)。
- KDD 2020 早期工作:分层、严格说话人独立的 train/dev/test 三分(arXiv 2012.14553)。
- 跨数据集评测:以 Coswara / COUGHVID 为外部队列的跨库迁移(Transfer learning 论文)。
§5.3 泄漏风险(重点)
本数据集的泄漏风险有两层:其一,同一参与者多条音频跨集合——应用允许重复提交,样本级随机划分会让模型记住"这个人"而非"这个病",官方实证 AUC 从 0.71 虚高至 0.90(npj);其二,纵向近邻泄漏——同一人相隔两天的录音高度相似,即便参与者级划分,构造时间外推测试时也应以提交日期切分。任何自定义划分都必须以 participant_id 为分组键,并在论文中报告划分口径。
§5.4 交叉验证建议
以参与者为组的 GroupKFold(5-10 折)做模型选择;报告折间均值与标准差;阳性样本过少的全量子集建议分层抽样保证每折阳性参与者数量。对纵向子任务,采用"参与者内时间外推"折:以时间切点将同一参与者的前后期录音分属验证与测试。
§5.5 外部验证建议
优先候选:UK COVID-19 Vocal Audio(PCR 参照,Scientific Data 2024);Coswara(协议不同但任务同构);COUGHVID(咳嗽单模态)。跨库时注意采样率、语言与采集季的差异,先做协变量对齐再评估(§7.8 矩阵给出已发表实例)。
§5.6 组合使用策略
单库研究之外,本库与同代数据集存在三种互补组合方式,均已有同行评审文献支撑:
| 组合 | 用法 | 注意事项 |
|---|---|---|
| 本库 → 小标注库 | 以 552 小时全量做自监督/有监督预训练,迁移至 ComParE CCS/CSS 或 COUGHVID 微调 | 迁移前统一采样率;预训练标签(自报)噪声会部分保留在表征中 |
| 本库 + Coswara 联合训练 | 拼接两库扩大阳性规模,学习跨协议不变性 | 采集协议不同(本库朗读语音 vs Coswara 元音/数数),需按库做域嵌入或域对抗 |
| 本库 → UK Vocal Audio 验证 | 以本库训练、UK PCR 参照库做外部验证,把"自报"升级为"PCR 参照"结论 | 采集时代不同(原始株 vs Alpha/Omicron),预期性能回落属于真实泛化损耗 |
(组合依据:Transfer learning 论文、UK 数据集论文、OPERA)
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
数据以 Google Drive 文件夹形式交付,无法公开直链下载。推荐流程:在 Colab 或自有云主机上挂载/同步官方共享文件夹 → 校验文件完整性(对照 Excel 说明)→ 将数据目录放入对象存储或本地 NVMe。以下代码均假设数据已就位于本地 DATA_ROOT。
容量与 IO 预算:552+ 小时 WAV 的原始体积在数十 GB 量级(§3.4),云盘同步一次性完成后建议转存为对象存储并在训练节点挂载;特征提取阶段 CPU 密集(§6.8),先在 1,000 条抽样上标定单条耗时再估算全量工期,可避免为几小时的 CPU 任务误开大规模集群。
§6.1 快速上手
代码前的三个约定:目录结构预期见 §4.0 目录树;DATA_ROOT 与所有子路径的拼接关系为 DATA_ROOT/<子目录>/<文件>;最小可用子集是官方 benchmark 子集中的 COVID 预测划分——先跑通它,再触碰 53,449 条全量音频。
import glob
import pandas as pd
DATA_ROOT = "covid19-sounds" # DTA 交付包解压后的根目录
# 1) 载入全部元数据 CSV(字段含义以 data_format_introduction.xlsx 为准)
meta_tables = [pd.read_csv(p) for p in sorted(glob.glob(f"{DATA_ROOT}/metadata/*.csv"))]
meta = pd.concat(meta_tables, ignore_index=True)
# 2) 找到官方 COVID 预测 benchmark 划分(参与者独立)
splits = pd.read_csv(f"{DATA_ROOT}/benchmark_subsets/covid_prediction/splits.csv")
# 3) 最小 sanity check:任何参与者不得同时出现在两个集合
per_user = splits.groupby("participant_id")["split"].nunique()
assert (per_user == 1).all(), "发现参与者跨集合,划分被污染"
print(meta.shape, splits["split"].value_counts().to_dict())
§6.2 数据获取
| 步骤 | 操作 | 要点 |
|---|---|---|
| 1 | 致函 covid-19-sounds@cl.cam.ac.uk | 附机构名称与用途简介(官方发布页) |
| 2 | 获取并签署 DTA | 须机构法定代表人与学术人员各签一份;仅限学术机构、学术用途 |
| 3 | 双方完成法律流程 | 团队通过你提供的 Google 账号共享文件夹 |
| 4 | 下载并落盘 | 包含元数据 CSV、全部音频、benchmark 子集、Excel 格式说明四类内容 |
| 5 | 引用义务 | 使用数据发表成果时引用 Xia et al., NeurIPS 2021(BibTeX 见 §9) |
申请邮件模板:
To: covid-19-sounds@cl.cam.ac.uk
Subject: Request for access to the COVID-19 Sounds dataset
Dear COVID-19 Sounds team,
We are researchers at [Your University], planning to use the dataset for
[academic research purpose, e.g. respiratory sound representation learning].
We have read and are ready to sign the Data Transfer Agreement.
Legal representative and academic staff contact details are as follows:
- Legal representative: [Name, Title, Email]
- Academic staff: [Name, Title, Email]
- Google account for delivery: [account]
Best regards,
[Name]
§6.3 预处理全流程
import librosa
import numpy as np
TARGET_SR = 16000 # 文献口径 16 kHz;低采样率录音是已知偏倚源(§6.5 坑点 3)
def load_audio(path: str) -> np.ndarray:
"""加载并重采样至 16 kHz、单声道。"""
wav, sr = librosa.load(path, sr=TARGET_SR, mono=True)
return wav
def trim_silence(wav: np.ndarray, top_db: int = 30) -> np.ndarray:
"""去除首尾静音,保留中间自然停顿(朗读任务的句间呼吸含信息)。"""
intervals = librosa.effects.split(wav, top_db=top_db)
return np.concatenate([wav[s:e] for s, e in intervals]) if len(intervals) else wav
def log_mel(wav: np.ndarray, n_mels: int = 64, frame_ms: int = 25, hop_ms: int = 10) -> np.ndarray:
"""Log-Mel 频谱:(n_mels, T)。咳嗽为瞬态信号,帧移宜短。"""
stft = np.abs(librosa.stft(wav, n_fft=int(TARGET_SR * frame_ms / 1000),
hop_length=int(TARGET_SR * hop_ms / 1000))) ** 2
mel = librosa.feature.melspectrogram(S=stft, sr=TARGET_SR, n_mels=n_mels)
return np.log(mel + 1e-6)
def segment_coughs(wav: np.ndarray, top_db: int = 25) -> list:
"""将 3 声咳嗽切成事件片段,供事件级模型使用。"""
intervals = librosa.effects.split(wav, top_db=top_db)
return [wav[s:e] for s, e in intervals]
§6.4 PyTorch DataLoader
import torch
from torch.utils.data import Dataset, DataLoader
class CovidSoundsDataset(Dataset):
"""三模态呼吸音频数据集。
manifest: DataFrame,至少包含 audio_path / modality / label / participant_id 列
(由 benchmark_subsets 划分表与音频清单合并而来)。
"""
def __init__(self, manifest, transform=None):
self.manifest = manifest.reset_index(drop=True)
self.transform = transform
def __len__(self):
return len(self.manifest)
def __getitem__(self, idx):
row = self.manifest.iloc[idx]
wav, _ = librosa.load(row["audio_path"], sr=TARGET_SR, mono=True)
wav = trim_silence(wav)
feat = torch.tensor(log_mel(wav), dtype=torch.float32)
if self.transform:
feat = self.transform(feat)
return feat, torch.tensor(row["label"], dtype=torch.long)
def make_loaders(train_df, val_df, batch_size=32, num_workers=4):
# 关键:划分已保证参与者独立(§5.3),DataLoader 只需常规 shuffle
train_ds = CovidSoundsDataset(train_df)
val_ds = CovidSoundsDataset(val_df)
return (DataLoader(train_ds, batch_size=batch_size, shuffle=True,
num_workers=num_workers, pin_memory=True),
DataLoader(val_ds, batch_size=batch_size, shuffle=False,
num_workers=num_workers))
在单模态 Dataset 之上,官方基线的核心是"三模态特征拼接 + 全连接融合"。以下给出一个可直接运行的最小多模态模型(对齐官方 VGGish+Dense 设计,用随机初始化 CNN 编码器占位,接入预训练 VGGish/AST 权重即升级为官方口径):
import torch
import torch.nn as nn
class ModalityEncoder(nn.Module):
"""单模态编码器:Log-Mel (1, 64, T) -> 定长嵌入。"""
def __init__(self, embed_dim: int = 128):
super().__init__()
self.conv = nn.Sequential(
nn.Conv2d(1, 32, 3, padding=1), nn.BatchNorm2d(32), nn.ReLU(),
nn.MaxPool2d(2),
nn.Conv2d(32, 64, 3, padding=1), nn.BatchNorm2d(64), nn.ReLU(),
nn.AdaptiveAvgPool2d((4, 4)),
)
self.fc = nn.Linear(64 * 4 * 4, embed_dim)
def forward(self, x):
h = self.conv(x.unsqueeze(1)).flatten(1)
return self.fc(h)
class TrimodalCovidNet(nn.Module):
"""呼吸/咳嗽/语音三模态融合,缺失模态以零嵌入屏蔽。"""
def __init__(self, embed_dim: int = 128, dropout: float = 0.3):
super().__init__()
self.encoders = nn.ModuleDict(
{m: ModalityEncoder(embed_dim) for m in ("breathing", "cough", "voice")})
self.head = nn.Sequential(
nn.Linear(embed_dim * 3, 256), nn.ReLU(), nn.Dropout(dropout),
nn.Linear(256, 1))
def forward(self, feats: dict):
emb = []
for name, enc in self.encoders.items():
x = feats.get(name)
if x is None: # 缺失模态:零嵌入占位
emb.append(torch.zeros(1, enc.fc.out_features,
device=next(enc.parameters()).device))
else:
emb.append(enc(x))
return self.head(torch.cat(emb, dim=-1)).squeeze(-1)
实操提示:真实 batch 中参与者常常只提交部分模态,训练循环里对缺失模态传零张量并配合缺失掩码(或直接只算可用模态均值),这是官方多模态基线在该库上稳健的关键工程细节。
§6.5 坑点 8 个
⚠️ 坑点 1:说话人泄漏——样本级划分让 AUC 从 0.71 虚高到 0.90(分类:数据泄漏)
问题:应用允许同一参与者多次提交,样本级随机划分会让同一人的音频同时出现在训练与测试集,模型学到的是声纹而非病理。
症状:测试 AUC 高得可疑(官方实测样本级划分 AUC 0.90 vs 参与者独立 0.71);换一批新用户后性能断崖式下跌。
解决:
- 简单方法:以 participant_id 为分组键做 GroupShuffleSplit / GroupKFold,保证组间互斥。
- 进阶方法:直接使用官方 benchmark 子集的划分表;若自建划分,先
df.groupby("participant_id")聚合再切分,并在数据卡中声明口径。- SOTA 方法:采用官方 npj 流程——在参与人群层面隔离开发与验证集,按 TRIPOD 报告,并补充时间外推测试(按提交日期切分)以捕捉纵向泄漏。
from sklearn.model_selection import GroupShuffleSplit gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42) tr, te = next(gss.split(manifest, groups=manifest["participant_id"]))
⚠️ 坑点 2:自报标签噪声——"阳性"不等于确诊,检测类型未记录(分类:标签理解)
问题:标签为参与者自报的检测状态,多数样本未区分 PCR 与抗原检测,真实性未经中心化核验;早期问卷"阴性"语义还曾含混(可被理解为"未测")。
症状:标签翻转导致模型上限被压低或指标抖动;跨研究对比时因纳入口径不同(是否要求 14 天窗口)数字不可比。
解决:
- 简单方法:主任务只使用"最近 14 天内阳性"作为正类、明确"未测"样本从对照组剔除。
- 进阶方法:对标签做随机翻转敏感性分析(如 5%/10% 翻转率)报告指标稳定区间;用 npj 精选子集(2,478 名参与者、已控混杂)作为高置信层。
- SOTA 方法:与 PCR 参照数据集(UK COVID-19 Vocal Audio)做跨库标签校准,或在自建小样本上做双标注一致性评估。
⚠️ 坑点 3:设备与采样率偏倚——低采样率录音曾与阳性标签完全相关(分类:偏倚陷阱)
问题:元数据不记录设备型号,Web/Android 双通道与各型号麦克风造成采样率与频响异质;ComParE 2021 挑战中曾出现"所有低采样率(<12 kHz)录音都是阳性"的灾难性相关,模型学会用采样率预测新冠。
症状:验证集成绩好但仅依赖频谱截断特征;去除低采样率样本后基线 UAR 从 73.8% 跌至 68.6%(CCS)。
解决:
- 简单方法:统计采样率分布并与标签做卡方/互信息检验;训练前统一重采样并剔除 <12 kHz 样本。
- 进阶方法:按平台(Web/Android)分层评估;将采样率作为协变量加入混杂控制。
- SOTA 方法:对抗去偏——以平台/采样率为敏感属性做对抗训练,或用实例重加权使设备分布在标签间均衡。
⚠️ 坑点 4:3.9% 阳性的类别不平衡——accuracy 完全失效(分类:评估误用)
问题:全量发布中阳性样本仅约 3.9%(2,106/53,449),全预测为阴的模型 accuracy 即约 96%。
症状:accuracy 高企但阳性召回为 0;ROC-AUC 因类别失衡被高估,PR 曲线惨不忍睹。
解决:
- 简单方法:以 ROC-AUC + PR-AUC + 灵敏度/特异度替代 accuracy;报告 UAR(ComParE 传统)。
- 进阶方法:加权 BCE 或 focal loss;阈值按目标场景(高灵敏度分诊 vs 高特异度确认)在验证集上调优并报告 95% CI。
- SOTA 方法:仿照官方无偏设定(1:1.9 阳阴参与者比、固定流行率敏感性分析)在多流行率下报告性能曲线。
from sklearn.metrics import roc_auc_score, average_precision_score auc = roc_auc_score(y_true, y_score) ap = average_precision_score(y_true, y_score)
⚠️ 坑点 5:三模态时长期异质与静音信息——一刀切 padding 毁信号(分类:预处理陷阱)
问题:呼吸(5 次深呼吸)、咳嗽(3 声瞬态)、朗读(3 句含句间呼吸)的时长与能量结构完全不同;按统一长度截断/填充会破坏呼吸相包络或把句间停顿的信息丢掉。
症状:呼吸模态性能对 padding 策略异常敏感;咳嗽事件在长窗中被稀释;VGGish 特征帧数参差导致 batch 内噪声。
解决:
- 简单方法:按模态分别设定窗长/帧移(咳嗽用短窗+事件切分,呼吸保留完整吸气-呼气循环,朗读保留句间停顿)。
- 进阶方法:注意力池化或模态专属时序聚合,让模型自己决定"听哪一段";对瞬态咳嗽用事件级二次采样。
- SOTA 方法:官方 npj 用 VGGish 逐帧特征+全序列池化的多模态融合骨架;可升级为 AST/ Whisper 编码器微调并做模态消融。
⚠️ 坑点 6:语言与人口学偏倚——77.7% 英语、60 岁以上几乎缺席(分类:偏倚陷阱)
问题:评测子集仅保留英语使用者;20-59 岁占 87%+,60 岁以上代表不足;官方实验证明性别失衡会让性别本身成为"阴性预测因子"。
症状:子群体间 AUC 差异显著;模型对老年或非英语使用者的外推失效;公平性审计不通过。
解决:
- 简单方法:按性别×年龄分箱报告分组指标;训练/验证分层抽样。
- 进阶方法:对少数群体样本重加权或重采样;将人口学变量从输入特征中显式剔除做敏感性对比。
- SOTA 方法:复制官方偏倚注入实验(人为构造性别/年龄失衡子集)量化性能虚高,再以均衡子集训练作为公平基线。
⚠️ 坑点 7:症状标签 ≠ 感染标签——16% 阳性无症状、49% 阴性有症状(分类:标签理解)
问题:症状预测任务与 COVID 预测任务的标签交叉严重:评测子集中 16% 的阳性无症状,49% 的阴性至少报告一种症状;干咳与湿咳是两个独立勾选项,直接二值化会混淆声学语义。
症状:把"有症状"当"阳性"训练后,模型在真实阳性无症状者上漏检;干/湿咳合并在症状任务中引入标签冲突。
解决:
- 简单方法:严格区分两个任务的标签源(症状多选 vs 检测状态),训练集与评估集使用同一任务定义。
- 进阶方法:症状任务做多标签(11 项各自 sigmoid),干咳/湿咳保留为独立头。
- SOTA 方法:官方定义的"健康 vs 任意呼吸道症状"泛化症状任务上以三模态融合建模,并报告无症状亚组灵敏度作为部署护栏。
⚠️ 坑点 8:纵向重复提交与元数据对齐——一人多录与跨表主键错配(分类:工程陷阱)
问题:同一参与者可至多每两天提交一次,交付包含多张 CSV 与音频目录,主键(参与者/提交/音频三层)在跨表合并时容易错位;位置字段为可选授权,缺失模式不随机。
症状:合并后同一音频出现多行;按"每行一个样本"统计的规模与官方 53,449 对不上;按时间切片时同一提交被拆散。
解决:
- 简单方法:以包内 Excel 格式说明确定每张表的主键层级,合并前
drop_duplicates并校验行数。- 进阶方法:构建 submission 级中间表(问卷+该提交三条音频路径),再派生样本级视图;位置缺失单独编码。
- SOTA 方法:为纵向任务构建以 participant_id+时间戳排序的序列索引,显式处理时间间隔分布(官方 JMIR 2022 序列建模范式)。
§6.6 数据增强
| 技术 | 状态 | 说明 |
|---|---|---|
| 时间拉伸/音高微扰(±10% 内) | ✅ 安全 | 模拟设备与生理差异,KDD 2020 证实增强可提升召回 5%-8% |
| 加性环境噪声(办公室/街道/风噪) | ✅ 安全 | 官方数据本身含真实环境噪声,合成噪声提升鲁棒性 |
| SpecAugment(时频掩蔽) | ✅ 安全 | 对长录音的局部失真稳健 |
| 随机增益/归一化抖动 | ✅ 安全 | 对抗设备增益差异 |
| 低采样率模拟 | ❌ 危险 | 会放大坑点 3 的设备偏倚——低采样率与阳性标签曾强相关 |
| 随机删段超过 30% | ❌ 危险 | 破坏呼吸循环完整性,删除含病信息的片段 |
| 跨参与者声纹拼接 | ❌ 危险 | 制造不存在个体,破坏参与者级划分的语义 |
§6.7 模型推荐
| 模型 | 适用场景 | 输入 | 官方/文献支撑 |
|---|---|---|---|
| openSMILE + SVM | 快速基线、小样本 | eGeMAPS 等声学特征集 | NeurIPS 2021 官方浅层基线 |
| VGGish(冻结/微调)+ 全连接 | 主力基线、多模态融合 | Log-Mel 帧 | NeurIPS 2021 与 npj 2022 官方深层基线 |
| AST / PaSST | 追求更强性能 | Mel 频谱 | 音频 Transformer 迁移范式(社区常规) |
| 优化自监督编码器(如 OPERA 范式) | 表征预训练 | 552 小时无标注依赖音频 | OPERA, NeurIPS 2024 |
| 序列模型(GRU/Transformer) | 纵向进展预测 | 同一参与者时序音频 | JMIR 2022 |
§6.8 硬件需求
| 阶段 | 最低配置 | 推荐配置 |
|---|---|---|
| 元数据处理 | 8 GB 内存笔记本 | 16 GB 内存 |
| 特征提取(53,449 条) | 4 核 CPU / 数小时 | 16 核 CPU 或 GPU 加速 / 1 小时内 |
| VGGish 微调 | 1× 8 GB GPU | 1× 24 GB GPU(batch 64 + AMP) |
| 全量自监督预训练 | 2× 24 GB GPU | 4× 40 GB GPU 多卡 DDP |
§6.9 评估指标代码
import numpy as np
from sklearn.metrics import roc_auc_score, average_precision_score, recall_score
def evaluate_user_level(df, score_col="score", label_col="label", user_col="participant_id"):
"""参与者级聚合评估:先按参与者取分数均值,再算指标。"""
agg = df.groupby(user_col).agg(score=(score_col, "mean"), label=(label_col, "max"))
y, s = agg["label"].values, agg["score"].values
return {
"auc_roc": roc_auc_score(y, s),
"auc_pr": average_precision_score(y, s),
"sensitivity": recall_score(y, (s >= np.quantile(s, 0.8))),
}
def bootstrap_ci(df, metric_fn, n_boot=1000, seed=42):
"""Bootstrap 95% 置信区间(官方 npj 报告口径)。"""
rng = np.random.default_rng(seed)
users = df["participant_id"].unique()
stats = []
for _ in range(n_boot):
sampled = rng.choice(users, size=len(users), replace=True)
stats.append(metric_fn(df[df["participant_id"].isin(sampled)])["auc_roc"])
return float(np.quantile(stats, 0.025)), float(np.quantile(stats, 0.975))
§6.10 MLOps 笔记
- 版本化:交付包无版本号字段,入库时以"NeurIPS 2021 发布版(2021-11-20)"为版本指纹,记录下载日期与文件清单哈希。
- 数据卡:在内部数据卡中固化 §5.3 划分口径与 §7.1 偏倚清单,任何微调前强制评审。
- 合规链:DTA 禁止再分发——团队内通过访问控制而非文件拷贝共享;产出模型时检查是否泄露可再识别声纹(导出前做成员推断测试)。
- 监控:部署态持续监控采样率分布、语言分布与阳性率漂移(§7.6),设定告警阈值。
- 可复现:固定 librosa 版本与重采样 kernel;特征缓存按 modality+窗长参数命名。
建议的最小 MLOps 资产清单:
| 资产 | 内容 | 验收标准 |
|---|---|---|
| 数据指纹 | 文件清单 + SHA-256 前缀表 | 两次入库指纹一致 |
| 划分快照 | benchmark 划分表原样入库 + 分组校验断言 | participant 无跨集合 |
| 特征缓存 | Log-Mel 参数、librosa 版本、重采样 kernel 写入元数据 | 缓存命中时特征逐位一致 |
| 评估报告 | ROC-AUC/PR-AUC/灵敏度/特异度 + 95% CI + 亚组矩阵 | 与 §8.3 复现清单逐项对应 |
| 偏倚检查单 | 采样率-标签独立性检验、平台分层结果 | 检验通过方可发布模型卡 |
| 合规留痕 | DTA 签署日期、用途声明、访问日志 | 审计可回溯至签署文件 |
团队协作约定:任何引用本库的实验配置(config)必须携带版本指纹与划分快照哈希;论文投稿前在附录披露 §8.3 复现清单五项,与官方 TRIPOD 口径保持一致,这也是审稿人最常核查的点。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 自报标签噪声 | 检测状态自报、类型未记录、真实阳性比例不确定 | 高 | 14 天窗口限定、高置信子集、标签翻转敏感性分析 |
| 设备/采样率偏倚 | 无设备型号记录;低采样率曾与阳性强相关 | 高 | 重采样统一、剔除低采样率、平台分层 |
| 类别不平衡 | 阳性样本约 3.9% | 高 | AUC/PR-AUC/UAR、重加权、流行率敏感性分析 |
| 语言偏倚 | 评测子集仅英语(全量 77.7% 英语) | 中 | 多语言扩展研究、语言分层 |
| 年龄偏倚 | 20-59 岁占 87%+、60 岁以上稀少 | 中 | 分组评估、重加权 |
| 时间/季节偏倚 | 阴性多采集于夏季,流感季混杂 | 中 | 时间外推测试、协变量控制 |
| 环境噪声与知情偏倚 | 录音环境与参与者知晓状态可泄漏标签 | 中 | 噪声增强、对抗去偏、谨慎解释 |
| 症状-感染交叉 | 16% 阳性无症状、49% 阴性有症状 | 中 | 双任务标签隔离、多标签建模 |
§7.2 标注质量
标签全部为自报,无标注者间一致性可报告;官方以三重补偿建立可信度:(1)npj 子集要求检测结果在录音前 14 天内;(2)控制人口学与语言混杂后训练"无偏模型";(3)以 TRIPOD 规范完整披露(npj)。使用者应把本数据集视为"弱标签大规模语料",高精确诊断需求应转向 PCR 参照库。
§7.3 泛化性评估
| 目标场景 | 失效风险 | 证据 |
|---|---|---|
| 无症状人群筛查 | 高:灵敏度仅 0.50 | npj |
| 老年(>60 岁)应用 | 高:代表不足、外推未知 | npj |
| 非英语人群 | 高:评测集中于英语 | ar5iv npj |
| 与流感等相似感染鉴别 | 高:未验证,"封闭世界"假设 | Coppock et al. |
| 新变异株时代(Omicron 后) | 中高:采集期集中于原始株流行期,症状谱与声学表现已变 | 采集窗口与变异株时间线对比推断 |
| 跨设备部署 | 中:设备型号未记录,采样率偏倚已实证 | ComParE 综述 |
§7.4 伦理
研究获剑桥大学计算机科学与技术系伦理委员会批准(ID #722),全部参与者经知情同意(NeurIPS 海报)。因声音原则上可被去匿名化再识别,数据仅以 DTA 受控共享、限学术用途;禁止再分发与再识别尝试。面向部署的声音筛查产品另需医疗器械监管路径与前瞻性临床验证。
§7.5 公平性
官方已示范公平性审计流程:按性别与年龄分组报告性能、构造失衡子集量化偏倚注入效应(npj)。建议任何下游研究至少复现性别×年龄分组矩阵,并将"Prefer not to say"作为独立类别评估。
def fairness_report(df, score_col="score", label_col="label"):
"""性别 × 年龄分箱的分组 AUC 矩阵(官方 npj 子组分析范式)。"""
rows = []
for g, sub in df.groupby(["gender", "age"]):
if sub[label_col].nunique() < 2 or len(sub) < 30:
continue # 子组过小或单类时跳过,避免假 AUC
from sklearn.metrics import roc_auc_score
rows.append({"gender": g[0], "age": g[1],
"n": len(sub),
"auc": roc_auc_score(sub[label_col], sub[score_col])})
out = pd.DataFrame(rows)
# 偏倚注入复现:人为下采样女性阴性样本,观察 AUC 虚高幅度
return out.sort_values(["gender", "age"])
复现官方偏倚注入实验的步骤:将训练集中某人口学组(如女性阴性)重采样至失衡 → 重训模型 → 对比均衡子集上的 AUC。官方结果显示失衡训练会让模型把该人口学特征本身当作"阴性预测因子",这是声音筛查公平性风险的直接证据。
§7.6 数据漂移
采集窗口对应原始株主导期;病毒变异、疫苗接种、检测习惯(抗原自测普及)都会使部署期分布偏离采集期分布。监控建议:采样率分布、录音时长分布、自报阳性率、症状构成四条曲线的滚动对比。
§7.7 DAIMS 数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 元数据 CSV 表结构清晰,一行一实体 |
| 2 | 唯一标识 | ✅ | participant_id / submission / sample 三层主键 |
| 3 | 特殊字符 | ⚠️ | 多语言问卷自由文本,跨库合并需规范化 |
| 4 | 重复行 | ⚠️ | 同一参与者多次提交,聚合前必须去重对齐 |
| 5 | 缺失编码 | ✅ | Prefer not to say 显式编码,语义明确 |
| 6 | 标签标识 | ✅ | covid_test_positive 四档显式标签列 |
| 7 | 罕见类分组 | ⚠️ | 罕见病史(如囊性纤维化)样本极少,无法支撑 subgroup 训练 |
| 8 | 偏倚评估 | ✅ | 官方论文系统性研究偏倚注入与去偏 |
| 9 | 数据字典 | ✅ | 官方 Excel 格式说明逐列解释 |
| 10 | 信息性缺失解释 | ⚠️ | 未授权定位、拒答与未检测的混同需自行建掩码 |
| 11 | 设备记录 | ⚠️ | 无设备型号字段,仅平台可推断 |
| 12 | 共线性 | ⚠️ | 症状与病史项间存在共线,需相关矩阵审查 |
| 13 | 编码映射 | ⚠️ | 问卷选项到 ICD-11/SNOMED 需自行映射(本 Wiki §2 已提供起点) |
| 14 | 时间戳处理 | ✅ | created_at 时间戳完整,支持时序与漂移分析 |
| 15 | 划分建议 | ✅ | 官方 benchmark 子集自带参与者独立划分 |
| 16 | 泄漏讨论 | ✅ | 官方实证样本级划分虚高(0.71→0.90) |
| 17 | 标签分布 | ✅ | 阳性数、症状交叉等关键分布在论文中披露 |
| 18 | 测量偏倚 | ⚠️ | 采样率/平台测量偏倚有实证但无设备字段可供完全校正 |
| 19 | 外部验证建议 | ✅ | 官方独立人群验证并示范跨设定报告 |
| 20 | 版本记录 | ✅ | KDD→NeurIPS→npj 三阶段口径清晰可溯 |
| 21 | 预处理脚本 | ✅ | 官方 GitHub 提供 NeurIPS 基线代码 |
| 22 | 合规要求 | ✅ | DTA 流程、学术限制、伦理批准号齐备 |
| 23 | 多模态对齐 | ✅ | 同一提交内三类音频与问卷天然对齐 |
| 24 | 去标识化 | ✅ | 匿名 ID 分发;声音再识别风险已在协议中声明管控 |
DAIMS 评分:20 / 24
评分解读:优秀——工程与合规基础扎实(三层主键、显式缺失编码、官方划分与字典、DTA 合规链),弱项集中在自报标签的先天上限与设备信息缺失这两类"采集期既定"的结构性限制。
对你意味着什么:你可以直接把它当作一座可开采的声音健康金矿——装载、划分、评估的全套物料(benchmark 子集、Excel 字典、官方代码)齐备,冷启动成本低于绝大多数医学音频数据集。但开工前必须立三条规矩:一切划分以 participant_id 分组(否则 0.90 的虚高会反噬你的论文);一切结论标注"自报标签"边界(不要与 PCR 参照结果直接混排);一切设备相关特征先做偏倚检验(低采样率教训近在眼前)。若目标是临床级声明,请把它作为预训练语料与方法学试验田,把标签金标准交给 UK COVID-19 Vocal Audio 这类 PCR 参照库。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| npj 独立验证人群(参与者级隔离) | 剑桥大学 | COVID 检测 | AUC-ROC 0.71(95% CI 0.65-0.77) | 相同样本级划分虚高至 0.90 | 泄漏消除后性能回落约 0.19,确立真实性能锚点 |
| ComParE 2021 CCS/CSS 子挑战 | 挑战组委会(取样自本库) | 咳嗽/语音 COVID 分类 | CCS 73.8% UAR、CSS 72.1% UAR;剔除低采样率后 68.6% / 70.9% | 去偏后 -5.2 / -1.2 个百分点 | 低采样率与阳性标签的相关性会虚高成绩 |
| Cambridge KDD 子集(独立团队) | 外部研究组 | 咳嗽+呼吸 COVID 分类 | 集成 CNN AUC 79.0% | 相对官方浅基线接近 | 严格说话人独立下早期数据可复现 70%-80% 区间 |
§8 基准性能与生态
§8.1 排行榜
⚠️ 以下数字来自不同子集、不同划分与不同任务定义,不可直接横向比较;仅供方法演进参考。
| 排名 | 模型 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | FAIR4Cov | AUC 0.8658 | 2022 | 自注意力融合咳嗽/呼吸/语音实例表征 | Truong et al., 2022, arXiv:2205.15738. https://arxiv.org/abs/2205.15738 | 未公开 |
| 2 | Ensemble CNN(KDD 子集) | AUC 79.0% | 2021 | CNN 集成 + 说话人独立划分 | arXiv:2012.14553, 2021, ICASSP 方向预印本. https://arxiv.org/abs/2012.14553 | 部分 |
| 3 | npj 无偏深度模型 | AUC 0.71(95% CI 0.65-0.77) | 2022 | VGGish 三模态融合 + 参与者独立 + TRIPOD | Han et al., 2022, npj Digital Medicine 5:16. DOI 10.1038/s41746-021-00553-x | 官方发布页 |
| 4 | NeurIPS 官方基线(三套) | ROC-AUC >0.7(两任务) | 2021 | openSMILE+SVM / VGGish 冻结 / 微调 | Xia et al., 2021, NeurIPS Datasets and Benchmarks Track. https://neurips.cc/virtual/2021/29829 | https://github.com/cam-mobys/covid19-sounds-neurips |
| 5 | ComParE 2021 CCS/CSS 基线 | 73.8% / 72.1% UAR(去偏后 68.6% / 70.9%) | 2022 | 声学特征基线融合 | Schuller et al., 2022, Frontiers in Signal Processing. https://www.frontiersin.org/article/1058163 | 挑战页 |
| 6 | KDD 2020 浅层分类器 | AUC 80%-82%(三任务) | 2020 | 特征工程 + 声学特征 + 增强 | Brown et al., 2020, KDD 2020. DOI 10.1145/3394486.3412865 | 官方发布页 |
§8.2 SOTA 总结与选型建议
数字上的"最高"来自混合库与更宽松设定的研究(FAIR4Cov),与本库用户独立设定的 0.71 不是同一口径。选型建议:追求可信医学结论→以 npj 无偏设定为标尺;追求预训练表征→走 OPERA 自监督路线;追求快速迭代→openSMILE+SVM 基线一小时内可跑通。任何声称 AUC >0.85 的单库结果都应先检查划分口径与设备偏倚(§6.5 坑点 1/3)。
§8.3 评测协议
社区共识协议由官方论文确立:(1)参与者独立划分(同一人不得跨集合);(2)主指标 ROC-AUC 并报告 95% CI(Bootstrap 或解析式);(3)按症状状态、性别、年龄分组的亚组性能;(4)多流行率下的性能敏感性;(5)遵循 TRIPOD 报告(npj)。ComParE 线沿用 UAR 与官方固定划分。
对齐协议时还需固定四个自由度,否则结果不可比:
| 自由度 | 官方口径 | 偏离后果 |
|---|---|---|
| 检测窗口 | 正类仅取录音前 14 天内自报阳性 | 放宽窗口会引入康复后录音,稀释声学信号 |
| 对照组定义 | 检测阴性 vs 健康(无检测)严格分开 | 混入未检测者会引入标签噪声 |
| 模态组合 | 三模态融合 vs 单模态分别报告 | 只报融合值会掩盖"哪类声音携带信号"的科学问题 |
| 聚合层级 | 参与者级聚合后再算指标 | 样本级聚合会重演 0.90 的记忆陷阱 |
§8.3b 复现清单
- 使用官方 benchmark 子集与划分表,禁止重新随机切分;
- 预处理固定 16 kHz 重采样与统一 Log-Mel 参数(帧长 25 ms、帧移 10 ms、64 Mel 带);
- 报告 ROC-AUC、PR-AUC、灵敏度、特异度及其 95% CI;
- 附上性别/年龄/症状状态亚组矩阵与流行率敏感性曲线;
- 在数据卡中声明自报标签口径与设备偏倚核查结果(采样率-标签独立性检验)。
§8.4 相关数据集
| 数据集 | 机构 | 规模 | 许可/获取 | 与本库关系 |
|---|---|---|---|---|
| Coswara | IISc 印度 | 数千名参与者、9 类发声任务 | GitHub 完全开放 | 协议更细(浅/深咳嗽、数数、元音),常与本库联合训练 |
| COUGHVID | EPFL | 25,000+ 条咳嗽 | Zenodo CC BY 4.0 | 提供专家质量标注,可补本库无人工标注的短板 |
| UK COVID-19 Vocal Audio | UKHSA | PCR 参照咳嗽/呼气/语音 | Zenodo OGL 3.0 | 标签金标准互补,外部验证首选 |
| ICBHI | 多机构 | 6,898 条肺音 | CC0 | 非新冠呼吸音基准,跨域迁移目标 |
| ComParE CCS/CSS | Interspeech 社区 | 725 条咳嗽 / 893 条语音 | 挑战分发 | 本库官方抽样子集 |
§8.5 关键论文 Top 8
- Xia et al., 2021, NeurIPS Datasets and Benchmarks Track. https://neurips.cc/virtual/2021/29829 — 数据集本体论文:规模、协议、双任务基线与无偏评测设计。
- Han et al., 2022, npj Digital Medicine 5:16. DOI 10.1038/s41746-021-00553-x — 真实性能锚点(AUC 0.71)与偏倚/泄漏系统解剖。
- Brown et al., 2020, KDD 2020. DOI 10.1145/3394486.3412865 — 首篇分析:约 7,000 名用户、三任务 AUC 80%-82%。
- Coppock et al., 2021, The Lancet Digital Health. https://www.sciencedirect.com/science/article/pii/S2589750021001412 — 七点质疑:标签效度、环境偏倚、非盲问题。
- Schuller et al., 2022, Frontiers in Signal Processing. https://www.frontiersin.org/article/1058163 — ComParE 2021 复盘:采样率偏倚事件的完整记录。
- Xia et al., 2022, Journal of Medical Internet Research 24(6):e37004. https://pmc.ncbi.nlm.nih.gov/articles/PMC9217153 — 纵向序列深度学习做疾病进展预测。
- Truong et al., 2022, arXiv:2205.15738. https://arxiv.org/abs/2205.15738 — FAIR4Cov 多库融合表征,AUC 0.8658。
- OPERA, 2024, NeurIPS Datasets and Benchmarks Track. https://proceedings.neurips.cc/paper_files/paper/2024 — 呼吸音预训练基准,将本库纳入核心语料。
§8.6 社区活跃度
数据集论文自 2021 年发布以来获 114+ 引用(Google Scholar,截至 2026-09),被 ComParE 2021 挑战、OPERA(NeurIPS 2024)等社区基准采纳为核心语料;官网与应用保持在线,学术共享流程持续受理(发布页)。官方 GitHub 仓库托管 NeurIPS 基线代码,社区衍生工作覆盖迁移学习、公平性与跨库泛化等方向。
引用轨迹的三条主线:2022 年前后集中于"新冠声音检测"直接应用(迁移学习、多模态融合);2023-2024 年转向方法学消费——预训练基准(OPERA)与跨库泛化研究将其作为标准语料;偏倚与标签效度的批评线(Coppock et al. 等)同样以本库为重要案例,使它同时是"正面资产"与"方法学反面教材"的双重参照。对新人而言,这意味着跟随引用轨迹即可快速定位该领域当前的问题意识所在。
§8.7 生态快照
| 资源 | 类型 | 链接 | Star/Fork(截至 2026-09,约) | 为什么值得关注 |
|---|---|---|---|---|
| cam-mobys/covid19-sounds-neurips | 官方代码 | https://github.com/cam-mobys/covid19-sounds-neurips | — | NeurIPS 2021 两任务三基线官方实现,复现起点 |
| COVID-19 Sounds 官网 | 官方门户 | https://www.covid-19-sounds.org/en/ | — | 协议、发布与共享公告的权威来源 |
| NeurIPS 2021 页面 | 论文页 | https://neurips.cc/virtual/2021/29829 | — | 官方摘要与评审元数据 |
| npj Digital Medicine 论文 | 方法论文 | https://doi.org/10.1038/s41746-021-00553-x | — | 无偏性能锚点与偏倚实验设计 |
| ComParE 2021 复盘 | 挑战综述 | https://www.frontiersin.org/article/1058163 | — | 采样率偏倚事件的原始记录 |
| OPERA 基准 | 预训练基准 | https://proceedings.neurips.cc/paper_files/paper/2024 | — | 呼吸音自监督预训练的当代标尺 |
§9 相关资源与引用
§9.1 官方资源列表
- 官方主页与应用入口:https://www.covid-19-sounds.org/en/
- 数据发布与获取公告(DTA 流程):https://www.covid-19-sounds.org/blog/neurips_dataset
- 早期数据共享公告(KDD 子集):https://www.covid-19-sounds.org/es/blog/data_sharing.html
- 官方 NeurIPS 基线代码:https://github.com/cam-mobys/covid19-sounds-neurips
- 申请邮箱:covid-19-sounds@cl.cam.ac.uk
申请实践中值得注意的三点:第一,DTA 需机构法定代表人在场,建议在邮件首封中即附上双方签署人信息以缩短流程;第二,交付经 Google Drive 共享,机构网络若限制云盘访问需提前准备网络方案;第三,收到数据后应先核对包内 Excel 格式说明与本文 §4.1 字段字典的一致性(官方说明为最终依据),再启动特征生产。
§9.2 BibTeX 引用
@inproceedings{xia2021covid19sounds,
title = {COVID-19 Sounds: A Large-Scale Audio Dataset for Digital Respiratory Screening},
author = {Xia, Tong and Spathis, Dimitris and Brown, Chlo{\"e} and Chauhan, Jagmohan and
Grammenos, Andreas and Han, Jing and Hasthanasombat, Apinan and Bondareva, Erika and
Dang, Ting and Floto, Andres and Cicuta, Pietro and Mascolo, Cecilia},
booktitle = {Proceedings of the 35th Conference on Neural Information Processing Systems
Datasets and Benchmarks Track},
year = {2021},
url = {https://neurips.cc/virtual/2021/29829}
}
@article{han2022sounds,
title = {Sounds of COVID-19: exploring realistic performance of audio-based digital testing},
author = {Han, Jing and Xia, Tong and Spathis, Dimitris and Bondareva, Erika and Brown, Chlo{\"e} and
Chauhan, Jagmohan and Dang, Ting and Grammenos, Andreas and Hasthanasombat, Apinan and
Floto, Andres and Cicuta, Pietro and Mascolo, Cecilia},
journal = {npj Digital Medicine},
volume = {5},
pages = {16},
year = {2022},
doi = {10.1038/s41746-021-00553-x}
}
@inproceedings{brown2020exploring,
title = {Exploring Automatic Diagnosis of COVID-19 from Crowdsourced Respiratory Sound Data},
author = {Brown, Chlo{\"e} and Chauhan, Jagmohan and Grammenos, Andreas and Han, Jing and
Hasthanasombat, Apinan and Spathis, Dimitris and Xia, Tong and Cicuta, Pietro and
Mascolo, Cecilia},
booktitle = {Proceedings of the 26th ACM SIGKDD Conference on Knowledge Discovery and Data Mining},
year = {2020},
doi = {10.1145/3394486.3412865}
}
@article{coppock2021covid,
title = {COVID-19 detection from audio: seven grains of salt},
author = {Coppock, Harry and Jones, Lyn and Kiskin, Ivan and Schuller, Bj{\"o}rn},
journal = {The Lancet Digital Health},
year = {2021},
url = {https://www.sciencedirect.com/science/article/pii/S2589750021001412}
}
@article{schuller2022summary,
title = {A summary of the ComParE COVID-19 challenges},
author = {Schuller, Bj{\"o}rn and others},
journal = {Frontiers in Signal Processing},
year = {2022},
url = {https://www.frontiersin.org/article/1058163}
}
@article{xia2022exploring,
title = {Exploring Longitudinal Cough, Breath, and Voice Data for COVID-19 Progression
Prediction via Sequential Deep Learning: Model Development and Validation},
author = {Xia, Tong and others},
journal = {Journal of Medical Internet Research},
volume = {24},
number = {6},
pages = {e37004},
year = {2022},
url = {https://pmc.ncbi.nlm.nih.gov/articles/PMC9217153}
}
@article{truong2022fair4cov,
title = {FAIR4Cov: Fused Audio Instance and Representation for COVID-19 Detection},
author = {Truong, Tuan and Lenga, Matthias and Serrurier, A. and Mohammadi, Sadegh},
journal = {arXiv preprint arXiv:2205.15738},
year = {2022},
url = {https://arxiv.org/abs/2205.15738}
}
@article{bhattacharya2023coswara,
title = {Coswara: A respiratory sounds and symptoms dataset for remote screening of
SARS-CoV-2 infection},
author = {Bhattacharya, Debarpan and Sharma, Neeraj and others and Alagesan, Meenakshi},
journal = {Scientific Data},
year = {2023},
url = {https://www.nature.com/articles/s41597-023-02437-1}
}
@article{budd2024ukcovid,
title = {A large-scale and PCR-referenced vocal audio dataset for COVID-19},
author = {Budd, Jobie and Baker, Kieran and others and Holmes, Chris},
journal = {Scientific Data},
year = {2024},
url = {https://www.nature.com/articles/s41597-024-03187-8}
}
§9.3 引用指南
使用本数据集发表任何成果时,必须引用 Xia et al. 2021(数据集论文);做性能声明时建议同时引用 Han et al. 2022(无偏基准);涉及偏倚与局限性讨论时引用 Coppock et al. 2021 与 Schuller et al. 2022。使用本页面内容时请遵循 qianfanghub.com 的引用规范。
§10 AI 使用声明卡
§10.1 AI 模型列表
- 本页面初稿由大语言模型(千方病案医学编辑部授权的代码生成助手)辅助撰写。
- 页面内代码示例由 AI 生成初稿。
§10.2 AI 参与范围
AI 参与了以下工作:文献事实提取与整理、章节初稿撰写、代码示例编写、表格结构化。AI 未参与:WebSearch 之外的事实裁决、医学与数据工程审核结论、最终发布决定。
§10.3 输入来源列表
- Xia et al., 2021, NeurIPS Datasets and Benchmarks Track. https://neurips.cc/virtual/2021/29829
- Xia et al., 2021, NeurIPS 2021 官方海报. https://xtxiatong.github.io/files/NeurIPs2021.pdf
- Xia et al., 2021, 数据集发布公告. https://www.covid-19-sounds.org/blog/neurips_dataset
- Xia et al., 2020, 早期数据共享公告. https://www.covid-19-sounds.org/es/blog/data_sharing.html
- Brown et al., 2020, KDD 2020. https://doi.org/10.1145/3394486.3412865
- Han et al., 2022, npj Digital Medicine 5:16. DOI 10.1038/s41746-021-00553-x
- Han et al., 2021, arXiv:2106.15523. https://arxiv.org/abs/2106.15523
- 官方应用页面(采集协议). https://www.covid-19-sounds.org/en/app
- Coppock et al., 2021, The Lancet Digital Health. https://www.sciencedirect.com/science/article/pii/S2589750021001412
- Schuller et al., 2022, Frontiers in Signal Processing. https://www.frontiersin.org/article/1058163
- Sharma et al., 2023, Transfer learning for the efficient detection of COVID-19 from smartphone audio data. https://pmid.ncbi.nlm.nih.gov/36741300/
- Xia et al., 2022, Journal of Medical Internet Research 24(6):e37004. https://pmc.ncbi.nlm.nih.gov/articles/PMC9217153
- Truong et al., 2022, arXiv:2205.15738. https://arxiv.org/abs/2205.15738
- OPERA, 2024, NeurIPS Datasets and Benchmarks Track. https://proceedings.neurips.cc/paper_files/paper/2024
- Google Scholar 引用快照(截至 2026-09). https://scholar.google.ae/citations?citation_for_view=VWwUGbkAAAAJ%3ASe3iqnhoufwC&hl=en
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| 规模数字与版本口径(53,449 / 36,116 / 2,106) | 千方病案医学编辑部 | 与官方发布页及 NeurIPS 页面逐项比对 | ✅ 已验证 |
| §2 医学背景与 ICD-11/SNOMED 映射 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §4 DAIMS 数据字典与目录结构 | 千方病案医学编辑部 | 与官方共享包描述对照审核 | ✅ 已通过 |
| §6 预处理 Pipeline 与 8 个坑点 | 千方病案医学编辑部 | 与论文 limitations 及 ComParE 复盘交叉比对 | ✅ 已通过 |
| §7 DAIMS 评分与偏倚矩阵 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 排行榜与引用数表述 | 千方病案医学编辑部 | 与原文及 Scholar 快照交叉比对 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后人工审核日期
2026-09-05
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- icbhi-2017 — 共享标签:生理信号 / 医学影像 / X光影像 / 语音信号
- coughvid — 共享标签:生理信号 / 语音信号 / COVID-19
- bridge2ai-voice — 共享标签:生理信号 / 可穿戴传感 / 语音信号
- midrc-ricord — 共享标签:医学影像 / X光影像 / COVID-19
- coswara — 共享标签:生理信号 / 语音信号 / COVID-19
- saarbrucken-voice-db — 共享标签:生理信号 / 医学影像 / 语音信号
- bimcv-covid — 共享标签:医学影像 / X光影像 / COVID-19
- covid-19-radiography — 共享标签:医学影像 / X光影像 / COVID-19
- stoic — 共享标签:医学影像 / X光影像 / COVID-19
- covidx-cxr — 共享标签:医学影像 / X光影像 / COVID-19
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
