DREAMT (dreamt) — AI-Ready Wikipedia

Duke 大学 Jessilyn Dunn 团队的单晚临床 PSG + Empatica E4 腕式可穿戴时序对齐多模态数据集——100 名睡眠障碍门诊患者、64Hz/100Hz 双目录、30 秒 AASM 分期,CHIL 2024 提出 LSTM 后处理与混合效应提升树集成,PhysioNet 受限访问发布

来源 Empatica E4 腕式可穿戴时序(BVP 64Hz、EDA/TEMP 4Hz、三轴 ACC 32Hz、HR 1Hz、IBI)+ Nihon Kohden 台式 PSG 全通道(EEG×5、EOG×2、颏 EMG、ECG、气流×2、呼吸努力×2、鼾声、腿动×2、SaO2)+ 30 秒 AASM 睡眠分期标签 + participant_info.csv 人口学与睡眠医学指标发布时间: 2026-09-26最后更新: 2026-09-26 阅读 21
DREAMT (dreamt) — AI-Ready Wikipedia

信息速览

数据集名称DREAMT (dreamt) — AI-Ready Wikipedia
数据类型时序信号数据,人工标注,原始数据
规模100 名受试者(每人一夜同步记录;SID 编号 S002-S103 非连续)
接入方式Empatica E4 腕式可穿戴时序(BVP 64Hz、EDA/TEMP 4Hz、三轴 ACC 32Hz、HR 1Hz、IBI)+ Nihon Kohden 台式 PSG 全通道(EEG×5、EOG×2、颏 EMG、ECG、气流×2、呼吸努力×2、鼾声、腿动×2、SaO2)+ 30 秒 AASM 睡眠分期标签 + participant_info.csv 人口学与睡眠医学指标
AI 就绪度

INFOBOX — DREAMT 一屏速览

维度 内容
本质 100 名睡眠障碍门诊患者的单晚临床 PSG + Empatica E4 腕式可穿戴时序对齐多模态数据集
团队 Duke University Jessilyn Dunn 实验室 × DUHS Sleep Disorder Lab;论文 10 作者(一作 Will Ke Wang)
论文 CHIL 2024,PMLR 248:380-396(2024-07-24 出版);标题含"Inequity"——论文名与数据集名不同
人群 年龄 56.2±16.6 岁;BMI 33.7±8.6;女 55/男 45;AHI 22.1±28.7/h;肥胖 68/100、重度 OSA 23/100
双目录 data_64Hz(仅 E4 信号+标签)/ data_100Hz(E4+PSG 全通道,2.0.0 起引入)
标签 30 秒 epoch,技术师按 PSG 标 AASM 分期:W/N1/N2/N3/R + P(准备)+ Missing
核心结果 睡眠起始+清醒检测:F1 0.823±0.019 / AUROC 0.926±0.016 / κ 0.695±0.025
方法 特征工程 + LSTM 后处理 + 混合效应 boosted tree 集成(配套 DREAMT_FE 代码库)
版本 1.0.0(2024-04)→ 2.2.0(2026-06,修复 ACC-PSG 对齐错位);concept DOI 10.13026/dztc-dv77
获取 PhysioNet 受限访问(注册+签 DUA 1.5.0);HF 有非官方镜像(许可张力存照)
生态 PyHealth DREAMTDataset 标准接口;WatchSleepNet 以 DREAMT 为预训练语料
消歧 与 Radha et al. 2021(荷兰 TU/e,多夜,三星手表)的 DREAMT 完全无关(坑 1)
库内互链 sleep-edf(73)、bidmc-ppg(74)、ppg-dalia(202)、isruc-sleep(262)、mros-sleep(292)、mesa-sleep(302)、cinc-2018-sleep(493)

DREAMT 是一个"把可穿戴睡眠追踪的验证数据搬到最需要它的人群"的数据集工程:100 名杜克大学健康系统(DUHS)睡眠障碍门诊的真实患者,在同一张床上同晚戴上 Empatica E4 腕带并连接临床级多导睡眠图(PSG),两条时间线逐样本对齐后发布——可穿戴端是 BVP(PPG 派生)、EDA、皮温、三轴加速度与派生心率/逐搏间期,金标端是 16 路临床通道加睡眠技术师逐 30 秒标注的 AASM 分期。配套论文(CHIL 2024,PMLR 248:380-396)以"Addressing Wearable Sleep Tracking Inequity"为题,直接点出动机:现有可穿戴睡眠分期算法在睡眠障碍人群上不可靠,而公开验证数据恰好稀缺这类人群。

导语读法三则:

  1. 只想下数据:直奔 §5 获取与许可——PhysioNet 受限访问(注册+签 DUA),部分地域有访问限制,HF 非官方镜像存在许可张力,别把镜像当官方渠道引用。
  2. 关心信号与标签:直奔 §3——特别注意 E4 端没有 ECG(心电只在 PSG 端,坑 3),以及 P 标签在两个目录行为不同(坑 5)。
  3. 做模型或复现论文:直奔 §4——论文任务与指标口径、DREAMT_FE 代码库流水线、数据质量自评表三段连读。

关键数字速记卡(全部硬数字一眼版,出处见附录 C 证据链):

组 数字
规模 100 名受试者 × 1 晚;SID S002-S103;文件 204 个(100+100+4)
人群 年龄 56.2±16.6;BMI 33.7±8.6;女 55/男 45;OAHI 19.4±27.5;AHI 22.1±28.7
人群三组 肥胖 68 / 重度 OSA 23 / 兼有 17
通道 E4 端 4 传感器+2 派生;PSG 端 16 路(EEG×5/EOG×2/EMG/ECG/气流×2/努力×2/鼾声/腿动×2/SaO2)
标签 30 秒 epoch;W/N1/N2/N3/R + P + Missing;Missing 涉及 6 人
epoch 常数 64Hz 目录 1920 行/epoch;100Hz 目录 3000 行/epoch
版本 5 版:1.0.0→2.2.0;concept DOI 10.13026/dztc-dv77
论文结果 F1 0.823±0.019;AUROC 0.926±0.016;κ 0.695±0.025
许可 Restricted License 1.5.0 + DUA 1.5.0;IRB #Pro00108961
引用三件套 数据集 DOI + PMLR 248:380-396 + Goldberger 2000

§0 导读:这个数据集解决什么问题

可穿戴睡眠分期有一条隐蔽的"验证盲区"。消费级与医用级腕式设备的睡眠分期算法,大多在健康年轻人或一般人群上验证;而真正每天戴着设备睡觉、又最依赖分期结果做健康判断的,是睡眠障碍患者——肥胖、阻塞性睡眠呼吸暂停(OSA)、不规则睡眠人群。论文背景引述美国约 70 million 成人有睡眠障碍,这个人群的可穿戴分期可靠性恰恰缺少公开数据支撑:临床金标 PSG 记录昂贵(单晚实验室记录、多名技师与设备),而"可穿戴+PSG 同晚对齐"的公开数据集更是稀缺,已有的要么人群健康、要么可穿戴通道单薄。

DREAMT 的回答是"单晚同床对齐"。2022 年 5 月至 9 月,100 名 DUHS 睡眠障碍门诊患者在睡眠实验室完成一夜同步记录:约 20:00 入住、左手腕佩戴 E4,约 23:00 护士启动 PSG,自然睡醒后双设备同时停用。发布时给出双目录:data_64Hz 只含 E4 信号与睡眠标签(统一重采样 64Hz,面向纯可穿戴建模);data_100Hz 含 E4+PSG 全通道(统一 100Hz,面向跨模态研究)。标签是睡眠技术师按 PSG 做的 30 秒 AASM 分期,另有受试者级临床指标(AHI、BMI、平均血氧等)随 participant_info.csv 发布。

它的第二个价值是把"不公"变成可测量的研究对象。论文标题里的 Inequity 指的是:睡眠追踪技术的验证人群与受益人群错位——算法在健康人身上调优,却用在患者身上。DREAMT 把 100 名真实患者(肥胖占 68%、重度 OSA 占 23%)的金标对齐数据开放出来,让"算法在疾病人群上到底行不行"从直觉变成可复现实验。CHIL 2024 论文给出的特征工程基线(F1 0.823±0.019、AUROC 0.926±0.016、κ 0.695±0.025,睡眠起始与清醒检测任务)就是这条研究线上的第一个公开参照点。

§0 读法三则:

  1. 这个条目是"数据集+方法论文+代码库"三合一:本体在 PhysioNet(受限访问),方法在 PMLR 论文,工程在 GitHub DREAMT_FE——三者许可与获取方式各不相同(§5)。
  2. 全文人口学硬数字(年龄/BMI/性别/68-23-17 三组)均经 participant_info.csv 独立复算并与 PhysioNet v2.2.0 页面口径核对一致;正文与官方文档的分歧处(肥胖人数表述、引用版本滞后)已在坑 2 与坑 8 存照。
  3. 检索时注意同名消歧:Radha et al. 2021 在 Scientific Data 发表的 DREAMT(荷兰 TU/e,多夜,三星手表)与本条目完全无关(坑 1),论文正式标题也不含"DREAMT"字样——两套名字都要搜。

§1 数据集速览:十问十答

Q1:DREAMT 是什么、规模多大?
Duke 大学发布的单晚 PSG+可穿戴时序对齐多模态数据集:100 名 DUHS 睡眠障碍门诊患者,每人一夜同步记录(E4 腕带+台式 PSG)。受试者编号 SID 从 S002 到 S103——非连续、无 S001(坑 6)。

Q2:记录了哪些信号?
E4 可穿戴端:BVP 64Hz(PPG 派生血容量脉搏)、EDA 4Hz、TEMP 4Hz、三轴 ACC 32Hz、HR 1Hz、IBI 逐搏间期。PSG 临床端:EEG×5、EOG×2、颏 EMG、ECG、气流×2(PTAF/FLOW)、呼吸努力×2(胸带/腹带)、鼾声、腿动×2(左右胫前肌)、SaO2。注意:ECG 只在 PSG 端,E4 端没有心电(坑 3)。

Q3:睡眠分期标签怎么来的?
由睡眠技术师对照 PSG 记录、每 30 秒一个 epoch 按 AASM 标准标注:W(清醒)/N1/N2/N3(NREM 1-3 期)/R(REM),另有 P(PSG 正式开始前的准备阶段)与 Missing(无标签)。

Q4:人群画像什么样?
年龄 56.2±16.6 岁、BMI 33.7±8.6 kg/m²、女 55/男 45、OAHI 19.4±27.5/h、AHI 22.1±28.7/h;肥胖或重度肥胖(BMI≥30)68 人,重度 OSA(AHI>30/h)23 人,其中兼肥胖者 17 人——三组数字经 CSV 独立复算与官方页面一致(坑 2 存照旧版页面的歧义表述)。

Q5:文件怎么组织?
每受试者两份 CSV:data_64Hz/SID_whole_df.csv(仅 E4 信号+睡眠标签,统一 64Hz);data_100Hz/SID_PSG_df.csv(E4+PSG 全通道,统一 100Hz)。根目录另有 participant_info.csv(10 字段人口学/临床表)、Metadata.txt、SHA256SUMS.txt、LICENSE.txt。

Q6:配套论文做了什么?
CHIL 2024(PMLR 248:380-396):以睡眠起始与清醒检测为任务,提出 LSTM 后处理与混合效应 boosted tree 集成两件套,F1 0.823±0.019、AUROC 0.926±0.016、Cohen’s κ 0.695±0.025;配套 DREAMT_FE 特征工程代码库开源。

Q7:现在怎么拿到数据?
PhysioNet 受限访问:注册账号、签署 Restricted DUA 1.5.0 并遵守 License 1.5.0 后访问;抓取时点部分地域出现"Data is not available in your region"提示。HuggingFace 有非官方镜像(v2.1.0 口径),正式引用一律以 PhysioNet 为准(§5.4)。

Q8:版本现状如何?
五个版本:1.0.0(2024-04-30,仅 data_64Hz)→ 1.0.1(2024-09-13)→ 2.0.0(2025-02-05,引入 data_100Hz)→ 2.1.0(2025-04-30)→ 2.2.0(2026-06-02,修复 ACC 与 PSG 对齐错位)。官方引用文本仍写 version 2.1.0——引用前先定版本口径(坑 4/坑 8)。

Q9:它和别的"DREAMT"是什么关系?
没有关系。Radha et al. 2021(Scientific Data)的 DREAMT 是荷兰 TU/e-Philips-Samsung 系的多夜 PSG+三星手表数据集,与本条目(Duke、单晚、Empatica E4、PhysioNet DOI 10.13026/*)完全无关;第三方代码库已出现两者引用混挂的实例(坑 1)。

Q10:为什么它对 AI-Ready 重要?
它是"金标对齐+受限访问"档位的代表样本:版本化 DOI、SHA256SUMS 校验、PyHealth 标准接口让工程接入顺畅;但访问门槛(DUA)、地域限制与非官方镜像的许可张力,使它的 AI-Ready 得分呈现"工程质量高、可获取性受限"的典型割裂——这正是受限访问数据集质检的标准案例(§6)。

§2 数据构成与规格

2.1 规模、人群与招募

DREAMT 的规模口径非常干净:100 名受试者(unique participants)× 每人一夜同步记录,不多也不少。participant_info.csv 实测恰为 100 数据行,SID 编号从 S002 到 S103。

属性 口径
受试者数 100(participant_info.csv 实测 100 行)
编号范围 S002-S103(非连续,无 S001——坑 6)
每人记录数 1 晚(E4 与 PSG 同步)
采集地点 DUHS(Duke University Health System)Sleep Disorder Lab
采集窗口 2022 年 5 月至 9 月
入选标准 无特别设定——面向来诊的疑似睡眠障碍人群自然采样
招募节流 受设备数量限制,每晚最多招募 4 人

两点值得展开。其一,"无入选标准"是刻意的:数据集要的就是门诊真实流量的样子,而不是筛选后的均衡样本——这直接决定了它的人群画像(2.3)向肥胖与 OSA 倾斜。其二,"每晚最多 4 人"是硬件约束(实验室同时挂接的可穿戴设备有限),这也解释了 100 人采集为何需要铺满整个夏天。

2.2 单晚采集流程与两台设备

单晚流程是一条固定时间线:

时点(约) 事件
20:00 受试者入住睡眠实验室
入住后 知情同意,左手腕佩戴 Empatica E4(Empatica Inc., Milano, Italy;Software Version: Summer 2019)
23:00 护士启动 PSG 记录
夜间 双设备连续记录,自然睡醒
06:00 前后 醒后 E4 与 PSG 同时停用,采集结束

PSG 端设备为 Nihon Kohden Polysmith 1004(version 11)Data Management System——光电台式多导睡眠图系统,即临床睡眠实验室的标准配置,而非便携式家庭睡眠监测。这意味着 PSG 端通道的完整度是"实验室级"的(§3.2),金标成色足。

E4 是消费-医用级交叉的四传感器腕带(PPG/EDA/温度/加速度),DREAMT 用它做"可穿戴侧"的代表机型——选择 E4 而非手表类设备的好处是原始信号通道齐全(尤其 EDA 与高采样率 PPG),缺点是与大众佩戴的主力设备(手表/手环)仍有形态差异,外推到消费级产品时要注意这一层(§8.1)。

2.3 人口统计与临床画像

PhysioNet v2.2.0 页面口径,且全部经 participant_info.csv 独立复算核对一致:

指标 数值
年龄 56.2 ± 16.6 岁
BMI 33.7 ± 8.6 kg/m²
女性 / 男性 55 / 45(CSV 实测 F=55, M=45)
OAHI(氧减饱和指数) 19.4 ± 27.5 /h
AHI(呼吸暂停低通气指数) 22.1 ± 28.7 /h(AHI < 5 /h 视为健康)
肥胖或重度肥胖(BMI ≥ 30) 68 人
重度 OSA(AHI > 30 /h) 23 人
重度 OSA 中兼肥胖者 17 人

三组关键数字(68/23/17)的复算口径:BMI≥30 计肥胖、AHI>30/h 计重度 OSA,与 v2.2.0 页面表述完全吻合。需要特别存照的是 v2.1.0 页面曾写作"17 were obese or severely obese",省略了"重度 OSA 中"的限定语——若按字面误读为"全人群仅 17 人肥胖",与实测 68 人相差 4 倍(坑 2)。本条目全文按 68/23/17 口径。

标准差本身就是信息:AHI 与 OAHI 的标准差(28.7/27.5)大于均值,说明人群从健康到重度 OSA 高度分散——这正是论文想要的"真实门诊分布",也是使用者在做子群分析时的分层依据(肥胖/OSA 严重度两个轴都显著)。

诊断分布方面,第三方转述口径(都灵理工 2025 学位论文对 DREAMT 的整理)为:呼吸障碍 66%、嗜睡 20%、健康对照 9%、不宁腿综合征 2%、失眠 2%。PhysioNet 官方页面未给逐类百分比——引用这组数字必须注明转述来源,或退而使用 participant_info.csv 的 MEDICAL_HISTORY 与 Sleep_Disorders 字段自行统计(坑 9)。

2.4 文件组织:双目录结构

数据集以"每受试者一个文件"的原则组织成两个平行目录(Metadata.txt 口径,经 HF 镜像实测核对):

dreamt/
├── data_64Hz/                    # 仅 E4 信号 + 睡眠标签(统一重采样 64Hz)
│   ├── S002_whole_df.csv
│   ├── S003_whole_df.csv
│   └── ...(每受试者一个文件)
├── data_100Hz/                   # E4 + PSG 全通道(统一 100Hz;PSG 原始 200Hz 降采样)
│   ├── S002_PSG_df.csv
│   ├── S003_PSG_df.csv
│   └── ...(每受试者一个文件)
├── participant_info.csv          # 100 行 × 10 列人口学/临床表
├── Metadata.txt                  # 数据字典与采集说明(注意内有 "GEDNER" 笔误,坑 7)
├── SHA256SUMS.txt                # 全量文件校验和(完整性验证用)
└── LICENSE.txt                   # PhysioNet Restricted Health Data License 1.5.0

两个目录的分工与陷阱:

  1. data_64Hz 是"纯可穿戴"视图:只含 E4 六通道(加派生 HR/IBI 与时间戳)+ Sleep_Stage 标签列,适合"只用可穿戴做分期"的主线任务。注意 IBI 与 HR 在 E4 内部采样率不同(逐搏事件 vs 1Hz),统一重采样到 64Hz 后的插值行为是使用者需要自查的细节。
  2. data_100Hz 是"金标对齐"视图:E4+PSG 全通道合并,PSG 原始 200Hz 降采样到 100Hz。适合跨模态研究(如用 PSG 导出更细粒度标签、研究 PPG 形态与呼吸事件的关系)。
  3. 两个目录的标签列不完全同构:P(准备阶段)标签在 data_64Hz 保留,在 data_100Hz 被记为 W——想拼接两目录或迁移标签时必须处理这一差异(坑 5)。
  4. 时间戳平移自 0 起:隐私保护处理;除重采样外对原始数据无任何预处理——干净,但也意味着日间时间信息(就寝时刻等)不可恢复。

SHA256SUMS.txt 约 200 余行校验和(实测 19,541 字节),下载后务必先验完整性再进管线——这对受限访问数据集尤其重要,因为再获取成本高(重新走 DUA 流程)。

2.5 participant_info.csv:十个字段的人口学-临床表

字段 类型 含义与用法提示
SID string 受试者编号(S002-S103,非连续)
AGE 数值 入组年龄(均值 56.2±16.6)
GENDER 类别 F/M(实测 F=55, M=45);注意 Metadata.txt 文档里字段名写作"GEDNER",以 CSV 实际表头为准(坑 7)
BMI 数值 kg/m²(均值 33.7±8.6;≥30 计肥胖,共 68 人)
OAHI 数值 氧减饱和指数(19.4±27.5 /h)
AHI 数值 呼吸暂停低通气指数(22.1±28.7 /h;>30 计重度 OSA,共 23 人)
Mean_SaO2 数值 平均血氧饱和度(逐人数值见 CSV,官方页面未给汇总统计)
Arousal Index 数值 微觉醒指数(逐人数值见 CSV)
MEDICAL_HISTORY 文本 既往史自由文本(统计诊断分布的原始依据)
Sleep_Disorders 文本 睡眠障碍诊断自由文本

这张表是 DREAMT 做"标签外任务"的支点:官方建议用例里"从可穿戴数据预测 AHI 等健康结局",预测目标就取自 OAHI/AHI 列;无监督子群发现(OSA 严重度 × 年龄 × 性别)的分群轴也全部来自此表。PyHealth 的 DREAMTDataset 甚至把 AHI 等字段做成了事件级直取接口。

2.6 版本演进:一条"先可穿戴、后金标"的发布线

版本 发布日期 关键变化 DOI
1.0.0 2024-04-30 首发:仅 data_64Hz(仅 E4 信号+睡眠标签,无 PSG 波形) (concept 系)
1.0.1 2024-09-13 维护性修订 (concept 系)
2.0.0 2025-02-05 引入 data_100Hz(E4+PSG 合并对齐版)——PSG 波形自此进入数据集 (concept 系)
2.1.0 2025-04-30 数据更新(Release Note 全文被页面截断,仅见 “Updated the data in…”) 10.13026/7r9r-7r24
2.2.0 2026-06-02 修复 ACC 与 PSG 数据对齐错位 10.13026/3f7y-2d80

concept DOI:10.13026/dztc-dv77(始终指向最新版)。三条使用纪律:

  1. 引用可穿戴分期结果时注版本:1.0.x 时代的结果不涉及 PSG 波形,与 2.x 的实验不可直接混比。
  2. 加速度计相关分析必须用 ≥2.2.0:2.2.0 之前的 ACC 与 PSG 存在对齐错位——任何"可穿戴活动度 vs PSG 睡眠结构"的跨模态结论在旧版本上都不可靠。
  3. 官方引用文本滞后:PhysioNet/PyHealth/HF 镜像的引用模板仍写 “(version 2.1.0)”,与最新版 2.2.0 不一致——按需选择口径并全篇统一(坑 8)。

2.7 规模与体量的工程账:text-format CSV 的现实

文件清单构成可以复算:data_64Hz 100 份 + data_100Hz 100 份 + 根目录 4 件 = 204 个文件,与 SHA256SUMS.txt 的"约 200 余行校验和"(实测 19,541 字节)吻合——这本身就是文件数口径的交叉验证。

工程维度 口径与建议
体量档位 HF 镜像 size_categories 标注 100M<n<1B(官方端文件体积因地域限制未逐个实测)——百 MB 到 GB 级,单机可容纳
内存放大 CSV 文本格式读入 pandas 后内存占用显著放大(尤其 64Hz/100Hz 的高行频时序列);建议显式指定 dtype(float32),或按受试者惰性加载
格式转换 一次性转 Parquet/Arrow 可提速数倍并保留列式裁剪能力;转换前后用 SHA256SUMS 锁定源文件、转换后自校验行数与列和,形成可审计的转换链
并行策略 每受试者一文件,按 SID 分片天然并行;共享内存/多进程时避免整库载入
文本字段 MEDICAL_HISTORY 与 Sleep_Disorders 为自由文本——是结构化数值之外的 NLP 机会面(受试者级表型抽取),也是解析脆弱点(分词/缩写因人而异)

一个容易被忽略的细节:两个目录同一受试者的行数不同(同一时长、64Hz vs 100Hz 行频),按"行数"对齐两个目录是错误操作——对齐媒介永远是 TIMESTAMP 与 30 秒 epoch 结构,不是行号。

2.8 人群画像的三种读法

同一张人口学表,不同使用者应读出不同的东西:

  1. 做分期模型的人:68/23/17 是分层变量而非描述性脚注。设计评测时按肥胖×OSA 严重度做分层子集报告(如"重度 OSA 子集的 F1"),全池平均会掩盖算法在重度人群上的塌陷——这正是 DREAMT 区别于健康人群数据集的核心价值。
  2. 做临床/人群研究的人:均值±SD 只是摘要。逐人分析以 participant_info.csv 的行为单位;MEDICAL_HISTORY/Sleep_Disorders 是自由文本,统计诊断构成前需要先做编码/清洗(这也是官方页不直接给逐类百分比的原因之一,坑 9)。
  3. 做数据集对比的人:与开放健康人群数据集对比时,把人群差异当自变量而非噪声——"同一模型在两边的分数差"本身就是"人群错位"效应的测量(§4.1 的实验化)。

一句提醒:AHI/OAHI 的标准差大于均值(28.7/27.5 vs 22.1/19.4),分布右偏明显——做参数化统计检验前先看分布形态,必要时用非参数方法或对数变换。

§3 信号通道与标注体系

3.1 E4 可穿戴端:四传感器六通道 + 两派生

data_64Hz 目录(与 data_100Hz 的 E4 部分)的信号通道如下:

通道 原生采样率 单位/量纲 物理来源与用途
BVP 64 Hz 相对单位(无量纲) 光体积描记(PPG)派生的血容量脉搏——可穿戴端的主信号,心率/HRV/血管张力研究的入口
EDA 4 Hz μS(微西门子) 皮电活动——交感张力指标,与觉醒/应激事件相关
TEMP 4 Hz °C 红外皮温——昼夜节律与外周血管调节的观测窗口
ACC_X / ACC_Y / ACC_Z 32 Hz 1/64 g(三轴) 三轴加速度——体动/体位/活动量,睡眠-觉醒运动学证据
HR 1 Hz bpm 由 BVP 派生的心率(非独立传感器)
IBI 逐搏事件 ms 逐搏间期(inter-beat interval)——HRV 分析的原始素材,同样由 BVP 派生
TIMESTAMP (记录列) s 平移自 0 起的相对秒(隐私处理)
Sleep_Stage 每 30 s 类别 AASM 分期标签(§3.3)

PPG 科普一段(初学者向):BVP 反映的是每次心跳引起的微血管血液容积变化,波形上的每个搏动对应一次心脏射血。它与心电(ECG)是"果与因"的关系——ECG 记录心肌电活动,PPG 记录电活动触发的机械-容积效应。因此 E4 上没有 ECG 不代表没有心跳信息:心率、HRV 都能从 BVP/IBI 派生,但心电图形态学诊断(ST 段、心律失常分型)无法用 BVP 替代——把 DREAMT 当"心电数据集"用是常见错误(坑 3)。

ACC 单位为 1/64 g 的三轴量纲,是 E4 固件的原始计数口径;做体动积分或与 PSG 体位导联对照时注意换算。2.2.0 版本修复了 ACC 与 PSG 的对齐错位——凡涉及 ACC 的分析务必使用最新版(坑 4)。

3.2 PSG 临床端:实验室级完整通道

data_100Hz 目录中 PSG 部分的通道(PhysioNet v2.2.0 页面完整口径):

类别 通道 数量 备注
脑电(EEG) C4-M1, F4-M1, O2-M1, T3-CZ, CZ-T4 5 AASM 蝶骨/乳突参考导联组合,覆盖额/中央/枕区
眼电(EOG) E1, E2 2 REM 与 N1 判读的关键证据
肌电(EMG) CHIN(颏下) 1 REM 肌张力弛缓判读
心电(ECG) 单导联 1 心电只在此端(坑 3)
呼吸气流 PTAF(压力式)+ FLOW(温度式) 2 双原理互证,呼吸暂停/低通气判定主证据
呼吸努力 THORAX(胸带)+ ABDOMEN(腹带) 2 区分中枢性/阻塞性事件
鼾声 SNORE 1 OSA 辅助证据
腿动 LAT / RAT(左/右胫前肌 EMG) 2 周期性肢体运动(PLMS)判读
血氧 SAO2 1 脉搏氧饱和度 [%],氧减事件判定

16 路通道覆盖 AASM 全套判读证据(脑电/眼电/肌电/心电/呼吸/腿动/血氧),配合技术师分期,构成完整的"金标闭环"——不仅分期标签可信,连分期依据本身都在数据里,支持做标签质量审计、规则复刻(如复算 AHI)与半监督利用。

PSG 原始采样 200Hz,发布时统一降采样到 100Hz。对 EEG/EOG/EMG 而言 100Hz 够用(AASM 判读与主流深度模型输入常用 100/128Hz);但若研究目标是高频 EEG 形态(棘波、纺锤波精细形态学),降采样后的数据不再适用——这是"统一 100Hz"便利性的代价。

3.3 睡眠分期标签:30 秒 epoch 的 AASM 体系

标签 含义 占位说明
W Wake 清醒 含 PSG 记录内清醒段
N1 NREM 1 期 浅睡/过渡期
N2 NREM 2 期 睡眠纺锤与 K-复合波特征期
N3 NREM 3 期 慢波深睡
R REM 快速眼动期
P Preparation 准备阶段 PSG 正式开始前的准备段——data_64Hz 保留 P;data_100Hz 将 P 记为 W(坑 5)
Missing 无标签 仅 2 名受试者因夜间 PSG 重新安装各有约 15 分钟连续 Missing;另 4 名各 1 个 Missing epoch

三个工程要点:

  1. 技术师标注而非算法标注:分期由睡眠技术师对照 PSG 逐 epoch 判定,这是临床金标的定义;它继承人类判读的固有变异(不同技术师间 κ 有上限),但也继承了临床一致性。
  2. epoch 对齐方式:Sleep_Stage 列每 30 秒给出一个标签,与信号列时间对齐;data_64Hz 中表现为每 1920 行一个标签值(64Hz×30s),data_100Hz 中每 3000 行一个(100Hz×30s)——按行数切 epoch 前先确认重采样后的实际行频。
  3. P 段的处置策略:P 段是 PSG 启动前的准备期(受试者尚未正式入睡记录)。主流做法是从训练与评测中剔除 P 段与 Missing 段;若用 data_100Hz,P 已并入 W,直接"剔除 W 首部"会误伤——两个目录的清洗逻辑必须分开写(坑 5)。

3.4 Missing 的分布与含义

Missing 标签的量级很小但值得如实记录:2 名受试者因夜间 PSG 重新安装(电极脱落等临床常见事件)各有约 15 分钟连续无分期段;另 4 名各有 1 个孤立 Missing epoch。对全数据集而言这是可忽略的噪声(约占总时长千分之一以下),对单受试者实验(SII 分析、逐人报告)则是必须处理的边界条件——按 SID 过滤时别假设每人的有效记录都完整无缝。

3.5 通道-设备归属速查:一张表终结"ECG 在哪"的争议

信号 E4 可穿戴端 PSG 临床端 常见误引
BVP/PPG ✓(64Hz) — 把 BVP 说成 PSG 通道
EDA ✓(4Hz) — —
皮温 TEMP ✓(4Hz) — —
三轴 ACC ✓(32Hz) — —
HR / IBI ✓(BVP 派生) — 把 HR 当独立传感器
EEG — ✓(×5) —
EOG — ✓(×2) —
颏 EMG — ✓ —
ECG —(无) ✓ 把 ECG 列为 E4 信号(坑 3)
气流/呼吸努力/鼾声/腿动 — ✓ 把呼吸信号说成可穿戴端
SaO2 — ✓ E4 无血氧探头

这张表的出处是 PhysioNet v2.2.0 页面的通道清单与 Metadata.txt;任务描述等二手材料中"PPG/ECG/加速度计/呼吸"混列为可穿戴信号的写法,均以本表为准绳(坑 3)。

3.6 重采样与对齐的工程含义:发布形态背后的取舍

DREAMT 的发布形态(两个统一采样率的目录)是"便利性换精度"的典型设计,使用者需要清楚每一层重采样做了什么:

层 原始形态 发布形态 工程含义
BVP 64Hz(E4 原生) 64Hz / 100Hz 原生保真;100Hz 目录中被上采样到 100Hz——插值不创造新信息
EDA / TEMP 4Hz(E4 原生) 64Hz / 100Hz 被插值扩展 16/25 倍——数值变"密"不等于分辨率提升;做皮肤电响应(SCR)检测等精细分析时应意识到有效分辨率仍是 4Hz
ACC 32Hz(E4 原生) 64Hz / 100Hz 插值扩展;体动计数类特征在重采样后与原生口径有差异
HR 1Hz(派生) 64Hz / 100Hz 阶梯状信号的插值扩展——别把插值出的"中间心率"当测量值
IBI 逐搏事件(不等间隔) 64Hz / 100Hz 事件流被栅格化为连续列——HRV 精细分析(pNN50、频域)应回推逐搏口径而非用重采样列
PSG 全通道 200Hz(NK 原生) 仅 100Hz 高频 EEG 形态学不适用(§3.2);常规分期判读无碍
Sleep_Stage 每 30s 一个标签 同左(随行数密度换算位置) 切 epoch 前按目录确认行频(1920 vs 3000 行/epoch)

三条使用纪律:

  1. "统一采样率"是打包口径,不是测量口径。任何声称"XX Hz 精度分析"的结论,都应回查该通道的原生采样率表(§3.1)——插值列只适合方便对齐,不适合当物理测量。
  2. 跨目录数值不完全可比。同一受试者的 BVP 在 64Hz 与 100Hz 目录中理应同源,但插值路径不同;严格实验锁定一个目录做全程。
  3. 时间戳平移自 0。跨受试者的绝对时刻(就寝钟点等)不可比、不可恢复;记录长度本身是可用的相对信息(总卧床时长)。

3.7 与库内可穿戴数据集的通道对照

把 DREAMT 放进库内可穿戴条目的通道光谱(细节以各条目为准),能看清它的差异化位置:

数据集(库内条目) 可穿戴/传感器侧 参照金标 与 DREAMT 的互补点
DREAMT(本条目) Empatica E4 腕带(PPG/EDA/TEMP/ACC+派生) 实验室 PSG 全通道+技术师分期 临床患者×多通道腕带×金标对齐
ppg-dalia(rid 202) 胸带多生理+腕式 E4 系设备 胸部 ECG(心参考) 日常活动场景、心参考口径;无 PSG 分期金标
bidmc-ppg(rid 74) 床旁监护 PPG 同步 ECG ICU 场景的 PPG-ECG 对;无睡眠分期标签
mhealth / pamap2 多部位 IMU/体戴传感 活动标签(无生理金标) 活动识别任务;体动通道更重,无 PSG
sleep-edf(rid 73) 主动监测型记录(历史设备) PSG 经典分期数据但人群健康、通道少
shhs 家庭睡眠监测(无腕带多通道) 家庭 PSG 大规模队列,人群与规模互补

读表要点:DREAMT 的稀缺性不在"有 PPG"(ppg-dalia/bidmc-ppg 都有),也不在"有 PSG 分期"(sleep-edf/shhs 都有),而在**"腕带多通道(含 EDA 与皮温)+ 实验室 PSG 全通道 + 技术师分期"三者同时成立且逐样本对齐**——满足这一组合的公开数据集,在患者人群上此前基本空缺。

3.8 分期标签的人类因素:技术师判读意味着什么

DREAMT 的标签由睡眠技术师对照 PSG 逐 epoch 判读。这对使用者有双重含义:

  1. 金标不是"物理真值"而是"专家共识口径"。睡眠分期是人类判读任务,不同技术师对 N1/N2 边界、觉醒 vs 清醒的判定存在固有变异(文献中技术师间 κ 通常显著低于 1)。DREAMT 单一实验室标注保证了内部一致性,但把它的标签当成"绝对真值"来苛求模型 100% 匹配是范畴错误——模型匹配的是"这批技术师的判读风格"。
  2. 标签噪声是可利用的信息而非纯缺陷。边界模糊 epoch(W↔N1、N2↔N3 过渡带)上的"错误"很多是判读分歧的自然产物;半监督/弱监督方法可以把 epoch 间连续性先验与边界不确定性显式建模——这正是论文 LSTM 后处理的直觉所在(§4.3),也是后续研究的空间。

工程建议:报告与 DREAMT 分期的一致性时,同时给出 κ 与混淆矩阵(哪个边界在出错);把性能上限的参照系设为"人-人一致性"而非 1.0。

3.9 “30 秒 epoch” 的由来与工程常数

30 秒是全行业睡眠分期的标准颗粒度——从纸带时代的判读页到现代数字判读软件,epoch 尺寸沿袭至今。对 DREAMT 的工程含义是三个可直接写进代码的常数:

常数 data_64Hz data_100Hz
行频 64 Hz 100 Hz
epoch 行数 64 × 30 = 1920 100 × 30 = 3000
单受试者 epoch 数 记录时长(秒)/30,随人而异 同左

两点边界注意:其一,epoch 边界对齐应从记录起点起算并整除切分——若首尾存在不足一个 epoch 的余数段(含 P/Missing 剔除后),余数段的处理(丢弃/保留)要写入实验配置并全库一致;其二,库内部分经典数据集时代存在 20 秒 epoch 口径的老记录,跨数据集训练时先统一 epoch 尺寸再做标签对齐,否则"epoch 级指标"不可比。

§4 论文核心发现:从不公叙事到基线方法

4.1 动机:"睡眠追踪不公"的三层论证

论文标题直陈主题——Addressing Wearable Sleep Tracking Inequity(应对可穿戴睡眠追踪的不公)。其论证链条分三层:

  1. 人群错位:美国约 70 million 成人有睡眠障碍(论文背景引述),现有可穿戴睡眠分期算法主要在健康/一般人群上训练与验证;算法在睡眠障碍、不规则睡眠人群上的表现缺乏系统证据。
  2. 数据缺口:公开数据集中"睡眠障碍患者 + 可穿戴多通道 + PSG 金标对齐"的组合稀缺——已有的可穿戴睡眠数据要么人群健康,要么只有单通道(如仅 PPG 或仅加速度)。
  3. 后果:依赖可穿戴分期的下游应用(睡眠健康报告、OSA 筛查、远程监护)在患者人群中给出不可靠读数,而患者恰恰是最需要这些读数的人群。

DREAMT 的定位由此明确:它不是"更大的可穿戴睡眠数据集",而是"被现有数据集系统性遗漏的那类人群"的对照资产。100 人、单中心、门诊真实分布——规模不大,但人群画像(肥胖 68/100、重度 OSA 23/100)正是缺口本身。

4.2 任务定义:睡眠起始与清醒检测

论文的评测任务不是"五期全分类"而是两个临床关键点:睡眠起始(sleep onset)与清醒(wakefulness)检测。这个选择有明确的临床理由:睡眠潜伏期(入睡时长)与夜间清醒量是睡眠医学的核心绩效指标(与 AHI、用药评估直接相关),也是消费级设备最常被挑战的两个读数。对使用者而言要注意:论文报告的 F1/AUROC/κ 属于这两个二值化任务口径,不能直接与文献中"五期分期 accuracy"横比——任务不同、类不平衡结构不同(§4.6)。

4.3 方法两件套

论文在特征工程基线上叠加两个可组合的组件:

  1. LSTM 后处理:在小样本设置下,用 LSTM 建模 epoch 间的时间连续性——睡眠分期有强时序结构(不会从 N3 直接跳到 W 再秒回 N3),序列后处理能把逐点分类的孤立错误"抹平"到时序一致的输出。
  2. 混合效应 boosted tree 集成(ensembling mixed-effects boosted trees):把影响分类表现的组间差异(受试者个体效应——如 BMI、AHI 带来的信号形态差异)作为随机效应显式建模,用 boosted tree 集成承载。直觉是:100 人里有 100 种"信号长相",与其假设一个全局模型通吃,不如让模型显式学习"这个人偏离平均多少"。

配套开源代码库 DREAMT_FE(GitHub WillKeWang/DREAMT_FE,初始提交 2024-04-23、最后提交 2024-06-28)把流水线拆成四段:read_raw_e4.py(读取 E4 原始数据、对齐睡眠标签与 AHI 等绩效指标)→ feature_engineering.py(时域/频域特征)→ datasets.py / models.py(训练与评估)。名字里的 FE 即 feature engineering——这条流水线是"经典特征+浅层模型"路线的完整参考实现,对算力受限团队尤其友好。

4.4 结果指标

指标 数值 任务口径
F1 0.823 ± 0.019 睡眠起始与清醒检测
AUROC 0.926 ± 0.016 同上
Cohen’s Kappa 0.695 ± 0.025 同上

三个数字的读法:

  • ±号是标准差(跨受试者/折的变异量度),不是置信区间也不是标准误——复现比较时用同口径。
  • AUROC 0.926 说明"区分睡/醒"在该人群上判别力较强;κ 0.695 落在"相当一致(substantial)"档(κ 0.61-0.80 的经典 Landis-Koch 分档)——注意 κ 对类不平衡敏感,睡眠数据中清醒占比低会天然压低 κ,两种指标合读才完整。
  • 这是特征工程基线而非 SOTA 声明:论文的公开价值在"数据集+可复现起点",后续深度模型(含同组 WatchSleepNet,§7.3)在这条基线之上继续推进。

4.5 数据质量自评:quality_score_per_subject.csv

DREAMT_FE 仓库额外提供 quality_score_per_subject.csv——每受试者的信号伪影百分比表。这是很少见的"数据集自带质检报告"设计:使用者在做受试者级划分、异常检测或加权训练时,可以直接把伪影率作为先验权重,而不必重新做信号质量评估。对多中心复用者,这也是"如何为自己的数据集附质检层"的模板样本。

4.6 统计卫生:引用这组数字的四条守则

  1. 任务口径先行:F1 0.823 是"睡眠起始+清醒检测"口径。别把它写成"分期准确率";与五期分类文献横比时注明任务差异。
  2. 人群口径先行:这是 AHI 22.1±28.7、肥胖 68% 的门诊人群,不是健康志愿者。同一算法在 Sleep-EDF 类健康人群上的分数通常更高——差异本身是研究信号,不是实现错误。
  3. 版本口径先行:论文发表于 2024 年(数据集 1.0.x 时代,无 PSG 波形发布);论文实验走的是 data_64Hz 口径。用 data_100Hz 复现并加入 PSG 通道后,数字没有可比性义务。
  4. 别拿基线当上限:混合效应 boosted tree 是论文方法主张的载体;深度模型、跨受试者泛化协议、个性化微调都是开放的后续空间——引用时写"CHIL 2024 报告的基线"而非"DREAMT 的最优成绩"。

4.7 从 epoch 分类到夜间指标:下游链条的两级评测

epoch 级输出不是研究的终点。把 epoch 分类结果沿"夜"聚合,可以得到睡眠医学真正消费的指标:

层级 任务 输入 输出 DREAMT 的支撑
L1 epoch 级 分期/起始/清醒检测 30s 信号窗 逐 epoch 标签 data_64Hz/100Hz + 分期标签(论文基线所在层)
L2 夜级指标 睡眠潜伏期、睡眠效率、觉醒次数、各期占比 全夜 epoch 序列 每晚一组数值 由 L1 输出聚合;真值由技术师分期聚合可得
L3 受试者级结局 从可穿戴预测 AHI/BMI 关联等 夜级指标或原始信号 受试者级回归/分箱 participant_info.csv 的 AHI/OAHI/Mean_SaO2/BMI

两级评测的纪律:

  1. L1 好不等于 L2 好。epoch 准确率高的模型,聚合出的睡眠效率仍可能系统性偏移(边界 epoch 的误差在分母效应下放大)——报告下游指标时直接在"夜"层面评估,别用 epoch 指标代言。
  2. L3 的样本量是 100。受试者级结局预测的统计功效有限——这是数据集的规模天花板,报告时给置信区间、做 bootstrap,别把单次划分的相关系数当稳定结论。
  3. 层级间信息量单调递减是常态。可穿戴信号对 L1(睡/醒)信息充分、对 L3(AHI 精确值)信息稀薄——AHI 的判定本质需要呼吸事件级证据,这恰是"从可穿戴预测 AHI"被列为官方开放用例而非已解决问题的方式。

4.8 复现基线的最短路径清单

从零到"论文口径数字"的最短路径(每步的口径依据见括号):

  1. 环境与依赖:以 DREAMT_FE 仓库 README 为准装依赖,锁定 commit(仓库最后提交 2024-06-28,后续不再动,锁定成本低)。
  2. 数据版本:复现论文基线选 data_64Hz(论文实验口径,§4.6 守则 3);版本号与 SHA256 写进实验记录。
  3. 抽查对齐:任选 1 名受试者,把 BVP 波形与 Sleep_Stage 标签画在同一条时间轴上,肉眼确认 epoch 边界与标签对齐(§3.9 常数:1920 行/epoch)。
  4. 清洗:剔除 P/Missing;确认每人的有效 epoch 数(Missing 涉及 6 人,§3.4)。
  5. 特征工程:先单人跑通 feature_engineering.py,再全量并行(按 SID 分片)。
  6. 标签重构:把多分类分期按论文任务定义二值化(睡眠起始/清醒检测,§4.2)。
  7. 划分:受试者级(LOSO 或分块留出),禁止行级随机划分(Q39)。
  8. 报告:F1/AUROC/κ±SD,注明任务口径、人群口径、版本口径三件套(§4.6)。

走完这条路径约需数小时级工作量(不含下载与 DUA 等待)——DREAMT_FE 的存在把"复现起点"的成本压到库内数据集的最低一档。

§5 获取与许可:受限访问的门怎么进

5.1 PhysioNet 受限访问流程

步骤 内容
1 在 physionet.org 注册账号(实名+机构信息)
2 阅读并签署 PhysioNet Restricted Health Data Use Agreement 1.5.0(DUA)
3 遵守 PhysioNet Restricted Health Data License 1.5.0:数据仅限本人研究使用、不得再分发原始数据、不得试图识别受试者
4 在项目页(physionet.org/content/dreamt/)点击访问申请,获批后可下载
5 引用规范:数据集引用 + DREAMT 论文 + PhysioNet 平台引用(Goldberger et al. 2000, Circulation 101(23):e215-e220, RRID: SCR_007345)三件套

这不是"注册即下"的开放档,而是 PhysioNet 三档体系(open / restricted / credentialed)中的 restricted 档:门槛低于 credentialed(不需要提交训练证明),但显著高于 CC 类开放数据。伦理侧:采集经 Duke Health IRB 批准(#Pro00108961),受试者书面知情同意并明确授权去标识数据共享;公开数据中所有直接标识符移除、时间戳平移。

5.2 版本与 DOI 速查

需要引用时 用哪个
指向"数据集本身"(任何版本) concept DOI:10.13026/dztc-dv77
指向 2.1.0(官方引用模板口径) 10.13026/7r9r-7r24
指向 2.2.0(最新版,含 ACC 修复) 10.13026/3f7y-2d80
指向论文 PMLR 248:380-396(proceedings.mlr.press/v248/wang24a.html)

官方 README/PyHealth/HF 镜像的引用文本均为 “Wang, K., Yang, J., Shetty, A., & Dunn, J. (2025). DREAMT (version 2.1.0). PhysioNet. doi:10.13026/7r9r-7r24”——与最新版 2.2.0 脱节(坑 8)。引用建议:方法学论文引 2.2.0(或 concept DOI);复现 2024 论文基线时引 1.0.x 并注明。

5.3 地域限制存照

抓取时点(2026-09-26)在本环境直接访问 PhysioNet 文件树返回 “Data is not available in your region due to legal or policy restrictions.”——PhysioNet 受限数据对部分地域有法律/政策性访问限制。影响有三:① 部分团队需自备合规网络环境或通过合作机构获取;② 文件级浏览(files 页)在受限地域不可用,元数据仍可经内容页获取;③ 任何"从镜像绕过地域限制"的做法都同时踩 DUA 与地域限制两条线,不建议。本条目对文件树结构的记录来自 HF 镜像与官方页面元数据的交叉核对。

5.4 HuggingFace 非官方镜像:许可张力存照

属性 口径
repo bsaenz/dreamt(非官方)
版本口径 v2.1.0
gated false(无门禁直下)
lastModified 2026-03-25
downloads 382(抓取时点)
体量档 100M<n<1B
内容 data_64Hz / data_100Hz / participant_info.csv / Metadata.txt / SHA256SUMS.txt / LICENSE.txt
tags timeseries / health / sleep-staging / wearables / physionet / medical

张力点:PhysioNet restricted 数据的 DUA 明确禁止再分发原始数据;HF 上 gated=false 的镜像与该条款存在冲突风险——无论上传者是否属于授权再分发,使用镜像都无法获得 DUA 下的合规地位。工程上可以用它预览结构、校验管线,正式研究请走 PhysioNet 流程并引用官方 DOI。上传者身份(bsaenz)与 Duke 团队的关系未在页面声明——按非官方镜像对待(§10 坑 9 一并存照)。

5.5 生态接口:PyHealth 标准加载类

PyHealth(医疗 AI 开源框架)提供 pyhealth.datasets.DREAMTDataset:支持 1.0.0/1.0.1/2.0.0/2.1.0 版本目录结构(抓取时点文档口径,2.2.0 是否已适配需自查)、stats() 概览与事件级字段访问(可直接取 AHI 等指标)。对工程团队的意义:不必手写 CSV 解析与 epoch 对齐逻辑,且能与其他 PyHealth 数据集(MIMIC 系、eICU 系等)共享数据处理范式。

# PyHealth 加载示意(版本支持以官方文档为准)
from pyhealth.datasets import DREAMTDataset

dataset = DREAMTDataset(
    root="path/to/dreamt",        # PhysioNet 下载并解压后的目录
    version="2.1.0",              # 目录结构版本口径
)
dataset.stats()                    # 受试者数/记录概览
# AHI 等受试者级指标可经事件级接口直取

5.6 PhysioNet 生态位:restricted 档为什么是生理信号数据的常态

理解 DREAMT 的获取门槛,需要把它放回 PhysioNet 的三档制度:open(注册即下)、restricted(注册+签署 DUA 后访问,本条目所在档)、credentialed(额外资质审核,如 MIMIC-IV 类临床库)。生理信号数据落在 restricted/credentialed 是结构性常态而非保守选择:

  1. 波形本身可唯一化个体。PPG/EEG/心形信号的研究表明其生物识别潜力——即使移除直接标识符,波形组合仍可能指纹化受试者,因此平台以合同(DUA)而非纯许可约束使用。
  2. DUA 是法律承诺而非道德倡议。禁止再分发、禁止重识别、违规追责——这是 HF 上出现"非官方镜像"时平台与机构必须严肃对待的原因(§5.4)。
  3. 引用规范是生态的一部分。PhysioNet 要求"数据集+论文+平台(Goldberger 2000)"三件套引用,本质是把数据贡献纳入学术激励体系。

对 AI-Ready 评估者的启示:工程完备度与访问制度要解耦打分。DREAMT 的文档、校验、版本管理、代码库都是高分项,restricted 门槛是制度属性——把两者混在一个分数里,会错杀一批"制度严但质量高"的数据集,也会漏掉"开放但文档稀烂"的反例。本条目的 DAIMS 表(附录 B)即按此解耦原则打分。

5.7 DUA 合规的日常操作清单

签署 DUA 不是终点,日常使用中维持合规的最低操作集:

  1. 签署记录存档:签署账号、日期、DUA 版本号(1.5.0)写入项目合规档案——团队交接与审计时的第一份材料。
  2. 访问最小化:原始数据只放在必要成员可及的存储位;新成员接入走项目内授权流程,不共享个人账号。
  3. 再分发红线:原始 CSV(任何目录、任何子集)不进代码仓、不进附件、不进网盘分享链接——可分享的是派生物(特征、模型权重、聚合统计),且派生前确认 DUA 对派生物的条款边界。
  4. 论文与报告:引用三件套(数据集 DOI+论文+Goldberger 2000);致谢按 PhysioNet 当期要求执行。
  5. 项目结束处置:按机构数据保留政策处置本地副本;注销不再需要的访问授权。
  6. 镜像纪律:任何"从 HF 镜像取数"的行为只限管线预览,正式实验与发表一律用 PhysioNet 下载副本(§5.4)。

这份清单的通用性大于本条目:库内所有 restricted/credentialed 档数据集的日常合规操作结构相同,差别只在 DUA 条款细节。

§6 AI-Ready 评估:工程质量高、可获取性受限的典型割裂

6.1 库内 AI-Ready 检查单

  • 机器可读元数据:良好。PhysioNet 结构化内容页(版本/通道/用例)+ Metadata.txt 数据字典 + participant_info.csv 十字段表 + SHA256SUMS 完整性清单——四层文档齐全。扣分项:Metadata.txt 内字段名笔误 “GEDNER”(坑 7),自动化解析以 CSV 表头为准。
  • 公开直链:缺失(受限访问)。AI-Ready 最大失分项:DUA 签署前无任何直链;HF 非官方镜像存在且无门禁,但合规地位存疑——不能计入官方可获取性。
  • 许可明确性:明确但严。License 1.5.0 + DUA 1.5.0 文本公开、条款清晰(不得再分发/不得重识别/限研究用);"严"不扣分,但"地域限制"使名义许可与实际可及出现缺口。
  • 可复现性:优秀。版本化 DOI(concept+版本双轨)、SHA256SUMS、官方代码库 DREAMT_FE 全流水线开源、论文开放获取(PMLR)——从论文到数据的复现链条完整。
  • 文档自洽:两处瑕疵已存照。v2.1.0 页面肥胖人数表述歧义(坑 2)、官方引用文本版本滞后(坑 8);均不影响主线数据质量。

综合评级:AI-Ready 等级"中"(6.6/10,DAIMS 全表见附录 B)。画像与库内"纯注册墙"数据集不同:它的差距不在文档或工程,而在访问制度——这正是 PhysioNet restricted 档数据集的共性,也是库内生理信号条目里与开放档(如 sleep-edf 类)对照的基准点。

6.2 库内可获取性光谱对照

档位 库内参照 本条目对应
注册+签约(restricted/credentialed 型) PhysioNet restricted 系 本体(DUA 1.5.0)
注册墙 LMC2 型(注册+审批) —
平台托管 Zenodo 型 —
Registry 收录 AWS Registry 型 —
公开直链 HF/Zenodo 直链型 仅非官方 HF 镜像(合规地位存疑)

定位:DREAMT 落在光谱最严一侧的温和端——门槛是"注册+自签署 DUA"而非"逐案审批",且有 PyHealth 接口与官方代码库兜底工程成本。对检索者的含义:按"能否立刻下载"过滤时本条目不命中;按"文档完备度+可复现性"过滤时它是受限档里的优等生——两种过滤口径下归属不同,收录价值正在于此。

6.3 评分语义说明:与公开直链条目怎么比

DAIMS 的"中"(6.6/10)放在公开直链条目旁边该怎么读?三条语义约定:

  1. 分数不可跨制度直接排序。公开直链条目的 A 分(如 8-9)反映"零门槛可复现",DREAMT 的 A 分(4)反映"合规门槛+地域缺口"——两者是不同制度下的量纲,排序只在同制度内有意义。
  2. I/M/S 维度可跨制度横比。文档完备度、格式通用性、版本管理是制度无关的工程属性——DREAMT 在这三维上高于库内多数开放条目,这正是"工程质量高、可获取性受限"画像的含义。
  3. 条件变化会整体改写评分。若 PhysioNet 将其降档为 open(或官方镜像上线),A 升至 8+、综合评级进入"高"档;维护触发点已列入附录 K。

因此本条目在库内的正确用法不是"综合分排行榜的一行",而是受限档的质量基准点:任何 PhysioNet restricted 系数据集入库时,文档/复现/版本三个维度都可与 DREAMT 对表。

§7 生态与衍生:一个数据集的三条扩散路径

7.1 PyHealth:进入医疗 AI 标准工具箱

pyhealth.datasets.DREAMTDataset 把 DREAMT 纳入 PyHealth 数据集全家桶(与 MIMIC 系、eICU 等同列):统一加载接口、跨版本目录适配(文档口径支持 1.0.0-2.1.0)、stats() 概览与事件级字段访问(AHI 等指标直取)。这是 DREAMT “AI-Ready” 成色最直接的证明——发布不到一年即被主流医疗 ML 框架收编,工程接入成本被第三方标准化。

7.2 学术复用:跨设备泛化与课程级实验

  • 都灵理工(Polito)2025 学位论文:把 DREAMT 与 Corsano 手环数据并用做跨设备泛化睡眠分期——DREAMT 在其中扮演"E4 端金标对齐源"角色,验证模型从一种腕带迁移到另一种腕带的可行性。该论文同时给出了 DREAMT 诊断分布的第三方转述口径(呼吸障碍 66%/嗜睡 20%/健康对照 9%/不宁腿 2%/失眠 2%,坑 9)。
  • 马里兰大学(UMD)2025 capstone 项目:用 DREAMT 训练决策树/神经网络/RNN 做 30 秒 epoch 分期——数据集作为课程级实验平台的样本。
  • HF 社区热度:非官方镜像 downloads 382(2026-09-26 抓取),属低热度精确工具而非爆款——与 PhysioNet restricted 的获取门槛一致,引用与复用以学术圈为主。

7.3 同组后续:WatchSleepNet 与用例扩展

PhysioNet v2.2.0 页面的 Use Cases 节列出三条官方建议路线:

  1. WatchSleepNet(同组后续工作):以 DREAMT 为预训练语料学习可穿戴通用表征,再增强下游睡眠分期——数据集从"评测对象"升级为"表征学习的语料"。
  2. 健康结局预测:从可穿戴数据预测 AHI 等睡眠医学指标(目标取自 participant_info.csv),即"用腕带筛查 OSA"的技术底座。
  3. 无监督子群发现:按 OSA 严重度 × 年龄 × 性别做聚类/子群分析——人口学表与高占比患者人群使这一路线有意义(健康人群数据集做不出这种分层)。

7.4 在睡眠分期数据集景观中的位置

与库内睡眠/可穿戴条目的定性对照(细节以各条目为准):

数据集(库内条目) 人群定位 可穿戴侧 与 DREAMT 的差异轴
sleep-edf(rid 73) 健康年轻人为主+少量老年人 主动监测型记录 经典前辈;人群健康、通道较少
SHHS(库内 shhs) 社区大型队列 家庭睡眠监测 规模碾压但无腕式多通道可穿戴
mros-sleep(rid 292)/ mesa-sleep(rid 302) 队列子集(老人/多种族) 家庭 PSG 为主 大规模+临床深度,非腕带对齐设计
isruc-sleep(rid 262) 临床疑似 OSA 人群 少量便携记录 同为临床人群,可穿戴通道不同
cinc-2018-sleep(rid 493) 挑战赛混合人群 — 挑战赛协议 vs 观察型数据集
ppg-dalia(rid 202)/ bidmc-ppg(rid 74) 健康青年/生命体征 PPG 单通道为主 PPG 深度 vs DREAMT 的多模态广度
mhealth / pamap2(库内目录) 活动识别人群 多部位 IMU 体动为主,无 PSG 金标
DREAMT(本条目) 睡眠障碍门诊(肥胖 68%/重度 OSA 23%) E4 四传感器+派生 临床患者 × 腕带多通道 × PSG 全通道同晚对齐

定位一句话:DREAMT 不是规模玩家,而是人群缺口玩家——在"临床睡眠障碍患者 + 腕式可穿戴全通道 + PSG 金标同晚对齐"的三元组合上,它是库内目前最纯粹的代表。

7.5 两种引用姿态:评测对象 vs 预训练语料

DREAMT 在文献中已经被以两种不同姿态使用,引用时先想清楚自己属于哪一种:

  1. 评测对象姿态:“我的算法在 DREAMT(版本 X)上取得 Y”——数据是测试基准,引用数据集 DOI+版本号,报告口径对齐 §4.6 守则(任务口径/人群口径/版本口径)。
  2. 预训练语料姿态(WatchSleepNet 路线):“我用 DREAMT 预训练表征再迁移到 Z”——数据是原料而非考场,此时版本敏感度更高(预训练见过 2.2.0 修复前的错位 ACC,下游迁移时会带入系统性偏差),且应披露预训练/下游的受试者级划分(防受试者泄漏)。

两种姿态的检查清单不同:前者查"评测协议是否可比",后者查"数据边界是否隔离"——混用是可穿戴睡眠文献里最常见的可复现性事故来源。

7.6 引用画像:三种引用姿势与三种事故

DREAMT 在文献中的引用可归为三种姿势,各有对应的高频事故:

姿势 正确做法 高频事故
数据集引用 Wang, K., Yang, J., Shetty, A., & Dunn, J. + PhysioNet DOI(版本口径自选,坑 8) 照抄模板把 2.1.0 当最新版;DOI 与版本不匹配
论文引用 全题(含 Inequity)+ PMLR 248:380-396 只搜"DREAMT"漏检论文;把论文标题当数据集名
数据+论文双引 受限访问数据集的规范姿势(PhysioNet 三件套另加 Goldberger 2000) 只引论文不引数据集 DOI——受限数据的可追溯性要求更高,别省

另有一个镜像场景的事故:在 HF 镜像下载后引用 HF repo 名(bsaenz/dreamt)——镜像不是数据集的正式身份,正式引用永远是 PhysioNet DOI(§5.4)。

§8 方法学启示:四条可迁移的经验

8.1 "金标-可穿戴同晚对齐"是稀缺资产,值得专门设计

DREAMT 的核心工艺不是算法而是实验设计:同一晚、同一人、双设备同步、发布时逐样本时间对齐。大量"可穿戴睡眠数据集"实际是可穿戴记录+次日问卷或手环自带分期,金标缺失;另一类有 PSG 但可穿戴端通道单薄。同晚对齐的成本(每晚限 4 人的硬件约束、整个夏天的采集窗口)恰恰说明它为何稀缺。可迁移的判断标准:凡声称"金标对齐"的数据集,先查三件事——设备型号与固件版本是否披露(E4: Summer 2019)、对齐方式是否有声明(DREAMT 在 Metadata.txt 明示)、金标设备是否实验室级(Nihon Kohden 台式机)。

8.2 "不公叙事"作为数据集设计动机的可复制模板

论文把"人群错位"写成标题级主张(Inequity),并把它操作化为可测量的东西:高肥胖占比、高 OHI/AHI 分布的 100 人对照集。这个模板可复制到其他"验证人群≠受益人群"的领域——可穿戴心律监测之于老年房颤人群、语音 Biomarker 之于构音障碍人群。数据集论文的差异化竞争力不一定在规模,而在"为被遗漏的人群建对照"。

8.3 版本化修复的正面样本(与负面教训同框)

2.2.0 修复 ACC-PSG 对齐错位是数据集生命周期管理的正面样本:问题被明确声明(Release Note 一句话)、版本号递进、DOI 分轨。但另一面是教训链:2.2.0 之前所有涉及 ACC 的跨模态分析都埋着错位风险,而官方引用文本至今停在 2.1.0(坑 8)——"修复"与"引用口径更新"并不同步。可迁移的纪律:引用受限访问且多版本的数据集时,把"版本号+发布日期"写进实验记录,别依赖 README 的引用模板。

8.4 经典特征工程在"小样本+强先验"场景仍有位置

论文选择"特征工程+LSTM 后处理+混合效应提升树"而非端到端深度学习,与 100 人规模、时序强先验(分期连续性)、个体差异强(混合效应)三重约束自洽。对数据集使用者的启示:拿到 DREAMT 先跑 DREAMT_FE 基线建立参照系,再上深度模型——没有参照系的深度模型数字在该人群上无法解释(§4.6 守则 4)。

8.5 受试者级变异:三种处理范式的取舍

DREAMT 的 100 人×1 夜结构让"受试者间变异"成为绕不开的设计变量。三种主流处理范式各有适用面:

范式 做法 优点 风险/代价
混合效应(论文路线) 个体效应作随机效应显式建模 小样本稳健、可解释 需要特征工程层;新受试者接入需重估
跨受试者泛化(LOSO) 留一受试者/分块留出训练测试 直接回答"换人行不行" 分数显著低于混合划分——这是特性不是缺陷
个性化/校准 首晚数据校准后微调 单人性能上限最高 每用户冷启动成本;多夜数据缺失(DREAMT 每人仅 1 晚)限制其在本库内的验证

对使用者的纪律:报告结果时必须写明属于哪种范式——"跨受试者协议下的 0.75"与"混合划分下的 0.85"没有可比性;用 DREAMT 做基准时优先 LOSO 型划分(每人 1 晚,受试者级划分天然无泄漏),并把 68/23/17 的人群结构作为分层依据做分层抽样。

8.6 数据集论文写作的三个可借鉴样本

DREAMT 论文与配套发布里,有三个值得数据集工程借鉴的写作/发布决策:

  1. 把动机操作化进数据构成。"Inequity"不是 引言里的口号,而是落进 100 人的构成(肥胖 68/100、重度 OSA 23/100)——主张与数据互证。反面样本是"动机写患者人群、数据却是健康志愿者"的常见错位。
  2. 数据质量自评作为附属产出。quality_score_per_subject.csv 把"我们的信号质量如何"从 FAQ 变成数据文件——使用者可直接消费,评估者可直接核查。成本极低(逐人算伪影率),收益是把质疑前置化解。
  3. 修复用 Release Note 一句话声明。2.2.0 的"Fixed the issue of misalignment in ACC and PSG data."是版本说明的合格线:改了什么、影响哪些分析,一目了然。不合格的写法是"bug fixes and improvements"式黑箱——使用者无从判断旧结论是否失效。

三条共同的底层原则:数据集的公信力来自"可核查性"而非"无瑕疵"——把质量与缺陷都摆在明面上,是 AI-Ready 时代数据发布的正确姿势。

§9 与库内条目的关系

9.1 家族图谱

  • sleep-edf(rid 73):可穿戴+PSG 睡眠研究的经典前辈(人群健康)。DREAMT 补的是它的反面——临床患者人群+现代多通道腕带;两篇同读构成"健康-患者"人群谱系的两端。
  • SHHS(库内 shhs):大型家庭 PSG 队列。规模与人群广度是 DREAMT 的数十倍,但无腕式多通道对齐设计;跨数据集训练(SHHS 预训练+DREAMT 校准)是文献里常见的组合拳。
  • mros-sleep(rid 292)/ mesa-sleep(rid 302):队列衍生 PSG 睡眠条目(老年男性/多种族队列)。与 DREAMT 共享"临床深度",差异在可穿戴侧通道与对齐设计。
  • isruc-sleep(rid 262):同为疑似 OSA 临床人群的 PSG 数据集;DREAMT 的差异点是 E4 腕带侧的多模态完整性。
  • cinc-2018-sleep(rid 493):挑战赛形态的睡眠分期数据;协议化评测 vs DREAMT 的观察型采集。
  • ppg-dalia(rid 202)/ bidmc-ppg(rid 74):PPG 信号家族。DREAMT 的 BVP 64Hz 是 PPG 睡眠应用的金标对齐实例;做 PPG 形态学研究时可互为参照。
  • mimic-iv-ecg(rid 172):ECG 归属对照——MIMIC-IV-ECG 是纯心电库,而 DREAMT 的心电在 PSG 端、腕带端只有 PPG;两条目并读可厘清"ECG vs PPG"的信号学边界(坑 3)。
  • mhealth / pamap2(库内目录):可穿戴多模态活动识别数据集(IMU 为主、无 PSG)。DREAMT 与它们共享"多传感器腕戴/体戴"形态,差异在标签体系(AASM 分期 vs 活动类别)与临床深度。

9.2 检索路径建议

  • 检索词组合:“DREAMT” + “Empatica E4” 或 “PhysioNet”;引论文时用全题 “Addressing Wearable Sleep Tracking Inequity”——注意论文标题不含 DREAMT 字样(§0 读法 3)。
  • 若目标是复现论文基线:GitHub DREAMT_FE(特征工程流水线)+ data_64Hz(论文实验口径)。
  • 若目标是跨模态/金标对齐研究:直接用 data_100Hz(≥2.2.0 版本,避免 ACC 错位,坑 4)。
  • 若目标是"可穿戴筛查 OSA":participant_info.csv 的 AHI/OAHI/Mean_SaO2 列是预测目标,E4 通道是输入——PyHealth 接口可省一层胶水代码。

9.3 组合使用场景三则

  1. "大规模预训练+患者人群校准"双数据集管线:在 shhs/sleep-edf 类大规模 PSG 数据上预训练分期模型,再在 DREAMT 上做患者人群校准与报告——这条管线把"规模"与"人群缺口"两个互补资产串起来,是 §4.1 不公叙事的直接工程化。注意两端的标签体系对齐(30s epoch+AASM 是共同语言)与可穿戴通道差异(SHHS 端无腕带多通道)。
  2. "ECG vs PPG"信号学教学对照:用 mimic-iv-ecg(rid 172,纯心电库)与 DREAMT(ECG 在 PSG 端、腕带端 PPG)并读,把"心电=电活动、PPG=机械-容积效应"的边界讲透——适合课程与新人训练场景(坑 3 的正面用法)。
  3. 跨设备 PPG 泛化实验:ppg-dalia(日常活动、心参考)与 DREAMT(睡眠、PSG 参考)分别代表 PPG 的两种参照系与两种场景;同一 PPG 特征集在两边的表现差异,本身就是"场景-参照-设备"三因素交互的可复现实验设计。

三则场景共同的纪律:跨数据集组合时,把各数据集的版本号、许可条款、划分协议分别存档——组合实验的可复现性由最弱一环决定。

9.4 互链实现提示

按库内互链机制(category_tags 计算相关度)的取值,本条目的 4 个标签(生理信号/睡眠信号/可穿戴传感/评测基准)覆盖的相邻域:

  • 睡眠信号直连:sleep-edf(73)、isruc-sleep(262)、mros-sleep(292)、mesa-sleep(302)、cinc-2018-sleep(493)、shhs——分期家族互链面。
  • 可穿戴传感直连:mhealth、pamap2、ppg-dalia(202)——体戴传感家族互链面。
  • 生理信号广域:bidmc-ppg(74)、mimic-iv-ecg(172)——信号类型家族(PPG/ECG 对照)互链面。
  • 评测基准:本条目可作"受限访问档基准数据集"的参照点被方法类条目引用。

反向链接期待:分期家族与可穿戴家族条目在讨论"人群缺口/患者人群验证"或"PPG 睡眠应用"时应链向本条目;本条目已在 §9.1/§9.3 正向覆盖对方。

§10 避坑清单:九个已踩过的坑

坑 1:同名"DREAMT"消歧。Radha et al. 2021 在 Scientific Data 发表的 DREAMT(“A multi-night dataset…”)是荷兰 TU/e-Philips-Samsung 系的多夜 PSG+三星手表数据集,与本条目(Duke、单晚、Empatica E4、PhysioNet DOI 10.13026/*)完全无关。第三方 GitHub 项目(如 DreamSense)已出现把两者引用混挂的实例。检索认准三要素:Duke / Empatica E4 / DOI 前缀 10.13026。

坑 2:肥胖人数双口径。v2.1.0 页面写 “17 were obese or severely obese”(省略限定语);v2.2.0 澄清为"68 were obese or severely obese (BMI ≥ 30)。Among the 23 participants who had severe OSA (AHI > 30 /h), 17 were obese or severely obese"。participant_info.csv 复算 68/23/17 与 v2.2.0 一致。按字面误读 v2.1.0 会把肥胖人数低估 4 倍——本条目全文按 68/23/17。

坑 3:ECG 归属。任务描述与部分二手材料把"PPG/ECG/加速度计/呼吸"混列为可穿戴信号;实际 ECG 仅在 PSG 端,E4 端为 BVP(PPG)/EDA/TEMP/ACC 及派生 HR/IBI。把 DREAMT 当"心电数据集"引用是硬伤;ECG 相关研究请转向 PSG 通道或库内 mimic-iv-ecg(172)。

坑 4:版本内容漂移。1.0.x 无 PSG 波形(仅 data_64Hz);data_100Hz 自 2.0.0(2025-02-05)引入;2.2.0(2026-06-02)修复 ACC 与 PSG 对齐错位。引用旧版本结果不注版本号、或用 <2.2.0 做 ACC 跨模态分析,都会产出不可靠结论。

坑 5:P 标签行为不一致。P(准备阶段)标签在 data_64Hz 保留原义,在 data_100Hz 被记为 W——两目录的标签列不能直接拼接或互相迁移;清洗逻辑(剔除 P/W 首部)必须按目录分别实现。

坑 6:SID 非连续。受试者编号 S002-S103、无 S001,实测恰 100 行。按 SID 数值范围推算人数、按编号哈希划分训练/测试集,都会引入偏差或误判——划分前先枚举实际 SID 列表。

坑 7:Metadata.txt 字段名笔误。文档内字段名写作 “GEDNER”,participant_info.csv 实际表头为 GENDER。自动化解析以 CSV 实际表头为准,勿按文档硬编码字段名。

坑 8:官方引用口径滞后。PhysioNet/PyHealth/HF 镜像的引用模板均写 “(version 2.1.0)” 与 doi:10.13026/7r9r-7r24,而最新版已是 2.2.0(doi:10.13026/3f7y-2d80)。按需求选版本口径(复现论文基线 vs 使用最新数据)并全篇一致。

坑 9:诊断分布数字为第三方转述 + 非官方镜像。66%/20%/9%/2%/2% 的诊断分布出自 Polito 学位论文的转述表,PhysioNet 官方页未列逐类百分比——引用须注转述来源,或用 MEDICAL_HISTORY/Sleep_Disorders 字段自行统计。同理,HF bsaenz/dreamt 镜像非官方(gated=false,v2.1.0 口径),与 restricted DUA 的再分发禁令存在张力——预览可用,正式引用一律走 PhysioNet。

§11 总结

11.1 三句话总结

  1. DREAMT 用 100 名睡眠障碍门诊患者的"单晚 E4+PSG 同床对齐"数据,把可穿戴睡眠分期算法最缺的验证人群(肥胖 68/100、重度 OSA 23/100)变成公开资产——数据不大,缺口不小。
  2. 双目录设计(data_64Hz 纯可穿戴 / data_100Hz 金标全通道)让"只用腕带做分期"与"跨模态金标研究"两条主线各取所需;30 秒 AASM 技术师分期 + 受试者级 AHI/BMI 表构成完整金标闭环。
  3. CHIL 2024 论文以特征工程基线(F1 0.823±0.019 / AUROC 0.926±0.016 / κ 0.695±0.025)给出可复现起点,PyHealth 接口与 DREAMT_FE 代码库把工程成本压到最低——但 PhysioNet restricted 访问与地域限制是绕不开的制度性门槛。

11.2 适合谁

  • 可穿戴睡眠分期团队:需要"金标对齐+患者人群"的训练/验证集,尤其是健康人群数据集上分数虚高后的对照实验。
  • PPG/信号处理研究者:BVP 64Hz 与 PSG 呼吸/血氧/分期同晚对齐,是研究 PPG 形态-呼吸事件-睡眠结构的稀缺素材。
  • 睡眠医学数据工程师:participant_info.csv 的 AHI/OAHI/Mean_SaO2 支撑"可穿戴筛查 OSA"类结局预测任务;PyHealth 接口即取即用。
  • 数据集方法论研究者:版本化修复(ACC 对齐)、自带质检表(quality_score_per_subject.csv)、不公叙事的操作化——三个方法学样本集于一身。

11.3 不适合谁

  • 需要大规模数据做端到端深度学习预训练的团队(100 人单晚,量级不够;预训练路线请看同组 WatchSleepNet 的用法)。
  • 需要 ECG 可穿戴信号或高频 EEG 形态学研究的项目(E4 无 ECG;PSG 已降采样至 100Hz)。
  • 需要多夜数据刻画个体内变异、或健康对照组分析的项目(每人仅一夜;健康对照占比很低且官方未给逐类诊断百分比)。
  • 无法签署 DUA 或所在地域受 PhysioNet 访问限制的团队(先确认合规路径再规划管线)。

11.4 30 秒决策卡

你的情况 行动
要复现论文基线 PhysioNet 下 1.0.x/2.x 的 data_64Hz + GitHub DREAMT_FE 流水线(§4.3)
要做跨模态/金标研究 下 ≥2.2.0 的 data_100Hz(避免 ACC 错位,坑 4);PSG 通道表见 §3.2
要做"腕带筛 OSA" participant_info.csv 取 AHI/OAHI 目标列 + PyHealth DREAMTDataset(§5.5)
在健康人群数据集上出了高分 先跑 DREAMT 对照实验再下结论——人群错位是它的存在理由(§4.1)
要引用数据集 concept DOI 10.13026/dztc-dv77 或指定版本 DOI;官方模板停在 2.1.0(坑 8)
检索到别的"DREAMT" 先过坑 1 消歧三要素:Duke / Empatica E4 / DOI 10.13026.*

FAQ(高频问答 66 问)

A. 基础认知

Q1:DREAMT 是缩写还是单词?
缩写:Dataset for Real-time sleep stage EstimAtion using Multisensor wearable Technology——“用多传感器可穿戴技术做实时睡眠分期估计的数据集”。注意缩写里刻意嵌了 DREAM(梦)的谐音。

Q2:谁做的?
Duke University(杜克大学)Jessilyn Dunn 实验室联合 DUHS(Duke University Health System)Sleep Disorder Lab。论文 10 位作者:Will Ke Wang、Jiamu Yang、Leeor Hershkovich、Hayoung Jeong、Bill Chen、Karnika Singh、Ali R Roghanizad、Md Mobashir Hasan Shandhi、Andrew R Spector(DUHS 睡眠医学临床端)、Jessilyn Dunn。PhysioNet 资源页署名为 Ke Wang、Jiamu Yang、Ayush Shetty、Jessilyn Dunn。

Q3:发表在哪里?
数据集在 PhysioNet(受限访问);论文在 CHIL 2024(Conference on Health, Inference, and Learning,2024-06-27/28,Cornell Tech),PMLR 248:380-396,2024-07-24 出版。论文标题是 “Addressing Wearable Sleep Tracking Inequity: A New Dataset and Novel Methods for a Population with Sleep Disorders”——标题不含 DREAMT,检索要双线。

Q4:数据集论文标题里的"Inequity"指什么?
指验证人群与受益人群的错位:可穿戴睡眠分期算法主要在健康人群上验证,却最常被睡眠障碍患者使用。DREAMT 用 100 名门诊患者(肥胖 68/100、重度 OSA 23/100)的金标对齐数据补这个缺口。

Q5:规模多大?
100 名受试者、每人一夜同步记录。SID 编号 S002-S103(非连续、无 S001,坑 6)。

Q6:采集时间与地点?
2022 年 5 月至 9 月,DUHS 睡眠障碍实验室(单中心)。因可穿戴设备数量限制,每晚最多招募 4 人。

Q7:伦理合规情况?
Duke Health IRB 批准(#Pro00108961),受试者书面知情同意并明确授权去标识数据共享;公开数据移除全部直接标识符、时间戳平移自 0 起。

Q8:和 Radha et al. 2021 的 DREAMT 什么关系?
没有关系,纯属同名。Radha 版是荷兰 TU/e 团队的多夜 PSG+三星手表数据集;本条目是 Duke 的单晚 PSG+Empatica E4 数据集。第三方代码库已有混挂引用实例(坑 1)。

Q9:开源吗?
数据本身是"受限开放":签署 DUA 后可获取,但禁止再分发。代码(DREAMT_FE)在 GitHub 开源;论文在 PMLR 开放获取。HF 上的非官方镜像不改变数据的 restricted 属性。

Q10:最大的卖点一句话?
"算法在健康人身上验证、在患者身上使用"的错位,第一次有了公开的金标对照数据来测量。

B. 数据与获取

Q11:怎么下载?
physionet.org 注册账号 → 阅读并签署 PhysioNet Restricted Health Data DUA 1.5.0 → 在项目页申请访问 → 获批后下载。整个流程线上完成,但不是"注册即下"。

Q12:数据有多少文件?
每受试者两份 CSV(data_64Hz/SID_whole_df.csv 与 data_100Hz/SID_PSG_df.csv,各 100 份)+ 根目录 participant_info.csv、Metadata.txt、SHA256SUMS.txt、LICENSE.txt。

Q13:data_64Hz 和 data_100Hz 选哪个?
只做可穿戴分期 → data_64Hz(论文实验口径);做跨模态/金标对齐研究 → data_100Hz(≥2.2.0,含 PSG 全通道且修复了 ACC 错位)。两个目录标签行为不同(P 标签,坑 5)。

Q14:PSG 原始采样率是多少?
PSG 原始 200Hz,发布时统一降采样到 100Hz。常规睡眠分期研究够用;高频 EEG 形态学(棘波/纺锤波精细形态)不适用。

Q15:数据做过什么预处理?
除重采样(64Hz/100Hz 统一)与时间戳平移(自 0 起,隐私)外无任何预处理——原始信号直接发布,好处是无隐藏加工,代价是使用者自己做滤波/伪影处理(可参考 quality_score_per_subject.csv 的伪影率)。

Q16:数据完整性怎么验证?
下载后先对 SHA256SUMS.txt(约 200 余行校验和)跑校验再进管线——受限数据重新获取成本高,别省这一步。

Q17:能用于商业项目吗?
默认不能。Restricted License 1.5.0 限研究用途、禁止再分发原始数据;商用需另行确认授权路径。HF 非官方镜像不受 DUA 保护,用它不产生合规地位。

Q18:部分地域打不开 PhysioNet 文件页怎么办?
抓取时点确有地域限制提示(“Data is not available in your region”)。合规路径是自备合规网络环境或经合作机构获取;不要从非官方镜像绕过——那同时踩 DUA 与地域限制两条线。

C. 信号与标注

Q19:E4 具体记录哪些通道?
BVP 64Hz(PPG 派生血容量脉搏)、EDA 4Hz(μS)、TEMP 4Hz(°C)、三轴 ACC 32Hz(单位 1/64g)、HR 1Hz(BVP 派生)、IBI(逐搏间期,BVP 派生)。原生传感器四个:PPG/EDA/温度/加速度;HR 与 IBI 是派生量。

Q20:E4 上有心电吗?
没有。ECG 只在 PSG 端。E4 的心脏信息载体是 BVP/IBI/HR——能做心率与 HRV 分析,不能做心电图形态学诊断(坑 3)。

Q21:PSG 有哪些通道?
EEG×5(C4-M1/F4-M1/O2-M1/T3-CZ/CZ-T4)、EOG×2(E1/E2)、颏 EMG、ECG、气流×2(PTAF 压力式+FLOW 温度式)、呼吸努力×2(胸带+腹带)、鼾声、腿动×2(左右胫前肌)、SaO2——AASM 判读全套证据。

Q22:睡眠分期是谁标的?
睡眠技术师对照 PSG 记录逐 30 秒 epoch 人工标注(AASM 体系:W/N1/N2/N3/R)——这是临床金标的定义,继承人类判读的一致性也继承其变异。

Q23:P 标签是什么?
Preparation,PSG 正式开始前的准备段。注意它在两个目录行为不同:data_64Hz 保留 P,data_100Hz 把 P 记为 W。训练/评测一般剔除 P 段(坑 5)。

Q24:Missing 标签多吗?
很少:2 名受试者因夜间 PSG 重新安装各有约 15 分钟连续 Missing,另 4 名各 1 个孤立 Missing epoch。全数据集层面可忽略,单受试者实验需处理。

Q25:ACC 单位为什么是 1/64g?
E4 固件的原始计数口径。做体动积分或与 PSG 体位对照时注意换算;并务必使用 2.2.0+ 版本——此前版本 ACC 与 PSG 有对齐错位(坑 4)。

Q26:participant_info.csv 里有什么?
10 列:SID、AGE、GENDER、BMI、OAHI、AHI、Mean_SaO2、Arousal Index、MEDICAL_HISTORY(自由文本)、Sleep_Disorders(自由文本)。注意文档里 GEDNER 是笔误,以 CSV 表头 GENDER 为准(坑 7)。

D. 论文与方法

Q27:论文的任务为什么不是五期全分类?
论文聚焦睡眠起始(sleep onset)与清醒(wakefulness)检测——睡眠潜伏期与夜间清醒量是临床核心绩效指标,也是消费设备最被质疑的读数。五期全分类是社区后续工作空间,别把论文数字当五期 accuracy 引用。

Q28:混合效应 boosted tree 是什么直觉?
把"每个受试者偏离平均多少"(BMI、AHI 带来的信号形态差异)作为随机效应显式建模,再用 boosted tree 集成承载——在小样本、个体差异强的数据上比全局单一模型更稳。

Q29:F1 0.823 是什么水平?
CHIL 2024 报告的特征工程基线水平(睡眠起始+清醒检测口径,F1 0.823±0.019 / AUROC 0.926±0.016 / κ 0.695±0.025)。它是参照起点而非 SOTA 声明;且是该患者人群上的数字,与健康人群数据集的结果不可横比。

Q30:quality_score_per_subject.csv 是什么?
DREAMT_FE 仓库附带的每受试者信号伪影百分比表——数据集自带的质检报告,可用于受试者加权、异常检测或划分策略。

Q31:WatchSleepNet 和 DREAMT 什么关系?
同一 Duke 团队的后续工作:以 DREAMT 为预训练语料学习可穿戴通用表征,再迁移增强下游睡眠分期。DREAMT 在其中从"评测对象"变成"表征语料"。

E. 生产与库内

Q32:为什么 slug 叫 dreamt?
数据集本体的官方缩写即 DREAMT;库内以数据集立条、论文以专节收录。查重确认库内此前无 dreamt 条目(url_name 检索 0 行)。

Q33:本条目与库内 sleep-edf、mesa-sleep 等条目冲突吗?
不冲突,互补:它们构成"健康人群—队列人群—临床门诊"的人群谱系与"单通道 PPG—多模态腕带"的通道谱系,互链关系见 §9.1。

Q34:库内还有哪些条目适合一起看?
睡眠分期家族:sleep-edf(73)、isruc-sleep(262)、mros-sleep(292)、mesa-sleep(302)、cinc-2018-sleep(493)、shhs;PPG 家族:ppg-dalia(202)、bidmc-ppg(74);信号归属对照:mimic-iv-ecg(172);可穿戴多模态:mhealth、pamap2。

Q35:这条目后续会更新什么?
维护触发点:新版本发布(2.2.0 后的 Release Note 与引用口径更新)、PyHealth 对 2.2.0 的适配确认、官方镜像/开放政策变化(若受限访问降档,条目 AI-Ready 评级与获取节整体改写)。

Q36:如果只记住一件事?
记住人群:这不是又一个健康年轻人睡眠数据集,而是肥胖 68%、重度 OSA 23% 的门诊患者金标对齐集——你的可穿戴分期算法在他们身上的表现,才决定它对真正用户有没有用。

F. 工程与复现

Q37:EDA 原生只有 4Hz,为什么 64Hz 目录里每秒有 64 个点?
统一重采样的插值结果。数值变密不代表分辨率提升——皮肤电响应分析的有效分辨率仍是 4Hz,插值列只用于方便与 BVP 对齐(§3.6)。

Q38:两个目录能混着训练吗?
不能直接拼。标签行为不同(P 保留 vs 记为 W,坑 5)、采样率不同、通道集不同。正确做法是选一个目录做全程,或写显式转换层(对齐标签语义+统一采样口径)后再合并。

Q39:训练/测试集怎么划分才不泄漏?
受试者级划分(按 SID 分组),因为每人只有 1 晚——任何行级/epoch 级随机划分都会把同一人的数据同时放进训练与测试,虚高分数。DREAMT 每人 1 晚的结构使受试者级划分天然无泄漏,建议再按肥胖/OSA 严重度分层抽样。

Q40:AHI 能从数据里自己复算吗?
可以验证:PSG 端有气流×2、呼吸努力×2、SaO2 全套判读证据,复算呼吸事件在原理上可行;但 AASM 事件判分规则(低通气的是否伴氧减/觉醒)有细节选项,复算值与官方 participant_info.csv 的 AHI 可能有口径差——以 CSV 官方值为准,复算只作交叉检查。

Q41:PSG 从 200Hz 降到 100Hz 丢了什么?
奈奎斯特上限从 100Hz 降到 50Hz。常规睡眠分期(EEG 节律、EOG、EMG 包络)不受影响;棘波/纺锤波精细形态学等高频研究不适用该发布版。

Q42:时间戳平移自 0 会影响什么?
跨受试者的绝对钟点(几点入睡)不可恢复;记录内相对时间、epoch 序列、跨通道对齐都完好。就寝时刻类研究需要另找数据源。

Q43:quality_score_per_subject.csv 怎么用?
它是每受试者的信号伪影百分比表(DREAMT_FE 附带)。三种用法:异常受试者筛查(伪影率离群者单独审视)、样本加权(伪影高的受试者降权)、划分敏感性分析(剔除高伪影者后结果是否稳)。

Q44:2.2.0 的 ACC 修复影响哪些已有结论?
凡在 <2.2.0 版本上做的"ACC 与 PSG 对照"类分析(体动 vs 分期、活动量 vs 睡眠结构)都可能受错位影响,结论应在新版上复核。仅用 BVP/EDA/TEMP 的分析不受影响。

Q45:下载后如何验证文件完整性?
对 SHA256SUMS.txt 逐行跑校验和(约 200 余行,实测 19,541 字节清单)。受限数据重取成本高,校验是第一步。

Q46:多线程/多机处理时还有什么细节?
CSV 按受试者一文件,天然可并行(按 SID 分片);注意 GEDNER 笔误(坑 7)别写进字段映射、P 标签按目录区分(坑 5)、epoch 行数按目录确认(1920 vs 3000)。三件事都过一遍再开并行,能省掉大部分返工。

G. 对比与选型

Q47:DREAMT 和 Sleep-EDF 该用哪个?
人群不同:Sleep-EDF 以健康人为主(经典基准),DREAMT 是睡眠障碍门诊患者。做"算法在患者身上行不行"的实验用 DREAMT;做与历史文献的可比基线用 Sleep-EDF。两者通道与时代也不同(§3.7、§9.1)。

Q48:DREAMT 和 SHHS 该用哪个?
规模与人群互补:SHHS 是数千人级社区队列(家庭 PSG),DREAMT 是 100 人门诊患者(实验室 PSG+腕带多通道)。大模型预训练/大规模评测看 SHHS;患者人群校准、可穿戴多通道研究看 DREAMT(§9.3 场景一)。

Q49:我的模型在健康人群数据集上 0.9,直接上线行吗?
先过 DREAMT 式人群再说话——健康人群分数不代表患者人群表现(§4.1 的错位正是这条数据集存在的理由)。至少做一次跨人群评测或在 DREAMT 上微调后再评估。

Q50:想做多夜/个体内变异研究怎么办?
DREAMT 每人仅 1 晚,不适合;需要多夜设计请看 Radha et al. 2021(荷兰,多夜——注意那是另一个 DREAMT,坑 1)或库内多夜条目,并在引用时明确区分"单晚校准+多夜验证"的组合设计。

Q51:EDA 通道能做什么?
交感张力窗口:觉醒相关皮肤电反应、唤醒事件与 EDA 波动的关系、跨模态(EDA+HRV+体动)的觉醒检测。注意 EDA 原生 4Hz,插值列不提升有效分辨率(§3.6)。

Q52:能做睡眠呼吸事件(暂停/低通气)检测吗?
数据支持但论文未做:PSG 端有气流×2/呼吸努力×2/SaO2 判读证据,事件级标注需要按 AASM 规则从波形自行派生或复算(Q40 的口径注意同样适用);腕带端只有间接证据(PPG 形态/体动)——这属于开放研究问题而非现成标签。

Q53:能把 DREAMT 和 ppg-dalia 合并训练吗?
可以做跨数据集 PPG 研究,但注意三点:参照系不同(PSG 分期 vs 胸部 ECG)、场景不同(睡眠 vs 日常活动)、许可制度不同(DUA vs 开放)——划分协议、版本记录、许可边界要分别存档(§9.3 纪律)。

Q54:哪里看官方最新动态?
PhysioNet 项目页(版本与 Release Note)与 DREAMT_FE 仓库(代码更新)两处;官方引用模板的版本口径变化也是动态信号(坑 8 的复核点)。

H. 快速答疑补遗

Q55:100 人会不会太少?
看用途。做人群校准与金标对齐研究,100 名特征鲜明的患者已可用(论文基线即在此规模上建立);做大规模预训练或细分子群统计则不足。它的定位是"缺口对照"而非"规模选手"(§4.1、Q48)。

Q56:P 标签为什么会不一致?
两个目录的生成链路独立(64Hz 与 100Hz 分别重采样/导出),准备阶段的处理策略未对齐——属于发布工程的边缘缺陷,官方尚未在 Release Note 中处理。本条目按现状存照并给出分目录清洗的工程口径(坑 5)。

Q57:E4 的固件版本(Summer 2019)重要吗?
重要但常被忽略:固件决定信号处理链(滤波、AGC 等),不同固件的 E4 输出可能有系统性差异。跨数据集对比其他 E4 数据(如 ppg-dalia 系)时,固件口径是应记录的元数据之一。

Q58:data_100Hz 里的 E4 部分和 data_64Hz 完全一样吗?
同源但插值路径不同(4Hz 通道分别扩到 64Hz 与 100Hz),不保证逐行数值一致。跨目录混用同一通道的数值前先抽查一致性(§3.6 纪律 2)。

Q59:每个 epoch 的标签在哪里看?
各 CSV 的 Sleep_Stage 列,每 30 秒一个值(W/N1/N2/N3/R/P/Missing),随信号行展开——按行频换算位置(1920/3000 行一个标签值,§3.9),不要假设文件里另存独立标注文件。

Q60:能只用 BVP 做端到端深度学习吗?
可以(BVP 64Hz 是 E4 的主信号),但建议先用 DREAMT_FE 特征基线建立参照系再上端到端——否则无法判断深度模型的增益来自"表示学习"还是"任务口径差异"(§4.6 守则 4)。

Q61:为什么 category_tags 里有"评测基准"?
它虽以数据集立条,但三件资产使其具备基准属性:论文基线(F1/AUROC/κ 可对标)、官方用例(AHI 预测/子群发现)、可复现工程(代码库+SHA256+版本 DOI)——在"受限访问档基准"这个生态位上,它是库内的参照点(§6.3)。

Q62:能做 HRV 研究吗?
可以,素材是 IBI(逐搏间期)。纪律有两条:精细时域/频域指标回推逐搏口径而非用重采样列(§3.6);先查 quality_score_per_subject.csv 的伪影率,运动伪影是腕部 PPG 做 HRV 的第一敌人。

Q63:两个目录哪个更"原始"?
都不是完全原始:原始 E4 各通道原生率与 PSG 200Hz 均未直接发布,发布的是两个统一重采样版。相对而言 data_64Hz 是 1.0.0 首发与论文基线口径,data_100Hz 是金标合并口径——按任务选,按版本引。

Q64:如何向团队一页汇报这个数据集?
四句话:① 100 名睡眠门诊患者的单晚 E4+PSG 同步对齐数据(患者人群,肥胖 68%/重度 OSA 23%);② 双目录发布,可穿戴分期与跨模态两条主线;③ PhysioNet 受限访问,签 DUA 才能用,部分地域受限;④ 官方代码库+PyHealth 接口,工程接入成本最低一档。

Q65:Missing 涉及的 6 名受试者会影响划分吗?
不影响划分本身(划分在 SID 层),只影响这 6 人的有效 epoch 数——统计样本量时用有效 epoch 数而非"人数×固定时长",并在预处理日志里记录剔除量(§3.4)。

Q66:自建可穿戴采集时能抄它哪些设计?
三件最值得抄:设备型号+固件版本披露(§8.1 检查项)、发布形态的对齐声明(Metadata 写明重采样与时间戳处理)、逐受试者质量自评表(§8.6 样本 2)。这三件恰好是大多数自建数据集缺的。

事实清单(硬事实 44 条)

  1. DREAMT 全称 Dataset for Real-time sleep stage EstimAtion using Multisensor wearable Technology。
  2. 团队:Duke University Jessilyn Dunn 实验室 × DUHS Sleep Disorder Lab;论文 10 作者,一作 Will Ke Wang,临床端共同作者 Andrew R Spector。
  3. 规模:100 名受试者 × 每人一夜同步记录;participant_info.csv 实测 100 数据行。
  4. SID 编号 S002-S103,非连续,无 S001。
  5. 采集窗口 2022 年 5 月至 9 月,单中心 DUHS 睡眠障碍实验室;每晚最多招募 4 人(设备限制);无特别入选标准。
  6. 伦理:Duke Health IRB #Pro00108961,书面知情同意并授权去标识共享;直接标识符移除、时间戳平移自 0 起。
  7. 可穿戴设备:Empatica E4(Empatica Inc., Milano, Italy;Software Version: Summer 2019),左手腕佩戴。
  8. PSG 设备:Nihon Kohden Polysmith 1004 (version 11) Data Management System(台式实验室级)。
  9. 单晚流程:约 20:00 入住 → 佩戴 E4 → 约 23:00 护士启动 PSG → 自然醒(约 06:00)双设备同时停用。
  10. 人口统计:年龄 56.2±16.6 岁;BMI 33.7±8.6 kg/m²;女 55/男 45(CSV 实测 F=55, M=45)。
  11. OAHI 19.4±27.5 /h;AHI 22.1±28.7 /h(AHI<5 为健康)。
  12. 肥胖或重度肥胖(BMI≥30)68 人;重度 OSA(AHI>30/h)23 人;重度 OSA 中兼肥胖 17 人——CSV 复算与 v2.2.0 页面一致。
  13. v2.1.0 页面曾写 “17 were obese or severely obese”(省略限定语),与 v2.2.0 口径歧义(坑 2)。
  14. 诊断分布第三方转述口径(Polito 2025 学位论文):呼吸障碍 66%/嗜睡 20%/健康对照 9%/不宁腿 2%/失眠 2%;官方页无逐类百分比。
  15. participant_info.csv 十字段:SID, AGE, GENDER, BMI, OAHI, AHI, Mean_SaO2, Arousal Index, MEDICAL_HISTORY, Sleep_Disorders。
  16. data_64Hz/SID_whole_df.csv:仅 E4 信号+睡眠标签,统一重采样 64Hz,每受试者一文件。
  17. data_100Hz/SID_PSG_df.csv:E4+PSG 全通道,统一 100Hz(PSG 原始 200Hz 降采样),每受试者一文件。
  18. 根目录:participant_info.csv、Metadata.txt、SHA256SUMS.txt(19,541 字节)、LICENSE.txt。
  19. E4 端通道:BVP 64Hz、EDA 4Hz(μS)、TEMP 4Hz(°C)、ACC 三轴 32Hz(1/64g)、HR 1Hz、IBI(ms)——HR/IBI 为 BVP 派生。
  20. E4 端无 ECG;ECG 仅在 PSG 端(坑 3)。
  21. PSG 通道:EEG×5(C4-M1/F4-M1/O2-M1/T3-CZ/CZ-T4)、EOG×2(E1/E2)、颏 EMG、ECG、PTAF+FLOW、THORAX+ABDOMEN、SNORE、LAT+RAT、SAO2。
  22. 睡眠分期:每 30 秒 epoch,睡眠技术师按 PSG 标注 AASM 分期 W/N1/N2/N3/R。
  23. P(准备阶段)标签:data_64Hz 保留,data_100Hz 记为 W(坑 5)。
  24. Missing 标签:2 名受试者因 PSG 夜间重新安装各约 15 分钟连续 Missing;另 4 名各 1 个 Missing epoch。
  25. 版本线:1.0.0(2024-04-30,仅 data_64Hz)→ 1.0.1(2024-09-13)→ 2.0.0(2025-02-05,引入 data_100Hz)→ 2.1.0(2025-04-30)→ 2.2.0(2026-06-02,修复 ACC-PSG 对齐错位)。
  26. DOI:concept 10.13026/dztc-dv77;2.1.0 为 10.13026/7r9r-7r24;2.2.0 为 10.13026/3f7y-2d80。
  27. 官方引用模板仍写 “(version 2.1.0)”,滞后于最新版 2.2.0(坑 8)。
  28. 许可:PhysioNet Restricted Health Data License 1.5.0 + DUA 1.5.0;受限访问,禁止再分发。
  29. 地域限制存照:抓取时点(2026-09-26)PhysioNet 文件页在本环境返回 “Data is not available in your region”。
  30. HF 非官方镜像 bsaenz/dreamt:v2.1.0 口径、gated=false、lastModified 2026-03-25、downloads 382、size_categories 100M<n<1B。
  31. 论文:Addressing Wearable Sleep Tracking Inequity: A New Dataset and Novel Methods for a Population with Sleep Disorders,CHIL 2024(2024-06-27/28,Cornell Tech),PMLR 248:380-396,出版 2024-07-24。
  32. 论文任务:睡眠起始与清醒检测;指标 F1 0.823±0.019、AUROC 0.926±0.016、Cohen’s κ 0.695±0.025。
  33. 论文方法:LSTM 后处理 + 混合效应 boosted tree 集成;背景引述美国约 70 million 成人有睡眠障碍。
  34. 代码库 DREAMT_FE(github.com/WillKeWang/DREAMT_FE):初始提交 2024-04-23、最后提交 2024-06-28;流水线 read_raw_e4.py → feature_engineering.py → datasets.py/models.py。
  35. quality_score_per_subject.csv:每受试者信号伪影百分比表(DREAMT_FE 提供)。
  36. 官方用例:WatchSleepNet 预训练语料、可穿戴预测 AHI 等健康结局、无监督子群发现(OSA 严重度×年龄×性别)。
  37. PyHealth 提供 DREAMTDataset 标准加载类(文档口径支持 1.0.0/1.0.1/2.0.0/2.1.0 目录结构,AHI 等字段事件级直取)。
  38. 同名数据集:Radha et al. 2021(Scientific Data)DREAMT 为荷兰 TU/e 系多夜 PSG+三星手表数据集,与本项目无关;第三方项目(DreamSense)已现混挂引用(坑 1)。
  39. Metadata.txt 内字段名笔误 “GEDNER”(实际 CSV 表头为 GENDER)(坑 7)。
  40. PhysioNet 标准平台引用:Goldberger et al. 2000, Circulation 101(23):e215-e220(RRID: SCR_007345)。
  41. 单晚流程时点:约 20:00 入住、约 23:00 护士启动 PSG、约 06:00 自然醒后双设备同时停用。
  42. epoch 行数常数:data_64Hz 每 epoch 64×30=1920 行;data_100Hz 每 epoch 100×30=3000 行。
  43. 文件总数 204(data_64Hz 100 + data_100Hz 100 + 根目录 4),与 SHA256SUMS.txt 约 200 余行校验和吻合。
  44. CHIL 2024 会议:2024-06-27/28,Cornell Tech(New York);论文 PMLR 出版日 2024-07-24。

术语表(51 条)

术语 释义
PSG(多导睡眠图) Polysomnography,睡眠实验室金标记录:脑电/眼电/肌电/心电/呼吸/血氧多通道同步
AASM 美国睡眠医学学会,睡眠分期与事件判读标准的制定者
睡眠分期 把整夜记录切成 30 秒 epoch 并判为 W/N1/N2/N3/R 的临床操作
Epoch 分期最小时间单元(30 秒)
NREM / REM 非快速眼动睡眠(N1-N3)/ 快速眼动睡眠(R)
OSA 阻塞性睡眠呼吸暂停,睡眠中上气道反复塌陷的疾病
AHI 呼吸暂停低通气指数:每小时呼吸事件数;>30/h 计重度
OAHI 氧减饱和指数:每小时血氧下降事件数
PPG / BVP 光体积描记 / 血容量脉搏:用光测微血管容积波的传感原理与信号
EDA 皮电活动(μS),交感张力指标
IBI 逐搏间期(ms),HRV 分析原始素材
HRV 心率变异性
Empatica E4 四传感器腕带(PPG/EDA/温度/加速度),本数据集可穿戴端机型
PTAF / FLOW 压力式/温度式呼吸气流双通道
LAT / RAT 左/右胫前肌 EMG,腿动判读
PLMS 周期性肢体运动(睡眠中)
P 标签 PSG 正式开始前的准备段;两目录行为不同(坑 5)
Missing 无分期标签的时段
受限访问(Restricted) PhysioNet 三档获取制度的中档:注册+签 DUA 后访问
DUA Data Use Agreement,数据使用协议
Concept DOI 始终指向最新版本的 DOI;版本 DOI 则固定于单版
SHA256SUMS 文件校验和清单,完整性验证用
混合效应模型 显式建模组间(受试者间)随机效应的统计模型
Boosted tree 逐步拟合残差的树集成方法
Cohen’s κ 扣除随机一致后的一致性系数;0.61-0.80 惯称"相当一致"档
AUROC ROC 曲线下面积,判别力指标
睡眠起始(sleep onset) 由醒转入睡的时刻;对应任务为二值检测
睡眠潜伏期 关灯到入睡的时长,临床核心绩效指标之一
微觉醒(arousal) 睡眠中短暂的觉醒反应(3 秒以上),Arousal Index 的计数对象
睡眠纺锤 / K-复合波 N2 期特征性 EEG 形态,技术师判读的标志物
SpO2 / SaO2 脉搏/动脉血氧饱和度;氧减事件的判定依据
上采样/下采样 重采样的两个方向;插值不创造新信息(§3.6)
LOSO Leave-One-Subject-Out,留一受试者交叉验证的划分协议
分层抽样 按人群结构(如肥胖/OSA 严重度)分块抽样的划分策略
信号伪影 运动/电极接触等引入的非生理波形污染;DREAMT 附逐人伪影率表
睡眠效率 睡眠时长占卧床时长的比例,夜级核心指标(§4.7 L2 层)
总卧床时间(TIB) 从上床到起床的总时长;时间戳平移后以记录长度近似
睡眠片段化 睡眠被频繁觉醒/微觉醒打断的程度
固件版本 设备内置软件版本(E4: Summer 2019),影响信号处理链与跨数据可比性
派生信号 由原始传感计算得到的信号(HR/IBI 源自 BVP),非独立测量
受试者泄漏 同一受试者的数据同时进入训练与测试造成的分数虚高;受试者级划分的防范对象
版本锁定 实验记录中固定数据版本号+校验和的做法;跨版本结果不可比的第一道防线
三档制度 PhysioNet 的 open / restricted / credentialed 获取分档(§5.6)
分块留出 按受试者分块划出测试集的协议;介于 LOSO 与随机划分之间
交叉核对 同一数字经两条独立来源或复算路径验证的方法(本条目附录 C 的做法)
数据字典 描述字段名/类型/语义的文档;DREAMT 的 Metadata.txt 即此(含 GEDNER 笔误)
事件级判分 AASM 呼吸事件判定中的规则选项(是否伴氧减/觉醒);AHI 复算的口径来源
概览统计 dataset.stats() 类接口输出的受试者/记录概要;PyHealth 标配(§5.5)

附录

附录 A:条目信息速查卡

项 值
条目名 DREAMT
url_name dreamt
类型 数据集+方法论文+代码库(三合一)
论文 PMLR 248:380-396(CHIL 2024)
团队 Duke University(Jessilyn Dunn 组)× DUHS Sleep Disorder Lab
规模 100 名受试者 × 单晚(S002-S103)
双目录 data_64Hz(仅 E4)/ data_100Hz(E4+PSG)
许可 PhysioNet Restricted Health Data License 1.5.0(DUA 1.5.0)
最新版本 2.2.0(2026-06-02,DOI 10.13026/3f7y-2d80)
抓取时点 2026-09-26
库内互链 sleep-edf(73)/bidmc-ppg(74)/mimic-iv-ecg(172)/ppg-dalia(202)/isruc-sleep(262)/mros-sleep(292)/mesa-sleep(302)/cinc-2018-sleep(493)/shhs/mhealth/pamap2

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 7 PhysioNet 官方页+PMLR 论文+PyHealth 文档三路可索引;失分项:论文标题不含 DREAMT(双名检索成本)且与 Radha 2021 同名(消歧成本,坑 1)
A 可获取性 4 受限访问(注册+DUA)+地域限制;HF 非官方镜像无门禁但合规地位存疑,不能计入官方可获取性——库内可获取性光谱最严一侧
I 可互操作 7 通用 CSV+PyHealth 标准接口+SHA256SUMS 完整性清单;失分项:双目录标签行为不一致(坑 5)、Metadata.txt 字段笔误(坑 7)、ACC 历史错位需版本甄别(坑 4)
M 元数据质量 7 participant_info.csv 十字段+Metadata.txt 数据字典+页面通道/用例文档完备;硬数字经 CSV 独立复算一致;失分项:v2.1.0 页面歧义表述(坑 2)、GEDNER 笔误、官方引用滞后(坑 8)
S 可持续性 8 PhysioNet 平台长期稳定、concept+版本双轨 DOI、Duke 机构背书;代码库 2024-06 后停更(单一开源实现的维护风险)
综合评级 6.6/10(中上) "工程质量高、可获取性受限"的典型割裂画像:文档/复现/版本管理皆优,制度性访问门槛是唯一硬伤

附录 C:逐项证据链自证

关键数字/事实 来源 验证方式
100 名受试者/S002-S103 PhysioNet v2.2.0 页面 + participant_info.csv CSV 实测 100 数据行复算
年龄 56.2±16.6 / BMI 33.7±8.6 PhysioNet v2.2.0 页面 participant_info.csv 独立复算一致
F55/M45 PhysioNet v2.2.0 页面 CSV GENDER 列计数 F=55, M=45
68/23/17(肥胖/重度 OSA/兼有) PhysioNet v2.2.0 页面 CSV 按 BMI≥30、AHI>30 复算一致
OAHI 19.4±27.5 / AHI 22.1±28.7 PhysioNet v2.2.0 页面 CSV 均值±SD 复算一致
版本时间线与 Release Note physionet.org/content/dreamt/ 各版本页(Versions 区) 逐版本页面抓取(HTML 存档 /tmp)
DOI 三口径 PhysioNet 版本页 页面 Citation 区核对
F1/AUROC/κ PMLR 248:380-396 摘要 论文页直接核对
通道清单(E4/PSG) PhysioNet v2.2.0 页面 + Metadata.txt 双源交叉核对
P/Missing 行为 Metadata.txt + v2.2.0 页面 双源核对
文件树结构 Metadata.txt + HF 镜像 API(hf-mirror.com) PhysioNet files 页地域受限,镜像实测补证
HF 镜像口径 hf-mirror.com API(bsaenz/dreamt) lastModified/downloads/gated 实测
GEDNER 笔误 Metadata.txt 文本直读 vs CSV 表头对照
DREAMT_FE 流水线 github.com/WillKeWang/DREAMT_FE(README+目录) 网页版抓取
论文作者名单/时间线 PMLR 论文页 直接核对

附录 D:数据获取决策树

需求是什么?
├── 只想跑通可穿戴分期基线
│   └── PhysioNet 签 DUA → 下 1.0.x 或 2.x 的 data_64Hz → DREAMT_FE 流水线
├── 要做金标对齐/跨模态研究
│   └── 下 ≥2.2.0 的 data_100Hz(ACC 已修复)→ 按 §3.5 归属表取通道
├── 要做"腕带筛 OSA"结局预测
│   └── participant_info.csv(AHI/OAHI/Mean_SaO2)+ E4 通道 → PyHealth DREAMTDataset
├── 所在地域 PhysioNet 受限
│   └── 合规网络环境或合作机构获取;勿用非官方镜像替代合规地位
└── 只想引用数据集
    └── concept DOI 10.13026/dztc-dv77(或指定版本 DOI)+ PMLR 论文 + Goldberger 2000 三件套

附录 E:双目录字段与标签对照

属性 data_64Hz(SID_whole_df.csv) data_100Hz(SID_PSG_df.csv)
信号范围 仅 E4(BVP/EDA/TEMP/ACC/HR/IBI) E4 全通道 + PSG 16 路
统一采样率 64 Hz 100 Hz(PSG 200Hz 降采样)
睡眠标签 每 30s 一个;P 保留 每 30s 一个;P 记为 W
适用任务 纯可穿戴分期(论文实验口径) 跨模态/金标对齐研究
版本可用性 1.0.0 起全部版本 2.0.0 起引入
epoch 行数(理论) 64×30=1920 行/epoch 100×30=3000 行/epoch
ACC-PSG 对齐 不涉及 2.2.0 起修复错位

使用纪律:两目录不做行级拼接;清洗(剔除 P/Missing)逻辑分目录实现;epoch 切分先确认实际行频再按行数切。

附录 F:检索路径示范(关键词组合与查询式)

目标 推荐查询式 预期命中
数据集本体 “DREAMT” AND (“Empatica E4” OR “PhysioNet”) physionet.org/content/dreamt/
论文 “Addressing Wearable Sleep Tracking Inequity” OR “PMLR 248” wang proceedings.mlr.press/v248/wang24a.html
代码 “DREAMT_FE” OR “WillKeWang” github.com/WillKeWang/DREAMT_FE
生态接口 “PyHealth” “DREAMTDataset” pyhealth.readthedocs.io
版本/DOI “10.13026/dztc-dv77” OR “10.13026/3f7y-2d80” PhysioNet 版本页
消歧反例(勿当本体) “DREAMT” “multi-night” Radha Radha et al. 2021 Scientific Data(另一数据集,坑 1)

检索卫生两条:一、论文标题不含"DREAMT"字样,只搜数据集名会漏掉方法学论文,双线并搜;二、官方引用模板的版本口径(2.1.0)随官方文档滚动,引用时存照抓取日期并按需选择版本 DOI。

附录 G:引用模板

% 数据集(concept DOI 口径,指向最新版)
@dataset{dreamt_dataset,
  author    = {Wang, Ke and Yang, Jiamu and Shetty, Ayush and Dunn, Jessilyn},
  title     = {DREAMT},
  year      = {2025},
  publisher = {PhysioNet},
  doi       = {10.13026/dztc-dv77},
  note      = {Restricted access; current version 2.2.0 (doi:10.13026/3f7y-2d80)}
}

% 原始研究论文
@inproceedings{wang2024dreamt,
  author    = {Wang, Will Ke and Yang, Jiamu and Hershkovich, Leeor and Jeong, Hayoung
               and Chen, Bill and Singh, Karnika and Roghanizad, Ali R
               and Shandhi, Md Mobashir Hasan and Spector, Andrew R and Dunn, Jessilyn},
  title     = {Addressing Wearable Sleep Tracking Inequity:
               A New Dataset and Novel Methods for a Population with Sleep Disorders},
  booktitle = {Proceedings of the fifth Conference on Health, Inference, and Learning (CHIL)},
  series    = {PMLR},
  volume    = {248},
  pages     = {380--396},
  year      = {2024}
}

% PhysioNet 平台引用(PhysioNet 官方要求三件套之一)
@article{goldberger2000physiobank,
  author  = {Goldberger, Ary L. and Amaral, Luis A. N. and Glass, Leon
             and Hausdorff, Jeffrey M. and Ivanov, Plamen Ch. and Mark, Roger G.
             and Mietus, Joseph E. and Moody, George B. and Peng, Chung-Kang
             and Stanley, H. Eugene},
  title   = {PhysioBank, PhysioToolkit, and PhysioNet:
             Components of a New Research Resource for Complex Physiologic Signals},
  journal = {Circulation},
  volume  = {101},
  number  = {23},
  pages   = {e215--e220},
  year    = {2000}
}

附录 H:工程管线骨架(data_64Hz 加载与 epoch 切分示意)

import pandas as pd

E4_COLS_64HZ = ["TIMESTAMP", "BVP", "IBI", "EDA", "TEMP",
                "ACC_X", "ACC_Y", "ACC_Z", "HR", "Sleep_Stage"]

def load_subject_64hz(data_dir: str, sid: str) -> pd.DataFrame:
    """加载单受试者 data_64Hz 文件。SID 形如 'S002'(注意无 S001,坑 6)。"""
    df = pd.read_csv(f"{data_dir}/{sid}_whole_df.csv")
    missing = [c for c in E4_COLS_64HZ if c not in df.columns]
    if missing:
        raise ValueError(f"{sid}: 列缺失 {missing}(以实际表头为准,勿信文档硬编码——坑 7)")
    return df

def split_epochs(df: pd.DataFrame, fs: int = 64, epoch_sec: int = 30) -> pd.DataFrame:
    """按行数切 30s epoch:data_64Hz 理论 64*30=1920 行/epoch(§3.3)。
    先行内裁剪:P(准备段)与 Missing 不进训练(data_64Hz 保留 P,坑 5)。"""
    usable = df[~df["Sleep_Stage"].isin(["P", "Missing"])].copy()
    n_per_epoch = fs * epoch_sec
    usable = usable.iloc[: len(usable) // n_per_epoch * n_per_epoch]
    usable["epoch_id"] = usable.index // n_per_epoch
    return usable

def subject_level_split(all_sids, frac_test=0.2, seed=42):
    """受试者级划分(每人仅 1 晚,受试者级划分天然无泄漏,Q39)。"""
    import random
    random.Random(seed).shuffle(all_sids)
    n_test = int(len(all_sids) * frac_test)
    return all_sids[n_test:], all_sids[:n_test]

三条骨架级纪律:① 列名以实际 CSV 表头为准(Metadata.txt 有 GEDNER 笔误);② P/Missing 剔除逻辑按目录区分(data_100Hz 无独立 P);③ 划分只发生在 SID 层,epoch 层不做随机。

附录 I:十条常见错误与修正对照

# 常见错误 修正
1 把 DREAMT 引成 Radha 2021 的多夜数据集 消歧三要素:Duke/E4/DOI 10.13026.*(坑 1)
2 写"17 人肥胖" 68 人肥胖;17 是重度 OSA 中兼肥胖者(坑 2)
3 把 ECG 列为 E4 通道 ECG 仅 PSG 端;腕带端心脏信号是 BVP/IBI/HR(坑 3)
4 用 1.0.x 做含 PSG 的实验 data_100Hz 自 2.0.0 才存在(坑 4)
5 用 <2.2.0 做 ACC-PSG 分析 ACC 对齐错位 2.2.0 才修复(坑 4)
6 两目录标签列直接拼接 P 语义不同(坑 5),写显式转换层
7 按 SID 数值范围枚举受试者 S002-S103 非连续;枚举实际 SID 列表(坑 6)
8 按文档字段名 GEDNER 解析 CSV CSV 实际表头是 GENDER(坑 7)
9 引用模板照抄 “(version 2.1.0)” 按需选版本口径并全篇一致(坑 8)
10 把 66%/20%/9%/2%/2% 诊断分布当官方口径 第三方转述;引用注来源或自行统计(坑 9)

附录 J:单晚数据的分析检查清单

动笔做实验前过一遍:

  1. 版本锁定:记录所用版本号与发布日期(推荐 ≥2.2.0)。
  2. 文件完整性:SHA256SUMS 校验通过。
  3. 目录选择:64Hz(可穿戴主线)或 100Hz(跨模态),全程不混用。
  4. 标签清洗:P/Missing 处理策略写入实验配置(按目录区分)。
  5. 划分协议:受试者级(SID 分组),建议按肥胖/OSA 严重度分层。
  6. 通道归归属表核对:不跨设备引用通道(附录 I 第 3 条)。
  7. 重采样口径:报告"有效分辨率"用原生采样率,不用打包采样率(§3.6)。
  8. 伪影处理:quality_score_per_subject.csv 纳入权重或敏感性分析。
  9. 指标口径:任务定义(起始/清醒 vs 五期)、误差棒含义(SD)写明(§4.6)。
  10. 引用三件套:数据集 DOI(版本口径)+ PMLR 论文 + Goldberger 2000(附录 G)。

附录 K:条目维护触发点

触发点 影响 优先级
数据集新版本发布(>2.2.0) 版本表/坑 4/坑 8 与引用模板更新 高
PyHealth 适配 2.2.0 的确认 §5.5 版本支持口径更新 中
PhysioNet 访问政策变化(降档/地域调整) §5.3/§6 AI-Ready 评级与获取节重写 高
WatchSleepNet 或同组后续正式发表 §7.3 扩展、互链新增 中
官方引用模板版本口径更新 坑 8 存照状态复核 低
HF 镜像下架或转官方 §5.4 许可张力段落改写 低

附录 L:版本迁移检查清单(旧版 → 2.2.0)

从旧版本升级或交叉验证旧结果时逐项过:

步骤 检查内容 涉及坑点
1 确认手头数据版本(下载页/Metadata 口径)并写入实验记录 —
2 版本 <2.0.0 且计划含 PSG:重取 2.0.0+(旧版无 data_100Hz) 坑 4
3 版本 2.0.0-2.1.0 且分析含 ACC:重取 2.2.0 并重跑对齐相关分析 坑 4
4 重取后先跑 SHA256SUMS 校验,再删旧目录 —
5 标签清洗配置按目录复核(data_100Hz 的 P 已并入 W) 坑 5
6 引用与论文/报告中的版本号、DOI 全篇更新(concept 或版本 DOI 二选一) 坑 8
7 已发布结果标注"基于 vX.Y.Z"的版本边界,避免被当最新版复现 坑 4/坑 8

附录 M:与库内大型睡眠条目的结构对照

DREAMT 与库内 PSG 系大条目(shhs/sleep-edf/mesa-sleep/mros-sleep 等)的结构性差异一览(各条目细节以库内为准):

结构轴 DREAMT 库内大型 PSG 条目的典型形态
记录时长设计 每人 1 晚(单晚深描) 每人 1 晚或多夜/随访
规模逻辑 人群缺口(100 人精选门诊) 统计功效(数百至数千人队列)
中心数 单中心(DUHS 实验室) 单/多中心队列
可穿戴侧 E4 四传感器腕带+派生(逐样本对齐) 多无腕带多通道或仅家庭监测设备
金标形态 实验室 PSG 全通道+技术师分期 家庭/实验室 PSG+集中判读
受试者级临床表 participant_info.csv(AHI/BMI 等 10 字段) 队列问卷+体检衍生表
获取制度 PhysioNet restricted(DUA 1.5.0) 多为 open/注册档
官方代码库 有(DREAMT_FE 全流水线) 多依赖社区实现

读表的结论:DREAMT 与大条目不是竞争关系而是结构互补——大规模队列给统计功效与人群广度,DREAMT 给患者人群的腕带-金标对齐深度。库内检索把两条线并置,才能覆盖"睡眠分期数据集"问题的完整设计空间。

附录 N:审稿/评审核查问题清单(DREAMT 相关论文适用)

评审或复核基于 DREAMT 的论文时,建议逐项过:

  1. 数据版本是否声明?是否 ≥2.2.0(若分析含 ACC)?
  2. 划分协议是否受试者级(SID 分组)?有无行级随机划分的泄漏?
  3. 任务口径是否写明(起始/清醒检测 vs 五期分期 vs 事件检测)?
  4. 人群口径是否写明(患者人群;是否做了肥胖/OSA 分层报告)?
  5. 通道-设备归属是否正确(有无把 ECG 写成可穿戴信号,坑 3)?
  6. 与论文基线(F1 0.823±0.019 口径)的比较是否同任务、同划分、同版本?
  7. 误差表述是 SD 还是 CI(±0.019 是 SD,§4.4)?
  8. 引用三件套是否齐全、DOI 与所用版本是否匹配(坑 8)?
  9. 数据获取路径是否合规(PhysioNet DUA,而非镜像引用,§5.4)?
  10. 夜级/受试者级结论是否在对应层级直接评测,而非用 epoch 指标代言(§4.7)?

这份清单同时是写作者的预审清单——投稿前自查一遍,可挡掉该数据集上最高频的十类方法论质疑。


尾注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-26,抓取与核验时点见附录 A。事实陈述以 PhysioNet 内容页(v1.0.0-v2.2.0)、PMLR 248:380-396 论文、Metadata.txt 与 participant_info.csv 实测(经 HF 镜像获取)、GitHub DREAMT_FE 仓库为源;人口学硬数字全部经 CSV 独立复算并与官方页面口径核对一致。原始文档缺陷(同名数据集、肥胖人数歧义表述、ECG 归属混引、版本漂移、P 标签不一致、SID 非连续、GEDNER 笔误、引用口径滞后、第三方转述分布)已在 §10 坑点与附录 C 存照。条目与库内 sleep-edf(rid 73)、bidmc-ppg(rid 74)、mimic-iv-ecg(rid 172)、ppg-dalia(rid 202)、isruc-sleep(rid 262)、mros-sleep(rid 292)、mesa-sleep(rid 302)、cinc-2018-sleep(rid 493)及 shhs、mhealth、pamap2 等条目互链,构成"睡眠分期 × 可穿戴传感 × PPG 信号"家族的完整检索面。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • isruc-sleep — 共享标签:生理信号 / 睡眠信号 / 评测基准
  • mesa-sleep — 共享标签:生理信号 / 睡眠信号 / 可穿戴传感
  • hmc-sleep-staging — 共享标签:生理信号 / 睡眠信号 / 评测基准
  • apnea-ecg — 共享标签:生理信号 / 睡眠信号 / 评测基准
  • wesad — 共享标签:生理信号 / 可穿戴传感
  • icentia11k — 共享标签:生理信号 / 可穿戴传感 / 评测基准
  • ppg-dalia — 共享标签:生理信号 / 可穿戴传感
  • bridge2ai-voice — 共享标签:生理信号 / 可穿戴传感
  • sleep-edf — 共享标签:生理信号 / 睡眠信号
  • bidmc-ppg — 共享标签:生理信号 / 可穿戴传感

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集