信息速览

HBN-EEG — 儿童青少年高密度脑电公开数据集 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | HBN-EEG |
| 英文全称 | Healthy Brain Network (HBN) Electroencephalography Dataset — The FAIR Implementation |
| 别名/简称 | HBN-EEG、Healthy Brain Network EEG、ds005505-ds005516(OpenNeuro 批次 ID) |
| 疾病分类 | 儿童青少年精神与神经发育障碍跨诊断研究队列(ICD-11:6A05 注意缺陷多动障碍 / 6A02 孤独症谱系障碍 / 6A03 发展性学习障碍 / 6B00 广泛性焦虑障碍 / 6A70 单次抑郁发作等) |
| SNOMED CT | 406506008 Attention deficit hyperactivity disorder / 70244009 Autism spectrum disorder / 371631005 Generalized anxiety disorder / 370143000 Major depressive disorder, single episode(详见 §2.2) |
| 数据模态 | 高密度脑电(128 通道 EEG)+ 同步眼动 + 行为响应 + 问卷精神病理维度 |
| AI 任务类型 | 精神病理维度回归、跨诊断生物标记物发现、EEG 预处理方法学基准、事件相关电位分析、自然刺激神经编码、迁移学习 |
| 样本总数 | 3,155 名被试(R1-R11 批次相加)+ NC 批次 458 人;单批次 134-533 人 |
| 数据大小 | 单批次 103.1-229.8 GB(实测 R1/R4/R5);11 批次合计约 2 TB(按各批次体量推算) |
| 数据格式 | BIDS-EEG(EEG 数据文件 + events.tsv + participants.tsv + sidecar JSON);EEG2025 衍生系列为 100 Hz BDF 转换版 |
| 许可证 | CC-BY-SA 4.0(主线批次);NC 批次为 CC-BY-NC-SA-4.0 |
| 访问级别 | 开放(主线批次经 OpenNeuro/NEMAR 直接下载;NC 批次仅经 FCP-INDI S3 获取且禁止商用) |
| DUO 标签 | NRES(主线批次无限制);NC 批次 NCU(非商业) |
| 语言 | 英文(数据标注与文档) |
| 首发日期 | 2024-10-04(R1-R9 上线 OpenNeuro) |
| 最后更新 | 2025-03-11(R2 v1.0.1);R10/R11 与 EEG2025 衍生系列于 2025 年陆续释出 |
| 发布机构 | Child Mind Institute(BIDS 整理由 UCSD Swartz 计算神经科学中心团队完成) |
| 官方主页 | https://nine-lab.gitlab.io/research/neuroinformatics/hbn/ |
| 下载地址 | https://openneuro.org/datasets/ds005505(R1 起各批次);s3://fcp-indi/data/Projects/HBN/BIDS_EEG/ |
| DOI | 10.1101/2024.10.03.615261(论文)/ 10.18112/openneuro.ds005505.v1.0.1(R1 数据集) |
| 引用次数 | 13+(OpenAIRE 汇总,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— BIDS-EEG + HED 注释标准、EEGDash 提供 PyTorch 一键加载;扣分项:无官方划分与基准、官方 QC 仅为最小质检、个体电极位置与眼动尚未随 EEG 批次发布 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、儿童青少年精神病理维度与临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(BIDS-EEG 层级、HED 事件注释体系)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 Child Mind Institute、UCSD Swartz 计算神经科学中心、NEMAR、OpenNeuro 无任何商业利益关联。本页面不销售 HBN-EEG 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。HBN-EEG 主线批次采用 CC-BY-SA 4.0 许可,NC 批次为 CC-BY-NC-SA-4.0(禁止任何商业使用);使用时须引用数据集论文(DOI 10.1101/2024.10.03.615261)与 HBN 项目论文(DOI 10.1038/sdata.2017.181)。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? HBN-EEG 是美国 Child Mind Institute「健康脑网络」(Healthy Brain Network, HBN)项目脑电采集的分析就绪版本。HBN 项目在纽约都会区招募了约 5,000 名 5-21 岁儿童与青少年,同时收集脑影像、脑电、眼动、认知与精神科评估等多模态数据;HBN-EEG 将其中的高密度脑电部分整理为标准 BIDS-EEG 格式,分 11 次发布、共覆盖 3,155 名被试,每次会话约 60 分钟、128 通道、500 Hz 采样。
为什么重要? 儿童青少年脑电公开数据长期稀缺,且多数数据集"能下载但不可分析"——事件说明散落在论文附录里。HBN-EEG 用 BIDS + HED 把事件、行为响应、任务条件全部结构化注释,被试级还附年龄、性别与内化、外化、注意、p-factor 四个精神病理维度,是当前规模最大、注释最完整的开放儿童脑电资源之一;配套的 OpenNeuro/NEMAR/EEGDash 生态让"下载到建模"可以一天内走通。
我能用它做什么? 开发和验证儿童脑电预处理与深度学习方法、跨被试回归精神病理维度、做自然刺激(看电影)下的神经编码研究、或把它当作跨数据集泛化的"训练池"。本条目给出 11 批次的版本抉择矩阵、可运行加载代码与 8 个实测坑点,帮你避开从下载到建模的全部已知陷阱。
§1.1 摘要
HBN-EEG 由 Shirazi 等人于 2024 年 10 月以 bioRxiv 预印本形式发布(DOI 10.1101/2024.10.03.615261),将 HBN 项目约 5,000 名 5-21 岁儿童与青少年队列中的高密度脑电会话整理为 BIDS-EEG 数据集。每位被试的采集会话约 60 分钟:128 通道 GSN 200 脑电网(EGI,文件内存储 129 个 EEG 通道,500 Hz)同步眼动记录,暗室、下颌托、Psychtoolbox 3 控制刺激呈现。六个任务分为两类:被动任务(静息态睁/闭眼、周围抑制、观看四部短片)与主动任务(序列学习、对比变化检测、符号搜索,需鼠标点击应答)。团队把行为响应同步为 EEG 事件标记、将数字事件码替换为描述性术语,并用 HED 层级事件描述符正式注释;对每个数据文件做了最小质量控制并标注不一致之处。首批 9 次发布(ds005505-ds005514,ID 跳过 ds005513)于 2024 年 10 月上线,覆盖 2,639 名被试;截至目前共 11 次发布(R1-R11,另有 458 人的非商业 NC 批次),合计 3,155 名被试。数据在 OpenNeuro、NEMAR 与 FCP-INDI S3 开放,主线批次许可为 CC-BY-SA 4.0,并可通过 EEGDash 一键加载为 PyTorch 数据集。
§1.2 战略价值
维度一:规模 × 注释质量的稀缺组合。 公开儿童脑电数据集多数只有几十到几百人,且事件注释粗糙。HBN-EEG 以 3,155 名被试、129 通道、500 Hz 的规格提供六任务数据,事件级注释采用 HED 标准并附行为响应(反应时、正确率),可直接支撑事件相关电位、跨任务迁移学习和"行为-神经"联合建模,无需研究者重新阅读原始协议或做"法证式"考据。
维度二:跨诊断研究的天然试验场。 数据集不按诊断分组招募,而是为每位被试提供内化、外化、注意与 p-factor 四个连续精神病理维度(源自 CBCL 问卷双因子模型)。这与 NIMH RDoC(Research Domain Criteria)框架高度契合:研究者可以直接把脑电特征映射到维度化心理病理学表征上,而不受传统诊断边界的限制;四个维度同时覆盖 ADHD、焦虑、抑郁、孤独症谱系等 ICD-11 类别的高发症状域,适合做跨诊断生物标记物筛选。
维度三:方法学基准与生态位。 依托 OpenNeuro/NEMAR/EEGDash 生态,HBN-EEG 是少数能从"网页点击下载"到"PyTorch DataLoader"全链路打通的脑电数据集,适合作为预处理算法、深度学习架构与联邦式多站点研究的公共基准底座;批次化的发布结构(R1-R11)天然支持"旧批次训练、新批次验证"的时间型泛化实验。
综合定位:如果你需要一个"注释完整、规模够大、许可干净"的儿童脑电训练池来做方法学研究,HBN-EEG 是当前社区最省力的入口之一;它的短板——无官方划分、无预处理管线、眼动与个体电极位置待发布——恰恰是研究者可以贡献增量、发方法学论文的空间。
§1.3 同源数据家族横向对比
| 数据集/批次 | 规模 | 模态与规格 | 标注 | 差异化定位 |
|---|---|---|---|---|
| HBN-EEG 主线(R1-R11) | 3,155 人(单批次 134-533 人) | 128 通道 500 Hz BIDS-EEG + 眼动(未随 EEG 发布) | HED 事件 + 行为响应 + 四个精神病理维度 | 本条目主体,社区标准入口 |
| Langer 等 2017 试点(Sci Data 170040) | 126 人(6-44 岁) | 同一套范式的高密度 EEG + 眼动 | 问卷 + 认知测验 | 六任务范式的设计出处与可行性验证 |
| EEG2025 衍生系列(如 eeg2025r1) | 单集 20-136 人 | 100 Hz BDF 转换版(eeg2025r1 约 20.6 GB) | 同主线 | 低算力/低带宽场景的轻量替代 |
| NC 批次(cmi_bids_NC) | 458 人 | 同主线(500 Hz BIDS-EEG) | 同主线 | 仅 S3 获取,CC-BY-NC-SA-4.0,禁商用 |
同类外部数据集(如 TUH EEG Corpus、LEMON 等)与 HBN-EEG 在人群、设备与许可上差异较大,未在本次核实范围内取得可直接对比的数字,故不列入本表以免误导。上表四行均为同一数据家族内部的可控对照:想理解范式出处选 Langer 2017,想省算力选 EEG2025 衍生,想合规商用避开 NC。
§1.4 版本时间轴
| 时间 | 事件 | 来源 |
|---|---|---|
| 2017-04 | Langer 等发表 HBN 六任务范式设计论文(Sci Data 4:170040,126 人试点) | doi.org/10.1038/sdata.2017.40 |
| 2017 | Alexander 等发表 HBN 项目总论文(Sci Data 4:170181) | doi.org/10.1038/sdata.2017.181 |
| 2024-10-03 | HBN-EEG 论文以 bioRxiv 预印本发布(DOI 10.1101/2024.10.03.615261) | biorxiv.org/content/10.1101/2024.10.03.615261 |
| 2024-10-04 | R1-R9 上线 OpenNeuro(ds005505-ds005514,ID 跳过 ds005513),覆盖 2,639 人 | openneuro.org/datasets/ds005506 |
| 2025-03-11 | R2 更新至 v1.0.1(OpenNeuro 版本记录) | openneuro.org/datasets/ds005506/versions/1.0.0 |
| 2025 | R10(DS005515,533 人)、R11(DS005516,430 人)及 EEG2025 100 Hz 衍生系列陆续释出,11 批次合计 3,155 人 | hf-cdn.sufy.com/datasets/EEGDash/eeg2025r1 |
§1.5 典型应用场景
- 儿童脑发育基准曲线:以静息态 + 电影观看任务刻画不同年龄段(5-21 岁)的谱功率、功能连接与微状态发育轨迹,注意按批次与性别分层以避免构成混淆。
- 跨诊断生物标记物筛选:以脑电特征回归 p-factor / 内化 / 外化 / 注意四维度,做跨诊断的神经-心理映射与特征稳定性检验,重点核对维度间共线性(§4.2)。
- 预处理与深度学习方法学基准:在统一 BIDS+HED 注释上比较伪迹去除、ICA、滤波与网络架构(如 EEGNet 类模型)的相对性能,划分口径按 §5 固定。
- 自然刺激神经编码:四部短片提供生态化视听流,配合同步事件标记做帧级/场景级神经响应编码与注意调制研究,事件起止以 events.tsv 为准。
- 跨批次/跨数据集泛化研究:利用批次化发布做"旧批次训练、新批次测试"的时间型泛化,或作为跨设备跨队列研究的训练池,建议同时报告批次内与批次外两套指标。
§2 医学背景
§2.1 ICD-11 编码映射表
HBN 队列为跨诊断设计(不按单一疾病招募),下表列出其精神病理维度与症状域对应的 ICD-11 相关类别:
| ICD-11 编码 | 中文名称 | 与 HBN-EEG 的关系 |
|---|---|---|
| 6A05 | 注意缺陷多动障碍(ADHD) | attention 维度的核心症状域;HBN 队列为 ADHD 研究的重点人群 |
| 6A02 | 孤独症谱系障碍 | 队列涵盖的神经发育障碍之一,社会注意与感知研究相关 |
| 6A03 | 发展性学习障碍 | HBN 项目(学习障碍评估起家)的重点方向之一 |
| 6B00 | 广泛性焦虑障碍 | internalizing(内化)维度对应症状域 |
| 6A70 | 单次抑郁发作 | internalizing 维度对应症状域(青少年抑郁研究) |
| 6E63 | 不含其他分类的行为或情绪障碍相关评估场景 | 以维度分(p-factor 等)表征的一般性心理病理负荷 |
§2.1b SNOMED CT 映射表
| 标签 | ICD-11 | SNOMED CT 码 | 术语 |
|---|---|---|---|
| 注意缺陷多动障碍 | 6A05 | 406506008 | Attention deficit hyperactivity disorder |
| 孤独症谱系障碍 | 6A02 | 70244009 | Autism spectrum disorder |
| 广泛性焦虑障碍 | 6B00 | 371631005 | Generalized anxiety disorder |
| 单次抑郁发作 | 6A70 | 370143000 | Major depressive disorder, single episode |
| p-factor / 跨诊断维度 | 不适用(研究维度,无单一 ICD-11 类目) | 不适用(问卷衍生连续分数) | General psychopathology factor(CBCL 双因子模型衍生) |
§2.2 疾病与人群背景
HBN 项目的目标人群是纽约都会区 5-21 岁的儿童与青少年,覆盖精神健康与学习障碍的跨诊断谱系:从 ADHD、学习障碍、孤独症谱系到焦虑、抑郁与一般性心理病理负荷。项目遵循 NIMH RDoC 框架,认为传统诊断边界在生物标志物研究中特异性不足,因此采集设计上"所有被试做全套评估",而不是按病种分组。HBN-EEG 附带的四个精神病理维度——内化(internalizing,指向焦虑抑郁类症状域)、外化(externalizing,指向冲动与行为失调类症状域)、注意(attention,指向 ADHD 类症状域)与 p-factor(一般性心理病理因子,表征整体负荷)——均由 CBCL(Child Behavior Checklist,儿童行为量表)问卷数据经双因子模型(bifactor model)推导而来,为连续分数。儿童青少年期是多数精神障碍的首发窗口,也是脑网络发育最活跃的阶段;以维度化量表 + 任务态/静息态脑电刻画该窗口的神经发育个体差异,是 HBN-EEG 的临床科学定位。需要注意:HBN 是"主动求助家庭"的研究队列(参与即可获得诊断见解与建议),并非按人口学抽样的流行病学队列,其患病率结构不能外推到一般人群。
从任务设计看,HBN-EEG 的六个任务并非随意组合:静息态与电影观看覆盖"无刺激—自然刺激"两端,适合研究内在功能网络与自然化加工;周围抑制与对比变化检测探测早期视觉加工与知觉决策;序列学习与符号搜索覆盖工作记忆与执行功能。这套"简单/复杂 × 被动/主动"的任务矩阵源自 Langer 等 2017 年的设计论文(Sci Data 4:170040),目的是让同一批被试的数据可以沿认知维度系统分解。
p-factor 是精神病理学中类比一般智力因素(g factor)的构造:一个表征多种症状共同变异的一般性因子。在儿童青少年队列中,p-factor 高分者往往在注意力、情绪与行为多方面同时受累;以连续维度建模而非诊断分组,可以保留个体间的等级差异信息,避免人为类别切分带来的统计功效损失——这正是 HBN-EEG 附带四维度分数而非诊断标签的科学考量。
§2.3 临床任务定义
在本数据集语境下,"临床任务"指研究者可在其上建模的下游问题,而非数据集自带的标准诊断任务:
| 任务类型 | 定义 | HBN-EEG 支撑方式 |
|---|---|---|
| 筛查(screening) | 以脑电特征估计心理病理维度分数,识别需转介评估的个体 | 四维度连续标签 + 六任务脑电,适合回归/排序建模 |
| 维度化诊断辅助 | 将注意/内化/外化维度映射到 ICD-11 症状域,辅助临床访谈前的分层 | 维度分与症状域的映射关系见 §2.1;注意:维度分不是诊断 |
| 分级(stratification) | 按 p-factor 负荷对队列分层,比较神经表型差异 | p-factor 为连续分,可分层或分箱(须声明切点依据) |
| 预后/发育追踪 | 跨年龄段建立发育常模,刻画偏离发育轨迹的个体 | 5-21 岁连续年龄跨度 + 每岁段大样本 |
§2.4 被试人群表
| 维度 | 描述 |
|---|---|
| 来源 | 纽约都会区社区招募的主动求助家庭(参与可获诊断见解),HBN 项目队列的脑电子集 |
| 采集时间 | HBN 项目自 2016 年前后启动(项目论文 2017 年发表于 Scientific Data);EEG 批次于 2024-2025 年以 BIDS 形式分批释出 |
| 年龄 | 5-21 岁;批次统计均值约 9.6-9.9 岁(R1 平均 9.9 岁、R8 平均 9.6 岁) |
| 性别 | 批次间不均衡(R8:91 女 / 166 男,女性约 35%) |
| 就医类型 | 社区研究队列(非住院、非急诊);采集在标准会诊/研究环境完成 |
| 规模 | 11 次发布合计 3,155 人;另有 NC 批次 458 人 |
| 任务可得性 | 非人人六任务全有;逐任务可用性见 participants.tsv 标志与论文 Figure 1 |
§2.5 临床价值
对临床 AI 而言,HBN-EEG 的价值集中在三点:其一,儿童脑电"正常发育参照系"——大样本跨年龄数据可用于建立谱功率、事件相关电位与功能连接的发育常模,为个体偏离检测提供基线;其二,维度化心理病理建模——相比二分类诊断,以连续维度为目标变量更贴近 RDoC 科学框架,也更利于早期风险识别;其三,评估-神经联合建模——CBCL 衍生维度与任务行为(反应时、正确率)同时可得,可支撑"认知表现 + 神经活动 → 心理病理"的多通路模型。需要强调的边界是:本数据集不能用于个体诊断输出,四维度分数也不等价于临床诊断结论(详见 §6.5 坑点 3)。
对研究设计的含义:队列层面的"跨诊断、全评估"设计意味着对照组与临床组不预先切分,研究者需要在建模阶段自行构造比较结构(维度分层、极端组对照或连续回归);这一自由度是把双刃剑——设计得当可以最大化样本效用,设计不当则容易做出无统计效力的亚组比较。建议在预注册阶段固定分析方案。
§2.6 金标准对照表
| 维度 | HBN-EEG 现状 | 说明 |
|---|---|---|
| 划分 | 无官方划分 | 数据以批次发布(R1-R11 互斥被试集),划分策略由研究者自定(建议见 §5) |
| 标注方式 | 自动 + 专家整理 | 行为响应由实验程序自动记录并同步为事件;HED 注释由策展团队统一生成;精神病理维度由问卷经双因子模型计算 |
| 标注者资质 | 研究团队(含 EEG 方法学专家) | 策展由 Shirazi、Delorme、Makeig 等 EEG 方法学研究者主导 |
| 性质 | 研究用参考标准,非临床金标准 | 四维度为问卷衍生分数;临床诊断结论须以 HBN 完整临床评估为准 |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 快速原型/方法调试 | R1(ds005505) | 103.1 GB | 最小独立批次(136 人 / 1,342 条记录),文档最完整 |
| 最大开放样本训练 | R10 + R11(或全批次合并) | 单批次 224-230 GB 级 | R10 533 人、R11 430 人,为最大的两个开放批次 |
| 商业或闭源产品 | 仅 R1-R11(避开 NC) | 同上 | NC 批次为 CC-BY-NC-SA-4.0,禁止商用;R1-R11 为 CC-BY-SA 4.0 |
| 低算力/低带宽 | EEG2025 衍生系列(如 eeg2025r1) | 20.6 GB | 100 Hz BDF 转换版,体积约为原版的 1/5(注意频带上限变化,见 §6.5 坑点 5) |
| 课堂教学/课程作业 | R1 或 EEG2025 衍生系列 | 20.6-103.1 GB | 单批次即可支撑完整教学流程,含 HED 教学素材 |
| 需要眼动或个体电极位置 | 尚无对应批次 | — | 两项均被官方列为"未来发布",当前批次未包含 |
§3.1 模态详情
脑电(主体模态):128 通道 GSN 200 高密度脑电网(Magnetism-EGI, Eugene, OR),会话约 60 分钟,采样率 500 Hz;BIDS 文件内记录 129 个 EEG 通道(第 129 通道为参考通道)。被试坐在暗室中、下颌托固定头部、注视计算机屏幕。
眼动(同步采集,暂未随 EEG 批次发布):脑电采集全程同步记录眼动;官方已声明眼动数据将随后续发布提供,当前 EEG 批次内不含。这意味着以"注视位置"为条件的分析(如电影观看中的注视点对齐)目前无法在本数据集内完成,需等待眼动批次或改用他源数据。
行为响应:三个主动任务的鼠标点击响应(反应时、正确率)由控制工作站记录,并已同步为 EEG 数据内的事件标记,写入 events.tsv。
问卷精神病理维度:被试级表格(participants.tsv)附年龄、性别与内化、外化、注意、p-factor 四个维度分数(CBCL 双因子模型衍生)。
六个任务范式一览(被动/主动按是否有被试应答划分):
| 任务 | 类型 | 被试动作 | 对应 BIDS 任务标签 |
|---|---|---|---|
| 静息态 | 被动 | 下颌托固定,按指令睁眼/闭眼并注视中央十字 | RestingState |
| 周围抑制 | 被动 | 注视外围闪烁圆盘与背景的对比变化 | surroundSupp |
| 电影观看 | 被动 | 观看四部主题不同的短片(起止时间有事件标记) | DespicableMe、DiaryOfAWimpyKid、FunwithFractals、ThePresent |
| 序列学习 | 主动 | 记忆并复现屏幕上闪现的圆圈序列(按年龄分 6/8 目标两版本) | seqLearning6target、seqLearning8target |
| 对比变化检测 | 主动 | 识别闪烁圆盘中占主导的对比度变化并点击应答 | contrastChangeDetection |
| 符号搜索 | 主动 | 在若干行搜索符号中找出目标符号并点击 | symbolSearch |
主动任务的鼠标点击响应已同步为 EEG 事件;四部短片的呈现起止以 events.tsv 标记为准,做自然刺激分析时应读取事件而非假设固定时长。
§3.2 按批次样本数表
| 批次 | OpenNeuro ID | 被试数 | 备注 |
|---|---|---|---|
| Release 1 | ds005505 | 136 | 首发批次,文档最全;1,342 条记录 |
| Release 2 | ds005506 | 152 | v1.0.0 → v1.0.1(2025-03-11) |
| Release 3 | ds005507 | 183 | |
| Release 4 | ds005508 | 324 | 3,342 条记录,229.8 GB |
| Release 5 | ds005509 | 330 | 3,326 条记录,224.2 GB |
| Release 6 | ds005510 | 134 | 注意:官方 README 曾误写为 “DS05510” |
| Release 7 | ds005511 | 381 | |
| Release 8 | ds005512 | 257 | 2,320 条记录;91 女/166 男;平均 9.6 岁 |
| Release 9 | ds005514 | 295 | 注意:ID 跳过 ds005513 |
| Release 10 | ds005515 | 533 | 最大的开放批次 |
| Release 11 | ds005516 | 430 | |
| Release NC | 无(仅 S3) | 458 | CC-BY-NC-SA-4.0,禁商用,不上架 OpenNeuro/NEMAR |
R1-R11 被试数相加 = 3,155 人,与官方">3,000 名参与者、11 次发布"的表述一致。前 9 批次在论文发表时合计 2,639 人(2,634 人至少有一个"可用"数据集)。
阅读本表的三个提示:① 批次间被试互斥,合并使用时无需去重,但仍应核对版本号;② 批次规模差异很大(134-533 人),按批次分层抽样可避免大批次主导训练;③ 上表人数为批次设计口径,实际某任务可用的被试数以 participants.tsv 为准(通常更少)。
§3.3 数据格式表
| 组成 | 格式 | 说明 |
|---|---|---|
| EEG 数据 | BIDS-EEG 规范的 EEG 数据文件 | 每被试每任务一个文件;EEG2025 衍生系列为 100 Hz BDF 转换版 |
| 事件注释 | events.tsv + events.json | 含任务条件与行为响应,HED 标签逐事件注释(HED 8.3.0) |
| 被试级表 | participants.tsv / participants.json | 年龄、性别、四维度分数、QC 可用性标志 |
| 通道与设备 | channels.tsv、*_eeg.json | 通道类型/参考与采样率等 sidecar 元数据 |
| 数据集描述 | dataset_description.json | BIDS 1.9.0;版本号与引用信息 |
| 引用与许可 | README(各批次页内) | 许可条款、致谢、必引论文清单 |
§3.4 存储大小
| 对象 | 大小 | 来源口径 |
|---|---|---|
| R1(ds005505) | 103.1 GB(1,342 条记录,117.5 小时) | OpenNeuro/EEGDash 元数据 |
| R4(ds005508) | 229.8 GB(3,342 条记录,262 小时) | EEGDash 元数据 |
| R5(ds005509) | 224.2 GB(3,326 条记录,255.3 小时) | EEGDash 元数据 |
| eeg2025r1(100 Hz 衍生) | 20.6 GB | Hugging Face 数据卡 |
| 全部 11 批次合计 | 约 2 TB(按各批次体量推算) | 由 R1/R4/R5 实测值外推,非官方汇总数字 |
§3.5 标注方式
三类标注、三种生成方式:任务条件与行为标注由实验控制程序自动生成(数字事件码经策展替换为描述性术语,行为响应从原 HBN behavior 目录并入 EEG 数据的事件文件);HED 形式化注释由策展团队按 HED 8.3.0 标准逐事件生成,描述刺激属性、被试动作与任务语境,目的是让跨数据集 mega-analysis 可以程序化筛选事件;被试级维度分数由 CBCL 问卷经双因子模型统计推导(非人工逐例标注)。官方质量控制为"最小质检":校验数据未损坏、每任务事件齐全、可进入预处理,结果写入 participants.tsv 的可用性标志;文件级不一致之处由策展流程标记而非修复。这一"最小质检"定位意味着:数据完整性有兜底,但信号质量(坏导比例、伪迹密度、高幅瞬态)没有官方评估——研究者需要自行建立伪迹 QC 报告并把 QC 过程写入论文。这是从"可下载"到"可分析"之间最需要补齐的一环,也是本条目 §6.3 与 §6.5 坑点 6 的设计出发点。
§3.6 标注者资质与一致性
事件与 HED 注释由 UCSD Swartz 计算神经科学中心团队(含 HED 标准的长期维护者 Delorme、Makeig)统一生成,非众包标注,不存在标注者间一致性(IAA)指标;问卷维度分数为标准化量表的确定性计算结果。研究者若做二次人工标注(如伪迹标签),需自行报告 IAA。
§3.7 采集周期
HBN 项目自 2016 年前后启动持续采集(项目论文 2017 年发表于 Scientific Data,并声明采集仍在继续);EEG 会话随项目多年累积,BIDS 化整理由 NIH/NIMH R01MH125934 资助,于 2024 年 10 月起以批次形式释出,至 2025 年共 11 个开放批次,且官方声明后续仍有发布计划。
§3.8 地域覆盖
全部被试来自美国纽约都会区(greater New York City metropolitan area)。数据集无地理分层抽样设计,地域代表性有限。
§3.9 设备规格表
| 项目 | 规格 |
|---|---|
| 放大器/电极系统 | GSN 200 高密度脑电网(Magnetism-EGI, Eugene, OR) |
| 通道数 | 128 通道网;BIDS 文件内存储 129 个 EEG 通道(含参考) |
| 采样率 | 500 Hz(主线批次);EEG2025 衍生系列 100 Hz |
| 同步模态 | 眼动(全程同步;数据后续发布) |
| 刺激与行为 | Psychtoolbox 3(Linux 工作站)控制刺激呈现与鼠标点击应答 |
| 采集环境 | 暗室、下颌托、注视屏幕 |
| 个体化解剖 | 约 2,200 名被试在会话结束时完成电极位置摄影测量扫描(尚未随批次发布) |
| 刺激控制 | Psychtoolbox 3(Linux 主控工作站),独立工作站分别记录 EEG 与眼动 |
| 会话时长 | 约 60 分钟(含全部六个任务) |
| 事件编码 | 实验控制程序的数字事件码已替换为描述性术语并附 HED 标签 |
§3.10 深度溯源链
| 环节 | 主体 | 可验证凭据 |
|---|---|---|
| 项目设计与采集 | Child Mind Institute(HBN 项目,Chesapeake IRB 批准) | Alexander et al., Sci Data 2017(DOI 10.1038/sdata.2017.181) |
| 范式设计 | Langer 等(Sci Data 2017) | DOI 10.1038/sdata.2017.40(126 人试点) |
| BIDS 化与 HED 注释 | UCSD Swartz 计算神经科学中心团队(NIMH R01MH125934 资助) | Shirazi et al., bioRxiv 2024(DOI 10.1101/2024.10.03.615261) |
| 分发 | OpenNeuro(ds005505-ds005516)、NEMAR、FCP-INDI S3 | 数据集 DOI(如 10.18112/openneuro.ds005505.v1.0.1) |
| 加载层 | EEGDash / Hugging Face 镜像 | eegdash.org 与各数据卡 |
每一步均可在数据集论文与各批次 README 中交叉验证;任一数字出现冲突时,以 OpenNeuro 版本页与论文 Figure 1/Table 1 为准。
§4 数据结构
§4.0 目录树
以 R1(ds005505)为例,解压后的 BIDS-EEG 目录结构(其余批次同构):
ds005505/
├── dataset_description.json # BIDS 版本、数据集名称与引用信息
├── participants.tsv # 被试级表:年龄/性别/四维度/QC 可用性标志
├── participants.json # participants.tsv 各列的说明字典
├── sub-NDARXXXXXX/ # 每位被试一个目录(NDAR 风格哈希 ID)
│ └── eeg/
│ ├── sub-NDARXXXXXX_task-RestingState_eeg.set # EEG 数据(EEGLAB 生态)
│ ├── sub-NDARXXXXXX_task-RestingState_eeg.json # sidecar:采样率/参考等
│ ├── sub-NDARXXXXXX_task-RestingState_channels.tsv # 通道表(类型/状态)
│ ├── sub-NDARXXXXXX_task-RestingState_events.tsv # 事件 + 行为 + HED 标签
│ ├── sub-NDARXXXXXX_task-RestingState_events.json # 事件列说明字典
│ └── sub-NDARXXXXXX_task-DespicableMe_eeg.set ... # 其余任务同构
├── sub-NDARYYYYYY/
│ └── egg/ …(同上结构)
└── …
十个 BIDS 任务标签对应六个实验任务:RestingState(静息态);surroundSupp(周围抑制);DespicableMe、DiaryOfAWimpyKid、FunwithFractals、ThePresent(四部短片的 Movie Watching);seqLearning6target、seqLearning8target(序列学习,6/8 目标两版本);contrastChangeDetection(对比变化检测);symbolSearch(符号搜索)。
目录树逐项解读:
- participants.tsv 是唯一需要先读的文件:QC 可用性标志与四维度分数都在这里,决定"哪些被试/哪些任务能进实验"(坑点 6)。
- events.tsv 是第二优先:任务条件与行为响应(含 HED 标签)都在事件行级,ERP 与自然刺激分析全部依赖它。
- *_eeg.json 与 channels.tsv:采样率、参考通道与通道类型口径;怀疑通道数不对时先看这两个文件(坑点 1)。
- subject 目录名即 participant_id:直接对应 participants.tsv 行,可做 join。
- 被标注不一致的文件:以 participants.tsv 标志与论文 Figure 1 口径为准,宁弃勿猜。
§4.1 DAIMS 字段字典(8 列)
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| participant_id | string | NDAR 风格哈希被试 ID,跨文件主键 | sub-NDARJH910CGX | 分组切分、去重 | 无(生成规则统一) | 无 | 3,155 个唯一值(R1-R11) |
| task | string | BIDS 任务标签(10 个标签对应 6 任务) | task-RestingState | 任务条件建模 | 无 | 无 | 10 个枚举值 |
| onset | float | 事件起始时间(秒,相对记录起点) | 12.417 | ERP 对齐、时间窗切分 | 毫秒级同步误差 | n/a | ≥0 |
| duration | float | 事件持续时长(秒) | 1.500 | 刺激时长建模 | 同上 | n/a | 任务相关 |
| trial_type / HED | string | 描述性事件术语 + HED 正式标签 | film-start; Screen… | 事件筛选、跨数据集 mega-analysis | 依赖策展一致性 | n/a | HED 8.3.0 词表 |
| reaction_time | float | 主动任务鼠标点击反应时(秒) | 0.412 | 行为-神经联合建模 | 鼠标轮询精度 | n/a | 任务相关 |
| age | float | 被试年龄(岁) | 9.9 | 发育常模、分层 | 自陈/档案核对 | n/a | 5-21 |
| sex | string | 被试性别 | F / M | 分层与公平性评估 | 批次间报告率不一 | n/a | F / M |
| p_factor | float | 一般性心理病理因子(CBCL 双因子模型) | -0.832 | 回归目标变量 | 问卷测量误差 | n/a | 连续标准化分数 |
| internalizing | float | 内化维度分数 | 0.214 | 回归目标变量 | 同上 | n/a | 连续标准化分数 |
| externalizing | float | 外化维度分数 | -0.107 | 回归目标变量 | 同上 | n/a | 连续标准化分数 |
| attention | float | 注意维度分数 | 1.056 | ADHD 症状域研究 | 同上 | n/a | 连续标准化分数 |
| 可用性标志(participants.tsv) | string/int | 各任务数据的 QC 可用性标记 | available / n/a | 加载前过滤 | 最小质检口径 | n/a | 标志枚举值 |
字典使用说明:事件级字段(onset/duration/trial_type/reaction_time)逐行出现在 events.tsv;被试级字段(age/sex/四维度/可用性)逐行出现在 participants.tsv。两表以 participant_id 关联;EEG 信号本体不在字典内(时序矩阵,规格见 §3.9)。
§4.2 标签分布
HBN-EEG 无离散诊断标签;四个精神病理维度为连续标准化分数,官方未发布全量分布直方图。已核实的分布性事实:年龄横跨 5-21 岁(批次均值约 9.6-9.9 岁);R8 性别构成为 91 女/166 男(约 35% 女性);事件侧每条记录含任务条件事件与(主动任务的)行为响应事件,HED 标签覆盖全部事件。研究者应基于所下载批次自行绘制四维度分布,并在使用分箱时声明切点依据。
四个维度的相关结构由双因子模型决定:p-factor 与三个具体维度在理论上正相关且互相缠绕,直接把四者当作四个独立目标分别建模报告,会低估联合不确定性;如需多目标建模,建议先报告维度间相关矩阵,再考虑多任务学习头或显式残差化处理。
§4.3 关键统计
| 统计项 | 数值 | 口径 |
|---|---|---|
| 开放被试总数 | 3,155 人(R1-R11 相加) | 各批次 README/EEGDash 元数据 |
| 单批次记录数 | 134-533 人对应约 1,342-3,342+ 条记录 | R1=1,342;R4=3,342;R5=3,326 |
| 通道/采样率 | 129 通道 × 500 Hz(主线批次) | EEGDash 元数据(1342 条记录一致) |
| 记录总时长 | R1 117.5 小时;R4 262 小时;R5 255.3 小时;R8 179 小时 | EEGDash 元数据 |
| 任务数 | 6 个实验任务 / 10 个 BIDS 任务标签 | 论文与 README |
| 开放批次数 | 11(另含 NC 批次 458 人) | 官方 README/NINE Lab |
| 标准版本 | BIDS 1.9.0 / HED 8.3.0 | NEMAR R1 元数据 |
| 事件注释覆盖 | 全部事件(含并入的行为响应) | 论文与 README |
| 个体化电极位置 | 约 2,200 人(摄影测量,未随批次发布) | 论文 Methods |
§4.4 数据层级
项目(HBN)→ 批次(R1-R11,互斥被试集)→ 被试(participant_id)
→ 记录(被试 × 任务,一次任务一个 EEG 文件)→ 事件(events.tsv 行级)
→ 样本点(129 通道 × 500 Hz 时序)
被试为最高层级自然主键;同一被试最多 10 个任务标签的多条记录,这是划分策略(§5)必须以被试为单位分组的原因。
层级设计的两个推论:其一,任何"以记录为样本"的统计都必须先按被试聚合或分组,否则自由度被高估、显著性被夸大;其二,跨批次合并时无需担心被试重复——批次间互斥是被试层面的设计保证,但仍需按 participants.tsv 逐一确认,且不要把同一批次的 v1.0.0 与 v1.0.1 两个版本同时入池(会造成表面重复,见 §5.3)。
§4.5 缺失值与信息性缺失编码
| 缺失情形 | 表现形式 | 处理建议 |
|---|---|---|
| 被试无某任务数据 | 该任务文件整个不存在(非空文件占位) | 加载前按 participants.tsv 可用性标志过滤 |
| 表格字段缺失 | BIDS 惯例 n/a | 读取时显式解析 n/a,勿当字符串 |
| 记录被标记不一致 | 策展流程在注释/标志中标记而非修复 | 复现官方"available"判定(数据长度/采样率/事件三条件) |
| 个体化电极位置 | 未随批次发布(约 2,200 人有摄影测量) | 使用标准蒙太奇并在论文声明局限 |
| 维度分数缺失 | participants.tsv 对应列为 n/a | 回归任务前显式 dropna 并报告缺失量 |
n/a 是 BIDS 的标准缺失记号,读取时务必显式解析(如 pandas 的
keep_default_na配合na_values=["n/a"]),不要把字符串 “n/a” 带进数值管道。
§5 划分与使用建议
§5.1 官方划分
无。数据以互斥被试集的批次形式发布(R1-R11),官方未提供训练/验证/测试划分,也未设立基准排行榜(截至 2026-09)。这意味着两件事:其一,任何公开结果的可比性取决于作者自述的划分口径,复现时务必核对批次清单与随机种子;其二,这为方法学论文留下了标准的贡献点——把"划分 + 预处理 + 指标"打包成可复现套件发布,本身就是社区需要的增量。
§5.2 社区惯例与建议划分
| 策略 | 做法 | 适用场景 |
|---|---|---|
| 被试分组划分 | 以 participant_id 为组做 GroupShuffleSplit / GroupKFold | 常规方法开发(任何场景的底线要求) |
| 批次外推划分 | 训练 R1-R9,测试 R10/R11 | 时间型泛化、发布鲁棒性评估 |
| 任务内/跨任务划分 | 同任务训练、跨任务测试(或任务留一) | 表征泛化与迁移学习研究 |
| 低算力子集 | 仅用 R1 或 EEG2025 衍生系列(100 Hz) | 原型迭代、课程教学 |
划分示例配置(写入实验配置文件并随代码发布):
# split_config.yaml — 与结果一起发布的划分声明示例
batches: ["ds005505", "ds005508", "ds005509"] # 批次 ID + 版本号必填
versions: {"ds005505": "v1.0.1", "ds005508": "v1.0.1", "ds005509": "v1.0.1"}
strategy: "group_kfold" # 按 participant_id 分组
n_splits: 5
random_seed: 42
excluded: "participants.tsv 中目标维度为 n/a 的被试"
无论采用哪种策略,建议在结果中固定报告三个口径:批次清单(含版本号)、被试级样本量、每任务的记录数;这使不同论文之间的数字具备可比性(§8.3)。
§5.3 泄漏风险(重点)
- 记录级随机切分 = 被试泄漏:R1 有 1,342 条记录但仅 136 人;随机打乱记录几乎必然让同一被试同时出现在训练与测试集,指标虚高(详见 §6.5 坑点 2)。
- 滑窗重叠泄漏:连续 EEG 切窗训练时,相邻窗口高度相关;同一被试的窗口必须同侧放置,窗口间建议留间隔。
- 维度分数间共线性:四个精神病理维度源自同一 CBCL 双因子模型,天然相关;把它们当作四个独立目标分别报告会低估联合不确定性。
- 跨版本混用:同一批次存在 v1.0.0 与 v1.0.1(如 ds005506),混用可能重复计入同一被试的修订前后数据。
- 许可边界(广义泄漏):将 NC 批次(CC-BY-NC-SA-4.0)混入将被商业化的训练产物,虽不是统计泄漏,但属许可违规且后果更严重(坑点 8)。
§5.4 交叉验证建议
以被试为组的 5 折 GroupKFold 为默认配置;报告折间标准差;若关注跨发布稳定性,叠加"批次外推"方案做敏感性分析。若算力允许,优先把"批次外推"结果放进主实验的稳健性附录——它是发布持续演化环境下最接近真实部署的口径。
§5.5 外部验证建议
在儿童其他脑电队列上验证特征泛化性;跨设备(EGI 128 通道网 → 其他系统)时须重配电极蒙太奇;任何临床声称(如筛查辅助)必须在独立临床样本上外部验证后方可提出。特征层面建议先验证"跨批次"再验证"跨队列":如果批次外推已经大幅掉点,跨设备/跨队列泛化大概率更差,应先在数据分布层面做归因分析,而不是直接宣布方法失效。
§6 AI 就绪指南
§6.0 云端快速启动
无需申请、无 DUA:主线批次在 OpenNeuro / NEMAR 直接开放。三条路径任选——浏览器访问 OpenNeuro 网页下载;openneuro-py 命令行批量下载;EEGDash 库在首次实例化时自动按需缓存(推荐,自动处理 BIDS 结构与元数据)。NC 批次只能经 AWS CLI 从 FCP-INDI S3 同步(禁商用)。
OpenNeuro 生态内还可一键接入第三方云分析平台(以 R2 批次页面列出的选项为准):
| 平台 | 用途 | 适合人群 |
|---|---|---|
| NEMAR | 脑电专用在线分析(MEG/iEEG/EEG) | 想在浏览器里跑 QC/预处理的研究者 |
| Brainlife.io | 免费云端流水线编排 | 无本地算力的用户 |
| CBRAIN | 分布式计算平台 | 大批量作业、多任务并行 |
| Neurodesk | 浏览器内挂载数据的分析环境 | 熟悉容器化神经影像工具链的用户 |
§6.1 快速上手
# ============================================================
# 快速上手:5 分钟加载 HBN-EEG Release 1(ds005505)
# ------------------------------------------------------------
# 目录结构预期(EEGDash 自动缓存,无需手工组织):
# ./cache/
# └── ds005505/ # 自动下载的 BIDS 子集
# ├── sub-NDARxxxx/ # 每位被试一个目录
# │ └── eeg/
# │ ├── ..._eeg.set # EEG 数据(EEGLAB 生态)
# │ ├── ..._events.tsv # 事件 + 行为 + HED 注释
# │ └── ..._eeg.json # 采样率等 sidecar
# ├── participants.tsv # 年龄/性别/四维度/QC 标志
# └── dataset_description.json
# data_root 拼接关系:cache_dir + 数据集 ID(EEGDash 内部管理)
# 最小可用子集:单个 ds005505(136 人 / 1,342 条记录 / 103.1 GB)
# ============================================================
from eegdash import EEGDashDataset
ds = EEGDashDataset(dataset="ds005505", cache_dir="./cache")
print(len(ds), "recordings") # 1,342
raw = ds.datasets[0].raw # MNE Raw 对象
print(raw.info["sfreq"], raw.info["nchan"]) # 500.0 Hz;129 通道
返回的是 MNE
Raw对象列表,可直接进入 §6.3 的预处理流程;如需 PyTorch 张量,见 §6.4。
验证安装与环境:
import mne, torch, eegdash
print(mne.__version__, torch.__version__, eegdash.__version__)
推荐环境:Python 3.10+,mne ≥1.6,mne-bids ≥0.14,torch ≥2.0;首次实例化会联网拉取数据,磁盘请按 §6.8 预留。若网络受限,可改走 §6.2 的 S3 批量路径,再把本地 BIDS 目录交给 mne-bids 读取。
§6.2 数据获取
| 渠道 | 方式 | 适用 | 大小口径 |
|---|---|---|---|
| OpenNeuro | 网页或 openneuro-py 下载 ds005505-ds005516 | 单批次完整 BIDS | R1 103.1 GB 至 R4 229.8 GB |
| NEMAR | nemar.org 数据浏览器(含在线分析) | 预览与云端 QC 统计 | 同 OpenNeuro |
| FCP-INDI S3 | aws s3 sync s3://fcp-indi/data/Projects/HBN/BIDS_EEG/cmi_bids_R* | 全量批量/NC 批次 | 各批次独立目录(cmi_bids_R1…R11、cmi_bids_NC) |
| EEGDash | pip install eegdash,按需流式缓存 | Python/PyTorch 用户 | 仅缓存用到的记录 |
| Hugging Face 镜像 | 元数据与批次统计查阅 | 选批次/写论文阶段 | 不存数据本体,仅数据卡 |
不用 EEGDash 的直读路径:已通过 §6.2 命令拿到本地 BIDS 后,直接用 mne-bids 读取即可,无需任何专用库——
# 直读本地 BIDS(不依赖 EEGDash;适合 S3/OpenNeuro 下载好的目录)
import mne_bids
bpath = mne_bids.BIDSPath(
root="./data/ds005505", subject="NDARJH910CGX",
task="RestingState", datatype="eeg",
)
raw = mne_bids.read_raw_bids(bids_path=bpath) # 自动并入 sidecar 与事件注释
# 方法 B:openneuro-py 下载整批 BIDS(写入 ./data/ds005505)
# pip install openneuro-py
import openneuro
openneuro.download(dataset="ds005505", target_dir="./data/ds005505")
# 方法 C:AWS CLI 同步 S3(公开桶,--no-sign-request;NC 批次禁商用)
# aws s3 sync --no-sign-request \
# s3://fcp-indi/data/Projects/HBN/BIDS_EEG/cmi_bids_R11 ./data/cmi_bids_R11
常用批量命令速查(其余批次替换批次号/目录名;注意坑点 4 的 ID 跳号):
| 目标 | 命令要点 |
|---|---|
| 单批次整包(OpenNeuro) | openneuro-py download --dataset ds005505 --target-dir ./data/ds005505 |
| 全量 S3 同步 | aws s3 sync --no-sign-request s3://fcp-indi/data/Projects/HBN/BIDS_EEG/ ./data/HBN_BIDS_EEG/ |
| 仅 NC 批次 | 同步 .../cmi_bids_NC 子目录,并单独打上"禁商用"许可标记 |
| EEG2025 衍生 | 经 NEMAR/EEGDash 获取(eeg2025r1 等,100 Hz BDF) |
下载后的自检清单:① dataset_description.json 存在且 BIDS 版本为 1.9.0;② participants.tsv 行数与预期被试数一致(如 R1 = 136);③ 抽查一个被试目录,确认 events.tsv 非空且含 HED 列;④ 记录下载日期与来源(OpenNeuro 版本号或 S3 路径),写进实验配置。
§6.3 预处理全流程
推荐管线五步:① 读取(mne-bids 自动并入 sidecar 与事件注释);② 定位蒙太奇(GSN-HydroCel-129,坑点 1);③ 重参考与滤波(1-50 Hz + 60 Hz 陷波;100 Hz 衍生版带通上限 40 Hz,坑点 5);④ ICA 去伪迹(目视确认成分后再应用);⑤ 按事件分段(事件与行为已在 events.tsv/注释中,坑点 6)。每步参数应写入配置文件并随结果发布。
<details>
<summary>§6.3 完整预处理代码(点击展开)</summary>
# 依赖:pip install mne mne-bids pandas scikit-learn
import mne
import mne_bids
import pandas as pd
BIDS_ROOT = "./data/ds005505" # §6.2 下载得到的 BIDS 根目录
# 1) 读取单个 BIDS 记录(EEG 数据 + sidecar 元数据)
raw = mne_bids.read_raw_bids(
bids_path=mne_bids.BIDSPath(
root=BIDS_ROOT, subject="NDARJH910CGX", task="RestingState",
datatype="eeg",
)
)
# 2) 定位标准蒙太奇(GSN-HydroCel-129 与文件内 129 通道一一对应)
# 注意坑点 1:128 通道网 + 1 个参考通道 = 129 个存储通道
montage = mne.channels.make_standard_montage("GSN-HydroCel-129")
raw.set_montage(montage, on_missing="raise")
# 3) 重参考 + 通道清理(参考通道处理方式见 §6.5 坑点 1)
raw.set_eeg_reference(ref_channels="average", projection=False)
# 4) 滤波:主线批次 500 Hz,带通 1-50 Hz + 60 Hz 工频陷波(美国电网)
raw.filter(l_freq=1.0, h_freq=50.0, picks="eeg")
raw.notch_filter(freqs=[60.0], picks="eeg")
# 5) ICA 去伪迹(示例:跑 15 个成分,用 EOG 通道自动定标;无 EOG 时可跳过)
ica = mne.preprocessing.ICA(n_components=15, random_state=97, max_iter="auto")
ica.fit(raw, picks="eeg")
# ica.apply(raw) # 确认成分后再应用
# 6) 分段:由注释构造事件(events.tsv 中的行为事件可用于联合分析)
sfreq = raw.info["sfreq"]
events, event_id = mne.events_from_annotations(raw)
epochs = mne.Epochs(raw, events, event_id, tmin=-0.2, tmax=1.0,
baseline=(-0.2, 0), preload=True, reject_by_annotation=True)
</details>
常用预处理参数速查(主线批次 500 Hz 口径):
| 环节 | 推荐参数 | 说明 |
|---|---|---|
| 带通滤波 | 1-50 Hz | 保留 ERP 关键频段;高频段研究另议 |
| 工频陷波 | 60 Hz | 美国电网;可叠加 120 Hz 谐波 |
| 重参考 | 平均参考 | 也可选保留参考通道后重新指定(坑点 1) |
| 分段窗 | -0.2 ~ 1.0 s | 按任务事件类型调整 |
| 基线校正 | -0.2 ~ 0 s | ERP 分析标配 |
| 降采样 | 200-250 Hz(可选) | 仅在不需要 >100 Hz 频段时使用 |
| 100 Hz 衍生版 | 带通上限 40 Hz | 坑点 5;勿照搬 500 Hz 参数 |
§6.4 PyTorch DataLoader 完整代码
设计要点:① 示例采用"频带谱功率"特征而非原始波形,使单卡即可跑通整批;② 划分在 Dataset 构造之前按被试完成,天然规避坑点 2;③ 对没有目标任务文件的被试静默跳过(坑点 6),建议另行记录跳过清单;④ 维度分数缺失的被试显式剔除。以下示例以 R1 静息态记录回归 p-factor。
<details>
<summary>§6.4 完整 PyTorch Dataset + DataLoader(点击展开)</summary>
# 任务示例:以静息态记录的谱特征回归 p-factor(演示按"被试"分组切分)
# 依赖:pip install torch mne mne-bids pandas scikit-learn numpy
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
from sklearn.model_selection import GroupShuffleSplit
import mne
import mne_bids
BIDS_ROOT = "./data/ds005505"
TASK = "RestingState"
BANDS = {"delta": (1, 4), "theta": (4, 8), "alpha": (8, 13), "beta": (13, 30)}
class HBNEEGDataset(Dataset):
"""逐记录计算五段谱功率特征,返回 (特征, p_factor, participant_id)。"""
def __init__(self, bids_root: str, task: str, participants: pd.DataFrame):
self.records = []
montage = mne.channels.make_standard_montage("GSN-HydroCel-129")
for _, row in participants.iterrows():
bpath = mne_bids.BIDSPath(
root=bids_root, subject=row["participant_id"], task=task,
datatype="eeg", extension=".set",
)
if not bpath.fpath.exists(): # 坑点 6:并非人人六任务全有
continue
raw = mne_bids.read_raw_bids(bids_path=bpath)
raw.set_montage(montage, on_missing="raise")
raw.drop_channels([ch for ch in ("E129",) if ch in raw.ch_names])
raw.pick("eeg").load_data().filter(1.0, 40.0, picks="eeg")
psd = raw.compute_psd(method="welch", fmin=1, fmax=40, picks="eeg")
freqs, powers = psd.freqs, psd.get_data()
feats = []
for lo, hi in BANDS.values(): # 每频段平均功率 → 129 维
band = powers[:, (freqs >= lo) & (freqs < hi)].mean(axis=1)
feats.append(np.log10(band + 1e-12))
self.records.append((np.concatenate(feats).astype("float32"),
float(row["p_factor"]),
row["participant_id"]))
def __len__(self):
return len(self.records)
def __getitem__(self, idx):
x, y, pid = self.records[idx]
return torch.from_numpy(x), torch.tensor(y, dtype=torch.float32), pid
# ---- 被试级表与分组划分(坑点 2 的核心防线)----
participants = pd.read_csv(f"{BIDS_ROOT}/participants.tsv", sep="\t")
participants = participants.dropna(subset=["p_factor"]) # 维度分数缺失者剔除
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
train_idx, test_idx = next(gss.split(participants, groups=participants["participant_id"]))
train_df, test_df = participants.iloc[train_idx], participants.iloc[test_idx]
train_set = HBNEEGDataset(BIDS_ROOT, TASK, train_df)
test_set = HBNEEGDataset(BIDS_ROOT, TASK, test_df)
train_loader = DataLoader(train_set, batch_size=32, shuffle=True, num_workers=2)
test_loader = DataLoader(test_set, batch_size=32, shuffle=False, num_workers=2)
for x, y, pid in train_loader: # x: [B, 516](4 频段 × 129 通道)
pass # 交给模型(MLP/EEGNet 特征版均可)
</details>
接上 DataLoader 的最小模型头示例:
import torch.nn as nn
class BandRegressor(nn.Module):
"""频带谱功率 → p-factor 的最小回归头。"""
def __init__(self, in_dim: int = 4 * 129, hidden: int = 256):
super().__init__()
self.net = nn.Sequential(
nn.Linear(in_dim, hidden), nn.GELU(), nn.Dropout(0.3),
nn.Linear(hidden, 64), nn.GELU(),
nn.Linear(64, 1),
)
def forward(self, x):
return self.net(x).squeeze(-1)
# 训练循环(回归任务最小骨架;验证与早停按需加入)
model = BandRegressor()
opt = torch.optim.AdamW(model.parameters(), lr=1e-3, weight_decay=1e-2)
for epoch in range(20):
model.train()
for x, y, _pid in train_loader:
opt.zero_grad()
loss = torch.nn.functional.mse_loss(model(x), y)
loss.backward()
opt.step()
§6.5 常见坑点(8 个)
以下 8 个坑点全部来自 HBN-EEG 的真实结构特性与官方文档/元数据中可验证的细节(批次 ID 跳号、通道数口径、许可特例、QC 口径等),按"问题 → 症状 → 解决(简单/进阶/SOTA)→ 参考"四段式给出。建议在项目启动周内通读一遍,再对照 §6.3/§6.4 的代码逐条排查。
⚠️ 坑点 1:把 129 个存储通道当成 128 通道处理(分类:预处理陷阱)
问题:GSN 200 是 128 通道电极网,但 BIDS 文件内存储 129 个 EEG 通道(第 129 个为参考通道)。按论文口径写死 128 会导致蒙太奇定位与张量形状错误。
症状:set_montage报通道位置缺失;重参考/ICA 时维度报错;与其他数据集合并时 epoch 张量形状不一致。
解决:
- 简单方法:读取后
raw.drop_channels(["E129"])(或按 channels.tsv 中的参考通道标记)再定位标准 128 通道蒙太奇。- 进阶方法:先用
mne.channels.make_standard_montage("GSN-HydroCel-129")完整定位 129 通道,再统一平均重参考,保留完整空间信息。- SOTA 方法:等待/申请个体化电极位置(约 2,200 名被试有摄影测量扫描)发布后,用真实坐标替换标准蒙太奇,并做个体化头模型(导联场矩阵亦在官方未来发布清单中)。
参考:EEGDash ds005505 数据卡(Channels 129);HBN-EEG 论文 Methods(bioRxiv DOI 10.1101/2024.10.03.615261)。
⚠️ 坑点 2:按"记录/窗口"切分而不是按"被试"切分(分类:数据泄漏)
问题:R1 有 1,342 条记录但只有 136 人,随机打乱记录级样本几乎必然让同一被试同时进入训练与测试集,造成被试级信息泄漏。
症状:测试指标异常好看(如 p-factor 回归 R² 虚高);换被试部署后性能骤降、置信区间爆炸。
解决:
- 简单方法:所有划分以
participant_id为组(sklearn.model_selection.GroupShuffleSplit/GroupKFold)。- 进阶方法:滑窗训练时窗口不跨集,且同一被试相邻窗口间留间隔;报告折间标准差而非单次划分。
- SOTA 方法:做跨批次外推(训练 R1-R9、测试 R10/R11)与跨数据集外部验证,把泛化差距写进论文。
参考:本条目 §5.3;EEGDash/braindecode 官方文档。
⚠️ 坑点 3:把四个精神病理维度当临床诊断(分类:标签理解)
问题:internalizing / externalizing / attention / p-factor 是 CBCL 问卷经双因子模型衍生的连续分数,不是临床诊断,也没有官方诊断切点。
症状:报告"ADHD 检测准确率"被审稿人质疑;随意二值化(如取中位数)后被当作"病例/对照"解释。
解决:
- 简单方法:作为回归任务建模(MAE / R²),结果表述为"维度分数预测"。
- 进阶方法:如需二分类,明确声明统计切点(如中位数或四分位)及其非临床属性,并做切点敏感性分析。
- SOTA 方法:在 RDoC 框架下做跨诊断维度建模,结合 HBN 行为测验与临床评估文献讨论效度边界。
参考:HBN-EEG 论文 Abstract(四维度定义);OpenNeuro README(CBCL 衍生说明)。
⚠️ 坑点 4:数据集 ID 跳号与 README 笔误导致批量下载失败(分类:工程陷阱)
问题:批次 ID 跳过 ds005513(R8=DS005512、R9=DS005514),官方 README 又把 R6 写成 “DS05510”(正确为 ds005510)。按连续整数枚举 ID 的下载脚本会在缺失 ID 上报错。
症状:批量脚本中途 404 / “dataset not found”;引用错误 ID 导致他人复现失败。
解决:
- 简单方法:直接使用上游 README 的权威批次表(本条目 §3.2 已核对)。
- 进阶方法:下载前逐个调用 OpenNeuro API 校验数据集存在性与版本号。
- SOTA 方法:把批次清单固化为版本化清单文件(含 DOI 与版本),纳入 CI 定期校验链接有效性。
参考:EEG2025r1 数据卡 “Other HBN-EEG Datasets” 段;NEMAR ds005510 页面。
⚠️ 坑点 5:500 Hz 主线版与 100 Hz EEG2025 衍生版混用(分类:预处理陷阱)
问题:NEMAR/EEGDash 同时分发 500 Hz 主线批次与 100 Hz BDF 转换的 EEG2025 衍生系列(如 eeg2025r1,20.6 GB)。两者奈奎斯特频率(250 Hz vs 50 Hz)与时程分辨率不同。
症状:gamma 频段(>50 Hz)分析在 100 Hz 版上无声失效;跨版本合并训练时输入长度/频带定义不一致,指标不可比。
解决:
- 简单方法:项目内固定单一版本,并在论文/模型卡写明版本与采样率。
- 进阶方法:低算力场景选 100 Hz 版时,把分析限定在 ≤40 Hz 频段并统一重采样。
- SOTA 方法:为两个版本分别维护预处理配置文件,禁止跨版本直接合并,报告时声明各自的频带上限。
参考:HF eeg2025r1 数据卡(100 Hz / 20.6 GB);EEG2025R11MINI 元数据页。
⚠️ 坑点 6:忽视可用性标志与任务缺失,把数据当"人人全任务"(分类:评估误用)
问题:并非每位被试六个任务都有数据(论文 Figure 1 逐任务统计可用性);官方 QC 是"最小质检"(只查数据未损坏、事件齐全),不做伪迹清理。
症状:加载时FileNotFoundError或事件为空;把"有 EEG 的人"误当"六任务全齐的人"做统计;拿到原始数据后惊讶于未清理的伪迹。
解决:
- 简单方法:加载前按 participants.tsv 可用性标志过滤目标任务。
- 进阶方法:先构建"被试 × 任务"可得性矩阵,再设计实验与统计功效分析。
- SOTA 方法:按论文口径(数据长度、采样率、事件存在三条件)复现 available 判定,并叠加自己的伪迹 QC 报告。
参考:HBN-EEG 论文 Figure 1 与 Methods;OpenNeuro README(Data quality 段)。
⚠️ 坑点 7:把纽约求助样本当全国代表性队列(分类:偏倚陷阱)
问题:HBN 是纽约都会区主动求助家庭的研究队列,不是流行病学概率样本;部分批次性别失衡(R8 女性 35%)。直接把模型输出赋予人群患病率语义会系统性偏倚。
症状:以"一般人群"口径解释维度分数分布;性别/年龄亚组分析中部分子样本过小、指标不稳。
解决:
- 简单方法:论文与模型卡明确"help-seeking、都会区样本、非流行病学代表性"。
- 进阶方法:按年龄/性别分层评估并报告区间,避免跨层小样本比较。
- SOTA 方法:与其他儿童队列做跨队列校准与外部验证(§7.8),量化选择偏倚对特征-目标关系的影响。
参考:HBN-EEG 论文 Background & Summary;EEGDash ON005512 队列统计(性别构成)。
⚠️ 坑点 8:NC 批次的许可与获取渠道特例(分类:工程陷阱)
问题:458 人的 NC 批次是 CC-BY-NC-SA-4.0(禁商用),且不在 OpenNeuro/NEMAR 上,仅存于 FCP-INDI S3 的 cmi_bids_NC 目录;其余批次均为 CC-BY-SA 4.0。
症状:商业/闭源产品中误用 NC 数据构成许可违规;在 OpenNeuro 上找不到第 12 个批次 ID,误以为数据缺失。
解决:
- 简单方法:商业项目只合并 R1-R11,完全绕开 NC 批次。
- 进阶方法:学术项目需要最大样本时,用
aws s3 sync --no-sign-request拉 cmi_bids_NC,并与其他批次隔离存储、单独标记许可。- SOTA 方法:在数据治理层为每批次打许可标签(SPDX 表达),随训练产物与模型卡一并声明数据来源与许可链。
参考:eeg2025r1 数据卡 “Release NC” 段;HBN-EEG 论文 Data Availability。
八条坑点的共同根源是:HBN-EEG 处于"多批次持续演进"状态(批次、版本、衍生格式并行)。任何一条的规避动作最终都归结为同一个习惯——把批次 ID、版本号、口径写进配置文件并随结果发布(§6.10),让复现者不必重新考古。
§6.6 数据增强
| 类别 | 操作 | 安全性 | 说明 |
|---|---|---|---|
| 时间平移(小幅) | 随机平移 ≤0.1 s | ✅ 安全 | 事件对齐类任务需同步平移事件 |
| 高斯噪声(小幅) | σ ≤ 5% 信号 std | ✅ 安全 | 模拟传感器噪声 |
| 时间反转/上下翻转 | 翻转 EEG 波形 | ❌ 危险 | 破坏 ERP 极性与时间结构 |
| 通道随机丢弃 | 丢弃大量通道 | ❌ 危险 | 高密度蒙太奇的空间拓扑被破坏 |
| 频带遮蔽(SpecAugment 式) | 遮蔽窄频带 | ⚠️ 谨慎 | 会破坏频段特异性解释 |
| 幅值缩放 | 0.9-1.1 倍随机缩放 | ✅ 安全 | 等效增益扰动,跨被试幅差鲁棒 |
增强选择的原则:任何不破坏"事件-信号"对齐与频谱物理意义的变换才可接受;凡涉及时间结构(反转、乱序)或空间结构(通道重排/丢弃)的操作都会破坏高密度蒙太奇与 ERP 解释,应默认关闭,除非研究问题本身考察这些不变性。
§6.7 模型推荐表
| 模型 | 适用任务 | 输入 | 备注 |
|---|---|---|---|
| EEGNet(小型卷积) | 维度回归/粗分类、快速基线 | 原始 epoch(C×T) | 参数量小,儿童数据不易过拟合 |
| DeepConvNet / ShallowConvNet | 表征学习基线 | 原始 epoch | braindecode 内置,与 EEGDash 无缝衔接 |
| Conformer 类(CNN+自注意力) | 长时程依赖建模 | 较长 epoch | 需较大显存与正则 |
| 频带特征 + 梯度提升/线性模型 | 谱功率回归维度分 | 手工特征 | 可解释性最好,适合先跑通 |
| 混合效应模型(频带特征 × 年龄/性别) | 发育常模与亚组比较 | 手工特征 | 直接建模批次/人口学协变量 |
| ICA 微状态/源定位管线 | 发育常模与连接研究 | 连续记录 | 需头模型;个体电极位置发布前用标准蒙太奇 |
上表为建模起点建议而非基准结论;同一模型在 100 Hz 衍生版上的输入长度需按采样率折算(坑点 5),跨模型比较必须固定预处理与划分(§8.3)。
§6.8 硬件需求表
| 场景 | 最低配置 | 建议配置 | 依据 |
|---|---|---|---|
| 单批次谱特征管线 | 16 GB RAM + 250 GB 磁盘 | 32 GB RAM + 1 TB SSD | R1 缓存 103.1 GB,Welch 谱内存开销中等 |
| 原始波形深度学习 | 24 GB 显存 GPU | 48 GB 显存 GPU + 2 TB 磁盘 | R4 229.8 GB 缓存 + epoch 批量驻留 |
| 全批次合并训练 | 多卡或分批流式 | SSD 阵列 + 数据加载流水线 | 11 批次合计约 2 TB(推算值) |
磁盘规划按"缓存即副本"估算:EEGDash 缓存体积 ≈ 对应原始批群体积;建议数据盘与系统盘分离,并把 cache_dir 放在 SSD 上以提升随机读取性能。
§6.9 评估指标代码
# 维度回归指标(p_factor 等):MAE + R²,按被试分组交叉验证后汇总
from sklearn.metrics import mean_absolute_error, r2_score
import numpy as np
y_true, y_pred = np.array(y_true), np.array(y_pred) # 各折测试集拼接
print(f"MAE = {mean_absolute_error(y_true, y_pred):.3f}")
print(f"R² = {r2_score(y_true, y_pred):.3f}")
# 报告规范:均值 ± 折间标准差;如做二分类请附 balanced accuracy 与切点声明
若做二分类演示(如 attention 按中位数切分),请补充 balanced accuracy、混淆矩阵与 ROC-AUC,并在正文明确声明切点为统计切点而非临床界值(坑点 3);多目标(四维度同时预测)时逐维度报告并附维度间相关矩阵(§4.2)。
# 二分类口径示例:attention 中位数切分(统计切点,非临床界值)
import numpy as np
from sklearn.metrics import balanced_accuracy_score, roc_auc_score, confusion_matrix
median_cut = np.median(y_true_attention_train) # 切点只在训练集上计算
y_true_bin = (y_true_attention_test > median_cut).astype(int)
y_pred_bin = (y_pred_attention_test > median_cut).astype(int)
print(f"balanced acc = {balanced_accuracy_score(y_true_bin, y_pred_bin):.3f}")
print(f"AUC = {roc_auc_score(y_true_bin, y_pred_attention_test):.3f}")
print(confusion_matrix(y_true_bin, y_pred_bin))
# 报告时必须写明:"切点为训练集中位数,属统计口径,不代表临床诊断界值"
§6.10 MLOps 笔记
- 版本钉死:在配置中记录批次 ID + 版本号(如 ds005506 v1.0.1)与下载日期;OpenNeuro 允许按版本引用。
- 许可合规自动化:把 CC-BY-SA 4.0 与 CC-BY-NC-SA-4.0 的适用批次清单写进数据治理脚本,训练产物自动携带许可声明(坑点 8)。- 可复现缓存:EEGDash 缓存目录纳入 DVC/对象存储管理,避免"换机器重下 2 TB"。
- 数据漂移监控:批次即天然漂移轴,监控各批次的谱特征分布漂移(§7.6)。
- 评估隔离:把"测试批次"的 participants.tsv 副本锁定为只读,防止实验中途被新版本覆盖导致划分漂移。
- 资源监控:记录每次实验的缓存命中率与下载量,避免团队内重复拉取 TB 级数据。
- 口径字典:维护一份团队共享的"口径表"(通道数口径、available 判定、维度切点、批次-版本清单)并版本化,随论文附录发布。
- 文档联动:模型卡/数据卡与本条目互链,注明所用批次、版本与许可链,便于第三方审计。
§7 质量评估与局限性
§7.1 已知偏倚表
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 招募偏倚 | 主动求助家庭队列,非概率抽样 | 高 | 外部验证;结论限定队列语义 |
| 地域偏倚 | 全部来自纽约都会区 | 中 | 跨地域队列验证 |
| 性别不均衡 | R8 约 35% 女性;批次间构成不一 | 中 | 分层评估与重加权 |
| 年龄-队列缠绕 | 年龄跨 5-21 岁但批次均值约 10 岁 | 低 | 以年龄分层抽样训练 |
| 任务可得性偏倚 | 并非人人六任务全有(QC 标志见 participants.tsv) | 中 | 建可得性矩阵后再设计实验 |
| 标签测量偏倚 | 四维度来自 CBCL 家长/自陈问卷 | 中 | 结合 HBN 完整临床评估文献解读 |
| 版本漂移偏倚 | 批次版本演进(v1.0.0→v1.0.1)与衍生格式并存 | 低-中 | 固定版本号引用;混合前核对版本清单 |
严重程度口径:高=会改变研究结论方向;中=影响亚组或边界场景;低=可通过常规控制消除。以上偏倚均为队列设计内生属性,无法通过事后统计完全消除,应在论文限制节逐条声明。
§7.2 标注质量
事件与 HED 注释由方法学团队统一生成(非众包),覆盖全部发布事件并声明"数据一致性与事件完整性已核验、不一致处已标记";问卷维度为标准化量表的确定性计算。已知限制:官方 QC 为最小质检(不含伪迹评估);个体电极位置未随批次发布。总体判断:注释完整度在开放 EEG 数据集中属第一梯队,但信号级质量控制需研究者自行补齐。
对研究者的影响:① 把官方 QC 当作"完整性兜底"而非"可用性保证";② 在论文中报告自己的伪迹 QC 通过率,使结果可复现;③ 对被标记不一致的文件,优先联系维护者或直接弃用,不要静默修复后再使用。
§7.3 泛化性表
| 部署场景 | 失效风险 | 证据/理由 |
|---|---|---|
| 直接用于成人数据 | 高 | 队列 5-21 岁,频谱与头模型参数随年龄显著变化 |
| 直接用于临床诊断输出 | 高 | 四维度为问卷衍生分数,非诊断;无诊断金标准标签 |
| 跨设备(非 EGI 128 通道系统) | 中-高 | 蒙太奇与阻抗特性不同,需重配空间映射 |
| 跨文化/跨语言人群 | 中 | 电影与符号搜索任务含语言/文化刺激成分 |
| 同类设备新采集数据 | 低-中 | 任务范式公开(Langer 2017 可复现),协议可对齐 |
使用建议:把本表当作"外推路线图"——从下往上风险递增;每往上走一步,先做小样本探测实验再全量投入。
§7.4 伦理与合规
数据采集经 Chesapeake Institutional Review Board 批准,含家长知情同意与儿童本人同意(assent);数据去标识化(NDAR 风格哈希 ID,无姓名与出生日期)后开放共享。精神病理维度为问卷聚合分数,不含病历文本。研究者须遵守 CC-BY-SA 4.0(NC 批次 CC-BY-NC-SA-4.0,禁商用),并引用数据集论文与 HBN 项目论文。涉及儿童的二次分析与模型部署须另过当地伦理审查。
对儿童数据的特别提示:任何再识别尝试(即使技术可行)都违反使用伦理;公开衍生产物(如特征表格、统计图表)时,避免把年龄 × 性别 × 批次交叉到个位数样本的小格子,防止变相识别风险。
§7.5 公平性
性别构成批次间不均衡(R8 女性 35%);种族/族裔、社会经济状态分层统计未在本次核实范围内取得公开数字,故不在此罗列。建模时建议:报告分性别/年龄段子集性能;避免把队列内相关解释为跨人群因果;对四维度分数的分布外推保持谨慎。
已核实的公平性抓手有三个:年龄(5-21 岁连续跨度)、性别(批次构成可查,如 R8 的 91 女/166 男)、任务可得性(QC 标志)。建议模型卡强制报告"分性别 × 分年龄段"的性能网格,并注明每格样本量;样本量不足的格子直接标注"不报告",不要以不稳定估计充数。
§7.6 数据漂移
批次间被试完全互斥、采集跨越多年:批次即数据漂移轴。已观察到的漂移源包括:性别构成差异、任务可得性差异、数据集版本演进(v1.0.0 → v1.0.1,R2 于 2025-03-11 更新)与衍生格式(500 Hz 主线 vs 100 Hz BDF)。建议把批次 ID 作为协变量监控,训练管线内置按批次的特征分布检验。
落地监控方案:以批号为轴绘制各频带谱功率的中位数与方差热图;新批次上线时先跑"分布对齐检查"(对照已入库批次的谱统计)再进训练池;发现阶跃式漂移时,优先排查采集硬件/协议变更而非模型原因。
§7.7 DAIMS 数据质量评估(24 项)
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | participants.tsv 一名被试一行,结构规整 |
| 2 | 唯一标识 | ✅ | NDAR 风格哈希 participant_id 全局唯一 |
| 3 | 特殊字符 | ✅ | BIDS 命名规范约束,路径与标签无特殊字符问题 |
| 4 | 重复行 | ✅ | OpenNeuro 过 BIDS Validation(R2 仅 3 条警告),无重复被试行 |
| 5 | 缺失编码 | ✅ | 遵循 BIDS 的 n/a 约定 |
| 6 | 标签标识 | ✅ | 事件列(trial_type/HED)与维度列命名清晰、口径有文档 |
| 7 | 罕见类分组 | ✅ | 无离散诊断类别;连续分数不涉及罕见类问题(已说明) |
| 8 | 偏倚评估 | ✅ | 论文与本条目 §7.1 给出招募/地域/性别偏倚分析 |
| 9 | 数据字典 | ✅ | BIDS sidecar JSON + HED 8.3.0 词表 + 本条目 §4.1 |
| 10 | 信息性缺失解释 | ✅ | 任务缺失由文件缺失 + participants.tsv 可用性标志双重表达 |
| 11 | 设备记录 | ⚠️ | 设备型号/采样率记录完备;个体电极位置仅约 2,200 人且未随批次发布 |
| 12 | 共线性 | ✅ | 四维度同源 CBCL 双因子模型的关系已官方声明(§5.3 提示处理) |
| 13 | 编码映射 | ✅ | 数字事件码已替换为描述性术语并配 HED 标签 |
| 14 | 时间戳处理 | ✅ | onset/duration 以秒计、事件与 EEG 同步(行为并入事件文件) |
| 15 | 划分建议 | ❌ | 官方无划分;需研究者自行按被试分组(§5) |
| 16 | 泄漏讨论 | ✅ | 记录级 vs 被试级泄漏、滑窗重叠均有明确对策(§5.3、坑点 2) |
| 17 | 标签分布 | ❌ | 无固定标签与官方分布表;四维度分布需自行统计 |
| 18 | 测量偏倚 | ✅ | 同步眼动/下颌托/统一协议控制测量条件;问卷测量误差已声明 |
| 19 | 外部验证建议 | ✅ | §7.8 给出外部验证矩阵与缺口 |
| 20 | 版本记录 | ⚠️ | 批次+版本体系完备(v1.0.0→v1.0.1),但部分批次日期仅见版本页 |
| 21 | 预处理脚本 | ❌ | 官方仅最小质检,无端到端预处理管线发布 |
| 22 | 合规要求 | ✅ | 许可(CC-BY-SA 4.0 / NC 批次 CC-BY-NC-SA-4.0)与引用要求明确 |
| 23 | 多模态对齐 | ⚠️ | 行为已并入事件文件;但眼动数据尚未随 EEG 批次发布 |
| 24 | 去标识化 | ✅ | 哈希 ID、无姓名/出生日期、IRB 批准后开放共享 |
DAIMS 评分:19.5 / 24(18 项 ✅ 计 18 分 + 3 项 ⚠️ 折半计 1.5 分 + 3 项 ❌ 计 0 分)
评分口径:✅ 计 1 分、⚠️ 计 0.5 分、❌ 计 0 分;状态仅反映"从 AI 建模视角的可用性",不代表数据科学价值的高低。
评分解读:19.5/24 属"结构化与注释质量优秀、就绪基础设施完善,但分析就绪度依赖研究者自建"的档位。强项集中在标识、字典、合规与去标识化——这些是"拿来即用"的硬基础;弱项集中在官方未提供划分、分布表与预处理管线,属于"研究自由度换便利性"的设计选择,而非数据缺陷。设备记录与多模态对齐的两个 ⚠️ 主要由"个体电极位置与眼动尚未发布"造成,预计随官方后续发布改善。
对你意味着什么:如果你做方法学或维度回归研究,可以直接采用本数据集——按 §5 的被试分组划分 + §6 的代码管线起步,把"无官方划分/无预处理"当作自己论文的贡献点补齐即可;如果你做临床转化或商用,先核对许可边界(尤其 NC 批次)与"维度分数非诊断"的效度声明;如果你做跨数据集基准,HBN-EEG 的 BIDS+HED 注释可显著降低事件对齐成本,但仍需为个体电极位置与眼动缺失预留方法学回退(标准蒙太奇 + 无眼动共分析)。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| 同范式试点队列(126 人,6-44 岁) | Child Mind Institute(Sci Data 4:170040) | 六任务范式可行性/信息处理测量 | 范式级有效性(非精度指标) | 同源协议 | HBN-EEG 六任务范式已在试点队列验证,事件级测量稳定 |
| 跨设备/跨队列外部验证 | 待积累 | 维度回归/生物标记 | — | — | HBN-EEG 于 2024 年 10 月 BIDS 化发布,独立同行评审的跨队列外部验证文献仍在积累期 |
声明:本矩阵只收录有同行评审支撑的结果;预印本(bioRxiv 2024.10.03.615261)与社区工具(EEGDash)不作为外部验证证据。研究者完成跨队列验证后,应以"训练 HBN-EEG → 测试外部队列"的口径补充本表。当前最现实的两步走:先完成 R1-R9 → R10/R11 的批次外推(无需新数据),再接驳其他儿童队列做跨设备验证(需重配蒙太奇)。
§8 基准性能与生态
§8.1 排行榜与基准现状
HBN-EEG 官方未设立固定排行榜与 SOTA 基线(截至 2026-09)。NEMAR/EEGDash 生态提供的是"加载与 QC 基础设施",而非统一指标:
| 排名 | 资源 | 性能口径 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| —(无统一榜单) | EEGDash 流式加载基线 | 未设统一指标(返回 MNE Raw/PyTorch 数据集) | 2025-2026 | BIDS-first 元数据目录 + 按需缓存 | EEGDash 开发团队, 2025-2026, 软件文档. https://eegdash.org | github.com/eegdash/EEGDash |
| —(无统一榜单) | NEMAR 自动 QC 管线 | 数据保留率/线噪声等 QC 统计图(非任务指标) | 2024-2025 | 自动化 EEG 清洗与 ICA 统计 | Shirazi et al., 2024, bioRxiv. DOI 10.1101/2024.10.03.615261 | nemar.org |
| —(衍生基准载体) | EEG2025 衍生系列(100 Hz BDF) | 面向挑战赛/基准用途的标准化子集 | 2025 | 统一降采样与格式转换 | 见 §9 BibTeX 数据集条目 | openneuro.org |
数值不可直接比较的原因:各资源发布的是数据与 QC 统计而非任务基准;不同批次样本量与采样率不同;任何第三方结果均依赖其自选划分(见 §5)。若需在论文中报告"最优性能",必须自建基线并公开划分与配置,同时注明"该数据集无官方排行榜"的口径限制。
§8.2 SOTA 总结与选型建议
当前(截至 2026-09)该数据集上不存在可引用的统一 SOTA。务实建议:先用频带特征 + 线性/梯度提升模型建立被试分组回归基线(§6.4 代码),再对比 EEGNet 类卷积与 Conformer 类模型;所有结果自带划分口径,引用时必须附批次清单与版本号。选型小结:可解释性优先选频带特征 + 线性模型;性能优先选 EEGNet/DeepConvNet 起步再上注意力架构;无论哪条路线,先把被试分组划分与版本钉死(§6.10),再谈调参与架构创新。
§8.3 评测协议建议
固定三要素后结果才可比较:① 批次与版本(如 ds005505 v1.0.1);② 被试分组划分方式(GroupKFold 折数与随机种子);③ 预处理参数(带通、参考、分段窗)。建议在论文附录发布可得性矩阵与被试数清单。若团队内部要建立基准,建议冻结一份"基准快照":R1+R4 两批次、GroupKFold(5)、统一预处理配置与指标脚本,随代码一起发布,让后续工作有共同对照物。
§8.4 相关数据集表
| 数据集 | 关系 | 获取 |
|---|---|---|
| HBN 项目全量(行为/影像/基因) | 同队列母项目,含临床与认知评估 | FCP-INDI / INDI(Alexander et al., Sci Data 2017) |
| Langer 2017 试点数据(126 人) | 同范式设计出处 | Scientific Data 4:170040 所述渠道 |
| EEG2025 衍生系列 | HBN-EEG 的 100 Hz BDF 标准化子集 | NEMAR(eeg2025r1、EEG2025R11MINI 等) |
| NEMAR/EEGDash 目录 | 加载层与 700+ EEG/MEG 数据集目录 | eegdash.org |
选型提示:需要"同队列多模态"时去 HBN 母项目拿行为/影像;需要"同范式小样本"做快速对照时用 Langer 2017;需要"低算力大样本"时用 EEG2025 衍生系列。三者在许可上均继承或并列于主线批次条款,商用前逐一核对。
§8.5 关键论文 Top 6
- Shirazi, S. Y., Franco, A., Hoffmann, M. S., Esper, N. B., Truong, D., Delorme, A., Milham, M. P., & Makeig, S. (2024). HBN-EEG: The FAIR implementation of the Healthy Brain Network (HBN) electroencephalography dataset. bioRxiv, 2024.10.03.615261. DOI 10.1101/2024.10.03.615261 — 数据集主论文:BIDS 化、HED 注释与九批次可用性统计。
- Langer, N., Ho, E. J., Alexander, L. M., Xu, H. Y., Jozanovic, R. K., Henin, S., Petroni, A., Cohen, S., Marcelle, E. T., Parra, L. C., Milham, M. P., & Kelly, S. P. (2017). A resource for assessing information processing in the developing brain using EEG and eye tracking. Scientific Data, 4, 170040. DOI 10.1038/sdata.2017.40 — 六任务范式的设计论文(126 人试点)。
- Alexander, L. M., Escalera, J., Ai, L., et al. (2017). An open resource for transdiagnostic research in pediatric mental health and learning disorders. Scientific Data, 4, 170181. DOI 10.1038/sdata.2017.181 — HBN 项目总论文(队列、评估与伦理框架)。
- Schirrmeister, R. T., Springenberg, J. T., Fiederer, L. D. J., Glasstetter, M., Eggensperger, K., Tangermann, M., Hutter, F., Burgard, W., & Ball, T. (2017). Deep learning with convolutional neural networks for brain mapping and decoding of movement-related imagery from the human EEG. Human Brain Mapping, 38(11), 5391-5420. DOI 10.1002/hbm.23730 — braindecode 卷积架构基线(EEGNet/DeepConvNet 谱系)的方法学参照。
- Delorme, A., & Makeig, S. (2004). EEGLAB: an open source toolbox for analysis of single-trial EEG dynamics including independent component analysis. Journal of Neuroscience Methods, 134(1), 9-21. DOI 10.1016/j.jneumeth.2003.10.009 — 主线批次 EEG 文件生态(EEGLAB)与 ICA 流程的基础工具论文。
- EEGDash 开发团队(2025-2026). EEGDash: the Python library for 700+ BIDS-first EEG/MEG datasets. https://eegdash.org — HBN-EEG 的 PyTorch 加载层与元数据目录(软件文档,随版本更新)。
§8.6 社区活跃度
数据集论文(2024-10 预印本)OpenAIRE 收录引用 13+ 次、影响力位列其统计的 Top 10%(截至 2026-09);EEGDash 将各批次注册为一等公民类(如 HBN_r1、DS005508)并在 Hugging Face 维护镜像数据卡;NEMAR 提供在线分析入口。社区讨论主要集中于 OpenNeuro/GitHub(eegdash/EEGDash)与 HED 社区渠道。
关注渠道建议:OpenNeuro 各批次页面的版本记录(新版本上线第一时间可见)、EEGDash GitHub 仓库的 release 与 issue 区、以及 HED 社区的标注更新公告;官方新批次发布通常会同步更新 NINE Lab 数据集页与各数据卡。
§8.7 生态快照表
| 资源 | 类型 | 链接 | Star(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| OpenNeuro 批次 | 数据托管 | https://openneuro.org/datasets/ds005505 | — | 权威分发渠道 + 数据集 DOI |
| NEMAR | 托管 + 在线分析 | https://nemar.org | — | 浏览/云端 QC 与分析 |
| EEGDash | Python 库 | https://github.com/eegdash/EEGDash | — | PyTorch/braindecode 一键加载 |
| Hugging Face 镜像 | 元数据数据卡 | https://huggingface.co/datasets/EEGDash/ds005505 | — | 快速查看批次统计与引用格式 |
| FCP-INDI S3 | 原始批量存储 | s3://fcp-indi/data/Projects/HBN/BIDS_EEG/ | — | 全量批量同步(含 NC 批次) |
| NINE Lab 数据集页 | 官方说明页 | https://nine-lab.gitlab.io/research/neuroinformatics/hbn/ | — | 各批次人数与论文引用信息 |
生态使用顺序建议:查元数据(Hugging Face 数据卡)→ 下载(OpenNeuro/S3)→ 加载(EEGDash)→ 云端分析(NEMAR);GitHub 仓库主要用于报告加载层问题。
§9 相关资源与引用
§9.1 官方资源清单
- 数据集论文(bioRxiv)— 方法学细节与九批次可用性统计的一手来源:https://www.biorxiv.org/content/10.1101/2024.10.03.615261v2.full
- OpenNeuro 各批次 — 权威分发渠道,含数据集 DOI 与版本记录:https://openneuro.org/datasets/ds005505(R1 起至 ds005516)
- NEMAR 数据浏览器 — 在线浏览与云端分析入口:https://nemar.org/dataexplorer/detail?dataset_id=ds005505
- EEGDash 文档与目录 — PyTorch 加载层与 700+ 数据集目录:https://eegdash.org ;代码仓库:https://github.com/eegdash/EEGDash
- Hugging Face 镜像 — 批次统计与引用格式的快速查阅:https://huggingface.co/datasets/EEGDash/ds005505
- 官方批次人数说明页(NINE Lab)— 各批次被试数与论文引用信息:https://nine-lab.gitlab.io/research/neuroinformatics/hbn/
- HBN 项目主页 — 队列背景、资助与致谢:https://childmind.org/science/global-open-science/healthy-brain-network/
- HED 标注标准 — 事件注释词表与工具:https://hedtags.org
- BIDS 标准 — BIDS-EEG 规范原文:https://bids.neuroimaging.org
- FCP-INDI S3 批量入口 — 全量与 NC 批次的命令行同步:s3://fcp-indi/data/Projects/HBN/BIDS_EEG/
- 数据集论文引用页(OpenAIRE)— 引用与影响力查询:https://beta.explore.openaire.eu/search/publication?pid=10.1101%2F2024.10.03.615261
§9.2 BibTeX 引用块
<details>
<summary>§9.2 完整 BibTeX(6 条,点击展开)</summary>
@article{Shirazi2024hbneeg,
title = "{HBN-EEG}: The {FAIR} implementation of the Healthy Brain Network ({HBN}) electroencephalography dataset",
author = "Shirazi, Seyed Yahya and Franco, Alexandre and Hoffmann, Mauricio Scopel and Esper, Nathalia B. and Truong, Dung and Delorme, Arnaud and Milham, Michael P. and Makeig, Scott",
journal = "bioRxiv",
pages = "2024.10.03.615261",
year = "2024",
doi = "10.1101/2024.10.03.615261"
}
@article{Langer2017pilot,
title = "A resource for assessing information processing in the developing brain using {EEG} and eye tracking",
author = "Langer, Nicolas and Ho, Erica J. and Alexander, Lindsay M. and Xu, Helen Y. and Jozanovic, Renee K. and Henin, Simon and Petroni, Agustin and Cohen, Samantha and Marcelle, Enitan T. and Parra, Lucas C. and Milham, Michael P. and Kelly, Simon P.",
journal = "Scientific Data",
volume = "4",
pages = "170040",
year = "2017",
doi = "10.1038/sdata.2017.40"
}
@article{Alexander2017hbn,
title = "An open resource for transdiagnostic research in pediatric mental health and learning disorders",
author = "Alexander, Lindsay M. and Escalera, Jasmine and Ai, Lei and others",
journal = "Scientific Data",
volume = "4",
pages = "170181",
year = "2017",
doi = "10.1038/sdata.2017.181"
}
@dataset{Shirazi2024r1,
title = "Healthy Brain Network ({HBN}) {EEG} - Release 1",
author = "Shirazi, Seyed Yahya and Franco, Alexandre and Hoffmann, Mauricio Scopel and Esper, Nathalia B. and Truong, Dung and Delorme, Arnaud and Milham, Michael and Makeig, Scott",
publisher = "OpenNeuro",
year = "2024",
doi = "10.18112/openneuro.ds005505.v1.0.1"
}
@article{Schirrmeister2017deep,
title = "Deep learning with convolutional neural networks for brain mapping and decoding of movement-related imagery from the human {EEG}",
author = "Schirrmeister, Robin Tibor and Springenberg, Jost Tobias and Fiederer, Lukas Dominique Josef and Glasstetter, Martin and Eggensperger, Katharina and Tangermann, Michael and Hutter, Frank and Burgard, Wolfram and Ball, Tonio",
journal = "Human Brain Mapping",
volume = "38",
number = "11",
pages = "5391--5420",
year = "2017",
doi = "10.1002/hbm.23730"
}
@article{Delorme2004eeglab,
title = "{EEGLAB}: an open source toolbox for analysis of single-trial {EEG} dynamics including independent component analysis",
author = "Delorme, Arnaud and Makeig, Scott",
journal = "Journal of Neuroscience Methods",
volume = "134",
number = "1",
pages = "9--21",
year = "2004",
doi = "10.1016/j.jneumeth.2003.10.009"
}
</details>
§9.3 引用指南
使用任一批次数据时,请同时引用:① 数据集论文(Shirazi et al., 2024,DOI 10.1101/2024.10.03.615261);② 所用批次的数据集 DOI(如 10.18112/openneuro.ds005505.v1.0.1);③ HBN 项目论文(Alexander et al., 2017,DOI 10.1038/sdata.2017.181);如涉及任务范式设计,建议加引 Langer et al., 2017。若使用了 EEGDash/braindecode 加载层,按其仓库的引用说明一并致谢;若使用了 NEMAR 的在线 QC 统计,也应在方法节注明。
§10 AI 使用声明卡
§10.1 AI 模型列表
| 项目 | 内容 |
|---|---|
| 生成平台/模型 | CodeBuddy Code(fast-model) |
| 生成日期 | 2026-09-13(事实检索与成稿) |
| 编辑模式 | AI 起草 + 千方病案医学编辑部人工交叉审核 |
§10.2 AI 参与范围
AI 负责:按宪法规范的检索汇总(6 次 WebSearch)、FACTS 事实清单整理、全条目初稿撰写与代码草拟。人工负责:事实核验(逐条对照原始来源)、医学与数据工程审核、最终发布决定。所有规模数字、日期与许可条款均溯源自 §10.3 所列来源;所有推算值(如全批次体量约 2 TB)均显式标注口径,未与实测值混排;检索未核实到的字段(如 Google Scholar 口径的引用数)按规则省略或改用可溯源口径,未做编造填充。
§10.3 输入来源列表
- Shirazi, S. Y., Franco, A., Hoffmann, M. S., Esper, N. B., Truong, D., Delorme, A., Milham, M. P., & Makeig, S. (2024). HBN-EEG: The FAIR implementation of the Healthy Brain Network (HBN) electroencephalography dataset. bioRxiv 2024.10.03.615261. https://www.biorxiv.org/content/10.1101/2024.10.03.615261v2.full
- Langer, N., Ho, E. J., Alexander, L. M., et al. (2017). A resource for assessing information processing in the developing brain using EEG and eye tracking. Scientific Data, 4, 170040. https://doi.org/10.1038/sdata.2017.40
- Alexander, L. M., Escalera, J., Ai, L., et al. (2017). An open resource for transdiagnostic research in pediatric mental health and learning disorders. Scientific Data, 4, 170181. https://doi.org/10.1038/sdata.2017.181
- Shirazi, S. Y., et al. (2024). Healthy Brain Network (HBN) EEG - Release 1. OpenNeuro. doi:10.18112/openneuro.ds005505.v1.0.1. https://openneuro.org/datasets/ds005505
- Shirazi, S. Y., et al. (2024). Healthy Brain Network (HBN) EEG - Release 2. OpenNeuro. doi:10.18112/openneuro.ds005506.v1.0.0. https://openneuro.org/datasets/ds005506/versions/1.0.0/metadata
- Healthy Brain Network (HBN) EEG - Release 1. NEMAR 数据页(BIDS 1.9.0、HED 8.3.0、任务清单). https://nemar-dev.ucsd.edu/dataexplorer/detail?dataset_id=ds005505
- EEGDash. DS005508(Release 4)数据页:324 subjects, 3,342 recordings, 229.8 GB, 262 h. https://eegdash.org/api/dataset/eegdash.dataset.DS005508.html
- EEGDash. ON005512(Release 8)数据页:257 subjects, 2,320 recordings, 179 h,性别构成与各批次人数表. https://eegdash.org/api/dataset/eegdash.dataset.ON005512.html
- EEGDash. EEG2025R11MINI 数据页(20 subjects, 100 Hz)与 NEMAR 处理统计说明. https://eegdash.org/api/dataset/eegdash.dataset.EEG2025R11MINI.html
- EEGDash/ds005505 数据卡. Hugging Face(136 subjects / 1,342 recordings / 103.1 GB / 500 Hz / CC-BY-SA 4.0). https://huggingface.co/datasets/EEGDash/ds005505
- EEGDash/eeg2025r1 数据卡. Hugging Face(BDF 转换版 100 Hz、20.6 GB、官方 README 全文含各批次人数与许可). https://hf-cdn.sufy.com/datasets/EEGDash/eeg2025r1
- EEGDash/ds005509 数据卡(Release 5:330 subjects / 224.2 GB). Hugging Face. https://huggingface.co/datasets/EEGDash/ds005509
- NINE Lab(Shirazi et al. 团队). HBN-EEG 数据集页(11 次发布、>3,000 参与者、引用信息). https://nine-lab.gitlab.io/research/neuroinformatics/hbn/
- OpenAIRE. Publication record: 10.1101/2024.10.03.615261(引用 13 次、Top 10% 影响力). https://beta.explore.openaire.eu/search/publication?pid=10.1101%2F2024.10.03.615261
- Child Mind Institute. Healthy Brain Network 项目页(资助与致谢信息). https://childmind.org/science/global-open-science/healthy-brain-network/
- 遇见数据集(selectdataset.com). HBN-EEG Release 2/10/11/NC 汇总页(各批次 S3 URI 与人数). https://www.selectdataset.com/dataset/bc9de34826e204e5117fc9dc32420da1
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| frontmatter 与 INFOBOX 全部数字/日期/许可 | 千方病案医学编辑部 | 逐项对照 FACTS.md 与原始来源 URL | ✅ 已通过 |
| §2 医学背景(ICD-11/SNOMED 映射与人群描述) | 千方病案医学编辑部 | 对照论文原文与编码手册核查 | ✅ 已通过 |
| §3-§4 批次规模、格式与 DAIMS 字段字典 | 千方病案医学编辑部 | 对照 OpenNeuro/EEGDash 元数据逐批次核对 | ✅ 已通过 |
| §6 代码可运行性与坑点四段式 | 千方病案医学编辑部 | 环境抽样运行 + 坑点逐条溯源 | ✅ 已通过 |
| §7 DAIMS 24 项评分与外部验证矩阵 | 千方病案医学编辑部 | 逐项状态复核并交叉审核 | ✅ 已通过 |
| §9-§10 引用与声明卡 | 千方病案医学编辑部 | BibTeX 与来源列表逐条比对 | ✅ 已通过 |
| §8 基准与生态表述 | 千方病案医学编辑部 | 对照 OpenAIRE 与官方页面核查 | ✅ 已通过 |
§10.5 AI 生成章节标注
本条目全部章节由 AI(CodeBuddy Code,fast-model)起草,经千方病案医学编辑部按 §10.4 所列方式人工交叉审核后发布;未标注的章节同样适用该流程。生成过程中 AI 的全部事实断言均限定于 §10.3 所列 16 条来源,超出来源的口径一律省略或显式标注推算依据。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)。
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- bci-competition-iv-2a — 共享标签:神经科学 / 脑电信号
- human-connectome-project — 共享标签:神经科学 / 医学影像
- fetal-planes-db — 共享标签:医学影像 / 儿科
- tufts-dental — 共享标签:神经科学 / 医学影像
- openneuro — 共享标签:神经科学 / 脑电信号
- bigbrain — 共享标签:神经科学 / 医学影像
- hc18 — 共享标签:医学影像 / 儿科
- tuh-eeg-corpus — 共享标签:神经科学 / 脑电信号
- chb-mit-scalp-eeg — 共享标签:儿科 / 脑电信号
- healthy-brain-network — 共享标签:神经科学 / 儿科
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

