Health-Data-Nexus

Health Data Nexus — 医学AI开放数据平台 AI-Ready Wikipedia | 千方病案医数集

来源 多伦多大学 T-CAIREM https://healthdatanexus.ai发布时间: 2026-08-04最后更新: 2026-08-04 阅读 2

信息速览

数据集名称Health-Data-Nexus
数据类型11+ 数据集, 2.2 万次就诊(GIM), Google Cloud 安全环境, 三级区域访问, 免费申请获取
规模1.4 万名患者
接入方式多伦多大学 T-CAIREM https://healthdatanexus.ai
AI 就绪度

INFOBOX

数据集名称 Health Data Nexus
英文全称 Health Data Nexus: an open data platform for AI research and education in medicine
别名 / 简称 HDN、T-CAIREM Health Data Nexus、Health Data Nexus Platform
疾病分类 全科医学覆盖。旗舰 GIM 数据集核心映射:MG30 脓毒症 / MG40 呼吸衰竭 / 5AA 转移至重症监护 / XJ9E 危重症入院姑息治疗
SNOMED CT 396275006 General internal medicine (qualifier value) / 89666000 Critical care admission (procedure) / 8392001 Sepsis (disorder) / 409622000 Respiratory failure (disorder) / 423493009 Hospital discharge (procedure)
数据模态 多模态平台:结构化 EHR(表格)+ CT 影像(DICOM)+ 语音录音 + 睡眠生理信号 + 数字病理切片 + 分子数据 + 人群健康调查
AI 任务类型 患者恶化预测、ICU 转移预测、脓毒症早期预警、呼吸衰竭预测、临床决策支持、语音健康诊断、睡眠分期分类、病理图像分析
样本总数 平台级 11+ 数据集;旗舰 GIM 数据集:22,000+ 次住院就诊(14,000 名唯一患者),2011-2019 年
数据大小 因数据集而异(GIM ~2 GB;CSpine 1,000+ CT 扫描;全平台数据存储于 Google Cloud,不可直接下载)
数据格式 CSV / DICOM / Parquet / R ExpressionSet / WAV / 语音元数据
许可证 Health Data Nexus Data Use Agreement(每数据集独立 DUA,非商业研究用途,须签署协议 + 完成培训)
访问级别 注册后开放(eduGAIN SSO + ORCID 认证 + TCPS 2 培训 + 签署 DUA;Zone 2 需研究计划审批;Zone 3 需 REB 批准)
DUO 标签 HMB, NPUNCU, IRB(Zone 3 数据集)
语言 英文(数据与文档)
首发日期 2021(T-CAIREM 数据平台上线);GIM 数据集首次上传 2022-10-21
最后更新 2026-03-26(REB 审批政策更新);ICB 数据集发布 2025-11-26
发布机构 University of Toronto Temerty Centre for AI Research and Education in Medicine (T-CAIREM)
官方主页 https://healthdatanexus.ai
下载地址 https://healthdatanexus.ai(注册后在 Google Cloud 安全环境中访问,不可直接下载)
DOI 10.1093/gigascience/giaf050(平台论文);10.57764/5rq7-xj70(GIM 数据集)
引用次数 新近发表(GigaScience 2025-07-04),引用数增长中(Google Scholar,截至 2026-08)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 平台提供预处理数据 + 云端计算环境 + 详细文档 + 教程;扣分项:数据不可离线下载、单城市来源、部分数据集样本量有限
页面状态 published

§0 E-E-A-T 信任声明与免责声明

字段 内容
医学审核者 [千方病案医学编辑部]交叉审核:§2 医学背景(ICD-11 映射、临床任务定义、GIM 数据集临床语境)、§7 偏倚分析。
数据工程审核者 [千方病案医学编辑部]交叉审核:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期 2026-08-04
审核方式 交叉审核
利益冲突声明 本页面与 Health Data Nexus / T-CAIREM / University of Toronto 无商业关联。千方病案医数集为独立第三方数据集百科平台。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。Health Data Nexus 要求数据使用协议(DUA)签署和 TCPS 2 伦理培训完成。Zone 2/3 数据集需额外提交研究计划和/或 REB 批准。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。

§1 数据集概览(Overview)

§1.0 📌 30 秒速览

Health Data Nexus(HDN) 是多伦多大学 Temerty Centre for AI Research and Education in Medicine(T-CAIREM)开发的医学 AI 研究与教育开放数据平台,托管 11+ 个去标识化健康数据集,旗舰数据集 GIM 覆盖 St. Michael’‘’‘’‘’‘’‘’‘’‘’'s Hospital 内科病房 22,000 次住院就诊和 14,000 名患者(2011-2019)。

它的独特价值在于构建了三级区域访问模型(Zone 1/2/3)——在保护患者隐私的前提下,让研究者在安全的 Google Cloud 环境中当天即可开始分析数据,而非等待数月的伦理审批。平台基于 PhysioNet 开源框架扩展,解决了医学 AI 领域"垃圾进,垃圾出"的顽疾,被誉为加拿大的医学 AI 数据基础设施基石。

你可以用它来:预测内科病房患者的恶化风险(ICU 转移/脓毒症/呼吸衰竭)、在多伦多健康数据马拉松中原型化临床决策支持工具、或学习如何在合规框架下处理真实世界去标识化健康数据。

§1.1 摘要

Health Data Nexus 由多伦多大学 T-CAIREM 于 2021 年启动,技术合作方为 Upside Lab(柏林),基于 PhysioNet(MIT/NIH)开源框架在 Google Cloud Platform 上构建。平台采用三级区域访问模型:Zone 1(凭证认证 + TCPS 2 培训 + DUA 签署)、Zone 2(追加研究计划审批)、Zone 3(追加 REB 伦理批准),平衡了数据安全与可访问性。截至 2026 年,平台托管 11+ 个数据集,涵盖结构化 EHR 表格、CT 影像、语音录音、睡眠生理信号、数字病理切片、分子数据和人群健康调查。旗舰数据集 GIM 由 Unity Health Toronto 数据科学与高级分析团队开发,数据源自三大临床系统(EHR、入院出院转院系统 ADT、药物管理检查系统 MAK),提供原始版和 8 小时窗口预处理版两种格式。平台于 2025 年 7 月在 GigaScience 期刊发表论文,用户已覆盖 12+ 个国家。

§1.2 战略价值分析

数据基础设施维度:HDN 填补了加拿大医学 AI 数据基础设施的关键空白。此前,PhysioNet(MIT/NIH)主要服务美国数据,Nightingale Open Science 偏重医学影像,Kaggle 缺乏敏感数据安全托管能力。HDN 是首个基于 PHIPA 合规框架、面向加拿大医疗系统、提供云端安全分析环境的开放数据平台。其独特的"数据不可直接下载、仅在安全云环境中分析"模式,既满足了隐私保护要求,又避免了 ICES 等机构"审批周期数月"的效率瓶颈——研究者在完成在线培训和签署 DUA 后当天即可获得数据访问权限。

教育赋能维度:HDN 的核心使命之一是教育。平台已连续三年(2023-2025)支撑多伦多健康数据马拉松(Toronto Health Datathon),累计服务数百名学生、实习生和医疗专业人员。多伦多大学生物医学工程教授连续两年使用 HDN 在课程中教授真实世界数据挑战(数据不一致性、预分析、偏差、类别不平衡)。VADA Summer Schools 工作坊将 HDN 作为一周项目实战平台。T-CAIREM 还提供 $50,000 数据集准备资助(Dataset Grants),鼓励研究者将自有数据上传至平台——如 2025 年 10 月发布的乳腺癌数字病理数据集即由此资助产生。

§1.3 横向对比

数据平台 样本量/规模 模态 安全性 可访问性 核心差异化
Health Data Nexus 11+ 数据集(GIM: 22,000 就诊) EHR/影像/语音/信号/病理/分子 ✅ 不可下载,三级区域控制,PHIPA 合规 当天批准(Zone 1) 加拿大首个安全可合规的医学 AI 数据平台
PhysioNet (MIT/NIH) 350+ 数据集 生理信号/EHR/影像 ⚠️ 可直接下载,存在再识别风险 当天批准 全球最成熟的生理信号数据仓库
Kaggle ~450,000 数据集 跨领域 ❌ 无敏感数据安全托管 立即下载 规模最大但无医学策展
ICES 100+ 数据集 卫生服务运营 ✅ PHIPA 指定实体,可托管可识别信息 ⚠️ 审批周期数月 加拿大最严格的卫生数据托管
Nightingale Open Science 医学影像为主 影像 + 标签 ⚠️ 可直接下载 注册后开放 芝加哥大学,偏重影像标注质量

§1.4 版本演进时间轴

时间 事件
2020-12 T-CAIREM 研究中心成立(多伦多大学 Temerty 医学院),三大支柱:研究、教育、数据基础设施
2021 HDN 平台上线,首批 3 个数据集;开展隐私影响评估(PIA)和威胁风险评估(TRA)
2022-10-21 GIM 数据集首次上传至 HDN(St. Michael’‘’‘’‘’‘’‘’‘’‘’'s Hospital 内科病房数据)
2023-02-10 CSpine 颈椎 CT 数据集上传
2023-03-29 T-CAIREM Hive 社区讨论平台上线
2023-07-05 HDN 加拿大全境开放(任何加拿大大学/研究机构可通过 eduGAIN SSO 登录)
2023 首届多伦多健康数据马拉松(~40 名研究者参与)
2023-03-17 GIM 数据集正式发布 v1.0.1
2024 第二届多伦多健康数据马拉松(引入共享计费账户和云存储)
2024-11-27 Bridge2AI-Voice 语音数据集发布
2024-12-09 睡眠实验室数据集发布
2025-07-04 GigaScience 论文正式发表:“Health Data Nexus: an open data platform for AI research and education in medicine”
2025-10-02 协作式 Vertex AI 工作区上线;乳腺癌数字病理数据集发布(157 名患者)
2025-11-26 免疫检查点阻断(ICB)分子数据集发布
2026-03-26 REB 审批政策更新与澄清

§1.5 典型 AI 应用场景

  1. 患者恶化预测:基于 GIM 数据集的 8 小时时间窗 EHR 数据(生命体征、实验室检查、药物、医嘱),预测未来 24/48/72 小时内 ICU 转移、脓毒症或呼吸衰竭风险
  2. 语音健康诊断:利用 Bridge2AI-Voice 数据集训练机器学习模型,从语音录音中诊断广泛健康状况(帕金森、声带病变等)
  3. 睡眠分期与障碍检测:基于 Sunnybrook 睡眠实验室的原始夜间多导生理信号,开发自动睡眠分期和睡眠呼吸暂停检测算法
  4. 病理图像分析:利用乳腺癌新辅助化疗数字切片数据集,训练 AI 预测病理完全缓解(pCR)
  5. 医学 AI 教育:在大学课程或数据马拉松中使用 HDN 数据集,让学生接触真实世界临床数据的不完美性(缺失值、类别不平衡、分布偏移)

§2 医学背景(Medical Context)

§2.1 ICD-11 映射

数据集标签 ICD-11 编码 ICD-11 术语
脓毒症(GIM 替代结局) MG30 脓毒症
呼吸衰竭(GIM 替代结局) MG40 呼吸衰竭
ICU 转移(GIM 结局) 5AA & XJ9E 转移至重症监护 / 危重症入院
死亡(GIM 结局) JD60 死亡,原因未明
姑息治疗入院(GIM 结局) XJ9E.1 入院姑息治疗
乳腺癌(病理数据集) 2D60.2 乳房内恶性肿瘤
COVID-19 住院(THP-C19) 1E31 COVID-19
颈椎损伤(CSpine) ND55.3 颈椎损伤
睡眠呼吸暂停(Sleep Lab) 7A40 睡眠相关呼吸障碍
心血管疾病(CHHDB) BD00-BD7Z 循环系统疾病
免疫检查点阻断相关毒性(ICB) 4A04 免疫治疗不良反应

§2.2 SNOMED CT 映射

数据集标签 SNOMED CT 代码 SNOMED CT 术语
全科内科 396275006 General internal medicine (qualifier value)
重症监护入院 89666000 Critical care admission (procedure)
脓毒症 8392001 Sepsis (disorder)
呼吸衰竭 409622000 Respiratory failure (disorder)
医院出院 423493009 Hospital discharge (procedure)
CT 扫描 77477000 Computed tomography (procedure)
乳腺恶性肿瘤 254837009 Malignant neoplasm of breast (disorder)
睡眠研究 258019001 Sleep studies (procedure)
语音评估 410005005 Speech and language assessment (procedure)

§2.3 临床任务定义

临床任务 对应数据集 任务类型 时间窗
患者恶化预警 GIM 二分类 / 多分类 8 小时窗口 → 未来 24/48/72h
ICU 转移预测 GIM 二分类 8 小时窗口 → 未来 24/48/72h
脓毒症早期识别 GIM 二分类 8 小时窗口 → 未来 24/48/72h
呼吸衰竭预警 GIM 二分类 8 小时窗口 → 未来 24/48/72h
语音健康诊断 Bridge2AI-Voice 多分类 录音片段级
睡眠分期 Sleep Lab 序列分类 30 秒 epoch
病理完全缓解预测 Breast Cancer Pathology 二分类 切片级 → 患者级
颈椎损伤检测 CSpine 目标检测 / 分割 CT 切片级

§2.4 患者人群特征(GIM 旗舰数据集)

维度 特征
数据来源 St. Michael’‘’‘’‘’‘’‘’‘’‘’'s Hospital(Unity Health Toronto),多伦多学术健康科学网络(TAHSN)成员
采集时间 2011-2019 年(8 年跨度)
年龄分布 四舍五入至 5 年;<20 岁设为 20,>90 岁设为 95;入排标准:住院 ≥30 小时
性别比例 数据含 sex 字段(具体比例见 GIM 文档仪表板)
其他人口统计 婚姻状况、语言、宗教信仰
就医类型 住院(General Internal Medicine 病房)
地理覆盖 加拿大安大略省多伦多市(单中心)

§2.5 临床意义

内科病房(GIM)是医院中最复杂的住院环境之一——患者年龄跨度大、合并症多、病情变化快。研究表明,约 10-15% 的内科住院患者在住院期间经历临床恶化(ICU 转移、脓毒症、呼吸衰竭等),而其中相当一部分恶化事件在回顾分析中是可预防的——如果早期识别系统足够灵敏。GIM 数据集的价值在于提供了真实世界中高粒度时序数据(8 小时窗口的生命体征、实验室检查、药物、医嘱),使 AI 模型能够在恶化事件发生前的 24-72 小时内发出预警,为临床团队争取干预窗口。

§2.6 金标准

数据划分 标注方式 标注者 金标准性质
GIM 原始数据 EHR 系统自动记录 + ICD-10 编码 临床信息系统 参考标准(系统记录)
GIM 预处理数据 8 小时窗口聚合 + 缺失值插补 DSAA 团队算法 加工参考标准
GIM 结局标签 EHR 系统事件记录(ICU 转移、死亡等) 临床信息系统 参考标准
GIM 变量选择 GIM 主治医师协商选定 GIM staff physician 专家共识
乳腺癌病理 新辅助化疗后病理评估 病理科医师 金标准(pCR 评估)

§3 数据集规格(Specifications)

§3.0 版本抉择矩阵

你的需求 推荐数据集/版本 大小 理由
患者恶化预测 / 时序 EHR 研究 GIM v1.0.1(预处理版) ~2 GB 含 8 小时窗口聚合、归一化、缺失值插补,直接可用于训练
自定义预处理 / 时序建模方法学研究 GIM v1.0.1(原始版) ~2 GB 未转换数据,含 demographics + outcomes 表,可自行设计窗口和特征工程
CT 影像分析 / 颈椎损伤检测 CSpine ~50 GB 1,000+ 张合并 CT 扫描(DICOM 格式)
语音健康诊断 / 多模态 AI Bridge2AI-Voice 视版本而定 NIH Bridge2AI 项目语音录音 + 健康元数据
睡眠医学 / 生理信号分析 Sleep Lab 视版本而定 Sunnybrook 睡眠实验室原始夜间信号 + 评分 + 问卷
数字病理 / 乳腺癌新辅助化疗 Breast Cancer Pathology 视版本而定 157 名高危乳腺癌患者高分辨率数字切片 + 临床数据
免疫治疗 / 分子数据 ICB 视版本而定 多中心临床试验 ExpressionSet R 对象
教学 / 数据马拉松 GIM + COVID-19 + CSpine 组合 2023-2024 多伦多数据马拉松验证的组合,覆盖表格/影像/多模态

§3.1 模态详细说明

Health Data Nexus 是一个多模态数据平台,托管以下模态的数据:

模态 涉及数据集 格式 说明
结构化 EHR 表格 GIM、THP-C19 CSV 生命体征、实验室检查、药物、医嘱、诊断编码(ICD-10)、人口统计
CT 影像 CSpine DICOM 颈椎 CT 扫描,1,000+ 张合并影像
语音录音 Bridge2AI-Voice WAV + 元数据 NIH Bridge2AI 项目,语音录音 + 健康状况标注
睡眠生理信号 Sleep Lab 多导仪原始信号 Sunnybrook 睡眠实验室,含原始夜间信号 + 评分 + 问卷
数字病理切片 Breast Cancer Pathology 全切片图像 157 名乳腺癌患者新辅助化疗前后高分辨率切片
分子数据 ICB R ExpressionSet 免疫检查点阻断临床试验多模态分子数据
人群健康调查 CHHDB、CCHS 表格 加拿大全国心血管健康调查、社区健康调查
RCT 摘要 Trial Files 表格 临床期刊发表的随机对照试验结果摘要
流行病学数据 COVID-19 Epi 表格 COVID-19 加拿大流行病学与疫苗接种数据

§3.2 样本总数(GIM 旗舰数据集)

数据集 子集 样本数 说明
GIM 唯一患者 14,000 2011-2019 年内科住院患者
GIM 住院就诊 22,000+ 每位患者可能有多次就诊
GIM 时间窗(预处理版) ~数百万行 8 小时窗口 × 就诊天数 × 变量数
CSpine CT 扫描 1,000+ 合并 CT 扫描
THP-C19 患者 500+ COVID-19 住院患者
CHHDB 调查条目 23,000 覆盖加拿大全部 10 个省
Breast Cancer Pathology 患者 157 高危乳腺癌新辅助化疗患者
Bridge2AI-Voice 录音 视版本 NIH Bridge2AI 项目语音数据

§3.3 数据格式

文件类型 格式 说明
结构化表格 CSV GIM、THP-C19 等关系表数据
影像 DICOM CSpine CT 扫描
病理切片 全切片图像格式 乳腺癌数字病理
语音 WAV + JSON 元数据 Bridge2AI-Voice
分子数据 R ExpressionSet ICB 临床试验数据
文档 Markdown / HTML Divio 文档系统(Data Dictionary / Tutorials / Getting Started)

§3.4 存储与访问

版本/形态 存储位置 可访问性 说明
全部数据集 Google Cloud Storage 仅在安全云环境内 通过 Cloud Storage FUSE 以文件系统形式呈现
数据下载 ❌ 不可下载 防止再识别和关联攻击 核心安全设计
计算环境 Google Cloud VM (Jupyter/RStudio) 凭证认证后使用 预装分析工具,支持 Kubernetes 自动扩缩
协作工作区 Vertex AI Workspace 2025-10 上线 支持多用户同时工作

§3.5 标注方式与数据管道

GIM 数据集的数据采集与处理管道:

┌─────────────────────────────────────────────────────────────────────┐
│                   GIM 数据集采集与处理管道                            │
├─────────────────────────────────────────────────────────────────────┤
│                                                                     │
│  [临床系统]         [数据提取]          [去标识化]        [预处理]   │
│                                                                     │
│  EHR ─────────┐                                                     │
│  (EMR)        ├─→ 数据提取 ─→ 去标识化 ─→ 原始数据 ─→ 预处理版   │
│  - 生命体征    │   按就诊 ID      ● 移除标识符    (raw/)    (processed/)│
│  - 实验室检查  │   关联三大系统   ● 随机 6 位 ID              │
│  - 临床医嘱    │                  ● 移除年/月                   │
│  - ICD-10     │                  ● 年龄取整至 5 年             │
│               │                  ● 仅保留相对时间               │
│  ADT ─────────┤                                                │
│  (入院/出院/  │                           ┌──────────────────┐ │
│   转院系统)   │                           │ 8 小时窗口聚合    │ │
│  - 就诊记录   │                           │ ● 数值取平均      │ │
│  - 转科记录   │                           │ ● 医嘱→布尔指示   │ │
│               │                           │ ● 药物→AHFS 分类  │ │
│  MAK ─────────┘                           │ ● 缺失值→LOCF     │ │
│  (药物管理    │                           │ ● 数值归一化 0-1   │ │
│   检查系统)   │                           └──────────────────┘ │
│  - 用药记录   │                                                 │
│  - 剂量/时间  │                           ┌──────────────────┐ │
│  - 给药途径   │                           │ 结局标签生成      │ │
│               │                           │ ● ICU 转移        │ │
│               │                           │ ● 死亡            │ │
│               │                           │ ● 姑息治疗        │ │
│               │                           │ ● 医院出院        │ │
│               │                           │ ● 脓毒症(24/48/72h)│ │
│               │                           │ ● 呼吸衰竭(24/48/72h)│ │
│               │                           └──────────────────┘ │
└─────────────────────────────────────────────────────────────────────┘

§3.6 标注者信息

角色 人数/来源 资质 职责
变量选择顾问 1 名 GIM 主治医师 Board-certified physician 协商选定 top occurring/most important 变量
数据工程团队 DSAA 团队 Unity Health Toronto 数据科学团队 数据提取、去标识化、预处理、文档化
平台治理 T-CAIREM 团队 数据治理分析师 + 首席分析官 + 临床负责人 平台治理、数据持有者协调、凭证审核
数据持有者 各数据集来源机构 TAHSN 成员医院 / 研究机构 数据去标识化、文档提供、DUA 签署

§3.7 采集时间

数据集 采集时间范围 跨度
GIM 2011-2019 8 年
CSpine 未公开
THP-C19 COVID-19 大流行期间
Sleep Lab 2024 年 8-10 月 ~3 个月
Bridge2AI-Voice 2024 年及后续 持续更新
Breast Cancer Pathology 未公开

§3.8 地域覆盖

数据集 地域 机构
GIM 加拿大安大略省多伦多 St. Michael’‘’‘’‘’‘’‘’‘’‘’'s Hospital (Unity Health Toronto)
CSpine 加拿大安大略省多伦多 St. Michael’‘’‘’‘’‘’‘’‘’‘’'s Hospital
THP-C19 加拿大安大略省密西沙加 Trillium Health Partners
CHHDB 加拿大全国 Canadian Heart Health Initiative(全部 10 省)
Sleep Lab 加拿大安大略省多伦多 Sunnybrook Research Institute
Bridge2AI-Voice 美国 + 国际多中心 University of South Florida 等
Breast Cancer Pathology 加拿大安大略省 Sunnybrook / 其他
ICB 国际多中心 多个临床试验

§3.9 设备规格

数据集 采集设备 说明
GIM EHR 系统(EMR)+ ADT + MAK 临床信息系统自动记录
CSpine CT 扫描仪 DICOM 格式
Sleep Lab 多导睡眠仪 原始夜间信号(EEG/EOG/EMG/呼吸/血氧等)
Bridge2AI-Voice 麦克风/录音设备 标准化语音录制
Breast Cancer Pathology 全切片数字扫描仪 高分辨率数字病理切片

§3.10 深度溯源链

[数据源头]                    [治理层]                     [平台层]                    [用户层]
                                                                                       
患者就诊                     T-CAIREM                    Health Data Nexus            研究者
  │                            │                            │                          │
  ├─→ EHR (EMR) ──┐           │                            │                          │
  │   - 生命体征   │           │                            │                          │
  │   - 实验室检查 │           │                            │                          │
  │   - 医嘱      │           │                            │                          │
  │   - ICD-10   │           │                            │                          │
  │              │           │                            │                          │
  ├─→ ADT ───────┤           │                            │                          │
  │   - 入院/出院 │           │                            │                          │
  │   - 转科     │           │                            │                          │
  │              │           │                            │                          │
  ├─→ MAK ───────┘           │                            │                          │
  │   - 药物管理 │            │                            │                          │
  │              ↓            │                            │                          │
  │     DSAA 团队提取 ──────→ DTA 签署 ──────→ GCP 上传 ──────→ 凭证认证 ──→ 安全环境分析
  │                            │                  │                    │
  │                     PIA + TRA 审查      Cloud Storage FUSE    Zone 1/2/3 准入
  │                     去标识化确认        (不可下载)            TCPS 2 培训
  │                     DUA 准备                                 DUA 签署
  │                                                             (Zone 2: 研究计划)
  │                                                             (Zone 3: + REB)
  │                                                                                   │
  │                                                                                   ↓
  │                                                                            Jupyter / RStudio
  │                                                                            Vertex AI Workspace
  │                                                                            (2025-10 协作功能)

§4 数据结构详解(Data Schema)

§4.0 目录树预览(GIM 数据集)

smh-gim/
├── processed/                    # 预处理数据(8 小时窗口聚合)
│   ├── vitals.csv               # 生命体征(8h 窗口平均值 + 测量指示 + 距上次测量时间)
│   ├── labs.csv                 # 实验室检查(同上)
│   ├── shift_assessment.csv     # 交接班评估
│   ├── fluid_intake.csv         # 液体摄入
│   ├── fluid_outtake.csv        # 液体排出
│   ├── disease_specific.csv     # 疾病特定变量
│   ├── clinical_orders.csv      # 临床医嘱(布尔指示:窗口内是否激活)
│   ├── medication_admin.csv     # 药物管理(AHFS 分类指示变量)
│   ├── outcomes.csv             # 结局(ICU 转移/死亡/姑息/出院 + 24/48/72h 预测窗)
│   └── alternate_outcomes.csv   # 替代结局(脓毒症/呼吸衰竭 + 24/48/72h)
├── raw/                          # 原始未转换数据
│   ├── vitals_raw.csv           # 原始生命体征(带时间戳)
│   ├── labs_raw.csv             # 原始实验室检查
│   ├── orders_raw.csv           # 原始医嘱
│   ├── medication_raw.csv       # 原始药物管理记录
│   └── ...                      # 其他原始表
├── demographics.csv              # 人口统计(age/sex/marital_status/language/religion)
├── outcomes_static.csv           # 静态结局(就诊级最终结局)
└── documentation/                # Divio 文档系统
    ├── data_dictionary/          # 每字段详细说明
    ├── tutorials/                # 基本分析教程
    ├── getting_started/          # 首次使用指南
    └── explanation/              # 数据集创建背景

§4.1 DAIMS 标准化字段描述表(GIM 预处理数据)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
encounter_id Text 就诊唯一标识符(随机 6 位整数) “384726” 记录关联主键 100000-999999
window_index Integer 8 小时窗口序号(从入院起算) 3 时序对齐 0-N(N=住院天数×3)
heart_rate_mean Float 8h 窗口内心率平均值 82.5 生命体征特征 测量设备误差 -1(未测量) 0-1(归一化)
heart_rate_measured Integer 窗口内是否测量心率 1 缺失指示 0/1
heart_rate_time_since_last Float 距上次测量时间(小时) 2.5 时序特征 0-192
sbp_mean Float 收缩压平均值 118.3 生命体征特征 测量误差 -1 0-1
temp_mean Float 体温平均值 37.2 生命体征特征 测量误差 -1 0-1
wbc_mean Float 白细胞计数平均值 8.7 实验室特征 分析仪误差 -1 0-1
lactate_mean Float 乳酸平均值 1.8 实验室特征 分析仪误差 -1 0-1
med_class_active Integer AHFS 药物分类是否在窗口内给药 1 药物特征 0(未给药) 0/1
order_active Integer 医嘱是否在窗口内激活 0 医嘱特征 0 0/1
age Integer 患者年龄(取整至 5 年) 65 人口统计特征 ±2.5 年 20-95
sex Text 患者性别 “F” 人口统计特征 M/F
icu_transfer_24h Integer 未来 24h 内 ICU 转移 0 预测标签 0/1
sepsis_48h Integer 未来 48h 内脓毒症 0 预测标签 0/1
resp_failure_72h Integer 未来 72h 内呼吸衰竭 0 预测标签 0/1

§4.2 标签分布(GIM 结局)

结局类型 发生次数 占总就诊比例 说明
医院出院 ~19,000+ ~86% 最常见结局,类别严重不平衡
ICU 转移 ~1,000-2,000 ~5-9% 关键预测目标
死亡 ~500-1,000 ~2-5% 罕见但高重要性
姑息治疗入院 ~500-1,000 ~2-5% 罕见
姑息治疗出院 <500 <2% 罕见

注意:以上比例为基于论文描述的估计值。实际分布请参考 GIM 文档仪表板(gim-docudash.netlify.app)中的可视化图表。结局类别严重不平衡是 GIM 数据集的核心挑战之一。

§4.3 数据统计

统计项 数值
唯一患者数 14,000
住院就诊数 22,000+
数据采集跨度 8 年(2011-2019)
时间窗口大小 8 小时
入排标准 住院 ≥30 小时
数据源系统数 3(EHR + ADT + MAK)
变量类别数 7(生命体征 + 实验室 + 交接班评估 + 液体 + 疾病特定 + 医嘱 + 药物)
药物分类体系 AHFS(American Hospital Formulary Service)
诊断编码体系 ICD-10
人口统计字段 5(age/sex/marital_status/language/religion)

§4.4 数据层级

患者 (Patient, N=14,000)
  └─→ 就诊 (Encounter, N=22,000+, 随机 6 位 ID)
        └─→ 8 小时窗口 (Window, N=就诊天数×3)
              ├─→ 生命体征 (vitals: HR/SBP/DBP/Temp/RR/SpO2...)
              ├─→ 实验室检查 (labs: WBC/Hb/Platelets/Na/K/Cr/Lactate...)
              ├─→ 交接班评估 (shift_assessment)
              ├─→ 液体平衡 (fluid_intake / fluid_outtake)
              ├─→ 疾病特定变量 (disease_specific)
              ├─→ 临床医嘱 (orders: imaging/telemetry/consults/...)
              ├─→ 药物管理 (medications: by AHFS class)
              └─→ 结局标签 (outcomes: icu_transfer/death/palliative/discharge + sepsis/resp_failure)

§4.5 缺失值情况

缺失类型 机制 编码方式 处理策略
实验室检查未测量 信息性缺失(非随机) 预处理版:LOCF 插补 + 测量指示变量 保留指示变量作为特征
生命体征未记录 信息性缺失(可能反映病情稳定) 同上 同上
药物未给药 真实零值 预处理版:0 插补 直接使用
医嘱未激活 真实零值 预处理版:0 插补 直接使用
年龄极值 隐私保护截断 <20→20, >90→95 注意极端年龄分布被掩盖

§5 数据划分与使用建议

§5.1 官方划分

Health Data Nexus / GIM 数据集未提供官方 train/val/test 划分。研究者需自行设计划分策略。

§5.2 推荐划分策略

策略 方法 适用场景 风险
按患者划分(推荐) 14,000 名患者按 70/15/15 划分 患者级预测 同一患者多次就诊不可跨集
按时间划分 2011-2017 训练 / 2018 验证 / 2019 测试 评估时间泛化性 需确认年度分布无突变
按结局分层 各结局类别内按比例划分 类别不平衡处理 需确保患者不跨集
嵌套交叉验证 患者级 5-fold CV 小样本稳定性 计算成本较高

§5.3 数据泄漏风险

风险 描述 缓解措施
患者级泄漏 同一患者多次就诊跨集 按 patient_id(可从 encounter_id 关联回溯)划分
时间窗泄漏 相邻 8h 窗口高度相关 避免相邻窗口分入不同集
结局泄漏 结局标签的时间窗口与特征窗口重叠 确保 features[t] 预测 outcome[t+k],k≥1
预处理泄漏 LOCF 可能携带未来信息 使用原始版数据 + 仅依赖历史信息的插补

§5.4 外部验证

外部验证场景 来源 可行性 说明
其他 TAHSN 医院内科数据 多伦多其他医院 ✅ 可行 需通过 HDN 申请新数据集
MIMIC-IV (US ICU) MIT/BIDMC ⚠️ 需适配 不同医疗系统、不同病房类型(ICU vs GIM)
eICU (US 多中心) Philips ⚠️ 需适配 多中心 ICU,数据结构差异大
加拿大其他省份数据 ICES 等 ⚠️ 需申请 不同省份医疗实践差异

§6 AI 就绪指南(AI-Ready Guide)

§6.1 快速上手

# ========================================
# Health Data Nexus — GIM 数据集快速上手
# 环境要求: 在 HDN 平台 Jupyter 工作区中运行
#
# ⚠️ 前置要求:
#   1. 在 https://healthdatanexus.ai 注册账户
#   2. 通过 eduGAIN SSO 或 ORCID 完成身份验证
#   3. 完成 TCPS 2: CORE-2022 伦理培训
#   4. 签署 GIM 数据集 Data Use Agreement (DUA)
#   5. 等待凭证认证通过(通常当天完成)
#   6. 在平台创建 Jupyter 工作区
#
# ⚠️ 数据位置约定:
#   在 HDN Jupyter 工作区中,GIM 数据集通过
#   Cloud Storage FUSE 挂载到文件系统。
#   具体路径请参考 GIM Documentation Dashboard:
#   https://gim-docudash.netlify.app/docs/getting-started/
# ========================================

import pandas as pd
import numpy as np

# 加载人口统计数据
demographics = pd.read_csv(''''''''''''''''data/gim/demographics.csv'''''''''''''''')
print(f"总就诊数: {len(demographics)}")
print(f"\n年龄统计:\n{demographics[''''''''''''''''age''''''''''''''''].describe()}")
print(f"\n性别分布:\n{demographics[''''''''''''''''sex''''''''''''''''].value_counts()}")

# 加载预处理生命体征数据(8 小时窗口)
vitals = pd.read_csv(''''''''''''''''data/gim/processed/vitals.csv'''''''''''''''')
print(f"\n生命体征记录数: {len(vitals)}")
print(f"列数: {len(vitals.columns)}")

# 加载结局标签
outcomes = pd.read_csv(''''''''''''''''data/gim/processed/outcomes.csv'''''''''''''''')
print(f"\n结局分布:\n{outcomes[''''''''''''''''outcome_type''''''''''''''''].value_counts()}")

§6.2 数据获取

步骤 操作 耗时 说明
1. 注册 https://healthdatanexus.ai → Sign Up 5 分钟 eduGAIN SSO(加拿大机构)或 ORCID
2. 凭证认证 提交个人信息 + 推荐人 1-24 小时 T-CAIREM 审核
3. 伦理培训 完成 TCPS 2: CORE-2022 2-3 小时 在线课程 + 测试
4. 签署 DUA 签署目标数据集的数据使用协议 10 分钟 需 T-CAIREM + 数据持有者双方批准
5. (Zone 2) 提交研究计划 视数据持有者 Zone 2 数据集需要
6. (Zone 3) 提交 REB 批准 视机构 Zone 3 数据集需要
7. 创建工作区 Jupyter / RStudio 即时 平台自动配置云资源
8. 开始分析 Cloud Storage FUSE 挂载数据 即时 数据以文件系统形式呈现

§6.3 预处理 Pipeline(GIM 患者恶化预测)

# ========================================
# GIM 患者恶化预测 — 预处理 Pipeline
# 目标: 预测未来 24h 内 ICU 转移
# ========================================

import pandas as pd
import numpy as np
from sklearn.preprocessing import StandardScaler

# 1. 加载预处理数据
vitals = pd.read_csv(''''''''''''''''data/gim/processed/vitals.csv'''''''''''''''')
labs = pd.read_csv(''''''''''''''''data/gim/processed/labs.csv'''''''''''''''')
meds = pd.read_csv(''''''''''''''''data/gim/processed/medication_admin.csv'''''''''''''''')
orders = pd.read_csv(''''''''''''''''data/gim/processed/clinical_orders.csv'''''''''''''''')
outcomes = pd.read_csv(''''''''''''''''data/gim/processed/outcomes.csv'''''''''''''''')
demographics = pd.read_csv(''''''''''''''''data/gim/demographics.csv'''''''''''''''')

# 2. 合并特征表(以 encounter_id + window_index 为主键)
feature_tables = [vitals, labs, meds, orders]
features = feature_tables[0]
for table in feature_tables[1:]:
    features = features.merge(table, on=[''''''''''''''''encounter_id'''''''''''''''', ''''''''''''''''window_index''''''''''''''''], how=''''''''''''''''outer'''''''''''''''')

# 3. 合并人口统计和结局
features = features.merge(demographics, on=''''''''''''''''encounter_id'''''''''''''''', how=''''''''''''''''left'''''''''''''''')
features = features.merge(
    outcomes[[''''''''''''''''encounter_id'''''''''''''''', ''''''''''''''''window_index'''''''''''''''', ''''''''''''''''icu_transfer_24h'''''''''''''''']],
    on=[''''''''''''''''encounter_id'''''''''''''''', ''''''''''''''''window_index''''''''''''''''], how=''''''''''''''''left''''''''''''''''
)

# 4. 处理缺失值
# 预处理版数据已做 LOCF,但仍可能有 NaN
numeric_cols = features.select_dtypes(include=[np.number]).columns
features[numeric_cols] = features[numeric_cols].fillna(0)

# 5. 编码分类变量
features[''''''''''''''''sex''''''''''''''''] = (features[''''''''''''''''sex''''''''''''''''] == ''''''''''''''''M'''''''''''''''').astype(int)

# 6. 按患者划分 train/val/test
# ⚠️ 关键: 必须按患者划分,防止数据泄漏
from sklearn.model_selection import GroupShuffleSplit

encounter_to_patient = demographics[[''''''''''''''''encounter_id'''''''''''''''']].copy()
encounter_to_patient[''''''''''''''''patient_id''''''''''''''''] = encounter_to_patient[''''''''''''''''encounter_id''''''''''''''''] // 100  # 示例:假设前 4 位为患者 ID

gss = GroupShuffleSplit(n_splits=1, test_size=0.3, random_state=42)
train_idx, temp_idx = next(gss.split(features, features[''''''''''''''''icu_transfer_24h''''''''''''''''], groups=features[''''''''''''''''encounter_id'''''''''''''''']))

# 7. 准备特征矩阵
drop_cols = [''''''''''''''''encounter_id'''''''''''''''', ''''''''''''''''window_index'''''''''''''''', ''''''''''''''''icu_transfer_24h'''''''''''''''']
X_train = features.iloc[train_idx].drop(columns=drop_cols)
y_train = features.iloc[train_idx][''''''''''''''''icu_transfer_24h''''''''''''''''].fillna(0).astype(int)

print(f"训练集大小: {len(X_train)}")
print(f"ICU 转移 24h 阳性率: {y_train.mean():.4f}")

§6.4 PyTorch DataLoader

# ========================================
# GIM 时序预测 — PyTorch Dataset
# 将 8h 窗口序列化为时序模型输入
# ========================================

import torch
from torch.utils.data import Dataset, DataLoader

class GIMTimeSeriesDataset(Dataset):
    """GIM 时序数据集:将每个就诊的 8h 窗口序列化为时序输入"""
    
    def __init__(self, features_df, outcome_col=''''''''''''''''icu_transfer_24h'''''''''''''''',
                 sequence_length=12, stride=1):
        """
        Args:
            features_df: 合并后的特征 DataFrame
            outcome_col: 预测目标列名
            sequence_length: 输入序列长度(12 个 8h 窗口 = 4 天历史)
            stride: 滑动窗口步长
        """
        self.features_df = features_df
        self.outcome_col = outcome_col
        self.seq_len = sequence_length
        self.stride = stride
        
        # 按就诊分组
        self.encounter_groups = features_df.groupby(''''''''''''''''encounter_id'''''''''''''''')
        # 构建样本索引:(encounter_id, start_window)
        self.samples = []
        for enc_id, group in self.encounter_groups:
            n_windows = len(group)
            for start in range(0, n_windows - self.seq_len, self.stride):
                self.samples.append((enc_id, start))
    
    def __len__(self):
        return len(self.samples)
    
    def __getitem__(self, idx):
        enc_id, start = self.samples[idx]
        group = self.encounter_groups.get_group(enc_id)
        
        # 提取时序特征
        seq = group.iloc[start:start + self.seq_len]
        feature_cols = [c for c in group.columns 
                       if c not in [''''''''''''''''encounter_id'''''''''''''''', ''''''''''''''''window_index'''''''''''''''', self.outcome_col]]
        x = torch.tensor(seq[feature_cols].values, dtype=torch.float32)
        
        # 标签:序列末端的预测目标
        y = torch.tensor(seq[self.outcome_col].iloc[-1], dtype=torch.long)
        
        return x, y

# 使用示例
# dataset = GIMTimeSeriesDataset(features, sequence_length=12, stride=1)
# dataloader = DataLoader(dataset, batch_size=64, shuffle=True)
# for x, y in dataloader:
#     print(f"Batch shape: {x.shape}, Labels: {y.shape}")
#     break

§6.5 常见坑点

⚠️ 坑点 1:数据不可离线下载(分类:工程陷阱)

问题:HDN 的核心安全设计是数据不可直接下载——所有分析必须在 Google Cloud 安全环境中进行。习惯了下载到本地分析的研究者可能不适应。

症状:无法找到"Download"按钮;尝试从工作区复制数据到本地失败。

解决:在平台 Jupyter/RStudio 工作区中直接分析;结果代码和图表可导出,但原始数据不可。如需大规模计算,使用 Vertex AI 工作区(2025-10 上线协作功能)。

参考:HDN 官方文档 — Getting Started 页面

⚠️ 坑点 2:GIM 结局类别严重不平衡(分类:标签理解)

问题:医院出院占 ~86%,ICU 转移仅 ~5-9%,死亡 ~2-5%。直接训练会导致模型偏向多数类(全预测"出院"可达 86% 准确率)。

症状:模型准确率很高但 recall 极低;混淆矩阵显示少数类几乎全被预测为多数类。

解决:(1) 使用 F1/AUROC/AUPRC 而非 Accuracy 作为评估指标;(2) 类别加权交叉熵损失(class weights inversely proportional to frequency);(3) SMOTE 或欠采样;(4) 使用 alternate_outcomes 表中的脓毒症/呼吸衰竭标签作为补充信号。

参考:GIM Documentation Dashboard — Outcomes 章节

⚠️ 坑点 3:LOCF 插补可能引入未来信息泄漏(分类:数据泄漏)

问题:预处理版数据使用 Last Observation Carry Forward (LOCF) 插补缺失值。如果预处理在全局层面执行(而非按时间顺序),可能携带未来观测值的信息。

症状:验证集性能异常高;切换到原始数据后性能大幅下降。

解决:(1) 使用 raw/ 目录中的原始数据,自行实现严格时序安全的插补;(2) 如使用预处理版,仅依赖 *_measured 指示变量和 *_time_since_last 特征,忽略 LOCF 值;(3) 在时序交叉验证中确认无未来信息泄漏。

参考:GIM data paper (Kuzulugil et al., 2023, DOI: 10.57764/5rq7-xj70)

⚠️ 坑点 4:同一患者多次就诊跨集泄漏(分类:数据泄漏)

问题:14,000 名患者产生 22,000+ 次就诊。如果按 encounter_id 随机划分,同一患者的不同就诊可能分入训练集和测试集,导致模型学到患者特异性模式。

症状:测试集性能偏高;部署到新患者时性能下降。

解决:按 patient_id 分组划分(GroupShuffleSplit),确保同一患者所有就诊在同一集。GIM 数据集中 patient_id 可从 encounter_id 关联回溯或从文档仪表板获取。

参考:GIM Documentation Dashboard — Data Dictionary

⚠️ 坑点 5:Zone 2/3 审批周期不可控(分类:工程陷阱)

问题:Zone 1 数据集当天可获批,但 Zone 2 需数据持有者审批研究计划,Zone 3 需 REB 批准,周期可能数周至数月。

症状:紧急项目被 Zone 2/3 审批阻塞。

解决:(1) 优先使用 Zone 1 数据集(如 GIM);(2) 非研究用途(教学、数据探索、datathon)不需要 REB 审批;(3) 提前准备研究计划文档。

参考:HDN 官网 News — 2026-03-26 REB Approval Reminder

⚠️ 坑点 6:年龄截断掩盖极端年龄分布(分类:偏倚陷阱)

问题:年龄 <20 设为 20、>90 设为 95,且取整至 5 年。这掩盖了儿科和超高龄患者的真实分布。

症状:模型在极端年龄患者中性能不可评估;无法识别年龄相关的子群体偏差。

解决:(1) 意识到 20 岁和 95 岁是截断值而非真实值;(2) 在模型评估中报告 20 岁和 95 岁子群体的性能;(3) 如需精确年龄分析,考虑原始数据中是否保留更多信息。

参考:GIM data paper — De-identification section

⚠️ 坑点 7:宗教和语言字段可能引入偏倚(分类:偏倚陷阱)

问题:多伦多是高度多元文化城市,宗教和语言字段反映了当地人口结构。直接使用这些特征可能导致模型学到文化/种族相关的偏见模式。

症状:模型在不同语言/宗教子群体间性能差异显著; fairness metrics 不达标。

解决:(1) 评估是否真正需要这些特征(对比有/无这些特征的模型性能);(2) 如使用,进行 fairness audit 并报告子群体性能;(3) 考虑移除后训练无偏模型作为 baseline。

参考:TCPS 2 伦理指南 — 多元文化考量

⚠️ 坑点 8:Vertex AI 工作区计费(分类:工程陷阱)

问题:2025-10 上线的 Vertex AI 协作工作区需要计费账户。个人研究者可能需要自付 GPU 费用,除非有共享计费账户(如 datathon 提供)。

症状:创建工作区时提示需要计费账户;无法使用 GPU。

解决:(1) 申请 Google Research Credits(教育者可用);(2) 参加官方 datathon 获取共享计费账户;(3) 使用 CPU 工作区进行小规模实验。

参考:HDN 官网 — Collaborative Workspaces announcement

§6.6 数据增强策略

策略 适用性 说明
时序窗口滑动 ✅ 安全 改变 sequence_length 和 stride 增加样本数
SMOTE ✅ 安全 对少数类(ICU 转移/死亡)过采样
Mixup ⚠️ 谨慎 时序 Mixup 可能产生不合理的生理信号组合
噪声注入 ✅ 安全 对生命体征添加高斯噪声模拟测量误差
时间偏移 ⚠️ 谨慎 偏移整个就诊时间轴可能改变结局时序关系

§6.7 模型推荐

模型 架构 适用任务 预期性能
XGBoost 梯度提升树 窗口级二分类(ICU 转移 24h) AUROC 0.75-0.85
LSTM 双向 LSTM + FC 时序序列预测 AUROC 0.78-0.88
Transformer 时序 Transformer + 分类头 时序序列预测 AUROC 0.80-0.90
Temporal Fusion Transformer TFT 多结局多窗口预测 AUROC 0.82-0.90
朴素 Baseline 前一窗口值 + 阈值 Baseline AUROC 0.60-0.70

§6.8 计算需求

配置 CPU GPU 内存 磁盘 训练时间(GIM 全量)
最低可行 4 vCPU 16 GB 50 GB 2-4 小时(XGBoost)
推荐 8 vCPU T4 16GB 32 GB 100 GB 1-2 小时(LSTM)
高性能 16 vCPU V100 32GB 64 GB 200 GB 30 分钟(Transformer)
协作(Vertex AI) 自动扩缩 A100 40GB 128 GB 500 GB <15 分钟

§6.9 评估指标

# ========================================
# GIM 患者恶化预测 — 评估指标
# ========================================

from sklearn.metrics import (roc_auc_score, average_precision_score,
                             f1_score, precision_score, recall_score,
                             confusion_matrix, classification_report)

def evaluate_deterioration_model(y_true, y_pred_prob, threshold=0.5):
    """
    评估患者恶化预测模型(重点:不平衡数据处理)
    
    Args:
        y_true: 真实标签 (0/1)
        y_pred_prob: 预测概率
        threshold: 分类阈值
    """
    y_pred = (y_pred_prob >= threshold).astype(int)
    
    # 核心指标(针对不平衡数据)
    auroc = roc_auc_score(y_true, y_pred_prob)
    auprc = average_precision_score(y_true, y_pred_prob)
    f1 = f1_score(y_true, y_pred)
    precision = precision_score(y_true, y_pred)
    recall = recall_score(y_true, y_pred)
    
    print(f"AUROC:     {auroc:.4f}")
    print(f"AUPRC:     {auprc:.4f}  ← 不平衡数据关键指标")
    print(f"F1:        {f1:.4f}")
    print(f"Precision: {precision:.4f}")
    print(f"Recall:    {recall:.4f}")
    print(f"\n混淆矩阵:\n{confusion_matrix(y_true, y_pred)}")
    print(f"\n分类报告:\n{classification_report(y_true, y_pred)}")
    
    return {''''''''''''''''auroc'''''''''''''''': auroc, ''''''''''''''''auprc'''''''''''''''': auprc, ''''''''''''''''f1'''''''''''''''': f1, 
            ''''''''''''''''precision'''''''''''''''': precision, ''''''''''''''''recall'''''''''''''''': recall}

§6.10 MLOps 笔记

  • 数据版本:HDN 数据集通过平台版本管理(如 GIM v1.0.1),但无 API 级版本锁定。建议在实验记录中标注数据集版本号和访问日期。

  • 实验追踪:平台 Jupyter 工作区支持自定义 MLflow/Weights & Biases 集成。

  • 模型导出:训练完成后的模型权重和代码可从工作区导出,但训练数据不可。

  • 可复现性:由于数据在云环境中分析,复现性依赖于:(1) 数据集版本不变;(2) 计算环境配置记录;(3) 随机种子固定。

  • 部署:HDN 是研究/教育平台,不提供模型部署服务。模型部署需在独立环境中进行。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
单中心偏倚 GIM 数据仅来自 St. Michael’‘’‘’‘’‘’‘’‘’‘’'s Hospital 一家医院 ⚠️ 高 平台持续新增其他医院数据集
地理偏倚 所有数据集主要来自多伦多 TAHSN 网络 ⚠️ 高 Bridge2AI-Voice 等数据集为多中心
时间偏倚 GIM 数据 2011-2019,不反映 COVID 后临床实践变化 ⚠️ 中 THP-C19 数据集补充 COVID 时期
选择偏倚 仅住院 ≥30 小时的患者纳入 GIM ⚠️ 中 短住院患者(<30h)被排除
人口统计偏倚 多伦多特定人口结构(高度多元文化) ⚠️ 中 评估子群体性能差异
年龄截断偏倚 <20→20, >90→95 掩盖极端年龄分布 ⚠️ 低 意识到截断值存在
用户偏倚 93% 平台用户来自安大略省大学 ⚠️ 低 持续国际扩展

§7.2 标注质量评估

标注类型 方式 质量 局限性
GIM 生命体征/实验室 EHR 自动记录 高(系统级精确) 测量设备误差
GIM 药物管理 MAK 系统记录 给药记录可能遗漏 PRN(按需)药物
GIM 结局标签 系统事件记录 中-高 姑息治疗定义可能不一致
GIM 变量选择 医师协商 中(专家共识但非系统化) 可能遗漏重要变量
GIM 预处理 算法自动 LOCF 可能不适用于所有变量

§7.3 泛化性讨论

场景 失效风险 证据
部署到非多伦多医院 不同医院 EHR 系统、临床实践、人口结构
部署到非加拿大医疗系统 药物名称/分类、ICD 编码实践、医疗流程差异
COVID 后时期部署 临床实践变化(远程医疗、分诊策略)
门诊/急诊场景 GIM 仅覆盖住院内科病房
儿科/外科场景 GIM 排除儿科和外科患者

§7.4 伦理考量

  1. 隐私保护:数据在 Google Cloud 安全环境中分析,不可直接下载。去标识化遵循安大略省信息与隐私专员指南。三级区域访问模型确保不同敏感度数据获得相应保护。
  2. 知情同意:数据为回顾性去标识化数据,基于 PHIPA 法规在无需个体知情同意的情况下用于研究。REB 审批(Zone 3)提供额外伦理监督。
  3. 公平性:多伦多高度多元文化人口为 fairness 研究提供了条件,但单一地理来源限制了公平性结论的可推广性。语言和宗教字段需要审慎使用。
  4. 数据主权:数据存储在加拿大 Google Cloud 区域,符合数据驻留要求。数据持有者保留对数据的控制权(包括审批研究计划的权利)。
  5. 教育公平:平台提供免费数据存储和教育资源,$50,000 Dataset Grants 降低数据贡献门槛。共享计费机制解决学生使用云资源的公平性问题。

§7.5 公平性评估代码

# ========================================
# GIM 数据集公平性评估
# 评估模型在不同人口统计子群体间的性能差异
# ========================================

def fairness_audit(y_true, y_pred_prob, demographics_df, 
                   sensitive_attrs=[''''''''''''''''sex'''''''''''''''', ''''''''''''''''age_group'''''''''''''''']):
    """
    评估模型在敏感属性子群体间的公平性
    """
    from sklearn.metrics import roc_auc_score
    
    results = {}
    
    for attr in sensitive_attrs:
        print(f"\n=== 公平性评估: {attr} ===")
        
        if attr == ''''''''''''''''age_group'''''''''''''''':
            # 年龄分组(注意截断值)
            demographics_df = demographics_df.copy()
            demographics_df[''''''''''''''''age_group''''''''''''''''] = pd.cut(
                demographics_df[''''''''''''''''age''''''''''''''''], 
                bins=[20, 40, 60, 80, 96],
                labels=[''''''''''''''''20-40'''''''''''''''', ''''''''''''''''40-60'''''''''''''''', ''''''''''''''''60-80'''''''''''''''', ''''''''''''''''80-95+'''''''''''''''']
            )
        
        for group in demographics_df[attr].unique():
            mask = demographics_df[attr] == group
            if mask.sum() > 0 and y_true[mask].nunique() > 1:
                auroc = roc_auc_score(y_true[mask], y_pred_prob[mask])
                prevalence = y_true[mask].mean()
                print(f"  {group}: N={mask.sum()}, AUROC={auroc:.4f}, 阳性率={prevalence:.4f}")
                results[f"{attr}_{group}"] = {''''''''''''''''auroc'''''''''''''''': auroc, ''''''''''''''''n'''''''''''''''': mask.sum(), ''''''''''''''''prevalence'''''''''''''''': prevalence}
            else:
                print(f"  {group}: N={mask.sum()} (样本不足或单一类别)")
    
    # 计算性能差异
    if len(results) > 1:
        aurocs = [v[''''''''''''''''auroc''''''''''''''''] for v in results.values()]
        print(f"\n  AUROC 范围: {min(aurocs):.4f} - {max(aurocs):.4f}")
        print(f"  性能差距: {max(aurocs) - min(aurocs):.4f}")
    
    return results

§7.6 数据漂移提示

  • 时间漂移:GIM 数据 2011-2019,COVID-19 后临床实践显著变化(分诊策略、远程监护、药物方案)。在 COVID 后数据上部署需重新验证。
  • EHR 系统升级:8 年跨度内 EHR 系统可能升级,导致变量定义或记录方式变化。
  • 药物方案变化:AHFS 分类体系本身可能更新;新药上市后分类归属可能变化。
  • 人口结构变化:多伦多人口结构在 2011-2019 间持续变化,移民模式和年龄分布可能有偏移。

§7.7 DAIMS 24 项数据就绪度评估表

# 评估项 状态 说明
1 数据集基本信息 名称、版本、创建者、许可证均明确
2 数据组成 11+ 数据集,GIM 旗舰数据集详细描述
3 数据采集过程 三大系统(EHR/ADT/MAK)+ 去标识化流程
4 标注策略 系统自动记录 + 医师协商变量选择
5 标注者资质 GIM staff physician + DSAA 团队
6 影响群体 内科住院患者,多伦多人口
7 数据采集时段 GIM: 2011-2019
8 数据采集地域 多伦多 TAHSN 网络
9 数据采集设备 EHR/CT/多导仪/麦克风/切片扫描仪
10 训练/验证/测试划分 ⚠️ 未提供官方划分,需自行设计
11 数据格式 CSV/DICOM/WAV/R ExpressionSet
12 数据大小 各数据集大小可查
13 缺失值处理 LOCF + 测量指示变量
14 标签分布 ⚠️ 结局类别严重不平衡,具体比例需查文档
15 已知偏倚 7 项偏倚已识别(§7.1)
16 伦理审查 PIA + TRA + PHIPA 合规 + Zone 3 REB
17 隐私保护 去标识化 + 不可下载 + 安全云环境
18 数据使用限制 DUA + DUO 标签 + Zone 控制
19 维护计划 T-CAIREM 持续运营 + Dataset Grants 扩展
20 版本控制 平台级版本管理(GIM v1.0.1)
21 文档质量 Divio 文档系统(4 类互补文档)
22 社区活跃度 年度 datathon + T-CAIREM Hive
23 工具链支持 ⚠️ Jupyter/RStudio 内置,但无 HuggingFace/Kaggle 集成
24 外部验证 ⚠️ 有限(主要在平台内验证,缺乏跨平台外部评估)

DAIMS 评分:20 / 24

评分解读良好 — 平台级治理和文档体系优秀,三级区域访问模型和 PHIPA 合规建立了高标准隐私保护框架。

对你意味着什么:Health Data Nexus 是一个高度治理化的安全数据平台,特别适合需要在合规框架下使用真实世界临床数据的研究和教育场景。主要扣分项集中在:(1) 无官方数据划分——需自行设计并防止患者级泄漏;(2) 结局类别严重不平衡——需使用 AUPRC 和类别加权策略;(3) 无 HuggingFace/Kaggle 集成——所有分析在平台云环境中进行;(4) 外部验证有限——跨平台/跨地域泛化性待验证。建议:(1) 按患者 ID 严格划分 train/val/test;(2) 使用原始数据版自行实现时序安全插补;(3) 参加官方 datathon 获取共享计费和协作环境;(4) 在 MIMIC-IV/eICU 上做跨数据集泛化性验证。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
MIMIC-IV (ICU) MIT/BIDMC ICU 转移预测 AUROC ~0.85 不同病房类型(ICU vs GIM),需适配特征空间
eICU (多中心 ICU) Philips 脓毒症预测 AUROC ~0.80 多中心数据结构差异大,需重新特征工程
HDN Datathon 2023 HDN GIM 恶化预测 变异较大 不同团队方案差异大,反映问题开放性
HDN Datathon 2024 HDN GIM + COVID + CSpine 变异较大 76% 参与者满意平台功能

约束:由于 HDN 是新近发表的平台(GigaScience 2025-07),同行评审的外部验证研究有限。上表包含基于 GIM 数据集结构与同类数据集(MIMIC-IV/eICU)的预期可比性分析。

§8 基准性能与生态

§8.1 排行榜

注意:Health Data Nexus / GIM 数据集尚无官方排行榜。以下为基于公开论文和 datathon 报告的参考性能。

排名 模型/方法 数据集 任务 性能指标 年份 关键技术 来源
DSAA 患者监测系统 GIM ICU 转移预测 内部验证 2019-2022 Unity Health Toronto 内部系统 Kuzulugil et al., 2023
Datathon 2023 团队方案 GIM 恶化预测 变异较大 2023 多种方法(XGBoost/LSTM/规则) HDN Datathon 2023
Datathon 2024 团队方案 GIM + COVID 多任务 变异较大 2024 多种方法 + 多模态融合 HDN Datathon 2024
Datathon 2025 团队方案 GIM + Sleep + Voice 多任务 变异较大 2025 跨数据集多模态 HDN Datathon 2025

为什么不可直接比较:不同 datathon 团队使用不同的特征集、时间窗、划分策略和评估指标。GIM 数据集无官方排行榜,研究者应建立自己的 baseline 并报告完整的评估协议。

§8.2 SOTA 总结与选型建议

任务 推荐 Baseline 推荐进阶 注意事项
ICU 转移 24h XGBoost + 窗口级特征 Temporal Fusion Transformer 使用 AUPRC 而非 Accuracy
脓毒症 48h Logistic Regression + MEWS LSTM + 注意力机制 参考临床评分(MEWS/SOFA)作为 baseline
呼吸衰竭 72h Random Forest BiLSTM + 临床知识嵌入 长窗口预测信息衰减明显

§8.3 评测协议

  1. 数据划分:按患者 ID 分组 70/15/15,确保同患者不跨集
  2. 评估窗口:在 8 小时窗口级别评估,但按患者级聚合报告
  3. 核心指标:AUROC(总体判别力)+ AUPRC(不平衡数据关键)+ Sensitivity at Specificity 0.90(临床效用)
  4. 子群体分析:按年龄组、性别报告性能差异
  5. 时间泛化:如有足够数据,按时间划分验证时间稳定性

§8.4 相关数据集

数据集 关系 说明
MIMIC-IV 互补 美国 ICU 数据,更大规模但不同病房类型
eICU 互补 美国多中心 ICU,适合跨地域泛化验证
GEMINI 同类 加拿大另一个内科住院数据集(St. Michael’‘’‘’‘’‘’‘’‘’‘’'s Hospital 更广泛版本)
HiRID 互补 欧洲重症监护数据
AmsterdamUMCdb 互补 欧洲 GDPR 合规 ICU 数据
Bridge2AI-Voice 同平台 HDN 托管的语音健康数据集

§8.5 关键论文

  1. Adams J, Rotenberg D, Verma A, et al. “Health Data Nexus: an open data platform for AI research and education in medicine.” GigaScience, 2025. DOI: 10.1093/gigascience/giaf050
    — 平台官方论文,描述 HDN 架构、治理框架、数据集和教育应用

  2. Kuzulugil S, Pou-Prom C, Mamdani M, et al. “GIM, a dataset for predicting patient deterioration in the General Internal Medicine ward.” 2023. DOI: 10.57764/5rq7-xj70
    — GIM 旗舰数据集数据论文,描述数据采集、去标识化、预处理和结构

  3. Johnson A, Bélisle-Pipon J-C, Dorr D, et al. “Bridge2AI-Voice: An ethically-sourced, diverse voice dataset linked to health information.” 2024.
    — HDN 托管的语音数据集,NIH Bridge2AI 项目

  4. Arora A, Alderman JE, Palmer J, et al. “The value of standards for health datasets in artificial intelligence-based applications.” Nature Medicine, 2023.
    — 健康数据集标准化价值,HDN 治理框架的理论基础

  5. University of Toronto. “No more ‘’‘’‘’‘’‘’‘’‘’‘‘garbage in, garbage out’’‘’‘’‘’‘’‘’‘’‘’: U of T rolls out health data repository for AI researchers.” 2025.
    — HDN 发布新闻报道,阐述平台使命和影响

§8.6 社区活跃度

维度 数值 截至日期
平台用户国家数 12+ 2025-12
托管数据集数 11+ 2026-03
年度数据马拉松 3 届(2023-2025) 2025-12
用户主要来源 93% 安大略省大学 2025-07
GIM 数据集引用 增长中(新近发布) 2026-08
T-CAIREM Hive 社区 活跃(TAHSN 成员) 2026-03
Dataset Grants $50,000/项 2025-10

§8.7 生态快照

资源 类型 链接 为什么值得关注
HDN 平台 官方平台 https://healthdatanexus.ai 注册、凭证认证、数据访问和云分析环境
GIM 文档仪表板 文档 https://gim-docudash.netlify.app/ GIM 数据集完整文档:数据字典、教程、快速入门
T-CAIREM 官网 研究中心 https://tcairem.utoronto.ca/ T-CAIREM 研究中心主页,含项目、人员和新闻
T-CAIREM Hive 社区 需注册后访问 数据集讨论组、问答、技巧分享
HDN News 新闻 https://healthdatanexus.ai/news 平台更新、新数据集发布、活动公告
GigaScience 论文 论文 https://doi.org/10.1093/gigascience/giaf050 平台官方论文(开放获取)
Upside Lab 案例研究 技术案例 https://upsidelab.io/case-studies/university-of-toronto 平台技术架构和开发过程详解
U of T 新闻 新闻 https://www.utoronto.ca/news/no-more-garbage-garbage-out-u-t-rolls-out-health-data-repository-ai-researchers 平台发布新闻和使命阐述
                    Health Data Nexus 生态全景
                                                                         
    ┌──────────────────┐    ┌──────────────────┐    ┌──────────────────┐
    │   T-CAIREM       │    │   Upside Lab     │    │   Data Holders   │
    │   (U of T)       │    │   (Berlin)       │    │   (TAHSN 网络医院) │
    │   治理 + 运营     │◄──►│   技术开发        │◄──►│   数据贡献        │
    └────────┬─────────┘    └────────┬─────────┘    └────────┬─────────┘
             │                       │                        │
             └───────────────────────┼────────────────────────┘
                                     │
                            ┌────────▼─────────┐
                            │  Health Data     │
                            │  Nexus 平台      │
                            │  (Google Cloud)  │
                            │                  │
                            │  ┌────────────┐  │
                            │  │ Zone 1     │  │  ← 凭证+培训+DUA
                            │  ├────────────┤  │
                            │  │ Zone 2     │  │  ← +研究计划
                            │  ├────────────┤  │
                            │  │ Zone 3     │  │  ← +REB 批准
                            │  └────────────┘  │
                            │                  │
                            │  Jupyter/RStudio │
                            │  Vertex AI       │
                            │  Cloud Storage   │
                            │  FUSE            │
                            └────────┬─────────┘
                                     │
             ┌───────────────────────┼───────────────────────┐
             │                       │                       │
    ┌────────▼─────────┐    ┌────────▼─────────┐    ┌────────▼─────────┐
    │   研究者          │    │   教育者          │    │   学生/实习生     │
    │   恶化预测模型    │    │   课程集成        │    │   Datathon       │
    │   公平性研究      │    │   VADA Workshop   │    │   小组项目        │
    └──────────────────┘    └──────────────────┘    └──────────────────┘

§9 相关资源与引用

§9.1 BibTeX

@article{adams2025hdn,
  title     = {Health Data Nexus: an open data platform for AI research and education in medicine},
  author    = {Adams, January and Rotenberg, David and Verma, Amol and others},
  journal   = {GigaScience},
  volume    = {14},
  year      = {2025},
  doi       = {10.1093/gigascience/giaf050},
  url       = {https://academic.oup.com/gigascience/article/doi/10.1093/gigascience/giaf050/8155783}
}

@article{kuzulugil2023gim,
  title     = {GIM, a dataset for predicting patient deterioration in the General Internal Medicine ward},
  author    = {Kuzulugil, Sebnem and Pou-Prom, Chloe and Mamdani, Muhammad and Murray, Joshua and Verma, Amol and Zhu, Kaiyin and Banning, Michaelia},
  year      = {2023},
  doi       = {10.57764/5rq7-xj70},
  url       = {https://doi.org/10.57764/5rq7-xj70}
}

§9.2 官方资源

资源 URL
HDN 平台主页 https://healthdatanexus.ai
GIM 数据集页 https://healthdatanexus.ai/content/smh-gim/1.0.0/
GIM 文档仪表板 https://gim-docudash.netlify.app/
T-CAIREM 官网 https://tcairem.utoronto.ca/
GigaScience 论文 https://doi.org/10.1093/gigascience/giaf050
PMC 全文 https://pmc.ncbi.nlm.nih.gov/articles/PMC12131319/
U of T 新闻 https://www.utoronto.ca/news/no-more-garbage-garbage-out-u-t-rolls-out-health-data-repository-ai-researchers
T-CAIREM Workshop https://tcairem.utoronto.ca/event/health-data-nexus-workshop-st-michaels-hospital-general-internal-medicine-dataset

§9.3 社区资源

资源 URL
HDN News https://healthdatanexus.ai/news
T-CAIREM Hive 需注册后访问(TAHSN 成员)
Upside Lab 案例研究 https://upsidelab.io/case-studies/university-of-toronto
Bridge2AI-Voice 文档 https://docs.b2ai-voice.org/

§9.4 许可证

Health Data Nexus 数据集采用每数据集独立 Data Use Agreement (DUA) 模式:

  • 使用者须在平台注册并通过凭证认证
  • 完成 TCPS 2: CORE-2022 伦理培训
  • 签署目标数据集的 DUA(须经 T-CAIREM 和数据持有者双方批准)
  • 非商业研究用途
  • 数据不可直接下载,仅在安全云环境中分析
  • Zone 2/3 数据集需额外审批

§9.5 引用建议

如果您在研究中使用了 Health Data Nexus 或 GIM 数据集,请引用:

Adams, J., Rotenberg, D., Verma, A., et al. (2025). Health Data Nexus: an open data platform for AI research and education in medicine. GigaScience, 14. https://doi.org/10.1093/gigascience/giaf050

Kuzulugil, S., Pou-Prom, C., Mamdani, M., Murray, J., Verma, A., Zhu, K., & Banning, M. (2023). GIM, a dataset for predicting patient deterioration in the General Internal Medicine ward. https://doi.org/10.57764/5rq7-xj70

§9.6 致谢

Health Data Nexus 由 University of Toronto Temerty Centre for AI Research and Education in Medicine (T-CAIREM) 开发,技术合作方为 Upside Lab(柏林)。平台基于 PhysioNet(MIT/NIH)开源框架扩展。数据由 Toronto Academic Health Science Network (TAHSN) 成员医院贡献。GIM 数据集由 Unity Health Toronto 数据科学与高级分析 (DSAA) 团队开发。

§9.7 变更日志

版本 日期 变更
v1.0 2026-08-04 初始版本,覆盖 HDN 平台 + GIM 旗舰数据集 + 11+ 数据集概览

§10 AI 使用声明卡

§10.1 AI 模型使用

模型 版本 用途
Claude Sonnet 4 全文撰写、结构设计、技术分析
WebSearch 检索 HDN 平台论文、GIM 数据集文档、新闻报道
WebFetch 提取 PMC 论文全文技术细节

§10.2 AI 参与范围

全文撰写(AI 生成 + 人工审核交叉校验)

§10.3 输入来源

  1. Adams et al. (2025). “Health Data Nexus: an open data platform for AI research and education in medicine.” GigaScience. DOI: 10.1093/gigascience/giaf050
  2. Kuzulugil et al. (2023). “GIM, a dataset for predicting patient deterioration in the General Internal Medicine ward.” DOI: 10.57764/5rq7-xj70
  3. PMC 全文:https://pmc.ncbi.nlm.nih.gov/articles/PMC12131319/
  4. HDN 官网:https://healthdatanexus.ai + https://healthdatanexus.ai/news
  5. GIM 文档仪表板:https://gim-docudash.netlify.app/docs/_print/
  6. U of T 新闻:https://www.utoronto.ca/news/no-more-garbage-garbage-out-u-t-rolls-out-health-data-repository-ai-researchers
  7. Upside Lab 案例研究:https://upsidelab.io/case-studies/university-of-toronto
  8. Edgentiq 报道:https://edgentiq.com/university-of-toronto-unveils-health-data-nexus-to-propel-ai-in-medical-research/
  9. PDF《Global Medical AI Datasets》第 10、22、24 页中 Health Data Nexus 基础介绍

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景 千方病案医学编辑部 交叉审核 ✅ 已通过
§3 数据规格 千方病案医学编辑部 与 GIM 文档仪表板交叉比对 ✅ 已验证
§4 DAIMS 数据字典 千方病案医学编辑部 与 GIM data paper 交叉比对 ✅ 已验证
§5 数据划分 千方病案医学编辑部 逻辑审查 ✅ 已通过
§6 代码示例 千方病案医学编辑部 逻辑审查 ✅ 已通过
§7 偏倚分析 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 生态 千方病案医学编辑部 与 HDN 官网交叉比对 ✅ 已验证
frontmatter JSON-LD 千方病案医学编辑部 结构验证 ✅ 已验证

页面状态:published(全部内容已完成审核并发布)

返回 AI Ready 数据集