ISARIC-CCP — 全球新冠住院队列 AI-Ready Wikipedia | 千方病案医数集

全球最大标准化新冠住院前瞻队列 · 70 万+ 例 · 60+ 国受控数据

来源 ISARIC (International Severe Acute Respiratory and emerging Infection Consortium) & IDDO url: https://isaric.org/research/covid-19-clinical-research-resources/发布时间: 2026-09-08最后更新: 2026-09-08 阅读 3

信息速览

数据集名称ISARIC-CCP — 全球新冠住院队列 AI-Ready Wikipedia | 千方病案医数集
数据类型超70万例住院病例,60+国全球队列,受控申请获取,CSV与PostgreSQL
规模70 万+ 例住院病例
接入方式ISARIC (International Severe Acute Respiratory and emerging Infection Consortium) & IDDO url: https://isaric.org/research/covid-19-clinical-research-resources/
AI 就绪度

数据集封面

ISARIC-CCP — 全球新冠住院临床登记 AI-Ready Wikipedia


INFOBOX

数据集名称 ISARIC-COVID-19 Dataset(ISARIC-CCP / CCP-UK)
英文全称 International Severe Acute Respiratory and emerging Infection Consortium COVID-19 Clinical Characterisation Consortium
别名/简称 ISARIC 4C、ISARIC-WHO CCP、CCP-UK、ISARIC Clinical Characterisation Consortium
疾病分类 COVID-19(ICD-11:RA01.0 2019 冠状病毒病);前瞻性临床表征跨多器官系统
SNOMED CT 840539006 COVID-19 / 840544004 SARS-CoV-2 / 233604007 Pneumonia(详见 §2.2)
数据模态 结构化 CRF 临床登记(症状、合并症、生命体征、检验、治疗、结局、随访)
AI 任务类型 院内死亡预测、预后风险分层(4C Mortality)、疾病失代偿预测、表型聚类、症状亚型分析、国际风险因素对比、长新冠随访建模
样本总数 数据描述论文:705,000+ 例住院病例 / 62 国 / 1,559 家机构(2020-2021);研究版本 V1.0.0:657,312 例 / 45 国 / 1,297 机构
数据大小 CSV 表集合 + PostgreSQL 脚本(受控共享,无公开静态包体积)
数据格式 CSV(表集合)/ PostgreSQL 导入脚本
许可证 受控访问——IDDO Data Use Agreement / COVID-19 Data Transfer Agreement;描述论文 CC BY 4.0
访问级别 申请审核(ISARIC Partner 经 Statistical Analysis Plan 协作,或外部经 IDDO 数据访问委员会审核)
DUO 标签 HMB, IRB, PUB
语言 英文(CRF 多语言)
首发日期 2020-01(ISARIC 启动 COVID-19 数据采集)
最后更新 2022-07-30(Scientific Data 数据描述论文发表);登记持续增长,版本 1.0.0(2022-03 快照)
发布机构 ISARIC(牛津大学牵头)与 WHO,数据托管于 IDDO(牛津大学)
官方主页 https://isaric.org/research/covid-19-clinical-research-resources/
下载地址 https://www.iddo.org/covid19/data-sharing/accessing-data
DOI 10.1038/s41597-022-01534-9(描述论文)/ 10.48688/nx85-bv30(研究版本 V1.0.0)
引用次数 描述论文 400+(Google Scholar,截至 2024-06,估算);4C Mortality 论文 700+(Europe PMC)
AI 就绪度评分 ⭐⭐⭐(3/5)— 结构化 CRF 数据、字段字典完整、有受控访问管道;扣分项:申请审核周期长、多国多版本拼合需自行清洗映射、结局与随访缺失需自行处理、无官方 train/test 划分
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(CRF 字段、结局与随访编码)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 ISARIC、WHO、IDDO 或牛津大学无任何商业利益关联。本页面不销售该数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。ISARIC-CCP 采用受控访问:非贡献者需向 IDDO 提交数据访问申请,经独立数据访问委员会审核并签署数据使用协议后方可下载;数据控制者始终保留数据所有权与治理决定权。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

ISARIC-CCP 是世界最大的标准化新冠住院临床前瞻登记之一,由国际严重急性呼吸与新发感染联盟(ISARIC,牛津大学牵头)与 WHO 共同推进。数据描述论文载明超 705,000 例住院病例、62 国、1,559 家机构(2020-2021),覆盖症状、合并症、生命体征、检验、治疗、并发症与结局,全部按统一的 ISARIC-WHO 病例报告表(CRF)采集。

它的独特价值在于「广度 + 标准化」:此前全球从未有一个住院队列能在如此短的时间内、以同一套 CRF 汇集数十国的真实世界住院数据。这套数据支撑了直接改写临床指南的成果——比如由 ISARIC-4C 开发的 4C 死亡率评分(8 个入院即可获取的变量,0-21 分),以及帮助判断糖皮质激素获益人群的表型分析。

你可以用它来:训练/外部验证新冠住院死亡预测模型、做跨大洲的风险因素对比、对症状进行无监督聚类分型、或研究不同疫情波次下治疗与结局的变化。注意数据需经受控申请,且多国拼合 + 结局随访不完整是你必须自己处理的清洗工作。

§1.1 摘要

ISARIC-CCP 脱胎于 ISARIC 自 2012 年起全球实施的「临床表征方案(CCP)」,一套专为快速应对新发呼吸道疫情设计的通用预审批研究框架,此前已用于 H5N1、MERS、埃博拉、寨卡、蜱传脑炎与猴痘等疫情。2020 年 1 月 SARS-CoV-2 疫情初起,ISARIC 即刻激活 CCP:参与的医院以统一 CRF 前瞻性录入入院患者的临床信息,数据经牛津托管的 REDCap 直录,或以本地系统采集后上传至 IDDO 平台做映射标准化与质量控制。

至 2021 年 9 月,该登记已汇集超 705,000 例来自 62 国、1,559 家机构的住院病例,构成全球最大的标准化新冠住院队列之一。英国分支 CCP-UK(即 ISARIC-4C)规模亦超 270,000 例。数据的标准化程度与跨国多样性使其成为一类特别的机器学习资源:你获得的不是单一医院系统产生的连续时序,而是「入院即快照」的 CRF 结构化记录——这正是其建模便利之处,也是其信息粒度(尤其缺少高频床旁时序)的边界。

数据形态上,它介于「传统流行病学队列」与「临床 AI 数据集」之间:一方面具备前瞻性、统一结局编码、可做生存分析等经典队列特征;另一方面字段量大(症状、合并症、检验、治疗、并发症、结局、接种、随访),足以支撑表格式机器学习与深度模型的特征工程。对想从事「多中心真实世界预后建模」的人而言,它是比单中心 EHR 更能反映「跨系统泛化挑战」的练级场——但前提是接受受控获取流程与结局随访不完整的现实。

数据访问现实:这是一个由 ISARIC 与 IDDO 治理的受控资源,非开放直下。非贡献者需经数据访问委员会审核并签署协议,通常预留 2 个月以上。你在构思研究时应把「获取周期」纳入排期,并优先考虑是否已有 CCP-UK 等可通过 Cohort Discovery 低成本探查的路径。

§1.2 战略价值分析

范式维度——「应急研究」模板:ISARIC-CCP 证明了在疫情高峰期,一套预先获批的通用协议能在数周内把数十个国家拉入同一套数据采集。这种「平时建库、疫时激活」的范式,与事后被动爬取的电子病历数据集本质不同——前者保证字段定义、结局编码与时间点在疫情冲击下仍保持一致,是它日后能支撑可复现建模的结构性前提。

临床转化维度:本数据直接催生了写入临床指南的预测与分型工具。最具代表性的是 4C 死亡率评分(BMJ 2020),仅用 8 个入院时即可获得的变量(年龄、性别、合并症数、呼吸频率、血氧、意识、尿素、C 反应蛋白),AUC 0.79,优于 15 个既有评分,并据此将患者分为低/中/高/极高四档。这套「数据—模型—管理分层」的闭环在医疗 AI 语境下极具教学与复现价值。

国际合作维度:跨 62 国的数据使得「同一套变量、不同卫生系统与资源水平」的比较成为可能,这是单中心 ICU 库无法提供的分析维度。识别不同国家/地区间风险因素效应与结局差异,正是本数据集不可替代的研究用途。

§1.3 横向对比

数据集 患者/记录数 地域 模态 采集方式 核心差异化
ISARIC-CCP 705,000+ 例住院 62 国(欧洲+非洲为主) CRF 结构化登记 前瞻统一 CRF + 受控申请 全球广度 + 协议标准化;覆盖门诊随访与多波次
N3C 1,500 万+(含门诊) 美国多中心 EHR 全量 联邦化 EHR 提取 美国规模最大 EHR,含高频数据,覆盖人群广
CCP-UK(ISARIC-4C) 270,000+ 英国三国 CRF + 生物样本 前瞻 含样本库与 GenOMICC 遗传关联
MIMIC-IV 364,627 美国单中心 EHR + 文本 回顾脱敏开放 高频时序 + 自由文本,完全开放
eICU-CRD 200,859 美国 208 院 EHR ICU 回顾受控 多中心 ICU 重症数据
WHO COVID Clinical Platform 数十万 全球多国 CRF 登记 前瞻 另一条 WHO 官方采集链,可交叉校验
COVID-19 症状 app(社区) 数百万自报 英国/美社区 自报症状 前瞻 app 覆盖轻症/社区,与 ISARIC 住院谱互补

ISARIC-CCP 的不可替代性在「跨国标准化广度」与「疫情全周期」:它是极少数能让你把同一套变量铺开到数十个国家、并横跨多波次治疗变迁的真实世界住院队列;代价是受控获取、结局随访不完整、且无高频时序细节。

谁不适合用它:若你要做 ICU 内分钟级失代偿预警(高频时序 → MIMIC-IV/eICU);若你要全人群感染率与社区传播建模(ISARIC-CCP 只含住院谱,且无人群分母 → 用疾病监测/症状 app 数据);若你希望无需申请、即时下载练手(受控访问周期长 → 先用公开汇总或 N3C/MIMIC 做原型)。

§1.4 版本演进时间轴

时间 事件
2012 ISARIC CCP 框架首次全球发布,用于 H5N1/MERS 等新发呼吸道疫情
2013-04-25 WHO 伦理评审委员会批准 ISARIC-WHO CCP(RPC571/RPC572)
2014 英国以 ISARIC-4C(Comprehensive Clinical Characterisation Collaboration)名义实施 CCP
2020-01 疫情初起,ISARIC 激活 COVID-19 CCP,全球启动数据采集
2020-05 CCP-UK 首批 20,133 例临床特征论文发表于 BMJ(369:m1985)
2020-09 4C 死亡率评分开发与验证发表于 BMJ(370:m3339)
2021-09 全球登记超 705,000 例 / 62 国 / 1,559 机构(描述论文快照时点)
2022-03 IDDO 研究版本 V1.0.0 快照:657,312 例 / 45 国 / 1,297 机构
2022-07-30 Scientific Data 数据描述论文发表(9:454)

§1.5 典型应用场景

  1. 预后模型开发/外部验证:以 4C 八变量为基础训练入院死亡预测,或用独立国家子集验证既有模型(如 4C Deterioration)在本地人群的表现。
  2. 风险因素跨国对比:分层比较肥胖、合并症、年龄-性别交互在不同卫生系统下对院内死亡的关联方向与强度。
  3. 症状表型无监督聚类:复现 ISARIC-4C 的 4 症状亚型(胃肠型/咳痰型/意识模糊型/少症状型),挖掘其与 30 天死亡及后续长新冠的关联。
  4. 多波次疗效比较:利用时间戳拆分波次,评估糖皮质激素、抗病毒药与疫苗接种状态普及对院内死亡率的漂移影响。
  5. 长新冠(Post-COVID)随访建模:结合出院后随访模块,分析感染急性期特征对恢复轨迹的预测力。

上述每个场景的落地难点不在模型而在数据工程(见 §6 与 §4.5):统一结局口径、处理信息性缺失、按站点分组划分、对抗跨波次时代效应。把这四项做扎实,比调优模型更决定你在该数据集上的成败。


§2 医学背景

§2.1 ICD-11 编码映射

临床概念 ICD-11 编码 ICD-11 名称
COVID-19(确认或疑似) RA01.0 2019 冠状病毒病
急性呼吸窘迫综合征(并发症) CB04 急性呼吸窘迫综合征
病毒性肺炎(影像学表现) CA40.1Z 病毒性肺炎,未特指
急性肾损伤(并发症) GB60 急性肾损伤
心肌炎/心肌损伤(并发症) BC43 心肌炎
脓毒症(危重症并发症) 1G40 脓毒症
长新冠(随访结局) RA02 2019 冠状病毒病后状态
意识模糊/谵妄(入院神经体征) MB21 意识障碍

§2.1b SNOMED CT 映射

标签(CRF 术语) ICD-11 SNOMED CT 代码 术语
COVID-19 确诊 RA01.0 840539006 COVID-19
SARS-CoV-2 感染 RA01.0 840544004 SARS-CoV-2
病毒性肺炎 CA40.1Z 233604007 Pneumonia
急性肾损伤 GB60 14669001 Acute kidney injury
心衰/慢性心脏病 CB4Z 84114007 Heart failure
糖尿病 5A10 73211009 Diabetes mellitus
慢性肺病(非哮喘) CA2Z 413839001 Chronic obstructive pulmonary disease
呼吸频率(体征) 86290005 Respiratory rate
外周血氧饱和度(体征) 431314004 Peripheral oxygen saturation
尿素(检验) 65309001 Urea/blood urea nitrogen

§2.2 疾病简介与流行病学

COVID-19 由严重急性呼吸综合征冠状病毒 2(SARS-CoV-2)引起,2020 年 3 月 11 日被 WHO 宣布为大流行。临床谱从无症状、轻症上呼吸道感染到重症肺炎、急性呼吸窘迫综合征与多器官衰竭。ISARIC-CCP 聚焦的是其中病情最重、最需要住院资源的人群——这是理解其数据分布与建模边界的前提:它不回答「人群中多少比例会感染」,而是回答「住院者呈现怎样的临床特征与结局」。(来源:WHO 大流行声明;数据集设计详见 Scientific Data 2022)

§2.2b 合并症与并发症分布(描述论文快照)

可分析子集(n=602,792)中报告频率最高的合并症与并发症如下(Scientific Data 2022):

类别 最常见项目 占比 备注
合并症 高血压 30.7% 全库报告率
合并症 糖尿病 29.6% 含 1/2 型
合并症 慢性心脏病 10.5% 各国判定差异
入院症状 咳嗽 23.7% 全库报告率
入院症状 气促 19.8% 即呼吸困难
入院症状 发热 17.5% 报告率低于直觉(病例定义演变)
并发症 病毒性肺炎 16.2% 住院过程
并发症 ARDS 6.6% 急性呼吸窘迫
并发症 急性肾损伤 5.5% AKI
并发症 细菌性肺炎 3.8% 继发感染

早期英国 CCP-UK(BMJ m1985,20,133 例)报告相似但年龄结构更老(中位 73):慢性心脏疾病 31%、非哮喘慢性肺病 18%、慢性肾病 16%,提示「合并症负担随年龄与卫生系统显著变化」。做合并症建模时务必区分全球库与英国子集的人口学差异,别把「一个快照的分布」当全局恒定。

§2.3 临床任务定义

任务类型 定义 关键变量 结局标签
院内死亡预测 入院时点预测本次住院死亡 年龄、性别、合并症数、呼吸频率、SpO₂、GCS、尿素、CRP outcome=died(28 天截尾惯例)
疾病失代偿预测 预测需要机械通气/转 ICU/死亡 上述 + 淋巴细胞、影像浸润、院内感染 deterioration 复合结局
症状分型(聚类) 按入院症状无监督分型 症状清单 + 年龄/性别 亚型内 30 天死亡
风险因素对比 估算各因素与死亡的关联 合并症、BMI、年龄、性别 院内死亡(分层/多变量)
长新冠随访建模 预测恢复/后遗症 急性期特征 + 随访问卷 PCC/恢复率

§2.4 患者人群

维度 描述
来源 62 国参与医院(1,559 家),数据描述论文;英国 CCP-UK 亚集 260+ 医院
时间 2020-01 起持续(核心覆盖 2020-2023 多波次)
年龄 全年龄;描述快照中位年龄 58(Q1-Q3 44-72),需按亚组(儿童/成人/高龄)分层
性别 描述快照男性 48.93%(294,928/602,792 可分析子集)
种族/民族 CRF 采集部分站点记录;非系统性,跨国际比较需谨慎
就医类型 急性住院(含 ICU/HDU);少部分含出院后门诊随访模块

上表人口学来自 Scientific Data 2022 Table 2(可分析子集 n=602,792),注意该子集小于宣称的 705,000。

亚队列 纳入口径 规模 用途提示
全库(国际) 各站点确认/疑似 SARS-CoV-2 住院 >705,000(2021-09 快照) 跨国广度分析;注意站点异质
成人子集 年龄 ≥18,英国为主 4C 系分析即此 复现 4C 死亡率/失代偿
儿科/青年 儿童专用 CRF + MIS-C 模块 库内儿科记录 病种与成人不同,独立处理
非洲/南美子集 中低收入资源站点 描述快照非洲 369,467 检验可及性差异大,缺失建模
英国 CCP-UK 英国三国住院 >270,000 含样本库;Cohort Discovery 可查
随访子集 出院后门诊随访站点 子集内 长新冠;非全站点,勿外推

§2.5 临床价值

ISARIC-CCP 的临床价值主要体现在三方面:其一,为资源分配提供入院即可算的风险工具(4C 评分把极高危组死亡风险标到 62%,低危组仅 1%),直接支撑「低危居家、高危早转 ICU 加抗病毒」的管理决策;其二,横跨多国的数据揭示了此前单中心队列难以捕捉的异质性,例如肥胖、合并症组合在不同卫生系统中的关联差异;其三,作为全球最大标准化住院登记之一,它是验证疫苗、抗病毒药与糖皮质激素真实世界效果的对照性数据源。

§2.6 金标准(Ground Truth)

任务 标注方式 标注者 性质
院内死亡 住院结局字段(discharged alive / died / palliative) 站点研究护士/医生从病历判定 权威结局,但有 28 天随访截尾惯例与个别丢失
入住 ICU/HDU 是否入 HDU/ICU 字段 站点录入 依赖站点诊疗路径(各国 ICU 门槛不一)
并发症 CRF 并发症勾选(ARDS/AKI/肺炎等) 站点医生 基于临床表现判定,跨站点定义统一由 CRF 约束
症状 入院症状勾选清单 站点(患者主诉 + 病历) 主观性较强,缺勤多,需按 missing 处理
合并症 慢性病勾选清单 站点从病历判定 临床诊断,部分靠既往史

§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本/途径 规模 理由
复现 4C 死亡率模型 申请全量国际库,筛英国成人 全球 >705,000 / 英国亚集庞大 原模型用英国 adult(年龄≥18)derivation/validation 队列
跨国风险因素对比 申请含国别字段的全量库 657,312+(V1.0.0) 需保留 country 字段,避免只看聚合
儿童/特殊人群 申请含儿童 CRF 的记录 全库含儿科 儿科 MIS-C 与青年随访需专用模块
快速原型验证 描述论文附带汇总表 + 公开图表 汇总统计 受控获取前先用公开 Table/Figure 定假设
队列发现/无代码探索 HDR-UK Cohort Discovery(英国 CCP-UK) 270,230+(含样本) 联邦化发现工具,无需逐字段建模

§3.1 模态详情

ISARIC-CCP 是结构化 CRF 临床登记,不是连续 EHR 时序。核心模态为入院快照 + 有限纵向随访:

  • 入院基线:人口学、症状、合并症、生命体征、入院检验(尿素、CRP、淋巴细胞等)、意识状态(GCS/改版)。
  • 住院过程:第 3/6/9 天进展记录,治疗(抗病毒、糖皮质激素、抗凝、器官支持)、并发症、是否入 ICU/HDU、机械通气。
  • 出院结局:出院存活/死亡/转临终关怀/持续住院,28 天截尾惯例。
  • 门诊随访(部分站点):长新冠症状与恢复状态。

§3.2 按子集样本数

子集 记录/规模 时点 说明
国际库(描述论文) 705,000+ 2021-09 62 国、1,559 机构
可分析子集(论文表 2) 602,792 2021-09 快照 有国别+多数变量的完整记录
研究版本 V1.0.0 657,312 2022-03 45 国、1,297 机构(IDDO 平台)
CCP-UK(英国) 270,230+(另 2,510 仅数据) 动态 含生物样本,federated-analytics 快照
4C Mortality derivation 35,463 2020-02-06~05-20 英国成人,死亡 32.2%
4C Mortality validation 22,361 2020-05-21~06-29 英国成人,死亡 30.1%

§3.3 格式表

环节 格式
原始采集 多语言 CRF(REDCap 电子版 / 本地系统)
平台交付 CSV 表集合 + PostgreSQL 导入脚本(受控下载)
汇总结计/图表 HTML 报告、Dashboard、公开 Figures(描述论文附表)
处理/分析代码 论文提供的代码仓库(IDDO/ISARIC)

§3.4 存储大小

受控平台不公开静态包体积。建议申请到数据后预留数十 GB 空间用于 CSV + PostgreSQL 导入与多国拼接分析(依所选字段与随访模块而定)。无公开静态大小,故此处从略。

§3.5 标注方式

绝大多数字段为人工结构化录入(研究护士、临床医生与医学生在床旁或事后从 EHR 提取),配合站点对照记录与后续 query 修正;结局字段(死亡/出院)为权威结局。自动化处理主要体现在 IDDO 平台的映射标准化与质检(见 §3.10),而非自动内容标注。

§3.6 标注者资质与一致性

CRF 由站点接受过培训的研究人员填写,高峰期为医学生与护士支援;描述论文与 技术验证 强调字段级数据质量检查、数据管理员对缺失/越界值的 query,以及 IDDO 对异构来源的 pre-mapping/review 校验。一致性跨站点依赖 CRF 的统一定义约束,无法像影像标注那样做阅片者间 Kappa 测量。

§3.7 采集周期

2020-01 疫情初期启动,2020-2023 覆盖主要波次。采集随时间推移衰减/站点响应变化;UK CCP-UK 侧持续至 2022-2023。数据为动态增长登记,各研究版本为快照。

§3.8 地域覆盖

62 国(描述论文),其中欧洲与非洲贡献最大:可分析子集非洲 369,467(约 61%)、欧洲 206,992(约 34%)、亚洲 16,019、北美 6,687、南美/中美洲 2,709、大洋洲 448。(来源:Scientific Data 2022 Table 2) 地域分布极不均匀,建模时必须把 continent/country 作为关键协变量或固定效应处理。

§3.9 设备规格

本数据为 CRF 登记,无影像/波形设备数据。检验(CRP、尿素等)来自各医院实验室,参考区间与单位需按站点标准化——这是工程清洗的要点之一。

§3.10 深度溯源链

CRF 字段定义 → 站点采集(REDCap 直录或本地工具)→ 上传 IDDO → pre-mapping 字段映射 → data review/edit checks → 缺失与越界值 query 站点确认 → 汇总入库(PostgreSQL)→ 版本化导出(CSV)→ 数据访问委员会/Partner 授权后交付。(来源:Scientific Data 2022)

§3.11 受控访问与数据治理细节

ISARIC-CCP 的访问本质是「数据控制者保留所有权、平台负责治理与共享」,理解这点对申请合规至关重要:

治理要素 说明
数据控制者 各贡献站点/网络;保留数据所有权与共享决定权
平台 IDDO(牛津大学治理框架下)承担数据标准化、托管、授权
独立评审 IDDO Data Access Committee,由 WHO TDR 主持,含伦理与数据治理专家
申请文件 数据访问申请表 + 数据访问指南 + Data Use Agreement + 转移协议
作者治理 作者名单按分析所含 USUBJID 由 ISARIC 系统生成,贡献站点以组作者出现
发表义务 论文须开放获取,回报 ISARIC,遵循 Publication Policy

§3.12 单位与编码标准化注意

  • 实验室单位不一致:CRP(mg/L 或 mg/dL)、尿素(mmol/L vs mg/dL BUN)随站点/国家而异;务必按 data_dictionary 统一后再进模型,否则 4C 的数值分档会失真。
  • 年龄编码异构:部分版本为整数年龄、部分为年龄带(如 50-59),跨表合并前先统一为带(age band)以匹配 4C 的 <50/50-59/…/≥80 分档。
  • 合并症/症状勾选值:yes/no/unknown 三态需统一(unknown 有时编码为空白);把 unknown 当作 no 会让「未报告」被误读为「无」。
  • 日期偏移:受隐私约束的日期可能做偏移/脱敏,进行「以天为单位的住院时长/28 天截尾」前需核对时间戳语义是否保留精确日差。

§3.13 获取排期实操

阶段 周期 关键动作
申请前 1-2 周 读数据清单,圈定字段范围,评估是否确需全量
提交申请 填申请表 + 伦理/方法说明,发 covid19@iddo.org
DAC 评审 ~2 周(紧急 3 个工作日) 委员会评估科学合理性与伦理
签约 1-4 周 DUA 需申请机构 + 牛津大学签署;大学法务审查可能延后
下载 数日 安全链接获取 CSV + 文档 + 脚本
总计预留 ≥2 个月 复杂申请更久

§4 数据结构

§4.0 目录树

ISARIC-COVID19_release_<version>/
├── README.md                      # 版本说明、引用、访问条款摘要
├── documentation/
│   ├── data_dictionary.xlsx       # 核心字段字典(英文)
│   ├── implementation_manual.pdf  # IDDO 实施手册
│   └── missing_codes_guide.md     # 信息性缺失编码约定
├── data/
│   ├── participants.csv           # 每个住院参与者一条(USUBJID 主键)
│   ├── admission.csv              # 入院 CRF(症状/合并症/体征/检验/治疗/结局)
│   ├── followup.csv               # 门诊随访(长新冠模块,部分站点)
│   ├── outcomes.csv               # 住院结局与日期(28 天截尾)
│   └── ...(其余 CRF 分块表)
├── scripts/
│   ├── import_to_postgres.sh      # 导入 PostgreSQL
│   └── codebook_render.py         # 生成代码簿/字典
└── analyses/                      # 受控分析,非公开静态

说明:受控获取后实际目录以交付的 README 为准;上图为基于描述论文「CSV 表集合 + PostgreSQL 脚本」的示意结构,表名以现场交付为准。

§4.1 DAIMS 字段字典

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
USUBJID Text 假名化参与者唯一标识 ISARIC-ABC123 主键、生成作者名单 必填,无缺失 假名化字符串
AGE Text/Num 入院年龄(带或分组) 60-69 / 64 关键协变量 依赖自报/记录 8,143 缺失 0-104+/年龄带
SEX Text 生理性别 male/female 关键协变量 149 缺失 male/female/unknown
COUNTRY Text 采集国 United Kingdom 分层/固定效应 470 缺失 62 国清单
HOSP_ADMISSION_DATE Date 入院日期(偏移后) 2020-04-15 时间/波次分层 日期
COMORBIDITY_* 0/1 勾选 慢性心脏/糖尿病/肾病等 1 合并症数特征 靠既往史判定 部分站点整块缺失 yes/no/unknown
SYMPTOM_* 0/1 勾选 入院症状(咳嗽/气促/发热等) 1 症状特征/聚类 主观性 缺勤多 yes/no/unknown
RESP_RATE Num 呼吸频率(入院) 24 4C 组分 测量误差 有缺失 数值
O2_SAT Num 血氧饱和度(入院) 88 4C 组分 测量误差 有缺失 0-100
GCS Num 意识评分 15 4C 组分 记录误差 有缺失 3-15
UREA Num 尿素(mmol/L) 8.5 4C 组分 实验室单位 有缺失 数值(单位标准化)
CRP Num C 反应蛋白(mg/L) 96 4C 组分 实验室单位 有缺失 数值
ICU_ADMIT 0/1 是否入 HDU/ICU 1 资源/严重度 各国阈值差异 有缺失 yes/no
OUTCOME Text 住院结局 died 死亡标签 随访截尾 10,130 缺失 discharged/died/palliative/in-hospital
VENTILATION Text 通气类型 invasive 失代偿标签 各国实践差异 有缺失 none/noninv/inv
VACCINE_STATUS 0/1 住院时是否接种 1 波次/保护效应 疫苗接种史 部分缺失 yes/no/unknown

§4.2 标签分布

可分析子集(n=602,792,论文表 2):

  • 院内死亡:141,646(23.5%);入住 ICU/HDU:126,069(20.9%)。
  • 结局缺失:10,130 例——标签不完整是建模首要清洗点。
  • 性别:male 294,928(48.93%);年龄缺失 8,143;国别缺失 470。
  • 合并症 Top3:高血压 30.7%、糖尿病 29.6%、慢性心脏病 10.5%。(来源:Scientific Data 2022)

§4.3 关键统计

指标 说明
全球中位年龄 58(Q1-Q3 44-72) 各洲差异大:欧洲 70 vs 非洲 54
男性比例 48.93% 各洲 44.76%-72.06%(亚洲最高)
院内死亡 23.5% 各洲 13.17%-26.91%
ICU/HDU 入住 20.9% 各洲 17.13%-95.31%(大洋洲样本极小)

§4.4 数据层级

参与者(USUBJID)→ 一次住院(Admission,一人一次主记录,个别重复入院需去重)→ 院内随访时间点(第 3/6/9 天 CRF 模块)→ 出院结局 / 门诊随访。与影像「患者→序列→切片」不同,本数据以「入院事件」为分析单元,时间分辨率以天计。

§4.4b 结局编码与时间口径

CRF 结局字段 语义 建模建议
discharged_alive 出院存活 二元负类基线
died 院内死亡 正类(死亡日期用于生存)
discharged_to_palliative 转临终关怀 敏感:常并入「死亡/不良结局」口径
in_hospital 截至报告日仍在院 属删失而非存活;应按 28 天截尾重判
discharged_to_other_facility 转其他机构 转归可能继续在院,需跟踪
unknown / 缺失 无明确结局 训练剔除或单独一档,报告比例

⚠️ 同一站点「结局未知」的含义(仍在院 vs 未随访)在交付数据中可能不显式区分——读 data_dictionary 的注释并联系站点确认,是结局建模前的必要步骤。

§4.4c 时序/快照时间戳表

时间戳字段 说明 缺失/漂移风险
HOSP_ADMISSION_DATE 入院日期 用于波次分层;快照版本间可能重编码
SYMPTOM_ONSET_DATE 症状起病日 供计算症状-入院时延(中位 4 天,早期论文)
ADMISSION_CRF_DATE / FU3 / FU6 / FU9 第 3/6/9 天随访模块 非全部站点完成,逐点覆盖率递减
DISCHARGE_DATE / DEATH_DATE 出院/死亡日期 用于生存分析与 28 天截尾
LONG_COVID_FU_DATE 长新冠随访日 仅随访子集有,失访相关

§4.5 缺失值 + 信息性缺失编码

缺失类别 典型字段 机制 应对策略
结局缺失 OUTCOME 站点报告/随访不足 28 天截尾 + survival;剔除并报告比例
信息性缺失 CRP/UREA 等检验 MNAR:重者更常检测 missingness indicator + MICE(site 条件)
整块缺失 合并症/症状组 站点未录入整模块 字段级覆盖率审计;跨站前剔除低覆盖字段
随访缺失 长新冠随访 仅随访子集 + 失访 仅在随访子集分析,勿外推
亚组稀疏 单国/极小站点 自愿参与失衡 合并为 continent 级 / 极小样本降权

关键经验:不要一开始就 fillna。先跑「字段覆盖率热图」(site × 字段),看清楚哪些字段在哪些国家整块不存在,再决定是缺失建模还是干脆剔除字段。ISARIC-CCP 的缺失模式主要来自站点行为而非随机的患者漏填,忽略这一点会把「站点系统性缺失」误当「个体随机缺失」。

§4.6 字段/表关系图

participants (USUBJID) 1 ──── 1 admission      # 一次住院主记录(快照)
       │                        ├── fup_day3 / day6 / day9   # 院内进展模块
       │                        ├── outcomes (discharge/death 日期)
       │                        └── icu / ventilation (子表或字段)
       └── 1 ── 0..n  long_covid_followup      # 出院后随访(部分站点)

联表分析时以 admission 为主表、参与者为去重索引;同一 USUBJID 若跨站点重复,需先按站点 + 入院日期判定主记录。


§5 划分与使用建议

官方划分

ISARIC-CCP 不提供官方 train/test 划分。数据描述论文提供的是全量描述性统计;4C 死亡率论文是按「时间顺序」自行切分(2020-02-06~05-20 derivation,05-21~06-29 validation),这是「时间外验证」的典范,但并非数据集官方划分。

社区惯例划分

社区普遍采用:

  1. 时间外划分:以疫情波次为界切分训练/验证/测试,避免同一诊疗环境泄漏(4C 论文范式)。
  2. 国别外验证:以一国训练、别国验证,评估跨卫生系统泛化(描述论文鼓励的用途)。
  3. 站点/机构级分组:hospital/site 作为分组单元做分层或 group-stratified CV,避免同一站点重复入院泄漏。

划分策略建议

强烈建议以 site 或 country 作为分组层(GroupKFold),把同一站点/国家的记录整体放进同一折,防止跨站点患者重复与系统偏差混入验证。时间敏感任务建议只做「前训后测」的时间外划分,且必须在 4C 论文明确的时间窗(2020 波次一/二)内复现其可比性。

泄漏风险

  • 重复/转诊记录:同一患者可能被多站点重复登记或转院转诊,USUBJID 去重是前提。
  • 结局定义漂移in-hospital(截至报告日仍在院)与「出院存活/死亡」混用,若不统一 28 天截尾会造成死亡标签计算偏倚。
  • 波次/治疗泄漏:糖皮质激素(Dexamethasone)2020-06 起写入指南,跨波次样本的死亡率不可当作同一分布——训练/测试若跨越治疗转折点,模型会学到「时代效应」而非患者特征效应。

交叉验证建议

建议最小可复现设定:GroupKFold(k=5) 按 site 分组 + 在折内按 outcome 做分层,评价用 AUROC + 校准曲线 + Brier score;对外报告务必注明排除的结局缺失样本比例。

外部验证建议

ISARIC-CCP 适合作为跨国外部验证队列。建议把「国别/洲际外验证」写成独立的实验章节——例如英国训练、转测非洲或南美子集,评估 4C 评分的跨资源水平迁移(原论文即提示需在各国本地验证后再临床使用)。

划分代码示例(GroupKFold by site)

from sklearn.model_selection import GroupKFold
import numpy as np

def group_cv_indices(df, n_splits=5):
    """按 site 分组做 K 折;同一站点的所有记录进入同一折,防跨站泄漏。"""
    gkf = GroupKFold(n_splits=n_splits)
    # df 需含 'group'(site_id 或 country)与 'label28'(非缺失子集)
    X = df.index.to_numpy()
    y = df["label28"].to_numpy()
    groups = df["group"].to_numpy()
    folds = []
    for tr_idx, va_idx in gkf.split(X, y, groups):
        folds.append((tr_idx, va_idx))
    return folds

# folds = group_cv_indices(df_train, n_splits=5)
# 对每折:只在 tr 折内 fit imputer/scaler,再预测 va,汇总报告 AUROC 与校准

为何不用随机 KFold:随机切分会把同一 hospital 的相似病例拆到训练与验证两侧,系统偏差(同一站点的录入习惯)会混入验证,导致乐观偏差——这正是 ISARIC-CCP 这类「站点异质」数据集最忌讳的切分方式。

敏感性分析清单

决策点 备选口径 敏感性检验
结局截尾 28 天 vs 全期 vs alive-at-censor 三种口径各跑一次,看 AUC 是否稳定
结局缺失 剔除 vs 单独一档 vs 视为存活 报告比例,剔除 vs 保守视为存活的差异
检验缺失 indicator+MICE vs 只含无缺失 4C 核心 检验增益是否仅来自缺失机制
地域 全库 vs 欧洲 vs 英国 结论是否依赖地域构成

§6 AI 就绪指南 ⭐

§6.0 云端快速启动

数据受控,不开放直下公开包。若你在英国学术界,可先用 HDR-UK Cohort Discovery 对 CCP-UK 做字段级的无代码队列发现与统计,再据此决定是否正式申请全量 CRF。想快速跑通 4C 模型逻辑,可先用描述论文公开的汇总统计在本地伪造一个 toy 数据集验证 pipeline,再把真实字段替换进来。

§6.1 快速上手

获取数据前先明确三件事:你要的字段范围(admission core?是否含检验/随访?)、结局口径(28 天院内死亡 vs 全期)、分析单元(住院事件 vs 参与者)。受控下载后典型目录(见 §4.0):

# data_root = /local/ISARIC-COVID19_release_1.0.0
# admission.csv   -> 主分析表,每个 USUBJID 一行核心 CRF
# participants.csv -> 参与者索引
# scripts/import_to_postgres.sh -> 先导库再用 SQL 清洗最省事

最小可用子集建议:仅 admission 表的非缺失结局、有国别、成人(剔除儿科)记录即可复现 4C 类二元分类;后续再增量引入检验字段。

§6.2 数据获取

非贡献者外部路径(官方流程):

  1. 阅读 IDDO 数据访问指南 与数据清单。
  2. 下载并填写 数据访问申请表,列出所需变量。
  3. 提交至 covid19@iddo.org;独立数据访问委员会审查(约 2 周;紧急公共健康事件 3 个工作日)。
  4. 批准后签署数据使用协议(DUA,由申请人机构与牛津大学/IDDO 签署)。
  5. 经安全链接下载 CSV + 支持文档。

ISARIC Partner(贡献数据方)路径:提交 Statistical Analysis Plan(SAP)至 data@isaric.org,经评审并邀请各站点评注后按 SAP 获取数据执行分析,须开放获取发表并回报作者名单。

⚠️ 预留 ≥2 个月完成申请—审核—签约—下载;大学法务对 DUA 的审查可能额外拉长周期。

项目 内容
官方主页 https://isaric.org/research/covid-19-clinical-research-resources/
外部申请 https://www.iddo.org/covid19/data-sharing/accessing-data
数据清单 见 ISARIC/IDDO data inventory 页
审查机构 IDDO Data Access Committee(WHO TDR 主持)
费用 非营利研究者免费

§6.3 预处理全流程

以下代码演示受控获取后、把 CSV 清洗为建模张量的关键步骤:统一列名 → 结局口径 → 站点分组 → 缺失策略

import pandas as pd
import numpy as np

data_root = "/local/ISARIC-COVID19_release_1.0.0"
adm = pd.read_csv(f"{data_root}/data/admission.csv", low_memory=False)

# 1) 保留成人住院,剔除儿科与无关行(按 AGE 字段约定)
#    4C 原始分析针对年龄>=18;儿科需单独 CRF 语义
if "AGE_CAT" in adm.columns:
    adult_mask = ~adm["AGE_CAT"].isin(["<18", "paediatric", "0-17"])
else:
    adult_mask = adm["age"] >= 18 if pd.api.types.is_numeric_dtype(adm["age"]) else np.ones(len(adm), bool)
df = adm[adult_mask].copy()

# 2) 结局口径:统一为 28 天院内死亡二元标签(died=1, 其余随访到>=28或出院=0)
#    无法判定者单独标记为 unknown,训练时剔除或另作一档
def make_label(row):
    if row.get("outcome") == "died":
        return 1
    # 仍在院超过28天视作未死亡是 4C 论文的保守约定,但需自行复核
    return 0 if row.get("outcome") in ("discharged_alive", "in_hospital") else np.nan
df["label28"] = df.apply(make_label, axis=1)
df["label_unknown"] = df["label28"].isna()
print("已知结局样本:", (~df["label_unknown"]).sum(), "未知:", df["label_unknown"].sum())

# 3) 站点分组键(防跨折泄漏)
df["group"] = df["site_id"]  # 若无 site 用 country

# 4) 选择 4C 八变量,缺失留空给 imputer
feats = ["age", "sex", "comorb_count", "resp_rate", "o2_sat", "gcs", "urea", "crp"]
X = df[feats].copy()
print(X.isna().mean().round(3))

⚠️ 上述为示意伪列名,真实字段名以交付的 data_dictionary 为准;务必先读字典映射到标准名(如 AGE/COMORBID_*)。

结局与标签清洗要点:4C 论文把「在院超 28 天仍无明确结局」视为 alive,但这是保守选择,你的分析应显式声明并做敏感性检验。

§6.4 PyTorch DataLoader

import torch
from torch.utils.data import Dataset, DataLoader
from sklearn.preprocessing import StandardScaler
import pandas as pd, numpy as np

class IsaricOutcomeDS(Dataset):
    """入院 CRF 的院内死亡分类。特征已由外部预处理为 float 张量。"""
    def __init__(self, X, y, groups, cont_cols, cat_cols):
        self.Xc = torch.as_tensor(X[cont_cols].to_numpy(dtype=np.float32))
        self.y = torch.as_tensor(y.to_numpy(dtype=np.int64))
        self.cat = torch.as_tensor(X[cat_cols].to_numpy(dtype=np.int64))
    def __len__(self):
        return len(self.y)
    def __getitem__(self, i):
        return self.Xc[i], self.cat[i], self.y[i]

def build_loader(X, y, groups, batch_size=256):
    cont_cols = ["resp_rate","o2_sat","gcs","urea","crp"]
    cat_cols  = ["age_ord","sex_code","comorb_ord"]  # 已编码为 int 类别
    # 数值标准化(必须在训练折内 fit,防泄漏)
    sc = StandardScaler().fit(X[cont_cols])
    Xs = X.copy()
    Xs[cont_cols] = sc.transform(X[cont_cols])
    ds = IsaricOutcomeDS(Xs, y, groups, cont_cols, cat_cols)
    return DataLoader(ds, batch_size=batch_size, shuffle=True), sc

# 示例:df 为已清洗主表,label28 无缺失的样本
X = df[~df["label_unknown"]].reset_index(drop=True)
y = X["label28"]; g = X["group"]
loader, scaler = build_loader(X, y, g)
for Xb, cb, yb in loader:
    print("batch shapes:", Xb.shape, cb.shape, yb.shape)
    break

真实模型请用 group-stratified CV 包一层(如 GroupKFold),且数值 imputer 与 scaler 只 fit 在训练折内,避免信息泄漏。

§6.5 坑点 8 个

⚠️ 坑点 1:宣称规模与可分析规模不一致(分类:数据泄漏/样本误解)

问题:描述论文宣称「>705,000 例 / 62 国」,但论文自己的汇总表(Table 2)与 IDDO 研究版本 V1.0.0 分别给出 602,792 与 657,312 例 / 45 国。拿到手的数据集规模取决于版本快照与字段覆盖率,「论文总例数」常被误当可直接分析量。
症状:直接按 70 万 + 写样本量,却在入 ICU/结局分析时突然少几万,或跨版本数字对不上、国别列表也不同。
解决

  1. 简单方法:报告时区分「登记规模」与「分析子集」,论文引用写明版本快照时点(V1.0.0、2022-03)。
  2. 进阶方法:先做字段级覆盖率审计——确认结局、年龄、国别三字段同时非缺失的真实样本量,以此作为论文样本量。
  3. SOTA 方法:多版本(描述论文快照 vs V1.0.0 vs 新版本)各跑一遍核心分析做鲁棒性检验,用覆盖率的敏感性区间报告。
    参考Scientific Data 2022 Table 2HDR Gateway 版本页

⚠️ 坑点 2:结局缺失与随访不完整造成的标签偏倚(分类:标签理解)

问题:快照中约 10,130 例结局缺失,且死亡依赖站点报告;把「截至报告日仍在院」直接当存活、或把 unknown 当死亡,都会让死亡标签系统性偏移。
症状:模型死亡风险被系统性高估或低估;校准(calibration)恶化;不同站点聚集导致偏差来源难定位。
解决

  1. 简单方法:训练时剔除 unknown,报告剔除比例;将「在院」明确按 28 天截尾视为存活。
  2. 进阶方法:把结局缺失建模为「当前在院 censored」做 survival 处理(Cox/随机生存森林),而非二分类。
  3. SOTA 方法:对 28 天截尾与死亡报告做敏感性分析 + 逆删失加权(IPCW),并对不同站点做 leave-site-out 检验。
    参考Scientific Data 2022 数据质量说明

⚠️ 坑点 3:自愿/资源依赖参与导致的选择偏倚(分类:偏倚陷阱)

问题:这是「便利性/医院登记」而非人群代表性样本;高峰时资源不足导致未全量纳入,部分站点事后从 EHR 回溯补录。纳入与否与站点能力、床位压力相关。
症状:把登记比例误当发病率/重症率;不同站点样本量悬殊,聚合统计被大贡献国主导。
解决

  1. 简单方法:只做「住院者内」的相对风险/预测建模,绝不做人群发病率推断。
  2. 进阶方法:把 site/country 作为协变量或固定效应纳入,报告每个国家权重;用描述论文的按洲统计校准认识。
  3. SOTA 方法:用多水平模型(国家-医院两层)显式建模聚集结构,做包含不平衡诊断。
    参考ISARIC/IDDO 数据采集说明

⚠️ 坑点 4:国别/站点间「诊疗与结局定义」差异(分类:评估误用)

问题:各国 ICU 入院门槛、通气指征、检验可及性、临终关怀编码(palliative vs died)不同。直接比较「院内死亡/ICU 率」会读到卫生系统差异而非疾病差异。
症状:非洲 17% vs 大洋洲 95% 的 ICU 入住率这类悬殊数字被当疾病差异解读;跨洲 AUC 崩盘。
解决

  1. 简单方法:任何跨国/跨洲对比前先做年龄-性别-合并症标准化,绝不直接比粗率。
  2. 进阶方法:把国别效应显式建模;对 ICU 结局用「是否上机械通气」这类较硬的中间结局。
  3. SOTA 方法:逐国 re-calibrate(如 4C Deterioration 在各 NHS 区域验证的做法),区分判别力(可迁移)与校准(需重标定)。
    参考Thorax 2022 前瞻验证

⚠️ 坑点 5:检验/测量的「信息性缺失」(分类:预处理陷阱)

问题:CRP、尿素等只在「觉得该查」的患者中记录——越重越常检测,缺失并非随机(MNAR)。把缺失粗暴填中位数会引入「测了就病重」的伪特征。
症状:纳入检验字段后模型明显更好,但这是「检测倾向」代理而非生理信号;别家数据上失效。
解决

  1. 简单方法:为每个检验加 missingness indicator(是否检测),显式暴露该信息。
  2. 进阶方法:用多重插补(MICE)+ 站点为条件变量,而非全局中位数。
  3. SOTA 方法:把「检测与否」当观测机制建模,或报告有无检测两情景下的稳健性;警惕特征重要性被 missingness 项占据。
    参考Scientific Data 2022 技术验证/数据缺失讨论

⚠️ 坑点 6:跨波次/治疗变迁的「时代效应」被当患者效应(分类:数据泄漏)

问题:Dexamethasone 自 2020-06 起成为标准治疗,疫苗/抗病毒药陆续普及。若把 2020-2023 样本混在一个 train/test,模型会把「时间」当成风险因子,学到过时诊疗环境。
症状:跨时间验证性能骤降;同特征在新波次方向反转;把「治疗进步」误归到人口特征变化。
解决

  1. 简单方法:把 admission month/wave 作为协变量,或按波次报告分层结果。
  2. 进阶方法:只用时间外划分(前训后测),与 4C 论文的 derivation/validation 时间窗对齐。
  3. SOTA 方法:做时间-固定效应与时变治疗协变量建模,明确报告模型随治疗演进的稳定性。
    参考ISARIC-4C 波次变化演示

⚠️ 坑点 7:age/sex 亚组效应显著异质,需分层而非仅校正(分类:偏倚陷阱)

问题:ISARIC-CCP 揭示年龄-性别的风险模式高度非单调(肥胖/合并症在 <50 与 ≥80 关联方向不同;性别随年龄交互)。仅把 age/sex 当线性校正项会掩盖真实信号。
症状:总体平均效应掩盖关键亚组;把一个波次的年龄分布外推到另一波次会误判死亡趋势。
解决

  1. 简单方法:至少按年龄带(<50/50-59/60-69/70-79/≥80)× 性别做分层表。
  2. 进阶方法:在模型里放 age-交互项与限制性立方样条,检查非线性。
  3. SOTA 方法:分亚组报告 AUC/校准而非单一汇总;针对儿科/青年做独立子队列分析(病种与成人不同)。
    参考ISARIC CCP-UK 肥胖/慢病年龄交互分析

⚠️ 坑点 8:登记时点与入院快照的信息边界(分类:工程陷阱)

问题:CRF 多为「入院快照 + 第 3/6/9 天」,而非高频时序。把入院基线特征误当作「任意决策时点可在线获得」用于现实床边实时预测,会高估部署可用性;ICU 内的精细决策需要本数据不含的高频监测。
症状:demo 里 AUC 漂亮,床边应用时缺字段;误以为能预测「数小时内」的失代偿(粒度只有天)。
解决

  1. 简单方法:模型只接受「入院即得」特征(明确 feature list 时间点),不偷看后续。
  2. 进阶方法:把任务定义为「入院时风险分层」而非实时预警,在文档与论文标题中讲清楚时间边界。
  3. SOTA 方法:需要精细 ICU 时序时改用 MIMIC-IV/eICU 等高频库;把 ISARIC-CCP 用于多中心/跨国预测价值论证与外部验证。
    参考ISARIC-CCP 采集时点说明

§6.6 数据增强

  • 安全✅:对缺失检验字段做 multiple imputation(MICE)并加 missingness indicator;对连续特征做 log 变换后标准化;为跨站点鲁棒性做 bootstrap 站点重采样。
  • 危险❌:SMOTE 对少数类(如极高危结局)合成样本会改变事件-时间分布,误导生存任务;对结局缺失样本做简单多数类填充;以 CRF 症状做文本增强——症状是勾选非自由文本,无文本可增。

§6.7 模型推荐表

任务 推荐起点 备选 理由
院内死亡预测 逻辑回归 + 4C 八变量 GBM / 稀疏 ML 基线可解释、易校准;与 4C 论文对齐
失代偿/ICU 预测 GBM(XGB/LGB) Cox / RSF 非线性 + 交互捕捉 age 异质
症状分型 K-prototypes / GMM 层次聚类 复现 ISARIC 4 亚型
跨国对比 多水平(国家-医院)GLMM 固定效应 logistic 显式聚集结构
长新冠随访 Logistic/顺序回归 survival 失访需 censoring 处理

§6.8 硬件需求

规模 内存 磁盘 建议
单国子集(如 UK) 16-32 GB 10-30 GB 常规笔记本/单机即可跑 GBM
全库 CRF 宽表 64+ GB 数十 GB + PostgreSQL 建议导入 PostgreSQL 后用 SQL 清洗再抽样
多洲 + 多波次 + 生存 128 GB 更多 建议云端列式(DuckDB/PostgreSQL)分批

§6.9 评估指标代码

from sklearn.metrics import roc_auc_score, brier_score_loss
import numpy as np

def evaluate_mortality(y_true, p_hat, groups):
    auc = roc_auc_score(y_true, p_hat)
    brier = brier_score_loss(y_true, p_hat)
    # 分站点校准:低/中/高/极高 4 档事件率 vs 观测
    thresholds = [3, 8, 11, 15]   # 4C score 分档(示意)
    return {"auc": round(auc,3), "brier": round(brier,3),
            "n": len(y_true), "groups": groups.nunique()}

# y_true=label28, p_hat=模型概率, groups=site_id
# print(evaluate_mortality(y_test, p_test, g_test))

§6.10 MLOps 笔记

数据受控且版本化快照,MLOps 重点是可复现性注册:记录 release version、data dictionary 版本、筛选 SQL、imputation seed;因 DUA 禁止重分发,全流程须走可审计 pipeline(记录在分析日志而非共享原始文件)。模型如拟临床化,需按 TRIPOD 报告并做外部验证(ISARIC-4C 的 Thorax 前瞻验证即示范)。受控数据下避免把含患者粒度数据的中间结果推送到公开 Git。

§6.11 复现 4C 死亡率评分的端到端示范

拿到受控数据后,复现 4C 分数是验证你 pipeline 正确性的最佳「冒烟测试」。4C Mortality Score 将 8 变量映射为 0-21 分的点值(BMJ m3339 附表给出完整赋分)。逻辑如下(示意,精确系数以论文为准):

变量 分档(示意) 加分
年龄 <50 / 50-59 / 60-69 / 70-79 / ≥80 0 / 2 / 4 / 6 / 7
性别 female / male 0 / 1
合并症数 0 / 1 / 2 / ≥3 0 / 1 / 2 / 3
呼吸频率 <20 / 20-29 / ≥30 0 / 1 / 2
SpO₂ >92 / 92 or less 0 / 2
GCS 15 / <15 0 / 2
尿素 <7 / 7-14 / >14 (mmol/L) 0 / 1 / 3
CRP <50 / 50-99 / ≥100 (mg/L) 0 / 1 / 2
def four_c_score(age, sex, n_comorb, rr, spo2, gcs, urea, crp):
    """将 CRF 入院变量折算为 4C 分数(0-21)。真实分档细节以论文附表为准。"""
    s  = 0 if age < 50 else 2 if age < 60 else 4 if age < 70 else 6 if age < 80 else 7
    s += 1 if sex == "male" else 0
    s += min(n_comorb, 3)                      # 0/1/2/3+
    s += 0 if rr < 20 else 1 if rr < 30 else 2
    s += 0 if spo2 > 92 else 2
    s += 0 if gcs == 15 else 2
    s += 0 if urea < 7 else 1 if urea <= 14 else 3
    s += 0 if crp < 50 else 1 if crp < 100 else 2
    return s

# df_score = df.dropna(subset=["age","sex","comorb_count","resp_rate","o2_sat","gcs","urea","crp"])
# df_score["c4"] = df_score.apply(lambda r: four_c_score(...), axis=1)
# 用 0.79(AUC) 数量级校验你的复现:与论文 derivation 一致说明 pipeline 正确

复现完成后即可按坑点 2 的截尾口径评估你的子集是否复现出与论文接近的 AUC 与分档死亡率(低 ≤3 约 1%、高 ≥15 约 62%),这一步能帮你发现字段映射错误——这是任何后续 AI 建模之前的第一道质检。


§7 质量评估与局限性

§7.1 已知偏倚表

偏倚类型 描述 严重程度 缓解
选择/参与偏倚 便利性医院登记,非人群代表 高(对发生率推断致命) 只做住院者内相对分析;site/country 建模
地域失衡 欧洲+非洲主导(可分析子集占 ~95%) 分层报告;明确排除不适用结论
结局随访不完整 死亡依赖站点;~1.7% 结局缺失 中-高 28 天截尾 + survival + 敏感性分析
诊疗路径差异 各国 ICU/通气/临终编码不同 高(跨洲粗比较) 标准化 + 硬中间结局 + 逐国重校准
检验信息性缺失 MNAR missingness indicator + MICE
波次/治疗时代效应 治疗/疫苗随时间变 中-高 时间外划分 + 波次分层
登记时点快照 只入院快照,无高频时序 明确定位为入院风险分层

§7.2 标注质量

CRF 录入由受过培训的研究人员完成,配合 REDCap 字段级质检、数据管理员 query 与 IDDO 站点确认,字段一致性在统一 CRF 定义下受约束。但无像影像标注那样的阅片者间一致性度量;主观字段(症状、合并症)与站点实践差异会引入噪声,需在字典阅读后自行评估。

你的应对:不要把 CRF 字段当成高一致性的金标准——把结局(death/discharge 这类硬指标)当标签用相对可靠,而症状、合并症这类受主观与站点实践影响的字段更适合当特征并在分析中做缺失/敏感处理。多站点来源意味着「同一字段在不同站的录入质量不均」,必要时做字段级站点覆盖率统计后再决定权重。

§7.3 泛化性表

场景 失效风险 证据
英国成人→英国后续波次 低(时间外仍稳定) 4C 前瞻验证 AUC 0.78,无需时域重标定
英国→其他高资源国 判别力可迁移,校准需重标定(原论文提示)
高资源→中低资源(非洲/南美) 中-高 ICU 率 17-95% 悬殊,检验可及性差异
成人→儿童/青年 病种与成人不同(MIS-C 等),需独立子队列
入院模型→实时 ICU 决策 无高频时序,时间粒度为天

§7.4 伦理

数据经 WHO 伦理评审委员会批准(RPC571/RPC572),各国按当地法规获批;高峰资源受限时多站点以脱敏 + 知情豁免方式采集。受控访问、假名化 USUBJID、作者名单由 subject ID 生成、DUA 约束再分发与销毁义务,是其伦理治理骨架。研究者使用时应遵守 DUO 标签(HMB/IRB/PUB)所体现的「仅生物医学研究、需伦理批准、成果须公开发表」边界。

§7.5 公平性

跨 62 国的数据天然暴露公平性议题:欧洲/非洲贡献不均意味着训练数据对多数低收入国家的覆盖被稀释;应在论文中按洲/国家报告亚组 AUC 与校准,避免「全球模型」实为「欧非主导模型」的错觉。年龄/性别分层报告的异质性(§6.5 坑点 7)也是公平性的一部分。做公平性审计时,把 site 的「资源水平」(可及检验项数量、ICU 率)作为代理协变量一并考察,往往比只看国别更能解释性能落差。

§7.6 数据漂移

主要漂移源为治疗与病毒株演变(波次、疫苗、抗病毒药、Dexamethasone)与站点纳入随时间变化。做历史训练→未来预测时必须承认分布漂移,建议在文档与模型卡中记录训练时间窗并提示周期性重训练。

漂移应对不是「一次训练一劳永逸」,而是把它当运维问题:设定监控指标(新波次入院时的死亡率基率、ICU 入住率、缺失率),用漂移检测在部署前后告警,触发按新数据重校准或重训练。

§7.7 DAIMS 24 项评估

# 检查项 状态 说明
1 宽格式 CRF 字段以宽表形式交付
2 唯一标识 USUBJID 唯一,跨表关联
3 特殊字符 ⚠️ 多语言 CRF 转码需核对编码
4 重复行 ⚠️ 跨站点重复/转诊需去重
5 缺失编码 ⚠️ 有 unknown 约定,但缺统一 machine 缺失码
6 标签标识 outcome/结局列清晰,28 天截尾需自行实现
7 罕见类分组 ⚠️ 极小国/亚型样本需自行合并
8 偏倚评估 描述论文含分洲统计,本站 §7.1 详述
9 数据字典 官方 data_dictionary + 实施手册
10 信息性缺失解释 描述论文承认并讨论,需自行建模
11 设备记录 ⚠️ 无统一设备;实验室单位需站点标准化
12 共线性 ⚠️ 症状/合并症重叠,需用户自查
13 编码映射 CRF 统一编码 + IDDO 映射标准化
14 时间戳处理 ⚠️ 日期偏移/波次需用户界定
15 划分建议 无官方 train/test 划分
16 泄漏讨论 本站 §5.3 与坑点 6 详述
17 标签分布 描述论文含结局/重症统计
18 测量偏倚 ⚠️ 检验 MNAR,需 missingness 建模
19 外部验证建议 鼓励跨国验证;本站 §7.3
20 版本记录 描述论文 + V1.0.0 DOI 明确
21 预处理脚本 ⚠️ 论文提供部分代码,无端到端脚本
22 合规要求 受控 DUA + 伦理批准明确
23 多模态对齐 ⚠️ 随访模块非全站点,对齐需自行处理
24 去标识化 假名化 + 脱敏 + 受控访问

DAIMS 评分:15 / 24

评分解读:这是一份「医学与流行病学设计顶级、数据工程打磨中等」的数据集。强项集中在偏倚讨论(8、10、16)、合规治理(22、24)与版本记录(20)——作为学术型受控登记,其方法论透明度很高;弱项主要在工程就绪度:无官方划分(15)、清洗脚本不完整(21)、编码/时间戳需自行标准化(5、14)、随访与检验的工程处理量大(10、23)。

对你意味着什么:请把拿到手的前两周花在「字典核对 + 字段覆盖率审计 + 结局口径统一」上,而不是直接建模。官方划分缺失意味着你必须自己设计 site 分组 + 时间外验证,且论文里必须写明——这既是负担也是可复现性的加分项。多模态(随访)只覆盖部分站点,若不打算做长新冠就果断只用 admission 核心,能省大量清洗。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
CCP-UK 第二波(27.08.2020-17.02.2021) ISARIC-4C / Thorax 4C Mortality 外部前瞻验证 AUC 0.78 与原始 validation (0.77) 持平 无需时域重标定;4C Deterioration AUC 0.76
非洲/南美子集(跨国) ISARIC-CCP 各站点 院内死亡预测泛化 判别可迁移,校准需重标定 校准下降 原论文明确提示本地重校准
他国独立队列(如 Ayub 医院巴基斯坦) 本地研究 4C Mortality 复测 报告可复现 视人群 提示需本地验证后再临床使用

§8 基准性能与生态

§8.1 排行榜

ISARIC-CCP 没有公开社区排行榜(受控访问限制了开放刷榜),主要「基准」来自官方与派生论文的预后模型表现。

模型 性能(AUC) 年份 关键技术 完整引用 代码
4C Mortality Score 0.79 (dev) / 0.77 (val) 2020 8 变量 logistic,0-21 分 Knight SR et al., BMJ 2020;370:m3339. DOI 10.1136/bmj.m3339 https://isaric4c.net/risk/
4C Mortality(前瞻验证) 0.78 2022 第二波前瞻队列 Knight SR et al., Thorax 2022;77:606-615. DOI 10.1136/thoraxjnl-2021-217629 见原文
4C Deterioration(前瞻验证) 0.76 2022 复合失代偿结局 同上 见原文
症状分型聚类 聚类一致性高 2022 无监督聚类 59,011 例 Millar JE et al., Sci Rep 2022. DOI 10.1038/s41598-022-13872-y 见原文

⚠️ 不同论文 AUC 不可直接比:样本人群、结局口径(院内 vs 28 天)、时间窗与剔除标准不同。跨模型比较前须统一 28 天截尾与成人样本口径。

§8.2 SOTA 总结与选型建议

对「入院死亡预测」这一核心任务,4C 八变量 logistic 至今仍是不可绕过的强基线,其优势在可解释性与校准(验证集 calibration-in-the-large=0、slope=1.0);更复杂的 ML(GBM)能在判别力上小幅提升,但需更强的缺失与交互工程。选型建议:先跑 4C 复现作底线,再用 GBM + missingness 特征尝试增益;若差异不足 0.02 AUC,优先选择可解释的 4C 型模型以利临床采纳。

§8.3 评测协议

ISARIC-4C 系列的评测协议示范:时间外划分(derivation 2020-02~05 / validation 05-21~06-29)、至少 4 周随访、成人(≥18)样本、结局 28 天截尾、评估 AUC + 校准(calibration-in-the-large、slope)+ Brier score、按年龄性别/族裔报告亚组。任何在本数据上发表的预测研究都应尽量对齐这套协议以保证可比性。

数据集 定位 与 ISARIC-CCP 互补
N3C 美国多中心 EHR 美国人群覆盖、高频数据,补英国/欧洲外的广度
MIMIC-IV 单中心开放 ICU 高频时序 + 文本,补 ICU 微观决策
eICU-CRD 美国多中心 ICU 多中心 ICU 重症时序
CCP-UK / GenOMICC ISARIC 英国分支 生物样本 + 遗传关联,是 ISARIC-CCP 的「深」互补
WHO Clinical Platform WHO 其他登记 另一条平行采集链,可交叉校验

§8.5 关键论文 Top

  1. Garcia-Gallo E, Merson L, Kennon K, et al.; ISARIC Clinical Characterization Group. ISARIC-COVID-19 dataset: A Prospective, Standardized, Global Dataset of Patients Hospitalized with COVID-19. Scientific Data 2022;9:454. DOI 10.1038/s41597-022-01534-9 — 数据描述论文,定义架构、标准化流程与获取方式(首选引用)。
  2. Docherty AB, Harrison EM, Green CA, et al.; ISARIC4C investigators. Features of 20 133 UK patients in hospital with covid-19 using the ISARIC WHO Clinical Characterisation Protocol: prospective observational cohort study. BMJ 2020;369:m1985. DOI 10.1136/bmj.m1985 — 首批英国住院临床特征刻画,确立年龄/性别/合并症基线分布。
  3. Knight SR, Ho A, Pius R, et al.; ISARIC4C investigators. Risk stratification of patients admitted to hospital with covid-19 using the ISARIC WHO Clinical Characterisation Protocol: development and validation of the 4C Mortality Score. BMJ 2020;370:m3339. DOI 10.1136/bmj.m3339 — 4C 死亡率评分:35,463 derivation / 22,361 validation,AUC 0.79/0.77,8 变量 0-21 分。
  4. Knight SR, Gupta RK, Ho A, et al.; ISARIC4C investigators. Prospective validation of the 4C prognostic models for adults hospitalised with COVID-19 using the ISARIC WHO Clinical Characterisation Protocol. Thorax 2022;77:606-615. DOI 10.1136/thoraxjnl-2021-217629 — 二次波前瞻外部验证 76,588 例,4C Mortality AUC 0.78 稳定,无需时域重标定。
  5. Millar JE, Neyton L, Seth S, et al.; ISARIC-4C. Distinct clinical symptom patterns in patients hospitalised with COVID-19 in an analysis of 59,011 patients in the ISARIC-4C study. Scientific Reports 2022. DOI 10.1038/s41598-022-13872-y — 无监督症状分型:识别胃肠/咳痰/意识模糊/少症状四亚型,与 30 天死亡及人口特征关联。
  6. (辅助) Obesity, chronic disease, age, and in-hospital mortality in patients with covid-19: analysis of ISARIC CCP-UK cohort. Obesity 2021. DOI 10.1002/oby.23180 — 示范年龄-性别分层的风险因素分析,呈现肥胖与慢病组合的异质关联。

引用口径提示:本数据集为「组作者(group authorship)」研究,正式引用请使用论文列出的 ISARIC Clinical Characterization Group / ISARIC4C investigators 作为作者之一,并按期刊要求提供完整作者列表。

§8.5b 衍生工具与临床落地

4C 死亡率与失代偿评分已打包为公开交互工具,是理解本数据「可用终点」的捷径:

  • 4C Mortality Score 在线计算器https://isaric4c.net/risk/):输入 8 变量即时给出 0-21 分与风险档(低/中/高/极高),论文与工具结合可快速核对你的复现。
  • 该评分被后续多国独立研究用于入院分诊(例如巴基斯坦 Ayub 医院、NHS 各区域),构成持续的外部证据积累——做「模型应用」类工作时是现成的对照基线。

§8.6 社区活跃度

ISARIC-CCP 生态为「学术协作型」而非「开放代码型」:活跃度体现在持续产出的 ISARIC Clinical Characterization Group 论文(数百篇协作发表)、ISARIC/IDDO 定期发布的 Clinical Data Reports、以及公开 Dashboard。受控访问限制了外部自发刷榜,但贡献者网络高度活跃。

§8.7 生态快照表

资源 类型 链接 推荐理由
ISARIC COVID-19 资源页 官方文档 https://isaric.org/research/covid-19-clinical-research-resources/ 协议/CRF/获取总入口
IDDO COVID-19 数据 申请平台 https://www.iddo.org/covid19 外部数据访问主入口
ISARIC-4C 官网 英国分支 https://isaric4c.net CCP-UK 协议、样本、结果工具
4C 风险工具 交互工具 https://isaric4c.net/risk/ 4C 评分在线计算/复现
COVID 临床 Dashboard 可视化 https://livedataoxford.shinyapps.io/CovidClinicalDataDashboard/ 无代码看分布/趋势
HDR-UK Cohort Discovery 队列发现 https://federated-analytics.ac.uk/isaric-4c 英国 CCP-UK 联邦化字段级发现

§9 相关资源与引用

BibTeX 核心引用

% 数据描述论文(首选引用)
@article{garcagallo2022isaric,
  title = {{ISARIC-COVID-19 dataset: A Prospective, Standardized, Global
             Dataset of Patients Hospitalized with COVID-19}},
  author = {Garcia-Gallo, Esteban and Merson, Laura and Kennon, Kalynn and
            Kelly, Sadie and Citarella, Barbara Wanjiru and Fryer, Daniel
            Vidali and Shrapnel, Sally and Lee, James and others and
            {ISARIC Clinical Characterization Group}},
  journal = {Scientific Data},
  volume = {9},
  pages = {454},
  year = {2022},
  doi = {10.1038/s41597-022-01534-9}
}

% 4C 死亡率评分
@article{knight2020score,
  title = {Risk stratification of patients admitted to hospital with
           covid-19 using the {ISARIC WHO Clinical Characterisation
           Protocol}: development and validation of the {4C Mortality Score}},
  author = {Knight, Stephen R and Ho, Antonia and Pius, Riinu and Buchan,
            Iain and Carson, Gail and Drake, Thomas M and Dunning, Jake and
            others and {ISARIC4C investigators}},
  journal = {BMJ},
  volume = {370},
  pages = {m3339},
  year = {2020},
  doi = {10.1136/bmj.m3339}
}

% 首批英国特征刻画
@article{docherty2020features,
  title = {Features of 20 133 UK patients in hospital with covid-19 using
           the {ISARIC WHO Clinical Characterisation Protocol}: prospective
           observational cohort study},
  author = {Docherty, Annemarie B and Harrison, Ewen M and Green, Christopher A
            and others and {ISARIC4C investigators}},
  journal = {BMJ},
  volume = {369},
  pages = {m1985},
  year = {2020},
  doi = {10.1136/bmj.m1985}
}

% 4C 前瞻外部验证
@article{knight2022prospective,
  title = {Prospective validation of the 4C prognostic models for adults
           hospitalised with {COVID-19} using the {ISARIC WHO Clinical
           Characterisation Protocol}},
  author = {Knight, Stephen R and Gupta, Rishi K and Ho, Antonia and Pius,
            Riinu and others and {ISARIC Coronavirus Clinical
            Characterisation Consortium (ISARIC4C) Investigators}},
  journal = {Thorax},
  volume = {77},
  number = {6},
  pages = {606--615},
  year = {2022},
  doi = {10.1136/thoraxjnl-2021-217629}
}

% 症状分型聚类
@article{millar2022distinct,
  title = {Distinct clinical symptom patterns in patients hospitalised with
           {COVID-19} in an analysis of 59,011 patients in the {ISARIC-4C}
           study},
  author = {Millar, Jonathan E and Neyton, Lucile and Seth, Sohan and Dunning,
            Jake and others and {ISARIC-4C}},
  journal = {Scientific Reports},
  volume = {12},
  pages = {9203},
  year = {2022},
  doi = {10.1038/s41598-022-13872-y}
}

官方资源链接

资源 链接
ISARIC 官方 https://isaric.org
COVID-19 临床研究资源 https://isaric.org/research/covid-19-clinical-research-resources/
IDDO 数据申请 https://www.iddo.org/covid19/data-sharing/accessing-data
ISARIC-4C(UK) https://isaric4c.net
数据描述论文(Nature) https://www.nature.com/articles/s41597-022-01534-9
研究数据 DOI https://doi.org/10.48688/nx85-bv30

引用指南

引用本数据集首选数据描述论文 garcagallo2022isaric;若使用 IDDO 研究版本 V1.0.0,同时引用其数据 DOI(10.48688/nx85-bv30)并按 DUA 要求致谢 ISARIC/IDDO 与贡献站点。引用次数表述须带「截至 YYYY-MM」。


§10 AI 使用声明卡

10.1 AI 模型列表

本页由 CodeBuddy(大型语言模型)辅助生成与审校,未使用图像生成模型生成正文配图。

10.2 AI 参与范围

AI 承担:检索并交叉核实数据集事实、组织章节结构、撰写表格与代码示例、生成 DAIMS 评估与坑点草稿。所有数字经人工核对来源后保留;代码示例经逻辑审查,未在真实受控数据上运行(受访问限制)。

10.3 输入来源列表

  1. WRITER_CONSTITUTION.md — 写作规范(内部)
  2. WRITER_BRIEF.md — 任务简报(内部)
  3. ISARIC 官网 CCP 说明 — https://isaric.org/?p=38104
  4. CCP for Covid 资源页 — https://isaric.org/?p=33741/
  5. Scientific Data 数据描述论文 — https://www.nature.com/articles/s41597-022-01534-9
  6. 论文 Table 2(分洲统计) — https://link.springer.com/article/10.1038/s41597-022-01534-9/tables/2
  7. 论文全文 PDF(技术验证) — https://www.nature.com/articles/s41597-022-01534-9.pdf
  8. BMJ 首批英国特征论文 — https://pubmed.gov/32444460/
  9. BMJ 4C Mortality Score 论文 — https://preview.ncbi.nlm.nih.gov/pmc/articles/PMC7116472/
  10. Thorax 前瞻验证论文 — https://pubmed.ncbi.nlm.nih.gov/34810237
  11. Sci Rep 症状分型论文 — https://www.paperity.org/p/289830455
  12. IDDO 数据访问 FAQ — http://iddo.org/fr/node/5707
  13. ISARIC 数据访问与协作页 — https://isaric.org/resources/data/data-access-and-collaboration/
  14. HDR Gateway 数据集版本页 — https://healthdatagateway.org/en/dataset/781
  15. IDDO/ISARIC 数据采集说明 — https://www.researchgate.net/publication/362350378
  16. ISARIC-4C 波次演示 — https://usher.ed.ac.uk/sites/default/files/atoms/files/ewen_harrison_slides_usher_isaric_2_pdf.pdf
  17. 肥胖/年龄交互分析 — https://pmc.ncbi.nlm.nih.gov/articles/PMC8324452/
  18. ISARIC 4C 队列发现 — https://federated-analytics.ac.uk/isaric-4c

10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景(ICD-11/SNOMED 映射、人群统计、金标准) 千方病案医学编辑部 交叉审核 ✅ 已通过
§3 数据集规格(规模、版本、分洲统计) 千方病案医学编辑部 与 Scientific Data 论文交叉比对 ✅ 已验证
§4 数据结构(DAIMS 字段字典、缺失编码) 千方病案医学编辑部 与描述论文与字典比对 ✅ 已验证
§5 数据划分策略 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与坑点 千方病案医学编辑部 逻辑审查 ✅ 已通过
§7 质量评估与 DAIMS 评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 关键论文与外部验证 千方病案医学编辑部 与原文及 DOI 交叉比对 ✅ 已验证
§1/§3 规模数字与版本 千方病案医学编辑部 与论文、HDR Gateway 比对 ✅ 已验证

10.5 AI 生成章节标注

§1-§10 正文内容均由 AI 依据人工核实的事实清单(FACTS.md)起草,经人工交叉审核后定稿;无未经验证即发布的数字。

10.6 最后人工审核日期

2026-09-05

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集