信息速览
Chest Computed Tomography for Patients with Sepsis in the Emergency Department(chest-ct-sepsis-er)
INFOBOX:chest-ct-sepsis-er 速览
| 项目 | 内容 |
|---|---|
| 官方名称 | Chest Computed Tomography for patients with sepsis in the Emergency Department |
| 托管平台 | PhysioNet(slug: chest-ct-sepsis-er) |
| 版本 / 发布 | v1.0.0,2024-10-28 |
| DOI | 10.13026/zne5-qh18 |
| RRID | SCR_007345 |
| 数据描述论文 | Jin S, Cai W, Shen Q, Yang L, Sheng’an H, Fu J, Zhang Z. Scientific Data 11:1261 (2024-11-20),DOI 10.1038/s41597-024-04132-z,PMID 39567547,PMCID PMC11579395 |
| 版本页署名 | Senjun Jin、Zhongheng Zhang(论文署名 7 人) |
| 数据来源 | 浙江省人民医院(杭州医学院附属人民医院)急诊医学部 / EICU |
| 队列口径 | 728 次就诊(含门诊)/ 337 例住院 / 327 例住院有 CT |
| 影像规模 | 836 次胸部 CT,NIfTI(nii.gz),SimpleITK v2.2.0 由 DICOM 转换 |
| 表格规模 | 14 张 CSV,合计约 3,962,948 行;最大表 NursingChart_VitalSign 2,251,285 行 |
| 疾病定义 | Sepsis-3.0:疑似/确诊感染 + SOFA 急性升高 ≥2 分 |
| 访问方式 | PhysioNet Credentialed Access + DUA;同步存于 NGDC OMIX005655(controlled access) |
| 伦理 | 浙江省人民医院伦理委员会 2023-397,回顾性设计知情同意豁免 |
| 去标识 | HIPAA 标准:随机代理 ID、年龄分箱、日期相对化、文本地名/人名删除 |
| DAIMS 评分 | 5.1 / 8(详见 §3.3) |
§0 摘要卡:为什么值得为 836 张胸部 CT 写一篇百科
一句话定位:chest-ct-sepsis-er 是浙江省人民医院团队在 PhysioNet 发布的脓毒症胸部 CT 与临床表格配对数据集——它把同一团队在 2023 年建立的纯表格中国危重症数据库(本系列第 498 号条目 zhejiang-ehr-critical-care)向前推进一步,为 337 例 Sepsis-3 脓毒症住院患者配上了 836 次胸部 CT 体数据(NIfTI 格式)与 14 张合计约 396 万行的 CSV 临床表格,是中文医疗 AI 生态中少有的"影像 + 表格 + 自由文本"三模态、单一疾病、小而深的公开资源。
三个立即能回答的问题。第一,脓毒症的肺部结构改变能不能用计算机视觉量化?这套数据给了 836 次高分辨率胸部 CT,覆盖 2012(或 2019,见存照 B)至 2022 年的急诊 ICU 脓毒症住院,让影像组学(radiomics)研究第一次有了公开的中国脓毒症影像底座。第二,影像特征与临床轨迹怎么对齐?CT 文件通过 CT2hospitalID 表逐次挂接到 Hospital_ID,临床侧从生命体征(VitalSign 505,151 行、NursingChart_VitalSign 2,251,285 行)到实验室检验(Lab 789,010 行)、用药(Medication 109,246 行)、微生物培养与药敏(MicrobiologyCulture 20,661 + DrugSens 55,029 行)一应俱全。第三,中文影像报告能不能做 NLP?ExamReport 表收了 6,037 行检查报告文本(CT、超声、MRI),PtAdmiTable 的 Med_history 字段保留大段中文现病史——作者刻意不做机器翻译以保 NLP 保真,只对元数据和短文本做了人工复核的英译。
它在 Top1000 序列里的位置。本条目属于医学影像大类,但和多数纯影像条目(如 499 的心脏植入装置胸片分割集)不同,它的重心是"影像与临床的配对深度":单疾病、单中心、11 年(或 4 年,见存照 B)时间窗、每例附带完整的住院过程表格。它也是本系列第 498 条目(Jin et al. 2023,Sci Data 10:49)的直接续作——论文原话是"临床数据结构与先前报告的非常相似"。读 498 再读本篇,可以完整看到一个中国三甲医院把院内 EHR 管线产品化为国际公开数据集的两级台阶:先表格、后影像。
三个必读存照。其一,标题漂移:PhysioNet 版本页用 Emergency Department(急诊科),论文标题用 emergency intensive care unit(急诊 ICU),HospitalTransfer 表的注释说明 EICU 就在急诊科内——三个名称指向同一物理空间,但检索时会互相错过。其二,时间窗双口径:论文 Methods 写 2019 年 1 月至 2022 年 12 月(EICU 脓毒症纳入期),而论文 Data Records 段与 PhysioNet 页面均写 2012 年 1 月至 2022 年 12 月——论文自身就并存两个口径,使用者在引用时间覆盖时必须自选并说明。其三,版本页的"额外引用"指向了 Kehl et al. 2024(Nat Commun,用共享 AI 提取癌症结局)——与脓毒症 CT 毫无关系的误引,真正的数据描述论文是 Jin et al. 2024(Sci Data 11:1261)。这三条都已写入 §10 存照。
DAIMS 5.1/8。文档完备性接近满分(数据描述论文 + 14 表字典 + MD5 校验表一应俱全),扣分项集中在评测协议缺失(0.3:无官方基准、无标注金标准、无划分)与许可/标签透明度中等。它更像一座"原料矿"而不是"考场"——适合自建任务的研究者,不适合想直接刷榜的团队。
给不同读者的最短路径:影像算法研究者直接看 §3.5(NIfTI 获取)与 §6.2(影像侧的空白与机会);临床信息学研究者看 §4.1(14 表结构)与 §4.7(与 MIMIC 的表对照);NLP 研究者看 §2.6(中文长文本的刻意保留)与 §7.5(LLM 实验配方);合规与教学场景看 §8 与 §9。
§0.1 名称勘误与口径声明
- 本条目正文统一使用 PhysioNet 官方标题"Emergency Department"版本,但在引用论文处保留论文原标题"emergency intensive care unit"——两者是同一数据集的两种官方表述,切勿当成两个数据集。
- "728"在本数据集里永远指就诊次数(visits,含门诊),“337"才是住院数;部分二手文章把 728 写成"728 例脓毒症住院”,属于把 Abstract 的口误当真(见存照 C)。本条目所有分析以 337 住院 / 836 CT / 327 有 CT 住院为准。
- 数据时间窗存在 2012-2022 与 2019-2022 双口径(见存照 B)。本条目在统计性叙述中标注口径,在叙事性叙述中采用"最长 11 年、EICU 纳入期 4 年"的双层表述。
§0.2 读者收益清单:读完这篇百科你能做什么
- 数据管理者:拿到 14 表结构图、ID 关联图、装载手册(§3.4/§4/§3.8),一天内完成本地化装载与对账,产出五数字(728/337/327/836/837)对账报告。
- 影像研究者:理解"层厚未知 + 无标注"两大约束的技术后果(§3.5/§6.2),获得弱监督标注工厂的四级配方(§7.6),把 836 体数据转化为可发表的方法学贡献。
- 临床 AI 研究者:获得 day-level 特征工程的完整路径(§5.4/§7.11)、泄漏防控专项(§7.3)、公平性清单(§7.4),以及三条可直接立项的提案(§7.15)。
- NLP 研究者:明确 6,037 行中文报告 + 主诉双语对的语料价值与边界(§2.6/§6.4),拿到 LLM 合规路线(§7.5)。
- 合规与教学:掌握双平台(PhysioNet+OMIX)叠加义务(§8.1)、LLM 时代数据位置口径(§8.3)、一节课与两周课程的教学化设计(§5.9/§7.12)。
§0.3 本条目与其他条目的阅读组合
| 需求 | 推荐组合 | 理由 |
|---|---|---|
| 看懂中文危重症数据生态 | 498 → 500 | 同团队同管线,先表格后影像 |
| 脓毒症 AI 全景 | 492 → 497 → 500 | 真实表格 → 合成数据 → 真实影像的三级台阶 |
| 医学影像数据集谱系 | 499 → 500 → 501 | 胸片器械 → 脓毒症 CT → 胸片分割的模态对照 |
| 儿科与成人的杭州双景 | 495 → 500 | ZUCH 儿科 ICU vs ZPPh 成人急诊 ICU,同城双中心 |
| 合规流程训练 | 495 → 500 | 两者同为 Credentialed,培训-申请-DUA 流程一致 |
§0.4 数据集身份卡(防混淆速查)
| 易混点 | 正确认知 |
|---|---|
| chest-ct-sepsis-er ≠ zhejiang-ehr-critical-care | 前者(本条目)是脓毒症 CT 配对集;后者(498)是同团队 2023 年的全谱系表格库 |
| 728 ≠ 337 | 728 是含门诊的就诊次数;337 是住院数;Abstract 的 “728 admissions” 是口误 |
| 836 ≠ 837 | 836 是 CT 扫描数;837 是 CT2hospitalID 表行数(差 1 待对账) |
| Emergency Department ≠ 另一个数据集 | 版本页标题与论文标题(emergency intensive care unit)指同一数据集 |
| Kehl et al. 2024 ≠ 数据论文 | 版本页误引;真正的数据论文是 Jin et al. Sci Data 11:1261 |
| 2012-2022 vs 2019-2022 | 双口径并存:版本页/Data Records 用前者,论文 Methods 用后者 |
| v1.0.0(2024-10-28) | 截止 2026-09 唯一版本,无更新 |
§1 出身与谱系:一条 EHR 管线的第二次产品化
§1.1 从 498 到 500:同一团队的两年两级台阶
2023 年 1 月,Jin Senjun 等人在 Scientific Data 发表"Establishment of a Chinese critical care database from electronic healthcare records in a tertiary care medical center"(Sci Data 10:49),把浙江省人民医院危重症单元的常规 EHR 整理成公开表格数据库——这就是本系列第 498 号条目 zhejiang-ehr-critical-care。2024 年 1 月 5 日,同一团队投出续作:这次不再泛化全院危重症,而是聚焦单一疾病(Sepsis-3 脓毒症)、单一模态(胸部 CT),从急诊 ICU 纳入队列,并补上了影像维度。论文 2024 年 11 月 13 日被接收,11 月 20 日正式刊出(Sci Data 11:1261);PhysioNet 版本页上线于 2024 年 10 月 28 日,比论文正式发表还早二十余天——数据先行、论文收尾,是 PhysioNet 生态的常见节奏。
作者团队 7 人:金红军系急诊与危重症中心(第一作者 Senjun Jin)、蔡炜、沈桥、杨璐、何胜安、傅佳,通讯与最后作者张忠辉(Zhongheng Zhang,浙江大学医学院附属邵逸夫医院急诊医学科,本系列 498 的同一通讯)。机构构成值得注意:三家来自浙江省人民医院本部(急诊危重症中心、放射科、信息中心),一家来自邵逸夫医院(张忠辉),一家来自绍兴文理学院医学院——信息中心的在列说明这仍是一次"官方管线工程"而非研究者个人爬取,数据从医院信息系统(HIS)到发布平台有制度化的提取与校验通道。
§1.2 为什么选脓毒症:一个"肺部最受伤"的疾病
论文的疾病逻辑链条很清晰:脓毒症是感染引起的全身炎症反应综合征(SIRS),住院患者死亡与致残的主要推手之一;最容易受累的器官系统是肺、肾与循环;其中肺损伤有直接的结构学呈现——脓毒症诱发的急性肺损伤在胸部 CT 上表现为双侧浸润影。但作者指出关键空白:肉眼可见的浸润只是冰山一角,“更细微的、人眼不可见的结构改变可能被忽略”,而计算机视觉与深度学习恰好擅长从 CT 中提取这类特征并用于预后、分型与决策支持。要训练这类模型,需要"公开、策展良好的脓毒症 CT 数据集",而当时该类资源几乎为零——这构成了立项理由。
§1.3 纳入标准:Sepsis-3 的中国急诊 ICU 实现
队列来自浙江省人民医院急诊 ICU(EICU)收治的全部脓毒症患者,时间窗按论文 Methods 为 2019 年 1 月至 2022 年 12 月。脓毒症采用 Sepsis-3.0 共识定义(Singer et al., JAMA 2016):疑似或确诊感染,加 SOFA 评分急性升高 ≥2 分。这是国际主流口径,与 MIMIC-IV 生态中 sepsis-onset 计算的常用标准一致,使跨库比较在概念层面可行。但要注意:数据集未发布逐患者的 SOFA 时序与感染判定中间变量——"哪些患者、何时被判定为脓毒症"这一关键过程在公开表格里只有结果(PtAdmiTable 的诊断与转归字段),过程可复现性有限,使用者无法自行审计纳入决策(见 §6.8 坑点)。
§1.4 三个计数口径:728 / 337 / 836
这组数字是本数据集最容易读错的地方。728 是就诊次数(visits),包括门诊(outpatient)——PtAdmiTable 恰好 728 行,每个 EncounterType 字段区分住院与门诊;337 是排除门诊后的住院数(103 女 + 234 男);836 是胸部 CT 扫描次数,分属 327 例住院(另外 10 例住院没有 CT,原因未说明);CT2hospitalID 表 837 行,比 836 多 1(存照 D,可能是表头或一条重复映射,官方文件为准)。论文 Abstract 写"728 admissions"是把 visits 误称 admissions;二手引用务必用 337/836 这对核心数字。
§1.5 单中心立场的利与弊
与 495(PIC,浙江大学儿童医院 12,881 患者)和 498(同院危重症全谱系)一样,这是单中心数据。利:表格结构统一、科室流程同质、Med_history 等中文文本风格一致,适合方法学开发与内部验证。弊:脓毒症的诊疗习惯(抗生素方案、液体策略、CT 开单指征)高度绑定于单一机构,模型外推到其他医院时面临中心效应——这恰是 2023 年 Intensive Care Medicine 上张忠辉与 Celi 等人"疾病轴 vs 聚类"论文反复论证的复现性难题。合理的用法是:把本集当作方法开发与效应量估计的"训练场",把跨中心验证留给多中心集(如 HiRID、eICU)或等待同系列扩展。
§1.6 双存储架构:PhysioNet + OMIX
这份数据同时落在两个受控通道:PhysioNet(Credentialed Access,面向国际研究者,DUA 三条款)与 NGDC OMIX005655(中国国家基因组科学数据中心,controlled access,BioProject PRJCA006118,2024-01-14 提交、2024-08-22 发布)。OMIX 通道的意义在国内合规:中国研究者无需跨境数据出境评估即可申请受控副本。论文 FAIR 声明逐条对应:Findable(OMIX 全局唯一标识与索引)、Accessible(双通道 + 明确的访问条件)、Interoperable(CSV 标准结构)、Reusable(来源与处理记录)。这种"一份数据、两张门牌"的双存储模式在中文数据集中还不常见,值得同类项目借鉴。
§1.7 与 PhysioNet 脓毒症主题家族的横向关系
PhysioNet 上以 sepsis 为主题的资源构成一个谱系:2019 Challenge(PhysioNet/CinC 2019 早期脓毒症预测挑战赛,时序表格)、Health Gym 合成脓毒症集(本系列第 497 条目,合成数据免合规)、Zigong 第四人民医院感染危重症库(2022,纯表格、另一家四川医院)、以及本条目(影像 + 表格)。它们共同覆盖了"时序预测—合成数据—表格描述—影像组学"四种研究范式。chest-ct-sepsis-er 是这个家族里唯一带 DICOM 衍生影像的成员,也是唯一提供检查报告自由文本的成员——这两个"唯一"就是它的生态位。
§1.8 伦理与治理
研究获浙江省人民医院伦理委员会批准(批准号 2023-397,批准范围明确包含数据发布),遵循赫尔辛基宣言,因回顾性设计由 IRB 决定豁免知情同意。注意批准主体是数据来源医院本身——与 498 一致;OMIX 通道提交者挂浙江大学(张忠辉的邮箱域名 zju.edu.cn),反映通讯作者的机构归属而非数据产权转移。DUA 三条款(不重识别、随论文发布代码、不分享数据)与 PhysioNet Credentialed 数据集的通行约束一致,其中"发布代码"一条是相对严格的可复现性承诺。
§1.9 资助与可持续性
版本页与论文未列出专项资助编号——这与 495(NSFC 与国家重点研发计划多项)形成对照。没有显式资助意味着数据维护的可持续性依赖团队自身:498(2023)、500(2024)两年两作的模式显示了团队的持续投入意愿,代码库(github.com/zh-zhang1984/ZhejiangProvinceICU)为两集共享。但单团队、单信息中心的管线也意味着版本迭代节奏不可预期——截止核查日(2026-09)版本仍为 v1.0.0,未见表结构扩展或勘误公告。
§1.10 用户画像:谁该用、谁不该用
适合:影像组学与 CV 研究者(有真实临床表格可配对的脓毒症 CT,样本量足够做方法学原型);多模态融合方法的开发者(影像 + 表格 + 中文文本的三模态最小可行集);中文医疗 NLP 团队(6,037 行检查报告 + 现病史长文本,附带人工复核的短文本双语平行样本);教学场景(数据量小,一张 32GB 内存的工作站即可全量装载)。不适合:需要大样本训练深度网络的团队(337 住院、836 CT 的量级只够微调与少样本实验);需要官方基准与排行榜的评测型研究(无划分、无金标准标注);需要连续年龄与精确时间戳的精细建模(年龄已分箱、时间已相对化到天)。
§1.11 名词速查表
| 名词 | 释义 |
|---|---|
| Sepsis-3.0 | 2016 年脓毒症国际共识:感染 + SOFA 急性升高 ≥2 分 |
| SOFA | 序贯器官衰竭评估评分,脓毒症严重程度的核心量表 |
| EICU | 急诊重症监护室(Emergency ICU),本数据集的物理来源单元,位于急诊科内 |
| NIfTI | 神经影像信息技术倡议格式(.nii.gz),医学影像研究的通用体数据格式 |
| SimpleITK | 基于 ITK 的简化医学影像处理库,本集用它做 DICOM→NIfTI 转换(v2.2.0) |
| patient_SN | 患者代理序列号(32 位十六进制样例 5810787d01cf52e6973eef9819b7d2ac) |
| Hospital_ID | 住院代理标识(15 位数字样例 337016968172517),全库主关联键 |
| serialID | CT 文件名,经 CT2hospitalID 表挂接 Hospital_ID |
| CTexame_DateTime | CT 检查时间,相对入院日的天数偏移,可为负(入院前门诊 CT) |
| OMIX | 中国国家基因组科学数据中心旗下组学原始数据库存档单元(OMIX005655) |
| DUA | 数据使用协议;本集三条款:不重识别、发布代码、不分享 |
| MD5 | 消息摘要算法;官方发布 14 表的 MD5 哈希供完整性校验 |
§1.12 发布时间线年表
| 日期 | 事件 |
|---|---|
| 2016 | Sepsis-3 共识发布(Singer et al., JAMA),为本集纳入标准提供定义基础 |
| 2023-01 | Jin et al. Sci Data 10:49 刊出(= 498),同一管线完成第一次产品化(纯表格) |
| 2024-01-05 | 本集数据描述论文投稿(Received 2024-01-05) |
| 2024-01-14 | OMIX005655 提交(BioProject PRJCA006118) |
| 2024-08-22 | OMIX 受控访问发布 |
| 2024-10-28 | PhysioNet 版本页上线(v1.0.0,DOI 10.13026/zne5-qh18) |
| 2024-11-13 | 论文被接收(Accepted) |
| 2024-11-20 | 论文正式刊出(Sci Data 11:1261,PMID 39567547) |
| 2026-09(核查日) | 版本仍为 v1.0.0,无更新公告;未检索到基于本集的同行评审后续研究 |
这张年表的三个读点:其一,OMIX 先行、PhysioNet 后上——国内通道优先就绪,说明团队的合规准备以境内为主;其二,投稿到接收历时 313 天(Sci Data 的常规节奏);其三,从 498 到本集恰好 22 个月,"表格库→影像扩展"的迭代周期约两年,可作为预测团队下一个产品(若有多中心或标注版)的时间参照。
§1.13 团队方法论的一致性指纹
对照 498 与本集的公开文档,可提取五条团队指纹:①ID 双键体系(患者代理号 + 住院代理号)完全一致;②时间相对化到天、自由文本日期 “****” 替换的处理习惯一致;③"短文本人工复核英译 + 长文本保留中文"的双语分层策略一致;④MD5 逐表交付的完整性校验习惯一致;⑤"数据描述论文 + 双平台存储"的发布模式一致。这些指纹对本系列读者的实用价值:读熟 498 与本集后,该团队(及协作网络如 Zigong 库)的后续数据集将具备近乎零的学习成本——同时也意味着其共同短板(无术语编码、无评测协议)会在新集中重复出现,使用者需要建立自己的补位工具箱。
§2 疾病与临床语境:脓毒症肺损伤的影像学底色
§2.1 从 SIRS 到器官衰竭:脓毒症的结构学后果
脓毒症的病理生理主线是感染触发的失控炎症反应:促炎因子风暴损伤血管内皮,毛细血管渗漏,血浆成分进入组织间隙。在肺部,这一过程的影像学呈现是间质水肿、磨玻璃影、实变与胸腔积液——从"正常肺纹理"到"双侧浸润"的连续谱。Sepsis-3 定义把"器官功能恶化"操作化为 SOFA ≥2 分的急性升高,而肺恰是 SOFA 氧合分项的直接对象(PaO2/FiO2)。因此本数据集的 CT 不只是"合并症的影像",而是定义疾病本身的器官在疾病过程中的结构快照——这是它区别于一般"疾病队列 + incidental 影像"资源的概念基础。
§2.2 为什么 CT 而不是胸片
论文选择 CT 的理由是空间分辨率:“CT 提供肺实质结构改变的高空间分辨率呈现”。胸片(如 499 的 CIED 集或 501 的胸片分割集)适合筛查与大样本形态学,但脓毒症肺损伤的间质细节——小叶间隔增厚、磨玻璃密度、微小实变——在 CT 上才可靠分辨。代价是数据量与辐射剂量:一家医院的 CT 存量远小于胸片,836 次扫描已经是 11 年(或 4 年)EICU 脓毒症队列的自然上限。研究者应把本集理解为"深度优先"的影像资源:每次扫描都是全胸体数据,但扫描次数有限。
§2.3 队列的人口学切面
337 例住院(排除门诊)中,女 103、男 234(男性 69.4%)——男性占优与多数脓毒症 ICU 队列一致。年龄分箱分布呈老年主导:(60,70] 87 例(26%)、(70,80] 95 例(28%)、(80,90] 52 例(15%)、(90,150] 19 例(6%),60 岁以上合计约 75%;(0,18] 仅 2 例(1%)。住院天数中位 22 天(IQR 12-36),男性中位略长(22 vs 20 天,p=0.224 不显著)。出院状态:治愈 185(56%)、未愈 121(36%)、未知 26(8%),性别间无显著差异(p=0.427)。注意"未愈"不等于死亡——StatusOnDischarge 字段的三分类是粗口径,准确院内死亡率需要结合 DiagnosisOnDeath 与 StatusOnDischarge_DESC 文本推断(见 §6.8 坑点 3)。
§2.4 CT 的时间分布:入院前的负偏移
CTexame_DateTime 以入院日为原点记录天数偏移,部分数值为负——因为相当一部分 CT 是患者以门诊身份在入院前完成的(728 次就诊含门诊正是为承载这些检查)。这一设计在数据建模上很有价值:研究者可以构建"入院前基线影像 → 住院过程表格 → 出院转归"的三段式分析,把 CT 当作入院时的结构学基线而非住院期间的过程快照。反过来,想在住院过程中追踪肺损伤演变的研究者会发现同一患者的多次 CT 分布不均——836 次扫描对 327 例住院平均 2.56 次,但方差未知,需自行统计。
§2.5 微生物与药敏:脓毒症异质性的病原学抓手
MicrobiologyCulture 表 20,661 行记录培养结果(样本类型、 category、时间、英文描述),DrugSens 表 55,029 行记录病原体对抗生素的敏感性。论文给出的描述样例透露了数据风格:“Poor quality (WBC<10/LP, LEC>25/LP)”(标本质量:每低倍镜视野白细胞少于 10、鳞状上皮细胞大于 25)、“No anaerobic bacteria growth after 5 days of culture”(培养 5 天无厌氧菌生长)。这些半结构化英文短句 + 结构化字段的组合,让病原谱分析(革兰阳性 vs 阴性、真菌比例)与药敏驱动的抗生素暴露重建成为可能——后者恰是脓毒症预后模型里公认难测但影响巨大的协变量。
§2.6 中文长文本:刻意的保真决策
PtAdmiTable 的 Med_history(现病史/既往史)与 ExamReport 的报告正文保留原始中文,作者在论文里明确解释:机器翻译"可能改变 NLP 或文本挖掘的结果",因此只在元数据与短文本(主诉、检验项目名、科室名等)上做了百度学术翻译服务初译 + 两作者人工复核的英译,长文本一律不动。这是一个对 NLP 社区友好但对国际用户不友好的决策——英语世界的研究者拿到的是一份需要自带翻译管线的语料。对本系列的中文 AI 生态而言,这反而是卖点:6,037 行影像报告 + 大段现病史,是稀缺的"报告-影像可对齐"中文语料(报告行经 ExamReport 关联到检查类型与时间,虽未直接给影像文件级对齐,但 Hospital_ID 粒度的对齐是可行的)。
§2.7 生命体征的两套来源
数据集有两张生命体征表:VitalSign.csv(505,151 行)与 NursingChart_VitalSign.csv(2,251,285 行)。前者按 VitalSign_DESC 分类(舒张压、体温、心率、呼吸频率)记录监护数据;后者来自护理录入界面(nursing chart),行数是前者的 4.5 倍。两套来源的采样频率、覆盖时段与质量控制标准不同——护理表更密但受录入习惯影响,监护表更规整但可能漏录护理时段。模型特征工程时建议两表并用并标注来源,切勿合并去重后当单一来源使用(见 §5.7 错误黑名单)。
§2.8 转科事件:EICU 的住院内轨迹
HospitalTransfer 表 277 行记录院内转科:转入/转出科室(英译)、转入/转出时间(相对入院天数)。表注释明确了科室命名约定:Emergency medical department 与 Emergency Department 都指 EICU。277 次转科对 337 例住院意味着多数患者未转科(滞留 EICU)或少部分多次转科。这张表是重构"住院内时间线"的关键:CT(CTexame_DateTime)、检验、用药都只有相对入院日的时间戳,把转科时间轴叠加进来才能回答"转入普通病房后生命体征是否还连续记录"这类过程性问题。
§2.9 转归字段的语义边界
PtAdmiTable 的转归字段组需要细读:StatusOnDischarge(三分类:治愈/未愈/未知)、StatusOnDischarge_DESC(文字描述)、DiagnosisOnDeath(死亡诊断)、Discharge_DateTime(出院时间,相对入院)、DaysHospitalStay(住院天数)。没有显式的 28/90 天死亡终点字段——这是与 MIMIC 系(有完整随访死亡日期)的显著差距。做预后建模的研究者只能用院内转归,且必须处理"未知"26 例(8%)的归属问题:剔除会引入选择偏倚,计入任一类都会污染标签。合理的做法是把转归建模为三分类或用 DESC 文本做规则细化并报告敏感性分析。
§2.10 与 498 的表格结构相似性:继承与微调
论文原话:“The structure of clinical data is quite like the ones reported previously”(临床数据结构与先前报告的非常相似),并把 498 的论文列为参考文献 10。这意味着熟悉 498 的研究者几乎零学习成本上手本集:同样的 patient_SN/Hospital_ID 双键体系、同样的相对时间戳约定、同样的中文长文本 + 英译短文本策略、同样的 MD5 校验交付。差异点有三:新增 CT2hospitalID 影像映射表;新增 ExamReport 检查报告表(498 无影像报告);_24hr 后缀列系本集特有(24 小时内出院/死亡者的主诉快照)。继承性让"498+500 联合装载"成为现实的整合方案(见 §5.10)。
§2.11 证据层级小结
本章临床叙述的证据等级:Sepsis-3 定义(Singer et al. JAMA 2016)为国际共识(A 级);队列人口学与转归统计来自论文 Table 1(B 级,单中心描述性);肺部结构改变的影像学逻辑为综述级共识(B 级);“肉眼不可见的细微结构改变可用 CV 提取并用于预后"为作者主张(C 级,尚待本数据集上的公开实证支持——截止核查日未检索到使用本集的同行评审影像研究)。引用时注意区分"论文论证的逻辑"与"已发表的实证结果”。
§2.12 脓毒症肺部影像研究的文献脉络与缺口
脓毒症肺损伤的影像学文献长期以两个传统为主:一是临床放射学的定性描述传统(双侧浸润、ARDS 影像标准的 Berlin 定义修订讨论),二是近十年的定量影像组学传统——后者在 COVID-19 期间爆发(CT 严重度评分、病灶定量与预后关联的论文数以百计),但脓毒症本身因为缺乏公开影像队列而明显滞后:大量脓毒症影像研究锁在单院 PACS 里无法复现。本集的直接动机就是这个缺口——论文引言明确说"由于缺乏策展良好的公开脓毒症 CT 数据集,探索肺 CT 影像组学的研究稀少"。对照 COVID-CT 的经验教训(公开数据集推动了评分系统的快速迭代,也暴露了标签质量与中心偏差问题),可以合理预期:一旦本集出现首批公开研究,"弱标签质量、层厚异质性、单中心偏差"将是同样的三大方法论焦点。本条目 §7 的配方正是按这三个焦点预置的。
§2.13 时间原点的建模含义:以入院为时区零点
全库以"入院时刻"为时间原点,这个设计有一个常被忽视的建模含义:它把"入院前-住院-出院后"三个阶段编码为负/正/更大的正,使得"跨阶段过程建模"成为一等公民。例如"入院前 72 小时内的门诊检验 + 入院即刻的生命体征"可以拼成一个连续特征窗口,而无需研究者知道真实日历日期。反过来,它也抹掉了星期几、季节、流行病学时段等日历信息——若要研究"周末入院效应"或季节性(脓毒症发病的季节波动是真实临床现象),本集无法支持。时间原点选择是隐私与科学的交换:得到了可拼接的过程窗口,失去了日历层的相关性研究空间。
§3 数据规格:14 张表、836 个体数据与它们的挂接方式
§3.1 交付物清单
访问获批后可下载的内容分三类:其一,14 张 CSV 临床表格(UTF-8,第一列为字段名);其二,CTImage 文件夹下的 NIfTI 体数据(.nii.gz),文件名即 serialID;其三,MD5 校验清单(论文 Table 2/3 逐表给出哈希)。没有任何标注文件(无分割 mask、无病变标注、无放射评分)、没有官方代码附件(代码以 GitHub 形式存在于团队仓库)、没有数据字典之外的字段级文档。下载前建议先核对 MD5——论文明确把 MD5 列为完整性校验手段,且不同信息系统抽取的表需要用 PtAdmiTable 的 Hospital_ID 做主键对账。
§3.2 十四张表全家福(NumObs 为官方口径)
| # | 表名 | NumObs | 内容 |
|---|---|---|---|
| 1 | CT2hospitalID.csv | 837 | CT 文件名(serialID)→ Hospital_ID 映射 + CTexame_DateTime |
| 2 | Diagnosis.csv | 8,459 | 诊断记录 |
| 3 | DrugSens.csv | 55,029 | 病原体对抗生素的药敏 |
| 4 | ExamReport.csv | 6,037 | 检查报告(CT/超声/MRI)文本 |
| 5 | HospitalTransfer.csv | 277 | 院内转科事件(含 EICU 命名约定) |
| 6 | Lab_dictionary.csv | 246 | 检验项目字典 |
| 7 | Lab.csv | 789,010 | 检验结果 |
| 8 | Medication.csv | 109,246 | 用药事件 |
| 9 | MedOrder.csv | 117,751 | 医嘱 |
| 10 | MicrobiologyCulture.csv | 20,661 | 微生物培养 |
| 11 | NursingChart_IO.csv | 98,231 | 护理出入量 |
| 12 | NursingChart_VitalSign.csv | 2,251,285 | 护理生命体征(最大表) |
| 13 | PtAdmiTable.csv | 728 | 就业主表(含门诊;住院 337) |
| 14 | VitalSign.csv | 505,151 | 监护生命体征 |
合计约 3,962,948 行。行数结构一目了然:护理生命体征一张表占 57%,影像相关只有 CT2hospitalID 的 837 行——这是一份"以临床表格为主体、影像为增量"的资源,与 MIMIC-CXR(影像 377 万张、表格相对薄)正好是两个方向的配比。
§3.3 DAIMS 评估:5.1/8
| 维度 | 得分 | 依据 |
|---|---|---|
| 文档完备性 | 0.9 | Sci Data 数据描述论文 + 14 表逐字段说明 + MD5 清单;扣 0.1:无字段级异常值说明与版本变更记录 |
| 机器可读性 | 0.8 | CSV + NIfTI 双标准格式、MD5 机器校验、ID 体系清晰;扣 0.2:检验项无 LOINC 映射、药物无 RxNorm/ATC 编码、科室名英文为人工翻译非标准术语 |
| 标签质量透明度 | 0.6 | Sepsis-3 纳入标准公开、转归三分类透明;扣 0.4:无影像标注、无 SOFA 时序、纳入决策过程不可审计 |
| 可访问性 | 0.7 | Credentialed 流程成熟、OMIX 国内通道;扣 0.3:需 DUA 且三条款约束强、无 Open Access 快速通道 |
| 许可清晰度 | 0.6 | DUA 条款明确(不重识别/发布代码/不分享);扣 0.4:非标准开源许可、二次分发与衍生数据集边界靠 DUA 文字约束 |
| 格式标准化 | 0.7 | NIfTI 为影像事实标准、CSV 通用;扣 0.3:未保留 DICOM 原始(丢失层厚/重建核/窗宽窗位元数据) |
| 评测协议完备性 | 0.3 | 无官方任务、无划分、无基准、无金标准标注 |
| 生态可持续性 | 0.5 | 498→500 系列延续、共享代码库;扣 0.5:单团队依赖、v1.0.0 无更新承诺、无资助信息公开 |
| 合计 | 5.1/8 | 原料矿型资源:文档好、协议缺 |
§3.4 ID 体系与关联图
三键体系:patient_SN(患者级,一人多次就诊共享)→ Hospital_ID(住院级,全库主键)→ serialID(CT 文件级)。关联路径:CT 文件名 serialID → CT2hospitalID(含 CTexame_DateTime)→ Hospital_ID → 任意临床表。HospitalTransfer 提供院内科室轨迹(EICU 起点)。与 MIMIC 的概念映射:patient_SN ≈ subject_id,Hospital_ID ≈ hadm_id,serialID ≈ MIMIC-CXR 的 study 实例。注意 patient_SN 样例是 32 位十六进制(MD5 风格),Hospital_ID 是 15 位数字——两者都不是原始病案号,官方声明原始标识未保留、不可回链。
§3.5 影像规格:从 DICOM 到 NIfTI 的转换决策
CT 原始为 DICOM 序列,用 SimpleITK v2.2.0 转为 NIfTI(.nii.gz);同一检查含多序列时,“提取包含胸部 CT 的那一序列”。这个决策的收益是易用性(NIfTI 一文件一体数据,Python/R 生态友好,论文还点名 RNifti 包);代价是 DICOM 头里的技术元数据(层厚、重建核、管电压、窗宽窗位、增益)随转换丢失或弱化——影像组学研究者知道,这些参数是 radiomics 特征可重复性的第一决定因素(RSNA 的 IBSI 标准要求报告它们)。论文与版本页均未给出队列级层厚/重建核分布统计(见 §6.8 坑点 1),使用者需要在装载阶段自行从 NIfTI 头(像素间距、体素维度)反推部分信息,并承认"重 sliced 厚度异质性"是本集的固有噪声。
§3.6 时间语义:相对天数与 _24hr 列
全库时间统一为"相对入院日的天数偏移":Discharge_DateTime、CTexame_DateTime、TransferIn/Out_DateTime、VitalSign_DateTime、Lab/Medication/Micro 时间字段同理。自由文本中的绝对日期以 “****” 替换。同一天内的事件无法排序(粒度=天),做时序模型时 day-level 聚合是默认操作。_24hr 后缀列(ChiefComplain_24hr、AdmissionStatus_24hr、ChiefComplain_24hr_dead、AdmissionStatus_24hr_dead)是入院 24 小时内出院或死亡患者的专用主诉快照——对多数住院为空。这个设计透露作者的建模兴趣(超早期转归),也提示急诊留观 24 小时内即出院/死亡的患者在主表其他字段可能信息稀薄。
§3.7 访问流程实操
PhysioNet 通道:注册账号 → 完成 CITI"人体受试者保护"课程(与 495/498 同一要求)→ 签署 DUA → 提交访问申请 → 批准后页面出现下载按钮(aws s3 sync 或浏览器逐文件)。Credentialed 审批通常数个工作日。OMIX 通道:注册 NGDC 账号 → 提交数据使用申请(OMIX005655)→ 中国境内研究者可申请受控副本,无需跨境合规评估。两通道拿到的是同一份数据(论文 Data Records 明示双存储)。国内团队建议优先 OMIX,国际团队走 PhysioNet。DUA 三条款里最容易被忽视的是"发布代码":用本集发表的论文必须公开配套代码,写作时要把这条义务写进项目计划。
§3.8 装载手册(最小可行环境)
32GB 内存单机即可全量装载。步骤:①校验 MD5(md5sum -c);②CTImage 解压,用 nibabel 或 SimpleITK 读取头信息建立体素维度/间距清单;③14 张 CSV 装入 SQLite/PostgreSQL(无官方建表脚本,字段类型需从数据推断——Lab_value 与 VitalSign_value 为混合类型文本);④以 PtAdmiTable 为中心做完整性对账:Hospital_ID 应在全部 13 张子表出现(论文声明已做过该一致性检查);⑤CT 对账:CT2hospitalID 的 serialID 与 CTImage 文件名逐一比对,官方 837 vs 836 的差异在此环节定位;⑥建立 day-level 物化视图(把相对天数聚合为每患者每日事件表),后续特征工程事半功倍。团队共享代码库(zh-zhang1984/ZhejiangProvinceICU)含部分处理脚本可参考。
§3.9 元数据速查
| 元数据项 | 值 |
|---|---|
| 版本 | 1.0.0(2024-10-28 发布,截止 2026-09 无更新) |
| DOI | 10.13026/zne5-qh18(PhysioNet)/ 10.1038/s41597-024-04132-z(论文) |
| RRID | SCR_007345 |
| OMIX | OMIX005655;BioProject PRJCA006118 |
| 访问级别 | Credentialed(PhysioNet)/ Controlled(OMIX) |
| 引用链 | 版本页引文 + Jin et al. Sci Data 2024 + PhysioNet 平台引文(Pollard et al.) |
| 伦理 | 浙江省人民医院 2023-397 |
| 平台 | PhysioNet + NGDC OMIX 双存储 |
§3.10 版本页引用要求的三个层次
第一层:Jin, S., & Zhang, Z. (2024). Chest Computed Tomography for patients with sepsis in the Emergency Department (version 1.0.0). PhysioNet. RRID:SCR_007345. https://doi.org/10.13026/zne5-qh18。第二层:数据描述论文 Jin et al. Sci Data 11:1261 (2024)——注意版本页把它误写为 Kehl et al.(存照 E),正确引用以论文 DOI 10.1038/s41597-024-04132-z 为准。第三层:PhysioNet 平台引文(Pollard et al., PhysioNet as a global platform for biomedical research)。三层缺一不可,二手文章最常见的错误是只引第一层不引论文,或跟着版本页误引 Kehl。
§3.11 跨库对齐协议
与 498(同院同管线):直接 join——patient_SN/Hospital_ID 语义相同,理论上同一患者在两集中同 ID(需验证),联合后可做"全院危重症表格 + 脓毒症子集影像"的分层分析。与 MIMIC-IV:概念映射可行(subject_id/hadm_id/charttime ↔ patient_SN/Hospital_ID/相对天数),但 MIMIC 无影像的对应表结构,对齐停留在方案层。与 2019 Challenge:后者是公开时序窗口数据(Sepsis-3 标签已给),可做"真实影像库 vs 时序竞赛库"的分布对照。与 OMIX 内其他脓毒症多组学项目(CMAISE 联盟):同院生态内可能存在患者重叠,任何跨集个体链接都属于重识别尝试,为 DUA 明令禁止——只做统计层对照。
§3.12 字段级示例速览(以官方披露样例为准)
| 表.字段 | 官方样例 | 解读 |
|---|---|---|
| PtAdmiTable.patient_SN | 5810787d01cf52e6973eef9819b7d2ac | 32 位十六进制代理号,MD5 风格 |
| PtAdmiTable.Hospital_ID | 337016968172517 | 15 位数字代理号,住院级主键 |
| PtAdmiTable.EncounterType | inpatient / outpatient | 728 visits 的分型依据 |
| PtAdmiTable.StatusOnDischarge | Cured / Not cured / Unknown | 三分类转归 |
| PtAdmiTable.Age_cut | (70,80] | 九档分箱年龄 |
| HospitalTransfer.TransferTo_Dept_Eng | Emergency medical department | 该名称即 EICU |
| MicrobiologyCulture.MicrobiologyCulture_DESC_Eng | “No anaerobic bacteria growth after 5 days of culture” | 半结构化英文描述 |
| MicrobiologyCulture.MicrobiologyCulture_DESC_Eng | “Poor quality (WBC<10/LP, LEC>25/LP)” | 标本质量描述样例 |
| CT2hospitalID.serialID | = CT 文件名 | 影像级关联键 |
| CT2hospitalID.CTexame_DateTime | 负数合法 | 入院前门诊 CT |
| VitalSign.VitalSign_DESC | 舒张压/体温/心率/呼吸频率 | 四类核心体征 |
§3.13 装载后对账清单(逐项断言)
- PtAdmiTable 行数 = 728;过滤 EncounterType=inpatient 后 = 337。
- Sex 统计 = 女 103 / 男 234(住院子集)。
- DaysHospitalStay 中位数 = 22(IQR 12-36)。
- StatusOnDischarge 分布 = 185/121/26。
- CTImage 文件数 = 836;CT2hospitalID 行数 = 837(差异行单独人工检视,写进对账报告)。
- CT2hospitalID.Hospital_ID ⊆ PtAdmiTable.Hospital_ID(论文声明已过一致性检查,仍应复验)。
- 每张子表的 Hospital_ID 都能在 PtAdmiTable 找到(13 张子表逐一外键反查)。
- 14 张表 MD5 与论文 Table 2/3 逐一比对。
- 无 CT 的 10 例住院:列出 Hospital_ID 清单留档(后续分析的分母口径证据)。
- VitalSign 与 NursingChart_VitalSign 的时间覆盖区间分别统计并画每患者甘特图。
§3.14 与 498 的逐表血缘对照
| 本集(500) | 498 对应表 | 血缘判断 |
|---|---|---|
| PtAdmiTable | 就业主表(同结构) | 同源改造:新增 _24hr 列组与双语主诉 |
| VitalSign | VitalSign | 同构:字段约定一致 |
| NursingChart_VitalSign | NursingChart_VitalSign | 同构;本集行数按脓毒症子集缩放 |
| NursingChart_IO | NursingChart_IO | 同构 |
| Lab + Lab_dictionary | Lab + Lab_dictionary | 同构;字典项数可能不同(246 vs 498 版) |
| Medication / MedOrder | Medication / MedOrder | 同构 |
| MicrobiologyCulture + DrugSens | MicrobiologyCulture + DrugSens | 同构 |
| Diagnosis | Diagnosis | 同构:均无 ICD 编码 |
| HospitalTransfer | HospitalTransfer | 同构:EICU 命名约定同 |
| ExamReport | (无) | 本集新增:影像扩展的标志表 |
| CT2hospitalID | (无) | 本集新增:影像映射 |
| CTImage(NIfTI) | (无) | 本集新增:影像本体 |
这个对照表的实用价值:从 498 迁移来的分析管线只需处理三件事——新增影像入口(CT2hospitalID + CTImage)、新增报告通道(ExamReport)、复核字典差异。其余 9 张表代码可原样复用。
§4 结构深查:表与影像的微观解剖
§4.1 PtAdmiTable:17+ 字段的主表
已披露字段:patient_SN、Hospital_ID、Sex、EncounterType(inpatient/outpatient)、ChiefComplain_24hr、AdmissionStatus_24hr、ChiefComplain_24hr_dead、AdmissionStatus_24hr_dead、ChiefComplain(中文)、ChiefComplain_Eng(英译)、StatusOnDischarge、StatusOnDischarge_DESC、DiagnosisOnDeath、Discharge_DateTime、DaysHospitalStay、Age_cut、PastHistory、Med_history。主诉双语平行(中文+英译)是现成的翻译对齐小语料;Med_history 与 PastHistory 为中文长文本。DaysHospitalStay 与 Discharge_DateTime 应当冗余一致,装载时可互验。Age_cut 的分箱边界即论文 Table 1 的九档。
§4.2 ExamReport:6,037 行报告文本的三重价值
第一重,NLP 语料:CT/超声/MRI 报告正文(中文),报告风格为中文放射科模板句式("两侧胸廓对称…两肺纹理增多…“类)。第二重,影像检索线索:CT 报告与 CTImage 文件在 Hospital_ID + 时间偏移粒度可弱对齐(论文未给 serialID 级对齐,研究者可用 CTexame_DateTime 与报告日期做最近邻匹配——属于合法推断,不是重识别)。第三重,结构学标签的弱来源:报告中的"胸腔积液”“实变”"磨玻璃影"等术语可经词典匹配生成弱监督标签,替代缺失的官方影像标注(见 §7.6 弱监督级联配方)——但必须意识到报告术语与影像真实病灶的偏差,弱标签只能用于预训练与原型,不能当金标准评测。
§4.3 Lab + Lab_dictionary:789,010 行检验的字典驱动解读
Lab_dictionary 仅 246 行,说明检验项目经院内标准化归并(相对原始 LIS 的数千项目名大幅收敛)。但 246 项无 LOINC 映射,跨库对齐需要人工建映射表(建议优先映射脓毒症模型高频项:乳酸、白细胞、降钙素原、C 反应蛋白、肌酐、胆红素、血小板、PaO2/FiO2 相关血气项)。Lab_value 为文本类型,数值解析时注意单位列与异常表示(“阴性”、“>1000”、“<0.03” 类截断值)。789,010 行 / 337 住院 ≈ 每住院 2,341 条检验记录,密度与 ICU 级监护吻合。
§4.4 Medication + MedOrder:109,246 + 117,751 行的双层用药记录
Medication 是给药事件(执行层),MedOrder 是医嘱(意图层)——两层对照可计算"医嘱-执行延迟",这是急危重症流程挖掘的有趣变量。药品名以中文商品名/通用名为主(无 ATC 编码),跨库使用需要建本地映射。液体类药品(晶体液、白蛋白、血制品)与 NursingChart_IO(98,231 行出入量)联合可重建液体平衡曲线——脓毒症复苏研究的核心过程指标。
§4.5 MicrobiologyCulture + DrugSens:培养与药敏的分离设计
培养表(20,661 行)记录标本、菌种、时间与英文描述;药敏表(55,029 行)记录病原-抗生素-敏感度三元组。两表按培养事件关联。药敏行数是培养行数的 2.7 倍,说明多数阳性培养附带多抗生素panel。抗生素耐药表型(MRSA、CRE、CRKP 类)可从药敏组合推导,为"耐药菌感染 vs 影像结构改变"的探索提供了其他公开脓毒症集少有的抓手。
§4.6 NursingChart_VitalSign vs VitalSign:4.5 倍行差的结构解释
护理表 2,251,285 行 vs 监护表 505,151 行。合理解释(论文未明说,属推断):护理表覆盖全住院周期(含普通病房时段)且采样密集,监护表聚焦监护时段;两者字段结构相同(DESC/value/unit/时间)。注意 327 例有 CT 的住院不一定是住 EICU 最久的——转科轨迹(HospitalTransfer)+ 两表覆盖差异共同决定每患者的有效观测窗口,特征工程前先画每患者的时间覆盖图,避免把"没记录"当"生命体征平稳"。
§4.7 与 MIMIC 系的表级对照
| 概念 | 本集 | MIMIC-III/IV |
|---|---|---|
| 患者 | patient_SN | subject_id |
| 住院 | Hospital_ID | hadm_id |
| ICU 住留 | HospitalTransfer 推导 | icustay_id(显式) |
| 生命体征 | VitalSign + NursingChart_VitalSign | chartevents |
| 检验 | Lab + Lab_dictionary | labevents + d_labitems |
| 用药 | Medication + MedOrder | inputevents + prescriptions |
| 微生物 | MicrobiologyCulture + DrugSens | microbiologyevents |
| 诊断 | Diagnosis(中文,无 ICD) | diagnoses_icd(ICD 编码) |
| 影像 | CTImage(NIfTI) | MIMIC-CXR 另库(DICOM/JPEG) |
| 报告文本 | ExamReport | MIMIC-CXR 的 radiology reports |
| 出转归 | StatusOnDischarge 三分类 | 死亡日期( hospital + 1 年随访) |
最大结构差异有二:诊断无 ICD 编码(中文文本,需 NLP 映射才能与 CCSCategory 类标准层对接);ICU 住留非显式实体(需从转科表推导)。这两点决定了从 MIMIC 迁移来的分析管线必须做适配层。
§4.8 影像文件的物理特征
样本 CT(论文 Fig.1)三视图坐标 [250,250,80] 暗示体数据矩阵约 512×512×若干层(x-y 250+ 的索引落在常见 512 矩阵内,z 80 提示层数至少百级,具体以实际文件为准)。压缩为 .nii.gz 后单文件体量视层厚约 10-50MB,836 文件总计约 10-40GB 量级——下载与存储预算应按 50GB 规划。全库无 mask、无 JSON 侧车文件、无 BIDS 式目录规范,文件名即 serialID(32 位十六进制风格),批处理脚本需要自己维护"文件名→Hospital_ID→患者"的解析层。
§4.9 血缘链:从 HIS 到 NIfTI 的五级加工
数据血缘可归纳为五级:①HIS/LIS/PACS 原始记录(院内多信息系统)→②按 HIPAA 去标识抽取(ID 替换、年龄分箱、日期相对化、文本脱敏)→③表间 Hospital_ID 一致性校验(论文声明逐表与 PtAdmiTable 对账)→④百度学术翻译 + 双作者人工复核(元数据与短文本)→⑤DICOM→NIfTI 转换(SimpleITK 2.2.0,胸部序列提取)。每一级都有信息损失或转换决策:①级丢失的是系统间外键;②级丢失绝对时间与精确年龄;③级未公开对账失败的样本量;④级未公开翻译错误的抽检错误率;⑤级丢失 DICOM 技术头。使用者的"尽职调查清单"应覆盖这五级(见 §6.10)。
§4.10 质量总评:文档 A、标准 B、协议 D
给三张成绩单。文档:A——论文逐表逐字段交代,MD5 全覆盖,在同类中国数据集中属第一梯队。标准:B——格式标准(CSV/NIfTI)但术语标准缺位(无 LOINC/ICD/ATC),科室与检验名的英译是"可读"而非"可算"的。协议:D——没有任何官方任务、划分、标注或基准;转归标签粗(三分类+未知),时序粒度粗(天)。这个画像决定了它的最佳用途:自建任务的方法学开发、中文医疗多模态预训练语料、教学演示;最差用途:直接刷某个公开榜(没有榜可刷)。
§4.11 SQL 速查:五个高频查询
-- 1) 住院子集(排除门诊)
SELECT * FROM PtAdmiTable WHERE EncounterType = 'inpatient'; -- 337 行
-- 2) 每患者的 CT 清单(含入院前负偏移)
SELECT p.patient_SN, c.Hospital_ID, c.serialID, c.CTexame_DateTime
FROM CT2hospitalID c JOIN PtAdmiTable p USING (Hospital_ID)
ORDER BY p.patient_SN, c.CTexame_DateTime;
-- 3) EICU 停留时长(转科轨迹推导 ICU 住留)
SELECT Hospital_ID,
MIN(TransferIn_DateTime) AS icu_in,
MAX(TransferOut_DateTime) AS icu_out
FROM HospitalTransfer
WHERE TransferFrom_Dept_Eng LIKE 'Emergency%' OR TransferTo_Dept_Eng LIKE 'Emergency%'
GROUP BY Hospital_ID;
-- 4) 脓毒症高频检验项的每日最新值(乳酸示意)
SELECT l.Hospital_ID, l.Lab_DateTime AS day, MAX(l.value_num) AS lactate_last
FROM Lab l JOIN Lab_dictionary d ON l.item_code = d.item_code
WHERE d.item_name LIKE '%乳酸%' OR d.item_name LIKE '%LACT%'
GROUP BY l.Hospital_ID, l.Lab_DateTime;
-- 5) 转归三分 + 未知留档
SELECT StatusOnDischarge, COUNT(*) FROM PtAdmiTable
WHERE EncounterType = 'inpatient'
GROUP BY StatusOnDischarge; -- Cured 185 / Not cured 121 / Unknown 26
注:字段名以实际文件表头为准(上式为语义示意);Lab 数值解析需处理文本型截断值(“<0.03”、“>1000”、“阴性”)。
§4.12 逐表深度注记:装载者视角的十四行
- CT2hospitalID:影像唯一入口;serialID 即文件名;837 vs 836 的差异行是装载首日就要解决的问题。
- Diagnosis:中文自由文本,无编码;感染灶归类词典(§7.16)的最大消费方。
- DrugSens:55,029 行药敏是本集"意外之喜"——多数脓毒症公开集只有培养无药敏。
- ExamReport:NLP 的主矿;报告-影像弱对齐(Q62)的边界必须先测后用。
- HospitalTransfer:ICU 住留的唯一推导来源;EICU 命名两条目都要匹配(§4.11 查询 3)。
- Lab_dictionary:246 项的收敛字典——建 LOINC 映射的工作量是可控的(一两天),值得立刻做。
- Lab:789,010 行;文本截断值与单位归并是清洗主战场。
- Medication:给药执行层;首剂抗生素时点是脓毒症研究的黄金特征。
- MedOrder:医嘱意图层;与 Medication 的时间差即执行延迟。
- MicrobiologyCulture:培养主表;阳性时点与标本类型的组合决定解读。
- NursingChart_IO:液体平衡的原料;单位归并先于求和(毫升/升混排是常见坑)。
- NursingChart_VitalSign:全库最大表;按患者抽样检查采样间隔而非假设等间隔。
- PtAdmiTable:全库中心表;17+ 字段里 Med_history 与双语主诉是两块特殊资产。
- VitalSign:监护层四类体征;与护理表并行不合并(Q44)。
§5.1 环境对账清单
开工前核对:Python ≥3.10 + nibabel/SimpleITK/pandas/scikit-learn;存储 ≥50GB(含解压余量);SQLite 或 PostgreSQL 任一;若复现论文表格统计需 R(RNifti 包被论文点名);Git(DUA 要求发表时公开代码,从第一天就建仓库)。国内团队若走 OMIX 通道,先确认单位对受控数据的内网管理流程;PhysioNet 通道注意 AWS S3 下载脚本对大文件夹的并发限制。
§5.2 评测协议:无官方协议时的自建规范
本集没有官方基准,自建评测必须自证清白。最低规范:①任务定义明确到字段级(如"以 24 小时内生命体征预测院内死亡");②划分按 patient_SN 分层(绝不按行划分——同一患者多表行泄漏);③转归标签处理"未知"26 例的方案写明(建议主分析剔除+敏感性分析计入);④所有时间特征只用 ≤ 预测时点的数据(day 粒度意味着"预测时点"取整天,边界事件统一规则);⑤报告 95% 置信区间(bootstrap by patient)。这五条写进论文方法节,审稿人无法用"划分泄漏"攻击。
§5.3 影像预处理推荐配方
NIfTI 装载后建议固定流程:①重采样到统一各向同性 spacing(如 1×1×1mm)——因为队列层厚异质性未披露,重采样是公平比较的前提;②肺窗窗宽窗位(如 W1500/L-600)统一渲染;③肺野分割用现成模型(TotalSegmentator/nnUNet 肺模板)生成 mask(自产 mask 需声明非官方);④若做 radiomics,用 IBSI 兼容特征提取器(PyRadiomics),并在限制节声明"重建核未知,特征稳定性未验证";⑤若做深度学习,337 例的量级只支持预训练-微调范式(CT 基础模型或自然图像预训练 + 少样本微调),从头训练大网络无意义。
§5.4 表格特征工程推荐路径
①day-level 聚合:每患者每日的 vitals 统计量(min/max/mean/last)、检验 latest + delta、用药计数与首剂时间;②液体平衡:NursingChart_IO 按日汇总入量-出量;③抗生素暴露:DrugSens 敏感谱 + Medication 时间线交叉生成"经验性治疗 vs 目标性治疗"标记;④SOFA 近似:用可得的检验/生命体征字段重算近似 SOFA(注明为近似值,非官方 SOFA 时序);⑤转归:三分类主标签 + DESC 文本规则细化的次级标签。全流程产出一张 patient-day 宽表,后续任何模型都从它出发。
§5.5 NLP 通道:中文报告的处理选项
三条路线按成本排序:①词典规则(术语表匹配病灶词,零成本低召回,适合弱标签);②预训练 BERT 系中文模型微调(需要小规模人工标注,建议标 200 份报告试水);③LLM 零样本/少样本抽取(提示词内给中文报告 + 输出 JSON 病灶词典,注意 DUA 对数据处理位置的限制——使用境外 API 前需评估"不分享数据"条款的含义,境内部署模型更稳妥)。短文本主诉的双语平行对(ChiefComplain/ChiefComplain_Eng)可做翻译质量抽样的参照系。
§5.6 与 498+495 的联合装载方案
三集同属"中国危重症公开数据"生态:498(同院表格全谱系)、500(同院脓毒症影像子集)、495(杭州另一家医院 ZUCH 儿科)。联合装载的价值:①方法学上,一套 ID/时间约定吃三集;②临床上,成人脓毒症(500)与全院危重症(498)的嵌套结构适合做"疾病特异 vs 全谱系"对照;③教学上,一个 Jupyter 仓库装三集走完"表格→影像→文本"全流程。技术要点:分别下载各自 DUA,物理上分开存储,统计层联合(报告三集来源),不做个体跨集链接(DUA 禁止重识别)。
§5.7 错误黑名单(本集特有)
①把 728 当住院数(实为 visits,住院 337);②把 Kehl et al. 2024 当数据论文(实为版本页误引,正确为 Jin et al. Sci Data 2024);③按行划分训练/测试(应按 patient_SN);④两套生命体征表合并去重后当单一来源;⑤把 “Unknown” 转归悄悄并进"Cured"(26 例,8%);⑥用 CT2hospitalID 837 行直接当 836 扫描的对账基准(先查差异行);⑦把中文诊断字段当 ICD 用(无编码,需 NLP 映射);⑧假定层厚统一(未披露,需重采样);⑨把 ExamReport 报告术语当影像金标准(是弱标签);⑩引用时间窗只写 2012-2022 或只写 2019-2022(双口径需同时披露)。
§5.8 可复现包模板
按 DUA"发布代码"义务,建议仓库结构:README(环境+数据声明:不含数据、含 MD5 校验说明);configs/(任务、划分种子、标签处理规则);src/(ingest:MD5+装载+对账;features:day-level 宽表;vision:重采样+窗宽窗位+mask;nlp:词典/模型;models:训练评测);notebooks/(对账报告、覆盖图、复现论文 Table 1);results/(CI 输出)。从申请数据当天就按此结构开工,发表时零返工。
§5.9 教学场景的最小实验设计
一节课(90 分钟)三步走:①装载 3 张表(PtAdmiTable/VitalSign/Lab_dictionary),统计 337 住院的年龄分箱分布并复现论文 Table 1(练习对账);②读一个 NIfTI(nibabel 三视图),观察肺窗渲染(练习影像基础);③用 ChiefComplain 双语对做一次词对齐观察(练习中文医疗文本)。素材小、风险低、覆盖三模态,适合本科高年级或研究生第一课。全程无需下载数据的场合可用论文 Fig.1 + Table 1/2 截图替代演示。
§5.10 与 492/497/498 构成的"脓毒症四重奏"
本系列已覆盖的脓毒症相关资源形成完整光谱:492 MIMIC-IV(重症表格全谱系,国际金标准)、497 Health Gym 合成集(免合规的 RL/生成模型练手场)、498 中文危重症表格库(同院前作)、500 本集(中文脓毒症影像+表格)。组合拳示例:在 492 上开发脓毒症预测模型 → 498/500 上验证跨语言跨中心迁移 → 497 上做无需合规的数据增强实验。这条路线图可直接写进课程设计或团队技术路线。
§5.11 R 语言路径(论文点名的 RNifti)
论文明确点名 RNifti 包操纵 CT,团队本身是 R 重度用户(张忠辉团队的论文多配 R 代码)。R 路线:RNifti::readNifti 读体数据 → imager/orthographic 三视图 → data.table 装载 CSV(2,251,285 行的护理表用 fread 秒级)→ survminer 做住院天数曲线。Python/R 混编也常见:影像侧 Python(nibabel+pyradiomics)、表格侧 R(tidyverse),以 Parquet/CSV 为交换格式。选型建议: radiomics 与深度学习走 Python;统计推断与出图走 R——与本团队的技术习惯对齐还有助于读他们的后续论文与代码。
§5.12 版本兼容与迁移预案
若官方发布 v1.1+:①MD5 清单先 diff,行数变化定位到表;②patient_SN/Hospital_ID 若保持稳定,旧宽表可增量更新;③若新增 DICOM 或标注,影像管线需重排(标注优先于重采样入包);④所有断言(§3.13 对账清单)改成参数化脚本,版本号作为断言输入。冻结 v1.0.0 的研究(论文在投/已发)不受影响——版本升级不追溯,但引用时要锁定版本号 1.0.0。
§5.13 一页纸执行摘要(给决策者的速览)
这是什么:浙江省人民医院急诊 ICU 的 337 例 Sepsis-3 脓毒症住院,配 836 次胸部 CT(NIfTI)+ 14 张临床表格(约 396 万行)+ 6,037 行中文检查报告;PhysioNet Credentialed + OMIX 双存储;Sci Data 2024 有正式数据论文。
获取成本:CITI 培训 + DUA + 数个工作日审批,零费用;国内可走 OMIX 通道免跨境合规。
技术门槛:32GB 内存单机可全量装载;影像侧需要 nibabel/SimpleITK 基础;无官方 pipeline,团队 GitHub 有部分脚本。
最大三个风险:无影像标注(需自建弱标注);层厚/重建核未知(radiomics 需敏感性分析);无官方评测协议(一切基准自建自证)。
最大三个机会:中文脓毒症 CT 的独占生态位;影像-表格-报告三模态配对的完整性;"498 表格库 + 本集影像扩展"的系列协同。
最适合的一句定位:给中文医疗 AI 团队的第一份"影像 × 表格 × 文本"三模态实战沙盘——小而深,方法学的公共试验田。
§6 实证图景:论文数据与社区使用的真实现状
§6.1 论文自证的全部实证内容
与典型的"数据描述 + 基线实验"论文不同,Jin et al. 2024 的实证部分只有数据本体:Table 1(337 住院的人口学与转归统计)、Table 2/3(14 表的 MD5 与 NumObs)、Table 4(CT2hospitalID 字段解释)、Table 5(用例清单)、Fig.1(样本 CT 三视图)。没有模型实验、没有特征基线、没有外部验证。这不是缺陷而是体裁——Sci Data 数据描述论文的规范就是"数据自证"。但使用者要知道:这意味着本集上没有任何已发表的"预期性能"可供对照,你的第一个 baseline 就是社区记录。
§6.2 影像侧的空白清单:研究者机会地图
按机会大小排序:①无任何影像标注——肺野分割 mask、磨玻璃/实变检测、脓毒症肺损伤定量评分(类 CT-SS/RALE)全部空白,做半自动标注 + 主动学习闭环是直接贡献;②CT 与转归的关联——836 次扫描 × 337 住院的院内转归,足够做"入院前基线 CT 特征 → 院内死亡/未愈"的弱预测研究;③影像组学特征稳定性——重建核未知的异质队列上测 PyRadiomics 特征的组内相关,本身就是方法学论文;④报告-影像对齐——ExamReport 的 CT 报告与 CTImage 的弱对齐语料,可做中文放射报告生成的评估集雏形;⑤多模态融合原型——表格 + 影像 + 文本的三模态最小集,论文用例表(Table 5)点名机器学习预测与决策支持。
§6.3 表格侧的可用任务盘点
①院内死亡/未愈预测(三分类,量级 337,只能做浅模型 + 敏感性分析);②住院时长回归(中位 22 天,右偏分布,建议 log 变换);③液体平衡轨迹与转归(NursingChart_IO 98,231 行);④抗生素启动时机与药敏匹配度(Medication + DrugSens 交叉);⑤检验异常模式挖掘(Lab 789,010 行 × 246 项目字典);⑥转科轨迹聚类(HospitalTransfer 277 行,量级只够描述性)。注意全部任务都受"day 粒度 + 单中心"约束,结论表述必须限定语境。
§6.4 NLP 侧的真实语料价值
主诉双语对(728 行 × 中文/英文两列)是现成的领域平行语料,虽然短句、术语密度高,但可支撑"中文医疗短文本翻译评估"的练手;ExamReport 6,037 行报告正文 + PtAdmiTable 的 Med_history/PastHistory 长文本构成中文医疗叙事语料——在"中文放射报告 + 对应影像存在"这个维度上,公开资源屈指可数(对照:MIMIC-CXR 报告是英文;国内 IRIS 类数据集不公开)。做中文报告生成/信息抽取的研究者,本集是"影像可获取"这一稀缺属性的少数供给者。
§6.5 与论文自引用网络的位置
论文参考文献 10 指向 Jin et al. 2023(Sci Data 10:49,即 498),参考文献 11 指向 Sepsis-3 共识,12 指向 NGDC 资源综述,13 指向 PhysioNet 版本页自身。这个引用环显示团队把本集定位为"498 的影像扩展 + 国际标准的本地实现"。截止核查日(2026-09),尚未检索到以本集为对象的同行评审后续研究(论文发表不足两年、Credentialed 访问门槛、无官方基准都抑制了快速采用)——使用本集发表的工作将享有"首发者优势",同时也承担方法自证的完全责任。
§6.6 团队生态的持续产出
张忠辉团队是中文危重症数据公开化的多产节点:498(2023 表格库)、本集(2024 影像扩展)、Zigong 第四人民医院感染 ICU 库(2022,四川协作)、以及 CMAISE 脓毒症多组学联盟的系列论文(单细胞/蛋白组学 + 临床)。对使用者的含义:表结构约定、ID 体系、双语策略在团队作品间高度一致,学会一套可复用到多个集;但团队风格也意味着共同的盲区(评测协议薄弱、术语标准缺位),使用时需补位。
§6.7 量级的诚实定位
把本集放回同类资源的量级光谱:MIMIC-CXR 377,000+ 影像 / 65,000 患者(多疾病胸片);RSNA 脑出血 CT 25,000+ 研究(单任务标注);FastMRI 数千例 MR;本集 836 次 CT / 327 住院 / 单疾病 / 无标注——量级在 CT 类公开资源中属于"迷你"。它的价值不在规模而在三件事:影像与临床表格的配对深度、中文报告语料的稀缺性、以及 Sepsis-3 标准化队列的概念纯净度。夸大宣传它的规模或当作通用 CT 预训练语料是误用。
§6.8 八个坑点(使用前必读)
坑点 1:层厚/重建核未知。 DICOM 头未随 NIfTI 交付,radiomics 特征的稳定性无从官方验证——重采样 + 敏感性分析自保。
坑点 2:双时间窗口径。 2012-2022(Data Records/版本页)vs 2019-2022(Methods)并存,引用与检索必须双口径声明。
坑点 3:转归三分粗口径。 Cured/Not cured/Unknown 不等于存活/死亡/失访,"未愈"含死亡但边界靠 DESC 文本推断,26 例 Unknown 需显式处理。
坑点 4:五数字纠缠。 728/337/327/836/837 分别是 visits/住院/有 CT 住院/CT 扫描/映射行数,每个数字口径不同,写论文前对一遍 §3.2 表。
坑点 5:诊断无编码。 Diagnosis 8,459 行为中文文本,无 ICD 映射,跨库对比前先做术语归一。
坑点 6:SOFA 无时序。 Sepsis-3 纳入用了 SOFA,但 SOFA 计算的输入序列未公开交付,复现纳入决策不可能——把纳入当黑盒接受。
坑点 7:门诊 CT 的负偏移。 CTexame_DateTime 为负属正常(入院前门诊检查),不要当数据错误清洗掉。
坑点 8:版本页误引。 Kehl et al. Nat Commun 2024 与本集无关,引用链以 Jin et al. Sci Data 2024 为准,别让审稿人抓住。
§6.9 自查清单(投稿前逐项打勾)
- [ ] 队列口径写清:728 visits / 337 admissions / 327 with CT / 836 scans
- [ ] 时间窗双口径披露(2012-2022 版本页 vs 2019-2022 论文 Methods)
- [ ] 引用三层齐全(版本页 + Sci Data 论文 + PhysioNet 平台引文),未误引 Kehl
- [ ] 划分按 patient_SN,种子已公开
- [ ] Unknown 转归的处理方案 + 敏感性分析
- [ ] 影像预处理(重采样参数、窗宽窗位、mask 来源)全部报告
- [ ] 中文长文本未被我方翻译污染(LLM 处理位置合规)
- [ ] DUA 三条款自查:无重识别、代码仓库公开、未二次分发数据
- [ ] OMIX005655 与 PhysioNet 双来源声明(如用了 OMIX 副本)
- [ ] 层厚异质性的限制声明
§6.10 口径诊断树
问:你的研究需要什么?→ 若要大样本影像监督信号:本集无标注,转 MIMIC-CXR/RSNA;→ 若要脓毒症影像 + 临床配对:本集适合,先确认 327 有 CT 住院的转归分布够不够统计功效;→ 若要中文报告 NLP:ExamReport 可用,确认你接受 Hospital_ID 级弱对齐;→ 若要时序精细建模(小时级):本集 day 粒度不够,转 492 MIMIC-IV 或 2019 Challenge;→ 若要跨中心验证:本集单中心,作训练/原型,验证转 eICU/HiRID;→ 若要免合规教学:Credentialed 门槛高,转 497 合成集。
§6.11 静态 × 活跃度定位
静态属性:v1.0.0 冻结、无更新路线图、无资助信息公开——资源活跃度存疑。活跃属性:团队持续产出(2022/2023/2024 连续三年发布)、共享代码库存在、PhysioNet/OMIX 双平台在线。综合判断:这是一份"稳定但不生长"的资源,适合当作固定底座做研究,不适合期待补丁或扩展。若团队后续发布 v1.1(如补 DICOM 或标注),迁移成本可控(ID 体系稳定的前提)。
§6.12 横向定位:脓毒症影像资源的稀缺性论证
公开的"脓毒症 × CT"资源目前近乎只有本集。其他脓毒症资源要么无影像(498、Zigong、2019 Challenge、Health Gym),要么影像非 CT(MIMIC-CXR 胸片、eICU 影像缺失),要么不公开(各院 PACS)。本集的稀缺性溢价是真实的;但稀缺不等于成熟——恰恰因为独一份,它的方法学瑕疵(层厚未知、无标注)没有同类资源可交叉校验,使用者的自证义务更重。
§6.13 竞品逐项对照表(脓毒症与胸 CT 相关公开资源)
| 维度 | 本集 | MIMIC-CXR | 2019 Challenge | 498 中文危重症库 | 497 Health Gym |
|---|---|---|---|---|---|
| 模态 | CT + 表格 + 文本 | 胸片 + 表格 + 报告 | 时序表格 | 纯表格 | 合成时序 |
| 疾病聚焦 | 脓毒症(Sepsis-3) | 全病种胸片 | 脓毒症时窗 | 全谱系危重症 | 脓毒症/低血压(合成) |
| 规模 | 836 CT / 337 住院 | 37.7 万影像 / 6.5 万患者 | 4 万 ICU stay | 院内 ICU 全量 | 2 套合成库 |
| 语言 | 中文为主 + 短文本英译 | 英文 | 英文 | 中文为主 | 英文(合成) |
| 标注 | 无 | 病灶标签(CheXpert 式)+ 报告 | 脓毒症 onset 标签 | 无 | 合成标签 |
| 访问 | Credentialed + DUA | Credentialed + DUA | Open | Credentialed | Credentialed |
| 时序粒度 | 天 | 天(检查级) | 小时 | 天 | 分钟(合成) |
| 评测协议 | 无 | 竞赛惯例基线 | 官方挑战赛框架 | 无 | 官方 RL 基线 |
| 适合 | 中文多模态方法学首发 | 大样本影像监督 | 时序预测对标 | 中文 EHR 建模 | 免合规练手 |
结论:本集在"脓毒症 × CT × 中文"三维交集上无直接竞品;所有相邻资源都在至少一个维度上让步。使用者的选型问题因此转化为"你最不能让步的是哪个维度"。
§6.14 十问十答:批判视角的自查
- 836 张 CT 能支撑深度学习吗? 预训练-微调可以,从头训练不行;论文用例表说的"机器学习算法开发"应理解为浅层模型与微调范式。
- 单中心数据有什么不可替代的价值? 表结构同质、文本风格一致、流程可控——恰恰是方法学开发(而非结论外推)最需要的属性。
- 无标注是致命伤吗? 对监督学习是门槛,对弱监督/半监督/基础模型评测是空白机会——标注空白的另一面是首发权。
- 天级粒度丢掉了什么? 脓毒症恶化的小时级动态、抗生素 1h bundle 的执行精度、ICU 峰值事件的精确时点——这些研究请转 MIMIC-IV/2019 Challenge。
- 中文语料是壁垒还是资产? 对国际用户是壁垒(需自带翻译管线),对中文 AI 生态是稀缺资产(影像可对齐的中文报告几乎独一份)。
- 为什么相信 Sepsis-3 被正确执行? 不能完全相信——SOFA 输入未交付,纳入是黑盒;缓解手段是用 Desc 文本抽样反查纳入合理性并在论文声明局限。
- Unknown 26 例会毁掉结论吗? 会污染比例估计但不会毁掉方法学演示;主分析剔除 + 敏感性分析计入是标准操作。
- 层厚未知对 radiomics 意味着什么? 特征间可比性存疑、跨集不可比;稳妥路线是把"层厚未知条件下的特征稳定性"本身作为研究对象(§7.15 提案一)。
- 为什么不保留 DICOM? 官方未解释;可推测是为减小体量与规避烧录 PHI 复查成本。使用者可在限制节要求社区关注此缺口。
- 本集五年后还重要吗? 取决于中文医疗 AI 的数据主权需求走向——若国内多模态语料需求持续增长,"唯一公开中文脓毒症 CT"的地位短期无替代者。
§6.15 增量策略:小数据上做大科学的四条路径
路径一(深度换广度):不追求全队列普查结论,而是在 327 例有 CT 的住院内做窄而深的机制研究——如"入院前 CT 定量的肌肉减少症指标与 ICU 停留时长的关联",样本虽小但机制假设明确,效应量可检测。路径二(方法换数据):把本集定位为"方法学的公共试验田"——弱标注精度评估、跨语言术语映射、多模态对齐协议等方法学产出不依赖大样本,337 例足够支撑方法比较实验。路径三(聚合换规模):与 498/495/Zigong 等同生态数据集做统计层聚合(不链接个体),用元分析式方法把有效样本量放大,代价是要处理集间异质性。路径四(时间换证据):接受 v1.0.0 冻结的现实,把本集当作"预注册式"研究的固定底座——现在设计、公开协议、五年后引用,冻结性反而成为可复现性的卖点。
§6.16 与"数据集老龄化"的对峙
一个 2024 年发布、2026 年仍无社区研究的数据集,必然面对"老龄化质疑":数据是否过时?本集的三个缓冲因素:其一,脓毒症的临床定义(Sepsis-3)与影像学基础在 2016-2026 十年间稳定,不存在 COVID-CT 式的定义漂移;其二,中文医疗文本的语言生态变化慢于英文,2026 年的中文报告与 2022 年的写法差异有限;其三,单中心数据的"时代标本"价值随时间上升而非下降——11 年(或 4 年)窗口内的诊疗习惯演变本身就是回顾性研究对象。真正的风险不是过时,而是"无人问津":如果 2027 年前仍无公开研究,它的引用网络将单薄到影响学术认可。这个风险的正解不在数据集本身,而在社区——包括本百科条目在内的"使用指南"类产出,本质是在降低采用门槛。
§7 AI 实践指南:从喂法到发表
§7.1 五种喂法总览
①影像分类微调(CT 基础模型 + 少样本,337 住院量级);②多模态融合原型(表格宽表 + 影像嵌入 + 报告文本三分支);③弱监督标注工厂(词典/LLM 从 ExamReport 抽病灶标签,回填影像训练);④中文医疗 NLP(报告信息抽取、主诉翻译对齐);⑤教学演示(三模态全流程最小实验)。每种喂法的具体配方见后续小节。
§7.2 30 分钟最小实验
目标:从零到"一份脓毒症 CT 的三视图 + 表格画像"。步骤:nibabel 读一个 .nii.gz → matplotlib 三视图渲染(肺窗)→ pandas 读 PtAdmiTable 滤出该 Hospital_ID 的行 → 打印转归/主诉/住院天数。产出一张"患者卡片"。这个实验验证你的装载链路完好,也是 DUA 合规的本地分析起点。
§7.3 泄漏防控专项
本集的泄漏面:①patient_SN 级泄漏(一人多 visit,划分必须按 patient_SN);②时间泄漏(day 粒度下"当日事件"在预测时点边界模糊——统一规则:预测当日转归时排除当日 24h 内事件或全部纳入并声明);③标签泄漏(DiagnosisOnDeath/StatusOnDischarge_DESC 文本里可能含预后信息,特征工程时禁用转归附近字段);④中心泄漏(单中心集上训练的模型评估必须只报内部指标,别暗示外推性能)。
§7.4 公平性与偏差清单
性别:男 69.4%,模型对女性亚组性能需单独报告;年龄:分箱后 60 岁以上 75%,儿童仅 2 例——儿童结论一律禁止;门诊 vs 住院:728 visits 中门诊 391 例,门诊患者字段稀疏,混训需子群标记;影像可得性:10 例住院无 CT,原因未知——"有 CT"本身可能关联病情选择,可用逆概率加权做敏感性检验。
§7.5 LLM 实验配方
三条合规路线:①境内部署开源模型(Qwen/GLM 系列)做 ExamReport 的病灶信息抽取,输出结构化 JSON——推荐主路线,规避数据出境问题;②主诉双语对做翻译评估基准(零样本 vs 微调小模型);③Med_history 长文本做检索增强问答原型(检索本地化、生成境内部署)。提示词工程要点:报告文本含 “****” 日期脱敏与少量缺字,提示词里声明这些为脱敏产物避免模型误判。严禁把原始数据上传境外 API(DUA"不分享"条款的最严格解读)。
§7.6 弱监督级联配方(填补无标注空白的正路)
第一级:构建中文放射术语词典(磨玻璃影、实变、胸腔积液、纤维条索、结节、钙化…约 50 词级)从 6,037 行 ExamReport 匹配出"报告级弱标签";第二级:Hospital_ID + 时间最近邻把报告标签挂到 CT 文件(标注近似率与误挂率抽检 100 例);第三级:弱标签预训练 + 200 例人工精标的验证集(只做验证不做训练)测弱标签精度;第四级:报告精度达标(如 P≥0.8)后再上影像弱监督训练。整套流程的精度账本全部公开——弱监督的价值取决于诚实度量。
§7.7 多模态融合原型架构
最小可行三分支:表格分支(day-level 宽表 → MLP/TabTransformer)+ 影像分支(CT 基础模型如 MedicalNet/CT-CLIP 类预训练 encoder → 池化)+ 文本分支(中文 BERT 对主诉/报告编码)→ 晚融合拼接 → 三分类转归头。337 例的量级决定:各分支先在各自模态上预训练/外源权重初始化,融合层参数 <10% 总量,五折 CV + 按患者分层。这个原型在论文 Table 5 的"机器学习预测"用例上是合规且现实的贡献。
§7.8 成本核算
数据获取:CITI 课程 2-4 小时 + 审批数工作日(免费);装载:1 人日;特征工程基线:3-5 人日;影像预处理(836 体):单 GPU 0.5 天;弱标注工厂:词典版 2 人日,LLM 版 +1 GPU 周;人工精标 200 例:放射科医生 2-3 天(需要合作临床团队)。总启动成本约 2-3 人月——比申请自建队列便宜两个数量级,这是"小而深"资源对单中心的真正卖点。
§7.9 负结果也有价值
预期中的负结果:337 例上深度网络的融合模型可能不敌 XGBoost 表格基线(样本量瓶颈);弱标签精度可能在报告-影像时间错配上折损;day 粒度时序特征可能丢失脓毒症恶化的小时级信号。这些负结果发表时把"为什么输"讲清楚(量级/粒度/错配),对本生态后来者是避坑地图,比硬凑的正结果更有引用价值。
§7.10 与 492 MIMIC-IV 的跨库迁移实验
方案:在 492 上训练脓毒症相关模型(如 SOFA 恶化预测),把特征空间约束到本集也有的字段(vitals/labs/用药),迁移到本集 day-level 宽表测性能衰减——这是"跨语言跨体系迁移"的公开实验台。障碍清单提前打:诊断无 ICD(映射层)、检验无 LOINC(建 246 项人工映射)、时间粒度天 vs 小时(聚合降级)。产出:一份公开的"中英危重症术语映射表"本身就是社区贡献。
§7.11 特征工程专属技巧
①Age_cut 保持分箱编码(别插值回连续年龄——分箱是隐私承诺,插值是变相重识别);②Med_history 长文本先抽"既往史关键词"(高血压/糖尿病/冠心病/COPD…)成布尔特征,比整段 embedding 稳;③抗生素首剂时间相对入院日的偏移是脓毒症指南敏感指标(1h bundle);④NursingChart_IO 的出入量差值按日累计,前 3 天累计正平衡是 AKI/预后的经典特征;⑤CTexame_DateTime 的符号与绝对值本身就是特征(入院前 CT = 门诊来源 = 病情阶段不同)。
§7.12 教学化改造
把本集做成两周课程:第 1 周表格(装载/对账/宽表/基线模型),第 2 周影像与文本(NIfTI 渲染/弱标注/三模态拼装)。考核题示例:“用 ≤5 个特征预测院内转归,报告 Unknown 处理方案与性别分层性能”。课程包(不含数据、含装载脚本与 MD5 说明)符合 DUA——学生各自申请访问。
§7.13 监控与回归防护
若在本集上部署迭代(如院内 demo):①冻结 v1.0.0 校验集(MD5 锁定)作回归基准;②每次特征/模型变更跑固定报告(划分、指标、分层);③弱标签管线加"词典版本号",术语表变更即触发全量重抽;④所有 artifact 带版本号入库。单中心冻结数据上的"部署"更多是教学演练,但工程习惯从第一行代码养成。
§7.14 复现工程的推荐工具链
DVC 或 git-lfs 管理 MD5 清单与中间产物的版本对应;snakemake/airflow 编排 ingest→features→models;pytest 固化对账断言(728/337/327/836/837 五数字断言、表间 Hospital_ID 覆盖断言);papermill 参数化 notebook 复现论文 Table 1。DUA 要求的"随论文发布代码"按这个标准交付,审稿与传播都受益。
§7.15 三条可发表的具体提案
提案一(方法学):异质重建核未知条件下的胸 CT radiomics 特征稳定性评估——在本集 836 体上测 IBSI 特征的重复性,产出"无 DICOM 元数据时代 radiomics 可行性"的实证边界。提案二(临床 AI):入院前基线 CT 影像组学 + 24 小时表格特征的多模态院内转归预测,337 例五折,报告性别/年龄分层与 Unknown 敏感性。提案三(NLP):中文放射报告弱标注工厂的全流程精度账本(词典 vs LLM vs 人工三层对照),副产品是公开的中文胸 CT 报告术语表。三条都是本集"独一份属性"能支撑的增量。
§7.16 特征字典:从原始字段到模型特征的映射建议
| 原始字段 | 建议特征 | 注意事项 |
|---|---|---|
| Age_cut | 九档序数编码或 one-hot | 禁止插值回连续年龄 |
| Sex | 二元 | 报告性别分层性能 |
| DaysHospitalStay | 目标泄漏字段,仅作标签侧使用 | 不得入特征 |
| VitalSign(四类) | 日级 min/max/mean/last/斜率 | 两表来源分开统计 |
| NursingChart_IO | 日入量、日出量、累计净平衡(前 72h) | 单位归并先于求和 |
| Lab(246 项) | 高频项日级 latest + 24h delta | 文本截断值编码规则显式化 |
| Medication | 首剂抗生素偏移日、日用药种类数 | 中文药名映射表需版本管理 |
| DrugSens | 耐药表型布尔(如耐甲氧西林) | 按培养事件聚合防行数膨胀 |
| MicrobiologyCulture | 阳性培养计数、首次阳性偏移日 | 阴性培养也是信息 |
| HospitalTransfer | EICU 停留天数、转科次数 | EICU 命名两条目都要匹配 |
| CTexame_DateTime | 首次 CT 偏移日、CT 次数、入院前 CT 布尔 | 负偏移是特征不是噪声 |
| ChiefComplain_Eng | TF-IDF 或词嵌入 | 双语对可先做翻译质量抽查 |
| ExamReport | 病灶词典命中向量 | 弱标签属性永久保留 |
| Diagnosis(中文) | 词典归类(感染灶部位等) | 无 ICD,映射表公开 |
这份字典的设计原则:所有特征都可从公开表格推导、不引入外部个体数据、每个特征可追溯到原始字段——满足 DUA 的可复现义务与审稿的证据链要求。
§7.17 审稿应对话术预置
- “样本量太小” → 回应:本集定位为方法学原型与弱标注工厂验证,效应量估计配合 bootstrap CI;规模局限在限制节首条声明,并给出同规模已发表工作的先例。
- “单中心” → 回应:以跨中心验证为明确 future work,引用 2023 Intensive Care Med 疾病轴论文论证单中心复现性难题的行业共识;不外推结论。
- “无影像标注,弱标签不可信” → 回应:弱标签全流程精度账本公开(词典 → 挂接 → 抽检),验证集独立于训练,弱标签仅用于预训练阶段。
- “时间窗口径混乱” → 回应:双口径(2012-2022 版本页 / 2019-2022 Methods)如实披露,分析按 EICU 纳入期口径为主、全窗口径做敏感性。
- “转归标签粗糙” → 回应:三分类 + Unknown 显式处理 + DESC 文本细化的次级标签做敏感性;不声称死亡率精度。
- “为什么不用 MIMIC?” → 回应:研究问题需要中文语境与影像-表格-报告三模态配对,MIMIC 系无对应组合;已做 MIMIC 侧的概念对照(§4.7)。
§7.18 部署差距清单:从 notebook 到病房的距离
若目标不止论文而是院内工具,差距清单如下:①时间粒度——day 级训练的模型到院内部署时拿不到"日终汇总",需要重定义预测时点并重新验证;②数据位置——DUA 数据不能上院内生产系统,只能迁移方法与模型权重(需成员推断风险测试);③术语漂移——院内 LIS/护理系统的项目名与本集 246 项字典不同,映射表是部署资产的一部分;④无前瞻验证——337 例历史数据的任何 AUC 都不构成前瞻性能承诺,部署前需院内影子模式试运行;⑤审批路径——临床决策支持工具按院内医疗器械/软件管理流程走,与本集的科研许可互不相干。诚实地说:本集训练的任何模型距离病房都还有完整的一个验证阶梯,把它定位为"方法学证据源"比"可部署模型源"更符合现实。
§7.19 成本-收益核算:值不值得把 2-3 人月投在这里
投入侧(§7.8 的明细):申请与合规 1 周、装载与对账 1 周、特征工程与基线 2-3 周、影像管线 1-2 周、弱标注工厂 2-4 周——总计 2-3 人月,一台 32GB 工作站,零数据费。收益侧的三种情景:情景 A(方法学论文):弱标注精度账本 + 多模态融合原型,投 Medical Image Analysis 级别的影像方法刊或 JAMIA 级别的信息学刊,首发者优势明显;情景 B(教学资产):两周课程 + 课程包,收益是教学影响力与学生管线经验,间接回馈科研招聘;情景 C(预研投资):为团队后续申请自建队列或多中心项目积累"我们已经在中国公开数据上验证过管线"的证据。三种情景的期望收益都明显高于 2-3 人月的机会成本,唯一不划算的用法是"只下载不分析"——Credentialed 义务下这也是合规负担而非资产。
§8 伦理与合规:Credentialed 通道的完整义务
§8.1 双平台合规的叠加义务
PhysioNet DUA 三条款(不重识别/发布代码/不分享)+ OMIX 受控协议(境内合规申请、用途声明)构成叠加义务。实操要点:两份协议独立生效——从 PhysioNet 下载的副本按 PhysioNet 规则管,从 OMIX 申请的副本按 NGDC 规则管,不得互相转移副本。团队成员变更时新成员需各自完成培训与申请,不能"共享账号"。
§8.2 去标识的残余风险认知
HIPAA 标准去标识已做:随机 ID、年龄分箱、日期相对化、文本脱敏、医护 ID 删除。残余风险仍在:①11 年单中心 + 罕见病亚组(如 (0,18] 年龄档仅 2 例)的组合可能具备准标识性;②Med_history/ExamReport 长文本可能含家庭住址碎片(作者声明地名已删,但自由文本的穷尽性无保证);③影像烧录字符已按"CT 不含 PHI"声明处理,但使用者如发现残留烧录信息应停止使用并报告平台。任何疑似重识别发现的第一动作是停止分析、报告 PhysioNet/OMIX,而不是继续挖掘。
§8.3 LLM 时代的数据位置合规
"不分享数据"条款在 API 时代的解读:把原始文本发送给第三方云端 LLM(无论是否承诺不留存)在多数解读下构成数据向第三方披露。本系列(495 PhysioNet LLM 政策、498)已建立的一致口径:境内部署的开源模型是安全路线;境外 API 需法务书面确认;云端 API 的"零留存"承诺不自动等于合规。论文发表时的语言模型使用声明应写明模型名称、部署位置、是否接触原始文本。
§8.4 引用伦理与误引纠正
社区有义务主动纠正版本页的 Kehl 误引:凡使用本集的论文,引用块写 Jin et al. Sci Data 2024(DOI 10.1038/s41597-024-04132-z),不写 Kehl;审稿中遇到同行误引 Kehl 应友好指出。这既是对数据作者的致谢,也避免文献计量把本集的引用算到无关论文头上。
§8.5 二次发布与衍生数据集
DUA"不分享"意味着:不可把表格子集/影像切片/弱标注连同数据本身再分发。合法的共享形式:代码、术语映射表、不含原始数据的聚合统计、模型权重(需评估模型反演残余风险——337 例小数据上过拟合的模型有记忆风险,发布前做成员推断测试或提供差分隐私声明)。这与本系列 493/494 讨论过的"标签工厂产出可共享、源数据不可共享"的原则一致。
§8.6 同门数据集的合规协议对照
把本系列已覆盖的中国危重症系数据集合规要点并排:
| 项 | 495 PIC(ZUCH) | 498 中文危重症库(ZPPh) | 500 本集(ZPPh) |
|---|---|---|---|
| 平台 | PhysioNet | PhysioNet | PhysioNet + OMIX |
| 访问 | Credentialed | Credentialed | Credentialed + Controlled |
| 培训 | CITI 或中国 GCP | CITI | CITI |
| 去标识 | 日期平移 50-100 年 | 随机 ID + 相对日期 | 随机 ID + 分箱 + 相对日期 |
| 特殊条款 | 零留存 LLM 建议本地部署 | 发布代码义务 | 不重识别 + 发布代码 + 不分享 |
| 伦理主体 | ZUCH 伦理委员会 | ZPPh 伦理委员会 | ZPPh 伦理委员会(2023-397) |
三个集的共同点:都是"机构伦理 + 平台 DUA"双层结构,都把可复现性义务写进协议(495 的数据发布授权、498/500 的代码发布义务)。差异点集中在去标识策略(495 的日期平移 vs 498/500 的相对日期)与双通道(仅本集有 OMIX)。跨集研究的合规基线:分别满足各自协议,义务取并集;其中"发布代码"义务覆盖所有用到 498/500 的工作。
§9 FAQ:60 问快答
§9.1 身份与获取(Q1-Q12)
Q1:官方 slug 是什么? A:chest-ct-sepsis-er,PhysioNet URL 路径 https://physionet.org/content/chest-ct-sepsis-er/1.0.0/。
Q2:DOI 是什么? A:数据 DOI 10.13026/zne5-qh18;论文 DOI 10.1038/s41597-024-04132-z。
Q3:论文标题为什么和版本页不一样? A:版本页用 Emergency Department,论文用 emergency intensive care unit,指同一数据集;EICU 位于急诊科内。检索时两个标题都要试。
Q4:谁写的? A:版本页署名 Senjun Jin、Zhongheng Zhang;论文署名 7 人(Jin S, Cai W, Shen Q, Yang L, Sheng’an H, Fu J, Zhang Z)。
Q5:什么时候发布的? A:PhysioNet 2024-10-28;论文 2024-11-20 刊出(Sci Data 11:1261)。
Q6:免费吗? A:数据免费但需 Credentialed Access:注册 + CITI 培训 + 签 DUA + 申请审批。OMIX005655 通道对中国研究者免跨境合规。
Q7:数据在哪两个平台? A:PhysioNet 与 NGDC OMIX(OMIX005655,BioProject PRJCA006118),同一份数据双存储。
Q8:下载多大? A:14 张 CSV 数十 MB + 836 个 NIfTI 体数据约 10-40GB,按 50GB 规划存储。
Q9:需要什么培训? A:CITI 人体受试者保护课程(PhysioNet Credentialed 通行要求)。
Q10:DUA 核心条款? A:不试图重识别、随论文发布代码、不与他人分享数据。
Q11:RRID 是什么? A:SCR_007345(与 PhysioNet 全库一致的资源标识)。
Q12:有中文入口吗? A:OMIX(ngdc.cncb.ac.cn)页面为中文界面,提交者信息挂浙江大学。
§9.2 数据内容(Q13-Q28)
Q13:多少数据? A:728 次就诊(含门诊)、337 例住院、327 例住院有 CT、836 次胸部 CT、14 张表约 396 万行。
Q14:为什么 327 < 337? A:10 例住院无 CT,官方未解释(可能影像未归档或仅临床数据保留)。
Q15:CT 是什么格式? A:NIfTI(.nii.gz),SimpleITK v2.2.0 从 DICOM 转换,多序列时取胸部序列。
Q16:有 DICOM 原始文件吗? A:没有,只有 NIfTI,DICOM 技术头(层厚/重建核)未随附。
Q17:有影像标注吗? A:没有任何官方标注(无 mask、无病变标签、无评分)。
Q18:最大的一张表? A:NursingChart_VitalSign 2,251,285 行(占全库 57%)。
Q19:有检验字典吗? A:Lab_dictionary 246 项,无 LOINC 映射。
Q20:微生物数据全吗? A:MicrobiologyCulture 20,661 行 + DrugSens 55,029 行药敏,是本集特色板块。
Q21:有 ICD 编码吗? A:没有,Diagnosis 8,459 行为中文文本。
Q22:报告文本有多少? A:ExamReport 6,037 行(CT/超声/MRI 报告),中文保留。
Q23:主诉有英文吗? A:有,ChiefComplain(中文)+ ChiefComplain_Eng(人工复核英译)构成双语平行。
Q24:Med_history 是什么? A:主表中的大段中文自由文本(现病史/既往史),作者刻意不翻译以保 NLP 保真。
Q25:_24hr 结尾的字段是什么? A:入院 24 小时内出院(或死亡)患者的专用主诉/状态快照,多数住院为空。
Q26:时间戳是什么粒度? A:天。全部时间字段为相对入院日的天数偏移,自由文本内日期以 “****” 替换。
Q27:CT 时间为负数是错的吗? A:不是,负值表示入院前(门诊期)完成的 CT。
Q28:年龄为什么是分箱? A:HIPAA 去标识要求,Age_cut 九档分箱,无法还原连续年龄。
§9.3 队列与临床(Q29-Q40)
Q29:脓毒症怎么定义的? A:Sepsis-3.0(疑似/确诊感染 + SOFA 急性升高 ≥2),对象为 EICU 收治患者。
Q30:能自己复现纳入过程吗? A:不能完整复现——SOFA 计算输入未交付,纳入决策当黑盒接受。
Q31:性别比例? A:女 103 / 男 234(男 69.4%)。
Q32:年龄结构? A:60 岁以上约 75%,(70,80] 档最多 95 例,儿童仅 2 例。
Q33:住院多久? A:中位 22 天(IQR 12-36)。
Q34:转归分布? A:治愈 185(56%)/未愈 121(36%)/未知 26(8%)。
Q35:有院内死亡标签吗? A:无显式死亡字段,死亡信息在 StatusOnDischarge_DESC 与 DiagnosisOnDeath 文本中推断。
Q36:有 SOFA 时序吗? A:没有,需自行用检验/生命体征近似重建并声明。
Q37:数据时间窗到底几年? A:双口径:版本页与论文 Data Records 写 2012-2022,论文 Methods 写 2019-2022(EICU 纳入期)——引用时双口径披露。
Q38:医院是哪家? A:浙江省人民医院(杭州医学院附属人民医院),通讯作者张忠辉隶属浙大邵逸夫医院。
Q39:伦理批号? A:浙江省人民医院伦理委员会 2023-397,知情同意豁免(回顾性)。
Q40:与 498 是同一批患者吗? A:同院同管线,患者可能重叠,但 DUA 禁止跨集个体链接,只能统计层对照。
§9.4 使用方法(Q41-Q52)
Q41:怎么把 CT 和临床表连起来? A:CT 文件名 serialID → CT2hospitalID → Hospital_ID → 任意表。
Q42:推荐的装载环境? A:32GB 内存单机 + Python(nibabel/pandas)+ SQLite/PostgreSQL 即可全量装载。
Q43:划分怎么做? A:按 patient_SN 分层划分,绝不按行。
Q44:两套生命体征表怎么用? A:VitalSign 与 NursingChart_VitalSign 来源不同(监护 vs 护理录入),并行使用并标注来源,勿合并去重。
Q45:影像预处理第一步? A:重采样到统一 spacing——层厚异质性未知,重采样是公平比较前提。
Q46:能做 radiomics 吗? A:能但有限制:重建核未知,PyRadiomics 特征稳定性需敏感性分析,论文需声明。
Q47:能从头训练 CNN 吗? A:不现实(337 例),用预训练 encoder + 微调。
Q48:怎么生成影像弱标签? A:从 ExamReport 中文报告做术语词典匹配 → 时间最近邻挂接到 CT → 人工抽检验证精度。
Q49:能用 ChatGPT/GPT-4 处理报告文本吗? A:不建议——境外 API 与 DUA"不分享"条款冲突,用境内部署开源模型。
Q50:需要翻译中文长文本吗? A:研究者自理;作者只译了元数据与短文本,长文本刻意保留中文。
Q51:有官方代码吗? A:团队仓库 github.com/zh-zhang1984/ZhejiangProvinceICU(与 498 共享),无官方 pipeline 承诺。
Q52:MD5 怎么用? A:论文 Table 2/3 给了 14 表哈希,下载后 md5sum 校验完整性。
§9.5 对比与选择(Q53-Q60)
Q53:和 MIMIC-CXR 比选哪个? A:要大样本胸片+英文报告选 MIMIC-CXR;要脓毒症 CT+中文表格报告配对选本集。
Q54:和 492 MIMIC-IV 呢? A:精细时序(小时级)与标准化术语选 MIMIC-IV;中文语境与影像配对选本集。
Q55:能和 497 合成集互补吗? A:能——497 免合规练手管线,本集做真实数据验证,构成"合成→真实"梯度。
Q56:想快速跑通流程又不想申请权限? A:本集不合适(Credentialed 门槛),用 497 或公开教学集先练,再申请本集。
Q57:一篇论文只用本集够发吗? A:方法学/弱标注/NLP 贡献够;纯临床结论因单中心+量级小需谨慎定位。
Q58:审稿人会攻什么? A:量级、单中心、无标注、双时间窗口径、转归粗标签——提前在限制节逐条回应。
Q59:数据会更新吗? A:截止 2026-09 仍 v1.0.0,无更新公告;团队 2022-2024 连续产出的历史支持期待,但不可依赖。
Q60:一句话总结? A:中文脓毒症 CT + 临床配对的独一份小样本深表型资源——文档一流、协议自建、合规走 Credentialed,适合方法学首发而不适合刷榜。
§9.6 进阶问答(Q61-Q90)
Q61:CT2hospitalID 多出的那 1 行怎么处理? A:装载后做 serialID 与文件名的集合差,找出差异行(可能为表头残留或重复映射),人工判定后写进对账报告,不要默默丢弃也不要悄悄保留。
Q62:能按 serialID 直接对应检查报告吗? A:不能精确对应——ExamReport 无 serialID 字段,只能 Hospital_ID + 时间偏移最近邻匹配,匹配率与错误率需抽检 100 例量化。
Q63:门诊就诊(391 例)有什么用? A:它们承载了入院前 CT 与门诊检验,是"基线影像"的主要来源;建模时作为独立子群或仅作 CT 来源通道。
Q64:护理表的采样间隔是多少? A:官方未披露统计,建议自行计算每患者采样间隔分布——护理录入的间隔通常与班次相关,直接假设等间隔会错。
Q65:检验截断值怎么编码? A:“>1000” 编码为 1000 + 布尔截断位,“<0.03” 编码为 0 + 布尔位——保留"超过测量范围"的信息,规则写进方法节。
Q66:能重算 SOFA 吗? A:可近似(氧合、血小板、胆红素、肌酐、GCS 映射到可得字段),但缺血压/机械通气细节,近似 SOFA 与真实 SOFA 的差异必须声明。
Q67:脓毒症休克亚组能识别吗? A:粗略可以——升压药使用(Medication 药名词典)+ 乳酸(Lab)组合,但无血管剂量的精确时序,休克定义只能是简化版,需声明偏离 Sepsis-3 休克标准。
Q68:CT 只有一次的患者占多少? A:官方未给分布,自行统计 836/327 的每住院 CT 数直方图;单次 CT 的患者无法做"肺损伤演变"类研究,需在分母上过滤。
Q69:能做 28 天死亡终点吗? A:不能——出院后无随访死亡日期字段;只能院内转归。这一点与 MIMIC 的差距无法在本集内弥补。
Q70:微生物阴性培养怎么用? A:阴性培养是"未检出"不是"无感染",特征化时区分"培养阴性"“未培养”"培养阳性"三态,比二元化保留更多信息。
Q71:转科表能重建完整住院轨迹吗? A:只能重建转科事件间的区间,无法覆盖科室内部的时段归属细节;轨迹图的粒度以转科事件为节点。
Q72:主诉的英译质量如何? A:百度学术翻译初译 + 两作者人工复核,质量应是"可读可靠"级;抽样 50 对做回译一致性检查可以量化,不要假设完美。
Q73:诊断文本怎么归类到感染灶? A:建中文感染灶词典(肺/腹/尿/血/皮肤软组织/中枢…),Diagnosis 8,459 行匹配后人工校验;这是"脓毒症异质性分层"的地基,也是可发表的副产品。
Q74:影像窗宽窗位怎么选? A:肺窗 W1500/L-600、纵隔窗 W350/L50 双渲染并存;官方未给扫描用途(平扫/增强)分布,增强扫描的纵隔窗解读需谨慎。
Q75:NIfTI 的方向(orientation)统一吗? A:官方未声明;装载时用 nibabel 检查 affine 矩阵,统一重定向到 RAS 再进模型,否则左右翻转会污染训练。
Q76:能和国内其他公开 CT 集对齐吗? A:概念上可(如公开 COVID-CT 类集合),但无术语/协议映射层,只建议统计层对照,别做池化训练。
Q77:弱标注工厂的最小人力配置? A:1 名熟悉放射术语的标注者(可非医生)+ 1 名放射科医生复核;200 例精标约 2-3 人日;这是"临床合作最小包"。
Q78:训练集里能放门诊 CT 吗? A:可以但需标记来源;门诊 CT 的采集指征与住院 CT 不同(筛查 vs 评估),混训不标记会引入指征偏倚。
Q79:代码仓库里能放数据截图吗? A:谨慎——个别切片截图可能构成数据再分发;安全做法是只放合成示例图或从论文 Fig.1 引用,MD5 断言不涉及像素。
Q80:发表时数据可用性声明怎么写? A:模板:“数据于 PhysioNet(DOI 10.13026/zne5-qh18)与 NGDC OMIX(OMIX005655)受控获取;本研究的处理代码见 [仓库链接];作者已签署 DUA。”
Q81:能做 federated learning 演示吗? A:单集无法演示真联邦;可行的是"本集 vs 498"的两方联邦模拟(同院数据做双方),需在论文明确这是模拟不是真实跨机构。
Q82:Med_history 文本多长? A:官方未给统计;装载后统计长度分布(中位/P90),超长文本考虑截断策略时保留首尾(现病史结构通常首重尾轻)。
Q83:能预测 CT 检查指征吗? A:有趣的小众任务——用 CT 前的表格序列预测"是否开 CT",可做医疗资源利用研究;分母要小心(无 CT 的 10 例住院与门诊混洽)。
Q84:数据里有 COVID 患者吗? A:时间窗(2012-2022 或 2019-2022)覆盖疫情期,诊断文本可检索 COVID 相关词条;若有, pandemic 期的临床习惯偏移需要分层讨论。
Q85:儿童患者(2 例)怎么处理? A:主分析排除或单列说明——脓毒症成人特征工程直接套用到 2 例儿童无统计意义,留下会引入噪声。
Q86:怎么验证我的宽表构建没出错? A:抽 3 个患者手工对照原始行拼出宽表再与脚本输出 diff——三例手工对账是特征工程的黄金标准,一小时能省一周返工。
Q87:模型输出能发医院落地吗? A:不能直接落地——单中心历史数据 + day 粒度 + 无前瞻验证;定位是"方法学证据",落地需院内前瞻数据重训与审批。
Q88:本集做预训练语料合规吗? A:表格/文本在 DUA 内可用于建模;把原始文本放进公开发布的基础模型权重有"不分享"条款的边界风险——发布前做法务评估,或只发布在私有推理接口。
Q89:审稿人要求"开源一切"怎么办? A:代码全开(DUA 本来要求),数据不开(DUA 禁止),提供"一键重跑"脚本从官方源拉数据 + MD5 锁定——这是受控数据开源的标准姿势。
Q90:下一个版本会补什么? A:无官方路线图。社区 wishlist:DICOM 技术头附录、serialID 级报告对齐、检验 LOINC 映射、SOFA 时序交付。若你在用本集,把 wishlist 发给作者比抱怨更有用。
§9.7 番外:来自写作过程的十个冷观察
- 版本页的发布日期(2024-10-28)比论文接收日(11-13)早,比刊出日(11-20)早三周——数据集先行于论文是 Sci Data 生态常态,但版本页把"原始论文"引成 Kehl 说明填表环节缺了人审。
- 论文标题的 “emergency intensive care unit” 与版本页的 “Emergency Department” 并存,暗示写作过程中疾病定位从"急诊科全体"收窄到"EICU",标题没同步。
- 728/337 的双数字结构说明团队有意保留门诊就诊——这在"以住院为中心"的 ICU 数据集传统里是少数派设计,却正好服务了"入院前 CT"叙事。
- OMIX 提交(1 月 14 日)早于论文投稿(1 月 5 日之后四天内)——先存档后投稿的时序符合数据期刊的惯例。
- 14 表里 246 行的 Lab_dictionary 是全库最小的表,却是跨库可用性的关键瓶颈——小表的杠杆率最高。
- EICU 转科注释(“Emergency medical department 即 EICU”)被写进官方文档,说明外国用户曾在这个命名上卡壳过。
- 百度学术翻译服务号被完整披露(MPE2022102608424528825)——中国数据治理文档里罕见的透明度细节。
- 论文用例表(Table 5)把"教学"与"公共卫生政策"并列进 use cases,可见作者对受众面的期待超出影像组学。
- 全库无一张标注 mask,但团队在 498 的结构里已经为"影像扩展"预留了 ExamReport 这样的文本通道——影像的缺席是有意的分期设计。
- 从 498 到 500 的 22 个月里,团队同时维持 Zigong 协作库与 CMAISE 多组学联盟——"一条管线多份产出"的工业模式,在中文医疗数据圈尚属先行。
§9.8 番外:十二个"如果……怎么办"
如果只要影像不要表格? 可以,但 836 个无标注 CT 的独立价值有限;表格恰恰是本集的差异化资产,弃用等于自废武功。
如果只要表格不要影像? 那请直接用 498(同结构、更大样本、全谱系);本集表格的增量只在脓毒症聚焦与 _24hr 列。
如果需要 ICD 编码的诊断? 自建 NLP 映射或找公开的中文诊断术语映射表;Diagnosis 的 8,459 行文本规模适中,一人周可完成粗映射。
如果想要小时级生命体征? 本集是 day 级;请用 492 MIMIC-IV 或 2019 Challenge,或接受本集粒度限制。
如果需要多中心? 单中心;联合 498/Zigong 做统计层聚合,或等待同系列扩展。
如果审稿人质疑弱标签? 出示三级精度账本(词典→挂接→抽检)+ 独立验证集;弱标签只用于预训练的主张要写死。
如果发现数据疑似可重识别? 停止分析,报告 PhysioNet 与 OMIX;这是 DUA 义务不是选择题。
如果需要在论文里放数据截图? 用论文 Fig.1 或合成示例;真实切片截图需评估再分发边界。
如果团队没有放射科医生? 弱标注工厂的精标环节不可省;先找临床合作再立项,否则影像侧只能做无监督方法。
如果 GPU 资源有限? 表格基线(XGBoost)零 GPU;影像微调用单卡 24GB 足够(836 体的量级);LLM 路线选 7B 级境内模型。
如果只是想引用它? 引用三层(版本页 + Sci Data 论文 + PhysioNet 平台文);版本页的 Kehl 是误引,别带上。
如果它五年后出了 v2.0? §5.12 迁移预案适用:MD5 diff → ID 稳定性验证 → 增量更新宽表;冻结 v1.0.0 的已发表论文不受影响。
§10 存照、引文与变更日志
§10.1 存照 A-K(核查期 2026-09-21)
- A. 标题双官方:PhysioNet “Emergency Department” vs 论文 “emergency intensive care unit”;HospitalTransfer 注释确认 EICU 在急诊科内,三名称同一物理单元。
- B. 时间窗双口径:论文 Methods “January 2019 to December 2022”;论文 Data Records 与 PhysioNet 页面 “January 2012 to December 2022”。论文自身并存两口径。
- C. Abstract 计数口误:Abstract “a total of 728 admissions with sepsis”;正文与 PtAdmiTable 728 行均为 visits(含门诊),住院 337。
- D. CT 数字差 1:正文 “836 CT scans for 327 hospital admissions”;CT2hospitalID NumObs 837。
- E. 版本页误引:Additional citation 指向 Kehl et al. Nat Commun 15:9787 (2024)(癌症结局共享 AI),与本集无关;正确数据论文为 Jin et al. Sci Data 11:1261。
- F. 作者数差异:版本页 2 人 vs 论文 7 人。
- G. OMIX 时间线:提交 2024-01-14、发布 2024-08-22,均早于 PhysioNet 上线(2024-10-28)。
- H. 翻译服务号:论文披露百度学术翻译服务编号 MPE2022102608424528825——数据治理颗粒度罕见的细。
- I. 层厚未披露:全文无层厚/重建核/管电压统计;Fig.1 坐标 [250,250,80] 是唯一的体数据尺寸线索。
- J. 无资助条款:论文与版本页均未列资助编号,与 495 的多基金支持形成对照。
- K. 转科表即 ICU 定义:ICU 住留非显式实体,需 HospitalTransfer 的 EICU 科室名推导,277 行转科事件是唯一轨迹素材。
§10.2 引文清单
- Jin S & Zhang Z. Chest Computed Tomography for patients with sepsis in the Emergency Department (version 1.0.0). PhysioNet (2024). DOI 10.13026/zne5-qh18
- Jin S, Cai W, Shen Q, Yang L, Sheng’an H, Fu J, Zhang Z. Chest computed tomography for patients with sepsis in the emergency intensive care unit. Sci Data 11:1261 (2024). DOI 10.1038/s41597-024-04132-z. PMID 39567547. PMCID PMC11579395
- Singer M et al. The Third International Consensus Definitions for Sepsis and Septic Shock (Sepsis-3). JAMA 315:801-810 (2016)
- Jin S et al. Establishment of a Chinese critical care database from electronic healthcare records in a tertiary care medical center. Sci Data 10:49 (2023)(= 本系列 498)
- Pollard T et al. PhysioNet as a global platform for biomedical research. Nature Health (2026). DOI 10.1038/s44360-026-00096-z
- CNCB-NGDC Members and Partners. Database Resources of the National Genomics Data Center. Nucleic Acids Res 52:D18-D32 (2024)
- OMIX005655. NGDC. https://ngdc.cncb.ac.cn/omix/release/OMIX005655
- 团队代码库 https://github.com/zh-zhang1984/ZhejiangProvinceICU
§10.3 系列关系
前置:498(同团队表格库,Sci Data 10:49)为本集的临床表结构母本;497(Health Gym)为脓毒症主题的合成数据对照组;492(MIMIC-IV)为跨库迁移的国际基线。后续若有同系列影像扩展(DICOM 原档、标注版、多中心版),本条目按变更日志增补。
§10.4 变更日志
- 2026-09-21:初版。核查源:PhysioNet 版本页(两轮抓取)、Sci Data 论文全文(Europe PMC XML)、PubMed 记录、OMIX005655 页面、PhysioNet sepsis 主题列表。DAIMS 5.1/8。存照 A-K 共 11 条。
§10.5 阅读地图(本条目内部导航)
- 想 5 分钟了解:INFOBOX + §0 摘要卡
- 想 30 分钟决策"用不用":§1.10 用户画像 + §6.7 量级定位 + §6.10 口径诊断树
- 准备申请数据:§3.7 访问流程 + §8 合规全章
- 开始装载:§3.8 装载手册 + §3.13 对账清单 + §4.12 逐表注记
- 设计研究:§6.2 机会地图 + §7.15 三提案 + §7.16 特征字典
- 写论文:§6.9 自查清单 + §7.17 审稿话术 + §8.4 引用规范
- 教课:§5.9 最小实验 + §7.12 教学化改造
- 被卡住了:§9 FAQ 90 问按主题检索
§10.6 存照 L-M(补充)
- L. 门诊子集的官方说明极简:“i.e. including outpatient visits” 一句话带过 391 例门诊的字段完整度,门诊子集的可用性边界需研究者自行测绘。
- M. 平台引文的年份错位:版本页引用的 PhysioNet 平台论文标注为 2026 年 Nature Health——本条目核查时按版本页原样记录;平台引文以 PhysioNet 官方最新公告为准(对照本系列 495 条目的平台政策叙述)。
§10.7 核心数字一览(写作与引用速查卡)
| 数字 | 口径 | 出处 |
|---|---|---|
| 728 | 就业次数(含门诊) | PtAdmiTable 行数 / Data Records |
| 337 | 住院数(103 女 + 234 男) | Table 1 / 正文 |
| 327 | 有 CT 的住院数 | Data Records |
| 836 | 胸部 CT 扫描次数 | Data Records |
| 837 | CT2hospitalID 表行数 | Table 2 |
| 2,251,285 | NursingChart_VitalSign 行数(最大表) | Table 3 |
| 789,010 | Lab 行数 | Table 2 |
| 505,151 | VitalSign 行数 | Table 3 |
| 6,037 | ExamReport 检查报告行数 | Table 2 |
| 246 | Lab_dictionary 检验项数 | Table 2 |
| 277 | HospitalTransfer 转科事件数 | Table 2 |
| 22 天(IQR 12-36) | 住院天数中位数 | Table 1 |
| 185/121/26 | Cured / Not cured / Unknown | Table 1 |
| 95 | 最多年龄档 (70,80] 例数 | Table 1 |
| v1.0.0 / 2024-10-28 | 版本与发布日 | 版本页 |
| 10.13026/zne5-qh18 | 数据 DOI | 版本页 |
| 10.1038/s41597-024-04132-z | 论文 DOI | Sci Data 11:1261 |
| 2023-397 | 伦理批号 | 论文 Methods |
| OMIX005655 | NGDC 存档号 | OMIX 页面 |
§10.8 官方资源导航与后续观察清单
资源导航
- PhysioNet 版本页:https://physionet.org/content/chest-ct-sepsis-er/1.0.0/
- 数据论文:https://www.nature.com/articles/s41597-024-04132-z(Sci Data 11:1261,PMID 39567547,PMCID PMC11579395)
- OMIX 存档:https://ngdc.cncb.ac.cn/omix/release/OMIX005655(BioProject PRJCA006118)
- 团队代码库:https://github.com/zh-zhang1984/ZhejiangProvinceICU
- Sepsis-3 共识:Singer et al., JAMA 315:801-810 (2016)
- 前作 498:Jin et al., Sci Data 10:49 (2023)
后续观察清单(重访本条目时核对)
- [ ] PhysioNet 版本是否 > 1.0.0(若有:跑 §5.12 迁移预案)
- [ ] 是否出现官方标注或 DICOM 补充包(若有:§6.2 机会地图需重排)
- [ ] 是否出现基于本集的首批同行评审论文(若有:§6.5 "首发者优势"论述需更新)
- [ ] OMIX 侧是否有版本同步公告
- [ ] 版本页的 Kehl 误引是否被平台修正(若有:存照 E 标记为已解决)
- [ ] 同团队是否有第三期产品(多中心或标注版)
本条目为千方病案医数集 Top1000 AI-Ready 医疗数据集百科第 500 号,依据官方一手来源核查撰写;数据以官方平台为准,引用请以 DOI 页面显示的最新版本信息为据。### §9.9 尾注三问
Q91:为什么本条目的 DAIMS 只有 5.1 而 492 MIMIC-IV 更高? A:差距集中在评测协议(0.3)与术语标准化(0.8)两维——MIMIC 系有成熟的官方基准生态与 ICD/LOINC 映射层,本集两者皆缺。这不是质量歧视,是 AI-Ready 就绪度的如实度量:数据本身不缺,缺的是"拿来就能比"的协议层。
Q92:本集与 499 CIED 胸片集哪个更适合分割研究入门? A:入门选 499(有三值掩码金标准 + 官方划分);本集适合已经入门、想做"无标注真实临床场景"进阶的研究者。两者的组合恰好覆盖"有监督入门 → 弱监督进阶"的完整训练路径。
Q93:一条建议总结? A:把它当成一份"真实临床数据的三模态切片标本"而不是一个大样本库——用显微镜的耐心,而不是收割机的规模感。
撰写说明:本条目由千方病案医数集自动化生产流水线生成,事实核查于 2026-09-21 完成,全部一手来源存照于 §10。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- health-data-nexus — 共享标签:医学影像 / 电子健康记录
- pad-ufes-20 — 共享标签:医学影像 / 电子健康记录
- scin — 共享标签:医学影像 / 电子健康记录
- copdgene — 共享标签:医学影像 / 电子健康记录
- oai — 共享标签:医学影像 / 电子健康记录
- cdsl-covid-data-shared-learning — 共享标签:医学影像 / 电子健康记录
- chest-imagenome — 共享标签:医学影像 / 电子健康记录
- rosmap — 共享标签:医学影像 / 电子健康记录
- nifd — 共享标签:医学影像 / 电子健康记录
- inspire — 共享标签:医学影像 / 电子健康记录
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

