脓毒症急诊胸部 CT — Sepsis-3 影像队列 AI-Ready Wikipedia

浙江省人民医院急诊 ICU 的 836 次脓毒症胸部 CT 与 14 张临床表格——把杭州 EHR 管线从纯表格延伸到影像的深表型续章

来源 https://physionet.org/content/chest-ct-sepsis-er/1.0.0/发布时间: 2026-09-21最后更新: 2026-09-25 阅读 25
脓毒症急诊胸部 CT — Sepsis-3 影像队列 AI-Ready Wikipedia

信息速览

数据集名称脓毒症急诊胸部 CT — Sepsis-3 影像队列 AI-Ready Wikipedia
数据类型836 次胸部 CT(NIfTI),337 例 Sepsis-3 住院,14 张 CSV 表约 396 万行,ExamReport 6,037 行中文检查报告,PhysioNet + OMIX 双存储
规模728 次就诊(含门诊)/ 337 例住院(103 女 + 234 男)/ 327 例住院有 CT
接入方式https://physionet.org/content/chest-ct-sepsis-er/1.0.0/
AI 就绪度

Chest Computed Tomography for Patients with Sepsis in the Emergency Department(chest-ct-sepsis-er)

INFOBOX:chest-ct-sepsis-er 速览

项目 内容
官方名称 Chest Computed Tomography for patients with sepsis in the Emergency Department
托管平台 PhysioNet(slug: chest-ct-sepsis-er)
版本 / 发布 v1.0.0,2024-10-28
DOI 10.13026/zne5-qh18
RRID SCR_007345
数据描述论文 Jin S, Cai W, Shen Q, Yang L, Sheng’an H, Fu J, Zhang Z. Scientific Data 11:1261 (2024-11-20),DOI 10.1038/s41597-024-04132-z,PMID 39567547,PMCID PMC11579395
版本页署名 Senjun Jin、Zhongheng Zhang(论文署名 7 人)
数据来源 浙江省人民医院(杭州医学院附属人民医院)急诊医学部 / EICU
队列口径 728 次就诊(含门诊)/ 337 例住院 / 327 例住院有 CT
影像规模 836 次胸部 CT,NIfTI(nii.gz),SimpleITK v2.2.0 由 DICOM 转换
表格规模 14 张 CSV,合计约 3,962,948 行;最大表 NursingChart_VitalSign 2,251,285 行
疾病定义 Sepsis-3.0:疑似/确诊感染 + SOFA 急性升高 ≥2 分
访问方式 PhysioNet Credentialed Access + DUA;同步存于 NGDC OMIX005655(controlled access)
伦理 浙江省人民医院伦理委员会 2023-397,回顾性设计知情同意豁免
去标识 HIPAA 标准:随机代理 ID、年龄分箱、日期相对化、文本地名/人名删除
DAIMS 评分 5.1 / 8(详见 §3.3)

§0 摘要卡:为什么值得为 836 张胸部 CT 写一篇百科

一句话定位:chest-ct-sepsis-er 是浙江省人民医院团队在 PhysioNet 发布的脓毒症胸部 CT 与临床表格配对数据集——它把同一团队在 2023 年建立的纯表格中国危重症数据库(本系列第 498 号条目 zhejiang-ehr-critical-care)向前推进一步,为 337 例 Sepsis-3 脓毒症住院患者配上了 836 次胸部 CT 体数据(NIfTI 格式)与 14 张合计约 396 万行的 CSV 临床表格,是中文医疗 AI 生态中少有的"影像 + 表格 + 自由文本"三模态、单一疾病、小而深的公开资源。

三个立即能回答的问题。第一,脓毒症的肺部结构改变能不能用计算机视觉量化?这套数据给了 836 次高分辨率胸部 CT,覆盖 2012(或 2019,见存照 B)至 2022 年的急诊 ICU 脓毒症住院,让影像组学(radiomics)研究第一次有了公开的中国脓毒症影像底座。第二,影像特征与临床轨迹怎么对齐?CT 文件通过 CT2hospitalID 表逐次挂接到 Hospital_ID,临床侧从生命体征(VitalSign 505,151 行、NursingChart_VitalSign 2,251,285 行)到实验室检验(Lab 789,010 行)、用药(Medication 109,246 行)、微生物培养与药敏(MicrobiologyCulture 20,661 + DrugSens 55,029 行)一应俱全。第三,中文影像报告能不能做 NLP?ExamReport 表收了 6,037 行检查报告文本(CT、超声、MRI),PtAdmiTable 的 Med_history 字段保留大段中文现病史——作者刻意不做机器翻译以保 NLP 保真,只对元数据和短文本做了人工复核的英译。

它在 Top1000 序列里的位置。本条目属于医学影像大类,但和多数纯影像条目(如 499 的心脏植入装置胸片分割集)不同,它的重心是"影像与临床的配对深度":单疾病、单中心、11 年(或 4 年,见存照 B)时间窗、每例附带完整的住院过程表格。它也是本系列第 498 条目(Jin et al. 2023,Sci Data 10:49)的直接续作——论文原话是"临床数据结构与先前报告的非常相似"。读 498 再读本篇,可以完整看到一个中国三甲医院把院内 EHR 管线产品化为国际公开数据集的两级台阶:先表格、后影像。

三个必读存照。其一,标题漂移:PhysioNet 版本页用 Emergency Department(急诊科),论文标题用 emergency intensive care unit(急诊 ICU),HospitalTransfer 表的注释说明 EICU 就在急诊科内——三个名称指向同一物理空间,但检索时会互相错过。其二,时间窗双口径:论文 Methods 写 2019 年 1 月至 2022 年 12 月(EICU 脓毒症纳入期),而论文 Data Records 段与 PhysioNet 页面均写 2012 年 1 月至 2022 年 12 月——论文自身就并存两个口径,使用者在引用时间覆盖时必须自选并说明。其三,版本页的"额外引用"指向了 Kehl et al. 2024(Nat Commun,用共享 AI 提取癌症结局)——与脓毒症 CT 毫无关系的误引,真正的数据描述论文是 Jin et al. 2024(Sci Data 11:1261)。这三条都已写入 §10 存照。

DAIMS 5.1/8。文档完备性接近满分(数据描述论文 + 14 表字典 + MD5 校验表一应俱全),扣分项集中在评测协议缺失(0.3:无官方基准、无标注金标准、无划分)与许可/标签透明度中等。它更像一座"原料矿"而不是"考场"——适合自建任务的研究者,不适合想直接刷榜的团队。

给不同读者的最短路径:影像算法研究者直接看 §3.5(NIfTI 获取)与 §6.2(影像侧的空白与机会);临床信息学研究者看 §4.1(14 表结构)与 §4.7(与 MIMIC 的表对照);NLP 研究者看 §2.6(中文长文本的刻意保留)与 §7.5(LLM 实验配方);合规与教学场景看 §8 与 §9。

§0.1 名称勘误与口径声明

  • 本条目正文统一使用 PhysioNet 官方标题"Emergency Department"版本,但在引用论文处保留论文原标题"emergency intensive care unit"——两者是同一数据集的两种官方表述,切勿当成两个数据集。
  • "728"在本数据集里永远指就诊次数(visits,含门诊),“337"才是住院数;部分二手文章把 728 写成"728 例脓毒症住院”,属于把 Abstract 的口误当真(见存照 C)。本条目所有分析以 337 住院 / 836 CT / 327 有 CT 住院为准。
  • 数据时间窗存在 2012-2022 与 2019-2022 双口径(见存照 B)。本条目在统计性叙述中标注口径,在叙事性叙述中采用"最长 11 年、EICU 纳入期 4 年"的双层表述。

§0.2 读者收益清单:读完这篇百科你能做什么

  • 数据管理者:拿到 14 表结构图、ID 关联图、装载手册(§3.4/§4/§3.8),一天内完成本地化装载与对账,产出五数字(728/337/327/836/837)对账报告。
  • 影像研究者:理解"层厚未知 + 无标注"两大约束的技术后果(§3.5/§6.2),获得弱监督标注工厂的四级配方(§7.6),把 836 体数据转化为可发表的方法学贡献。
  • 临床 AI 研究者:获得 day-level 特征工程的完整路径(§5.4/§7.11)、泄漏防控专项(§7.3)、公平性清单(§7.4),以及三条可直接立项的提案(§7.15)。
  • NLP 研究者:明确 6,037 行中文报告 + 主诉双语对的语料价值与边界(§2.6/§6.4),拿到 LLM 合规路线(§7.5)。
  • 合规与教学:掌握双平台(PhysioNet+OMIX)叠加义务(§8.1)、LLM 时代数据位置口径(§8.3)、一节课与两周课程的教学化设计(§5.9/§7.12)。

§0.3 本条目与其他条目的阅读组合

需求 推荐组合 理由
看懂中文危重症数据生态 498 → 500 同团队同管线,先表格后影像
脓毒症 AI 全景 492 → 497 → 500 真实表格 → 合成数据 → 真实影像的三级台阶
医学影像数据集谱系 499 → 500 → 501 胸片器械 → 脓毒症 CT → 胸片分割的模态对照
儿科与成人的杭州双景 495 → 500 ZUCH 儿科 ICU vs ZPPh 成人急诊 ICU,同城双中心
合规流程训练 495 → 500 两者同为 Credentialed,培训-申请-DUA 流程一致

§0.4 数据集身份卡(防混淆速查)

易混点 正确认知
chest-ct-sepsis-er ≠ zhejiang-ehr-critical-care 前者(本条目)是脓毒症 CT 配对集;后者(498)是同团队 2023 年的全谱系表格库
728 ≠ 337 728 是含门诊的就诊次数;337 是住院数;Abstract 的 “728 admissions” 是口误
836 ≠ 837 836 是 CT 扫描数;837 是 CT2hospitalID 表行数(差 1 待对账)
Emergency Department ≠ 另一个数据集 版本页标题与论文标题(emergency intensive care unit)指同一数据集
Kehl et al. 2024 ≠ 数据论文 版本页误引;真正的数据论文是 Jin et al. Sci Data 11:1261
2012-2022 vs 2019-2022 双口径并存:版本页/Data Records 用前者,论文 Methods 用后者
v1.0.0(2024-10-28) 截止 2026-09 唯一版本,无更新

§1 出身与谱系:一条 EHR 管线的第二次产品化

§1.1 从 498 到 500:同一团队的两年两级台阶

2023 年 1 月,Jin Senjun 等人在 Scientific Data 发表"Establishment of a Chinese critical care database from electronic healthcare records in a tertiary care medical center"(Sci Data 10:49),把浙江省人民医院危重症单元的常规 EHR 整理成公开表格数据库——这就是本系列第 498 号条目 zhejiang-ehr-critical-care。2024 年 1 月 5 日,同一团队投出续作:这次不再泛化全院危重症,而是聚焦单一疾病(Sepsis-3 脓毒症)、单一模态(胸部 CT),从急诊 ICU 纳入队列,并补上了影像维度。论文 2024 年 11 月 13 日被接收,11 月 20 日正式刊出(Sci Data 11:1261);PhysioNet 版本页上线于 2024 年 10 月 28 日,比论文正式发表还早二十余天——数据先行、论文收尾,是 PhysioNet 生态的常见节奏。

作者团队 7 人:金红军系急诊与危重症中心(第一作者 Senjun Jin)、蔡炜、沈桥、杨璐、何胜安、傅佳,通讯与最后作者张忠辉(Zhongheng Zhang,浙江大学医学院附属邵逸夫医院急诊医学科,本系列 498 的同一通讯)。机构构成值得注意:三家来自浙江省人民医院本部(急诊危重症中心、放射科、信息中心),一家来自邵逸夫医院(张忠辉),一家来自绍兴文理学院医学院——信息中心的在列说明这仍是一次"官方管线工程"而非研究者个人爬取,数据从医院信息系统(HIS)到发布平台有制度化的提取与校验通道。

§1.2 为什么选脓毒症:一个"肺部最受伤"的疾病

论文的疾病逻辑链条很清晰:脓毒症是感染引起的全身炎症反应综合征(SIRS),住院患者死亡与致残的主要推手之一;最容易受累的器官系统是肺、肾与循环;其中肺损伤有直接的结构学呈现——脓毒症诱发的急性肺损伤在胸部 CT 上表现为双侧浸润影。但作者指出关键空白:肉眼可见的浸润只是冰山一角,“更细微的、人眼不可见的结构改变可能被忽略”,而计算机视觉与深度学习恰好擅长从 CT 中提取这类特征并用于预后、分型与决策支持。要训练这类模型,需要"公开、策展良好的脓毒症 CT 数据集",而当时该类资源几乎为零——这构成了立项理由。

§1.3 纳入标准:Sepsis-3 的中国急诊 ICU 实现

队列来自浙江省人民医院急诊 ICU(EICU)收治的全部脓毒症患者,时间窗按论文 Methods 为 2019 年 1 月至 2022 年 12 月。脓毒症采用 Sepsis-3.0 共识定义(Singer et al., JAMA 2016):疑似或确诊感染,加 SOFA 评分急性升高 ≥2 分。这是国际主流口径,与 MIMIC-IV 生态中 sepsis-onset 计算的常用标准一致,使跨库比较在概念层面可行。但要注意:数据集未发布逐患者的 SOFA 时序与感染判定中间变量——"哪些患者、何时被判定为脓毒症"这一关键过程在公开表格里只有结果(PtAdmiTable 的诊断与转归字段),过程可复现性有限,使用者无法自行审计纳入决策(见 §6.8 坑点)。

§1.4 三个计数口径:728 / 337 / 836

这组数字是本数据集最容易读错的地方。728 是就诊次数(visits),包括门诊(outpatient)——PtAdmiTable 恰好 728 行,每个 EncounterType 字段区分住院与门诊;337 是排除门诊后的住院数(103 女 + 234 男);836 是胸部 CT 扫描次数,分属 327 例住院(另外 10 例住院没有 CT,原因未说明);CT2hospitalID 表 837 行,比 836 多 1(存照 D,可能是表头或一条重复映射,官方文件为准)。论文 Abstract 写"728 admissions"是把 visits 误称 admissions;二手引用务必用 337/836 这对核心数字。

§1.5 单中心立场的利与弊

与 495(PIC,浙江大学儿童医院 12,881 患者)和 498(同院危重症全谱系)一样,这是单中心数据。利:表格结构统一、科室流程同质、Med_history 等中文文本风格一致,适合方法学开发与内部验证。弊:脓毒症的诊疗习惯(抗生素方案、液体策略、CT 开单指征)高度绑定于单一机构,模型外推到其他医院时面临中心效应——这恰是 2023 年 Intensive Care Medicine 上张忠辉与 Celi 等人"疾病轴 vs 聚类"论文反复论证的复现性难题。合理的用法是:把本集当作方法开发与效应量估计的"训练场",把跨中心验证留给多中心集(如 HiRID、eICU)或等待同系列扩展。

§1.6 双存储架构:PhysioNet + OMIX

这份数据同时落在两个受控通道:PhysioNet(Credentialed Access,面向国际研究者,DUA 三条款)与 NGDC OMIX005655(中国国家基因组科学数据中心,controlled access,BioProject PRJCA006118,2024-01-14 提交、2024-08-22 发布)。OMIX 通道的意义在国内合规:中国研究者无需跨境数据出境评估即可申请受控副本。论文 FAIR 声明逐条对应:Findable(OMIX 全局唯一标识与索引)、Accessible(双通道 + 明确的访问条件)、Interoperable(CSV 标准结构)、Reusable(来源与处理记录)。这种"一份数据、两张门牌"的双存储模式在中文数据集中还不常见,值得同类项目借鉴。

§1.7 与 PhysioNet 脓毒症主题家族的横向关系

PhysioNet 上以 sepsis 为主题的资源构成一个谱系:2019 Challenge(PhysioNet/CinC 2019 早期脓毒症预测挑战赛,时序表格)、Health Gym 合成脓毒症集(本系列第 497 条目,合成数据免合规)、Zigong 第四人民医院感染危重症库(2022,纯表格、另一家四川医院)、以及本条目(影像 + 表格)。它们共同覆盖了"时序预测—合成数据—表格描述—影像组学"四种研究范式。chest-ct-sepsis-er 是这个家族里唯一带 DICOM 衍生影像的成员,也是唯一提供检查报告自由文本的成员——这两个"唯一"就是它的生态位。

§1.8 伦理与治理

研究获浙江省人民医院伦理委员会批准(批准号 2023-397,批准范围明确包含数据发布),遵循赫尔辛基宣言,因回顾性设计由 IRB 决定豁免知情同意。注意批准主体是数据来源医院本身——与 498 一致;OMIX 通道提交者挂浙江大学(张忠辉的邮箱域名 zju.edu.cn),反映通讯作者的机构归属而非数据产权转移。DUA 三条款(不重识别、随论文发布代码、不分享数据)与 PhysioNet Credentialed 数据集的通行约束一致,其中"发布代码"一条是相对严格的可复现性承诺。

§1.9 资助与可持续性

版本页与论文未列出专项资助编号——这与 495(NSFC 与国家重点研发计划多项)形成对照。没有显式资助意味着数据维护的可持续性依赖团队自身:498(2023)、500(2024)两年两作的模式显示了团队的持续投入意愿,代码库(github.com/zh-zhang1984/ZhejiangProvinceICU)为两集共享。但单团队、单信息中心的管线也意味着版本迭代节奏不可预期——截止核查日(2026-09)版本仍为 v1.0.0,未见表结构扩展或勘误公告。

§1.10 用户画像:谁该用、谁不该用

适合:影像组学与 CV 研究者(有真实临床表格可配对的脓毒症 CT,样本量足够做方法学原型);多模态融合方法的开发者(影像 + 表格 + 中文文本的三模态最小可行集);中文医疗 NLP 团队(6,037 行检查报告 + 现病史长文本,附带人工复核的短文本双语平行样本);教学场景(数据量小,一张 32GB 内存的工作站即可全量装载)。不适合:需要大样本训练深度网络的团队(337 住院、836 CT 的量级只够微调与少样本实验);需要官方基准与排行榜的评测型研究(无划分、无金标准标注);需要连续年龄与精确时间戳的精细建模(年龄已分箱、时间已相对化到天)。

§1.11 名词速查表

名词 释义
Sepsis-3.0 2016 年脓毒症国际共识:感染 + SOFA 急性升高 ≥2 分
SOFA 序贯器官衰竭评估评分,脓毒症严重程度的核心量表
EICU 急诊重症监护室(Emergency ICU),本数据集的物理来源单元,位于急诊科内
NIfTI 神经影像信息技术倡议格式(.nii.gz),医学影像研究的通用体数据格式
SimpleITK 基于 ITK 的简化医学影像处理库,本集用它做 DICOM→NIfTI 转换(v2.2.0)
patient_SN 患者代理序列号(32 位十六进制样例 5810787d01cf52e6973eef9819b7d2ac)
Hospital_ID 住院代理标识(15 位数字样例 337016968172517),全库主关联键
serialID CT 文件名,经 CT2hospitalID 表挂接 Hospital_ID
CTexame_DateTime CT 检查时间,相对入院日的天数偏移,可为负(入院前门诊 CT)
OMIX 中国国家基因组科学数据中心旗下组学原始数据库存档单元(OMIX005655)
DUA 数据使用协议;本集三条款:不重识别、发布代码、不分享
MD5 消息摘要算法;官方发布 14 表的 MD5 哈希供完整性校验

§1.12 发布时间线年表

日期 事件
2016 Sepsis-3 共识发布(Singer et al., JAMA),为本集纳入标准提供定义基础
2023-01 Jin et al. Sci Data 10:49 刊出(= 498),同一管线完成第一次产品化(纯表格)
2024-01-05 本集数据描述论文投稿(Received 2024-01-05)
2024-01-14 OMIX005655 提交(BioProject PRJCA006118)
2024-08-22 OMIX 受控访问发布
2024-10-28 PhysioNet 版本页上线(v1.0.0,DOI 10.13026/zne5-qh18)
2024-11-13 论文被接收(Accepted)
2024-11-20 论文正式刊出(Sci Data 11:1261,PMID 39567547)
2026-09(核查日) 版本仍为 v1.0.0,无更新公告;未检索到基于本集的同行评审后续研究

这张年表的三个读点:其一,OMIX 先行、PhysioNet 后上——国内通道优先就绪,说明团队的合规准备以境内为主;其二,投稿到接收历时 313 天(Sci Data 的常规节奏);其三,从 498 到本集恰好 22 个月,"表格库→影像扩展"的迭代周期约两年,可作为预测团队下一个产品(若有多中心或标注版)的时间参照。

§1.13 团队方法论的一致性指纹

对照 498 与本集的公开文档,可提取五条团队指纹:①ID 双键体系(患者代理号 + 住院代理号)完全一致;②时间相对化到天、自由文本日期 “****” 替换的处理习惯一致;③"短文本人工复核英译 + 长文本保留中文"的双语分层策略一致;④MD5 逐表交付的完整性校验习惯一致;⑤"数据描述论文 + 双平台存储"的发布模式一致。这些指纹对本系列读者的实用价值:读熟 498 与本集后,该团队(及协作网络如 Zigong 库)的后续数据集将具备近乎零的学习成本——同时也意味着其共同短板(无术语编码、无评测协议)会在新集中重复出现,使用者需要建立自己的补位工具箱。

§2 疾病与临床语境:脓毒症肺损伤的影像学底色

§2.1 从 SIRS 到器官衰竭:脓毒症的结构学后果

脓毒症的病理生理主线是感染触发的失控炎症反应:促炎因子风暴损伤血管内皮,毛细血管渗漏,血浆成分进入组织间隙。在肺部,这一过程的影像学呈现是间质水肿、磨玻璃影、实变与胸腔积液——从"正常肺纹理"到"双侧浸润"的连续谱。Sepsis-3 定义把"器官功能恶化"操作化为 SOFA ≥2 分的急性升高,而肺恰是 SOFA 氧合分项的直接对象(PaO2/FiO2)。因此本数据集的 CT 不只是"合并症的影像",而是定义疾病本身的器官在疾病过程中的结构快照——这是它区别于一般"疾病队列 + incidental 影像"资源的概念基础。

§2.2 为什么 CT 而不是胸片

论文选择 CT 的理由是空间分辨率:“CT 提供肺实质结构改变的高空间分辨率呈现”。胸片(如 499 的 CIED 集或 501 的胸片分割集)适合筛查与大样本形态学,但脓毒症肺损伤的间质细节——小叶间隔增厚、磨玻璃密度、微小实变——在 CT 上才可靠分辨。代价是数据量与辐射剂量:一家医院的 CT 存量远小于胸片,836 次扫描已经是 11 年(或 4 年)EICU 脓毒症队列的自然上限。研究者应把本集理解为"深度优先"的影像资源:每次扫描都是全胸体数据,但扫描次数有限。

§2.3 队列的人口学切面

337 例住院(排除门诊)中,女 103、男 234(男性 69.4%)——男性占优与多数脓毒症 ICU 队列一致。年龄分箱分布呈老年主导:(60,70] 87 例(26%)、(70,80] 95 例(28%)、(80,90] 52 例(15%)、(90,150] 19 例(6%),60 岁以上合计约 75%;(0,18] 仅 2 例(1%)。住院天数中位 22 天(IQR 12-36),男性中位略长(22 vs 20 天,p=0.224 不显著)。出院状态:治愈 185(56%)、未愈 121(36%)、未知 26(8%),性别间无显著差异(p=0.427)。注意"未愈"不等于死亡——StatusOnDischarge 字段的三分类是粗口径,准确院内死亡率需要结合 DiagnosisOnDeath 与 StatusOnDischarge_DESC 文本推断(见 §6.8 坑点 3)。

§2.4 CT 的时间分布:入院前的负偏移

CTexame_DateTime 以入院日为原点记录天数偏移,部分数值为负——因为相当一部分 CT 是患者以门诊身份在入院前完成的(728 次就诊含门诊正是为承载这些检查)。这一设计在数据建模上很有价值:研究者可以构建"入院前基线影像 → 住院过程表格 → 出院转归"的三段式分析,把 CT 当作入院时的结构学基线而非住院期间的过程快照。反过来,想在住院过程中追踪肺损伤演变的研究者会发现同一患者的多次 CT 分布不均——836 次扫描对 327 例住院平均 2.56 次,但方差未知,需自行统计。

§2.5 微生物与药敏:脓毒症异质性的病原学抓手

MicrobiologyCulture 表 20,661 行记录培养结果(样本类型、 category、时间、英文描述),DrugSens 表 55,029 行记录病原体对抗生素的敏感性。论文给出的描述样例透露了数据风格:“Poor quality (WBC<10/LP, LEC>25/LP)”(标本质量:每低倍镜视野白细胞少于 10、鳞状上皮细胞大于 25)、“No anaerobic bacteria growth after 5 days of culture”(培养 5 天无厌氧菌生长)。这些半结构化英文短句 + 结构化字段的组合,让病原谱分析(革兰阳性 vs 阴性、真菌比例)与药敏驱动的抗生素暴露重建成为可能——后者恰是脓毒症预后模型里公认难测但影响巨大的协变量。

§2.6 中文长文本:刻意的保真决策

PtAdmiTable 的 Med_history(现病史/既往史)与 ExamReport 的报告正文保留原始中文,作者在论文里明确解释:机器翻译"可能改变 NLP 或文本挖掘的结果",因此只在元数据与短文本(主诉、检验项目名、科室名等)上做了百度学术翻译服务初译 + 两作者人工复核的英译,长文本一律不动。这是一个对 NLP 社区友好但对国际用户不友好的决策——英语世界的研究者拿到的是一份需要自带翻译管线的语料。对本系列的中文 AI 生态而言,这反而是卖点:6,037 行影像报告 + 大段现病史,是稀缺的"报告-影像可对齐"中文语料(报告行经 ExamReport 关联到检查类型与时间,虽未直接给影像文件级对齐,但 Hospital_ID 粒度的对齐是可行的)。

§2.7 生命体征的两套来源

数据集有两张生命体征表:VitalSign.csv(505,151 行)与 NursingChart_VitalSign.csv(2,251,285 行)。前者按 VitalSign_DESC 分类(舒张压、体温、心率、呼吸频率)记录监护数据;后者来自护理录入界面(nursing chart),行数是前者的 4.5 倍。两套来源的采样频率、覆盖时段与质量控制标准不同——护理表更密但受录入习惯影响,监护表更规整但可能漏录护理时段。模型特征工程时建议两表并用并标注来源,切勿合并去重后当单一来源使用(见 §5.7 错误黑名单)。

§2.8 转科事件:EICU 的住院内轨迹

HospitalTransfer 表 277 行记录院内转科:转入/转出科室(英译)、转入/转出时间(相对入院天数)。表注释明确了科室命名约定:Emergency medical department 与 Emergency Department 都指 EICU。277 次转科对 337 例住院意味着多数患者未转科(滞留 EICU)或少部分多次转科。这张表是重构"住院内时间线"的关键:CT(CTexame_DateTime)、检验、用药都只有相对入院日的时间戳,把转科时间轴叠加进来才能回答"转入普通病房后生命体征是否还连续记录"这类过程性问题。

§2.9 转归字段的语义边界

PtAdmiTable 的转归字段组需要细读:StatusOnDischarge(三分类:治愈/未愈/未知)、StatusOnDischarge_DESC(文字描述)、DiagnosisOnDeath(死亡诊断)、Discharge_DateTime(出院时间,相对入院)、DaysHospitalStay(住院天数)。没有显式的 28/90 天死亡终点字段——这是与 MIMIC 系(有完整随访死亡日期)的显著差距。做预后建模的研究者只能用院内转归,且必须处理"未知"26 例(8%)的归属问题:剔除会引入选择偏倚,计入任一类都会污染标签。合理的做法是把转归建模为三分类或用 DESC 文本做规则细化并报告敏感性分析。

§2.10 与 498 的表格结构相似性:继承与微调

论文原话:“The structure of clinical data is quite like the ones reported previously”(临床数据结构与先前报告的非常相似),并把 498 的论文列为参考文献 10。这意味着熟悉 498 的研究者几乎零学习成本上手本集:同样的 patient_SN/Hospital_ID 双键体系、同样的相对时间戳约定、同样的中文长文本 + 英译短文本策略、同样的 MD5 校验交付。差异点有三:新增 CT2hospitalID 影像映射表;新增 ExamReport 检查报告表(498 无影像报告);_24hr 后缀列系本集特有(24 小时内出院/死亡者的主诉快照)。继承性让"498+500 联合装载"成为现实的整合方案(见 §5.10)。

§2.11 证据层级小结

本章临床叙述的证据等级:Sepsis-3 定义(Singer et al. JAMA 2016)为国际共识(A 级);队列人口学与转归统计来自论文 Table 1(B 级,单中心描述性);肺部结构改变的影像学逻辑为综述级共识(B 级);“肉眼不可见的细微结构改变可用 CV 提取并用于预后"为作者主张(C 级,尚待本数据集上的公开实证支持——截止核查日未检索到使用本集的同行评审影像研究)。引用时注意区分"论文论证的逻辑"与"已发表的实证结果”。

§2.12 脓毒症肺部影像研究的文献脉络与缺口

脓毒症肺损伤的影像学文献长期以两个传统为主:一是临床放射学的定性描述传统(双侧浸润、ARDS 影像标准的 Berlin 定义修订讨论),二是近十年的定量影像组学传统——后者在 COVID-19 期间爆发(CT 严重度评分、病灶定量与预后关联的论文数以百计),但脓毒症本身因为缺乏公开影像队列而明显滞后:大量脓毒症影像研究锁在单院 PACS 里无法复现。本集的直接动机就是这个缺口——论文引言明确说"由于缺乏策展良好的公开脓毒症 CT 数据集,探索肺 CT 影像组学的研究稀少"。对照 COVID-CT 的经验教训(公开数据集推动了评分系统的快速迭代,也暴露了标签质量与中心偏差问题),可以合理预期:一旦本集出现首批公开研究,"弱标签质量、层厚异质性、单中心偏差"将是同样的三大方法论焦点。本条目 §7 的配方正是按这三个焦点预置的。

§2.13 时间原点的建模含义:以入院为时区零点

全库以"入院时刻"为时间原点,这个设计有一个常被忽视的建模含义:它把"入院前-住院-出院后"三个阶段编码为负/正/更大的正,使得"跨阶段过程建模"成为一等公民。例如"入院前 72 小时内的门诊检验 + 入院即刻的生命体征"可以拼成一个连续特征窗口,而无需研究者知道真实日历日期。反过来,它也抹掉了星期几、季节、流行病学时段等日历信息——若要研究"周末入院效应"或季节性(脓毒症发病的季节波动是真实临床现象),本集无法支持。时间原点选择是隐私与科学的交换:得到了可拼接的过程窗口,失去了日历层的相关性研究空间。

§3 数据规格:14 张表、836 个体数据与它们的挂接方式

§3.1 交付物清单

访问获批后可下载的内容分三类:其一,14 张 CSV 临床表格(UTF-8,第一列为字段名);其二,CTImage 文件夹下的 NIfTI 体数据(.nii.gz),文件名即 serialID;其三,MD5 校验清单(论文 Table 2/3 逐表给出哈希)。没有任何标注文件(无分割 mask、无病变标注、无放射评分)、没有官方代码附件(代码以 GitHub 形式存在于团队仓库)、没有数据字典之外的字段级文档。下载前建议先核对 MD5——论文明确把 MD5 列为完整性校验手段,且不同信息系统抽取的表需要用 PtAdmiTable 的 Hospital_ID 做主键对账。

§3.2 十四张表全家福(NumObs 为官方口径)

# 表名 NumObs 内容
1 CT2hospitalID.csv 837 CT 文件名(serialID)→ Hospital_ID 映射 + CTexame_DateTime
2 Diagnosis.csv 8,459 诊断记录
3 DrugSens.csv 55,029 病原体对抗生素的药敏
4 ExamReport.csv 6,037 检查报告(CT/超声/MRI)文本
5 HospitalTransfer.csv 277 院内转科事件(含 EICU 命名约定)
6 Lab_dictionary.csv 246 检验项目字典
7 Lab.csv 789,010 检验结果
8 Medication.csv 109,246 用药事件
9 MedOrder.csv 117,751 医嘱
10 MicrobiologyCulture.csv 20,661 微生物培养
11 NursingChart_IO.csv 98,231 护理出入量
12 NursingChart_VitalSign.csv 2,251,285 护理生命体征(最大表)
13 PtAdmiTable.csv 728 就业主表(含门诊;住院 337)
14 VitalSign.csv 505,151 监护生命体征

合计约 3,962,948 行。行数结构一目了然:护理生命体征一张表占 57%,影像相关只有 CT2hospitalID 的 837 行——这是一份"以临床表格为主体、影像为增量"的资源,与 MIMIC-CXR(影像 377 万张、表格相对薄)正好是两个方向的配比。

§3.3 DAIMS 评估:5.1/8

维度 得分 依据
文档完备性 0.9 Sci Data 数据描述论文 + 14 表逐字段说明 + MD5 清单;扣 0.1:无字段级异常值说明与版本变更记录
机器可读性 0.8 CSV + NIfTI 双标准格式、MD5 机器校验、ID 体系清晰;扣 0.2:检验项无 LOINC 映射、药物无 RxNorm/ATC 编码、科室名英文为人工翻译非标准术语
标签质量透明度 0.6 Sepsis-3 纳入标准公开、转归三分类透明;扣 0.4:无影像标注、无 SOFA 时序、纳入决策过程不可审计
可访问性 0.7 Credentialed 流程成熟、OMIX 国内通道;扣 0.3:需 DUA 且三条款约束强、无 Open Access 快速通道
许可清晰度 0.6 DUA 条款明确(不重识别/发布代码/不分享);扣 0.4:非标准开源许可、二次分发与衍生数据集边界靠 DUA 文字约束
格式标准化 0.7 NIfTI 为影像事实标准、CSV 通用;扣 0.3:未保留 DICOM 原始(丢失层厚/重建核/窗宽窗位元数据)
评测协议完备性 0.3 无官方任务、无划分、无基准、无金标准标注
生态可持续性 0.5 498→500 系列延续、共享代码库;扣 0.5:单团队依赖、v1.0.0 无更新承诺、无资助信息公开
合计 5.1/8 原料矿型资源:文档好、协议缺

§3.4 ID 体系与关联图

三键体系:patient_SN(患者级,一人多次就诊共享)→ Hospital_ID(住院级,全库主键)→ serialID(CT 文件级)。关联路径:CT 文件名 serialID → CT2hospitalID(含 CTexame_DateTime)→ Hospital_ID → 任意临床表。HospitalTransfer 提供院内科室轨迹(EICU 起点)。与 MIMIC 的概念映射:patient_SN ≈ subject_id,Hospital_ID ≈ hadm_id,serialID ≈ MIMIC-CXR 的 study 实例。注意 patient_SN 样例是 32 位十六进制(MD5 风格),Hospital_ID 是 15 位数字——两者都不是原始病案号,官方声明原始标识未保留、不可回链。

§3.5 影像规格:从 DICOM 到 NIfTI 的转换决策

CT 原始为 DICOM 序列,用 SimpleITK v2.2.0 转为 NIfTI(.nii.gz);同一检查含多序列时,“提取包含胸部 CT 的那一序列”。这个决策的收益是易用性(NIfTI 一文件一体数据,Python/R 生态友好,论文还点名 RNifti 包);代价是 DICOM 头里的技术元数据(层厚、重建核、管电压、窗宽窗位、增益)随转换丢失或弱化——影像组学研究者知道,这些参数是 radiomics 特征可重复性的第一决定因素(RSNA 的 IBSI 标准要求报告它们)。论文与版本页均未给出队列级层厚/重建核分布统计(见 §6.8 坑点 1),使用者需要在装载阶段自行从 NIfTI 头(像素间距、体素维度)反推部分信息,并承认"重 sliced 厚度异质性"是本集的固有噪声。

§3.6 时间语义:相对天数与 _24hr 列

全库时间统一为"相对入院日的天数偏移":Discharge_DateTime、CTexame_DateTime、TransferIn/Out_DateTime、VitalSign_DateTime、Lab/Medication/Micro 时间字段同理。自由文本中的绝对日期以 “****” 替换。同一天内的事件无法排序(粒度=天),做时序模型时 day-level 聚合是默认操作。_24hr 后缀列(ChiefComplain_24hr、AdmissionStatus_24hr、ChiefComplain_24hr_dead、AdmissionStatus_24hr_dead)是入院 24 小时内出院或死亡患者的专用主诉快照——对多数住院为空。这个设计透露作者的建模兴趣(超早期转归),也提示急诊留观 24 小时内即出院/死亡的患者在主表其他字段可能信息稀薄。

§3.7 访问流程实操

PhysioNet 通道:注册账号 → 完成 CITI"人体受试者保护"课程(与 495/498 同一要求)→ 签署 DUA → 提交访问申请 → 批准后页面出现下载按钮(aws s3 sync 或浏览器逐文件)。Credentialed 审批通常数个工作日。OMIX 通道:注册 NGDC 账号 → 提交数据使用申请(OMIX005655)→ 中国境内研究者可申请受控副本,无需跨境合规评估。两通道拿到的是同一份数据(论文 Data Records 明示双存储)。国内团队建议优先 OMIX,国际团队走 PhysioNet。DUA 三条款里最容易被忽视的是"发布代码":用本集发表的论文必须公开配套代码,写作时要把这条义务写进项目计划。

§3.8 装载手册(最小可行环境)

32GB 内存单机即可全量装载。步骤:①校验 MD5(md5sum -c);②CTImage 解压,用 nibabel 或 SimpleITK 读取头信息建立体素维度/间距清单;③14 张 CSV 装入 SQLite/PostgreSQL(无官方建表脚本,字段类型需从数据推断——Lab_value 与 VitalSign_value 为混合类型文本);④以 PtAdmiTable 为中心做完整性对账:Hospital_ID 应在全部 13 张子表出现(论文声明已做过该一致性检查);⑤CT 对账:CT2hospitalID 的 serialID 与 CTImage 文件名逐一比对,官方 837 vs 836 的差异在此环节定位;⑥建立 day-level 物化视图(把相对天数聚合为每患者每日事件表),后续特征工程事半功倍。团队共享代码库(zh-zhang1984/ZhejiangProvinceICU)含部分处理脚本可参考。

§3.9 元数据速查

元数据项 值
版本 1.0.0(2024-10-28 发布,截止 2026-09 无更新)
DOI 10.13026/zne5-qh18(PhysioNet)/ 10.1038/s41597-024-04132-z(论文)
RRID SCR_007345
OMIX OMIX005655;BioProject PRJCA006118
访问级别 Credentialed(PhysioNet)/ Controlled(OMIX)
引用链 版本页引文 + Jin et al. Sci Data 2024 + PhysioNet 平台引文(Pollard et al.)
伦理 浙江省人民医院 2023-397
平台 PhysioNet + NGDC OMIX 双存储

§3.10 版本页引用要求的三个层次

第一层:Jin, S., & Zhang, Z. (2024). Chest Computed Tomography for patients with sepsis in the Emergency Department (version 1.0.0). PhysioNet. RRID:SCR_007345. https://doi.org/10.13026/zne5-qh18。第二层:数据描述论文 Jin et al. Sci Data 11:1261 (2024)——注意版本页把它误写为 Kehl et al.(存照 E),正确引用以论文 DOI 10.1038/s41597-024-04132-z 为准。第三层:PhysioNet 平台引文(Pollard et al., PhysioNet as a global platform for biomedical research)。三层缺一不可,二手文章最常见的错误是只引第一层不引论文,或跟着版本页误引 Kehl。

§3.11 跨库对齐协议

与 498(同院同管线):直接 join——patient_SN/Hospital_ID 语义相同,理论上同一患者在两集中同 ID(需验证),联合后可做"全院危重症表格 + 脓毒症子集影像"的分层分析。与 MIMIC-IV:概念映射可行(subject_id/hadm_id/charttime ↔ patient_SN/Hospital_ID/相对天数),但 MIMIC 无影像的对应表结构,对齐停留在方案层。与 2019 Challenge:后者是公开时序窗口数据(Sepsis-3 标签已给),可做"真实影像库 vs 时序竞赛库"的分布对照。与 OMIX 内其他脓毒症多组学项目(CMAISE 联盟):同院生态内可能存在患者重叠,任何跨集个体链接都属于重识别尝试,为 DUA 明令禁止——只做统计层对照。

§3.12 字段级示例速览(以官方披露样例为准)

表.字段 官方样例 解读
PtAdmiTable.patient_SN 5810787d01cf52e6973eef9819b7d2ac 32 位十六进制代理号,MD5 风格
PtAdmiTable.Hospital_ID 337016968172517 15 位数字代理号,住院级主键
PtAdmiTable.EncounterType inpatient / outpatient 728 visits 的分型依据
PtAdmiTable.StatusOnDischarge Cured / Not cured / Unknown 三分类转归
PtAdmiTable.Age_cut (70,80] 九档分箱年龄
HospitalTransfer.TransferTo_Dept_Eng Emergency medical department 该名称即 EICU
MicrobiologyCulture.MicrobiologyCulture_DESC_Eng “No anaerobic bacteria growth after 5 days of culture” 半结构化英文描述
MicrobiologyCulture.MicrobiologyCulture_DESC_Eng “Poor quality (WBC<10/LP, LEC>25/LP)” 标本质量描述样例
CT2hospitalID.serialID = CT 文件名 影像级关联键
CT2hospitalID.CTexame_DateTime 负数合法 入院前门诊 CT
VitalSign.VitalSign_DESC 舒张压/体温/心率/呼吸频率 四类核心体征

§3.13 装载后对账清单(逐项断言)

  1. PtAdmiTable 行数 = 728;过滤 EncounterType=inpatient 后 = 337。
  2. Sex 统计 = 女 103 / 男 234(住院子集)。
  3. DaysHospitalStay 中位数 = 22(IQR 12-36)。
  4. StatusOnDischarge 分布 = 185/121/26。
  5. CTImage 文件数 = 836;CT2hospitalID 行数 = 837(差异行单独人工检视,写进对账报告)。
  6. CT2hospitalID.Hospital_ID ⊆ PtAdmiTable.Hospital_ID(论文声明已过一致性检查,仍应复验)。
  7. 每张子表的 Hospital_ID 都能在 PtAdmiTable 找到(13 张子表逐一外键反查)。
  8. 14 张表 MD5 与论文 Table 2/3 逐一比对。
  9. 无 CT 的 10 例住院:列出 Hospital_ID 清单留档(后续分析的分母口径证据)。
  10. VitalSign 与 NursingChart_VitalSign 的时间覆盖区间分别统计并画每患者甘特图。

§3.14 与 498 的逐表血缘对照

本集(500) 498 对应表 血缘判断
PtAdmiTable 就业主表(同结构) 同源改造:新增 _24hr 列组与双语主诉
VitalSign VitalSign 同构:字段约定一致
NursingChart_VitalSign NursingChart_VitalSign 同构;本集行数按脓毒症子集缩放
NursingChart_IO NursingChart_IO 同构
Lab + Lab_dictionary Lab + Lab_dictionary 同构;字典项数可能不同(246 vs 498 版)
Medication / MedOrder Medication / MedOrder 同构
MicrobiologyCulture + DrugSens MicrobiologyCulture + DrugSens 同构
Diagnosis Diagnosis 同构:均无 ICD 编码
HospitalTransfer HospitalTransfer 同构:EICU 命名约定同
ExamReport (无) 本集新增:影像扩展的标志表
CT2hospitalID (无) 本集新增:影像映射
CTImage(NIfTI) (无) 本集新增:影像本体

这个对照表的实用价值:从 498 迁移来的分析管线只需处理三件事——新增影像入口(CT2hospitalID + CTImage)、新增报告通道(ExamReport)、复核字典差异。其余 9 张表代码可原样复用。

§4 结构深查:表与影像的微观解剖

§4.1 PtAdmiTable:17+ 字段的主表

已披露字段:patient_SN、Hospital_ID、Sex、EncounterType(inpatient/outpatient)、ChiefComplain_24hr、AdmissionStatus_24hr、ChiefComplain_24hr_dead、AdmissionStatus_24hr_dead、ChiefComplain(中文)、ChiefComplain_Eng(英译)、StatusOnDischarge、StatusOnDischarge_DESC、DiagnosisOnDeath、Discharge_DateTime、DaysHospitalStay、Age_cut、PastHistory、Med_history。主诉双语平行(中文+英译)是现成的翻译对齐小语料;Med_history 与 PastHistory 为中文长文本。DaysHospitalStay 与 Discharge_DateTime 应当冗余一致,装载时可互验。Age_cut 的分箱边界即论文 Table 1 的九档。

§4.2 ExamReport:6,037 行报告文本的三重价值

第一重,NLP 语料:CT/超声/MRI 报告正文(中文),报告风格为中文放射科模板句式("两侧胸廓对称…两肺纹理增多…“类)。第二重,影像检索线索:CT 报告与 CTImage 文件在 Hospital_ID + 时间偏移粒度可弱对齐(论文未给 serialID 级对齐,研究者可用 CTexame_DateTime 与报告日期做最近邻匹配——属于合法推断,不是重识别)。第三重,结构学标签的弱来源:报告中的"胸腔积液”“实变”"磨玻璃影"等术语可经词典匹配生成弱监督标签,替代缺失的官方影像标注(见 §7.6 弱监督级联配方)——但必须意识到报告术语与影像真实病灶的偏差,弱标签只能用于预训练与原型,不能当金标准评测。

§4.3 Lab + Lab_dictionary:789,010 行检验的字典驱动解读

Lab_dictionary 仅 246 行,说明检验项目经院内标准化归并(相对原始 LIS 的数千项目名大幅收敛)。但 246 项无 LOINC 映射,跨库对齐需要人工建映射表(建议优先映射脓毒症模型高频项:乳酸、白细胞、降钙素原、C 反应蛋白、肌酐、胆红素、血小板、PaO2/FiO2 相关血气项)。Lab_value 为文本类型,数值解析时注意单位列与异常表示(“阴性”、“>1000”、“<0.03” 类截断值)。789,010 行 / 337 住院 ≈ 每住院 2,341 条检验记录,密度与 ICU 级监护吻合。

§4.4 Medication + MedOrder:109,246 + 117,751 行的双层用药记录

Medication 是给药事件(执行层),MedOrder 是医嘱(意图层)——两层对照可计算"医嘱-执行延迟",这是急危重症流程挖掘的有趣变量。药品名以中文商品名/通用名为主(无 ATC 编码),跨库使用需要建本地映射。液体类药品(晶体液、白蛋白、血制品)与 NursingChart_IO(98,231 行出入量)联合可重建液体平衡曲线——脓毒症复苏研究的核心过程指标。

§4.5 MicrobiologyCulture + DrugSens:培养与药敏的分离设计

培养表(20,661 行)记录标本、菌种、时间与英文描述;药敏表(55,029 行)记录病原-抗生素-敏感度三元组。两表按培养事件关联。药敏行数是培养行数的 2.7 倍,说明多数阳性培养附带多抗生素panel。抗生素耐药表型(MRSA、CRE、CRKP 类)可从药敏组合推导,为"耐药菌感染 vs 影像结构改变"的探索提供了其他公开脓毒症集少有的抓手。

§4.6 NursingChart_VitalSign vs VitalSign:4.5 倍行差的结构解释

护理表 2,251,285 行 vs 监护表 505,151 行。合理解释(论文未明说,属推断):护理表覆盖全住院周期(含普通病房时段)且采样密集,监护表聚焦监护时段;两者字段结构相同(DESC/value/unit/时间)。注意 327 例有 CT 的住院不一定是住 EICU 最久的——转科轨迹(HospitalTransfer)+ 两表覆盖差异共同决定每患者的有效观测窗口,特征工程前先画每患者的时间覆盖图,避免把"没记录"当"生命体征平稳"。

§4.7 与 MIMIC 系的表级对照

概念 本集 MIMIC-III/IV
患者 patient_SN subject_id
住院 Hospital_ID hadm_id
ICU 住留 HospitalTransfer 推导 icustay_id(显式)
生命体征 VitalSign + NursingChart_VitalSign chartevents
检验 Lab + Lab_dictionary labevents + d_labitems
用药 Medication + MedOrder inputevents + prescriptions
微生物 MicrobiologyCulture + DrugSens microbiologyevents
诊断 Diagnosis(中文,无 ICD) diagnoses_icd(ICD 编码)
影像 CTImage(NIfTI) MIMIC-CXR 另库(DICOM/JPEG)
报告文本 ExamReport MIMIC-CXR 的 radiology reports
出转归 StatusOnDischarge 三分类 死亡日期( hospital + 1 年随访)

最大结构差异有二:诊断无 ICD 编码(中文文本,需 NLP 映射才能与 CCSCategory 类标准层对接);ICU 住留非显式实体(需从转科表推导)。这两点决定了从 MIMIC 迁移来的分析管线必须做适配层。

§4.8 影像文件的物理特征

样本 CT(论文 Fig.1)三视图坐标 [250,250,80] 暗示体数据矩阵约 512×512×若干层(x-y 250+ 的索引落在常见 512 矩阵内,z 80 提示层数至少百级,具体以实际文件为准)。压缩为 .nii.gz 后单文件体量视层厚约 10-50MB,836 文件总计约 10-40GB 量级——下载与存储预算应按 50GB 规划。全库无 mask、无 JSON 侧车文件、无 BIDS 式目录规范,文件名即 serialID(32 位十六进制风格),批处理脚本需要自己维护"文件名→Hospital_ID→患者"的解析层。

§4.9 血缘链:从 HIS 到 NIfTI 的五级加工

数据血缘可归纳为五级:①HIS/LIS/PACS 原始记录(院内多信息系统)→②按 HIPAA 去标识抽取(ID 替换、年龄分箱、日期相对化、文本脱敏)→③表间 Hospital_ID 一致性校验(论文声明逐表与 PtAdmiTable 对账)→④百度学术翻译 + 双作者人工复核(元数据与短文本)→⑤DICOM→NIfTI 转换(SimpleITK 2.2.0,胸部序列提取)。每一级都有信息损失或转换决策:①级丢失的是系统间外键;②级丢失绝对时间与精确年龄;③级未公开对账失败的样本量;④级未公开翻译错误的抽检错误率;⑤级丢失 DICOM 技术头。使用者的"尽职调查清单"应覆盖这五级(见 §6.10)。

§4.10 质量总评:文档 A、标准 B、协议 D

给三张成绩单。文档:A——论文逐表逐字段交代,MD5 全覆盖,在同类中国数据集中属第一梯队。标准:B——格式标准(CSV/NIfTI)但术语标准缺位(无 LOINC/ICD/ATC),科室与检验名的英译是"可读"而非"可算"的。协议:D——没有任何官方任务、划分、标注或基准;转归标签粗(三分类+未知),时序粒度粗(天)。这个画像决定了它的最佳用途:自建任务的方法学开发、中文医疗多模态预训练语料、教学演示;最差用途:直接刷某个公开榜(没有榜可刷)。

§4.11 SQL 速查:五个高频查询

-- 1) 住院子集(排除门诊)
SELECT * FROM PtAdmiTable WHERE EncounterType = 'inpatient';  -- 337 行

-- 2) 每患者的 CT 清单(含入院前负偏移)
SELECT p.patient_SN, c.Hospital_ID, c.serialID, c.CTexame_DateTime
FROM CT2hospitalID c JOIN PtAdmiTable p USING (Hospital_ID)
ORDER BY p.patient_SN, c.CTexame_DateTime;

-- 3) EICU 停留时长(转科轨迹推导 ICU 住留)
SELECT Hospital_ID,
       MIN(TransferIn_DateTime)  AS icu_in,
       MAX(TransferOut_DateTime) AS icu_out
FROM HospitalTransfer
WHERE TransferFrom_Dept_Eng LIKE 'Emergency%' OR TransferTo_Dept_Eng LIKE 'Emergency%'
GROUP BY Hospital_ID;

-- 4) 脓毒症高频检验项的每日最新值(乳酸示意)
SELECT l.Hospital_ID, l.Lab_DateTime AS day, MAX(l.value_num) AS lactate_last
FROM Lab l JOIN Lab_dictionary d ON l.item_code = d.item_code
WHERE d.item_name LIKE '%乳酸%' OR d.item_name LIKE '%LACT%'
GROUP BY l.Hospital_ID, l.Lab_DateTime;

-- 5) 转归三分 + 未知留档
SELECT StatusOnDischarge, COUNT(*) FROM PtAdmiTable
WHERE EncounterType = 'inpatient'
GROUP BY StatusOnDischarge;  -- Cured 185 / Not cured 121 / Unknown 26

注:字段名以实际文件表头为准(上式为语义示意);Lab 数值解析需处理文本型截断值(“<0.03”、“>1000”、“阴性”)。

§4.12 逐表深度注记:装载者视角的十四行

  1. CT2hospitalID:影像唯一入口;serialID 即文件名;837 vs 836 的差异行是装载首日就要解决的问题。
  2. Diagnosis:中文自由文本,无编码;感染灶归类词典(§7.16)的最大消费方。
  3. DrugSens:55,029 行药敏是本集"意外之喜"——多数脓毒症公开集只有培养无药敏。
  4. ExamReport:NLP 的主矿;报告-影像弱对齐(Q62)的边界必须先测后用。
  5. HospitalTransfer:ICU 住留的唯一推导来源;EICU 命名两条目都要匹配(§4.11 查询 3)。
  6. Lab_dictionary:246 项的收敛字典——建 LOINC 映射的工作量是可控的(一两天),值得立刻做。
  7. Lab:789,010 行;文本截断值与单位归并是清洗主战场。
  8. Medication:给药执行层;首剂抗生素时点是脓毒症研究的黄金特征。
  9. MedOrder:医嘱意图层;与 Medication 的时间差即执行延迟。
  10. MicrobiologyCulture:培养主表;阳性时点与标本类型的组合决定解读。
  11. NursingChart_IO:液体平衡的原料;单位归并先于求和(毫升/升混排是常见坑)。
  12. NursingChart_VitalSign:全库最大表;按患者抽样检查采样间隔而非假设等间隔。
  13. PtAdmiTable:全库中心表;17+ 字段里 Med_history 与双语主诉是两块特殊资产。
  14. VitalSign:监护层四类体征;与护理表并行不合并(Q44)。

§5.1 环境对账清单

开工前核对:Python ≥3.10 + nibabel/SimpleITK/pandas/scikit-learn;存储 ≥50GB(含解压余量);SQLite 或 PostgreSQL 任一;若复现论文表格统计需 R(RNifti 包被论文点名);Git(DUA 要求发表时公开代码,从第一天就建仓库)。国内团队若走 OMIX 通道,先确认单位对受控数据的内网管理流程;PhysioNet 通道注意 AWS S3 下载脚本对大文件夹的并发限制。

§5.2 评测协议:无官方协议时的自建规范

本集没有官方基准,自建评测必须自证清白。最低规范:①任务定义明确到字段级(如"以 24 小时内生命体征预测院内死亡");②划分按 patient_SN 分层(绝不按行划分——同一患者多表行泄漏);③转归标签处理"未知"26 例的方案写明(建议主分析剔除+敏感性分析计入);④所有时间特征只用 ≤ 预测时点的数据(day 粒度意味着"预测时点"取整天,边界事件统一规则);⑤报告 95% 置信区间(bootstrap by patient)。这五条写进论文方法节,审稿人无法用"划分泄漏"攻击。

§5.3 影像预处理推荐配方

NIfTI 装载后建议固定流程:①重采样到统一各向同性 spacing(如 1×1×1mm)——因为队列层厚异质性未披露,重采样是公平比较的前提;②肺窗窗宽窗位(如 W1500/L-600)统一渲染;③肺野分割用现成模型(TotalSegmentator/nnUNet 肺模板)生成 mask(自产 mask 需声明非官方);④若做 radiomics,用 IBSI 兼容特征提取器(PyRadiomics),并在限制节声明"重建核未知,特征稳定性未验证";⑤若做深度学习,337 例的量级只支持预训练-微调范式(CT 基础模型或自然图像预训练 + 少样本微调),从头训练大网络无意义。

§5.4 表格特征工程推荐路径

①day-level 聚合:每患者每日的 vitals 统计量(min/max/mean/last)、检验 latest + delta、用药计数与首剂时间;②液体平衡:NursingChart_IO 按日汇总入量-出量;③抗生素暴露:DrugSens 敏感谱 + Medication 时间线交叉生成"经验性治疗 vs 目标性治疗"标记;④SOFA 近似:用可得的检验/生命体征字段重算近似 SOFA(注明为近似值,非官方 SOFA 时序);⑤转归:三分类主标签 + DESC 文本规则细化的次级标签。全流程产出一张 patient-day 宽表,后续任何模型都从它出发。

§5.5 NLP 通道:中文报告的处理选项

三条路线按成本排序:①词典规则(术语表匹配病灶词,零成本低召回,适合弱标签);②预训练 BERT 系中文模型微调(需要小规模人工标注,建议标 200 份报告试水);③LLM 零样本/少样本抽取(提示词内给中文报告 + 输出 JSON 病灶词典,注意 DUA 对数据处理位置的限制——使用境外 API 前需评估"不分享数据"条款的含义,境内部署模型更稳妥)。短文本主诉的双语平行对(ChiefComplain/ChiefComplain_Eng)可做翻译质量抽样的参照系。

§5.6 与 498+495 的联合装载方案

三集同属"中国危重症公开数据"生态:498(同院表格全谱系)、500(同院脓毒症影像子集)、495(杭州另一家医院 ZUCH 儿科)。联合装载的价值:①方法学上,一套 ID/时间约定吃三集;②临床上,成人脓毒症(500)与全院危重症(498)的嵌套结构适合做"疾病特异 vs 全谱系"对照;③教学上,一个 Jupyter 仓库装三集走完"表格→影像→文本"全流程。技术要点:分别下载各自 DUA,物理上分开存储,统计层联合(报告三集来源),不做个体跨集链接(DUA 禁止重识别)。

§5.7 错误黑名单(本集特有)

①把 728 当住院数(实为 visits,住院 337);②把 Kehl et al. 2024 当数据论文(实为版本页误引,正确为 Jin et al. Sci Data 2024);③按行划分训练/测试(应按 patient_SN);④两套生命体征表合并去重后当单一来源;⑤把 “Unknown” 转归悄悄并进"Cured"(26 例,8%);⑥用 CT2hospitalID 837 行直接当 836 扫描的对账基准(先查差异行);⑦把中文诊断字段当 ICD 用(无编码,需 NLP 映射);⑧假定层厚统一(未披露,需重采样);⑨把 ExamReport 报告术语当影像金标准(是弱标签);⑩引用时间窗只写 2012-2022 或只写 2019-2022(双口径需同时披露)。

§5.8 可复现包模板

按 DUA"发布代码"义务,建议仓库结构:README(环境+数据声明:不含数据、含 MD5 校验说明);configs/(任务、划分种子、标签处理规则);src/(ingest:MD5+装载+对账;features:day-level 宽表;vision:重采样+窗宽窗位+mask;nlp:词典/模型;models:训练评测);notebooks/(对账报告、覆盖图、复现论文 Table 1);results/(CI 输出)。从申请数据当天就按此结构开工,发表时零返工。

§5.9 教学场景的最小实验设计

一节课(90 分钟)三步走:①装载 3 张表(PtAdmiTable/VitalSign/Lab_dictionary),统计 337 住院的年龄分箱分布并复现论文 Table 1(练习对账);②读一个 NIfTI(nibabel 三视图),观察肺窗渲染(练习影像基础);③用 ChiefComplain 双语对做一次词对齐观察(练习中文医疗文本)。素材小、风险低、覆盖三模态,适合本科高年级或研究生第一课。全程无需下载数据的场合可用论文 Fig.1 + Table 1/2 截图替代演示。

§5.10 与 492/497/498 构成的"脓毒症四重奏"

本系列已覆盖的脓毒症相关资源形成完整光谱:492 MIMIC-IV(重症表格全谱系,国际金标准)、497 Health Gym 合成集(免合规的 RL/生成模型练手场)、498 中文危重症表格库(同院前作)、500 本集(中文脓毒症影像+表格)。组合拳示例:在 492 上开发脓毒症预测模型 → 498/500 上验证跨语言跨中心迁移 → 497 上做无需合规的数据增强实验。这条路线图可直接写进课程设计或团队技术路线。

§5.11 R 语言路径(论文点名的 RNifti)

论文明确点名 RNifti 包操纵 CT,团队本身是 R 重度用户(张忠辉团队的论文多配 R 代码)。R 路线:RNifti::readNifti 读体数据 → imager/orthographic 三视图 → data.table 装载 CSV(2,251,285 行的护理表用 fread 秒级)→ survminer 做住院天数曲线。Python/R 混编也常见:影像侧 Python(nibabel+pyradiomics)、表格侧 R(tidyverse),以 Parquet/CSV 为交换格式。选型建议: radiomics 与深度学习走 Python;统计推断与出图走 R——与本团队的技术习惯对齐还有助于读他们的后续论文与代码。

§5.12 版本兼容与迁移预案

若官方发布 v1.1+:①MD5 清单先 diff,行数变化定位到表;②patient_SN/Hospital_ID 若保持稳定,旧宽表可增量更新;③若新增 DICOM 或标注,影像管线需重排(标注优先于重采样入包);④所有断言(§3.13 对账清单)改成参数化脚本,版本号作为断言输入。冻结 v1.0.0 的研究(论文在投/已发)不受影响——版本升级不追溯,但引用时要锁定版本号 1.0.0。

§5.13 一页纸执行摘要(给决策者的速览)

这是什么:浙江省人民医院急诊 ICU 的 337 例 Sepsis-3 脓毒症住院,配 836 次胸部 CT(NIfTI)+ 14 张临床表格(约 396 万行)+ 6,037 行中文检查报告;PhysioNet Credentialed + OMIX 双存储;Sci Data 2024 有正式数据论文。

获取成本:CITI 培训 + DUA + 数个工作日审批,零费用;国内可走 OMIX 通道免跨境合规。

技术门槛:32GB 内存单机可全量装载;影像侧需要 nibabel/SimpleITK 基础;无官方 pipeline,团队 GitHub 有部分脚本。

最大三个风险:无影像标注(需自建弱标注);层厚/重建核未知(radiomics 需敏感性分析);无官方评测协议(一切基准自建自证)。

最大三个机会:中文脓毒症 CT 的独占生态位;影像-表格-报告三模态配对的完整性;"498 表格库 + 本集影像扩展"的系列协同。

最适合的一句定位:给中文医疗 AI 团队的第一份"影像 × 表格 × 文本"三模态实战沙盘——小而深,方法学的公共试验田。

§6 实证图景:论文数据与社区使用的真实现状

§6.1 论文自证的全部实证内容

与典型的"数据描述 + 基线实验"论文不同,Jin et al. 2024 的实证部分只有数据本体:Table 1(337 住院的人口学与转归统计)、Table 2/3(14 表的 MD5 与 NumObs)、Table 4(CT2hospitalID 字段解释)、Table 5(用例清单)、Fig.1(样本 CT 三视图)。没有模型实验、没有特征基线、没有外部验证。这不是缺陷而是体裁——Sci Data 数据描述论文的规范就是"数据自证"。但使用者要知道:这意味着本集上没有任何已发表的"预期性能"可供对照,你的第一个 baseline 就是社区记录。

§6.2 影像侧的空白清单:研究者机会地图

按机会大小排序:①无任何影像标注——肺野分割 mask、磨玻璃/实变检测、脓毒症肺损伤定量评分(类 CT-SS/RALE)全部空白,做半自动标注 + 主动学习闭环是直接贡献;②CT 与转归的关联——836 次扫描 × 337 住院的院内转归,足够做"入院前基线 CT 特征 → 院内死亡/未愈"的弱预测研究;③影像组学特征稳定性——重建核未知的异质队列上测 PyRadiomics 特征的组内相关,本身就是方法学论文;④报告-影像对齐——ExamReport 的 CT 报告与 CTImage 的弱对齐语料,可做中文放射报告生成的评估集雏形;⑤多模态融合原型——表格 + 影像 + 文本的三模态最小集,论文用例表(Table 5)点名机器学习预测与决策支持。

§6.3 表格侧的可用任务盘点

①院内死亡/未愈预测(三分类,量级 337,只能做浅模型 + 敏感性分析);②住院时长回归(中位 22 天,右偏分布,建议 log 变换);③液体平衡轨迹与转归(NursingChart_IO 98,231 行);④抗生素启动时机与药敏匹配度(Medication + DrugSens 交叉);⑤检验异常模式挖掘(Lab 789,010 行 × 246 项目字典);⑥转科轨迹聚类(HospitalTransfer 277 行,量级只够描述性)。注意全部任务都受"day 粒度 + 单中心"约束,结论表述必须限定语境。

§6.4 NLP 侧的真实语料价值

主诉双语对(728 行 × 中文/英文两列)是现成的领域平行语料,虽然短句、术语密度高,但可支撑"中文医疗短文本翻译评估"的练手;ExamReport 6,037 行报告正文 + PtAdmiTable 的 Med_history/PastHistory 长文本构成中文医疗叙事语料——在"中文放射报告 + 对应影像存在"这个维度上,公开资源屈指可数(对照:MIMIC-CXR 报告是英文;国内 IRIS 类数据集不公开)。做中文报告生成/信息抽取的研究者,本集是"影像可获取"这一稀缺属性的少数供给者。

§6.5 与论文自引用网络的位置

论文参考文献 10 指向 Jin et al. 2023(Sci Data 10:49,即 498),参考文献 11 指向 Sepsis-3 共识,12 指向 NGDC 资源综述,13 指向 PhysioNet 版本页自身。这个引用环显示团队把本集定位为"498 的影像扩展 + 国际标准的本地实现"。截止核查日(2026-09),尚未检索到以本集为对象的同行评审后续研究(论文发表不足两年、Credentialed 访问门槛、无官方基准都抑制了快速采用)——使用本集发表的工作将享有"首发者优势",同时也承担方法自证的完全责任。

§6.6 团队生态的持续产出

张忠辉团队是中文危重症数据公开化的多产节点:498(2023 表格库)、本集(2024 影像扩展)、Zigong 第四人民医院感染 ICU 库(2022,四川协作)、以及 CMAISE 脓毒症多组学联盟的系列论文(单细胞/蛋白组学 + 临床)。对使用者的含义:表结构约定、ID 体系、双语策略在团队作品间高度一致,学会一套可复用到多个集;但团队风格也意味着共同的盲区(评测协议薄弱、术语标准缺位),使用时需补位。

§6.7 量级的诚实定位

把本集放回同类资源的量级光谱:MIMIC-CXR 377,000+ 影像 / 65,000 患者(多疾病胸片);RSNA 脑出血 CT 25,000+ 研究(单任务标注);FastMRI 数千例 MR;本集 836 次 CT / 327 住院 / 单疾病 / 无标注——量级在 CT 类公开资源中属于"迷你"。它的价值不在规模而在三件事:影像与临床表格的配对深度、中文报告语料的稀缺性、以及 Sepsis-3 标准化队列的概念纯净度。夸大宣传它的规模或当作通用 CT 预训练语料是误用。

§6.8 八个坑点(使用前必读)

坑点 1:层厚/重建核未知。 DICOM 头未随 NIfTI 交付,radiomics 特征的稳定性无从官方验证——重采样 + 敏感性分析自保。

坑点 2:双时间窗口径。 2012-2022(Data Records/版本页)vs 2019-2022(Methods)并存,引用与检索必须双口径声明。

坑点 3:转归三分粗口径。 Cured/Not cured/Unknown 不等于存活/死亡/失访,"未愈"含死亡但边界靠 DESC 文本推断,26 例 Unknown 需显式处理。

坑点 4:五数字纠缠。 728/337/327/836/837 分别是 visits/住院/有 CT 住院/CT 扫描/映射行数,每个数字口径不同,写论文前对一遍 §3.2 表。

坑点 5:诊断无编码。 Diagnosis 8,459 行为中文文本,无 ICD 映射,跨库对比前先做术语归一。

坑点 6:SOFA 无时序。 Sepsis-3 纳入用了 SOFA,但 SOFA 计算的输入序列未公开交付,复现纳入决策不可能——把纳入当黑盒接受。

坑点 7:门诊 CT 的负偏移。 CTexame_DateTime 为负属正常(入院前门诊检查),不要当数据错误清洗掉。

坑点 8:版本页误引。 Kehl et al. Nat Commun 2024 与本集无关,引用链以 Jin et al. Sci Data 2024 为准,别让审稿人抓住。

§6.9 自查清单(投稿前逐项打勾)

  • [ ] 队列口径写清:728 visits / 337 admissions / 327 with CT / 836 scans
  • [ ] 时间窗双口径披露(2012-2022 版本页 vs 2019-2022 论文 Methods)
  • [ ] 引用三层齐全(版本页 + Sci Data 论文 + PhysioNet 平台引文),未误引 Kehl
  • [ ] 划分按 patient_SN,种子已公开
  • [ ] Unknown 转归的处理方案 + 敏感性分析
  • [ ] 影像预处理(重采样参数、窗宽窗位、mask 来源)全部报告
  • [ ] 中文长文本未被我方翻译污染(LLM 处理位置合规)
  • [ ] DUA 三条款自查:无重识别、代码仓库公开、未二次分发数据
  • [ ] OMIX005655 与 PhysioNet 双来源声明(如用了 OMIX 副本)
  • [ ] 层厚异质性的限制声明

§6.10 口径诊断树

问:你的研究需要什么?→ 若要大样本影像监督信号:本集无标注,转 MIMIC-CXR/RSNA;→ 若要脓毒症影像 + 临床配对:本集适合,先确认 327 有 CT 住院的转归分布够不够统计功效;→ 若要中文报告 NLP:ExamReport 可用,确认你接受 Hospital_ID 级弱对齐;→ 若要时序精细建模(小时级):本集 day 粒度不够,转 492 MIMIC-IV 或 2019 Challenge;→ 若要跨中心验证:本集单中心,作训练/原型,验证转 eICU/HiRID;→ 若要免合规教学:Credentialed 门槛高,转 497 合成集。

§6.11 静态 × 活跃度定位

静态属性:v1.0.0 冻结、无更新路线图、无资助信息公开——资源活跃度存疑。活跃属性:团队持续产出(2022/2023/2024 连续三年发布)、共享代码库存在、PhysioNet/OMIX 双平台在线。综合判断:这是一份"稳定但不生长"的资源,适合当作固定底座做研究,不适合期待补丁或扩展。若团队后续发布 v1.1(如补 DICOM 或标注),迁移成本可控(ID 体系稳定的前提)。

§6.12 横向定位:脓毒症影像资源的稀缺性论证

公开的"脓毒症 × CT"资源目前近乎只有本集。其他脓毒症资源要么无影像(498、Zigong、2019 Challenge、Health Gym),要么影像非 CT(MIMIC-CXR 胸片、eICU 影像缺失),要么不公开(各院 PACS)。本集的稀缺性溢价是真实的;但稀缺不等于成熟——恰恰因为独一份,它的方法学瑕疵(层厚未知、无标注)没有同类资源可交叉校验,使用者的自证义务更重。

§6.13 竞品逐项对照表(脓毒症与胸 CT 相关公开资源)

维度 本集 MIMIC-CXR 2019 Challenge 498 中文危重症库 497 Health Gym
模态 CT + 表格 + 文本 胸片 + 表格 + 报告 时序表格 纯表格 合成时序
疾病聚焦 脓毒症(Sepsis-3) 全病种胸片 脓毒症时窗 全谱系危重症 脓毒症/低血压(合成)
规模 836 CT / 337 住院 37.7 万影像 / 6.5 万患者 4 万 ICU stay 院内 ICU 全量 2 套合成库
语言 中文为主 + 短文本英译 英文 英文 中文为主 英文(合成)
标注 无 病灶标签(CheXpert 式)+ 报告 脓毒症 onset 标签 无 合成标签
访问 Credentialed + DUA Credentialed + DUA Open Credentialed Credentialed
时序粒度 天 天(检查级) 小时 天 分钟(合成)
评测协议 无 竞赛惯例基线 官方挑战赛框架 无 官方 RL 基线
适合 中文多模态方法学首发 大样本影像监督 时序预测对标 中文 EHR 建模 免合规练手

结论:本集在"脓毒症 × CT × 中文"三维交集上无直接竞品;所有相邻资源都在至少一个维度上让步。使用者的选型问题因此转化为"你最不能让步的是哪个维度"。

§6.14 十问十答:批判视角的自查

  1. 836 张 CT 能支撑深度学习吗? 预训练-微调可以,从头训练不行;论文用例表说的"机器学习算法开发"应理解为浅层模型与微调范式。
  2. 单中心数据有什么不可替代的价值? 表结构同质、文本风格一致、流程可控——恰恰是方法学开发(而非结论外推)最需要的属性。
  3. 无标注是致命伤吗? 对监督学习是门槛,对弱监督/半监督/基础模型评测是空白机会——标注空白的另一面是首发权。
  4. 天级粒度丢掉了什么? 脓毒症恶化的小时级动态、抗生素 1h bundle 的执行精度、ICU 峰值事件的精确时点——这些研究请转 MIMIC-IV/2019 Challenge。
  5. 中文语料是壁垒还是资产? 对国际用户是壁垒(需自带翻译管线),对中文 AI 生态是稀缺资产(影像可对齐的中文报告几乎独一份)。
  6. 为什么相信 Sepsis-3 被正确执行? 不能完全相信——SOFA 输入未交付,纳入是黑盒;缓解手段是用 Desc 文本抽样反查纳入合理性并在论文声明局限。
  7. Unknown 26 例会毁掉结论吗? 会污染比例估计但不会毁掉方法学演示;主分析剔除 + 敏感性分析计入是标准操作。
  8. 层厚未知对 radiomics 意味着什么? 特征间可比性存疑、跨集不可比;稳妥路线是把"层厚未知条件下的特征稳定性"本身作为研究对象(§7.15 提案一)。
  9. 为什么不保留 DICOM? 官方未解释;可推测是为减小体量与规避烧录 PHI 复查成本。使用者可在限制节要求社区关注此缺口。
  10. 本集五年后还重要吗? 取决于中文医疗 AI 的数据主权需求走向——若国内多模态语料需求持续增长,"唯一公开中文脓毒症 CT"的地位短期无替代者。

§6.15 增量策略:小数据上做大科学的四条路径

路径一(深度换广度):不追求全队列普查结论,而是在 327 例有 CT 的住院内做窄而深的机制研究——如"入院前 CT 定量的肌肉减少症指标与 ICU 停留时长的关联",样本虽小但机制假设明确,效应量可检测。路径二(方法换数据):把本集定位为"方法学的公共试验田"——弱标注精度评估、跨语言术语映射、多模态对齐协议等方法学产出不依赖大样本,337 例足够支撑方法比较实验。路径三(聚合换规模):与 498/495/Zigong 等同生态数据集做统计层聚合(不链接个体),用元分析式方法把有效样本量放大,代价是要处理集间异质性。路径四(时间换证据):接受 v1.0.0 冻结的现实,把本集当作"预注册式"研究的固定底座——现在设计、公开协议、五年后引用,冻结性反而成为可复现性的卖点。

§6.16 与"数据集老龄化"的对峙

一个 2024 年发布、2026 年仍无社区研究的数据集,必然面对"老龄化质疑":数据是否过时?本集的三个缓冲因素:其一,脓毒症的临床定义(Sepsis-3)与影像学基础在 2016-2026 十年间稳定,不存在 COVID-CT 式的定义漂移;其二,中文医疗文本的语言生态变化慢于英文,2026 年的中文报告与 2022 年的写法差异有限;其三,单中心数据的"时代标本"价值随时间上升而非下降——11 年(或 4 年)窗口内的诊疗习惯演变本身就是回顾性研究对象。真正的风险不是过时,而是"无人问津":如果 2027 年前仍无公开研究,它的引用网络将单薄到影响学术认可。这个风险的正解不在数据集本身,而在社区——包括本百科条目在内的"使用指南"类产出,本质是在降低采用门槛。

§7 AI 实践指南:从喂法到发表

§7.1 五种喂法总览

①影像分类微调(CT 基础模型 + 少样本,337 住院量级);②多模态融合原型(表格宽表 + 影像嵌入 + 报告文本三分支);③弱监督标注工厂(词典/LLM 从 ExamReport 抽病灶标签,回填影像训练);④中文医疗 NLP(报告信息抽取、主诉翻译对齐);⑤教学演示(三模态全流程最小实验)。每种喂法的具体配方见后续小节。

§7.2 30 分钟最小实验

目标:从零到"一份脓毒症 CT 的三视图 + 表格画像"。步骤:nibabel 读一个 .nii.gz → matplotlib 三视图渲染(肺窗)→ pandas 读 PtAdmiTable 滤出该 Hospital_ID 的行 → 打印转归/主诉/住院天数。产出一张"患者卡片"。这个实验验证你的装载链路完好,也是 DUA 合规的本地分析起点。

§7.3 泄漏防控专项

本集的泄漏面:①patient_SN 级泄漏(一人多 visit,划分必须按 patient_SN);②时间泄漏(day 粒度下"当日事件"在预测时点边界模糊——统一规则:预测当日转归时排除当日 24h 内事件或全部纳入并声明);③标签泄漏(DiagnosisOnDeath/StatusOnDischarge_DESC 文本里可能含预后信息,特征工程时禁用转归附近字段);④中心泄漏(单中心集上训练的模型评估必须只报内部指标,别暗示外推性能)。

§7.4 公平性与偏差清单

性别:男 69.4%,模型对女性亚组性能需单独报告;年龄:分箱后 60 岁以上 75%,儿童仅 2 例——儿童结论一律禁止;门诊 vs 住院:728 visits 中门诊 391 例,门诊患者字段稀疏,混训需子群标记;影像可得性:10 例住院无 CT,原因未知——"有 CT"本身可能关联病情选择,可用逆概率加权做敏感性检验。

§7.5 LLM 实验配方

三条合规路线:①境内部署开源模型(Qwen/GLM 系列)做 ExamReport 的病灶信息抽取,输出结构化 JSON——推荐主路线,规避数据出境问题;②主诉双语对做翻译评估基准(零样本 vs 微调小模型);③Med_history 长文本做检索增强问答原型(检索本地化、生成境内部署)。提示词工程要点:报告文本含 “****” 日期脱敏与少量缺字,提示词里声明这些为脱敏产物避免模型误判。严禁把原始数据上传境外 API(DUA"不分享"条款的最严格解读)。

§7.6 弱监督级联配方(填补无标注空白的正路)

第一级:构建中文放射术语词典(磨玻璃影、实变、胸腔积液、纤维条索、结节、钙化…约 50 词级)从 6,037 行 ExamReport 匹配出"报告级弱标签";第二级:Hospital_ID + 时间最近邻把报告标签挂到 CT 文件(标注近似率与误挂率抽检 100 例);第三级:弱标签预训练 + 200 例人工精标的验证集(只做验证不做训练)测弱标签精度;第四级:报告精度达标(如 P≥0.8)后再上影像弱监督训练。整套流程的精度账本全部公开——弱监督的价值取决于诚实度量。

§7.7 多模态融合原型架构

最小可行三分支:表格分支(day-level 宽表 → MLP/TabTransformer)+ 影像分支(CT 基础模型如 MedicalNet/CT-CLIP 类预训练 encoder → 池化)+ 文本分支(中文 BERT 对主诉/报告编码)→ 晚融合拼接 → 三分类转归头。337 例的量级决定:各分支先在各自模态上预训练/外源权重初始化,融合层参数 <10% 总量,五折 CV + 按患者分层。这个原型在论文 Table 5 的"机器学习预测"用例上是合规且现实的贡献。

§7.8 成本核算

数据获取:CITI 课程 2-4 小时 + 审批数工作日(免费);装载:1 人日;特征工程基线:3-5 人日;影像预处理(836 体):单 GPU 0.5 天;弱标注工厂:词典版 2 人日,LLM 版 +1 GPU 周;人工精标 200 例:放射科医生 2-3 天(需要合作临床团队)。总启动成本约 2-3 人月——比申请自建队列便宜两个数量级,这是"小而深"资源对单中心的真正卖点。

§7.9 负结果也有价值

预期中的负结果:337 例上深度网络的融合模型可能不敌 XGBoost 表格基线(样本量瓶颈);弱标签精度可能在报告-影像时间错配上折损;day 粒度时序特征可能丢失脓毒症恶化的小时级信号。这些负结果发表时把"为什么输"讲清楚(量级/粒度/错配),对本生态后来者是避坑地图,比硬凑的正结果更有引用价值。

§7.10 与 492 MIMIC-IV 的跨库迁移实验

方案:在 492 上训练脓毒症相关模型(如 SOFA 恶化预测),把特征空间约束到本集也有的字段(vitals/labs/用药),迁移到本集 day-level 宽表测性能衰减——这是"跨语言跨体系迁移"的公开实验台。障碍清单提前打:诊断无 ICD(映射层)、检验无 LOINC(建 246 项人工映射)、时间粒度天 vs 小时(聚合降级)。产出:一份公开的"中英危重症术语映射表"本身就是社区贡献。

§7.11 特征工程专属技巧

①Age_cut 保持分箱编码(别插值回连续年龄——分箱是隐私承诺,插值是变相重识别);②Med_history 长文本先抽"既往史关键词"(高血压/糖尿病/冠心病/COPD…)成布尔特征,比整段 embedding 稳;③抗生素首剂时间相对入院日的偏移是脓毒症指南敏感指标(1h bundle);④NursingChart_IO 的出入量差值按日累计,前 3 天累计正平衡是 AKI/预后的经典特征;⑤CTexame_DateTime 的符号与绝对值本身就是特征(入院前 CT = 门诊来源 = 病情阶段不同)。

§7.12 教学化改造

把本集做成两周课程:第 1 周表格(装载/对账/宽表/基线模型),第 2 周影像与文本(NIfTI 渲染/弱标注/三模态拼装)。考核题示例:“用 ≤5 个特征预测院内转归,报告 Unknown 处理方案与性别分层性能”。课程包(不含数据、含装载脚本与 MD5 说明)符合 DUA——学生各自申请访问。

§7.13 监控与回归防护

若在本集上部署迭代(如院内 demo):①冻结 v1.0.0 校验集(MD5 锁定)作回归基准;②每次特征/模型变更跑固定报告(划分、指标、分层);③弱标签管线加"词典版本号",术语表变更即触发全量重抽;④所有 artifact 带版本号入库。单中心冻结数据上的"部署"更多是教学演练,但工程习惯从第一行代码养成。

§7.14 复现工程的推荐工具链

DVC 或 git-lfs 管理 MD5 清单与中间产物的版本对应;snakemake/airflow 编排 ingest→features→models;pytest 固化对账断言(728/337/327/836/837 五数字断言、表间 Hospital_ID 覆盖断言);papermill 参数化 notebook 复现论文 Table 1。DUA 要求的"随论文发布代码"按这个标准交付,审稿与传播都受益。

§7.15 三条可发表的具体提案

提案一(方法学):异质重建核未知条件下的胸 CT radiomics 特征稳定性评估——在本集 836 体上测 IBSI 特征的重复性,产出"无 DICOM 元数据时代 radiomics 可行性"的实证边界。提案二(临床 AI):入院前基线 CT 影像组学 + 24 小时表格特征的多模态院内转归预测,337 例五折,报告性别/年龄分层与 Unknown 敏感性。提案三(NLP):中文放射报告弱标注工厂的全流程精度账本(词典 vs LLM vs 人工三层对照),副产品是公开的中文胸 CT 报告术语表。三条都是本集"独一份属性"能支撑的增量。

§7.16 特征字典:从原始字段到模型特征的映射建议

原始字段 建议特征 注意事项
Age_cut 九档序数编码或 one-hot 禁止插值回连续年龄
Sex 二元 报告性别分层性能
DaysHospitalStay 目标泄漏字段,仅作标签侧使用 不得入特征
VitalSign(四类) 日级 min/max/mean/last/斜率 两表来源分开统计
NursingChart_IO 日入量、日出量、累计净平衡(前 72h) 单位归并先于求和
Lab(246 项) 高频项日级 latest + 24h delta 文本截断值编码规则显式化
Medication 首剂抗生素偏移日、日用药种类数 中文药名映射表需版本管理
DrugSens 耐药表型布尔(如耐甲氧西林) 按培养事件聚合防行数膨胀
MicrobiologyCulture 阳性培养计数、首次阳性偏移日 阴性培养也是信息
HospitalTransfer EICU 停留天数、转科次数 EICU 命名两条目都要匹配
CTexame_DateTime 首次 CT 偏移日、CT 次数、入院前 CT 布尔 负偏移是特征不是噪声
ChiefComplain_Eng TF-IDF 或词嵌入 双语对可先做翻译质量抽查
ExamReport 病灶词典命中向量 弱标签属性永久保留
Diagnosis(中文) 词典归类(感染灶部位等) 无 ICD,映射表公开

这份字典的设计原则:所有特征都可从公开表格推导、不引入外部个体数据、每个特征可追溯到原始字段——满足 DUA 的可复现义务与审稿的证据链要求。

§7.17 审稿应对话术预置

  • “样本量太小” → 回应:本集定位为方法学原型与弱标注工厂验证,效应量估计配合 bootstrap CI;规模局限在限制节首条声明,并给出同规模已发表工作的先例。
  • “单中心” → 回应:以跨中心验证为明确 future work,引用 2023 Intensive Care Med 疾病轴论文论证单中心复现性难题的行业共识;不外推结论。
  • “无影像标注,弱标签不可信” → 回应:弱标签全流程精度账本公开(词典 → 挂接 → 抽检),验证集独立于训练,弱标签仅用于预训练阶段。
  • “时间窗口径混乱” → 回应:双口径(2012-2022 版本页 / 2019-2022 Methods)如实披露,分析按 EICU 纳入期口径为主、全窗口径做敏感性。
  • “转归标签粗糙” → 回应:三分类 + Unknown 显式处理 + DESC 文本细化的次级标签做敏感性;不声称死亡率精度。
  • “为什么不用 MIMIC?” → 回应:研究问题需要中文语境与影像-表格-报告三模态配对,MIMIC 系无对应组合;已做 MIMIC 侧的概念对照(§4.7)。

§7.18 部署差距清单:从 notebook 到病房的距离

若目标不止论文而是院内工具,差距清单如下:①时间粒度——day 级训练的模型到院内部署时拿不到"日终汇总",需要重定义预测时点并重新验证;②数据位置——DUA 数据不能上院内生产系统,只能迁移方法与模型权重(需成员推断风险测试);③术语漂移——院内 LIS/护理系统的项目名与本集 246 项字典不同,映射表是部署资产的一部分;④无前瞻验证——337 例历史数据的任何 AUC 都不构成前瞻性能承诺,部署前需院内影子模式试运行;⑤审批路径——临床决策支持工具按院内医疗器械/软件管理流程走,与本集的科研许可互不相干。诚实地说:本集训练的任何模型距离病房都还有完整的一个验证阶梯,把它定位为"方法学证据源"比"可部署模型源"更符合现实。

§7.19 成本-收益核算:值不值得把 2-3 人月投在这里

投入侧(§7.8 的明细):申请与合规 1 周、装载与对账 1 周、特征工程与基线 2-3 周、影像管线 1-2 周、弱标注工厂 2-4 周——总计 2-3 人月,一台 32GB 工作站,零数据费。收益侧的三种情景:情景 A(方法学论文):弱标注精度账本 + 多模态融合原型,投 Medical Image Analysis 级别的影像方法刊或 JAMIA 级别的信息学刊,首发者优势明显;情景 B(教学资产):两周课程 + 课程包,收益是教学影响力与学生管线经验,间接回馈科研招聘;情景 C(预研投资):为团队后续申请自建队列或多中心项目积累"我们已经在中国公开数据上验证过管线"的证据。三种情景的期望收益都明显高于 2-3 人月的机会成本,唯一不划算的用法是"只下载不分析"——Credentialed 义务下这也是合规负担而非资产。

§8 伦理与合规:Credentialed 通道的完整义务

§8.1 双平台合规的叠加义务

PhysioNet DUA 三条款(不重识别/发布代码/不分享)+ OMIX 受控协议(境内合规申请、用途声明)构成叠加义务。实操要点:两份协议独立生效——从 PhysioNet 下载的副本按 PhysioNet 规则管,从 OMIX 申请的副本按 NGDC 规则管,不得互相转移副本。团队成员变更时新成员需各自完成培训与申请,不能"共享账号"。

§8.2 去标识的残余风险认知

HIPAA 标准去标识已做:随机 ID、年龄分箱、日期相对化、文本脱敏、医护 ID 删除。残余风险仍在:①11 年单中心 + 罕见病亚组(如 (0,18] 年龄档仅 2 例)的组合可能具备准标识性;②Med_history/ExamReport 长文本可能含家庭住址碎片(作者声明地名已删,但自由文本的穷尽性无保证);③影像烧录字符已按"CT 不含 PHI"声明处理,但使用者如发现残留烧录信息应停止使用并报告平台。任何疑似重识别发现的第一动作是停止分析、报告 PhysioNet/OMIX,而不是继续挖掘。

§8.3 LLM 时代的数据位置合规

"不分享数据"条款在 API 时代的解读:把原始文本发送给第三方云端 LLM(无论是否承诺不留存)在多数解读下构成数据向第三方披露。本系列(495 PhysioNet LLM 政策、498)已建立的一致口径:境内部署的开源模型是安全路线;境外 API 需法务书面确认;云端 API 的"零留存"承诺不自动等于合规。论文发表时的语言模型使用声明应写明模型名称、部署位置、是否接触原始文本。

§8.4 引用伦理与误引纠正

社区有义务主动纠正版本页的 Kehl 误引:凡使用本集的论文,引用块写 Jin et al. Sci Data 2024(DOI 10.1038/s41597-024-04132-z),不写 Kehl;审稿中遇到同行误引 Kehl 应友好指出。这既是对数据作者的致谢,也避免文献计量把本集的引用算到无关论文头上。

§8.5 二次发布与衍生数据集

DUA"不分享"意味着:不可把表格子集/影像切片/弱标注连同数据本身再分发。合法的共享形式:代码、术语映射表、不含原始数据的聚合统计、模型权重(需评估模型反演残余风险——337 例小数据上过拟合的模型有记忆风险,发布前做成员推断测试或提供差分隐私声明)。这与本系列 493/494 讨论过的"标签工厂产出可共享、源数据不可共享"的原则一致。

§8.6 同门数据集的合规协议对照

把本系列已覆盖的中国危重症系数据集合规要点并排:

项 495 PIC(ZUCH) 498 中文危重症库(ZPPh) 500 本集(ZPPh)
平台 PhysioNet PhysioNet PhysioNet + OMIX
访问 Credentialed Credentialed Credentialed + Controlled
培训 CITI 或中国 GCP CITI CITI
去标识 日期平移 50-100 年 随机 ID + 相对日期 随机 ID + 分箱 + 相对日期
特殊条款 零留存 LLM 建议本地部署 发布代码义务 不重识别 + 发布代码 + 不分享
伦理主体 ZUCH 伦理委员会 ZPPh 伦理委员会 ZPPh 伦理委员会(2023-397)

三个集的共同点:都是"机构伦理 + 平台 DUA"双层结构,都把可复现性义务写进协议(495 的数据发布授权、498/500 的代码发布义务)。差异点集中在去标识策略(495 的日期平移 vs 498/500 的相对日期)与双通道(仅本集有 OMIX)。跨集研究的合规基线:分别满足各自协议,义务取并集;其中"发布代码"义务覆盖所有用到 498/500 的工作。

§9 FAQ:60 问快答

§9.1 身份与获取(Q1-Q12)

Q1:官方 slug 是什么? A:chest-ct-sepsis-er,PhysioNet URL 路径 https://physionet.org/content/chest-ct-sepsis-er/1.0.0/。

Q2:DOI 是什么? A:数据 DOI 10.13026/zne5-qh18;论文 DOI 10.1038/s41597-024-04132-z。

Q3:论文标题为什么和版本页不一样? A:版本页用 Emergency Department,论文用 emergency intensive care unit,指同一数据集;EICU 位于急诊科内。检索时两个标题都要试。

Q4:谁写的? A:版本页署名 Senjun Jin、Zhongheng Zhang;论文署名 7 人(Jin S, Cai W, Shen Q, Yang L, Sheng’an H, Fu J, Zhang Z)。

Q5:什么时候发布的? A:PhysioNet 2024-10-28;论文 2024-11-20 刊出(Sci Data 11:1261)。

Q6:免费吗? A:数据免费但需 Credentialed Access:注册 + CITI 培训 + 签 DUA + 申请审批。OMIX005655 通道对中国研究者免跨境合规。

Q7:数据在哪两个平台? A:PhysioNet 与 NGDC OMIX(OMIX005655,BioProject PRJCA006118),同一份数据双存储。

Q8:下载多大? A:14 张 CSV 数十 MB + 836 个 NIfTI 体数据约 10-40GB,按 50GB 规划存储。

Q9:需要什么培训? A:CITI 人体受试者保护课程(PhysioNet Credentialed 通行要求)。

Q10:DUA 核心条款? A:不试图重识别、随论文发布代码、不与他人分享数据。

Q11:RRID 是什么? A:SCR_007345(与 PhysioNet 全库一致的资源标识)。

Q12:有中文入口吗? A:OMIX(ngdc.cncb.ac.cn)页面为中文界面,提交者信息挂浙江大学。

§9.2 数据内容(Q13-Q28)

Q13:多少数据? A:728 次就诊(含门诊)、337 例住院、327 例住院有 CT、836 次胸部 CT、14 张表约 396 万行。

Q14:为什么 327 < 337? A:10 例住院无 CT,官方未解释(可能影像未归档或仅临床数据保留)。

Q15:CT 是什么格式? A:NIfTI(.nii.gz),SimpleITK v2.2.0 从 DICOM 转换,多序列时取胸部序列。

Q16:有 DICOM 原始文件吗? A:没有,只有 NIfTI,DICOM 技术头(层厚/重建核)未随附。

Q17:有影像标注吗? A:没有任何官方标注(无 mask、无病变标签、无评分)。

Q18:最大的一张表? A:NursingChart_VitalSign 2,251,285 行(占全库 57%)。

Q19:有检验字典吗? A:Lab_dictionary 246 项,无 LOINC 映射。

Q20:微生物数据全吗? A:MicrobiologyCulture 20,661 行 + DrugSens 55,029 行药敏,是本集特色板块。

Q21:有 ICD 编码吗? A:没有,Diagnosis 8,459 行为中文文本。

Q22:报告文本有多少? A:ExamReport 6,037 行(CT/超声/MRI 报告),中文保留。

Q23:主诉有英文吗? A:有,ChiefComplain(中文)+ ChiefComplain_Eng(人工复核英译)构成双语平行。

Q24:Med_history 是什么? A:主表中的大段中文自由文本(现病史/既往史),作者刻意不翻译以保 NLP 保真。

Q25:_24hr 结尾的字段是什么? A:入院 24 小时内出院(或死亡)患者的专用主诉/状态快照,多数住院为空。

Q26:时间戳是什么粒度? A:天。全部时间字段为相对入院日的天数偏移,自由文本内日期以 “****” 替换。

Q27:CT 时间为负数是错的吗? A:不是,负值表示入院前(门诊期)完成的 CT。

Q28:年龄为什么是分箱? A:HIPAA 去标识要求,Age_cut 九档分箱,无法还原连续年龄。

§9.3 队列与临床(Q29-Q40)

Q29:脓毒症怎么定义的? A:Sepsis-3.0(疑似/确诊感染 + SOFA 急性升高 ≥2),对象为 EICU 收治患者。

Q30:能自己复现纳入过程吗? A:不能完整复现——SOFA 计算输入未交付,纳入决策当黑盒接受。

Q31:性别比例? A:女 103 / 男 234(男 69.4%)。

Q32:年龄结构? A:60 岁以上约 75%,(70,80] 档最多 95 例,儿童仅 2 例。

Q33:住院多久? A:中位 22 天(IQR 12-36)。

Q34:转归分布? A:治愈 185(56%)/未愈 121(36%)/未知 26(8%)。

Q35:有院内死亡标签吗? A:无显式死亡字段,死亡信息在 StatusOnDischarge_DESC 与 DiagnosisOnDeath 文本中推断。

Q36:有 SOFA 时序吗? A:没有,需自行用检验/生命体征近似重建并声明。

Q37:数据时间窗到底几年? A:双口径:版本页与论文 Data Records 写 2012-2022,论文 Methods 写 2019-2022(EICU 纳入期)——引用时双口径披露。

Q38:医院是哪家? A:浙江省人民医院(杭州医学院附属人民医院),通讯作者张忠辉隶属浙大邵逸夫医院。

Q39:伦理批号? A:浙江省人民医院伦理委员会 2023-397,知情同意豁免(回顾性)。

Q40:与 498 是同一批患者吗? A:同院同管线,患者可能重叠,但 DUA 禁止跨集个体链接,只能统计层对照。

§9.4 使用方法(Q41-Q52)

Q41:怎么把 CT 和临床表连起来? A:CT 文件名 serialID → CT2hospitalID → Hospital_ID → 任意表。

Q42:推荐的装载环境? A:32GB 内存单机 + Python(nibabel/pandas)+ SQLite/PostgreSQL 即可全量装载。

Q43:划分怎么做? A:按 patient_SN 分层划分,绝不按行。

Q44:两套生命体征表怎么用? A:VitalSign 与 NursingChart_VitalSign 来源不同(监护 vs 护理录入),并行使用并标注来源,勿合并去重。

Q45:影像预处理第一步? A:重采样到统一 spacing——层厚异质性未知,重采样是公平比较前提。

Q46:能做 radiomics 吗? A:能但有限制:重建核未知,PyRadiomics 特征稳定性需敏感性分析,论文需声明。

Q47:能从头训练 CNN 吗? A:不现实(337 例),用预训练 encoder + 微调。

Q48:怎么生成影像弱标签? A:从 ExamReport 中文报告做术语词典匹配 → 时间最近邻挂接到 CT → 人工抽检验证精度。

Q49:能用 ChatGPT/GPT-4 处理报告文本吗? A:不建议——境外 API 与 DUA"不分享"条款冲突,用境内部署开源模型。

Q50:需要翻译中文长文本吗? A:研究者自理;作者只译了元数据与短文本,长文本刻意保留中文。

Q51:有官方代码吗? A:团队仓库 github.com/zh-zhang1984/ZhejiangProvinceICU(与 498 共享),无官方 pipeline 承诺。

Q52:MD5 怎么用? A:论文 Table 2/3 给了 14 表哈希,下载后 md5sum 校验完整性。

§9.5 对比与选择(Q53-Q60)

Q53:和 MIMIC-CXR 比选哪个? A:要大样本胸片+英文报告选 MIMIC-CXR;要脓毒症 CT+中文表格报告配对选本集。

Q54:和 492 MIMIC-IV 呢? A:精细时序(小时级)与标准化术语选 MIMIC-IV;中文语境与影像配对选本集。

Q55:能和 497 合成集互补吗? A:能——497 免合规练手管线,本集做真实数据验证,构成"合成→真实"梯度。

Q56:想快速跑通流程又不想申请权限? A:本集不合适(Credentialed 门槛),用 497 或公开教学集先练,再申请本集。

Q57:一篇论文只用本集够发吗? A:方法学/弱标注/NLP 贡献够;纯临床结论因单中心+量级小需谨慎定位。

Q58:审稿人会攻什么? A:量级、单中心、无标注、双时间窗口径、转归粗标签——提前在限制节逐条回应。

Q59:数据会更新吗? A:截止 2026-09 仍 v1.0.0,无更新公告;团队 2022-2024 连续产出的历史支持期待,但不可依赖。

Q60:一句话总结? A:中文脓毒症 CT + 临床配对的独一份小样本深表型资源——文档一流、协议自建、合规走 Credentialed,适合方法学首发而不适合刷榜。

§9.6 进阶问答(Q61-Q90)

Q61:CT2hospitalID 多出的那 1 行怎么处理? A:装载后做 serialID 与文件名的集合差,找出差异行(可能为表头残留或重复映射),人工判定后写进对账报告,不要默默丢弃也不要悄悄保留。

Q62:能按 serialID 直接对应检查报告吗? A:不能精确对应——ExamReport 无 serialID 字段,只能 Hospital_ID + 时间偏移最近邻匹配,匹配率与错误率需抽检 100 例量化。

Q63:门诊就诊(391 例)有什么用? A:它们承载了入院前 CT 与门诊检验,是"基线影像"的主要来源;建模时作为独立子群或仅作 CT 来源通道。

Q64:护理表的采样间隔是多少? A:官方未披露统计,建议自行计算每患者采样间隔分布——护理录入的间隔通常与班次相关,直接假设等间隔会错。

Q65:检验截断值怎么编码? A:“>1000” 编码为 1000 + 布尔截断位,“<0.03” 编码为 0 + 布尔位——保留"超过测量范围"的信息,规则写进方法节。

Q66:能重算 SOFA 吗? A:可近似(氧合、血小板、胆红素、肌酐、GCS 映射到可得字段),但缺血压/机械通气细节,近似 SOFA 与真实 SOFA 的差异必须声明。

Q67:脓毒症休克亚组能识别吗? A:粗略可以——升压药使用(Medication 药名词典)+ 乳酸(Lab)组合,但无血管剂量的精确时序,休克定义只能是简化版,需声明偏离 Sepsis-3 休克标准。

Q68:CT 只有一次的患者占多少? A:官方未给分布,自行统计 836/327 的每住院 CT 数直方图;单次 CT 的患者无法做"肺损伤演变"类研究,需在分母上过滤。

Q69:能做 28 天死亡终点吗? A:不能——出院后无随访死亡日期字段;只能院内转归。这一点与 MIMIC 的差距无法在本集内弥补。

Q70:微生物阴性培养怎么用? A:阴性培养是"未检出"不是"无感染",特征化时区分"培养阴性"“未培养”"培养阳性"三态,比二元化保留更多信息。

Q71:转科表能重建完整住院轨迹吗? A:只能重建转科事件间的区间,无法覆盖科室内部的时段归属细节;轨迹图的粒度以转科事件为节点。

Q72:主诉的英译质量如何? A:百度学术翻译初译 + 两作者人工复核,质量应是"可读可靠"级;抽样 50 对做回译一致性检查可以量化,不要假设完美。

Q73:诊断文本怎么归类到感染灶? A:建中文感染灶词典(肺/腹/尿/血/皮肤软组织/中枢…),Diagnosis 8,459 行匹配后人工校验;这是"脓毒症异质性分层"的地基,也是可发表的副产品。

Q74:影像窗宽窗位怎么选? A:肺窗 W1500/L-600、纵隔窗 W350/L50 双渲染并存;官方未给扫描用途(平扫/增强)分布,增强扫描的纵隔窗解读需谨慎。

Q75:NIfTI 的方向(orientation)统一吗? A:官方未声明;装载时用 nibabel 检查 affine 矩阵,统一重定向到 RAS 再进模型,否则左右翻转会污染训练。

Q76:能和国内其他公开 CT 集对齐吗? A:概念上可(如公开 COVID-CT 类集合),但无术语/协议映射层,只建议统计层对照,别做池化训练。

Q77:弱标注工厂的最小人力配置? A:1 名熟悉放射术语的标注者(可非医生)+ 1 名放射科医生复核;200 例精标约 2-3 人日;这是"临床合作最小包"。

Q78:训练集里能放门诊 CT 吗? A:可以但需标记来源;门诊 CT 的采集指征与住院 CT 不同(筛查 vs 评估),混训不标记会引入指征偏倚。

Q79:代码仓库里能放数据截图吗? A:谨慎——个别切片截图可能构成数据再分发;安全做法是只放合成示例图或从论文 Fig.1 引用,MD5 断言不涉及像素。

Q80:发表时数据可用性声明怎么写? A:模板:“数据于 PhysioNet(DOI 10.13026/zne5-qh18)与 NGDC OMIX(OMIX005655)受控获取;本研究的处理代码见 [仓库链接];作者已签署 DUA。”

Q81:能做 federated learning 演示吗? A:单集无法演示真联邦;可行的是"本集 vs 498"的两方联邦模拟(同院数据做双方),需在论文明确这是模拟不是真实跨机构。

Q82:Med_history 文本多长? A:官方未给统计;装载后统计长度分布(中位/P90),超长文本考虑截断策略时保留首尾(现病史结构通常首重尾轻)。

Q83:能预测 CT 检查指征吗? A:有趣的小众任务——用 CT 前的表格序列预测"是否开 CT",可做医疗资源利用研究;分母要小心(无 CT 的 10 例住院与门诊混洽)。

Q84:数据里有 COVID 患者吗? A:时间窗(2012-2022 或 2019-2022)覆盖疫情期,诊断文本可检索 COVID 相关词条;若有, pandemic 期的临床习惯偏移需要分层讨论。

Q85:儿童患者(2 例)怎么处理? A:主分析排除或单列说明——脓毒症成人特征工程直接套用到 2 例儿童无统计意义,留下会引入噪声。

Q86:怎么验证我的宽表构建没出错? A:抽 3 个患者手工对照原始行拼出宽表再与脚本输出 diff——三例手工对账是特征工程的黄金标准,一小时能省一周返工。

Q87:模型输出能发医院落地吗? A:不能直接落地——单中心历史数据 + day 粒度 + 无前瞻验证;定位是"方法学证据",落地需院内前瞻数据重训与审批。

Q88:本集做预训练语料合规吗? A:表格/文本在 DUA 内可用于建模;把原始文本放进公开发布的基础模型权重有"不分享"条款的边界风险——发布前做法务评估,或只发布在私有推理接口。

Q89:审稿人要求"开源一切"怎么办? A:代码全开(DUA 本来要求),数据不开(DUA 禁止),提供"一键重跑"脚本从官方源拉数据 + MD5 锁定——这是受控数据开源的标准姿势。

Q90:下一个版本会补什么? A:无官方路线图。社区 wishlist:DICOM 技术头附录、serialID 级报告对齐、检验 LOINC 映射、SOFA 时序交付。若你在用本集,把 wishlist 发给作者比抱怨更有用。

§9.7 番外:来自写作过程的十个冷观察

  1. 版本页的发布日期(2024-10-28)比论文接收日(11-13)早,比刊出日(11-20)早三周——数据集先行于论文是 Sci Data 生态常态,但版本页把"原始论文"引成 Kehl 说明填表环节缺了人审。
  2. 论文标题的 “emergency intensive care unit” 与版本页的 “Emergency Department” 并存,暗示写作过程中疾病定位从"急诊科全体"收窄到"EICU",标题没同步。
  3. 728/337 的双数字结构说明团队有意保留门诊就诊——这在"以住院为中心"的 ICU 数据集传统里是少数派设计,却正好服务了"入院前 CT"叙事。
  4. OMIX 提交(1 月 14 日)早于论文投稿(1 月 5 日之后四天内)——先存档后投稿的时序符合数据期刊的惯例。
  5. 14 表里 246 行的 Lab_dictionary 是全库最小的表,却是跨库可用性的关键瓶颈——小表的杠杆率最高。
  6. EICU 转科注释(“Emergency medical department 即 EICU”)被写进官方文档,说明外国用户曾在这个命名上卡壳过。
  7. 百度学术翻译服务号被完整披露(MPE2022102608424528825)——中国数据治理文档里罕见的透明度细节。
  8. 论文用例表(Table 5)把"教学"与"公共卫生政策"并列进 use cases,可见作者对受众面的期待超出影像组学。
  9. 全库无一张标注 mask,但团队在 498 的结构里已经为"影像扩展"预留了 ExamReport 这样的文本通道——影像的缺席是有意的分期设计。
  10. 从 498 到 500 的 22 个月里,团队同时维持 Zigong 协作库与 CMAISE 多组学联盟——"一条管线多份产出"的工业模式,在中文医疗数据圈尚属先行。

§9.8 番外:十二个"如果……怎么办"

如果只要影像不要表格? 可以,但 836 个无标注 CT 的独立价值有限;表格恰恰是本集的差异化资产,弃用等于自废武功。

如果只要表格不要影像? 那请直接用 498(同结构、更大样本、全谱系);本集表格的增量只在脓毒症聚焦与 _24hr 列。

如果需要 ICD 编码的诊断? 自建 NLP 映射或找公开的中文诊断术语映射表;Diagnosis 的 8,459 行文本规模适中,一人周可完成粗映射。

如果想要小时级生命体征? 本集是 day 级;请用 492 MIMIC-IV 或 2019 Challenge,或接受本集粒度限制。

如果需要多中心? 单中心;联合 498/Zigong 做统计层聚合,或等待同系列扩展。

如果审稿人质疑弱标签? 出示三级精度账本(词典→挂接→抽检)+ 独立验证集;弱标签只用于预训练的主张要写死。

如果发现数据疑似可重识别? 停止分析,报告 PhysioNet 与 OMIX;这是 DUA 义务不是选择题。

如果需要在论文里放数据截图? 用论文 Fig.1 或合成示例;真实切片截图需评估再分发边界。

如果团队没有放射科医生? 弱标注工厂的精标环节不可省;先找临床合作再立项,否则影像侧只能做无监督方法。

如果 GPU 资源有限? 表格基线(XGBoost)零 GPU;影像微调用单卡 24GB 足够(836 体的量级);LLM 路线选 7B 级境内模型。

如果只是想引用它? 引用三层(版本页 + Sci Data 论文 + PhysioNet 平台文);版本页的 Kehl 是误引,别带上。

如果它五年后出了 v2.0? §5.12 迁移预案适用:MD5 diff → ID 稳定性验证 → 增量更新宽表;冻结 v1.0.0 的已发表论文不受影响。

§10 存照、引文与变更日志

§10.1 存照 A-K(核查期 2026-09-21)

  • A. 标题双官方:PhysioNet “Emergency Department” vs 论文 “emergency intensive care unit”;HospitalTransfer 注释确认 EICU 在急诊科内,三名称同一物理单元。
  • B. 时间窗双口径:论文 Methods “January 2019 to December 2022”;论文 Data Records 与 PhysioNet 页面 “January 2012 to December 2022”。论文自身并存两口径。
  • C. Abstract 计数口误:Abstract “a total of 728 admissions with sepsis”;正文与 PtAdmiTable 728 行均为 visits(含门诊),住院 337。
  • D. CT 数字差 1:正文 “836 CT scans for 327 hospital admissions”;CT2hospitalID NumObs 837。
  • E. 版本页误引:Additional citation 指向 Kehl et al. Nat Commun 15:9787 (2024)(癌症结局共享 AI),与本集无关;正确数据论文为 Jin et al. Sci Data 11:1261。
  • F. 作者数差异:版本页 2 人 vs 论文 7 人。
  • G. OMIX 时间线:提交 2024-01-14、发布 2024-08-22,均早于 PhysioNet 上线(2024-10-28)。
  • H. 翻译服务号:论文披露百度学术翻译服务编号 MPE2022102608424528825——数据治理颗粒度罕见的细。
  • I. 层厚未披露:全文无层厚/重建核/管电压统计;Fig.1 坐标 [250,250,80] 是唯一的体数据尺寸线索。
  • J. 无资助条款:论文与版本页均未列资助编号,与 495 的多基金支持形成对照。
  • K. 转科表即 ICU 定义:ICU 住留非显式实体,需 HospitalTransfer 的 EICU 科室名推导,277 行转科事件是唯一轨迹素材。

§10.2 引文清单

  1. Jin S & Zhang Z. Chest Computed Tomography for patients with sepsis in the Emergency Department (version 1.0.0). PhysioNet (2024). DOI 10.13026/zne5-qh18
  2. Jin S, Cai W, Shen Q, Yang L, Sheng’an H, Fu J, Zhang Z. Chest computed tomography for patients with sepsis in the emergency intensive care unit. Sci Data 11:1261 (2024). DOI 10.1038/s41597-024-04132-z. PMID 39567547. PMCID PMC11579395
  3. Singer M et al. The Third International Consensus Definitions for Sepsis and Septic Shock (Sepsis-3). JAMA 315:801-810 (2016)
  4. Jin S et al. Establishment of a Chinese critical care database from electronic healthcare records in a tertiary care medical center. Sci Data 10:49 (2023)(= 本系列 498)
  5. Pollard T et al. PhysioNet as a global platform for biomedical research. Nature Health (2026). DOI 10.1038/s44360-026-00096-z
  6. CNCB-NGDC Members and Partners. Database Resources of the National Genomics Data Center. Nucleic Acids Res 52:D18-D32 (2024)
  7. OMIX005655. NGDC. https://ngdc.cncb.ac.cn/omix/release/OMIX005655
  8. 团队代码库 https://github.com/zh-zhang1984/ZhejiangProvinceICU

§10.3 系列关系

前置:498(同团队表格库,Sci Data 10:49)为本集的临床表结构母本;497(Health Gym)为脓毒症主题的合成数据对照组;492(MIMIC-IV)为跨库迁移的国际基线。后续若有同系列影像扩展(DICOM 原档、标注版、多中心版),本条目按变更日志增补。

§10.4 变更日志

  • 2026-09-21:初版。核查源:PhysioNet 版本页(两轮抓取)、Sci Data 论文全文(Europe PMC XML)、PubMed 记录、OMIX005655 页面、PhysioNet sepsis 主题列表。DAIMS 5.1/8。存照 A-K 共 11 条。

§10.5 阅读地图(本条目内部导航)

  • 想 5 分钟了解:INFOBOX + §0 摘要卡
  • 想 30 分钟决策"用不用":§1.10 用户画像 + §6.7 量级定位 + §6.10 口径诊断树
  • 准备申请数据:§3.7 访问流程 + §8 合规全章
  • 开始装载:§3.8 装载手册 + §3.13 对账清单 + §4.12 逐表注记
  • 设计研究:§6.2 机会地图 + §7.15 三提案 + §7.16 特征字典
  • 写论文:§6.9 自查清单 + §7.17 审稿话术 + §8.4 引用规范
  • 教课:§5.9 最小实验 + §7.12 教学化改造
  • 被卡住了:§9 FAQ 90 问按主题检索

§10.6 存照 L-M(补充)

  • L. 门诊子集的官方说明极简:“i.e. including outpatient visits” 一句话带过 391 例门诊的字段完整度,门诊子集的可用性边界需研究者自行测绘。
  • M. 平台引文的年份错位:版本页引用的 PhysioNet 平台论文标注为 2026 年 Nature Health——本条目核查时按版本页原样记录;平台引文以 PhysioNet 官方最新公告为准(对照本系列 495 条目的平台政策叙述)。

§10.7 核心数字一览(写作与引用速查卡)

数字 口径 出处
728 就业次数(含门诊) PtAdmiTable 行数 / Data Records
337 住院数(103 女 + 234 男) Table 1 / 正文
327 有 CT 的住院数 Data Records
836 胸部 CT 扫描次数 Data Records
837 CT2hospitalID 表行数 Table 2
2,251,285 NursingChart_VitalSign 行数(最大表) Table 3
789,010 Lab 行数 Table 2
505,151 VitalSign 行数 Table 3
6,037 ExamReport 检查报告行数 Table 2
246 Lab_dictionary 检验项数 Table 2
277 HospitalTransfer 转科事件数 Table 2
22 天(IQR 12-36) 住院天数中位数 Table 1
185/121/26 Cured / Not cured / Unknown Table 1
95 最多年龄档 (70,80] 例数 Table 1
v1.0.0 / 2024-10-28 版本与发布日 版本页
10.13026/zne5-qh18 数据 DOI 版本页
10.1038/s41597-024-04132-z 论文 DOI Sci Data 11:1261
2023-397 伦理批号 论文 Methods
OMIX005655 NGDC 存档号 OMIX 页面

§10.8 官方资源导航与后续观察清单

资源导航

后续观察清单(重访本条目时核对)

  • [ ] PhysioNet 版本是否 > 1.0.0(若有:跑 §5.12 迁移预案)
  • [ ] 是否出现官方标注或 DICOM 补充包(若有:§6.2 机会地图需重排)
  • [ ] 是否出现基于本集的首批同行评审论文(若有:§6.5 "首发者优势"论述需更新)
  • [ ] OMIX 侧是否有版本同步公告
  • [ ] 版本页的 Kehl 误引是否被平台修正(若有:存照 E 标记为已解决)
  • [ ] 同团队是否有第三期产品(多中心或标注版)

本条目为千方病案医数集 Top1000 AI-Ready 医疗数据集百科第 500 号,依据官方一手来源核查撰写;数据以官方平台为准,引用请以 DOI 页面显示的最新版本信息为据。### §9.9 尾注三问

Q91:为什么本条目的 DAIMS 只有 5.1 而 492 MIMIC-IV 更高? A:差距集中在评测协议(0.3)与术语标准化(0.8)两维——MIMIC 系有成熟的官方基准生态与 ICD/LOINC 映射层,本集两者皆缺。这不是质量歧视,是 AI-Ready 就绪度的如实度量:数据本身不缺,缺的是"拿来就能比"的协议层。

Q92:本集与 499 CIED 胸片集哪个更适合分割研究入门? A:入门选 499(有三值掩码金标准 + 官方划分);本集适合已经入门、想做"无标注真实临床场景"进阶的研究者。两者的组合恰好覆盖"有监督入门 → 弱监督进阶"的完整训练路径。

Q93:一条建议总结? A:把它当成一份"真实临床数据的三模态切片标本"而不是一个大样本库——用显微镜的耐心,而不是收割机的规模感。

撰写说明:本条目由千方病案医数集自动化生产流水线生成,事实核查于 2026-09-21 完成,全部一手来源存照于 §10。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • health-data-nexus — 共享标签:医学影像 / 电子健康记录
  • pad-ufes-20 — 共享标签:医学影像 / 电子健康记录
  • scin — 共享标签:医学影像 / 电子健康记录
  • copdgene — 共享标签:医学影像 / 电子健康记录
  • oai — 共享标签:医学影像 / 电子健康记录
  • cdsl-covid-data-shared-learning — 共享标签:医学影像 / 电子健康记录
  • chest-imagenome — 共享标签:医学影像 / 电子健康记录
  • rosmap — 共享标签:医学影像 / 电子健康记录
  • nifd — 共享标签:医学影像 / 电子健康记录
  • inspire — 共享标签:医学影像 / 电子健康记录

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集