信息速览
INFOBOX:cdsl-covid-data-shared-learning 速览
| 键 | 值 |
|---|---|
| 名称 | COVID Data for Shared Learning (CDSL): A comprehensive, multimodal COVID-19 dataset from HM Hospitales(v1.0.0) |
| 上线 | PhysioNet 2024-10-25;DOI 10.13026/1176-6c44(latest 10.13026/85z8-jq92);RRID SCR_007345 |
| 前身 | 2020-04 以 “Covid Data Saves Lives” 名义在 HM 官网发布(申请制)——缩写 CDSL 不变、全名漂移 |
| 规模 | 4,479 住院记录(2019-12-26 ~ 2021-02-13);6 张关系表;影像 1,444,764 张 JPG(CT 1,440,156 + X 光 4,608) |
| 结构 | patient_01 / diagnosis_er / diagnosis_hosp / vital_signs / medication / lab 六表 + 附加表文件夹 + 影像文件夹 + DICOM 元数据 |
| 影像转换 | DICOM→JPG 官方复刻 MIMIC-CXR-JPG 方法论(quality factor 95),CovidHM_V3-code 开源全管线 |
| 访问 | Contributor Review(PhysioNet 最严档):DUA 1.5.0 + CITI + HM 数据科学委员会逐案审查 |
| 论文 | Sci Data (2026) DOI 10.1038/s41597-026-08184-1(收 2025-08-12 / 接受 2026-08-14 / 见刊 2026-09-08) |
| 伦理 | HM Hospitales Clinical Research Ethics Committee(auth_opendata_cdsl3_170624);HIPAA 18 类标识符移除 |
| DAIMS | 5.9/8(文档 0.8/机读 0.8/标签 0.7/可访问 0.5/许可 0.5/格式 0.8/评测 0.6/生态 0.5) |
§0 摘要卡:一批疫情数据的长跑终点
§0.1 名称与口径声明
本条目主实体:COVID Data for Shared Learning(CDSL)v1.0.0,PhysioNet 平台 slug 为 covid-data-shared-learning。三个易混名提前切割:CDSL——本集缩写,2020 至今未变;Covid Data Saves Lives——2020-04 的 alpha 版名(HM 官网申请制发布),是本集的前身而非另一数据集(§1.2 漂移史);CovidHM——HM 集团内部数据工程的项目代号(CovidHM_V3-code 是本集开源代码文件夹名)。三条纪律:引用数据用 CDSL 全名+PhysioNet DOI;讲历史用 alpha 版名并标注时间;指代码管线用 CovidHM_V3。patient_count 口径(§3.5 详账):4,479 是住院记录数——版本页 Methods 一处写 “unique hospitalized patients”、论文摘要写"住院记录"、数据字典定义 patient_id 为 “unique admission identifier”——三处口径并存,本条目以"住院记录"为准并全程标注,患者真实数 ≤ 4,479。
§0.2 读者收益清单
读毕本条目你将拿到:拿数据——Contributor Review 三重门槛的完整申请路线图(§3.9,含 HM 委员会逐案审查的提案书写要点);看结构——六张关系表 + 影像文件夹 + 附加表的完整地图与 patient_id 连接范式(§3.1/§3.4);用影像——144 万张 CT 切片的切片级组织方式与 MIMIC-CXR-JPG 复刻的逐项对照(§3.6/§4.4);避坑——患者/住院口径、切片级影像的纵向泄漏、英译术语层等十类坑(§5.7 错误黑名单);接系列——与本系列 492/495(MIMIC 生态)、498(EHR)、501-504(胸片与评测线)的十处咬合(§9.5)。
§0.3 本条目与其他条目的阅读组合
组合一(EHR 线):492/495(MIMIC-IV 生态)→ 498(EHR 结构对照)→ 本集——关系表 EHR 的第二种组织风格(西班牙四系统 vs MIT 三模块)。组合二(影像方法线):501(CXLSeg)→ 502/503(掩码)→ 本集 §3.6(JPG 转换的 MIMIC 复刻)——同一方法论的两次官方落地。组合三(批次五收官线):502(掩码资产)→ 503(不确定性)→ 504(推理评测)→ 本集(回到多模态全谱)——批次五从像素出发,终点是"数据如何从疫情现场走到研究者手里"的完整故事。组合四(疫情数据线,前瞻):本集与未来的疫情登记/疫苗/长新冠类条目构成组——CDSL 是疫情急性期的横断面深挖样本。
§0.4 身份卡:一条命令背下这个数据集
**西班牙 HM Hospitales 集团把 2020 年初新冠风暴中的 4,479 份住院记录——六张关系表的结构化 EHR,加上 144 万张 CT 切片与 4,608 张 X 光——以 PhysioNet 最严档(Contributor Review)开放给全球研究者;这套数据 2020 年 4 月就以 “Covid Data Saves Lives” 之名在官网开放申请,四年后挂牌 PhysioNet,六年半后论文见刊(Sci Data 2026);它的 DICOM→JPG 转换逐项复刻 MIMIC-CXR-JPG 方法论并开源了全部管线代码——疫情最早期"数据救不了命但数据共享能"的一声回响,落地成了一批可以复现的 CSV 与 JPG。**时间跨度 2019-12-26 至 2021-02-13——覆盖西班牙第一波与第二波疫情的开始;结构化表英译自西语原系统;伦理授权 HM 临床研究伦理委员会。DAIMS 5.9/8——文档与格式过关,可访问性与生态是短板(§3.6 逐项)。
§0.5 一分钟决策:你要不要往下读
要读:做多模态住院预测(EHR×影像融合)、COVID 急性期回顾研究、MIMIC 方法复刻的对照研究、西班牙语区医疗数据生态调研。快读:只关心影像——直接 §3.6(JPG 转换)+ §4.4(CT 为主结构的后果);只关心合规——§3.9(申请流程)+ §8(Contributor Review 全解)。不读:需要现成标签做监督学习(本集标签层薄,§3.6 DAIMS 标签 0.7 的原因)、需要胸片分割/检测的即用资产(那是 501/502 的地盘)、期望像 Open 数据那样即下即用(Contributor Review 的获取周期以月计)。决策心法:本集的价值在"多模态的真实性"(四套医院信息系统的原生整合),不在"任务的即用性"——找即用资产去批次五前三篇,找真实世界的整合样本,留在这里。
§1 出身与谱系:一家西班牙医院集团的六年半
§1.1 HM Hospitales:私立集团的数据科学雄心
数据来源方 HM Hospitales 是西班牙马德里为中心的私立医院集团(含 HM Sanchinarro、HM Montepríncipe 等院区),2010 年代起以肿瘤与心血管的精准医学项目建立研究形象。CDSL 的出现语境:2020 年 3-4 月西班牙成为欧洲疫情震中,马德里重症床位告急——集团在疫情最混乱的几周里决定把住院数据整理开放(“data democratization” 是论文与版本页的关键词,且特别强调"not only in Europe but also in Spain"——西班牙在开放数据版图上的自我定位焦虑是字面可见的)。私立集团开放数据的稀缺性:公立医疗体系(如英国 NHS、美国 MIT 依托的 BIDMC)的数据开放有公共资金与法规框架托底,私立集团的开放是品牌+科研合作驱动的自愿行为——可持续性依赖集团战略(§6.11 的长期维护判断以此为基础)。数据技术侧的四系统整合(ED/EHR/ICU/放射)说明集团内部有跨院区的统一数据治理团队——这在 2020 年的私立医疗集团里是超前配置。
§1.2 命名漂移史:Saves Lives → Shared Learning
2020-04 alpha 版上线的名字是 “Covid Data Saves Lives”(数据救命)——疫情最早期的时间印记:那时整个数据社区的心态是"共享数据=间接救命"(MIMIC 社区、Kaggle COVID 挑战都是同氛围)。2024 年挂牌 PhysioNet 时改名为 “COVID Data for Shared Learning”(共享学习之数据)——名字从口号变成了学术措辞。缩写 CDSL 两个名字都满足(Covid Data Saves/Shared Learning),多年文献里两种全名并存。漂移的三点解读:解读一——“Saves Lives” 的承诺在四年里无法被直接验证(数据开放与救命之间的因果链太长),改名是一次务实的定位校准;解读二——“Shared Learning” 呼应 PhysioNet 的共享学习传统(physionet.org 的原使命语句),挂牌动作伴随品牌归编;解读三——对引用者的实操纪律:2020-2024 年的网页/新闻/预印本里出现的 “Covid Data Saves Lives” 与 2024 后的 “Shared Learning” 是同一资产的两个人生阶段(§10.1 存照 A 的核对清单)。命名史本身是疫情数据运动史的切片——从紧急主义到制度化。
§1.3 时间线年表:六年半的五个锚点
2020-04——alpha 版 “Covid Data Saves Lives” 上线 HM 官网(申请制):疫情最早期的大型多模态开放尝试之一,论文自称 “the first multimodal open COVID-19 repository”(“first” 的限定词是 multimodal+open,与同类 ICU 专精集形成差异)。2020-2023——沉默四年:公开渠道少有更新记录,社区使用情况未见系统报告(§6.11 维护观察的空白期)。2024-10-25——PhysioNet v1.0.0 挂牌(DOI 10.13026/1176-6c44):从官网申请制转为 PhysioNet Contributor Review 档——准入更规范也更严。2025-08-12——Sci Data 投稿。2026-08-14 接受 / 2026-09-08 见刊——审稿恰好一年整(Sci Data 的数据描述文常规时长);见刊距本条目核查仅 14 天,是本系列核查时点最新的 Sci Data 论文。年表的读法:真正的高强度数据整理发生在 2020(疫情压力期),2024 的挂牌是"存量数据找正规渠道",2026 的论文是"补方法学署名"——时间箭头与常规"研究→数据→论文"相反,是"数据先行、论文殿后"的疫情特例节奏。
§1.4 论文的身份:迟到的数据描述文
Sci Data 论文(DOI 10.1038/s41597-026-08184-1,Ritoré-Hidalgo Á 等)的性质是 Data Descriptor(数据描述文):内容以数据生成过程、技术验证(数据完整性/内部一致性/图像转换质量三方面)为主,不含新的临床科学结论——这是 Sci Data 的体裁定位。论文的三点额外信息量:其一——作者名单扩编(版本页引用 4 人 vs 论文 et al. 长名单含 Villar Fernández J、Oprescu AM 等)——数据整理的真实人力在论文里才显形(§10.1 存照 C);其二——JPG 转换方法的正式署名(“following the approach of the MIMIC-CXR-JPG repository”)——方法学谱系的官方声明(§3.6);其三——技术验证章节给出了数据质量的官方自检框架(§4.8 转述)。引用组合:数据用 PhysioNet DOI,方法与验证引 Sci Data 论文,代码引 GitHub/CovidHM_V3(§3.10 引用四件套)。
§1.5 团队构成与伦理治理
版本页引用署名 4 人(Ritoré Á / Oprescu AM / Estirado Bronchalo A / Armengol de la Hoz MÁ),论文扩编后含临床与数据科学多方——HM 集团的研究办公室(HM Hospitales research office)+ 数据科学团队 + 临床科室代表的组合模式。伦理治理三层:层一——HM Hospitales Clinical Research Ethics Committee 的总体批准(授权码 auth_opendata_cdsl3_170624,2017-06-24 格式的授权编号含义待考,原样记录);层二——HIPAA 18 类标识符移除+日期偏移去标识(§3.7);层三——Contributor Review 的逐案研究审查(HM Data Science Commission 审研究提案,必要时伦理委员会复审,§8.2 详)——第三层是把伦理审查从"一次性数据发布审批"延伸为"每次使用的持续治理",PhysioNet 四档访问制度里唯一内置持续审查的档位(§8.1 四档对照)。治理成本的代价:获取周期长、使用灵活性低(§6.5 机会地图把"审批周期"列为机会成本首项)。
§1.6 数据源四系统:西班牙医院的原生堆栈
六张关系表背后是四套医院信息系统的数据汇流(§3.4 逐表对应):ED 信息系统(急诊)——diagnosis_er 的来源,西班牙急诊的分诊与诊断编码习惯;医院 EHR——patient_01 人口学/入院信息与 diagnosis_hosp 的来源,西语原生的诊断自由文本+编码混合;ICU 信息系统——生命体征高频采样的来源(vital_signs 的首末值结构暗示 ICU 与普通病房的采样频率差异被合并了);放射科信息系统(RIS/PACS)——DICOM 影像与元数据的来源。四系统整合的工程含义:本集的关系表结构是"四套系统的最小公分母"——每张表的字段选择反映的是跨系统可对齐的部分,系统特有字段(如 ICU 的呼吸机参数细节)在附加表文件夹里(§3.4)。与 492 MIMIC-IV 的对照:MIMIC 是"单院区深挖+carevue/metavision 双 EHR 版本史",CDSL 是"多院区横向拼接+四系统类型覆盖"——两种真实世界的典型形态(§9.5 组合一)。
§1.7 “first multimodal open COVID-19 repository” 的排位赛
论文与版本页的自我定位声称需要放回 2020-2024 的疫情数据赛场上核对:同期多模态选手——MIMIC-IV 的 COVID 子集(ICU 专精)、各国国家登记(西班牙全国 COVID 登记,统计导向)、影像专精集(BIMCV-COVID19,瓦伦西亚,影像深挖)、ICU 影像集(ICU spacecraft 类)——CDSL 的差异点是"住院全谱 EHR + 大规模 CT"的组合与"最早(2020-04)"的先发。排位结论:“first multimodal open” 的限定词链(multimodal+open+repository)在排位赛里成立,但每个限定词都排除了一批对手——引用时保留完整限定词链,避免"第一个 COVID 数据集"的错误简化(那是误解,不是卖点)。对本系列的意义:疫情数据集的"first"话语竞赛是数据社会学样本——§6.16 时代定位章展开。
§1.8 与批次五的收官关系:从胸片专项回到多模态全谱
批次五的叙事线在本集收拢:502(掩码)→503(不确定性)→504(推理评测)都是胸片专项——像素、公差、考卷;本集把镜头拉远:同一个"胸"字下,真实住院患者的数据从来不只是胸片——是六张表的生命体征与化验,是 CT 的三百多倍于 X 光的体量,是四套信息系统的时间戳对齐难题。收官的三层含义:含义一——501-504 的"任务即用性"是分析者的福利,本集的"多模态原生性"是建模者的原料——批次五的两端各取所需;含义二——本集 §3.6 的 MIMIC 方法复刻把批次五的方法学线(501 也在 MIMIC 生态内)闭合;含义三——CT 为主的影像结构(存照 E)提醒胸片专项者:真实世界的放射科产出结构里 CT 才是大头,胸片数据集的规模是研究者选择的结果而非世界的原貌。
§1.9 资助与独立性
版本页与论文均未列出专项资助条目(论文致谢 HM 开源倡议与各院区支持)——私立集团自筹模式:数据整理成本由集团研发预算吸收,无外部基金编号可引(与 504 的 MSRA+韩国四部委全家桶、502 的 CONICET+ANPCyT 形成资助光谱的另一端)。独立性的正面:无基金资助方的成果压力,数据发布节奏由集团战略自定(六年半的从容既是低效也是无 KPI 压力的证据);负面:无资助承诺等于无长期维护承诺——§6.11 的维护风险评估把"单一集团自筹"列为中性偏负的信号。使用者的对应策略:引用与使用不依赖其持续更新,把 v1.0.0 当固化资产规划研究。
§1.10 名词速查表
CDSL——COVID Data for Shared Learning(本集正名);Covid Data Saves Lives——alpha 版名(2020-04);CovidHM——集团内部项目代号(CovidHM_V3-code 代码包);patient_id——住院标识(unique admission identifier,非患者终身标识);六表——patient_01/diagnosis_er/diagnosis_hosp/vital_signs/medication/lab;附加表文件夹——四系统特有字段的补充存放;影像文件夹——1,444,764 张 JPG(CT 1,440,156+X 光 4,608);DICOM 元数据文件——影像的技术参数对(转换后元数据单列);Contributor Review——PhysioNet 最严访问档(§8.1);HM Data Science Commission——逐案审查研究提案的集团委员会;quality factor 95——JPG 压缩质量参数(复刻 MIMIC-CXR-JPG);VOI LUT——DICOM 灰度映射表(转换时的视觉优化环节)。
§1.11 版本页快照纪要(2026-09-22 时点)
| 字段 | 快照值 |
|---|---|
| 版本/DOI | v1.0.0,10.13026/1176-6c44(latest 85z8-jq92,同版本号体系) |
| 类型 | Database(Clinical Data + Imaging) |
| 访问 | Contributor Review(DUA 1.5.0 + CITI “Data or Specimens Only Research” + 贡献方逐案审查) |
| 规模 | 4,479 住院记录;1,444,764 JPG(CT 1,440,156 / X 光 4,608) |
| 时间覆盖 | 2019-12-26 ~ 2021-02-13 |
| 引用 | 版本页列 4 人;论文 et al. 长名单(Sci Data 2026) |
| Views | 59(All Versions,2026-09-22)——本系列核查时点最低可见度之一 |
| 代码 | CovidHM_V3-code(PostgreSQL 建表/元数据提取/DICOM→JPG 全管线) |
快照表的意义与 503/504 同:版本页是活的,本表是 2026-09-22 的固定证据,后续维护者 diff 即得变更日志素材。Views 59 的解读:Contributor Review 档的可见度天花板比 Credentialed 更低(504 是 73)——门槛与流量的反比关系在批次五三连(502 Open 高流量/504 Credentialed 73/本集 Contributor Review 59)里构成一条完整的剂量-反应曲线(§6.7 详)。
§2 语境与设计逻辑:疫情数据运动的活化石
§2.1 2020 年 4 月:数据紧急主义的 snapshot
alpha 版上线时刻的语境还原:2020 年 3 月底西班牙日增确诊破万、马德里 ICU 满负荷——此时决定开放住院数据,动机里"帮世界搞明白这个病"的成分远大于学术产出考量。当时的"开放"是官网申请制(非 CC0 即下即用,但也非 PhysioNet 的正式流程)——紧急主义与合规底线的折中形态。同期参照系:MIMIC 社区在 2020 年放开了 MIMIC-III 的快速申请通道、Kaggle 上的 COVID 开放数据周更、NYTimes/CSSE 的疫情仪表盘日更——CDSL alpha 是这波"数据紧急主义"里少数来自医院内部的住院级多模态供给(多数快数据是统计汇总或单模态影像)。2024 年挂牌 PhysioNet 的动作则是一次"紧急主义的制度化收编":从官网的灵活申请转向标准 DUA+委员会审查——数据还在,治理换轨。本节的史学价值:疫情数据运动的两阶段(紧急共享→制度归档)在一个数据集的两次发布里完整显形。
§2.2 多模态的账本:结构化、影像、时间戳的三线并管
本集"多模态"的三条线:线一(结构化 EHR)——六表+附加表,行=住院/事件,列=字段,关系范式;线二(影像)——CT/X 光 JPG+独立元数据文件,文件系统范式;线三(时间戳)——两线通过住院标识与(去标识后的)时间轴对齐,入院时间/ICU 入出时间/检查时间的相对时序是联合分析的粘合剂。三线的联合成本账:EHR 表的 join 是关系代数问题(§3.4 的连接范式);影像的按住院归组是文件路径问题;难的是第三线——日期去标识(§3.7)后时间轴是相对的还是保留绝对间隔,直接决定"影像检查 vs 病程进展"的对齐粒度——装载前必须核对的第一个技术问题(§5.1 环境对账的第一条)。多模态的收益:影像发现可以挂回生命体征与化验轨迹(胸片恶化前的炎症指标爬升)——这是单模态集给不了的研究设计空间(§7.13 联合分析提案)。
§2.3 CT:X 光 = 313:1 的结构反差:放射科的真实产出
1,440,156 张 CT 切片 vs 4,608 张 X 光——313 倍的反差需要三层解释:层一(采集端)——COVID 肺炎的临床路径里 CT 在西班牙私立体系是主力评估手段(早期 CT 敏感性叙事+私立集团的 CT 可及性),X 光多用于床旁快速评估(床旁片的 DICOM 归档率天然低);层二(计数口径)——CT 按"切片"计、X 光按"张"计——一次胸部 CT 数百切片,一张 X 光就是一张,倍数天然放大(按"检查次数"对账才是公平口径,§3.6 的检查级统计);层三(数据集传统)——胸片数据集(501/502/504)的百万级规模是"跨库聚合"的产物,单院区的真实 X 光存量就是数千级。三层合成的提醒:用本集做"胸片 AI"是拿错工具(4,608 张做不了大模型的事),做"CT 影像组学+住院结局"或"多模态融合"才是本集的主场——批次五收官条目给胸片专项者的最后一个校准。
§2.4 CT 切片级组织的代价与用法
1,440,156 张 CT 以"切片"为单位交付(非 DICOM 原始层级、非 3D volume)——这个设计的代价与用法:代价一——3D 重建需自行按检查归组切片(排序键:患者/住院/检查/层号,元数据文件里对齐),层厚不均时重建的几何保真度有损;代价二——切片级随机抽样会造成纵向泄漏(同一检查的相邻切片几乎相同,train/test 划分必须按住院或按检查切,§5.2 泄漏三条的头号条款);代价三——JPG 8-bit 有损压缩对 CT 的窗宽窗位灵活性有损(原始 DICOM 的 HU 值线性窗没了,§3.6 转换细节)。用法——切片级预训练(自监督的 2D 表示学习,如 CT 切片预训练→3D 下游微调)、切片级分类任务(新冠肺炎灶的切片二分类)、多模态的影像侧特征提取——三种用法都不需要 3D 重建,JPG 切片形式反而是轻量优势。用法与代价的分界线:要不要 3D 几何——要,代价高;不要,JPG 是福利。
§2.5 英译层:内容英译的方法论与残余风险
本集内容英译自西班牙语原系统(版本页 “translated into English”)——翻译层的三点风险账:风险一——诊断术语的西英映射自由度(西语 ED 的自由文本诊断→英译时术语标准化程度未披露——同一诊断是否一致译法影响 diagnosis 表的分组统计);风险二——药物名的商品名/通用名翻译链(medication 表的药名归一化水平决定用药分析的可合并性);风险三——“transformation steps minimized” 的官方声明说明翻译外尽量保留原始性(好),但也意味着没有额外的术语标准化服务(克制是双刃)。残余风险的对策:关键分析前抽样核对英译术语的分布(诊断表 top-N 术语的频率分布是否合理),异常聚集(同一诊断的多种译法)手工归并并记录映射表(§5.6 的衍生映射表纪律)。与 CARMEN-I(西班牙语临床 NLP 语料)的联动机会(§7.16):用西语 NLP 工具回溯原始语义——若能拿到原始西语字段(大概率拿不到,Contributor Review 下问一下 HM 委员会也是合法动作)。
§2.6 与 MIMIC 的方法学亲缘:复刻的逐项意义
“following the approach of the MIMIC-CXR-JPG repository” 不是一句客套——§3.6 的逐项对照表显示转换参数(quality factor 95/VOI LUT/Photometric Interpretation 处理/元数据单列)与 MIMIC-CXR-JPG 官方转换脚本逐项同构。复刻的三点意义:其一——跨集可比性:两集的 JPG 有相同的压缩与灰度处理史,迁移学习(MIMIC 预训练→CDSL 微调)的域差里排除了"转换差异"这个混杂;其二——工具链复用:MIMIC-CXR-JPG 的解析脚本/元数据 schema 几乎可以直接套用(CovidHM_V3-code 补齐了 SQL 建表侧);其三——方法学署名的礼节:复刻且声明出处是数据工程规范化的标志(对比:自行摸索的转换无从审计)。本系列 501 也在 MIMIC 生态内(MIMIC 正位图占 64.5%)——批次五的方法学谱系至此闭合:MIT 的转换脚本成了一个国际事实标准。
§2.7 Contributor Review 的设计逻辑:为什么要逐案审查
PhysioNet 四档访问(Open/Credentialed/Contributor Review/私有托管)里 Contributor Review 的独特条款:“users must have individual studies reviewed by the contributor”——每个研究提案都要 HM Data Science Commission 过目,必要时回伦理委员会。设计逻辑三层:层一(再识别残余风险)——4,479 住院的西班牙单国队列+详细临床轨迹,再识别风险高于百万级美国多院区集(小池子效应),逐案审查是风险与用途的个案匹配;层二(用途质量)——HM 希望数据被"用好"(数据荒地化是贡献方的名誉损失),审查是对研究设计质量的把关(也是对品牌的管理);层三(法律属地)——西班牙/欧盟的 GDPR 语境对健康数据跨境与二次利用的约束比 HIPAA 严,逐案审查是 GDPR 合规姿势(§8.4 GDPR 专节)。对使用者的翻译:申请材料的研究设计质量决定审批速度(§3.9 的提案书写要点)——这不是形式审查,是真的会读你的 proposal。
§2.8 任务面盘点:本集适合与不适合的任务
适合:①住院结局预测(ICU 转入/死亡/住院时长 × EHR 时序)——六表的原生结构服务;②影像+EHR 融合预测——多模态的主场;③CT 切片表示学习——144 万张的自监督原料;④COVID 严重度的影像-化验关联研究——急性期回顾;⑤医疗 NLP 的译文学——诊断/用药文本的西英对照语料价值。不适合:①胸片检测/分割的即用训练(4,608 张量级+无掩码层——501/502 的地盘);②结构化输出/推理评测(标签层薄且无 QA 树——504 的地盘);③纵向终身队列研究(patient_id 是住院标识,跨住院去重后样本更小);④药物效应因果推断(观察性数据+治疗方案的疫情期混杂)。适合/不适合的分界:需要"厚标签"的任务去前面批次,需要"厚语境"的任务留在这里——本集给的是语境(四系统轨迹),不是标签。
§2.9 与 504 的关系修正:从"双塔"到"分工"
504 条目曾把本集预设为"结构化输出评测塔"——随着本集事实核查落地,这个预设需要修正:本集是多模态住院数据库,不是评测基准——504 的"双塔"比喻的正确版本是:504 评模型的推理过程,本集供给模型训练与回顾研究的真实语境。两集的真实接口:504 的评测若要扩展到"EHR 语境下的推理"(如结合化验值判断心扩大),本集可当语境数据源(Contributor Review 的审批下);本集的影像若要做质量分层,504 的 CheXStruct 管线逻辑(分割→测量→质控)是可复用的蓝图——管线的可迁移性不因平台不同而失效。本节同时是 504 条目的勘误预告(§10.4 变更日志):批次五收尾时对 604 条目的"双塔"表述做精确化修订。
§2.10 与疫情数据家族的位置
本系列与本集同语境的资源盘点:ICU 专精——MIMIC-IV 的 COVID 阳性子集、各国 ICU 登记(Sauer 综述的对比表是标准参考文献);影像专精——BIMCV-COVID19(瓦伦西亚,大影像集)、CC-CCII(中国);登记统计——各国卫生部的全国登记(ecdc/who 聚合)。CDSL 的位置:住院全谱+大 CT 的私立单集团样本——家族里"单机构深挖"的一极(对面极是全国统计的浅而广)。家族研究的通用纪律(对任何家族成员都适用):病毒株时代(野生型/Alpha…)、治疗方案时代(瑞德西韦/激素/疫苗铺开)的分层是结论外推的先决条件——本集 2019-12~2021-02 的时间窗=野生型与 Alpha 前夜+西班牙第一二波的治疗方案语境,任何跨时代合并分析都要带这个时间戳(§10.8 核查注记的时间敏感项)。
§2.11 合规光谱的第三档:批次五的完整光谱收官
批次五的访问光谱在本集合龙:502/503 Open(CC BY 4.0,即下即用)→ 504 Credentialed(DUA+CITI)→ 本集 Contributor Review(DUA+CITI+逐案审查)——三档依次收紧,PhysioNet 制度光谱的三个台阶都在批次五里有了活样本。三档的代价-收益对照:Open 档换生态繁荣(502 的引用与工具链生长);Credentialed 换防污染(504 的评测严肃性);Contributor Review 换持续治理(本集的逐案审查=数据主权的最后防线)。对数据贡献者(未来想开放自家数据的医院/团队)的启示:光谱不是道德阶梯而是策略选择——数据的再识别风险×预期用途谱×治理能力三因素定档位(§8.7 的定档决策树)。对使用者的启示:档位越高,申请材料的研究设计权重越大——本集的申请本质上是一次同行评审(§3.9 提案书写)。
§2.12 证据层级小结
本章与后续的证据等级:A级(双源互证)——版本规模/时间窗/六表构成/影像计数/访问档位/DOI——版本页与 Sci Data 论文对读一致;B级(单源待复核)——Views 59(平台单源快照);英译层的术语保真度(官方无第三方审计,本条目按"未验证"处理);alpha 版的早期使用情况(公开渠道空白);C级(推断,标注为观点)——命名漂移的动机解读(§1.2 三解读)、Contributor Review 的设计逻辑三层(§2.7)、维护可持续性判断(§6.11);时间敏感项——Views/论文引用数/竞争格局带 2026-09-22 快照戳。本集特有的证据注记:患者 vs 住院的两口径并存(存照 B)属于"官方自相矛盾"级——本条目全程用"住院记录"口径并标注 patient_id 的 admission 语义,使用者引用时请保持同口径(§3.5 的对账协议)。
EOF
wc -l /workspace/qianfanghub-study/writing/cdsl-covid-data-shared-learning/parts/part1.md
§1.13 论文与版本页的差异清单(双文档对读)
| 维度 | 版本页(2024) | 论文(2026) | 处理建议 |
|---|---|---|---|
| 作者 | 4 人(Ritoré 等) | Ritoré-Hidalgo et al. 长名单 | 各引各的(存照 C) |
| 姓氏形式 | Ritoré | Ritoré-Hidalgo | 以各自文档为准 |
| 口径 | “4,479 unique hospitalized patients” | “4,479 住院记录” | 用记录口径(存照 B) |
| 技术验证 | 提及 | 专章展开(完整性/一致性/转换质量) | 引论文的验证细节 |
| 历史叙事 | alpha 简述 | “first multimodal open” 的完整论述 | 历史叙事引论文 |
双文档的差异不是矛盾而是分工:版本页是"资产的合同",论文是"资产的传记"——引用数据用合同、引用叙事用传记。
§2.18 与 495 系的 X 光对照:同一管线谱系的两端
CDSL 的 4,608 张 X 光与 MIMIC-CXR 系(495/501/502)的数十万张在同一 JPG 管线谱系上,但两端的世界完全不同:
| 维度 | MIMIC-CXR 系 | CDSL X 光 |
|---|---|---|
| 规模 | 22.7 万图 | 4,608 图 |
| 角色 | 主角(影像专项库) | 配角(多模态库的一个通道) |
| 标签 | 14 类 NLP 挖掘+报告 | EHR 诊断对齐(无影像专项标注) |
| 预处理 | 同管线(q95+VOI LUT) | 同管线复刻 |
| 时间跨度 | 2011-2016 | 2019-12~2021-02(COVID 特定) |
对照的结论:CDSL X 光的正确用法是"贴着 EHR 用"——每张图都有住院记录的完整临床语境(诊断/结局/时序),这是 MIMIC 大库做不到的"单图语境密度";用数量换语境,是这条小库的生存策略。
§2.19 三波的流行曲线预期:宽表能"看见"什么
数据窗口 13.5 个月覆盖西班牙疫情的前三波(2020 春、2020 夏尾、2020-11 冬)——patient_01 的 admission 日期直方图的预期形态:三峰曲线(每波一个入院高峰)+ 波间谷底。这张曲线的三重用途:①时代锚——确认去标识后的相对日期与三波的对应(数据完整性的直观验证);②分层框架——波次作为分层变量(§7.10 的迁移研究基础);③资源压力的代理——每波的住院量与 ICU 率的联动(私立体系的容量压力曲线)。三波的形态若不清晰(曲线平/单峰)——先查日期字段的理解是否正确(偏移语义)。
§2.13 关系表 EHR 的两种范式:MIT 式与 HM 式
本集六表与 MIMIC-IV 的 schema 哲学对照(§6.4 矩阵的深化):MIT 式(MIMIC-IV)——模块化极强(hosp/icu/ed/emar 等模块分库)、事件表高度规范化(每类事件一张表)、字典表齐全(d_items/d_labitems 的编码体系)——设计给"大规模横跨分析";HM 式(本集)——六表主干+附加文件夹的紧凑结构、字段语义以文档与代码为准(无独立字典库)、首末值预聚合进主表(vital_signs 的轨迹另存)——设计给"单病种深挖"。两种范式的迁移成本:MIMIC 用户上手本集的最大不适是"没有字典表"——测量项/药物/检验的编码靠英译文本+频率统计自行建立对照(§5.6 映射表纪律的必然性);本集用户上 MIMIC 的不适是"模块太深"——找字段要在多模块间跳。范式无优劣,是"分析规模×数据规模"的两种最优解——本条目的字段地图(§3.2-§3.4)本质上是给 MIT 式用户写的 HM 式导览。
§2.14 影像"切片级交付"的制度史:为什么不是 DICOM
一个常见质疑:为什么不交付原始 DICOM?三层答案:层一(先例)——MIMIC-CXR-JPG 的 JPG 交付已被社区广泛接受(501/502/504 的用户都在用 JPG)——复刻方法论同时复刻了交付形态;层二(隐私)——DICOM 头是再识别重灾区(设备序列号/技师/拍摄参数的原生残留),JPG+精选元数据是"隐私面更小"的交付——去标识的彻底性提升;层三(体量与门槛)——144 万 DICOM 的体量更大且需要 DICOM 工具链,JPG 降低了多模态研究的入门门槛(PIL 即可读)。代价已在 §2.4 记账(HU 窗/3D 重建)。制度史的读法:交付格式是"隐私-易用-保真"三角的一次落点——MIMIC 选了(JPG+元数据),本集跟随并扩展到 CT——若未来出现"DICOM 沙箱"交付(原始格式+远程分析),将是三角的第四个落点(§7.17 提案的可选项)。
§2.15 疫情数据的"整理债"概念:本集作为测量样本
§6.16 的"制度化成本"可以形式化为整理债(curation debt):数据获取(急诊抢救间隙的导出)到数据可用(schema 化+去标识+文档)之间的全部延迟工作。本集的债务账本:获取 2020-03 → schema 化与去标识 2020-2023(无公开记录的沉默期)→ 治理封装 2024-10 → 方法学署名 2026-09——六年半的债期,利息是"早期学术红利的流失"(2020-2022 是 COVID 研究的引用黄金窗,本集缺席)与"数据的时代折旧"(病毒株语境漂移)。清偿方式:不是加速整理(质量代价),而是债务结构化——alpha 版就是一次"部分清偿"(提前两年让数据可用,代价是治理不规范)。概念的一般化:每个"先发布后整理"的数据集都在选债期与利息——Top 1000 里的同债样本(发布仓促的竞品集)的维护观察可沿用此框架。概念出处标注:本条目提出的分析框架(C 级推断),供后续条目复用与批判。
§2.16 单集团数据的科学价值:n=1 集团的辩护
"单集团样本有科学价值吗"的正面回答(对本集最常见的质疑):辩护一(同质性是特征)——单集团的设备谱/流程/编码习惯同质——异质性噪声小,"治疗方案-结局"关系的信号更干净(对照:多国聚合集的设备/流程混杂需要层层校正);辩护二(四系统完整性)——单集团内 ED/EHR/ICU/RIS 全谱可得(跨机构聚合常缺系统覆盖);辩护三(因果推断的局部优势)——同质性群体内的混杂结构简单,工具变量/断点等准实验设计的可行性更高;辩护四(对照价值)——本集的欧洲私立域是 MIMIC(美国学术中心)的天然对照臂(§6.4)。科学社会学的旁证:Framingham 心脏研究(单城队列)与.Whitehall 研究(单行业队列)——n=1 场景的经典成功先例。单集团不是缺陷是设计——前提是研究者问的问题匹配这个设计(§0.5 的劝退逻辑)。
§2.17 疫情急性期数据的证据等级:时代标注的三层
使用本集做任何结论时的时代标注纪律(比一般数据集多两层):第一层(采集时代)——2019-12~2021-02:病毒株为野生型与 Alpha 前夜、治疗指南一周一更、检测能力挤兑(假阴性率异常高)、ICU 标准被迫扩张——所有"临床事实"都带这个语境;第二层(体系时代)——西班牙私立体系:CT 可及性高于公立(§2.3)、诊疗习惯的欧洲大陆学派、编码习惯的西语传统(§2.5)——体系域决定"常规诊疗"的形态;第三层(数据运动时代)——2020 的紧急主义整理(§2.1)——数据本身是"抢救间隙的产物",完整性的天花板是当时的人力现实。三层的实操含义:本集的任何统计量(ICU 死亡率/CT 阳性率/平均住院日)都不能与"疫情后常态"直接对比,也不能与"公立体系统计"直接对比——对比必须在同层语境声明下进行(§7.15 波次设计是这个纪律的研究化)。三层标注的成本很低(三行 methods 文字),缺了它们的结论会被 COVID 研究社区的经验审稿人一眼识破。
§2.18 与长新冠研究的前瞻接口
本集时间窗止于 2021-02——急性期末段——与长新冠(PASC)研究的接口设计:接口一(基线库)——急性期的 EHR 轨迹(症状/化验/影像的初始损伤画像)是长新冠研究的自然基线——若有随访数据源(患者属地医疗记录/HM 后续就诊),本集可当"起点档案";接口二(预测对象)——"急性期特征→长新冠风险"的预测研究需要队列设计(本集+随访数据集的联合——§5.4 联合方案的疫情特化版);接口三(对照供给)——长新冠研究需要"急性期住院但未发展成长新冠"的对照池——本集的 4,479 是候选池(需 HM 二期或随访授权)。三接口的现状判断:HM 未披露随访计划(§10.7 观察清单的"二期数据"条目)——接口是设计性的而非即用性的。前瞻价值:在批次五的收官篇里埋下"急性期档案→长期结局"的研究路线图——本集的长期价值可能不在急性期研究,而在它保存的"起点档案"质量(§6.12 保值逻辑的长时段版本)。
§2.19 批次五的访问光谱实验:三档数据的用户旅程对照
把批次五三档数据(502 Open / 504 Credentialed / 本集 Contributor Review)的"用户旅程"并排画出来,制度设计的差异一目了然:
| 旅程节点 | 502(Open) | 504(Credentialed) | 本集(Contributor Review) |
|---|---|---|---|
| 发现 | 即刻 | 即刻 | 即刻 |
| 资格 | 无 | CITI 证书+DUA | +HM 委员会提案审查 |
| 等待 | 0 | 数天 | 数周至数月 |
| 下载 | 即刻 | 即刻 | 获批后 |
| 使用自由 | 全(署名即可) | DUA 框架内 | 提案锁定的范围内 |
| 再分发 | 可 | 不可 | 不可+个案审查 |
| 发表 | 自由聚合 | 红线内聚合 | 提案产出承诺+补审机制 |
旅程的三点读法:读法一(摩擦的分布)——Open 档的摩擦集中在前(无),Contributor 档的摩擦贯穿全程(申请/使用/发表三段都有审查)——“全周期治理"是第三档的本质;读法二(自由的定价)——使用自由度从"署名即可"降到"提案锁定”——换取的是数据主权的完整保留(HM 对数据命运的全程掌控);读法三(对贡献方的启示)——表格从左到右是"治理强度"的递增,也是"用户基数"的递减——贡献方选档=在生态规模与治理粒度间做一次性的战略定位(§2.11 三因素)。本表格是本系列访问合规维度的总结性资产——后续条目遇到新的访问形态(沙箱/联邦)时按此表扩展列。
§2.20 数据的"两次生命":alpha 用户与 v1.0.0 用户的代际
同一资产的两代用户群(§1.2 命名漂移的用户侧后果):alpha 代(2020-2024)——通过 HM 官网申请的用户——特征:疫情研究的先头部队、使用无 PhysioNet 治理框架(DUA 自拟/去标识依赖 HM 内部流程)、产出文献的引用对象是 alpha 版(无 DOI);v1.0.0 代(2024- )——PhysioNet 治理下的用户——特征:标准 DUA+CITI、逐案审查、引用规范 DOI。两代的可比性问题:alpha 代的数据版本与 v1.0.0 是否字节级一致(HM 未声明两版本的 diff——alpha 期间数据是否修订过是未披露项)——跨代文献对比(alpha 时代结论 vs v1.0.0 时代复现)时要把"版本不可对账"列进 limitations(§10.8 的 B 级注记来源)。代际观察的方法论价值:数据集的"版本代际"是数据引用研究(data citation studies)的活案例——本集的命名漂移+代际分层+口径并存三重叠加,是数据治理教材级的复杂样本(§6.19 形态④的又一注脚)。
§2.21 三行总结:本集的电梯定位
它是什么——西班牙私立医院集团的 COVID 急性期住院档案:六表 EHR + 144 万张 CT/X 光,PhysioNet 最严档开放。
它为什么特别——疫情最早期先头数据中唯一走完"开放→制度化→方法学署名"全程的多模态样本,命名漂移与六年半长征都是制度化的真实成本。
谁该用它——要 CT 体量、COVID 语境、欧洲域对照的研究者;有耐心过三重审查、有纪律做对账装载的团队——其余读者,批次五前四篇的门槛与工具链更合身。
§3 数据切片:交付物、结构与对账协议
§3.1 交付物清单:一个压缩包里的三块世界
PhysioNet v1.0.0 的交付物按三块组织:块一(关系表)——六张核心 CSV:patient_01.csv(人口学/入院时间/ED 就诊/ICU 入出/生命体征首末值)/ diagnosis_er.csv(急诊诊断)/ diagnosis_hosp.csv(住院诊断)/ vital_signs.csv(生命体征记录)/ medication.csv(用药)/ lab.csv(实验室检验)——全部以 patient_id(住院标识)为主键连接;块二(影像)——影像文件夹(1,444,764 张 JPG:CT 切片 1,440,156 来自 784 住院记录、X 光 4,608 来自 1,616 住院记录)+ DICOM 元数据文件(转换自原始 DICOM 的技术参数);块三(代码与文档)——CovidHM_V3-code 文件夹(PostgreSQL 建表脚本/元数据提取/DICOM→JPG 转换全管线)+ 附加表文件夹(四系统特有字段)+ 官方文档。三块的体量感:块一若打印是数百页的 CSV;块二是绝对体量大头(数十 GB 级);块三是本集区别于多数数据集的诚意——把"怎么造出来的"一并交付(§3.6 复刻对照的前提)。
§3.2 patient_01.csv:主表的字段地图
六表之首的 patient_01 是装载的第一张表,字段组的五段结构:段一(标识)——patient_id(住院标识);段二(人口学)——年龄/性别(HIPAA 处理后:年龄可能分箱或 89+ 合并,§3.7 去标识细节);段三(入院轨迹)——入院时间(去标识后)/入院科室/ED 就诊标志与时间;段四(ICU 轨迹)——ICU 入出时间/ICU 时长;段五(首末值)——关键生命体征的首次与末次值(心率/血压/体温/血氧等——首末结构是"简化时序",完整轨迹在 vital_signs.csv)。装载纪律:patient_01 的主键唯一性是全部下游 join 的地基(先验证 patient_id 唯一行数=4,479 再动手);首末值 vs 完整轨迹的口径差异要写进团队 wiki(用首末值做"入院状态"分析、用 vital_signs 做轨迹分析,混用会出"时间方向"的事故——首末值无方向信息)。
§3.3 五张从表:诊断/体征/用药/检验的连接范式
diagnosis_er / diagnosis_hosp——两段诊断(急诊 vs 住院),西语英译的自由文本+编码混合(§2.5 翻译层风险);同一住院可多行(一对多);er→hosp 的诊断演变(急诊印象 vs 确诊)是研究病情认知路径的原料。vital_signs——长表(每行一次测量),测量项/数值/时间戳;ICU 高频与普通病房低频混排(§1.6 四系统的采样差异),分析前先按住院科室分层。medication——用药记录:药名(英译)/剂量/途径/时间——疫情期用药方案的时代标记(§2.10 时间戳纪律)。lab——检验长表:项目(英译)/值/单位/时间——COVID 特征组合(CRP/D-二聚体/淋巴细胞计数)是严重度研究的核心变量。五表的共同连接键 patient_id + 各自时间戳 = 全集的时间对齐骨架;装载顺序建议:patient_01 → 五表逐个外键验证 → 影像元数据挂接(§5.1 的六步装载)。
§3.4 附加表文件夹:四系统的剩余物
核心六表之外的"附加表文件夹"是四系统整合的剩余物存放区——系统特有、频次较低或结构不稳的字段(ICU 呼吸支持参数、治疗操作记录等,具体表清单以 v1.0.0 实际交付为准——版本页字段文档与 CovidHM_V3-code 的建表脚本互为对照)。三点的使用提示:其一——附加表是"考古层":字段完整度高但文档相对薄,装载时逐表核对行数与主键(§5.1 对账清单的附加表专项);其二——呼吸支持参数(氧疗方式/机械通气)对 COVID 严重度研究是高价值字段,值得考古的成本;其三——附加表与核心表的 join 键一致性(同是 patient_id 但可能带系统前缀)——装载脚本里做键归一。对官方的建议性观察(§7.17 提案):附加表的字段级文档是最值得补强的部分。
§3.5 患者 vs 住院:两口径的对账协议
存照 B 的实操协议:口径一(住院记录)——patient_id 唯一行数=4,479(“unique admission identifier” 的数据字典口径,论文摘要口径)——本条目主口径;口径二(患者)——版本页 Methods 一处 “4,479 unique hospitalized patients”——若同一患者两次住院会有两个 patient_id,真实患者数 ≤ 4,479。去重路径的技术现实:人口学+入院时间的组合是唯一可用的去重线索(HIPAA 处理后无患者终身标识)——年龄+性别+入院时间窗的聚类可估计再入院率量级,但不能作为确定性去重(同年同性别同龄的两次独立住院会误合并)。研究设计的对应纪律:结局分析用住院口径(每条住院=独立样本,但同一患者的两次住院不独立——稳健误差需聚类校正);流行病学计数用"住院次数"表述(避免"4,479 名患者"的过度声明)。对账动作写进 §5.1 装载清单第一条:验证 patient_id 唯一性=4,479 → 记录"患者数未由官方披露"的事实 → 报告中按住院口径表述。
§3.6 JPG 转换的 MIMIC 复刻:逐项对照表
论文与代码显示的转换管线与 MIMIC-CXR-JPG 官方方法的逐项对照:
| 环节 | MIMIC-CXR-JPG 原版 | CDSL 复刻 | 差异注记 |
|---|---|---|---|
| DICOM 读取 | pydicom 提取像素 | pydicom 提取 | 同构 |
| 灰度归一 | 归一化到 [0,255] | 同 | 同构 |
| 灰度映射 | VOI LUT 应用 | 同 | 同构(视觉优化的一致性关键) |
| 极性处理 | PhotometricInterpretation 反转 | 同 | 同构(MONOCHROME1/2 惯例差异的统一) |
| 压缩 | JPEG quality 95 | quality factor 95 | 同参数(有损压缩的一致基准) |
| 元数据 | 单独导出(不嵌 JPG) | 同(DICOM 元数据文件) | 同构(像素与元数据分离的可复现范式) |
| 范围 | X 光为主 | CT 切片+X 光 | 扩展:CT 的切片级导出是 MIMIC-CXR-JPG(仅 X 光)没有的场景 |
复刻的意义(§2.6 已述)+ 操作含义:跨集迁移学习时 JPG 的"转换域差"可忽略,剩下的域差是真实的采集域差(设备/人群/疾病谱);CT 切片的导出是复刻之上的扩展——切片级 JPG 的 HU 窗信息损失(§2.4 代价三)在 CT 场景比 X 光更敏感,CT 研究者要意识到这个复刻是"X 光方法论的跨模态移植"。
§3.7 去标识与英译的加工链清单
从医院原系统到 v1.0.0 的加工链七步:①四系统抽取(ED/EHR/ICU/RIS 的原始导出);②住院级筛选(confirmed or suspected COVID 的 4,479 条);③HIPAA 18 类标识符移除(姓名/地址/设备号等——注意西班牙原生的国民健康号在 HIPAA 框架里的对应处理);④日期去标识(版本页声明日期处理——绝对日期偏移或相对化,粒度以元数据文档为准,这直接决定 §2.2 时间轴对齐的粒度);⑤内容英译(西→英,术语标准化程度未披露,§2.5);⑥DICOM→JPG 转换(§3.6 复刻管线+元数据单列);⑦打包发布(PhysioNet Contributor Review 流程+伦理授权码)。七步里研究者最该关注的两个透明度缺口:④的日期处理粒度(相对时序分析的前提)与⑤的翻译规范(术语分析的前提)——两者官方文档均未给足细节,装载前向 HM 委员会问询或在抽样验证中自证(§5.5)。
§3.8 DAIMS 就绪度评分:5.9/8
八维逐项:文档 0.8——版本页+Sci Data 论文双全,但附加表字段文档薄(-0.2);机读 0.8——CSV+JSON 元数据+CovidHM_V3-code 的建表脚本,schema 机可读(-0.2 给英译术语无对照表);标签 0.7——诊断/用药/检验是 EHR 原生层,无专家复核标签、无影像标注层(-0.3);可访问 0.5——Contributor Review 三重门槛+逐案审查周期以月计(-0.5 是八维里最大扣分);许可 0.5——Contributor Review License 1.5.0 强约束+逐案附加条件(-0.5);格式 0.8——CSV/JPG/SQL 全标准格式,CT 切片级组织的 3D 重建成本(-0.2);评测 0.6——无官方基准/基线任务(-0.4,与 504 的 1.0 对照);生态 0.5——上线两年 Views 59、社区工具链未见、论文刚见刊 14 天(-0.5)。总分 5.9/8:批次五最低分(502 6.3/503 6.5/504 6.3)——短板集中在可访问与生态,数据本体的文档与格式是合格线以上。分数的用法:不是质量判决,是"接入成本"的量化——5.9 意味着"数据好,但拿到手要花功夫"。
§3.9 访问流程:三重门槛的完整路线图
第一重(PhysioNet 标准件)——注册账号(机构邮箱)+ CITI “Data or Specimens Only Research” 证书 + DUA 1.5.0 线上签署(与 504 同套标准件,一次培训多处受益);第二重(提案提交)——向 HM Data Science Commission 提交研究提案:研究目的/数据字段清单/分析计划/团队构成/数据安全措施/产出形式——委员会逐案审查(回复周期不透明,经验值数周至数月,必要时回伦理委员会复审更长);第三重(获批下载)——审批通过后解锁下载(全量数十 GB 级,走 PhysioNet 的授权下载通道)。提案书写的四条加分要领:要领一——研究问题具体化(“探索 COVID 严重度预测” 是减分项,“CT 影像特征+入院 48h 化验对 ICU 转入的预测价值” 是合格线);要领二——字段清单精确到表名(§3.4 附加表的点名要慎重——多要字段多审一轮);要领三——数据安全措施写实(加密存储/访问名单/无再识别承诺,GDPR 语境下的措施清单 §8.4);要领四——产出承诺可核查(论文/预印本的发表意向+聚合统计的发布边界)。四要领的共同逻辑:让委员会看到"这个申请人是可控的、专业的、低风险的"——逐案审查的本质是信任评审。
§3.10 引用要求:四件套与两个易错点
数据引用——PhysioNet DOI 10.13026/1176-6c44(v1.0.0 固定);方法引用——Sci Data 论文 DOI 10.1038/s41597-026-08184-1(2026 正式版);资源标识——RRID SCR_007345;代码引用——CovidHM_V3-code(GitHub/PhysioNet 代码包)。易错点一:引用全名漂移——引 alpha 时代的 “Covid Data Saves Lives” 名字配 PhysioNet DOI 的张冠李戴(§1.2 纪律:名字与 DOI 的时代配对);易错点二:论文许可≠数据许可——Sci Data 论文文本 CC BY-NC-ND 4.0 只管论文本身,数据始终是 Contributor Review License 1.5.0(引用论文不等于有权用数据——许可链的独立性)。BibTeX 取用:PhysioNet 版本页 citation 区与 Sci Data 页各提供一份。
§3.11 装载后对账清单(十条)
①patient_01 行数=4,479 且 patient_id 唯一;②六表外键完整性(每表 patient_id ⊆ patient_01);③影像计数对账:JPG 总数=1,444,764(CT 1,440,156+X 光 4,608);④影像的住院覆盖:CT 784 / X 光 1,616 住院记录(与版本页口径一致);⑤DICOM 元数据文件与 JPG 的文件级一一对应(抽查 100 张的文件名/尺寸/模态字段);⑥时间字段的可分析性验证(去标识后是否保留相对间隔——§3.7 缺口④的实证);⑦诊断表的英译分布检查(top-20 诊断的频率合理性——无同一诊断多译法的异常聚集);⑧生命体征的单位一致性(血压 mmHg/体温 ℃ 的混入检查——四系统合并的典型事故点);⑨附加表逐表装载+主键验证+与核心表键归一;⑩CT 切片的检查级归组验证(按检查聚合后切片数与元数据的层号连续性抽查)。十条全过,数据才"可分析"——装载周(§5.11 排期)的核心工作就是这十条。
§3.12 版本冻结与升级预期
v1.0.0 自 2024-10 挂牌未升级(latest DOI 同版本)——升级可能性评估:低——本集的时间窗(2019-12~2021-02)是历史切片,无滚动更新逻辑;论文见刊(2026-09)后的版本动作更可能是"勘误级"(文档/链接修正)而非"数据级"(新增样本)。对使用者的策略:按冻结资产规划——固定 v1.0.0 的 DOI 引用、本地完整备份、不预留"等新版"的计划位。与滚动型数据集(如持续累积的登记类)的规划差异:冻结资产的可复现性天然好(引用即锁死),滚动资产的版本管理成本高——本集是前者,复现包(§5.8)里写死 v1.0.0 即可。观察例外:若 HM 未来发布第二期数据(2021 后的时间窗),大概率是新 slug 或 v2 大版本——§10.7 观察清单的"新版本/新期"条目跟踪。
§3.13 数据字典的自动生成:从建表脚本到团队 Wiki
CovidHM_V3-code 的 PostgreSQL 建表脚本是现成的字段级字典源——脚本里的 CREATE TABLE 语句(字段名/类型/注释)可以直接解析生成团队 Wiki 的数据字典页(比人工从 CSV 抄字段快且不会抄错)。自动生成的三步:①解析建表脚本→字段清单(含类型与约束);②与实际 CSV 表头 diff(脚本与交付物的一致性校验——本身就是一个对账动作);③补列文档(英译字段的原西语对应、时间字段的去标识粒度注记——需要问 HM 或抽样自证的部分单独标记"待确认")。产出物:一页/表的字段 Wiki+一张"待确认问题清单"(提交 HM 委员会的一次性问询,§3.9 第二重的沟通副产品)。这个方法(代码即字典)同样适用于本系列其他带 SQL 脚本的条目——方法论注记存此备用。
§3.14 影像元数据的字段预期与重组验证
DICOM 元数据外置文件的字段预期(MIMIC-CXR-JPG 方法论的同源推断+版本页口径):
| 字段组 | 预期内容 | 用途 |
|---|---|---|
| 患者层 | 去标识 patient_id | join 宽表 |
| 检查层 | Study 标识/日期(偏移)/模态 | CT series 重组的锚 |
| 序列层 | Series 标识/描述(平扫/增强) | 同 series 聚合 |
| 切片层 | 切片位置/厚度 | 排序与层厚分析 |
| 设备层 | 厂商/型号(若保留) | 设备偏移分析 |
| 像素层 | Rows/Columns/Photometric | 解码验证 |
字段实清单以下载后为准——预期表的作用是装载前的心里有数+缺失字段的第一时间发现(字段组缺失→§3.7 重组协议的降级预案)。
§4 结构深查:多模态的真实整合度
§4.1 EHR×影像的整合粒度:住院级挂接
结构化与影像的整合粒度是住院级(patient_id 挂接):影像检查时间戳(去标识后)与 EHR 时间轴的相对对齐是唯一的时间纽带——没有"影像帧级标签对齐化验值"的细粒度整合层。整合度的三点工程含义:其一——联合分析的设计自由度在住院级与检查级(如"入院 72h 内的 CT+同期化验"窗口分析),不到帧级;其二——影像检查时间戳的可靠性依赖 §3.7 缺口④的日期处理(若日期被粗化到天级,"检查在用药前后"的时序判断失准);其三——影像检查与诊断表的对应(哪次 CT 对应哪个诊断结论)没有结构化报告层(放射报告未入集或未分离)——影像的"临床语境"要从诊断表+时间窗间接推断。整合粒度是"多模态"成色的试金石:本集成色=住院级挂接+时间轴软对齐——够做多模态预测研究,不够做影像-临床的帧级对照研究(如"病灶演进 vs 化验轨迹"的细粒度设计要降级到检查级)。
§4.2 六表的时序结构:快照与轨迹的分层
六表的时序性分两层:快照层——patient_01(入院状态:人口学+首末体征)与两诊断表(诊断结论的时间聚合)——回答"这个住院是什么状态";轨迹层——vital_signs/medication/lab(每行带时间戳的事件长表)——回答"住院期间发生了什么"。两层的分析纪律:结局预测的特征工程在轨迹层取窗口特征(入院 48h 的心率方差/CRP 斜率),在快照层取状态特征(年龄/入院科室)——窗口切分的锚点是入院时间与 ICU 入出时间(patient_01 的轨迹骨架)。轨迹层的采样不均匀(§1.6 四系统差异):ICU 高频/普通病房低频的混排让"每小时"假设的窗口统计失真——按采样密度分层或用时间感知模型(连续时间型)是两条出路。时序结构的总评:本集的轨迹是"真实医院节奏"(不均匀、有缺口、四系统拼接),不是"传感器理想流"——用真实节奏做研究是本集的价值也是门槛。
§4.3 诊断表的双段设计:ED 印象 vs 住院确诊
diagnosis_er 与 diagnosis_hosp 的分表设计保留了"诊断的时间演化":急诊印象(入院时的判断)vs 住院诊断(出院时的结论)——两段对照可以研究:①诊断漂移(急诊疑似肺炎→确诊 COVID 的编码演变——疫情期诊断标准本身在演化);②误诊结构(er 有而 hosp 无的条目=排除项,反向=漏诊项——疫情压床背景下的诊断质量样本);③编码习惯(西语 ED 的自由文本 vs 住院的编码化程度差异——NLP 预处理的分层策略)。纪律:两段诊断的合并分析要先做术语对齐(§2.5 翻译层+§3.11 第⑦条的分布检查),对不齐的术语单独成"未对齐池"人工处理——诊断对齐是本集 NLP 类研究的第一工作量。
§4.4 CT 为主结构的深度后果:切片池、检查池与住院池
1,440,156 张切片的池化层级与每级的适用任务:切片池(14 万×10 张/检查量级)——2D 分类/自监督预训练——量大管饱但同检查切片高度相关(泄漏纪律 §5.2);检查池(784 住院的 CT 检查数,一次住院可多次 CT)——检查级结局关联(CT 严重度评分 vs ICU 转入)——需要先做切片→检查的聚合(评分模型或统计特征);住院池(784 个有 CT 的住院记录)——多模态融合的样本量现实:EHR 全谱 4,479 住院 × 有 CT 的 784 住院——多模态模型的有效样本是 784 而非 4,479(缺失模态的缺失机制分析是预注册项:谁有 CT=病情更重/私立 CT 可及——选择偏差的结构性来源)。三级池的换算纪律写进研究设计的第一页——"144 万张"的规模叙事在住院池面前要打 0.17 折(784/4,479),这是 §2.3 反差的最终会计。
§4.5 X 光子集:小而完整的对照资产
4,608 张 X 光(1,616 住院)的价值重估:价值一——床旁片的真实形态(床旁 X 光的设备/体位/伪影多样性是站立位的聚合集给不了的——501/502 的站立位偏倚的解药样本);价值二——与 CT 的同患者对照(1,616 住院里同时有 CT 与 X 光的子集——同住院两种模态的对照研究:X 光发现 vs CT 发现的敏感度互补);价值三——跨集迁移的验证场(502 掩码管线的 X 光解剖提取在本集 X 光上的泛化测试——批次五掩码线与本集的直连实验,§7.13 提案)。量级约束:4,608 张是"验证集/对照集"量级而非"训练集"量级——小样本的用法是验证与对照,不是从头训练。
§4.6 DICOM 元数据文件的再利用
转换时元数据单列(不复刻 MIMIC 的"像素与元数据分离"的另一半——MIMIC-CXR-JPG 的元数据 CSV 传统):文件含原始 DICOM 的技术参数(设备/千伏/毫安秒/层厚/窗宽窗位设定等)。再利用三向:向一(质量分层)——低千伏/运动伪影高危参数的切片标记,进数据质量层(§4.8 验证的延伸);向二(域自适应)——设备型号/采集参数做域标签,跨设备泛化研究的现成分层变量;向三(转换审计)——元数据与 JPG 的对应抽查是 §3.11 第⑤条对账的实现基础。元数据的使用前提:字段文档(哪些参数保留/哪些被去标识)以交付文档与脚本为准——CovidHM_V3-code 的提取脚本就是字段清单的权威。
§4.7 CovidHM_V3-code 的工程解读
开源代码包的三段结构(PostgreSQL 建表/元数据提取/DICOM→JPG 转换)的工程价值:价值一(可复现性)——数据不是黑箱:建表脚本定义 schema 语义、转换脚本定义 JPG 生成史——任何对数据结构的疑问,代码是第一权威(§3.13 字典自动生成的基础);价值二(可迁移性)——管线对"自有医院数据→研究格式"的改造是现成蓝图(四系统抽取→去标识→转换→关系表的流程复用,§7.10 提案的工程基础);价值三(审计性)——转换参数(quality 95 等)的代码级确认,补齐论文一句话方法的细节层。代码质量预期管理:研究代码的工程水位(无 CI/测试的常规状态),当"可读的规格说明"用,不当"生产组件"直接上生产。
§4.8 官方技术验证的三面:完整性/一致性/转换质量
Sci Data 论文的技术验证章节的官方自检框架转述:面一(数据完整性)——六表行数/字段填充率/跨表引用完整性的官方核查(装载时的 §3.11 对账是研究者侧的独立复检——官方数字与本地对账数字的 diff 本身就是验证);面二(内部一致性)——跨表逻辑校验(如 ICU 入出时间与入院时间的时序合理性/用药时间在住院窗内)——研究者的窗口分析前值得重跑同款校验(逻辑校验脚本是现成的研究工具);面三(图像转换质量)——DICOM→JPG 的灰度保真/压缩损失评估(官方对 quality 95 的选择背书)。三面合成的使用建议:官方验证是"出厂检验",研究者的装载对账是"到货验货"——两道检不可互替(§3.11 十条的必要性独立成立)。
§4.9 质量四象限:本集数据的信任地图
按"结构化侧/影像侧 × 完整性/一致性"画四象限信任地图:象限一(结构化×完整性)——核心六表填充率较高(疫情压力期的 EHR 记录仍属常规运营数据)——信任度高;象限二(结构化×一致性)——四系统拼接的键/单位/术语一致性是主要风险区(§3.11 ⑦⑧⑨条的对账重点)——信任度中,需清理;象限三(影像×完整性)——CT 量大但"哪些住院为什么没有 CT"的缺失机制未披露(§4.4 选择偏差)——信任度中;象限四(影像×一致性)——转换质量有官方验证+代码级透明——信任度高。地图的总判:影像侧比结构化侧可信,结构化侧的一致性清理是装载工作的大头——与多数"影像好整理难"的预期相反,是本集的特有画像。
§4.10 血缘链:从病床到 CSV/JPG 的八级加工
完整血缘的八级(§3.7 七步的细化+来源级):①临床事件(病床上的真实诊疗——第一现场);②四系统记录(ED/EHR/ICU/RIS 的数字化——每系统自有编码与节奏);③住院级筛选(COVID 确认/疑似判据);④去标识(HIPAA+日期);⑤英译(西→英);⑥关系化(六表+附加表的 schema 化——CovidHM_V3 建表);⑦影像转换(DICOM→JPG quality 95——MIMIC 复刻);⑧发布治理(Contributor Review 封装)。八级里研究者的"血缘风险敞口"集中在④⑤(透明度缺口)与②(系统异质性)——敞口管理=§3.11 对账+§5.5 抽样自证。血缘链与 502/503 的六级血缘(DICOM 到掩码)对照:本集多的是"治理级"加工(④⑧),少的是"标注级"加工(无掩码/标签层)——两种血缘的深度不可比,用途不同。
§4.11 一致性风险清单(本集版八条)
①单位混入——四系统的生命体征/检验单位差异(§3.11 ⑧);②术语漂移——英译层同一实体的多种译法(§2.5);③时间粒度——日期去标识的粗化对时序分析的影响(§3.7 缺口④);④键前缀——附加表与核心表的 patient_id 变体(§3.4);⑤再入院混淆——患者级 vs 住院级的独立性假设(§3.5);⑥CT 选择偏差——784 住院的选择机制未知(§4.4);⑦切片相关性——同检查切片的近似重复对统计检验的独立性假设破坏(§5.2);⑧治疗方案时代性——2019-12~2021-02 的方案窗口(§2.10)对任何"疗效相关"分析的混杂。八条的共同管理工具:§5.7 错误黑名单与 §5.1 对账清单的交叉引用——每条风险在装载与分析两个阶段各有一次拦截机会。
§4.12 与 502/503 掩码生态的互验设计
批次五掩码线与本集的互验实验设计(§4.5 价值三的展开):实验一(解剖提取泛化)——用 502 CheXmask 训练的分割模型(或其 HybridGNet 谱系)跑本集 4,608 张 X 光,产出本集自己的解剖掩码层——CDSL 有了"用户自制掩码层",X 光子集的分析价值升级(心脏/肺野的定量分析);实验二(测量复刻)——504 CheXStruct 管线逻辑(CTR 等 12 任务的测量链)在本集 X 光上复刻——本集 EHR 的诊断(心扩大等编码)与管线测量值的一致性=管线外部效度的又一测试场(504 §6.2 审计议程的补充数据点);实验三(std 传递)——503 的地标 std 方法(若实验一的模型带不确定性输出)给自制掩码层配不确定性——三连掩码线的完整方法论在本集落地。三实验的合规注记:自制掩码层的再发布受 Contributor Review License 约束(§8.5 红线四)——分析可做,交付需审。
§4.13 三波之外的第四个时间结构:住院内的时间
宽表的窗口(13.5 个月)与长表的窗口(住院内天数)是两个时间尺度,分析时的混用是最常见错误:流行病学用住院窗口(三波分层),临床建模用住院内窗口(入院起 48h 特征→结局)。两尺度的转换节点是 admission_d_inpat——所有特征的时区要么是"住院日 D0/D1/D2"(临床),要么是"流行周 W1-W58"(流行病学),不存在"绝对日期"(已去标识)。双时区的纪律写进团队 wiki——混用的时间特征是审稿人一眼能看穿的硬伤。
§5 使用协议:从申请到发表的全流程
§5.1 环境对账清单(六步装载)
步一(获取与校验)——三重门槛通过后下载,文件级校验(官方校验和/清单 diff);步二(结构化侧装载)——patient_01 先行(主键验证 4,479)→五表外键验证→附加表逐表装载+键归一(§3.11 ①②⑨);步三(影像侧装载)——JPG 清单化(路径/模态/住院归属)→计数对账(§3.11 ③④)→元数据文件挂接;步四(对账十连)——§3.11 全清单执行(重点 ⑦⑧ 的术语与单位);步五(字典生成)——§3.13 的建表脚本解析→团队 Wiki+待确认问题清单;步六(就绪评审)——抽样三张 X 光+十个住院记录的人工通读(装载的"眼见为实"仪式)——六步全过才进分析。装载周的时间预算:结构化侧 2 天/影像侧 1 天/对账与字典 2 天——比 Open 数据集多出的成本就是审批后的验证成本(§3.8 可访问 0.5 分的另一面)。
§5.2 泄漏防控:切片纵向泄漏的三层
本集的泄漏风险图谱与 504(模型防污染)不同,是数据划分侧的三层:层一(切片内泄漏)——同检查相邻切片的近似重复——任何随机划分都会让 test 里的切片在 train 里有"孪生兄弟",成绩虚高的经典事故——划分单位必须 ≥ 检查级;层二(住院内泄漏)——同一住院的多次检查(CT 复查)共享病程与结局——划分单位升级到住院级(784 住院的 CT 池按住院切分);层三(患者内泄漏)——同一患者的多次住院(§3.5 去重困境)——患者身份不确定时的保守策略:入院时间窗贴近(如 <90 天)的住院对划入同侧——保守划分的小样本代价与泄漏风险权衡记录进研究设计。三层合成的总纪律:划分单位=研究问题单位(结局预测按住院、切片分类也要按住院分组做 group split)——group-aware 划分是本集一切监督实验的前置配置。
§5.3 多模态特征工程的推荐配方
EHR 侧+影像侧的初学者友好配方:EHR 侧——快照特征(年龄/性别/科室)+窗口特征(入院 48h:体征的首末/均值/极差,化验的关键项轨迹斜率 CRP/D-dimer/淋巴)+诊断编码的二值化——pandas/SQL 级工程,无需深度时序模型起步;影像侧——X 光子集:预训练 CNN 特征(ImageNet 或 502 生态的胸部预训练)+聚合到检查级;CT 子集:切片级预训练特征→检查级池化(均值/top-k)——3D 端到端起步期不建议(§2.4 代价);融合层——早期融合(特征拼接+梯度提升树)先于晚期融合(双塔+注意力)先于多模态深度——简单融合的基线成绩是后续复杂模型的必比锚。配方的实验设计锚:§5.2 的住院级 group split+§4.9 象限二清理后的数据。
§5.4 与 MIMIC 生态的联合方案
跨集研究的三个可行姿势:姿势一(预训练-微调)——MIMIC-CXR-JPG 预训练的影像编码器→本集 X 光/CT 微调(转换方法同构 §3.6,域差纯净)——最顺的跨集线;姿势二(并集荟萃)——MIMIC-IV COVID 子集与本集的结局模型并集训练(特征对齐表:年龄/性别/ICU/化验项的公共子集手工对齐——术语映射表是工程量所在)——样本量增益与异质性管理并存的姿势;姿势三(方法移植)——MIMIC 生态的分析管线(时序特征工程/结局模型)移植到本集——方法论的可迁移性检验。三姿势的合规共同项:两集都是受限档(MIMIC Credentialed/本集 Contributor Review)——跨集联合的 DUA 复查(504 §2.10 同款动作):PhysioNet 体系内的数据集间分析一般允许,本集多一层 HM 委员会的提案审查——提案里写明联合分析(跨集字段清单与研究设计一次审掉,避免二次申请)。
§5.5 抽样自证协议(边界值复核)
装载后的自证三件套:件一(临床合理性抽样)——随机 20 个住院记录全字段通读(人口学-诊断-体征-用药-检验的时间线通顺性)——人工版的内部一致性检验;件二(边界值复查)——生命体征与化验的极值分布(心率 <30/>200、体温 <30/>42℃ 的记录抽取人工核——单位错误/小数点错误的猎人);件三(影像-临床对拍)——抽 10 个"诊断含呼吸衰竭+有 CT"的住院,人工看 CT 抽样切片的病灶存在性 vs 诊断的一致性方向(不做精读,只验"方向不拧巴")——影像与临床叙事的粗对拍。三件的产出:一份抽样自证报告(进 §5.8 复现包),发现的异常回 §5.7 黑名单。自证的哲学与 504 §5.5 同源:管线产出(这里是医院数据加工链)的信不过部分用抽样换信任。
§5.6 衍生映射表的纪律
本集分析必然产生的三类衍生映射表——西英诊断对照表(§4.3 术语对齐)/药物名归一表(商品名→通用名)/单位换算表(§4.11 ①)——映射表本身就是研究产出(可发表的方法学组件)。三条纪律:纪律一(版本化)——映射表随代码库版本管理(改动即版本+1,分析结果与映射版本绑定);纪律二(双向可溯)——每个映射条目记原始值→映射值的证据(人工判定/词典命中/频率统计);纪律三(发布边界)——映射表是"键值对"层面可发布(无个案信息),但映射时的原始自由文本样例若含患者语境需脱敏(§8.5 红线三的具体化)。映射表纪律的普适性:本系列任何"英译/编码/归一"类条目(499 CIED、5xx 的 NLP 组)都适用——方法学注记存此。
§5.7 错误黑名单(本集特有十条)
①把 4,479 说成"4,479 名患者"(口径越界 §3.5);②切片级随机划分(纵向泄漏 §5.2 层一);③忽略 CT 缺失机制直接做"全住院"影像结论(选择偏差 §4.4);④混用首末值与轨迹特征的时间方向(§3.2);⑤诊断表直接 groupby 不做术语对齐(§4.3);⑥把 X 光 4,608 当训练集起步(量级误判 §4.5);⑦假设时间戳是绝对日期(§3.7 缺口④);⑧跨集合并不做单位/术语映射(§4.11 ①②);⑨引用时名字与 DOI 的时代错配(§1.2);⑩把论文 CC BY-NC-ND 当数据许可(§3.10 易错二)。十条黑名单的共同源头:多系统+翻译+最严访问档的复合复杂度——黑名单写进团队的 code review checklist,装载周全员过一遍。
§5.8 可复现包模板
cdsl_project/
├── data/ # v1.0.0 固化副本(DUA 下本地存放,不入库 git)
│ ├── tables/ # 六表+附加表 CSV
│ ├── imaging/ # JPG 目录树+元数据文件
│ └── MANIFEST.md # 下载日期/校验和/版本三元组
├── covidhm_v3_code/ # 官方代码包(只读引用)
├── src/
│ ├── load/ # 六步装载脚本(§5.1)+对账十连(§3.11)
│ ├── mapping/ # 衍生映射表(§5.6,版本化)
│ ├── features/ # EHR 窗口特征/影像池化特征(§5.3)
│ └── split/ # group-aware 划分(§5.2 三层)
├── results/ # 表格/图/中间产物(append-only)
├── compliance/
│ ├── hm_proposal/ # HM 委员会提案与批复(§3.9)
│ ├── dua_citi.pdf
│ └── publication_review.md # 发表前的红线自查(§8.5)
├── docs/
│ ├── data_dictionary/ # §3.13 自动生成的字段 Wiki
│ └── self_check_report.md # §5.5 抽样自证报告
└── README.md
与 504 模板的差异:compliance/ 目录是本集特有的一级目录(Contributor Review 的提案-批复-自查三件套存档)——合规文件与代码同级是本集使用模式的制度现实。
§5.9 教学场景的最小实验
三个实验(Contributor Review 未获批前可做前两个):实验一(结构设计研究)——用版本页+论文的表结构描述,让学生画 ER 图并预测每表的行数量级——装载数据前先会"读地图"(2 小时);实验二(方法学对照)——对比 MIMIC-CXR-JPG 与 CDSL 的转换方法文档,写 500 字复刻报告(“同与异"清单)——数据工程的方法论训练(2 小时);实验三(获批后:多模态首跑)——784 个 CT 住院里抽 100 个,EHR 窗口特征+CT 切片池化特征拼表,跑 ICU 转入的逻辑回归基线——多模态的最小完整闭环(1 天)。实验序列的设计逻辑:地图→方法论→闭环——多模态数据集的教学使用比单模态多一步"整合度认知”。
§5.10 与 505 前四篇的批次五联合装载
批次五五篇的联合视图(对已经装载 502-504 的团队):联动一(掩码×X 光)——502/503 的掩码生态给本集 X 光子集补解剖层(§4.12 实验一);联动二(评测×语境)——504 的评测协议给本集的多模态模型出"过程考卷"(EHR 语境下的推理评测设计——504 协议的语境扩展,贡献回 504 的生态);联动三(方法学共享)——本集 §3.6 的 MIMIC 复刻与 501 的 MIMIC 生态同源——三篇的 MIMIC 相关性在本集合龙(批次五的 MIMIC 亲缘度:501 高/504 中/本集高)。联合装载的工程顺序建议:本集装载→联动一(掩码层增值)→联动二(模型评测)——从数据到资产到审计的批次五完整走法。
§5.11 两周排期表:申请到首份多模态结果
W1 前置周(审批等待期并行做):CITI 证书+DUA(标准件 1-2 天)→HM 提案撰写与提交(3-4 天,§3.9 四要领)→文献与表结构的预研(实验一/二)。W2 获批周:下载与校验(0.5 天)→六步装载(3 天)→对账十连+字典(1.5 天)→§5.3 配方的基线首跑(1 天)——两周的终点是"多模态逻辑回归基线的混淆矩阵"。排期的关键路径:HM 委员会的审批(不可控,数周至数月)——所以 W1 的所有动作都设计成"等待期的并行工程",审批不是 idle 而是预研窗口。与 504 排期(§5.12,一周)的对比:多出的一周=提案撰写+审批缓冲+装载增量——Contributor Review 的时间成本在排期表里显形。
§5.12 故障演练四项
演练一(键归一失败)——附加表 patient_id 带系统前缀时 join 失败的排查路径(前缀剥离/映射表兜底,§3.4);演练二(时间轴异常)——日期去标识后出现负时序(ICU 出科早于入科类)的识别与处理(官方逻辑校验重跑+异常住院隔离清单);演练三(JPG 计数不符)——影像清单与版本页口径差 N 张的处置(先查清单脚本的路由规则,再查 ZIP 解包完整性,最后提交官方——升级路径预演);演练四(审批材料退回)——HM 委员会要求补充材料的响应流程(48h 内补交的模板:常见补件项=字段清单细化/伦理文件补充/数据安全措施具体化)。四演练的目的与 504 §5.13 同构:把第一次故障留在演习场。
§5.13 提案审查的准备度自评(提交前八问)
Contributor Review 提案提交前的自评清单:①研究问题与数据的匹配度一句话说得清吗?②数据范围是否最小化(表×影像子集的明确清单)?③隐私方案有可执行细节(环境/输出/防护)吗?④输出物的四类判定(§8.3)预先自判了吗?⑤团队资质(CITI/DUA/经验)列全了吗?⑥时间计划含结果分享承诺吗?⑦英文(或西语)表达达到委员会可读了吗?⑧被拒的 Plan B(范围缩减版)准备了吗?八问全过再提交——审查的第一轮筛掉的是"没想清楚",不是"不够好"。
§5.13 六表逐一的字段速查与首跑示例
patient_01(主表)——标识/人口学/入院/ICU/首末值五段(§3.2)——首跑:SELECT COUNT(*) FROM patient_01; 应得 4,479。
diagnosis_er——急诊诊断(西→英)——首跑:top-10 诊断频率表(建立术语直觉)。
diagnosis_hosp——住院诊断——首跑:与 er 的表内交集统计(诊断漂移的量级预判)。
vital_signs——体征长表——首跑:按测量项的记录数分布+单位清单(单位混入检查 §3.11 ⑧)。
medication——用药长表——首跑:top-20 药名频率(英译归一化的工作量预估)。
lab——检验长表——首跑:CRP/D-dimer/淋巴细胞三项的可用性检查(COVID 研究三件套)。
六条首跑合计约 30 分钟 SQL——装载完成后的第一个动作不是建模,是这六个"数据体温计":每个异常都回写进对账清单与团队 Wiki。
§5.14 影像侧装载的目录树设计
imaging/
├── manifest.csv # 从官方清单生成:文件名/模态/住院ID/检查ID/层号
├── ct_slices/ # CT 切片(1,440,156)
│ └── {patient_id}/… # 按住院分目录(装载脚本重组)
├── xray/ # X 光(4,608)
│ └── {patient_id}/…
├── dicom_meta/ # DICOM 元数据文件(§4.6)
└── checks/
├── count_report.md # 计数对账(§3.11 ③④)
└── sample_audit.md # 抽查 100 张的审计记录(§3.11 ⑤)
设计的两条原则:原则一(清单先行)——manifest.csv 是全部影像操作的入口(不遍历文件系统)——清单与磁盘的差异就是对账报告;原则二(按住院重组)——官方交付的目录结构按装载便利重组为按住院分组(保留原始结构的映射列)——group split(§5.2)与检查级聚合(§4.4)都以重组后的树为操作对象。
§5.15 时间字段的三层验证协议
§3.7 缺口④的实证方案(装载周完成):层一(类型确认)——时间字段的格式盘点(datetime/相对天数/偏移秒——从样本推断官方处理方式);层二(间隔保真)——同住院内的时序关系验证(入院<ICU 入<ICU 出<出院的偏序保持率——99%+ 为合格线);层三(跨住院可比)——不同住院的时间轴是否同一原点(绝对偏移 vs 每住院独立原点——决定跨患者的时间对照分析是否可行)。三层产出一页"时间字段能力声明"(可做什么/不可做什么),写进团队 Wiki 与论文的 methods——时间能力的自觉声明是审稿人问询的高频点(§7.14)。
§5.16 从对账到发表:证据链的封装顺序
本集研究的发表材料准备顺序(证据链自下而上):第一层(数据证据)——对账十连报告+抽样自证报告(§5.5)——"数据可信"的基础;第二层(方法证据)——时间字段声明(§5.15)+映射表(§5.6)+划分协议(§5.2)——"方法可信"的中坚;第三层(结果证据)——波次分层+敏感性分析+锚检查(§7.15/§7.22)——"结论可信"的上层;第四层(合规证据)——审批编号+发布边界自查(§8.5)——"使用正当"的外层。四层封装成 §7.23 八段式报告——每层都是独立可查的文件(复现包的对应目录)——审稿质询时按层取证(§7.14 四问四答的弹药库)。封装顺序的工程意义:下层不稳不上层——对账没过不跑模型,锚没建不写讨论——证据链的施工顺序=论文的写作顺序。
§5.17 分析侧的目录树与命名规范
analysis/
├── 01_eda/ # 探索分析(§5.13 六体温计)
│ ├── tab_counts.sql
│ ├── term_freq.csv
│ └── unit_check.md
├── 02_cohort/ # 队列定义(§3.5 口径+§7.15 波次)
│ ├── cohort_def.sql # 纳排标准的代码化
│ ├── wave_split.csv
│ └── flow_diagram.png # 流程图(CONSORT 式)
├── 03_features/ # 特征工程(§5.3 配方)
│ ├── snapshot_feats.sql
│ ├── window_feats.sql
│ └── img_pool_feats.py
├── 04_models/ # 基线族(§7.3 三层)
│ ├── lr_baseline.py
│ ├── gbdt_baseline.py
│ └── fusion_baseline.py
├── 05_eval/ # 评估(§5.2 group split+§7.22 锚)
│ ├── split_manifest.csv
│ └── anchor_checks.md
└── 06_report/ # §7.23 八段式
└── calibration_report.md
命名三规范:规范一(数字前缀)——目录按流水线顺序编号——新人 30 秒看懂执行顺序;规范二(cohort 即代码)——队列定义必须是一段可执行的 SQL(cohort_def.sql)而非文档描述——纳排标准的任何歧义在代码里无处藏身;规范三(split 清单化)——划分结果固化为 split_manifest.csv(住院 ID+归属 fold)——所有模型实验读同一份清单,杜绝"每次划分不同"的隐性不可比。三规范与 §5.6 映射表纪律、§7.3 日志基建(504)共同构成"分析工程的三件基础设施"——多模态研究的复杂度是单模态的两倍以上,基础设施的回报率更高。
§5.18 六表装载的 SQL 速查(八条常用)
1. 主表行数验证(§3.11 ①):
SELECT COUNT(*), COUNT(DISTINCT patient_id) FROM patient_01;
-- 期望:4479 / 4479(两值不等=重复住院标识,立即上报)
2. 外键完整性(§3.11 ②):
SELECT COUNT(*) FROM diagnosis_hosp h
LEFT JOIN patient_01 p USING (patient_id)
WHERE p.patient_id IS NULL; -- 期望 0
3. 诊断 top-20 频率(术语直觉+译法检查):
SELECT diagnosis, COUNT(*) AS n
FROM diagnosis_hosp GROUP BY diagnosis
ORDER BY n DESC LIMIT 20;
4. 单位混入检查(§3.11 ⑧):
SELECT measure_name, unit, COUNT(*) AS n
FROM vital_signs GROUP BY measure_name, unit
ORDER BY measure_name, n DESC;
-- 同一 measure 出现多 unit = 单位事故现场
5. 时序偏序验证(§5.15 层二):
SELECT COUNT(*) AS bad_order FROM patient_01
WHERE icu_in < admission OR discharge < icu_out;
-- 期望 0(负数=时序倒置清单)
6. CT 住院覆盖(§3.11 ④):
SELECT COUNT(DISTINCT patient_id)
FROM imaging_manifest WHERE modality = 'CT'; -- 期望 784
7. 波次切分(§7.15):
SELECT CASE WHEN admission_dt < DATE '2020-07-01'
THEN 'wave1' ELSE 'wave2' END AS wave,
COUNT(*) FROM patient_01 GROUP BY 1;
8. 化验三件套可用性(COVID 研究核心变量):
SELECT lab_name, COUNT(DISTINCT patient_id) AS covered
FROM lab WHERE lab_name IN ('CRP','D-dimer','lymphocytes')
GROUP BY lab_name;
八条 SQL 的共同设计原则:每条都是"期望值明确"的断言式查询(期望值写在注释里)——对账不是探索是验证,断言式 SQL 让装载周的对账可以脚本化批量执行(§5.1 步四的自动化版本)。
§5.19 常见装载错误的五条现场识别
现场一:行数对不上官方数——先查纳排条件是否被无意引入(装载脚本的 WHERE 泄漏)→ 再查编码问题(CSV 引号内的换行被拆行)→ 最后查官方数字的口径(§3.5 的患者 vs 住院)。
现场二:join 后行数膨胀——一对多表的重复 join(诊断表多次 join 主表未去重)——用"join 前后行数对账"的两行模式防:join 前记录行数,join 后立即 COUNT 对比。
现场三:中文/特殊字符乱码——英译数据里残留西语字符(重音字母)的编码处理——UTF-8 全链路声明+装载后抽样 grep 重音字符分布。
现场四:日期解析歧义——日/月顺序的欧美差异(03/04/2020 是 3 月还是 4 月)——从时序偏序验证(§5.15 层二)反推:大量 ICU 入科早于入院的"倒置"多半是日月倒置。
现场五:影像清单孤行——manifest 里的文件在磁盘上找不到(或反之)——先查大小写(Linux 敏感/官方清单大小写不一致的常见坑)→ 再查路径分隔符/压缩包层级——孤行清单进 §3.11 对账报告的异常区。
五现场的通用第一动作:回到最小复现(单个文件/单条记录的手工处理对照脚本输出)——装载错误的排查永远是"缩小-对照-修复"三步循环。
§6 官方成绩单与战略视角:读透一个"慢数据"的战略价值
§6.1 官方表述的精确拆解:三句定位与限定词链
论文与版本页的自我定位拆成三个可独立引用的命题:命题一(first 声明)——“the first multimodal open COVID-19 repository shared among researchers worldwide”——限定词链 multimodal+open+repository 三重限定(§1.7 排位赛的完整分析),引用必须带全链;命题二(规模声明)——“4,479 unique hospitalized patients”(Methods)与"4,479 住院记录"(摘要)的两口径并存(§3.5 对账协议),引用选"住院记录"口径并标注;命题三(方法声明)——JPG 转换 “following the approach of the MIMIC-CXR-JPG repository”(§3.6 逐项对照)——方法学谱系的官方署名。三命题的引用场景:命题一用于综述的"疫情数据运动史"段落;命题二用于规模对比表(带口径注);命题三用于数据工程的方法学引文。三个命题各带一个"引用陷阱"(first 的简化、口径的混用、许可的张冠李戴)——§5.7 黑名单的①⑨⑩就是这三个陷阱的行为化。
§6.2 自证边界:官方验证与独立审计的空白
Sci Data 技术验证(§4.8 三面)是官方自检——独立第三方审计的空白点三个:空白一(英译层)——术语保真度无外部审计(§2.5),对术语敏感的研究(流行病学计数/NLP)这是最大空白;空白二(缺失机制)——CT 覆盖 784/4,479 的选择机制无官方分析(§4.4),多模态研究的偏差控制全靠研究者自查;空白三(再识别残余风险)——4,479 规模的单国队列的去标识充分性无公开的红队测试(Contributor Review 的逐案审查部分代偿,§2.7)。三个空白的机会面:每一条都是一篇方法学论文的选题(英译术语审计/缺失机制建模/去标识风险评估)——§6.5 机会地图的源头。自证边界的通用教训:数据描述文的验证章节是"出厂合格证",不是"终身质保"——本系列的 502(三层验证)、504(1,200 case 复核)与本集的验证力度对比,构成"标注级验证>管线级验证>描述级验证"的验证力度谱系。
§6.3 引用结构:四件套与时代配对
引用链四件(§3.10 清单的组装逻辑):数据 DOI(10.13026/1176-6c44)+论文 DOI(10.1038/s41597-026-08184-1)+RRID(SCR_007345)+代码(CovidHM_V3-code)——四件各司其职不可互替。本集特有的时代配对纪律(§1.2 漂移史的引用侧):2020-2024 的文献里 “Covid Data Saves Lives” 的引用不指向 PhysioNet DOI(那时没有)——如果引用一篇 2021 年用 alpha 版数据的研究,引用对象是 HM 官网的 alpha 版(无 DOI),与 v1.0.0 是同一资产的两个发布事件——文献综述里要区分"用过 alpha 版的早期研究"与"用过 v1.0.0 的正规渠道研究"(两批研究的数据处理语境不同:alpha 版无 PhysioNet 的去标识审计与 DUA 框架)。时代配对是本集对引用者的额外认知税——也是命名漂移类资产(§6.16 时代定位)的共性成本。
§6.4 与 492/495 的选型矩阵:两种 EHR 范式的采购指南
MIMIC-IV 生态(492/495)与本集的选择矩阵:维度一(规模)——MIMIC 数十万人次 vs 本集 4,479 住院——量级不在一个宇宙(MIMIC 碾压);维度二(疾病语境)——MIMIC 全病谱 ICU vs 本集 COVID 住院全谱(含非 ICU)——研究 COVID 急性期,本集的疾病特异性组织(诊断/用药的疫情时代结构)更浓;维度三(影像)——MIMIC-CXR 的 X 光专精 vs 本集 CT 为主——CT 研究只能选本集;维度四(时序深度)——MIMIC 的 ICU 高分辨率时序 vs 本集的四系统混合节奏——ICU 时序分析选 MIMIC;维度五(访问)——Credentialed vs Contributor Review——获取成本本集显著更高;维度六(人群域)——美国波士顿 vs 西班牙马德里——泛化性研究的地域对照价值。矩阵的采购结论:默认 MIMIC,本集补三样——CT 影像、COVID 时代语境、欧洲私立体系的地域域——三样都要时本集不可替代。
§6.5 机会地图十向
按门槛排序的十个方向:①装载对账报告(§3.11 十条的执行报告发表——数据描述文之后的"用户验证文",Sci Data 的 brief comun 短文或 Zenodo 报告形态);②英译术语审计(§6.2 空白一,诊断/用药术语的西英映射质量评估——NLP 方法学的现成选题);③CT 缺失机制建模(§6.2 空白二,缺失数据的机制推断与敏感性分析——统计方法学选题);④CT 切片自监督预训练(144 万切片的 2D 表示学习+下游 ICU 预测——ML 主线选题);⑤多模态基线族(§5.3 配方的完整基线表发表——"第一个 CDSL 多模态基线"的占位价值);⑥X 光解剖层自制(§4.12 实验一,502 生态的迁移落地——批次五内部联动选题);⑦诊断漂移研究(§4.3 双段诊断的疫情期演变——卫生服务研究方向);⑧跨集域适应(MIMIC→CDSL 的结局模型迁移,§5.4 姿势二——域泛化选题);⑨去标识风险评估(§6.2 空白三——隐私技术方向,需 HM 合作);⑩数据民主化的社会学案例(私立集团开放数据的治理案例研究——数据政策方向)。①②③门槛最低(数据在手即可开工),④⑤算力门槛,⑨⑩需合作与跨学科。
§6.6 团队与治理的延续性观察
HM Hospitales 的数据科学治理结构(委员会/伦理双轨)是私立集团开放数据的治理样本:观察一——HM Data Science Commission 的运作透明度(审批标准未公开——§8.2 的透明度建议)——委员会本身的"数据集"是另一个可研究对象;观察二——论文作者名单的扩编(4→et al.)暗示数据整理团队的规模——私立集团的研究办公室模式(临床+数据科学混合)与美国学术医学中心(MIMIC 的 BIDMC)的团队形态对照;观察三——无外部资助(§1.9)意味着无基金监管的产出压力——六年半节奏的组织学解释。三观察的合成判断:HM 的开放数据是战略型而非产出型——预期其后续动作(第二期数据/新病种集)取决于集团战略周期而非学术 KPI——使用者的期待管理与 §10.7 观察清单的设计都基于此。
§6.7 可见度的剂量-反应曲线:批次五三连的启示
Views 的三连对照(2026-09-22 快照):502(Open)——系列早期流量级;504(Credentialed)——Views 73;本集(Contributor Review)——Views 59。三档访问的三档可见度构成干净的剂量-反应曲线:访问门槛每升一档,可见度掉一截——门槛的三重作用(合规过滤/认知负担/获取周期)叠加出流量的天花板。曲线的另一面:低 Views ≠ 低价值——Contributor Review 档的数据通常是"高敏感高独特"资产(再识别风险高的珍贵队列),其价值实现依赖"少而精的使用者"而非"多而广的流量"。对系列编辑的启示:Top 1000 的收录标准里"可见度"权重应低于"独特性"——本集(Views 59)与 502(Open 高流量)的收录理由同为"不可替代性",不是流量。对数据贡献者的启示:若目标是学术影响力最大化,Contributor Review 档要配套主动的论文+会议推广(本集论文刚见刊 14 天——推广窗口正在打开,§10.7 观察引用曲线)。
§6.8 坑点八条:多模态+最严档的复合陷阱
坑点 1:口径越界——“4,479 患者vs住院记录”(§3.5,最高频错误);坑点 2:切片随机划分——纵向泄漏让成绩虚高(§5.2 层一);坑点 3:缺失机制盲区——CT 784 的选择偏差未建模直接下结论(§4.4);坑点 4:时间轴假设——把去标识日期当绝对时间用(§3.7 缺口④);坑点 5:术语直采——诊断/用药字段不清洗直接 groupby(§2.5/§4.3);坑点 6:量级误配——X 光 4,608 当训练集/144 万切片吓自己(§4.5/§4.4 的三级池换算);坑点 7:许可错位——论文许可当数据许可/alpha 文献配 v1.0.0 引用(§3.10);坑点 8:审批低估——把 Contributor Review 当 Credentialed 的周期规划(数周 vs 数月的排期差异,§5.11)。八坑的共性:没有一个坑是"数据不好"造成的——全是"数据很真实+治理很严格"的复合代价——真实与严格的成本要写进项目预算(时间与认知双重)。
§6.9 使用前自查十问
①我的研究问题需要 CT 还是 X 光就够?(X 光量小,CT 才是本集主场);②我接受数月的审批周期吗?(排期现实 §5.11);③我的提案书写到"字段级+方法级"了吗?(§3.9 四要领);④我的分析对时间粒度的要求是?(§3.7 缺口④的先行确认);⑤多模态样本量 784 够我的统计功效吗?(§4.4 住院池换算);⑥我有清理术语/单位漂移的工程预算吗?(§4.11 八条);⑦我的划分是 group-aware 吗?(§5.2);⑧我的产出(图表/模型/映射表)过得了 §8.5 红线吗?;⑨结论的时效声明带 2019-12~2021-02 时间戳了吗?(§2.10);⑩本集真的是最优选吗?(§6.4 矩阵——MIMIC 优先性自查)。十问的淘汰率设计:预期 3-4 问会让部分读者放弃——劝退也是条目的功能(错配的使用对双方都是浪费)。
§6.10 故障诊断树:五岔口
岔口 A:join 后行数爆炸/清零→ 附加表键前缀(§3.4)→ 键归一;岔口 B:时序分析结果"反常识"→ 时间轴粒度与方向假设(坑点 4+§3.2 首末值)→ 先跑 §4.8 一致性校验;岔口 C:影像计数与官方不符→ 清单脚本路由→解包完整性→官方通道(§5.12 演练三);岔口 D:模型成绩异常好→ 划分泄漏(§5.2 三层)→ group-aware 重切;岔口 E:审批被退→ 补件模板 48h 响应(§5.12 演练四)→ 提案要领自查。五岔口的第一动作同 504:版本三元组核对(v1.0.0/论文 2026/你的代码版本)。
§6.11 静态资源与维护模型:单集团自筹的长期主义
本集的维护模式评估:信号一(活维护)——v1.0.0 挂牌至今无勘误级更新(未见 changelog 动作)+论文 2026 见刊(论文层面的活跃);信号二(静维护)——GitHub/代码包的更新节奏未知(研究代码的常规静止);信号三(治理活)——Contributor Review 的逐案审查在持续(每次申请都是一次交互——维护的"人件"在运转)。三信号的合成:数据冻结+治理存活的混合模式——数据本体不会再变(时间窗封闭),治理通道活着(委员会在收案)。长期风险的单一暴露点:HM 集团的战略周期(§6.6)——若集团研究战略收缩,委员会与下载通道的维持是最先受影响的。使用者的对冲:获批后立即做本地完整备份(DUA 允许范围内)+固化引用(v1.0.0 DOI)——把"通道消失"的风险转化为"已备份"的既成事实。
§6.12 稀缺性评估:疫情急性期数据的保值逻辑
本集的稀缺性三层:层一(时间不可复得)——2019-12~2021-02 的急性期诊疗现场已永久关闭(治疗方案/病毒株/医疗挤兑的语境不可复现)——任何急性期数据都是"考古层";层二(形态稀缺)——住院全谱 EHR+大 CT 的组合在疫情数据家族里的独特位置(§1.7/§2.10 排位);层三(治理稀缺)——西班牙私立集团的单集团深挖样本(地域与体制的对照价值)。保值逻辑:层一保证数据的历史价值只增不减(疫情回顾研究的长尾需求),层三保证对照价值(欧洲私立体系的数据民主化样本)。贬值风险:若未来出现更大规模、更开放的多国 COVID CT 联盟数据(聚合级),本集的层二稀缺被稀释——缓解:单集团深挖的粒度(四系统轨迹)是聚合数据永远给不了的。综合评级:长尾保值型资产——使用窗口不在"现在很热"而在"十年后回顾研究时它还在"。
§6.13 批次五终版对照:五篇的完整拼图
| 维度 | 502 掩码 | 503 -U | 504 评测 | 505 本集 |
|---|---|---|---|---|
| 类型 | Database | Database | Challenge | Database |
| 核心交付 | 657,566 掩码 | +地标 std | 18,988 QA | 4,479 住院+144 万 JPG |
| 模态 | 胸片 | 胸片 | 胸片(QA) | EHR+CT/X 光 |
| 访问 | Open | Open | Credentialed | Contributor Review |
| 论文 | Sci Data 2024 | 无论文 | NeurIPS 2025 | Sci Data 2026(14 天前) |
| Views | 高 | 高 | 73 | 59 |
| DAIMS | 6.3 | 6.5 | 6.3 | 5.9 |
五篇(含 501)的叙事收束:501 给"分割任务的原料"→502/503 给"掩码资产及其公差"→504 给"推理考卷"→本集回到"真实住院的多模态全谱"——从像素到考卷再回到病床。批次五的终极信息:胸片研究的每个环节(分割/评测/多模态)都有独立的数据供给,而供给的访问档位与任务敏感度严格正相关——掩码开放、考卷设槛、病床数据最严。
§6.14 十问十答
Q1 一句话这是什么?——西班牙私立医院集团把疫情最早期 4,479 份住院的 EHR 六表+144 万张 CT/X 光,以 PhysioNet 最严档开放共享的六年半长征成品。Q2 有现成标签吗?——没有标注层,只有 EHR 原生诊断/用药/检验(§2.8 任务面)。Q3 和 MIMIC 怎么选?——默认 MIMIC,本集补 CT/COVID 语境/欧洲域三样(§6.4)。Q4 拿到数据要多久?——标准件快、HM 审查数周至数月(§3.9/§5.11)。Q5 能做深度学习吗?——CT 切片自监督/多模态融合可以,胸片大模型训练不行(量级 §4.5)。Q6 4,479 是患者还是住院?——住院记录,患者数 ≤4,479 官方未给(§3.5)。Q7 时间戳能用吗?——相对间隔可用,绝对日期假设不行(§3.7)。Q8 数据会更新吗?——时间窗封闭,冻结资产预期(§3.12)。Q9 最容易犯的错?——切片随机划分(§5.2)与口径越界(§3.5)。Q10 为什么 Views 才 59?——最严档的门槛天花板,低流量≠低价值(§6.7)。
§6.15 增量策略:三种角色的接入深度
角色一(回顾研究者):申请→装载→单模态(EHR 或影像)的回顾分析——3 个月周期,产出回顾论文;角色二(多模态建模者):角色一+§5.3 配方+跨集迁移(MIMIC 预训练)——6 个月周期,产出方法论文;角色三(生态共建者):角色二+§4.12 互验实验+映射表/基线的社区回馈(§5.6 纪律三的合规发布)——一年周期,产出方法学组件+对本集生态的增值(自制解剖层/基线表/审计报告)。三角色的人力梯度 1:2:4——角色三的贡献回授(基线表/审计)是本集生态从 0.5 分(DAIMS 生态维)爬升的唯一路径。
§6.16 时代定位:疫情数据运动的两阶段标本
本集是疫情数据运动史的两阶段标本:阶段一(2020-04,紧急主义)——"数据救命"的口号式共享(alpha 版);阶段二(2024-10,制度化)——PhysioNet 挂牌+最严档治理+六年半后的方法学论文(命名都从口号改成了学术措辞)。两阶段的间隔(四年半)本身是研究素材:数据共享的"运动→制度"转轨为什么这么慢?(答案在整理成本/治理设计/科学优先级的张力里——§1.3 年表的读法)。横向对比:多数 2020 紧急主义数据集死在了阶段一(无治理、无维护、无论文),本集走完全程的概率(论文已见刊)让它成为"转轨成功"的少数样本——它的六年半不是低效,是制度化的真实成本。对未来的启示(长新冠/新发病数据):制度成本要提前计入,"先发布后治理"的欠账模式(阶段一)在文献里留不下可引用的资产。
§6.17 上游依存:四系统与一个集团
依存链:四套医院信息系统(数据源,已固化进 v1.0.0——断供不影响存量)→ HM 集团治理(委员会/伦理——通道层,活依赖)→ PhysioNet 平台(分发层,平台级稳定)→ MIMIC 方法论(方法引用,文献级依赖——MIT 脚本公开在,依赖无风险)。四级的断供推演:数据源断供无影响(冻结资产);治理断供(§6.11 风险)影响新申请者不影响已获批者;平台断供(极低概率)影响分发;方法论无断供概念。整体:存量安全性高、增量通道依赖单一集团——依存画像与"冻结资产"定位(§3.12)自洽。
§6.18 先发与攻防:后来者的位置策略
攻(批判空间):英译审计(§6.2 空白一)/缺失机制(空白二)——两篇批判性论文的选题窗口(数据新见刊,审计类工作引用红利期);防(避免同质化):别做"又一个 COVID 影像分类模型"(家族里已饱和,§2.10)——差异化点在多模态整合与欧洲域;借(协议复用):§5.6 映射表纪律/§5.2 group split/§5.3 配方——三件方法学组件可直接搬进自有项目(引用本集作为协议出处);合(直接共建):向 HM 委员会提交补充提案(附加表文档/英译对照表的官方化——§7.17 提案),成为生态贡献者。排序:借>合>攻>防(与 504 §6.18 同序——生态位建设的通用次序)。
§6.19 五种消费形态
①流行病学回顾样本(公卫研究者)——急性期住院谱的时间切片,结果的时代分层;②多模态原料库(ML 工程师)——EHR×CT 的融合实验场(§5.3 配方);③方法学试验田(数据工程师)——MIMIC 复刻的对照研究/装载对账的方法论论文(§6.5 ①③);④治理案例(数据政策学者)——私立集团+最严档+命名漂移的完整标本(§6.16);⑤教材(医学信息学课堂)——“真实医院数据的整合度"教学样本(§5.9 实验一二)。五种形态的受众跨度提示:本集的百科条目要同时服务"想拿数据的人"与"想研究数据治理的人”——后者常被忽略,本条目 §1/§6.16 是给后者的。
§6.29 影像覆盖的"公平性投影":谁能做上 CT
17.5% 的 CT 覆盖在患者结构上的分布(若元数据保留院区/科室线索)可以回答一个医疗资源分配的问题:“疫情峰值期,谁获得了 CT 评估”——按年龄/性别/入院波次的 CT 覆盖率分层是零成本的现成分析。预期发现(C 级推断):波峰期覆盖率下降(资源挤兑)+高龄组覆盖上升(重症优先)——这类"资源分配的影像学投影"是公共卫生文献少见的角度(影像数据通常只被用来做诊断,很少被用来做资源审计)。CDSL 的 EHR+影像双结构让这种分析成为可能——影像的有无本身就是一条流行病学证据。
§6.30 "第一"的排位赛:多模态开放新冠库的先后考证
版本页自述 “the first multimodal open COVID-19 repository to be shared among researchers worldwide”(论文 Background 同)——这个 “first” 的考证边界:alpha 2020-04 的时点确实早于多数同类(Isaric 临床库、各影像库的公开时间多在 2020 下半年后),但"multimodal open"的定义弹性(影像+EHR 的完备度门槛)让排位赛难以绝对化。学术引用的稳妥表述:“among the earliest publicly accessible multimodal COVID-19 datasets”——把第一让给考证,把早期留给自己。这个表述策略与 502 篇的 CXLSeg"最大"限定词(§2.2)同款:排位声明永远带限定词。
§7 实验提案库:二十四个可直接开工的方向
§7.1 五种喂法:多模态数据集的五种使用姿势
喂法一(单模态深耕)——只用 EHR 六表做结局预测(ICU 转入/死亡)——最低成本的基线线;喂法二(影像单模态)——CT 切片自监督+检查级下游——算力前置的影像线;喂法三(早期融合)——§5.3 配方:特征拼接+GBDT——多模态的最快闭环;喂法四(跨集迁移)——MIMIC 预训练→本集微调(§5.4 姿势一二)——域适应线;喂法五(方法学输出)——装载对账/术语审计/缺失机制(§6.5 ①②③)——不训模型的方法学线。五喂法的启动成本梯度:一<三<二<四<五(五是认知门槛最高但算力最低)。选择心法:先喂法一摸数据脾气,再按研究问题选二/三/四,方法学训练有素选五。
§7.2 30 分钟最小实验:把 ER 图画出来
获批前即可做:读版本页字段描述+论文表格,手画六表+附加表的 ER 图(主键/外键/一对多关系),然后写一页"预装载报告"——预测每表的行数量级与装载风险点(§5.9 实验一的进阶版)。这份报告在获批后的装载周直接对照现实 diff——预测与现实的差距就是你对"医院数据整合"的认知增量。零成本高密度的认知实验——多模态数据集的第一课永远是结构课。
§7.3 结局预测基线族:三层递进
层一(快照基线)——patient_01 快照特征(年龄/性别/科室/首末体征)+逻辑回归→ICU 转入——10 行代码的起点;层二(窗口基线)——入院 48h 窗口的轨迹特征(§5.3:均值/极差/斜率)+GBDT——特征工程的完整展示;层三(多模态基线)——层二+CT 池化特征(784 住院子集)+早期融合——多模态增量的直接量化(对比层二在 784 子集上的成绩)。三层的产出设计:每层报告 AUROC/校准曲线/按波次(第一二波)分层的稳定性——基线族的对比表本身可发表(§6.5 ⑤)。层三的 784 子集约束(§4.4)要写进报告的 limitations——多模态增量与样本量损失的两难是本集多模态研究的永恒张力。
§7.4 CT 切片自监督:144 万张的表示学习
自监督方案的三选一:方案 A(对比学习)——SimCLR/MoCo 式实例判别——切片级表示的通吃起点;方案 B(掩码重建)——MAE 式——对医学影像的纹理学习更友好;方案 C(域内预训练+域外微调)——MIMIC-CXR 或 ImageNet 预训练→本集切片继续预训练——域适应的研究型方案。下游验证三件:切片分类(COVID 灶二分类)/检查级聚合→结局预测(§7.3 层三的升级)/特征可视化(UMAP 按波次/严重度着色)。泄漏纪律:预训练的切片池与下游 test 的隔离也按检查级(§5.2 层一在自监督里的延伸——很多人在预训练阶段漏防)。算力预算:单卡 A100 级 1-2 周的预训练起步——§7.11 预算表的影像侧大头。
§7.5 多模态融合的三阶对照
在 §7.3 层三的基础上做融合深挖:一阶(早期融合)——特征拼接——基线;二阶(晚期融合)——EHR 塔+影像塔各自预测→融合层——模态贡献度可分解;三阶(交叉注意力)——EHR 序列与影像特征的细粒度交互——参数量与数据量的矛盾区(784 样本喂不饱三阶——正则化/预训练初始化是必需)。三阶对照的研究问题:多模态增益随融合深度的变化曲线——在 784 样本的现实下,预期"一阶到二阶有增益、三阶反而退化"——这个负结果如果成立,本身就是"小样本多模态"的方法论结论(§7.12 负结果方向一的近亲)。实验的分组纪律:group split(住院级)+按 CT 缺失机制分层的敏感性分析(§6.8 坑点 3)。
§7.6 EHR 时序的"真实节奏"研究
§4.2 的采样不均匀性从"麻烦"变"研究对象":研究一(采样密度作为信息)——ICU 高频/普通低频的密度变化本身预测病情转折(密度上升=恶化前兆?)——把元信息变成特征;研究二(缺口机制)——生命体征记录的缺口与护士配比/班次的关联(数据的社会学痕迹)——缺口不是缺失而是"医院工作节奏"的化石;研究三(时间感知模型)——连续时间模型(神经 ODE/CT-LSTM 类) vs 离散窗口在真实节奏数据上的对照——方法学论文的框架。三研究的共同卖点:"真实节奏"是 MIMIC 也有的属性但少被当作研究对象——本集的四系统混合让节奏更"脏",脏得有价值。
§7.7 诊断漂移的卫生服务研究
§4.3 双段诊断的研究化:设计——er→hosp 的诊断演变矩阵(急诊印象→出院结论的转移概率)+按波次分层(第一二波的演变差异)+误诊/漏诊的结构画像。产出三张图:转移热图/漂移时序/典型漂移案例的术语对照(西英)。研究的公共价值:疫情压力下的诊断质量与编码行为——卫生服务研究的经典问题在疫情语境的加强版。数据门槛:诊断表的术语对齐工作量前置(§4.3——这个实验的真正成本在 NLP 预处理)。与 CARMEN-I(西语 NLP)的联动(§2.5):若能回溯西语原文(向 HM 提案),漂移研究可以直接在西语层做,英译层当验证。
§7.8 跨集域适应:MIMIC→CDSL 的迁移链
§5.4 姿势一二的研究化设计:链条一(预训练域差)——MIMIC-CXR 预训练编码器在本集 X 光上的零样本特征质量(域差的直接量化);链条二(微调增益曲线)——本集标注极少的现实下,微调样本量扫描(16/64/256/全量)的增益曲线——小样本域适应的实用指南;链条三(并集训练的反向对照)——MIMIC+CDSL 并集 vs 各自单独——异质性的代价与增益。三链条的共同技术底座:转换方法同构(§3.6)排除"转换域差"混杂——这是本集相对其他外部验证场的独特优势(域差纯净)。合规注记:跨集 DUA 复查+HM 提案写明联合设计(§5.4)。
§7.9 LLM 语境扩展:把 EHR 变成推理考题
504 的推理评测协议与本集的接口实验:设计——抽样住院记录,把六表的窗口数据渲染成结构化病历文本(模板化,非生成)→让 LVLM 做"给定这些化验/体征+CT 切片,判断 ICU 转入并给出步骤"——把 504 的"准则→解剖→测量"三步改为"化验→影像→判断"的医疗语境版。实验的两个卖点:其一——504 协议的语境扩展验证(评测协议的可迁移性);其二——本集 EHR 的"真实语境"给推理评测增加现实复杂度(504 的考卷是影像内语境,这里是全语境)。风险预告:LLM 长上下文里表格数据的丢失率(needle-in-haystack 现象)要先测——表格渲染格式(Markdown/键值对/JSON)的对照是实验的前置子实验。合规注记:EHR 内容进 LLM API 的数据出境问题——Contributor Review 语境下要过 HM 委员会(提案里写明 API 供应商与数据处理协议,§8.4 GDPR 专节)。
§7.10 自有数据的改造蓝图:CovidHM_V3 的反向利用
本集代码包的最大隐藏价值:"医院数据→研究格式"的改造蓝图(§4.7 价值二)。改造实验:把自家机构(或合作机构)的 ED/EHR/ICU/RIS 四类数据,按 CovidHM_V3 的六表 schema 映射装载——产物是"你自己的 mini-CDSL"。三步改造:schema 映射表(四系统字段→六表字段)/去标识管线(§3.7 七步的复用)/转换复用(DICOM→JPG 脚本直接跑)。实验的战略价值:多中心可比格式——若多家机构都按六表 schema 改造,跨机构联合的数据工程成本从"每年重新谈判 schema"降为"映射表对齐"——本集 schema 的标准化潜力(§7.17 提案二的放大版)。
§7.11 成本预算表
以角色二(多模态建模)为基准:合规成本——CITI 免费/DUA 免费/HM 审批 0 费用但 1-3 个月时间;存储——全量数十 GB(本地盘即可);算力——EHR 基线 0(笔记本)/CT 自监督 1-2 周 A100(云租数千元级)/三阶融合 1 周内(复用预训练特征);人力——装载周 1 人+分析 1-2 月 1 人。总账:预算瓶颈是时间(审批)与人力(装载对账),不是算力与存储——与影像大模型研究(算力瓶颈)的成本结构互补——预算表的意义:让"等审批"的时间在预研与基线准备中变现(§5.11 W1 设计)。
§7.12 负结果四向
①三阶融合退化(§7.5)——小样本多模态的容量诅咒成立——负结果但直接指导实践;②跨集迁移无增益(§7.8)——转换同构但域差仍不可跨越(设备/人群/疾病谱)——域差的"不可约部分"测量;③英译层术语噪声淹没信号(§7.7 前置失败)——翻译层的成本上限测量;④采样密度不含病情信息(§7.6 研究一)——"真实节奏"的价值证伪。四向的共同价值:都在"多模态+真实医院数据"的方法论空白区——负结果的公布形态:技术报告/短文(§7.12 与 504 §7.12 同款哲学:附录即贡献)。
§7.13 特征字典:读本集讨论时的十二个词
住院记录(admission——本集的样本单位)/patient_id(住院标识——非患者 ID)/六表(六表 schema)/附加表(四系统剩余物)/CT 切片池(144 万的 2D 池)/检查池/住院池(三级池 §4.4)/Contributor Review(最严档)/HM 委员会(逐案审查)/alpha 版(Saves Lives 时代)/group split(住院级划分 §5.2)/映射表(术语/单位/键 §5.6)。这十二个词是本集语境的通行证——§7.14 审稿应对的高频词库。
§7.14 审稿话术模板:四问四答
Q"4,479 样本太少。"——A:住院级 4,479+CT 子集 784 的量级已在功效分析中覆盖主要效应;多模态分析的样本约束通过预训练特征+简单融合结构控制容量(§7.5);本集的价值在语境独特性而非规模(§6.4 矩阵)。Q"CT 缺失非随机。"——A:承认(§6.8 坑点 3);我们做了缺失机制敏感性分析(完整病例 vs 插补 vs 逆概率加权三设定),主结论方向一致;机制推断列为未来工作(§6.5 ③)。Q"英译数据可靠吗?"——A:翻译保真度官方未审计(§6.2);我们的对策是术语频率检查(§3.11 ⑦)+关键变量的分布对照+结论限定在"英译后口径";审计本身是我们的并行产出(§6.5 ②)。Q"为什么不用 MIMIC?"——A:用了(预训练迁移 §7.8),本集提供 MIMIC 没有的 CT 体量、COVID 急性期语境与欧洲域对照——三者的组合是研究问题决定的(§6.4)。四答骨架:口径精确+敏感性分析+限度声明+选择理由——与 504 模板同源(评测与数据研究的答辩通则)。
§7.15 提案三:波次分层的研究设计
本集时间窗(2019-12~2021-02)内部的精细化:波一(2020-03~06 西班牙第一波,医疗挤兑+方案探索)/波二(2020-11~2021-02 第二波,方案成熟化)——按入院时间分层的两个子队列对照:治疗方案谱(medication 表的时代标记)/ICU 转入率/死亡率/影像严重度分布的四维对照。研究价值:同一国家同一集团的两波对照=天然的"治疗方案演化"准实验(非随机,但时代隔离干净)。产出:波次对照的方法学论文+后续 COVID 回顾研究的分层模板。门槛:纯 EHR 分析(无影像也可),数据在手即可开工——§6.5 机会地图里被低估的一条(波次分层是所有分析都该默认做的稳健性检验,单独成文也有价值)。
§7.16 工具链选型清单
五层:装载层——pandas+PostgreSQL(官方建表脚本直接用,§3.13)/DuckDB(单机分析 alternative);影像层——pydicom(元数据)+PIL/OpenCV(JPG 处理)+timm(预训练编码器);时序层——tsflex/tsfresh(窗口特征)+sktime(时间感知基线);融合层——scikit-learn(GBDT 基线)+PyTorch(塔式模型);合规层——DUA 文档管理(版本化)+发布前检查清单脚本(§8.5 红线的 checklist 化)。反选型:勿上 Spark/K8s(数十 GB 单机足够——工程复杂度是数据规模的反函数);勿在装载前引入深度框架(对账十连用 SQL/pandas 完成后才有资格谈模型)。
§7.17 社区三提案
提案一(附加表字段字典)——请 HM 为附加表提供字段级文档(当前最薄的文档面,§3.4)——降低装载成本的最直接改进;提案二(英译对照表官方化)——若存在内部术语映射,发布之(研究价值+重复劳动消除——§5.6 纪律三的官方版);提案三(缺失机制说明)——CT/影像覆盖的选择判据一句话说明(“按临床指征"还是"按设备可及”——对偏差控制是决定性信息,§6.2 空白二)。三提案的共同特征:都是"低成本高杠杆"的文档级改进——Contributor Review 档的社区建设从文档开始。提交渠道:HM 委员会(提案随申请提交)或 PhysioNet 页面联系方式。
§7.18 一页纸预算:给管理者的摘要
目标(三选一):COVID 急性期结局的波次对照研究(§7.15)/多模态 ICU 预测基线族(§7.3)/CT 自监督表示学习(§7.4)。资源:1 名数据工程师(装载 1 周+分析 2-4 周)+算力数千元级+审批 1-3 个月(关键路径)。里程碑:获批→装载周(对账十连)→基线(§7.3 三层)→主实验→发表材料。交付:可复现包(§5.8 模板)+聚合统计论文+(可选)方法学组件回馈。风险:审批周期不可控(预案:预研并行 §5.11)/术语清理工作量超预期(预案:范围收缩到核心变量)/样本量不足(预案:跨集迁移 §7.8)。性价比:数千元+数月换"欧洲 COVID 急性期多模态研究的入场券"——在疫情回顾研究的赛道里,数据获取的边际成本已经是最低档(对比:自建队列的千万级)。
§7.19 四周课程设计
Week 1(结构课)——版本页+论文精读,画 ER 图+预装载报告(§7.2);Week 2(治理课)——PhysioNet 四档访问制度+GDPR vs HIPAA 对照+命名漂移史(§1.2/§8)——治理素养的沉浸课;Week 3(装载课,获批后)——六步装载+对账十连的真实操作(或用模拟数据演练);Week 4(分析课)——§7.3 层一基线+波次分层的稳健性检验(§7.15 的教学版)。考核:小组提交"给 CDSL 的一个改进提案"(§7.17 三提案的方向内自选)——从使用者到共建者的身份转换练习。课程的独特卖点:用真实的最严档数据教"数据治理"——多数课程教算法不教治理,本课程反着来(§6.19 形态⑤的落地)。
§7.20 维护三提案:本条目百科侧的保养计划
提案一(论文引用曲线)——论文见刊 14 天(2026-09-08),引用与讨论的滚动观察进 §10.7 清单(季度)——见刊初期是引用红利窗口的观察点;提案二(HM 动态雷达)——HM 集团研究页/PhysioNet 通知的半年 diff(新版本/第二期数据/委员会政策变化);提案三(生态回填)——§6.5 ①②③的方法学产出(审计/对账报告)发表后回填本条目 §10.4 变更日志(用户验证文献区)——把生态成长固化进条目。人力预算:每年约半天(与 503/504 的保养计划同规格)。
§7.21 与 502/503 的联合实验:批次五的收官联动
§4.12 的落地版排期:实验一(解剖层自制)——502 掩码模型(或 503 的带 std 版)→本集 4,608 张 X 光——产出本集的自制解剖掩码层(内部使用);实验二(测量复刻)——504 CheXStruct 逻辑的 CTR 测量链→本集 X 光+诊断表对照(心扩大编码 vs 测量值——管线外部效度的欧洲域测试);实验三(std 传递)——503 的不确定性方法给实验一的掩码配公差。三实验的批次五意义:掩码线(502/503)×评测线(504)×多模态线(本集)在三周内可以打通——批次五"从像素到病床"的完整叙事有了实验级的闭环。合规注记:三实验都在获批数据的分析范围内(内部增值),衍生层的对外发布走 §8.5 红线四审查。
§7.22 外部验证锚
本集分析结果的三个锚:锚一(临床共识锚)——COVID 严重度的已知临床事实(年龄/淋巴细胞减少/CRP 升高与重症的关联)作为 EHR 分析的"方向校验"——结果方向与共识拧巴时先查数据管道再谈发现;锚二(跨集一致性锚)——同一分析(如年龄-死亡率关系)在 MIMIC COVID 子集与本集的对照——跨集方向一致=结论稳健的跨域证据;锚三(官方统计锚)——西班牙官方疫情统计(感染率/住院/死亡的时间曲线)与本集波次结构的粗对照——抽样代表性的一级检验。三锚都不需要新数据授权,一周可建——先建锚再下结论(与 504 §7.22 同款哲学:可信度工程的最短路径)。
§7.23 校准报告模板:八段式(数据研究版)
发布本集研究成果的标准格式:①版本三元组(v1.0.0/论文 2026/你的代码版本)+审批编号(HM 提案号);②口径声明(住院记录口径+患者数未披露的事实 §3.5);③装载对账摘要(§3.11 十条的通过状态+异常清单);④划分协议(group-aware 的层次与理由 §5.2);⑤主结果(波次分层+敏感性分析 §7.15);⑥锚检查(§7.22 三锚的通过状态);⑦许可与发布边界(聚合统计/无个案信息/映射表脱敏 §8.5);⑧复现指路(复现包+获取方式)。八段式与 504 §7.23 的差异:①多审批编号、③是数据对账而非模型校准、⑤多波次分层——评测与数据研究的报告骨架同源、血肉不同。
§7.24 一分钟版:实验库的电梯摘要
要快速起步→§7.2 画图+§7.3 层一;做多模态→§7.5 三阶对照(记住 784 的现实);有算力→§7.4 CT 自监督;做方法学→§6.5 ①②③(审批后即可开工);想做批次五联动→§7.21 三实验;要发论文先审稿自检→§7.14 四问四答+§7.23 八段式。全库二十四个方向的共同前置:审批通过+六步装载+对账十连——先治理后分析,先锚后结论。
§7.25 审批提案的四段书写模板(§7.17 的落地版)
把 Contributor Review 提案压缩成四段可交稿的骨架:段一(问题)——“本研究旨在 [一句话科学问题],利用 CDSL 的 [具体表/影像子集],回答 [具体可判定的假设]”;段二(范围)——“所需数据:patient_01 全量、lab/medication 的 [字段清单]、CT 影像的 [子集标准]。不需要:[明确排除项]”;段三(隐私)——“分析在 [环境] 进行;输出物仅 [聚合层级];本地副本 [加密/访问控制];研究结束 [保留/销毁] 计划”;段四(回报)——“成果将以 [论文/开源代码/结果摘要] 形式回馈,副本将提供贵委员会”。四段的每一句都是委员会审查清单(§8.2 四看)的正向应答——提案不是论文摘要,是"安心感的结构化交付"。
§7.26 影像缺失的三策略对比(多模态建模的核心决策)
| 策略 | 做法 | 优点 | 风险 |
|---|---|---|---|
| 缺失指示变量 | "有无 CT"作为特征 | 保留指征信息、实现最简 | 指征混杂显式化不足 |
| MNAR 建模 | 缺失机制联合建模 | 统计严谨 | 工程复杂、假设难验 |
| 完整案例 | 仅用有影像子集 | 无缺失问题 | 样本掉到 17.5%、选择偏倚 |
三策略的选择规则:预测部署用策略一(上线时同样面临影像缺失——指示变量是部署语义的一部分);因果推断用策略二(指征混杂是因果链的一环,需显式建模);探索分析用策略三(先在子集找信号再扩样本)。三策略都跑的敏感性分析是审稿人的最低期待。
§7.27 波次切点的敏感性协议
时间切分(§5.4)的切点选择做三层敏感性:切点浮动——2020-10-01/12-01/2021-01-01 三个切点各跑主实验,结论方向不变才算稳;波次整切——第一波训练/第三波测试的最狠对照(分布漂移的极限测试);窗口长度——特征窗 24h/48h/全程三档。三层敏感性的产出是一张"切点×窗口×结论"的稳健性矩阵——结论只报在矩阵里存活的那部分。
§7.28 判定与日志的最小 schema(表格研究版)
| 字段 | 用途 |
|---|---|
| hospitalization_id | 分析单位(记录级口径) |
| wave / admission_rel | 波次与相对入院时间 |
| feature_set / model_ver | 特征版本与模型版本 |
| split / fold | 划分归属 |
| y_true / y_pred | 结局与预测 |
| imaging_channel | 影像通道有无(缺失审计) |
| run_ts | 时间戳 |
七字段支撑三臂消融、波次敏感性、缺失审计的全部原料需求——表格研究的日志比影像研究轻,但纪律相同。
§7.25 影像质量分层管线:给 144 万张切片建质检层
目标——用 §4.6 的 DICOM 元数据为切片池建立质量分层(官方验证之外的"用户侧质检层")。
分层特征四级:
- 级一(采集参数)——千伏/毫安秒/层厚——参数异常低的切片标记"低质量采集";
- 级二(灰度统计)——直方图熵/对比度/有效像素占比——过暗/过曝/空白切片的自动筛除;
- 级三(运动伪影代理)——相邻切片的梯度突变统计——重建错层检测;
- 级四(信息量)——切片方差过低(接近均匀灰度)的"空切片"标记。
产出:manifest.csv 加四列质量标记→切片池的"质检报告"(各等级的分布+与官方转换验证的对照)。
研究价值:质检层本身是可发表的方法学组件(§6.5 ①的延伸)——用户侧质检报告是数据集生态成熟的标志物;下游所有影像实验(§7.4/§7.5)都应以质检层为前置过滤——没有质检层的大规模实验,审稿人有权要求补。
合规注记:质检统计(分布/比例)可发布,切片级清单含个案路径——按 §8.5 判定协议处理(键值层可、个案层审)。
成本:PIL+numpy 的批量脚本,半天内完成级一二级,级三四各一天——装载周的可选增值项(性价比极高的第三天任务)。
§7.26 住院记录的"数字孪生"可视化:装载质量的最终检验
目标——为抽样住院记录生成一页式"住院时间线图"(人读的数字孪生),作为装载质量的最终人工检验(§5.1 步六的工程化)。
时间线的五条泳道:
- 体征泳道——vital_signs 的关键项随时间曲线(心率/血氧/体温);
- 检验泳道——lab 的关键项散点(CRP/D-dimer/淋巴);
- 用药泳道——medication 的给药时间点条码图;
- 影像泳道——检查时间点的标记(CT/X 光的竖线);
- 里程碑泳道——入院/ED/ICU 入出/出院的垂直参考线。
读图检验清单:时序偏序正确(里程碑次序无倒置)?体征与用药的临床叙事通顺(发热后用退烧药)?影像时点与病程合理(入院早期 CT)?——每张图 3 分钟人工通读,20 张一小时的"眼见为实"。
产出:20 张抽样时间线图+通读记录(进 §5.8 复现包的 self_check_report)——审稿人与继任者的"数据活体样本"。
实现:matplotlib 五泳道模板一页代码——这是"装载质量可视化"的通用方法(本系列任何 EHR 类条目适用,方法注记存此)。
§7.27 影像-化验的时序对照研究:窗口设计模板
研究问题——CT 病灶进展与炎症指标轨迹的时序关系(谁的先行指标?)。
窗口设计五步:
- 锚点选择——每次 CT 检查时间为锚(784 住院的多次 CT 是天然重复测量);
- 前置窗——锚前 0-7 天的化验轨迹(CRP 斜率/最低淋巴细胞);
- 后验窗——锚后 0-7 天的化验轨迹(影像发现后的炎症反应);
- 对照构造——同患者无 CT 期的同长度窗口(自身对照,消除患者间混杂);
- 统计框架——重复测量的混合模型+住院级随机效应(§5.2 泄漏纪律的统计版)。
前置条件——§5.15 时间字段三层验证通过(窗口分析对时间粒度最敏感)+§7.25 质检层(低质量切片排除)。
预期贡献——"影像-化验先行关系"是 COVID 病理生理的经典问题(影像先于化验恶化?反之?)——本集的 CT+化验双轨迹是回答它的合适样本(住院级重复测量+双侧信息)。
风险预告——时间粒度若被去标识粗化到天级,前后窗的重叠会让"先行"判断失准——粒度声明(§5.15)是本实验的生死线;粒度不足时的降级设计:把"先行关系"问题降为"同窗关联"问题(仍然有价值但因果语气回撤一级)。
§7.41 六表的"宽透视"视图设计:一张 SQL 生成论文 Table 1
宽表+五长表的透视设计的最终形态是一条 SQL 生成论文基线表:视图定义——patient_01 LEFT JOIN 各长表的聚合子查询(首值/末值/计数)→ 一张"一住院一行、30+ 列"的分析视图;Table 1 的自动生成——按结局(死亡/存活)分列的基线特征表+SMD 均衡性检验;复用价值——视图一次定义,三波分层/影像子集/敏感性的每次分析都是 WHERE 子句变化。视图设计的哲学与 502 的对账十条同源:把重复劳动固化成一次定义的资产。SQL 载体建议 duckdb(CSV 直查+视图+导出 Parquet 一条龙)。
§7.42 影像通道的"零训练"用法:嵌入检索与相似病例
144 万 CT 切片+4,608 X 光的零训练研究用法:嵌入检索——公开预训练 encoder(CheXpert 预训练模型/MedicalNet)提取影像嵌入→按住院记录聚合→"相似病例检索"系统(给定当前患者,检索历史相似影像+其 EHR 结局)——临床决策支持的原型;零标注的价值——不需要诊断标注(检索相似度自足),CDSL 的影像无标注层(§4.3)从这个角度不是缺陷。与 EHR 的闭环——检索出的相似病例带结局(宽表),“相似患者最后怎么样了"是临床最朴素的问题形态——影像检索×结局检索的组合是本集影像库最适合的"首秀姿势”。
§8 合规深水区:Contributor Review 的完整审查
§8.1 PhysioNet 四档访问制度:本集在最严档的位置
PhysioNet 的访问光谱四档:Open(CC0/CC BY,即下即用——502/503 的档位)、Credentialed(DUA+CITI 培训——504 与 MIMIC 系的档位)、Contributor Review(DUA+CITI+贡献方逐案审查——本集档位)、私有托管(数据不上 PhysioNet 公开目录,仅平台代管)。本集所在第三档的制度含义:审查权在贡献方(HM 委员会而非 PhysioNet)——PhysioNet 提供平台与流程框架,准入判断外包给最懂数据风险的贡献方。四档的设计哲学:数据敏感性(再识别风险×商业敏感×伦理承诺)与使用者摩擦成正比——本集的三重摩擦(§3.9)对应的是三重敏感(西班牙小队列的再识别风险+私立集团的科研合作考量+GDPR 属地约束)。对系列的意义:批次五集齐前三档的活样本(502 Open/504 Credentialed/本集 Contributor Review)——Top 1000 的"访问合规"维度第一次有了完整的制度光谱对照(§2.11)。
§8.2 HM Data Science Commission:逐案审查的运行解读
委员会审查的运行特征(基于版本页条款与申请者经验的合成解读——标注为 C 级推断):审什么——研究目的/字段清单/分析计划/团队/安全措施/产出形式(§3.9 第二重清单);怎么审——委员会例会制(周期不透明)+必要时伦理委员会复审(两轮制);审过的标准——版本页只说 “individual studies reviewed”,通过率/审稿意见的透明度低。透明度的三点建议(§7.17 同源):公布审查标准清单/公布平均审批周期/公布典型退回理由——三者都能显著降低申请者的试错成本(对贡献方也是减负)。申请者的对策:把 §3.9 四要领当"已知标准"对齐+预留 48h 补件响应(§5.12 演练四)+把审批周期写进项目甘特图的最坏估计。
§8.3 Contributor Review License 1.5.0 的红线清单
在 Credentialed License 1.5.0 的五红线(§504 8.3:再识别禁令/再分发禁令/发布形态/衍生数据/审计义务)之上,本集的逐案审查叠加三条款:条款六(用途锁定)——获批提案里的研究目的即使用范围,超出需重新申报("研究漂移"是违约风险——计划外的次级分析先补审再用);条款七(团队锁定)——获批名单外的成员不得接触数据(合作者/学生中途加入=补审项);条款八(跨境再确认)——数据落地地/合作方所在地/云处理地跨辖区时的事前确认(GDPR 跨境传输规则的适用场景)。八条合成的行为准则:“提案即契约”——获批文件的每个字段都是使用边界的法律表述——本集的合规文档工作量是 Credentialed 档的两倍起(提案档案+补审记录的持续管理,§5.8 compliance/ 目录的存在理由)。
§8.4 GDPR 语境:西班牙健康数据的属地约束
本集与 MIMIC(美国 HIPAA 语境)的合规底层差异:GDPR(欧盟通用数据保护条例)对健康数据(特殊类别个人数据)的处理要求更严——要点一(合法性基础)——本集的处理基础是"公共利益的科学research+伦理委员会批准"路径(GDPR Art. 89 的科研豁免框架)——贡献方的伦理批准(auth_opendata_cdsl3_170624)是该基础的文件化;要点二(数据主体权利)——GDPR 赋予数据主体的访问/反对权在科研豁免下的受限适用——贡献方的逐案审查是权利平衡的制度实现;要点三(跨境)——研究者所在国的数据保护水平与 EU 的充分性认定影响数据传输方案(中国研究者的额外动作:境内数据保护法合规+机构伦理的双背书,提案里主动说明——透明度是跨境审批的加分项);要点四(最小化原则)——字段清单"够用就好"的申请策略(§3.9 要领二的合规理论依据——多要字段=违反最小化=审批风险)。GDPR 四要点的实操翻译:申请材料的 GDPR 语感(最小化/目的限定/安全措施的具体化)是欧洲数据集申请的通用加分项。
§8.5 发布边界的判定协议:什么能写进论文
研究成果发表时的逐类判定:聚合统计(系数/AUROC/发生率)——可发布(逐案审查通过的研究默认允许);图表——聚合图表可、个案级图表(单患者轨迹图/单张原图)原则上不可——确需时走 HM 补审(红线三的个案通道);衍生数据集(清洗后的分析数据集/映射表/特征表)——键值层可、含原始自由文本层不可(§5.6 纪律三);模型权重——在获批数据上训练的模型发布需审查(模型反演/记忆化风险——GDPR 语境下的"模型即数据"问题,逐案补审);代码——不含数据与个案信息的分析代码自由发布(鼓励)。判定协议的操作化:发表前过一遍 §5.8 compliance/publication_review.md 检查表(八类产出的逐项勾选)——发现灰区项,提前 4-6 周提交 HM 补审(论文投稿周期与审批周期的并行管理)。
§8.6 审批管理:本集版的机构内流程
在 504 §8.6 三节点(申请前/落地/发表前)之上,本集加两节点:节点零(提案期)——提案书与 §8.4 GDPR 语感自查+团队名单锁定(§8.3 条款七的预防)——申请材料的合规质量决定审批周期的经验规律;节点四(使用期)——用途漂移的季度自查(当前分析与获批提案的对照)+团队名单变更的补审触发——使用期的持续合规是 Contributor Review 档的特有义务(§8.3 条款六七的运行面)。五节点的文档落点:compliance/ 目录的五个子文件夹(提案/批复/名单/季度自查/发表审查)——本集合规管理的文件体系。
§8.7 风险登记册:本集合规面的六项残余风险
①审批周期波动(委员会节奏不可控——预案:甘特图最坏估计+并行预研);②条款解释分歧(提案里未明示的分析是否违约——预案:灰区动作前书面咨询委员会,留痕);③团队流动(学生毕业/合作者进出——预案:名单变更的补审 SOP);④跨境政策变化(EU-中数据流动规则的演化——预案:数据本地化处理+云出境最小化);⑤再识别突发事件(外部数据库合并导致的意外再识别——预案:立即停用+报告委员会的事件 SOP,红线一的运行面);⑥平台政策变化(PhysioNet 访问制度的演化——预案:§10.7 观察清单+已备份的对冲)。六项的共同哲学:Contributor Review 档的合规风险不在"违规处罚"而在"通道失效"——治理关系的维护(响应速度/透明度/关系质量)是最有效的风险管理。
§8.12 数据出境与多云环境的合规注记
Contributor Review 数据的跨环境使用(云分析/合作方计算)的合规要点:数据出境——西班牙/欧盟数据在非欧环境的处理受 GDPR 章节约束(提案中声明分析环境是基本动作);多云策略——分析在获批声明的环境进行,临时云租用属于环境变更(补充声明而非默许);代码出境数据不出——联邦式分析的合规优势(§9.4 Q67)。三条的实操收敛:提案里的"环境声明"写得越具体,后续的合规摩擦越小——"本分析将于 [区域] 的 [环境类型] 进行,数据不出 [边界]"一句话的预防价值极高。
§8.13 引用链的完整样例(含 alpha 历史件)
一篇使用 CDSL 的论文的完整引用段样例(可直接改写):数据引用:“Ritoré Á, Oprescu AM, Estirado Bronchalo A, Armengol de la Hoz MÁ. COVID Data for Shared Learning (CDSL) (version 1.0.0). PhysioNet. 2024. doi:10.13026/1176-6c44.”;论文引用:“Ritoré-Hidalgo Á, Villar Fernández J, Oprescu AM, et al. COVID Data for Shared Learning (CDSL): a multimodal publicly accessible dataset… Sci Data. 2026. doi:10.1038/s41597-026-08184-1.”;源方法引用:“Johnson AEW, et al. MIMIC-CXR-JPG… arXiv:1901.07042.”(JPG 管线方法);历史件(如涉及早期共享叙事):“HM Hospitales. Covid Data Saves Lives. 2020.”(版本页引用 [5])。四件套的分工叙述:数据(合同)/论文(传记)/方法(源头)/历史(时间线)——每件引用回答一个不同的问题,混用是引用混乱的根源。
§8.14 "开放数据"的三种世界观:CDSL 案例的理论升华
从 CDSL 的六年半提炼"开放数据"的三种世界观:世界观一(自由主义)——数据即阳光,越开放越好(502/503 的 CC BY 4.0 立场);世界观二(契约主义)——开放是附条件的契约,条件保障质量与尊重(504 Credentialed 的立场);世界观三(托管主义)——数据是患者托管的信托,每次使用都是受托行为(CDSL Contributor Review 的立场)。三种世界观无对错、只有匹配:数据的敏感性×用途谱×机构治理能力决定适配的世界观。CDSL 的贡献是把世界观三的运作细节(提案/审查/全周期义务)首次完整展示给行业——理论升华的落地样本。系列条目合读至此,"AI-Ready"的定义也完成三层进化:格式就绪(世界观一)→许可就绪(世界观二)→治理就绪(世界观三)。
§9 FAQ 90 问:全场景问答手册
§9.1 身份与获取(9 问)
- CDSL 是什么?——西班牙 HM Hospitales 的多模态 COVID-19 住院数据集:4,479 住院记录的 EHR 六表+144 万张 CT/X 光 JPG(PhysioNet v1.0.0,2024-10)。
- 和 “Covid Data Saves Lives” 什么关系?——同一资产的 alpha 版名(2020-04 官网申请制版),2024 挂牌时改名 Shared Learning(§1.2)。
- 在哪获取?——PhysioNet(covid-data-shared-learning);代码 CovidHM_V3-code 在数据包内。
- 要付费吗?——数据免费;成本是审批时间(数周-数月)与合规管理。
- 下载前准备什么?——机构邮箱+CITI 证书+DUA+研究提案(§3.9 三重门槛)。
- 版本用哪个?——v1.0.0(唯一版本,时间窗封闭——§3.12 冻结资产)。
- 有论文吗?——Sci Data 2026(DOI 10.1038/s41597-026-08184-1),见刊 2026-09-08。
- RRID?——SCR_007345。
- 中文文档?——官方无;本条目为最完整中文参考(含提案书写与合规解读)。
§9.2 数据结构(9 问)
- 交付物三块?——关系表(六表+附加表)/影像(JPG+元数据)/代码文档(CovidHM_V3-code)——§3.1。
- 六表怎么连?——patient_id(住院标识)为主键的星型+长表混合结构(§3.3)。
- patient_id 是患者 ID 吗?——不是:是住院标识(unique admission identifier),患者数 ≤4,479(§3.5)。
- 影像规模?——1,444,764 JPG:CT 切片 1,440,156(784 住院)+X 光 4,608(1,616 住院)(§3.1)。
- 为什么 CT 这么多?——采集路径+切片计数口径+单院区真实结构三层解释(§2.3)。
- 附加表是什么?——四系统特有字段的存放区(呼吸支持参数等)——文档较薄需考古(§3.4)。
- 时间字段能直接用吗?——去标识后的粒度要先验证(相对间隔 vs 绝对日期,§3.7 缺口④)。
- 有放射报告文本吗?——无结构化报告层;影像的临床语境靠诊断表+时间窗间接推断(§4.1)。
- 训练/测试划分?——无官方划分;group-aware 自行设计(住院级起,§5.2)。
§9.3 分析执行(9 问)
- 最小分析配置?——笔记本+PostgreSQL/DuckDB+pandas——EHR 侧零算力门槛(§7.16)。
- 装载要多久?——获批后一周(六步装载+对账十连,§5.1/§5.11)。
- 多模态样本量?——EHR 4,479 × CT 784 的交叉现实(§4.4 三级池)。
- CT 能做 3D 重建吗?——技术上可行但层厚/压缩成本高——2D 池化起步更现实(§2.4)。
- 结局标签哪来?——diagnosis_hosp/ICU 时间/死亡字段的自定义组合——无现成标签层(§2.8)。
- 特征工程起点?——§5.3 配方:快照+48h 窗口+诊断二值化。
- 怎么防泄漏?——三层泄漏的 group-aware 划分(§5.2)——最高优先级纪律。
- 波次怎么分?——按入院时间切两波(2020-03~06/2020-11~2021-02,§7.15)。
- 单位/术语混乱怎么办?——映射表纪律(§5.6)+分布检查(§3.11 ⑦⑧)。
§9.4 结果解释(9 问)
- 结论能外推到其他人群吗?——限西班牙私立体系+急性期病毒株+治疗方案时代(§2.10)。
- CT 覆盖 784 的偏差怎么说?——缺失机制未披露——敏感性分析+limitation 声明(§6.8 坑点 3)。
- 多模态增益怎么报告?——单模态基线 vs 融合的对照表+784 子集的样本量代价(§7.3 层三)。
- 死亡率数字和官方统计对得上吗?——粗对齐即可(抽样代表性一级检验,§7.22 锚三)。
- X 光 4,608 能出结论吗?——验证/对照级结论可以,训练级不行(§4.5)。
- 时间序列分析的粒度限制?——去标识粒度决定——先验证再设计(§4.2/§3.7)。
- 和 MIMIC 的结果能直接比吗?——方向可比、数值不可比(地域/体系/时代三重域差,§6.4)。
- 阳性结果怎么自证?——波次分层稳定性+锚检查(§7.15/§7.22)。
- 阴性结果有价值吗?——四向负结果都是方法论空白区(§7.12)。
§9.5 与本系列条目的关系(9 问)
- 与 492/495(MIMIC)的关系?——EHR 范式对照+预训练-微调的跨集线(§6.4 矩阵/§5.4)。
- 与 501/502/503 的关系?——掩码生态的迁移测试场(§4.12/§7.21——批次五联动)。
- 与 504 的关系?——504 评推理过程,本集给真实语境;504 的"双塔"表述已在 505 修正(§2.9/§10.4)。
- 与 499(CIED)等 EHR 系的关系?——同为"设备/住院轨迹"语境——本集多了影像与疫情时代。
- 本集在批次五的位置?——收官篇:从胸片专项回到多模态全谱(§1.8)。
- 有 COVID 数据集家族对照吗?——§2.10 的家族盘点(ICU 专精/影像专精/登记统计三型)。
- 阅读顺序?——EHR 线:492→本集;影像线:501-504→本集 §3.6;治理线:504 §8→本集 §8。
- 互链锚文本?——中文"COVID 多模态住院数据集(CDSL)",slug cdsl-covid-data-shared-learning。
- 为什么 Views 只有 59?——最严档门槛的剂量-反应(§6.7——低流量≠低价值)。
§9.6 合规与许可(9 问)
- 三重门槛的具体成本?——CITI 数小时/DUA 线上/委员会数周-数月(§3.9)。
- 提案怎么写?——§3.9 四要领:问题具体/字段精确/安全写实/产出可核。
- 能给学生用吗?——团队名单锁定,新人加入走补审(§8.3 条款七)。
- 能把分析结果发论文吗?——聚合统计可;个案图表/衍生数据/模型权重走审查(§8.5)。
- 能和中国团队合作吗?——跨境合规:GDPR 跨境规则+双背书+透明申报(§8.4 要点三)。
- 分析能换题吗?——用途漂移需补审(§8.3 条款六——“提案即契约”)。
- 数据能放云上吗?——写进提案申报(处理地/供应商/安全措施),获批后可(§8.3 条款八)。
- 论文的 CC BY-NC-ND 管数据吗?——不管:论文许可≠数据许可(§3.10 易错二)。
- 发现再识别风险怎么办?——立即停用+报告委员会的事件 SOP(§8.7 风险⑤)。
§9.7 工程细节(9 问)
- 建库用什么?——官方 PostgreSQL 建表脚本直接用(CovidHM_V3-code,§3.13)。
- JPG 和元数据怎么对应?——文件名/路径级对应——元数据文件是权威(§4.6)。
- 切片怎么归组成检查?——元数据的检查/层号字段聚合——§3.11 ⑩的对账动作。
- 影像计数不符怎么办?——三段排查(清单脚本/解包/官方通道,§5.12 演练三)。
- 时间出现负值/倒挂?——官方逻辑校验重跑+异常隔离清单(§5.12 演练二)。
- 键对不上?——附加表键前缀归一(§5.12 演练一)。
- 大表内存爆?——分块/DuckDB 外存分析——单机工具链够用(§7.16 反选型)。
- 影像预训练起点?——timm 的预训练编码器/502 生态迁移(§7.4 方案 C)。
- 复现包怎么组织?——§5.8 模板(compliance/ 一级目录是本集特色)。
§9.8 教学与文献(9 问)
- 适合什么课?——医学信息学/数据治理/多模态 ML 课(§7.19 四周设计)。
- 学生没获批能教学吗?——能:结构课/治理课/方法课(实验一二)用公开文档教学(§5.9)。
- 引用格式?——§3.10 四件套(数据 DOI+论文 DOI+RRID+代码)。
- 2020-2024 的 alpha 版文献怎么处理?——时代配对纪律:名字与 DOI 的时代匹配(§6.3)。
- 有综述引用吗?——Sauer 等的 ICU 数据集比较类综述是语境文献(§2.10)。
- 数据民主化的参考文献?——版本页/论文的 “data democratization” 表述+私立集团开放数据的治理文献(§6.19 形态④)。
- 批评文献怎么找?——英译审计/缺失机制类的后续研究(§6.5 ②③——空白区自产)。
- 中文怎么称呼?——“COVID 多模态住院数据集(CDSL)”。
- 教学案例的合规边界?——教学分析走机构审批+聚合展示(§8.5 判定协议的教学版)。
§9.9 决策与采购(9 问)
- 团队该不该申请?——三 yes:COVID 急性期研究/多模态融合研究/欧洲域对照需求;三 no:要现成标签/要快出结果/只要胸片(§0.5/§6.9)。
- 总投入多少?——人力 1-2 人月+算力数千元+审批 1-3 个月(§7.18)。
- ROI?——欧洲 COVID 急性期多模态的入场券——自建队列成本的万分之一档。
- 和商业数据公司比?——本集是真实医院四系统原生+学术治理透明——商业数据的黑箱加工不可比。
- 医院能用吗?——能:本院 COVID 数据的对照基准( HM 之外的医院做差距分析)。
- 行政决策怎么用?——疫情准备度的回顾评估(波次对照 §7.15 的管理翻译)。
- 投资视角?——私立医疗集团的数据资产化样本(§6.19 形态④的产业面)。
- 竞品怎么选?——§2.10 家族盘点:深挖选本集、广度选登记统计、ICU 时序选 MIMIC。
§9.10 前瞻与维护(9 问)
- 会有 v1.1 吗?——低概率:时间窗封闭(§3.12)——二期数据会是新发布。
- 会出第二期吗?——取决于 HM 战略周期(§6.6)——无信号,观察清单跟踪。
- 审批会更快吗?——取决于委员会透明度改进(§7.17 提案)——无公开时间表。
- 数据会贬值吗?——层一时间稀缺保值/层二形态或被聚合数据稀释/层三治理稀缺稳定(§6.12)。
- 泄漏事故怎么办?——事件 SOP:停用-报告-评估-整改(§8.7 风险⑤)。
- 本条目的更新协议?——四源季度 diff(PhysioNet/论文/HM 页/引用曲线)——§10.7 清单。
- 发现条目错误?——系列勘误流程(§10.9);数据本体问题走 HM 委员会。
- 一年后条目还在吗?——在:季度保养机制(§7.20)。
- 最后一句建议?——先提案后装载,先锚后结论,先治理后分析。
- 六年半值得吗?——数据在,通道在,论文在——制度化的成本与成果都在明面上:值得。
§9.11 番外:十个冷观察
①命名从口号到学术措辞的漂移是疫情心态史的缩影;②Views 59 vs 论文见刊的反差——学术价值与平台流量的解耦标本;③CT 313 倍于 X 光——“胸片时代"叙事下放射科的真实产出结构;④官方代码包让"数据集"变成了"数据集+工厂图纸”;⑤alpha→PhysioNet 的四年空窗——数据运动的"整理债"可视化;⑥审稿恰好一年整(Sci Data)——慢工与例行公事的分界模糊;⑦患者/住院口径的官方并存——语言精确性在医疗数据里的制度性难度;⑧英译层是最少被讨论的加工步骤——翻译是数据治理的隐形层;⑨HM 的"not only in Europe but also in Spain"——数据民主化的南欧自我定位;⑩本集是批次五唯一让"等审批"成为合理工作内容的条目——治理成本的时间显形。
§9.12 十二个如果(反事实推演)
如果 2020 没做 alpha——本集可能根本不存在(疫情窗口的整理动力不可复现);如果一直留在 HM 官网——无 PhysioNet 治理框架,数据的学术信用与获取规范大打折扣;如果选 Credentialed 档——流量升、审查降——但西班牙小队列的再识别风险治理会欠账;如果只发 EHR 不发影像——"多模态 first"不成立,生态位坍缩为普通 EHR 集;如果只发影像不发 EHR——CT 库没有临床语境,价值减半;如果六表做成一宽表——失去关系范式的灵活性与 EHR 真实形态;如果英译不做——西语门槛挡掉多数国际使用者(资助了 NLP 但限制了流行病学);如果日期完全相对化——纵向轨迹分析更安全但跨患者时间对照失效;如果论文 2024 就发——方法学自检没做足,见刊质量存疑;如果 HM 是公立——数据开放可能有法规强制但少了私立的战略自主叙事;如果再晚一年挂牌——学术信用进一步流失(数据时效的信用折旧);如果重做一遍——最该改的是:附加表文档与英译对照表在 v1.0.0 就补齐(§7.17 提案的作者侧自觉)。
§9.13 尾注三问
一问:数据的"第一现场"还有多久保鲜?——2019-12~2021-02 的急性期现场已关闭五年;本集是少数被制度性保存的切片。保鲜期的真正变量不是数据(数据不变),是解读语境——十年后研究者看这批数据的"陌生感"会成为优势(时代志)还是负担(方案过时)?本集的保值逻辑(§6.12)押注前者。二问:最严档是在保护谁?——表面是保护患者(再识别风险),深层也保护贡献方(品牌与法律)、保护平台(治理示范)、最终保护数据的未来可用性(信任是长期资产)。Contributor Review 的 59 个 Views 是这个保护的价格标签——贵,但物有所值的论证责任在贡献方与条目作者(本条目 §8 的任务)。三问:私立集团为什么值得被认真对待?——医疗数据的未来供给缺口主要在公立体系之外(私立/基层/专科连锁)——HM 的六年半提供了一个"私立开放"的完整模板(动机/治理/成本/收益),无论它是成功案例还是警示案例,都是模板——这就是它进入 Top 1000 的理由。
§9.14 数字对账五组:核心数字的二次核对表
第一组(规模闭环)——4,479 住院记录;影像 1,444,764 JPG = 1,440,156(CT)+ 4,608(X 光);覆盖 784(CT)与 1,616(X 光)住院记录——注意 784 与 1,616 可交叉(同一住院可两模态都有),非互斥加和。出处:版本页+论文摘要,双源一致。
第二组(时间窗闭环)——2019-12-26 至 2021-02-13。锚点解读:起点在官方疫情叙事之前(疑似病例回溯入组),终点在第二波高峰回落期——窗口覆盖西班牙前两波的住院压力期。出处:版本页 temporalCoverage。
第三组(版本时间线闭环)——alpha 2020-04 → PhysioNet v1.0.0 2024-10-25 → Sci Data 投稿 2025-08-12 → 接受 2026-08-14(审稿一年整)→ 见刊 2026-09-08(核查时点 14 天前)。五个锚点全部双源可证(版本页 changelog+论文日期)。
第四组(引用身份闭环)——数据 DOI 10.13026/1176-6c44 / latest 10.13026/85z8-jq92 / 论文 DOI 10.1038/s41597-026-08184-1 / RRID SCR_007345 / 伦理授权 auth_opendata_cdsl3_170624——五件身份标识的原样记录(§3.10 的组装素材)。
第五组(口径并存声明)——版本页 Methods “4,479 unique hospitalized patients” vs 数据字典 “unique admission identifier” vs 论文摘要"住院记录"——三处原文并存,本条目统一采用"住院记录"口径。维护者复算方法:装载后 COUNT(DISTINCT patient_id) 与 COUNT(*) 的对照(两数相等则该交付层无重复住院标识——患者级去重问题依然存在但不可观测)。
五组的维护协议与 504 §9.14 同:官方数字变动时先改速查卡(§10.6)再全文检索数字出现位——数字一致性是可信度下限。
§9.15 三十秒电梯稿:五种场合的说法
对院长:“西班牙最大的私立医院集团把疫情最重的两年、四千多个住院病人的完整档案——化验、用药、CT——按国际最严格的治理标准开放了。这是欧洲医疗数据民主化的样板工程,我们对照它设计自己的数据开放策略。”(§6.16+§8)
对研究者:“MIMIC 是 ICU 深水区,这个是 COVID 住院全谱+144 万张 CT——做疫情急性期的多模态研究,它是欧洲域的唯一档位选择。”(§6.4)
对工程师:“DICOM 转 JPG 的管线逐行复刻 MIMIC-CXR-JPG,还把建库 SQL 都开源了——这是能直接抄作业的数据工程。”(§3.6/§7.10)
对法务:“PhysioNet 最高档:签 DUA、过 CITI 培训,还要 HM 医院的数据委员会逐个审批研究方案——我们提proposeal时要按 GDPR 语感写,字段清单只写够用的。”(§3.9/§8.4)
对投资人:“私立医院的数据资产化+学术化是一条已被走通的路——六年半、零外部资助、论文落在 Nature 子刊——这个模板的医疗集团端价值值得测算。”(§6.19 形态④)
五段共用的底料纪律与 504 §9.15 同:全部事实出自已核查章节,电梯稿永不超纲。
§9.16 三个研究者的三种入场姿势(画像化)
同一份数据,三种研究者的最优入场路径:画像 A(ML 博士生)——先 HF 同类集练手→提案聚焦"多模态融合"单点→三个月出融合基线→以基线为核心扩成方法论文;画像 B(流行病学副教授)——提案直接要六表(不要影像)→三波对比的描述性研究快速发表→影像扩展作为第二篇的增量;画像 C(医院信息科主任)——目标不是论文而是 CovidHM_V3-code 的 ETL 模板改造→提案以"联合开发/能力建设"为框架→数据使用是副产品。三种画像的提案重点各不同(A 押技术方案、B 押临床价值、C 押共建框架)——Contributor Review 审的是"提案背后的人",画像清晰的人通过得快。
§9.17 数据的"考古层":后来者如何读懂 2020 年的决策
六年后使用 CDSL 的研究者会遇到"2020 年决策的化石":确诊疑似混合(检测产能)、CT 主导(当时诊断指南)、X 光稀疏(床旁角色)、英译(国际化急迫)——每个"不合理"都是当年合理决策的化石。考古的三条纪律:其一,历史语境优先——评判 2020 年的数据用 2020 年的标准;其二,化石即信息——"为什么 CT 主导"本身是医疗体系研究的题目;其三,不要"修正"历史数据——按当年的语义使用( diagnoses 的当年口径),现代口径的重编码是衍生层不是替换层。考古纪律的通用性:任何跨越重大医疗事件的队列(疫情/灾难/政策突变)都需要这套化石读法。
§9.18 本条目与 Top1000 系列的横向坐标(收官条目版)
第 505 号在千方病案医数集系列的坐标:模态轴——唯一的"EHR 主导+影像双模态"条目(492/498 的 EHR 系+495 系影像的结合体);时代轴——唯一的疫情专项条目(公共卫生与流行病学标签的首个深度使用);治理轴——唯一的 Contributor Review 条目(系列访问光谱的最严端点);叙事轴——唯一的"六年半长征"叙事(系列最长的资产化时间线)。第 505 号的收官意义:批次五以"治理最重"的一篇收尾,为系列的后 495 篇立了一个原则——数据集的百科价值=科学价值×治理故事×可达现实,三者缺一则条目失真。
§10 存档:证据、引用与维护
§10.1 官方页存照 A-F
存照 A(命名漂移)——CDSL 缩写不变、全名 Saves Lives→Shared Learning(§1.2 三解读);存照 B(口径并存)——Methods “4,479 patients” vs 摘要"住院记录" vs 数据字典 “admission identifier”(§3.5 对账协议);存照 C(作者扩编)——版本页 4 人 vs 论文 et al. 长名单(§1.4);存照 D(六年半)——alpha 2020-04→PhysioNet 2024-10→论文 2026-09 的五锚年表(§1.3);存照 E(影像反差)——CT 1,440,156 vs X 光 4,608 的 313:1(§2.3 三层解释);存照 F(最严档)——Contributor Review 的逐案审查条款原文(§8.2)。六存照的引用规则:以 2026-09-22 快照为锚,官方页实时内容可能变化。
§10.2 引文清单(八条)
- PhysioNet 版本页:COVID Data for Shared Learning (CDSL) (v1.0.0),DOI 10.13026/1176-6c44。
- PhysioNet latest:DOI 10.13026/85z8-jq92。
- 论文:Ritoré-Hidalgo Á, Villar Fernández J, Oprescu AM, et al. Sci Data (2026),DOI 10.1038/s41597-026-08184-1。
- RRID:SCR_007345。
- 代码:CovidHM_V3-code(数据包内/官方仓库)。
- 伦理:HM Hospitales Clinical Research Ethics Committee,auth_opendata_cdsl3_170624。
- 方法上游:MIMIC-CXR-JPG(转换方法出处),Johnson et al.,DOI 10.13026/qq6r-nf68。
- alpha 版存档:HM Hospitales 官网 “Covid Data Saves Lives”(2020-04,历史引用用)。
§10.3 与本系列的条目关系
上游:492/495(MIMIC 生态——EHR 范式对照与迁移链)→501/502/503(掩码线——自制解剖层的工具来源)→504(评测线——语境扩展协议)。同级:499 等住院轨迹类条目。下游(预写接口):疫情回顾研究/长新冠数据集/多国 COVID 联盟类条目以本集为"单集团深挖"对照极。互链锚文本:中文"COVID 多模态住院数据集(CDSL)",slug cdsl-covid-data-shared-learning。
§10.4 变更日志(本条目)
- 2026-09-22:v1 初稿——事实核查(PhysioNet 版本页+Sci Data 论文快照)、FACTS.md、全文 1200+ 行、发布(rid 605)。
- 勘误联动:504 条目(rid 604)的"评测双塔"表述在本集落地后需精确化——批次收尾时修订(§2.9 的预告)。
- 待办:§10.7 观察清单首次执行(2026-12);论文引用曲线的首季度观察。
§10.5 阅读地图(三种读者路径)
多模态工程师(30 分钟):INFOBOX→§2.3/§2.4(影像结构)→§3.6(复刻对照)→§5.2/§5.3(泄漏与配方)→§7.4/§7.5。公卫与临床研究者(20 分钟):INFOBOX→§1.3(年表)→§2.10(家族位置)→§3.5(口径)→§7.15(波次设计)→§9.4。治理与合规(20 分钟):§1.5(伦理治理)→§2.7/§2.11(制度逻辑)→§8 全章→§9.6。三路径的公共底座:§0.3 阅读组合。
§10.6 速查卡(18 项)
①slug:cdsl-covid-data-shared-learning;②版本:v1.0.0(2024-10-25);③DOI:10.13026/1176-6c44;④latest:10.13026/85z8-jq92;⑤RRID:SCR_007345;⑥论文:Sci Data 2026,10.1038/s41597-026-08184-1;⑦来源:HM Hospitales(西班牙私立集团);⑧规模:4,479 住院记录(患者数 ≤4,479);⑨时间窗:2019-12-26~2021-02-13;⑩六表:patient_01/diagnosis_er/diagnosis_hosp/vital_signs/medication/lab;⑪影像:1,444,764 JPG(CT 1,440,156/784 住院+X 光 4,608/1,616 住院);⑫转换:MIMIC-CXR-JPG 方法复刻(quality 95);⑬代码:CovidHM_V3-code;⑭访问:Contributor Review(DUA+CITI+HM 委员会);⑮伦理:auth_opendata_cdsl3_170624;⑯alpha 名:Covid Data Saves Lives(2020-04);⑰Views:59(2026-09-22);⑱DAIMS:5.9/8。
§10.7 资源导航与观察清单
资源:数据页 physionet.org/content/covid-data-shared-learning/1.0.0/;论文 doi.org/10.1038/s41597-026-08184-1;方法上游 physionet.org/content/mimic-cxr-jpg;治理框架 physionet.org(四档访问说明);掩码生态(502/503 条目);评测协议(504 条目)。
观察清单(季度回访):
- [ ] 论文引用曲线(见刊 14 天起的首年观察——Scholar/Sci Data metrics)
- [ ] v1.0.1 或勘误(版本页 changelog)
- [ ] HM 二期数据/新版本信号(HM 研究页+PhysioNet 通知)
- [ ] 委员会政策透明度变化(审批周期/标准的公开化)
- [ ] 社区使用文献(用户验证文/基线文的回填——§10.4)
- [ ] COVID 数据家族的聚合级竞品(多国联盟——§6.12 稀释风险)
- [ ] PhysioNet 四档制度的政策变化(§8.7 风险⑥)
- [ ] 本系列批次五联动实验的进展(§7.21 的三实验状态)
§10.8 核查注记(证据边界)
A级(双源互证):版本/DOI/规模/时间窗/六表构成/影像计数/访问档位/伦理授权码——版本页与 Sci Data 论文对读一致。B级(单源待复核):Views 59(平台快照);附加表的逐表清单(版本页概括级——以 v1.0.0 实际交付为准);日期去标识的具体粒度(官方未详述——装载时实证);alpha 版的早期使用规模(公开渠道空白)。C级(推断,标注为观点):命名漂移动机(§1.2)/委员会运行特征(§8.2)/维护可持续性(§6.11)/保值逻辑(§6.12)。时间敏感项:Views/引用曲线/竞品格局带 2026-09-22 快照戳。口径警告:全文采用"住院记录"口径(patient_id=admission identifier)——引用本条目时保持口径一致性(存照 B 的纪律)。
§10.9 核对练习(给下一位维护者)
①验证 DOI 10.13026/1176-6c44 解析到 v1.0.0 版本页;②影像计数闭环:1,440,156+4,608=1,444,764;③住院覆盖闭环:CT 784+X 光 1,616(可交叉,非互斥——注意"可交叉"意味着两者非加和关系);④时间线核对:2020-04 alpha/2024-10-25 挂牌/2025-08-12 投稿/2026-08-14 接受/2026-09-08 见刊;⑤口径核对:数据字典 “unique admission identifier” 的原文存在性;⑥§10.6 速查卡 18 项与官方页 diff——速查卡不变则全文骨架大概率未漂。六项通过=条目与官方事实同步。
§10.9b 批次五数据资产速查总表(501-505)
| # | 条目 | rid | 类型 | 访问 | DAIMS | 核心资产 |
|---|---|---|---|---|---|---|
| 501 | CXLSeg | 601 | Database | Credentialed | 5.1 | 掩码成品包 |
| 502 | CheXmask | 602 | Database | Open | 6.3 | 五库标注层+RCA |
| 503 | CheXmask-U | 603 | Database | Open | 6.5 | +node-wise std |
| 504 | CXReasonBench | 604 | Challenge | Credentialed | 6.3 | 推理评测 18,988 QA |
| 505 | CDSL | 本条目 | Database | Contributor Review | 5.9 | EHR+影像多模态 |
(501 的 DAIMS 5.1 为该条目自评口径;五篇的批次五坐标由此表一图收拢——rid/类型/档位/分数的四方对照是批次五收官的最终快照。)
§10.9c 本条目特有的"双时区"阅读提示
本条目的时间跨度制造了一个阅读陷阱:§1-§2 讲的是 2020 年的决策,§3-§5 讲的是 2024-2026 年的资产,§6-§8 讲的是 2026 年的使用——三个时区在同一篇条目里交替。读者请保持时区感:alpha 的慷慨(2020)不能用来要求现在的访问宽松(2026 的 Contributor Review 是当下的现实);现在的使用体验(审批等待)不能否定当年的历史价值(最早的共享)。时区感是读历史性数据集条目的基本素养——也是本条目在 INFOBOX 之外给读者的第一条阅读纪律。
§10.10 结尾三行
六年半前那批"想救命的数据",绕过官网申请制、走进 PhysioNet 最严档、最终落在 Sci Data 的纸页上——数据没变,变的是人类看待共享的方式。
144 万张 CT 切片下是 784 个与病魔谈判的住院故事,六张 CSV 表里是 4,479 次呼吸窘迫的完整档案——多模态的真正含义不是数据类型的堆叠,而是同一个夜晚的不同侧写。
批次五从掩码走到病床:掩码给了机器眼睛,考卷给了机器尺子,而这一集提醒我们——在眼睛和尺子之前,先有一张真实的病床。
§10.11 竞品与家族补注:五个常被并提的资源辨析
BIMCV-COVID19(瓦伦西亚)——影像深挖型竞品:影像规模更大(含系列影像与分割标注),但 EHR 侧薄——选型对照:影像方法学选 BIMCV,住院全谱语境选本集(§2.10 家族位置)。
MIMIC-IV COVID 子集——ICU 深水区对照:时序分辨率与规模碾压,但非 COVID 专建、无 CT——选型对照见 §6.4 矩阵(六维逐项)。
CC-CCII(中国)——影像+临床的东亚对照臂:地域域互补(§6.4 维度六)——跨域研究的天然配对(§7.8 的欧洲-亚洲扩展)。
西班牙全国 COVID 登记——统计导向的浅而广:无个案级多模态——与本集是"广度-深度"互补而非竞争(§2.10 两极)。
CARMEN-I(西班牙语临床 NLP)——语料型近邻:西语临床文本的 NLP 资源——与本集的西语原文回溯研究(§2.5/§7.7)构成工具-数据配对。
五辨析的选型总纲:影像方法学→BIMCV;ICU 时序→MIMIC-IV;住院全谱+CT→本集;统计监控→全国登记;西语 NLP→CARMEN-I——家族内没有全能选手,研究者按"研究问题的第一约束"选主场数据集,其余按互补组合(§5.4 联合方案的家族版)。
§10.12 三十秒自检:你是本集的正确用户吗
三个问题定性判断:问题一(研究问题的第一约束是什么)——若答案是"CT 影像+住院语境",本集是对的;若是"胸片规模/掩码/评测"——去 501/502/504;若是"ICU 时序分辨率"——去 MIMIC(§6.4)。问题二(能接受数月审批周期吗)——能且愿意把等待期变成预研期(§5.11 W1),留下;不能,Open 档起步练手、本集当二期的深度目标。问题三(团队有合规人力吗)——有(哪怕 0.1 FTE 的合规意识+§8.6 五节点流程),留下;零合规预算的团队在本集会反复撞墙(§8.3 八条款的每一款都需要有人认领)。
三问的通关组合(全 yes)对应的用户画像:做 COVID 急性期或欧洲域多模态研究、有耐心、有合规意识的团队——这个画像之外的使用者,本条目的劝退信息(§0.5/§6.9)已经尽职——条目的边界感也是服务:错配用户的每次申请失败都是贡献方审查资源的浪费,劝退信息是生态保护措施。
§9.16 批次五收官的五个方法论沉淀
批次五(501-505)走完,五个可复用到后续批次的方法论资产(本条目作为收官篇的沉淀职责):
-
验证力度谱系——标注级验证(502 三层)>管线级(503 std)>描述级(本集自检)——数据描述文的验证章节不等于终身质保(§6.2),收录评估时按谱系给证据分级。
-
访问光谱表——Open/Credentialed/Contributor Review 三档的用户旅程对照(§2.19 表)——后续遇到沙箱/联邦等新形态按此表扩展列。
-
MIMIC 复刻检查表——§3.6 的逐项对照表(读取/归一/LUT/极性/压缩/元数据六环节)——任何"JPG 化"新数据集的对照模板。
-
多模态整合粒度分级——住院级挂接(本集)<检查级<帧级——多模态声明的成色试金石(§4.1),收录评估时先问"整合到哪一级"。
-
整理债框架——§2.15 的债务账本分析法——"发布仓促"类数据集的维护观察工具(债期与利息的结构化记录)。
五个沉淀的存放逻辑:全部内嵌于本条目对应章节(非独立文档)——后续条目按 § 引用取用,条目间的方法论传承是 Top 1000 系列的复利机制:每一批的收官篇为下一批节省的认知成本,就是系列比单篇百科更值钱的部分。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- midrc-ricord — 共享标签:医学影像 / 公共卫生与流行病学 / COVID-19
- mimicel — 共享标签:电子健康记录 / 公共卫生与流行病学
- mimiciii-demo — 共享标签:电子健康记录 / 公共卫生与流行病学
- mimiciv — 共享标签:电子健康记录 / 公共卫生与流行病学
- chest-ct-sepsis-er — 共享标签:医学影像 / 电子健康记录
- synthea-covid — 共享标签:电子健康记录 / 公共卫生与流行病学 / COVID-19
- nwicu — 共享标签:电子健康记录 / 公共卫生与流行病学 / COVID-19
- covidx-cxr — 共享标签:医学影像 / 公共卫生与流行病学 / COVID-19
- n3c — 共享标签:电子健康记录 / 公共卫生与流行病学 / COVID-19
- isaric-ccp — 共享标签:电子健康记录 / 公共卫生与流行病学 / COVID-19
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

