COPDGene — 慢阻肺基因与 CT 影像队列 AI-Ready Wikipedia

10,719 名吸烟者基因组 + 双期胸部 CT 纵向队列

来源 National Jewish Health / Brigham and Women's Hospital(NHLBI 资助) url: https://www.ncbi.nlm.nih.gov/projects/gap/cgi-bin/study.cgi?study_id=phs000179发布时间: 2026-09-13最后更新: 2026-09-25 阅读 47
COPDGene — 慢阻肺基因与 CT 影像队列 AI-Ready Wikipedia

信息速览

数据集名称COPDGene — 慢阻肺基因与 CT 影像队列 AI-Ready Wikipedia
数据类型10,719 名受试者,21 个美国中心,吸气+呼气双期胸部 CT,30x 全基因组测序(TOPMed),dbGaP 申请获取
规模10,719 名受试者(Phase 1 吸烟者 10,198 名)
接入方式National Jewish Health / Brigham and Women's Hospital(NHLBI 资助) url: https://www.ncbi.nlm.nih.gov/projects/gap/cgi-bin/study.cgi?study_id=phs000179
AI 就绪度

数据集封面

COPDGene(慢阻肺基因研究)— 基因组与双期 CT 纵向队列 AI-Ready Wikipedia


INFOBOX

字段 内容
数据集名称 COPDGene(慢阻肺基因研究)
英文全称 Genetic Epidemiology of COPD (COPDGene) Study
别名/简称 COPDGene Study;dbGaP phs000179;NHLBI TOPMed: COPDGene(phs000951)
疾病分类(ICD-11) CA22 慢性阻塞性肺疾病(含 CA22.0-CA22.3 轻/中/重/极重度分级)
SNOMED CT 13645005(慢性阻塞性肺疾病);404640003(肺气肿);10509002(慢性支气管炎)
数据模态 胸部 CT(吸气+呼气)+ 肺活量测定(前后支气管扩张剂)+ GWAS/全基因组测序 + 标准化问卷
AI 任务类型 COPD 影像分期、肺气肿/气道定量回归、影像表型无监督分型、GWAS 与遗传风险评分、多模态融合、纵向进展预测
样本总数 10,719 名受试者(Phase 1 吸烟者 10,198 名;TOPMed WGS QC 后约 10,500 人)
数据格式 DICOM(CT 影像);dbGaP 表型/基因型数据集;VCF(TOPMed WGS call set,GRCh38)
许可证 dbGaP Controlled Access(Data Use Certification)
访问级别 申请审核
DUO 标签 HMB(健康/生物医学研究);DS-CS(特定疾病-心肺研究);TOPMed 子研究另含 DS-CS-RD
语言 英语
首发日期 2008(Phase 1 启动招募)
最后更新 2025-08(Phase 4 十五年随访启动)
发布机构 National Jewish Health 与 Brigham and Women’s Hospital(NHLBI 资助 U01 HL089897 / U01 HL089856)
官方主页 copdgene.org
下载地址 dbGaP phs000179
DOI 10.3109/15412550903499522(研究设计论文)
引用次数 1,108+(Scopus,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐(3/5)— 表型数据结构化且 GT 基因组可直接下载,扣分项:影像需经 ancillary study proposal 单独申请、无官方预处理脚本、多厂商 CT 需自行协调定量
页面状态 published

§0 E-E-A-T 审核声明

  • 医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 双映射、COPD 流行病学)、§7 偏倚分析。
  • 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
  • 审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。COPDGene 通过 dbGaP authorized access 发布,要求 PI 所在机构签署 Data Use Certification(DUC)并遵守 consent 组限制(HMB / DS-CS)。DUO 标签仅供参考,具体使用限制以 dbGaP 官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? COPDGene(Genetic Epidemiology of COPD Study)是美国 NHLBI 资助的大型纵向观察队列:2008-2011 年在 21 个临床中心招募了 10,198 名 45-80 岁、吸烟史不少于 10 包年的非西裔白人与非裔美国人,每位参与者都做了吸气+呼气两次胸部 CT、吹气肺功能测试、6 分钟步行与整套呼吸问卷,并留下了血样用于基因分析;此后又完成了 5 年与 10 年随访,含增补对照合计 10,719 人。

为什么重要? 它是目前"影像 + 生理 + 基因组"三者齐备的最大慢阻肺队列:研究提出的 COPDGene 2019 诊断框架把 CT 结构改变与症状纳入诊断,推动了 COPD 定义更新;GWAS 与 TOPMed 全基因组测序已定位 80 余个相关基因组区域,并给出 COPD、肺功能与肺气肿的 SNP 遗传度估计。

我能用它做什么? 训练从 CT 自动预测 GOLD 分期或肺功能的模型、做肺气肿/气道表型无监督分型、把定量 CT 与基因组关联做影像遗传学(imaging genetics)、或利用双期 CT 与纵向随访建模疾病进展——一切以 dbGaP 申请批准为前提。

§1.1 技术摘要

COPDGene 采用多中心前瞻性观察设计,按 GOLD 分期(0-4 期与 PRISm)分层招募吸烟者与非吸烟对照。每例采集:仰卧位深吸气(约 200 mAs)与放松呼气(约 50 mAs)两次无对比剂容积 CT(120 kVp,≥16 排探测器,层厚 GE 0.625 mm / Siemens 0.75 mm / Philips 0.90 mm);ndd EasyOne 肺量计完成前后支气管扩张剂肺活量测定;6 分钟步行;SGRQ、mMRC、CAT 与改良 ATS 问卷;血样 DNA 用于 Illumina OmniExpress 全基因组芯片分型。定量影像指标由 VIDA、Thirona 与 Chest Imaging Platform 等软件计算,包括 %LAA-950 肺气肿百分比、呼气气体陷闭百分比(< -856 HU)与 Pi10 标准化气道壁厚度。基因组数据经 dbGaP phs000179 controlled access 发布(v7.p2,10,719 名受试者);TOPMed 项目在 phs000951 提供约 10,500 人 30x 全基因组测序(HiSeq X Ten,GRCh38,Freeze 9b/10b)。5 年随访(Phase 2)约 6,284 人完成,10 年随访(Phase 3)转入约 1.5 mSv 低剂量 CT 协议;含 RNA-seq、DNA 甲基化、代谢组与蛋白质组在内的多组学层随 Phase 2 起的血样逐步叠加。

§1.2 战略价值

维度一:影像-基因-生理三模态闭环。 公开影像队列多止步于"影像 + 单一标签",COPDGene 同时提供双期定量 CT、前后支气管扩张剂肺功能与全基因组数据,使"CT 表型 ↔ 遗传变异 ↔ 生理终点"的三角验证成为可能。例如 SNP 遗传度研究估计 COPD 遗传度约 37.7%(非西裔白人)与 37.9%(非裔),FEV1 遗传度 38.4% 与 50.9%,肺气肿 28.2% 与 31.3%,为影像遗传学与多基因风险评分研究提供了基线标尺。

维度二:真实世界多厂商采集的训练场。 数据来自 21 个中心的 GE、Siemens、Philips 三大厂商 16-64 排机型,层厚 0.625-0.90 mm、重建 kernel 各不相同,这正是临床部署 AI 模型必须面对的异质性环境。围绕该数据集已发表多厂商 kernel 归一化、低剂量协议校准等方法学论文,使其成为检验定量 CT 算法稳健性的公认基准。

维度三:诊断标准演进的一手证据。 COPDGene 2019 分析(8,784 名 Phase 1 参与者)显示 GOLD 标准仅诊断 46%,而融合暴露、症状、CT 异常与肺功能的扩展标准将诊断覆盖率提高到 82%,且具备死亡风险梯度(4 项特征全有者 HR 5.18,95% CI 4.15-6.48)。研究 PRISm、GOLD 0 等边界人群的 AI 模型可直接复用其已发表的定义与结局变量。

维度四:十五年级纵向深度的稀缺性。 从 2008 年基线到 2025 年启动的 15 年随访,COPDGene 提供四次访视(含三次成像访视)与半年度结局随访,时间跨度覆盖从亚临床到终末期的完整轨迹。对 AI 而言,这意味着可以做真正的前瞻性验证:用 Phase 1 训练、用 Phase 3/4 结局检验,将"预测 10 年死亡"这类长程任务建立在真实观测而非代理终点上;公开队列中同时具备此时间深度、样本量与多模态密度者屈指可数。

§1.3 同类数据集横向对比

数据集 规模 模态 标注/终点 与 COPDGene 的差异化
COPDGene 10,719 人,21 中心 吸气+呼气 CT、肺功能、GWAS/WGS、问卷 GOLD 分期、%LAA-950、Pi10、纵向随访 唯一同时具备双期 CT 与全基因组测序的大型 COPD 队列
NLST 约 53,000 人 低剂量 CT(肺癌筛查) 肺癌结局 以肺癌筛查为目的,无基因分型与双期 CT
SPIROMICS 约 2,900 人 CT、肺功能、生物标本 COPD 加重与进展 规模更小、侧重加重事件,与 COPDGene 常互为验证队列
MESA Lung 约 3,700 人(MESA 子研究) CT、肺功能 肺气肿/气体陷闭定量 心血管队列衍生的肺亚研究,无全基因组深度测序
LIDC-IDRI 1,018 例 胸部 CT 肺结节多专家标注 结节检测任务,无肺功能与基因组

§1.4 版本时间轴

时间 事件 说明
2008-2011 Phase 1 基线 21 中心入组 10,198 名吸烟者,完成双期 CT、肺功能、问卷与基因分型
2010-02 研究设计论文发表 Regan et al., COPD 7(1):32-43,DOI 10.3109/15412550903499522
2012-2016 Phase 2 五年随访 约 6,284 人完成复诊,重复双期 CT 与肺功能
2014-03 大型 GWAS 元分析 Cho et al., Lancet Respir Med,确认 FAM13A/CHRNA3/HHIP 并发现 RIN3
2016 起 TOPMed 全基因组测序 约 10,500 人 30x WGS(phs000951),Freeze 9b/10b(GRCh38)
2018-2023 Phase 3 十年随访 8,431 人进入定量 CT 进展分析,转用约 1.5 mSv 低剂量协议
2025-08 Phase 4 十五年随访启动 NHLBI 资助,目标约 3,500 名受试者复诊,含 COVID-19 影响评估
2026-09 本 Wiki 编写时点 数据版本 phs000179.v7.p2;TOPMed Freeze 10b 为当前 WGS 版本

§1.5 典型应用场景

  1. CT 自动分期:以吸气 CT 为输入预测 GOLD 1-4 期或回归 FEV1% 预测值,复用 Phase 1/2 双期数据做时序验证;已有 CNN 先例显示 CT 分期可预测 5 年进展(OR 1.50-2.67)与死亡。
  2. 肺气肿与气道定量:在原始 DICOM 上复算 %LAA-950、Pi10 与气体陷闭,与官方定量结果对比,开发跨厂商稳健的定量算法;kernel 归一化与低剂量校准是两个已发表的方法学切入面。
  3. 影像遗传学:将 CT 定量表型或深度学习嵌入作为中间表型,与 TOPMed WGS 关联,寻找影像特异的遗传决定因素;队列的 80+ 关联区域提供了现成的先验基因座。
  4. 多模态进展预测:融合基线 CT + 肺功能 + 多基因风险评分,预测 5 年 FEV1 下降(> 350 ml)与全因死亡;COPDGene 2019 框架给出结局定义与风险分层模板。
  5. 无监督表型分型:在吸烟者谱系上做聚类/机器学习分型,复现或挑战 COPDGene 病轴(airway-predominant / emphysema-predominant)框架;Chest 2020 的 ML 亚型研究是该方向的模板。
  6. 形变配准研究:利用双期呼吸 CT 与 Emory landmark 基准开发吸气-呼气配准算法,服务于气体陷闭逐体素分析与 CT 通气成像。

§2 医学背景

§2.1 ICD-11 编码映射表

标签/概念 ICD-11 编码 中文名称 说明
慢性阻塞性肺疾病 CA22 慢性阻塞性肺疾病 数据集核心疾病
COPD 轻度(GOLD 1 对应) CA22.0 轻度慢性阻塞性肺疾病 按肺功能严重度分级
COPD 中度(GOLD 2 对应) CA22.1 中度慢性阻塞性肺疾病 按肺功能严重度分级
COPD 重度(GOLD 3 对应) CA22.2 重度慢性阻塞性肺疾病 按肺功能严重度分级
COPD 极重度(GOLD 4 对应) CA22.3 极重度慢性阻塞性肺疾病 按肺功能严重度分级
肺气肿表型 CA23.4 肺气肿 定量 CT(%LAA-950)对应的结构性表型

§2.1b SNOMED CT 映射表

标签/概念 ICD-11 SNOMED CT 码 术语
慢性阻塞性肺疾病 CA22 13645005 Chronic obstructive lung disease
肺气肿 CA23.4 404640003 Emphysema
慢性支气管炎 CA20 10509002 Chronic bronchitis
肺功能检查异常(PRISm 相关) — 267036007 Abnormal spirometry findings

§2.2 疾病简介与流行病学

慢性阻塞性肺疾病(COPD)是以持续气流受限为特征、通常与有害颗粒暴露相关的异质性肺部疾病,涵盖肺气肿(肺泡结构破坏)与慢性支气管炎(气道炎症黏液分泌)两大成分。COPDGene 立项时 COPD 是美国第四大死因且是其中唯一持续上升的致死原因;设计论文估计美国约 2,400 万人可能患病。全球范围内 COPD 影响超过 3 亿人,位居死因前列,疾病负担随人口老龄化持续加重。吸烟是最主要危险因素,但仅少数重度吸烟者发展为明显 COPD——这正是 COPDGene 追问"遗传易感性"的临床动机。

从影像病理生理看,COPD 的两大结构成分在 CT 上可分别量化:肺气肿表现为吸气相低衰减区域(%LAA-950),小气道疾病则通过呼气相气体陷闭(< -856 HU)间接显影,气道重塑由管壁增厚(Pi10/WA%)刻画。三者与 FEV1 下降、加重频率及死亡率的关联强度不同,构成了"同病异像"的表型谱系。COPDGene 借此提出疾病轴框架:气道路(airway-predominant,常经 PRISm 阶段进展)与肺气肿路(emphysema-predominant,常经 GOLD 1 进展),混合通路者可直接从 GOLD 0 跳至 GOLD 2-4。

除吸烟者外,队列还纳入 PRISm(保留比值受损肺活量,FEV1 下降而 FEV1/FVC ≥ 0.7)人群,该类别近年被视为 COPD 早期演进与死亡风险的重要窗口:PRISm 纵向分析显示其 5 年内可恢复为正常、可转为 GOLD 1-4,且全因死亡风险显著升高,是队列中流动性最强、预测价值最高的边缘人群之一。

§2.3 临床任务定义

任务 定义 数据集支撑
筛查/早期识别 在吸烟者中识别 Possible/Probable COPD(症状 + CT 异常但无气流受限) CT 定量(≥5% 肺气肿、Pi10 ≥ 2.5 mm、≥15% 气体陷闭)+ mMRC/慢性支气管炎问卷
分级 GOLD 1-4 期(FEV1% 预测值)与 GOLD 0、PRISm、GOLD-Unclassified 前后支气管扩张剂 spirometry(FEV1/FVC < 0.70 固定比值;敏感性分析用 LLN/Z-score -1.645)
表型刻画 肺气肿为主型 vs 气道疾病为主型等病轴 %LAA-950、气体陷闭、WA%/Pi10 定量 CT
预后 5 年 FEV1 进展(> 350 ml 丢失)与全因死亡 Phase 2/3 纵向随访 + 死亡登记(含社保死亡索引核验)
加重监测 急性加重事件(需激素/抗生素的呼吸事件) 半年度 LFU 随访程序事件捕获

§2.4 患者人群画像

维度 描述
来源 美国 21 个临床中心社区招募的志愿者(含 VA 医疗中心)
入组时间 Phase 1:2008-2011;Phase 2:2012-2016;Phase 3:2018 年起十年随访
年龄 45-80 岁
性别 男性略多(随访分析亚组约 49% 女性)
种族/民族 自报非西裔白人(约 2/3)与非裔美国人(约 1/3)
吸烟暴露 当前或曾经吸烟者,≥10 包年(各组平均 37-53 包年);Phase 1/2 增补非吸烟对照后共 10,719 人
就医类型 无需因 COPD 住院;排除显著非 COPD 肺病(肺纤维化、广泛支气管扩张、囊性纤维化)、肺叶切除/肺减容史、活动期癌症、可疑肺癌、胸部金属、近期加重或手术等

§2.5 临床价值

对 AI 研究者而言,COPDGene 的临床价值在于它同时覆盖"从无症状吸烟者到 GOLD 4 极重度"的完整疾病谱,使模型可以在真实疾病梯度上学习而不是只拟合住院人群。双期 CT 把"肺气肿"与"小气道疾病(气体陷闭)"两个病理成分拆开定量,配合 Pi10 气道壁厚度,支持以 CT 反推病理亚型的建模路线。纵向设计(含全因死亡与加重事件)让"CT 早期异常 → 功能下降 → 死亡"的因果链条可以被验证,COPDGene 2019 框架已经证明该链条在 5 年尺度上成立(HR 最高 5.18)。此外,非裔参与者约占三分之一,是少数有足够统计功效做跨种族遗传度与公平性分析的临床影像队列。

对临床转化的直接启示有三条:其一,CT 定量指标已在队列内完成与死亡/进展的关联验证,是"影像生物标志物"路径上成熟度最高的一批候选;其二,扩展诊断标准把大量"肺功能正常但 CT 异常"者划入高危,意味着面向肺癌筛查 CT 的机会性 COPD 筛查算法有明确应用出口;其三,PRISm 的动态性提示临床模型应输出"轨迹风险"而非"静态分期",这恰好是时序模型相对传统分期工具的增量价值所在。

§2.6 金标准参考表

项目 内容
划分 无官方 ML 划分;研究层面按 GOLD 分期分层(对照组=GOLD 0 吸烟者,病例组=GOLD 2-4)
标注方式 生理金标准:支气管扩张剂后 spirometry(FEV1/FVC < 0.70);影像定量:自动软件计算 + 训练分析员目视审核;视觉 CT 评分由至少 2 名受训观察者独立完成
标注者 定量软件(VIDA、Thirona、Chest Imaging Platform)+ 受训影像分析员(Thirona 肺/气道结构自动提取并经目视核准);死亡结局由中央与各中心双重判定
性质 前瞻性多中心观察研究金标准;金标准本身依赖肺功能与定量 CT,不含组织病理学验证

金标准使用注意:

  1. 影像视觉评分与定量指标可冲突:视觉"存在肺气肿"与 %LAA-950 ≥ 5% 不是同一断言,建模时择一为主、另一作敏感性。
  2. 支气管扩张剂前 vs 后:GOLD 以支扩剂后为准,直接用支扩剂前数据会引入可逆性噪声。
  3. GOLD-U 与 PRISm 是设计保留类别:不是"脏标签",而是有意纳入的边界人群,论文方法节应交代其去向。

§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本 获取渠道 理由
CT 影像 + 表型建模 phs000179(v7.p2)+ ancillary study proposal 申请影像 dbGaP authorized access + COPDGene Administrative Core 表型最全,含 GOLD、定量 CT 衍生变量
全基因组关联/罕见变异 phs000951(TOPMed WGS,Freeze 9b/10b,GRCh38) dbGaP authorized access 30x WGS 覆盖 SNP 与结构变异
形变配准算法验证 Emory COPDgene 参考数据集(10 对吸气-呼气 CT + landmark) Emory 申请表(Dropbox 下载) 提供 3D landmark 与观察者重复误差基准
纵向进展/死亡率研究 Phase 1+2+3 表型 + 死亡随访 dbGaP + ANC 提案 需声明使用纵向访视变量

§3.1 模态详情

模态 采集细节
吸气 CT 仰卧位深吸气(近似肺总量 TLC),200 mAs、120 kVp、0.5 s 旋转时间,≥16 排探测器,无对比剂,亚毫米层厚(GE 0.625 mm / Siemens 0.75 mm / Philips 0.90 mm),标准与边缘增强双 kernel 重建
呼气 CT 放松呼气末(近似功能残气量 FRC),50 mAs,其余参数同上
肺活量测定 ndd EasyOne 肺量计,统一标准化协议,支气管扩张剂前+后各一次;报告 FEV1、FVC、FEV1/FVC 及预测值百分比
运动与体格 标准化 6 分钟步行试验(6MWD);身高、体重、血压、静息血氧
问卷 改良 ATS 呼吸流行病学问卷、SGRQ、mMRC 呼吸困难评分、CAT 评分;用药与病史
基因组 Illumina OmniExpress 全队列芯片分型(初期 500+500 名非西裔白人用 Omni-1);TOPMed 30x WGS(Illumina HiSeq X Ten,PCR-free 建库)
组学扩展 Phase 2 起采集血常规与 RNA-seq;TOPMed 框架下另有 DNA 甲基化、代谢组与蛋白质组
心胸附带指标 吸气 CT 还可提取体成分(胸肌面积 PMA、椎旁竖脊肌面积 PVMA、皮下脂肪 SAT)与冠状动脉钙化(CAC)衍生变量

§3.2 按子集样本数

子集 样本数 说明
Phase 1 吸烟者 10,198 2008-2011 入组,非西裔白人 + 非裔美国人
含增补非吸烟对照的总队列 10,719 dbGaP phs000179 记录数(v7.p2);TOPMed 页面记 10,720
Phase 2 完成者 6,284 2012-2016 五年随访复诊
Phase 2 肺病轴完整分析亚组 8,157 具备完整 spirometry 与 CT 的 Phase 1 参与者
Phase 3 定量 CT 进展分析 8,431 含 1,508 人全剂量+低剂量双扫描
TOPMed WGS(QC 后) 约 10,500 phs000951,Freeze 9b/10b
Phase 4 目标 约 3,500 十五年随访(2025-08 启动)

§3.3 数据格式

数据 格式 说明
胸部 CT DICOM 吸气/呼气两个系列,原始像素 + 几何信息;经 ancillary study proposal 获取
表型变量 dbGaP 数据表(tab-delimited) 受试者、访视、spirometry、问卷、定量 CT 衍生变量
芯片基因型 dbGaP 分子数据集 Illumina OmniExpress;附 QC 文档
TOPMed WGS call set VCF(GRCh38) Freeze 9b / 10b,含变异位点级注释文档
RNA-seq / 甲基化 / 代谢组 / 蛋白质组 dbGaP/TOPMed 对应子研究数据集 主要挂在 phs000951 及附属子研究

§3.4 存储规模

dbGaP 各数据集的具体文件体积以授权页 manifest 为准,本页不给出固定数字。经验参考:单例双期亚毫米层厚容积 CT(吸气+呼气各约 250-400 层)未压缩 DICOM 通常在数百 MB 量级,全队列影像在 TB 级,建议按 15-30 TB 规划存储与索引;WGS 单样本 BAM/CRAM 约数十 GB,VCF call set 建议直接使用 dbGaP 分发的 Freeze 版本而不自行重比对。

存储组件 估算方法 建议
影像原始 DICOM 单例双期数百 MB × 约 1.1 万例 20-30 TB 起步 + 对象存储冷备
转换后 NIfTI/zarr 压缩后约为 DICOM 的 50-70% 10-20 TB
TOPMed Freeze VCF Freeze 9b/10b 按染色体分发 3-8 TB(含解压缓存)
表型/衍生变量 数 GB 本地磁盘即可
预处理中间产物(掩膜/配准场) 与影像同量级 按需保留,建议保留掩膜弃配准场

§3.5 标注方式

标注层 方式 说明
GOLD 分期 规则化(人工质检肺功能曲线) 前后支气管扩张剂 spirometry 按 GOLD 固定比值分期;LLN 作敏感性分析
视觉 CT 评分 人工(≥2 名受训观察者) Phase 1 影像异常(含间质性异常)存在性判定
定量 CT 自动 + 人工审核 VIDA/Thirona 自动提取肺与气道结构,由受训分析员目视核准
死亡与加重结局 中央裁定 + 纵向随访程序 半年度电话/网络随访(LFU),死亡信息以社保死亡索引等核验

§3.6 标注者资质与一致性

定量影像由受训分析员在自动分割结果上审核,文中报告的一致性证据包括:形变配准参考数据集中 3 名观察者重复配准误差约 0.6-1.1 mm;体成分分析中胸肌面积(PMA)的观察者内 CCC 达 1.00、观察者间 0.98。视觉评分采用至少双人独立判读。肺功能按 ATS 标准执行并经中央质控(PFT QA Core)复核。

§3.7 采集周期

访视 时间 内容
Phase 1(基线) 2008-2011 全套基线评估
纵向随访程序(LFU) 每半年 电话/网络:死亡、加重、合并症
Phase 2(5 年) 2012-2016 重复全套评估
Phase 3(10 年) 2018 年起 复诊 + 低剂量 CT(约 1.5 mSv);1,508 人于 Phase 2 末叠加双剂量扫描
Phase 4(15 年) 2025-08 起 目标约 3,500 人复诊,含 COVID-19 影响评估
生物样本库 全程 DNA 与生物样本由 Johns Hopkins University 保存,支持后续组学扩展

§3.8 地域覆盖

美国 21 个临床中心,覆盖东北(波士顿、纽约、费城)、中西部(安娜堡、明尼阿波利斯、爱荷华)、南部(休斯顿、达勒姆、伯明翰、亚特兰大、圣安东尼奥)与西部(丹佛、洛杉矶、盐湖城、圣地亚哥)等主要区域;所有数据最终汇入 National Jewish Health 数据协调中心(DCC)。

§3.9 设备规格

项目 规格
CT 厂商/机型 GE LightSpeed 16 / VCT / Pro 16;Siemens Sensation-16 / -64、Definition、Definition AS+;Philips 40/60 排
探测器 ≥16 排
管电压/管电流 120 kVp;吸气 200 mAs、呼气 50 mAs
旋转时间 0.5 s
重建 标准算法(GE STANDARD / Siemens B31f / Philips B)+ 边缘增强算法;层厚 0.625-0.90 mm,层间隔 0.45-0.625 mm
有效剂量 Phase 1/2 约 6.5 mSv;Phase 3 约 1.5 mSv(QIBA 风格剂量调制)
肺量计 ndd EasyOne(统一机型)
步行测试 标准化 6 分钟步行(含 SpO₂ 与血压监测)

§3.10 深度溯源链

环节 主体 职责
资助 NHLBI(U01 HL089897 / U01 HL089856)+ COPD Foundation 产业委员会(AstraZeneca、Boehringer-Ingelheim、GSK、Novartis、Pfizer、Siemens、Sunovion 等) 立项与续期(Phase 1-4)
牵头 National Jewish Health(PI James D. Crapo;DCC、影像核心、PFT 质控)+ Brigham and Women’s Hospital(PI Edwin K. Silverman;遗传分析核心) 研究设计与数据协调
采集 21 个临床中心(各设 PI 与放射科负责人) IRB 审批、知情同意、CT/spirometry/问卷/血样采集
质控 影像核心(David A. Lynch)+ PFT QA Core(Robert Crapo)+ DCC(James Murphy) 中央质控、实时招募配额监控
生物样本库 Johns Hopkins University DNA/生物样本保存
分发 dbGaP(phs000179;TOPMed phs000951) controlled access 数据发布与版本管理
注册 ClinicalTrials.gov NCT00608764 研究注册与监督(OSMB)

§4 数据结构

§4.0 目录树

dbGaP 授权下载解压后(表型+基因型部分)与影像包的典型组织如下(文件名以实际 manifest 为准):

copdgene/
├── phs000179.v7.p2/                  # dbGaP 主研究(表型+基因型)
│   ├── pheno_subject.v7.p2.c1.DS     # 受试者级表(SID、consent 等)
│   ├── pheno_variable.v7.p2.c1.DS    # 访视级变量(spirometry、问卷、定量 CT)
│   ├── mol_geno_v7.c1/               # OmniExpress 芯片基因型(PLINK 兼容)
│   ├── docs/                         # 数据字典、QC 报告、consent 说明
│   └── manifest.md5
├── phs000951.v6.p5/                  # TOPMed WGS(Freeze 9b/10b)
│   ├── wgs.freeze10b.chr*.vcf.gz     # 按染色体切分的 VCF(GRCh38)
│   └── docs/
├── imaging/                          # 经 ANC 提案批准后的 CT 影像
│   ├── {SID}/
│   │   ├── visit1/
│   │   │   ├── insp/                 # 吸气 DICOM 序列
│   │   │   └── expr/                 # 呼气 DICOM 序列
│   │   └── visit2/
│   └── qct_derived/                  # 部分定量 CT 衍生变量随表型分发
└── README.txt

§4.1 DAIMS 字段字典(核心表)

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
SID Text 受试者唯一编码 ID 10000A 主键,跨表/跨访视关联 无(中央分配) 不适用 每人唯一
VISIT Integer 访视编号 1 区分 Phase 1/2/3 无 不适用 1-4
GOLD_STAGE Integer 支气管扩张剂后 GOLD 分期 2 分类标签 固定比值法固有误差 -1(未分类 GOLD-U) 0-4;-1
PRISM Integer 是否 PRISm 0 早期疾病标签 类别高度流动 缺失=未评估 0/1
FEV1PP_POST Float 支扩剂后 FEV1 占预测值% 62.4 回归目标/分期 呼气努力变异 ±5% 内 -999(测试失败) 约 5-140
PCT_EMPHYSEMA Float 吸气 CT < -950 HU 体素占比(%) 8.7 影像定量金标准 kernel/剂量/容积相关 -999 0-约 60
PCT_GAS_TRAP Float 呼气 CT < -856 HU 占比(%) 14.2 小气道功能代理 依赖呼气配合度 -999 0-约 80
PI10 Float 内周长 10 mm 标准气道平方根壁面积(mm) 3.4 气道重塑定量 分割误差约 0.1-0.2 mm -999 约 2-6
FEV1_FVC_POST Float 支扩剂后 FEV1/FVC 比值 0.58 气流受限判定 呼气努力变异 -999 约 0.2-1.0
PACK_YEARS Float 累计吸烟包年 42.0 暴露协变量 自报回忆偏倚 -999 ≥10(对照除外)
CAT_SCORE Integer COPD 评估测试总分 12 症状负荷协变量 自报偏倚 -999 0-40
MMRC Integer 改良 MRC 呼吸困难评分 2 症状定义(≥2 计入诊断) 主观分级 -999 0-4
SGRQ_TOTAL Float St. George 呼吸问卷总分 38.5 症状负荷 问卷变异 ±4 分(MCID) -999 0-100
SIX_MWD Float 6 分钟步行距离(m) 412.0 运动能力 场地/学习效应 -999 0-约 800
GENO_CHIP Text 芯片平台标识 OmniExpress 基因型 QC 分层 不适用 缺失=未分型 Omni-1/OmniExpress
RACE Text 自报种族分组 AA 分层/公平性分析 自报偏倚 不适用 NHW / AA
AGE Integer 基线年龄 63 协变量 无 不适用 45-80

§4.2 标签分布

队列按设计分层覆盖全疾病谱:COPDGene 2019 分析显示,8,784 名有完整 spirometry 与 CT 的 Phase 1 参与者中,按 GOLD 标准诊断 COPD 者 4,062 人(46%),其余为 GOLD 0 与 PRISm(后者约占队列 12%,主要论文常将其单列)。设计上非西裔白人约占三分之二、非裔约占三分之一;各 GOLD 期与对照组均按中心配额招募,无单一主导类别。%LAA-950 在 GOLD 0 吸烟者中常 < 5%,随分期上移而显著增大。使用前建议以 VISIT=1 复算自己的分布表,并区分"分析亚组"(如 8,157 人)与总队列。

标签使用上的三点提醒:

  1. 两套标签体系并存:固定比值(GOLD)与 LLN 判定的阳性集不同,论文引用时必须注明所用体系。
  2. "对照组"不是健康人:GOLD 0 吸烟者是"吸烟对照",可能携带症状与 CT 异常,作负类时需明确任务语义。
  3. 类别配额 ≠ 自然分布:招募按 GOLD 配额设计,任何"患病率"结论都不能直接外推到人群。

§4.3 关键统计

  • 平均吸烟史 37-53 包年(按疾病亚组),远超入组门槛 10 包年。
  • CT 与 spirometry 平均间隔 10.45 天(0-98 天),属"同访视但非同日"。
  • 全剂量 CT 有效剂量约 6.5 mSv ± 1;低剂量协议约 1.5 mSv ± 0.7。
  • SNP 遗传度:COPD 37.7%(NHW)/ 37.9%(AA);FEV1 38.4% / 50.9%;肺气肿 28.2% / 31.3%。
  • 形变配准 landmark 位移 12-31 mm,观察者重复误差 0.6-1.1 mm(Emory 参考集)。
  • CT 矩阵统一 512 × 512,层厚亚毫米;标准 kernel 重建为定量分析默认输入。
  • COPDGene 2019 分析中:4,062/8,784(46%)符合 GOLD;扩展标准下 82% 归入可能/可能/确定 COPD。
  • 体成分衍生:PMA 观察者内/间 CCC 1.00/0.98;CAC 与心电门控 CT 的相关性 r = 0.96。
  • 视觉 CT 评分由 ≥2 名受训观察者完成,间质性异常与肺气肿亚型(小叶中心型/间隔旁型)可分别标注。

§4.4 数据层级

受试者(SID,唯一)
└── 访视(Visit 1/2/3/4)
    ├── CT 检查
    │   ├── 吸气序列(DICOM series)
    │   │   └── 切片(512×512,亚毫米层厚)
    │   └── 呼气序列
    ├── spirometry(前/后支扩剂各一组曲线参数)
    ├── 问卷(SGRQ / mMRC / CAT / ATS)
    └── 血样 → 芯片基因型 / RNA-seq / 甲基化 / 代谢组 / WGS(人级)

注意:基因组数据挂在受试者级(不含访视级),纵向建模时需明确时间戳错位。

§4.5 缺失值与信息性缺失 {#sec-missingness}| 情形 | 表现 | 处理建议 |

|—|—|—|
| 检查未完成 | 定量 CT/6MWD 字段空缺或哨兵值 | 用哨兵值(如 -999)显式建模而非均值填充 |
| GOLD-Unclassified | GOLD_STAGE = -1 | 保留为独立类别(研究设计有意纳入) |
| 呼气配合失败 | 气体陷闭不可信/缺失 | 剔除呼气相关指标,保留吸气指标 |
| 随访脱落 | Phase 2/3 行缺失 | 采用多重插补或随机效应模型(Radiology 进展分析先例) |
| 分型/测序失败 | GENO_CHIP 缺失或 QC 剔除 | 与论文 QC 规则对齐(重度 α1-抗胰蛋白酶缺乏等除外) |
| 近期加重者 | 入组推迟至加重后 1 个月 | 采集窗口本身过滤了急性期状态,建模时无需额外剔除 |
| 哮喘合并者 | 未被排除(设计决定) | 敏感性分析按"有无哮喘"分层 |

§4.6 定量 CT 变量复算核对清单

在自建管线复算官方定量指标时,按顺序核对以下各项,可避免绝大多数与文献值"对不上"的情形:

# 核对项 通过标准
1 HU 校准 水的 HU 值在 0 ± 5、空气在 -1,000 ± 5
2 序列选择 使用标准(smooth)kernel 序列,非边缘增强序列
3 吸气相定位 影像元数据/层序确认吸气序列,勿与呼气互换
4 肺掩膜完整性 不含气管主干与肺外空气;分割 Dice 与参考接近
5 体素计数方式 以掩膜内体素占比计,不以全图占比计
6 阈值方向 吸气 -950、呼气 -856,勿混用
7 呼气 QC expiratory_qc 容积比在合理区间再采信气体陷闭
8 重采样效应 记录插值方法;三线性插值会平滑低衰减区,需与原始层厚结果一并报告
9 元数据留痕 厂商/机型/kernel/层厚/kVp/mAs 五元组写入每例特征行
10 与论文锚点对齐 GOLD 0 吸烟者 %LAA-950 中位数应远低于 GOLD 4;如有倒挂先查管线

§5 数据划分与使用建议

§5.1 官方划分

COPDGene 不提供官方机器学习划分。数据以受试者为单位分发,访视(Phase 1/2/3)全部挂在同一 SID 下;任何划分必须以 SID 为最小单元。研究文献的惯例是按分析问题自选横断面或纵向亚组(如 8,157 人肺病轴亚组、8,431 人 CT 进展亚组),并在论文方法部分明确入选规则。

§5.2 社区惯例划分

  • 横断面分期任务:Phase 1(VISIT=1)建训练/验证集,Phase 2 同人数据只作时序外测。
  • 交叉验证:按 GOLD 分期 × RACE 分层 5 折 CV,保证每折病例谱系一致。
  • 纵向任务:Phase 1/2 作训练、Phase 3 作外测,或按 10 年随访完整性划分。
  • 影像遗传学:以 GWAS 显著性阈值独立选 SNP,模型评估用留一染色体或独立队列(如 ECLIPSE/GenKOLS)复现。
  • 跨厂商稳健性:leave-one-vendor-out(GE/Siemens/Philips 轮流作测试域)。
  • 抽样策略:全量影像处理成本高时,可按 GOLD × RACE 分层抽样,但需在论文中报告抽样设计以支持加权推断。

§5.3 泄漏风险(重点)

  1. 同人跨期泄漏:同一 SID 的 Phase 1 与 Phase 2 CT 高度相似,随机按行划分会让验证集性能虚高。务必 group-aware 划分(group = SID)。
  2. 衍生变量重复计算:定量 CT 变量在多个 dbGaP 数据集中重复出现,合并表时以 (SID, VISIT) 去重。
  3. 特征标签同源:用 %LAA-950 训练预测 GOLD 时,注意 GOLD 定义本身含 FEV1 而不含 CT,二者相关但非同源;反之若把"分析师视觉评分"当标签又用相同影像工程特征,会引入评分者泄漏。
  4. 家族与同中心:入组排除了直系亲属同时入组,但中心效应仍在;建议在模型中纳入中心随机效应或按中心分层划分。

§5.4 交叉验证与外部验证建议

  • 内部:5 折 CV + 按中心留出(leave-one-center-out)检验扫描仪稳健性。
  • 外部:SPIROMICS(COPD,CT+肺功能)、NLST(吸烟者 CT)、MESA Lung(多族裔 CT 定量)作迁移目标;遗传发现按惯例在 ECLIPSE、NETT/NAS、GenKOLS 等队列复现。

§5.5 典型任务划分示例

任务 训练 验证/测试 关键控制
CT→GOLD 分期 Phase 1(80% SID) Phase 1 剩余 20% SID + Phase 2 全量时序外测 分层:GOLD × RACE;组:SID
%LAA-950 跨厂商稳健性 两个厂商站点 留出一个厂商站点 leave-one-vendor-out
5 年 FEV1 进展预测 Phase 1 基线特征 Phase 2 结局 结局定义 > 350 ml 丢失;多重插补脱落
影像遗传学 全队列 GWAS + CV ICGN/ECLIPSE 复制 阈值 5 × 10⁻⁸;PC 协变量
死亡风险评分 Phase 1+2 Phase 3 时间依存 C-index;按性别/种族分层

§6 AI 就绪指南 ⭐

§6.0 云端快速启动

COPDGene 无官方云镜像或 S3 桶。dbGaP 数据通过 authorized access 下载到本地/私有工作区后即可使用;合规前提是 DUC 与 consent 限制。若需团队协作,可在获批机构内部使用带访问控制的存储桶,但不得将数据转存公共镜像。

推荐的最小化上云路径:在机构私有云划分一个合规工作区(如 20-30 TB 卷),第一周只下载 phs000179 表型表完成数据字典摸索与分布核对,第二周再决定影像申请范围(全量还是按 GOLD 分层抽样),避免为未获批的影像提前付费存储。TOPMed VCF 体积大、用途单一,建议独立卷挂载并直接在卷上跑 bcftools,不与影像工作区混用。

§6.1 快速上手

下面代码假设目录结构如下(与 §4.0 一致),data_root 指向解压根目录;最小可用子集是 dbGaP 表型表(无需影像即可做表型/GWAS 分析):

data_root/
├── phs000179.v7.p2/pheno_subject.v7.p2.c1.DS   # 受试者表
├── phs000179.v7.p2/pheno_variable.v7.p2.c1.DS  # 变量表(宽格式)
└── imaging/{SID}/visit1/insp/*.dcm             # 影像(获批后)
# pip install pandas pydicom pydicom numpy
import pandas as pd, glob, pydicom, numpy as np

DATA_ROOT = "/data/copdgene"   # ← 替换为你的解压根目录

# 1) 表型:dbGaP 分发的 DS 文件为 tab 分隔,跳过头部描述行后即为数据
subj = pd.read_csv(f"{DATA_ROOT}/phs000179.v7.p2/pheno_subject.v7.p2.c1.DS",
                   sep="\t", dtype=str)
print(subj.shape)              # 受试者级行数

# 2) 读取一例吸气 CT 的 HU 直方图(最小影像子集)
def hu_volume(series_dir: str, max_slices: int | None = None) -> np.ndarray:
    files = sorted(glob.glob(f"{series_dir}/*.dcm"))[: max_slices or None]
    vol = np.stack([pydicom.dcmread(f).pixel_array for f in files])
    # CT 存储值 → HU:hu = pixel * slope + intercept
    d0 = pydicom.dcmread(files[0])
    return vol * float(getattr(d0, "RescaleSlope", 1)) + float(getattr(d0, "RescaleIntercept", -1024))

hu = hu_volume(f"{DATA_ROOT}/imaging/10000A/visit1/insp", max_slices=50)
print("HU range:", hu.min(), hu.max())   # 期望约 -1024 ~ 600+

§6.2 数据获取

数据 渠道 前置条件 周期
表型 + 芯片基因型(phs000179) dbGaP authorized access NIH eRA 登录 → PI 提交 Data Use Certification → 机构官员签署 → IRB 批准 数周量级
TOPMed WGS(phs000951) dbGaP authorized access 同上,注意 DS-CS-RD consent 组限制 数周量级
胸部 CT 影像 COPDGene Administrative Core(ANC 提案制) 提交 ancillary study proposal(先例编号 ANC-251),经 OSMB/执行委员会批准 数月量级
形变配准参考集(10 例 landmark) Emory 形变配准实验室申请表 填表后获取 Dropbox 密码 数天
基因组应用工具链 TOPMed Freeze 文档 遵循官方 QC 与 imputation 说明 —

WGS 使用提示:Freeze 9b/10b 为 GRCh38、按染色体分发的 VCF;直接使用官方 QC 后 call set 与配套方法文档,不要用芯片数据自行重跑 WGS 管线。常见工具链为 bcftools/plink2 预处理 + REGENIE/SAIGE 关联分析;COPDGene 的 TOPMed consent 组为 HMB 与 DS-CS-RD,分析用途声明需与之匹配。

# dbGaP 下载(获批后):file-reporter 生成 manifest,再下载
# 1) 安装 dbGaP 工具(NCBI 提供)并登录
# 2) 获取 decryption key 后:
#    ./srapath /data/copdgene    # 校验路径
#    ./prefetch phs000179        # 拉取数据(示例)
# 影像数据以审批邮件中的传输说明为准,不在 dbGaP 自动下载范围内

dbGaP 申请四步走(表型/基因型):

步骤 操作 要点
1 建立 NIH eRA/commons 登录并确认 PI 资质 非研究型个人无法申请 controlled access
2 在 dbGaP 页面提交 Data Use Certification 申请 明确勾选所需 consent 组(HMB/DS-CS)与用途描述
3 机构签署官(Signing Official)确认 + 本地 IRB 批准 机构与 PI 须一致;IRB 批准号需填入
4 NCBI 批准后获取 decryption key 并下载 批准有效期与年度续期要求以官方邮件为准

影像申请(ANC 提案制)要点:向 COPDGene Administrative Core 提交 ancillary study proposal,说明科学问题、所需访视与分析范围;获批后获得 ANC 编号(先例 ANC-251)并按约定交付数据安全计划;该路径与 dbGaP 相互独立,均需满足。

§6.3 预处理全流程

核心思路:CT 的 HU 值具有物理意义,任何会改变 HU 分布的操作都必须显式记录。以下流程从 DICOM 到可训练张量:

# pip install SimpleITK scipy numpy
import SimpleITK as sitk, numpy as np

def load_dicom_series(path: str) -> np.ndarray:
    reader = sitk.ImageSeriesReader()
    ids = reader.GetGDCMSeriesIDs(path)
    reader.SetFileNames(reader.GetGDCMSeriesFileNames(path, ids[0]))
    img = reader.Execute()                      # HU 已由 reader 处理 rescale
    return sitk.GetArrayFromImage(img)          # (Z, Y, X) in HU

def compute_laa950(hu: np.ndarray, lung_mask: np.ndarray) -> float:
    """%LAA-950:肺掩膜内 < -950 HU 体素占比(吸气相)"""
    lung = hu[lung_mask > 0]
    return float((lung < -950).mean() * 100.0)

def compute_gas_trapping(hu_exp: np.ndarray, mask_exp: np.ndarray) -> float:
    """气体陷闭:呼气相肺内 < -856 HU 占比"""
    lung = hu_exp[mask_exp > 0]
    return float((lung < -856).mean() * 100.0)

def expiratory_qc(hu_insp, mask_insp, hu_exp, mask_exp,
                  voxel_vol_mm3_insp: float, voxel_vol_mm3_exp: float) -> dict:
    """呼气质量 QC:肺容积比 + 空气陷闭比双重检查(见坑点 2)"""
    lung_vol_insp = float(mask_insp.sum() * voxel_vol_mm3_insp)   # ml/1000
    lung_vol_exp = float(mask_exp.sum() * voxel_vol_mm3_exp)
    air_insp = lung_vol_insp - float((hu_insp[mask_insp > 0] + 1000).sum()
                                     * voxel_vol_mm3_insp / 1000.0)
    air_exp = lung_vol_exp - float((hu_exp[mask_exp > 0] + 1000).sum()
                                   * voxel_vol_mm3_exp / 1000.0)
    return {
        "vol_ratio_exp_insp": lung_vol_exp / lung_vol_insp,   # 正常呼气末约 0.3-0.5
        "air_ratio_exp_insp": air_exp / air_insp,             # 过高提示呼气不全
    }

# 肺分割可用 lungmask / TotalSegmentator 生成 lung_mask(吸气相)
# 步骤总结:
# 1) load_dicom_series 读入吸气/呼气序列(校验 HU 范围 -1024~600+)
# 2) 重采样到统一 spacing(如 1×1×1 mm)——保留原始 HU
# 3) 肺分割 → 掩膜 → %LAA-950 / 气体陷闭 + expiratory_qc 呼气质检
# 4) 记录厂商/kernel/层厚/剂量元数据,用于跨站点校正(见坑点 1/2)

进一步可复算气道指标 Pi10(标准内周长 10 mm 气道的平方根壁面积)与图像噪声估计:

def pi10_from_segmental_airways(wall_areas: list[float], perimeters: list[float]) -> float:
    """对分段气道拟合 WA vs 内周长,外推到周长 10 mm 处的平方根壁面积。
    wall_areas: 各分段气道壁面积(mm²);perimeters: 对应内周长(mm)
    """
    import numpy as np
    sq_wa = np.sqrt(wall_areas)          # 平方根壁面积
    coef = np.polyfit(perimeters, sq_wa, 1)   # 线性回归(文献惯例)
    return float(np.polyval(coef, 10.0))      # Pi10(mm)

def estimate_ct_noise(hu: np.ndarray) -> float:
    """基于相邻轴向层面相减的噪声估计(Radiology 2022 方法族)"""
    diff = hu[1:].astype(np.float32) - hu[:-1].astype(np.float32)
    return float(diff.std() / np.sqrt(2))

格式转换(可选,便于团队复用):

# dcm2niix:DICOM → NIfTI(保留 HU 与几何元数据)
dcm2niix -z y -o /data/copdgene/nifti -f "p%t_s%r_{SID}_{VISIT}" \
         /data/copdgene/imaging/{SID}/visit{VISIT}/insp
# 校验:nifti 文件 HU 直方图峰值应仍在约 -850~-750(肺实质)

§6.4 PyTorch DataLoader

import torch
from torch.utils.data import Dataset, DataLoader

class COPDGeneCTDataset(Dataset):
    """每个样本 = 一个受试者一个访视的吸气 CT + GOLD 标签。
    目录结构:
      data_root/imaging/{SID}/visit{n}/insp/   DICOM
      data_root/labels.csv                     columns: sid,visit,label,spacing_z
    """
    def __init__(self, csv_path, data_root, target_shape=(64, 256, 256)):
        import pandas as pd
        self.df = pd.read_csv(csv_path)
        self.root, self.shape = data_root, target_shape

    def __len__(self):
        return len(self.df)

    def _load(self, sid, visit):
        import SimpleITK as sitk
        r = sitk.ImageSeriesReader()
        p = f"{self.root}/imaging/{sid}/visit{visit}/insp"
        r.SetFileNames(r.GetGDCMSeriesFileNames(p, r.GetGDCMSeriesIDs(p)[0]))
        img = r.Execute()
        vol = sitk.GetArrayFromImage(img).astype(np.float32)   # HU
        vol = np.clip(vol, -1200.0, 600.0)                     # 保留 HU 物理意义
        t = torch.from_numpy(vol)[None]                        # (1, Z, Y, X)
        return torch.nn.functional.interpolate(t, size=self.shape,
                                               mode="trilinear", align_corners=False)[0]

    def __getitem__(self, i):
        row = self.df.iloc[i]
        x = self._load(row["sid"], int(row["visit"]))
        y = torch.tensor(int(row["label"]), dtype=torch.long)  # GOLD 0-4(-1 可归入 0 或单列)
        return x, y

ds = COPDGeneCTDataset("labels.csv", "/data/copdgene")
# group-aware 划分示例:按 SID 分层,防同人跨期泄漏(坑点 3)
from sklearn.model_selection import GroupShuffleSplit
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
tr_idx, te_idx = next(gss.split(ds.df, groups=ds.df["sid"]))
dl = DataLoader(torch.utils.data.Subset(ds, tr_idx), batch_size=4,
                num_workers=4, pin_memory=True)

实现要点:

  • np.clip(vol, -1200, 600) 保留 HU 物理意义,切勿 z-score;三线性重采样到固定形状仅作粗对齐,定量研究应保留原始 spacing。
  • 标签构建时把 GOLD_STAGE == -1(GOLD-U)与 PRISm 显式建模(见坑点 4/5),不要静默映射到 0。
  • 万例级 3D 体数据的瓶颈是 I/O:建议预先转 NIfTI/zarr 并把 (SID, VISIT, 路径, spacing) 写入索引 parquet,Dataset 只查索引不再扫目录。

§6.5 常见坑点

⚠️ 坑点 1:多厂商重建 kernel 与层厚差异让 %LAA-950 不可直接比较(分类:预处理陷阱)

问题:COPDGene 跨 GE/Siemens/Philips 三家机型,重建 kernel(GE STANDARD vs BONE、Siemens B31f vs B45f、Philips B)与层厚(0.625-0.90 mm)不同。尖锐 kernel 会高估低衰减体素比例,同一肺的 %LAA-950 可因 kernel 不同出现数个百分点的系统差。

症状:跨中心/跨厂商训练时,模型学到"扫描仪指纹"而非疾病;按厂商分层后 %LAA-950 分布明显错位;混合 kernel 的合并队列中肺气肿患病率与文献不符。

解决:

  1. 简单方法:只使用标准(smooth)kernel 序列训练,把厂商/kernel 作为协变量或分层变量。
  2. 进阶方法:以同一受试者双 kernel 重建数据拟合 kernel 间线性/非线性映射做归一化(COPDGene 内部 GE vs Siemens 交叉研究已验证该路线能降低变异且保持与肺功能的相关性);或统一重采样到各向同性体素并做噪声水平匹配。
  3. SOTA 方法:用对抗域自适应/站点不变学习(把站点当域标签)或基于幻觉核的谐波化网络,在保留疾病信号的同时抹平 kernel 效应。

参考:Normalizing CT data reconstructed with different filter kernels(Eur Radiol 2015,DOI 10.1007/s00330-015-3824-y);Lynch et al., Fleischner Society CT-definable subtypes 声明。

⚠️ 坑点 2:呼气质量决定气体陷闭指标的可信度(分类:预处理陷阱)

问题:气体陷闭(呼气 CT < -856 HU 占比)假设呼气末达到功能残气量。呼气配合不佳(提前终止、咳嗽、伪影)会让肺内残余气体偏多,把正常人算出"陷闭"。COPD 患者呼气配合更差,形成与疾病相关的信息性噪声。

症状:同一人两次呼气扫描的气体陷闭差异巨大;GOLD 0 对照中出现 > 30% 的"重度陷闭";吸气/呼气肺容积比明显异常(如呼气容积 > 60% 吸气容积)。

解决:

  1. 简单方法:设定呼气质量阈值(如呼气/吸气肺容积比或气道塌陷率),超界样本剔除气体陷闭指标。
  2. 进阶方法:吸气-呼气形变配准后用逐体素衰减差图(attenuation difference map)替代纯呼气阈值法,把配准误差纳入 QC(Emory landmark 参考集给出 0.6-1.1 mm 观察者误差基准)。
  3. SOTA 方法:用深度学习配准(如 VoxelMorph 系)+ 不确定性估计,自动标记低置信呼气区域并加权抑制。

参考:Radiol Cardiothorac Imaging 2021 自动分期 pipeline(对称微分同胚配准 + 衰减差图);Emory COPDgene 参考数据集页面。

⚠️ 坑点 3:同一受试者跨 Phase 数据导致验证性能虚高(分类:数据泄漏)

问题:Phase 1 与 Phase 2 的 CT/表型挂在同一 SID 下,双期间肺结构变化远小于个体间差异。随机按行划分训练/测试集等于把"同一人"同时放进两边。

症状:验证 AUROC/R² 异常漂亮(如 GOLD 分期 AUROC > 0.99);换到 SPIROMICS/NLST 外部验证时性能断崖式下跌。

解决:

  1. 简单方法:GroupShuffleSplit / GroupKFold(group = SID)。
  2. 进阶方法:按 SID 划分 + 按 GOLD × RACE 分层,再留出整个访视作时序外测(Phase 2/3)。
  3. SOTA 方法:leave-one-center-out 评估站点泛化,配合外部队列(SPIROMICS/NLST)做真正的时间-空间双重外测。

参考:§5.3;sklearn GroupShuffleSplit 文档;COPDGene 纵向分析惯例(Radiology 2022 进展研究使用混合效应模型处理同人重复测量)。

⚠️ 坑点 4:GOLD 固定比值在跨种族分析中的系统性偏差(分类:偏倚陷阱)

问题:GOLD 用固定比值 FEV1/FVC < 0.70 定义气流受限,会随年龄高估老年人、且与 LLN(Z-score -1.645)判定的阳性集不一致;COPDGene 同时纳入非西裔白人与非裔,参考方程的种族效应叠加其上。

症状:用固定比值标签训练的模型在 LLN 标签评估时指标下降;不同种族亚组患病率差异被误读为生物学差异;PRISm 人群随标准切换漂移。

解决:

  1. 简单方法:主分析用 GOLD,敏感性分析用 LLN(COPDGene 论文即如此双轨报告),在论文中并列两种结果。
  2. 进阶方法:直接以 FEV1%(预测值)与 FEV1/FVC 连续值建模,回避二值化阈值;分层报告 NHW/AA 指标。
  3. SOTA 方法:采用 GLI 参考方程的 Z-score 建模,结合公平性约束(组间校准误差)训练。

参考:COPDGene ACO 论文方法部分(ATS/ERS LLN 建议);COPDGene 2019 重定义论文。

⚠️ 坑点 5:PRISm 是高流动性类别,不能当静态标签(分类:标签理解)

问题:PRISm(FEV1 < 80% 预测值但 FEV1/FVC ≥ 0.7)在 5 年随访中可恢复为正常、可转为 GOLD 1-4,是动态过渡状态而非稳定诊断;约 12% 的 Phase 1 队列处于该类。

症状:把 PRISm 当固定类训练的模型在纵向数据上表现不稳定;用基线 PRISm 预测"是否 COPD"时标签翻转污染评估。

解决:

  1. 简单方法:每个访视重新判定 PRISm,标签绑定 (SID, VISIT) 而非 SID。
  2. 进阶方法:建模"状态转移"(多状态模型或时序分类),把 PRISm→GOLD 2-4、PRISm→正常作为不同结局。
  3. SOTA 方法:用轨迹聚类(group-based trajectory modeling)先分型再预测,复刻 COPDGene 进展通路研究(airway-predominant / emphysema-predominant / 混合通路)。

参考:COPDGene PRISm 纵向表型与死亡研究(Ann Am Thorac Soc);COPDGene 2019 论文。

⚠️ 坑点 6:GWAS/WGS 分析必须处理祖先分层与芯片批次(分类:偏倚陷阱)

问题:队列由非西裔白人(约 2/3)与非裔(约 1/3)组成,且经历 Omni-1 → OmniExpress 两代芯片与 TOPMed WGS 多个 Freeze。不校正祖先与批次会把人群结构、芯片差异当遗传信号。

症状:曼哈顿图出现整条染色体级别的平台(Laminin 类大信号块);已知吸烟行为基因座(如 15q25)与 COPD 关联被放大;跨种族合并分析 p 值虚高。

解决:

  1. 简单方法:按 RACE 分层跑 GWAS,再加前 10 个主成分作协变量;芯片平台作 batch 协变量。
  2. 进阶方法:混合模型(SAIGE/REGENIE/BOLT-LMM)统一处理亲缘与分层;TOPMed Freeze 直接使用官方 QC 后 call set 与 imputation 前置步骤。
  3. SOTA 方法:跨种族元分析(MR-MEGA/ MANTRA)+ 祖先特异遗传度估计(LD score regression 分层),复刻 Zhou 等给出的 NHW/AA 双重遗传度框架。

参考:Zhou et al.(COPDGene 遗传度);Cho et al., Lancet Respir Med 2014;TOPMed Freeze 9b/10b 方法文档。

⚠️ 坑点 7:CT 与肺功能并非同日采集,多模态对齐有时间窗(分类:工程陷阱)

问题:同一访视内 CT 与 spirometry 平均间隔 10.45 天、最长 98 天。肺功能可在短期内波动(近期加重、季节),把两者当作"同一时刻"配对会引入标签噪声。

症状:CT→肺功能回归的可解释方差上不去且残差呈双峰;加入"间隔天数"特征后模型反而更稳(说明窗口真实存在影响)。

解决:

  1. 简单方法:过滤间隔 > 30 天的配对样本再训练。
  2. 进阶方法:把间隔天数作为协变量/注意力偏置显式注入模型。
  3. SOTA 方法:多时间戳建模——把访视内各检查建模为带时间戳的观测序列,用时间感知的多模态 Transformer 聚合。

参考:Eur Radiol 2015 kernel 归一化研究方法节(报告平均间隔 10.45 天,0-98 天)。

⚠️ 坑点 8:按吸烟状态+GOLD 分期的入组设计污染二次表型分析(分类:评估误用)

问题:COPDGene 按"病例(GOLD 2-4)/对照吸烟者"设计招募,队列 ≠ 自然人群。在此队列上估计任何与入选条件相关的二次表型(症状、合并症、影像定量)的流行率或关联,都受 ascertainment bias 影响。

症状:估出的肺气肿流行率明显高于人群研究;把队列当人群做患病率迁移时与 NHANES/BRFSS 口径对不上;回归系数在加入入选条件调整项后大幅变化。

解决:

  1. 简单方法:分析时始终调整入选条件变量(GOLD 期、吸烟状态、包年)。
  2. 进阶方法:使用针对 case-control 设计的条件似然/逆概率加权恢复人群尺度估计。
  3. SOTA 方法:在独立人群队列(如 NLST/UK Biobank 子集)做复制,或只报告队列内相对关联并显式声明不可外推为患病率。

参考:COPDGene spirometric GWAS 论文 limitations 节(明确讨论 ascertainment 条件化问题)。

八个坑点的分布速查(便于立项前自检):

坑点 分类 首当其冲的任务类型 一句话对策
1 kernel/层厚差异 预处理陷阱 定量 CT、跨站训练 只用标准 kernel + 归一化
2 呼气质量 预处理陷阱 气体陷闭、CT 通气 容积比 QC + 配准差图
3 跨期泄漏 数据泄漏 一切纵向/横断面训练 group = SID 划分
4 固定比值偏倚 偏倚陷阱 分期标签构建 GOLD/LLN 双轨报告
5 PRISm 流动 标签理解 早期疾病预测 标签绑定 (SID, VISIT)
6 祖先混杂 偏倚陷阱 GWAS/WGS 分层 + PC + 混合模型
7 检查时间窗 工程陷阱 多模态融合 间隔过滤或时间戳建模
8 入选偏倚 评估误用 患病率/流行病学外推 条件化调整 + 外部复制

§6.6 数据增强

类别 操作 说明
✅ 安全 弹性/仿射形变、左右镜像、随机 z 轴裁剪、插值重采样(保持 HU)、高斯噪声(模拟低剂量,幅度按 Phase 3 校准) 不改变 HU 语义与解剖合理性
✅ 安全 强度窗宽窗位随机化(在固定 HU 边界内) 提高对窗设置的鲁棒性
❌ 危险 全局 HU 平移/缩放、直方图均衡、CLAHE、z-score 归一化 直接破坏 -950/-856 HU 阈值语义,定量任务禁止
❌ 危险 随机伽马/对比度扰动(面向自然图像的增强) 让模型学习到与物理无关的纹理
❌ 危险 大角度 3D 旋转 破坏重力梯度与解剖方向先验

安全增强的参考实现:

def train_transform(vol: np.ndarray, rng: np.random.Generator) -> np.ndarray:
    # 仅使用保持 HU 语义的增强
    vol = vol[:, :, ::-1] if rng.random() < 0.5 else vol          # 左右镜像
    noise = rng.normal(0, rng.uniform(0, 15), vol.shape)          # 轻度高斯噪声
    return (vol + noise).astype(np.float32)                        # HU 仍以 -950 为锚

危险操作的判别口诀:任何"输出值不再能直接与 HU 阈值对话"的变换,都不应进入定量 CT 管线;分类任务若使用此类增强,应同时冻结一份未增强验证集做健康检查。

§6.7 模型推荐

任务 推荐起点 说明
CT→GOLD 分期 3D ResNet/DenseNet(单期吸气 CT) COPDGene 自动分期 CNN 已验证影像分期可预测进展与死亡(OR 1.50-2.67)
肺气肿亚型分类 弱监督 CNN(DRAM 空间回归) 训练标签为 6 分区视觉评分,COPDGene 上完成并可作 Grand-Challenge Web 服务
肺功能回归 3D CNN + 定量 CT 特征混合 定量特征(%LAA-950、Pi10)作为强先验提升小样本稳定性
影像表型嵌入 REGLE/自监督(对比学习) 从临床数据与影像学习低维嵌入再连 GWAS,2024 年已在 COPDGene 发表
进展预测 混合效应模型 / 时序 Transformer Phase 1→2→3 重复测量;Radiology 2022 用 4 观测/人拟合 10 年肺气肿进展
死亡风险 Cox 回归 + 影像深度特征 / 随机生存森林 CT 功能成像指标(CT-V、PBM)联合 FEV1 的 10 年死亡预测已有发表先例
肺分割底座 TotalSegmentator / lungmask / nnU-Net 所有定量任务的公共前置;分割失败必须进入 QC 队列

选型补充说明:COPDGene 无 voxel 级肺气肿标注,全监督分割式表型模型需要迁移外部标注或采用弱监督(分区视觉评分);单例双期数据的批处理开销主要在 I/O,预处理阶段建议先把 DICOM 转为压缩 NIfTI/zarr 再做 GPU 训练。

§6.8 硬件需求

场景 最低配置 推荐配置
表型 + GWAS 分析 16 GB 内存 CPU 64 GB 内存、NVMe 缓存(VCF 解压峰值大)
单例 CT 预处理 8 核 CPU、16 GB 内存 GPU 加速分割(如 TotalSegmentator)
3D CNN 训练 单卡 24 GB(A10/3090 级) 多卡 A100 80 GB,混合精度 + 梯度累积
全队列预处理(约万例双期) 分布式 CPU 集群 Kubernetes 批处理 + 对象存储,按站点并行

§6.9 评估指标代码

import numpy as np
from sklearn.metrics import roc_auc_score, mean_absolute_error, r2_score

def eval_classification(y_true, proba, labels=(1, 2, 3, 4)):
    """GOLD 1-4 分期:每类 one-vs-rest AUROC + 宏平均"""
    aucs = {f"GOLD{l}": roc_auc_score((np.asarray(y_true) == l).astype(int),
                                      np.asarray(proba)[:, i])
            for i, l in enumerate(labels)}
    aucs["macro"] = float(np.mean(list(aucs.values())))
    return aucs

def eval_regression(y_true, y_pred):
    """FEV1% / %LAA-950 回归:MAE + R² + Bland-Altman 偏差"""
    yt, yp = np.asarray(y_true, float), np.asarray(y_pred, float)
    return {"MAE": mean_absolute_error(yt, yp), "R2": r2_score(yt, yp),
            "bias": float((yp - yt).mean()), "LoA": float(1.96 * (yp - yt).std())}

def bootstrap_ci(y_true, y_pred, metric_fn, n_boot: int = 1000, seed: int = 42):
    """按受试者自助抽样给指标加 95% CI(评测协议要求报告 CI)"""
    rng = np.random.default_rng(seed)
    n = len(y_true)
    vals = [metric_fn(np.asarray(y_true)[idx], np.asarray(y_pred)[idx])
            for idx in (rng.integers(0, n, n) for _ in range(n_boot))]
    return {"point": metric_fn(np.asarray(y_true), np.asarray(y_pred)),
            "lo": float(np.percentile(vals, 2.5)),
            "hi": float(np.percentile(vals, 97.5))}

分层评估骨架(论文口径):

def report_by_group(df, proba, label_col="label", group_cols=("RACE",)):
    """按种族等分组复报 AUROC,检查公平性(§7.5)"""
    from sklearn.metrics import roc_auc_score
    out = {}
    for key, sub in df.groupby(list(group_cols)):
        out[key] = roc_auc_score(sub[label_col], proba[sub.index])
    return out

§6.10 MLOps 笔记

  • 数据版本化:以 dbGaP 研究版本(phs000179.v7.p2、phs000951 Freeze 10b)作为数据集版本号写入 ML 元数据,论文复现时绑定版本。
  • 预处理不可变:DICOM → 张量的管线用容器(Docker/Singularity)固化,记录 dcm2niix/SimpleITK 版本与重采样目标 spacing。
  • 合规审计:所有落盘路径与 notebook 输出需过一遍"无标识符"检查(SID 为编码 ID 仍属受限数据,不得同步到公共 git/网盘)。
  • 站点监控:上线后的模型按采集厂商/kernel 分组监控输入分布漂移(见 §7.6),kernel 类漂移是最高频告警源。
  • 结果对齐:定量指标先与论文报告值对齐(如 %LAA-950 与 GOLD 期的单调关系),再进入训练。
  • 特征商店分层:把"原始 DICOM → 定量表(%LAA-950/Pi10/气体陷闭)"与"定量表 → 模型特征"拆成两级,二级只依赖表格,便于复用与回溯。
  • QC 看板:肺分割 Dice、呼气容积比、噪声估计三项作为每日批处理质量指标,超阈值样本自动隔离。
  • 复现实录:论文级复现建议记录环境(PyTorch/CUDA)、随机种子与网格搜索空间;混合效应模型结果用 R(lme4)与 Python(statsmodels)双实现交叉验证可提升可信度。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
入选偏倚(ascertainment) 按吸烟状态+GOLD 分期招募,非人群样本 高 调整入选变量;逆概率加权;外部队列复制
种族代表性限制 仅含 NHW 与 AA 两个自报类别 中 分层分析;避免外推至其他人群
固定比值判读偏倚 FEV1/FVC < 0.70 与 LLN 不一致,随年龄/种族漂移 中 双轨(GOLD+LLN)报告
设备异质性 三厂商、多 kernel、层厚 0.625-0.90 mm 中 kernel 归一化;分层训练
剂量协议变化 Phase 3 低剂量约 1.5 mSv,噪声升高 中 噪声建模与校准;1,508 人双剂量对照
存活者偏倚 Phase 2/3 随访覆盖下降,死亡者缺失纵向影像 中 混合效应模型 + 多重插补
自报吸烟偏倚 包年依赖回忆 低-中 与生物标记物交叉验证(研究层面)
哮喘合并偏倚 哮喘者未被排除,可能混入"可逆性梗阻" 低-中 按有无哮喘分层敏感性分析
妊娠排除 孕妇因辐射排除 低 对老年吸烟者队列影响可忽略

§7.2 标注质量

肺功能按 ATS 标准执行并经中央 PFT 质控核心复核;视觉 CT 评分由至少 2 名受训观察者独立完成;定量 CT 由自动软件产出后经受训分析员目视核准(Thirona 管线明确要求"visually approved")。可复核的一致性证据包括:PMA 测量观察者内 CCC 1.00、观察者间 0.98;形变配准 landmark 观察者重复误差 0.6-1.1 mm。局限:无组织病理学对照,定量指标与病理的相关性依赖文献外推。

从 AI 视角解读这组数字:生理标签(GOLD 分期)的稳定性受肺功能测量变异(约 ±5%)约束,这决定了分类模型的天花板指标不宜期待完美;影像定量标签的方差主要来自扫描仪与呼气配合而非"标注者分歧",因此提升标签质量的方向是协调化与 QC,而不是多标几遍。对需要像素级监督的任务(如肺/气道分割),可先用官方定量表做弱监督校准,再用人工抽检闭环。

§7.3 泛化性

场景 失效风险 证据
迁移到非吸烟者/年轻人 高 队列全部 ≥45 岁且 ≥10 包年(对照除外)
迁移到其他种族/地区人群 高 仅 NHW/AA;遗传度估计均以这两组为条件
迁移到低剂量筛查 CT(NLST 类) 中-高 Phase 1/2 为全剂量;低剂量需噪声校准(Radiology 2022 已示范)
迁移到不同 kernel 的临床常规 CT 中-高 kernel 差异可系统性改变 %LAA-950(Eur Radiol 2015)
迁移到同期美国其他中心 CT 中 多中心多厂商设计已部分覆盖,但站点效应仍需监控
迁移到病房/床旁或急诊低质量 CT 高 队列全部为标准化仰卧位闭气容积 CT
CT 通气类衍生任务(CT-V) 中 双期配准质量决定上限,Phase 3 低剂量数据更难

§7.4 伦理

21 个中心各自通过 IRB 审批(含 National Jewish Health、Brigham and Women’s Hospital、Baylor、Columbia、Duke 等),全体参与者书面知情同意;研究立项即从美国 HHS 获得保密证书(Certificate of Confidentiality);孕妇因 CT 辐射风险排除;基因组与影像数据经 dbGaP controlled access 分发,使用者须遵守 DUC 与 consent 组(HMB/DS-CS,TOPMed 另有 DS-CS-RD)限制;OSMB(NHLBI 召集的观察研究监测委员会)全程监督。

§7.5 公平性

队列按设计纳入约三分之一的非裔美国人,是少数能支撑跨种族遗传度估计(FEV1 遗传度 38.4% vs 50.9%)与公平性评估的影像队列。已知的公平性议题:固定比值标准在跨人群中的系统差(见坑点 4);AA 亚组样本量较小导致功效有限(spirometric GWAS 论文明确指出);影像质量与合并症分布在种族亚组间存在差异。

可操作的公平性检查清单:

  1. 主指标按 RACE(以及性别)分层复报,报告组间性能差与校准斜率。
  2. 用跨种族 GWAS 工具(如 MR-MEGA)检验基因座效应的祖先异质性。
  3. 影像质量指标(噪声、体素大小、kernel)在两组间的分布差异纳入协变量。
  4. 外部验证数据(NLST 约 4-5% 非裔、MESA 更均衡)可进一步暴露泛化差距。

§7.6 数据漂移

  • 协议漂移:Phase 1/2(约 6.5 mSv)→ Phase 3(约 1.5 mSv)剂量减半以上,噪声升高导致表观肺密度下降,跨期直接比较需校准;1,508 人双剂量扫描提供了现成的配对校准数据。
  • 设备漂移:站点机型更新与 kernel 变化是长期队列的常态,建议以定量指标分布的按站点 CUSUM 监控。
  • 人群漂移:随访存活者与脱落者在疾病严重度上系统性不同(存活者偏倚)。

§7.7 DAIMS 24 项评估

# 检查项 状态 说明
1 宽格式支持 ✅ dbGaP 变量表按 (SID, VISIT) 宽格式分发
2 唯一标识 ✅ SID 编码 ID 全库唯一,跨访视/跨表一致
3 特殊字符处理 ✅ dbGaP 表为纯 ASCII tab 分隔,无多字节风险
4 重复行控制 ⚠️ 同一变量在多个子数据集重复出现,合并需自行 (SID, VISIT) 去重
5 缺失编码 ⚠️ 哨兵值(如 -999)与空缺并存,需读数据字典统一
6 标签标识清晰 ✅ GOLD_STAGE、PRISM、FEV1PP_POST 定义明确且论文可溯
7 罕见类分组 ⚠️ GOLD-Unclassified(-1)与 PRISm 属研究特意保留的稀有类别,需独立处理
8 偏倚评估 ✅ 入选/设备/剂量/存活者偏倚均有论文级讨论
9 数据字典 ✅ dbGaP docs 提供变量字典与 consent 文档
10 信息性缺失解释 ⚠️ 呼气失败、检查未完成等缺失具信息性,需自行建模
11 设备记录 ✅ 厂商/机型/协议参数在论文与附录协议完整公开
12 共线性风险 ⚠️ FEV1/FVC 与 GOLD、%LAA-950 与分期高度相关,多模态融合需降维
13 编码映射 ✅ GOLD↔ICD-11 CA22.0-3 映射清晰;视觉评分体系有 Fleischner 对照
14 时间戳处理 ⚠️ 访视年月可得,检查级精确时间需从 DICOM 头提取
15 划分建议 ✅ 官方无划分但社区惯例清晰(SID 分组 + 分层)
16 泄漏讨论 ✅ 同人跨期泄漏已在多篇论文与本 Wiki 显式处理
17 标签分布 ✅ 分期构成可由表型表精确复算(4,062/8,784 等论文锚点)
18 测量偏倚 ⚠️ 呼气配合度、支扩剂反应等生理测量偏倚存在
19 外部验证建议 ✅ SPIROMICS/NLST/MESA Lung 及 ECLIPSE/GenKOLS(遗传)路线明确
20 版本记录 ✅ dbGaP 版本链(v1-v7)与 TOPMed Freeze 9b/10b 完整
21 预处理脚本 ❌ 无官方端到端预处理脚本,管线需自建
22 合规要求 ✅ DUC + consent 组 + Certificate of Confidentiality 齐备
23 多模态对齐 ⚠️ CT 与肺功能同访视不同日(0-98 天),需时间戳对齐策略
24 去标识化 ✅ 编码 ID + 影像脱敏,controlled access 分发

DAIMS 评分:18.5 / 24

评分解读:数据治理面(标识、字典、合规、版本)接近满分,属于 dbGaP 生态的成熟水准;失分集中在"工程就绪"——无官方预处理脚本、定量指标跨设备需协调、多模态时间对齐需要自行设计。这意味着 COPDGene 是一台"发动机完整但需要自装底盘"的队列:数据科学团队可直接上手表型与基因组,影像团队则要先构建稳健的预处理管线。

对你意味着什么:

  1. 表型/GWAS 研究可即取即用:读 DS 表 → 按数据字典处理哨兵值 → 分层分析,无需额外清洗工具。
  2. 影像项目预算中必须为"多厂商协调 + 肺分割 + QC"预留 1-2 个工程师月的预处理开发。
  3. 任何涉及 Phase 2/3 的模型,把"同人分组 + 访视外测 + 剂量校准"写进实验设计,可避免本文 8 个坑点中的 5 个。
  4. 合规动作前置:ANC 提案(影像)审批以月计,先启动申请再写代码。
  5. 建立组级(SID)划分与分层报告的 CI/CD 检查项,让"同人泄漏""不分层报告"在代码评审阶段就被拦截。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
GE↔Siemens 交叉归一化(COPDGene 内部跨站) 多中心站点 %LAA-950 kernel 归一化 与肺功能相关系数保持,kernel 间变异下降 归一化后混合队列与单 kernel 队列一致 多 kernel 差异可被映射校正(Eur Radiol 2015)
形变配准基准(10 例 landmark,多观察者) Emory(数据源自 COPDGene 档案) 3D 配准精度 观察者重复误差 0.6-1.1 mm 各病例位移量级 12-31 mm 为吸气-呼气配准算法提供定量标尺
TOPMed 跨队列(MESA/CHS/WHI/COPDGene 等) NHLBI TOPMed 血源性镶嵌染色体改变(mCA)检测 WGS 比芯片更敏感(低克隆分数) 四队列芯片对比一致 跨研究 WGS 方法可迁移(Nat Genet 2023)

矩阵小结:COPDGene 的"外部验证"文献多集中在方法学(kernel 归一化、配准基准、WGS 方法迁移)而非单一模型移植;这提示使用者在宣称泛化能力前,应优先完成"协议对齐"层面的验证,再谈模型层面的迁移。


§8 基准性能与生态

§8.1 代表性 AI/统计基准结果

COPDGene 无竞赛式排行榜。下表汇总有同行评审支撑的代表性结果;不同论文的任务定义、样本与评估协议不同,数值不可直接横向比较:

排名 模型/研究 任务与性能 年份 关键技术 完整引用 代码
1 自动 CT 分期 CNN(COPDGene 深度学习分期研究) CT 视觉分期预测进展与死亡:重度者进展 OR 1.50-2.67(P < 0.05) 2021 3D CNN + 形变配准衰减差图 COPDGene Investigators, 2021, Radiology: Cardiothoracic Imaging. DOI 10.1148/ryct.2021200477 无公开
2 弱监督肺气肿亚型网络(DRAM) 6 分区视觉亚型回归;模型公开为 Grand-Challenge Web 服务 2023 DRAM 空间回归图弱监督 DIAG Nijmegen 团队(通讯作者 B. van Ginneken), 2023, Scientific Reports. DOI 10.1038/s41598-023-40116-6 GitHub
3 REGLE 临床数据表征学习 从临床变量学习嵌入辅助遗传发现(Harnessing hidden genetic information in clinical data with REGLE) 2024 表征学习 + 低维嵌入 GWAS REGLE 研究团队, 2024(COPDGene 临床数据应用,2024-07 发布) 以论文发布为准
4 机器学习 COPD 亚型 无监督聚类识别临床可解释亚型 2020 聚类 + 生存分析 Castaldi PJ, et al., 2020, Chest. DOI 10.1016/j.chest.2019.11.039 无公开
5 10 年肺气肿进展混合效应模型 8,431 人 4 观测/人,量化全剂量/低剂量差异 2022 线性混合效应 + 噪声建模 COPDGene Investigators, 2022, Radiology. DOI 10.1148/radiol.222786 无公开
6 CT 功能成像 + FEV1 生存模型 CT-V/血容量变化指标联合 FEV1 预测 10 年全因死亡 2025 CT-V 衍生指标 + 随机生存森林 Nair G, et al.(通讯作者 E. Castillo), 2025, npj Imaging. DOI 10.1038/s44385-025-00027-9 无公开
7 TOPMed WGS 跨队列基准 血源性镶嵌染色体改变(mCA)检测:WGS 较芯片更敏感(低克隆分数);COPDGene 为 12 队列之一 2023 30x WGS + 断裂点检测 TOPMed 联盟, 2023, Nature Genetics. DOI 10.1038/s41588-023-01553-1 无公开

§8.2 SOTA 总结与选型建议

以"CT→生理/结局"为主线,弱监督与自监督路线(DRAM、REGLE)是当前最能利用 COPDGene 规模的选择:它们不依赖 voxel 级标注,且能把大规模未标注影像转成可遗传分析的嵌入。若目标是分期/预后这类标签明确的任务,3D CNN + 定量特征混合模型仍是性价比最高的起点。GWAS 方向应直接采用 TOPMed Freeze 版本与混合模型工具链,避免自行重跑 QC。

选型决策树建议:先问"标签在哪一层"——标签是访视级生理值(FEV1、GOLD)就选监督回归/分类;标签是分区视觉评分(肺气肿亚型)就选弱监督空间回归;没有标签(表型发现)就先自监督预训练再聚类;任务是"找基因"就把前一步的嵌入/定量值作为 GWAS 表型。无论哪条线,都应把厂商/kernel 与剂量作为固定协变量或分层因子,这是 COPDGene 上所有已发表方法学的共同底座。

§8.3 评测协议

  • 分期任务报告:整体准确率 + GOLD 1-4 各类 AUROC(one-vs-rest)+ 宏平均;主标签固定比值,附 LLN 敏感性。
  • 回归任务报告:MAE、R²、Bland-Altman 偏差与一致性界限;按厂商/kernel 分层复报。
  • 纵向任务报告:以混合效应模型为主(随机截距含中心与机型),划分以 SID 为组。
  • 遗传任务报告:分层 GWAS + 全基因组显著阈值 5 × 10⁻⁸;复制队列(ECLIPSE/NETT-NAS/GenKOLS/ICGN)结果并列。
  • 公平性报告:主指标按 RACE/性别分层,报告组间校准斜率而非仅 AUROC。
  • 所有指标附 95% CI(bootstrap 按受试者抽样),并注明所用 dbGaP 版本号。
  • 消融建议:定量特征与深度特征分开报告增量,便于判断模型收益来自"学了影像"还是"学了表"。
数据集 关系 适用
SPIROMICS 同代 COPD 队列(约 2,900 人) COPDGene 发现的外部复制
NLST 大规模肺癌筛查 CT 低剂量 CT 泛化测试
MESA Lung 多族裔心血管队列肺亚研究 跨人群影像定量验证
LTRC 间质性肺病 + COPD 影像与基因组 肺移植组织学对照方向
ECLIPSE / NETT-NAS / GenKOLS 历史 COPD GWAS 联盟队列 遗传发现复制
Framingham / Jackson Heart 等 TOPMed 同盟队列 共享 WGS 管线 跨疾病方法迁移与 mCA/组学分析

§8.5 关键论文 Top 8

  1. Regan EA, Hokanson JE, Murphy JR, et al. Genetic epidemiology of COPD (COPDGene) study design. COPD. 2010;7(1):32-43. DOI 10.3109/15412550903499522 — 研究设计与协议总纲(被引 1,100+)。
  2. Cho MH, McDonald MLN, Zhou X, et al. Risk loci for chronic obstructive pulmonary disease: a genome-wide association study and meta-analysis. Lancet Respir Med. 2014 — 6,633 病例 + 5,704 对照;确认 FAM13A/CHRNA3/HHIP,新发现 RIN3、MMP12、TGFB2。
  3. Zhou X, et al. SNP 遗传度估计(COPDGene 阵列数据)—— COPD 37.7%/37.9%、FEV1 38.4%/50.9%、肺气肿 28.2%/31.3%(NHW/AA),见 Am J Respir Crit Care Med 2013 综述引用框架。
  4. Lowe KE, et al. COPDGene 2019: Redefining the Diagnosis of Chronic Obstructive Pulmonary Disease. Chronic Obstr Pulm Dis. 2019;6(5):384-399. DOI 10.15326/jcopdf.6.5.2019.0149 — 融合暴露/症状/CT/生理的扩展诊断框架(HR 5.18)。
  5. Castaldi PJ, et al. Machine learning characterization of COPD subtypes: Insights from the COPDGene study. Chest. 2020;157:1147-1157. DOI 10.1016/j.chest.2019.11.039 — 无监督亚型的代表作。
  6. Sakornsakolpat P, et al. Genetic landscape of chronic obstructive pulmonary disease(含 COPDGene 的跨联盟元分析). Nature Genetics. 2019 — 将 COPD 关联区域扩展至 80+ 个。
  7. van Ginneken B, et al. Emphysema subtyping on thoracic CT using deep neural networks. Scientific Reports. 2023. DOI 10.1038/s41598-023-40116-6 — 弱监督影像分型 + 开源代码。
  8. Han MK, et al. Chronic obstructive pulmonary disease phenotypes: The future of COPD. Am J Respir Crit Care Med. 2010;182:598-604. DOI 10.1164/rccm.200912-1843CC — 表型驱动研究范式的理论奠基。

§8.6 社区活跃度

  • 截至 2021-02,COPDGene 数据已支撑 427 篇论文;2023 年资助文件称累计 450+ 篇(绝大多数同行评审)。
  • 数据集作为 TOPMed 12 个核心研究之一参与跨疾病分析(WGS 结构变异、mCA、遗传度等)。
  • 影像核心产出的 Chest Imaging Platform、定量软件管线(VIDA、Thirona)被后续队列(如 SPIROMICS)沿用。
  • 注册临床试验 NCT00608764;官方站点提供 Phase 1/2 文档与 FAQ。
  • COPDGene 是 ANC 提案制度最活跃的 dbGaP 大队列之一:第三方影像研究(如弱监督肺气肿分型)以提交提案 + 获批编号(先例 ANC-251)的方式持续产出发表成果。
  • 依托 TOPMed 生态,COPDGene 数据被纳入 GRCh38 Freeze 体系,与 Framingham、MESA、ARIC 等队列共享同一 imputation/QC 方法链,降低了跨队列复现成本。
  • 学术会议(ATS、ERS、RSNA)历年均有 COPDGene 专场或卫星会;COPD Foundation 产业委员会为长期续期(Phase 4)提供了联邦经费之外的持续支持。

§8.7 生态快照

资源 类型 链接 状态(截至 2026-09) 推荐理由
COPDGene 官网 研究主页 copdgene.org 活跃 协议、文档、FAQ 一站式入口
COPD Foundation 项目页 机构页 copdfoundation.org 活跃 研究亮点与出版列表
dbGaP phs000179 数据仓库 NCBI dbGaP v7.p2 表型 + 基因型主入口
dbGaP phs000951 数据仓库 NCBI dbGaP v6.p5 TOPMed WGS(Freeze 9b/10b)
Emory 配准参考集 基准数据 Emory DIR Lab 可申请 配准算法定量验证
DRAM 代码 开源代码 GitHub 公开 肺气肿亚型弱监督实现

§9 相关资源与引用

§9.1 官方资源列表

  • 官方研究网站(协议、Phase 1/2 文档、FAQ、出版物列表):copdgene.org
  • COPD Foundation 项目页(研究亮点、Phase 3/4 动态):COPDGene.aspx
  • dbGaP 主研究(表型 + 芯片基因型,v7.p2):phs000179
  • dbGaP TOPMed WGS(Freeze 9b/10b):phs000951
  • ClinicalTrials.gov 注册:NCT00608764
  • 形变配准参考数据集(Emory DIR Lab):COPDgene reference data
  • 影像获取(ANC 提案):联系 COPDGene Administrative Core(执行秘书,见 Nature Scientific Reports 2023 数据可用性声明示例)

§9.2 BibTeX 引用块

@article{regan2010copdgene,
  author  = {Regan, Elizabeth A. and Hokanson, John E. and Murphy, James R. and Make, Barry
             and Lynch, David A. and Beaty, Terri H. and Curran-Everett, Douglas
             and Silverman, Edwin K. and Crapo, James D.},
  title   = {Genetic epidemiology of {COPD} ({COPDGene}) study design},
  journal = {COPD: Journal of Chronic Obstructive Pulmonary Disease},
  volume  = {7},
  number  = {1},
  pages   = {32--43},
  year    = {2010},
  doi     = {10.3109/15412550903499522}
}

@article{cho2014riskloci,
  author  = {Cho, Michael H. and McDonald, Merry-Lynn N. and Zhou, Xiaobo and Mattheisen, Manuel
             and Castaldi, Peter J. and Hersh, Craig P. and DeMeo, Dawn L. and Sylvia, Jody S.
             and Ziniti, John and Laird, Nan M. and Lange, Christoph and Litonjua, Augusto A.
             and Sparrow, David and Casaburi, Richard and Barr, R. Graham and Regan, Elizabeth A.
             and Make, Barry J. and Hokanson, John E. and Lutz, Sharon and Dudenkov, Tanda Murray
             and Farzadegan, Homayoon and Hetmanski, Jacqueline B. and Tal-Singer, Ruth
             and Lomas, David A. and Bakke, Per and Gulsvik, Amund and Crapo, James D.
             and Silverman, Edwin K. and Beaty, Terri H.},
  title   = {Risk loci for chronic obstructive pulmonary disease: a genome-wide association study and meta-analysis},
  journal = {The Lancet Respiratory Medicine},
  volume  = {2},
  number  = {3},
  pages   = {214--225},
  year    = {2014}
}

@article{lowe2019copdgene2019,
  author  = {Lowe, Kendra E. and Regan, Elizabeth A. and Anzueto, Antonio and Austin, John H. M.
             and Barr, R. Graham and Beaty, Terri H. and Bowler, Russell P. and Crapo, James D.
             and Curtin, John J. and DeMeo, Dawn L. and Dransfield, Mark T. and Lynch, David A.
             and Silverman, Edwin K. and Make, Barry J.},
  title   = {{COPDGene} 2019: Redefining the Diagnosis of Chronic Obstructive Pulmonary Disease},
  journal = {Chronic Obstructive Pulmonary Diseases: Journal of the COPD Foundation},
  volume  = {6},
  number  = {5},
  pages   = {384--399},
  year    = {2019},
  doi     = {10.15326/jcopdf.6.5.2019.0149}
}

§9.3 引用指南

  • 引用数据集本体:Regan 2010(研究设计)+ 明确所用 dbGaP 版本(如 phs000179.v7.p2)与 TOPMed Freeze(如 Freeze 10b)。
  • 引用遗传发现:Cho 2014(元分析)与 Sakornsakolpat 2019(扩展图谱)。
  • 引用诊断框架:Lowe 2019(COPDGene 2019)。
  • 引用影像方法:标注所用定量软件(VIDA/Thirona/Chest Imaging Platform)与协议来源(Regan 2010 附录)。
  • 引用纵向结局:说明所用访视(Phase 1/2/3)与结局定义(如 5 年 FEV1 丢失 > 350 ml;LFU 加重事件)。
  • 引用本 Wiki:千方病案医数集条目仅作导航与教学引用,实验复现仍以原始论文与 dbGaP 文档为准。

§9.4 常见问题速答

问题 速答
影像能直接从 dbGaP 下载吗 不能。dbGaP 分发表型与基因型;胸部 CT 影像需向 COPDGene Administrative Core 提交 ancillary study proposal
有公开的子集可先用吗 Emory 形变配准参考集(10 对吸气-呼气 CT + landmark)填表即可获取,适合先做管线开发
需要 CITI 培训吗 dbGaP 走 DUC + 机构签署 + IRB 路线,具体培训要求以本机构合规部门为准
GWAS 用芯片还是 WGS 新研究建议直接用 TOPMed Freeze(GRCh38)并配套官方方法文档
%LAA-950 能跨 Phase 直接比吗 Phase 1/2 之间经 kernel 对齐可比;Phase 3 低剂量数据需噪声校准(1,508 人双剂量扫描可作桥接)
PRISm 样本能用吗 能,且是研究热点;但标签须按访视重判(见坑点 5)

§10 AI 使用声明卡

§10.1 AI 模型列表

模型 版本/访问日期 用途
大语言模型(长文本生成与结构化) CodeBuddy Code,2026-09 本页文献综合、结构与代码草稿生成

§10.2 AI 参与范围

AI 用于:检索结果综合、章节组织、代码示例草拟、表格整理与语言润色。AI 不用于:事实核验的最终裁决(所有硬数字回溯检索来源)、医学判断与编码映射的裁定(由编辑部审核)。

按章节的参与边界:§1-§5 与 §7-§8 为"AI 起草 + 编辑部逐数字溯源复核";§6 代码为"AI 起草 + 工程师静态走查"(因数据 controlled access 未能端到端重跑,见 §10.5);§0 免责与 §10 声明卡为编辑部模板,AI 仅做排版;frontmatter 与 §C JSON-LD 由管线从同一数据源生成,二者内容一致。

§10.3 输入来源列表

  1. Regan EA, et al., 2010, COPD. DOI 10.3109/15412550903499522
  2. Cho MH, et al., 2014, Lancet Respir Med(NIEHS 收录页)
  3. Lowe KE, et al., 2019, Chronic Obstr Pulm Dis. DOI 10.15326/jcopdf.6.5.2019.0149
  4. dbGaP phs000179 研究页(NCBI)
  5. dbGaP phs000951(NHLBI TOPMed: COPDGene)研究页
  6. NCPI Dataset Catalog(phs000179 / phs000951 条目)
  7. COPD Foundation COPDGene 项目页
  8. Columbia CIC 资助摘要(Phase 4,#75N92023D00011)
  9. DIAG Nijmegen 团队(通讯作者 B. van Ginneken), 2023, Scientific Reports. DOI 10.1038/s41598-023-40116-6
  10. COPDGene Investigators, 2021, Radiology: Cardiothoracic Imaging. DOI 10.1148/ryct.2021200477
  11. COPDGene Investigators, 2022, Radiology. DOI 10.1148/radiol.222786(10 年肺气肿进展)
  12. Eur Radiol, 2015, DOI 10.1007/s00330-015-3824-y(kernel 归一化)
  13. Respir Res, 2018, DOI 10.1186/s12931-018-0771-6(PMA 与 CT 协议细节)
  14. Emory DIR Lab COPDgene 参考数据集页面
  15. PMC6775891(Genetic Advances in Obstructive Pulmonary Disease 综述,含 Zhou 遗传度)
  16. Ann Am Thorac Soc(COPDGene PRISm 纵向表型与死亡,eScholarship 全文)

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
§1 概览与规模数字 千方病案医学编辑部 与 dbGaP/资助文件逐项比对 ✅ 已通过/已验证
§2 医学背景(ICD-11/SNOMED) 千方病案医学编辑部 编码表双人核对 ✅ 已通过/已验证
§3-§4 规格与数据结构 医疗 AI 数据工程师 与协议论文/数据字典比对 ✅ 已通过/已验证
§6 代码与坑点 医疗 AI 数据工程师 代码静态走查 + 文献对齐 ✅ 已通过/已验证
§7-§8 质量与基准 医疗 AI 数据工程师 数字逐条溯源 ✅ 已通过/已验证
§9-§10 引用与声明 千方病案医学编辑部 BibTeX 字段校对 ✅ 已通过/已验证

§10.5 AI 生成章节标注

全部章节由 AI 起草、人工复核后发布;其中 §6.3-§6.4 代码块与 §6.5 坑点为 AI 基于 §10.3 来源综合整理,未经端到端在真实数据上重跑(数据受 controlled access 限制)。

§10.6 最后人工审核日期

2026-09-05(与 §0 审核声明一致)

页面状态:published(全部内容已完成审核并发布)


§C 机器可读元数据(JSON-LD)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • chest-imagenome — 共享标签:医学影像 / 电子健康记录 / X光影像 / 队列研究
  • oai — 共享标签:医学影像 / 电子健康记录 / 队列研究
  • chest-ct-sepsis-er — 共享标签:医学影像 / 电子健康记录
  • rosmap — 共享标签:医学影像 / 电子健康记录 / 队列研究
  • nifd — 共享标签:医学影像 / 电子健康记录 / 队列研究
  • ehrxqa — 共享标签:电子健康记录 / X光影像
  • chexpert — 共享标签:医学影像 / X光影像
  • nih-chestx-ray14 — 共享标签:医学影像 / X光影像
  • mimic-cxr — 共享标签:医学影像 / X光影像
  • health-data-nexus — 共享标签:医学影像 / 电子健康记录

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集