China Kadoorie Biobank — 中国慢性病队列 AI-Ready Wikipedia | 千方病案医数集

全球最大中国人群前瞻队列 · 51.2 万参与者 · 随访近 20 年

来源 牛津大学人口健康系 & 北京大学公共卫生学院 & 中国医学科学院 url: https://www.ckbiobank.org/发布时间: 2026-09-06最后更新: 2026-09-06 阅读 12

信息速览

数据集名称China Kadoorie Biobank — 中国慢性病队列 AI-Ready Wikipedia | 千方病案医数集
数据类型512,891 名参与者,10 地区(5 城 5 乡),随访近 20 年,10 万人基因分型,申请审核获取,中国大陆/香港学术免费
规模51.2 万名参与者
接入方式牛津大学人口健康系 & 北京大学公共卫生学院 & 中国医学科学院 url: https://www.ckbiobank.org/
AI 就绪度

数据集封面

China Kadoorie Biobank — 中国慢性病前瞻队列 AI-Ready Wikipedia


INFOBOX

数据集名称 China Kadoorie Biobank(CKB)
英文全称 China Kadoorie Biobank;曾用名 Kadoorie Study of Chronic Disease in China(KSCDC)
别名/简称 CKB、中国慢性病前瞻性研究、中国卡杜里生物库、嘉道理生物银行
疾病分类 慢性病全疾病谱。核心映射:BA40–BA6Z 缺血性心脏病 / 8B10–8B12 卒中 / 5B55 2 型糖尿病 / CA22 慢性阻塞性肺疾病 / 2C25 肺恶性肿瘤 / GB61 慢性肾脏病
SNOMED CT 22298006 Myocardial infarction / 230690007 Cerebrovascular accident / 44054006 Diabetes mellitus type 2 / 13645005 Chronic obstructive lung disease / 38341003 Hypertension(详见 §2.2)
数据模态 结构化(问卷 + 体格测量)、时序(随访事件流)、基因组、生物样本
AI 任务类型 生存分析、风险预测(Cox/ML)、GWAS 与多基因风险评分、孟德尔随机化、回归预测、聚类
样本总数 512,891 名参与者(基线)/ 100,706 人全基因组基因分型 / 随访结局事件 >120 万条(截至 2022,官方披露)
数据大小 无固定发布包——个体级数据按获批变量清单定制生成;PheWeb GWAS 汇总统计开放下载
数据格式 CSV / SAS / SPSS / R(交付可选)/ PLINK 与 VCF(基因数据,经 RAP)
许可证 CKB Data Access Agreement(申请审核制研究用途协议)
访问级别 申请审核(CDAS 注册 → 计划书评审 → 签署 DAA;中国大陆/香港学术免费,海外 £2,500/项目)
DUO 标签 HMB, NPUNCU, IRB, GS(GS:中国人类遗传资源跨境管制)
语言 中文(问卷与原始采集)/ 英文(数据字典与文档)
首发日期 2005(KSCDC 队列论文,IJE 34:1243-1249)/ 2011(CKB 队列论文,IJE 40:1652-1666)
最后更新 持续随访中;当前开放结局数据截点 2019-01-01,2019-2024 结局将陆续释放
发布机构 牛津大学纳菲尔德人口健康系(NDPH)/ 北京大学公共卫生学院 / 中国医学科学院
官方主页 https://www.ckbiobank.org/
下载地址 https://www.ckbiobank.org/CKBDataAccess/(申请入口)/ https://pheweb.ckbiobank.org/(开放 GWAS 汇总统计)
DOI 10.1093/ije/dyr120(2011 队列论文)/ 10.1093/ije/dyi174(2005 KSCDC 论文)
引用次数 1,094(Dimensions,截至 2026-09;2011 队列论文单篇口径)
AI 就绪度评分 ⭐⭐⭐(3/5)— 数据结构化程度高、文档完整、结局事件 ICD-10 编码规范;扣分项:申请周期 3-6 个月、无官方 ML 划分、无社区加载工具、个体级基因数据跨境受限
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(慢性病 ICD-11/SNOMED CT 映射、临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与牛津大学、北京大学、中国医学科学院及 Kadoorie Charitable Foundation 无任何商业利益关联。本页面不代理 CKB 数据申请,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。CKB 要求研究者通过 CKB Data Access System 提交申请并签署 Data Access Agreement;涉及中国人类遗传资源(含基因数据)的使用须额外遵守中国《人类遗传资源管理条例》及科技部相关审批/备案程序。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

China Kadoorie Biobank(CKB,中国慢性病前瞻性研究) 是牛津大学、北京大学与中国医学科学院于 2004-2008 年联合建立的超大规模前瞻性队列:在中国 5 个城市与 5 个农村地区招募了 512,891 名 30-79 岁成人,采集了问卷、体格测量和血液样本,并通过死亡登记、疾病登记与全国医保数据库联动随访至今,已累积超过 5 万例死亡和 120 万条住院事件。

它的独特价值在于用西方生物银行的工程标准研究中国人群:当 UK Biobank 覆盖英国白人时,CKB 回答了"吸烟、饮酒、膳食、空气污染对中国人慢性病的影响"这一全球公共卫生的关键缺口——NEJM 的新鲜水果研究、Lancet 的饮酒孟德尔随机化研究都直接改写了膳食与饮酒指南的证据基础。同时,10 万人的定制芯片基因分型使其成为东亚人群 GWAS 与孟德尔随机化的核心资源。

你可以用它来:做中国人群慢性病的生存分析与风险预测、在东亚人群中验证欧洲发现的基因-疾病关联、用 ALDH2/ADH1B 等工具变量做孟德尔随机化因果推断、或者与 UK Biobank 做跨人群比较研究。

§1.1 摘要

CKB 于 2002 年经原卫生部批准立项,由香港嘉道理慈善基金会等资助,中英双方团队共同设计。基线调查(2004-06 至 2008-07)在 10 个地理定义明确的地区通过居民名册逐户邀请,招募 512,891 名成人(男性 41%、农村 56%、平均年龄 51.5 岁),完成 interviewer 电子化问卷(生活方式、膳食频率、病史、家族史、女性生殖史)、标准化体格测量(血压、肺功能、握力、人体测量、现场随机血糖与乙肝表面抗原快速检测)和 10 mL 血液采集(成功率 99.98%,血沉棕黄层与血浆分存北京与牛津)。随访采用全被动联动设计:死亡登记(CDC 死亡证明,ICD-10 编码)、四大疾病登记(卒中、缺血性心脏病、糖尿病、癌症)与全国医保数据库(任何住院事件)三源互补。此外每 4-5 年从存活者中随机抽取约 5% 进行重复调查(2008、2013-14、2020-21,第三次含腕戴加速度计)。2012 年起开展基因分型:先以 Illumina Golden Gate 384-SNP panel 检测约 10 万人,再定制华人优化的 Affymetrix Axiom 芯片(803,030 变异)分型 100,706 人,填充至 5,000 万+ 变异,并完成约 1 万人全基因组测序参考面板。数据经 CKB Data Access System 申请开放,GWAS 汇总统计在 PheWeb 完全开放。

§1.2 战略价值分析

人群代表性维度:全球大型生物银行长期由欧洲裔人群主导——这一失衡本身就是被 Nature Genetics 反复批评的健康不平等根源(Martin et al. 2019 指出欧洲裔 PRS 直接迁移会加剧健康差距)。CKB 以 51.2 万东亚人群规模填补了这一空白:中国汉族特有的暴露谱(男性 74% 吸烟率、烈酒文化、辣食、饮茶、室内空气污染、1959-61 饥荒出生队列)与疾病谱(卒中负担远高于心梗、出血性卒中占比约 30%、肝癌与食管癌高发)使其成为研究"在西方罕见或不存在暴露"的唯一可行平台。ALDH2-rs671 与 ADH1B-rs1229984 这两个在东亚高频、在欧洲近乎缺失的酒精代谢基因变异,更使 CKB 成为全球酒精因果研究的天然实验场。

方法学示范维度:CKB 证明了在医保体系快速演变的中等收入国家也能建成"登记系统联动"型队列——三源联动(死亡登记 + 疾病登记 + 医保住院)以极低成本实现了近 20 年全事件捕获,这套设计被后续多个中国队列沿用。其"中英双团队 + 双样本库(北京/牛津)+ 统一数据字典"的治理结构,以及在《人类遗传资源管理条例》框架下探索"数据不出域 + 云端 RAP"的共享路径,为跨境大队列合规协作提供了现实样本。

证据产出维度:CKB 的研究直接进入了顶级临床证据链——NEJM 2016 新鲜水果与心血管(HR 0.60)、BMJ 2015 辣食与死亡(风险降 14%)、Lancet 2019 与 Lancet Public Health 2023 饮酒系列(以孟德尔随机化推翻"适量饮酒保护"假说)均发表于四大医学期刊,并多次被国际膳食与饮酒指南引用。对 AI 研究者而言,CKB 提供的不是又一个人群,而是一个暴露-结局因果关系已被大量先验知识锚定的验证场——在这里训练的风险模型可以直接对照数十万字的流行病学文献进行 sanity check。

§1.3 横向对比

数据集 参与者 地区/人群 随访方式 基因数据 核心差异化
CKB 512,891 中国 10 地区(5 城 5 乡) 死亡/疾病登记 + 医保住院联动 10.07 万人芯片 + 1 万人 WGS 面板 东亚暴露谱;酒精代谢基因天然实验;非代表性但地区内低选择
UK Biobank 502,000+ 英国(40-69 岁) NHS 住院/死亡/癌症登记联动 + 影像/加速度计增强 全队列芯片 + 50 万 WES + 20 万 WGS 开放度与工具生态全球最佳;RAP 云平台成熟
FinnGen 500,000+ 芬兰 全国登记系统全覆盖 全队列芯片 芬兰人群遗传隔离优势;药企联盟驱动
Taiwan Biobank 150,000+ 中国台湾 健保登记联动 芯片 东亚对照;规模较小
CHARLS 17,000+ 中国全国代表性抽样(45+ 岁) 面对面追踪 部分 全国代表但规模小;老年健康与社会经济
All of Us 400,000+ 美国(重视少数族裔) EHR + 问卷 + 可穿戴 全队列 WGS 进行中 族裔多样性设计;云端工作台

CKB 的不可替代性在三点:东亚人群规模最大的血液前瞻队列之一、覆盖 UK Biobank 缺失的暴露谱(烈酒、辣食、室内空气污染、饥荒经历)、以及 ALDH2/ADH1B 工具变量支撑的酒精因果推断。短板同样明确:无影像模态、无全国代表性、个体级数据获取摩擦显著高于 UK Biobank。

§1.4 版本演进时间轴

时间 事件
2002 项目经原卫生部批准立项(Kadoorie Charitable Foundation 资助),原名 KSCDC
2004-06-25 基线调查启动(甘肃天水为首个地区)
2005 KSCDC 队列论文发表(Int J Epidemiol 34:1243-1249,DOI: 10.1093/ije/dyi174)
2008-07-15 基线调查完成,累计 512,891 名参与者
2008-06~10 第 1 次重复调查(约 2 万人,应答率 80%)
2011-09-21 CKB 队列论文在线发表(Chen et al., IJE 40:1652-1666,DOI: 10.1093/ije/dyr120)
2012-2013 Illumina Golden Gate 384-SNP panel 分型约 10 万人
2013-08~2014-09 第 2 次重复调查(约 2.5 万人)
2015 BMJ 辣食研究(351:h3942)发表,引发全球媒体关注
2015-2016 定制 Axiom CKB 芯片(803,030 变异)完成 100,706 人分型
2016-04 NEJM 新鲜水果与心血管研究(374:1332-1343)
2017 Lancet Diabetes Endocrinol 新鲜水果与糖尿病研究;截至 2017-01-01 累积约 4.5 万死亡、约 100 万条住院事件
2019-05 Lancet 饮酒与血管病研究(传统 + 遗传证据,393:1831-1842)
2020-08~2021 第 3 次重复调查(含腕戴加速度计 >2 万人;受 COVID-19 影响分地区调整)
2023-11 Lancet Public Health 饮酒与死因别死亡研究(8:e956-e967)
2023 Cell Genomics 基因分型与人群特征论文;CKB PheWeb 开放 GWAS 汇总统计;CKB RAP 云平台试点启动
2024-2026 2019-2024 结局数据完成收集处理,将陆续释放;多组学(蛋白组、代谢组、病原血清学)嵌套检测持续推进

§1.5 典型 AI 应用场景

  1. 慢性病生存分析与风险预测:以基线暴露预测 10 年以上卒中、心梗、糖尿病、癌症等 ICD-10 编码结局,构建中国人群特异的 Cox/ML 风险评分。
  2. 孟德尔随机化因果推断:利用 ALDH2-rs671、ADH1B-rs1229984 等东亚高频工具变量评估酒精、血脂、代谢物的因果效应,规避观察性研究混杂。
  3. GWAS 与多基因风险评分:在 10 万华人芯片数据上发现/验证东亚位点,构建中国人群 PRS 并评估跨族群迁移性。
  4. 跨人群比较研究:与 UK Biobank/FinnGen 平行建模,检验风险因素效应在不同祖先人群间的一致性与异质性。
  5. 嵌套病例对照 biomarker 研究:在特定疾病(卒中、COPD、肝癌)病例-对照子集中整合蛋白组、代谢组、病原血清学,做疾病机制与早期标志物挖掘。

§2 医学背景

§2.1 ICD-11 疾病分类锚定

CKB 覆盖成人慢性病全疾病谱——随访事件按 ICD-10 编码(死亡登记与医保联动体系的官方编码),研究中最常见的结局到 ICD-11 的映射如下:

CKB 高频结局(ICD-10 口径) 中文名称 ICD-11 对应 队列中的流行病学锚点
I20-I25 缺血性心脏病 BA40–BA6Z 缺血性心脏病(BA41 急性心肌梗死) NEJM 2016:2,551 例主要冠脉事件(3.2M 人年)
I60-I69 卒中 8B10 缺血性卒中 / 8B11 脑出血 / 8B12 蛛网膜下腔出血 NEJM 2016:14,579 缺血性卒中 + 3,523 脑出血;中国出血性占比约 30%,远高于西方
E10-E14 糖尿病 5B55.Z 2 型糖尿病 基线患病 5.9%(30,300 人);7.2 年新发 9,504 例
J40-J44 慢性阻塞性肺疾病 CA22 慢性阻塞性肺疾病 Eur Respir J 2021 肺功能 GWAS 表型来源
C15-C26 消化道恶性肿瘤 2C00–2C0Z 食管 / 2C12 肝 / 2C16 胃恶性肿瘤 中国肝癌、食管癌负担全球最高;HBV 感染背景
I10 原发性高血压 BA00 原发性高血压 基线平均血压 132/79(男)、130/77(女),治疗率低
N18 慢性肾脏病 GB61 慢性肾脏病 糖尿病血管并发症嵌套研究对象

编码衔接要点:CKB 结局事件为纯 ICD-10 编码(中国疾控死亡登记系统与医保结算体系的现行标准),与 ICD-11 的映射经 WHO 官方对照表完成;暴露侧的"自报疾病史"为问卷文本结构化变量,不含 ICD 编码——构建队列时应以 ICD-10 事件记录为准、自报史仅作基线剔除依据。

§2.2 SNOMED CT 映射

临床场景 ICD-10 ICD-11 SNOMED CT SNOMED CT 术语
急性心肌梗死 I21 BA41 22298006 Myocardial infarction (disorder)
缺血性卒中 I63 8B10 422504002 Cerebral infarction (disorder)
脑出血 I61 8B11 274100004 Cerebral hemorrhage (disorder)
2 型糖尿病 E11 5B55.Z 44054006 Diabetes mellitus type 2 (disorder)
原发性高血压 I10 BA00 38341003 Hypertension (disorder)
慢性阻塞性肺疾病 J44 CA22 13645005 Chronic obstructive lung disease (disorder)
恶性肿瘤(总) C00-C97 2B50–2E2Z 等 363346000 Malignant neoplastic disease (disorder)
慢性乙型肝炎感染 B18 1E51.Z 66071002 Type B viral hepatitis (disorder)

§2.3 疾病背景简介

CKB 面向中国成人慢性非传染性疾病全谱。中国正处于流行病学转型深水区:卒中、缺血性心脏病、慢性阻塞性肺疾病与肺癌位居死因前列,且呈现与西方截然不同的模式——卒中负担远高于心梗、出血性卒中占卒中比例约 30%(西方约 10-15%)、肝癌与食管癌发病率全球最高、糖尿病患病率快速攀升但知晓率与控制率低。基线时全队列平均血压 132/79 mmHg(男),平均 BMI 仅 23.4-23.8 kg/m²、肥胖率 4%,提示中国人群在"低肥胖"表型下即出现高血管风险——这正是 CKB 证据对全球指南构成增量价值的流行病学背景。

§2.4 临床任务定义

AI 任务 临床/流行病学定义 标准参考 在 CKB 中的操作化
全因死亡预测 随访期内全因死亡 死亡登记(CDC 死亡证明) ICD-10 根本死因 + 死亡日期;12 年累积 56,550 例
病因别死亡 卒中/CVD/癌症/肝病等死因 ICD-10 编码 Lancet PH 2023:死因别 HR 体系
新发疾病事件 首次住院或登记的新发病例 疾病登记 + 医保住院记录 ICD-10 三位/四位码聚合;当前释放截点 2019-01-01
糖尿病事件 新发糖尿病 + 基线糖尿病血管并发症 登记/住院 + 基线筛查 Lancet D&E 2017:新发 9,504 例;基线 30,300 例中 9,746 大血管、1,345 微血管事件
卒中亚型 缺血性 vs 出血性 影像确认(卒中几乎均有 CT/MRI) 嵌套病例对照按亚型抽样分型
孟德尔随机化 基因工具变量 → 暴露 → 结局 ALDH2/ADH1B 等 基因型预测暴露量 → Cox HR(Lancet PH 2023 范式)

§2.5 患者人群特征

维度 特征
数据来源 10 个地理定义地区:城市(哈尔滨、青岛、苏州、柳州、海口)+ 农村(甘肃天水、河南辉县、四川彭州、湖南浏阳、浙江桐乡);通过居民名册逐户邀请
采集时间 基线 2004-06-25 至 2008-07-15;随访持续至今(当前开放结局截点 2019-01-01)
规模 512,891 名参与者
年龄 30-79 岁入组;平均 51.5 岁(SD 10.7)
性别 男性 41% / 女性 59%(Lancet PH 2023 分析集:210,205 男 / 302,519 女)
城乡 农村 56% / 城市 44%
民族/祖先 以中国汉族为主体;基因 PCA 呈明显南北地理结构
吸烟 男性曾规律吸烟 74% / 女性 3%(IJE 2011)
饮酒 男性 33% 每周多数时间饮酒 / 女性约 2%(Lancet PH 2023)
体格 平均 BMI 23.4(男)/ 23.8(女)kg/m²;肥胖(>30)4%;平均血压 132/79(男)、130/77(女)
基线糖尿病 3.2%(IJE 2011 自报口径);5.9%(30,300 人,自报+现场随机血糖筛查,Lancet D&E 2017)
代表性声明 非全国代表性抽样:10 个地区为目的性选择以覆盖发病模式差异;每个地区内参与者相对未选择

§2.6 金标准/参考标准

数据来源 记录方式 产生者 金标准性质
死亡及死因 地区 CDC 死亡证明系统,按 WHO ICD-10 编码根本死因 各地区疾控中心登记系统 客观事件,覆盖全队列;个别地区死因编码质量参差
非致死事件(4 大疾病) 卒中、缺血性心脏病、糖尿病、癌症专项登记 地区疾病登记系统 登记质量经 CKB 团队定期核查
住院事件(全病种) 全国医保数据库电子记录联动 城镇职工/居民医保与新农合系统 覆盖任何住院;门诊不覆盖;2009 年前后农村覆盖率爬坡
基线问卷 interviewer 电子化问卷(笔记本电脑现场录入,内置逻辑校验) 经统一培训的专职调查员 自报信息,存在回忆与社会期许偏倚
体格测量 标准化设备定期校准,统一操作规范 各地区调查点专职技术人员 定量测量;含现场随机血糖与 HBsAg 快速检测
血液样本 10 mL 静脉血,平均 10.6 小时内处理,低温长期保存 北京/牛津双样本库 采集成功率 99.98%;冻存周期近 20 年
基因分型 定制 Axiom 芯片 + 重复样本质控(一致性 99.9%) CKB 遗传团队(牛津) QC 失败率 2.5%;报告性别与遗传性别不符率 0.1%

伦理与知情同意:研究经牛津大学、中国疾控中心、中国医学科学院及全部参与地区伦理委员会批准,全部参与者签署书面知情同意(涵盖长期随访联动与未来样本检测)。


§3 数据集规格

§3.0 版本抉择矩阵

CKB 不存在传统意义的"版本号",但存在四种获取粒度,选择哪一种直接决定你的研究形态。30 秒选型:

你的需求 推荐途径 规模 理由
快速做 GWAS 汇总层面分析、PRS 构建、跨队列 Meta CKB PheWeb 开放汇总统计 全基因组 summary stats 完全开放、免申请、即下即用;适合方法学开发与二次分析
个体级流行病学分析(生存分析、风险预测) CDAS 开放数据申请(基线 + 重复调查 + 结局事件至 2019-01-01) 512,891 人 × 获批变量 覆盖绝大多数非遗传课题;中国大陆/香港学术免费
个体级基因-表型联合分析 CKB RAP 云平台(试点)+ 遗传数据申请 100,706 人芯片 + 填充 个体级基因数据受 HGR 条例管制,须中方合作 + 科技部程序;RAP 实现数据不出域分析
生物标志物/组学嵌套研究 合作申请(Collaboration) 各嵌套子集(最多约 2-4 万人) 需 CKB 团队共同作者与课题共建;适合机制研究

一句话结论:先用 PheWeb 零成本验证想法,再决定是否投入 3-6 个月申请个体级数据;凡涉及基因数据,第一天就把中方合作者与 HGR 合规排进计划表。

CKB 与 UK Biobank 获取体验速查(两大生物银行常被同时申请):

维度 CKB UK Biobank
申请平台 CDAS(ckbiobank.org/CKBDataAccess) AMS(ukbiobank.ac.uk
审核周期 注册约 4 周 + 数据申请 6-8 周 + 协议 6-8 周 通常数周至 2-3 个月
费用 中国大陆/香港学术免费;海外 £2,500/项目 分级收费(标准 Tier 约 £3,000-9,000)
交付方式 定制变量 CSV/SAS/SPSS/R 加密下载 Showcase 下载 + RAP 云平台
基因数据 RAP 试点;HGR 跨境管制,须中方合作 全队列开放(芯片/WES/WGS),RAP 成熟
共同作者要求 合作申请需 CKB 团队共同作者;开放申请不需要 不需要
发表审查 投稿无需预审,正式出版前 30 天须提交论文副本 无预审;年度报告即可
衍生数据 项目结束后须返还 CKB 中央库 须回传 UKB 供他人使用

§3.1 模态详细说明

CKB 包含四大数据模态:

  1. 问卷调查(结构化暴露):interviewer 电子化问卷,覆盖人口学、社会经济、吸烟/饮酒/饮茶、12 类食物摄入频率、体力活动、睡眠、精神心理、室内空气污染(烹饪燃料、通风)、个人病史与家族史、女性生殖因素(月经、生育、哺乳、避孕)。全部变量经在线 Data Showcase 检索。
  2. 体格测量(结构化表型):身高、体重、腰臀围、生物电阻抗体脂、血压与心率、肺功能(FEV1/FVC)、握力;现场快速检测随机血糖与乙肝表面抗原(HBsAg)。
  3. 随访事件流(时序结局):三源联动的 ICD-10 编码事件——死亡(根本死因)、四大疾病登记事件、医保全病种住院事件;截至 2022 年官方披露已累积 >5 万死亡、>120 万条住院事件、>5,000 种疾病类型、>3.5 万新发癌症。
  4. 生物样本与组学(分子层):10 mL 基线血液(血沉棕黄层 + 血浆,北京/牛津双库存储);100,706 人 Axiom 芯片基因型(填充至 5,000 万+ 变异)、约 1 万人 WGS 参考面板;嵌套子集的 NMR 代谢组、Olink/SomaLogic 蛋白组、19 种病原体血清学(约 4 万人)与 >4,000 例 HBV 病毒基因组测序。

§3.2 样本量拆分

子集 规模 内容 开放状态
基线调查 512,891 人 问卷 + 体格测量 + 现场快检(2004-2008) ✅ 开放申请
第 1 次重复调查 约 20,000 人 2008 年,25,000 受邀、80% 应答,同基线内容 ✅ 开放申请
第 2 次重复调查 约 25,000 人 2013-08 至 2014-09,内容含增强项目 ✅ 开放申请
第 3 次重复调查 约 5% 存活者(加速度计 >20,000 人) 2020-2021,含腕戴加速度计 7 天数据 陆续释放
死亡事件 >50,000 例(截至 2022 官方披露;12 年随访口径 56,550 例) ICD-10 根本死因 ✅ 至 2019-01-01 截点
住院/发病事件 >120 万条、>5,000 疾病类型(截至 2022 官方披露) ICD-10 编码 ✅ 至 2019-01-01 截点
新发癌症 >35,000 例(截至 2022 官方披露) 癌症登记 + 医保 ✅ 至 2019-01-01 截点
2019-2024 结局 已完成收集处理 同上三源 ⏳ 将陆续释放
SNP panel 93,208 人(QC 后) Illumina Golden Gate 384 位点(2012-2013) 随遗传申请
Axiom 芯片 100,706 人 77,176 人群代表 + 23,542 疾病富集;803,030 变异 RAP 试点
WGS 参考面板 9,950 CKB + 50 1KGP 平均深度 15.41× 填充服务器公开使用
血液生物标志物 各子集最多约 20,000 人 常规生化、感染指标等 ✅ 开放申请
GWAS 汇总统计 全基因组 PheWeb ✅ 完全开放

§3.3 数据格式详情

形态 格式 说明
个体级交付 CSV / SAS / SPSS / R(四选一) 按获批变量清单定制生成,加密链接下载,准备约 1-2 周
数据字典 在线 Data Showcase https://www.ckbiobank.org/datashowcase/ — 字段级检索、分布预览、问卷原文
GWAS 汇总统计 TSV(PheWeb 标准格式) https://pheweb.ckbiobank.org/ — 免申请直接下载
基因型(个体级) PLINK / VCF(RAP 环境内) 芯片原始检出 + 多参考面板填充版本
基因型填充服务 在线填充服务器 https://db.cngb.org/imputation/ — 基于 CKB 单倍型面板,免费

§3.4 存储大小

CKB 无固定发布包,数据体积取决于获批变量数与事件年限。工程规划参考:基线 512,891 行 × 数百变量约数百 MB 至数 GB;全事件表(>120 万条)为百 MB 量级;10 万人芯片 + 5,000 万填充变异的个体级基因数据为 TB 量级(须在 RAP 云环境内分析,不提供打包下载)。

§3.5 标注方式

CKB 无人工标注流程,"标签"来自三条客观链路:

  1. 死亡登记:CDC 死亡证明 → 按 WHO 规则确定根本死因 → ICD-10 编码。
  2. 疾病登记:卒中、缺血性心脏病、糖尿病、癌症四大专项登记,由地区登记系统产出并经 CKB 团队定期质量核查。
  3. 医保住院记录:全国医保数据库电子联动,任何住院事件附带 ICD-10 诊断码与日期。

暴露侧(问卷与体格测量)由统一培训的专职调查员与技术人员按标准操作规范(SOP)采集,电子化问卷内置逻辑校验与范围检查。

参与者 → 基线问卷/测量/血样(2004-2008)
       ├─→ 死亡登记(CDC,ICD-10 根本死因)──────────┐
       ├─→ 疾病登记(卒中/IHD/糖尿病/癌症)────────────┼─→ 结局事件表(ID + ICD-10 + 日期)
       └─→ 医保住院记录(全病种 ICD-10)──────────────┘

§3.6 标注者资质

不适用传统标注者概念。死因编码由各地区疾控系统按 WHO ICD-10 规则完成;疾病登记由地区登记处专职人员维护;CKB 中央团队对事件数据进行程序化核查与抽样复核。基因分型在牛津完成,含 2% 重复样本(一致性 99.9%)、性别一致性检查(不符率 0.1%)与 2.5% 整体 QC 失败率控制。

§3.7 数据采集时间范围

基线:2004-06-25 至 2008-07-15(各地区错时启动,甘肃天水最早)。重复调查:2008(第 1 次)、2013-08 至 2014-09(第 2 次)、2020-08 至 2021(第 3 次,受 COVID-19 影响各地区季节不一致)。随访:持续进行中;当前开放释放结局截点 2019-01-01,2019-2024 结局已收集处理、将陆续释放。

§3.8 地理覆盖

10 个地区横跨中国东西南北:东北(哈尔滨)、华北沿海(青岛)、华东(苏州、桐乡)、华中(辉县、浏阳)、西南(彭州)、西北(天水)、华南(柳州、海口)。选址为目的性设计——优先选择慢病模式差异大、登记系统完善、地方疾控执行力强的地区,而非概率抽样;因此地区间暴露与发病率的巨大异质性是设计特性而非缺陷(IJE 2011 Figure 3 系统展示了 10 地区间教育、吸烟、饮酒、膳食、肥胖的显著差异)。

§3.9 采集设备规格

环节 设备/平台 说明
问卷采集 interviewer 电子化问卷系统(笔记本电脑) 内置逻辑校验、跳转控制与范围检查
体格测量 标准化测量设备,定期校准 身高体重、腰臀围、生物电阻抗体脂、电子血压计、肺功能仪、握力计
现场快检 随机血糖与 HBsAg 快速检测 基线现场完成,用于筛查糖尿病与乙肝感染状态
血液处理 平均 10.6 小时内离心分装 血沉棕黄层 + 血浆分存北京与牛津,长期低温保存
SNP panel Illumina Golden Gate 384 位点,2012-2013
全基因组芯片 Affymetrix(ThermoFisher)Axiom 定制 CKB 芯片 803,030 变异,含 >80,000 功能变异与 HBV 探针,华人优化
WGS MGI DNBSEQ 平台(PE100,350 bp 插入片段) 9,950 CKB + 50 1KGP,平均深度 15.41×
加速度计 腕戴式设备(第 3 次重复调查) 7 天佩戴,>20,000 人

§3.10 深度溯源链

环节 系统/方法 关键转换
1. 人群抽样框 10 个地区居民名册(residential rosters) 逐户邀请 30-79 岁无重大残疾居民;地区为目的性选择
2. 基线采集 地区调查点电子化问卷 + 标准化测量 + 现场快检 + 采血 原始回答/读数 → 结构化变量;血样 → 分装冻存(北京/牛津)
3. 中央整合 CKB 国家协调中心(北京)+ 牛津 NDPH 10 地区数据汇聚、清洗、逻辑核查、统一编码与匿名化
4. 随访联动 CDC 死亡登记 + 四大疾病登记 + 全国医保数据库 以唯一身份标识定期电子匹配 → ICD-10 事件表(含截点管理)
5. 样本检测 Golden Gate → Axiom 芯片 → WGS/组学嵌套检测 DNA 提取 → 基因型检出 → 多参考面板填充(1KGP3/TOPMed/西湖)
6. 开放共享 CDAS 申请制交付 + PheWeb 开放汇总 + RAP 云平台 获批变量清单 → 定制匿名化数据集 → 加密下载/云内分析

§4 数据结构详解

§4.0 目录结构预览

CKB 获批数据为定制交付,目录形态取决于你的变量清单。典型交付结构如下(以 CSV 选项为例):

ckb_project_[申请编号]/
├── baseline_survey.csv            # 基线问卷 + 体格测量(512,891 行 × 获批变量)
├── resurvey_1.csv                 # 第 1 次重复调查(约 2 万行,如获批)
├── resurvey_2.csv                 # 第 2 次重复调查(约 2.5 万行,如获批)
├── outcome_events.csv             # 随访事件表:死亡 + 住院/发病(ID + ICD-10 + 事件日期,截点 2019-01-01)
├── biomarker_subset.csv           # 血液生物标志物嵌套子集(如获批)
├── data_dictionary.xlsx           # 变量名、标签、取值编码、缺失编码说明
├── documentation/                 # 问卷原文、SOP 摘要、释放说明
└── README.txt                     # 交付说明:截点日期、编码约定、引用要求

基因数据(RAP 云环境内):

rap://project-[ID]/
├── genotype/axiom_plink/          # 芯片检出(100,706 人,PLINK bed/bim/fam)
├── imputed/                       # 多参考面板填充(>50M 变异,VCF/BGEN)
├── qc/                            # 样本 QC、亲缘关系、PCA 文件
└── phenotypes/                    # 已联动的表型与结局提取

开放层(无需申请):

pheweb.ckbiobank.org/              # GWAS 汇总统计:按表型组织的 TSV + 曼哈顿图
db.cngb.org/imputation/            # CKB 单倍型面板在线填充服务

§4.1 DAIMS 标准化字段描述表

以下字段名为示意性通用命名——实际变量名以获批交付的 data dictionary 与 Data Showcase 为准。

核心表:baseline_survey(基线)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
participant_id STRING 匿名参与者唯一标识 “P000123456” 全库主键(连接重复调查/事件/基因) 不允许缺失 合成 ID
sex INT 性别 1 分层/交互作用 与遗传性别不符率 0.1% 不允许缺失 1 男 / 2 女
age_at_baseline INT 基线年龄(岁) 52 协变量/风险分层 身份证日期推算 不允许缺失 30-79
region_code INT 10 地区编码 3 地区分层(CKB 分析标配) 不允许缺失 10 个取值
is_urban INT 城乡标识 1 分层/公平性 不允许缺失 0 农村 / 1 城市
education_years INT 最高学历分组 2 社会经济协变量 自报 少量缺失编码 分组变量
smoking_status INT 吸烟状态 2 核心暴露 自报;男性 74% 曾规律吸烟 "不适用/拒答"单独编码 从不/偶尔/曾规律/已戒烟
alcohol_weekly_g FLOAT 每周饮酒量(克,由频率×种类推算) 140.0 连续暴露/MR 表型 自报低估 非饮酒者为 0(结构零) ≥0
tea_daily INT 每日饮茶 1 暴露 自报 少量缺失 0/1
spicy_days_per_week INT 每周吃辣天数 6 暴露(BMJ 2015 变量) 自报 少量缺失 0-7
met_hours_per_day FLOAT 体力活动总量(MET-小时/天) 12.5 连续暴露 自报问卷;女性家务活动被低估 少量缺失 ≥0
systolic_bp FLOAT 收缩压(mmHg,多次测量规范) 132.0 表型/结局 测量规范统一;白大衣效应 少量缺失 生理范围
fev1 FLOAT 一秒用力呼气量(L) 2.4 肺功能表型 设备校准;配合度影响 缺失多因无法完成测试(MNAR) ≥0
bmi FLOAT 体质指数 23.6 表型/暴露 标准化测量 少量缺失 生理范围
random_glucose FLOAT 现场随机血糖(mmol/L) 5.4 糖尿病筛查 非空腹(注意:CKB 无空腹血糖) 快检失败少量缺失 >0
hbsag INT 乙肝表面抗原(现场快检) 0 感染状态/肝癌研究 快检灵敏度限制 少量缺失 0/1
self_reported_diabetes INT 自报医生诊断糖尿病 0 基线剔除/患病定义 知晓率限制 少量缺失 0/1

核心表:outcome_events(随访事件)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
participant_id STRING 参与者标识 “P000123456” 外键 联动匹配误差极低 不允许缺失 合成 ID
event_type INT 事件来源类型 1 区分死亡/登记/住院 三源去重规则 不允许缺失 死亡/登记/住院
icd10_code STRING ICD-10 编码(根本死因或住院诊断) “I63.9” 结局标签 死因编码质量地区参差 不允许缺失 ICD-10 全集
event_date DATE 事件日期 2015-03-12 生存时间计算 登记滞后 不允许缺失 2004 至截点
source_flag INT 数据来源系统 2 质量分层 不允许缺失 编码表

§4.2 标签分布统计

结局/暴露 率/分布 出处
全因死亡(12 年随访) 56,550 例(约 11%) Lancet PH 2023
CVD 死亡(无基线 CVD 者,3.2M 人年) 5,173 例 NEJM 2016
主要冠脉事件 2,551 例 NEJM 2016
缺血性卒中 / 脑出血 14,579 / 3,523 例 NEJM 2016
新发糖尿病(482,591 无基线糖尿病者,7.2 年) 9,504 例(约 2.0%) Lancet D&E 2017
基线糖尿病(自报+筛查) 30,300 例(5.9%) Lancet D&E 2017
新发癌症(截至 2022 官方披露) >35,000 例 牛津 NDPH
每日新鲜水果摄入 18.0%-18.8% NEJM 2016 / Lancet D&E 2017
每周吃辣 6-7 天 约 30%(地区差异极大) BMJ 2015
男性曾规律吸烟 / 女性 74% / 3% IJE 2011
男性每周多数时间饮酒 / 女性 33% / 约 2% Lancet PH 2023

§4.3 关键字段描述性统计

  • 平均随访人年:NEJM 2016 水果研究为 3.2M 人年(约 7 年/人);Lancet PH 2023 酒精研究为 12 年。
  • 地区异质性:IJE 2011 Figure 3 显示主要基线变量在 10 地区间差异巨大(如 ≥6 年教育比例、吸烟率、肥胖率数倍差异)——任何全队列合并分析必须调整地区
  • 重复测量一致性:IJE 2011 报告主要基线变量在重复调查中具有良好重现性,可作回归稀释校正基础。
  • 基因数据:100,706 人 = 77,176 人群代表 + 23,542 疾病富集(卒中、COPD 等);24% 有 ≥1 名一级亲属(农村 28%/城市 18%);PCA 与经纬度强相关。
  • 事件总量(官方披露口径):截至 2017-01-01 约 4.5 万死亡 + 约 100 万条住院(约 1,500 疾病类型);截至 2022 年 >5 万死亡 + >120 万条住院(>5,000 疾病类型)。

§4.4 数据层级关系

participant_id(512,891 人,基线)
  ├─ resurvey_1 / resurvey_2 / resurvey_3(同一 ID,约 5% 存活者重复测量)
  ├─ outcome_events(同一 ID 多条事件:死亡唯一 + 住院/发病多条)
  ├─ genetic_array(同一 ID,100,706 人子集)
  ├─ biomarker / omics subsets(同一 ID,各嵌套子集)
  └─ family links(基因数据内:24% 有 ≥1 名一级亲属同在库中)
  • 高频踩坑:结局事件表为"一人多行"长表——构建生存分析时必须按结局定义(首次特定 ICD-10 事件)+ 截点规则自行汇总为"一人一行"的 time-to-event 结构;CKB 官方论文标准做法是以基线日期为 t=0、首次目标事件为终点、死亡/失访/截点日为删失。
  • 嵌套病例对照结构:生物标志物/组学数据按"病例 + 频数匹配对照"设计抽样(如卒中嵌套研究按地区、年龄、性别、入组时间匹配),直接全子集合并分析会破坏匹配结构。

§4.5 缺失值情况与信息性缺失编码

缺失类型 变量示例 缺失原因 信息性缺失编码 对 AI 的影响
结构零(非缺失) alcohol_weekly_g 非饮酒者 0 = 不饮酒,勿当中位数填充 分布双峰,需分阶段建模(是否饮酒 + 饮多少)
MNAR_能力 fev1、fvc 无法配合肺功能测试者多为高龄/呼吸疾病患者 缺失 ≈ 肺功能差 直接完整案例分析高估人群肺功能
MAR_流程 biomarker 子集变量 仅嵌套子集检测 未检测 ≠ 缺失 子集外不可用;需按嵌套设计权重分析
自报拒答 income、 reproductive 变量 敏感问题 单独"拒答/不适用"编码 拒答本身与社会经济相关,勿简单丢弃
筛查 vs 自报分歧 diabetes 筛查阳性但不知晓 self_reported=0 且 glucose 高 两种糖尿病定义(自报 vs 自报+筛查)患病率差近一倍(3.2% vs 5.9%),必须声明口径
右删失 全部结局 存活/截点(2019-01-01) 无事件记录 生存分析框架处理;勿当中位随访后"无病"二分标签

§5 数据划分与使用建议

§5.1 官方数据划分

CKB 官方不提供 train/validation/test 划分。 队列研究的传统是可解释流行病学(Cox 回归报告 HR),机器学习社区尚未在 CKB 上形成统一基准。这意味着:(1) 与文献比较时,你比较的是效应量方向与量级而非 AUROC 排名;(2) 自建 ML 基准时必须在论文中完整声明队列定义、事件口径与划分规则。

§5.2 推荐划分策略

  1. 按 participant_id 分组随机划分:重复调查与多条事件记录同属一人,必须按人划分而非按行。
  2. 家庭感知划分(基因数据必做):24% 参与者有一级亲属同在库中——随机划分会把兄弟姐妹分到两侧,导致遗传性泄漏。按基因亲缘关系(king/PLINK --rel-cutoff 或官方亲缘文件)构建家庭簇后整簇划分。
  3. 地区分层划分:按 region_code 分层抽样保持 10 地区比例;更严格的泛化测试采用留一地区验证(leave-one-region-out)——在 9 个地区训练、第 10 个地区测试,是 CKB 特有的准外部验证。
  4. 城乡分层:农村 56% / 城市 44%,且暴露谱截然不同,城乡应分别报告性能。
  5. 时间感知验证:以随访截点为轴做"截断-验证"(如用 2015 年前事件训练、2015-2019 事件验证),检验模型对登记系统演变的稳健性。
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit

# df:一人一行(已按结局定义汇总);groups:家庭簇 ID(无亲属者为自身 ID)
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
train_idx, test_idx = next(gss.split(df, groups=df["family_cluster_id"]))
assert not set(df.iloc[train_idx]["family_cluster_id"]) & \
           set(df.iloc[test_idx]["family_cluster_id"])  # 家庭簇零泄漏

§5.3 数据泄漏风险防御

# 泄漏模式 严重程度 防御措施
1 用随访期内(结局后)的重复调查测量预测结局 仅用基线暴露;或严格限定测量时间早于结局时间
2 把基线已患病人群纳入"新发"结局建模(患病率-发病率混淆) 按结局剔除基线自报+筛查患病者(CKB 论文标准做法)
3 家庭簇跨越训练/测试两侧(基因数据) §5.2 家庭感知划分
4 用"全部住院事件"特征预测某病事件(目标事件本身在特征中) 特征事件窗必须严格早于终点事件窗
5 嵌套病例对照子集当作随机样本训练 按匹配结构加权或仅限该设计内分析

§5.4 交叉验证建议

  • 标准:5-10 折按 participant_id(基因分析按家庭簇)分组交叉验证。
  • 地理稳健性:留一地区交叉验证(10 折,每折留一个地区),直接度量模型跨地域可迁移性。
  • 亚群报告:按性别 × 城乡四层分别报告,CKB 文献惯例。

§5.5 外部验证

CKB 训练模型的经典外部验证路径:UK Biobank(跨祖先验证,BMC Medicine 2021 心衰研究即 CKB+UKB 双队列平行设计)、Taiwan Biobank(东亚内部验证)、FinnGen / Biobank Japan(GWAS 汇总层面 meta 与 PRS 迁移)、CHARLS(中国全国代表性队列,检验绝对风险校准)。注意编码差异:UK Biobank 结局含 ICD-10 + 自报 + 手术编码(OPCS),事件定义需逐病种对齐。


§6 AI 就绪指南

§6.0 云端快速启动

零门槛入口 1:CKB PheWeb(免申请)https://pheweb.ckbiobank.org/ 提供已发表 GWAS 的全基因组汇总统计与曼哈顿图,直接下载即可做 PRS 构建、LD 结构比较、跨队列 meta 分析——这是不动用 CDAS 申请就能开始 CKB 研究的最快路径。

零门槛入口 2:在线基因型填充服务器https://db.cngb.org/imputation/ 基于 CKB 单倍型参考面板(9,950 CKB + 50 1KGP,15.41×)提供免费填充服务,上传你自己的芯片数据即可获得华人优化的填充结果。

零门槛入口 3:Data Showcase 在线探查https://www.ckbiobank.org/datashowcase/ 无需注册即可检索全部字段定义与分布预览——写数据申请前先在这里敲定变量清单。

CKB RAP(试点):仿 UK Biobank RAP 的云分析平台,个体级基因与表型数据在云内分析、数据不出域,是 HGR 合规框架下基因数据的主通道;部署进展以官网公告为准。

# 5 分钟上手:下载 CKB PheWeb 汇总统计并画曼哈顿图(示例流程)
import pandas as pd
import matplotlib.pyplot as plt
import numpy as np

# 从 pheweb.ckbiobank.org 下载某表型的 summary statistics TSV 后:
gwas = pd.read_csv("ckb_pheweb_phenotype.tsv.gz", sep="\t", compression="gzip")
gwas["neglog10p"] = -np.log10(gwas["pval"].clip(lower=1e-300))
plt.figure(figsize=(12, 4))
for chrom, sub in gwas.groupby("chrom"):
    plt.scatter(sub.index, sub["neglog10p"], s=2)
plt.axhline(-np.log10(5e-8), color="red", ls="--", lw=1)  # 全基因组显著性阈值
plt.ylabel("-log10(P)"); plt.title("CKB GWAS Manhattan")
plt.show()

§6.1 快速上手(生存分析最小示例)

# ========================================
# CKB 快速上手 — R 生存分析版(获批个体级数据)
# 环境要求: R >= 4.0, survival, data.table
#
# ⚠️ 目录结构预期:
#   ./ckb_project_XXXX/
#   ├── baseline_survey.csv     # 基线(512,891 行 × 获批变量)
#   └── outcome_events.csv      # 事件表(一人多行:ID + ICD-10 + 日期)
#
# 以下流程:构建"新发缺血性卒中(I63)"time-to-event 队列
#   —— CKB 官方论文的标准队列构建范式
# ========================================

library(data.table); library(survival)

base   <- fread("baseline_survey.csv")          # 含 participant_id, sex, age,
                                                # region_code, systolic_bp, smoking_status,
                                                # self_reported_stroke, survey_date ...
events <- fread("outcome_events.csv")           # participant_id, icd10_code, event_date

# 步骤 1:剔除基线已患卒中者(防患病率-发病率混淆,§6.5 坑点 1)
cohort <- base[self_reported_stroke == 0]

# 步骤 2:取每人首次 I63 事件;无事件者以截点(2019-01-01)删失
censor <- as.Date("2019-01-01")
i63 <- events[substr(icd10_code, 1, 3) == "I63",
              .(event_date = min(event_date)), by = participant_id]
cohort <- merge(cohort, i63, by = "participant_id", all.x = TRUE)
cohort[, status := as.integer(!is.na(event_date))]
cohort[, exit_date := fifelse(status == 1L, event_date, censor)]
cohort[, time_years := as.numeric(exit_date - survey_date) / 365.25]

# 步骤 3:地区分层 Cox(CKB 标准做法,§6.5 坑点 3),年龄为时间轴更稳健
fit <- coxph(Surv(time_years, status) ~ systolic_bp + smoking_status +
               sex + strata(region_code), data = cohort)
summary(fit)   # 报告 HR 与 95% CI —— CKB 文献的通用货币

§6.2 数据获取流程

获取方式 入口 规模/费用 流程与周期
GWAS 汇总统计 https://pheweb.ckbiobank.org/ 免费、免申请 直接下载
Data Showcase 字典 https://www.ckbiobank.org/datashowcase/ 免费、免注册 在线检索字段与分布
个体级非遗传数据(开放申请) https://www.ckbiobank.org/CKBDataAccess/ 中国大陆/香港学术免费;海外 £2,500/项目 ① 注册账号(机构邮箱)→ ② 提交研究者注册表 + 简历 + 发表记录(审核约 4 周)→ ③ 提交 Data Request Form:题目/摘要/方法/产出/时间线/伦理/团队/经费/数据安全 + 变量清单(评审 6-8 周,RMC 至少每 2 个月开会,可送外审,争议交独立 Access Committee)→ ④ 签署 DAA(境外与牛津大学签、境内与北京大学医学部签,协议与发票约 6-8 周)→ ⑤ 数据以 CSV/SAS/SPSS/R 加密下载(准备约 1-2 周)
个体级基因数据 RAP 云平台(试点)+ 遗传申请 依项目评估 上述流程 + 中方合作者 + 中国人类遗传资源(HGR)科技部审批/备案程序
生物标志物/组学/样本 合作申请(Collaboration) 依项目评估 先邮件联系 CKB 团队(ckbaccess@ndph.ox.ac.uk)共建课题,需 CKB 共同作者

获批后的持续义务:每 6 个月提交中期进度报告;项目结束前 15 日提交总结报告并返还衍生数据集与分析代码(衍生变量将并入主库供后续研究者使用);投稿无需 CKB 预审,但正式出版前 30 天须向 CKB 提交论文副本审查;项目结束后共享数据须删除或返还。一个申请对应一个项目,新增变量须另行申请。

释放排期惯例:新数据模块完成后,中英 CKB 团队有一段独家使用期,之后中国其他研究者优先 6 个月,随后全球开放。

§6.3 预处理 Pipeline

<details>
<summary><b>点击展开完整的 5 步预处理代码(Python 版,构建 ML 就绪宽表)</b></summary>

# 步骤 1:读取并构建一人一行的时间-事件骨架
import pandas as pd
import numpy as np

base = pd.read_csv("baseline_survey.csv",
                   parse_dates=["survey_date"])
events = pd.read_csv("outcome_events.csv",
                     parse_dates=["event_date"])
CENSOR = pd.Timestamp("2019-01-01")          # 当前释放截点

def first_event(events, prefix3):
    sub = events[events["icd10_code"].str[:3].isin(prefix3)]
    return (sub.groupby("participant_id")["event_date"]
               .min().rename("event_date"))

# 以新发糖尿病(E10-E14)为例
tgt = first_event(events, ["E10", "E11", "E12", "E13", "E14"])
df = base.merge(tgt, on="participant_id", how="left")
df["status"] = df["event_date"].notna().astype(int)
df["exit"] = df["event_date"].fillna(CENSOR)
df["time_years"] = (df["exit"] - df["survey_date"]).dt.days / 365.25

# 步骤 2:基线患病剔除(自报 + 筛查双口径,§6.5 坑点 1)
df["screen_diabetes"] = ((df["random_glucose"] >= 11.1) |
                         (df["self_reported_diabetes"] == 1)).astype(int)
df = df[df["screen_diabetes"] == 0].copy()

# 步骤 3:暴露清洗——结构零与缺失编码区分(§4.5)
df["alcohol_weekly_g"] = df["alcohol_weekly_g"].fillna(0)      # 非饮酒者=0
df["is_drinker"] = (df["alcohol_weekly_g"] > 0).astype(int)
for col in ["education_years", "income"]:
    df[f"{col}_missing"] = df[col].isna().astype(int)          # 拒答作信息性特征
    df[col] = df[col].fillna(df[col].median())

# 步骤 4:地区/城乡分层变量与交互
df["urban"] = df["is_urban"].astype(int)
df = pd.get_dummies(df, columns=["region_code"], prefix="r")

# 步骤 5:导出 ML 宽表(生存标签 + 特征),划分见 §5.2
features = [c for c in df.columns if c.startswith("r_")] + [
    "sex", "age_at_baseline", "bmi", "systolic_bp", "smoking_status",
    "alcohol_weekly_g", "is_drinker", "met_hours_per_day",
    "education_years", "education_years_missing", "urban"]
ml = df[["participant_id", "family_cluster_id", "time_years",
         "status"] + features]
ml.to_parquet("ckb_ml_ready.parquet", index=False)
print(ml.shape, ml["status"].mean())

</details>

工程提示:(1) 结局定义先在 Data Showcase 与 ICD-10 对照表上敲定三位码/四位码粒度,全部卒中(I60-I69)与缺血性卒中(I63)是不同结局;(2) 死亡病例的死因编码与住院诊断编码语义不同,混合使用时在模型中加 source_flag;(3) 若做传统流行病学分析,直接沿用 CKB 论文的协变量集(年龄、性别、地区、教育、收入、吸烟、饮酒、体力活动、BMI 等)保证可比。

§6.4 框架加载

# PyTorch:表格特征 → 离散时间生存模型(一人一行)
import torch
from torch.utils.data import Dataset, DataLoader

class CKBCohort(Dataset):
    def __init__(self, X, t, e):
        self.X = torch.FloatTensor(X)
        self.t = torch.FloatTensor(t)   # time_years
        self.e = torch.FloatTensor(e)   # status (1=event, 0=censored)
    def __len__(self):
        return len(self.e)
    def __getitem__(self, i):
        return self.X[i], self.t[i], self.e[i]

loader = DataLoader(CKBCohort(X_train, t_train, e_train),
                    batch_size=1024, shuffle=True)
# XGBoost 基线:以 5 年新发事件为二分标签(教学口径;正式分析请用生存框架)
import xgboost as xgb

df5 = df[(df["status"] == 0) | (df["time_years"] <= 5)].copy()
df5["y"] = ((df5["status"] == 1) & (df5["time_years"] <= 5)).astype(int)
pos_weight = (len(df5) - df5["y"].sum()) / df5["y"].sum()
dtrain = xgb.DMatrix(df5[features], label=df5["y"])
model = xgb.train({"objective": "binary:logistic", "eval_metric": "auc",
                   "scale_pos_weight": pos_weight,
                   "max_depth": 5, "learning_rate": 0.05},
                  dtrain, num_boost_round=400)
# R 生态:随机生存森林(rsf)—— 右删失数据的 ML 标准路径之一
library(randomForestSRC)
fit <- rfsrc(Surv(time_years, status) ~ ., data = train_df,
             ntree = 500, importance = TRUE)

§6.5 常见坑点

⚠️ 坑点 1:不剔除基线患病者,把"患病率"当"发病率"研究(分类:标签理解)

问题:CKB 基线已有大量慢性病患者(如 30,300 名糖尿病、自报卒中/心脏病/癌症者)。若研究"新发"结局却不剔除基线患病者,估计的是患病状态的关联而非因果方向明确的暴露→发病关联;更严重的是反向因果——已病人群会改变暴露(戒烟、戒酒、少吃辣),使暴露呈现虚假保护效应。

症状:HR 方向与文献相反(如"吃水果增加糖尿病风险");暴露最高组反而事件率最低。

解决:(1) 按目标结局剔除基线自报 + 筛查阳性者(BMJ 2015 辣食研究剔除了基线癌症/心脏病/卒中,剩 487,375 人);(2) 进一步剔除随访前 2 年发生的事件(CKB 论文惯例,压制残余反向因果);(3) 糖尿病等需声明"自报"还是"自报+筛查"口径——两者患病率差近一倍(3.2% vs 5.9%)。

参考:Lv et al. BMJ 2015;351:h3942(队列定义范式);Du et al. Lancet D&E 2017(482,591 人剔除口径)。

⚠️ 坑点 2:单次基线暴露的回归稀释偏倚(regression dilution bias)(分类:评估误用)

问题:血压、膳食、体力活动等暴露仅在基线测一次,个体内随时间波动会使长期暴露-结局关联被系统性低估(向零偏倚)。把 CKB 的 HR 直接与采用重复测量校正的文献比较会得出"CKB 效应偏小"的错误结论。

症状:同一暴露的 HR 比西方队列系统性更接近 1;暴露测量次数越少的变量低估越严重。

解决:利用第 1/2 次重复调查(约 5% 存活者)计算个体内相关系数(ICC),按回归稀释校正法(MacMahon-Peto 法)放大 log HR:校正系数 = 1 / ICC;或在方法学中声明"未校正,效应估计为下限"。

参考:Chen et al. IJE 2011(重复调查设计与重现性评估)。

⚠️ 坑点 3:忽视地区强混杂——10 个地区暴露与发病率差异数倍(分类:偏倚陷阱)

问题:地区同时决定暴露与结局:辣食集中在四川/湖南、男性吸烟率、室内空气污染、饮食结构与各病发病率在 10 地区间呈数倍差异(IJE 2011 Figure 3)。不做地区调整的全队列合并分析会产生严重混杂——吃辣与死亡的关联部分反映的是地区差异。

症状:地区哑变量进入模型后暴露 HR 大幅衰减;某地区单独分析时关联消失或反向。

解决:(1) 标准做法:Cox 模型按 region_code 分层(strata(region_code))或纳入地区哑变量;(2) 更严格:按地区分层报告 HR 并检验地区×暴露交互;(3) ML 模型把地区作为特征,并按 §5.4 做留一地区验证。

参考:Chen et al. IJE 2011 Figure 3;Lancet PH 2023(全模型均调整地区)。

⚠️ 坑点 4:把 CKB 当全国代表性样本外推绝对率(分类:偏倚陷阱)

问题:10 个地区为目的性选择,参与者为受邀自愿者(健康志愿者效应),官方明确"队列非按全国代表设计"。直接用 CKB 计算"中国成人糖尿病患病率"或"全国癌症发病率"会产生不可外推的数字。

症状:算出的绝对率与全国监测数据(如中国 CDC 慢病监测)系统性偏离;城乡合并率对抽样权重敏感。

解决:(1) 只报告相对效应(HR、OR、率差的标准化估计)——CKB 的设计优势在于地区内低选择偏倚,内部对比有效;(2) 需要绝对率时用全国代表性资源(CHARLS、CDC 监测)校准;(3) 报告时引用官方表述:“within each study region, the participants were relatively unselected”。

参考:Atlas of Longitudinal Datasets CKB 页(“Representative sample at baseline? No”);加速度计论文局限性段(PMID 38001522)。

⚠️ 坑点 5:自报生活方式的测量误差与性别失衡亚组功效(分类:标签理解)

问题:吸烟、饮酒、膳食、体力活动均为自报,存在回忆偏倚与社会期许偏倚;且暴露高度性别失衡——女性吸烟 3%、规律饮酒约 2%,女性亚组对多数暴露-结局分析统计功效不足。加速度计验证研究还显示问卷系统性低估女性家务类轻体力活动。

症状:女性亚组 HR 置信区间极宽无法解释;自报体力活动与设备测量结果方向不一致。

解决:(1) 主分析按性别分层报告(CKB 文献惯例);(2) 女性亚组功效不足时改用全人群交互检验而非单独估计;(3) 体力活动优先用第 3 次重复调查的加速度计子集(>20,000 人)做校准;(4) 酒精研究借鉴 Lancet PH 2023 策略:以男性为主分析、女性作基因多效性阴性对照。

参考:Millwood et al. Lancet Public Health 2023;PMID 38001522(设备测量验证)。

⚠️ 坑点 6:医保联动事件的三重陷阱——覆盖率爬坡、门诊缺失、编码粒度(分类:工程陷阱)

问题:(1) 医保住院联动依赖各地医保系统电子化程度,2009 年前后新农合扩面导致早期农村住院事件捕获敏感度偏低且随时间变化;(2) 联动只覆盖住院事件——仅门诊管理的事件(多数高血压、糖尿病常规随访、轻症)不在事件表中;(3) ICD-10 三位码与四位码混用,"I64(未分型卒中)"占比不可忽视,直接把 I64 当缺血性卒中会错分亚型。

症状:早期农村事件率异常低、随年份陡升;按亚型汇总的卒中数与文献对不上;结局为"糖尿病"时捕获的多为严重/住院病例,发病率被低估。

解决:(1) 敏感性分析限定 2010 年后起始随访;(2) 结局定义明确声明"住院事件口径",与登记系统(4 大疾病登记含非住院)互补使用;(3) 卒中亚型分析仅用有分型编码事件或嵌套影像确认子集,I64 单独处理;(4) 死亡结局优先用死因登记而非住院记录。

参考:IJE 2011 方法段(三源联动设计);MRC 资助摘要(事件捕获说明)。

⚠️ 坑点 7:GWAS 忽视亲缘关系与地区群体结构(分类:工程陷阱)

问题:CKB 中 24% 基因分型参与者有至少一名一级亲属同在库中(农村 28%),32% 有二级亲属;PCA 按招募地区聚类并与经纬度强相关。用普通线性回归做 GWAS 会因亲缘与分层产生基因组膨胀(λ >> 1),假阳性位点成批出现。此外芯片数据由 77,176 人群代表 + 23,542 疾病富集两部分构成,混合分析需校正抽样结构。

症状:QQ 图整体上扬、λ_GC > 1.1;显著位点集中在地区差异 SNP;同一表型在城市/农村子集结果不一致。

解决:(1) 使用亲缘感知的混合模型(SAIGE、BOLT-LMM、fastGWA)而非 PLINK 线性回归;(2) 纳入足够 PCA(官方建议量级 10-20 个)并按地区分层检查;(3) 疾病富集子集按病例-对照设计加权或用 SAIGE 的鞍点校正处理不平衡表型;(4) 家庭内 GWAS(within-family)可进一步控制共享环境混杂。

参考:Walters et al. Cell Genomics 2023(亲缘、PCA 与设计结构);CKB genetic resources 官方页。

⚠️ 坑点 8:低估 HGR 合规周期——基因数据跨境不是技术问题是法规问题(分类:工程陷阱/合规)

问题:中国《人类遗传资源管理条例》(2019-07-01 施行)规定外方不得采集、保藏、向境外提供中国人类遗传资源;利用中国 HGR 开展研究须与中方合作并经科技部审批,HGR 信息对外提供须安全审查与备案。CKB 个体级基因数据受此约束——未经中方合作与审批程序把基因数据拷出境属违规, CKB 数据访问条款亦明确要求独立 Access Committee 审批安全措施。

症状:项目计划中"第 2 个月下载基因数据到海外服务器"完全不可行;纯海外团队申请基因数据被搁置;发表论文因合规问题被要求补充材料。

解决:(1) 第一天就纳入中方合作者(高校/医院),由中方主导 HGR 申报;(2) 优先使用 CKB RAP 云平台——数据不出域、在线分析,绕开跨境传输;(3) 汇总层面研究直接用 PheWeb 开放 GWAS 汇总统计(不涉及个体级数据);(4) 在课题预算中预留 3-6 个月合规周期与中方协作成本。

参考:国务院《人类遗传资源管理条例》(2019);Springer Human Genetics 2018(CKB 国际用户安全要求);ckbiobank.org data access 页(RAP 部署)。

§6.6 数据增强

✅ 安全增强 ❌ 危险增强(禁止)
基于重复调查测量误差模型做暴露模拟(蒙特卡洛回归稀释校正) 对 ICD-10 结局编码做"近义码替换"式标签增强
按地区×城乡×性别分层自助重采样(bootstrap)评估稳健性 SMOTE 类插值生成合成患者(破坏家庭/地区结构,泄漏亲属信息)
时间轴重抽样:改变随访起点做敏感性分析 打乱 participant_id 或家庭簇归属
特征空间缺失模式扰动(拒答→缺失的等价性检验) 把重复调查测量"借给"基线缺失值(时间错位)

§6.7 模型推荐

任务 推荐方法 特征方案 说明
传统流行病学(HR 估计) Cox 比例风险(地区分层 + 年龄时间轴) CKB 论文标准协变量集 与 600+ 篇 CKB 文献可比的唯一选择
10 年风险评分 Cox / Fine-Gray(竞争风险) 基线全部获批变量 死亡作为竞争事件时必须 Fine-Gray
ML 风险预测 XGBoost / 随机生存森林 / DeepSurv §6.3 宽表 + 地区哑变量 与 Cox 头对头比较 C-index,ML 增益通常有限
GWAS SAIGE / BOLT-LMM(亲缘感知) 芯片 + 填充剂量 + PCA §6.5 坑点 7;不平衡表型用 SAIGE 鞍点校正
孟德尔随机化 一阶段基因型预测暴露 → Cox;两样本 MR 用 PheWeb 汇总 ALDH2/ADH1B 等工具变量 Lancet 2019 / Lancet PH 2023 范式
PRS 构建与迁移 PheWeb 汇总统计 + LDpred2/PRS-CS 东亚 LD 参考(CKB/西湖面板) 欧洲权重在 CKB 上衰减明显,需重估

§6.8 计算资源需求

硬件 最小配置 推荐配置
磁盘 50 GB(基线 + 事件 + 派生宽表) 200 GB(多模块 + 嵌套子集)
内存 16 GB 64 GB(事件表连接与宽表特征工程)
GPU CPU 足够(Cox/XGBoost) 1 × 16 GB 显存(深度生存模型)
训练时间 XGBoost 基线 <1 小时(CPU) 全队列深度生存模型数小时
基因分析 不可本地——RAP 云环境 SAIGE 全基因组扫描约数十核·天
云端替代 PheWeb 汇总统计本地即可 RAP(试点)/ CNGB 填充服务器

§6.9 评估指标

from lifelines.utils import concordance_index
from sklearn.metrics import roc_auc_score, brier_score_loss

# 生存模型:C-index(区分度)——CKB 上 ML 风险模型的主指标
c = concordance_index(t_test, -risk_score, e_test)   # 注意 lifelines 约定:低风险=长生存
print(f"C-index: {c:.4f}")

# 固定时点(如 10 年)口径:累积发病 AUC + Brier(校准)
auc = roc_auc_score(y_10y, p_10y)
brier = brier_score_loss(y_10y, p_10y)
print(f"10y AUC: {auc:.4f}  Brier: {brier:.4f}")

社区共识:传统分析报 HR + 95% CI(地区分层 Cox);ML 风险模型报 C-index + 分十分位校准图 + 固定时点 AUC;竞争风险场景(死亡 vs 非致死事件)报 Fine-Gray sub-HR 或累积发病率函数;GWAS 报 λ_GC 与 QQ 图;PRS 报每 SD 增加的 HR 与增量 C-index。所有结果按性别 × 城乡分层报告为 CKB 惯例。

§6.10 MLOps 笔记

  • 截点声明:论文必须声明结局数据截点(当前释放为 2019-01-01)——不同截点的随访人年不可比;2019-2024 结局释放后旧结果需注明所用释放批次。
  • 变量版本:CKB 变量名与释放批次相关,锁定 data dictionary 版本号并随代码归档。
  • 引用规范:按 DAA 要求引用 CKB 队列论文(10.1093/ije/dyr120)并在致谢中声明 “China Kadoorie Biobank collaborative group”;出版前 30 天提交论文副本(§6.2)。
  • 衍生数据回流:项目结束时衍生数据集与代码须返还 CKB——把派生变量写成可复现脚本而非手工产物,回流同时保护自己。
  • 合规红线:个体级数据禁止共享给 DAA 以外人员;基因数据禁止未经授权跨境;RAP 环境内禁止截屏/导出个体级记录。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
非全国代表性 10 个目的性选择地区 + 自愿参加,绝对率不可外推全国 高(对绝对率)/ 低(对相对效应) 只报告相对效应;需要绝对率时用 CHARLS/CDC 监测校准
健康志愿者偏倚 受邀者中更健康、配合度高者更可能入组 基线特征与全国监测对比声明;内部对比仍有效
地区混杂 暴露与结局在 10 地区间均呈数倍差异 地区分层 Cox(CKB 标配)+ 交互检验
反向因果 基线已病人群改变暴露行为 剔除基线患病者 + 剔除随访前 2 年事件
回归稀释偏倚 暴露仅基线单次测量,长期关联被低估 中高 重复调查 ICC 校正;声明效应为下限
自报测量误差 生活方式全自报;社会期许与回忆偏倚 加速度计等客观子集校准;按性别分层
暴露性别失衡 吸烟 74% vs 3%、饮酒 33% vs 2% 中(女性亚组功效不足) 男性主分析 + 女性阴性对照策略;交互检验
事件捕获演变 医保电子化与新农合扩面使早期农村住院捕获偏低 敏感性分析限 2010 年后;登记系统互补
幸存者偏倚(重复调查) 重复调查仅覆盖存活且可联系者(约 5%) 重复测量仅用于校正而非独立队列
基因群体结构 24% 一级亲属 + 地区 PCA 聚类 高(对 GWAS) SAIGE/BOLT-LMM + PCA 校正(§6.5 坑点 7)

§7.2 标注质量评估

标注类型 可靠性 一致性 局限性
全因死亡(死亡登记) CDC 系统统一 个别地区早期漏报;根本死因编码质量参差
死因别死亡(ICD-10) 中高 按 WHO 规则编码 农村死因推断(verbal autopsy 类)比例较高地区精度下降
四大疾病登记事件 CKB 定期核查 仅覆盖卒中/IHD/糖尿病/癌症
医保住院事件 中高 医保结算标准 早期农村覆盖爬坡;门诊缺失;诊断编码粒度不一
体格测量 高(标准化 SOP + 校准) 地区间统一 白大衣效应等测量学固有限制
现场快检(血糖/HBsAg) 中高 统一试剂 随机血糖非空腹,糖尿病筛查须结合口径声明
自报问卷 电子化逻辑校验 回忆/社会期许偏倚;女性体力活动低估
基因分型 高(99.9% 重复一致性) 双平台交叉验证 芯片对罕见变异覆盖依赖填充质量

§7.3 泛化性讨论

场景 失效风险 证据
跨人群(中国 → 欧洲裔) 中高 暴露谱与疾病谱结构性差异(出血性卒中占比、BMI-风险曲线);BMC Med 2021 心衰研究显示欧洲 GWAS 位点仅 2 个在 CKB 显著
跨人群(中国 → 其他东亚人群) Taiwan Biobank/Biobank Japan 提供更近对照;祖先相近但生活方式不同
跨地区(CKB 内部 10 地区) IJE 2011 Figure 3 的地区异质性;NEJM 2016 报告水果-CVD 关联在 10 地区一致——核心暴露关联的地区稳健性已被反复验证
跨时间(2004-2008 暴露 → 当代) 中国生活方式剧变(吸烟率下降、肥胖率上升、外卖饮食);基线暴露反映 2000 年代
跨医疗体系(住院事件口径 → 门诊/基层) 医保联动不含门诊;轻症与筛查管理疾病捕获不全
跨年龄层(30-79 岁 → 青年) 入组即 30+ 岁,青年暴露窗口未覆盖

§7.4 伦理考量

  1. 参与者为普通社区居民,知情同意涵盖长期随访联动与未来样本检测;研究者应尊重其近 20 年的持续贡献。
  2. 数据经牛津大学、中国疾控中心、中国医学科学院及参与地区多层伦理批准;下游使用者须遵守 DAA 与原知情同意范围,用途重大偏离须重新审批。
  3. 基因数据涉及家族信息——24% 参与者有亲属同在库中,任何可能推断亲属健康的分析(如家族性风险评估)需额外谨慎。
  4. 中国人类遗传资源条例框架下,基因数据跨境、对外提供与开放使用均有法定程序;规避程序不仅是协议违约更是法规问题。
  5. 饥荒出生队列(1959-61)等敏感暴露的研究应注意避免对参与地区的污名化表述。

§7.5 公平性评估

from fairlearn.metrics import MetricFrame
from lifelines.utils import concordance_index

def cidx(y, score):
    return concordance_index(y["time_years"], -score, y["status"])

frame = MetricFrame(
    metrics={"C-index": cidx},
    y_true=test_df[["time_years", "status"]],
    y_pred=risk_score,
    sensitive_features=test_df["group"]   # sex × urban 四层:CKB 惯例分层
)
print(frame.by_group)

已知公平性差异:女性亚组因暴露率低(吸烟 3%、饮酒 2%)导致暴露相关模型在女性中功效与稳定性差;农村死亡登记编码质量低于城市,城乡间结局标签噪声不对称;欧洲来源 PRS 在 CKB 人群迁移性显著下降(BMC Med 2021),直接用欧洲权重做中国人群风险分层会系统性失准——这是生物银行时代最重要的算法公平性议题之一(Martin et al., Nat Gen 2019)。

§7.6 数据漂移提示

  • 暴露时代锚定:基线暴露采集于 2004-2008 年——彼时的吸烟率、膳食结构、室内燃料与空气污染水平与 2020 年代差异显著,用 CKB 训练的绝对风险模型部署前需以当代数据重校准。
  • 事件捕获漂移:医保系统 2009-2012 年快速扩面与电子化,住院事件捕获敏感度随时间上升;死因登记质量持续改善——趋势分析须按年份分层。
  • 编码语义漂移:ICD-10 版本与地区编码习惯演变;2019-2024 新释放批次与旧批次拼接时核对编码一致性。
  • COVID-19 冲击:第 3 次重复调查(2020-21)各地区调查季节不一,加速度计等活动数据的地区比较受季节混杂;2020-2022 年住院事件受就医行为改变影响。

§7.7 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 数据为宽格式(每行一个样本/事件) 基线一人一行;事件表一人多行为标准长表
2 有唯一标识符列 participant_id 贯通基线/重复调查/事件/基因
3 无 Unicode 或特殊字符 ⚠️ 编码变量为 ASCII;部分文本字段与字典含中文字符
4 无重复行 中央清洗 + 基因重复样本一致性 99.9% 验证 ID 链路
5 缺失值已识别并编码 §4.5 结构零/MNAR/拒答均有编码约定
6 标签列被明确标识 ⚠️ 无单一标签列——结局为 ICD-10 事件记录,终点由用户定义(队列数据集固有特征)
7 已对罕见类别(<3%)进行分组 ⚠️ >5,000 种疾病事件含大量罕见编码,需自行按 ICD-10 章节聚合
8 偏倚评估已完成 §7.1 列出 10 类偏倚与缓解措施
9 有完整的数据字典 Data Showcase 在线字典 + 交付 data dictionary + 问卷原文
10 对"信息性缺失"有明确编码解释 ⚠️ 核心变量缺失编码已记录;MNAR 机制(如肺功能)未见正式文档化
11 数据采集设备和设置已记录 §3.9 采集设备与芯片/测序平台完整记录
12 已移除完全共线性变量 未执行,交付保留全部获批原始变量
13 对编码的映射标准已说明 结局纯 ICD-10;本 Wiki 提供 ICD-11/SNOMED CT 映射(§2.1/§2.2)
14 对时间戳的处理已明确说明 ⚠️ 事件日期与截点规则已记录;2019-2024 批次释放排期待定
15 训练/验证/测试划分建议已给出 官方无划分;本 Wiki §5 提供家庭/地区感知方案
16 数据泄漏风险已被讨论 §5.3 五种 CKB 特有泄漏模式
17 标签分布已被分析 §4.2 主要结局事件数与暴露率
18 选择性测量偏倚已被讨论 §4.5 + §6.5 坑点 5(自报测量误差与性别失衡)
19 外部验证建议已给出 §5.5 UKB/Taiwan Biobank/FinnGen/CHARLS
20 数据更新和版本信息已记录 官方 Data Release Schedule 公开(截点与释放排期)
21 最小必要预处理脚本已提供 ⚠️ 无官方派生变量脚本;依赖用户按论文范式自建
22 合规使用要求已明确 CDAS + DAA + HGR 条例程序完整文档化
23 多模态对齐方法已说明 ⚠️ 基因-表型 ID 联动已文档化;组学嵌套子集对齐需按各研究 bespoke 处理
24 去标识化方法已被记录 ⚠️ 匿名化交付(合成 ID、去直接标识);具体脱敏细节出于安全不公开

DAIMS 评分:18.0 / 24

评分解读良好——文档化与合规体系接近教科书级,扣分集中在 ML 就绪度的结构性缺口(无官方划分、无预处理脚本)与队列数据集的固有特征(标签需自定义、罕见事件未聚合)。

对你意味着什么:CKB 的 14 个 ✅ 几乎全部来自其工程化的队列治理——统一数据字典、双样本库质控、三源联动事件体系、完整的合规文档。扣分项不是"质量差"而是"定位不同":这是一个为可解释流行病学优化的资源,而非为机器学习竞赛优化的资源。建议在上手前执行以下操作:(1) 用 §5 的家庭/地区感知划分自建基准并随论文公开,为后来者补位官方缺失;(2) 按 §6.3 Pipeline 自行完成"事件长表 → 一人一行 time-to-event"转换,这是绝大多数 CKB 分析的第一步;(3) 罕见结局先按 ICD-10 章节聚合再建模;(4) 基因分析直接用 SAIGE 而非 PLINK 线性回归,跳过 λ 膨胀的返工。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能/效应指标 相对内部变化 关键发现
UK Biobank 英国(50 万人) 心衰:基因 × 心血管健康指标交互 HR 体系 效应方向一致 CKB 与 UKB 平行分析显示遗传风险与健康生活方式独立关联心衰;但欧洲 HF GWAS 位点在 CKB 仅 2 个显著——PRS 跨祖先衰减的实证
东亚 GWAS 联盟(MEGASTROKE、GIANT 等) 多队列 meta 卒中/身高/血脂位点复现 效应等位基因 OR/β 方向高度一致 CKB 作为东亚核心贡献队列复现已知位点,并贡献 14 个新疾病关联(Cell Genomics 2023)
Global Biobank Meta-Analysis Initiative 全球 20+ 生物银行 跨祖先 GWAS meta 位点效应 CKB 为东亚祖先代表性数据来源之一,验证多祖先进展
酒精 MR:观察性 vs 基因型预测(库内互证) CKB 内部双证据链 饮酒与死因别死亡 HR/100 g/周:观察性 1.18 vs 基因型 1.07(全因) 方向一致、量级不同 观察性 J 形关联被遗传证据证伪——"适量饮酒保护"不成立;库内即完成外部性检验
重复调查子集(库内校准) CKB 第 1/2 次重复调查 暴露测量误差校正 ICC 校正系数 校正后 HR 幅度增大 主要暴露-结局关联经回归稀释校正后量级上修,方向不变
加速度计子集(客观测量对照) CKB 第 3 次重复调查 体力活动测量 设备 vs 问卷 MET-h/d 问卷低估轻体力活动 自报问卷与设备测量在总活动量上方向一致,但女性家务活动被系统性低估

CKB 在 2026 年还值得申请吗? 值得——尤其当UK Biobank无法回答你的问题时。酒精代谢基因、辣食、室内空气污染、饥荒经历、出血性卒中高占比、HBV 背景下的肝癌风险……这些暴露与结局组合在 UK Biobank 中要么不存在要么样本不足。反过来,如果你的问题能用 UK Biobank 解决(欧洲人群、影像模态、成熟工具链),优先 UK Biobank——CKB 的申请摩擦与工具生态短板是真实的。两大生物银行是互补关系,而 CKB+UKB 双队列平行设计已经成为因果流行病学的高影响力论文模板。


§8 基准性能与生态

§8.1 标志性研究发现榜

CKB 没有 ML 排行榜——它的"榜单"是改写指南的效应量。以下为按影响力排序的标志性发现。注意跨论文数值不可直接比较:各研究随访截点(7.2-12 年)、队列剔除口径、调整协变量集与暴露定义均不同。

排名 研究主题 核心效应量 年份 关键方法 完整引用
1 饮酒与死因别死亡(传统 + 遗传) 当前饮酒者每 100 g/周:全因死亡 HR 1.18(1.15-1.20);基因型预测:全因 1.07、肝病 1.31、CVD 1.15;无适量饮酒保护证据 2023 ALDH2/ADH1B 基因型预测暴露量 + Cox Millwood IY et al. “Alcohol intake and cause-specific mortality: conventional and genetic evidence in a prospective cohort study of 512 000 adults in China.” Lancet Public Health 8(12):e956-e967. DOI: 10.1016/S2468-2667(23)00217-7
2 新鲜水果与心血管疾病 每日 vs 从不:CVD 死亡 HR 0.60、主要冠脉事件 0.66、缺血性卒中 0.75、脑出血 0.64 2016 3.2M 人年地区分层 Cox + 对数线性剂量反应 Du H et al. “Fresh Fruit Consumption and Major Cardiovascular Disease in China.” N Engl J Med 374:1332-1343. DOI: 10.1056/NEJMoa1501451
3 饮酒与血管病(传统 + 遗传) 基因型证据否定"适量饮酒防心梗",确认卒中风险线性上升 2019 孟德尔随机化双证据链 Millwood IY et al. “Conventional and genetic evidence on alcohol and vascular disease aetiology.” Lancet 393:1831-1842
4 辣食与总死亡及病因别死亡 每周 6-7 天 vs <1 天:总死亡 HR 0.86(降 14%);癌症、IHD、呼吸疾病死亡同向 2015 剔除基线患病者 + 前 2 年事件 Lv J et al. BMJ 351:h3942. DOI: 10.1136/bmj.h3942
5 新鲜水果与糖尿病及并发症 新发糖尿病风险降低;基线糖尿病者每日水果与微血管并发症风险下降相关 2017 482,591 人新发队列 + 30,300 患者并发症分析 Du H et al. Lancet Diabetes Endocrinol. DOI: 10.1016/S2213-8587(16)30367-9
6 基因分型与人群遗传结构 100,706 人芯片;24% 一级亲属;系统 GWAS 发现 14 个新疾病关联 2023 定制 Axiom 芯片 + 多面板填充 Walters RG et al. “Genotyping and population characteristics of the China Kadoorie Biobank.” Cell Genomics 2023
7 血脂与卒中亚型 MR 血脂组分对缺血性 vs 出血性卒中的因果效应方向不同 2019 孟德尔随机化 CKB 协作组. Nat Med 2019
8 Lp-PLA2 失功能变异 PheWAS 90,000 人表型组范围关联扫描 2016 PheWAS Millwood IY et al. Int J Epidemiol 45:1588-1599
9 肺功能与 COPD GWAS 发现新位点与潜在药物靶点 2021 跨祖先 GWAS + CKB 验证 Eur Respir J 2021
10 CKB 单倍型参考面板 9,950 CKB WGS 面板;身高 GWAS 显著位点 119→147 2023 15.41× WGS + 100,706 人填充 NAR/PMC10681741;填充服务器 db.cngb.org/imputation

§8.2 SOTA 总结与选型建议

如果你… 推荐方案 为什么
验证一个生活方式-慢病假设 先查 CKB 官方论文库是否已做 → 复用其队列定义做敏感性扩展 数百篇先验论文是免费的 sanity check
做东亚人群因果推断 ALDH2/ADH1B 等东亚特异工具变量 + 一阶段 MR 全球独此一家的天然实验
构建中国人群风险评分 基线全变量 + 地区分层 Cox/Fine-Gray → UKB/CHARLS 外部验证 暴露-结局先验丰富,校准有据可依
训练深度生存模型 §6.3 宽表 + DeepSurv/RSF,与 Cox 头对头 CKB 样本量足以支撑,但预期增益有限
做跨祖先遗传方法学 PheWeb 汇总统计(免申请) 零成本起步,与 UKB/FinnGen 汇总统计同构

§8.3 官方评测协议

无官方 ML 评测协议。流行病学事实标准(CKB 论文范式):地区分层 Cox + 年龄时间轴;剔除基线患病者与随访前 2 年事件;HR + 95% CI;按性别与城乡分层报告;剂量反应用限制性立方样条;遗传分析用亲缘感知混合模型 + 足量 PCA;敏感性分析常规包含"剔除前 5 年事件""仅限无主要慢病史者"等。

数据集 关系 说明
UK Biobank 姊妹队列/互补 欧洲人群镜像;双队列平行设计是高影响力模板
FinnGen 同类 芬兰登记系统全覆盖 + 药企联盟
Taiwan Biobank 同类/东亚对照 15 万+ 人,健保联动
Biobank Japan 同类/东亚对照 患者队列设计,东亚遗传对照
CHARLS 互补 中国全国代表性老年队列(45+ 岁),校准绝对率
中国 CDC 慢病监测系统 互补 全国代表性监测数据
Global Biobank Meta-Analysis Initiative 联盟 CKB 为东亚代表参与跨祖先 meta
西湖生物银行(Westlake BioBank) 衍生合作 中国人填充参考面板之一(CKB 填充采用)

§8.5 关键论文 Top 10

  1. Chen Z et al. (2011), Int J Epidemiol 40(6):1652-1666. “China Kadoorie Biobank of 0.5 million people: survey methods, baseline characteristics and long-term follow-up.” — 队列本体论文,权威引用入口。DOI: 10.1093/ije/dyr120
  2. Chen Z et al. (2005), Int J Epidemiol 34:1243-1249. “Cohort Profile: The Kadoorie Study of Chronic Disease in China (KSCDC).” — 前身设计与立项背景。DOI: 10.1093/ije/dyi174
  3. Walters RG et al. (2023), Cell Genomics. “Genotyping and population characteristics of the China Kadoorie Biobank.” — 遗传资源权威论文:芯片设计、亲缘结构、PCA、14 个新关联。
  4. Millwood IY et al. (2023), Lancet Public Health 8(12):e956-e967. 饮酒与死因别死亡——双证据链推翻适量饮酒保护说。DOI: 10.1016/S2468-2667(23)00217-7
  5. Du H et al. (2016), N Engl J Med 374:1332-1343. 新鲜水果与心血管——CKB 被引最高的发现之一。DOI: 10.1056/NEJMoa1501451
  6. Millwood IY et al. (2019), Lancet 393:1831-1842. 饮酒与血管病传统 + 遗传证据——MR 临床转化范本。
  7. Lv J et al. (2015), BMJ 351:h3942. 辣食与死亡——CKB 传播最广的研究。DOI: 10.1136/bmj.h3942
  8. Du H et al. (2017), Lancet Diabetes Endocrinol. 新鲜水果与糖尿病及血管并发症——糖尿病人群吃水果安全性的关键证据。DOI: 10.1016/S2213-8587(16)30367-9
  9. Millwood IY et al. (2018), JAMA Cardiol 3:34-43. CETP 基因变异 PheWAS——药物靶点遗传学范式。
  10. Yu Y et al. (2023), 加速度计运动行为论文(PMID 38001522). 2 万+ 人设备测量运动行为——客观测量子集的方法学基准。

§8.6 社区活跃度

维度 数据
队列论文引用(IJE 2011) 1,094 次(Dimensions,截至 2026-09)
CKB 论文产出 官方论文库持续收录数百篇(NEJM/Lancet/JAMA/BMJ 多篇,截至 2026-09,ckbiobank.org/publications)
CDAS 注册与申请(北大披露) 74 家高校 + 28 家科研机构 + 89 家医疗机构共 449 名中国学者注册;提交 174 项申请、批准 40 项
随访规模 近 20 年;>5 万死亡、>120 万住院事件、>3.5 万新发癌症(截至 2022 官方披露)
资助方 Kadoorie Charitable Foundation、Wellcome Trust、MRC、British Heart Foundation、Cancer Research UK、国家自然科学基金委、中国科技部、GlaxoSmithKline 等
国际合作 Global Biobank Meta-Analysis Initiative、MEGASTROKE、GIANT、GLGC 等联盟核心贡献队列

§8.7 生态快照

资源 类型 链接 规模(截至 2026-09) 为什么值得关注
CKB 官网与文档 官方 https://www.ckbiobank.org/ Data Access 政策、Release Schedule、问卷与 Publications 总入口
CKB Data Showcase 官方字典 https://www.ckbiobank.org/datashowcase/ 全字段 免注册检索字段定义与分布——申请前必做功课
CKB PheWeb 开放数据 https://pheweb.ckbiobank.org/ 全基因组汇总统计 免申请下载 GWAS summary stats,方法学零成本入口
CKB RAP 云平台(试点) 经官网公告 部署中 HGR 合规下个体级基因数据分析主通道
CNGB 填充服务器 工具 https://db.cngb.org/imputation/ 免费 CKB 单倍型面板在线填充,华人研究提速器
北大 CKB 站点(中文) 官方 https://ckbiobank.pku.edu.cn/ 中文数据共享流程、CDAS 使用说明与项目动态
Atlas of Longitudinal Datasets CKB 页 元数据 https://atlaslongitudinaldatasets.ac.uk/datasets/ckb 队列元数据第三方权威汇编
SAIGE 工具库 https://github.com/saigegit/SAIGE 活跃 亲缘感知 + 不平衡表型 GWAS 标配,CKB 遗传分析必需

§9 相关资源与引用

官方资源

BibTeX 引用

% 1) 队列本体论文(使用 CKB 数据的首要必引)
@article{chen2011ckb,
  title={China Kadoorie Biobank of 0.5 million people: survey methods,
         baseline characteristics and long-term follow-up},
  author={Chen, Zhengming and Chen, Junshi and Collins, Rory and Guo, Yu
          and Peto, Richard and Wu, Fan and Li, Liming and {China Kadoorie
          Biobank (CKB) collaborative group}},
  journal={International Journal of Epidemiology},
  volume={40}, number={6}, pages={1652--1666}, year={2011},
  doi={10.1093/ije/dyr120}
}

% 2) 前身 KSCDC 队列论文(引用研究设计时)
@article{chen2005kscdc,
  title={Cohort Profile: The Kadoorie Study of Chronic Disease in China
         (KSCDC)},
  author={Chen, Zhengming and others},
  journal={International Journal of Epidemiology},
  volume={34}, number={6}, pages={1243--1249}, year={2005},
  doi={10.1093/ije/dyi174}
}

% 3) 遗传资源论文(使用基因数据时必引)
@article{walters2023ckb,
  title={Genotyping and population characteristics of the China Kadoorie
         Biobank},
  author={Walters, Robin G and others},
  journal={Cell Genomics}, year={2023}
}

% 4) 使用 PheWeb 汇总统计或参考面板时,加引对应 GWAS/面板论文

投稿前请对照 DAA 的引用条款逐项核对——除队列论文外,使用特定数据模块(基因、生物标志物、加速度计)通常还要求引用对应模块论文与致谢 CKB collaborative group。

教程与学习资源

原始论文

  1. Chen Z et al. (2011). Int J Epidemiol 40(6):1652-1666. DOI: 10.1093/ije/dyr120. PMID: 22158673. PMCID: PMC3235021.
  2. Chen Z et al. (2005). Int J Epidemiol 34:1243-1249. DOI: 10.1093/ije/dyi174.
  3. Walters RG et al. (2023). Cell Genomics. “Genotyping and population characteristics of the China Kadoorie Biobank.”
  4. Du H et al. (2016). N Engl J Med 374:1332-1343. DOI: 10.1056/NEJMoa1501451.
  5. Lv J et al. (2015). BMJ 351:h3942. DOI: 10.1136/bmj.h3942. PMID: 26242395.
  6. Millwood IY et al. (2023). Lancet Public Health 8(12):e956-e967. DOI: 10.1016/S2468-2667(23)00217-7. PMID: 38000378.
  7. Millwood IY et al. (2019). Lancet 393:1831-1842.
  8. Du H et al. (2017). Lancet Diabetes Endocrinol. DOI: 10.1016/S2213-8587(16)30367-9.

§10 AI 使用声明卡

§10.1 AI 模型使用

AI 模型 版本 用途
deep-model(WorkBuddy) 2026-09 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建
WebSearch(多源检索) 2026-09-05 6 组检索:队列规模与基线特征、数据访问流程、代表论文核实、随访联动体系、基因资源、HGR 合规与引用快照

§10.2 AI 参与范围

AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。

AI 在本页面的工作中负责:(1) 从 ckbiobank.org 官方页面、北大 CDAS 站点、Chen 2011 队列论文摘要、Cell Genomics 2023 及四大医学期刊论文中整理结构化信息;(2) 生成 §6 的 R/Python 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。

§10.3 输入来源

  1. Chen Z et al. (2011), Int J Epidemiol 40(6):1652-1666 — CKB 队列论文(DOI: 10.1093/ije/dyr120;规模、基线特征、随访设计)
  2. Chen Z et al. (2005), Int J Epidemiol 34:1243-1249 — KSCDC 前身论文(DOI: 10.1093/ije/dyi174)
  3. ckbiobank.org Data Access 系列页面(data overview / procedures / policy:申请流程、费用、释放排期、RAP)
  4. 北大 CKB 站点数据共享流程页(CDAS 注册、中期/总结报告、发表申请)
  5. 中国人民大学健康大数据研究院 CKB 数据集页(10 地区名单、重复调查、申请要点)
  6. Atlas of Longitudinal Datasets CKB 条目(代表性声明、资助方、元数据)
  7. Du H et al. (2016), N Engl J Med 374:1332-1343(新鲜水果与心血管,事件数与 HR)
  8. Lv J et al. (2015), BMJ 351:h3942(辣食与死亡,队列剔除范式)
  9. Millwood IY et al. (2023), Lancet Public Health 8(12):e956-e967(饮酒与死因别死亡,12 年随访与基因型分层)
  10. Millwood IY et al. (2019), Lancet 393:1831-1842(饮酒与血管病)
  11. Du H et al. (2017), Lancet Diabetes Endocrinol(新鲜水果与糖尿病;DOI: 10.1016/S2213-8587(16)30367-9)
  12. Walters RG et al. (2023), Cell Genomics(基因分型与人群结构;S2666-979X(23)00144-1)
  13. ckbiobank.org Genetic resources 页(Golden Gate/Axiom/WGS/填充/亲缘结构细节)
  14. MRC 资助摘要 MC_UU_00017/1(截至 2017-01-01 事件累积量)
  15. 牛津 NDPH DPhil 项目页(截至 2022 事件累积量:>5 万死亡、>120 万住院、>3.5 万癌症)
  16. 国务院《人类遗传资源管理条例》(2019)与 Springer Human Genetics 2018(CKB 国际用户安全要求)及科技部 2023 事先报告细则
  17. CKB 加速度计论文(PMID 38001522:非全国代表性表述、设备测量验证)
  18. BMC Medicine 2021(CKB+UKB 心衰双队列、PRS 跨祖先衰减)
  19. CKB 单倍型参考面板论文(PMC10681741:9,950 WGS、100,706 填充、身高 GWAS、填充服务器)
  20. Dimensions / Altmetric 引用快照(截至 2026-09)

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景(ICD-11/SNOMED 映射、人群统计、金标准) 千方病案医学编辑部 交叉审核 ✅ 已通过
§3 数据集规格(规模、模态、溯源链) 千方病案医学编辑部 ckbiobank.org 官方页面及队列论文交叉比对 ✅ 已验证
§4 数据结构(字段字典、缺失编码) 千方病案医学编辑部 与 Data Showcase 及论文方法章交叉比对 ✅ 已验证
§5 数据划分策略 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与坑点 千方病案医学编辑部 逻辑审查 + 与官方申请流程文档比对 ✅ 已通过
§7 质量评估与 DAIMS 评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 发现榜与引用数表述 千方病案医学编辑部 与原文及 Dimensions 快照交叉比对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 Schema v3.9 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。

§10.6 最后审核

最后一次人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集