信息速览
# UK Biobank — 大规模人群队列 AI-Ready Wikipedia
— 大规模人群队列 AI-Ready Wikipedia
INFOBOX
| 属性 | 内容 |
|---|---|
| 全称 | UK Biobank(英国生物样本库) |
| 发起方 | UK Medical Research Council + Wellcome Trust;曼彻斯特/牛津团队运营 |
| 招募 | 2006-2010,503,317 名 40-69 岁英国志愿者(22 个评估中心) |
| WGS | 490,640 人(32.5X,NovaSeq 6000;约 15 亿变异;Nature 645:692-701, 2025) |
| 影像 | 10 万人多模态(脑/心/腹 MRI + 骨密度 + 颈动脉超声;10 亿+ 图像,2025-07 里程碑) |
| 组学扩展 | Olink 蛋白组 54,000 人;NMR 代谢组 50 万全量(2025);WES;imputed 96M SNP |
| EHR 链接 | HES 住院 + 初级保健 GP(~23 万人至 2016/17)+ 癌症登记 + 死亡登记(全量) |
| 总量 | 约 30 PB;生物样本 1,600 万份 |
| 访问 | 申请制 + UKB-RAP 云平台(数据不可整体下载);Tier 1 £3,000/3 年起,WGS/影像 Tier 3 £9,000/3 年起 |
| 使用规模 | 22,000+ 研究者 / 60+ 国 / 18,000+ 论文 / 6,934 批准项目(2026) |
| 治理 | 不可重识别、按批准项目使用、2025-01 起保险公司不予直接访问 |
| 主论文 | UKB WGS Consortium, Nature 645:692-701 (2025), DOI 10.1038/s41586-025-09272-9;Sudlow 2015 PLoS Med(资源描述) |
| 本库关联 | 015 PLoS Med(资源描述) |
| 本库关联 | gwas-catalog、gnomad、all-of-us、hprc、tcga(队列、gnomad、all-of-us、hprc、tcga(队列/组学对照) |
§0 E-E-A-T 信任声明与免责声明
本页所有规模数字、费用与治理口径均核实自一手来源:UK Biobank 官网数据说明页(ukbiobank.ac.uk,「Data highlights」口径:影像 10 万人、WGS/WES 50 万人、蛋白组 5.4 万人、200 万在线问卷)、UK Biobank WGS Consortium Nature 论文(2025-08-06,DOI 10.1038/s41586-025-09272-9:490,640 人、32.5X、15 亿变异)、以及 2026 年公共白皮书对官网数字的汇编(招募 503,317、费用分层、6,934 项目等)。检索核实时间为 2026-09-19。
费用与治理条款可能随时更新(2026 年中曾暂停新申请),本页数字为核实时点口径——正式申请前以官网最新文本为准。本页为技术参考文档,不构成申请或法律建议。
关于人群表述:UKB 样本以英国居民为主,ancestry 构成不均衡(欧洲 ancestry 主导),这是采样人群决定的统计事实;本页在公平性小节讨论其对 AI 外推的影响,不构成对任何人群的评价。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:全球最大深度表型人群队列——50 万英国人的基因组 + 影像 + 蛋白/代谢组 + 全程健康记录链接,纵向随访 20 年。
- 三块招牌:490,640 人 WGS(15 亿变异);10 万人多模态影像(10 亿+ 图像);50 万人 EHR 链接(HES/GP/癌症/死亡登记)。
- 体量:约 30 PB;1,600 万生物样本。
- 访问:申请制(机构研究者 + MTA + 分层费用)+ UKB-RAP 云平台——数据不出云。
- 使用规模:22,000+ 研究者、18,000+ 论文——队列研究的全球事实基准。
- 适用:疾病风险预测、影像-基因关联(IDP×GWAS)、蛋白/代谢组生物标志、药物靶点 Mendelian randomization。
- 不适用:个体诊断(科研去标识数据)、儿科/孕产人群(40-69 岁招募)、实时临床决策。
§1.1 摘要
现代队列研究的核心矛盾:要理解疾病,需要「海量人群 + 深度表型 + 长期结局」三者同时成立——但深度表型(基因组、影像、蛋白组)昂贵,长期结局只能靠时间。UK Biobank 的设计是对这个矛盾的系统回答:2006-2010 年,它一次性招募 50 万名 40-69 岁英国志愿者(本阶段的「投资」),采集基线问卷、体格测量与血尿样本;随后的十五年里,按「技术成熟一层、追加一层」的策略滚动加码——2014 年起影像扩展(10 万人 MRI)、蛋白组(5.4 万 Olink)、代谢组(30 万→50 万 NMR)、最终 2023 年完成全量 50 万人 WGS(490,640 人实测,15 亿变异)。健康结局通过英国国民健康体系的登记系统(HES 住院、初级保健、癌症与死亡登记)自动链接——参与者不需要回访,结局数据持续累积。
对医疗 AI,UKB 提供的是「从人群尺度学健康」的原料:数百万级影像-基因型-结局三元组使「影像组学 IDP 与遗传变异关联」成为可训练任务;15 亿变异与全量临床结局使 PRS、Mendelian randomization、药物靶点验证有了人群级效力;10 亿张影像是医学影像自监督预训练的最大公开语料之一。
成本侧是本页的重点:申请制、分层费用(WGS/影像 Tier 3)、云端锁定(数据不可下载)与 ancestry 偏斜是四条必须预先规划的现实约束——坑点体系(§6.6)展开。
§1.2 战略价值
- 疾病风险预测的人群基准:任何风险模型(临床+基因+影像)都需要「基线健康人群 → 未来患病」的纵向数据;UKB 的 20 年随访 + 全量结局链接是这类模型的训练与验证主战场。
- 影像组学的规模天花板:10 亿+ 张 MRI 图像配基因型与结局——影像表型(IDP)、脑龄预测、疾病二分类的公开语料天花板;「影像-基因关联」(如 IDP×GWAS)只有 UKB 规模才够效力。
- 药物靶点验证的黄金标准:WGS 稀有变异 + 蛋白组 + 结局——「遗传学支持的药物靶点」(human genetics validation)流程的行业参考;药企大量采购 Tier 3 访问正为此。
- 多组学交叉的最大公约数:基因×蛋白×代谢×影像×结局在同一批人身上对齐——跨组学建模的「对齐样本」没有公开替代品。
§1.3 同类资源横向对比
| 资源 | 定位 | 规模 | 与 UKB 的关系 |
|---|---|---|---|
| UK Biobank | 深度表型人群队列(成年中老年) | 50 万 / 30 PB / 20 年随访 | — |
| All of Us | 美国多样化人群队列(含 EHR+WGS) | 40 万+(含 10 万+ WGS),ancestry 多样化显著 | 人群构成互补(本库有专页) |
| try 多样化显著 | 人群构成互补(本库有专页) | ||
| 1000 Genomes / HPRC | 人群遗传多样性参考 | 千人级/泛基因组 / HPRC | 人群遗传多样性参考 |
| gnomAD | 人群频率数据库 | 80 万+ 人 | 频率查询互补(UKB 基因型受控) |
| GIAB | 标准品真值 | 数十样本 | 技术基准(与队列互补) |
| MIMIC-IV | ICU 深度临床数据 | 5 万住院 | 临床深度 vs 队列广度 |
| TCGA | 癌症多组学 | 1.1 万患者 | 疾病纵深 vs 人群广度 |
| ChinaMAP/CKB 等 | 亚洲人群队列 | 十万级 | 人群互补(ancestry 外推验证) |
一句话定位:要「人群广度 × 深度表型 × 纵向结局」的组合,UKB 是公开资源的天花板;要 ancestry 多样性补 All of Us;要临床深度补 MIMIC;要疾病纵深补 TCGA。
§1.4 版本时间轴
| 时间 | 事件 | 意义 |
|---|---|---|
| 2006-2010 | 基线招募 503,317 人 | 问卷 + 体测 + 血尿样本;前瞻性设计就位 |
| 2014 起 | 影像扩展启动(复邀 10 万人) | 全球最大人群 MRI 计划 |
| 2018-2020 | WES 与 imputed 数据发布;蛋白组启动 | 组学层加码 |
| 2021-04 | 访问费用分层(Tier 1-3) | 可持续运营模式 |
| 2023 | 代谢组 30 万人发布 | NMR 平台规模 |
| 2023-11-30 | 全量 50 万人 WGS 发布 | 官方称全球最大 WGS 数据集 |
| 2025-07 | 影像 100,000 scans 里程碑 | 10 亿+ 图像;1,300+ 影像论文 |
| 2025-08-06 | WGS 主论文 Nature 发表 | 490,640 人;15 亿变异 |
| 2025 | 代谢组扩至 50 万全量 | NMR 全量完成 |
| 2026 | RAP 升级期暂停新申请;22,000+ 研究者 / 18,000+ 论文 | 本页核实口径 |
§1.5 典型应用场景
- 影像表型 × 基因组关联(IDP×GWAS):数万 IDP(影像衍生表型)与全基因组变异的关联——脑科学、心血管成像遗传学的规模化范式。
- 多基因风险评分(PRS)的人群验证:在 50 万英国人中训练/校准/验证 PRS,并用 EHR 结局测增量预测力(对照 gwas-catalog 的关联资源)。
- Mendelian randomization 药物靶点验证:暴露(蛋白/代谢物/影像表型)→ 结局(疾病登记)的因果推断——药企靶点优先级流程。
- 影像 AI 预训练与疾病检测:10 亿张 MRI 的自监督预训练;脑龄、心脏功能、脂肪分布的自动量化。
- 多模态健康风险建模:问卷+体测+基因+影像+代谢组融合预测未来疾病(深度学习与经典 Cox 的对照基准)。
- 环境-健康关联:空气污染模型、绿地暴露等环境图层与结局链接的环境流行病学。
§1.6 组件全景
UKB 资源的六个层次:
- 参与者层:503,317 人(eid 主键);撤回机制使每次 release 人数小幅浮动。
- 基线层:触屏问卷、口头访谈、体格测量、血尿样本(2006-2010)。
- 多组学扩展层:WGS/WES/imputed array、Olink 蛋白组、NMR 代谢组、加速度计活动记录、眼底照相等。
- 影像层:10 万人 × 多模态(脑结构/功能/DWI、心 MRI、腹 MRI、骨密度、颈动脉超声)+ IDP(影像衍生表型)库。
- 结局链接层:HES 住院、GP 初级保健、癌症登记、死亡登记、内科特病登记——按 NDA(National Data Opt-out)治理。
- 平台层:UKB-RAP(DNAnexus 托管云)——数据存储 + Spark/Hail 分析 + DX Workflow;Showcase 数据浏览器(字段文档)。
§1.7 队列研究的经济学:为什么 UKB 值 £9,000
UKB 的访问费用常被诟病(相比开放数据的「零成本」),但把账算全:
- 生成成本沉没:50 万人 WGS 按市值数亿美元、影像扫描按每人 £150-200 计——研究者以 £9,000/3 年获得的是「分摊后的边际成本」。
- 合规成本内化:伦理审批、数据治理、重识别防护、撤回处理由 UKB 中央承担——自建 50 万人队列的合规成本远超访问费。
- 云端算力捆绑:RAP 费用含计算资源弹性——15 亿变异 × 50 万人的矩阵在本地需要 PB 级存储与集群,云端按需。
- 复现与协作:同一项目多成员共享工作区、公开项目可引用——协作成本降低。
反面同样成立:数据不出云 + 费用门槛 + 单一平台依赖意味着小团队与教学场景受限——这是 UKB 与完全开放数据(TCGA、MIMIC)的结构性差异,立项前必须想清楚。
§1.8 场景-验收匹配表
立项前自查:你的场景属于哪一列?验收标准在申请前就要写进项目计划——UKB 的费用与排期结构使「先申请后想清楚」的代价远高于开放数据。
| 应用场景 | 所需数据层 | Tier | 验收标准(示例) |
|---|---|---|---|
| 人群疾病风险预测 | 基线+结局+PRS | Tier 1 | 5 年 AUC ≥ 0.75 且校准斜率 0.8-1.2,分层报告 |
| GWAS(常见变异) | WGS/imputed + 结局 | Tier 1 | Manhattan/QQ 正常,λGC < 1.05,复现已知位点 |
| 罕见变异基因负荷 | WGS + 精细表型 | Tier 3 | burden/SKAT 检出至少一个可复制信号 |
| 影像 AI 预训练 | 脑/心/腹 MRI | Tier 3 | 下游迁移 ≥ ImageNet 初始化基线 +2% |
| 药物靶点 MR | Olink pQTL + HES | Tier 1 | F 统计量 > 10、Steiger 正向、三敏感性一致 |
| 蛋白/代谢生物标志 | Olink/NMR + 结局 | Tier 1 | 增量 AUC/NRI 显著且方向符合机制 |
| 环境-健康建模 | 环境图层 + 结局 | Tier 1 | 暴露-结局关联跨中心方向一致 |
| 方法基准测试 | 任一子集 | Tier 1 | 与已发表基线在固定切分下可比 |
匹配纪律:验收标准里的每一个数字都要能在 RAP 上复算——写进申请的评估计划就是你日后导出 Review 的对照物。
§2 医学与科学背景
§2.1 前瞻性队列为何仍然不可替代
在病例对照、电子病历挖掘、可穿戴设备研究满天飞的时代,前瞻性人群队列的价值常被低估。它解决三个别的方法做不到的问题:
- 时序明确:基线暴露(基因、影像、生活方式)先于结局发生——因果方向天然成立(Mendelian randomization 的前提)。
- 选择偏差可控:招募在疾病发生前完成(40-69 岁一般人群),避免了「医院数据只看到病人」的入径偏差——代价是 healthy volunteer effect(见 §2.9)。
- 结局完整:死亡登记全量覆盖——「没出现在医院数据里」不等于「没事件」;失访与竞争风险可显式建模。
对 AI 的含义:在 UKB 上训练的风险模型,其「AUC 提升能否转化为预防决策」的逻辑链比回溯性临床数据更硬——这正是监管科学界(FDA/EMA 对 AI 辅助预防的讨论)关注的证据形态。
§2.2 「深层表型」的规模化哲学
UKB 的表型策略是「宽底座 + 逐层加深」:
底座(50 万人全量):问卷 / 体测 / 血尿样本 / 死亡与住院链接
↓ 加深 1:基因分型 array(全量)→ imputation 96M SNP(全量)
↓ 加深 2:WES(全量)→ WGS 490,640(32.5X,15 亿变异)
↓ 加深 3:Olink 蛋白组 5.4 万 / NMR 代谢组 50 万
↓ 加深 4:多模态影像 10 万(复邀采样)
↓ 加深 5:加速度计、眼底、认知测试、在线问卷 200 万
每一层都是「全量 or 明确子集」的清晰口径——不存在「部分人有部分字段无版本说明」的模糊地带(这是很多研究数据库的通病)。这个哲学让 UKB 成为「表型深度 trade-off 研究」的标准试验场。
§2.3 影像扩展:10 万人的 MRI 如何做
UKB 影像是「复邀制」:从 50 万人中复邀 10 万名参与者到专设的影像评估中心(Cheadle、Newcastle、Reading、Bristol 四中心)。多模态协议(每次约 1 小时):
- 脑 MRI:T1/T2-FLAIR 结构、静息态 fMRI、DWI、SWI、ASL 灌注。
- 心 MRI:cine 电影序列(心功能)、T1-mapping。
- 腹 MRI:肝脏脂肪(PDFF)、胰腺、肾脏、脾脏定量。
- 骨密度(DXA)+ 全身体脂分布。
- 颈动脉超声(内膜中层厚度)。
衍生 IDP(Image Derived Phenotypes)由统一管线提取(数千个:脑区体积、皮层厚度、心室参数、肝铁含量等)——直接与基因型、结局链接做关联。10 亿+ 张图像、1,300+ 篇论文(2025-07 里程碑口径)。
§2.4 WGS 15 亿变异意味着什么
Nature 2025 WGS 论文(490,640 人)的关键数字与含义:
| 指标 | 数字 | 含义 |
|---|---|---|
| 平均覆盖 | 32.5X(≥23.5X/人) | 统一 NovaSeq 6000 平台 |
| 变异总数 | 约 15 亿(SNP+indel+SV) | 比 imputed array 多 18.8 倍、比 WES 多 40+ 倍 |
| 稀有变异覆盖 | 编码区 + UTR + 非编码 | array/WES 时代不可见的稀有非编码变异入场 |
| ancestry 发现 | 欧洲主导,非洲/亚洲人群有强或新信号 | 多 ancestry 分析可行但效力不均 |
对药物发现:这一步让「目标验证」从编码区扩展到调控区——许多药效/安全性相关变异(eQTL、pQTL)位于非编码区。对 AI:15 亿变异的基因型矩阵(GRM、嵌入向量)是人群遗传结构的最大公开(受控)语料。
§2.5 EHR 链接:英国 NHS 的结构性优势
UKB 的结局数据依赖英国 NHS 的全国性登记体系——这是美国多中心研究难以复制的结构性优势:
- HES(Hospital Episode Statistics):全英住院事件(诊断 ICD-10、操作 OPCS),50 万人全量。
- 初级保健 GP:~23 万人(依数据供应商覆盖至 2016 或 2017;后批次更新中)——门诊处方、症状记录。
- 癌症登记:全国癌症诊断(形态学、分期)。
- 死亡登记:全量死亡与死因(ICD)。
- 内科特病与二手数据源:心理健康服务(部分)、COVID 检测/住院记录(专项链接)。
链接方式:NHS 编号 + 出生日期/性别确定性匹配——链接质量高(英国单人单号体系)。AI 含义:标签来源(HES vs GP vs 死亡)决定标签质量——用「出院主诊断」做标签与用「死亡原因」做标签是两套不同的灵敏度/特异度(见坑点 7)。
§2.6 与传统 biobank 的区别
| 维度 | 传统 biobank(如医院样本库) | UKB |
|---|---|---|
| 采样 | 疾病富集(住院/门诊患者) | 一般人群(疾病发生前) |
| 表型 | 病例为中心的临床摘要 | 标准化深度表型(统一协议) |
| 结局 | 随访依从机构 | 全国登记自动链接(失访极少) |
| 数据一致性 | 各中心异质 | 单一协议 + 统一管线 |
| 规模 | 千-万级 | 50 万级 |
§2.7 healthy volunteer effect
UKB 参与者比一般人群更健康(自愿参加体检研究的人行为更健康、死亡率更低)——这是设计内生现象,不是数据错误:
- 证据:UKB 全因死亡率显著低于英格兰一般人群匹配年龄组。
- 对流行病学:相对风险(RR)内部比较仍有效(效应估计的倍数关系),但绝对风险的直接外推(「50 万人中 X% 患病 → 全国患病率 X%」)会低估。
- 对 AI:用 UKB 训练的疾病检测模型,其患病率基线偏低——PR 曲线、阈值校准、部署前的人群患病率重加权都要处理(§7.4)。
§2.8 治理与参与者的位置
UKB 的治理结构是「参与者中心」话语的样本:
- 承诺:参与者捐献时承诺「数据仅用于健康研究」「不可重识别」「撤回自由」——这些不是装饰条款而是访问政策的约束源。
- 伦理委员会(Ethics Advisory Committee):审批数据使用类别(含敏感类别如心理健康、性少数相关字段)。
- 政策演进:2025-01 起保险公司不再获直接访问(防止保险歧视)——治理随社会关切演进。
- 撤回处理:参与者可撤回全部数据——每次 release 样本量小幅下降(坑点 8)。
对使用者的含义:申请时勾选的数据类别、分析目的与实际用途必须一致——越权使用(如把健康研究数据用于保险精算)是真实红线。
§2.9 与亚洲人群队列的互补
UKB 的 ancestry 局限由其他队列补位:
- ChinaMAP(中国代谢分析项目,万余全基因组)与 CKB(China Kadoorie Biobank,51 万人):中国人群的等位频率与疾病谱。
- **nk,51 万人):中国人群的等位频率与疾病谱。
- BioBank Japan(20 万人):日本人群疾病基因组。
- **All **(20 万人):日本人群疾病基因组。
- All of Us(美国,40 万+):种族/民族多样性刻意设计(含 10 万+ WGS)。
- SG10K/GenomeAsia:南亚与东南亚覆盖。
AI 外推的标准动作:UKB 训练 → 上述队列独立验证 → ancestry 分层报告(PRS 的 ancestry 可移植性是文献中反复出现的负结果来源——先声明再训练)。
§2.10 IDP × GWAS:影像-基因联合分析的方法学骨架
UKB 独有的组合拳是把数千个影像衍生表型(IDP)与全基因组关联对接——「脑结构/心功能的遗传架构」研究绝大多数产自这里。方法学骨架:
- IDP 选择:官方管线输出数千 IDP(体积/厚度/扩散张量/血流/PDFF 等),分模态打包——先按研究问题筛模态,再剔除质量警告样本(管线自带 QC 标志位)。
- 协变量标准集:年龄、性别、评估中心(扫描仪差异的主源)、成像批次/时间、头动参数(DWI/fMRI)、遗传主成分前 40 项——UKB 影像 GWAS 的社区惯例集合。
- 规模:10 万影像 × 1500 万变异的双侧矩阵,REGENIE 分步回归是标准解;单 IDP GWAS 快,但数千 IDP 串行仍要数天——批处理与共享 LD 参考是效率关键。
- 多重性与遗传相关:数千表型 × 数百万变异的 Bonferroni 过严——社区常用 FDR(按 IDP 族)+ 复现队列;跨 IDP 的遗传相关(LDSC/BOLT-REML)揭示「同一基因影响多种结构」的共享架构。
- 结果归宿:显著位点进 GWAS Catalog 汇总层;IDP 与疾病的遗传相关(如脑龄 gap 与痴呆)是纯计算可得的二手发现富矿区。
- 陷阱:扫描仪换代引入批次效应(影像分批 10 年跨越多代设备)——批次协变量与敏感性分析(留一中心法)是审稿人必查项;IDP 逆回归(用基因预测 IDP 反推疾病)要走 MR 方向性检验。
这条骨架的产出物(IDP-疾病关联、影像遗传架构)是 UKB 论文里引用密度最高的一类——方法学复用价值高于任何单点发现。
§3 数据集规格
§3.0 规格总表
| 维度 | 口径 |
|---|---|
| 招募 | 503,317 人(2006-2010,40-69 岁,22 中心) |
| WGS | 490,640 人(32.5X,15 亿变异,2023-11 发布) |
| WES | 全量(50 万人) |
| imputed array | 全量(~96M SNP) |
| 影像 | 10 万人复邀(脑/心/腹 MRI + DXA + 颈动脉超声;10 亿+ 图) |
| 蛋白组 | Olink 54,000 人(~3,000 蛋白面板) |
| 代谢组 | NMR 50 万全量(2025;249 代谢指标量级) |
| EHR | HES 全量 + GP ~23 万 + 癌症/死亡登记全量 |
| 问卷 | 基线 + 触屏 + 24h 饮食回忆 ×N + 在线问卷 200 万 |
| 总量 | 约 30 PB;样本 1,600 万 |
| 访问 | UKB-RAP 云平台;Tier 1 £3,000/3 年起 / Tier 3 £9,000/3 年起 |
| 使用 | 22,000+ 研究者 / 60 国 / 18,000+ 论文(2026) |
§3.1 八大类数据矩阵
| 类别 | 内容 | 子集规模 |
|---|---|---|
| Imaging | 脑/心/腹 MRI、DXA、颈动脉超声、IDP | 10 万 |
| Biomarker | 血尿生化(糖脂、肝肾功能、炎症) | 50 万 |
| Genetic | WGS/WES/array-imputed | 49 万 / 50 万 / 50 万 |
| Healthcare records | HES/GP/癌症/死亡登记 | 50 万(GP 23 万) |
| Questionnaire | 基线/触屏/饮食/在线 | 50 万 |
| Physical measures | 体格/握力/肺功能/眼底/加速度计 | 50 万(加速度计 10 万) |
| Demographic & lifestyle | 人口学/教育/饮食/环境暴露 | 50 万 |
| Proteomics/metabolomics | Olink / NMR | 5.4 万 / 50 万 |
§3.2 Field ID 取数体系
UKB 的字段体系是「Field ID-Instance-Array」三级:
- Field ID:数千个字段(如 Field 21000=ethnicity、Field 4079=舒张压)。每个 field 有定义文档(Showcase 页)。
- Instance:重复测量实例(Instance 0=基线、1=第一次复访、2=第二次复访…;影像访问实例另有口径)。
- Array:同一 instance 内多元素(如多选项问题的各选项)。
取数规则:eid + Field ID + Instance + Array 四元组定位一个值。Showcase(biobank.ndph.ox.ac.uk/showcase)提供全字段 CSV 下载与分类浏览——先读 Showcase 文档再写取数代码是第一纪律(坑点 6)。
§3.3 影像与 IDP 规格
| 模态 | 序列/产物 | IDP 数量级 |
|---|---|---|
| 脑结构 | T1、T2-FLAIR | 脑区体积/皮层厚度/病变负荷 |
| 脑功能 | 静息态 fMRI | 功能连接矩阵 |
| 脑扩散 | DWI | 各向异性/ diffusivity |
| 心脏 | cine MRI、T1-mapping | 心室容积/射血分数/心肌 T1 |
| 腹部 | PDFF MRI | 肝/胰/肾脂肪定量 |
| 体成分 | DXA | 内脏脂肪/骨密度 |
| 血管 | 颈动脉超声 | IMT |
IDP 由统一管线提取并随 release 更新——直接用 IDP 还是自提特征是两条路径(基线用 IDP,前沿用原始 DICOM/NIfTI 自提)。
§3.4 DAIMS 数据集资产信息表
| 字段 | 内容 |
|---|---|
| 资产名称 | UK Biobank |
| 资产类型 | 深度表型前瞻性人群队列(多组学+影像+EHR) |
| 版本 | 滚动 release(WGS 2023-11 全量;影像 2025-07 10 万;代谢组 2025 全量) |
| 规模 | 503,317 招募 / 490,640 WGS / 约 30 PB / 样本 1,600 万 |
| 格式 | RAP 表格(Spark/CSV)、BAM/CRAM(WGS)、DICOM/NIfTI(影像)、IDP 表 |
| 主键 | eid(参与者唯一匿名标识) |
| 平台 | UKB-RAP(DNAnexus 云;Spark/Hail/DX Workflow) |
| 访问 | 申请制 + MTA + Tier 费用;不可整体下载 |
| 费用 | Tier 1 £3,000/3 年起;Tier 3(WGS/WES/影像)£9,000/3 年起;学生/低收入国 £500 |
| 治理 | 不可重识别、撤回自由、类别审批、保险业禁入(2025-01) |
| 引用 | Sudlow 2015 PLoS Med(资源)+ WGS 2025 Nature + 所用 field/子集专项论文 |
| 健康声明 | 科研去标识数据;个体诊断/保险精算禁止;healthy volunteer effect 需校正 |
§3.5 存储与计算规划
UKB 的计算规划与传统数据集完全不同(数据在云,算力也在云):
| 策略 | RAP 方案 | 量级参考 |
|---|---|---|
| 表格分析 | Spark DataFrame / dx extract | 全量表 join 分钟-小时级 |
| 基因组分析 | Hail(GRM/GWAS/回归) | 49 万 WGS GRM 集群小时级 |
| 影像分析 | DX Workflow / GPU 作业 | 预处理流水线按需弹 GPU |
| 深度学习 | dx 作业 + GPU instance | 单作业数千 GPU 时预算规划 |
费用结构:访问费(Tier)+ RAP 计算费(按量)分开计——计算费常超过访问费(10 亿张影像的预处理尤其如此),立项预算必须含计算。
§3.6 获取路径速查
- 资格:认可研究机构的 PI(背景审查)→ 机构 signing official 签署 → 缴费 → 开通 RAP。
- 浏览:Data Showcase(字段文档免费公开)+ Data Browser——申请前就能做字段功课。
- 申请:Access Management System 选数据类别(Tier 决定费用);项目描述需与实际分析一致。
- 分析:RAP 工作区——Spark/Hail/Python/R 环境 + DX 工作流;结果导出走白名单审查(聚合统计/模型可导出,个体级数据不可)。
- 更新:新 release 通知与撤回同步——项目期内定期同步 release 差异。
§3.7 版本与口径对齐表
| 你看到的数字 | 实际口径 |
|---|---|
| 「50 万人」 | 招募口径 503,317;各子集按 release 实查 |
| 「49 万人 WGS」 | 490,640(WGS 实测完成人数,Nature 2025) |
| 「10 万人影像」 | 影像复邀完成 10 万(2025-07 里程碑;分批释放) |
| 「80 万人」 | 不是 UKB(那是 gnomAD)——UKB 不提供公开频率 |
| 「30 PB」 | FY2025 年报的数据捐赠总量口径 |
| 「18,000+ 论文」 | 官网 2026 口径(含使用 UKB 数据的已发表论文) |
§3.8 与 release 版本的管理
UKB 滚动 release 的工程纪律:
- 锁定 release:论文/项目声明所用 release(如「2025-XX release,Field 版本 X」)。
- 撤回同步:UKB 定期通知撤回名单——缓存的中间表要在下轮同步剔除。
- 字段版本:同一 Field 的定义/单位可能修订(Showcase 有 changelog)——升级前 diff。
- IDP 管线版本:影像 IDP 随管线版本演进——IDP 关联研究须锁管线版本。
§4 数据结构
§4.0 RAP 数据组织
UKB-RAP 上的典型项目工作区结构:
ukb_rap_project/
├── bulk/ # 全量表格(batch 格式)
│ ├── ukb_records.csv.gz # 基线/随访记录(按 field 分批)
│ └── assessments.csv
├── genetic/
│ ├── ukb_wgs_cram/ # 490,640 人 CRAM(GRCh38)
│ ├── ukb_hla_qc/ # HLA/相关补充
│ └── ukb_imp_v3/ # imputed array(BGEN)
├── imaging/
│ ├── dicom/(原始 DICOM,按模态/批次)
│ ├── nifti/(预处理 NIfTI)
│ └── imaging_ids/ # IDP 提取表
├── linkage/ # HES/GP/癌症/死亡登记链接表
├── applications/ # 项目申请材料存档
└── analysis/ # 自己的代码与中间表
关键认知:上面是逻辑视图——RAP 上数据以「数据集资产 + 表格」呈现,通过 Spark/dx 命令读取;个人无文件系统级全量控制(这也防止了数据导出违规)。
§4.1 eid 主键体系
所有表通过 eid(参与者唯一匿名整数)关联:
# 示例:把基线血压(Field 4079/4080)与死亡登记链接
# RAP Spark 语法骨架
import pyspark.sql.functions as F
bp = (spark.read.table("ukb_records")
.where(F.col("field_id").isin([4079, 4080]))
.groupBy("eid")
.pivot("field_id").agg(F.first("value")))
death = spark.read.table("death_register") # 含 date_of_death, cause_icd10
analysis = (bp.join(death, "eid", "left")
.withColumn("yrs_to_death",
F.datediff("date_of_death", "assessment_date") / 365.25))
要点:eid 是唯一允许跨表关联的键;任何「用其他字段二次识别参与者」的尝试违反政策。
§4.2 临床链接表结构
| 表 | 关键字段 | 粒度 |
|---|---|---|
| HES 住院 | eid、episstart/episend、ICD-10 诊断(多诊断位)、OPCS 操作 | 就诊事件(episode) |
| GP 初级保健 | eid、事件日期、Read Code/CTV3、处方 | 临床事件 |
| 癌症登记 | eid、诊断日期、ICD-O-3 形态学、分期 | 肿瘤诊断 |
| 死亡登记 | eid、死亡日期、主死因/伴随死因 ICD-10 | 死亡事件 |
| COVID 专项 | eid、检测/接种/住院 | 事件 |
疾病定义的通行做法:ICD-10 代码清单 + 日期窗(如「任一 episode 主诊断为 I21.x」=心肌梗死);社区有成熟 phenome 级代码库(如 CALIBER、UKB-G出的 PheWeb 实现)——自造标签前先查现成定义。
§4.3 基因组数据规格
| 数据 | 格式 | 坐标 | 规模 |
|---|---|---|---|
| WGS | CRAM/BAM | GRCh38 | 490,640 人,32.5X |
| WES | pVCF/PLINK | GRCh38 | 50 万 |
| imputed | BGEN | 与 array 对齐(版本口径 GRCh37/38 均有) | 96M SNP |
| 衍生(GRM/QC) | PLINK/Hail | — | Consortium 提供 QC 版本 |
分析栈建议:Hail(RAP 原生支持)做 GWAS/GRM/rare-variant burden(SKAT 类);PLINK2 做经典管线;SAIGE/REGENIE 做大规模二分类/数量性状回归(UKB 社区事实标准)。
§4.4 影像数据规格
- 原始层:DICOM(按模态/访问批次组织);NIfTI 转换版官方提供(部分模态)。
- IDP 层:数千个影像衍生表型的 CSV 表(含批次中心、设备版本协变量)。
- 批次变量:影像中心(Cheadle 等)、设备版本、访问批次——影像分析的标准协变量集。
- 注意:影像仅覆盖复邀 10 万人子集(与 WGS 交集约 9 万+,实查 release)——影像×WGS 分析的样本量以此交集为准。
§4.5 DAIMS 字段字典(常用字段)
| 字段(Field ID) | 语义 |
|---|---|
| eid | 参与者唯一标识 |
| 31 | 性别 |
| 34 / 52 | 出生年 / 出生月 |
| 21000 | 自报 ethnicity(Array) |
| 4079 / 4080 | 舒张压 / 收缩压(Instance 0/1/2) |
| 21001 | BMI |
| 738 | 平均家庭收入 |
| 20116 | 吸烟状态 |
| 1558 | 酒精摄入频率 |
| 41270 / 41280 | HES 诊断 ICD-10 / 操作 OPCS |
| 40001 / 40000 | 死亡主因 / 死亡日期 |
| 40005 / 40006 | 癌症诊断日期 / ICD-10 |
| 40007 / 40008 | 癌症形态学代码 / 行为代码 |
| 25781+ | 影像 IDP 系列(管线版本化) |
§4.6 下载与取数参考代码
# RAP 环境:表格数据用 dx 命令 + Spark;示例为提取并导出聚合结果
# 1) 浏览数据资产
dx ls genetic: | head
# 2) 提取字段子集(dx extract_dataset 生成提取配置)
dx extract_dataset ukb_records.csv -o extraction.py --list-keys
# 3) Spark 读取并聚合(结果须为聚合/匿名形式方可导出)
import pyspark.sql.functions as F
df = spark.read.csv("bulk/ukb_records.csv.gz", header=True)
summary = df.groupBy("field_id").count()
summary.write.csv("analysis/summary_counts")
# 4) 导出聚合结果(走 Review Submissions 白名单审查)
dx upload analysis/summary_counts -p
导出纪律:个体级数据(含 eid 的表)不可导出;可导出的是聚合统计、模型权重、图表——RAP 的 Review 机制强制执行这一点(坑点 2)。
§4.7 WGS 分析的最小管线(Hail)
# RAP 上 490,640 人 WGS 的 Hail 骨架(GWAS 单点回归)
import hail as hl
mt = hl.read_matrix_table("genetic:/ukb_wgs_qc/ukb_wgs.mt")
# 1) 基础 QC(Consortium QC 版本可跳过部分步骤)
mt = mt.filter_rows(mt.info.AF > 0.001)
mt = mt.filter_rows(mt.variants_qc.call_rate > 0.95)
# 2) 表型合并(HES 心梗标签 + 年龄/性别/PC 协变量)
pheno = hl.import_table("analysis/mi_pheno.tsv", key="eid", impute=True)
mt = mt.annotate_cols(**pheno[mt.s])
# 3) SAIGE/REGENIE 为主流——此处展示 Hail logreg 最小版
gwas = hl.logistic_regression_rows(
test="firth",
y=mt.mi_case, x=mt.GT.n_alt_alleles(),
covariates=[mt.age, mt.sex, mt.PC1, mt.PC2, mt.PC3,
mt.PC4, mt.PC5, mt.PC6, mt.PC7, mt.PC8,
mt.PC9, mt.PC10],
)
gwas.write("analysis/mi_gwas.mt")
大规模实践的分工:**REGENIE 第一步(全人群)+ 第二步(关联)**是 50 万级事实标准;Hail 适合灵活探索;单点 GWAS 之后走 fine-mapping/FUMA 注释——顺序不要跳。
§4.8 数据完整性验证清单
- 样本数对账:所用 release 的实测样本数(490,640 类口径)vs 你拉到的 eid 数——差异来自撤回/子集过滤。
- field 版本核对:Showcase 字段 changelog diff(单位/枚举修订)。
- QC 状态确认:WGS 用 Consortium QC 版本还是自 QC——混用会让关联结果漂移。
- 影像批次齐全:10 万影像按批次分批到齐——分析前确认所含批次。
- EHR 时间窗:GP 数据截断日期(2016/2017)与结局窗匹配——超窗的「结局」其实是截断伪影。
- IDP 管线版本:IDP 表版本声明。
- 交叉校验:子集样本量与官方 highlights 对表(影像 10 万/蛋白 5.4 万)。
- 撤回同步:最近一次 UKB 撤回通知后的数据刷新。
§4.9 数据血缘示例
一次「肝脂肪影像-基因关联」的血缘:
UKB 影像复邀 10 万人
→ 腹部 MRI PDFF(肝脂肪分数)IDP 提取(锁管线版本)
→ 与 WGS 490,640 交集(约 9 万+ 实查)
→ 协变量:年龄/性别/ ancestry PCs/影像中心/设备版本
→ REGENIE 两步(全基因组单点)
→ 命中位点 → eQTL/pQTL 共定位(对照 gnomAD 频率做 QC)
→ MR 验证(肝脂 → 肝癌/糖尿病结局,用 HES/死亡登记)
→ 导出聚合 Manhattan 表 + 关联摘要 → 论文
§5 下游分析协议
§5.1 任务-数据-工具速查
| 任务 | 数据 | 工具 |
|---|---|---|
| 单点 GWAS(50 万级) | WGS/BGEN + 表型 | REGENIE / SAIGE / Hail |
| PRS 构建与验证 | imputed + GWAS 摘要 | PRSice / LDpred2 / lassosum |
| 罕见变异 burden | WGS + 基因注释 | SKAT/burden(Hail/REGENIE) |
| MR 药物靶点验证 | pQTL/暴露 + HES 结局 | TwoSampleMR / MendelianRandomization |
| 影像 IDP×GWAS | IDP + WGS | REGENIE(数量性状)+ FUMA |
| 影像深度学习 | DICOM/NIfTI | MONAI / nnUNet / 自监督(BYOL 类) |
| 多模态风险建模 | 全量表格 + 影像 + 基因 | XGBoost 基线 → 深度融合 |
| 生存分析 | 基线 + HES/死亡 | Cox / 随机生存森林 / DeepSurv |
§5.2 疾病结局定义协议
UKB 结局定义的标准流程(以心梗为例):
- 代码清单:ICD-10 I21.x(HES 主诊断)+ 死亡主因 I21——现成库(CALIBER)先查。
- 时间定义:首次诊断日期(基线后)——基线前患病要排除( prevalent 过滤,用 HES 全历史+GP)。
- 敏感性分析:主诊断 vs 任一诊断位、含 GP 代码 vs 不含——报告两套口径。
- 竞争风险:死亡为竞争事件(Fine-Gray)——老年队列必须考虑。
- 患病率校正:healthy volunteer effect——绝对风险外推前做一般人群加权(§2.7)。
§5.3 GWAS 管线的 UKB 专属细节
- 分层 ancestry:全量混合 GWAS 会被结构污染——欧洲主分析 + 非欧独立/交叉验证是社区惯例。
- 协变量标准集:年龄、性别、21 个遗传 PCs(Consortium 提供)、array、评估中心(部分表型)。
- REGENIE 两步:Step 1 全样本拟合(含 LOCO 预测)→ Step 2 染色体级关联——50 万级内存友好。
- 多重检验与解释:5e-8 基因组显著 + FDR;摘要统计上传 GWAS Catalog(政策鼓励)。
- 复现包:RAP 项目代码共享(GitHub 有官方示例)——REGENIE/Hail 版本固定。
§5.4 影像 AI 管线
- 预处理:N4 偏场、配准(脑:MNI152;心:cine 时相对齐)、颅骨剥离——官方或自建(nnUNet)。
- 自监督预训练:10 亿图像规模支持 BYOL/DINO 类预训练——预训练后小样本下游(脑龄、疾病分类)效率显著提升。
- IDP 回归基线:影像深度模型必须对照「直接用 IDP + XGBoost」基线——IDP 已浓缩大量信息。
- 批次校正:中心/设备版本作为协变量或 ComBat——UKB 影像的批次效应研究很多,先读再训。
- 泛化验证:UKB(英国中年)→ ABIDE/ADNI/内部数据(不同年龄/设备)——域偏移显式报告。
§5.5 PRS 的 UKB 实操
- 来源摘要:外部 GWAS 摘要(避免样本重叠)或 UKB 内部交叉(train/test 切分声明)。
- 方法对比:P-tuning(PRSice)vs Bayesian(LDpred2)vs 功能加权——报告多方法稳定性。
- ancestry 校准:欧洲训练 → 非欧验证的跨 ancestry 衰减是已知现象——报告每 ancestry 的 R²/OR 增量。
- 增量价值:PRS 增量 vs 临床风险因子(家族史/血压/血脂)——CDC 模型(临床 + PRS)是监管讨论的基准。
- 报告:标准化量纲(单位方差标准化 PRS per SD OR)+ 校准曲线。
§5.6 计算成本预算
| 环节 | 量级 | 参考成本构成 | 备注 |
|---|---|---|---|
| 访问费(Tier 3) | WGS/影像 | £9,000/3 年 + £3,000/年 | 不含 VAT |
| RAP 计算费 | 按量 | GWAS 单项目数千-万元级 | Spark/Hail 时数×实例 |
| 影像预处理 | 10 亿图像 | GPU 时主导 | 分批+缓存策略 |
| WGS 全量 QC+GWAS | 49 万人 | REGENIE Step1 集群天级 | Consortium QC 可复用 |
| 深度学习训练 | GPU 时 | 单项目数千 GPU 时 | 自监督预训练占大头 |
预算原则:访问费只是入场券——计算费、存储费、人力(RAP 学习曲线)合计常为访问费的数倍;教学/试点用 Tier 1 数据先跑通管线再升级。
§5.7 常见失败模式与诊断
- Join 后样本数对不上:instance/array 未处理(同一 field 多列)或撤回未同步——先 groupBy(eid).count() 对账。
- 结局「太多」:用了任一诊断位且含基线前历史——prevalent 过滤 + 主诊断口径复核。
- GWAS 全是Population structure 信号:混 ancestry 或 PCs 不足——分层重跑。
- 影像模型分数虚高:批次泄漏(同中心同批样本跨 train/test)——按批次分层切分。
- MR 结果翻车:LD 参照不对(用非欧洲 LD 面板配 UKB 欧洲)或弱工具变量——F 统计量与 Steiger 方向性检验。
- PRS 效应消失:样本重叠(训练 GWAS 含 UKB 验证集)——换独立 GWAS 或显式校正。
- RAP 作业卡死:全表扫描没有分区——Spark 分区/Hail 分块重写。
- 导出被拒:导出了含 eid 的个体级表——改聚合/模型权重再走 Review。
§6 实证结果与方法学分析
§6.1 WGS 主论文的实证要点
Nature 2025(490,640 人 WGS)的实证结构:
| 实证项 | 数字/设计 | 意义 |
|---|---|---|
| 变异发现 | 约 15 亿(SNP+indel+SV) | 较 array 18.8 倍、较 WES 40+ 倍 |
| 平台统一 | NovaSeq 6000,32.5X(≥23.5X) | 跨人可比性 |
| ancestry 关联 | 欧洲主导;非洲/亚洲有强或新信号 | 多 ancestry 可行性与局限并存 |
| 非编码变异 | 编码+UTR+非编码 SV 精确分型 | 调控区药物靶点验证打开 |
| 功能证明 | eQTL/选择性约束应用示例 | 罕见非编码变异优先级方法学 |
方法论启示:大规模 WGS 项目的价值释放不在测序而在「统一 QC + 表型链接」——15 亿变异 × 50 万表型字段的对齐才是资源本体。
§6.2 影像-基因关联的规模化成果
UKB 影像扩展开启的 IDP×GWAS 范式(文献图景):
- 脑影像遗传度全面重估:数千 IDP 的 SNP 遗传度系统估计——传统体积表型之外的扩散/功能连接遗传度绘制。
- 共享位点发现:帕金森、精神分裂等疾病位点与脑结构 IDP 的共定位——「影像作为中间表型」的证据链。
- 方法学溢出:UKB 的规模迫使 GWAS 工具链升级(REGENIE/SAIGE 的出现与 UKB 直接相关)。
- AI 含义:影像预测模型(脑龄等)的「遗传锚定」研究——预测目标与遗传结构的对齐成为新方向。
§6.3 药物靶点验证流程
UKB 已成为药企靶点验证的行业基础设施(pQTL+结局的 MR 链条):
靶点蛋白 X
→ Olink 蛋白组 5.4 万人中找 X 的 pQTL(顺式优先)
→ 工具变量强度检验(F 统计量 > 10)
→ MR:X 遗传代理 → HES/死亡登记的疾病结局
→ 敏感性:Steiger 方向性、异质性、多 IV 方法一致
→ 输出:支持/不支持靶点-疾病因果 + 效应量级
这个流程与 gwas-catalog(关联证据)、```
这个流程与 gwas-catalog(关联证据)、ClinVar(变异致病性)、gnomAD(频率对照)串成完整的靶点证据链(变异致病性)、gnomAD(频率对照)串成完整的靶点证据链——UKB 提供的是「人群因果段」。
§6.4 结果解读的三层框架
- 资源层:规模/费用/治理数字以官网与 Nature 论文为准(注意 release 时点)。
- 关联层:GWAS/MR/影像关联结论绑定 ancestry 与 QC 口径——移植前检查。
- 推断层:「UKB 证明 XX 导致 YY」多为过度简化(MR 假设敏感)——技术写作回到原始论文限制节。
§6.5 与其他资源的接力
| 资源 | 接力内容 |
|---|---|
| gnomAD | 变异频率背景(UKB 不提供公开频率) |
| GWAS Catalog | 关联证据的汇总与规范化(UKB 摘要统计的归宿之一) |
| ClinVar | 变异临床意义注释 |
| HPRC/T2T | 参考结构(UKB WGS 分析的坐标与图谱参考) |
| All of Us | ancestry 多样化对照与复制 |
| CKB/ChinaMAP | 亚洲人群验证 |
| UKB- BiLEVE/Axialis 等 | 专项扩展(烟酒、心理健康等子研究) |
§6.6 坑点(Pitfalls)
以下 8 个坑点均来自官方文档约束或社区高频失败模式,每条标注来源。
坑点 1:把「50 万人」当统一分母
503,317 招募 ≠ 490,640 WGS ≠ 10 万影像 ≠ 5.4 万蛋白组 ≠ 23 万 GP——每个子集样本量独立且随 release 浮动。方案书按子集口径写,引用标 release。(来源:官网 highlights + Nature WGS 论文)
坑点 2:试图本地下载或导出个体级数据
数据不出云是政策刚性:RAP 上可分析,个体级导出会被 Review 拒绝;整包下载不存在通道。设计分析架构时直接按「云端分析 + 聚合导出」规划,别为本地集群留幻想接口。(来源:RAP 政策)
坑点 3:预算只算访问费
Tier 3 £9,000 只是入场券——RAP 计算费(Spark/Hail/GPU 时长)、存储费、人力学习曲线合计常为数倍。10 亿图像的预处理尤其烧 GPU。立项预算按「访问费 × 3-5」起步。(来源:RAP 计费模型 + 社区经验)
坑点 4:忽视频率对照——UKB 不提供公开频率
需要等位基因频率对照时用 gnomAD(80 万+人),别把 UKB 受控基因型当频率源复用。引用频率数字时源出处写清(坑点 1 的跨库版本)。(来源:资源定位差异)
坑点 5:混合 ancestry 的 GWAS 与 PRS
欧洲 ancestry 主导(英国 40-69 岁采样决定)——混跑全量会出结构伪信号;PRS 跨 ancestry 移植衰减是文献反复出现的负结果。标准动作:主分析欧洲 + 非欧独立 + 跨 ancestry 报告衰减。(来源:Nature WGS 论文明示)
坑点 6:不读 Showcase 直接猜字段
数千 Field × Instance × Array 的取数体系——列名猜错/instance 混用是新手第一大坑(如把 Instance 1 复访值当基线)。Showcase 的字段文档免费公开,申请前就能做功课。(来源:Showcase 体系)
坑点 7:结局标签不分来源与截断
HES(住院主/任一诊断位)、GP(至 2016/17 截断)、死亡登记(全量)——三源标签的灵敏度/特异度不同。GP 截断后的「无记录」不是「无病」;老年队列死亡是竞争事件(Fine-Gray)。(来源:链接数据文档)
坑点 8:healthy volunteer effect 不校正
UKB 参与者比一般人群健康(死亡率更低)——绝对风险直接外推会低估患病率;部署模型的先验要用目标人群重加权。相对效应(RR/HR 内部比较)受影响较小。(来源:社区方法学文献)
§6.7 审稿人视角自查清单
- 子集样本量按所用 release 实查并声明(勿用「50 万」糊弄)。
- ancestry 分层与分析策略明确(欧洲主分析 + 跨 ancestry 报告)。
- 协变量标准集(年龄/性别/21 PCs/评估中心)声明。
- 结局定义来源(HES/GP/死亡)与 prevalent 过滤声明。
- QC 版本(Consortium QC vs 自 QC)声明。
- 影像研究声明批次/中心协变量与 IDP 管线版本。
- 健康志愿者效应与外推局限在限制节明示。
- 数据使用声明(RAP、批准号、Tier)+ 参与者致谢。
§7 AI 就绪指南与应用场景
§7.1 UKB 在医疗 AI 中的四种喂法
- 风险预测监督学习:基线表型(问卷/体测/基因/影像/代谢组)→ 未来疾病(HES/死亡)——多模态融合 + 生存建模的人群级训练场。
- 影像自监督预训练语料:10 亿张 MRI——BYOL/DINO/MoCo 类预训练的公开最大医学影像语料之一;预训练编码器向下游(ADNI/ABIDE/内部数据)迁移。
- 遗传先验注入:PRS/多基因架构(polygenic architecture)作为模型特征或正则——「基因信息增强的临床预测」范式。
- 因果特征工程:MR 筛选的因果暴露(蛋白/代谢物/影像 IDP)作为模型特征——相关性特征与因果特征的对照实验场。
四种喂法与 §6 八坑点的对应:喂法 1 踩坑 3(结局定义)与坑 8(HVE);喂法 2 踩坑 5(影像批次)与坑 6(GPU 预算);喂法 3 踩坑 4(ancestry);喂法 4 踩坑 2(Field 取数)与坑 7(MR 方向性)——建模前回读 §6 逐条对号。
§7.2 多模态风险模型实操配方
#!/usr/bin/env python3
"""UKB 多模态风险模型数据准备骨架(RAP Spark 版)。
目标:基线表型 + PRS → 未来 5 年心梗风险(HES 标签)。
输出:X(特征)+ y(时间到事件)训练矩阵的聚合特征工程。"""
from pyspark.sql import SparkSession, functions as F
spark = SparkSession.builder.getOrCreate()
def build_cohort(spark):
# 1) 基线特征:血压/BMI/吸烟/饮酒/收入(Field-Instance 显式)
fields = {"4079": "dbp", "4080": "sbp", "21001": "bmi",
"20116": "smoking", "1558": "alcohol", "738": "income"}
base = None
for fid, name in fields.items():
f = (spark.read.table("ukb_records")
.where((F.col("field_id") == fid) & (F.col("instance") == 0))
.select("eid", F.col("value").cast("double").alias(name)))
base = f if base is None else base.join(f, "eid", "outer")
# 2) PRS:外部预计算得分表 join(eid → prs)
prs = spark.read.table("analysis/prs_scores").select("eid", "prs")
# 3) 结局:HES 心梗(I21.x 主诊断,基线后)首次日期 + 死亡竞争
hes = spark.read.table("hes_episode")
mi = (hes.where(F.col("icd10").startswith("I21"))
.groupBy("eid").agg(F.min("episstart").alias("mi_date")))
return base.join(prs, "eid", "left").join(mi, "eid", "left")
if __name__ == "__main__":
print("骨架示例——生产版补 prevalent 过滤/竞争风险/缺失策略")
工程要点:Instance 显式选 0(基线);prevalent(基线前 MI)排除用 HES 全历史;竞争风险用 Fine-Gray 或时变 Cox。
§7.3 影像自监督预训练配方
- 数据流:RAP 上 DICOM/NIfTI → 分批 GPU 作业 → patch(3D cube 64³ 或 2D 256²)→ 预训练(BYOL3D/DINO 风格)。
- 规模策略:先脑 MRI T1 单模态打样(数据同质)→ 扩多模态/多中心混合。
- 下游基准:脑龄回归(与 UKB IDP 基线对照)、ADNI AD 分类迁移、UKB 内部小样本疾病检测。
- 基线对照:IDP + XGBoost、ImageNet 2D 迁移、公开预训练(MedicalNet 等)——自监督增益必须过这三关。
- 算力现实:10 亿图像全量预训练是数万 GPU 时级——务实做法是「分层采样打样 + 领域课程扩展」。
§7.4 公平性与人群外推
- UKB ancestry 偏斜的结构性:英国中年人群采样决定——AI 模型的跨 ancestry 性能衰减要显式测量(分层 AUC/校准)。
- healthy volunteer effect 的模型含义:部署环境的患病率/协变量分布不同——用目标人群重加权或多域训练。
- 年龄窗:40-69 岁招募——老年疾病(80+)与青年疾病的样本结构不对称;时序外推注意随访年龄增长带来的事件累积。
- 政策面:保险业禁入(2025-01)提示 AI 团队:模型用途的商业边界与数据授权范围要一起设计。
§7.5 任务×资源速查表
| 任务 | UKB 数据 | 标签 | 基线 | 外推验证 |
|---|---|---|---|---|
| 心血管风险 | 基线+PRS+影像 | HES I21/I50 | Framingham/Cox | CKB/内部 |
| 脑龄预测 | 脑 MRI | 年龄 | IDP 回归 | ADNI/ABIDE |
| 痴呆预测 | 影像+基因+认知 | HES F00-F03 | Cox+APOE | All of Us |
| 肝脂遗传 | 腹 MRI PDFF | IDP | GWAS 常规 | CKB 代谢组 |
| 蛋白-疾病 MR | Olink+HES | 登记结局 | 两样本 MR 敏感性 | 国际 pQTL 联盟 |
| 环境暴露-健康 | 环境图层+结局 | 登记结局 | 生态学对照 | 外部环境数据 |
§7.6 端到端案例:痴呆五年风险模型
- 队列:60 岁+、基线无痴呆(HES/GP 排除 prevalent)。
- 特征栈:脑 MRI IDP(海马体积等)+ PRS(AD GWAS)+ APOE + 认知测试 + 心血管因子。
- 模型:Cox 基线 → XGBoost 生存 → 深度多模态(各模态先单独、后门控融合)。
- 评估:5 年 AUC + 校准 + 决策曲线(DCA);按 ancestry/性别分层报告。
- 外推:All of Us 复制集(不同医疗体系)。
- 报告:数据版本(release)、分析代码(RAP 项目引用)、参与者致谢——三件套齐全。
§7.7 报告模板:方法学段落骨架
本研究使用 UK Biobank 数据(申请号 XXXX;release 2025-XX)。参与者为 2006-2010 年招募的 503,317 名 40-69 岁英国志愿者,本分析纳入基线后随访的 N 人(剔除 prevalent XXXX 后)。基因组数据使用 UKB WGS Consortium 发布的 490,640 人全基因组测序(32.5X,GRCh38,Consortium QC 版本);影像使用多模态 MRI 及官方 IDP(管线版本 X)。疾病结局定义基于 HES 住院记录(ICD-10 主诊断)与死亡登记,代码清单遵循 CALIBER;竞争风险以 Fine-Gray 回归处理。分析在 UKB Research Analysis Platform(RAP)上进行,协变量含年龄、性别、遗传主成分前 21 项与评估中心。本研究遵循 UK Biobank 数据使用政策,感谢 UK Biobank 参与者。
§7.8 成本与排期模板
| 阶段 | 内容 | 成本构成 | 周期 |
|---|---|---|---|
| 立项 | Showcase 字段功课 + 申请 | 人力 | 2-4 周(含审查) |
| 入场 | Tier 费用 + RAP 开通 | £3,000-9,000 | 与审批并行 |
| 打样 | Tier 1 数据管线跑通 | RAP 计算费小额 | 2 周 |
| 扩展 | Tier 3 数据 + 影像/GWAS | 计算费大头 | 4-8 周 |
| 论文 | 敏感性 + 复现包 | 人力 | 2-4 周 |
先「Tier 1 打样」后「Tier 3 扩展」的节奏可避免计算费空烧——RAP 学习曲线在廉价数据上完成。
§7.9 模型选型与迁移决策
UKB 上的模型选型与通用 ML 不同——数据不出云约束了框架可用性,人群级样本量改变了模型偏好:
- 表格/队列任务(基线→结局):样本量 50 万级时,梯度提升树(XGBoost/LightGBM)与 Cox/Aalen 回归仍是强基线——深度模型要证明「增量足够抵消解释性损失」才值得上。RAP 上 XGBoost 有托管版本,起步零配置。
- GWAS/回归大规模扫描:REGENIE(分步:LD 降维 + 分布式回归)是 UKB 事实标准——50 万 × 数百万变异的直接回归不可行;SAIGE 处理不平衡二分类(罕见结局);Hail Query 用于矩阵级 QC 与 PRS 计算。
- 影像建模:卷积(ResNet/DenseNet)做 IDP 回归已有官方管线对照;ViT/Swin 类要 10 万样本以上才显优势;自监督(SimCLR/BYOL)是预训练主流——RAP GPU 项目池按批次排队,先算好 GPU 时预算。
- 多模态融合:门控/注意力融合优于早期拼接(模态缺失模式差异大——影像 10 万 vs 基线 50 万,缺失本身有信息);缺失模态的鲁棒性要进评估协议。
- 框架可用性:RAP 支持 Spark/Hail/PyTorch/TensorFlow/R;不走 RAP 的框架(如需自建集群的分布式训练)先确认 DX App 构建路径——平台依赖是真实约束。
- 迁移与部署边界:UKB 训练的模型导出权重到本地部署是允许的(模型 ≠ 个体级数据)——但训练代码、中间统计(可能小 Cell)的导出走 Review;部署前用目标人群校准(HVE 与 ancestry 偏斜在此兑现)。
选型速查:表格任务 → LightGBM + Cox;规模扫描 → REGENIE/SAIGE;影像 → 自监督编码器 + 任务头;多模态 → 门控融合 + 缺失鲁棒评估;任何模型 → 先 Tier 1 子集打样再放量。
§8 伦理、许可与合规
§8.1 申请制的政策结构
UKB 的访问是「许可制研究合作」而非数据开放:
- 资格:认可研究机构(大学/医院/公司研发部门)的研究者;申请人背景资格审查;机构 signing official 签署。
- MTA 与政策:签署材料转让协议与数据使用政策——核心义务:按批准目的使用、不可重识别、不出借、不转售、参与者撤回遵从。
- 费用分层(2021-04 起):Tier 1(£3,000/3 年 + £1,000/年)覆盖基线与常规数据;Tier 3(£9,000/3 年 + £3,000/年)覆盖 WGS/WES/影像;额外协作机构 +£1,000;低收入国家/学生 £500(不含 VAT)。
- 审批类别:敏感字段(心理健康、性少数、犯罪记录相关等)走额外伦理审查。
- 动态治理:2025-01 起保险公司不予直接访问;2026 年中 RAP 升级期暂停新申请——政策随社会关切演进,申请前读最新版。
§8.2 不可重识别的工程含义
UKB 的「去标识」不只是删名字:
- eid 化:参与者唯一标识为随机 eid,与 NHS 编号的映射只在 UKB 内部。
- 时间泛化:部分日期字段模糊化(如出生仅到年月)。
- 小 Cell 保护:极小子集(如罕见病×罕见 ancestry 交叉)的导出受审查。
- 使用者的义务:不尝试链接外部数据反推身份、不在论文/代码中发布可识别组合——导出 Review 是执行闸门。
§8.3 致谢与引用模板
致谢模板(按需裁剪):
This research has been conducted using the UK Biobank Resource under
Application Number XXXX. We are grateful to the UK Biobank participants
for their contribution. Genomic data were provided by the UK Biobank
Whole-Genome Sequencing Consortium (Nature 645, 692-701, 2025). Imaging
data were acquired by the UK Biobank imaging study. Analysis was performed
on the UK Biobank Research Analysis Platform.
引用清单:Sudlow et al. 2015 PLoS Med(资源描述)+ UKB WGS Consortium 2025 Nature(若用 WGS)+ 影像文献(Littlejohns 2020 Sci Data,若用影像)+ 所用 field 的专项方法论文。
§8.4 商业使用的边界
- 允许:商业机构(药企/生物技术)按同一流程申请研究使用——费用同表。
- 禁止:保险公司直接访问(2025-01 政策);就业/信用决策相关用途与「健康研究目的」不符。
- 产品化:基于 UKB 训练的模型产品化——按政策与法务口径自查(训练数据使用合规 + 输出不含个体可识别信息)。
- 跨境:RAP 云端访问的合规设计天然支持国际协作(60+ 国)——但遵守本国数据出境法规仍是使用者责任。
§8.5 国内团队合规清单
- 机构资质:UKB 要求认可研究机构——国内高校/医院/企业研发部门按其审核流程认定。
- 数据性质:UKB 为境外人群数据(非中方人类遗传资源)——使用其数据一般不触发《人类遗传资源管理条例》的出境审批,但「中英合作采集中方样本」类项目另论。
- 成果发表:按期刊与 UKB 政策双重要求致谢与声明。
- 模型入境:把 UKB 训练的模型(权重非数据)带回国内部署——权重不属于人类遗传材料,但临床用途按 NMPA 途经另行管理。
- 免责声明:以机构法务与伦理委员会意见为准。
§8.6 数据使用红线速记
- 不重识别(含外部数据链接反推)。
- 不出借/转售数据或账号。
- 不越类别使用(申请的类别 = 实际用途)。
- 不把科研结论直接用于个体保险/雇佣决策。
- 撤回遵从:UKB 通知的撤回名单及时执行。
- 导出走 Review:个体级数据不出云。
§9 谱系与生态
§9.1 人群队列资源时间线
1948 Framingham 心脏研究(队列范式起点)
2006 UK Biobank 招募启动(50 万人设计公布)
2010 UKB 基线招募完成(503,317)
2012 CKB(China Kadoorie Biobank)50 万人基线
2014 UKB 影像扩展启动
2018 All of Us 计划全面启动(美)
2021 UKB 访问费用分层
2023 UKB 全量 50 万 WGS 发布(全球最大 WGS 数据集)
2025 UKB WGS Nature 论文;影像 10 万里程碑
2026 All of Us / UKB 双巨头格局;UKB 18,000+ 论文
§9.2 术语表
| 术语 | 定义 |
|---|---|
| eid | 参与者唯一匿名标识(跨表主键) |
| Field ID / Instance / Array | 字段三级取数体系(字段-重复测量-多元素) |
| UKB-RAP | Research Analysis Platform,官方云分析平台(DNAnexus) |
| Data Showcase | 免费公开的字段文档浏览器 |
| HES | Hospital Episode Statistics,英国医院住院统计 |
| GP 链接 | 初级保健记录链接(约 23 万人) |
| IDP | Image Derived Phenotype,影像衍生表型 |
| PDFF | 质子密度脂肪分数(肝脂肪 MRI 定量) |
| PRS | 多基因风险评分 |
| MR / pQTL | 孟德尔随机化 / 蛋白数量性状位点 |
| healthy volunteer effect | 健康志愿者效应(队列比一般人群健康) |
| prevalent / incident | 基线前已有 / 基线后新发 |
| Tier 1 / Tier 3 | 访问费用分层(Tier 3 覆盖 WGS/WES/影像) |
| MTA | 材料转让协议 |
| Fine-Gray | 竞争风险回归模型 |
| REGENIE / SAIGE | 大规模 GWAS 回归工具(UKB 事实标准) |
| CALIBER | 现成 EHR 疾病定义代码库 |
| dx | DNAnexus 命令行工具(RAP 的操作接口) |
§9.3 资源选型决策树
你的需求是什么?
├─ 「疾病风险预测模型(人群级)」
│ → Tier 1 基线+结局起步,验证后加 PRS/影像
├─ 「影像 AI 预训练」
│ → Tier 3 影像 + 自监督打样 → 分层扩展
├─ 「药物靶点因果验证」
│ → Olink pQTL + HES 结局 MR(§6.3 流程)
├─ 「GWAS/罕见变异」
│ → WGS/BGEN + REGENIE(Consortium QC 复用)
├─ 「跨 ancestry 验证」
│ → All of Us / CKB 复制(UKB 主分析欧洲)
├─ 「频率查询」
│ → 不用 UKB → gnomAD(受控差异)
├─ 「ICU 深度临床」
│ → MIMIC-IV(临床深度互补)
└─ 「癌症多组学纵深」
→ TCGA(疾病纵深互补)
§9.4 与本库其他条目的关系
| 条目 | 关系 |
|---|---|
| gnomad | 人群频率对照(UKB 不提供公开频率) |
| gwas-catalog | GWAS 关联汇总(UKB 摘要统计的归宿) |
| all-of-us | 美国多样化队列对照(ancestry 互补) |
| hprc | 泛基因组参考(单倍型结构对照) |
| tcga | 癌症多组学纵深(疾病队列 vs 人群队列) |
| dbgap | 受控访问模式的另一种实现(美式 DAC) |
| mimic-iv | ICU 临床深度(临床密度互补) |
§9.5 组合使用建议
| 研究设计 | 推荐组合 | 分工 |
|---|---|---|
| PRS 跨 ancestry | UKB(欧洲主)+ All of Us/CKB | 训练 + 多 ancestry 验证 |
| 靶点因果链 | UKB pQTL+MR + gnomAD 频率 + ClinVar 注释 | 因果 + 背景 + 功能 |
| 影像模型临床化 | UKB 预训练 + ADNI/ABIDE 微调 + 内部验证 | 语料 + 疾病域 + 落地 |
| 罕见变异终点 | UKB WGS + HPRC/T2T 图谱参考 | 关联 + 结构解析 |
| 生态-健康建模 | UKB 环境图层 + CKB 复制 | 暴露 + 人群验证 |
| GWAS 结果溯源 | UKB 摘要统计 + GWAS Catalog + gnomAD | 生成 + 归档 + 频率过滤 |
| EHR 定义复用 | UKB HES/GP + CALIBER + MIMIC 验证 | 链接 + 定义 + 临床深度对照 |
| 影像-基因联合 | UKB IDP + GWAS Catalog + HPRC 参考 | 表型 + 归档 + 结构解析 |
| 多组学风险建模 | UKB 全栈(基因+蛋白+代谢+影像) | 单库内闭环(独此一家) |
| 方法基准 | UKB Tier 1 + TCGA/内部数据 | 规模基准 + 疾病域外推 |
组合纪律:合并键与版本先声明(eid/eRA/ORCID 级别的跨库映射不存在——跨库只在汇总统计层合并)。跨库合并的三条安全路径:
- 汇总统计层:GWAS 摘要统计(UKB 发布的数百个全量 summary)与其他队列的 summary 做 meta-analysis(METAL/这些工具的标准输入输出)——最安全且可发表。
- 等价定义层:同一疾病用 CALIBER 定义分别在本库与 MIMIC/All of Us 计算,结果并排呈现——不做个体级合并,做「平行验证」。
- 模型迁移层:UKB 训练的模型权重导出(模型不是个体数据)到其他队列推理——保留 RAP Review 导出的合规记录。
§10 资源导航与 FAQ
§10.1 官方资源导航
| 资源 | 链接 | 用途 |
|---|---|---|
| 官网 | https://www.ukbiobank.ac.uk/ | 项目总览与政策 |
| 数据说明 | https://www.ukbiobank.ac.uk/?p=15 | 八类数据与 highlights |
| 研究者入口 | https://www2.ukbiobank.ac.uk/use-our-data | 申请与费用 |
| Data Showcase | https://biobank.ndph.ox.ac.uk/showcase/ | 字段文档(免费) |
| UKB-RAP | https://ukbiobank.dnanexus.com/ | 云分析平台 |
| WGS 论文 | https://www.nature.com/articles/s41586-025-09272-9 | 490,640 人 WGS |
| 申请页 | https://www.ukbiobank.ac.uk/enable-your-research/apply-for-access | 流程与资格 |
| 社区 | https://community.ukbiobank.ac.uk/ | 研究者问答 |
§10.2 关键文献速查
- Sudlow, C. et al. UK Biobank: An Open Access Resource for Identifying the Causes of a Wide Range of Complex Diseases of Middle and Old Age. PLoS Med 12, e1001779 (2015). DOI 10.1371/journal.pmed.1001779
- UK Biobank Whole-Genome Sequencing Consortium. Whole-genome sequencing of 490,640 UK Biobank participants. Nature 645, 692-701 (2025). DOI 10.1038/s41586-025-09272-9
- Littlejohns, T.J. et al. The UK Biobank imaging enhancement of 100,000 participants. Sci Data 7, 292 (2020). DOI 10.1038/s41597-020-00552-y
- Bycroft, C. et al. The UK Biobank resource with deep phenotyping and genomic data. Nature 562, 203-209 (2018). DOI 10.1038/s41586-018-0579-z
§10.3 站内延伸阅读
- gnomAD — 人群等位基因频率数据库:频率查询对照
- All of Us — NIH 多样化人群队列:ancestry 互补的对照队列
- GWAS Catalog — 关联研究目录:关联证据汇总层
- HPRC — 人类泛基因组参考:基因组结构参考
- MIMIC-IV — 重症监护临床数据库:临床深度互补(本库 MIMIC 家族)
- dbGaP — 受控基因型-表型档案:受控访问模式对照
§10.4 FAQ
Q1:UKB 数据可以商用吗?
A:商业机构(药企等)按同一申请流程与费用申请研究使用是被允许的;但保险业直接访问被禁(2025-01 起),就业/信用类用途与「健康研究目的」不符。产品化训练模型前做专项合规自查。
Q2:「50 万人」和「49 万人」哪个对?
A:都对——503,317 是基线招募数,490,640 是 WGS 实测完成数。不同子集(影像 10 万、蛋白 5.4 万)另有口径。引用时写明子集与 release。
Q3:可以下载数据到本地吗?
A:不可以整体下载——UKB 数据只能在 RAP 云端分析,可导出的是聚合统计/模型/图表(走 Review)。这是政策刚性,别在设计里假设本地集群。
Q4:总费用大概多少?
A:访问费 Tier 1 £3,000/3 年起、Tier 3 £9,000/3 年起(WGS/WES/影像);RAP 计算费按量另计,重计算项目(影像/GWAS)计算费常为数倍于访问费。学生/低收入国 £500。
Q5:申请要多久?
A:流程(资格审查+签署+缴费)通常数周;2026 年中 RAP 升级期曾暂停新申请——排期留缓冲并关注官网公告。
Q6:能用 UKB 做 MR 药物靶点验证吗?
A:这正是它的高频用法——Olink 蛋白组(5.4 万人)找顺式 pQTL 作工具变量,HES/死亡登记作结局。注意工具变量强度(F>10)、Steiger 方向性与异质性敏感性。
Q7:影像 10 亿张图怎么处理?
A:RAP 上按批次 GPU 作业处理;务实路径是「IDP 优先(官方已提取数千特征)→ 自提特征只做 IDP 没有的」。10 亿图全量自监督预训练是数万 GPU 时级项目。
Q8:UKB 的 PRS 能直接用到中国人群吗?
A:会显著衰减(跨 ancestry 移植是已知现象)。标准做法:欧洲训练 + CKB/ChinaMAP 独立验证 + 按 ancestry 报告 R²/OR 增量;或用多 ancestry GWAS 重训。
Q9:healthy volunteer effect 影响有多大?
A:参与者死亡率显著低于一般人群——相对效应(RR/HR 内部比较)受影响小,绝对风险外推会低估患病率。部署模型先验用目标人群重加权。
Q10:数据多久更新一次?
A:滚动 release——新组学批次(影像分批到 10 万)、字段修订、撤回同步。项目期内定期同步 release 差异并锁版本声明。
Q11:GP 数据为什么只到 2016/17?
A:初级保健数据依供应商提供,不同供应商截断不同——后批次持续更新。时序研究先查所用 release 的 GP 窗口。
Q12:和 All of Us 怎么选?
A:欧洲 ancestry 主导 + 英国 NHS 链接 + 影像深度 → UKB;美国人群多样化 + EHR 生态 → All of Us。理想是两者互为验证集。
Q13:WGS 数据是什么格式?可以直接用 VCF 吗?
A:Consortium QC 版提供 BGEN/plink2/千万人级变异矩阵等多种形态;全量原始 VCF 巨大(数 PB 级),常规分析走 imputed 或 Consortium 版——先读 WGS 论文的 supplement 再选形态。
Q14:撤回(withdrawal)怎么处理?
A:UKB 按批次从 release 中移除撤回者——同一 eid 在不同 release 可能消失;分析锁定单一 release 并在论文声明版本,不要跨 release 拼接纵向个人数据。
Q15:UKB 能做时序/纵向建模吗?
A:能但有结构——重测(Instance 1/2/3)只覆盖影像子集与部分问卷;GP/HES 天然纵向但时点不规则。把「基线 + 累积结局」与「真重复测量」区分开,别把随访记录当面板数据。
Q16:环境暴露数据(空气污染等)在哪?
A:Showcase 提供空气污染模型、噪声、绿地、夜间光照等链接字段(按住址与评估中心地理链接)——免费看文档,使用时按 Tier 1 计费。空间链接的精度上限是住址邮政区。
Q17:引用 UKB 的最小要求是什么?
A:致谢模板(§8.3)三要素:申请号 + 参与者感谢 + 所用数据来源(关键文献)。用 WGS 加引 Nature 645 (2025),用影像加引 Sci Data 7 (2020),基线设计加引 PLoS Med 12 (2015)。
§10.5 要点回顾
- 子集口径:503,317 招募 / 490,640 WGS / 10 万影像 / 5.4 万蛋白——引用写子集与 release。
- 云端纪律:数据不出云、聚合导出走 Review、个体级数据不出 RAP。
- 预算全口径:Tier 费用 + RAP 计算费 + 人力——访问费只是入场券。
- 先 Showcase 后代码:数千 Field × Instance × Array,字段文档免费公开。
- ancestry 与 HVE:欧洲主导与健康志愿者效应是两条结构性局限——分层报告与重加权是标准动作。
- 结局三源:HES/GP/死亡登记的灵敏度与截断差异——标签定义显式声明。
- 三件套:申请号 + release 版本 + 参与者致谢——UKB 论文的标准声明。
- IDP×GWAS 骨架:协变量标准集(含中心与批次)+ FDR + 遗传相关——UKB 高引用产出的标准方法学。
- 费用三段式:Tier 访问费 + RAP 计算费 + 人力排期——立项书里按 §7.8 模板算全。
- 导出边界:聚合统计/模型/图表可出,个体级数据不可出——Review 是闸门不是建议。
- AI 位置:人群级风险建模、影像预训练语料、pQTL-MR 因果——UKB 是「从人群学健康」的最大公开基础设施。
口径存照(数字均注明口径与来源,写入正文前已核对)
- 503,317 = 2006-2010 基线招募总数(PLoS Med 12, e1001779, 2015)
- 490,640 = WGS 实测完成人数,32.5X 平均覆盖(Nature 645, 692-701, 2025)
- ~15 亿 = WGS 变异位点集合(同上,含单核苷酸与插入缺失)
- 100,000 = 影像扩展 2025-07 里程碑(官网新闻;Sci Data 7, 292, 2020 为管线文献)
- 54,000 = Olink 蛋白组覆盖人数;30 万→50 万 = NMR 代谢组扩容后目标(官网项目页)
- 30 PB = 官方口径的存储总量(2025 官网);1,600 万 = 生物样本库存(官网)
- 费用 = 2021-04 起费率(Tier 1 £3,000/3 年 + £1,000/年;Tier 3 £9,000/3 年 + £3,000/年;学生/低收入国 £500;不含 VAT)
- 22,000+ 研究者 / 60 国 / 18,000+ 论文 / 6,934 项目 = 官网统计(2026-04 快照)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- impc — 共享标签:公共卫生与流行病学 / 基因组学与多组学
- alphamissense — 共享标签:公共卫生与流行病学 / 基因组学与多组学
- ckb — 共享标签:公共卫生与流行病学 / 基因组学与多组学
- multimedbench — 共享标签:基因组学与多组学 / 医学影像
- enigma — 共享标签:公共卫生与流行病学 / 医学影像
- nih-malaria — 共享标签:公共卫生与流行病学 / 医学影像
- all-of-us — 共享标签:公共卫生与流行病学 / 基因组学与多组学
- sra — 共享标签:公共卫生与流行病学 / 基因组学与多组学
- cellxgene — 共享标签:基因组学与多组学 / 医学影像
- icgc — 共享标签:基因组学与多组学 / 医学影像
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

