All of Us 研究计划 — AI-Ready Wikipedia

74.7 万参与者 · 53.5 万全基因组 · 86% 代表性不足社区:世界最大基因组+健康整合库

来源 https://allofus.nih.gov/发布时间: 2026-09-19最后更新: 2026-09-25 阅读 37
All of Us 研究计划 — AI-Ready Wikipedia

信息速览

数据集名称All of Us 研究计划 — AI-Ready Wikipedia
数据类型74.7 万参与者,53.5 万全基因组,86% 代表性不足,EHR 整合,多组学 CDRv9
规模747,000+ 参与者数据可用(匿名化;总注册超 88.3 万)
接入方式https://allofus.nih.gov/
AI 就绪度

All of Us — 研究计划 AI-Ready Wikipedia

INFOBOX

属性 内容
全称 All of Us Research Program(NIH)
启动 2018 征集启动(奠基论文 Denny NEJM 2019);目标 100 万+ 参与者
现行版本 CDRv9(2026-06-26/30 发布)——NIH 口径「世界最大的基因组+健康整合数据库」
参与者 数据可用 747,000+;总注册 >883,000(较上版 +114,000)
基因组 535,662 srWGS(>13 亿变异) + 553,949 array + 96,405 SV + 14,521 lrWGS
EHR 近 482,000 份(OMOP 标准化;较上版 +22%)
多组学(首次) proteomics 9,969(>5,000 蛋白)+ RNA-seq 8,980(含 per-ancestry QTL)
多样性 86%(645,000+)历史代表性不足社区;50 州+领地、98% 三位 ZIP
其他模态 调查 747K(社会决定因素/行为/环境)、体格测量 600K、Fitbit wearables
访问 Researcher Workbench 云平台(GCP)——Registered/Controlled 双层;RCR 培训 + 行为准则;数据免费、$300 初始云积分
版本政策 只保留最近 3 个 CDR 版本
学术影响 1,400+ 论文 / 近 23,000 研究者 / 1,200+ 机构 DUA
本库关联 究者 / 1,200+ 机构 DUA
本库关联 UK Biobank(对照)、gnomAD(频率)、MIMIC-IV(EHR 方(对照)、gnomAD(频率)、MIMIC-IV(EHR 方法学)、TCGA(癌症)

§0 E-E-A-T 信任声明与免责声明

本页所有规模数字、版本信息与访问条款均核实自一手来源:NIH 官方新闻稿(2026,「世界最大基因组+健康整合数据库」发布通告)、All of Us 官网(allofus.nih.gov,2026-09-19 检索)、官方基因组与多组学质量报告(support.researchallofus.org,CDRv9 口径 2026-06-26)、基因组数据主论文(All of Us Research Program Investigators, Nature 627:340-346, 2024)与 AJHG 年度回顾系列(2024/2025/2026)。检索核实时间为 2026-09-19。

All of Us 的数字随 CDR 版本滚动(v8 的 633,000 → v9 的 747,000+;注册数 883,000 vs 数据可用数 747,000 是两个不同口径),本页在各处显式标注 CDR 版本与口径。本页为技术参考文档,不构成临床决策依据——参与者数据经去标识化但属于受控访问资源:使用受 Data User Code of Conduct 与同意框架约束(再识别禁令、结果回报义务);任何临床结论需经独立验证。

关于偏倚:All of Us 的多样性设计(86% underrepresented)是对研究公平的历史性矫正,但队列仍是「自选志愿者队列」(更老/更多女性/更多受教育/更不健康)——外推到一般人群时声明 §7.4 的偏倚面。

§1 数据集概览

§1.0 📌 30 秒速览

  • 是什么:基因组 × EHR 的世界最大整合研究库——74.7 万人从 DNA 到生活方式的全模态健康档案(云端原位分析)。
  • 体量:535K WGS(>13 亿变异)/ 482K EHR / 553K array / 96K SV / 14.5K lrWGS / 蛋白质组+转录组(v9 首次)/ 747K 调查。
  • 访问:受控开放——注册研究者 + RCR 培训 + 行为准则;数据免费,$300 初始云积分后自费 GCP。
  • 杀手锏:多样性(86% underrepresented)+ 基因组-EHR 同人链接 + 多组学——「精准医学需要的大规模多样性人群」只有这里有。
  • 适用:跨祖源 GWAS、EHR 深表型 × 基因组、药物基因组学、健康差异研究、多组学整合建模。
  • 不适用:快速下载数据集(云端原位分析模型,无 bulk 下载)、全开放无门槛数据(受控访问)、非美国人群外推(祖源与美国语境)。

§1.1 摘要

精准医学有一个悖论:要为个体定制方案,恰恰需要极大的人群才能发现连接基因、生活方式与环境的模式——NIH 的 All of Us 计划就是对这一悖论的回答。2018 年征集启动,目标 100 万+ 美国居民,设计核心是「多样性优先」:把在生物医学研究中长期代表性不足的社区(少数族裔、老年人、残障人士、乡村居民)作为征集重点。到 CDRv9(2026-06),747,000+ 参与者的数据对注册研究者开放:535,662 条全基因组序列(超过 13 亿变异)链接近 482,000 份电子健康记录,配合调查、体格测量、wearables,并首次加入蛋白质组(9,969 样本、5,000+ 蛋白)与转录组(8,980 样本)——NIH 称之为「世界最大的基因组+健康整合数据库」。

对 AI 团队,All of Us 的价值在三个维度:

  1. 基因组-EHR 同人链接的最大公共供给:53 万基因组 × 48 万 EHR 的同人整合——PheWAS、EHR 深表型 × 基因组、药物基因组学的规模在其他公共库里不存在。
  2. 多样性的方法论红利:86% underrepresented + per-ancestry 分析工具——跨祖源 GWAS 的统计功效与公平性同时提升;2024 Nature 论文在队列内发现 2.75 亿个此前未报告的变异。
  3. 云原生的数据治理范式:数据不出云(GCP 原位分析)+ RCR 培训 + 行为准则——「受控访问的规模化」是隐私计算时代的公共数据样本。

数据的第一性事实:同意框架决定分析边界——再识别被禁止、结果回报是义务、EHR 数据经 OMOP 标准化但存在 30 万+ 人的完整性缺口——「先查数据可得性再设计分析」是 All of Us 项目的第一课。

§1.2 战略价值

  1. 精准医学的多样性矫正:基因组研究的历史偏倚(欧洲祖源主导)在 All of Us 被设计性矫正——per-ancestry QTL、多祖源关联的统计基础设施只有这里成规模。
  2. EHR 深表型的规模供给:48 万份 OMOP 标准化 EHR 与基因组同人链接——「真实世界临床语义 × 遗传变异」的 PheWAS 规模跃升。
  3. 多组学的整合起点:蛋白质组+转录组+基因组+EHR 同人——多组学整合建模(病因机制/生物标志物)的同人模态对齐全库最全。
  4. 方法学的公共标杆:参与者参与治理、结果回报(含临床级基因组结果回传)、云原生访问——「以人为本的公共队列」工程样本。

§1.3 同类数据集横向对比

资源 定位 规模量级 与 All of Us 的关系
All of Us 基因组+EHR+多组学(美国多样性队列) 747K 参与者 / 535K WGS —
UK Biobank 深表型前瞻队列(英国 40-69 岁) ~50 万参与者 / ~49 万 exome+genome 对照队列;美国多样性 vs 英国中年深度
gnomAD 变异频率参考(非队列) 80.7 万 exome/genome 频率对照(无 EHR 链接)
eMERGE EHR 基因组学网络 数十万人(多中心) 方法学前辈;规模小于 AoU
十万人(多中心) 方法学前辈;规模小于 AoU
Million Veteran Program 美国退伍军人队列 90 万+ 同为美国巨型队列
90 万+ 同为美国巨型队列;人群构成不同
FinnGen 芬兰全国 EHR 基因组 50 万+ 全国性健
TCGA 癌症多组学 1.1 万+ 癌症样本 癌症深组学 vs 人群广度
MIMIC-IV ICU EHR(单系统) ~30 万就诊 EHR 方法学参照;无基因组

§1.4 版本时间轴

2015  精准医学计划宣布(Obama 国情咨文)→ All of Us 立项
2018  征集启动(Denny NEJM 381:668-676 奠基论文)
2020  首批数据开放(约 10 万参与者;Workbench 上线)
2022  基因组数据发布启动(array + srWGS 滚动扩容)
2024  Nature 基因组主论文(245,388 临床级基因组;2.75 亿新变异)
2025  CDRv8(633,000 参与者口径;预算削减放缓征集)
2026-06  CDRv9:747,000+ 参与者 / 535K WGS / 482K EHR /
         首次多组学(蛋白组+转录组+lrWGS 扩容);
         NIH 宣布「世界最大基因组+健康整合数据库」
2026  AJHG 年度回顾(CDRv9 口径);1,400+ 论文里程碑

§1.5 应用场景矩阵

  1. 跨祖源 GWAS/精细定位:86% underrepresented + 遗传祖源辅助——多祖源关联与迁移分析。
  2. PheWAS 与 EHR 深表型:OMOP EHR × 基因组——变异到临床表型的双向扫描。
  3. 药物基因组学:PGx 辅助 calls(CYP2D6/HLA 等)+ 药物暴露 EHR——真实世界药物响应。
  4. 多组学整合:蛋白组/转录组/基因组/EHR 同人——生物标志物与机制建模。
  5. 健康差异研究:社会决定因素调查 + 环境数据 + 临床结局——SDoH × 基因交互。
  6. wearables 数字表型:Fitbit 活动 × 基因/结局——行为表型的数字生物标记。

§1.6 组件全景

All of Us 的八个数据层:

  1. 参与者核心层:匿名 person_id + 注册/同意/人口学(OMOP person 表)。
  2. 调查层:747K 响应——社会决定因素(SDoH)、行为、环境、心理健康(认知与行为健康数据 2026 新增)。
  3. EHR 层:482K——OMOP CDM 标准化(condition/drug/measurement/visit);participant-mediated 提交 + HIE 扩容。
  4. 基因组层:array 553,949 / srWGS 535,662(SNP-Indel)/ SV 96,405 / lrWGS 14,521——VCF/gVCF/CRAM + 原始文件。
  5. 多组学层(v9 新):RNA-seq 8,980(counts + per-ancestry QTL)/ proteomics 9,969(Olink 类,5,000+ 蛋白)。
  6. 辅助注释层:遗传祖源、亲缘/kinship、HLA、PGx、难检医学相关基因 calls、变异注释。
  7. 测量与 wearables 层:体格测量 600K + Fitbit 活动数据。
  8. 平台层:Researcher Workbench(GCP)——cohort builder / notebook(Jupyter/R)+ $300 初始积分;CDR 三版本滚动。

§1.7 云原生受控访问的经济学

  1. 数据不动人动:All of Us 的分发模型是「数据不出云」——分析代码进 Workbench(GCP),结果出、数据留——这是受控访问与隐私保护在 PB 级规模下的唯一可扩展解。
  2. 成本结构:数据免费(NIH 资助)+ $300 初始云积分(RCR 完成后 365 天)+ 之后 GCP 自费——「门槛在纪律不在钱」与「成本在算力不在数据」的双设计。
  3. 机构规模化:1,200+ 机构 master DUA——机构签约一次、研究者随取随用; Rural 大学与顶尖机构同权(NIH 明示的公平设计)。
  4. 版本滚动策略:只保留最近 3 个 CDR——存储成本控制与鼓励版本前行的权衡;长期纵向研究的快照自留纪律(§3.7)。

§1.8 All of Us 在研究流程中的定位

假设生成 → 队列构建 → 关联/预测分析 → 机制解释 → 转化验证
   │            │              │             │
   │            ├─ AoU:cohort builder(表型/祖源/EHR 入组)
   │            ├─ AoU:基因组 × EHR 关联(GWAS/PheWAS/PGx)
   │            ├─ AoU:多组学同人整合(机制层证据)
   │            └─ AoU:多样性分层(公平性分析内建)
   └─ gnomAD(频率对照)→ UKB(复现队列)→ 临床试验
流程阶段 AoU 角色 典型用法 验收标准
假设生成 现象发现 EHR 表型频率 × 变异 enrich 口径(CDR 版本)锁定
队列构建 入组引擎 表型+祖源+EHR 可得性过滤 入组漏斗透明
关联分析 主战场 GWAS/PheWAS/PGx 多祖源分层报告
机制解释 组学三角 蛋白/转录/基因组同人 mediator 模态对齐核验
转化 外推与复现 UKB/FinnGen 独立复现 跨队列一致

定位纪律:AoU 覆盖「美国语境的多样性人群」最厚——非美国人群结论需独立复现;发现(discovery)队列强、验证(validation)队列靠外部。

§1.9 参与者中心治理的独特设计

  1. 参与者即伙伴:All of Us 把参与者纳入治理(顾问委员会)、研究选择(participant-led 研究优先级)与结果回报(个体基因组结果回传)——「受试者」语义被「参与者」替代是有意的治理声明。
  2. 结果回报的双刃:临床级基因组结果(如遗传病风险)回传参与者——研究价值与临床责任同构;研究者分析的是「已知自己部分结果的队列」——知情状态本身是协变量。
  3. 同意的动态性:同意框架允许退出与数据撤回——快照内固定、跨版本个体可能消失;分析管线的「个体集稳定性」检查是长跑项目的必做项。
  4. 对 AI 的含义:参与者参与的数据治理预示「数据主体权利内建于数据产品」的未来——合规设计(撤回处理/结果回报/再识别禁令)应进模型工程而非仅进法务文档。

§2 医学与科学背景

§2.1 为什么多样性是科学问题而不只是伦理问题

  1. 统计功效:稀有变异关联的分析功效依赖祖源内样本量——欧洲祖源主导使非欧人群的遗传发现系统性滞后;86% underrepresented 的队列设计直接改写多祖源 GWAS 的功效曲线。
  2. 变异谱差异:2024 Nature 论文——2.75 亿此前未报告变异,绝大多数集中在非欧祖源——参考变异目录的补全本身就是科学产出。
  3. 多基因评分(PRS)的公平性:欧洲训练的 PRS 在其他祖源上性能衰减——AoU 的多祖源数据是 PRS 跨人群校准的标准测试场。
  4. 临床转化:药物基因组学(PGx)的剂量指南长期基于欧裔证据——AoU 的 PGx calls × EHR 药物暴露使「多祖源真实世界药效」可验证。

§2.2 EHR 深表型:OMOP 标准化的语义

  1. OMOP CDM:多源 EHR 统一映射到 OMOP 表(person/condition_occurrence/drug_exposure/measurement/visit_occurrence)——跨健康系统可比性的基础;AoU 是 OMOP 生态最大的公开基因组链接资源。
  2. 数据来源的混合:健康系统对接 + participant-mediated 提交 + HIE(健康信息交换)——v9 的 22% EHR 增长主要来自后两者;来源异质性是协变量。
  3. EHR 的固有噪声:编码不全(undercoding)、账单偏倚、机构差异——EHR 表型算法(phenome-wide 的 phecode/OMOP 概念集)是标准应对;「表型定义敏感性分析」是审稿底线。
  4. 缺口纪律:98% 同意但 30 万+ 人无 EHR 数据——「有基因组无 EHR」子集的存在使任一「全队列」统计都要先声明 EHR 可得性过滤(§6.5 坑点 1)。

§2.3 基因组数据的分层口径

  1. array(553,949):基因分型——imputation 前的基础层;全队列覆盖最广。
  2. srWGS(535,662):短读长全基因组——SNP/Indel 主数据(>13 亿变异);「世界最大 srWGS 数据集之一」官方口径。
  3. SV(96,405):结构变异 call 集(~150 万 SV)——基因组重排层。
  4. lrWGS(14,521):长读长——SV/复杂区域/单倍型分辨(>250 万变异)——深度子集。
  5. 工程含义:不同分析用不同层(全基因组关联用 srWGS;罕见变异用 lrWGS 子集敏感性);「全基因组序列 53.5 万」与「SV 9.6 万」「lrWGS 1.45 万」是三个不同覆盖口径,别混引。

§2.4 多组学的入场(CDRv9)

  1. 蛋白质组(9,969):Olink 类亲和蛋白组(>5,000 蛋白)——血浆蛋白 × 基因组 × EHR 的同人三角——pQTL 与药物靶点因果推断(Mendelian randomization)的规模跃升。
  2. 转录组(8,980):RNA-seq counts + per-ancestry QTL(v9 亮点)——表达数量性状位点按祖源分层是「多样性红利」的直接兑现。
  3. lrWGS 扩容(14,521):长读长的 SV/单倍型解析——罕见结构变异与药物代谢基因(如 CYP2D6 拷贝数)的精度层。
  4. 整合纪律:多组学子集(~1 万)是全队列的 1.3%——「多组学分析的有效样本量」先声明;子集选择是否随机要查质量报告。

§2.5 与监管/临床语义的边界

All of Us 提供「研究数据」——临床行动(诊断/用药/风险沟通)需临床验证闭环:其成果管线(心血管八病遗传测试、前列腺癌风险模型进入 5,000 人退伍军人试验)示范了「研究发现 → 临床工具」的路径;研究者使用数据产出结论时,ACMG 分级、FDA 监管语义(如 LDT 边界)不在数据集内——这是研究者自己的责任层。

§2.6 与 UK Biobank 的互补结构

UK Biobank(50 万英国中年深表型)与 AoU(74.7 万美国多样性)是当代两大公共队列——互补而非替代:UKB 的深表型与影像是「广度-深度」 trade 的另一端;AoU 的多样性是 UKB(欧洲祖源 95%+)的结构短板。标准工作流:AoU 发现(多样性功效)→ UKB 复现(深表型机制)→ 双库一致升级结论(本库 uk-biobank 条目详述其对位)。

§2.7 AI 视角的科学定位

对医疗 AI,AoU 是「多样性人群的多模态健康分布」:基因组-EHR 同人链接是链接预测与风险模型的监督源;多祖源结构是公平性审计的最真实测试场;多组学是机制解释的中介层。它的短板(EHR 缺口、自选偏倚、云分析的成本摩擦)都是「真实世界征集」的固有代价——用它的方法论核心是「先查可得性与偏倚面,再建模」。

§2.8 隐私与再识别的技术边界

  1. 去标识 ≠ 匿名:基因组数据理论上不可逆匿名化——AoU 的应对是受控访问 + 法律约束(再识别禁令)+ 审计(云内操作留痕)——「技术+法律+治理」三层防线。
  2. unshifted dates 的分层:真实日期(unshifted)只在 Controlled Tier——Registered 层日期被平移(保护);时序分析(生存/时间线建模)必须确认层级口径。
  3. 亲属结构:kinship 辅助文件使家族结构可见——混合模型(线性混合模型)需要亲缘协方差;亲属对的隐私敏感性更高(一人授权涉及家族信息)。
  4. ** wearables 的特殊性**:Fitbit 时间戳数据可推断作息轨迹——其隐私风险与 EHR 不同构;AoU 的 wearables 层有独立的同意粒度。

§2.9 健康差异研究:SDoH × 基因组的归因结构

AoU 的调查层使其成为美国规模最大的「社会决定因素 × 基因组」同人资源——健康差异研究在这里有三层归因结构:

  1. 暴露层(SDoH):调查覆盖居住稳定性/教育/收入代理/食品保障/歧视经历/社会支持——SDoH 变量与临床结局的关联是健康差异的描述性证据;「歧视经历」类条目的敏感性使其缺失率高于普通条目。
  2. 调节层(医疗接触):EHR 的「数据存在」本身就是医疗接触的代理——同一疾病在组间的编码密度差异反映接触机会差异;差异分析必须区分「病得更重」与「被记录得更少」(§7.4 公平性的最深一层在这里有数据基础)。
  3. 生物学层(G×E 交互):基因-环境交互是机制层核心问题——SDoH 调查 × 基因组 × EHR 的同人链接使交互项检验在 74 万人尺度可行;G×E 的功效要求比主效应更大会样本量,设计前先做功效预算。

工程纪律:SDoH 调查的缺失模式不是随机的(敏感问题拒答率更高)——「缺失指示变量 + 多重插补」是健康差异建模的基线组合;把「缺失本身」建模为披露意愿协变量是高阶用法;对缺失机制(MCAR/MAR/MNAR)的声明是审稿必答项。

§3 数据集规格

§3.1 规格总表

维度 规格(CDRv9 口径,2026-06)
数据可用参与者 747,000+(总注册 >883,000)
srWGS 535,662(>13 亿变异;较上版 +120K 人/+1.25 亿变异)
array 553,949(>190 万 variants)
SV 96,405(~150 万 variants)
lrWGS 14,521(>250 万 variants;较上版 +11K)
RNA-seq 8,980(v9 首次;含 per-ancestry QTL)
proteomics 9,969(v9 首次;>5,000 蛋白)
EHR 近 482,000(OMOP;+22%)
体格测量 600,000
调查 747,000(含认知与行为健康 2026 新增)
wearables Fitbit 活动数据
多样性 86%(645,000+)underrepresented
访问 Workbench(GCP)Registered/Controlled 双层;$300 初始积分
版本政策 最近 3 个 CDR 版本
学术影响 1,400+ 论文 / ~23,000 研究者 / 1,200+ 机构

§3.2 CDRv9 相对 v8 的增量地图

维度 CDRv8(2025) CDRv9(2026-06) 含义
数据可用参与者 ~633,000 747,000+(+50% 相对 v8 发布口径) 最大单次扩容
srWGS ~41.5 万 535,662(+12 万) 最大 srWGS 数据集之一
变异目录 — +1.25 亿新变异 稀有变异目录持续加深
lrWGS ~3,500 14,521(+11K,4 倍) 长读长规模化起点
蛋白质组 — 9,969(首次) 多组学时代开启
转录组 — 8,980(首次) per-ancestry QTL
EHR ~39.5 万 近 482,000(+22%) participant-mediated + HIE
认知与行为健康 — 新增调查集 心理健康研究开启

解读:v9 的主题是「多组学元年 + 长读长规模化」——蛋白质组/转录组首次入场使 AoU 从「基因组+EHR」库升级为「多组学+EHR」库;lrWGS 4 倍扩容是罕见结构变异研究的前奏。

§3.3 DAIMS 数据AI就绪度评估

维度 D 数据完整性 评分 说明
D1 人群覆盖 10/10 74.7 万 + 86% underrepresented——多样性满分档
D2 基因组深度 9/10 535K WGS + SV/lrWGS 分层
D3 表型深度 8/10 EHR 48 万 + 调查/wearables;EHR 缺口存在
D4 多组学 7/10 蛋白/转录首次入场但样本量 1 万级
A1 机器可读 9/10 OMOP + VCF 标准化;云内 API/notebook
A2 文档完备 9/10 质量报告/known issues/FAQ 完整
A3 接入成本 7/10 RCR+DUA 纪律成本;数据免费但云分析有成本曲线
A4 更新机制 8/10 CDR 年度级滚动;三版本保留
I1 指标标准化 9/10 OMOP + 统一 QC
I2 可复现性 8/10 版本锁定可复现;三版本滚动要求自存快照
M1 多模态对齐 9/10 同人链接(person_id)跨模态
M2 时间序列 8/10 EHR 纵向 + wearables;unshifted 分层
S1 数据安全 9/10 云内受控 + 审计;基因组不可逆匿名为固有约束
S2 合规负担 6/10 受控访问纪律(RCR/DUA/行为准则)是真实义务

总分:A- 级(多样性与同人整合的满分档;扣分项是受控访问纪律成本与 EHR 缺口——「开放科研」与「受控治理」的平衡点)

§3.4 存储与计算需求

数据件 体量 获取方式
队列表(OMOP 子集) GB 级 Workbench 内 SQL/BigQuery
全队列变异(VCF) PB 级 云端原位(不下载)
单点分析(notebook) 内存级 $300 积分内可行
GWAS 级全库扫描 数千-数万 compute-hours 自费 GCP 预算
结果导出 研究产物级 审核后出云

AoU 的工程重心是「云内原位计算」——本地集群思维(下载数据)在这里不适用;预算规划(BigQuery 查询/GCE 计算)是项目启动前的必做项。

§3.5 获取通道

  1. 机构路径:查所在机构是否已有 master DUA(1,200+ 家)——有则研究者直接注册;无则机构先签约。
  2. 研究者注册:researchallofus.org——身份验证 + 机构 affiliation。
  3. RCR 培训:Responsible Conduct of Research(年度更新);Controlled Tier 加修附加模块。
  4. 行为准则:Data User Code of Conduct 签署(再识别禁令/结果回报/合规承诺)。
  5. Workbench 使用:cohort builder 入组 → BigQuery/notebook 分析 → 结果出云审核。
  6. 版本选择:CDRv9 主力;跨版本敏感性用 v8(注意三版本滚动窗口)。

§3.6 口径对齐表

数字 出处口径 澄清
747,000+ 数据可用 / >883,000 注册 NIH 新闻稿(2026;CDRv9) 两个口径:可用 ≠ 注册
535,662 srWGS / >13 亿变异 质量报告(2026-06-26) srWGS SNP-Indel 层
553,949 array / 96,405 SV / 14,521 lrWGS 质量报告 各基因组层独立口径
9,969 蛋白组 / 8,980 转录组(首次) 质量报告 + NIH 新闻稿 v9 多组学首秀
近 482,000 EHR(+22%) NIH 新闻稿 OMOP 标准化
86% / 645,000+ underrepresented NIH 新闻稿 多样性核心口径
633,000(+50%) CDRv8 发布(2025) 旧版口径——引用注版本
245,388 临床级基因组 / 2.75 亿新变异 Nature 627:340-346(2024) 历史(v4 前后)口径
1,400+ 论文 / ~23,000 研究者 / 1,200+ 机构 NIH 新闻稿(2026) 学术影响口径
「世界最大基因组+健康整合数据库」 NIH 新闻稿(2026) 带定语(整合库)——非「最大基因组库」

§3.7 版本选择纪律

  1. 快照自留:Workbench 只保留 3 个 CDR——长跑项目的 cohort 定义与中间结果导出自存(出云审核后)。
  2. 版本锁定声明:论文写「CDRv9(2026-06)」——跨版本统计不可比(扩容改变统计功效)。
  3. 层级口径:Registered vs Controlled 的分析结论不可混——unshifted dates 与基因组只在 Controlled。
  4. 升级节奏:年度级 CDR 发布——升级触发条件(新数据类型/样本量跃升)进项目计划。

§3.8 数据层级与文件格式详表

层 格式 访问层级 分析入口
调查/测量 OMOP 表(BigQuery) Registered+ cohort builder/SQL
EHR OMOP CDM 表 Registered+ BigQuery + phecode 概念集
wearables 活动表 Registered+ notebook(时序特征)
array VCF/imputed Controlled Hail/plink2(云内)
srWGS SNP-Indel gVCF/VCF + CRAM 原始 Controlled Hail 批量/GATK
SV VCF(Manta/Delly 类 calls) Controlled 结构变异管线
lrWGS BAM + 变异 calls Controlled 长读长专用管线
RNA-seq counts 表 + QTL 结果 Controlled 差异表达/QTL 映射
proteomics NPX 表 Controlled pQTL/MR 分析
辅助(祖源/kinship/PGx/HLA) 注释文件 Controlled 协变量与安全过滤
  1. 格式纪律:基因组分析在云内用 Hail/plink2(BigQuery 不适合变异矩阵)——混合引擎架构(BigQuery 表型 × Hail 基因型)是标准用法。
  2. 原始文件(CRAM/BAM):重比对级需求才用——计算成本高;绝大多数分析用 call set 即可。

§4 数据结构

§4.1 Workbench 对象模型

Researcher Workbench 数据模型(CDRv9)
├── CDR(Curated Data Repository v9)
│   ├── OMOP CDM
│   │   ├── person               # 参与者(匿名 person_id)
│   │   ├── condition_occurrence # 诊断(SNOMED/ICD 映射概念)
│   │   ├── drug_exposure        # 药物暴露(RxNorm)
│   │   ├── measurement          # 化验/体格测量(LOINC)
│   │   ├── visit_occurrence     # 就诊
│   │   ├── observation          # 调查响应/社会决定因素
│   │   └── survey(AoU 扩展)   # 调查模块(SDoH/行为/认知健康)
│   ├── Genomics
│   │   ├── variant calls(array/srWGS/SV/lrWGS 各层)
│   │   ├── sample 元数据(祖源/kinship/QC)
│   │   └── 辅助(PGx/HLA/medically relevant genes)
│   ├── Multiomics
│   │   ├── proteomics(NPX 矩阵,9,969 × 5,000+)
│   │   └── transcriptomics(counts + per-ancestry QTL)
│   └── Fitbits(活动时序)
└── Workspace(研究者层)
    ├── cohort(入组定义,可分享/复用)
    ├── dataset(概念集抽取)
    └── notebooks(Jupyter/R;分析产物)

§4.2 队列构建与表型抽取

-- BigQuery(Workbench 内):2 型糖尿病 × 有 WGS × 拉丁裔语境的队列示意
SELECT
  p.person_id,
  MIN(c.condition_start_date) AS first_t2d_date,
  COUNT(DISTINCT c.visit_occurrence_id) AS n_visits
FROM `all-of-us-cdrv9.person` p
JOIN `all-of-us-cdrv9.condition_occurrence` c
  ON p.person_id = c.person_id
JOIN `all-of-us-cdrv9.concept` con
  ON c.condition_concept_id = con.concept_id
WHERE con.concept_name LIKE '%type 2 diabetes%'
GROUP BY p.person_id
HAVING first_t2d_date IS NOT NULL;
-- cohort builder 也可视化完成同任务;SQL 路线的优势是可版本化(SQL 进复现包)

§4.3 基因组分析(Hail 云内)

#!/usr/bin/env python3
"""Workbench notebook 内的 Hail GWAS 骨架:QC → 关联 → 祖源分层。"""
import hail as hl
hl.init()  # Workbench 预配置 Spark 后端

mt = hl.read_matrix_table("gs://fc-aou-datasets-controlled/v9/wgs/short_read/snpindel/...")

# 样本与变异 QC(官方 QC 后的敏感性再过滤)
mt = mt.filter_rows(mt.variant_qc.call_rate > 0.95)
mt = mt.filter_cols(mt.sample_qc.call_rate > 0.95)

# 祖源分层(官方 ancestry 辅助文件的 PCA/随机森林标签)
for anc in ["eur", "afr", "amr", "eas", "sas", "mid"]:
    m_anc = mt.filter_cols(mt.meta.ancestry_pred == anc)
    if m_anc.count_cols() < 1000:
        continue
    gwas = hl.linear_regression_rows(
        y=m_anc.pheno.t2d, x=m_anc.GT.n_alt_alleles(),
        covariates=[m_anc.pheno.age, m_anc.pheno.sex,
                    m_anc.pheno.pc1, m_anc.pheno.pc2, m_anc.pheno.pc3])
    gwas.write(f"gs://mybucket/gwas_t2d_{anc}.mt")

# 跨祖源合并:meta-analysis(逆方差加权)在导出汇总统计后本地/云内完成

(per-ancestry 分析 + meta 合并是 §2.1 多样性方法论的标准落地;汇总统计出云走审核。)

§4.4 药物基因组学抽取

#!/usr/bin/env python3
"""PGx 层:CYP2D6 表型 calls × 阿片/抗凝药物暴露(OMOP)交叉。
PGx 辅助文件(CPIC 类别)+ drug_exposure 表在 Workbench 内 join。"""
import pandas as pd

# 1) PGx 辅助:CYP2D6 metabolizer 状态(Controlled 层辅助文件)
pgx = pd.read_csv("pgx_cyp2d6_cdrv9.tsv", sep="\t")   # person_id, metabolizer_status
# 2) 药物暴露:RxNorm 概念(codeine/warfarin 等说明书基因-药物对)
drugs = client.query("""
SELECT person_id, drug_concept_id, MIN(drug_exposure_start_date) AS first_exposure
FROM `all-of-us-cdrv9.drug_exposure`
WHERE drug_concept_id IN (SELECT concept_id FROM my_pgx_drug_list)
GROUP BY person_id, drug_concept_id""").to_dataframe()
# 3) 合并:metabolizer 状态 × 暴露/剂量/结局(真实世界 PGx 关联表)
df = pgx.merge(drugs, on="person_id")
print(df.groupby(["metabolizer_status"]).size())

(此表即真实世界 PGx 的原料——与 CPIC 指南口径对照是 §5.6 L3 的内容。)

§4.5 元数据与版本指纹

  1. CDR 版本:所有产物写「CDRv9(2026-06)」+ workspace 创建日期。
  2. cohort 定义:Workbench cohort 的定义 JSON + 概念集版本——复现包必备。
  3. QC 报告:官方质量报告(2026-06-26 版)的 known issues 清单逐条核对——官方已知问题的状态影响解读。

§4.6 完整性清单

  • [ ] CDR 版本 + workspace 日期双戳
  • [ ] 层级口径(Registered/Controlled)声明
  • [ ] EHR 可得性过滤(30 万+ 无 EHR 的处理)声明
  • [ ] 队列入组漏斗(每步剩多少)透明
  • [ ] 祖源分层策略(per-ancestry vs meta)
  • [ ] 表型定义敏感性(phecode/概念集变体)
  • [ ] 多组学子集样本量声明(~1 万 ≠ 全队列)
  • [ ] 偏倚面(自选队列)limitation 段落
  • [ ] 行为准则合规(再识别禁令/结果回报)确认

§4.7 数据血缘

参与者征集(50 州;HPO/社区伙伴/直接登记)
  → 同意框架 + 生物样本采集
  → 测序/分型生产管线(官方 QC)
  → EHR 对接(健康系统 + participant-mediated + HIE)
  → OMOP 标准化(DRC/curating)
  → CDR 版本化发布(v9)
  → Researcher Workbench 云内受控分发

「参与者 → 样本 → 数据 → 标准化 → 发布」五级血缘以 person_id 为键同人贯通——「参与者贡献可溯源」是 All of Us 治理承诺的数据面。

§4.8 wearables 时序特征工程(Fitbit)

#!/usr/bin/env python3
"""Fitbit 活动数据 → 日级/周级数字表型特征(Workbench notebook 示意)。
输入:活动日表(person_id, date, steps, active_minutes, wear_minutes...)"""
import pandas as pd
import numpy as np

daily = pd.read_csv("fitbit_daily_cdrv9.tsv", sep="\t", parse_dates=["date"])

# 1) 佩戴时数过滤:低佩戴日的特征是噪声源(阈值先查官方质量报告口径)
daily["valid_day"] = daily["wear_minutes"] >= 1440 * 0.66   # ≥66% 日佩戴

# 2) 日级特征聚合:步数统计量 + 活动结构
feat = (daily[daily.valid_day]
        .groupby("person_id")
        .agg(steps_mean=("steps", "mean"),
             steps_cv=("steps", lambda s: s.std() / (s.mean() + 1e-9)),
             active_week=("active_minutes", lambda s: (s >= 150).mean()),
             n_valid_days=("date", "count")))

# 3) 昼夜节律代理:周末-工作日步数比(行为规律性的粗粒度)
daily["is_weekend"] = daily["date"].dt.dayofweek >= 5
wk = daily[daily.valid_day].groupby(["person_id", "is_weekend"]).steps.mean().unstack()
feat["weekend_ratio"] = wk[True] / (wk[False] + 1e-9)

# 4) 最小观察窗:有效天数不足者不进主分析(敏感性分析另报)
feat = feat[feat.n_valid_days >= 30]
print(feat.describe().T)

(wearables 的时间戳口径随访问层级——Registered 层日期平移使「星期几」语义失真,节律类特征需 Controlled 层;佩戴时数阈值与最小观察窗的声明是审稿必答项;数字表型与临床结局的关联在 §5.1 任务矩阵第 6 行。)

§4.9 pQTL 定位与孟德尔随机化(MR)

#!/usr/bin/env python3
"""cis-pQTL → MR 工具变量:蛋白暴露 × 疾病结局的因果推断骨架。
数据:proteomics NPX 表(9,969 子集)+ srWGS;cis 窗口 = 编码基因 ±500kb。"""
import hail as hl

# 1) 蛋白暴露矩阵(NPX 已 batch 校正;官方 batch/平台协变量照进模型)
prot = hl.read_matrix_table("gs://fc-aou-datasets-controlled/v9/proteomics/npx.mt")

# 2) cis-pQTL:基因窗内变异 × NPX 线性回归(每蛋白独立扫描)
cis = hl.linear_regression_rows(
    y=prot.NPX, x=prot.GT.n_alt_alleles(),
    covariates=[prot.age, prot.sex, prot.pc1, prot.pc2,
                prot.batch, prot.ancestry_pred])

# 3) 工具变量筛选:全基因组显著(5e-8)+ 独立(LD clump r2<0.01, 1Mb 窗)
iv = cis.filter(cis.p_value < 5e-8)   # 独立性用 plink2 --clump 或 LD 矩阵二次过滤

# 4) 两样本 MR:cis-pQTL 权重 × 结局 GWAS(AoU EHR 表型)汇总统计——
#    Wald 比值 / IVW 主估计 + 敏感性(MR-Egger 截距 / 加权中位数)在汇总统计导出后完成

(MR 三假设——相关性/独立性/排他性——在单库内只能部分检验:水平多效性用 MR-Egger 截距诊断;「AoU 内 cis-pQTL × AoU EHR 结局」属单样本 MR 语境,样本重叠的稳健性分析是审稿关注点;9,969 子集的功效对弱工具变量敏感,F 统计量 >10 报告必备。)

§5 下游分析协议

§5.1 任务×资源速查表

任务 用哪些数据层 关键过滤 陷阱
多祖源 GWAS srWGS + 祖源文件 + EHR 表型 per-ancestry + meta pooling 假关联
PheWAS 全 OMOP + 基因组 EHR 可得性过滤 表型定义单一化
PGx 关联 PGx 辅助 + drug_exposure 暴露窗定义 无暴露窗的粗关联
pQTL/MR 蛋白组 + srWGS 子集样本量声明 全队列结论外推
PRS 校准 array + 祖源 + 测量 分祖源评估 欧训模型直接跨用
wearables 表型 Fitbit + 测量/结局 佩戴时数过滤 时间戳口径(层级)

§5.2 多祖源 GWAS 协议

  1. 入组:表型(OMOP 概念集)+ 基因组可得(srWGS)+ 年龄/性别协变量完整——漏斗透明记录。
  2. 祖源分层:官方遗传祖源标签分 6-8 组——各组独立 GWAS(组内 PCA 协变量)。
  3. meta 合并:逆方差加权 meta(组间异质性 Q 检验)——异质性位点单独标记(跨祖源生物学差异线索)。
  4. 多重校正:全基因组 5e-8 + 表型族 FDR——双线并行报告。
  5. 复现:UKB/ FinnGen 独立复现(欧洲子集跨队列)——复现不一致按祖源构成差异解释。

§5.3 PheWAS 协议

  1. 锚定变异:候选变异(GWAS 命中/已知临床变异)× 全 OMOP 表型谱。
  2. 表型算法:phecode/OMOP 概念集 + 最小病例数阈值——定义敏感性(± 概念集变体)。
  3. 分层:按祖源/性别分层——多效性与性别特异关联分离。
  4. 校正:表型数 FDR + 相关表型的相关结构(有效检验数)。
  5. 解读:双向(同一变异多表型)结果与已知生物学对照——新关联进复现队列。

§5.4 成本模型

场景 技术路线 成本量级
队列构建 + 描述统计 BigQuery $300 积分内
单表型 GWAS(单祖源) Hail 云内 数十-数百 compute-hr
全祖源 × 多表型 Hail + 批处理 数千 compute-hr(自费)
pQTL 全谱 蛋白子集 Hail 数百-千级
深度学习(EHR 时序) GCE GPU 预算评估先行

($300 积分够「试跑与原型」——正式 GWAS/PheWAS 的云预算是项目立项项。)

§5.5 失败模式清单

  1. EHR 可得性未过滤:30 万+ 无 EHR 参与者混入表型阴性——假阴性稀释。
  2. 跨祖源 pooling:人群分层假关联——per-ancestry 是铁律。
  3. 层级口径错配:Registered 的 shifted dates 做生存分析——时序错乱。
  4. 多组学小样本外推:9,969 蛋白样本的发现当全队列结论——样本量声明。
  5. PRS 欧训直接跨用:跨祖源性能衰减——分祖源校准。
  6. 表型定义单一:一个概念集的结论——定义敏感性必备。
  7. 版本混拼:CDRv8/v9 混合统计——锁版本。
  8. 云成本失控:全库扫描无预算上限——compute 预算告警先行。

§5.6 校准与验证协议

验证层 数据源 指标 通过线(参考)
L1 表型验证 EHR 抽样人工核 PPV ≥90%(关键表型)
L2 关联复现 已知位点(≥90%(关键表型)
L2 关联复现 已知位点(GWAS catalog) 复现率 已知方向/效应一致
L3 PGx) 复现率 已知方向/效应一致
L3 PGx 对照 CPIC/DPWG 指南口径 效应方向一致 与指南一致或解释偏离
L4 跨队列复现 UKB/FinnGen 效应量相关 主效应复现
L5 分层公平性 祖源/性别分层 性能极差 无灾难性组失效
L6 前瞻衔接 临床验证管线(如 AoU 成果路径) 前瞻 AUC/PPV 进入试验设计
  1. L1 是 AoU 特有:EHR 表型算法的 PPV 人工核验成本高但必要——OMOP 概念集 ≠ 临床确诊。
  2. L6 的生态:AoU 自身的成果路径(心血管八病测试 → 临床)说明「发现 → 工具」闭环在库内生态可完成——研究者可对照其标准。

§6 实证结果与方法学分析

§6.1 CDRv9 发布的核心信号(2026-06)

  1. 规模信号:747K 参与者/535K WGS/482K EHR——NIH 的「世界最大整合库」宣言有数字支撑(带「基因组+EHR 整合」定语)。
  2. 多组学信号:蛋白组/转录组/lrWGS 首次成规模入场——「基因组+EHR」向「多组学+临床」的升级点。
  3. 多样性信号:86% underrepresented 稳定维持——扩容 50% 没有稀释多样性设计(征集纪律的证明)。
  4. 治理信号:认知与行为健康数据集发布——敏感表型的受控开放节奏(隐私审查先行)。

§6.2 精准医学队列的实证教训

  1. 「80/20 的同意-完整性缺口」:98% 同意 vs 30 万+ 无 EHR——同意率高不等于数据完整;「可得性偏差」是 EHR 研究的头号内部威胁。
  2. 多样性的回报已现:2.75 亿新变异(2024 Nature)+ per-ancestry QTL(v9)——多样性设计的数据回报可量化,不只是伦理姿态。
  3. 成果闭环的示范:心血管八病遗传测试(首个临床级)、前列腺癌模型进试验——「公共数据 → 临床工具」路径在库内生态可走通,但周期是 5-8 年不是 5-8 个月。
  4. 预算风险的现实:2025 年 75% 预算削减使年征集放缓(86 万→87.3 万)——公共队列的路线图受拨款周期约束;依赖单一公共源的产品要有对冲(多库组合)。

§6.3 方法学三层框架(gsm)

  1. G(Ground layer):测序/化验/测量/调查原始层——机器可测。
  2. S(Synthesis layer):OMOP 标准化、祖源标签、QC 标签、phecode——标准化推断层。
  3. M(Medical layer):诊断语义、药物响应、风险预测——临床语义层(需验证闭环)。

越层引用:用 S 层 phecode 说「确诊疾病」(M 层语义)、用 G 层单次化验说「疾病状态」——审稿按层问责;EHR 数据的这一层次纪律比 ChEMBL 的 assay 泥潭更隐蔽。

§6.4 接力实验设计

  1. AoU → UK Biobank:发现(多样性)→ 复现(深表型)。
  2. AoU → gnomAD:关联变异 → 频率对照(一致性核查)。
  3. AoU → TCGA:人群风险 → 癌症机制(疾病分支深化)。
  4. **AoU → 风险 → 癌症机制(疾病分支深化)。
  5. AoU → ClinVar/CPIC:PGx/罕见变异 → 临床语义核对。

##/CPIC**:PGx/罕见变异 → 临床语义核对。

§6.5 八个真实坑点

  1. 坑点 1:EHR 可得性未过滤——有基因组无 EHR 的 30 万+ 人;先过滤再统计。
  2. 坑点 2:跨祖源 pooling——人群分层假关联;per-ancestry 铁律。
  3. 坑点 3:层级日期口径——shifted vs unshifted dates;时序分析锁 Controlled。
  4. 坑点 4:多组学小样本外推——1 万级子集 ≠ 74.7 万全队列。
  5. 坑点 5:PRS 跨祖源直用——欧训衰减;分祖源校准。
  6. 坑点 6:表型定义单一——概念集敏感性分析必备。
  7. 坑点 7:版本混拼——CDR 三版本滚动;锁版本 + 自存快照。
  8. 坑点 8:偏倚不声明——自选队列(更老/更多女性/更多受教育/更不健康);limitation 固定条款。

§6.6 审稿人自查清单

  • [ ] CDR 版本 + workspace 日期写入方法段?
  • [ ] Registered/Controlled 层级与日期口径声明?
  • [ ] EHR 可得性过滤与漏斗透明?
  • [ ] per-ancestry 策略(分层 + meta)报告?
  • [ ] 表型定义敏感性分析?
  • [ ] 多组学子集样本量声明?
  • [ ] 队列偏倚(自选)limitation 段落?
  • [ ] 行为准则合规(再识别禁令)确认?

§6.7 版本演进的方法学含义

  1. 三版本滚动的复现纪律:旧版本下线使「原样复算」不可得——分析快照(cohort JSON + 汇总统计)自存是长跑项目的保险。
  2. 多组学层的加入(v9):使「全队列」与「多组学子集」成为两个分析宇宙——引用样本量时先问层。
  3. EHR 来源扩展(participant-mediated + HIE):数据的来源异质性上升——来源协变量进敏感性分析。
  4. 年度节奏与预算波动:征集增速受拨款影响——「队列规模随时间线性增长」的假设在 2025-2026 已被证伪;规划用区间不用点估计。

§6.8 多组学元年之后的版本路线预判

从 v8→v9 的增量结构外推 v10+ 的可能方向(预判,非官方路线图):

  1. 多组学扩容:蛋白组 9,969 → 数万级(UKB-PPP 5 万级蛋白组是对标量尺);lrWGS 1.45 万 → 持续翻倍;多组学子集从「首次入场」走向「常态化扩容」。
  2. EHR 缺口收敛:participant-mediated 与 HIE 管线成熟后,482K → 55 万级可期——「同意率与可得性之间的缺口」是核心瓶颈而非技术。
  3. 敏感数据节奏:认知与行为健康(2026)之后,环境暴露与基因组报告相关数据集将按「隐私审查先行」节奏释放——每类敏感数据独立评估层级。
  4. 分析含义:长跑项目应把「多组学子集扩容」设计成可增量吸收的结构(baseline 快照 + 增量更新重跑),而非一次性锁死 1 万级子集——v10 的扩容会改变子集构成的代表性。

§7 AI 就绪指南与应用场景

§7.1 AoU 在医疗 AI 中的四种喂法

  1. 风险模型喂法:基因组 + EHR 纵向 → 多病种风险预测(含时序 EHR 深度模型)。
  2. 公平性基准喂法:多祖源结构 → 模型跨人群审计(PRS/风险评分的公平性测试场)。
  3. PGx 决策喂法:PGx calls × 药物暴露/结局 → 剂量与选药决策模型。
  4. 多组学机制喂法:蛋白/转录/基因/EHR 同人 → 因果中介(MR/mediation)与生物标志物。

四种喂法与 §6.5 坑点的对应:喂法 1 踩坑 1(EHR 缺口)与坑 3(日期口径);喂法 2 踩坑 5(PRS 跨用);喂法 3 踩坑 6(定义敏感性);喂法 4 踩坑 4(小样本外推)——建模前回读对号。

§7.2 多病种风险预测管线实操配方

#!/usr/bin/env python3
"""Workbench notebook:EHR 时序 + 静态特征 → 心衰 2 年风险(示意管线)。
数据:OMOP condition/measurement/drug + 祖源/年龄/性别协变量。"""
import pandas as pd, numpy as np
from lightgbm import LGBMClassifier
from sklearn.metrics import roc_auc_score
from sklearn.model_selection import GroupShuffleSplit

# 1) 队列:40+ 岁、有 EHR、基线无心衰(概念集省略)
cohort = client.query("""
SELECT p.person_id, MAX(c.condition_start_date) AS last_visit
FROM `all-of-us-cdrv9.person` p
JOIN `all-of-us-cdrv9.condition_occurrence` c USING (person_id)
GROUP BY 1""").to_dataframe()

# 2) 特征:既往诊断计数/主要化验/用药计数 + 人口学(SQL 预聚合省略)
feat = pd.read_csv("hf_features_cdrv9.tsv", sep="\t")   # person_id, features..., hf_2y
feat = feat.merge(cohort, on="person_id")

# 3) 切分:按 person 防同人泄漏(多就诊同人问题)
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=0)
tr, te = next(gss.split(feat, groups=feat.person_id))
cols = [c for c in feat.columns if c not in ("person_id", "last_visit", "hf_2y")]

m = LGBMClassifier(n_estimators=500, learning_rate=0.05, random_state=0)
m.fit(feat.iloc[tr][cols], feat.iloc[tr].hf_2y)
pred = m.predict_proba(feat.iloc[te][cols])[:, 1]

print("AUC:", round(roc_auc_score(feat.iloc[te].hf_2y, pred), 3))
# 4) 分层评估(公平性):按祖源/性别报 AUC——组间极差是 §5.6 L5

§7.3 模型选型与迁移决策

  1. 表格型风险模型:LightGBM/XGBoost——EHR 特征工程后的主力(同 UKB 纪律)。
  2. EHR 时序深度模型:Transformer/RNN 处理就诊序列——大样本(48 万 EHR)下值得,须同人切分。
  3. PRS/多基因模型:分祖源训练 + 分祖源校准(§7.4);贝叶斯 PRS(PRS-CS 类)+ AoU 多祖源权重。
  4. 多组学整合:MOFA/DIABLO 类多视图——1 万级子集上小模型优先。
  5. 不确定性:共形预测——临床风险输出的校准是决策接口的底线。

§7.4 公平性:多样性的工程兑现

  1. 分祖源报告:所有性能指标按祖源分层——平均数是多样性队列里最危险的数字。
  2. PRS 跨祖源协议:欧训模型在非欧组的衰减量化 → 祖源特异权重重训 → 跨组校准曲线对照。
  3. 性别/年龄分层:自选偏倚使女性/年长过代表——重加权(survey-weight 类)敏感性。
  4. 健康差异语义:模型输出的组间差异可能是「医疗接触差异」(EHR 机会不均)而非生物学——差异归因要区分「数据机会」与「生物学」,这是 AoU 公平性分析的最深一层。

§7.5 任务×资源速查表

AI 任务 AoU 数据 输出形态 验收
多病种风险 EHR 时序 + 基因组 风险模型 分祖源 AUC
PRS 校准 array + 测量 校准模型 跨祖源曲线
PGx 决策 PGx + drug_exposure 决策支持 CPIC 口径对照
pQTL/MR 蛋白组 + srWGS 因果边 MR 敏感性全通过
EHR 表型 NLP OMOP + 结构化 抽取/表型 PPV 人工核
wearables 表型 Fitbit + 结局 数字标记 佩戴时长敏感性

§7.6 端到端案例:跨祖源心房颤动风险模型

  1. 取数:Afib OMOP 概念集 → EHR 可得性过滤 → 12 万+ 病例(v9 量级)。
  2. 分层:6 祖源组独立 GWAS(srWGS,协变量 age/sex/PC)→ meta 合并 → 已知位点(4q25 等)复现确认。
  3. 建模:PRS(祖源特异)+ EHR 特征(LGBM)→ 融合模型;同人 GroupShuffleSplit。
  4. 公平性:分祖源 AUC 极差 <0.03 为达标线;不达标组重校准。
  5. 复现:UKB 欧洲子集外推验证。
  6. 报告:CDR 版本/层级/漏斗/分祖源指标/偏倚声明——五件套齐。

§7.7 报告模板:方法学段落骨架

数据来自 All of Us Research Program CDRv9(2026-06 发布;NIH)。分析在 Researcher Workbench(Controlled Tier)内完成,日期口径为 unshifted。队列限定基因组可得(短读长 WGS,n=535,662 口径)且 EHR 数据可用(OMOP 标准化)的参与者;入组漏斗逐级报告。表型采用 OMOP 概念集(含 ± 定义敏感性分析);关联分析按官方遗传祖源分层(各祖源组内 PCA 协变量)后逆方差 meta 合并。风险模型按同人分组切分防泄漏,性能按祖源与性别分层报告;多基因评分采用祖源特异权重。队列的自选偏倚(较一般人群更年长、更多女性与更高教育水平)与 EHR 完整性缺口已在局限中声明。全部使用遵守 Data User Code of Conduct(含再识别禁令);参与者结果回报义务不受本研究影响。

§7.8 成本与排期模板

阶段 内容 成本构成 周期
准入 注册 + RCR + DUA 人力 2-4 周
原型 cohort + 描述统计 $300 积分 1 周
主分析 GWAS/建模 自费 GCP(数百-数千 hr) 2-4 周
校准 L1-L5 协议 算力 + 人力 1-2 周
复现 UKB 外推 外部队列成本 2 周
复现包 cohort JSON + 快照 人力 2 天

AoU 项目的排期风险不在建模在准入与云成本——「预算上限先行」与「机构 DUA 预查」是排期第一项。

§7.9 消融案例:PRS 跨祖源校准的必要性

PRS 的跨祖源公平性是 AoU 多样性设计的标志性应用——一组典型消融:

配置 训练/校准策略 各祖源 AUC(示意) 诊断
R1 欧洲祖源训练,直接全队列应用 EUR 0.68 / AFR 0.56 / EAS 0.58 经典衰减
R2 欧训 + 各祖源重校准(截距/斜率) EUR 0.68 / AFR 0.60 / EAS 0.62 校准修复部分衰减
R3 祖源特异权重重训(AoU 分组) EUR 0.68 / AFR 0.64 / EAS 0.65 权重差异是主因
R4 R3 + 多祖源 meta 特征 全面 +0.01-0.02 跨祖源信息互补
  1. 方法:同一心血管结局,AoU 分祖源训练集;评估锁独立测试集;R2 用 logistic 重校准,R3 用祖源内 LD 参考重估计权重。
  2. 读数:R1→R3 的差距证明「衰减主因是 LD 与效应频率差异」——不是不可救;R2 的截距校准只能修偏倚修不了区分度。
  3. 结论:多样性队列(AoU)的核心 ML 价值正是 R3 类「祖源特异权重的训练供给」——没有 86% underrepresented,R3 在任何单一欧训库都无法完成。

§8 伦理、许可与合规

§8.1 访问与义务结构

  1. 受控开放:数据免费但受控——注册研究者 + RCR(年度)+ Data User Code of Conduct + 机构 DUA;违反行为准则的后果包括账号终止与机构问责。
  2. 再识别禁令:绝对红线——技术尝试与结果传播都禁止;基因组数据的再识别风险使这一条是法律与伦理的双重义务。
  3. 结果回报生态:临床级发现(如 Actionable 变异)有向参与者回报的程序——研究者的 incidental findings 处理走平台流程,不是个人决定。
  4. 发表规范:引用 AoU 数据集 + CDR 版本 + 注册号(protocol 注册于 Workbench);成果受 NIH 公共获取政策约束。

§8.2 引用与致谢模板

致谢模板(按需裁剪):
Data were obtained from the All of Us Research Program (National Institutes
of Health), Curated Data Repository version 9 (CDRv9, 2026-06), accessed
via the Researcher Workbench under Controlled Tier. The All of Us Research
Program is supported by the National Institutes of Health (Office of the
Director, regional medical centers, and partner organizations). We thank
the All of Us participants for their contributions. Genomic data citation:
All of Us Research Program Investigators, Nature 627, 340-346 (2024).

§8.3 国内合规路径

  1. 数据性质:美国受控访问研究资源——国内团队使用需 NIH 注册资格(国际研究者可申请)+ 本国人类遗传资源管理规范的双合规。
  2. 出境/入境边界:数据不出 Workbench(云内分析)——国内团队的合规重点是「分析结果出云」的边界与本国 HGRAC 对衍生数据的定义。
  3. 红线:再识别禁令是全球通用红线;把 AoU 数据与国内人群库做未批准的个体级合并是两侧都违规的动作。

§8.4 商业使用边界

  1. 研究优先语义:AoU 的同意框架以研究为导向——商业产品化(直接向消费者报告风险等)不在同意覆盖内;基于汇总统计/方法的商业衍生可行,个体级数据的商业再利用不行。
  2. 成本模型:数据免费但云不免费——商业实体的 GCP 成本全额自担(无学术折扣豁免的假设)。
  3. 对冲策略:依赖 AoU 的商业管线要有「公共源波动」对冲(2025 预算削减事件)——多库组合与本地化快照策略。

§8.5 合规台账最小模板

台账项 记录内容 示例
准入凭证 注册号 + RCR 有效期 + DUA 年度续期提醒
CDR 版本 版本 + workspace 创建日 CDRv9(2026-06)
层级口径 Registered/Controlled Controlled;unshifted dates
队列定义 cohort JSON + 概念集版本 复现包存档
出云产物 汇总统计审核记录 结果出云清单
行为准则 签署版本 + 合规要点 再识别禁令确认
云成本 compute 预算与实际 GCP 账单对账

§8.6 合规问询的应答准备

机构 IRB/法务对 AoU 使用的高频问询与标准应答要点:

  1. 「这算人类受试者研究吗」:AoU 数据已去标识且平台提供判定参考——多数机构判为非 human subjects research,但判定书要留档(各机构口径不一)。
  2. 「数据出境吗」:云内分析无数据移动;出云产物(汇总统计)的语义按 DUA 与本国规范双查——「结果 vs 数据」的边界界定是应答核心。
  3. 「再识别风险多大」:技术防线(云内审计)+ 法律防线(禁令)+ 机构问责三层;研究者个人不做任何再识别尝试是绝对义务,风险应答不等于豁免。
  4. 留档纪律:以上应答与凭证进 §8.5 台账——审计时的「可出示性」比「合规性」本身更常被检验;合规是流程资产不是一次性事件。

§9 谱系与生态

§9.1 大型队列时间线

2006  UK Biobank 立项(深表型前瞻队列范式)
2015  精准医学计划宣布(Obama)→ AoU 立项
2018  AoU 征集启动(Denny NEJM;beta 10 万)
2020  Workbench 开放(首批数据)
2022  基因组数据滚动发布
2024  Nature 基因组主论文(245K 基因组;2.75 亿新变异)
2025  CDRv8(633K);预算削减(75%)放缓征集
2026-06  CDRv9(747K;535K WGS;多组学元年;「世界最大整合库」)

§9.2 术语表

术语 定义
CDR Curated Data Repository——版本化数据发布(v9)
Researcher Workbench 云端研究平台(GCP)
Registered/Controlled Tier 数据访问层级(基因组/unshifted 仅 Controlled)
RCR Responsible Conduct of Research——强制伦理培训
DUA Data Use Agreement——机构数据使用协议
OMOP CDM 观察性医疗数据通用数据模型
phecode EHR 表型编码体系(PheWAS 用)
SDoH 社会健康决定因素(调查层)
srWGS / lrWGS 短读长/长读长全基因组测序
kinship 亲缘关系估计(混合模型协方差)
PGx 药物基因组学
pQTL 蛋白数量性状位点
PRS 多基因风险评分
PheWAS 全表型关联研究
participant-mediated EHR 参与者自行提交的 EHR 数据
HIE Health Information Exchange——健康信息交换数据源

§9.3 资源选型决策树

你的需求是什么?
├─ 「多祖源 GWAS/PRS 公平性」
│    → AoU(86% underrepresented 是唯一解)
├─ 「基因组 × 深表型(影像/体格)」
│    → UK Biobank(深表型另一端)
├─ 「变异频率参考」
│    → gnomAD(非队列;频率金标准)
├─ 「EHR 时序方法学开发」
│    → MIMIC-IV(免费下载;先在 MIMIC 原型再上 AoU)
├─ 「美国真实世界药物响应」
│    → AoU PGx + drug_exposure(CPIC 对照)
├─ 「蛋白组/转录组 × 基因组」
│    → AoU v9 多组学(子集 1 万级)或 UKB-PPP(5 万级蛋白组)
├─ 「癌症机制」
│    → TCGA(深组学)+ AoU(人群风险背景)
└─ 「免费快速下载原型」
     → AoU 不适用(云内受控)——MIMIC/公开基准先行

§9.4 与本库其他条目的关系

条目 关系
uk-biobank 互补巨型队列——发现/复现双库组合
gnomad 变异频率对照——关联结果的背景核查
MIMIC-IV-ED EHR 方法学原型——云内分析前的算法演练场
TCGA 癌症深组学——人群风险的疾病分支
GTEx 组织表达——多组学机制的外部参照
ClinVar 临床变异语义——PGx/罕见变异的注释归宿

§9.5 组合使用建议

研究设计 推荐组合 分工
多祖源发现-复现 AoU(发现)+ UKB(复现)+ gnomAD(频率) 功效 + 复现 + 背景
PGx 全链 AoU(PGx+暴露)+ CPIC/DrugBank(指南/语义) 数据 + 语义
EHR AI 原型 → 生产 MIMIC(原型)+ AoU(规模化验证) 方法 + 规模
多组学机制 AoU(同人整合)+ GTEx(组织参照)+ ChEMBL(药理) 整合 + 参照 + 归宿
公平性审计 AoU(测试场)+ 各来源模型 基准 + 审计对象

组合纪律:版本快照统一——AoU CDR 版本与对照库版本同期锁定;出云结果与库内结果的口径声明分开。

§9.6 公共队列治理的生态角色

AoU 证明了「多样性 + 参与者治理 + 云原生受控访问」可以在国家尺度并存:86% underrepresented 是征集工程的结果(社区伙伴网络/HPO),参与者进入治理层是结构设计而非姿态,云内分析使 PB 级受控数据可规模化供给。它把「队列研究」从「招募受试者」重写为「与公众长期合作」——AI 时代健康数据的合法性来源因此有了可复制的模板。对医疗 AI,AoU 是公平性测试的最真实基准:任何声称「通用」的模型都应在这里接受多祖源审计。

§9.7 开放-受控光谱上的定位

公共生物医学数据资源分布在「全开放(gnomAD CC0)— 宽开放(UKB 注册制)— 受控(AoU/TFGA)」光谱上——AoU 是受控端的工程极值:

维度 gnomAD UK Biobank All of Us
数据形态 汇总/频率 全体级 全体级
访问 直接下载 注册+费用 注册+培训+云内
个体数据 无 有(英国语境) 有(美国语境)
分析地 本地 本地/云 仅云内
再识别防线 不适用(汇总) 法律+技术 法律+技术+审计+治理
  1. 工程含义:AoU 的「仅云内」使分析范式(Hail/notebook/BigQuery)成为一等公民——代码可移植性设计(避免与本地管线强耦合)从第一天就值得。
  2. 风险对冲:云内依赖 → 平台变更风险;对策是代码与产物快照的版本管理(Workbench 产物出云留档)。

§9.8 全球巨型队列生态位

把 AoU 放进全球队列生态的完整拼图:

队列 国家/语境 规模量级 与 AoU 的差异化
All of Us 美国(多样性设计) 74.7 万+ 86% underrepresented + 多组学 + 云治理
UK Biobank 英国(中年深表型) ~50 万 影像/体格深度;欧洲祖源主导
FinnGen 芬兰(全国登记链接) 50 万+ 全国健康系统语义;北欧祖源
Million Veteran Program 美国(退伍军人) 90 万+ 规模更大但人群构成不同
中国队列(ChinaMAP 等) 中国(东亚祖源) 十万级 东亚祖源深度;区域健康语义

生态位结论:AoU 的不可替代性不在「最大」(MVP 规模更大)而在「多样性结构 + 多组学 + 云原生治理」的三重组合——引用时说清楚维度比说「最大」更准确;多祖源比较研究需要 AoU × 东亚队列 × UKB 的三方拼图。

§10 资源导航与 FAQ

§10.1 官方资源导航

上手指引(第一次接入的推荐顺序):

  1. 查机构 master DUA → 研究者注册 → RCR 培训(第一周)。
  2. Registered Tier 先行:cohort builder 建队 + BigQuery 描述统计($300 积分内)。
  3. Controlled 升级(若需基因组):附加模块 + Hail 环境(§4.3 骨架)。
  4. 单表型原型(GWAS 或风险模型)→ 云成本实测 → 正式预算。
  5. 出云审核流程走通(汇总统计导出)→ 团队 SOP 固化。

§10.2 关键文献

  1. Denny, J.C. et al. The “All of Us” Research Program. New England Journal of Medicine 381, 668-676 (2019).
  2. All of Us Research Program Investigators. Genomic data in the All of Us Research Program. Nature 627, 340-346 (2024). DOI 10.1038/s41586-024-07340-0
  3. Dutka, T. et al. All of Us Research Program year in review: 2024. American Journal of Human Genetics 112, 1983-1987 (2025).
  4. All of Us Research Program year in review: 2025. American Journal of Human Genetics (2026). DOI 10.1016/j.ajhg.2026.xx(CDRv9 口径年度回顾)
  5. NIH. NIH’s All of Us Research Program is now the largest integrated genomics and health database in the world. NIH 新闻稿(2026).

§10.4 FAQ

Q1:All of Us 数据免费吗?
A:数据免费(NIH 资助)——成本在云计算($300 初始积分后 GCP 自费)与合规纪律(RCR/行为准则)。

Q2:怎么拿到访问权?
A:机构 master DUA(1,200+ 家已有)→ 研究者注册 → RCR 培训(年度)→ Controlled Tier 加修模块;无 DUA 的机构先签约。

Q3:747,000 和 883,000 哪个对?
A:都对——88.3 万是总注册,74.7 万是数据可用(部分参与者的数据未达发布质量/未完成模块);引用声明口径。

Q4:「世界最大」是什么口径?
A:NIH 口径是「最大的基因组+EHR 整合数据库」——带整合定语;单比基因组量另有更大资源(如 UKB 全基因组接近)。

Q5:Registered 和 Controlled Tier 差在哪?
A:基因组数据与 unshifted(真实)日期只在 Controlled;Registered 有 EHR/调查/测量/wearables(日期平移)。

Q6:能下载数据到本地吗?
A:不能(受控模型是数据不出云)——分析在 Workbench 内做,汇总类结果经审核出云。

Q7:EHR 数据全吗?
A:不全——98% 同意分享但 30 万+ 参与者尚无 EHR 数据;分析前必做可得性过滤(坑点 1)。

Q8:多组学(蛋白/转录)样本怎么这么少?
A:v9 首次入场(9,969/8,980)——是多组学时代的起点不是全队列;结论声明子集样本量。

Q9:CDR 版本会过期吗?
A:Workbench 只保留最近 3 个 CDR——长项目自存快照(cohort 定义 + 汇总结果)。

Q10:per-ancestry 分析为什么是铁律?
A:人群分层使跨祖源 pooling 产生假关联(LD 结构与效应频率差异)——分层 + meta 是标准姿势。

Q11:PRS 直接用欧洲训练的行吗?
A:不行——跨祖源衰减显著(§7.9 消融);用 AoU 做祖源特异权重训练/校准是它的核心价值。

Q12: wearables 数据是什么粒度?
A:Fitbit 活动时序(步数/心率/睡眠类)——数字表型研究的原料;时间戳口径按访问层级确认。

Q13:能做家族/遗传混合模型吗?
A:能——kinship 辅助文件提供亲缘结构(GRM);亲属对的存在使混合模型是标配不是可选。

Q14:PGx 数据怎么用?
A:PGx 辅助 calls(CYP2D6/HLA 等)× OMOP drug_exposure——真实世界药物响应;与 CPIC 指南口径对照验证。

Q15:EHR 是原始数据吗?
A:不是——OMOP CDM 标准化后的事实表;表型算法(phecode/概念集)是必要一层,定义敏感性分析必备。

Q16:认知与行为健康数据是什么?
A:2026 新增调查集——心理健康表型的受控发布;敏感数据的层级与使用条款更严。

Q17:国际研究者能用吗?
A:能——注册与 RCR 流程对国际机构开放(DUA 路径同);注意本国人类遗传资源管理的双合规。

Q18:算一个 GWAS 大概多少钱?
A:单表型单祖源数百 compute-hours 量级(GCP 自费)——$300 积分够原型;正式分析先做预算与配额告警。

Q19:和 MIMIC-IV 怎么分工?
A:MIMIC 免费下载适合方法原型(ICU 语境);AoU 规模化与基因组链接——「MIMIC 原型 → AoU 验证」是省成本路径。

Q20:和 UKB 怎么分工?
A:AoU 管多样性发现(86% underrepresented),UKB 管深表型复现(影像/体格全)——「AoU 发现 → UKB 复现」是标准组合。

Q21:数据会更新吗?老结果怎么办?
A:CDR 年度级滚动(v9 当前)——老结果可复算期受三版本窗口限制;发表锁版本 + 快照自存。

Q22:参与者的基因组结果会回传给他们吗?
A:会(临床级发现)——这是 AoU 治理设计的一部分;研究者分析的队列部分成员「知情」——知情状态作为协变量的讨论是加分项。

Q23:能把自己的数据与 AoU 合并分析吗?
A:汇总统计级合并可行(meta-analysis);个体级合并不行(数据不出云)——设计分析时按此约束。

Q24:2.75 亿新变异(2024 论文)现在还有效吗?
A:口径是 2024 论文(245K 基因组时点);v9(535K WGS)的变异目录更大(+1.25 亿 vs v8)——引用各处锁时点。

Q25:怎么引用 All of Us?
A:数据集 + CDR 版本 + 注册 protocol;基因组分析引 Nature 2024 论文;遵守 NIH 公共获取政策。

Q26:AI 训练(大模型)允许吗?
A:研究用途的模型训练在同意框架内可行(云内)——商业基础模型预训练不在同意覆盖;产物与用途按行为准则评估。

Q27:调查(Survey)数据怎么进模型?
A:调查响应在 OMOP observation/survey 表——SDoH 变量直接可 join;缺失模式敏感(§2.9),插补策略写进方法段。

Q28:「基线」是什么时候?
A:AoU 是滚动征集不是单时点基线——「基线」按参与者首次采集定义;纵向分析用事件日期(注意 Registered 层日期平移)。

Q29:能查某个具体参与者的数据吗?
A:不能——person_id 匿名且禁止再识别;个体级追溯在任何场景都不合规(§8.1 红线)。

Q30:多组学子集(1 万级)能加权外推到全队列吗?
A:谨慎——先查子集选择机制(质量报告);加权外推的方差代价大,多数分析直接声明「子集内结论」。

Q31:kinship 显示队列里有亲属对怎么办?
A:混合模型(GRM 协方差)或每组保留一个亲属(敏感性分析)——亲属对破坏独立性假设是 GWAS 显著性膨胀的常见原因。

Q32:发表前平台要审核什么?
A:出云产物审核(汇总统计语义)+ 引用规范(数据集 + CDR 版本 + NIH 公共获取政策);protocol 在 Workbench 注册是流程一环。

§10.5 要点回顾

  1. 受控开放:注册 + RCR + 行为准则 + 云内分析——纪律是门槛,数据免费。
  2. 多样性即科学:86% underrepresented 改写多祖源 GWAS/PRS 的功效与公平性。
  3. 同人整合:535K WGS × 482K EHR + 多组学——模态对齐全库最全。
  4. EHR 缺口纪律:98% 同意 ≠ 数据完整——可得性过滤是第一动作。
  5. per-ancestry 铁律:分层 + meta——pooling 假关联。
  6. 层级口径:unshifted dates/基因组仅 Controlled——时序分析先确认层级。
  7. 三版本滚动:CDR 快照自存——长跑项目的保险。
  8. 云成本规划:$300 够原型不够 GWAS——预算与告警先行。
  9. 分祖源报告:平均数是多样性队列最危险的数字。
  10. 偏倚声明:自选队列(更老/更多女性/更不健康)——limitation 固定条款。

口径存照(数字均注明口径与来源,写入正文前已核对)

  • 747,000+ 数据可用 / >883,000 注册(+114,000)/ 535K WGS / 近 482K EHR(+22%)/ 1.3B 变异 / 553K array / 96K SV / 600K 测量 / 747K 调查 / 86%(645,000+)underrepresented / 50 州 98% ZIP / 1,400+ 论文 / ~23,000 研究者 = NIH 新闻稿(2026,CDRv9 发布)
  • Array 553,949(>190 万 variants)/ srWGS 535,662(>1.3B variants;+12 万人 +1.25 亿变异)/ SV 96,405(~150 万)/ lrWGS 14,521(>250 万;+11K)/ RNA-seq 8,980(首次;per-ancestry QTL)/ proteomics 9,969(首次;>5,000 蛋白)= 官方基因组与多组学质量报告(2026-06-26,CDRv9)
  • CDRv8 口径 633,000(较前 +50%)= 2025 发布口径(旧版)
  • 245,388 临床级基因组 / 77% underrepresented / >2.75 亿新变异 / 3,724 变异 × 117 疾病复制 = All of Us Investigators, Nature 627:340-346(2024)
  • 「世界最大基因组+EHR 整合数据库」= NIH 新闻稿口径(带整合定语)
  • 访问模型(Registered/Controlled、$300 初始积分 365 天、RCR 年度、DUA 1,200+ 机构、三 CDR 滚动)= researchallofus.org 平台文档与官方支持页
  • 奠基论文 Denny NEJM 381:668-676(2019);成果示例(心血管八病测试/前列腺癌模型 5,000 人试验)= NIH 新闻稿
  • EHR 完整性缺口(30 万+ 无 EHR)与队列偏倚(自选)= 第三方分析(intuitionlabs 综述 2026-08)+ 官方已知问题——按 limitation 处理
  • 2025 预算削减 75% 影响征集(86 万→87.3 万)= 第三方综述(2026-08)——公共源波动背景,非官方数字
  • 多组学与 EHR 语义(OMOP 标准化/participant-mediated/HIE/认知与行为健康新增)= NIH 新闻稿与官方质量报告(2026-06)交叉核对
  • 队列偏倚方向(更老/更多女性/更多受教育/更多有保险/更少白人/更不健康)= 官方队列特征描述(2024 Nature)与第三方综述一致性核对

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • ckb — 共享标签:公共卫生与流行病学 / 队列研究 / 基因组学与多组学
  • impc — 共享标签:公共卫生与流行病学 / 基因组学与多组学
  • alphamissense — 共享标签:公共卫生与流行病学 / 基因组学与多组学
  • uk-biobank — 共享标签:公共卫生与流行病学 / 基因组学与多组学
  • ega — 共享标签:队列研究 / 基因组学与多组学
  • nki-rockland — 共享标签:公共卫生与流行病学 / 队列研究
  • sra — 共享标签:公共卫生与流行病学 / 基因组学与多组学
  • all-of-us-nih — 共享标签:队列研究 / 基因组学与多组学
  • hrs — 共享标签:公共卫生与流行病学 / 队列研究
  • topmed — 共享标签:队列研究 / 基因组学与多组学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集