信息速览

MVP(Million Veteran Program)— 百万级退伍军人基因组与 EHR 队列 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | Million Veteran Program(MVP,百万退伍军人计划) |
| 英文全称 | Million Veteran Program |
| 别名/简称 | VA MVP、MVP Cohort、MegaMVP(Science 2024 全表型 GWAS 项目名)、百万退伍军人计划 |
| 疾病分类 | 全表型覆盖(2,068 个性状,Science 2024):ICD-11 6B40 PTSD / 6A70 重度抑郁 / BA00 原发性高血压 / 5A11 2 型糖尿病 / GB61 慢性肾病 / 7A42 阻塞型睡眠呼吸暂停等多系统疾病 |
| SNOMED CT | 64779008 PTSD / 370143000 Major depressive disorder / 44054006 Diabetes mellitus type 2 / 433144002 Chronic kidney disease / 38341003 Hypertension / 78275009 Obstructive sleep apnea(详见 §2.1b) |
| 数据模态 | 血样基因分型(全基因组 SNP 阵列+填充)、纵向电子健康记录(EHR)、结构化问卷调查、生物样本(DNA/血浆) |
| AI 任务类型 | GWAS 与精细映射(fine-mapping)、PheWAS、多基因风险评分(PGS)开发与跨血统验证、EHR 疾病风险预测(如 REACH-VET 自杀风险模型)、药物基因组学、表型提取(NLP/phecode) |
| 样本总数 | 入组 1,091,487 名退伍军人(截至 2025-11-20);基因分型 635,969 人(Genomics Release 4,Science 2024) |
| 数据大小 | 个体级原始基因组+表型约 30 TB(VA 安全计算环境内);2,068 个性状 GWAS 汇总统计经 dbGaP 开放 |
| 数据格式 | 个体级:基因型 dose/概率文件 + VA CDW 关系库表型(VA 环境内);汇总统计:bgzip/tabix 压缩文本(dbGaP) |
| 许可证 | dbGaP Authorized Access(需签署数据使用认证 DUC);个体级数据经 VA ORD 研究价值评审 |
| 访问级别 | 申请审核(汇总统计经 dbGaP Authorized Access;个体级限 VA 研究者及获批合作者) |
| DUO 标签 | GRU、NCU、IRB(dbGaP Authorized Access,非商业研究使用,需伦理审批) |
| 语言 | 英语(调查问卷、EHR 文本与研究文档);队列人群含多血统(约 1/3 非欧洲血统) |
| 首发日期 | 2011(启动招募,初期站点:波士顿 MA、西黑文 CT) |
| 最后更新 | 2025-11(入组 1,091,487 人);dbGaP 版本 phs001672.v14.p1 |
| 发布机构 | U.S. Department of Veterans Affairs — Office of Research and Development(VA ORD,资助方 VA Cooperative Studies Program) |
| 官方主页 | https://www.mvp.va.gov/ |
| 下载地址 | dbGaP phs001672(汇总统计);个体级经 VA ORD 评审流程 申请 |
| DOI | 10.1126/science.adj1182(Science 2024 全表型 GWAS);dbGaP phs001672 |
| 引用次数 | 303+(Scopus,截至 2026-09,Science 2024 全表型 GWAS 论文) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 基因组数据已完成标准化 QC 与填充、表型库(CIPHER/phecode)成熟;扣分项:无官方机器学习划分、需自建表型定义与训练/验证/测试划分、个体级访问审批周期长且仅限 VA 环境 |
| 页面状态 | published |
§0 E-E-A-T 审核与免责
医学审核:[千方病案医学编辑部]交叉审核:§2 医学背景(退伍军人健康、PTSD/心血管/代谢/肾病流行病学与 ICD-11/SNOMED 映射)、§7 偏倚分析。
数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。MVP 汇总统计需通过 dbGaP Authorized Access 申请并签署数据使用认证(DUC);个体级数据仅对 VA 研究者及获批合作者开放,须经 VA Office of Research and Development 研究价值评审,且数据不得离开 VA 安全计算环境。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? MVP(Million Veteran Program,百万退伍军人计划)是美国退伍军人事务部(VA)自 2011 年运行的巨型纵向队列与生物样本库:超过 109 万名退伍军人(截至 2025-11-20 已达 1,091,487 人)自愿捐献血样、填写健康与服役经历调查,并授权研究者持续访问其 VA 电子健康记录(官方数据快照、Military.com 报道)。截至 2024 年 7 月,其中 635,969 人已完成全基因组基因分型(Genomics Release 4)。
为什么重要? 这是全球首个突破百万参与者、且与单一医疗系统深度绑定的基因组队列:基因型可以直接链接到参与者数十年的纵向 EHR(含诊断、检验、生命体征、用药),样本多样性显著优于同类 biobank——非欧洲血统参与者占基因分型人群近三分之一。2024 年 7 月发表于 Science 的全表型 GWAS(常称 MegaMVP)一次性覆盖 2,068 个性状、报告 26,049 条变异-性状关联(VA News),其衍生的自杀风险模型 REACH-VET 已在全 VA 系统部署。
我能用它做什么? 做 GWAS/PheWAS 与跨血统精细映射、开发与验证多基因风险评分(PGS)、用 EHR+基因型构建疾病风险预测模型、研究药物基因组学与军事暴露健康效应。注意:个体级数据仅向 VA 研究者及获批合作者开放(数据不离开 VA 安全计算环境),外部研究者主要使用 dbGaP 上的 GWAS 汇总统计,或以 VA 主导项目合作者身份参与。
§1.1 摘要
MVP 由 VA Office of Research and Development(ORD)资助、VA Cooperative Studies Program(CSP)支持,主 PI 为 J. Michael Gaziano(VA Boston),联合 PI 包括 Christopher J. O’Donnell(VA Boston)与 Philip S. Tsao(VA Palo Alto),数据协调依托 VA Boston 的 MAVERIC 中心(dbGaP phs001672、Science 2024)。招募通过邀约邮件、临床站点现场报名与在线报名(mvp.va.gov)进行,参与者在签署知情同意与 HIPAA 授权后提供血样、完成基线/生活方式/军事经历与有毒暴露调查,并同意持续的 EHR 链接与未来再联系。基因分型采用定制 Affymetrix Axiom Biobank Array(MVP 1.0)并填充至 1000 Genomes 参考面板;Science 2024 报告 Release 4 覆盖 635,969 人、逾 4,430 万个变异,全表型 GWAS 在 ORNL Summit/Andes 超算上完成逾 3,500 亿次变异-性状检验(Argonne/ORNL 报道)。对医疗 AI 而言,MVP 的核心资产是"基因型 × 纵向 EHR × 调查 × 大规模多样性队列"的四重链接,以及 dbGaP 上可经授权获取的全表型汇总统计。
§1.2 战略价值分析
维度一:多样性与统计功效的稀缺平衡。 迄今 GWAS 文献约 94% 的参与者为欧洲血统,而 MVP 基因分型人群中非欧洲血统达 186,927 人(近三分之一):非洲血统 121,177、混合美洲血统 59,048、东亚血统 6,702(VA News, 2024-07)。这一结构让跨血统精细映射成为可能——Science 2024 的 fine-mapping 在 613 个性状上识别 6,318 个因果变异信号,其中三分之一(2,069 个)仅在纳入非欧洲人群后才显现。对 AI 团队,这意味着可以直接获取按血统分层的效应量估计,用于构建更公平的 PGS。
维度二:单一医疗系统内的深表型纵向性。 与 UK Biobank 等多医院联盟不同,MVP 的 EHR 来自统一的 VA Veterans Health Administration(VHA)体系:编码体系一致(ICD-9/ICD-10、CPT)、实验室与生命体征标准化存储、随访可跨越数十年(Release 4 个体级 EHR 覆盖 1999-10 至 2020-01)。叠加 VA 特色资产——服役经历与有毒暴露调查、精神健康量表、自杀预防数据库(SPAN)与国家死亡指数(NDI)链接——MVP 是研究 PTSD、自杀风险、Gulf War Illness、耳鸣、创伤性脑损伤等"退伍军人特异"表型的几乎唯一大规模选择。
维度三:从数据到论文再到临床落地的完整闭环。 MVP 是极少数"数据集—论文—部署"全链条打通的生物样本库:衍生分析进入 REACH-VET 自杀风险模型并在全 VA 系统部署,前列腺癌遗传标志物进入临床试验验证,药物基因组学证据经 National Pharmacogenomics Program 推进临床工作流。截至 2025-11,MVP 支撑同行评审论文 475+ 篇、dbGaP 汇总统计服务 300+ 项外部研究(Military.com, 2025-11)。对 AI 团队,这意味着可以对标"真实部署先例"而非只对标论文指标——REACH-VET 的分层监控与"触发主动关怀"设计就是现成的落地模板。
维度四:持续扩张中的活体资源。 MVP 不是冻结的存量数据集:2023-11 破百万后招募仍在继续(重点提升女性与农村退伍军人占比),dbGaP 版本持续迭代(v14.p1),生物样本库保留测序、甲基化等组学扩展空间。选型含义:围绕 MVP 建立的 pipeline 与模型需要内置"版本感知"(见 §7.6 漂移),但同时也意味着今天进入的研究者会在后续 release 中持续获益。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 人群 | 标注/表型 | 与 MVP 的差异化 |
|---|---|---|---|---|---|
| MVP | 入组 1,091,487(截至 2025-11);基因分型 635,969 | 基因分型阵列+EHR+调查+生物样本 | 美国退伍军人(91% 左右男性,约 1/3 非欧洲血统) | 2,068 个性状 GWAS 汇总统计;CIPHER/phecode 表型库 | 军队人群、服役/暴露数据、单一 EHR 系统、REACH-VET 等临床落地 |
| UK Biobank | 约 50 万参与者 | 基因分型+外显子/全基因组子集+影像+EHR | 英国 40-69 岁一般人群 | ICD/HES 链接+影像表型 | 影像深度更强,但退伍军人暴露表型缺失、人群同质性更高 |
| All of Us(NIH) | 100 万+ 注册(截至 2024 年口径) | 全基因组测序+EHR+调查+可穿戴 | 美国一般人群,强调多样性 | 测序级基因组+EHR | 测序更精细,但 EHR 跨异构系统、表型标准化程度低于 VA |
| Geisinger MyCode / DiscovEHR | 约 30 万+ 外显子测序 | 外显子测序+EHR | 宾州等地域性人群 | EHR 表型 | 区域性、外显子聚焦;无军事暴露维度 |
| Mass General Brigham Biobank | 10 万+ | 基因分型+EHR | 新英格兰地区患者 | EHR 表型 | 规模与多样性均小于 MVP |
§1.4 版本时间轴
| 时间 | 事件 | 规模口径 |
|---|---|---|
| 2011 | MVP 启动招募,初期站点:波士顿(MA)、西黑文(CT),后扩展至全国 VA 站点 | — |
| 2015-08 | 邀约回复率 13.2%(VA CSP 记录) | — |
| 2016-02 | Gaziano 等在 J Clin Epidemiol 发表 MVP 队列设计论文 | — |
| 2017-09 | VA CSP 记录 | >600,000 名参与者 |
| 2018-10 | Nature Genetics 血脂 GWAS(首批大规模 MVP GWAS 之一) | 基因分型 312,571 人 |
| 2023-11 | VA 宣布突破百万参与者,为全球首个百万级医疗系统关联生物样本库 | 入组 1,000,000+ |
| 2023-03 / 2024 | 各论文口径:PLOS Genetics(825,000+);JAMA Psychiatry(850,000) | — |
| 2024-07-19 | Science 发表全表型 GWAS(MegaMVP,Genomics Release 4):2,068 性状、26,049 条关联 | 基因分型 635,969 人 |
| 2025-11-20 | VA 官员证实最新入组规模;累计同行评审论文 475+ 篇 | 入组 1,091,487 |
| 2025 | dbGaP 汇总统计版本迭代至 phs001672.v14.p1,已支撑 300+ 项外部研究 | — |
§1.5 典型应用场景
- 跨血统 GWAS 与精细映射:直接使用 dbGaP 汇总统计或 VA 环境内个体级数据,按非洲/混合美洲/东亚/欧洲血统分层分析,利用 Science 2024 的 6,318 个 fine-mapped 信号做因果变异优先级排序。
- 多基因风险评分(PGS)开发与公平性评估:在多血统人群上量化 PGS portability 衰减(已有文献显示非欧洲血统效应显著衰减),构建 ancestry-aware 评分。
- EHR 疾病风险预测:结合基因型与纵向 EHR(诊断、检验、生命体征、用药)预测 PTSD、自杀风险、慢性肾病进展等;参考已落地的 REACH-VET 自杀风险模型。
- PheWAS 与药物重定位:以 phecode 全表型扫描变异-疾病关联,复制 PCSK9/ANGPTL4/PDE3B 式的药物靶点假设(2018 血脂 GWAS 路线)。
- 军事暴露与健康结局研究:利用 Military Experiences and Toxic Exposures Survey(223,000+ 人完成)研究部署史、有毒暴露与长期健康结局的基因-环境交互。
- 外部队列的复制与参照集:反向使用 MVP——作为 FinnGen、UK Biobank、MGB 发现的独立复制集,或利用其血统多样性(AFR 121,177)补足欧洲主导元分析中缺失的血统层。
§2 医学背景
MVP 的表型空间覆盖 VA 医疗系统全疾病谱,Science 2024 全表型 GWAS 量化了 2,068 个性状。本节聚焦队列中最具代表性、文献证据最充分的核心疾病域:精神健康(PTSD、抑郁、自杀风险)、心血管代谢(高血压、血脂、BMI、2 型糖尿病)、慢性肾病与睡眠呼吸暂停,并说明退伍军人健康研究与精密医学(precision medicine)的临床语境。
§2.1 ICD-11 编码映射表
| 疾病/表型 | ICD-11 编码 | ICD-11 中文名 | 在 MVP 中的证据基础 |
|---|---|---|---|
| 创伤后应激障碍 | 6B40 | 创伤后应激障碍 | MVP 支持迄今最大 PTSD GWAS(VA 新闻口径) |
| 重度抑郁 | 6A70 | 抑郁障碍 | MVP 支持迄今最大重度抑郁 GWAS(VA 新闻口径) |
| 原发性高血压 | BA00 | 原发性高血压 | EHR 诊断+血压生命体征长期纵向记录 |
| 急性心肌梗死 | BA41 | 急性心肌梗死 | 2018 血脂 GWAS 关联冠心病终点 |
| 2 型糖尿病 | 5A11 | 2 型糖尿病 | EHR 诊断+实验室(HbA1c/血糖) |
| 肥胖 | 5B80 | 肥胖 | 平均 BMI 30.2(Release 4);BMI phenomics 专项研究 |
| 慢性肾病 | GB61 | 慢性肾脏病 | 肾病为 MVP 重点研究领域;eGFR 实验室轨迹 |
| 阻塞型睡眠呼吸暂停 | 7A42 | 阻塞型睡眠呼吸暂停 | 568,576 人 OSA GWAS,MVP 内患病率 21% |
| 结节病 | 4B90 | 结节病 | Science 2024:非洲血统患病率≥2 倍于欧洲血统的性状之一 |
§2.1b SNOMED CT 映射表
| 标签 | ICD-11 | SNOMED CT 码 | 术语 |
|---|---|---|---|
| PTSD | 6B40 | 64779008 | Posttraumatic stress disorder (disorder) |
| 重度抑郁 | 6A70 | 370143000 | Major depressive disorder, single episode |
| 2 型糖尿病 | 5A11 | 44054006 | Diabetes mellitus type 2 (disorder) |
| 原发性高血压 | BA00 | 38341003 | Hypertensive disorder, systemic arterial (disorder) |
| 急性心肌梗死 | BA41 | 57054005 | Acute myocardial infarction (disorder) |
| 慢性肾病 | GB61 | 433144002 | Chronic kidney disease (disorder) |
| 阻塞型睡眠呼吸暂停 | 7A42 | 78275009 | Obstructive sleep apnea (disorder) |
| 肥胖 | 5B80 | 414916001 | Obesity (disorder) |
| 结节病 | 4B90 | 35999006 | Sarcoidosis (disorder) |
§2.2 疾病简介与退伍军人流行病学
为什么退伍军人健康是一个独立的研究领域? 退伍军人人群的服役经历(部署、战斗暴露、有毒物质接触如越战 Agent Orange 与海湾战争燃烧坑)带来了普通人群队列缺乏的暴露谱;同时,VA 作为美国最大的整合医疗系统之一,为约 900 万在册退伍军人提供连续照护,使"基因型-暴露-纵向结局"三者得以在同一体系内闭环。MVP 正是这一语境下的旗舰工程:目标直指"理解遗传特征、行为与环境因素如何影响健康"(VA CSP 研究页)。
MVP 人群的基础健康画像(Genomics Release 4,Science 2024):平均年龄 61.9 岁,平均 BMI 30.2 kg/m²(肥胖比例高),20.6% 为现吸烟者,女性占 8.8%。这与 VA 医疗使用人群"年龄偏大、男性为主、慢病共病负担重"的结构一致,也决定了 MVP 对心血管代谢、慢性肾病、精神疾病研究的天然优势:这些疾病在队列中既有足够病例量,又有多年 EHR 轨迹可回溯。
精神健康:PTSD、重度抑郁与自杀风险是 MVP 的标志性产出方向——VA 官方多次强调 MVP 已支持"迄今最大的 PTSD、重度抑郁与心脏病遗传研究";2023 年 PLOS Genetics 的自杀意念 GWAS 在 99,814 例病例与 512,567 名对照中识别 4 个 pan-ancestry 位点,表型整合了 ICD 编码、SPAN 自杀行为报告、心理健康调查与国家死亡指数四类来源。睡眠呼吸暂停:MVP 内 OSA 患病率约 21%,568,576 人 GWAS 揭示显著的性别异质性(eBioMedicine 2023)。肾病与种族差异性状:慢性肾病在退伍军人中疾病负担高于普通人群;Science 2024 识别出 101 个在非洲血统参与者中患病率至少两倍于欧洲血统的性状(含遗传性溶血性贫血、结节病、瘢痕疙瘩),并发现非洲血统特异的痛风风险信号。
§2.2b MVP 支撑的代表性研究方向一览
MVP 的研究版图按 VA 医疗系统的高负担病种展开,每个方向均已产出里程碑级证据(下表规模口径互不相同,不可横向比较):
| 研究方向 | 代表发现 | 规模口径 | 出处 |
|---|---|---|---|
| 精神健康(PTSD/抑郁/自杀) | 支持迄今最大 PTSD、重度抑郁与心脏病 GWAS;自杀意念 4 个 pan-ancestry 位点 | SI 病例 99,814 / 对照 512,567 | PLOS Genetics 2023 |
| 睡眠医学(OSA) | 21 个关联区域(17 个新发现);显著性别异质性 | 568,576 人;MVP+FinGen+MGB 合并 916,696 | eBioMedicine 2023 |
| 心血管代谢(血脂) | 118 个新的全基因组显著位点 | 312,571 人、约 32M 变异 | Nature Genetics 2018 |
| 骨关节炎 | 髋/膝 OA 多血统 GWAS,10 个新位点 | MVP+UKB 合计 484,374 人 | Nature Genetics 2022 |
| 肥胖(基因组-表型组网络) | BMI 的 PheWAS 网络与孟德尔随机化 | EA 215,734 / AA 55,525 | Nature Communications 2022 |
| 跨血统差异性状 | 101 个性状非洲血统患病率 ≥2× 欧洲血统;非洲血统特异痛风信号 | 635,969 人(Release 4) | Science 2024 |
逐方向展开:
- 精神健康为何是 MVP 的招牌方向? 服役相关暴露(战斗、军事性创伤、有毒物质)使退伍军人的 PTSD 与抑郁负担高于一般人群,而传统精神遗传学长期受困于病例量不足。MVP 用"四源整合表型"(ICD 编码 + SPAN 自杀行为报告 + Mental Health Assistant 调查 + National Death Index 死亡链接)把自杀意念病例推到近 10 万量级——其中 65.8% 的病例仅由心理健康调查识别:若只依赖诊断编码将漏掉大多数病例,这是 EHR 弱监督表型的经典教训,也是复现此类研究的第一检查点。
- OSA 研究的方法论价值:该论文把"性别 × 血统"双层分层做成可复用模板(按性别与 HARE 分组分别估计再合并),用 FinnGen 做外部复制,并以随机 100 份病历审阅验证表型 PPV=0.92——构成"表型验证 → GWAS → 外部复制"的完整闭环,适合作为新表型项目的流程参照。
- 心血管代谢的药物靶点路线:2018 血脂 GWAS(312,571 人、约 3,200 万变异)确立了"EHR 表型 + 基因组 → 靶点因果推断"的 MVP 招牌范式(PCSK9/ANGPTL4/PDE3B 路线),后续 PheWAS 与孟德尔随机化工作大量沿用该设计。
- 跨血统差异性状为何与 AI 直接相关:Science 2024 把"哪些性状在不同血统中患病率系统性不同"本身作为发现输出(101 个性状)。对建模者,这份清单等于"合并训练几乎注定校准失衡"的病种警戒名单——凡属此类性状,分血统评估(§6.9)不是可选项而是必选项。
§2.3 临床任务定义
| 任务类型 | 定义 | 在 MVP 语境中的形态 |
|---|---|---|
| 风险筛查 | 识别无症状期高风险个体 | PGS+EHR 预测模型(如 REACH-VET 自杀风险,全 VA 系统部署) |
| 诊断支持 | 提高疾病识别准确性 | phecode/EHR 表型算法 + OSA 类 ICD 编码验证(chart review PPV 0.92) |
| 分型/分层 | 按基因亚型或血统分层 | HARE 血统分层分析;ancestry-specific 效应量估计 |
| 预后建模 | 预测疾病进展与结局 | 纵向实验室(eGFR、HbA1c)+生命体征轨迹建模 |
| 药物基因组学 | 预测药物反应差异 | National Pharmacogenomics Program 的研究基础;靶点因果推断(PCSK9/ANGPTL4/PDE3B 路线) |
§2.4 患者人群画像
| 维度 | 取值 | 来源与口径 |
|---|---|---|
| 来源 | VA 医疗系统活跃使用者(须具备知情同意能力;不要求以 VA 为唯一照护来源) | VA CSP 研究页 |
| 入组时间 | 2011 年至今(持续招募,重点提升女性与农村等代表性不足群体) | Military.com,2025-11 |
| 年龄结构 | 主峰 60-69 岁(35%)、70-79 岁(20%)、50-59 岁(18%);18-29 岁 3% | mvp.va.gov(截至 2023-11,100 万口径) |
| 性别 | 女性 >10%(全员口径);Release 4 基因分型分析人群中 8.8% | mvp.va.gov;Science 2024 |
| 种族/血统 | 74% White、18% Black、8% Hispanic;基因分型人群非欧洲血统占近 1/3 | mvp.va.gov;VA News 2024-07 |
| 就医类型 | 连续综合照护(含住院、门诊、社区照护报销记录),EHR 中位随访长达十年量级(2018 论文:中位 10.0 年) | Nature Genetics 2018 |
画像对建模的三点含义:(1) 这是一个"老年、男性为主、慢病共病密集"的队列——常见慢病病例量充沛,而罕见病与年轻发病型疾病功效有限;(2) 参与者须具备知情同意能力且自愿报名,天然排除了认知严重受损等群体,把结论外推到全人群时须再次校验(见 §7.3 泛化性表);(3) 参与者不要求以 VA 为唯一照护来源,但 EHR 记录以 VA 系统内诊疗为主体(含社区照护报销),非 VA 就医的可见性系统性偏低,这是就医利用偏倚(坑点 7)的人群结构根源。
§2.5 临床价值
MVP 的发现已进入三条临床转化通道。其一,系统级风险预测:MVP 分析识别的遗传与临床标志物被纳入 REACH-VET 模型,在全 VA 系统用于识别自杀风险升高的退伍军人并触发主动干预(Military.com, 2025-11)。其二,肿瘤与肾病的精准医疗:前列腺癌风险预测的遗传标志物进入临床试验验证,慢性肾病(退伍军人高发)的新疗法研究持续推进。其三,药物基因组学体系化:VA 借助 MVP 证据推进 National Pharmacogenomics Program 与 National Precision Oncology Program,把"基因-药物反应"知识写进临床工作流。对 AI 研究者,这些通道意味着 MVP 衍生模型有真实的部署先例可对标,而非停留在论文指标。
§2.6 表型金标准定义
| 要素 | 内容 |
|---|---|
| 划分/定义方式 | phecode 体系(基于 ICD-9/ICD-10 映射)+ CIPHER 表型知识库统一管理;复杂表型叠加问卷与专项数据库 |
| 标注方式 | 自动编码提取(EHR 主导)+ 自报调查(补充)+ 少量人工病历审阅(验证) |
| 标注者资质 | VA/MVP 表型方法学研究团队(如 MAVERIC、CIPHER 平台作者)定义与维护 |
| 一致性验证示例 | OSA 表型:随机 100 份病历审阅,阳性预测值 PPV=0.92(eBioMedicine 2023) |
| 多源自杀表型 | ICD-9/ICD-10 自伤编码 + SPAN 报告 + Mental Health Assistant 调查 + NDI 死亡链接;65.8% 病例仅由心理健康调查识别 |
| 性质 | 弱监督(真实世界 EHR 表型),非人工逐例标注的金标准诊断 |
§3 数据集规格
§3.0 版本抉择矩阵
MVP 不是单一下载包,而是"汇总统计 + 个体级数据 + 探索工具"三层资源。先对号入座再动手:
| 你的需求 | 推荐资源 | 大小/规模 | 理由 |
|---|---|---|---|
| 外部研究者做 GWAS 复现、MR、PGS 权重开发 | dbGaP phs001672 汇总统计(Authorized Access + DUC) | 2,068 个性状,bgzip/tabix | 无需 VA 身份;已支撑 300+ 外部研究 |
| VA 附属或合作团队训练 ML 模型(个体级) | Genomics Release 4(VA 安全环境内) | 约 30 TB | 基因型+EHR+调查个体级链接,唯一可训练个体级模型的通道 |
| 规划阶段估算样本量、构建粗队列 | GenHub(VA MVP Data Explorer,VA NT 账户)与公开数据快照 | 在线工具 | 查询临床特征分布、power analysis,无需完整数据 |
| 查找/复用标准化表型定义 | CIPHER(Centralized Interactive Phenomics Resource,公开) | 在线知识库 | phecode 表型定义跨系统可复用,提升可重复性 |
§3.1 模态详情
基因分型:血样 DNA 经定制 Affymetrix Axiom Biobank Genotyping Array(MVP 1.0,含 custom content)分型,填充至 1000 Genomes 参考面板;Science 2024 在 QC 与填充后纳入逾 4,430 万个变异(MAC>40)。早期论文(2018)检验约 3,200 万变异。EHR:VA 企业级数据仓库(CDW)提取的诊断(ICD-9/ICD-10)、实验室、生命体征、用药与诊疗过程;Release 4 个体级 EHR 覆盖 1999-10 至 2020-01,并含社区照护(Community Care)报销记录。调查:Baseline(642,000+ 完成)、Lifestyle(524,000+)、Military Experiences and Toxic Exposures(223,000+)三类核心问卷,线上/纸质/电话多通道采集。生物样本:编码 DNA、buffy coat 与血浆样本(VA CSP 记录),供后续测序与甲基化等扩展(Syracuse 合作页提及 genomic、sequencing、methylation、nutrition 数据扩展)。
§3.2 按子集样本数表
| 子集 | 样本数 | 口径与来源 |
|---|---|---|
| 累计入组 | 1,091,487 | 截至 2025-11-20(VA 官员,Military.com) |
| 完成基因分型(Release 4 分析集) | 635,969 | Science 2024 |
| — 其中非洲血统(AFR) | 121,177 | Science 2024 |
| — 其中混合美洲血统(AMR) | 59,048 | Science 2024 |
| — 其中东亚血统(EAS) | 6,702 | Science 2024 |
| — 其中欧洲血统(EUR) | 449,042 | Science 2024 |
| Baseline Survey 完成 | 642,000+ | VA News(百万里程碑公告) |
| Lifestyle Survey 完成 | 524,000+ | VA News |
| Military Experiences & Toxic Exposures Survey 完成 | 223,000+ | VA News |
| 2018 血脂 GWAS 基因分型 | 312,571 | Nature Genetics 2018(历史版本口径) |
| OSA GWAS 分析集 | 568,576 | eBioMedicine 2023 |
| 自杀意念 GWAS 病例/对照 | 99,814 / 512,567 | PLOS Genetics 2023 |
为什么几个"总人数"对不上? 这是使用 MVP 最高频的困惑——每个数字都正确,只是口径不同:
| 数字 | 口径 | 与前者的差异来源 |
|---|---|---|
| 1,091,487 | 累计签署知情同意并入组(截至 2025-11-20) | 分母上限;含未完成血样采集或基因分型的参与者 |
| 642,000+ | 完成 Baseline Survey | 调查完成存在流失,与基因分型完成集合不完全重合 |
| 635,969 | Genomics Release 4 通过 QC 的基因分型分析集 | 叠加 call rate ≥98.5%、可疑身份剔除、三度及以上亲缘剔除其一 |
| 850,000 / 825,000+ | JAMA Psychiatry 2024 / PLOS Genetics 2023 成稿时的入组快照 | 论文写作时点早于当前累计数,属历史快照口径 |
建模铁律:分母永远取你实际拿到的分析集(如 Release 4 的 635,969),不要用宣传口径的累计入组数做 power calculation——后者约为分析集的 1.7 倍,直接套用会让样本量估计虚高约七成。
§3.3 数据格式表
| 数据对象 | 格式 | 获取通道 |
|---|---|---|
| GWAS 汇总统计 | bgzip 压缩 + tabix 索引文本(按性状/血统分层) | dbGaP phs001672 Authorized Access |
| 个体级基因型 | dose/概率文件(IMPUTE 风格)+ 样本协变量表(PLINK 兼容转换) | VA 安全计算环境内(ORD 评审后) |
| 个体级 EHR/表型 | 关系数据库表(VA CDW 提取;含诊断、实验室、生命体征、用药) | VA 安全计算环境内 |
| 调查数据 | 结构化问卷条目表(在线/纸质/电话录入) | VA 安全计算环境内 |
| 表型定义 | CIPHER 在线知识库 + phecode 映射文件 | 公开 |
| 单 SNP 快查 | dbGaP 在线 look-up 工具 | 公开接口 |
§3.4 存储大小
个体级原始基因组+表型约 30 TB(ORNL/Argonne 报道口径,相当于约 2 亿页文本的信息量);全表型 GWAS 计算产生逾 3,500 亿次变异-性状检验、>50 万 node-hours 的超算负载。外部研究者的实际下载体量以所选性状的汇总统计为准(通常数 GB 至数十 GB 量级,dbGaP 页面提供按性状打包下载)。
§3.5 标注方式
MVP 的"标注"即表型定义(phenotyping),以规则驱动的 EHR 编码提取为主(弱监督):phecode 体系将 ICD 编码聚合为疾病表型;连续性状(BMI、血压、血脂)直接取 EHR 测量并做异常值修剪(如 BMI 论文剔除身高>3 英寸或体重>60 磅的离群记录);调查条目(生活方式、军事暴露)提供 EHR 无法观测的变量。部分高误判风险表型辅以人工病历审阅验证(OSA PPV 0.92)。无逐例人工诊断金标准,使用时应把"表型≠临床确诊"纳入建模假设。
§3.6 标注者资质与一致性
表型定义由 VA/MVP 方法学团队(MAVERIC、CIPHER 平台建设者、各 GWAS 工作组)制定并跨研究复用;CIPHER 的使命即"跨医疗系统优化 EHR 表型的可重复性、一致性与可扩展性"。一致性证据以验证性审阅与跨数据集复制(FinnGen、MGB Biobank 等)形式提供,而非标注者间 kappa 一致性。
§3.7 采集周期
招募自 2011 年持续至今(Ongoing enrollment);参与者入组后 EHR 链接持续更新。Genomics Release 4 的个体级 EHR 窗口为 1999-10 至 2020-01(含入组前历史病历回溯);调查数据自入组起分批完成(Baseline 642,000+,随招募推进)。
§3.8 地域覆盖
美国全国。初期两个招募中心:波士顿(MA)与西黑文(CT),随后扩展至全国参与 VA 医疗中心;单体站点招募冠军为 VA Long Beach(超 33,000 人入组)。人群血统结构与全美退伍军人总体接近,女性与农村退伍军人为重点补招方向。
§3.9 设备与平台规格
基因分型:定制 Affymetrix Axiom Biobank Genotyping Array(MVP 1.0,含 custom content)。计算平台:全表型 GWAS 使用美国能源部橡树岭国家实验室(ORNL)Summit 超算与 Andes 系统,对 SAIGE 做 GPU 优化改造后完成(常规实现估算需约 251 计算年)。表型探索:GenHub(VA NT 账户)与 CIPHER(公开)。
§3.10 深度溯源链
| 环节 | 主体 | 说明 |
|---|---|---|
| 招募与知情同意 | MVP 全国站点 + mvp.va.gov | 书面知情同意 + HIPAA 授权 + 同意未来再联系 |
| 样本采集与分型 | VA 临床站点 → 分型实验室 | 血样采集,MVP 1.0 阵列分型 |
| 填充与 QC | MVP 基因组数据团队 | 1000 Genomes 填充;call rate <98.5% 剔除;亲缘与身份 QC |
| EHR 提取 | VA CDW / MAVERIC | ICD-9/ICD-10、实验室、生命体征、社区照护报销 |
| 表型定义 | CIPHER / phecode 团队 | 标准化表型知识库,跨研究复用 |
| GWAS 汇总统计 | ORNL/DOE 合作 + dbGaP | phs001672 版本化发布(v14.p1),DUC 管控 |
§4 数据结构
§4.0 目录树
MVP 不提供统一的公开下载包。以下为两类工作区的典型布局示意(依据 dbGaP 汇总统计分发规范与 VA 环境论文描述整理,具体文件名以获批后官方交付为准):
# A. dbGaP 汇总统计(外部研究者,Authorized Access 下载)
phs001672.v14.p1/
├── summary_stats/ # GWAS 汇总统计(按性状×血统分层)
│ ├── eur/ # 欧洲血统层
│ │ ├── trait_001.tsv.bgz # bgzip 压缩 + tabix 索引
│ │ └── trait_001.tsv.bgz.tbi
│ ├── afr/ # 非洲血统层
│ └── meta/ # 跨血统 meta-analysis
├── phenotype_tables/ # 性状 QC 后定义与病例数
├── readme_data_usage.md # 使用说明与引用要求
└── manifest.txt
# B. VA 安全计算环境(获批 VA 研究者,Release 4 个体级)
mvp_release4/
├── genotypes/ # MVP 1.0 阵列分型 + 1000G 填充
│ ├── chr{1..22}.dose.* # 剂量文件(按染色体)
│ └── sample_covariates.* # 样本协变量(age/sex/HARE/PC1-10)
├── ehr/ # VA CDW 提取
│ ├── diagnoses/ # ICD-9/ICD-10 编码 + 时间戳
│ ├── labs/ # 实验室测量
│ ├── vitals/ # 生命体征(BMI/血压等)
│ └── meds/ # 用药记录
├── surveys/
│ ├── baseline/ # 基线问卷(642,000+ 完成)
│ ├── lifestyle/ # 生活方式问卷(524,000+ 完成)
│ └── military_exposure/ # 军事经历与有毒暴露(223,000+ 完成)
└── phenotype_library/ # phecode 映射与 CIPHER 导出定义
注意:个体级数据不得离开 VA 安全计算环境;上表仅用于理解数据组织逻辑,实际目录以 ORD 评审通过后的官方交付物为准。
§4.1 DAIMS 字段字典
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差/注意 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| sample_id | Text | 编码化参与者标识(跨基因型/EHR/调查链接主键) | MVP-XXXXXX(脱敏) |
患者级聚合与划分 | 全程使用编码 ID;直接标识符已移除 | 无(主键必有) | 系统生成唯一值 |
| age_at_enrollment | Integer | 入组时年龄 | 64 |
协变量、年龄偏倚校正 | 以入组日为准,非 EHR 事件日 | 无 | 18-100+ |
| sex_at_birth | Category | 出生性别(基因分型 QC 经性染色体确认) | M |
分层分析、性别异质性 | 与性别身份字段区分;91% 左右为男性 | 少数未确认样本被剔除 | M/F |
| hare_group | Category | Harmonized race/ethnicity 分组 | EUR |
血统分层、公平性评估 | 自报与遗传祖源协调后的分类 | 无 | AFR/AMR/EAS/EUR/ Hispanic 等 |
| genetic_pc1…pc10 | Float | 遗传主成分(前 10) | -0.0123 |
祖源校正、防混杂 | 不可作预测特征随意使用(会吸收祖源效应) | 无 | 连续值 |
| genotype_dosage | Float | 变异等位基因剂量(0/1/2 连续化) | 0.97 |
GWAS/PGS 输入 | 填充值含不确定性(info 分数过滤) | 无 | [0, 2] |
| icd_code | Text | ICD-9/ICD-10 诊断编码(2015-10 切换) | I10 / BA00 |
表型提取主来源 | 两版编码体系需映射;社区照护记录覆盖不全 | 无(有 encounter 才有行) | ICD-9/10 词表 |
| phecode | Text | phecode 聚合表型(CIPHER 库) | 401 |
PheWAS、标签 | 排除性编码规则影响病例/对照定义 | 无 | phecode 词表 |
| bmi | Float | EHR 生命体征计算体质指数 | 30.2 |
代谢表型、协变量 | 离群测量(论文剔除身高>3 英寸等极端记录) | 长期未就诊者缺失 | 15-60(QC 后) |
| lab_egfr | Float | 估算肾小球滤过率(示例实验室指标) | 58 |
CKD 进展建模 | 检验频率不均(就医利用偏倚) | 未检验即缺失(非随机) | 连续值 |
| survey_item | Category | 调查问卷条目响应 | 5 |
基因-环境交互 | 轮次未完成即缺失(Baseline 642k/Lifestyle 524k/Exposure 223k) | -777 类哨兵值随官方文档 |
各条目量表 |
| encounter_date | Date | EHR 诊疗事件日期 | 2017-06-14 |
时序特征、时间切分 | ICD-10 切换(2015-10)前后编码密度突变 | 无 | 1999-10 至 2020-01(Release 4) |
§4.2 标签分布
| 性状层 | 规模示例 | 来源 |
|---|---|---|
| 全表型扫描 | 2,068 个性状(1,854 二元 + 214 定量,medRxiv 版 QC 口径) | Science 2024 / medRxiv |
| OSA(二元) | MVP 内患病率约 21%;分析集 568,576 | eBioMedicine 2023 |
| 自杀意念(二元) | 99,814 病例 / 512,567 对照 | PLOS Genetics 2023 |
| BMI(定量) | 均值 30.2 kg/m²(Release 4) | Science 2024 |
| 血脂(定量) | 297,626 人有至少一次血脂测量(2018 口径) | Nature Genetics 2018 |
§4.3 关键统计
- 变异数:QC 与填充后 >44.3M(MAC>40,Science 2024);2018 论文检验约 32M。
- 基因分型 QC:call rate 阈值 98.5%;可疑身份样本剔除;三度及以上亲缘者每组保留一人。
- 血统结构:EUR 449,042 / AFR 121,177 / AMR 59,048 / EAS 6,702。
- EHR 窗口:1999-10 至 2020-01(Release 4);2018 论文报告 EHR 中位随访 10.0 年。
- 汇总统计成熟度:dbGaP 版本 v14.p1,300+ 外部研究使用。
- 调查完成度:Baseline 642,000+ / Lifestyle 524,000+ / Military Experiences & Toxic Exposures 223,000+(VA News 百万里程碑公告)。
- Release 4 分析人群画像:平均年龄 61.9 岁、平均 BMI 30.2 kg/m²、20.6% 现吸烟者、女性 8.8%(Science 2024)。
- 计算体量:全表型 GWAS 逾 3,500 亿次变异-性状检验、>500,000 node-hours,于 ORNL Summit/Andes 超算完成(Argonne/ORNL 报道)。
- 招募历史口径:邀约回复率 13.2%(截至 2015-08,VA CSP 存档);>600,000 名参与者(截至 2017-09)。
§4.4 数据层级
参与者(participant,编码 sample_id)
└── 入组事件(enrollment:同意书+血样+首份调查)
├── 调查轮次(survey wave:Baseline / Lifestyle / Military Exposure)
└── EHR 纵向流(1999-10 起)
└── 诊疗事件(encounter)
├── 诊断编码(ICD-9/ICD-10 → phecode)
├── 实验室测量(labs)
├── 生命体征(vitals → BMI、血压)
└── 用药记录(meds)
§4.5 缺失值与信息性缺失编码表
| 缺失模式 | 机制 | 信息性 | 处理建议 |
|---|---|---|---|
| 调查轮次缺失 | Lifestyle(524k)与 Exposure(223k)完成率低于 Baseline(642k) | 与健康素养/参与意愿相关 | 按轮次补录时间建模缺失倾向;避免把未完成当"阴性" |
| EHR 测量缺失 | 检验按临床指征开单 | 强信息性(未就医≠健康) | 就医利用调整(如近 1-2 年就诊次数协变量);明确"缺失=未测" |
| 社区照护记录不全 | 非 VA 就诊仅部分经报销进入记录 | 对女性/慢病管理场景影响更大 | 敏感性分析:VA 使用强度分层 |
| 2015-10 前后编码密度突变 | ICD-9 → ICD-10-CM 切换 | 系统性(非随机) | 跨版本映射表 + 切换点前后敏感性分析 |
| 入组与基因分型不同步 | 1,091,487 累计入组 vs 635,969 已分型(Release 4 口径) | 与入组批次/站点相关 | 分析一律以"通过 QC 的分析集"为分母;勿用累计入组数 |
| 罕见表型病例稀疏 | 低患病率性状病例数不足 | — | 参照 CIPHER 定义使用阈值化病例标准;参考 Science 2024 对 ≥100 例 phecode 的处理惯例 |
§5 数据划分与使用建议
§5.1 官方划分
MVP 官方未提供机器学习用途的训练/验证/测试划分。GWAS 工作流按血统(HARE)与性别分层后使用全量分析集(如 Release 4 的 635,969 人),并通过亲缘剔除与 PCs 校正控制混杂——这是"流行病学划分逻辑",不是"ML 划分",直接照搬会带来患者级与家系级泄漏。
§5.2 社区惯例划分
- GWAS/PGS 路线:全量分析 + 外部队列验证(FinnGen、MGB Biobank、UK Biobank 是常见复制集;OSA 论文即用 FinnGen v7 复制)。
- EHR 深度学习路线:按
sample_id划分(约 70/15/15 或 80/10/10),确保同一参与者的所有 encounter 只出现在一侧;时间外推场景用"入组前后"或"日历年"切分。 - 跨血统评估:固定测试集为 AFR/AMR/EAS 分层样本,量化模型在各血统层的表现差(PGS portability 评估惯例)。
划分方案速查(细节见对应小节):
| 方案 | 适用任务 | 切分逻辑 | 关键约束 |
|---|---|---|---|
| 随机 ID 划分 | 横断面疾病预测 | 约 70/15/15,按 sample_id | 亲缘组同侧(GroupShuffleSplit,§5.4) |
| 时间切分 | 前瞻性外推 | 预测时点 T 两侧(§5.6) | ICD 切换点敏感性双口径 |
| 血统分层固定测试集 | PGS/公平性 | EUR 训练 → AFR/AMR/EAS 测试 | PCs 不进特征;分血统报告(§6.9) |
| 入组批次 group CV | 纵向/漂移检验 | 5 折按入组批次 | 检验招募年代漂移鲁棒性 |
§5.3 泄漏风险(重点)
| 泄漏源 | 机制 | 缓解 |
|---|---|---|
| 患者级重复 | 同一参与者多次 encounter/住院分散在训练与测试集 | 划分前先按 sample_id 去重聚合;assert 无跨集 ID |
| 家系泄漏 | 亲缘参与者(一/二/三度亲属)分布两侧,结局高度相关 | 用官方 QC 的亲缘推断分组划分(GroupShuffleSplit);或直接采用剔除亲缘后的分析集 |
| 血统信息泄漏 | genetic PCs 作为特征会把祖源-结局关联"内化",跨血统虚高 | 评估公平性时 PCs 仅作混杂校正(GWAS 惯例),不进 ML 特征 |
| 时间穿越 | 用后续用药/诊断反推基线状态(如把出院诊断当入院特征) | 严格按 encounter_date 构建前向特征窗口;预测时点 T 只允许 ≤T 信息 |
| 表型定义循环 | 标签与特征出自同一 EHR 编码体系(phecode 由 ICD 聚合) | 标签 ICD 列从特征集中显式剔除或加时间窗间隔 |
§5.4 交叉验证建议
- 精神健康等失衡表型:5 折分层 CV + 报告 AUROC 的 95% CI;病例<1,000 的性状用嵌套 CV 防过拟合。
- 纵向建模:按入组批次做 group CV,检验招募年代漂移鲁棒性。
- PGS 任务:训练(MVP EUR)→ 超参(内部验证)→ 测试(AFR/AMR/EAS + 外部 biobank),三级隔离。
亲缘分组的划分代码骨架(配合 §5.3 家系泄漏一行):
from sklearn.model_selection import GroupShuffleSplit
# 官方 QC 已把三度及以上亲缘者每组剔除至一人(Release 4),
# 但推断亲缘与自报家系不完全重合:把亲缘组作为 group 做
# GroupShuffleSplit 仍是最低合规动作,而非过度设计。
gss = GroupShuffleSplit(n_splits=1, test_size=0.15, random_state=42)
train_idx, test_idx = next(gss.split(
cohort, groups=cohort["kinship_group"])) # 无亲缘列时退化为按 sample_id
assert set(cohort.iloc[train_idx]["sample_id"]) .isdisjoint(
cohort.iloc[test_idx]["sample_id"]) # 患者级隔离断言
§5.5 外部验证建议
优先级:FinnGen(欧洲,OSA 论文已示范)→ MGB Biobank(美国 EHR 结构相近)→ UK Biobank(深表型)→ All of Us(美国多样性参照)。跨系统验证时统一用 phecode/ICD 映射并重新校准概率(MVP 人群基线患病率与一般人群不同)。
§5.6 时间切分示例(EHR 窗口 1999-10 至 2020-01)
Release 4 的个体级 EHR 覆盖 1999-10 至 2020-01,并横跨 2015-10 的 ICD-9 → ICD-10-CM 官方切换点。时间外推实验建议按"预测时点 T"切分——特征只允许来自 T 之前,标签在 T 之后累积:
import pandas as pd
EHR_START, EHR_END = "1999-10-01", "2020-01-31" # Release 4 EHR 覆盖窗口
SWITCH_DATE = "2015-10-01" # ICD-9 → ICD-10-CM 美国切换点
enc = pd.read_parquet(f"{DATA_ROOT}/mvp_release4/ehr/encounters.parquet")
enc["encounter_date"] = pd.to_datetime(enc["encounter_date"])
assert enc["encounter_date"].between(EHR_START, EHR_END).all()
T = pd.Timestamp("2017-01-01") # 预测时点:用 2017-01-01 前的病史预测其后结局
history = enc[enc["encounter_date"] < T] # 特征窗口:1999-10 → 2016-12
outcome = enc[enc["encounter_date"] >= T] # 标签窗口:2017-01 → 2020-01
# 切换点敏感性:是否包含 ICD-9 时代记录会改变 phecode 密度,
# 建议两种口径都报告——history_full(1999 起)与 history_post(仅 ICD-10 时代)
history_post = history[history["encounter_date"] >= SWITCH_DATE]
三个注意点:(1) MVP 入组自 2011 年开始,1999-2010 的记录属"回溯病历",完整度低于前瞻期,可在特征中加入"记录起始年"作为数据成熟度协变量;(2) outcome 窗口内的诊断不得以任何形式回流 history 特征(防 §5.3 时间穿越);(3) EHR 窗口止于 2020-01,COVID 时代完全不在此版本内,后续 release 更新时该切分需整体重做(见 §7.6)。
§6 AI 就绪指南
§6.0 访问路径总览
MVP 没有 Kaggle/HuggingFace 式的一键下载。开工前先确定你的路径:
| 路径 | 适用人群 | 数据层级 | 前置条件 |
|---|---|---|---|
| A. dbGaP 汇总统计 | 高校/企业外部研究者 | GWAS 统计值(无个体行) | dbGaP 账号 + 机构 PI + DUC 签署 |
| B. VA 环境个体级 | VA 研究者或其获批合作者 | 个体级基因型+EHR+调查 | VA ORD 研究价值评审 + VA 计算账户 |
| C. 公开探索工具 | 所有人(规划阶段) | 表型定义/数据快照 | 无(CIPHER 公开;GenHub 需 VA NT 账户) |
典型周期参考:dbGaP 授权以机构审批为准;VA ORD 评审按 RFA 周期滚动开放(联络 MVPLOI@va.gov 咨询)。先在路径 C 上完成表型定义选型与样本量估算,再进入 A/B,是性价比最高的顺序。
§6.1 快速上手(dbGaP 汇总统计)
# ============================================================
# 目录结构预期(dbGaP Authorized Access 下载后):
# data_root/
# └── phs001672.v14.p1/
# └── summary_stats/
# ├── meta/ trait_XXX.tsv.bgz # bgzip 压缩汇总统计
# └── ...
# data_root 与文件名的拼接关系:DATA_ROOT / "phs001672.v14.p1" / 层级 / 性状文件
# 最小可用子集:单性状单血统层的一个 .bgz 文件(数百万行,约数百 MB)
# ============================================================
import pandas as pd
DATA_ROOT = "/path/to/data_root" # 改成你的下载目录
# 读取单个 bgzip 压缩的汇总统计文件(pandas 可直接解析 gzip 流)
gwas = pd.read_csv(
f"{DATA_ROOT}/phs001672.v14.p1/summary_stats/meta/trait_001.tsv.bgz",
sep="\t",
compression="gzip",
usecols=["chrom", "pos", "rsid", "allele1", "allele2",
"af", "beta", "se", "pvalue"], # 列名以官方 manifest 为准
)
# 基础 QC 惯例(MIP/on-screen 检查):显著位点
sig = gwas[gwas["pvalue"] < 5e-8].sort_values("pvalue")
print(f"全基因组显著位点数:{len(sig)}")
print(sig.head(10))
外部研究者 90% 的首篇工作(MR、共定位、PGS 权重构建)都从上述循环开始:遍历 summary_stats/ 下的性状文件即可完成跨性状扫描。
进阶一步——从汇总统计构建多血统 PGS(全程无需个体级数据):
# ============================================================
# 场景 B:单性状 PGS 权重构建与跨血统打分准备
# 输入:§6.1 读入的 EUR 血统层汇总统计
# 工具链:PLINK 2(clumping + scoring),GWAS 生态标准工具
# 红线:MVP 汇总统计按血统分层提供——不要拿 EUR 权重直接给
# AFR/AMR 人群打分(PGS portability 问题,见坑点 5)
# ============================================================
import pandas as pd
ss = pd.read_csv(
f"{DATA_ROOT}/phs001672.v14.p1/summary_stats/meta/trait_001_EUR.tsv.bgz",
sep="\t", compression="gzip",
usecols=["chrom", "pos", "rsid", "allele1", "allele2",
"af", "beta", "se", "pvalue"], # 列名以官方 manifest 为准
)
# QC 惯例 1:剔除 MHC 区域(chr6: 29-33 Mb),LD 结构极端复杂,会污染 clumping
ss = ss[~((ss["chrom"] == 6) & ss["pos"].between(29_000_000, 33_000_000))]
# QC 惯例 2:去重,每个位点只保留最显著变异
ss = ss.sort_values("pvalue").drop_duplicates(subset=["rsid"])
ss.to_csv("trait_001_EUR_clean.tsv", sep="\t", index=False)
# ---- 终端步骤 1:LD clumping(用 1000G 对应血统参考面板)----
# plink2 --clump trait_001_EUR_clean.tsv \
# --clump-p1 5e-8 --clump-r2 0.01 --clump-kb 250 \
# --out trait_001_EUR_leads
# ---- 终端步骤 2:生成 scoring 文件,在目标队列打分 ----
# plink2 --score trait_001_EUR_clean.tsv rsid allele1 beta \
# --out target_cohort_score
# (效应等位基因方向以官方 manifest 说明为准;目标人群为 AFR/AMR 时,
# 应改用对应血统层汇总统计重新构建权重,并考虑 LD 参考匹配类工具。
# JAMA Psychiatry 2024 已量化:直接跨血统移植会让非欧洲层效应
# 系统性衰减——评估方案见 §6.9 的分血统评估代码。)
§6.2 数据获取流程
| 步骤 | 路径 A(dbGaP 汇总统计) | 路径 B(个体级,VA 环境) |
|---|---|---|
| 1. 确认资格 | 机构 PI 拥有 eRA Commons/dbGaP 账号 | VA PI(非 VA 者先建立与 VA PI 的合作) |
| 2. 定位资源 | dbGaP 检索 phs001672(study 页) | VA MVP for researchers 页 + RFA 公告 |
| 3. 提交申请 | dbGaP Authorized Access 申请 + 数据使用认证(DUC) | 经 VA ORD merit review(周期性 RFA);意向联络 MVPLOI@va.gov |
| 4. 审批与下载 | 批准后经 dbGaP 下载汇总统计包 | 在 VA 安全计算环境内开通项目空间(数据不出环境) |
| 5. 使用约束 | 遵守 DUC(非商业、发表声明、禁止再识别) | VA 政策 + MVP 知情同意范围 + VA 审查委员会要求 |
申请材料与常见卡点清单(依据官方流程页与报道口径整理):
- 路径 A(dbGaP)卡点:机构无 eRA Commons 账号、PI 与 DUC 签署人不一致、研究用途描述超出 DUC 边界(如商业用途)——三者构成 dbGaP 拒批的主因;提前核对可省一轮返工。
- 路径 B(个体级)卡点:非 VA 研究者未先建立 VA PI 合作关系、意向书未发 MVPLOI@va.gov、研究设计要求"数据离场"(与"数据不出 VA 环境"政策直接冲突)——后者只能通过改为"分析进环境、结果出环境"的架构解决。
- 规划阶段能做什么:申请审批期间先用公开资源推进——CIPHER 冻结表型定义、dbGaP 单 SNP 查询核对关键变异、GenHub(VA NT 账户)估算队列规模与 power,做到"获批即开工"。
# dbGaP 汇总统计包校验(下载完成后)
find phs001672.v14.p1 -name "*.md5" -exec md5sum -c {} \;
# 逐性状抽查文件完整性(bgzip 需要 tabix 可读)
tabix -h phs001672.v14.p1/summary_stats/meta/trait_001.tsv.bgz 1:1-1000000 | head
§6.3 预处理全流程
# ============================================================
# 预处理目标:从 VA 环境交付的个体级表(示意结构)构建
# "基因型 + EHR + 调查" 的 ML 就绪队列表。
# 目录结构预期:mvp_release4/{genotypes, ehr, surveys, phenotype_library}
# data_root 拼接:DATA_ROOT / "mvp_release4" / 子目录
# 最小可用子集:单病种 phecode 病例-对照 + 基线协变量
# ============================================================
import pandas as pd
import numpy as np
DATA_ROOT = "/path/to/va_project_space/mvp_release4"
# ---- 1. 诊断编码标准化:ICD-9/ICD-10 → 统一时序表 ----
dx = pd.read_csv(f"{DATA_ROOT}/ehr/diagnoses/diagnoses.tsv", sep="\t",
parse_dates=["encounter_date"])
# 2015-10 是 ICD-9 → ICD-10-CM 切换点:先打标再映射,便于做切换点敏感性分析
dx["coding_era"] = np.where(dx["encounter_date"] < "2015-10-01", "icd9", "icd10")
# ---- 2. phecode 聚合:用 CIPHER/官方映射表(弱监督标签)----
phe_map = pd.read_csv(f"{DATA_ROOT}/phenotype_library/phecode_map.tsv", sep="\t")
dx = dx.merge(phe_map[["icd_code", "phecode"]], on="icd_code", how="left")
def define_cases(dx: pd.DataFrame, phecode: str, min_codes: int = 2) -> pd.DataFrame:
"""病例:≥min_codes 条该 phecode 记录;对照:全库无该 phecode。
min_codes 的作用:降低偶发编码噪音(MVP/CIPHER 惯例思路)。"""
n_code = dx[dx["phecode"] == phecode].groupby("sample_id").size()
cases = n_code[n_code >= min_codes].index
ever = set(n_code.index)
cohort = dx[["sample_id"]].drop_duplicates()
cohort["label"] = np.where(cohort["sample_id"].isin(cases), 1,
np.where(cohort["sample_id"].isin(ever), np.nan, 0))
return cohort.dropna(subset=["label"]) # 病例排除型对照:未定者丢弃
# ---- 3. 基线协变量 + 血统层 ----
cov = pd.read_csv(f"{DATA_ROOT}/genotypes/sample_covariates.tsv", sep="\t")
cov = cov[["sample_id", "age_at_enrollment", "sex_at_birth", "hare_group"] +
[f"genetic_pc{i}" for i in range(1, 11)]]
# ---- 4. EHR 纵向特征:BMI 清洗 + 就医利用度 ----
vit = pd.read_csv(f"{DATA_ROOT}/ehr/vitals/bmi.tsv", sep="\t",
parse_dates=["encounter_date"])
# BMI 离群修剪(论文口径:剔除与个体均值偏离过大的极端身高体重记录)
vit["bmi"] = vit.groupby("sample_id")["bmi"].transform(
lambda s: s.mask((s < 12) | (s > 70)))
bmi = vit.groupby("sample_id")["bmi"].mean().rename("bmi_mean")
util = (dx.groupby("sample_id")["encounter_date"].count()
.rename("encounter_count")) # 就医利用代理,缓解信息性缺失
# ---- 5. 合成 ML 就绪队列 ----
cohort = define_cases(dx, phecode="401") # 示例:高血压
cohort = (cohort.merge(cov, on="sample_id", how="left")
.merge(bmi, on="sample_id", how="left")
.merge(util, on="sample_id", how="left"))
cohort = cohort[cohort["hare_group"] != "EAS"] # 示例:EAS 层样本过小先剔除
assert cohort["sample_id"].is_unique # 患者级唯一,防划分泄漏
cohort.to_parquet("hypertension_cohort.parquet")
§6.4 PyTorch DataLoader
# ============================================================
# 场景:用基线协变量 + BMI + 就医利用度预测 phecode 病例状态
# 输入:§6.3 产出的 hypertension_cohort.parquet(患者级唯一)
# 关键设计:按 sample_id 划分;血统分层抽样保证每折含 AFR/AMR/EUR
# ============================================================
import torch
from torch.utils.data import Dataset, DataLoader, WeightedRandomSampler
from sklearn.model_selection import train_test_split
FEATURES = ["age_at_enrollment", "bmi_mean", "encounter_count"]
class MVPCohortDataset(Dataset):
"""患者级表格数据集。sex/hare 做独热;数值列按训练集中位数填补。"""
def __init__(self, df, feature_cols, label_col="label"):
self.X = pd.get_dummies(
df[feature_cols + ["sex_at_birth", "hare_group"]],
columns=["sex_at_birth", "hare_group"],
).astype("float32")
self.X = self.X.fillna(self.X.median(numeric_only=True))
self.X = (self.X - self.X.mean()) / (self.X.std() + 1e-8) # 标准化
self.y = torch.tensor(df[label_col].values, dtype=torch.float32)
def __len__(self):
return len(self.y)
def __getitem__(self, idx):
return torch.tensor(self.X.iloc[idx].values), self.y[idx]
df = pd.read_parquet("hypertension_cohort.parquet")
tr, te = train_test_split(df, test_size=0.2,
stratify=df[["label", "hare_group"]].astype(str).agg("|".join, axis=1),
random_state=42)
train_ds, test_ds = MVPCohortDataset(tr, FEATURES), MVPCohortDataset(te, FEATURES)
# 病例-对照失衡 → 加权采样(标签分布见 §4.2)
counts = tr["label"].value_counts()
weights = tr["label"].map({0: 1.0 / counts[0], 1: 1.0 / counts[1]})
sampler = WeightedRandomSampler(weights.values, num_samples=len(train_ds))
train_loader = DataLoader(train_ds, batch_size=512, sampler=sampler, num_workers=2)
test_loader = DataLoader(test_ds, batch_size=1024, shuffle=False, num_workers=2)
§6.5 八大坑点
⚠️ 坑点 1:ICD-9/ICD-10 编码切换导致表型时间序列断裂(分类:预处理陷阱)
问题:VA EHR 于 2015 年 10 月从 ICD-9 切换到 ICD-10-CM,两套编码粒度差异巨大(ICD-10 细分程度远高于 ICD-9),直接把原始编码当特征或标签会让"同一疾病"在切换点前后语义不一致。
症状:以诊断频次为特征时,2015-10 前后出现与临床无关的阶跃;患病率曲线在切换点出现假性激增或骤降;phecode 映射后部分细码无法回溯。
解决:
- 简单方法:统一走 phecode 映射(phecode 本身对两版 ICD 做了聚合),特征与标签均用 phecode 层。
- 进阶方法:保留
coding_era标记,对关键表型做"切换点前后分层回归",报告效应稳定性;对无法映射的细码按 CIPHER 排除规则处理。- SOTA 方法:用 CIPHER 知识库的跨系统标准化定义,并以 2015-10 前后双窗口训练两个模型版本做敏感性分析(切换点鲁棒性成为论文 limitation 章节的标准动作)。
参考:CIPHER 平台(mvp.va.gov);PLOS Genetics 2023(自杀意念表型的 ICD9/ICD10 双来源整合)
⚠️ 坑点 2:91% 男性与年代队列的外推性陷阱(分类:偏倚陷阱)
问题:MVP 人群以男性为主(全员口径 >10% 女性;Release 4 分析集 8.8% 女性)、年龄偏大(均值 61.9 岁)、皆为 VA 医疗使用者,把 MVP 模型直接外推到一般人群(或反过来把一般人群结论套进退伍军人)会产生系统性偏差。
症状:女性亚组 AUROC 不稳定甚至坍塌;患病率校准(calibration)在一般人群中整体偏移;年轻退伍军人(海湾战争/后 9·11 世代)风险被低估。
解决:
- 简单方法:报告按性别与年龄段分层的性能指标,明示模型适用人群边界。
- 进阶方法:训练时做重加权(IPW)补偿年龄/性别分布;用 VA 人群流行病学先验做校准曲线重标定。
- SOTA 方法:迁移校准——在目标人群小样本上做 Platt/isotonic 再校准,并在论文中同时报告"退伍军人内部 + 一般人群外部"双矩阵(参照 §7.8)。
参考:Science 2024(Release 4 人群画像);JAMA Psychiatry 2024("结果可能不外推至更广泛美国人群"的明确声明)
⚠️ 坑点 3:基因分型阵列与填充面板的批次效应(分类:预处理陷阱)
问题:MVP 使用定制 Affymetrix Axiom Biobank Array(MVP 1.0,含 custom content)并填充至 1000 Genomes 面板;不同招募批次、填充版本与 MAC 阈值(medRxiv 版用 MAC>20,Science 定稿用 MAC>40)会让变异集与等位基因频率口径不一致。
症状:跨血统层合并 GWAS 时出现 QQ 图尾部膨胀的假信号;PGS 权重应用到外部队列时大量变异缺碱基对定位或等位基因翻转;复现结果与论文不完全一致。
解决:
- 简单方法:严格按所用 release 的 QC 文档过滤(info 分数、MAC 阈值),只使用 manifest 内变异。
- 进阶方法:做等位基因对齐(allele harmonization:检查 effect allele/other allele 与参考面板一致性),A/T、C/G 多态位点单独人工核对。
- SOTA 方法:分层 meta 分析(METAL/GWAMA,各血统层独立 GWAS 后合并),并用 LD Score 回归截距诊断分层残余混杂(Science 2024 的标准流程)。
参考:dbGaP phs001672 平台描述;Nature Communications 2022 BMI 论文 Methods(MVP 1.0 阵列+1000G 填充);medRxiv 2023(MAC 阈值差异)
⚠️ 坑点 4:亲缘剔除让样本"悄悄缩水"且划分更脆弱(分类:工程陷阱)
问题:官方 QC 会剔除身份可疑样本(call rate <98.5%)并对三度及以上亲缘者每组保留一人;各论文可用样本因此显著小于"基因分型总数",且不同论文口径不同(635,969 是 Release 4 全口径,单研究常在 56 万级)。
症状:用自己的 cohort 表跑出来的样本量对不上论文数字;把亲缘对留在了训练与测试两侧,模型在家系聚集性状上虚高。
解决:
- 简单方法:以所用 release 官方 QC 后样本清单为准,不做"补回"操作。
- 进阶方法:需要最大化样本时,用官方亲缘推断做 GroupShuffleSplit(同一家系进同一侧)。
- SOTA 方法:主分析用剔亲缘集 + 敏感性分析用家庭分组 CV 双轨报告(PLOS Genetics 2023 等 MVP 论文的惯例)。
参考:PLOS Genetics 2023(QC 细节);JAMA Psychiatry 2024(635,969 → 560,824 的样本流量展示)
⚠️ 坑点 5:PGS 跨血统效应衰减(portability)(分类:评估误用)
问题:用欧洲血统 GWAS 训练的 PGS 在非洲与西语血统人群中效应量显著衰减(连锁结构、等位基因频率与效应异质性共同导致),把"欧洲人群表现"当成全人群表现是 MVP 语境内最常见的评估误用。
症状:AFR/AMR 层 AUROC/R² 大幅低于 EUR 层;跨血统风险分层把少数族裔系统性置于"低风险"档;校准斜率明显偏离 1。
解决:
- 简单方法:始终分血统层报告性能,杜绝"总体 AUROC"单一口径。
- 进阶方法:用 MVP 自身的多血统 GWAS 汇总统计训练 ancestry-aware PGS(PRS-CSx 类跨血统联合框架)。
- SOTA 方法:按血统层分别调权重再融合,并在外部多样性队列(如 All of Us)复核;把衰减幅度作为模型的固定披露项。
参考:JAMA Psychiatry 2024(EXT PGS 衰减证据);Science 2024(多血统 fine-mapping 资源)
⚠️ 坑点 6:多源表型定义"同病不同源"(分类:标签理解)
问题:MVP 复杂表型常由多来源拼合(如自杀意念:ICD 编码 + SPAN 报告 + 心理健康调查 + NDI;65.8% 的 SI 病例仅来自调查),不同来源的假阳/假阴结构完全不同,混用会污染标签。
症状:加入调查源后病例数跳变数倍;不同论文的"同一表型"患病率对不上;只信 ICD 的模型学不到"未就医但有症状"的人群。
解决:
- 简单方法:选定单一主来源(如 ICD→phecode)并在论文中冻结定义。
- 进阶方法:做多源交叉表(来源×来源),按来源组合做分层评估,识别各来源的特异病例群。
- SOTA 方法:多源证据加权标签(如 SI 论文的分类学法:主分析用严格定义 + 敏感性用宽松定义双轨报告)。
参考:PLOS Genetics 2023(SI 表型四来源与占比);eBioMedicine 2023(OSA 编码 PPV 0.92 验证)
⚠️ 坑点 7:就医利用偏倚 = 信息性缺失(分类:偏倚陷阱)
问题:MVP 的 EHR 测量按临床指征产生——检验做得多的人"看起来病得更重、数据也更全";未在 VA 就医的时段不是"健康"而是"未观测"。
症状:缺失越多预测风险越高的悖论;以"近一年检验次数"为特征时模型过度依赖就医频率;把随访长度当协变量后效应方向反转。
解决:
- 简单方法:把就医利用度(encounter 数、最近就诊时间)作为协变量显式建模。
- 进阶方法:按固定观察窗(如入组后第 1-2 年)标准化特征提取窗,窗内缺失单独编码为"未测"通道。
- SOTA 方法:联合建模测量过程与结局(informative missingness 模型),或用 G-computation 类方法做利用度调整的敏感性分析。
参考:VA CSP 研究页(人群=VA 活跃使用者);§4.5 缺失机制表
⚠️ 坑点 8:个体级数据出不了 VA 环境的工程与合规陷阱(分类:工程陷阱)
问题:MVP 个体级数据必须留在 VA 安全计算系统内,外部成员只能以 VA 主导项目合作者身份参与;把"拿到 dbGaP 汇总统计"误当成"拿到个体级数据",或试图把个体级中间结果导出,都会让项目直接停滞甚至违规。
症状:团队按公开数据集习惯搭好本地 GPU 集群后发现无处喂数据;审批时间线与论文 DDL 错配;把中间特征表拷出 VA 环境时被合规审查拦下。
解决:
- 简单方法:规划期就用 dbGaP 汇总统计验证科学假设,确认必须个体级后再启动 ORD 申请(联络 MVPLOI@va.gov)。
- 进阶方法:按 VA 环境资源(CPU 为主、大数据表)重写训练管线:预处理降维在环境内完成,只输出聚合统计/模型权重。
- SOTA 方法:联邦式协作——VA 侧跑训练、外部侧只接收模型与汇总结果,遵循 VA 正在建设的去标识化数据共享机制(截至 2025-11 仍在推进)。
参考:Military.com 2025-11(数据共享机制);Syracuse 合作页(数据留在 VA 系统内)
§6.6 数据增强
- ✅ 安全:表格特征的噪声注入(训练期高斯抖动,模拟测量误差);时间窗抖动(encounter 窗口 ±30 天);按血统层的重采样/加权;SMOTE 类方法仅用于训练折内部。
- ❌ 危险:对遗传 PCs 做任何"增强"(破坏祖源结构);跨血统混合后做 SMOTE(会合成不存在的血统混合型);用 LLM 生成合成病历文本补充稀有表型(引入与真实编码体系脱节的伪分布);对基因组剂量值做线性插值增强(等位基因剂量不可插值)。
§6.7 模型推荐
| 任务 | 推荐模型 | 理由 |
|---|---|---|
| GWAS/汇总统计再分析 | PLINK 2 / REGENIE / SAIGE(GPU 优化版) | MVP 规模与 case 失衡的事实标准;MegaMVP 即 SAIGE 路线 |
| PGS | PRS-CS / PRS-CSx / LDpred2 | 支持多血统联合(PRS-CSx 直接吃 MVP 分层汇总统计) |
| 表格型 EHR 预测 | XGBoost / LightGBM | 患者级表格基线强、可解释;VA 环境资源受限下易部署 |
| 纵向 EHR 深度模型 | 时间感知 Transformer / GRU-D | 处理不规则随访与缺失通道(配合 §6.6 的"未测"编码) |
| 多模态(基因型+EHR) | 两塔编码 + 门控融合 | 基因组与 EHR 量纲差异大,融合层需可学习门控 |
§6.8 硬件需求
| 场景 | 最低配置 | 推荐配置 |
|---|---|---|
| dbGaP 汇总统计分析 | 16 GB RAM 台式机 | 64 GB RAM + NVMe(全表型批量下载) |
| PGS 构建 | 32 GB RAM | 128 GB RAM(LD 参考面板内存密集) |
| VA 环境个体级 ML | VA 项目空间标准配额(CPU) | 申请高内存节点;深度学习优先在环境内做降维后 CPU/有限 GPU 训练 |
§6.9 评估指标代码
# 多血统分层的评估:MVP 语境的最低合规动作(防坑点 2/5)
import numpy as np
from sklearn.metrics import roc_auc_score, brier_score_loss
def evaluate_by_group(y_true, y_prob, groups):
rows = []
for g in np.unique(groups):
m = groups == g
rows.append({
"group": g,
"n": int(m.sum()),
"auroc": roc_auc_score(y_true[m], y_prob[m]),
"brier": brier_score_loss(y_true[m], y_prob[m]),
"prevalence": float(y_true[m].mean()),
})
return pd.DataFrame(rows).sort_values("group")
# 用法:evaluate_by_group(y_test, prob, test_df["hare_group"].values)
# 检查点:AFR/AMR 层 AUROC 相对 EUR 的衰减幅度与 Brier 差值必须写入报告
指标之外还要看分组校准——MVP 的患病率与一般人群不同(如 OSA 约 21%),概率不校准会直接破坏决策阈值:
# 分组分位校准表:报告每血统层的预测均值 vs 实际患病率 + 十分位校准
def calibration_by_group(y_true, y_prob, groups, n_bins=10):
out = []
for g in np.unique(groups):
m = groups == g
pred, real = y_prob[m], y_true[m]
qs = pd.qcut(pred, q=n_bins, duplicates="drop")
tab = (pd.DataFrame({"q": qs, "p": pred, "y": real})
.groupby("q", observed=True).agg(pred=("p", "mean"),
obs=("y", "mean"),
n=("y", "size")))
out.append({
"group": g,
"mean_pred": float(pred.mean()),
"obs_rate": float(real.mean()),
"calib_intercept": float(np.log(real.mean() / (1 - real.mean())
/ max(pred.mean(), 1e-9))), # 粗校准斜率检查
"max_bin_gap": float((tab["pred"] - tab["obs"]).abs().max()),
})
return pd.DataFrame(out)
# 报告口径:每个 group 一行写入主表;max_bin_gap > 0.05 的层必须在
# limitation 中声明或做组内重校准(Platt/iso),禁止只报全局 Brier。
§6.10 MLOps 笔记
- 版本化:dbGaP 版本(phs001672.v14.p1)与 release(Genomics Release 4)必须写进每次实验配置;不同版本数字不可混用。
- 环境约束:VA 环境内无法自由拉取公网包,依赖清单需提前经审批;优先使用环境预装的 R/Python 栈。
- 可重复性:phecode/表型定义用 CIPHER 导出快照存档;ICD 切换点、MAC 阈值、亲缘剔除策略写进 pipeline 配置而非代码注释。
- 审计与合规:所有数据访问留痕(VA 审计要求);输出物(论文图表、模型权重)按 DUC 与 VA 政策走审批后再离场。
- 监控:PGS/预测模型上线后按血统与性别分层监控漂移(MVP 招募仍在扩大,人群结构会缓慢变化)。
- 跨版本对齐:合并多篇论文数字时先对齐口径(累计入组 vs QC 后分析集,见 §3.2);版本不同的数字不得出现在同一张表里。
- 文档留存:dbGaP manifest、CIPHER 导出快照、QC 参数三件套随代码库存档,保证合作者与审稿人可回溯到具体版本。
- 求助路径:数据问题先查 MVP 官网研究者 FAQ,无法解决再经 MVPLOI@va.gov 询问——VA 环境内没有公网社区可搜,官方渠道是唯一出口。
- 合作者管理:非 VA 合作者的访问资格与 VA PI 绑定,人员变动需同步更新项目授权,避免"离职账号仍有数据访问"的合规事故。
§7 质量评估与局限性
§7.1 已知偏倚表
| 偏倚类型 | 描述 | 严重程度 | 缓解 |
|---|---|---|---|
| 性别偏倚 | 男性占绝对多数(全员 >10% 女性,Release 4 分析集 8.8%),女性特异结局功效不足 | 高 | 血统×性别分层分析;VA 正定向补招女性退伍军人 |
| 年龄/年代队列偏倚 | 均值 61.9 岁,以越战与更早服役世代为主,后 9·11 世代偏少 | 中高 | 按服役时代分层;对年轻退伍军人结论保持保守 |
| 就医利用偏倚 | EHR 测量随临床指征产生,非 VA 就医仅部分进入记录 | 高 | §6.3 的利用度协变量 + §7.6 漂移监控 |
| 血统结构不均衡 | EUR 449,042 vs EAS 6,702,跨血统功效差异悬殊 | 中 | 分层 meta 分析;EAS 层结论仅作探索 |
偏倚的量化锚点(建模前先记住这几组数字):女性 8.8% 意味着任何性别特异结局在 Release 4 中的有效样本量约为名义样本的 1/10;EAS 层 6,702 人只够检出常见变异的主效应(对应 Science 2024 中 EAS 特异信号极少的事实);平均 BMI 30.2 + 20.6% 现吸烟者说明代谢与行为混杂普遍存在,协变量集合应默认包含年龄、性别、血统 PCs、BMI、吸烟与就医利用度。
| 招募自选择 | 邀约回复率 13.2%(2015-08 口径),参与者健康与研究参与意愿高于平均 | 中 | 与 VA 全体使用者流行病学做基线对比再解释 |
| 幸存者偏倚 | 入组时点在中年后,早发/致死性疾病被右截断 | 中 | 用 EHR 回溯窗(1999-10 起)部分补偿 |
§7.2 标注质量
MVP 表型 = 弱监督 EHR 编码 + 调查自报,无逐例人工金标准。质量锚点:OSA 表型经 100 份随机病历审阅验证,PPV=0.92(eBioMedicine 2023);phecode 体系经 CIPHER 平台跨系统标准化;复杂表型(自杀意念)采用多源整合并公开各来源占比(65.8% 仅来自调查)。标注质量整体"高一致性、中特异性",用于模型训练时应保留敏感性分析空间。
§7.3 泛化性表(外推性重点)
| 外推场景 | 失效风险 | 证据 |
|---|---|---|
| 退伍军人 → 美国一般人群 | 高:性别/年龄结构、慢病负担、就医体系均不同 | JAMA Psychiatry 2024 明确声明"结果可能不外推至更广泛美国人群" |
| MVP PGS → 非洲/西语血统一般人群 | 高:效应衰减叠加人群结构差异 | PGS 在 AFR/Hispanic 层效应显著衰减(JAMA Psychiatry 2024) |
| MVP 模型 → 非 VA 医疗系统(ICD-10-CM 社区医院) | 中高:编码实践、患者构成不同;phecode 可迁移性待验证 | CIPHER 即为此设计,但需逐表型重校准 |
| 老队列 → 年轻退伍军人(后 9·11 世代) | 中高:暴露谱(燃烧坑、爆炸伤)与年龄结构差异 | MVP 重点补招方向即女性与农村退伍军人 |
| 跨时间(ICD 切换、COVID 后就医模式) | 中:编码密度与就医行为漂移 | ICD-9→10 切换点 2015-10;Release 4 窗口止于 2020-01 |
§7.4 伦理与合规(军方人群知情同意与联邦法规)
- 知情同意框架:参与者签署书面知情同意与 HIPAA 授权,内容覆盖血样采集、EHR 持续链接、未来再联系与数据共享范围;参与完全自愿,且不要求以 VA 为主要照护来源(降低"医疗依赖 coerce 同意"的风险)。
- 联邦法规体系:VA 研究受 Common Rule(45 CFR 46,VA 以 38 CFR 16 实施)约束,人类受试者保护经 VA Central IRB 审查(如自杀意念研究的 Central VA IRB 18-11);基因数据共享叠加 NIH Genomic Data Sharing 政策与 dbGaP Data Use Certification 体系。
- 再识别防护:基因组数据原则上可再识别,MVP 的对策是"编码标识 + 个体级数据不出 VA 安全计算环境 + VA 审查委员会逐项目审批",比一般"下载即负责"模式更严格。
- 返还结果政策:截至 2024-02,个体基因信息不返还参与者(VA 官方口径),使用 MVP 数据时应避免暗示临床可及性的表述。
- 敏感人群议题:退伍军人涉及精神健康、自杀、有毒暴露等高敏表型;SPAN 自杀行为报告等专项数据库的使用受额外审查,模型输出不得用于对个体的惩罚性判定(如退役/福利资格),这正是 REACH-VET 落地时"触发主动关怀而非处分"的设计前提。
联邦法规映射表:使用 MVP 数据意味着同时落在多层法规的管辖之下,逐层理解比记住任何单一条款更重要:
| 法规/政策 | 层级 | 对 MVP 数据使用的具体含义 |
|---|---|---|
| Common Rule(45 CFR 46;VA 以 38 CFR 16 实施) | 联邦人类受试者保护 | 涉及个体级数据的新研究须经 IRB 审查;VA 研究由 VA Central IRB(如自杀意念研究的 Central VA IRB 18-11)或依托机构 IRB 批准 |
| HIPAA 隐私规则 | 联邦医疗隐私 | 参与者入组时签署 HIPAA 授权,覆盖 EHR 持续链接;研究侧对应义务是"不得尝试还原标识符" |
| NIH Genomic Data Sharing(GDS)政策 | NIH 数据共享 | 基因组表型数据按 dbGaP 受控层级发布;Data Use Certification(DUC)约束用途边界(非商业、禁止再识别、发表声明) |
| VA ORD 研究价值评审 | 机构科学评审 | 个体级数据仅对 VA 研究者及获批合作者开放,经周期性 RFA 择优准入(联络 MVPLOI@va.gov) |
| VA 数据安全策略 | 机构信息安全 | 个体级数据保留在 VA 安全计算系统内、不提供下载(截至 2025-11 官方口径) |
对"军方人群知情同意"的三点展开:
- 同意的"未来性"与边界:MVP 同意书覆盖血样采集、EHR 持续链接、未来再联系与数据共享范围——生物样本库的标准设计。但研究者须意识到,参与者同意的是"VA 治理下的研究";把个体级数据搬出 VA 安全环境去第三方云训练模型,大概率同时越过同意范围与 DUC 边界(外部可用资源以 dbGaP 汇总统计为界)。
- 不返还结果的双重含义:截至 2024-02,个体基因信息不返还参与者。一方面免除了研究者的即时临床行动义务;另一方面意味着衍生发现(如高风险变异携带者识别、药物基因组学 actionable 发现)没有临床回传通道——涉及可行动发现的模型应在报告中显式讨论这一闭环缺口,避免夸大"临床可及性"。
- 双重角色的敏感性:参与者既是研究对象又是 VA 患者,研究内容包含现役相关 PTSD、自杀意念等高敏表型。REACH-VET 的部署伦理设计(模型触发主动关怀外展,而非福利或身份处置)应作为一切 MVP 衍生预测模型落地的伦理参照基线。
§7.5 公平性
MVP 的多样性是其公平性资产(非欧洲血统近 1/3,对比既有 GWAS 文献约 94% 欧洲血统),但不等于公平性自动成立:EAS 层仅 6,702 人、女性 8.8%,跨层功效与校准差异必须逐项报告;Science 2024 已示范"分血统 fine-mapping + 报告仅非欧洲人群显现的 2,069 个信号"的公平性叙事模板,建议直接沿用该报告结构。
§7.6 数据漂移
三类漂移需持续监控:编码漂移(ICD-10-CM 细分演进、Community Care 记录接入程度);人群漂移(招募向女性/农村/年轻退伍军人倾斜会改变基线分布,2023-11 破百万后补招仍在进行);医疗实践漂移(GLP-1 类药物普及、COVID 后远程医疗改变就诊与检验模式)。Release 4 的 EHR 窗口止于 2020-01,跨版本更新时需重跑时间切分实验。
§7.7 DAIMS 24 项自检
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ⚠️ | 汇总统计为标准宽格式;个体级为关系库形态,需自行宽化 |
| 2 | 唯一标识 | ✅ | sample_id 编码主键贯穿基因型/EHR/调查三模态 |
| 3 | 特殊字符 | ⚠️ | EHR 文本与编码字段含非常规字符,需清洗管道 |
| 4 | 重复行 | ⚠️ | 多 encounter 天然多行,患者级聚合由研究者负责 |
| 5 | 缺失编码 | ⚠️ | 调查有哨兵值;EHR"缺失=未测"语义需自行声明 |
| 6 | 标签标识 | ⚠️ | phecode 弱监督标签,非临床金标准诊断 |
| 7 | 罕见类分组 | ✅ | CIPHER/Science 2024 提供罕见 phecode 阈值惯例(≥100 例) |
| 8 | 偏倚评估 | ✅ | 各论文 limitation 披露充分;多样性数据官方维护 |
| 9 | 数据字典 | ⚠️ | 汇总统计文档完备;个体级字典随 VA 项目交付提供 |
| 10 | 信息性缺失解释 | ⚠️ | 就医利用偏倚有文献支撑,缺官方字段级操作指南 |
| 11 | 设备记录 | ⚠️ | 基因分型平台明确;临床测量设备源信息不对外 |
| 12 | 共线性 | ✅ | LD 结构、PCs 校正流程成熟(GWAS 生态标准) |
| 13 | 编码映射 | ✅ | phecode + CIPHER 跨系统映射完备 |
| 14 | 时间戳处理 | ✅ | encounter_date 完整;ICD 切换点(2015-10)明确可标定 |
| 15 | 划分建议 | ❌ | 无官方 ML 划分,需自建(见 §5.2/§5.3) |
| 16 | 泄漏讨论 | ⚠️ | GWAS 层面(亲缘/PCs)惯例充分;ML 泄漏需自行处理 |
| 17 | 标签分布 | ✅ | dbGaP/CIPHER 提供性状定义与病例数(如 SI 99,814 例) |
| 18 | 测量偏倚 | ⚠️ | 生命体征/检验受就医利用影响,需利用度调整 |
| 19 | 外部验证建议 | ✅ | FinnGen/MGB/UKB 复制先例成熟(见 §7.8) |
| 20 | 版本记录 | ✅ | dbGaP v1-v14 与 Genomics Release 4 口径清晰 |
| 21 | 预处理脚本 | ❌ | 无官方端到端 ML 预处理脚本公开 |
| 22 | 合规要求 | ✅ | DUC + VA ORD 评审 + IRB 体系明确 |
| 23 | 多模态对齐 | ✅ | 基因型-EHR-调查经 sample_id 官方链接 |
| 24 | 去标识化 | ✅ | 编码 ID + HIPAA 授权 + 数据不出 VA 环境 |
DAIMS 评分:16.5 / 24(✅ 12 项、⚠️ 11 项、❌ 2 项)
评分解读:MVP 在"身份与链接体系"(唯一标识、多模态对齐、去标识化、版本记录、合规)上达到研究级队列的最高水准,编码映射(phecode/CIPHER)与时间戳治理同样扎实;短板集中在"面向 ML 的最后一公里"——无官方划分、无公开预处理脚本,个体级数据字典与缺失语义需要研究者在 VA 环境内自行补齐。
对你意味着什么:(1) 把工程预算的大头从"数据清洗"移到"表型定义与划分设计"上,链接体系可以信任、标签语义不能;(2) 入场前先跑 §5 的划分与泄漏设计评审,避免 635,969 人的样本量被亲缘与患者级泄漏悄悄破坏;(3) 若你是外部研究者,按"dbGaP 汇总统计先行"的路线可绕开大半 DAIMS ⚠️ 项;(4) 任何跨血统/跨性别结论必须自带分层评估(§6.9 代码可直接套用)。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| FinnGen v7 | 芬兰生物样本库 | OSA 位点复制 | FDR 显著复制数 | 17 个新区域中 13 个复制成功 | MVP OSA 发现跨人群稳健(eBioMedicine 2023) |
| Global Lipids Genetics Consortium | 国际联盟 | 血脂 GWAS meta | 新位点数 | MVP 312,571 + 联盟 >600,000 | 118 个新全基因组显著位点(Nature Genetics 2018) |
| UK Biobank | UK Biobank | 骨关节炎多血统 GWAS | 新位点数 | MVP+UKB 484,374 人 | 10 个新位点;部分区域跨血统稳健(Nature Genetics 2022) |
| 同胞家庭内比较 | MVP 内部设计 | EXT 多基因评分因果方向 | 家庭内关联 | 家庭内效应方向一致但幅度减弱 | 支持遗传效应非家庭混杂伪影(JAMA Psychiatry 2024) |
§8 基准性能与生态
§8.1 已发表标杆结果
MVP 是队列型数据集,不存在 Kaggle 式 ML 排行榜;其"基准"由里程碑级 GWAS 论文构成。下表数值来自各自论文的独立设定(样本量、性状定义、QC 门槛均不同),不可直接横向比较,仅用于把握资源量级:
| 研究 | 任务 | 规模 | 关键数值 | 完整引用 |
|---|---|---|---|---|
| MegaMVP 全表型 GWAS | 2,068 性状 GWAS + fine-mapping | 635,969 人 / >44.3M 变异 | 13,672 位点;6,318 fine-mapped 信号(1/3 仅非欧洲人群显现) | Verma et al., 2024, Science. doi:10.1126/science.adj1182 |
| 血脂 GWAS | 4 项血脂性状 | 312,571 人 | 118 个新位点;检验约 32M 变异 | Klarin et al., 2018, Nat Genet. doi:10.1038/s41588-018-0222-9 |
| OSA GWAS | 阻塞型睡眠呼吸暂停 | 568,576 人(合并 meta 916,696) | 21 个关联区域,17 个为新发现 | Sofer et al., 2023, eBioMedicine. doi:10.1016/j.ebiom.2023.104536 |
| 骨关节炎多血统 GWAS | 髋/膝骨关节炎 | MVP+UKB 484,374 人 | 10 个新位点 | Nature Genetics, 2022. doi:10.1038/s41588-022-01221-w |
| BMI 基因组-表型组网络 | BMI GWAS + PheWAS/MR | EA 215,734 / AA 55,525 | EA 795 个全基因组显著位点 | Nature Communications, 2022. doi:10.1038/s41467-022-35553-2 |
§8.2 SOTA 总结与选型建议
- 想发表"资源型"论文:对标 Verma 2024 的分析骨架(分层 GWAS → meta → fine-mapping → 跨血统比较),该文已确立 MVP 全表型分析的叙事标准。
- 想做方法学(PGS/移植性):以 JAMA Psychiatry 2024 的分层评估协议为模板——主分析 + 血统分层 + 家庭内复制三件套。
- 想做 ML 工程:§6 路径 B;先在 CIPHER 上冻结表型,再进 VA 环境。
§8.3 评测协议
GWAS 类结果以"全基因组显著性(P<5×10⁻⁸)+ 独立队列复制"为准绳;PGS 类以"外部队列 AUROC/R² + 血统分层校准"为准绳;ML 预测类目前没有社区统一基准,建议自建划分时公开配置并附 dbGaP/release 版本号,方便横向对齐。
自建评测时的最低报告清单(任缺一项即不宜声称"MVP 验证有效"):
- 数据版本:phs001672 具体版本(如 v14.p1)与 Genomics Release 编号;
- 分析集口径:通过 QC 的样本数(如 Release 4 的 635,969 或你的子集),而非累计入组数;
- 表型定义:phecode 编号或 CIPHER 定义链接 + 病例/对照数;
- 划分方式:sample_id 级隔离声明 + 亲缘处理策略(引用 §5.3/§5.4);
- 分层指标:按 HARE 血统与性别分列 AUROC/校准(§6.9 代码),标注衰减幅度;
- 外部复制集:FinnGen/MGB/UKB 至少一个,附人群构成说明。
§8.4 相关数据集表
| 数据集 | 关系 | 说明 |
|---|---|---|
| UK Biobank | 互补 | 英国一般人群深表型队列,MVP 论文常用复制/联合对象 |
| All of Us(NIH) | 互补 | 美国多样性人群测序队列,公平性对照首选 |
| FinnGen | 外部验证 | 芬兰人群 GWAS 复制源(OSA 论文示范) |
| VA Cooperative Studies Program 其他研究 | 同源 | VA CSP 资助的其他队列/试验(MVP 数据经 CSP 渠道治理) |
| dbGaP phs001672 | 本体入口 | MVP 汇总统计与元数据的正式发布位 |
§8.5 关键论文 Top 5
- Gaziano et al., 2016, J Clin Epidemiol 70:214-223. doi:10.1016/j.jclinepi.2015.09.017 — MVP 队列设计奠基论文("mega-biobank"概念出处)。
- Klarin et al., 2018, Nature Genetics 50:1514-1523. doi:10.1038/s41588-018-0222-9 — 首批大规模 MVP GWAS 之一,确立"EHR 表型+基因型"药物靶点路线。
- Verma et al., 2023, medRxiv 2023.06.28.23291975 — MegaMVP 预印本,披露 SAIGE GPU 化与超算工程细节。
- Verma et al., 2024, Science 385:eadj1182. doi:10.1126/science.adj1182 — MVP 全表型 GWAS 定稿,跨血统 fine-mapping 资源。
- Sofer et al., 2023, eBioMedicine 90:104536. doi:10.1016/j.ebiom.2023.104536 — 大样本 OSA GWAS,示范性别×血统双层异质性分析与外部复制协议。
扩展论文清单(按研究方向检索入口):
| 方向 | 论文 | 一句话定位 |
|---|---|---|
| 队列设计 | Gaziano et al., 2016, J Clin Epidemiol 70:214-223 | 招募流程、基线调查与样本管理的一手描述(MVP 奠基论文) |
| 药物靶点 | Klarin et al., 2018, Nature Genetics 50:1514-1523 | 血脂 GWAS + PCSK9/ANGPTL4/PDE3B 靶点推断范式 |
| 精神健康 | PLOS Genetics, 2023(自杀意念 GWAS) | 四源整合表型(ICD+SPAN+调查+NDI)+ pan-ancestry 分析 |
| 睡眠 | Sofer et al., 2023, eBioMedicine 90:104536 | OSA 性别×血统双层 GWAS + FinnGen 复制 + PPV 验证 |
| PGS 移植性 | JAMA Psychiatry, 2024 | 主分析 + 血统分层 + 家庭内复制的方法学模板 |
| 多血统资源 | Verma et al., 2024, Science 385:eadj1182 | 全表型 GWAS、fine-mapping 与跨血统比较的主资源 |
§8.6 社区活跃度
官方口径:800+ 研究者、100+ 在研项目、550+ 论文(约 2023 数据快照);截至 2025-11 累计同行评审论文 475+ 篇、dbGaP 汇总统计支撑 300+ 项外部研究;dbGaP 版本已迭代至 v14.p1。MVP 仍在新招募(目标扩大女性与农村退伍军人占比),数据资源处于持续扩张期。
招募与产出的时间脉络(详见 §1.4 版本时间轴):2011 年自波士顿与西黑文两站点启动 → 2015-08 邀约回复率 13.2% → 2017-09 累计 >600,000 人 → 2023-11 突破 1,000,000(全球首个百万级医疗系统关联生物样本库)→ 2024-07 Science 发表 635,969 人全表型 GWAS → 2025-11 累计入组 1,091,487。单站点产出的量级可参考 VA Long Beach(全 VA 入组领先站点,累计 >33,000 人)。
§8.7 生态快照表
| 资源 | 类型 | 链接 | 更新口径 | 推荐理由 |
|---|---|---|---|---|
| MVP 官网 | 官方入口 | mvp.va.gov | 持续 | 报名、数据快照、研究者 FAQ |
| 数据探索页 | 官方文档 | Discover MVP data | 持续 | 工具矩阵(GenHub/CIPHER/dbGaP)一站式 |
| CIPHER | 表型知识库 | 经 MVP 数据探索页进入 | 持续 | 公开 phecode 表型定义,跨系统可复用 |
| dbGaP phs001672 | 汇总统计发布 | study 页 | v14.p1 | 外部研究者的正式获取通道 |
| VA MVP for researchers | 申请入口 | research.va.gov/mvp | 持续 | 个体级数据 RFA 与流程(MVPLOI@va.gov) |
| VA CSP MVP 页 | 研究档案 | vacsp.research.va.gov | 存档口径 | 队列设计、样本管理、联系方式 |
§9 相关资源与引用
§9.1 官方资源清单
- 报名与公众信息:mvp.va.gov(在线报名、数据快照、参与者说明)
- 研究者入口:research.va.gov/mvp/for-researchers(RFA 公告与申请流程;咨询:MVPLOI@va.gov)
- 队列档案:VA CSP MVP 研究页
- 汇总统计:dbGaP phs001672(Authorized Access + DUC)
- 里程碑公告:VA News:百万里程碑、VA News:Science 全表型 GWAS
- 第三方深度报道:Military.com:MVP 的增长与数据共享走向(2025-11)
- 计算工程报道:Argonne/ORNL:>50 万 node-hours 的全表型 GWAS 工程
- Release 4 方法学全文:Genomics Release 4 论文 PDF(eScholarship)(QC、HARE 分组与阵列细节的一手来源)
- 站点招募案例:VA Long Beach 单站点 33,000+ 入组公告
§9.2 BibTeX 引用块
@article{gaziano2016million,
author = {Gaziano, J. Michael and Concato, John and Brophy, Mary and Fiore, Louis and Pyarajan, Saiju and Breeling, James and Whitbourne, Stacey and Deen, Jennifer and Shannon, Colleen and Humphries, Donald and others},
title = {Million Veteran Program: A mega-biobank to study genetic influences on health and disease},
journal = {Journal of Clinical Epidemiology},
volume = {70},
pages = {214--223},
year = {2016},
doi = {10.1016/j.jclinepi.2015.09.017}
}
@article{klarin2018genetics,
author = {Klarin, Derek and Damrauer, Scott M. and Cho, Kelly and Sun, Yan V. and Teslovich, Tanya M. and Honerlaw, Jacqueline and Gagnon, David R. and DuVall, Scott L. and Li, Jin and Peloso, Gina M. and others},
title = {Genetics of blood lipids among ~300,000 multi-ethnic participants of the Million Veteran Program},
journal = {Nature Genetics},
volume = {50},
pages = {1514--1523},
year = {2018},
doi = {10.1038/s41588-018-0222-9}
}
@article{verma2024diversity,
author = {Verma, Anurag and Huffman, Jennifer E. and Rodriguez, Alex and Conery, Mitchell and Liu, Molei and Ho, Yuk-Lam and Kim, Youngdae and Liao, Katherine P. and Gaziano, J. Michael and Madduri, Ravi K. and Damrauer, Scott M. and others},
title = {Diversity and scale: Genetic architecture of 2068 traits in the VA Million Veteran Program},
journal = {Science},
volume = {385},
pages = {eadj1182},
year = {2024},
doi = {10.1126/science.adj1182}
}
@article{sofer2023genomewide,
author = {Sofer, Tamar and Kurniansyah, Nuzulul and Murray, Michael and Ho, Yuk-Lam and Gottlieb, Daniel J. and VA Million Veteran Program},
title = {Genome-wide association study of obstructive sleep apnoea in the Million Veteran Program uncovers genetic heterogeneity by sex},
journal = {eBioMedicine},
volume = {90},
pages = {104536},
year = {2023},
doi = {10.1016/j.ebiom.2023.104536}
}
@misc{mvp_dbgap,
author = {{U.S. Department of Veterans Affairs}},
title = {Veterans Administration (VA) Million Veteran Program (MVP) Summary Results from Omics Studies},
howpublished = {dbGaP Study Accession phs001672},
year = {2025},
url = {https://www.ncbi.nlm.nih.gov/projects/gap/cgi-bin/study.cgi?study_id=phs001672.v14.p1}
}
§9.3 引用指南
- 使用汇总统计:引用 Verma et al. 2024(Science)+ dbGaP accession phs001672 + 具体版本号。
- 使用队列设计叙述:引用 Gaziano et al. 2016。
- MVP 官方要求所有产出按 DUC 与 VA 政策致谢 MVP 与其参与者("感谢数十万奉献的退伍军人"是官方叙事的标准表述)。
§10 AI 使用声明卡
§10.1 AI 模型列表
| 用途 | 模型 | 使用方式 |
|---|---|---|
| 资料整合与初稿撰写 | 大语言模型(CodeBuddy 内置 fast-model) | 检索结果归纳、章节起草、表格整理 |
| 事实核验 | 大语言模型 + WebSearch | 数字与来源交叉比对(以 FACTS 清单为准) |
§10.2 AI 参与范围
AI 参与了资料检索整理、章节初稿、表格与代码示例的组织;全部关键数字经人工核对检索来源后录入;章节结构、医学表述与合规声明由人工审定。AI 未接触任何 MVP 个体级数据(本页面为二手文献编纂,不涉及数据操作)。
§10.3 输入来源列表
- Gaziano et al., 2016, J Clin Epidemiol 70:214-223. doi:10.1016/j.jclinepi.2015.09.017
- Klarin et al., 2018, Nature Genetics 50:1514-1523. doi:10.1038/s41588-018-0222-9
- Verma et al., 2023, medRxiv 2023.06.28.23291975
- Verma et al., 2024, Science 385:eadj1182. doi:10.1126/science.adj1182
- Sofer et al., 2023, eBioMedicine 90:104536. doi:10.1016/j.ebiom.2023.104536
- Nature Communications, 2022, BMI 基因组-表型组网络. doi:10.1038/s41467-022-35553-2
- Nature Genetics, 2022, 骨关节炎多血统 GWAS. doi:10.1038/s41588-022-01221-w
- PLOS Genetics, 2023, 自杀意念 pan-ancestry GWAS. doi:10.1371/journal.pgen.1010623
- JAMA Psychiatry, 2024, EXT 多基因评分研究. doi:10.1001/jamapsychiatry.2024.0450(卷期以原文为准)
- MVP 官方数据快照:https://www.mvp.va.gov/pwa/discover-mvp-data
- VA CSP MVP 研究页:https://www.vacsp.research.va.gov/CSPEC/Studies/INVESTD-R/Million-Veteran-Program.asp
- dbGaP phs001672:https://www.ncbi.nlm.nih.gov/projects/gap/cgi-bin/study.cgi?study_id=phs001672.v14.p1
- VA News:百万里程碑 https://news.va.gov/148171/make-history-with-vas-million-veteran-program
- VA News:Science 全表型 GWAS https://news.va.gov/133297/new-mvp-study-highlights-value-of-diversity-in-clinical-research-leads-to-new-genetic-discoveries
- Military.com 深度报道(2025-11):https://www.military.com/feature/2025/11/21/inside-million-veteran-programs-growth-and-what-it-means-va-healthcare.html
- Argonne/ORNL 计算报道:https://www.anl.gov/article/genetic-breakthrough-over-500000-us-veterans-dna-mapped-in-trailblazing-precision-medicine-study
- VA Cleveland 研究通讯(2024-02,数据访问政策):https://content.govdelivery.com/accounts/USVHA/bulletins/388dd9d
- VA Providence / VA Long Beach 站点新闻稿(站点招募口径)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1 概览与版本时间轴 | 千方病案医学编辑部 | 对照 FACTS 清单逐条核对来源 URL | ✅ 已通过 |
| §2 医学背景与 ICD-11/SNOMED 映射 | 千方病案医学编辑部 | 编码表人工复核(高置信编码收录,存疑项已剔除) | ✅ 已通过 |
| §3-§5 数据规格与划分策略 | 医疗 AI 数据工程师 | 依据 dbGaP/论文口径核对结构与数字 | ✅ 已通过 |
| §6 AI 就绪指南与 8 坑点 | 医疗 AI 数据工程师 | 代码逻辑走查 + 坑点与文献证据一一对应 | ✅ 已验证 |
| §7 DAIMS 24 项与偏倚分析 | 医疗 AI 数据工程师 | 逐项对照数据集可得性评定 | ✅ 已通过 |
| §8-§9 生态与引用 | 千方病案医学编辑部 | BibTeX 与期刊卷期核对 | ✅ 已验证 |
§10.5 AI 生成章节标注
全页面由 AI 起草、人工审定后发布;其中 §6 代码示例与 §7.7 DAIMS 评分为 AI 依据公开文献整理的工程判断,已在 §10.4 完成人工复核。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- all-of-us-nih — 共享标签:电子健康记录 / 基因组学与多组学 / 肿瘤学 / 队列研究
- dbgap — 共享标签:电子健康记录 / 基因组学与多组学 / 临床电子病历 / 队列研究
- metabric — 共享标签:电子健康记录 / 基因组学与多组学 / 肿瘤学 / 队列研究
- geisinger-mycode — 共享标签:电子健康记录 / 基因组学与多组学 / 临床电子病历 / 队列研究
- topmed — 共享标签:基因组学与多组学 / 肿瘤学 / 队列研究
- flatiron-health — 共享标签:电子健康记录 / 临床电子病历 / 肿瘤学
- uk-biobank — 共享标签:电子健康记录 / 基因组学与多组学 / 队列研究
- finngen — 共享标签:电子健康记录 / 基因组学与多组学 / 队列研究
- biobank-japan — 共享标签:电子健康记录 / 基因组学与多组学 / 队列研究
- outcomerea — 共享标签:电子健康记录 / 临床电子病历 / 队列研究
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
