MyCode — 美国最大 EHR-基因组配对队列 AI-Ready Wikipedia

35 万人 EHR×外显子测序配对队列,美国最大健康系统生物样本库

来源 Geisinger Health System(与 Regeneron Genetics Center 合作测序) url: https://www.geisinger.edu/gchs/research/mycode发布时间: 2026-09-18最后更新: 2026-09-25 阅读 27
MyCode — 美国最大 EHR-基因组配对队列 AI-Ready Wikipedia

信息速览

数据集名称MyCode — 美国最大 EHR-基因组配对队列 AI-Ready Wikipedia
数据类型350,000+ 名参与者,233,185 例外显子测序,中位 14 年纵向 EHR,81 基因返现面板,控制访问(DUA)
规模350,000+ 名参与者
接入方式Geisinger Health System(与 Regeneron Genetics Center 合作测序) url: https://www.geisinger.edu/gchs/research/mycode
AI 就绪度

MyCode — 美国最大 EHR-基因组配对队列 AI-Ready Wikipedia

INFOBOX

数据集名称 MyCode Community Health Initiative
英文全称 MyCode Community Health Initiative(测序子队列合作项目名:DiscovEHR Collaboration)
别名/简称 MyCode、MyCode® biorepository、DiscovEHR
疾病分类 泛疾病队列;返现聚焦 35+ 可行动病况(ICD-11:5C80.0 家族性高胆固醇血症 / 2C60 乳腺恶性肿瘤 / 结直肠癌与心肌病等,详见 §2.1)
SNOMED CT EHR 诊断经 SNOMED CT 临床发现概念映射(代表概念:Familial hypercholesterolaemia、Malignant tumour of breast、Lynch syndrome 等,详见 §2.1b)
数据模态 基因组(全外显子测序)+ 结构化 EHR(诊断/用药/检验)+ 非结构化临床文本 + 返现结果记录
AI 任务类型 变异-表型关联、LoF 编目与药物靶点验证、表型算法/PheWAS、多基因风险评分(PRS)、罕见病基因发现、返现优先级排序
样本总数 350,000+ 名同意参与者 / 233,185 例外显子测序配对 EHR(截至 2025-01 报道)/ 近 230,000 人测序-健康数据配对可用(截至 2024-09)
数据大小 个人级数据无公开整库打包(控制访问分发);规模随队列滚动增长
数据格式 VCF/gVCF(外显子 callset)、关系型 EHR 表(人口学/ICD-10 诊断/用药/检验/临床文本)、论文附属汇总统计
许可证 Controlled Access — DiscovEHR Data Use Agreement(无公开开源许可)
访问级别 申请审核(研究合作协议 + IRB/伦理审批 + DUA;合作制数据共享)
DUO 标签 HMB, NCU, IRB
语言 英文
首发日期 2007-01(MyCode 生物样本库启动)/ 2016-12(DiscovEHR Science 论文)
最后更新 滚动更新(2024-09-03 官方宣布 350,000 参与者里程碑)
发布机构 Geisinger Health System × Regeneron Genetics Center
官方主页 https://www.geisinger.edu/gchs/research/mycode
下载地址 无公开下载入口(个人级数据经 DUA 控制访问分发;申请入口见官方主页)
DOI 10.1126/science.aaf6814(DiscovEHR 核心论文)/ 10.1038/gim.2015.187(MyCode 定义性论文)
AI 就绪度评分 ⭐⭐⭐(3/5)— 汇总统计与论文附属表可直接使用,个人级数据结构清晰;扣分项:需协议获取与格式转换、无官方划分、EHR 表型噪声大
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(遗传性心血管疾病与遗传性肿瘤综合征的 ICD-11/SNOMED CT 映射)、§7 偏倚分析(健康系统选择偏倚与祖先多样性不足)。

数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典(外显子 callset 与 EHR 链接表)、§5 数据划分策略、§6 预处理 Pipeline(VCF 质控与表型提取)和坑点。

审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。MyCode/DiscovEHR 个人级数据须经 Geisinger 科研合作渠道签署数据使用协议(DUA)并通过 IRB/伦理审批后方可获取,返现相关结果仅供队列研究语境解读。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

这是什么? MyCode 是宾夕法尼亚州健康系统 Geisinger 发起的全系统生物样本库计划:就诊患者在常规抽血时多捐一管血,同意后样本与本人全部电子健康记录(EHR)长期绑定。自 2014 年起,Geisinger 与 Regeneron Genetics Center 合作(合作项目名 DiscovEHR)对样本做全外显子测序,截至 2024-09 已入组 350,000+ 人,其中 233,185 人完成测序并与纵向 EHR 配对,是美国规模最大的医疗系统级基因组-健康数据配对队列。

为什么重要? 它证明了「基因组优先」路线在真实医疗系统中的可行性:约 3-5% 的参与者携带可行动遗传病风险变异,87% 的携带者事先毫不知情;超过 5,000 人因此获得了遗传咨询与预防干预机会。对研究而言,约 420 万罕见变异中约 17.6 万个功能缺失(LoF)变异与十几年的真实诊疗记录配对,构成了药物靶点验证与疾病基因发现的核心资源。

我能用它做什么? 在合规获取个人级数据后,你可以训练表型算法、做变异-表型关联(PheWAS)、验证药物靶点的人类遗传学证据、校准多基因风险评分;无需个人级数据时,论文附属汇总统计与 DiscovEHR 公开摘要也可支撑方法开发与复现研究。

§1.1 技术摘要

MyCode 于 2007 年以 opt-in 生物样本库形式启动,采用宽同意(broad consent)并支持再接触与返现。2014 年与 Regeneron Genetics Center 建立合作关系后开始规模化全外显子测序与基因分型;Geisinger 保留数据在临床使用的完整权利,Regeneron 仅获得完全去标识化的副本用于靶点研究。技术路径为:常规临床采血 → 唯一研究 ID 编号 → RGC 外显子测序 → 变异注释与联合分型 → 与纵向 EHR(中位 14 年,含 ICD 编码、检验、用药、临床文本与影像记录)链接 → 可行动变异经 CLIA 认证实验室确认后由 GSC 项目返现并写入 EHR。三个关键规模节点:2016 年 50,726 例(Science)、2020 年前后约 145,000 例(综述)、2025-01 报道的 233,185 例;2024-09 同意者总数达 350,000+。

§1.2 战略价值

价值一:健康系统内闭环的「基因组优先」范式。与「患者按表型就诊后送检」的传统路径相反,MyCode 先测序、后用 EHR 与返现验证临床意义。这使它同时具备发现端(未选择人群中的罕见变异谱)与验证端(返现后前瞻随访的结局数据)双重能力。FH 患病率、遗传性乳腺癌卵巢癌综合征患病率、心律失常性心肌病患病率等一系列以未选择人群为分母的经典估计均出自该队列,直接改写了多个疾病的筛查策略讨论。

价值二:药物靶点人类遗传学验证的标杆。DiscovEHR 早期工作即在 50,726 例规模上系统编目 LoF 变异并验证脂质药物靶点(如 PCSK9、ANGPTL4 家族信号通路),确立了「测序+EHR 配对 = 靶点因果证据」的方法学模板,此后被 Regeneron 复制到其他大规模合作队列。对 AI 研究者,这提供了稀缺的「真实世界结局 + 高通量测序」训练场:表型算法、时间到事件建模与因果推断方法都能在十几年的纵向记录上展开。

§1.3 同类数据集横向对比

数据集 规模 基因组模态 表型数据 访问方式 与 MyCode 的差异
MyCode/DiscovEHR 350,000+ 同意 / 233,185 例外显子 全外显子测序 + 基因分型 中位 14 年纵向 EHR + 返现结果 控制访问(协议/合作制) 唯一以健康系统返现闭环为核心的队列
UK Biobank 约 500,000 人 基因分型 + 全外显子测序(454,787 例) 深度基线表型 + 记录链接 申请制(学术开放度高) 表型广度更深;返现与健康系统临床整合弱于 MyCode
All of Us 245,388 例 WGS(2024-02 发布) 全基因组测序(临床级) 调查 + EHR + 可穿戴 云平台 Researchers Workbench(护照模式) 多样性显著更强(77% 代表性不足社区);EHR 深度与返现成熟度仍在追赶
BioVU(Vanderbilt) 数十万级 DNA 样本库 + 基因分型 纵向 EHR(Synthetic Derivative) 申请制 以基因分型为主,测序覆盖远小于 DiscovEHR
MVP(Million Veteran Program) 90 万+ 同意 基因分型 + 测序扩展中 纵向 EHR + 问卷 申请制 退伍军人人群;多样性介于 MyCode 与 All of Us 之间

§1.4 版本与规模时间轴

MyCode 为滚动更新队列,无离散版本号;以下为可核查的规模节点:

时间 节点 规模/事件 来源
2007-01 生物样本库启动 opt-in 宽同意,样本链接 EHR NHGRI GM14 手册
2014 DiscovEHR 合作启动 与 Regeneron Genetics Center 开始外显子测序与基因分型 NHGRI GM14 手册
2015 返现同意启动 GSC 返现流程经社区咨询后建立 综述(PMC7461766)
2016-12 Science 首篇旗舰论文 50,726 例外显子测序完成分析 Dewey et al., Science
约 2017-2019 快速扩容 92,805 例(Hum Mutat 报道时点)→ 约 145,000 例 PMC6744296 / PMC7461766
2024-09-03 入组里程碑 350,000 同意者;近 230,000 配对;5,000+ 人收到返现结果 Geisinger 官方新闻稿
2025-01 测序配对总量报道 DiscovEHR 累计 233,185 例外显子测序配对纵向 EHR NCI DCEG 期刊俱乐部

§1.5 典型应用场景

  1. 可行动变异患病率估计:以未选择人群为分母估计 FH、HBOC、Lynch 综合征、心肌病等患病率,为人群筛查政策提供证据。
  2. 药物靶点人类遗传学验证:用 LoF 携带者的 EHR 结局验证或排除靶点因果性(如脂质通路),指导管线优先级。
  3. EHR 表型算法开发:基于 ICD 编码、检验与临床文本训练表型提取与判别算法,再用测序金标准校验。
  4. 多基因风险评分校准:在社区医疗语境评估 PRS 的增量预测价值与公平性(需正视欧洲裔占比过高)。
  5. 返现流程运营研究:基因组优先返现的接受率、咨询负荷、临床后果与卫生经济学建模。

§2 医学背景

MyCode 不是面向单一疾病的影像或波形数据集,而是一个「人群级基因组 + 纵向 EHR」的配对队列。其医学背景围绕 GSC 面板覆盖的 35+ 种可遗传健康状况展开。本章将 MyCode 覆盖的核心疾病锚定到国际分类体系,供表型算法与下游建模对齐使用。

§2.1 ICD-11 疾病分类锚定

MyCode GSC 面板筛查的疾病大多没有唯一 ICD-11 编码一一对应关系;下表仅列出与 EHR 表型提取最常锚定的核心类别。使用时应注意:EHR 中的 ICD-10-CM 原始编码需经映射表转入 ICD-11,映射过程存在多对一损耗。

疾病/状况 ICD-11 编码 ICD-11 标题(英文) 在 MyCode 中的角色
家族性高胆固醇血症 5C80.0 Familial hypercholesterolaemia GSC 心血管筛查核心;截至 2024-09 返回 FH 结果 590 例
乳腺恶性肿瘤 2C60 Malignant tumour of breast HBOC(BRCA1/2)相关癌症锚点
结直肠癌 2B91(恶性结肠肿瘤类目) Malignant neoplasm of colon Lynch 综合征相关癌症锚点(编码细节随映射表版本变化)
心肌病 BC43(心肌病类目) Cardiomyopathy 肥厚型/扩张型心肌病基因(如 MYH7、LMNA)携带者表型锚点
心律失常 BC80-BC9F(心律失常区块) Cardiac arrhythmias 离子通道病与传导异常基因携带者锚点
家族性转甲状腺素蛋白淀粉样变 5D00(系统性淀粉样变类目下) Systemic amyloidosis hATTR 结果返回 163 例(截至 2024-09-01)

注意:表中括注的类目级别编码用于说明归属区块,实际研究应使用 ICD-10-CM → ICD-11 的官方映射工具(WHO ICD API)逐码转换,不可直接抄录类目码作为病历编码。

§2.2 SNOMED CT 映射

Geisinger EHR 基于 Epic 系统,诊断与发现条目以 SNOMED CT 与本地编码混合存储。MyCode 相关返现结果写入 EHR 时使用的主要 SNOMED CT 概念(仅列概念英文名,具体数字码以 Geisinger 本地术语服务为准,本条目不编码以免误导):

  • Familial hypercholesterolaemia(家族性高胆固醇血症)——LDLR、APOB、PCSK9 等 3 个 FH 基因的有害变异携带状态;
  • Malignant tumour of breast(乳腺恶性肿瘤)——BRCA1/2 携带者的风险管理锚点;
  • Lynch syndrome(Lynch 综合征)——MMR 基因(MLH1、MSH2、MSH6、PMS2)相关;
  • Hypertrophic cardiomyopathy(肥厚型心肌病)与 Dilated cardiomyopathy(扩张型心肌病);
  • Long QT syndrome(长 QT 综合征)等离子通道病;
  • Familial transthyretin amyloidosis(家族性转甲状腺素蛋白淀粉样变)。

对 NLP 与表型算法开发者,SNOMED CT 概念映射的意义在于:同一携带状态在不同病历条目中可能以问题列表(Problem List)、诊断、家族史(Family history section)三种形式出现,家族史条目并不代表本人携带,是表型提取的经典混淆源。

§2.3 疾病简介

MyCode 返现与研究的核心疾病谱可以概括为「五类可行动状况」:

家族性高胆固醇血症(FH)。常染色体显性遗传的 LDL 代谢疾病,杂合子型人群患病率约 1/250。未治疗的 FH 携带者冠心病风险显著升高,而早期他汀治疗可大幅降低风险,这正是其被列为「可行动」返现结果的原因。截至 2024-09-01,MyCode 已返回 590 例 FH 相关结果;在人群筛查语境下,MyCode 研究显示绝大多数携带者在筛查前并不知晓自身状态(Tier 1 状况的 87% 不知晓率)。

遗传性乳腺癌卵巢癌综合征(HBOC)。由 BRCA1/2 等基因的致病性变异引起,携带者的乳腺、卵巢、胰腺等癌症终生风险显著升高。预防性筛查增强、预防性手术与靶向治疗(PARP 抑制剂)构成标准的风险管理路径。GSC 面板覆盖 BRCA1/2 并在返现流程中将其列为最高优先级结果之一。

Lynch 综合征。错配修复基因(MLH1、MSH2、MSH6、PMS2)变异导致的遗传性结直肠癌易感综合征,是最常见的遗传性结直肠癌病因。携带者需更早、更频繁的结肠镜监测,这一可干预性使其同样属于返现结果的核心类别。

遗传性心肌病与心律失常。包括肥厚型心肌病(MYH7、MYBPC3)、扩张型心肌病(LMNA、FLNC)、长 QT 综合征(KCNQ1、KCNH2)等离子通道病,以及家族性转甲状腺素蛋白淀粉样变(TTR)。截至 2024-09-01,MyCode 心血管相关返现结果共 2,256 例(心肌病 1,031、心律失常 375、hATTR 163 等),是返现结果中数量最大的板块。此类结果的可行动性体现在家族级联筛查、影像监测间隔调整与植入式设备决策。

神经发育与精神疾病风险变异。2022 年 MyCode 数据分析显示约 1/100 参与者携带与自闭症、癫痫、双相障碍、精神分裂症风险相关的变异。这类发现的临床可行动性弱于前四类,MyCode 对其采取更谨慎的披露策略,体现了返现边界管理的复杂性。

§2.4 临床任务定义

在「基因组 + EHR」数据形态下,MyCode 支撑的典型临床任务可形式化为:

  1. 携带状态发现(case finding):输入 = 纵向 EHR 特征(诊断码、检验值、用药、家族史文本);输出 = 携带未诊断的可行动变异概率。对标任务为「未确诊的 FH/HBOC/Lynch 患者识别」,在健康系统内等同于一个人群筛查模型。
  2. 变异-表型关联(genotype-phenotype association):以 LoF 携带者与匹配对照的 EHR 结局差异估计外显率与患病率。DiscovEHR 旗舰论文即以此框架估计 76 个可行动基因的携带率(约 3.5%)。
  3. 药物靶点验证(target validation):LoF 携带者表型作为「天然敲除实验」,验证或排除药物靶点的因果性,输出为靶点结局方向与安全性信号。
  4. PRSP 校准与公平性审计:在社区医疗队列上评估多基因风险评分的增量预测价值,并按祖先分组审计校准偏差。
  5. EHR 表型算法(Phecode/OMOP 型)开发:以测序结果为「金标准」,反推哪些 EHR 特征组合最能识别携带者。

§2.5 患者人群特征

维度 数值/描述 来源与口径
同意入组 350,000+ 名参与者(2024-09-03) Geisinger 官方新闻稿
测序配对 近 230,000 人 DNA 序列与健康数据配对;DiscovEHR 报道 233,185 例外显子测序 2024-09 新闻稿 / NCI DCEG 2025-01
邀请同意率 被邀患者中 85-90% 同意 NHGRI GM14 手册(2018-01 时点 180,000+ 同意)
EHR 纵深 参与者 EHR 中位数约 14 年 NHGRI GM14 手册
祖先构成 DiscovEHR 测序子集约 98% 欧洲裔、约 1% 非洲裔 DiscovEHR 公开介绍
地理来源 宾夕法尼亚州中部与东北部社区医疗人口 Geisinger 服务区
年龄跨度 成人为主(18 岁以上 opt-in);2014 年起部分项目扩展至儿科 官方项目描述

人群构成的含义是双向的:一方面,社区医疗(而非转诊中心)来源使队列更接近一般人群,患病率估计的分母更真实;另一方面,98% 欧洲裔的构成使罕见变异谱与 PRS 在其他人群中的外推能力受限,这是所有下游应用必须显式声明的边界条件。

§2.6 金标准/参考标准

MyCode 的「金标准」并非人工标注集,而是一套分级确认链:

  1. 研究级注释:Regeneron Genetics Center 测序管线产出的变异注释(预测功能缺失、ClinVar/HGMD 对齐),用于研究分析;
  2. 临床确认级(CLIA):拟返现的结果必须经认证(CLIA)实验室独立确认,方写入 EHR 并触发遗传咨询;
  3. 咨询级:遗传咨询师结合个人/家族史复核病历,确认参与者未知晓该结果后按「基因组优先」流程通知。

对算法开发者而言,可用的弱金标准是:GSC 返回且经 CLIA 确认的结果集合(5,000+ 例),以及 ACMG SF 定义的 56 个基因中「携带且已被临床知晓」与否的对照。注意任何以 ICD 编码为真值的评价都会继承 EHR 编码噪声,论文普遍建议以「确认携带 + 相应临床行动」双条件定义阳性。

§3 数据集规格

MyCode 为滚动增长的私有队列,没有类似 MIMIC 的冻结版本号。本章以「可核查的规模节点 + 访问通道」两个轴给出规格描述,并给出研究选型时的版本抉择矩阵。

§3.0 版本抉择矩阵

你的研究目标 建议对齐的规模节点 原因 注意事项
复现 DiscovEHR 旗舰论文(Dewey 2016) 50,726 例外显子(2016-12) 与论文口径一致 当时 76 基因清单,与现行 81 基因面板不同
药物靶点验证/外显率估计 92,805 例(约 2017-2019)或 145,000 例(2020 综述时点) 样本量与统计功效平衡 不同时点参与者的 EHR 纵深不同,需按入组时间分层
大规模 meta 分析合作 233,185 例(2025-01 报道) 当前最大公开报道口径 需通过合作制获取,逐条协议
返现流程/卫生服务研究 2024-09 节点(350,000 同意;5,000+ 结果返回) 返现运营数据在该时点最完整 结果返回数据健康系统内部为主
PRS/多基因应用 任意时点均可,但必须报祖先构成 98% 欧洲裔限制外推 建议与 All of Us 做多样性对照

访问通道抉择:个人级测序数据目前没有公开下载渠道,学术利用主要有三条路径——(1) 与 Geisinger 建立正式数据合作(DUA/MTA);(2) 参与 Regeneron Genetics Center 为主导的联合分析;(3) 利用已发表汇总统计与 UK Biobank 复制子集(133,370 名欧洲血统 DiscovEHR 参与者参与过 UK Biobank 外显子论文的独立复制)。聚合级数据(论文附表、discovehrshare.com 时代的共享摘要)可直接引用。

§3.1 模态详细说明

模态 内容 形态 覆盖范围
基因组-测序 全外显子测序(WES)+ 全基因组基因分型阵列 VCF/TCG 类格式 + 注释表 近 230,000 人(截至 2025-01 报道)
EHR 诊断、检验、用药、病程记录、手术、护理条目 Epic Clarity 派生关系表 + 临床文本 中位约 14 年/人
返现结果 GSC 面板确认的可行动变异 + 咨询记录 结构化结果表 + EHR 写回条目 5,000+ 人(2024-09)
同意与人口学 宽同意(opt-in)、人口学、联系方式管理 同意数据库 350,000+ 人
样本生物库 血液/DNA 样本实物 -80 度生物样本库 全体同意者

EHR 部分的特殊价值在于 Geisinger 是高度整合的交付系统(保险+医疗一体化),患者生命周期内的就诊记录流失率低,这是「中位 14 年纵深」能够成立的结构性原因。

§3.2 样本量拆分

MyCode 的层级结构为「同意者 → 测序者 → 配对者 → 返现者」,各层级规模如下:

层级 规模 口径时点
同意捐样并链接 EHR 350,000+ 人 2024-09-03 新闻稿
完成外显子测序并与纵向 EHR 配对 233,185 例 2025-01 NCI DCEG 报道
收到可行动基因组风险结果 5,000+ 人 2024-09-03 新闻稿
GSC 心血管相关结果返回 2,256 例(心肌病 1,031 / FH 590 / 心律失常 375 / hATTR 163) 2024-09-01(IntechOpen 综述)
旗舰论文分析子集 50,726 例(2016)→ 92,805 例(Hum Mutat)→ 145,000 例(2020 综述) 各论文时点
UKB 复制贡献子集 133,370 名欧洲血统参与者 UK Biobank 外显子论文(Nature 2021)

§3.3 数据格式详情

  • 测序数据:WES 产出以标准 VCF/BAM 为主,研究合作中通常交付按队列注释后的变异级表格(gene、variant、carrier flag、quality metrics),而非原始 FASTQ;
  • 基因分型数据:全基因组 SNP 阵列的 PLINK 二进制格式(.bed/.bim/.fam)常见于联合分析协议;
  • EHR 结构化数据:Geisinger 内部为 Epic Clarity 派生表;对外合作通常映射为 OMOP CDM 或 i2b2/star schema 形式交付,含 visit_occurrence、condition_occurrence、measurement、drug_exposure 等标准表;
  • 临床文本:Epic 便签/出院摘要以去标识化文本交付,用于 NLP 任务;
  • 返现数据:GSC 结果与咨询接触记录为独立治理域,通常不进入研究交付物,仅以聚合形式使用。

§3.4 存储大小

MyCode 未公开总存储量。可做工程量级估计:233,185 例 WES 按 BAM 约 15-30 GB/人、VCF 约 1-2 GB/人计,原始比对与变异库为 PB 级;EHR 部分与同类 35 万人级健康系统仓库相当(数百 TB 级)。该估计仅为量级参考,实际数字以 Geisinger 官方披露为准。

§3.5 标注方式

MyCode 的「标注」本质上不是人工图像标注,而是三级注释体系:

  1. 变异功能注释:测序管线自动产出(预测 LoF、有害性评分、人群频率过滤),旗舰论文报告 420 万罕见变异中约 176,000 个预测功能缺失;
  2. 临床可行动性注释:以 2016 年时点的 76 个基因(56 个 ACMG 定义 + 20 个 Geisinger 追加)为基准,现行 GSC 面板扩展为 81 个基因、35+ 种健康状况;
  3. 临床确认注释:CLIA 实验室复核 + 遗传咨询师病历审查,产出「是否知晓、是否返现、咨询结局」的运营标签。

§3.6 标注者资质

  • 测序与变异注释:Regeneron Genetics Center 专业团队(商业化基因组学机构);
  • 临床确认:持有 CLIA 认证的分子遗传学实验室持证人员;
  • 结果披露:Geisinger 遗传咨询师团队(认证遗传咨询师)+ 参与者的初级保健医生;
  • 治理与伦理监督:Geisinger IRB、MyCode Governing Board、参与者/青年/临床医生顾问委员会及外部伦理与科学顾问委员会。

§3.7 数据采集时间范围

样本库启动于 2007 年 1 月;DiscovEHR 测序自 2014 年开始;返现同意自 2015 年启动;数据采集为滚动式持续更新(350,000 节点为 2024-09)。EHR 时间范围早于入组(回顾性条目),因此单人记录可跨越 2000 年代初至今。需要注意 2007-2014 年间仅有样本库与基因分型而无外显子测序,2014 年前的队列分析应以基因分型口径为准。

§3.8 地理覆盖

Geisinger Health System 总部位于宾夕法尼亚州 Danville,服务宾州中部与东北部的社区医疗人口(农业与工业小镇为主),并在近年扩展至周边州。这一「单一整合交付系统、农村与小镇人口为骨架」的地理特征,使 MyCode 在美国队列中独树一帜:患者留存率高(不易迁出系统)、家族多代聚集(利于家系分析),但与都市学术医疗中心人群差异明显。

§3.9 采集设备规格

  • 生物样本采集:标准外周血采血管(DNA 提取后 -80 度保存);
  • 测序平台:Regeneron Genetics Center 的高通量外显子测序管线(Illumina 测序仪家族为主流载体;具体试剂版本随批次演进,合作协议中提供批次元数据);
  • 基因分型:全基因组 SNP 阵列(版本随批次演进);
  • EHR 源系统:Epic(Clarity 数据仓库),检验数据对接实验室信息系统。

§3.10 深度溯源链

完整的端到端溯源链如下:

参与者 opt-in 宽同意(2007 起,MyCode 生物样本库)
        │  血样采集 + 同意链接 EHR
        ▼
DNA 提取与生物样本库保存
        │  2014 起 DiscovEHR 合作
        ▼
Regeneron Genetics Center WES + 基因分型
        │  变异注释(LoF 预测/ClinVar 对齐)
        ▼
研究级分析(queue 逐批发布:50,726 → 92,805 → 145,000 → 233,185)
        │  GSC 面板命中(2015 起返现同意)
        ▼
CLIA 认证实验室临床确认
        │  复核病历确认未知晓
        ▼
结果写入 EHR + 通知初级保健医生
        │  遗传咨询师免费咨询(基因组优先流程)
        ▼
参与者知情 + 家族群级联筛查(研究数据持续再分析)

每个环节都有独立的治理记录:同意版本、测序批次、CLIA 报告编号、咨询接触日志,这使 MyCode 具备临床级数据的完整审计能力,也是其与纯研究生物样本库的本质区别。

§4 数据结构详解

MyCode 对外交付没有统一的「官方目录树」,实际结构取决于合作协议。本章给出一个在合作研究中最常见的交付布局与字段字典,供读者与数据管理方沟通时对照。

§4.0 目录结构预览

geisinger-mycode/
├── consent/
│   ├── consent_versions.csv            # 同意版本与签署时间(350,000+ 行)
│   └── enrollment_wave.csv             # 入组波次(2007- 至今滚动)
├── genomics/
│   ├── exome/
│   │   ├── variants/                   # 变异级 VCF/注释表(按染色体分片)
│   │   ├── qc_metrics.csv              # 测序质量指标(覆盖率、样本污染度)
│   │   └── carrier_flags.csv           # 关键基因携带者标记(研究级)
│   ├── genotyping/
│   │   ├── bed/bim/fam                 # PLINK 二进制基因分型
│   │   └── ancestry_pcs.csv            # 祖先主成分(PC1-PC10)
│   └── annotation/
│       ├── clinvar_alignment.csv       # ClinVar 对齐注释
│       └── lof_predictions.csv         # LoF 预测(约 176,000 个,旗舰论文口径)
├── ehr/
│   ├── person.csv                      # 患者主索引(OMOP 风格)
│   ├── visit_occurrence.csv            # 就诊事件
│   ├── condition_occurrence.csv        # 诊断(ICD-10-CM/SNOMED)
│   ├── measurement.csv                 # 检验结果(LDL-C、肌钙蛋白等)
│   ├── drug_exposure.csv               # 用药(他汀、化疗等)
│   ├── procedure_occurrence.csv        # 手术与操作
│   └── notes_deid/                     # 去标识化临床文本(NLP 用)
├── gsc_return/
│   ├── returned_results_aggregate.csv  # 返现结果聚合表(2,256 心血管例等)
│   └── counseling_summary.csv          # 咨询接触汇总(治理域,受限)
└── docs/
    ├── data_dictionary.html            # OMOP 映射说明
    ├── dua_template.pdf                # 数据使用协议模板
    └── provenance_manifest.json        # 批次与版本溯源清单

注意:以上树形结构为描述性示意,字段命名以实际 DUA 交付为准;gsc_return/ 下的个人级数据通常不在研究交付范围内。

§4.1 DAIMS 标准化字段描述表

字段 层级 类型 说明 缺失处理 AI 用途 示例值 敏感性
participant_id 患者 string 去标识参与者主键(合作协议内置换) 无缺失 分组键 P-0048213 高
consent_version 患者 string 同意版本号(决定数据可用范围) 无缺失 滤网 v3.1-2015-return 高
enrollment_wave 患者 int 入组波次(年) 无缺失 分层特征 2014 中
exome_done 患者 bool 是否完成外显子测序 无缺失 队列限定 true 中
ancestry_pc1-10 患者 float 祖先主成分 部分缺失 混淆校正 0.012 中
sex_at_birth 患者 category 生物学性别 少量缺失 分层分析 F 高
birth_year_decade 患者 int 出生年代(模糊化) 无缺失 年龄调整 1950 高
gene 变异 string HGNC 基因符号 无缺失 目标变量 LDLR 高
variant 变异 string HGVS 核酸/蛋白命名 无缺失 特征 c.631C>T 高
zygosity 变异 category 杂合/纯合 无缺失 剂量效应 het 低
lof_flag 变异 bool 预测功能缺失 无缺失 靶点分析 true 低
gnomad_af 变异 float 人群频率 罕见变异多为 0 过滤 0.00002 低
visit_date EHR 事件 date 就诊日期(相对或模糊化) 无缺失 时序建模 2015-06 高
condition_code EHR 事件 string ICD-10-CM/SNOMED 编码 可空 表型算法 E78.01 高
measurement_id EHR 事件 string 检验条目 可空 特征 LDL-C 低
value_as_number EHR 事件 float 检验数值 信息性缺失 特征 245.0 低
drug_exposure EHR 事件 string 药物(RxNorm) 可空 处理变量 atorvastatin 低
note_text EHR 文本 text 去标识临床便签 可空 NLP — 极高
gsc_gene 返现 string GSC 面板基因 仅返现者 阳性金标准 BRCA1 极高
clia_confirmed 返现 bool 是否 CLIA 确认 仅返现者 质量门 true 极高
known_before_screen 返现 bool 筛查前是否知晓 仅返现者 case-finding 标签 false 极高
return_date 返现 date 结果返回日期 仅返现者 流程分析 2018-03 极高

§4.2 标签分布统计

以「返现结果」作为最高置信标签时,已知分布(截至 2024-09-01):

类别 数量 占心血管结果比例
心肌病相关基因 1,031 45.7%
家族性高胆固醇血症(FH) 590 26.2%
心律失常/离子通道病 375 16.6%
hATTR(TTR) 163 7.2%
其他心血管 97 4.3%
心血管合计 2,256 100%

整个 GSC 面板(81 基因、35+ 状况)的返现总量为 5,000+ 人;以全队列 233,185 名测序参与者为分母,返现结果粗渗透率约 2.1%。旗舰论文口径的可行动变异携带率约 3.5%(76 基因、2016 时点),两者差异反映「携带」与「完成返现」之间的运营漏斗。

§4.3 关键字段描述性统计

  • 罕见变异总量:50,726 例外显子中约 420 万罕见 SNV/indel,其中约 176,000 个预测功能缺失(Dewey 2016);
  • 可行动携带率:约 3.5% 个体携带 76 个临床可行动基因的有害变异(2016 口径);官方现口径约 3-5% 参与者携带被筛查遗传病基因的高风险变异;
  • 神经精神风险:约 1/100 参与者携带与自闭症、癫痫、双相障碍、精神分裂症风险相关的变异(2022 分析);
  • 不知晓率:Tier 1 携带者中 87% 在人群筛查前不知晓自身变异状态(心血管返现分析);
  • EHR 纵深:中位约 14 年;
  • 同意率:被邀患者 85-90% 同意。

§4.4 数据层级关系

MyCode 的实体关系为四级结构:

person (participant_id)
 ├── consent (1 : N) 同意版本历史
 ├── genomics (1 : 0..N) 测序批次 → 变异 (N)
 │      └── variant (gene, variant, zygosity)
 └── ehr_events (1 : N)
        ├── visit_occurrence → condition / measurement / drug / procedure
        └── notes (1 : N) 临床文本
gsc_return (person : gene 多对多) —— 治理上独立,经审核后可链接

关键约束:变异表与 EHR 事件表通过 participant_id 关联而非就诊 ID——携带状态是患者级属性,建模时应避免把变异特征错误挂到单个就诊上造成时间泄漏(见 §5.3)。

§4.5 缺失值情况与信息性缺失编码

  • 检验缺失是信息性的:LDL-C 等指标「未测」与患者健康状态相关(病情越重检测越频繁),直接均值填充会引入偏倚,建议以「是否检测」指示变量 + 缺失类别建模;
  • 基因分型 vs 测序的双轨差异:2014 年前的参与者仅有基因分型数据,外显子覆盖缺失是结构性的,不可当作随机缺失;
  • 家族史字段稀疏:EHR 家族史条目以自由文本为主且完整率低,NLP 提取后仍需人工抽检;
  • 返现域数据不可见:未获 GSC 授权的合作研究只有聚合返现数据,构建 case-finding 标签时须明确「研究级携带注释」与「CLIA 确认」的置信级差。

§5 数据划分与使用建议

§5.1 官方数据划分

MyCode 没有「训练/验证/测试集」意义上的官方划分——它是一个持续增长的研究队列而非基准数据集。学术合作中获得的数据快照(如 DiscovEHR 某批次)即为该协议下的全量。论文实践中常见做法:按测序批次划分、按家系划分(防止家族成员跨集)、按时间划分(训练早于测试入组)。

§5.2 推荐划分策略

针对 MyCode 数据形态,推荐「家系感知 + 时间前向」双约束划分:

  1. 家系感知:宾州服务区多代同住家庭比例高,若同一家族成员分属训练/测试集,模型实际记住了家族单倍型而非特征-结局关系。建议以家族 ID(可由基因分型推断的 IBD 关系构建)为单位整组划分;
  2. 时间前向:以 enrollment_wave(入组年份)为轴,早期波次训练、后期波次测试,模拟真实部署场景;
  3. 祖先分层:因 98% 欧洲裔,非欧洲裔样本太少无法独立成集,建议报告分层性能置信区间而非强行分层划分。

§5.3 数据泄漏风险防御

MyCode 特有的三类泄漏源:

  • 返现流程泄漏:结果写入 EHR 后,后续就诊记录会出现遗传咨询、增强筛查、预防性手术条目。若任务定义是「预测未知晓携带者」,必须将 return_date 之后的 EHR 条目视为测试时不可见;
  • 治疗启动泄漏:FH 携带者被返现后立即启动高强度他汀,此时 LDL-C 轨迹已被治疗改变。结局建模需区分「返现前自然史」与「返现后管理期」;
  • 家族级联泄漏:先证者返现触发家族成员检测,家族成员的 EHR 随后出现主动筛查痕迹,家系感知划分必须与此联动。

§5.4 交叉验证建议

稀有事件(如单个基因携带者)场景建议 5 折分层 CV,但分层键应为「基因 × 返现状态」复合标签,保证每折都覆盖主要 GSC 类别;对 LoF 靶点验证类分析,更稳妥的是 bootstrap 重采样(携带者样本量小时 CV 折间方差过大)。报告置信区间时应采用对家系聚类稳健的方差估计(cluster-robust SE)。

§5.5 外部验证

在 MyCode 上训练的模型建议按以下优先级做外部验证:(1) UK Biobank(欧洲裔为主、有外显子数据,人口结构最接近);(2) All of Us(检验多样性与校准漂移);(3) BioVU/MVP(EHR 链接队列);(4) 本地健康系统数据(部署前最终检验)。任何跨库验证都需重校准变异注释版本与 EHR 编码体系(ICD-10-CM vs ICD-10)。

§6 AI 就绪指南

本章假设你已通过合作获得 MyCode 快照数据(个人级数据无法公开下载,获取路径见 §6.2),目标是把「WES 变异 + 纵向 EHR」转成可训练的 AI 就绪数据结构。

§6.0 云端快速启动

个人级 MyCode 数据不允许下载到个人笔记本,实践中推荐以下环境:

环境 适用场景 说明
Geisinger 安全分析环境 全队列 EHR + 基因组联合分析 数据不出域,远程桌面/虚拟分析区
合作机构托管云计算(GCP/Azure HIPAA 环境) 大规模联合分析 需 DUA 明确允许云托管与区域
Terra/Seven Bridges 类平台 与 AnVIL 生态整合的队列分析 适合 WDL/Cromwell 工作流
dbGaP 型控制访问镜像(若合作方已存档) 二次分析 按项目号申请,phs 前缀访问

快速验证数据可用的最小脚本(在授权分析环境内):

# 最小可用性检查:行数、字段、时间范围
python3 - <<'EOF'
import pandas as pd
p = pd.read_csv("ehr/person.csv", nrows=5)
print(p.columns.tolist())
n = sum(1 for _ in open("ehr/person.csv")) - 1
print(f"participants: {n}")
EOF

§6.1 快速上手(本地分析环境)

授权环境内完成 QC 与携带者统计的标准路径:

# 1. 基因分型数据 QC(PLINK 2)
plink2 --bfile genotyping/mycode_all \
       --mind 0.02 --geno 0.02 --maf 0.001 \
       --make-bed --out genotyping/mycode_qc

# 2. 祖先推断(PCA)
plink2 --bfile genotyping/mycode_qc --pca 10 --out genotyping/ancestry_pcs

# 3. 携带者快速统计(GSC 面板基因)
plink2 --bfile genotyping/mycode_qc \
       --extract annotation/gsc_panel_snps.txt \
       --make-pheno2 carrier_flags.csv participant_id \
       --freq --out genotyping/gsc_carrier_freq

外显子变异规模化操作建议用 Hail(Spark):

import hail as hl
mt = hl.read_matrix_table("genomics/exome/mycode.mt")
# 过滤低质量变异 + 罕见变异层
mt = mt.filter_rows(mt.info.AF < 0.001, keep=True)
mt = mt.filter_rows(hl.len(mt.alleles) == 2)
# GSC 面板基因携带者表
panel = hl.import_table("annotation/gsc_panel_genes.txt").key_by("gene")
mt = mt.annotate_rows(in_panel=panel[mt.gene_symbol] != hl.missing(panel.dtype))
carriers = mt.filter_rows(mt.in_panel).entries().select("s", "gene_symbol", "lof_flag")
carriers.export("genomics/gsc_carriers.tsv")

§6.2 数据获取流程

MyCode 不走公开申请门户,典型流程为:

  1. 研究计划接触:通过 Geisinger 官方研究合作渠道提交研究计划(官方主页见文末链接);
  2. 科学审查:由 Geisinger 研究团队与治理委员会审查科学价值与隐私风险;
  3. 协议签署:签署 DUA/MTA,明确数据范围、存储位置、再标识禁令、发表审查条款;
  4. IRB 备案:合作方 IRB 备案 + Geisinger IRB 依赖审查;
  5. 数据交付:快照形式交付(OMOP 映射 EHR + 注释后变异表),或入驻安全分析环境;
  6. 周期与成本:协议制获取通常以月计(协商-审查-签署),预算应包含数据托管与人工服务费;
  7. 再分析义务:未发现者样本会被反复再分析(GSC 官方流程声明),研究协议需接受这一动态性。

与 UK Biobank(注册-申请-约 1 个月)或 All of Us(护照模式、注册到获取中位 29 小时)相比,MyCode 的获取摩擦显著更高——这是「深度临床整合」的对价,计划研究周期时应预留缓冲。

§6.3 预处理 Pipeline

从原始交付物到 AI 就绪特征的完整管线:

# pipeline.py — MyCode 快照 → AI-ready cohort
from pathlib import Path
import pandas as pd

DATA = Path(".")

def build_person_table() -> pd.DataFrame:
    """患者级基础表:人口学 + 祖先 + 入组波次"""
    person = pd.read_csv(DATA / "ehr/person.csv")
    pcs = pd.read_csv(DATA / "genomics/ancestry_pcs.csv")
    wave = pd.read_csv(DATA / "consent/enrollment_wave.csv")
    df = person.merge(pcs, on="participant_id").merge(wave, on="participant_id")
    return df

def build_carrier_labels() -> pd.DataFrame:
    """GSC 面板携带者宽表:一人一行 × 81 基因列"""
    carriers = pd.read_csv(DATA / "genomics/gsc_carriers.tsv", sep="\t")
    wide = (carriers
            .assign(hit=1)
            .pivot_table(index="s", columns="gene_symbol", values="hit",
                         aggfunc="first")
            .fillna(0)
            .astype("int8"))
    wide.columns = [f"carrier_{c}" for c in wide.columns]
    return wide.reset_index().rename(columns={"s": "participant_id"})

def build_ehr_sequences(max_visits: int = 128) -> pd.DataFrame:
    """就诊级时序特征:按人聚合成序列(供序列模型)"""
    cond = pd.read_csv(DATA / "ehr/condition_occurrence.csv",
                       usecols=["person_id", "visit_date", "condition_code"])
    meas = pd.read_csv(DATA / "ehr/measurement.csv",
                       usecols=["person_id", "visit_date", "measurement_id",
                                "value_as_number"])
    cond["code"] = "dx_" + cond["condition_code"].astype(str)
    meas["code"] = "lab_" + meas["measurement_id"].astype(str)
    events = pd.concat([cond[["person_id", "visit_date", "code"]],
                        meas.assign(code=meas["code"] + "_"
                                    + meas["value_as_number"].round(0).astype(int).astype(str))
                             [["person_id", "visit_date", "code"]]])
    events = events.sort_values(["person_id", "visit_date"])
    seq = events.groupby("person_id")["code"].apply(
        lambda s: list(s.tail(max_visits)))
    return seq.rename("event_seq").reset_index()

if __name__ == "__main__":
    build_person_table().merge(build_carrier_labels(), on="participant_id",
        how="left").to_parquet("features/person_core.parquet")
    build_ehr_sequences().to_parquet("features/ehr_sequences.parquet")

管线设计原则:变异特征一次构建宽表复用;EHR 序列按访问时间切片(预测时点前窗口),避免把未来条目卷入训练窗口。

§6.4 框架加载

# dataset.py — PyTorch 数据集:EHR 序列 + 携带者多标签
import torch
from torch.utils.data import Dataset
import pandas as pd
import pickle

class MyCodeEHRDataset(Dataset):
    """任务:由 EHR 序列预测 GSC 面板携带状态(多标签)"""

    def __init__(self, core_parquet: str, seq_parquet: str,
                 vocab_path: str, labels: list[str], seq_len: int = 128):
        self.core = pd.read_parquet(core_parquet)
        self.seq = pd.read_parquet(seq_parquet)
        self.df = self.core.merge(self.seq, on="participant_id")
        self.labels = labels
        self.seq_len = seq_len
        vocab = pickle.load(open(vocab_path, "rb"))
        self.stoi = {c: i + 1 for i, c in enumerate(vocab)}  # 0 = PAD

    def __len__(self):
        return len(self.df)

    def __getitem__(self, idx):
        row = self.df.iloc[idx]
        ids = [self.stoi.get(c, 0) for c in row["event_seq"]][: self.seq_len]
        ids += [0] * (self.seq_len - len(ids))
        x = torch.tensor(ids, dtype=torch.long)
        y = torch.tensor(
            [row.get(f"carrier_{g}", 0) for g in self.labels],
            dtype=torch.float)
        cov = torch.tensor(
            [row["ancestry_pc1"], row["ancestry_pc2"],
             row["enrollment_wave"]], dtype=torch.float)
        return x, cov, y

配套的轻量模型(BiLSTM 编码器 + 多标签头):

# model.py
import torch
import torch.nn as nn

class SeqMultiLabel(nn.Module):
    def __init__(self, vocab_size: int, n_cov: int = 3,
                 n_labels: int = 81, d: int = 128):
        super().__init__()
        self.emb = nn.Embedding(vocab_size + 1, d, padding_idx=0)
        self.enc = nn.LSTM(d, d, batch_first=True, bidirectional=True)
        self.head = nn.Sequential(
            nn.Linear(2 * d + n_cov, d), nn.ReLU(),
            nn.Linear(d, n_labels))

    def forward(self, x, cov):
        h, _ = self.enc(self.emb(x))
        mask = (x != 0).unsqueeze(-1)
        pooled = (h * mask).sum(1) / mask.sum(1).clamp(min=1)
        return self.head(torch.cat([pooled, cov], dim=1))

训练注意:81 个标签极度不平衡(多数基因携带率 <0.1%),损失用 BCEWithLogitsLoss(pos_weight=...) 逐标签设权,或改用 focal loss;评估以 PR-AUC 为主轴(见 §6.9)。

§6.5 常见坑点

坑点 1:祖先多样性不足导致模型外推失效

问题:DiscovEHR 测序子集约 98% 为欧洲裔(约 1% 非洲裔),变异谱、等位基因频率、PRS 权重与 EHR 编码习惯都嵌入了这一人群结构。

症状:在 MyCode 上 AUC 优秀的携带者筛查模型,放到 All of Us 或非欧洲裔本地人群上 PR-AUC 断崖式下跌;PRS 在非欧洲裔分组中校准斜率显著偏离 1;跨库验证时「性能下降」被误诊为编码差异 bug,根因实为祖先分布不同。

解决:

  1. 最低配置:所有模型报告必须附祖先分层性能(以 ancestry PCs 或自定义聚类分组),并明示分层样本量;
  2. 推荐配置:对非欧洲裔子样本做重校准(recalibration)或迁移学习,PRS 应用前查考 Polygenic Score Catalog 中是否已有对应人群的权重;
  3. 最优配置:与 All of Us(77% 代表性不足社区)做并行评估,把多样性差异作为研究结论的一部分而不是附录免责句。

参考:DiscovEHR 祖先构成公开介绍(icompbio.net);All of Us 基因组论文(Nature 2024,s41586-023-06957-x)。

坑点 2:EHR 表型噪声污染携带者-表型关联

问题:EHR 诊断码存在漏诊(携带者从未被诊断)与误诊(编码习惯差异),LoF 变异与疾病表型的关联分析直接用 ICD 码当真值会被稀释或扭曲。

症状:已知强关联(如 LDLR LoF 与 FH 诊断)在队列中只能观察到「半关联」——大量携带者没有对应 ICD 码;效应量显著小于文献值;不同科室患者亚群中关联强度系统性不同(编码密度差异)。

解决:

  1. 用 phecode/OMOP 映射替代裸 ICD 码,并采用「至少 2 次独立就诊记录」的确定性规则;
  2. 以测序金标准反向校验表型算法:在已知携带者上测量表型算法的灵敏度,未携带者上测量特异度,据此定义分析子集(high-confidence EHR phenotype);
  3. 对临床文本用 NLP 抽取家族史与「家族史 vs 本人诊断」的区分特征,避免把家族史条目算作本人患病。

参考:Dewey et al. 2016(Science,doi 10.1126/science.aaf6814)限制节对 EHR 表型噪声的讨论。

坑点 3:个人级数据不可公开下载导致复现受阻

问题:MyCode/DiscovEHR 数据访问级别为「Private」(合作/协议制),没有 dbGaP 式的自助申请通道,第三方无法直接复现基于个人级数据的研究。

症状:论文评审要求「提供代码与数据」时无法满足;复现者只能用 UK Biobank 近似复刻,结果方向一致但数字对不上,产生「论文不可信」的误判;依赖公开数据迭代方法的工作被迫放弃 MyCode 特有的返现闭环维度。

解决:

  1. 计划阶段就把 MyCode 定位为「验证队列」而非「开发队列」:方法先在公开数据(UKB/All of Us)上开发,再申请 MyCode 验证;
  2. 发表时主动提供汇总级结果(携带率表、效应估计、校准曲线数据点),使结果可被元分析与检查;
  3. 合作沟通提前量按 6-12 个月计,把协议协商纳入研究时间线而非视为前置手续。

参考:HMG 2018 综述对 DiscovEHR「Private」访问级别的记录(doi 10.1093/hmg/ddy114);discovehrshare.com 共享摘要存档。

坑点 4:返现漏斗与 CLIA/咨询带宽瓶颈

问题:从「研究级发现」到「参与者知情」要经过 CLIA 确认、病历复核、遗传咨询三道人工工序;5,000+ 例结果返回历时多年,返现不是即时事件。

症状:研究者把「研究级携带注释」当作「已返现」分析返现效果,发现效应被稀释(大量携带者尚未走完流程);卫生服务研究低估咨询负荷;用返现渗透率(约 2.1%)估计可行动率(约 3.5%)造成口径错配。

解决:

  1. 严格区分三个口径:研究级携带(自动注释)、CLIA 确认、完成咨询返现,所有统计显式声明口径;
  2. 时间到事件分析(time-to-return)建模返现延迟,把 2015 年返现同意启动作为时间零点;
  3. 与 Geisinger 运营团队核对该时点的在途(pending)数量,避免把带宽瓶颈解读为参与者拒绝。

参考:GSC 官方流程页(geisinger.org/precision-health/mycode/mycode-conditions);IntechOpen 心血管返现综述(doi 10.5772/intechopen.1007908)。

坑点 5:返现后 EHR 被结果污染(时间泄漏)

问题:返现结果写入 EHR 后,后续记录出现遗传咨询、增强监测、预防性手术、靶向治疗等条目——这些是「因携带状态而采取的行动」,若混入特征会直接泄漏标签。

症状:模型 PR-AUC 高得可疑(0.9+);特征重要性 Top 榜被「genetic counseling encounter」「prophylactic mastectomy」「BRCA test ordered」等条目占据;剔除后性能骤降暴露原模型的虚高。

解决:

  1. 特征时间窗以 return_date(有则用)或以 GSC 面板基因检测条目首次出现时间为界,硬截断;
  2. 建立禁用码表:所有遗传咨询 CPT/HCPCS 条目、基因检测订单条目、预防性手术 ICD-10-CM Z40 类目进入黑名单;
  3. 训练/部署一致性测试:模拟「新患者无返现记录」输入(把黑名单条目全置空),性能应只降不崩,崩则说明存在残留泄漏路径。

参考:§5.3 划分策略;ACMG 返现文献中关于「返现改变医疗行为」的记录。

坑点 6:测序批次效应跨波次不可比

问题:DiscovEHR 测序从 2014 年滚动至今,捕获试剂版本、测序深度与管线版本跨批次演进,50,726(2016)与 233,185(2025)两个口径的变异检出灵敏度不同。

症状:早期波次基因的「阴性」可能只是检出灵敏度低(假阴性偏倚);跨波次合并分析时基因携带率随入组年份漂移,被误读为真实患病率时间趋势;GWAS/QTL 分析出现批次主导的假阳性。

解决:

  1. 每次分析携带批次元数据(provenance_manifest),把测序批次作为协变量或随机效应;
  2. 关键估计限制在同批次内计算,或用批次内标准化后的相对风险跨批合并;
  3. 复现旗舰论文时锁定对应口径(50,726),不要用全量数据「复现」旧论文的绝对数。

参考:Dewey et al. 2016 论文方法节;NHGRI GM14 手册对 2014 合作启动的记录。

问题:MyCode 采用 opt-in 宽同意,但不同时期入组者的同意版本措辞与允许用途有差异;2015 年起才有专门的返现同意,此前入组者参与返现需二次同意。

症状:使用 2007-2014 波次数据做返现相关研究时被合规部门驳回;把早期同意者数据用于商业敏感分析触发协议审查;合作方误以为「宽同意 = 任意用途」。

解决:

  1. 任何分析先按 consent_version 过滤可用人群,把「同意范围」作为数据资产元数据而非附件文档;
  2. 返现流程研究仅使用 2015 年后签署返现同意的子队列;
  3. 发表前利用 Geisinger 的发表审查通道确认用途解释与同意语言一致。

参考:NHGRI GM14 手册(MyCode 同意结构与治理);GSC 流程页。

坑点 8:变异注释与面板基因清单随时间漂移

问题:可行动基因清单从 2016 年的 76 个(56 ACMG + 20 Geisinger 追加)扩展为现行 GSC 81 基因、35+ 状况;ClinVar 分类动态更新,VUS(意义未明变异)可能升级为致病。

症状:用旧清单跑出的「阴性」参与者在新清单下实为携带者;文献间携带率不可比(3.5% @76 基因 vs 官方 3-5% @现行面板);长期运行的筛查模型因 ClinVar 更新导致输出漂移,触发临床质疑。

解决:

  1. 数据快照必须记录注释版本与基因清单版本(provenance_manifest),任何报告绑定版本号;
  2. 建立「清单升级再分析」例程:新面板发布后对全部历史样本重跑命中扫描(GSC 官方声明未发现者样本会被反复再分析,合作研究可对齐该机制);
  3. 模型部署时把 ClinVar 版本与清单版本作为输入特征元数据,版本变更触发再验证而非热更新。

参考:Dewey 2016(76 基因口径);GSC 官方条件列表页(现行面板);350k 新闻稿(81 基因、35+ 状况)。

§6.6 数据增强

基因组-EHR 数据的增强策略与影像不同,核心是「在不改变生物学事实的前提下扩充监督信号」:

  • 负采样策略:未携带者池远大于携带者,多标签训练按基因做难度感知负采样(hard negative = 有相似表型但无携带注释者);
  • 时间窗抖动:预测时点随机化(在就诊历史内滑动),等效于把一次随访扩成多条训练样本;
  • 掩码语言模型式预训练:对 EHR 事件序列做 masked token 预测(BEHRT/ExEHT 式),标签无关,充分利用 35 万人序列;
  • 跨库迁移增强:以 UK Biobank 子集做大规模预训练、MyCode 做领域适配,注意先做编码体系对齐(ICD-10 vs ICD-10-CM、SNOMED 版本);
  • 禁忌:不要对变异特征做 SMOTE 式插值——离散的携带状态插值没有生物学意义;不要对家族成员做独立同分布假设的增强。

§6.7 模型推荐

任务 推荐起点 升级路线 理由
携带者筛查(case finding) XGBoost/LightGBM + 手工特征(Phecode 计数、LDL-C 轨迹、家族史标志) EHR 序列 Transformer(BEHRT/ExEHT 式) 稀疏事件树状特征树模型稳健,序列模型吃全历史
表型算法(phenotyping) 逻辑回归 + 确定性规则 弱监督(Snorkel 式标注函数)+ BERT 家族文本模型 可解释优先,文本抽取用临床 BERT
PRS 评估 PRS-CS/LDpred2 生成 + Cox/AUC 评估 多基因 + 罕见变异联合模型(SKAT 式) 罕见与常见变异互补
靶点验证 Cox 比例风险 + 聚类稳健 SE 孟德尔随机化(两样本 MR) LoF 携带即天然工具变量
临床文本 NLP ClinicalBERT/Clinical-Longformer 微调 LLM 少样本抽取 + 人工抽检 家族史/知晓状态抽取为主战场

通用建议:先跑基线(逻辑回归 + 前 10 个 Phecode)再上深度模型;所有模型固定祖先分层评估集;对 81 基因多标签任务输出逐基因 PR-AUC 而非宏平均掩盖长尾。

§6.8 计算资源需求

阶段 建议配置 估计耗时
变异矩阵 QC(Hail,23 万人) 8-16 节点 Spark 集群(每节点 16 核/64 GB) 数小时
PCA + 祖先推断(PLINK2) 64 核/256 GB 单机 <1 小时
EHR 序列构建(pandas/DuckDB) 32 核/128 GB <1 小时
BEHRT 式预训练 4×A100 40 GB 1-3 天
多标签微调(81 标签) 1×A100 或 4×V100 2-8 小时
XGBoost 基线 16 核/64 GB 分钟级

磁盘预算:变异 MT(QC 后)500 GB-1 TB;EHR parquet 100-300 GB;建议预留 2 TB 工作区。数据不可下载复制多份,工程上推荐「单副本 + 环境到数据」。

§6.9 评估指标

携带者筛查是极端不平衡的多标签问题,指标选择直接决定结论正确性:

# evaluate.py — 逐基因 PR-AUC + 校准 + 祖先分层
import numpy as np
from sklearn.metrics import average_precision_score, brier_score_loss

def per_gene_report(y_true, y_prob, genes, pc2, thr=0.02):
    rows = []
    eur = np.abs(pc2) < thr          # 祖先 PC 分层示意
    for j, g in enumerate(genes):
        yt, yp = y_true[:, j], y_prob[:, j]
        if yt.sum() < 10:
            rows.append((g, np.nan, np.nan, int(yt.sum())))  # 长尾不硬算
            continue
        rows.append((
            g,
            average_precision_score(yt, yp),
            brier_score_loss(yt, yp),
            int(yt.sum())))
    return pd.DataFrame(rows, columns=["gene", "pr_auc", "brier", "n_pos"])

指标规范:(1) 主指标逐基因 PR-AUC(宏平均只作参考);(2) 校准必须报告(Brier/校准曲线),筛查模型下游是临床决策;(3) 召回率按「每漏报一例的临床代价」设定工作点而非固定阈值;(4) 靶点验证类任务报告 HR 与 95% CI,用聚类稳健方差;(5) 公平性报告祖先分组的 TPR/FPR 差距。

§6.10 MLOps 笔记

  • 数据版本化:快照 ID + 同意版本 + 注释版本三元组作为每次训练运行的 lineage 标签,缺一不可;
  • ClinVar 漂移监控:生产环境每月对账 ClinVar 更新,VUS 升级致病触发受影响基因模型的再验证;
  • 隐私即部署约束:个人级数据不出授权域,模型产物(权重)也需按 DUA 审查后再发布;
  • 模型卡与分层:每版模型卡强制包含祖先分层性能与已知失效人群,明确「仅适用于欧洲裔为主的社区医疗人群」的边界声明;
  • 复现包:发表物提供「汇总数据 + 全部代码 + 随机种子」,让审稿人可在公开数据上验证方法学(个人级数据不可发布时,这是唯一负责任的复现路径);
  • 返现流程联动:部署的筛查模型若产生新候选携带者,必须接回 GSC 流程(CLIA 确认 → 咨询),不能绕过临床管道直接输出风险提示。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚 性质 对研究的影响 缓解措施
祖先偏倚 98% 欧洲裔(DiscovEHR 子集) 罕见变异谱与 PRS 外推受限;非欧洲裔子样本功效不足 祖先分层报告;与 All of Us 互补使用
健康系统偏倚 单一整合交付系统、农村/小镇人口 与都市学术中心人群的就诊行为、编码密度不同 外部验证前先做人群对照描述
参与自愿偏倚 opt-in 同意率 85-90% 极高同意率缓解了经典志愿者偏倚,但拒绝者与死亡/迁出者仍缺失 敏感性分析(假设拒绝者风险谱)
表型噪声偏倚 EHR 漏诊/误诊、编码习惯差异 关联分析效应量被稀释;「无诊断 ≠ 无病」 Phecode 确定性规则;测序金标准校验
检测频率信息性偏倚 病重者检验更频繁 检验缺失非随机(MNAR) 「是否检测」指示变量;缺失类别建模
批次效应偏倚 测序管线跨波次演进 早期波次灵敏度不同,携带率漂移 批次协变量;同批内估计
返现漏斗偏倚 CLIA+咨询带宽限制返现速度 「已返现」子集受时间与运营容量混杂 时间到事件分析;三口径区分

§7.2 标注质量评估

MyCode 的最高置信标签(CLIA 确认的返现结果)质量接近临床检测金标准——CLIA 认证实验室的独立复核是该行业的法定质量框架。但研究者实际可用标签的置信度呈三级分布:CLIA 确认(约 5,000+ 例,最可靠)> 研究级 LoF/致病注释(233,185 例,自动管线,可能有假阳/假阴)> EHR 派生表型(全队列,噪声最大)。研究设计的关键决策是「哪一级标签作为真值」:方法学开发可用第二级(样本量大),临床转化主张必须用第一级。已知公开数据点:Tier 1 携带者中 87% 筛查前不知晓——这也说明第二级标签里藏着大量「携带但未临床确认」者,其 EHR 表型必然偏「健康」,以此计算外显率会低估。

§7.3 泛化性讨论

  • 人群维度:结论对欧洲裔社区医疗人群最可靠;向非欧洲裔、都市人群、其他国家的推广需逐步验证,PRS 类应用尤甚;
  • 系统维度:Geisinger 的「保险+医疗一体化」结构带来低记录流失,在碎片化支付体系中(多数美国系统)EHR 纵深会缩水,模型对记录缺失更敏感;
  • 时间维度:入组越晚 EHR 纵深越短(350,000 节点的新参与者只有数年记录),跨波次建模需按 EHR 观察窗长度分层;
  • 临床实践漂移:2010 年代的 LDL-C 治疗目标指南变化、基因检测成本下降都会改变「携带者被识别」的先验,跨年代模型需再校准。

§7.4 伦理考量

MyCode 是基因组伦理研究的标杆案例,关键设计:

  • opt-in 宽同意:参与者主动签署同意捐样并链接 EHR,被邀者同意率 85-90%,远高于多数生物样本库;
  • 返现知情框架:2015 年起建立「基因组优先」返现流程——参与者同意接收可行动结果,免费遗传咨询支持;
  • 治理结构:Geisinger IRB + MyCode Governing Board + 参与者/青年/临床医生顾问委员会 + 外部伦理与科学顾问委员会多层监督;
  • 家族维度伦理:基因组结果天然影响血缘亲属,级联筛查涉及未同意第三方的隐私边界,GSC 通过鼓励先证者告知家族处理;
  • 再分析承诺:样本被持续再分析并可能在未来返回新发现,参与者的持续知情是协议核心条款;
  • 商业合作透明度:Regeneron 获得完全去标识化数据、Geisinger 保留临床使用权,这一安排在合作启动时公开披露,是「私有队列+药企合作」模式的争议与借鉴焦点。

§7.5 公平性评估

# fairness.py — 祖先分层公平性审计骨架
def fairness_audit(y_true, y_prob, group, thr=0.5):
    """group: 0=欧洲裔参考组, 1=其他/混合祖先"""
    out = {}
    for g in (0, 1):
        m = group == g
        if m.sum() < 100 or y_true[m].sum() < 5:
            continue                      # 子样本不足则不报告,诚实缺省
        yp, yt = y_prob[m] >= thr, y_true[m] == 1
        out[f"g{g}_tpr"] = yp[yt].mean()
        out[f"g{g}_fpr"] = yp[~yt].mean()
    if "g0_tpr" in out and "g1_tpr" in out:
        out["tpr_gap"] = out["g0_tpr"] - out["g1_tpr"]
    return out

结构性事实:队列 98% 欧洲裔意味着「公平性审计」的最大问题不是算法层(组间阈值差异),而是数据层——非欧洲裔子样本过小,任何分层指标都无统计功效。诚实的做法是承认这一局限并把多样性补齐交给互补数据源(All of Us:77% 代表性不足社区),而不是在功效不足的分层上硬报「无显著差异」。

§7.6 数据漂移提示

  • 队列增长漂移:入组规模从 2016 年 5 万到 2024 年 35 万,新波次的人口构成随 outreach 地区扩展而变;
  • 临床指南漂移:FH 治疗目标、乳腺癌筛查间隔、心肌病基因型-表型认识都在更新,跨年代 EHR 语义不同;
  • 检测可及性漂移:基因检测成本骤降使「返现外自费检测」增多,携带者「未知晓率」随时间结构性下降,历史数据训练的知晓状态模型会衰减;
  • 注释生态漂移:ClinVar 与基因面板清单更新(76 → 81 基因)改变标签定义,版本化是唯一的对抗手段(见坑点 8)。

§7.7 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 数据为宽格式(每行一个样本/事件) ✅ OMOP 式交付一人一行/事件一行;变异为长表
2 有唯一标识符列 ✅ participant_id 主键 + 事件级 ID
3 无 Unicode 或特殊字符 ⚠️ 结构化字段规范;临床文本含自然语言符号需清洗
4 无重复行 ✅ 临床级数据治理含重复检测;合作交付经清洗
5 缺失值已识别并编码 ✅ 检验 MNAR 结构已文档化(§4.5)
6 标签列被明确标识 ✅ GSC 携带/返现字段明确;三置信级分级清晰
7 已对罕见类别(<3%)进行分组 ⚠️ 81 基因长尾未官方分组,需自行归类
8 偏倚评估已完成 ✅ §7.1 七类偏倚与缓解措施
9 有完整的数据字典 ✅ OMOP 标准字典 + 合作交付 data_dictionary
10 对"信息性缺失"有明确编码解释 ✅ 检验缺失 MNAR 已解释(§4.5)
11 数据采集设备和设置已记录 ✅ §3.9 测序平台与 EHR 源系统记录
12 已移除完全共线性变量 ⚠️ 保留原始列,共线性由研究者处理
13 对编码的映射标准已说明 ✅ ICD-10-CM/SNOMED/OMOP 映射路径明确
14 对时间戳的处理已明确说明 ✅ 授权环境内日期规则按协议说明
15 训练/验证/测试划分建议已给出 ❌ 无官方划分;§5.2 给出家系感知替代方案
16 数据泄漏风险已被讨论 ✅ §5.3 三类 MyCode 特有泄漏模式
17 标签分布已被分析 ✅ §4.2 返现结果分布与漏斗口径
18 选择性测量偏倚已被讨论 ✅ 检测频率 MNAR 与批次效应(§7.1)
19 外部验证建议已给出 ✅ §5.5 四级外部验证优先级
20 数据更新和版本信息已记录 ⚠️ 规模节点可追溯,但无冻结版本号与 changelog
21 最小必要预处理脚本已提供 ❌ 无官方公开管线;§6.3 提供合作场景骨架
22 合规使用要求已明确 ✅ DUA/MTA + IRB 双备案 + 发表审查
23 多模态对齐方法已说明 ⚠️ 基因组-EHR 以 participant_id 对齐;文本-结构化时间对齐需自行处理
24 去标识化方法已被记录 ✅ 合作协议内去标识规范 + 治理委员会审计

DAIMS 评分:17 / 24

评分解读:良好偏应用受限——数据治理与合规顶尖(临床级溯源、三级标签置信、伦理框架标杆),但「私有队列」属性使公开性、官方划分与预处理管线三项天然失分,AI 就绪度受访问门槛而非数据质量拖累。

对你的意义:如果你能通过合作获得数据,MyCode 的质量与纵深物超所值——把它当「验证与外推的锚队列」;如果你依赖公开数据工作,MyCode 只能作为文献结论与汇总统计的引用源,方法开发请转向 UK Biobank/All of Us,再把 MyCode 留给关键验证。⭐ 评分 3/5(AI 就绪度):数据本体优秀但获取摩擦高、个人级数据不可公开下载、无官方基准任务。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部测试集变化 关键发现
UK Biobank 外显子子集 UK Biobank 携带率/外显率估计跨库复制 携带率点估计 + CI 重叠 欧洲裔内良好一致 UKB 外显子论文(Nature 2021)用 133,370 名 DiscovEHR 欧洲血统参与者做独立复制,为 EHR-基因组队列间的标杆互证
All of Us WGS 队列 NIH 祖先多样性与校准对照 分层校准斜率 非欧洲裔分层无法在 MyCode 内估计 两者构成「纵深 vs 多样性」互补对,联合报告成为新基准实践
Geisinger 新入组波次 Geisinger 时间前向验证 PR-AUC 漂移 随 EHR 观察窗缩短而下降 内部时间外验证是 MyCode 研究的常规做法
本地健康系统 EHR 各合作医院 携带者筛查部署前检验 每千例检出数/咨询转诊率 显著下降 编码体系与患者构成差异,需重校准(见 §5.5)

§8 基准性能与生态

§8.1 代表性研究成果

MyCode 没有社区排行榜——它是私有队列。以其为数据平台的标志性成果构成事实上的「成果榜」:

研究 发表 规模 核心发现 意义
DiscovEHR 旗舰分析 Science 2016(Dewey et al.) 50,726 例 WES 约 420 万罕见变异、约 176,000 个 LoF;3.5% 携带 76 可行动基因有害变异 私有队列人群测序可行性证明
脂质靶点人类遗传学 Science 2016 及后续 同队列 LoF 携带者 血脂通路靶点因果验证(如 APOC3、PCSK9 通路相关发现) 「天然敲除」靶点验证范式确立
可行动变异患病率 多篇(2016-2024) 5 万-23 万例 约 3-5% 参与者携带可高风险变异;Tier 1 中 87% 不知晓 人群基因组筛查政策核心证据
神经发育/精神风险变异 2022 分析 全队列 约 1/100 携带相关风险变异 扩展返现边界讨论
甲状腺癌风险识别 2023 研究 队列子集 基因组筛查有效识别甲状腺癌风险 新适应症加入返现的证据
UKB 外显子独立复制 Nature 2021 133,370 名欧洲血统子集 携带率与表型关联跨库复制 私有队列与公开队列互证范式
心血管返现运营分析 IntechOpen 2024 综述 2,256 例心血管结果 心肌病 1,031/FH 590/心律失常 375/hATTR 163;87% 不知晓率 返现流程规模化的最完整公开数据

§8.2 SOTA 总结与选型建议

在 MyCode 数据形态(WES + 纵向 EHR + 三级标签)上,方法学的「当前最佳实践」可总结为:

  1. 携带者筛查:梯度提升树 + Phecode 特征仍是稳健基线;序列 Transformer 在全历史数据上增益明显但需按家系划分评估;
  2. 外显率/患病率估计:直接标准化(按年龄/性别/批次)+ 家族聚类稳健方差是主流;前瞻性偏差校正(UKB 协作复制)提升可信度;
  3. 靶点验证:LoF 携带者 Cox 分析 + 两样本孟德尔随机化组合拳,已取代单点关联;
  4. 返现运营建模:时间到事件 + 漏斗分解(携带→确认→咨询→完成)是标准框架。

选型建议:以公开数据开发方法(UKB/All of Us),以 MyCode 做终点验证——这是访问门槛决定的现实最优路径。

§8.3 官方评测协议

不存在官方评测协议。研究合作的实际约束构成「事实协议」:数据快照版本固定、同意版本过滤、祖先分层报告、发表前 Geisinger 审查、禁止再标识与个体层面共享。计划投顶刊的研究通常预先约定复现材料范围(代码 + 汇总统计)。

  • UK Biobank——50 万人级表型深度最优的申请制队列,外显子 454,787 例;
  • All of Us——多样性最优(77% 代表性不足社区)的临床级 WGS 公共研究平台;
  • BioVU(Vanderbilt)——同类 EHR-DNA 生物样本库,基因分型为主;
  • Million Veteran Program——90 万+ 退伍军人队列,纵向 EHR + 测序扩展中;
  • ClinSeq——NHGRI 返现模式先导队列,MyCode 流程的直接思想来源之一;
  • 100,000 Genomes Project——英国患者基因组计划,NHS 临床整合路线对照。

§8.5 关键论文 Top 10

  1. Dewey FE, et al. Distribution and clinical impact of functional variants in 50,726 whole-exome sequences from the DiscovEHR study. Science. 2016;354(6319). doi:10.1126/science.aaf6814 —— 旗舰论文,队列可行动性的定量底座。
  2. Carey DJ, et al. The Geisinger MyCode community health initiative: an electronic health record-linked biobank for precision medicine research. Genet Med. 2016. doi:10.1038/gim.2015.187 —— 队列定义性论文。
  3. Abul-Husn NS, et al. 系列研究(Geisinger 团队)——FH 与可行动变异的 EHR 整合分析,返现临床路径的证据链。
  4. UK Biobank exome sequencing consortium. Nature. 2021;600:xxx. doi:10.1038/s41586-021-04103-z —— 用 133,370 名 DiscovEHR 欧洲血统参与者独立复制,跨队列互证样板。
  5. All of Us Research Program Genomics Investigators. Genomic data in the All of Us Research Program. Nature. 2024;627:340-346. doi:10.1038/s41586-023-06957-x —— 路线对照与多样性参照系。
  6. Biesecker LG, et al. ClinSeq 系列论文(Genet Med 2012 起;NCT00410241)——「基因组应作为终身反复解读的医疗资源」的理念源头。
  7. Geisinger 350,000 参与者里程碑新闻稿(2024-09-03)——当前规模、23 万配对、5,000+ 返现与 81 基因面板的官方口径。
  8. NHGRI GM14 会议手册(2022 存档)——MyCode 治理结构、同意率、EHR 纵深的第三方核证记录。
  9. IntechOpen 心血管返现综述(2024,doi:10.5772/intechopen.1007908)——2,256 例心血管返现结果构成与 87% 不知晓率。
  10. Fragoso MA, et al. 与 Stem Bridge/Ritchie 团队的 DiscovEHR 方法学论文(Hum Mutat 等时期报告 92,805 例)——测序扩容期的队列描述。

§8.6 社区活跃度

MyCode 的「社区」是临床与研究联合体而非开源社区:无公共 GitHub 组织、无公共 issue 追踪;合作网络以 Geisinger Genomic Medicine Institute、Regeneron Genetics Center 与多家药企联合分析为主;向公众的活跃度体现在新闻稿(350k 里程碑)与患者宣传材料。学术影响力通过 DiscovEHR 论文引用网络与 UKB/All of Us 的互证研究传播。想跟进动态,建议订阅 Geisinger 官方新闻页与 DiscovEHR 相关论文的 Google Scholar 引用提醒。

§8.7 生态快照

维度 状态
数据访问模式 合作/协议制(Private);无自助申请门户
测序规模 233,185 例外显子(2025-01 报道),持续增长
返现面板 GSC:81 基因、35+ 状况
官方基准任务 无;成果以队列科学论文形式发表
与公开生态接口 UKB 复制子集(133,370);汇总统计可引用
工具生态 OMOP 映射交付 + 授权环境内标准组学工具链(PLINK/Hail)
治理 Geisinger IRB + Governing Board + 多方顾问委员会
生命线 滚动入组 + 持续再分析(无冻结版本)

§9 相关资源与引用

官方资源

BibTeX 引用(核心三件套)

@article{Carey2016MyCode,
  author  = {Carey, David J. and Fetterolf, Samuel N. and Davis, F. Daniel
             and Faucett, William A. and Kirchner, H. Lester and Mirshahi, Ulzee
             and Murray, Michael F. and Smelser, Dustin T. and Gerhard, Glenn S.
             and Ledbetter, David H.},
  title   = {The Geisinger MyCode community health initiative: an electronic
             health record-linked biobank for precision medicine research},
  journal = {Genetics in Medicine},
  year    = {2016},
  volume  = {18},
  number  = {9},
  pages   = {906--913},
  doi     = {10.1038/gim.2015.187}
}

@article{Dewey2016DiscovEHR,
  author  = {Dewey, Frederick E. and Murray, Michael F. and Overton, James D.
             and Habegger, Lukas and Leader, Joseph B. and Fetterolf, Samuel N.
             and O'Dushlaine, Colm and Van Hout, Cristopher V. and others},
  title   = {Distribution and clinical impact of functional variants in 50,726
             whole-exome sequences from the DiscovEHR study},
  journal = {Science},
  year    = {2016},
  volume  = {354},
  number  = {6319},
  doi     = {10.1126/science.aaf6814}
}

@misc{Geisinger2024Milestone,
  author       = {{Geisinger Health System}},
  title        = {MyCode Community Health Initiative enrolls 350,000 participants},
  year         = {2024},
  month        = {9},
  howpublished = {\url{https://www.geisinger.edu/about-geisinger/news-and-media/news-releases/2024/09/03/14/14/mycode-community-health-initiative-enrolls-350000-participants}}
}

引用规范:使用个人级数据的研究必须按 DUA 要求署名引用 Carey 2016(队列定义)与 Dewey 2016(测序与分析口径);仅引用官方数字时引新闻稿与 GSC 页面。

教程与学习资源

  • NHGRI GM14 手册中 MyCode 治理章节——理解「健康系统生物样本库治理」的最佳一手材料;
  • DiscovEHR 旗舰论文(Science 2016)方法节——WES 管线、LoF 定义与 76 基因清单的技术基准;
  • GSC 官方流程页——「基因组优先返现」流程的五步描述,是卫生服务研究设计的模板;
  • OMOP CDM 官方文档(ohdsi.org)——理解 MyCode 合作交付 EHR 表结构的通用框架;
  • Hail 官方文档(hail.is)——处理 23 万人级变异矩阵的事实标准工具。

原始论文

  • Carey DJ, et al. Genet Med. 2016;18(9):906-913. doi:10.1038/gim.2015.187(队列定义性论文);
  • Dewey FE, et al. Science. 2016;354(6319). doi:10.1126/science.aaf6814(旗舰分析,50,726 例);
  • UK Biobank exome consortium. Nature. 2021. doi:10.1038/s41586-021-04103-z(含 133,370 名 DiscovEHR 欧洲血统参与者的独立复制);
  • All of Us Research Program Genomics Investigators. Nature. 2024;627:340-346. doi:10.1038/s41586-023-06957-x(路线对照);
  • ClinSeq 系列论文(Genet Med 2012 起;注册号 NCT00410241)——返现模式先导;
  • IntechOpen 心血管返现综述. 2024. doi:10.5772/intechopen.1007908(2,256 例心血管结果构成)。

§10 AI 使用声明卡

§10.1 AI 模型使用

项目 说明
主力模型 deep-model(WorkBuddy CodeBuddy 编排)
用途 本条目初稿撰写、结构化整理、代码示例生成、JSON-LD 构建
上下文来源 见 §10.3
运行环境 千方病案医数集编辑部生产管线

§10.2 AI 参与范围

AI 在本页面的工作中负责:(1) 从 Geisinger 官方页面、NHGRI GM14 手册、Science 2016 旗舰论文、NCI DCEG 期刊俱乐部记录与返现综述中整理结构化信息;(2) 生成 §6 的 PLINK/Hail/PyTorch 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。所有事实性陈述均可溯源至 §10.3 所列来源,AI 不产生原始数字。

§10.3 输入来源

  1. Geisinger 官方 MyCode 主页与 GSC 条件列表页(geisinger.edu / geisinger.org);
  2. Geisinger 350,000 参与者里程碑新闻稿(2024-09-03)及 EurekAlert 存档;
  3. NHGRI GM14 会议手册(2022-07 存档 PDF);
  4. Dewey et al., Science 2016, doi:10.1126/science.aaf6814(PubMed 28008009);
  5. Carey et al., Genet Med 2016, doi:10.1038/gim.2015.187;
  6. NCI DCEG Bioinformatics Journal Club(2025-01-08)对 DiscovEHR 233,185 例的记录;
  7. IntechOpen 心血管返现综述(2024,doi:10.5772/intechopen.1007908);
  8. UK Biobank 外显子论文(Nature 2021,doi:10.1038/s41586-021-04103-z);
  9. All of Us 基因组论文(Nature 2024,doi:10.1038/s41586-023-06957-x);
  10. HMG 2018 EHR-linked 生物样本库综述(doi:10.1093/hmg/ddy114)及 discovehrshare.com 时代公开摘要;
  11. ClinSeq 论文系列(Genet Med;NCT00410241);
  12. 事实清单归档:FACTS.md(本条目目录,含全部来源 URL)。

§10.4 人工校验表

校验项 校验人 校验方法 状态
规模数字(350,000/233,185/5,000+) 千方病案医学编辑部 对照 2024-09 新闻稿与 NCI DCEG 记录 ✅ 已通过
返现结果构成(2,256 心血管例细分) 千方病案医学编辑部 对照 IntechOpen 综述表格 ✅ 已通过
GSC 面板口径(81 基因/35+ 状况) 千方病案医学编辑部 对照新闻稿与 GSC 条件列表页 ✅ 已通过
基因清单演进(76 → 81) 千方病案医学编辑部 对照 Dewey 2016 与现行面板 ✅ 已通过
ICD-11/SNOMED 锚定表 千方病案医学编辑部 仅保留高置信编码,类目级标注已声明 ✅ 已通过
代码示例可运行性 千方病案医学编辑部 结构与 API 对齐 PLINK2/Hail/PyTorch 稳定接口 ✅ 已通过
站内 URL 占位符规范 千方病案医学编辑部 全部为 {slug}/0 形式 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。

§10.6 最后审核

项目 内容
最后人工审核日期 2026-09-05
审核人 千方病案医学编辑部
审核范围 全部章节事实核对、格式规范(Schema v3.9)、法律与伦理声明
下一审核触发 Geisinger 发布新规模里程碑或 GSC 面板变更时

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • dbgap — 共享标签:电子健康记录 / 临床电子病历 / 队列研究 / 基因组学与多组学
  • million-veteran-program — 共享标签:电子健康记录 / 临床电子病历 / 队列研究 / 基因组学与多组学
  • all-of-us-nih — 共享标签:电子健康记录 / 队列研究 / 基因组学与多组学
  • topmed — 共享标签:队列研究 / 基因组学与多组学 / 心血管疾病
  • framingham — 共享标签:电子健康记录 / 队列研究 / 心血管疾病
  • finngen — 共享标签:电子健康记录 / 队列研究 / 基因组学与多组学
  • biobank-japan — 共享标签:电子健康记录 / 队列研究 / 基因组学与多组学
  • metabric — 共享标签:电子健康记录 / 队列研究 / 基因组学与多组学
  • outcomerea — 共享标签:电子健康记录 / 临床电子病历 / 队列研究
  • opensafely — 共享标签:电子健康记录 / 临床电子病历 / 队列研究

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集