信息速览

Vanderbilt Synthetic Derivative / BioVU — EHR+DNA 单机构最大生物库 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | Vanderbilt Synthetic Derivative 与 BioVU(合成衍生数据 + DNA 生物库) |
| 英文全称 | Vanderbilt Synthetic Derivative & BioVU DNA Databank |
| 别名/简称 | SD、BioVU、Vanderbilt DNA Databank、Vanderbilt DNA Biorepository |
| 疾病分类(ICD-11) | 全病谱泛医疗队列;代表:BA00 原发性高血压、5A11 2 型糖尿病、BA41 急性心肌梗死 |
| SNOMED CT | 38341003(高血压性疾患)、44054006(2 型糖尿病)、22298006(心肌梗死) |
| 数据模态 | EHR(结构化编码 + 实验室 + 自由文本)+ DNA 生物库/基因型数据 |
| AI 任务类型 | 表型分类、PheWAS/GWAS、药物基因组学、疾病轨迹建模、临床 NLP |
| 样本总数 | BioVU >343,000 份 DNA 样本(2024 年中);SD >360 万患者 EHR |
| 数据大小 | 无整包下载;按研究提案定制提取(SD 记录平均约 100 KB/条,2014 年测算) |
| 数据格式 | 定制提取 CSV;基因组 PLINK / VCF / BAM / CRAM / FASTQ |
| 许可证 | VUMC Data Use Agreement(专有 DUA,禁止再识别与再分发) |
| 访问级别 | 申请审核(仅限 VUMC 教员牵头的项目,外部机构可合作) |
| DUO 标签 | IRB、COL(需协作)、NPU(非营利使用)、GSO(仅限遗传研究,对应 dbGaP DUL 修饰符) |
| 语言 | 英语 |
| 首发日期 | 2007-02(BioVU 首批样本;SD 随 VUMC EHR 体系于 1994 年后逐步建成) |
| 最后更新 | 持续滚动更新(官方规模核实至 2024 年中) |
| 发布机构 | Vanderbilt University Medical Center(VUMC) |
| 官方主页 | https://www.vumc.org/dbmi/node/144 |
| 下载地址 | 无公开下载;经 BioVU 官方页提交提案申请 |
| DOI | 10.1038/clpt.2008.89(体系描述论文) |
| 引用次数 | 916+(Semantic Scholar,截至 2026-09,Roden 2008 描述论文) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— OMOP CDM 标准化与 PheWAS 工具链成熟、表型文档丰富,但数据需申请审核、定制提取、无官方公开划分,扣分项为不可自助获取与日期偏移需逐任务适配 |
| 页面状态 | published |
§0 E-E-A-T 审核与免责
医学审核:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、队列流行病学)、§7 偏倚分析(转诊偏倚、编码偏倚、公平性)。本页所引规模数字均来自 VUMC 官方页面与同行评审论文,核实日期为 2026-09。
数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。去标识机制描述依据 VUMC 官方方法论文献(Roden 2008、Pulley 2010)与 BioVU NIH 数据共享指南(v2/2023)。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。SD 与 BioVU 为 VUMC 专有资源,须由 Vanderbilt 全职教员牵头提交研究提案、经 BioVU 审查委员会批准并签署数据使用协议(DUA)后方可获取;使用者须承诺不尝试再识别患者,并在发现潜在再识别信息时主动报告。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? 范德堡合成衍生数据(Synthetic Derivative,SD)是范德堡大学医学中心(VUMC)生产环境电子病历的"去标识镜像"——把真实 EHR 里的身份信息系统性抹除后形成的科研数据库,覆盖 360 万+ 患者的纵向临床数据。BioVU 则是把患者做常规抽血检验后"本来要丢弃"的剩余血液提取成 DNA 的生物库,截至 2024 年中已积累超过 343,000 份样本,并通过单向哈希研究 ID 与 SD 精确链接。两者合起来,就是"病历 + 基因"在世界单一学术机构规模上的最大组合。
为什么重要? 医疗 AI 最缺的不是算法,而是"真实世界临床数据 + 可验证结局"。SD/BioVU 用一套工程化去标识方案(SHA-512 哈希研究 ID、患者内恒定日期偏移、自由文本 PHI 清洗,去标识错误率 <0.1%)把这些数据变成了 IRB 认定"非人类受试者研究"的科研资源,让基因发现(GWAS/PheWAS)、药物基因组学(PREDICT 项目已落地处方实践)与 EHR 预测建模可以大规模开展。
我能用它做什么? 如果你是 VUMC 或其合作机构的教员,可以申请提取诊断编码、实验室、用药、临床文本与基因型的定制数据包,训练表型分类器、复现 PheWAS 管线、开发临床 NLP 算法,或把 EHR 时序与遗传多基因评分结合。外部研究者无法直接下载该数据,但可以复用其公开方法论(去标识方案、Phecode 映射、PheWAS R 包)与 dbGaP 上受控共享的衍生基因型数据。
§1.1 摘要
SD/BioVU 体系由 VUMC 生物医学信息学系与个性化医学办公室主导建设。技术路线上,SD 对生产 EHR 做三步去标识:①病历号(MRN)经 SHA-512 单向哈希替换为 128 字符研究 ID;②每个患者的全部服务日期按确定性规则整体后移 0–364 天,破坏绝对时间但保留就诊间隔;③自由文本经 De-ID 软件清除残余 PHI,经验证错误率 <0.1%,样本处理错误率 <0.3%(Roden 2008)。BioVU 采血采用"选择退出(opt-out)→ 2015 年起研究知情同意"模式,血样在临床检验后保留 3 天再提取 DNA,接受样本即触发哈希 ID 分配,与 SD 记录及基因型数据建立链接。SD 表型数据基于 OMOP CDM 互操作,含 RxNorm、CPT、LOINC、SNOMED 编码;基因组数据以 PLINK/VCF/BAM/CRAM 格式存储,2025 年 3 月一个由 Illumina 与 9 家药企组成的联盟完成了 250,000 份 BioVU 样本的全基因组测序。该体系是 PheWAS(全表型组关联研究)方法学的发源地,催生了 Phecode 映射、PheWAS R 包与 PheKB 表型知识库等公共工具。
§1.2 战略价值
维度一:规模与纵深。 单机构资源的天花板通常是样本量与随访长度,SD/BioVU 在两者上都达到极致:343,000+ 份 DNA 样本(2024 年中)链接 360 万+ 患者记录,临床数据回溯至 1994 年,平均每个早期样本携带 14±18 个 ICD-9 编码、8.0±6.8 种用药、6.5±6.2 年病史(Roden 2008 对前 16,102 个样本的统计)。对需要"同一患者在多年就诊中的连续事件流"的任务(疾病轨迹、药物安全信号、多病共存建模),这种纵深是短期前瞻性队列无法替代的。
维度二:方法学外溢。 SD/BioVU 的价值远超数据本身:它定义了"EHR 衍生去标识库 + opt-out 生物库"的合规范式(IRB 与联邦 OHRP 认定为非人类受试者研究),其 Phecode 体系与 PheWAS 框架已被 eMERGE 网络及全球 EHR 遗传学团队复用,PheWAS R 包(GPL-3)与 PheKB 成为公开基础设施。即便拿不到原始数据,其工具链与去标识设计也是 EHR AI 工程的直接蓝图。
维度三:转化闭环。 它是极少数"数据资产→临床行动"走通全程的单机构体系:BioVU 的基因分型经 PREDICT 项目回流到处方工作流,实现"发现→验证→床边提示"的闭环。对 AI 团队的启示是:本库上训练的模型不是终点——任何进入 VUMC 临床流程的算法,都能借助这套既有闭环获得真实世界的迭代反馈,这是纯研究数据库没有的增值通道。
§1.3 同类数据集横向对比
| 数据集 | 机构/国家 | 规模 | 模态 | 访问方式 | 与 SD/BioVU 的差异化 |
|---|---|---|---|---|---|
| Vanderbilt SD/BioVU | VUMC(美国) | >343,000 DNA 样本;>360 万患者 EHR | EHR+DNA | 申请审核(VUMC 牵头) | 单机构 EHR+DNA 最大组合;PheWAS 发源地 |
| UK Biobank | UK Biobank(英国) | 约 50 万参与者 | 问卷+影像+基因+WES/EHR 链接 | 受控申请(开放度较高) | 前瞻性人群队列,表型标准化程度高,但 EHR 纵深弱于 SD |
| All of Us | NIH(美国) | 数十万全基因组(滚动扩展) | 问卷+EHR+全基因组 | 受控工作台访问 | 多样性优先,EHR 来自多家医院,标准化程度不及单一 CDM |
| Mass General Brigham Biobank | MGB(美国) | 数十万 DNA 样本链接 EHR | EHR+DNA | 受控申请 | 与 BioVU 最同构的横向验证伙伴,LabWAS 研究常用其复现 |
| eMERGE 各节点(含 Marshfield PMRP) | NIH 网络(美国) | 各节点数万–数十万 | EHR+DNA | dbGaP 受控 | 协调网络,提供跨站点表型算法验证环境 |
| MIMIC-IV | MIT/BIDMC(美国) | 约 30 万患者、ICU 住院片段 | ICU EHR | 凭证化公开申请 | 重症监护深度远超 SD,但无 DNA、无门诊纵向 |
§1.4 版本时间轴
| 时间 | 里程碑 | 说明 |
|---|---|---|
| 1994 | VUMC EHR 建立 | SD 数据的时间下限(临床数据回溯至该年) |
| 2004 年中 | BioVU 立项规划 | 个性化医学办公室启动 opt-out 生物库设计 |
| 2007-02 | BioVU 首批样本(成人) | opt-out 同意模式上线,约 5% 患者选择退出 |
| 2008-09 | Roden et al. 描述论文发表 | Clin Pharmacol Ther 2008;84(3):362-369,去标识错误率 <0.1% |
| 2010 | 儿科 BioVU 启动 | 儿童样本采集开始(2013 年发表儿科专文) |
| 2012 年中 | 150,000 份样本 | 其中儿科 >16,000;周采集 600–800 |
| 2015-01 | 知情同意模式改革 | 响应 NIH GDS 政策,opt-out 表单改为研究知情同意书 |
| 2022-01 | >275,000 份样本 | 周采集 500–1,000;SD 约 250 万份 EMR |
| 2023 | BioVU NIH 数据共享指南 v2 | 明确 OMOP CDM、dbGaP 受控共享与 DUL 修饰符 |
| 2024 年中 | >343,000 份 DNA 样本 | SD 覆盖 >360 万患者;官方称世界最大单机构 EHR+DNA 库 |
| 2025-03 | 250,000 份样本完成全基因组测序 | Illumina + 9 家药企联盟项目 |
§1.5 典型应用场景
- PheWAS 药物再利用与多效性发现:以某遗传变异或生物标志物为暴露,横扫 1,800+ 个 Phecode 表型,发现意想不到的疾病关联(方法即诞生于本数据集)。
- EHR 表型算法开发与验证:结合计费编码、NLP 与实验室规则定义病例/对照(如 SLE 算法 PPV 89%、灵敏度 86%),供 GWAS 与队列招募复用。
- 药物基因组学临床转化:PREDICT 项目将 BioVU 基因分型转化为床边处方决策,是"EHR+基因→临床行动"的经典闭环。
- 疾病轨迹与时序预测建模:利用纵向就诊序列(诊断、用药、化验)训练住院风险、疾病进展与再入院模型。
- 临床文本 NLP:在脱敏出院小结、手术报告中开发信息抽取与表型深度化算法(PheKB 算法库即由此沉淀)。
场景选择的"适配检验"三问:任务是否依赖绝对日历时间(是→不可行,坑点 1)?任务是否需要设备级时序或原始影像(是→改用 MIMIC 类资源)?任务是否需要基因型×表型联合(是→本库是同类最优起点)?三问过后仍成立的任务,才值得投入申请周期。
§2 医学背景
§2.1 ICD-11 编码映射表
SD 覆盖全病谱,下表列出 EHR 队列中最具代表性、也是文献中反复用作案例的疾病及其 ICD-11 编码(WHO ICD-11 MMS 2024 版):
| 疾病/标签 | ICD-11 编码 | ICD-11 中文名 | 在 SD/BioVU 中的意义 |
|---|---|---|---|
| 原发性高血压 | BA00 | 原发性高血压 | BioVU 首批样本最高频诊断(占 15.7%) |
| 2 型糖尿病 | 5A11 | 2 型糖尿病 | 第二高频(11.8%),PheWAS 常用结局 |
| 高脂血症 | 5C80 | 高脂血症 | 第三高频(11.5%),LabWAS 主要表型 |
| 冠状动脉粥样硬化性心脏病 | BA41–BA4Z | 急性心肌梗死等缺血性心脏病 | 高频诊断(7.8%),多基因风险评分经典场景 |
| 贫血 | 3A00–3A0Z | 获得性溶血性贫血等(按分型) | 高频诊断(5.9%),化验值与编码交叉验证案例 |
| 全身性红斑狼疮 | 4A40 | 全身性红斑狼疮 | EHR 算法表型(编码+ANA 滴定)验证经典案例 |
| 抽动障碍 | 8A05 | 抽动障碍 | Phecode/PheRS 方法论文示例疾病 |
§2.1b SNOMED CT 映射表
| 标签 | ICD-11 | SNOMED CT | 术语说明 |
|---|---|---|---|
| 高血压性疾患 | BA00 | 38341003 | Hypertensive disorder(disorder 层级) |
| 2 型糖尿病 | 5A11 | 44054006 | Diabetes mellitus type 2 |
| 心肌梗死 | BA41 | 22298006 | Myocardial infarction |
| 高脂血症 | 5C80 | 55822004 | Hyperlipidemia |
| 贫血(未分型) | 3A00–3A0Z | 271737000 | Anemia(parent concept) |
| 系统性红斑狼疮 | 4A40 | 55464009 | Systemic lupus erythematosus |
说明:SD 原生编码体系为 ICD-9/ICD-10 计费编码,SNOMED 编码经 OMOP CDM 映射层进入互操作体系(BioVU NIH 数据共享指南 v2/2023)。上表映射用于跨体系检索与 OMOP 概念对齐。
§2.2 疾病与队列简介
SD/BioVU 不是单病种数据集,而是全病谱临床队列,其"医学背景"即 VUMC 服务人群的疾病构成。VUMC 是区域三级转诊中心,服务田纳西州中南部(Davidson、Montgomery、Rutherford、Williamson 四县为主)、南肯塔基与北阿拉巴马,患者群约覆盖 Davidson County 26% 的居民。队列人种以白人为主(约 81%),男女大致均衡;少数族裔在特定疾病研究中样本量偏小(例如 SLE PheWAS 中亚裔仅 25 人、西裔 30 人)。首批 16,102 个 BioVU 样本的诊断谱以慢性病为主:高血压 15.7%、2 型糖尿病 11.8%、高脂血症 11.5%、冠心病 7.8%、贫血 5.9%;55% 的记录包含住院记录,88% 至少有一种在用药物。这种"慢病富集、重症转诊叠加"的构成,决定了它最适合慢性病遗传学、药物安全与疾病轨迹研究,而急危重症深度不及 MIMIC 类 ICU 数据库。
§2.3 临床任务定义
在医疗 AI 语境下,SD/BioVU 支撑的任务可分为四类:筛查/发现——用 EHR 数据挖掘未确诊患者的风险(如实验室+编码联合的糖尿病病例发现算法);诊断/表型分类——将编码、文本、化验组合成高 PPV 表型算法(SLE:≥4 次 ICD-9 710.0 + ANA≥1:160,PPV 89%);预后/轨迹——纵向事件序列建模预测进展与再入院;遗传关联——GWAS/PheWAS 把基因型与算法定义的表型相连,是本数据集最独特的能力。注意所有"标签"都是算法生成而非病理金标准,任务设计必须显式处理误分类(见 §5 与坑点 4)。
§2.4 患者人群表
| 维度 | 描述 | 来源依据 |
|---|---|---|
| 来源机构 | Vanderbilt University Medical Center(三级学术医学中心) | VUMC 官方页 |
| 数据起点 | 1994 年(VUMC EHR 建立) | tic disorders 队列论文 2024 |
| 年龄 | 全年龄段(成人 2007 年起、儿科 2010 年起纳入 BioVU) | VUMC DBMI |
| 性别 | 男女约均衡 | SLE PheWAS 论文 2018 |
| 种族 | 白人约 81%,非裔次之;race 字段为自报+行政录入混合 | SLE PheWAS 论文 2018 |
| 就医类型 | 门诊为主、住院+急诊兼备;无外部机构记录 | VICTR/官方描述 |
| 地域 | 田纳西州中南部为主,覆盖 Davidson County 约 26% 居民 | Atlas of Longitudinal Datasets |
| 入库选择 | 均有临床检验经历(剩余血样来源),无检验就诊者不入 BioVU | 采血机制推论(检验后血样) |
§2.5 临床价值
对临床决策的价值已被体系内项目验证:PREDICT 在患者就诊时按基因型自动提示药物剂量/替代选择,把 BioVU 的基因分型直接写入处方工作流;急性肾损伤(AKI)预警项目利用研究数据仓库识别危险因素并嵌入医嘱录入系统。对 AI 研究者,价值在于"算法定义的表型 + 30 万级基因型"可以回答"这个生物标志物在真实临床人群里到底关联哪些结局"——这是纯 ICU 数据或纯影像队列无法回答的问题。
§2.6 金标准参考表
| 项目 | 内容 |
|---|---|
| 划分方式 | 无官方机器学习划分;按研究提案定制提取,病例/对照由表型算法在 SD 内定义 |
| 标注方式 | 算法自动标注(计费编码规则 + NLP + 实验室规则);关键研究辅以人工病历复核 |
| 标注者资质 | 表型算法由临床信息学团队开发;复核由专科医师(如风湿科医师复核自身抗体状态)执行 |
| 标注性质 | 弱监督/算法生成标签,PPV 依算法而异(示例:SLE 算法 PPV 89%、灵敏度 86%;心律算法 PPV 97%) |
| 一致性参考 | PheKB 平台公开多站点算法验证指标;跨站点复现依赖 eMERGE 网络协作 |
§2.7 表型算法谱系(PheKB 经典案例)
| 算法/队列 | 定义信号 | 验证指标 | 意义 |
|---|---|---|---|
| SLE(系统性红斑狼疮) | ≥4 次不同日期 ICD-9 710.0 + ANA 滴度 ≥1:160 | PPV 89%、灵敏度 86% | 编码+化验双通道算法的标杆,风湿科医师复核 |
| 心律传导(PR 间期) | NLP 筛选正常 ECG 报告 + 编码 | PPV 97% | NLP 深度介入表型定义的代表,支撑 GWAS 复现 |
| 正常窦性心律 ECG 队列 | 自由文本 ECG 报告 NLP 抽取 | eMERGE HDL 研究采用 | 用文本信号构造"健康对照"式队列的经典先例 |
| 多发性硬化 | ICD 编码 + 病程证据 | rs3135388 关联复现(PheWAS 2010) | 证明 EHR 表型可复现已知遗传信号 |
| 抽动障碍(tic disorders) | 编码 + 精神/神经共病结构 | 2024 队列论文(首诊共病 47% vs 对照 7%) | 展示共病富集的转诊偏倚量化方法 |
说明:上述算法定义与指标均来自已发表文献与 PheKB 平台,直接引用时须回溯原文;社区惯例是优先复用已验证算法,再按本地编码实践重估 PPV。
§3 数据集规格
§3.0 版本/获取方式抉择矩阵
SD/BioVU 无"版本号"意义上的发布,研究者实际面对的是四种获取路径的抉择:
| 你的需求 | 推荐路径 | 交付形态 | 理由 |
|---|---|---|---|
| 立项前估算可行样本量 | Record Counter | 近似计数(无需 IRB) | 官方明示结果为非精确的高层评估,仅用于可行性判断 |
| 病例对照研究/表型算法 | SD Discover | 按条件筛选的去标识患者记录 | 需 DUA + IRB,返回真实记录而非计数 |
| 复杂多表关联/大队列定制提取 | IDASC 定制服务 | 程序员交付的定制数据集($90/小时起) | 自助工具覆盖不了跨源链接与时序查询 |
| 基因型/WGS 分析 | BioVU 提案 → 审查委员会 | PLINK/VCF/BAM/CRAM + SD 表型文件 | 基因组与表型捆绑交付,dbGaP 受控共享衍生数据 |
§3.1 模态详情
EHR(SD):SD 是 VUMC 生产 EHR 的连续去标识镜像,滚动刷新,含诊断与操作计费编码(ICD-9/ICD-10、CPT)、人口学与生命体征、实验室值与参考范围、用药医嘱(RxNorm 映射)、临床文档(出院小结、病史体检、手术记录、病程记录、会诊信件)、病理/心电图/超声心动报告、家族史与肿瘤登记(Tumor Registry)。外部机构记录不包含在内——这是跨机构研究的重要边界。
DNA/基因组(BioVU):DNA 提取自常规临床检验后拟丢弃的剩余血样(检验后保留 3 天再处理),与 SD 记录经研究 ID 硬链接。基因分型横跨多个 Illumina 平台(Infinium HumanExome BeadChip、HumanOmni5-Quad、Human1M、MEGAEX),2025 年 3 月起 250,000 份样本具备全基因组测序数据。衍生数据经机构认证提交 dbGaP 受控共享(DUL 修饰符 COL/NPU/GSO)。
SD 内 EHR 内容域明细(按官方与培训材料描述的内容清单):
| 内容域 | 编码/表示 | AI 典型用途 | 边界注意 |
|---|---|---|---|
| 诊断编码 | ICD-9 / ICD-10 | 表型标签主信号 | 双版本混杂(坑点 2) |
| 操作/手术编码 | CPT | 干预暴露定义 | 计费口径而非手术细节 |
| 用药医嘱 | RxNorm 映射 | 暴露定义、药物安全 | 起止日期经同一日期偏移 |
| 化验值 | LOINC + 值/单位/参考范围 | 连续结局、LabWAS | 单位/参考范围漂移(坑点 5) |
| 生命体征 | 结构化数值 | 时序特征 | 记录密度随就诊场景变化 |
| 临床文档 | 出院小结、H&P、手术记录、病程、会诊信件(脱敏文本) | 临床 NLP | De-ID 清洗可能过度/不足(坑点 8) |
| 报告文本 | 病理、ECG、超声心动 | 影像/电生理代理表型 | 仅报告文本,无 DICOM/波形 |
| 家族史、肿瘤登记 | 结构化 + 文本 | 风险特征、肿瘤队列 | 覆盖与录入完整性不均 |
外部机构记录不包含在内——这是跨机构研究的重要边界。
§3.2 子集样本数表
| 子集 | 规模 | 核实时点 | 来源 |
|---|---|---|---|
| BioVU DNA 样本总量 | >343,000 份 | 2024 年中 | VUMC personalized medicine 官方页 |
| — 儿科样本 | >23,280 份(2014 时点),2010 年启动 | 2014-06 | RecordCounter 培训材料 |
| — 完成 WGS | 250,000 份 | 2025-03 | VUMC 官方页 |
| SD 覆盖患者总数 | >3,600,000 人 | 2024 | tic disorders 队列论文 |
| — 详细纵向数据 | 约 1,000,000 人 | 2014-06 | RecordCounter 培训材料 |
| 基因分型可用(早期统计) | >60,000 人(其中 GWAS 芯片 >13,000) | 2014-06 | RecordCounter 培训材料 |
| 知识共享层 | ~18,000 个 ICD-9 码 → ~1,800 个 Phecode(v1.2) | 持续 | Phecode 映射官方说明 |
§3.2b BioVU 规模增长时间线(多时点核实值)
| 时点 | BioVU DNA 样本 | 周采集速率 | 来源 |
|---|---|---|---|
| 2007-02 | 首批样本(成人) | — | VUMC DBMI 官方页 |
| 2008 | — | 700–900 份 | Roden 2008 |
| 2012 中 | >150,000 份(儿科 >16,000) | 600–800 份 | VUMC DBMI 官方页 |
| 2014-06 | 212,059 份(成人 168,014 + 儿科 23,280) | — | RecordCounter 培训材料 |
| 2015-01 | >193,000 患者(成人 169,659 + 儿童 23,516) | — | Vanderbilt Reporter |
| 2022-01 | >275,000 份 | 500–1,000 份 | Trends in Pharmacological Sciences 综述 |
| 2024 中 | >343,000 份 | — | VUMC Personalized Medicine 官方页 |
| 2025-03 | 其中 250,000 份完成 WGS | — | VUMC 官方页(Illumina + 9 药企联盟) |
注意"样本"与"患者"口径不同(同一患者可有多个时间点样本),跨来源数字混用口径时会有表观不一致(如 2014-06 的 212,059 样本与 2015-01 的 193,000 患者);引用时务必标明口径。
§3.3 数据格式表
| 数据类型 | 格式 | 说明 |
|---|---|---|
| 定制表型提取 | CSV | 由 SD Discover/IDASC 交付,字段按提案定义 |
| 基因分型(芯片) | PLINK 二进制(bed/bim/fam) | 常规 GWAS 工作流 |
| 测序原始数据 | FASTQ → BAM/CRAM | WGS 数据(250,000 份,2025-03 完成) |
| 变异调用 | VCF | 单样本/队列级 |
| 编码体系 | ICD-9/ICD-10、CPT、RxNorm、LOINC、SNOMED | OMOP CDM 互操作层 |
§3.4 存储大小
SD/BioVU 不提供整包下载,无公开总大小。可参考的量级指标:2014 年测算 SD 记录平均约 100 KB/条,按当时 230 万条记录计约数百 TB 级(含文档文本);2025 年完成的 250,000 份 WGS(30× 量级 FASTQ/CRAM)另需 PB 级存储。研究实际拿到的是定制提取包,通常为 MB–GB 级 CSV 与相应基因组文件——基础设施的庞大与交付物的轻量并存,这是"定制提取"类数据集区别于整包下载数据集的本质特征。
§3.5 标注方式
全部"标签"由算法在 SD 内生成,属弱监督:计费编码规则(如 ≥2 个不同日期的 Phecode)、NLP 抽取(临床文本中的疾病证据)、实验室规则(如 ANA 滴度阈值)三种信号组合,形成 Phecode 或研究专用表型。PheKB 平台沉淀了多站点验证过的算法及其 PPV/灵敏度,是选择标签定义时的第一参考。
| 信号类型 | 典型规则 | 强项 | 弱项 |
|---|---|---|---|
| 计费编码规则 | ≥2 个不同日期的同一 Phecode | 覆盖面大、可复现 | 编码噪声;单码定 case 有偏 |
| NLP 文本抽取 | 从出院小结/手术报告抽取疾病证据 | 捕捉编码未反映的临床细节 | 依赖文档存量;De-ID 后文本有截断 |
| 实验室规则 | 阈值/滴度判据(如 ANA ≥1:160) | 客观、可量化 | 检验按指征开具,缺失信息性强 |
三信号叠加是 eMERGE/PheKB 系算法的标准配方:编码提供召回、文本与化验提供精确度,二者按 PPV 目标权衡。
§3.6 标注者资质与一致性
表型算法定义由临床信息学研究者与专科医师联合制定;抽样人工复核由专科医师执行(如 SLE 研究中风湿科医师复核自身抗体状态,双评者)。没有跨全队列的标注者间一致性统计——算法标签的一致性以"规则可复现"保证,误差来源是编码实践而非人评差异,这一点与人工标注数据集有本质区别。
§3.7 采集周期
SD:连续镜像生产 EHR,滚动刷新(研究数据仓库 Research Derivative 版本通常落后现实约 4 周)。BioVU:2007-02 起持续采血,2008 年周采集 700–900 份,2012 年 600–800 份,2022 年 500–1,000 份;儿科 2010 年并入。数据更新是常态而非版本事件——同一提案两次提取可能得到不同快照,复现研究须记录提取日期。
周速率的波动不是管理失败而是流程使然:样本供给取决于"当周有检验就诊且未退出"的患者流量,与 VUMC 门诊量联动。做增长外推时按 500–1,000 区间下限保守估计,不要用峰值速率承诺样本量。
§3.8 地域覆盖
以田纳西州中南部为核心:Davidson、Montgomery、Rutherford、Williamson 四县,延伸至南肯塔基与北阿拉巴马。Davidson County 约 26% 居民在库。单一都会区+腹地结构意味着人群同质性强、环境暴露相对一致——利于遗传学研究控制混杂,但不利于地理泛化。
对建模的实操含义:地理并不是一个"特征"——库内没有市级以下地理标识(属于潜在准标识符),所有地域效应只能以"机构层常量"存在。任何声称学到"地域差异"的模型实际学到的是就医行为差异,解读时应直接改写措辞。
§3.9 设备与系统规格
实验室结果来自 VUMC 检验系统(LOINC 编码);心电图由 TraceMaster 系统存储并生成报告文本;影像为报告文本(病理、超声心动)而非原始 DICOM。EHR 生产系统自 1994 年演进,跨代系统迁移造成的编码与单位漂移是分析时必须显式处理的工程事实(见坑点 5)。
对设备类 AI 任务(波形分类、影像重建)这意味着一票否决:本库的"设备数据"只以报告文本存在——报告的价值在于支持表型定义(如 NLP 读 ECG 报告构造心律队列),而非支撑信号级建模。需要原始信号的任务请直接转到 MIMIC-IV 等波形开放资源,不要在本库上浪费申请周期。
§3.10 深度溯源链
每条记录的溯源路径:生产 EHR 事件 → SD 镜像(哈希 ID + 日期偏移 + 文本清洗)→ 研究提案定制提取(提案编号在 REDCap 跟踪)→ 分析数据集。BioVU 样本溯源:临床采血 → 检验后保留 3 天 → DNA 提取 → SHA-512 研究 ID 分配 → 基因分型/WGS → dbGaP 机构认证提交。官方页确认 SD/BioVU 的申请、修订与 DUA 全部经 REDCap 数据库跟踪,全检索与导出有审计日志。
§3.11 获取成本、资格与流程限制
| 维度 | 规则 | 来源 |
|---|---|---|
| PI 资格 | 必须 Vanderbilt/VUMC 全职教员;外部研究者只能以合作方式参与 | VUMC 官方描述 |
| Record Counter | 仅返回计数,无需 IRB;结果为近似高层评估(非精确) | VICTR 数据资源页 |
| SD Discover | 需 DUA + IRB,返回真实去标识记录 | VICTR 数据资源页 |
| IDASC 定制提取 | 按小时计费,$90/小时起(fee-for-service) | IDASC 服务页 |
| BioVU 提案 | 提案 → BioVU Review Committee 批准 → 签署 user agreement | VUMC DBMI 官方页 |
| 再识别禁令 | 须书面承诺不试图再识别;发现潜在再识别信息必须主动报告 | Vanderbilt News |
| 流程跟踪 | 申请、修订与 DUA 全程 REDCap 跟踪;全部检索与导出有审计日志 | 官方页 + 培训材料 |
| 数据快照 | 滚动更新无版本号;Research Derivative 落后现实约 4 周 | 培训材料 |
§4 数据结构
§4.0 目录树
SD/BioVU 无标准公开目录结构——每位研究者的提取包按提案定制。以下是一次典型"表型+基因型"联合研究的交付形态示意(字段名按通用命名示意,实际以提取协议为准):
vanderbilt_extract/ # 提案定制交付根目录
├── README_delivery.txt # 提取日期、提案编号、DUA 条款
├── demographics/
│ ├── patient_demographics.csv # research_id, gender, race, shifted_birth_year
│ └── encounter_summary.csv # research_id, encounter_type, shifted_dates
├── diagnoses/
│ ├── diagnosis_icd_all.csv # research_id, icd_code, icd_version(9/10), shifted_date
│ └── phecode_mapping_v1.2.csv # icd9_code → phecode(公共映射,phewascatalog.org)
├── medications/
│ └── medication_rxnorm.csv # research_id, rxnorm_code, shifted_start/end
├── labs/
│ └── lab_results_loinc.csv # research_id, loinc, value, unit, ref_range, shifted_date
├── notes/
│ └── clinical_notes_deid.csv # research_id, note_type, shifted_date, deid_text
├── cpt_procedures/
│ └── procedures_cpt.csv # research_id, cpt_code, shifted_date
└── genotype/
├── biovu_gwas.plink.bed/.bim/.fam # 芯片基因分型(PLINK 二进制)
├── biovu_wgs.vcf.gz # WGS 变异调用(如项目含测序)
└── genotype_platform_map.csv # research_id → genotyping_platform
目录树的三点使用说明:①每个子目录对应 SD 的一个内容域,跨目录靠 research_id 键连接(见 §4.6);②phecode_mapping_v1.2.csv 不是 VUMC 交付物而是公共映射文件(phewascatalog.org),放这里仅为提示工作流位置;③基因组目录只在你申请了 BioVU 基因型/WGS 时出现——纯 EHR 提案的交付包没有 genotype/ 层。
§4.1 DAIMS 字段字典
核心字段(8 列:字段/类型/说明/示例值/AI 用途/观测误差/信息性缺失编码/取值范围):
| 字段 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失 | 取值范围 |
|---|---|---|---|---|---|---|---|
| research_id | Text | SHA-512 单向哈希生成的 128 字符研究 ID | a9f3…(128 位十六进制) | 主键;跨表/跨模态链接 | 理论上不可逆;无法回溯 MRN | 无 | 每患者唯一 |
| shifted_birth_year | Integer | 经日期偏移机制的出生年份 | 1963 | 年龄分层/风险调整 | 患者内恒定偏移使具体生日失真 | 无 | 1900–至今 |
| gender | Text | 行政登记性别 | F | 分层/公平性评估 | 行政录入可能与身份表达不一致 | 空值=未录入 | M/F/其他/空 |
| race | Text | 种族(自报+行政混合来源) | White | 祖先分层/公平性 | 与基因推断的 ancestry 可能不一致 | Unknown | 分类目录 |
| icd_code + icd_version | Text+Int | 诊断编码及版本 | 250.00 (ICD-9) / E11.9 (ICD-10) | 表型标签主信号 | 编码实践偏倚;2015-10 版本切换断裂 | 无 | ICD-9/ICD-10 全集 |
| phecode | Text | Phecode 分组表型(v1.2 映射) | 371.1(高血压) | PheWAS/标签降维 | ~18,000 ICD-9 码折叠为 ~1,800 组的粒度损失 | 555(Unknown) | Phecode v1.2 |
| lab_value + unit | Float+Text | LOINC 化验结果与单位 | 7.2 mmol/L | 连续结局/时序特征 | 单位与参考范围随时间/仪器漂移 | 空值=未测 | 按检验项 |
| rxnorm_code | Text | RxNorm 标准化药物编码 | 856983(metformin) | 暴露定义/药物安全 | 商品名→通用名映射误差 | 无 | RxNorm 全集 |
| encounter_type | Text | 就诊类型(门诊/住院/急诊) | outpatient | 场景分层/密度建模 | 类型口径随 EHR 代际演进 | 空值=未标注 | 机构目录 |
| shifted_start / shifted_end | Date | 用药起止日期(同一偏移常数) | 2015-03-12 → 2015-06-27 | 暴露时长/用药依从 | 与诊断日期共享偏移,间隔可算 | 空值=持续用药未知 | 患者内有序 |
| note_type | Text | 临床文档类型 | discharge summary | NLP 分域处理 | 文档类型覆盖不均 | 空值=无文档 | 机构文档目录 |
| deid_text | Text | PHI 清洗后的临床笔记全文 | “…pt with hx of…[延误信息已删]” | 临床 NLP/标签深化 | De-ID 软件可能过度/不足清洗 | 空值=无文档 | 自由文本 |
| genotyping_platform | Text | BioVU 基因分型芯片平台 | MEGAEX | 批次效应校正 | 多平台混合造成 allele 编码差异 | 无 | HumanExome/Omni5/Human1M/MEGAEX |
| shifted_service_date | Date | 偏移后的服务日期 | 2015-03-12 | 时序建模/间隔计算 | 绝对日历意义被 0–364 天后移破坏 | 无 | 患者内有序 |
§4.2 标签分布
以 BioVU 早期 16,102 个样本为参考(Roden 2008):高血压 15.7%、2 型糖尿病 11.8%、高脂血症 11.5%、冠心病 7.8%、贫血 5.9%。注意这些是"至少一次该编码"的出现率,非患病率;Phecode 化后每种表型的病例数取决于"≥2 个不同日期"等规则。研究者应以 Record Counter 或 SD Discover 实测目标表型的当下计数(近似/精确两档)。
§4.3 关键统计
| 统计项 | 数值 | 时点/来源 |
|---|---|---|
| 平均 ICD-9 编码数/记录 | 14 ± 18 | Roden 2008(首批 16,102 样本) |
| 平均病史年数 | 6.5 ± 6.2 | Roden 2008 |
| 含住院记录比例 | 55% | Roden 2008 |
| 至少一种用药比例 / 平均用药数 | 88% / 8.0 ± 6.8 | Roden 2008 |
| 含操作编码比例 | 69% | Roden 2008 |
| 平均记录大小 | ~100 KB | 2014 年 RecordCounter 材料 |
| 平均编码数/记录 | ~27 | 2014 年 RecordCounter 材料 |
两组统计的对比揭示了体系的成长:Roden 2008 首批样本平均 14±18 个 ICD-9 码、6.5±6.2 年病史,而 2014 年材料给出的平均编码数已达 ~27——十年间 SD 的纵向深度接近翻倍。这对 AI 的含义是"队列代际效应":早期样本与近期样本的记录密度、编码粒度系统性不同,任何跨 2008–2024 全期建模都要检查"入组时间"作为协变量或分层因素。
§4.4 数据层级
患者(research_id,哈希唯一)
└─ 就诊/ encounter(门诊/住院/急诊,日期经患者内恒定偏移)
├─ 诊断编码(ICD-9/ICD-10 → Phecode)
├─ 操作编码(CPT)
├─ 用药(RxNorm,起止日期)
├─ 检验(LOINC,值/单位/参考范围)
├─ 文档(出院小结/手术记录/病程,脱敏文本)
└─ 报告(病理/ECG/超声心动文本)
└─ 生物样本(BioVU:DNA,1 患者 1+ 样本)
└─ 基因型/WGS(PLINK/VCF,平台标注)
层级要点:患者→样本可为一对多(同一患者的连续采血产生多个时间点样本);基因组数据挂在样本层而非就诊层;所有时间维度共享同一个患者内偏移常数,因此"间隔"跨层级一致可算。
§4.5 缺失值与信息性缺失
| 模式 | 表现 | 对 AI 的含义 | 处理建议 |
|---|---|---|---|
| 未就诊即未记录 | 无该疾病的编码 ≠ 无该疾病 | EHR 负标签不可靠,控制组需 medical home 定义 | 控制组要求 ≥5 编码跨 3 天/3 年(或 3 次门诊/5 年) |
| 检验按临床指征开具 | 化验值结构化缺失 | 缺失与疾病状态相关(信息性缺失) | 显式建模缺失指示变量;避免均值插补 |
| 文档缺失 | 部分记录无自由文本 | NLP 表型覆盖不均 | 算法需兼容"仅编码"路径 |
| 编码版本断裂 | 2015-10 后 ICD-9 停用 | 跨版本表型定义须双向映射 | 统一到 Phecode/OMOP 概念层 |
| race=Unknown / 行政错录 | 少量 | 公平性评估的测量噪声 | 用基因推断 ancestry 交叉校验 |
| 基因组覆盖不均 | 343,000 份 DNA 中仅部分有芯片分型,250,000 份有 WGS(2025-03) | EHR+基因组联合分析的可用样本远小于 EHR 全库 | 建模前先取 EHR∩基因组交集并记录交集时点 |
| 外部机构记录缺失 | 外院就诊完全不在 SD 内 | 纵向事件流不完整,终点事件可能漏采 | 结局定义限定 VUMC 内事件并在论文中明示 |
共同规律:本库的缺失几乎都不是"随机缺"——缺失概率与就诊行为、检验指征、平台批次强相关。插补永远应是最后手段,首选是把"缺失指示"当作特征并在论文里报告缺失机制的假设。
§4.6 跨模态链接与 ID 一致性
SD(EHR)与 BioVU(DNA/基因组)能成为"世界最大单机构 EHR+DNA 资源"的关键,是一套贯穿全体系的标识与链接设计:
生产 EHR(MRN + 真实日期)
│ SHA-512 单向哈希(盐控、不可逆)
▼
research_id(128 字符十六进制,患者级唯一)
│
├── SD 全部内容域(诊断/操作/用药/检验/文档/报告)——每行携带 research_id + shifted_date
└── BioVU 样本层(1 患者 1+ 份 DNA)——样本接受时分配 research_id
└── 基因组产物(PLINK fam / VCF 样本列)——与 research_id 同名链接
链接工程的三条纪律:①键唯一且患者级恒定——同一患者在 SD 与 BioVU 中的 research_id 完全一致,跨表 join 无需模糊匹配;②时间层共享同一偏移常数——患者内所有日期(诊断、用药、检验、文档)后移同一 0–364 天值,因此跨表时间间隔计算无损;③基因组样本列名即 research_id——PLINK/VCF 层与表型文件可以直接键连接,但连接前必须校验平台 QC 报告中的样本剔除清单,避免把 QC 剔除样本带入关联分析。
§5 数据划分与使用建议
§5.1 官方划分
不存在官方 train/val/test 划分——SD/BioVU 是研究基础设施而非基准数据集,每位研究者按提案提取自己的队列。dbGaP 上经机构认证的衍生数据集按研究项目隔离,同样不构成通用划分。这意味着"划分"是研究者的工程责任:数据一到,先按 research_id 定组长,再谈任何模型。
§5.2 社区惯例划分
社区惯例由任务决定:EHR 遗传学(GWAS/PheWAS)通常不用"划分"而用全样本关联+独立队列复现(如 MGB Biobank、eMERGE 其他节点做外部复现);预测建模任务则按患者划分(70/15/15 或 5 折 CV),并强制按 research_id 分组——同一患者的所有就诊行必须落在同一侧。
§5.3 划分策略与泄漏风险
患者级泄漏是本数据集的头号泄漏源:一个 research_id 在定制提取中可产生数百行诊断、上千行检验,随机按行划分会让同一患者同时出现在训练与测试集,指标虚高常见 10–20 个百分点。第二泄漏源是时间前视:用全期数据统计标准化参数(如化验单位归一的均值方差)会把未来信息泄入历史样本,正确做法是按患者首诊时间切分时间折叠。第三是表型算法定义泄漏:如果标签算法本身用了某实验室值,就不能再把同一值作为该表型预测模型的特征。第四是亲缘泄漏:BioVU 含生物学亲属,遗传模型中训练/测试集间的亲缘关系会高估多基因评分的可迁移性,需按 IBD 估计值或家系结构分组。
§5.4 交叉验证建议
推荐嵌套结构:外层按 research_id 分组 5 折;若有基因组任务,内层在训练折内再做 ancestry 分层抽样,保证欧洲/非裔祖先样本比例稳定;所有预处理参数(单位归一、参考范围映射、词典/词向量)只在外层训练折内拟合。时间敏感任务用前向时间折叠(按偏移后日期排序的患者首诊时间)。
§5.5 外部验证建议
单中心数据的结论必须外部验证:优先选择 MGB Biobank(同为 EHR+DNA、LabWAS 已有复现先例)、eMERGE 其他节点(表型算法多站点验证)、或 OMOP 格式兼容的 OHDSI 网络站点。跨站点验证时注意 ICD 编码实践差异会改变同一 Phecode 的 PPV——先复验证表型算法(PPV/灵敏度),再复验证模型。
§5.6 划分反模式速查表
| 反模式 | 发生方式 | 后果 | 正确替代 |
|---|---|---|---|
| 按行随机划分 | 把诊断/检验长表直接 train_test_split | 同一患者跨训练/测试,AUROC 虚高 10–20 个百分点 | GroupShuffleSplit/GroupKFold(按 research_id) |
| 按就诊划分 | 以 encounter 为切分单位 | 同一患者的多次就诊仍跨侧 | 切分单位必须是患者而非就诊 |
| 全期参数标准化 | 用全数据均值/方差归一化验值 | 未来信息泄入历史样本 | 参数只在训练折内拟合(时间折叠) |
| 标签信号复用为特征 | 表型算法用了某化验值又作模型特征 | 表现"好得不可信"的自证模型 | 标签定义信号与特征集显式互斥 |
| 无视亲缘结构 | 遗传任务随机划分 | IBD 亲缘跨侧,PRS 泛化性被高估 | 家系/IBD 分组划分 |
| 拿单次编码定标签 | 病例=仅 1 次目标编码 | 编码噪声(漏诊编码/规则编码)混入标签 | ≥2 个不同日期编码;仅 1 次者剔除 |
§6 AI 就绪指南
§6.0 云端快速启动
SD/BioVU 不提供云沙箱或公开容器。获批项目在 VUMC 内网环境使用 Record Counter(近似计数)与 SD Discover(记录提取);外部合作者通过 VUMC 教员牵头的数据协议获得交付包。公开可用的替代分析环境:PheWAS R 包(CRAN/GitHub)、Phecode 映射文件(phewascatalog.org)、PheKB 算法库——这些可在任何环境先行搭建分析骨架,拿到数据后即插即用。
§6.1 快速上手
以下代码假设你已获得定制提取包,目录结构符合 §4.0 所示:提取包根目录为 data_root,其中 diagnoses/、labs/、medications/ 为提案交付的 CSV;最小可用子集是 diagnosis_icd_all.csv(单文件即可做 Phecode 表型统计)。data_root 拼接关系:所有路径相对根目录,字段名以交付 README 为准(下方用通用命名示意)。
# 环境准备:pandas >= 2.0, numpy
# 目录结构预期(与 §4.0 目录树一致):
# data_root/
# ├── diagnoses/diagnosis_icd_all.csv # research_id, icd_code, icd_version, shifted_date
# └── labs/lab_results_loinc.csv # research_id, loinc, value, unit, ref_range, shifted_date
# 最小可用子集: diagnoses/diagnosis_icd_all.csv 单文件即可完成 Phecode 计数统计
import pandas as pd
data_root = "vanderbilt_extract"
# 1) 读入诊断编码(ICD-9 与 ICD-10 同表,icd_version 列区分)
dx = pd.read_csv(f"{data_root}/diagnoses/diagnosis_icd_all.csv",
dtype={"icd_code": str, "icd_version": int})
# 2) 关键第一步:显式确认编码版本构成,双版本混杂是本数据集第一大坑
print(dx["icd_version"].value_counts()) # 必查:9/10 各占多少
print(dx["shifted_date"].min(), dx["shifted_date"].max()) # 提取快照时间窗
# 3) 病例定义示例:≥2 个不同日期的 ICD-10 E11.9(2 型糖尿病)
dx["shifted_date"] = pd.to_datetime(dx["shifted_date"])
t2dm = dx[(dx["icd_code"].str.startswith("E11")) & (dx["icd_version"] == 10)]
cases = t2dm.groupby("research_id")["shifted_date"].nunique()
cases = cases[cases >= 2].index
print(f"T2DM algorithmic cases: {len(cases):,}")
§6.2 数据获取流程
SD/BioVU 是"申请审核"级资源,没有下载页面。完整流程(依据 VUMC 官方页与 VICTR 文档):
| 步骤 | 动作 | 主体 | 说明 |
|---|---|---|---|
| 1 | 用 Record Counter 估算样本量 | 任意 VUNET 账号 | 无需 IRB,结果为近似计数 |
| 2 | 撰写研究提案 | VUMC 全职教员(PI) | 外部研究者须通过 VUMC PI 合作 |
| 3 | 提交 IRB 审查(非人类受试者认定或豁免) | VUMC IRB | 仅用 SD 的协议通常按非人类受试者处理 |
| 4 | 签署数据使用协议(DUA) | 机构 | 承诺不再识别、报告再识别发现 |
| 5 | BioVU 审查委员会批准(仅基因组) | 委员会 | 提案/修订/DUA 经 REDCap 跟踪 |
| 6 | SD Discover 自助提取或 IDASC 定制($90/小时起) | 研究者 | 交付 CSV/PLINK/VCF 定制包 |
# 申请材料 checklist(组织为字典便于团队协作核对)
application = {
"pi": "Vanderbilt full-time faculty (required)",
"proposal": "study aims, cohort definition, phenotype algorithm citation (PheKB link)",
"irb": "non-human-subjects determination or approval number",
"dua": "no re-identification clause; incident reporting obligation",
"biovu_committee": "required only for DNA/genotype requests",
"tracking": "proposal + amendments logged in REDCap by VUMC",
}
§6.3 预处理全流程
四阶段:格式转换(CSV → 分析就绪 DataFrame/矩阵)→ 清洗(单位/参考范围漂移、编码版本统一)→ 标准化(Phecode/OMOP 概念层对齐、ancestry 推断)→ 样本构建(病例/对照定义、患者级聚合)。
# 阶段 1+2:化验值清洗——处理单位与参考范围漂移(坑点 5 的代码化)
import numpy as np
labs = pd.read_csv(f"{data_root}/labs/lab_results_loinc.csv",
dtype={"loinc": str, "unit": str})
# 每种 LOINC 的单位历史可能有多种(系统/仪器迁移所致)
unit_counts = labs.groupby("loinc")["unit"].nunique()
multi_unit = unit_counts[unit_counts > 1]
print(f"{len(multi_unit)} LOINC tests have multiple units over time")
def normalize_loinc(df: pd.DataFrame, loinc: str,
target_unit: str, conv: float) -> pd.DataFrame:
"""将某检验项所有观测统一到目标单位。
conv: 原单位 -> 目标单位的换算系数(需人工从 LOINC/机构文档核实)。"""
sub = df[df["loinc"] == loinc].copy()
mask = sub["unit"] != target_unit
sub.loc[mask, "value"] = sub.loc[mask, "value"] * conv
sub.loc[mask, "unit"] = target_unit
return sub
# 例:葡萄糖 mg/dL -> mmol/L(系数 0.0555),实际换算须按机构文档核实
glucose = normalize_loinc(labs, "2345-7", "mmol/L", 0.0555)
# 阶段 3:诊断编码统一到 Phecode 层(使用公共映射 phewascatalog.org v1.2)
# 映射文件覆盖 ICD-9;ICD-10 需先经 GEM/机构映射回 ICD-9 或用 Phecode v1.2b 的 ICD-10 扩展
phe = pd.read_csv("phecode_mapping_v1.2.csv", dtype=str) # icd9_code, phecode
dx9 = dx[dx["icd_version"] == 9].merge(phe, left_on="icd_code",
right_on="icd9_code", how="inner")
# 阶段 4:患者级 Phecode 矩阵(≥2 个不同日期才算病例——官方 PheWAS 规则)
def phecode_matrix(dx_with_phe: pd.DataFrame) -> pd.DataFrame:
d = dx_with_phe.dropna(subset=["phecode"])
multi = d.groupby(["research_id", "phecode"])["shifted_date"].nunique().reset_index()
multi = multi[multi["shifted_date"] >= 2]
mat = (multi.assign(v=1)
.pivot(index="research_id", columns="phecode", values="v")
.fillna(0).astype(int))
return mat
X_phe = phecode_matrix(dx9)
print(f"Phecode matrix: {X_phe.shape[0]:,} patients × {X_phe.shape[1]:,} phenotypes")
§6.4 PyTorch DataLoader
患者级纵向序列 + 多 Phecode 标签的多任务 Dataset。输入为 §6.3 构建的患者聚合表(每患者一个事件序列 + Phecode 标签向量)。
import torch
from torch.utils.data import Dataset, DataLoader
class EHRPatientDataset(Dataset):
"""患者级 EHR 序列数据集。
events: dict research_id -> list of (days_since_offset_origin, code_index)
日期间隔用偏移后日期差计算(患者内间隔保真,见坑点 1)。
labels: dict research_id -> np.ndarray (n_phecodes,) 0/1 向量(≥2 日期规则)
"""
def __init__(self, events: dict, labels: dict, max_len: int = 256):
self.ids = list(events.keys())
self.events, self.labels, self.max_len = events, labels, max_len
def __len__(self):
return len(self.ids)
def __getitem__(self, idx):
rid = self.ids[idx]
seq = torch.tensor(self.events[rid][: self.max_len], dtype=torch.long)
pad = torch.zeros(self.max_len, dtype=torch.long)
pad[: seq.size(0)] = seq
attn = (torch.arange(self.max_len) < seq.size(0)).long()
y = torch.tensor(self.labels[rid], dtype=torch.float)
return pad, attn, y
# 构造示例(实际来自 §6.3 的患者聚合结果)
events = {"p1": [(0, 15), (34, 210), (400, 77)], "p2": [(0, 3), (12, 900)]}
labels = {"p1": np.array([1, 0, 1]), "p2": np.array([0, 1, 0])}
ds = EHRPatientDataset(events, labels, max_len=256)
# 患者级分组划分:DataLoader 之前必须完成按 research_id 的分组切分(坑点 7)
gss = torch.Generator().manual_seed(42)
n_val = max(1, len(ds) // 5)
train_ids = list(range(len(ds) - n_val))
val_ids = list(range(len(ds) - n_val, len(ds)))
train_loader = DataLoader(torch.utils.data.Subset(ds, train_ids),
batch_size=32, shuffle=True, num_workers=2)
val_loader = DataLoader(torch.utils.data.Subset(ds, val_ids),
batch_size=64, shuffle=False)
for pad, attn, y in train_loader:
break # 形状: [32, 256], [32, 256], [32, n_phecodes]
§6.5 坑点 8 个(本数据集真实特有失败模式)
⚠️ 坑点 1:日期偏移摧毁绝对时间,季节性/疫情特征全部失真(分类:预处理陷阱)
问题:SD 对每个患者的所有服务日期按确定性规则整体后移 0–364 天(患者内恒定、跨记录不同)。任何依赖绝对日历时间的特征——月份、季节、星期、疫情时点、灾难日期——都被系统性破坏。
症状:用月份做特征时模型"学"到的季节模式实为 0–364 天随机相位叠加的噪声;跨患者比较"同一天"的检验值分布毫无意义;疫情期入院率分析得到平缓曲线。官方培训材料明确列出 SD 不能支持季节性研究与疫情/灾难时点研究。
解决:
- 简单方法:只使用患者内相对时间(治疗开始后天数、就诊间隔、事件序列顺序),删除所有日历时间特征。
- 进阶方法:用"相对入组日"重构时间轴——以每患者首次事件为原点(offset origin),所有特征表达为 days_since_origin,序列模型输入保持单调且间隔保真(偏移是患者内常数,间隔不被破坏)。
- SOTA 方法:如确需真实季节性,向 VUMC 申请在受控环境下将偏移量作为加密元数据返回(需 IRB/DUA 特批);或将季节暴露作为外部协变量按地理区域聚合后链接(如县级流感活动度时间序列),规避个体级绝对日期。
参考:Roden et al., Clin Pharmacol Ther 2008. doi:10.1038/clpt.2008.89;RecordCounter 培训材料(studylib.net/doc/9891470)明列 SD 三大不支持场景。
⚠️ 坑点 2:ICD-9/ICD-10 双版本混杂与 Phecode 映射断点(分类:标签理解)
问题:SD 原生同时携带 ICD-9 与 ICD-10 计费编码,2015 年 10 月美国 ICD-10 过渡造成同一疾病在版本两侧的编码断裂;官方 Phecode v1.2 映射只覆盖 ICD-9(约 18,000 码折叠为约 1,800 个 Phecode),直接把两版编码混入标签会引入系统性断点。
症状:以"原始编码前缀"定义病例时,2015-10 之后同一疾病病例数骤降/骤升;跨 2015 年的时间折叠中标签流行率出现阶跃;PheWAS 中某些 Phecode 的信号完全由过渡期前或后的样本驱动。
解决:
- 简单方法:全部分析前按
icd_version列拆分,任何标签定义必须给出两个版本的显式编码列表。- 进阶方法:ICD-10 先经 CMS General Equivalence Mappings(GEM)或机构映射回 ICD-9,再走 Phecode v1.2;或使用社区维护的 Phecode ICD-10 扩展映射(PheWAS R 包内置映射表可查)。
- SOTA 方法:在 OMOP CDM 概念层统一(SNOMED/OMOP concept_id),用 OHDSI 的 Phenotype Library 定义可跨版本复用的表型;报告时对过渡期(2015 前后各 1 年)做敏感性分析。
参考:Denny et al., Bioinformatics 2010. doi:10.1093/bioinformatics/btq126;Carroll et al., Bioinformatics 2014. doi:10.1093/bioinformatics/btu197(R PheWAS 包)。
⚠️ 坑点 3:记录密度不均,对照组定义决定结论成败(分类:偏倚陷阱)
问题:EHR 中"没有某诊断"不等于"没有该疾病"——就诊少的人编码天然少。若无对照组定义规则,病例(就诊多、编码多)与对照(就诊少)在记录密度上系统不同,任何 PheWAS/预测模型都会把"就医强度"当成疾病信号。
症状:几乎所有 Phecode 都与暴露"显著"关联(系统性假阳性);对照组成员平均编码数远低于病例组;结果在加入"医疗利用量"协变量后大面积塌缩。
解决:
- 简单方法:控制组要求最低记录密度——社区惯例为"≥5 个诊断编码分布在 ≥3 个不同日期、跨越 ≥3 年"(medical home 规则)或"5 年内 ≥3 次门诊"。
- 进阶方法:匹配设计——对照按年龄、性别、race 与就诊频次 1:5 匹配(SLE PheWAS 采用的做法);对仅出现 1 次目标编码的个体剔除(可能是编码错误或疑似排除)。
- SOTA 方法:PheRS 表型风险分数——跨多个 Phecode 聚合相似性做诊断无关的对照富集,缓解单表型编码偏倚;报告时展示编码数分布的诊断-对照对比图以自证无密度混杂。
参考:tic disorders PheRS 论文, PMC11284231(2024);SLE PheWAS, PMC6389392(2018)。
⚠️ 坑点 4:计费编码的机构偏倚与被污名化诊断的编码不足(分类:标签理解)
问题:诊断编码反映"被记录的临床判断+计费实践",不是客观诊断。机构编码习惯、医生风格、科室差异都会改变编码频率;历史上被污名化的疾病(精神科诊断、物质使用)编码系统性偏低,三级转诊中心则富集重症复杂病例。
症状:同一算法在不同科室/医生的患者亚群中 PPV 漂移;精神共病率显著低于文献值;转诊重症富集表现为首诊即合并症比例异常(抽动障碍病例中 47% 首个诊断即精神/神经共病,对照仅 7%)。
解决:
- 简单方法:标签定义用"编码 + 独立证据"双通道(如 SLE:编码次数 + ANA 滴度),并在 PheKB 查阅已验证算法的 PPV。
- 进阶方法:NLP 深化——在脱敏文本中抽取疾病证据补足编码不足;对关键亚组抽样人工复核并报告 PPV/灵敏度。
- SOTA 方法:多站点复现(eMERGE/MGB)检验编码实践敏感性;用 PheRS 跨表型信号替代单编码定义;对已污名化表型显式讨论漏报方向并在结论中限定范围。
参考:tic disorders 论文 PMC11284231;PheKB(phewkb.org);SLE 算法验证 PMC6389392。
⚠️ 坑点 5:化验值单位与参考范围随时间漂移(分类:预处理陷阱)
问题:VUMC 检验系统横跨近三十年,同一 LOINC 项的计量单位、参考范围、检测方法随仪器与方法学迁移而变化;研究还发现 EHR 化验值仅 70% 含全部报告要素、91% 格式正确,且存在录入的生理不可能值。
症状:把不同时期的同项化验直接并入特征矩阵后分布出现多峰;按固定参考范围判定"异常"时异常率随年代漂移;模型在历史数据上失效而在近期数据上正常(或反之)。
解决:
- 简单方法:按 LOINC 分组检查单位唯一性(
groupby("loinc")["unit"].nunique()),多单位项人工核对换算系数后统一(见 §6.3 代码);删除超出生理界限的录入错误。- 进阶方法:不做绝对值建模,改做"相对参考范围"标准化——value 中位数化到当期参考范围((value - mid_ref) / half_ref),自动吸收范围漂移。
- SOTA 方法:部署 QualityLab 式清洗管线(单位统一、参考范围时代分段、异常值隔离、可视化质检),清洗日志入库保证可复现;时间敏感任务按检验年代分块验证。
参考:QualityLab/LabWAS 论文(ScienceOpen: fe7957db);CLARITE 质控框架。
⚠️ 坑点 6:多平台基因分型的批次效应(分类:工程陷阱)
问题:BioVU 基因组数据横跨 Illumina HumanExome BeadChip、HumanOmni5-Quad、Human1M、MEGAEX 等平台及后续 WGS,等位基因编码、位点覆盖、.call rate 特性不同;不同批次还对应不同入组年代,与队列构成(年龄、race)部分共线。
症状:GWAS 的 Manhattan 图出现平台对齐的条带状伪信号;PCA 主成分与分型平台强相关而非祖先相关;跨平台合并的 imputation 质量分数异常低(R² 阈值过滤后样本量骤减)。
解决:
- 简单方法:每平台独立 QC(call rate、HWE、MAF)后仅在平台共有位点做 meta 分析;用
genotype_platform_map.csv显式纳入平台协变量。- 进阶方法:统一 imputation(Michigan/HRC 面板,社区先例),剂量值跨平台合并;PCA 用 LD-pruned 常见位点计算,确认与前几主成分的平台相关被祖先解释后校正。
- SOTA 方法:线性混合模型(BOLT-LMM/SAIGE)纳入亲缘矩阵+平台批次;WGS 与芯片子集分别分析后荟萃;对 ancestry 分层(欧裔/非裔样本量差异大,先例中 65,363 vs 12,383)独立运行。
参考:autism PGS PheWAS(PMC10273739,Michigan imputation + HRC 工作流);pharmacogenomics 综述 S0165614722001717。
⚠️ 坑点 7:患者级与亲缘级双重数据泄漏(分类:数据泄漏)
问题:定制提取按研究定义返回多行/患者,随机按行划分训练测试集会让同一 research_id 跨集;BioVU 含生物学亲属与同一患者的多次采血样本,遗传任务的划分若忽略家系结构,多基因评分性能被亲缘关系虚增。
症状:验证指标显著优于文献同类工作且不可复现;同一患者的两行分别出现在训练/测试集;删除重复患者后性能骤降 10–20 个百分点;PRS 在无关个体上失去预测力。
解决:
- 简单方法:一切划分前先
groupby("research_id")聚合,Split 按患者键执行(§6.4 的 Subset 按患者索引切分即为此设计)。- 进阶方法:遗传任务用 KING/PLINK 估计 IBD 关系矩阵,将亲属对放入同侧(或用留一家族法);重复采血样本仅保留最早一次或聚合为患者级特征。
- SOTA 方法:外层分组 CV + 内层 ancestry 分层的嵌套验证;时间敏感任务叠加前向时间折叠(按患者首诊时间);在论文中公开划分脚本与随机种子以支持审计。
参考:eMERGE QC 工作流(Genomics Working Group);PLINK 官方文档(Purcell et al. 2007)。
⚠️ 坑点 8:自由文本残余 PHI 与再识别合规红线(分类:工程陷阱)
问题:SD 的自由文本经 De-ID 软件清洗,但任何 NLP 去标识都不是 100%(官方经验证的错误率 <0.1% 对百万级文档仍意味着残余风险);DUA 明确禁止再识别尝试,并要求发现潜在再识别信息时主动报告——这直接约束了 NLP 特征工程中"能不能把文本片段存进分析产物"。
症状:词表/嵌入产物中意外出现人名、电话格式字符串;把中间产物带出机构环境时违反 DUA;用文本日期特征反推偏移量时触碰再识别边界。
解决:
- 简单方法:分析产物入库前跑 PHI 模式审计(正则:日期/电话/MRN 格式、称呼+大写姓氏模式),命中行剔除并记录。
- 进阶方法:文本只保留经 tokenizer 的索引序列或匿名化后的实体类型序列,原始文本不进入可移动介质;用独立的再识别风险清单(small cell 统计、唯一值扫描)过滤可标识组合。
- SOTA 方法:按 HIPAA Expert Determination 思路做正式的残余风险评估并文档化(机构隐私办公室协作);NLP 训练用差分隐私或联邦式部署,原始文本永不出 VUMC 边界。
参考:Roden 2008(De-ID 错误率 <0.1%);BioVU DUA 条款(news.vumc.org/?p=329729:禁止再识别+报告义务);HIPAA Expert Determination 指南(HHS)。
§6.6 数据增强(安全/危险)
| 策略 | 判定 | 说明 |
|---|---|---|
| 事件序列随机 dropout(编码级 mask) | ✅ 安全 | 模拟记录缺失,等价于对信息性缺失的正则 |
| 患者内时间窗口扰动 | ✅ 安全 | 在偏移量不变的约束下微调相对间隔,保序即可 |
| 跨患者序列拼接/打乱 | ❌ 危险 | 制造不存在的患者轨迹,污染时序因果结构 |
| 化验值随机加噪 | ⚠️ 视情况 | 须远小于检测不确定度;对接近判异阈值处禁用 |
| 同义编码替换(ICD↔Phecode 上下位) | ⚠️ 视情况 | 只能向更粗粒度替换,反向会伪造诊断特异性 |
| 对文本同义词替换 | ⚠️ 视情况 | 医学否定词极敏感(“无胸痛”→"胸痛"致命),需医学词典校验 |
§6.7 模型推荐表
| 任务 | 推荐模型 | 理由 |
|---|---|---|
| 表型分类(编码矩阵) | XGBoost / 正则逻辑回归 | 高维稀疏 0/1 特征,可解释,PheWAS 社区基线 |
| 纵向事件序列 | GRU / Transformer(事件编码序列) | 就诊间隔与编码顺序联合建模 |
| 临床文本表型深化 | BioBERT/ClinicalBERT 微调 | 脱敏笔记上的疾病证据抽取 |
| GWAS/PheWAS | PLINK2 / SAIGE / BOLT-LMM | 处理不均衡病例与亲缘/批次混杂 |
| 多基因评分 | PRS-CS / PRS-CSx | 社区在 BioVU 祖先分层的先例工作流 |
| 化验值 LabWAS | 线性模型 + QualityLab 前置 | 清洗质量决定上游 validity |
§6.8 硬件需求表
| 任务 | 最低配置 | 推荐 |
|---|---|---|
| 表型统计/清洗 | 16 GB RAM 笔记本 | 32 GB RAM |
| Phecode 矩阵(百万级患者) | 64 GB RAM 工作站 | 128 GB RAM |
| 文本 BERT 微调 | 1× 24 GB GPU | 2× 40 GB GPU |
| GWAS(34 万样本级) | 64 GB RAM、多核 CPU | 128–256 GB RAM、HPC 队列 |
| WGS 联合分析 | HPC 必需 | 高 I/O 并行集群 |
§6.9 评估指标代码
from sklearn.metrics import (roc_auc_score, average_precision_score,
confusion_matrix)
import numpy as np
def ehr_eval(y_true: np.ndarray, y_prob: np.ndarray) -> dict:
"""表型分类任务的推荐指标组合:
AUROC 看排序,AUPRC 看不均衡下的召回代价(EHR 标签常 <5% 阳性),
PPV@k 对齐'算法标签要人工复核'的实际工作流。"""
out = {
"auroc": roc_auc_score(y_true, y_prob),
"auprc": average_precision_score(y_true, y_prob),
"prevalence": float(y_true.mean()),
}
k = max(1, int(0.05 * len(y_true))) # top-5% 送人工复核
top = np.argsort(-y_prob)[:k]
out["ppv_at_5pct"] = float(y_true[top].mean())
out["confusion@0.5"] = confusion_matrix(
y_true, (y_prob >= 0.5).astype(int)).tolist()
return out
§6.10 MLOps 笔记
- 快照即版本:SD 滚动更新,每次提取记录提取日期+提案号,分析产物绑定快照 ID;复现检查先比对快照。
- 划分脚本入库:分组划分、时间折叠的代码与种子随仓库版本化,评审可审计(应对坑点 7)。
- DUA 合规流水线:数据不出机构边界,产物导出前自动跑 PHI 审计与 small-cell 抑制(应对坑点 8)。
- 监测标签漂移:Phecode 病例率的月度监控可暴露编码实践变化与 ICD 过渡类断点(应对坑点 2、4)。
- 表型版本引用:任何模型交付都注明所用 Phecode 映射版本与表型算法出处(PheKB 链接),否则跨研究不可比。
- 再提取预算:提案通常允许有限次数的修订再提取(REDCap 跟踪),首次提取就应设计"留出验证字段"——避免为补一个特征重走申请流程。
- 协作交接:外部合作者不接触原始数据,交接物是聚合结果与审计日志截图;把 DUA 义务写进团队 onboarding 文档。
§7 质量评估与局限性
§7.1 已知偏倚表
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 三级转诊偏倚 | 学术中心富集重症/罕见/复杂病例,轻症与社区人群代表性受限 | 高 | 结论限定于就医人群;外部验证用社区队列 |
| 编码实践偏倚 | 诊断编码反映计费与机构习惯;精神科等被污名化诊断编码不足 | 高 | 编码+独立证据双通道标签;PheKB 已验证算法 |
| 记录密度偏倚 | 就诊强度差异驱动伪关联(“就医越多越像病例”) | 高 | medical home 对照规则(≥5 编码/3 天/3 年) |
| 人群同质性偏倚 | 白人约 81%,少数族裔样本小;东南美地域局限 | 中高 | ancestry 分层;公平性评估报告分层指标 |
| 版本断裂 | ICD-9→ICD-10 过渡(2015-10)造成时间序列断点 | 中 | Phecode/OMOP 统一层;过渡期敏感性分析 |
| 时间锚点破坏 | 0–364 天日期偏移使绝对时间特征失效 | 中 | 仅用患者内相对时间(见坑点 1) |
| 外部记录缺失 | 外院就诊不在 SD 内,事件流不完整 | 中 | 结局定义以 VUMC 内事件为准并明示边界 |
| 采血来源偏倚 | BioVU 样本仅来自有临床检验的就诊,无检验经历者不入库 | 中低 | 遗传关联影响小;纯 EHR 对照研究需注意入库选择 |
| 记录代际漂移 | 编码密度与粒度随 EHR 代际系统性变化(14→~27 编码/记录) | 中 | 入组时间作协变量;分段敏感性分析 |
§7.2 标注质量
算法标签质量取决于算法定义而非采集协议:已发表的验证点包括 SLE 算法(PPV 89%、灵敏度 86%)、心律传导算法(PPV 97%)。体系化保障来自 PheKB 平台——算法、验证指标与多站点结果公开可查。但绝大多数 Phecode 没有逐站点 PPV 报告,标签噪声水平是任务级而非数据集级的属性,研究者必须为自己的目标表型复核(抽样人工病历复核 + 报告 PPV)。
除标签层外,底层数据质量有两个经过同行验证的量化点:
| 质量层 | 量化指标 | 来源 | 对 AI 的含义 |
|---|---|---|---|
| 去标识处理 | 文本去标识错误率 <0.1%(Roden 2008 抽样验证) | Roden 2008 | 残余 PHI 概率低但非零,产物审查仍是义务(坑点 8) |
| 样本处理 | DNA 样本处理错误率 <0.3% | Roden 2008 | 样本↔记录错链概率低,遗传分析前仍应核对性别/亲缘一致性 |
| 化验传输 | 99% 结果传输准确;但仅 70% 要素齐全、91% 格式正确 | QualityLab/LabWAS 研究 | 结构化≠可用:单位/参考范围缺失与格式异常是常态,必须逐 LOINC 清洗 |
三层质量指标合起来说明一件事:本数据集的"标签可信度"是逐算法、逐化验项、逐处理环节分别量化的组合,不存在整库统一的"质量等级"——把这三个数字写进你的方法学部分,审稿人会感谢你。
§7.3 泛化性评估表
| 场景 | 失效风险 | 证据/理由 |
|---|---|---|
| 迁移到非美医疗体系(编码体系不同) | 高 | ICD 计费实践与门诊结构差异大 |
| 迁移到美国其他学术中心 | 中 | eMERGE 跨站点复现多见成功,但 PPV 漂移需重估 |
| 迁移到社区/基层医疗 | 高 | 三级中心重症富集;就诊密度结构完全不同 |
| 少数族裔亚组模型 | 高 | 亚裔/西裔样本极小(如 SLE 中 25/30 人) |
| 儿科模型 | 中 | 儿科样本 2010 年起步、占比约一成(2014 时点 23,280/212,059) |
| 急危重症深度预测 | 高 | 无 ICU 波形/呼吸机级数据(对照 MIMIC 类资源) |
§7.4 伦理与合规(DNA 样本二次使用的知情同意模型)
知情同意模型的三阶段演化是理解 BioVU 合规架构的钥匙:
- 共同规则豁免 + opt-out 加层(2007–2015):BioVU 使用"检验后拟丢弃"的剩余血样、链接全部去标识的 SD 记录,既无研究性干预也不含可识别私人信息,因此 VUMC IRB 与联邦 OHRP 认定其为非人类受试者研究(45 CFR 46),法律上无需知情同意。但 IRB 认为联邦标准"与社区对遗传研究的期待不同步",主动叠加了 opt-out 机制:治疗同意书内嵌退出勾选框、宣传册与公众教育并行。最终约 5% 患者选择退出——与事前调查(1/5 有顾虑、1/20 会退出)吻合。该设计的伦理依据由 Pulley et al. 2010 以 Belmont 三原则(尊重人、有利、公正)系统阐述。
- 研究知情同意书(2015 起):NIH 基因组数据共享(GDS)政策于 2015-01-25 生效后,BioVU 把 opt-out 表单升级为研究知情同意书,明确说明数据可能在 VUMC 之外使用,并配合海报、手册与前台培训。这意味着 2015 年后入组者的基因组数据共享有明确同意基础,而历史样本的共享走 dbGaP 受控通道。
- 受控共享与数据使用限制(当前):BioVU 是 NIH dbGaP 的优先存储库之一,衍生数据经"机构认证"提交,附带数据使用限制修饰符——COL(需协作)、NPU(非营利使用)、GSO(仅限遗传研究);新的通用研究用途须联系 biovu@vumc.org 走官方程序。VUMC 治理结构包括 IRB、医学中心伦理委员会、外部伦理顾问委员会、社区顾问委员会与法务部门,IRB 每年审查整个项目。
对使用者的直接义务(DUA 条款):不得尝试再识别任何个体;一旦发现潜在再识别信息必须主动报告;基因组研究新用途受 GSO 类限制约束。对二次分析的伦理提示:基因组+EHR 的组合本质上是不可匿名化的(文献已多次演示聚合基因型数据的再识别可能),因此"去标识"在此语境下是风险控制而非身份切断——任何模型交付都应假设患者身份在理论上可被技术进步攻破,并以最小化、不外传、不链接外部数据源为工程纪律。
§7.5 公平性
race 字段是自报与行政录入的混合体,与基因推断 ancestry 可能不一致——做公平性评估时建议用遗传主成分校准分组。更实质的问题是结构性代表不足:队列白人约 81%,亚裔/西裔在多数疾病中样本过小(个位到两位数),任何"全人群统一模型"实际上主要是欧裔人群模型。公平性技术动作:按 ancestry 分层训练与评估、报告子组 AUROC/AUPRC、对样本不足亚组显式声明适用边界而非静默输出。
公平性维度上还有一层容易被忽略:BioVU 的"剩余血样"采集机制意味着入库者必然有过临床检验,而无检验经历的边缘人群(低就诊频率、无保险群体)结构性缺位——这不是采样算法能修复的偏倚,公平性结论应限定在"有临床检验经历的就医人群"内。
§7.6 数据漂移
三类漂移源:编码体系漂移(2015-10 ICD-10 过渡是硬断点);临床实践漂移(检测方法更新、编码习惯、医保政策改变计费行为);队列构成漂移(30 年间诊疗人口结构变化、儿科并入、周采集速率从 700–900 到 500–1,000 的波动)。监控建议:按年度监控目标表型病例率、各 LOINC 单位构成、race/年龄分布,断点检出即触发标签算法复查。
漂移监控的一个务实技巧:把"入组时间"作为永久协变量保留在所有模型里,它同时吸收编码代际、临床实践与队列构成三类漂移的低频分量——即使无法逐一归因,也能阻止模型把时代效应错学到疾病信号上。
§7.7 DAIMS 24 项评估表
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式支持 | ⚠️ | 定制提取自由定义宽/长格式;Phecode 矩阵需自行 pivot |
| 2 | 唯一标识 | ✅ | SHA-512 哈希 research_id 患者级唯一,跨表/模态硬链接 |
| 3 | 特殊字符处理 | ⚠️ | 自由文本含临床缩写与截断符号,交付 CSV 需显式编码声明 |
| 4 | 重复行 | ✅ | 纵向重复行是数据本质(多次就诊),主键为 research_id+日期+编码 |
| 5 | 缺失编码 | ✅ | 结构化缺失即信息(未检验≠无检验值),文档化充分 |
| 6 | 标签标识 | ⚠️ | 标签=算法定义,无统一 label 字段;须引用表型算法定义 |
| 7 | 罕见类分组 | ✅ | Phecode 折叠 ~18,000 编码为 ~1,800 组,天然缓解罕见类稀疏 |
| 8 | 偏倚评估 | ✅ | 转诊/编码/密度偏倚在文献中被反复量化并给出缓解先例 |
| 9 | 数据字典 | ⚠️ | OMOP CDM 提供标准层,但定制提取字段字典随提案交付、无公共版 |
| 10 | 信息性缺失解释 | ✅ | EHR 缺失机制(按指征检验)在文献中被显式讨论并给出对策 |
| 11 | 设备记录 | ❌ | 无原始设备输出(ECG 仅有报告文本,无波形;无影像 DICOM) |
| 12 | 共线性 | ⚠️ | 编码间强相关(疾病共病结构),高维模型需正则或降维 |
| 13 | 编码映射 | ✅ | ICD→Phecode/OMOP/SNOMED 映射链公开(Phecode v1.2、OMOP CDM) |
| 14 | 时间戳处理 | ❌ | 日期偏移 0–364 天,绝对时间永久失真,仅患者内间隔可用 |
| 15 | 划分建议 | ✅ | 患者级分组划分共识明确;亲缘/时间维度有成熟方法可循 |
| 16 | 泄漏讨论 | ✅ | 患者行级泄漏与亲缘泄漏均有社区警示与标准对策 |
| 17 | 标签分布 | ✅ | 高频表型分布有官方统计;其余可用 Record Counter 实测 |
| 18 | 测量偏倚 | ⚠️ | 化验单位/参考范围漂移已识别,需逐 LOINC 清洗 |
| 19 | 外部验证建议 | ✅ | MGB/eMERGE 复现通道成熟,LabWAS 已有跨机构先例 |
| 20 | 版本记录 | ⚠️ | 滚动更新无公共版本号;提取快照需研究者自行登记 |
| 21 | 预处理脚本 | ❌ | 无官方公共预处理脚本;PheWAS R 包覆盖标签层,其余自建 |
| 22 | 合规要求 | ✅ | DUA/IRB/dbGaP 认证流程文档完备,义务条款清晰 |
| 23 | 多模态对齐 | ✅ | EHR↔DNA 经 research_id 硬链接,对齐键唯一且稳定 |
| 24 | 去标识化 | ✅ | 三步机制(哈希/偏移/文本清洗)公开且错误率经同行验证 |
DAIMS 评分:17.5 / 24
评分解读:强项集中在标识体系(哈希 ID)、编码映射链、泄漏与偏倚的文献化对策、以及 EHR↔DNA 的硬链接对齐——这些是"数据基建质量"的体现,也是它能支撑遗传学级严谨性的原因。失分集中在三点:绝对时间被偏移破坏(不可修复,任务设计必须绕行)、无设备级原始数据(波形/影像层缺失)、无公共预处理脚本与版本号(可复现性依赖研究者自律)。
对你意味着什么:①任务设计阶段先画"时间轴依赖检查表"——凡依赖绝对日历时间的特征全部改为患者内相对时间(坑点 1);②把"标签质量"当成自己的责任——引用 PheKB 已验证算法或自做抽样复核,不要默认编码即诊断;③工程预算的大头应放在预处理管线(单位漂移、版本统一、Phecode 矩阵)与分组划分脚本上,这两块没有官方现成品;④若需要设备级时序(波形),本数据集不可用,改用 MIMIC 类资源;⑤合规成本前置——DUA 义务(不再识别+报告义务)会约束你的产物形态,按坑点 8 的产物审计流程设计 MLOps。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| Mass General Brigham Biobank | MGB(美国) | LabWAS(血脂 PGS 关联) | PGS-血脂关联方向一致 | 效应量方向一致、量级相近 | EHR 清洗后化验值的遗传关联可跨机构复现 |
| eMERGE 网络多节点 | NIH eMERGE | 表型算法跨站点验证 | Phecode 级复现 | PPV 因站点编码实践而异 | PheWAS 关联在多站点 PheWAS 中系统性复现 |
| Marshfield PMRP | Marshfield Clinic(美国) | GWAS 复现(HDL 等) | CETP 位点复制 | 检验效能随样本构成变化 | EMR 衍生表型足以复现经典 GWAS 信号 |
| UK Biobank | UK Biobank(英国) | PheWAS 对照(罕见变异) | 跨库表型关联比较 | 粒度与定义差异需映射 | EHR 衍生表型与前瞻队列表型互补 |
§8 基准性能与生态
§8.1 排行榜与标志性结果
SD/BioVU 无公共排行榜(数据受控、任务自定义),下表收录以该资源(或其衍生存档数据)完成的标志性方法学结果,作为"该数据上什么方法有先例"的参考:
| 任务 | 代表工作 | 结果 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| PheWAS 方法学奠基 | Denny et al. | 以 rs3135388 复现多发性硬化关联并发现新表型 | 2010 | ICD→Phecode 全表型扫描 | Denny JC, et al., Bioinformatics. 2010. doi:10.1093/bioinformatics/btq126 | PheWAS R 包 |
| PheWAS vs GWAS 系统比较 | Denny et al. | 两框架关联集互补性量化 | 2013 | EMR 表型 vs GWAS 结局对齐 | Denny JC, et al., Nat Biotechnol. 2013;31(12):1102-10. doi:10.1038/nbt.2748 | — |
| PheWAS 工具化 | Carroll et al. | R 包实现 ICD 转换/回归/Manhattan 绘图 | 2014 | GPL-3 R 包 | Carroll RJ, et al., Bioinformatics. 2014;30(16):2375-6. doi:10.1093/bioinformatics/btu197 | GitHub |
| EMR-GWAS 复现经典位点 | eMERGE HDL 研究 | CETP rs1532624/rs1800775 复现(p<1e-8) | 2011 | NLP 筛选正常 ECG 队列 | Denny JC, et al., HUGO Journal(eMERGE HDL 研究) | dbGaP 受控 |
| ECG 表型遗传 | PR interval 研究 | 算法 PPV 97%,复现 PR 间期位点 | 2010 | NLP+编码+检验联合表型 | Circulation. 2010. doi:10.1161/CIRCULATIONAHA.110.948828 | — |
| LabWAS 管线 | QualityLab/LabWAS | 血脂 PGS 关联跨两机构复现 | 2023 | 化验值清洗+全实验室扫描 | ScienceOpen 记录(VUMC/MGB 双库) | — |
| 多基因评分 PheWAS | autism PGS 研究 | EU/AF 祖先分层(65,363/12,383) | 2023 | PRS-CS/PRS-CSx + Michigan imputation | PMC10273739 | — |
注意:上表数值来自不同任务与队列定义,不可直接横向比较——各工作的病例定义、样本子集、协变量策略不同,仅作方法可行性参考。
§8.2 SOTA 总结与选型建议
该数据集上的"最优方法"随任务而变:表型定义问题已由"Phecode + PheKB 验证"成为事实标准;关联检验首选 SAIGE/BOLT-LMM 级混合模型(处理不均衡与亲缘);化验值研究必须先过 QualityLab 式清洗;预测建模任务没有公认 SOTA——分组划分下的简单基线(正则逻辑回归 + Phecode 特征)通常是第一道必须打赢的对手。
选型判断的三个默认项:①文本深度任务(抽取、表型细化)在 2015-10 前后要分开评估——ICD-10 后编码信息密度变化会改变 NLP 与编码的相对贡献;②多模态融合(编码+化验+文本)在医疗 AI 文献中普遍优于单域输入,但融合前必须先完成 §6.3 的域内清洗,否则融合放大的不是信号而是单位漂移噪声;③基因组+EHR 联合任务(PheWAS、药物基因组学)是这个库不可替代的赛道——别在纯预测任务上与 MIMIC 类资源比深度。
§8.3 评测协议
社区默认协议要素:①表型定义引用公开算法(Phecode 规则或 PheKB 编号);②病例要求 ≥2 个不同日期的目标编码,仅 1 次者剔除;③对照施加 medical home 规则;④ancestry 分层或 PCA 校正;⑤结果附独立队列复现(eMERGE/MGB)。符合这套协议的结果才具备跨研究可比性。
§8.4 相关数据集表
| 数据集 | 关系 | 互补性 |
|---|---|---|
| MIMIC-IV | 同为美国 EHR 研究库 | ICU 级深度(波形/呼吸机)+ 凭证化公开,弥补 SD 急危重症短板 |
| eMERGE 各节点 | 网络协作节点 | 跨站点表型算法验证与 GWAS 复现 |
| UK Biobank | 前瞻队列对照 | 标准化前瞻表型 vs EHR 衍生表型的交叉校验 |
| Mass General Brigham Biobank | 同构资源 | 最直接的横向复现伙伴(LabWAS 先例) |
| All of Us | 多样性补充 | 弥补 SD 少数族裔代表不足 |
| VUMC Research Derivative | 同体系兄弟仓库 | SD 的研究级刷新版本(滞后约 4 周),与 SD 同源同键 |
| dbGaP 衍生存档数据集 | 受控分发渠道 | BioVU 衍生数据按项目隔离存档,可作跨研究对照基准 |
§8.5 关键论文 Top 6
- Roden DM, Pulley JM, Basford MA, et al. Development of a Large-Scale De-Identified DNA Biobank to Enable Personalized Medicine. Clinical Pharmacology & Therapeutics. 2008;84(3):362-369. doi:10.1038/clpt.2008.89 —— 体系奠基论文:opt-out 设计、去标识机制与错误率验证。
- Pulley JM, Clayton EW, Bernard GR, Roden DM, Masys DR. Principles of human subjects protections applied in an opt-out, de-identified biobank. Clinical and Translational Science. 2010;3(1):42-48. doi:10.1111/j.1752-8062.2010.00175.x —— Belmont 三原则在 opt-out 生物库中的落地蓝图。
- Denny JC, Ritchie MD, Basford MA, et al. PheWAS: demonstrating the feasibility of a phenome-wide scan to discover gene-disease associations. Bioinformatics. 2010;26(9):1205-1210. doi:10.1093/bioinformatics/btq126 —— PheWAS 方法学起点(诞生于本数据集)。
- Denny JC, Bastarache L, Ritchie MD, et al. Systematic comparison of phenome-wide association study of electronic medical record data and genome-wide association study data. Nature Biotechnology. 2013;31(12):1102-1110. doi:10.1038/nbt.2748 —— 证明 EMR 表型与 GWAS 框架的互补性。
- Carroll RJ, Bastarache L, Denny JC. R PheWAS: data analysis and plotting tools for phenome-wide association studies in the R environment. Bioinformatics. 2014;30(16):2375-2376. doi:10.1093/bioinformatics/btu197 —— 把方法学固化为公共工具(GPL-3)。
- Pediatrics inclusion: inclusion of pediatric samples in an opt-out biorepository linking DNA to de-identified medical records: pediatric BioVU. Clinical Pharmacology & Therapeutics. 2013;93(2):204-211. doi:10.1038/clpt.2012.230 —— 儿科扩展的合规与实施。
§8.6 社区活跃度
生态活跃度以工具与网络形式呈现:PheWAS R 包在 GitHub 持续维护(PheWAS/PheWAS),Phecode 映射更新至 v1.2 并被全社区引用;eMERGE(NHGRI 资助)将 BioVU 方法论推广至数十个美国站点;PheKB 表型算法库由多机构共建。VUMC 内部则以 VICTR/IDASC 服务体系支撑高吞吐提案。没有公共论坛式社区——问题反馈走官方邮箱(biovu@vumc.org)与包仓库 issue。
影响力还可以从三组事实读出:方法学侧,PheWAS 从本库起源后成为 EHR 遗传学的通用范式,Phecode 映射被 eMERGE 各站点与 MGB 等外部库直接采用;工程侧,体系的奠基论文(Roden 2008)累计引用 916+(Semantic Scholar,截至 2026-09),是去标识生物库设计的标准引用;制度侧,opt-out→研究知情同意的合规演化被后续生物库(含儿科扩展)反复引用为范本。对研究者,这意味着围绕本库的每一个方法问题都大概率有先行者可问——起点是 PheKB 页面与 PheWAS R 包 issue 区,而非从零摸索。
§8.7 生态快照表
| 资源 | 类型 | 链接 | 状态 | 推荐理由 |
|---|---|---|---|---|
| PheWAS R 包 | R 工具包 | GitHub | 持续维护(截至 2026-09) | Phecode 转换+关联+绘图一站式 |
| Phecode 映射 v1.2 | 映射表 | phewascatalog.org | v1.2 公开 | ICD-9→Phecode 官方映射 |
| PheKB | 表型算法库 | phewkb.org | 在线 | 已验证表型算法及 PPV |
| PheWAS Catalog | 结果目录 | phewascatalog.org | 在线 | 已发表 PheWAS 结果检索 |
| BioVU NIH 数据共享指南 | 官方文档 | vanderbilt.edu PDF(v2/2023) | v2 | OMOP/dbGaP 流程权威说明 |
| eMERGE Network | 研究网络 | NIH NHGRI 页面 | 运行中 | 跨站点验证与复现通道 |
§8.8 复现工具链清单(拿到数据前的准备)
SD/BioVU 数据本身无法提前获得,但整套方法学工具链全部公开——"等数据的 6 个月"足够把管线跑通:
| 步骤 | 工具 | 获取方式 | 就绪标准 |
|---|---|---|---|
| 1. ICD→Phecode 映射 | Phecode mapping v1.2 | phewascatalog.org 下载 | 能把示例 ICD-9 表折叠为 Phecode |
| 2. PheWAS 回归与绘图 | PheWAS R 包(GPL-3) | CRAN / GitHub | 用示例数据出 Manhattan 图 |
| 3. 已验证表型算法 | PheKB | phewkb.org 在线检索 | 目标表型的算法定义与 PPV 建档 |
| 4. 已发表结果对照 | PheWAS Catalog | phewascatalog.org | 检索目标 Phecode 的既有关联清单 |
| 5. OMOP 对齐 | OMOP CDM DDL 与词表 | OHDSI 官网 | 本地建库脚本就绪 |
| 6. 计数估算 | Record Counter | 获 VUMC 账号后(无需 IRB) | 目标表型样本量可行性报告 |
这套清单的价值在于:管线代码在拿到真实提取包之前就能用公开映射与模拟数据完成开发与代码评审,数据一到只替换输入路径——这是 SD/BioVU 类"定制提取"数据集上唯一合理的工程节奏。
§9 相关资源与引用
§9.1 官方资源列表
- BioVU 官方页(VUMC DBMI)——体系描述、申请流程、REDCap 跟踪说明
- VUMC Personalized Medicine 工具与资源页——BioVU 最新规模(>343,000,2024 年中)与 WGS 项目
- VICTR 数据资源页——Record Counter / SD Discover / RD 工具说明
- VUMC IDASC 服务核心——定制提取服务($90/小时起)
- BioVU NIH-repository Data Sharing Guide(v2/2023)——OMOP/dbGaP/机构认证全流程
- PheWAS R 包(GitHub)与vumc.org 使用页
- PheKB 表型知识库与 PheWAS Catalog
- Secondary use of EHR data: The Vanderbilt approach(JAMIA 2014)——SD 去标识三步法的技术描述
- Trends in Pharmacological Sciences 综述(2022)——BioVU 十五年规模演化与样本速率
- Roden 2008 原文(PubMed)——体系奠基论文与去标识错误率验证
- 咨询邮箱:biovu@vumc.org(BioVU 访问);victrbigdata@vumc.org(IDASC 服务)
§9.2 BibTeX 完整引用
@article{Roden2008,
title = {Development of a Large-Scale De-Identified {DNA} Biobank to Enable Personalized Medicine},
author = {Roden, Dan M. and Pulley, Jill M. and Basford, Melissa A. and Bernard, Gordon R. and Clayton, Ellen Wright and Balser, Jeffery R. and Masys, Dan R.},
journal = {Clinical Pharmacology \& Therapeutics},
volume = {84},
number = {3},
pages = {362--369},
year = {2008},
doi = {10.1038/clpt.2008.89}
}
@article{Pulley2010,
title = {Principles of human subjects protections applied in an opt-out, de-identified biobank},
author = {Pulley, Jill M. and Clayton, Ellen Wright and Bernard, Gordon R. and Roden, Dan M. and Masys, Dan R.},
journal = {Clinical and Translational Science},
volume = {3},
number = {1},
pages = {42--48},
year = {2010},
doi = {10.1111/j.1752-8062.2010.00175.x}
}
@article{Denny2010PheWAS,
title = {{PheWAS}: demonstrating the feasibility of a phenome-wide scan to discover gene--disease associations},
author = {Denny, Joshua C. and Ritchie, Marylyn D. and Basford, Melissa A. and Pulley, Jill M. and Bastarache, Lisa and Brown-Gentry, Kristin and Wang, Deede and Masys, Dan R. and Roden, Dan M. and Crawford, Dana C.},
journal = {Bioinformatics},
volume = {26},
number = {9},
pages = {1205--1210},
year = {2010},
doi = {10.1093/bioinformatics/btq126}
}
@article{Denny2013,
title = {Systematic comparison of phenome-wide association study of electronic medical record data and genome-wide association study data},
author = {Denny, Joshua C. and Bastarache, Lisa and Ritchie, Marylyn D. and Carroll, Robert J. and Zink, Raquel and Mosley, Jonathan D. and Field, Julie R. and Pulley, Jill M. and Ramirez, Andrea H. and Bowton, Erica and others},
journal = {Nature Biotechnology},
volume = {31},
number = {12},
pages = {1102--1110},
year = {2013},
doi = {10.1038/nbt.2748}
}
@article{Carroll2014,
title = {{R PheWAS}: data analysis and plotting tools for phenome-wide association studies in the {R} environment},
author = {Carroll, Robert J. and Bastarache, Lisa and Denny, Joshua C.},
journal = {Bioinformatics},
volume = {30},
number = {16},
pages = {2375--2376},
year = {2014},
doi = {10.1093/bioinformatics/btu197}
}
@article{PediatricBioVU2013,
title = {Inclusion of pediatric samples in an opt-out biorepository linking {DNA} to de-identified medical records: pediatric {BioVU}},
author = {Pulley, Jill M. and Bowton, Erica and Field, Julie R. and Basford, Melissa A. and Bernard, Gordon R. and Roden, Dan M. and Denny, Joshua C.},
journal = {Clinical Pharmacology \& Therapeutics},
volume = {93},
number = {2},
pages = {204--211},
year = {2013},
doi = {10.1038/clpt.2012.230}
}
§9.3 引用指南
使用 SD/BioVU 数据的研究在引用体系论文(Roden 2008)之外,还应:①引用所用表型算法的原始论文或 PheKB 页面;②基因型分析引用对应基因分型/平台说明;③使用 PheWAS R 包时引用 Carroll 2014(GPL-3 工具);④在方法部分写明提取快照日期与提案编号(无公共版本号,快照即版本)。文中规模数字以 VUMC 官方页最近核实值为准(本页核实截至 2026-09)。
反例警示:跳过表型算法引用、只写"病例来自 BioVU"会导致结果无法跨研究比较——同一 Phecode 在不同编码实践下的 PPV 可以相差数十个百分点,算法出处(规则+阈值+验证人群)才是标签定义的完整坐标。
§10 AI 使用声明卡
§10.1 本页面制作中使用的 AI 模型列表
| 模型 | 用途 |
|---|---|
| CodeBuddy Code(fast-model) | 结构起草、代码示例生成、格式校验 |
§10.2 AI 参与范围说明
AI 参与了章节结构组织、代码示例编写与文字润色。全部事实性内容(规模数字、日期、机制描述、引用)来自 §0 声明的检索来源(VUMC 官方页、同行评审论文、官方指南文档),由人工逐条核对;医学与合规表述按 §0 审核流程人工复核。
§10.3 输入来源列表
- Roden DM, et al., Clin Pharmacol Ther. 2008;84(3):362-369. doi:10.1038/clpt.2008.89
- Pulley JM, et al., Clin Transl Sci. 2010;3(1):42-48. doi:10.1111/j.1752-8062.2010.00175.x
- Denny JC, et al., Bioinformatics. 2010;26(9):1205-1210. doi:10.1093/bioinformatics/btq126
- Denny JC, et al., Nat Biotechnol. 2013;31(12):1102-1110. doi:10.1038/nbt.2748
- Carroll RJ, et al., Bioinformatics. 2014;30(16):2375-6. doi:10.1093/bioinformatics/btu197
- Pediatric BioVU, Clin Pharmacol Ther. 2013;93(2):204-211. doi:10.1038/clpt.2012.230
- Vanderbilt DBMI BioVU 官方页. https://www.vumc.org/dbmi/node/144
- VUMC Personalized Medicine 工具与资源页. https://medsites.vumc.org/personalized-medicine/tools-resources
- VICTR 数据资源页. https://www.vumc.org/vclic/node/193
- VUMC IDASC 服务核心. https://vumc.ilab.agilent.com/service_center/show_external/3668
- BioVU NIH-repository Data Sharing Guide v2/2023. https://cdn.vanderbilt.edu/vu-URL/wp-content/uploads/sites/381/2023/03/20030214/BioVU-NIH-repository-Data-Sharing-Guide_v02-2023final.pdf
- Secondary use of clinical data: The Vanderbilt approach(JAMIA/e-asianjournalsurgery 存档). https://www.e-asianjournalsurgery.com/science/article/pii/S1532046414000392
- Vanderbilt News: BioVU’s data riches a boon for discovery. https://news.vumc.org/?p=329729
- Vanderbilt Reporter: Consent process for BioVU participation updated(2015-01). https://news.vanderbilt.edu/2015/01/consent-process-for-biovu-participation-updated/
- Tic disorders PheRS 队列论文(2024). https://pmc.ncbi.nlm.nih.gov/articles/PMC11284231
- SLE PheWAS(2018). https://www.ncbi.nlm.nih.gov/pmc/articles/PMC6389392/
- Autism PGS PheWAS(2023). https://pmc.ncbi.nlm.nih.gov/articles/PMC10273739/
- QualityLab/LabWAS 研究. https://www.scienceopen.com/document?vid=fe7957db-24f1-448c-90d6-ca257b8138e2
- Atlas of Longitudinal Datasets: BioVU. https://atlaslongitudinaldatasets.ac.uk/datasets/biovu
- RecordCounter 培训材料(2014). https://www.studylib.net/doc/9891470/
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1 概览与版本时间轴 | 千方病案医学编辑部 | 逐条对照 FACTS.md 与来源 URL 核实 | ✅ 已通过 |
| §2 医学背景(ICD-11/SNOMED 映射) | 千方病案医学编辑部 | 编码对照 WHO ICD-11 与 SNOMED CT 标准概念 | ✅ 已通过 |
| §3 规格(规模时间线/获取流程) | 千方病案医学编辑部 | 多时点数字与官方页/论文交叉比对,口径逐一标注 | ✅ 已通过 |
| §4 DAIMS 字段字典与目录树 | 医疗 AI 数据工程师 | 对照去标识机制文献与 OMOP CDM 标准核查 | ✅ 已通过 |
| §5 划分与泄漏对策 | 医疗 AI 数据工程师 | 泄漏模式对照文献案例与分组划分标准做法复核 | ✅ 已通过 |
| §6 预处理代码与 8 坑点 | 医疗 AI 数据工程师 | 代码逻辑走查;坑点逐条溯源至文献/官方材料 | ✅ 已通过 |
| §7 质量评估与伦理(DAIMS 24 项) | 千方病案医学编辑部 | 偏倚/伦理表述对照 Pulley 2010 与 DUA 条款核实 | ✅ 已通过 |
| §8-§9 引用与生态(BibTeX) | 千方病案医学编辑部 | 引文逐条与 DOI/官方页交叉核对 | ✅ 已通过 |
| 规模与日期数字(全页) | 千方病案医学编辑部 | 与 FACTS.md 快照逐一比对(核实截至 2026-09) | ✅ 已通过 |
§10.5 AI 生成章节标注
初稿由 AI 起草的章节:§1-§10 全部章节的结构与文字初稿;§6.1/§6.3/§6.4/§6.9 代码示例为 AI 生成并经人工走查。所有事实性断言均绑定 §10.3 来源,AI 未引入无来源数字。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- 1000-genomes — 共享标签:基因组学与多组学 / GWAS / 测序数据
- pcawg — 共享标签:基因组学与多组学 / 测序数据 / 肿瘤学
- cbioportal — 共享标签:基因组学与多组学 / 测序数据 / 肿瘤学
- gwas-catalog — 共享标签:基因组学与多组学 / GWAS / 测序数据
- gwas-catalog — 共享标签:基因组学与多组学 / GWAS / 测序数据
- hprc — 共享标签:基因组学与多组学 / GWAS / 测序数据
- all-of-us-nih — 共享标签:基因组学与多组学 / 电子健康记录 / 肿瘤学
- gtex — 共享标签:基因组学与多组学 / GWAS / 测序数据
- gtex — 共享标签:基因组学与多组学 / GWAS / 测序数据
- gnomad — 共享标签:基因组学与多组学 / GWAS / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
