信息速览

Epic Cosmos — 3 亿+患者聚合 EHR 平台 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | Epic Cosmos |
| 英文全称 | Epic Cosmos(Cosmos: Real-World Data Powered by the Healthcare Community) |
| 别名/简称 | Cosmos、Cosmos dataset、Epic Research Cosmos |
| 疾病分类 | 全疾病谱覆盖平台(不限定单一 ICD-11 类目;典型研究域见 §2.1) |
| SNOMED CT | 诊断映射 SNOMED CT 全本体、检验映射 LOINC、用药映射 RxNorm(详见 §2.1b) |
| 数据模态 | 聚合去标识化 EHR(诊断/用药/检验/生命体征/操作/出生记录/SDOH/人口学;叙事笔记有限提供) |
| AI 任务类型 | 队列发现、疾病表征、流行病学建模、药物利用研究、疫苗效果评价、预测建模、健康服务研究、差异分析 |
| 样本总数 | 3 亿+ 去重患者 / 330+ 参与机构 / 数十亿临床数据点(39% 患者拥有 5 年以上数据) |
| 数据大小 | 官方未披露总容量(存于 Epic 托管的两个 SQL 关系数据库,不支持下载) |
| 数据格式 | SQL Server 关系数据库(DSVM 环境内)/ SlicerDicer 聚合查询 / 数据集市可导出 SQL 表、CSV、Parquet(环境内) |
| 许可证 | Epic Cosmos Terms(专有社区协作许可;访问不可购买,禁止出售数据访问权) |
| 访问级别 | 申请审核(须隶属 Epic 客户机构;行级访问需完成 Epic 认证培训) |
| DUO 标签 | 官方未发布 DUO 标签(去标识化数据按通用研究用途管理;聚合层查询无需 IRB 个案审批) |
| 语言 | 英文(界面与文档;数据来自多语言医疗机构但以英文编码为主) |
| 首发日期 | 2019(MetroHealth 成为首家参与机构);2020-04 Epic Research 发表首篇研究 |
| 最后更新 | 滚动更新(截至 2026-09;旧 encounter 可随源系统修正被重新推送刷新) |
| 发布机构 | Epic Systems Corporation |
| 官方主页 | https://cosmos.epic.com/ |
| 下载地址 | 不支持下载(经 Cosmos Portal 聚合查询或 DSVM 环境内分析访问) |
| DOI | 10.47912/jscdm.246(官方方法学论文)/ 10.1055/a-2842-3407(平台综述)/ 10.1056/NEJMoa2215201(代表性应用) |
| 引用次数 | 100+ 篇同行评审研究采用(截至 2025-12,Howat et al. 口径;2024 年底前为 54 篇) |
| AI 就绪度评分 | ⭐⭐(2/5)— 数据规模与保真度顶尖;扣分项:行级数据不可导出、无法本地复现管道、需付费认证培训、快照不可第三方复现 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
审核声明:本词条由 [千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、疾病流行病学)、§7 偏倚分析(单一厂商偏倚、非检测偏倚、差异缺失)。
[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。Epic Cosmos 要求用户隶属 Epic 客户机构、遵守 Cosmos Terms 与 Rules of the Road,行级访问须完成 Epic 官方认证培训;发布研究时须按 Section 2.3.1 致谢 Cosmos 并定期向 Governing Council 提交引用清单。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? Epic Cosmos 是美国最大 EHR 厂商 Epic Systems 与其客户医院社区共建的聚合研究数据平台:数百家医疗机构把自家病历(去标识化后)持续汇入 Epic 托管的统一数据库,形成覆盖 3 亿+ 去重患者、330+ 机构的纵向"健康数据宇宙"。它不是一份可以下载的静态数据集,而是一个研究者按需查询的分析环境。据官方论文, Cosmos 与 N3C、All of Us 同属新一代大规模真实世界数据基础设施(Noel & Bartelt, 2023, JSCDM. DOI: 10.47912/jscdm.246)。
为什么重要? 单家医院的数据既小又偏——梅奥诊所的患者不代表全美。Cosmos 把全美 50 个州、外加加拿大、黎巴嫩、沙特阿拉伯参与机构的住院、门诊、急诊数据整合成单一纵向记录,并跨机构去重链接(约一半患者的病历由多家机构共同拼合完成),其年龄、种族、保险构成与美国人口普查高度一致。NEJM 已基于它发表疫苗真实世界效果研究(Deputy et al., 2023, DOI: 10.1056/NEJMoa2215201),CDC 用它做疫情监测。
我能用它做什么? 如果你所在的机构使用 Epic,你可以免费通过 SlicerDicer 做聚合队列发现,或付费完成认证后在数据科学虚拟机(DSVM)里用 SQL、R、Python 分析行级去标识数据:疾病自然史、药物利用、罕见病聚集、健康差异、预测建模。注意:行级数据永远不能导出,模型只能在环境内训练、以聚合形式带出结果。
§1.1 技术摘要
Cosmos 采用"厂商托管、社区贡献"的集中式架构。参与机构经 Care Everywhere 互操作网络以加密 HL7 CDA 消息将生产 EHR 数据持续推送至 Epic 托管的 Cosmos 主机;患者跨机构链接由 Care Everywhere 原生完成,无需第三方 token broker(Noel & Bartelt, 2023)。去重后的数据存于两个 SQL 关系数据库,底层模型为 Epic Caboodle 简化版——星型/雪花维度的 fact table + dimension tables 结构(CTPH, 2025),以最小转换保真存储源系统数据,诊断、检验、用药分别映射 SNOMED CT、LOINC、RxNorm 标准本体。去标识化采用双层机制:全部记录在源机构层面按 HIPAA limited data set 标准处理,行级访问数据经"专家判定"(expert determination)确认不可再识别——日期按个体随机偏移、地理编码仅保留州级、小样本计数被抑制、直接标识符被剔除。访问分两层:SlicerDicer 聚合层(免费、无代码)与 Data Science Virtual Machine 行级层(SQL Server、R、Python,需 Epic 认证培训)。截至 2025 年,平台数据来自 330+ 机构(美国、加拿大、黎巴嫩、沙特阿拉伯),39% 患者拥有 5 年以上连续数据,已支撑 100+ 项同行评审研究(Howat et al., 2025, Methods. DOI: 10.1055/a-2842-3407)。
§1.2 战略价值
维度一:规模与代表性——"看起来像美国"的健康数据底座。 传统单中心 EHR 库受地理与就诊人群选择偏倚制约,而 Cosmos 因由全国健康系统共建,官方宣称其年龄、种族、民族、城乡与保险构成与美国人口普查及社会脆弱性指数高度对齐(cosmos.epic.com, 截至 2026-09)。medRxiv 母婴队列研究实测印证了这一点:从 Cosmos 构建的 262 万+ 妊娠链接队列,其地域与种族-民族构成与全美出生证明数据高度相似(Leonard et al., 2026, medRxiv. DOI: 10.64898/2026.06.02.26354757)。对医疗 AI 而言,这意味着在 Cosmos 上训练的流行病学模型更接近目标部署人群,外推风险低于单中心数据。
维度二:纵向整合与去重链接——跨机构完整患者旅程。 患者的真实医疗轨迹散落在多家机构:社区诊所的处方、专科医院的手术、急诊科的化验。Cosmos 通过 Care Everywhere 原生链接把分散记录拼成单一纵向病历,据 Epic 数据研究副总裁披露,近一半患者的病历由多个组织共同构建(Nemours 播客访谈, 2025)。39% 患者拥有 5 年以上连续数据,使疾病自然史、药物长期结局、围产期母婴链条(出生数据保持母婴链接,见 BirthFact 表)等纵向研究成为可能——这是 claim 数据(只有计费无临床细节)与单中心 EHR(只有片段轨迹)都难以提供的。
维度三:证据回流闭环——从研究到临床决策支持。 Cosmos 的差异化定位不止于研究:分析结果以工具形态回流至 Epic 临床系统,如 Look-Alikes(疑难病例相似患者匹配)、Condition-Specific Growth Charts(特定疾病儿童生长曲线)、Best Care Choices(治疗选择参考),并支撑 Epic Research 双团队快速研究流水线(2020-04 起发布,CDC 合作研究登上 NEJM)。对构建"学习健康系统"(learning health system)而言,这种数据-证据-临床的闭环设计是全美最接近规模化落地的实践之一(Noel & Bartelt, 2023)。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标注/结构 | 与 Cosmos 的差异化 |
|---|---|---|---|---|
| Epic Cosmos | 3 亿+ 去重患者、330+ 机构 | 聚合 EHR(住院+门诊+急诊,纵向去重链接) | Caboodle 简化版星型模型;SNOMED/LOINC/RxNorm 映射;最小转换保真 | 同源操作数据模型直传、证据回流临床系统;仅 Epic 客户可访问、不可下载 |
| TriNetX | 数千万患者、全球合作网络 | 聚合 EHR/claims(标准化 OMOP) | OMOP CDM;队列构建与患者级下载优化 | 患者级数据可下载导出;Cosmos 数据面更广但行级不可导出(VCU 对比, 2026) |
| N3C | 1,600 万+ 患者、76 临床站点 | 聚合 EHR(COVID 优先) | OMOP CDM;多级去标识化分层访问 | NIH 主导、聚焦 COVID;Cosmos 全疾病谱且单一数据模型保真更高(JSCDM, 2023) |
| All of Us | 数十万参与者(目标百万级) | 调查+EHR+基因组+可穿戴 | 表型+基因型链接; controlled access | 主动招募志愿者队列含基因组;Cosmos 为就诊人群、无基因组主库(CTPH, 2025) |
| PCORnet | 1 亿+ 患者记录 | 分布式 PCORnet CDM | 分布式查询网络 | 联邦式架构(数据不出站);Cosmos 集中式托管但同为本机构贡献模式 |
| MIMIC-IV | 约 30 万患者、贝斯以色列单中心 | 单中心 ICU EHR | 开放下载(PhysioNet 凭证化) | 可本地下载复现、深度 ICU 细节;Cosmos 规模大三个数量级但不可下载 |
§1.4 版本时间轴
| 时间 | 里程碑 | 规模快照 | 来源 |
|---|---|---|---|
| 2019 | MetroHealth(俄亥俄州)成为首家加入 Cosmos 研究协作的机构 | 起步阶段 | Medscape 报道(2026) |
| 2020-04 | Epic Research 发表首篇基于 Cosmos 的研究 | 数据汇入启动 | Medscape 报道(2026) |
| 2021 Q4 | Cosmos 协作进入规模化增长期 | 152 家机构上线 | Gunderson et al., 2025 |
| 2022-02 | 学术文献首次系统记录 Cosmos 规模 | 1.62 亿患者、5.7B encounters、22,500 诊所、1,063 医院 | PMC11571052(引文 28) |
| 2023 | 官方方法学论文发表(JSCDM) | 217M+ 去重患者、219 家美国机构 + 1 家黎巴嫩机构 | Noel & Bartelt, 2023 |
| 2023 年底 | 机构参与持续扩大 | 229 家机构上线 | Gunderson et al., 2025 |
| 2025 | 平台基础设施与增长综述发表(Methods) | 330+ 机构(美/加/黎/沙特)、3 亿+ 去重记录、39% 患者 5 年+ 数据、100+ 同行评审研究 | Howat et al., 2025 |
| 2025-11 | 官方 about 口径与高校门户同步更新 | 1,809 医院、41,500+ 诊所、3 亿+ 患者 | uOttawa(2025)/ cosmos.epic.com/about |
| 2026-09(截至本词条审核) | 持续滚动更新 | 近 2,000 医院、约 3.04 亿患者(VCU 口径) | VCU Wiki(2026) |
§1.5 典型应用场景
- 疫苗与药物真实世界效果评价:CDC 与 Epic Research 基于 Cosmos 完成 JYNNEOS 猴痘疫苗效果病例对照研究(2,193 病例 vs 8,319 对照,两剂调整后 VE 66.0%),发表于 NEJM(Deputy et al., 2023. DOI: 10.1056/NEJMoa2215201)。
- 公共卫生快速监测:与 CDC 合作追踪 COVID 再感染(CDC MMWR)、儿童住院趋势、RSV 急诊负担,响应速度领先传统监测系统约一个月(The Big Unlock 访谈, 2022)。
- 罕见病聚集与病例匹配:通过 Look-Alikes 工具为疑难/罕见病例寻找跨机构相似患者,比较治疗路径;脐核黄疸(kernicterus,发病率约 1-2/10 万活产)等罕见病研究依赖 Cosmos 的聚合规模(VCU, 2026)。
- 围产期母婴纵向队列:利用保持母婴链接的出生数据构建 262 万+ 妊娠队列,研究慢性高血压孕妇收缩压与子痫前期关联(Leonard et al., 2026, medRxiv)。
- 健康差异与药物利用研究:自闭症谱系早期诊断的种族差异(JAMA Network Open)、Paxlovid 处方差异(JGIM)、GLP-1 停药后体重维持(Epic Research, 2025)等全国尺度差异分析。
§2 医学背景
定位说明:Epic Cosmos 是全疾病谱覆盖的平台型数据资源,不针对单一疾病。本节以"平台如何映射医学知识体系"为主线,选取官方文献与已发表研究中最具代表性的疾病域作为映射示例。
§2.1 ICD-11 编码映射表
Cosmos 中的诊断以 ICD-9/10-CM 编码存储并映射至 SNOMED CT;ICD-11 为 WHO 2022 年生效的国际标准,下表给出 Cosmos 已发表研究中高频疾病域的 ICD-11 参照编码(供百科读者理解疾病域归属,非 Cosmos 原生编码):
| 疾病域 | ICD-11 编码 | ICD-11 中文名 | Cosmos 中的典型研究用途 |
|---|---|---|---|
| 2 型糖尿病 | 5A11 | 2 型糖尿病 | 糖尿病结局与 GLP-1 用药研究(Diabetes Care, 2023) |
| 1 型糖尿病 | 5A13 | 1 型糖尿病 | COVID 感染与 1 型糖尿病关联(Diabetes, 2023) |
| 原发性高血压 | BA00 | 原发性高血压 | 抗高血压给药方案与血压控制(Epic Research, 2026) |
| 急性心肌梗死 | BA41 | 急性心肌梗死 | 心血管事件风险与血压曲线研究(Epic Research, 2025) |
| 缺血性卒中 | 8B11 | 缺血性卒中 | 低血压端卒中风险评估(Epic Research, 2025) |
| 子痫前期 | JA27 | 子痫前期 | 母婴队列妊娠期高血压研究(Leonard et al., 2026) |
| 哮喘 | CA23 | 哮喘 | 呼吸道感染季节性分析 |
| 阿片使用障碍 | 6C43 | 阿片类物质使用障碍 | 芬太尼检测率与过量救治研究(Epic Research, 2023-2026) |
| 自闭症谱系障碍 | 6A02 | 自闭症谱系障碍 | 早期诊断种族/民族差异(JAMA Network Open) |
| 新生儿黄疸 | KA87 | 新生儿高胆红素血症 | 脐核黄疸罕见病聚集研究(VCU, 2026) |
§2.1b SNOMED CT / LOINC / RxNorm 映射表
| 数据类别 | 标准本体 | 映射示例 | 在 Cosmos 中的角色 |
|---|---|---|---|
| 诊断/问题列表 | SNOMED CT | 44054006 Diabetes mellitus type 2(2 型糖尿病);38341003 Hypertensive disorder(高血压) | 诊断表主映射目标;问题列表与计费编码并存 |
| 检验结果 | LOINC | 2160-0 Creatinine [Mass/volume](血肌酐);2951-2 Hemoglobin A1c(糖化血红蛋白) | 化验结果表主键映射,含参考范围与异常标记 |
| 用药 | RxNorm | 860975 metformin 500 MG Oral Tablet(二甲双胍);方案级 RxNorm Concept | 医嘱、配药、给药三类记录均可映射 |
| 操作/手术 | CPT(存储)+ SNOMED CT(映射) | 27447 手术操作概念族 | 手术、产科、出生操作记录 |
| 免疫接种 | CVX(存储)+ SNOMED CT | JYNNEOS 疫苗记录 | 疫苗效果研究关键变量(NEJM, 2023) |
§2.2 平台医学定位与人群流行病学
作为全疾病谱平台,Cosmos 的"医学背景"核心是就诊人群的流行病学代表性。官方口径显示其覆盖全美 50 个州的 3 亿+ 去重患者,年龄、种族、民族、城乡分布与保险类型构成和美国人口普查及社会脆弱性指数高度对齐(cosmos.epic.com, 截至 2026-09)。这一代表性有两层含义:其一,在患病率层面,Cosmos 队列的慢病分布可直接作为全国患病率参照——例如 Epic Research 利用其追踪癌症筛查率、流感就诊峰值、肥胖人群 GLP-1 使用等全国趋势;其二,在纵向层面,39% 患者拥有 5 年以上连续临床数据,为慢病自然史与药物长期安全性提供了传统横断面调查不具备的时间深度(Howat et al., 2025)。
需要强调的是,Cosmos 代表的是就医人群而非全人群:无医疗接触的健康个体不产生记录,因而无法用于全人群患病率分母的推断;同时数据全部来自 Epic 安装机构,使用其他 EHR 系统的机构(部分竞争厂商市场份额地区)存在覆盖缺口,这是所有基于 Cosmos 的研究在讨论外推性时必须声明的局限(Howat et al., 2025)。
§2.3 平台支撑的临床研究任务定义
| 任务类型 | 定义 | Cosmos 支撑方式 | 代表研究 |
|---|---|---|---|
| 疫苗效果评价 | 真实世界接种人群与对照的保护效果估计 | 病例对照设计:诊断编码 + 实验室确认 + 免疫接种记录 | JYNNEOS 猴痘 VE(NEJM, 2023) |
| 药物流行病学 | 用药暴露与结局的观察性关联 | RxNorm 用药记录 + 纵随结局链接 | GLP-1 停药体重维持(Epic Research, 2025) |
| 疾病表征 | 疾病人群特征、共病与就医模式的全国画像 | 队列聚合 + SDOH 变量 | 肥胖人群 MASLD 聚类(Epic Research, 2026) |
| 预测建模 | 基于纵向数据的风险预测模型训练 | DSVM 内 SQL/R/Python 行级建模 | 平台异常检测与结局预测(JSCDM, 2023) |
| 健康服务研究 | 就医路径、利用率与差异分析 | encounter 级利用数据 + 州级地理编码 | 心衰出院 7 天门诊随访率(VCU, 2026) |
| 临床试验匹配 | 按入选标准跨机构估算合格患者池 | Cosmos 试验匹配功能 + 聚合可行性分析 | 平台临床试验招募加速模块(JSCDM, 2023) |
§2.4 患者人群画像
| 维度 | 描述 | 来源 |
|---|---|---|
| 来源机构 | 330+ 组织:学术医疗中心(Duke、Yale、Baylor)、社区医院、联邦认证健康中心(FQHC)、危急照护医院、专科诊所 | Noel & Bartelt, 2023;Medscape, 2026 |
| 地域覆盖 | 美国 50 个州全覆盖 + 加拿大、黎巴嫩、沙特阿拉伯 | Howat et al., 2025 |
| 时间跨度 | 最早记录回溯至 2015 年前后;39% 患者拥有 5 年以上数据 | Howat et al., 2025 |
| 年龄 | 全年龄段(含新生儿与 80+ 老年,无 Medicare 型年龄截断) | Nemours 访谈, 2025 |
| 性别 | 法定性别、出生指定性别、性别认同三项分立记录 | Noel & Bartelt, 2023 |
| 种族/民族 | 完整度约 77%(母婴队列实测),低于其他变量 | Leonard et al., 2026 |
| 保险类型 | financial class 记录;含无保险人群(优于 claims 型数据) | cosmos.epic.com, 2026 |
| 就医类型 | 住院、门诊、急诊、专科、远程医疗全类型 encounter | Noel & Bartelt, 2023 |
§2.5 临床与科研价值
对临床医者,Cosmos 的价值在决策时刻的证据可得性:Epic 将聚合分析嵌入临床工作流(如 Best Care Choices 展示相似患者的治疗结局分布),医生可在诊疗现场询问"与我面前患者相似的人群中,该方案的实际结局如何",而无需等待文献发表(The Big Unlock 访谈, 2022)。对研究者,其价值是规模×保真×速度的组合:以风暴后鼻窦炎研究为例,Epic 评估了单次风暴相关的高达 4,000 万+ 次 encounter,而大学团队自建数据仅能分析约 1 万次(Medscape, 2026)。对公共卫生部门,其价值是监测时效:CDC 反馈 Cosmos 的儿童住院数据比其传统来源提前约一个月到达,在 Omicron 波等紧急时刻直接影响决策窗口(同上)。
§2.6 真实世界证据的"金标准"参照
| 要素 | 随机对照试验(金标准) | Cosmos 观察性真实世界证据 | Cosmos 的补偿机制 |
|---|---|---|---|
| 分组 | 随机化,控制混杂 | 自然暴露,混杂不可避免 | 大样本协变量调整;病例对照设计(NEJM, 2023) |
| 人群 | 严格入选/排除,代表性受限 | 就医全人群,外推性好 | 与普查/SVI 对齐性校验(cosmos.epic.com) |
| 结局测量 | 方案化统一采集 | 源于临床文档,标准不统一 | 标准本体映射 + 数据质量检查流水线(Howat, 2025) |
| 外部效度 | 低(理想条件) | 高(真实条件) | 与流感监测/VAERS/NHAMCS 外部验证对齐(JSCDM, 2023) |
| 时效 | 数年 | 周级(Epic Research 双团队流程) | 快速发表与政策引用(Medscape, 2026) |
结论:Cosmos 不替代 RCT,而是填补其"人群窄、周期长、不可及"的空档;规范做法是 RCT 与 Cosmos 真实世界证据互为三角验证。
§3 数据集规格
§3.0 访问层级抉择矩阵
Cosmos 无传统意义上的"多版本",但存在必须先行抉择的访问层级。不同研究需求对应的层级、成本与能力差异巨大:
| 你的需求 | 推荐层级 | 成本 | 理由 |
|---|---|---|---|
| 快速估算疾病患病率、验证想法、可行性评估 | SlicerDicer 聚合层 | 免费、无培训要求 | 无代码点选界面,分钟级返回 3 亿+ 患者聚合计数(LDS 级) |
| 发表级观察性研究(病例对照、队列) | DSVM 行级(SQL) | COS305+COS500 认证约 $800(美国口径,2026-07) | SQL 灵活构建数据集市,支持复杂纳入/排除与敏感性分析 |
| 机器学习建模(R/Python) | DSVM 行级(Data Scientist 认证) | COS305+COS550 认证约 $400(美国口径,2026-07) | 环境内 RStudio/Python 工具链,可在数据集市上训练模型 |
| 有资助的课题(NIH/基金会) | 任意层级 + 预算沟通 | 需向 Epic 报备,可能收取项目费 | 资助项目按 case-by-case 收取 charge-back,需在预算阶段介入(Stanford FAQ, 2026) |
| 母婴纵向链接研究 | DSVM 行级 + BirthFact 表 | 同 DSVM | 出生数据保持母婴链接,聚合并不能获得个体级妊娠轨迹(Leonard et al., 2026) |
| 学生教学/培训项目 | SlicerDicer + Super User 认证 | 免费 | 聚合查询无需 IRB 个案审批,适合假设生成教学(Dartmouth, 2026) |
§3.1 数据模态详情
Cosmos 的数据元素来自参与机构 Epic 系统的原生记录,经跨机构标准化后入池。以下为官方论文与多所大学门户确认的数据清单(Noel & Bartelt, 2023;CTPH, 2025;Dartmouth, 2026):
- 诊断:ICD-9/10-CM 计费编码 + 问题列表(problem list),映射 SNOMED CT;
- 用药:医嘱(orders)、配药(fills)、给药(administrations)三层记录,映射 RxNorm;
- 检验:结果值、单位、参考范围、异常标记,映射 LOINC;
- 生命体征:身高、体重、血压、心率、体温等 flowsheet 生命体征(flowsheet 中非生命体征数据如呼吸治疗事件、疼痛评分不在池内,CTPH, 2025);
- 操作与 ICU 事件:手术、产科操作、ICU 住院事件;
- 出生数据:产科入院与分娩记录,保持 birthing parent–infant 链接(BirthFact 表);
- 人口学:年龄、法定性别、出生指定性别、性别认同、种族、民族(完整度约 77%,Leonard et al., 2026);
- 社会决定因素:交通与经济安全评估、Area Deprivation Index、社会脆弱性指数(SVI)、患者自报数据(PGHD)与调查量表;
- 行政与计费:billed codes、financial class(保险类别)、患者数字互动(portal 使用);
- 叙事笔记:官方口径为 “limited clinical notes (in development)”(Dartmouth, 2026),VCU 明确"叙事笔记、影像解读等富文本不可下载或详细审阅"——即叙事文本尚非平台成熟数据元素;
- 专科检查:肺功能(PFT)、心电图(EKG)、超声心动图等专科检查结果不在池内(CTPH, 2025 口径;数据元素持续扩展中)。
§3.2 数据层级与样本规模
| 层级 | 规模 | 说明 | 来源 |
|---|---|---|---|
| 去重患者 | 3 亿+(官方 about 口径;2026-09 高校口径约 3.04 亿) | 跨机构链接去重后的唯一患者数 | Howat et al., 2025;VCU, 2026 |
| 参与组织 | 330+(美国、加拿大、黎巴嫩、沙特阿拉伯) | 2025 年论文口径;官方 about 列 1,809 医院、41,517 诊所 | Howat et al., 2025;healthaidb 转述 |
| Encounter | 数十亿次(2022 年口径 5.7B;官网旧快照 9.1B encounters、4.4B 面对面就诊) | 官方未披露当前精确值 | PMC11571052;cosmos.epic.com 快照 |
| 纵向深度 | 39% 患者拥有 5 年以上临床数据 | 平台增长核心指标 | Howat et al., 2025 |
| 跨机构链接 | 约一半患者病历由多个组织共同构建 | 去重链接是 Cosmos 核心增值 | Nemours 访谈, 2025 |
| 医师/床位 | 296K 医师、241K 床位(官网旧快照) | 较早期口径,仅供参考 | cosmos.epic.com 快照 |
§3.3 数据格式
| 形态 | 格式 | 说明 |
|---|---|---|
| 存储层 | 两个 SQL 关系数据库(Epic 托管) | 去重后数据以最小转换保真存储;底层为 Caboodle 简化版星型/雪花模型(Howat et al., 2025;CTPH, 2025) |
| 聚合查询 | SlicerDicer 无代码界面(Cosmos Portal) | LDS 级聚合计数、队列发现、可视化看板(Stanford FAQ, 2026) |
| 行级分析 | DSVM 内 SQL Server(SSMS)、R(RStudio)、Python、Excel | 经 Citrix Cloud 安全环境访问(VCU, 2026;CTPH, 2025) |
| 数据集市导出 | SQL 表、CSV、Parquet | 仅限 DSVM 环境内导出至分析工作区,不可带出环境(Stanford Onboarding, 2026) |
| 结果输出 | 聚合文件/图片 | 须经 Epic 人工审核后方可转移出环境(Stanford FAQ, 2026) |
§3.4 存储规模
官方未披露 Cosmos 总存储容量。可核实的规模锚点为:3 亿+ 去重患者、数十亿临床数据点、2022 年口径 5.7B encounters(PMC11571052)。参与机构端数据经加密 HL7 CDA 通道推送至 Epic 托管主机,研究者无需自行承担存储成本——分析完全在 Epic 托管的 DSVM 环境内进行。这一"数据不动、人动"的模式与 MIMIC-IV 等可下载数据集形成本质区别:研究者本地永远不存在 Cosmos 副本。
§3.5 标注方式
Cosmos 无第三方人工标注层,所有"标签"均源于临床文档流程本身:
- 诊断标签:临床医师在诊疗过程中录入的问题列表与计费编码(自动编码 + 人工确认混合);
- 实验室标签:仪器自动产生 + LIS 人工审核的参考范围与异常标记;
- 用药标签:医嘱录入(CPOE)系统化产生,给药记录由护理流程回填;
- 结局标签:研究者自行从编码数据构造(如再入院、死亡等复合结局),构造逻辑是可复现性的关键。
这意味着 Cosmos 的"标注质量"等于临床文档质量:文档实践差异、编码遗漏、复制粘贴错误都会进入数据(Howat et al., 2025 将 documentation error 列为明示局限)。
§3.6 标注者资质与一致性
| 环节 | 资质 | 一致性控制 |
|---|---|---|
| 源头文档 | 各机构持证医师、护士、药师 | 无跨机构统一方案;依赖 Epic 系统内标准化表单约束 |
| 编码映射 | Epic 数据质量流水线自动映射 SNOMED/LOINC/RxNorm | 机构接入时全量数据通过系列数据质量检查(The Big Unlock, 2022) |
| Epic Research 研究 | 双团队制:每项研究 ≥1 名数据科学家 + ≥1 名临床医师(在编 6 名全职 DS、8 名兼职 DS、23 名临床人员) | 未参与研究的内部研究者交叉审核(Medscape, 2026) |
| 社区研究 | 各机构认证研究者(完成 Epic 培训) | Governing Council(15 名社区成员)治理 + 发表后引用清单年审 |
§3.7 采集周期与数据新鲜度
数据为滚动持续汇入:参与机构实时经 Care Everywhere 推送,Cosmos 数据集周期性刷新入库(官方未披露具体刷新日历)。两个关键特性:其一,旧 encounter 会被刷新——源系统的事后修正(图表更正、补充文档)会重新推送并在下次刷新时生效,越久远的记录被改动的概率越低但非零(Stanford FAQ, 2026);其二,时效优势——CDC 反馈 Cosmos 的儿童住院数据比传统公共卫生来源提前约一个月(The Big Unlock, 2022)。
§3.8 地域覆盖
- 国家级:美国 50 个州全覆盖;加拿大、黎巴嫩、沙特阿拉伯机构参与(Howat et al., 2025);
- 患者级地理编码:仅保留州(state)级居住地;更低层级(县、邮编)地理信息不可用(CTPH, 2025)——这使"按邮编可视化 GLP-1 使用"等精细空间分析在行级层面受限,仅 SlicerDicer 聚合看板可展示区域模式;
- 机构级地理:不可识别具体卫生系统,机构间比较只能以匿名分组形式进行。
§3.9 设备与数据源规格
Cosmos 不含设备原始信号(无波形、无影像),其"设备层"表现为设备产生的结构化输出:监护仪与护理记录的生命体征 flowsheet 值、检验分析仪经 LIS 传递的定量结果。设备型号、校准信息不随数据入池。对医疗 AI 而言,这意味着无法做信号级深度学习(如心电波形分类),但适合做以结构化临床变量为输入的表格与时序建模。
§3.10 深度溯源链
| 溯源环节 | 机制 | 可核验性 |
|---|---|---|
| 数据创建 | Epic 系统内结构化录入,工作流原生可知 | Epic 作为数据创建系统方,理解每条数据的产生屏幕与交互(The Big Unlock, 2022) |
| 传输 | Care Everywhere 网络,加密 HL7 CDA | 传输协议公开可查(Howat et al., 2025) |
| 链接去重 | Care Everywhere 原生患者链接,无第三方 token broker | Noel & Bartelt, 2023 |
| 质量控制 | 机构接入时全量数据质量检查;持续用户反馈回路改进数据质量 | Howat et al., 2025 |
| 去标识 | 源机构层面 HIPAA LDS 处理 + 专家判定 | 机制公开(JSCDM, 2023),细节(日期偏移算法参数)不公开 |
| 治理 | Governing Council(15 名社区成员)+ Cosmos Terms | 治理框架公开(healthaidb 转述官方 about;Stanford Onboarding, 2026) |
§4 数据结构
§4.0 目录树(DSVM 环境内数据集市示意)
Cosmos 行级数据不是以文件目录形式分发的——研究者通过 DSVM 中的 SQL 数据库访问。以下是研究者在 DSVM 内构建分析数据集市(data mart)并导出为环境内文件的典型工作区结构示意(依据 Stanford Onboarding 指南与 CTPH 访问说明整理):
cosmos-dsvm-workspace/ # DSVM 环境内工作区(EDDI 实例)
├── CABOODLE_LAYER/ # Caboodle 简化版星型模型(只读)
│ ├── FACT_TABLES/ # 事实表:EncounterFact, DiagnosisFact,
│ │ # LabResultFact, MedicationOrderFact,
│ │ # VitalSignFact, BirthFact ...
│ ├── DIM_TABLES/ # 维度表:PatientDim, EncounterDim,
│ │ # DepartmentDim, MedicationDim ...
│ └── DATA_DICTIONARY/ # 数据元素百科(环境内查询)
├── MY_DATAMART/ # 研究者自建数据集市(可写)
│ ├── cohort_definition.sql # 队列纳入/排除逻辑
│ ├── datamart_patients.csv # 集市导出:患者级特征(环境内)
│ ├── datamart_labs.parquet # 集市导出:检验时序(环境内)
│ └── datamart_outcomes.parquet # 集市导出:结局标签(环境内)
├── ANALYSIS/
│ ├── 01_exploratory.ipynb # R/Python 探索性分析
│ ├── 02_model_train.py # 模型训练(结果只能在环境内)
│ └── 03_aggregate_export/ # 聚合结果导出(须经 Epic 人工审核)
└── EXPORT_REVIEW/
└── aggregate_results_approved/ # Epic 审核通过的可带出聚合结果
关键理解:CABOODLE_LAYER 为只读星型模型,研究者按 fact table + dimension tables 的星型/雪花结构自行编写 SQL 构建数据集市;一切行级产物(CSV/Parquet)只存在于环境内,唯一能离开环境的是经审核的聚合结果。
§4.1 DAIMS 字段字典(核心概念表)
重要说明:下表呈现 Cosmos 数据模型中研究者最常使用的概念表与关键字段(依据官方论文数据类型清单、CTPH/Dartmouth/VCU 访问文档整理);具体表名与字段名以 DSVM 环境内 DATA_DICTIONARY 的官方定义为准——这正是宪法级的研究习惯:查 data dictionary 确认元素存在后再设计研究(CTPH, 2025)。
| 字段(概念) | 类型 | 说明 | 示例值 | AI 用途 | 观测误差/注意事项 | 信息性缺失 | 取值范围 |
|---|---|---|---|---|---|---|---|
| PatientID(去标识) | Integer | 跨机构去重后的唯一患者标识 | 10 位数级伪标识符 | 患者级分组、防泄漏 | 约 1/2 患者被多机构记录链接;残余重复可能存在 | 无 | 数据库内唯一 |
| BirthDateShifted | Date | 出生日期(按个体随机偏移) | 1985-07-xx(偏移后) | 年龄分层 | 具体偏移天数不公开;星期几不可辨 | 无 | 1900-至今 |
| EncounterID | Integer | 一次就诊/住院的唯一标识 | 12 位数级伪标识符 | 事件级建模单元 | 旧 encounter 可被刷新 | 无 | 数据库内唯一 |
| EncounterType | Text | 就诊类型 | inpatient / outpatient / ED | 分层分析、服务研究 | 机构间分类实践差异 | 无 | 枚举值 |
| DiagnosisCode | Text | ICD-9/10-CM 诊断编码 | E11.9(2 型糖尿病) | 表型定义、结局标签 | 计费编码 vs 问题列表语义不同;编码遗漏即假阴性 | 缺失≠无病 | ICD 码表 |
| SnomedMappedConcept | Text | 映射后的 SNOMED CT 概念 | 44054006 | 跨机构统一表型 | 映射由 Epic 流水线维护 | 未映射项入其他类 | SNOMED 全本体 |
| LabLOINC + NumericValue | Text/Float | 检验项目与定量结果 | 2951-2 / 7.2(HbA1c %) | 时序建模、异常检测 | 单位与参考范围随检验系统差异;需按 LOINC 分组归一 | 缺失≠未测(可能未开单) | 连续值 |
| MedicationRxNorm | Text | RxNorm 药物概念 | 二甲双胍方案概念码 | 暴露定义 | 医嘱≠服药依从;给药记录最接近实际暴露 | 缺失≠未用 | RxNorm 全库 |
| VitalValue | Float | 生命体征量测值 | SBP 138 mmHg | 基线特征、风险分层 | 护理量测情境差异(诊室/急诊);离群值需清洗 | 缺失常见于门诊 | 按体征定义 |
| IsProblemListEntry | Integer | 是否为问题列表条目(非计费) | 1 / 0 | 慢病表型更可靠来源 | 问题列表维护质量因机构而异 | — | 0/1 |
| SDOH_Assessment | Text | 社会决定因素评估(交通/经济安全等) | 交通运输困难 | 公平性分析、差异研究 | 筛查开展率机构差异大;完整度低 | 缺失≠无社会风险 | 评估项枚举 |
| StateOfResidence | Text | 患者居住州(地理最高精度) | CA / TX / NY | 区域流行病学 | 仅州级;邮编不可用 | 无 | 50 州 + 参与国 |
| BirthLinkID | Integer | 母婴链接标识(BirthFact 表) | 母婴对唯一码 | 围产期纵向队列 | 官方确认保持链接;链接覆盖完整度需实测 | 非出生 encounter 无 | 每对唯一 |
| FinancialClass | Text | 保险/支付类别 | Commercial / Medicaid / Uninsured | 差异分析、可及性研究 | 分类口径机构间微差 | 未知类存在 | 枚举值 |
§4.2 标签分布与表型定义
Cosmos 无统一标签体系,表型分布由研究者的定义决定。已发表研究给出的可参照锚点:
- 出生队列:2023-2024 年活产构建的链接母婴队列达 2,624,186 妊娠,队列特征与全美出生证明数据一致(Leonard et al., 2026);
- 疫苗效果研究:JYNNEOS 病例对照研究中 2,193 病例 / 8,319 对照(Deputy et al., 2023);
- 患病率研究:Epic Research 发布的疾病数据追踪器(癌症筛查率、流感就诊峰值等)给出全国尺度患病率曲线(epicresearch.org, 2026)。
研究者构造标签时必须报告:编码版本(ICD-9 vs 10-CM)、问题列表 vs 计费编码、是否要求实验室确认、观察窗定义——四要素不同,同一"糖尿病"表型的队列规模可相差数倍。
§4.3 关键统计
| 统计量 | 数值 | 来源 |
|---|---|---|
| 5 年以上纵向数据患者占比 | 39% | Howat et al., 2025 |
| 跨机构链接患者占比 | 约 1/2(“almost one in two patients”) | Nemours 访谈(Epic 数据研究副总裁), 2025 |
| 种族/民族字段完整度 | 77%(母婴队列实测) | Leonard et al., 2026 |
| BMI(分娩时)完整度 | 76%(同上队列) | Leonard et al., 2026 |
| 多数临床变量完整度 | >90%(同上队列实测) | Leonard et al., 2026 |
| 参与机构数据贡献义务 | 必须贡献全量数据、不得出售访问权 | Medscape, 2026 |
§4.4 数据层级关系
去重患者(Patient,3 亿+)
└── Encounter(数十亿次;住院/门诊/急诊/远程)
├── 诊断条目(ICD → SNOMED 映射)
├── 用药记录(医嘱 / 配药 / 给药 三层)
├── 检验结果(LOINC 映射,含参考范围)
├── 生命体征(flowsheet 量测)
├── 操作 / ICU 事件
└── 计费与行政属性(billed codes, financial class)
特殊链接:
BirthFact:birthing parent ↔ infant(跨代际纵向链接)
SDOH / PRO:患者级,独立于单次 encounter
§4.5 缺失值与信息性缺失
| 缺失模式 | 机制 | 处理建议 |
|---|---|---|
| 检验未开单 | 临床未指示(真阴性可能性存在) | 检验缺失≠阴性;用"测量前时间窗"方法区分 |
| 生命体征缺失 | 门诊轻症不常规量测 | 按 encounter 类型分层处理 |
| 种族/民族缺失 | 自报意愿与机构采集实践差异(完整度 77%) | 缺失类别显式建模;禁用均值/众数填补 |
| BMI 缺失 | 非所有就诊量测(完整度 76%) | 限定量测窗口内最近值 |
| SDOH 缺失 | 筛查工具开展率机构差异大 | 视为信息性缺失:缺失本身与机构类型相关 |
| 专科检查缺失 | 数据元素不在池内(PFT/EKG/超声心动图) | 结构性不可用——设计研究时直接排除该路径 |
| 叙事文本缺失 | in development,有限提供 | 不可将 NLP 管道假设为可迁移至 Cosmos |
信息性缺失核心结论:Cosmos 的缺失几乎全部是"信息性"的——缺失概率与就医模式、机构类型、临床实践强相关(Howat et al., 2025 将 workflow variation 列为明示局限)。任何把"缺失=随机"假设写进模型的做法都会引入系统偏倚。
§5 数据划分与使用建议
§5.1 官方划分
Cosmos 没有官方训练/验证/测试划分——它是研究查询平台而非标注数据集。划分责任完全在研究者。
§5.2 社区惯例与推荐策略
| 策略 | 做法 | 适用场景 |
|---|---|---|
| 按患者分组划分 | 以去重 PatientID 为组键做 train/val/test 分割,严禁同一患者跨集 | 一切患者级预测模型 |
| 按时间划分 | 以偏移后日期的时间轴(相对时间而非绝对日历)切分训练/验证/测试期 | 时效性强的预测任务、漂移评估 |
| 机构分层抽样 | 因机构不可识别,以 encounter 类型/地理区域(州)/机构规模代理变量做分层 | 泛化性评估 |
| 母婴对完整划分 | BirthFact 链接的母婴对视为同一分组单元,防止母婴信息互漏 | 围产期研究(Leonard et al., 2026) |
§5.3 泄漏风险(重点)
Cosmos 的三大特有泄漏路径:
- 跨机构重复未链接:约 1/2 患者被多机构链接,但链接依赖 Care Everywhere 网络质量;残余未链接的重复个体若落入不同数据集划分,即构成患者级泄漏。缓解:以尽可能宽的匹配键(年龄+性别+州+诊断指纹)做重复探测敏感性分析。
- 母婴/家庭链接泄漏:BirthFact 保持母婴链接,若母亲在训练集、婴儿在测试集且特征高度共享(妊娠期暴露),泛化指标虚高。缓解:以家庭/妊娠链接为组键整体划分。
- 动态刷新泄漏:旧 encounter 被事后刷新,若在模型定稿后重跑同一数据集市,历史记录可能"长出"新信息。缓解:数据集市构建时冻结提取时间戳并全程记录。
§5.4 交叉验证建议
- 推荐 GroupKFold(按 PatientID)+ 时间外折 双重验证:GroupKFold 防患者泄漏,按相对时间轴留出最末时段做外推验证;
- 罕见结局用分层分组抽样,保证各折事件率稳定;
- 折间统计口径(同一数据集市、同一提取时间戳)必须冻结,否则刷新数据会污染折间比较。
§5.5 外部验证建议
- 三角验证首选:与全美参照系统对齐——流感就诊率 vs CDC ILINet、药物不良事件 vs VAERS、急诊模式 vs NHAMCS,早期研究者已验证 Cosmos 与三者结果相似(Noel & Bartelt, 2023);
- 出生数据外部参照:与全国生命统计(birth certificate data)对比队列构成(Leonard et al., 2026 已示范);
- 跨平台验证:与 TriNetX/N3C 同表型队列对比基线特征分布(注意三方访问门槛与数据模型差异);
- 跨厂商缺口声明:Cosmos 无法覆盖非 Epic 机构,模型部署目标是混合 EHR 环境时必须声明该验证边界(Howat et al., 2025)。
§6 AI 就绪指南
本章适用边界:与 MIMIC-IV 等"下载到本地跑"的数据集不同,Cosmos 的 AI 工作流是"人进环境、数据不动"——所有行级计算发生在 Epic 托管的 DSVM 内,研究者带走的是聚合结果。本章所有代码均在 DSVM 环境(SQL Server + Python/R)语境下编写。
§6.0 环境快速启动
Cosmos 的"安装"即环境开通,标准路径为(Stanford FAQ/Onboarding, 2026;VCU, 2026):
- 确认资格:隶属 Epic 客户机构(本地 Epic 账号 + Epic UserWeb 账号必需);
- 申请 Cosmos 席位:经本机构 Cosmos 管理员提交 Data Tool Access Request;
- 选择路径:
- 聚合路径:直接使用 Cosmos Portal 内 SlicerDicer(免费、无培训硬性要求);
- 行级路径:完成 Epic 认证培训(COS305 必修;SQL 方向 + COS500 ≈ $800,或 R/Python 方向 + COS550 ≈ $400,美国口径 2026-07),由机构管理员开通 DSVM(EDDI)访问;
- 环境即服务:DSVM 内置 SQL Server(SSMS)、R(RStudio)、Python、Excel、Git 工具链,无需本地安装任何数据库;
- 账号活性:180 天不登录被锁定,1 年不登录席位被回收——长期项目需设置登录提醒。
§6.1 快速上手:从星型模型到第一张队列表
代码前置说明:以下 SQL 在 DSVM 内对 Caboodle 简化版星型模型执行。目录结构预期:所有查询在
MY_DATAMART工作区运行;data_root拼接关系为——DSVM 数据库即数据根,研究者不接触文件路径,产物统一落MY_DATAMART/;最小可用子集为单一数据集市(一个患者级特征表 + 一个结局表),而非全库。表名与字段名为概念示意,执行前必须在环境内 DATA_DICTIONARY 核对真实表名(CTPH, 2025)。
-- 目标:构建"2 型糖尿病 + HbA1c 控制"研究的最小可用数据集市
-- 步骤 1:定义患者级纳入队列(问题列表 + 计费编码双通道,见 §4.2)
WITH dm2_patients AS (
SELECT p.PatientID,
MIN(d.DiagnosisDateShifted) AS FirstDxDate -- 首诊日期(偏移后)
FROM DiagnosisFact d -- 事实表:诊断
JOIN PatientDim p ON d.PatientKey = p.PatientKey
WHERE d.SnomedMappedConcept = '44054006' -- SNOMED: DM2
OR d.DiagnosisCode LIKE 'E11%' -- ICD-10-CM: E11
GROUP BY p.PatientID
),
-- 步骤 2:提取首诊后 90 天内的 HbA1c 基线(时序窗口约束)
baseline_hba1c AS (
SELECT l.PatientID,
AVG(l.NumericValue) AS BaselineHbA1c
FROM LabResultFact l
JOIN dm2_patients m ON l.PatientID = m.PatientID
WHERE l.LOINCCode = '2951-2' -- LOINC: HbA1c
AND l.ResultDateShifted BETWEEN m.FirstDxDate
AND DATEADD(day, 90, m.FirstDxDate)
GROUP BY l.PatientID
)
-- 步骤 3:落集市表(写入 MY_DATAMART schema,环境内可复用)
SELECT m.PatientID,
m.FirstDxDate,
h.BaselineHbA1c,
p.StateOfResidence, -- 注意:仅州级精度
p.FinancialClass
INTO MY_DATAMART.dm2_baseline -- 环境内持久化,可反复引用
FROM dm2_patients m
JOIN PatientDim p ON m.PatientID = p.PatientID
LEFT JOIN baseline_hba1c h ON m.PatientID = h.PatientID;
# === 02_exploratory.py:DSVM 内 Python 探索(最小可用子集 = 上面的集市表) ===
import pandas as pd
import pyodbc # DSVM 内预装;连接串由环境统一管理
# data_root 拼接关系:DSVM 内无文件路径,直接连环境数据库
conn = pyodbc.connect("DSN=CosmosEDDI") # 环境内 DSN,咨询机构管理员
dm = pd.read_sql(
"SELECT PatientID, FirstDxDate, BaselineHbA1c, "
"StateOfResidence, FinancialClass FROM MY_DATAMART.dm2_baseline",
conn,
)
print(f"队列规模: {len(dm):,} 患者") # 环境内可打印行级计数
print(dm["BaselineHbA1c"].describe())
# 注意:此表仍属行级数据,只能留在环境内;导出聚合摘要需走审核通道
§6.2 数据获取:申请-认证-开通全流程
| 步骤 | 动作 | 成本/时长 | 关键产出 |
|---|---|---|---|
| 1. 资格确认 | 本机构须为 Epic 客户;申请人取得本地 Epic 账号 + Epic UserWeb 账号 | 免费;1-3 天 | UserWeb 个人主页 URL |
| 2. 提交访问申请 | 经机构 Cosmos 管理员/Data Tool Access Request 表单提交 | 免费;1-2 周 | Cosmos Portal 席位 |
| 3. SlicerDicer 自学 | 完成 COS100/200/300 系列微课程(可选) | 免费;数小时 | 聚合查询能力 |
| 4. 行级认证(SQL 方向) | COS305(0.5 天)+ COS500(1.5 天)虚拟课 | ≈ $800(研究者自费,美国口径 2026-07) | Data Model for Data Architects 证书 |
| 4’. 行级认证(DS 方向) | COS305(0.5 天)+ COS550(0.5 天)虚拟课 | ≈ $400(同上) | Data Scientist 证书 |
| 5. DSVM 开通 | 证书证明发机构管理员 + Epic 开通 EDDI 访问 | 免费;数天 | DSVM(SSMS/RStudio/Python)访问 |
| 6. 资助项目报备 | 预算阶段联系 Epic Cosmos 团队说明资助状态 | Case-by-case | 项目费协议(无资助项目免费) |
| 7. 合规义务 | 阅读 Rules of the Road;发表时致谢;每年两次提交引用清单 | 持续 | Governing Council 合规记录 |
# === 环境健康检查脚本(首次登录 DSVM 后运行) ===
import pyodbc, pandas as pd
def check_cosmos_env():
"""登录 DSVM 后的第一件事:确认连接、账号活性与数据新鲜度。"""
conn = pyodbc.connect("DSN=CosmosEDDI", timeout=30)
# 1) 连接活性:读一个最小表计数(表名以环境内 DATA_DICTIONARY 为准)
n = pd.read_sql("SELECT COUNT_BIG(*) AS n FROM PatientDim", conn)
print(f"[OK] 连接正常,患者维度表规模量级: {int(n.n[0]):,}")
# 2) 数据新鲜度:确认最新 encounter 刷新时间(字段名以字典为准)
fresh = pd.read_sql(
"SELECT MAX(LoadedOnDate) AS latest FROM EncounterFact", conn)
print(f"[OK] 数据最新入库时间: {fresh.latest[0]}")
# 3) 自我提醒:本会话所有行级输出只能留在环境内
print("[REMINDER] 行级数据禁止导出;聚合结果导出须经 Epic 人工审核")
check_cosmos_env()
§6.3 预处理全流程
Cosmos 的预处理主战场是 SQL 数据集市构建(把星型模型压平为建模友好的宽表),其次是环境内的 Python/R 特征工程。
阶段一:SQL 层队列与特征集市(对应 §6.1 模式扩展)
-- 预处理步骤 1:时序特征——每人每年化 HbA1c 轨迹(数据集市内)
SELECT PatientID,
YEAR(ResultDateShifted) AS DxYear, -- 注意:用相对/偏移时间
AVG(NumericValue) AS MeanHbA1c,
COUNT_BIG(*) AS NTests
INTO MY_DATAMART.dm2_hba1c_yearly
FROM LabResultFact
WHERE LOINCCode = '2951-2'
GROUP BY PatientID, YEAR(ResultDateShifted);
阶段二:Python 层清洗与标准化
# === 03_preprocess.py:集市表 → 建模就绪特征 ===
import pandas as pd
import numpy as np
def preprocess_dm2(datamart_df: pd.DataFrame) -> pd.DataFrame:
"""Cosmos 集市表的标准化清洗。返回建模就绪 DataFrame。"""
df = datamart_df.copy()
# 1) 单位与量纲:HbA1c 以 NGSP % 为准;排除 SI 单位残留(>20 视为 mmol/mol 混入)
df = df[df["BaselineHbA1c"].between(4, 20)]
# 2) 生命体征/化验离群值:按 LOINC 分组的 1-99 分位截断(比全局截断更稳)
q = df["BaselineHbA1c"].quantile([0.01, 0.99])
df["BaselineHbA1c"] = df["BaselineHbA1c"].clip(*q)
# 3) 缺失编码显式化:种族等高缺失字段(完整度 77%)不得隐式填补
df["StateOfResidence"] = df["StateOfResidence"].fillna("Unknown")
df["FinancialClass"] = df["FinancialClass"].fillna("Unknown")
# 4) 类别合并:低频州/保险类别归入 other,防独热维度爆炸
for col in ["StateOfResidence", "FinancialClass"]:
top = df[col].value_counts().nlargest(20).index
df[col] = df[col].where(df[col].isin(top), other="other")
# 5) 禁止事项:不构造"星期几"特征(日期已随机偏移,见坑点 1)
assert "dayofweek" not in df.columns
return df
clean = preprocess_dm2(pd.read_sql(
"SELECT * FROM MY_DATAMART.dm2_baseline",
pyodbc.connect("DSN=CosmosEDDI")))
阶段三:标准化检验回路——机构接入时 Epic 会对全量数据跑数据质量检查(The Big Unlock, 2022),但研究者仍须自查:同一 LOINC 在不同机构间的单位分布、诊断编码的版本混杂(ICD-9 残留)、问题列表与计费编码的语义错位。
§6.4 PyTorch DataLoader(DSVM 环境内)
# === 04_train.py:在 DSVM 内训练患者级结局预测模型 ===
# 合规前提:训练全程在环境内;模型权重不得导出,仅聚合指标可申请带出
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader, GroupShuffleSplit
class CosmosTabularDataset(Dataset):
"""从数据集市 DataFrame 构建患者级表格数据集。
参数:
df: SQL 数据集市导出的患者级宽表(环境内 Parquet/CSV)
feature_cols: 特征列名列表
label_col: 结局列名(研究者从编码数据构造,见 §3.5)
group_col: 组键列名(去重 PatientID;母婴研究改用 BirthLinkID)
"""
def __init__(self, df, feature_cols, label_col, group_col="PatientID"):
self.X = df[feature_cols].to_numpy(dtype=np.float32)
self.y = df[label_col].to_numpy(dtype=np.float32)
self.groups = df[group_col].to_numpy()
def __len__(self):
return len(self.y)
def __getitem__(self, idx):
return torch.from_numpy(self.X[idx]), torch.tensor(self.y[idx])
# ---- 构建:按患者分组的划分(防跨机构重复泄漏,见 §5.3) ----
df = pd.read_parquet("MY_DATAMART/dm2_features.parquet") # 环境内文件
feats = [c for c in df.columns if c.startswith(("lab_", "vital_", "demo_"))]
ds = CosmosTabularDataset(df, feats, label_col="label_1y_deterioration")
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
train_idx, val_idx = next(gss.split(df, groups=df["PatientID"]))
train_loader = DataLoader(
torch.utils.data.Subset(ds, train_idx),
batch_size=512, shuffle=True,
num_workers=2, pin_memory=(torch.cuda.is_available()))
val_loader = DataLoader(
torch.utils.data.Subset(ds, val_idx),
batch_size=1024, shuffle=False)
model = torch.nn.Sequential(
torch.nn.Linear(len(feats), 128), torch.nn.ReLU(), torch.nn.Dropout(0.2),
torch.nn.Linear(128, 64), torch.nn.ReLU(),
torch.nn.Linear(64, 1))
opt = torch.optim.AdamW(model.parameters(), lr=1e-3, weight_decay=1e-4)
loss_fn = torch.nn.BCEWithLogitsLoss()
for epoch in range(10):
model.train()
for xb, yb in train_loader:
opt.zero_grad()
loss = loss_fn(model(xb).squeeze(-1), yb)
loss.backward(); opt.step()
# 验证:AUC 等聚合指标可在环境内计算并申请导出
print(f"epoch {epoch}: train loss {loss.item():.4f}")
§6.5 坑点 8 个(Cosmos 真实特有失败模式)
⚠️ 坑点 1:日期随机偏移——绝对日历与星期几分析全部失效(分类:预处理陷阱)
问题:Cosmos 所有日期按个体随机偏移(time-shifted by a random number of days,CTPH, 2025),同一患者的相对时间间隔保留,但绝对日历锚点被破坏。
症状:试图按"周末 vs 工作日"分析入院结局时结果完全随机;疫情时间线研究(“2020 年 3 月之后”)无法定位;季节性日历(流感季、花粉季)对齐失效;两个独立数据集的日期无法对齐。
解决:
- 简单方法:放弃所有绝对日历特征,全部改用相对时间(入组后第 N 天、距首诊 N 月);
- 进阶方法:季节性研究用"事件相对锚点"替代日历——以流感季首个院内确诊高峰为 T0 对齐队列(聚合层面可行);或用诊断流行曲线反推大致日历窗(精度仅周级且不保证);
- SOTA 方法:需要真日历的外部效度问题(政策生效日、疫苗上市日)改在聚合层设计——SlicerDicer 聚合看板可按平台统一时间轴展示趋势,牺牲个体粒度换取日历可对齐性;设计评审时把"本分析不依赖星期/日历"写进协议。
参考:CTPH Epic Cosmos 说明(ctph-texas.org/epiccosmos-1);Noel & Bartelt, 2023, JSCDM. DOI: 10.47912/jscdm.246。
⚠️ 坑点 2:行级数据不可导出——管道设计与可复现性策略(分类:工程陷阱)
问题:DSVM 禁止导出任何行级数据;只有聚合文件/图片经 Epic 人工审核后可带出(Stanford FAQ, 2026)。本地复现经典 ML 管道(本地 Notebook + 版本化数据快照)在 Cosmos 上不存在。
症状:合作者无法在本地复现你的结果;论文投稿后被要求提供数据与代码复现包,无法满足;模型权重想带到本地部署被拒。
解决:
- 简单方法:把"代码可复现、数据不可复现"作为论文前提——公开全部 SQL/Python 代码 + 聚合结果表,附数据集市构建协议(纳入排除、窗口、编码版本)供社区重跑;
- 进阶方法:在 DSVM 内做结果稳定性自检——随机种子 × 5、数据刷新前后各跑一遍,把环境内敏感性分析写进论文附录;
- SOTA 方法:联邦式工作流——行级探索在 Cosmos,方法学验证在可公开的替代数据集(如 MIMIC-IV、N3C 公开层)上并行完成;部署类需求转向"模型留在环境内、推理请求进环境"的服务化设计,或改用 TriNetX 等允许患者级导出的平台。
参考:Stanford Cosmos Onboarding Guide(med.stanford.edu/starr-tools);VCU Cosmos Data wiki(2026)。
⚠️ 坑点 3:数据元素想当然——先查 DATA_DICTIONARY 再设计研究(分类:工程陷阱)
问题:Cosmos 数据元素持续扩展中,且部分类别结构性不在池内:flowsheet 中非生命体征数据(呼吸治疗事件、疼痛评分)、肺功能/EKG/超声心动图结果、影像解读均不可用(CTPH, 2025);叙事笔记处于 “in development” 有限状态(Dartmouth, 2026)。
症状:研究方案在评审阶段才发现关键暴露(如疼痛评分)或结局(如射血分数)根本不可得;把 MIMIC 的 NLP 管道假设套到 Cosmos 上落空;低频实验室项目跨机构覆盖差异巨大。
解决:
- 简单方法:设计前强制完成 DATA_DICTIONARY 元素存在性检查清单,逐项标记可得/不可得/低覆盖;
- 进阶方法:对低覆盖元素先跑可行性查询——用 SlicerDicer 估算"有该元素的机构贡献的患者量",低于阈值的元素降级为敏感性变量或放弃;
- SOTA 方法:与 Cosmos 团队沟通数据扩展需求(社区反馈是官方数据扩展的正式通道,JSCDM, 2023);结构不可得的元素(PFT/EKG)改用替代终点(诊断编码、用药轨迹)。
参考:CTPH Epic Cosmos(2025);Dartmouth Geisel Epic Cosmos 指南(2026);Noel & Bartelt, 2023。
⚠️ 坑点 4:非检测偏倚与部分部署——“没记录"不等于"没发生”(分类:偏倚陷阱)
问题:仅部分科室/院区使用 Epic 的机构只贡献该部分数据(CTPH, 2025);需要频繁住院服务的疾病在"住院数据不全"的机构中系统性低估;Epic 之外的就医事件完全不可见。
症状:某地区队列的住院率异常低于全国基准;随访"丢失"率远高于预期——实为患者去非 Epic 机构就诊;罕见病样本量在该机构远低于患病率推算。
解决:
- 简单方法:在数据集市加"机构数据完整性代理变量"(如该患者所在州/机构的门诊-住院记录比),纳入敏感性分析;
- 进阶方法:用仅门诊数据重跑主分析,若结论方向一致则偏倚风险可控(负控制设计);以死亡等"必然留痕"结局做阳性控制校准检测灵敏度;
- SOTA 方法:捕获-再捕获思想——用多来源(Cosmos × 全国住院样本 × 生命统计)三角核对目标疾病计数,量化缺口后做校正建模;论文 limitation 明确引用 Howat et al., 2025 的 vendor-bias 表述。
参考:Howat et al., 2025, Methods. DOI: 10.1055/a-2842-3407;CTPH(2025)。
⚠️ 坑点 5:小样本抑制——聚合结果不可加总(分类:评估误用)
问题:为防再识别,Cosmos 抑制小样本计数并模糊敏感元素(VCU, 2026);SlicerDicer 输出对交叉分层的小格子显示抑制标记或粗化值。
症状:把各分层计数相加得不到全量总数;交叉表边缘分布与单元格总和对不上;罕见病亚组人数在聚合层"消失"。
解决:
- 简单方法:所有聚合层报告使用平台输出的原值,禁止手工加总/差分重建被抑制格子;
- 进阶方法:行级层(DSVM)内做精细亚组分析——行级计数在环境内可见,亚组规模过小(<11)时主动抑制输出以符合合规预期;
- SOTA 方法:对必要的小格子估计采用环境内贝叶斯/层次模型输出汇总参数(而非原始计数),既保精度又降低再识别面。
参考:VCU Cosmos Data wiki(2026);Epic Cosmos Terms(经机构门户分发)。
⚠️ 坑点 6:跨机构去重不完美——残余重复造成患者级泄漏与计数膨胀(分类:数据泄漏)
问题:约 1/2 患者由多机构记录链接(Nemours 访谈, 2025),但链接依赖 Care Everywhere 网络交换质量;未链接的重复个体在数据中表现为多个"独立"患者。
症状:队列规模在不同机构组合下不可复现地波动;同一患者以不同 PatientID 同时出现在训练集与测试集,验证 AUC 虚高;患病率估计被重复计数抬升。
解决:
- 简单方法:一切划分按 PatientID 分组(GroupShuffleSplit/GroupKFold),确保跨集无共享组;
- 进阶方法:以(偏移出生日期 + 性别 + 州 + 罕见诊断指纹)做环境内重复探测,对高相似患者对做"合并/不合并"双情景分析,报告结论稳健性;
- SOTA 方法:以概率链接框架(类似 Fellegi-Sunter)在环境内构建二次去重层,仅用于敏感性分析(不得改写平台原生链接,遵守 Rules of the Road)。
参考:Nemours Well Beyond Medicine 播客(2025,Epic 数据研究副总裁访谈);Leonard et al., 2026, medRxiv. DOI: 10.64898/2026.06.02.26354757。
⚠️ 坑点 7:动态数据刷新——快照不可复现(分类:工程陷阱)
问题:Cosmos 数据动态更新,旧 encounter 可因源系统图表更正被重新推送刷新(Stanford FAQ, 2026);平台无研究者可固定的历史快照。
症状:返修稿阶段重跑同一数据集市,队列人数变了;期刊要求"数据可用性声明"无法承诺第三方获得同一数据状态;两个时间点跑出的模型性能差异无法归因(是漂移还是刷新?)。
解决:
- 简单方法:数据集市落成时在环境内记录提取时间戳与行数指纹,论文报告"数据提取于 YYYY-MM 的平台状态";
- 进阶方法:关键分析在集市落成后立即冻结为环境内只读表(MY_DATAMART 内新建固定表),后续所有分析引用冻结表而非重查底层;
- SOTA 方法:对刷新敏感的结局(死亡确认、再入院链)设计"刷新前后"双版本敏感性分析,把刷新效应量化为不确定性区间写入论文;投稿期间若平台大幅刷新,在返修中主动重跑并说明差异。
参考:Stanford Cosmos FAQ(2026);Howat et al., 2025。
⚠️ 坑点 8:差异缺失与文档偏倚——"缺失机制"本身就是信号(分类:标签理解)
问题:种族/民族完整度 77%、分娩 BMI 76%,其余多数变量 >90%(Leonard et al., 2026 实测);缺失概率与机构类型、就医强度、筛查实践强相关——文档错误与工作流差异是官方明示局限(Howat et al., 2025)。
症状:以"有完整人口学记录"为纳入条件的队列系统性偏向采集规范的机构;把检验缺失当随机缺失填补后,模型在真实部署中误报/漏报模式失控;表型定义里"无该诊断编码"被当真阴性,灵敏度被低估。
解决:
- 简单方法:缺失类别显式保留("Unknown"列),禁止中位数/众数静默填补;报告每个关键变量的完整度及缺失与结局的关联;
- 进阶方法:多水平模型把机构(以州/机构规模代理)作为随机效应,吸收采集实践差异;对表型定义做"严格 vs 宽松"双版本(编码确认 vs 编码+用药佐证),报告阳性预测值差异;
- SOTA 方法:对目标表型抽样做环境内阳性验证(如以实验室确认校正诊断编码的假阳性),估计 PPV/NPV 后对全队列标签做校准加权;缺失机制建模(pattern-mixture 或 selection model)用于结局回归的敏感性分析。
参考:Leonard et al., 2026, medRxiv;Howat et al., 2025, Methods. DOI: 10.1055/a-2842-3407。
§6.6 数据增强(安全 ✅ / 危险 ❌)
| 类别 | 操作 | 说明 |
|---|---|---|
| ✅ 安全 | 随机特征 dropout(模拟缺失) | 提升对 Cosmos 高缺失现实的鲁棒性 |
| ✅ 安全 | 时序窗口抖动(相对时间轴上 ±1-2 天) | 相对时间间隔保留,小幅抖动不破坏语义 |
| ✅ 安全 | 类别均衡重采样(SMOTE 类,环境内) | 罕见结局队列不平衡的标准手段 |
| ✅ 安全 | mixup(同结局标签患者间特征插值) | 表格模型正则化,环境内执行 |
| ❌ 危险 | 绝对日历平移/星期重排 | 日期已随机偏移,二次操作放大失真且无意义 |
| ❌ 危险 | 跨患者实验室值插值外推 | 个体轨迹不可跨患者拼插,制造伪临床状态 |
| ❌ 危险 | 用生成模型合成"患者"再混入训练集 | 合成数据混入真实队列破坏可审计性,且与合规审计冲突 |
| ❌ 危险 | 基于被抑制小格子的增强 | 小样本抑制格子上做任何统计操作都是再识别风险 |
§6.7 模型推荐
| 任务 | 推荐模型 | 理由 |
|---|---|---|
| 患者级结局预测(表格) | XGBoost / LightGBM | 高缺失表格数据的强基线;DSVM 内 CPU 即可训练 |
| 时序恶化预测 | GRU / 时间感知 Transformer(时间感知位置编码用相对时间) | 相对时间间隔保留,事件间隔本身是特征 |
| 表型定义/患者分层 | 逻辑回归 + 临床规则(可解释优先) | 发表与临床沟通要求可解释;规则表型可外部三角验证 |
| 大规模表示学习 | 环境内对比学习(患者级聚合嵌入) | 3 亿+ 患者规模优势;注意训练资源与刷新管理 |
| 因果效应估计 | 倾向得分匹配/加权 + 纵向边际结构模型 | Cosmos 纵向深度支持时间依存混杂处理 |
§6.8 硬件需求
| 场景 | 配置 | 说明 |
|---|---|---|
| SlicerDicer 聚合查询 | 普通浏览器 | 计算在 Epic 侧;本地零要求 |
| DSVM SQL 数据集市 | 环境内标准虚拟机 | Epic 托管,无需自购;大集市构建注意会话时限 |
| 环境内深度学习 | DSVM 内 GPU 视机构配置而定 | 无 GPU 时以 XGBoost/GRU 为主,或申请环境内批量作业窗口 |
| 聚合结果本地分析 | 笔记本 8GB+ | 仅处理审核通过的聚合 CSV/图片 |
§6.9 评估指标代码
# === 05_evaluate.py:环境内评估;聚合指标可申请带出 ===
import numpy as np
from sklearn.metrics import roc_auc_score, average_precision_score, brier_score_loss
def evaluate_patient_level(y_true, y_prob, groups):
"""患者级指标 + 按组(州/机构代理)稳定性检查。"""
out = {
"AUROC": roc_auc_score(y_true, y_prob),
"AUPRC": average_precision_score(y_true, y_prob), # 类不平衡主指标
"Brier": brier_score_loss(y_true, y_prob),
}
# 按组 AUROC 稳定性:泛化到不同采集实践的代理检查
for g in np.unique(groups):
mask = groups == g
if y_true[mask].sum() >= 10: # 避免小样本组(见坑点 5)
out[f"auc_{g}"] = roc_auc_score(y_true[mask], y_prob[mask])
return out
def calibration_table(y_true, y_prob, n_bins=10):
"""校准表:环境内输出聚合 bin 统计,天然符合导出合规。"""
bins = np.quantile(y_prob, np.linspace(0, 1, n_bins + 1))
return (pd.DataFrame({"p": y_prob, "y": y_true})
.assign(bin=lambda d: pd.cut(d.p, bins, include_lowest=True))
.groupby("bin", observed=True)
.agg(mean_pred=("p", "mean"), obs_rate=("y", "mean"), n=("y", "size")))
§6.10 MLOps 笔记
- 版本管理:Git 工具链在 DSVM 内可用;代码版本本地/环境内双备份,数据集市以"提取时间戳 + 行数指纹"版本化(数据本体不可带出,指纹可);
- 实验追踪:环境内记录每次实验的数据集市版本、特征清单、超参、聚合指标;禁止依赖"重跑即得"的天真假设(坑点 7);
- 再训练策略:平台滚动刷新意味着概念漂移与数据刷新叠加;设置季度级环境内重训窗口,对比冻结表 vs 最新集市的表现差;
- 审计合规:发表前经 Cosmos Publication Checklist;每年两次向 Governing Council 提交引用清单(Stanford Onboarding, 2026);
- 知识转移:模型留在环境内的部署模式要求"环境即产品"——与 Epic 临床工具(如 Best Care Choices 类模块)集成的路径是官方渠道而非自建 API。
§7 质量评估与局限性
§7.1 已知偏倚表
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 单一厂商偏倚 | 全部数据来自 Epic 安装机构,非 Epic 系统覆盖区存在结构缺口(Howat et al., 2025) | 高 | 声明验证边界;与全国统计三角核对 |
| 非检测偏倚 | 部分部署机构只贡献部分数据;需频繁住院的疾病代表性失真(CTPH, 2025) | 高 | 门诊-only 敏感性分析;死亡等阳性控制校准 |
| 就医人群选择偏倚 | 代表就医人群而非全人群,无接触者不入池 | 中 | 明确研究问题适配性;用就医强度分层 |
| 文档实践差异 | 机构间工作流、编码习惯、表单使用不一致(Howat et al., 2025) | 中 | 多水平模型;机构代理变量敏感性分析 |
| 差异缺失 | 种族/民族 77%、BMI 76% 完整度低于其他变量(Leonard et al., 2026) | 中 | 缺失显式建模;缺失-结局关联报告 |
| 残余重复 | 跨机构链接约覆盖 1/2 患者,未链接重复造成计数膨胀(Nemours, 2025) | 中 | 二次重复探测敏感性分析(坑点 6) |
| 日期偏移失真 | 绝对日历信息被破坏(CTPH, 2025) | 中 | 相对时间设计;聚合层日历分析 |
| 快速发表偏倚 | Epic Research 双团队产出未经传统同行评审,学界存在严谨性争议(Medscape, 2026) | 低-中 | 引用时区分同行评审论文与 Rapid Insights |
§7.2 标注质量评估
Cosmos 无独立标注层,标签质量等于临床文档质量。已发表研究的实测锚点:母婴队列中多数围产期关键变量完整度 >90%(Leonard et al., 2026);诊断编码的真伪阳性率未做全平台系统性审计,依赖研究者按任务抽样验证。社区可参照的实践:以实验室确认校正诊断编码(如 HbA1c ≥ 6.5% 佐证糖尿病编码)、双表型定义(严格 vs 宽松)报告 PPV 区间、以用药轨迹佐证慢性病诊断。Epic Research 侧的质量控制包括机构接入时全量数据质量检查与未参与研究的内部研究者交叉审核(Medscape, 2026)。
§7.3 泛化性评估表
| 部署场景 | 失效风险 | 证据/机制 |
|---|---|---|
| 部署到非 Epic 医院 | 高 | 模型特征分布依赖 Epic 表单与工作流;Howat et al., 2025 明示 vendor bias |
| 部署到低访问量社区诊所 | 中 | Cosmos 含 FQHC 与危急照护医院(Noel & Bartelt, 2023),但轻症低频数据下时序模型窗口失效 |
| 跨国部署(加拿大/沙特) | 中-高 | 数据来自 4 国但以美国为绝对主体;保险类别等特征语义不可跨系统迁移 |
| 儿科 → 成人迁移或反向 | 中 | 平台全年龄段覆盖,但特征工程需按年龄段重构(生长曲线类特征不可跨段) |
| 疫情等剧变期外推 | 高 | 刷新与漂移叠加;CDC 合作研究表明平台时效优势同时意味着漂移最先到达 |
| 周末/节假日运营场景 | 高 | 星期几信息结构性缺失(坑点 1),相关场景无法建模 |
§7.4 伦理与治理
Cosmos 的伦理架构以"不可再识别"为根基:源机构层面 HIPAA LDS 处理 + 行级数据经专家判定(Howat et al., 2025),Stanford IRB 对多项 Cosmos 研究判定为"非人类受试者研究"(Leonard et al., 2026 的伦理声明)。治理由 15 名社区成员组成的 Governing Council 承担,配套 Rules of the Road:禁止出售数据访问权、禁止再识别尝试、发表须致谢并定期提交引用清单(healthaidb 转述官方;Stanford Onboarding, 2026)。研究者义务还包括:不得用 Cosmos 做患者招募(无标识符,需 Honest Broker 替代通道,VCU, 2026)、不得将数据表述为机构特定结果(Dartmouth, 2026)。
§7.5 公平性
Cosmos 的公平性资产与负债并存。资产端:全年龄段、含无保险人群、官方宣称种族/民族/城乡构成对齐美国普查(cosmos.epic.com),使差异研究(如自闭症诊断的种族差异、Paxlovid 处方差异)具备全国尺度样本量。负债端:种族/民族字段 77% 完整度意味着差异分析的分母有系统缺口;SDOH 筛查的机构间开展率差异会与真实差异纠缠;英语为主的语言环境对多语言人群的记录完整性可能不均。公平性研究的最低标准:报告关键亚组完整度、缺失机制讨论、把"Unknown"作为分析类别而非删除。
§7.6 数据漂移
四重漂移源叠加:机构组合漂移(新机构加入改变总体构成,152→229→330+ 家的扩张轨迹,Gunderson/Howat);元素扩展漂移(数据元素持续增加,新旧时段可比性下降);文档实践漂移(编码标准切换如 ICD-9→10-CM、表单改版);刷新漂移(旧记录事后修正,坑点 7)。缓解组合拳:冻结数据集市做纵向对比、以固定"机构-元素-编码版本"子集构建漂移监控基线、把平台刷新日历纳入模型监控节拍。
§7.7 DAIMS 24 项就绪度检查
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式可用性 | ⚠️ | 需研究者自建数据集市(SQL)压平为宽表;平台不直接提供 |
| 2 | 唯一患者标识 | ✅ | 跨机构去重 PatientID;残余重复需敏感性分析 |
| 3 | 特殊字符处理 | ✅ | 结构化编码字段为主,编码统一映射标准本体 |
| 4 | 重复行 | ⚠️ | 平台级去重已完成;未链接重复需研究者自查 |
| 5 | 缺失编码 | ✅ | 缺失机制有实测数据支撑(77%/76%/90% 锚点) |
| 6 | 标签标识明确 | ⚠️ | 无官方标签层;结局标签由研究者构造 |
| 7 | 罕见类分组 | ⚠️ | 小样本计数被抑制,聚合层罕见亚组不可见 |
| 8 | 偏倚评估 | ✅ | 官方论文明示 vendor bias/文档差异/非检测偏倚 |
| 9 | 数据字典 | ✅ | 环境内 DATA_DICTIONARY 数据元素百科 |
| 10 | 信息性缺失解释 | ✅ | 缺失与机构/就医模式强相关,官方与论文有明确讨论 |
| 11 | 设备记录 | ⚠️ | 仅结构化输出,无设备元数据与原始信号 |
| 12 | 共线性 | ⚠️ | 无官方处理;编码映射关系(ICD↔SNOMED)天然共线 |
| 13 | 编码映射 | ✅ | SNOMED CT / LOINC / RxNorm 全映射 |
| 14 | 时间戳处理 | ⚠️ | 日期随机偏移保相对序;绝对日历信息缺失 |
| 15 | 划分建议 | ❌ | 无官方划分;平台形态决定了划分完全交给研究者 |
| 16 | 泄漏讨论 | ✅ | 跨机构重复/母婴链接/动态刷新三类泄漏路径明确(§5.3) |
| 17 | 标签分布 | ⚠️ | 无全局标签分布;已发表研究提供锚点(§4.2) |
| 18 | 测量偏倚 | ✅ | 机构接入数据质量检查 + 文档差异讨论(Howat, 2025) |
| 19 | 外部验证建议 | ✅ | 与 ILINet/VAERS/NHAMCS 对齐的先例(JSCDM, 2023) |
| 20 | 版本记录 | ⚠️ | 滚动更新、无研究者可固定快照;提取时间戳为唯一锚 |
| 21 | 预处理脚本 | ❌ | 无官方脚本;代码不可带出环境,需自建自管 |
| 22 | 合规要求 | ✅ | Terms/Rules of the Road/Governing Council/引用清单制度完备 |
| 23 | 多模态对齐 | ❌ | 无影像/信号/基因组模态;叙事文本 in development |
| 24 | 去标识化 | ✅ | HIPAA LDS + 专家判定双层机制,机制公开可查 |
DAIMS 评分:13.5 / 24
评分解读:得分子项集中在"数据治理与去标识化"(标识、字典、编码映射、合规、外部验证先例),失分项集中在"AI 工程基建"(无官方划分、无预处理脚本、无固定快照、无多模态)。这与 Cosmos 的产品定位一致——它是研究查询平台而非开箱即用的 ML 数据集:平台把"数据保真 + 治理"做到了厂商级水准,而把"建模基建"留给环境内研究者自建。
对你意味着什么:如果你需要"下载即训练"的 AI 数据集,Cosmos 不是答案(选 MIMIC-IV/eICU 类)。如果你的研究问题需要 3 亿+ 患者的统计功效、全国代表性或跨机构纵向轨迹,且你隶属 Epic 客户机构、愿意为认证培训付费、接受行级数据不出环境——Cosmos 是全美无可替代的选择。行动清单:① 先用免费的 SlicerDicer 验证队列可行性;② 预算中列入 $400-800 认证培训费;③ 设计阶段把"环境内冻结集市 + 提取时间戳"写进分析计划;④ 发表前核对 Publication Checklist 与引用清单义务。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| CDC 流感监测(ILINet 类) | 美国疾控系统 | 流感就诊趋势对齐 | 趋势一致性(定性) | 无系统性偏移报告 | 早期研究验证 Cosmos 与流感监测系统结果相似(Noel & Bartelt, 2023) |
| VAERS | 疫苗不良事件报告系统 | 疫苗不良事件信号对齐 | 信号检出一致性(定性) | 未报告 | 早期研究者比对结果相似(Noel & Bartelt, 2023) |
| NHAMCS | 全国医院门诊医疗调查 | 急诊就诊模式 | 分布一致性(定性) | 未报告 | 早期研究者比对结果相似(Noel & Bartelt, 2023) |
| 全国生命统计(出生证明) | 美国生命统计系统 | 母婴队列构成代表性 | 地域/种族构成分布相似 | 无实质漂移(纵向限制后亦稳定) | 262 万+ 妊娠队列与全国出生人群高度相似(Leonard et al., 2026) |
| CDC Mpox 应急监测 | CDC + Epic Research | JYNNEOS 疫苗真实世界效果 | 两剂 VE 66.0%(95% CI 47.4-78.1) | — | 病例对照设计基于 Cosmos 全国 EHR 数据,发表于 NEJM(Deputy et al., 2023) |
说明:Cosmos 生态以平台级外部对齐验证(前 4 行)与平台支撑的发表级研究(第 5 行)为主;不存在 Kaggle 式统一基准排行榜,不同研究的数值不可直接比较(任务、定义、人群均不同)。
§8 基准性能与生态
§8.1 代表性研究结果(非统一基准)
| 研究 | 任务 | 性能/结果 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| JYNNEOS 疫苗效果 | 猴痘疫苗真实世界 VE(病例对照) | 两剂 VE 66.0%(95% CI 47.4-78.1);单剂 35.8% | 2023 | 条件逻辑回归 + 全国 EHR 队列 | Deputy NP, et al. N Engl J Med. 2023;388(26):2434-2443. DOI: 10.1056/NEJMoa2215201 | 未公开 |
| 母婴链接队列 | 围产期纵向队列构建方法学 | 2,624,186 妊娠链接;多数变量完整度 >90% | 2026 | BirthFact 母婴链接 + 纵向限制敏感性分析 | Leonard SA, et al. medRxiv. 2026. DOI: 10.64898/2026.06.02.26354757 | 方法学流程公开 |
| 平台增长与基础设施 | 平台综述(非任务基准) | 330+ 机构、3 亿+ 记录、39% 5 年+ 数据、100+ 同行评审研究 | 2025 | 加密 HL7 CDA 摄取 + 双 SQL 库 + DSVM | Howat M, et al. Methods. 2025. DOI: 10.1055/a-2842-3407 | 不适用 |
| 机构采纳纵向分析 | 平台使用计量 | 152→229 机构(2021Q4-2023);2024 年底 54 篇出版物 | 2025 | 管理数据计量分析 | Gunderson MA, et al. Stud Health Technol Inform. 2025. DOI: 10.3233/SHTI250820 | 不适用 |
| 平台方法学立场论文 | 数据架构与治理综述 | 217M+ 患者、219 US 机构 + 1 黎巴嫩机构(2023 口径) | 2023 | Care Everywhere 原生链接 + 标准本体映射 | Noel A, Bartelt K. JSCDM. 2023;3(4):1-4. DOI: 10.47912/jscdm.246 | 不适用 |
不可直接比较声明:上表为不同任务/设计/年份的结果集合,VE、完整度、机构数等指标间无可比性;Cosmos 社区不存在统一排行榜,评估协议由各研究自行定义并接受期刊同行评审。
§8.2 SOTA 总结与选型建议
平台本身的"性能"体现在证据产出速度与规模:紧急公共卫生问题(新变异、新疫苗)可在周级完成全国尺度分析(Medscape, 2026);罕见病研究借助 3 亿+ 患者池获得传统网络数十年难以积累的样本。对 AI 团队的选型建议:以 Cosmos 做队列发现与全国尺度证据生成,以 MIMIC-IV 等开放 ICU 数据集做信号级方法学开发,两者互补而非竞争。
§8.3 评测协议
社区没有统一评测协议,但已发表研究形成了可复用的协议要素:表型定义四要素(编码版本/问题列表 vs 计费/实验室确认/观察窗)、按 PatientID 分组划分、与全国统计外部对齐、报告缺失完整度与敏感性分析。Epic Research 内部协议为双团队制(≥1 数据科学家 + ≥1 临床医师)+ 内部交叉审核 + 公开发布(Medscape, 2026)。
§8.4 相关数据集对比表
| 数据集 | 运营方 | 规模 | 访问模式 | 与 Cosmos 关系 |
|---|---|---|---|---|
| N3C | NIH NCATS | 1,600 万+ 患者、76 站点 | 凭证化分层访问(OMOP CDM) | 同为聚合 EHR 基础设施;N3C 聚焦 COVID、多站标准化转换 |
| All of Us | NIH | 数十万参与者 | controlled access(含基因组) | 主动招募志愿者队列;Cosmos 为就医人群、临床纵深更深 |
| TriNetX | TriNetX Inc. | 全球合作网络数千万患者 | 注册申请 + 患者级下载 | 队列构建与导出更灵活;Cosmos 规模与纵向去重更强(VCU, 2026) |
| PCORnet | PCORI | 1 亿+ 患者记录 | 分布式查询网络 | 联邦式 vs Cosmos 集中式 |
| MIMIC-IV | MIT LCP / BIDMC | 约 30 万患者 | PhysioNet 凭证化下载 | 开放可复现的单中心 ICU 深度数据,与 Cosmos 互补 |
| Optum/Truven claims | 商业数据商 | 数千万-亿级投保人 | 商业许可购买 | claims 无临床细节;Cosmos 临床保真更高且不可购买访问 |
§8.5 关键论文 Top 8
- Noel A, Bartelt K. Cosmos: Real World Data Powered by the Health Care Community. JSCDM. 2023;3(4):1-4. DOI: 10.47912/jscdm.246 —— 平台官方方法学立场论文:架构、数据类型、治理与差异化定位的一手来源。
- Howat M, Martell S, Tarabichi Y, Kaelber DC, Chen SS, Freedman H. Advancing Real-World Evidence Generation: Growth and Lessons Learned from the Early Years of Cosmos. Methods. 2025. DOI: 10.1055/a-2842-3407 —— 平台基础设施、增长指标(330+ 机构/3 亿+记录/39% 纵深)与局限性的最权威综述。
- Deputy NP, Deckert J, Chard AN, et al. Vaccine Effectiveness of JYNNEOS against Mpox Disease in the United States. N Engl J Med. 2023;388(26):2434-2443. DOI: 10.1056/NEJMoa2215201 —— Cosmos 支撑登上 NEJM 的疫苗效果研究,展示病例对照协议范式。
- Leonard SA, Dysart K, Callahan A, et al. Development of Longitudinal, Linked Maternal-Infant Cohorts using the Epic Cosmos EHR Dataset. medRxiv. 2026. DOI: 10.64898/2026.06.02.26354757 —— 可复制的母婴队列构建方法学与变量完整度实测。
- Gunderson MA, Dorr DA, Freedman H, Melton GB. A Longitudinal Analysis of Institutional Adoption, Use, and Dissemination of an EHR Vendor-Based Data Sharing Program. Stud Health Technol Inform. 2025. DOI: 10.3233/SHTI250820 —— 唯一量化平台采纳轨迹(152→229 机构、用户参与度)的独立分析。
- Deputy NP, et al.(CDC 合作系列)与 Epic Research 双团队研究的 CDC MMWR 合作产出 —— 展示 Cosmos 在国家应急监测中的时效价值。
- JAMA Network Open:Racial and ethnic differences in early diagnosis of autism spectrum disorder —— Cosmos 支撑的健康差异研究范式(cosmos.epic.com 学术发表列表)。
- Diabetes Care:COVID-19 与 1 型糖尿病关联研究 —— 展示全国尺度暴露-结局观察设计的可行性(同上)。
§8.6 社区活跃度
- 研究者规模:2021Q4-2023 期间独立用户数增长 3 倍(人均季度项目数 0.21-0.25,参与度仍有提升空间,Gunderson et al., 2025);
- 学术产出:2024 年底 54 篇出版物 → 2025 年 100+ 同行评审研究(Gunderson/Howat),增长曲线陡峭;
- 社区活动:高校 Cosmos 用户组主办数据马拉松(如 UTHealth Houston TMC 的 UTCD2026 datathon),优胜研究推荐至同行评审期刊并亮相 Epic XGM/UGM 大会;
- 持续发布:epicresearch.org 保持高频研究简报更新(2026 年仍在按周发布,如 GLP-1、高血压给药方案等主题);
- 机构渗透:UC Davis(2024 年末加入)、Ottawa Hospital/Atlas Alliance(2025-11 推进)等机构持续接入,说明社区仍在扩张期。
§8.7 生态快照表
| 资源 | 类型 | 链接 | 状态(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| Cosmos 官方主页 | 产品页 | https://cosmos.epic.com/ | 在线 | 平台能力与数据类型的官方口径 |
| Epic Research | 研究发布站 | https://www.epicresearch.org/ | 持续更新(周级) | Cosmos 快速研究的最佳实例库 |
| JSCDM 246 号论文 | 方法学论文 | https://www.jscdm.org/article/id/246/print/ | 开放获取 | 引用 Cosmos 时的首选学术锚点 |
| Methods 平台综述 | 综述论文 | DOI: 10.1055/a-2842-3407 | 期刊获取 | 最新规模指标与局限性的权威引用 |
| Stanford Cosmos 门户 | 机构接入指南 | https://med.stanford.edu/starr-tools/other-resources/cosmos/faq.html | 在线 | 访问流程/费用/FAQ 最详尽的公开材料 |
| VCU Cosmos Wiki | 机构接入指南 | https://wiki-vcu.atlassian.net/wiki/spaces/VCI/pages/1961820164/Cosmos+Data | 在线 | 数据构成/局限/使用场景的简洁汇总 |
| UTCD2026 Datathon | 社区活动 | https://e.easychair.org/cfp/UTCD2026 | 征稿结束(2026-02) | 了解 Cosmos 用户社区生态与培训体系 |
| UOttawa 接入指南 | 机构接入指南 | https://www.uottawa.ca/faculty-medicine/research-and-innovation/omari-newsletter-blogs/cosmos-powerful-data-resource-researchers | 在线 | 加拿大口径费用与角色体系 |
§9 相关资源与引用
§9.1 官方资源列表
| 资源 | 说明 |
|---|---|
| Cosmos 官方主页(cosmos.epic.com) | 平台定位、数据类型、代表研究的官方总览 |
| Epic Research(epicresearch.org) | 基于 Cosmos 的持续研究简报库,可提交研究问题 |
| Cosmos Portal | 参与机构研究者的聚合查询入口(SlicerDicer) |
| Epic Galaxy 培训目录 | COS305/COS500/COS550 认证课程报名入口 |
| Cosmos Terms & Rules of the Road | 数据使用协议与行为准则(经机构管理员分发) |
| DATA_DICTIONARY(DSVM 环境内) | 数据元素百科,行级研究设计的强制第一步 |
| Governing Council 通道 | 治理、合规与引用清单提交(每年两次) |
§9.2 BibTeX 完整引用
@article{Noel2023Cosmos,
author = {Noel, Andrea and Bartelt, Kersten},
title = {Cosmos: Real World Data Powered by the Health Care Community},
journal = {Journal of the Society for Clinical Data Management},
year = {2023},
volume = {3},
number = {4},
pages = {1--4},
doi = {10.47912/jscdm.246}
}
@article{Howat2025Cosmos,
author = {Howat, Meghan and Martell, Steven and Tarabichi, Yasir and Kaelber, David C. and Chen, Selina S. and Freedman, Harry},
title = {Advancing Real-World Evidence Generation: Growth and Lessons Learned from the Early Years of Cosmos},
journal = {Methods},
year = {2025},
doi = {10.1055/a-2842-3407},
pmid = {42523215}
}
@article{Deputy2023JYNNEOS,
author = {Deputy, Nicholas P. and Deckert, Joseph and Chard, Anna N. and Sandberg, Neil and Moulia, Danielle L. and Barkley, Eric and Dalton, Alexandra F. and Sweet, Cory and Cohn, Amanda C. and Little, David R. and Cohen, Adam L. and Sandmann, Danessa and Payne, Daniel C. and Gerhart, Jacqueline L. and Feldstein, Leora R.},
title = {Vaccine Effectiveness of {JYNNEOS} against Mpox Disease in the United States},
journal = {New England Journal of Medicine},
year = {2023},
volume = {388},
number = {26},
pages = {2434--2443},
doi = {10.1056/NEJMoa2215201}
}
@article{Gunderson2025Adoption,
author = {Gunderson, Melissa A. and Dorr, David A. and Freedman, Harry and Melton, Genevieve B.},
title = {A Longitudinal Analysis of Institutional Adoption, Use, and Dissemination of an {EHR} Vendor-Based Data Sharing Program},
journal = {Studies in Health Technology and Informatics},
year = {2025},
doi = {10.3233/SHTI250820},
pmid = {40775838}
}
@article{Leonard2026MaternalInfant,
author = {Leonard, Stephanie A. and Dysart, Kevin and Callahan, Alison and Siadat, Sara and Zhang, Jiaqi and Handley, Sara C. and Huybrechts, Krista F. and Igbinosa, Irogue and Bateman, Brian T.},
title = {Development of Longitudinal, Linked Maternal-Infant Cohorts using the {Epic Cosmos} Electronic Health Record Dataset},
journal = {medRxiv},
year = {2026},
doi = {10.64898/2026.06.02.26354757}
}
§9.3 引用指南
- 引用数据平台:引用 Noel & Bartelt(2023, JSCDM)作为平台方法学锚点,并致谢 “data from Epic Cosmos”(官方要求发布时致谢 Cosmos,Stanford Onboarding, 2026);
- 报告规模口径:注明数据提取时间(YYYY-MM)与当时官方口径(如 3 亿+ 去重患者,Howat et al., 2025),避免跨快照混用;
- 报告平台局限:vendor bias、非检测偏倚、日期偏移、差异缺失四项至少在 limitation 中讨论(参照 Howat et al., 2025);
- 合规动作:按 Cosmos Terms Section 2.3.1 在每半年一次的引用清单中登记你的发表物(Stanford Onboarding, 2026)。
§10 AI 使用声明卡
§10.1 AI 模型列表
| 环节 | 模型/工具 | 用途 |
|---|---|---|
| 资料检索与事实核验 | 检索增强 LLM(CodeBuddy 内置 fast-model) | 多轮 WebSearch 结果整理与交叉核验 |
| 文本生成 | 检索增强 LLM(同上) | 依据 FACTS 清单生成词条初稿 |
| 代码生成 | 检索增强 LLM(同上) | §6 SQL/Python 示例代码(概念表名示意,需环境内核对) |
| 质量校验 | check_md.py 脚本 | 结构、格式与纯净度自动检查 |
§10.2 AI 参与范围说明
AI 参与了本词条的全部文字初稿生成、检索结果归纳与代码示例编写;所有关键数字(患者规模、机构数、完整度、费用、疫苗效果)均锚定 FACTS.md 中记录的原始来源(官方论文、大学门户、新闻报道),由人工逐一回查原始链接后定稿。AI 不接触任何原始数据,本词条不含任何基于模型记忆的未核实数字。
§10.3 输入来源列表
- Noel A, Bartelt K. Cosmos: Real World Data Powered by the Health Care Community. JSCDM. 2023;3(4):1-4. DOI: 10.47912/jscdm.246
- Howat M, Martell S, Tarabichi Y, Kaelber DC, Chen SS, Freedman H. Advancing Real-World Evidence Generation: Growth and Lessons Learned from the Early Years of Cosmos. Methods. 2025. DOI: 10.1055/a-2842-3407
- Deputy NP, Deckert J, Chard AN, et al. Vaccine Effectiveness of JYNNEOS against Mpox Disease in the United States. N Engl J Med. 2023;388(26):2434-2443. DOI: 10.1056/NEJMoa2215201
- Gunderson MA, Dorr DA, Freedman H, Melton GB. A Longitudinal Analysis of Institutional Adoption, Use, and Dissemination of an EHR Vendor-Based Data Sharing Program. Stud Health Technol Inform. 2025. DOI: 10.3233/SHTI250820
- Leonard SA, Dysart K, Callahan A, et al. Development of Longitudinal, Linked Maternal-Infant Cohorts using the Epic Cosmos EHR Dataset. medRxiv. 2026. DOI: 10.64898/2026.06.02.26354757
- Epic Systems. Epic Cosmos 官方主页. https://cosmos.epic.com/ (截至 2026-09 快照)
- Epic Systems. Epic Research 研究发布站. https://www.epicresearch.org/ (截至 2026-09)
- Centralized and Federated Models for the Analysis of Clinical Data(PMC11571052,含 2022-02 Cosmos 规模引文)
- Stanford Medicine. Cosmos FAQ & Onboarding Guide. https://med.stanford.edu/starr-tools/other-resources/cosmos/faq.html (2026 口径)
- VCU Innovation Gateway. Cosmos Data Wiki. https://wiki-vcu.atlassian.net/wiki/spaces/VCI/pages/1961820164/Cosmos+Data (2026 口径)
- CTPH (Texas). Epic Cosmos 说明页. https://www.ctph-texas.org/epiccosmos-1 (2025 口径)
- University of Ottawa. Cosmos: A Powerful Data Resource for Researchers. https://www.uottawa.ca/faculty-medicine/research-and-innovation/omari-newsletter-blogs/cosmos-powerful-data-resource-researchers (2025-11)
- UC Davis Health. Epic - Cosmos. https://health.ucdavis.edu/data/epic-cosmos.html (2025 口径)
- Dartmouth Geisel. Epic Cosmos User Guidelines. https://geiselmed.dartmouth.edu/student-research?p=1978 (2026 口径)
- Medscape Medical News(经 Upcontent 存档). Inside Epic’s Rapid-Fire Research Machine (2026)
- Nemours Well Beyond Medicine Podcast. Harnessing Real-World Data with Epic(2025,Epic 数据研究副总裁访谈)
- The Big Unlock. Epic 访谈:Cosmos 与点 of care 证据(2022-02-28)
- UTHealth Houston TMC. UTCD2026 Cosmos Datathon CFP(2026)
- healthaidb.com. Epic Cosmos 产品档案(转述官方 about 页,2026-09)
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1 概览与规模数字 | 千方病案医学编辑部 | 逐项回查官方论文与机构门户原文 | ✅ 已通过/已验证 |
| §2 医学背景与 ICD-11/SNOMED 映射 | 千方病案医学编辑部 | 编码表人工比对 WHO/标准本体公开编码 | ✅ 已通过/已验证 |
| §3-§5 规格与结构描述 | 千方病案医学编辑部(数据工程) | 对照 JSCDM/Methods 论文与 Stanford/VCU 门户交叉核验 | ✅ 已通过/已验证 |
| §6 代码示例 | 千方病案医学编辑部(数据工程) | 逻辑走查;标注"表名以环境内字典为准"边界 | ✅ 已通过/已验证 |
| §6.5 坑点 8 项 | 千方病案医学编辑部(数据工程) | 每项坑点回溯至少一个原始来源 | ✅ 已通过/已验证 |
| §7 DAIMS 与偏倚评估 | 千方病案医学编辑部 | 24 项逐条对照事实清单评分 | ✅ 已通过/已验证 |
| §8-§9 引文与 BibTeX | 千方病案医学编辑部 | DOI/PMID 逐条检索回验 | ✅ 已通过/已验证 |
| §10 声明卡与免责声明 | 千方病案医学编辑部 | 比对金标准固定文本与平台状态 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
本词条正文各章节初稿均由 AI 依据核实后的事实清单生成,人工完成事实回查、数字校正、表述审校与结构定稿;无任何章节在无人工审核的情况下直接发布。
§10.6 最后人工审核日期
2026-09-05(与 §0.3 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- gemini — 共享标签:电子健康记录 / 公共卫生与流行病学 / 临床电子病历 / 真实世界数据
- qresearch — 共享标签:电子健康记录 / 公共卫生与流行病学 / 临床电子病历 / 流行病学
- nhs-hes — 共享标签:电子健康记录 / 公共卫生与流行病学 / 临床电子病历 / 真实世界数据
- iqvia-disease-analyzer — 共享标签:电子健康记录 / 临床电子病历 / 流行病学 / 真实世界数据
- maternal-ultrasound-nutrition — 共享标签:电子健康记录 / 公共卫生与流行病学 / 真实世界数据
- n3c — 共享标签:电子健康记录 / 公共卫生与流行病学 / 临床电子病历 / 真实世界数据
- swedish-npr — 共享标签:电子健康记录 / 公共卫生与流行病学 / 临床电子病历 / 流行病学
- seer-nci — 共享标签:电子健康记录 / 公共卫生与流行病学 / 临床电子病历
- flatiron-health — 共享标签:电子健康记录 / 临床电子病历 / 真实世界数据
- framingham — 共享标签:电子健康记录 / 公共卫生与流行病学 / 流行病学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
