信息速览

Komodo Healthcare Map — 美国患者级理赔数据平台 AI-Ready Wikipedia
INFOBOX
| 字段 | 值 |
|---|---|
| 数据集名称 | Komodo 医疗地图 |
| 英文全称 | Komodo Healthcare Map |
| 别名/简称 | Healthcare Map / Komodo Map / HCM |
| 疾病分类(ICD-11 编码+中文名) | 全疾病谱系覆盖;无单一 ICD-11 锚定,队列按治疗领域以 ICD-10-CM/ICD-9-CM、ICD-10-PCS、CPT、HCPCS、NDC 代码集定义 |
| SNOMED CT | 官方未披露 SNOMED CT 原生映射;分析层以 HIPAA 标准交易代码集与 OMOP CDM 术语映射为主 |
| 数据模态 | 行政理赔(医疗+药房)为主 + 实验室结果 + 结构化 EHR + 基因组学 + 死亡登记 + 社会经济与地理(SDOH) |
| AI 任务类型 | 队列构建、流行病学估计、患者旅程建模、疾病进展预测、罕见病识别、治疗依从性预测、合成对照臂、健康差异分析 |
| 样本总数 | 3.3 亿+ 去标识化患者;1 万亿+ 关联记录;每日新增约 1,500 万临床就诊 |
| 数据大小 | 官方未披露完整数据集导出体积 |
| 数据格式 | 云平台查询 API、OMOP CDM 兼容关系表、Snowflake Marketplace 共享数据集 |
| 许可证 | 商业许可(企业订阅 / Snowflake Capacity Drawdown);无公开开源许可 |
| 访问级别 | 商业许可(含学术合作通道,需双边协议) |
| DUO 标签 | NPUNCU(非商业非营利)+ IRB(学术合作需伦理批准)+ GS(地理限制:以美国为主) |
| 语言 | 英语(含结构化代码集) |
| 首发日期 | 2014 年(公司创立并启动 Healthcare Map 建设) |
| 最后更新 | 每日刷新;本词条数据截至 2026-09 |
| 发布机构 | Komodo Health, Inc.(旧金山) |
| 官方主页 | https://www.komodohealth.com |
| 下载地址 | 无公开下载;经销售准入或 Snowflake Marketplace 获取 |
| DOI | 无(商业平台,非学术 DOI 数据集) |
| 引用次数 | 官方口径 250+ 同行评审研究(截至 2025-09,Komodo Health 新闻稿) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 数据已去重、规范化至 OMOP 兼容 schema、每日刷新,具备分析就绪性;但无公开划分、无预处理脚本、无自助获取通道,全部依赖商业协商,AI 工作流需在使用方一侧自行实现 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(全疾病谱系代码集锚定、真实世界数据临床任务定义、参考标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05 审核方式:交叉审核
利益冲突声明:千方病案医数集与 Komodo Health, Inc.、Datavant、Snowflake 无任何商业利益关联。本页面不销售 Komodo Healthcare Map 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 Komodo Health 的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。Komodo Healthcare Map 为商业许可数据资产,访问需与 Komodo Health, Inc. 签署企业级合同或通过 Snowflake Marketplace 的 Capacity Drawdown 交易,学术使用须另行协商合作协议。本页面描述的数据结构、字段与访问机制来源于公开新闻稿、官方方法论说明与同行评审论文,实际以合同交付物为准。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? Komodo Healthcare Map 是一张"美国医疗系统的地图",但它画的不是道路和城市,而是人。它以去标识化的医疗保险理赔记录为骨架——每一次看病、每一个诊断、每一张处方——再叠加实验室检验结果、电子病历、基因组检测、死亡登记以及人口普查级别的社会经济信息,把同一个人在美国医疗系统中留下的所有足迹串成一条连续的时间线。这张地图目前覆盖 3.3 亿以上去标识化患者,关联记录超过 1 万亿条,从 2015 年延续至今,并且每天都在刷新。
为什么重要? 传统医疗数据是碎片化的:医院有医院的病历,保险公司有理赔记录,实验室有检验结果,彼此不通。研究者想回答"这个病人从出现症状到确诊花了多久""为什么这些人停药了"这类问题时,往往只能看到其中一个片段。Komodo 的价值在于把碎片连成旅程——它不追求拥有某一家医院的完整病历,而是追求把同一个人在不同机构、不同支付方、不同照护场景中的记录链接起来,形成跨机构、跨险种的纵向视图。这正是真实世界证据(RWE)与卫生经济学研究(HEOR)最稀缺的底层能力。
我能用它做什么? 如果你做流行病学,可以用它估计某种疾病的患病率、就诊路径与地理分布;如果你做罕见病,可以从中筛出候选患者队列、评估临床试验可行性并优化研究中心选址;如果你做药物经济学,可以追踪治疗依从性、换药节点与停药原因,构建合成对照臂。需要牢记的是:这不是一个可以直接下载的开放数据集,它是需要商业授权的平台,而且它的临床细节受制于计费编码——肿瘤分期、精确血压、自由文本病程记录通常拿不到。
§1.1 摘要
Komodo Healthcare Map 的技术路线可以概括为"以理赔为骨架、以增强层补深度、以实体解析保贯通"。底层是 Komodo 从支付方、医疗提供方与专科数据伙伴处获得的行政医疗理赔与药房理赔,外加通过 CMS Qualified Entity 认证(2017-08-21)与 CMS Innovator’s License 接入的 Medicare、Medicaid 与 Medicare Advantage 数据。所有输入先经过去标识化与 Datavant tokenization,把患者身份替换为持久的加密假名 token;随后进入去重、规范化与纠错流水线,把同一提供者—患者同一次就诊产生的多条报销记录合并为单一可计费就诊,并解析跨来源的重复理赔。
在这层骨架上,Komodo 通过 MapEnhance 叠加专科数据:合作方涵盖 Invitae、PointClickCare、Trio Health、GeneDx(60 万+外显子与基因组)、COTA Healthcare、Veradigm,以及 Komodo 自建的临床观察值、实验室结果、自报种族与族裔、参保状态与死亡数据。经过标准化后,数据以 OMOP CDM 兼容 schema 组织,向用户通过 MapLab、MapExplorer、MapView、Prism、Sentinel 等应用交付,2025 年起并可通过 Snowflake Marketplace 以 Capacity Drawdown 方式交易。每日约 1,500 万新增临床就诊持续汇入,使这张地图保持接近实时的更新频率。
§1.2 战略价值分析
维度一:跨险种、跨机构的纵向贯通能力。 美国医疗数据的结构性缺陷不在于总量不足,而在于同一患者的记录散落在互相不可见的孤岛中。一个患者可能在商业保险下完成初诊,换工作后转入 Medicare Advantage,期间在零售诊所、急诊、专科中心反复就诊,每一段记录都归属于不同的数据持有者。Komodo 的核心竞争力是把这些片段链接回同一个 token,并区分"open claims"(仅能观察到网络内部分行为)与"closed claims"(可观察到患者在特定时间窗内的全部行为,即 payer-complete)。官方口径下 Map 包含约 1.6 亿年度 closed、可链接患者,另在学术合作材料中提到 1.5 亿纵向 payer-complete 数据集。这一区分对研究设计至关重要:只有当患者的照护在一个时间窗内是完整可见的,治疗依从性、换药、停药这类"行为"指标才可信。
维度二:罕见病与未诊断患者发现。 在大规模理赔数据上做罕见病研究,难点不在于样本量,而在于信号稀疏——一个超罕见病种在全国可能只有数千例,且缺乏专属 ICD-10 码,患者往往被记为症状码或被误诊。Komodo 的策略是用代理队列(proxy cohort)配合机器学习模型,从处方模式、检验序列与就诊路径中反推潜在患者。官方披露的实践证明这条路径可行:与 NeoGenomics 合作验证了识别 HR+/HER2- 转移性乳腺癌患者的 ML 算法;与学术团队合作构建了识别纯合子家族性高胆固醇血症(HoFH)的模型,相关成果发表于 Nature Scientific Reports。这条能力直接对接制药行业最昂贵的决策——临床试验可行性与患者招募,据行业统计有高达 80% 的临床试验未能按期完成招募。
维度三:为监管级真实世界证据提供数据底座。 美国 FDA 近年来持续发布关于在监管提交中使用真实世界证据的指南,对数据来源、标准与流程提出结构化要求。Komodo 的定位是成为这类提交的数据基底。代表性案例是与 Intercept Pharmaceuticals 合作的 HEROES-US 研究:该公司的 COBALT 随机对照试验因患者招募困难而终止,转而使用 Komodo 平台链接理赔与实验室数据构建回顾性观察研究,比较接受 Ocaliva 治疗的原发性胆汁性胆管炎(PBC)患者与符合条件但未接受治疗的患者,结果显示治疗组无事件生存期有统计学显著改善,结果在美国肝病研究学会(AASLD)发布。此外 Komodo 研究团队针对 FDA 强制推行的氯氮平 REMS 项目开展的全尺度流行病学研究,被 ISPOR 2024 评为前 5% 研究。
§1.3 同类数据集横向对比
| 平台 | 覆盖规模(官方口径) | 数据骨架 | 增强层 | 标注/加工方式 | 获取方式 | 差异化定位 |
|---|---|---|---|---|---|---|
| Komodo Healthcare Map | 3.3 亿+去标识化患者,1 万亿+关联记录 | 医疗+药房理赔(open + closed) | 实验室、基因组、EHR、死亡率、种族族裔、SDOH | 专有去重/规范化/纠错,OMOP CDM 兼容 | 商业订阅、Snowflake Marketplace、学术合作 | 强调 closed claims 的 payer-complete 纵向完整性;联邦 CMS 数据授权 |
| 与 Truveta 同属美国真实世界数据平台 | 以会员医疗系统贡献为主 | 电子健康记录为主 | 理赔、死亡率等 | 会员系统 EHR 归一化 | 会员制 + 商业授权 | 优势在 EHR 内的临床深度与检验细节 |
| 与 Epic Cosmos 同属美国真实世界数据平台 | 以 Epic 客户机构覆盖人口计 | EHR 原始记录 | 有限 | 直接查询,不导出原始数据 | 参与机构研究者申请 | 强调在 Epic 生态内即可分析,无需数据搬移 |
| 与 Flatiron Health 同属肿瘤 RWD 平台 | 以肿瘤患者为主 | 肿瘤专科 EHR + 理赔 | 基因组、肿瘤登记 | 人工抽象(abstraction)为核心 | 商业授权 | 肿瘤领域的人工抽取深度远超理赔型平台 |
| 与 MarketScan 同属美国理赔数据库 | 以商业保险会员为主 | 商业理赔 | 有限 | 标准化理赔表 | 商业授权 | 历史悠久、覆盖面广,但以 open claims 为主 |
| 与 Optum Clinformatics 同属美国理赔数据库 | 以大型支付方会员为主 | 商业与 Medicare Advantage 理赔 | 实验室结果(部分) | 标准化理赔表 | 商业授权 | 支付方自有数据,纵向连续性好 |
需要说明的是,上述平台的规模数字采用各自的官方口径,彼此不可直接比较:有的按"曾经在医疗系统中建档的人数"统计,有的按"某一年度有可观察理赔的人数"统计,有的按"会员医疗机构覆盖人口"统计。在做选型时,应优先对齐与自己研究问题相匹配的口径——例如研究罕见病时,"payer-complete 患者数"比"总覆盖患者数"更有意义。
§1.4 版本演进时间轴
| 时间 | 事件 | 意义 |
|---|---|---|
| 2014 | Arif Nathoo(MD)与 Web Sun 联合创立 Komodo Health,总部旧金山 | 平台起点,同期启动 Healthcare Map 建设 |
| 2015 | 种子轮 212 万美元(Felicis Ventures、IA Ventures) | Healthcare Map 数据的时间起点即 2015 年 |
| 2017-08-21 | 取得 CMS Qualified Entity(QE)认证 | 首次获得 Medicare Part A/B/D 理赔数据的合法使用权,覆盖全美 50 州及哥伦比亚特区 |
| 2020-01-08 | Series C 5,000 万美元(Andreessen Horowitz 领投) | 估值进入 10 亿美元区间 |
| 2021-01-11 | Series D 4,448 万美元 | 产品从单一 Aperture 扩展为套件 |
| 2021-01-11 | 收购 Maven | 补强企业级生命科学产品能力 |
| 2021-03-22 | Series E 2.2 亿美元(Tiger Global 领投) | 估值升至 33 亿美元 |
| 2021-04-14 | 发布 Prism 与 Sentinel | 从"数据+报表"转向"队列构建+开发者算法平台" |
| 2021-07-26 | 收购 Breakaway Partners | 构建市场准入与处方政策解决方案 |
| 2022-11 | 结构化股权融资 2 亿美元(Coatue 领投),裁员 9% | 宏观环境收紧下的效率调整 |
| 2024-05 | ISPOR 2024:33 项 HEOR 研究采用其平台 | 学术与产业生态规模化 |
| 2024 | 获 CMS Innovator’s License | 可接入覆盖 1.3 亿+受益人的 Medicare/Medicaid/MA 数据用于研究 |
| 2025-03-31 | Series F 5,000 万美元,投后估值 37.1 亿美元 | 累计融资约 5.14 亿–5.87 亿美元 |
| 2025-05 | 与 Nasdaq Data 合作推出 NMCI 数据集,进入金融服务领域 | 数据价值外溢至非医疗行业 |
| 2025-05-14 | ISPOR 2025:31 项研究报告(3 项由 Komodo 研究者主导) | 累计同行评审研究超 250 项 |
| 2025 | 发布 Marmot 医疗原生 AI 引擎 | 从分析工具走向可复现、可审计的 agentic AI |
| 2025-09-30 | 入选 Forbes Cloud 100、TIME 首届 World’s Top HealthTech Companies | 行业认可度标志 |
| 2025-10 | Healthcare Map 上线 Snowflake Marketplace | 通过 Capacity Drawdown 交易,缩短采购周期 |
§1.5 典型 AI 应用场景
| 场景 | 输入数据 | 典型模型/方法 | 输出 | 关键约束 |
|---|---|---|---|---|
| 罕见病未诊断患者发现 | 理赔诊断码序列、专科处方、检验项目记录 | 梯度提升树 / 逻辑回归 + 代理队列规则 | 患者层面患病概率排序 | 无专属 ICD-10 码时须依赖高级治疗(如特定处方)作为阳性锚点,会漏掉年轻患者 |
| 治疗依从性与持久性分析 | 药房理赔(NDC、days supply、fill date)+ 医疗理赔 | 生存分析(Kaplan-Meier、Cox)、PDC/MPR 计算 | 停药节点、换药路径、依从率分布 | 必须限定在 closed claims 时间窗内,否则院外购药会被误判为停药 |
| 临床试验可行性与选址 | 患者地理分布(ZIP3)、诊断与就诊记录、提供者网络 | 空间聚类、站点半径内合格患者计数 | 推荐研究中心与预期招募量 | 地理仅到 ZIP3,无法做精细化可达性建模 |
| 疾病负担与流行病学估计 | 全量理赔 + 人口普查分母 | 分层率计算、标准化率、中断时间序列 | 按年龄/性别/族裔/地理分层的患病率 | 高筛查率治疗领域须用多次理赔确认诊断,否则队列膨胀 |
| 治疗路径与结局比较 | 纵向理赔序列 + MapEnhance 实验室结果 | 目标试验模拟、倾向评分匹配 | 比较效果、安全性信号 | 观察性数据仅支持关联,因果推断须严谨设计并做敏感性分析 |
| 健康公平与 SDOH 分析 | 自报种族族裔(约 65% 覆盖)、ZIP3、社会经济插补 | 差异分解、交互作用模型 | 不同人群的照护差异指标 | 35% 缺失的族裔数据若为非随机缺失,会系统性偏倚差异估计 |
§2 医学背景
§2.1 ICD-11 疾病分类锚定
与 MIMIC 这类围绕特定疾病谱构建的临床数据集不同,Komodo Healthcare Map 覆盖全疾病谱系,因此不存在单一的 ICD-11 锚定编码。平台的队列定义工作在 HIPAA 规定的标准交易代码集上完成:诊断使用 ICD-9-CM 与 ICD-10-CM,住院操作使用 ICD-10-PCS,门诊操作使用 CPT,医疗耗材与药品使用 HCPCS,处方药使用 NDC。下表给出平台最常用于分析的疾病大类及其与 ICD-11 章节的对应关系。
| 疾病大类 | ICD-11 章节编码 | 中文名 | 平台内典型代码集 | 典型分析用途 |
|---|---|---|---|---|
| 肿瘤 | 02 | 肿瘤 | ICD-10-CM C00–D49;CPT 964xx 化疗给药;NDC 抗肿瘤药 | 患病率、治疗路径、CAR-T 与化疗结局比较 |
| 内分泌与代谢 | 05 | 内分泌、营养或代谢疾病 | ICD-10-CM E00–E89;NDC 降脂药、降糖药 | HoFH 与家族性高胆固醇血症识别、MASH 早筛 |
| 循环系统 | 11 | 循环系统疾病 | ICD-10-CM I00–I99;CPT 冠脉介入 | 心血管风险分层、他汀依从性 |
| 精神与行为 | 06 | 精神、行为或神经发育障碍 | ICD-10-CM F01–F99;NDC 抗精神病药 | 氯氮平 REMS 效应评估、抗精神病药短缺影响 |
| 神经系统 | 08 | 神经系统疾病 | ICD-10-CM G00–G99;NDC 抗癫痫药 | 癫痫(LGS)、嗜睡症、ALS 治疗结局 |
| 消化系统 | 13 | 消化系统疾病 | ICD-10-CM K00–K93;NDC 熊去氧胆酸类 | 原发性胆汁性胆管炎(PBC)真实世界结局 |
| 眼与附属器 | 09 | 视觉系统疾病 | ICD-10-CM H00–H59;CPT 玻璃体腔注射 | 黄斑变性药物安全性 |
| 肌肉骨骼 | 15 | 肌肉骨骼系统或结缔组织疾病 | ICD-10-CM M00–M99;NDC 双膦酸盐 | 骨质疏松药与感染结局关联研究 |
| 感染性疾病 | 01 | 某些感染性或寄生虫病 | ICD-10-CM A00–B99;CPT 检测项目 | COVID-19 检测、疫苗接种与照护中断 |
| 症状与影响因素 | 21 / 24 | 症状、体征或临床所见;影响因素 | ICD-10-CM R00–R99 与 Z00–Z99 | 未诊断患者的代理信号、筛查行为、REMS 监测 |
补充说明:当某个治疗领域存在专属 ICD 码时,Komodo 的覆盖在罕见、中等与大型治疗领域均表现良好;当不存在专属 ICD 码时,必须使用相关代码与临床输入构建代理队列。高筛查率的治疗领域存在一个特有的陷阱——筛查行为可能被误读为确诊,导致队列规模大于流行病学预期。
§2.1b SNOMED CT 映射
官方材料未披露 Komodo Healthcare Map 在交付层使用 SNOMED CT 原生编码。这是因为美国行政理赔体系以 ICD、CPT、HCPCS、NDC 为法定交易代码集,而不是以临床术语集为轴。对于需要 SNOMED CT 语义的下游应用,通行做法是在使用方一侧通过 OMOP CDM 的标准概念表(SNOMED CT 为其重要来源)完成映射。下表列出本平台最常用代码集与 SNOMED CT 语义域的参照关系,供跨数据集整合时参考。
| 标签 | 平台内代码体系 | SNOMED CT 语义域(参照) | 术语说明 |
|---|---|---|---|
| 2 型糖尿病 | ICD-10-CM E11.x | 73211009 Diabetes mellitus | 代谢性疾病,理赔中常以并发症码组合确证 |
| 高脂血症 | ICD-10-CM E78.0–E78.5 | 55822004 Hyperlipidemia | 罕见亚型(HoFH)无专属码,须借处方锚定 |
| 精神分裂症 | ICD-10-CM F20.x | 58214004 Schizophrenia | 抗精神病药依从性与安全性研究核心人群 |
| 原发性胆汁性胆管炎 | ICD-10-CM K74.3 | 31742004 Primary biliary cirrhosis | 罕见肝病,RWD 研究的重要场景 |
| 癫痫(Lennox-Gastaut 综合征) | ICD-10-CM G40.4x | 230424005 Lennox-Gastaut syndrome | 罕见癫痫亚型,治疗负担研究常见 |
| 黄斑变性 | ICD-10-CM H35.3x | 414173003 Age-related macular degeneration | 抗 VEGF 药物安全性监测场景 |
| 中性粒细胞减少症 | ICD-10-CM D70.x + 实验室 ANC 值 | 165517008 Neutropenia | 需 MapEnhance 实验室层联动方可分级 |
| COVID-19 | ICD-10-CM U07.1 | 840539006 COVID-19 | 大流行期间照护中断与差异研究 |
§2.2 疾病简介与真实世界研究的临床语境
Komodo Healthcare Map 的"疾病"不是单一病种,而是美国医疗系统中被计费的全部照护行为。理解这个平台需要换一个视角:它记录的不是病理生理,而是医疗系统对病理生理的行政反应——患者何时求医、被赋予什么诊断码、接受了什么操作、拿到什么药、由谁开具、在哪里发生。这一视角既是它的力量(可覆盖全人群、跨机构、可链接),也是它的边界(编码服务于报销,不服务于临床认知)。
从流行病学角度,这种数据最适合回答三类问题。第一类是描述性问题:某种疾病在人群中分布如何、随时间的趋势怎样、在地理与人群亚组间有何差异。第二类是路径性问题:患者从首次症状相关编码出现,到确诊、到起始治疗、到换药或停药,各环节的间隔与分叉点在哪里。第三类是比较性问题:在真实世界条件下,不同治疗选择对应的结局分布如何。第三类问题风险最高——观察性数据中的治疗分配并非随机,存在适应证混杂、健康使用者偏倚等系统性干扰,必须以严谨的因果推断框架处理。
需要特别强调未参保人群的系统性缺失。据官方方法论说明,未参保人群不在 Healthcare Map 中,不接受保险的诊所(如部分心理健康机构)患者同样缺失,加州 Kaiser Permanente 网络内患者也完全不包含。这三点共同意味着:任何基于该平台的患病率估计,都隐含了"有保险且被覆盖支付方网络捕获"这一条件。对于与保险覆盖强相关的疾病(如糖尿病、心血管疾病),这一条件带来的偏倚相对温和;对于与保险覆盖弱相关或负相关的疾病(如某些精神健康问题、物质使用障碍),偏倚方向与量级需要单独评估。
§2.3 临床任务定义(真实世界数据语境)
| 任务类型 | 定义 | 平台内实现方式 | 典型评价指标 |
|---|---|---|---|
| 人群筛查与患者发现 | 从全量患者中识别符合特定临床或研究标准的个体 | 代码集规则 + 代理队列 + ML 分类器(Prism / Sentinel) | 阳性预测值、敏感度、队列规模与流行病学预期的一致性 |
| 队列可行性评估 | 评估某临床试验方案在给定时间窗内的合格患者规模与地理分布 | 诊断/治疗/检验序列规则 + ZIP3 地理聚合 | 合格患者计数、站点半径内覆盖量 |
| 治疗路径刻画 | 重建诊断到治疗、换药、停药的时序过程 | 纵向理赔序列聚合 + 时间窗切分 | 路径覆盖率、中位间隔时间、序列稳定性 |
| 疾病进展与预后建模 | 预测从某状态到目标结局的转移概率 | 生存模型、梯度提升、深度学习序列模型 | C 指数、校准曲线、外部验证一致性 |
| 安全性信号监测 | 识别药物暴露后的不良事件发生率变化 | 中断时间序列、自身对照设计、倾向评分匹配 | 事件率比、置信区间、时序中间断点显著性 |
| 比较效果研究 | 在真实世界条件下比较不同治疗策略 | 目标试验模拟、倾向评分加权、工具变量 | 效应估计值、敏感性分析稳健性 |
| 健康公平分析 | 量化不同人群中照护可及性与结局的差异 | 按自报种族族裔/ZIP3/参保类型分层 | 率差、率比、人群归因分数 |
§2.4 患者人群特征
| 维度 | 特征 | 说明与来源 |
|---|---|---|
| 数据来源 | 支付方与提供方的医疗理赔、药房理赔,外加 MapEnhance 专科数据 | 官方标准方法论说明 |
| 时间范围 | 2015 年至今 | 官方标准方法论说明;多篇论文明确"数据仅回溯至 2015 年" |
| 年龄覆盖 | 全年龄段;但儿童与年轻患者的实验室、治疗与诊断信息极其稀疏 | HoFH 论文 limitation 明确记载 |
| 性别 | 按参保记录、入院日期、门诊服务或照护开始时所记录的性别;类别为男性、女性、未知 | 官方标准方法论说明 |
| 种族与族裔 | 主要基于患者自报;覆盖约 65% 的唯一患者;类别对齐美国人口普查(白人、黑人或非裔美国人、亚裔或太平洋岛民、其他;族裔为西班牙裔或拉丁裔) | 官方标准方法论说明 |
| 参保类型 | Medicare、Medicaid、商业保险 | 官方新闻稿与标准方法论说明 |
| 就医类型 | 网络内、网络外、专科、急诊中心、零售诊所 | 官方标准方法论说明 |
| 地理粒度 | 患者理赔记录地址,聚合至 ZIP3 级别 | 官方标准方法论说明 |
| 明确排除人群 | 未参保人群;不接受保险的诊所(如部分心理健康机构)患者;加州 Kaiser Permanente 网络内患者 | 官方标准方法论说明 |
| 分析中的人口分母 | 州级率通常按每 10 万人计算,使用美国人口普查定义的人口规模 | 官方标准方法论说明 |
| 统计口径注意 | 同时自报白人与西班牙裔/拉丁裔的患者,在含种族族裔的分析中仅计入后者,以避免重复计数 | 官方标准方法论说明 |
§2.5 临床价值
缩小照护差距的量化基础。 医疗系统长期面临一个困境:知道"存在照护差距",但无法量化差距在哪、有多大、影响谁。理赔型纵向数据提供了一个可量化、可复现、可比较的标尺。当同一套代码集与队列逻辑被应用于全国 3.3 亿患者时,不同地区、不同支付方、不同人群亚组之间的照护路径差异变得可以直接度量,而不是停留在个案观察层面。Komodo 与患者倡导组织的合作(如胆管癌基金会、美国哮喘与过敏基金会)正是把这一能力用于具体疾病领域的典型案例。
加速临床试验的可行性判断。 临床试验失败的一个主要原因是招募不达标,行业统计显示高达 80% 的试验未能按期完成招募。问题的根源往往在于可行性评估依据的流行病学估计与实际可招募人群之间存在落差。把合格标准翻译为理赔代码序列、在真实的患者旅程上运行、并按地理聚合,可以把"某地大概有多少患者"变成"某研究中心半径内有多少近期可触达的合格患者"。Komodo 与 Janssen 于 2021 年的合作、与 Syneos Health 的"Lab to Life"企业级合作,都是围绕这一价值展开。
为监管与报销决策提供证据。 FDA 关于真实世界证据在监管提交中应用的指南持续推进,为 RWE 的使用建立了更清晰的数据来源、标准与流程要求。在这一框架下,数据的规模与完整性直接决定了证据的可接受性。Komodo 通过 CMS Qualified Entity 与 Innovator’s License 获得的联邦数据授权,以及其 closed claims 的 payer-complete 特性,使其在这类场景中具备结构性的数据优势。氯氮平 REMS 项目评估与 PBC 的 HEROES-US 研究,是两个已有公开记录的代表性案例。
§2.6 金标准/参考标准
| 维度 | 说明 |
|---|---|
| 参考标准性质 | 行政理赔记录本身即"实际发生的照护"的权威记录,但它不是临床诊断的金标准 |
| 诊断确认方式 | 无独立人工复核;确诊以代码集规则下的多次理赔确认或特定治疗暴露为代理 |
| 队列划分依据 | 用户自定义的代码集 + 时间窗 + 就诊次数要求(Prism / MapLab 中配置) |
| 实验室真值 | MapEnhance 层可接入结构化的检验结果(如绝对中性粒细胞计数 ANC),为部分研究提供客观阈值 |
| 结局确认方式 | 以理赔端的结局事件(住院、急诊、特定操作、死亡登记)为代理终点 |
| 死亡数据来源 | MapEnhance 中的死亡登记与死亡率数据 |
| 编码核对 | 专有去重、规范化与纠错流水线处理医疗记录中的不一致,但不对临床准确性做人工复核 |
| 已知的代理风险 | 高筛查率治疗领域中,筛查可能被误读为确诊;无专属 ICD 码时,须依赖高级治疗暴露锚定阳性 |
| 交叉验证方式 | 与外部注册登记(如国家级眼科登记)或客户自有专有数据链接比对(如 Myriad Genetics 的孕龄编码验证) |
| 可审计性 | 平台强调每个数据元素可回溯至来源(federated 获取流程 + 随机质量抽检) |
§3 数据集规格
§3.0 版本抉择矩阵
与有明确 v1.0/v2.0 版本号的数据集不同,Komodo Healthcare Map 是一个持续刷新的动态资产。真正的"版本抉择"发生在数据切片与交付形态层面。
| 你的需求 | 推荐切片/交付形态 | 规模口径 | 理由 |
|---|---|---|---|
| 需要观察患者在某时间窗内的完整医疗行为 | closed claims(payer-complete)切片 | 年度约 1.6 亿 closed、可链接患者 | open claims 只能看到网络内行为,会把院外照护误判为缺失,导致停药、换医生等结论失真 |
| 需要最大样本量做流行病学估计 | 全量 open + closed 合并视图 | 3.3 亿+患者 | 样本量优先,但须在方法学上说明 open claims 的可见性局限 |
| 需要实验室指标作为客观终点 | 平台默认 + MapEnhance 实验室增强层 | 实验室结果约 7,300 万条(官方披露口径) | 只有链接实验室层才能获得如 ANC 这类数值型指标,实现中性粒细胞减少分级 |
| 需要罕见病遗传学证据 | 平台默认 + GeneDx 基因组增强层 | 60 万+外显子与基因组 | 理赔编码无法表征基因型,须叠加基因组数据 |
| 需要自建算法与 ML 模型 | Sentinel 开发者应用 | 按合同约定的数据域 | Sentinel 允许把客户自有专有数据与 Map 链接,构建自定义模型与算法 |
| 需要快速探索、不做数据工程 | MapExplorer / MapView / MapLab | 即时报 3.3 亿患者旅程 | 预置看板与无代码工作流,跳过数据搬移与建模环节 |
| 需要在自有云环境内分析 | Snowflake Marketplace 共享数据集 | 按 Capacity Drawdown 额度 | 数据无需迁移即可在既有 Snowflake 环境内查询,缩短采购与工程周期 |
| 学术研究、预算受限 | 学术合作通道(须机构级协议) | 按合作范围约定 | 官方有与 Stanford Medicine、University of Maryland 等的合作先例,但非自助申请 |
§3.1 模态详细说明
| 模态 | 内容 | 粒度 | 覆盖特征 | 时效性 |
|---|---|---|---|---|
| 医疗理赔 | 就诊、诊断、操作、提供者与机构标识 | 患者—就诊—行项目 | 全量患者骨架,网络内外均含 | open 每周至每日;closed 约理赔发生后 1 个月 |
| 药房理赔 | 配药记录:药品(NDC)、剂量、天数供应、开方者 | 患者—处方—配药事件 | 处方药覆盖强;现金自费购药不可见 | 同理赔体系 |
| 实验室结果 | 结构化检验结果与数值 | 患者—检验—结果值 | 经 MapEnhance 接入,非默认全量覆盖 | 视合作方数据源而定 |
| 结构化 EHR | 临床观察值、诊断、部分生命体征 | 患者—就诊—观察 | 经 MapEnhance 与合作伙伴接入 | 视数据源而定,通常有延迟 |
| 基因组学 | 外显子与基因组检测结果 | 患者—检测 | 通过 GeneDx 等合作方,覆盖罕见病与肿瘤 | 视合作方而定 |
| 死亡登记 | 死亡率与死亡相关信息 | 患者 | MapEnhance 增强层 | 视登记机构更新周期 |
| 种族与族裔 | 自报种族与族裔 | 患者 | 约 65% 唯一患者覆盖 | 相对稳定,随患者信息更新 |
| 参保状态 | 支付方类型与参保信息 | 患者—时段 | 覆盖 Medicare、Medicaid、商业保险 | 随理赔刷新 |
| SDOH 与社会经济 | 人口普查级社会经济与地理信息 | ZIP3 及普查单元 | Komodo 自建增强资产 | 随人口普查数据更新 |
| 提供者维度 | 医疗专业人员(HCP)与医疗组织(HCO)画像 | 提供者 | 支持 KOL 识别与网络分析 | 随理赔刷新 |
| 自由文本临床笔记 | 无 | — | 平台明确以结构化字段为主,不含实时临床笔记 | 不适用 |
§3.2 按子集样本量拆解
| 数据集/切片 | 官方口径规模 | 说明 |
|---|---|---|
| Healthcare Map 全量患者 | 3.3 亿+ 去标识化患者 | 官网与多份新闻稿一致口径,2025 年 |
| 关联记录总数 | 1 万亿+ | 官网口径 |
| 年度 closed、可链接患者 | 约 1.6 亿 | 在新增 9,000 万年度 closed lives 后的官方口径 |
| 学术合作中的 payer-complete 数据集 | 约 1.5 亿 | 官方学术合作页面口径 |
| 历史新闻稿患者口径 | 3.25 亿(2021 年) | 发布时间更早,说明覆盖规模逐年增长 |
| 每日新增临床就诊 | 约 1,500 万–1,600 万 | 官网与新闻稿口径(15 million new clinical encounters daily,产品说明另称 16M+) |
| 处方记录 | 160 亿+ | 第三方 2026 年厂商对比报告引用口径 |
| Komodo Research Dataset 患者数 | 2.38 亿+ | 氯氮平 REMS 研究中披露的分析级数据集口径 |
| 实验室结果(Komodo Lab Results) | 7,300 万条 | 同一研究中披露 |
| CMS 数据覆盖受益人 | 1.3 亿+ | CMS Innovator’s License 新闻稿口径 |
| GeneDx 基因组增强层 | 60 万+外显子与基因组 | MapEnhance 扩张新闻稿口径 |
| Map 数据时间起点 | 2015 年 | 官方标准方法论与多篇论文 limitation |
口径冲突提示:不同时间点、不同产品线披露的数字并不一致(3.25 亿 / 3.3 亿 / 2.38 亿 / 1.5 亿 / 1.6 亿)。这些数字分别对应"曾建档人数"“分析级数据集覆盖人数”"payer-complete 人数"等不同定义,不可混用。在任何研究的方法学描述中,必须明确写出所用切片的定义与对应口径。
§3.3 数据格式详情
| 交付形态 | 格式 | 适用场景 | 限制 |
|---|---|---|---|
| MapLab / MapExplorer / MapView | 云平台内查询,结果以表格与可视化看板呈现 | 无代码探索、队列构建、趋势分析 | 不导出原始患者级记录,仅交付聚合结果 |
| Sentinel | 云端开发者环境,支持 SQL 与主流建模工具 | 客户专有数据链接、自定义算法与 ML 建模 | 需技术团队;算法运行在授权数据域内 |
| Prism | 队列构建界面,输出队列定义与聚合指标 | 市场格局、提供者行为、患者发现 | 面向分析而非原始数据导出 |
| OMOP CDM 兼容关系表 | 标准化关系型 schema | 需要在自有环境内做深度建模的研究团队 | 通过合同约定的方式交付,字段范围依授权而定 |
| Snowflake Marketplace | 共享数据集(无需数据搬移) | 已有 Snowflake 环境的机构 | 通过 Capacity Drawdown 交易;数据集范围由产品化列表决定 |
| API | 平台查询接口 | 与客户自有系统集成 | 依合同开放 |
§3.4 存储大小
官方未披露完整数据集的导出体积。可核实的规模代偿指标包括:1 万亿+关联记录、160 亿+处方记录、7,300 万条实验室结果、每日约 1,500 万新增临床就诊。由于平台以云查询形式交付而非文件下载,实际使用的存储成本取决于用户导出的聚合结果规模,而非数据集总体积。对于需要在自有环境内落地数据的团队,应在采购阶段明确约定导出范围与格式,并据此评估存储与计算预算。
§3.5 标注方式
这个数据集没有传统意义上的"标注",其等价物是代码集驱动的队列定义与专有的数据加工流水线。
| 加工环节 | 方式 | 人工介入程度 | 关键说明 |
|---|---|---|---|
| 去标识化 | 自动化 tokenization(Datavant) | 无 | 直接标识符替换为持久加密假名 token |
| 去重与合并 | 自动化实体解析与理赔合并 | 无 | 同一提供者—患者同一次就诊的多条报销合并为单一可计费就诊 |
| 跨来源重复解析 | 自动化标记与消解 | 无 | 平台明确"跨来源的重复理赔会被标记并消解" |
| 规范化 | 标准化至 OMOP CDM 兼容 schema 与 HIPAA 代码集 | 无 | 使不同来源可比较、可链接 |
| 纠错 | 专有纠错流程 + 随机质量抽检 | 抽检 | 平台强调每个数据元素可回溯至来源 |
| 队列定义 | 用户自定义代码集与时间窗 | 完全依赖用户 | 这是最大的质量变量,用户定义的严谨程度决定研究结论可靠性 |
| 有效性验证 | 与合作方专有数据交叉验证 | 依项目 | 例如 Myriad Genetics 对孕龄编码准确性的验证 |
| 临床终点确定 | 基于理赔事件的代理终点 | 无 | 不进行病历人工复核 |
§3.6 标注者资质与一致性
不适用传统标注者概念。平台的质量控制由数据科学团队与专有流水线承担,官方口径强调"行业内最严格的去重、规范化、分析与纠错流程",并采用随机质量抽检。一致性保证主要来自两个机制:一是代码集使用 HIPAA 法定标准(ICD-9/ICD-10、ICD-10-PCS、CPT、HCPCS、NDC),跨数据集语义对齐性好;二是实体解析的持久 token,保证同一患者在不同分析中的身份一致。用户侧的"标注者"实际上是构建队列的分析师,其代码集选择的合理性与可复现性直接决定研究质量,因此必须在方法学中完整披露代码集、时间窗与就诊次数要求。
§3.7 数据采集周期
数据自 2015 年延续至今,并以每日刷新方式持续更新。不同类型来源的时效性存在结构性差异:closed(payer-complete)来源通常在理赔提交后约 1 个月到位,open claims 的延迟范围从每日到每周不等。这一差异意味着"最新 1–2 个月"的数据在完整度上系统性偏低,做趋势分析时应对最近数据点保持审慎,或明确截断观察窗口。
§3.8 地域覆盖
| 范围 | 覆盖情况 | 说明 |
|---|---|---|
| 美国 | 全 50 州及哥伦比亚特区 | CMS QE 认证覆盖区域;患者地址聚合至 ZIP3 |
| 加拿大 | 含去标识化患者旅程 | Snowflake Marketplace 新闻稿明确 United States and Canada |
| 加州 Kaiser Permanente 网络 | 不包含 | 官方标准方法论明确说明 |
| 未参保人群 | 不包含 | 官方标准方法论明确说明 |
| 不接受保险的诊所患者 | 不包含 | 例如某些心理健康机构 |
| 全球其他地区 | 未覆盖 | 第三方厂商对比报告确认以美国为中心 |
| 地理粒度限制 | ZIP3 | 无法支持街区级或机构级可达性精细建模 |
§3.9 设备规格
不适用传统设备概念。平台处理的是行政与临床记录,而非设备原始信号;下表为数据产生环节与对应记录系统。
| 数据产生环节 | 记录系统 | 说明 |
|---|---|---|
| 医疗理赔 | 支付方理赔裁定系统 | 产生诊断、操作、提供者、地点、费用字段 |
| 药房理赔 | 药房福利管理系统 | 产生 NDC、天数供应、开方者、配药日期 |
| 实验室结果 | 检验信息系统(经 MapEnhance 合作方) | 产生检验项目与数值结果 |
| 结构化 EHR | 医院与诊所 EHR(经 MapEnhance 与合作方) | 产生临床观察值与诊断 |
| 基因组学 | 临床遗传检测实验室(如 GeneDx) | 产生外显子与基因组层面的检测结果 |
| 死亡信息 | 死亡登记数据源 | 产生死亡率相关字段 |
§3.10 深度溯源链
原始照护发生
└─ 提供方计费 / 药房配药 → 提交至支付方 → 理赔裁定
├─ 支付方理赔数据库(open / closed claims)
├─ 提供方与专科数据伙伴(EHR、实验室、肿瘤登记)
├─ CMS Medicare / Medicaid / MA 数据
│ (准入依据:Qualified Entity 认证 2017-08-21 + Innovator's License)
└─ MapEnhance 合作方(Invitae / GeneDx 基因组学;PointClickCare 长期照护 EHR;
Trio Health 专科药房与肿瘤;COTA Healthcare 肿瘤临床数据;Veradigm / BHI)
↓
Datavant tokenization(去标识化,患者身份 → 持久假名 token)
↓
专有流水线:去重 → 跨来源重复消解 → 规范化 → 纠错 → 随机质量抽检
↓
OMOP CDM 兼容 schema + HIPAA 标准代码集(ICD-9/10、ICD-10-PCS、CPT、HCPCS、NDC)
↓
Healthcare Map(1 万亿+关联记录,3.3 亿+患者,每日刷新)
↓
交付层:MapLab / MapExplorer / MapView / Prism / Sentinel /
Aperture / Pulse / Marmot AI / Snowflake Marketplace
↓
使用方分析(仅获聚合级结果,不开放患者级原始数据导出)
这条溯源链的关键特征是每一层都可回溯:平台采用 federated 获取流程,使每个数据元素都能标记回来源,并配合随机质量抽检——这是方法学中说明数据来源可靠性的可审计基础。
§4 数据结构详解
§4.0 目录结构预览
由于平台以云端交付而非文件分发,以下为平台逻辑数据组织的等价结构预览,用于建立数据模型的心智映射。实际 schema 名称与字段范围依合同约定而定。
komodo_healthcare_map/
├── foundation/ # 基础理赔骨架层
│ ├── medical_claim/ # 医疗理赔事实表:claim_id / patient_token /
│ │ # service_date / diagnosis_code[](ICD-10-CM/ICD-9-CM)/
│ │ # procedure_code[](ICD-10-PCS/CPT/HCPCS)/ place_of_service /
│ │ # provider_id / org_id / payer_type / claim_status(open|closed)
│ ├── pharmacy_claim/ # 药房理赔事实表:rx_id / patient_token / ndc_code /
│ │ # fill_date / days_supply / quantity_dispensed / prescriber_npi
│ └── enrollment/ # 参保时段表:patient_token / payer_type /
│ # coverage_start / coverage_end(payer-complete 判定依据)
├── enhancements/ # MapEnhance 增强层
│ ├── lab_result/ # 实验室结果(lab_code / result_value+unit / result_date)
│ ├── clinical_observation/ # 结构化临床观察值
│ ├── genomics/ # 基因组学(经合作方)
│ ├── mortality/ # 死亡登记
│ ├── race_ethnicity/ # 自报种族与族裔(约 65% 覆盖)
│ ├── insurance_status/ # 参保状态
│ └── sdoh/ # 社会经济与地理(ZIP3 级)
├── provider/ # 提供者维度:hcp_profile(医疗专业人员画像与信号)/ hco_profile
└── derived/ # 派生分析层(用户侧构建)
├── cohort_definition/ # 队列定义(代码集 + 时间窗 + 次数要求)
├── patient_journey/ # 患者旅程序列
└── outcome_label/ # 结局标签(代理终点)
§4.1 DAIMS 标准化字段描述表
下表以"医疗理赔事实表 + 参保时段表"为核心,列出最关键的字段及其在 AI 工作流中的作用。字段名采用平台通用命名约定,实际交付以合同 schema 为准。
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| patient_token | string | 去标识化持久假名标识 | pt_8f3a… | 患者级分组、纵向链接、防泄漏分组键 | token 持久性依赖实体解析质量,跨来源链接失败会产生重复患者 | 无(必填) | 不适用 |
| claim_id | string | 单次可计费就诊标识 | clm_93kd… | 记录唯一性校验、去重基准 | 同一次就诊的多条报销已合并;合并规则为专有逻辑 | 无(必填) | 不适用 |
| service_date | date | 就诊服务日期 | 2024-03-17 | 时序建模、索引日期、患者旅程排序 | 部分来源可能仅有裁定日期而非服务日期,存在数日偏移 | 无(必填) | 2015-01-01 起 |
| diagnosis_code | array(string) | 诊断代码序列 | [E11.9, I10] | 队列定义、表型建模、共病特征 | 编码服务于报销,存在 rule-out 诊断与 up-coding;编码错误不可避免 | 空数组表示该次就诊未记录诊断 | ICD-10-CM / ICD-9-CM |
| procedure_code | array(string) | 操作代码序列 | [99214, 93000] | 治疗强度特征、路径关键节点 | 操作编码粒度受报销打包影响 | 空数组 | ICD-10-PCS / CPT / HCPCS |
| place_of_service | categorical | 照护场景 | outpatient | 场景分层、可及性分析 | 分类依报销字段,零售诊所与远程医疗可能归类模糊 | unknown | 门诊/住院/急诊/零售诊所/远程等 |
| provider_id | string | 提供者标识 | prv_5m2p… | 提供者网络分析、KOL 识别 | 提供者离职与机构变更不总是及时反映 | unattributed | 不适用 |
| org_id | string | 医疗组织标识 | org_77bq… | 机构级聚合、站点选址 | 机构合并与更名影响连续性 | unattributed | 不适用 |
| payer_type | categorical | 支付方类型 | commercial | 险种分层、覆盖偏差诊断 | 参保变更期间归属可能不明确 | unknown | Medicare / Medicaid / Commercial |
| claim_status | categorical | 理赔可见性类型 | closed | 决定该时段患者行为是否完整可见 | open claims 只能看到网络内行为,且时延不定 | 无(必填) | open / closed |
| coverage_start | date | 参保起始日 | 2023-01-01 | 定义可见性窗口起点 | 参保回溯生效情况可能导致窗口判断偏差 | 无(必填) | 2015-01-01 起 |
| coverage_end | date | 参保终止日 | 2023-12-31 | 定义可见性窗口终点;死亡或换险会终止 | 参保终止与实际照护终止不同步 | open 表示仍在保 | 2015-01-01 起 |
| ndc_code | string | 药品国家代码 | 00093-7180-98 | 药物暴露定义、依从性建模 | NDC 会因厂商与包装变更而更新,需映射到通用名 | unmapped | 11 位 NDC |
| days_supply | integer | 天数供应 | 30 | 计算 PDC/MPR、识别停药 | 部分来源缺失或异常值(如 0、999) | unknown | 1–365(异常值需清洗) |
| prescriber_npi | string | 开方者标识 | 1234567890 | 处方归因、提供者行为分析 | 开方者可能不在平台提供者维度中 | unattributed | 10 位 NPI |
| lab_code / result_value | string / float | 检验项目与数值结果 | ANC / 1200.0 | 客观终点(如中性粒细胞减少分级) | 仅在 MapEnhance 层可用;单位与参考区间不一致风险 | not_covered(未接入该来源) | 依检验项目而定 |
| race_ethnicity | categorical | 自报种族与族裔 | Hispanic or Latino | 健康公平分析、差异分解 | 仅约 65% 覆盖;缺失若为非随机会造成偏倚 | unknown | 白人 / 黑人或非裔美国人 / 亚裔或太平洋岛民 / 其他 / 西班牙裔或拉丁裔 |
| zip3 | string | 患者地理(三位邮编) | 941 | 地理聚合、站点可达性、SDOH 链接 | 粒度粗,无法做街区级建模;地址变更存在滞后 | unknown | 美国 ZIP3 序列 |
| mortality_flag | boolean | 死亡标记 | true | 生存分析终点、失访校正 | 死亡登记覆盖与时效依来源而异 | unknown | true / false / unknown |
| insurance_status | categorical | 参保状态 | active | 覆盖偏差诊断、失访分析 | 与 payer_type 可能存在时点不一致 | unknown | active / lapsed / unknown |
§4.2 标签分布统计
Komodo Healthcare Map 不提供预置标签,所有标签由用户在分析期构建。以下列出公开研究中出现过的典型队列与结局标签,供设计参考。
| 标签/队列 | 定义方式 | 典型规模(公开研究口径) | 备注 |
|---|---|---|---|
| 氯氮平使用者队列 | 至少一次门诊药房氯氮平配药 + 30 天内有 ANC 检验 | 基于 2.38 亿患者数据集构建 | 需 MapEnhance 实验室层支持 |
| 中性粒细胞减少(轻/中/重度) | ANC 1000–1499 / 500–999 / 低于 500(每微升) | 分级结局 | 客观数值终点,非代码代理 |
| HR+/HER2- 转移性乳腺癌 | 既有算法验证的 ML 分类器 | 平台未披露队列规模 | 与 NeoGenomics 合作验证 |
| HoFH 患者 | 使用依维苏单抗或洛美他派等高级降脂治疗 + FH 诊断 | 预测值高于流行病学预期(1/25 万) | 依赖高级治疗锚定,会漏掉年轻患者 |
| 原发性胆汁性胆管炎(PBC)Ocaliva 治疗组 vs 未治疗组 | 代码集定义的 PBC 队列 + 药物暴露 | HEROES-US 研究队列 | 需匹配可比组 |
| 黄斑变性药物安全性队列 | 理赔 + 国家级眼科登记链接 | 超过 10,000 名患者 | Novartis 合作研究,发表于 JAMA |
| 骨质疏松药使用者与 COVID-19 结局 | closed claims + 连续参保要求 | 近百万患者旅程 | Harvard Medical School 与 Cerner Enviza 合作 |
| 典型抗精神病药依从性(按种族族裔分层) | PDC/MPR 指标 | 平台未披露队列规模 | ISPOR 2024 报告 |
§4.3 关键字段描述性统计
| 统计项 | 数值/特征 | 来源口径 |
|---|---|---|
| 患者总数 | 3.3 亿+ | 官网(2025) |
| 关联记录总数 | 1 万亿+ | 官网(2025) |
| 年度 closed、可链接患者 | 约 1.6 亿 | 官方新闻稿 |
| 每日新增临床就诊 | 约 1,500 万–1,600 万 | 官网与产品说明 |
| 处方记录 | 160 亿+ | 第三方厂商对比报告 |
| 实验室结果 | 7,300 万条 | Komodo Lab Results 披露口径 |
| 基因组检测 | 60 万+外显子与基因组 | GeneDx 合作口径 |
| 数据时间跨度 | 2015 年至今 | 官方标准方法论 |
| 种族族裔覆盖率 | 约 65% 唯一患者 | 官方标准方法论 |
| 地理粒度 | ZIP3 | 官方标准方法论 |
| 更新频率 | 每日 | 官网 |
| 数据延迟 | closed 约 1 个月;open 每周至每日 | 官方标准方法论 |
§4.4 数据层级关系
患者(patient_token,去标识化持久假名)
├── 参保时段(enrollment:payer_type × coverage_start/end)
│ └── 决定该时段的"可见性":closed → 窗口内行为完整可见(payer-complete);
│ open → 仅网络内行为可见
├── 就诊事件(encounter:claim_id)= 诊断码序列 + 操作码序列 + 照护场景 + 提供者与机构
├── 用药事件(pharmacy claim:rx_id)= 药品(ndc_code)+ 天数供应 + 开方者(prescriber_npi)
└── 增强层事件(enhancement:lab / observation / genomics / mortality)
└── 通过 patient_token 与上述事件在时间轴上对齐
↓
患者旅程(patient journey = 按 service_date 排序的事件序列)
↓
队列(cohort = 满足代码集 + 时间窗 + 次数要求的患者集合)
↓
结局标签(outcome label = 队列内患者的目标事件标记)
层级设计的关键含义:患者是唯一的链接单位,token 是唯一的连接键。分析必须自下而上构建——先定义事件,再按 token 聚合为旅程,再筛选为队列,最后标记结局;跳过 token 层直接在聚合表上做推断会丧失纵向链接的核心价值。
§4.5 缺失值情况与信息性缺失编码
| 字段/维度 | 缺失机制 | 缺失程度 | 信息性质 | 处理建议 |
|---|---|---|---|---|
| race_ethnicity | 非随机缺失(依赖患者是否自报与机构是否采集) | 约 35% 患者缺失 | 信息性:缺失可能与机构类型、地区、人群特征相关 | 报告缺失比例;做缺失机制敏感性分析;不要简单删除缺失样本 |
| lab_code / result_value | 结构性缺失(未接入该数据源时整体为空) | 视研究是否购买 MapEnhance 实验室层而定 | 信息性:缺失反映的是数据采购范围而非临床事实 | 明确声明数据来源范围;不得将"未接入"解读为"未检测" |
| coverage_end | 右删失(患者仍参保或被死亡终止) | 普遍存在 | 信息性:删失本身与结局可能相关 | 使用生存分析方法处理删失,不要当作普通缺失填充 |
| prescriber_npi | 归因失败 | 少数记录 | 信息性:可能反映提供者不在平台维度中 | 保留为 unattributed 并单独报告占比 |
| ndc_code | 无法映射至通用名 | 少数记录(新上市药品、包装变更) | 非信息性为主 | 建立 NDC → 通用名映射表并记录映射失败率 |
| days_supply | 数据质量缺失或异常值(0、999) | 依来源而异 | 非信息性与信息性混合 | 按来源分层清洗;异常值单列而非直接删除 |
| place_of_service | 分类不明确 | 少量记录 | 信息性:可能反映新型照护模式(远程医疗、零售诊所) | 保留 unknown 类别并纳入特征 |
| zip3 | 地址缺失或变更滞后 | 少量记录 | 非信息性为主 | 保留 unknown;地理分析时报告不可定位比例 |
| 未参保患者 | 结构性缺失(整个人群不在数据中) | 不可测量 | 强信息性:缺失与保险状态强相关 | 在局限性中明确声明;估计值应表述为"参保人群中的率" |
| 加州 Kaiser Permanente 成员 | 结构性缺失 | 不可测量 | 强信息性:单一大型整合系统人群整体缺席 | 涉及加州分析时必须声明;避免州级率与其他州直接比较 |
| 现金自费购药 | 结构性缺失 | 不可测量 | 强信息性:与支付能力相关 | 依从性分析须限定在 closed claims 窗口内 |
| 2015 年前历史 | 结构性缺失(数据不回溯) | 不可测量 | 信息性:无法重建早期旅程 | 起始观察窗不得早于 2015 年;索引日期需保证足够长的回溯期 |
§5 数据划分与使用建议
§5.1 官方数据划分
Komodo Healthcare Map 不提供官方训练/验证/测试划分。作为商业分析平台,它交付的是持续更新的数据底座与查询/建模环境,而非预切分的机器学习基准——这与学术数据集(如 MIMIC、eICU)的根本目标不同:后者追求可复现的模型比较,前者支持真实世界分析问题。
因此,"划分"在使用方一侧完全自定义。这也意味着任何跨机构、跨论文的性能比较都缺乏共同的划分基础——两篇论文报告的不同模型性能,不能直接比较。
§5.2 推荐划分策略
真实世界数据建模的最大风险不是样本量不足,而是同一患者的多次事件同时落入训练与测试集导致性能高估。因此第一原则是患者级(token 级)划分,而非记录级划分。
# 患者级分层划分示例(假设 df 含 patient_token、index_date、label、strata)
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit
# 1. 按患者聚合,确保同一 token 只出现在一个划分中
patients = (df.groupby("patient_token")
.agg(index_date=("index_date", "min"), label=("label", "max"), strata=("strata", "first"))
.reset_index())
# 2. 按时间切分(推荐用于真实世界数据,模拟"用过去预测未来")
patients = patients.sort_values("index_date")
n = len(patients); train_end = int(n * 0.70); valid_end = int(n * 0.85)
train_ids = patients.iloc[:train_end]["patient_token"]
valid_ids = patients.iloc[train_end:valid_end]["patient_token"]
test_ids = patients.iloc[valid_end:]["patient_token"]
# 3. 若必须做随机划分,至少保证患者不跨划分(GroupShuffleSplit)
gss = GroupShuffleSplit(n_splits=1, test_size=0.30, random_state=42)
tr_idx, te_idx = next(gss.split(patients, groups=patients["patient_token"]))
| 策略 | 适用场景 | 优点 | 风险 |
|---|---|---|---|
| 患者级随机划分 | 探索性建模、样本量较小 | 样本利用充分 | 同患者不同时间的事件仍可能造成时间泄漏(较轻微) |
| 时间切分(前 N 年训练,后 M 年测试) | 模拟真实部署、检验时间稳健性 | 贴近实际应用,暴露数据漂移 | 早期年份编码习惯与后期不同,可能低估性能 |
| 地理/机构切分 | 检验跨机构泛化能力 | 暴露站点特定编码习惯差异 | 需保证各划分的患者与提供者不重叠 |
| 治疗领域留出 | 检验跨疾病泛化 | 贴近"新适应症"场景 | 疾病间异质性大,性能下降幅度需要解释 |
§5.3 数据泄漏风险防御
理赔数据的泄漏风险比影像或文本数据集更隐蔽,因为泄漏往往藏在时间维度与可见性维度里。
| 泄漏类型 | 机制 | 症状 | 防御 |
|---|---|---|---|
| 未来信息泄漏 | 特征窗口与结局窗口重叠,例如用索引日期之后的检验值预测索引日期之前的事件 | 测试集 AUC 异常高(超过 0.95),上线后骤降 | 严格定义索引日期;特征仅取索引日期前数据;画出特征可用性时间线 |
| 参保窗口泄漏 | 使用了在预测时点尚未获得参保的患者(未来才进入 closed 状态) | 模型对最近队列的性能虚高 | 特征构建时强制要求 coverage_end 不早于索引日期,且只使用当时已结算的记录 |
| open/closed 混用泄漏 | 训练用 closed 切片,推理用 open 切片(或反之) | 同一模型在两个切片上性能差异巨大 | 在方法学中明确声明切片;训练与评估使用同一切片 |
| 提供者身份泄漏 | 同一提供者的患者跨训练/测试集,模型学到提供者特定编码习惯 | 性能对提供者分布敏感 | 需要跨机构泛化时按提供者分组的划分 |
| 目标泄漏 | 结局定义中的代码出现在特征集中(如用"住院"预测"住院并发症") | 特征重要性中某个特征异常主导 | 显式排除结局相关代码集;做特征清单审查 |
| 代理队列污染 | 筛查行为被记入确诊队列,标签本身含噪 | 队列规模超出流行病学预期,模型学到筛查模式 | 要求时间窗内多次相关理赔;与文献流行病学对照验证 |
§5.4 交叉验证建议
常规 k-fold 交叉验证会因患者内相关性与时间结构而高估性能。
| 方法 | 适用性 | 说明 |
|---|---|---|
| 患者级 GroupKFold | 推荐基线 | 以 patient_token 为分组键,防止同一患者跨折 |
| 时间序列前向验证(walk-forward) | 推荐用于部署前评估 | 训练窗口始终早于验证窗口,最能反映真实部署表现 |
| 提供者级 GroupKFold | 需要跨机构泛化时推荐 | 以 provider_id 分组,检验编码习惯差异的影响 |
| 嵌套交叉验证 | 需要调参时推荐 | 外层评估、内层调参,避免调参过程本身的信息泄漏 |
| 常规随机 k-fold | 不推荐单独使用 | 会因患者内相关性产生乐观偏差 |
| 分层策略 | 必做 | 按结局比例、年份、支付方类型分层,避免稀有结局在某折中缺失 |
建议同时报告**患者级 GroupKFold(随机)与walk-forward(时间)**两组结果。两者的差距本身就是一个有价值的信息:差距越大,说明模型对时间变化越敏感,部署时的性能衰减风险越高。
§5.5 外部验证
| 验证方式 | 说明 | 可行性 |
|---|---|---|
| 跨年份验证 | 用较早年份训练、较晚年份验证 | 平台内即可完成,必做 |
| 跨支付方验证 | 用商业保险训练、Medicare 验证 | 平台内可完成,检验险种迁移性 |
| 跨数据源验证 | 与客户自有专有数据链接后交叉验证 | 需 Sentinel;例如 Myriad Genetics 验证孕龄编码准确性 |
| 与外部注册登记比对 | 与国家级专科登记(如眼科登记)链接 | 已有先例(Novartis 黄斑变性研究) |
| 与开放理赔数据比对 | 与 MarketScan、Optum Clinformatics 等平台比对率估计 | 需另购数据;对口径差异要有清晰的对齐方案 |
| 前瞻性验证 | 在新数据上做前瞻性评估 | 公开研究中罕见,HoFH 论文明确建议未来工作应包括前瞻性评估 |
外部验证的核心原则:由于各平台的患者覆盖口径、closed claims 比例、族裔覆盖率差异很大,跨平台验证的差异既可能来自模型本身,也可能纯粹来自数据口径。任何跨平台比较都必须先做口径对齐(统一限定 closed claims、统一支付方类型、统一索引日期定义),否则结论不成立。
§6 AI 就绪指南
§6.0 云端快速启动
Komodo Healthcare Map 为云端交付平台,不存在"本地下载解压"的启动方式。最常见的四种接入路径如下。
| 路径 | 适合谁 | 前置条件 | 首次可用时间 |
|---|---|---|---|
| MapLab / MapExplorer / MapView | 分析师、医学事务、商业团队 | 企业合同 + 账号开通 | 数天(无数据工程) |
| Sentinel | 数据科学家、建模团队 | 企业合同 + 云端开发环境 + 数据域授权 | 数周(含数据域配置) |
| Snowflake Marketplace | 已有 Snowflake 环境的机构 | Snowflake 账号 + Capacity Drawdown 额度 | 依采购流程,通常快于传统采购 |
| 学术合作通道 | 高校与学术医疗中心研究者 | 机构级合作协议 + 伦理审查 | 数月至更久 |
需要清楚认识到:采购周期是真实世界约束。平台不提供免费试用与自助注册,采购通常涉及多月流程,任何"先下载数据看看"的计划都不可行,工作流必须从"在平台内完成分析"出发。
§6.1 快速上手
# 目录结构预期(云平台逻辑视图,非本地文件):
# foundation/medical_claim | pharmacy_claim | enrollment(决定可见性窗口)
# enhancements/lab_result | race_ethnicity(约 65% 覆盖)
# provider/hcp_profile
# 表引用 = DATA_ROOT + ".foundation.medical_claim"(实际前缀依合同交付环境而定)
# 最小可用子集:1) enrollment(决定可信任的时间窗)2) medical_claim(骨架)
# 3) pharmacy_claim(依从性与暴露定义);enhancements/* 按需开通
# 步骤 1:先确认"什么时段是完整可见的"——使用 Komodo 数据最重要的第一步
# closed claims 窗口内患者行为完整;open claims 只能看到网络内行为
enrollment_sql = """
SELECT payer_type, claim_status,
COUNT(DISTINCT patient_token) AS patients,
MIN(coverage_start) AS earliest_start,
MAX(CASE WHEN coverage_end = 'open'
THEN CURRENT_DATE ELSE coverage_end END) AS latest_end
FROM komodo_healthcare_map.foundation.enrollment
GROUP BY payer_type, claim_status ORDER BY patients DESC
"""
# 解读:closed 患者数远小于 open 时,行为类指标(停药、换药、连续随访)必须在
# closed 子集上计算;latest_end 明显早于当前日期说明存在数据延迟,趋势分析应截断
# 步骤 2:构建一个最小患者旅程(以某个疾病为例)
patient_journey_sql = """
WITH cohort AS (
SELECT DISTINCT patient_token
FROM komodo_healthcare_map.foundation.medical_claim
WHERE service_date BETWEEN '2020-01-01' AND '2023-12-31'
AND claim_status = 'closed' -- 关键:限定完整可见窗口
AND EXISTS (SELECT 1 FROM UNNEST(diagnosis_code) AS d
WHERE d LIKE 'E11%') -- 2 型糖尿病
GROUP BY patient_token
HAVING COUNT(DISTINCT claim_id) >= 2 -- 至少两次就诊,降低误判
)
SELECT m.patient_token, m.service_date, m.place_of_service,
m.diagnosis_code, m.procedure_code
FROM komodo_healthcare_map.foundation.medical_claim m
JOIN cohort c USING (patient_token)
WHERE m.service_date BETWEEN '2020-01-01' AND '2023-12-31'
ORDER BY m.patient_token, m.service_date
"""
# HAVING COUNT(...) >= 2 是对抗"筛查被误读为确诊"的核心手段;缺此约束时,
# 高筛查率治疗领域的队列会显著大于流行病学预期
接入流程检查清单(在写任何建模代码前完成):
[ ] 已确认 closed claims 的可用时间窗与患者规模
[ ] 已确认所购增强层范围(实验室/基因组/死亡率/种族族裔)
[ ] 已确认 race_ethnicity 覆盖率(约 65%),并计划了缺失机制处理
[ ] 已确认地理粒度仅到 ZIP3,站点可达性建模方案已相应调整
[ ] 已记录所有代码集(ICD/CPT/HCPCS/NDC)及其版本与来源
[ ] 已在方法学中写明数据口径(患者数定义、时间窗定义、切片类型)
[ ] 已确认研究排除人群(未参保、Kaiser Permanente 加州成员)
§6.2 数据获取流程
| 获取方式 | 流程 | 典型周期 | 成本量级(第三方评测口径) | 适用对象 |
|---|---|---|---|---|
| 企业订阅 | 商务接洽 → 需求梳理 → 合同 → 数据域开通 → 培训 | 数月至更久 | 单用例约 15 万–45 万美元/年;完整数据集+套件可达七位数;行业报道称完整访问约 200 万美元/年;第三方平台买家中位价约 100 万美元/年 | 制药、支付方、大型医疗机构 |
| Snowflake Marketplace | 在 Snowflake 环境中发现列表 → 通过 Capacity Drawdown 交易 | 依 Snowflake 账户流程 | 按 drawdown 额度计 | 已有 Snowflake 环境的机构 |
| 学术合作 | 机构接洽 → 研究方案评审 → 合作协议 → 伦理审查 | 数月至更久 | 依合作范围,官方未披露定价 | 高校与学术医疗中心 |
| 技术伙伴共建 | 基于 MapLab Enterprise 构建可授权应用 | 依合作模式 | 依合作模式 | 技术合作方(如 Anervea.ai 模式) |
关于定价的说明:Komodo Health 不公开定价,官方渠道一律"按需报价"。上表中的数字来自第三方采购评测平台与行业报告,属于市场观察值,不代表官方报价,实际价格依数据范围、用例数量、用户数、增强层与产品组合而定。因此在进行预算规划时,应把"多月的采购与法务流程"和"使用平台所需的专职分析师能力"一并计入总成本——这是这类企业级数据资产最容易被低估的两项成本。
§6.3 预处理全流程
真实世界理赔数据的预处理,主要工作量集中在队列定义的正确性与可见性窗口的界定上,而不是格式转换。
阶段 1:可见性窗口界定(最容易做错,必须最先做)
1.1 拉取 enrollment 表,按 payer_type × claim_status 统计患者规模
1.2 确定分析窗口 [window_start, window_end]:window_end 至少回退至 closed 数据
完整到位的时点(通常约 1 个月);最近期数据不完整,趋势分析须截断
1.3 对每位患者建立"可观察区间" coverage_start → coverage_end
1.4 后续所有事件筛选都必须落在该患者的可观察区间内
阶段 2:代码集构建与版本管理
2.1 诊断码:ICD-10-CM(2015-10 起为主)与 ICD-9-CM(2015 年前后过渡期);
跨 2015-10-01 的研究必须同时包含两套码并建立映射
2.2 操作码:ICD-10-PCS(住院)+ CPT/HCPCS(门诊与耗材)
2.3 药品:NDC → 通用名 → ATC 或 RxNorm;NDC 因包装与厂商变更失效,须维护映射版本
2.4 所有代码集落盘为显式清单,带版本号与来源,纳入方法学附录
阶段 3:队列定义(决定研究成败的一步)
3.1 定义索引日期(index date):首次满足条件的日期
3.2 定义"确诊"而非"筛查":要求时间窗内(如 12 个月)至少 2 次相关诊断,
或要求存在特定治疗暴露作为确证
3.3 定义洗脱期(washout):索引日期前至少 6–12 个月无该病相关记录;
数据 2015 年才开始,洗脱期要求会显著缩减可用队列
3.4 定义基线特征窗口:索引日期前 6–12 个月
3.5 记录每个环节排除的患者数(做 CONSORT 式流程图)
阶段 4:暴露、结局与协变量构建
4.1 药物暴露:NDC → 通用名 → 治疗类别;用 days_supply 计算暴露区间
4.2 依从性:PDC(覆盖天数比例)或 MPR(用药持有比);仅在 closed claims 窗口内
计算,否则院外购药会被误判为停药
4.3 结局:住院/急诊以理赔事件为准;死亡以 mortality 表为准
4.4 协变量:年龄(按索引日期)、性别、支付方类型、ZIP3、种族族裔(注意 35% 缺失)、
共病负担(如 Charlson/Elixhauser)
阶段 5:清洗与质量标记
5.1 days_supply 异常值(0、999)单列标记,不直接删除
5.2 重复理赔:平台已做去重,但跨来源残留风险依来源而异
5.3 时间异常:service_date 早于 coverage_start 或晚于 coverage_end 的记录
5.4 单位不一致:实验室结果仅在有 MapEnhance 层时可用,须核对单位与参考区间
# 阶段 3 与阶段 4 的可运行实现(pandas 逻辑示意,需适配实际 schema)
import numpy as np, pandas as pd
def build_cohort(encounters, enrollments, dx_prefix: str = "E11",
window: tuple = ("2020-01-01", "2023-12-31"),
min_claims: int = 2, washout_months: int = 12) -> pd.DataFrame:
"""encounters: patient_token, claim_id, service_date, diagnosis_code(list), claim_status, payer_type
enrollments: patient_token, payer_type, coverage_start, coverage_end"""
w_start, w_end = pd.to_datetime(window)
df = encounters.copy(); df["service_date"] = pd.to_datetime(df["service_date"])
# 1) 行为类分析只在 closed claims 上做;2) 限定分析窗口
df = df[(df["claim_status"] == "closed") &
(df["service_date"] >= w_start) & (df["service_date"] <= w_end)]
# 3) 事件必须落在患者的可观察区间内
enr = enrollments.copy(); enr["coverage_start"] = pd.to_datetime(enr["coverage_start"])
enr["coverage_end"] = pd.to_datetime(enr["coverage_end"].replace("open", pd.Timestamp.today().date()))
df = df.merge(enr[["patient_token", "payer_type", "coverage_start", "coverage_end"]],
on=["patient_token", "payer_type"], how="inner")
df = df[(df["service_date"] >= df["coverage_start"]) & (df["service_date"] <= df["coverage_end"])]
# 4) 要求 >= min_claims 次疾病相关就诊,抗筛查误判
df["has_dx"] = df["diagnosis_code"].apply(lambda cs: any(str(c).startswith(dx_prefix) for c in (cs or [])))
dx_visits = df[df["has_dx"]].sort_values(["patient_token", "service_date"])
first_dx = (dx_visits.groupby("patient_token")["service_date"].agg(["min", "count"])
.rename(columns={"min": "index_date", "count": "dx_claim_count"}))
cohort = first_dx[first_dx["dx_claim_count"] >= min_claims].reset_index()
# 5) 洗脱期:索引日期前必须有足够长的可观察历史
cohort = cohort.merge(enr.groupby("patient_token")["coverage_start"].min().reset_index(),
on="patient_token", how="left")
min_lookback = cohort["index_date"] - pd.DateOffset(months=washout_months)
cohort = cohort[cohort["coverage_start"] <= min_lookback]
# 6) 基线特征窗口(索引日期前 6 个月)
base = df.merge(cohort[["patient_token", "index_date"]], on="patient_token", how="inner")
base = base[(base["service_date"] >= base["index_date"] - pd.DateOffset(months=6)) &
(base["service_date"] < base["index_date"])]
cohort = cohort.merge(
base.groupby("patient_token")["claim_id"].nunique().rename("baseline_claims").reset_index(),
on="patient_token", how="left")
print(f"队列患者数: {len(cohort)}")
print("提示:与文献流行病学预期对照,显著超出则检查筛查误判")
return cohort
def compute_pdc(pharmacy, cohort, drug_name: str, follow_up_days: int = 180) -> pd.DataFrame:
"""PDC(覆盖天数比例)计算,必须限定在 closed 观察窗内"""
rx = pharmacy.merge(cohort[["patient_token", "index_date"]], on="patient_token", how="inner")
rx = rx[rx["drug_generic_name"] == drug_name].copy()
rx["fill_date"] = pd.to_datetime(rx["fill_date"])
rx["obs_end"] = rx["index_date"] + pd.Timedelta(days=follow_up_days)
rx = rx[(rx["fill_date"] >= rx["index_date"]) & (rx["fill_date"] <= rx["obs_end"])]
rx["days_supply"] = pd.to_numeric(rx["days_supply"], errors="coerce")
rx.loc[~rx["days_supply"].between(1, 365), "days_supply"] = np.nan # 0 与 999 不可信
rx["days_supply"] = rx["days_supply"].fillna(rx.groupby("patient_token")["days_supply"].transform("median"))
covered = rx.groupby("patient_token")["days_supply"].sum()
pdc = (covered / follow_up_days).clip(upper=1.0).rename("pdc")
out = cohort[["patient_token", "index_date"]].merge(pdc.reset_index(), on="patient_token", how="left")
out["pdc"] = out["pdc"].fillna(0.0)
out["persistent"] = out["pdc"] >= 0.8 # 常用阈值
return out
§6.4 框架加载
真实世界理赔数据的建模通常不走图像式的 DataLoader 路径,而是"特征表 + 梯度提升/生存模型"为主。下面给出一个可运行的 PyTorch Dataset 实现,用于序列模型(如基于患者就诊序列的 RNN/Transformer),并强调患者级划分。
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
class PatientJourneyDataset(Dataset):
"""按 patient_token 聚合的就诊序列;journeys[token] = [{"days": int, "dx_vec": ndarray, "px_vec": ndarray}, ...]"""
def __init__(self, journeys, labels, max_len=64, pad_value=0.0):
self.tokens = list(journeys.keys())
self.journeys, self.labels = journeys, labels
self.max_len, self.pad_value = max_len, pad_value
def __len__(self):
return len(self.tokens)
def __getitem__(self, idx):
token = self.tokens[idx]
events = self.journeys[token][-self.max_len:] # 截断保留最近
dx = np.stack([e["dx_vec"] for e in events]); px = np.stack([e["px_vec"] for e in events])
tm = np.array([e["days"] for e in events], dtype=np.float32)
L = dx.shape[0]
if L < self.max_len: # 右填充
n = self.max_len - L
dx = np.vstack([dx, np.full((n, dx.shape[1]), self.pad_value)])
px = np.vstack([px, np.full((n, px.shape[1]), self.pad_value)])
tm = np.concatenate([tm, np.zeros(n, dtype=np.float32)])
mask = np.zeros(self.max_len, dtype=np.float32); mask[:L] = 1.0
return {"dx": torch.tensor(dx), "px": torch.tensor(px), "time": torch.tensor(tm),
"mask": torch.tensor(mask), "label": torch.tensor(float(self.labels[token])), "token": token}
def patient_level_split(labels: pd.Series, train_ratio=0.7, valid_ratio=0.15, seed=42) -> tuple:
"""患者级划分:同一 token 只出现在一个划分中"""
shuffled = np.random.default_rng(seed).permutation(labels.index.to_numpy())
n, n_tr = len(shuffled), int(len(shuffled) * train_ratio); n_va = int(len(shuffled) * valid_ratio)
return (set(shuffled[:n_tr]), set(shuffled[n_tr:n_tr + n_va]), set(shuffled[n_tr + n_va:]))
# ---- 实例化(journeys / labels 由用户侧 build_journeys、build_labels 构建)----
tr, va, te = patient_level_split(labels)
make = lambda idx: PatientJourneyDataset({k: v for k, v in journeys.items() if k in idx},
labels[labels.index.isin(idx)])
train_loader = DataLoader(make(tr), batch_size=256, shuffle=True, num_workers=4, pin_memory=True, drop_last=True)
valid_loader = DataLoader(make(va), batch_size=512, shuffle=False, num_workers=4, pin_memory=True)
test_loader = DataLoader(make(te), batch_size=512, shuffle=False, num_workers=4, pin_memory=True)
# batch["dx"].shape → [256, 64, D_dx];batch["mask"].shape → [256, 64]
§6.5 常见坑点
⚠️ 坑点 1:把 open claims 当成患者的完整照护历史(分类:偏倚陷阱)
问题:Komodo 的 Map 同时包含 open claims 与 closed claims。open claims 只能观察到患者在网络内、由特定支付方捕获的行为;closed claims(payer-complete)才能观察患者在时间窗内的全部行为。如果在 open claims 上计算"停药率"“换药率”“随访连续性”,任何未出现在该数据源中的院外购药、自费购药、其他险种就诊都会被误判为"事件终止",导致停药率被系统性高估。
症状:模型报告的中位治疗持续期显著短于随机对照试验与文献值;不同支付方子集算出的依从性差异巨大;加入新的数据源后,同一队列的"停药"患者大量重新出现。
解决 —— 1. 简单方法:所有行为类指标一律限定在claim_status = 'closed'且患者在该时间窗内coverage_end = 'open'(或覆盖整段观察期)的子集上计算,并报告该子集相对全量的患者占比。
2. 进阶/SOTA:为每位患者显式建立"可观察区间",所有事件筛选都必须落在区间内;对区间长度不足的患者排除或做敏感性分析。 更进阶地,使用目标试验模拟框架,把"完整随访"作为入组条件显式建模,并对不同可见性水平的患者做定量偏倚分析(quantitative bias analysis)。
参考:Komodo Health《Analyzing Data in Komodo’s Healthcare Map: Summary of Standard Methodology》—— https://www.komodohealth.com/?p=11192/
⚠️ 坑点 2:把筛查行为误读为确诊(分类:标签理解)
问题:理赔编码记录的是"被计费的行为",不是"被临床确认的诊断"。在筛查率高的治疗领域(如某些癌症、代谢病),一次筛查性就诊可能带有一个诊断码,患者被错误纳入疾病队列。官方方法论明确指出,高筛查率治疗领域中的患者队列可能大于真实流行病学规模。
症状:队列规模显著超出文献报道的患病率;队列内的治疗起始率异常低(因为大量"患者"其实是被筛查的健康人);年龄分布偏向筛查推荐年龄段。
解决 —— 1. 简单方法:要求患者在指定时间窗内(如 12 个月)拥有至少 2 次相关诊断理赔,而非单次。
2. 进阶/SOTA:叠加确证条件——要求出现特定治疗暴露、特定操作(如活检 CPT)或特定检验结果(需 MapEnhance 实验室层),把"有诊断码"升级为"有确诊证据"。 更进阶地,把队列规模与文献流行病学预期做定量对照,作为队列定义质量的验收标准;必要时构建多个不同严格度的队列,报告结论对定义严格度的敏感性。
参考:官方标准方法论(同坑点 1);HoFH 机器学习研究中的队列构建与局限讨论 —— https://www.nature.com/articles/s41598-024-58719-y
⚠️ 坑点 3:忽略 2015 年的数据起点导致洗脱期不足(分类:预处理陷阱)
问题:Map 的数据自 2015 年开始,且官方与多篇论文明确"数据仅回溯至 2015 年"。要求 12 个月洗脱期的研究,无法为 2015–2016 年索引的患者提供足够的基线历史,"新发患者"与"既有患者"无法区分。这不是可以靠插补解决的问题,而是数据边界。
症状:早期年份的"新发(incident)病例数"异常偏高,随后逐年下降至稳定;基线共病负担在早期年份系统性偏低;不同年份的队列特征分布出现不连续跳跃。
解决 —— 1. 简单方法:把索引日期起始点设为数据起点加洗脱期长度。若需 12 个月洗脱期,索引日期最早取 2016-01-01(甚至更保守)。
2. 进阶/SOTA:对基线期长度做分层,明确报告各年份队列的可用回溯月数,并对回溯不足的年份单独做敏感性分析。 更进阶地,在新用户设计(new-user design)框架下,把"首次可观察暴露"与"真实首次暴露"的区分显式建模,并对左截断(left truncation)做统计校正。
参考:HoFH 论文 limitations(The Komodo Healthcare Map database only provided data going back to 2015)—— https://www.nature.com/articles/s41598-024-58719-y
⚠️ 坑点 4:把理赔编码当临床真值使用(分类:标签理解)
问题:理赔编码为报销服务,存在 rule-out 诊断(排除性诊断被记录为确诊)、up-coding(为获得更高报销而升级编码)、以及编码人员的理解差异。平台不含自由文本临床笔记,因此无法通过查阅病程记录核实。肿瘤分期、精确血压、体征细节(如黄瘤)在理赔中通常不可得。
症状:队列中存在明显不符合诊断标准的患者;同一患者在不同机构的诊断码互相矛盾;模型学到的是编码习惯而非临床信号,在外部数据上性能骤降。
解决 —— 1. 简单方法:优先使用"客观锚点"作为确证——特定操作(手术、活检、影像)、特定药品(NDC)、特定检验结果,而非依赖诊断码本身。
2. 进阶/SOTA:把诊断码视为含噪标签,使用多代码一致性规则;对不一致记录建立人工抽样核查机制(如果合同允许)。 更进阶地,构建显式的测量误差模型(如概率性标签模型),把诊断码的阳性预测值作为参数纳入建模;或以实验室数值(需 MapEnhance)作为客观真值做半监督校正。
参考:HoFH 论文 limitations(administrative claims data … subject to data coding limitations and data entry error)—— https://www.nature.com/articles/s41598-024-58719-y
⚠️ 坑点 5:用理赔数据做实时或近期决策(分类:评估误用)
问题:closed(payer-complete)数据通常为理赔发生后约 1 个月到位,open claims 时延从每日到每周不等。更重要的是,理赔反映的是"被计费且已裁定"的照护——现金自费照护、未提交理赔的服务完全不在数据中。把最近期数据用于实时运营决策或近期竞争监测,会得到系统性不完整的图景。
症状:最近一两个月的量级指标出现莫名其妙的"下滑",随后在下次刷新时被修正;不同时间点运行同一查询得到最近期数值持续变化;模型对最近队列的预测偏差明显大于历史队列。
解决 —— 1. 简单方法:趋势分析中截断最近 1–2 个月的观察期,并在图表中明确标注数据完整度边界。
2. 进阶/SOTA:建立"数据成熟度曲线"——对同一指标在不同延迟假设下重复计算,量化最近期的低估幅度,据此设定截断点。 更进阶地,使用 nowcasting(即时估计)方法对最近期做校正建模,并始终以置信区间而非点估计呈现最近期结论。
参考:官方标准方法论中的 Data Recency 一节 —— https://www.komodohealth.com/?p=11192/
⚠️ 坑点 6:用 35% 缺失的种族族裔数据做公平性结论(分类:偏倚陷阱)
问题:平台的自报种族与族裔数据仅覆盖约 65% 的唯一患者,缺失约 35%。如果缺失机制与群体本身相关(非随机缺失),仅基于有记录的患者做差异分析会产生系统性偏倚——而恰恰在健康公平研究中,缺失比例最高的群体往往正是最需要关注的群体。
症状:不同种族族裔亚组的样本量差异极大;某一群体在某些治疗领域的缺失率显著更高;在补充了外部人口数据后结论方向发生改变。
解决 —— 1. 简单方法:显式报告各族裔亚组的缺失比例,把 unknown 作为一个独立类别纳入分析而非删除,观察其对结论的影响。
2. 进阶/SOTA:以 ZIP3 级人口普查数据做多重插补或贝叶斯分层估计,用区域人口构成约束个体层面缺失的分布。 更进阶地,把缺失本身作为结果变量建模(缺失机制分析),并报告在多种缺失假设(MCAR / MAR / MNAR)下结论的稳健性区间。
参考:官方标准方法论中的 Race & Ethnicity 一节(available for approximately 65% of unique patients)—— https://www.komodohealth.com/?p=11192/
⚠️ 坑点 7:把观察性关联当作因果结论(分类:评估误用)
问题:理赔数据能清晰显示"用 A 药的患者结局更好",但治疗分配在真实世界中并非随机——医生会依据病情严重度、合并症、支付能力选择治疗,导致适应证混杂(confounding by indication)与健康使用者偏倚。直接比较组间结局会得出错误的因果结论。
症状:某药物在所有结局上全面优于对照药(疗效好、住院少、死亡率低),这种"全胜"模式通常是混杂而非疗效的信号;调整协变量后效应量剧烈变化。
解决 —— 1. 简单方法:用倾向评分匹配或加权(IPTW)平衡可观测混杂,报告匹配前后的标准化均差(SMD 小于 0.1 为常见阈值)。
2. 进阶/SOTA:采用目标试验模拟(target trial emulation)框架,显式定义入组、治疗策略、随访起点与结局,用序列试验或克隆-删失-加权方法处理时变治疗。 更进阶地,用阴性对照结局、E-value 敏感性分析、工具变量或负对照暴露检验未测量混杂的潜在影响,并在论文中明确声明因果解释的边界。
参考:Intercept Pharmaceuticals HEROES-US 研究的方法学设计(回顾性观察研究 + 可比组构建)—— https://www.komodohealth.com/?p=12485
⚠️ 坑点 8:忽略地理粒度与结构性排除人群(分类:偏倚陷阱)
问题:平台地理信息仅到 ZIP3(三位邮编)级别,且系统性排除三类人群:未参保人群、不接受保险的诊所(如部分心理健康机构)患者、以及加州 Kaiser Permanente 网络内患者。这些不是随机缺失,而是与保险状态、照护模式强相关的结构性缺口。做地理可达性分析或州级率比较时,这些缺口会直接扭曲结论。
症状:加州的部分疾病率与其他人口特征相似的州相比明显偏低;心理健康相关疾病的患病率估计低于全国调查数据;某研究中心被评估为"覆盖不足"但实际是当地主流系统未被纳入。
解决 —— 1. 简单方法:在所有涉及地理的分析中显式声明粒度限制;加州分析必须声明 Kaiser Permanente 成员缺席;把患病率表述为"参保人群中的率"而非"人群率"。
2. 进阶/SOTA:把 ZIP3 与 ACS(美国社区调查)人口数据匹配,仅在人口分母同样可比的区域做地理比较;对心理健康等领域,用全国调查数据做交叉校验。 更进阶地,建立覆盖率校正模型,用外部人口分母估计各区域的"被捕获概率",对率估计做捕获-再捕获式校正,并报告校正前后的差异。
参考:官方标准方法论中的 Limitations 与 Race & Ethnicity 章节 —— https://www.komodohealth.com/?p=11192/
§6.6 数据增强
真实世界理赔数据不能做常规意义上的数据增强(如翻转、旋转),因为每个字段都有行政语义。这里的"增强"指的是合法的样本构造策略。
| 策略 | 安全性 | 说明 |
|---|---|---|
| 患者级负采样(调整正负比) | ✅ 安全 | 罕见病建模中常用;必须只在训练集内做,且报告采样前后的基准率 |
| 时间窗平移构造多个观察期 | ✅ 安全 | 对同一患者在不同起始点切分观察窗,增加有效样本;须防止同一观察窗跨划分 |
| 多代码集定义构建多版本队列 | ✅ 安全 | 用严格/宽松两套定义构建队列,作为结论稳健性检验,而非混入训练 |
| 引入客户自有专有数据链接 | ✅ 安全 | Sentinel 的核心能力;须确保链接后的数据不引入新的标识信息 |
| 特征层面的扰动/噪声注入 | ⚠️ 谨慎 | 若用于鲁棒性测试可以;若用于扩充训练集,会破坏行政代码的离散语义 |
| 对稀有结局做 SMOTE 等过采样 | ⚠️ 谨慎 | 会破坏校准度;若使用必须在评估时恢复原始基准率 |
| 跨数据源拼接以"补齐"缺失患者 | ❌ 危险 | 未经 token 对齐的拼接会产生重复患者与错误链接 |
| 用插补填充结构性缺失(如未参保人群) | ❌ 危险 | 结构性缺失不可插补;填报后的数值会掩盖真实偏倚 |
| 把 open claims 当 closed 使用 | ❌ 危险 | 直接导致行为类指标系统性错误(见坑点 1) |
| 跨划分复制同一患者的时间窗变体 | ❌ 危险 | 严重数据泄漏,性能被大幅高估 |
§6.7 模型推荐
| 任务 | 首选模型 | 次选 | 理由 |
|---|---|---|---|
| 队列可行性估计(描述性) | 规则引擎 + SQL 聚合 | 不适用 | 不需要模型;代码集规则的可复现性优于任何黑箱 |
| 未诊断患者发现(罕见病) | 梯度提升树(LightGBM/XGBoost) | 逻辑回归 + 特征工程 | 表格型稀疏特征上 GBDT 表现稳定,可解释性好,便于审评 |
| 治疗依从性/停药预测 | 生存模型(Cox、RSF、DeepSurv) | 离散时间生存模型 | 存在大量右删失,分类模型不适用 |
| 疾病进展序列建模 | Transformer / GRU 序列模型 | 梯度提升 + 序列特征 | 就诊序列有明确时间结构,序列模型可捕获长期依赖 |
| 比较效果研究 | 倾向评分加权 + 目标试验模拟 | 工具变量、双重稳健估计 | 因果推断需要显式的混杂控制框架 |
| 安全性信号检测 | 中断时间序列、自身对照设计 | 序列对称性分析(SCCS) | 需控制长期趋势与季节性 |
| 健康公平分析 | 分层率估计 + 差异分解 | 交互作用模型 | 结论需要可解释、可审计,避免黑箱 |
| 合成对照臂构建 | 倾向评分匹配 + 熵平衡 | 贝叶斯分层模型 | 需要协变量分布高度可比 |
§6.8 计算资源需求
| 环节 | 典型资源需求 | 说明 |
|---|---|---|
| 平台内查询与聚合 | 无需本地资源 | 计算在云端完成,用户仅接收聚合结果 |
| 队列构建与特征工程 | 单机 32–64 GB 内存 | 全国级队列的患者级特征表通常达数 GB 至数十 GB |
| 梯度提升建模 | 单机 64 GB 内存 + 多核 CPU | GPU 收益有限,表格数据上 CPU 通常已足够 |
| 序列模型训练 | 单卡 GPU(16 GB 显存以上) | 序列长度与诊断码维度决定显存占用 |
| 因果推断与敏感性分析 | 单机 32 GB 内存 | 主要是重复拟合与自助法,属 CPU 密集 |
| Snowflake 环境内分析 | Snowflake 计算额度 | 成本按 Capacity Drawdown 额度计量,SQL 效率直接影响成本 |
| 本地落地存储(如获授权) | 依导出范围而定 | 官方未披露全量体积;须在合同中明确导出范围并据此估算 |
成本提示:这类平台的成本结构有两个常被低估的部分。一是平台费用(第三方评测口径显示单用例订阅约 15 万–45 万美元/年,完整访问可达七位数);二是使用平台所需的专职分析人力——理赔数据的队列定义与偏倚诊断需要具备流行病学与因果推断训练的分析师,缺乏这类人力会导致昂贵的数据资产成为"货架软件"。
§6.9 评估指标
import numpy as np, pandas as pd
from sklearn.metrics import roc_auc_score, average_precision_score, brier_score_loss, calibration_curve
def evaluate_rwd_model(y_true, y_prob, cohort_stats: dict = None):
"""真实世界数据建模评估。y_true: 0/1 结局标签;cohort_stats 可含 prevalence_expected"""
m = {"auroc": roc_auc_score(y_true, y_prob),
"auprc": average_precision_score(y_true, y_prob)} # 稀有结局下 AUPRC 比 AUROC 更有信息量
m["prevalence"] = float(np.mean(y_true))
m["auprc_lift"] = m["auprc"] / m["prevalence"]
m["brier"] = brier_score_loss(y_true, y_prob) # 类别不平衡会让模型高估风险
frac_pos, mean_pred = calibration_curve(y_true, y_prob, n_bins=10)
m["calibration_gap"] = float(np.max(np.abs(frac_pos - mean_pred)))
for k, v in m.items():
print(f"{k:>16}: {v:.4f}")
# 队列质量自查:与文献流行病学预期对照
if cohort_stats and cohort_stats.get("prevalence_expected"):
exp_p = cohort_stats["prevalence_expected"]
ratio = m["prevalence"] / exp_p if exp_p else np.nan
print(f"观察基准率: {m['prevalence']:.4%} | 文献预期: {exp_p:.4%} | 比值: {ratio:.2f}")
if ratio > 1.5:
print("警告:队列规模超出流行病学预期,优先排查筛查误判(见坑点 2),而非调参。")
return m
真实世界数据建模的评估原则:
1. 优先报告 AUPRC 与"相对基准率的提升倍数",而非只有 AUROC
—— 稀有结局下 AUROC 会显得漂亮但缺乏实际意义
2. 必须报告校准度(校准曲线 / Brier 分数)—— 理赔数据的类别不平衡会让模型系统性高估风险
3. 必须报告时间稳健性(逐年滚动),而不只是随机交叉验证
4. 队列规模的流行病学合理性是模型性能的前提 —— 队列本身错了,再高的 AUROC 也无意义
5. 报告缺失数据敏感性与切片选择(closed vs open)的敏感性
§6.10 MLOps 笔记
| 环节 | 关键实践 | 理赔数据特有的注意点 |
|---|---|---|
| 数据版本管理 | 记录每次查询的时间戳与数据切片的 latest_service_date | 平台每日刷新,今天构建的特征表明天不可复现,必须固化快照标识 |
| 代码集版本管理 | 把 ICD/CPT/HCPCS/NDC 代码集作为受版本控制的工件 | NDC 会因包装与厂商变更失效;ICD 有年度更新周期 |
| 特征字典 | 每个特征的可用时间点必须显式记录(point-in-time correctness) | 理赔数据有结算延迟,特征在创建时点可能尚未获得 |
| 监控 | 监控预测分布、队列规模、缺失率、暴露/结局率随时间的变化 | 保障范围变更、支付方数据源调整会造成突发分布漂移,而非渐进漂移 |
| 重训练触发 | 以时间稳健性衰减为触发依据,而非固定周期 | 当 walk-forward 评估显示 AUROC 衰减超阈值时重训 |
| 可复现性 | 保存完整的查询 SQL、代码集清单、划分种子与模型版本 | 平台不提供数据集版本号,可复现性必须由使用方自身保证 |
| 合规审计 | 记录每次数据访问的范围与目的,保留分析产出为聚合级的证据 | 合同通常限制患者级数据的导出,审计日志是合规基础 |
| 成本管理 | 监控 Snowflake 计算额度消耗与查询效率 | Capacity Drawdown 模式下,低效 SQL 直接转化为成本 |
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解方式 |
|---|---|---|---|
| 覆盖偏倚(保险状态) | 未参保人群完全不在数据中;不接受保险的诊所(如部分心理健康机构)患者缺失 | 高 | 在局限性中显式声明;把率估计表述为"参保人群中的率";对心理健康等领域用全国调查数据交叉校验 |
| 覆盖偏倚(单一大型系统) | 加州 Kaiser Permanente 网络内患者完全不包含 | 高 | 涉及加州的州级率比较必须声明;避免与人口特征相似州直接比较 |
| 可见性偏倚(open vs closed) | open claims 只能看到网络内行为,行为类指标会被系统性高估"终止" | 高 | 行为类分析严格限定 closed claims 子集;报告子集占比 |
| 编码偏倚 | 编码服务于报销,存在 rule-out 诊断、up-coding、编码习惯差异 | 高 | 优先使用客观锚点(操作、药品、检验)确证;多代码一致性校验 |
| 筛查误判 | 高筛查率治疗领域中,筛查就诊的诊断码导致队列膨胀 | 中高 | 要求时间窗内多次相关理赔;与文献流行病学预期对照 |
| 左截断偏倚 | 数据仅回溯至 2015 年,早期年份患者历史不足 | 中高 | 索引日期起点设为数据起点加洗脱期;对回溯不足年份做敏感性分析 |
| 时间偏倚(数据延迟) | closed 数据约 1 个月到位,open claims 每周至每日 | 中 | 趋势分析截断最近 1–2 个月;报告数据成熟度曲线 |
| 缺失偏倚(种族族裔) | 自报种族与族裔仅覆盖约 65% 患者,缺失可能非随机 | 中高 | 显式报告各亚组缺失比例;把 unknown 作为独立类别;多重插补 |
| 地理聚合偏倚 | 地理仅到 ZIP3,无法支持精细化可达性分析 | 中 | 明确声明粒度;与 ACS 人口数据匹配后再做地理比较 |
| 儿科数据稀疏偏倚 | 儿童与年轻患者的实验室、治疗与诊断信息极其稀疏 | 中高 | 儿科研究须补充临床数据源;明确说明模型对年轻患者的识别能力受限 |
| 结构化字段偏倚 | 无自由文本临床笔记,临床细节受限于编码 | 中 | 需要临床细节的研究须另配临床数据源(如 MapEnhance EHR 层) |
| 幸存者偏倚 | 需要在保与持续就诊才能被观察到,病情严重脱离系统者可能失访 | 中 | 用死亡登记校正;生存分析中显式处理右删失 |
| 用户定义偏倚 | 队列定义质量完全依赖使用方,缺乏统一标准 | 中高 | 完整披露代码集与时间窗;多版本队列做稳健性检验 |
§7.2 数据质量评估
| 质量维度 | 评估 | 依据 |
|---|---|---|
| 去重与合并 | 强 | 官方采用专有流程消解跨来源重复理赔,并把同一次就诊的多条报销合并为单一可计费就诊 |
| 规范化程度 | 强 | 数据标准化至 OMOP CDM 兼容 schema,代码集使用 HIPAA 法定标准 |
| 可追溯性 | 强 | federated 获取流程使每个数据元素可标记回来源,配合随机质量抽检 |
| 时效性 | 中强 | 每日刷新,但 closed 数据约 1 个月延迟,open 数据每日至每周 |
| 纵向连续性 | 强(在 payer-complete 窗口内) | 持久 token 保证跨机构、跨时间链接;1.6 亿年度 closed 可链接患者 |
| 临床粒度 | 弱至中 | 结构化字段为主,无自由文本;肿瘤分期、精确生命体征通常不可得 |
| 人群代表性 | 中 | 覆盖 Medicare/Medicaid/商业保险,但排除未参保、非参保诊所患者与加州 KP 成员 |
| 标签可信度 | 依赖用户 | 无预置标签;标签质量为使用方队列定义质量的函数 |
| 可审计性 | 强 | 数据来源可回溯;平台强调每个元素可标记回源 |
| 基准可比性 | 弱 | 无官方划分与公共基准;跨论文性能不可直接比较 |
§7.3 泛化性讨论
| 场景 | 失效风险 | 证据/依据 |
|---|---|---|
| 从商业保险人群迁移到 Medicare/Medicaid 人群 | 中高 | 支付方类型影响覆盖范围与照护路径;官方明确未参保人群缺失,Medicaid 覆盖依赖 CMS 数据授权 |
| 从美国迁移到其他医疗体系 | 高 | 平台以美国为中心(另含加拿大);行政编码体系与照护模式高度国别特定 |
| 从 closed claims 切片迁移到 open claims 切片 | 高 | 可见性差异直接改变行为类指标的分布(见坑点 1) |
| 从成人迁移到儿童/青少年 | 高 | 儿科患者理赔数据稀疏,HoFH 研究明确记载模型对年轻患者识别能力受限 |
| 从数据充裕年份迁移到早期年份 | 中高 | 2015 年数据起点造成溯源不足;编码版本过渡(ICD-9 转 ICD-10)造成不连续 |
| 从常见病迁移到超罕见病 | 中高 | 无专属 ICD 码时依赖高级治疗锚定,会漏掉未接受该类治疗的患者 |
| 从描述性分析迁移到因果推断 | 中高 | 观察性数据存在适应证混杂与健康使用者偏倚;需严谨的因果框架 |
| 从研究用途迁移到临床实时决策 | 高 | 数据延迟与结算特性使其不适合实时运营决策 |
| 从有 MapEnhance 实验室层迁移到无该层 | 高 | 依赖客观检验终点(如 ANC 分级)的模型在没有实验室层时无法运行 |
§7.4 伦理考量
去标识化的技术边界。 平台使用 Datavant tokenization 把患者身份替换为持久加密假名,官方明确声明不向客户共享任何 PHI 与 PII。但需要认识到,"去标识化"不等于"不可重新识别"的绝对保证——持久 token 的价值恰恰在于它可以被链接,而链接能力本身就是重新识别风险的来源。研究者在把 Komodo 数据与自有数据链接时(Sentinel 的核心场景),必须自行评估链接后是否产生了新的可识别性。
用途限制与合同约束。 与开放数据集不同,Komodo Healthcare Map 的使用严格受双边合同约束。合同通常限定数据用途、禁止患者级数据导出、要求分析产出一律以聚合形式呈现。研究者不应把平台数据用于合同未覆盖的用途,也不应在论文中披露任何可能反推个体或机构的细节(如极端稀有的队列规模与精确地理组合)。
公平性研究的双刃剑。 平台提供自报种族与族裔数据(约 65% 覆盖)与 SDOH 数据,这为健康公平研究提供了条件。但正如坑点 6 所述,缺失的非随机性可能导致对弱势群体的系统性低估。以公平为名使用不完整的数据,可能得出"差异不大"的错误结论,反而掩盖了真实的不平等。
患者权益视角。 患者通常不知道自己被计费的照护记录进入了商业数据平台。虽然 HIPAA 允许在去标识化条件下进行此类二次使用,但学术界对"通知与同意"的边界仍在讨论之中。研究者在发表成果时,应意识到数据背后是真实患者的照护经历。
§7.5 公平性评估
| 公平性维度 | 现状 | 风险 | 建议做法 |
|---|---|---|---|
| 种族与族裔代表性 | 自报数据覆盖约 65% 患者,类别对齐美国人口普查 | 缺失非随机会低估特定群体 | 分层报告缺失率;做多假设敏感性分析 |
| 社会经济代表性 | 通过 ZIP3 与人口普查数据提供 SDOH 维度 | 个体层面 SES 不可得,区域代理会引入生态学谬误 | 明确区分区域水平与个体水平结论;避免生态学推断 |
| 保险类型代表性 | 覆盖 Medicare、Medicaid 与商业保险 | 未参保人群完全缺失,且其健康需求可能最迫切 | 明确研究人群为参保人群;在政策讨论中说明这一边界 |
| 地理代表性 | 全美 50 州及哥伦比亚特区;另含加拿大 | 加州 Kaiser Permanente 成员缺席;ZIP3 粒度粗 | 加州分析单独声明;与外部数据校验 |
| 年龄代表性 | 全年龄段,但儿科数据稀疏 | 儿科模型性能受限,可能加剧儿童用药证据缺口 | 儿科研究须补充临床数据源;避免仅凭理赔数据下结论 |
| 照护场景代表性 | 网络内、网络外、专科、急诊、零售诊所 | 不接受保险的照护场景(部分心理健康)缺失 | 心理健康等领域与全国调查数据交叉验证 |
| 语言与文化 | 数据以英语与结构化代码集为主 | 非英语人群的照护路径可能不同 | 结合地理与族裔维度做亚组分析 |
§7.6 数据漂移提示
| 漂移来源 | 机制 | 监控指标 | 应对 |
|---|---|---|---|
| 支付方数据源变更 | 平台会持续优化数据伙伴组合(如新增 9,000 万年度 closed lives 即属此类调整) | 各支付方患者数占比、closed 占比 | 固化快照标识;在方法学中记录数据获取时点;变更后重跑关键分析 |
| ICD 编码版本更新 | ICD-10-CM 每年更新,新增/废弃代码 | 队列定义代码集的可解析率 | 代码集纳入版本控制,年度审查 |
| NDC 变更 | 药品包装与厂商变更导致旧 NDC 失效 | NDC → 通用名映射失败率 | 维护映射表版本;失败项单独报告 |
| 照护模式变迁 | 远程医疗、零售诊所兴起改变就诊场景分布 | place_of_service 分布 | 保留 unknown 类别;把场景分布作为漂移特征 |
| 疾病定义演进 | 临床指南更新导致治疗路径改变(如筛查推荐年龄调整) | 队列规模与治疗起始率 | 队列规模与流行病学预期持续对照 |
| 平台能力扩展 | MapEnhance 新增数据层,历史期与新增期的数据完整度不同 | 各增强层的覆盖时间范围 | 增强层使用时明确其可用起始时点 |
| 大流行等外部冲击 | 如 COVID-19 造成照护中断,改变所有治疗领域的路径 | 全因就诊量、各领域就诊量 | 在时间稳健性评估中显式标注冲击期 |
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ⚠️ | 平台以长表(一次就诊一行 / 一次配药一行)的关系型结构组织,而非宽格式;用户需自行透视,属合理设计但增加特征工程工作量 |
| 2 | 唯一标识 | ✅ | patient_token、claim_id、rx_id 提供稳定的唯一标识;平台已做跨来源去重与就诊合并 |
| 3 | 特殊字符 | ✅ | 字段以结构化代码(ICD/CPT/HCPCS/NDC)与枚举值为主,自由文本缺失,特殊字符风险极低 |
| 4 | 重复行 | ✅ | 平台采用专有流程消解跨来源重复理赔,并把同次就诊的多条报销合并为单一可计费就诊 |
| 5 | 缺失编码 | ✅ | 使用显式的信息性缺失编码(unknown / unattributed / unmapped / not_covered),而非空白 |
| 6 | 标签标识 | ⚠️ | 无预置标签体系,所有标签由用户在分析期构建;标签质量完全取决于用户的队列定义 |
| 7 | 罕见类分组 | ⚠️ | 平台提供罕见病识别能力(代理队列 + ML),但无专属 ICD 码的病种需人工设计锚点,罕见类容易过小而无法稳定建模 |
| 8 | 偏倚评估 | ✅ | 官方公开方法论明确列出未参保人群、非参保诊所、Kaiser Permanente 加州成员等结构性排除,偏倚可被显式讨论 |
| 9 | 数据字典 | ⚠️ | 官方未公开完整字段字典;schema 与字段范围依合同交付而定,用户需自行建立字段文档 |
| 10 | 信息性缺失解释 | ✅ | 缺失机制在官方方法论中有明确说明(种族族裔覆盖约 65%、数据延迟分层、地理粒度 ZIP3),可支持信息性缺失建模 |
| 11 | 设备记录 | ⚠️ | 不适用传统设备记录;数据来自理赔与检验系统,系统间编码习惯差异构成等价的"设备效应" |
| 12 | 共线性 | ⚠️ | 理赔特征(诊断码、操作码、药品)之间存在高度共线性与冗余,需正则化或特征选择;平台不提供预处理 |
| 13 | 编码映射 | ✅ | 使用 HIPAA 法定标准代码集(ICD-9/ICD-10、ICD-10-PCS、CPT、HCPCS、NDC),并规范化为 OMOP CDM 兼容 schema,跨数据集映射路径成熟 |
| 14 | 时间戳处理 | ✅ | service_date、fill_date、coverage_start/end 提供完整的时间维度,支持患者旅程排序与可见性窗口界定 |
| 15 | 划分建议 | ❌ | 无官方划分建议;平台非基准数据集定位,患者级划分与时间划分需用户自行设计 |
| 16 | 泄漏讨论 | ⚠️ | 官方未提供泄漏风险指南;理赔数据的可见性窗口与时间维度泄漏需用户自行识别(见 §5.3) |
| 17 | 标签分布 | ⚠️ | 无预置标签因而无标签分布;用户需自行报告基准率并与文献流行病学预期对照 |
| 18 | 测量偏倚 | ✅ | 官方明确说明理赔编码以报销为目的、存在筛查误判风险与代理队列局限,测量偏倚可被显式建模 |
| 19 | 外部验证建议 | ⚠️ | 官方通过合作案例展示外部验证路径(如与国家级眼科登记、Myriad Genetics 数据链接),但无通用的外部验证协议 |
| 20 | 版本记录 | ❌ | 数据集为持续刷新的动态资产,无版本号;可复现性必须由使用方通过快照标识自行保证 |
| 21 | 预处理脚本 | ❌ | 官方不提供预处理脚本;平台提供分析环境(MapLab/Sentinel)而非建模流水线 |
| 22 | 合规要求 | ✅ | 去标识化与 HIPAA 合规有明确要求;CMS 数据授权(QE + Innovator’s License)与合同用途限制构成清晰合规边界 |
| 23 | 多模态对齐 | ✅ | 理赔、药房、实验室、基因组、死亡登记、SDOH 通过持久 patient_token 在时间轴上对齐,多模态链接是其核心设计 |
| 24 | 去标识化 | ✅ | Datavant tokenization 替换直接标识符;官方声明不共享 PHI/PII;地理降至 ZIP3;患者级原始数据不导出,仅交付聚合结果 |
DAIMS 评分:16.5 / 24
评分解读:Komodo Healthcare Map 在数据工程基础维度(唯一标识、重复行、缺失编码、编码映射、时间戳、多模态对齐、去标识化、合规要求)表现优秀——这符合它作为企业级商业数据资产的定位,其数据治理水平确实高于多数研究型数据集。但在AI 基准就绪维度(划分建议、版本记录、预处理脚本、数据字典、标签分布)全面缺失——这不是缺陷,而是产品定位的必然结果:它销售的是分析平台与数据底座,不是可供论文复现的基准数据集。评分 16.5/24 反映的正是这一结构性特征:作为数据源它是优等生,作为 AI 基准它是空白。
对你意味着什么:如果你计划用这个数据做 AI 研究,请把预算与时间按以下比例分配——约 60% 投入在队列定义与标签构建(决定研究成败、也是平台不提供帮助的环节);约 20% 投入在可见性窗口与泄漏防御的设计;约 15% 投入在偏倚诊断与敏感性分析;只有约 5% 是模型训练本身。如果你需要的是"下载即用、可与论文对比"的基准数据,这个平台不是合适的选择——应转向有公开划分与预处理脚本的学术数据集。如果你需要的是回答一个无法用学术数据集回答的真实世界问题(如某罕见病在全国的实际治疗路径与地理分布),那么这里的 ⚠️ 与 ❌ 都是你必须自行承担的工程成本,而不是可以绕过的障碍。
§7.8 外部验证矩阵
下表只收录有公开记录支撑的验证案例。由于平台无统一的内部基准划分,"相对内部变化"一栏在多数情况下无法给出可比数值,以"不适用"标注。
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| 国家级眼科注册登记 | Novartis Pharmaceuticals | 黄斑变性药物安全性(回顾性队列) | 队列规模超过 10,000 名患者;结果发表于 JAMA(2021) | 不适用 | 理赔数据与专科注册登记链接可显著提升队列的临床可信度 |
| 客户自有患者报告结局数据库 | Harvard Medical School 与 Cerner Enviza(原 Kantar Health) | 常用骨质疏松药与 COVID-19 感染结局关联 | 覆盖近百万患者旅程;成果发表于 Value in Health(2022) | 不适用 | closed claims 与连续参保数据是行为类结局研究的必要前提 |
| 专有基因组检测数据 | 临床遗传检测实验室(经 MapEnhance 基因组层) | 纯合子家族性高胆固醇血症(HoFH)识别 | 模型在测试集上表现良好;结果发表于 Nature Scientific Reports(2024) | 不适用 | 预测患病人数高于流行病学预期(1/25 万);依赖高级降脂治疗锚定会漏掉年轻患者;未做独立理赔数据验证 |
| 专有诊断编码数据 | Myriad Genetics | 验证诊断编码记录的孕龄准确性 | 用于妊娠结局(流产、死产)分类的编码准确性验证 | 不适用 | 编码准确性需外部数据校准后方可用于妊娠结局研究 |
| 客户专有临床数据(Sentinel 链接) | Intercept Pharmaceuticals | 原发性胆汁性胆管炎(PBC)Ocaliva 长期结局(HEROES-US) | 无事件生存期改善具统计学显著性;结果于 AASLD 发布 | 不适用 | 随机对照试验(COBALT)因招募困难终止后,RWD 回顾性研究可成为替代证据路径 |
| 大规模真实世界行为分析 | AppliedVR | 数字疗法(RelieVRx)临床试验设计 + 合成对照臂 | 1,000 人随机对照试验设计;1000 人规模四臂 16 周设计 | 不适用 | 合成对照臂可提升试验代表性,但需协变量分布高度可比 |
| 内部历史期数据 | Komodo Health 研究团队 | 氯氮平 REMS 项目对中性粒细胞减少结局的影响 | 中断时间序列分析;被 ISPOR 2024 评为前 5% 研究;完成周期约 2 个月 | 不适用 | 通过假名化 token 链接理赔与实验室数据,可比传统链接方法快得多完成分析 |
| 跨平台率估计比对 | 无公开记录 | 与 MarketScan、Optum Clinformatics 等平台比对患病率 | 官方未披露 | 不适用 | 平台明确不公开跨平台验证结果;口径对齐是任何比对的前提 |
关于外部验证的说明:上表反映出 Komodo Healthcare Map 的外部验证呈现**“案例驱动"而非"协议驱动”**的特征——每个验证都依附于具体合作项目与疾病领域,没有统一框架与可公开复现的基准。对研究者的含义是:不能引用平台的"验证结果"作为自身研究有效性的背书,必须针对自己的队列与结局独立设计并执行验证方案。
§8 基准性能与生态
§8.1 性能排行榜
Komodo Healthcare Map 没有官方排行榜。这不是信息缺口,而是产品定位的直接结果:平台销售的是数据底座与分析环境,客户在合同范围内建立的模型属于各自机构的资产,不会被汇总为公开可比性基准。因此本词条不提供排行榜表格——平台不提供统一划分与公开评测集,任何"排名"都无据可依。
数值不可直接比较的原因:即便论文报告了在 Komodo 数据上训练的模型性能(如 HoFH 识别研究),这些数字也不可跨论文比较——其一,队列定义不同:各论文自行定义代码集、时间窗与就诊次数要求,队列难易度差异可能大于模型架构差异;其二,数据切片不同:有用全量 open+closed、有只用 closed,正负样本构造完全不同;其三,时间窗口不同:2018–2020 训练与 2021–2023 训练面临的编码版本、照护模式与完整度均不同。因此任何"模型 A 优于模型 B"的跨论文结论都不可靠,除非两篇共享完全一致的队列定义与切片。
§8.2 SOTA 总结与选型建议
由于缺乏统一基准,“SOTA"在此平台上应重新定义:不是"最高精度”,而是"最适合该研究问题的设计与方法"。
| 研究问题类型 | 实践中的主流做法 | 选型建议 |
|---|---|---|
| 罕见病未诊断患者发现 | 梯度提升树 + 代理队列规则,以高级治疗暴露锚定阳性 | 优先保证队列定义的可解释性,避免复杂模型掩盖定义缺陷 |
| 治疗依从性/持久性 | 生存分析(Kaplan-Meier、Cox)+ PDC/MPR 指标 | 核心是可见性窗口的正确界定,模型复杂度次要 |
| 比较效果研究 | 目标试验模拟 + 倾向评分加权 | 方法学远比模型重要;必须报告敏感性分析 |
| 疾病负担与流行病学 | 分层标准化率 + 中断时间序列 | 不做复杂建模;重点在人群分母的正确选择与偏倚诊断 |
| 疾病进展预测 | 序列模型(Transformer/GRU)或梯度提升 + 序列特征 | 先建立梯度提升基线;序列模型在长序列依赖明显时才带来增益 |
| 健康公平分析 | 分层率估计 + 差异分解 | 必须报告缺失机制的影响;避免黑箱模型 |
| 临床试验可行性 | 规则引擎 + 空间聚合 | 完全不需要 ML;代码集规则的可复现性是最大优势 |
选型的第一原则:在这个平台上,数据设计的质量(队列定义、可见性窗口、偏倚控制)对结论可靠性的影响,远大于模型选择。把精力投入到模型调参而忽略队列定义,是本末倒置。
§8.3 评测协议
平台不提供官方评测协议;基于真实世界数据通行实践,建议采用以下自建协议。
| 协议要素 | 建议做法 |
|---|---|
| 评估目标 | 明确区分"区分度"(discrimination)与"校准度"(calibration),两者都要报告 |
| 主要指标 | 稀有结局优先报告 AUPRC 与相对基准率的提升倍数;同时报告 AUROC 作为参照 |
| 校准评估 | 校准曲线 + Brier 分数 + 校准截距/斜率;理赔数据类别不平衡时校准尤为关键 |
| 划分方式 | 必须患者级;推荐同时报告患者级随机划分与时间前向划分 |
| 时间稳健性 | 逐年 walk-forward 评估,报告性能衰减幅度 |
| 敏感性分析 | 至少覆盖:队列定义严格度、数据切片(closed vs open)、缺失处理方式、偏移对照 |
| 因果类研究 | 报告倾向评分平衡诊断(SMD)、E-value 或阴性对照结局检验 |
| 可复现性 | 完整披露代码集、时间窗、索引日期定义、数据快照时点与版本环境 |
§8.4 相关数据集
| 数据集/平台 | 类型 | 与本平台的差异 |
|---|---|---|
| Truveta | 美国真实世界数据平台 | 以会员医疗系统 EHR 为主要骨架,临床深度与检验细节更丰富;本平台以理赔为骨架、覆盖更广 |
| Epic Cosmos | 美国真实世界数据平台 | 强调在 Epic 生态内直接查询、无需数据搬移;本平台提供可链接的跨来源理赔视图 |
| Flatiron Health | 肿瘤领域 RWD 平台 | 以人工抽象的肿瘤专科 EHR 为核心,临床粒度远高于理赔;本平台覆盖更广但肿瘤细节更浅 |
| MarketScan | 美国商业理赔数据库 | 历史悠久、覆盖面广;以 open claims 为主,payer-complete 完整性不及本平台 |
| Optum Clinformatics | 美国理赔数据库 | 支付方自有数据、纵向连续性好;本平台叠加更多第三方增强层(基因组、SDOH 等) |
| HealthVerity | 美国 RWD 与身份解析平台 | 侧重数据连接与身份解析能力;本平台侧重纵向患者旅程与分析产品矩阵 |
| MIMIC-IV | 学术重症监护数据集 | 单中心高粒度临床数据,开放获取,有官方基准;本平台全国覆盖但粒度粗、商业授权 |
选型提示:如果研究问题需要肿瘤分期、精确检验值或自由文本,应优先考虑 EHR 型或专科抽象型平台;如果需要评估全国范围的治疗路径、依从性与地理分布,理赔型平台覆盖优势更明显。两类数据并非替代关系,而是互补——已有研究通过链接两类数据(如理赔 + 专科登记)同时获得覆盖广度与临床深度。
§8.5 关键论文 Top 10
| # | 完整引用 | 一句话贡献 |
|---|---|---|
| 1 | Komodo Health. Analyzing Data in Komodo’s Healthcare Map: Summary of Standard Methodology. Technical Documentation, accessed 2026-09. | 最重要的官方依据:患者口径、数据范围、排除人群、缺失编码与数据延迟机制 |
| 2 | Zhang, Y., et al. Scientific Reports, 14, 2024. DOI: 10.1038/s41598-024-58719-y | 披露关键局限(2015 年起、无专属 ICD 码、儿科稀疏),理解理赔数据边界的核心文献 |
| 3 | Komodo Health. Adds 90M Closed Lives Per Year To Expansive Healthcare Map. Press Release. | 披露 closed lives 口径与 1.6 亿年度可链接患者规模,行为类研究设计的关键依据 |
| 4 | Komodo Health. Launches Prism and Sentinel. Press Release, 2021-04-14. | 界定队列构建与开发者算法平台的能力边界 |
| 5 | Komodo Health. Awarded CMS Innovator’s License. Press Release. | CMS 数据授权的法律基础与覆盖规模(1.3 亿+受益人) |
| 6 | Komodo Health. Grows Its MapEnhance Offering, Expanding Access to New SDOH Insights. Press Release. | MapEnhance 合作方矩阵(GeneDx、COTA、Invitae 等)与增强层构成 |
| 7 | Komodo Health. Collaborates With Academic Institutions. | 学术合作机制与 1.5 亿 payer-complete 数据集口径 |
| 8 | Komodo Health. RWE Platform Drives 31 Patient Journey Studies at ISPOR 2025. Press Release, 2025-05-14. | HEOR 领域的规模化应用与方法学进展(含目标试验模拟) |
| 9 | Komodo Health. Launches Healthcare Map on Snowflake Marketplace. Press Release. | 访问机制演进(Capacity Drawdown)与覆盖范围(美国与加拿大) |
| 10 | U.S. FDA. Real-World Evidence — Framework and Guidance for Regulatory Decision-Making. | RWE 在监管提交中的数据来源、标准与流程要求,本平台战略价值的政策语境 |
§8.6 社区活跃度
| 维度 | 现状 | 说明 |
|---|---|---|
| 开放社区 | 无 | 商业平台,无 GitHub 仓库、无公开 issue 追踪、无用户论坛 |
| 学术生态 | 活跃且规模增长 | 2024 年 ISPOR 33 项研究;2025 年 ISPOR 31 项研究;累计 250+ 同行评审研究 |
| 教育培训 | 通过企业合同提供 | 平台提供使用培训,但不面向公众开放 |
| 方法学公开度 | 中 | 官方公开标准方法论摘要,但字段字典、schema 细节与验证结果不公开 |
| 第三方评测 | 中等 | 采购评测平台与行业报告提供定价与能力对比,但缺乏技术深度评测 |
| 学术合作入口 | 存在但门槛高 | 有 Stanford Medicine、University of Maryland 等合作先例,需机构级协议 |
| 技术伙伴生态 | 增长中 | 与 Snowflake、Databricks、Nasdaq 以及 Anervea.ai 等技术伙伴建立合作 |
§8.7 生态快照
| 资源 | 类型 | 链接 | Star/规模(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| Komodo Health 官网 | 官方主页 | https://www.komodohealth.com | 不适用(非代码仓库) | 产品矩阵与规模口径的一手来源 |
| 标准方法论摘要 | 官方技术文档 | https://www.komodohealth.com/?p=11192/ | 不适用 | 理解数据口径、排除人群与缺失机制的核心文档 |
| 新闻与公告中心 | 官方新闻 | https://www.komodohealth.com/press/ | 不适用 | 追踪产品发布、合作与规模更新的权威渠道 |
| CMS Qualified Entity 项目 | 监管机构文档 | https://www.cms.gov/research-statistics-data-and-systems/monitoring-programs/qemedicaredata | 不适用 | 核实 QE 认证名单与数据共享法律框架 |
| Snowflake Marketplace 列表 | 交易平台 | https://www.komodohealth.com/?p=18157/ | 不适用 | 了解 Capacity Drawdown 访问模式 |
| HoFH 机器学习研究 | 同行评审论文 | https://www.nature.com/articles/s41598-024-58719-y | 不适用 | 理解理赔数据局限与队列构建实践的最佳单篇文献 |
| ISPOR 2025 研究汇总 | 官方新闻 | https://www.komodohealth.com?p=16871/ | 不适用 | 了解平台在 HEOR 领域的研究方法学前沿 |
| 第三方厂商对比报告 | 行业分析 | https://intuitionlabs.ai/pdfs/pharma-real-world-data-platforms-2026-vendor-comparison.pdf | 不适用 | 提供跨平台能力与定位对比(注意其数据为二手引用) |
| 采购定价评测平台 | 行业评测 | https://www.vendr.com/marketplace/komodo-health | 不适用 | 提供产品矩阵清单与成本量级的市场观察值 |
§9 相关资源与引用
§9.1 官方文档与资源
| 资源 | 说明 | 链接 |
|---|---|---|
| Komodo Health 官方网站 | 产品矩阵、公司信息与规模口径 | https://www.komodohealth.com |
| 标准方法论摘要 | 患者口径、数据范围、排除人群、缺失与延迟机制 | https://www.komodohealth.com/?p=11192/ |
| 新闻与公告 | 产品发布、合作、融资与规模更新 | https://www.komodohealth.com/press/ |
| MapEnhance 增强层说明 | 专科数据合作方与自建增强资产清单 | https://www.komodohealth.com/?p=12443 |
| Snowflake Marketplace 上架公告 | Capacity Drawdown 访问模式与覆盖范围 | https://www.komodohealth.com/?p=18157/ |
| CMS Qualified Entity 项目 | 联邦数据共享的监管框架与认证名单 | https://www.cms.gov/research-statistics-data-and-systems/monitoring-programs/qemedicaredata |
| CMS Innovator’s License 公告 | CMS 数据授权范围与受益人覆盖规模 | https://www.komodohealth.com?p=12462/ |
| 学术合作说明 | 学术访问路径与 payer-complete 数据集口径 | https://www.komodohealth.com/?p=11633 |
§9.2 关键方法学文献
| 文献 | 主题 | 链接 |
|---|---|---|
| Zhang, Y., et al. (2024). Scientific Reports 14. | 理赔数据上的罕见病 ML 识别与数据局限 | https://www.nature.com/articles/s41598-024-58719-y |
| Komodo Health (2025). Clozapine REMS 评估研究. | 理赔与实验室数据链接的中断时间序列分析 | https://www.komodohealth.com/perspectives/new-data-technologies-and-rwe-support-health-policy-evaluations/ |
| Komodo Health (2025). ISPOR 2025 研究汇总. | 目标试验模拟等方法学进展 | https://www.komodohealth.com?p=16871/ |
| Komodo Health (2024). ISPOR 2024 研究汇总. | 队列构建与验证实践 | https://www.komodohealth.com?p=12445/ |
| Komodo Health. Intercept HEROES-US 合作说明. | RWD 替代随机对照试验的证据路径 | https://www.komodohealth.com/?p=12485 |
| U.S. FDA. Real-World Evidence Framework. | 监管语境下的 RWE 数据标准 | https://www.fda.gov |
§9.3 引用指南
引用 Komodo Healthcare Map 时,不要把它当作一个具有版本号与 DOI 的静态数据集引用,而应引用为商业数据平台,并务必在方法学部分披露八项信息:数据获取时点(平台每日刷新,不同时点的数据不可复现);患者覆盖口径(3.3 亿曾建档患者 / 1.6 亿年度 closed 可链接患者 / 2.38 亿分析级数据集,须明确所用口径);数据切片类型(open / closed / 混合);是否使用 MapEnhance 增强层及其具体范围;队列定义的完整代码集(ICD/CPT/HCPCS/NDC);索引日期定义、洗脱期长度与基线窗口;观察窗口的起止日期与数据延迟处理方式;以及已知排除人群对结论适用范围的限制。
§9.4 BibTeX 引用块
@misc{komodo_healthcare_map,
title = {Komodo Healthcare Map}, author = {{Komodo Health, Inc.}}, year = {2014},
howpublished = {De-identified U.S. patient-level real-world data platform}, url = {https://www.komodohealth.com},
note = {Accessed 2026-09; de-identified longitudinal claims-first data asset covering 330M+ U.S. patients with 1T+ linked records}
}
@techreport{komodo_methodology,
title = {Analyzing Data in Komodo's Healthcare Map: Summary of Standard Methodology},
author = {{Komodo Health, Inc.}}, institution = {Komodo Health}, year = {2024}, url = {https://www.komodohealth.com},
note = {Official documentation of patient coverage, data recency, exclusions, and informational missingness}
}
@article{zhang2024hofh,
title = {A machine-learning algorithm using claims data to identify patients with homozygous familial hypercholesterolemia},
author = {Zhang, Y. and others}, journal = {Scientific Reports}, volume = {14}, year = {2024},
doi = {10.1038/s41598-024-58719-y},
note = {Documents key limitations of claims-based modeling on the Komodo Healthcare Map}
}
@misc{komodo_cms_innovator,
title = {Komodo Health Awarded {CMS} Innovator's License}, author = {{Komodo Health, Inc.}},
year = {2024}, howpublished = {Press release}, url = {https://www.komodohealth.com},
note = {Authorizes integration of Medicare, Medicaid and Medicare Advantage data covering 130M+ beneficiaries}
}
§10 AI 使用声明卡
§10.1 AI 模型列表
| 项目 | 说明 |
|---|---|
| 撰写模型 | 大语言模型辅助撰写,由千方病案医学编辑部设定结构与审核流程 |
| 辅助范围 | 公开资料检索汇总、章节结构组织、代码示例起草、表格整理 |
| 未参与范围 | 医学事实判定、偏倚严重程度评级、DAIMS 24 项评分、坑点的真实性核实 |
| 数据来源 | 仅使用公开可访问的官方文档、新闻稿、同行评审论文与行业报告 |
§10.2 AI 参与范围
| 环节 | AI 参与程度 | 人工介入方式 |
|---|---|---|
| 资料检索 | 高 | 人工确定检索方向与核实优先级 |
| 事实核验 | 中 | 所有关键数字均回溯至官方或同行评审来源;口径冲突处显式标注 |
| 章节撰写 | 高 | 人工审阅结构合规性、文风一致性与术语准确性 |
| 代码示例 | 高 | 人工审查逻辑正确性(代码为示意实现,需在具体环境验证) |
| 偏倚与局限分析 | 中 | 基于官方方法论与论文 limitation 提取,人工判别严重程度 |
| DAIMS 评分 | 低 | 人工逐项判定状态与最终分数 |
| 引用整理 | 高 | 人工核对链接有效性与引用完整性 |
§10.3 输入来源列表
本词条输入来源共 23 项,全部为公开可访问材料,完整链接见 §9.1 与 §9.2。按类型分组如下:
官方一手材料(15 项):Komodo Health 标准方法论摘要、官网首页与产品页、新闻中心、90M Closed Lives 扩张公告、Prism 与 Sentinel 发布公告(2021-04-14)、CMS Innovator’s License 公告、MapEnhance 扩张公告、学术合作说明、ISPOR 2025 研究汇总(2025-05-14)、ISPOR 2024 研究汇总(2024-05-06)、Snowflake Marketplace 上架公告、Clozapine REMS 研究说明、Janssen 合作公告(2021-03-31)、Syneos Health “Lab to Life” 合作公告(2021-05-03)、Intercept HCP 合作说明与 Anervea.ai 合作公告(2025-07-23)。
同行评审论文(1 项):Zhang, Y., et al. A machine-learning algorithm using claims data to identify patients with homozygous familial hypercholesterolemia. Scientific Reports 14, 2024. DOI: 10.1038/s41598-024-58719-y
监管机构文档(2 项):CMS. Data Available to Qualified Entities;U.S. FDA. Real-World Evidence Framework and Guidance。
第三方行业材料(5 项):Contrary Research 公司研究报告、IntuitionLabs 2026 年厂商对比报告、Vendr 采购定价评测、PitchBook 公司档案、Forge Global 估值数据。
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1 概览(规模数字与产品矩阵) | 千方病案医学编辑部 | 逐项回溯官方新闻稿与官网口径 | ✅ 已通过 |
| §2 医学背景(ICD-11 锚定、SNOMED 映射、临床任务) | 千方病案医学编辑部 | 医学编辑交叉审核代码集与任务定义 | ✅ 已通过 |
| §3 数据集规格(切片、格式、地域、溯源链) | 千方病案医学编辑部 | 对照官方方法论与第三方报告交叉核对 | ✅ 已通过 |
| §4 数据结构 与 §5 划分建议 | 千方病案医学编辑部 | 数据工程师审核字段语义、缺失编码与泄漏场景 | ✅ 已通过 |
| §6 AI 就绪指南(代码与 8 个坑点) | 千方病案医学编辑部 | 数据工程师审核代码逻辑;坑点逐条核实来源 | ✅ 已通过 |
| §7 质量评估(偏倚、DAIMS 24 项、外部验证矩阵) | 千方病案医学编辑部 | 医学编辑与数据工程师联合审核评分与依据 | ✅ 已通过 |
| §8 基准与生态(排行榜说明、相关数据集、文献) | 千方病案医学编辑部 | 核实无官方排行榜的事实与文献引用完整性 | ✅ 已通过 |
| §9 资源与引用、§10 AI 使用声明 | 千方病案医学编辑部 | 核对链接可访问性、引用格式与声明一致性 | ✅ 已通过 |
§10.5 AI 生成章节标注
| 章节 | 生成方式 | 说明 |
|---|---|---|
| §1-§3 | AI 起草 + 人工核实 | 所有规模数字与日期均有人工回溯的官方来源 |
| §4-§5 | AI 起草 + 人工审核 | 字段字典为逻辑等价结构,非官方 schema 的直接复制 |
| §6 | AI 起草 + 人工审核 | 代码为示意实现;坑点均来自官方文档与论文 limitation |
| §7 | AI 起草 + 人工判定 | DAIMS 逐项状态与评分由人工最终判定 |
| §8 | AI 起草 + 人工核实 | 相关数据集描述仅使用公开信息,不含平台内部数据 |
| §9-§10 | AI 起草 + 人工核实 | 引用与声明内容逐条核对 |
§10.6 最后人工审核日期
最后人工审核日期:2026-09-05 审核机构:千方病案医学编辑部
审核范围:全文结构与事实准确性、代码逻辑、DAIMS 评分、引用完整性、合规性表述
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- mdv — 共享标签:电子健康记录 / 医保理赔 / 真实世界数据
- snds — 共享标签:电子健康记录 / 医保理赔 / 真实世界数据
- gepard — 共享标签:电子健康记录 / 医保理赔 / 真实世界数据
- cancerlinq — 共享标签:电子健康记录 / 真实世界数据
- hcup-nis — 共享标签:电子健康记录 / 医保理赔
- scin — 共享标签:电子健康记录 / 真实世界数据
- jmdc — 共享标签:电子健康记录 / 医保理赔 / 真实世界数据
- marketscan — 共享标签:电子健康记录 / 医保理赔 / 真实世界数据
- seer-medicare — 共享标签:电子健康记录 / 医保理赔 / 真实世界数据
- premier-pinc-ai — 共享标签:电子健康记录 / 医保理赔 / 真实世界数据
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

