信息速览

TriNetX — 全球真实世界数据研究网络 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | TriNetX Global Research Network(TriNetX LIVE™) |
| 英文全称 | TriNetX Global Research Network / TriNetX LIVE™ Real-World Data Platform |
| 别名/简称 | TriNetX、TriNetX LIVE、TriNetX Research Network、TriNetX Network |
| 疾病分类 | 全疾病谱(ICD-11 全编码体系;高频领域如 5A11 2 型糖尿病 / 1G4Z 脓毒症 / BD1Z 心力衰竭 / GB61 慢性肾脏病等,详见 §2.1) |
| SNOMED CT | 平台术语体系覆盖 SNOMED CT(如 44054006 Diabetes mellitus / 84114007 Heart failure / 91302008 Sepsis),另支持 ICD-10-CM、LOINC、RxNorm、CPT(详见 §2.2) |
| 数据模态 | 结构化 EHR(诊断、操作/手术、检验、用药)、基因组学关联、理赔数据补充、NLP 抽取的非结构化临床事实 |
| AI 任务类型 | 队列识别与试验可行性、结局预测、药物警戒信号检测、比较效果研究、生存分析、表型算法(phenotyping)、HEOR 建模 |
| 样本总数 | 3.09 亿+ 患者生命 / 240+ 医疗机构 / 13,000+ 临床站点 / 940 亿+ 临床数据点(截至 2026-06) |
| 数据大小 | 查询式联邦访问,无单一下载包;单次导出数据集大小随队列规模浮动(数 MB 至数十 GB CSV) |
| 数据格式 | 在线联邦查询(聚合统计)+ 患者级数据集导出(CSV)/ OMOP CDM 就绪 |
| 许可证 | TriNetX Terms of Use + Dataset Release Agreement(逐数据集授权) |
| 访问级别 | 申请审核(学术合作申请 + 机构订阅;商业研究订阅制/议价) |
| DUO 标签 | GRU, IRB(队列计数探索无需 IRB;患者级数据导出需 IRB 批准并签署 Dataset Release Form) |
| 语言 | 英文为主(数据来源覆盖 20+ 国家,含非英语地区机构数据) |
| 首发日期 | 2014(TriNetX 由 Gadi Lachman 创立于美国马萨诸塞州剑桥市) |
| 最后更新 | 持续滚动更新(约 80% 医疗机构以 1/2/4 周间隔刷新,平均约 1 个月;规模口径截至 2026-08) |
| 发布机构 | TriNetX, LLC(2020-09 起为 The Carlyle Group 旗下公司) |
| 官方主页 | https://trinetx.com/ |
| 下载地址 | https://live.trinetx.com/(平台入口;数据集经平台内 Request Dataset 流程交付) |
| 引用次数 | 4,000+ 篇同行评审论文使用(TriNetX 官网统计,截至 2026-08;2026-06 官方新闻稿口径为 3,300+) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 在线联邦查询与内置统计工具即时可用、OMOP 就绪;扣分项:需 IRB/授权才能导出患者级数据、实验室数据仅保留窗口内最近值、机构间编码差异需人工清洗、无官方 ML 划分 |
| 页面状态 | published |
§0 E-E-A-T 审核声明
医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11 编码表、SNOMED CT 映射、流行病学数据)、§7 偏倚分析(选择偏差、适应证混杂、监测偏差)。
数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。TriNetX 要求学术研究者通过所属机构(CTSI/ICTR)或与 TriNetX 直接合作获取账户,患者级数据集导出需 IRB/伦理委员会批准并签署 Dataset Release Agreement,商业研究需与 TriNetX 议价授权。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? TriNetX 是全球最大的联邦式真实世界数据(RWD)研究网络之一。你可以把它想象成一张覆盖 20+ 国家、240+ 家医院和医疗系统的"数据协作网":3.09 亿+ 患者的去识别电子健康记录(EHR)数据留在各自的医疗机构里,研究者提交的查询被下发到数据所在地执行,只返回聚合统计结果——没有一个集中存储所有患者数据的大仓库。截至 2026-06,网络累计沉淀 940 亿+ 临床数据点、13,000+ 临床站点,并已支撑 4,000+ 篇同行评审研究。
为什么重要? 药物研发与临床研究长期受制于"找不到足够的病人":一项试验能否招募到患者、一个药物在真实世界中是否安全,都取决于能否快速看到大规模患者群体的诊疗数据。TriNetX 让研究者用自助式界面在数分钟内完成过去需要数月的跨机构队列统计,直接支撑试验可行性评估、药物上市后安全性监测(药物警戒)、比较效果研究与真实世界证据(RWE)生成,是监管申报与学术研究中被引用最多的 RWD 来源之一。
我能用它做什么? 如果你在药企、CRO 或学术医疗中心,你可以:在平台上构建自定义患者队列(按诊断、用药、检验、操作与时间窗组合筛选);比较两组患者的基线特征与结局(内置倾向评分匹配与 Kaplan-Meier 分析);申请导出特定队列的去识别患者级 CSV 数据集(需 IRB 批准)用于离线机器学习建模。注意它不适合:需要纵向检验轨迹的分析(平台只保留窗口内最近一次检验值)、以普通人群为目标的发病率估计,以及任何声称个体级因果结论的轻率设计。
§1.1 技术摘要
TriNetX 采用联邦式(federated)架构:各医疗机构在本地保留患者数据,通过平台部署的标准化映射层将本地 EHR 字段转换为通用数据模型(OMOP CDM 就绪)与标准术语(ICD-10-CM、SNOMED CT、LOINC、RxNorm 等)。研究者的队列定义(入排准则、时间窗、结局定义)作为查询下发至各参与机构本地执行,仅返回去识别化的聚合计数与摘要统计;这一"查询旅行到数据(queries travel to the data)"的设计避免了中心化数据仓库,是 HIPAA、GDPR 与 LGPD 合规架构的基础。当研究需要患者级数据时,研究者可在平台内对已构建的队列发起数据集请求(Request Dataset),经 TriNetX 审核、签署 Dataset Release Agreement 并(在学术场景下)取得 IRB 批准后,获得导出的 CSV 数据集用于统计分析与机器学习。数据直接来源于医疗机构合作而非商业购买,每条记录产生于真实诊疗流程(诊断、操作、检验、用药与基因组学检测),另有 NLP 管线从非结构化临床笔记中抽取临床事实。平台内置队列构建、摘要统计、倾向评分匹配(PSM)、Kaplan-Meier 生存分析与 Incidence & Prevalence 工具,并提供可自定义编程的分析环境(R/Python 沙箱)支撑更复杂的建模需求(官方口径;URMC 使用指南)。
§1.2 战略价值
对生命科学与监管科学:TriNetX 已成为 RWE 生成的事实基础设施之一。2025-01 官方口径显示平台每月处理数千万次查询,覆盖所有主要治疗领域(TriNetX 官方新闻稿)。对药企而言,它的价值链覆盖药物全生命周期:早期靶点验证与假设生成、试验方案设计(据第三方行业整理,可显著减少方案修正)、试验可行性与站点选择、上市后药物警戒与安全信号精化、以及标签扩展的 RWE 支撑。与自建数据仓库相比,联邦网络的边际扩张成本更低,且数据始终由源机构维护更新,质量责任链清晰。
对学术研究与全球健康:对学术医疗中心,加入 TriNetX 意味着本院患者数据"不出门"即可参与全球协作——机构既能通过 Trial Connect 接收行业试验邀请获得经费机会,又能让本院研究者以自助方式访问全球 3.09 亿+ 患者规模的对照队列。平台的区域分布(美国约 1.86 亿、EMEA 约 7,200 万、拉美约 2,300 万、APAC 约 2,100 万患者,2026-06 官方口径)使罕见病研究与跨种族比较在单一平台内成为可能,这是单一国家数据库难以提供的。对 AI 研究者,它是 MIMIC-IV(单一 ICU 数据库)之外通向"全疾病谱、全门诊场景"真实世界数据的最短路径之一——尽管获取门槛与数据形态差异显著(详见 §5、§6.5)。
§1.3 同类数据集横向对比
| 数据集/平台 | 规模 | 数据模态 | 访问方式 | 与 TriNetX 的差异 |
|---|---|---|---|---|
| TriNetX | 3.09 亿+ 患者生命,240+ HCO,20+ 国家 | 结构化 EHR + 基因组学 + 理赔补充 | 联邦查询免费计数;患者级导出需 IRB/授权 | 联邦架构(数据不离院);在线自助分析;商业公司运营 |
| MIMIC-IV(BIDMC) | 单一中心 ICU,约 30 万入住/25.7 万患者 | ICU 监护 + EHR + 影像子集 | PhysioNet 凭证化申请,免费下载 | 开放下载、深度精细;但仅单一学术中心 ICU 人群 |
| All of Us(NIH) | 约 27 万+ 全基因组序列(截至 2024) | EHR + 基因组 + 可穿戴 + 调查 | 研究者工作台(RE RWB)受控访问 | 志愿者队列、纵向随访深;EHR 深度不及诊疗网络 |
| Optum Clinformatics | 约 9,000 万+ 成员 | 理赔 + EHR 衍生 | 商业授权(整库许可) | 理赔主导、无诊疗细节;TriNetX 以 EHR-native 为主 |
| IQVIA E360/OneKey | 全球级,规模口径不公开 | 处方/理赔/EHR 混合 | 商业订阅 | 服务重、定制强;自助查询能力弱于 TriNetX |
| OMOP 光纤网络(OHDSI) | 数十亿患者记录(跨网络聚合) | OMOP CDM 统一 | 各库分别授权 + 社区工具 | 开源社区生态;TriNetX 为商业托管、开箱即用 |
§1.4 版本与公司里程碑时间轴
| 时间 | 里程碑 | 来源 |
|---|---|---|
| 2014 | Gadi Lachman 创立 TriNetX(美国马萨诸塞州剑桥市);同年 12 月申请"临床试验候选者识别"专利 | 官方新闻稿;CB Insights |
| 2019-03 | 完成 Series D 融资,累计融资 $102M(投资方含 Merck Global Health Innovation Fund、三井物产、伊藤忠、MPM Capital、Deerfield Management 等) | Tracxn 公司档案 |
| 2020-09 | The Carlyle Group(凯雷集团)收购多数股权,成为主要投资方 | Tracxn |
| 2022-01 / 2022-10 | 收购 Advera Health Analytics(药物安全信号)与 Oncology Information Service、CancerDataNet(肿瘤数据资产) | 第三方行业整理 |
| 2025-02 / 2025-03 | 与 Fujitsu 达成合作;创始人 CEO Gadi Lachman 卸任运营职务(留任董事会),Jeff Margolis 任执行董事长 | 第三方行业整理;官方新闻稿 |
| 2026-04 | 收购 Zetta Genomics(基因组学数据能力);与 Regeneron 达成合作 | 第三方行业整理 |
| 2026-06 | TriNetX LIVE™ 网络突破 3 亿患者生命:240+ HCO、13,000+ 站点、20+ 国家、940 亿+ 数据点;一年新增约 5,200 万患者 | 官方新闻稿(2026-06-23) |
| 2026-07 | August Calhoun 出任 CEO;官网口径更新为 990 亿+ 数据点、65M+ 可关联患者、4,000+ 论文 | 官网 |
§1.5 典型应用场景
- 临床试验可行性与站点选择:申办方在方案定稿前查询全球队列中符合入排标准的患者计数,按机构拆分结果直接指导站点遴选与招募目标设定,将传统数月的"邮件询访"压缩到数分钟。
- 上市后药物警戒与安全信号精化:利用大样本回顾性队列比较暴露组与非暴露组的不良结局风险,支撑标签变更与风险最小化措施(TriNetX 收购 Advera Health Analytics 即为此能力布局)。
- 比较效果研究与 HEOR:内置 PSM 与生存分析工具,用于真实世界中两种治疗策略的结局比较、疾病负担与医疗资源利用研究。
- 假设生成与药物重定位:跨治疗领域的大规模共病与用药轨迹分析,用于发现意外的暴露-结局关联并生成可验证的研究假设。
- 监管沟通中的 RWE 支撑:为标签扩展、适应证外使用证据与监管问询提供大规模去识别数据的描述性与分析性证据(通常配合 target trial emulation 设计)。
§2 医学背景
§2.1 ICD-11 编码映射表
TriNetX 为全疾病谱平台,术语映射由各参与机构按平台数据字典完成,覆盖 ICD-10-CM、SNOMED CT、LOINC、RxNorm 等体系。下表列出 TriNetX 高频研究领域及其在 ICD-11 中的代表编码(供队列定义与文献对照使用;平台内部以 ICD-10-CM 为主干,研究者需借助术语映射工具跨体系换算):
| 研究领域 | 代表疾病 | ICD-11 编码 | 备注 |
|---|---|---|---|
| 内分泌/代谢 | 2 型糖尿病 | 5A11 | ICD-11 采用后组配(post-coordination)表达并发症,如 5A11 & GB61 表达糖尿病肾病 |
| 肾脏 | 慢性肾脏病 | GB61 | 分期子码 GB61.0-GB61.5(CKD 1-5 期)需组合编码 |
| 肾脏(急性) | 急性肾损伤 | 8B6Z | 重症与药物安全性研究高频结局 |
| 感染 | 脓毒症 | 1G4Z | 药物警戒与重症研究高频入组条件 |
| 呼吸 | 肺炎 | CA4Z | 疫苗效果与抗感染药物研究常用结局 |
| 呼吸 | 慢性阻塞性肺疾病 | CA22 | 呼吸领域队列构建高频条件 |
| 呼吸 | 哮喘 | CA23 | 常与 CA22 联合定义慢性气道疾病谱 |
| 循环 | 心力衰竭 | BD1Z(未特指) | 心衰分型(急性/慢性)经后组配细分 |
| 循环 | 急性心肌梗死 | BA41 | 心血管结局试验的 RWE 复现常用结局 |
| 循环 | 心房颤动或扑动 | BC81 | 抗凝药物真实世界研究核心适应证 |
| 肿瘤 | 乳腺癌 | 2C60 | TriNetX 收购肿瘤数据资产(2022)后为强项领域 |
| 精神/神经 | 抑郁发作 | 6A70 | 中枢神经与精神类药物上市后研究高频领域 |
§2.2 SNOMED CT 映射表
平台数据字典将各机构本地编码规范化为标准术语,研究者可在查询中跨体系检索同一概念(第三方平台介绍):
| 代表疾病 | SNOMED CT 概念码 | 首选术语(FSN 缩写) | 与 ICD-11 对应 |
|---|---|---|---|
| 糖尿病 | 44054006 | Diabetes mellitus (disorder) | 5A1x 系列 |
| 慢性肾脏病 | 433144002 | Chronic kidney disease (disorder) | GB61 |
| 心力衰竭 | 84114007 | Heart failure (disorder) | BD1Z |
| 脓毒症 | 91302008 | Sepsis (disorder) | 1G4Z |
| 肺炎 | 233604007 | Pneumonia (disorder) | CA4Z |
| 急性心肌梗死 | 22298006 | Myocardial infarction (disorder) | BA41 |
| 心房颤动 | 49436004 | Atrial fibrillation (disorder) | BC81 |
| 慢性阻塞性肺疾病 | 13645005 | Chronic obstructive lung disease (disorder) | CA22 |
| 哮喘 | 195967001 | Asthma (disorder) | CA23 |
| 乳腺恶性肿瘤 | 254837009 | Malignant tumor of breast (disorder) | 2C60 |
§2.3 疾病背景与流行病学
TriNetX 不针对单一疾病,其"医学背景"是真实世界证据(RWE)科学本身。RWD(电子健康记录、理赔、登记、可穿戴等诊疗过程数据)补充了随机对照试验(RCT)的不足:RCT 内部效度高但外部效度受限(人群窄、随访短),而 RWD 能刻画"真实临床实践中谁接受了什么治疗、发生了什么结局"。医疗健康数据约占全球数据总量的 30%,且以约 36% 的年复合增长率扩张——挑战不在数据量,而在适用性(fit-for-purpose):同一段 RWD 对研究问题 A 足够可靠,对研究问题 B 却可能因系统性误分类而失效(TriNetX 首席科学官 Jeffrey Brown 与首席医学信息官 Matvey Palchuk 以 COVID-19 疫苗接种状态漏记导致暴露误分类为例系统阐述,官方博客)。
在流行病学层面,TriNetX 网络的人群结构与一般人群存在已知偏差:以大型学术医疗中心与急性医疗机构就诊的、多有保险的人群为主,无保险、社区健康中心与农村医院人群代表性不足(方法学系统综述,Ismail 等 2025)。这决定了:用 TriNetX 估计"就诊人群中的疾病负担与治疗模式"可信度较高;直接外推"一般人群发病率/患病率"则需谨慎(见 §7.1、坑点 5)。
§2.4 临床任务定义
| 临床任务 | 定义 | 在 TriNetX 上的实现路径 | 关键挑战 |
|---|---|---|---|
| 队列构建(cohort discovery) | 按诊断/用药/检验/操作与时间窗组合筛选患者集合 | 平台 Query Builder 可视化拖拽式构建,即时返回各机构计数 | 术语检索完整性;编码变体遗漏 |
| 试验可行性评估 | 评估目标入排标准下的可招募患者量与竞争性试验 | 队列计数按 HCO 拆分 + Trial Connect 站点邀约 | 计数≠可入组(知情同意、竞争试验) |
| 暴露-结局关联分析 | 比较暴露组与非暴露组结局风险 | 内置 PSM、Kaplan-Meier;导出后可多变量调整 | 适应证混杂、未测量混杂、不灭时间偏差 |
| 药物警戒信号检测 | 大样本回顾性暴露与不良结局关联筛查 | 自定义结局窗口 + 敏感性分析 | 报告偏倚、监测偏差、近期数据右删失 |
| 表型算法(phenotyping) | 用编码组合定义疾病人群(如 eRADAR、pheKB 思路) | ICD/SNOMED 码组合 + 检验阈值 | 编码准确性未独立验证;机构间差异 |
| 预后建模 | 从基线特征预测结局(如再入院、死亡) | 导出患者级 CSV 后离线建模 | 检验快照限制、划分泄漏(见坑点 6) |
§2.5 患者人群画像
| 维度 | 描述 | 来源 |
|---|---|---|
| 来源机构 | 240+ 医疗机构(以大型学术医疗中心与急性医疗系统为主),13,000+ 临床站点 | 官方新闻稿 2026-06 |
| 地域分布 | 20+ 国家:美国约 1.86 亿患者生命、EMEA 约 7,200 万、拉美约 2,300 万、APAC 约 2,100 万 | 官方新闻稿 2026-06 |
| 规模增速 | 2025-04 至 2026-04 一年新增约 5,200 万患者,多数来自国际市场 | 官方新闻稿 2026-06 |
| 就医类型 | 覆盖门诊、住院、急诊全场景(EHR-native 诊疗记录),非单一 ICU 场景 | 官方架构描述 |
| 人口学字段 | 年龄、性别、种族/族裔等去识别化人口学变量 | URMC 使用指南 |
| 保险结构 | 以有保险人群为主;无保险与初级保健为主人群代表性不足 | Ismail 等 2025 |
§2.6 临床价值与"金标准"定位
RWD 研究没有影像数据集意义上的"像素级金标准标注",其质量参照系是研究设计的严格性与编码算法的验证透明度。下表总结 TriNetX 语境下的金标准要素:
| 要素 | TriNetX 现状 | 金标准要求 | 差距与建议 |
|---|---|---|---|
| 结局定义 | 研究者用编码算法定义(ICD/SNOMED 组合 + 时间窗) | 经验证的表型算法(如 pheKB 验证库)+ 阳性预测值(PPV)报告 | 多数已发表研究未报告编码 PPV;建议引用已验证算法并做敏感性分析 |
| 暴露定义 | 处方记录/给药记录 + 暴露窗定义 | target trial emulation 框架下的明确暴露时点 | 需处理不灭时间偏差(坑点 4) |
| 统计规范 | 平台内置 PSM/KM;可导出后自定义 | 预注册分析计划(如 STaRT-RWE、RECORD-PE 报告规范) | 平台便捷性诱发多路比较(坑点 7) |
| 可重复性 | 查询可保存、可共享给合作者 | 独立团队在相同队列定义下复现结果 | 机构数据动态更新导致时点快照漂移;导出数据集应版本化留存 |
| 编码质量 | 机构自映射至标准术语 | 独立验证编码准确性 | 系统综述指出编码准确性未经独立验证,是数据可靠性关键决定因素 |
§3 数据集规格
§3.0 访问模式抉择矩阵
TriNetX 不是"一个下载包",而是同一数据底座的四种访问模式。先选对模式,再谈技术细节:
| 你的需求 | 推荐模式 | 耗时 | 理由 |
|---|---|---|---|
| 快速看某病种有多少患者、分布在哪 | TriNetX LIVE 在线联邦查询 | 分钟级 | 即时返回聚合计数,无需 IRB(仅计数) |
| 完成一项比较效果/药物警戒研究 | 在线分析(PSM/KM)± 数据集导出 | 数周(含 IRB 与授权) | 计数与统计在线完成;需患者级建模再导出 |
| 训练机器学习/深度学习模型 | 数据集导出(CSV)+ 离线建模 | 数周至数月 | 需 IRB 批准、Dataset Release Agreement;未受资助学术研究多数免费 |
| 复杂自定义统计(非内置方法) | 平台内置 R/Python 编程环境 | 数天 | 避免导出审批;在联邦环境内运行自定义代码 |
| 商业决策级多适应证研究 | 商业订阅 + 咨询服务 | 商务流程 | 直接与 TriNetX 签约,获得企业级支持 |
§3.1 数据模态详情
| 模态 | 内容 | 术语/格式 | AI 用途 |
|---|---|---|---|
| 诊断 | 门诊/住院/急诊诊断记录 | ICD-10-CM、SNOMED CT | 表型算法、队列入组、共病网络 |
| 操作/手术 | 手术与操作记录 | ICD-10-PCS、CPT、SNOMED CT | 治疗路径、暴露定义 |
| 检验 | 实验室检验结果(名称、数值、单位、时间) | LOINC | 基线特征、结局定义、生物标志物分析 |
| 用药 | 处方与给药记录 | RxNorm、ATC | 暴露定义、药物警戒、治疗轨迹 |
| 基因组学 | 经 Zetta Genomics 收购(2026-04)强化的基因组数据关联能力 | 变异/基因层级 | 精准医学、靶点验证研究 |
| 理赔补充 | 部分机构提供理赔数据补充 | 标准理赔编码 | 医疗资源利用、院外事件补充 |
| 非结构化文本 | NLP 从临床笔记/报告抽取的临床事实 | 平台归一化 | 丰富表型定义(第三方介绍口径) |
§3.2 规模与区域子集
| 区域 | 患者生命规模 | 说明 |
|---|---|---|
| 美国 | 约 1.86 亿 | EHR-native 记录最成熟,学术医疗中心密度最高 |
| EMEA | 约 7,200 万 | GDPR 框架下匿名化/去识别处理 |
| 拉丁美洲 | 约 2,300 万 | LGPD 合规 |
| 亚太(APAC) | 约 2,100 万 | 增长最快的区域之一 |
| 合计 | 3.09 亿+ 患者生命;240+ HCO;13,000+ 站点;940 亿+ 临床数据点;65M+ 可关联患者(2026-08 口径) | 官方 2026-06 新闻稿与官网 2026-08 口径 |
注:「3.09 亿+ 患者生命」是全网络累计口径;「65M+ 可关联患者」指跨机构记录可链接、支持纵向关联分析的患者子集——两者相差 4 倍以上,撰写方案与样本量估算时务必区分(见坑点 2)。
§3.3 数据格式
| 场景 | 格式 | 说明 |
|---|---|---|
| 在线查询结果 | 平台内交互表格(计数、摘要统计) | 可导出为聚合统计表 |
| 患者级数据集导出 | CSV(含查询元数据与协变量) | 经 Request Dataset 流程交付至平台内研究空间下载 |
| 数据模型 | OMOP CDM 就绪(官方口径) | 便于与 OHDSI 工具链对接 |
| 平台编程环境 | R / Python 沙箱 | 在联邦环境内运行自定义分析代码 |
| 商业交付 | 定制数据集/报告 | 经咨询团队交付 |
§3.4 存储与规模量级
TriNetX 无单一下载包,存储需求取决于导出队列规模。参考量级:单队列导出(数万患者、含诊断/用药/检验全量事件)通常为数十 MB 至数 GB 的 CSV 集合;全网络 940 亿+ 临床数据点的完整体量仅存在于各参与机构本地与平台联邦层,任何单一用户都无法也无需下载全量数据。离线建模建议预留 50-100 GB 磁盘与 16-32 GB 内存以容纳多队列合并分析。
§3.5 标注方式
TriNetX 数据不是为研究预标注的数据集,所有"标签"均由研究者用编码算法定义:
| 标签类型 | 定义方式 | 性质 |
|---|---|---|
| 疾病/暴露/结局标签 | ICD/SNOMED/LOINC/RxNorm 编码组合 + 时间窗逻辑 | 自动(编码推导),质量取决于编码与算法定义 |
| 结局窗口 | 索引事件后 N 天/月内的编码出现 | 自动,存在右删失问题(坑点 3) |
| 队列分组 | 暴露组 vs 对照组(经 PSM 或硬性入排) | 半自动,混杂控制依赖变量可得性 |
| 无像素级/人工判读标签 | 不适用 | —— |
§3.6 数据录入者资质与一致性
数据由各参与机构的临床流程直接产生:诊断与操作编码由注册编码员/临床文档改进(CDI)团队按 ICD-10-CM 等规范录入,检验结果由实验室信息系统(LIS)自动传输,用药记录来自电子处方(CPOE)系统。跨机构编码实践存在系统差异(文档标准、编码习惯、报销规则),且编码准确性未经独立验证(Ismail 等 2025);平台通过统一数据字典与术语映射缩小(而非消除)这一差异。
§3.7 采集周期与更新频率
| 项 | 口径 |
|---|---|
| 更新机制 | 各机构按自身节奏向平台推送更新,非实时 |
| 更新间隔 | 约 80% 医疗机构以 1、2 或 4 周间隔更新,平均刷新频率约 1 个月(眼科叙述综述 2025) |
| 平台增长 | 2025-04 至 2026-04 新增约 5,200 万患者(官方 2026-06) |
| 对研究的影响 | 近期结局可能尚未入库 → 右删失;跨机构时间窗错位 → 时间偏差(坑点 3) |
§3.8 地域覆盖
覆盖 20+ 国家:美国(约 1.86 亿患者生命)、EMEA(约 7,200 万)、拉美(约 2,300 万)、APAC(约 2,100 万)(截至 2026-06 官方口径)。2025-01 官方口径为"25+ 国家数据"(官方新闻稿),2026-06 口径更新为 20+ 国家——国家数口径随统计方式调整收缩,引用时注明时点与口径。各机构名单与具体位置不对用户公开(见 §7.1 选择偏差)。
§3.9 数据来源系统与设备规格
TriNetX 不采集设备原始信号(无影像 DICOM、无波形文件)。数据来源系统包括各机构的 EHR 平台(Epic、Oracle Health/Cerner 等主流系统)、实验室信息系统(LIS)、电子处方系统与(部分机构)理赔系统;平台侧通过标准化映射层(OMOP CDM 就绪)统一承接。基因组学数据经 2026-04 收购的 Zetta Genomics 能力整合。
§3.10 深度溯源链
真实诊疗事件(患者就诊)
→ 机构 EHR/LIS/CPOE 系统记录(临床流程产生,非研究目的采集)
→ 机构数据团队按平台数据字典去识别化 + 标准术语映射(HIPAA 去识别 / GDPR 匿名化)
→ TriNetX 联邦层:数据留在机构本地,标准化查询引擎下发执行
→ 聚合结果返回(计数/摘要统计)或患者级数据集导出(IRB + Dataset Release Agreement)
→ 研究空间内下载 CSV / 平台内 R-Python 沙箱分析
溯源要点:每条记录可追溯到"某参与机构的真实诊疗流程",但机构身份对研究者不可见(计数按机构拆分显示,机构名称隐藏);数据从诊疗事件到平台可查询存在数天至数周级延迟。
§4 数据结构
TriNetX 导出数据集的具体 schema 随查询配置与平台版本演进,官方未发布固定公开字典。以下结构依据多中心机构使用指南(JHU ICTR、UNC TraCS、URMC CTSI 等)与已发表研究的方法学描述整理,呈现典型导出数据集形态;实际列名与文件划分以你的数据集交付文档为准。
§4.0 导出数据集目录树
trinetx_export_<study_id>/
├── query_metadata.json # 查询定义快照:入排准则、术语码、时间窗、生成时间
├── demographics.csv # 队列患者人口学(每患者一行)
│ patient_id, age, sex, race, ethnicity, index_date
├── encounters.csv # 就诊/住院事件(每事件一行)
│ patient_id, encounter_id, encounter_type, start_date, end_date, hco_token
├── diagnoses.csv # 诊断事件(编码 + 时间偏移)
│ patient_id, encounter_id, code, code_system, start_date
├── procedures.csv # 操作/手术事件
│ patient_id, encounter_id, code, code_system, start_date
├── medications.csv # 用药/给药记录
│ patient_id, encounter_id, drug_code, drug_system, route, start_date
├── labs.csv # 检验结果(窗口内最近值)
│ patient_id, lab_name, lab_code, lab_value, lab_unit, start_date
├── covariates.csv # 可选:PSM 用协变量汇总(宽格式)
│ patient_id, covariate_1 ... covariate_n
└── data_dictionary.md # 本次交付的字段说明(内容随研究空间配置而异)
要点:所有表以 patient_id 为根主键关联;诊断/操作/用药/检验行通常以相对索引事件的日期偏移或广义化日期表达(进一步降低重识别风险);hco_token 仅标识机构匿名令牌(用于分层抽样),不披露机构身份。
§4.1 DAIMS 核心字段字典
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| patient_id | Text | 去识别患者主键,跨表关联根 | 8f14e45f | 分组键、防泄漏分层 | 跨机构同一患者可能产生不同 ID | 无(必填) | 机构/研究空间内唯一 |
| age | Integer | 索引时年龄(岁) | 67 | 基线特征、分层 | 老年高位段可能被截断泛化 | 空值=未记录 | 0-89 或机构泛化上限 |
| sex | Text | 生理性别 | F / M / Unknown | 分层、公平性评估 | 录入错误低频存在 | Unknown | 类别型 |
| race / ethnicity | Text | 种族/族裔(美式分类为主) | White | 公平性与外推评估 | 非美地区机构常缺失 | 空值或 Unknown | OMB 类别体系 |
| encounter_id | Text | 就诊/住院事件键 | e3b0c442 | 事件聚合、暴露定义 | 门诊碎片化就诊合并口径因机构而异 | 无(事件表必填) | 研究空间内唯一 |
| encounter_type | Text | 就诊类型(门诊/住院/急诊) | Inpatient | 场景分层、护理强度代理 | 机构间分诊口径差异 | 空值=未标注 | 有限枚举 |
| code | Text | 诊断/操作/用药编码值 | I50.9;44054006 | 特征、标签推导 | 编码欠特异/欠完整(未独立验证) | 无(事件行必填) | 术语体系取值域 |
| code_system | Text | 编码体系标识 | ICD-10-CM / SNOMED CT | 跨体系映射、去重 | 同一概念多体系并存 | 无 | 有限枚举 |
| start_date | Date | 事件日期或相对索引偏移 | 2024-03-02 / +14d | 时序建模、窗口逻辑 | 广义化处理损失日级精度 | 无(事件行必填) | 泛化后时域 |
| lab_name / lab_code | Text | 检验项目名(LOINC 映射) | Creatinine [Mass/volume] | 基线/结局特征 | 同物异名需映射收敛 | 无 | LOINC 取值域 |
| lab_value | Float | 检验数值(窗口内最近一次) | 1.2 | 生物标志物分析 | 无纵向轨迹(见坑点 1) | 空值=未查 | 连续值 |
| lab_unit | Text | 检验单位 | mg/dL / µmol/L | 跨机构单位归一 | 单位不统一是经典坑(坑点 8) | 随缺失值 | 有限枚举 |
| drug_code | Text | 药物编码(RxNorm/ATC) | 860975 | 暴露定义、DDD 计算 | 门诊处方≠实际服用依从 | 无 | RxNorm/ATC 取值域 |
| drug_route | Text | 给药途径 | Oral / Intravenous | 暴露强度、给药方案刻画 | 部分机构处方记录不含途径 | 空值=未记录 | 有限枚举 |
| index_date | Date | 队列入组锚点日期 | 2024-03-01 | 时间零点、随访起点 | 定义依赖研究者设计 | 无 | 研究自定义 |
§4.2 标签分布特征
TriNetX 导出数据集无内置标签列;标签分布由研究者构造后自行统计。从已发表研究的普遍经验看:常见结局(全因死亡、再入院)在宽时间窗下通常为中等不平衡(阳性率 5%-30%);特定不良药物反应与罕见结局在高特异编码定义下常呈极端不平衡(<1%)。平台在线端提供 Incidence & Prevalence 工具辅助估计事件率(URMC 功能清单)。建议在导出后立即输出标签-协变量交叉表,检查阳性样本在机构令牌(hco_token)与时间上的分布是否均匀——极端不均会放大坑点 6 的泄漏与坑点 8 的机构间漂移。
§4.3 关键统计
| 统计项 | 数值 | 口径 |
|---|---|---|
| 患者生命总量 | 3.09 亿+ | 全网络累计,官方 2026-06 |
| 可关联患者 | 65M+(2026-08)/ 56M+(2026-06) | 支持跨机构纵向链接的子集 |
| 临床数据点 | 940 亿+(2026-06)/ 990 亿+(2026-08) | 官网口径 |
| 医疗机构 / 站点 | 240+ / 13,000+ | 官方 2026-06 |
| 支撑论文 | 3,300+(2026-06)/ 4,000+(2026-08) | 官方口径 |
| 月查询量 | 数千万次 | 官方 2025-01 |
§4.4 数据层级
患者(patient_id,去识别)
└── 就诊/住院事件(encounter_id,机构内)
├── 诊断事件(code + start_date)
├── 操作事件(code + start_date)
├── 用药事件(drug_code + route + start_date)
└── 检验结果(lab_code + value + unit + start_date)
跨患者:机构令牌(hco_token)→ 联邦层聚合统计
跨机构:仅 65M+ 可关联患者子集支持患者级纵向链接
§4.5 缺失值与信息性缺失
| 缺失模式 | 典型表现 | 信息性 | 处理建议 |
|---|---|---|---|
| 结构性缺失 | 未做某检验 → 该检验值缺失 | 信息性缺失:检查本身反映诊疗强度与病情怀疑度 | 生成"是否检测"指示变量,勿按随机缺失处理 |
| 机构性缺失 | 某机构不传理赔/某字段 → 全机构段缺失 | 与 hco_token 相关 | 按机构分层检查;避免单一机构主导某特征 |
| 记录性缺失 | 诊断漏编、门诊 fragment 未关联 | 疾病严重度低估 | 用已验证表型算法 + 敏感性分析 |
| 泛化性缺失 | 日期泛化后日级精度丢失 | 影响短窗时序逻辑 | 窗口定义留冗余;导出时确认日期精度 |
| 删失性缺失 | 随访期末尾事件未入网(更新延迟) | 右删失,近期队列结局低估 | 结局窗尾部留缓冲;报告数据截止日期 |
§5 数据划分与使用建议
§5.1 官方划分
TriNetX 没有官方 ML 训练/验证/测试划分——它是持续更新的联邦平台而非静态基准数据集。每次导出数据集都是研究自定义的快照,划分责任完全在使用者。
§5.2 社区惯例与推荐划分
| 划分策略 | 做法 | 适用场景 | 风险 |
|---|---|---|---|
| 按患者划分 | 以 patient_id 为单位随机分层切分 | 一般预测建模基线 | 必须先去重同一患者跨机构记录(坑点 6) |
| 按机构划分(hco_token 分组切分) | 留出整批机构作外部测试 | 泛化性评估(跨站点模型迁移) | 机构规模悬殊时需加权 |
| 按时间划分 | 以索引日期切点划分训练/测试 | 模拟前瞻部署、检测时间漂移 | 与数据更新延迟(坑点 3)耦合 |
| 按机构+时间双维 | 组合切分 | RWE 研究稳健性检验 | 有效样本量下降 |
§5.3 泄漏风险(重点)
- 跨机构重复患者:同一人在多家参与机构就诊会产生多条独立 patient_id;直接随机切分会让"同一患者"同时出现在训练与测试集,指标虚高。缓解:可关联患者子集内按真实患者去重;其余场景按机构分组切分或报告保守下界。
- 索引事件信息回灌:用"索引日当天的检验值/用药"预测"索引日后的结局"时,事件时间戳泛化可能造成窗口边界模糊,将结局前兆(如死亡前的抢救用药)计入特征。缓解:特征窗与结局窗之间设置显式缓冲期(washout)。
- 平台内统计→导出建模的顺序泄漏:若先在平台上做 PSM 后导出,再离线做交叉验证调参,匹配信息(协变量选择)已"看过"全部数据。缓解:匹配流程冻结后仅在匹配集内交叉验证。
- 查询元数据泄漏:query_metadata.json 中的入排准则若含结局相关条件(如"因 X 结局就诊"),会把标签写进入排逻辑。缓解:入排仅基于暴露与基线,结局定义独立于队列入组。
§5.4 交叉验证与外部验证建议
- 交叉验证:患者级分组 K 折(GroupKFView on patient_id);若关注部署泛化,优先机构级 5 折(按 hco_token)+ 时间切点验证的三重稳健性报告。
- 外部验证:真正的外部验证应换数据库——同模型在 TriNetX 训练后在 MIMIC-IV、All of Us 或本地 OMOP 库验证;同一平台内的"机构级留出"属内部验证。系统综述指出 TriNetX 研究普遍缺乏真正的外部验证(Ismail 等 2025),这是当前文献的主要方法学短板之一。
§5.5 三种典型研究设计模板
| 设计 | 平台端操作 | 导出端操作 | 主要防坑点 |
|---|---|---|---|
| 试验可行性评估 | 入排准则 → 按机构拆分计数 → 竞争试验患者排除(编码定义) → Trial Connect 邀约 | 无需导出 | 坑点 2(口径)、坑点 3(近期数据未入库导致低估可招募量) |
| 新用户 active-comparator 队列研究 | 两个暴露队列(新用药者)+ 相同索引逻辑 + Summary Statistics 看基线 → 平台内 PSM + KM | 若需 E-value/时变 Cox 则导出 | 坑点 4(不灭时间)、坑点 5(残留混杂)、坑点 3(右删失) |
| 结局预测 ML 建模 | 队列定义 + 基线窗(索引前 365 天特征)+ 结局窗(索引后 30/90 天)→ Request Dataset | GroupKFold/机构分组划分 → §6.3 清洗 → §6.4 建模 | 坑点 6(跨机构泄漏)、坑点 1(检验快照)、坑点 8(单位漂移) |
§6 AI 就绪指南
§6.0 云端快速启动
TriNetX 本身就是云端自助平台,不存在"本地部署"路径。典型云端工作流:
- 机构管理员为你开通账户(见 §6.2),登录
live.trinetx.com。 - 在 Query Builder 中以可视化方式定义队列:入排准则(诊断/操作/用药/检验 + 逻辑与或非)、时间窗、 cohorts 对(暴露组/对照组)。
- 即时查看全网络聚合计数与按机构拆分计数;用 Summary Statistics 比较两组基线(年龄、性别、合并症、用药、检验)。
- 需要患者级数据 → 平台内 Request Dataset → IRB + Dataset Release Agreement → 数据集出现在你的研究空间(Study),下载 CSV。
- 复杂分析可在平台内置 R/Python 编程环境运行(不导出);或下载后本地建模(本节其余部分的主题)。
无机构订阅的个人研究者无法直接试用 TriNetX;替代学习路径:MIMIC-IV(免费)、Synthea 合成数据、或查询所属机构是否为 TriNetX 成员(美国主要学术医疗中心多数已加入,CTSI/ICTR 页面通常列有本地申请指南,如 JHU、UNC、URMC)。
§6.1 快速上手(导出数据集 → DataFrame)
# ============================================================
# 目录结构预期(与 §4.0 一致):
# data_root/
# └── trinetx_export_<study_id>/ # 你的导出数据集解压目录
# ├── demographics.csv
# ├── encounters.csv
# ├── diagnoses.csv
# ├── medications.csv
# ├── labs.csv
# └── query_metadata.json
# data_root 拼接关系:data_root = 你解压导出包的任意父目录;
# 下面的 DATA_ROOT 变量只需指向该父目录,其余路径自动拼接。
# 最小可用子集:demographics.csv + diagnoses.csv(约数 MB)
# 即可完成队列表型与基线统计;labs/medications 按需加载。
# ============================================================
import pandas as pd
from pathlib import Path
DATA_ROOT = Path("data_root/trinetx_export_<study_id>") # ← 改成你的解压路径
demo = pd.read_csv(DATA_ROOT / "demographics.csv") # 每患者一行
dx = pd.read_csv(DATA_ROOT / "diagnoses.csv") # 诊断事件表
print(demo.shape, demo["patient_id"].nunique()) # 校验:行数 == 唯一患者数
print(demo["age"].describe(), demo["sex"].value_counts()) # 基线画像
# 最小可用示例:用 ICD-10 前缀定义心衰队列并统计共病 Top10
hf_ids = dx.loc[dx["code"].astype(str).str.startswith("I50"), "patient_id"].unique()
comorb = dx[dx["patient_id"].isin(hf_ids) & ~dx["code"].astype(str).str.startswith("I50")]
print(comorb["code"].value_counts().head(10))
§6.2 数据获取(申请流程全解)
获取路径分四类(数字与流程来自机构指南与官方页面,截至 2026-09):
| 路径 | 前提 | 流程 | 费用 |
|---|---|---|---|
| 机构内平台账户 | 所属机构为 TriNetX 成员 | 完成培训课程(如 TriNetX 101)→ 提交账户申请 → 2-3 个工作日开通 | 机构订阅覆盖,个人免费 |
| 研究网络数据集导出 | 有平台账户 + 研究方案 | 平台内构建查询 → Request Dataset(附 PI 姓名/邮箱/项目名)→ 机构 Procurer 转交 TriNetX 审核 → 签 Dataset Release Form | 未受资助研究多数免费;受资助/商业研究议价收费 |
| 可识别数据(Re-ID) | IRB 批准 + 机构数据核心代办 | 平台查询 → IRB 批准 → 机构核心(如 JHU CCDA)向 TriNetX/CDW 发起下载 | 机构核收工时费;部分机构 2025-10 起对 Re-ID 收费 |
| 商业/企业合作 | 机构或公司与 TriNetX 签约 | 商务洽谈 → 订阅 + 咨询 | 订阅制,规模相关 |
# 学术申请清单(checklist,非代码):提交 Request Dataset 前逐项自查
checklist = [
"查询定义已冻结:入排、术语码版本、时间窗、暴露组/对照组",
"PI 与联系人信息齐全(姓名、邮箱、项目名)——缺项会被直接拒绝",
"IRB 批准号已取得(患者级数据导出必须;仅聚合计数探索不需要)",
"资助状态已声明:受资助研究需预留数据费预算并与 TriNetX 议价",
"Dataset Release Form 签署流程已确认(PI 签字)",
"导出数据集的存储与安全方案符合协议(不得再分发出去识别数据)",
]
for i, item in enumerate(checklist, 1):
print(f"[{i}] {item}")
§6.3 预处理全流程
import numpy as np
import pandas as pd
# ---------- 1) 术语归一:同概念多体系合并 ----------
DX_MAP = {"ICD-10-CM": "icd", "ICD-9": "icd", "SNOMED CT": "snomed"}
dx["sys_norm"] = dx["code_system"].map(DX_MAP).fillna("other")
# 简单方法:前缀级表型(示例:2 型糖尿病 ICD-10 E11 / SNOMED 44054006)
def is_t2dm(row):
return (row["sys_norm"] == "icd" and str(row["code"]).startswith("E11")) or \
(row["sys_norm"] == "snomed" and str(row["code"]) == "44054006")
dx["t2dm"] = dx.apply(is_t2dm, axis=1)
# ---------- 2) 检验单位归一(跨机构单位漂移,见坑点 8) ----------
CREAT_CONV = {"mg/dL": 1.0, "umol/L": 0.0113, "µmol/L": 0.0113} # → mg/dL
labs = pd.read_csv(DATA_ROOT / "labs.csv")
creat = labs[labs["lab_name"].str.contains("Creatinine", case=False, na=False)].copy()
creat["creat_mgdl"] = creat["lab_value"] * creat["lab_unit"].map(CREAT_CONV)
creat = creat.dropna(subset=["creat_mgdl"])
# 注意:这里每个 patient 只剩窗口内最近一次值(平台快照限制,见坑点 1)
baseline = creat.sort_values("start_date").groupby("patient_id").tail(1)
# ---------- 3) 宽表组装(患者级特征矩阵) ----------
feat = demo.merge(baseline[["patient_id", "creat_mgdl"]], on="patient_id", how="left")
feat["has_creat"] = feat["creat_mgdl"].notna().astype(int) # 信息性缺失指示(§4.5)
feat["creat_mgdl"] = feat["creat_mgdl"].fillna(feat["creat_mgdl"].median())
# ---------- 4) 简单稳定性检查:按机构令牌看分布漂移 ----------
# (若导出包含 hco_token 列)group-wise 标准差提示机构间编码/检验口径差异
# feat.groupby("hco_token")["creat_mgdl"].agg(["count", "median", "std"])
print(feat[["age", "creat_mgdl", "has_creat"]].describe())
§6.4 PyTorch DataLoader(结局预测示例)
任务示例:以基线诊断序列预测 90 天内再入院(标签由研究者自_encounters_构造)。完整可运行代码:
<details>
<summary>展开完整 Dataset + DataLoader 代码(约 70 行)</summary>
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
from collections import Counter
from pathlib import Path
DATA_ROOT = Path("data_root/trinetx_export_<study_id>") # data_root 拼接关系见 §6.1
# --- 标签构造:90 天再入院(示例逻辑,实际以交付文档日期字段为准) ---
enc = pd.read_csv(DATA_ROOT / "encounters.csv", parse_dates=["start_date", "end_date"])
enc = enc.sort_values(["patient_id", "start_date"])
enc["next_start"] = enc.groupby("patient_id")["start_date"].shift(-1)
enc["readmit_90d"] = ((enc["next_start"] - enc["end_date"]).dt.days.between(1, 90)).astype(int)
label_map = enc.groupby("patient_id")["readmit_90d"].max() # 患者级标签
# --- 诊断序列特征:每患者的前 K 个诊断码映射为词表索引 ---
dx = pd.read_csv(DATA_ROOT / "diagnoses.csv")
VOCAB, MIN_FREQ, MAX_LEN = {"<pad>": 0, "<unk>": 1}, 5, 50
freq = Counter(dx["code"].astype(str))
for code, c in freq.items():
if c >= MIN_FREQ:
VOCAB[code] = len(VOCAB)
seq = dx.groupby("patient_id")["code"].apply(lambda s: s.astype(str).tolist()[:MAX_LEN])
class TriNetXSeqDataset(Dataset):
"""患者诊断序列 → 多标签 90 天再入院二分类。
分组键为 patient_id;划分请用 GroupKFold/按机构分组,见 §5.3 坑点 6。"""
def __init__(self, seq, label_map, vocab, max_len=MAX_LEN):
self.items = [(pid, seq[pid], int(label_map[pid]))
for pid in seq.index if pid in label_map.index]
self.vocab, self.max_len = vocab, max_len
def __len__(self):
return len(self.items)
def __getitem__(self, i):
pid, codes, y = self.items[i]
ids = [self.vocab.get(c, 1) for c in codes][:self.max_len]
ids += [0] * (self.max_len - len(ids)) # pad
return (torch.tensor(ids, dtype=torch.long),
torch.tensor(min(len(codes), self.max_len)),
torch.tensor(y, dtype=torch.float32), pid)
# --- 按患者分组划分(简单演示;生产请用机构分组 + 时间切点,见 §5.2) ---
import numpy as np
ds = TriNetXSeqDataset(seq, label_map, VOCAB)
g = torch.Generator().manual_seed(42)
n_train = int(0.8 * len(ds))
train_ds, val_ds = torch.utils.data.random_split(ds, [n_train, len(ds) - n_train], generator=g)
train_dl = DataLoader(train_ds, batch_size=64, shuffle=True)
val_dl = DataLoader(val_ds, batch_size=256)
# --- 冒烟测试 ---
for ids, lens, y, pid in train_dl:
print(ids.shape, lens[:5].tolist(), y.float().mean().item())
break
</details>
§6.5 八个真实坑点
⚠️ 坑点 1:实验室数据是"快照"而不是"轨迹"(分类:预处理陷阱)
问题:TriNetX 在指定观察窗口内对每项检验只保留最近一次结果,而非全部历史值。任何"追踪生物标志物随治疗变化"的设计(如 HbA1c 随访变化、肌酐轨迹)在平台端结构性不可能正确实现。
症状:导出数据里每位患者每项检验只有一行;你对"治疗前后指标变化"建模时,前后值实为不同患者的窗口快照拼凑,模型看似能跑但语义是错的;论文评审指出方法学内部矛盾。
解决:
- 简单方法:只用基线(索引前)最近一次检验作协变量,放弃纵向检验轨迹类研究问题。
- 进阶方法:把"检验变化"改写为"两个不重叠时间窗各自最近值"的差值,并在文中显式声明该代理变量的窗口语义与局限;对窗口边界做敏感性分析。
- SOTA 方法:需真正纵向检验数据时改用数据源——机构本地 CDW、All of Us 或 MIMIC-IV;或将 TriNetX 用于可行性与基线部分、纵向部分换库,两库结果做三角互证。
参考:Journal Metrics 平台限制综述(2026);TriNetX 眼科叙述综述
⚠️ 坑点 2:3.09 亿"患者生命" ≠ 3.09 亿可用患者(分类:标签理解)
问题:官方宣传口径的 3.09 亿+ 是全网络累计"患者生命(patient lives)";其中只有 65M+(2026-08 口径)是跨机构可关联、支持纵向研究的子集。且网络增长极快(一年 +5,200 万),不同时点的文献数字不可比。
症状:用"全网络 3 亿人"做样本量估算,实际查询后队列骤缩一个数量级;跨机构死亡/结局链接时发现大量患者事件无法关联,随访断裂。
解决:
- 简单方法:样本量以实际查询计数为准(平台 30 秒返回),引用文献时注明口径与时点(“3.09 亿患者生命,2026-06 官方口径”)。
- 进阶方法:纵向设计先检查队列中"可关联患者"占比;把跨机构就诊患者单列,报告其与单机构患者的结局差异(选择性链接偏差)。
- SOTA 方法:用按机构拆分的计数做分层可行性分析,估计"理想样本量实现概率";在方案中预设最小可招募机构数与最小单机构样本数。
参考:TriNetX 官网口径(2026-08);官方 2026-06 新闻稿
⚠️ 坑点 3:数据更新延迟造成结局右删失(分类:偏倚陷阱)
问题:数据非实时入库——约 80% 机构以 1/2/4 周间隔更新,平均约 1 个月。索引日期靠近"数据截止线"的患者,其远期结局(死亡、再入院)尚未入库即被计入"无结局"。
症状:随访窗末段(尤其最近 1-3 个月入组的患者)事件率异常偏低;暴露组与对照组入组时间不同导致表观风险差异随时间漂移。
解决:
- 简单方法:从队列中剔除索引日期晚于"数据截止日期 − 结局窗长"的患者(左缩随访起点)。
- 进阶方法:对全部患者统一以"数据截止日"做结局窗截断的删失处理(Kaplan-Meier/Cox 中计入 censored),并在报告中说明数据刷新周期。
- SOTA 方法:在导出数据中显式构造 per-patient 的"可观测窗"(observation end),用时间-事件模型以可观测窗为界做删失;对更新周期做敏感性分析(假设全部事件延迟 4 周 vs 1 周)。
参考:TriNetX 眼科叙述综述(更新频率口径)
⚠️ 坑点 4:不灭时间偏差(immortal time bias)(分类:偏倚陷阱)
问题:以"确诊 X 后使用了药物 A"定义暴露组时,从确诊到用药之间的存活时间被"不灭"地划入暴露组——暴露组在结构上必然活到用药那天,死亡率被系统性低估。
症状:药物治疗组生存曲线"永不交叉"地优于对照组;效应量随随访设计改动剧烈变化;评审人一句 “immortal time” 否掉整篇。
解决:
- 简单方法:时间零点统一设在"所有人都已可被分类为暴露/非暴露"的时刻(如确诊后 30 天),暴露窗从零点后开始计。
- 进阶方法:把用药前时间作为独立时间-事件段处理(time-dependent Cox:暴露为时变协变量),或用里程碑(milestone)设计。
- SOTA 方法:采用 target trial emulation——先写下假想 RCT 的资格、治疗策略、零点、随访与结局,再让观察性分析逐条模仿(搭配克隆-删失-加权 CCSW);TriNetX 的查询速度极适合先做"模拟目标试验"的可行性检查。
参考:Journal Metrics 偏倚清单(2026)
⚠️ 坑点 5:适应证混杂 + PSM 的残留混杂与过度匹配(分类:偏倚陷阱)
问题:"谁吃了这个药"由医生决策决定,决策本身与预后相关。平台内置 PSM 只能匹配你选进模型的变量;未测量混杂(严重度、功能状态、依从性)原样残留。反向问题也存在:协变量加太多导致过度匹配(over-matching),大规模剔除患者后外部效度崩塌——平台会提示协变量过多,但可以忽略提示继续分析。
症状:PSM 后两组仍基线不齐;匹配后样本掉一个数量级、CI 飙宽;不同协变量组合下效应符号翻转。
解决:
- 简单方法:预注册协变量清单与主分析;报告中给出 PSM 前后基线表(SMD<0.1)与匹配后样本量。
- 进阶方法:导出后做多变量调整 + 工具变量/阳性对照 negativity 等阴性对照检验;报告 E-value(未测量混杂需要多大才能推翻结论)。
- SOTA 方法:Doubly-robust 估计(AIPW/TMLE)结合结局模型与倾向模型;对关键混杂做定量偏差分析;优先用"活动性药物比较者(active comparator)"新用户设计降低适应证混杂。
参考:TriNetX 眼科综述(PSM 局限与过度匹配);Ismail 等 2025 系统综述
⚠️ 坑点 6:同一患者跨机构重复 → 划分泄漏(分类:数据泄漏)
问题:患者在多家参与机构就诊会生成多条独立 patient_id(只有 65M+ 可关联子集内部已链接)。直接按 patient_id 随机划分训练/测试集,"同一个人"同时出现在两侧,模型背下了这个人而不是学会了规律。
症状:AUROC 本地 0.85+,跨机构/上线后掉到 0.7 以下;测试集中与训练集年龄/共病组合完全相同的"新患者"频繁出现。
解决:
- 简单方法:按机构令牌(hco_token)分组切分——每个机构的所有患者要么全在训练侧、要么全在测试侧。
- 进阶方法:机构 + 时间双维切分;若使用可关联子集,先按真实患者链接去重再按患者划分。
- SOTA 方法:报告三重稳健性(患者内 CV + 机构留出 + 时间外推);对链接失败概率做敏感性分析(用可关联比例 65M/309M≈21% 作为泄漏上限情景)。
参考:本条为导出数据建模的通用工程陷阱,结合 官方规模口径 与 §5.3 推导
⚠️ 坑点 7:"不可能设计"与 AI 方法学幻觉(分类:评估误用)
问题:发表文献中已有 13 篇 TriNetX 回顾性研究描述了平台上技术上不可能实现的设计,其中 8 篇声称分析就在 TriNetX 上完成——方法学部分与软件实际功能内部矛盾。根因之一是 AI 幻觉:研究者测试的 7 个生成式 AI 工具中 6 个给出了平台上无法实现的 index event 设定建议(如"取每次开药后 30 天为索引日并回溯前 90 天协变量"这类平台查询引擎不支持的回溯逻辑)。
症状:方法学部分出现平台菜单里根本不存在的操作(如自由嵌套时间窗、患者级随机抽样、任意顺序的时变调整);用 LLM 起草方法段后未经核对直接投稿。
解决:
- 简单方法:方法学每一句平台操作描述都对应到 Query Builder 的真实界面动作;截屏存档查询定义(query_metadata)作为方法附件。
- 进阶方法:平台做不到的分析明确写"数据导出后离线完成",区分"平台内分析"与"导出后分析"两段;不让 LLM 生成平台操作步骤,只让它润色。
- SOTA 方法:投稿前用 target trial emulation 表格逐项核对(资格/零点/策略/结局/随访);预注册协议(STaRT-RWE),把查询定义快照与协议版本绑定。
参考:Journal Metrics 关于 13 篇不可能设计与 7 个 AI 工具的报道(2026)
⚠️ 坑点 8:机构间编码漂移与检验单位不统一(分类:预处理陷阱)
问题:240+ 家机构各自映射本地编码到标准术语,编码习惯、文档标准与报销规则不同;同一检验在不同机构可能以 mg/dL 与 µmol/L 两种单位并存;ICD-9 → ICD-10 过渡在历史数据中留下体系断层。
症状:按原始 code 值聚合后同一概念裂成多个簇;肌酐分布出现 0.5-1.5 与 50-150 双峰(实为两种单位);跨机构模型性能显著低于单机构。
解决:
- 简单方法:特征一律经过概念级映射表(ICD/SNOMED/RxNorm 双体系字典)而非裸 code 值;检验值先按 LOINC + 单位换算归一(§6.3 代码),单位未知行宁可丢弃。
- 进阶方法:按机构令牌做特征分布漂移检测(KS 检验/PSI),漂移大的特征降权或机构内标准化(z-score per hco_token)。
- SOTA 方法:模型层做机构不变性约束(如 domain-adversarial 训练以 hco_token 为域标签);关键结局用两种编码体系定义的并集与交集做敏感性分析。
参考:Ismail 等 2025(编码实践差异);§3.7 更新周期口径
§6.6 数据增强(安全 vs 危险)
| 技术 | 判定 | 说明 |
|---|---|---|
| 概念级 dropout(诊断码随机遮盖) | ✅ 安全 | 模拟编码漏记,提升对坑点 8 的鲁棒性 |
| 序列随机截断/窗抖动 | ✅ 安全 | 缓解日期泛化带来的边界伪影 |
| 单位归一 + LOINC 映射 | ✅ 必做 | 非增强,是前提(坑点 8) |
| SMOTE 过采样罕见结局 | ⚠️ 慎用 | 只在训练折内做,且要报告原始分布 |
| 随机交换诊断码 | ❌ 危险 | 破坏编码语义,产生临床上不存在的患者 |
| 时序倒置/窗口翻转 | ❌ 危险 | 医疗时序不可逆,因果方向会被摧毁 |
| 跨患者特征拼接 | ❌ 危险 | 制造假患者,放大泄漏与隐私争议 |
§6.7 模型推荐
| 任务 | 推荐模型 | 起点 | 备注 |
|---|---|---|---|
| 队列表型/结局预测基线 | Logistic Regression / XGBoost | scikit-learn | RWE 文献主流,可解释、审稿友好 |
| 生存结局 | Cox + 时变协变量 / DeepSurv | lifelines、pycox | 处理坑点 3/4 的删失与时变暴露 |
| 诊断序列表示 | RETAIN / Transformer Encoder | 自实现 | 可解释注意力契合 RWE 叙事 |
| 跨机构泛化 | Domain-Adversarial (DANN) / Mixed Effects | 自实现 | 以 hco_token 为域标签(坑点 8) |
| 平台内快速分析 | 内置 PSM + KM + R/Python 沙箱 | TriNetX LIVE | 不导出、免 IRB(仅聚合) |
§6.8 硬件需求
| 阶段 | 配置建议 |
|---|---|
| 平台在线查询/内置分析 | 浏览器即可(计算在 TriNetX 云端) |
| 单队列导出数据清洗(≤100 万行) | 16 GB 内存笔记本 + pandas 即可 |
| 多队列合并 / 全表特征工程 | 32-64 GB 内存工作站;或 Polars/DuckDB 流式处理 |
| 深度模型训练(序列模型) | 单张 24 GB GPU(A10/3090 级)足够;EHR 表型模型很少需要更大算力 |
§6.9 评估指标代码
import numpy as np
from sklearn.metrics import roc_auc_score, average_precision_score, brier_score_loss
from sklearn.calibration import calibration_curve
def ehr_report(y_true, y_prob, group=None):
"""RWE/临床 AI 标准四件套:辨别力 + 召回精度 + 校准 + 分组稳健"""
out = {
"AUROC": roc_auc_score(y_true, y_prob),
"AUPRC": average_precision_score(y_true, y_prob), # 不平衡结局主指标
"Brier": brier_score_loss(y_true, y_prob),
}
frac_pos, mean_pred = calibration_curve(y_true, y_prob, n_bins=10, strategy="quantile")
out["calibration_points"] = list(zip(mean_pred, frac_pos)) # 画可靠性曲线用
if group is not None: # 例:按 hco_token 分组
aucs = [roc_auc_score(y_true[group == g], y_prob[group == g])
for g in np.unique(group) if y_true[group == g].nunique() == 2]
out["per_group_AUROC"] = {"mean": float(np.mean(aucs)),
"min": float(np.min(aucs)),
"spread": float(np.max(aucs) - np.min(aucs))}
return out
# y_prob 为模型输出的正类概率;group 建议先传机构令牌验证跨站稳健性
§6.10 MLOps 笔记
- 数据快照版本化:TriNetX 是活网络——每次导出都不同。以
study_id + 导出日期命名数据快照,query_metadata.json入版本库,实验结果与快照绑定。 - 口径追踪:官方规模数字(3.09 亿、940 亿、65M 等)随季度更新,任何写进报告的数字标注"截至 YYYY-MM + 口径"。
- 协议即代码:入排准则、协变量清单、统计方法写成版本化文档(预注册),查询定义与协议版本互相引用,防坑点 7。
- 再训练触发器:监控输入漂移(机构令牌分布、新编码体系出现、ICD/术语版本切换)与性能漂移;机构数据月级刷新决定了月度监控粒度是合理默认值。
- 合规流水线:导出数据集仅存于协议允许的安全环境;销毁流程与 Dataset Release Agreement 条款对齐;发表前确认 TriNetX 对论文致谢/披露的要求(引用官网口径时附来源链接)。
§7 质量评估与局限性
§7.1 已知偏倚总表
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 选择偏差 | 网络以大型学术/急性医疗机构、有保险人群为主;无保险、社区诊所、农村医院人群缺失;参与机构名单不公开,选择偏差幅度难以量化 | 高 | 明确目标人群限定为"就诊人群";在泛化结论中显式声明;换库三角验证 |
| 适应证混杂 | 治疗分配非随机;PSM 仅控制入选变量,未测量混杂残留 | 高 | 新用户设计、活动性对照、E-value、doubly-robust 估计(坑点 5) |
| 不灭时间偏差 | 确诊→用药间隔被划入暴露组,暴露组生存被高估 | 高 | target trial emulation、时变 Cox、CCSW(坑点 4) |
| 时间偏差(数据延迟) | 非实时更新(平均约 1 个月)→ 近期结局右删失 | 中 | 结局窗尾部缓冲、显式删失(坑点 3) |
| 医疗监测偏差 | 大型 HCO 患者检查更密集,疾病检出率虚高 | 中 | 检测指示变量、按机构分层敏感性分析 |
| 信息偏差(编码) | EHR 编码准确性未经独立验证;机构间编码实践差异 | 中高 | 已验证表型算法、编码 PPV 报告、双体系敏感性分析(坑点 8) |
| 检验快照限制 | 窗口内仅保留最近一次检验值,纵向轨迹结构性缺失 | 中(特定设计下高) | 避免纵向检验轨迹设计(坑点 1) |
| 多路比较(P-hacking) | 查询极快,易在大量组合中挑选显著结果报告 | 中 | 预注册主分析、报告全部预设比较 |
§7.2 标注/编码质量
TriNetX 无集中式标注团队,"标注质量"等价于编码质量:各机构编码员按 ICD-10-CM 等规范录入,平台数据字典做术语映射,但跨机构映射一致性无公开量化指标。系统综述(Ismail 等 2025)将"编码准确性未经独立验证"列为数据可靠性的关键决定因素。实践基准:引用第三方已验证表型算法(如 pheKB 系列及其 PPV 报告),并对每种结局定义报告编码组合、时间窗与阳性预测值文献依据。
§7.3 泛化性评估
| 部署场景 | 失效风险 | 证据 |
|---|---|---|
| 学术中心住院人群结局预测 | 低-中:训练分布与部署分布接近 | 网络以学术医疗中心为主(Ismail 等 2025) |
| 社区/基层/农村医疗场景 | 高:人群与诊疗模式在训练分布外 | 无保险与基层人群代表性不足(同上) |
| 一般人群患病率/发病率估计 | 高:分母非一般人群 | 平台为就诊人群,非人口学抽样框 |
| 跨国迁移(美→非美机构) | 中-高:编码体系、诊疗路径、保险结构差异 | 区域分布广但美国占约 6 成(官方 2026-06 口径) |
| 罕见病结局分析 | 中:样本量充足但事件确认依赖编码敏感性 | 平台为罕见病研究提供规模优势;PPV 风险仍在 |
| 生物标志物纵向轨迹任务 | 结构性失效 | 检验快照限制(坑点 1,Journal Metrics 2026) |
§7.4 伦理与合规
- 去标识化:数据在各源机构按 HIPAA 去识别标准(Safe Harbor 或专家判定法)处理后再入网;平台整体符合 HIPAA、GDPR 与 LGPD 要求,并维护信息安全管理体系(官方口径;眼科综述)。
- 联邦隐私设计:患者数据不出机构,仅聚合结果跨网返回,从架构上消除了"中心仓库泄露"的单点风险。
- IRB/伦理审查:聚合计数探索无需 IRB;患者级数据导出需 IRB/伦理委员会批准并签署 Dataset Release Agreement;可识别数据走独立且更严格的机构流程(如 JHU CCDA 代办)。
- 二次使用边界:RWD 为临床/运营目的采集,二次研究使用须遵守各机构协议与 Terms of Use;再识别攻击被协议禁止且技术上被去识别化与日期泛化阻抑。
§7.5 公平性
| 群体 | 表征风险 | 建议 |
|---|---|---|
| 无保险/低收入人群 | 系统性欠代表,结局估计偏乐观 | 不用于此类人群的效果声明 |
| 种族/族裔少数群体 | 美式 OMB 分类为主,非美机构字段常缺失 | 分层报告缺失率;避免族裔变量直接入模型 |
| 非英语地区患者 | 术语映射链更长,编码语义漂移风险更高 | 区域分层验证(EMEA/APAC/拉美) |
| 老年高龄段 | 年龄字段可能高位截断/泛化 | 极端年龄段单独报告 |
§7.6 数据漂移
三大漂移源:(1) 网络扩张漂移——一年新增约 5,200 万患者且多数来自国际市场,区域构成随时间显著变化,模型隐含的"人群先验"随之移动;(2) 机构增减与更新节奏漂移——参与机构动态加入,各机构 1-4 周更新间隔不同步,跨期快照不可比;(3) 编码体系漂移——ICD-9→ICD-10 过渡与术语字典演进在长时程数据中留下断层。建议:所有快照绑定导出日期;监控按机构令牌的特征分布(PSI/KS);跨年研究显式加入"时期"协变量做敏感性分析。
§7.7 DAIMS 数据质量评估(24 项)
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式可用性 | ✅ | 患者级导出可组装为宽表(§4.0、§6.3) |
| 2 | 唯一标识 | ⚠️ | patient_id 研究空间内唯一,但跨机构重复患者需按机构分组处理(坑点 6) |
| 3 | 特殊字符处理 | ✅ | 标准化 CSV,编码值为受控术语 |
| 4 | 重复行检测 | ⚠️ | 同患者跨机构产生平行身份,需主动去重 |
| 5 | 缺失编码规范 | ⚠️ | 无平台级统一缺失码,缺失语义需按 §4.5 自行判定 |
| 6 | 标签标识清晰度 | ⚠️ | 无内置标签,全部结局由研究者编码算法定义(§3.5) |
| 7 | 罕见类分组策略 | ⚠️ | 罕见结局依赖编码敏感性,需报告 PPV 依据 |
| 8 | 偏倚评估充分性 | ✅ | 平台级偏倚有系统综述与叙述综述支撑(§7.1) |
| 9 | 数据字典完备性 | ⚠️ | 无固定公开字典,字段随交付配置而异(§4 前言) |
| 10 | 信息性缺失解释 | ✅ | 未做检验=诊疗强度信号,§4.5 给出处理路径 |
| 11 | 设备信号记录 | ❌ | 无影像/波形/设备原始信号,纯 EHR 事实数据 |
| 12 | 协变量共线性 | ⚠️ | 共病与用药高度相关,PSM/多变量前需 VIF 或降维检查 |
| 13 | 编码映射规范 | ✅ | ICD-10-CM/SNOMED CT/LOINC/RxNorm 多体系映射(§2) |
| 14 | 时间戳处理 | ⚠️ | 日期泛化降低日级精度,短窗逻辑需冗余(§4.5) |
| 15 | 划分建议 | ✅ | §5.2 给出患者/机构/时间三维划分方案 |
| 16 | 泄漏讨论 | ✅ | 跨机构重复与索引回灌泄漏有专项讨论(§5.3、坑点 6) |
| 17 | 标签分布透明度 | ⚠️ | 平台 Incidence & Prevalence 工具辅助,导出后需自查分布(§4.2) |
| 18 | 测量偏倚讨论 | ✅ | 监测偏差、检验快照等测量层偏倚有文献支撑(§7.1) |
| 19 | 外部验证建议 | ✅ | §5.4 明确"换数据库才算外部验证" |
| 20 | 版本记录 | ⚠️ | 平台持续更新无静态版本号,快照版本化责任在使用者(§6.10) |
| 21 | 预处理脚本 | ⚠️ | 无官方脚本;本条目提供可复用管线(§6.3、§6.4) |
| 22 | 合规要求明确 | ✅ | HIPAA/GDPR/LGPD 与 IRB 流程清晰(§7.4) |
| 23 | 多模态对齐 | ⚠️ | 基因组学与 EHR 事件级对齐能力随 Zetta Genomics 整合仍在演进 |
| 24 | 去标识化 | ✅ | 源机构级 HIPAA 去识别 + 日期泛化 + 联邦架构(§7.4) |
DAIMS 评分:16.0 / 24(✅×10 + ⚠️×12 + ❌×1)
评分解读:TriNetX 的优势在合规与偏倚透明(去标识化、合规流程、偏倚文献都非常扎实),短板集中在"研究者责任转嫁"上——标签、字典、划分、版本、预处理全部没有官方供给,需要团队自行建设。它是一个**研究就绪(research-ready)但非模型即用(not model-ready)**的数据源:适合以 RWE 研究流程为主的团队,对纯 ML 团队则有明显的工程前置成本。
对你意味着什么:
- 如果你做 RWE/药物流行病学研究——直接可用,把精力花在坑点 4/5/7 的设计规范上,DAIMS 短板几乎不影响你。
- 如果你训练临床 ML 模型——先建三件套:快照版本化仓库、机构分组划分管线、单位/术语归一表(§6.3 起点),否则指标不可信。
- 如果你要纵向生物标志物轨迹或设备信号——此库结构性不满足,直接换数据源(MIMIC-IV、All of Us、机构 CDW)。
- 如果你在选型对比——把"16.0/24"拆开看:10 个 ✅ 里有一半是合规项,这恰是 TriNetX 相对自拼数据的最大溢价点。
§7.8 外部验证与跨库比较矩阵
| 验证场景 | 来源 | 评估任务 | 性能指标 | 关键发现 |
|---|---|---|---|---|
| 平台方法学系统评价 | Ismail A, Nassar M 等, ASIDE Intern Med, 2025(PMID 40697879) | 平台数据架构/质量/外推效度综述 | 定性 | 编码准确性未独立验证;人群以有保险学术中心为主,外推受限 |
| 眼科领域应用综述 | Annals of Eye Science 叙述综述(原文) | TriNetX 在眼科研究的优势与陷阱 | 定性 | PSM 残留混杂为文献第二大高频局限;更新延迟与监测偏差列为主要偏倚 |
| 元科学研究 | European Journal of Epidemiology 刊载研究(经 Journal Metrics 2026 转述) | 已发表 TriNetX 研究的设计可实施性审计 | 13 篇不可能设计 / 8 篇声称平台内完成;7 个生成式 AI 中 6 个给出不可实施方案 | 平台研究的方法学报告失真与 AI 幻觉风险有量化证据 |
| 上市后安全性研究应用 | Zontag J 等, JAMA Otolaryngol Head Neck Surg, 2026(经 CB Insights 收录) | 2 型糖尿病患者 GLP-1 处方与味觉/嗅觉障碍关联 | 未收录效应量 | 展示 TriNetX EHR 数据库支撑 JAMA 系列期刊上市后安全研究的可行路径 |
注:TriNetX 生态中没有"内部基准→外部数据集"的标准化迁移排行榜;上表收录的是有同行评审支撑的平台级验证与方法学审计结果,均为定性或研究设计层面的结论。
§8 基准表现与生态
§8.1 代表性研究成果(非 ML 排行榜)
TriNetX 是数据基础设施而非基准数据集,不存在 Kaggle 式排行榜。其"基准表现"体现为支撑研究的规模、速度与发表量级。下表按生态影响力列出代表性成果:
| 排名 | 研究/成果 | 发表 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | 平台方法学系统综述(偏倚与局限全景) | ASIDE Intern Med | 2025 | 系统综述 | Ismail A, Nassar M, et al., 2025, ASIDE Intern Med. PMID 40697879 | 不适用 |
| 2 | 元研究:13 篇不可能设计的审计 | European Journal of Epidemiology | 2025-2026 | 元研究 + LLM 测试 | 原文见 EJE 检索;经 Journal Metrics(2026)专题转述 | 不适用 |
| 3 | GLP-1 与味觉/嗅觉障碍上市后安全研究 | JAMA Otolaryngol Head Neck Surg | 2026 | 回顾性队列 + EHR 数据库分析 | Zontag J, et al., 2026, JAMA Otolaryngol Head Neck Surg | 不适用 |
| 4 | 眼科领域应用与陷阱叙述综述 | Annals of Eye Science | 2025 | 叙述综述 | Ann Eye Sci(原文) | 不适用 |
| 5 | RWD 适用性框架(官方) | TriNetX 官方博客 | 2024 | fit-for-purpose 框架 | Brown J, Palchuk M, 2024, “Is Your Real-World Data Research-Ready?”(官方博客) | 不适用 |
注:表中 2 的原始论文以 EJE 官网检索为准;各研究数字口径不同(队列、时点、结局定义各异),不可直接横向比较。
§8.2 SOTA 总结与选型建议
- 规模与速度即 SOTA:TriNetX 在"分钟级跨机构聚合计数"这个任务上处于行业第一梯队(3.09 亿+ 患者生命、月查询数千万次),这正是它被 4,000+ 篇论文采用的原因。
- RWE 研究选型:试验可行性/药物警戒/比较效果 → TriNetX 是最优性价比之一;需深度纵向 ICU 数据 → MIMIC-IV;需基因组-EHR 深度链接 → All of Us;需一般人群推断 → 换人群抽样库。
- AI 建模选型:把 TriNetX 当"全疾病谱预训练语料的采样器"——先在平台内做队列可行性,导出后在 §6.7 模型谱系上从 LR/XGBoost 起步,跨机构泛化是必修课不是选做题。
§8.3 评测协议
| 协议 | 用途 | 适用性 |
|---|---|---|
| RECORD-PE | 药物流行病学观察性研究报告规范 | TriNetX 研究报告的事实标准之一 |
| STaRT-RWE | RWE 研究透明度与报告结构化清单 | 监管导向 RWE 研究推荐 |
| Target Trial Emulation | 观察性研究模仿假想 RCT 的设计框架 | 防坑点 4/5 的首选设计工具 |
| HDE(Harmonized Data Elements)/OMOP CDM | 数据模型与术语协调 | 导出数据对接 OHDSI 工具链 |
§8.4 相关数据集
| 数据集 | 类型 | 与 TriNetX 的关系 |
|---|---|---|
| MIMIC-III/IV | 单中心 ICU 公开库 | 免费下载的深度替代/外部验证库;人群窄但字段深 |
| All of Us(NIH) | 志愿者纵向队列 | 基因组-EHR 深链接;controlled tier 受控访问 |
| eICU-CRD | 多中心 ICU 公开库 | 多中心 ICU 视角的补充 |
| Synthea | 合成患者生成器 | 无合规门槛的方法学演练场 |
| Optum Clinformatics / IQVIA | 商业理赔/EHR 库 | 商业竞品;理赔主导 vs TriNetX EHR-native |
| OHDSI OMOP 网络 | 开源联邦网络 | 开源社区版联邦范式;数据需各自授权 |
§8.5 关键文献 Top 6
- Ismail A, Nassar M, et al. (2025). “TriNetX and Real-World Evidence: A Critical Review of Its Strengths, Limitations, and Bias Considerations in Clinical Research.” ASIDE Intern Med. PMID: 40697879 — 首个针对 TriNetX 平台全景的系统方法学综述,偏倚分类的最完整来源。
- Zontag J, et al. (2026). GLP-1 处方与 2 型糖尿病患者味觉/嗅觉障碍的回顾性队列分析. JAMA Otolaryngol Head Neck Surg. — 展示 TriNetX EHR 数据库进入顶级专科期刊上市后安全研究的最新样例。
- Brown J, Palchuk M (2024). “Is Your Real-World Data Research-Ready?” TriNetX 官方博客, 2024-10-22 — 官方 fit-for-purpose 框架,CSO/CMIO 亲述 RWD 质量哲学。
- TriNetX, LLC (2026). “TriNetX LIVE™ Network Surpasses 300 Million Patient Lives” 官方新闻稿, 2026-06-23 — 当前规模口径(240+ HCO、940 亿+ 数据点、区域分布)的一手来源。
- TriNetX, LLC (2025). “TriNetX’s Founding CEO Announces Plans to Step Down” 官方新闻稿, 2025-01-09 — 公司治理沿革与平台定位(HIPAA/GDPR/LGPD 合规)的一手来源。
- Journal Metrics (2026). “The TriNetX Study Surge: What Medical Authors Need to Understand About Real-World Data Research in 2026” — 对 EJE 元研究(13 篇不可能设计、7 个 LLM 中 6 个幻觉)与平台特有限制的系统性编辑部综述。
§8.6 社区与支持活跃度
- 学术产出:累计 3,300+(2026-06)/4,000+(2026-08)篇同行评审论文引用平台数据,月查询量数千万次,为被引最多的 RWD 来源之一。
- 官方支持:support.trinetx.com 知识库、在线 Training Center(基础/高级课程、月度网络研讨会)、机构级 CSM 支持。
- 学术社区:美国主要学术医疗中心的 CTSI/ICTR 均维护本地使用指南与培训(JHU、UNC、URMC、Utah 等),构成事实上的分布式用户社区;OHDSI 社区工具链可通过 OMOP 就绪接口互通。
§8.7 生态快照
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| TriNetX 官网 | 官方主页 | https://trinetx.com/ | 规模口径、新闻稿、合规声明的一手来源 |
| TriNetX LIVE 平台 | 在线平台 | https://live.trinetx.com/ | 队列构建与数据集请求入口(需账户) |
| 官方 Training Center | 教程 | 经官网导航进入 | 平台操作与高级查询的官方课程 |
| support.trinetx.com | 文档/工单 | https://support.trinetx.com/ | Terms of Use 与操作文档(登录) |
| JHU ICTR TriNetX 指南 | 机构指南 | https://ictr.johnshopkins.edu/trinetx | 最详尽的学术开户与数据请求流程之一 |
| UNC TraCS 数据集指南 | 机构指南 | https://tracs.unc.edu/index.php/services/informatics-and-data-science/trinetx/research-network-datasets | Request Dataset 字段要求与费用机制 |
| URMC CTSI 指南 | 机构指南 | https://www.urmc.edu/clinical-translational-science-institute/services-and-support/trinetx | 功能全景(Trial Connect、Incidence & Prevalence、培训) |
| Ismail 等 2025 系统综述 | 同行评审 | https://pmc.ncbi.nlm.nih.gov/articles/PMC12282508/ | 写方案 limitations 章节的必引文献 |
§9 相关资源与引用
§9.1 官方与权威资源
| 资源 | 说明 |
|---|---|
| TriNetX 官网 | 平台定位、规模口径、新闻稿与合规声明 |
| TriNetX LIVE 平台 | 研究者登录入口(需机构账户) |
| support.trinetx.com | 官方知识库、Terms of Use、操作手册(登录) |
| 官方 Training Center | 基础/高级课程与网络研讨会(官网导航进入) |
| JHU ICTR 指南 | 学术开户、IRB 流程与 CCDA 可识别数据代办 |
| UNC TraCS 数据集指南 | Request Dataset 字段要求与费用机制 |
| UNC TraCS Re-ID 指南 | 可识别数据请求的限制与收费 |
| URMC CTSI 指南 | 功能全景与培训体系 |
| Utah CTSI 数据集请求 | Dataset Release Form 签署流程 |
§9.2 BibTeX 引用
@article{ismail2025trinetx,
title = {TriNetX and Real-World Evidence: A Critical Review of Its Strengths, Limitations, and Bias Considerations in Clinical Research},
author = {Ismail, Abdellatif and Nassar, Mahmoud and others},
journal = {ASIDE Intern Med},
year = {2025},
pmid = {40697879},
url = {https://pmc.ncbi.nlm.nih.gov/articles/PMC12282508/}
}
@article{zontag2026glp1,
title = {GLP-1 receptor agonist use and smell and taste disturbances in type 2 diabetes: a retrospective cohort analysis of the TriNetX electronic health records database},
author = {Zontag, J and others},
journal = {JAMA Otolaryngology--Head \& Neck Surgery},
year = {2026},
note = {标题为编者按内容转述,准确题录以期刊原文为准}
}
@misc{brown2024rwd,
title = {Is Your Real-World Data Research-Ready?},
author = {Brown, Jeffrey and Palchuk, Matvey},
howpublished = {TriNetX Official Blog},
year = {2024},
month = {10},
url = {https://trinetx.com/?p=1854/}
}
@misc{trinetx2026milestone,
title = {TriNetX LIVE Network Surpasses 300 Million Patient Lives},
author = {{TriNetX, LLC}},
howpublished = {Press Release},
year = {2026},
month = {6},
url = {https://trinetx.com/}
}
@misc{trinetx2025ceo,
title = {TriNetX's Founding CEO Announces Plans to Step Down},
author = {{TriNetX, LLC}},
howpublished = {Press Release},
year = {2025},
month = {1},
url = {https://trinetx.com/?p=1868/}
}
@misc{aes2025trinetx,
title = {A narrative review of TriNetX in ophthalmology: applications, advantages, and pitfalls},
author = {{Annals of Eye Science}},
howpublished = {Annals of Eye Science},
year = {2025},
url = {https://aes.amegroups.org/article/view/8013/html}
}
@misc{journalmetrics2026surge,
title = {The TriNetX Study Surge: What Medical Authors Need to Understand About Real-World Data Research in 2026},
author = {{Journal Metrics}},
howpublished = {Journal Metrics Blog},
year = {2026},
url = {https://www.journalmetrics.org/blog/trinetx-real-world-data-studies-medical-journals-2026}
}
§9.3 引用指南
- 引用平台本身:商业平台无统一数据 DOI,学术惯例是引用采用其数据的研究文献(如 Ismail 2025 综述)并在方法学部分注明平台名称、访问月份与查询定义。
- 引用规模数字:必须附时点与口径(“3.09 亿+ 患者生命,TriNetX 官方 2026-06 新闻稿”;“990 亿+ 数据点,官网 2026-08”),因为数字随季度快速变化。
- 引用本条目:千方病案医数集(qianfanghub.com)AI-Ready Wikipedia 条目 “TriNetX”,访问日期 + 条目版本。
- 引用机构流程:数据请求与费用规则因机构而异,引用时以你的所属机构 CTSI/ICTR 页面为准。
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| deep-model(WorkBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch(多源检索) | 2026-09-13 | 5 组检索:官方规模口径、公司沿革与收购、获取流程(JHU/UNC/URMC/Utah 指南)、研究局限与坑点素材、ICD-11 编码核实 |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从 TriNetX 官网、官方新闻稿、Tracxn/CB Insights 公司档案、四所大学 CTSI 指南与同行评审文献中整理结构化信息;(2) 生成 §6 的 Python 代码示例(平台端流程描述基于官方与机构指南转述);(3) 系统化组织 §6.5 的 8 个坑点(素材来自同行评审综述与元研究报道);(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
§10.3 输入来源
- TriNetX 官网(规模口径:990 亿+ 数据点、65M+ 可关联患者、4,000+ 论文,截至 2026-08;2026-07-27 CEO 任命)
- TriNetX 官方新闻稿(2026-06-23):网络突破 3 亿患者生命、240+ HCO、13,000+ 站点、20+ 国家、940 亿+ 数据点、区域分布、联邦架构与合规描述
- TriNetX 官方新闻稿(2025-01-09):创始人 CEO 卸任、2014 年创立、HIPAA/GDPR/LGPD 合规、月查询数千万次
- Tracxn 公司档案:2020-09-21 Carlyle 收购、$102M 融资(Series D 2019-03)、投资方清单、员工数(2026-07-31)、收购列表
- CB Insights 公司档案:总部地址、2013 年口径、专利申请(2014-12-09)、Zontag 2026 JAMA Otolaryngol 论文收录
- Physician AI Tools 公司页:275M/170+ HCO 早期口径、NLP 能力、应用场景、收购与合作时间线
- Johns Hopkins ICTR TriNetX 指南:开户培训、2-3 工作日开通、IRB 与 CCDA 可识别数据流程
- UNC TraCS Research Network Datasets 指南:Request Dataset 字段要求、费用机制(未受资助免费)、Terms of Use 责任
- UNC TraCS Re-ID 指南:Re-ID 限制(<2,500 人)、2025-10-20 起收费
- URMC CTSI 指南:队列计数无需 IRB、Trial Connect、Incidence & Prevalence、培训课程体系
- Utah CTSI 指南:Dataset Release Form 签署、受资助研究收费
- Ismail A, Nassar M, et al. (2025), ASIDE Intern Med, PMID 40697879(PMC12282508)——平台方法学系统综述:选择偏差、编码未验证、外推受限
- Annals of Eye Science(2025)眼科叙述综述——更新频率口径(80% HCO 1-4 周、平均 1 个月)、PSM 局限、过度匹配、监测偏差、700 亿数据点时点口径
- Journal Metrics(2026)编辑部综述——检验快照限制、13 篇不可能设计(8 篇声称平台内完成)、7 个生成式 AI 中 6 个幻觉、P-hacking 与不灭时间偏差清单、Eur J Epidemiol 元研究转述
- Brown J & Palchuk M (2024), TriNetX 官方博客——RWD fit-for-purpose 框架、COVID 疫苗暴露误分类案例、医疗数据 30% 占比与 36% CAGR
- findacode.com / medsci.cn ICD-11 编码工具——5A11、GB61 等编码核实(2026-01 版 ICD-11 MMS)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11 映射、SNOMED CT、人群统计) | 千方病案医学编辑部 | 交叉审核(编码经 findacode/medsci 双源核实) | ✅ 已验证 |
| §3 数据集规格(规模数字、区域分布、更新周期) | 千方病案医学编辑部 | 与官方新闻稿及眼科综述交叉比对 | ✅ 已验证 |
| §4 数据结构(导出目录树、DAIMS 字段字典) | 千方病案医学编辑部 | 与机构使用指南及已发表方法学描述交叉比对 | ✅ 已通过 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 坑点素材逐条溯源(综述/元研究/机构指南) | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核(24 项逐项对照 §4-§6 证据) | ✅ 已通过 |
| §8 排行榜与引用表述 | 千方病案医学编辑部 | 与原始文献及官方口径交叉比对;不可直比项已标注 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema v3.9 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
本条目全部章节由 AI 辅助生成初稿,经千方病案医学编辑部按 §10.4 范围人工交叉审核后发布。其中 §2.1/§2.2 的 ICD-11 与 SNOMED CT 编码表、§3 的规模数字、§6.5 的 8 个坑点均为 AI 整理 + 人工逐条溯源核验;§6 的代码为 AI 生成 + 人工逻辑审查(未在 TriNetX 私有数据上端到端执行,属于教学示例性质)。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- twosides — 共享标签:电子健康记录 / 药物发现与化学 / 真实世界数据 / 药物安全
- faers — 共享标签:电子健康记录 / 药物发现与化学 / 真实世界数据 / 药物安全
- cgrd — 共享标签:电子健康记录 / 药物发现与化学 / 真实世界数据 / 药物安全
- thin — 共享标签:电子健康记录 / 药物发现与化学 / 真实世界数据 / 药物安全
- jmdc — 共享标签:电子健康记录 / 药物发现与化学 / 真实世界数据 / 药物安全
- cdars — 共享标签:电子健康记录 / 药物发现与化学 / 药物安全
- openfda — 共享标签:电子健康记录 / 真实世界数据 / 药物安全
- fda-sentinel — 共享标签:药物发现与化学 / 真实世界数据 / 药物安全
- CPRD — 共享标签:电子健康记录 / 真实世界数据 / 药物安全
- nhird — 共享标签:电子健康记录 / 药物发现与化学 / 药物安全
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

