信息速览
GePaRD — 德国 2,500 万人医保理赔数据库 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | GePaRD |
| 英文全称 | German Pharmacoepidemiological Research Database |
| 别名/简称 | GePaRD、Statutory Health Insurance Data (GePaRD)、德国药物流行病学研究数据库 |
| 疾病分类 | 全疾病谱(ICD-11:CB4Z 心力衰竭 / BA41 急性心肌梗死 / 5A11 2 型糖尿病 / 1G4Z 脓毒症等多系统疾病,理赔数据无预设疾病范围) |
| SNOMED CT | 74400008 Hospital admission / 182817000 Prescription of drug / 57809007 Dispensing medication / 404684003 Clinical finding(详见 §2.2) |
| 数据模态 | 结构化医保理赔(人口学主数据、门诊诊疗与诊断、住院诊疗与诊断、门诊处方配药) |
| AI 任务类型 | 药物安全性预测、疾病风险预测、表型算法(phenotyping)开发与验证、目标试验模拟(target trial emulation)、医疗资源利用研究、时序疾病轨迹建模 |
| 样本总数 | 约 2,500 万名参保人(每数据年约 1,700 万活跃个体,约占德国人口 20%) |
| 数据大小 | 未公开(全库为 BIPS 内部关系数据库,项目制按需生成研究提取集) |
| 数据格式 | 项目研究提取集(常见 CSV/SAS/Stata 导出);ConcepTION CDM 映射已登记 |
| 许可证 | 无公开数据许可协议(数据不对外分发,使用依 SGB X §75 获批项目与合作协议) |
| 访问级别 | 申请审核(须与 BIPS 合作,经医保公司与主管当局依 SGB X §75 批准,流程可长达数月) |
| DUO 标签 | HMB, PUB |
| 语言 | 德语(原始编码与单据字段)/ 英语(研究文献) |
| 首发日期 | 2004-01-01(EMA 目录登记的数据起始日) |
| 最后更新 | 年度刷新;EMA 目录登记最近数据刷新为 2023-02-28 |
| 发布机构 | Leibniz Institute for Prevention Research and Epidemiology – BIPS(不来梅) |
| 官方主页 | https://www.bips-institut.de/en/research/research-infrastructures/gepard.html |
| 下载地址 | 无公开下载(合作咨询:gepard@leibniz-bips.de) |
| DOI | 10.17616/R31NJMSR(re3data 登记符;数据集本身无数据 DOI) |
| AI 就绪度评分 | ⭐⭐(2/5)— 数据结构规整、验证文献厚实;扣分项:完全不对外分发、无公开数据字典与预处理脚本、门诊诊断仅季度聚合、无官方数据划分 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(德国法定医保体系、全疾病谱编码锚定)、§7 偏倚分析(社会经济状态选择偏倚、区域覆盖差异、结局验证研究)。
数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。GePaRD 不提供任何公开下载,数据访问仅限 BIPS 员工在经法定医保公司与主管当局依《社会法典》(SGB)X 第 75 条批准的研究项目框架内进行,第三方须与 BIPS 合作并签署访问科学家协议。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? GePaRD 是德国不来梅 BIPS 研究所自 2004 年起建立的医保理赔研究数据库。它汇集了四家德国法定医保公司(AOK Bremen/Bremerhaven、Techniker Krankenkasse、DAK-Gesundheit、hkk)的报销单据数据,累计覆盖约 2,500 万名参保人——相当于每 3 个德国人中就有 1 人曾被纳入,每个数据年活跃个体约 1,700 万(约占德国人口的 20%)。
为什么重要? 在德国,约 87% 的人口参加法定医疗保险,所有就诊、住院、处方药配药都会产生理赔记录。这些记录虽为行政目的而生,却完整刻画了真实世界中的医疗行为。GePaRD 因此成为德国药物警戒的旗舰数据源:复方口服避孕药静脉血栓风险、丙戊酸致畸性等改变监管决策的证据,都出自这个数据库。
我能用它做什么? 如果你是药企或学术研究者,可通过与 BIPS 建立合作,在获批项目内研究新上市药物的真实世界安全性(PASS 研究)、妊娠期用药安全、癌症筛查效果评估,或开发与验证疾病结局识别算法。注意:GePaRD 不提供任何公开下载,所有分析在 BIPS 安全区内完成。
§1.1 摘要
GePaRD 由 BIPS(Leibniz Institute for Prevention Research and Epidemiology)于 2004 年启动建设,属项目制(project-based)研究数据库:数据经伪匿名化后进入 BIPS 内部关系数据库,每年刷新一次,再按获批项目生成专属提取集。数据覆盖人口学主数据(出生年、性别、居住地)、门诊与住院诊疗及诊断(ICD-10-GM 至少 4 位、OPS 手术操作码、EBM 门诊服务码)以及门诊药房配药记录(ATC 编码)。门诊诊断按季度聚合且强制标注诊断确定性(确诊/疑似/状态 post/排除),住院数据含精确出入院日期。该库被 HMA-EMA 真实世界数据目录收录(数据源 ID 26534),记录完整度 90%。其研究产出以药物安全与结局验证见长:死亡率与全国统计的系统性比对(Ohlmeier et al., 2016)、识别超过 123 万例妊娠结局的算法(Wentzell et al., 2018)、以及直接支撑 BfArM 用药安全沟通的避孕药血栓风险研究(Schink et al., 2022)。
GePaRD 的名称可拆解为 “German Pharmacoepidemiological Research Database”——从命名即可看出其出身:它不是为 AI 训练而生,而是为药物流行病学(pharmacoepidemiology)而生。这一出身决定了它的全部气质:数据结构围绕"暴露-结局"研究设计组织,质量控制围绕"编码是否等于疾病"这一问题展开,治理围绕《社会法典》第十编(SGB X)第 75 条的审批框架运行。理解这一点,比记住任何规模数字都更重要。
条目的读者路线图如下:临床与监管背景的读者建议从 §1.2 与 §2 读起;计划申请数据访问的读者直接看 §6.0 与 §6.2 的合作流程;AI 工程师应优先读 §4 的数据结构与 §6.5 的八个坑点,再决定是否立项;方法学研究者则可以从 §7.7 的 DAIMS 24 项评估快速判断该库与自己研究问题的匹配度。
§1.2 战略价值分析
维度一:德国全人群药物警戒的稀缺窗口。 德国没有瑞典 SCR 或丹麦登记库那样的全民个人编号体系,理赔数据因此成为观察德国真实世界医疗行为的最佳代理。GePaRD 每个数据年覆盖约 20% 人口且全德地域有代表性,足以在数年内检出罕见或迟发不良事件,是德国药品监管机构(BfArM)认可的药物安全证据来源。对新批准药物而言,PAS(Post-Approval Safety Studies)研究可在此类数据上以万人级新用药者队列快速完成。
维度二:方法学验证的深水区。 与多数理赔数据库不同,GePaRD 拥有一条罕见的"验证链":死亡率对照联邦统计局数据、妊娠结局算法对照临床专家评审、AMI/卒中/心血管死亡算法对照患者画像评审。这使它不仅产出关联证据,还能回答"我们的算法有多准"这一 AI 建模的核心问题。BIPS 亦设立跨部门工作组 GeTTCausal,专门以目标试验模拟(target trial emulation)方法在此数据上做因果推断。
维度三:欧洲监管科学网络的节点。 GePaRD 被 HMA-EMA 真实世界数据目录收录,是 IMI ConcepTION 项目(妊娠期药物安全)的参与数据源,与 CPRD(英国)、PHARMO(荷兰)、BIFAP(西班牙)等欧洲数据库共同构成跨国药物警戒的证据底座。
维度四:AI 训练数据的"可信弱监督"范式样本。 对 AI 社区而言,GePaRD 的示范意义超出单个数据库:它展示了在没有金标准标签的全人群数据上,如何用"规则表型 + 画像评审 + 外部统计对标"三件套建立标签可信度。随着欧盟健康数据空间(EHDS)推动理赔类数据的研究利用,这套验证文化正是医疗 AI 从单中心病历走向人群级训练最欠缺的基础设施。
§1.3 横向对比
| 数据集 | 规模 | 模态 | 标注 | 与 GePaRD 的差异化 |
|---|---|---|---|---|
| GePaRD | 约 2,500 万人(每年约 1,700 万活跃) | 德国 4 家法定医保理赔(门诊季度+住院+配药) | 无人工标注;算法表型+验证研究 | 德国全境代表性、SGB X §75 治理、验证文献最厚 |
| MIMIC-III | 46,520 名患者 | 单中心 ICU 床旁时序+临床笔记 | 人工整理事件标注 | 深度监护级粒度 vs GePaRD 全人群广度 |
| CPRD (UK) | 约 6,000 万累计(Gold/Aurum) | 英国全科诊疗+处方+linkage | 研究者定义表型 | 英全科为主 vs 德理赔视角;CPRD 可申请脱敏提取 |
| SNDS (法国) | 全法约 6,600 万人 | 法定医保理赔+住院(PMSI) | 无标注 | 全人群 vs GePaRD 的 20% 年覆盖;SNDS 为政府开放框架 |
| BARMER DWH | 约 1,260 万人(2006-2017) | 单一保司 BARMER 理赔 | 无标注 | 单保司纵深 vs GePaRD 四保司横向制衡 |
| IQVIA Disease Analyzer | 数百万人(德国诊所样本) | 诊所电子病历抽样 | 无标注 | 诊所细节更多 vs GePaRD 人群代表性更强 |
| InGef | 多家保司联合(德国保险数据研究联盟) | 多保司理赔研究数据 | 无标注 | 同为多保司理赔路线,方法学可互鉴 |
§1.4 版本演进时间轴
| 时间 | 里程碑 |
|---|---|
| 2004 | BIPS 启动理赔数据利用与数据库建设,EMA 登记数据起始日 2004-01-01 |
| 2008 | 建库方法学论文发表:Pigeot & Ahrens, Pharmacoepidemiol Drug Saf 17(3):215-223 |
| 2010 | NSAID 配药与住院诊断代表性评估发表(Schink & Garbe);早期抗凝药安全系列研究(苯丙香豆素与颅内出血等) |
| 2016 | 死亡率验证:GePaRD 死亡率与联邦统计局数据系统比对(Pharmacoepidemiol Drug Saf 25:778-784) |
| 2018 | 妊娠结局识别与分类算法优化:识别 1,235,261 例妊娠结局(Pharmacoepidemiol Drug Saf 27:1005-1010) |
| 2021 | Springer 专著章节《German Pharmacoepidemiological Research Database (GePaRD)》(DOI 10.1007/978-3-030-51455-6_8) |
| 2022 | AMI/卒中/心血管死亡结局算法验证(Clin Epidemiol 14:141352);复方口服避孕药 VTE 风险研究发表于 BJOG |
| 2023 | 数据刷新 2023-02-28;丙戊酸-脊柱裂概念验证(Pharmacoepidemiol Drug Saf 32(2):148-157);乳腺癌筛查目标试验模拟协议发表 |
| 2024 至今 | HMA-EMA 真实世界数据目录正式收录(首录 2024-02-01,数据源 ID 26534),持续年度刷新 |
时间轴的解读要点:GePaRD 的演进不是"版本迭代"而是"能力累积"——建库(2004-2008)、代表性验证(2010-2016)、表型算法资产化(2018-2022)、监管网络化(2022 至今)。四家保司构成二十年基本稳定,这使跨年趋势分析的可比性显著优于保司频繁更替的同类库。
§1.5 典型 AI 应用场景
- 新药安全信号检出与精化(PASS):以新用药者队列+巢式病例对照设计,量化新上市药物 vs 老药的不良事件相对风险(如 Schink et al., 2022 对 9 种复方口服避孕药的 VTE 风险分级)。
- 妊娠期用药安全:利用妊娠识别与结局分类算法(母亲-婴儿联结、孕周估计),研究药物致畸性(如丙戊酸与脊柱裂,Haug et al., 2023)。
- 结局识别算法(phenotyping)开发与验证:以 ICD-10-GM/OPS/EBM 编码构建 AMI、卒中、心血管死亡等结局算法,并用患者画像评审验证 PPV(Platzbecker et al., 2022)。
- 目标试验模拟与因果推断:在 GeTTCausal 框架下用克隆-删失加权等方法回答筛查与用药的因果问题(乳腺癌筛查死亡率、抗糖尿病药与胰腺癌的参数 g-formula 可行性研究)。
- 癌症筛查项目评估:筛查肠镜后结直肠癌发生率与重复肠镜检出率(Schwarz et al., 2023, Clin Transl Gastroenterol 14(1):e00535),为全国筛查政策提供效果证据。
- 医保政策与处方模式监测:以纵向配药记录量化政策干预前后的处方结构变化——避孕药处方中低风险孕激素制剂份额在监管行动后从 32% 升至 54%,正是这类监测的范例;AI 方法可将其扩展为异常处方模式检测与政策效果的多区域分层评估。
§2 医学背景
§2.1 ICD-11 疾病分类锚定
GePaRD 为全疾病谱理赔数据,不预设疾病范围。其研究高频领域在 ICD-11 中的锚定如下:
| 研究高频领域 | ICD-11 编码 | 中文名称 | 说明 |
|---|---|---|---|
| 缺血性心脏病 | BA41 | 急性心肌梗死 | 住院主诊断 I21-I22(ICD-10-GM)对应场景 |
| 心力衰竭 | CB4Z | 心力衰竭 | 药物安全研究常见合并症 |
| 脑血管病 | 8B11 | 脑梗死 | 卒中结局算法核心(ICD-10-GM I63.-) |
| 静脉血栓栓塞 | DB6Z | 静脉血栓栓塞 | 避孕药安全研究结局(肺栓塞+深静脉血栓) |
| 2 型糖尿病 | 5A11 | 2 型糖尿病 | 药物流行与 g-formula 研究常见暴露/混杂 |
| 感染与脓毒症 | 1G4Z | 脓毒症 | 急性感染作为 VTE 时变混杂 |
| 妊娠与产程 | JA00-JB5Z | 妊娠、分娩与产褥期 | 妊娠结局算法覆盖活产/流产/死产/异位妊娠 |
| 结直肠肿瘤 | 2B92 | 结直肠癌 | 筛查效果评估结局 |
| 慢性肾病 | GB61 | 慢性肾病 | 药物安全研究常见合并症与结局修饰 |
| 心房颤动 | BC81 | 心房颤动 | 抗凝药安全研究的暴露与适应证 |
| 抑郁障碍 | 6A70 | 单次发作抑郁障碍 | 精神类药物流行病学高频领域 |
§2.1b SNOMED CT 映射
| 标签 | ICD-11 | SNOMED CT 码 | 术语 |
|---|---|---|---|
| 住院事件 | BA41/8B11 等 | 74400008 | Hospital admission (procedure) |
| 处方开具 | 覆盖全谱 | 182817000 | Prescription of drug (procedure) |
| 药房配药 | 覆盖全谱 | 57809007 | Dispensing medication (procedure) |
| 临床发现 | 覆盖全谱 | 404684003 | Clinical finding (finding) |
SNOMED 映射止步于"过程与实体"级是理赔数据的普遍局限:理赔库记录的是报销事实(就诊发生了、药配了、住院了),而 SNOMED 的价值在临床语义(发现、分期、形态学)。做语义互操作(如把 GePaRD 队列导出为 OMOP/SNOMED 术语体系)时,事件级映射可靠、发现级映射须回退到 ICD 码的语义近似,并在映射文档中标注置信级别。
§2.2 疾病简介与流行病学背景
GePaRD 的"医学背景"不是单一疾病,而是德国法定医疗保险(SHI)体系下全人群医疗行为的流行病学底座。德国实行强制医保:约 87% 人口参加法定医保,约 11% 参加私人保险,其余由特殊制度覆盖(军人、难民等)。理赔数据因此天然覆盖从新生儿到高龄老人的全年龄结构,既包括门诊全科与专科服务,也包括住院与手术。
从研究分布看,GePaRD 的产出集中在三大疾病域:其一为药物安全(抗凝药出血、激素避孕药血栓、抗糖尿病药与肿瘤、妊娠期致畸),对应上述血栓、心血管与妊娠分类;其二为癌症筛查与预防(结直肠癌、乳腺癌筛查效果),对应肿瘤分类;其三为脆弱人群用药(儿童青少年、孕产妇、老年人、慢病患者)。德国每年新发癌症超过 48 万例、死亡超过 23 万例,筛查项目评估因此是 GePaRD 转化价值最直接的出口之一。
理解理赔数据的流行病学含义,需要先理解德国医保的制度结构。德国实行竞争性法定医保:约 100 家法定医保基金(Krankenkassen)在统一的法律框架下竞争运营,公民可自由更换保司。这意味着单家保司的数据库不是全国随机样本——每家保司的参保结构有其历史渊源(如地域性 AOK、面向白领的 TK)。GePaRD 用"四家互补保司"的组合策略对冲这一结构性偏差,但组合本身仍非随机抽样,这正是 §7.1 选择偏倚条目的制度根源。
| 制度要素 | 概况 | 对数据形态的影响 |
|---|---|---|
| 法定医保(SHI)覆盖率 | 约 87% 人口 | 数据主体;私保人群(约 11%)结构性缺席 |
| 保司竞争 | 约 100 家保司自由投保 | 单保司样本有选择效应,需多保司组合 |
| 门诊偿付 | 按季度总额与医生协会分配 | 门诊诊断以季度为记账单位(根源) |
| 住院偿付 | G-DRG 按病例分组付费 | 住院诊断/操作逐例完整记录(高确证来源) |
| 药房配药 | 法定医保处方药统一报销 | 配药表近乎完备,OTC 自购除外 |
§2.3 临床任务定义
在理赔数据语境下,"临床任务"被重新定义为四类算法任务:
| 任务 | 定义 | GePaRD 上的典型实现 |
|---|---|---|
| 筛查(screening) | 识别接受过指定筛查服务的人群 | EBM 码识别肠镜/乳腺 X 线筛查服务 |
| 诊断(diagnosis) | 以编码组合识别患病个体 | ICD-10-GM 住院主诊断(高确证)+ 门诊确诊码 |
| 分级(classification) | 区分结局亚型与确定性 | 妊娠结局分为活产/早产/过期/流产/死产/异位妊娠 |
| 预后(prognosis) | 以基线协变量预测远期事件 | 死亡(出院原因+死亡记录)、心血管死亡复合结局 |
同一份底层数据在四类任务间的角色互换值得注意:编码组合在"诊断"任务里是特征,在"预后"任务里是标签来源,在"筛查"任务里是入选条件。多任务混做时,变量角色表应作为协议附件显式维护——这正是理赔数据建模与影像数据建模在工程习惯上的最大分野。
§2.4 患者人群特征
| 维度 | 描述 |
|---|---|
| 来源 | 四家法定医保公司参保人:AOK Bremen/Bremerhaven、Techniker Krankenkasse(TK)、DAK-Gesundheit、hkk |
| 时间 | 2004 年或以后在参与保司参保者,连续纳入、持续刷新 |
| 年龄 | 全年龄段(Varied),含 10-19 岁青少年等未成年亚组 |
| 性别 | 全部(All) |
| 种族/移民背景 | 理赔数据不含 ethnicity 字段 |
| 就医类型 | 门诊(全科+专科,季度汇总)、住院(逐例精确日期)、药房配药 |
| 社会经济结构 | 中高社会经济状态参保者偏多(>90% 由两家传统保中高人群的保司覆盖);不来梅州因纳入本地保司而结构均衡 |
| 区域分布 | 全德 16 个联邦州均有覆盖,东部前民主德国各州覆盖相对较低 |
参保动态是人群画像的隐变量:参保区间以事件形式记录(入保、退保、死亡、移民出境),一人可有多段参保历史,段间空隙在风险人时计算中必须剔除。换保司的人群系统性更年轻、更健康(反向选择),因此纵向分析中"同一人跨保司"的连续性不能想当然——BIPS 通过四家保司间的协作识别换保者,研究者拿到的项目提取集中此信息以联结键形式呈现,跨年队列定义时须显式处理。
§2.5 临床价值
对临床与监管决策而言,GePaRD 的价值链条是"真实世界暴露 → 结局 → 监管行动"。其研究结论已进入德国药品监管沟通:复方口服避孕药 VTE 研究结果被 BfArM 纳入《药品安全公报》,并支撑"优先处方低风险孕激素制剂"的行业培训材料;妊娠期用药安全方法学则让致畸信号(如丙戊酸)可在上市后数据中复现,为育龄人群处方决策提供证据。对 AI 开发者,价值在于:这是一片可以反复验证"编码→疾病"推断是否成立的人群级试验场。
此外,BIPS 长期与监管机构、医学科研界保持方法学对话,AI 项目若能挂靠此类研究议程,获批与合作推进都会更顺畅。
§2.6 金标准/参考标准
GePaRD 无影像/病理金标准,其"参考标准"体系由三类验证研究构成:
| 参考标准 | 划分方式 | 标注方式 | 标注者 | 性质 |
|---|---|---|---|---|
| 死亡率验证 | 按年龄/性别/地区分层比对 | 与联邦统计局(FSOG)及不来梅死亡登记比对 | 官方统计与死亡登记 | 人群级外部金标准 |
| 妊娠结局算法 | 2006-2014 纵向妊娠记录 | 20 份纵向妊娠档案专家评审对照算法判定 | 临床专家 | 结局类型+日期一致率 95% |
| CV 结局算法 | 2016-2017 事件队列 | 伪匿名患者画像(时间轴表格摘要)逐例评审 | 医学评审员 | AMI/卒中/心血管死亡算法 PPV 验证 |
使用这些参考标准时的三点注意:其一,一致性指标针对算法整体而非逐条编码,研究者自建表型不能直接继承 95% 的数字;其二,画像评审的 PPV 是在特定年代、特定编码目录下测得的,跨年应用须重新抽样验证;其三,死亡率验证是人群级对标而非个体级联结(无死亡原因逐例比对),对死亡原因的研究(如心血管死亡)只能依赖出院原因编码加复合定义。
§3 数据集规格
§3.0 版本抉择矩阵
GePaRD 不发布版本号(项目制提取、年度刷新)。"版本抉择"在此语境下转化为数据源与数据年份切片的选择:
| 你的需求 | 推荐数据源 | 规模 | 理由 |
|---|---|---|---|
| 与 BIPS 合作做药物安全/筛查因果研究 | GePaRD(2004 年起全部数据年) | 约 2,500 万人 | 验证文献最厚、BfArM 认可、TTE 方法学支持 |
| 需要德国理赔数据做平行验证 | BARMER 数据仓库(2006-2017 提取) | 约 1,260 万人 | 单保司纵深数据,TTE 协议中的伙伴库 |
| 需要全科诊疗细节(化验、吸烟等) | IQVIA Disease Analyzer | 数百万人 | 诊所 EHR 抽样,含临床测量细节 |
| 需要全人群覆盖的欧洲理赔研究 | 法国 SNDS / 英国 CPRD | 6,000 万+级 | 全人群框架且有公开申请通道 |
| 孕期药物安全跨国研究 | IMI ConcepTION 联盟数据 | 多库联合 | GePaRD 已登记 ConcepTION CDM 映射 |
矩阵缺位之处同样是信息:若你的需求是"公开下载、开箱即训",GePaRD 不在候选之列(见 §6.0);若需求是"德国全人群药物安全因果证据",它是默认答案。选型前先回答"我的结论要说服谁"——说服监管,选 GePaRD 这类有验证链的闭库;说服算法社区跑分,选有公开基准的库。
§3.1 模态详细说明
GePaRD 的单一模态是结构化行政理赔,由四个逻辑块构成:
- 人口学主数据(master data):出生年、性别、居住地区、参保起止;职业键(Tätigkeitsschlüssel,依 SGB IV §28a 由雇主每年传输)可推导教育/职业状态,家庭 ID 可联结同保家庭成员以近似个体社会经济状态。
- 门诊块(outpatient):全科与专科就诊有精确日期;诊断按季度汇总编码(医生每季度为所治疗疾病编码一次),且必须标注诊断确定性——确诊(confirmed)、疑似(suspected)、状态 post(status post)、排除(excluded);门诊服务与免疫接种用 EBM 码;可报销的化验与体格检查有记录(但无结果数值)。
- 住院块(inpatient):入院/出院日期、入院诊断、主/次出院诊断(ICD-10-GM ≥4 位)、诊断与手术操作(OPS 码)、出院原因(含死亡)。
- 配药块(drug dispensations):医生处方且在药房配药、由医保报销的药物,ATC 编码(德国修改版),含处方与配药日期、包装数、处方医生专科、中央药品编号(PZN,可关联商品名/规格/DDD/给药途径)。
§3.2 样本量拆分
| 层级 | 数量 | 说明 |
|---|---|---|
| 累计参保人 | 约 2,500 万 | 2004 年或以后在参与保司参保者 |
| 每数据年活跃个体 | 约 1,700 万 | 约为德国总人口(约 8,300 万)的 20% |
| 参与保司 | 4 家 | AOK Bremen/Bremerhaven、TK、DAK-Gesundheit、hkk |
| 两家主力保司占比 | >90% | 传统保中高社会经济人群的两家保司构成主体 |
| 妊娠结局(2006-2014) | 1,235,261 例 | 活产占 94% |
| 妊娠(2006-2016,VPA 研究) | 1,271,384 例 | 12-50 岁女性 |
| COC 新用药者队列(2005-2017) | 10-19 岁女性 | 每例 VTE 匹配 10 名对照 |
两个口径必须分清:"累计约 2,500 万"是二十年间曾在四家保司参保的去重人数(含已脱保、死亡、移民者),"每数据年约 1,700 万"是任一数据年内有参保记录的活跃人数。功效计算、 prevalence 估计用后者;历史暴露追溯用前者。另注意"约 20% 德国人口"是活跃口径对全国人口的比值,不能与累计口径混用,否则会得出"四分之一德国人都在库中"的错误表述。
§3.3 数据格式详情
| 层面 | 格式 | 说明 |
|---|---|---|
| BIPS 内部 | 关系数据库(项目制) | 伪匿名化参保人主键 + 事件表结构 |
| 项目提取集 | CSV / SAS / Stata | 按获批项目生成,随项目协议定义表结构 |
| 互操作 | ConcepTION CDM | EMA 目录登记已映射;ETL 周期 12 个月 |
| 编码体系 | ICD-10-GM / OPS / EBM / ATC | 诊断、操作、门诊服务、药物四套编码 |
格式层面的实用提示:项目提取集若为 SAS/Stata 格式,安全区内一般预装对应读取器(或先转 CSV/Parquet);编码目录版本须在提取时向 BIPS 索要当年快照,I/O 管道从第一天起就按"表 + 编码年"双键管理,避免后期版本归属混乱。
§3.4 存储大小
全库体量未公开(BIPS 内部关系数据库,不对外分发)。参考量级估算:每数据年约 1,700 万活跃个体 × 四类事件表(门诊季度诊断、住院事件、配药、服务),单数据年研究提取集通常在 GB 量级;跨 2004-2023 全时段的联合分析集显著更大。获批项目获取的是项目专属提取集而非全库,故磁盘规划应以项目协议中约定的年份窗口与人群为准,预留 3-5 倍冗余用于派生中间表。
体量估算的经验规则:配药表约为参保人数 × 每年 5-15 条事件;门诊诊断表随年龄与患病谱浮动更大;克隆-删失加权后分析集膨胀 5-20 倍属正常。安全区内磁盘配额由 BIPS 分配,超限的中间表应即时落 Parquet 并清理 CSV 原始副本之外的临时文件。
§3.5 标注方式
理赔数据无人工疾病标注,所有"标签"均为编码衍生(弱监督)表型:诊断算法(如 AMI=住院主诊断 I21-I22;卒中=I61/I63/I64)、妊娠结局算法(编码序列+孕程校验)、暴露算法(PDC 比例覆盖天数、DDD 估算供给时长)。算法质量依赖验证研究:GePaRD 的妊娠算法与专家评审一致率 95%,CV 结局算法经患者画像评审验证,死亡率经外部统计比对。
弱监督表型用于 AI 训练标签时的三重折扣:标签噪声与编码行为相关(非随机),下游模型会把"编码习惯"学成"疾病规律";PPV 高不代表敏感度高,漏诊者以未标注形式混入阴性集,估计流行率时系统性偏低;因此凡以 GePaRD 标签训练的模型,其评估集亦应来自同源编码——跨库迁移评估(如在 CPRD 上测试)会叠加编码制度差异,须单独声明。
§3.6 标注者资质
算法验证中的"标注者"为两类:临床专家(妊娠结局研究中的 case profile 评审)与医学评审员(CV 结局研究中按标准化流程阅读伪匿名患者画像)。评审在 BIPS 安全区内完成,不接触原始病历。
评审流程的规范化程度接近临床试验的终点裁定:画像按统一模板呈现(时间轴表格摘要),评审者对算法判定结果设盲,分歧 cases 由第二评审员复核。若你的项目需要类似验证(自建表型 PPV),这套模板化、设盲、复核的流程设计可直接借鉴,BIPS 的已发表论文对模板字段有完整描述。
§3.7 数据采集时间范围
数据自 2004-01-01 起连续采集;每数据年刷新一次;EMA 目录登记最近数据刷新为 2023-02-28;记录在库内无限期保存。发表文献中的分析窗口随项目而异(如妊娠算法 2006-2014、VPA 研究 2006-2016、COC 研究 2005-2017、CV 验证 2016-2017)。
刷新节奏对纵向设计的隐含约束:死亡与退保信息的"终态确认"存在滞后,最近数据年的事件计数在下一轮刷新前应视为临时的;跨刷新批次比较时间趋势时,统一使用同一批次快照是防止"版本抖动"的底线做法。
§3.8 地域覆盖
德国全境 16 个联邦州均有覆盖。结构性特点:两家主力保司在全国范围参保;AOK Bremen/Bremerhaven 与 hkk 使不来梅州覆盖最深且人群社会经济结构最均衡;前民主德国各州覆盖相对较低(历史上年轻健康人群更换保司的筛选效应),死亡率研究中该区域与全国统计的偏差也更明显。
地域字段的分析价值在"州/空间规划区"级可用,县以下不可用(小单元格抑制);跨州迁移(搬家换保司)会体现为居住地更新滞后约一个季度,做迁移相关研究时把该滞后纳入测量误差预算。
§3.9 采集设备规格
不适用(行政理赔数据,无采集设备)。与"测量"相关的规格是编码粒度:诊断 ICD-10-GM ≥4 位;门诊诊断按季度聚合、门诊就诊有精确日期;住院事件全字段精确日期;药物至 ATC+PZN 级(可回溯规格与 DDD)。
§3.10 深度溯源链
参保人就医(门诊/住院/药房)
│ 产生报销申请
▼
法定医保公司理赔系统(AOK Bremen/Bremerhaven / TK / DAK-Gesundheit / hkk)
│ 按 SGB 数据传输条款向 BIPS 提供理赔数据
▼
BIPS 数据工程(伪匿名化、主数据整合、逐年入库)
│ 项目申请:BIPS → 保司批准 → 主管当局(如联邦社会保障局)依 SGB X §75 批准
▼
获批项目专属提取集(BIPS 员工在安全区内分析)
│ 发表前须经保司批准
▼
同行评审论文 / 监管报告(EMA、BfArM)
§4 数据结构详解
§4.0 目录结构预览
GePaRD 无公开下载,以下为获批项目典型研究提取集的目录布局示意(表内容基于公开论文描述的数据块整理;实际表名与字段以项目协议为准):
gepard_project_extract/
├── README.txt # 项目协议约定的年份窗口、人群、表清单
├── data/
│ ├── insurants.csv # 参保人主数据:伪匿名 ID、出生年、性别、居住地区
│ ├── insurance_periods.csv # 参保起止区间(事件:入保/退保/死亡/移民)
│ ├── outpatient_visits.csv # 门诊就诊:精确日期、医生专科
│ ├── outpatient_diagnoses.csv # 门诊诊断:季度聚合、ICD-10-GM、确定性标记
│ ├── outpatient_services.csv # 门诊服务/操作/免疫:EBM 码、日期
│ ├── hospitalizations.csv # 住院:入/出院日期、入院诊断、主/次诊断、OPS、出院原因
│ ├── drug_dispensations.csv # 配药:处方/配药日期、ATC、PZN、包装数、处方医生专科
│ ├── occupation_key.csv # 职业键(教育/职业状态推导,SGB IV §28a)
│ └── family_id.csv # 家庭 ID(家庭成员联结)
├── reference/
│ ├── icd10gm_2023.txt # ICD-10-GM 编码目录
│ ├── ops_catalog.txt # OPS 手术操作目录
│ ├── ebm_catalog.txt # EBM 门诊服务目录
│ └── atc_pzn_ref.csv # PZN → ATC/商品名/规格/DDD 参考表
└── docs/
└── project_data_dictionary.pdf # 项目专属数据字典(不公开)
提取集的表清单不是标准化的:协议中写了哪些数据块,提取集就只有哪些表。这意味着同一个 GePaRD,不同项目拿到的"目录树"可能差异极大—— prenatal 研究可能没有住院表,筛查研究可能没有配药表。上图的 reference/ 目录存 ATC-PZN 参照表与编码目录快照,属于多数项目都会配的公共件。设计可复用代码库时,把"表是否存在"做成显式断言而非隐式假设。
§4.1 DAIMS 标准化字段描述表
下表以核心事件表的最小字段集说明 GePaRD 的数据形态(字段名为整理示意;每列遵循 DAIMS 八要素):
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| person_id | 文本 | 伪匿名参保人主键 | P00004217 | 队列联结、纵向建模 | 一人可有多段参保区间 | 无缺失 | 项目内唯一 |
| year_of_birth | 整数 | 出生年(无精确生日) | 1978 | 年龄分层、时变协变量 | 年龄推算误差 ≤1 岁 | 无 | 1900-当前年 |
| sex | 分类 | 性别 | F | 分层/效应修饰 | 极少量登记误差 | 无 | M / F |
| region | 分类 | 居住地区(联邦州/空间规划区) | HB | 地区混杂、SOC 近似 | 搬迁更新滞后 | 无 | 德国行政区划 |
| insurance_start/end | 日期 | 参保起止 | 2004-01-01 / 2023-12-31 | 风险人时计算 | 段间空隙需显式处理 | 无 | 2004-至今 |
| quarter | 季度 | 门诊诊断归属季度 | 2015Q3 | 时序对齐(粗粒度) | 季度内时序不可分辨 | 无 | 2004Q1-至今 |
| icd_code | 文本 | ICD-10-GM(≥4 位) | I63.4 | 结局定义、表型 | 完整性取决于就诊行为 | 无显式"未知" | ICD-10-GM 全表 |
| certainty | 分类 | 门诊诊断确定性(强制) | G(gesichert,确诊) | 过滤排除/疑似码 | 依赖医生编码习惯 | 无 | 确诊/疑似/状态 post/排除 |
| ops_code | 文本 | 住院手术操作 | 5-920.0 | 操作识别 | 编码粒度逐年变化 | 无 | OPS 全表 |
| ebm_code | 文本 | 门诊服务/操作/免疫 | 31623 | 筛查服务识别 | 目录更新致跨年不可比 | 无 | EBM 全表 |
| atc_code | 文本 | 药物 ATC(德国修改版) | G03AA07 | 暴露定义 | 仅含报销配药(无 OTC/住院药) | 无 | ATC 全表 |
| pzn | 文本 | 中央药品编号 | 12345678 | 关联规格/DDD/商品名 | 同药多包装 | 无 | PZN 目录 |
| dispensed_ddd | 浮点 | 配药量折算 DDD 数 | 28.0 | 供给时长估算(DDD×1.2 修正) | 个体剂量差异 | 无 | >0 |
| discharge_reason | 分类 | 出院原因(含死亡) | T(死亡) | 死亡结局 | 院外死亡完备性需敏感性分析 | 无 | 编码目录 |
| payer_id | 分类 | 保司标识 | TK | 按保司敏感性分析、换保识别 | 四家保司构成随年份变动 | 无 | 参与保司列表 |
| occupational_key | 文本 | 职业键(在职者,SGB IV §28a) | 6 位分类码 | SOC 代理、职业暴露 | 退休者/家庭成员无此键;2011 年分类改版 | 部分缺失 | 官方分类目录 |
| household_id | 文本 | 家庭联结键(示意) | F000217 | 家庭组分析、职业键回填 | 仅特定年份起可靠 | 部分缺失 | 项目内唯一 |
| physician_specialty | 分类 | 门诊医生专科方向 | 17(内科) | 就医行为、专科确认判据 | 一季度多医生时归属模糊 | 无 | 医生 specialty 目录 |
§4.2 标签分布统计
GePaRD 无监督标签;以下为已发表的算法衍生"标签"分布参考:
| 算法标签 | 分布 | 来源 |
|---|---|---|
| 妊娠结局类型(2006-2014,n=1,235,261) | 活产 94%(早产 10%、足月 78%、过期 12%);不合理结局序列 0.03% | Wentzell et al., 2018 |
| 妊娠 VPA 关键窗暴露(2006-2016) | 668 / 1,271,384(0.053%) | Haug et al., 2023 |
| 门诊诊断确定性 | 四分类强制编码:确诊/疑似/状态 post/排除 | 数据结构事实 |
这张表透露了弱监督标签的一个独特优势:GePaRD 的"标签分布"不是从标永续的静态标注入库,而是随研究逐年可复算的。这意味着 AI 团队可以用同一套算法定期重建标签,观察其在不同数据年上的稳定性——标签漂移检测在这里比影像库中更容易做,但前提是把算法实现与论文描述逐字对齐,任何"顺手优化"都会让可复算性失效。
§4.3 关键字段描述性统计
- 人群覆盖:每数据年约 1,700 万活跃个体(约德国人口 20%),四家保司合计累计约 2,500 万。
- 年龄结构:接近德国法定医保人群金字塔;妊娠研究中孕妇中位年龄 32 岁(Q1 28,Q3 35)。
- 社会经济:>90% 由两家保司覆盖,中高 SOC 偏多;不来梅州结构最均衡。
- 死亡率:年龄标化死亡率略低于全国(SOC 差异可解释),住院死亡占比与全国吻合。
§4.4 数据层级关系
参保人 person_id(主数据,一人一行)
└── 参保区间 insurance_period(一人多段,含入保/退保/死亡/移民事件)
├── 门诊就诊 outpatient_visit(精确日期)
│ └── 季度诊断 outpatient_diagnosis(季度聚合 + 确定性标记)
│ └── 季度服务 outpatient_service(EBM 码 + 日期)
├── 住院 hospitalization(入/出院精确日期)
│ └── 住院诊断(主/次)+ OPS 操作 + 出院原因
└── 配药 drug_dispensation(处方/配药精确日期,ATC + PZN + DDD)
关键特征:一人多事件的长格式事件表;门诊诊断挂在"季度"粒度而就诊/住院/配药挂"日期"粒度——层级建模时须显式区分两种时间精度。
跨表联结的四条工程要点:联结主键只有伪匿名 person_id,禁止任何身份再识别尝试(法律红线);参保区间表是一切分析的底座——任何事件都必须先与其内联结(inner join)到有效参保区间上,否则会把脱保期间的事件误入分析;配药表与门诊诊断表基数最大(人×年×数百万行级),联结前先按年份分块;住院表与主数据联结后应立即派生"住院期间"区间变量,供 immortal time 校验与院内事件识别复用。
§4.5 缺失值情况与信息性缺失编码
GePaRD 的缺失几乎全部是结构性缺失(字段在理赔体系内就不存在),而非随机缺失:
| 缺失内容 | 性质 | 对 AI 建模的含义 | 检测/缓解 |
|---|---|---|---|
| OTC 自购药 | 结构性缺失 | “无配药记录”≠“未暴露” | 敏感性分析、结局窗错位 |
| 住院期间用药(单抗等昂贵药除外) | 结构性缺失 | 住院暴露无法直接测量 | OPS 码间接识别给药 |
| 化验结果数值 | 结构性缺失 | 无 HbA1c/血脂等连续协变量 | 以诊断码/配药代理 |
| 生活方式(吸烟/饮酒/BMI) | 结构性缺失 | 经典混杂不可用 | 肥胖/酒精相关 ICD 码、职业键教育代理 |
| 精确出生日期 | 结构性缺失 | 只有出生年,年龄误差 ≤1 岁 | 出生年+参保年近似 |
| 门诊诊断季度内日期 | 结构性聚合 | 诊断日期=季度而非就诊日 | 单次就诊季度可间接定位 |
| 职业键(退休者/家庭成员) | 部分缺失 | SOC 估计不全 | 家庭 ID 联结回填、历史年份回溯 |
信息性缺失的建模纪律:凡"缺失即信息"的字段(如配药表无记录可能意味着未用药也可能意味着 OTC 自购),一律构造显式缺失指示变量而非静默填充,让下游模型自行学习"无记录"的语义;派生连续代理(如以诊断码计数的 Charlson)时,代理得分与真实临床变量的对应关系应在协议中写明,审稿与保司评审都会追问这一层。
§5 数据划分与使用建议
§5.1 官方数据划分
无官方划分。GePaRD 每个研究都是按项目独立定义队列,不存在机器学习意义上的 train/val/test 官方切分。
这不是缺陷而是数据性质使然:理赔库的分析单位是"研究问题定义的队列"而非固定样本,同一人可同时进入多个互不相干的项目队列。移植 MIMIC-III 式"官方 benchmark"预期的研究者,应在立项阶段就与 BIPS 明确自己队列的入选-排除标准——这份标准本身会写进保司审批文件,相当于你自建了"官方划分"。
§5.2 推荐划分策略
- 按参保人划分(person-level split):同一人的所有事件进入同一侧,禁止按事件行打散——否则同一个人跨侧泄漏。
- 时间外推验证(temporal validation):以早期数据年训练(如 2004-2012)、后期验证(2013-2018),模拟真实前瞻部署;编码体系随年份变化(2011 职业键改版、ICD-10-GM 年度更新)正是检验稳健性的自然压力测试。
- 按保司敏感性分析:两家主力保司贡献 >90% 人群,建议报告"全体 vs 仅主力保司"双口径结果,检验结论对保司构成的依赖。
- 区域留一:以不来梅(结构最均衡)为验证子集,可部分校正 SOC 偏倚方向。
- 阴性对照前置:训练前先跑阴性对照暴露/结局(如"与暴露不可能相关的编码组合"),若模型仍能"预测"出关联,说明特征管道有泄漏或混杂代理未清除。
- 冻结提取集快照:划分前对项目提取集做行数与哈希存证;任何因数据刷新导致的重新划分都视为新实验,旧结果不得沿用。
§5.3 数据泄漏风险防御
| 泄漏源 | 机制 | 防御 |
|---|---|---|
| 指数日期后信息 | 暴露判定窗与随访窗重叠(immortal time) | TTE 框架:资格核查、分配、随访起点对齐 time-zero;克隆-删失加权 |
| 死亡作为出院原因 | 若基线特征取自住院期内,出院死亡即泄漏 | 特征窗口严格截止于入院/确诊前 |
| 季度诊断回填 | 医生可能以追溯性编码记录既有诊断 | 以确定性标记(确诊 vs 状态 post)区分新发与既往 |
| 特征工程中的全期聚合 | 用整个观察期均值预测期内结局 | 仅用指数日期前窗口聚合 |
§5.4 交叉验证建议
结局事件(如 VTE、死亡)在人群级数据中仍属少数类,建议:分层 5 折交叉验证(保持事件率);嵌套 CV 做超参选择;对季度聚合的时间粒度,折叠划分粒度取"参保人 × 起始年"以避免同一季度跨折。
两个补充提醒:极少数类结局(事件率 <0.1%)下,交叉验证的方差可能大于模型间差异,此时更可靠的做法是固定一个大验证集(如最近三个数据年)并报告自助置信区间;嵌套 CV 的内层选择若涉及阈值调优(如 PDC >0.5 的暴露判定),阈值属于设计参数,应由临床与方法学依据事先固定,而不是交给内层 CV 优化——否则等于把研究假设交给了数据。
§5.5 外部验证
- 国内:与 BARMER 数据仓库(约 1,260 万人)平行分析(如乳腺癌筛查 TTE 协议中两库独立分析,因数据保护不合并)。
- 跨国:VTE 研究与丹麦、英国同类研究对照风险排序;VPA-脊柱裂与已确立的致畸文献量级对照(RR≈12-25)。
- 统计口径:死亡率与联邦统计局按年龄/性别/地区/年度对标。
- 算法移植复算:把已验证结局算法原样移植到外部理赔库复算分布与一致率(无个体级联结时比较汇总指标),是预算最低的跨库验证方式。
§6 AI 就绪指南
§6.0 云端快速启动
不适用,且这是本数据集最重要的"负向规格":GePaRD 数据不出 BIPS 安全区。不存在 S3 桶、BigQuery 镜像或 HuggingFace 数据集。合作模式下,你在 BIPS 提供的分析环境中工作(或签署访问科学家协议后驻场)。因此本节的"快速启动"是合作流程启动清单:
- 明确科学问题与统计功效预估(约 2,500 万人背景池,罕见事件可期)。
- 邮件联系 BIPS(gepard@leibniz-bips.de)陈述项目设想与资助情况。
- 与 BIPS 共同起草研究协议(目标人群、数据年窗口、变量清单、分析计划)。
- BIPS 向参与保司申请项目批准;保司再向主管当局(如联邦社会保障局)申请 SGB X §75 授权。
- 获批后签署合作协议(第三方为访问科学家协议),数据提取与安全区访问开通。全流程常需数月,发表前还需保司批准。
时间与预算的现实预期:从首次接洽到拿到提取集,常态为 6-12 个月(保司逐一批准与主管当局授权不可并行催办);协议中变量清单每增加一张表,审批与提取周期相应延长;资助方排期应把"数据获取期"单列,切勿按公开数据集的"下载即用"节奏立项。提交前把统计分析计划(SAP)写到位——保司审批通过的 SAP 之后不可随意扩窗,改动需重新走流程。
§6.1 快速上手(合作模式下的分析环境)
以下代码假设你已在 BIPS 安全区内获得项目提取集。目录结构预期见 §4.0;
data_root指向提取集根目录;最小可用子集为insurants.csv+drug_dispensations.csv(可完成暴露定义与队列构建)。
# ============================================================
# 环境预期:BIPS 安全区内分析工作站(Python 3.10+,pandas/duckdb)
# 目录结构:gepard_project_extract/
# ├── data/insurants.csv, drug_dispensations.csv, ...
# └── reference/atc_pzn_ref.csv
# data_root 与文件名的拼接关系:data_root / "data" / "<table>.csv"
# 最小可用子集:insurants + drug_dispensations(暴露→队列)
# ============================================================
from pathlib import Path
import pandas as pd
data_root = Path("/secure/gepard_project_extract") # 项目提取集根目录
# 1) 主数据:仅保留项目协议年份窗口内有参保、存活、居德者
ins = pd.read_csv(data_root / "data" / "insurants.csv", dtype={"person_id": str})
# 2) 配药表:ATC 暴露(示例:低剂量左炔诺孕酮复方避孕药 G03AA 系)
drugs = pd.read_csv(
data_root / "data" / "drug_dispensations.csv",
dtype={"person_id": str, "atc_code": str, "pzn": str},
parse_dates=["prescription_date", "dispensation_date"],
)
cohort_drugs = drugs[drugs["atc_code"].str.startswith("G03AA")]
# 3) 新用药者定义(借鉴 Schink 2022 设计):首次配药前 365 天无同组配药
first = cohort_drugs.groupby("person_id")["dispensation_date"].min()
print(f"提取集参保人: {len(ins):,} | 同组配药者: {first.size:,}")
拿到提取集的第一周,建议先跑一遍体检清单再谈建模:核对每张表的行数与协议约定是否一致;检查 person_id 是否与参保区间表一一闭合(有无"孤儿事件");统计各表的年份分布与缺失峰值(某年突降往往意味着编码目录变更或数据补录滞后);对确定性四分类的比例做 sanity check(排除码占比异常升高通常提示编码行为变化);抽查 20 个配药记录的 ATC-PZN 关联是否指向预期药物。这份清单成本极低,却能在建模前暴露大部分提取集级别的意外。
§6.2 数据获取流程
| 步骤 | 内容 | 关键约束 |
|---|---|---|
| 1. 项目洽谈 | 联系 gepard@leibniz-bips.de,明确科学问题、资助、时间表 | 仅限正式研究项目 |
| 2. 研究协议 | 与 BIPS 共同撰写目标人群/变量/分析计划 | 协议即后续提取规格 |
| 3. 保司批准 | BIPS 向 4 家保司逐一申请项目许可 | 依 SGB X §75:公共研究利益须显著高于隐私利益 |
| 4. 主管当局批准 | 保司向主管当局(如联邦社会保障局)申请 | 流程可长达数月 |
| 5. 合作/访问科学家协议 | 第三方签署后可在合作框架内使用 | 数据不出 BIPS 安全区 |
| 6. 提取与分析 | BIPS 生成项目提取集 | 项目制:表结构与年份窗口随项目而定 |
| 7. 发表 | 论文发表前须经保司批准 | 依《社会法典》规制,无个体知情同意 |
从历史退回案例归纳,申请材料的三类常见短板:科学问题的公共健康价值论证不足(SGB X §75 的权衡核心,纯商业内部建模难获批);变量清单与科学问题脱节(要么遗漏关键结局定义字段,要么"顺手多要"引发必要性质疑);分析计划缺少对数据局限的处理预案(如未写明 OTC 暴露错分的敏感性分析)。立项前对照本条目 §4.5 与 §7.1 逐项自查,可显著提高一次通过率。
§6.3 预处理 Pipeline
理赔数据预处理的三大任务是暴露量化、结局定义、时序对齐。以下示例实现论文中广泛使用的 PDC(proportion of days covered)暴露算法与门诊诊断过滤:
import numpy as np
import pandas as pd
# ---------- A. 暴露量化:PDC(借鉴 GePaRD 抗糖尿病药研究) ----------
# 论文做法:以配药 DDD 数估计供给天数(DDD × 1.2 修正老年低剂量),逐年算 PDC
drugs["days_supply"] = drugs["dispensed_ddd"] * 1.2 # DDD → 天数(经验修正)
drugs["year"] = drugs["dispensation_date"].dt.year
def yearly_pdc(g: pd.DataFrame) -> pd.Series:
"""按年合并重叠供给区间,返回 person-year 级 PDC"""
out = {}
for y, gy in g.groupby("year"):
gy = gy.sort_values("dispensation_date")
intervals = []
for _, r in gy.iterrows():
start = r["dispensation_date"]
end = start + pd.Timedelta(days=r["days_supply"])
if intervals and start <= intervals[-1][1]: # 重叠供给合并
intervals[-1] = (intervals[-1][0], max(intervals[-1][1], end))
else:
intervals.append((start, end))
covered = sum((e - s).days for s, e in intervals)
out[y] = min(covered / 365.25, 1.0)
return pd.Series(out)
pdc = drugs.groupby(["person_id", "atc_code"]).apply(yearly_pdc)
# 暴露判定(论文阈值):PDC>0.5 当年暴露;0.25<PDC≤0.5 且前后年 >0.5 亦视为暴露
# ---------- B. 结局定义:门诊诊断确定性过滤 ----------
# 关键:排除码(excluded)与疑似码(suspected)绝不能当患病处理
dx = pd.read_csv(data_root / "data" / "outpatient_diagnoses.csv",
dtype={"person_id": str, "icd_code": str})
CONFIRMED = {"G"} # gesichert/确诊(其余为疑似/状态/排除)
stroke_confirmed = dx[
dx["icd_code"].str.startswith(("I61", "I63", "I64"))
& dx["certainty"].isin(CONFIRMED)
]
# 住院结局优先(高确证):主诊断 I21/I22 = AMI;I61/I63/I64 = 卒中
# 门诊-only 卒中需附加条件(如后续抗凝配药/影像服务码)以避免误分类
# ---------- C. 时序对齐:季度诊断 → 日期级分析窗 ----------
# 门诊诊断仅到季度;若该季度只有 1 次就诊,可将诊断归属就诊日(论文策略)
dx["quarter"] = dx["quarter"].astype(str)
visits_per_quarter = (drugs.assign(quarter=drugs["dispensation_date"].dt.to_period("Q").astype(str))
.groupby(["person_id", "quarter"]).size())
dx["_vcount"] = dx.set_index(["person_id", "quarter"]).index.map(visits_per_quarter)
dx["date_resolved"] = np.where(dx["_vcount"] == 1, "exact", "quarterly")
# "exact":诊断日期可间接定位到就诊日;"quarterly":保持季度粒度
# ---------- D. 混杂协变量构造(理赔研究通行做法,指数日期前窗口) ----------
# 无化验值/生活方式时,混杂控制依赖三类代理:
# 1) 合并症:Charlson/Deyo 指数的 ICD 改编版(住院全码 + 门诊确诊码)
# 2) 医疗资源利用强度:既往年门诊就诊数、住院次数与床日(就医行为代理)
# 3) 既往用药史:同 ATC 二级类的既往配药种类数(处方者倾向代理)
CHARLSON_MAP = { # 示意:Deyo 改编版节选,实际实现须查完整映射表
"I21": 1, "I21.9": 1, # 心肌梗死(既往史,须排除指数事件本身)
"I50": 1, # 心力衰竭
"I63": 1, # 脑血管病
"N18": 2, # 中重度肾病
"C34": 2, # 实体瘤
}
def charlson_at(dx_window: pd.DataFrame, index_date) -> int:
"""对指数日期前的诊断窗口计 Charlson 权重和;门诊仅计确诊码"""
g = dx_window[(dx_window["date"] < index_date) & (dx_window["certainty"] == "G")]
weights = []
for prefix, w in CHARLSON_MAP.items():
if g["icd_code"].str.startswith(prefix).any():
weights.append(w)
return sum(weights)
def utilization_features(enrollee_year: pd.DataFrame) -> pd.DataFrame:
"""既往医疗资源利用:就医频率本身承载健康状况信息"""
return enrollee_year.assign(
n_outpatient_quarters=lambda d: d["quarter_dx_count"], # 有诊断的季度数
n_hospitalizations=lambda d: d["hosp_count"],
n_dispensings=lambda d: d["drug_count"],
prior_drug_variety=lambda d: d.groupby("person_id")["atc_l3"].transform("nunique"),
)
§6.4 框架加载
以 PyTorch 构建患者级时序数据集(预测暴露后不良事件)。代码超过 30 行,折叠展示:
<details>
<summary>展开:GePaRD 患者-季度时序 Dataset 完整代码</summary>
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
# ---------- 构建 person-quarter 面板特征 ----------
# 输入:主数据 + 配药 + 门诊诊断(已过滤确定性)+ 住院(日期级)
# 输出:每人按季度排序的特征序列 + 结局标签(示例:暴露后 90 天内住院结局)
LOOKBACK = 8 # 用前 8 个季度预测
LABEL_WINDOW_DAYS = 90
def build_panel(ins: pd.DataFrame, dx: pd.DataFrame, drugs: pd.DataFrame,
hosp: pd.DataFrame) -> pd.DataFrame:
panel = []
for pid, g in drugs.groupby("person_id"):
g = g.sort_values("dispensation_date")
idx_date = g["dispensation_date"].iloc[0] # 指数日期 = 首次暴露
hist = dx[(dx["person_id"] == pid)]
quarters = pd.period_range(idx_date - pd.DateOffset(years=2),
idx_date, freq="Q").astype(str)
f = pd.DataFrame({
"n_dx": [hist[hist["quarter"] == q].shape[0] for q in quarters],
"n_dx_confirmed": [hist[(hist["quarter"] == q) &
hist["certainty"].isin(CONFIRMED)].shape[0]
for q in quarters],
"n_disp": [((g["dispensation_date"].dt.to_period("Q").astype(str)) == q).sum()
for q in quarters],
"n_atc_classes": [g[g["dispensation_date"].dt.to_period("Q").astype(str) == q]
["atc_code"].str[:3].nunique() for q in quarters],
}).fillna(0.0)
# 标签:指数日期后 LABEL_WINDOW_DAYS 内是否有住院
y = int(hosp[(hosp["person_id"] == pid) &
(hosp["admission_date"] > idx_date) &
(hosp["admission_date"] <= idx_date +
pd.Timedelta(days=LABEL_WINDOW_DAYS))].shape[0] > 0)
if len(f) >= LOOKBACK:
panel.append({"person_id": pid, "x": f.tail(LOOKBACK).values, "y": y})
return pd.DataFrame(panel)
class GePaRDDataset(Dataset):
"""患者级时序分类数据集:x = [LOOKBACK, F] 特征矩阵,y = 0/1"""
def __init__(self, panel: pd.DataFrame):
self.x = [torch.tensor(r["x"], dtype=torch.float32) for _, r in panel.iterrows()]
self.y = [int(r["y"]) for _, r in panel.iterrows()]
def __len__(self):
return len(self.y)
def __getitem__(self, i):
return self.x[i], self.y[i]
# DataLoader:按参保人划分 train/val(防泄漏),分层保持事件率
# loader = DataLoader(GePaRDDataset(panel), batch_size=256, shuffle=True,
# num_workers=2, pin_memory=True)
</details>
要点:特征窗口严格截止于指数日期(time-zero),标签窗在其后,杜绝前视泄漏;季度特征用计数型聚合,规避门诊日期不可分辨问题。
§6.5 常见坑点
⚠️ 坑点 1:把门诊"排除码/疑似码"当患病(分类:标签理解)
问题:德国门诊编码强制区分确诊(gesichert)、疑似(Verdacht auf)、状态 post(Zustand nach)与排除(ausgeschlossen)。直接把含目标 ICD 码的行当"患病",会把大量"已排除"和"疑似"混入正类。
症状:结局率显著虚高、PPV 验证远低于预期;"排除码"人群甚至可能是筛查阴性者——标签方向性错误。
解决:
- 简单方法:只保留确定性标记为确诊的门诊诊断行;住院诊断默认视为高确证。
- 进阶方法:门诊-only 结局加验证性条件(如诊断后抗凝配药、影像服务码、6-9 个月内死亡等,借鉴胰腺癌算法的复合判据)。
- SOTA 方法:对关键结局做患者画像评审抽样验证(CV 结局算法做法),报告 PPV 及其置信区间,再决定是否用于建模。
参考:Platzbecker et al., 2022, Clin Epidemiol
⚠️ 坑点 2:门诊诊断只有季度粒度,日期级模型"看起来很准"(分类:预处理陷阱)
问题:门诊诊断按季度聚合(医生每季度编码一次),诊断日期实为季度;把季度中点/季度首日当诊断日会让时间对齐误差达 ±90 天。
症状:暴露-结局窗口分析对窗口长度极端敏感;同一患者在"指数日期前后"的诊断归因不稳定;模型时间外推时性能骤降。
解决:
- 简单方法:所有时间特征统一降采样到季度粒度,模型与粒度匹配。
- 进阶方法:利用"该季度仅 1 次门诊就诊则诊断可归属就诊日"的策略恢复部分精确日期(论文策略),并给每条诊断打
exact/quarterly精度标记。- SOTA 方法:以住院(精确日期)锚定结局时间,门诊仅作协变量窗;或用连续时间生存模型(Cox/g-formula)直接消化区间删失。
参考:Xarelto PASS 报告 §9.5.2(HMA-EMA 目录)
⚠️ 坑点 3:“无配药记录”≠“未暴露”——OTC 与住院用药双盲区(分类:偏倚陷阱)
问题:GePaRD 仅含医生处方且医保报销的药房配药;OTC 自购药完全没有,住院期间用药基本缺失(昂贵的单抗等例外)。
症状:把非甾体抗炎药、阿司匹林等 OTC 使用当零暴露;住院期暴露(如造影剂、围术期用药)系统性漏记;暴露-结局关联被稀释或反向。
解决:
- 简单方法:在论文 limitation 中明确暴露定义边界,避免过度解读。
- 进阶方法:以 OPS 码间接识别住院给药(昂贵药物有 OPS 编码);以诊断码代理部分 OTC 适应证行为。
- SOTA 方法:负对照暴露/负对照结局量化残余混杂方向;对暴露定义做错分偏倚的定量偏差分析(COC 研究对吸烟漏报做了同型分析)。
参考:Schink et al., 2022, BJOG
⚠️ 坑点 4:社会经济状态选择偏倚——GePaRD 人群"更健康"(分类:偏倚陷阱)
问题:>90% 研究人群由两家传统上保中高 SOC 人群的保司覆盖;东部各州覆盖偏低且年轻健康者更易换保司。GePaRD 年龄标化死亡率因此低于全国。
症状:把 GePaRD 发病率/死亡率当全德基线率做功效计算或风险标尺会系统性低估;跨区域迁移模型(不来梅→全国)外推失败。
解决:
- 简单方法:所有率报告同时给出"与全国统计的比对区间",声明 SOC 偏倚方向。
- 进阶方法:用不来梅子集(本地保司使结构最均衡)校准区域外推;纳入职业键推导的教育/SOC 作协变量。
- SOTA 方法:按年龄/性别/地区/SOC 做事后加权(raking/post-stratification)对齐联邦统计局边际分布;对东部州单独报告。
参考:Ohlmeier et al., 2016, Pharmacoepidemiol Drug Saf 25:778-784
⚠️ 坑点 5:死亡结局的"部分完备性"——别只看死亡率高低(分类:标签理解)
问题:死亡信息主要经住院出院原因(含死亡)进入数据;院外死亡记录总体与全国吻合但存在欠编码可能。仅以"住院死亡"定义结局会漏掉院外死亡,反之全谱死亡又可能欠计。
症状:死亡预测模型 AUC 虚高(住院死亡与住院特征强耦合);生存分析的死亡人时被截断或重复计数。
解决:
- 简单方法:区分"全因死亡"与"住院死亡"两个结局版本,分别报告。
- 进阶方法:用复合结局定义(死亡前 60 天内心源性住院等,CV 死亡算法做法)明确操作化定义;对出院原因=死亡做内部一致性核查。
- SOTA 方法:与不来梅死亡登记(BreMI)等外部金标准做链接验证或敏感性区间;按 SOC 分层评估死亡欠编码方向。
参考:Ohlmeier et al., 2016、Platzbecker et al., 2022
⚠️ 坑点 6:无处方剂量——DDD×1.2 供给估算的错分(分类:预处理陷阱)
问题:GePaRD 无处方剂量字段,暴露时长只能由配药 DDD 数×1.2(老年人低剂量修正)折算供给天数;个体真实剂量差异会转化为暴露错分。
症状:剂量-反应分析失真;PDC 阈值(0.5 / 0.25+0.5)附近人群的暴露判定不稳定;连续暴露指标出现锯齿状年度跳变。
解决:
- 简单方法:固定沿用文献阈值与 1.2 系数,保证可比性,并声明估算性质。
- 进阶方法:把暴露作时变协变量(逐年 PDC),并对阈值两侧做敏感性分析(如 0.4/0.6 扰动)。
- SOTA 方法:以边际结构模型(IPW)处理暴露错分与时变混杂;对关键药物用 PZN 级包装规格反推剂量上限做界值分析。
参考:抗糖尿病药-胰腺癌参数 g-formula 可行性研究, Clin Epidemiol
⚠️ 坑点 7:immortal time 与 time-zero 错位(分类:评估误用)
问题:观察性用药研究若把"从入保/从确诊"到"首次配药"之间的生存时间计入暴露组,会制造不朽时间偏倚;GePaRD 的因果研究已系统性转向目标试验模拟(GeTTCausal 工作组)。
症状:暴露组死亡率/事件率荒谬地低;HR<1 的"保护效应"在时间对齐修正后消失。
解决:
- 简单方法:暴露组随访起点=首次配药日(time-zero 对齐),资格核查不使用未来信息。
- 进阶方法:克隆-删失加权(clone-censoring weighting)模拟随机化;按季度起点重复模拟多个目标试验(乳腺癌筛查协议做法)。
- SOTA 方法:参数 g-formula 处理时变混杂与时间相关偏倚(抗糖尿病药-胰腺癌研究已验证可行性);克隆+加权+竞争风险联合建模。
参考:GeTTCausal / 乳腺癌筛查 TTE 协议, Clin Epidemiol 2023
⚠️ 坑点 8:项目制提取集——脚本不可复用与发表审批(分类:工程陷阱)
问题:每次获批项目拿到的是按协议定制的提取集:年份窗口、人群、表结构都可能不同;且发表前须经保司批准,代码与数据都不能带出安全区。
症状:上一项目的预处理脚本在新项目上直接崩(列名/编码年份差异);复现材料(数据/代码)无法公开,投稿时审稿人要求共享数据陷入被动。
解决:
- 简单方法:脚本按"读入→适配列名→校验年份"三段式编写,把项目差异收敛到配置文件。
- 进阶方法:在协议阶段即约定发表计划与"结果级共享"口径(汇总统计、合成数据);用容器固化环境,便于 BIPS 端复跑。
- SOTA 方法:遵循 ConcepTION CDM 等通用模型组织提取集,减少跨项目 schema 漂移;论文附"分析代码+合成数据"包过审稿关。
参考:BIPS GePaRD 官方访问说明
§6.6 数据增强
理赔数据无影像式增强,“增强”= 重采样与窗口策略:
| 策略 | 安全 ✅ | 危险 ❌ |
|---|---|---|
| 少数类处理 | 类权重、focal loss、按参保人分层的过采样 | 按"事件行"随机过采样(同人跨训练/验证泄漏) |
| 时间窗 | 多起点重复采样(每季度一个 time-zero,TTE 框架) | 把指数日期前的住院移入标签窗(前视泄漏) |
| 扰动 | 对 PDC 阈值 ±0.1 敏感性分析 | 给 ICD 码加噪声"增广"(编码语义不可扰动) |
| 合成 | 项目批准后发布合成数据/汇总统计 | 未审批将个体级数据派生文件带出安全区 |
两点展开。关于重采样:目标试验模拟框架下,“多起点重复采样”(每个合格 time-zero 克隆一次个体)会让数据集急剧膨胀,内存预算应按克隆后的行数而非参保人数估算,且删失加权发生在克隆之后、模型训练之前——顺序颠倒会产生确定性偏倚。关于合成数据:合成集只能用于管道调试与教学演示,其统计性质(尤其 rare 事件的联合分布)不可作为效应量证据引用;发表用合成数据须经保司与 BIPS 双重批准,并附生成方法与局限声明。
§6.7 模型推荐
| 任务 | 推荐模型 | 理由 |
|---|---|---|
| 药物安全因果效应 | 目标试验模拟 + 克隆加权、参数 g-formula | GeTTCausal 已验证可行,处理时变混杂 |
| 罕见结局信号精化 | 巢式病例对照 + 条件 logistic 回归 | 论文主流设计,1:10 匹配,计算轻 |
| 风险预测(死亡/再入院) | 正则化 Cox、梯度提升(XGBoost/LightGBM) | 表格计数特征首选,可解释性强 |
| 患者时序表征 | RETAIN(注意力 RNN)、季度粒度 Transformer | 与季度诊断粒度天然匹配 |
| 表型算法 | 编码规则算法 + PPV 验证流程 | 先规则后模型,验证文化成熟 |
| 政策评估(筛查/接种) | TTE 多重试验 + 汇总 | 与 BIPS 方法学生态一致 |
为什么不推荐"大模型端到端"?其一,季度诊断串的语义密度远低于临床文本,预训练语言模型的先验在这里反而引入与理赔制度无关的偏置;其二,理赔建模的输出要进入监管与发表流程,梯度提升与 Cox 的特征归因(SHAP/系数)可直接支撑协议中的先验假设检验,而黑箱端到端模型难以通过保司的方法学评审;其三,GePaRD 已发表的验证资产(PPV、一致率)全部针对规则与浅层模型生态,端到端深度模型没有可继承的验证锚点。务实的分工是:浅层模型做效应量与主结果,深度序列模型仅作敏感性探索或表征学习。
§6.8 计算资源需求
| 场景 | 配置 | 说明 |
|---|---|---|
| 项目提取集(百万人级) | 16-32 GB 内存工作站、CPU 即可 | 单数据年队列构建与经典模型 |
| 全时段面板(2,500 万人级) | 128 GB+ 内存或多机 DuckDB/Spark | 按年份分块、列式存储(Parquet) |
| 深度时序模型 | 单张 24 GB GPU | 季度粒度序列短(LOOKBACK≈8),显存压力小 |
| 安全区约束 | 分析在 BIPS 环境内完成 | 不可云端并行、不可外带数据 |
性能瓶颈通常不在算力而在 I/O 与联结基数:配药表与门诊诊断表按人年联结是百万行 × 百万行的操作,优先用 DuckDB 列式扫描或先按年份分块再聚合,避免 pandas 全内存 join;克隆-删失加权会把行数放大一个数量级,膨胀后的数据用 Parquet 落盘按需读取,比驻留内存更稳。
§6.9 评估指标
import numpy as np
from sklearn.metrics import roc_auc_score, brier_score_loss
def eval_binary(y_true, y_score, n_boot=1000, seed=42):
"""二分类结局:判别(AUC)+ 校准(Brier)+ 自助置信区间"""
rng = np.random.default_rng(seed)
auc = roc_auc_score(y_true, y_score)
brier = brier_score_loss(y_true, y_score)
aucs, briers = [], []
n = len(y_true)
for _ in range(n_boot):
idx = rng.integers(0, n, n) # 严格版应按参保人聚类自助
aucs.append(roc_auc_score(np.array(y_true)[idx], np.array(y_score)[idx]))
briers.append(brier_score_loss(np.array(y_true)[idx], np.array(y_score)[idx]))
return {
"AUC": (auc, np.percentile(aucs, [2.5, 97.5])),
"Brier": (brier, np.percentile(briers, [2.5, 97.5])),
}
def ppv_with_ci(n_valid, n_total, z=1.96):
"""表型算法 PPV(如患者画像评审):报告点估计与 Wald 区间"""
p = n_valid / n_total
se = np.sqrt(p * (1 - p) / n_total)
return p, (p - z * se, p + z * se)
配套指标约定:因果研究报告校正 OR/RR/HR 与 95% CI(条件 logistic/Cox);算法研究报告 PPV+敏感性;生存分析报告时间相关 AUC 与校准曲线。
时间相关 AUC 的实现要点:因删失存在(退保、移民、研究窗截断),直接在 t 时刻比较"事件 vs 未事件"会把删失者错误归入未事件组,须用逆概率删失加权(IPCW)修正;季度粒度下 t 通常取指数日期后 90/180/365 天,与配药供给窗或妊娠关键窗的设计终点对齐。校准建议按 SOC 与年龄段分亚组报告,并在文中声明哪些亚组的事件数不足(小单元格抑制规则同样适用于模型评估输出)。
§6.10 MLOps 笔记
- 数据版本:提取集随项目一次性冻结;在 BIPS 环境内对提取集做哈希存证,保证论文复现。
- 编码版本:ICD-10-GM/OPS/EBM 按年份记录目录版本;模型输入管道显式绑定编码年。
- 审批即流程:分析计划前置(保司批准的协议即预注册),发表审批节点纳入项目排期。
- 隐私工程:安全区内日志不落个体级数据;结果输出前做小单元格抑制(<5 事件不呈现)。
- 可移植性:训练代码容器化;跨项目复用层(PDC、确定性过滤、季度对齐)写成带配置的库而非脚本。
- 协变量字典:把 Charlson 映射、ATC 分组、EBM 筛查码清单做成带版本号的 YAML 字典随代码入库,论文附录直接引用字典哈希。
- 失败重跑预案:保司审批有效期有限,管道应支持"审批到期前冻结数据快照、到期后仅复算"的节流模式。
- 文档即合规:安全区内的 README 与运行日志默认视为可审计材料,按"任何人接手都能复跑"的标准写,省去后续合规补录。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 选择偏倚(SOC) | 中高 SOC 参保者偏多(>90% 由两家保司覆盖),死亡率略低于全国 | 高 | 事后加权、不来梅子集校准、SOC 分层报告 |
| 区域覆盖不均 | 东部前民主德国各州覆盖较低、偏差更明显 | 中 | 按州敏感性分析、区域加权 |
| 暴露错分 | 无 OTC/住院用药、无处方剂量(DDD 估算) | 高 | OPS 间接识别、负对照、定量偏差分析 |
| 时间粒度错分 | 门诊诊断季度聚合 | 中 | 住院锚定结局、季度粒度统一建模 |
| 残余混杂 | 无吸烟/饮酒/BMI/化验值 | 高 | 诊断码代理、职业键 SOC、负对照结局 |
| 编码行为偏倚 | 门诊诊断依赖医生每季度编码习惯 | 中 | 确定性标记过滤、复合判据 |
| 就医频率差异 | 就医频繁者编码更密,“看起来更病” | 中 | 医疗资源利用协变量、结局用住院锚定 |
| 新用药者偏倚 | 仅看首发配药会混入不耐受者早期停药 | 中 | 新用药者设计 + 1 年洗脱、意向性 vs 按方案敏感性 |
§7.2 标注质量评估
无人工监督标注。算法表型质量证据链:妊娠结局算法与临床专家评审一致率 95%(结局类型与日期均一致;不合理结局序列仅 0.03%);CV 结局算法经标准化患者画像评审(德国理赔数据上首个同类验证);死亡率经联邦统计局分层比对(住院死亡占比与全国吻合)。总体评价:表型可信度在同类型理赔数据中处于第一梯队,但任何新表型仍须自建验证。
把这条证据链转译为机器学习语言:95% 一致率相当于外部标注集上的准确率报告,但它只覆盖算法判定为某结局的那部分样本(PPV 语义),阴性侧的特异性与敏感性并未报告——这直接决定了用该表型训练的模型在"未标注≠未患病"意义上的上限。评价体系成熟的团队会在此处自动进入敏感性区间分析,而不是把 95% 当作无偏标签质量。
§7.3 泛化性讨论
| 外推场景 | 失效风险 | 证据 |
|---|---|---|
| → 德国全人群率 | 高(低估死亡/慢病负担) | 年龄标化死亡率低于全国统计(SOC 差异) |
| → 东部各州 | 较高(覆盖低+健康移民效应) | 死亡率验证中东部偏差更显著 |
| → 私人保险人群(11%) | 不可直接外推 | 数据不含私保人群 |
| → 儿童青少年/孕产妇 | 中低(队列在库,已有多项研究) | COC 10-19 岁研究、妊娠算法系列 |
| → 药物处方模式 | 低(代表性已验证) | NSAID 配药与住院诊断代表性评估(Schink & Garbe 2010) |
| → 跨国(欧洲理赔库间) | 中(编码/报销制度差异) | 需与 CPRD/PHARMO/SNDS 协调映射 |
| → 长期照护/失能人群 | 中(照护机构内就医路径不同) | 机构内处方与康复服务报销结构特殊,住院依赖型结局会低估 |
§7.4 伦理考量
GePaRD 研究无个体知情同意:依《社会法典》规制,当获取同意不可行且会引入偏倚时,理赔数据研究可豁免知情同意;项目合法性由 SGB X §75 的"公共研究利益显著高于当事人隐私利益"权衡保障。数据在 BIPS 伪匿名化存储,个体不可被联系,无生物标本。不来梅大学伦理委员会将 GePaRD 研究豁免于机构审查。发表须保司批准,构成额外的伦理-法律双重闸门。
对 AI 开发者的操作性含义:伪匿名不等于匿名——person_id 一旦与外部数据非法联结即可能再识别,因此任何个体级数据的传出(哪怕是图表原始点)都是违规行为;模型与输出属于"派生数据",训练好的模型权重在带离安全区前同样需要审批,若模型在极小亚组上过拟合,权重本身可能携带可再识别信息,这一点在提交输出审批时应主动说明;联邦数据保护法(BDSG)与社会法典的数据保护条款叠加适用,违反的后果不仅是个别研究被叫停,而是整个合作框架的信任崩塌。
§7.5 公平性评估
- SOC 维度:低 SOC 人群欠代表(不来梅除外),模型对低 SOC 人群的校准可能变差——应报告 SOC 分层校准曲线。
- 区域维度:东部覆盖低,区域分层模型须防小样本过拟合。
- 移民/族裔维度:数据无 ethnicity/移民字段,公平性审计在此维度不可行,只能以居住地区代理并声明局限。
- 性别维度:性别字段完备;孕产相关研究中需注意妊娠识别算法对特殊结局(异位妊娠、死产)的敏感性差异。
SOC 分层的落地做法:以职业键推导的教育/职业状态为分层变量,在模型评估阶段至少报告"高 SOC 主体人群 vs 不来梅均衡子集"两套校准曲线;若两者偏离超过预设阈值(如 Brier 差异 >0.01),应在文中把结论限定为主体人群而非全德推论。儿童青少年亚组(COC 研究已示范 10-19 岁队列)是另一个必须单列的公平性切片——未成年人的编码密度与处方行为与成人差异极大。
§7.6 数据漂移提示
- 编码制度漂移:ICD-10-GM 年度修订、OPS/EBM 目录更新;2011 年职业键分类改版(新分类自 2017 年数据年起才大规模传输)——跨版本特征需映射层。
- 人群漂移:保司参保结构随时间变化(换保司人群系统性更年轻健康)。
- 政策漂移:避孕药处方结构(低风险制剂份额 32%→54%)、筛查政策等制度变化会改变"暴露基线"。
- 刷新节奏:年度刷新(最近 2023-02-28),跨年拼接时注意补录与回溯性编码。
- 模型-数据共同漂移:即使编码制度不变,AI 模型部署本身会改变诊断行为(开发者用模型辅助的科室编码风格逐渐迁移),部署后应设漂移监控看板(季度诊断量、确定性比例、特征分布 KS 统计量)。
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ⚠️ | 事件表为长格式,需自行透视成 person-quarter 面板 |
| 2 | 唯一标识 | ✅ | 伪匿名参保人主键贯通全表,家庭 ID 可联结成员 |
| 3 | 特殊字符 | ⚠️ | 德语变音符(ä/ö/ü/ß)与文本字段需统一 UTF-8 处理 |
| 4 | 重复行 | ⚠️ | 理赔重复提交与补录需按事件键去重 |
| 5 | 缺失编码 | ⚠️ | 无显式缺失代码体系;结构性缺失占主导 |
| 6 | 标签标识 | ❌ | 无监督标签,全部为算法衍生表型 |
| 7 | 罕见类分组 | ✅ | 2,500 万人背景池使罕见结局仍可聚合出可用样本 |
| 8 | 偏倚评估 | ✅ | SOC/区域/死亡率偏倚均有同行评审量化研究 |
| 9 | 数据字典 | ❌ | 无公开数据字典(项目协议内提供) |
| 10 | 信息性缺失解释 | ✅ | OTC/住院用药/生活方式缺失在文献中有系统说明 |
| 11 | 设备记录 | ❌ | 行政理赔数据无设备级信息(性质上不适用) |
| 12 | 共线性 | ⚠️ | 编码计数特征高维稀疏,共线性由研究者自行处理 |
| 13 | 编码映射 | ✅ | ICD-10-GM/OPS/EBM/ATC 四套编码体系清晰,ATC 关联 PZN 参考表 |
| 14 | 时间戳处理 | ⚠️ | 门诊诊断仅到季度,住院/配药到日,双粒度需显式管理 |
| 15 | 划分建议 | ⚠️ | 无官方划分;本条目给出按人/时间双维划分方案 |
| 16 | 泄漏讨论 | ✅ | time-zero 对齐、immortal time、TTE 方法学文献充分 |
| 17 | 标签分布 | ❌ | 无固定标签集,分布随研究问题而定 |
| 18 | 测量偏倚 | ⚠️ | 编码行为、报销门槛引入的测量偏倚需自行量化 |
| 19 | 外部验证建议 | ✅ | 死亡率(联邦统计局)、跨国研究(丹麦/英国)对照路径成熟 |
| 20 | 版本记录 | ⚠️ | 无公开版本号,年度刷新;项目协议内年份窗口即"版本" |
| 21 | 预处理脚本 | ❌ | 无公开脚本;合作模式下代码留存 BIPS 安全区 |
| 22 | 合规要求 | ✅ | SGB X §75 审批链与访问科学家协议制度清晰 |
| 23 | 多模态对齐 | ❌ | 仅结构化理赔单模态(无影像/文本/信号可对齐) |
| 24 | 去标识化 | ✅ | 伪匿名化+数据不出安全区+个体不可联系 |
DAIMS 评分:13.5 / 24
评分解读:GePaRD 的强项在"治理与验证"(唯一标识、偏倚评估、信息性缺失说明、编码映射、泄漏讨论、外部验证、合规、去标识化共 9 项 ✅),弱项在"AI 开箱即用"(无公开字典/脚本/标签/版本,6 项 ❌)。这符合闭库型行政数据的一般规律:数据质量高,但就绪度取决于合作门槛而非数据本身。
对你意味着什么:若你的团队计划申请合作,本表告诉你四件事——(1) 必须自建表型验证流程(无现成标签);(2) 预算中要为"协议阶段数据字典获取"留时间;(3) 时间粒度设计从第一天起按"季度+日期"双轨规划;(4) 所有预处理代码要在 BIPS 环境内可复跑,别指望把数据带回来调参。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| 联邦统计局(FSOG)+ 不来梅死亡登记 | 德国官方统计 | 死亡率有效性 | 年龄标化率比、住院死亡占比 | GePaRD 略低(SOC 可解释) | 死亡信息完整且内部一致 |
| 临床专家评审(20 例纵向妊娠档案) | BIPS | 妊娠结局算法 | 结局类型+日期一致率 | 95% 一致;不合理序列 0.03% | 妊娠表型可用于药物安全研究 |
| 患者画像评审(2016-2017 事件) | BIPS(德国理赔首个) | AMI/卒中/CV 死亡算法 | PPV(评审验证) | 住院主诊断定义确证度高 | 编码算法可达到监管可用精度 |
| 丹麦全国登记研究(JAMA Netw Open 2025) | 丹麦团队 | 激素避孕 VTE 风险排序 | 发病率比 | 风险排序方向一致 | 跨国理赔/登记数据结论可复制 |
| EURAP 国际注册与既有致畸文献 | 国际多中心 | VPA-脊柱裂风险 | RR | GePaRD RR 24.5 与文献量级一致 | 妊娠期药物安全可行性成立 |
| BARMER 数据仓库 | BARMER(合作研究) | 筛查效果平行分析 | 并行估计 | 两库独立分析不合并(数据保护) | 国内跨库三角验证可行 |
§8 基准性能与生态
§8.1 排行榜(方法学定量结果参照表)
GePaRD 是闭库型研究数据,不存在公开 ML 排行榜。社区的实际"基准"是可复算的方法学定量结果。下表汇总可作参照锚点的同行评审结果(数值来自各自论文设定,互不可直接比较——人群、年份、结局定义与设计均不同):
| 排名 | 研究(任务) | 关键性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | 妊娠结局识别与分类 | 专家一致率 95%;n=1,235,261 结局;不合理序列 0.03% | 2018 | 纵向编码算法优化 | Wentzell N, et al., 2018, Pharmacoepidemiol Drug Saf 27(9):1005-1010. DOI 10.1002/pds.4588 | 无公开 |
| 2 | 复方口服避孕药 VTE 风险 | dienogest OR 2.23(1.77-2.80);gestodene OR 5.05;左炔诺孕酮低剂量为最低风险参考 | 2022 | 巢式病例对照 1:10 匹配 | Schink T, Princk C, Braitmaier M, Haug U, 2022, BJOG 129(13):2107-2116. DOI 10.1111/1471-0528.17268 | 无公开 |
| 3 | VPA-脊柱裂概念验证 | 活产 RR 24.5(7.9-76.0);流产 RR 12.4;n=1,271,384 妊娠 | 2023 | 关键窗(前 55 天)暴露算法 | Haug U, et al., 2023, Pharmacoepidemiol Drug Saf 32(2):148-157. DOI 10.1002/pds.5573 | 无公开 |
| 4 | 死亡率外部验证 | 年龄标化率与全国吻合(SOC 差异内);住院死亡占比一致 | 2016 | 人群级对标 | Ohlmeier C, Langner I, Garbe E, Riedel O, 2016, Pharmacoepidemiol Drug Saf 25(7):778-784. DOI 10.1002/pds.3998 | 无公开 |
| 5 | CV 结局算法验证 | AMI=住院主诊断 I21/I22;卒中 I61/I63/I64;复合 CV 死亡定义 | 2022 | 患者画像评审 | Platzbecker I, et al., 2022, Clin Epidemiol 14:141352. DOI 10.2147/CLEP.S380314 | 无公开 |
为何不可直接比较:上表横跨病例对照与队列设计、不同年代编码目录、不同年龄窗(10-19 岁至全年龄)与不同结局操作化定义;任何"性能数字"只有在同协议重跑下才有可比性。
§8.2 SOTA 总结与选型建议
在 GePaRD 语境下,"SOTA"体现为方法学选型共识:因果问题走目标试验模拟(TTE)+ g-formula(GeTTCausal 路线),信号精化走巢式病例对照(COC-VTE 路线),表型走规则算法+画像评审验证(CV/妊娠路线),预测建模走梯度提升+按人划分+时间外推(本条目 §5 建议)。对首次进入德国理赔数据的研究者,建议顺序为:先复现一个已验证表型(如妊娠算法)建立数据直觉,再进入自选问题。
一个务实的 90 天路线图:第 1-4 周,读 Pigeot & Ahrens 2008 与 Springer 自述章节,理解建库逻辑与访问流程,同时向 BIPS 发起项目初步接洽(流程本身以数月计,宜早启动);第 5-8 周,在获批提取集上复算死亡率对标或妊娠结局分布,校准对数据粒度与编码行为的直觉;第 9-12 周,选定研究问题的 TTE 表格化设计(资格、分配策略、随访起点),与 BIPS 方法学家迭代协议草案——这份协议同时就是保司审批文件与未来论文的骨架。
§8.3 评测协议
- 表型验证协议:定义→编码规则→随机抽样伪匿名患者画像→标准化评审→PPV+敏感性报告(CV 结局研究模板)。
- 因果分析协议:预注册式研究协议(即保司批准文件)→ TTE 表格化设计(资格/分配/随访/time-zero)→ 克隆-删失加权 → 敏感性分析(吸烟漏报偏差分析模板)。
- 预测建模协议:按参保人分层 5 折 + 时间外推集 + SOC/区域亚组校准报告。
- 部署后监控协议:季度诊断量与确定性比例看板、特征分布 KS 统计量阈值、年度编码目录变更影响评估——与 §7.6 漂移清单一一对应。
§8.4 相关数据集
| 数据集 | 机构 | 模态 | 关系 |
|---|---|---|---|
| CPRD | 英国 MHRA | 全科诊疗+linkage | 欧洲同级理赔/诊疗库,跨国对照首选 |
| SNDS | 法国 CNAM/ATIH | 全民理赔+住院 | 全人群覆盖的法国对应物 |
| PHARMO | 荷兰 PHARMO Institute | 多设置 linkage 数据链 | 荷兰药物警戒对照 |
| BIFAP | 西班牙 AEMPS | 全科电子病历 | 西班牙药品监管科研库 |
| BARMER DWH | BARMER | 单保司理赔(约 1,260 万人) | 德国境内跨库验证伙伴 |
| IQVIA Disease Analyzer | IQVIA | 德国诊所 EHR 抽样 | 补充化验/生活方式细节 |
| MIMIC-III | MIT/BIDMC | ICU 深度时序 | 粒度互补:单中心深度 vs 全人群广度 |
| InGef | 德国保险数据研究联盟 | 多家保司理赔研究数据 | 德国境内同类理赔路线,方法学可互鉴 |
| AOK NORDWEST 数据仓库 | AOK NORDWEST | 单区域保司理赔 | 区域深度对照(北部地区) |
组合使用策略:主分析在 GePaRD、敏感性分析在 BARMER/InGef 的"双库三角验证"是德国理赔研究已验证的工作模式(乳腺癌筛查 TTE 协议即此范式);需要临床细节时以 IQVIA Disease Analyzer 补充做小样本校验,而非试图把两源拼接成单库——数据保护框架不允许个体级跨库联结,一切"组合"都发生在结果层面(平行估计、对照风险排序)。
§8.5 关键论文 Top 8
- Pigeot I, Ahrens W, 2008, Pharmacoepidemiol Drug Saf 17(3):215-223. DOI 10.1002/pds.1110 —— 建库奠基论文:德国建立药物流行病学数据库的方法学潜力、科学价值与实际限制。
- Ohlmeier C, et al., 2016, Pharmacoepidemiol Drug Saf 25(7):778-784. DOI 10.1002/pds.3998 —— 死亡率对全国数据与死亡登记的系统验证。
- Wentzell N, et al., 2018, Pharmacoepidemiol Drug Saf 27(9):1005-1010. DOI 10.1002/pds.4588 —— 妊娠结局识别与分类算法优化(123 万例结局)。
- Haug U, Schink T, 2021, chapter in Databases for pharmacoepidemiological research, Springer, 119-124. DOI 10.1007/978-3-030-51455-6_8 —— 官方数据源自述章节(结构、内容、应用最权威摘要)。
- Schink T, et al., 2022, BJOG 129(13):2107-2116. DOI 10.1111/1471-0528.17268 —— 9 种复方口服避孕药 VTE 风险分级,BfArM 资助并进入监管沟通。
- Platzbecker I, et al., 2022, Clin Epidemiol 14:141352. DOI 10.2147/CLEP.S380314 —— AMI/卒中/CV 死亡算法在德国理赔数据上的首次画像评审验证。
- Haug U, et al., 2023, Pharmacoepidemiol Drug Saf 32(2):148-157. DOI 10.1002/pds.5573 —— VPA-脊柱裂概念验证:GePaRD 妊娠期药物安全能力的方法学证明。
- 乳腺癌筛查 TTE 协议团队, 2023, Clin Epidemiol. DOI 10.2147/CLEP.S376107 —— GePaRD+BARMER 双库目标试验模拟协议(克隆-删失加权示范)。
建议的阅读顺序:方法学新手按 4 → 2 → 8 → 3 的顺序读(自述章节打底、死亡率验证建立外部效度直觉、TTE 协议学设计、妊娠算法学表型工程);做暴露-结局因果研究的按 1 → 6 → 5 → 7 读(建库 → 结局算法 → 病例对照 → 致畸应用)。每篇都配了可复算的定量锚点,读完任何一条线即可在自己的协议中预置对照数字。
§8.6 社区活跃度
无公开 GitHub/论坛生态。学术社区以 BIPS 为中心:不来梅流行病学与公共卫生研讨会(Bremen Colloquium of Epidemiology and Public Health)定期开放;GePaRD 官方维护公开发表论文清单;跨机构合作通过 IMI ConcepTION、HMA-EMA 目录与 NFDI4Health(德国健康数据研究基础设施)等框架展开。对研究者的实际含义:"社区"即 BIPS 的项目合作网络,加入方式是与 BIPS 共同立项而非提交 issue。
跟踪前沿的三个低成本渠道:一是 BIPS 官网的发表清单与 Leibniz Institute 系列报告,新论文通常先于数据库文档更新;二是 ICPE(国际药物流行病学学会)年会摘要——GePaRD 团队习惯把进行中的方法学工作先投 ICPE;三是 NFDI4Health 的资源目录,数据刷新与元数据变更会在那里最先反映。检索关键词建议用全称 “German Pharmacoepidemiological Research Database” 而非缩写,可显著降低漏检率。
§8.7 生态快照
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| BIPS GePaRD 官方页 | 官方文档 | bips-institut.de | 数据内容、访问规则第一手来源 |
| HMA-EMA 目录条目 | 监管登记 | catalogues.ema.europa.eu | 结构化元数据(ID 26534、完整度 90%、刷新节奏) |
| re3data 登记 | 库登记 | re3data.org | 引用符 DOI 10.17616/R31NJMSR |
| NFDI4Health 资源页 | 国家基础设施 | csh.nfdi4health.de | 德国健康数据 FAIR 化目录 |
| Atlas of Longitudinal Datasets | 纵向数据集目录 | atlaslongitudinaldatasets.ac.uk | 横向比较 GePaRD 与其他纵向队列 |
| Springer 专著章节 | 方法论综述 | DOI 10.1007/978-3-030-51455-6_8 | 最系统的官方自述(2021) |
生态快照的读法:这六项资源覆盖了"官方描述—监管元数据—库登记—国家基础设施—横向目录—方法学综述"六个正交视角,交叉核对它们是本条目规模数字的验证路径。若发现口径冲突(如目录页与论文的数字差异),以 BIPS 官方页为最高优先级,EMA 目录次之,论文中的项目期数字仅对该项目窗口有效。
§9 相关资源与引用
官方资源
- GePaRD 官方主页(BIPS,英文) —— 数据内容与访问规则
- GePaRD 访问与研究利用说明(Bremen Colloquium 页面) —— SGB X §75 审批流程详解
- BIPS 临床流行病学系 —— 研究方向、GeTTCausal 工作组
- HMA-EMA 真实世界数据目录条目 —— 结构化登记信息与官方发表论文列表
- re3data.org 登记记录 —— 仓库元数据与引用符
- 合作与项目咨询:gepard@leibniz-bips.de
BibTeX 引用(数据使用与条目写作建议引用三件套)
@article{pigeot2008establishment,
author = {Pigeot, Iris and Ahrens, Wolfgang},
title = {Establishment of a pharmacoepidemiological database in Germany:
methodological potential, scientific value and practical limitations},
journal = {Pharmacoepidemiology and Drug Safety},
year = {2008},
volume = {17},
number = {3},
pages = {215--223},
doi = {10.1002/pds.1110}
}
@incollection{haug2021gepard,
author = {Haug, Ulrike and Schink, Tania},
title = {German Pharmacoepidemiological Research Database (GePaRD)},
booktitle = {Databases for Pharmacoepidemiological Research},
editor = {Sturkenboom, Miriam C.J.M. and Schink, Tania},
publisher = {Springer},
address = {Cham},
year = {2021},
pages = {119--124},
doi = {10.1007/978-3-030-51455-6_8}
}
@article{schink2022combined,
author = {Schink, Tania and Princk, Christina and Braitmaier, Malte and Haug, Ulrike},
title = {Use of combined oral contraceptives and risk of venous thromboembolism
in young women: A nested case-control analysis using German claims data},
journal = {BJOG: An International Journal of Obstetrics \& Gynaecology},
year = {2022},
volume = {129},
number = {13},
pages = {2107--2116},
doi = {10.1111/1471-0528.17268}
}
引用指南
- 使用数据的研究:依 BIPS 惯例在致谢中列出四家参与医保公司(AOK Bremen/Bremerhaven、TK、DAK-Gesundheit、hkk),并引用建库论文(Pigeot & Ahrens 2008)与官方章节(Haug & Schink 2021)。
- 引用本条目:引用本 Wiki 页面时请同时引用上述原始文献;规模数字(2,500 万/1,700 万/20%)以 BIPS 官方页与 EMA 目录为准。
- 条目内链接:所有外部链接为官方页、监管目录或同行评审文献;站内相关数据集导航由平台自动挂载。
- 数据集引用符:re3data 提供 DOI 10.17616/R31NJMSR 作为数据库级引用符;论文中的数据库方法学部分可直接引用该 DOI 与建库论文。
§10 AI 使用声明卡
§10.1 AI 模型使用
本条目由「千方数据集百科」写作管线生成,底座模型为 fast-model(大语言模型)。信息检索、事实核查、结构编排与文字生成均由模型辅助完成,最终内容由人工审核确认。
§10.2 AI 参与范围
| 环节 | 参与方式 |
|---|---|
| 检索与事实收集 | AI 执行 6 轮 WebSearch,产出 FACTS.md 事实清单(22 条,逐条附来源 URL) |
| 正文撰写 | AI 按写作宪法一次成稿;数字全部取自 FACTS.md 已验证来源 |
| 代码示例 | AI 撰写示意性预处理/建模代码;因数据闭库,代码基于公开论文描述的方法逻辑,未在真实数据上运行 |
| 医学审核 | 人工复核 §2 医学背景与 §7 偏倚分析 |
| 数据工程审核 | 人工复核 §4 数据字典、§5 划分与 §6 坑点的技术正确性 |
§10.3 输入来源
- BIPS. Statutory Health Insurance Data (GePaRD). https://www.bips-institut.de/en/research/research-infrastructures/gepard.html
- BIPS. GePaRD 访问与研究利用说明(Bremen Colloquium 页面). https://www.bips-institut.de/en/research/research-infrastructures/gepard/bremen-colloquium-epidemiology-public-health.html
- BIPS. Clinical Epidemiology(系所页,含 GeTTCausal 工作组). https://www.bips-institut.de/en/the-institute/departments/clinical-epidemiology.html
- HMA-EMA Catalogues of real-world data sources and studies. German Pharmacoepidemiological Research Database, Data source ID 26534. https://catalogues.ema.europa.eu/node/967/administrative-details
- HMA-EMA Catalogues. GePaRD data flows and management. http://catalogues.ema.europa.eu/node/967/data-flows-and-management
- HMA-EMA Catalogues. Xarelto PASS Combined Report(含 GePaRD 数据结构 §9.5.2). https://catalogues.ema.europa.eu/sites/default/files/document_files/Xarelto PASS - Combined Report_16159_16646_16647_17543_redacted_final.pdf
- Atlas of Longitudinal Datasets. German Pharmacoepidemiological Research Database (GePaRD). https://atlaslongitudinaldatasets.ac.uk/datasets/gepard
- re3data.org. GePaRD(r3d100013355,DOI 10.17616/R31NJMSR). http://www.re3data.org/repository/r3d100013355
- Ohlmeier C, Langner I, Garbe E, Riedel O, 2016, Pharmacoepidemiol Drug Saf 25(7):778-784. DOI 10.1002/pds.3998. https://europepmc.org/articles/4474340
- Wentzell N, Schink T, Haug U, et al., 2018, Pharmacoepidemiol Drug Saf 27(9):1005-1010. DOI 10.1002/pds.4588. https://www.pubmed.ncbi.nlm.nih.gov/30022557/
- Schink T, Princk C, Braitmaier M, Haug U, 2022, BJOG 129(13):2107-2116. DOI 10.1111/1471-0528.17268(ICPE 2022 报告页). https://www.eventscribe.net/2022/ICPE/fsPopup.asp?Mode=presInfo&PresentationID=1084611
- Haug U, et al., 2023, Pharmacoepidemiol Drug Saf 32(2):148-157. DOI 10.1002/pds.5573. https://repository.publisso.de/resource/frl%3A6441129
- Platzbecker I, et al., 2022, Clin Epidemiol 14:141352. DOI 10.2147/CLEP.S380314. https://pmc.ncbi.nlm.nih.gov/articles/PMC9661914/
- 乳腺癌筛查目标试验模拟协议, 2023, Clin Epidemiol. DOI 10.2147/CLEP.S376107. https://www.tandfonline.com/doi/abs/10.2147/CLEP.S376107
- 抗糖尿病药与胰腺癌参数 g-formula 可行性研究, Clin Epidemiol. https://www.dovepress.com/avoiding-time-related-biases-a-feasibility-study-on-antidiabetic-drugs-peer-reviewed-fulltext-article-CLEP
- Pigeot I, Ahrens W, 2008, Pharmacoepidemiol Drug Saf 17(3):215-223(经 GePaRD 综述页引用列表核实). https://docsbay.net/the-german-pharmacoepidemiological-research-database-gepard
- Socioeconomic status in GePaRD(职业键与教育推导). https://journals.publisso.de/en/journals/mibe/volume18/mibe000235
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| frontmatter 与 INFOBOX 规模数字 | 千方病案医学编辑部 | 对照 FACTS.md 与官方来源逐项核对 | ✅ 已通过 |
| §2 医学背景与编码锚定 | 千方病案医学编辑部 | 医学编辑复核 ICD-11/SNOMED 映射与流行病学表述 | ✅ 已通过 |
| §4 数据结构与 §5 划分 | 千方病案医学编辑部 | 数据工程师复核表结构示意与泄漏防御逻辑 | ✅ 已通过 |
| §6 坑点与代码 | 千方病案医学编辑部 | 数据工程师复核 8 个坑点与代码可运行性 | ✅ 已通过 |
| §7 质量评估与 DAIMS | 千方病案医学编辑部 | 对照验证研究文献核对打分 | ✅ 已通过 |
| §8-§10 与引用 | 千方病案医学编辑部 | 逐条核对 17 项输入来源 URL | ✅ 已通过 |
§10.5 AI 生成章节标注
本条目全部章节由 AI 辅助生成(底座模型 fast-model),经 §10.4 所列人工审核流程确认发布。已知的 AI 局限与对策:闭库数据无法实测代码,全部示例标注为"示意";未检索到的字段(全库体量、引用计数)按规范整行省略或标注"未公开",不做推测填充。
§10.6 最后审核
最后人工审核日期:2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- cprd — 共享标签:电子健康记录 / 真实世界数据 / 队列研究 / 药物安全
- nhird — 共享标签:电子健康记录 / 医保理赔 / 队列研究 / 药物安全
- snds — 共享标签:电子健康记录 / 医保理赔 / 真实世界数据 / 药物安全
- komodo-healthcare-map — 共享标签:电子健康记录 / 医保理赔 / 真实世界数据
- nhis-nhid — 共享标签:电子健康记录 / 医保理赔 / 队列研究 / 药物安全
- jmdc — 共享标签:电子健康记录 / 医保理赔 / 真实世界数据 / 药物安全
- cdars — 共享标签:电子健康记录 / 队列研究 / 药物安全
- mdv — 共享标签:电子健康记录 / 医保理赔 / 真实世界数据
- chronic-kidney-disease-uci — 共享标签:电子健康记录 / 真实世界数据 / 队列研究
- marketscan — 共享标签:电子健康记录 / 医保理赔 / 真实世界数据 / 药物安全
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

