信息速览

SEER-Medicare — 美国老年癌症登记-理赔链接数据库 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | SEER-Medicare Linked Database |
| 英文全称 | Surveillance, Epidemiology, and End Results (SEER) – Medicare Linked Database |
| 别名/简称 | SEER-Medicare、SEER-CMS 链接数据、SEER-Medicare Specialized Databases |
| 疾病分类 | 全癌种谱系(ICD-11 恶性肿瘤章节 2A00-2F5Z;重点癌种映射详见 §2.1) |
| SNOMED CT | 363346000 Malignant neoplastic disease (disorder) / 254837009 Malignant tumor of breast / 93880001 Primary malignant neoplasm of lung / 363406005 Malignant tumor of colon(详见 §2.1b) |
| 数据模态 | 结构化癌症登记(肿瘤临床)、结构化医保理赔(多文件类型)、纵向随访 |
| AI 任务类型 | 治疗模式挖掘、费用预测、生存分析、共病表征、差异与公平性研究、理赔序列建模、因果推断 |
| 样本总数 | SEER 17 / SEER 22 登记区 65 岁及以上癌症确诊人群(覆盖约 26.5% / 47.9% 美国人口,2020 Census);Specialized 版含 2000-2019 年确诊肿瘤与 1999-2020 年 Medicare 人群 |
| 数据大小 | 官方未公开统一大小(以 DUA 获批后的分发介质为准) |
| 数据格式 | SAS V8 传输格式 / SAS 数据集 / 定制 ASCII(历史版本) |
| 许可证 | SEER-Medicare Data Use Agreement(DUA,无开源许可证) |
| 访问级别 | 申请审核(NCI DUA + CMS 合规审查) |
| DUO 标签 | GS(仅限美国境内使用)、PUB(发表前须送 NCI 隐私审查)、IRB(机构伦理与 DUA 要求) |
| 语言 | 英语 |
| 首发日期 | 1991(首次 SEER-Medicare 链接) |
| 最后更新 | 2024 Linkage Version(肿瘤文件至 2021 年确诊、多数理赔至 2022 年) |
| 发布机构 | 美国国家癌症研究所(NCI)× 美国医疗保险与医疗补助服务中心(CMS) |
| 官方主页 | healthservices.cancer.gov/seermedicare |
| 下载地址 | SEER Specialized Data Request System |
| 引用次数 | 1,751+(Scopus,经 Weill Cornell VIVO 收录,截至 2026-09,针对 Warren 2002 原始方法学论文) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 登记数据高度标准化、变量文档完备,但需 SAS 专有格式转换、自行构建分析队列与划分,且理赔治疗指标存在已知的系统性缺口 |
| 页面状态 | published |
§0 E-E-A-T 审核声明
- 医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、人群统计、金标准)、§7 偏倚分析。
- 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
- 审核日期:2026-09-05
- 数据来源:本页面全部事实性内容基于 NCI 官方文档(healthservices.cancer.gov/seermedicare)、SEER 官方数据页与同行评审文献(Warren et al. 2002;Enewold et al. 2020;Warren et al. 2023)交叉核实,来源清单见 §10.3。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。SEER-Medicare 要求用户通过 SEER Specialized Data Request System 提交申请、签署 NCI 数据使用协议(DUA)并满足 CMS 合规要求,数据不得发布至美国境外。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
利益冲突声明:千方病案医数集与 NCI、CMS、SEER 登记区无任何商业利益关联。本页面不销售 SEER-Medicare 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。
§1 数据集概览
§1.0 30 秒速览
这是什么? SEER-Medicare 是美国国家癌症研究所(NCI)把两套独立的国家级数据"缝"在一起的作品:一套是 SEER 癌症登记——医院与登记员逐例收集的肿瘤临床细节(部位、组织学、分期、初始治疗、生存);另一套是 CMS Medicare 理赔——65 岁以上老人每次住院、门诊、买药产生的账单流水。NCI 用确定性链接算法把同一个人的两份数据对上,形成"既知道得了什么癌、又知道后续三十多年怎么看病花钱"的超级队列。
为什么重要? 癌症治疗的真实世界证据在 65 岁以上人群中最为稀缺:临床试验几乎不纳入老年多病共存患者,而美国大多数癌症恰恰发生在 65 岁以上。SEER-Medicare 自 1991 年首次链接以来约每两年更新,每次更新约 95% 的 SEER 65+ 岁人群能成功匹配 Medicare 记录,是老年癌症治疗模式、费用与结局研究被引用最多的证据来源之一(原始方法学论文 Scopus 引用超过 1,751 次,截至 2026-09)。
我能用它做什么? 构建老年癌症分析队列并比较不同治疗路径的生存与费用;开发理赔编码算法识别化疗、放疗与并发症;研究治疗差异与公平性;训练表格与理赔序列模型预测结局。但注意:它不适合 65 岁以下患者研究,且 Medicare Advantage 参保人的理赔大量缺失,AI 建模前必须先做队列筛选(详见 §6.5 坑点 1)。
§1.1 技术摘要
SEER-Medicare 的技术核心是个体级确定性链接。SEER 癌症登记按 NAACCR 标准逐例收集肿瘤信息;CMS Medicare 收集全部参保人的登记资格与理赔流水。NCI 及其承包商(Information Management Services)在每次更新中以 SSN 与出生日期(至少月/年)为主键执行确定性概率匹配——自 2020 数据版起,SSN 缺失时改用姓、性别与完整出生日期匹配——约 95% 的 SEER 65+ 人群可成功链接。链接后 NCI 派生研究变量:患者级诊断与登记资格摘要文件、按 Medicare 理赔类型组织的事件文件(住院 MedPAR、门诊、医师/供应商、居家保健、临终关怀、耐久医疗器械、Part D 处方事件),以及共病指数(16 项共病指标、Charlson 评分、NCI 共病指数)、全身治疗与放疗指标(按诊断后年份组织)、低收入补贴月数等。数据以 SAS 传输格式按 DUA 分发,2027-03-01 起将转为联邦管理的安全飞地访问。
§1.2 战略价值
维度一:老年癌症真实世界证据的"事实标准"。 临床试验的老年代表性不足是肿瘤学界公认难题,而美国多数癌症确诊于 65 岁以上。SEER-Medicare 同时提供登记级别的肿瘤临床金标准(分期、组织学)与理赔级别的服务利用全景(30 余年纵向),让"指南符合度、比较效果、费用影响"这类研究可以在人口基准上开展。超过 1,751 次引用(截至 2026-09)意味着大量已发表算法——共病指数、治疗识别算法、费用分摊方法——可直接复用。
维度二:AI 建模的高价值"疑难标本"。 对医疗 AI 团队而言,SEER-Medicare 是检验模型鲁棒性的理想训练场:它具备行政理赔数据的全部经典陷阱(信息性缺失、MA 缺口、时间滞后、多原发癌归属),也具备登记数据的标注质量优势。在它上面打磨出的队列构建与特征工程能力,可直接迁移到任何"登记+理赔"型数据(如各国的医保-病历链接数据)。
维度三:合规密集型 AI 工作的"预演场"。 医疗 AI 的落地瓶颈往往不在模型而在合规:DUA 管制、小样本单元掩蔽、境外环境禁令、发表前审查、2027 年起的安全飞地工作流——这些约束在 SEER-Medicare 上全部真实存在且文档化程度极高。团队在此数据集上跑通一次"申请-分析-发表"闭环,等于预演了未来任何联邦级医疗数据的合规工程实践,包括代码入飞地、结果出飞地的审计式工作流。
§1.3 同类数据集横向对比
| 数据集 | 规模与人群 | 模态 | 标注/临床深度 | 与 SEER-Medicare 的差异化 |
|---|---|---|---|---|
| SEER Incidence(Research Data) | SEER 22 登记区,全年龄 | 癌症登记 | 肿瘤临床细节完整,无服务利用信息 | SEER-Medicare 在其 65+ 子集上叠加理赔纵向数据 |
| SEER-MHOS | SEER 地区 Medicare Advantage 参保人 | 登记链接健康调查(SF-36 等) | 健康相关生活质量 | 面向管理式医疗人群,与 SEER-Medicare 的 FFS 重心互补 |
| SEER-CAHPS | SEER 地区 65+ 癌症患者与对照 | 登记链接患者体验调查 | 患者报告体验 | 提供患者体验维度,理赔细节弱于 SEER-Medicare |
| NCDB(国家癌症数据库) | 约 70% 美国新发癌症(委员会认证医院) | 医院登记 | 临床细节+部分治疗 | 医院级而非人口级,无理赔纵向 |
| Medicare Limited Data Sets | 全美 Medicare 参保人 | 理赔 | 无肿瘤临床细节 | SEER-Medicare = Medicare LDS ∩ SEER 登记临床深度 |
§1.4 版本时间轴
| 时间 | 版本/事件 | 关键内容 |
|---|---|---|
| 1991 | 首次链接 | SEER 与 Medicare 理赔首次完成个体级链接 |
| 约 1991-2024 | 周期性更新 | 约每两年更新一次,每次约 95% 的 SEER 65+ 人群匹配成功 |
| 2018 版 | 数据发布 | 癌症病例至 2015 年、理赔至 2016 年 |
| 2020 数据版 | 链接算法更新 | 匹配标准改为 SSN+出生日期(至少月/年);SSN 缺失用姓+性别+完整出生日期 |
| 2023-11 数据提交 | Specialized Databases | 2000-2019 确诊肿瘤、1999-2020 Medicare 人群;SEER 17/22 三个变体 |
| 2024 Linkage Version | 数据发布 | 肿瘤文件至 2021 年确诊;大部分 Medicare 登记/理赔至 2022 年 |
| 2027-03-01 | 访问方式转型 | SEER-CMS 数据访问从实体文件转为联邦管理安全飞地(按 seat 周期付费) |
§1.5 典型应用场景
- 治疗模式与指南符合度研究:用登记分期信息分层,用理赔识别手术、放疗、化疗的时序与组合,评估指南依从性及其随时间的演变。
- 费用与医疗利用分析:MedPAR/门诊/Part D 理赔天然带金额字段,可按癌种与治疗阶段分解费用轨迹,建模终末期费用峰值。
- 生存与结局预测建模:以诊断月为锚点构建随访窗口,训练表格模型或理赔序列模型预测死亡、再入院等结局(注意 §5.3 泄漏风险)。
- 差异与公平性研究:登记的种族/族裔、登记区地理、Part D 低收入补贴月数变量支持按人群分层的治疗可及性分析。
- 老年共病表征:16 项共病指标 + Charlson 评分 + NCI 共病指数,为老年肿瘤的竞争风险与治疗耐受性建模提供基线。
§2 医学背景
§2.1 ICD-11 编码映射
SEER-Medicare 覆盖全部侵袭性癌种,AI 任务通常按癌种分层建模。下表给出高频研究癌种的 ICD-11 编码(SEER-Medicare 本体使用 ICD-O-3 组织学与 SEER site recode 分组,理赔侧使用 ICD-9-CM/ICD-10-CM 诊断码;ICD-11 映射用于跨数据集对齐):
| 标签(中文) | 标签(英文) | ICD-11 编码 | 说明 |
|---|---|---|---|
| 恶性肿瘤(总类) | Malignant neoplastic disease | 2A00-2F5Z | ICD-11 恶性肿瘤章节整体范围 |
| 乳腺癌 | Malignant neoplasm of breast | 2E60 | 老年女性最高发癌种之一,SEER-Medicare 研究最密集的癌种 |
| 支气管与肺癌 | Malignant neoplasm of bronchus or lung | 2C25 | 老年高发、预后分层研究常用 |
| 结肠恶性肿瘤 | Malignant neoplasm of colon | 2B90 | 结直肠癌筛查与手术质量研究主力 |
| 直肠恶性肿瘤 | Malignant neoplasm of rectum | 2B91 | 与 2B90 合并分析形成结直肠癌队列 |
| 前列腺恶性肿瘤 | Malignant neoplasm of prostate | 2C82 | 治疗选择(手术/放疗/主动监测)研究经典场景 |
§2.1b SNOMED CT 映射
| 标签 | ICD-11 | SNOMED CT 码 | SNOMED 术语 |
|---|---|---|---|
| 恶性肿瘤(总类) | 2A00-2F5Z | 363346000 | Malignant neoplastic disease (disorder) |
| 乳腺癌 | 2E60 | 254837009 | Malignant tumor of breast (disorder) |
| 肺癌 | 2C25 | 93880001 | Primary malignant neoplasm of lung (disorder) |
| 结肠癌 | 2B90 | 363406005 | Malignant tumor of colon (disorder) |
| 前列腺癌 | 2C82 | 399068003 | Malignant tumor of prostate (disorder) |
§2.2 疾病背景与流行病学
癌症是全球主要死因之一,而在美国,多数癌症确诊发生在 65 岁及以上人群——这正是 Medicare 的覆盖人群,也是 SEER-Medicare 存在的根本理由。SEER 项目自 1973 年起运行,是美国癌症发病率与生存率统计的官方来源;SEER 22 登记区覆盖约 47.9% 的美国人口(2020 Census),其队列在种族/族裔构成上比美国总人口更富多样性。老年癌症患者的特殊性在于:多病共存使治疗决策复杂化、临床试验证据外推受限、治疗与结局对医疗系统依赖更强。SEER-Medicare 通过"登记临床细节 × 理赔服务全景"的组合,成为回答这些问题的主流数据基础设施。
SEER 22 与美国总人口的关键人口学对照(官方演示材料,基于 2020 Census 基准):
| 指标 | 美国总人口 | SEER 22 登记区 |
|---|---|---|
| 人口覆盖 | 100.0% | 47.9% |
| 西班牙裔 | 18.7% | 25.9% |
| 亚裔/太平洋岛民 | 6.2% | 9.2% |
| 白人 | 61.6% | 54.0% |
| 农村人口占比 | 15.0% | 10.1% |
这一"更多样、更城市化"的构成使 SEER 22 在种族/族裔分层研究上优于全国抽样,但 Warren et al. 2002 的经典比较同时提醒:SEER 地区老年人口白人比例与贫困率低于全美、HMO 参保率更高、癌症死亡率更低——任何向全美老年人群的外推都要带这一修正。
§2.3 临床任务定义
| 临床任务 | 输入(本数据集) | 监督信号 | 典型输出 |
|---|---|---|---|
| 筛查利用与诊断分期关联 | 理赔筛查服务编码(结肠镜、乳腺 X 线等) | SEER 诊断时分期 | 分期偏移模型、筛查缺口识别 |
| 治疗决策建模 | 诊断特征(部位、分期、年龄、共病) | 登记初始治疗 + 理赔治疗指标 | 治疗组合/时序预测、指南符合度 |
| 分期与分级辅助 | 登记临床字段 | SEER Summary Stage、AJCC 分期 | 分期相关监督任务 |
| 预后建模 | 基线特征 + 治疗轨迹 | 登记死亡日期与死因 | 生存曲线、风险分层 |
| 费用与利用预测 | 基线利用 + 肿瘤特征 | 后续理赔金额 | 费用轨迹、高利用者识别 |
§2.4 患者人群特征
| 维度 | 描述 |
|---|---|
| 来源 | SEER 17 / SEER 22 癌症登记区与 CMS Medicare 系统 |
| 时间窗口 | Specialized Databases:2000-2019 年确诊肿瘤、1999-2020 年出现在 Medicare 数据中的人群;2024 Linkage Version 肿瘤文件至 2021 年确诊、多数理赔至 2022 年 |
| 年龄 | 65 岁及以上为主(ABFFS 队列要求 66+;Medicare 65 岁以下仅覆盖残障、ESRD 等特殊资格人群) |
| 性别/种族 | 全部性别;SEER 22 地区西班牙裔约 25.9%、亚裔/太平洋岛民约 9.2%(2020 Census 基准的人口构成) |
| 就医类型 | fee-for-service(FFS)与 Medicare Advantage 并存;共病与治疗指标主要仅在连续 FFS 队列(ABFFS)可用 |
| 癌种 | 全部侵袭性癌种(含原位癌子集视数据库版本而定) |
§2.5 临床价值
对临床研究的价值集中在三点:其一,人口基准——登记的全体病例设计(而非医院抽样)使治疗模式研究可以回答"真实世界里谁没有接受推荐治疗";其二,纵向完整——诊断前后数十年的理赔允许构造诊断前基线(共病、既往费用)与诊断后轨迹(治疗、并发症、终末期照护);其三,结局硬终点——登记与 SSA/CMS 的死亡日期链接提供近乎完整的生存终点,这在任何单中心 EHR 数据中都难以实现。对 AI 开发者,它提供了一个标注质量高于普通理赔、服务细节丰富于普通登记的表格与序列混合数据源。
§2.6 标注金标准对照
| 事项 | 金标准 | 标注方式 | 标注者 | 性质 |
|---|---|---|---|---|
| 诊断、分期、组织学 | SEER 登记字段 | 登记员按 NAACCR 标准逐例编码 | 认证癌症登记员 | 人口级监督金标准 |
| 初始治疗 | SEER 登记治疗字段 | 登记员编码(初始疗程) | 认证癌症登记员 | 仅覆盖初始治疗,治疗"未知"与"未做"不可分 |
| 服务利用与后续治疗 | Medicare 理赔 | 自动生成(账单驱动) | 无人工标注 | 行政数据,存在假阴性(未申报≠未发生) |
| 共病 | Charlson/NCI 共病指数 | 理赔编码算法派生 | NCI 方法团队定义规则 | 需诊断前连续 FFS 观察窗 |
| 死亡日期 | 登记与 SSA/CMS 链接 | 确定性链接 | NCI | 生存分析可靠终点 |
§3 数据集规格
§3.0 版本抉择矩阵
SEER-Medicare 现存两条获取路径与一个确定性的未来状态,选错版本会浪费数月申请时间:
| 你的需求 | 推荐版本 | 数据窗口 | 理由 |
|---|---|---|---|
| 快速验证研究设计、需要最新理赔年份 | 2024 Linkage Version(主链接版) | 肿瘤至 2021、多数理赔至 2022 | 覆盖最新年份,经典文件结构 |
| 需要 CoRe 派生指标(共病/治疗/放疗指标文件) | Specialized Databases(2023-11 提交版) | 2000-2019 确诊、1999-2020 Medicare 人群 | 派生指标与三个 SEER 17/22 变体在此路径提供 |
| 长期项目、预算可持续 | 规划安全飞地访问 | 2027-03-01 起 | 实体文件访问将停用,按 seat 周期付费 |
| 已在境外机构 | 均不可行 | — | 按 CMS 合规,SEER-Medicare 数据不向美国境外发布 |
§3.1 数据模态详情
| 模态 | 内容 | 典型文件 | AI 相关性 |
|---|---|---|---|
| 癌症登记(患者级) | 人口学、肿瘤部位/组织学/分期、初始治疗、生存 | 患者诊断与登记资格摘要文件(每位患者一行) | 标签与分层变量来源 |
| 住院理赔 | 住院与专业护理机构(SNF)费用与诊断/操作 | MedPAR(按住院聚合) | 住院事件、费用、并发症序列 |
| 门诊理赔 | 门诊机构服务 | Outpatient SAF | 手术/放疗/门诊化疗事件 |
| 医师与供应商理赔 | 医师办公室、检验、影像 | NCH(Physician/Supplier) | 最细粒度的服务流水(理赔行级) |
| 居家保健 / 临终关怀 | HHA、Hospice 理赔 | HHA SAF、Hospice SAF | 照护强度与终末期照护特征 |
| 耐久医疗器械 | DME 理赔 | DME SAF | 辅助设备利用特征 |
| 处方事件 | Part D 处方(PDE) | PDE 文件 | 药物暴露(NDC 级)、口服抗肿瘤药 |
| 派生研究变量 | 共病、全身治疗指标、放疗指标、LIS 月数 | NCI 派生指标文件(CoRe) | 直接可用特征/标签,省去自建算法 |
§3.2 按子集样本构成
| 子集/变体 | 覆盖 | 说明 |
|---|---|---|
| SEER 17 excl AK | SEER 17 登记区(约 26.5% 美国人口,2020 Census),不含 Alaska Natives | 覆盖最长年份的稳定核心 |
| SEER 22 excl AK Limited-Field | SEER 22 登记区(约 47.9% 美国人口),不含 Alaska Natives | 地理覆盖最大,部分登记区年份较短 |
| SEER 22 excl AK,IL,MA Limited-Field | 再剔除 Illinois 与 Massachusetts | 应对部分州数据授权限制的变体 |
| ABFFS Cohort | 66+ 岁、诊断前 12 个月至诊断后 1 个月连续 Parts A/B FFS | 共病与 Parts A/B 治疗指标仅此队列可用 |
| Part D Cohort | 诊断前 4 个月至诊断后 1 个月连续登记 Part D | Part D 指标与 LIS 月数仅此队列可用 |
§3.3 数据格式
| 层级 | 格式 | 说明 |
|---|---|---|
| 分发介质 | SAS V8 传输格式(.v8xport/.stc)或 SAS 数据集 | 历史版本含定制 ASCII 定长文件 |
| 读取工具 | pandas.read_sas、SAS、R haven | Python 生态可直接读取(见 §6.3) |
| 官方分析入口 | SEER*Stat 软件 | Specialized Databases 的登记侧访问界面 |
| 派生宏 | NCI Comorbidity SAS Macro(2021 版) | 共病指数计算,可对照移植为 Python |
§3.4 存储规模
NCI 未公开统一的数据大小;实际规模取决于获批的数据库变体、申请的年份窗口与文件类型组合,以 DUA 获批后交付的分发介质清单为准。规划磁盘时可按文件类型的量级特征预估:
| 文件类型 | 行粒度 | 量级特征 | 磁盘规划建议 |
|---|---|---|---|
| 患者摘要文件 | 一位患者一行 | 十万至百万行级 | 数 GB 以内 |
| 参保资格文件 | 一人一年(或一月) | 患者数 × 年份 | 数 GB |
| MedPAR | 一次住院一行 | 百万至千万行级 | 十 GB 级 |
| Outpatient / NCH | 一张理赔(行)一行 | 千万至亿行级 | 数十 GB 级 |
| PDE | 一张处方事件一行 | 千万行级 | 十 GB 级 |
| 派生指标文件 | 一位患者一行 | 与患者摘要同量级 | GB 以内 |
建议预留中间产物(宽表、特征矩阵)3-5 倍空间;理赔事件文件是规模主体,聚合查询优先在数据库层完成再进入 Python 内存。
§3.5 标注方式
本数据集的"标注"分三层:SEER 登记字段由认证癌症登记员按 NAACCR 标准人工编码(肿瘤部位、组织学、分期、初始治疗、生存),质量受 SEER 项目审计协议约束;Medicare 理赔字段由账单系统自动生成(诊断/操作码服务于报销目的,非科研标注);NCI 派生指标(共病指数、治疗 yes/no 指标)由规则算法自动派生,规则公开可复现。对 AI 任务而言:登记字段接近金标准标签,理赔字段是需要算法转换的原始证据,派生指标是官方预计算特征。
§3.6 标注者资质与一致性
癌症登记员需通过认证(NAACCR 体系),SEER 登记区执行统一编码标准与质量审核流程;理赔编码由医疗机构与报销处理链路生成,其"标注一致性"体现为编码标准的全国统一性(ICD-9-CM → 2015-10-01 起 ICD-10-CM、CPT/HCPCS、NDC)。NCI 派生指标的方法学经同行评审(Warren et al. 2002 补充刊系列论文),跨版本规则更新在官方文档中披露。
§3.7 采集周期
| 环节 | 周期 | 说明 |
|---|---|---|
| SEER 登记提交 | 每年一次正式提交 | 11 月正式提交为官方版本,2 月预提交不计入官方统计 |
| Medicare 理赔处理 | 按月/季 | 服务发生到进入研究文件平均滞后 2-3 年,需成熟期(runout) |
| SEER-Medicare 链接 | 约每两年 | 2024 链接版为当前最新(肿瘤至 2021、多数理赔至 2022) |
| 派生指标更新 | 随链接版本 | 共病宏 2021 版、治疗/放疗指标随 Specialized Databases 更新 |
§3.8 地域覆盖
SEER 17 登记区覆盖约 26.5% 美国人口、SEER 22 覆盖约 47.9%(2020 Census)。Medicare 覆盖全美,但仅 SEER 登记区内的确诊者进入链接数据库。登记区构成:
| 分组 | 登记区 |
|---|---|
| 核心创始登记区(2000+ 年份) | 旧金山-奥克兰、康涅狄格、夏威夷、爱荷华、新墨西哥、西雅图(普吉特湾)、犹他、亚特兰大 |
| 扩展登记区(SEER 13/17 阶段加入) | 圣何塞-蒙特雷、洛杉矶、阿拉斯加原住民、乡村佐治亚、加州其余部分、肯塔基、新泽西、大佐治亚、路易斯安那 |
| SEER 22 扩展部分 | 纽约、马萨诸塞、伊利诺伊、德克萨斯、爱达荷 |
| Specialized Databases 变体处理 | SEER 17 excl AK;SEER 22 excl AK Limited-Field;SEER 22 excl AK,IL,MA Limited-Field |
§3.9 设备与编码系统规格
本数据集不含影像/信号设备采集数据。其"设备规格"体现为行政编码系统:
| 编码系统 | 应用层 | 时间口径 |
|---|---|---|
| ICD-O-3 | 肿瘤组织学/形态学(登记侧) | 全时段 |
| ICD-9-CM | 诊断与操作(理赔侧) | 至 2015-09 |
| ICD-10-CM/PCS | 诊断与操作(理赔侧) | 2015-10 起 |
| CPT/HCPCS | 服务与操作(含放疗与管理码 96400-96549、Q0083-Q0085、G0355-G0363) | 全时段 |
| NDC | Part D 药品,经 CanMED 分类映射 | Part D 事件 |
§3.10 深度溯源链
医疗机构(病历)→ SEER 登记区(认证登记员,NAACCR 标准)→ NCI(SEER 项目办公室,年度提交)→ 链接承包商(Information Management Services,SSN+出生日期确定性匹配)→ 研究者(DUA 约束下分发);平行链路:医疗服务 → 报账(837 索赔)→ CMS MACs → CMS Medicare 标准分析文件(SAF)→ NCI 链接与派生指标 → 研究者。两层链路在受益人标识处汇合,任何合规审计(发表前隐私审查)均沿此链回溯。
§4 数据结构
§4.0 目录树
以下为 DUA 获批后典型分发组织的示意结构(具体文件名与清单以随数据交付的官方 data dictionary 为准):
seer-medicare/
├── data/
│ ├── patient/
│ │ └── pedsf_or_core_patient.sas7bdat # 患者级摘要(每位患者一行)
│ ├── claims/
│ │ ├── medpar/ # 住院 + SNF(按住院聚合)
│ │ ├── outpatient/ # 门诊机构理赔
│ │ ├── nch/ # 医师与供应商理赔(行级最细)
│ │ ├── hha/ # 居家保健理赔
│ │ ├── hospice/ # 临终关怀理赔
│ │ ├── dme/ # 耐久医疗器械理赔
│ │ └── pde/ # Part D 处方事件
│ ├── enrollment/
│ │ └── denominator/ # 逐年参保资格(FFS 月数、HMO 标识)
│ └── derived/
│ ├── comorbidity/ # 16 项共病 + Charlson + NCI 指数
│ ├── systemic_therapy/ # 化疗/内分泌/免疫指标(A/B 与 D 两套)
│ └── radiation/ # 放疗指标(前 4 个月 + 年 1 / 年 2+)
├── docs/
│ ├── data_dictionary.pdf # 全字段定义与取值
│ ├── linkage_method.pdf # 链接算法说明
│ └── comorbidity_sas_macro/ # NCI Comorbidity SAS Macro(2021 版)
└── README.txt
§4.1 DAIMS 字段字典(核心字段)
下表列出建模中最常用的核心字段(字段名以官方 data dictionary 为准,此处为类别化示意;"信息性缺失"列说明该字段缺失时传达的额外信息):
| 字段 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失 | 取值范围 |
|---|---|---|---|---|---|---|---|
| patient_id | Text | 研究用受益人标识(直接标识符已替换) | 8 位字母数字 | 分组键(患者级划分必需) | 无 | 不应缺失 | 每患者唯一 |
| diagnosis_year | Integer | 诊断年份 | 2015 | 队列分层、时间外推 | 登记完整 | 不应缺失 | 1999-2021(视版本) |
| site_recode | Text | SEER 部位重编码(原发部位分组) | “Colon excluding Rectum” | 癌种分层标签 | 编码标准统一 | 不应缺失 | 约 70+ 组 |
| histology_icd_o3 | Text | ICD-O-3 组织学编码 | 8140/3 | 亚型建模 | 编码依赖病理报告 | 可缺失(病理未获取) | ICD-O-3 码表 |
| summary_stage | Text | SEER 分期(Localized/Regional/Distant) | “Distant” | 预后分层核心特征 | 分期标准跨年有版本演进 | 少量缺失 | 3-5 类 |
| age_at_dx | Integer | 诊断时年龄 | 74 | 关键协变量 | 登记准确 | 不应缺失 | 65-110+(视队列) |
| race/ethnicity | Text | 种族/族裔分类 | “Non-Hispanic Black” | 公平性分析 | Bach 2002 提示该变量需谨慎使用 | 可缺失 | 编码表 |
| ffs_months | Integer | 每年 Parts A/B FFS 月数 | 12 | 构造 ABFFS 队列、识别 MA 月份 | 理赔系统准确 | 不应缺失 | 0-12 |
| claim_service_date | Date | 理赔服务日期 | 2016-03-14 | 时间窗对齐锚点 | 服务与申报日期可差数月 | 无理赔即无行(信息性) | 1999-2022 |
| icd_dx_code | Text | ICD-9-CM/ICD-10-CM 诊断码 | C18.7(ICD-10) | 结局/并发症识别 | 账单导向,可含 rule-out 编码 | 无行即无事件 | ICD 码表 |
| hcpcs_code | Text | CPT/HCPCS 操作/服务码 | 96413(化疗输注) | 治疗识别算法核心 | 编码粒度不均 | 无行即无事件 | HCPCS 码表 |
| ndc_code | Text | Part D 处方 NDC 药品码 | 抗肿瘤口服药 NDC | 药物暴露(CanMED 映射) | 依赖 Part D 队列资格 | 无行即无事件 | NDC 码表 |
| charlson_score | Integer | 派生 Charlson 共病评分 | 3 | 基线共病特征 | 需诊断前连续 FFS 观察窗 | 队列外为缺失 | 0-37(理论) |
| therapy_indicator | Integer | 派生治疗 yes/no(按年、按医保部分) | 1(诊断后第 1 年化疗) | 直接可用治疗标签 | 理赔假阴性(见坑点 2) | 非对应队列为缺失 | 0/1 |
§4.2 标签与治疗指标分布
可作为监督信号的官方派生标签体系:
| 指标套件 | 内容 | 窗口组织 | 可用队列 |
|---|---|---|---|
| 全身治疗指标(Parts A/B) | 化疗/内分泌治疗/免疫治疗 yes/no | 诊断后第 1 年、第 2+ 年 | ABFFS |
| 全身治疗指标(Part D) | 同上,基于处方事件(NDC/CanMED) | 诊断后第 1 年、第 2+ 年 | Part D Cohort |
| 放疗指标 | yes/no,细分质子/中子、其他射线、近距离放疗、放射性同位素、放射性药物、NOS | 诊断前 4 个月、第 1 年、第 2+ 年(含年 2+ 首次放疗距诊断月数) | ABFFS |
| 共病指标 | 16 项共病 + Charlson 评分 + NCI 共病指数 | 诊断前观察窗 | ABFFS |
| 低收入补贴 | LIS 月数 | 逐年 | Part D Cohort |
注意两套治疗指标的可用人群不相等:仅同时进入两个队列的患者兼有 Parts A/B 与 Part D 指标,任何跨指标联合建模都要先取队列交集。
§4.3 关键统计
| 统计项 | 数值 | 来源 |
|---|---|---|
| 链接匹配率 | 每次更新约 95%(SEER 65+ 人群) | 官方链接方法文档 |
| SEER 17 地理覆盖 | 约 26.5% 美国人口(2020 Census) | SEER*Stat Nov 2022 文档 |
| SEER 22 地理覆盖 | 约 47.9% 美国人口(2020 Census) | SEER*Stat Nov 2022 文档 |
| 理赔可得性滞后 | 平均 2-3 年 | Enewold et al. 2020 |
| Medicare Advantage 占比 | 2023 年达 Medicare 人口 51%,且被 ABFFS 排除 | Specialized Databases 官方页面 |
| 治疗指标编码基础 | ICD + CPT/HCPCS(含 96400-96549、Q0083-Q0085、G0355-G0363)+ NDC(CanMED) | Specialized Databases 官方页面 |
§4.4 数据层级
受益人 Beneficiary(patient_id,患者级摘要文件 1 行)
└── 保险期间(enrollment 逐年记录:FFS 月数、Part D 状态)
└── 理赔 Claim(按文件类型:MedPAR 按住院聚合;其余按理赔单)
└── 理赔行 Claim line(NCH/DME/PDE 等:服务码、金额、NDC)
AI 建模的关键推论:同一患者拥有 1 行患者摘要 + 数百至数万行理赔,任何患者级统计必须先聚合、任何数据划分必须以 patient_id 为组键(详见 §5.3)。
§4.5 缺失值与信息性缺失
| 缺失模式 | 机制 | 处理建议 |
|---|---|---|
| 理赔文件无对应行 | 该服务未被 Medicare 申报(非主要付费方、非覆盖服务、MA 参保) | 不能当"事件未发生";结合登记治疗字段与 FFS 月数解释 |
| SEER 治疗字段"未知/未做"合并编码 | 登记无法区分未治疗与漏报 | 官方建议按"是/否或未知"处理,勿当二分类金标准 |
| 共病指标缺失 | 患者不在 ABFFS 队列(无 12 个月连续 FFS 观察窗) | 队列资格筛选后自然消失;勿在队列外插补 |
| Part D 指标缺失 | 患者不在 Part D 队列 | 同上 |
| 检验结果值缺失 | 理赔不含实验室值/生物标志物 | 结构性缺失,需外部链接或作为数据局限声明 |
§4.6 典型分析宽表示例
队列建模通常把上述层级压成一张患者级宽表(示意,字段名以官方字典为准):
patient_id | dx_year | site_recode | stage | age_dx | abffs | part_d |
charlson | chemo_y1_ab | chemo_y1_pd | rt_y1 | lis_months |
ip_admits_pre12m | op_visits_pre12m | tot_paid_pre12m | death_date
-----------+---------+-------------+-------+--------+-------+--------+
P-000001 | 2015 | Colon excl. | Reg. | 74 | 1 | 1 |
3 | 1 | 1 | 1 | 7 |
2 | 11 | 31,400 | 2016-05-02
-----------+---------+-------------+-------+--------+-------+--------+
P-000002 | 2018 | Lung & bron.| Dist. | 81 | 1 | 0 |
5 | 1 | (缺失) | 0 | (缺失) |
4 | 6 | 18,900 | 2018-11-19
(缺失) 出现在 Part D 列的含义是"该患者不在 Part D 队列"——这是队列资格造成的信息性缺失(§4.5),插补为 0 会直接制造偏倚;ip_admits_pre12m 等基线列仅由诊断前 12 个月理赔聚合而来,与结局窗口严格分离(§5.3)。
§5 划分与使用建议
§5.1 官方划分
无。SEER-Medicare 是研究型行政数据,NCI 不提供机器学习划分;所有划分由研究者自行构建。这也是 DAIMS 划分项只得 ⚠️ 的原因:划分质量完全取决于使用者。
§5.2 社区惯例划分
| 惯例 | 做法 | 适用场景 | 代价 |
|---|---|---|---|
| 时间切分 | 早期年份训练、较新年份测试 | 部署外推声明(最接近真实使用) | 测试集受理赔成熟度影响(坑点 4) |
| 登记区分层抽样 | 以登记区为分层变量 | 保持地理/人群构成 | 登记区间人群差异仍存在 |
| 患者 ID 分层 + 癌种分层 | site_recode × 结局双层 | 通用基准构建 | 需检查层内样本量 |
| 专属癌种子队列 | 按研究问题固定单一癌种 | 临床叙事清晰的研究 | 放弃跨癌种泛化声明 |
§5.3 泄漏风险(重点)
- 患者级泄漏(最高风险):同一患者的理赔跨越多年,若按行随机划分,同一患者的住院会同时出现在训练与测试集——模型只需记住患者即可"作弊"。必须以 patient_id 为 GroupKFold 组键。
- 标签-特征时间重叠:官方派生的治疗指标、费用总额若与结局标签取自同一时间窗,会造成标签泄漏。明确"基线窗(诊断前 12 个月)→ 预测窗"的边界,特征只能来自基线窗。
- 诊断月锚点穿越:SEER-Medicare 的事件窗口以诊断月对齐(官方变量组织方式)。若误用日历月而非相对月对齐,诊断前服务(保险前置窗)会混入"诊断后"特征。
- 生存分析的人为窗:构造"30/90 天结局"时,死亡日期来自登记链接(完整),但服务事件受理赔成熟度影响——最末年份的预测窗会被理赔滞后截短,表现为时间相关的标签缺失。
§5.4 交叉验证建议
用 GroupKFold(n_splits=5)(组 = patient_id)叠加 StratifiedKFold 思路(按结局分层);对外推声明敏感的研究,改用"按诊断年份滚动起点"(rolling-origin)评估。
§5.5 外部验证建议
| 外部资源 | 来源机构 | 适配场景 |
|---|---|---|
| SEER-MHOS | NCI | 健康相关生活质量结局的横向验证 |
| SEER-CAHPS | NCI | 患者体验与照护过程指标 |
| SEER-Medicaid | NCI | 双保险(Medicare+Medicaid)人群的服务完整性验证 |
| NCDB | 美国外科医师学会/ACS 癌症项目 | 医院级人群的治疗与生存泛化性 |
| Medicare Limited Data Sets(全美) | CMS | 登记区外老年人群的地理外推测试 |
上述外部资源均需各自的访问协议;可复用的链接数据库清单见官方 SEER-Linked Databases 页面。
§6 AI 就绪指南
§6.0 云端快速启动
SEER-Medicare 无公开云端沙箱:数据受 DUA 管制、按项目分发,且依 CMS 合规不得在美国境外环境处理。可运行的最短路径是:DUA 获批后,在本机构符合协议的本地服务器(美国境内)用 Python 生态读取 SAS 传输格式文件——无需 SAS 许可证即可完成全流程(见 §6.1-§6.4)。2027-03-01 起实体文件停用,届时改在联邦管理的安全飞地内运行分析代码(代码入飞地、结果出飞地),本节的 Pipeline 逻辑不变。
§6.1 快速上手
# ---------------------------------------------------------------
# 环境与目录约定(与 §4.0 目录树一一对应)
# data_root/
# data/patient/pedsf_or_core_patient.v8xport <- 患者摘要文件
# data/claims/medpar/ <- 住院理赔(示例用)
# data/enrollment/denominator/ <- 参保资格逐年记录
# 说明:
# 1. data_root 是你 DUA 获批后解压数据的根路径,代码里所有路径
# 都从 data_root 拼接而来,不写死盘符。
# 2. 最小可用子集 = 患者摘要文件 + 一类理赔文件(如 MedPAR)+
# 参保资格文件,即可完成"队列构建 + 住院事件"闭环。
# 3. SAS 传输格式用 pandas.read_sas 直接读取,无需 SAS 软件。
# ---------------------------------------------------------------
import pandas as pd
from pathlib import Path
data_root = Path("/path/to/seer-medicare") # 换成你的实际解压路径
patient_fp = data_root / "data/patient/pedsf_or_core_patient.v8xport"
df_patient = pd.read_sas(patient_fp, format="xport", encoding="latin-1")
# 患者摘要文件:一位患者一行,是全部后续分析的骨架
print(f"患者数: {len(df_patient):,},字段数: {df_patient.shape[1]}")
print(df_patient.head(3).T) # 转置查看,避免宽表折行
上手检查三件事:① 患者数与你的 DUA 批复范围一致;② 关键标识(患者 ID)无重复;③ 诊断年份分布与你申请的窗口一致。任何一条不符,先联系 NCI 项目官员再动手建模。
§6.2 数据获取
| 步骤 | 动作 | 入口/材料 | 周期参考 |
|---|---|---|---|
| 1 | 先取得 SEER Research Plus Data 访问权 | SEER 数据申请系统(Signed-letter/DUA 流程) | Specialized Databases 的前置条件 |
| 2 | 注册 SEER*Stat 账号 | seer.cancer.gov | 需要用户名作为申请材料 |
| 3 | 提交 Specialized Database 申请 | SEER*Stat 用户名 + SEER-Medicare DUA + Project Description + Specialized Database DUA + Signing Official Attestation | 机构签署官(Signing Official)签批 |
| 4 | 等待合规审查(隐私/境外限制) | SEER Specialized Data Request System | 视申请复杂度 |
| 5 | 接收分发介质并解压到美国境内受控环境 | 数据 + 官方 data dictionary | 分发形态视获批变体 |
| 6 | 发表前送审 | 稿件经原申请系统提交(仅审隐私,不评科学价值) | 投稿评审前完成 |
# 申请材料自检清单(提交前逐项确认)
materials = {
"seer_stat_username": "SEER*Stat 账号名",
"seer_medicare_dua": "SEER-Medicare 数据使用协议(签署完成)",
"project_description": "研究计划描述(数据需求与用途)",
"specialized_db_dua": "Specialized Database 专用 DUA(签署完成)",
"signing_official_attestation": "机构签署官证明",
}
assert all(materials.values()), "存在未准备的申请材料"
§6.3 预处理全流程
完整 Pipeline:SAS 读取 → ABFFS 队列构建 → 诊断月锚定 → 特征矩阵。以下代码块超过 30 行,已折叠。
<details>
<summary><b>点击展开:队列构建与预处理完整代码</b></summary>
import numpy as np
import pandas as pd
from pathlib import Path
data_root = Path("/path/to/seer-medicare")
# ---------- 步骤 1:读取患者摘要与参保资格 ----------
df_patient = pd.read_sas(
data_root / "data/patient/pedsf_or_core_patient.v8xport",
format="xport", encoding="latin-1",
)
df_enroll = pd.read_sas(
next((data_root / "data/enrollment/denominator").glob("*.v8xport")),
format="xport", encoding="latin-1",
)
# ---------- 步骤 2:构建 ABFFS 队列 ----------
# 官方定义:诊断前 12 个月至诊断后 1 个月连续 Parts A/B FFS。
# 按月索引检查 [dx_month-12, dx_month+1] 共 14 个月全部 FFS。
def month_index(dx_year: int, dx_month: int) -> int:
return dx_year * 12 + (dx_month - 1)
def is_cont_ffs(row, ffs_lookup, window_before=12, window_after=1) -> bool:
key = row["patient_id"]
m0 = month_index(row["dx_year"], row["dx_month"])
months = [m0 - i for i in range(window_before, 0, -1)] + \
[m0, m0 + window_after]
ffs = ffs_lookup.get(key, {})
return all(ffs.get(m, 0) == 12 for m in months) # 当月 12 个月 FFS
# ffs_lookup: {patient_id: {month_index: ffs_months}},由 df_enroll 展开
ffs_lookup = (
df_enroll.assign(month_idx=df_enroll["year"] * 12 + df_enroll["month"] - 1)
.groupby("patient_id")[["month_idx", "ffs_months_a_b"]]
.apply(lambda g: dict(zip(g["month_idx"], g["ffs_months_a_b"])))
.to_dict()
)
abffs = df_patient[df_patient.apply(lambda r: is_cont_ffs(r, ffs_lookup), axis=1)]
print(f"ABFFS 队列: {len(abffs):,} 人(MA 参保月份已被定义排除)")
# ---------- 步骤 3:诊断月锚定(相对月坐标系) ----------
# 所有理赔时间换算为相对诊断月的整数月,杜绝日历时间穿越。
def to_rel_month(claim_year, claim_month, dx_year, dx_month) -> int:
return (claim_year * 12 + claim_month - 1) - \
(dx_year * 12 + dx_month - 1) # 诊断前为负、后为正
# ---------- 步骤 4:基线特征矩阵(仅用诊断前窗口,防泄漏) ----------
baseline_window = (-12, -1) # 诊断前 12 个月
def build_features(patient_id, claims_df):
c = claims_df[claims_df["patient_id"] == patient_id].copy()
c["rel_month"] = [
to_rel_month(y, m, dy, dm)
for y, m, dy, dm in zip(c["year"], c["month"],
c["dx_year"], c["dx_month"])
]
base = c[c["rel_month"].between(*baseline_window)]
return pd.Series({
"n_ip_admits_base": base.loc[base["file"] == "medpar", "claim_id"].nunique(),
"n_op_visits_base": base.loc[base["file"] == "outpatient", "claim_id"].nunique(),
"n_phys_claims_base": (base["file"] == "nch").sum(),
"has_any_base_claim": int(len(base) > 0),
})
feature_matrix = pd.DataFrame(
[build_features(p, claims_df) for p in abffs["patient_id"]],
index=abffs["patient_id"].values,
)
</details>
三个关键纪律:① 队列筛选必须先于任何特征统计(否则 MA 缺口污染分布);② 一切时间变量进入相对月坐标系后再比较;③ 特征只取基线窗,治疗标签与特征窗的边界在代码里显式声明。
§6.4 PyTorch DataLoader
以"诊断后 90 天死亡预测"为例(特征 = 基线窗,标签 = 诊断后 30-90 天事件;超过 30 行,已折叠)。
<details>
<summary><b>点击展开:Dataset 类与 DataLoader 完整代码</b></summary>
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
from sklearn.model_selection import GroupKFold
class SeerMedicareTabDataset(Dataset):
"""患者级表格数据集。
X: 基线特征(诊断前 12 个月构造,见 §6.3)
y: 二值标签(诊断后第 30-90 天内死亡 = 1)
groups: patient_id,用于 GroupKFold 防止患者级泄漏
"""
def __init__(self, X: pd.DataFrame, y: np.ndarray,
groups: np.ndarray, mean=None, std=None):
self.X = torch.tensor(
np.asarray(X, dtype=np.float32), dtype=torch.float32)
self.y = torch.tensor(y, dtype=torch.float32)
self.groups = groups
self.mean = X.mean(0) if mean is None else mean
self.std = X.std(0).replace(0, 1) if std is None else std
def __len__(self):
return len(self.y)
def __getitem__(self, idx):
x = (self.X[idx] - torch.tensor(
np.asarray(self.mean, dtype=np.float32))) / torch.tensor(
np.asarray(self.std, dtype=np.float32))
return x, self.y[idx]
def make_loaders(feature_matrix, labels, patient_ids,
n_splits=5, batch_size=512, fold=0):
gkf = GroupKFold(n_splits=n_splits) # 组 = patient_id
tr_idx, va_idx = list(gkf.split(feature_matrix, labels,
groups=patient_ids))[fold]
ds_tr = SeerMedicareTabDataset(
feature_matrix.iloc[tr_idx], labels[tr_idx], patient_ids[tr_idx])
ds_va = SeerMedicareTabDataset(
feature_matrix.iloc[va_idx], labels[va_idx], patient_ids[va_idx],
mean=ds_tr.mean, std=ds_tr.std) # 统计量只来自训练折
return (
DataLoader(ds_tr, batch_size=batch_size, shuffle=True,
num_workers=2, drop_last=True),
DataLoader(ds_va, batch_size=batch_size, shuffle=False),
)
# 用法示例:
# labels = build_death_label(df_patient, horizon=(30, 90)) # 由死亡日期派生
# train_loader, val_loader = make_loaders(
# feature_matrix, labels.values,
# patient_ids=feature_matrix.index.values)
</details>
§6.5 坑点清单(8 个真实失败模式)
⚠️ 坑点 1:Medicare Advantage 幽灵队列(分类:偏倚陷阱)
问题:Medicare Advantage(MA)参保人的服务由私人计划管理,传统理赔文件中基本无记录;官方派生的共病与治疗指标又集中在排除 MA 的 ABFFS 队列。MA 已占 2023 年 Medicare 人口的 51%,若不筛选,一半人群进入"数据黑洞"。
症状:大量患者登记信息完整但理赔近乎为空;治疗率/住院率随诊断年份推进系统性走低(MA 渗透率上升);共病指标大面积缺失。
解决:
- 简单方法:用参保资格文件中的 FFS 月数限定分析人群为连续 FFS(即 ABFFS 定义),MA 月份期间的服务不纳入任何统计。
- 进阶方法:对 FFS/MA 混合患者构造月级 coverage 指示矩阵,特征与结局只在与研究窗重叠的 FFS 月份内计算,并把 MA 月数作为缺失指示特征。
- SOTA 方法:把 MA 数据缺口当测量问题建模——参照 Warren et al. 2023 的对照评估框架,用 MA encounter data 与 SEER 双源估计可识别率(诊断敏感性 92%+、手术敏感性 90%+),对 FFS 限定导致的入选偏倚做敏感性分析并在论文中显式声明。
参考:SEER-Medicare Specialized Databases 官方局限说明;Warren JL et al. Med Care. 2023;61(12):846-857. DOI 10.1097/MLR.0000000000001936
⚠️ 坑点 2:未理赔 ≠ 未治疗(分类:标签理解)
问题:治疗指标从理赔编码派生,而理赔只在 Medicare 是主要付费方时才存在;患者另有雇主团险等第一付费方时,服务可能根本不向 Medicare 申报,导致治疗假阴性。
症状:65-69 岁仍在职的患者化疗/放疗识别率异常偏低;同一患者 SEER 登记记录了治疗而理赔侧找不到对应服务。
解决:
- 简单方法:治疗率同时报告 SEER 与 Medicare 两个口径,差异本身作为数据质量指标。
- 进阶方法:按年龄与参保特征分层检验假阴性集中区;对"SEER 有、理赔无"的患者做 missing-claim 指示变量而非直接归为 0。
- SOTA 方法:限定连续 FFS 队列后仍做双源敏感性分析(官方发表要求承认并讨论该局限);识别具体药物暴露时优先使用 Part D 的 NDC 级事件(受第一付费方影响较小)。
参考:官方数据局限与分析注意事项;Warren JL et al. “Utility of the SEER-Medicare data to identify chemotherapy use.” Med Care. 2002;40(8 Suppl):IV-55-61. DOI 10.1097/01.MLR.0000020944.17670.D7
⚠️ 坑点 3:多原发癌的理赔归属歧义(分类:预处理陷阱)
问题:患者存在两个及以上原发癌时,理赔的 ICD/服务码不指明该服务针对哪个肿瘤;大量研究因此只保留第一原发癌,而随着生存期延长,多原发癌患者占比持续增长,被排除人群的治疗证据被系统性丢弃。
症状:多原发癌患者的治疗指标"双高"(两个肿瘤的服务混在一起);限定 first primary 后样本量骤减且人群明显偏向早期病程。
解决:
- 简单方法:限定第一原发癌并在方法学部分声明排除比例。
- 进阶方法:按诊断时序做归属——第二次诊断前的服务归第一肿瘤、其后归第二肿瘤,对诊断间窗(overlap)显式定义规则。
- SOTA 方法:采用 NCI 开发的将理赔化疗归属到特定肿瘤的方法(见 Enewold et al. 2020),并在敏感性分析中比较归属规则对治疗率的影响。
参考:Enewold L, Parsons H, Zhao L, et al. “Updated Overview of the SEER-Medicare Data: Enhanced Content and Applications.” JNCI Monographs. 2020;55:3-13
⚠️ 坑点 4:数据滞后与理赔成熟度陷阱(分类:工程陷阱)
问题:服务发生到进入研究文件平均滞后 2-3 年,且 CMS 要求理赔充分成熟后才定稿;数据库最末 1-2 个年份的事件系统性不完整。
症状:按诊断年份绘制治疗率/住院率/费用,末端年份突然"跳水";用最新年份训练的模型把"数据不成熟"学成了"风险下降"。
解决:
- 简单方法:结局分析截断到"成熟年份"(例如当前版本下理赔至 2022,则结局窗避开最后 1-2 年)。
- 进阶方法:对每个诊断年计算可用理赔月数(runout),把 runout 不足的患者从结局评估中删失并记录比例。
- SOTA 方法:为成熟度建模——对末端年份放宽置信区间或按 runout 加权,趋势结论仅在成熟窗口内声明。
参考:Enewold L et al. JNCI Monographs. 2020;55:3-13(2-3 年滞后与成熟期机制)
⚠️ 坑点 5:Immortal Time Bias(不朽时间偏倚)(分类:偏倚陷阱)
问题:比较"诊断后接受某治疗 vs 未接受"时,治疗组从诊断到治疗开始的存活时间天然存在,若把它当普通随访时间,治疗组被人为赋予"不死"优势。
症状:观察性"治疗延长生存"效应大得反常,甚至与随机对照试验方向或量级不符;审稿人一眼要求处理时间零点。
解决:
- 简单方法:把诊断日期设为统一时间零点,治疗作为时变暴露而非基线分组。
- 进阶方法:landmark 分析(如诊断后 3 个月为锚点重分组)或"诊断后 X 月内治疗"的意向性分类。
- SOTA 方法:目标试验模拟框架——克隆-删失-加权(clone-censor-weight)配合边际结构模型处理治疗-时间混杂。
参考:Hernán MA, Robins JM. “Using Big Data to Emulate a Target Trial When a Randomized Trial Is Not Available.” Am J Epidemiol. 2016;183(8):758-764
⚠️ 坑点 6:共病指数的观察窗前提被破坏(分类:预处理陷阱)
问题:Charlson/NCI 共病指数依赖"诊断前 12 个月连续 FFS"观察窗——只有连续参保,“没看到共病编码"才近似"没有共病”。把观察窗不足的患者混入,共病被系统性低估。
症状:纳入非连续 FFS 患者后共病分布整体左移(偏向 0 分);共病与结局的关联被稀释;不同研究间共病均值不可比。
解决:
- 简单方法:严格按官方队列定义筛选(ABFFS:诊断前 12 个月至诊断后 1 个月连续 Parts A/B FFS)。
- 进阶方法:把"无完整观察窗"单独编码为缺失类别而非 0 分,并报告两类患者基线差异。
- SOTA 方法:对 Part D 队列成员用处方记录补充共病信息(药物治疗的疾病可作代理),并与理赔口径交叉验证。
参考:NCI Comorbidity SAS Macro(2021 版)官方文档;Klabunde CN et al. “Assessing Comorbidity Using Claims Data.” Med Care. 2002;40(8 Suppl)
⚠️ 坑点 7:理赔算法识别复发与并发症的低阳性预测值(分类:评估误用)
问题:用诊断码规则从理赔识别癌症复发、术后并发症等结局时,特异度天然不足——排除性检查(rule-out)、个人既往史编码、无关住院的附带诊断都会制造假阳性;这是 2002 年方法学补充刊反复论证的核心难题。
症状:识别出的"复发率"远超临床流行病学预期;并发症集中出现在高频住院患者身上(住院越多、编码机会越多);用该标签训练的模型在临床复核中表现崩塌。
解决:
- 简单方法:要求多次、跨就诊的独立编码(如间隔 30 天以上两次非相关就诊出现同一诊断)才计为事件。
- 进阶方法:与 SEER 登记字段(新原发癌、死亡)交叉验证,抽样做病历金标准核对并报告 PPV。
- SOTA 方法:改用硬终点(死亡、第二原发癌登记)或正例未标注(PU learning)框架,把理赔规则作为弱标签而非真值。
参考:Earle CC, Nattinger AB, Potosky AL, et al. “Identifying Cancer Relapse Using SEER-Medicare Data.” Med Care. 2002;40(8 Suppl):IV-75-81. DOI 10.1097/00005650-200208001-00011
⚠️ 坑点 8:隐私合规与小样本单元泄漏(分类:数据泄漏)
问题:数据虽经去标识,但仍是受控的个体级联邦数据:出版物中过小的样本单元可能造成再识别;按 CMS 合规数据不得发布至美国境外;发表前须经 NCI 隐私审查。
症状:稿件在送审环节被要求修改表格(小样本单元未掩蔽);把数据或派生文件放上境外云存储/境外协作者邮箱,直接违反 DUA。
解决:
- 简单方法:所有频数表对小样本单元做掩蔽(cell suppression),只报告比率、模型系数与足够大的分组计数。
- 进阶方法:建立输出检查清单——每张表、每个图在导出前过一遍最小单元数检查;协作者访问仅限美国境内并记录于项目文档。
- SOTA 方法:代码与数据分离——分析代码经审计后在受控环境运行,仅输出合规统计量;2027-03 起直接采用安全飞地工作流(代码入飞地、结果出飞地)。
参考:SEER-Medicare Specialized Databases Publication Policy
§6.6 数据增强(安全 ✅ / 危险 ❌)
| 操作 | 判定 | 说明 |
|---|---|---|
| 患者级分层重采样(按 site_recode/分期) | ✅ | 保持队列结构均衡,不制造新个体 |
| 特征域正则化(L1/L2、dropout) | ✅ | 表格数据最稳妥的"增强" |
| 诊断前窗口随机窗偏移(±1-2 个月) | ✅ | 模拟申报时点抖动,需同步移动标签边界 |
| SMOTE 等插值合成 | ❌ | 在相对时间坐标系上插值会产生临床上不存在的"患者" |
| 用全量数据统计量标准化 | ❌ | 折间泄漏;统计量只能来自训练折 |
| 按理赔行随机复制过采样 | ❌ | 夸大高频就诊患者权重,扭曲费用/利用分布 |
§6.7 模型推荐
| 模型 | 适用任务 | 起步理由 | 注意事项 |
|---|---|---|---|
| Logistic 回归 / Cox 比例风险 | 治疗模式、生存 | 领域默认可解释基线,审稿友好 | 对共病与分期做样条/交互项 |
| XGBoost / LightGBM | 表格结局预测、费用 | 表格数据性价比最高 | 用 GroupKFold + 早停 |
| DeepSurv / DeepHit | 生存建模 | 可捕捉非线性与竞争风险 | 需大样本;报告 C-index 与校准 |
| GRU / Transformer(理赔序列) | 服务轨迹建模 | 理赔天然是事件序列 | 先按相对月对齐;序列长度截断策略要透明 |
| IPW / 边际结构模型 / TMLE | 治疗比较因果推断 | 处理时变混杂的标准工具 | 配合坑点 5 的时间零点纪律 |
§6.8 硬件需求
| 场景 | 最低配置 | 建议 |
|---|---|---|
| 队列构建与表格模型 | 16 GB RAM、8 核 CPU | 64 GB RAM(理赔聚合吃内存)、NVMe SSD |
| 理赔序列模型(数千万行级) | 64 GB RAM、GPU(单张 24 GB) | 多 GPU 或按登记区分块训练 |
| 全流程开发 | 本地 SAS 免环境(pandas 读取) | versioned 数据快照 + 特征缓存 |
§6.9 评估指标代码
import numpy as np
from sklearn.metrics import roc_auc_score, average_precision_score
def evaluate_binary(y_true, y_prob):
return {
"AUROC": roc_auc_score(y_true, y_prob),
"AUPRC": average_precision_score(y_true, y_prob), # 结局不平衡时优先
}
def concordance_index(event_time, event_observed, risk_score):
# 生存任务:倾向用 sksurv.metrics.concordance_index_censored
from sksurv.metrics import concordance_index_censored
c = concordance_index_censored(
event_observed.astype(bool), event_time, risk_score)
return c[0] # C-index
def subgroup_gap(y_true, y_prob, group):
# 公平性检查:各亚组(如种族/性别)AUROC 之差
aurocs = {g: roc_auc_score(y_true[group == g], y_prob[group == g])
for g in np.unique(group)}
return max(aurocs.values()) - min(aurocs.values()), aurocs
§6.10 MLOps 笔记
- 数据版本即 DUA 版本:实验配置中记录 linkage version、数据库变体(SEER 17/22)与提取日期;跨版本比较结果属于不同数据集。
- 合规即流水线:把 cell suppression 与境外环境检查写成 CI 步骤,输出物先过检查再离开受控环境。
- 队列定义即代码:ABFFS/Part D 队列筛选用版本化代码而非手工筛选,保证同行可复现。
- 发表前送审入流程:投稿日历里把 NCI 隐私审查排为投稿前的硬性节点(不评科学价值,仅审保密性)。
- 漂移监控:跟踪 ICD-9→ICD-10 切换(2015-10-01)、MA 渗透率与理赔滞后三类结构性断点,任何跨期模型上线前重估校准。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解方式 |
|---|---|---|---|
| MA 选择偏倚 | ABFFS 等指标队列系统性排除 Medicare Advantage 参保人(2023 年占 Medicare 人口 51%),MA 人群共病与治疗信息缺失 | 高 | 连续 FFS 队列限定 + MA 缺口敏感性分析(坑点 1) |
| 治疗识别假阴性 | Medicare 非主要付费方时无理赔,治疗被漏检 | 高 | 双源(SEER×理赔)口径并报、missing-claim 指示(坑点 2) |
| 泛化性偏倚 | SEER 地区老年人口更城市化、贫困率更低、HMO 参保更高、癌症死亡率更低(Warren 2002) | 中 | 外推结论加地理/人群修正声明 |
| 年龄范围截断 | 65 岁以下基本不可及,结论不能外推年轻人群 | 中 | 明确声明适用人群 |
| 编码测量偏倚 | 理赔编码以报销为目的,rule-out 与既往史码产生假阳性 | 中 | 多次编码规则、与登记交叉验证(坑点 7) |
| 成熟度偏倚 | 最末 1-2 年事件不完整(2-3 年滞后) | 中 | 结局窗避开未成熟年份(坑点 4) |
§7.2 标注质量
SEER 登记字段由认证登记员按 NAACCR 标准编码,接受项目级质量审计,分期、组织学与死亡日期可视为人口级金标准;理赔侧"标注"是行政副产品,其质量取决于编码制度而非人工审核;NCI 派生指标(共病、治疗、放疗)规则公开、经同行评审,属于可复现的弱金标准。
| 字段族 | 质量等级 | 依据 |
|---|---|---|
| 年龄、性别、诊断部位/组织学 | 高 | 登记审计体系 + Bach et al. 2002 准确性评估 |
| 死亡日期 | 高 | 登记与 SSA/CMS 链接,Bach et al. 2002 认为可信 |
| 种族/族裔 | 中,需谨慎 | Bach et al. 2002 明确提示 |
| SES(收入代理) | 中 | 推荐使用收入中位数代理(Bach et al. 2002) |
| 治疗指标 | 中低(假阴性已知) | 理赔派生 + 非主要付费方漏检机制 |
| 复发/并发症事件 | 低-中 | 理赔识别低阳性预测值(Earle et al. 2002) |
§7.3 泛化性
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 65 岁以下患者 | 高:数据基本缺失 | Medicare 资格结构;官方数据库定义 |
| MA 占比高的地区与年份 | 高:理赔缺失、指标队列排除 | 官方 ABFFS 定义;MA 占 51%(2023) |
| 全美非 SEER 地区 | 中高:SEER 地区人口构成与全美有系统差异 | Warren et al. 2002 泛化性比较 |
| 生物标志物驱动的任务 | 高:理赔无检验结果值 | Enewold et al. 2020 局限讨论 |
| 非美国医疗体系 | 高:编码与支付体系不可迁移 | 数据结构本质 |
§7.4 伦理
数据涉及联邦受益人个体级信息:访问须签署 NCI DUA 与 Specialized Database DUA,接受 CMS 合规约束(不得发布至美国境外);发表前稿件须经 NCI 隐私审查(不评科学价值,仅审保密性);出版物须对小样本单元做掩蔽。数据属于公共卫生监测与行政数据的二次利用,不包含直接标识符,但仍按敏感个人信息管理。任何衍生数据集的再分发均被 DUA 禁止。
对 AI 团队的具体约束映射:
| 伦理要求 | 技术落点 |
|---|---|
| DUA 签署与机构签署官证明 | 访问流程第 3 步(§6.2),材料缺失直接被拒 |
| 境外禁令 | 代码仓库、云环境、协作者地理合规检查 |
| 发表前隐私审查 | 投稿日历硬节点(§6.10 第 4 条) |
| 小样本单元掩蔽 | 输出物 CI 检查(§6.10 第 2 条) |
| 再分发禁止 | 特征文件不得持久化到项目外存储 |
§7.5 公平性
数据集自带公平性研究的两面性:一方面,种族/族裔、登记区地理、Part D 低收入补贴月数等变量使其成为健康差异研究的主力平台;另一方面,字段本身携带测量不平等——种族/族裔编码质量有已知问题(Bach et al. 2002 提示谨慎使用),理赔可及性随保险状态(FFS/MA、第一付费方)系统变化,模型若不加处理会把"理赔少"学成"治疗少"。公平性建模建议:以 race/ethnicity 与 LIS 分层的亚组校准必查(§6.9 subgroup_gap),并在方法学声明中区分"服务利用差异"与"治疗需求差异"。
§7.6 数据漂移
| 漂移源 | 时间点 | 影响 |
|---|---|---|
| ICD-9-CM → ICD-10-CM 切换 | 2015-10-01 | 诊断/操作码体系断裂,跨期编码算法需双码表映射 |
| Part D 计划与处方格局 | 2006 年起持续演变 | 处方事件覆盖与药物分类随时间变化 |
| MA 渗透率上升 | 持续(2023 年达 51%) | 理赔完整人群逐年收缩,队列构成漂移 |
| 登记分期标准演进 | 随 AJCC/SEER 标准版本 | 跨期分期比较需版本对齐 |
| 理赔政策与支付改革 | 持续 | 编码行为与账单结构变化影响事件识别 |
§7.7 DAIMS 数据质量评分
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式可用性 | ✅ | 患者摘要文件一位患者一行,可直接建模 |
| 2 | 唯一标识 | ✅ | 患者级与理赔级标识完整,患者级分组可行 |
| 3 | 特殊字符处理 | ⚠️ | SAS 传输格式编码(latin-1 类)需显式指定,跨平台读取注意 |
| 4 | 重复行检查 | ⚠️ | 理赔多行是业务本质而非错误;行级去重需按服务语义判断 |
| 5 | 缺失编码规范 | ✅ | 官方 data dictionary 明确定义缺失与未知码值 |
| 6 | 标签标识清晰 | ⚠️ | 无单一标签列;治疗指标按队列与医保部分分套,须先取队列交集 |
| 7 | 罕见类分组 | ✅ | SEER site recode 与分期分组已是社区标准 |
| 8 | 偏倚评估 | ✅ | 官方文档与方法学文献对偏倚披露充分 |
| 9 | 数据字典完备 | ✅ | 官方字典覆盖全部字段与取值 |
| 10 | 信息性缺失解释 | ✅ | "无理赔行即无申报事件"机制文档化清楚 |
| 11 | 设备记录 | ⚠️ | 无设备元数据(行政数据本质);以编码系统(CPT/HCPCS)替代描述 |
| 12 | 共线性检查 | ⚠️ | 费用、诊断数、住院天数强相关,建模需自查 VIF |
| 13 | 编码映射 | ✅ | ICD/CPT/HCPCS/NDC 体系完整,另有官方 recode 分组 |
| 14 | 时间戳处理 | ⚠️ | 诊断月锚点 + 服务日期与申报日期分离,需自行实现相对月坐标系 |
| 15 | 划分建议 | ⚠️ | 官方无 ML 划分;需自建患者级分组划分(本页 §5 给出方案) |
| 16 | 泄漏讨论 | ⚠️ | 官方未讨论 ML 泄漏;本页 §5.3 提供完整清单 |
| 17 | 标签分布 | ⚠️ | 治疗/结局分布需自行统计,随队列定义而变 |
| 18 | 测量偏倚 | ✅ | 理赔报销导向的测量偏倚有大量文献支撑 |
| 19 | 外部验证建议 | ✅ | SEER-MHOS/CAHPS/Medicaid、NCDB 等官方链接资源可作外部验证 |
| 20 | 版本记录 | ✅ | 链接版本时间轴清楚(1991 首发、约每两年更新、2024 版) |
| 21 | 预处理脚本 | ⚠️ | 官方提供 SAS Macro(共病),Python 预处理需自建 |
| 22 | 合规要求 | ✅ | DUA、发表审查、境外禁令明确成文 |
| 23 | 多模态对齐 | ⚠️ | 纯结构化数据,无影像/文本模态,该检查项不适用 |
| 24 | 去标识化 | ✅ | 直接标识符替换为研究 ID,受控访问 + 小样本单元掩蔽 |
DAIMS 评分:18.5 / 24
评分解读:13 项 ✅、11 项 ⚠️、0 项 ❌。这是一个"行政数据里文档最完善、文档完善里最需要领域工程"的数据集:缺失编码、偏倚披露、版本记录、合规要求都达到最高水准,扣分集中在"为机器学习准备"的环节——无官方划分、无 Python 预处理、标签体系需研究者自行组织。11 项 ⚠️ 中约一半是数据本质(行政理赔无设备元数据、无生物标志物),不可修复,只能声明;另一半(划分、泄漏讨论、预处理脚本)是社区尚未沉淀的可改进项。
对你意味着什么:① 把 60% 以上的工程预算投给队列构建与特征窗纪律(§6.3),而不是模型结构——在这个数据集上,"谁被纳入、特征窗在哪截止"对结果的影响远大于模型选择;② 不要期望开箱即得的标签列,先画清"队列 → 指标套件 → 标签"的派生图;③ 论文/模型卡里主动披露 MA 缺口、治疗假阴性与成熟度截断,这三项是审稿人对 SEER-Medicare 研究的固定质疑点;④ 如果你的任务强依赖生物标志物或影像,换数据集,这里没有。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| MA encounter data(2015-2017 确诊乳腺癌/结直肠癌/前列腺癌/肺癌,186,449 例、38% 在 MA) | NCI/IMS(Warren et al. 2023) | 以 SEER 为参照识别癌症诊断与治疗 | 诊断敏感性 92%+;手术敏感性 90%+、特异性 >84%(乳腺癌仅 52%);化疗 Kappa 0.61-0.82;放疗 Kappa >0.75 | MFFS 理赔的对照结果与 MA 相似 | MA 数据可补 MA 缺口,但手术特异性在乳腺癌偏低,治疗一致性依癌种而异 |
§8 基准性能与生态
§8.1 代表性研究表现(无统一排行榜说明)
SEER-Medicare 是研究型证据数据集,不存在 Kaggle 式统一排行榜;不同研究的队列定义、版本与结局各异,数值不可直接比较。下表列出可直接引用的官方对照评估结果:
| 研究 | 任务 | 关键数值 | 完整引用 | 代码 |
|---|---|---|---|---|
| Warren et al. 2023 | MA encounter data 识别诊断与治疗 | 诊断敏感性 92%+;化疗 Kappa 0.61-0.82 | Warren JL, Parsons HM, Mariotto AB, Boyd E, Enewold L. Med Care. 2023;61(12):846-857. DOI 10.1097/MLR.0000000000001936 | 未公开 |
| Warren et al. 2002 | 泛化性基线(SEER 老年 vs 全美) | SEER 地区白人比例与贫困率更低、城市化更高、HMO 参保更高 | Warren JL, Klabunde CN, Schrag D, Bach PB, Riley GF. Med Care. 2002;40(8 Suppl):IV-3-18. DOI 10.1097/01.MLR.0000020942.47004.03 | 未公开 |
| Bach et al. 2002 | 人口学/SES/死亡日期字段准确性 | 死亡日期可信度高;种族/族裔需谨慎;SES 推荐收入中位数代理 | Bach PB, Guadagnoli E, Schrag D, Schussler N, Warren JL. Med Care. 2002;40(8 Suppl). DOI 10.1097/00005650-200208001-00003 | 未公开 |
| Earle et al. 2002 | 复发识别算法 | 论证理赔识别复发的低阳性预测值问题 | Earle CC, Nattinger AB, Potosky AL, et al. Med Care. 2002;40(8 Suppl):IV-75-81. DOI 10.1097/00005650-200208001-00011 | 未公开 |
§8.2 SOTA 总结与选型建议
该数据集的"最强表现"不是单一模型分数,而是方法学成熟度:治疗识别(化疗/放疗/手术)、共病度量(Charlson/NCI 指数)、费用核算均有一经发表即可复用的规则算法。选型建议:新任务先复用 2002 补充刊与 NCI 派生指标作为基线,再叠加机器学习;因果类问题直接进入目标试验模拟框架(§6.5 坑点 5)。
§8.3 评测协议
可复现研究的最小协议:
| 协议项 | 具体要求 |
|---|---|
| 版本固定 | 声明 linkage version 与数据库变体(SEER 17/22,excl 口径) |
| 队列定义公开 | ABFFS/Part D 资格、癌种、年份窗、first primary 限定全部写成代码 |
| 窗口边界声明 | 特征窗(如诊断前 12 个月)与标签窗显式分离 |
| 敏感性分析 | MA 缺口、治疗双口径、成熟度截断三项固定动作 |
| 指标报告 | 表格任务报 AUROC+AUPRC;生存任务报 C-index+校准;亚组差值 |
| 合规节点 | 发表前完成 NCI 隐私审查 |
§8.4 相关数据集
| 数据集 | 来源机构 | 与 SEER-Medicare 的关系 |
|---|---|---|
| SEER Incidence Research Data | NCI | 登记母集(全年龄),SEER-Medicare 的临床骨架 |
| SEER-MHOS | NCI | 登记链接健康结局调查(Medicare Advantage 人群) |
| SEER-CAHPS | NCI | 登记链接患者体验调查 |
| SEER-Medicaid | NCI | 补充 Medicaid 双保险信息 |
| CRWDi(Cancer Research Wide Data) | NCI | 更广的研究型链接数据基础设施 |
| NCDB | 美国外科医师学会 | 医院级癌症登记,覆盖约 70% 新发癌症(医院报告口径) |
§8.5 关键论文 Top 8
- Warren JL, Klabunde CN, Schrag D, Bach PB, Riley GF. Overview of the SEER-Medicare data: content, research applications, and generalizability to the United States elderly population. Medical Care. 2002;40(8 Suppl):IV-3-18. DOI 10.1097/01.MLR.0000020942.47004.03 — 原始方法学总览,全库引用的锚点(Scopus 1,751+,截至 2026-09)。
- Enewold L, Parsons H, Zhao L, et al. Updated Overview of the SEER-Medicare Data: Enhanced Content and Applications. JNCI Monographs. 2020;55:3-13 — 现代版本的内容增强与局限权威综述。
- Bach PB, Guadagnoli E, Schrag D, Schussler N, Warren JL. Patient Demographic and Socioeconomic Characteristics in the SEER-Medicare Database. Medical Care. 2002;40(8 Suppl) — 字段准确性评估(性别/年龄准、种族谨慎、SES 用收入代理)。
- Warren JL, Harlan LC, Fahey A, et al. Utility of the SEER-Medicare data to identify chemotherapy use. Medical Care. 2002;40(8 Suppl):IV-55-61. DOI 10.1097/01.MLR.0000020944.17670.D7 — 化疗识别算法奠基。
- Virnig BA, Warren JL, Cooper GS, et al. Studying radiation therapy using SEER-Medicare-linked data. Medical Care. 2002;40(8 Suppl):IV-49-54 — 放疗识别方法。
- Cooper GS, Virnig B, Klabunde CN, et al. Use of SEER-Medicare data for measuring cancer surgery. Medical Care. 2002;40(8 Suppl):IV-43-48 — 手术识别方法。
- Earle CC, Nattinger AB, Potosky AL, et al. Identifying cancer relapse using SEER-Medicare data. Medical Care. 2002;40(8 Suppl):IV-75-81 — 复发结局识别的边界条件。
- Warren JL, Parsons HM, Mariotto AB, Boyd E, Enewold L. Evaluation of the Completeness of Managed Care Data to Identify Cancer Diagnoses and Treatments for Patients in the SEER-Medicare Data. Medical Care. 2023;61(12):846-857. DOI 10.1097/MLR.0000000000001936 — MA encounter data 完整性的量化证据。
§8.6 社区活跃度
SEER-Medicare 的社区以学术研究者为主:NCI 通过官方文档、SEER*Stat 培训材料与数据使用者会议支持用户群;方法学讨论主要沉淀在 Med Care、JNCI Monographs 等期刊的方法学论文与 NCI 官方 FAQ;数据申请与合规问题通过 SEER Specialized Data Request System 的官方支持渠道处理。该数据集 2002 年方法学补充刊以单刊形式集中发布,此后每两年一次的数据更新保持稳定的用户活跃度。
活跃度的三个可观察指标:其一,原始方法学论文 Scopus 引用已超过 1,751 次(截至 2026-09),且更新综述(Enewold et al. 2020)与 MA 完整性评估(Warren et al. 2023)持续产出,说明 NCI 在主动维护方法学对话;其二,数据每两年稳定更新(最新为 2024 链接版),并有 Specialized Databases 这类新形态扩展;其三,2027 年安全飞地转型是社区级别的重大工作流变化,官方已提前公告,反映运营方与用户群的持续互动。
§8.7 生态快照
| 资源 | 类型 | 链接 | Star/热度(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| SEER-Medicare 官方主页 | 官方文档 | healthservices.cancer.gov/seermedicare | — | 所有问题的第一入口 |
| Specialized Databases 申请页 | 官方流程 | seer.cancer.gov | — | 变体、材料与发表政策 |
| 链接方法文档 | 官方文档 | healthcaredelivery.cancer.gov/seermedicare | — | 匹配算法与匹配率 |
| NCI Comorbidity SAS Macro(2021 版) | 官方工具 | 随数据文档分发 | — | 共病指数参考实现 |
| SEER*Stat 软件 | 官方工具 | seer.cancer.gov/seerstat | — | 登记侧官方分析界面 |
| 2002 Med Care 补充刊 | 方法学论文集 | PubMed 12187163 起 | — | 治疗识别与共病算法源头 |
§9 相关资源与引用
§9.1 官方资源
- SEER-Medicare 官方主页(总览、更新公告、安全飞地转型):healthservices.cancer.gov/seermedicare
- Specialized Databases(变体、申请材料、数据局限、发表政策):seer.cancer.gov/data/specialized/available-databases/seer-medicare-request
- 链接方法与匹配率:healthcaredelivery.cancer.gov/seermedicare(Linkage 页)
- SEER 数据总入口与版本说明:seer.cancer.gov/data
- SEER*Stat 数据库文档(SEER 17/22 覆盖比例):seer.cancer.gov/data-software/documentation/seerstat/nov2022
§9.2 BibTeX 引用
@article{warren2002overview,
author = {Warren, Joan L. and Klabunde, Carrie N. and Schrag, Deborah and Bach, Peter B. and Riley, Gerald F.},
title = {Overview of the {SEER-Medicare} data: content, research applications, and generalizability to the {United States} elderly population},
journal = {Medical Care},
volume = {40},
number = {8 Suppl},
pages = {IV-3--IV-18},
year = {2002},
doi = {10.1097/01.MLR.0000020942.47004.03}
}
@article{enewold2020updated,
author = {Enewold, Lindsey and Parsons, Helen M. and Zhao, Limin and others},
title = {Updated Overview of the {SEER-Medicare} Data: Enhanced Content and Applications},
journal = {JNCI Monographs},
volume = {2020},
number = {55},
pages = {3--13},
year = {2020}
}
@article{warren2023evaluation,
author = {Warren, Joan L. and Parsons, Helen M. and Mariotto, Angela B. and Boyd, Eric and Enewold, Lindsey},
title = {Evaluation of the Completeness of Managed Care Data to Identify Cancer Diagnoses and Treatments for Patients in the {SEER-Medicare} Data},
journal = {Medical Care},
volume = {61},
number = {12},
pages = {846--857},
year = {2023},
doi = {10.1097/MLR.0000000000001936}
}
@article{bach2002patient,
author = {Bach, Peter B. and Guadagnoli, Edward and Schrag, Deborah and Schussler, Nicola and Warren, Joan L.},
title = {Patient Demographic and Socioeconomic Characteristics in the {SEER-Medicare} Database: Applications and Limitations},
journal = {Medical Care},
volume = {40},
number = {8 Suppl},
pages = {IV-107--IV-117},
year = {2002},
doi = {10.1097/00005650-200208001-00003}
}
@article{warren2002chemotherapy,
author = {Warren, Joan L. and Harlan, Linda C. and Fahey, Anna and others},
title = {Utility of the {SEER-Medicare} data to identify chemotherapy use},
journal = {Medical Care},
volume = {40},
number = {8 Suppl},
pages = {IV-55--IV-61},
year = {2002},
doi = {10.1097/01.MLR.0000020944.17670.D7}
}
@article{earle2002relapse,
author = {Earle, Craig C. and Nattinger, Ann B. and Potosky, Arnold L. and others},
title = {Identifying cancer relapse using {SEER-Medicare} data},
journal = {Medical Care},
volume = {40},
number = {8 Suppl},
pages = {IV-75--IV-81},
year = {2002},
doi = {10.1097/00005650-200208001-00011}
}
@article{hernan2016target,
author = {Hern{\'a}n, Miguel A. and Robins, James M.},
title = {Using Big Data to Emulate a Target Trial When a Randomized Trial Is Not Available},
journal = {American Journal of Epidemiology},
volume = {183},
number = {8},
pages = {758--764},
year = {2016},
doi = {10.1093/aje/kwv254}
}
§9.3 引用指南
使用该数据集的论文应同时引用:① Warren et al. 2002 原始方法学论文;② 所用数据库版本与变体(含数据提交版本年份);③ 若使用派生指标,引用对应方法学论文(治疗识别、共病度量)。页面数据如需引用可补充本页 URL。
§10 AI 使用声明卡
§10.1 AI 模型列表
本页面生产过程中使用大语言模型辅助完成资料整理、结构起草与代码示例编写;未使用 AI 模型生成医学结论性判断,所有医学与技术事实以 §10.3 所列来源为准。
§10.2 AI 参与范围
| 参与项 | 是否 AI 参与 | 说明 |
|---|---|---|
| 全文初稿起草 | 是 | 大语言模型按编辑部规范起草 |
| 表格与代码示例结构化 | 是 | 初稿生成,人工复核逻辑 |
| 事实核实 | 否 | 人工对照官方文档与同行评审文献 |
| 8 个坑点的事实依据 | 是(起草)/否(核实) | 依据均溯源至官方文档或论文 |
| DAIMS 评分终审 | 否 | 编辑部人工决定 |
| 医学结论性判断 | 否 | 全部以所列来源为准 |
§10.3 输入来源
- Warren JL, Klabunde CN, Schrag D, Bach PB, Riley GF. Med Care. 2002;40(8 Suppl):IV-3-18. DOI 10.1097/01.MLR.0000020942.47004.03(PubMed: 12187163)
- Enewold L, Parsons H, Zhao L, et al. Updated Overview of the SEER-Medicare Data. JNCI Monographs. 2020;55:3-13
- Warren JL, Parsons HM, Mariotto AB, Boyd E, Enewold L. Med Care. 2023;61(12):846-857. DOI 10.1097/MLR.0000000000001936(PubMed: 37796197)
- NCI Healthcare Delivery Research Program,SEER-Medicare 官方主页(healthservices.cancer.gov/seermedicare,2024 链接版数据窗口与安全飞地公告)
- SEER-Medicare Specialized Databases 申请页(seer.cancer.gov,变体定义、申请材料、ABFFS/Part D 队列、数据局限与发表政策)
- NCI SEER-Medicare 链接方法页(healthcaredelivery.cancer.gov/seermedicare,1991 首链、每两年更新、95% 匹配率、2020 版匹配标准)
- SEER*Stat Databases: November 2022 Submission(seer.cancer.gov,SEER 17 = 26.5%、SEER 22 = 47.9% 美国人口,2020 Census)
- Bach PB, Guadagnoli E, Schrag D, Schussler N, Warren JL. Med Care. 2002;40(8 Suppl). DOI 10.1097/00005650-200208001-00003
- Weill Cornell Medicine VIVO 收录页(Warren 2002 Scopus 引用 1,751 次;Bach 2002 引用 243 次)
- Scilit 收录页(2002 Med Care 补充刊系列论文清单)
- SEER 癌症统计演示材料(seer.cancer.gov,SEER 22 人口构成:西班牙裔 25.9%、亚裔/太平洋岛民 9.2%)
- NCI SEER-Linked Databases 总览页(SEER-MHOS、SEER-CAHPS、SEER-Medicaid、CRWDi)
- NCI Comorbidity SAS Macro(2021 版)文档(16 项共病指标、Charlson 评分、NCI 共病指数)
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED 映射、人群统计) | 千方病案医学编辑部 | 与 SEER 官方统计材料及编码浏览器交叉比对 | ✅ 已通过 |
| §3 数据集规格(版本矩阵、变体、覆盖比例) | 千方病案医学编辑部 | 与 NCI 官方页面逐项核对 | ✅ 已验证 |
| §4 数据结构(DAIMS 字段字典、层级) | 千方病案医学编辑部 | 与官方 data dictionary 结构交叉比对 | ✅ 已验证 |
| §5 数据划分策略与泄漏清单 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与 8 个坑点 | 千方病案医学编辑部 | 逻辑审查 + 与官方队列定义/方法学论文比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 代表性研究与引用数表述 | 千方病案医学编辑部 | 与原文及 Scopus 快照交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
除 §10.3 所列来源中直接摘录的事实外,§6 代码示例与 §7.7 评分解读为 AI 辅助起草、人工复核后的内容;全部坑点条目的事实依据均来自官方文档或同行评审文献。
§10.6 最后人工审核日期
2026-09-05
页面状态:published(全部内容已完成审核并发布)
§C 结构化数据(JSON-LD)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- marketscan — 共享标签:电子健康记录 / 公共卫生与流行病学 / 医保理赔 / 卫生服务研究 / 真实世界数据
- ncdb — 共享标签:电子健康记录 / 公共卫生与流行病学 / 医疗登记 / 卫生服务研究 / 真实世界数据
- premier-pinc-ai — 共享标签:电子健康记录 / 公共卫生与流行病学 / 医保理赔 / 卫生服务研究 / 真实世界数据
- GEMINI — 共享标签:电子健康记录 / 公共卫生与流行病学 / 卫生服务研究 / 真实世界数据
- snds — 共享标签:电子健康记录 / 公共卫生与流行病学 / 医保理赔 / 真实世界数据
- meps — 共享标签:电子健康记录 / 公共卫生与流行病学 / 医保理赔 / 卫生服务研究
- cms-medicare-lds — 共享标签:公共卫生与流行病学 / 医保理赔 / 卫生服务研究 / 真实世界数据
- nhs-hes — 共享标签:电子健康记录 / 公共卫生与流行病学 / 卫生服务研究 / 真实世界数据
- ices-ontario — 共享标签:电子健康记录 / 公共卫生与流行病学 / 医疗登记 / 卫生服务研究
- nhis-nhid — 共享标签:电子健康记录 / 公共卫生与流行病学 / 医保理赔 / 卫生服务研究
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

