SEER (NCI) — 美国癌症监测流行病学与最终结局数据库 AI-Ready Wikipedia | 千方医数集

22登记区·48%美国人口·1880万肿瘤记录·1975-2023·49年纵向追踪

来源 美国国家癌症研究所 (NCI) Surveillance Research Program url: https://seer.cancer.gov/发布时间: 2026-08-14最后更新: 2026-08-14 阅读 46

信息速览

数据集名称SEER (NCI) — 美国癌症监测流行病学与最终结局数据库 AI-Ready Wikipedia | 千方医数集
数据类型约1880万肿瘤记录,22个登记区·48%美国人口覆盖,1975-2023年·49年纵向追踪
规模约1880万肿瘤记录
接入方式美国国家癌症研究所 (NCI) Surveillance Research Program url: https://seer.cancer.gov/
AI 就绪度

数据集封面

INFOBOX

| 属性 | 值 |
|||
| 全称 | Surveillance, Epidemiology, and End Results Program |
| 运营机构 | 美国国家癌症研究所 (NCI),癌症控制与人口科学部 (DCCPS),监测研究项目 (SRP) |
| 创立年份 | 1973 年(依据 1971 年《国家癌症法》授权) |
| 覆盖范围 | 22 个登记区域,覆盖美国约 48% 人口 |
| 累计肿瘤记录 | 18,809,827 条(SEER 21,2000-2023,Nov 2025 提交) |
| 年度新增 | ~950,000 例/年 |
| 时间跨度 | 1975-2023(49 年,SEER 8) |
| 核心编码 | ICD-O-3、AJCC TNM 分期、NAACCR 标准 |
| 分析工具 | SEER*Stat v9.0.43(Windows 桌面软件) |
| 数据层级 | 4 级:Research → Research Plus → Specialized → Restricted |
| 许可证 | NCI SEER Data Use Agreement(研究免费,注册制) |
| 访问费用 | Research 免费 / Research Plus 免费(需 eRA Commons)/ SEER-Medicare 付费 |
| ICD-11 映射 | ICD-11 2A00-2F9Z(肿瘤章节)↔ ICD-O-3 Site Recode |
| SNOMED CT | 254837009 (Malignant neoplasm) / 263703002 (Carcinoma) 等 |
| DUO 标签 | NRES: clinical data, no PII (Tier 1); GS: restricted (Tier 2-4) |
| AI 就绪度 | DAIMS 21/24 (87.5%) ⭐⭐⭐⭐☆ |
| 引用规模 | 25,000+ 主要分析 / 126,000+ 引用 |
| 页面状态 | published |

§0 E-E-A-T 信任声明与免责声明

审核机制

维度 声明
内容来源 本文基于 NCI SEER 官方文档(seer.cancer.gov)、SEER*Stat 技术文档、NAACCR 数据标准、同行评审文献(PubMed/PMC 索引)及 SEER 50 周年纪念资料综合撰写
审核方 [千方病案医学编辑部]交叉审核:癌症流行病学方法论、SEER 数据结构与编码体系、AI/ML 生存模型基准
时效性 最近数据提交:November 2025 Submission(2026-04-22 发布),诊断年份 1975-2023,随访截止 2023-12-31
利益冲突 本文作者与 NCI 无利益关联。千方病案为独立数据集索引平台,不代表 NCI 官方立场
可信信号 NCI 是美国联邦政府 HHS 下属 NIH 的 27 个研究所之一;SEER 自 1973 年持续运行 53 年,是国际癌症登记数据的金标准
可验证性 所有关键数据点附原始来源 URL,读者可自行访问 seer.cancer.gov 验证

免责声明

⚠️ 本条目为数据集百科索引,不构成医学建议。SEER 数据为去标识化汇总数据,不可用于个体化临床决策。癌症治疗请咨询执业肿瘤科医师。SEER 数据引用须遵守 NCI SEER Data Use Agreement,禁止重新识别参与者。

§1 数据集概览

§1.0 30 秒速览

SEER 是什么? 美国国家癌症研究所 (NCI) 自 1973 年运营的人群癌症登记系统,覆盖美国约 48% 人口,累计收集 1,880 万条肿瘤记录(1975-2023),每年新增约 95 万例。

为什么重要? 它是全球唯一的、覆盖近半个美国人口、持续 49 年、包含诊断时分期和患者长期生存的纵向癌症数据库。没有 SEER,就没有可靠的美国癌症发病率趋势、种族差异和生存统计数据。

AI 研究者该知道什么? SEER 提供结构化表格数据(患者人口统计 + 肿瘤特征 + 分期 + 首次治疗 + 生存月数),通过 SEER*Stat 软件导出为 ASCII/CSV,可直接用于 Python/R 的生存分析和机器学习。它不是影像数据集,但它是开发癌症生存预测模型最权威的金标准数据源。

关键限制: ① 仅覆盖美国 48% 人口(非全国普查);② SEER 区域偏城市化、外国出生比例偏高;③ 缺失率 12-19%(农村/社区医院患者更易缺失);④ 无癌症复发数据;⑤ Research Plus 层级对中国/俄罗斯研究者受限(2025 年 4 月起 NIH 政策)。

§1.1 摘要

SEER (Surveillance, Epidemiology, and End Results) 是美国国家癌症研究所 (NCI) 于 1973 年依据《国家癌症法》(National Cancer Act of 1971) 授权建立的人群癌症监测项目。其前身是 NCI 的「最终结局项目」(End Results Program) 和「第三次全国癌症调查」(Third National Cancer Survey)。SEER 从最初的 5 个州和 2 个大都市区起步,经过 50 余年的扩展,如今已覆盖 22 个登记区域、约 48% 的美国人口,成为全球规模最大、运行时间最长、数据质量最高的人群癌症登记系统。

截至 November 2025 数据提交(2026 年 4 月发布),SEER 21 登记区共收录 18,809,827 条肿瘤记录,诊断年份跨度 2000-2023;其中 SEER 8(最早 8 个登记区)覆盖 1975-2023,达 5,475,910 条记录。SEER 每年新增约 950,000 例癌症病例,是全美唯一包含诊断时分期 (stage at diagnosis) 和患者生存数据的人群癌症登记系统。

SEER 的核心数据采集涵盖五大维度:

  1. 患者人口统计学:年龄、性别、种族(白人/黑人/印第安人/亚裔/太平洋岛民)、西班牙裔族裔、婚姻状况、出生地
  2. 肿瘤特征:原发部位(ICD-O-3,C00.0-C80.9)、形态学(ICD-O-3 组织学编码 8000-9999)、行为(良性/恶性/原位/不确定)、分级(I-IV)
  3. 诊断分期:AJCC TNM(T-原发肿瘤、N-区域淋巴结、M-远处转移)、SEER Summary Stage(局限/区域/远处/未分期)、Collaborative Stage
  4. 首次治疗:手术方式与范围、放射治疗、化疗、激素治疗、免疫治疗(治疗序列与时间)
  5. 生存与随访:生存月数、生命状态(存活/死亡)、死亡原因(癌症特异性 vs 其他原因)、最后联系日期

SEER 数据通过 SEER*Stat(Windows 桌面分析软件,v9.0.43,2026-03-27 发布)进行访问与分析,支持频率统计、发病率计算、生存分析(Kaplan-Meier / 相对生存 / 竞争风险)、患病率估计、多原发肿瘤分析(MP-SIR/SMR)等多种会话类型。数据导出为 ASCII 分隔文本文件(.txt + .dic 字典文件),可直接导入 R、Python、SAS 等分析工具。

SEER 实行四级数据访问体系

层级 名称 内容 门槛 费用
Tier 1 SEER Research 去标识化数据,无地理/日期详情 邮箱注册 + DUA 免费
Tier 2 SEER Research Plus 含县级地理 + 月/年日期 eRA Commons/HHS 账号 + 机构签署 免费
Tier 3 Specialized Databases 普查区社会经济 + 基因检测数据 Tier 2 要求 + NCI 提案审批 免费
Tier 4 Restricted 详细治疗时间序列 + 敏感数据 Tier 3 要求 + IRB 审批 免费

SEER-Medicare 链接数据库是一个独立产品,将 SEER 登记数据与 Medicare 医保报销数据链接,覆盖 65 岁以上癌症患者的医疗服务利用、共病、处方药和治疗效果信息。它需要独立的项目申请(含假设/研究问题/研究计划)、签署 DUA、IRB 审批,并支付成本回收费用(如癌症数据文件 $350、5% 抽样文件 $200)。2027 年 3 月 1 日起,SEER-Medicare 将从物理文件分发转向联邦管理的安全飞地 (enclave) 访问模式。

§1.2 为什么重要

# 维度 说明
1 全球癌症监测金标准 SEER 自 1973 年持续运行 53 年,是国际癌症登记协会 (IACR) 和 NAACCR 认证的数据质量标杆
2 唯一含分期的全美人群数据 SEER 是全美唯一的人群癌症登记系统,包含诊断时分期(AJCC TNM)和患者长期生存数据
3 49 年纵向趋势 SEER 8(1975-2023)提供美国癌症发病率 49 年连续趋势
4 种族/族裔差异洞察 覆盖 42.0% 白人、44.7% 黑人、59.9% AI/AN、70.7% 亚裔、70.3% NHPI、66.3% 西班牙裔
5 AI 生存预测基准 结构化表格数据是开发癌症生存预测机器学习模型的理想训练数据
6 SEER-Medicare 整合 链接 Medicare 报销数据后,可分析 65+ 老年癌症患者的医疗服务利用和成本效果
7 基因组检测链接 通过 Tier 3 专门数据库,链接 OncotypeDX、Decipher、DecisionDX 等基因检测结果
8 政策制定依据 支撑 NCI《年度国家癌症状况报告》和 FDA 药物审批的流行病学基线
9 NAACCR 标准制定者 与 NAACCR 共同制定北美癌症登记数据标准(Version 27,2027 年实施)
10 1,880 万记录规模 庞大的样本量使罕见癌症的统计推断成为可能

§1.3 对比:SEER 与相关癌症数据集

数据集 国家 规模 时间跨度 核心优势 核心限制
SEER (NCI) 美国 1,880 万记录 1975-2023 含分期+生存,49 年趋势 48% 覆盖,偏城市
NPCR (CDC) 美国 全国 97% 人口 1999-2023 全国覆盖 无系统分期/生存
NCDB (CoC) 美国 3,400 万+记录 1985-2023 CoC 医院含治疗详情 医院基础非人群基础
EUROCare 欧洲 100+ 登记区 1990-2013 多国比较 各国编码差异
CONCORD 全球 71 国 2000-2014 全球癌症生存比较 低收入国家数据稀疏
CCSP (中国) 中国 115 登记区 2008-2022 覆盖 5.7 亿人口 编码标准化待提升
ICR (英国) 英国 1,300 万+ 1971-2023 国家全覆盖 仅英国数据
ACD (澳大利亚) 澳大利亚 全国 1982-2023 国家全覆盖 仅澳洲数据

§1.4 时间轴

年份 事件
1971 《国家癌症法》(National Cancer Act) 签署,授权 NCI 建立国家癌症计划
1973 SEER 项目正式启动,数据采集从 1973-01-01 诊断病例开始。初始 7 个登记区
1974-1975 Seattle 和 Atlanta 加入,形成 SEER 9
1978 Rural Georgia(10 个以黑人为主的县)加入
1980 American Indians in Arizona 加入
1983 首次 Certified Tumor Registrar (CTR) 认证考试
1992 Congress 建立 CDC NPCR。SEER 扩展至 Los Angeles 和 San Jose-Monterey
2000 SEER 扩展至 SEER 17:新增 California、Kentucky、Louisiana、New Jersey、Greater Georgia
2001 SEER*Stat 软件发布
2005 Hurricane Katrina/Rita 影响 Louisiana 数据
2018 AJCC 第 8 版 TNM 分期系统实施;Collaborative Stage 转向 SSDI
2020 SEER 扩展至 SEER 22,覆盖约 48% 美国人口
2021 SEER Research Plus 层级引入
2023 SEER 50 周年纪念。JNCI Monographs 出版 50 周年特刊
2024 Nov 2024 提交发布(2025-04):1975-2022。16,354 个 Research 请求
2025-04 NIH 依据 EO 14117 暂停中国/俄罗斯研究者访问 SEER Research Plus
2025-06 SEER Research Data 重新开放中国学者访问
2025-11 November 2025 数据提交:1975-2023,SEER 21 共 18,809,827 条记录
2026-03 SEER*Stat v9.0.43 发布
2026-04 November 2025 提交数据公开发布
2027-03 SEER-Medicare 将转向联邦安全飞地 (enclave) 访问模式

§1.5 核心用例

# 用例 典型研究 输出指标
1 癌症发病率趋势分析 Joinpoint 回归评估结直肠癌发病率转折点 APC、AAPC
2 癌症生存率估计 Kaplan-Meier 估计乳腺癌 5 年相对生存率 5 年相对生存率
3 种族/族裔差异研究 白人 vs 黑人前列腺癌诊断分期分布 分期分布比、IRR
4 AI 生存预测模型 随机森林预测胰腺癌 IV 期生存 AUC、C-index
5 治疗模式分析 SEER-Medicare 分析化疗使用率变化 治疗率%、OR
6 癌症患病率估计 有限持续时间患病率 患病数
7 多原发肿瘤分析 MP-SIR 评估放疗后继发癌症风险 SIR、SMR

§2 医学背景

§2.1 癌症登记概念与编码体系

ICD-11 与 ICD-O-3 映射

SEER 使用 ICD-O-3 对肿瘤部位和形态学进行编码。ICD-O-3 是 WHO 专为肿瘤登记设计的双轴编码系统,与 ICD-11 的肿瘤章节(2A00-2F9Z)存在映射关系。

ICD-11 章节 范围 对应 ICD-O-3 Site Recode SEER 常见癌症
2A00-2A0Z 口腔与唇部恶性肿瘤 C00.0-C14.9 口腔癌、口咽癌
2A21-2A2Z 食管 C15.0-C15.9 食管癌
2A80-2A8Z C16.0-C16.9 胃癌
2A90-2A9Z 结肠 C18.0-C18.9 结肠癌
2B00-2B0Z 直肠 C19.9-C20.9 直肠癌
2B60-2B6Z 肝与肝内胆管 C22.0-C22.9 肝细胞癌
2B70-2B7Z 胰腺 C25.0-C25.9 胰腺癌
2C30-2C3Z 气管/支气管/肺 C33.9-C34.9 非小细胞肺癌
2C60-2C6Z 乳腺 C50.0-C50.9 乳腺癌
2C70-2C7Z 女性生殖器官 C51.0-C58.9 宫颈癌、子宫内膜癌
2C80-2C8Z 男性生殖器官 C60.0-C63.9 前列腺癌、睾丸癌
2C90-2C9Z 泌尿器官 C64.0-C68.9 肾细胞癌、膀胱癌
2D01-2D0Z 脑与中枢神经系统 C70.0-C72.9 胶质瘤、脑膜瘤
2B00-2B0Z 淋巴/造血组织 C81.0-C96.9 淋巴瘤、白血病

SNOMED CT 补充映射

SEER 概念 SNOMED CT 编码
恶性肿瘤 254837009 (Malignant neoplasm)
263703002 (Carcinoma)
腺癌 443961001 (Adenocarcinoma)
鳞状细胞癌 402815007 (Squamous cell carcinoma)
原位癌 285140008 (Carcinoma in situ)
转移 14799000 (Neoplasm, metastasis)
TNM 分期 258219007 (Tumor staging)
AJCC 分期 399423003 (TNM classification)

§2.2 AJCC TNM 分期系统

SEER 记录患者诊断时的 AJCC TNM 分期。TNM 是国际癌症分期标准,评估原发肿瘤 (T)、区域淋巴结 (N) 和远处转移 (M):

分期 定义 5 年生存率范围(全癌种平均)
Stage 0 原位癌(Tis, N0, M0) 90-100%
Stage I 局限性,早期(T1-2, N0, M0) 70-95%
Stage II 局部进展(T1-3, N1, M0) 50-80%
Stage III 区域扩散(T任何, N1-3, M0) 25-60%
Stage IV 远处转移(T任何, N任何, M1) 5-30%

SEER 中 AJCC TNM 经历了多个版本:

  • AJCC 第 3 版(1988-2003)
  • AJCC 第 6 版(2003-2009)
  • AJCC 第 7 版(2010-2017)
  • AJCC 第 8 版(2018 至今):当前标准

⚠️ 坑点:跨 AJCC 版本的分期不可直接比较。SEER 提供「TNM Edition」字段标识使用版本,但历史数据按当时标准编码,未回溯重新分期。

§2.3 SEER Summary Stage 与 Collaborative Stage

除 AJCC TNM 外,SEER 还使用两套分期系统:

SEER Summary Stage(最简单、时间最长):

  • Localized(局限性):肿瘤局限于原发器官
  • Regional(区域扩散):扩散至区域淋巴结或邻近组织
  • Distant(远处转移):远处转移
  • Unstaged(未分期)

Collaborative Stage (CS)(2004-2017):

  • 综合 TNM 各因子 + Site-Specific Factors (SSF)
  • 2018 年起被 AJCC 第 8 版 + SSDI 替代

§2.4 临床转化意义

临床场景 SEER 数据支撑
筛查指南更新 SEER 数据显示结直肠癌在 50 岁以下人群发病率上升,推动筛查年龄从 50 岁降至 45 岁
治疗效果评估 人群水平验证临床试验发现(如早期乳腺癌保乳手术 vs 根治术生存率相当)
种族差异干预 识别黑人乳腺癌诊断时分期更晚、前列腺癌死亡率更高等健康不平等
罕见癌症统计 提供胆管癌、间皮瘤等罕见癌症的人群发病率和生存率
AI 模型验证 生存预测模型在 SEER 人群数据上的外部验证和性能基准

§3 数据集规格

§3.0 版本与数据提交矩阵

SEER 不采用「版本号」而是按年度数据提交 (Data Submission) 发布。每年 11 月各登记区提交数据,NCI 清洗验证后于次年春季发布。

数据提交 发布日期 诊断年份 SEER 21 记录数 SEER 8 记录数
Nov 2025 2026-04-22 1975-2023 18,809,827 5,475,910
Nov 2024 2025-04-22 1975-2022 17,765,845 5,285,250
Nov 2023 2024-04 1975-2022 ~17.5M ~5.25M
Nov 2022 2023-04 1975-2021 ~17M ~5.2M
Nov 2021 2022-04 1975-2020 ~16.5M ~5.1M
Nov 2020 2021-04 1975-2019 ~16M ~5.0M

选择建议:始终使用最新数据提交(Nov 2025)。SEER 每年更新历史数据(回溯修正),新提交的数据在准确性和完整性上优于旧版本。

§3.1 数据来源与登记区

原始 SEER 8(1975+,8.3% 美国人口):Connecticut、Iowa、New Mexico、Utah、Hawaii、San Francisco-Oakland SMSA、Seattle (Puget Sound)、Atlanta (Metropolitan)

扩展登记区(1992+,SEER 12 → 17 → 21 → 22):San Jose-Monterey、Los Angeles、Alaska Natives、Rural Georgia、California (excl SF/SJM/LA)、Kentucky、Louisiana、New Jersey、Greater Georgia、Massachusetts、Illinois 等

种族/族裔覆盖(SEER 22,基于 2020 人口普查):

种族/族裔 SEER 覆盖率
白人 42.0%
黑人 44.7%
印第安人/阿拉斯加原住民 59.9%
亚裔 70.7%
夏威夷原住民/太平洋岛民 70.3%
西班牙裔 66.3%

§3.2 样本统计

November 2025 提交——按登记区分组的肿瘤记录数

登记区分组 诊断年份 全部记录 恶性记录
SEER 21 2000-2023 18,809,827 16,782,305
SEER 21 2023 976,660 843,288
SEER 17 2000-2023 10,944,803 9,709,322
SEER 12 1992-2023 6,016,379 5,375,000
SEER 8 1975-2023 5,475,910 4,953,837

§3.3 数据格式与大小

属性
原生格式 SEER*Stat 内部数据库(.slf 二进制)
导出格式 ASCII 分隔文本(.txt)+ 字典文件(.dic)+ 可选 SAS 代码(.sas)
分隔符 可选:Tab / 逗号 / 空格 / 自定义
数据库大小 SEER 21 全量数据约 2-5 GB(取决于字段选择)
SEER*Stat 平台 Windows 桌面软件(v9.0.43,2026-03-27 发布)
会话类型 Rate / Case Listing / Frequency / Survival / Prevalence / MP-SIR / Left-Truncated Life Table

§3.4 预处理流水线

数据采集 → 登记区提交 → NCI 清洗验证 → SEER*Stat 数据库构建 → 发布
    │            │           │              │                    │
    ▼            ▼           ▼              ▼                    ▼
 医院病案    年度11月    质量控制:       .slf 二进制         每年4月
 报告        提交NCI     - 完整性评估    + 数据字典          研究者
 病理报告               - 重抽象核查    + 变量文档          下载
 放疗记录               - 死亡指数      + 格式说明
 医生办公室              链接(NDI)
 临终关怀
 死亡证明

质量保证流程

  1. 病例发现完整性 (Case-finding Completeness):确保所有报告来源的癌症病例均被捕获
  2. 重抽象与重编码 (Re-abstracting and Re-coding):独立审计样本验证登记准确性
  3. 死亡指数链接 (NDI Linkage):与 National Death Index 链接获取生命状态和死亡原因
  4. NAACCR 认证:每年接受 NAACCR 数据质量认证(金/银/铜级)

§3.5 许可证

层级 许可证 限制 费用
Tier 1: Research NCI SEER DUA 去标识化;禁止重新识别;最小单元格规则 免费
Tier 2: Research Plus NCI SEER DUA + eRA Commons 同上 + 含地理/日期信息 免费
Tier 3: Specialized Specialized Database DUA + NCI 提案 同上 + 基因/社会经济数据 免费
Tier 4: Restricted Tier 3 + IRB 审批 同上 + 纵向治疗时间 免费
SEER-Medicare SEER-Medicare DUA + 项目申请 + IRB 5 年数据保留;项目专用;禁止境外分发 $350 癌症文件 / $200 5% 抽样

地理限制(2025 年 4 月起):

  • SEER Research Data:全球开放(2025 年 6 月起恢复中国学者访问)
  • SEER Research Plus 及以上层级:NIH 依据 EO 14117 暂停「关注国家」研究者访问

§3.6 基金来源

来源 说明
NCI 核心拨款 SEER 22 个登记区的核心运营经费
NIH 联邦拨款 DCCPS/SRP 研究项目经费(2024 年:$52.7M 主要 + $5.3M 次要 + $24.6M 背景)
研发合同 2024 年 $92.9M 研发合同
CMS 合作 SEER-Medicare 数据链接合作
州/地方配套 各登记区所在州/机构配套资金

§3.7 溯源链

NCI (联邦机构)
  └─ DCCPS (Division of Cancer Control and Population Sciences)
       └─ SRP (Surveillance Research Program)
            ├─ SEER Program Manager: Steve Friedman
            ├─ 22 SEER 登记区 (PIs / 机构)
            │    ├─ Connecticut Tumor Registry (CT DPH)
            │    ├─ Iowa Cancer Registry (U of Iowa)
            │    ├─ New Mexico Tumor Registry (UNM)
            │    ├─ Utah Cancer Registry (U of Utah)
            │    ├─ Hawaii Tumor Registry (U of Hawaii)
            │    ├─ Detroit Cancer Surveillance (Wayne State U)
            │    ├─ Northern California Cancer Center (SF-Oakland)
            │    ├─ Cancer Surveillance System (Seattle/Fred Hutch)
            │    ├─ Atlanta SEER Registry (Emory U)
            │    ├─ Los Angeles Cancer Surveillance (USC)
            │    ├─ Greater Bay Area Cancer Registry (SJM)
            │    ├─ Alaska Native Tumor Registry (ANTR)
            │    ├─ Rural Georgia Cancer Registry
            │    ├─ California (rest of state)
            │    ├─ Kentucky Cancer Registry (U of Kentucky)
            │    ├─ Louisiana Tumor Registry (LSU)
            │    ├─ New Jersey State Cancer Registry (Rutgers)
            │    ├─ Georgia Center for Cancer Statistics (Greater Georgia)
            │    ├─ Massachusetts Cancer Registry
            │    ├─ Illinois State Cancer Registry
            │    └─ 其他扩展登记区
            ├─ NCI 承包商: Information Management Services (IMS, Inc.)
            └─ 质量认证: NAACCR

§4 数据结构详解

§4.0 目录树预览

SEER Research Data (Nov 2025 Submission)
│
├── SEER Research (Tier 1)
│   ├── Incidence - SEER 8 Registries (1975-2023)     [5,475,910 records]
│   ├── Incidence - SEER 12 Registries (1992-2023)    [6,016,379 records]
│   ├── Incidence - SEER 17 Registries (2000-2023)    [10,944,803 records]
│   ├── Incidence - SEER 21 Registries (2000-2023)    [18,809,827 records]
│   ├── US Mortality Data (1969-2024)
│   ├── US Population Data (1969-2024)
│   └── Standard Populations
│
├── SEER Research Plus (Tier 2)
│   ├── Incidence - SEER 8/12/17/21 (with county + month/year)
│   └── County Attributes (static + time-dependent)
│
├── Specialized Databases (Tier 3)
│   ├── SEER-Medicare Specialized Databases
│   ├── Genomic Test Linkages (OncotypeDX, Decipher, DecisionDX, etc.)
│   └── Other Specialized Data
│
├── SEER Linked Databases
│   ├── SEER-Medicare (full claims, project-specific)
│   ├── SEER-CAHPS (patient experience)
│   ├── SEER-MHOS (Medicare Health Outcomes Survey)
│   └── SEER-Medicaid
│
└── Software & Tools
    ├── SEER*Stat v9.0.43 (Windows analysis software)
    ├── SEER*Prep v3.0.7 (data conversion)
    ├── SEER*Rx (drug database)
    ├── SEER*RSA (EOD calculator)
    ├── Joinpoint (trend analysis)
    ├── SEER*Explorer (web visualization)
    ├── HD*Calc (health disparities calculator)
    └── NCCR*Explorer / CONCORD*Explorer

§4.1 DAIMS 标准化数据字典

表 1:患者人口统计学变量
变量名 NAACCR # 类型 值域 Tier 描述
Age at Diagnosis 220 Integer 0-130 1 诊断时年龄(岁);另含 20 年龄组
Sex 220 Categorical 1=M, 2=F 1 性别
Race recode Categorical White/Black/Other 1 种族汇总编码
Race/ethnicity Categorical NH White/NH Black/AI-AN/API/Hispanic 1 种族与族裔组合
Spanish Hispanic Origin 190 Categorical 0-9 1 西班牙裔来源
Marital Status at Diagnosis 140 Categorical 1-6, 9 1 诊断时婚姻状况
Birth Place 1410 String 国家/州代码 2 出生地
IHS Link 192 Boolean Y/N 1 印第安人健康服务链接
表 2:肿瘤特征与分期变量
变量名 NAACCR # 类型 值域 Tier 描述
Primary Site 400 String C00.0-C80.9 1 ICD-O-3 原发部位
Histology ICD-O-3 522 String 8000-9999 1 ICD-O-3 组织学编码
Behavior ICD-O-3 523 Categorical /0-/9 1 行为码(良性/恶性/原位/不确定)
Grade 440 Categorical 1-4, 9 1 分级(I-IV + 未定)
Site Recode ICD-O-3/WHO 2008 Categorical ~100 类 1 部位重编码(用于分析)
AJCC TNM Edition 9550 Integer 3-8 1 使用的 AJCC 版本
TNM Pathologic T 880 String T0-T4, TX 1 病理 T 分期
TNM Pathologic N 882 String N0-N3, NX 1 病理 N 分期
TNM Pathologic M 884 String M0-M1, MX 1 病理 M 分期
AJCC Stage Group 910 Categorical 0-IV, Unstaged 1 AJCC 分期分组
SEER Summary Stage 2000 760 Categorical 0/1/2/3/4/9 1 SEER 汇总分期
Tumor Size 770 Integer 0-999 (mm) 1 肿瘤大小(毫米)
Regional Nodes Examined 830 Integer 0-99 1 检查的区域淋巴结数
Regional Nodes Positive 820 Integer 0-97 1 阳性区域淋巴结数
表 3:治疗与生存变量
变量名 NAACCR # 类型 值域 Tier 描述
RX SummSurgery Prim Site 1290 Categorical 0-90 1 原发部位手术代码
RX SummRadiation 1510 Categorical 0-9 1 放疗代码
RX SummChemotherapy 1550 Categorical 0-9 1 化疗代码
RX SummHormone Therapy 1560 Categorical 0-9 1 激素治疗代码
RX SummImmunotherapy 1570 Categorical 0-9 1 免疫治疗代码
Survival Months 856 Integer 0-999+ 1 生存月数
Vital Status 1760 Categorical 0(Alive)/1(Dead) 1 生命状态
Cause of Death 1920 String ICD-10 编码 1 死亡原因
COD to Site Recode Categorical ~100 类 1 癌症特异性死亡(按部位重编码)
Year of Diagnosis 390 Integer 1975-2023 1 诊断年份
Month of Diagnosis 390 Integer 1-12 2 诊断月份(仅 Research Plus)
SEER Registry 40 Categorical 1-22 2 登记区代码
State-County String FIPS 代码 2 州县代码(仅 Research Plus)

§4.2 关键变量编码体系

ICD-O-3 编码结构

ICD-O-3 采用 4+1+4 编码格式:C##.# + M-####/#

示例:C50.9 M-8500/3
      │    │  │  │
      │    │  │  └── 行为码:/3 = 恶性(原发)
      │    │  └───── 组织学码:8500 = 浸润性导管癌
      │    └──────── 分隔符
      └───────────── 部位码:C50.9 = 乳腺,未特指

行为码:/0 良性、/1 交界性、/2 原位癌、/3 恶性原发、/6 恶性转移、/9 不确定

Site Recode 是 SEER 对 ICD-O-3 部位+组织学的分组编码,将 1000+ 种 ICD-O-3 组合映射为 ~100 个分析友好的癌症部位分组。

§4.3 数据获取方式

# 方式 说明 门槛
1 SEER*Stat 软件下载 安装 Windows 版 SEER*Stat,使用凭据登录 Tier 1/2 凭据
2 SEER Research Data 在线请求 seer.cancer.gov/data/access.html 邮箱 + DUA
3 SEER Research Plus 在线请求 Data Request System(eRA Commons + Login.gov eRA Commons + 机构签署
4 SEER-Medicare 项目申请 申请表 + DUA + IRB + 研究计划 项目审批 + 付费
5 SEER*Explorer 在线工具 Web 浏览器直接查询 无需注册
6 NCCR*Explorer Web 查询种族/族裔癌症统计 无需注册
7 CONCORD*Explorer Web 查询全球癌症生存比较 无需注册

§4.4 数据缺失与质量

缺失类型 缺失率 影响 处理建议
分期缺失 (Unstaged) 5-15%(因癌症类型) 无法计算分期特异性生存率 报告 unstaged 比例;多重插补
治疗信息缺失 10-30% 治疗效果分析偏差 使用 SEER-Medicare 补充
种族信息缺失 <2% 种族差异分析限制 使用 IHS 链接补充 AI/AN
系统性缺失 12-19% 高危人群被排除 参见 §6.5 坑点 #2

🔴 2026 年关键发现(Marmor et al., J Am Coll Surg):SEER 中 12-19% 的患者存在系统性的数据缺失,这些患者更多来自非 CoC 认证社区医院和农村地区,生存率显著更低。排除缺失数据的研究可能高估生存率

§4.5 生态工具

# 工具 类型 功能
1 SEER*Stat 桌面软件 核心分析平台(率/频率/生存/患病率/MP-SIR)
2 SEER*Prep 桌面软件 ASCII → SEER*Stat 数据库格式转换
3 SEER*Rx Web 工具 抗肿瘤药物数据库
4 SEER*RSA Web 工具 Extent of Disease (EOD) 计算器
5 Joinpoint 桌面软件 癌症趋势分析(APC/AAPC)
6 SEER*Explorer Web 工具 癌症统计在线可视化
7 NCCR*Explorer Web 工具 种族/族裔癌症统计
8 CONCORD*Explorer Web 工具 全球癌症生存比较
9 HD*Calc 桌面软件 健康差异计算器
10 Observational Research in Oncology Toolbox Web 工具 观察性肿瘤研究标准化
11 SEER Educate Web 平台 CTR 培训与教育
12 NAACCR Metafile 数据工具 数据验证与标准检查

§5 数据划分与使用建议

§5.1 数据划分策略

# 策略 方法 适用场景
1 随机划分 80/20 或 70/30 随机分配 生存预测模型训练/验证
2 按诊断年份划分 训练 2000-2018,验证 2019-2020,测试 2021-2023 时间趋势外推验证
3 按登记区划分 训练 SEER 17,验证新增 4 个登记区 地理泛化验证
4 按种族划分 训练白人/黑人,验证亚裔/西班牙裔 种族公平性评估
5 嵌套交叉验证 5-fold CV × 20 cycles 超参数调优

§5.2 基准配置代码

import pandas as pd
import numpy as np
from sklearn.model_selection import train_test_split
from sklearn.preprocessing import LabelEncoder
from lifelines import CoxPHFitter, KaplanMeierFitter

# 1. 加载 SEER*Stat 导出的 Tab 分隔文件
df = pd.read_csv(''''''''''''''''''''''''''''''''seer_export.txt'''''''''''''''''''''''''''''''', sep=''''''''''''''''''''''''''''''''\t'''''''''''''''''''''''''''''''', low_memory=False)

# 2. 基本预处理
df = df[df[''''''''''''''''''''''''''''''''Site recode ICD-O-3/WHO 2008''''''''''''''''''''''''''''''''] != ''''''''''''''''''''''''''''''''Site recode ICD-O-3/WHO 2008'''''''''''''''''''''''''''''''']
df[''''''''''''''''''''''''''''''''Age recode''''''''''''''''''''''''''''''''] = df[''''''''''''''''''''''''''''''''Age recode''''''''''''''''''''''''''''''''].str.extract(r''''''''''''''''''''''''''''''''(\d+)'''''''''''''''''''''''''''''''').astype(float)
df[''''''''''''''''''''''''''''''''Survival months''''''''''''''''''''''''''''''''] = pd.to_numeric(df[''''''''''''''''''''''''''''''''Survival months''''''''''''''''''''''''''''''''], errors=''''''''''''''''''''''''''''''''coerce'''''''''''''''''''''''''''''''')
df[''''''''''''''''''''''''''''''''Vital status recode''''''''''''''''''''''''''''''''] = df[''''''''''''''''''''''''''''''''Vital status recode''''''''''''''''''''''''''''''''].map({''''''''''''''''''''''''''''''''Alive'''''''''''''''''''''''''''''''': 0, ''''''''''''''''''''''''''''''''Dead'''''''''''''''''''''''''''''''': 1})

# 3. 选择目标癌症(示例:乳腺癌)
breast = df[df[''''''''''''''''''''''''''''''''Site recode ICD-O-3/WHO 2008''''''''''''''''''''''''''''''''] == ''''''''''''''''''''''''''''''''Breast''''''''''''''''''''''''''''''''].copy()

# 4. 特征工程
features = [''''''''''''''''''''''''''''''''Age recode'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''Sex'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''Race recode (W/B/AI/API)'''''''''''''''''''''''''''''''',
            ''''''''''''''''''''''''''''''''Marital status at diagnosis'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''Grade'''''''''''''''''''''''''''''''',
            ''''''''''''''''''''''''''''''''AJCC stage group'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''Surgery'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''Radiation'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''Chemotherapy'''''''''''''''''''''''''''''''']
for col in features:
    if breast[col].dtype == ''''''''''''''''''''''''''''''''object'''''''''''''''''''''''''''''''':
        breast[col] = LabelEncoder().fit_transform(breast[col].astype(str))

# 5. 划分数据
X_train, X_test, y_t_train, y_t_test, y_e_train, y_e_test = train_test_split(
    breast[features], breast[''''''''''''''''''''''''''''''''Survival months''''''''''''''''''''''''''''''''], breast[''''''''''''''''''''''''''''''''Vital status recode''''''''''''''''''''''''''''''''],
    test_size=0.2, random_state=42, stratify=breast[''''''''''''''''''''''''''''''''Vital status recode''''''''''''''''''''''''''''''''])

# 6. 基线模型:Cox 比例风险回归
train_df = X_train.copy()
train_df[''''''''''''''''''''''''''''''''duration''''''''''''''''''''''''''''''''] = y_t_train
train_df[''''''''''''''''''''''''''''''''event''''''''''''''''''''''''''''''''] = y_e_train
cph = CoxPHFitter()
cph.fit(train_df, durationevent-blocked=''''''''''''''''''''''''''''''''duration'''''''''''''''''''''''''''''''', event_col=''''''''''''''''''''''''''''''''event'''''''''''''''''''''''''''''''')
print(f"Cox C-index: {cph.concordance_index_:.4f}")

# 7. XGBoost 5 年生存二分类
import xgboost as xgb
from sklearn.metrics import roc_auc_score
threshold = 60  # 5 年 = 60 个月
y_train_5yr = ((y_t_train <= threshold) & (y_e_train == 1)).astype(int)
y_test_5yr = ((y_t_test <= threshold) & (y_e_test == 1)).astype(int)
xgb_model = xgb.XGBClassifier(n_estimators=200, max_depth=6, learning_rate=0.1)
xgb_model.fit(X_train, y_train_5yr)
auc = roc_auc_score(y_test_5yr, xgb_model.predict_proba(X_test)[:, 1])
print(f"XGBoost 5yr AUC: {auc:.4f}")

§5.3 使用建议

# 场景 建议
1 生存预测模型 使用 Cause-Specific Survival(癌症特异性死亡)而非 Overall Survival
2 发病率趋势 使用 SEER 8(1975+)获取最长趋势;SEER 21(2000+)获取最大覆盖
3 种族差异分析 使用 SEER 12+ 获取扩展种族/族裔编码
4 罕见癌症 使用 SEER 21 获取最大样本量
5 治疗效果 标准数据无详细化疗方案/剂量;使用 SEER-Medicare 获取 65+ 处方药
6 AI 模型训练 导出为 Tab 分隔文本 → Python pandas;分类变量编码使用 LabelEncoder
7 跨年比较 注意 AJCC TNM 版本变化(3rd→8th);2018 年后使用 SSDI 替代 CS
8 发表要求 遵守最小单元格规则(<10 例需抑制);引用数据提交版本和发布日期

§6 AI 就绪指南

§6.0 快速启动

步骤 1: 访问 seer.cancer.gov/data/access.html
步骤 2: 注册 Research Data(邮箱 + DUA)
步骤 3: 等待确认邮件(通常 1-2 天)
步骤 4: 下载并安装 SEER*Stat (Windows)
步骤 5: 使用凭据登录 SEER*Stat
步骤 6: 选择数据库 → Case Listing Session → 选择变量 → 导出
步骤 7: 导入 Python/R 进行 AI 建模

§6.1 Python 快速上手

import pandas as pd
import numpy as np
from lifelines import CoxPHFitter, KaplanMeierFitter
from lifelines.utils import concordance_index
from sklearn.ensemble import RandomForestClassifier
from sklearn.metrics import roc_auc_score
import xgboost as xgb

class SEERDataset:
    """SEER 癌症数据集加载与预处理"""
    def __init__(self, filepath, cancer_site=''''''''''''''''''''''''''''''''Breast''''''''''''''''''''''''''''''''):
        self.filepath = filepath
        self.cancer_site = cancer_site
        self.df = None

    def load(self):
        self.df = pd.read_csv(self.filepath, sep=''''''''''''''''''''''''''''''''\t'''''''''''''''''''''''''''''''', low_memory=False)
        self.df = self.df[self.df.iloc[:, 0] != self.df.columns[0]]
        return self

    def filter_cancer(self):
        site_col = [c for c in self.df.columns if ''''''''''''''''''''''''''''''''Site recode'''''''''''''''''''''''''''''''' in c][0]
        self.df = self.df[self.df[site_col] == self.cancer_site].copy()
        return self

    def preprocess(self):
        self.df[''''''''''''''''''''''''''''''''Survival months''''''''''''''''''''''''''''''''] = pd.to_numeric(
            self.df[''''''''''''''''''''''''''''''''Survival months''''''''''''''''''''''''''''''''], errors=''''''''''''''''''''''''''''''''coerce'''''''''''''''''''''''''''''''')
        self.df[''''''''''''''''''''''''''''''''event''''''''''''''''''''''''''''''''] = self.df[''''''''''''''''''''''''''''''''Vital status recode''''''''''''''''''''''''''''''''].map(
            {''''''''''''''''''''''''''''''''Alive'''''''''''''''''''''''''''''''': 0, ''''''''''''''''''''''''''''''''Dead'''''''''''''''''''''''''''''''': 1})
        self.df[''''''''''''''''''''''''''''''''age''''''''''''''''''''''''''''''''] = self.df[''''''''''''''''''''''''''''''''Age recode''''''''''''''''''''''''''''''''].str.extract(r''''''''''''''''''''''''''''''''(\d+)'''''''''''''''''''''''''''''''').astype(float)
        grade_map = {
            ''''''''''''''''''''''''''''''''Well differentiated; Grade I'''''''''''''''''''''''''''''''': 1,
            ''''''''''''''''''''''''''''''''Moderately differentiated; Grade II'''''''''''''''''''''''''''''''': 2,
            ''''''''''''''''''''''''''''''''Poorly differentiated; Grade III'''''''''''''''''''''''''''''''': 3,
            ''''''''''''''''''''''''''''''''Undifferentiated; anaplastic; Grade IV'''''''''''''''''''''''''''''''': 4
        }
        self.df[''''''''''''''''''''''''''''''''grade''''''''''''''''''''''''''''''''] = self.df[''''''''''''''''''''''''''''''''Grade''''''''''''''''''''''''''''''''].map(grade_map).fillna(0)
        self.df = self.df.dropna(subset=[''''''''''''''''''''''''''''''''Survival months'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''event''''''''''''''''''''''''''''''''])
        return self

    def get_features(self):
        feature_cols = [''''''''''''''''''''''''''''''''age'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''grade'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''Race recode (W/B/AI/API)'''''''''''''''''''''''''''''''',
                        ''''''''''''''''''''''''''''''''Sex'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''Marital status at diagnosis'''''''''''''''''''''''''''''''',
                        ''''''''''''''''''''''''''''''''Surgery'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''Radiation'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''Chemotherapy'''''''''''''''''''''''''''''''']
        X = self.df[feature_cols].copy()
        for col in X.select_dtypes(include=[''''''''''''''''''''''''''''''''object'''''''''''''''''''''''''''''''']).columns:
            X[col] = pd.Categorical(X[col]).codes
        y_time = self.df[''''''''''''''''''''''''''''''''Survival months''''''''''''''''''''''''''''''''].values
        y_event = self.df[''''''''''''''''''''''''''''''''event''''''''''''''''''''''''''''''''].values
        return X, y_time, y_event

# 使用示例
dataset = SEERDataset(''''''''''''''''''''''''''''''''seer_breast_export.txt'''''''''''''''''''''''''''''''', cancer_site=''''''''''''''''''''''''''''''''Breast'''''''''''''''''''''''''''''''')
dataset.load().filter_cancer().preprocess()
X, y_time, y_event = dataset.get_features()
print(f"样本量: {len(X)} | 事件率: {y_event.mean():.3f}")

§6.2 PyTorch 生存模型

import torch
import torch.nn as nn
import torch.optim as optim
from torch.utils.data import Dataset, DataLoader

class DeepSurv(nn.Module):
    """DeepSurv: 深度神经网络生存模型(基于 Cox 偏似然损失)"""
    def __init__(self, input_dim, hidden_dims=[128, 64, 32]):
        super().__init__()
        layers = []
        prev_dim = input_dim
        for dim in hidden_dims:
            layers.extend([
                nn.Linear(prev_dim, dim),
                nn.BatchNorm1d(dim),
                nn.ReLU(),
                nn.Dropout(0.3)
            ])
            prev_dim = dim
        layers.append(nn.Linear(prev_dim, 1))
        self.network = nn.Sequential(*layers)

    def forward(self, x):
        return self.network(x).squeeze(-1)

def cox_partial_likelihood_loss(hazard, time, event):
    sort_idx = torch.argsort(time, descending=True)
    hazard = hazard[sort_idx]
    event = event[sort_idx]
    log_cumsum = torch.logcumsum(hazard.exp(), dim=0)
    loss = -(hazard - log_cumsum) * event
    return loss.sum() / (event.sum() + 1e-8)

§6.3 10 大坑点

# 坑点 严重度 解决方案
1 SEER 区域非全国代表 SEER 偏城市化;结合 CDC NPCR 验证
2 缺失数据系统性偏差 12-19% 系统性缺失;多重插补或报告缺失比例
3 AJCC TNM 版本变更 2018 年从第 7 版切换到第 8 版;使用 SEER Summary Stage 做长期趋势
4 SEER*Stat 仅限 Windows Mac/Linux 需虚拟机或 Wine
5 Research Plus 地理限制 2025-04 起 NIH 限制「关注国家」;中国研究者可用 Tier 1
6 无癌症复发数据 SEER 仅记录首次治疗和最终生存结局
7 治疗信息不完整 仅首次治疗方案(有/无),无药物名称/剂量
8 种族编码变更 种族分类从白/黑/其他演进到多类别
9 SEER-Medicare 年龄限制 仅覆盖 65+ 的 Medicare FFS 参保者
10 数据提交年度差异 每年新提交回溯修正历史数据

§6.4 模型推荐

# 任务 推荐模型 预期性能 参考
1 癌症特异性生存预测 Cox PH + XGBoost C-index 0.70-0.80 常规基准
2 5 年生存二分类 Random Forest AUC 0.75-0.85 多种癌症验证
3 分期特异性生存 Gradient Boosting AUC 0.90-0.95 胰腺癌 IV 期 AUC 0.947
4 罕见癌症预后 Elastic Net AUC 0.65-0.75 小样本场景
5 多时点生存预测 DeepSurv (MLP) C-index 0.72-0.78 深度学习基准
6 AML 预后预测 Random Forest AUC 0.80+ Heliyon 2025
7 肾癌术后生存 Random Survival Forest AUC 0.74-0.75 Sci Rep 2025
8 卵巢癌预后 RF + SMOTE AUC 0.77-0.87 2025
9 发病率趋势预测 Joinpoint 回归 APC + 95% CI 官方工具
10 竞争风险分析 Fine-Gray 模型 sHR + 95% CI R cmprsk

§6.5 硬件配置

# 配置 用途
1 PC (16 GB RAM) SEER*Stat + 小规模导出
2 工作站 (32 GB RAM) SEER 17/21 全量 + Python
3 工作站 (64 GB RAM) SEER-Medicare + 大规模 ML
4 GPU (1× RTX 3090) 深度学习生存模型
5 GPU (2-4× A100) 大规模 Transformer
6 云实例 弹性计算 + SEER-Medicare enclave (2027+)

§6.6 评估指标

# 指标 适用场景
1 C-index (Harrell’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s) 生存预测排序能力
2 AUC-ROC 二分类(5/10 年生存)
3 Brier Score 校准评估
4 Time-dependent AUC 时点生存预测
5 Calibration plot 模型校准可视化
6 Decision Curve Analysis 临床效用评估

§7 质量评估与局限性

§7.1 偏倚分析

# 偏倚 来源 影响 缓解措施
1 地理选择偏倚 SEER 区域偏城市化 发病率可能不代表全美 结合 NPCR 数据验证
2 健康志愿者偏倚 SEER 参与者医疗可及性更好 生存率可能偏高 报告 SEER 区域人口特征
3 缺失数据偏倚 12-19% 系统性缺失 排除缺失数据高估生存率 多重插补;报告缺失比例
4 分期准确性偏倚 非专科医师分期有 22% 重大误差 分期特异性分析偏倚 报告分期质量评估
5 种族分类偏倚 种族编码标准变更 跨年代种族趋势不一致 使用一致种族编码
6 时间偏倚 AJCC TNM 版本变更 跨版本分期不可直接比较 使用 SEER Summary Stage
7 报告完整性偏倚 小型医院病例漏报率更高 发病率可能被低估 NAACCR 认证数据

§7.2 标注质量

维度 评估 说明
病例发现完整性 ≥98% NAACCR 认证要求 ≥90%(金级);SEER 实际 ≥98%
变量准确性 ≥95% 重抽象审计验证关键变量准确率
生命状态随访 ≥95% 通过 NDI 链接获取死亡信息
分期一致性 因部位而异 AJCC TNM 分期一致性因癌症类型和医师专业而异
治疗记录完整性 中等 首次治疗记录较完整;后续治疗/复发无记录
编码标准化 NAACCR 标准统一编码

§7.3 泛化性评估

# 场景 泛化性 说明
1 美国 SEER 区域内 数据直接来自目标人群
2 美国非 SEER 区域 SEER 区域偏城市化
3 全球发达国家 癌症编码和治疗差异
4 低中收入国家 医疗资源差异巨大
5 跨种族/族裔 SEER 覆盖多种族但非完全代表性
6 跨年龄段 SEER-Medicare 仅限 65+
7 AI 模型跨数据集 需在 NCDB/European 数据上外部验证

§7.4 伦理考量

# 议题 SEER 的处理
1 患者隐私 Tier 1 去标识化;Tier 2 增加地理/日期需更强认证
2 重新识别风险 DUA 明确禁止;最小单元格规则
3 知情同意 人群监测项目,使用州法律规定的人群癌症报告数据
4 数据安全 Tier 2-4 需 eRA Commons 认证;SEER-Medicare 需 IRB
5 种族数据使用 用于识别健康差异,须注意种族是社会建构
6 商业使用 Research Data 允许商业研究但需遵守 DUA

§7.5 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 数据集标识符 SEER November 2025 Submission
2 版本信息 按年度提交版本管理
3 创建者/发布者 NCI / DCCPS / SRP
4 许可证条款 4 级访问体系,DUA 明确
5 数据格式 ASCII 分隔文本,广泛兼容
6 数据大小 ~2-5 GB(SEER 21)
7 采集方法 人群癌症登记,标准化编码
8 代表性 48% 美国人口,多种族覆盖
9 时间覆盖 1975-2023,49 年纵向
10 空间覆盖 22 个美国登记区域
11 变量定义 NAACCR 数据字典 + SEER*Stat 文档
12 缺失值 🟡 缺失率 12-19%,系统性偏倚已报告
13 质量保证 NAACCR 认证 + 重抽象审计 + NDI 链接
14 去标识化 Tier 1 完全去标识化
15 使用案例 25,000+ 主要分析论文验证
16 已知偏倚 7 种偏倚明确记录
17 外部验证 NCDB / NPCR / EUROCare / CONCORD 可交叉验证
18 引用 明确引用格式
19 机器可读 ASCII 文本 + SEER*Stat 二进制
20 工具支持 SEER*Stat + Python/R/SAS 兼容
21 分期系统一致性 🟡 AJCC TNM 版本变更
22 治疗信息完整性 🟡 仅首次治疗,无药物/剂量/复发
23 基因组数据 🟡 仅 Tier 3/4 可获取
24 国际可及性 🟡 Tier 1 全球开放;Tier 2+ 限制

DAIMS 总分:21/24 (87.5%) ⭐⭐⭐⭐☆

§7.6 外部验证数据集

# 数据集 来源 用途
1 NCDB American College of Surgeons CoC 医院数据交叉验证
2 NPCR (CDC) CDC 全美 97% 人口覆盖率验证
3 EUROCare-6 European cancer registries 欧洲癌症生存比较
4 CONCORD-3 71 国 全球癌症生存比较
5 CCSP (中国) 中国国家癌症中心 中国癌症发病率对比
6 ICR (英国) Public Health England 国家全覆盖数据对比
7 ACD (澳大利亚) AIHW 国家全覆盖数据对比

§8 基准性能与生态

§8.1 排行榜

任务 1:胰腺癌 IV 期生存预测
排名 模型 AUC 参考
1 Gradient Boosting (GBM) 0.947 JCM 2025, 14(13):4686
2 Neural Network ~0.92 同上
3 Random Forest ~0.90 同上
4 Elastic Net ~0.88 同上
5 Cox PH (baseline) ~0.82 同上
任务 2:AML 生存预测(1/2/3 年)
排名 模型 1 年 AUC 参考
1 Random Forest 0.85+ Heliyon 2025, 11(2):e42030
2 XGBoost 0.83+ 同上
3 Neural Network 0.82+ 同上
任务 3:肾细胞癌(cT1b)术后生存预测
排名 模型 5 年 AUC 参考
1 Random Survival Forest (RSF) 0.746 Sci Rep 2025, 15:38366
2 XGB-AFT ~0.73 同上
3 AJCC TNM (传统分期) 0.663 基线

§8.2 关键论文

# 论文 年份 期刊 核心贡献
1 Hankey BF et al. “The SEER Program: A National Resource” 1999 Cancer Epidemiol Biomarkers Prev 8(12):1117-1121 SEER 项目综述
2 SEER 50th Anniversary JNCI Monographs 2024 JNCI Monographs 50 周年特刊
3 Howlader N et al. “SEER Cancer Statistics Review” 2019 NCI 年度癌症统计综述
4 Edwards BK et al. “Annual Report to the Nation” 2014 Cancer 120:1290-1314 年度国家癌症状况报告
5 Petkov VI et al. “Genomic test results via linkages” 2024 CEBP 基因检测链接数据系统
6 Marmor S et al. “Missing patient information in SEER” 2026 J Am Coll Surg 缺失数据系统性偏差
7 Friedl T et al. “ML for Pancreatic Cancer Survival” 2025 JCM 14(13):4686 胰腺癌 AUC 0.947
8 Liu Y et al. “ML for AML Survival” 2025 Heliyon 11(2):e42030 AML 11 种模型对比
9 Wang Z et al. “RSF for RCC Survival” 2025 Sci Rep 15:38366 RSF 超越 AJCC TNM
10 Zhang M et al. “ML for Ovarian CCC” 2025 肿瘤预防与治疗 38(4):312-321 RF + SMOTE 卵巢癌
11 Hayat MJ et al. “Cancer statistics, trends, and survival” 2007 CA Cancer J Clin SEER 早期统计方法
12 Noone AM et al. “SEER Research and Research Plus Data” 2024 NCI 数据产品比较文档

§8.3 使用统计

指标 2024 年数据
SEER Research Data 请求 16,354
SEER Research Plus 请求 1,883
SEER*Stat 软件下载 16,191
SEER*Stat 分析次数 362,501
SEER 网站页面浏览量 22,000,000+
主要拨款 N=95, $52.7M
研发合同 N=37, $92.9M
使用 SEER 为主要数据的论文 ~25,000 (1975-2024)
引用 SEER 的论文 126,000+
使用 SEER-Medicare 等链接数据的论文 2,600+
# 数据集 关系 说明
1 NPCR (CDC) 互补 CDC 全国癌症登记项目,覆盖 97% 美国人口
2 NCDB (CoC) 互补 医院基础数据库,含更详细治疗信息
3 SEER-Medicare 链接 SEER + Medicare 医保报销数据
4 SEER-CAHPS 链接 SEER + 患者医疗体验评估
5 SEER-MHOS 链接 SEER + Medicare Health Outcomes Survey
6 SEER-Medicaid 链接 SEER + Medicaid 数据(低收入人群)
7 EUROCare 对比 欧洲癌症生存比较项目
8 CONCORD 对比 全球癌症生存比较项目

§9 相关资源与引用

§9.1 官方资源

# 资源 URL
1 SEER 主页 https://seer.cancer.gov/
2 SEER 数据访问 https://seer.cancer.gov/data/access.html
3 SEER*Stat 下载 https://seer.cancer.gov/seerstat/
4 SEER*Explorer https://seer.cancer.gov/explorer/
5 SEER-Medicare https://healthservices.cancer.gov/seermedicare/
6 NAACCR 数据字典 https://apps.naaccr.org/data-dictionary/
7 SEER 编码手册 2024 https://seer.cancer.gov/archive/manuals/2024/
8 Site Recode https://seer.cancer.gov/siterecode/
9 ICD-O-3 编码材料 https://seer.cancer.gov/icd-o-3/
10 数据产品对比 https://seer.cancer.gov/data/product-comparison.html
11 SEER 50 周年 https://seer.cancer.gov/about/50-anniversary.html
12 SEER 登记区列表 https://seer.cancer.gov/registries/
13 SEER GitHub https://github.com/NCI-SSEER
14 Joinpoint 软件 https://surveillance.cancer.gov/joinpoint/

§9.2 BibTeX 引用

@misc{seer2025,
  author = {{Surveillance Research Program, National Cancer Institute}},
  title = {SEER*Stat Software, Version 9.0.43},
  year = {2026},
  publisher = {National Cancer Institute, DCCPS, Surveillance Research Program},
  url = {https://www.seer.cancer.gov/seerstat/},
  note = {November 2025 Submission, diagnosis years 1975-2023, released April 2026}
}

@article{hankey1999seer,
  author = {Hankey, Benjamin F. and Ries, Lynn A. and Edwards, Brenda K.},
  title = {The Surveillance, Epidemiology, and End Results Program: A National Resource},
  journal = {Cancer Epidemiology, Biomarkers \& Prevention},
  volume = {8}, number = {12}, pages = {11171121}, year = {1999}
}

@article{marmor2026missing,
  author = {Marmor, Schelomo and White, McKenzie},
  title = {Missing patient information in a national database may create blind spots in cancer data},
  journal = {Journal of the American College of Surgeons}, year = {2026}
}

@article{friedl2025pancreatic,
  author = {Friedl, T. and others},
  title = {Machine Learning Models for Pancreatic Cancer Survival Prediction},
  journal = {Journal of Clinical Medicine},
  volume = {14}, number = {13}, pages = {4686}, year = {2025}
}

§9.3 核心团队

# 姓名 角色 机构
1 Steve Friedman, MHA SEER Program Manager NCI SRP
2 Benjamin F. Hankey SEER 创始团队 NCI (retired)
3 Lynn A. Ries 统计学家 NCI
4 Brenda K. Edwards Surveillance Research Director NCI
5 Nadia Howlader, PhD 统计学家 NCI
6 Angela B. Mariotto, PhD 患病率统计 NCI
7 Eric J. Feuer, PhD 统计方法学 NCI
8 Kathleen A. Cronin, PhD 统计建模 NCI
9 Recinda Sherman, PhD NAACCR 标准 NAACCR
10 Kevin C. Ward, PhD Atlanta/Greater Georgia SEER Emory University
11 Dennis Deapen, DrPH Los Angeles SEER USC
12 Charles F. Lynch, MD, PhD Iowa SEER University of Iowa

§10 AI 使用声明卡

§10.1 标识

属性
数据集标识 SEER November 2025 Submission (NCI)
数据集 slug/ID seer-nci/98
千方页面 URL https://www.qianfanghub.com/ai-ready-dataset/seer-nci/98
官方 URL https://seer.cancer.gov/
页面状态 published

§10.2 许可证摘要

  • ✅ 免费用于研究和教育:Tier 1 Research Data 无费用
  • ✅ Research Plus 也免费:需 eRA Commons 认证
  • ❌ 禁止重新识别参与者
  • ❌ 禁止公开小样本数据(最小单元格规则)
  • ❌ SEER-Medicare 禁止美国境外分发
  • ❌ Research Plus 禁止「关注国家」研究者访问(2025-04 起)
  • ✅ 允许商业研究(需遵守 DUA)
  • ✅ 允许发表(需引用 SEER 数据提交版本 + NCI 致谢)
步骤 操作 工具
1 确定研究问题与癌症部位
2 注册并获取 SEER Research Data seer.cancer.gov/data/access.html
3 下载并安装 SEER*Stat seer.cancer.gov/seerstat/
4 选择数据库和会话类型 SEER*Stat
5 选择变量并设置筛选条件 SEER*Stat Case Listing
6 导出为 ASCII Tab 分隔文本 SEER*Stat Export
7 导入 Python/R 进行预处理和建模 pandas / read.delim
8 训练生存预测模型 lifelines / sklearn / xgboost
9 报告结果时引用数据提交版本和发布日期

§10.4 人工校验表

# 检查项 状态
1 数据集标识符准确
2 覆盖率和登记区数量最新
3 记录数量准确
4 ICD-O-3 编码体系正确
5 AJCC TNM 分期版本标注
6 4 级数据访问体系准确
7 SEER-Medicare 申请流程准确
8 SEER*Stat 版本号正确
9 引用规模数据准确
10 缺失数据偏倚发现已纳入
11 种族覆盖比例准确
12 AI/ML SOTA 性能数据准确
13 地理限制政策已标注
14 NAACCR 标准版本正确
15 JSON-LD @graph 结构完整
16 页面状态为 published
返回 AI-Ready 数据集