CancerLinQ — 肿瘤快速学习健康系统 AI-Ready Wikipedia

覆盖 900 万+ 癌症患者的美国肿瘤真实世界数据平台

来源 CancerLinQ LLC(ASCO 发起,ConcertAI 旗下) url: https://www.cancerlinq.org/发布时间: 2026-09-13最后更新: 2026-09-25 阅读 39
CancerLinQ — 肿瘤快速学习健康系统 AI-Ready Wikipedia

信息速览

数据集名称CancerLinQ — 肿瘤快速学习健康系统 AI-Ready Wikipedia
数据类型900 万+ 患者记录,去标识化 EHR 真实世界数据,申请审核获取,49 个瘤种数据集,13 种 EHR 来源
规模900 万+ 名患者(官方口径,截至 2026-09)
接入方式CancerLinQ LLC(ASCO 发起,ConcertAI 旗下) url: https://www.cancerlinq.org/
AI 就绪度

数据集封面

CancerLinQ — 肿瘤快速学习健康系统 AI-Ready Wikipedia


INFOBOX

数据集名称 CancerLinQ
英文全称 Cancer Learning Intelligence Network for Quality
别名/简称 CancerLinQ、CLQ、CancerLinQ Discovery(研究数据产品,简称 CLQD)
疾病分类 恶性肿瘤全病谱,以 12 大常见癌种为研究核心(ICD-11:2E65 乳腺 / 2C25 肺、支气管 / 2C82 前列腺 / 2B90 结肠 / 2B91 直肠 / 2C30 皮肤黑色素瘤 / 2C94 膀胱 / 2C90 肾与肾盂 / 2C76 子宫 / 2C10 胰腺 / 2D10 甲状腺,另含非霍奇金淋巴瘤与白血病,详见 §2.1)
SNOMED CT 363346000 Malignant neoplastic disease (disease) 为顶层概念;瘤种级映射详见 §2.1b
数据模态 结构化 EHR、自由文本临床笔记(NLP 处理)、肿瘤登记数据、死亡登记数据、人工/NLP 病历抽象数据
AI 任务类型 生存分析、治疗模式与真实世界证据(RWE)、质量测量、预后建模、临床试验智能匹配(TriaLinQ)、精准治疗匹配(RxLinQ)、临床文本 NLP
样本总数 900 万+ 患者真实世界数据(官方口径,截至 2026-09);学术快照(2020-03):1,426,015 例原发恶性肿瘤诊断、总人群 2,546,350
数据大小 未公开总量(在 AWS 安全工作区内访问;单瘤种数据集规模以数据合同为准)
数据格式 平台内分析数据集(AWS Workspace:Apache Spark / RStudio / Jupyter;交付文件格式以合同约定为准)
许可证 商业数据使用协议(申请审批 + 合同交付;无公开开源许可证)
访问级别 申请审核(CancerLinQ Discovery Research & Publications Committee 审批,周期约 6-8 周)
DUO 标签 HMB, IRB(按 GA4GH DUO 框架的类比映射,实际限制以数据合同为准,见 §7.4)
语言 英文
首发日期 2014(CancerLinQ LLC 启动)/ 2015(正式推出)
最后更新 持续日更摄取;2025-08-27 获 ASCO Certified RQS 认证
发布机构 美国临床肿瘤学会(ASCO)发起,CancerLinQ LLC 运营(2013-12 起 ASCO 全资子公司;2023-12 起为 ConcertAI 旗下计划)
官方主页 https://www.cancerlinq.org/
下载地址 无公开下载(Discovery 数据经审批后在安全云工作区内分析)
DOI 10.1200/CCI.20.00064(平台描述论文)/ 10.1200/CCI.21.00011(CLQD 数据库描述论文)
AI 就绪度评分 ⭐⭐⭐(3/5)— 数据规模与临床深度顶尖、官方论文披露充分;扣分项:需委员会申请审批、数据不可本地下载、无官方 ML 划分与公开预处理脚本、交付 schema 逐合同定制
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、12 大癌种流行病学、临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(QDM 标准化映射、抽象数据层级)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 ASCO、CancerLinQ LLC、ConcertAI、SAP、AstraZeneca 及本页面提及的任何机构无商业利益关联。本页面不销售 CancerLinQ 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。CancerLinQ Discovery 数据通过 Research & Publications Committee 审批并以数据使用合同方式交付,仅限合同约定范围内使用;本页面描述的申请流程与费用信息可能随平台政策调整。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

这是什么? CancerLinQ(Cancer Learning Intelligence Network for Quality,肿瘤学习质量智能网络)是美国临床肿瘤学会 ASCO 于 2013-2014 年发起的"快速学习健康系统"(Rapid Learning Health System)。它把全美上百家社区肿瘤诊所、学术癌症中心和健康系统的电子健康记录(EHR)数据自动汇聚、标准化、去标识化,形成一张覆盖 900 万+ 患者的肿瘤真实世界数据网络(官方口径,截至 2026-09)。2023 年 12 月起,它成为真实世界证据公司 ConcertAI 旗下的核心计划。

为什么重要? 只有不到 5% 的癌症患者参加临床试验,而且试验人群往往比真实患者更年轻、更健康——药物说明书上的证据并不能直接回答"我这位 78 岁、有三种合并症的乳腺癌患者该怎么办"(Potter et al., 2020, JCO CCI.20.00064)。CancerLinQ 的使命就是让肿瘤学界从"每一个患者"身上学习,而不是只从那 5% 的试验人群身上学习。

我能用它做什么? 如果你是肿瘤诊所或健康系统,可以订阅它的质量测量与临床决策支持产品(SmartLinQ 等);如果你是研究者,可以申请 CancerLinQ Discovery——审批通过后在 AWS 安全工作区内分析去标识化的瘤种级数据集,用于生存分析、治疗模式挖掘、预后建模和临床 NLP。注意:它不是可以下载到本地的公开数据集,本 Wiki 的 §6 会按"申请制 + 云内分析"的真实形态给你完整的上手路径。

§1.1 摘要

CancerLinQ 采用订阅式学习健康系统架构:参与诊所通过自动日更接口上传 EHR 中的结构化数据(诊断编码、用药、检验、生命体征)与非结构化数据(临床笔记、扫描文档、以 PDF 形式存储的基因检测报告),平台将其本地表示转化为基于美国国家质量论坛(NQF)Quality Data Model(QDM)的标准化表示(Potter et al., 2020)。平台同时采集肿瘤特异性登记数据与死亡登记数据,并用自然语言处理(NLP)与人工病历抽象补全结构化字段捕获不佳的关键信息——如肿瘤形态学、影像、放疗、手术与分子检测。截至 2020 年 3 月的学术快照显示:63 家机构、9 种 EHR、1,426,015 例原发恶性肿瘤诊断患者,其中 238,680 例经病历抽象补全(同上)。面向研究者的数据产品 CancerLinQ Discovery(CLQD) 自 2017 年上线、2020 年 5 月推出自助式研究平台,提供瘤种级去标识化数据集与个性化 AWS 分析工作区(ASCO, 2020-05);数据申请由 Discovery Research & Publications Committee 审批,周期约 6-8 周(ASCO Connection)。2023 年 12 月,ConcertAI 收购 CancerLinQ,ASCO 保留多年合作协议(Healthcare IT Today, 2024-01)。

§1.2 战略价值

维度一:社区肿瘤数据的稀缺性。 美国大多数癌症患者(尤其乳腺癌、肺癌、结直肠癌)在社区诊所而非学术中心接受治疗,但学术中心的数据资源长期被过度代表。CancerLinQ 的数据网络以社区肿瘤诊所为主体(2019 年约 100 家诊所,涵盖 100+ 订阅机构的当前口径),并明确宣称其 Discovery 数据"反映癌症患者的真实多样性"(CancerLinQ 官网)。对 AI 研究者而言,这是检验模型在"真实诊疗场景"而非"转诊偏倚人群"中表现的重要数据源。

维度二:质量改进与研究闭环的整合。 与纯研究型数据库不同,CancerLinQ 的数据流同时服务于三个闭环:诊所端质量测量(QOPI/ASCO Certified 自动化指标,2025-08 起作为 RQS 供应商为诊所节省每周 4-20 小时人工抽象,CB Insights 汇编)、临床决策支持(RxLinQ 分子靶向治疗匹配、TriaLinQ 试验匹配)、以及研究端的 Discovery 数据集。同一份底层数据既是质量反馈的输入也是研究产出的来源,这种"学习回路"设计本身就是快速学习健康系统理念的工程实现,也为 AI 模型提供了接近临床工作流的评估语境。

维度三:监管级 RWE 的先发经验。 CancerLinQ 早在 2017 年就与 FDA 药品审评与评价中心(CDER)建立合作,并支持了对超过 10,000 名免疫检查点抑制剂患者的真实世界分析(见 §1.4 时间轴)。对关注"AI 模型 + 真实世界证据"监管路径的团队,它的数据治理框架(委员会审批、去标识化承诺、PHI 防火墙)提供了可参考的先例。

§1.3 同类数据集横向对比

数据集 运营方 规模口径 数据来源与模态 获取方式 与 CancerLinQ 的差异化
CancerLinQ / Discovery ASCO 发起,ConcertAI 旗下 900 万+ 患者(官方,截至 2026-09);学术快照 1,426,015 例原发恶性诊断(2020-03) 美国社区+学术肿瘤诊所 EHR(自动日更)、肿瘤/死亡登记、NLP+人工抽象 申请审核(委员会审批,6-8 周,云内分析) 学习健康系统闭环:质量测量与研究共用底层数据;社区诊所代表性突出
Flatiron Health(Frontmatter/clinico-genomic) Roche 旗下(2018 收购) 未公开全量口径;200+ 美国癌症中心 肿瘤专科 EHR + 人工集中式病历抽象 + 基因组(Foundation Medicine)链接 + NDI 死亡链接 商业合作(面向药企/学术合作) 商业化集中抽象流程与基因组深度整合;与 CancerLinQ 同为肿瘤 RWD 双巨头(对比综述)
TriNetX 独立公司 数十亿条全球临床记录口径 全球医疗机构 EHR + 声明数据联盟 注册后免费查询聚合结果,队列级数据需合作 覆盖面更广但肿瘤专科深度(登记、分期、形态学)不及肿瘤专科网络
SEER 美国 NCI 覆盖约 47.9% 美国人口的登记数据 人口学登记:分期、生存、死亡 公开申请(免费,签署 DUA) 金标准生存参照,但无诊疗过程细节(给药、检验、影像);常作 CancerLinQ 的外部基准(§7.8)
NCDB 美国外科医师学会 + ACS 每年约 100 万新增病例的医院登记 委员会癌症登记(CoC 认证机构) 申请审核(Participating机构/研究申请) 手术与机构级细节强;同样缺少纵向临床过程数据
MIMIC-IV MIT LCP / BIDMC 约 25.7 万成人住院 / 亲代 ICU 体系 单一学术医院住院 EHR(时序监护、检验、文本) 凭证化公开申请(CITI 培训 + DUA) 免费且粒度极细,但为 ICU/住院场景、单中心;CancerLinQ 为门诊肿瘤全谱系、多中心

表中"未公开/口径"条目均为公开资料可得口径;各数据集规模数字不可直接互比(统计口径不同),详见 §8.1 的可比性说明。

§1.4 版本与里程碑时间轴

时间 里程碑 关键数字与事件
2013 ASCO 启动 CancerLinQ 概念与监管框架研究 发表于 ASCO Educational Book 与 JCO 的早期愿景论文(JCO 2013 综述线索)
2014 CancerLinQ LLC 成立并启动平台建设 发表快速学习健康系统监管框架论文(JCO.2014.56.2124);约 37 家参与诊所
2015 平台正式推出;与 SAP 合作构建数据平台 以 SAP HANA 内存计算为技术底座的合作期启动
2016 vanguard 阶段扩展;AstraZeneca 成为 Discovery 首个行业战略伙伴 约 75 万条患者记录、61 家 vanguard practices、1,000+ 医生
2017 CancerLinQ Discovery 上线;与 FDA CDER 建立合作 超 150 万条记录、78 家签约 practices、2,000+ 医生;Integra Connect 成为首家认证 EHR
2019 数据与网络持续扩张 约 150 万患者记录(含约 105 万原发恶性肿瘤诊断)、约 100 家肿瘤诊所;Conquer Cancer 设立 32,500 美元/项的 Discovery 研究资助(ASCO Post)
2020-03 学术快照(D2 数据库) 63 家机构、9 种 EHR、1,426,015 例原发恶性诊断、238,680 例经抽象(Potter et al. 2020)
2020-05 Discovery Research Platform 自助化上线 AWS Workspace(Spark/RStudio/Jupyter);首发 5 个瘤种数据集;当年 11 篇 ASCO 年会摘要(ASCO)
2021 首篇 CLQD 数据库描述论文发表 12 大癌种 491,360 例(2013-2018)描述性分析(CCI.21.00011)
2022 登记数据链接评估发表 EHR 与癌症登记链接的优势与局限(CCI.21.00149)
2023-10 ASCO 宣布 ASCO Certified 认证计划 基于 QOPI 的新一代质量认证,CancerLinQ 承接自动化方案
2023-12 ConcertAI 收购 CancerLinQ ASCO 保留多年合作协议;ConcertAI 承诺投入超 2.5 亿美元;收购时口径:100+ 机构、10 个 EMR 集成、近 700 万患者记录(Healthcare IT Today)
2024-12 ConcertAI 发布一周年报告 CARAai 平台、SmartLinQ 下一代 SaaS、分子治疗路径框架(ConcertAI Blog)
2025-08-27 获 ASCO Certified RQS 认证 自动质量追踪为诊所节省每周 4-20 小时人工抽象(CB Insights 汇编)
2026-09 官方当前口径(本 Wiki 检索时点) 100+ 订阅机构、13 种 EHR、49 个瘤种专用数据集、9M+ 患者(CancerLinQ 官网)

§1.5 典型应用场景

  1. 真实世界治疗模式与指南依从性研究:分析特定瘤种在社区与学术机构中的治疗序列、指南偏离及其与结局的关联——这正是 Discovery 资助计划列举的优先方向(ASCO Post, 2019)。
  2. 生存分析与预后建模:基于诊断、治疗与结局构建预后模型;2025 年发表的转移性乳腺癌预后模型即在 CancerLinQ Discovery 上完成开发与外部验证(JCO OP.25-00610)。
  3. 质量测量自动化与电子临床质量指标(eCQM)开发:平台原生以 QDM 标准化质量指标起家,适合研究"指标计算逻辑 × 真实数据"的落地问题(CCI.17.00139)。
  4. 临床文本 NLP 与信息抽取:非结构化临床笔记、扫描文档与 PDF 基因报告构成大规模肿瘤临床文本资产,适合开发/评测肿瘤 NLP 抽取管线(§6.3)。
  5. 临床试验匹配与精准治疗匹配算法:TriaLinQ/RxLinQ 的公开产品化实践为"患者-试验匹配"算法研究提供了真实的落地需求定义(CancerLinQ 新闻)。

§2 医学背景

§2.1 疾病覆盖与 ICD-11 编码表

CancerLinQ 覆盖恶性肿瘤全病谱;其研究数据库 CLQD 的首篇描述性论文(Potter et al., 2021, JCO CCI.21.00011)刻画了 12 大常见癌种。下表列出其中 10 个实体瘤的 ICD-11 编码及 CLQD 快照样本量;非霍奇金淋巴瘤与白血病属造血淋巴系统恶性肿瘤,在 ICD-11 中按形态学亚型(如弥漫性大 B 细胞淋巴瘤、慢性淋巴细胞白血病等)分别编码,建议通过 WHO ICD-11 浏览器按亚型查询。

疾病标签(中/英) ICD-11 编码 ICD-11 中文名 CLQD 快照例数(2013-2018 诊断)
乳腺癌 Breast cancer 2E65 乳腺恶性肿瘤 139,506
肺与支气管癌 Lung and bronchus cancer 2C25 肺或支气管恶性肿瘤 70,959
前列腺癌 Prostate cancer 2C82 前列腺恶性肿瘤 63,303
结肠癌 Colon cancer 2B90 结肠恶性肿瘤 (与直肠癌合计)53,504
直肠癌 Rectal cancer 2B91 直肠恶性肿瘤 (与结肠癌合计)53,504
皮肤黑色素瘤 Melanoma of the skin 2C30 皮肤恶性黑色素瘤 论文未逐一披露
膀胱癌 Bladder cancer 2C94 膀胱恶性肿瘤 论文未逐一披露
肾与肾盂癌 Kidney and renal pelvis cancer 2C90 肾恶性肿瘤(肾盂按解剖细分) 论文未逐一披露
子宫癌 Uterine cancer 2C76 子宫(宫体)恶性肿瘤 论文未逐一披露
胰腺癌 Pancreatic cancer 2C10 胰腺恶性肿瘤 论文未逐一披露
甲状腺癌 Thyroid cancer 2D10 甲状腺恶性肿瘤 论文未逐一披露
非霍奇金淋巴瘤 Non-Hodgkin lymphoma 按亚型编码 成熟 B/T/NK 细胞肿瘤各类目 论文未逐一披露
白血病 Leukaemia 按亚型编码 白血病各类目(如急性髓系、慢性淋巴细胞等) 论文未逐一披露

注:ICD-11 编码为常见公开映射,粒度以 MMS 版本而异;生产环境中请以 WHO ICD-11 官方浏览器复核。CLQD 快照纳入标准为 2013-01-01 至 2018-12-31 间新诊断的恶性肿瘤(排除原位诊断),12 癌种合计 491,360 例。

§2.1b SNOMED CT 映射表

CancerLinQ 平台以 NQF Quality Data Model(QDM)为内部标准化模型,诊断编码在摄取与映射中涉及 ICD-9/10-CM 与 SNOMED CT 体系。肿瘤领域常用顶层与代表概念的映射如下:

概念标签 ICD-11 参考 SNOMED CT 码 术语(英文)
恶性肿瘤(顶层概念) 2A00-2F5Z(第 02 章肿瘤) 363346000 Malignant neoplastic disease (disease)
原发恶性肿瘤 按部位细分 按部位细分 Primary malignant neoplasm (disorder)
乳腺癌 2E65 254837009 Malignant tumor of breast (disorder)
肺恶性肿瘤 2C25 363358000 Malignant tumor of lung (disorder)
前列腺恶性肿瘤 2C82 399068003 Malignant tumor of prostate (disorder)
结肠恶性肿瘤 2B90 363406005 Malignant tumor of colon (disorder)
肿瘤形态学(组织学) 按形态学码 按形态学轴细分 Morphologically abnormal structure 系列概念

注:SNOMED CT 概念随国际版/美国版扩展与版本更新而调整;表中瘤种级码值为常用映射,顶层概念 363346000 为稳定锚点。CLQD 论文特别指出:ICD-9/10 编码侧重解剖部位而非肿瘤形态学,识别如 NSCLC 这类依赖组织学的诊断必须回到病理文本或抽象数据(Potter et al., 2020)——这是 §6.5 坑点 3 的根源。

§2.2 疾病与人群简介

CancerLinQ 服务的是"肿瘤诊疗全人群"而非单一疾病队列。其学术快照提供了美国社区肿瘤诊疗人群的罕见画像(Potter et al., 2021):2013-2018 年间 12 大癌种共 491,360 例新诊断,乳腺、肺、前列腺、结直肠四大癌种合计 327,272 例(占比约 66.6%);诊断时中位年龄为乳腺癌 61 岁、肺癌 68 岁、前列腺癌 68 岁、结直肠癌 64 岁——显著低于传统认知中"登记数据人群"的年龄结构,反映了门诊诊疗人群的真实构成。

从流行病学视角看,这 12 大癌种恰好是美国新发恶性肿瘤的主体,也是临床试验入组排除效应最严重的领域:老年患者(肺癌中位诊断年龄即已接近 70 岁)、多合并症患者与罕见病理亚型在随机对照试验中长期欠代表。CancerLinQ 数据网络以社区肿瘤诊所为主体,意味着它对"日常诊疗中的真实治疗选择"(而非"试验方案下的理想治疗")有更贴近的采样——例如同一适应证下不同诊所间方案选择的离散度、剂量调整与治疗中止的真实频率,这些信息在登记数据中完全缺失。

与 SEER 登记数据的对比显示,CLQD 中若干瘤种的 5 年总生存估计高于 SEER 参照值,论文作者将其主要归因于 EHR 对死亡信息的捕获不完整(见 §7.1 与坑点 1),这一"生存高估"现象本身就是使用该数据时必须内化的流行病学背景:在 CancerLinQ 上做生存分析,你的对手不是算法,而是删失机制。

§2.3 临床任务定义

临床任务 定义 在 CancerLinQ 中的数据基础 典型 AI 任务形式
诊断与形态学确认 恶性肿瘤的诊断依赖病理组织学确认;ICD 编码仅反映解剖部位 诊断编码 + 病理/临床文本(NLP)+ 抽象数据 文本分类、形态学信息抽取、队列识别
分期 TNM/SEER 分期主要来自肿瘤登记与影像报告 肿瘤登记数据、影像相关抽象元素 分期预测、分期缺失填补
治疗选择 手术、放疗、系统治疗(化疗/靶向/免疫)的组合决策 用药给药记录、手术/放疗抽象元素、临床文本 治疗序列建模、指南依从性分类
生存与预后 总生存(OS)、无进展生存(PFS)等时间-事件结局 死亡登记 + EHR 生命状态(不完整,见坑点 1) 生存分析、风险分层、时间-事件模型
质量监测 eCQM 电子临床质量指标计算与基准比较 QDM 标准化概念 + 全人群覆盖 指标计算引擎、依从性预测、异常检测
试验/治疗匹配 患者入组资格与分子靶向治疗资格识别 结构化诊断 + NLP 抽取的分子检测信息(常为 PDF) 信息抽取 + 规则/学习混合匹配(TriaLinQ/RxLinQ 场景)

§2.4 患者人群表

维度 内容(学术快照口径,CLQD 12 癌种,2013-2018 诊断)
数据来源 美国 63 家订阅机构(2020-03),社区肿瘤诊所为主体、含学术中心与健康系统
时间范围 诊断年份 2013-01-01 至 2018-12-31(排除原位诊断);平台数据自 2013 年起持续累积
年龄 诊断时中位年龄:乳腺癌 61 岁;肺癌 68 岁;前列腺癌 68 岁;结直肠癌 64 岁
性别 论文未以性别分层披露总数(前列腺/乳腺等瘤种本身即性别特异)
种族 论文未在快照摘要中披露分层;平台宣称数据反映癌症患者的真实多样性(官网口径)
就医类型 门诊肿瘤诊疗为主(社区诊所、学术癌症中心、健康系统肿瘤科)
地域 美国全国;2020-03 快照含按地理分布与机构规模分层的活跃站点统计(论文 Table 2)

§2.5 临床价值

对临床与研究者而言,CancerLinQ 的核心价值在于把"指南与证据"放回"真实人群"中检验:其一,质量测量从抽样人工审计(传统 QOPI 模式)升级为全患者覆盖的自动化指标,使质量差距可量化、可追踪(2025 年 RQS 认证披露其为诊所节省每周 4-20 小时人工抽象);其二,对少见场景——老年、多合并症、临床试验排除人群——提供效应量与安全性的真实世界参照,补齐"临床试验 5% 入组"留下的证据缺口(Potter et al., 2020);其三,对 AI 研究者,它是少有的"门诊肿瘤 + 多机构 + 社区为主体"的组合,可与 ICU 型(MIMIC)、登记型(SEER/NCDB)、商业集中抽象型(Flatiron)数据形成互补验证。

§2.6 金标准与参照标准表

CancerLinQ 是观察性真实世界数据平台,不存在临床试验意义上的"金标准标注";其描述性研究中使用的参照标准如下:

参照对象 参照标准 参照来源 性质
生存估计 SEER 5 年总生存估计(登记金标准) NCI SEER 外部参照(注意 CLQD 生存高估现象)
诊断与形态学 病理组织学报告 参与机构病理文本(NLP/抽象处理) 数据内金标准
癌症诊断、分期、生命状态 肿瘤登记与死亡登记数据 机构肿瘤登记、死亡登记链接 数据内补充标准(覆盖不完整,CCI.21.00149)
质量指标计算 NQF QDM 数据模型与 eCQM 规范 NQF / ASCO QOPI 体系 规范性标准
抽象数据质量 高影响数据元素的评估与分层(与 CTCA 联合数据质量举措) CCI.17.00139 内部质量举措

§3 数据集规格

§3.0 访问形态抉择矩阵

CancerLinQ 是"平台 + 研究数据产品"的复合体,不存在传统意义上的 v1.0/v2.0 版本序列;你的第一个决策是选择访问形态:

你的需求 推荐路径 大小/规模 理由
快速复现已发表学术结果、教学演示 公开论文快照口径(CCI.21.00011 的 12 癌种描述、CCI.20.00064 的 D2 统计) 无数据下载(复用论文统计量) 免申请、可核查;适合方法学与教学场景
单瘤种 RWE 研究(如预后模型、治疗模式) CancerLinQ Discovery 标准瘤种数据集(49 个瘤种专用数据集池,官网口径) 以数据合同为准 审批流程标准化(6-8 周)、AWS Workspace 现成工具链
多瘤种/多数据源联合研究 Discovery 定制数据请求(走同一委员会审批,先做可得性与充分性审查) 以数据合同为准 可在申请阶段确认数据可得性,避免获批后落空
机构质量改进与决策支持部署 SmartLinQ 等 SaaS 订阅(机构侧) 全机构数据接入 面向运营而非研究;含 RxLinQ/TriaLinQ 模块
死亡/生存结局的严格验证研究 Discovery + 外部死亡索引链接方案(研究设计阶段即声明) 以数据合同为准 EHR 生命状态不完整,需在设计上处理(坑点 1、§7.8)

§3.1 数据模态详情

模态 内容 摄取方式 标准化 已知短板
结构化 EHR 诊断编码(ICD-9/10)、门诊记录、用药给药、检验、生命体征 自动日更接口 QDM 标准化映射 编码重解剖轻形态学;跨 EHR 捕获率不一
非结构化文本 临床笔记、扫描文档(病史、病程、检验报告、转诊医嘱等)、PDF 形式基因检测报告 随日更接收,整份进入管线 NLP + 机器学习抽取 含 PHI,去标识化依赖管线质量;抽取有误差
肿瘤登记数据 癌症登记(诊断、分期、形态学) 登记数据链接 与 EHR 记录链接 链接覆盖与准确性有限(CCI.21.00149)
死亡登记数据 生命状态、死亡日期 登记链接 + 机构记录 患者级合并 捕获不完整且滞后(核心局限,坑点 1)
人工/NLP 抽象数据 影像、放疗、手术、分子检测、不良事件等关键元素 NLP 辅助 + 受训抽象员 瘤种级优先抽象(首抽象瘤种为 NSCLC) 成本与人力限制导致仅覆盖部分患者(2020-03:238,680 例)

§3.2 按子集样本数表

子集口径 例数 统计时点 来源
原发恶性肿瘤诊断患者 1,426,015 2020-03 Potter et al., 2020
良性或原位肿瘤诊断患者 733,107 2020-03 同上
良性血液学诊断患者 893,977 2020-03 同上
数据库总患者人群(含跨类重复计数) 2,546,350 2020-03 同上
经病历抽象(NLP+人工)补全数据的患者 238,680 2020-03 同上
CLQD 12 大癌种新诊断患者(2013-2018) 491,360 2021 发表 CCI.21.00011
其中:乳腺癌 / 肺癌 / 前列腺癌 / 结直肠癌 139,506 / 70,959 / 63,303 / 53,504 2021 发表 同上
官方平台口径(真实世界数据代表的患者) 9M+ 截至 2026-09 CancerLinQ 官网

⚠️ 口径警示:9M+(官网营销口径,“真实世界数据代表”)≠ 1,426,015(学术快照的原发恶性诊断数)≠ 2,546,350(含良性/原位/血液学的总人群,且跨类重复计数)。引用任何规模数字前先明确口径,详见坑点 8。

§3.3 数据格式表

环节 格式/形态 说明
诊所端摄取 各 EHR 厂商接口(自动日更) 已集成 13 种 EHR 系统(2026-09 官网口径;2020-03 为 9 种)
平台内部 QDM 标准化表示 + 登记链接数据 内部 schema 不公开
研究交付 AWS 安全工作区内分析数据集 Apache Spark、RStudio、Jupyter Notebooks 预装;升级算力需另行申请
分析产出 Notebook/脚本/汇总结果 仅去标识化、匿名化数据可被访问;产出经合同约定合规输出
交付文件格式 以数据合同与数据字典为准 本 Wiki §4/§6 的表结构与代码为教学示意,勿直接当作官方 schema

§3.4 存储大小

官方未公开数据总量。理解其量级的正确方式是分解驱动因素而非估算绝对值:

驱动因素 量级贡献 说明
患者主索引 千万级行 9M+ 官方口径 + 良性/原位/血液学诊断人群
结构化临床事件 数亿至十亿级行 每患者的多次就诊 × 每次就诊的多条检验/用药/体征记录;日更持续追加
非结构化文本 体量最大变量 整份临床笔记、扫描件与 PDF 基因报告随日更累积,是存储与 NLP 成本的主要来源
抽象数据 相对小但单位成本最高 238,680 例(2020-03)的深度抽象元素,受人力成本约束
登记链接数据 患者级小表 分期、形态学、生命状态

Discovery 以"瘤种级数据集 + 云内分析"交付,研究者实际接触的是筛选后的子集——单瘤种数据集在 Spark/Jupyter 工作流中通常无需关心全库体量,但特征窗口跨度(回看多少年)与文本可用性会显著影响内存与计算需求。任何具体 GB 数字(包括同类平台的类比估算)均无官方来源,本 Wiki 不提供估算值以免误导;存储规划应在获批后以目标数据集的实际行数与字段类型为准。

§3.5 标注(信息补全)方式

方式 覆盖对象 规模特征 质量特征
原生结构化字段 诊断、用药、检验、生命体征 全患者覆盖 受 EHR 录入习惯与编码实践影响
NLP 自动抽取 非结构化文本中的临床观察 全量文本处理 抽取误差未公开量化; genomic 结果多为 PDF 源
人工病历抽象 影像、放疗、手术、分子检测、哨点不良事件 优先瘤种、部分患者(2020-03:238,680 例) 受训抽象员执行;成本与人力是规模化瓶颈
登记链接 分期、形态学、生命状态 覆盖随机构与年份变化 链接准确性有限(CCI.21.00149)

§3.6 标注者资质与一致性

病历抽象由 CancerLinQ 的业务关联分包商(business associate subcontractors)执行,抽象工作与科研工作实施防火墙隔离;所有涉及 PHI 的处理在受控环境完成(Potter et al., 2020)。抽象优先级由"结构化捕获率低 + 质量指标影响大 + 活跃研究机会"三因素决定;首个系统抽象瘤种为非小细胞肺癌(NSCLC),因其靶向与免疫治疗密集、且诊断与治疗评估强依赖组织学与影像信息。抽象员间一致性、抽象准确性等指标的公开量化数据有限;与 Cancer Treatment Centers of America 的联合数据质量举措评估了电子临床质量指标中高影响数据元素的质量与分层(CCI.17.00139)。作为研究者,应在申请阶段向平台确认目标数据元素的抽象覆盖率与质量报告。

§3.7 采集周期

参与机构的 EHR 数据经自动接口每日更新摄取;肿瘤特异性登记数据与死亡登记数据按登记机构的更新节奏定期并入。因此平台是一个持续增长的时间滚动数据资产:同一研究在 2024 年与 2026 年重跑可能获得不同结果(新增机构、回填修正、口径演进),可复现性设计必须固定数据快照时点(§6.10)。

§3.8 地域覆盖

覆盖美国全国,站点以社区肿瘤诊所为主体、辅以学术癌症中心与健康系统;2020-03 快照包含按地理分布与机构规模划分的活跃站点统计(论文 Table 2),但具体州级分布未公开。数据集本质上是"参与机构的服务人群"而非美国人口的概率样本:地理与机构类型分布直接决定选择偏倚的方向(§7.1)。

§3.9 系统(EHR)规格

时点 已集成 EHR 数 备注
2020-03 9 种 63 家机构(Potter et al., 2020)
2024-01 10 个 EMR 集成 收购公告口径(Healthcare IT Today)
2026-09 13 种 官网口径(CancerLinQ)

平台设有 Certified EHR System 认证体系(Integra Connect 为首家认证 EHR,2017),并已为 QOPI Certification 与 ASCO Certified 提供自动化质量方案;对采用 Elsevier ClinicalPath 的诊所提供质量指标与路径数据的联合报送。跨 EHR 的概念映射差异是数据异质性的主要来源之一(坑点 7)。

§3.10 深度溯源链

[参与机构 EHR]                      ── 诊所本地记录(PHI)
      │  自动日更接口(13 种 EHR)
      ▼
[CancerLinQ 摄取层]                 ── 结构化 + 非结构化(整份文本/PDF)
      │  NQF QDM 标准化映射
      ▼
[平台标准化数据层 D2]               ── 内部统一模型(PHI 环境)
      │  NLP 抽取 + 受训抽象员(业务关联分包商,与科研防火墙隔离)
      │  肿瘤登记 / 死亡登记链接
      ▼
[去标识化处理]                      ── 可识别数据永不进入研究产品
      │
      ▼
[CancerLinQ Discovery (CLQD)]      ── 瘤种级去标识化数据集(49 个,官网口径)
      │  委员会审批(6-8 周)+ 数据合同
      ▼
[AWS Workspace 研究环境]            ── Spark / RStudio / Jupyter,云内分析

每个环节的责任方与合规边界:机构负责源数据授权;CancerLinQ LLC 负责摄取、标准化、抽象与去标识化;Discovery Research & Publications Committee 负责研究用途审批(与 ASCO 使命一致性审查);研究者仅接触去标识化产物。


§4 数据结构

§4.0 数据资产逻辑目录树

以下为 Discovery 瘤种数据集交付后、在 AWS 工作区内常见的逻辑组织示意(教学示意结构;真实文件命名、目录与 schema 以平台交付的数据字典为准):

cancerlinq_discovery_<tumor>_<snapshot_date>/
├── README.md                      # 数据集概述、快照时点、使用条款
├── data_dictionary/               # 字段字典与取值码表(交付核心文档)
│   ├── qdm_fields.csv             # QDM 概念与字段定义
│   ├── value_sets.csv             # 编码值集(ICD/注册码/抽象码表)
│   └── abstraction_notes.md       # 抽象规则说明(如哨点事件 AE 窗口)
├── patients/                      # 患者主索引(去标识化)
│   └── patients.csv               # 每患者一行:出生年、性别、生命状态等
├── diagnoses/
│   └── diagnoses.csv              # ICD 编码 + 诊断时点 + 来源(结构化/抽象/登记)
├── treatments/
│   ├── medications.csv            # 系统治疗给药记录(方案/药物/时点)
│   ├── radiation.csv              # 放疗抽象元素(如交付瘤种含此项)
│   └── surgery.csv                # 手术抽象元素
├── labs_vitals/
│   ├── labs.csv                   # 检验结果(概念 + 值 + 单位 + 时点)
│   └── vitals.csv                 # 生命体征时序
├── outcomes/
│   ├── mortality.csv              # 生命状态与死亡日期(注意缺失/滞后)
│   └── adverse_events.csv         # 哨点事件相关 AE(30 天窗口,见坑点 5)
├── registry/
│   └── tumor_registry.csv         # 登记链接:分期、形态学、原发部位
└── notes/                         # 去标识化临床文本(可用性随合同而定)
    └── notes_<type>.csv

§4.1 DAIMS 字段字典(核心数据元素)

下表按数据元素类别组织(示例值为示意,真实取值以交付数据字典为准):

字段/类别 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围/备注
patient_id Text 去标识化患者唯一键 CLQ-0001A3 主键、分组防泄漏 无(平台生成) 不适用 每数据集内唯一
birth_year Integer 出生年份(非完整生日) 1957 年龄特征 老年段可能截断 无 与去标识化规范一致
sex Text 性别 F 分层/公平性 录入误差 空值=未记录 F/M/其他
diagnosis_code Text 恶性肿瘤 ICD 编码 C50.911 队列识别、标签构造 重解剖轻形态学(坑点 3) 空值=未见诊断记录 ICD-9/10-CM
diagnosis_date Date 诊断日期 2016-03-15 时间锚点、指数日期 登记与 EHR 日期可能不一致 空值=日期未捕获 平台覆盖期内
morphology Text 组织学形态学(抽象/登记/NLP) 8500/3 亚型分层(如 NSCLC) 仅抽象覆盖患者可靠 空值=未抽象或未捕获 ICD-O-3 风格
stage Text 分期(登记链接) IIIB 预后核心特征 链接覆盖不全 空值=未链接到登记 AJCC/SEER 风格
medication_* Text+Date 给药记录(药物/方案/时点) trastuzumab 治疗序列、暴露定义 门诊给药记录完整性不一 空值=无给药记录 按 RxNorm/本地码
lab_result Float+Date 检验值 ANC=1.2, 10^9/L 纵向特征、毒性监测 单位与参考范围跨机构差异 空值=未检出该项 概念+值+单位
vital_sign Float+Date 生命体征时序 BP=138/86 健康状态轨迹 测量场景差异 空值=未测量 概念+值+单位
adverse_event Text+Date 哨点事件 30 天窗口内 AE(坑点 5) neutropenia 毒性分析 仅哨点窗口内、不做因果判定 空值=窗口内无记录 抽象编码
vital_status Text 生命状态 deceased 生存标签(坑点 1) EHR 捕获不全且滞后 unknown 应视为信息性缺失 alive/deceased/unknown
death_date Date 死亡日期 2019-07-02 事件时间 滞后与缺失(SEER 对比高估的根源) 空值≠存活! 需与 vital_status 联用
note_text Text 去标识化临床文本 (长文本) 临床 NLP 去标识化处理可能扰动文本 无 可用性随合同而定

§4.2 标签分布

以 CLQD 12 癌种快照(2013-2018 诊断,N=491,360)为"癌种标签"分布:

乳腺癌        139,506  ██████████████████████████  28.4%
肺与支气管癌   70,959  ██████████████              14.4%
前列腺癌       63,303  ████████████▌               12.9%
结直肠癌       53,504  ██████████▌                 10.9%
其余 8 癌种   164,088  ████████████████████████████████▌  33.4%
(黑色素瘤、膀胱、NHL、肾、子宫、白血病、胰腺、甲状腺;单项未披露)

结局类标签(如生存)的"类分布"由死亡数据捕获状况决定,且随随访时间与登记链接进度漂移;不要假设死亡标签是静态的。

§4.3 关键统计

统计项 数值 口径与来源
四大癌种合计 327,272 例(占 12 癌种快照约 66.6%) 2013-2018 诊断,CCI.21.00011
诊断时中位年龄 乳腺 61 岁 / 肺 68 岁 / 前列腺 68 岁 / 结直肠 64 岁 同上
抽象数据覆盖 238,680 例,约占原发恶性诊断的 16.7% 2020-03,Potter et al., 2020
平台瘤种数据集 49 个瘤种专用数据集 2026-09 官网口径
EHR 来源系统 13 种(2020-03 时为 9 种) 官网 / PMC7608629
订阅机构 100+(2020-03 时为 63 家) 官网 / PMC7608629
哨点 AE 抽象窗口 哨点事件后 30 天 Potter et al., 2020
D2 数据库总患者 2,546,350(含跨类重复计数) 2020-03,PMC7608629

§4.4 数据层级

患者 (patient_id)
 └── 参与机构 / 机构网络(站点级,跨机构患者需去重评估)
      └── 诊断/登记条目(每癌种一条主登记记录)
           └── 就诊与事件 (encounter/event_date)
                ├── 给药记录(药物 × 时点)
                ├── 检验/生命体征(概念 × 时点)
                └── 临床文档(note / 扫描件 / PDF 基因报告)
                     └── NLP 抽取或人工抽象元素(形态学、影像、放疗、AE)

建模含义:患者内强时间自相关 + 机构内强聚类(同一诊所的医师习惯、患者构成)→ 交叉验证必须按患者分组,机构泛化评估需按站点分组(§5.3)。

§4.5 缺失值与信息性缺失

缺失情形 是否信息性缺失 机制与证据 建议处理
死亡日期为空但随访期已结束 是(最典型) EHR 死亡捕获不完整/滞后;CLQD 生存估计系统性高于 SEER(CCI.21.00011;OP.25-00610) 空值 ≠ 存活;用生存分析右删失而非"存活"二分类;敏感性分析
抽象元素(形态学/影像/放疗/手术)为空 是 抽象仅覆盖优先瘤种与部分患者(16.7%,2020-03) 区分"未抽象"与"未发生";避免把缺失当阴性
分期缺失 是 依赖登记链接覆盖 多重插补或分层敏感性分析
检验缺失 部分信息性 按临床状态选择性检测(病重者查得更勤) 显式建模指示变量;§6.3 演示
给药缺失 部分信息性 门诊给药记录完整性因机构而异 机构级捕获率校准;外院治疗不可见(坑点 2)

共线性与信息性缺失的详细讨论见 §7.1 偏倚表;vital_status = unknown 应作为一等公民参与建模决策,而非简单过滤。

缺失策略可按下面这个决策顺序落地(伪代码):

for 字段 in 关键数据元素:
    if 字段 ∈ {vital_status, death_date}:          # 坑点 1
        空值 → 删失处理 + 报告删失比例 + 敏感性分析夹逼
    elif 字段 ∈ {morphology, stage, 放疗/手术}:     # 抽象/登记覆盖型(坑点 3/6)
        空值 → 区分"未抽象"与"未发生"
        → 标记 unclassified + 逆概率加权敏感性分析
    elif 字段 ∈ {lab, vital}:                      # 选择性检测型
        空值 → 保留缺失指示变量 + 训练期统计插补
    elif 字段 ∈ {medication}:                      # 机构流程型(坑点 2/7)
        空值 → 机构级捕获率校准 + 首治空窗标记
    else:
        空值 → 报告缺失率,默认保守处理
最后:全表输出缺失率 × 机构 × 诊断年份三元透视,随研究档案归档。

§5 数据划分与使用建议

§5.1 官方划分

CancerLinQ 不提供官方机器学习划分。平台交付的是完整瘤种数据集,训练/验证/测试的切分是研究者的责任。Discovery 平台内的分析产出遵循其合规流程,但划分方案由研究方案(随申请提交)约定。

§5.2 社区惯例划分

RWE 研究中的两类主流惯例,均比随机划分更接近部署现实:

惯例 做法 适用场景
时间外推(temporal holdout) 训练用早期诊断年份(如 2013-2016),测试用后期(如 2017-2018+) 模拟"模型上线后面对未来患者";CLQD 快照的 2013-2018 跨度天然支持
机构外推(site holdout) 按参与机构分组留出若干站点作测试 模拟"模型推广到新诊所";直接检验跨 EHR 异质性(坑点 7)
随机划分 患者级随机切分 仅作内部 sanity check,不可作为唯一证据

§5.3 泄漏风险(重点)

  1. 同一患者多条记录跨集泄漏:纵向数据(多次就诊、多次给药)若按"行"随机划分,同一患者会同时出现在训练与测试集。必须以 patient_id 为最小分组单位做 GroupShuffle/GroupKFold。
  2. 机构聚类泄漏:同一诊所的患者共享医师处方习惯、检验套餐与记录风格;机构外推测试才能暴露模型学到的是"诊所指纹"还是临床信号。
  3. 特征时间泄漏:使用指数日期(如诊断日)之后才产生的信息(如后续检验值、治疗记录)预测诊断时点结局,是最常见的 RWE 泄漏。特征窗口必须显式截断在指数日期之前。
  4. 标签构造泄漏:把死亡登记链接的处理时间当作死亡时间、或用"未知生命状态"训练时将其当作存活,会引入乐观偏倚(坑点 1)。
  5. 抽象数据选择偏倚泄漏:抽象覆盖率与瘤种/研究活跃度相关;若测试集的抽象覆盖率与训练集分布不同,依赖抽象特征的模型会隐性漂移(坑点 6)。

§5.4 交叉验证建议

  • 首选:按 patient_id 分组的 5 折 GroupKFold + 每折内再按诊断年份做时间检查;报告折间方差。
  • 进阶:嵌套验证——外层机构分组、内层患者分组,同时评估"新机构泛化"。
  • 生存任务:禁止 StratifiedKFold 按结局事件率分层(事件时间删失机制复杂),改用按机构/年份分层。

§5.5 外部验证建议

  • SEER:生存与流行病学参照的金标准;但注意 CLQD 生存估计系统性高于 SEER(死亡捕获差异),直接对标前必须先做生命状态敏感性分析(§7.8、坑点 1)。
  • NCDB / 独立登记:检验分期、手术相关结论。
  • 本机构自有 EHR:最接近部署场景;留意本地编码体系与 QDM 映射差异。
  • 已发表模型复现:以 OP.25-00610 的转移性乳腺癌预后模型为参照(其外部验证 Brier score 升高、并计划引入州死亡索引链接),是"Discovery 上模型泛化"的公开实例。

§5.6 划分策略决策表

你的研究问题 首选划分 次选划分 关键理由
治疗模式/指南依从性描述 时间外推(后半段年份做测试) 全样本描述性统计 描述性结论对时间窗敏感;外推展示稳健性
预后/生存建模(本网络部署) 患者分组 GroupKFold 时间外推 面向未来患者;删失机制随时间变化
跨机构推广的预测模型 机构外推(站点留出) 机构分组 CV 直接量化"诊所指纹"效应(坑点 7)
治疗-结局因果推断 时间外推 + 敏感性分析 — 观察性设计的主要威胁是混杂而非划分本身
临床 NLP 抽取 按文档时间切分 + 按机构分组 患者分组 文档风格跨机构差异大(坑点 4/7)
试验匹配算法 规则验证 + 患者分组 CV — 资格标准可结构化验证,避免学习式过拟合历史匹配

原则:任何划分方案都要在研究方案(随 Discovery 申请提交)中预先固定;随机划分只允许作为辅助 sanity check。


§6 AI 就绪指南

§6.0 云端快速启动

CancerLinQ Discovery 的分析不发生在你的笔记本上,而在平台为你开通的个性化 AWS 工作区内:

要素 内容
环境 个性化 AWS Workspace,预装 Apache Spark、RStudio、Jupyter Notebooks(ASCO, 2020-05)
数据 审批通过的数据集直接挂载在区内;不可下载到本地
算力 基础配置起步;额外工具与升级算力需申请(同上公告)
首次登录清单 ① 阅读交付 README 与数据字典;② 确认数据快照时点并记录;③ 用 §6.1 的最小检查脚本验证行数与键唯一性;④ 核对目标数据元素的抽象覆盖率再动手建模

§6.1 快速上手(云内 Notebook)

代码前提:以下代码在 Discovery AWS Workspace 的 Jupyter 环境中运行。目录结构预期:你的数据集根目录 data_root 形如 /workspace/cancerlinq_discovery_<tumor>_<snapshot>/(§4.0 的示意树)。data_root 拼接关系:所有文件路径由 data_root / 子目录 / 文件名 拼接而成,请以交付 README 为准替换。最小可用子集:patients.csv + diagnoses.csv + outcomes/mortality.csv 三个文件即可完成队列识别与生存结局构造。

import pandas as pd
from pathlib import Path

# data_root:以交付 README 中的实际挂载路径替换
data_root = Path("/workspace/cancerlinq_discovery_breast_2026-01")

# ① 患者主索引(每患者一行:出生年、性别、生命状态等)
patients = pd.read_csv(data_root / "patients" / "patients.csv")

# ② 诊断表(队列识别的最小表)
diagnoses = pd.read_csv(data_root / "diagnoses" / "diagnoses.csv")

# ③ 生存结局(坑点 1 的主战场)
mortality = pd.read_csv(data_root / "outcomes" / "mortality.csv")

# 最小数据体检:行数、主键唯一性、生命状态分布
print(patients["patient_id"].duplicated().sum())      # 期望 0
print(mortality["vital_status"].value_counts(dropna=False))  # 注意 unknown 的体量
print(diagnoses["diagnosis_date"].min(), diagnoses["diagnosis_date"].max())  # 确认快照覆盖期

以上文件名与字段名为教学示意(§4.0/§4.1),真实交付以数据字典为准;第一个工作日先跑通"读三张表 + 三行体检",再展开复杂管线。

§6.2 数据获取:申请流程

步骤 动作 要点
1 意向沟通 邮件联系 info@cancerlinq.org 或经 Discovery 页面了解数据集目录(研究者页)
2 提交数据申请 填写 data request application:研究问题、目标瘤种、所需数据元素、分析计划
3 初筛 核查材料完整性与与 ASCO 使命的一致性(ASCO Connection)
4 可得性/质量/充分性审查 平台评估目标元素的可得性;此时可能给出报价与项目规格
5 委员会审批 Discovery Research & Publications Committee 审查;可能要求补充材料;从提交到通知约 6-8 周
6 合同与交付 签约后开通 AWS Workspace;费用取决于订阅身份与研究复杂度
申请材料自查清单(依据公开流程整理):
[ ] 研究问题与科学合理性说明
[ ] 目标瘤种与数据元素清单(对齐 49 个瘤种数据集池)
[ ] 统计分析计划(含划分方案:§5 的时间/机构外推)
[ ] 数据安全与合规承诺(仅去标识化数据、云内分析)
[ ] 发表计划(委员会审批关注与 ASCO 使命的一致性)

§6.3 预处理全流程

以下管线演示三个关键步骤:生存结局构造(处理信息性缺失)、队列识别(处理形态学缺失)、特征工程(实验室值标准化 + 缺失指示)。代码为示意(字段名以交付字典为准),逻辑可直接迁移。

import numpy as np
import pandas as pd

# ---------- 第 1 步:构造生存结局 ----------
# 原则:death_date 为空 ≠ 存活!unknown 生命状态一律右删失(坑点 1)
idx_date = pd.to_datetime(diagnoses["diagnosis_date"])
merged = patients.merge(mortality, on="patient_id", how="left")

last_contact = pd.to_datetime(merged["last_contact_date"])          # 交付若含末次接触/随访日期
death_date = pd.to_datetime(merged["death_date"])

# 事件:明确死亡;时间:事件或末次接触(右删失)
merged["event_observed"] = (merged["vital_status"] == "deceased").astype(int)
merged["time_days"] = np.where(
    merged["event_observed"] == 1,
    (death_date - idx_date).dt.days,                                # 诊断 → 死亡
    (last_contact - idx_date).dt.days,                              # 诊断 → 末次接触(删失)
).clip(lower=0)

# 剔除负随访与零时间(时间结构异常,先查后删)
bad = merged["time_days"] <= 0
print(f"异常随访时间行数:{bad.sum()}(先核查登记/EHR 日期冲突再处理)")
cohort = merged[~bad]

# ---------- 第 2 步:队列识别(以 NSCLC 为例,坑点 3) ----------
# ICD 编码只能给"肺恶性肿瘤",区分 NSCLC 必须依赖形态学/文本/抽象
lung = cohort.merge(diagnoses, on="patient_id")
lung_icd = lung[lung["diagnosis_code"].astype(str).str.startswith(("C34", "162"))]

has_morph = lung_icd["morphology"].notna()          # 抽象/登记链接提供的形态学
print(f"肺恶性肿瘤患者 {len(lung_icd)} 例中,形态学可得 {has_morph.sum()} 例")
# 处理:形态学缺失者标记为 'unclassified',禁止默认归入腺癌/鳞癌
lung_icd["histology_group"] = np.where(has_morph, lung_icd["morphology"], "unclassified")

# ---------- 第 3 步:实验室特征(标准化 + 缺失指示,坑点 6) ----------
labs = pd.read_csv(data_root / "labs_vitals" / "labs.csv")
labs["lab_date"] = pd.to_datetime(labs["lab_date"])

# 只取指数日期前的窗口(防时间泄漏,§5.3)
window = labs.merge(cohort[["patient_id"]], on="patient_id")
window = window[window["lab_date"] < idx_date.loc[window["patient_id"].values].values]

feat = (window.groupby(["patient_id", "lab_concept"])["lab_value"]
              .agg(["mean", "min", "max", "count"]).reset_index())
feat_wide = feat.pivot(index="patient_id", columns="lab_concept",
                       values=["mean", "min", "max", "count"])
# 训练期统计做 winsorize(1%/99%),统计量保存供推理复用
q01, q99 = feat_wide.quantile(0.01), feat_wide.quantile(0.99)
feat_wide = feat_wide.clip(q01, q99, axis=1)
# count 列即"该患者做过多少次该项检验"——缺失模式本身是特征(信息性缺失)

§6.4 PyTorch DataLoader(生存建模)

import torch
from torch.utils.data import Dataset, DataLoader

class CancerLinQSurvivalDataset(Dataset):
    """从预处理后的患者级特征矩阵构造生存建模样本。
    X: 患者特征(float32 张量);time/event: 生存时间与事件指示。
    真实项目中由 §6.3 的 cohort 与特征表 join 而来。"""

    def __init__(self, features: pd.DataFrame, time_days: pd.Series, event: pd.Series):
        self.X = torch.tensor(features.values, dtype=torch.float32)
        self.time = torch.tensor(time_days.values, dtype=torch.float32)
        self.event = torch.tensor(event.values, dtype=torch.float32)

    def __len__(self):
        return len(self.time)

    def __getitem__(self, i):
        return self.X[i], self.time[i], self.event[i]

def collate_survival(batch):
    xs, times, events = zip(*batch)
    return (torch.stack(xs), torch.stack(times), torch.stack(events))

# GroupKFold 已在 §5.4 完成;此处演示单折内 DataLoader
train_ds = CancerLinQSurvivalDataset(feat_wide, cohort["time_days"], cohort["event_observed"])
train_loader = DataLoader(train_ds, batch_size=512, shuffle=True,
                          collate_fn=collate_survival, num_workers=2)
xb, tb, eb = next(iter(train_loader))
print(xb.shape, tb.shape, eb.shape)   # 期望 [512, n_features] [512] [512]

§6.5 坑点清单(8 个,全部来自公开文献与官方文档)

⚠️ 坑点 1:死亡数据不完整且滞后,把"未知生命状态"当存活会系统性高估生存(分类:评估误用 / 标签理解)

问题:EHR 对死亡信息的捕获不完整——医生常常不知道患者是否已死亡,机构登记也低报生命状态;CLQD 生存估计高于 SEER 参照即归因于此。未链接死亡索引时死亡日期缺失导致结局错分。
症状:模型 C-index 虚高但外部验证崩塌;Kaplan-Meier 曲线在随访后期不降反稳;"生存率"随随访窗口缩短而非随治疗改善。
解决:

  1. 简单方法:vital_status = unknown 一律按删失处理(§6.3 第 1 步);报告所有生存结果时同时给出删失比例。
  2. 进阶方法:敏感性分析——在最坏情形(unknown 全按死亡/全按删失)间夹逼真实效应;随访窗口截断到登记链接可靠性较高的时段。
  3. SOTA 方法:在研究设计阶段申请/组合国家或州死亡索引链接(NDI/州死亡索引);OP.25-00610 的 MBC 模型即计划用州死亡索引重链接后再部署。
    参考:Potter et al., 2021, JCO CCI.21.00011;OP.25-00610;JCO.2015.65.0598 讨论

⚠️ 坑点 2:参与诊所之外的诊疗不可见,治疗暴露被系统性低估(分类:偏倚陷阱)

问题:数据库仅覆盖参与肿瘤诊所内的诊疗;患者在外院、急诊、基层的治疗与检查不进入数据。纵向"治疗史"实际是"本网络内治疗史"。
症状:治疗间隔出现不可能的长空窗;部分患者的"一线治疗开始"晚于诊断数月(其实在外院完成);队列特征随参与机构类型变化。
解决:

  1. 简单方法:定义暴露时把首诊到首治的"空窗"当作外院治疗指示,做敏感性分层。
  2. 进阶方法:以"网络内停留时间"为协变量或删失触发条件;对边缘患者(入网前后诊断)单独标记。
  3. SOTA 方法:申请时即声明需登记链接与机构变更信息,把跨机构治疗还原纳入研究协议;发表时把覆盖边界写进局限性(OP.25-00610 即如此声明)。
    参考:OP.25-00610 Limitations

⚠️ 坑点 3:ICD 编码重解剖轻形态学,"肺癌队列"直接按 ICD 筛会混入组织学杂质(分类:预处理陷阱)

问题:ICD-9/10 编码聚焦解剖部位而非肿瘤形态学;连"识别 NSCLC 诊断"都需要检查结构化内容中通常不存在的组织学数据;影像、放疗、手术、分子检测在结构化字段中捕获同样不佳。
症状:按 ICD 筛出的"NSCLC"混入 SCLC 与转移性肿瘤;亚型分析中腺癌/鳞癌比例与文献不符;靶向治疗人群对不上分子检测率。
解决:

  1. 简单方法:只使用带形态学/抽象补全的患者(§6.3 第 2 步),其余标记 unclassified 单独报告。
  2. 进阶方法:组合诊断码 + 登记链接形态学 + 临床文本 NLP 抽取三源确认;对冲突源记录置信级。
  3. SOTA 方法:在申请阶段确认目标瘤种的抽象覆盖(NSCLC 是首个系统抽象瘤种,覆盖最深);用抽取一致性高的元素作纳入标准,把低置信元素仅作特征。
    参考:Potter et al., 2020, PMC7608629

⚠️ 坑点 4:非结构化文本与 PDF 基因报告是 PHI 密集区,去标识化是管线第一关(分类:工程陷阱)

问题:临床笔记、扫描文档与 PDF 基因报告包含姓名、生日、病历号、电话等直接标识符;平台需整份接收记录再经 NLP/ML 处理。研究端只能接触去标识化产物,任何试图自行"还原"或导出原始文本的动作都违反合同。
症状:交付文本中出现 [NAME]/日期泛化等脱敏扰动;NLP 模型在脱敏文本上的抽取率低于原始文本基准;把云内 Notebook 结果带出时触碰合规边界。
解决:

  1. 简单方法:NLP 实验全部在 Workspace 内完成,仅导出汇总统计与模型输出(依合同)。
  2. 进阶方法:对脱敏扰动敏感的抽取任务,先量化脱敏对抽取率的影响(在允许的评测集上),把"脱敏鲁棒性"作为模型选型指标。
  3. SOTA 方法:采用对扰动不敏感的抽取架构(如基于上下文窗口的实体识别 + 术语标准化双层设计),并在研究方案中预先声明 NLP 评估口径。
    参考:Potter et al., 2020, PMC7608629(PHI 类型清单与防火墙设计)

⚠️ 坑点 5:不良事件只围绕"哨点事件"30 天窗口记录,直接统计 AE 字段会严重低估毒性(分类:标签理解)

问题:平台抽象 AE 时以哨点事件(换药、停药、急诊、住院、死亡)为锚,仅记录事件 30 天内的 AE,且不对因果性做判定;恶心、脱发等常见低级别毒性不在抽象范围。
症状:用 adverse_events.csv 算出的毒性发生率远低于临床试验报告;不同治疗臂"毒性差异"实际反映的是哨点事件率差异(如住院率);低级别 AE 完全缺席。
解决:

  1. 简单方法:只把 AE 字段用于"高级别毒性"场景(3 级+),并声明其为哨点窗口内发生率而非全谱毒性。
  2. 进阶方法:用实验室值(如血象、肝肾功能)自建毒性代理指标,与哨点 AE 交叉验证;把停药/换药本身当作毒性代理事件。
  3. SOTA 方法:文本 NLP 抽取补充非哨点窗口 AE(依合同与评估口径),并对"因果性未判定"的记录在统计模型中显式处理错分。
    参考:Potter et al., 2020, PMC7608629(AE 抽象策略原文)

⚠️ 坑点 6:curated 记录里也有缺失,且缺失不是随机的(分类:预处理陷阱)

问题:即便是平台精心整理的记录,仍会遇到缺失数据并可能使研究偏倚;抽象资源的分配(成本与人力)本身与瘤种研究活跃度相关——数据"缺在哪"与"谁被研究"高度相关。
症状:完整病例分析集(CCA)的人群特征明显异于全队列;缺失率与结局相关(病重者检验更密);加入缺失指示变量后模型性能跳变。
解决:

  1. 简单方法:报告每个关键元素的缺失率表;禁止把"抽象缺失"当作"临床阴性"。
  2. 进阶方法:多重插补(MICE)+ 缺失指示双通道;对抽象覆盖做逆概率加权(以瘤种/机构/年份为权重模型)。
  3. SOTA 方法:申请阶段向平台索取目标元素抽象覆盖的分层统计,把覆盖偏差写进分析计划的预先敏感性分析。
    参考:OP.25-00610 Limitations;Potter et al., 2020(抽象资源分配逻辑)

⚠️ 坑点 7:13 种 EHR 的系统异质性,模型跨机构验证性能会下降(分类:偏倚陷阱 / 评估误用)

问题:同一临床概念在不同 EHR 中的捕获率、编码习惯与文本风格不同;外部验证中模型性能劣于内部验证(OP.25-00610 中 Brier score 升高、预测概率与观察风险对齐变差)。
症状:内部验证 AUC 亮眼、新机构/新年份验证骤降;特征重要性里出现"某检验次数"这类机构流程代理变量;按站点分组的校准曲线发散。
解决:

  1. 简单方法:按机构分组交叉验证(§5.4),把最差折作为泛化下限汇报。
  2. 进阶方法:剔除/降权机构流程代理特征;对检验频次类特征做机构内标准化(相对本机构分布而非全库分布)。
  3. SOTA 方法:机构自适应校准(站点级 Platt/isotonic);训练时以机构为环境变量做不变风险最小化(IRM)类正则;发布模型卡说明验证机构构成。
    参考:OP.25-00610;CancerLinQ 官网 13 种 EHR 口径

⚠️ 坑点 8:规模口径混淆——9M+ ≠ 近 700 万 ≠ 2,546,350 ≠ 1,426,015(分类:工程陷阱 / 评估误用)

问题:同一数据资产在不同时点、不同口径下的"患者数"差异巨大:官网营销口径 9M+(真实世界数据代表的患者,截至 2026-09);收购公告"近 700 万"(2023-12);学术快照总人群 2,546,350(含良性/原位/血液学且跨类重复计数,2020-03);原发恶性肿瘤诊断 1,426,015(2020-03)。
症状:论文/标书里引用"千万级肿瘤患者队列"被审稿人质疑;与 2020 年论文对比时数字"对不上";样本量论证(power calculation)建立在意想口径上。
解决:

  1. 简单方法:引用任何规模数字前标注三要素——口径、时点、来源(如"原发恶性肿瘤诊断 1,426,015 例,2020-03,CCI.20.00064")。
  2. 进阶方法:在自己数据集上重算可获得研究人群的实际 N(纳入标准过滤后的数字才是样本量依据)。
  3. SOTA 方法:在研究方案与发表稿件中固定"口径-时点-来源"三元组表格,团队内以该表统一引用。
    参考:CancerLinQ 官网;Healthcare IT Today 收购公告;Potter et al., 2020

§6.6 数据增强(安全 ✅ / 危险 ❌)

类别 技术 说明
✅ 安全 缺失掩码扰动 训练时随机遮蔽部分检验特征(模拟缺失机制),提升对缺失模式的鲁棒性;不改动标签与时间
✅ 安全 特征噪声注入 对标准化后的连续检验值/生命体征加小幅高斯噪声(σ 取训练期标准差的 1-5%)
✅ 安全 时间分箱抖动 在粗时间分箱内对事件时间做小幅度重采样(保持事件排序不变)
❌ 危险 对删失样本"插值补全"死亡结局 直接制造标签错分,把坑点 1 放大数倍
❌ 危险 随机翻转 vital_status 做类别平衡 生命状态分布是真实流行病学,不可重采样改变
❌ 危险 把抽象缺失填充为"阴性/未发生" 违反信息性缺失机制(坑点 6),系统性地把研究活跃度低的群体编码为健康
❌ 危险 跨患者拼接近邻插值生成新样本 破坏患者内纵向结构(§4.4),并可能在报告中"生成"不存在的临床轨迹

§6.7 模型推荐

任务 推荐起点 进阶 说明
生存分析 Cox(套索/弹性网) DeepSurv / 随机生存森林 / XGBoost-AFT 传统 Cox 是必做基线,审稿人默认要求
纵向检验建模 逻辑回归 + 窗口聚合特征 GRU/Transformer 时序编码器 注意机构内标准化(坑点 7)
治疗模式/序列挖掘 序列模式挖掘 + 状态机 离散状态隐马尔可夫 / 序列表示学习 治疗线数定义需与研究方案固定
临床文本 NLP 规则 + 词典基线 领域预训练语言模型微调 在脱敏文本上评测(坑点 4)
试验/治疗匹配 规则引擎(资格标准结构化) 匹配模型 + 可解释召回 参考 TriaLinQ/RxLinQ 的产品化口径
质量指标预测 eCQM 规则计算 + 汇总统计 指标依从性预测模型 QDM 逻辑可直接复用为监督信号

§6.8 硬件需求

场景 建议配置 说明
表格/生存建模(单瘤种) Workspace 基础配置(CPU、常规内存)即可 Spark/单机 pandas 均可;数据集经瘤种筛选后规模可控
全库探索(跨瘤种) 申请升级 Spark 集群资源 官方公告明确"额外工具与升级算力可申请"
临床文本 NLP 云内 GPU 资源(需申请)或允许导出的汇总特征上外部分析 原始文本不可出云
本地开发 无本地数据时,用同结构合成小样开发代码,Workspace 内替换真实路径 严格避免把真实数据带出云环境

§6.9 评估指标代码(生存任务)

# 依赖:pip install scikit-survival
import numpy as np
from sksurv.metrics import concordance_index_censored, brier_score, cumulative_dynamic_auc

# y_true 结构化数组:事件指示 + 时间(sk-survival 约定)
y_train = np.array(list(zip(cohort["event_observed"].astype(bool), cohort["time_days"])),
                   dtype=[("event", "?"), ("time", "<f8")])
y_test  = y_train[len(y_train)//5:]   # 示意切分;实际用 §5.4 的折

risk = model.predict(x_test)          # 模型输出的风险分(越大越高危)

# ① Harrell's C-index(注意删失机制下解释局限)
cindex = concordance_index_censored(y_test["event"], y_test["time"], -risk)[0]
print(f"C-index = {cindex:.3f}")

# ② 时间依赖 AUC(1 年/3 年/5 年三个临床时点)
times = np.array([365, 1095, 1825])
auc, mean_auc = cumulative_dynamic_auc(y_train, y_test, risk, times)
print(dict(zip(["1y", "3y", "5y"], auc.round(3))))

# ③ Integrated/Brier Score —— OP.25-00610 外部验证劣化的核心指标(坑点 7)
surv_prob = model.predict_survival_function(x_test, times)   # 依模型 API 调整
_, ibs = brier_score(y_train, y_test, surv_prob, times)
print(f"Time-dependent Brier = {ibs.round(3)}")

报告规范:C-index、时间依赖 AUC、Brier/IBS 三件套必须同时报告内部与外部(时间/机构外推)结果;单独报告 C-index 会被视为对删失与校准问题的回避。

§6.10 MLOps 笔记

  1. 固定快照,写进产物:平台日更意味着"同一天重跑"才可比;在配置、特征库与模型卡中记录数据快照标识与下载时点。
  2. 特征库双份统计:训练期 winsorize/标准化统计量持久化(§6.3 第 3 步),推理复用;禁止推理期重算全局统计。
  3. 合同即流水线边界:允许导出的只有合规汇总/模型产物;代码审查中加入"数据不出云"检查项。
  4. 漂移监控:月度监控关键元素的缺失率、机构构成与诊断年份分布;抽象覆盖变化会静默改变特征语义(坑点 6/7)。
  5. 可复现实验:数据不可本地化 → 把环境(依赖版本)与随机种子纳入版本化;分析产出走平台合规流程。
  6. 重跑与研究协议一致性:委员会批准的是特定研究问题与数据范围;扩展用途需回到审批流程,勿在"顺手分析"里越界。

§7 质量评估与局限性

§7.1 已知偏倚表

偏倚类型 描述 严重程度 缓解措施
生存高估(死亡捕获不全) EHR 死亡信息不完整且滞后;CLQD 若干瘤种 5 年生存估计高于 SEER 高 删失处理 + 敏感性分析 + 死亡索引链接(坑点 1)
选择偏倚 仅覆盖参与机构的服务人群;机构自愿订阅、非概率抽样 高 明确目标人群边界;机构外推验证(§5.3)
覆盖截断偏倚 院外/网外治疗与检查不可见(坑点 2) 中-高 暴露定义留边界;登记链接补充
结构化捕获偏倚 形态学、影像、放疗、手术、分子检测结构化捕获差,依赖抽象(坑点 3) 中 三源确认(编码+登记+文本);抽象覆盖分层
缺失非随机 curated 记录仍有缺失且与瘤种研究活跃度相关(坑点 6) 中 缺失指示 + 逆概率加权 + 多重插补
跨系统测量偏倚 13 种 EHR 概念捕获率不同;模型外部验证性能下降(坑点 7) 中 机构分组验证 + 机构内标准化
结局错分偏倚 仅用结构化数据判别转移状态会错分(OP.25-00610 自述) 中 文本/抽象补充确认
产业资助相关性 CLQD 描述论文由 AstraZeneca 资助、多位作者受雇于药企(论文披露);平台商业模式含产业合作 低-中 引用与解读时注意来源声明;方法透明度复核

§7.2 标注(抽象)质量

人工/NLP 抽象是 CancerLinQ 的质量核心也是质量瓶颈。三层结构决定了最终数据质量:结构化层受 EHR 录入习惯约束(跨 13 种系统不一致);NLP 层对整份文本自动抽取,抽取误差未公开量化,且对脱敏扰动敏感(坑点 4);人工抽象层质量最高但覆盖最窄。

抽象由受训的业务关联分包商在 PHI 防火墙内执行,抽象范围按"质量指标影响 × 结构化捕获缺口 × 研究活跃度"排序(NSCLC 首位),2020-03 覆盖 238,680 例患者(约 16.7%)。抽象员间一致性与抽象准确性的公开量化数据有限;与 CTCA 的联合数据质量举措曾系统评估电子临床质量指标中高影响数据元素(CCI.17.00139)。

使用建议:把"目标元素是否在抽象覆盖内、覆盖到哪个深度"当作申请阶段的必答题,而不是拿到数据后的意外;同时把抽象覆盖与瘤种/年份/机构的交叉表纳入研究档案——它是审稿人追问选择偏倚时的第一道防线(坑点 6)。

§7.3 泛化性表

部署场景 失效风险 证据
推广到未参与机构 高:机构聚类泄漏 + 流程代理特征 OP.25-00610 外部验证 Brier score 升高、校准变差
时间外推(跨治疗范式) 高:免疫治疗时代后治疗分布漂移 数据 2013 年起持续更新,范式演进必然改变先验(§7.6)
社区 → 学术中心迁移 中:人群构成与记录风格差异 平台以社区诊所为主体,学术机构子分布不同
美国外部 → 其他国家 高:编码体系、诊疗路径、支付结构全变 spatialCoverage 明确为美国(§3.8)
生存结局跨场景 高:死亡捕获质量随场景变化 CLQD vs SEER 系统性差异(坑点 1)

§7.4 伦理与治理

治理链:机构授权 → PHI 防火墙(抽象与科研隔离)→ 去标识化(Discovery 永不含可识别患者/医师数据)→ 委员会审批(研究问题与 ASCO 使命一致性)→ 数据合同(范围与产出约束)→ AWS 受控环境分析。患者参与:平台设 Patient Advisory Committee,把患者意见纳入产品设计、产品线与数据治理(官网)。DUO 类比说明:本页标注 HMB(健康/生物医学研究)、IRB(伦理审查类比委员会审批)为 GA4GH DUO 框架下的近似映射——CancerLinQ 未官方发布 DUO 编码,实际限制以数据合同为准。

§7.5 公平性

平台明确宣称数据"反映癌症患者的真实多样性",且社区诊所为主体正是其公平性卖点(学术试验人群系统性排除老年、Rural、低收入患者);但公开的描述性论文未披露种族/族裔/保险分层的完整统计。公平性研究者的行动清单:① 申请时要求目标瘤种的分层计数;② 对结构性缺医少药人群的"缺数据"与"低发生率"做机制区分;③ 谨慎对待以缺失指示为特征的模型(可能把医疗资源可及性编码为风险,坑点 6)。

公平性评估维度 建议指标 本数据集的特定风险
亚组性能一致性 分层 C-index/AUC 与校准斜率(年龄、机构类型、诊断年份) 老年与社区亚组样本可能充足,但标签质量(死亡捕获)不一致
资源可及性混淆 缺失率 × 结局关联分析 检验频次反映就医强度而非病情(§4.5)
表征公平性 分层计数与官方流行病学(SEER)对照 种族/保险分层未公开,需申请阶段索取
标签公平性 死亡捕获率分层(坑点 1) 亚组间删失机制差异会伪装成"风险差异"

§7.6 数据漂移

三重漂移源持续存在:① 机构组成漂移——订阅机构进出(63 家/2020-03 → 100+/2026-09 口径)改变人群与记录风格;② 临床范式漂移——2015-2025 年免疫治疗、靶向治疗、分子诊断的爆发直接改写治疗序列先验;③ 口径漂移——并购(2023-12)、产品线换代(ASCO Certified、CARAai)与持续日更使"同一数据集"在不同时点并非同一实体。缓解:固定快照、漂移监控(§6.10)、时间外推验证(§5.2)。

§7.7 DAIMS 24 项检查表

# 检查项 状态 说明
1 宽格式可得性 ⚠️ 云内提供分析就绪表;无公开宽格式下载
2 唯一标识 ✅ 患者级去标识化主键体系,跨表可用
3 特殊字符处理 ⚠️ 文本含扫描/NLP 抽取内容;清洗规范未公开,需自查
4 重复行 ⚠️ 跨机构/跨诊断类目重复计数需自行检测(快照明确声明跨类重复计数)
5 缺失编码 ⚠️ 无统一缺失码;空值语义逐字段判断(死亡日期空 ≠ 存活)
6 标签标识 ⚠️ 无现成 ML 标签;生存结局需按 §6.3 自构造
7 罕见类分组 ⚠️ 49 个瘤种专用数据集天然分组;单项规模需在申请阶段确认
8 偏倚评估 ✅ 官方论文系统披露偏倚与 SEER 对比(CCI.21.00011 等)
9 数据字典 ✅ 交付含数据字典与码表(申请流程内置文档交付)
10 信息性缺失解释 ✅ 死亡缺失机制、AE 哨点窗口规则均有官方明文
11 设备记录 ❌ 无测量设备级元数据公开
12 共线性 ⚠️ 抽象数据与登记链接存在概念重叠,需自行检测
13 编码映射 ✅ QDM 标准化 + ICD/SNOMED 体系,映射逻辑有论文级披露
14 时间戳处理 ⚠️ 诊断/登记/末次接触等日期语义多样,需统一锚点(§6.3)
15 划分建议 ❌ 无官方 ML 划分
16 泄漏讨论 ⚠️ 官方局限声明部分覆盖;研究级泄漏设计需自行完成(§5.3)
17 标签分布 ✅ 12 癌种分布有公开描述(491,360 例明细)
18 测量偏倚 ⚠️ 跨 EHR 差异已知但未公开量化
19 外部验证建议 ✅ SEER 参照与模型外部验证实例公开(§7.8)
20 版本记录 ⚠️ 无正式版本号;时点口径散见论文/公告(坑点 8)
21 预处理脚本 ❌ 无公开官方预处理脚本
22 合规要求 ✅ 委员会审批 + 合同 + 去标识化承诺,边界清晰
23 多模态对齐 ⚠️ 结构化/文本/登记链接的患者级对齐质量未公开量化
24 去标识化 ✅ Discovery 永不含可识别数据;PHI 防火墙有官方设计披露

DAIMS 评分:15.5 / 24(✅ 9 项、⚠️ 12 项、❌ 3 项)

评分解读:CancerLinQ 的强项集中在"治理与透明度"——去标识化设计、合规流程、偏倚披露、编码标准化都有论文级或官方文档级支撑,这在商业 RWD 平台中属于第一梯队。弱项集中在"机器学习工程适配"——无官方划分、无预处理脚本、无统一缺失编码、无设备元数据,所有 ML 就绪化工作(标签构造、划分、缺失策略)都要研究者自行完成并自行证明其合理性。

对你意味着什么:① 别指望"拿到就能跑"——把 §6.1-§6.3 的体检与结局构造当作第一周标配动作;② 申请阶段就要锁定数据字典、抽象覆盖率与缺失语义,这三样决定了你后面一半的方法学决策;③ 预算至少一个专门迭代做缺失/泄漏/口径三元问题的方法学验证(坑点 1/6/8),这部分工作在审稿与合规审查中都会被追问;④ 治理透明度高意味着"合规路径清晰"——按 §6.2 流程走,不会在数据合规上踩雷。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
SEER 登记数据 NCI 12 癌种 5 年总生存估计 5 年 OS 估计(Kaplan-Meier) CLQD 高于 SEER(多个瘤种) 差异主要归因 EHR 死亡捕获不完整(CCI.21.00011)
机构肿瘤/死亡登记 参与/合作登记机构 EHR-登记数据链接评估 链接优势、局限与教训(定性) — 登记链接提升诊断/分期/生命状态质量但覆盖与准确性有限(CCI.21.00149)
独立外部验证集(MBC 预后模型) OP.25-00610 作者团队 转移性乳腺癌近期预后预测 Brier score(外部高于内部) 外部验证性能劣化 缺失数据与死亡数据滞后是主因;计划州死亡索引重链接(OP.25-00610)
高影响 eCQM 数据元素(CTCA 联合举措) CancerLinQ + CTCA 电子临床质量指标数据质量评估 元素级质量分层(定性) — 质量指标的落地瓶颈在高影响元素的结构化捕获质量(CCI.17.00139)

表中只收录有同行评审支撑的比较;未公开量化的对齐/偏倚问题见 §7.1 与 §4.5。


§8 基准性能与生态

§8.1 已发表研究表现快照(无公开排行榜的诚实替代)

CancerLinQ 没有公开的 ML 排行榜(数据非公开下载、无统一基准划分),不存在"huggingface 榜"式的可比数字。下表收录公开文献/公告中可核查的研究表现,各研究的数据子集、定义与时期不同,数值与结论不可直接互比:

研究/分析 任务 数据子集 公开结果要点 完整引用
CLQD 12 癌种描述 流行病学描述 + 生存估计 2013-2018 诊断的 12 癌种 491,360 例 四大癌种分布与中位年龄;生存高于 SEER 归因死亡捕获 Potter et al., 2021, JCO Clin Cancer Inform. doi:10.1200/CCI.21.00011
转移性乳腺癌预后模型 近期预后预测 Discovery curated MBC 记录 模型可区分高风险人群;外部验证 Brier score 劣于内部 Development and Validation of a Metastatic Breast Cancer–Specific Prognostic Model Using CancerLinQ Discovery, 2025, JCO Oncol Pract. doi:10.1200/OP-25-00610
免疫检查点抑制剂 RWE 真实世界治疗分析 >10,000 名 ICI 治疗患者数据集 平台可支撑大规模免疫治疗时代分析 CancerLinQ/Tempus/Concerto HealthAI 合作公告(2017-2018,见 §1.4 线索)
ASCO 2020 年会摘要群 多瘤种 RWE Discovery 上线数据集 11 篇摘要入选 ASCO 2020 年会 ASCO 公告, 2020-05

§8.2 SOTA 总结与选型建议

该领域没有"刷榜"意义上的 SOTA;实际选型建议:① 生存与预后任务以 Cox/弹性网为基线、以 Brier/校准为主要汇报指标(跟随 OP.25-00610 的教训,别只报 C-index);② 治疗模式研究优先做指南依从性类定义清晰的任务;③ NLP 任务以"脱敏鲁棒性"为一等指标(坑点 4);④ 任何任务都必须包含时间/机构外推验证(§5.2),否则结论对"新诊所/新一年"没有承诺力。

方法论层面,CancerLinQ 上已发表工作给出的"最佳实践共识"可以总结为三条:其一,把数据局限写进研究设计而不是写进 Limitations 的最后一句话(OP.25-00610 把死亡索引链接计划纳入后续工作是范本);其二,描述性研究与建模研究共用同一套口径表(坑点 8),让平台论文与自有结果可对账;其三,模型可解释性优先于性能微调——审稿人对 RWE 模型的第一问永远是"它学到的特征是临床信号还是机构流程"(坑点 7)。

§8.3 评测协议

若你在 Discovery 上开展研究并希望结果可被社区复用,建议协议:① 在研究方案(随申请提交)中固定数据快照、纳入排除标准、结局定义、划分方案与指标族;② 内部验证(患者分组 CV)+ 外推验证(时间 + 机构)双轨;③ 按 §6.9 三件套报告;④ 在稿件中固定"口径-时点-来源"表格(坑点 8)并披露产业资助关系(§7.1)。

数据集 类型 获取 与 CancerLinQ 的互补关系
SEER 人口学癌症登记 公开申请(免费 + DUA) 生存/发病率金标准参照;无诊疗过程细节
NCDB 医院癌症登记 申请审核 手术与机构级细节;CoC 认证机构覆盖
Flatiron Health 商业肿瘤 EHR RWD 商业合作 集中抽象 + 基因组深度;方法论对照对象
TriNetX 全球 EHR+声明联盟 注册查询/合作 覆盖广、肿瘤专科深度较浅
MIMIC-IV 单中心 ICU/住院 EHR 凭证化公开申请 免费细粒度住院数据;与门诊肿瘤场景互补
TCGA 基因组+临床队列 公开 深度分子特征;无纵向诊疗过程

§8.5 关键论文 Top 8

  1. Potter DM, Brothers R, Kolacevski A, et al. Development of CancerLinQ, a Health Information Learning Platform From Multiple Electronic Health Record Systems to Support Improved Quality of Care. JCO Clinical Cancer Informatics. 2020;4:CCI.20.00064. doi:10.1200/CCI.20.00064 — 平台架构、QDM 映射、抽象策略与 D2 快照的官方系统描述(本页首选引用)。
  2. Potter DM, Riffon MF, Manning B, et al. Summary of the 12 Most Common Cancers in the CancerLinQ Discovery (CLQD) Database. JCO Clinical Cancer Informatics. 2021;5:658-667. doi:10.1200/CCI.21.00011 — CLQD 首篇数据库描述论文,12 癌种统计与 SEER 对比。
  3. Building a rapid learning health care system for oncology: the regulatory framework of CancerLinQ. Journal of Clinical Oncology. 2014;32(22):2373-2379. doi:10.1200/JCO.2014.56.2124 — 快速学习健康系统的监管框架奠基论文。
  4. CancerLinQ: Origins, Implementation, and Future Directions. JCO Clinical Cancer Informatics. 2018;2:1-7. doi:10.1200/CCI.17.00060 — 起源与实施历程综述。
  5. Assessment and Stratification of High-Impact Data Elements in Electronic Clinical Quality Measures: A Joint Data Quality Initiative Between CancerLinQ and Cancer Treatment Centers of America. JCO Clinical Cancer Informatics. 2018;2:1-10. doi:10.1200/CCI.17.00139 — eCQM 高影响数据元素的质量评估方法。
  6. Cancer Registry Data Linkage of Electronic Health Record Data From ASCO’s CancerLinQ: Evaluation of Advantages, Limitations, and Lessons Learned. JCO Clinical Cancer Informatics. 2022;6:e2100149. doi:10.1200/CCI.21.00149 — 登记链接的价值与局限。
  7. Development and Validation of a Metastatic Breast Cancer–Specific Prognostic Model Using CancerLinQ Discovery. JCO Oncology Practice. 2025. doi:10.1200/OP-25-00610 — 在 Discovery 上开发并外部验证预后模型的完整方法学实例(局限声明极具教学价值)。
  8. The American Society of Clinical Oncology’s CancerLinQ vision / quality improvement 架构系列(含可识别数据钻取 vs 去标识化的设计张力讨论). Journal of Oncology Practice. 2016. doi:10.1200/JOP.2016.020743(及 JCO.2015.65.0598)— 质量报告与研究数据双重身份的工程权衡。

§8.6 社区活跃度

生态面 现状 证据/说明
学术产出 Discovery 数据已支撑"数十篇"发表 官网研究者页
会议影响力 2020 年单届 ASCO 年会 11 篇摘要 ASCO 公告, 2020-05
质量认证生态 ASCO Certified RQS 供应商(2025-08)、Certified EHR 体系、QOPI 自动化 CB Insights 汇编
产业与政府合作 AstraZeneca(首个战略伙伴)、FDA CDER、Tempus/Concerto HealthAI、ConcertAI(母公司) §1.4 时间轴各来源
开源社区 无官方 GitHub 仓库或公开 issue 区 技术问题走合同与平台支持通道
资助通道 Conquer Cancer 曾设 Discovery 专项资助(32,500 美元/项,2019) ASCO Post

§8.7 生态快照表

资源 类型 链接 推荐理由
CancerLinQ 官网 门户 cancerlinq.org 规模口径与产品线的第一信源
Discovery 研究者页 获取入口 cancerlinq.org/solutions/researchers 数据集目录与申请联系方式
ASCO Discovery 平台公告 官方新闻 asco.org(2020-05) AWS Workspace 工具链与申请机制的权威描述
ASCO Connection 数据共享指南 官方流程 connection.asco.org 6-8 周审批流程与费用逻辑的最完整公开描述
CCI.20.00064(PMC 全文) 论文 PMC7608629 平台技术与数据治理的最佳单篇文献
ConcertAI 收购公告 产业动态 Healthcare IT Today(2024-01) 理解平台当前归属与投资承诺
Conquer Cancer Discovery 资助 资助 ASCO Post(2019-04) 研究资助与数据使用结合的范例

生态链接均为外部官方资源;本页站内地址统一为 https://www.qianfanghub.com/ai-ready-dataset/cancerlinq/388。


§9 相关资源与引用

§9.1 官方资源清单

资源 用途 地址
CancerLinQ 官网 规模口径、产品线、联系方式 https://www.cancerlinq.org/
Discovery 研究者页 数据集目录、申请入口(info@cancerlinq.org) https://www.cancerlinq.org/solutions/researchers
ASCO Connection 数据共享指南 申请审批全流程最详细公开描述 https://connection.asco.org/magazine/society-member-news/asco-data-sharing-initiatives-support-innovative-cancer-research
ASCO Discovery 平台公告 AWS Workspace 与自助式平台机制 https://www.asco.org/practice-policy/policy-issues-statements/asco-in-action/new-cancerlinq-discovery-research-platform-may-2020
PMC7608629 全文 平台技术与治理最佳单篇 https://preview.ncbi.nlm.nih.gov/pmc/articles/PMC7608629/
CCI.21.00011 CLQD 数据库描述论文 https://ascopubs.org/doi/10.1200/CCI.21.00011
ConcertAI 官网 母公司动态与 RWE 生态 https://www.concertai.com/
ASCO 官网 学会背景、QOPI/ASCO Certified 体系 https://www.asco.org/

§9.2 学习路径建议

  1. 第一周(读懂资产):精读 PMC7608629(架构与抽象策略)→ CCI.21.00011(数据画像)→ OP.25-00610 的 Limitations(真实研究中的坑位清单)。
  2. 第二周(锁定研究问题):对照 49 个瘤种数据集池与研究资助方向,把研究问题写窄;同时列出目标数据元素清单。
  3. 第三周(启动申请):按 §6.2 六步走流程提交;审批期(6-8 周)内用同结构合成数据开发管线(§6.8)。
  4. 获批后第一周(数据体检):§6.1 最小体检 → §6.3 结局构造 → 缺失率普查(坑点 1/6/8 三连)。

§9.3 BibTeX 完整引用

@article{Potter2020CancerLinQ,
  author  = {Potter, Danielle M. and Brothers, Raven and Kolacevski, Andrej and Koskimaki, Jacob E. and McNutt, Amy and Miller, Robert S. and Nagda, Jatin and Nair, Anil and Rubinstein, Wendy S. and Stewart, Andrew K. and Trieb, Iris J. and Komatsoulis, George A.},
  title   = {Development of {CancerLinQ}, a Health Information Learning Platform From Multiple Electronic Health Record Systems to Support Improved Quality of Care},
  journal = {JCO Clinical Cancer Informatics},
  year    = {2020},
  volume  = {4},
  pages   = {CCI.20.00064},
  doi     = {10.1200/CCI.20.00064}
}

@article{Potter2021CLQD,
  author  = {Potter, Danielle M. and Riffon, Mark F. and Manning, Brittany and Taylor, Aliki and Emmas, Cathy and Kabadi, Shaum and Jiang, Miao and Miller, Robert S.},
  title   = {Summary of the 12 Most Common Cancers in the {CancerLinQ Discovery} ({CLQD}) Database},
  journal = {JCO Clinical Cancer Informatics},
  year    = {2021},
  volume  = {5},
  pages   = {658--667},
  doi     = {10.1200/CCI.21.00011}
}

@article{RegulatoryFramework2014,
  title   = {Building a rapid learning health care system for oncology: the regulatory framework of {CancerLinQ}},
  journal = {Journal of Clinical Oncology},
  year    = {2014},
  volume  = {32},
  number  = {22},
  pages   = {2373--2379},
  doi     = {10.1200/JCO.2014.56.2124}
}

@article{Origins2018,
  title   = {{CancerLinQ}: Origins, Implementation, and Future Directions},
  journal = {JCO Clinical Cancer Informatics},
  year    = {2018},
  volume  = {2},
  pages   = {1--7},
  doi     = {10.1200/CCI.17.00060}
}

@article{CTCADataQuality2018,
  title   = {Assessment and Stratification of High-Impact Data Elements in Electronic Clinical Quality Measures: A Joint Data Quality Initiative Between {CancerLinQ} and {Cancer Treatment Centers of America}},
  journal = {JCO Clinical Cancer Informatics},
  year    = {2018},
  volume  = {2},
  pages   = {1--10},
  doi     = {10.1200/CCI.17.00139}
}

@article{RegistryLinkage2022,
  title   = {Cancer Registry Data Linkage of Electronic Health Record Data From {ASCO}'s {CancerLinQ}: Evaluation of Advantages, Limitations, and Lessons Learned},
  journal = {JCO Clinical Cancer Informatics},
  year    = {2022},
  volume  = {6},
  pages   = {e2100149},
  doi     = {10.1200/CCI.21.00149}
}

@article{MBCPrognostic2025,
  title   = {Development and Validation of a Metastatic Breast Cancer--Specific Prognostic Model Using {CancerLinQ Discovery}},
  journal = {JCO Oncology Practice},
  year    = {2025},
  doi     = {10.1200/OP-25-00610}
}

@misc{CancerLinQPortal,
  title        = {CancerLinQ Official Website},
  howpublished = {\url{https://www.cancerlinq.org/}},
  year         = {2026},
  note         = {Accessed 2026-09-13}
}

§9.4 引用指南

  • 引用本数据集:优先引 Potter 2020(平台)+ Potter 2021(CLQD 数据库);两者分别对应"平台是什么"与"数据长什么样"。
  • 引用规模数字:按坑点 8 的"口径-时点-来源"三元组;禁止把 9M+ 写成"4,913,600 例研究样本"这类口径拼接。
  • 引用本页面:千方病案医数集. CancerLinQ — 肿瘤快速学习健康系统 AI-Ready Wikipedia. https://www.qianfanghub.com/ai-ready-dataset/cancerlinq/388(审核日期 2026-09-05)
  • 成果发表:Discovery 数据的发表还需遵守数据合同的发表与致谢条款(委员会审批时即会明确)。

§10 AI 使用声明卡

§10.1 AI 模型列表

模型/工具 版本 用途 使用日期
CodeBuddy(大语言模型编码助手) fast-model 本条目文本起草、结构化整理、代码示例编写 2026-09-13
WebSearch(检索工具) 平台内置 事实核查(5 次检索,2026-09-13) 2026-09-13

§10.2 AI 参与范围

AI 参与了以下工作:检索线索生成与执行、检索结果的甄别与整理、正文初稿撰写、表格与代码示例的组织。AI 未参与:最终事实裁决(以来源链接为准)、医学与数据工程判断的背书、以及任何形式的临床建议生成。所有关键数字均可通过 §10.3 的来源清单回溯核实。

§10.3 输入来源列表

  1. CancerLinQ Official Website. https://www.cancerlinq.org/
  2. CancerLinQ Researchers(Discovery 数据集目录与申请). https://www.cancerlinq.org/solutions/researchers
  3. Potter DM, et al. Development of CancerLinQ… JCO Clin Cancer Inform. 2020;4:CCI.20.00064. PMC7608629 / PubMed 33104389
  4. Potter DM, et al. Summary of the 12 Most Common Cancers in the CLQD Database. JCO Clin Cancer Inform. 2021;5:658-667. https://ascopubs.org/doi/10.1200/CCI.21.00011 / PubMed 34110931
  5. New CancerLinQ Discovery Research Platform Offers Researchers Easy Access to Real-World Cancer Data. ASCO, 2020-05. https://www.asco.org/practice-policy/policy-issues-statements/asco-in-action/new-cancerlinq-discovery-research-platform-may-2020
  6. ASCO Data-Sharing Initiatives Support Innovative Cancer Research. ASCO Connection. https://connection.asco.org/magazine/society-member-news/asco-data-sharing-initiatives-support-innovative-cancer-research
  7. ASCO Seeks Applicants for Research Grants to Use Data From CancerLinQ Discovery. The ASCO Post, 2019-04-10. https://ascopost.com/issues/april-10-2019/asco-seeks-applicants-for-research-grants-to-use-data-from-cancerlinq-discovery/
  8. ConcertAI to Acquire CancerLinQ to Build the Leading Healthcare Learning and Research Network in Oncology. Healthcare IT Today, 2024-01-02. https://www.healthcareittoday.com/2024/01/02/concertai-to-acquire-cancerlinq-to-build-the-leading-healthcare-learning-and-research-network-in-oncology/
  9. CancerLinQ One Year Later. ConcertAI Blog, 2024-12-11. https://www.concertai.com/blog/cancerlinq-one-year-later
  10. CancerLinQ Company Profile(含 2025-08-27 ASCO Certified RQS 新闻). CB Insights. https://www.cbinsights.com/company/cancerlinq
  11. CancerLinQ Enables Oncology’s Largest Learning Network and Precision Oncology Solutions with Clinical Informatics Innovations. CancerLinQ, 2024. https://www.cancerlinq.org/cancerlinq-enables-oncologys-largest-learning-network-and-precision-oncology-solutions-with-clinical-informatics-innovations
  12. Development and Validation of a Metastatic Breast Cancer–Specific Prognostic Model Using CancerLinQ Discovery. JCO Oncol Pract. 2025. https://ascopubs.org/doi/abs/10.1200/OP-25-00610
  13. The Opportunities and Shortcomings of Using Big Data and National Databases for Sarcoma Research. PMC6690764
  14. CancerLinQ 质量报告可识别数据钻取与生命状态完整性讨论(JCO.2015.65.0598,经 JOP.2016.020743 引文链接). https://ascopubs.org/servlet/linkout?suffix=e_1_3_3_25_2&dbid=4&doi=10.1200%2FJOP.2016.020743&key=10.1200%2FJCO.2015.65.0598&site=asco-site
  15. Building a rapid learning health care system for oncology: the regulatory framework of CancerLinQ. JCO. 2014;32(22):2373-9. https://doi.org/10.1200/JCO.2014.56.2124
  16. CancerLinQ: Origins, Implementation, and Future Directions. JCO Clin Cancer Inform. 2018. https://doi.org/10.1200/CCI.17.00060(经 PubMed 33104389 相似文献核实存在性)

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§0 免责声明与利益冲突 千方病案医学编辑部 逐字核对模板与关联方清单 ✅ 已通过/已验证
§1 概览与时间轴数字 千方病案医学编辑部 对 §10.3 来源逐条回溯 ✅ 已通过/已验证
§2 ICD-11/SNOMED 映射 千方病案医学编辑部 对照 WHO ICD-11 公开映射复核,低置信条目已标注或删除 ✅ 已通过/已验证
§3-§4 规格与数据结构 千方病案医学编辑部(数据工程) 口径-时点-来源三元组核查;示意性结构已显式声明 ✅ 已通过/已验证
§6 AI 指南与 8 坑点 千方病案医学编辑部(数据工程) 坑点全部对应文献证据;代码经结构审查 ✅ 已通过/已验证
§7 DAIMS 24 项与偏倚 千方病案医学编辑部 逐项对照官方文档与论文证据 ✅ 已通过/已验证
§8-§9 引用与 BibTeX 千方病案医学编辑部 DOI 可解析性核对;作者未核实处采用标题式引用 ✅ 已通过/已验证

§10.5 AI 生成章节标注

本条目全部章节由 AI 辅助起草;其中 §1.0/§1.2/§2.5/§7.4-§7.6/§8.2/§9.2/§9.4 的观点性综合内容与 §6 的代码示例为 AI 生成后经人工编辑审定,事实性内容(数字、日期、流程)均锚定 §10.3 来源清单。

§10.6 最后人工审核日期

2026-09-05(与 §0 审核日期一致)

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • flatiron-health — 共享标签:电子健康记录 / 真实世界数据 / 肿瘤学
  • ncdb — 共享标签:电子健康记录 / 真实世界数据 / 肿瘤学
  • aacr-genie — 共享标签:真实世界数据 / 肿瘤学
  • komodo-healthcare-map — 共享标签:电子健康记录 / 真实世界数据
  • scin — 共享标签:电子健康记录 / 真实世界数据
  • maternal-ultrasound-nutrition — 共享标签:电子健康记录 / 真实世界数据
  • all-of-us-nih — 共享标签:电子健康记录 / 肿瘤学
  • trec-pm — 共享标签:电子健康记录 / 肿瘤学
  • aact — 共享标签:电子健康记录 / 真实世界数据
  • trinetx — 共享标签:电子健康记录 / 真实世界数据

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集