MSK-IMPACT 肿瘤靶向测序队列

Integrated Mutation Profiling of Actionable Cancer Targets:全球规模最大的前瞻性临床肿瘤靶向测序队列之一

来源 Memorial Sloan Kettering Cancer Center发布时间: 2026-09-15最后更新: 2026-09-25 阅读 40
MSK-IMPACT 肿瘤靶向测序队列

信息速览

数据集名称MSK-IMPACT 肿瘤靶向测序队列
数据类型靶向 panel 测序,体细胞突变,配对正常样本,临床队列,真实世界数据,泛癌种,免疫治疗生物标志物
规模67617
接入方式Memorial Sloan Kettering Cancer Center
AI 就绪度

数据集封面

MSK-IMPACT 肿瘤靶向测序队列

INFOBOX 内容
数据集名称 MSK-IMPACT 肿瘤靶向测序队列
英文名称 MSK-IMPACT(Integrated Mutation Profiling of Actionable Cancer Targets)
维护机构 Memorial Sloan Kettering Cancer Center(MSK)
首次发布 2017-05(Nature Medicine 队列论文与 cBioPortal 公开数据同步上线)
数据模态 肿瘤靶向 panel 测序(DNA NGS)+ 配对正常样本 + 临床随访
样本规模 内部 cBioPortal 累计 89,735 个肿瘤样本(截至 2022 官方数据共享材料)
患者规模 67,617 名患者(截至 2022),检测人数累计逾 70,000,年增速逾 12,000 样本
癌种覆盖 2017 队列 62 种主要肿瘤类型;MSK-IMPACT 50K 队列 448 个 OncoTree 组织学亚型
Panel 版本 341 → 410 → 468 → 505 基因(现行实体瘤版 505 基因;血液肿瘤 Heme 版 468 基因)
测序平台 Illumina 高通量测序,杂交捕获靶向富集,CLIA 合规临床实验室
数据格式 MAF(突变)、TSV(临床与拷贝数)、SEG(区段)、TAR 打包下载
公开规模 cBioPortal msk-impact:10,945 例肿瘤(2017 队列);Zenodo 50K:54,331 例肿瘤 / 48,179 名患者
许可协议 cBioPortal 公开 study 免费开放;Zenodo MSK-IMPACT 50K 为 CC BY-NC-ND 4.0
获取渠道 cBioPortal、Zenodo、AACR Project GENIE(延迟约一年共享)
访问门槛 cBioPortal 与 Zenodo 免登录直接下载;GENIE 需 Synapse 账号并签署数据使用协议
标注协议 OncoKB 突变功能注释、OncoTree 癌种编码、HGVS 变异命名、FACETS 拷贝数输出
关联知识库 OncoKB、OncoTree、cBioPortal for Cancer Genomics
关联数据集 AACR Project GENIE、TCGA、MSK-ACCESS(cfDNA 液体活检)
典型任务 驱动突变发现、TMB/MSI 生物标志物研究、免疫治疗响应预测、基因型-试验匹配
AI 就绪度 4/5 星
试验注册号 NCT01775072(IRB 批准的前瞻性分子画像协议)
最后更新 2026-09-05
页面状态 published

§0 可信度声明

  • 本词条由 qianfanghub.com 医疗数据集百科编辑部撰写,编辑部长期跟踪临床肿瘤测序队列的数据开放实践。
  • 全部规模数字、版本信息与许可条款均经 2026-09 网络检索核实,来源包括 MSK Data Catalog、MSK 官方资源页、Zenodo 数据集记录、PubMed/PMC 论文全文与 AACR GENIE 相关官方材料。
  • 首要参考为原始队列论文 Zehir et al.(Nature Medicine 2017,PMID 28481359,DOI 10.1038/nm.4333,Google Scholar 引用 3,758 次,截至 2026-09)。
  • 编辑部与 MSK、AACR 无任何利益关联;词条不含商业推广内容。
  • 最后人工审核日期:2026-09-05。若 MSK 后续发布新的公开 cohort 或许可变更,请以官方渠道最新说明为准。

修订记录:

版本 日期 说明
1.0 2026-09-05 初版发布:基于 6 次公开检索完成事实核查,覆盖规格、结构、AI 就绪指南与 8 大坑点

§1 数据集概览

MSK-IMPACT(Integrated Mutation Profiling of Actionable Cancer Targets,整合突变分析可用药癌症靶点)是 MSK 自 2014 年起持续运行的临床肿瘤靶向测序项目,也是全球最早、规模最大的机构级前瞻性临床测序队列之一。它不是一个为 AI 研究专门设计的"干净"基准数据集,而是一个真实世界临床队列——所有样本均来自因治疗需要而接受检测的晚期与难治性肿瘤患者,这既是它作为研究资源的独特价值,也是使用它时必须直面的偏倚来源。

项目的技术底座由 MSK 病理科分子诊断服务与 CMO 共同搭建:检测在 CLIA 合规实验室完成,分析管线开源可审计,结果每日摄取进 cBioPortal 并实时分发给机构研究者。项目由 Michael Berger 等主导设计,数据分发体系由 Nikolaus Schultz 团队围绕 cBioPortal 构建,OncoKB 与 OncoTree 两个配套知识基础设施均出自同一体系。

队列的核心设计是肿瘤-正常配对测序:对每例患者的肿瘤组织(或转移灶活检)与配对正常样本(通常为外周血)进行 341 至 505 基因(版本随时间演进)的全外显子杂交捕获测序,同时捕获 TERT 启动子区与 17 个高频重排基因的选定内含子,从而在一次检测中同时输出体细胞 SNV、小 indel、拷贝数改变、重排、TMB 与 MSI 等多类 altered。2017 年 5 月发表于 Nature Medicine 的首报论文分析了最初的 10,945 例肿瘤(10,336 名患者、62 种主要肿瘤类型),检出 78,066 个体细胞突变、22,989 个拷贝数改变与 1,875 个重排,37% 的患者携带至少一个可用药改变,81% 的改变会被仅覆盖热点的传统 panel 遗漏。

对 AI 研究者而言,这个数据集的独特之处在于三件事:其一,规模真实——截至 2022 年官方材料,内部 cBioPortal 已累计 89,735 个肿瘤样本 / 67,617 名患者,年增速逾 12,000 样本;其二,临床标注真实——每例样本关联 OncoTree 癌种编码、治疗路径与随访结局,支撑生存分析与真实世界效果研究;其三,公开渠道成熟——cBioPortal、Zenodo 与 AACR GENIE 三条渠道各有分工,从快速复现到大规模建模再到多机构外部验证均可覆盖。

快速上手三步:

  1. 访问 cBioPortal 的 msk-impact study(2017 队列,10,945 例肿瘤)或 Zenodo 的 MSK-IMPACT 50K 记录(54,331 例肿瘤 / 48,179 名患者),直接下载 TAR 打包的 TSV/MAF/SEG 文件。
  2. 阅读 data_clinical_sample.tsv 确认每例样本的 OncoTree 癌种与 panel 版本线索,再加载 data_mutations.maf 构建突变矩阵。
  3. 按本文 §6 的指引处理 panel 版本异质性与按患者划分,避免最常见的数据泄漏与标签谬误。

开始之前的四个自问:

  • 我要回答的问题属于哪类任务(驱动发现/生物标志物/响应预测),对应哪个公开渠道最合适?
  • 我需要多大规模:复现级(2017 队列)还是建模级(50K 队列)?
  • 我能否承受 CC BY-NC-ND 的非商业约束,还是需要走授权流程?
  • 我的模型是否依赖批次元数据或完整随访?若是,公开版能否满足?

1.1 一分钟版摘要

  • 这是什么:全球最大规模的单中心前瞻性临床肿瘤靶向测序队列,肿瘤-正常配对设计,341 至 505 基因四代 panel 持续演进。
  • 谁维护:MSK 的分子诊断服务与 Marie-Josée and Henry R. Kravis 分子肿瘤学中心(CMO)。
  • 有多大:累计逾 70,000 名患者、89,735 个肿瘤样本(2022 官方口径);公开可下载的最大切片为 54,331 例肿瘤(Zenodo 50K)。
  • 有什么:MAF 体细胞突变、基因级与区段级拷贝数、选定重排、TMB、MSI、OncoTree 癌种、生存与随访。
  • 怎么拿:cBioPortal 免登录下载(2017 队列);Zenodo 下载 50K 队列(CC BY-NC-ND 4.0);GENIE 走 Synapse 协议。
  • 最要先读:本文 §3.0 版本抉择矩阵与 §6.5 八大坑点。
  • 一句话定位:研究肿瘤基因组学的人都绕不开的"真实世界金标准队列",但要用好必须先理解它的临床出身。
  • 引用基线:使用数据必引 Zehir et al. 2017;使用 50K 队列加引 Zenodo 记录。

1.2 适用与不适用场景

场景 适配度 说明
驱动突变与热点发现 非常适合 50K 队列 448 亚型,罕见癌种也能支撑分层分析
TMB/MSI 方法学与阈值研究 非常适合 临床级 panel 原生输出,配对正常保证体细胞判别质量
免疫治疗响应/预后建模 适合 需自行构造响应标签并处理适应症混杂(坑点 6)
罕见癌种回顾性研究 适合 罕见亚型多年积累,样本量远超单病种专项研究
多机构泛化性声明 需组合 本数据集单中心,泛化结论必须叠加 GENIE 外部验证
人群疾病流行率推断 不适合 临床送检路径驱动的非随机队列(坑点 2)
生殖系变异群体遗传学研究 不适合 公开版以体细胞分析为主,生殖系报告在机构内协议管理
批次效应/设备级校准研究 不适合 公开版无测序批次与仪器元数据(DAIMS 第 11 项 ❌)
结构变异全景发现 不适合 panel 仅在 17 个高频重排基因选定内含子有检出能力
cfDNA 动态监测研究 不适合 液体活检由独立的 MSK-ACCESS 承担,与本队列模态不同

§2 医学背景

2.1 精准肿瘤学与晚期肿瘤的分子画像

晚期与转移性恶性肿瘤的治疗决策正从组织学驱动转向分子驱动。同一种组织学诊断(例如肺腺癌)内部,EGFR、ALK、ROS1、MET 等驱动改变决定了对靶向药物的敏感性;而跨组织学的共同改变(例如 MSI-H 或高 TMB)则预测免疫检查点抑制剂的获益。这催生了"泛癌种、宽 panel"的分子画像需求:不按癌种定制检测菜单,而是用一套统一的数百基因 panel 覆盖全部实体瘤。MSK-IMPACT 正是这一范式的代表实现,其 2017 队列论文的标题——“从前瞻性临床测序揭示的转移性癌症突变图谱”——即点明了它对"跨组织学共享靶点"(basket trial 生物学基础)的支撑。

这一范式转换对 AI 研究的含义是双重的:一方面,"组织学 × 分子"的二维空间天然适合机器学习刻画——癌种作为条件变量、改变谱作为特征、治疗结局作为标签;另一方面,临床检测的决策逻辑(谁被检测、何时检测、检测什么)深深嵌在数据生成过程里,忽略它就会把制度性因素误学成生物学规律。2017 论文关于 ALK 融合在 11 种预期之外癌种中被检出的发现,既是生物学洞见的例证,也提醒研究者:检出格局受"谁被检测"影响。

2.2 靶向 panel 测序的技术原理

MSK-IMPACT 采用杂交捕获(hybridization capture)靶向富集:设计生物素标记探针捕获目标基因的全蛋白编码外显子,加上 TERT 启动子与 17 个高频重排基因的选定内含子,然后在 Illumina 平台高深度测序。关键技术特征有二:第一,肿瘤-正常配对——正常样本(外周血为主)直接测序以扣除生殖系变异,显著提升体细胞判别的灵敏度与特异度,并顺带支持按 IRB 协议向患者返回遗传性致病发现;第二,多类改变一体检测——同一份数据可同时输出 SNV、indel、拷贝数(FACETS 算法)、选定重排、TMB 与 MSI(MSIsensor 算法),这正是它相对"仅热点"检测的根本优势。

与 WES(全外显子测序)相比,靶向 panel 的取舍清晰:覆盖面小但深度高、成本可控、噪音更低,特别适合临床场景的快速周转与高灵敏度变异检出;代价是检出范围被 panel 边界限定,且 TMB 等归一化指标携带 panel 口径。与热点 panel 相比,MSK-IMPACT 覆盖全外显子而非仅热点区,这正是"81% 改变会被热点 panel 遗漏"这一数字的来源。理解这三层技术谱系(热点 panel、宽 panel、WES)是判断"什么问题该用这份数据回答"的前提。

配套的注释体系决定了数据形态:突变的功能注释由 OncoKB(MSK 的 FDA 部分认可的肿瘤变异知识库)按证据等级(Level 1 至 4)标注;癌种命名由 OncoTree(MSK 开发的肿瘤类型本体)统一编码;变异命名遵循 HGVS。理解这套体系是正确解析数据的前提。

2.3 队列覆盖的疾病谱系

2017 队列覆盖 62 种主要肿瘤类型,晚期常见癌种(非小细胞肺癌、结直肠癌、乳腺癌)与罕见癌种(肉瘤、胆管癌、葡萄膜黑色素瘤等)并存;MSK-IMPACT 50K 队列进一步细化到 448 个 OncoTree 组织学亚型。值得注意的是,队列以转移性/晚期疾病为主体——2017 论文明确队列来自"晚期肿瘤患者",且 2018 年起 MSK 还对既往检测样本开展了全外显子测序(WES Recapture)以扩展数据深度。此外 MSK 提供 468 基因的 Heme 版本覆盖白血病、淋巴瘤与骨髓瘤,但公开大队列以实体瘤为主。

疾病谱系的三点观察值得记录:其一,常见癌种样本量大但亚型内异质性同样大,罕见癌种样本量小但同质性高,两类场景的建模策略应当不同;其二,转移灶样本占相当比例,这使得队列对"转移生物学"问题的价值高于以原发瘤为主的队列;其三,同一患者多部位采样(原发与转移、前后时点)构成了天然的体内纵向数据,是研究肿瘤演进与治疗选择的独特资源,但也是坑点 5 泄漏风险的来源。

2.4 术语的标准化映射

将本数据集接入医疗 AI 流水线时,推荐以下编码映射。队列原生分类是 OncoTree(临床视角的肿瘤类型本体,提供唯一的 OncoTree code),其官方发布包含到 ICD-O-3 的映射字段;对接 SNOMED CT 与 ICD-11 时可按下表起步,并通过 WHO ICD-11 浏览器与 SNOMED CT 浏览器按术语匹配补全。

数据集术语 OncoTree code ICD-O-3 形态学 SNOMED CT 参考锚点 ICD-11 对接建议
恶性肿瘤(总类) TUMOR(层级根) M-8000/3 363346000(malignant neoplastic disease) 第 2 章 2A00-2F9Z
肺腺癌 LUAD M-8140/3 恶性肺肿瘤下的腺癌子类 气管支气管肺恶性上皮性肿瘤对应节点
结直肠癌 COADREAD M-8140/3(腺癌为主) 结肠/直肠恶性疾病子类 结肠或直肠恶性肿瘤节点
浸润性乳腺癌 BREAST M-8500/3 乳腺恶性疾病子类 乳腺恶性肿瘤节点
黑色素瘤 MELANOMA M-8720/3 皮肤恶性黑色素瘤子类 皮肤黑色素瘤节点
胶质母细胞瘤 GBM M-9440/3 脑恶性肿瘤子类 脑胶质母细胞瘤节点
肾透明细胞癌 CCRCC M-8312/3 肾恶性疾病子类 肾细胞癌对应节点
胆管癌 CHOL M-8160/3 胆道恶性疾病子类 肝外/肝内胆管癌对应节点
肉瘤(软组织) SARcoma 层级 M-8800/3 系列 软组织恶性疾病子类 软组织肉瘤对应章节节点

映射实践要点:OncoTree 到 ICD-O-3 的映射为官方提供,可直接使用;OncoTree code 在数据中以独立列出现,建议保留原码并另存映射结果,避免有损转换;SNOMED CT 对接建议以 363346000(malignant neoplastic disease)为根做后滑行(post-coordination)表达分期与转移属性;ICD-11 对接建议使用 MMS 线性化版本并在文中记录所用版本号,因为不同发布年份的码点会有迁移。

2.5 变异分类体系与报告口径

解读 MAF 表的前提是理解 MAF 标准的 Variant_Classification 体系。数据中高频出现的类别包括:Missense_Mutation(错义)、Nonsense_Mutation(无义)、Frame_Shift_Del/Ins(移码)、Splice_Site(剪接位点)、In_Frame_Del/Ins(框内 indel)、Translation_Start_Site(起始密码子)、Nonstop_Mutation(终止丢失)——以上构成"非同义(nonsynonymous)"突变集合,是 TMB 计数的标准口径;Silent(同义)、Intron、3’UTR/5’UTR、IGR(基因间区)等类别不计入非同义口径但保留在数据中。MAF 表另含 variant 级读深(肿瘤与正常的参考/替代等位基因计数),这是重建 VAF、进行亚克隆分析与过滤假阳性的原始依据。

可用药性维度由 OncoKB 证据等级体系承载:Level 1 对应 FDA 认可的生物标志物,Level 2 对应标准治疗指南推荐,Level 3 对应临床试验中的 investigational 药物,Level 4 为生物学证据支持;2017 论文的"37% 携带可用药改变"即按此体系对每例样本取最高证据等级统计。AI 研究者应把 OncoKB 等级当作外部知识特征或标签构造原料,而不是数据集自带列的直接替代。

2.6 TMB 与 MSI 的生物学及临床意义

肿瘤突变负荷(TMB)定义为每 Mb 测序覆盖范围内的非同义体细胞突变数,反映肿瘤基因组积累突变的总强度。高 TMB 通常意味着更多新抗原产生,与免疫检查点抑制剂的响应概率相关;MSK-IMPACT 的重要贡献之一是以临床级 panel 数据在真实世界大队列中系统量化了这一关联。理解 TMB 的两个技术前提:其一,TMB 是"每 Mb"的归一化量,分母由 panel 覆盖范围决定,不同 panel、不同平台(panel 对 WES)的 TMB 不可直接比较(坑点 4);其二,TMB 的分子由"非同义"过滤规则决定,计算前必须显式声明 Variant_Classification 过滤集合。

微卫星不稳定性(MSI)指微卫星位点因错配修复缺陷而出现的长度不稳定现象,由 MSIsensor 等算法从配对测序数据推断,输出 MSI-H(高不稳定)、MSS(稳定)等状态。MSI-H 是跨癌种的免疫治疗响应生物标志物,也是 Lynch 综合征等遗传性肿瘤易感的提示信号——这正是肿瘤-正常配对设计的附带价值:正常样本既用于扣除生殖系变异,也使 MSI 推断获得稳定基线。在建模中,TMB 与 MSI 高度相关但不等价(MSI-H 肿瘤通常高 TMB,反之不然),二者应作为独立特征分别处理。

§3 数据集技术规格

3.0 版本抉择矩阵

MSK-IMPACT 的 panel 经历了四代演进,公开队列也由三个渠道分别托管。开始任何项目前,必须先做一次"版本抉择",这是使用本数据集最重要的第一步。

Panel 版本演进:

维度 IMPACT341 IMPACT410 IMPACT468 IMPACT505(现行)
服务起始 2014 年项目启动 2015 年前后 2017-11 FDA 授权版本 现行实体瘤版本
基因数 341 410 468 505
捕获内容 全外显子 + TERT 启动子 + 17 重排基因内含子 同左并扩容基因 同左并扩容基因 同左,当前版本
公开队列中的存在 2017 队列(占 13.8% 样本) 2017 队列(占 60.3%) 2017 队列后期(占 25.9%)与 50K 队列主体 50K 队列后期与当前新数据
AI 使用建议 仅作历史复现,务必启用覆盖掩膜 同左 FDA 授权版,外部引用价值高 默认版本,覆盖最全

血液肿瘤专用版本说明:MSK-IMPACT Heme 为 468 基因的独立检测,与实体瘤 468 版基因构成不同,不可与实体瘤数据直接合并;公开大规模数据以实体瘤为主,Heme 数据主要通过论文与专项发布获取。

公开渠道抉择矩阵:

渠道 托管内容 规模 许可与门槛 最适合的场景
cBioPortal:msk-impact 2017 队列(Nature Medicine 论文配套) 10,945 例肿瘤 / 10,336 名患者 免登录,TSV/MAF/SEG 全量下载 复现 2017 论文;教学与原型开发
Zenodo:MSK-IMPACT 50K(msk_impact_50k_2026) 50K 队列(Bandlamudi & Berger) 54,331 例肿瘤 / 48,179 名患者 / 448 亚型 CC BY-NC-ND 4.0,商用需联系 MSK 大规模建模;癌种特异驱动格局分析
AACR Project GENIE 多机构聚合注册库(MSK 为最大贡献者,数据延迟约一年进入) 多机构聚合,随版本增长 Synapse 账号 + 数据使用协议 多机构外部验证;跨中心泛化研究

抉择原则:目标是复现 2017 论文则用 cBioPortal msk-impact;目标是训练模型则首选 Zenodo 50K(规模与亚型覆盖最大);目标是声明泛化性则必须在 GENIE 上做外部验证;三条渠道是同一体系的不同快照与去标识深度,绝不可当作三个独立数据源混拼。

补充三条执行细则:

  • 渠道一旦选定,研究全程不再更换;确需更换时作为新的快照事件记录并重跑全部预处理。
  • 任何论文中的"MSK-IMPACT 数据 N 例"必须能拆解为"渠道 × study id × 快照日期"三元组。
  • 三渠道各自的许可与使用协议独立适用,混合使用时取最严约束(见 §3.3)。

3.1 测序与生物信息学规格

规格维度 内容
检测形式 杂交捕获靶向 panel,捕获目标基因全部蛋白编码外显子 + TERT 启动子 + 17 个高频重排基因的选定内含子
配对设计 每例肿瘤样本配套正常样本(外周血为主,亦接受唾液等),用于生殖系扣除与体细胞判别
测序平台 Illumina 高通量测序仪(含 NovaSeq 系列),在 CLIA 合规、经纽约州卫生部批准的临床分子诊断实验室完成
检测能力 SNV、小 indel、基因级与区段级拷贝数、选定内含子重排、TMB、MSI、TERT 启动子突变
生信管线 官方分析管线以开源形式发布(IMPACT-Pipeline),可直接审计从原始数据到变级输出的全部步骤
拷贝数算法 FACETS——基于肿瘤/正常配对的等位基因特异拷贝数与杂合性丢失联合估计
MSI 算法 MSIsensor——对比肿瘤与配对正常的微卫星位点稳定性
注释体系 OncoKB 证据等级注释、OncoTree 癌种编码、HGVS 变异命名
输出层级 临床报告(写入电子病历)→ 机构内 cBioPortal 实例(每日摄取)→ 公开 cBioPortal/Zenodo/GENIE 渠道(去标识后)
质量监管 CLIA 合规、纽约州卫生部批准、FDA II 类授权(2017-11,认可第三方评审路径)

3.2 规模与构成数字(均有来源)

指标 数值 来源与口径
2017 队列肿瘤样本 10,945 Nature Medicine 2017 论文
2017 队列患者 10,336 Nature Medicine 2017 论文
2017 队列肿瘤类型 62 种主要类型 Nature Medicine 2017 论文
2017 队列检出突变 78,066 个体细胞突变 Nature Medicine 2017 论文
2017 队列拷贝数/重排 22,989 处拷贝数改变、1,875 个重排 Nature Medicine 2017 论文
累计检测人数 逾 70,000 MSK 官网与 2022 数据共享材料
内部累计样本 89,735 个肿瘤样本 / 67,617 名患者(截至 2022) MSK 官方数据共享材料
样本增速 逾 12,000 样本/年 MSK 官方数据共享材料
50K 队列规模 54,331 例肿瘤 / 48,179 名患者 / 448 亚型 Zenodo MSK-IMPACT 50K 记录
2017 队列 panel 构成 341 版 13.8%、410 版 60.3%、468 版 25.9% 基于 MSK-IMPACT 队列的免疫治疗生物标志物对比研究(PMC7210182)
actionable 比例 37% 患者携带可用药改变 Nature Medicine 2017 论文
试验匹配率 11%(前 5,009 名患者口径) Nature Medicine 2017 论文
热点 panel 遗漏率 81% 改变会被仅覆盖热点的检测遗漏 Nature Medicine 2017 论文
ICI/非 ICI 分组基线 1,661 名 ICI 治疗患者 / 3,840 名对照 TMS/TMB 对比研究(PMC7210182)
ICI 治疗构成 PD-1/PD-L1 单药 78.7%、CTLA4 单药 6.0%、联合 15.3% TMS/TMB 对比研究(PMC7210182)
生存构成(2017 队列 ICI 组) 随访截点时存活 49.9%、死亡 50.1% TMS/TMB 对比研究(PMC7210182)
2017 队列 IRB 入组 >85% 患者入组协议 NCT01775072 Nature Medicine 2017 论文
cBioPortal 月活 每月 >30,000 名科学家使用 MSK 官方报道
衍生论文 576 篇(仅 MSK 内部),累计被引 43,714 次 MSK 2022 数据共享材料

3.3 许可与合规规格

  • cBioPortal 公开 study:免费开放查看与下载,登录仅用于保存个人工作区偏好,非数据访问前提。
  • Zenodo MSK-IMPACT 50K:CC BY-NC-ND 4.0——允许署名后的非商业使用且不得演绎再分发原始文件;商业用途需联系 MSK 官方数据请求邮箱。
  • AACR GENIE:经 Synapse 平台获取,需注册账号并签署数据使用协议,禁止再识别与再分享原始级数据。
  • 去标识承诺:公开数据仅含癌种、年龄、性别、种族/ancestry、采样治疗时点等基本临床变量,不包含可回溯个人的直接标识符。
  • 伦理与同意:检测为临床指征驱动,逾 85% 患者入组 IRB 批准的前瞻性研究协议 NCT01775072,授权测序结果的研究性使用与标本库开发。
  • 出版规范:MSK 内部设有出版委员会审查基于该数据的发表与署名;外部使用者应遵循各渠道的数据使用协议并在成果中引用原始论文。
  • 跨渠道许可优先级:同一研究混合多渠道数据时,取各渠道许可中最严格的约束作为整体约束(例如 cBioPortal 数据与 Zenodo 50K 合用,整体按 NC-ND 约束执行)。
  • 演绎数据边界:从原始数据派生的特征矩阵、模型权重与聚合统计不属于"原始文件再分发",但应继续注明来源与许可并遵守禁止再识别的要求。

3.4 三渠道文件清单对比

文件角色 cBioPortal msk-impact Zenodo MSK-IMPACT 50K AACR GENIE
患者级临床表 data_clinical_patient.txt data_clinical_patient.txt(约 3.5 GB) data_clinical_patient(Synapse 表/文件)
样本级临床表 data_clinical_sample.txt 含癌种、纯度等样本字段 data_patient_sample 风格核心字段
突变表 data_mutations.maf data_mutations(MAF 风格) data_mutations(扩展 MAF)
拷贝数 data_cna.txt + data_segments.seg 区段表随包发布 data_CNA(Gene level/segment level)
结构变异 data_sv.txt(视 study 版本) data_SV.txt(约 7 MB) structural 变异文件
元信息 meta_study.txt 等系列 Zenodo 记录描述 + 许可声明 release 说明文档
获取动作 免登录 TAR/TSV 下载 逐文件或整包下载 Synapse 签协议后下载
快照标识 study 页面更新日期 Zenodo 记录版本 DOI GENIE release 版本号

清单使用建议:第一次下载后立即建立"文件 × 行数 × md5"的本地清单表,写入研究仓库;跨渠道研究为每个渠道各建一份快照标识,禁止用文件名猜测版本(见坑点 7)。

§4 数据结构

4.0 目录树

cBioPortal/Zenodo 渠道下载的 TAR 包遵循 cBioPortal 标准文件约定,解压后结构如下(Zenodo 50K 记录的文件清单包含 data_clinical_patient.txt、data_SV.txt 等,完整目录以实际下载为准):

<details>
<summary>cBioPortal 标准下载目录树(展开查看)</summary>

msk_impact_study/
├── data_clinical_patient.txt        # 患者级临床表(TSV,含表头描述块)
├── data_clinical_sample.txt         # 样本级临床表(TSV,含表头描述块)
├── data_mutations.maf               # 体细胞突变表(MAF 扩展格式)
├── data_cna.txt                     # 基因级拷贝数表(GISTIC 风格离散值)
├── data_segments.seg                # 区段级拷贝数表(FACETS 输出,IGV 可视化)
├── data_sv.txt                      # 结构变异/重排表
├── data_tmb.txt?                    # TMB 派生指标(视渠道版本而定)
├── meta_study.txt                   # study 元信息
├── meta_clinical_patient.txt        # 各文件对应的 cBioPortal meta 描述
├── meta_clinical_sample.txt
├── meta_mutations.txt
├── meta_CNA.txt
└── case_lists/                      # 预定义病例清单(按癌种等切分)

</details>

要点:每个数据文件配有同名 meta 文件声明列语义与显示名;临床表文件头部有数行 # 开头的描述块(列名、显示名、数据类型、优先级),解析时必须跳过;MAF 与 SEG 可直接导入 maftools、IGV 等工具。

4.1 患者级临床表(data_clinical_patient)

字段 含义 说明
PATIENT_ID 患者唯一标识 关联主键,去标识化编码
OS_STATUS 生存状态 0:LIVING / 1:DECEASED 风格的枚举
OS_MONTHS 总生存月数 随访截止随数据版本变化
SEX / AGE 性别与年龄 公开版为去标识粒度
SMOKING_HISTORY 等 行为史字段 部分研究队列提供
种族/ancestry 相关字段 人口学背景 视渠道与版本而定,ancestry 研究的关键输入

4.2 样本级临床表(data_clinical_sample)

字段 含义 说明
SAMPLE_ID 样本唯一标识 一名患者可有多个样本(多病灶/多时点)
PATIENT_ID 所属患者 与患者表关联
CANCER_TYPE / CANCER_TYPE_DETAILED 癌种名称 OncoTree 命名,配套 OncoTree code
ONCOTREE_CODE OncoTree 编码 建议保留原码做映射
SAMPLE_TYPE 样本类型 原发灶/转移灶等
METASTATIC_SITE / PRIMARY_SITE 部位字段 转移部位分析的关键
TUMOR_PURITY / TMB 相关 质量与派生字段 瘤体纯度、每 Mb 非同义突变数等
突变计数 / FGA 派生指标 突变负荷与基因组改变比例
检测与采样时点字段 时间信息 粒度受去标识限制,纵向分析前先确认可得性

4.3 体细胞突变表(data_mutations.maf)

MAF 表为长格式,每行一个变异-样本对,核心列包括:Hugo_Symbol(基因)、Chromosome/Start_Position/End_Position(坐标)、Variant_Classification(变异功能分类,如 Missense_Mutation、Nonsense_Mutation、Frame_Shift_Del)、HGVSp_Sc/HGVSc(HGVS 命名)、t_ref_count/t_alt_count/n_ref_count/n_alt_count(肿瘤与正常读深,支撑 VAF 计算)、Tumor_Sample_Barcode(关联 SAMPLE_ID)、OncoKB 相关注释列(视渠道而定)。分析前务必确认使用的 MAF 是否已限定为非同义突变(TMB 计算口径相关)。

核心列速查表:

列 类型 语义 常见用法
Hugo_Symbol string 基因符号 特征矩阵行键
Chromosome / Start_Position / End_Position int 基因组坐标 变异去重与区间运算
Variant_Classification 枚举 功能分类 TMB 过滤集合
HGVSp_Sc / HGVSc string 蛋白/编码级 HGVS 命名 热点匹配、OncoKB 对齐
t_ref_count / t_alt_count int 肿瘤读深 VAF 与纯度分析
n_ref_count / n_alt_count int 正常读深 生殖系残留质控
Tumor_Sample_Barcode string 样本键 关联临床表
Mutation_Status 枚举 Somatic/Germline/LOH 等 过滤体细胞集合

4.4 拷贝数与结构变异

  • data_cna.txt:基因 × 样本宽表,取值遵循 GISTIC 风格离散编码(-2 深缺失、-1 浅缺失、0 中性、1 扩增、2 高扩增)。
  • data_segments.seg:区段长格式(样本、染色体、起点、终点、段数、平均 log2 比值),可直接被 IGV 读取,保留连续值信息,适合需要原始信号的任务。
  • data_sv.txt:重排/结构变异表,覆盖 panel 设计支持的 17 个高频重排基因选定内含子所检出的融合与重排事件。

三表分工与选用原则:

表 粒度 值域 选用场景
data_cna.txt 基因级 -2/0/1/2 风格离散 分类特征、oncoprint 类展示
data_segments.seg 区段级 log2 连续比值 振幅敏感任务、片段化模式分析
data_sv.txt 事件级 基因对/断点 融合检测、重排特征

选用注意:离散表丢失振幅信息(浅缺失与深缺失原因不同);连续表需要自行定义离散化阈值并与文献对齐;SV 表的阴性结果不等于无重排(panel 内含子覆盖决定检出能力),建模时把"可检出区域"当先验而非事后说明。

4.5 关键字段 DAIMS 字段字典(8 列)

文件 字段 类型 缺失表示 取值样貌 编码体系 对齐要点 关联坑点
data_clinical_sample ONCOTREE_CODE string [Not Available] LUAD、COADREAD、MELANOMA OncoTree 保留原码,映射到 ICD-O-3/ICD-11 后另存 坑点 8
data_clinical_sample CANCER_TYPE string [Not Available] Lung Adenocarcinoma 等 OncoTree 名称 与 code 严格对表,勿用名称做连接键 坑点 8
data_clinical_patient OS_STATUS 枚举 [Unknown] 0:LIVING / 1:DECEASED cBioPortal 约定 统一解析为 0/1 后再建模 坑点 6
data_clinical_patient OS_MONTHS float [Not Available] 12.3、98.6 等 月 注意随访截止随数据版本漂移 坑点 6
data_mutations.maf Variant_Classification 枚举 无 Missense_Mutation 等 MAF 标准 计算 TMB 时先过滤非同义类 坑点 4
data_mutations.maf Tumor_Sample_Barcode string 无 与 SAMPLE_ID 一致 cBioPortal 约定 以 SAMPLE_ID 连接临床表 坑点 5
data_mutations.maf t_alt_count/t_ref_count int 0 读深计数 原始计数 VAF = t_alt/(t_ref+t_alt),勿与纯度混淆 坑点 3
data_cna.txt 基因列 int 0 -2/-1/0/1/2 GISTIC 风格 早于该 panel 版本的基因列为全 0,需掩膜 坑点 1
data_segments.seg mean float 无 log2 比值 连续值 离散化阈值需自行声明并与文献对齐 坑点 4
panel 版本线索 无独立列(视渠道) — — 需按渠道说明推断 IMPACT341/410/468/505 以渠道文档与研究协议推断版本归属 坑点 1、7

4.6 meta 文件与数据字典的正确打开方式

cBioPortal 发行包中每个数据文件都配有同名 meta 文件(如 meta_clinical_sample.txt),声明该表的 display_name、description、datatype 与 cBioPortal 渲染优先级;临床数据文件的头部描述块则逐列给出五元组(列名、显示名、描述、数据类型、优先级)。推荐的处理流程:

def parse_clinical_header(path):
    """解析临床表头部描述块,返回官方数据字典 DataFrame。"""
    rows = []
    with open(path, encoding="utf-8") as fh:
        for line in fh:
            if not line.startswith("#"):
                break
            rows.append(line.lstrip("#").strip().split("\t"))
    # 描述块共 5 行:列名、显示名、描述、类型、优先级
    cols = rows[0]
    return pd.DataFrame(
        {name: values for name, values in zip(["NAME", "LABEL", "DESC", "TYPE", "PRIORITY"], rows)}
    ).set_index("NAME").T

dict_sample = parse_clinical_header("data_clinical_sample.txt")
dict_patient = parse_clinical_header("data_clinical_patient.txt")

三条实践纪律:第一,把解析出的字典随代码库提交,作为字段语义的唯一权威来源,禁止凭列名望文生义;第二,MAF 表的列语义以 MAF 标准为基准、以渠道 meta 为补充,两者冲突时以 meta 为准;第三,任何在数据字典之外自行派生的字段(如重构的 TMB、VAF),必须在派生脚本中重命名并注明口径,避免与原始列混淆。

§5 数据划分建议

本数据集没有官方 train/val/test 划分——它是持续增长的临床队列而非基准测试集。任何论文中的划分方案都是研究者自设的,因此划分本身必须成为方法学声明的一部分。以下六条铁律与数据结构一一对应:

  • 铁律一:按患者划分。任何患者级任务(生存、响应、试验匹配)必须以 PATIENT_ID 为分组键做 GroupShuffleSplit/GroupKFold,杜绝同一患者的多病灶/多时点样本同时出现在训练与测试集。
  • 铁律二:按时间划分做外推验证。2017 论文将 2015-07 前完成检测的前 5,009 名患者作为试验匹配分析口径;仿照这一思路,以检测日期把早期样本划入训练、晚期样本划入测试,可检验模型对时间漂移的稳健性。
  • 铁律三:按 panel 版本分层。划分前后检查 IMPACT341/410/468/505 的样本占比是否一致,必要时分层抽样,防止版本构成差异伪装成模型能力差异。
  • 铁律四:按 OncoTree 层级处理长尾。448 个亚型中长尾类别极多,划分时保证每层级类别在训练集中有最低样本量,评估时按亚型与上级类别分别报告。
  • 铁律五:划定留出层。无论怎样划分,都把"最近一个快照周期"的样本整体留作 untouched 测试层,模拟真实部署时的数据增量场景。
  • 铁律六:外部层独立。GENIE 外部验证数据永远不参与任何特征选择、阈值调参与模型选择,只在最终模型冻结后运行一次。
  • 外部验证划分:训练用 Zenodo 50K(或 cBioPortal msk-impact),外部验证用 AACR GENIE 的 MSK 之外机构数据,这是声明泛化性的黄金路径;GENIE 同一 release 内的多机构数据也可做留中心(leave-one-center-out)评估。
  • 禁止做法:禁止随机行级划分;禁止用全量数据做特征选择后再划分;禁止把 GENIE 中的 MSK 数据与 cBioPortal 队列并用造成重复计数(见坑点 7)。

患者级划分的最小实现(Python):

import numpy as np
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit

def patient_split(clin: pd.DataFrame, seed: int = 20260905):
    """按 PATIENT_ID 组键划分训练/测试,并输出 panel 版本分层检查表。"""
    gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=seed)
    train_idx, test_idx = next(gss.split(clin, groups=clin["PATIENT_ID"]))
    train, test = clin.iloc[train_idx], clin.iloc[test_idx]

    # 分层检查:两边的癌种与 panel 版本构成应一致
    audit = pd.DataFrame({
        "train_pct": train["CANCER_TYPE"].value_counts(normalize=True),
        "test_pct": test["CANCER_TYPE"].value_counts(normalize=True),
    })
    version_cols = [c for c in clin.columns if c.startswith("PANEL_")]
    if version_cols:
        audit_v = pd.DataFrame({
            "train_pct": train[version_cols].mean(),
            "test_pct": test[version_cols].mean(),
        })
    else:
        audit_v = None
    assert set(train["PATIENT_ID"]).isdisjoint(set(test["PATIENT_ID"])), "患者泄漏"
    return train, test, audit, audit_v

两个检查动作不可省略:assert 断言排除患者级泄漏;audit 表人工核对癌种与 panel 版本构成,任何一侧占比偏差超过数个百分点都应改用分层划分。

时间外推划分的补充实现:

def temporal_split(clin: pd.DataFrame, cutoff: str = "2016-01-01"):
    """以检测时点切分:截止日前的样本训练、之后的样本测试。

    检测时点字段视渠道粒度而定;若公开版只有年份/月份粒度,
    cutoff 需相应取到该粒度并写进研究记录。
    """
    date_col = "SAMPLE_ACQUISITION_DATE"
    dates = pd.to_datetime(clin[date_col], errors="coerce")
    train = clin[dates < cutoff]
    test = clin[dates >= cutoff]
    assert set(train["PATIENT_ID"]).isdisjoint(set(test["PATIENT_ID"])), "患者泄漏"
    drift = pd.DataFrame({
        "train": train["CANCER_TYPE"].value_counts(normalize=True),
        "test": test["CANCER_TYPE"].value_counts(normalize=True),
    }).fillna(0)
    drift["abs_diff"] = (drift["train"] - drift["test"]).abs()
    return train, test, drift.sort_values("abs_diff", ascending=False).head(15)

时间划分的核心产出是 drift 表:它量化训练期与测试期的癌种构成漂移,是解释"时间外推性能下降"的第一手证据——性能下降可能来自模型过时,也可能只是构成漂移,drift 表帮助区分二者。

§6 AI 就绪指南

6.1 获取与加载

cBioPortal 路径:进入 msk-impact study 页面,通过 Download 按钮获取 TAR 打包(或逐文件 TSV/SEG);亦可用官方 cBioPortal API(study id:msk-impact)以 R(cbioportalR 等)或 Python 请求体获取。Zenodo 路径:检索 MSK-IMPACT 50K 记录,逐文件下载或整包下载,文件为 cBioPortal 约定格式的 TSV。GENIE 路径:在 Synapse 平台注册并签署协议后按 release 版本下载。

加载代码骨架(Python):

import pandas as pd

# 患者级与样本级临床表:跳过文件头部 # 描述块
pat = pd.read_csv("data_clinical_patient.txt", sep="\t", comment="#")
smp = pd.read_csv("data_clinical_sample.txt", sep="\t", comment="#")

# MAF 突变表(长格式)与拷贝数区段表
maf = pd.read_csv("data_mutations.maf", sep="\t", comment="#")
seg = pd.read_csv("data_segments.seg", sep="\t")

# 一患者多样本时的合并规范:先聚到患者级,再做任务标签
clin = smp.merge(pat, on="PATIENT_ID", how="left")

注意:临床表头部的 # 描述块包含官方列名与显示名对照,建议解析留存作为数据字典;MAF 行数可达数百万级,建议指定 dtype 或使用分块读取。

R 语言路径(cBioPortal API):

library(httr)
library(json)

# 通过官方 API 读取 study 概要与分子画像样本清单
base <- "https://www.qianfanghub.com/ai-ready-dataset/msk-impact/423"   # cBioPortal API 根地址,study id: msk-impact
studies <- GET(paste0(base, "/studies/msk-impact")) |> content(as = "parsed")
samples <- GET(paste0(base, "/studies/msk-impact/samples")) |> content(as = "parsed")

sample_df <- do.call(rbind, lapply(samples, function(s) {
  data.frame(sampleId = s$sampleId, patientId = s$patientId, studyId = s$studyId)
}))

API 适合交互式探索与小型抽取;全量建模仍建议下载 TAR 包本地加载。下载核对清单:确认 study id 与快照日期、核对文件行数与记录描述一致、将 md5 与下载日期写入研究日志、首次加载后即运行 §4.6 的字典解析并把字典入仓。

下载完整性核对脚本:

import hashlib
from pathlib import Path

def audit_download(study_dir: str, expected: dict[str, int]) -> pd.DataFrame:
    """下载后立即核对:文件存在性、行数与 md5。

    expected: {"data_clinical_sample.txt": 10945, ...} 以渠道记录页声明为准。
    """
    rows = []
    for name, exp_rows in expected.items():
        path = Path(study_dir) / name
        if not path.exists():
            rows.append({"file": name, "exists": False, "rows": None, "md5": None})
            continue
        with open(path, "rb") as fh:
            md5 = hashlib.md5(fh.read()).hexdigest()
        n = sum(1 for _ in open(path, encoding="utf-8"))
        rows.append({"file": name, "exists": True, "rows": n, "md5": md5})
    report = pd.DataFrame(rows)
    report["rows_match"] = [
        (r.rows is not None and r.rows >= exp) for r, exp in zip(report.itertuples(), expected.values())
    ]
    return report

6.2 预处理与特征工程

  • 突变矩阵构建:以样本 × 基因二值/计数矩阵为主特征,建议区分错义、截断(nonsense/移码/剪接)与拷贝数事件三类通道;截断突变与错义突变的生物学含义不同,混为一类会损失信息。
  • VAF 与纯度:由 t_alt_count/(t_ref_count+t_alt_count) 计算 VAF;TUMOR_PURITY 字段可用于亚克隆结构分析;切勿把 VAF 直接当"突变强度"跨样本比较而不做纯度校正。
  • TMB 计算:以非同义突变数除以 panel 覆盖 Mb 数得到每 Mb TMB;必须固定分母口径并随数据一起声明(见坑点 4)。
  • 拷贝数特征:离散表适合分类特征;连续 seg 表适合需要振幅信息的任务;两表不可互相替代。
  • 重排特征:SV 表按基因对编码(如 EML4-ALK 类融合伙伴对),注意 panel 只在选定内含子有检出能力,阴性不等于无重排。
  • 缺失策略:cBioPortal 用 [Not Available]/[Unknown] 表示缺失,加载后统一转为 NaN;不同渠道的缺失粒度不同,转换时逐一核对(见坑点 7)。
  • 版本掩膜:为每个样本维护一个"该 panel 版本可测基因集合"的布尔掩膜,所有基因级计算仅在掩膜内进行(见坑点 1)。
  • 低纯度样本处理:TUMOR_PURITY 过低的样本变异检出灵敏度下降,建议设定纯度下限并分流,阈值随任务声明。
  • 单核苷酸特征工程:以六核苷酸背景的突变谱做特征分解,可在 panel 数据上近似刻画 APOBEC、吸烟等签名活性(注意 panel 覆盖对分解稳定性的限制)。

特征工程核心代码(突变矩阵、VAF、TMB、掩膜):

import numpy as np
import pandas as pd

NONSYN = {
    "Missense_Mutation", "Nonsense_Mutation", "Frame_Shift_Del", "Frame_Shift_Ins",
    "In_Frame_Del", "In_Frame_Ins", "Splice_Site", "Translation_Start_Site",
    "Nonstop_Mutation",
}

def build_mutation_matrix(maf: pd.DataFrame, panel_mask: dict[str, set[str]]):
    """按 panel 版本掩膜构建样本 × 基因三类通道特征。

    panel_mask: {"IMPACT341": {gene, ...}, "IMPACT410": {...}, ...}
    sample_panel: 样本到 panel 版本的映射(由渠道文档/研究协议确定)
    """
    sample_panel = maf.drop_duplicates("Tumor_Sample_Barcode").set_index(
        "Tumor_Sample_Barcode")["PANEL_VERSION"].to_dict()

    nonsyn = maf[maf["Variant_Classification"].isin(NONSYN)]
    trunc = nonsyn[nonsyn["Variant_Classification"].isin(
        {"Nonsense_Mutation", "Frame_Shift_Del", "Frame_Shift_Ins", "Splice_Site"})]

    def mat(df):
        return (df.groupby(["Tumor_Sample_Barcode", "Hugo_Symbol"]).size()
                  .unstack(fill_value=0).astype("int8"))

    feats = {"mut": mat(nonsyn), "trunc": mat(trunc)}

    # 掩膜对齐:仅保留各样本 panel 版本可测的基因
    for name, m in feats.items():
        aligned = []
        for sid, row in m.iterrows():
            genes = panel_mask[sample_panel[sid]]
            aligned.append(row.reindex(sorted(genes), fill_value=0))
        feats[name] = pd.DataFrame(aligned)
    return feats

def compute_vaf(maf: pd.DataFrame) -> pd.Series:
    """由原始读深重建 VAF;正常读深列用于生殖系质控审计。"""
    t_alt = maf["t_alt_count"].astype(float)
    t_ref = maf["t_ref_count"].astype(float)
    return (t_alt / (t_ref + t_alt)).rename("VAF")

def compute_tmb(maf: pd.DataFrame, panel_mb: dict[str, float]) -> pd.DataFrame:
    """非同义突变数 / panel 覆盖 Mb;分母口径必须随数据一起发布。"""
    nonsyn = maf[maf["Variant_Classification"].isin(NONSYN)]
    counts = nonsyn.groupby("Tumor_Sample_Barcode").size()
    versions = maf.drop_duplicates("Tumor_Sample_Barcode").set_index(
        "Tumor_Sample_Barcode")["PANEL_VERSION"]
    mb = versions.map(panel_mb)
    tmb = counts / mb.loc[counts.index]
    return pd.DataFrame({"TMB_NONSYN": tmb, "PANEL_VERSION": versions, "PANEL_MB": mb})

代码中的三条纪律对应三个坑点:build_mutation_matrix 的掩膜对齐防"未测即野生型"(坑点 1);compute_vaf 强制从原始读深重建而非信任派生列(坑点 3 的质控入口);compute_tmb 把分母 Mb 随结果一起落盘(坑点 4)。示例中的 PANEL_VERSION/PANEL_MB 列为按渠道文档推导的自建列,禁止伪装成官方字段。

缺失值与拷贝数处理代码:

CNA_MAP = {-2: "deep_del", -1: "shallow_del", 0: "neutral", 1: "gain", 2: "amp"}

def load_cna_wide(cna_path: str, genes: list[str]) -> pd.DataFrame:
    """加载基因级拷贝数宽表并按目标基因集对齐(宽表:基因 × 样本)。"""
    cna = pd.read_csv(cna_path, sep="\t", index_col=0)
    aligned = cna.reindex(genes).T.replace(CNA_MAP)
    return aligned  # 样本 × 基因的类别特征

def normalize_missing(df: pd.DataFrame) -> pd.DataFrame:
    """统一 cBioPortal 缺失标记为 NaN。"""
    tokens = {"[Not Available]", "[Unknown]", "[Not Applicable]", "NA", ""}
    return df.replace(list(tokens), np.nan)

def paire_normal_audit(maf: pd.DataFrame) -> pd.Series:
    """按样本审计正常配对质量:正常读深过低或正常携带变异即预警。"""
    n_depth = maf["n_ref_count"].fillna(0) + maf["n_alt_count"].fillna(0)
    low_normal = n_depth < 20
    germline_leak = maf.get("Mutation_Status", pd.Series(index=maf.index)).eq("Germline")
    flag = (low_normal | germline_leak).groupby(maf["Tumor_Sample_Barcode"]).max()
    return flag.rename("NORMAL_FLAG")

三个函数各守一道关:normalize_missing 统一缺失语义(避免五套缺失写法各自为政);load_cna_wide 把离散拷贝数转成可控的类别特征并按基因集对齐;paire_normal_audit 在变异层预警正常配对质量问题样本,是坑点 3 的操作化入口。

6.3 标签构造

  • 癌种分类标签:直接取 CANCER_TYPE/ONCOTREE_CODE;建议同时构造 OncoTree 层级标签(上级类别)以支持层级学习与长尾评估。
  • actionable 标签:参考 2017 论文口径,按 OncoKB 证据等级(Level 1 FDA 认可、Level 2 标准治疗、Level 3 试验性)对每例样本取最高等级,构造"是否携带 actionable 改变"的二值标签。
  • 免疫治疗响应标签:需利用随访与治疗记录自行构造(如 ICI 治疗开始后 3 个月影像评估口径,参照 2017 论文对响应的定义),公开数据不含现成的 RECIST 字段时必须显式声明构造规则。
  • 生存标签:OS_STATUS/OS_MONTHS 直接可用;注意随访截止随数据版本变化,切勿在同一研究中混用不同快照的生存数据。
  • TMB/MSI 生物标志物标签:MSI 状态由 MSIsensor 输出;将 TMB/MSI 作为预测目标(而不是协变量)时,同样要固定 panel 口径。

标签构造代码(actionable 等级与响应窗口):

def actionable_label(maf: pd.DataFrame, oncokb_levels: dict[str, int]) -> pd.Series:
    """按 OncoKB 证据等级为每例样本构造 actionable 二值标签。

    oncokb_levels: 变异键(Hugo_Symbol + HGVSp_Sc 等)到 Level 1-4 的映射,
    来源为 OncoKB 注释列或官方知识库对齐结果。
    """
    keys = (maf["Hugo_Symbol"] + "|" + maf.get("HGVSp_Sc", "").fillna("")).str.strip("|")
    levels = keys.map(oncokb_levels)
    top = maf.assign(LEVEL=levels).groupby("Tumor_Sample_Barcode")["LEVEL"].min()
    # 等级数值越小证据越高:取最高证据等级后判断是否达标(Level 1-3 口径)
    return (top <= 3).rename("HAS_ACTIONABLE")

def response_label(treatment: pd.DataFrame, imaging: pd.DataFrame) -> pd.DataFrame:
    """构造 ICI 治疗后约 3 个月的影像评估标签(2017 论文口径)。

    treatment: 患者、治疗类型(ICI/其他)、治疗开始日期
    imaging: 患者、评估日期、RECIST 类评估结果
    """
    ici = treatment[treatment["TREATMENT_TYPE"] == "ICI"]
    assessed = imaging.merge(ici[["PATIENT_ID", "TREATMENT_START"]], on="PATIENT_ID")
    window = assessed[
        (assessed["ASSESS_DATE"] >= assessed["TREATMENT_START"])
        & (assessed["ASSESS_DATE"] <= assessed["TREATMENT_START"] + pd.Timedelta(days=120))
    ]
    best = window.groupby("PATIENT_ID")["RESPONSE"].first()
    return best.rename("RESPONSE_3MO").to_frame()

两个标签函数共享同一原则:口径必须写成代码而非留在脑中——actionable 的等级阈值、响应窗口的天数,都要作为显式参数出现在调用处,评审者据此复算。

6.4 建模建议

  • 驱动突变/突变格局建模:50K 队列论文示范了按癌种分层解析驱动改变的标准做法(含 164 个新鉴定的热点),复现或扩展时按亚型分层、用覆盖掩膜约束背景突变率估计。
  • 免疫治疗响应预测:从 TMB 之类的单变量基线出发,逐步加入突变特征(如 POLE/MMR 路径、吸烟特征代理)、拷贝数与组织学协变量;对照研究务必处理 ICI 与非 ICI 组的适应症混杂(见坑点 6)。
  • 多模态与迁移:MSK-IMPACT 可与 OncoKB 证据库、OncoTree 本体联合构建知识增强模型;与 TCGA(WES)做跨平台迁移时优先对齐共同基因集合再训练。
  • 突变特征学习:从 SNV/indel 谱学习通路级表征(如 MMR 缺陷、APOBEC 活性、POLE 校正缺陷的特征代理),比逐基因特征更稳健,且能迁移到其他 panel 队列。
  • 患者轨迹建模:利用同一患者多时点样本构建"演进对"(治疗前后、原发-转移),以成对差分学习抵抗患者间混杂,但要警惕随访时长与治疗变化的共线性。
  • 弱监督与知识蒸馏:以 OncoKB 等级作为弱标签训练可用药性排序模型,用 cBioPortal 的治疗-结局字段做二级校准;等级缺失样本按 PU-learning 思路处理而非直接丢弃。
  • 评估指标:分类任务报告 AUROC/AUPRC 并按癌种分层;生存任务报告 C-index 与时间依赖 AUC;所有任务同时报告长尾亚型子集指标,防止平均指标掩盖头部类别偏置。
  • 可复现性:固定渠道快照日期与 GENIE release 号;将 panel 版本、TMB 口径、标签构造规则写入配置文件与论文附录。

任务-指标-检查点对照表:

任务 主指标 分层指标 建模检查点
驱动突变预测 AUPRC(类别不平衡敏感) 按亚型、按 panel 版本 覆盖掩膜是否生效;背景突变率是否按版本校准
TMB/MSI 阈值研究 AUROC + 阈值处敏感度/特异度 按癌种、按平台口径对照 分母 Mb 是否落盘;是否与 WES 口径做了校准
免疫治疗响应 AUROC/AUPRC + 校准曲线 按 ICI 药物类型、按癌种 特征是否全部来自治疗开始前;混杂是否加权
生存预测 C-index + 时间依赖 AUC 按分期与癌种 删失比例报告;跨快照随访是否混用
癌种细分类 宏平均 F1 + 层级准确率 亚型级与上级类别两级 长尾是否有拒绝预测;是否用了层级损失
试验匹配排序 Precision@k 按证据等级分层 匹配特征时间戳是否先于匹配行为

6.5 已知坑点全景

⚠️ 坑点 1:Panel 版本异质性与"未测即野生型"谬误(分类:标签理解/偏倚陷阱)

  • 问题:队列横跨 IMPACT341/410/468/505 四代 panel。在 2017 队列中,341 版占 13.8%、410 版占 60.3%、468 版占 25.9%。早期版本未覆盖的基因在数据中表现为"无突变",直接当作野生型会系统性低估这些基因的突变率,并且低估幅度随样本年份(即版本)规律变化。
  • 症状:某基因的突变频率随检测年份单调爬升;合并多版本训练时,晚期患者"携带更多突变";模型悄悄学会了用协变量预测 panel 版本而非生物学结果;文献间同一基因突变率对不上。
  • 解决:简单方法——仅使用各版本共同覆盖的基因集合做特征,牺牲覆盖换干净;进阶方法——为每个样本建立 panel 覆盖掩膜,突变率与损失计算仅在掩膜内进行,并把 panel 版本 one-hot 作为协变量分层建模;SOTA 方法——在似然层面显式建模 panel 覆盖(masked likelihood),对掩膜外基因不做"野生型"假设,这正是 MSK-IMPACT 50K 等大规模驱动分析所采用的处理思想。
  • 参考:基于 MSK-IMPACT 队列的 TMS/TMB 对比研究(PMC7210182,明确记录三版本占比与"未测序基因假定为野生型"的口径);Zenodo MSK-IMPACT 50K 记录。

⚠️ 坑点 2:三级转诊中心的非随机抽样(ascertainment bias)(分类:偏倚陷阱)

  • 问题:队列由单一三级癌症中心的临床路径产生——患者多为晚期/转移性、逾 85% 入组 IRB 研究协议,癌种与分期分布不反映一般人群;MSK 官方研究亦自述"队列构成可能无法忠实代表更广泛人群的癌种与分期分布"。ancestry 构成上,欧洲 ancestry 患者占比超过 76%,非欧裔绝对人数虽大于多数队列但相对代表性不足。
  • 症状:在人群登记(如 SEER 类分布)上评估模型时校准失效;罕见癌种被过采样导致看起来"常见";把队列内关联当人群规律做因果外推;非欧裔亚群上性能骤降。
  • 解决:简单方法——报告队列构成表并与人群基准对比,把"单中心临床队列"写进所有结论的限定语;进阶方法——对关键协变量做重要性加权或分层校准,按 ancestry/癌种分层评估;SOTA 方法——在 AACR GENIE 的多机构数据上做外部校准与 domain adaptation,用跨中心一致性而非单中心精度支撑泛化声明。
  • 参考:MSK 遗传祖先研究(Cancer Discovery 2022,DOI 10.1158/2159-8290.CD-22-0312,含 45,157 名患者队列的局限声明);Nature Medicine 2017 论文。

⚠️ 坑点 3:缺失配对正常样本与 tumor-only 误判(分类:预处理陷阱)

  • 问题:配对正常是 MSK-IMPACT 的设计核心,但并非每例样本都能获得足够正常 DNA——在第三方使用 MSK-IMPACT panel 的 InterMEL 研究中,518 例肿瘤有 95 例缺失配对正常;公开大队列中此类样本的存在要求使用者在加载时逐样本甄别。
  • 症状:对缺失正常的样本套用群体频率过滤做 tumor-only 调用,生殖系变异被误标为体细胞;非欧裔样本误判更严重,因为群体参考库以欧洲人群为主;下游突变特征(如 BRCA 信号)被生殖系污染。
  • 解决:简单方法——仅保留有配对正常的样本做体细胞分析,缺失正常的样本单独隔离说明;进阶方法——采用专为 panel 设计的 tumor-only 判别管线(利用肿瘤纯度导致的等位基因频率偏移区分体细胞/生殖系,Shen et al. 2022 式方法);SOTA 方法——利用脱靶 reads 推断每位患者的遗传祖先,用祖先校正的群体频率过滤,同时为生殖系发现触发遗传咨询提示。
  • 参考:InterMEL 研究(PMC9640183);Cancer Discovery 2022 祖先研究(DOI 10.1158/2159-8290.CD-22-0312)。

⚠️ 坑点 4:TMB 口径不可跨平台直接比较(分类:评估误用)

  • 问题:MSK-IMPACT 的 TMB 定义为 panel 覆盖范围内每 Mb 的非同义体细胞突变数;WES(如 TCGA)则以全外显子(约 44 Mb 口径)计算。panel 与外显子的组成、大小不同,同一肿瘤在两种口径下的 TMB 数值不等,免疫治疗阈值(如 10 mut/Mb)也不可平移。
  • 症状:MSK 队列与 TCGA 队列的 TMB 分布"对不上";把一个队列上训练的 TMB 阈值直接搬到另一队列评估;ICI 响应模型跨队列性能漂移;panel 大小不同的两个公开研究 TMB 均值差异被误读为生物学差异。
  • 解决:简单方法——在同源口径内建模与评估,报告中显式写出分母 Mb 数与突变类型过滤规则;进阶方法——把所有样本限制到共同 panel 区域重新计数,并像 2017 论文那样对 IMPACT 与 WES 的 TMB 做相关性校准;SOTA 方法——分位数映射/批次校准(ComBat 类)将 panel TMB 映射到 WES 参考分布,并在外部队列上验证校准后的决策阈值。
  • 参考:InterMEL 研究 TMB 定义段(PMC9640183);Nature Medicine 2017 论文方法部分(PMC5461196)。

⚠️ 坑点 5:一名患者多个样本导致的划分泄漏(分类:数据泄漏)

  • 问题:队列天然包含同一患者的多病灶、多时点样本(PATIENT_ID 对 SAMPLE_ID 为一对多)。按样本行级随机划分时,同一患者的近克隆样本会同时落入训练集与测试集,患者的基因组背景、治疗经历与结局信息随之泄漏。
  • 症状:患者级任务(生存、响应、转移预测)的测试指标系统性虚高;同一患者在"训练集"与"测试集"里几乎携带相同突变谱;删除重复患者后指标大幅回落。
  • 解决:简单方法——GroupShuffleSplit/GroupKFold 以 PATIENT_ID 为组键,这是不可妥协的底线;进阶方法——在患者划分之上叠加时间维度(早期检测入训练、晚期检测入测试)与 panel 版本分层,构造三重稳健划分;SOTA 方法——患者级划分 + 时间外推 + 多机构外部验证(GENIE)三层验证体系,并报告各层指标落差作为泄漏敏感度检查。
  • 参考:cBioPortal 数据模型(PATIENT_ID/SAMPLE_ID 两级键);本文 §5 划分建议。

⚠️ 坑点 6:生存随访截断与 ICI 对照组的适应症混杂(分类:评估误用)

  • 问题:生存与随访数据的截止时点随数据版本漂移(2017 首报之后随访数据在后续更新中扩充,ICI 治疗队列分析即建立在更新后的随访之上);同时,ICI 治疗组(约 1,661 人)与非 ICI 对照组(约 3,840 人)的构成由适应症决定——癌种、体能状态、治疗线数系统性不同,对照并非随机分配。
  • 症状:把 ICI 组与非 ICI 组的生存差异全数归因于 TMB 或基因特征;合并不同快照的随访数据导致删失机制不一致;生存曲线尾部因截断不稳;倾向性被模型当作生物学效应学走。
  • 解决:简单方法——只用检测/治疗时点之前可得的变量做预测,报告每队列的删失比例与随访中位数;进阶方法——按年龄、癌种、治疗线数等做倾向得分匹配或逆概率加权后再比较;SOTA 方法——采用双重稳健估计/目标学习框架处理混杂与删失,并对未测混杂因素做敏感性分析(E-value 类)。
  • 参考:基于 MSK-IMPACT 队列的 TMS/TMB 免疫治疗对比研究(PMC7210182,含 ICI/非 ICI 分组构成表);Nature Medicine 2017 论文对响应评估与试验匹配口径的定义(PMC5461196)。

⚠️ 坑点 7:三个公开渠道是不同快照,混用即重复计数(分类:工程陷阱)

  • 问题:cBioPortal msk-impact(2017 队列)、Zenodo MSK-IMPACT 50K(msk_impact_50k_2026)与 AACR GENIE(MSK 数据延迟约一年进入,并经再聚合与更深度去标识)承载同一体系的三个不同快照:内容重叠、时点不同、字段粒度不同、ID 体系不互通。
  • 症状:把 GENIE 里的 MSK 样本与 cBioPortal 队列合并时同一患者被计数两次;跨渠道找不到可对齐的样本 ID;论文规模声明张冠李戴(例如把 2017 队列数字说成累计规模);许可条款被渠道错配(把 CC BY-NC-ND 渠道的数据当成无限制使用)。
  • 解决:简单方法——单渠道单快照完成任务,记录渠道、study id 与下载日期三要素;进阶方法——跨渠道合并前以"基因+突变+癌种+关键临床字段"做模糊去重,规模数字永远注明快照日期;SOTA 方法——多机构研究统一以 GENIE 某一 release 为准并在方法部分登记 release 号,把 cBioPortal/Zenodo 渠道仅用于复现与训练,禁止交叉计数。
  • 参考:MSK 数据共享材料(HeroX DataWorks 2022 提交,说明三渠道分工与延迟一年策略);MSK Data Catalog UID 10438 说明;Zenodo MSK-IMPACT 50K 许可声明。

⚠️ 坑点 8:448 个亚型的长尾与癌种标签的指示混杂(分类:标签理解)

  • 问题:MSK-IMPACT 50K 队列覆盖 448 个 OncoTree 组织学亚型,其中大量亚型样本极少;同时癌种标签是临床检测路径的产物——不同癌种、不同疾病阶段被送检的概率不同,标签本身携带选择机制信息。
  • 症状:细粒度多分类模型在长尾亚型上指标崩塌;把"检测年份/批次"学成癌种的代理特征;罕见癌种的"过表示"被误读为人群流行率;跨研究对比时因为亚型合并粒度不同而不可比。
  • 解决:简单方法——按 OncoTree 层级上卷到有足够样本的上级类别做主任务,长尾亚型单列少样本评估;进阶方法——层级 softmax 或层级标签树损失,评估时按"亚型/上级类别"两级分别报告,并加拒绝预测(abstention)阈值;SOTA 方法——以 OncoTree 本体构建层级约束的表征学习,并对送检概率做选择模型校正(healing selection bias),在泛癌种任务上联合建模"是否被检测"与"突变状态"。
  • 参考:Zenodo MSK-IMPACT 50K 记录(448 亚型口径);MSK Data Catalog(OncoTree 编码说明)。
  • 坑点速查:写模型前扫一遍本表,任何一条命中你的任务就先读对应坑点的完整展开。
坑点 一句话风险 命中场景
1 未测基因被当野生型 合并多版本 panel 数据
2 单中心队列当人群 人群推断、校准声明
3 生殖系误判为体细胞 有缺失配对正常的样本
4 TMB 跨口径比较 与 WES/其他 panel 对比
5 患者跨集泄漏 样本级随机划分
6 随访截断与适应症混杂 ICI 对照、生存分析
7 三渠道重复计数 跨渠道合并数据
8 长尾亚型与指示混杂 细粒度多分类

6.6 可复现性清单

  • 记录渠道(cBioPortal/Zenodo/GENIE)、study id、下载日期与 GENIE release 号。
  • 记录 panel 版本处理策略(共同基因集/掩膜/协变量)与版本构成表。
  • 记录 TMB 分母 Mb 数与突变类型过滤规则。
  • 记录标签构造规则(actionable 等级、响应评估窗口、删失口径)。
  • 划分脚本以 PATIENT_ID 为组键并输出版本分层检查表。
  • 全部随机过程固定 seed,外部验证结果单独成表。

可复现性登记表模板(建议随代码仓一起提交):

登记项 内容要求 例子(写法)
渠道快照 渠道名 + study id + 下载日期 Zenodo MSK-IMPACT 50K,2026-09-05 下载
文件指纹 关键文件行数与 md5 data_mutations.maf:N 行,md5 值
版本策略 掩膜/共同基因集/协变量三选一并说明理由 覆盖掩膜法,掩膜表随仓
TMB 口径 过滤集合 + 分母 Mb NONSYN 九类,按 panel 版本分母
标签口径 阈值与窗口的显式参数 actionable 取最高 Level ≤ 3
划分方案 组键、比例、分层维度 PATIENT_ID 组键,8:2,版本分层
外部验证 数据源与排除规则 GENIE release 号,排除 MSK 机构
环境 语言与关键包版本 Python 3.11,pandas 与 scikit-learn 版本号

6.7 端到端建模骨架

以"高 TMB 预测"之外更有价值的患者级生存建模为例,给出端到端骨架:

import numpy as np
import pandas as pd
from lifelines import CoxPHFitter
from sklearn.model_selection import GroupKFold

def build_patient_level(feats: dict[str, pd.DataFrame], clin: pd.DataFrame) -> pd.DataFrame:
    """样本级特征聚合到患者级:多病灶取 max(携带即为阳性)。"""
    pat = {}
    for name, m in feats.items():
        pat[name] = m.groupby(level=0).max()  # 以 SAMPLE_ID 索引聚合到患者
    X = pd.concat(pat.values(), axis=1)
    X.index.name = "PATIENT_ID"
    return X.join(clin.set_index("PATIENT_ID")[["OS_MONTHS", "OS_STATUS"]], how="inner")

def crossval_cox(X: pd.DataFrame, n_splits: int = 5, seed: int = 20260905) -> list[float]:
    """患者级 GroupKFold + Cox 比例风险模型,返回每折 C-index。"""
    y_time = X["OS_MONTHS"].astype(float)
    y_event = (X["OS_STATUS"].astype(str).str.startswith("1")).astype(int)
    covariates = [c for c in X.columns if c not in {"OS_MONTHS", "OS_STATUS"}]
    c_indexes = []
    gkf = GroupKFold(n_splits=n_splits)
    groups = X.index.to_numpy()
    for tr, te in gkf.split(X, groups=groups):
        fitter = CoxPHFitter()
        fit_df = X.iloc[tr][covariates + ["OS_MONTHS"]].assign(EVENT=y_event.iloc[tr])
        fitter.fit(fit_df, duration_col="OS_MONTHS", event_col="EVENT")
        te_df = X.iloc[te][covariates + ["OS_MONTHS"]].assign(EVENT=y_event.iloc[te])
        c = fitter.score(te_df, scoring_method="concordance_index")
        c_indexes.append(float(c))
    return c_indexes

骨架体现三个不可妥协点:患者级聚合在特征层完成(坑点 5 的前置防御);GroupKFold 保证折间无患者重叠;C-index 逐折输出而非只报均值,便于检查长尾折的波动。实际研究中把 OS_STATUS 解析、panel 版本协变量与分层指标按 §6.4 的对照表补齐。

骨架之外的三条提醒:

  • 生存模型的协变量必须是检测时点前可得的变量,任何治疗相关后验特征都构成时间泄漏。
  • 患者级聚合方式(max/mean/首事件)是研究决策,需在方法部分显式声明并做敏感性分析。
  • C-index 报告须同时给出各折样本量,防止某折的罕见癌种集中导致均值失真。

§7 质量评估

7.1 分析有效性(准确性)

MSK-IMPACT 由 CLIA 合规、经纽约州卫生部临床实验室评估项目批准的临床实验室实施,2017 年 11 月成为首个获 FDA II 类授权的 NGS 肿瘤 panel(彼时为 468 基因版,以 NYSDOH 为认可第三方评审路径)。2017 论文另将 IMPACT 结果与 TCGA 全外显子数据比对,报告了高度一致的突变谱,并展示了 panel 对 WES 的 TMB 相关性校准。对 AI 使用者而言,这意味着原始变级数据(SNV/indel/CNA/重排)经过临床级验证管线,底层数据质量处于行业最高档位。

有效性的另一面是检出范围声明:panel 设计决定了哪些事件"检测不到"(例如选定内含子之外的重排、panel 未覆盖基因的突变)与哪些事件"低置信"(低纯度样本、低 VAF 变异)。建模时把检出范围当作先验写进掩膜与损失,比事后清洗更可靠。

7.2 完整性

配对正常样本是设计默认,但受标本可得性限制存在缺失案例;临床字段(治疗、随访)在公开渠道的粒度低于机构内部版本;癌种与基本人口学字段覆盖完整。使用前以 §4.5 字段字典逐列核对缺失率,并把缺失粒度差异写入研究限制。

完整性审计建议按三个层次做:文件层(每个表行数与渠道记录是否一致)、字段层(每列缺失率与缺失模式是否随机)、样本层(配对正常缺失样本占比、低纯度样本占比)。三层审计脚本建议在数据加载入口一次性完成并输出报告。

审计层 检查内容 通过标准
文件层 行数、md5 与渠道记录一致 全部一致或差异可解释
字段层 每列缺失率与缺失机制 高缺失列(>50%)显式排除或说明
样本层 配对正常缺失、低纯度样本占比 剔除或分流处理并报告数量

7.3 一致性

跨版本一致性需要主动维护:panel 版本、TMB 口径、OncoTree 版本随时间演进;同一快照内部一致性由 cBioPortal 标准格式保证。2017 论文与 TCGA 的跨平台一致性比对是文献中可引用的正面证据。

实践中的不一致风险主要来自三处:OncoTree 编码随本体版本迁移(个别癌种更名或拆分)、同一基因在不同 panel 版本中的覆盖外显子范围不同、渠道间派生指标(TMB 列)的算法版本差异。三者都应在数据对齐脚本中显式处理并留痕。

7.4 时效性

队列以逾 12,000 样本/年的速度增长,但公开快照更新有滞后期(GENIE 延迟约一年)。数字声明必须绑定快照日期;本词条全部数字截至 2026-09 检索。

时效性对两类研究影响最大:其一是规模声明——任何"我们用了 N 例"的表述都会随时间失效,正确做法是写"N 例(渠道,快照日期)";其二是纵向研究——更长的随访会改变生存分析的删失结构,同一研究内必须使用单一快照。

7.5 代表性

队列的临床真实性与代表性偏倚一体两面:晚期疾病过采样、欧洲 ancestry 占比逾 76%、癌种分布由送检路径塑造。MSK 官方研究在局限声明中明确承认上述偏差,并通过社区合作与专项计划扩展可及性。任何以人群推断为目标的研究都必须叠加外部验证与加权校正。

代表性的量化自查步骤:

  • 第一步:从快照数据导出"癌种 × 分期(或采样类型)× ancestry"三维构成表。
  • 第二步:选定人群基准(SEER 类登记或 GENIE 多机构聚合),对齐粒度。
  • 第三步:逐单元格计算过/欠采样倍数,列出超过一个数量级的单元格清单。
  • 第四步:把清单写进研究限制,并在模型评估中为这些单元格单独报告指标或直接拒绝外推。

代表性的量化自查:把队列的癌种×分期×ancestry 三维构成表与目标人群基准并列,计算每个单元格的过/欠采样倍数;倍数超过一个数量级的单元格就是外推禁区。这个自查成本低,但能把坑点 2 从"抽象警告"变成"具体边界"。

7.6 可追溯性

从样本到变级的全程管线开源(IMPACT-Pipeline),拷贝数、MSI 算法与注释知识库(OncoKB)均可追溯;公开数据以 cBioPortal 标准格式发布,字段语义由 meta 文件与数据字典声明。原始影像、病理切片与完整病历不在公开范围内。

可追溯性的使用姿势:复现研究时先固定管线版本(commit 号)再固定数据快照,两者共同构成"数据指纹";对比文献结果时先确认对方使用的快照与版本策略,再解释数字差异——多数文献间突变率差异来自版本口径而非生物学。

7.7 DAIMS 24 项核查

# 检查项 状态 说明
1 宽格式表格规范 ✅ cBioPortal 标准 TSV/MAF/SEG,行列表意稳定
2 唯一标识体系 ✅ PATIENT_ID/SAMPLE_ID 两级主键,跨表关联清晰
3 特殊字符与编码 ✅ UTF-8 文本,HGVS 命名规范
4 重复行处理 ⚠️ 一患者多样本是特性而非错误,需按任务显式聚合
5 缺失值编码 ✅ [Not Available]/[Unknown] 统一约定,易解析
6 标签语义清晰 ⚠️ panel 版本与部分派生指标无独立列,需按渠道文档推断
7 罕见类别处理 ⚠️ 448 亚型长尾严重,需层级分组与掩膜评估
8 偏倚评估材料 ⚠️ 官方论文自述选择偏倚,但公开包内无偏倚元数据
9 数据字典完备 ✅ meta 文件 + 官方文档提供列语义
10 信息性缺失说明 ✅ 临床表描述块说明字段含义与缺失口径
11 设备与批次记录 ❌ 公开版不含测序批次、试剂版本与仪器信息
12 特征共线性检查 ✅ 突变/拷贝数/重排通道划分明确,可按生物学先验分组
13 编码体系映射 ✅ OncoTree 官方映射 ICD-O-3,可再对接 SNOMED CT/ICD-11
14 时间戳处理 ⚠️ 检测/随访时点粒度受去标识限制,跨快照漂移需注意
15 划分建议可得 ✅ 本文 §5 给出按患者/时间/版本/层级的完整方案
16 泄漏风险讨论 ✅ 本文坑点 5/6 系统覆盖患者泄漏与时间泄漏
17 标签分布统计 ✅ 癌种、actionable 比例等关键分布有文献数字支撑
18 测量偏倚讨论 ⚠️ 送检路径指示混杂存在但公开数据无法直接校正
19 外部验证建议 ✅ GENIE/TCGA 两条外部验证路径明确可用
20 版本记录机制 ✅ panel 版本演进与渠道快照可追溯(需自行记录日期)
21 预处理脚本可得 ✅ IMPACT-Pipeline 开源,社区工具(maftools 等)成熟
22 合规要求明确 ✅ 各渠道许可与数据使用协议条款清晰(含 NC-ND 限制)
23 多模态对齐支持 ⚠️ 影像/单细胞等扩展在机构内推进中,公开版以基因组+临床为主
24 去标识化审计 ✅ 三渠道均经去标识流程,公开字段不含直接标识符

DAIMS 评分:19.5/24(✅ 计 1 分 × 16 项,⚠️ 计 0.5 分 × 7 项,❌ 计 0 分 × 1 项)

评分解读:这是一个"底座极硬、边角需人工"的数据集。标识体系、数据字典、编码映射、许可合规与去标识化等结构性维度全部满格,公开成熟度在临床基因组队列中处于第一梯队;扣分集中在三处——批次/设备元数据缺失(❌,无法做精细的批次效应校正)、panel 版本与派生指标需人工推断(⚠️)、长尾与偏倚需要研究者自行设计处理策略(⚠️)。

对你意味着什么:如果你的任务是驱动突变发现、TMB/MSI 方法学研究或按患者划分的生存/响应建模,19.5 分意味着你可以直接开工,把精力花在科学问题本身;如果你的任务对批次效应、设备元数据或亚型均衡有强依赖,你需要先用坑点 1/2/8 的策略补齐这些缺口,或把外部验证(GENIE/TCGA)纳入必做步骤。综合而言,这是肿瘤基因组 AI 研究最值得投入学习的公开队列之一,学习成本集中在本文 §6.5 的八个坑点上。

如何使用这份评分:

  • 报告引用:论文的数据节可直接写"基于 DAIMS 框架评估为 19.5/24",并引用本词条的逐项表作为依据。
  • 缺口排查:把你的任务必须依赖的检查项圈出来,任何圈中项若非 ✅,先读对应坑点再动手。
  • 方法学预算:⚠️ 项意味着需要在 pipeline 中额外写代码处理(掩膜、加权、分层),把这部分工作量计入项目排期。
  • 对比选型:与其他队列的 DAIMS 评分并排比较时,务必逐项比而非只比总分——总分相同的项目,失效模式可能完全不同。

7.8 外部验证矩阵

验证目标 外部数据源 对齐方式 注意事项
驱动格局与热点复现 AACR GENIE(多机构 panel 聚合) 共同基因集 + OncoTree 对齐 GENIE 各中心 panel 不同,需掩膜;排除 MSK 机构数据防重复
TMB 分布与阈值 TCGA(WES,全外显子口径) 限定共同区域重计数 + 分位数映射 口径差异见坑点 4,阈值不可平移
突变特征与 MMR/POLE 信号 TCGA / 公共 WGS 队列 特征级对比而非样本级合并 panel 检出特征的能力有限,声明覆盖差异
ancestry 相关分析 祖先参考面板 + GENIE 多 ancestry 祖先推断管线统一后分层 参考库欧洲偏倚会传导给结果(坑点 3)
生存与治疗效应 多机构真实世界登记(GENIE 临床字段) 时间锚点与治疗线数对齐 各机构随访实践不同,删失机制需检验

7.9 已知质量问题登记表

问题编号 描述 影响 缓解 关联
Q-01 2017 队列论文存在 Erratum(2017-08-04 刊出,修正图 3c 纵轴标注) 不影响数据文件,影响论文图版复现 引用图版时核对勘误说明 §9.2
Q-02 公开渠道无测序批次与仪器元数据 无法做批次级校正 以渠道/时间代理批次并做敏感性分析 DAIMS 11
Q-03 panel 版本无独立列 版本归属需推断 版本掩膜 + 协变量分层 坑点 1
Q-04 少数样本缺失配对正常 体细胞/生殖系判别不均一 加载时逐样本甄别 坑点 3
Q-05 公开临床字段粒度低于内部版 精细混杂控制受限 仅用公开字段做粗分层,结论加限定 坑点 2、6
Q-06 三渠道快照时点不同 跨渠道数字不一致 数字绑定快照日期 坑点 7
Q-07 2017 论文数据含三版本 panel 版本异质性直接影响突变率估计 覆盖掩膜 + 版本分层(本文提供代码) 坑点 1
Q-08 癌种编码随 OncoTree 版本迁移 跨快照合并时类别漂移 保留原码 + 映射版本号双记录 §2.4

§8 基准任务与研究生态

8.1 衍生研究规模

MSK 官方 2022 年数据共享材料统计:仅 MSK 内部基于 MSK-IMPACT 数据的论文即达 576 篇,累计被引 43,714 次;cBioPortal 每月服务逾 30,000 名全球科学家。原始论文 Google Scholar 引用 3,758 次(截至 2026-09),OpenAlex 统计 3,403 次、FWCI 129.4——在临床肿瘤测序领域均属顶级影响力。

规模背后的三点结构信息:

  • 产出主体多元:576 篇论文横跨驱动发现、治疗响应、诊断标志物与方法学工具,说明数据的价值密度不依赖单一问题域。
  • 数据-发表闭环:内部出版委员会审查 + 论文发表后数据进公开渠道的机制,使公开快照与文献持续同步。
  • 引用加速度:2017 论文的年度引用曲线在发表后多年维持数百次/年量级(OpenAlex FWCI 129.4),属"基础设施型论文"特征——被引不随热点消退而衰减,因为后续研究持续以它为基线。

8.2 代表性研究方向与可对标结果

  • 队列全景与驱动格局:2017 论文(10,945 例肿瘤的泛癌突变图谱)与 MSK-IMPACT 50K(54,331 例肿瘤、448 亚型、164 个新热点)构成两代"可对标基线",任何驱动发现研究都应与之对照。
  • 免疫治疗生物标志物:基于 MSK-IMPACT 队列的 ICI 治疗分析确立了 TMB 作为泛癌免疫治疗响应标志物的真实世界证据链,TMS/TMB 对比研究(PMC7210182)提供了 ICI 组 1,661 人、非 ICI 组 3,840 人的可复现分组基线。
  • 转移与治疗抵抗:队列支撑了转移灶与原发灶突变谱差异、治疗抵抗突变(如雄激素受体等)的系列发现,2017 论文与 TCGA 原发瘤对照是标准引用点。
  • 遗传 ancestry 与公平性:Cancer Discovery 2022(45,157 名患者)建立了从 panel 数据推断 ancestry 并分析跨 ancestry 差异的方法学样板。
  • 试验匹配与真实世界效果:37% actionable 与 11% 试验匹配率的口径(前 5,009 名患者)为真实世界精准肿瘤学研究的经典参照。
  • 罕见癌种研究:队列对罕见癌种(胆管癌、肉瘤、葡萄膜黑色素瘤等)的覆盖是其社会价值的核心——单独一个中心难有足够罕见癌种样本,而泛癌种 panel 让罕见癌种"搭车"积累;50K 队列 448 亚型的长尾结构正是这一价值的直接体现。
  • 方法学外溢:从该队列发展出的掩膜分析、panel TMB 校准、ancestry 推断等方法已反向输出到其他 panel 队列的分析实践中,形成方法学正循环。

每个方向都可以直接作为学位论文或论文专题的选题骨架:先复现基线数字,再引入一个明确的扩展变量(时间、ancestry、治疗线数),最后用 GENIE 做外部验证——这是该数据集投入产出比最高的研究路径。

8.3 工具生态

工具/资源 角色 备注
cBioPortal for Cancer Genomics 数据托管、可视化与下载 开源软件,可自建实例
OncoKB 突变功能与可用药性知识库 FDA 部分认可,注释等级体系
OncoTree 肿瘤类型本体与编码 提供 ICD-O-3 映射
IMPACT-Pipeline 官方生信分析管线 开源可审计
FACETS 等位基因特异拷贝数分析 拷贝数与杂合性丢失 jointly 建模
MSIsensor MSI 评估 MSI-H 识别标准方法之一
maftools 等 R/Bioconductor 工具 MAF 读取、oncoplot、TMB 计算 直接兼容 data_mutations.maf
IGV SEG 区段可视化 拷贝数人工质检的快速入口
mutation-signatures 仓库 突变特征分解 2017 论文配套开源代码
Synapse GENIE 数据获取与协作平台 需签署数据使用协议

8.4 相关数据集对比

数据集 模态与定位 配对正常 临床标注深度 获取方式
MSK-IMPACT 临床靶向 panel,前瞻性真实世界队列 是(设计默认,个别缺失) 强(治疗路径+随访) cBioPortal/Zenodo/GENIE 三渠道
TCGA 科研 WES,多组学,以原发瘤为主 多数有正常对照 中(随访有限) 开放(GDC)
AACR GENIE 多机构临床 panel 聚合注册库 部分机构提供 中(标准化核心字段) Synapse 协议获取
全基因组队列(PCAWG 类) WGS 全景,结构变异检出最强 是 中 开放,但样本量为千例级
MSK-ACCESS cfDNA 液体活检(129 基因),动态监测 无(血浆 cfDNA) 中 临床检测,非公开研究队列

选型建议:以"真实世界临床深度"为纲选 MSK-IMPACT;以"多组学原发瘤全景"为纲选 TCGA;以"多机构泛化"为纲选 GENIE;以"结构变异全景"为纲选 WGS 队列。四者互补,MSK-IMPACT 的不可替代性在于临床级 panel 数据与随访深度的结合。

8.5 三个可复用的研究设计模板

模板一:驱动格局复现与扩展。数据用 Zenodo 50K;按 OncoTree 亚型分层;以覆盖掩膜约束背景突变率;输出与 50K 论文(54,331 例肿瘤、164 个新热点)对标的驱动清单;扩展方向是按 ancestry 或治疗暴露分层。评估锚点是热点复现率与新增热点的独立队列支持率。

模板二:免疫治疗生物标志物方法学。数据用 cBioPortal msk-impact(2017 队列)或 50K + 自建 ICI 标签;对照设计采用倾向得分加权的 ICI/非 ICI 分组(基线:PMC7210182 的 1,661 对 3,840 分组构成);评估 AUROC 与校准,敏感度分析覆盖未测混杂。锚点是 TMB 单变量基线,任何复杂模型须证明相对 TMB 的净增益。

模板三:多机构泛化验证。训练在 Zenodo 50K,外部验证在 GENIE 某一 release(排除 MSK 机构数据);对齐共同基因集 + 掩膜;报告从单中心到多中心的性能落差,作为泛化性的诚实声明。该模板同时满足坑点 2 与坑点 7 的缓解要求。

§9 资源与引用

9.1 官方资源入口

  • MSK-IMPACT 官方介绍页(检测内容与临床说明):MSK-IMPACT
  • MSK Data Catalog 数据集记录(2017 队列,UID 10438):MSK Data Catalog
  • cBioPortal 公开 study(msk-impact 与 msk_impact_50k_2026):cBioPortal
  • Zenodo 数据集记录(MSK-IMPACT 50K,CC BY-NC-ND 4.0):Zenodo
  • MSK 分子肿瘤学中心资源与里程碑时间线:CMO Resources
  • AACR Project GENIE 项目页与 Synapse 获取入口:AACR GENIE
  • 官方分析管线仓库(IMPACT-Pipeline):IMPACT-Pipeline
  • 突变特征分解配套代码仓库(mutation-signatures):mutation-signatures
  • NCI Cancer Currents 论文解读稿(2017 关键数字的机构级核对源):NCI 解读

9.2 必读文献

  • Zehir A, Benayed R, Shah RH, et al. Mutational landscape of metastatic cancer revealed from prospective clinical sequencing of 10,000 patients. Nature Medicine. 2017;23(6):703-713. DOI: 10.1038/nm.4333(队列首报,Google Scholar 引用 3,758 次,截至 2026-09)
  • Bandlamudi C, Berger M, et al. MSK-IMPACT 50K: Cancer type-specific variation in patterns of driver alterations across 50,000 tumors. Zenodo 数据集记录(含 cBioPortal study msk_impact_50k_2026)。
  • Memorial Sloan Kettering Cancer Center. MSK-IMPACT: Sharing cancer genomic & clinical data. DataWorks 2022 数据共享挑战赛提交材料(三渠道分工与累计规模口径)。
  • 基于 MSK-IMPACT 队列的免疫治疗生物标志物对比研究(TMS 与 TMB 比较,PMC7210182;含 panel 版本占比与 ICI/非 ICI 分组基线)。
  • MSK 遗传祖先推断研究. Cancer Discovery. 2022. DOI: 10.1158/2159-8290.CD-22-0312(45,157 名患者的 ancestry 方法学与偏倚声明)。
  • InterMEL 研究联盟. Landscape of mutations in early stage primary cutaneous melanoma: an InterMEL study.(PMC9640183;第三方使用 MSK-IMPACT panel 的方法论参照,含缺失配对正常样本的处理与 TMB 口径声明)
  • Nature Medicine 2017 论文勘误. Nat Med. 2017;23(8):1004. DOI: 10.1038/nm0817-1004c(引用论文图版时需一并核对)。
  • NCI Cancer Currents 官方解读. Study identifies genetic mutations in tumors from 10,000 patients with metastatic cancer.(2017 论文关键数字的机构级解读稿,适合快速核对 78,066 突变、81% 热点遗漏率等数字)

9.3 BibTeX

@article{zehir2017mutational,
  author  = {Zehir, Ahmet and Benayed, Ryma and Shah, Ronak H. and Syed, Aijazuddin and Middha, Sumit and Kim, Hyunjae R. and Srinivasan, Preethi and Gao, Jianjiong and Chakravarty, Debyani and Devlin, Sean M. and Hellmann, Matthew D. and Barron, David A. and Schram, Alison M. and Hameed, Meera and Dogan, Snjezana and Ross, Dara S. and Hechtman, Jaclyn F. and DeLair, Deborah F. and Yao, JinJuan and Mandelker, Diana L. and Cheng, Donavan T. and Chandramohan, Raghu and Mohanty, Abhinita S. and Ptashkin, Ryan N. and Jayakumaran, Gowtham and Prasad, Meera and Syed, Mustafa H. and Rema, Anoop Balakrishnan and Liu, Zhen Y. and Nafa, Khedoudja and Borsu, Laetitia and Sadowska, Justyna and Casanova, Jacklyn and Bacares, Ruben and Kiecka, Iwona J. and Razumova, Anna and Son, Julie B. and Stewart, Lisa and Baldi, Tessara and Mullaney, Kerry A. and Al-Ahmadie, Hikmat and Vakiani, Efsevia and Abeshouse, Adam A. and Penson, Alexander V. and Jonsson, Philip and Camacho, Niedzica and Chang, Matthew T. and Won, Helen H. and Gross, Benjamin E. and Kundra, Ritika and Heins, Zachary J. and Chen, Hsiao-Wei and Phillips, Sarah and Zhang, Hongxin and Wang, Jiaojiao and Ochoa, Angelica and Wills, Jonathan and Eubank, Michael and Thomas, Stacy B. and Gardos, Stuart M. and Reales, Dalicia N. and Galle, Jesse and Durany, Robert and Cambria, Roy and Abida, Wassim and Cercek, Andrea and Feldman, Darren R. and Gounder, Mrinal M. and Hakimi, A. Ari and Harding, James J. and Iyer, Gopa and Janjigian, Yelena Y. and Jordan, Emmet J. and Kelly, Ciara M. and Lowery, Maeve A. and Morris, Luc G. T. and Omuro, Antonio M. and Raj, Nitya and Razavi, Pedram and Shoushtari, Alexander N. and Shukla, Neerav and Soumerai, Tara E. and Varghese, Anna M. and Yaeger, Rona and Coleman, Jonathan and Bochner, Bernard and Riely, Gregory J. and Saltz, Leonard B. and Scher, Howard I. and Sabbatini, Paul J. and Robson, Mark E. and Klimstra, David S. and Taylor, Barry S. and Baselga, Jose and Schultz, Nikolaus and Hyman, David M. and Arcila, Maria E. and Solit, David B. and Ladanyi, Marc and Berger, Michael F.},
  title   = {Mutational landscape of metastatic cancer revealed from prospective clinical sequencing of 10,000 patients},
  journal = {Nature Medicine},
  volume  = {23},
  number  = {6},
  pages   = {703--713},
  year    = {2017},
  doi     = {10.1038/nm.4333}
}

@dataset{bandlamudi2026mskimpact50k,
  author    = {Bandlamudi, Chaitanya and Berger, Michael},
  title     = {MSK-IMPACT 50K: Cancer type-specific variation in patterns of driver alterations across 50,000 tumors},
  publisher = {Memorial Sloan Kettering Cancer Center},
  year      = {2026},
  note      = {Zenodo 数据集记录,CC BY-NC-ND 4.0,配套 cBioPortal study msk_impact_50k_2026}
}

@misc{msk2022datasharing,
  author = {{Memorial Sloan Kettering Cancer Center}},
  title  = {MSK-IMPACT: Sharing cancer genomic and clinical data},
  year   = {2022},
  note   = {DataWorks 2022 数据共享挑战赛提交材料}
}

@article{mskancestry2022,
  author  = {{MSK Computational Oncology and Human Oncology and Pathogenesis Program}},
  title   = {Genetic ancestry inference from MSK-IMPACT data in 45,157 patients},
  journal = {Cancer Discovery},
  year    = {2022},
  doi     = {10.1158/2159-8290.CD-22-0312}
}

9.4 版本与快照记录

  • 本词条事实核查检索日期:2026-09(6 次公开检索)。
  • 数字快照:2017 队列 10,945 例肿瘤 / 10,336 名患者;累计检测逾 70,000 人;内部累计 89,735 肿瘤样本 / 67,617 名患者(2022 官方口径);50K 队列 54,331 例肿瘤 / 48,179 名患者。
  • 引用快照:Google Scholar 3,758 次(截至 2026-09)。
  • Panel 版本快照:现行实体瘤版 505 基因;Heme 版 468 基因;四代版本演进信息以 MSK 官方与 DataWorks 2022 材料为准。
  • 许可快照:Zenodo 50K 记录许可声明为 CC BY-NC-ND 4.0(截至 2026-09 检索)。
  • 后续更新建议:MSK 若发布 100K 级公开 cohort 或改变 GENIE 共享策略,本词条应启动新一轮事实核查并更新 §3、§9.4。

9.5 术语表

术语 释义
MSK-IMPACT Integrated Mutation Profiling of Actionable Cancer Targets,MSK 的临床肿瘤靶向测序检测与队列体系
杂交捕获 用生物素标记探针富集目标区域的测序建库方式,panel 检测的主流技术路线
肿瘤-正常配对 对肿瘤与同一患者正常组织分别测序并比对,扣除生殖系变异以判别体细胞改变
MAF Mutation Annotation Format,体细胞突变的标准表格式,每行一个变异-样本对
VAF 变异等位基因频率,由肿瘤样本中替代与参考等位基因读深计数计算
CNA 拷贝数改变,涵盖扩增与缺失,本数据集提供基因级离散值与区段级连续值
SV 结构变异/重排,本 panel 在 17 个高频重排基因的选定内含子具备检出能力
TMB 肿瘤突变负荷,每 Mb 覆盖范围内的非同义体细胞突变数
MSI 微卫星不稳定性,错配修复缺陷的基因组表现,免疫治疗响应标志物
OncoTree MSK 开发的肿瘤类型本体,为每个诊断赋予唯一编码并含 ICD-O-3 映射
OncoKB MSK 维护的肿瘤变异知识库,FDA 部分认可,提供 Level 1-4 证据等级
FACETS 基于肿瘤/正常配对的等位基因特异拷贝数与杂合性丢失分析算法
MSIsensor 从配对测序数据推断 MSI 状态的标准算法
basket trial 跨组织学按分子改变入组的篮式试验,MSK-IMPACT 支撑其患者匹配
ascertainment bias 因样本来自特定就诊/检测路径而系统性偏离目标人群的偏倚
cBioPortal MSK 主导的开源癌症基因组数据平台,本队列的主要公开托管渠道
AACR Project GENIE 美国癌症研究协会牵头的多机构临床基因组注册库,MSK 为最大贡献者
CC BY-NC-ND 4.0 署名-非商业性-禁止演绎许可,Zenodo 50K 渠道采用
WES / 全外显子测序 对全部蛋白编码区测序的科研级方法,与本 panel 形成"口径对照"基准
WES Recapture MSK 对既往 IMPACT 检测余留样本开展的 WES 再测序项目(2018 起)
GISTIC 风格编码 拷贝数离散化惯例:-2 深缺失、-1 浅缺失、0 中性、1 扩增、2 高扩增
GroupShuffleSplit 以分组键(此处为患者)为单位的随机划分方法,防患者级泄漏
DAIMS 本百科采用的数据集 AI 就绪度核查框架,24 项逐条评估

§10 AI 使用声明卡

  • 允许用途:学术研究与方法学开发(驱动发现、生物标志物研究、模型基准)均允许,成果须引用原始论文并遵守渠道数据使用协议。
  • 限制用途:Zenodo 50K 渠道采用 CC BY-NC-ND 4.0——非商业、禁演绎再分发;商业用途需联系 MSK 获取授权;GENIE 数据仅限协议范围内使用并禁止再分享原始级数据。
  • 禁止用途:任何形式的个体再识别;将数据直接作为个体临床决策依据;将非欧裔亚群结果不加校准地泛化为全人群结论。
  • 隐私与伦理:公开数据为去标识数据,仅含基本临床变量;生殖系发现的临床返回在机构内按 IRB 协议执行,公开数据不含可回溯的生殖系报告。
  • 健康声明:本词条与数据集均不构成医疗建议;临床应用须以监管部门批准的检测与指南为准。
  • 引用要求:使用任何渠道数据,请引用 Zehir et al. 2017(Nature Medicine)与所选渠道的数据记录;使用 50K 队列请同时引用 Zenodo 记录。
  • 数据时效:所有数字绑定快照日期(见 §9.4);MSK 持续新增数据,使用前请在官方渠道确认最新口径。
  • 联系与授权:商业用途与数据问题请联系 MSK 官方数据请求渠道(datarequests@mskcc.org,见 Zenodo 记录许可声明)。
  • 公平性提示:数据在 ancestry 构成上偏倚明显,基于本数据训练的模型在部署前必须评估跨 ancestry 性能差异,防止放大既有医疗差距。
  • 模型部署边界:本数据训练的任何模型均为研究用途,不可未经前瞻验证直接进入临床决策流。
  • 透明度建议:发表基于本数据的研究时,随稿公开快照标识、掩膜策略与划分脚本,方便社区复核。
  • 再分发边界:无论何渠道获取,均不得以可回溯个体的形式再分发数据,亦不得绕过渠道协议向第三方转售。

附录 C | JSON-LD 结构化数据

{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@type": "MedicalWebPage",
      "@id": "#webpage",
      "name": "MSK-IMPACT 肿瘤靶向测序队列",
      "description": "面向 AI 研究者与临床数据科学家的 MSK-IMPACT 数据集百科词条:数据规格、字段结构、AI 就绪指南、已知坑点与质量评估。",
      "inLanguage": "zh-CN",
      "about": { "@id": "#dataset" },
      "audience": {
        "@type": "Audience",
        "audienceType": "医疗 AI 研究者、计算肿瘤学研究者、临床数据科学家"
      },
      "specialty": "Oncologic",
      "lastReviewed": "2026-09-05",
      "reviewedBy": "qianfanghub.com 医疗数据集百科编辑部",
      "dateModified": "2026-09-05",
      "datePublished": "2026-09-05"
    },
    {
      "@type": "Dataset",
      "@id": "#dataset",
      "name": "MSK-IMPACT",
      "alternateName": [
        "MSK-IMPACT 肿瘤靶向测序队列",
        "Integrated Mutation Profiling of Actionable Cancer Targets",
        "MSK-IMPACT Clinical Sequencing Cohort"
      ],
      "description": "MSK 自 2014 年起运行的前瞻性临床肿瘤靶向测序队列,肿瘤-正常配对测序,覆盖实体瘤与血液恶性肿瘤,含体细胞突变、拷贝数、重排、TMB、MSI 与临床随访数据。",
      "identifier": [
        { "@type": "PropertyValue", "propertyID": "cBioPortal Study ID", "value": "msk-impact" },
        { "@type": "PropertyValue", "propertyID": "cBioPortal Study ID", "value": "msk_impact_50k_2026" },
        { "@type": "PropertyValue", "propertyID": "ClinicalTrials.gov", "value": "NCT01775072" }
      ],
      "url": "https://www.qianfanghub.com/ai-ready-dataset/msk-impact/423",
      "keywords": [
        "靶向 panel 测序",
        "体细胞突变",
        "精准肿瘤学",
        "肿瘤突变负荷",
        "微卫星不稳定性",
        "真实世界临床队列",
        "泛癌种",
        "免疫治疗生物标志物"
      ],
      "license": "CC BY-NC-ND 4.0",
      "isAccessibleForFree": true,
      "creator": {
        "@type": "Organization",
        "name": "Memorial Sloan Kettering Cancer Center",
        "alternateName": "MSK"
      },
      "publisher": {
        "@type": "Organization",
        "name": "Memorial Sloan Kettering Cancer Center"
      },
      "temporalCoverage": "2014/2026",
      "spatialCoverage": {
        "@type": "Place",
        "name": "美国纽约(Memorial Sloan Kettering Cancer Center,单中心)"
      },
      "variableMeasured": [
        "体细胞单核苷酸变异(SNV)",
        "小片段插入缺失(indel)",
        "拷贝数改变(CNA)",
        "结构性重排(选定的 17 个高频重排基因内含子区)",
        "TERT 启动子突变",
        "肿瘤突变负荷(TMB)",
        "微卫星不稳定性(MSI)",
        "癌种(OncoTree 编码)",
        "总生存与随访信息"
      ],
      "measurementTechnique": [
        "杂交捕获靶向富集测序(hybridization capture)",
        "Illumina 高通量测序平台",
        "肿瘤-正常配对分析",
        "FACETS 拷贝数分析算法",
        "MSIsensor 微卫星不稳定性评估"
      ],
      "distribution": [
        {
          "@type": "DataDownload",
          "name": "cBioPortal:MSK-IMPACT Clinical Sequencing Cohort(2017 队列)",
          "encodingFormat": "text/tab-separated-values",
          "contentUrl": "https://www.qianfanghub.com/ai-ready-dataset/msk-impact/423"
        },
        {
          "@type": "DataDownload",
          "name": "Zenodo:MSK-IMPACT 50K(msk_impact_50k_2026)",
          "encodingFormat": "text/tab-separated-values",
          "contentUrl": "https://www.qianfanghub.com/ai-ready-dataset/msk-impact/423"
        },
        {
          "@type": "DataDownload",
          "name": "AACR Project GENIE:MSK 延迟一年共享数据",
          "encodingFormat": "text/tab-separated-values",
          "contentUrl": "https://www.qianfanghub.com/ai-ready-dataset/msk-impact/423"
        }
      ],
      "isPartOf": {
        "@type": "Dataset",
        "name": "AACR Project GENIE",
        "url": "https://www.qianfanghub.com/ai-ready-dataset/msk-impact/423"
      },
      "citation": {
        "@type": "ScholarlyArticle",
        "name": "Mutational landscape of metastatic cancer revealed from prospective clinical sequencing of 10,000 patients",
        "datePublished": "2017",
        "identifier": "10.1038/nm.4333"
      },
      "mainEntityOfPage": { "@id": "#webpage" }
    }
  ]
}

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • ocelot — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • sicapv2 — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • munich-bmc — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • cima — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • icgc — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • osteosarcoma — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • midog — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • hest-1k — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • panda — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • leopard — 共享标签:医学影像 / 病理图像 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集