TrackRAD2025 (trackrad) — AI-Ready Wikipedia

MICCAI 2025 挑战赛的首个公开多机构 MRI-linac cine-MRI 实时肿瘤追踪数据集——6 国中心 585 名患者 280 万+ 帧矢状位 2D cine-MRI,477 例未标注支撑预训练、108 例逐帧标注支撑追踪评测,冠军方案 MedSAM2 半监督微调 Dice 0.8909

来源 6 个国际中心(3 荷兰、1 德国、1 澳大利亚、1 中国四川)在 0.35T ViewRay MRIdian 与 1.5T Elekta Unity MRI-linac 放疗疗程中采集的矢状位 2D cine-MRI 序列(.mha 格式,1-8 Hz)+ 逐例 JSON 元数据(场强/帧率/扫描区域)+ 首帧模板肿瘤分割与逐帧标注掩码发布时间: 2026-09-27最后更新: 2026-09-27 阅读 18
TrackRAD2025 (trackrad) — AI-Ready Wikipedia

信息速览

数据集名称TrackRAD2025 (trackrad) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模585 名患者(477 未标注 + 108 逐帧手工标注);280 万+ 未标注 cine-MRI 帧;1 万+ 标注帧(另约 8000 帧多观察者标注);公开数据约 206 GiB(未标注 ~200
接入方式6 个国际中心(3 荷兰、1 德国、1 澳大利亚、1 中国四川)在 0.35T ViewRay MRIdian 与 1.5T Elekta Unity MRI-linac 放疗疗程中采集的矢状位 2D cine-MRI 序列(.mha 格式,1-8 Hz)+ 逐例 JSON 元数据(场强/帧率/扫描区域)+ 首帧模板肿瘤分割与逐帧标注掩码
AI 就绪度

INFOBOX — TrackRAD2025 一屏速览

维度 内容
本质 MICCAI 2025 挑战赛数据集:首个公开多机构 MRI-linac cine-MRI 实时肿瘤追踪基准
团队 LMU 慕尼黑放疗科牵头,联合 UMC Utrecht、Catharina、Amsterdam UMC、GenesisCare Sydney、四川省癌症医院等;27 位论文作者
论文 数据集论文 Med. Phys. 2025;52(7):e17964(doi:10.1002/mp.17964;预印本 arXiv:2503.19119);挑战赛报告 Med. Image Anal. 112:104134(2026)
数据 585 例 = 477 未标注 + 108 逐帧标注;矢状位 2D cine-MRI;1-8 Hz;胸/腹/盆
设备 0.35T ViewRay MRIdian + 1.5T Elekta Unity(两种商用 MRI-linac)
中心 6 个国际中心:3 荷兰 + 1 德国 + 1 澳大利亚 + 1 中国(四川省癌症医院)
帧量 280 万+ 未标注帧;1 万+ 标注帧(另约 8000 帧多观察者标注)
任务 首帧模板分割 → 逐帧实时肿瘤分割掩码(视频目标分割式追踪)
指标 DSC、SD95、SDavg、质心误差 CD、模拟 MLC 追踪剂量学精度 Rel. D98、推理速度——六指标综合排名
约束 NVIDIA A10G 24GB;≤1 秒/帧;全自动方法;每队 ≤5 人
终榜 冠军 Track’n’Treat(MedSAM2 半监督,DSC 0.8909)|季军 felixknispelrwth(零样本 CoTracker3)
获取 HuggingFace LMUK-RADONC-PHYS-RES/TrackRAD2025 直下(未标注 ~200 GiB);Zenodo DOI 仅描述 PDF
许可 数据 CC-BY-NC|Zenodo 元数据 cc-by-4.0(仅 PDF)|代码 MIT 风格
库内互链 fastmri(MRI 挑战赛先例)、duke-breast-mri、nsclc-radiomics、atlas-liver-tumor、covid-19-radiography

TrackRAD2025 是一个把"放疗机器上看直播"变成标准化 AI 赛道的数据集工程:在 MRI 引导放疗(MRI-guided radiotherapy, MRgRT)中,混合 MRI-直线加速器(MRI-linac)能边照射边用 2D cine-MRI 连续拍摄肿瘤的实时运动画面,但要让射线始终咬住肿瘤,机器必须在每一帧上瞬间认出肿瘤边界——临床现成的形变配准和模板匹配方案在这种大幅非刚性运动面前力不从心,于是治疗只能退化成"大动就关束"(beam gating)的保守模式。TrackRAD2025 的组织方把六个国际 MRI-linac 中心在真实放疗疗程中采集的 585 例矢状位 cine-MRI 汇成一个统一基准:477 例未标注数据(280 万+ 帧)供预训练与自监督方法发挥,108 例逐帧手工标注(1 万+ 帧)供追踪算法同台竞技,配套六项从几何到剂量学的评测指标和"每帧一秒"的硬性实时约束,在 MICCAI 2025 上决出名次。

这个数据集对 AI-Ready 研究者的价值有三层。第一层是数据稀缺性本身:这是世界上第一个跨厂商(0.35T 低场与 1.5T 高场)、跨六个中心、带逐帧标注的 MRI-linac cine-MRI 公开集合,此前此类数据全部锁在各机构的私有服务器里。第二层是任务设定:它把"分割"重构为"追踪"——算法只拿首帧一个模板掩码,之后必须完全靠自己逐帧跟上肿瘤,这比逐帧独立分割更贴近临床也更能暴露时序一致性问题。第三层是评测设计的完整性:评测不只看 Dice,还把分割误差折算成"如果按这个误差去照射,剂量会偏多少"(模拟 MLC 追踪剂量学精度),把 AI 指标与患者安全直接挂钩——这种设计在医学影像挑战赛里仍属少数。

导语读法三则:

  1. 只想下数据:直奔 §4 获取与许可——注意数据 CC-BY-NC 禁商用,Zenodo 那个 DOI 只是描述 PDF 不是数据,别下错门。
  2. 复现或参赛:直奔 §3 任务与评测协议——接口签名、六指标、"1 秒/帧"约束、A10G 24GB 硬件都是硬杠杠。
  3. 关心方法学:直奔 §5 结果与方法谱系——半监督 MedSAM2 冠军、零样本 CoTracker3 季军、SAM 微调第六名,三条路线的成败值得细读。

§0 导读:这个数据集解决什么问题

放疗的基本矛盾是"照得准"与"打得着":射线剂量分布是按计划 CT 上勾画的靶区设计好的,但胸腹部的肿瘤随着呼吸每分钟移动数百次,位移可达数厘米。传统处理办法要么扩大照射范围(以牺牲正常组织为代价),要么在运动过大时关闭射束(beam gating,拉长治疗时间)。MRI-linac 的出现改变了局面——它把 MRI 线圈装进直线加速器机架,医生可以在照射的同时用 cine-MRI 实时观察肿瘤位置。理论上,下一步自然是让射线"追着肿瘤打"(multi-leaf collimator tracking, MLC 追踪:多叶准直器叶片实时变形跟随肿瘤投影),这能把剂量适形度拉满、把每次治疗时间缩短。但 MLC 追踪有个卡脖子环节:系统必须在每一帧 cine-MRI 上实时、准确、稳健地分割出肿瘤——帧率 1-8 Hz 意味着每 125-1000 毫秒就要交付一帧掩码,误差直接换算成照射位置偏差。

这个环节恰恰是临床软件的短板。目前可用的临床方案依赖传统形变图像配准(deformable image registration, DIR)或模板匹配:从一帧已标注的帧出发,把轮廓传播到后续帧。它们在大幅非刚性运动、器官形变、图像对比度变化面前表现脆弱,也因此 MLC 追踪至今没有在 MRI-linac 上常规开展,临床上普遍停留在 gating 模式。AI 方法把计算成本前移到训练阶段、推理时近乎瞬时,是突破这层瓶颈的最有希望路径——但 AI 需要训练数据,而 MRI-linac 的 cine-MRI 数据分散在六七个早期采用者的机构里,从未有人把它们汇到一起。TrackRAD2025 解决的就是这个"数据孤岛 + 无统一评测"的双重缺位:首个公开的多机构 cine-MRI 追踪数据集 + 首个统一评测平台,让全世界的方法在同一把尺子下比出高下。

对数据集工程师而言,TrackRAD2025 还有一个值得品味的结构设计:它把"未标注数据"和"标注数据"当成两条腿。477 例未标注数据(280 万+ 帧)体量巨大(约 200 GiB),但没有任何人工标签——组织方的意图明确:这是给自监督预训练、无监督配准、伪标签等"数据效率"方法留的跑道;挑战赛的赛前宣传里也明示鼓励利用未标注数据。108 例标注数据则构成基准本身。最终赛果也证明了这种设计的意义:冠军 Track’n’Treat 用半监督(MedSAM2 在小标注集上微调),季军 felixknispelrwth 干脆零样本(CoTracker3 直接用自然视频预训练权重),两者路径截然不同却都站上领奖台——说明这个基准既奖励"会用大数据的",也奖励"会不依赖标注的"。

§0 读法三则:

  1. 这个条目是"数据集 + 挑战赛 + 方法论文集"三合一:本体是 585 例 cine-MRI,评测协议是六指标综合排名,衍生品是一批 MICCAI 2025 论文集方法论文——三者引用时注意区分(数据集引 Med Phys,赛果引 Med Image Anal 2026 报告)。
  2. 全文统计数字均出自官网 data 页、arXiv:2503.19119(=Med Phys 2025;52(7):e17964)与官方 GitHub 三处互证;各处口径漂移(500 vs 477、2.5M vs 2.8M 帧)已在 §10 避坑清单存照。
  3. 检索时勿把 Zenodo DOI 10.5281/zenodo.15044965 当数据下载入口——那个记录里只有一个 123 KB 的描述 PDF,数据本体在 HuggingFace(坑 2)。

0.4 条目边界:本条目不覆盖什么

为防检索者带着错误预期深读,明确四条边界:

  1. 不是放疗计划数据集:无 CT 定位像、无剂量分布、无 DVH——它只有治疗中的 cine 流与追踪标注;剂量学仅在评测指标层面以仿真形式出现。
  2. 不是诊断数据集:无病理/诊断标签、无分期、无结局——不做肿瘤检测或预后建模。
  3. 不是纵向队列:同一患者的多次扫描存在(未标注例),但无跨分次的纵向追踪标注——不做治疗响应分析。
  4. 评测口径随赛果冻结:post-challenge 榜单的新提交成绩不进本条目数字体系(仅描述其存在);条目统计以挑战赛报告定版口径为准。

这四条边界同时是该数据集留白清单的反面——需要这些维度的读者,附录 J 已给出相邻基准的入口。

§1 数据集速览:十问十答

Q1:TrackRAD2025 的"585 例"怎么构成?
477 例未标注 + 108 例逐帧手工标注 = 585 例(数据集论文口径)。全部为放疗疗程中采集的矢状位 2D cine-MRI 时间序列。公开训练集 527 例(477 未标注 + 50 标注),私有测试 58 例标注(预测试 8 + 最终测试 50)。

Q2:数据是什么模态、什么规格?
矢状位(sagittal)2D cine-MRI:在同一解剖层面连续采集的时间序列图像,存储为 .mha 体数据(W×H×T)。帧率 1-8 Hz(多数约 1.65-4 Hz),每例附带 JSON 元数据记录场强(0.35 或 1.5)、帧率与扫描区域(thorax/abdomen/pelvis)。面内分辨率各中心不一,论文未统一给单一数值——使用时直接读 .mha 头信息。

Q3:在什么机器上采集的?
两种商用 MRI-linac:0.35T ViewRay MRIdian(低场)与 1.5T Elekta Unity(高场)。低场图像信噪比与对比度特征和高场差异显著,跨厂商泛化是本基准的核心难点之一。

Q4:谁提供了数据?
六个国际中心:荷兰 3 家(UMC Utrecht、Catharina Ziekenhuis、Amsterdam UMC)、德国 1 家(LMU 大学医院)、澳大利亚 1 家(GenesisCare Sydney/University of Sydney)、中国 1 家(四川省癌症医院,成都)。数据全部在真实放疗疗程中采集,去标识化后汇集。

Q5:标注怎么做的?
标注例每帧手工分割追踪目标(通常是肿瘤,也可为追踪替代物)。每例附首帧模板掩码(first_label)与逐帧掩码(labels);部分病例有多名观察者的独立标注(约 8000 帧),可用于观察者间变异研究。

Q6:任务具体是什么?
给定首帧一个模板肿瘤分割 + 整段 cine-MRI 序列(外加帧率、场强、扫描区域元数据),算法须在每一帧输出肿瘤分割掩码。形式上就是视频目标分割(VOS)在 cine-MRI 上的特化——但评测指标与实时约束都是放疗特制的。

Q7:怎么评测?
六项指标综合排名:Dice 相似系数(DSC)、95% 表面距离(SD95)、平均表面距离(SDavg)、2D 质心误差(CD)、模拟 MLC 追踪下的剂量学精度(Rel. D98)、推理速度。单看 DSC 会误判名次——冠军的 DSC 第一但剂量学指标第四,综合权重才定胜负。

Q8:我现在能拿到什么?
HuggingFace LMUK-RADONC-PHYS-RES/TrackRAD2025 四个子树直下:标注训练(~3 GiB)、未标注训练(~200 GiB)、标注测试(~3 GiB)、预测试(<1 GiB)。CC-BY-NC 许可。官方 GitHub 另有 baseline、评测代码、本地测试脚本与厂商格式转换脚本(MIT 风格许可)。

Q9:挑战赛结果如何?
Top 5:Track’n’Treat(冠军,MedSAM2 半监督微调,DSC 0.8909)、Hkini、felixknispelrwth(季军,零样本 CoTracker3)、CIT、Reg’n’Track。前五名 DSC 差距仅 0.01-0.02,竞争极激烈;完整分析与终榜见挑战赛报告(Med Image Anal 2026;112:104134)。

Q10:为什么它对 AI-Ready 重要?
它是"多机构真实临床数据 + 未标注/标注双轨 + 领域特化评测"的完整范式样本:未标注 200 GiB 支撑预训练研究,标注子集支撑追踪评测,剂量学指标把 AI 误差翻译成临床语言。对研究"数据效率、域泛化、实时约束下模型选型"的团队,这是一份罕见的现成试验场。

§2 数据构成与规格

2.1 规模与划分:585 例的账本

TrackRAD2025 的总账本按数据集论文(arXiv:2503.19119 / Med Phys 2025;52(7):e17964)口径如下:

子集 例数 标注 可得性 体积(GitHub 口径)
未标注训练集 477 无 公开(HuggingFace) ~200 GiB
标注训练集 50 逐帧手工 公开(HuggingFace) ~3 GiB
预测试集(preliminary/validation) 8 逐帧手工 赛期私有;赛后公开(<1 GiB) <1 GiB
最终测试集(final testing) 50 逐帧手工 赛期私有;赛后部分公开(部分病例因隐私永不公开) ~3 GiB
合计 585 108 标注 + 477 未标注 — ~206 GiB 公开

三个读表要点:

  1. 标注比约 1:4.4(108/585 = 18.5%),但真正可用于监督训练的公开标注只有 50 例——这正是冠军方案选择"预训练基础模型 + 小样本微调"路线的直接原因。
  2. 测试集的私有化是暂时的:组织方承诺"挑战赛闭幕后几年内"把测试数据上传到训练数据同处,GitHub README 确认赛后已部分公开,但有明确提示"Some cases of the testing dataset were not made public due to privacy restrictions"——即 58 例测试并非全部可复得,赛后公开标注数据的可用口径为 n=88 例、4 中心、7932 帧(2026 年 DGMP 会议摘要口径:50 训练标注 + 38 例公开测试标注),使用者应以 88 例而非 108 例规划可复现实验。
  3. 未标注数据可以"多次扫描":同一未标注患者可有 2-3 次不同日期/不同区域的扫描(frames2.mha、frames3.mha 及配套 JSON),因此"477 例"是患者数而实际序列数更多——统计帧量时按序列计而非按患者计。

帧量口径:官网 data 页写"超过 280 万未标注矢状位 cine-MRI 帧 + 超过 1 万标注帧(另有约 8000 帧多观察者标注)“。这是定稿口径;早期宣传材料(如 BZKF 新闻)写"250 万帧/500 例未标注”,属于数据收集收尾期的旧数字,以 280 万/477 例为准(坑 3)。

2.2 六个国际中心:一次罕见的多机构汇集

国家 中心 角色(论文作者网络对应)
荷兰 UMC Utrecht(乌得勒支大学医学中心) 数据中心 + 组织方(Maspero、Borman、Intven)
荷兰 Catharina Ziekenhuis(埃因霍温卡特里娜医院) 数据中心 + 组织方(Hurkmans、Tijssen、Cobussen)
荷兰 Amsterdam UMC(阿姆斯特丹大学医学中心) 数据中心(Palacios、Finazzi、Haasbeek、Tetar)
德国 LMU University Hospital(慕尼黑大学医院) 牵头组织 + 数据中心(Landry、Kurz、Lombardo、Thummerer、Blöcker)
澳大利亚 GenesisCare Sydney / University of Sydney 数据中心 + 组织方(Keall、Jameson、Byrne)
中国 四川省癌症医院(成都) 数据中心(Wang Yiling、Fan Yu、Zhao Yue)

这张表背后是三件不常同时发生的事。第一,跨厂商:荷兰、德国、澳大利亚中心同时使用 ViewRay MRIdian(0.35T)与 Elekta Unity(1.5T)两种设备,中国中心亦然——同一基准内天然含有两种场强的域偏移。第二,真实疗程采集:数据不是专门为研究额外扫描的,而是患者做 MRI 引导放疗时机器顺手记录的 cine 流,因此它携带真实治疗中的全部"噪声"(不同摆位、不同解剖层面选择、不同序列参数)。第三,伦理合规的统一化:六家机构的伦理/IRB 流程各不相同,最终能汇成公开 CC-BY-NC 数据集,是项目自 2022 年 ESTRO Physics Workshop 启动后三年多协调的结果(GitHub 时间线与 BZKF 报道互证)。

对使用者的含义:任何跨中心的性能结论都要先问"这个模型在哪个中心的数据上训练"。挑战赛报告的事后分析(含全部参赛队伍的跨站点稳健性评估)是做这类分析的第一参考。

2.3 两种 MRI-linac:0.35T 与 1.5T 不是"同一台机器的两个档位"

属性 ViewRay MRIdian Elekta Unity
场强 0.35T(低场) 1.5T(高场)
成像特点 信噪比较低但MRI 可见性对腹部常足够;cine 序列灵活 高分辨率高信噪比;B0 均匀性好
c专注场景 每日出图像引导 + 实时 cine 追踪(本数据集来源之一) 每次治疗 MRI 引导 + cine 追踪
数据中的意义 域 A 域 B(跨域泛化的另一半)

写在数据集层面,这意味着:一个在 1.5T Unity 数据上训练的模型,直接搬到 0.35T MRIdian 数据上会遭遇对比度、噪声、几何形变的多重分布差。参赛队伍普遍报告跨场强是最大泛化障碍之一(BreizhTrack 事后分析:训练标注集 Dice 0.91+,隐藏测试跌至 0.879,部分归因于跨域分布偏移)。评测平台按例提供 field-strength.json,算法接口签名里也有 magnetic_field_strength 参数——官方设计鼓励"按场强自适应"的方法,而不是假装差异不存在。

2.4 数据结构与格式:一个目录读懂全部

每例患者一个目录,官方示例(GitHub README 原样):

dataset/
|-- D_001/                       -> 标注患者
|   |-- field-strength.json      -> 0.35
|   |-- frame-rate.json          -> 4.0
|   |-- scanned-region.json      -> "thorax"
|   |-- images/
|   |   `-- D_001_frames.mha
|   `-- targets/
|       |-- D_001_first_label.mha
|       `-- D_001_labels.mha
|-- F_002/                       -> 未标注患者(多次扫描)
|   |-- field-strength.json      -> 1.5(该患者所有扫描相同)
|   |-- frame-rate.json          -> 1.65(第一次扫描帧率)
|   |-- frame-rate2.json         -> 1.3(第二次扫描帧率)
|   |-- frame-rate3.json         -> 1.65(第三次扫描帧率)
|   |-- scanned-region.json      -> "abdomen"
|   |-- scanned-region2.json     -> "pelvis"
|   |-- scanned-region3.json     -> "abdomen"
|   `-- images/
|       |-- F_002_frames.mha
|       |-- F_002_frames2.mha
|       `-- F_002_frames3.mha

字段速查:

文件/对象 类型 语义
*_frames.mha MHA 体数据(W×H×T) 矢状位 cine-MRI 帧序列
field-strength.json 数值 磁场强度(0.35 或 1.5,单位 T)
frame-rate.json(可带 2/3 后缀) 数值 帧率(Hz);未标注患者多次扫描时按序号展开
scanned-region.json(可带后缀) 字符串 解剖区域:thorax / abdomen / pelvis
*_first_label.mha MHA 掩码 首帧模板肿瘤分割(算法唯一"先验")
*_labels.mha(可多份) MHA 掩码 逐帧人工标注;多观察者时以文件区分

三处工程细节值得注意:

  1. JSON 是标量而非表格:field-strength.json 里就是一个数字,scanned-region.json 里就是一个字符串。用 json.load 读单值即可,别当字典遍历。
  2. HuggingFace 仓库按四个前缀分片:trackrad2025_labeled_training_data/、trackrad2025_unlabeled_training_data/、trackrad2025_labeled_testing_data/、trackrad2025_labeled_pre-testing_data/——用 snapshot_download 的 allow_patterns 参数按需拉取,避免一次下载 200 GiB。
  3. 官方提示"目录结构与提交接口不一一对应":提交时的算法接口是 (frames, target, frame_rate, magnetic_field_strength, scanned_region) 五元组(§3.2),本地目录里 JSON 文件要在推理封装里读出来再喂给接口——官方 test-algorithm.sh 与 example 案例 Z_001 演示了这条转换链。

2.5 标注协议:首帧模板 + 逐帧掩码 + 多观察者

TrackRAD2025 的标注目标在官方文档中表述为"irradiation targets or tracking surrogates"(照射靶区或追踪替代物)——大多数情况下是肿瘤本身,个别病例可能是替代结构。协议三要素:

  • 首帧模板(first_label):算法运行时唯一给定的"答案提示",模拟临床工作流(医生在起点帧勾画一次)。
  • 逐帧掩码(labels):所有 108 例标注患者都有每个时间帧的手工分割,构成评测 ground truth。
  • 多观察者子集(约 8000 帧):部分病例由多名观察者独立标注,掩码以多份文件并存。这批数据的价值超出主竞赛:可量化"追踪任务里观察者间变异有多大",为"Dice 多高才算 clinically acceptable"提供标定基线——组织方在评测指标里保留这一层的用意即在于此。

与常见分割数据集"逐例独立掩码"不同,这里的标注在时间上是连续链条:帧间目标连续形变,标注者须保持时序一致性。这也是为什么把该任务称作"tracking"而非"frame-wise segmentation"——评测指标(质心误差、剂量学)对时序抖动敏感,逐帧独立预测即便每帧 Dice 不低也可能在时序上抖动而扣分。

2.6 解剖与运动:为什么是胸、腹、盆

官方选择 thorax/abdomen/pelvis 三区的理由有二:受呼吸运动影响最直接;是 MRI-linac 临床上最常治疗的部位。DGMP 2026 对公开标注数据的统计给出分布口径:腹部约 41%、胸部约 32%、盆腔约 27%(n=88、7932 帧)。三个区的运动学特征差异明显:肺与肝脏随呼吸大幅往复,胰腺与腹膜后器官混入非刚性形变,盆腔位移小但受充盈器官影响——一个在盆腔上很稳的模型到了胸部可能完全跟不上,这也是评测把解剖区域作为元数据暴露给算法的原因之一(scanned-region 参数进接口签名)。

2.7 横向对比:cine-MRI 追踪基准的空缺与填补

数据集 模态 规模 标注 多中心 任务定位
TrackRAD2025 矢状位 2D cine-MRI(MRI-linac) 585 例 / 280 万+ 帧 108 例逐帧(含多观察者) 6 中心 2 厂商 实时肿瘤追踪(VOS 式)
fastMRI(库内 #23) MRI 原始 k 空间 数千例 无需(重建任务) 单源(NYU 等) MRI 重建
4D-CT 呼吸运动数据(多家机构) 4D-CT 单中心居多 隐式(相位) 少 呼吸运动建模
医学 VOS 视频(超声/内镜等) 2D 视频 各异 逐帧或稀疏 少 通用视频分割

横向看,TrackRAD2025 填的空缺非常具体:放疗床上的实时 MRI 视频流这一子领域此前没有公开基准——既有的 MRI 公开数据集(fastMRI 重建、脑/乳腺结构 MRI 分类分割)都不覆盖"治疗中连续成像 + 实时约束 + 剂量学评价"三要素。这也是它能聚起一支横跨三大洲组织者队伍的原因:不解决数据问题,MLC 追踪的临床转化就永远停在论文阶段。

2.8 数据质量与使用注意

  • 面内分辨率与矩阵尺寸不统一:各中心序列参数不同,官方未给统一规格表;批处理前先逐例读 .mha 头。挑战赛评测在几何指标上做空间校准,但自建实验要自己处理重采样。
  • 帧率跨度大(约 1.3-8 Hz):时序模型的采样假设要显式参数化,接口签名里的 frame_rate 就是为此设计——别忽略它。
  • 未标注数据的"多扫描"结构:同一患者 2-3 次扫描意味着按患者划分训练/验证可防数据泄漏;按序列随机划分会高估泛化。
  • 第一版数据的已知边界:官网明示评测接口与目录结构非一一对应;b-field-strength.json(example 案例命名)与 field-strength.json(数据集命名)在早期版本中并存过——以官方 GitHub 最新 README 为准(坑 6)。

2.9 五例画像:拿到数据后第一小时该看什么

假设你刚把标注训练子树拉到本地,第一小时的高效动作是把"抽象规格"落到"具体帧上"。以下五个观察点构成一份事实上的数据体检单:

画像一:场强与中心的对应关系。遍历所有 field-strength.json,统计 0.35 与 1.5 的分布。你会立刻看到两个厂商子集的体量并不平衡——这个分布决定你做跨场强实验时的分层抽样方案。注意:场强与中心并非一一映射(多中心同时持有两款设备),所以分层维度至少是"场强 × 区域"二维,而不是"中心"一维。

画像二:帧率谱。把所有 frame-rate.json 画成直方图。主峰大约落在 1.65-4 Hz,长尾延伸到 8 Hz。两个下游影响:时序模型的窗口长度要么按帧率归一(时间窗固定、帧数浮动),要么按帧数固定(时间窗浮动)——这个选择必须写进实验配置,否则跨帧率子集的结果不可比。

画像三:区域占比。scanned-region.json 的 thorax/abdomen/pelvis 三分。公开标注子集的口径约 32%/41%/27%(DGMP 2026),你的本地分布应大体吻合;若偏差大,先怀疑下载不完整。

画像四:序列长度。读每个 *_frames.mha 的 T 维。cine 序列长度不统一——训练时 padding/裁剪策略在这里定型。一个实用基准:按 T 的中位数定窗口、按 P95 定上限(截断长序列时保留呼吸相位完整性比保留总长更重要)。

画像五:标注的多观察者分布。统计 targets/ 下出现多份 *_labels.mha 的病例数与帧数。这批多观察者数据约 8000 帧,是标定"Dice 天花板"(人类一致性)的唯一素材——建议在首次实验报告里就给出"模型 DSC vs 观察者间 DSC"的对照位,这是一切后续改进的锚点。

体检单跑完后,你手上会有四张分布图与两个设计决策(时间窗策略、分层抽样方案)。TrackRAD2025 的元数据设计(§9.5)保证了这一切只需要遍历一遍小 JSON 文件——不用碰任何一个 200 GiB 的 .mha。

2.10 伦理与合规注记

六中心临床数据的公开化背后是一条完整的合规链,使用者了解它有助于理解数据的边界从何而来:

  • 采集场景:全部数据在常规放疗疗程中采集(cine-MRI 本来就是治疗流程的一部分),不因研究目的增加额外扫描——这意味着数据的伦理基础是"诊疗数据二次利用",各中心按本国规范取得同意或豁免。
  • 去标识化:官网 data 页与论文均确认数据经去标识化处理;图像本身为矢状面局部扫描,面部等可识别结构通常不在视野内——但使用者仍应避免把未发表的病例图像直接用于对外宣传材料。
  • 隐私保留项:部分最终测试病例因隐私限制赛后不公开(§4.4)——这是六家机构伦理协议的交集结果,不是技术问题。
  • 许可传导:CC-BY-NC 的"非商业"限定源于哪些中心的哪些协议未公开披露;这也意味着组织方无法单方面"升级"许可为 CC-BY——任何商业合作都需回到六中心逐一解决。对以此数据训练模型的产品团队,这是立项前就要评估的结构性约束。
  • 患者视角:数据的公开价值(推动 MLC 追踪临床化、缩短治疗时间)与患者贡献一致——这也是组织方在论文 Potential Applications 节的叙事框架。

§3 任务设定与评测协议

3.1 任务定义:从"分割"到"追踪"的重构

官方表述:“The objective of TrackRAD2025 will be real-time tumor tracking on time-resolved sagittal 2D cine-MRI sequences. Algorithms will be provided with a template tumor segmentation on the first frame, and the remaining 2D cine-MRI sequence requiring real-time segmentation.”

拆开看,这个任务定义有四个刻意的设计决策:

  1. 只给首帧模板,不给历史真值。算法拿到的先验只有第一帧的人工掩码,此后每帧都要自己推断。这与临床流程同构(医生只勾一次),也与视频目标分割(VOS)任务范式同构——但 VOS 社区的常用技巧(离线精调、多次回溯)在这里被实时约束卡死。
  2. 输出是每帧二值掩码,不是关键点或包围盒。因为下游用途是剂量计算与 MLC 叶片控制,需要的是形状完整的靶区投影。
  3. 元数据显式入参。帧率、场强、扫描区域直接进函数签名——组织方明确鼓励"条件化"方法:一个聪明的模型应该知道自己在 0.35T 盆腔 4 Hz 的序列上运行。
  4. "实时"被量化成硬指标:单帧推理 ≤1 秒(另有模型加载与数据加载的独立计时项),评测机是 NVIDIA A10G(24 GiB VRAM)。推理速度本身是六项评测指标之一。

对方法设计的直接推论:任何"离线优化 + 逐帧精修"的重型管线都要重新掂量;而轻量传播类方法(配准、光流)与"记忆机制 + 单次前向"的时序模型天然适配这个任务结构。

3.2 提交接口与 baseline

官方仓库 baseline-algorithm/model.py 的接口签名(原样):

def run_algorithm(frames: np.ndarray,
    target: np.ndarray,
    frame_rate: float,
    magnetic_field_strength: float,
    scanned_region: str) -> np.ndarray:
    """
    Args:
    - frames (numpy.ndarray): A 3D numpy array of shape (W, H, T) containing the MRI linac series.
    - target (numpy.ndarray): A 2D numpy array of shape (W, H, 1) containing the MRI linac target.
    - frame_rate (float): The frame rate of the MRI linac series.
    - magnetic_field_strength (float): The magnetic field strength of the MRI linac series.
    - scanned_region (str): The scanned region of the MRI linac series.
    """
    # For the example we want to repeat the initial segmentation for every frame
    repeated_target = np.repeat(target, frames.shape[2], axis=-1)
    return repeated_target

官方 baseline 的行为极其朴素——把首帧模板复制到每一帧。这不是敷衍,而是精心选择的下界:它假设"肿瘤不动",任何认真建模运动的方法都应显著超过它。同时它也是一条完整的接入门:输入输出格式、Docker 打包、test-algorithm.sh 本地评测链路全部就绪,参赛者只需替换函数体。

本地验证链路:sh test-algorithm.sh 会用合成示例案例(Z_001)编译、执行并评测算法,要求 unix 环境 + Docker(Windows 走 WSL)。

3.3 六项评测指标详解

指标 简写 方向 衡量什么 为什么重要
Dice 相似系数 DSC ↑ 掩码与真值的体积重叠 分割质量的基本盘
95% 表面距离 SD95(95th percentile of surface distance) ↓(mm) 边界误差的尾部行为 对"偶发大面积跑偏"敏感——放疗最怕尾事件
平均表面距离 SDavg ↓(mm) 边界误差的整体水平 对称、对掩码拓扑鲁棒
2D 质心误差 CD(Euclidean 2D center-of-mass error) ↓(mm) 目标位置的偏差 射束跟随直接用的是位置,不是形状
模拟 MLC 追踪剂量学精度 Rel. D98 ↑ 按预测掩码做模拟 MLC 追踪照射时,D98 剂量相对理想计划的保真度 把分割误差翻译成"剂量打偏多少"——临床语言
推理速度 — ↓(时间) 单帧推理耗时 实时约束的硬门槛

其中第五项是本基准最有辨识度的设计:评测平台把每支队伍的预测掩码喂进模拟的 MLC 追踪流程,计算"如果真的按这个分割去实时移动叶片,靶区 D98(98% 体积接受的剂量)相对理想值会打几折"。这一步把几何误差、时序抖动、形状崩坏全部折算成剂量学后果——一个 DSC 很高但偶尔在呼吸末端丢失目标的模型,会在 Rel. D98 上现出原形。

3.4 排名机制:为什么"单看 Dice"会误判

终榜实证(最终测试集,挑战赛报告口径):

名次 队伍 DSC(单项名次) CD mm Rel. D98(单项名次) SD95 mm SDavg mm
1 Track’n’Treat 0.8909(1) 1.4733 0.9361(4) 4.2171 1.6642
2 Hkini 0.8860(2) 1.4858 0.9628(1) 4.4969 1.8565
3 felixknispelrwth 0.8764(5) 1.6576 0.9250(7) 4.5409 1.9174
4 CIT 0.8712(6) 1.9564 0.9392(2) 5.2583 2.1903
5 Reg’n’Track 0.8801(3) 2.1031 0.9321(5) 5.6407 2.2416

读表:第 4 名 CIT 的 DSC(0.8712)低于第 5 名 Reg’n’Track(0.8801)——多指标综合排名下名次与单指标名次可以倒挂。亚军 Hkini 的 Rel. D98(0.9628)全场第一。含义:想在这类基准上做方法改进,六项指标要一起看;只优化 Dice 的策略天花板明显。

(第六名 BreizhTrack 的 DSC 0.8794 高于第 4、5 名之外的多数队伍却无缘前五——再次说明综合排名的权重设计里剂量学与距离指标占实权。数字出处:BreizhTrack 团队论文 arXiv:2510.25990 Table 5,与官方榜单互证。)

3.5 运行约束与提交规则

  • 硬件:评测统一跑在 NVIDIA A10G Tensor Core GPU(24 GiB VRAM)上,提交者须在平台"Job required gpu type"里显式选择该机型以保证计时一致。
  • 时间:单例(单患者)推理不得超过 1 秒/帧,另计模型加载与数据加载时间(有独立预算)。超时判罚。
  • 方法:仅允许全自动方法(fully automatic),禁止人工在环。
  • 队伍:每队 ≤5 人、每队一个账号;多账号提交即取消资格。
  • 外部数据/预训练权重:允许使用公开数据与公开预训练模型,但必须在挑战赛开始(2025-03-15)之前已公开;私有数据或 3 月 15 日后才公开的权重一律禁止;使用情况须在方法描述中申报。
  • 开源义务:前五名队伍须在获奖公布后 14 天内公开代码(冠军 Track’n’Treat 的开源实现即 DIAGNijmegen/TrackRAD25_submission)。
  • 发表义务:获奖队须赴 MICCAI 2025 现场展示、提交 LNCS 格式方法论文与算法信息表,并在后续发表中引用挑战赛报告与数据集论文。

3.6 评测平台的两阶段设计

预测试阶段(2025-06-01 至 08-15,每队 10 次提交)用 8 例私有样例给队伍校准方法与元信息;最终测试阶段(07-16 至 08-15,每队 2 次提交)用 50 例定名次。赛后组织方重开预测试通道(每月 10 次、日志公开),最终测试数据滚入 post-challenge 开放榜单。这个"8 例校准 + 50 例决赛"的结构是对过拟合测试集的直接防御——每队只有 2 次决赛提交,把"刷测试集"的空间压到最小。

3.7 指标复现指南:从 .mha 到六指标报表的最短链路

想在本地复现官方指标(而不依赖线上平台),官方 evaluation/ 目录提供了紧凑实现,链路如下:

  1. 准备预测输出:你的算法按 §3.2 接口对每例输出 (W, H, T) 的二值掩码,保存格式与目录层级对齐标注数据(images/ 与 targets/ 平行)。
  2. 对齐与二值化:预测掩码与真值在同一网格上(无需重采样);阈值化到 {0,1}。浮点概率图直接取 0.5 阈值——官方评测不接受软掩码。
  3. 几何三件套:DSC、SD95、SDavg 由 evaluation/ 中的表面距离实现计算(基于 scipy/skimage 的距离变换,官方实现特意做了向量化以保证在评测时限内跑完 58 例 × 每例数百帧)。
  4. 质心误差:逐帧取掩码质心(一阶矩/面积),与真值质心做 2D 欧氏距离,全序列汇总(官方口径见 metrics 页)。
  5. 剂量学仿真:这一步依赖放疗物理栈——按预测掩码生成 MLC 叶片序列、用计划剂量分布做照射模拟、计算 D98 相对偏差。平台版已内置;本地复现需自建(这也是多数团队选择线上提交而非本地全复现的原因)。
  6. 速度计时:模型加载与数据加载分开计时,推理段按帧均摊。注意平台计时含 Docker 容器开销——本地裸机数字会偏乐观,对标排名时留余量。

实践建议:先把几何四指标(DSC/SD95/SDavg/CD)在本地跑通并与 BreizhTrack 论文 Table 5 的公开数字对表(该文给了各队终榜全部指标值),对上之后再决定是否值得自建剂量仿真——对多数算法迭代场景,几何四指标 + 平台提交验证剂量学的分工效率最高。

§4 获取与许可:三层异构的门怎么进

4.1 资产清单与入口

资产 位置 许可 备注
数据本体(四子树) HuggingFace LMUK-RADONC-PHYS-RES/TrackRAD2025 CC-BY-NC HF DOI 10.57967/hf/4539;引用条目 “TrackRAD2025 (Revision 505ec64)”
描述文档 PDF(Structured description) Zenodo record 15044966(concept DOI 10.5281/zenodo.15044965) 元数据 cc-by-4.0(仅此 PDF) 123,176 bytes;不是数据
官方代码(baseline/评测/格式转换/结果) GitHub LMUK-RADONC-PHYS-RES/trackrad2025 MIT 风格(“Copyright 2025 The TrackRAD2025 organizers”) 含评测代码、本地测试脚本、两家厂商专有格式转换脚本、原始挑战赛结果与分析脚本
冠军实现 GitHub DIAGNijmegen/TrackRAD25_submission 随仓库 MedSAM2 半监督微调,官方 README 点名
挑战赛官网全站内容 官方仓库 trackrad2025.grand-challenge.org/ 子目录镜像 — 网站/规则/指标页全文存档

4.2 HuggingFace 下载实操

官方推荐的按需拉取方式(GitHub README 原样):

from huggingface_hub import snapshot_download

# 标注训练集(约 3 GiB):监督训练或评测
snapshot_download(repo_id="LMUK-RADONC-PHYS-RES/TrackRAD2025", repo_type="dataset",
    local_dir="./dataset/", allow_patterns="trackrad2025_labeled_training_data/*")

# 未标注训练集(很大,约 200 GiB):无监督/自监督学习
snapshot_download(repo_id="LMUK-RADONC-PHYS-RES/TrackRAD2025", repo_type="dataset",
    local_dir="./dataset/", allow_patterns="trackrad2025_unlabeled_training_data/*")

# 标注测试集(约 3 GiB,赛后公开;部分病例缺失)
snapshot_download(repo_id="LMUK-RADONC-PHYS-RES/TrackRAD2025", repo_type="dataset",
    local_dir="./dataset/", allow_patterns="trackrad2025_labeled_testing_data/*")

# 预测试/预赛阶段数据(< 1 GiB)
snapshot_download(repo_id="LMUK-RADONC-PHYS-RES/TrackRAD2025", repo_type="dataset",
    local_dir="./dataset/", allow_patterns="trackrad2025_labeled_pre-testing_data/*")

网络受限环境可把 repo_id 端点换到 hf-mirror.com 镜像域名;allow_patterns 务必带上——不带的话 snapshot_download 会从未标注子树开始全量下载。国内带宽下建议先拉标注子树(约 3 GiB)跑通管线,再决定是否要 200 GiB 的预训练粮仓。

带宽与存储规划参考(按官方体积口径换算):

场景 下载量 时间估算(参考) 磁盘预留
仅跑通管线(标注训练 + 预测试 + example) ~4 GiB 数分钟至半小时 10 GiB
全标注(含赛后测试子树) ~7 GiB 半小时内 15 GiB
加未标注粮仓(自监督研究) ~206 GiB 数小时(千兆带宽)至数日(百兆带宽) 300 GiB(含解压冗余)

三条省带宽技巧:① allow_patterns 精确到子树前缀;② 未标注子树可按患者首字母分批拉取(F_0* → F_1*);③ 用 local_dir 直落数据盘,避免"下载到系统盘再搬运"的双重 I/O。

4.3 许可双口径的来龙去脉(本条目最重要的坑)

三种文本同时存在于官方渠道:

  1. HuggingFace 数据卡与官网 data 页:“Data is released under CC-BY-NC (Attribution-NonCommercial).” ——这是对数据本体的有效口径:可自由分享与改编,须署名,不得商用。
  2. Zenodo record 15044966 元数据:license: cc-by-4.0。但该记录的文件列表里只有一个 123 KB 的描述 PDF——这个 cc-by-4.0 只覆盖那份 PDF 文档。Zenodo 记录存在的意义是给数据集一个可引用的概念 DOI(10.5281/zenodo.15044965),不是数据分发。
  3. GitHub 仓库 LICENSE:MIT 风格全文(允许使用/复制/修改/合并/发布/分发/再许可/销售),且明确声明"All other materials made available in the context of the TrackRAD2025 competition may be licensed under different terms"——MIT 只管仓库里的代码。

自动化抽取系统若从 Zenodo API 抓 license 字段,会把整个数据集误标为 CC-BY-4.0(可商用),与真实口径相反——非商业限制是商用落地前必须验证的合规红线(坑 2)。

4.4 post-challenge:现在还能"参赛"吗

能。官方 winners 公告与 GitHub README(2026-06 存档状态)确认:

  • 预测试阶段已重开:每月最多 10 次提交,日志公开;
  • 最终测试病例滚入 post-challenge 阶段,开放榜单持续运行(“as long as the computational budget allows”);
  • 排行榜的赛期成绩冻结存档,与 post-challenge 成绩分开呈现。

因此把 TrackRAD2025 当"持续在线的基准服务"使用是成立的:新方法可以直接提交评测拿官方指标,而不必本地复现全套六指标流水线——这对缺少放疗物理引擎(Rel. D98 模拟需要剂量计算)的团队是实质性的门槛降低。

4.5 引用清单(官方 bibtex 口径)

@misc{wang2025trackrad2025challengedatasetrealtime,
      title={TrackRAD2025 challenge dataset: Real-time tumor tracking for MRI-guided radiotherapy},
      author={Yiling Wang and Elia Lombardo and Adrian Thummerer and Tom Blöcker and others},
      year={2025}, eprint={2503.19119}, archivePrefix={arXiv}, primaryClass={physics.med-ph}}
      (正式版:Med. Phys. 2025;52(7):e17964, doi:10.1002/mp.17964)

@article{Blcker2026,
  title={MRIgRT real-time target tracking: TrackRAD2025 challenge report},
  volume={112}, pages={104134}, year={2026}, month={July},
  journal={Medical Image Analysis}, doi={10.1016/j.media.2026.104134}}

@misc{lmu_adaptive_radiation_therapy_lab_2025,
  author={{LMU Adaptive Radiation Therapy Lab}},
  title={TrackRAD2025 (Revision 505ec64)}, year={2025},
  url={https://huggingface.co/datasets/LMUK-RADONC-PHYS-RES/TrackRAD2025},
  doi={10.57967/hf/4539}, publisher={Hugging Face}}

使用数据引第三条,报告方法结果引前两条——官方 GitHub 明示"commit to citing the challenge report and data overview paper"是参赛与使用的义务条款。

4.6 网络受限环境的获取策略

对主站访问受限的环境(实测路径,2026-09):

  • HF 镜像:hf-mirror.com 提供同路径镜像,snapshot_download 支持 endpoint="https://hf-mirror.com" 参数;API 层(/api/datasets/...)同样可镜像,但注意对不存在仓库返回的是 “Invalid username or password.”(401 文本伪装 404),别误判为鉴权问题(坑 5)。
  • DOI 定门:doi.org/10.57967/hf/4539 重定向到 HF 页面,用于确认组织/仓库名;doi.org/10.5281/zenodo.15044965 到 Zenodo 概念页。
  • GitHub 加速:官方仓库无大文件(数据不在 GitHub),clone 无压力;若需镜像 README 中的 bibtex 与下载命令,直接引用仓库原文即可。
  • 分片下载纪律:先 list_repo_files(或树页)确认目标子树文件清单,再按 allow_patterns 拉取;200 GiB 级子集建议 max_workers 限速并配断点续传(snapshot_download 自带 resume)。
  • 校验:HF 不提供逐文件强校验清单,拉取后按 §附录 G 的统计画像自检(例数、帧量、区域占比)——统计对不上即有缺件。

§5 挑战赛全景:从数据发布到终榜

5.1 时间线全记录(官方 rules 页 + GitHub README 口径)

日期 事件
2024-12-15 挑战赛官网开放
2025-03-04 官方仓库提交两家厂商专有 cine-MRI 格式转换脚本
2025-03-15 训练数据发布(HuggingFace),挑战赛正式开始
2025-03-18 Zenodo 描述文档记录发布(v1,record 15044966)
2025-03 数据集论文预印本 arXiv:2503.19119 挂出
2025-05-04 ESTRO 2025(维也纳)上宣传挑战赛
2025-06-01 - 08-15 预测试阶段开放(每队 10 次提交,8 例私有样例)
2025-07-16 - 08-15 最终测试阶段(每队 2 次提交,50 例私有病例)
2025-08-15 测试阶段关闭
2025-09-01 算法信息表 + LNCS 方法描述论文截止
2025-09-09 官方公布终榜
2025-09-19 前五名代码公开截止(获奖条件)
2025-09-23 MICCAI 2025 workshop(韩国大田 DCC1-1F-103)冠军方法报告
2025-10-23/24 ESTRO Physics Workshop(图卢兹)赛后讨论
2025 数据集论文正式发表 Med. Phys. 52(7):e17964
2026-05-18 ESTRO 2026 展示挑战赛结果
2026-05/07 挑战赛报告出版 Med. Image Anal. 112:104134
持续 post-challenge 阶段:预测试通道每月 10 次提交,开放榜单运行

5.2 终榜与参赛生态

官方 winners 公告的 Top 5(终榜冻结口径):

名次 队伍 已知方法路线 开源状态
🥇 1 Track’n’Treat MedSAM2 半监督微调(DIAG Nijmegen,Radboud 大学医学中心背景团队) 已开源(获奖条件)
🥈 2 Hkini 未在参赛论文集公开细节(以挑战赛报告为准) 按获奖条件公开
🥉 3 felixknispelrwth 零样本 CoTracker3 点追踪(RWTH Aachen + Stanford,Knispel & Gatidis) 论文 LNCS 公开
4 CIT 以挑战赛报告为准 按获奖条件公开
5 Reg’n’Track 以挑战赛报告为准 按获奖条件公开
6 BreizhTrack SAM 2.1 b+ 微调(arXiv:2510.25990 公开完整自评) 论文公开

挑战赛报告(Med Image Anal 2026)的作者名单本身就是生态图:除 27 位组织者外,联合署名还包括各前五队伍成员(如 DIAG Nijmegen 的 Guo/Ni、RWTH/Stanford 的 Knispel/Gatidis、Hkini 相关的 Sentker/Boussot 等)——"Top 5 联署挑战赛报告"是官方公布的政策,保证了赛果分析的权威性。

5.3 冠军 Track’n’Treat:MedSAM2 的"半监督正确打开方式"

冠军方案(官方 README 原话:“The winning submission based on MedSAM2 can be found here”)由 Radboud 大学医学中心 DIAG(Diagnostic Image Analysis Group,Nijmegen)团队提交,开源仓库 DIAGNijmegen/TrackRAD25_submission。技术路线要点:

  1. 基础模型底座:MedSAM2(“segment anything in 3D medical images and videos”,arXiv:2504.03600)——把 SAM 系列的可提示分割扩展到医学视频,天然契合"首帧模板 + 序列传播"的任务结构。
  2. 半监督语义:团队代表方法报告题名 “Label-efficient semi-supervised cine-MRI tumor tracking using MedSAM2”(DGMP 2026 文献口径)——50 例公开标注不足以充分微调视频基础模型,未标注 477 例用于一致性正则/伪标签一类的半监督补充。
  3. 成绩:最终测试集 DSC 0.8909(第一)、CD 1.4733 mm(第一)、SD95 4.2171 mm(第一)、SDavg 1.6642 mm(第一);Rel. D98 0.9361 单项第四——几何指标全面领先,剂量学稍逊于亚军,综合仍稳居第一。
  4. 事后定位:DGMP 2026 报告称"the winning approach achieved a Dice of 0.891 on the private test set using a GPU-based MedSAM2 foundation model"——GPU 依赖与训练成本是该路线的代价面。

对实践者的启示:当任务给了"首帧模板",可提示视频分割模型(MedSAM2/SAM2 系)是最短路径;瓶颈从"模型会不会分割"转移到"小标注集怎么用好"——这正是数据集把 477 例未标注放在那里的用意。

5.4 季军 felixknispelrwth:零样本点追踪的降维打击

季军论文(Springer LNCS 论文集,doi:10.1007/978-3-032-35046-6_2)给出了一条与冠军完全正交的路线:

  • 重构任务:把"掩码追踪"拆解为"边界点追踪"——掩码轮廓采样为若干边界点,用 Meta 的 CoTracker3(自然视频上预训练的点追踪模型,arXiv:2410.11831)逐点跟踪,再用 find_contours + fillPoly 从追踪点重建掩码。
  • 零医学数据:不使用任何 cine-MRI 训练,不做微调——“off-the-shelf point tracking models trained on natural videos can transfer effectively to real-time tumor tracking”。
  • 成绩:最终测试集 DSC 0.8764(第三名综合),跨中心与跨数据集稳健性好。
  • 意义:证明通用视频基础模型对医学 cine 数据的迁移能力,挑战"医学任务必须医学数据"的直觉;也印证了任务接口设计(首帧模板)与点追踪范式的天然兼容。

5.5 第六名 BreizhTrack:一份难得的"全透明参赛复盘"

BreizhTrack(Boussot 等,arXiv:2510.25990)虽只排第六,其论文是公开渠道里信息密度最高的参赛复盘(完整终榜数字 + 消融),方法论样本价值高:

  • 两条路线对照:(i) IMPACT 相似度度量的无监督配准;(ii) SAM 2.1 b+(Hiera 骨干)以首帧掩码为提示做提示式分割 + 在 50 例小标注集上微调。最终选 SAM 路线(受 1 秒/帧约束影响)。
  • 训练配方:1024×1024 patches、batch size 1、Dice+IoU 平衡损失、全模块统一低学习率 0.0001、300 epochs 约 12 小时(RTX A6000 48GB)——单卡可复现的成本结构。
  • 诚实的数据点:训练/验证 Dice 0.91+,隐藏测试跌到 0.8794——“development data 与 evaluation cohort 存在分布偏移;在小公开标注子集上的表现不能预测对肿瘤外观、运动模式与采集协议变化的鲁棒性”。这是对全体使用者的直接警示。
  • 试错存照:test-time augmentation 因增益可忽略被弃用——实时约束下任何推理期开销都要精打细算。

5.6 方法谱系归类:六条路线一张表

路线 代表 训练数据需求 实时友好度 本赛表现
传统配准/模板匹配 临床现状(DIR) 无 极高 基线下方(大幅非刚性运动失效)
光流传播 DGMP 2026 DKA+Farneback(赛后) 无 极高(0.05 s/帧 CPU) 公开集 DSC 0.877,逼近冠军
可提示视频分割 + 微调 Track’n’Treat(MedSAM2)、BreizhTrack(SAM 2.1) 少量标注 + 基础模型预训练 中(GPU) 冠军 / 第六
半监督 + 基础模型 Track’n’Treat(未标注数据利用) 标注 + 未标注 中 冠军
零样本点追踪 felixknispelrwth(CoTracker3) 零医学标注 中 季军
记忆网络视频分割 XMem 参赛方案(arXiv:2509.18591) 未标注/自监督 中高 论文公开

赛后衍生(DGMP 2026,Betancourt Tarifa 等)补上了第七格:CPU-only 光流框架(动态关键帧锚定 DKA + Farneback)在公开标注数据上 DSC 0.877 / 0.05 s/帧,“与 GPU 冠军 0.891 相当”(公开集口径)——对没有 GPU 预算的放疗科室,可解释、免训练的光流路线重新变得有竞争力。这张表对"从零起步选型"的读者是最快入口。

5.7 参赛论文集与二次文献

  • Springer LNCS 论文集:“AI for Real-Time Tumor Tracking in MRI-Guided Radiotherapy and Trauma Procedure Understanding: TrackRAD2025 Challenge and Second Trauma Thompson Challenge”(MICCAI 2025 联合活动论文集,ISBN 978-3-032-35046-6)——季军论文即出自此卷。
  • arXiv 参赛/衍生论文散见:2509.18591(XMem)、2510.25990(BreizhTrack/SAM)等。
  • 挑战赛报告(Med Image Anal 2026;112:104134)是唯一覆盖全部参赛方法、跨站点分析与失败案例的权威文献——引用赛果时应以其为准,团队论文仅作方法细节补充。

5.8 终榜之外的信号:参赛生态四个观察

观察一:学术-临床混合队伍主导。从队伍命名与论文署名可辨:冠军 Track’n’Treat 来自 Radboud DIAG(医学影像 AI 组,grand-challenge 平台的运营方之一),季军来自 RWTH Aachen 医学物理背景(合作者含 Stanford),第六名 BreizhTrack 是法国团队——传统放疗物理中心(LMU/UTrecht 系)反而以组织者身份出现,形成"组织方出题、计算机视觉社区解题"的分工。这个生态位分布与 fastMRI(厂商+学界)、PANDA(病理 AI 社区)的挑战赛一脉相承。

观察二:基础模型路线的两极分化。同样是"SAM 家族 + 微调",冠军(MedSAM2)与第六名(SAM 2.1)结果相差 0.012 DSC 但名次差 5 位——差距主要在半监督数据利用与剂量学指标,不在底座模型。这说明 2025 年节点上,"选哪个基础模型"已不是胜负手,"怎么喂未标注数据"才是。

观察三:零样本路线的稳健性溢价。季军论文特别强调其方法"shows robust performance across held-out datasets and data acquisition sites"——不训练就不会过拟合训练域,在跨中心评测中天然占优。对临床部署方,这是一个比榜单名次更值得关注的性质:零样本方法的失败模式可预期(外推失败)而微调方法的失败模式难预期(分布外静默劣化)。

观察四:论文纪律对生态的塑造。"Top 5 须开源 + 须提交 LNCS 论文 + 须引用挑战赛报告"三件套让赛果在赛后 12 个月内完成了从榜单到文献的固化——对比一些只有榜单没有论文集的挑战赛(赛果随平台下线而失传),TrackRAD2025 的知识保存率显著更高。组织方在 GitHub 存档官网全文的举动同属这一策略。

5.9 参赛论文里可提取的超参数存照

以公开材料中信息最全的 BreizhTrack(arXiv:2510.25990)为例,一份"能对表他人实验"的最小超参集:

项 值 备注
底座 SAM 2.1 b+(Hiera 骨干) 提示式视频分割
提示 首帧标注切片的 mask-based prompt 与任务接口天然对齐
微调范围 全模块(prompt encoder + decoder + Hiera) 统一低学习率保留泛化
学习率 0.0001(uniform) 防止小标注集灾难遗忘
输入 1024×1024 patches 原生分辨率友好
batch size 1 显存约束下的常态
损失 Dice + IoU 平衡 掩码质量双约束
epochs 300(约 12 h,RTX A6000 48 GB) 单卡可复现
TTA 试过、弃用 增益可忽略 + 实时预算紧张
结果 隐藏测试 DSC 0.8794(总榜第 6) 与官方榜单互证

另一侧的对照锚点:季军 CoTracker3 方案完全零训练(推理期点↔掩码转换:find_contours + fillPoly),与上表构成"训练重 vs 零训练"两端。中间地带(光流、XMem)的超参多为推理期配置——三条路线的调参成本依次递减,是按算力预算选型的直接依据。

§6 技术与临床背景:为什么这个任务是"硬骨头"

6.1 MRI 引导放疗(MRgRT)与 MRI-linac 一页纸

  • 定义:MRI-linac = 磁共振成像机与医用直线加速器的混合系统,治疗时持续 MRI 成像。两款商用代表正是本数据集的两个来源:ViewRay MRIdian(0.35T,环形双翼磁体 + 钴源/直线加速器)与 Elekta Unity(1.5T,诊断级场强磁体 + 7 MV 直线加速器)。
  • 临床价值:软组织对比度远超 CBCT,可以每天(甚至每次射束)看到肿瘤与危及器官的真实位置与形变,支撑自适应放疗(adaptive radiotherapy)。
  • 综述锚:Keall PJ 等,“Integrated MRI-guided radiotherapy – opportunities and challenges”,Nature Reviews Clinical Oncology 2022;19(7):458-470(doi:10.1038/s41571-022-00631-3)——数据集官方叙事的文献起点。
  • 运动管理综述锚:Lombardo E 等,“Real-time motion management in MRI-guided radiotherapy: Current status and AI-enabled prospects”,Radiotherapy and Oncology 2024;190:109970——本数据集挑战赛叙事的第二块基石,其第一作者 Elia Lombardo 亦是数据集论文的核心作者。

6.2 运动管理谱系:gating → tracking 的临床跃迁

模式 机制 代价 现状
内在边界(ITV)扩靶 把全部运动范围包进靶区 正常组织过量照射 传统方案
Beam gating(门控) 运动超阈值时关束 治疗时间拉长、吞吐下降 MRI-linac 当前主流
MLC 追踪 多叶准直器叶片实时跟随肿瘤投影 需要毫秒级实时分割 + 叶片控制闭环 本数据集推动的目标
Movers(床补偿) 治疗床随肿瘤平移 低维(只能平移) 部分系统具备

官方叙事的因果链:现有临床追踪方案(DIR/模板匹配)扛不住大幅非刚性运动 → 只能停留在 gating → gating 浪费时间与吞吐 → AI 实时分割可靠后,MLC 追踪可在 MRI-linac 常规化 → “deliver radiation more efficiently and shorten treatment times for an increased number of treatments per day”(官网 Outcome 节原文)。

6.3 cine-MRI 追踪的四个技术难点

  1. 跨场强域差:0.35T 与 1.5T 的对比度机制、信噪比、几何畸变特性不同——同一种肿瘤在不同机器上长得不一样。
  2. 非刚性大幅运动:呼吸 + 充盈 + 患者自主运动叠加,帧间位移与形变可以很大,纯刚体假设失效。
  3. 外观退化与边界模糊:低场 cine 帧的肿瘤-正常组织边界可能很弱,运动模糊与序列参数变化加剧不确定性。
  4. 实时 + 稳健的双重约束:不仅每帧要快(≤1 s),还要在长序列中不漂移不丢失——一次性推理错误会通过时序传播放大,这正是评测把剂量学精度设为独立指标的原因。

6.4 与库内 MRI/肿瘤条目的技术光谱互补

TrackRAD2025 在"医学影像 × AI"光谱中的位置与库内 MRI 条目形成互补:fastMRI(库内 #23)解决"采得快不快"(k 空间加速重建),duke-breast-mri(#440)解决"看得清不清"(乳腺 MRI 形态学),nsclc-radiomics/#247 与 nsclc-radiogenomics/#257 解决"看得懂不懂"(肺癌影像组学与基因型关联),而 trackrad 解决"跟得跟不住"——实时时序维度的分割追踪。五个条目合起来覆盖 MRI 从采集、静态分析到动态干预的完整链条;atlas-liver-tumor(#431)的肝脏肿瘤背景则是呼吸运动影响的典型器官对照(肝细胞癌放疗正是 MRgRT 追踪的主要适应证之一)。

6.5 数据集视角下的一次 MRgRT 治疗分次

把数据集放回它诞生的场景——一次典型的 MRI-linac 治疗分次(fraction)——能更准确理解每个设计决策:

  1. 摆位与计划核验:患者上床,先做一次较高质量的 3D MRI 用于当日计划核验/自适应勾画(这一步不在数据集内)。
  2. 治疗中 cine 流:射束开启,MRI 切到 cine 模式,在选定的矢状面上以 1-8 Hz 连续成像——数据集的每一例就是这段流的一部分,采集于真实照射期间。
  3. 实时分割(本基准的任务点):每帧图像到达即需肿瘤掩码——临床现状是 DIR/模板匹配,挑战赛在为 AI 替代方案做认证性评测。
  4. 动作闭环(数据集外):掩码驱动的 MLC 叶片追踪 / 门控开关 / 床移动。Rel. D98 指标模拟的正是这一步的剂量后果。
  5. 分次间自适应:跨分次的形变累积用于计划调整——数据集按"治疗中片段"组织,不含跨分次纵向追踪(使用时勿假设同一患者的多次扫描是同一解按压面内的连续序列——frames2/frames3 是不同日期的不同区域扫描)。

这个映射同时解释了两个"为什么":为什么掩码必须是二值硬输出(叶片控制没有概率语法);为什么单层面 2D 而非 3D(cine 实时性以空间维度为代价,临床机器就是单层面采集的)。也因此,把 TrackRAD2025 的结论外推到 3D 剂量验证或立体定向场景时需要额外的验证层——它是"实时 2D 追踪"的认证基准,不是"放疗分割全能"基准。

6.6 实时成像追踪的模态横向:cine-MRI 在"实时看见肿瘤"谱系中的位置

模态 实时性 软组织可见性 辐射 本数据集中的角色
2D cine-MRI(MRI-linac) 1-8 Hz 连续 高(无需造影) 无 本基准载体
4D-CT 分相位重建,非真正实时 中 有(计划期一次性) 传统运动建模载体(对照系)
KV/MV 透视 实时 低(投影重叠) 有 C 臂放疗的追踪源(历史主流)
超声 实时(30+ Hz) 中(声窗依赖) 无 床旁追踪补位(库内 tus-rec 家族相邻主题)
EPID(电子射野影像) 实时 低(MV 级对比度) 治疗束自身 出束中验证

cine-MRI 的组合(无辐射 + 高软组织对比 + 治疗中连续可得)使它成为 MLC 追踪闭环的理想传感源——代价是成像物理复杂(磁场中的电子束行为、声学噪声、序列参数自由度大)与算力约束。TrackRAD2025 评测设计把"传感源特性"原样传给了算法社区:场强、帧率、区域就是传感器的自述参数。

6.7 cine-MRI 成像的最小背景包(通用科普,非数据集规格)

以下为理解数据所需的 MRI 成像通用背景(条目作者按领域常识整理,标注为科普;数据集未在公开材料中给出逐例序列参数表,具体序列以各中心采集为准):

  • cine 序列的物理取舍:治疗中 cine 追踪通常采用平衡稳态自由进动类(balanced SSFP)或快速梯度回波类序列——它们能在亚秒级重建单帧,代价是对磁场不均匀敏感(带宽窄、易出带状伪影)。0.35T 低场下磁化率伪影与 B0 不均匀问题相对温和,1.5T 下信噪比更高但对均匀性要求更苛刻——这是"同任务双场强"域差的物理根源之一。
  • 时间分辨率与空间分辨率的跷跷板:8 Hz 意味着单帧采集窗口仅约 125 毫秒,空间分辨率与信噪比都要让路——cine 帧的清晰度通常显著低于计划用 3D MRI,这正是"追踪"而非"诊断分割"任务的数据基础。
  • 运动模糊与呼吸相位:帧内运动(采集窗口内目标移动)与帧间运动(序列漂移)叠加;高帧率下帧内模糊小但帧间冗余高,低帧率反之。算法在两种帧率下面对的误差结构不同——这是 frame_rate 元数据影响方法设计的具体含义。
  • 磁场中的射线(背景一句话):MRI-linac 的独特挑战还包括磁场对加速器电子束的洛伦兹偏转与射野影像畸变——不在本数据集范围内,但解释了为什么"cine-MRI 追踪"是 MRgRT 特有的问题设定。

使用声明:本小节仅提供阅读数据的背景框架;任何涉及具体序列参数(TR/TE/矩阵)的结论请回数据文件头信息与原始论文,不要从本小节外推。

§7 生态与影响:一个数据集的三层产出

7.1 论文层:三份互锁的正式文献

文献 定位 关键内容 口径注意
Wang Y 等,Med. Phys. 2025;52(7):e17964(doi:10.1002/mp.17964;预印本 arXiv:2503.19119,一作 Yiling Wang/四川省癌症医院) 数据集论文(结构化描述) 585 例构成、6 中心、双场强、数据格式、划分协议、潜在应用 投稿期写"under revision in Medical Physics";正式卷期 2025 年 52 卷 7 期;正文 10 页 5 图 2 表
Blöcker TJ 等,Med. Image Anal. 2026;112:104134(doi:10.1016/j.media.2026.104134) 挑战赛报告 全部参赛方法、六指标终榜、跨站点事后分析、失败案例;Top 5 联署 bibtex year 2026 month July;GitHub 时间线写"publication 2026-05-23"
LNCS 论文集(ISBN 978-3-032-35046-6,MICCAI 2025 联合活动) 方法论文集 各获奖队伍方法细节(如 CoTracker3 季军论文 doi:10.1007/978-3-032-35046-6_2) 与 Second Trauma Thompson Challenge 合卷出版

三层引用关系:用数据 → 引数据集论文;引赛果/比较方法 → 引挑战赛报告;复现具体队伍 → 引其方法论文 + 挑战赛报告。官方规则明确要求参赛者后续发表时同时引用前两者(“commit to citing the challenge report and data overview paper”)。

7.2 代码层:官方仓库的完整闭环

官方 GitHub(LMUK-RADONC-PHYS-RES/trackrad2025)不是一个 README 空壳,而是一条完整的"从原始厂商数据到官方排名"的复现链:

  1. scripts/:两家厂商(ViewRay 与 Elekta)专有 cine-MRI 格式到公开元数据格式的转换脚本——意味着外部机构若拿到原始 MRIdian/Unity 影像,可按同一格式入库比对;
  2. baseline-algorithm/:接口模板与朴素 baseline(首帧掩码 repeat);
  3. evaluation/:官方六指标的紧凑实现(“a compact and fast custom implementation of the metrics”)——本地复现排名的钥匙;
  4. test-algorithm.sh:合成示例 Z_001 上的端到端本地测试(Docker 链路);
  5. analysis/ + 原始挑战赛结果:赛果的原始数据与分析脚本(事后分析可复算);
  6. trackrad2025.grand-challenge.org/:官网全站内容镜像(2026-06 存档状态)——即使官网改版,规则与指标页有 Git 存照。

软件许可为 MIT 风格(“Copyright 2025 The TrackRAD2025 organizers”),但仓库明确声明该许可只覆盖软件、竞赛材料另有条款——与 §4.3 的数据许可分层呼应。

7.3 赛后衍生层:基准的二次生命

挑战赛闭幕后(2025-09 至 2026)围绕公开数据出现了一批二次研究,说明基准在赛后仍持续产出:

  • CPU-only 光学流路线(DGMP 2026 会议摘要,Betancourt Tarifa 等——作者亦在挑战赛报告联署名单中):动态关键帧锚定(DKA)+ Farneback 光流,公开标注数据(n=88/7932 帧)上 DSC 0.877、0.05 s/帧,主打"可解释位移场、无需 GPU、不触发高风险 AI 监管"——瞄准临床落地的另一极。
  • 参赛方法论文陆续见刊:BreizhTrack(arXiv:2510.25990)、XMem 方案(arXiv:2509.18591)等在赛后公开完整细节。
  • post-challenge 开放榜单:预测试通道每月 10 次提交、日志公开;新方法可持续与赛期成绩对标。
  • 测试集公开化进程:官方承诺赛后数年内把测试数据并入训练数据同址;已部分完成(部分病例因隐私永不公开)——后续使用者需盯紧官方 GitHub 的数据段落更新。

7.4 组织生态:为什么是这几家

  • LMU 慕尼黑(Landry/Kurz/Lombardo/Thummerer/Blöcker/Riboldi):牵头与日常运营;HF 组织 LMUK-RADONC-PHYS-RES 即"LMU Klinikum Radiation Oncology Physics Research"缩写。
  • UMC Utrecht(Maspero/Borman)+ Catharina(Hurkmans/Tijssen)+ Amsterdam UMC(Palacios):荷兰三家 MRI-linac 中心,欧洲 MRgRT 研究密度最高的集群之一。
  • University of Sydney / GenesisCare(Keall/Jameson/Byrne):MRI-linac 运动管理临床研究的发源团队之一(Keall 系 MRI-linac 集成综述一作)。
  • 四川省癌症医院(Wang Yiling 等):中国唯一中心,数据集论文一作单位——也是"中国机构在顶级医学影像挑战赛中承担数据核心角色"的代表性案例。
  • BZKF(巴伐利亚癌症研究联盟):把 TrackRAD2025 列为其 Lighthouse 项目"Image Guidance in Local Therapies"的旗舰成果,明确表述"通过组织 Grand Challenge 吸纳全球智慧解决 MRI 病灶追踪问题"。
  • Grand Challenge 平台(diagnijmegen 运营):评测容器、A10G 计时、榜单管理的基础设施承载方——与 fastMRI、PANDA 等挑战赛同一平台家族。

7.5 影响定位

在"医学影像挑战赛数据集"谱系里,TrackRAD2025 的独特性不是规模(585 例比不过万例级胸片集),而是任务的临床临界性:它是少数把"AI 输出直接驱动治疗机动作(MLC 叶片)"作为设计目标的公开基准,评测指标里嵌着剂量学安全。对"AI in the loop of interventional workflow"类研究(实时介入、手术导航、治疗闭环),它的评测设计范式(几何误差 → 治疗后果折算 → 实时约束 → 硬件标准化)比它的数据本身更值得移植。

7.6 影响的三级火箭:数据 → 方法 → 临床转化

  • 数据级影响:六中心数据的公开化本身改写了该子领域的研究可行性——2025 年之前,一篇 cine-MRI 追踪论文通常只能用单中心几十例私有数据自证;之后,任何方法都能在 88 例公开标注(4 中心)上与全球最强基线对表。
  • 方法级影响:终榜与挑战赛报告确立了三条被复证的结论(可提示视频分割适配此任务、通用视频模型可零样本迁移、未标注数据的半监督利用是主要增益源)——这三条已出现在 2025-2026 年的多篇后续工作中,成为该子领域的公共知识。
  • 临床转化级影响(进行时):CPU 光流路线与开源冠军代码把"部署一个追踪器"的工程门槛从"自研团队"降到"配置开源仓库";post-challenge 榜单为院内验证提供持续基准服务。真正把 MLC 追踪推进常规治疗还需监管路径与前瞻性临床验证——数据集的角色是把这个验证的起点从"方法不存在"推进到"方法可复现"。

§8 与库内条目的关系

8.1 直接互链(库内 status=1,按相关度)

库内条目 record_id 关系 互链建议角度
fastmri 23 同为 MRI 模态 + 同为 Grand Challenge 生态挑战赛数据集 "MRI 挑战赛数据集"双例:重建(fastMRI)vs 实时追踪(TrackRAD2025);评测设计对比
duke-breast-mri 440 MRI 模态(乳腺) MRI 序列参数差异与模态内多样性;单中心 vs 多中心数据集设计的对照
nsclc-radiomics 247 肺癌 CT 影像组学 胸部肿瘤放疗背景;静态影像组学 vs 动态 cine 追踪的互补
nsclc-radiogenomics 257 肺癌影像-基因型 肺癌治疗链条:影像基因组学(选方案)→ 放疗追踪(做执行)
atlas-liver-tumor 431 肝肿瘤分割 肝脏是呼吸运动最显著的腹部器官——TrackRAD2025 数据中腹部占比约 41%;肝细胞癌放疗追踪的主要适应证
covid-19-radiography 217 胸部 X 光/CT 胸部影像谱系的时间维度对照:静态胸片 vs 治疗中实时 cine-MRI
cancerlinq 388 肿瘤临床数据 肿瘤诊疗数据闭环:临床数据(cancerlinq)→ 治疗执行数据(trackrad)
radgraph2-radiology-reports 622 放射报告 NLP 影像与报告的 AI 两翼:报告理解 vs 影像实时分割

8.2 库位观察

  • 经 url_name ILIKE '%trackrad%' 查重为 0 行,本条目为库内首篇。
  • %radiotherapy%、%linac%、%mrl% 均无命中——trackrad 是库内放疗主题首篇,后续若有 MRgRT、4D-CT 呼吸运动、放疗剂量预测类条目,应以本条目为互链锚点。
  • 库内存在 writing/tus-rec/ 目录(TUS-REC 超声扫查重建,同属"实时成像序列 + 追踪/重建"家族)——两主题在"自由手实时成像的时序算法"话题上天然相邻,可在各自条目的方法学节互提。
  • category_tags 已取"挑战赛数据集"“评测基准”,与库内其他挑战赛系条目(同标签网络)自动建立标签级相关。

8.3 检索与引用提示

  • 检索词:TrackRAD2025(精确短语);变体陷阱:TrackRAD 2025(空格)与 TrackRAD2025 连写在文献中混用,DOI 检索以连写为准;勿与假想缩写 “TR2025” 或 “TrackRad-25” 混淆。
  • 唯一官方域名:trackrad2025.grand-challenge.org;不存在独立的 trackrad.org 或 trackrad2025.org——后者如遇内容与本条目冲突,以 grand-challenge.org 与官方 GitHub 为准。
  • 中文检索注意:“实时肿瘤追踪”“MRI 引导放疗”"磁共振引导放疗(MRgRT)"是同义高频变体,入库关键词已覆盖。

§9 方法学启示:八条可迁移的经验

9.1 "未标注粮仓 + 标注基准"双轨制

TrackRAD2025 把 200 GiB 未标注数据与 3 GiB 标注数据放进同一个任务框架,并用赛果证明了双轨各有拥趸(冠军吃半监督,季军吃零样本)。对任何标注昂贵的医学领域(超声、病理、手术视频),这是可复制的数据集设计:未标注数据不必等标注就能发布,只要任务定义与评测协议同时给出。

9.2 把"临床后果"写进评测指标

Rel. D98(模拟 MLC 追踪剂量学精度)是本基准的独门设计:几何误差自动折算为剂量偏差。通用分割基准(Dice 榜)长期被批评"指标提升与临床价值脱钩",TrackRAD2025 给出了可操作的解法——在评测环节嵌入领域仿真器。移植要点:找到你领域的"治疗后果仿真"(药物剂量、手术路径误差、诊断置信度),把它做成指标。

9.3 实时约束必须进评测,而不是进倡议

“1 秒/帧"不是愿景而是硬判罚,且推理速度是六指标之一。这倒逼方法设计从"离线重型"转向"在线轻量”(BreizhTrack 弃用 TTA、季军选点追踪而非视频扩散模型,都受此约束)。经验:实时性若不进排名,就等于不存在。

9.4 防过拟合的提交经济学

8 例校准 + 50 例决赛 + 每队仅 2 次决赛提交——用提交次数的稀缺性替代测试集的保密性(测试集赛后终究要公开)。同时 post-challenge 阶段重开预测试通道、日志公开,把"刷榜"与"研究"分层。这套"校准通道 + 稀缺决赛 + 赛后开放"三段式,可作为在线基准运营的模板。

9.5 元数据是接口的一部分

帧率、场强、解剖区域直接进函数签名——数据集方承认"条件不同则先验不同",并把它编码为 API。对比许多数据集把元数据埋在附属 CSV 里,TrackRAD2025 的做法使"条件化模型"(如按场强切换预处理)成为一等公民。可迁移原则:凡是影响算法行为的采集参数,都应该出现在接口签名里。

9.6 多观察者标注是"指标天花板"的标定仪

很多分割数据集把多观察者标注当附属品发布,TrackRAD2025 把约 8000 帧多观察者数据内嵌在主数据集里——它回答一个所有分割团队迟早要面对的问题:模型的 Dice 应该以多少为满分?如果观察者间 DSC 本身只有 0.85-0.90,那模型 0.89 的成绩已触及人类一致性天花板,继续卷指标就是在拟合标注噪声。建议任何使用者在首个实验报告里就给出这个对照位;这也是把"标注一致性研究"从附加论文变成主线工作的一步。

9.7 数据集的"可引用资产分层"范式

TrackRAD2025 给三种资产各配了一套标识符与许可:数据(HF DOI + CC-BY-NC)、描述文档(Zenodo DOI + cc-by-4.0)、论文(Med Phys / Med Image Anal DOI)。这是对"数据集引用混乱"这一老问题的系统化解法:引用哪个 DOI 取决于你在引用哪层资产。可迁移原则:发布数据集时,为"数据本体、描述文档、评测代码"分别取得独立可引用标识,并在 README 里写清三层对应关系——TrackRAD2025 的 GitHub bibtex 段就是这套分层引用的现场示范。

9.8 数据审计视角:这个数据集的"可审计性"设计

从数据审计(data audit)角度回看 TrackRAD2025,它的几项设计让第三方核验成本异常低:

  • 评测代码与原始结果同仓:analysis/ + raw challenge results——任何人可以复算榜单,而不是"相信一张截图";
  • 官网全文 Git 存档:规则改动有 diff 可查;
  • bibtex 三层引用规范:数据/赛果/方法各归其位,减少"引用错位"类审计纠纷;
  • 口径冲突有锚:500/477、2.5M/2.8M、2023/2025 年份笔误等所有已发现的口径分歧,都能在"论文 vs 官网 data 页"两级权威源中裁决;
  • 缺失可解释:测试集不完整公开有明确的隐私原因声明,而不是无声缺失。

对建设自家数据集的团队,这是第四条可迁移经验之外的第五条:审计友好不是加一层文档,而是让"数字能被复算、缺失有解释、版本有存档"成为仓库结构的一部分。

§10 避坑清单:八个已踩过的坑

坑 1:arXiv 编号 2503.17941 是错的(任务简报笔误存照)。该编号实为一篇流体力学 DeepONet 论文(Sunwoong Yang 等,physics.flu-dyn)。TrackRAD2025 数据集论文的正确编号是 arXiv:2503.19119(ADS、官网 data 页、官方 GitHub bibtex 三处互证),正式版为 Med. Phys. 2025;52(7):e17964(doi:10.1002/mp.17964)。检索或自动抓取时若用了错误编号会撞上完全无关的论文——引用前先核对标题。

坑 2:Zenodo 的 cc-by-4.0 不是数据许可。Zenodo record 15044966(concept DOI 10.5281/zenodo.15044965)元数据里 license 写 cc-by-4.0,但该记录仅承载一份 123 KB 的结构化描述 PDF——cc-by-4.0 只覆盖这份 PDF。数据本体的有效许可是 CC-BY-NC(HF 数据卡与官网 data 页双处口径),禁止商业使用。自动化系统从 Zenodo API 抓 license 字段会把整个数据集误标为可商用,方向完全相反。商用前以 CC-BY-NC 为准并与组织方确认。

坑 3:规模数字口径漂移(500 vs 477;250 万 vs 280 万帧)。早期宣传材料(BZKF 新闻等)写"500 unlabeled / 2.5 million frames";定稿口径(论文与官网 data 页)为 477 未标注 / 585 总例 / 280 万+ 帧。引用时认准论文与官网 data 页;旧数字若混入会造成"例数对不上"的假性矛盾。同理"108 例标注"是患者数,赛后公开可下载的标注是 88 例(部分测试病例隐私不公开)——复现实验按 88 例规划。

坑 4:官网 rules 页的年份笔误(2023)。官网 Timeline 节 testing phase 写"16/07/2023 - 15/08/2023",实际为 2025 年(GitHub README 镜像已更正)。做时间线抽取的系统需写白名单修正,否则会推出"测试早于数据发布一年"的荒谬时序。

坑 5:HF 组织名不易猜,猜错返回"Invalid username or password"。正确仓库是 LMUK-RADONC-PHYS-RES/TrackRAD2025(LMU Klinikum Radiation Oncology Physics Research 缩写)。凭直觉猜 TrackRAD2025/TrackRAD2025 之类会收到 401 类错误(hf-mirror 实测返回 “Invalid username or password.”,伪装成鉴权失败的 404)。最稳入口是 doi.org/10.57967/hf/4539 重定向。

坑 6:目录命名两套并存,且目录结构与提交接口非一一对应。example 案例(Z_001)用 b-field-strength.json,正式数据用 field-strength.json;未标注患者多扫描时文件带数字后缀(frames2.mha、frame-rate2.json)。官网明示"the dataset folder structure does not match the interfaces that submissions need to implement one-to-one"——本地解析与提交封装要写两套适配,别假设一致。

坑 7:单看 DSC 会误判名次与"最好方法"。终榜上第 4 名 CIT 的 DSC(0.8712)低于第 5 名 Reg’n’Track(0.8801),冠军的 Rel. D98(0.9361)只排单项第四——多指标综合排名下名次倒挂是常态。转述赛果必须以挑战赛报告(Med Image Anal 2026;112:104134)的综合排名为准,引用任一单项时注明"单项名次"。

坑 8:论文与记录的"版本位"别引错。Zenodo concept DOI(10.5281/zenodo.15044965)指向概念版本,具体 record 是 15044966(v1,2025-03-18);HF 引用条目带 revision 号(“TrackRAD2025 (Revision 505ec64)”);数据集论文有预印本与正式版两个年份。三种资产各有一套标识符,引用时按资产类型对应(数据→HF DOI,描述文档→Zenodo DOI,论文→Med Phys DOI),交叉混引会生成查不到的 DOI 组合。

§11 总结

TrackRAD2025 用"585 例真实疗程 cine-MRI + 首帧模板追踪任务 + 六指标剂量学感知评测 + 硬实时约束"四件事,把 MRI 引导放疗的实时肿瘤追踪从各机构私有课题变成了全球公开赛道。它的价值可以压缩成四句话:

  1. 对放疗临床:这是 MLC 追踪从论文走向治疗床前必经的那块垫脚石——数据跨双厂商六中心,评测把分割误差翻译成剂量偏差,冠军方法已开源可审计。
  2. 对方法研究者:一个天然的"域泛化 + 数据效率 + 实时约束"三重考题——半监督 MedSAM2 冠军、零样本 CoTracker3 季军、CPU 光流赛后逼近 GPU 冠军,三条路线的相对成绩单就是一篇隐形的领域综述。
  3. 对数据集工程师:未标注粮仓与标注基准双轨发布、元数据进接口签名、提交经济学防过拟合、赛后开放榜单续命——四个设计决策都值得整段抄进自家数据集规范。
  4. 对 AI-Ready 生态:它是"多机构真实临床时序数据公开化"的稀缺样本(库内放疗主题首篇),其许可分层(数据 CC-BY-NC / 描述文档 cc-by-4.0 / 代码 MIT)是自动化管线必须显式建模的异构样例。

使用门槛小结:下数据走 HuggingFace(LMUK-RADONC-PHYS-RES/TrackRAD2025,先拉标注子树);跑评测走官方 GitHub(baseline + evaluation + test-algorithm.sh);读赛果走 Med Image Anal 2026 挑战赛报告;引数据走 Med Phys 2025 数据集论文 + HF DOI。避开 §10 的八个坑,这条管线从下载到复现排名全程无暗门。

附录 A:高频问答(FAQ)

Q1:TrackRAD2025 数据到底在 Zenodo 还是 HuggingFace?
数据本体只在 HuggingFace(LMUK-RADONC-PHYS-RES/TrackRAD2025,HF DOI 10.57967/hf/4539)。Zenodo(DOI 10.5281/zenodo.15044965)只放了一份 123 KB 的结构化描述 PDF,作用是给数据集一个概念 DOI。坑 2。

Q2:我能商用吗?
不能直接商用。数据 CC-BY-NC(署名-非商业)。代码仓库是 MIT 风格可商用,但用 MIT 代码训练出的模型若依赖 CC-BY-NC 数据,模型商用边界需自行与组织方确认——仓库声明竞赛材料"may be licensed under different terms"。

Q3:108 例标注数据都能下到吗?
不能。公开标注 = 50 训练 + 赛后公开的部分测试(预测试 8 例 <1 GiB 全公开 + 测试 50 例中部分公开),赛后可用口径 n=88 例/4 中心/7932 帧;部分测试病例因隐私限制永不公开。坑 3。

Q4:未标注数据真的有 200 GiB?值得下吗?
是(约 200 GiB,280 万+ 帧)。若做自监督/半监督预训练研究值得;若只做监督分割或评测,拉标注子树(约 3 GiB)+ 预测试子树(<1 GiB)足够。下载务必带 allow_patterns。

Q5:跑通 baseline 需要什么环境?
Unix + Docker(Windows 走 WSL),sh test-algorithm.sh 用合成案例 Z_001 端到端验证。官方评测硬件是 NVIDIA A10G(24 GiB)——本地复现计时不需要同款卡,但要对标排名就需要在平台提交或自建 A10G 级环境。

Q6:任务和视频目标分割(VOS)有什么区别?
任务形态同构(首帧模板 + 序列传播),差异在三处:实时硬约束(≤1 秒/帧且计分)、放疗特化指标(质心误差 + 剂量学精度)、跨场强/跨中心域偏移。VOS 榜上的重型方法(大模型 + 多次精修)通常无法直接过实时关。

Q7:为什么冠军不是 Rel. D98 第一名?
六指标综合排名的权重设计:冠军 Track’n’Treat 几何指标(DSC/CD/SD95/SDavg)四项第一,Rel. D98 单项第四(0.9361 vs 亚军 0.9628);亚军 Hkini 剂量学第一但几何稍逊。综合后冠军胜出——这正是"别单看一个指标"的活教材(坑 7)。

Q8:现在提交还能进官方榜吗?
能。post-challenge 阶段预测试通道每月 10 次提交(日志公开),最终测试病例滚入开放榜单,"computational budget allows"期间持续开放。

Q9:数据能用于训练通用医学分割模型吗?
许可上可以(CC-BY-NC 非商业内自由使用),但注意 2D 单层面矢状位 cine 的分布特异性——迁移到 3D 或其他模态时域差显著;多观察者标注子集(约 8000 帧)更适合做标注一致性研究而非主力训练集。

Q10:和库内 tus-rec(超声重建)什么关系?
同属"实时成像序列上的时序算法"家族:TrackRAD2025 是 MRI 实时追踪(治疗场景),TUS-REC 是超声扫查重建(导航场景)。两者在"自由手实时成像、时序一致性、实时约束"方法学上互为邻居,数据模态与任务目标不同。

附录 B:DAIMS 评估全表

维度 得分(/10) 评分理由
D 发现性 Discoverability 9 三套正式 DOI(Zenodo concept / HF / 两篇论文)+ 官网 + GitHub 五路入口;唯一扣分:Zenodo 与 HF 的角色易混淆(坑 2/坑 5),首次检索者常需 doi.org 重定向定门
A 可获取性 Accessibility 8 HF 直下无需注册审批,四个子树按需拉取;扣分:未标注子集 200 GiB 门槛高、部分测试数据因隐私永不公开(赛后可用标注 88/108 例)、CC-BY-NC 封死商用路径
I 互操作性 Interoperability 8 .mha(ITK 生态通用)+ 标量 JSON 元数据,无专有格式(官方还提供厂商专有格式转换脚本);扣分:目录命名两套并存(坑 6)、分辨率/帧率逐例浮动需自行归一
M 元数据质量 Metadata 9 场强/帧率/区域三参数逐例齐备且进算法接口;论文(Med Phys)+ 描述 PDF + 官网三处文档互证;扣分:口径漂移需靠坑清单仲裁(坑 3/坑 4)、面内分辨率无统一规格表
S 可持续性 Sustainability 9 官方代码 MIT 风格、评测代码开源、post-challenge 榜单持续运营、测试集公开化推进中、挑战赛报告 Top 5 联署保长期权威性;扣分:榜单存续绑定平台算力预算(“as long as the computational budget allows”)
总分 43/50 AI-Ready 光谱定位:公开直链 + 标注稀缺 + 领域特化评测的高发现性时序影像基准

附录 C:术语表

术语 全称/原文 一句话解释
MRgRT MRI-guided radiotherapy 用 MRI 在放疗照射过程中实时成像引导的治疗范式
MRI-linac MRI-linear accelerator MRI 与医用直线加速器一体的治疗机;本数据集含 0.35T MRIdian 与 1.5T Unity 两款
cine-MRI — 同一层面连续快速采集的 MRI 时间序列("电影"成像),本数据集为矢状位 2D、1-8 Hz
VOS video object segmentation 视频目标分割:首帧模板 + 序列传播的任务范式
DIR deformable image registration 形变图像配准;临床现行的轮廓传播方案,大幅非刚性运动下脆弱
MLC multi-leaf collimator 多叶准直器;叶片实时变形可"追着肿瘤照射"(MLC tracking)
Beam gating — 运动超阈值时关束的保守运动管理;当前 MRI-linac 主流
DSC Dice similarity coefficient 掩码重叠度指标,分割基本盘
SD95 / SDavg surface distance(95th percentile / average) 边界距离指标的尾部/整体口径,单位 mm
CD center-of-mass error(2D Euclidean) 目标质心位置误差——射束跟随最直接依赖的量
Rel. D98 relative D98 dose 模拟按预测掩码做 MLC 追踪照射时,靶区 98% 体积剂量的保真度——本基准的剂量学安全指标
半监督 semi-supervised — 少量标注 + 大量未标注联合训练;冠军路线
零样本 zero-shot — 不用目标任务数据、直接用预训练模型推理;季军路线
ESTRO European Society for Radiotherapy and Oncology 欧洲放疗学会;本挑战赛的宣传与赛后讨论场
BZKF Bayerisches Zentrum für Krebsforschung 巴伐利亚癌症研究联盟;组织方背后的资助/协调层之一

附录 D:三类读者速查卡

给数据工程师(要把数据接进管线):

1. snapshot_download + allow_patterns 按子树拉取(先标注 ~3 GiB 试管线)
2. 逐例读 JSON 标量(field-strength/frame-rate/scanned-region),注意数字后缀文件
3. 按患者(非按序列)划分训练/验证,防多扫描泄漏
4. .mha 头信息取分辨率,勿硬编码;帧率进时序模型超参
5. 许可红线:CC-BY-NC,商用前书面确认

给方法研究者(要出结果):

1. 起点选型:可提示视频分割(MedSAM2/SAM2)或点追踪(CoTracker3)双路线
2. 50 例标注不足以全参微调 → 未标注 477 例的半监督/自监督利用是主战场
3. 六指标一起优化;SD95 与 Rel. D98 对"偶发丢失"最敏感
4. 推理预算 ≤1 s/帧;TTA 等推理期开销慎用
5. 基准口径以挑战赛报告为准(Med Image Anal 2026;112:104134)

给临床/放疗物理师(要评估可用性):

1. 方法成熟度标尺:最终测试集 DSC 0.87-0.89 / CD 1.5-2 mm / Rel. D98 0.93-0.96
2. CPU 光流路线(赛后 DSC 0.877, 0.05 s/帧)证明无 GPU 科室也有可用选项
3. 官方 post-challenge 通道可提交院内数据思路验证(每月 10 次,日志公开)
4. 引用时用挑战赛报告口径,勿直接转引参赛队自评
5. 临床落地前还需 3D 剂量验证与院内 QA——本数据集是 2D 矢状面基准

条目元信息与自检对照

  • 抓取/核验时点:2026-09-26 至 2026-09-27(web 检索与官网/仓库抓取)
  • 三源互证基线:Zenodo API(concept 15044965 → record 15044966)× 挑战赛官网(首页/rules/data/winners-announcement 四页)× 官方 GitHub(README + bibtex);外加 arXiv/ADS(2503.19119)、Med Phys(10.1002/mp.17964)、Med Image Anal(10.1016/j.media.2026.104134)、Springer LNCS(978-3-032-35046-6)、HF(doi.org 重定向)、BZKF、DGMP 2026 摘要
  • 查重存照:url_name ILIKE '%trackrad%' → 0 行(record_id 无);%radiotherapy%/%linac%/%mrl% → 0 行;MRI 互链仅 fastmri(23)、duke-breast-mri(440)
  • 坑点:§10 八则(坑 1-8,"坑 N:"编号制)
  • DAIMS:附录 B 全表(43/50)
  • frontmatter:title/subtitle/description(≤170 字符)/summary/schema_org(MedicalWebPage + Dataset + cr:RecordSet + rai:dataLimitations + ScholarlyArticle)/category_tags(词表内 6 个)/cover_image_prompt(固定收尾句)
  • 数字口径总原则:规模与划分以 Med Phys 论文 + 官网 data 页为准;赛果以挑战赛报告为准;下载体积以官方 GitHub README 为准;时间线以 rules 页 + GitHub README 镜像为准(2023 笔误已修正)

附录 E:十种常见错误用法与纠正

错误 1:把 Zenodo 记录当数据镜像下载。
现象:从 doi.org/10.5281/zenodo.15044965 进入,只看到一个 123 KB PDF。
纠正:数据本体走 HuggingFace LMUK-RADONC-PHYS-RES/TrackRAD2025;Zenodo 只负责给描述文档一个概念 DOI。

错误 2:从 Zenodo API 抓 license 字段填充数据集元数据。
现象:自动化管线把数据集标为 CC-BY-4.0。
纠正:数据许可以 HF 数据卡/官网 data 页的 CC-BY-NC 为准;Zenodo 字段只描述其承载的 PDF。管线里对"记录级 license"与"资产级 license"分字段建模。

错误 3:按序列随机划分训练/验证。
现象:同一患者的 frames.mha 与 frames2.mha 分属两侧,验证集泄漏训练分布,指标虚高。
纠正:按患者 ID 前缀(D_/F_/Z_ 等)分组划分;报告划分协议。

错误 4:忽略 frame_rate 参数。
现象:时序模型按固定帧数窗口设计,跨帧率子集(1.3-8 Hz)结果不可比。
纠正:时间窗按秒归一;接口签名里 frame_rate 是一级输入,不是装饰。

错误 5:假设所有标注病例都可得。
现象:按 108 例标注规划实验,下载数对不上。
纠正:赛后可用标注 88 例/4 中心/7932 帧(部分测试病例隐私不公开);规划复现实验前先跑目录清单核对。

错误 6:用训练标注集(50 例)的成绩预测排名。
现象:本地验证 DSC 0.92 就预期榜单前列。
纠正:BreizhTrack 实证训练集 0.91+ → 隐藏测试 0.879 的跌落;分布偏移是本基准主考题,小标注集成绩只作 sanity check。

错误 7:单指标(DSC)转述名次。
现象:文案写"DSC 0.8801 排第五、0.8712 排第四,说明榜单有误"。
纠正:综合排名含六指标;单项名次必须显式标注"单项"(坑 7)。

错误 8:把 example 案例的命名当正式 schema。
现象:解析器只认 b-field-strength.json(example 用名),批量数据全挂。
纠正:正式数据是 field-strength.json;两套命名并存过,解析器做双兼容并以官方 GitHub 最新 README 为准(坑 6)。

错误 9:把多观察者标注当独立训练样本。
现象:同一帧的多份掩码被当成多个训练对,等价于过采样且引入标签冲突。
纠正:多观察者数据用于一致性标定(观察者间 DSC)或标签融合实验;主训练集用单一标注版。

错误 10:把 2D cine 追踪结论直接外推到 3D 放疗流程。
现象:用本基准成绩论证"可替代 3D 自适应放疗的分割"。
纠正:本数据集是矢状面单层面基准,无体积信息;3D 结论需 3D 数据(如院内 4D-MRI/4D-CT)另行验证(§6.5)。

附录 F:复现排名的工程手册(最短路径)

目标:在本地复现挑战赛报告中的几何四指标(DSC/SD95/SDavg/CD),并对表终榜数字。

Step 1  环境
        - git clone https://github.com/LMUK-RADONC-PHYS-RES/trackrad2025
        - docker 就绪(test-algorithm.sh 依赖);unix 或 WSL
Step 2  数据
        - HF 拉取 trackrad2025_labeled_training_data/*(~3 GiB)
        - HF 拉取 trackrad2025_labeled_pre-testing_data/*(<1 GiB,8 例,用于对表公开数字)
        - (可选)labeled_testing_data/*(~3 GiB,注意部分病例缺失)
Step 3  baseline 冒烟
        - sh test-algorithm.sh  → example 案例端到端跑通,确认容器/路径/输出格式
Step 4  接入你的模型
        - 复制 baseline-algorithm/ 为你的包,实现 run_algorithm 五元组接口
        - 首帧 target 从 *_first_label.mha 读入,元数据从 JSON 读入
Step 5  评测
        - 用 evaluation/ 的官方实现算 DSC/SD95/SDavg/CD
        - 对表:预测试 8 例上与 BreizhTrack 论文 Table 4 的口径互校(其公开了各队在预测试集的成绩)
Step 6  剂量学(可选)
        - Rel. D98 需 MLC 追踪仿真栈;多数场景建议直接用官方 post-challenge 通道提交获取
Step 7  速度
        - 分段计时:模型加载 / 数据加载 / 逐帧推理;对标平台时预留容器开销余量
Step 8  结果归档
        - 保存逐例逐帧掩码与指标明细,注明数据子集哈希/revision(HF 引用带 Revision 505ec64 口径)

三个工程陷阱提前预警:① snapshot_download 不带 allow_patterns 会全量 200 GiB;② Windows 路径分隔符在 Docker 挂载里出错(用 WSL 内部路径);③ .mha 的 T 维在最末(W,H,T),与某些视频框架的 (T,H,W) 惯例相反——transpose 一次就够,但转错方向的模型会"训练成功、结果为零"。

附录 G:数据画像与可推演统计

在官方未发布统一统计表的情况下,以下画像由官方口径数字推演,供管线自检对照(均为推演值,非官方表格——以论文 2 tables 为最终裁决):

维度 推演值 依据
总患者数 585(477 未标注 + 108 标注) 论文摘要
总帧量(未标注) >2,800,000 官网 data 页下界
标注帧量 >10,000(另 ~8,000 多观察者帧) 官网 data 页
患者均帧数(未标注) ~5,900+ 帧/患者(2.8M/477) 推演——单例序列长或多次扫描
标注序列均帧数 ~93 帧/序列(10,000/108 量级) 推演
区域分布(公开标注) 腹部 ~41% / 胸部 ~32% / 盆腔 ~27% DGMP 2026 口径(n=88, 7932 帧)
公开数据体积 ~206 GiB(200 + 3 + 3,另 <1 预测试) GitHub README
场强二分 0.35T / 1.5T 逐例 JSON 标注 数据 schema
帧率范围 ~1.3-8 Hz(样例 1.3/1.65/4.0) 官网 data 页示例

自检位:你的本地统计若在"总标注帧数"、"区域三分占比"上偏离上表超过量级差异,优先怀疑下载不完整或目录遍历漏掉了带数字后缀的文件(frames2.mha/frames3.mha 系列是漏统重灾区)。

时间维度提示:数据集的时间覆盖为各中心 2022-2024 前后的治疗采集(数据集论文 2025-03 挂出、数据 2025-03-15 发布),元数据不含采集日期字段——做时间趋势分析需向组织方查询,不要从 record ID 或文件名推断日期。

附录 H:版本与更新记录

时点 事件 对使用者的影响
2024-12-15 官网开放,规则/指标页上线 评测协议自此定版可引
2025-03-15 训练数据发布(HF),挑战赛开始 数据 v0 起点口径
2025-03-18 Zenodo 描述文档 v1(record 15044966) 概念 DOI 定版
2025-03 arXiv:2503.19119 预印本 数据集论文可引
2025-08-15 测试阶段关闭 赛期数据口径冻结
2025-09-09 终榜公布 Top 5 定版
2025-09 Med. Phys. 52(7):e17964 正式发表 数据集论文正式版
2025-09 起 post-challenge 开放(预测试重开) 基准转入持续运营
2025-09-23 MICCAI 2025 workshop(大田) 方法论文集定稿
2025-10 LNCS 论文集出版(ISBN 978-3-032-35046-6) 季军等方法细节可引
2026-05/07 挑战赛报告 Med Image Anal 112:104134 赛果权威口径定版
2026-06 GitHub README 更新为 post-challenge 存档状态(本条目抓取的仓库口径) 数据段落含测试集公开化最新状态
2026-09-27 本条目抓取/核验时点 后续更新以官方渠道为准

附录 I:给下一个挑战赛设计者的清单

从 TrackRAD2025 提炼的组织清单,每条都可直接搬用:

  • [ ] 任务接口里放领域元数据(本例:场强/帧率/区域),并把"用不用是方法的自由"写进规则——先验标准化而不强制。
  • [ ] baseline 要"朴素但有尊严":本例的首帧 repeat baseline 恰好模拟了"肿瘤静止"的零假设,任何方法超过它即证明建模了运动——baseline 的语义下界比其技术含量更重要。
  • [ ] 指标里放一个"领域后果"指标(本例:Rel. D98),并让它在排名里有实权——否则社区永远只优化通用指标。
  • [ ] 硬件统一 + 计时规则透明(A10G、1 秒/帧、加载时间分列)——实时约束才有公信力。
  • [ ] 提交经济学:校准阶段多给(10 次/月),决赛稀缺(2 次)——用稀缺性防过拟合,比保密测试集更可持续(测试集终将公开)。
  • [ ] 赛后开放通道:预测试重开 + 日志公开 + 开放榜单——让基准成为服务而非一次性事件。
  • [ ] 知识固化三件套:数据集论文 + 挑战赛报告(Top 队联署)+ 方法论文集——赛后 12 个月内把榜单固化为文献。
  • [ ] 开源义务绑定获奖(Top 5 须 14 天内开源)——把"可复现"写进获奖条件而不是倡议。
  • [ ] 仓库存档官网全文——平台会改版,Git 不会。
  • [ ] 许可分层写清楚(数据/文档/代码各一套)——并在 README 用 bibtex 示范三层引用。

附录 J:相邻基准对比细则

把 TrackRAD2025 放进"时序医学影像基准"的近邻集合中看设计差异:

基准 模态/任务 时序结构 标注范式 实时约束 领域后果指标
TrackRAD2025 cine-MRI / 掩码追踪 连续帧序列(1-8 Hz) 首帧模板 + 逐帧真值 有(计分) 有(Rel. D98)
医学 VOS 类基准(内镜/超声视频分割) 视频 / 分割 连续 逐帧或稀疏 通常无 无
fastMRI(库内 #23) k 空间 / 重建 单帧(多 coil) 无需 重建不要求 无(图像质量指标)
4D 呼吸运动数据集 4D-CT / 运动建模 相位分箱 隐式 无 剂量学间接
手术视频相位/工具分割 内镜视频 / 分割+识别 长视频 逐帧/秒级 少数有 无

读表可见 TrackRAD2025 的差异化三连:真实时(计分)× 真治疗数据(疗程中采集)× 真后果(剂量学)。三项全占的公开基准在医学影像里目前仍是少数——这也是它对"干预闭环类 AI"研究的范本价值所在。

反向的启示是它的局限:单层面 2D、无跨分次纵向标注、无 3D 体积、无在线自适应闭环数据——这些留白恰好是下一代数据集(4D cine、跨分次追踪、闭环 RL)的机会清单。

附录 K:数据使用合规检查清单(商用/发表前过一遍)

许可与署名:

  • [ ] 数据使用场景确认在 CC-BY-NC 范围内(非商业);商用意向已单独评估(坑 2)
  • [ ] 转载/展示的病例图像符合去标识化惯例(不用于宣传)
  • [ ] 引用三件套齐:数据集论文(Med Phys)+ 挑战赛报告(MedIA,若引赛果)+ HF DOI(若引数据)

技术边界:

  • [ ] 训练/验证按患者划分,无跨序列泄漏
  • [ ] 未假设 108 例标注全部可得(按 88 例公开口径规划)
  • [ ] 未把 2D 追踪结论外推为 3D 剂量/立体定向结论
  • [ ] 多观察者数据未混入主训练集
  • [ ] 帧率/场强条件化处理已声明(或明确声明未使用)

报告规范:

  • [ ] 报告了数据划分、版本/revision(HF Revision 505ec64 口径)
  • [ ] 单指标成绩标注了"单项",综合名次以挑战赛报告为准
  • [ ] 计时口径写明(本地裸机 vs 平台 A10G)
  • [ ] 引用了官方评测实现(或声明自建差异)

红线自查:

  • [ ] 未使用 Zenodo cc-by-4.0 字段作为数据许可声明
  • [ ] 未引用 arXiv:2503.17941 作为数据集论文(正确 2503.19119)
  • [ ] 未把 BZKF 早期数字(500 例/250 万帧)当定稿口径

附录 L:进阶问答(FAQ 续)

Q11:为什么接口要传 scanned_region?直接看图像不行吗?
可以,但组织方选择把先验显式化:区域决定了运动幅度先验(盆腔几毫米 vs 胸部数厘米)、解剖背景与序列特征。把它编码为输入等于把"条件先验"标准化,让方法对比在公平的先验条件下进行——不用的队伍也不会因此吃亏(当噪声忽略即可),但善加利用的方法(如按区域切换运动模型)有制度空间。

Q12:挑战赛评测的 58 例测试与公开的测试数据是什么关系?
同一批数据:8 例预测试 + 50 例最终测试。赛期仅通过平台提交访问;赛后公开到 HF(trackrad2025_labeled_testing_data/ 与 labeled_pre-testing_data/),但部分病例因隐私不公开——因此公开测试子集(连同 50 例训练标注凑成 88 例口径)小于赛期评测全集,本地复现的排名与官方排名可能在小样本上有出入。

Q13:能不能只用未标注数据训练出一个有竞争力的模型?
季军证明了"完全不用 cine-MRI 训练数据"能拿第三(CoTracker3 零样本),说明预训练先验价值巨大;但纯靠 477 例未标注自监督从头学分割,目前没有公开的榜单级证据支持——更现实的定位是把未标注数据当作微调阶段的正则/伪标签来源(冠军路线的半监督语义)。

Q14:数据里有没有健康对照或非肿瘤病例?
没有专门的健康对照组。所有数据来自放疗疗程中的患者,标注目标是"照射靶区或追踪替代物"——这是一个纯治疗场景数据集,不做疾病诊断类任务。

Q15:挑战赛报告里我该最关注哪几张表/图?
三个看点:① 终榜全指标表(一切转引的权威口径);② 跨站点/跨场强分层分析(方法泛化性的官方证据);③ 失败案例分析(什么运动模式下全体方法都掉分——那是真实的科研空白)。

Q16:未标注数据有没有质量控制说明?
未标注子集与标注子集同源于六中心治疗流;官方未单独发布未标注数据的质量分级表。实际使用时的隐性 QC 信号:frame-rate/scanned-region 元数据完备性、序列长度合理性、明显伪影需逐例目检——这正是它被定位为"自监督粮仓"而非"评测集"的原因(评测只在标注子集上发生)。

Q17:同一患者跨区域的多次扫描(frames2/frames3)有什么研究价值?
它是天然的"同体跨域"样本:同一解剖结构在不同日期、不同区域、(可能)不同序列参数下的表现——适合做时序一致性、患者内泛化、扫描协议鲁棒性研究。注意它不是呼吸周期内的连续帧,别当时间连续序列用(坑见附录 E 错误 3)。

Q18:想复现剂量学指标,需要哪些开源组件?
需要:MLC 叶片序列生成(按预测掩码投影)、剂量计算引擎(如 matRad 类开源 TPS 或厂商研究接口)、D98 统计。官方未把这些打包进 GitHub(评测容器内含平台私有实现)——多数团队走 post-challenge 平台提交获取该指标,本地只做几何四指标。

Q19:这个数据集适合做基础模型(foundation model)的预训练语料吗?
适合做"医学视频/时序预训练"的补充语料(280 万帧 MRI 视频),但有三个限制:单层面 2D(缺 3D 空间结构)、单一矢状位视角、非商业许可传导到下游权重。与 fastMRI(k 空间)、大规模 3D CT 语料互补而非替代。

Q20:条目里的"推演统计"(附录 G)能直接引用吗?
不能。附录 G 是本条目基于官方口径数字的算术推演(标注了"推演值"),仅作管线自检对照;正式引用请回到三个权威源(论文 2 tables、官网 data 页、挑战赛报告)。

Q21:.mha 文件用什么库读?
任意 ITK 生态库:SimpleITK(sitk.ReadImage)、nibabel(部分支持)、medpy。官方仓库的转换与评测代码即按 ITK/MHA 生态实现。注意 T 维在最末(W,H,T)。

Q22:官方榜单在哪看?
挑战赛官网的 Leaderboard 页(grand-challenge 平台托管);赛期终榜冻结展示,post-challenge 榜单持续更新——两者分开呈现,引用时注明是哪一榜。

Q23:冠军代码能直接商用吗?
冠军开源仓库(DIAGNijmegen/TrackRAD25_submission)的许可证以该仓库为准(开源义务来自挑战赛规则,具体 license 由队伍自选)——且模型权重若含 CC-BY-NC 数据训练成果,商用边界回到数据许可评估。两层都要查。

Q24:0.35T 与 1.5T 数据各占多少?
官方未发布逐中心逐场强的统计表。用 field-strength.json 遍历自查即可(一秒遍历完所有小 JSON)——这也是双场强子集做分层实验前必须做的第一步。

Q25:如何引用本条目?
引用千方病案医数集条目页(占位 URL https://www.qianfanghub.com/ai-ready-dataset/trackrad/669,入库后归一);同时务必引用官方三件套(数据集论文/挑战赛报告/HF DOI)——条目是导读,数据结论以官方文献为准。

附录 M:扩展阅读路线图

按"从这条数据集出发想往哪走"组织的四条阅读路线:

路线一:懂放疗背景(数据集 → 临床语境)

  1. Keall 等 2022 Nat Rev Clin Oncol 综述(MRgRT 全景,doi:10.1038/s41571-022-00631-3)
  2. Lombardo 等 2024 Radiother Oncol 109970(实时运动管理现状与 AI 前景——本数据集的直接前传)
  3. ESTRO 2025/2026 上组织方的报告材料(官网与 GitHub 存档)

路线二:懂方法谱系(数据集 → 算法)

  1. 挑战赛报告 Med Image Anal 2026;112:104134(全部方法的统一评测)
  2. 季军论文 LNCS doi:10.1007/978-3-032-35046-6_2(零样本点追踪范式)
  3. BreizhTrack arXiv:2510.25990(SAM 微调路线完整复盘)
  4. MedSAM2 arXiv:2504.03600、CoTracker3 arXiv:2410.11831(两个底座模型原文)
  5. XMem arXiv:2509.18591(记忆网络路线)

路线三:懂数据工程(数据集 → 数据集建设)

  1. 数据集论文 Med Phys 52(7):e17964(采集协议与格式设计的正式描述)
  2. 官方 GitHub 的 scripts/(厂商专有格式 → 开放格式的转换实践)
  3. 本条目 §2.4/§2.9/附录 G(结构画像与体检单)
  4. 对照读库内 fastMRI 条目(另一套"挑战赛数据格式设计"的范本)

路线四:懂挑战赛运营(数据集 → 赛事设计)

  1. 官网 rules 页 + winners 公告(Git 存档版)
  2. 本条目 §3.6/§5.1/附录 I(提交经济学与设计清单)
  3. Grand Challenge 平台文档(评测容器与计时基础设施)

三条提醒:阅读顺序上别跳过挑战赛报告直接引团队论文(后者常有自评偏差);所有 arXiv 编号引用前对一遍标题(坑 1 的教训);2026 年之后的新文献先查官方 README 的更新段落(post-challenge 生态在持续演化)。

附录 N:条目制作说明(核验过程存照)

任务与代理:千方病案医数集【50 篇冲刺批量生产 · 批次 2】条目 trackrad,写手代理 agentA-trackrad;租约锁 writing/trackrad/.lock(agentA-trackrad,2026-09-27T05:31:55+0800 建立);环境留痕 ps aux | grep -c "[c]odebuddy" = 4。

三源核验记录(2026-09-26/27):

源 访问方式 关键确认
Zenodo zenodo.org 与 API(records/15044965 → concept;records/15044966 → v1) 标题/19 创作者/MICCAI meeting/cc-by-4.0(仅 PDF)/123 KB 文件
官网 trackrad2025.grand-challenge.org(首页/rules/data/winners-announcement 四页) 477+108/280 万帧/6 中心/6 指标/时间线/Top 5/CC-BY-NC
arXiv/ADS ADS 摘要页 + GitHub bibtex 正确编号 2503.19119;Med Phys 正式版 52(7):e17964
官方 GitHub github.com/LMUK-RADONC-PHYS-RES/trackrad2025 目录结构/体积(200+3+3 GiB)/接口签名/许可证文本/MedIA 报告 DOI/开源冠军仓库
HuggingFace doi.org/10.57967/hf/4539 重定向(hf-mirror API 探测失败于错误组织名,重定向确认 LMUK-RADONC-PHYS-RES/TrackRAD2025) 仓库名/CC-BY-NC 卡片/Revision 505ec64
旁证 BZKF 新闻、DGMP 2026 摘要、Springer LNCS 卷页、Unpaywall 溯源与口径漂移证据(500/2.5M 旧口径、n=88 公开标注、论文集 ISBN)

查重记录:url_name ILIKE '%trackrad%' → 0 行;互链检索 %mri%(fastmri/duke-breast-mri)、%radio%/%cancer%/%tumor%/%tracking%(nsclc-radiomics/nsclc-radiogenomics/atlas-liver-tumor/cancerlinq/radgraph2-radiology-reports/covid-19-radiography);ls writing/ 无同名目录(tus-rec 为备选家族已存在目录,不影响本 slug)。

已识别并修正的写作期错误:编辑过程中一次锚点替换曾误删 §10 章节标题(坑 1-8 内容短暂挂于 §9 之下),自检前已发现并恢复——本条目成稿经全文结构复查后定稿。

自检承诺:成稿经 python3.11 scripts/check_md.py 与 python3.11 scripts/preflight_check.py 双检,结果见最终汇报(期望双 PASS)。

附录 O:中英术语对照表

中文 英文 备注
磁共振引导放疗 MRI-guided radiotherapy (MRgRT) 也写 MR-linac radiotherapy
磁共振-直线加速器 MRI-linear accelerator (MRI-linac / MR-linac) 本数据集双厂商:MRIdian / Unity
电影序列磁共振 cine-MRI 同层面连续成像的"电影"模式
矢状位 sagittal 本数据集统一采集平面
实时肿瘤追踪 real-time tumor tracking 挑战赛核心任务
视频目标分割 video object segmentation (VOS) 任务的计算机视觉范式
首帧模板分割 template segmentation on the first frame 算法唯一先验
形变图像配准 deformable image registration (DIR) 临床现行轮廓传播方案
多叶准直器追踪 multi-leaf collimator (MLC) tracking 数据集推动的临床目标
射束门控 beam gating 当前主流保守方案
呼吸运动 respiratory motion 胸腹肿瘤位移主因
运动管理 motion management 放疗物理学科分支
表面距离 surface distance (SD95/SDavg) 边界误差指标
质心误差 center-of-mass error (CD) 位置误差指标
剂量学精度 dosimetric accuracy (Rel. D98) 剂量安全指标
自监督学习 self-supervised learning 未标注数据利用路线
半监督学习 semi-supervised learning 冠军路线标签
零样本迁移 zero-shot transfer 季军路线标签
域偏移 domain shift / distribution shift 双场强跨中心的核心难点
分布外泛化 out-of-distribution (OOD) generalization 参赛复盘的焦点议题
观察者间变异 interobserver variability 多观察者子集的用途
挑战赛 grand challenge Grand Challenge 平台上的竞赛
榜单 leaderboard 预测试/最终/post-challenge 三榜
数据集卡 dataset card HF 仓库的元数据页

附录 P:给互链建设者的操作建议

本条目在库内的链接价值:

  1. MRI 时序维度锚点:库内 MRI 系条目(fastmri、duke-breast-mri)与本条目互链后,“MRI"标签网络的覆盖从静态扩展到时序——建议互链锚文本用"cine-MRI 实时追踪"而非泛化"MRI 数据集”。
  2. 放疗主题首篇:%radiotherapy%/%linac% 查库为空,后续任何放疗类条目(4D-CT、放疗计划、剂量预测)都应以本条目为首链点。
  3. 挑战赛系聚类:category_tags 含"挑战赛数据集"“评测基准”,与库内同标签条目自动形成聚类;本条目可作"评测设计"话题的引用源(六指标 + 剂量学感知评测的范本)。
  4. 运动/实时成像家族:与 writing/tus-rec/(超声扫查重建)在"自由手实时成像"话题互链;未来若有手术视频、内镜视频条目,同样适用"实时约束下的时序算法"话题桥接。

建议的双向互链对(按 record_id):

本条目侧锚文本 对端条目 对端侧建议锚文本
“同为 MRI 模态挑战赛基准的 fastMRI” fastmri (23) “与 TrackRAD2025 同属 Grand Challenge 生态”
“MRI 模态内多样性的另一例” duke-breast-mri (440) “乳腺 MRI 静态分析对照时序 cine 追踪”
“肺癌放疗的影像组学上游” nsclc-radiomics (247) “肺癌治疗链条的执行端见 TrackRAD2025”
“肝肿瘤是呼吸运动追踪的典型器官” atlas-liver-tumor (431) “运动影响的腹部器官,实时追踪见 TrackRAD2025”

反链检查清单:互链上线后核对 ① 双向可达(无单向孤链);② 锚文本不含"坑"字残留(如"见坑 2"类内部引用不要出现在互链锚文本);③ 链接指向 https://www.qianfanghub.com/ai-ready-dataset/trackrad/669 占位 URL(入库时由系统归一)。

标签网络定位:本条目 6 个标签(医学影像/MRI/医学图像分割/挑战赛数据集/评测基准/肿瘤学)在 L1-L2-DISEASE 三层各占一档,是库内少见的"全层覆盖"配置——互链算法的相关度计算中,它与影像类、分割类、基准类条目均有非零边权,适合做互链网络的枢纽节点。

附录 Q:与 fastMRI 的设计对照——两个 MRI 挑战赛数据集的镜像课

TrackRAD2025 与库内 fastMRI(record 23)同为"Grand Challenge 生态的 MRI 挑战赛数据集",但设计决策几乎处处相反——对照读是理解"数据集设计服务于任务本质"的最佳案例组。

设计维度 fastMRI TrackRAD2025
MRI 子任务 重建(k 空间 → 图像) 追踪(图像序列 → 逐帧掩码)
数据本质 原始 k 空间采样 治疗中 cine 视频流
标注需求 无人工标注(图像本身即真值) 108 例逐帧人工掩码(核心成本)
规模策略 万例级(大而全) 585 例(小而深,双轨)
域多样性 单一机型族 + 采样策略受控 双厂商六中心,域差是任务本身
实时约束 无(离线重建) 有(1 秒/帧,计分)
领域后果指标 图像质量指标(PSNR/SSIM) 剂量学精度(Rel. D98)
未标注数据角色 不需要(k 空间自监督天然成立) 独立子树(200 GiB,预训练粮仓)
许可 CC-BY-NC(同向) CC-BY-NC(同向)
测试集策略 公开验证 + 秘密测试 8 例校准 + 50 例决赛(2 次提交)
赛后形态 数据持续用于重建研究 开放榜单 + 报告固化

三组"镜像课"值得展开:

课一:标注成本决定规模哲学。fastMRI 的"真值"来自物理(全采样 k 空间),标注零成本,于是走万例大库路线;TrackRAD2025 的真值来自人工逐帧勾画(每例数百帧),标注昂贵,于是 477 例未标注走量、108 例标注走质。对准备立项数据集的团队,第一个要回答的问题就是"你的真值从哪来、多贵"——答案直接决定规模设计。

课二:域差是负担还是考题,取决于任务。fastMRI 的域差(机型、线圈)是要被模型"抹平"的 nuisance;TrackRAD2025 的域差(场强、中心)被显式编码为输入先验(magnetic_field_strength)。同一现象(多中心多机型)在不同任务里的数据处理策略完全不同——取决于域信息对输出是干扰还是条件。

课三:领域后果指标的可行性差异。fastMRI 的后果(诊断质量)难以量化进评测,退而求其次用图像质量指标;TrackRAD2025 的后果(剂量偏差)可以用物理仿真精确量化,于是 Rel. D98 进了排名。教训:后果指标能不能建,取决于你领域有没有可信的"误差 → 后果"仿真器——有则务必放进排名(见 §9.2),没有则至少把代理指标的相关性讨论写进评测文档。

两库互补的最终图景:fastMRI 教会社区"MRI 采集侧的 AI",TrackRAD2025 教会社区"MRI 治疗侧的 AI"——加上 duke-breast-mri 的静态诊断维度,MRI 全生命周期(采集 → 诊断 → 治疗)的公开数据版图在库内可以拼完整。

附录 R:管线故障排查 15 例

基于该数据集格式特征与社区常见报错整理的排查清单(症状 → 根因 → 处方):

例 1:snapshot_download 下载量远超预期
根因:未传 allow_patterns,默认全仓(含 200 GiB 未标注子树)。
处方:杀掉进程,按子树前缀重新拉取;磁盘预留按 §4.2 表核对。

例 2:json.load 报 “Expecting value”
根因:把 field-strength.json 当字典读(它是裸标量,如 0.35)。
处方:float(open(p).read()) 或 json.load 后直接当数值用;scanned-region.json 同理是裸字符串。

例 3:掩码与图像维度不匹配
根因:target 形状是 (W,H,1),掩码输出按 (W,H) 写出。
处方:对齐接口签名——输出必须逐帧堆叠为 (W,H,T);首帧模板保持 (W,H,1)。

例 4:训练 loss 正常但评测 Dice 近零
根因:T 维顺序转错(框架默认 (T,H,W) 与数据的 (W,H,T) 相反)。
处方:显式 transpose 并用单例数据目检帧序(呼吸相位应连续);别信"训练跑通了"。

例 5:frames2.mha 出现在训练集但不在文件清单里
根因:文件枚举用 glob *_frames.mha,漏掉带数字后缀的 frames2/frames3。
处方:枚举模式改为 *_frames*.mha 并解析后缀序号;同时读对应带后缀的 JSON 元数据。

例 6:验证集 Dice 异常高于测试
根因:按序列划分导致同一患者跨两侧(多扫描泄漏)。
处方:按患者 ID 分组划分(GroupShuffleSplit 类实现)。

例 7:推理超时被判罚
根因:TTA/滑窗等推理期增强把单帧耗时推过 1 秒线。
处方:推理期开销全部砍掉或蒸馏进离线训练;计时按平台口径(A10G + 容器开销)预留 20% 余量。

例 8:本地 A100 上很快、平台 A10G 上超时
根因:架构差异(A10G 无 A100 的显存带宽/算力),batch 或精度策略不适配。
处方:按 A10G 24GB 重新调 batch/精度(FP16);平台提交前先按 A10G 规格做本地压测。

例 9:SimpleITK.ReadImage 返回数组方向与预期镜像
根因:MHA 头的方向矩阵与 numpy 行列序组合的惯例混淆。
处方:统一用 sitk.GetArrayFromImage(输出为 Z,Y,X 序),写一次适配层全仓复用;目检一帧确认左右不镜像。

例 10:评测脚本报告"找不到 labels"
根因:多观察者文件的命名带后缀(如 _labels2.mha),评测器只认主文件。
处方:用官方 evaluation/ 目录的实现而非自写解析;多观察者文件用于一致性实验时单独枚举。

例 11:Docker 提交在平台找不到 GPU
根因:平台提交表单"Job required gpu type"未选 A10G。
处方:重选机型重提——这也是官方保证计时一致性的机制,不是 bug。

例 12:训练标注集 50 例跑大模型全参微调爆显存
根因:视频基础模型全参微调的显存需求远超 24GB。
处方:LoRA/冻结骨干/梯度检查点三选一起步(BreizhTrack 用统一低学习率全模块微调是 48GB 卡的配置,24GB 上需降级)。

例 13:下载的测试子树例数与预期 58 不符
根因:部分最终测试病例因隐私不公开(坑 3)。
处方:按实际到手清单规划复现;与官方榜单对比时注明"公开子集口径"。

例 14:案例 Z_001 的 b-field-strength.json 在正式数据里找不到
根因:example 与正式数据命名不同(坑 6)。
处方:解析器双兼容两套命名;以官方 README 最新段落为 schema 权威。

例 15:自建评测的 DSC 与官方榜单差 0.01-0.02
根因:评测细节差异(二值化阈值、空掩码处理、逐帧汇总方式)。
处方:换用官方 evaluation/ 实现重算;仍不一致则检查是否混入了预测试与最终测试两阶段的不同例集。

附录 S:数据体检脚本示例

与 §2.9 体检单对应的可执行骨架(标准库 + SimpleITK,复制即改):

import json, glob, os
from collections import Counter
import SimpleITK as sitk

ROOT = "dataset/trackrad2025_labeled_training_data"
field_strengths, regions, frame_rates = Counter(), Counter(), []
seq_lengths = []

for case_dir in sorted(glob.glob(os.path.join(ROOT, "*"))):
    pid = os.path.basename(case_dir)
    # 1) 元数据:带数字后缀的变体一起枚举
    for fs_file in glob.glob(os.path.join(case_dir, "field-strength*.json")):
        field_strengths[json.load(open(fs_file))] += 1
    for region_file in glob.glob(os.path.join(case_dir, "scanned-region*.json")):
        regions[json.load(open(region_file))] += 1
    for fr_file in glob.glob(os.path.join(case_dir, "frame-rate*.json")):
        frame_rates.append(float(json.load(open(fr_file))))
    # 2) 序列长度:frames*.mha 全枚举(勿漏 frames2/frames3)
    for img_file in glob.glob(os.path.join(case_dir, "images", "*_frames*.mha")):
        seq_lengths.append(sitk.ReadImage(img_file).GetSize()[2])  # T 维
    # 3) 标注盘点:多观察者 = targets/ 下多个非 first_label 文件
    labels = [f for f in glob.glob(os.path.join(case_dir, "targets", "*_labels*.mha"))]
    if len(labels) > 1:
        print(f"[multi-observer] {pid}: {len(labels)} 份逐帧标注")

print("场强分布:", dict(field_strengths))
print("区域分布:", dict(regions))
print("帧率 min/median/max:",
      min(frame_rates), sorted(frame_rates)[len(frame_rates)//2], max(frame_rates))
print("序列长度 min/median/P95:",
      min(seq_lengths), sorted(seq_lengths)[len(seq_lengths)//2],
      sorted(seq_lengths)[int(len(seq_lengths)*0.95)])

三个扩展点:① 把 Counter 换成分层交叉(场强 × 区域)得到二维分布;② 对未标注子树复用同一脚本(targets/ 为空属正常);③ 把输出存为 JSON 随实验配置归档——数据画像随时间漂移(测试集公开化进程)时可 diff 出变化。


条目完。 TrackRAD2025:放疗床上的一次"数据民主化"实验——280 万帧真实治疗的 cine 流,从此属于每一个愿意追着肿瘤跑的算法。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • promise12 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • wsss4luad — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 评测基准 / 肿瘤学
  • monusac — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 评测基准 / 肿瘤学
  • lascarqs — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 评测基准
  • prostatex — 共享标签:医学影像 / MRI / 挑战赛数据集 / 肿瘤学
  • pi-cai — 共享标签:医学影像 / MRI / 挑战赛数据集 / 肿瘤学
  • ulf-enc — 共享标签:医学影像 / MRI / 挑战赛数据集 / 评测基准
  • brats-africa — 共享标签:医学影像 / MRI / 医学图像分割 / 肿瘤学
  • prostate158 — 共享标签:医学影像 / MRI / 医学图像分割 / 评测基准
  • trials — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 评测基准 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集