VLM3D 2025 (vlm3d) — AI-Ready Wikipedia

MICCAI 2025 官方注册的 3D 医学影像视觉语言建模挑战赛——基于 CT-RATE 25,692 例胸部 CT 与配对放射学报告,设 CT 报告生成、多异常分类、自监督多异常定位、文本条件 3D CT 生成四大任务,Docker 容器服务端评测封闭测试集,冠军方法发表于 ICCV 2025 Workshop,2026 届扩展 MR-RATE 脑 MRI 赛道

来源 CT-RATE 非增强胸部 CT(土耳其伊斯坦布尔梅迪波尔医院单中心,3 家厂商扫描仪,年龄 18-102 岁,性别均衡)+ 放射科医生撰写的 impression/findings 配对报告 + 微调 RadBERT 从报告自动抽取的 18 种胸部异常多标签发布时间: 2026-09-27最后更新: 2026-09-27 阅读 17
VLM3D 2025 (vlm3d) — AI-Ready Wikipedia

信息速览

数据集名称VLM3D 2025 (vlm3d) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模训练/验证 21,304 位独立患者(25,692 个 study / 50,188 个 volume / 超 1,430 万张 slice);评测集 2,000 例内部 + 1,024 例波士顿大学
接入方式CT-RATE 非增强胸部 CT(土耳其伊斯坦布尔梅迪波尔医院单中心,3 家厂商扫描仪,年龄 18-102 岁,性别均衡)+ 放射科医生撰写的 impression/findings 配对报告 + 微调 RadBERT 从报告自动抽取的 18 种胸部异常多标签
AI 就绪度

INFOBOX — VLM3D 2025 一屏速览

维度 内容
本质 MICCAI 2025 官方注册挑战赛(satellite event)+ 围绕 CT-RATE 构建的 3D 医学影像视觉语言基准;非独立数据集论文,而是"数据集+赛题+榜单"三合一
全称 Challenge for Vision-Language Modeling in 3D Medical Imaging(VLM3D Challenge)
组织方 Forithmus 牵头 + 多机构联盟:苏黎世大学、伊斯坦布尔梅迪波尔大学、波士顿大学、斯坦福、哈佛、约翰霍普金斯、帝国理工、上海交大、都柏林大学学院、NIH、ETH 苏黎世、NVIDIA
关键人物 第一作者/发起人 Ibrahim Ethem Hamamci(CT-RATE/CT-CLIP/CT-CHAT 一作);组织委员会含 Bjoern Menze、Kayhan Batmanghelich、Pranav Rajpurkar、Alan Yuille、Zongwei Zhou 等
底层数据 CT-RATE:25,692 个非增强胸部 CT study(21,304 患者)/ 50,188 个 3D volume / 超 14.3M 张 slice / 18 种异常多标签 / 配对放射学报告
四大任务 ①CT 报告生成 ②多异常分类(18 标签)③自监督多异常定位 ④文本条件 3D CT 生成
赛制 Docker 容器(≤50 GB)服务端评测隐藏测试集;内部测试 2,000 例 + 波士顿大学外部测试 1,024 例(均不公开);point-based permutation test 排名
参与规模 双口径:Forums 页 73/68/53 人 vs Forithmus 现页 120/115/80 人(三赛道);媒体口径报告生成 161 人——引用必须注明届别与抓取日期(坑 4)
结果发表 冠军方法发表于 ICCV 2025 VLM3D Workshop(如 CTFlow:video-inspired latent flow matching 文本条件 3D CT 合成)
工业获奖 影禾医脉(报告生成第一、分类第三)、Deepnoid M4CT(定位第一、分类第一、报告生成第三)——报告生成名次两源冲突,官方榜单未直接核验(坑 6)
许可 CT-RATE 与挑战赛本体均 CC BY-NC-SA;封闭测试集不公开;CT-CLIP/CT-CHAT 代码 GitHub 开源
2026 届 第二届扩展 MR-RATE(脑 MRI 约 100,000 配对扫描-报告),CT×3 + MR×3 六赛道,MICCAI 2026 satellite event
库内互链 ct-rate(546)(上游本体)、mimic-cxr(16)/ms-cxr(340)/ms-cxr-t(619)(2D 对照系)、chexstruct-cxreasonbench(604)、radvlm-instruction-dataset(624)、vindr-cxr(125)(消歧对照)

VLM3D 2025 是一个"把最大 3D 胸部 CT 影像-文本数据集变成公开竞技场"的挑战赛:它不新采集数据,而是把 Hamamci 等人发布的 CT-RATE(25,692 个非增强胸部 CT study、50,188 个 3D volume、配对放射学报告、18 种异常多标签)包装成四个明确的赛题——报告生成、多异常分类、自监督定位、文本条件 CT 生成——并用 Docker 容器服务端评测的方式,让全世界参赛队伍在同一套隐藏测试集上比出高下。它是 MICCAI 2025 官方注册挑战赛(2025 年 9 月 23-27 日,韩国大田),冠军方法随后发表于 ICCV 2025 的 VLM3D Workshop。对"3D 医学影像 + 语言"这条在 2024 年之前几乎空白的技术路线来说,VLM3D 是第一座统一的、可复现的、有榜单的里程碑。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——训练/验证数据就是 HuggingFace 上的 CT-RATE(CC BY-NC-SA,gated),封闭测试集不公开,别找错门。
  2. 想参赛或复现赛题:直奔 §4 四大任务与 §5 赛制——四个任务的输入输出、指标、评测方式各不相同,Docker ≤50 GB 的硬约束别忽略。
  3. 关心榜单与排名:直奔 §7 结果与生态——参与数字和名次都有多口径(坑 4、坑 6),引用前先对表。

§0 导读:这个挑战赛解决什么问题

医学影像的"视觉语言建模"(vision-language modeling)在 2D 胸片上已经相当成熟:MIMIC-CXR 提供了数十万张配对报告的胸片,MS-CXR 在其上补充了局部对齐监督,CheXbert 类工具把报告变成结构化标签,RadVLM 一类的视觉语言模型(VLM)能在胸片上做报告生成与视觉问答。但把镜头从 2D 切到 3D——也就是真正承载解剖信息的容积 CT——局面完全不同:3D 影像的数据体量大一个数量级、标注成本高一个数量级,长期没有一个大型的"volume + 报告"公开配对数据集,更没有一个统一的评测舞台。2024 年底 CT-RATE 的发布填补了数据空白,VLM3D 2025 则填补了评测空白:它把"你有数据"推进到"大家用同一把尺子量"。

VLM3D 的回答分四层。第一层是任务设计:从 CT-RATE 的报告与标签出发,拆出四个覆盖"看懂—说出—找到—生成"全链路的赛题——CT 报告生成(volume → 自由文本)、多异常分类(volume → 18 标签)、自监督多异常定位(不用人工标注找病灶)、文本条件 3D CT 生成(报告 → 合成 volume),四题共享同一套公开训练数据,公平可比。第二层是评测纪律:所有提交以 Docker 容器形式交付(≤50 GB),在服务端隐藏测试集(内部 2,000 例 + 波士顿大学外部 1,024 例)上自动评测,参赛者自始至终见不到测试数据——这在医学影像挑战赛里是对"测试集泄露"这一顽疾的正面回应。第三层是生态杠杆:冠军方法进入 ICCV 2025 VLM3D Workshop 正式发表,CTFlow 等方法随即成为文本条件 3D CT 合成的公开基线。第四层是可持续性:2026 届用同一套赛制扩展到脑 MRI(MR-RATE,约 100,000 配对扫描-报告),把"CT 教科书"升级为"跨模态平台"。

对数据集百科的读者而言,VLM3D 的价值定位需要说清楚:它的"数据集本体"就是 CT-RATE——本库已另立 ct-rate(546) 条目专述数据本身;VLM3D 条目的独立价值在于赛制(Docker 服务端评测的模板价值)、任务定义(四大任务后来成为 3D 医学 VLM 的标准评测口径)、榜单生态(工业界队伍的参与与名次)与 2026 届的跨模态扩展。换句话说:ct-rate 条目回答"数据长什么样",本条目回答"这些数据如何被用来公平地衡量一个领域的进步"。

§0 读法三则:

  1. 本条目是"数据集+赛题+榜单"三合一:数据本体归 CT-RATE(另见 ct-rate 条目),本条目聚焦挑战赛本身——任务、赛制、结果、生态。两者许可与获取方式同源但引用口径不同。
  2. 全文统计数字均出自官方三源(vlm3dchallenge.com / MICCAI 官网 / Zenodo)与底层数据论文(arXiv:2403.17834);所有已知口径冲突(参与数字、排名名次、DOI 后缀、规模三口径)分别在坑 2、坑 3、坑 4、坑 6 存照。
  3. 检索时若把 arXiv:2509.15772(同名 “VLM3D” 的 text-to-3D 生成论文)当作本挑战赛的论文会张冠李戴——两者毫无关系(坑 1)。

0.4 赛前技术空白:2024 年的 3D 医学 VLM 缺什么

要理解 VLM3D 的立项逻辑,可以倒放 2024 年底 3D 医学视觉语言领域的空白清单——VLM3D 的每一个设计决策几乎都能在清单里找到对应项:

空白 2D 世界的现状(彼时) 3D 世界的缺口 VLM3D 的对应设计
大规模配对语料 MIMIC-CXR 数十万对 CT-RATE 刚发布(2024 底),知名度与使用范式未建立 直接以 CT-RATE 为唯一合法训练数据,强制生态汇聚
统一评测 报告生成/分类各有惯用基准 各论文各测各的,数字互不可比 四任务统一口径+统一划分
防泄露评测 测试集常随论文公开或半公开 同样如此 双封闭测试集+Docker 服务端
跨机构信号 多中心数据集渐多 CT 数据多为单中心 波士顿大学外部测试集单列
生成方向基准 2D 合成尚属边缘 文本→3D 几乎无人量化评测 任务四+FVD/FID/CLIP/IS 指标族
方法社区 RadVLM、LLaVA-Med 等活跃 3D 专用方法稀缺(CT-CLIP/CT-CHAT 刚起步) 冠军方法进 Workshop,公开方法基线

这张表也解释了为什么 VLM3D 选在 CT-RATE 发布后约半年即开赛:数据刚立、方法未聚,是"以赛聚才"的最佳窗口期。事实证明窗口判断正确——首届即有跨三大洲的参赛者与公司级队伍入局(§5.3,注意口径)。

§1 数据集速览:十问十答

Q1:VLM3D 的全称与身份是什么?
全称 Challenge for Vision-Language Modeling in 3D Medical Imaging(3D 医学影像视觉语言建模挑战赛),简称 VLM3D Challenge。它是 MICCAI 2025 官方注册挑战赛(satellite event),2025 首届设 CT 赛道,2026 第二届扩展 MRI 赛道。注意它是 official challenge 但不是 MICCAI 2025 的 lighthouse challenge(灯塔挑战赛三席为 BraTS、SAGES-CVS、UNICORN,坑 8)。

Q2:比赛用的是什么数据?
训练/验证数据全部来自公开的 CT-RATE 数据集:25,692 个非增强胸部 CT study(来自 21,304 位独立患者),按多种重建展开为 50,188 个 3D volume,总计超 1,430 万张 2D slice;每个 study 配对放射科医生撰写的报告(含 impression 与 findings 两节),并由微调 RadBERT 从报告自动抽取 18 种胸部异常多标签。训练用 20,000 患者,内部验证用 1,304 患者。

Q3:四大任务分别是什么?
①CT 报告生成:输入 3D 胸部 CT,输出自由文本报告,指标以 BLEU(1-4) 为代表;②多异常分类:对 18 种胸部异常做多标签分类,指标为 AUC;③自监督多异常定位:训练阶段不使用任何人工 ground-truth 标注,定位心包积液、胸腔积液、实变、肺影、肺结节等病灶,用人工标注集评测;④文本条件 3D CT 生成:输入报告文本,输出合成 3D CT volume,指标为 FVD/FID/CLIP score/IS 一族。

Q4:谁在办这个比赛?
Forithmus(研究机构)牵头的多机构联盟:苏黎世大学、伊斯坦布尔梅迪波尔大学、波士顿大学、斯坦福大学、哈佛大学、约翰霍普金斯大学、帝国理工伦敦、上海交通大学、都柏林大学学院、NIH、ETH 苏黎世、NVIDIA。Zenodo 记录署名 32 位作者;发起人与第一作者 Ibrahim Ethem Hamamci 是 CT-RATE、CT-CLIP、CT-CHAT 三个工作的一作(苏黎世大学/伊斯坦布尔梅迪波尔)。

Q5:赛制怎么评?
参赛者训练模型后打包成 Docker 容器提交(容量上限 50 GB),由组织方在隐藏的封闭测试集上服务端评测:内部测试集 2,000 例(梅迪波尔分布内)+ 波士顿大学医院外部测试集 1,024 例。测试数据不公开;仅最终有效提交参与排名;排名采用基于主指标的 point-based permutation test 方案。

Q6:多少人参赛?
存在多口径:vlm3dchallenge.com 的 Forums 页面(2025 届收官后)显示 CT-ABNORMALITY 73 人/40 次提交、CT-REPORT 68 人/49 次、CT-VOLUME 53 人/20 次;research.forithmus.com 现页(2026 届视图)显示 120/165、115/126、80/192;媒体报道口径报告生成赛道 161 人参与综合排名。引用时必须注明届别与抓取日期(坑 4)。

Q7:结果发表在哪里?
冠军方法发表于 ICCV 2025 的 VLM3D Workshop(CVF open access 可查,如 CTFlow);官网称 top-performing methods 收录于联合挑战赛论文(joint challenge paper)。颁奖与结果发布在 2025 年 9 月 24 日前后(MICCAI 2025 大田会议周内)。

Q8:许可是什么?
CT-RATE 数据与挑战赛本体均为 CC BY-NC-SA(非商业-相同方式共享):官网规则原文 “Both CT-RATE and MR-RATE are released under CC BY-NC-SA”,MICCAI 官网 challenges 表 license 列同样登记 CC BY-NC-SA。CT-RATE 在 HuggingFace 托管(gated,下载需接受平台使用条款);官方模型代码 CT-CLIP、CT-CHAT 在 GitHub 开源。

Q9:VLM3D、CT-RATE、CT-CLIP、CT-CHAT 是什么关系?
CT-RATE 是数据集(volume + 报告 + 标签);CT-CLIP 是在其上做对比语言-图像预训练的 3D 基础模型;CT-CHAT 是视觉语言对话模型;VLM3D 是用这套数据办的挑战赛。四者同一核心团队(Hamamci 等),数据论文同为 arXiv:2403.17834 系。检索时四个名字会互相串,认准条目边界即可。

Q10:2026 届有什么变化?
第二届新增 MR-RATE 数据集(脑 MRI,约 100,000 配对扫描-报告),赛道从 3 个扩为 6 个(VLM3D-CT-ABNORMALITY/CT-REPORT/CT-VOLUME + VLM3D-MR-ABNORMALITY/MR-REPORT/MR-VOLUME),赛制沿用 Docker ≤50 GB 服务端评测,作为 MICCAI 2026 satellite event 举办;早期获奖者受邀在 MIUA 2026(都柏林大学学院)展示。2025 届榜单保留作参考。

1.11 关键数字速查一栏表

数字 含义 出处(详见附录 C)
25,692 CT-RATE 非增强胸部 CT study 数 arXiv:2403.17834
50,188 展开后的 3D volume 数 arXiv:2403.17834
21,304 独立患者数 arXiv:2403.17834
14.3M+ 2D slice 总量 arXiv:2403.17834
18 胸部异常多标签类别数 CT-RATE 官方 CSV
1,000 RadBERT 微调用人工标注报告数 arXiv:2403.17834
20,000 / 1,304 训练/内部验证患者划分 CT-RATE 官方划分
2,000 / 1,024 内部/外部封闭测试集例数(不公开) Zenodo 记录摘要
50 GB Docker 容器容量上限 官网 rules 页
4 / 3 / 6 任务数 / 2025 赛道数 / 2026 赛道数 官网任务与赛道页
32 Zenodo 记录署名作者数 Zenodo 元数据
10.5281/zenodo.15052707 赛事记录 DOI(双 DOI 见坑 2) MICCAI 官网登记
2025-03-19 Zenodo v1 发布日 Zenodo 元数据
2025-09-23 至 27 MICCAI 2025 会期(韩国大田) MICCAI 官网
5,000+ CTFlow 训练 GPU 小时 CTFlow 论文(ICCV 2025W)
0.2791 / 0.846 影禾医脉媒体口径 BLEU(1-4)/AUC 媒体报道(坑 6)

1.12 与 2D 胸片生态的对应关系

VLM3D 的四个任务都能在 2D 胸片生态里找到"前辈",对照着看能更快理解任务设计的来路:

能力方向 2D 前辈(库内条目) 3D 赛场(VLM3D) 迁移增加的难度
影像-文本配对语料 MIMIC-CXR(16)(数十万胸片-报告对) CT-RATE(546)(25,692 study-报告对) 数据体量×数十、每例三维体积
局部对齐监督 MS-CXR(340)(短语-区域对齐子集) 任务三自监督定位(不用人工区域标注) 3D 区域标注贵得多,故改为自监督
时序建模 MS-CXR-T(619)(纵向胸片对) (VLM3D 未单设时序任务) 3D 纵向配对数据更稀缺
结构化/推理评测 CheXstruct/CXReasonBench(604) 任务二 18 标签多标签分类 弱标签来源同源(报告挖掘)
指令跟随对话 RadVLM-Instruct(624) CT-CHAT(对话模型,代码开源) 3D 编码器 + 逐层上下文
大规模标注库 VinDr-CXR(125)(胸片标注库) (无对应——CT 系无 VinDr 类人工标注大库) ——这正是弱标签路线兴起的原因

读表要点:VLM3D 的任务形态对 2D 研究者并不陌生,陌生的只是"3D"带来的数据工程与算力维度;反过来,2D 生态的方法(线性探针、指令微调、LoRA 对齐)大多可以平移试验。

1.13 常见误解速查

误解 事实
“VLM3D 是一个新数据集” 不是:训练/验证数据就是 CT-RATE;VLM3D 的新资产是任务定义、赛制与榜单
“VLM3D 基于 VinDr 数据扩展” 证伪:完全基于 CT-RATE + 封闭测试集,与 VinDr 无关(坑 5)
“它是 MICCAI 灯塔挑战赛” 不是:official challenge 但非 lighthouse(坑 8)
“测试集可以下载来本地跑榜” 不能:两套测试集不公开,仅服务端评测
“arXiv 上的 VLM3D 论文就是挑战赛论文” 不是:arXiv:2509.15772 是同名 text-to-3D 论文(坑 1)
“获奖模型可以商用” 不可以:CC BY-NC-SA 禁商业用途,获奖不改变数据许可
“参与了就是 161 人那个数字” 口径混乱:73/68/53 vs 120/115/80 vs 媒体 161/118,引用须注明来源(坑 4)

1.14 给三类读者的一段话速览

研究者:VLM3D 给了你四个可以直接对标的任务口径(报告生成/18 标签分类/自监督定位/文本条件生成),训练数据就是 HF 上 gated 的 CT-RATE(CC BY-NC-SA),官方基线代码在 GitHub(CT-CLIP/CT-CHAT),方法天花板参考 ICCV 2025W 的 CTFlow——你的论文只要声明"CT-RATE train 训练 + validation 自评"就能与整个生态对话,但别拿自评分数冒充官方榜单成绩。

工程/产业团队:这是一个技术含金量可公开验证的赛场——报告生成与分类正是影像公司产品化的两大方向,2025 届已有影禾医脉、Deepnoid 等队伍入局(名次口径见坑 6)。注意两件事:榜单名次不等于产品合规,CC BY-NC-SA 把商用挡在许可之外;参赛交付是 Docker ≤50 GB 的服务端盲测,工程纪律权重不亚于模型本身。

数据工程师/库方:VLM3D 是"数据集→基础模型→对话模型→挑战赛→榜单→跨模态扩展"完整数据工程栈的公开样板,其 Docker 盲测赛制与双测试集(内部 2,000 + 外部 1,024)设计值得任何计划办医学评测的团队整段借鉴;引用其数据时认准 study/volume/患者三个计数单位(坑 3)。

§2 数据构成与规格:CT-RATE 本体

VLM3D 的全部"可用数据"来自 CT-RATE——理解挑战赛,先要把这份数据的规格吃透。本节按规模、报告与标签、划分与命名、人群特征、评测集五个层次展开。数据本身的更完整画像(含采集协议与伦理口径)另见本库 ct-rate(546) 条目,本节只保留参赛者与引用者必须知道的骨架。

2.1 规模三口径:study、volume、患者如何互容

CT-RATE 的规模在不同文献里有三种写法,初见容易以为是矛盾,实为三个不同计数单位:

口径 数字 含义
study 口径 25,692 个非增强胸部 CT study 一次检查一个 study(官网/Forithmus 常写 “~25,000 chest CT studies”)
volume 口径 50,188 个 3D volume 同一 study 的多种重建(不同层厚/核算法)各自展开为一个 volume(Zenodo 摘要写 “over 50,000 3D chest CT volumes”)
患者口径 21,304 位独立患者 去重后的真实人数(arXiv:2403.17834 精确数)

三者互容:21,304 位患者做了 25,692 次检查(少数患者多次检查),每次检查按重建展开为约 2 个 volume。附加总量:全部 volume 合计超过 1,430 万张 2D slice。arXiv 论文给出的是精确数(25,692/50,188/21,304),官网与 Zenodo 给出的是约数——三口径并存时以精确数为准,引用时注明单位(坑 3)。

2.2 报告结构与 18 异常多标签

每个 study 配对一份放射科医生撰写的报告,报告分两大部分:impression(印象,结论性判读)与 findings(发现,逐系统描述),另有患者信息、扫描技术等附加节。对报告生成任务而言,impression 与 findings 都是可学习的生成目标;对标签任务而言,报告是"免费标注"的来源。

18 种胸部异常多标签的来源是文本挖掘而非人工逐例标注:团队微调 RadBERT(一个放射学文本预训练模型)做报告→标签的自动分类器,微调用了 1,000 份人工标注报告。异常类别包括:肺结节(lung nodule)、动脉壁钙化、冠状动脉钙化、心脏肥大、心包积液、胸腔积液、肺实变、肺气肿、肺纤维化后遗症、肺不张、淋巴结肿大、磨玻璃影/肺影(lung opacity)、小叶间隔增厚、支气管扩张、胸膜增厚、食管裂孔疝、马赛克衰减模式等(完整 18 类以数据集官方 CSV 为准)。这就是多异常分类任务(任务二)的标签体系,也是任务三(自监督定位)的病灶对象清单。

对使用者有三点提醒:第一,这批标签是弱标签——由文本分类器从报告自动抽取,报告漏写≠影像无异常;第二,文本分类器的错误率未逐例人工复核(1,000 份微调集之外),下游做严格诊断实验需自建金标准;第三,标签粒度是"有无"而非"位置"——位置信息要靠任务三的自监督方法或人工标注集补充。

2.3 划分与目录命名

CT-RATE 官方划分:训练集 20,000 患者 / 内部验证集 1,304 患者。目录命名规则 split_patientID_scanID_reconstructionID,例如 train_1_a_1.nii.gz 表示训练集、患者 1、第 a 次扫描、第 1 种重建。这个命名把"患者—检查—重建"三层计数单位编码进文件名,参赛者写数据加载器时可直接解析:同一位患者的所有文件共享 patientID,做患者级划分防泄漏时以此为键。

VLM3D 规则明确:训练与验证只能用 CT-RATE 公开的 train/validation 划分,四个任务一视同仁——这是榜单可比性的数据边界。

2.4 人群与采集特征

CT-RATE 采集于土耳其伊斯坦布尔梅迪波尔医院(单中心),非增强(未打造影剂)胸部 CT;扫描仪来自 3 家厂商;患者年龄 18-102 岁;性别分布均衡。单中心是它最大的分布局限:所有训练/验证数据来自同一家医院的设备与人群,跨机构、跨厂商、跨人群的泛化能力需要外部数据检验——这正是 VLM3D 设置波士顿大学外部测试集(§2.5)的原因,也是"外部测试 1,024 例"这个数字在榜单上含金量高的原因。

论文层面的外部验证(CT-CLIP 工作所述)还使用了公开的 RAD-ChestCT 与一个私有的真实世界临床集合;这两者不属于 VLM3D 赛题数据,只在方法论文的泛化实验中出现。

2.5 VLM3D 评测集:两个封闭测试集

VLM3D 的评测数据由两套封闭测试集构成,均不公开:

测试集 规模 来源 状态
内部封闭测试集 2,000 例 与训练数据同分布(梅迪波尔) 不公开,仅服务端评测
外部封闭测试集 1,024 例 波士顿大学医院(跨机构) 不公开,仅服务端评测

两套测试集的设计意图泾渭分明:内部集衡量"在同分布数据上做到多好",外部集衡量"换一家医院还剩多少"。参赛者在整个赛程中拿不到任何一例测试数据,只能提交 Docker 容器(§5)。对引用者而言,这意味着官方排行榜上的任何数字都无法离线复现——第三方复现只能退回 CT-RATE 内部验证划分(1,304 患者)自建评测,结果与官方榜单不可直接比较。

2.6 与库内 ct-rate 条目的边界

本库将 CT-RATE 数据本体与 VLM3D 挑战赛分立两条目:ct-rate(546) 条目负责数据集本体(采集协议、字段、下载、衍生工作谱系),本条目负责挑战赛(任务、赛制、榜单、生态)。若你的目的只是"拿到影像-文本对做训练",直接读 ct-rate 条目即可;若你要引用"某方法在标准赛题上的名次"或"Docker 服务端评测范式",本条目才是正确出处。两处互链,引用时按需取用。

2.7 数据质量与已知局限

在把 CT-RATE 当"标准答案"使用前,四条已知局限值得写进实验设计:

  1. 单中心偏倚:全部数据来自伊斯坦布尔梅迪波尔医院的 3 家厂商扫描仪——人群构成、临床惯例、扫描协议的机构烙印无法通过数据内部处理消除;跨机构泛化只能靠外部数据(波士顿大学测试集的存在正是为此,但对外不公开)。
  2. 弱标签噪声:18 异常标签由 RadBERT 微调版从报告自动抽取,报告本身的漏写/简写会传导为标签缺失;1,000 份人工标注只保证分类器微调质量,不保证全量标签正确率。严格诊断实验需自建金标准子集。
  3. 多重建展开的统计重叠:50,188 个 volume 由 25,692 个 study 展开——同一解剖被以不同重建参数记录多次。若按 volume 随机划分训练/验证,同一 study 的"孪生 volume"可能跨越划分边界,造成隐性泄漏;患者级(或至少 study 级)划分是底线。
  4. 报告语言与书写风格:报告为英文放射学书写,风格受单一机构惯例影响;文本生成任务的 BLEU 类指标对此敏感(机构风格拟合可抬高 n-gram 重合度)。

2.8 三代胸部影像-文本数据集规格对比

把 CT-RATE 放进 2D 前辈的坐标系,能看清"3D 转折"的量级:

维度 MIMIC-CXR(2D,库内 16) VinDr-CXR(2D,库内 125) CT-RATE(3D,库内 546)
模态 胸部 X 光 胸部 X 光 胸部 CT(容积)
数据单位 单张影像-报告对 单张影像 + 人工标注 study → 多 volume-报告对
规模 数十万级 数万级(人工标注) 25,692 study / 50,188 volume
标签来源 报告文本挖掘(CheXbert 系) 专家人工标注 报告文本挖掘(RadBERT 微调)
许可 PhysioNet credential 制 CC BY-NC-SA(口径以条目为准) CC BY-NC-SA(HF gated)
在 VLM3D 语境中的角色 2D 任务形态的模板来源 消歧对照(与 VLM3D 无关,坑 5) 训练/验证数据本体

读表要点:CT-RATE 与 MIMIC-CRX 系共享"报告挖掘弱标签"路线(而非 VinDr 的人工标注路线),这正是 VLM3D 任务三要"自监督定位"的根源——弱标签有"有无"无"位置",位置信息只能靠自监督从影像-文本对应中掘取。

2.9 参赛者视角的数据走查:从下载到第一个 batch

以任务二(多异常分类)为例,把"拿到数据"到"喂进模型"的路径走一遍——这条走查同样适用于其他三个任务的前半程:

第 0 步 平台门禁
  - HuggingFace 登录 → ibrahimhamamci/CT-RATE 页 → 阅读并接受使用条款
  - 确认许可显示 CC BY-NC-SA;记录接受日期(合规留痕)
第 1 步 结构核对
  - 目录树按 split_patientID_scanID_reconstructionID 组织
  - train/ 含 20,000 患者的 volume;validation/ 含 1,304 患者
  - 标签 CSV 按 patient/scan 粒度对齐 18 异常列
第 2 步 索引与防泄漏
  - 用正则解析文件名建索引(附录 H 骨架)
  - 以 patient_id 为去重键;确认验证患者与训练患者零交集
  - 注意同一 study 的多重建 volume 同源——按 study 聚合后再划分实验
第 3 步 体素预处理
  - 读 NIfTI → 统一 spacing(重采样)→ HU 窗口化(肺窗/纵隔窗)
  - 裁剪到胸腔包围盒;按需降采样以控制显存
第 4 步 第一个 batch
  - volume 张量形状(C, D, H, W);标签张量形状(18,)
  - 抽样核对:标签阳性异常与报告文本描述一致(弱标签抽查)

走查中最后一步最容易被跳过,也最不该跳过:抽样 20-30 例,把 CSV 里的阳性标签与报告原文对照读一遍,能直观建立"弱标签噪声长什么样"的手感——这决定你后续要不要在损失函数里做标签平滑或噪声鲁棒设计。

2.10 重建维度:volume 计数为何是 study 的近两倍

命名规则里的 reconstructionID 段揭示了 CT-RATE 的一个关键机制:同一次扫描(study)会以不同重建参数(层厚、卷积核、迭代算法)产出多个 volume。这解释了 25,692→50,188 的近两倍展开,也带来三个使用注意:

  1. 统计单位必须声明:报"数据量"时写 study 还是 volume,结果差近一倍——坑 3 的全部混乱都源于此。审稿与引用时强制自己写明单位。
  2. 重建即数据增强的误解:多重建不是"免费增强"——不同重建的解剖完全相同,只有纹理/噪声特性不同;把同一 study 的多重建分入训练与验证两侧会造成乐观偏差,任何划分必须以 study(保守)或患者(标准)为最小单元。
  3. 模型对重建参数的敏感性是可研究的副产品:同一解剖、不同重建的预测一致性,可以当作模型鲁棒性的免费探针——这是 CT-RATE 结构赠送的独特评测维度。

§3 组织方与时间线:谁在办、何时办

3.1 组织架构:Forithmus + 十二机构联盟

VLM3D 由研究机构 Forithmus 牵头组织(官网与 Forithmus Research Hub 的 collections 页均挂 VLM3D Challenge 专页),背后是一个横跨欧美亚的多机构联盟:

机构 角色(公开口径)
Forithmus 牵头组织方
University of Zurich(苏黎世大学) 发起人所在机构(Hamamci)
Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) 数据来源医院所在机构
Boston University(波士顿大学) 外部测试集提供方
Stanford University / Harvard University / Johns Hopkins University / Imperial College London / University College Dublin / Shanghai Jiao Tong University 组织委员会成员所在机构
NIH / ETH Zurich / NVIDIA 联盟成员

Zenodo 挑战赛记录署名 32 位作者。组织委员会阵容在医学 AI 挑战赛里属高配:Bjoern Menze(苏黎世/哈佛系影像分析)、Kayhan Batmanghelich(匹兹堡/波士顿系,胸部 CT 长期深耕)、Pranav Rajpurkar(哈佛系医学 AI 基准)、Alan Yuille(约翰霍普金斯,医学视觉长远旗手)、Zongwei Zhou(约翰霍普金斯,自监督医学影像)、Bernhard Kainz(帝国理工)、Weidi Xie(上海交大)等——委员会覆盖了报告生成、分类、自监督、生成四个任务方向的代表性研究者,任务设计与评委结构相对应。

3.2 关键人物:Hamamci 与 CT-RATE 系谱

Ibrahim Ethem Hamamci 是理解 VLM3D 谱系的钥匙:他是 CT-RATE 数据集论文(arXiv:2403.17834)、CT-CLIP 基础模型、CT-CHAT 对话模型三个工作的一作,也是 VLM3D Zenodo 记录的第一作者。这条"数据集→基础模型→对话模型→挑战赛"的递进路径,是当代医学 AI 数据工程的典型打法:先建数据护城河,再在数据上立方法标杆,最后把评测权标准化为公共基础设施。对引用者而言,这意味着 VLM3D 的任务定义与 CT-RATE 论文的实验设计一脉相承,读 arXiv:2403.17834 可以找到四大任务最初的动机与原型实验。

3.3 时间线总表

时间 事件
2024-03 底层数据论文 CT-RATE/CT-CLIP 首版挂 arXiv(2403.17834,v1 标题为 “A foundation model utilizing chest CT volumes and radiology reports for supervised-level zero-shot detection of abnormalities”,坑 7)
2024-2025 论文多轮修订,v3 改题为 “Developing Generalist Foundation Models from a Multimodal Dataset for 3D Computed Tomography”(坑 7)
2025-03-19 VLM3D 挑战赛记录发布于 Zenodo,Version v1,DOI 10.5281/zenodo.15052707(双 DOI 见坑 2)
2025 上半年 官网 vlm3dchallenge.com 上线,四任务开放报名与开发
2025-09-23 至 27 MICCAI 2025 于韩国大田(Daejeon)举行,VLM3D 为官方注册挑战赛(satellite event,非 lighthouse,坑 8)
2025-09-24 前后 颁奖与结果发布
2025 下半年 冠军方法发表于 ICCV 2025 VLM3D Workshop(CVF open access)
2026 第二届:新增 MR-RATE 脑 MRI 赛道,六赛道并行,MICCAI 2026 satellite event;早期获奖者受邀 MIUA 2026(都柏林大学学院)展示

3.4 双 DOI 与收录口径存照

双 DOI:MICCAI 官网 challenges 列表登记 VLM3D 的 DOI 为 10.5281/zenodo.15052707;OpenAIRE 记录同时显示 10.5281/zenodo.15052708——同一记录名下两个 DOI 后缀,均重定向至同一 Zenodo 页面。引用时任取其一皆可达,但正式文献建议以 MICCAI 官网登记的 15052707 为准(坑 2)。

MICCAI 收录口径:MICCAI 官网 challenges 表对 VLM3D 的任务类型标注为 “Classification; Detection; Localization; Modeling; Reconstruction; Segmentation”——这是 MICCAI 对全部挑战赛统一使用的分类学标签串,不是 VLM3D 四大任务本身的描述;把六个词当成 VLM3D 的任务清单会以偏概全(坑 8)。license 列登记 CC BY-NC-SA,与官网规则一致。

lighthouse 辨析:MICCAI 每届从注册挑战赛中遴选少数 “lighthouse challenge”(灯塔挑战赛)作为标杆。2025 届三席为 BraTS、SAGES-CVS、UNICORN,VLM3D 不在其列。引用"MICCAI 官方挑战赛"准确,引用"MICCAI 灯塔挑战赛"错误。

3.5 官网与发布渠道清单

渠道 地址/标识 内容
挑战赛官网 vlm3dchallenge.com 任务定义、规则、报名、榜单(Forums 页含参与统计)
Forithmus Research Hub research.forithmus.com/collections/vlm3d-challenge 挑战赛合集页(2026 届视图含参与数字现值)
Zenodo 记录 DOI 10.5281/zenodo.15052707(/15052708 重定向同页) 挑战赛描述、32 作者、发布时间 2025-03-19
MICCAI 官网 conferences.miccai.org/2025 challenges 列表 官方注册凭证、DOI、license、lighthouse 遴选
底层数据论文 arXiv:2403.17834 CT-RATE 规模精确数、方法原型
训练数据 HuggingFace ibrahimhamamci/CT-RATE(gated) NIfTI volume + 报告 + 标签
官方代码 GitHub ibrahimethemhamamci/CT-CLIP、CT-CHAT 基础模型与对话模型开源实现
Workshop 论文集 openaccess.thecvf.com/content/ICCV2025W/VLM3D/ 冠军方法(CTFlow 等)

3.6 方法论评述:单中心数据何以支撑大赛

一个常见的疑虑是:单中心数据办全球大赛,榜单还有意义吗?VLM3D 的答案是"分层评测"——用两套测试集把问题拆开:内部测试集(2,000 例)回答"在数据分布内,方法学上谁做得好",这是对算法能力的公平比较;外部测试集(1,024 例,波士顿大学)回答"换医院后谁还站得住",这是对泛化能力的检验。两个名次都拿才真正有说服力——这也是为什么本条目在 §7.2 处理工业获奖口径时反复强调"评测集/榜单切片"的标注。

这套设计对数据工程界的启示是:单中心不是原罪,只有单中心评测才是。只要评测层引入外部分布,训练数据的单中心局限就从"缺陷"转化为"已知边界"——参赛者知道自己该为什么优化,引用者知道榜单数字的适用范围。

3.7 与代表性医学挑战赛的结构对比

维度 BraTS(神经肿瘤基准) UNICORN(2025 lighthouse 之一) VLM3D 2025
领域 脑肿瘤 MRI 分割 多任务医学影像 3D 医学影像视觉语言
任务形态 分割为绝对主轴 多任务组合 四任务(分类/生成/报告/定位)
数据策略 多年迭代扩充+公开训练集 公开训练+隐藏评测 公开训练(CT-RATE)+双隐藏测试集
评测形态 在线评测平台 挑战赛平台 Docker 容器服务端评测
语言模态 无 无 有(报告文本为一等公民)
MICCAI 地位 lighthouse 常客 2025 lighthouse 三席之一 official challenge(非 lighthouse,坑 8)

读表要点:VLM3D 在 MICCAI 挑战赛光谱里的独特位置是"语言模态为一等公民 + Docker 服务端评测"的组合——分割类赛事比拼的是掩码 Dice,VLM3D 比拼的是"影像与语言之间的往返能力"。两者方法论互补而非竞争;2026 届 MR-RATE 进入脑 MRI 域后,与 BraTS 系的数据生态还可能产生新的交叉点(但任务形态依旧不同:报告对 vs 掩码)。

3.8 组织委员会与四任务的对应关系

组织委员会的人员构成与四大任务之间存在可观察的对应——这解释了 VLM3D 任务设计的"专家对口"逻辑:

委员会成员 长期领域 对应任务方向
Ibrahim Ethem Hamamci CT-RATE/CT-CLIP/CT-CHAT 一作 全局发起、数据与基线
Bjoern Menze 腹部/肿瘤影像分析与挑战赛组织 评测设计与影像侧
Kayhan Batmanghelich 胸部 CT、影像-文本、弱监督 分类与定位任务
Pranav Rajpurkar 医学 AI 基准(CheXbert 系) 基准设计与报告生成
Alan Yuille 医学视觉长远布局(JHU 系) 学界背书与方向把关
Zongwei Zhou 自监督医学影像(JHU 系) 自监督定位任务
Bernhard Kainz 医学影像与挑战赛实践(帝国理工) 赛制与评测
Weidi Xie 多模态学习(上海交大) 视觉语言方法

读表说明:对应关系依据各人公开研究方向归纳,属条目作者的观察性整理而非官方声明——用于理解任务设计逻辑,勿转引为"某人负责某任务"的分工事实。

§4 四大任务详解:看懂、说出、找到、生成

VLM3D 2025 的四个任务共享同一套公开训练数据(CT-RATE train/validation 划分),却覆盖了视觉语言建模的四种基本能力方向:理解结构(分类)、产出文本(报告生成)、空间定位(自监督定位)、数据合成(文本条件生成)。以下逐任务展开输入输出、指标与设计意图。

4.1 任务一:CT 报告生成(radiology report generation)

输入/输出:输入 3D 胸部 CT volume,输出自由文本放射学报告。这是"影像→语言"的正向任务,也是临床上最直接的落地方向——一份能用的初稿报告可以显著压缩放射科医生的书写负担。

评测指标:以 BLEU(1-4) 为代表的文本生成指标族(媒体报道口径:冠军队伍平均 BLEU(1-4) 达 0.2791、较基线高约 5 个点)。BLEU 对 3D 医学报告生成这类长文本、术语密集的任务只是粗尺子——临床正确性(异常是否被正确提及/遗漏/虚构)才是金标准,但金标准需要人工,榜单只能退而求其次用 n-gram 重合度。引用榜单数字时应意识到这个天花板。

设计意图:把 CT-RATE 的 impression/findings 两节报告作为生成目标,检验模型能否从容积影像中读出跨层的、三维空间里的异常组合,并按放射学书写规范成文。这是 2D 胸片报告生成(MIMIC-CXR 系)向 3D 的直接迁移,难点在于 volume 的信息密度与上下文长度远超 2D。

4.2 任务二:多异常分类(multi-abnormality classification)

输入/输出:输入 3D 胸部 CT volume,输出 18 种胸部异常的多标签预测(每个异常独立二判)。标签体系即 §2.2 所述的 RadBERT 自动抽取弱标签。

评测指标:AUC(媒体报道口径:第三名队伍平均 AUC 0.846)。多标签设定下 AUC 按异常类别逐一计算再聚合,18 类的患病率高度不均衡(如食管裂孔疝罕见、胸腔积液常见),榜单聚合方式(宏平均/微平均)细节以官方评测脚本为准。

设计意图:任务二看似最"传统",实为整个挑战赛的锚点——18 标签体系直接继承 CT-RATE 的文本挖掘产物,它检验的是模型对报告弱标签的拟合上限。同时它也是任务四的生成条件、任务三的定位对象清单:四个任务在标签体系上互相咬合。

4.3 任务三:自监督多异常定位(self-supervised multi-abnormality localization)

输入/输出:输入 3D 胸部 CT volume,输出异常的空间定位(如异常热图/区域)。约束条件是本任务的灵魂:训练阶段不得使用任何人工 ground-truth 标注——模型只能从影像-报告对、影像本身或其他自监督信号中学会"哪里不对劲"。

评测:用一个人工标注集做最终评测(病灶对象涵盖心包积液、胸腔积液、实变、肺影(lung opacity)、肺结节等)。定位质量以人工标注为尺,训练过程与人工标注完全隔离——这是"弱监督/自监督定位"范式的一次公开大考。

设计意图:医学影像定位标注极贵(像素级/体积级勾画需要专家小时计),VLM3D 用规则设计把这条成本曲线摆上台面:既然报告里"免费"藏着定位线索("右肺下叶胸腔积液"这类文字),模型就该学会把语言证据翻译回空间证据。这个任务对 3D 医学影像的可解释性研究有直接的推动价值——冠军方法 Deepnoid M4CT 的获奖(§7.2)说明工业界对此方向已有成熟积累。

4.4 任务四:文本条件 3D CT 生成(text-conditional 3D chest CT generation)

输入/输出:输入报告文本,输出合成的 3D 胸部 CT volume。这是"语言→影像"的逆向任务,也是四个任务中计算最重、最新颖的一个:从文本描述生成一个生理上合理、解剖上连贯的容积数据。

评测指标:生成质量指标族——FVD(Fréchet Video Distance,把 volume 视为视频帧序列)、FID(Fréchet Inception Distance)、CLIP score(文本-影像对齐度)、IS(Inception Score)(CTFlow 论文口径)。

设计意图与应用:官方口径给出的应用方向是数据增强、教育与生成建模研究。合成 CT 可以低成本扩充稀有异常的训练样本、给教学提供无隐私风险的素材、给生成模型社区提供医学试验场。但合成数据的边界同样清晰:合成 volume 不等于真实解剖,不能用于诊断声明,混合训练时必须明示合成来源(frontmatter 的 rai:dataLimitations 已存照)。

4.5 四任务的公共边界与互恰性

任务 输入 输出 核心指标 代表口径数字
①报告生成 3D CT volume 自由文本报告 BLEU(1-4) 等 冠军平均 BLEU(1-4) 0.2791(媒体口径)
②多异常分类 3D CT volume 18 标签多标签 AUC 第三名平均 AUC 0.846(媒体口径)
③自监督定位 3D CT volume 异常空间定位 人工标注集评测 冠军 Deepnoid M4CT(媒体口径)
④文本条件生成 报告文本 合成 3D volume FVD/FID/CLIP/IS CTFlow 为代表方法

四个任务共享三条公共规则:训练/验证数据只能来自 CT-RATE 公开 train/validation 划分;评测一律走 Docker 服务端隐藏测试集;模型以容器交付(≤50 GB)。这保证了跨任务、跨队伍的可比性——也意味着任何在私有数据上预训练的模型必须声明(规则细节以官网 rules 页为准)。

值得一提的是"任务数口径":韩媒报道写作"四个项目",与官方四任务一致;2026 届赛道数扩为六(CT×3 + MR×3),那是赛道口径而非任务口径——赛道是按数据域(CT/MR)与任务组合的报名单元,任务仍是四类。混用两个口径会把"六赛道"误读成"六个任务"。

4.6 四任务的 2D 对应物与迁移难点

任务 2D 对应物(库内条目) 3D 迁移的核心难点
报告生成 MIMIC-CXR 系报告生成(16) 单例 token 量级上升(数百层切片 vs 单图);跨层空间推理;显存与上下文窗口压力
多异常分类 胸片多标签分类(CheXpert/胸片 14 标签系) 标签从 14→18 且由 CT 报告挖掘;volume 级聚合策略(逐层投票 vs 3D 编码)
自监督定位 MS-CXR 短语-区域对齐(340) 2D 框/掩码监督在 3D 缺位,需从报告文本与影像对应中自掘监督信号
文本条件生成 (2D 罕见成熟先例) 3D 解剖一致性约束;FVD 类指标把 volume 当视频处理的建模要求

一张表看清:四个任务里,报告生成与分类是"平移+加重",自监督定位是"范式重设计",文本条件生成接近"从零开始"。这也解释了为什么 ICCV 2025W 的代表论文出自任务四——新范式最先催生新方法。

4.7 参赛者工程要点

从 CT-RATE 的数据规格与 Docker ≤50 GB 的交付约束倒推,参赛者普遍要过四道工程关:

  1. 数据加载:50,188 个 NIfTI volume 的随机读取是 I/O 瓶颈——常见做法是离线预解码为统一 spacing 的数组缓存(注意存储预算)或按 patientID 分片流式读取;命名规则(§2.3)是写索引器的现成依据。
  2. 3D 表征:整 volume 直接进 3D 卷积网络显存吃紧;主流方案两端化——3D 编码器配滑窗推理,或"2D 逐层编码 + 跨层聚合"(把 volume 当视频)。CTFlow 的 video-inspired 思路即后者的生成版。
  3. 文本侧:报告生成任务的输出长度远超 2D 胸片报告,解码策略(beam/采样)与临床术语一致性检查值得单独调优;CT-CLIP 的文本编码器是现成的 3D 对齐起点。
  4. 容器纪律:50 GB 含权重——3D 大模型基座(如经大规模预训练的 3D ViT)动辄数十 GB,迫使参赛者做量化/蒸馏或自训小型基座;这道约束本身就在筛选"高效架构"路线。

4.8 各任务指标的读法与陷阱

榜单数字只有在指标语义清楚时才有意义。四个任务的指标各有一个最常被误读的陷阱:

任务 主指标 正确读法 常见误读
报告生成 BLEU(1-4) 平均 n-gram 重合度,对机构书写风格敏感;0.2791 是"与参考报告的词汇重合水平" 误读为"27.9% 的诊断正确率"
多异常分类 AUC(按类计算后聚合) 排序质量指标,与阈值无关;0.846 是 18 类某聚合方式下的均值 忽略类别不均衡下宏/微平均的巨大差异
自监督定位 人工标注集上的定位度量 训练零人工标注是前提,评测才用金标准 混入任何人工标注训练即违规
文本条件生成 FVD/FID/CLIP/IS 分布级指标,衡量合成 volume 与真实分布的距离与文本对齐度 误读为"单张合成图质量分"

两条横向提醒:其一,四任务的指标族不可跨任务比较(BLEU 0.28 与 AUC 0.85 之间没有换算关系);其二,置换检验排名(§5.1)意味着"名次相邻"的分数差可能统计不显著——引用时写名次比写裸分数更稳,写两者时注明检验口径。

4.9 四任务的方法空间地图

从 2025 届公开方法与 CT-RATE 系论文归纳,四任务的方法空间大致如下(供复现者定位自己的起点):

任务 方法家族 代表组件 起点建议
报告生成 3D 编码器 + 文本解码器;逐层 2D 编码 + 跨层聚合 + LLM 解码 CT-CLIP 视觉塔、开源医学 LLM 微调 CT-CLIP 系或逐层 ViT + 医学 LLM 头
多异常分类 3D CNN/ViT + 多标签头;基础模型特征 + 线性探针 CT-CLIP 零样本→微调 先跑 CT-CLIP 特征线性探针建立底线
自监督定位 影像-文本对应挖掘;注意力/梯度定位;对比区域学习 RadBERT 文本侧、3D 注意力图 从报告短语-体素注意力对应起步
文本条件生成 隐空间流匹配/扩散;自回归逐层生成 A-VAE、CT-CLIP 文本编码器(CTFlow) 直接研读 CTFlow 论文复现管线

方法空间的公共底座是 CT-CLIP——它同时提供视觉编码器、文本编码器与影像-文本对齐先验,是四个任务都绕得开的"地基"。这也再次显示 CT-RATE 系谱的工程完整性:数据、基础模型、对话模型、挑战赛层层咬合。

4.10 案例走查:任务一的一道"题"长什么样

为让四个任务的抽象定义落地,以下用纯示意的方式走查任务一(报告生成)的一道赛题——数值与文本均为示意构造,非真实数据:

【输入】
  volume: train_12345_b_1.nii.gz(某患者第二次检查、重建 1)
    形状约 (1, 300+, 512, 512),HU 值体素
【模型需产出的报告要素(示意)】
  findings 节:
    - 双肺透过度与血管纹理走行描述
    - 逐区描述:左肺下叶小结节(约 x mm,边界清)……
    - 心脏大小、纵隔位置、胸腔有无积气积液
  impression 节:
    - 结论性一句话:如"左肺下叶小结节,建议随访;余未见明确异常"
【评分】
  生成文本 vs 参考报告的 BLEU(1-4) 等指标
【示意要点】
  - 同一 volume 的参考报告可能不止一份风格变体(机构书写惯例)
  - 漏写阳性发现与虚构阴性发现都会拉低 n-gram 重合与临床可信度
  - 3D 的价值在于"跨层确认":单层看似结节,邻层可能证实为血管截面

走查揭示的实战要点:报告生成不是"看图说话"而是"跨层侦查 + 规范化书写"——模型必须先在三维空间里确认结构性发现,再用放射学惯用语序输出;这也是 2D 报告生成冠军方法难以直接平移的原因。

§5 赛制:Docker 服务端评测与参与规模

5.1 Docker 容器规则:把评测权收归服务端

VLM3D 赛制的核心是一条工程纪律:参赛者提交 Docker 容器,组织方在隐藏测试数据上服务端运行评测。要点四则:

  1. 容器 ≤50 GB:模型权重、依赖、代码全须装进 50 GB 的容器里。这个上限对 3D 影像大模型并不宽裕(一个 3D ViT 的权重加推理栈很容易逼近),实质上限制了"暴力堆参数"的参赛策略,偏向高效架构。
  2. 隐藏测试数据:内部 2,000 例 + 波士顿大学外部 1,024 例全程不公开,参赛者无法在测试集上调参——从制度上封死测试集泄露这条路。
  3. 仅最终有效提交参与排名:多次提交取最终有效版本,防止"榜单试探式"刷分。
  4. 排名方法:采用基于主指标的 point-based permutation test scheme(点数制置换检验)——不做单一数字排序,而是用统计检验判断名次差异是否显著,这是医学影像挑战赛中相当严谨的排名设计。

这套设计的模板价值大于其自身:对任何要办医学 AI 挑战赛的团队,VLM3D 展示了"数据不公开 + 容器交付 + 统计检验排名"的完整可复制方案。

5.2 三赛道命名与结构

2025 届按任务设三个赛道(任务三自监督定位与任务一/二/四的对应关系以官网为准):

赛道 对应任务
VLM3D-CT-ABNORMALITY 多异常分类(+ 定位方向)
VLM3D-CT-REPORT CT 报告生成
VLM3D-CT-VOLUME 文本条件 3D CT 生成(volume 合成)

2026 届扩展为六赛道:CT 三席不变,新增 VLM3D-MR-ABNORMALITY / MR-REPORT / MR-VOLUME(数据换为 MR-RATE 脑 MRI)。

5.3 参与规模:三口径并存(引用前必读)

VLM3D 的参与数字是本条目口径冲突最密集的区域,三个来源三套数:

来源(页面属性) CT-ABNORMALITY CT-REPORT CT-VOLUME
vlm3dchallenge.com Forums 页(2025 届收官后口径) 73 参赛者 / 40 提交 68 参赛者 / 49 提交 53 参赛者 / 20 提交
research.forithmus.com 现页(2026 届视图,2026-09 抓取) 120 / 165 115 / 126 80 / 192
媒体报道(韩媒/港股财经,2025-09) 分类赛道 118 人 报告生成赛道 161 人 未逐项披露

三口径的可能解释:Forums 页为 2025 届系统页的收官快照;Forithmus 现页为 2026 届累计视图(数字更大);媒体报道的 161/118 可能是"注册参与"口径而非"有效提交"口径。没有官方声明解释差异,故本条目不做仲裁,只存照三条规则:引用任何参与数字必须注明来源页与抓取日期;比较"届"时不得跨口径;媒体数字不与官方页面数字混排(坑 4)。

5.4 评测时点与颁奖

颁奖与结果发布在 2025-09-24 前后(MICCAI 2025 大田会议周内,9 月 23-27 日)。冠军方法随后(2025 下半年)经 ICCV 2025 VLM3D Workshop 正式发表——"MICCAI 办赛、ICCVW 出论文"的跨会议安排在挑战赛生态里并不多见,反映了组织方对方法发表可见性的刻意经营。

5.5 服务端评测的信任模型:为什么这是对的方向

医学 AI 挑战赛的历史教训里,"测试集泄露"排第一:测试数据一旦公开,或经公开的"开发集"反复试探,榜单就会退化为记忆测试。VLM3D 的服务端评测在制度上重排了信任关系:

  • 数据信任:参赛者不需要相信组织方的"测试集未泄露"承诺——因为他们根本接触不到测试数据,泄露面被物理性压缩;
  • 过程信任:Docker 容器让"同一份代码在同一环境重跑"成为可能,组织方可以复验提交;点数制置换检验让"0.001 的 AUC 差"不再自动等于名次差;
  • 边界信任:仅最终有效提交参与排名,把"多次试探榜单"的博弈空间压到最小。

代价是透明度:参赛者看不到自己在外部测试集上的逐例表现,只能拿到总分。这是隐私(真实患者影像)与开放(可复核)之间的工程折衷——在医疗数据语境下,这个折衷正在成为行业默认。

5.6 参赛周期与里程碑建议

对计划参加后续届别(2026 CT+MR)的团队,按 2025 届节奏倒推一个参考周期:

阶段 建议动作
报名期 官网注册赛道;HF 接受 CT-RATE 条款并完成数据下载(体量大,尽早启动)
开发期前期 用官方划分搭 baseline(分类用 CT-CLIP 特征线性探针;报告生成微调开源 VLM;生成任务直接读 CTFlow 复现)
开发期中期 患者级防泄漏审计(附录 H 骨架);自建内部验证流程对齐官方指标口径
提交期 Docker 打包(附录 I 清单)→ 预提交验证容器可运行 → 最终有效提交
会期 MICCAI 会议周颁奖(2025 届为 9 月 24 日前后);获奖方法准备 Workshop 论文

5.7 三种评测形态的对照:VLM3D 的位置

医学影像基准评测目前有三种主流形态,各有信任假设与失效模式:

形态 代表 信任假设 典型失效模式
公开测试集论文基准 多数学术论文自建基准 使用者自律不测训练 测试集进入预训练语料,基准通胀
在线评测平台 grand-challenge 系在线提交 平台持有数据、按次反馈 反馈次数可被用作榜单试探
Docker 服务端盲测 VLM3D(≤50 GB,仅最终提交有效) 容器代码可复验、数据零接触 透明度换安全,逐例错误不可见

VLM3D 属第三种的完整实现,且加了第四道保险:点数制置换检验让"刷出来的 0.001"无法兑换名次。三种形态不是替代关系——论文基准胜在开放可复算,在线平台胜在易用,盲测容器胜在可信;VLM3D 证明的是"可信"在医学领域可以工程化,而不必以牺牲全部透明度为代价(官方代码与训练数据全公开,被锁住的只有测试集)。

§6 获取与许可:两把锁、一道闭门

6.1 资产清单与许可矩阵

资产 内容 许可 获取方式
CT-RATE 训练/验证数据 25,692 study / 50,188 volume / 报告 / 18 标签 CC BY-NC-SA HuggingFace ibrahimhamamci/CT-RATE(gated,需接受平台使用条款)
挑战赛本体(Zenodo 记录) 赛题描述、规则、元数据 CC BY-NC-SA Zenodo DOI 10.5281/zenodo.15052707(公开)
内部封闭测试集 2,000 例 不适用(不公开) 仅组织方服务端评测用
外部封闭测试集 1,024 例(波士顿大学医院) 不适用(不公开) 仅组织方服务端评测用
官方代码 CT-CLIP、CT-CHAT 开源 GitHub ibrahimethemhamamci/ 下两仓库
冠军方法论文 CTFlow 等 按 ICCV 2025W 论文许可 CVF open access

两把锁:第一把是 CT-RATE 的 CC BY-NC-SA——非商业、相同方式共享,任何商业用途(包括把参赛模型直接产品化)都超出许可;第二把是 HuggingFace 的 gated 下载——需登录并接受数据集页面列出的使用条款后才能下载。一道闭门:两套封闭测试集彻底不公开,第三方永远无法离线复现官方榜单。

6.2 下载实操与平台注意

CT-RATE 经 HuggingFace 托管,标准路径为登录平台→访问数据集页→接受条款→获得下载权。两点实操存照:其一,本库核验时曾尝试经 hf-mirror.com 的 API 直接读取数据集元信息,返回鉴权失败——镜像通道对 gated 数据集不可用,gated 数据请走 HuggingFace 官方通道;其二,数据体量大(50,188 个 NIfTI volume、超 14.3M slice),全量下载前先用 HF 的文件列表与 README 核对划分目录结构(train/validation 与 §2.3 命名规则),按需分片下载。

对"只是想跑通管线"的使用者:官方 GitHub 仓库(CT-CLIP/CT-CHAT)通常附推理示例与模型权重入口,可以先用小样本验证环境,再决定是否全量拉取数据。

6.3 AI-Ready 评估:挑战赛形态对机器可读性的加成

从 AI-Ready 视角看,VLM3D 形态的"数据集"有三个加分项:任务定义机器可读(四任务的输入输出与指标即接口规范)、评测容器化(Docker 交付即部署规范)、榜单公开(排行榜即基准报告)。两个减分项:测试集不可见使第三方基准复现只能自建;CC BY-NC-SA 把"AI 就绪"限定在非商业语境。综合而言,它对研究者的 AI-Ready 程度高于多数学术数据集,对商业团队则需要先过许可关。

6.4 与库内可获取性光谱的对照

本库条目的可获取性光谱大致分五档:完全公开直链、平台注册、条款接受(gated)、申请制、不公开。VLM3D 的训练数据居"条款接受"档(与多数 HF gated 医学数据集同级),评测数据居"不公开"档(与多数挑战赛封闭测试集同级)。对照参考:MIMIC-CXR(16) 为credential 制(PhysioNet 认证),ct-rate(546) 同为本条目的 gated 档——检索者按自己的合规条件在光谱上对号入座即可。

6.5 许可合规自查清单

CC BY-NC-SA 的"NC"(非商业)与"SA"(相同方式共享)两条,对使用者意味着一张实际的自查清单:

使用场景 合规判断
学术研究、论文发表、竞赛参赛 允许(署名 + 相同方式共享即可)
医院内部科研/教学使用 一般允许(非商业语境),建议法务确认院方政策
商业产品集成(含 SaaS、院内商业化系统) 禁止——除非另行获得权利人(Forithmus/数据团队)授权
用参赛模型对外提供服务 谨慎:模型训练数据许可通常随权重传导,CC BY-NC-SA 边界需法务评估
衍生数据集再发布 必须同许可(CC BY-NC-SA)+ 署名
合成 CT(任务四产物)再分发 注意合成数据源自真实数据许可的传导,同按 CC BY-NC-SA 处理并明示合成来源

两条提醒:其一,"获奖/榜单名次"不构成许可豁免——名次只证明技术,不改变数据权利;其二,HuggingFace gated 条款是平台层面的附加约束,与 CC BY-NC-SA 叠加生效,下载时的接受行为即合同行为。

6.6 获取环节高频问答补充

问:能不能只下载数据集的一个子集?
HuggingFace 支持按文件/分片选择性下载;CT-RATE 的目录命名(split_patientID_scanID_reconstructionID)使按患者或按划分挑选成为可能。但注意挑战赛语境下训练数据边界是"公开 train/validation 全部",自选子集做研究可以,参赛需遵守完整规则。

问:验证集(1,304 患者)能当自己的测试集吗?
可以且推荐——这是第三方唯一合法的"分布内自测"数据。但要明白它与官方封闭测试集(2,000 例)不是同一批数据,分数不可与官方榜单互换。

问:Zenodo 记录里有没有数据?
Zenodo 记录(DOI 10.5281/zenodo.15052707)是赛事描述与元数据记录,不是数据分发渠道;数据本体在 HuggingFace。把 Zenodo DOI 当"数据引用 DOI"是对的,当"下载入口"是错的。

问:2026 届的 MR-RATE 现在能拿到吗?
以官方渠道(vlm3dchallenge.com / Forithmus)最新公告为准;本库抓取时点(2026-09-26)核验到的信息是约 100,000 配对脑 MRI、CC BY-NC-SA,发放细节未在核验范围内逐条确认——引用前请查当日页面。

§7 结果与生态:冠军方法、工业获奖与下游谱系

7.1 冠军方法与 ICCV 2025 Workshop

VLM3D 官网明确:top-performing methods(头部方法)发表于联合挑战赛论文(joint challenge paper),收录于 ICCV 2025 VLM3D Workshop(CVF open access 可查:openaccess.thecvf.com/content/ICCV2025W/VLM3D/)。其中最具代表性的是 CTFlow:

  • 方法:video-inspired latent flow matching(视频启发的隐空间流匹配)做自回归 3D CT 合成——把 3D volume 的逐层生成类比为视频的逐帧生成,在隐空间用流匹配建模层间依赖;
  • 组件:A-VAE(3D 自编码器)负责隐空间压缩,CT-CLIP 文本编码器负责把报告文本变成生成条件;
  • 成本:训练消耗超过 5,000 GPU 小时——文本条件 3D CT 生成任务的算力门槛之高,从这个数字可见一斑。

CTFlow 的意义超出比赛本身:它公开了"文本→3D CT"的完整可复现管线(文本编码器、隐空间、生成器三件套),成为该方向事实上的公开基线。

7.2 工业界获奖画像与排名口径冲突

2025 届榜单吸引了多家公司级队伍,媒体报道的获奖画像如下(未逐一对照官方 leaderboard,引用需注明口径):

队伍 机构背景 获奖口径(媒体)
影禾医脉 上海,一脉阳光(02522.HK)孵化 CT 报告生成第一(161 人中综合第一,平均 BLEU(1-4) 0.2791);多异常分类第三(118 人中,平均 AUC 0.846)
Deepnoid M4CT 韩国 Deepnoid 自监督多异常定位第一;多异常分类第一;报告生成第三

排名口径冲突存照:报告生成任务上,影禾医脉宣称第一、Deepnoid 口径为第三——同一任务同一届出现两个"第一"叙事。两种可能:两队引用了不同评测集或不同榜单切片(如内部 vs 外部测试集、单一指标 vs 综合),或媒体转述失真。官方 leaderboard 未在本库核验中直接读取,故本条目不做仲裁,两个口径并存存照(坑 6)。这也再次验证 §5.3 的引用纪律:榜单数字不注明"来源页+抓取日期+口径"就不具备引用资格。

7.3 CT-RATE 下游谱系:从数据到模型的完整栈

VLM3D 并非孤立事件,而是 CT-RATE 系谱的第三棒:

层级 工作 内容 状态
数据层 CT-RATE 25,692 study / 50,188 volume + 报告 + 18 标签 HF 公开(gated,CC BY-NC-SA)
预训练层 CT-CLIP 对比语言-图像预训练的 3D 胸部 CT 基础模型;零样本多异常检测优于全监督 SOTA 代码 GitHub 开源
对话层 CT-CHAT 基于 CT-CLIP 的视觉语言对话模型 代码 GitHub 开源
竞技层 VLM3D 2025 四任务公开挑战赛 榜单+Workshop 论文
生成层 CTFlow 等 文本条件 3D CT 合成(挑战赛产物) ICCV 2025W 论文
另有 CT2Rep 3D CT 报告生成的同期工作 学术论文

这一谱系展示了当代医学 AI 数据工程的完整栈:单中心大数据集→基础模型→对话系统→标准化竞技场→生成模型。每一层都开源可查,后来者可以按层取用。

7.4 对 3D 医学 VLM 生态的三点影响

第一,评测口径的确立:四大任务(报告生成/多异常分类/自监督定位/文本条件生成)在 2025 年后成为 3D 医学视觉语言工作论文里的常见评测框架,"在 CT-RATE train 上训练、报 VLM3D 口径指标"渐成惯例。第二,服务端评测范式的示范:Docker ≤50 GB + 隐藏测试集 + 统计检验排名的组合,被后续医学挑战赛广泛参考。第三,跨会议生态的样本:MICCAI 办赛、ICCVW 出论文、次年 MIUA 展示——挑战赛作为"领域加速器"的多会议协同样本。对 2D 世界的对照系(MIMIC-CXR/MS-CXR/CheXpert 生态)而言,3D 世界用一届比赛补上了"统一基准"这块最后拼图。

7.5 媒体口径的解读守则

VLM3D 的榜单数字经媒体转述后产生了本条目最多的口径问题。给后续引用者四条守则:

  1. 区分"官方"与"媒体":官方 leaderboard 数字(需当日核对官网)与媒体报道数字(161 人、BLEU 0.2791 等)是两类证据;引用媒体数字必须写"媒体报道口径",不得写成"官方榜单"。
  2. 注明队伍自称视角:影禾医脉与 Deepnoid 各自的新闻稿都是"己方视角",双方数字可能各自准确但指向不同榜单切片——并存存照(坑 6),不做仲裁。
  3. 指标写全口径:BLEU(1-4) 是四个 BLEU 的平均;"平均 AUC 0.846"对应 18 类的某种聚合。只写"BLEU 0.28"或"AUC 0.85"会诱导读者以为遇到了单一公认指标。
  4. 届别与日期绑定:所有数字带上"2025 届/2026 届"与抓取日期,避免来年 2026 届收官后新旧数字自然混淆。

7.6 对产业界的意义

VLM3D 榜单上出现的中国(影禾医脉)与韩国(Deepnoid)公司级队伍,标注了这个赛事在产业侧的信号价值:报告生成与多异常分类恰是医学影像公司产品化的两大主流方向,一个 CC BY-NC-SA 的学术赛题成了厂商技术实力的公开试金石。对产业观察者,值得注意三点:其一,参赛与商用是两回事——榜单名次不能直接转化为产品合规(数据许可、医疗器械注册各自独立);其二,赛题指标(BLEU/AUC)与临床价值之间仍有距离,产业落地需要各自的真实世界验证;其三,榜单排名的多口径冲突(坑 6)本身提示:产业宣传口径的核验成本高,引用需回到官方页面。

7.7 冠军方法技术解剖:CTFlow 管线分解

作为任务四的代表发表方法,CTFlow 的管线值得逐段拆解——它同时是一份"文本条件 3D 医学合成"的参考架构:

输入:放射学报告文本
   │
   ▼
[1] 文本编码:CT-CLIP 文本编码器
   - 输出已与 3D 影像空间对齐的文本表征(对比预训练的红利)
   │
   ▼
[2] 条件注入:文本表征作为生成条件
   │
   ▼
[3] 逐层自回归生成(video-inspired)
   - 把 3D volume 的层序列当视频帧序列
   - 上一层的隐状态作为下一层的额外条件 → 保证层间解剖连续性
   │
   ▼
[4] 隐空间流匹配(latent flow matching)
   - 在 A-VAE 的隐空间中学习从噪声到目标分布的流
   - 相比像素空间扩散:显存与采样步数大幅节省
   │
   ▼
[5] A-VAE 解码:隐表示 → 3D CT volume
   │
   ▼
输出:合成 3D 胸部 CT volume(FVD/FID/CLIP/IS 评测)

三个设计选择的启发:其一,“视频化"视角把 3D 生成降维成"带时间一致性的 2D 序列生成”,是显存友好的通用技巧;其二,复用 CT-CLIP 的文本编码器而非另训,让生成任务的文本理解站在分类/检索任务的肩膀上;其三,隐空间生成 + 3D 自编码器的组合正在成为医学 3D 生成的默认架构。训练成本(5,000+ GPU 小时)则提示后来者:这条管线的复现门槛在算力而不在代码。

7.8 从单届赛事到领域基建:平台化路径

把两届赛事连起来看,VLM3D 的运营轨迹是一条清晰的"平台化"路径:

2024 底      CT-RATE 发布(数据资产)
2025-03      Zenodo 记录(赛事身份资产:DOI 可引用)
2025-09      MICCAI 2025 首届(学会背书资产)+ Forums/榜单(社区资产)
2025 下半年  ICCV 2025W 论文集(学术产出资产)
2026         MR-RATE + 六赛道(跨模态扩展)+ MIUA 2026(第二学术出口)
2026+        2025 榜单保留作参考 → 历史基准层

每一环都沉淀为可引用、可复用的资产——这正是"赛事即基建"与"赛事即活动"的分野。对想要复制此路径的团队,可迁移的次序是:先数据、再身份(DOI/学会注册)、后社区(榜单与论文出口);跳步(先办赛后补数据身份)通常导致引用混乱——本条目坑 2/坑 4 的多口径问题,部分正来自资产沉淀过程中页面口径未及时归一。

7.9 榜单之外:如何跟踪这个生态的后续

榜单是快照,生态是过程。想持续跟踪 VLM3D/CT-RATE 生态的读者,按可信度排序的观测点如下:

  1. 官网动态(vlm3dchallenge.com):届别公告、榜单更新、MR-RATE 发放——注意按坑 4 纪律记录抓取日期;
  2. ICCV 2025W 论文集(CVF open access):冠军方法的后续版本通常在 arXiv 持续演进,以 Workshop 版本为锚点追溯;
  3. GitHub 仓库(ibrahimethemhamamci/):CT-CLIP/CT-CHAT 的 issue 区常是数据使用问题的第一手答疑场所;
  4. 组织委员会成员的主页/发表流:四任务方向的后续方法多半出自委员会辐射的学术网络;
  5. 库内条目:ct-rate(546) 与本条目将随生态演进更新互链与存照。

一条反直觉的提醒:跟踪时优先看"方法是否开源可复现",其次才是名次——榜单头名的方法若未开源,其生态价值反而可能低于第 5 名但全栈开源的队伍。CTFlow 成为基线的原因正在于此。

§8 2026 第二届:从 CT 到 MR 的跨模态扩展

8.1 MR-RATE:约 100,000 配对脑 MRI

第二届(MICCAI 2026 satellite event)的核心增量是新数据集 MR-RATE:脑部 MRI,约 100,000 对"扫描-报告"配对,许可同为 CC BY-NC-SA(官网规则原文 “Both CT-RATE and MR-RATE are released under CC BY-NC-SA”)。这一步把 VLM3D 的方法论从胸部 CT 复制到神经影像域:脑 MRI 的报告语言习惯、异常类型(梗死、肿瘤、退行性变等)与 CT 完全不同,任务定义虽同(报告生成/分类/生成三型赛道),模型需要的能力结构全然不同。

8.2 六赛道与赛制延续

2026 届赛道:VLM3D-CT-ABNORMALITY / CT-REPORT / CT-VOLUME + VLM3D-MR-ABNORMALITY / MR-REPORT / MR-VOLUME,共六条。赛制沿用 Docker ≤50 GB 服务端评测。Forithmus 现页显示的参与数字(120/165、115/126、80/192)即 2026 届视图——这解释了它与 2025 届 Forums 页快照(73/68/53)的差异(坑 4)。2025 届 leaderboards 保留在官网作参考。

8.3 展示通道:MIUA 2026

早期获奖者受邀在 MIUA 2026(Medical Image Understanding and Analysis 会议,University College Dublin 主办,爱尔兰)展示——又一个跨会议协同点(MICCAI 2026 办赛、MIUA 2026 展示、ICCVW 系论文发表)。对参赛者而言,一届比赛最多可产出三处学术曝光。

8.4 从 CT 到 MR:同一赛制下的难度重构

把四大任务的框架原样搬到脑 MRI(MR-RATE),难度结构会重排:

维度 胸部 CT(2025) 脑 MRI(2026) 对参赛者的含义
影像物理 X 射线衰减,灰度语义相对稳定(HU 值) 多序列(T1/T2/FLAIR 等),参数依赖强 预处理与序列对齐成为新的第一道坎
异常谱 肺结节/积液/实变等 18 类结构病灶 梗死、肿瘤、白质病变、退行性改变等 分类任务的标签体系整体换血
报告语言 胸部放射学书写惯例 神经放射学书写惯例 报告生成任务的术语分布偏移
数据规模 25,692 study / 50,188 volume 约 100,000 配对(MR-RATE 宣称) 数据量级更大,I/O 与算力预算重估
3D 先例 CT 基础模型已有 CT-CLIP 等 脑 MRI 视觉语言大模型尚少 更大的方法空白,也是更大的机会

换言之,2026 届不是"换个数据集再比一次",而是把同一套评测纪律投进一个方法储备更薄弱的领域——对研究者而言,MR 赛道的首发红利可能高于已充分竞争的 CT 赛道。

8.5 MR-RATE 画像:已知与未知

截至本库抓取时点(2026-09-26),MR-RATE 的公开画像可以分成"已确认"与"待公告"两栏——引用时注意区分:

状态 内容
已确认(官网规则原文级) 脑 MRI;约 100,000 配对扫描-报告;CC BY-NC-SA(与 CT-RATE 同句声明);三条新赛道命名
待公告(核验未覆盖) 数据来源机构与采集协议;标签体系(是否延续报告挖掘弱标签路线);HuggingFace 托管与 gated 细节;测试集规模与构成;发布时间表

保守的引用写法是"官网口径约 100,000 配对脑 MRI(CC BY-NC-SA),细节以官方渠道为准"。特别注意:2025 届规则原文 “Both CT-RATE and MR-RATE are released under CC BY-NC-SA” 已经把两代数据的许可一次讲清——这是少数可以直接跨届引用的承诺。

§9 与库内条目的关系

9.1 家族图谱与互链清单

                    【2D 胸片对照系】
  MIMIC-CXR(16) ──┬── MS-CXR(340)(局部对齐监督)
                  ├── MS-CXR-T(619)(时序扩展)
                  └── CheXstruct/CXReasonBench(604)(结构化与推理)
                            │
                            │  "2D → 3D" 的范式迁移
                            ▼
  CT-RATE(546)【上游数据本体】
        │
        ├── CT-CLIP(3D 基础模型,代码开源)
        ├── CT-CHAT(3D 对话模型,代码开源)
        └── VLM3D 2025【本条目:挑战赛/榜单/赛制】
                  │
                  ├── 2026 届 → MR-RATE(脑 MRI,六赛道)
                  └── 榜单 → CTFlow / 影禾医脉 / Deepnoid M4CT

  VinDr-CXR(125)【消歧对照:与 VLM3D 无数据关系,见坑 5】
  RadVLM-Instruct(624)【2D VLM 指令集:与 VLM3D 任务互补】

互链点清单(7 个):ct-rate(546)(上游数据本体,第一互链)、mimic-cxr(16)、ms-cxr(340)、ms-cxr-t(619)(2D 胸片视觉语言对照系)、chexstruct-cxreasonbench(604)(报告结构化与推理评测)、radvlm-instruction-dataset(624)(2D 医学 VLM 指令数据)、vindr-cxr(125)(胸部 X 光大库;检索者常把它与 CT 系数据混淆,见坑 5)。

9.2 检索路径建议

  • 做 3D 胸部 CT 视觉语言研究:ct-rate(546)(数据)→ 本条目(任务与榜单)→ radvlm-instruction-dataset(624)(指令格式参考)。
  • 对比 2D 与 3D 的报告生成差异:mimic-cxr(16)/ms-cxr(340)(2D 基线)→ 本条目 §4.1(3D 任务定义)。
  • 研究评测方法论:本条目 §5(Docker 服务端评测)→ chexstruct-cxreasonbench(604)(2D 推理评测对照)。
  • 溯源数据归属:任何"VLM3D 用了 VinDr 数据吗"的疑问,直接看坑 5 的证伪结论。

9.3 2D→3D 迁移的技术栈对照表

把 2D 胸片生态的成熟组件与 VLM3D 语境的 3D 对应物并排,检索者可以按图索骥:

技术栈层 2D(胸片生态) 3D(VLM3D 生态)
配对语料 MIMIC-CXR(16) CT-RATE(546)
局部对齐 MS-CXR(340) 短语-区域 任务三自监督定位(无人工区域标注)
结构化标签 CheXpert/CheXbert 标签器 RadBERT 微调抽取 18 标签
结构化/推理评测 CheXstruct/CXReasonBench(604) 任务一/任务二榜单口径
指令数据 RadVLM-Instruct(624) (3D 指令集尚无公开对应物)
基础模型 2D ViT 系(DINOv2/BiomedCLIP 类) CT-CLIP(对比预训练)
对话模型 RadVLM 类 CT-CHAT
报告生成 2D 报告生成模型族 任务一赛道(CT-REPORT)
生成模型 少量 2D 合成尝试 CTFlow(任务四产物)

表中最刺眼的空位是"3D 指令数据"——2D 世界的 RadVLM-Instruct(624) 已把指令微调跑通,3D 世界尚无同级公开资产;这既是空白,也是 CT-RATE 生态最自然的下一步。

9.4 检索者常见误区

  1. 把"VLM3D"当论文关键词全局检索:会命中同名 text-to-3D 论文(坑 1)。医学语境加限定词(MICCAI、CT-RATE、challenge)或直接用 DOI。
  2. 把 ct-rate(546) 与 vlm3d 条目混引:数据规格引前者,任务/榜单/赛制引后者;两处互链但分工明确。
  3. 以为 VinDr-CXR(125) 是本赛道的上游:不是(坑 5);VinDr 是 2D 胸片人工标注大库,与本赛事无数据继承。
  4. 拿官方榜单与自建验证分数直接比较:测试集不同,分数不可比;自建评测请在论文里明确声明与官方榜单的关系。
  5. 把 2026 届 Forithmus 页数字当 2025 届参与数:届别口径错位(坑 4)。

9.5 若你是评审人:核对引用 VLM3D 的论文

审稿中遇到引用 VLM3D/CT-RATE 的稿件,可按下列清单快速核对常见问题:

核对点 常见问题 建议处理
数据划分声明 未说明按患者级/study 级划分,存在 volume 泄漏 要求补充划分粒度与去重证据
数据边界声明 训练混入官方验证集或外部数据 核对是否只用公开 train/validation
指标注明 只写"AUC 0.85"不写聚合方式 要求写明宏/微平均与类别覆盖
榜单比较 自建验证分数与官方榜单数字直接对比 不可比;要求改为同数据自评或注明不可比性
许可声明 商业应用未提 CC BY-NC-SA 要求披露许可与用途边界
引用身份 引了同名 text-to-3D 论文或灯塔表述 按坑 1/坑 8 更正
媒体数字 引"161 人/0.2791"未注明媒体报道口径 按坑 6 模板补口径
弱标签语义 把 18 标签当人工金标准讨论诊断性能 要求说明 RadBERT 抽取来源与噪声风险

§10 避坑清单:八个已踩过的坑

坑 1:同名 “VLM3D” 论文消歧。arXiv:2509.15772 “VLM3D: Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation”(Qwen2.5-VL + SDS,评测于 GPTeval3D)与本医学影像挑战赛毫无关系——同名、同期、都做 3D,检索极易混淆。认准医学挑战赛的三源标识:vlm3dchallenge.com、Zenodo DOI 10.5281/zenodo.15052707、MICCAI 2025 challenges 列表。

坑 2:Zenodo 双 DOI。MICCAI 官网登记 10.5281/zenodo.15052707,OpenAIRE 同时显示 10.5281/zenodo.15052708——同一记录名下两个 DOI 后缀,均重定向至同一 Zenodo 页面。正式引用建议取 MICCAI 官网口径的 15052707,避免同一文献出现两个版本号。

坑 3:规模三口径。官网/Forithmus 写 “~25,000 chest CT studies”(study 口径),Zenodo 摘要写 “over 50,000 3D chest CT volumes”(volume 口径),arXiv:2403.17834 给精确数 25,692 studies / 50,188 volumes / 21,304 patients。三者互容(study 经多重建展开为 volume),但引用时单位写错会把数据"虚增一倍"。以精确数为准,注明计数单位。

坑 4:参与数字三口径。Forums 页(2025 届收官快照)73/68/53 人,Forithmus 现页(2026 届视图)120/115/80 人,媒体报道 161/118 人——同一件事三套数。可能解释:届别不同(2025 vs 2026 累计)、口径不同(注册 vs 有效提交)。引用必须注明来源页与抓取日期,禁止跨口径比较。

坑 5:与 VinDr 无关(方向提示证伪)。主会任务简报的先验方向提示"基础数据印象为 CT-RATE/VinDr 系扩展"——官方三源核验结论:VLM3D 完全基于 CT-RATE(训练/验证)+ 封闭测试集(波士顿大学医院),与 VinDr 系数据集无关。VinDr-CXR(125) 是胸部 X 光(2D)数据集家族,与 CT-RATE 的 3D CT 无数据继承关系。此证伪结论已存照,检索者勿被"同是胸部影像"的表面相似带偏。

坑 6:报告生成名次两源冲突。影禾医脉(媒体口径)称 CT 报告生成第一(161 人中,平均 BLEU(1-4) 0.2791);Deepnoid(媒体口径)称己方报告生成第三、定位第一、分类第一。同一任务两个"第一"叙事并存——官方 leaderboard 未直接核验,可能涉及不同评测集/榜单切片。引用任何名次时写明"媒体报道口径",勿写"官方榜单"。

坑 7:arXiv 标题版本漂移。底层数据论文 arXiv:2403.17834 的 v1 标题为 “A foundation model utilizing chest CT volumes and radiology reports for supervised-level zero-shot detection of abnormalities”,v3 改题为 “Developing Generalist Foundation Models from a Multimodal Dataset for 3D Computed Tomography”。同一 arXiv 号两套标题,引用时注明版本号,按 v3 最新题名为准。

坑 8:MICCAI 任务类型串与 lighthouse 辨析。MICCAI 官网 challenges 表对 VLM3D 的标注 “Classification; Detection; Localization; Modeling; Reconstruction; Segmentation” 是 MICCAI 统一分类学标签串,不是 VLM3D 四大任务的描述;把六个词当任务清单会以偏概全。同时 VLM3D 是 MICCAI 2025 official challenge 但非 lighthouse challenge(灯塔三席:BraTS、SAGES-CVS、UNICORN)——"官方挑战赛"与"灯塔挑战赛"是两回事,引用时勿升级表述。

坑点速查总表

坑号 一句话 最高风险场景 规避动作
坑 1 同名论文消歧(arXiv:2509.15772) 文献检索、综述写作 认官网+DOI 三源标识
坑 2 Zenodo 双 DOI(15052707/15052708) 参考文献著录 取 MICCAI 官网口径 15052707
坑 3 规模三口径(study/volume/患者) 数据规模转引 用精确数并写明单位
坑 4 参与数字三口径 新闻稿、影响力引用 注明来源页+抓取日期+届别
坑 5 与 VinDr 无关(方向证伪) 数据谱系描述 引官方三源核验结论
坑 6 报告生成名次两说(影禾/Deepnoid) 榜单名次引用 写"媒体报道口径"并存存照
坑 7 arXiv 标题版本漂移(v1/v3) 论文著录 注版本号,按 v3 题名
坑 8 MICCAI 任务串误读 + 非 lighthouse 赛事身份表述 区分统一分类串与四大任务;勿升级为灯塔

§11 总结

11.1 三句话总结

  1. VLM3D 2025 是 MICCAI 2025 官方注册挑战赛,把 CT-RATE(25,692 study / 50,188 volume / 21,304 患者 / 18 异常弱标签 / 配对报告)变成四大任务(报告生成、多异常分类、自监督定位、文本条件 3D CT 生成)的公开竞技场。
  2. 赛制核心是 Docker 容器(≤50 GB)服务端评测两套隐藏测试集(内部 2,000 例 + 波士顿大学外部 1,024 例),从制度上封死测试集泄露;排名用 point-based permutation test。
  3. 冠军方法发表于 ICCV 2025 Workshop(代表:CTFlow),2026 届以 MR-RATE(约 100,000 脑 MRI 配对)扩展为六赛道;数据与赛题本体许可均为 CC BY-NC-SA,训练数据 gated 公开、测试集不公开。

11.2 适合谁

人群 用法
3D 医学视觉语言模型研究者 用四任务定义对齐自己的评测框架,对标榜单方法(CTFlow 等)
胸部 CT 分析团队 直接复用 CT-RATE train/validation 划分与 18 标签体系
挑战赛组织者 借鉴 Docker ≤50 GB + 隐藏测试集 + 统计检验排名的完整范式
报告生成/合成数据工程团队 参考 CTFlow 的"文本→3D CT"管线与 A-VAE/流匹配组件
医学 AI 生态观察者 用参与数字与工业获奖画像分析领域热度(注意坑 4/坑 6 口径)

11.3 不适合谁

场景 原因
需要商业部署 CC BY-NC-SA 禁止商业用途;参赛模型直接产品化超出许可
需要离线复现官方榜单 两套封闭测试集不公开,第三方只能自建评测且数字不可比
需要像素级/体积级人工金标准 18 标签是 RadBERT 自动抽取弱标签,任务三的人工标注集不公开
2D 胸片任务 这是 3D CT/MR 赛事;2D 对照系请走 mimic-cxr(16)/ms-cxr(340)/vindr-cxr(125)
脑 MRI 数据需求(2026 前) MR-RATE 属 2026 届资产,获取状态以官方渠道最新公告为准

11.4 30 秒决策卡

你要做什么?
├── 训练/评测 3D 胸部 CT 视觉语言模型
│   └── HF 接受条款 → 下载 CT-RATE → 按四任务对齐指标 → 引用 Zenodo DOI
├── 引用 VLM3D 挑战赛本身
│   └── DOI 10.5281/zenodo.15052707(坑 2 双 DOI 取 MICCAI 口径)
│       + 注明任务名与届别(2025 CT / 2026 CT+MR)
├── 引用榜单数字或名次
│   └── 先查坑 4(参与三口径)与坑 6(名次冲突),注明来源页+抓取日期+口径
├── 找 arXiv "VLM3D" 论文
│   └── 先过坑 1 消歧(2509.15772 与本挑战赛无关)
└── 想办一个类似挑战赛
    └── 抄 §5.1 作业:容器上限+隐藏测试集+最终有效提交+置换检验排名

FAQ(高频问答 34 问)

A. 基础认知

Q1:VLM3D 是数据集还是比赛?
两者都是,但本体是比赛。它没有自己的新数据——训练/验证数据就是 CT-RATE;它的独立资产是任务定义、赛制、榜单与 Workshop 论文。库内 ct-rate(546) 条目讲数据,本条目讲比赛。

Q2:为什么叫 VLM3D?
Vision-Language Modeling in 3D Medical Imaging 的缩写,直译"3D 医学影像视觉语言建模"。加上届别后常见写法 VLM3D 2025 / VLM3D Challenge。

Q3:它和 MICCAI 是什么关系?
MICCAI 2025 官方注册挑战赛(satellite event),在 2025 年 9 月 23-27 日韩国大田的 MICCAI 会议周内举办颁奖。注意不是 lighthouse challenge(坑 8)。

Q4:第一届是什么时候办的?
2025 届(赛事记录 2025-03-19 发布于 Zenodo,活动随 MICCAI 2025)。第二届 2026 年随 MICCAI 2026 举办。

Q5:VLM3D 和 CT-RATE 论文是同一篇吗?
不是。挑战赛记录在 Zenodo(DOI 10.5281/zenodo.15052707);底层数据论文是 arXiv:2403.17834(CT-RATE/CT-CLIP)。两者团队重叠(Hamamci 等 32 人署名挑战赛记录)但文档身份独立。

B. 数据与获取

Q6:训练数据从哪下载?
HuggingFace ibrahimhamamci/CT-RATE,gated 数据集:登录→接受使用条款→下载。许可 CC BY-NC-SA。注意 hf-mirror 等镜像通道对 gated 数据集通常不可用(本库核验时 API 返回鉴权失败)。

Q7:测试集能下载吗?
不能。内部测试 2,000 例 + 波士顿大学外部测试 1,024 例均不公开,仅组织方服务端评测用。这是设计而非疏漏——防泄露是赛制核心。

Q8:数据是什么格式?
3D volume 为 NIfTI(.nii.gz),配文本报告与多标签 CSV。目录命名 split_patientID_scanID_reconstructionID(如 train_1_a_1.nii.gz)。

Q9:训练集和验证集怎么分?
CT-RATE 官方划分:训练 20,000 患者、内部验证 1,304 患者。VLM3D 规则要求四任务全部只用这个公开划分。

Q10:能商用吗?
不能。CT-RATE 与挑战赛本体均 CC BY-NC-SA(非商业-相同方式共享)。商业用途需另行获得权利人许可,挑战赛获奖不改变数据许可。

Q11:官方代码在哪?
GitHub ibrahimethemhamamci/ 下的 CT-CLIP 与 CT-CHAT 两个仓库(基础模型与对话模型开源实现)。挑战赛参赛代码是否逐队公开以各队论文与仓库为准。

C. 任务与赛制

Q12:四个任务里哪个最难?
维度不同难说"最",但任务四(文本条件 3D CT 生成)计算最重——冠军方法 CTFlow 训练超过 5,000 GPU 小时;任务三(自监督定位)约束最苛刻——训练禁用人工标注。

Q13:Docker 容器 50 GB 上限包含什么?
权重、依赖、代码都算。这个上限实质限制了参数规模与冗余打包,鼓励高效架构。具体打包规范以官网 rules 页为准。

Q14:排名怎么算的?
point-based permutation test scheme:以主指标为基础做点数制置换检验,判断名次差异的统计显著性——比"单一数字排序"更稳健。

Q15:提交几次?
多次提交机制下仅最终有效提交参与排名(防榜单试探式刷分)。提交次数上限等细则以官网为准。

Q16:外部测试集(波士顿大学)和内部测试集的区别?
分布不同:内部 2,000 例与训练数据同分布(梅迪波尔医院),外部 1,024 例来自波士顿大学医院(跨机构)。前者量"同分布上限",后者量"泛化保留率"。

D. 结果与榜单

Q17:冠军是谁?
任务与赛道不同冠军不同:文本条件生成方向代表方法为 CTFlow(ICCV 2025W 发表);自监督定位与分类方向媒体口径冠军为 Deepnoid M4CT;报告生成方向媒体口径第一为影禾医脉(但与 Deepnoid 的"第三"叙事冲突,见坑 6)。官方 leaderboard 建议直接查 vlm3dchallenge.com。

Q18:影禾医脉和 Deepnoid 到底谁第一?
报告生成任务上两方媒体口径冲突(影禾称第一、Deepnoid 称己方第三)。官方榜单未在本库核验中直接读取,本条目不做仲裁、两说并存。引用时写"媒体报道口径"。

Q19:BLEU 0.2791 是什么水平?
媒体报道口径:影禾医脉在报告生成赛道的平均 BLEU(1-4),较基线高约 5 个点。BLEU 对医学长文本是粗指标,0.28 量级在报告生成任务里属正常竞争区间,不代表"28% 正确"。

Q20:参加人数到底多少?
三口径:Forums 页 73/68/53 人(2025 届三赛道)、Forithmus 现页 120/115/80 人(2026 届视图)、媒体 161/118 人(报告/分类赛道)。无官方仲裁说明,引用注明来源页与抓取日期(坑 4)。

E. 生态与延伸

Q21:2026 届有什么新东西?
MR-RATE 脑 MRI 数据集(约 100,000 配对扫描-报告,CC BY-NC-SA)+ 三条新赛道(MR-ABNORMALITY/MR-REPORT/MR-VOLUME),共六赛道;赛制沿用 Docker 服务端评测;早期获奖者受邀 MIUA 2026 展示。

Q22:CTFlow 是什么?
ICCV 2025 VLM3D Workshop 发表的文本条件 3D CT 合成方法:video-inspired latent flow matching + A-VAE + CT-CLIP 文本编码器,自回归逐层生成 3D volume,训练超 5,000 GPU 小时。该方向的事实公开基线。

Q23:CT-CLIP 的零样本检测为什么常被引用?
CT-RATE 论文的标志性结果:CT-CLIP 的零样本多异常检测优于全监督 SOTA——说明"volume+报告"的对比预训练能迁移出结构化诊断能力。这也是 VLM3D 四大任务数据假设的合法性来源。

Q24:和 RadVLM 一类的 2D 医学 VLM 什么关系?
互补而非竞争:RadVLM 系(及 radvlm-instruction-dataset(624))做 2D 胸片的指令跟随与对话;VLM3D 生态做 3D 容积。任务形态相似(报告生成/分类/VQA),数据载体与模型架构(2D ViT vs 3D/逐层处理)不同。

Q25:检索 “VLM3D” 出来的 text-to-3D 论文是怎么回事?
那是 arXiv:2509.15772(Qwen2.5-VL + SDS 奖励做 text-to-3D 生成),与本挑战赛无关,纯同名(坑 1)。医学语境认 vlm3dchallenge.com 与 Zenodo DOI。

Q26:想引用本条目,抓取时点是什么?
本库核验与写作的抓取时点为 2026-09-26;官网页面(尤其参与数字)为动态内容,再引用时建议按坑 4 的纪律重新核对当日快照。

Q27:我没有 GPU 集群,还能用这套数据做什么?
三条轻量路径:CT-CLIP 特征 + 线性探针做分类基线(单卡可行);用官方验证划分(1,304 患者)子集做报告生成的 LoRA 微调实验;读 CTFlow 论文做方法学综述或评测设计研究。生成任务的全量复现才是算力大户。

Q28:任务三"自监督"到底禁止什么?
禁止在训练阶段使用任何人工 ground-truth 定位标注(框/掩码/体积)。允许使用:影像本身(重建、对比学习)、影像-报告配对(文本侧监督)、公开预训练权重。评测阶段才用人工标注集——"训练不用、评测才用"是这条规则的全部。

Q29:如果我只想做教育/演示用途?
CC BY-NC-SA 的非商业条款覆盖教育场景;合成 CT(任务四产物)用于教学时明示"合成数据"即可规避患者隐私问题——这正是官方列出的应用方向之一(§4.4)。

Q30:2026 届报名从哪里进?
vlm3dchallenge.com 与 Forithmus 合集页是入口;MR 赛道需关注 MR-RATE 的发放公告(§8.5)。CT 赛道老选手可直接沿用已有管线,重点预算在新序列预处理上(§8.4)。

Q31:本条目与 ct-rate 条目的数字为什么一致?
因为同一份数据:ct-rate(546) 条目与 VLM3D 条目的规模数字同源(arXiv:2403.17834 精确数)。若发现两处数字不一致,以精确数为准并视为条目缺陷反馈库方。

Q32:18 个异常类别里为什么有"食管裂孔疝"这种看似非胸部的条目?
食管裂孔疝在胸部 CT 上可观察(胃贲门部经膈食管裂孔疝入胸腔),且是报告里常被提及的偶发发现——报告挖掘路线天然会把"报告里写什么"变成标签,而非只挑"典型胸部病"。

Q33:外部测试集 1,024 例的"外部"指什么?
指与训练数据不同机构的波士顿大学医院——跨厂商、跨人群、跨临床惯例。它在榜单上衡量的是泛化保留率,是整个赛制里最能区分"背题"与"泛化"的部分。

Q34:可以把 VLM3D 的任务搬到自己的数据上吗?
可以且被鼓励——四大任务的定义与指标族是公开的方法论,不随数据许可绑定;只是搬用后不能再说"VLM3D 口径",应写"参照 VLM3D 任务设计"。

Q35:我想确认一篇文章引用的到底是挑战赛还是同名论文,最快的方法?
三个指纹任查其一:官网域名(vlm3dchallenge.com)、DOI 前缀(10.5281/zenodo.15052707 系)、任务词(报告生成/多异常分类/自监督定位/文本条件 CT 生成)。text-to-3D 同名论文(坑 1)的指纹是 Qwen2.5-VL、SDS、GPTeval3D 三个词。

Q36:两届赛事混在一个文献综述里,怎么防串?
按届分栏引用:2025 届引 Zenodo DOI + MICCAI 2025 + ICCV 2025W;2026 届引官网 2026 页 + MIUA 2026。任何参与数字、榜单数字必须带届别标签;"四任务"属于两届共有,"六赛道"只属于 2026 届。

事实清单(硬事实 34 条)

  1. VLM3D 全称 Challenge for Vision-Language Modeling in 3D Medical Imaging。
  2. MICCAI 2025 官方注册挑战赛(satellite event),非 lighthouse(灯塔三席:BraTS、SAGES-CVS、UNICORN)。
  3. Zenodo 记录 DOI 10.5281/zenodo.15052707(MICCAI 口径)与 10.5281/zenodo.15052708(OpenAIRE 并存口径),重定向同页。
  4. Zenodo 发布 2025-03-19,Version v1,署名 32 位作者。
  5. 第一作者 Ibrahim Ethem Hamamci(CT-RATE/CT-CLIP/CT-CHAT 一作)。
  6. 牵头组织方 Forithmus;联盟含苏黎世大学、伊斯坦布尔梅迪波尔大学、波士顿大学、斯坦福、哈佛、约翰霍普金斯、帝国理工、上海交大、都柏林大学学院、NIH、ETH 苏黎世、NVIDIA。
  7. 组织委员会含 Bjoern Menze、Kayhan Batmanghelich、Pranav Rajpurkar、Alan Yuille、Zongwei Zhou、Bernhard Kainz、Weidi Xie 等。
  8. 底层数据 CT-RATE:25,692 非增强胸部 CT study / 21,304 患者 / 50,188 volume / 超 14.3M slice。
  9. CT-RATE 单中心(伊斯坦布尔梅迪波尔医院)、3 家厂商扫描仪、18-102 岁、性别均衡。
  10. 18 种胸部异常多标签由微调 RadBERT 从报告自动抽取,微调用 1,000 份人工标注报告。
  11. 报告含 impression 与 findings 两节(放射科医生撰写)。
  12. 划分:训练 20,000 患者 / 内部验证 1,304 患者;命名 split_patientID_scanID_reconstructionID。
  13. 四大任务:CT 报告生成、多异常分类(18 标签)、自监督多异常定位、文本条件 3D CT 生成。
  14. 任务三训练阶段禁用人工 ground-truth 标注,用人工标注集评测。
  15. 任务四指标族 FVD/FID/CLIP score/IS(CTFlow 论文口径)。
  16. 评测:Docker 容器 ≤50 GB,服务端评测隐藏测试集。
  17. 测试集:内部 2,000 例 + 波士顿大学医院外部 1,024 例,均不公开。
  18. 仅最终有效提交参与排名;排名用 point-based permutation test。
  19. 2025 三赛道:VLM3D-CT-ABNORMALITY / CT-REPORT / CT-VOLUME。
  20. 参与数字三口径:Forums 页 73/68/53、Forithmus 现页 120/115/80、媒体 161/118。
  21. 颁奖于 2025-09-24 前后(MICCAI 2025 大田会议周,9 月 23-27 日)。
  22. 冠军方法发表于 ICCV 2025 VLM3D Workshop(CVF open access)。
  23. CTFlow:video-inspired latent flow matching + A-VAE + CT-CLIP 文本编码器,训练超 5,000 GPU 小时。
  24. 媒体口径获奖:影禾医脉报告生成第一(BLEU(1-4) 0.2791)分类第三(AUC 0.846);Deepnoid M4CT 定位第一、分类第一、报告生成第三;两源报告生成名次冲突存照。
  25. 许可:CT-RATE 与挑战赛本体均 CC BY-NC-SA;CT-RATE 经 HuggingFace gated 托管。
  26. CT-CLIP、CT-CHAT 代码 GitHub 开源;CT-CLIP 零样本多异常检测优于全监督 SOTA。
  27. 2026 第二届:MR-RATE 脑 MRI 约 100,000 配对扫描-报告,六赛道,MICCAI 2026 satellite event。
  28. 早期获奖者受邀 MIUA 2026(University College Dublin,爱尔兰)展示。
  29. 同名消歧:arXiv:2509.15772(text-to-3D 生成)与本挑战赛无关。
  30. 证伪存照:VLM3D 完全基于 CT-RATE + 封闭测试集,与 VinDr 系无关。
  31. HuggingFace gated 条款与 CC BY-NC-SA 叠加生效;hf-mirror 等镜像通道对 gated 数据集不可用(核验实测)。
  32. 2025 届规则原文同句覆盖 CT-RATE 与 MR-RATE 两代数据的 CC BY-NC-SA 声明。
  33. 第三方合法自测数据只有官方验证划分(1,304 患者),自评分数与官方榜单不可比。
  34. VLM3D 生态无公开的 3D 医学指令数据集(2D 世界对应物为 radvlm-instruction-dataset(624))。

术语表(36 条)

术语 释义
VLM3D Challenge for Vision-Language Modeling in 3D Medical Imaging,3D 医学影像视觉语言建模挑战赛
MICCAI 医学影像计算与计算机辅助介入国际会议;VLM3D 的母会议
satellite event 卫星活动:挂靠主会议举办的挑战赛/workshop
lighthouse challenge MICCAI 从注册挑战赛遴选的"灯塔"标杆;VLM3D 2025 不在其列
CT-RATE 25,692 study 的非增强胸部 CT + 报告 + 18 异常弱标签数据集(VLM3D 训练数据)
study 影像学一次检查单位;一个 study 可因多重建展开为多个 volume
volume 3D 容积数据单元;CT-RATE 共 50,188 个
NIfTI 神经影像常用 3D/4D 数据格式(.nii.gz),CT-RATE 的存储格式
reconstruction 同一扫描的不同重建(层厚/核算法),volume 计数大于 study 计数的来源
impression / findings 放射报告的"印象/发现"两节,报告生成任务的输出目标
RadBERT 面向放射学的 BERT 文本模型;18 异常标签由其微调版自动抽取
弱标签 从报告文本自动挖掘而非人工逐例标注的标签
多标签分类 每例可同时命中多个类别(18 异常互不互斥)
自监督定位 训练不用人工位置标注、仅靠影像-文本等信号学会定位病灶的范式
BLEU n-gram 重合度文本指标,报告生成任务主指标之一
AUC ROC 曲线下面积,多异常分类任务主指标
FVD / FID 生成质量指标(Fréchet 距离族),FVD 把 volume 当视频帧序列处理
CLIP score 文本-影像对齐度指标,文本条件生成任务用
flow matching 流匹配生成范式;CTFlow 用 video-inspired latent 变体做 3D CT 合成
Docker 容器技术;VLM3D 参赛交付形态(≤50 GB)
服务端评测 组织方在隐藏数据上运行参赛容器的评测模式
permutation test 置换检验;VLM3D 排名用其点数制方案判断名次差异显著性
MR-RATE 2026 届新增脑 MRI 配对数据集(约 100,000 对,CC BY-NC-SA)
CC BY-NC-SA 知识共享"署名-非商业-相同方式共享"许可;CT-RATE 与挑战赛本体均此许可
gated dataset 需登录并接受使用条款方可下载的 HuggingFace 数据集形态
impression 放射报告的结论节,报告生成任务的重要输出目标
joint challenge paper 挑战赛官方联合论文,收录头部参赛方法(官网口径)
zero-shot detection 零样本检测:不针对目标异常微调直接推理;CT-CLIP 的标志性结果
point-based permutation test 点数制置换检验:以统计显著性而非裸分差定名次的排名方案
A-VAE 3D 自编码器,CTFlow 管线的隐空间压缩组件
linear probe 线性探针:冻结特征+线性头的轻量评测法,分类任务的入门基线
patient-level split 患者级划分:以患者为最小单元切分数据,防泄漏的标准做法
coverage bias 覆盖偏倚:报告未提及≠影像无异常,弱标签路线的固有风险
server-side evaluation 服务端评测:组织方持有数据并运行参赛容器的盲测模式
CT2Rep CT-RATE 系谱中的 3D CT 报告生成同期工作(§7.3 谱系表)
RAD-ChestCT 公开胸部 CT 数据集,CT-CLIP 论文外部验证所用(非 VLM3D 赛题数据)

附录

附录 A:条目信息速查卡

项 值
条目名 VLM3D 2025
url_name vlm3d
类型 官方挑战赛 + 评测基准(数据本体为 CT-RATE,另立条目)
赛事记录 Zenodo DOI 10.5281/zenodo.15052707(2025-03-19,v1,32 作者)
母会议 MICCAI 2025(2025-09-23 至 27,韩国大田)
训练数据 CT-RATE(HF ibrahimhamamci/CT-RATE,gated,CC BY-NC-SA)
测试数据 内部 2,000 例 + 外部 1,024 例(不公开)
许可 CC BY-NC-SA(数据与赛题本体)
抓取时点 2026-09-26
库内互链 ct-rate(546)/mimic-cxr(16)/ms-cxr(340)/ms-cxr-t(619)/chexstruct-cxreasonbench(604)/radvlm-instruction-dataset(624)/vindr-cxr(125)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 8 官网 + MICCAI 官网列表 + Zenodo DOI + ICCV 2025W 四路可索引;但同名论文(坑 1)与多口径数字(坑 3/4)增加检索噪声
A 可获取性 5 训练数据 gated 可得(接受条款即可),但测试集彻底不公开;榜单数字不可离线复现——两道失分
I 可互操作 7 NIfTI 标准格式 + HF 托管 + Docker 交付规范;命名规则(split_patientID_scanID_reconstructionID)机器可解析;缺官方 DICOM 转换件
M 元数据质量 7 任务定义/指标/规则官网齐备;但参与数字三口径(坑 4)、双 DOI(坑 2)、规模三口径(坑 3)需引用者自查——元数据"多而不仲裁"
S 可持续性 7 两届连续办赛(2025 CT → 2026 CT+MR)+ Forithmus 机构化运营 + 多会议发表通道;依赖单一官网域名是轻微单点风险
综合评级 6.8/10(中上) 赛制与任务定义的工程化程度高于均值;可获取性被"测试集不公开"与 CC BY-NC-SA 拖低

附录 C:逐项证据链自证

关键数字/事实 来源 位置/时点
25,692 study / 50,188 volume / 21,304 患者 / 14.3M slice arXiv:2403.17834 CT-RATE 论文摘要与正文
训练 20,000 / 验证 1,304 患者 CT-RATE 官方划分 论文与 HF 数据卡
测试集 2,000 内部 + 1,024 波士顿大学外部 Zenodo 记录摘要 DOI 10.5281/zenodo.15052707
发布 2025-03-19 / v1 / 32 作者 Zenodo 记录元数据 同上
MICCAI 2025 官方注册 + DOI + license CC BY-NC-SA conferences.miccai.org/2025 challenges 列表 MICCAI 官网
非 lighthouse miccai.org SIG challenges 表 + lighthouse 三席名单 MICCAI 官网
CC BY-NC-SA 原文 vlm3dchallenge.com rules 页(“Both CT-RATE and MR-RATE are released under CC BY-NC-SA”) 官网抓取 2026-09-26
Docker ≤50 GB / 服务端评测 / permutation test 排名 vlm3dchallenge.com 规则页 官网抓取 2026-09-26
参与数字 73/68/53 与 120/115/80 vlm3dchallenge.com Forums 页 / research.forithmus.com collections 页 两页分别抓取 2026-09-26
四任务定义 vlm3dchallenge.com 任务页 + Zenodo 记录 官网抓取 2026-09-26
ICCV 2025W VLM3D 论文集 openaccess.thecvf.com/content/ICCV2025W/VLM3D/ CVF open access
CTFlow 组件与 5,000+ GPU 小时 CTFlow 论文(ICCV 2025W) CVF open access
影禾医脉 BLEU 0.2791 / AUC 0.846 韩媒/港股财经报道(媒体口径) 新闻抓取 2026-09-26
Deepnoid M4CT 三赛道获奖口径 韩媒报道(媒体口径) 新闻抓取 2026-09-26
MR-RATE 约 100,000 配对 / 六赛道 / MIUA 2026 vlm3dchallenge.com 2026 届页面 官网抓取 2026-09-26

附录 D:数据获取决策树

需求是什么?
├── 只想训练 3D 胸部 CT 视觉语言模型
│   └── HuggingFace 接受条款 → ibrahimhamamci/CT-RATE(CC BY-NC-SA)
├── 想复现挑战赛任务
│   ├── 训练:CT-RATE train/validation(唯一合法数据边界)
│   ├── 评测:官方测试集不可得 → 自建(1,304 患者验证划分)
│   │    └── 注意:自建数字与官方榜单不可直接比较
│   └── 提交形态:参考 Docker ≤50 GB 打包规范
├── 只想引用榜单名次
│   └── 先读坑 4/坑 6 → 注明来源页 + 抓取日期 + 口径
├── 想做文本条件 3D CT 生成
│   └── CTFlow(ICCV 2025W)为公开基线 → 组件:A-VAE + CT-CLIP 文本编码器
└── 想做脑 MRI 对应任务
    └── 等 2026 届 MR-RATE 发布渠道(CC BY-NC-SA)→ 关注官网公告

附录 E:四大任务 × 指标 × 获奖口径对照表

任务 赛道 输入→输出 指标 媒体口径代表成绩
报告生成 VLM3D-CT-REPORT volume → 自由文本报告 BLEU(1-4) 族 影禾医脉:平均 BLEU(1-4) 0.2791(161 人综合第一);Deepnoid 称第三(口径冲突,坑 6)
多异常分类 VLM3D-CT-ABNORMALITY volume → 18 标签 AUC 影禾医脉第三(118 人中,AUC 0.846);Deepnoid M4CT 第一(口径并存)
自监督定位 (并入 ABNORMALITY 方向) volume → 异常空间定位 人工标注集评测 Deepnoid M4CT 第一(媒体口径)
文本条件生成 VLM3D-CT-VOLUME 报告文本 → 合成 volume FVD/FID/CLIP/IS CTFlow 为代表发表方法(ICCV 2025W)

附录 F:参与数字三口径总表(引用模板)

口径 页面属性 CT-ABNORMALITY CT-REPORT CT-VOLUME 引用写法模板
口径 A vlm3dchallenge.com Forums 页(2025 届收官快照) 73 人/40 提交 68 人/49 提交 53 人/20 提交 “2025 届 Forums 页快照(抓取于 YYYY-MM-DD)”
口径 B research.forithmus.com collections 页(2026 届视图) 120/165 115/126 80/192 “Forithmus 现页 2026 届视图(抓取于 YYYY-MM-DD)”
口径 C 媒体报道(韩媒/港股财经) 分类 118 人 报告 161 人 未披露 “媒体报道口径(YYYY-MM 报道)”

三口径并存、无官方仲裁。任何跨口径比较均属误用。

附录 G:2025 届 vs 2026 届对照表

维度 2025 届 2026 届
母会议 MICCAI 2025(大田) MICCAI 2026
数据域 CT(胸部) CT + MR(脑)
数据集 CT-RATE CT-RATE + MR-RATE(约 100,000 配对)
赛道数 3 6
赛制 Docker ≤50 GB 服务端评测 沿用
许可 CC BY-NC-SA CC BY-NC-SA(官网规则同句覆盖 MR-RATE)
展示通道 ICCV 2025 VLM3D Workshop MIUA 2026(都柏林大学学院)+ 论文通道
2025 榜单 当届有效 保留作参考

附录 H:CT-RATE 数据加载骨架(代码)

import re
from pathlib import Path

PATTERN = re.compile(
    r"^(?P<split>train|validation)_(?P<patient>\d+)_(?P<scan>[a-z])_(?P<recon>\d+)\.nii\.gz$"
)

def index_ct_rate(root: str):
    """按 命名规则解析 CT-RATE 目录,返回患者级索引。
    关键:以 patient_id 为去重键,防止患者级泄漏。"""
    index = {}
    for f in Path(root).rglob("*.nii.gz"):
        m = PATTERN.match(f.name)
        if not m:
            continue                      # 命名不符的文件先记录再人工排查
        rec = m.groupdict()
        index.setdefault(rec["patient"], []).append({
            "split": rec["split"],        # train / validation
            "scan": rec["scan"],          # 同患者第几次检查
            "recon": rec["recon"],        # 同检查的第几种重建
            "path": str(f),
        })
    return index

def patient_level_split(index, train_ids, val_ids):
    """患者级划分校验:任一患者不得同时出现在 train 与 validation。"""
    assert not (set(train_ids) & set(val_ids)), "患者级泄漏!"
    return ({p: index[p] for p in train_ids},
            {p: index[p] for p in val_ids})

附录 I:Docker 参赛交付自查清单(复现模板)

提交前自查(对应 §5.1 规则):
□ 容器总大小 ≤ 50 GB(权重+依赖+代码)
□ 入口脚本可无网络运行(服务端环境不保证联网)
□ 输入:3D CT volume(NIfTI);输出:任务规定格式(报告文本/标签 CSV/热图/合成 volume)
□ 随机种子固定(评测需可复现)
□ 仅使用 CT-RATE train/validation 训练(数据边界声明)
□ 最终有效提交的版本号确认(仅最终提交参与排名)
□ 主指标与评测脚本版本对齐官网 rules 页当日快照

附录 J:18 异常标签体系使用注意表

注意点 说明
来源 微调 RadBERT 从报告自动抽取(弱标签),非人工逐例标注
微调金标准 仅 1,000 份报告经人工标注用于分类器微调
代表类别 肺结节、动脉壁钙化、冠状动脉钙化、心脏肥大、心包积液、胸腔积液、肺实变、肺气肿、肺纤维化后遗症、肺不张、淋巴结肿大、磨玻璃影(lung opacity)、小叶间隔增厚、支气管扩张、胸膜增厚、食管裂孔疝、马赛克衰减模式等(完整清单以官方 CSV 为准)
标签语义 “报告提及”≠“影像确认”:报告漏写≠无异常
粒度 有无(二值),无位置信息;定位需求走任务三范式
患病率 类别高度不均衡,多标签聚合方式(宏/微平均)影响分数解读

附录 K:与库内条目互链声明

本条目(vlm3d)与以下库内条目建立互链:ct-rate(546) 为上游数据本体条目(数据规格、下载、谱系的完整画像在本条目只保留参赛者必需骨架);mimic-cxr(16)、ms-cxr(340)、ms-cxr-t(619) 构成 2D 胸片视觉语言对照系(VLM3D 是其 3D 迁移);chexstruct-cxreasonbench(604) 为报告结构化与推理评测对照;radvlm-instruction-dataset(624) 为 2D 医学 VLM 指令数据(与四任务互补);vindr-cxr(125) 为消歧对照条目(与 VLM3D 无数据关系,见坑 5)。引用边界:引用"数据集规格"请引 ct-rate 条目,引用"任务/榜单/赛制"请引本条目。

附录 L:证据链与核验方法说明

本条目的全部关键事实按"三轮精确搜索 + 三源互证"纪律核验,存照如下:

  1. 第一轮(官网系):vlm3dchallenge.com(任务、规则、Forums 参与快照)+ research.forithmus.com/collections/vlm3d-challenge(机构合集、2026 届视图)——确立四任务、Docker 规则、CC BY-NC-SA 原文、参与数字口径 A/B。
  2. 第二轮(学会系):conferences.miccai.org/2025 challenges 列表 + miccai.org SIG challenges 表——确立官方注册身份、登记 DOI(15052707)、license 列、统一任务类型串(坑 8)、非 lighthouse(三席名单比对)。
  3. 第三轮(记录与论文系):Zenodo 记录(发布日 2025-03-19、v1、32 作者、测试集 2,000/1,024、volume 口径)+ arXiv:2403.17834(精确规模 25,692/50,188/21,304/14.3M、RadBERT 1,000 份微调标注)+ ICCV 2025W 论文集(CTFlow 组件与算力)。

三源互证结论:任务、赛制、许可、时间线、数据规格五类事实均至少两源一致;无法仲裁的四类口径(坑 2/3/4/6)全部就地存照而非取舍。核验过程中的两条失败路径同样存照:hf-mirror API 对 gated 数据集返回鉴权失败(改用搜索核对 HF 页面内容并记录镜像不可用事实);arXiv 全文 API 对 “VLM3D” 检索返回空(改用网页搜索命中同名论文并转化为坑 1 消歧存照)。

附录 M:常见误解澄清表

误解 澄清 出处
VLM3D 发布了新影像数据 训练/验证数据即 CT-RATE;新的是任务与榜单 官网规则+Zenodo
VLM3D 数据来自 VinDr 系 与 VinDr 无关;测试集来自波士顿大学医院 三源核验(坑 5)
测试集 2,000+1,024 例可下载 均不公开,仅服务端评测 Zenodo 记录摘要
MR-RATE 是 2025 届数据 2026 届新增;2025 届纯 CT 官网 2026 届页
参赛模型获奖后可商用 CC BY-NC-SA 禁商业用途 官网 rules 原文
官方榜单数字可本地复现 不可;第三方只能用 1,304 患者验证划分自建 赛制设计(§5.5)
MICCAI 六词任务串就是赛题 那是学会统一分类学标注 MICCAI challenges 表(坑 8)
“VLM3D 2026 六赛道=六个新任务” 任务仍四类;赛道是数据域×任务组合 官网赛道页(§4.5)
CT-CLIP/CT-CHAT 是挑战赛冠军模型 它们是组织方的官方基线系;冠军另有其队(CTFlow 等) ICCV 2025W 论文集
14.3M 张 slice=14.3M 个样本 slice 是 volume 的组成层;样本单位是 study/volume §2.1 口径表

附录 N:引用模板库

为减少引用时踩坑,给出五类高频引用的写法模板(坑点已在模板内规避):

赛事引用:
VLM3D Challenge: Challenge for Vision-Language Modeling in 3D Medical Imaging. Zenodo. DOI 10.5281/zenodo.15052707(2025-03-19 发布,v1;官方注册于 MICCAI 2025,韩国大田)。〔避免:写 15052708 后缀与 15052707 混用——坑 2〕

数据引用:
Hamamci, I.E., et al. A foundation model utilizing chest CT volumes and radiology reports…(arXiv:2403.17834,注意按所引版本著录题名——坑 7);数据本体:CT-RATE, HuggingFace ibrahimhamamci/CT-RATE, CC BY-NC-SA。

规模转引:
“CT-RATE 包含 25,692 个非增强胸部 CT study(21,304 位患者),按多种重建展开为 50,188 个 3D volume。”〔避免:把 volume 数说成 study 数或反之——坑 3〕

榜单转引:
“据媒体报道口径(抓取于 2026-09-26),影禾医脉在 2025 届 CT 报告生成赛道获综合第一(161 人参与,平均 BLEU(1-4) 0.2791);Deepnoid 新闻稿则称该队获此赛道第三——两口径并存,官方 leaderboard 为准。”〔避免:去掉"媒体报道口径"四字——坑 6;去掉人数来源——坑 4〕

身份表述:
“VLM3D 2025 为 MICCAI 2025 官方注册挑战赛(satellite event,非 lighthouse),设报告生成、多异常分类、自监督多异常定位、文本条件 3D CT 生成四任务。”〔避免:把 MICCAI 六词任务类型串当任务清单、升级为灯塔挑战赛——坑 8〕

附录 O:关键文档身份对照表

VLM3D 生态的文档身份容易缠绕,一张表理清"谁是论文、谁是记录、谁是数据":

文档 身份 角色 常见误用
Zenodo 记录(DOI 10.5281/zenodo.15052707) 赛事记录(非论文) 挑战赛的可引用身份凭证 被当数据下载入口(§6.6)
arXiv:2403.17834 底层数据论文(CT-RATE/CT-CLIP) 数据规格与方法原型的学术出处 被当挑战赛论文引用
ICCV 2025W VLM3D 论文集 冠军方法论文集合 方法细节与可复现组件 被当赛制规则的出处
vlm3dchallenge.com 官网 任务/规则/榜单的权威动态源 快照数字被当永久事实(坑 4)
research.forithmus.com 合集页 机构运营页 2026 届视图与合集导航 与官网 2025 届快照混淆(坑 4)
MICCAI challenges 列表 学会注册凭证 官方身份、DOI、license 登记 六词分类串被当任务清单(坑 8)
HF ibrahimhamamci/CT-RATE 数据托管页 唯一训练数据入口(gated) 被镜像站替代尝试(会失败,§6.2)
GitHub CT-CLIP / CT-CHAT 官方代码库 基础模型与对话模型实现 被当冠军方案(冠军是 CTFlow 等)

附录 P:两届赛事引用速查卡

引用对象 2025 届写法 2026 届写法
赛事身份 MICCAI 2025 official challenge(非 lighthouse) MICCAI 2026 satellite event
赛事记录 Zenodo DOI 10.5281/zenodo.15052707(v1,2025-03-19) 以官网 2026 届公告为准
数据 CT-RATE(HF gated,CC BY-NC-SA) CT-RATE + MR-RATE(约 100,000 配对脑 MRI)
赛道 CT-ABNORMALITY / CT-REPORT / CT-VOLUME 上述三条 + MR-ABNORMALITY / MR-REPORT / MR-VOLUME
方法出口 ICCV 2025 VLM3D Workshop(CTFlow 等) MIUA 2026 展示 + 论文通道
参与数字 Forums 页快照 73/68/53(注明抓取日期) Forithmus 现页 120/115/80(2026 届视图,注明抓取日期)
测试集 内部 2,000 + 波士顿大学外部 1,024(不公开) 待官方公告
历史榜单 2025 届榜单保留作参考 当届有效

尾注

  • 官方渠道:vlm3dchallenge.com(任务/规则/榜单);research.forithmus.com/collections/vlm3d-challenge(机构合集页);Zenodo DOI 10.5281/zenodo.15052707(赛事记录);conferences.miccai.org/2025(MICCAI challenges 列表)。
  • 数据与代码:HuggingFace ibrahimhamamci/CT-RATE(gated,CC BY-NC-SA);GitHub ibrahimethemhamamci/CT-CLIP 与 CT-CHAT(开源)。
  • 论文:arXiv:2403.17834(CT-RATE/CT-CLIP,v1/v3 标题漂移见坑 7);ICCV 2025 VLM3D Workshop 论文集(CVF open access,含 CTFlow)。
  • 本条目抓取时点 2026-09-26;官网动态内容(参与数字、榜单)引用前请按坑 4 纪律重新核对当日快照。
  • 口径冲突不做仲裁的四处在案:双 DOI(坑 2)、规模三口径(坑 3)、参与三口径(坑 4)、报告生成名次两说(坑 6)——存照即结论。

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • osic-pulmonary-fibrosis — 共享标签:医学影像 / CT / 多模态 / 挑战赛数据集 / 评测基准
  • ms-cxr-t — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 评测基准
  • reg2026 — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 挑战赛数据集
  • biomedica — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 评测基准
  • quilt-1m — 共享标签:医学影像 / 多模态 / 影像-文本对齐
  • medpix — 共享标签:医学影像 / CT / 多模态
  • openi — 共享标签:医学影像 / 影像-文本对齐 / 评测基准
  • roco — 共享标签:医学影像 / 多模态 / 影像-文本对齐
  • derm1m — 共享标签:多模态 / 影像-文本对齐 / 评测基准
  • toothfairy2 — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集