信息速览
INFOBOX — VLM3D 2025 一屏速览
维度 内容 本质 MICCAI 2025 官方注册挑战赛(satellite event)+ 围绕 CT-RATE 构建的 3D 医学影像视觉语言基准;非独立数据集论文,而是"数据集+赛题+榜单"三合一 全称 Challenge for Vision-Language Modeling in 3D Medical Imaging(VLM3D Challenge) 组织方 Forithmus 牵头 + 多机构联盟:苏黎世大学、伊斯坦布尔梅迪波尔大学、波士顿大学、斯坦福、哈佛、约翰霍普金斯、帝国理工、上海交大、都柏林大学学院、NIH、ETH 苏黎世、NVIDIA 关键人物 第一作者/发起人 Ibrahim Ethem Hamamci(CT-RATE/CT-CLIP/CT-CHAT 一作);组织委员会含 Bjoern Menze、Kayhan Batmanghelich、Pranav Rajpurkar、Alan Yuille、Zongwei Zhou 等 底层数据 CT-RATE:25,692 个非增强胸部 CT study(21,304 患者)/ 50,188 个 3D volume / 超 14.3M 张 slice / 18 种异常多标签 / 配对放射学报告 四大任务 ①CT 报告生成 ②多异常分类(18 标签)③自监督多异常定位 ④文本条件 3D CT 生成 赛制 Docker 容器(≤50 GB)服务端评测隐藏测试集;内部测试 2,000 例 + 波士顿大学外部测试 1,024 例(均不公开);point-based permutation test 排名 参与规模 双口径:Forums 页 73/68/53 人 vs Forithmus 现页 120/115/80 人(三赛道);媒体口径报告生成 161 人——引用必须注明届别与抓取日期(坑 4) 结果发表 冠军方法发表于 ICCV 2025 VLM3D Workshop(如 CTFlow:video-inspired latent flow matching 文本条件 3D CT 合成) 工业获奖 影禾医脉(报告生成第一、分类第三)、Deepnoid M4CT(定位第一、分类第一、报告生成第三)——报告生成名次两源冲突,官方榜单未直接核验(坑 6) 许可 CT-RATE 与挑战赛本体均 CC BY-NC-SA;封闭测试集不公开;CT-CLIP/CT-CHAT 代码 GitHub 开源 2026 届 第二届扩展 MR-RATE(脑 MRI 约 100,000 配对扫描-报告),CT×3 + MR×3 六赛道,MICCAI 2026 satellite event 库内互链 ct-rate(546)(上游本体)、mimic-cxr(16)/ms-cxr(340)/ms-cxr-t(619)(2D 对照系)、chexstruct-cxreasonbench(604)、radvlm-instruction-dataset(624)、vindr-cxr(125)(消歧对照)
VLM3D 2025 是一个"把最大 3D 胸部 CT 影像-文本数据集变成公开竞技场"的挑战赛:它不新采集数据,而是把 Hamamci 等人发布的 CT-RATE(25,692 个非增强胸部 CT study、50,188 个 3D volume、配对放射学报告、18 种异常多标签)包装成四个明确的赛题——报告生成、多异常分类、自监督定位、文本条件 CT 生成——并用 Docker 容器服务端评测的方式,让全世界参赛队伍在同一套隐藏测试集上比出高下。它是 MICCAI 2025 官方注册挑战赛(2025 年 9 月 23-27 日,韩国大田),冠军方法随后发表于 ICCV 2025 的 VLM3D Workshop。对"3D 医学影像 + 语言"这条在 2024 年之前几乎空白的技术路线来说,VLM3D 是第一座统一的、可复现的、有榜单的里程碑。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——训练/验证数据就是 HuggingFace 上的 CT-RATE(CC BY-NC-SA,gated),封闭测试集不公开,别找错门。
- 想参赛或复现赛题:直奔 §4 四大任务与 §5 赛制——四个任务的输入输出、指标、评测方式各不相同,Docker ≤50 GB 的硬约束别忽略。
- 关心榜单与排名:直奔 §7 结果与生态——参与数字和名次都有多口径(坑 4、坑 6),引用前先对表。
§0 导读:这个挑战赛解决什么问题
医学影像的"视觉语言建模"(vision-language modeling)在 2D 胸片上已经相当成熟:MIMIC-CXR 提供了数十万张配对报告的胸片,MS-CXR 在其上补充了局部对齐监督,CheXbert 类工具把报告变成结构化标签,RadVLM 一类的视觉语言模型(VLM)能在胸片上做报告生成与视觉问答。但把镜头从 2D 切到 3D——也就是真正承载解剖信息的容积 CT——局面完全不同:3D 影像的数据体量大一个数量级、标注成本高一个数量级,长期没有一个大型的"volume + 报告"公开配对数据集,更没有一个统一的评测舞台。2024 年底 CT-RATE 的发布填补了数据空白,VLM3D 2025 则填补了评测空白:它把"你有数据"推进到"大家用同一把尺子量"。
VLM3D 的回答分四层。第一层是任务设计:从 CT-RATE 的报告与标签出发,拆出四个覆盖"看懂—说出—找到—生成"全链路的赛题——CT 报告生成(volume → 自由文本)、多异常分类(volume → 18 标签)、自监督多异常定位(不用人工标注找病灶)、文本条件 3D CT 生成(报告 → 合成 volume),四题共享同一套公开训练数据,公平可比。第二层是评测纪律:所有提交以 Docker 容器形式交付(≤50 GB),在服务端隐藏测试集(内部 2,000 例 + 波士顿大学外部 1,024 例)上自动评测,参赛者自始至终见不到测试数据——这在医学影像挑战赛里是对"测试集泄露"这一顽疾的正面回应。第三层是生态杠杆:冠军方法进入 ICCV 2025 VLM3D Workshop 正式发表,CTFlow 等方法随即成为文本条件 3D CT 合成的公开基线。第四层是可持续性:2026 届用同一套赛制扩展到脑 MRI(MR-RATE,约 100,000 配对扫描-报告),把"CT 教科书"升级为"跨模态平台"。
对数据集百科的读者而言,VLM3D 的价值定位需要说清楚:它的"数据集本体"就是 CT-RATE——本库已另立 ct-rate(546) 条目专述数据本身;VLM3D 条目的独立价值在于赛制(Docker 服务端评测的模板价值)、任务定义(四大任务后来成为 3D 医学 VLM 的标准评测口径)、榜单生态(工业界队伍的参与与名次)与 2026 届的跨模态扩展。换句话说:ct-rate 条目回答"数据长什么样",本条目回答"这些数据如何被用来公平地衡量一个领域的进步"。
§0 读法三则:
- 本条目是"数据集+赛题+榜单"三合一:数据本体归 CT-RATE(另见 ct-rate 条目),本条目聚焦挑战赛本身——任务、赛制、结果、生态。两者许可与获取方式同源但引用口径不同。
- 全文统计数字均出自官方三源(vlm3dchallenge.com / MICCAI 官网 / Zenodo)与底层数据论文(arXiv:2403.17834);所有已知口径冲突(参与数字、排名名次、DOI 后缀、规模三口径)分别在坑 2、坑 3、坑 4、坑 6 存照。
- 检索时若把 arXiv:2509.15772(同名 “VLM3D” 的 text-to-3D 生成论文)当作本挑战赛的论文会张冠李戴——两者毫无关系(坑 1)。
0.4 赛前技术空白:2024 年的 3D 医学 VLM 缺什么
要理解 VLM3D 的立项逻辑,可以倒放 2024 年底 3D 医学视觉语言领域的空白清单——VLM3D 的每一个设计决策几乎都能在清单里找到对应项:
| 空白 | 2D 世界的现状(彼时) | 3D 世界的缺口 | VLM3D 的对应设计 |
|---|---|---|---|
| 大规模配对语料 | MIMIC-CXR 数十万对 | CT-RATE 刚发布(2024 底),知名度与使用范式未建立 | 直接以 CT-RATE 为唯一合法训练数据,强制生态汇聚 |
| 统一评测 | 报告生成/分类各有惯用基准 | 各论文各测各的,数字互不可比 | 四任务统一口径+统一划分 |
| 防泄露评测 | 测试集常随论文公开或半公开 | 同样如此 | 双封闭测试集+Docker 服务端 |
| 跨机构信号 | 多中心数据集渐多 | CT 数据多为单中心 | 波士顿大学外部测试集单列 |
| 生成方向基准 | 2D 合成尚属边缘 | 文本→3D 几乎无人量化评测 | 任务四+FVD/FID/CLIP/IS 指标族 |
| 方法社区 | RadVLM、LLaVA-Med 等活跃 | 3D 专用方法稀缺(CT-CLIP/CT-CHAT 刚起步) | 冠军方法进 Workshop,公开方法基线 |
这张表也解释了为什么 VLM3D 选在 CT-RATE 发布后约半年即开赛:数据刚立、方法未聚,是"以赛聚才"的最佳窗口期。事实证明窗口判断正确——首届即有跨三大洲的参赛者与公司级队伍入局(§5.3,注意口径)。
§1 数据集速览:十问十答
Q1:VLM3D 的全称与身份是什么?
全称 Challenge for Vision-Language Modeling in 3D Medical Imaging(3D 医学影像视觉语言建模挑战赛),简称 VLM3D Challenge。它是 MICCAI 2025 官方注册挑战赛(satellite event),2025 首届设 CT 赛道,2026 第二届扩展 MRI 赛道。注意它是 official challenge 但不是 MICCAI 2025 的 lighthouse challenge(灯塔挑战赛三席为 BraTS、SAGES-CVS、UNICORN,坑 8)。
Q2:比赛用的是什么数据?
训练/验证数据全部来自公开的 CT-RATE 数据集:25,692 个非增强胸部 CT study(来自 21,304 位独立患者),按多种重建展开为 50,188 个 3D volume,总计超 1,430 万张 2D slice;每个 study 配对放射科医生撰写的报告(含 impression 与 findings 两节),并由微调 RadBERT 从报告自动抽取 18 种胸部异常多标签。训练用 20,000 患者,内部验证用 1,304 患者。
Q3:四大任务分别是什么?
①CT 报告生成:输入 3D 胸部 CT,输出自由文本报告,指标以 BLEU(1-4) 为代表;②多异常分类:对 18 种胸部异常做多标签分类,指标为 AUC;③自监督多异常定位:训练阶段不使用任何人工 ground-truth 标注,定位心包积液、胸腔积液、实变、肺影、肺结节等病灶,用人工标注集评测;④文本条件 3D CT 生成:输入报告文本,输出合成 3D CT volume,指标为 FVD/FID/CLIP score/IS 一族。
Q4:谁在办这个比赛?
Forithmus(研究机构)牵头的多机构联盟:苏黎世大学、伊斯坦布尔梅迪波尔大学、波士顿大学、斯坦福大学、哈佛大学、约翰霍普金斯大学、帝国理工伦敦、上海交通大学、都柏林大学学院、NIH、ETH 苏黎世、NVIDIA。Zenodo 记录署名 32 位作者;发起人与第一作者 Ibrahim Ethem Hamamci 是 CT-RATE、CT-CLIP、CT-CHAT 三个工作的一作(苏黎世大学/伊斯坦布尔梅迪波尔)。
Q5:赛制怎么评?
参赛者训练模型后打包成 Docker 容器提交(容量上限 50 GB),由组织方在隐藏的封闭测试集上服务端评测:内部测试集 2,000 例(梅迪波尔分布内)+ 波士顿大学医院外部测试集 1,024 例。测试数据不公开;仅最终有效提交参与排名;排名采用基于主指标的 point-based permutation test 方案。
Q6:多少人参赛?
存在多口径:vlm3dchallenge.com 的 Forums 页面(2025 届收官后)显示 CT-ABNORMALITY 73 人/40 次提交、CT-REPORT 68 人/49 次、CT-VOLUME 53 人/20 次;research.forithmus.com 现页(2026 届视图)显示 120/165、115/126、80/192;媒体报道口径报告生成赛道 161 人参与综合排名。引用时必须注明届别与抓取日期(坑 4)。
Q7:结果发表在哪里?
冠军方法发表于 ICCV 2025 的 VLM3D Workshop(CVF open access 可查,如 CTFlow);官网称 top-performing methods 收录于联合挑战赛论文(joint challenge paper)。颁奖与结果发布在 2025 年 9 月 24 日前后(MICCAI 2025 大田会议周内)。
Q8:许可是什么?
CT-RATE 数据与挑战赛本体均为 CC BY-NC-SA(非商业-相同方式共享):官网规则原文 “Both CT-RATE and MR-RATE are released under CC BY-NC-SA”,MICCAI 官网 challenges 表 license 列同样登记 CC BY-NC-SA。CT-RATE 在 HuggingFace 托管(gated,下载需接受平台使用条款);官方模型代码 CT-CLIP、CT-CHAT 在 GitHub 开源。
Q9:VLM3D、CT-RATE、CT-CLIP、CT-CHAT 是什么关系?
CT-RATE 是数据集(volume + 报告 + 标签);CT-CLIP 是在其上做对比语言-图像预训练的 3D 基础模型;CT-CHAT 是视觉语言对话模型;VLM3D 是用这套数据办的挑战赛。四者同一核心团队(Hamamci 等),数据论文同为 arXiv:2403.17834 系。检索时四个名字会互相串,认准条目边界即可。
Q10:2026 届有什么变化?
第二届新增 MR-RATE 数据集(脑 MRI,约 100,000 配对扫描-报告),赛道从 3 个扩为 6 个(VLM3D-CT-ABNORMALITY/CT-REPORT/CT-VOLUME + VLM3D-MR-ABNORMALITY/MR-REPORT/MR-VOLUME),赛制沿用 Docker ≤50 GB 服务端评测,作为 MICCAI 2026 satellite event 举办;早期获奖者受邀在 MIUA 2026(都柏林大学学院)展示。2025 届榜单保留作参考。
1.11 关键数字速查一栏表
| 数字 | 含义 | 出处(详见附录 C) |
|---|---|---|
| 25,692 | CT-RATE 非增强胸部 CT study 数 | arXiv:2403.17834 |
| 50,188 | 展开后的 3D volume 数 | arXiv:2403.17834 |
| 21,304 | 独立患者数 | arXiv:2403.17834 |
| 14.3M+ | 2D slice 总量 | arXiv:2403.17834 |
| 18 | 胸部异常多标签类别数 | CT-RATE 官方 CSV |
| 1,000 | RadBERT 微调用人工标注报告数 | arXiv:2403.17834 |
| 20,000 / 1,304 | 训练/内部验证患者划分 | CT-RATE 官方划分 |
| 2,000 / 1,024 | 内部/外部封闭测试集例数(不公开) | Zenodo 记录摘要 |
| 50 GB | Docker 容器容量上限 | 官网 rules 页 |
| 4 / 3 / 6 | 任务数 / 2025 赛道数 / 2026 赛道数 | 官网任务与赛道页 |
| 32 | Zenodo 记录署名作者数 | Zenodo 元数据 |
| 10.5281/zenodo.15052707 | 赛事记录 DOI(双 DOI 见坑 2) | MICCAI 官网登记 |
| 2025-03-19 | Zenodo v1 发布日 | Zenodo 元数据 |
| 2025-09-23 至 27 | MICCAI 2025 会期(韩国大田) | MICCAI 官网 |
| 5,000+ | CTFlow 训练 GPU 小时 | CTFlow 论文(ICCV 2025W) |
| 0.2791 / 0.846 | 影禾医脉媒体口径 BLEU(1-4)/AUC | 媒体报道(坑 6) |
1.12 与 2D 胸片生态的对应关系
VLM3D 的四个任务都能在 2D 胸片生态里找到"前辈",对照着看能更快理解任务设计的来路:
| 能力方向 | 2D 前辈(库内条目) | 3D 赛场(VLM3D) | 迁移增加的难度 |
|---|---|---|---|
| 影像-文本配对语料 | MIMIC-CXR(16)(数十万胸片-报告对) | CT-RATE(546)(25,692 study-报告对) | 数据体量×数十、每例三维体积 |
| 局部对齐监督 | MS-CXR(340)(短语-区域对齐子集) | 任务三自监督定位(不用人工区域标注) | 3D 区域标注贵得多,故改为自监督 |
| 时序建模 | MS-CXR-T(619)(纵向胸片对) | (VLM3D 未单设时序任务) | 3D 纵向配对数据更稀缺 |
| 结构化/推理评测 | CheXstruct/CXReasonBench(604) | 任务二 18 标签多标签分类 | 弱标签来源同源(报告挖掘) |
| 指令跟随对话 | RadVLM-Instruct(624) | CT-CHAT(对话模型,代码开源) | 3D 编码器 + 逐层上下文 |
| 大规模标注库 | VinDr-CXR(125)(胸片标注库) | (无对应——CT 系无 VinDr 类人工标注大库) | ——这正是弱标签路线兴起的原因 |
读表要点:VLM3D 的任务形态对 2D 研究者并不陌生,陌生的只是"3D"带来的数据工程与算力维度;反过来,2D 生态的方法(线性探针、指令微调、LoRA 对齐)大多可以平移试验。
1.13 常见误解速查
| 误解 | 事实 |
|---|---|
| “VLM3D 是一个新数据集” | 不是:训练/验证数据就是 CT-RATE;VLM3D 的新资产是任务定义、赛制与榜单 |
| “VLM3D 基于 VinDr 数据扩展” | 证伪:完全基于 CT-RATE + 封闭测试集,与 VinDr 无关(坑 5) |
| “它是 MICCAI 灯塔挑战赛” | 不是:official challenge 但非 lighthouse(坑 8) |
| “测试集可以下载来本地跑榜” | 不能:两套测试集不公开,仅服务端评测 |
| “arXiv 上的 VLM3D 论文就是挑战赛论文” | 不是:arXiv:2509.15772 是同名 text-to-3D 论文(坑 1) |
| “获奖模型可以商用” | 不可以:CC BY-NC-SA 禁商业用途,获奖不改变数据许可 |
| “参与了就是 161 人那个数字” | 口径混乱:73/68/53 vs 120/115/80 vs 媒体 161/118,引用须注明来源(坑 4) |
1.14 给三类读者的一段话速览
研究者:VLM3D 给了你四个可以直接对标的任务口径(报告生成/18 标签分类/自监督定位/文本条件生成),训练数据就是 HF 上 gated 的 CT-RATE(CC BY-NC-SA),官方基线代码在 GitHub(CT-CLIP/CT-CHAT),方法天花板参考 ICCV 2025W 的 CTFlow——你的论文只要声明"CT-RATE train 训练 + validation 自评"就能与整个生态对话,但别拿自评分数冒充官方榜单成绩。
工程/产业团队:这是一个技术含金量可公开验证的赛场——报告生成与分类正是影像公司产品化的两大方向,2025 届已有影禾医脉、Deepnoid 等队伍入局(名次口径见坑 6)。注意两件事:榜单名次不等于产品合规,CC BY-NC-SA 把商用挡在许可之外;参赛交付是 Docker ≤50 GB 的服务端盲测,工程纪律权重不亚于模型本身。
数据工程师/库方:VLM3D 是"数据集→基础模型→对话模型→挑战赛→榜单→跨模态扩展"完整数据工程栈的公开样板,其 Docker 盲测赛制与双测试集(内部 2,000 + 外部 1,024)设计值得任何计划办医学评测的团队整段借鉴;引用其数据时认准 study/volume/患者三个计数单位(坑 3)。
§2 数据构成与规格:CT-RATE 本体
VLM3D 的全部"可用数据"来自 CT-RATE——理解挑战赛,先要把这份数据的规格吃透。本节按规模、报告与标签、划分与命名、人群特征、评测集五个层次展开。数据本身的更完整画像(含采集协议与伦理口径)另见本库 ct-rate(546) 条目,本节只保留参赛者与引用者必须知道的骨架。
2.1 规模三口径:study、volume、患者如何互容
CT-RATE 的规模在不同文献里有三种写法,初见容易以为是矛盾,实为三个不同计数单位:
| 口径 | 数字 | 含义 |
|---|---|---|
| study 口径 | 25,692 个非增强胸部 CT study | 一次检查一个 study(官网/Forithmus 常写 “~25,000 chest CT studies”) |
| volume 口径 | 50,188 个 3D volume | 同一 study 的多种重建(不同层厚/核算法)各自展开为一个 volume(Zenodo 摘要写 “over 50,000 3D chest CT volumes”) |
| 患者口径 | 21,304 位独立患者 | 去重后的真实人数(arXiv:2403.17834 精确数) |
三者互容:21,304 位患者做了 25,692 次检查(少数患者多次检查),每次检查按重建展开为约 2 个 volume。附加总量:全部 volume 合计超过 1,430 万张 2D slice。arXiv 论文给出的是精确数(25,692/50,188/21,304),官网与 Zenodo 给出的是约数——三口径并存时以精确数为准,引用时注明单位(坑 3)。
2.2 报告结构与 18 异常多标签
每个 study 配对一份放射科医生撰写的报告,报告分两大部分:impression(印象,结论性判读)与 findings(发现,逐系统描述),另有患者信息、扫描技术等附加节。对报告生成任务而言,impression 与 findings 都是可学习的生成目标;对标签任务而言,报告是"免费标注"的来源。
18 种胸部异常多标签的来源是文本挖掘而非人工逐例标注:团队微调 RadBERT(一个放射学文本预训练模型)做报告→标签的自动分类器,微调用了 1,000 份人工标注报告。异常类别包括:肺结节(lung nodule)、动脉壁钙化、冠状动脉钙化、心脏肥大、心包积液、胸腔积液、肺实变、肺气肿、肺纤维化后遗症、肺不张、淋巴结肿大、磨玻璃影/肺影(lung opacity)、小叶间隔增厚、支气管扩张、胸膜增厚、食管裂孔疝、马赛克衰减模式等(完整 18 类以数据集官方 CSV 为准)。这就是多异常分类任务(任务二)的标签体系,也是任务三(自监督定位)的病灶对象清单。
对使用者有三点提醒:第一,这批标签是弱标签——由文本分类器从报告自动抽取,报告漏写≠影像无异常;第二,文本分类器的错误率未逐例人工复核(1,000 份微调集之外),下游做严格诊断实验需自建金标准;第三,标签粒度是"有无"而非"位置"——位置信息要靠任务三的自监督方法或人工标注集补充。
2.3 划分与目录命名
CT-RATE 官方划分:训练集 20,000 患者 / 内部验证集 1,304 患者。目录命名规则 split_patientID_scanID_reconstructionID,例如 train_1_a_1.nii.gz 表示训练集、患者 1、第 a 次扫描、第 1 种重建。这个命名把"患者—检查—重建"三层计数单位编码进文件名,参赛者写数据加载器时可直接解析:同一位患者的所有文件共享 patientID,做患者级划分防泄漏时以此为键。
VLM3D 规则明确:训练与验证只能用 CT-RATE 公开的 train/validation 划分,四个任务一视同仁——这是榜单可比性的数据边界。
2.4 人群与采集特征
CT-RATE 采集于土耳其伊斯坦布尔梅迪波尔医院(单中心),非增强(未打造影剂)胸部 CT;扫描仪来自 3 家厂商;患者年龄 18-102 岁;性别分布均衡。单中心是它最大的分布局限:所有训练/验证数据来自同一家医院的设备与人群,跨机构、跨厂商、跨人群的泛化能力需要外部数据检验——这正是 VLM3D 设置波士顿大学外部测试集(§2.5)的原因,也是"外部测试 1,024 例"这个数字在榜单上含金量高的原因。
论文层面的外部验证(CT-CLIP 工作所述)还使用了公开的 RAD-ChestCT 与一个私有的真实世界临床集合;这两者不属于 VLM3D 赛题数据,只在方法论文的泛化实验中出现。
2.5 VLM3D 评测集:两个封闭测试集
VLM3D 的评测数据由两套封闭测试集构成,均不公开:
| 测试集 | 规模 | 来源 | 状态 |
|---|---|---|---|
| 内部封闭测试集 | 2,000 例 | 与训练数据同分布(梅迪波尔) | 不公开,仅服务端评测 |
| 外部封闭测试集 | 1,024 例 | 波士顿大学医院(跨机构) | 不公开,仅服务端评测 |
两套测试集的设计意图泾渭分明:内部集衡量"在同分布数据上做到多好",外部集衡量"换一家医院还剩多少"。参赛者在整个赛程中拿不到任何一例测试数据,只能提交 Docker 容器(§5)。对引用者而言,这意味着官方排行榜上的任何数字都无法离线复现——第三方复现只能退回 CT-RATE 内部验证划分(1,304 患者)自建评测,结果与官方榜单不可直接比较。
2.6 与库内 ct-rate 条目的边界
本库将 CT-RATE 数据本体与 VLM3D 挑战赛分立两条目:ct-rate(546) 条目负责数据集本体(采集协议、字段、下载、衍生工作谱系),本条目负责挑战赛(任务、赛制、榜单、生态)。若你的目的只是"拿到影像-文本对做训练",直接读 ct-rate 条目即可;若你要引用"某方法在标准赛题上的名次"或"Docker 服务端评测范式",本条目才是正确出处。两处互链,引用时按需取用。
2.7 数据质量与已知局限
在把 CT-RATE 当"标准答案"使用前,四条已知局限值得写进实验设计:
- 单中心偏倚:全部数据来自伊斯坦布尔梅迪波尔医院的 3 家厂商扫描仪——人群构成、临床惯例、扫描协议的机构烙印无法通过数据内部处理消除;跨机构泛化只能靠外部数据(波士顿大学测试集的存在正是为此,但对外不公开)。
- 弱标签噪声:18 异常标签由 RadBERT 微调版从报告自动抽取,报告本身的漏写/简写会传导为标签缺失;1,000 份人工标注只保证分类器微调质量,不保证全量标签正确率。严格诊断实验需自建金标准子集。
- 多重建展开的统计重叠:50,188 个 volume 由 25,692 个 study 展开——同一解剖被以不同重建参数记录多次。若按 volume 随机划分训练/验证,同一 study 的"孪生 volume"可能跨越划分边界,造成隐性泄漏;患者级(或至少 study 级)划分是底线。
- 报告语言与书写风格:报告为英文放射学书写,风格受单一机构惯例影响;文本生成任务的 BLEU 类指标对此敏感(机构风格拟合可抬高 n-gram 重合度)。
2.8 三代胸部影像-文本数据集规格对比
把 CT-RATE 放进 2D 前辈的坐标系,能看清"3D 转折"的量级:
| 维度 | MIMIC-CXR(2D,库内 16) | VinDr-CXR(2D,库内 125) | CT-RATE(3D,库内 546) |
|---|---|---|---|
| 模态 | 胸部 X 光 | 胸部 X 光 | 胸部 CT(容积) |
| 数据单位 | 单张影像-报告对 | 单张影像 + 人工标注 | study → 多 volume-报告对 |
| 规模 | 数十万级 | 数万级(人工标注) | 25,692 study / 50,188 volume |
| 标签来源 | 报告文本挖掘(CheXbert 系) | 专家人工标注 | 报告文本挖掘(RadBERT 微调) |
| 许可 | PhysioNet credential 制 | CC BY-NC-SA(口径以条目为准) | CC BY-NC-SA(HF gated) |
| 在 VLM3D 语境中的角色 | 2D 任务形态的模板来源 | 消歧对照(与 VLM3D 无关,坑 5) | 训练/验证数据本体 |
读表要点:CT-RATE 与 MIMIC-CRX 系共享"报告挖掘弱标签"路线(而非 VinDr 的人工标注路线),这正是 VLM3D 任务三要"自监督定位"的根源——弱标签有"有无"无"位置",位置信息只能靠自监督从影像-文本对应中掘取。
2.9 参赛者视角的数据走查:从下载到第一个 batch
以任务二(多异常分类)为例,把"拿到数据"到"喂进模型"的路径走一遍——这条走查同样适用于其他三个任务的前半程:
第 0 步 平台门禁
- HuggingFace 登录 → ibrahimhamamci/CT-RATE 页 → 阅读并接受使用条款
- 确认许可显示 CC BY-NC-SA;记录接受日期(合规留痕)
第 1 步 结构核对
- 目录树按 split_patientID_scanID_reconstructionID 组织
- train/ 含 20,000 患者的 volume;validation/ 含 1,304 患者
- 标签 CSV 按 patient/scan 粒度对齐 18 异常列
第 2 步 索引与防泄漏
- 用正则解析文件名建索引(附录 H 骨架)
- 以 patient_id 为去重键;确认验证患者与训练患者零交集
- 注意同一 study 的多重建 volume 同源——按 study 聚合后再划分实验
第 3 步 体素预处理
- 读 NIfTI → 统一 spacing(重采样)→ HU 窗口化(肺窗/纵隔窗)
- 裁剪到胸腔包围盒;按需降采样以控制显存
第 4 步 第一个 batch
- volume 张量形状(C, D, H, W);标签张量形状(18,)
- 抽样核对:标签阳性异常与报告文本描述一致(弱标签抽查)
走查中最后一步最容易被跳过,也最不该跳过:抽样 20-30 例,把 CSV 里的阳性标签与报告原文对照读一遍,能直观建立"弱标签噪声长什么样"的手感——这决定你后续要不要在损失函数里做标签平滑或噪声鲁棒设计。
2.10 重建维度:volume 计数为何是 study 的近两倍
命名规则里的 reconstructionID 段揭示了 CT-RATE 的一个关键机制:同一次扫描(study)会以不同重建参数(层厚、卷积核、迭代算法)产出多个 volume。这解释了 25,692→50,188 的近两倍展开,也带来三个使用注意:
- 统计单位必须声明:报"数据量"时写 study 还是 volume,结果差近一倍——坑 3 的全部混乱都源于此。审稿与引用时强制自己写明单位。
- 重建即数据增强的误解:多重建不是"免费增强"——不同重建的解剖完全相同,只有纹理/噪声特性不同;把同一 study 的多重建分入训练与验证两侧会造成乐观偏差,任何划分必须以 study(保守)或患者(标准)为最小单元。
- 模型对重建参数的敏感性是可研究的副产品:同一解剖、不同重建的预测一致性,可以当作模型鲁棒性的免费探针——这是 CT-RATE 结构赠送的独特评测维度。
§3 组织方与时间线:谁在办、何时办
3.1 组织架构:Forithmus + 十二机构联盟
VLM3D 由研究机构 Forithmus 牵头组织(官网与 Forithmus Research Hub 的 collections 页均挂 VLM3D Challenge 专页),背后是一个横跨欧美亚的多机构联盟:
| 机构 | 角色(公开口径) |
|---|---|
| Forithmus | 牵头组织方 |
| University of Zurich(苏黎世大学) | 发起人所在机构(Hamamci) |
| Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) | 数据来源医院所在机构 |
| Boston University(波士顿大学) | 外部测试集提供方 |
| Stanford University / Harvard University / Johns Hopkins University / Imperial College London / University College Dublin / Shanghai Jiao Tong University | 组织委员会成员所在机构 |
| NIH / ETH Zurich / NVIDIA | 联盟成员 |
Zenodo 挑战赛记录署名 32 位作者。组织委员会阵容在医学 AI 挑战赛里属高配:Bjoern Menze(苏黎世/哈佛系影像分析)、Kayhan Batmanghelich(匹兹堡/波士顿系,胸部 CT 长期深耕)、Pranav Rajpurkar(哈佛系医学 AI 基准)、Alan Yuille(约翰霍普金斯,医学视觉长远旗手)、Zongwei Zhou(约翰霍普金斯,自监督医学影像)、Bernhard Kainz(帝国理工)、Weidi Xie(上海交大)等——委员会覆盖了报告生成、分类、自监督、生成四个任务方向的代表性研究者,任务设计与评委结构相对应。
3.2 关键人物:Hamamci 与 CT-RATE 系谱
Ibrahim Ethem Hamamci 是理解 VLM3D 谱系的钥匙:他是 CT-RATE 数据集论文(arXiv:2403.17834)、CT-CLIP 基础模型、CT-CHAT 对话模型三个工作的一作,也是 VLM3D Zenodo 记录的第一作者。这条"数据集→基础模型→对话模型→挑战赛"的递进路径,是当代医学 AI 数据工程的典型打法:先建数据护城河,再在数据上立方法标杆,最后把评测权标准化为公共基础设施。对引用者而言,这意味着 VLM3D 的任务定义与 CT-RATE 论文的实验设计一脉相承,读 arXiv:2403.17834 可以找到四大任务最初的动机与原型实验。
3.3 时间线总表
| 时间 | 事件 |
|---|---|
| 2024-03 | 底层数据论文 CT-RATE/CT-CLIP 首版挂 arXiv(2403.17834,v1 标题为 “A foundation model utilizing chest CT volumes and radiology reports for supervised-level zero-shot detection of abnormalities”,坑 7) |
| 2024-2025 | 论文多轮修订,v3 改题为 “Developing Generalist Foundation Models from a Multimodal Dataset for 3D Computed Tomography”(坑 7) |
| 2025-03-19 | VLM3D 挑战赛记录发布于 Zenodo,Version v1,DOI 10.5281/zenodo.15052707(双 DOI 见坑 2) |
| 2025 上半年 | 官网 vlm3dchallenge.com 上线,四任务开放报名与开发 |
| 2025-09-23 至 27 | MICCAI 2025 于韩国大田(Daejeon)举行,VLM3D 为官方注册挑战赛(satellite event,非 lighthouse,坑 8) |
| 2025-09-24 前后 | 颁奖与结果发布 |
| 2025 下半年 | 冠军方法发表于 ICCV 2025 VLM3D Workshop(CVF open access) |
| 2026 | 第二届:新增 MR-RATE 脑 MRI 赛道,六赛道并行,MICCAI 2026 satellite event;早期获奖者受邀 MIUA 2026(都柏林大学学院)展示 |
3.4 双 DOI 与收录口径存照
双 DOI:MICCAI 官网 challenges 列表登记 VLM3D 的 DOI 为 10.5281/zenodo.15052707;OpenAIRE 记录同时显示 10.5281/zenodo.15052708——同一记录名下两个 DOI 后缀,均重定向至同一 Zenodo 页面。引用时任取其一皆可达,但正式文献建议以 MICCAI 官网登记的 15052707 为准(坑 2)。
MICCAI 收录口径:MICCAI 官网 challenges 表对 VLM3D 的任务类型标注为 “Classification; Detection; Localization; Modeling; Reconstruction; Segmentation”——这是 MICCAI 对全部挑战赛统一使用的分类学标签串,不是 VLM3D 四大任务本身的描述;把六个词当成 VLM3D 的任务清单会以偏概全(坑 8)。license 列登记 CC BY-NC-SA,与官网规则一致。
lighthouse 辨析:MICCAI 每届从注册挑战赛中遴选少数 “lighthouse challenge”(灯塔挑战赛)作为标杆。2025 届三席为 BraTS、SAGES-CVS、UNICORN,VLM3D 不在其列。引用"MICCAI 官方挑战赛"准确,引用"MICCAI 灯塔挑战赛"错误。
3.5 官网与发布渠道清单
| 渠道 | 地址/标识 | 内容 |
|---|---|---|
| 挑战赛官网 | vlm3dchallenge.com | 任务定义、规则、报名、榜单(Forums 页含参与统计) |
| Forithmus Research Hub | research.forithmus.com/collections/vlm3d-challenge | 挑战赛合集页(2026 届视图含参与数字现值) |
| Zenodo 记录 | DOI 10.5281/zenodo.15052707(/15052708 重定向同页) | 挑战赛描述、32 作者、发布时间 2025-03-19 |
| MICCAI 官网 | conferences.miccai.org/2025 challenges 列表 | 官方注册凭证、DOI、license、lighthouse 遴选 |
| 底层数据论文 | arXiv:2403.17834 | CT-RATE 规模精确数、方法原型 |
| 训练数据 | HuggingFace ibrahimhamamci/CT-RATE(gated) | NIfTI volume + 报告 + 标签 |
| 官方代码 | GitHub ibrahimethemhamamci/CT-CLIP、CT-CHAT | 基础模型与对话模型开源实现 |
| Workshop 论文集 | openaccess.thecvf.com/content/ICCV2025W/VLM3D/ | 冠军方法(CTFlow 等) |
3.6 方法论评述:单中心数据何以支撑大赛
一个常见的疑虑是:单中心数据办全球大赛,榜单还有意义吗?VLM3D 的答案是"分层评测"——用两套测试集把问题拆开:内部测试集(2,000 例)回答"在数据分布内,方法学上谁做得好",这是对算法能力的公平比较;外部测试集(1,024 例,波士顿大学)回答"换医院后谁还站得住",这是对泛化能力的检验。两个名次都拿才真正有说服力——这也是为什么本条目在 §7.2 处理工业获奖口径时反复强调"评测集/榜单切片"的标注。
这套设计对数据工程界的启示是:单中心不是原罪,只有单中心评测才是。只要评测层引入外部分布,训练数据的单中心局限就从"缺陷"转化为"已知边界"——参赛者知道自己该为什么优化,引用者知道榜单数字的适用范围。
3.7 与代表性医学挑战赛的结构对比
| 维度 | BraTS(神经肿瘤基准) | UNICORN(2025 lighthouse 之一) | VLM3D 2025 |
|---|---|---|---|
| 领域 | 脑肿瘤 MRI 分割 | 多任务医学影像 | 3D 医学影像视觉语言 |
| 任务形态 | 分割为绝对主轴 | 多任务组合 | 四任务(分类/生成/报告/定位) |
| 数据策略 | 多年迭代扩充+公开训练集 | 公开训练+隐藏评测 | 公开训练(CT-RATE)+双隐藏测试集 |
| 评测形态 | 在线评测平台 | 挑战赛平台 | Docker 容器服务端评测 |
| 语言模态 | 无 | 无 | 有(报告文本为一等公民) |
| MICCAI 地位 | lighthouse 常客 | 2025 lighthouse 三席之一 | official challenge(非 lighthouse,坑 8) |
读表要点:VLM3D 在 MICCAI 挑战赛光谱里的独特位置是"语言模态为一等公民 + Docker 服务端评测"的组合——分割类赛事比拼的是掩码 Dice,VLM3D 比拼的是"影像与语言之间的往返能力"。两者方法论互补而非竞争;2026 届 MR-RATE 进入脑 MRI 域后,与 BraTS 系的数据生态还可能产生新的交叉点(但任务形态依旧不同:报告对 vs 掩码)。
3.8 组织委员会与四任务的对应关系
组织委员会的人员构成与四大任务之间存在可观察的对应——这解释了 VLM3D 任务设计的"专家对口"逻辑:
| 委员会成员 | 长期领域 | 对应任务方向 |
|---|---|---|
| Ibrahim Ethem Hamamci | CT-RATE/CT-CLIP/CT-CHAT 一作 | 全局发起、数据与基线 |
| Bjoern Menze | 腹部/肿瘤影像分析与挑战赛组织 | 评测设计与影像侧 |
| Kayhan Batmanghelich | 胸部 CT、影像-文本、弱监督 | 分类与定位任务 |
| Pranav Rajpurkar | 医学 AI 基准(CheXbert 系) | 基准设计与报告生成 |
| Alan Yuille | 医学视觉长远布局(JHU 系) | 学界背书与方向把关 |
| Zongwei Zhou | 自监督医学影像(JHU 系) | 自监督定位任务 |
| Bernhard Kainz | 医学影像与挑战赛实践(帝国理工) | 赛制与评测 |
| Weidi Xie | 多模态学习(上海交大) | 视觉语言方法 |
读表说明:对应关系依据各人公开研究方向归纳,属条目作者的观察性整理而非官方声明——用于理解任务设计逻辑,勿转引为"某人负责某任务"的分工事实。
§4 四大任务详解:看懂、说出、找到、生成
VLM3D 2025 的四个任务共享同一套公开训练数据(CT-RATE train/validation 划分),却覆盖了视觉语言建模的四种基本能力方向:理解结构(分类)、产出文本(报告生成)、空间定位(自监督定位)、数据合成(文本条件生成)。以下逐任务展开输入输出、指标与设计意图。
4.1 任务一:CT 报告生成(radiology report generation)
输入/输出:输入 3D 胸部 CT volume,输出自由文本放射学报告。这是"影像→语言"的正向任务,也是临床上最直接的落地方向——一份能用的初稿报告可以显著压缩放射科医生的书写负担。
评测指标:以 BLEU(1-4) 为代表的文本生成指标族(媒体报道口径:冠军队伍平均 BLEU(1-4) 达 0.2791、较基线高约 5 个点)。BLEU 对 3D 医学报告生成这类长文本、术语密集的任务只是粗尺子——临床正确性(异常是否被正确提及/遗漏/虚构)才是金标准,但金标准需要人工,榜单只能退而求其次用 n-gram 重合度。引用榜单数字时应意识到这个天花板。
设计意图:把 CT-RATE 的 impression/findings 两节报告作为生成目标,检验模型能否从容积影像中读出跨层的、三维空间里的异常组合,并按放射学书写规范成文。这是 2D 胸片报告生成(MIMIC-CXR 系)向 3D 的直接迁移,难点在于 volume 的信息密度与上下文长度远超 2D。
4.2 任务二:多异常分类(multi-abnormality classification)
输入/输出:输入 3D 胸部 CT volume,输出 18 种胸部异常的多标签预测(每个异常独立二判)。标签体系即 §2.2 所述的 RadBERT 自动抽取弱标签。
评测指标:AUC(媒体报道口径:第三名队伍平均 AUC 0.846)。多标签设定下 AUC 按异常类别逐一计算再聚合,18 类的患病率高度不均衡(如食管裂孔疝罕见、胸腔积液常见),榜单聚合方式(宏平均/微平均)细节以官方评测脚本为准。
设计意图:任务二看似最"传统",实为整个挑战赛的锚点——18 标签体系直接继承 CT-RATE 的文本挖掘产物,它检验的是模型对报告弱标签的拟合上限。同时它也是任务四的生成条件、任务三的定位对象清单:四个任务在标签体系上互相咬合。
4.3 任务三:自监督多异常定位(self-supervised multi-abnormality localization)
输入/输出:输入 3D 胸部 CT volume,输出异常的空间定位(如异常热图/区域)。约束条件是本任务的灵魂:训练阶段不得使用任何人工 ground-truth 标注——模型只能从影像-报告对、影像本身或其他自监督信号中学会"哪里不对劲"。
评测:用一个人工标注集做最终评测(病灶对象涵盖心包积液、胸腔积液、实变、肺影(lung opacity)、肺结节等)。定位质量以人工标注为尺,训练过程与人工标注完全隔离——这是"弱监督/自监督定位"范式的一次公开大考。
设计意图:医学影像定位标注极贵(像素级/体积级勾画需要专家小时计),VLM3D 用规则设计把这条成本曲线摆上台面:既然报告里"免费"藏着定位线索("右肺下叶胸腔积液"这类文字),模型就该学会把语言证据翻译回空间证据。这个任务对 3D 医学影像的可解释性研究有直接的推动价值——冠军方法 Deepnoid M4CT 的获奖(§7.2)说明工业界对此方向已有成熟积累。
4.4 任务四:文本条件 3D CT 生成(text-conditional 3D chest CT generation)
输入/输出:输入报告文本,输出合成的 3D 胸部 CT volume。这是"语言→影像"的逆向任务,也是四个任务中计算最重、最新颖的一个:从文本描述生成一个生理上合理、解剖上连贯的容积数据。
评测指标:生成质量指标族——FVD(Fréchet Video Distance,把 volume 视为视频帧序列)、FID(Fréchet Inception Distance)、CLIP score(文本-影像对齐度)、IS(Inception Score)(CTFlow 论文口径)。
设计意图与应用:官方口径给出的应用方向是数据增强、教育与生成建模研究。合成 CT 可以低成本扩充稀有异常的训练样本、给教学提供无隐私风险的素材、给生成模型社区提供医学试验场。但合成数据的边界同样清晰:合成 volume 不等于真实解剖,不能用于诊断声明,混合训练时必须明示合成来源(frontmatter 的 rai:dataLimitations 已存照)。
4.5 四任务的公共边界与互恰性
| 任务 | 输入 | 输出 | 核心指标 | 代表口径数字 |
|---|---|---|---|---|
| ①报告生成 | 3D CT volume | 自由文本报告 | BLEU(1-4) 等 | 冠军平均 BLEU(1-4) 0.2791(媒体口径) |
| ②多异常分类 | 3D CT volume | 18 标签多标签 | AUC | 第三名平均 AUC 0.846(媒体口径) |
| ③自监督定位 | 3D CT volume | 异常空间定位 | 人工标注集评测 | 冠军 Deepnoid M4CT(媒体口径) |
| ④文本条件生成 | 报告文本 | 合成 3D volume | FVD/FID/CLIP/IS | CTFlow 为代表方法 |
四个任务共享三条公共规则:训练/验证数据只能来自 CT-RATE 公开 train/validation 划分;评测一律走 Docker 服务端隐藏测试集;模型以容器交付(≤50 GB)。这保证了跨任务、跨队伍的可比性——也意味着任何在私有数据上预训练的模型必须声明(规则细节以官网 rules 页为准)。
值得一提的是"任务数口径":韩媒报道写作"四个项目",与官方四任务一致;2026 届赛道数扩为六(CT×3 + MR×3),那是赛道口径而非任务口径——赛道是按数据域(CT/MR)与任务组合的报名单元,任务仍是四类。混用两个口径会把"六赛道"误读成"六个任务"。
4.6 四任务的 2D 对应物与迁移难点
| 任务 | 2D 对应物(库内条目) | 3D 迁移的核心难点 |
|---|---|---|
| 报告生成 | MIMIC-CXR 系报告生成(16) | 单例 token 量级上升(数百层切片 vs 单图);跨层空间推理;显存与上下文窗口压力 |
| 多异常分类 | 胸片多标签分类(CheXpert/胸片 14 标签系) | 标签从 14→18 且由 CT 报告挖掘;volume 级聚合策略(逐层投票 vs 3D 编码) |
| 自监督定位 | MS-CXR 短语-区域对齐(340) | 2D 框/掩码监督在 3D 缺位,需从报告文本与影像对应中自掘监督信号 |
| 文本条件生成 | (2D 罕见成熟先例) | 3D 解剖一致性约束;FVD 类指标把 volume 当视频处理的建模要求 |
一张表看清:四个任务里,报告生成与分类是"平移+加重",自监督定位是"范式重设计",文本条件生成接近"从零开始"。这也解释了为什么 ICCV 2025W 的代表论文出自任务四——新范式最先催生新方法。
4.7 参赛者工程要点
从 CT-RATE 的数据规格与 Docker ≤50 GB 的交付约束倒推,参赛者普遍要过四道工程关:
- 数据加载:50,188 个 NIfTI volume 的随机读取是 I/O 瓶颈——常见做法是离线预解码为统一 spacing 的数组缓存(注意存储预算)或按 patientID 分片流式读取;命名规则(§2.3)是写索引器的现成依据。
- 3D 表征:整 volume 直接进 3D 卷积网络显存吃紧;主流方案两端化——3D 编码器配滑窗推理,或"2D 逐层编码 + 跨层聚合"(把 volume 当视频)。CTFlow 的 video-inspired 思路即后者的生成版。
- 文本侧:报告生成任务的输出长度远超 2D 胸片报告,解码策略(beam/采样)与临床术语一致性检查值得单独调优;CT-CLIP 的文本编码器是现成的 3D 对齐起点。
- 容器纪律:50 GB 含权重——3D 大模型基座(如经大规模预训练的 3D ViT)动辄数十 GB,迫使参赛者做量化/蒸馏或自训小型基座;这道约束本身就在筛选"高效架构"路线。
4.8 各任务指标的读法与陷阱
榜单数字只有在指标语义清楚时才有意义。四个任务的指标各有一个最常被误读的陷阱:
| 任务 | 主指标 | 正确读法 | 常见误读 |
|---|---|---|---|
| 报告生成 | BLEU(1-4) 平均 | n-gram 重合度,对机构书写风格敏感;0.2791 是"与参考报告的词汇重合水平" | 误读为"27.9% 的诊断正确率" |
| 多异常分类 | AUC(按类计算后聚合) | 排序质量指标,与阈值无关;0.846 是 18 类某聚合方式下的均值 | 忽略类别不均衡下宏/微平均的巨大差异 |
| 自监督定位 | 人工标注集上的定位度量 | 训练零人工标注是前提,评测才用金标准 | 混入任何人工标注训练即违规 |
| 文本条件生成 | FVD/FID/CLIP/IS | 分布级指标,衡量合成 volume 与真实分布的距离与文本对齐度 | 误读为"单张合成图质量分" |
两条横向提醒:其一,四任务的指标族不可跨任务比较(BLEU 0.28 与 AUC 0.85 之间没有换算关系);其二,置换检验排名(§5.1)意味着"名次相邻"的分数差可能统计不显著——引用时写名次比写裸分数更稳,写两者时注明检验口径。
4.9 四任务的方法空间地图
从 2025 届公开方法与 CT-RATE 系论文归纳,四任务的方法空间大致如下(供复现者定位自己的起点):
| 任务 | 方法家族 | 代表组件 | 起点建议 |
|---|---|---|---|
| 报告生成 | 3D 编码器 + 文本解码器;逐层 2D 编码 + 跨层聚合 + LLM 解码 | CT-CLIP 视觉塔、开源医学 LLM | 微调 CT-CLIP 系或逐层 ViT + 医学 LLM 头 |
| 多异常分类 | 3D CNN/ViT + 多标签头;基础模型特征 + 线性探针 | CT-CLIP 零样本→微调 | 先跑 CT-CLIP 特征线性探针建立底线 |
| 自监督定位 | 影像-文本对应挖掘;注意力/梯度定位;对比区域学习 | RadBERT 文本侧、3D 注意力图 | 从报告短语-体素注意力对应起步 |
| 文本条件生成 | 隐空间流匹配/扩散;自回归逐层生成 | A-VAE、CT-CLIP 文本编码器(CTFlow) | 直接研读 CTFlow 论文复现管线 |
方法空间的公共底座是 CT-CLIP——它同时提供视觉编码器、文本编码器与影像-文本对齐先验,是四个任务都绕得开的"地基"。这也再次显示 CT-RATE 系谱的工程完整性:数据、基础模型、对话模型、挑战赛层层咬合。
4.10 案例走查:任务一的一道"题"长什么样
为让四个任务的抽象定义落地,以下用纯示意的方式走查任务一(报告生成)的一道赛题——数值与文本均为示意构造,非真实数据:
【输入】
volume: train_12345_b_1.nii.gz(某患者第二次检查、重建 1)
形状约 (1, 300+, 512, 512),HU 值体素
【模型需产出的报告要素(示意)】
findings 节:
- 双肺透过度与血管纹理走行描述
- 逐区描述:左肺下叶小结节(约 x mm,边界清)……
- 心脏大小、纵隔位置、胸腔有无积气积液
impression 节:
- 结论性一句话:如"左肺下叶小结节,建议随访;余未见明确异常"
【评分】
生成文本 vs 参考报告的 BLEU(1-4) 等指标
【示意要点】
- 同一 volume 的参考报告可能不止一份风格变体(机构书写惯例)
- 漏写阳性发现与虚构阴性发现都会拉低 n-gram 重合与临床可信度
- 3D 的价值在于"跨层确认":单层看似结节,邻层可能证实为血管截面
走查揭示的实战要点:报告生成不是"看图说话"而是"跨层侦查 + 规范化书写"——模型必须先在三维空间里确认结构性发现,再用放射学惯用语序输出;这也是 2D 报告生成冠军方法难以直接平移的原因。
§5 赛制:Docker 服务端评测与参与规模
5.1 Docker 容器规则:把评测权收归服务端
VLM3D 赛制的核心是一条工程纪律:参赛者提交 Docker 容器,组织方在隐藏测试数据上服务端运行评测。要点四则:
- 容器 ≤50 GB:模型权重、依赖、代码全须装进 50 GB 的容器里。这个上限对 3D 影像大模型并不宽裕(一个 3D ViT 的权重加推理栈很容易逼近),实质上限制了"暴力堆参数"的参赛策略,偏向高效架构。
- 隐藏测试数据:内部 2,000 例 + 波士顿大学外部 1,024 例全程不公开,参赛者无法在测试集上调参——从制度上封死测试集泄露这条路。
- 仅最终有效提交参与排名:多次提交取最终有效版本,防止"榜单试探式"刷分。
- 排名方法:采用基于主指标的 point-based permutation test scheme(点数制置换检验)——不做单一数字排序,而是用统计检验判断名次差异是否显著,这是医学影像挑战赛中相当严谨的排名设计。
这套设计的模板价值大于其自身:对任何要办医学 AI 挑战赛的团队,VLM3D 展示了"数据不公开 + 容器交付 + 统计检验排名"的完整可复制方案。
5.2 三赛道命名与结构
2025 届按任务设三个赛道(任务三自监督定位与任务一/二/四的对应关系以官网为准):
| 赛道 | 对应任务 |
|---|---|
| VLM3D-CT-ABNORMALITY | 多异常分类(+ 定位方向) |
| VLM3D-CT-REPORT | CT 报告生成 |
| VLM3D-CT-VOLUME | 文本条件 3D CT 生成(volume 合成) |
2026 届扩展为六赛道:CT 三席不变,新增 VLM3D-MR-ABNORMALITY / MR-REPORT / MR-VOLUME(数据换为 MR-RATE 脑 MRI)。
5.3 参与规模:三口径并存(引用前必读)
VLM3D 的参与数字是本条目口径冲突最密集的区域,三个来源三套数:
| 来源(页面属性) | CT-ABNORMALITY | CT-REPORT | CT-VOLUME |
|---|---|---|---|
| vlm3dchallenge.com Forums 页(2025 届收官后口径) | 73 参赛者 / 40 提交 | 68 参赛者 / 49 提交 | 53 参赛者 / 20 提交 |
| research.forithmus.com 现页(2026 届视图,2026-09 抓取) | 120 / 165 | 115 / 126 | 80 / 192 |
| 媒体报道(韩媒/港股财经,2025-09) | 分类赛道 118 人 | 报告生成赛道 161 人 | 未逐项披露 |
三口径的可能解释:Forums 页为 2025 届系统页的收官快照;Forithmus 现页为 2026 届累计视图(数字更大);媒体报道的 161/118 可能是"注册参与"口径而非"有效提交"口径。没有官方声明解释差异,故本条目不做仲裁,只存照三条规则:引用任何参与数字必须注明来源页与抓取日期;比较"届"时不得跨口径;媒体数字不与官方页面数字混排(坑 4)。
5.4 评测时点与颁奖
颁奖与结果发布在 2025-09-24 前后(MICCAI 2025 大田会议周内,9 月 23-27 日)。冠军方法随后(2025 下半年)经 ICCV 2025 VLM3D Workshop 正式发表——"MICCAI 办赛、ICCVW 出论文"的跨会议安排在挑战赛生态里并不多见,反映了组织方对方法发表可见性的刻意经营。
5.5 服务端评测的信任模型:为什么这是对的方向
医学 AI 挑战赛的历史教训里,"测试集泄露"排第一:测试数据一旦公开,或经公开的"开发集"反复试探,榜单就会退化为记忆测试。VLM3D 的服务端评测在制度上重排了信任关系:
- 数据信任:参赛者不需要相信组织方的"测试集未泄露"承诺——因为他们根本接触不到测试数据,泄露面被物理性压缩;
- 过程信任:Docker 容器让"同一份代码在同一环境重跑"成为可能,组织方可以复验提交;点数制置换检验让"0.001 的 AUC 差"不再自动等于名次差;
- 边界信任:仅最终有效提交参与排名,把"多次试探榜单"的博弈空间压到最小。
代价是透明度:参赛者看不到自己在外部测试集上的逐例表现,只能拿到总分。这是隐私(真实患者影像)与开放(可复核)之间的工程折衷——在医疗数据语境下,这个折衷正在成为行业默认。
5.6 参赛周期与里程碑建议
对计划参加后续届别(2026 CT+MR)的团队,按 2025 届节奏倒推一个参考周期:
| 阶段 | 建议动作 |
|---|---|
| 报名期 | 官网注册赛道;HF 接受 CT-RATE 条款并完成数据下载(体量大,尽早启动) |
| 开发期前期 | 用官方划分搭 baseline(分类用 CT-CLIP 特征线性探针;报告生成微调开源 VLM;生成任务直接读 CTFlow 复现) |
| 开发期中期 | 患者级防泄漏审计(附录 H 骨架);自建内部验证流程对齐官方指标口径 |
| 提交期 | Docker 打包(附录 I 清单)→ 预提交验证容器可运行 → 最终有效提交 |
| 会期 | MICCAI 会议周颁奖(2025 届为 9 月 24 日前后);获奖方法准备 Workshop 论文 |
5.7 三种评测形态的对照:VLM3D 的位置
医学影像基准评测目前有三种主流形态,各有信任假设与失效模式:
| 形态 | 代表 | 信任假设 | 典型失效模式 |
|---|---|---|---|
| 公开测试集论文基准 | 多数学术论文自建基准 | 使用者自律不测训练 | 测试集进入预训练语料,基准通胀 |
| 在线评测平台 | grand-challenge 系在线提交 | 平台持有数据、按次反馈 | 反馈次数可被用作榜单试探 |
| Docker 服务端盲测 | VLM3D(≤50 GB,仅最终提交有效) | 容器代码可复验、数据零接触 | 透明度换安全,逐例错误不可见 |
VLM3D 属第三种的完整实现,且加了第四道保险:点数制置换检验让"刷出来的 0.001"无法兑换名次。三种形态不是替代关系——论文基准胜在开放可复算,在线平台胜在易用,盲测容器胜在可信;VLM3D 证明的是"可信"在医学领域可以工程化,而不必以牺牲全部透明度为代价(官方代码与训练数据全公开,被锁住的只有测试集)。
§6 获取与许可:两把锁、一道闭门
6.1 资产清单与许可矩阵
| 资产 | 内容 | 许可 | 获取方式 |
|---|---|---|---|
| CT-RATE 训练/验证数据 | 25,692 study / 50,188 volume / 报告 / 18 标签 | CC BY-NC-SA | HuggingFace ibrahimhamamci/CT-RATE(gated,需接受平台使用条款) |
| 挑战赛本体(Zenodo 记录) | 赛题描述、规则、元数据 | CC BY-NC-SA | Zenodo DOI 10.5281/zenodo.15052707(公开) |
| 内部封闭测试集 | 2,000 例 | 不适用(不公开) | 仅组织方服务端评测用 |
| 外部封闭测试集 | 1,024 例(波士顿大学医院) | 不适用(不公开) | 仅组织方服务端评测用 |
| 官方代码 | CT-CLIP、CT-CHAT | 开源 | GitHub ibrahimethemhamamci/ 下两仓库 |
| 冠军方法论文 | CTFlow 等 | 按 ICCV 2025W 论文许可 | CVF open access |
两把锁:第一把是 CT-RATE 的 CC BY-NC-SA——非商业、相同方式共享,任何商业用途(包括把参赛模型直接产品化)都超出许可;第二把是 HuggingFace 的 gated 下载——需登录并接受数据集页面列出的使用条款后才能下载。一道闭门:两套封闭测试集彻底不公开,第三方永远无法离线复现官方榜单。
6.2 下载实操与平台注意
CT-RATE 经 HuggingFace 托管,标准路径为登录平台→访问数据集页→接受条款→获得下载权。两点实操存照:其一,本库核验时曾尝试经 hf-mirror.com 的 API 直接读取数据集元信息,返回鉴权失败——镜像通道对 gated 数据集不可用,gated 数据请走 HuggingFace 官方通道;其二,数据体量大(50,188 个 NIfTI volume、超 14.3M slice),全量下载前先用 HF 的文件列表与 README 核对划分目录结构(train/validation 与 §2.3 命名规则),按需分片下载。
对"只是想跑通管线"的使用者:官方 GitHub 仓库(CT-CLIP/CT-CHAT)通常附推理示例与模型权重入口,可以先用小样本验证环境,再决定是否全量拉取数据。
6.3 AI-Ready 评估:挑战赛形态对机器可读性的加成
从 AI-Ready 视角看,VLM3D 形态的"数据集"有三个加分项:任务定义机器可读(四任务的输入输出与指标即接口规范)、评测容器化(Docker 交付即部署规范)、榜单公开(排行榜即基准报告)。两个减分项:测试集不可见使第三方基准复现只能自建;CC BY-NC-SA 把"AI 就绪"限定在非商业语境。综合而言,它对研究者的 AI-Ready 程度高于多数学术数据集,对商业团队则需要先过许可关。
6.4 与库内可获取性光谱的对照
本库条目的可获取性光谱大致分五档:完全公开直链、平台注册、条款接受(gated)、申请制、不公开。VLM3D 的训练数据居"条款接受"档(与多数 HF gated 医学数据集同级),评测数据居"不公开"档(与多数挑战赛封闭测试集同级)。对照参考:MIMIC-CXR(16) 为credential 制(PhysioNet 认证),ct-rate(546) 同为本条目的 gated 档——检索者按自己的合规条件在光谱上对号入座即可。
6.5 许可合规自查清单
CC BY-NC-SA 的"NC"(非商业)与"SA"(相同方式共享)两条,对使用者意味着一张实际的自查清单:
| 使用场景 | 合规判断 |
|---|---|
| 学术研究、论文发表、竞赛参赛 | 允许(署名 + 相同方式共享即可) |
| 医院内部科研/教学使用 | 一般允许(非商业语境),建议法务确认院方政策 |
| 商业产品集成(含 SaaS、院内商业化系统) | 禁止——除非另行获得权利人(Forithmus/数据团队)授权 |
| 用参赛模型对外提供服务 | 谨慎:模型训练数据许可通常随权重传导,CC BY-NC-SA 边界需法务评估 |
| 衍生数据集再发布 | 必须同许可(CC BY-NC-SA)+ 署名 |
| 合成 CT(任务四产物)再分发 | 注意合成数据源自真实数据许可的传导,同按 CC BY-NC-SA 处理并明示合成来源 |
两条提醒:其一,"获奖/榜单名次"不构成许可豁免——名次只证明技术,不改变数据权利;其二,HuggingFace gated 条款是平台层面的附加约束,与 CC BY-NC-SA 叠加生效,下载时的接受行为即合同行为。
6.6 获取环节高频问答补充
问:能不能只下载数据集的一个子集?
HuggingFace 支持按文件/分片选择性下载;CT-RATE 的目录命名(split_patientID_scanID_reconstructionID)使按患者或按划分挑选成为可能。但注意挑战赛语境下训练数据边界是"公开 train/validation 全部",自选子集做研究可以,参赛需遵守完整规则。
问:验证集(1,304 患者)能当自己的测试集吗?
可以且推荐——这是第三方唯一合法的"分布内自测"数据。但要明白它与官方封闭测试集(2,000 例)不是同一批数据,分数不可与官方榜单互换。
问:Zenodo 记录里有没有数据?
Zenodo 记录(DOI 10.5281/zenodo.15052707)是赛事描述与元数据记录,不是数据分发渠道;数据本体在 HuggingFace。把 Zenodo DOI 当"数据引用 DOI"是对的,当"下载入口"是错的。
问:2026 届的 MR-RATE 现在能拿到吗?
以官方渠道(vlm3dchallenge.com / Forithmus)最新公告为准;本库抓取时点(2026-09-26)核验到的信息是约 100,000 配对脑 MRI、CC BY-NC-SA,发放细节未在核验范围内逐条确认——引用前请查当日页面。
§7 结果与生态:冠军方法、工业获奖与下游谱系
7.1 冠军方法与 ICCV 2025 Workshop
VLM3D 官网明确:top-performing methods(头部方法)发表于联合挑战赛论文(joint challenge paper),收录于 ICCV 2025 VLM3D Workshop(CVF open access 可查:openaccess.thecvf.com/content/ICCV2025W/VLM3D/)。其中最具代表性的是 CTFlow:
- 方法:video-inspired latent flow matching(视频启发的隐空间流匹配)做自回归 3D CT 合成——把 3D volume 的逐层生成类比为视频的逐帧生成,在隐空间用流匹配建模层间依赖;
- 组件:A-VAE(3D 自编码器)负责隐空间压缩,CT-CLIP 文本编码器负责把报告文本变成生成条件;
- 成本:训练消耗超过 5,000 GPU 小时——文本条件 3D CT 生成任务的算力门槛之高,从这个数字可见一斑。
CTFlow 的意义超出比赛本身:它公开了"文本→3D CT"的完整可复现管线(文本编码器、隐空间、生成器三件套),成为该方向事实上的公开基线。
7.2 工业界获奖画像与排名口径冲突
2025 届榜单吸引了多家公司级队伍,媒体报道的获奖画像如下(未逐一对照官方 leaderboard,引用需注明口径):
| 队伍 | 机构背景 | 获奖口径(媒体) |
|---|---|---|
| 影禾医脉 | 上海,一脉阳光(02522.HK)孵化 | CT 报告生成第一(161 人中综合第一,平均 BLEU(1-4) 0.2791);多异常分类第三(118 人中,平均 AUC 0.846) |
| Deepnoid M4CT | 韩国 Deepnoid | 自监督多异常定位第一;多异常分类第一;报告生成第三 |
排名口径冲突存照:报告生成任务上,影禾医脉宣称第一、Deepnoid 口径为第三——同一任务同一届出现两个"第一"叙事。两种可能:两队引用了不同评测集或不同榜单切片(如内部 vs 外部测试集、单一指标 vs 综合),或媒体转述失真。官方 leaderboard 未在本库核验中直接读取,故本条目不做仲裁,两个口径并存存照(坑 6)。这也再次验证 §5.3 的引用纪律:榜单数字不注明"来源页+抓取日期+口径"就不具备引用资格。
7.3 CT-RATE 下游谱系:从数据到模型的完整栈
VLM3D 并非孤立事件,而是 CT-RATE 系谱的第三棒:
| 层级 | 工作 | 内容 | 状态 |
|---|---|---|---|
| 数据层 | CT-RATE | 25,692 study / 50,188 volume + 报告 + 18 标签 | HF 公开(gated,CC BY-NC-SA) |
| 预训练层 | CT-CLIP | 对比语言-图像预训练的 3D 胸部 CT 基础模型;零样本多异常检测优于全监督 SOTA | 代码 GitHub 开源 |
| 对话层 | CT-CHAT | 基于 CT-CLIP 的视觉语言对话模型 | 代码 GitHub 开源 |
| 竞技层 | VLM3D 2025 | 四任务公开挑战赛 | 榜单+Workshop 论文 |
| 生成层 | CTFlow 等 | 文本条件 3D CT 合成(挑战赛产物) | ICCV 2025W 论文 |
| 另有 | CT2Rep | 3D CT 报告生成的同期工作 | 学术论文 |
这一谱系展示了当代医学 AI 数据工程的完整栈:单中心大数据集→基础模型→对话系统→标准化竞技场→生成模型。每一层都开源可查,后来者可以按层取用。
7.4 对 3D 医学 VLM 生态的三点影响
第一,评测口径的确立:四大任务(报告生成/多异常分类/自监督定位/文本条件生成)在 2025 年后成为 3D 医学视觉语言工作论文里的常见评测框架,"在 CT-RATE train 上训练、报 VLM3D 口径指标"渐成惯例。第二,服务端评测范式的示范:Docker ≤50 GB + 隐藏测试集 + 统计检验排名的组合,被后续医学挑战赛广泛参考。第三,跨会议生态的样本:MICCAI 办赛、ICCVW 出论文、次年 MIUA 展示——挑战赛作为"领域加速器"的多会议协同样本。对 2D 世界的对照系(MIMIC-CXR/MS-CXR/CheXpert 生态)而言,3D 世界用一届比赛补上了"统一基准"这块最后拼图。
7.5 媒体口径的解读守则
VLM3D 的榜单数字经媒体转述后产生了本条目最多的口径问题。给后续引用者四条守则:
- 区分"官方"与"媒体":官方 leaderboard 数字(需当日核对官网)与媒体报道数字(161 人、BLEU 0.2791 等)是两类证据;引用媒体数字必须写"媒体报道口径",不得写成"官方榜单"。
- 注明队伍自称视角:影禾医脉与 Deepnoid 各自的新闻稿都是"己方视角",双方数字可能各自准确但指向不同榜单切片——并存存照(坑 6),不做仲裁。
- 指标写全口径:BLEU(1-4) 是四个 BLEU 的平均;"平均 AUC 0.846"对应 18 类的某种聚合。只写"BLEU 0.28"或"AUC 0.85"会诱导读者以为遇到了单一公认指标。
- 届别与日期绑定:所有数字带上"2025 届/2026 届"与抓取日期,避免来年 2026 届收官后新旧数字自然混淆。
7.6 对产业界的意义
VLM3D 榜单上出现的中国(影禾医脉)与韩国(Deepnoid)公司级队伍,标注了这个赛事在产业侧的信号价值:报告生成与多异常分类恰是医学影像公司产品化的两大主流方向,一个 CC BY-NC-SA 的学术赛题成了厂商技术实力的公开试金石。对产业观察者,值得注意三点:其一,参赛与商用是两回事——榜单名次不能直接转化为产品合规(数据许可、医疗器械注册各自独立);其二,赛题指标(BLEU/AUC)与临床价值之间仍有距离,产业落地需要各自的真实世界验证;其三,榜单排名的多口径冲突(坑 6)本身提示:产业宣传口径的核验成本高,引用需回到官方页面。
7.7 冠军方法技术解剖:CTFlow 管线分解
作为任务四的代表发表方法,CTFlow 的管线值得逐段拆解——它同时是一份"文本条件 3D 医学合成"的参考架构:
输入:放射学报告文本
│
▼
[1] 文本编码:CT-CLIP 文本编码器
- 输出已与 3D 影像空间对齐的文本表征(对比预训练的红利)
│
▼
[2] 条件注入:文本表征作为生成条件
│
▼
[3] 逐层自回归生成(video-inspired)
- 把 3D volume 的层序列当视频帧序列
- 上一层的隐状态作为下一层的额外条件 → 保证层间解剖连续性
│
▼
[4] 隐空间流匹配(latent flow matching)
- 在 A-VAE 的隐空间中学习从噪声到目标分布的流
- 相比像素空间扩散:显存与采样步数大幅节省
│
▼
[5] A-VAE 解码:隐表示 → 3D CT volume
│
▼
输出:合成 3D 胸部 CT volume(FVD/FID/CLIP/IS 评测)
三个设计选择的启发:其一,“视频化"视角把 3D 生成降维成"带时间一致性的 2D 序列生成”,是显存友好的通用技巧;其二,复用 CT-CLIP 的文本编码器而非另训,让生成任务的文本理解站在分类/检索任务的肩膀上;其三,隐空间生成 + 3D 自编码器的组合正在成为医学 3D 生成的默认架构。训练成本(5,000+ GPU 小时)则提示后来者:这条管线的复现门槛在算力而不在代码。
7.8 从单届赛事到领域基建:平台化路径
把两届赛事连起来看,VLM3D 的运营轨迹是一条清晰的"平台化"路径:
2024 底 CT-RATE 发布(数据资产)
2025-03 Zenodo 记录(赛事身份资产:DOI 可引用)
2025-09 MICCAI 2025 首届(学会背书资产)+ Forums/榜单(社区资产)
2025 下半年 ICCV 2025W 论文集(学术产出资产)
2026 MR-RATE + 六赛道(跨模态扩展)+ MIUA 2026(第二学术出口)
2026+ 2025 榜单保留作参考 → 历史基准层
每一环都沉淀为可引用、可复用的资产——这正是"赛事即基建"与"赛事即活动"的分野。对想要复制此路径的团队,可迁移的次序是:先数据、再身份(DOI/学会注册)、后社区(榜单与论文出口);跳步(先办赛后补数据身份)通常导致引用混乱——本条目坑 2/坑 4 的多口径问题,部分正来自资产沉淀过程中页面口径未及时归一。
7.9 榜单之外:如何跟踪这个生态的后续
榜单是快照,生态是过程。想持续跟踪 VLM3D/CT-RATE 生态的读者,按可信度排序的观测点如下:
- 官网动态(vlm3dchallenge.com):届别公告、榜单更新、MR-RATE 发放——注意按坑 4 纪律记录抓取日期;
- ICCV 2025W 论文集(CVF open access):冠军方法的后续版本通常在 arXiv 持续演进,以 Workshop 版本为锚点追溯;
- GitHub 仓库(ibrahimethemhamamci/):CT-CLIP/CT-CHAT 的 issue 区常是数据使用问题的第一手答疑场所;
- 组织委员会成员的主页/发表流:四任务方向的后续方法多半出自委员会辐射的学术网络;
- 库内条目:ct-rate(546) 与本条目将随生态演进更新互链与存照。
一条反直觉的提醒:跟踪时优先看"方法是否开源可复现",其次才是名次——榜单头名的方法若未开源,其生态价值反而可能低于第 5 名但全栈开源的队伍。CTFlow 成为基线的原因正在于此。
§8 2026 第二届:从 CT 到 MR 的跨模态扩展
8.1 MR-RATE:约 100,000 配对脑 MRI
第二届(MICCAI 2026 satellite event)的核心增量是新数据集 MR-RATE:脑部 MRI,约 100,000 对"扫描-报告"配对,许可同为 CC BY-NC-SA(官网规则原文 “Both CT-RATE and MR-RATE are released under CC BY-NC-SA”)。这一步把 VLM3D 的方法论从胸部 CT 复制到神经影像域:脑 MRI 的报告语言习惯、异常类型(梗死、肿瘤、退行性变等)与 CT 完全不同,任务定义虽同(报告生成/分类/生成三型赛道),模型需要的能力结构全然不同。
8.2 六赛道与赛制延续
2026 届赛道:VLM3D-CT-ABNORMALITY / CT-REPORT / CT-VOLUME + VLM3D-MR-ABNORMALITY / MR-REPORT / MR-VOLUME,共六条。赛制沿用 Docker ≤50 GB 服务端评测。Forithmus 现页显示的参与数字(120/165、115/126、80/192)即 2026 届视图——这解释了它与 2025 届 Forums 页快照(73/68/53)的差异(坑 4)。2025 届 leaderboards 保留在官网作参考。
8.3 展示通道:MIUA 2026
早期获奖者受邀在 MIUA 2026(Medical Image Understanding and Analysis 会议,University College Dublin 主办,爱尔兰)展示——又一个跨会议协同点(MICCAI 2026 办赛、MIUA 2026 展示、ICCVW 系论文发表)。对参赛者而言,一届比赛最多可产出三处学术曝光。
8.4 从 CT 到 MR:同一赛制下的难度重构
把四大任务的框架原样搬到脑 MRI(MR-RATE),难度结构会重排:
| 维度 | 胸部 CT(2025) | 脑 MRI(2026) | 对参赛者的含义 |
|---|---|---|---|
| 影像物理 | X 射线衰减,灰度语义相对稳定(HU 值) | 多序列(T1/T2/FLAIR 等),参数依赖强 | 预处理与序列对齐成为新的第一道坎 |
| 异常谱 | 肺结节/积液/实变等 18 类结构病灶 | 梗死、肿瘤、白质病变、退行性改变等 | 分类任务的标签体系整体换血 |
| 报告语言 | 胸部放射学书写惯例 | 神经放射学书写惯例 | 报告生成任务的术语分布偏移 |
| 数据规模 | 25,692 study / 50,188 volume | 约 100,000 配对(MR-RATE 宣称) | 数据量级更大,I/O 与算力预算重估 |
| 3D 先例 | CT 基础模型已有 CT-CLIP 等 | 脑 MRI 视觉语言大模型尚少 | 更大的方法空白,也是更大的机会 |
换言之,2026 届不是"换个数据集再比一次",而是把同一套评测纪律投进一个方法储备更薄弱的领域——对研究者而言,MR 赛道的首发红利可能高于已充分竞争的 CT 赛道。
8.5 MR-RATE 画像:已知与未知
截至本库抓取时点(2026-09-26),MR-RATE 的公开画像可以分成"已确认"与"待公告"两栏——引用时注意区分:
| 状态 | 内容 |
|---|---|
| 已确认(官网规则原文级) | 脑 MRI;约 100,000 配对扫描-报告;CC BY-NC-SA(与 CT-RATE 同句声明);三条新赛道命名 |
| 待公告(核验未覆盖) | 数据来源机构与采集协议;标签体系(是否延续报告挖掘弱标签路线);HuggingFace 托管与 gated 细节;测试集规模与构成;发布时间表 |
保守的引用写法是"官网口径约 100,000 配对脑 MRI(CC BY-NC-SA),细节以官方渠道为准"。特别注意:2025 届规则原文 “Both CT-RATE and MR-RATE are released under CC BY-NC-SA” 已经把两代数据的许可一次讲清——这是少数可以直接跨届引用的承诺。
§9 与库内条目的关系
9.1 家族图谱与互链清单
【2D 胸片对照系】
MIMIC-CXR(16) ──┬── MS-CXR(340)(局部对齐监督)
├── MS-CXR-T(619)(时序扩展)
└── CheXstruct/CXReasonBench(604)(结构化与推理)
│
│ "2D → 3D" 的范式迁移
▼
CT-RATE(546)【上游数据本体】
│
├── CT-CLIP(3D 基础模型,代码开源)
├── CT-CHAT(3D 对话模型,代码开源)
└── VLM3D 2025【本条目:挑战赛/榜单/赛制】
│
├── 2026 届 → MR-RATE(脑 MRI,六赛道)
└── 榜单 → CTFlow / 影禾医脉 / Deepnoid M4CT
VinDr-CXR(125)【消歧对照:与 VLM3D 无数据关系,见坑 5】
RadVLM-Instruct(624)【2D VLM 指令集:与 VLM3D 任务互补】
互链点清单(7 个):ct-rate(546)(上游数据本体,第一互链)、mimic-cxr(16)、ms-cxr(340)、ms-cxr-t(619)(2D 胸片视觉语言对照系)、chexstruct-cxreasonbench(604)(报告结构化与推理评测)、radvlm-instruction-dataset(624)(2D 医学 VLM 指令数据)、vindr-cxr(125)(胸部 X 光大库;检索者常把它与 CT 系数据混淆,见坑 5)。
9.2 检索路径建议
- 做 3D 胸部 CT 视觉语言研究:ct-rate(546)(数据)→ 本条目(任务与榜单)→ radvlm-instruction-dataset(624)(指令格式参考)。
- 对比 2D 与 3D 的报告生成差异:mimic-cxr(16)/ms-cxr(340)(2D 基线)→ 本条目 §4.1(3D 任务定义)。
- 研究评测方法论:本条目 §5(Docker 服务端评测)→ chexstruct-cxreasonbench(604)(2D 推理评测对照)。
- 溯源数据归属:任何"VLM3D 用了 VinDr 数据吗"的疑问,直接看坑 5 的证伪结论。
9.3 2D→3D 迁移的技术栈对照表
把 2D 胸片生态的成熟组件与 VLM3D 语境的 3D 对应物并排,检索者可以按图索骥:
| 技术栈层 | 2D(胸片生态) | 3D(VLM3D 生态) |
|---|---|---|
| 配对语料 | MIMIC-CXR(16) | CT-RATE(546) |
| 局部对齐 | MS-CXR(340) 短语-区域 | 任务三自监督定位(无人工区域标注) |
| 结构化标签 | CheXpert/CheXbert 标签器 | RadBERT 微调抽取 18 标签 |
| 结构化/推理评测 | CheXstruct/CXReasonBench(604) | 任务一/任务二榜单口径 |
| 指令数据 | RadVLM-Instruct(624) | (3D 指令集尚无公开对应物) |
| 基础模型 | 2D ViT 系(DINOv2/BiomedCLIP 类) | CT-CLIP(对比预训练) |
| 对话模型 | RadVLM 类 | CT-CHAT |
| 报告生成 | 2D 报告生成模型族 | 任务一赛道(CT-REPORT) |
| 生成模型 | 少量 2D 合成尝试 | CTFlow(任务四产物) |
表中最刺眼的空位是"3D 指令数据"——2D 世界的 RadVLM-Instruct(624) 已把指令微调跑通,3D 世界尚无同级公开资产;这既是空白,也是 CT-RATE 生态最自然的下一步。
9.4 检索者常见误区
- 把"VLM3D"当论文关键词全局检索:会命中同名 text-to-3D 论文(坑 1)。医学语境加限定词(MICCAI、CT-RATE、challenge)或直接用 DOI。
- 把 ct-rate(546) 与 vlm3d 条目混引:数据规格引前者,任务/榜单/赛制引后者;两处互链但分工明确。
- 以为 VinDr-CXR(125) 是本赛道的上游:不是(坑 5);VinDr 是 2D 胸片人工标注大库,与本赛事无数据继承。
- 拿官方榜单与自建验证分数直接比较:测试集不同,分数不可比;自建评测请在论文里明确声明与官方榜单的关系。
- 把 2026 届 Forithmus 页数字当 2025 届参与数:届别口径错位(坑 4)。
9.5 若你是评审人:核对引用 VLM3D 的论文
审稿中遇到引用 VLM3D/CT-RATE 的稿件,可按下列清单快速核对常见问题:
| 核对点 | 常见问题 | 建议处理 |
|---|---|---|
| 数据划分声明 | 未说明按患者级/study 级划分,存在 volume 泄漏 | 要求补充划分粒度与去重证据 |
| 数据边界声明 | 训练混入官方验证集或外部数据 | 核对是否只用公开 train/validation |
| 指标注明 | 只写"AUC 0.85"不写聚合方式 | 要求写明宏/微平均与类别覆盖 |
| 榜单比较 | 自建验证分数与官方榜单数字直接对比 | 不可比;要求改为同数据自评或注明不可比性 |
| 许可声明 | 商业应用未提 CC BY-NC-SA | 要求披露许可与用途边界 |
| 引用身份 | 引了同名 text-to-3D 论文或灯塔表述 | 按坑 1/坑 8 更正 |
| 媒体数字 | 引"161 人/0.2791"未注明媒体报道口径 | 按坑 6 模板补口径 |
| 弱标签语义 | 把 18 标签当人工金标准讨论诊断性能 | 要求说明 RadBERT 抽取来源与噪声风险 |
§10 避坑清单:八个已踩过的坑
坑 1:同名 “VLM3D” 论文消歧。arXiv:2509.15772 “VLM3D: Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation”(Qwen2.5-VL + SDS,评测于 GPTeval3D)与本医学影像挑战赛毫无关系——同名、同期、都做 3D,检索极易混淆。认准医学挑战赛的三源标识:vlm3dchallenge.com、Zenodo DOI 10.5281/zenodo.15052707、MICCAI 2025 challenges 列表。
坑 2:Zenodo 双 DOI。MICCAI 官网登记 10.5281/zenodo.15052707,OpenAIRE 同时显示 10.5281/zenodo.15052708——同一记录名下两个 DOI 后缀,均重定向至同一 Zenodo 页面。正式引用建议取 MICCAI 官网口径的 15052707,避免同一文献出现两个版本号。
坑 3:规模三口径。官网/Forithmus 写 “~25,000 chest CT studies”(study 口径),Zenodo 摘要写 “over 50,000 3D chest CT volumes”(volume 口径),arXiv:2403.17834 给精确数 25,692 studies / 50,188 volumes / 21,304 patients。三者互容(study 经多重建展开为 volume),但引用时单位写错会把数据"虚增一倍"。以精确数为准,注明计数单位。
坑 4:参与数字三口径。Forums 页(2025 届收官快照)73/68/53 人,Forithmus 现页(2026 届视图)120/115/80 人,媒体报道 161/118 人——同一件事三套数。可能解释:届别不同(2025 vs 2026 累计)、口径不同(注册 vs 有效提交)。引用必须注明来源页与抓取日期,禁止跨口径比较。
坑 5:与 VinDr 无关(方向提示证伪)。主会任务简报的先验方向提示"基础数据印象为 CT-RATE/VinDr 系扩展"——官方三源核验结论:VLM3D 完全基于 CT-RATE(训练/验证)+ 封闭测试集(波士顿大学医院),与 VinDr 系数据集无关。VinDr-CXR(125) 是胸部 X 光(2D)数据集家族,与 CT-RATE 的 3D CT 无数据继承关系。此证伪结论已存照,检索者勿被"同是胸部影像"的表面相似带偏。
坑 6:报告生成名次两源冲突。影禾医脉(媒体口径)称 CT 报告生成第一(161 人中,平均 BLEU(1-4) 0.2791);Deepnoid(媒体口径)称己方报告生成第三、定位第一、分类第一。同一任务两个"第一"叙事并存——官方 leaderboard 未直接核验,可能涉及不同评测集/榜单切片。引用任何名次时写明"媒体报道口径",勿写"官方榜单"。
坑 7:arXiv 标题版本漂移。底层数据论文 arXiv:2403.17834 的 v1 标题为 “A foundation model utilizing chest CT volumes and radiology reports for supervised-level zero-shot detection of abnormalities”,v3 改题为 “Developing Generalist Foundation Models from a Multimodal Dataset for 3D Computed Tomography”。同一 arXiv 号两套标题,引用时注明版本号,按 v3 最新题名为准。
坑 8:MICCAI 任务类型串与 lighthouse 辨析。MICCAI 官网 challenges 表对 VLM3D 的标注 “Classification; Detection; Localization; Modeling; Reconstruction; Segmentation” 是 MICCAI 统一分类学标签串,不是 VLM3D 四大任务的描述;把六个词当任务清单会以偏概全。同时 VLM3D 是 MICCAI 2025 official challenge 但非 lighthouse challenge(灯塔三席:BraTS、SAGES-CVS、UNICORN)——"官方挑战赛"与"灯塔挑战赛"是两回事,引用时勿升级表述。
坑点速查总表
| 坑号 | 一句话 | 最高风险场景 | 规避动作 |
|---|---|---|---|
| 坑 1 | 同名论文消歧(arXiv:2509.15772) | 文献检索、综述写作 | 认官网+DOI 三源标识 |
| 坑 2 | Zenodo 双 DOI(15052707/15052708) | 参考文献著录 | 取 MICCAI 官网口径 15052707 |
| 坑 3 | 规模三口径(study/volume/患者) | 数据规模转引 | 用精确数并写明单位 |
| 坑 4 | 参与数字三口径 | 新闻稿、影响力引用 | 注明来源页+抓取日期+届别 |
| 坑 5 | 与 VinDr 无关(方向证伪) | 数据谱系描述 | 引官方三源核验结论 |
| 坑 6 | 报告生成名次两说(影禾/Deepnoid) | 榜单名次引用 | 写"媒体报道口径"并存存照 |
| 坑 7 | arXiv 标题版本漂移(v1/v3) | 论文著录 | 注版本号,按 v3 题名 |
| 坑 8 | MICCAI 任务串误读 + 非 lighthouse | 赛事身份表述 | 区分统一分类串与四大任务;勿升级为灯塔 |
§11 总结
11.1 三句话总结
- VLM3D 2025 是 MICCAI 2025 官方注册挑战赛,把 CT-RATE(25,692 study / 50,188 volume / 21,304 患者 / 18 异常弱标签 / 配对报告)变成四大任务(报告生成、多异常分类、自监督定位、文本条件 3D CT 生成)的公开竞技场。
- 赛制核心是 Docker 容器(≤50 GB)服务端评测两套隐藏测试集(内部 2,000 例 + 波士顿大学外部 1,024 例),从制度上封死测试集泄露;排名用 point-based permutation test。
- 冠军方法发表于 ICCV 2025 Workshop(代表:CTFlow),2026 届以 MR-RATE(约 100,000 脑 MRI 配对)扩展为六赛道;数据与赛题本体许可均为 CC BY-NC-SA,训练数据 gated 公开、测试集不公开。
11.2 适合谁
| 人群 | 用法 |
|---|---|
| 3D 医学视觉语言模型研究者 | 用四任务定义对齐自己的评测框架,对标榜单方法(CTFlow 等) |
| 胸部 CT 分析团队 | 直接复用 CT-RATE train/validation 划分与 18 标签体系 |
| 挑战赛组织者 | 借鉴 Docker ≤50 GB + 隐藏测试集 + 统计检验排名的完整范式 |
| 报告生成/合成数据工程团队 | 参考 CTFlow 的"文本→3D CT"管线与 A-VAE/流匹配组件 |
| 医学 AI 生态观察者 | 用参与数字与工业获奖画像分析领域热度(注意坑 4/坑 6 口径) |
11.3 不适合谁
| 场景 | 原因 |
|---|---|
| 需要商业部署 | CC BY-NC-SA 禁止商业用途;参赛模型直接产品化超出许可 |
| 需要离线复现官方榜单 | 两套封闭测试集不公开,第三方只能自建评测且数字不可比 |
| 需要像素级/体积级人工金标准 | 18 标签是 RadBERT 自动抽取弱标签,任务三的人工标注集不公开 |
| 2D 胸片任务 | 这是 3D CT/MR 赛事;2D 对照系请走 mimic-cxr(16)/ms-cxr(340)/vindr-cxr(125) |
| 脑 MRI 数据需求(2026 前) | MR-RATE 属 2026 届资产,获取状态以官方渠道最新公告为准 |
11.4 30 秒决策卡
你要做什么?
├── 训练/评测 3D 胸部 CT 视觉语言模型
│ └── HF 接受条款 → 下载 CT-RATE → 按四任务对齐指标 → 引用 Zenodo DOI
├── 引用 VLM3D 挑战赛本身
│ └── DOI 10.5281/zenodo.15052707(坑 2 双 DOI 取 MICCAI 口径)
│ + 注明任务名与届别(2025 CT / 2026 CT+MR)
├── 引用榜单数字或名次
│ └── 先查坑 4(参与三口径)与坑 6(名次冲突),注明来源页+抓取日期+口径
├── 找 arXiv "VLM3D" 论文
│ └── 先过坑 1 消歧(2509.15772 与本挑战赛无关)
└── 想办一个类似挑战赛
└── 抄 §5.1 作业:容器上限+隐藏测试集+最终有效提交+置换检验排名
FAQ(高频问答 34 问)
A. 基础认知
Q1:VLM3D 是数据集还是比赛?
两者都是,但本体是比赛。它没有自己的新数据——训练/验证数据就是 CT-RATE;它的独立资产是任务定义、赛制、榜单与 Workshop 论文。库内 ct-rate(546) 条目讲数据,本条目讲比赛。
Q2:为什么叫 VLM3D?
Vision-Language Modeling in 3D Medical Imaging 的缩写,直译"3D 医学影像视觉语言建模"。加上届别后常见写法 VLM3D 2025 / VLM3D Challenge。
Q3:它和 MICCAI 是什么关系?
MICCAI 2025 官方注册挑战赛(satellite event),在 2025 年 9 月 23-27 日韩国大田的 MICCAI 会议周内举办颁奖。注意不是 lighthouse challenge(坑 8)。
Q4:第一届是什么时候办的?
2025 届(赛事记录 2025-03-19 发布于 Zenodo,活动随 MICCAI 2025)。第二届 2026 年随 MICCAI 2026 举办。
Q5:VLM3D 和 CT-RATE 论文是同一篇吗?
不是。挑战赛记录在 Zenodo(DOI 10.5281/zenodo.15052707);底层数据论文是 arXiv:2403.17834(CT-RATE/CT-CLIP)。两者团队重叠(Hamamci 等 32 人署名挑战赛记录)但文档身份独立。
B. 数据与获取
Q6:训练数据从哪下载?
HuggingFace ibrahimhamamci/CT-RATE,gated 数据集:登录→接受使用条款→下载。许可 CC BY-NC-SA。注意 hf-mirror 等镜像通道对 gated 数据集通常不可用(本库核验时 API 返回鉴权失败)。
Q7:测试集能下载吗?
不能。内部测试 2,000 例 + 波士顿大学外部测试 1,024 例均不公开,仅组织方服务端评测用。这是设计而非疏漏——防泄露是赛制核心。
Q8:数据是什么格式?
3D volume 为 NIfTI(.nii.gz),配文本报告与多标签 CSV。目录命名 split_patientID_scanID_reconstructionID(如 train_1_a_1.nii.gz)。
Q9:训练集和验证集怎么分?
CT-RATE 官方划分:训练 20,000 患者、内部验证 1,304 患者。VLM3D 规则要求四任务全部只用这个公开划分。
Q10:能商用吗?
不能。CT-RATE 与挑战赛本体均 CC BY-NC-SA(非商业-相同方式共享)。商业用途需另行获得权利人许可,挑战赛获奖不改变数据许可。
Q11:官方代码在哪?
GitHub ibrahimethemhamamci/ 下的 CT-CLIP 与 CT-CHAT 两个仓库(基础模型与对话模型开源实现)。挑战赛参赛代码是否逐队公开以各队论文与仓库为准。
C. 任务与赛制
Q12:四个任务里哪个最难?
维度不同难说"最",但任务四(文本条件 3D CT 生成)计算最重——冠军方法 CTFlow 训练超过 5,000 GPU 小时;任务三(自监督定位)约束最苛刻——训练禁用人工标注。
Q13:Docker 容器 50 GB 上限包含什么?
权重、依赖、代码都算。这个上限实质限制了参数规模与冗余打包,鼓励高效架构。具体打包规范以官网 rules 页为准。
Q14:排名怎么算的?
point-based permutation test scheme:以主指标为基础做点数制置换检验,判断名次差异的统计显著性——比"单一数字排序"更稳健。
Q15:提交几次?
多次提交机制下仅最终有效提交参与排名(防榜单试探式刷分)。提交次数上限等细则以官网为准。
Q16:外部测试集(波士顿大学)和内部测试集的区别?
分布不同:内部 2,000 例与训练数据同分布(梅迪波尔医院),外部 1,024 例来自波士顿大学医院(跨机构)。前者量"同分布上限",后者量"泛化保留率"。
D. 结果与榜单
Q17:冠军是谁?
任务与赛道不同冠军不同:文本条件生成方向代表方法为 CTFlow(ICCV 2025W 发表);自监督定位与分类方向媒体口径冠军为 Deepnoid M4CT;报告生成方向媒体口径第一为影禾医脉(但与 Deepnoid 的"第三"叙事冲突,见坑 6)。官方 leaderboard 建议直接查 vlm3dchallenge.com。
Q18:影禾医脉和 Deepnoid 到底谁第一?
报告生成任务上两方媒体口径冲突(影禾称第一、Deepnoid 称己方第三)。官方榜单未在本库核验中直接读取,本条目不做仲裁、两说并存。引用时写"媒体报道口径"。
Q19:BLEU 0.2791 是什么水平?
媒体报道口径:影禾医脉在报告生成赛道的平均 BLEU(1-4),较基线高约 5 个点。BLEU 对医学长文本是粗指标,0.28 量级在报告生成任务里属正常竞争区间,不代表"28% 正确"。
Q20:参加人数到底多少?
三口径:Forums 页 73/68/53 人(2025 届三赛道)、Forithmus 现页 120/115/80 人(2026 届视图)、媒体 161/118 人(报告/分类赛道)。无官方仲裁说明,引用注明来源页与抓取日期(坑 4)。
E. 生态与延伸
Q21:2026 届有什么新东西?
MR-RATE 脑 MRI 数据集(约 100,000 配对扫描-报告,CC BY-NC-SA)+ 三条新赛道(MR-ABNORMALITY/MR-REPORT/MR-VOLUME),共六赛道;赛制沿用 Docker 服务端评测;早期获奖者受邀 MIUA 2026 展示。
Q22:CTFlow 是什么?
ICCV 2025 VLM3D Workshop 发表的文本条件 3D CT 合成方法:video-inspired latent flow matching + A-VAE + CT-CLIP 文本编码器,自回归逐层生成 3D volume,训练超 5,000 GPU 小时。该方向的事实公开基线。
Q23:CT-CLIP 的零样本检测为什么常被引用?
CT-RATE 论文的标志性结果:CT-CLIP 的零样本多异常检测优于全监督 SOTA——说明"volume+报告"的对比预训练能迁移出结构化诊断能力。这也是 VLM3D 四大任务数据假设的合法性来源。
Q24:和 RadVLM 一类的 2D 医学 VLM 什么关系?
互补而非竞争:RadVLM 系(及 radvlm-instruction-dataset(624))做 2D 胸片的指令跟随与对话;VLM3D 生态做 3D 容积。任务形态相似(报告生成/分类/VQA),数据载体与模型架构(2D ViT vs 3D/逐层处理)不同。
Q25:检索 “VLM3D” 出来的 text-to-3D 论文是怎么回事?
那是 arXiv:2509.15772(Qwen2.5-VL + SDS 奖励做 text-to-3D 生成),与本挑战赛无关,纯同名(坑 1)。医学语境认 vlm3dchallenge.com 与 Zenodo DOI。
Q26:想引用本条目,抓取时点是什么?
本库核验与写作的抓取时点为 2026-09-26;官网页面(尤其参与数字)为动态内容,再引用时建议按坑 4 的纪律重新核对当日快照。
Q27:我没有 GPU 集群,还能用这套数据做什么?
三条轻量路径:CT-CLIP 特征 + 线性探针做分类基线(单卡可行);用官方验证划分(1,304 患者)子集做报告生成的 LoRA 微调实验;读 CTFlow 论文做方法学综述或评测设计研究。生成任务的全量复现才是算力大户。
Q28:任务三"自监督"到底禁止什么?
禁止在训练阶段使用任何人工 ground-truth 定位标注(框/掩码/体积)。允许使用:影像本身(重建、对比学习)、影像-报告配对(文本侧监督)、公开预训练权重。评测阶段才用人工标注集——"训练不用、评测才用"是这条规则的全部。
Q29:如果我只想做教育/演示用途?
CC BY-NC-SA 的非商业条款覆盖教育场景;合成 CT(任务四产物)用于教学时明示"合成数据"即可规避患者隐私问题——这正是官方列出的应用方向之一(§4.4)。
Q30:2026 届报名从哪里进?
vlm3dchallenge.com 与 Forithmus 合集页是入口;MR 赛道需关注 MR-RATE 的发放公告(§8.5)。CT 赛道老选手可直接沿用已有管线,重点预算在新序列预处理上(§8.4)。
Q31:本条目与 ct-rate 条目的数字为什么一致?
因为同一份数据:ct-rate(546) 条目与 VLM3D 条目的规模数字同源(arXiv:2403.17834 精确数)。若发现两处数字不一致,以精确数为准并视为条目缺陷反馈库方。
Q32:18 个异常类别里为什么有"食管裂孔疝"这种看似非胸部的条目?
食管裂孔疝在胸部 CT 上可观察(胃贲门部经膈食管裂孔疝入胸腔),且是报告里常被提及的偶发发现——报告挖掘路线天然会把"报告里写什么"变成标签,而非只挑"典型胸部病"。
Q33:外部测试集 1,024 例的"外部"指什么?
指与训练数据不同机构的波士顿大学医院——跨厂商、跨人群、跨临床惯例。它在榜单上衡量的是泛化保留率,是整个赛制里最能区分"背题"与"泛化"的部分。
Q34:可以把 VLM3D 的任务搬到自己的数据上吗?
可以且被鼓励——四大任务的定义与指标族是公开的方法论,不随数据许可绑定;只是搬用后不能再说"VLM3D 口径",应写"参照 VLM3D 任务设计"。
Q35:我想确认一篇文章引用的到底是挑战赛还是同名论文,最快的方法?
三个指纹任查其一:官网域名(vlm3dchallenge.com)、DOI 前缀(10.5281/zenodo.15052707 系)、任务词(报告生成/多异常分类/自监督定位/文本条件 CT 生成)。text-to-3D 同名论文(坑 1)的指纹是 Qwen2.5-VL、SDS、GPTeval3D 三个词。
Q36:两届赛事混在一个文献综述里,怎么防串?
按届分栏引用:2025 届引 Zenodo DOI + MICCAI 2025 + ICCV 2025W;2026 届引官网 2026 页 + MIUA 2026。任何参与数字、榜单数字必须带届别标签;"四任务"属于两届共有,"六赛道"只属于 2026 届。
事实清单(硬事实 34 条)
- VLM3D 全称 Challenge for Vision-Language Modeling in 3D Medical Imaging。
- MICCAI 2025 官方注册挑战赛(satellite event),非 lighthouse(灯塔三席:BraTS、SAGES-CVS、UNICORN)。
- Zenodo 记录 DOI 10.5281/zenodo.15052707(MICCAI 口径)与 10.5281/zenodo.15052708(OpenAIRE 并存口径),重定向同页。
- Zenodo 发布 2025-03-19,Version v1,署名 32 位作者。
- 第一作者 Ibrahim Ethem Hamamci(CT-RATE/CT-CLIP/CT-CHAT 一作)。
- 牵头组织方 Forithmus;联盟含苏黎世大学、伊斯坦布尔梅迪波尔大学、波士顿大学、斯坦福、哈佛、约翰霍普金斯、帝国理工、上海交大、都柏林大学学院、NIH、ETH 苏黎世、NVIDIA。
- 组织委员会含 Bjoern Menze、Kayhan Batmanghelich、Pranav Rajpurkar、Alan Yuille、Zongwei Zhou、Bernhard Kainz、Weidi Xie 等。
- 底层数据 CT-RATE:25,692 非增强胸部 CT study / 21,304 患者 / 50,188 volume / 超 14.3M slice。
- CT-RATE 单中心(伊斯坦布尔梅迪波尔医院)、3 家厂商扫描仪、18-102 岁、性别均衡。
- 18 种胸部异常多标签由微调 RadBERT 从报告自动抽取,微调用 1,000 份人工标注报告。
- 报告含 impression 与 findings 两节(放射科医生撰写)。
- 划分:训练 20,000 患者 / 内部验证 1,304 患者;命名 split_patientID_scanID_reconstructionID。
- 四大任务:CT 报告生成、多异常分类(18 标签)、自监督多异常定位、文本条件 3D CT 生成。
- 任务三训练阶段禁用人工 ground-truth 标注,用人工标注集评测。
- 任务四指标族 FVD/FID/CLIP score/IS(CTFlow 论文口径)。
- 评测:Docker 容器 ≤50 GB,服务端评测隐藏测试集。
- 测试集:内部 2,000 例 + 波士顿大学医院外部 1,024 例,均不公开。
- 仅最终有效提交参与排名;排名用 point-based permutation test。
- 2025 三赛道:VLM3D-CT-ABNORMALITY / CT-REPORT / CT-VOLUME。
- 参与数字三口径:Forums 页 73/68/53、Forithmus 现页 120/115/80、媒体 161/118。
- 颁奖于 2025-09-24 前后(MICCAI 2025 大田会议周,9 月 23-27 日)。
- 冠军方法发表于 ICCV 2025 VLM3D Workshop(CVF open access)。
- CTFlow:video-inspired latent flow matching + A-VAE + CT-CLIP 文本编码器,训练超 5,000 GPU 小时。
- 媒体口径获奖:影禾医脉报告生成第一(BLEU(1-4) 0.2791)分类第三(AUC 0.846);Deepnoid M4CT 定位第一、分类第一、报告生成第三;两源报告生成名次冲突存照。
- 许可:CT-RATE 与挑战赛本体均 CC BY-NC-SA;CT-RATE 经 HuggingFace gated 托管。
- CT-CLIP、CT-CHAT 代码 GitHub 开源;CT-CLIP 零样本多异常检测优于全监督 SOTA。
- 2026 第二届:MR-RATE 脑 MRI 约 100,000 配对扫描-报告,六赛道,MICCAI 2026 satellite event。
- 早期获奖者受邀 MIUA 2026(University College Dublin,爱尔兰)展示。
- 同名消歧:arXiv:2509.15772(text-to-3D 生成)与本挑战赛无关。
- 证伪存照:VLM3D 完全基于 CT-RATE + 封闭测试集,与 VinDr 系无关。
- HuggingFace gated 条款与 CC BY-NC-SA 叠加生效;hf-mirror 等镜像通道对 gated 数据集不可用(核验实测)。
- 2025 届规则原文同句覆盖 CT-RATE 与 MR-RATE 两代数据的 CC BY-NC-SA 声明。
- 第三方合法自测数据只有官方验证划分(1,304 患者),自评分数与官方榜单不可比。
- VLM3D 生态无公开的 3D 医学指令数据集(2D 世界对应物为 radvlm-instruction-dataset(624))。
术语表(36 条)
| 术语 | 释义 |
|---|---|
| VLM3D | Challenge for Vision-Language Modeling in 3D Medical Imaging,3D 医学影像视觉语言建模挑战赛 |
| MICCAI | 医学影像计算与计算机辅助介入国际会议;VLM3D 的母会议 |
| satellite event | 卫星活动:挂靠主会议举办的挑战赛/workshop |
| lighthouse challenge | MICCAI 从注册挑战赛遴选的"灯塔"标杆;VLM3D 2025 不在其列 |
| CT-RATE | 25,692 study 的非增强胸部 CT + 报告 + 18 异常弱标签数据集(VLM3D 训练数据) |
| study | 影像学一次检查单位;一个 study 可因多重建展开为多个 volume |
| volume | 3D 容积数据单元;CT-RATE 共 50,188 个 |
| NIfTI | 神经影像常用 3D/4D 数据格式(.nii.gz),CT-RATE 的存储格式 |
| reconstruction | 同一扫描的不同重建(层厚/核算法),volume 计数大于 study 计数的来源 |
| impression / findings | 放射报告的"印象/发现"两节,报告生成任务的输出目标 |
| RadBERT | 面向放射学的 BERT 文本模型;18 异常标签由其微调版自动抽取 |
| 弱标签 | 从报告文本自动挖掘而非人工逐例标注的标签 |
| 多标签分类 | 每例可同时命中多个类别(18 异常互不互斥) |
| 自监督定位 | 训练不用人工位置标注、仅靠影像-文本等信号学会定位病灶的范式 |
| BLEU | n-gram 重合度文本指标,报告生成任务主指标之一 |
| AUC | ROC 曲线下面积,多异常分类任务主指标 |
| FVD / FID | 生成质量指标(Fréchet 距离族),FVD 把 volume 当视频帧序列处理 |
| CLIP score | 文本-影像对齐度指标,文本条件生成任务用 |
| flow matching | 流匹配生成范式;CTFlow 用 video-inspired latent 变体做 3D CT 合成 |
| Docker | 容器技术;VLM3D 参赛交付形态(≤50 GB) |
| 服务端评测 | 组织方在隐藏数据上运行参赛容器的评测模式 |
| permutation test | 置换检验;VLM3D 排名用其点数制方案判断名次差异显著性 |
| MR-RATE | 2026 届新增脑 MRI 配对数据集(约 100,000 对,CC BY-NC-SA) |
| CC BY-NC-SA | 知识共享"署名-非商业-相同方式共享"许可;CT-RATE 与挑战赛本体均此许可 |
| gated dataset | 需登录并接受使用条款方可下载的 HuggingFace 数据集形态 |
| impression | 放射报告的结论节,报告生成任务的重要输出目标 |
| joint challenge paper | 挑战赛官方联合论文,收录头部参赛方法(官网口径) |
| zero-shot detection | 零样本检测:不针对目标异常微调直接推理;CT-CLIP 的标志性结果 |
| point-based permutation test | 点数制置换检验:以统计显著性而非裸分差定名次的排名方案 |
| A-VAE | 3D 自编码器,CTFlow 管线的隐空间压缩组件 |
| linear probe | 线性探针:冻结特征+线性头的轻量评测法,分类任务的入门基线 |
| patient-level split | 患者级划分:以患者为最小单元切分数据,防泄漏的标准做法 |
| coverage bias | 覆盖偏倚:报告未提及≠影像无异常,弱标签路线的固有风险 |
| server-side evaluation | 服务端评测:组织方持有数据并运行参赛容器的盲测模式 |
| CT2Rep | CT-RATE 系谱中的 3D CT 报告生成同期工作(§7.3 谱系表) |
| RAD-ChestCT | 公开胸部 CT 数据集,CT-CLIP 论文外部验证所用(非 VLM3D 赛题数据) |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | VLM3D 2025 |
| url_name | vlm3d |
| 类型 | 官方挑战赛 + 评测基准(数据本体为 CT-RATE,另立条目) |
| 赛事记录 | Zenodo DOI 10.5281/zenodo.15052707(2025-03-19,v1,32 作者) |
| 母会议 | MICCAI 2025(2025-09-23 至 27,韩国大田) |
| 训练数据 | CT-RATE(HF ibrahimhamamci/CT-RATE,gated,CC BY-NC-SA) |
| 测试数据 | 内部 2,000 例 + 外部 1,024 例(不公开) |
| 许可 | CC BY-NC-SA(数据与赛题本体) |
| 抓取时点 | 2026-09-26 |
| 库内互链 | ct-rate(546)/mimic-cxr(16)/ms-cxr(340)/ms-cxr-t(619)/chexstruct-cxreasonbench(604)/radvlm-instruction-dataset(624)/vindr-cxr(125) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | 官网 + MICCAI 官网列表 + Zenodo DOI + ICCV 2025W 四路可索引;但同名论文(坑 1)与多口径数字(坑 3/4)增加检索噪声 |
| A 可获取性 | 5 | 训练数据 gated 可得(接受条款即可),但测试集彻底不公开;榜单数字不可离线复现——两道失分 |
| I 可互操作 | 7 | NIfTI 标准格式 + HF 托管 + Docker 交付规范;命名规则(split_patientID_scanID_reconstructionID)机器可解析;缺官方 DICOM 转换件 |
| M 元数据质量 | 7 | 任务定义/指标/规则官网齐备;但参与数字三口径(坑 4)、双 DOI(坑 2)、规模三口径(坑 3)需引用者自查——元数据"多而不仲裁" |
| S 可持续性 | 7 | 两届连续办赛(2025 CT → 2026 CT+MR)+ Forithmus 机构化运营 + 多会议发表通道;依赖单一官网域名是轻微单点风险 |
| 综合评级 | 6.8/10(中上) | 赛制与任务定义的工程化程度高于均值;可获取性被"测试集不公开"与 CC BY-NC-SA 拖低 |
附录 C:逐项证据链自证
| 关键数字/事实 | 来源 | 位置/时点 |
|---|---|---|
| 25,692 study / 50,188 volume / 21,304 患者 / 14.3M slice | arXiv:2403.17834 | CT-RATE 论文摘要与正文 |
| 训练 20,000 / 验证 1,304 患者 | CT-RATE 官方划分 | 论文与 HF 数据卡 |
| 测试集 2,000 内部 + 1,024 波士顿大学外部 | Zenodo 记录摘要 | DOI 10.5281/zenodo.15052707 |
| 发布 2025-03-19 / v1 / 32 作者 | Zenodo 记录元数据 | 同上 |
| MICCAI 2025 官方注册 + DOI + license CC BY-NC-SA | conferences.miccai.org/2025 challenges 列表 | MICCAI 官网 |
| 非 lighthouse | miccai.org SIG challenges 表 + lighthouse 三席名单 | MICCAI 官网 |
| CC BY-NC-SA 原文 | vlm3dchallenge.com rules 页(“Both CT-RATE and MR-RATE are released under CC BY-NC-SA”) | 官网抓取 2026-09-26 |
| Docker ≤50 GB / 服务端评测 / permutation test 排名 | vlm3dchallenge.com 规则页 | 官网抓取 2026-09-26 |
| 参与数字 73/68/53 与 120/115/80 | vlm3dchallenge.com Forums 页 / research.forithmus.com collections 页 | 两页分别抓取 2026-09-26 |
| 四任务定义 | vlm3dchallenge.com 任务页 + Zenodo 记录 | 官网抓取 2026-09-26 |
| ICCV 2025W VLM3D 论文集 | openaccess.thecvf.com/content/ICCV2025W/VLM3D/ | CVF open access |
| CTFlow 组件与 5,000+ GPU 小时 | CTFlow 论文(ICCV 2025W) | CVF open access |
| 影禾医脉 BLEU 0.2791 / AUC 0.846 | 韩媒/港股财经报道(媒体口径) | 新闻抓取 2026-09-26 |
| Deepnoid M4CT 三赛道获奖口径 | 韩媒报道(媒体口径) | 新闻抓取 2026-09-26 |
| MR-RATE 约 100,000 配对 / 六赛道 / MIUA 2026 | vlm3dchallenge.com 2026 届页面 | 官网抓取 2026-09-26 |
附录 D:数据获取决策树
需求是什么?
├── 只想训练 3D 胸部 CT 视觉语言模型
│ └── HuggingFace 接受条款 → ibrahimhamamci/CT-RATE(CC BY-NC-SA)
├── 想复现挑战赛任务
│ ├── 训练:CT-RATE train/validation(唯一合法数据边界)
│ ├── 评测:官方测试集不可得 → 自建(1,304 患者验证划分)
│ │ └── 注意:自建数字与官方榜单不可直接比较
│ └── 提交形态:参考 Docker ≤50 GB 打包规范
├── 只想引用榜单名次
│ └── 先读坑 4/坑 6 → 注明来源页 + 抓取日期 + 口径
├── 想做文本条件 3D CT 生成
│ └── CTFlow(ICCV 2025W)为公开基线 → 组件:A-VAE + CT-CLIP 文本编码器
└── 想做脑 MRI 对应任务
└── 等 2026 届 MR-RATE 发布渠道(CC BY-NC-SA)→ 关注官网公告
附录 E:四大任务 × 指标 × 获奖口径对照表
| 任务 | 赛道 | 输入→输出 | 指标 | 媒体口径代表成绩 |
|---|---|---|---|---|
| 报告生成 | VLM3D-CT-REPORT | volume → 自由文本报告 | BLEU(1-4) 族 | 影禾医脉:平均 BLEU(1-4) 0.2791(161 人综合第一);Deepnoid 称第三(口径冲突,坑 6) |
| 多异常分类 | VLM3D-CT-ABNORMALITY | volume → 18 标签 | AUC | 影禾医脉第三(118 人中,AUC 0.846);Deepnoid M4CT 第一(口径并存) |
| 自监督定位 | (并入 ABNORMALITY 方向) | volume → 异常空间定位 | 人工标注集评测 | Deepnoid M4CT 第一(媒体口径) |
| 文本条件生成 | VLM3D-CT-VOLUME | 报告文本 → 合成 volume | FVD/FID/CLIP/IS | CTFlow 为代表发表方法(ICCV 2025W) |
附录 F:参与数字三口径总表(引用模板)
| 口径 | 页面属性 | CT-ABNORMALITY | CT-REPORT | CT-VOLUME | 引用写法模板 |
|---|---|---|---|---|---|
| 口径 A | vlm3dchallenge.com Forums 页(2025 届收官快照) | 73 人/40 提交 | 68 人/49 提交 | 53 人/20 提交 | “2025 届 Forums 页快照(抓取于 YYYY-MM-DD)” |
| 口径 B | research.forithmus.com collections 页(2026 届视图) | 120/165 | 115/126 | 80/192 | “Forithmus 现页 2026 届视图(抓取于 YYYY-MM-DD)” |
| 口径 C | 媒体报道(韩媒/港股财经) | 分类 118 人 | 报告 161 人 | 未披露 | “媒体报道口径(YYYY-MM 报道)” |
三口径并存、无官方仲裁。任何跨口径比较均属误用。
附录 G:2025 届 vs 2026 届对照表
| 维度 | 2025 届 | 2026 届 |
|---|---|---|
| 母会议 | MICCAI 2025(大田) | MICCAI 2026 |
| 数据域 | CT(胸部) | CT + MR(脑) |
| 数据集 | CT-RATE | CT-RATE + MR-RATE(约 100,000 配对) |
| 赛道数 | 3 | 6 |
| 赛制 | Docker ≤50 GB 服务端评测 | 沿用 |
| 许可 | CC BY-NC-SA | CC BY-NC-SA(官网规则同句覆盖 MR-RATE) |
| 展示通道 | ICCV 2025 VLM3D Workshop | MIUA 2026(都柏林大学学院)+ 论文通道 |
| 2025 榜单 | 当届有效 | 保留作参考 |
附录 H:CT-RATE 数据加载骨架(代码)
import re
from pathlib import Path
PATTERN = re.compile(
r"^(?P<split>train|validation)_(?P<patient>\d+)_(?P<scan>[a-z])_(?P<recon>\d+)\.nii\.gz$"
)
def index_ct_rate(root: str):
"""按 命名规则解析 CT-RATE 目录,返回患者级索引。
关键:以 patient_id 为去重键,防止患者级泄漏。"""
index = {}
for f in Path(root).rglob("*.nii.gz"):
m = PATTERN.match(f.name)
if not m:
continue # 命名不符的文件先记录再人工排查
rec = m.groupdict()
index.setdefault(rec["patient"], []).append({
"split": rec["split"], # train / validation
"scan": rec["scan"], # 同患者第几次检查
"recon": rec["recon"], # 同检查的第几种重建
"path": str(f),
})
return index
def patient_level_split(index, train_ids, val_ids):
"""患者级划分校验:任一患者不得同时出现在 train 与 validation。"""
assert not (set(train_ids) & set(val_ids)), "患者级泄漏!"
return ({p: index[p] for p in train_ids},
{p: index[p] for p in val_ids})
附录 I:Docker 参赛交付自查清单(复现模板)
提交前自查(对应 §5.1 规则):
□ 容器总大小 ≤ 50 GB(权重+依赖+代码)
□ 入口脚本可无网络运行(服务端环境不保证联网)
□ 输入:3D CT volume(NIfTI);输出:任务规定格式(报告文本/标签 CSV/热图/合成 volume)
□ 随机种子固定(评测需可复现)
□ 仅使用 CT-RATE train/validation 训练(数据边界声明)
□ 最终有效提交的版本号确认(仅最终提交参与排名)
□ 主指标与评测脚本版本对齐官网 rules 页当日快照
附录 J:18 异常标签体系使用注意表
| 注意点 | 说明 |
|---|---|
| 来源 | 微调 RadBERT 从报告自动抽取(弱标签),非人工逐例标注 |
| 微调金标准 | 仅 1,000 份报告经人工标注用于分类器微调 |
| 代表类别 | 肺结节、动脉壁钙化、冠状动脉钙化、心脏肥大、心包积液、胸腔积液、肺实变、肺气肿、肺纤维化后遗症、肺不张、淋巴结肿大、磨玻璃影(lung opacity)、小叶间隔增厚、支气管扩张、胸膜增厚、食管裂孔疝、马赛克衰减模式等(完整清单以官方 CSV 为准) |
| 标签语义 | “报告提及”≠“影像确认”:报告漏写≠无异常 |
| 粒度 | 有无(二值),无位置信息;定位需求走任务三范式 |
| 患病率 | 类别高度不均衡,多标签聚合方式(宏/微平均)影响分数解读 |
附录 K:与库内条目互链声明
本条目(vlm3d)与以下库内条目建立互链:ct-rate(546) 为上游数据本体条目(数据规格、下载、谱系的完整画像在本条目只保留参赛者必需骨架);mimic-cxr(16)、ms-cxr(340)、ms-cxr-t(619) 构成 2D 胸片视觉语言对照系(VLM3D 是其 3D 迁移);chexstruct-cxreasonbench(604) 为报告结构化与推理评测对照;radvlm-instruction-dataset(624) 为 2D 医学 VLM 指令数据(与四任务互补);vindr-cxr(125) 为消歧对照条目(与 VLM3D 无数据关系,见坑 5)。引用边界:引用"数据集规格"请引 ct-rate 条目,引用"任务/榜单/赛制"请引本条目。
附录 L:证据链与核验方法说明
本条目的全部关键事实按"三轮精确搜索 + 三源互证"纪律核验,存照如下:
- 第一轮(官网系):vlm3dchallenge.com(任务、规则、Forums 参与快照)+ research.forithmus.com/collections/vlm3d-challenge(机构合集、2026 届视图)——确立四任务、Docker 规则、CC BY-NC-SA 原文、参与数字口径 A/B。
- 第二轮(学会系):conferences.miccai.org/2025 challenges 列表 + miccai.org SIG challenges 表——确立官方注册身份、登记 DOI(15052707)、license 列、统一任务类型串(坑 8)、非 lighthouse(三席名单比对)。
- 第三轮(记录与论文系):Zenodo 记录(发布日 2025-03-19、v1、32 作者、测试集 2,000/1,024、volume 口径)+ arXiv:2403.17834(精确规模 25,692/50,188/21,304/14.3M、RadBERT 1,000 份微调标注)+ ICCV 2025W 论文集(CTFlow 组件与算力)。
三源互证结论:任务、赛制、许可、时间线、数据规格五类事实均至少两源一致;无法仲裁的四类口径(坑 2/3/4/6)全部就地存照而非取舍。核验过程中的两条失败路径同样存照:hf-mirror API 对 gated 数据集返回鉴权失败(改用搜索核对 HF 页面内容并记录镜像不可用事实);arXiv 全文 API 对 “VLM3D” 检索返回空(改用网页搜索命中同名论文并转化为坑 1 消歧存照)。
附录 M:常见误解澄清表
| 误解 | 澄清 | 出处 |
|---|---|---|
| VLM3D 发布了新影像数据 | 训练/验证数据即 CT-RATE;新的是任务与榜单 | 官网规则+Zenodo |
| VLM3D 数据来自 VinDr 系 | 与 VinDr 无关;测试集来自波士顿大学医院 | 三源核验(坑 5) |
| 测试集 2,000+1,024 例可下载 | 均不公开,仅服务端评测 | Zenodo 记录摘要 |
| MR-RATE 是 2025 届数据 | 2026 届新增;2025 届纯 CT | 官网 2026 届页 |
| 参赛模型获奖后可商用 | CC BY-NC-SA 禁商业用途 | 官网 rules 原文 |
| 官方榜单数字可本地复现 | 不可;第三方只能用 1,304 患者验证划分自建 | 赛制设计(§5.5) |
| MICCAI 六词任务串就是赛题 | 那是学会统一分类学标注 | MICCAI challenges 表(坑 8) |
| “VLM3D 2026 六赛道=六个新任务” | 任务仍四类;赛道是数据域×任务组合 | 官网赛道页(§4.5) |
| CT-CLIP/CT-CHAT 是挑战赛冠军模型 | 它们是组织方的官方基线系;冠军另有其队(CTFlow 等) | ICCV 2025W 论文集 |
| 14.3M 张 slice=14.3M 个样本 | slice 是 volume 的组成层;样本单位是 study/volume | §2.1 口径表 |
附录 N:引用模板库
为减少引用时踩坑,给出五类高频引用的写法模板(坑点已在模板内规避):
赛事引用:
VLM3D Challenge: Challenge for Vision-Language Modeling in 3D Medical Imaging. Zenodo. DOI 10.5281/zenodo.15052707(2025-03-19 发布,v1;官方注册于 MICCAI 2025,韩国大田)。〔避免:写 15052708 后缀与 15052707 混用——坑 2〕
数据引用:
Hamamci, I.E., et al. A foundation model utilizing chest CT volumes and radiology reports…(arXiv:2403.17834,注意按所引版本著录题名——坑 7);数据本体:CT-RATE, HuggingFace ibrahimhamamci/CT-RATE, CC BY-NC-SA。
规模转引:
“CT-RATE 包含 25,692 个非增强胸部 CT study(21,304 位患者),按多种重建展开为 50,188 个 3D volume。”〔避免:把 volume 数说成 study 数或反之——坑 3〕
榜单转引:
“据媒体报道口径(抓取于 2026-09-26),影禾医脉在 2025 届 CT 报告生成赛道获综合第一(161 人参与,平均 BLEU(1-4) 0.2791);Deepnoid 新闻稿则称该队获此赛道第三——两口径并存,官方 leaderboard 为准。”〔避免:去掉"媒体报道口径"四字——坑 6;去掉人数来源——坑 4〕
身份表述:
“VLM3D 2025 为 MICCAI 2025 官方注册挑战赛(satellite event,非 lighthouse),设报告生成、多异常分类、自监督多异常定位、文本条件 3D CT 生成四任务。”〔避免:把 MICCAI 六词任务类型串当任务清单、升级为灯塔挑战赛——坑 8〕
附录 O:关键文档身份对照表
VLM3D 生态的文档身份容易缠绕,一张表理清"谁是论文、谁是记录、谁是数据":
| 文档 | 身份 | 角色 | 常见误用 |
|---|---|---|---|
| Zenodo 记录(DOI 10.5281/zenodo.15052707) | 赛事记录(非论文) | 挑战赛的可引用身份凭证 | 被当数据下载入口(§6.6) |
| arXiv:2403.17834 | 底层数据论文(CT-RATE/CT-CLIP) | 数据规格与方法原型的学术出处 | 被当挑战赛论文引用 |
| ICCV 2025W VLM3D 论文集 | 冠军方法论文集合 | 方法细节与可复现组件 | 被当赛制规则的出处 |
| vlm3dchallenge.com | 官网 | 任务/规则/榜单的权威动态源 | 快照数字被当永久事实(坑 4) |
| research.forithmus.com 合集页 | 机构运营页 | 2026 届视图与合集导航 | 与官网 2025 届快照混淆(坑 4) |
| MICCAI challenges 列表 | 学会注册凭证 | 官方身份、DOI、license 登记 | 六词分类串被当任务清单(坑 8) |
| HF ibrahimhamamci/CT-RATE | 数据托管页 | 唯一训练数据入口(gated) | 被镜像站替代尝试(会失败,§6.2) |
| GitHub CT-CLIP / CT-CHAT | 官方代码库 | 基础模型与对话模型实现 | 被当冠军方案(冠军是 CTFlow 等) |
附录 P:两届赛事引用速查卡
| 引用对象 | 2025 届写法 | 2026 届写法 |
|---|---|---|
| 赛事身份 | MICCAI 2025 official challenge(非 lighthouse) | MICCAI 2026 satellite event |
| 赛事记录 | Zenodo DOI 10.5281/zenodo.15052707(v1,2025-03-19) | 以官网 2026 届公告为准 |
| 数据 | CT-RATE(HF gated,CC BY-NC-SA) | CT-RATE + MR-RATE(约 100,000 配对脑 MRI) |
| 赛道 | CT-ABNORMALITY / CT-REPORT / CT-VOLUME | 上述三条 + MR-ABNORMALITY / MR-REPORT / MR-VOLUME |
| 方法出口 | ICCV 2025 VLM3D Workshop(CTFlow 等) | MIUA 2026 展示 + 论文通道 |
| 参与数字 | Forums 页快照 73/68/53(注明抓取日期) | Forithmus 现页 120/115/80(2026 届视图,注明抓取日期) |
| 测试集 | 内部 2,000 + 波士顿大学外部 1,024(不公开) | 待官方公告 |
| 历史榜单 | 2025 届榜单保留作参考 | 当届有效 |
尾注
- 官方渠道:vlm3dchallenge.com(任务/规则/榜单);research.forithmus.com/collections/vlm3d-challenge(机构合集页);Zenodo DOI 10.5281/zenodo.15052707(赛事记录);conferences.miccai.org/2025(MICCAI challenges 列表)。
- 数据与代码:HuggingFace ibrahimhamamci/CT-RATE(gated,CC BY-NC-SA);GitHub ibrahimethemhamamci/CT-CLIP 与 CT-CHAT(开源)。
- 论文:arXiv:2403.17834(CT-RATE/CT-CLIP,v1/v3 标题漂移见坑 7);ICCV 2025 VLM3D Workshop 论文集(CVF open access,含 CTFlow)。
- 本条目抓取时点 2026-09-26;官网动态内容(参与数字、榜单)引用前请按坑 4 纪律重新核对当日快照。
- 口径冲突不做仲裁的四处在案:双 DOI(坑 2)、规模三口径(坑 3)、参与三口径(坑 4)、报告生成名次两说(坑 6)——存照即结论。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- osic-pulmonary-fibrosis — 共享标签:医学影像 / CT / 多模态 / 挑战赛数据集 / 评测基准
- ms-cxr-t — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 评测基准
- reg2026 — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 挑战赛数据集
- biomedica — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 评测基准
- quilt-1m — 共享标签:医学影像 / 多模态 / 影像-文本对齐
- medpix — 共享标签:医学影像 / CT / 多模态
- openi — 共享标签:医学影像 / 影像-文本对齐 / 评测基准
- roco — 共享标签:医学影像 / 多模态 / 影像-文本对齐
- derm1m — 共享标签:多模态 / 影像-文本对齐 / 评测基准
- toothfairy2 — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

