信息速览
INFOBOX — 3DReasonKnee 一屏速览
维度 内容 本质 首个医学影像 3D 定位推理(grounded reasoning)数据集——不只给标签,还给"医生如何一步步看片"的推理链 团队 Harvard Medical School 生物医学信息学系(rajpurkarlab)+ Seoul National University Hospital;共同一作 Sraavya Sambara / Sung Eun Kim 论文 arXiv:2510.20967(2025-10-23 提交,v1),DOI 10.48550/arXiv.2510.20967,论文与数据集均 CC BY 4.0 数据 7,970 例 3D 膝关节 DESS MRI(160 slices/scan)→ 494k 五元组 {I, Q, B, C, D} 上游 OAI(Osteoarthritis Initiative)baseline 至 48 个月随访;4,796 受试者队列(45-79 岁,58% 女性) 任务空间 62 个诊断问题模板 × 22 个解剖区域,覆盖 MOAKS 全部主要组件(BML 15 / 软骨 14 / 骨赘 16 / 半月板 6 亚区等) 五元组 3D volume + 诊断问题 + 3D bounding box + 专家思维链 + MOAKS 结构化分级(如 size/depth 0-3) 标注成本 450+ 小时专家时间:2 位 board-certified 放射科医生 + 1 位骨科医生手工分割(4.5h/scan × 100 例)+ 1 位骨科医生(7+ 年膝外科)撰写 62 问题与全部 CoT 流水线 100 例手工分割 → 训练 nnU-Net → 自动生成全部 7,970 例 3D 边界框 + 专家裁决 MOAKS 分级 评测 ReasonKnee-Bench:7 大类诊断准确率 + 3D IoU 定位,双指标 关键结果 zero-shot 全数失守(Qwen2.5VL-3B 0.158 / o1 0.477);SFT 后 3B w/o CoT 最佳 0.613;加 CoT 反而略降;grounding 是主要失败点 获取 HuggingFace rajpurkarlab/3DReasonKnee(公开直链,gated=false)+ GitHub 代码;CC BY 4.0 允许商用坑位 masks.zip 是分卷需 cat 合并;HF size_categories 标签双口径矛盾;上游 OAI 原始 DICOM 另需 NDA 账号
条目速读路径:赶时间的研究者按任务取读——想快速判断"这数据能不能用"读 §1 + §7;写 related work 引用读 §4 + 附录 L;复现评测读 §5 + §6 + 附录 G/M;设计训练方案读 §3 + §6 + §9 + 附录 N;排查异常读 §10 坑清单;查术语读术语表;核对任何数字读附录 C 证据链。
§0 导读:这个数据集解决什么问题
一个真实的膝关节 MRI 诊断场景是这样的:骨科医生打开一份 3D 影像,先在数百张切片中找到可疑区域——比如股骨内侧髁负重区的软骨——然后放大观察损伤范围,再按照一套半定量评分标准(MOAKS,MRI Osteoarthritis Knee Score)逐步推理:软骨缺损占表面积多少?是否全层缺失?最后落成一个结构化分级。整个过程中,"定位"与"分级推理"是交织进行的:不知道病变在哪,就谈不上评估严重度。
现有医学 AI 数据集几乎都只覆盖这条链路上孤立的某一环。分割数据集(如 TotalSegmentator)给逐层掩码但不给诊断推理;2D 医学 VQA 数据集(VQA-Rad、SLAKE、PathVQA)给问答对但图像是平面的、答案通常一句话;3D 定位数据集给 bounding box 但没有"为什么"。当研究者想让视觉语言模型(Vision-Language Model,VLM)学会"在 3D 影像中定位病灶并像医生一样逐步推理"时,找不到任何训练资源——这是论文 Table 1 对照 20 余个同类数据集后给出的空白判断,也是 3DReasonKnee 立项的直接动因。
3DReasonKnee 的回应方式是把整条诊断链路封装成五元组:每个样本包含 (1) 一份 3D 膝关节 MRI volume、(2) 一个指向特定解剖区域的诊断问题、(3) 一个圈定相关结构的 3D bounding box、(4) 一段临床医生撰写的逐步思维链(Chain-of-Thought,CoT)、(5) 一组结构化 MOAKS 严重度分级。494,000 条这样的五元组,覆盖 7,970 份 DESS 序列、62 种问题模板、22 个解剖区域。用论文自己的话说,它同时是"骨科医生诊断专长的知识库"(每条 CoT 都是专家决策过程的显式记录)和"多模态医学 AI 走向 3D、临床对齐、可定位决策的试验场"。
这个数据集的三个鲜明特征值得在动手使用前认清:
其一,它把"推理"当作一等公民而非附属品。 五元组中的 CoT 不是事后生成的解释——论文明确记录了撰写流程:一位有 7 年以上膝外科经验的 board-certified orthopedic surgeon,先描述每类病变在 DESS 序列上的关键影像学特征与鉴别要点,再按 MOAKS 标准把观察翻译成分级条件与依据,逐步落成文字。这意味着 CoT 与最终分级之间是"推导关系"而非"并列关系"——这是它与"图像+答案"式数据集的本质区别。
其二,它的规模与保真度是分层设计的。 专家逐层手工分割只发生在 100 例高保真子集上(每例约 4.5 小时、合计 450+ 小时);这 100 例用来训练 nnU-Net 分割模型,再由模型自动生成全部 7,970 例的 3D 边界框。这是一个"专家标注种子 → 模型放大"的经典杠杆结构——好处是规模,代价是 7,970 例的边界框精度受 nnU-Net 性能约束(论文以各亚区 Dice 分数呈现,见 §3)。使用者需要清楚自己拿到的是哪一层保真度。
其三,它附带的 ReasonKnee-Bench 揭示了当前 VLM 的双重失守。 zero-shot 下,Qwen2.5-VL-3B 的 MOAKS 分级 overall 准确率仅 0.158,连 o1 也只有 0.477;监督微调(SFT)后最好成绩 0.613,仍远低于临床可用线。更微妙的发现是:把 CoT 加进 SFT 反而让成绩略降(0.588 vs 0.613),而定位准确率(IoU)与诊断准确率在受监督模型中呈正相关——grounding(定位)是主要失败点,提供 ground-truth 区域后成绩显著回升。这些负结果与正结果同样有价值:它们划定了"标准 SFT 吃不下专家推理链"这一边界,暗示需要 RL 等其他训练范式。
对谁有用:做 3D 医学 VLM 的研究者(这是目前唯一的大规模 3D grounded reasoning 训练源);做骨科/肌骨影像 AI 的工程团队(DESS 序列 + MOAKS 分级 + 分割掩码可单独取用);做评测基准的团队(ReasonKnee-Bench 的双指标协议可直接复用);以及研究"CoT 数据如何正确用于微调"的训练方法学者(w/ CoT vs w/o CoT 的对照结果本身就是一份实验设计模板)。
本条目按千方病案医数集 AI-Ready Wikipedia 规范成稿:§1 十问速览,§2-§5 数据构成、构建流水线、同类对比与基准设计,§6 评估结果详表,§7 获取与许可(CC BY 4.0 双确认),§8 生态互链,§9 方法学启示,§10 避坑清单(九坑),§11 总结;其后附 FAQ 40 问、硬事实 40 条、术语表 35 条与附录 A-K。所有硬数字均经 arXiv 全文、HuggingFace 数据集卡(经 hf-mirror 镜像核验)、GitHub 仓库三源互证,抓取时点 2026-09-30。
§1 数据集速览:十问十答
Q1:3DReasonKnee 是什么?
一个 3D 医学影像定位推理数据集:494k 条五元组,每条 = 3D 膝关节 DESS MRI volume + 指向特定解剖区域的诊断问题 + 3D bounding box + 临床医生撰写的思维链 + 结构化 MOAKS 分级。论文自称也是文献中首个 3D grounded reasoning 医学影像数据集。
Q2:谁做的?
Harvard Medical School 生物医学信息学系(Pranav Rajpurkar 组,rajpurkarlab)与 Seoul National University Hospital 合作;Sraavya Sambara 与 Sung Eun Kim 为共同一作。标注团队另含 2 位 board-certified radiologists 与 1 位 orthopedic surgeon(分割)+ 1 位 7 年以上经验的膝外科 orthopedic surgeon(问题与 CoT)。
Q3:数据从哪来?
OAI(Osteoarthritis Initiative,骨关节炎倡议)——美国 NIAMS 资助的多中心纵向队列,4,796 名 45-79 岁受试者(58% 女性)、45,000+ 份 MRI。3DReasonKnee 取其 baseline 至 48 个月随访中的 7,970 份 DESS(Double Echo Steady State)序列,每份固定 160 层。
Q4:规模多大?
494k 五元组 / 7,970 份 volume / 62 问题模板 / 22 解剖区域 / 450+ 小时专家时间。划分:train 5,977(75%)/ val 797(10%)/ test 1,196(15%),无患者重叠。
Q5:任务是什么形式?
给定 (3D volume, 问题),模型需同时输出三要素:3D bounding box(定位)、推理链(过程)、MOAKS 分级集合(结论)——形式化记作 (B̂, Ĉ, D̂) = M(I, Q)。这是"grounded reasoning"与普通 VQA 的差别:答案必须带定位、带过程。
Q6:MOAKS 是什么?覆盖哪些结构?
MRI Osteoarthritis Knee Score,国际通用的膝骨关节炎半定量评分体系。本数据集覆盖:骨骨髓病变(BML,15 亚区)、软骨病变(14 亚区)、骨赘(16 亚区)、半月板损伤(6 亚区)、韧带/肌腱(3 结构)、Hoffa 滑膜炎、渗出-滑膜炎与关节周特征。软骨等病变按 size(0-3)与 depth(0-3)分级。
Q7:标注是怎么做的?
两层杠杆结构:专家手工分割 100 例高保真子集(2 radiologists + 1 orthopedic surgeon,约 4.5 小时/例)→ 训练 nnU-Net → 自动为全部 7,970 例生成 3D 边界框;MOAKS 分级继承 OAI 官方专家裁决评估;问题模板与全部 CoT 由资深骨科医生撰写。
Q8:license 是什么?能商用吗?
数据集 CC BY 4.0(HuggingFace 数据集卡 frontmatter 与 License 节双重确认),允许商用,仅需署名;论文本体同为 CC BY 4.0(arXiv HTML 页头实锤)。注意:若需要上游 OAI 原始 DICOM,需另行申请 NDA 账号——但这不影响数据集本体的 CC BY 4.0 使用。
Q9:模型表现如何?
zero-shot 全数失守:Qwen2.5-VL-3B overall 准确率 0.158,Qwen2.5-VL-7B 0.470,o1 0.477;医学专用 Med3DVLM zero-shot 甚至无法稳定遵循指令输出有效结果。SFT 后 Qwen2.5-VL-3B(w/o CoT)达 0.613(全场最佳),加 CoT 反而降至 0.588。定位与诊断准确率正相关,grounding 是最大瓶颈。
Q10:怎么拿?
HuggingFace rajpurkarlab/3DReasonKnee(公开直链,gated=false,NIfTI + JSON + 掩码分卷压缩包)+ GitHub sungeunkim0127/3DReasonKnee(SFT 与 zero-shot 评测代码)。大陆网络环境下走 hf-mirror.com 镜像。避坑细节见 §10。
十问速查:
| 问 | 答案关键词 |
|---|---|
| Q1 是什么 | 首个 3D grounded reasoning 数据集,494k 五元组 |
| Q2 谁做 | rajpurkarlab(HMS)+ SNUH,双共同一作 |
| Q3 数据哪来 | OAI 队列 DESS 子集,baseline~48 个月 |
| Q4 规模 | 494k/7,970 卷/62 模板/22 区域/450+ 小时 |
| Q5 任务 | (I,Q) → (框, 推理, 分级) 三联输出 |
| Q6 MOAKS | 7 组件全覆盖,size/depth 0-3 |
| Q7 标注 | 100 例专家种子 → nnU-Net 放大 → 官方评分继承 |
| Q8 license | CC BY 4.0 双确认,可商用 |
| Q9 表现 | zero-shot 0.158-0.477;SFT 最佳 0.613 |
| Q10 获取 | HF 直链 + GitHub 代码 + hf-mirror 备选 |
§2 数据构成与规格
2.1 临床与影像背景:读懂五元组前需要知道的三件事
其一,膝骨关节炎(knee osteoarthritis)为什么值得一个 494k 规模的 AI 数据集。 膝骨关节炎是最常见的关节退行性疾病之一,中老年人群患病率高,诊断与随访高度依赖影像。MRI 相比 X 光的价值在于能直接显示软骨、骨髓、半月板、滑膜等 X 光不可见的结构——病变在这些组织里的分布与严重度,正是治疗分层(保守观察 / 关节镜 / 截骨 / 置换)的依据。这意味着"读懂膝关节 MRI"是一个高频、标准化、且直接连着临床决策的视觉推理任务——为它构建大规模推理数据集的投入有明确的临床回报预期。
其二,MOAKS 是把"看片"变成"可比较文本"的桥。 半定量评分体系(semi-quantitative grading system)的存在,让放射科医生与骨科医生之间可以用整数分级沟通病灶,也让 AI 的输出有了可对齐的标注空间。MOAKS(MRI Osteoarthritis Knee Score)把膝关节按解剖分区——股骨、胫骨、髌骨各自划分亚区,半月板分内外侧与前后角——再对每个亚区内的每类病变独立分级。这套"分区 × 病变 × 属性"的三维结构,正是 3DReasonKnee 五元组设计的骨架:62 个问题模板对齐"亚区 × 病变"组合,final_diagnosis 的属性字典对齐"属性 × grade space"。可以说,不理解 MOAKS 的分区逻辑,就看不懂这个数据集为什么长这样。
其三,DESS 序列决定了"一个 volume 长什么样"。 DESS(Double Echo Steady State,双回波稳态)是三维梯度回波序列,稳态采集带来的高信噪比与良好的软骨-滑液对比度,使它成为软骨形态定量研究的首选序列;OAI 队列按标准协议采集,每份 160 层、层内分辨率均匀。对建模者的直接含义:(1) 输入形状规整(160 层固定),数据管线无需处理可变深度;(2) 软骨相关任务(14 亚区软骨缺损分级)是数据的主场,信号对比度好;(3) 但 BML 等病变的检出在 DESS 上依赖医生的经验读片——这或许能部分解释 §6 中 BML 分项的普遍低分。
2.2 上游血统:OAI 纵向队列
3DReasonKnee 的每一份影像都来自 OAI(Osteoarthritis Initiative,骨关节炎倡议)——由美国 NIAMS(国立关节炎与肌肉骨骼及皮肤病研究所)资助、跨多个临床中心执行的膝骨关节炎纵向观察研究。队列规模 4,796 名受试者,入组年龄 45-79 岁,58% 为女性,平均年龄 61.4 岁,累计产生 45,000+ 份 MRI 扫描及配套的临床评估与影像评分。
3DReasonKnee 的取材窗口是 baseline(基线)至 48 个月随访,序列类型锁定 DESS,从中选出 7,970 份构成数据集。同一受试者的多个时间点扫描可同时入选——这正是官方划分必须"按患者分组"(无患者重叠)的原因:否则"记住某个膝盖"就能在 test 集作弊。OAI 的影像评分(含 MOAKS)由队列官方组织专家裁决完成,3DReasonKnee 直接继承这套分级作为五元组的 D 分量——这是"站在队列研究肩膀上"的典型做法:AI 数据集不必重造评分体系,把多年专家成果挂接到影像即可。
库内 rid 391(oai)条目覆盖 OAI 队列本体(影像 + 评分 + 临床随访数据 + NDA 获取路径);两条件目构成"队列 → 推理数据集"的上下游互链关系。
2.3 规格总表
| 维度 | 数值 | 备注 |
|---|---|---|
| 五元组总数 | 494,000(494k) | 论文与 HF README 口径一致 |
| 3D MRI volumes | 7,970 份 | 全部 DESS 序列 |
| 每卷层数 | 160 slices | DESS 标准采集规格 |
| 序列类型 | DESS(Double Echo Steady State) | 高分辨率三维稳态序列,软骨显示佳 |
| 上游队列 | OAI 4,796 受试者(58% 女性;45-79 岁;平均 61.4 岁) | baseline 至 48 个月随访 |
| 划分 | train 5,977(75%)/ val 797(10%)/ test 1,196(15%) | 无患者重叠 |
| 问题模板 | 62 个 distinct | 由资深骨科医生开发,对齐 MOAKS 组件 |
| 解剖区域 | 22 个 distinct | 含骨/软骨/半月板/韧带肌腱/滑膜炎/关节周 |
| MOAKS 亚区覆盖 | BML 15 / 软骨 14 / 骨赘 16 / 半月板 6 / 韧带肌腱 3 + 滑膜炎与关节周 | 全 MOAKS 主组件 |
| 专家时间 | 450+ 小时 | 手工分割(100 例 × ~4.5h)+ 推理链生成 |
| 分割掩码 | masks.zip(nnU-Net 全亚区掩码,分卷 aa/ab) | cat masks_aa masks_ab > masks.zip 合并 |
| 许可 | CC BY 4.0 | 数据集与论文同许可 |
| HF 抓取元数据 | sha 7a611f92fd3ad3954e8b62feef49ee12bfef725a;lastModified 2026-05-10 |
gated=false;downloads 1,105(2026-09-30 时点) |
2.4 五元组:一条样本里有什么
论文 §3.1 把任务形式化为五元组 {I, Q, B, C, D}:
| 元素 | 含义 | HF 卡字段 | 形态示例 |
|---|---|---|---|
| I | 3D DESS MRI volume | image |
/data/images/9021195/48M/20090518_12801512_1.nii.gz(160 slices) |
| Q | 指向特定解剖区域的诊断问题 | prompt |
MOAKS 框架下针对 femur medial central 亚区软骨损伤的提问 |
| B | 3D bounding box | (随示例给出) | [83, 141, 117, 261, 154, 258] |
| C | 临床医生撰写的逐步思维链 | cot |
按 MOAKS 标准展开的影像观察→鉴别→分级依据 |
| D | 结构化严重度评估 | final_diagnosis |
{"femur medial central cartilage lesion": {"size": 0, "depth": 0}} |
bounding box 的六个分量按 [start_slice, end_slice, x_min, x_max, y_min, y_max] 排布——前两个圈层深,后四个圈面内范围。这是一个"体积窗口"而非逐层掩码:它告诉模型"看这片区域",而像素级的精细轮廓则由随仓库发布的 nnU-Net 分割掩码(masks.zip)补充。
结构化诊断 D 的设计直接镜像 MOAKS 评分工作流:每个病变类别附带若干属性(如软骨的 size 与 depth),每个属性从其专属 grade space(分级空间)取值。模型的任务因此不是输出一个孤立标签,而是复现"定位→判别病变类别→逐属性分级"的完整决策序列。
2.5 仓库结构(HF README 实采)
3DReasonKnee/
├── data/
│ ├── OAI/ # 上游原始 DICOM(使用需 NDA 账号)
│ ├── labels/ # taxonomymatch csv + MOAKS 评分表
│ ├── images/ # 预处理 NIfTI 图像(.nii.gz)
│ ├── masks.zip # nnU-Net 分割掩码(分卷 masks_aa + masks_ab)
│ ├── split_files/ # 划分清单 csv
│ ├── question_files/ # 问题与映射 JSON
│ └── generate_data/ # 数据生成脚本
├── code/
│ ├── data_preprocessing/dcm2nifti.py # DICOM→NIfTI 转换
│ ├── sft/ # 监督微调代码(GitHub 仓库)
│ └── zero_shot/ # zero-shot 评测代码(GitHub 仓库)
2.6 split_files 与 question_files 字段详解
split_files 是防泄漏与复现的生命线。每行一条扫描记录,字段如下:
| 字段 | 含义 | 使用注意 |
|---|---|---|
patient_id |
患者唯一标识 | 患者级分组/交叉验证以此为准,官方划分已保证跨集无重叠 |
time |
采集时间点 | OAI 时间点编码(baseline / 12M / 24M / 36M / 48M 口径) |
study_folder / series_folder |
DICOM 层级的检查/序列目录 | 复现预处理时定位原始 DICOM 用 |
knee_side |
膝别(左/右) | 双膝患者同一时间点可贡献两份扫描 |
path |
原始路径 | OAI 目录树内位置 |
image_filepath |
NIfTI 图像路径 | 直接喂模型的文件指针 |
label_filepath |
标签文件路径 | 对应 MOAKS/掩码指针 |
| (划分标注) | train/val/test 归属 | 与论文 75/10/15 口径对应 |
question_files 内含五份 JSON,是"62 × 22"任务空间的机器可读定义:
| 文件 | 内容 | 典型用途 |
|---|---|---|
questions.json |
62 个诊断问题模板全文 | 生成 prompt、审计问题措辞 |
cot_question_mapping.json |
问题 → CoT 文本的映射 | 检索某模板下的推理链 |
labels.json |
分级标签 | 训练目标构造 |
grade_dict.json |
各属性 grade space 定义 | 输出头设计与合法值校验 |
question_subregion_mapping.json |
问题 → 解剖亚区映射 | 亚区级分组评测(对齐 Bench 7 大类) |
复现或扩展任务空间时,以这五份文件为准而非论文正文——它们是作者发布的权威映射。统计类别分布(§6.4 的类别不平衡应对)也应从 labels.json + grade_dict.json 出发逐模板统计。
2.7 分割掩码覆盖的亚区(HF 仓库 siblings 实证)
掩码覆盖以下结构(nnU-Net 逐亚区输出):ACL(前交叉韧带)、PCL(后交叉韧带)、Femur(股骨)、Femur cartilage(股骨软骨)、Tibia(胫骨)、Tibia cartilage(胫骨软骨)、Medial Meniscus(内侧半月板)、Lateral Meniscus(外侧半月板)、Patella(髌骨)、Patella cartilage(髌骨软骨)、Patellar Tendon(髌腱)、Effusion-Synovitis(渗出-滑膜炎)、Hoffa-Synovitis(Hoffa 滑膜炎),以及方位细分亚区:anterior femur (lateral)、anterior patella (axial)、anterior tibia (lateral)、lateral spine tibia (coronal)、medial spine tibia (coronal)、patella medial BML、posterior femur (lateral) 等。这套亚区体系与 MOAKS 的分区标准对应,是把"22 个解剖区域"落到体素层面的载体。
2.8 MOAKS 分级语义速查
MOAKS 对软骨等病变的分级采用双属性:
| 属性 | 分级 | 语义 |
|---|---|---|
| Size(缺损表面积占比) | 0 | 无缺损 |
| 1 | <10% 表面积 | |
| 2 | 10-75% 表面积 | |
| 3 | >75% 表面积 | |
| Depth(全层缺失深度) | 0-3 | 从无全层缺失到全层缺失逐级递进 |
BML 同样按 size 分级(另计数量与百分比);骨赘按大小、半月板按撕裂形态、滑膜炎按程度各有专属 grade space——这正是论文把结构化诊断 D 定义为"每个属性从其专属 grade space 取分级"的原因:不同病变类别的答案空间形状不同,不能用单一分类头硬套。
2.9 一条完整样本走读
以 HF README 示例为底本(数字为实证采录):volume /data/images/9021195/48M/20090518_12801512_1.nii.gz 来自患者 9021195 的 48 个月随访(48M 目录),2009-05-18 采集的 DESS 序列。问题针对股骨内侧中央亚区(femur medial central subregion)的软骨损伤。标注给出 3D 边界框 [83, 141, 117, 261, 154, 258]——第 83 到 141 层、面内 x 117-261、y 154-258 的体积窗口,覆盖 59 层厚度。CoT 按临床路径展开:先确认该亚区在序列中的位置与软骨信号特征,再按 MOAKS 标准测量缺损范围与深度,最后落成 final_diagnosis:{"femur medial central cartilage lesion": {"size": 0, "depth": 0}}——该例为正常(无缺损)。
这个例子有两处值得咀嚼:其一,路径里的 48M 展示了纵向队列的组织方式——同一患者的 baseline 与历次随访扫描各自成卷,为"病变进展"类研究保留了时间线;其二,该例恰好说明数据集包含大量正常与轻度样本:分级分布保留自然临床变异(论文 Figure 4a),并非只堆阳性病例,训练时需留意类别不平衡。
2.10 数据质量自检清单(使用前过一遍)
结合论文口径与本条目核验,把"拿数据前要确认的事"折叠成清单:
| # | 检查项 | 通过标准 | 不通过时的处置 |
|---|---|---|---|
| 1 | 下载完整性 | 分卷 masks_aa/ab 均在且 cat 合并后可解压 | 重下缺失分卷;校验文件清单与 HF README 目录一致 |
| 2 | 版本锚定 | 记录所用 sha(本条目抓取时点 7a611f92…) | 对照实验结果时在论文/报告中注明版本 |
| 3 | 划分使用 | 直接采用官方 split_files,未自行重切 | 自行重切必须按 patient_id 分组,并在结果中声明 |
| 4 | 字段对齐 | image/prompt/answer/cot/final_diagnosis 与 grade_dict 一致 | 以 question_files 五份 JSON 为准校验字段名 |
| 5 | 保真度分层 | 明确所用 bbox 属于"nnU-Net 自动"层 | 需要像素级金标准时只取 100 例高保真子集口径 |
| 6 | 类别分布 | 从 labels.json 统计逐类样本量 | 按需重采样/加权;报告中披露分布 |
| 7 | 许可合规 | 产出物署名(论文+HF+GitHub) | 商用场景额外自查派生数据许可链 |
| 8 | 评测协议 | 复用官方 zero_shot 代码的预处理与计分规则 | 自改协议需声明不可与论文数字直接对比 |
§3 构建流水线:450 小时专家时间如何花掉
3DReasonKnee 的构建是"专家种子标注 → 模型放大 → 专家裁决"三层杠杆结构的教科书案例(论文 Figure 3 给出全景图)。拆开看每一步:
3.0 成本模型:专家时间都花在哪了
先把"450+ 小时"摊开成账本,再进流水线细节——这个数字是数据集质量宣称的锚,值得看清构成:
| 成本项 | 单位成本 | 数量 | 小计 | 产出物 |
|---|---|---|---|---|
| 专家手工分割 | ~4.5 小时/例 | 100 例 | ~450 小时 | 高保真掩码 + nnU-Net 训练集 |
| 问题模板撰写 | — | 62 模板 | (并入 450+ 口径) | questions.json |
| 逐步 CoT 撰写 | 按模板×病变组合 | 62 × 亚区组合 | (并入 450+ 口径) | cot_question_mapping.json |
| 模型放大 | 专家 0 小时/例 | 7,970 例 | ~0 | 全量 bbox + 掩码(伪标签) |
| 分级挂接 | 专家 0 小时/例 | 7,970 例 | ~0 | OAI 官方评分继承 |
要点:450+ 小时几乎全部押在种子集上;全量数据的边际专家成本趋近于零。这是"质量押注在杠杆支点"的设计——支点(nnU-Net 的分割质量)决定了全量数据的天花板,这也是论文愿意花一整个 Figure 3b 展示 Dice 的原因。
3.1 第一层:100 例高保真手工分割(450+ 小时的大头)
两位 board-certified radiologists 与一位 orthopedic surgeon 使用专用 3D 标注工具,对解剖亚区逐例手工标注。每例约 4.5 专家小时,高保真子集合计 100 例——这就是"450+ 小时"宣称的主体(另一部分是推理链撰写时间)。4.5 小时/例意味着什么:一份 DESS 有 160 层,要覆盖骨、软骨、半月板、韧带、滑膜等 20 余个亚区,逐层勾画并交叉核对,这是按"天"计的精细活。三位标注者的分工论文未详述(是否双人独立标注后仲裁、还是分工不同亚区),存照见 FACTS.md。
3.2 第二层:nnU-Net 训练与全量自动框生成
把 100 例手工标注按标准 nnU-Net 流水线(论文引用 Isensee et al.)训练成分割模型,覆盖所有解剖结构、亚区与病变;随后将训练好的 nnU-Net 应用到全部 7,970 例,自动生成各亚区的分割掩码与 3D bounding boxes(伪标签)。同时,每份扫描的 MOAKS 评分继承自 OAI 官方评估(expert-adjudicated MOAKS assessment,专家裁决口径)——分级不是流水线新造的,而是把上游队列多年专家评估成果直接挂接到对应 volume 上。
这个设计的经济学很直白:逐例专家分割 7,970 例需要约 35,000 专家小时(7,970 × 4.5),完全不现实;用 100 例(450 小时)换一个可靠的自动分割器,成本压缩两个数量级。代价同样明确——7,970 例的边界框精度上限由 nnU-Net 决定。论文以各亚区 Dice 分数(Figure 3b)披露模型质量,未在正文逐项列表(图形呈现,数值待核,见 §10 坑 8)。使用者若需要像素级金标准,应只依赖 100 例高保真子集的专家掩码;若可接受模型生成的边界框,再使用全量数据。
3.3 第三层:问题模板与思维链的专家撰写
一位 board-certified orthopedic surgeon、膝外科经验 7 年以上独立完成两件事:
- 62 个亚区特定诊断查询模板——每个模板对齐一个 MOAKS 组件,指向一个解剖亚区与病变类别组合;
- 逐步思维链——对每个"目标病变 × 解剖亚区"组合,先描述该病变在 DESS 序列上的关键病理特征(强调与正常解剖的鉴别点),再按 MOAKS 标准系统翻译成推理步骤,明确写出"在什么条件下给什么分级、依据是什么"。
论文特别强调 CoT 是"为模仿临床医生的推理路径而精心构造"的:它不是模型生成的回声,而是把专家脑内决策过程显式展开的文本化。每条五元组的 CoT 因此与该例的 MOAKS 分级构成推导关系——这是数据集最不可替代的资产。
3.4 流水线全景(复述为步骤)
OAI 队列(4,796 受试者,45,000+ MRI)
└── 取 baseline~48 个月随访 DESS 序列 → 7,970 例(160 slices/scan)
│
├── [专家层] 2 rad + 1 orthopedic surgeon 手工分割 100 例(~4.5h/例)
│ └── 训练 nnU-Net(全结构/亚区/病变)
│ └── [放大层] 自动生成 7,970 例 3D bounding box + 掩码
│
├── [分级层] OAI 官方 MOAKS 专家裁决评分 → 挂接对应 volume
│
├── [问题层] 骨科医生(7+ 年)撰写 62 模板 × 逐步 CoT
│ └── question_files 五份 JSON 固化映射
│
└── [组装层] 五元组 {I, Q, B, C, D} → 494k 条 → 划分 5,977/797/1,196
3.5 划分与防泄漏
7,970 例按 75% / 10% / 15% 切为 train(5,977)/ val(797)/ test(1,196),官方明确 no patient overlap——同一患者的多次随访扫描不会跨集出现。这一点对纵向队列数据至关重要:OAI 每位受试者有多个时间点,若按扫描随机划分而不按患者分组,模型可以靠"记住这个膝盖"作弊。HF 仓库 split_files 提供逐行清单(含 patient_id 与 knee_side 字段),复现实验时应直接使用官方划分而非自行重切。
3.5b 划分完整性复检脚本(防泄漏自查)
拿到数据后第一件事:确认自己下载的版本划分无泄漏。骨架如下:
import csv
from collections import defaultdict
def check_split_leakage(split_dir: str):
"""官方划分的患者级泄漏自查:同一 patient_id 不得跨集。"""
seen = defaultdict(set)
for name in ("train", "val", "test"):
with open(f"{split_dir}/{name}.csv", newline="") as f:
for row in csv.DictReader(f):
seen[row["patient_id"]].add(name)
leaked = {p: s for p, s in seen.items() if len(s) > 1}
print(f"患者总数: {len(seen)}")
print(f"跨集泄漏患者数: {len(leaked)}") # 期望 0
assert not leaked, f"发现泄漏: {list(leaked)[:5]}"
两处细节:OAI 的 patient_id 形态以官方 csv 为准(不做二次解析);若自行扩展数据(FAQ Q37),新患者同样纳入本检查。官方划分理论上零泄漏——此脚本是"信任但验证"的廉价保险。
3.6 质量口径与流水线局限
论文没有为 3DReasonKnee 做标注一致性实验(inter-rater reliability)——MOAKS 分级继承上游,手工分割未见双人独立标注+仲裁的描述。这不是缺陷指控,而是使用者应知的质量边界:数据集的"金标准"语义是"OAI 官方专家裁决分级 + nnU-Net 放大定位",而非"逐例多专家一致性收敛"。同类的医学标注流水线(如金标准条目 PANDA-PLUS 的三层学生-专家流水线)通常附一致性统计,本数据集选择把统计资源换成了规模——494k 的量级在 3D 推理数据集里尚无对手。
§4 与现有数据集的比较:3D 定位推理的空白
论文 Table 1 把 3DReasonKnee 放进 20 余个同类资源的对照矩阵,三个维度上此前没有任何数据集同时满足:3D volumetric data(3D 体数据)+ voxel-level localization(体素级定位)+ expert-annotated reasoning chains(专家注释推理链)。
4.1 各流派各自的短板
| 流派 | 代表 | 有什么 | 缺什么 |
|---|---|---|---|
| 2D 医学 VQA | VQA-Rad、SLAKE、PathVQA、PMC-VQA | 问答对 | 图像是平面的;无定位;推理链缺失或浅 |
| 大规模图文对 | MedTrinity-25M(25M 图文对) | 预训练规模 | 2D 为主;定位与诊断推理脱节 |
| 推理增强 VQA | GMAI-Reasoning10K、RadRBench-CXR | CoT 解释 | 前者 2D;后者 59K 样本/301K 推理步但局限于胸片 |
| 3D 定位/报告 | MAIRA-2(胸片 grounded report) | grounding | 主要 2D 胸片场景 |
| 3D 医学 VLM 训练源 | M3D-LaMed(基于 M3D)、RadFM | 3D 体数据 | 限位于"诊断配 vision-language reasoning"不足 |
| 3D 分割 | TotalSegmentator 等 | 掩码 | 无诊断推理语义 |
4.2 逐数据集详述:它们各自解决了什么、留下了什么
VQA-Rad(库内 rid 240)。 医学 VQA 的奠基数据集之一:3,157 张放射影像(多为胸片与头部 CT/MRI)配 3,515 个问答对,由临床医生标注。它定义了"医学视觉问答"这一任务形式,但规模小、图像 2D、答案多为短词(yes/no/器官名),没有推理过程。3DReasonKnee 的五元组相当于把 VQA-Rad 的"图+问+答"扩成"体+问+框+推理+结构化分级",并把领域从泛放射聚焦到膝 MRI。
SLAKE(rid 250)。 中英双语的医学 VQA(642 张图 / 7,028 问),含解剖分割标注,任务形式比 VQA-Rad 丰富(有对话式与描述式)。它的双语设计与结构化标注启发了后续多任务医学 VQA,但同样是 2D 与短答案世界。论文 Related Work 引用它作为"2D VQA 有推理痕迹或无"的对照。
PathVQA / PMC-VQA(rid 260/270 系)。 病理与文献图文问答的大规模化尝试:PathVQA 从病理教科书挖掘 32,799 对;PMC-VQA 从 PMC 文献构建约 229K 对。规模上来了,但图文对来自文献挖掘,问答质量参差、无空间标注、无专家推理链——"量"与"临床推理深度"的矛盾在这些数据集上表现得最典型。
MedTrinity-25M。 2,500 万级图文对,是目前最大的多模态医学预训练语料之一,附自动生成的疾病区域掩码。它是"规模路线"的极致:靠自动流水线换体量,适合预训练而非精评。论文把它归入"focus on 2D images with reasoning traces"一侧——掩码是自动的、推理是模板化的,与 3DReasonKnee 的"专家手写推理链"形成方法学对照。
GMAI-Reasoning10K。 10,000 条医学推理样本,每条 VQA 配详细 CoT 解释——与 3DReasonKnee 在"推理链"维度同构,是最近的血缘。差异在维度与领域:它是 2D、泛医学;3DReasonKnee 是 3D、聚焦膝 OA 且规模放大 49 倍。库内 gmai-mmbench(rid 562)条目覆盖相关评测生态。
RadRBench-CXR。 59K 胸片 VQA 样本 + 301K 临床验证的推理步骤——"grounded reasoning"理念在 2D 胸片上的先行者,推理步骤经过临床验证是其亮点。3DReasonKnee 可视为该理念向 3D 体数据的延伸与倍增(494k 样本),任务从报告理解转向结构化分级。
MAIRA-2。 微软的胸片 grounded report generation 模型,输出带空间定位的报告片段——证明"定位+文本"在 2D 胸片可行。但它面向报告生成而非逐属性分级,且止步 2D。论文引它佐证"空间标注数据是 grounding 的前提"。
M3D-LaMed / RadFM / OpenBiomedVid。 3D 医学 VLM 的训练资源系:M3D-LaMed 基于 M3D 数据集(CT 为主)构建 3D 指令数据,RadFM 整合多模态医学影像做通用模型,OpenBiomedVid 收录生物医学视频。它们证明"3D + 文本"可训,但论文的判语是"remain limited in diagnosis with vision-language reasoning"——缺少细粒度定位与逐步临床推理的耦合。3DReasonKnee 的增量正是补上"voxel 级定位 × 专家推理"这两块拼图。
TotalSegmentator(rid 422)。 覆盖全身 100+ 结构的大规模 CT 分割数据集,是"3D 掩码"路线的代表。它给像素级真值但不给任何诊断语义——掩码回答"这是什么器官在哪",不回答"损伤多严重、为什么"。3DReasonKnee 的 masks.zip 与它互补:前者服务解剖定位,后者服务诊断推理。
读完整张对照表的结论:每个前作都贡献了一块拼图——VQA 的任务形式、CoT 数据的推理深度、3D 指令数据的维度、分割数据的体素真值——但没有谁把"3D 体数据 × 体素级定位 × 专家推理链"三块拼在一起。3DReasonKnee 的"首个"宣称卡的就是这个交集,且限定词精确(§4.3)。
4.3 与库内条目的对照视角
用千方病案医数集的标签语言重述这张表:库内 fastmri(23)是膝关节 MRI 但任务是重建;oai(391)是上游队列本体(影像 + 评分 + 临床随访),但没有推理链与 bounding box;vqa-rad(240)、slake(250)、pmc-vqa(270)等是 2D VQA;totalsegmentator(422)是分割掩码集。3DReasonKnee 恰好站在这些条目的能力交集之外——它从 oai 取材,向 VQA 家族借任务形式,把 totalsegmentator 式的掩码作为附属资产,最后加上所有条目都没有的专家 CoT。§8 互链建议即按此逻辑展开。
4.4 "首个"的边界
“首个 3D grounded reasoning 数据集"的限定词是"grounded reasoning”(定位+推理耦合),不是"首个 3D 医学 VQA"也不是"首个膝关节数据集"。引用时应保留这个限定:3D 医学影像问答与定位数据集均已有先例,缺的是把 bounding box 与 CoT 绑定在同一条样本里的资源。
4.2b 对照小结:一张表记住前作们
| 数据集 | 维度 | 定位标注 | 推理链 | 规模量级 | 相对本条目的角色 |
|---|---|---|---|---|---|
| VQA-Rad | 2D | ✗ | ✗ | ~3.5K QA | 任务形式定义者 |
| SLAKE | 2D | 分割标注 | ✗ | ~7K QA | 多任务形式参照 |
| PathVQA / PMC-VQA | 2D | ✗ | ✗ | 33K / 229K | 规模化路线参照 |
| MedTrinity-25M | 2D | 自动掩码 | 模板化 | 25M 图文对 | 规模路线极致 |
| GMAI-Reasoning10K | 2D | ✗ | ✓ 专家级 | 10K | 推理链同构最近邻 |
| RadRBench-CXR | 2D | 区域级 | ✓ 临床验证 | 59K QA / 301K 步 | grounded reasoning 2D 先行 |
| MAIRA-2 | 2D | ✓(报告内) | 报告式 | — | 定位+文本可行性证明 |
| M3D-LaMed / RadFM | 3D | 弱 | ✗/浅 | M3D 系 | 3D 指令训练源 |
| TotalSegmentator | 3D | ✓ 掩码 | ✗ | 全身 100+ 结构 | 掩码资产同类 |
| 3DReasonKnee | 3D | ✓ 体素框 | ✓ 专家手写 | 494k 五元组 | 三元交集首个 |
读法:从上往下是"任务形式 → 规模 → 推理深度 → 维度"的逐级演进,最后一行是首次会师。引用本数据集的定位时,可直接引用此表的对照逻辑。
§5 ReasonKnee-Bench:双指标评测协议
5.0 协议设计动机:为什么是这两个指标
grounded reasoning 的评测陷阱在于:单看诊断准确率,无法区分"模型看不见病灶"和"看见了判不对"——两种失败的临床含义与修复路径完全不同,但总分上无法区分。ReasonKnee-Bench 的双指标设计正是为了拆解这一点:
- 诊断准确率回答"分级对不对"——这是任务的最终交付物,对齐 MOAKS 的 7 大类结构;
- 3D IoU 回答"看的地方对不对"——这是推理过程的物理前提,对齐 bounding box 的空间语义。
两者分开报告后,再用 w/ GT region 消融把因果钉死:如果定位能力被外生补齐(直接喂正确区域)后成绩显著回升,则"定位不足拖累分级"从相关性升级为因果结论——论文正是这样做的(§6.3)。这套"双指标 + 消融归因"的评测设计,比单指标榜单更能指导改进工作,值得做评测的团队直接借鉴。
5.1 协议设计
ReasonKnee-Bench 是作者基于 test set(1,196 scans)建立的评测协议,两项指标分别对着"定位"与"分级"两难:
指标一:Final Diagnostic Accuracy(最终诊断准确率)——模型预测的 MOAKS 严重度分级是否与专家裁决一致,按 7 大类分别报告:
| 大类 | 覆盖内容 |
|---|---|
| Bone Marrow Lesions(BML) | 骨骨髓病变,15 亚区,size 0-3 + 数量/百分比 |
| Cartilages | 软骨病变,14 亚区,size/depth 分级 |
| Osteophytes | 骨赘,16 亚区 |
| Menisci | 半月板损伤,6 亚区 |
| Ligaments & Tendons | 韧带/肌腱,3 结构 |
| Synovitis & Effusion | Hoffa 滑膜炎 + 渗出-滑膜炎 |
| Periarticular Features | 关节周特征 |
指标二:Anatomical Subregion Localization(解剖亚区定位)——预测 bounding box 与专家框的 3D IoU(体积交并比):
IoU_3D = Volume(B_pred ∩ B_gt) / Volume(B_pred ∪ B_gt)
5.2 评测设定族
论文在两种设定下测模型:
- Zero-shot:给模型 3D 扫描与问题提示(如"In this DESS MRI, identify and grade the osteophyte at the patella lateral subregion. Provide your reasoning, and the MOAKS grade."),不给任何推理链示例,全凭预训练知识作答;
- Instruction Zero-shot / SFT(w/ 或 w/o CoT):前者在提示中加入指令化格式约束;后者用训练集微调,变量是 CoT 是否进入训练目标——这构成"CoT 数据有没有用"的天然对照实验。
另有 w/ GT region 变体(把 ground-truth 区域直接喂给模型)用于失败归因:如果喂了正确区域成绩大涨,说明错误主要出在定位而非分级。
5.2b 设定族对照表
| 设定 | 训练数据 | 提示形式 | CoT 位置 | 回答的问题 |
|---|---|---|---|---|
| Zero-shot | 无(纯预训练) | 原始问题 | 不提供 | 预训练知识裸表现如何 |
| Instruction Zero-shot | 无 | 指令化格式约束 | 不提供 | 格式约束是否有益 |
| SFT w/o CoT | (I, Q, D) | 原始问题 | 不进损失 | 五元组监督信号价值 |
| SFT w/ CoT | (I, Q, D) + CoT 文本 | 原始问题 | 进损失 | CoT 直接入 SFT 是否有益 |
| Instruction Zero-shot w/ GT region | 无 | 直接喂正确区域 | 不提供 | 定位失败归因(消融) |
设定族的设计逻辑:前三行沿"无监督 → 监督"递进,第四行单独隔离 CoT 变量,第五行做归因消融——五设定对应论文五个核心结论,评测协议与论文叙事严丝合缝。复现时建议全族跑齐而非只跑 SFT 主线,否则归因链条断裂。
5.3 被测模型
论文摘要称 benchmark 了 five state-of-the-art VLMs;实验设置实名四类,结果表含变体行:
| 模型 | 类型 | 说明 |
|---|---|---|
| Qwen2.5-VL-3B-Instruct | 通用 VLM(视频输入能力) | 3B 开源 |
| Qwen2.5-VL-7B-Instruct | 通用 VLM(视频输入能力) | 7B 开源 |
| o1 | API 闭源推理模型 | 2024-12-01-preview,经 Azure |
| Med3DVLM | 专业 3D 医学 VLM | 3D 医学影像专用 |
| (变体行) | Instruction Zero-shot / SFT w-o CoT / SFT w CoT | 上述模型的设定变体 |
存照:摘要的"five"与实名的四类模型存在计数口径差(四类 + 变体展开后表格行数超五),条目不硬凑第五个名字,详见 §10 坑 6。前轮研究记录中提到的 Qwen2-VL-3B 未在本轮 HTML 全文中出现于基线表,以本轮四类实名为准。
5.4 评测的工程细节与复现提示
三件事在复现时容易踩线:
- 3D 输入的承载方式:被测通用 VLM(Qwen2.5-VL 系)本身不吃原生 3D 体数据,论文利用其视频输入能力把 160 层 DESS 作为帧序列喂入——这是一个务实的迁移方案,也意味着这些模型对"层间几何关系"的感知依赖时序注意力的偶然涌现。复现时应保持与官方一致的输入预处理(GitHub code/zero_shot 为准),自行改成逐层拼接或多视图投影都会破坏与论文数字的可比性。
- 解析与容错:Med3DVLM zero-shot 大量输出不可解析(§6.1),评测代码必须对无效输出有明确的计分规则(论文按"无法遵循指令"处理)。自己复现时若把无效输出一律记 0 分或跳过,overall 会与论文不可比。
- 抽取与配对:Bench 在 test split 上按"扫描 × 问题模板"展开评测项;
question_subregion_mapping.json决定每条五元组归入 7 大类的哪一类。逐类准确率的分母因此逐类不同,报告时不可用全局分母平均。
5.5 结果速览(详表见 §6)
zero-shot 梯度:3B 0.158 << 7B 0.470 ≈ o1 0.477 << 临床可用线;SFT 后 3B w/o CoT 0.613 最佳。两条交叉发现——CoT 进 SFT 反降分、grounding 是主瓶颈——构成论文最具方法论价值的结果,§6 展开。
§6 评估结果:VLM 在 3D 定位推理上的双重失守
6.1 Zero-shot 诊断准确率:全数远低于临床可用
ReasonKnee-Bench zero-shot 设定下各模型 MOAKS 分级 overall 准确率(论文结果表实采):
| 模型 | 设定 | BML | Cartilage | Osteophyte | Meniscus | Others | Overall |
|---|---|---|---|---|---|---|---|
| Qwen2.5VL-3B | Zero-shot | 0.081 | 0.253 | 0.251 | 0.093 | 0.159 | 0.158 |
| Qwen2.5VL-7B | Zero-shot | 0.642 | 0.309 | 0.348 | 0.347 | 0.469 | 0.470 |
| o1 | Zero-shot | 0.479 | 0.553 | 0.353 | 0.332 | 0.476 | 0.477 |
| Qwen2.5VL-3B | Instruction Zero-shot | 0.092 | 0.149 | 0.253 | 0.205 | 0.146 | 0.146 |
读表三个要点:
- 3B 通用模型基本失明——0.158 的 overall 意味着按多数类猜也差不了太多;BML 分项 0.081 尤其惨烈(骨骨髓病变在 DESS 序列上表现为信号改变,小模型难以捕捉)。
- 规模与推理能力的补偿有限——7B 与 o1 都在 0.47 附近,距"临床可用"(论文的隐含基准线)仍有明显距离;o1 的通用推理能力在 3D 医学影像定位上没有兑现成优势。
- 指令格式约束帮倒忙——Instruction Zero-shot 的 3B 反而从 0.158 降到 0.146,提示僵化输出格式会进一步挤压小模型本就孱弱的判别能力。
另一条存照级发现:Med3DVLM zero-shot 无法遵循指令给出有效输出(论文原文 “medical VLMs like Med3DVLM fail to follow the instructions and give valid outputs”)——在 MOAKS 分级任务上,这个 3D 医学专用模型在 zero-shot 设定下甚至不能稳定产出可解析的答案。“医学专用"不等于"指令遵循可用”,这是对医学 VLM 营销叙事的一次实证泼冷水。
6.2 逐类失分分析:哪里最难
把 zero-shot 行按列读,可以看到任务难度的地形图:
- BML(骨骨髓病变)是重灾区:3B 仅 0.081——BML 表现为骨髓信号的区域性改变,边界模糊、亚区归属依赖立体解剖知识,是"先定位才可能分级"的典型;有意思的是 7B 在 BML 上反而拿到 0.642(七类中最强),暗示 BML 分级对模型容量敏感——更大的模型能从帧序列里捕捉信号异常,但 3B 的容量不足以支撑。o1 的 0.479 高于 3B 但低于 7B,说明通用推理链不能完全替代视觉容量。
- 软骨(Cartilage)与骨赘(Osteophyte)是 3B 的相对高点(0.253 / 0.251):软骨缺损在 DESS 上对比度好、骨赘形态学特征直观,这两个分项对"看到结构"的要求高于"理解信号",小模型尚能蒙对一部分。
- 半月板(Meniscus)全场低迷(3B 0.093 / o1 0.332 / 7B 0.347):半月板损伤分级要综合撕裂形态、位置、完整性多属性,属性空间的复合度拉高了错误率。
- 跨模型方差提示类别难度不均匀:7B 的 BML 0.642 vs 软骨 0.309(差 0.33),o1 的软骨 0.553 vs BML 0.479(差仅 0.07)——不同模型在不同类别的失败模式不同,做模型选型时应看逐类表而非 overall。
逐类小结表(zero-shot 维度,跨模型对照):
| 类别 | 最强模型及分数 | 最弱表现 | 难度归因 |
|---|---|---|---|
| BML | 7B 0.642 | 3B 0.081 | 信号改变依赖容量;定位依赖立体解剖知识 |
| Cartilage | o1 0.553 | 3B Instruction 0.149 | DESS 对比度好但分区分级细 |
| Osteophyte | 7B 0.348 | 3B Instruction 0.253 | 形态直观但 16 亚区划分琐碎 |
| Meniscus | 7B 0.347 | 3B 0.093 | 多属性复合(形态×位置×完整性) |
| Others | o1 0.476 / 7B 0.469 | 3B Instruction 0.146 | 异质类混合,无单一规律 |
6.3 SFT 结果:CoT 进训练目标反而降分
在训练集上监督微调后的 overall 准确率(论文结果表实采):
| 模型 | 设定 | BML | Cartilage | Osteophyte | Meniscus | Others | Overall |
|---|---|---|---|---|---|---|---|
| Qwen2.5VL-3B | SFT w/o CoT | 0.706 | 0.602 | 0.345 | 0.387 | 0.616 | 0.613 |
| Med3DVLM | SFT w/o CoT | 0.670 | 0.578 | 0.330 | 0.346 | 0.600 | 0.596 |
| Qwen2.5VL-3B | SFT w/ CoT | 0.667 | 0.600 | 0.342 | 0.340 | 0.590 | 0.588 |
| Med3DVLM | SFT w/ CoT | 0.671 | 0.579 | 0.333 | 0.343 | 0.605 | 0.581 |
| Qwen2.5VL-7B | Instruction Zero-shot w/ GT region | 0.697 | 0.549 | 0.338 | 0.166 | 0.563 | 0.556 |
三条关键读数:
- SFT 带来大幅跃升但仍不够:3B 从 0.158 → 0.613(约 3.9 倍),说明五元组中的 (I, Q, D) 部分是有效的监督信号;但 0.613 离临床部署依然很远。
- 加 CoT 一致性略降:两个模型上 w/ CoT 均低于 w/o CoT(0.588 vs 0.613;0.581 vs 0.596)。论文的解读克制而清晰:专家 CoT 蕴含的价值可能需要标准 SFT 之外的训练范式(如 RL)才能释放——把长推理链硬塞进逐 token 交叉熵目标,反而稀释了对最终分级的监督权重。这对整个"CoT 数据热"是一记提醒:CoT 数据 ≠ SFT 数据,资产的形态决定用法。
- 喂 ground-truth 区域(GT region)可救回大量分数:7B 从 zero-shot 0.470 → w/ GT region 0.556,证实失败的主因在定位环节。逐类看 GT region 行的 Meniscus 仍只有 0.166——即便定位正确,半月板分级本身对模型仍极难,说明任务难度不止来自定位。
6.4 逐模型小结
- Qwen2.5-VL-3B-Instruct:zero-shot 近乎失明(0.158),SFT 后跃至 0.613 成为全场最佳——最"可塑"的基线,性价比之选,但天花板仍远低于临床线。
- Qwen2.5-VL-7B-Instruct:zero-shot 0.470 与 o1 打平,BML 分项全场最强(0.642);GT region 消融的关键载体(0.556),是失败归因分析的主力模型。
- o1:0.477,与 7B 同档。通用推理能力没有兑现成 3D 医学影像优势——推理强不强,先得看得见;o1 的视觉前端对 160 层 DESS 的编码可能才是瓶颈。
- Med3DVLM:zero-shot 指令失效(存照级发现);SFT 后 0.596/0.581 略逊于 3B 同设定。但它的 IoU-诊断准确率正相关最强(§6.5)——定位与判别的联动质量最高,3D 原生架构的价值在"一致性"而非"绝对分数"。
6.5 定位(IoU)与诊断准确率:正相关 + grounding 是主瓶颈
论文对 supervised 模型的两项指标做了交叉分析,结论有三层:
- 清晰正相关:定位越好(3D IoU 高)的模型,诊断准确率也越高——两者不是独立技能,共享"找到病灶"这一底层能力;
- Med3DVLM(w/ CoT 训练)正相关最强:在所有受监督模型中,该模型的 IoU-准确率联动最紧密,提示 3D 专用架构在"定位-判别一致性"上有结构性优势;
- Grounding 是主要失败点(Failure Modes 节原文口径):提供 ground-truth region 后性能显著提升,说明大量错误源于错误定位而非分级能力本身——模型看错了地方,自然给错了分级。
这组发现对使用者的指导意义:在 3D 医学 VLM 的改进路线上,先修定位、再修分级是数据给出的优先序;跳过 grounding 直接堆分级监督,收益有限。
6.6 分级分布:自然临床变异与类别不平衡
论文 Figure 4a 呈现各解剖区域 MOAKS 分级分布,明确说明数据集保留自然临床变异(natural clinical variation)——既有大量 0 级(正常/无病变)样本,也有各等级病变。以 §2.9 走读的示例为例,femur medial central 软骨的 final_diagnosis 就是 size 0 / depth 0。这对训练是双刃剑:分布真实(好),但阳性样本占比被真实患病率稀释(需加权重采样或 focal loss 应对)。论文正文未给出逐类精确占比表(图形呈现),使用者应从 labels.json / grade_dict.json 自行统计。
论文正文未给出逐类精确占比表(图形呈现),使用者应从 labels.json / grade_dict.json 自行统计。
类别不平衡的快速统计脚本:
import json
from collections import Counter
def grade_distribution(labels_path: str):
"""从 labels.json 统计各病变类别的分级分布(类别不平衡自查)。"""
labels = json.load(open(labels_path))
dist = Counter()
for rec in labels: # 字段名以实际文件为准
for lesion, attrs in rec.items():
for attr, grade in attrs.items():
dist[(lesion, attr, grade)] += 1
for key in sorted(dist):
print(key, dist[key])
6.7 结果的横向解读:三句话带走
把 §6 全部表格压缩成三句可复述的结论,便于论文写作或立项汇报引用:
- “通用 VLM 在 3D 医学定位推理上全线失守,规模与通用推理能力只能部分补偿”——zero-shot 0.158-0.477 全档低于临床线,o1 与 7B 打平说明这不是单纯的参数量问题;
- “监督信号有效但 CoT 直接入损失无效”——SFT 拉升 3.9 倍证明五元组监督含金量,w/ CoT 一致性略降证明标准交叉熵不是消化推理链的正确容器;
- “先修定位再修分级”——grounding 是主要失败点(GT region 消融实证),IoU 与准确率正相关(Med3DVLM w/ CoT 最强),改进资源的优先序由此确定。
这三句均可在论文结果节找到直接依据(见附录 C 证据链),复述时不必改写数字。
§7 获取与许可:三层资源三种进法
7.1 许可结构
3DReasonKnee 的许可在同类 3D 医学数据集中属于最通透的一档,但仍要分三层看清:
| 层 | 对象 | 许可 | 依据 |
|---|---|---|---|
| 1 | 数据集本体(NIfTI 图像 + 五元组 + 掩码 + 划分/问题文件) | CC BY 4.0 | HF 卡 frontmatter license: cc-by-4.0 + README License 节原文 |
| 2 | 论文本体 | CC BY 4.0 | arXiv HTML 页头 “License: CC BY 4.0 arXiv:2510.20967v1” |
| 3 | 上游 OAI 原始 DICOM | 需 NDA 账号申请 | README 原文 “To obtain access to OAI data you will need an NDA user account” |
HF README License 节原文明确列出 CC BY 4.0 的三项自由:“Sharing and adaptation of the material / Commercial use / With the requirement to provide appropriate attribution”——允许商用,条件是适当署名。对医学 AI 创业团队与工业界使用者,这是关键利好:不似许多医学数据集的 CC BY-NC(禁商用)或请求制(如金标准条目 PANDA-PLUS 掩码的 upon qualified request),3DReasonKnee 本体零门槛。
第 3 层容易误读:NDA 账号只挡原始 DICOM(/data/OAI 目录),而数据集本体的预处理 NIfTI 图像已包含全部诊断所需信息,CC BY 4.0 直接可用。只有当你需要复现 dcm2nifti.py 预处理、或要把其他 OAI 序列(本数据集未收录的)纳入实验时,才需要去 nda.nih.gov 申请账号。
7.1b 许可细则五问
Q:基于本数据集训练的模型权重也按 CC BY 4.0 开放吗?
CC BY 4.0 约束的是数据集及其派生数据库;模型权重不在其直接约束范围。但学术惯例(及部分上游数据协议精神)建议:发布用本数据训练的模型时注明训练数据来源与许可,数据集内影像/文本若在产出物中可复原(如 few-shot 示例、报告插图)则同样署名。
Q:把五元组翻译成中文再发布可以吗?
可以——CC BY 4.0 允许演绎(adaptation),条件是署名并标注修改,且演绎作品不施加更严限制。翻译版应注明"译自 rajpurkarlab/3DReasonKnee(CC BY 4.0),翻译可能引入语义偏差"。
Q:商用产品里用它的 CoT 做蒸馏可以吗?
License 层面可以(明文允许 commercial use)。工程层面注意 §6.3 的负结果:直接 SFT 蒸馏 CoT 不是最优用法;RL/过程监督路线更契合这类资产,且属于正常的 adapt 范围。
Q:论文里的图(流水线图、Dice 图)能转载吗?
论文 CC BY 4.0 允许,注明出处即可(arXiv:2510.20967)。
Q:上游 OAI 的许可会不会"传染"本数据集?
不会。OAI 原始 DICOM 的获取协议只约束从 NDA 下载的那部分;3DReasonKnee 发布的预处理产物与新增标注由作者以 CC BY 4.0 独立授权。两层互不穿透——这与金标准条目 PANDA-PLUS 的"三层异构"不同,本条目是"两层清晰分层"(本体 CC BY 4.0 / 上游另取)。
7.2 获取路径
① HuggingFace 主仓库(公开直链)
https://huggingface.co/datasets/rajpurkarlab/3DReasonKnee
- gated=false,无需登录审批
- 五元组 + images + labels + question_files + split_files
- 大陆网络环境走镜像:hf-mirror.com(同路径替换域名)
② GitHub 代码仓库
https://github.com/sungeunkim0127/3DReasonKnee
- code/sft(微调)、code/zero_shot(评测)
- data/question_files 与 HF 仓库对应
③ NDA(仅当需要原始 DICOM)
https://nda.nih.gov/oai/query-download
- 注册 NDA 账号 → 签署数据使用协议 → 下载 OAI 原始数据
masks.zip 分卷坑(§10 坑 3 预告):仓库中掩码打包为 masks_aa + masks_ab 两个分卷文件,官方 README 明确合并命令:
cat masks_aa masks_ab > masks.zip && unzip masks.zip
直接找 masks.zip 会落空——这不是文件缺失,是 HF 单文件体积限制下的标准分卷操作。
7.3 hf-mirror 下载实操(受限网络环境)
主站不可达时的镜像路径(本条目核验时实测可用):
# 元数据探查(确认仓库状态、文件清单、license)
curl -s -A "Mozilla/5.0" https://hf-mirror.com/api/datasets/rajpurkarlab/3DReasonKnee
# README 全文(含 License 节、目录说明、示例)
curl -s -A "Mozilla/5.0" \
https://hf-mirror.com/datasets/rajpurkarlab/3DReasonKnee/raw/main/README.md
# 文件下载(大文件建议 huggingface-cli + HF_ENDPOINT 环境变量)
export HF_ENDPOINT=https://hf-mirror.com
huggingface-cli download rajpurkarlab/3DReasonKnee \
--repo-type dataset --local-dir ./3DReasonKnee
镜像与主站的同源性用 sha 对照:本条目核验时镜像 API 返回的 sha 为 7a611f92fd3ad3954e8b62feef49ee12bfef725a,与官方仓库一致即可放心使用。镜像元数据偶有缓存延迟,lastModified 类字段以主站为准。
7.4 版本链与引用
- 论文引用(HF 卡官方 BibTeX 键):
@misc{sambara20253dreasonkneeadvancinggroundedreasoning,
title={3DReasonKnee: Advancing Grounded Reasoning in Medical Vision Language Models},
author={Sraavya Sambara and Sung Eun Kim and Xiaoman Zhang and Luyang Luo and Shreya Johri and Mohammed Baharoon and Du Hyun Ro and Pranav Rajpurkar},
year={2025},
eprint={2510.20967},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2510.20967}
}
- 版本锚点:HF 仓库 sha
7a611f92fd3ad3954e8b62feef49ee12bfef725a(2026-09-30 抓取时点),lastModified 2026-05-10——仓库在论文发表(2025-10)后仍在持续维护,使用时留意 README 更新与文件清单变化。 - 署名建议:CC BY 4.0 要求 attribution,实际使用中建议同时署论文 + HF 仓库 + GitHub 仓库三项,并注明所用版本 sha。
7.5 系统资源与存储预估
7,970 份 160 层 DESS NIfTI(.nii.gz)+ 全亚区分割掩码 + 494k 五元组 JSON:论文与 HF 卡未给出总字节数(HF 卡未标 GB 值,size_categories 标签双口径矛盾见 §10 坑 1),实测需下载后确认;按 DESS 160×~384×~384 体积与 gzip 压缩率粗估,全仓库在数十 GB 量级——规划磁盘时留足余量,掩码分卷解压后体积还会膨胀。训练侧:3B 模型 SFT 在单张 80GB 级加速卡可跑(160 层按帧序列输入的显存开销可控),7B 起建议多卡或梯度累积;推理评测逐条展开 494k 中 test 子集即可。
7.6 常见获取失败场景与修复
| 症状 | 根因 | 修复 |
|---|---|---|
huggingface.co 超时/无法解析 |
主站被网络策略拦截 | 切 hf-mirror.com(§7.3);CI 环境用 HF_ENDPOINT 环境变量 |
| 镜像 API 返回旧 sha | 镜像缓存延迟 | 以主站 sha 为准做版本决策;镜像仅用于文件传输 |
unzip masks.zip 报"missing end of central directory" |
只下了 masks_aa 或 masks_ab 单分卷 | 补齐双分卷重新 cat;两卷都校验字节量 |
masks.zip 解压后路径错乱 |
在错误目录解压或覆盖 | 按官方目录树(§2.5)放置;勿与其他数据集混目录 |
| HF 下载中断后续传失败 | 大文件分块中断 | 用 huggingface-cli download 自带断点续传;避免裸 wget 循环 |
| GitHub clone 慢/失败 | 网络对 github 限速 | 走镜像代理或直接 HF 仓库取 question_files(两边同步) |
| 找不到 masks.zip 本体 | 误以为存在单文件 masks.zip | 坑 3:仓库只有分卷 masks_aa/ab,cat 合并才是正解 |
§8 生态与影响:rajpurkarlab 的 3D 落子与库内互链
8.1 在 rajpurkarlab 产品线中的位置
Pranav Rajpurkar 组(rajpurkarlab)是医学 NLP/VLM 数据集领域的高产实验室,库内已有其 rexgradient-160k(rid 717)。3DReasonKnee 在这条产品线上的独特性在于维度跃迁:实验室此前的主力资产(CheXpert 系、MedST-CoT 系、radgraph 系等)几乎都在 2D 胸片或文本层面,本条目是其首次把"grounded reasoning + CoT"的方法论搬进 3D volumetric 医学影像,并配齐了 Bench(ReasonKnee-Bench)、训练代码(code/sft)、评测代码(code/zero_shot)的全套基建。论文摘要的定位语——“a repository of orthopedic surgeons’ diagnostic expertise”(骨科医生诊断专长的知识库)——暗示实验室把 CoT 资产视为可跨任务复用的专长库,而非一次性训练语料。
8.2 HF 生态位与热度
抓取时点(2026-09-30)HF API 实测:downloads 1,105、likes 10、gated=false。对一个发布不足一年、任务形式全新的 3D 数据集,这是一个"早期爬坡"量级——远未破圈,但论文(arXiv)与 HF 仓库、GitHub 仓库三处入口齐备,社区可发现性良好。论文与数据集的时间线:2025-10-23 论文提交(v1),HF 仓库持续维护至 2026-05-10(lastModified),期间补充分卷掩码与问题文件——这是一个仍在演进中的活跃资产。
热度解读要避免两个极端:一是拿下载量直接比较成熟 2D 数据集(数万级下载)得出"无人问津"的结论——3D 医学推理数据的用户基数本就小而专;二是把 1,105 次下载当作质量背书——它只说明发现与获取,不说明使用效果。合理的参照系是同为新范式的 3D 资产(如 M3D 系)的早期曲线。数据集卡维护质量(字段规范、示例完整、许可清晰)与论文披露的完整度,才是判断其长期价值的更稳指标——这两项本数据集都属上乘(DAIMS 7.8/10,附录 B)。
从工程角度看,gated=false 的零门槛设计值得同行借鉴:作者团队没有用申请制筛选使用者,而是靠 CC BY 4.0 的署名条款维持学术信用链——在"开放 vs 滥用"的天平上选择了信任与规模,这与其"让 3D 推理范式快速起步"的定位一致。
8.3 库内互链建议(rid 实查)
第一梯队(正文双向引用):
- oai(391)——血缘最强的上游:DESS 序列与 MOAKS 专家裁决评分直接取自 OAI 队列。两条件目构成"队列研究 → AI 推理数据集"的完整增值链,读者从任一条进入都能找到数据源头或下游用法。
- rexgradient-160k(717)——同实验室(rajpurkarlab)姊妹条目:方法论同源(专家 CoT + 指令化任务形式),领域不同(gradient 回声 vs 膝关节 MRI)。互链可展示实验室"2D 病理 → 3D 影像"的方法迁移路线。
- fastmri(23)——同影像部位、不同任务的对照:fastMRI knee 子集服务重建(k-space → 图像),3DReasonKnee 服务诊断推理。两者合看可覆盖"从采集到诊断"的膝关节 AI 管线全链。
第二梯队(FAQ 或正文单处引用):
- vqa-rad(240)/ slake(250)——论文 Related Work 明确引用的 2D VQA 基线,是论证"3D + 推理增量"的对照系;faq 与 §4 已引用。
- totalsegmentator(422)——附属资产同类:nnU-Net 分割掩码生态的参照系,互链语义是"掩码资产的任务边界"(解剖定位 vs 诊断推理)。
- gmai-mmbench(562)——多模态医学评测方法论互参:GMAI-Reasoning10K 是论文 Related Work 里与本数据集最近的血缘(推理链 VQA)。
第三梯队(编目互链,正文不强求):
- pmc-vqa(270)/ vqa-med(280)/ omnimedvqa(290)——2D VQA 家族扩展对照;
- radimagenet(545)——放射影像预训练生态位;
- osteosarcoma(188)——骨肌系统 MRI 数据集家族。
成稿互链优先级:正文 §9 与 FAQ 至少双向引用 oai(391)、rexgradient-160k(717)、fastmri(23)、vqa-rad(240)、slake(250)、totalsegmentator(422) 六条。
8.4 库外对标(不构成互链,仅背景)
论文 Related Work 引用的能力对标:MedTrinity-25M(25M 图文对预训练语料)、GMAI-Reasoning10K(10K 医学推理样本)、RadRBench-CXR(59K VQA + 301K 推理步,胸片)、MAIRA-2(胸片 grounded report)、M3D-LaMed / RadFM(3D 医学 VLM 训练源)、OpenBiomedVid(生物医学视频)。这些名字共同勾勒出"3DReasonKnee 之前的世界":每个资源解决一维,没人做三元交集。
§9 方法学启示:六条可迁移的经验
一、"专家种子 → 模型放大 → 专家裁决"是大规模 3D 标注的可行解。 100 例 × 4.5 小时的专家投入换 nnU-Net 分割器,再放大到 7,970 例——成本两个数量级的压缩。迁移条件有二:任务空间可被分割模型可靠覆盖(解剖结构分割是 nnU-Net 的主场);上游存在可挂接的专家评估成果(此处是 OAI 官方 MOAKS)。缺第二条时,放大的伪标签会失去"专家裁决"这层保真背书。
二、推理链资产的正确用法尚未定论,但错误用法已有实证。 w/ CoT vs w/o CoT 的对照(0.588 vs 0.613)给出了一个确定的负结果:把专家 CoT 直接混入 SFT 目标不涨反跌。可能的解释包括长序列稀释分级监督、CoT 文本风格与最终答案格式冲突、以及逐 token 交叉熵无法对"推理质量"建模。论文暗示 RL 等范式是下一步——对持类似 CoT 数据集的团队,这个对照实验设计(同一模型、唯一变量是 CoT 是否进损失)值得原样复制。
三、评测协议应把"定位"与"判别"拆开测。 ReasonKnee-Bench 的双指标设计(7 大类诊断准确率 + 3D IoU)加 GT region 消融,把"模型错了"拆解成"错在没找到"还是"找到了看错"——本次的答案是前者为主。任何 grounding 类任务的评测都应携带这种归因结构,单一总分掩盖的正是最有行动价值的差异。
四、"首个"卡位依赖三元交集的精确表述。 论文对空白的主张不是"首个 3D 医学数据集"或"首个医学 VQA",而是"3D 体数据 × 体素级定位 × 专家推理链"的交集为空。精确的限定词让"首个"经得起挑战(§4.4)——数据集论文写 positioning 时的模板句式。
五、纵向队列是医学 AI 数据集的优质矿脉。 本数据集与库内 oai(391)条目的共同经验:长期队列自带三样 AI 数据集最难自产的东西——标准化的采集协议(跨中心一致性)、经年积累的专家评分(免标注成本)、纵向随访(天然的时间维度)。AI 团队接入队列的方式从"自建标注"升级为"增值重打包",成本结构与数据质量同时受益。选矿原则:队列的评分体系越结构化(如 MOAKS 的"分区 × 病变 × 属性"三维结构),增值重打包的工程难度越低。
六、负结果要和正结果一起发布才有牵引力。 本论文的价值有一半在负结果(zero-shot 全线失守、CoT 入 SFT 反降、Med3DVLM 指令失效)——它们把社区从"榜单内卷"拉回"范式选择"(SFT → RL/过程监督)。数据集论文附完整的 baseline 失败分析,比只报最好成绩更能产生引用与后续工作,这份论文的组织方式本身就是模板。
§10 避坑清单:九个已踩过的坑
坑 1:HF size_categories 标签双口径互相矛盾。 HF API cardData.size_categories 写 10K<n<100K,API tags 数组却写 100K<n<1M——同一仓库两处标签打架,且都不精确(实际 494k 五元组)。处置:一切规模表述以论文实数 494k / 7,970 volumes 为准,标签口径仅存照;引用 HF 元数据时注明抓取时点与 sha。
坑 2:HuggingFace 主站直连失败。 沙箱/部分网络环境下 huggingface.co 被封锁,网页版与 API 均不通。处置:走 hf-mirror.com 镜像——API 端点 https://hf-mirror.com/api/datasets/rajpurkarlab/3DReasonKnee 与 raw README https://hf-mirror.com/datasets/rajpurkarlab/3DReasonKnee/raw/main/README.md 均可直接 curl(建议带浏览器 User-Agent)。镜像元数据与主站一致性经 sha 比对确认。
坑 3:masks.zip 是分卷文件,直下 404 心态崩。 仓库里没有单个 masks.zip,只有 masks_aa + masks_ab 两个分卷。处置:cat masks_aa masks_ab > masks.zip && unzip masks.zip;下载脚本要显式覆盖两个分卷,缺一不可解压。
坑 4:把"需 NDA 账号"误读为"数据集不可用"。 README 的 NDA 要求只针对上游 OAI 原始 DICOM(/data/OAI);数据集本体的 NIfTI + 五元组 + 掩码 CC BY 4.0 公开直链。处置:需求是训练/评测 VLM → 走 HF 直链即可;需求是复现 DICOM 预处理或扩展其他 OAI 序列 → 才去 nda.nih.gov 申请。
坑 5:论文许可想当然。 不少医学数据集论文是 CC BY-NC-ND 或 arXiv 默认许可,容易顺手写"论文 CC BY-NC"。处置:本条论文 HTML 页头实锤 License: CC BY 4.0——数据集与论文同许可,双双允许商用;引用时两处分开注明依据(HF 卡 frontmatter + arXiv 页头),不要合并成一句"均为 CC BY 4.0"而不给出处。
坑 6:摘要说 “five VLMs” 就硬凑五个名字。 论文摘要写 benchmark five state-of-the-art VLMs,但实验设置实名只有四类(Qwen2.5-VL-3B / Qwen2.5-VL-7B / o1 / Med3DVLM),“五"的口径来自变体行展开(Instruction Zero-shot / SFT w-o CoT / SFT w CoT)。处置:条目写"四类模型 + 设定变体”,并在存照节说明计数口径差;不虚构第五个模型名。
坑 7:Med3DVLM"医学专用"就默认它 zero-shot 能打。 论文实锤 Med3DVLM zero-shot 无法遵循指令给出有效输出(fail to follow the instructions and give valid outputs)。处置:引用其成绩时必须注明设定(SFT 后才有可比数字);"医学专用模型"与"指令遵循能力"是两个独立维度。
坑 8:nnU-Net Dice 数值论文正文查不到就想当然补。 各亚区 Dice 分数以 Figure 3b 图形呈现,纯文本抓取无法提取具体数值。处置:条目只定性表述"各亚区 Dice 见论文 Figure 3b",不编造数值;需要精确值的读者应查 PDF 原图。同理,ReasonKnee-Bench 未单列评测例数(在 test set 1,196 scans 上评估),不复述"X 例 Bench"这类无出处的数字。
坑 9:把 494k 五元组当 494k 独立影像。 494k 是"扫描 × 问题模板"组合后的样本数(7,970 扫描 × 62 模板 × 亚区命中数的量级),底层独立 volume 只有 7,970 份。处置:表述规模时双数字并列(494k 五元组 / 7,970 volumes),划分口径永远按扫描算(5,977/797/1,196)而非按五元组算,否则"无患者重叠"的防泄漏语义会失真。
坑点速查索引
| 坑 | 一句话 | 波及场景 |
|---|---|---|
| 1 | size_categories 标签矛盾,以论文实数为准 | 元数据引用、数据规模表述 |
| 2 | 主站被拦走 hf-mirror | 下载、CI、脚本 |
| 3 | masks 分卷需 cat 合并 | 掩码使用 |
| 4 | NDA 只挡原始 DICOM | 获取路径选择 |
| 5 | 论文也是 CC BY 4.0(别想当然) | 引用与许可声明 |
| 6 | "五个 VLM"实为四类+变体 | 论文转述 |
| 7 | Med3DVLM zero-shot 指令失效 | 基线比较 |
| 8 | Dice 数值/Bench 例数论文未列数字 | 数字核查 |
| 9 | 494k ≠ 494k 独立影像 | 规模表述与划分口径 |
§11 总结
3DReasonKnee 用"五元组"这个紧凑的形式,把一整套临床诊断认知流程——找到病灶、说出依据、给出分级——封装成了机器可学的监督信号。494k 条五元组背后是 7,970 份 3D 膝关节 DESS MRI、450+ 小时骨科专家时间、62 个对齐 MOAKS 的问题模板与 22 个解剖区域的系统覆盖。它不是膝关节数据集里最大的,不是 MOAKS 评分资源里最早的,但它是第一个把"3D 定位"与"专家推理"绑在同一条样本里的——这个交集此前为空,现在有了第一个可下载的实例。
它的价值有三层:作为训练资源,它是 3D 医学 VLM grounded reasoning 方向目前唯一的规模化监督源;作为评测基准,ReasonKnee-Bench 的双指标 + GT region 消融为"模型到底错在哪"提供了归因框架;作为方法论样本,它的"专家种子 → nnU-Net 放大 → 专家裁决"流水线、"w/ CoT vs w/o CoT"对照设计、以及对 zero-shot 全面失守的坦率报告,都是可迁移的公共知识。它的局限同样清晰:边界框是模型生成的(逐例金标准仅 100 例)、分级继承上游评估而无多标注者一致性实验、SFT 上限 0.613 远离临床、CoT 资产的正确打开方式仍在探索。
CC BY 4.0 的通透许可(数据与论文双确认、允许商用)让这些资产对所有使用者敞开。对千方病案医数集而言,它与上游 oai(391)、同门 rexgradient-160k(717)构成"队列 → 推理数据集"的完整血缘链,也把库内的 3D 医学影像条目从"分割与重建"扩展到了"定位推理"这一新任务象限。
一句话版本(供外部引用):3DReasonKnee 是首个 3D 医学定位推理数据集——494k 五元组(7,970 例 OAI 膝关节 DESS MRI × 62 个 MOAKS 对齐问题 × 22 解剖区域),每条含 3D 影像、诊断问题、边界框、专家思维链与结构化分级,450+ 小时专家时间构建,ReasonKnee-Bench 显示当前 VLM 在定位与分级上双重失守(zero-shot 最佳 0.477,SFT 最佳 0.613),CC BY 4.0 公开。
FAQ(高频问答 40 问)
Q1:3DReasonKnee 的"3D"体现在哪里?
三个层面:输入是 3D volume(160 层 DESS 序列,非单张切片);定位输出是 3D bounding box(六个分量含起止层号);推理过程要求跨层理解立体结构(论文引言强调 VLM 需"在多个平面理解 3D 结构")。这是它与 2D 医学 VQA 数据集的根本区别。
Q2:"grounded reasoning"到底是什么意思?
直译"有根据的推理":模型的推理必须锚定在具体解剖位置上。本数据集的操作定义是三件套同时输出——bounding box(在哪)、CoT(怎么想)、MOAKS 分级(结论)。只有答案没有定位,是普通 VQA;只有分割没有推理,是分割任务;两者耦合才是 grounded reasoning。
Q3:为什么选膝关节?
膝骨关节炎(knee osteoarthritis)是全球最常见的关节疾病之一,MRI 评估有成熟的标准体系(MOAKS),且 OAI 队列提供了大规模、多时间点、带专家裁决评分的公开影像——标准明确 + 数据充足 + 临床需求大,三条件齐备。
Q4:DESS 是什么序列?为什么用它?
Double Echo Steady State,双回波稳态序列,三维采集、各向同性分辨率高、软骨与滑液对比度好,是膝关节软骨形态评估的标准序列。OAI 队列常规采集 DESS,每份固定 160 层。
Q5:MOAKS 评分体系具体评什么?
MRI Osteoarthritis Knee Score,半定量评分,覆盖:骨骨髓病变(BML,15 亚区,按 size/数量/百分比)、软骨缺损(14 亚区,size 0-3 + 全层缺失 depth 0-3)、骨赘(16 亚区)、半月板损伤(6 亚区)、韧带/肌腱(3 结构)、Hoffa 滑膜炎、渗出-滑膜炎、关节周特征。本数据集的 62 个问题模板即对齐这些组件。
Q6:494k 这个数字怎么构成的?
7,970 份扫描 × 62 个问题模板 × 各扫描实际命中的"病变-亚区"组合,展开成 494,000 条五元组。平均每份扫描约 62 条五元组(494,000 / 7,970 ≈ 62)。注意底层独立影像只有 7,970 份——494k 是"影像 × 问题"的样本数,不是独立影像数。
Q7:450+ 小时专家时间花在哪了?
大头在 100 例高保真子集的手工分割:2 位 board-certified radiologists + 1 位 orthopedic surgeon,每人每例约 4.5 小时,100 例约 450 小时;其余为资深骨科医生撰写 62 个问题模板与全部思维链的时间。论文口径是"over 450 hours"合并表述。
Q8:为什么只有 100 例手工分割,其余 7,870 例的框是怎么来的?
杠杆设计:100 例手工分割训练 nnU-Net,再由模型对全部 7,970 例自动生成分割掩码与 3D bounding boxes(伪标签)。MOAKS 分级不经过这条放大链——它直接继承 OAI 官方专家裁决评估。
Q9:nnU-Net 的分割质量如何?
论文 Figure 3b 以 Dice 分数逐亚区呈现,图形显示各亚区分割质量良好;具体数值为图形呈现、纯文本不可提取(§10 坑 8),需精确值的读者查论文 PDF 原图。使用者应记住:7,970 例的框精度上限由该 Dice 水平决定。
Q10:数据划分是怎么做的?
按扫描划分:train 5,977(75%)/ val 797(10%)/ test 1,196(15%),官方保证无患者重叠(no patient overlap)。划分清单在 HF 仓库 split_files/,含 patient_id 等字段,建议直接使用官方划分。
Q11:同一患者多个时间点的扫描怎么处理的?
OAI 是纵向队列(baseline、12/24/36/48 个月随访),同一患者会贡献多份扫描。官方划分按患者分组保证了同一患者的扫描不跨 train/val/test。数据集内 patient_id 与 time 字段可还原时间线——这也是它能支撑"随访对照"类研究的原因。
Q12:62 个问题模板长什么样?
每个模板指向一个"解剖亚区 × 病变类别"组合,要求模型定位并按 MOAKS 分级。zero-shot 评测用的提示示例(论文原文):“In this DESS MRI, identify and grade the osteophyte at the patella lateral subregion. Provide your reasoning, and the MOAKS grade.”——在此 DESS MRI 中,识别并分级髌骨外侧亚区的骨赘,给出推理与 MOAKS 分级。
Q13:CoT(思维链)是谁写的?质量如何保证?
一位 board-certified orthopedic surgeon、膝外科经验 7 年以上。撰写流程:先描述病变在 DESS 上的关键病理特征与鉴别点,再按 MOAKS 标准把观察翻译成分级条件与依据。质量保证是"资深专科医生一手撰写"而非模型生成或众包——这是论文宣称 superior quality 的核心依据。
Q14:CoT 是英文的吗?
是。数据集语言为英文(HF 卡 language: en),问题与思维链均为英文临床表述。中文团队使用时需注意术语映射(见本条目术语表)。
Q15:final_diagnosis 字段的结构是什么?
JSON 对象,键为"亚区 + 病变"命名字符串(如 femur medial central cartilage lesion),值为属性-分级字典(如 {"size": 0, "depth": 0})。不同病变类别的属性集不同(软骨有 size/depth,BML 有 size/数量/百分比),故用字典而非固定 schema。
Q16:3D bounding box 的六个数字分别是什么?
[start_slice, end_slice, x_min, x_max, y_min, y_max]——前两个是层号范围(z 轴),后四个是面内像素坐标范围。示例 [83, 141, 117, 261, 154, 258] 表示第 83-141 层、x 117-261、y 154-258 的体积窗口。
Q17:分割掩码(masks.zip)里有什么?
nnU-Net 对全部 7,970 例生成的逐亚区分割:ACL、PCL、股骨/胫骨/髌骨及其软骨、内外侧半月板、髌腱、渗出-滑膜炎、Hoffa 滑膜炎及各方位细分亚区。下载后需 cat masks_aa masks_ab > masks.zip 合并解压。
Q18:OAI 数据集本身是什么?
Osteoarthritis Initiative,美国 NIAMS 资助的多中心纵向队列研究,4,796 名 45-79 岁受试者(58% 女性,平均 61.4 岁),45,000+ 份 MRI,随访多年,配套影像评分与临床数据。原始数据需 NDA 账号(nda.nih.gov/oai)。库内 rid 391 有专条。
Q19:3DReasonKnee 与 OAI 原始数据的区别?
OAI 给"影像 + 评分 + 临床随访",没有推理链与定位框;3DReasonKnee 在其 DESS 子集上加了 3D bounding box、专家 CoT 与结构化的五元组组织形式,并按 ML 任务需求做了划分与文件重组。血缘上 3DReasonKnee ⊂ OAI。
Q20:license 能商用吗?有什么条件?
能。数据集 CC BY 4.0(README License 节明文列出 Commercial use),论文也 CC BY 4.0。唯一条件是适当署名——建议署论文(arXiv:2510.20967)+ HF 仓库 + GitHub 仓库。上游 OAI 原始 DICOM 另有其数据使用协议,但那只在你要动 DICOM 时才相关。
Q21:数据在哪里下载?怎么加载?
HF:rajpurkarlab/3DReasonKnee(gated=false 公开直链);代码:GitHub sungeunkim0127/3DReasonKnee。加载骨架见附录 F。大陆环境走 hf-mirror.com 同路径镜像。
Q22:ReasonKnee-Bench 是独立下载的数据集吗?
不是独立资产——它是论文定义的评测协议(在 test set 1,196 scans 上,按 7 大类诊断准确率 + 3D IoU 两指标评测),配套的划分与问题文件就在 HF 仓库内。论文未单列"Bench 例数",复现时按官方 split_files 抽取 test 集。
Q23:zero-shot 成绩为什么这么差?
论文失败分析给出主因:grounding 失效——模型找不对解剖区域,后续分级自然错误;喂 ground-truth region 后成绩显著回升。次要因素包括 3D 体数据的输入表示(通用 VLM 靠视频输入通道承载 3D)、MOAKS 分级的细粒度属性空间、以及专业影像特征的领域鸿沟。
Q24:SFT 后 0.613 够用吗?
不够。论文将其定位为 baseline(基线性能),明确"远低于临床可接受水平"(fall short of clinically acceptable performance)。0.613 的价值在于证明五元组的监督信号有效(从 0.158 跃升)并给出可对照的基准线,而非可部署成绩。
Q25:为什么加 CoT 的 SFT 反而降分?
论文的解释:专家 CoT 的价值"可能需要标准 SFT 之外的训练范式才能更有效释放"(如 RL)。直觉上的机制:长推理链进入逐 token 交叉熵目标后,稀释了对最终分级的监督权重,且模型可能学会复述推理文体而不提升判别质量。这是该数据集最有方法论价值的负结果。
Q26:Med3DVLM 表现如何?
zero-shot 下无法遵循指令给出有效输出(论文原文口径),诊断准确率表无其 zero-shot 行;SFT 后 w/o CoT 0.596、w/ CoT 0.581,均略低于同设定的 Qwen2.5VL-3B。但它的 IoU-诊断准确率正相关最强——定位与判别的联动质量最高,值得在改进工作中单独关注。
Q27:IoU 和诊断准确率的关系是什么?
在受监督模型中呈清晰正相关:定位越准,分级越对。Med3DVLM(w/ CoT)正相关最强。这支持"先修定位、再修分级"的改进优先序,也说明 ReasonKnee-Bench 双指标设计(分别测两者)能暴露单指标掩盖的短板。
Q28:数据里正常样本多吗?类别平衡吗?
保留自然临床变异——大量 0 级(正常)样本与各等级病变共存(论文 Figure 4a)。示例五元组即有 size 0 / depth 0 的正常例。训练时应从 labels.json 统计实际分布并考虑重采样/损失加权。论文未给逐类精确占比表。
Q29:可以做骨科教学或患者教育用途吗?
数据集本体 CC BY 4.0 允许各类使用(含商用),教学用途无许可障碍;但注意:(1) 450+ 小时投入的专家 CoT 用于教学是高价值场景;(2) 涉及上游 OAI 影像的再分发建议同时注明 OAI 来源与其协议;(3) 医学内容免责声明仍需自行添加。
Q30:与 fastMRI 的膝关节数据有何不同?
fastMRI knee 子集的目标任务是重建(加速 MRI 的 k-space → 图像),不携带诊断标注;3DReasonKnee 的图像已是诊断级 DESS,目标是定位推理。两者互补:可用 fastMRI 研究重建、用 3DReasonKnee 研究诊断。
Q31:想复现论文实验,代码在哪?
GitHub sungeunkim0127/3DReasonKnee:code/sft(监督微调)、code/zero_shot(zero-shot 评测);论文 §4 写明 “Implementation details are available at rajpurkarlab/3DReasonKnee”。数据预处理脚本 dcm2nifti.py 亦在仓库内(复现需 OAI 原始 DICOM + NDA 账号)。
Q32:这份数据集最大的局限是什么?
按论文自述与条目核验综合:(1) 边界框为模型生成,逐例专家金标准仅 100 例;(2) MOAKS 分级继承上游、无新增多标注者一致性实验;(3) 单一评分体系(MOAKS)与单一序列(DESS)、单一部位(膝);(4) SFT 上限远离临床;(5) HF 卡 size_categories 标签失真(以论文实数为准)。使用前对照 §10 坑清单逐项排查。
Q33:494k 五元组能直接喂给 HF datasets 的 load_dataset 吗?
五元组的 JSON 部分可以;但 3D NIfTI 体数据不是 HF 标准图像列,需要自定义加载器(读 .nii.gz → 张量)。官方未提供 HF datasets 原生加载脚本(DAIMS 扣分项之一),建议参考 GitHub code/ 内的数据管线或附录 F 骨架自建。
Q34:一份数据能同时做定位、推理、分级三个任务的训练吗?
设计上可以——五元组三要素齐备。但建议分阶段:先只用 (I, Q, B) 训定位头(IoU 监督),再叠分级;CoT 按论文证据暂不进 SFT 损失(§6.3),留作 RL 奖励模型或过程监督的语料。三任务端到端一把梭的效果没有实验支撑。
Q35:有多少患者?能做患者级分析吗?
论文未明示 7,970 份扫描对应多少 unique 患者(上限 4,796)。split_files 的 patient_id 字段可自行去重统计。患者级分析(如病变进展)受随访时间窗限制(baseline~48 个月),且同一患者的 MOAKS 纵向变化要经 OAI 官方口径核对。
Q36:左右膝都有吗?膝别信息在哪?
在。split_files 含 knee_side 字段——双膝受试者同一时间点可贡献两份扫描。OAI 队列本身采集双侧膝,本数据集的 22 个解剖区域描述不区分膝别,建模时可把 knee_side 作为元数据保留。
Q37:想加自己的标注(如新的病变类型)怎么扩?
路径:用随仓库的 nnU-Net 掩码作底 → 新类别走小规模专家精标 → 重训或增量训练分割器 → 挂接新问题模板(question_files 加条目)。上游 OAI 若还需其他序列(如 T2),则需 NDA 账号从源头取。扩展部分与原数据的许可兼容(派生作品 CC BY 4.0 继续开放)。
Q38:这篇论文有没有同行评审版本?
本轮核验(2026-09-30)时为 arXiv 预印本 v1(cs.CV),未检索到期刊正式发表记录。引用时以 arXiv DOI 为准;若后续见刊,以期刊版为准更新。
Q39:与其他膝 OA 数据集(MOST、OAI 官方评分包)怎么选?
做 AI 推理训练/评测 → 3DReasonKnee(唯一带 CoT 与定位);做流行病学与临床统计 → OAI/MOST 原始队列(样本更大、变量更全);做分割算法研究 → 本数据集 masks 或库内 totalsegmentator。三者不互斥,键在任务形式。
Q40:条目里"待核"的数字会影响使用吗?
不影响主流程。待核项(nnU-Net 逐亚区 Dice 数值、Bench 单列例数、unique 患者数)都是"论文图形呈现/未披露"的性质,核心使用链路(下载、加载、训练、评测)不依赖它们;需要时按附录 C 证据链自查原图或实测。
事实清单(硬事实 40 条)
- 数据集名:3DReasonKnee;论文题同名:3DReasonKnee: Advancing Grounded Reasoning in Medical Vision Language Models
- arXiv 编号 2510.20967,v1 唯一版本,2025-10-23 提交(19:54:49 UTC),DOI 10.48550/arXiv.2510.20967
- 学科分类 cs.CV(主)+ cs.AI(交叉)
- 作者 8 人:Sraavya Sambara*、Sung Eun Kim*(共同一作)、Xiaoman Zhang、Luyang Luo、Shreya Johri、Mohammed Baharoon、Du Hyun Ro、Pranav Rajpurkar
- 机构:Harvard Medical School 生物医学信息学系 + Seoul National University Hospital
- 论文本体许可 CC BY 4.0(arXiv HTML 页头实锤)
- 数据集许可 CC BY 4.0(HF 卡 frontmatter + README License 节双确认,明文允许商用)
- HF 仓库 rajpurkarlab/3DReasonKnee,gated=false,sha 7a611f92fd3ad3954e8b62feef49ee12bfef725a
- GitHub 仓库 sungeunkim0127/3DReasonKnee(code/sft + code/zero_shot)
- 494k 五元组(quintuples {I, Q, B, C, D})
- 7,970 份 3D 膝关节 DESS MRI volumes,每份 160 slices
- 上游 OAI:4,796 受试者(58% 女性;45-79 岁;平均 61.4 岁),45,000+ MRI
- 取材窗口:baseline 至 48 个月随访
- 划分:train 5,977(75%)/ val 797(10%)/ test 1,196(15%),无患者重叠
- 62 个 distinct 临床 instruction tuning 问题模板
- 22 个 distinct 解剖区域
- MOAKS 覆盖:BML 15 亚区 / 软骨 14 亚区 / 骨赘 16 亚区 / 半月板 6 亚区 / 韧带肌腱 3 结构 / Hoffa 滑膜炎 / 渗出-滑膜炎 / 关节周特征
- 标注团队:2 位 board-certified radiologists + 1 位 orthopedic surgeon(手工分割);1 位 7+ 年经验骨科医生(问题 + CoT)
- 每例手工分割约 4.5 专家小时;高保真子集 100 例
- 专家总投入 450+ 小时
- 分割模型:nnU-Net(100 例训练 → 全量自动生成)
- MOAKS 分级继承 OAI 官方专家裁决评估
- bounding box 格式 [start_slice, end_slice, x_min, x_max, y_min, y_max];示例 [83, 141, 117, 261, 154, 258]
- HF 字段:image / prompt / answer / cot / final_diagnosis
- 示例 final_diagnosis:{“femur medial central cartilage lesion”: {“size”: 0, “depth”: 0}}
- ReasonKnee-Bench 双指标:7 大类 MOAKS 诊断准确率 + 3D IoU
- zero-shot overall:Qwen2.5VL-3B 0.158 / Qwen2.5VL-7B 0.470 / o1 0.477 / 3B Instruction 0.146
- o1 评测版本 2024-12-01-preview(Azure)
- Med3DVLM zero-shot 无法遵循指令给出有效输出
- SFT overall:3B w/o CoT 0.613(最佳)/ Med3DVLM w/o CoT 0.596 / 3B w/ CoT 0.588 / Med3DVLM w/ CoT 0.581
- supervised 模型 IoU-诊断准确率正相关;Med3DVLM(w/ CoT)正相关最强
- 失败主因:grounding;提供 GT region 后性能显著提升(7B 0.470 → 0.556)
- masks.zip 为分卷(masks_aa + masks_ab),合并命令 cat masks_aa masks_ab > masks.zip
- 上游 OAI 原始 DICOM 需 NDA 账号(nda.nih.gov/oai/query-download)
- HF lastModified 2026-05-10;downloads 1,105 / likes 10(2026-09-30 抓取)
- HF size_categories 双口径:cardData 10K<n<100K vs API tags 100K<n<1M(均不精确,以论文 494k 为准)
- 五元组形式化 {I, Q, B, C, D},任务记作 (B̂, Ĉ, D̂) = M(I, Q),结构化诊断 D 按属性专属 grade space 取值
- 仓库附 dcm2nifti.py 预处理脚本;generate_data/ 含数据生成脚本
- SFT w/ GT region 变体:7B 0.556;逐类 Meniscus 仍仅 0.166——分级难度不止来自定位
- HF 卡语言标注 en;论文摘要口径 “five state-of-the-art VLMs”(实验设置实名四类 + 变体)
术语表(35 条)
| # | 术语 | 英文 | 释义 |
|---|---|---|---|
| 1 | 定位推理 | grounded reasoning | 推理锚定于具体解剖位置的 AI 任务范式:输出=定位+过程+结论 |
| 2 | 五元组 | quintuple | 本数据集样本单位 {I, Q, B, C, D}:影像/问题/框/思维链/分级 |
| 3 | 视觉语言模型 | VLM (Vision-Language Model) | 同时处理图像与文本的多模态模型 |
| 4 | 思维链 | CoT (Chain-of-Thought) | 逐步推理文本;本数据集由资深骨科医生人工撰写 |
| 5 | MOAKS | MRI Osteoarthritis Knee Score | 膝骨关节炎 MRI 半定量评分国际标准 |
| 6 | 骨关节炎倡议 | OAI (Osteoarthritis Initiative) | 美国 NIAMS 资助的膝骨关节炎纵向队列(4,796 人) |
| 7 | 双回波稳态 | DESS (Double Echo Steady State) | 三维梯度回波 MRI 序列,软骨显示佳,160 层/卷 |
| 8 | 骨骨髓病变 | BML (Bone Marrow Lesion) | 骨髓内信号异常(水肿样),骨关节炎疼痛相关标志 |
| 9 | 骨赘 | osteophyte | 关节边缘骨性增生,骨关节炎影像学标志之一 |
| 10 | 半月板 | meniscus | 膝关节纤维软骨垫,内侧/外侧各一 |
| 11 | 滑膜炎 | synovitis | 关节滑膜炎症;MOAKS 评 Hoffa 与渗出-滑膜炎 |
| 12 | 全层缺失 | full-thickness loss | 软骨缺损深达骨面;depth 分级的核心语义 |
| 13 | 亚区 | subregion | 解剖结构的细分区(如股骨内侧中央),MOAKS 按亚区计分 |
| 14 | 3D 交并比 | 3D IoU | 两个 3D 框体积交并比,定位评测指标 |
| 15 | 监督微调 | SFT (Supervised Fine-Tuning) | 用标注数据微调预训练模型 |
| 16 | 指令微调 | instruction tuning | 以指令-回答对训练模型遵循任务指令 |
| 17 | zero-shot | zero-shot | 不给任何任务示例直接评测 |
| 18 | 伪标签 | pseudo label | 模型生成的标注(此处为 nnU-Net 自动框) |
| 19 | nnU-Net | nnU-Net | 自配置医学图像分割框架(Isensee et al.) |
| 20 | Dice 分数 | Dice score | 分割重叠度指标,1 为完全重合 |
| 21 | 患者无重叠 | no patient overlap | 划分时同一患者的数据不跨 train/test,防泄漏 |
| 22 | 专家裁决 | expert-adjudicated | 由专家最终裁定确认的评估口径 |
| 23 | 纵向队列 | longitudinal cohort | 对同一批受试者多年重复随访的研究设计 |
| 24 | NDA | National Data Archive | 美国 NIH 的数据档案系统,OAI 数据经其发放 |
| 25 | NIfTI | Neuroimaging Informatics Technology Initiative | 医学影像常用格式(.nii.gz) |
| 26 | DICOM | Digital Imaging and Communications in Medicine | 医学影像原始标准格式 |
| 27 | 高保真子集 | high-fidelity subset | 逐例专家精标的 100 例子集 |
| 28 | 分卷压缩 | split archive | 大文件切分为 aa/ab 分卷,cat 合并还原 |
| 29 | 数据集卡 | dataset card | HF 仓库的说明文档(README frontmatter + 正文) |
| 30 | 镜像站 | mirror | 主站不可达时的等价访问入口(如 hf-mirror.com) |
| 31 | 过程监督 | process supervision | 对推理步骤(而非仅最终答案)施加训练信号 |
| 32 | 类别不平衡 | class imbalance | 各分级样本数悬殊;本数据集保留自然临床分布所致 |
| 33 | 指令遵循 | instruction following | 模型按提示格式与任务要求输出的能力;Med3DVLM zero-shot 反例 |
| 34 | 数据使用协议 | DUA (Data Use Agreement) | OAI/NDA 体系下获取原始数据的法律文件 |
| 35 | 多实例标注 | multi-instance annotation | 同一患者贡献多份扫描(多时间点/双膝)的数据形态 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | 3DReasonKnee |
| url_name | 3dreasonknee |
| 类型 | 数据集 + 方法论文 + 评测基准(三合一) |
| 论文 | arXiv:2510.20967(2025-10-23,v1),DOI 10.48550/arXiv.2510.20967 |
| 团队 | Harvard Medical School DBMI(rajpurkarlab)+ Seoul National University Hospital |
| 规模 | 494k 五元组 / 7,970 volumes(DESS,160 slices)/ 62 模板 × 22 区域 |
| 划分 | 5,977 / 797 / 1,196(无患者重叠) |
| 许可 | CC BY 4.0(数据集与论文同许可,允许商用) |
| HF | rajpurkarlab/3DReasonKnee(gated=false,sha 7a611f92…) |
| GitHub | sungeunkim0127/3DReasonKnee |
| 抓取时点 | 2026-09-30 |
| 库内互链 | oai(391)/rexgradient-160k(717)/fastmri(23)/vqa-rad(240)/slake(250)/totalsegmentator(422)/gmai-mmbench(562) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | arXiv + HF + GitHub 三入口齐备,论文标题即数据集名检索直达;"3DReasonKnee"无撞名干扰 |
| A 可获取性 | 9 | HF 公开直链 gated=false、CC BY 4.0 允许商用、无需注册审批;唯一扣分:masks 需分卷合并、上游 DICOM 需 NDA(非本体障碍) |
| I 可互操作 | 8 | NIfTI + JSON 标准格式、字段结构清晰(image/prompt/answer/cot/final_diagnosis)、提供 dcm2nifti 转换脚本;扣分:无官方 HF datasets 流式加载器,3D 体数据需自建 DataPipe |
| M 元数据质量 | 7 | 论文表格完备(任务形式化/划分/结果三表);README 含完整目录结构与示例;扣分:HF size_categories 标签双口径失真(坑 1)、masks 分卷无版本号 |
| S 可持续性 | 7 | 学术机构维护、论文发表后仍更新(lastModified 2026-05);上游 OAI 由 NIH 体系长期保障;扣分:单一 GitHub 个人账号承载代码 |
| 综合评级 | 7.8/10(良好) | 许可与入口是同规模 3D 医学数据集中最优档;失分集中在元数据标签失真与加载工具链缺位 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 494k 五元组 / 7,970 volumes | 论文摘要 | arXiv:2510.20967 abs 页 |
| 160 slices / DESS / baseline~48 个月 | 论文 §3.2 Data Source | arXiv HTML 全文 |
| 5,977/797/1,196 无患者重叠 | 论文 §3.4 Data Split | arXiv HTML 全文 |
| 62 模板 / 22 区域 | 论文摘要 + §3.1 | arXiv abs + HTML |
| MOAKS 亚区数(15/14/16/6/3) | 论文 §3.2 | arXiv HTML 全文 |
| 4.5h/例 × 100 例 / 450+ 小时 | 论文 §3.2 3D Bounding Box Generation | arXiv HTML 全文 |
| 2 rad + 1 orthopedic surgeon | 论文 §3.2 | arXiv HTML 全文 |
| 7+ 年骨科医生撰写 62 问题与 CoT | 论文 §3.2 Expert Question Development | arXiv HTML 全文 |
| zero-shot 0.158/0.470/0.477 | 论文 §4 结果表 | arXiv HTML 全文 |
| SFT 0.613/0.596/0.588/0.581 | 论文 §4 结果表 | arXiv HTML 全文 |
| Med3DVLM IoU-准确率正相关最强 | 论文 §4 结果讨论 | arXiv HTML 全文 |
| grounding 主失败点 / GT region 回升 | 论文 §4 Failure Modes | arXiv HTML 全文 |
| 论文 CC BY 4.0 | HTML 页头版权行 | arXiv HTML |
| 数据集 CC BY 4.0(商用许可原文) | HF README License 节 | hf-mirror raw README 2026-09-30 |
| 五元组字段/示例/bbox 格式 | HF README + 示例数据 | hf-mirror raw README 2026-09-30 |
| sha/lastModified/downloads | HF API | hf-mirror API 2026-09-30 |
| masks 分卷合并命令 | HF README | hf-mirror raw README 2026-09-30 |
| NDA 账号要求(上游 DICOM) | HF README | hf-mirror raw README 2026-09-30 |
附录 D:数据获取决策树
你的需求是什么?
├── 训练/评测 3D 医学 VLM(定位推理任务)
│ └── HF 直下全量(CC BY 4.0)
│ ├── 五元组 + question_files + split_files(必下)
│ ├── images(NIfTI,主体体积)
│ └── masks_aa/ab → cat 合并 → unzip(需分割掩码时)
├── 只要 ReasonKnee-Bench 评测
│ └── 下载 split_files + question_files + images
│ └── 按 test split(1,196 scans)+ 双指标协议评测
├── 复现论文全部实验(含预处理)
│ ├── HF 数据 + GitHub 代码(code/sft + code/zero_shot)
│ └── 若需 dcm2nifti 复跑:NDA 账号 → OAI 原始 DICOM
├── 只想引用"CoT 进 SFT 反降"论点
│ └── 引论文 §4 结果表(0.613 vs 0.588)+ Discussion 口径
└── 想沿用 OAI 其余序列/模态
└── 走 oai 原始通道(NDA),与本数据集 CC BY 4.0 无关
附录 E:MOAKS 组件 × grade space 速查
| 组件 | 亚区数 | 分级属性 | grade space |
|---|---|---|---|
| 骨骨髓病变(BML) | 15 | size(表面积占比)/ 数量 / 百分比 | size 0-3(0 无 / 1 <10% / 2 10-75% / 3 >75%) |
| 软骨病变 | 14 | size / depth(全层缺失) | size 0-3;depth 0-3 |
| 骨赘 | 16 | 大小分级 | 0-3 |
| 半月板损伤 | 6 | 撕裂/形态分级 | 按撕裂类型与程度 |
| 韧带/肌腱 | 3 结构 | 损伤分级 | 按结构各自标准 |
| Hoffa 滑膜炎 | — | 程度分级 | 0-3 |
| 渗出-滑膜炎 | — | 程度分级 | 0-3 |
| 关节周特征 | — | 各特征标准 | 按特征各自标准 |
注:逐属性 grade space 的机器可读定义在 HF 仓库 question_files/grade_dict.json,构建训练目标时以该文件为准;上表为人读速查版。骨骨髓病变的 size 分级沿用 MOAKS 标准三档阈值,与软骨 size 一致(<10% / 10-75% / >75%)。
附录 F:五元组加载与训练样本构造骨架(代码)
import json
from pathlib import Path
REPO = Path("/data/3DReasonKnee") # 按实际挂载路径调整
def load_quintuples(split: str = "train"):
"""按官方划分加载五元组。split_files 每行含 patient_id 等字段。"""
import csv
split_rows = []
with open(REPO / "data/split_files" / f"{split}.csv", newline="") as f:
for row in csv.DictReader(f):
split_rows.append(row) # patient_id/time/study_folder/.../image_filepath
# question_files 提供模板与映射
questions = json.load(open(REPO / "data/question_files/questions.json"))
grade_dict = json.load(open(REPO / "data/question_files/grade_dict.json"))
q_subregion = json.load(open(REPO / "data/question_files/question_subregion_mapping.json"))
return split_rows, questions, grade_dict, q_subregion
def make_training_sample(quintuple: dict):
"""(I, Q) -> (B, C, D) 三目标构造。
image: NIfTI 路径;prompt: 问题;cot: 专家思维链;
final_diagnosis: 结构化分级 JSON;bbox: [z0, z1, x0, x1, y0, y1]
"""
return {
"input_volume": quintuple["image"], # .nii.gz,160 slices
"question": quintuple["prompt"],
"targets": {
"bbox": quintuple["bounding_box"], # 3D 定位
"cot": quintuple["cot"], # 推理过程(建议按坑 7/§9.2 审慎入损失)
"diagnosis": quintuple["final_diagnosis"] # 逐属性 MOAKS 分级
},
}
注意:bounding_box 与 final_diagnosis 的具体承载字段名以实际下载版本的数据文件为准(示例口径见 HF README),上表字段名为论文形式化 {I,Q,B,C,D} 与 HF 卡示例的对应关系。
附录 G:ReasonKnee-Bench 评测复现骨架(代码)
import numpy as np
def iou_3d(pred_box, gt_box):
"""pred_box/gt_box: [z0, z1, x0, x1, y0, y1]"""
inter_z = max(0, min(pred_box[1], gt_box[1]) - max(pred_box[0], gt_box[0]))
inter_x = max(0, min(pred_box[3], gt_box[3]) - max(pred_box[2], gt_box[2]))
inter_y = max(0, min(pred_box[5], gt_box[5]) - max(pred_box[4], gt_box[4]))
inter = inter_z * inter_x * inter_y
if inter == 0:
return 0.0
vol_p = (pred_box[1]-pred_box[0]) * (pred_box[3]-pred_box[2]) * (pred_box[5]-pred_box[4])
vol_g = (gt_box[1]-gt_box[0]) * (gt_box[3]-gt_box[2]) * (gt_box[5]-gt_box[4])
return inter / (vol_p + vol_g - inter)
# 指标一:7 大类 MOAKS 分级准确率(macro 平均前逐类统计)
CATEGORIES = ["BML", "Cartilage", "Osteophyte", "Meniscus",
"Ligaments&Tendons", "Synovitis&Effusion", "Periarticular"]
# 指标二:3D IoU(上函数),与 GT region 消融对照做失败归因
# 官方完整协议以 GitHub code/zero_shot 为准,本骨架仅供理解指标定义
附录 H:术语中英对照速查(写作/翻译用)
| 中文 | 英文(首现形式) |
|---|---|
| 定位推理 | grounded reasoning |
| 五元组 | quintuple |
| 膝骨关节炎 | knee osteoarthritis |
| 骨骨髓病变 | bone marrow lesion (BML) |
| 软骨缺损 | cartilage lesion |
| 半月板损伤 | meniscal damage |
| 骨赘 | osteophyte |
| 关节周特征 | periarticular features |
| 解剖区域 | anatomical region |
| 体积边界框 | volumetric bounding box |
| 严重度分级 | severity grade |
| 分级空间 | grade space |
| 专家裁决评估 | expert-adjudicated assessment |
| 高保真子集 | high-fidelity subset |
| 无患者重叠 | no patient overlap |
附录 I:OAI 队列详介(上游血缘档案)
| 维度 | 内容 |
|---|---|
| 全称 | Osteoarthritis Initiative(骨关节炎倡议) |
| 资助 | 美国 NIH 下属 NIAMS(国立关节炎与肌肉骨骼及皮肤病研究所) |
| 设计 | 多中心前瞻性纵向观察研究(非干预) |
| 规模 | 4,796 名受试者;45,000+ 份 MRI 扫描 |
| 人口学 | 45-79 岁入组;58% 女性;平均 61.4 岁 |
| 影像协议 | 双膝 MRI 标准化协议(含 DESS 等多序列);多时间点随访 |
| 评分体系 | 官方组织的专家裁决半定量评分(含 MOAKS 口径的 BML/软骨/骨赘/半月板/滑膜炎分量) |
| 获取 | NDA 账号 + 数据使用协议(nda.nih.gov/oai/query-download) |
| 与本数据集关系 | 3DReasonKnee 取其 baseline~48 个月 DESS 子集(7,970 份)做推理增强重打包 |
对使用者的含义:OAI 是膝骨关节炎 AI 研究的公共基础设施,3DReasonKnee 是其在"定位推理"方向的一次增值重打包。需要更大样本、更多序列、更全临床变量的研究直接回 OAI 本体(库内 rid 391 条目)取数;需要即取即用的推理监督信号则用本数据集。
附录 J:3D 体数据的输入表示方案(建模者参考)
被测模型用视频通道承载 160 层 DESS(论文口径),这是当前通用 VLM 吃 3D 体数据的主流迁移法。其他可选方案与权衡:
| 方案 | 做法 | 优点 | 代价 |
|---|---|---|---|
| 视频帧序列(论文采用) | 160 层作为 160 帧 → VLM 视频通道 | 零改动复用预训练权重 | 层间几何仅靠时序位置编码隐式表达 |
| 多视图拼接 | 轴/冠/矢三平面各取代表层拼 2D 网格 | 显存友好、几何直观 | 丢失层间连续性信息 |
| 逐层独立 | 每层当独立 2D 样本 | 数据量放大 160 倍 | 完全破坏 3D 语义,仅适合预训练 |
| 3D 原生骨干 | 3D ViT/CNN 编码器 + LLM 头 | 几何保真 | 需重训、背离通用 VLM 生态(Med3DVLM 路线) |
| 体素 token 化 | 3D patch tokenizer → 序列输入 | 理论最优 | 序列长度爆炸(160³ 级 patch),工程门槛高 |
ReasonKnee-Bench 的失败模式(grounding 主因)部分可归因于方案一对几何的弱表达——提供 GT region 后回升即旁证。改进工作可优先尝试:稀疏采样关键层 + bbox 区域放大重读(两阶段 grounding)、或 3D 原生编码器替换视觉前端。
附录 K:膝关节数据集对照速查
| 数据集 | 模态/任务 | 规模 | 标注类型 | 许可口径 | 库内 rid |
|---|---|---|---|---|---|
| OAI(队列本体) | MRI/流行病学+评分 | 4,796 人、45,000+ MRI | 专家裁决评分+临床变量 | NDA 协议 | 391 |
| 3DReasonKnee(本条) | 3D DESS MRI/定位推理 | 494k 五元组、7,970 卷 | 框+CoT+MOAKS 分级 | CC BY 4.0 | — |
| fastMRI(knee 子集) | MRI/重建 | k-space+图像对 | 无诊断标注 | fastMRI 协议 | 23 |
| osteosarcoma | MRI/肿瘤分割 | 肿瘤例 | 分割掩码 | 见库内条目 | 188 |
| totalsegmentator | CT/全身分割 | 100+ 结构 | 逐结构掩码 | 见库内条目 | 422 |
| vqa-rad | 2D X光/CT/VQA | 3,515 QA | 短答案 | CC 系列 | 240 |
注:fastMRI 与 osteosarcoma 等条目的规模/许可细节以各自库内条目为准,本表仅作任务定位对照;3DReasonKnee 的独特生态位是"3D × 定位 × 推理"三要素耦合(见 §4)。
附录 L:论文原文关键句摘录(引用锚点)
以下句子均为 arXiv HTML 全文(2510.20967v1)逐字采录,供写作引用时直接取用(中文转述请回查原文):
定位与空白(Introduction / Related Work):
“Current Vision-Language Models (VLMs) struggle to ground anatomical regions in 3D medical images and reason about them in a step-by-step manner, a key requirement of real-world diagnostic assessment.”
“Existing 3D datasets provide localization labels, but none support this ‘grounded reasoning’ ability.”
规模与构成(Abstract / §3.1):
“we introduce 3DReasonKnee, the first 3D grounded reasoning dataset for medical images, which provides 494k high-quality quintuples derived from 7,970 3D knee MRI volumes.”
“We frame 62 distinct clinical instruction tuning questions and provide volumetric bounding boxes for 22 distinct anatomical regions, drawing from the MOAKS framework.”
标注投入(Abstract / §3.2):
“The creation and validation of 3DReasonKnee, involving over 450 hours of expert clinician time for manually segmenting MRIs and generating reasoning chains, ensures its superior quality and clinical relevance.”
“Each scan required approximately 4.5 expert hours for comprehensive annotation, resulting in a substantial time investment of over 450 hours for the complete high-fidelity subset of 100 scans.”
专家构成(§3.2):
“Two board-certified radiologists and one orthopedic surgeon performed manual annotation of anatomical subregions using a specialized 3D annotation tool.”
“A board-certified orthopedic surgeon with over seven years of experience in knee surgery developed a comprehensive set of 62 subregion-specific diagnostic queries, each aligned with distinct MOAKS components.”
划分(§3.4):
“Our data set comprises 7,970 high-resolution DESS MRI scans split into training (5,977 scans, 75%), validation (797 scans, 10%), and test sets (1,196 scans, 15%) with no patient overlap.”
结果与失败模式(§4):
“In zero-shot settings, even state-of-the-art models struggle with the complex task of MOAKS grading, with Qwen2.5VL-3B achieving only 0.158 overall accuracy.”
“Note that medical VLMs like Med3DVLM fail to follow the instructions and give valid outputs.”
“we observed a clear positive correlation between localization accuracy (IoU) and diagnostic accuracy for our supervised models, with the Med3DVLM model trained with CoT exhibiting the strongest positive correlation between these two metrics.”
“Grounding is a major failure point. Performance improves notably when the ground-truth region is provided, indicating that many errors arise from incorrect localization.”
许可与定位(页头 / Abstract):
“License: CC BY 4.0 arXiv:2510.20967v1”
“3DReasonKnee serves as a repository of orthopedic surgeons’ diagnostic expertise and offers a vital testbed for advancing multimodal medical AI systems towards 3D, clinically aligned, localized decision-making capabilities.”
附录 M:数据使用检查清单(工程接入前过一遍)
接入前
├── [ ] 磁盘余量 ≥ 预估仓库体积(数十 GB 级 + 掩码解压膨胀)
├── [ ] 版本锚定:记录 sha 7a611f92… 与抓取日期
├── [ ] 网络路径确认:主站 or hf-mirror.com(见 §7.3)
├── [ ] masks_aa + masks_ab 双分卷齐全,cat 合并解压成功
└── [ ] question_files 五份 JSON 可解析(questions/cot_mapping/labels/grade_dict/q_subregion)
训练前
├── [ ] 官方划分已加载(train 5,977 / val 797 / test 1,196),未自行重切
├── [ ] 患者级去重核查:patient_id 跨集零交集
├── [ ] 逐类样本量统计完成(labels.json 出发),不平衡对策已定
├── [ ] 输入表示方案选定(附录 J),与可比实验一致
└── [ ] bbox 保真度层级确认:nnU-Net 自动(全量)vs 专家手工(100 例)
评测前
├── [ ] 3D IoU 与 7 大类准确率双指标实现(附录 G 骨架 or 官方 code/zero_shot)
├── [ ] 无效输出计分规则与论文口径一致
├── [ ] GT region 消融已配置(失败归因用)
└── [ ] 结果报告注明版本 sha 与评测设定族
发布前
├── [ ] 三重署名:论文 arXiv:2510.20967 + HF 仓库 + GitHub 仓库
├── [ ] 派生数据/翻译/图表标注 CC BY 4.0 与修改说明
└── [ ] 上游 OAI 致谢(若用了队列背景信息或原始 DICOM)
附录 N:训练配方建议(基于论文证据的起步点)
论文未公开全部超参细节(implementation details 在 GitHub 仓库),以下为基于其结果表的结构化起步建议:
| 场景 | 建议配置 | 依据 |
|---|---|---|
| 复现论文 SFT 基线 | Qwen2.5-VL-3B + (I,Q,D) 监督,不含 CoT 文本 | w/o CoT 0.613 > w/ CoT 0.588 |
| 冲击更高诊断准确率 | 先训定位头(IoU 监督)→ 冻结/融合后训分级头 | grounding 主瓶颈 + IoU-准确率正相关 |
| 利用 CoT 资产 | RL/过程监督(CoT 作奖励或过程信号),不进 SFT 损失 | 论文 Discussion 范式暗示 |
| 小模型部署 | 3B + 知识蒸馏自 7B(GT region 教师信号) | 7B w/ GT region 0.556 的归因证据 |
| 多任务扩展 | 7 大类分组评测头 + question_subregion_mapping 路由 | Bench 7 大类协议 |
| 数据增强 | 优先沿层向(slice 方向)的裁剪/采样,避免破坏 MOAKS 亚区完整性 | bbox 以层号为轴的结构 |
提醒:上表为证据驱动的启发式,非论文原文结论;实验设计仍应以官方代码与自设消融为准。
附录 O:作者与实验室背景
rajpurkarlab(Pranav Rajpurkar 组)。 哈佛医学院生物医学信息学系实验室,医学 NLP/VLM 领域高产出团队。库内已有其 rexgradient-160k(rid 717);实验室公开资产的方法论主线是"把临床专家的隐性知识显式化为可训练的标注形式"——从 CheXpert 系的不确定性标签、RadGraph 系的结构化临床文本(库内 radgraph/561、radgraph2/622 相关生态),到本条目的专家 CoT 推理链,一以贯之。
作者分工口径(依据论文署名与 §3.2 记录):
| 人物 | 角色 | 可核事实 |
|---|---|---|
| Sraavya Sambara* | 共同一作 | arXiv 署名;Harvard DBMI |
| Sung Eun Kim* | 共同一作;arXiv 提交人 | 双机构署名(HMS + SNUH);Submission history 提交邮箱 |
| Xiaoman Zhang / Luyang Luo / Shreya Johri / Mohammed Baharoon | 合作研究 | arXiv 署名;HMS 系 |
| Du Hyun Ro | 合作研究(骨科方向) | arXiv 署名;SNUH 系 |
| Pranav Rajpurkar | 通讯/团队负责人 | rajpurkarlab |
*号标注共同一作(论文原文 “*These authors contributed equally”)。标注专家(2 rad + 1 orthopedic surgeon + 1 出题骨科医生)论文未披露姓名——这是数据集论文的常见隐私处理,使用者引用标注质量时应引论文描述而非猜测个人。
附录 P:关键数字交叉索引(写作自查用)
| 数字 | 正文出现位置 | 一手来源 | 存照状态 |
|---|---|---|---|
| 494k 五元组 | §0/§1/§2.3/§4/§11 | 论文摘要+HF README | ✓ 双源一致 |
| 7,970 volumes | §0/§2.3/§3/§11 | 论文摘要+§3.4 | ✓ 双源一致 |
| 160 slices/scan | §2.1/§2.3/附录 J | 论文 §3.2 | ✓ 单源(论文) |
| 4,796/58%/45-79/61.4 | §2.2/§2.3/FAQ Q18 | 论文 §3.2 | ✓ 单源(论文) |
| 5,977/797/1,196 | §2.3/§3.5/附录 M | 论文 §3.4 | ✓ 单源(论文) |
| 62 模板/22 区域 | 全文多处 | 论文摘要+§3.1 | ✓ 双源一致 |
| MOAKS 亚区 15/14/16/6/3 | §2.3/§5.1 | 论文 §3.2 | ✓ 单源(论文) |
| 4.5h/例、100 例、450+ h | §0/§3/INFOBOX | 论文 §3.2 | ✓ 单源(论文) |
| zero-shot 0.158/0.470/0.477/0.146 | §1/§6.1/附录 C | 论文 §4 表 | ✓ 单源(论文表) |
| SFT 0.613/0.596/0.588/0.581 | §6.3/附录 C | 论文 §4 表 | ✓ 单源(论文表) |
| GT region 0.556/Meniscus 0.166 | §6.3 | 论文 §4 表 | ✓ 单源(论文表) |
| CC BY 4.0(数据集) | §7.1/附录 C | HF frontmatter+License 节 | ✓ 双重确认 |
| CC BY 4.0(论文) | §7.1/附录 L | arXiv HTML 页头 | ✓ 单源实锤 |
| sha 7a611f92…/lastModified 2026-05-10 | §2.3/§7.4 | HF API | ✓ 抓取时点 |
| downloads 1,105/likes 10 | §8.2 | HF API | ✓ 抓取时点 |
| nnU-Net 各亚区 Dice | §3.2 引用但不给数 | 论文 Figure 3b | ⚠ 图形呈现,数值待核 |
| unique 患者数 | 未写具体数 | 论文未披露 | ⚠ 待核(FAQ Q35) |
| ReasonKnee-Bench 例数 | 未写具体数 | 论文未单列 | ⚠ 待核(坑 8) |
尾注
- 本条目为千方病案医数集 AI-Ready Wikipedia 系列之 3dreasonknee 条,写手代理 agent-b-3dreasonkn,成稿于 2026-09-30。
- 事实核验来源:arXiv abs 页与 HTML 全文(arxiv.org/abs/2510.20967、arxiv.org/html/2510.20967v1,2026-09-30 抓取);HuggingFace 数据集卡 API 与 raw README(经 hf-mirror.com 镜像,sha 7a611f92fd3ad3954e8b62feef49ee12bfef725a);GitHub 仓库 sungeunkim0127/3DReasonKnee(结构信息经 WebSearch 实采,直抓被沙箱拦截,见 FACTS.md 存照)。
- 上游血缘:OAI(Osteoarthritis Initiative)队列数据经 NDA 发放(nda.nih.gov/oai);本数据集为其 DESS 子集的推理增强重打包。
- 库内互链:oai(391)、rexgradient-160k(717)、fastmri(23)、vqa-rad(240)、slake(250)、totalsegmentator(422)、gmai-mmbench(562)、radimagenet(545)、osteosarcoma(188)。
- 双口径存照与遗留疑点全量清单见同目录 FACTS.md §9;坑点细则见正文 §10。
- 本条目许可:遵循千方病案医数集站点整体许可;所引第三方事实的原始许可状态以 §7.1 三层许可表为准。
- 事故附记:成稿期间检测到 /tmp 共享池同名 part 文件被并发实例覆写(part1-3 被改写为另一版本结构),按纪律包 apollocorpus 五步处置——弃用 /tmp 共享池、改用锁目录内私有区
.parts_agent-b-3dreasonkn/、特征串逐文件鉴别归属(part4/5 为本实例原稿,part1-3 全量重写)、重拼核对章节序(§0-§11 + FAQ/事实清单/术语表/附录/尾注 共 17 个一级节完整)、本条即事故记录。 - 医学免责:本条目为数据集事实汇编,不构成临床建议;MOAKS 分级语义与临床决策的对应关系以临床指南为准。
- 规模口径声明:正文所有规模数字(494k/7,970/5,977/797/1,196/62/22/450+ 小时)均指向论文 arXiv:2510.20967v1 与 HF README 的一致口径;HF 元数据标签(size_categories)失真之处已在坑 1 与 FACTS.md §9 存照。
- 更新记录:v1.0(2026-09-30,agent-b-3dreasonkn)初版成稿,抓取时点 2026-09-30。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- amos — 共享标签:医学影像 / MRI / 医学图像分割 / 多模态
- chaos — 共享标签:医学影像 / MRI / 医学图像分割 / 多模态
- prostate158 — 共享标签:医学影像 / MRI / 医学图像分割 / 评测基准
- vqa-med — 共享标签:医学影像 / 视觉问答 / 多模态
- rexvqa — 共享标签:医学影像 / 视觉问答 / 评测基准 / 多模态
- omnimedvqa — 共享标签:医学影像 / 视觉问答 / 评测基准
- rex-in-the-wild — 共享标签:视觉问答 / 评测基准 / 多模态
- pathvqa — 共享标签:视觉问答 / 评测基准 / 多模态
- derm1m — 共享标签:视觉问答 / 评测基准 / 多模态
- acdc — 共享标签:医学影像 / MRI / 医学图像分割 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

