RaDialog Instruct Dataset — 胸片对话指令数据集 AI-Ready Wikipedia

为防遗忘而生的胸片对话课:10 个任务、总量保密、 vicuna 自问自答的第一代 instruct 方案

来源 MIMIC-CXR-JPG train 集(报告/标签/视图 metadata)+ MIMIC-NLE(解释金标)+ Rad-ReStruct(细粒度 QA 金标);vicuna-13b zero-shot 生成 4 任务伪金标;CheXbert 标签引擎发布时间: 2026-09-25最后更新: 2026-09-25 阅读 25
RaDialog Instruct Dataset — 胸片对话指令数据集 AI-Ready Wikipedia

信息速览

数据集名称RaDialog Instruct Dataset — 胸片对话指令数据集 AI-Ready Wikipedia
数据类型指令数据,对话数据,派生数据,伪金标
规模总量未披露(构造规则:报告生成与 instruct 样本 1:1 平衡,仅 MIMIC-CXR train 集分层采样)——须下载后自行统计
接入方式MIMIC-CXR-JPG train 集(报告/标签/视图 metadata)+ MIMIC-NLE(解释金标)+ Rad-ReStruct(细粒度 QA 金标);vicuna-13b zero-shot 生成 4 任务伪金标;CheXbert 标签引擎
AI 就绪度

数据集封面

INFOBOX:radialog-instruct-dataset 速览

字段 值
数据集 RaDialog Instruct Dataset v1.1.0(v1.0.0 2024-03-25 / v1.1.0 2024-07-12)
slug radialog-instruct-dataset(批次登记 ‘RaDialog’ 为简称)
DOI v1.0.0:10.13026/zecj-bh52 / v1.1.0:10.13026/40d2-wj86
访问 Credentialed(License 1.5.0 + Credentialed DUA——批次预判命中;注册+签 DUA+CITI)
规模 总量零披露(页面/论文均无数字)——构造规则:RG 与 instruct 1:1 平衡;仅 MIMIC-CXR train 集分层采样(positive 全保留+无 findings 减 1/4)
任务 10 任务名/11 条目:RG/IG/FQA-c/FQA-b/RR/RE/VC(金标 6 类)+ RQA/EL/SU/CO(LLM 伪金标 4 类)
对话构造 两轮式(第一轮金标报告+第二轮任务指令);v1.1.0 QA 类加 report dropping 三模式
格式 自有格式单文件(output/instruction/dicom 三字段)——.json.gz 后缀实为 bz2
图像 不随发——凭 dicom_id 从 z2
图像 不随发——凭 dicom_id 从 MIMIC-CXR-JPG 取
标签引擎 CheXbert(标签)+ vi 取
标签引擎 CheXbert(标签)+ vicuna-13b zero-shot(4 任务伪金标)+ MIMIC-NLE/Rad-ReStruct(金标源)
基座 vicuna-7b LLM + BioViL-T 编码器 + BERT 对齐(32 token)+ CheXbert 分类器双分支
模型成绩 报告生成临床正确性 +15.0% / 报告修正 +23.4% / 放射科医生 84.0% 偏好;消融:QA F1 0.397 vs 0.018(20 倍)
第一性目标 缓解灾难性遗忘——“we do not claim the instruct data to be completely medically correct”
论文 arXiv:2311.18681(v1 2023-11-30 → v3 2025-05-07,MIDL 2025 接收)
代码 github.com/ChantalMP/RaDialog
资助 BMBF DIVA(13GW0469C)+ Bavarian StMWi ThoraXAI(DIK-2302-0002)
团队 TUM 全系 5 人(CAMP+AI Medicine+MCML;论文 6 人 +Wiestler)
一句话 为防遗忘而生的胸片对话课——总量保密、任务管够、vicuna 自问自答的第一代 instruct 方案

§0 摘要卡:一个把"防遗忘"写进设计目标的数据集

§0.1 它是什么

RaDialog Instruct Dataset 是慕尼黑工业大学团队为 RaDialog 模型配套发布的胸片指令微调数据集——但它的第一性目标与 524 RadVLM 那种"SOTA 训练配方"完全不同:页面 Usage Notes 坦白 “we do not claim the instruct data to be completely medically correct”,数据集的正式使命是缓解灾难性遗忘(catastrophic forgetting mitigation)——当 LLM 在放射报告上微调后,通用对话能力会崩塌;本集用 10 个任务的多样性让模型"复习"对话技能。消融证据直白有力:不用本集训练的模型 binary CheXpert QA F1 只有 0.018,用了之后 0.397——20 倍差距。数据含金标任务(MIMIC-CXR/MIMIC-NLE/Rad-ReStruct)与伪金标任务(vicuna-13b zero-shot 生成的区域 QA/通俗语言/总结/纠错)各半,总量数字页面论文均不披露——须下载后自数。

§0.2 三个数字

  • 20 倍:CheXpert binary QA F1 从 0.018(无 Instruct 训练)到 0.397(有)——灾难性遗忘缓解的量化证据,本数据集价值的直接度量。
  • 10 任务名/11 条目:6 类金标任务(RG/IG/FQA 双变体/RR/RE/VC)+ 4 类伪金标任务(RQA/EL/SU/CO);v1.0.0 是 8 条目、v1.1.0 +3 任务+report dropping。
  • 0:页面与论文披露的总量数字——只有 1:1 平衡、每图一任务、分层采样三条构造规则;透明度与 524 RadVLM 的个位数级表 1 形成两极。

§0.3 谁在用、怎么接

持续学习/防遗忘研究者拿它做"任务多样性 vs 遗忘速率"的实验场;对话助手开发者在自己的报告生成模型后接本集做第二阶段调优;数据透明度研究者把它当"零数字披露"的案例标本。获取走 Credentialed 档(注册+DUA+CITI)。接入前的三件准备:图像本体要从 MIMIC-CXR-JPG 按 dicom_id 对齐;文件要用 bz2.open 读(.gz 后缀撒谎);评测只用 MIMIC test(本集只碰 train 集的隔离设计)。

§0.4 本条目怎么读

读完本条目建议顺读 524 ## §0.4 本条目怎么读

读完本条目建议顺读 524 RadVLM Instruction Dataset——两联合读覆盖胸片对话助手 2023-2025 的全部方法论演进(文本任务→空间 grounding / vicuna→GPT-4o / 保密→透明)。

§1 身份卡 → §2 灾难性遗忘问题与数据集定位 → §3 十任务配方解剖 → §4 构造管线(多轮结构/分层/bz2)→ §5 模型架构与成绩 → §6 生态位(与 524 对照)→ §7 AI-Ready 十问 + DAIMS → §8 误解与坑点表 → §9 工作实例 → §10 FAQ 速查 → 附录 A-L。

§1 身份卡:一张速览

字段 值
全称 RaDialog Instruct Dataset
slug / 本库编号 radialog-instruct-dataset / 523
版本 v1.0.0(2024-03-25)→ v1.1.0(2024-07-12,双版本演进)
DOI v1.0.0:10.13026/zecj-bh52;v1.1.0:10.13026/40d2-wj86
访问 Credentialed——注册 + CITI + Credentialed DUA(License 1.5.0)
Topics 3 个:medical image understaning(官方 typo 存照)/ radiology chatbot / radiology report generation
文件 mimic_cxr_instruct_stratified.json.gz(实为 bz2)+ README
图像 不随发——dicom_id 对齐 MIMIC-CXR-JPG
源库 MIMIC-CXR-JPG train(主)+ MIMIC-NLE(解释金标)+ Rad-ReStruct(细粒度 QA 金标)
标签引擎 CheXbert + vicuna-13b zero-shot(4 任务伪金标)
基座 vicuna-7b + BioViL-T + BERT 对齐 32 token + CheXbert 分类器双分支
论文 arXiv:2311.18681(v1 2023-11-30 / v3 2025-05-07 MIDL 2025;标题两版不同)
模型发布 GitHub/HF(未在 PhysioNet 另立条目——与 524 双实体策略相反)
资助 BMBF DIVA 13GW0469C + Bavarian StMWi ThoraXAI DIK-2302-0002
团队 TUM 5 人(数据集引用;论文 6 人 +Wiestler)
Ethics 一句话:“The authors declare no ethics concerns.”
一句话 胸片对话第一代 instruct 方案——防遗忘是使命,总量是秘密

§2 背景:灾难性遗忘与"第一代"的野心

§2.1 微调悖论:越专业,越不会聊天

在 MIMIC-CXR 报告上微调 LLM 是当时报告生成的主流做法,但代价明确:模型在放射文体上越精进,通用语言能力与对话能力衰退越严重——灾难性遗忘。医生真正需要的不是一个只会写报告的打字机,而是能被追问、能改错、能用大白话解释的人机协作伙伴。RaDialog 团队给出的解法是回放式持续学习(replay-based continual learning)思路:微调数据里混入多任务对话样本,让模型在学新知识的同时"复习"旧技能。

§2.2 第一代的定位与坦白

页面 Abstract 的自我表述是"第一个经过彻底评估且公开可用的大型视觉语言模型"(the first thoroughly evaluated and publicly available large vision-language model)——报告生成+交互对话双能力。配套数据集的 Usage Notes 同样坦白:半自动标注(LLM 生成)、基于 CheXbert(可含错)、不声称完全医学正确——数据集的价值主张是"任务多样性与对话能力保持",不是金标医学知识。这种坦白在数据集声明里是罕见的诚实,也是使用者的第一道安全边界。

§2.3 与同期方案的竞争叙事

2023 年底的医学 VLLM 版图两极分化:私有数据训练的闭源模型(如 Med-PaLM M 系)与只做通用医疗 VQA 的开源模型——两者都不解决"胸片报告+对话"的组合需求。RaDialog 的补位:公开数据+公开模型+公开 instruct 配方三件套全开源。它的直接对照物 RadVLM(本库 524)要在 15 个月后才出现——后者把 grounding 坐标与 GPT-4o 全链合成带进场,两代方案共同锚定了胸片对话助手从"能聊"到"能指"的演进史。

§2.4 单一信源的取舍

本集所有数据源都收束在 MIMIC 生态(MIMIC-CXR train + MIMIC-NLE + Rad-ReStruct 同样源自 MIMIC 文本链)——换来的是评测隔离的干净(模型可在 MIMIC test 上无泄漏评测)与许可链的统一(Credentialed 一档全解锁)。代价是机构多样性为零——所有对话都是 MIMIC 医院的文体。这个取舍与 524 的四源策略(MIMIC+VinDr+MS-CXR)形成方法论分野。

§2.5 "防遗忘"为什么需要专门的数据集

有人会问:多任务训练不就够了,为什么还要一份"以防遗忘为使命"的数据?答案在微调经济性:一份纯报告数据(如 MIMIC-CXR 原始对)确实最"专业",但模型训完就只会一种格式;而配一份任务多样的 instruct 数据做第二阶段,成本几乎不变(同一批图、同一套管线),对话能力却完整保住。本集的 20 倍消融(§5.3)就是把这笔经济账算成数字——一份 instruct 数据的价格,换回一个能对话的助手。这也解释了为什么它的 4 个任务愿意用伪金标:防遗忘练的是"对话格式保持",不是新增医学知识——伪金标够用,金标(6 类任务)负责医学正确性。

§3 十任务配方解剖:一条 instruct 样本长什么样

§3.1 六类金标任务(Dataset-based)

RG(报告生成):唯一的"第一轮"任务——prompt 含 <IMG> 占位+CheXbert 分类器对当前图预测的标签列表+固定写作指令(“act as a radiologist…write one fluent text without enumeration, be concise”——这段 prompt 在原始 vicuna-7b 上零样本试出来的)。金标来自 MIMIC-CXR train 集报告。

IG(印象生成):findings 段进、impression 段出——报告内部的"摘要改写",v1.1.0 新增。金标从 MIMIC-CXR 报告结构里直接抽。

FQA(Findings QA,双变体):CheXbert 标签问答——complete 模式"列出图中全部异常"、binary 模式"Is there evidence of <PATHOLOGY>?"(yes/no)。标签由 CheXbert 从报告 findings 段自动提取(可含错——官方 Limitations 明示)。消融的主战场:0.018→0.397 的 20 倍证据就在这个任务上测的。

RR(Rad-ReStruct QA):存在性/位置/外观的细粒度问答,金标来自 Rad-ReStruct 数据集——Pellegrini 自己 2023 年的前作(“Q: Is there a density in the thorax? A: Yes…Q: What are the attributes?”)。原集高度不平衡,本集限制每类问题正负样本同数。v1.1.0 新增。

RE(自然语言解释):“Why do you think the patient has <PATHOLOGY>?”——回答指向报告里支持该诊断的句子。金标来自 MIMIC-NLE(Kayser et al. 2022)——把 NLP 里的解释生成任务搬进对话。

VC(视图分类):“Was this image taken from the frontal or lateral view?”——AP/PA/LL/lateral 四分类或 frontal/lateral 二分类,金标是 MIMIC-CXR metadata。v1.1.0 新增。最轻量但最稳的任务——纯 metadata 无噪声。

§3.2 四类伪金标任务(LLM-based)

RQA(区域问答,“Is the patient’s heart healthy?”)/ EL(通俗语言,“such that a child would understand”)/ SU(要点总结)/ CO(纠错)——四类任务的"金标"全部由非微调的 vicuna-13b 零样本生成:把 MIMIC 金标报告塞进 prompt,让 LLM 自己产出回答。页面把这称为与回放式持续学习"similar"的构造——本质是"用大模型给孩子出题再写答案",答案质量由 vicuna 的能力封顶(官方 Limitations 原话承认)。

§3.3 CO(纠错)任务的精巧机关

十任务里构造最绕的一个:先让非微调 vicuna 只凭预测标签(不给图像——原始 vicuna 也看不了图)写一份"必错报告";CheXbert 给这份报告打标并与金标对比,找出漏检(missing)与多报(added)的病理;再构造指令"I disagree with the generated report, I think the patient has <MISSING>, but does not have <ADDED>. Please adapt the report.“——让模型学会改错。它是唯一嵌入预测报告(而非金标报告)的任务,对话训练里唯一的"真实噪声源”,模拟医生纠正 AI 的真实交互。

§3.4 Report Dropping(v1.1.0 的抗依赖设计)

v1.1.0 给 CPbQA/CPaQA/RQA 三个 QA 任务加了"报告随机三选":a) 金标报告在手 b) 只有部分报告 c) 直接不给报告。设计动机(Release Notes 原话):“we encourage the model to pay more attention to the image instead of mainly relying on the report content”——没有报告可抄时,模型被迫真正利用图像特征。这是指令数据里少见的"反捷径"(anti-shortcut)设计。

§3.5 每图一任务与任务均分

分配规则:每张入选图只带一个 instruct 任务(避免同图多任务过拟合),十一个条目间均分样本。加上 RG 与 instruct 总量 1:1 平衡——整个数据集的任务分布是设计出来的均匀分布,而非数据自然分布。要重建任务统计,用 instruction 文本特征聚类(§9.3)。

§4 构造管线:分层、对话结构与那个撒谎的后缀

§4.1 分层采样:让训练集长得像测试集

页面 Stratification 段披露的问题:MIMIC-CXR train/validate 集的健康人比例远高于 test 集——直接在 train 上训练会让模型 biased 向"什么都是正常"。解法:positive findings 样本全保留,无 findings 样本裁到 1/4,“approximately match the test set distribution”。这个分层只对 RG 任务生效(每图一任务的 instruct 部分跟随图像入选),是本集构造里唯一涉及分布对齐的决策。

§4.2 两轮对话结构:为什么第一轮回答是金标

除 RG 外的所有 instruct 任务都嵌在两轮对话里:第一轮 USER 要报告→ASSISTANT 答金标报告(不是模型预测)——页面原话:“in order to reduce noise in the training process”。逻辑:第二轮问答要建立在正确的报告上下文上;若第一轮就喂预测报告,错误会传播进后续轮次。推理时第一轮才由模型自己预测——train/test 的不对称是刻意设计。RG 任务本身则是单轮(prompt 直接到 ASSISTANT)。

§4.3 .json.gz 后缀的谎言(独家坑点)

页面 Data Description 的读取代码块明示:

with bz2.open('mimic_cxr_instruct_stratified.json.gz', 'rt', encoding='UTF-8') as f:
    data = json.load(f)

文件后缀是 .gz 但实际是 bz2 压缩——用 gzip 模块直接打开会立刻报错。这是本集最实际的工程陷阱(也是本条目最有传播力的存照):后缀撒谎、代码块说实话。同类教训:任何数据集的"文件格式"要以官方读取代码为准,别信文件名。

§4.4 三字段结构与图像对齐

每条样本三字段:output(金标或伪金标回答)/ instruction(任务指令,含 <IMG> 占位——图像特征在模型内嵌的位置)/ dicom(MIMIC-CXR-JPG 的 dicom_id)。图像本体不随发——与 524 同策略:源图像在母库有独立许可链,本集只发指针与文本。组装流程:Credentialed 档下载 MIMIC-CXR-JPG → 按 dicom_id 索引 → 训练时替换 <IMG> 占位为 BioViL-T 特征(或自己模型的视觉编码)。

§4.5 评测隔离设计

数据只用 MIMIC-CXR 与 MIMIC-NLE 的 train 集——页面明确说这样"can thus safely be used to train models that will be evaluated on the test sets of these datasets or on other non-overlapping datasets"。这个声明把"评测隔离"从使用者的责任转成了数据集的出厂属性——对比很多混用 train/val 的数据集是工程美德。使用者仍需自查:自己的下游评测若用 IU-Xray 等外部集(论文的 OOD 评测用 IU-Xray test),无泄漏问题更小。

§4.6 读取的边界案例清单

除 bz2 陷阱外,读取还有四个边界要防:(1) 编码——官方代码显式 encoding=‘UTF-8’,Windows 默认 GBK 会炸;(2) 文本模式——bz2.open 必须 ‘rt’ 而非 ‘rb’(json.load 要字符串不要字节);(3) <IMG> 占位——instruction 字段里的 <IMG> 是模型内特征嵌入位,做文本预处理时别当 HTML 标签清洗掉;(4) dicom 键类型——统一按字符串处理(部分工具链会把纯数字 dicom_id 误转 int)。四个坑都不难,但都会在深夜的训练脚本里精准复仇。

§5 模型架构与成绩:双分支、双版本、20 倍证据

§5.1 四组件架构

RaDialog 模型(本集数据的消费者):BioViL-T 图像编码器(X-ray 域对比学习预训练的专用编码器,patch-wise 特征)→ BERT 对齐模块(BLIP-2 风格,把视觉特征转成 32 个 LM token)→ vicuna-7b LLM(对话主干)。外加第二条分支:CheXbert 分类器独立预测 14 类结构化 findings,以"Predicted Findings: <列表>“文本形式进 prompt——这就是"secondary image branch”:结构化 findings 显式通道。论文消融:这个分支单独贡献临床正确性 +13.3%。

§5.2 训练方式的版本演进(存照)

页面 Abstract(引用 v1 论文口径)说 parameter-efficient fine-tuning;v3 论文(MIDL 2025)Table 6 把差异化因素说成 end-to-end fine-tuning of both the image encoder and the LLM。两版训练方式不同(PEFT/LoRA → 全参微调),数据集本身不变。引用模型成绩时必须注明论文版本——v1 的 0.397/0.403 QA 成绩与 v3 的 39.4/39.7 分数体系不可直接混比(§10 存照 6)。

§5.3 成绩单与数据集的价值证明

v3 摘要三个数字:报告生成临床正确性 +15.0% vs 现有医疗 LVLM;交互式报告修正 +23.4%;放射科医生 84.0% 案例偏好。而数据集本身的"存在意义证明"是 v1 消融:同一模型有无 Instruct 训练的 QA F1 从 0.018/0.098 跳到 0.397/0.403——没有这份"防遗忘教材",对话能力基本归零。这组数字是本数据集最硬的底气。

§5.4 模型发布渠道的对照

RaDialog 模型权重走 GitHub(ChantalMP/RaDialog)与 HuggingFace——未在 PhysioNet 另立模型条目。与 524 RadVLM 的双实体策略(数据+模型都上 PhysioNet,相隔 13 天)相反。对照读法:523 的许可重心全在数据侧(MIMIC 派生),模型侧走开源社区惯例;524 则把两边都纳入平台审计链。两种策略都是合法解,检索与引用时注意渠道差异。

§5.5 成绩体系的版本地图(防混比指南)

两代论文的成绩体系完全不同,引用前先对地图。v1 消融体系(Frontiers 综述转录):同模型有/无 Instruct 训练的 QA F1 对比——binary 0.397 vs 0.018、complete 0.403 vs 0.098——证明数据集价值。v3 主成绩体系:align/project(对齐模块两种实现)× report/instruct(两阶段训练差异)四组合的 CheXbert F1(39.4/38.6/39.7/39.2,×100 口径)+ RadGraph F1(0.36-0.40)——证明架构选型。混比陷阱实例:39.4 不是"39.4 倍"也不是 v1 的 0.394 小数点位移,而是另一个任务口径的另一个分数。报告成绩时永远带上"版本+任务+指标"三元组。

§6 生态位:胸片对话助手谱系的第一块基石

§6.1 时间轴定位

2023-11-30 论文 v1 挂 arXiv → 2024-03-25 数据集 v1.0.0 上 PhysioNet → 2024-07-12 v1.1.0(+3 任务+report dropping)→ 2025-05-07 论文 v3 被 MIDL 2025 接收(标题从"A Large Vision-Language Model for Radiology Report Generation and Conversational Assistance"改为"Large Vision-Language Models for X-Ray Reporting and Dialog-Driven Assistance")——两年从预印本到正式发表,数据集历经一次大版本演进。

§6.2 与本库条目的血缘网

直接血缘:MIMIC-CXR-JPG(617,主源)→ CheXbert 标签链(512 CheXpert 的标签体系)→ MIMIC-NLE 与 Rad-ReStruct(金标源;Rad-ReStruct 是 Pellegrini 前作,本库观察项)。方向近邻:621 RadCoref(同为报告文本理解)、622 RadGraph2(结构化金标)、624 RadVLM Instruction(本库双指令集的另一半——15 个月后的迭代版)。加上 624,本库的"胸片 instruct 数据"二联完成:能聊的(523)与能指的(524)。

§6.3 方法论遗产

本集留给后续 instruct 数据集三件工具:(1) 两轮对话构造(金标报告打底降噪声)——524 的多轮对话沿用同思路;(2) report dropping 反捷径——"不给报告逼模型看图"的设计后被广泛借鉴;(3) 任务均分+每图一任务——防过拟合的分配纪律。而它的"总量零披露"则是反面教材——524 的个位数级表 1 就是对照改进。

§6.4 伪金标的边界哲学

本集对 LLM 生成答案的处理与 524 形成哲学对照:523 把 4 个任务整体划为 LLM-based,明示"不声称医学正确",用途限定在"防遗忘练习";524 则用 GPT-4o 生成 86k 对话且做三连选退合规声明但同样零人工抽检。两者共同的底层事实:LLM 生成的临床对话在 2024-2025 年的公开数据集里都未经人工验证——使用者的信任边界要自己画,两条条目的 Limitations 都读一遍再定用途。

§6.5 "胸片 instruct 二联"深读:15 个月的三个跃迁

把 523 与 524 并排放,能看到 2023-11 至 2025-09 间胸片 instruct 方案的三个结构性跃迁。跃迁一:从文本到空间——523 的十任务全在文本层(报告/QA/解释),524 加入三项坐标 grounding 并把坐标文本化进 LLM;"能指"成为新基准。跃迁二:从 vicuna 到 GPT-4o——伪金标生成器从 13B 开源模型换成 GPT-4o(合规包装三连选退),生成质量与合规复杂度同时上升。跃迁三:透明度反转——523 的总量保密在 524 变成个位数级表 1,社区对"指令数据可审计性"的要求在一年内被拉高。二联合读,读的不是两个数据集,是一条方法论 S 曲线的两个采样点。

§7 AI-Ready 十问

一问:什么格式? 单文件 mimic_cxr_instruct_stratified.json.gz(实为 bz2 压缩——bz2.open 读取);每条 output/instruction/dicom 三字段;图像凭 dicom_id 从 MIMIC-CXR-JPG 对齐。

二问:多大规模? 总量未披露(页面/论文零数字)——构造规则:RG 与 instruct 1:1、每图一任务、11 条目均分、分层采样(positive 全保留+无 findings 减 1/4);MIMIC-CXR train 集量级(十万级推理,官方未确认)。

三问:标注是什么性质? 双轨:6 类任务金标(MIMIC-CXR 报告/CheXbert 标签/MIMIC-NLE/Rad-ReStruct/metadata)+ 4 类任务 vicuna-13b 伪金标;官方明示不声称医学完全正确;零人工抽检披露。

四问:许可与门槛? Credentialed:注册+CITI+Credentialed DUA(License 1.5.0);源图像在 MIMIC-CXR-JPG 同档——一次认证全解锁。

五问:伦理完备度? 一句话声明(“no ethics concerns”)——2024-03 口径的极简风格;数据源伦理继承 MIMIC 系;无 LLM API 合规专项声明(对照 524 的三连选退)。

六问:可复现性? 构造代码开源(GitHub)+每任务 10 条 prompt 模板全公开+构造规则完整披露;但总量数字缺失——复现校验只能靠下载后统计与构造规则推断。

七问:标签的可信边界? CheXbert 自动标签可含错;vicuna 伪金标受模型能力封顶;CO 任务的纠错对是构造的(非真实临床错误);金标任务(RG/IG/RE/VC/RR)可信度较高——分任务取用。

八问:适合什么任务? 报告生成模型的对话能力追加训练(防遗忘第二阶段);持续学习/任务多样性研究;报告纠错与患者通俗解释的系统原型;医学对话 SFT 的组成部分。

九问:不适合什么? 医学金标评测(官方自认非金标);grounding/定位任务(无框坐标——对照 524);多机构泛化研究(纯 MIMIC 文体);任何要求"数据量明确"的注册研究(总量未披露)。

十问:一句话定位? 胸片对话助手的第一代 instruct 方案——为防遗忘而生,总量保密,vicuna 自问自答,MIDL 2025 正式背书。

DAIMS 评估:数据可得性 6(Credentialed 中间档+图像须对齐+总量不透明)/ 标注 6(金标伪金标双轨+零人工抽检+官方诚实声明加分但边界真实)/ 方法 8(构造规则全披露+report dropping 反捷径设计+消融证据 20 倍+构造代码开源)/ 影响力 7(第一代完整公开方案+MIDL 2025+社区广泛引用)/ 规模 6(总量未知,MIMIC train 量级但无法核数)——DAIMS:6.6(对照:624 RadVLM 7.4、622 RadGraph2 7.6、623 REFLACX 6.6)。

§8 误解与反直觉

误解一:“这是个大数据集。” 无人知道——总量数字页面论文均未披露(官方只给构造规则)。MIMIC train 分层采样后估计十万级,但"估计"不是事实;引用时写"总量未披露"或下载自数。

误解二:“instruct 数据是医学正确的。” 官方原话反向声明:“we do not claim the instruct data to be completely medically correct”——4 个任务的答案是 vicuna-13b 零样本生成的。它的使命是防遗忘练习,不是医学知识库。

误解三:“文件是 gzip 的。” 后缀 .gz 撒谎——实际 bz2 压缩(页面代码块明示 bz2.open)。gzip 直接打开必报错。本条目最实际的坑。

误解四:“任务是 8 个。” 页面 Overview 说"eight tasks"是 v1.0.0 遗留——v1.1.0 实为 10 任务名/11 条目(FQA 双变体)。读任务清单以页面 Tasks included in the dataset 节为准。

误解五:“两轮对话的第一轮也是模型生成的。” 不是——训练时第一轮回答固定为 MIMIC 金标报告(降噪声设计);推理时第一轮才由模型预测。train/test 不对称是特性不是 bug。

误解六:“纠错任务教的是真实错误。” CO 任务的"错误报告"是 vicuna 只凭标签生成的构造物(没有图像输入),纠错对不是真实临床误诊——它训练的是"接受纠正指令并修改"的交互模式。

误解七:“数据可以用来评测模型。” 官方定位是训练集(且只用 MIMIC train 集构造)——评测要用 MIMIC test 或外部集(IU-Xray 等)。拿训练数据当评测集是双重错误(泄漏+非金标)。

误解八:“RaDialog 模型也在 PhysioNet 上。” 不——模型走 GitHub/HF,PhysioNet 只有数据集条目(对照 524 的 radvlm-model 双实体策略)。

误解九:“这个数据集没有价值因为都是自动生成的。” 反了——消融证据 0.018→0.397(20 倍)证明它的"防遗忘"价值真实存在;价值主张从来不是医学正确性,是任务多样性带来的对话能力保持。

误解十:“MIMIC-NLE 和 Rad-ReStruct 也是 MIMIC-CXR。” MIMIC-NLE(Kayser 2022)是解释数据集;Rad-ReStruct(Pellegrini 2023)是结构化报告 QA 数据集——两者独立成集,本集只是消费方。

误解十一:“报告 dropping 是数据清洗。” 不是——它是把"有报告可抄"的 QA 任务随机变成"部分报告/无报告"三模式的抗捷径训练设计,强迫模型用图像。方向与清洗相反:主动引入信息缺失。

误解十二:“作者就是论文那 6 个人。” 数据集引用 5 人(无 Wiestler)——Wiestler 只在论文作者名单。引用数据集用 5 人版,引用论文用 6 人版。

误解十三:“vicuna-13b 也被微调了。” 生成伪金标用的是非微调的 vicuna-13b(zero-shot)——被微调的是 vicuna-7b(RaDialog 主干)。两个模型两个角色,别混。

误解十四:“标题就一个。” 论文两版标题不同:v1 “…for Radiology Report Generation and Conversational Assistance” → v3 “…for X-Ray Reporting and Dialog-Driven Assistance”。检索与引用认准版本。

误解十五:“两轮结构浪费算力。” 第一轮金标报告看似"白送"的监督信号,实际是低成本的多任务课程学习——RG 能力在每条 instruct 样本里被免费复习,这正是防遗忘目标的执行细节。

误解十六:“可以自己加任务扩数据。” 可以但要记录口径——官方 11 条目均分的分布会被打破;扩充任务建议独立成文件并声明版本(学官方 v1.0→v1.1 的变更日志纪律)。

§8.13 坑点表(八坑)

坑点 典型翻车 绕行姿势
坑点1:信 .gz 后缀 gzip.open 直接报错 官方代码 bz2.open(‘…’, ‘rt’, encoding=‘UTF-8’)(§4.3)
坑点2:猜总量 论文引用写"约 X 万条" 官方零披露——写"总量未披露"或下载自数(§10 存照 1)
坑点3:伪金标当真 拿 RQA/EL/SU/CO 答案当医学事实 vicuna-13b 生成+官方不声称正确——只当对话训练信号(§3.2)
坑点4:8/10 任务数记错 任务统计与页面对不上 Overview “eight”=v1.0 遗留;v1.1 实为 10 名/11 条目(§4/§3)
坑点5:<IMG> 当真图 找 <IMG> 文件 占位符——特征在模型内嵌入,图像凭 dicom_id 对齐 MIMIC-CXR-JPG(§4.4)
坑点6:训练集上评测 用本集样本测模型 本集是训练集(MIMIC train 构造)——评测去 MIMIC test/IU-Xray(§4.5)
坑点7:CO 错误当真实 研究真实误诊模式 CO 的错误报告是构造的——只练交互模式不研究误诊(§3.3)
坑点8:成绩混版本 v1 的 0.397 与 v3 的 39.4 互比 PEFT→端到端两代训练——引用注明论文版本(§5.2)

§9 工作实例:从下载到任务统计的完整管线

§9.1 正确读取(bz2 陷阱现场)

import bz2, json
from collections import Counter

# ⚠️ 后缀 .gz 实为 bz2 —— gzip.open 会报 BadGzipFile
with bz2.open('mimic_cxr_instruct_stratified.json.gz', 'rt', encoding='UTF-8') as f:
    data = json.load(f)

print(type(data), len(data))   # list —— 官方未披露的总数在这里揭晓
sample = data[0]
print(sample.keys())           # dict_keys(['output', 'instruction', 'dicom'])

§9.2 三字段结构与任务判别

def guess_task(sample):
    inst = sample["instruction"]
    if "write the finding section" in inst:          return "RG"
    if "impression" in inst.lower():                 return "IG"
    if "List all the finding" in inst:               return "FQA-complete"
    if "Is there evidence of" in inst:               return "FQA-binary"
    if "What are the attributes" in inst:            return "RR"
    if "Why do you think" in inst:                   return "RE"
    if "frontal or lateral" in inst.lower():         return "VC"
    if "healthy" in inst.lower() or "lung" in inst.lower(): return "RQA"
    if "very easy terms" in inst or "child" in inst: return "EL"
    if "bullet points" in inst:                      return "SU"
    if "I disagree" in inst:                         return "CO"
    return "UNKNOWN"

counts = Counter(guess_task(s) for s in data)
print(counts)   # 11 条目分布——官方未给的统计自己补上

§9.3 与 MIMIC-CXR-JPG 图像对齐

import os
# 图像本体在 MIMIC-CXR-JPG(同 Credentialed 档);dicom_id 即索引键
# MIMIC-CXR-JPG 路径规律:files/p10/p10000032/s<study_id>/<dicom_id>.jpg
missing = 0
for s in data:
    d = s["dicom"]
    # 实际项目按 MIMIC-CXR-JPG 的 metadata csv 反查完整路径
    if not find_jpg_by_dicom(d):      # 项目自己的反查函数
        missing += 1
print(f"缺图 {missing} / {len(data)}")   # 训练前必须清零

§9.4 两轮对话展开(训练视角)

def to_chat(sample):
    # 官方结构:第一轮=金标报告(RG 轮)→ 第二轮=任务指令
    # 训练时第一轮 ASSISTANT 答案是 MIMIC 金标报告(非模型预测)
    return [
        {"role": "user",      "content": RG_PROMPT(sample)},      # 含 <IMG> 占位
        {"role": "assistant", "content": GT_REPORT(sample)},      # 金标——降噪声设计
        {"role": "user",      "content": sample["instruction"]},  # 任务指令
        {"role": "assistant", "content": sample["output"]},       # 金标或 vicuna 伪金标
    ]
# report dropping 模式(v1.1.0 QA 类):第二轮 instruction 可能附带
# 金标/部分/无报告三种上下文——抽样时注意三种模式都在

§9.5 五行清单

  1. bz2.open 读 json(别信 .gz 后缀)→ len(data) 得到官方未披露的总数
  2. guess_task 聚类 → 11 条目分布自检(对照 §3 任务清单)
  3. dicom_id 反查 MIMIC-CXR-JPG 图像树 → 缺图清零
  4. 两轮对话展开 + report dropping 三模式确认 → 接自己的训练框架
  5. 评测只在 MIMIC test / IU-Xray——训练集样本永不入评测

§9.6 report dropping 模式统计(v1.1 专属检查)

v1.1.0 的 QA 类样本分三模式(金标报告在手/部分报告/无报告)——官方未给比例,统计脚本加一桶:

def drop_mode(sample):
    inst = sample["instruction"]
    if "Report:" in inst and len(inst) > 400:  return "full-report"
    if "Report:" in inst:                      return "partial-report"
    return "no-report"

mode_counts = Counter(drop_mode(s) for s in data if guess_task(s) in
                      {"FQA-complete","FQA-binary","RR","RQA"})
print(mode_counts)   # 三模式分布——官方未给,自补统计

若 no-report 桶为 0,说明拿到的是 v1.0.0 文件(report dropping 未生效)——用版本号复核下载源。

§10 FAQ:速查索引

FAQ-基础身份(18 问)

Q1:RaDialog Instruct Dataset 是什么?

Q2:它的 slug 是什么?

Q3:在 PhysioNet 上的 DOI 是什么?

Q4:v1.0.0 什么时候发布的?

Q5:v1.1.0 什么时候发布的?

Q6:两个版本的 DOI 分别是什么?

Q7:属于哪个访问等级?

Q8:Topics 有哪些?

Q9:Topics 里 ‘understaning’ 是拼写错误吗?

Q10:它是图像数据集吗?

Q11:配套模型在哪里发布?

Q12:模型为什么没在 PhysioNet 单独挂牌?

Q13:官方论文是哪篇?

Q14:论文的 arXiv 编号?

Q15:论文改过标题吗?

Q16:MIDL 2025 是什么?

Q17:代码在哪里?

Q18:有问题联系谁?

FAQ-规模与统计(12 问)

Q19:数据集有多少条样本?

Q20:为什么官方不披露总量?

Q21:怎么自己统计条数?

Q22:报告生成和 instruct 任务的比例是多少?

Q23:每张图会带几个任务?

Q24:任务之间怎么分配样本?

Q25:分层采样是什么规则?

Q26:为什么要减少健康样本?

Q27:数据只用了 MIMIC 的哪些部分?

Q28:评测时能用自己的样本吗?

Q29:十万级是官方数字吗?

Q30:v1.0.0 和 v1.1.0 的样本量一样吗?

FAQ-十任务配方(22 问)

Q31:数据集包含哪十个任务?

Q32:哪些任务是金标?

Q33:哪些任务是 LLM 生成?

Q34:RG(报告生成)任务长什么样?

Q35:IG(印象生成)是什么?

Q36:FQA 的两个变体是什么?

Q37:CPaQA 和 CPbQA 是什么缩写?

Q38:RR(Rad-ReStruct QA)是什么?

Q39:Rad-ReStruct 是谁的数据集?

Q40:RE(自然语言解释)的金标来自哪里?

Q41:MIMIC-NLE 是什么?

Q42:VC(视图分类)分哪几类?

Q43:RQA(区域问答)问什么?

Q44:EL(通俗语言)任务的目标读者是谁?

Q45:SU(总结)任务输出什么格式?

Q46:CO(纠错)任务怎么构造的?

Q47:为什么 CO 任务的报告是预测的?

Q48:report dropping 是什么?

Q49:report dropping 覆盖哪些任务?

Q50:为什么要随机去掉报告?

Q51:每个任务有几条 prompt 模板?

Q52:prompt 模板在哪里能看到?

FAQ-格式与文件(12 问)

Q53:数据集是什么文件格式?

Q54:怎么正确读取数据文件?

Q55:为什么 .gz 后缀不能直接用 gzip 读?

Q56:每条样本有几个字段?

Q57:instruction 里的 <IMG> 是什么?

Q58:dicom 字段怎么用?

Q59:图像本体在数据集里吗?

Q60:图像怎么对齐?

Q61:两轮对话的结构是什么?

Q62:第一轮回答为什么用金标报告?

Q63:推理时第一轮回答怎么办?

Q64:RG 任务也是两轮的吗?

FAQ-构造与标注(12 问)

Q65:数据是自动生成的吗?

Q66:vicuna-13b 在构造里的角色?

Q67:vicuna-13b 被微调过吗?

Q68:伪金标的质量怎么保证?

Q69:CheXbert 在构造里的角色?

Q70:CheXbert 标签有错误吗?

Q71:官方怎么声明数据的医学正确性?

Q72:数据集的第一性设计目标是什么?

Q73:什么是灾难性遗忘?

Q74:回放式持续学习是什么思路?

Q75:分层采样只影响哪些任务?

Q76:构造代码开源了吗?

FAQ-模型与成绩(15 问)

Q77:RaDialog 模型的架构是什么?

Q78:图像编码器是什么?

Q79:对齐模块是什么?

Q80:结构化 findings 分支有什么用?

Q81:次要分支带来多少提升?

Q82:LLM 用的哪个模型?

Q83:训练方式是 LoRA 还是全参微调?

Q84:为什么有两种训练方式的说法?

Q85:模型的报告生成成绩提升了多少?

Q86:报告修正成绩提升多少?

Q87:84.0% 医生偏好是怎么测的?

Q88:放射科医生偏好率是多少?

Q89:20 倍差距是什么证据?

Q90:0.018 和 0.397 分别怎么来的?

Q91:v1 和 v3 的成绩能直接比吗?

FAQ-访问与许可(8 问)

Q92:怎么获取这个数据集?

Q93:Credentialed 访问要什么条件?

Q94:许可是什么?

Q95:MIMIC-CXR-JPG 要单独申请吗?

Q96:能再分发吗?

Q97:引用时要引哪些文献?

Q98:PhysioNet 平台引用是什么?

Q99:数据集引用和论文引用的作者数为什么不一样?

FAQ-伦理与资助(7 问)

Q100:数据集的伦理声明是什么?

Q101:为什么伦理声明只有一句话?

Q102:数据源的伦理责任怎么继承?

Q103:和 524 RadVLM 的合规声明差在哪?

Q104:资助方是谁?

Q105:DIVA 和 ThoraXAI 是什么项目?

Q106:有利益冲突声明吗?

FAQ-团队与论文链(11 问)

Q107:数据集是谁做的?

Q108:作者有几个人?

Q109:第一作者是谁?

Q110:团队来自哪些机构?

Q111:CAMP 是什么实验室?

Q112:Wiestler 在数据集作者里吗?

Q113:论文什么时候提交的?

Q114:论文 v3 什么时候改的?

Q115:两个版本标题差在哪?

Q116:Rad-ReStruct 和本集什么关系?

Q117:联系邮箱是什么?

FAQ-近邻与生态(10 问)

Q118:本库里有哪些近邻条目?

Q119:和 MIMIC-CXR-JPG(617)什么关系?

Q120:和 524 RadVLM Instruction 什么关系?

Q121:524 比 523 进步在哪?

Q122:和 512 CheXpert 什么关系?

Q123:和 621/622 什么关系?

Q124:'胸片 instruct 二联’是什么?

Q125:和 CheXagent/MAIRA-2 什么关系?

Q126:第一代方案的定位合适吗?

Q127:后续有什么值得跟踪的?

FAQ-使用与复现(16 问)

Q128:官方推荐用途?

Q129:能当医学金标用吗?

Q130:适合什么下游任务?

Q131:不适合什么场景?

Q132:怎么接自己的报告生成模型?

Q133:两阶段训练怎么设计?

Q134:能只挑金标任务用吗?

Q135:能只挑 LLM 任务用吗?

Q136:任务判别怎么写?

Q137:缺图怎么办?

Q138:评测用什么数据集?

Q139:IU-Xray 是什么?

Q140:复现模型成绩需要什么?

Q141:20 倍消融怎么复现?

Q142:怎么引用本数据集?

Q143:有 companion model 吗?

FAQ-版本与演进(20 问)

Q144:v1.0.0 和 v1.1.0 差在哪?

Q145:v1.1.0 新增了哪三个任务?

Q146:report dropping 是哪个版本引入的?

Q147:report dropping 影响哪些任务?

Q148:三模式(金标/部分/无报告)的比例是多少?

Q149:IG/VC/RR 为什么在 1.1 才加?

Q150:老版本还能下载吗?

Q151:引用时引哪个版本?

Q152:两版本的构造代码一样吗?

Q153:论文版本和数据集版本怎么对应?

Q154:arXiv 有 v2 吗?

Q155:MIDL 2025 版和 v1 内容差多少?

Q156:未来还会有 v1.2 吗?

Q157:官方对未随发部分有什么说法?

Q158:report dropping 的三模式可以自己配置吗?

Q159:从 v1.0 升级到 v1.1 要重训吗?

Q160:三模式分布官方给了比例吗?

Q161:怎么判断拿到的是 v1.0 还是 v1.1 文件?

Q162:v1.1 的 QA 任务还需要金标报告吗?

Q163:两个版本可以混用吗?

FAQ 共 163 问——每问即一个检索意图锚点,答案散布于 §0-§9 与附录各节;为站内搜索与 AI 检索提供问题空间全覆盖索引。

§11 事实清单:逐条存照(每条可溯源至页面快照或论文交叉)

  1. 身份:RaDialog Instruct Dataset——PhysioNet 双版本:v1.0.0(2024-03-25,DOI 10.13026/zecj-bh52)→ v1.1.0(2024-07-12,DOI 10.13026/40d2-wj86)。
  2. 访问:Credentialed——License 1.5.0 + Credentialed DUA(页面顶部 ‘Credentialed Access’ 实测;512/522/523/524 批次七 Credentialed 四连)。
  3. slug 实测:radialog-instruct-dataset/1.0.0/ 与 /1.1.0/ 均 HTTP 200(快照 64,841 B)。
  4. Topics 3 个:medical image understaning(官方 typo 存照)/ radiology chatbot / radiology report generation。
  5. 作者 5 人(citation_author):Pellegrini, Chantal / Özsoy, Ege / Busam, Benjamin / Navab, Nassir / Keicher, Matthias——论文 6 人(+Benedikt Wiestler)存照。
  6. 机构:TUM CAMP(Computer Aided Medical Procedures,School of Computation, Information and Technology)+ TUM AI for Image-Guided Diagnosis and Therapy + MCML(Munich Center for Machine Learning)——全慕尼黑工大系。
  7. 论文:arXiv 2311.18681——v1(2023-11-30)‘RaDialog: A Large Vision-Language Model for Radiology Report Generation and Conversational Assistance’ → v3(2025-05-07)‘RaDialog: Large Vision-Language Models for X-Ray Reporting and Dialog-Driven Assistance’(MIDL 2025 接收,CC-BY 4.0,标题改写存照)。
  8. 页面要求双引:数据集(PhysioNet v1.1.0)+ 论文(arXiv 2311.18681)+ 平台(Pollard 2026 Nature Health 1(8):792-795)。
  9. 任务清单(v1.1.0,10 任务名/11 条目):金标 6 类——RG(报告生成,MIMIC-CXR)/ IG(印象生成,MIMIC-CXR,v1.1 新增)/ FQA 双变体(CheXbert 标签)/ RR(Rad-ReStruct QA,v1.1 新增)/ RE(MIMIC-NLE 解释)/ VC(视图分类,metadata,v1.1 新增);LLM 伪金标 4 类——RQA(区域问答)/ EL(通俗语言)/ SU(总结)/ CO(纠错)。
  10. 页面 Overview 段 ‘eight tasks, including report generation and seven instruct tasks’ 为 v1.0.0 遗留口径——与 v1.1.0 实列 10 任务名不一致(页面未全面更新,存照)。
  11. CPaQA/CPbQA(Release Notes 缩写)= FQA 的 complete/binary 两变体。
  12. Rad-ReStruct 是 Pellegrini et al. 2023 前作——本集 RR 任务金标源;原集高度不平衡→限制每类问题正负样本同数。
  13. v1.1.0 两项变更(Release Notes 原话归纳):①+3 任务(IG/VC/RR)②report dropping——CPbQA/CPaQA/RQA 提问随机三模式(a 金标报告在手/b 部分报告/c 无报告),‘encourage the model to pay more attention to the image’。
  14. 两轮对话构造:除 RG 外所有任务=第一轮 USER 报告生成→ASSISTANT 金标报告(‘reduce noise’)→第二轮 USER 任务指令→ASSISTANT;推理时第一轮由模型预测。
  15. CO 任务构造:非微调 vicuna 只凭预测标签(无图像)生成’必错报告’→CheXbert 对比金标找漏检/多报→构造 ‘I disagree…Please adapt the report.’ 纠错指令——唯一嵌入预测报告的任务。
  16. 每任务 10 条 prompt 模板手工定义,随机选用;GitHub data/instruct_prompts 公开。
  17. 规模数字零披露:页面与论文均无总条数——仅构造规则(RG 与 instruct 1:1 平衡/每图 1 个 instruct 任务/11 条目均分/分层采样)。
  18. 分层采样:positive findings 全保留,无 findings 减到 1/4(‘approximately match the test set distribution’——train 集健康人比例远高于 test)。
  19. 评测隔离:仅用 MIMIC-CXR/MIMIC-NLE train 集——官方声明可在 MIMIC test 或非重叠数据集上安全评测(论文 OOD 评测用 IU-Xray test)。
  20. 文件:mimic_cxr_instruct_stratified.json.gz——⚠️ 后缀 .gz 实为 bz2(页面代码块 bz2.open(…, ‘rt’, encoding=‘UTF-8’) 明示)——gzip 直接打开报错(本条目独家坑点)。
  21. 每条三字段:output(金标/伪金标回答)/ instruction(含 <IMG> 占位)/ dicom(MIMIC-CXR-JPG dicom_id)——图像不随发。
  22. 模型架构四组件:BioViL-T 图像编码器(X-ray 域对比预训练,patch-wise)+ BERT 对齐模块(BLIP-2 风格,32 LM token)+ CheXbert 分类器(结构化 findings 双分支)+ vicuna-7b LLM。
  23. 双分支价值:次要 findings 分支单独提升临床正确性 13.3%(v3 论文)。
  24. 训练方式版本差:页面 Abstract/v1 口径 parameter-efficient fine-tuning(Frontiers 综述同说 LoRA)vs v3 论文 end-to-end fine-tuning of both image encoder and LLM——两版演进存照。
  25. 模型成绩(v3 摘要):报告生成临床正确性 +15.0% vs 现有医疗 LVLM / 交互式报告修正 +23.4% / 放射科医生 84.0% 案例偏好。
  26. Instruct 价值消融(v1,Frontiers 综述转录):binary CheXpert QA F1 0.397(有 Instruct)vs 0.018(无)——20 倍;complete QA 0.403 vs 0.098。
  27. v3 成绩体系:RaDialog-align-report 39.4/0.40、align-instruct 38.6/0.39、project-report 39.7/0.36、project-instruct 39.2/0.37(CheXbert F1×100 + RadGraph F1 口径)——与 v1 消融数字不可混比。
  28. 伦理一句话:‘The authors declare no ethics concerns.’(页面 Ethics 全文)——与 524 GPT-4o 三连选退的时代对照存照。
  29. 资助:BMBF DIVA(13GW0469C)+ Bavarian StMWi ThoraXAI(DIK-2302-0002);COI 无。
  30. 模型发布渠道:GitHub ChantalMP/RaDialog + HF——未在 PhysioNet 另立模型条目(对照 524 radvlm-model 双实体策略)。
  31. 联系:chantal.pellegrini@tum.de。
  32. Usage Notes 定位原话:‘the main purpose of the provided dataset is to be able to mitigate catastrophic forgetting…we do not claim the instruct data to be completely medically correct’——防遗忘第一性+非金标声明。
  33. 快照体量:/tmp/523_page.html 64,841 B(v1.1.0)+ ar5iv 2311.18681 206,507 B——本条目所有页面数字的第一存照。
  34. DB 查重:radialog/instruct 相关 0 行(radvlm 624 为本轮 LIKE 命中)——MAX=624、总数 622 → 预期本条 rid 625。
  35. 本库近邻:mimic-cxr-jpg(617 主源)/ chexpert(512 标签体系)/ radvlm-instruction-dataset(624 姊妹)/ radgraph2(622)/ rad-coreference-resolution(621)。
  36. 胸片 instruct 二联:523(能聊,vicuna 时代,防遗忘使命)+ 524(能指,GPT-4o 时代,grounding 进 LLM)——15 个月演进的两侧锚点。
  37. 批次七收官:本条为 523 队列位——上线后 516-525 十条全齐。
  38. 信息缺口清单:①总量零披露 ②.gz 后缀撒谎 ③Overview 任务数遗留 ④arXiv v2 缺席(v1→v3)⑤MIMIC-NLE/Rad-ReStruct 细节依赖外部文献。

事实清单共 38 条——每条对应一次页面/论文/DB 读取,编号即存照序。

§12 术语表:五十条

1. RaDialog Instruct Dataset:TUM 团队的胸片多任务指令微调数据集——10 任务名/11 条目,防遗忘设计第一性。
2. RaDialog(模型):vicuna-7b+BioViL-T+CheXbert 分类器双分支的胸片对话助手——GitHub/HF 发布。
3. catastrophic forgetting(灾难性遗忘):LLM 微调后通用/对话能力衰退的现象——本集的核心设计动机。
4. 回放式持续学习(replay-based continual learning):用多样任务’复习’旧技能缓解遗忘的思路——本集 LLM 伪金标构造的类比来源。
5. instruct dataset(指令数据集):多任务指令-回答对组织的 SFT 数据——LLaVA 范式在胸片域的落地。
6. vicuna-7b:RaDialog 的 LLM 主干(LLaMA 微调系)——被 Instruct 数据集微调。
7. vicuna-13b:非微调的更大 vicuna——4 个任务的伪金标生成器(zero-shot)。
8. BioViL-T:微软 X-ray 域对比学习预训练编码器——RaDialog 的视觉前端。
9. BLIP-2 风格对齐:BERT 模块把视觉特征转 32 个 LM token——Q-Former 思路的简化实现。
10. CheXbert:报告自动标注器——标签引擎+结构化 findings 分支的监督来源。
11. CheXpert labels(14 类):FQA 任务的标签空间——本库 512 CheXpert 条目同源。
12. secondary image branch:结构化 findings 双分支——单独提升临床正确性 13.3%。
13. RG:Report Generation 报告生成任务——唯一第一轮任务,MIMIC-CXR 金标。
14. IG:Impression Generation 印象生成——findings→impression,v1.1 新增。
15. FQA-complete / FQA-binary:Findings QA 双变体——列全部异常/单个 yes-no;CPaQA/CPbQA 同物。
16. RR:Rad-ReStruct QA——存在/位置/外观细粒度问答,Pellegrini 前作金标,v1.1 新增。
17. RE:Reasoning/Natural Language Explanation——诊断推理与报告证据定位,MIMIC-NLE 金标。
18. VC:View Classification 视图分类——AP/PA/LL/lateral,metadata 金标,v1.1 新增。
19. RQA:Region QA 区域问答——心脏/肺等区域的 binary 或开放问答(vicuna 伪金标)。
20. EL:Easy Language 通俗语言——报告转儿童能懂的话(vicuna 伪金标)。
21. SU:Summarization 总结——要点式报告摘要(vicuna 伪金标)。
22. CO:Correction 纠错——基于构造错误报告的修正交互(唯一用预测报告的任务)。
23. report dropping:v1.1 反捷径设计——QA 任务随机金标/部分/无报告三模式,逼模型看图。
24. 两轮对话构造:金标报告打底+任务指令跟进的训练结构——降噪声设计。
25. MIMIC-NLE:Kayser 2022 的自然语言解释数据集——RE 任务金标源。
26. Rad-ReStruct:Pellegrini 2023 的结构化报告 QA 数据集——RR 任务金标源。
27. IU-Xray:OpenI 胸片报告数据集——论文 OOD 评测用。
28. MIDL:Medical Imaging with Deep Learning 会议——论文 v3 正式发表处(2025)。
29. BMBF DIVA:德国联邦教研部资助项目(13GW0469C)。
30. ThoraXAI:巴伐利亚州 StMWi 资助项目(DIK-2302-0002)。
31. bz2:实际压缩格式——与 .gz 后缀不符,须 bz2.open 读取(独家坑点)。
32. <IMG> 占位:instruction 中的图像特征嵌入位——非文件名。
33. dicom_id:MIMIC-CXR-JPG 的图像索引键——图像对齐的凭据。
34. stratified sampling(分层采样):positive 全保留+无 findings 减 1/4——匹配 test 分布。
35. 参数高效微调(PEFT/LoRA):v1 论文的训练方式口径——v3 改为端到端全参。
36. 端到端全参微调:v3 论文口径——图像编码器与 LLM 全解冻(版本差存照)。
37. anti-shortcut(反捷径):report dropping 的设计哲学——主动制造信息缺失防依赖。
38. 任务均分:11 条目样本均衡分配——防任务偏斜。
39. 每图一任务:每张图只带一个 instruct 任务——防同图多任务过拟合。
40. zero-shot 生成:vicuna-13b 无微调直接生成伪金标——质量受模型能力封顶。
41. CheXbert F1:临床正确性主指标(v3 成绩 39.4-39.7 即 ×100 口径)。
42. RadGraph F1:报告结构化正确性次指标(v3 成绩 0.36-0.40)——与本库 622 RadGraph2 同源。
43. radialog-instruct-dataset:官方 slug——批次登记 ‘RaDialog’ 为简称。
44. DAIMS:本库 AI-Ready 评估体系——本条目 6.6(总量不透明扣分)。
45. rai:dataLimitations:AI-Ready 元数据字段——本条目 7 条限制存照。
46. RRID:SCR_007345:PhysioNet 平台通用研究资源标识符。
47. 胸片 instruct 二联:523+524 本库双条目组合——胸片对话助手两代方案的完整存档。
48. Credentialed DUA:数据使用协议——与 CITI 课程、注册共同构成三件套。
49. MCML:Munich Center for Machine Learning——一作双挂机构。
50. rai 第一代方案:社区语境:523 是胸片对话 instruct 的第一个完整公开方案(官方自述 first thoroughly evaluated and publicly available)。
51. report dropping 三模式:金标报告在手/部分报告/无报告的随机三选——v1.1 QA 类专属设计。
52. anti-shortcut:反捷径设计哲学——主动制造信息缺失逼模型依赖图像。
53. 两代成绩体系:v1 消融(0.018→0.397)与 v3 四组合(39.4 等)——不可互比,引用带版本。
54. 评测隔离声明:官方 train-only 构造声明——评测隔离从使用者责任转为出厂属性。
55. 一作前作复用:Rad-ReStruct(Pellegrini 2023)作为金标源——同作者数据生态的纵向整合。
56. 合规代际对照:523 一句话伦理 vs 524 三连选退——2024 与 2025 的合规成熟度断层样本。
57. 任务规格表:附录 E 的十任务全字段对照——复现与统计的基准文件。
58. guess_task 聚类:本条目 §9.2 的推断式任务统计——官方零披露下的自数方案。
59. drop_mode 分桶:§9.6 的三模式统计——顺带当版本指纹(no-report=0 即 v1.0 文件)。
60. 两轮结构复习效应:金标报告打底让 RG 能力在每条样本被免费复习——课程学习的低成本实现。
61. 开源构造代码:GitHub data/ 管线全公开——官方唯一权威分类与自建同构数据的依据。

术语表共 61 条——覆盖任务/方法/模型/许可/人物五域,交叉引用见附录 C 术语索引。

附录 A:数据集速查卡(一屏版)

属性 值
名称 RaDialog Instruct Dataset
slug radialog-instruct-dataset
版本 v1.0.0(2024-03-25)/ v1.1.0(2024-07-12)
DOI v1.0:10.13026/zecj-bh52 / v1.1:10.13026/40d2-wj86
访问 Credentialed(License 1.5.0 + DUA + CITI)
类型 胸片多任务对话指令微调数据(文本+指针,图像不随发)
总量 未披露(页面/论文零数字;仅构造规则)
任务 10 任务名/11 条目:金标 6 类(RG/IG/FQA-c/FQA-b/RR/RE/VC)+ 伪金标 4 类(RQA/EL/SU/CO)
对话结构 两轮式(金标报告→任务指令);v1.1 QA 类 report dropping 三模式
格式 mimic_cxr_instruct_stratified.json.gz(实为 bz2)——output/instruction/dicom 三字段
标签引擎 CheXbert(标签)+ vicuna-13b zero-shot(4 任务)+ MIMIC-NLE/Rad-ReStruct(金标源)
消费模型 RaDialog(vicuna-7b + BioViL-T + BERT 对齐 32 token + CheXbert 双分支)
模型成绩 临床正确性 +15.0% / 修正 +23.4% / 医生偏好 84.0%;消融 QA F1 0.397 vs 0.018
第一性目标 缓解灾难性遗忘(“we do not claim the instruct data to be completely medically correct”)
评测隔离 仅 MIMIC-CXR/MIMIC-NLE train 集构造——MIMIC test/IU-Xray 评测安全
模型发布 GitHub ChantalMP/RaDialog + HF(PhysioNet 无模型条目)
语言 英语
团队 TUM 全系 5 人(数据集)/ 6 人(论文 +Wiestler)
论文 arXiv:2311.18681(v1 2023-11-30 → v3 2025-05-07 MIDL 2025)
资助 BMBF DIVA 13GW0469C + Bavarian StMWi ThoraXAI DIK-2302-0002

附录 B:关键时间线

时间 事件
2022 MIMIC-NLE(Kayser et al.)发布——RE 任务金标源就位
2023 Rad-ReStruct(Pellegrini et al.)发布——一作前作,RR 任务金标源就位
2023-11-30 arXiv 2311.18681 v1 提交——“RaDialog: …Report Generation and Conversational Assistance”
2024-03-25 数据集 v1.0.0 挂牌 PhysioNet(8 任务条目,DOI zecj-bh52)
2024-07-12 v1.1.0 发布:+IG/VC/RR 三任务 + report dropping(DOI 40d2-wj86)
2025-05-07 论文 v3(MIDL 2025 接收,标题改为 “…for X-Ray Reporting and Dialog-Driven Assistance”)
2025-02→09 524 RadVLM 论文与数据集先后发布——第二世代(grounding+GPT-4o 全链)接力
2026-09 本条目核查快照(v1.1.0 页面 64,841 B + ar5iv 206,507 B)

附录 C:术语交叉索引(按字母序)

术语 首现节 关联术语
0.018 → 0.397 §5.3 20 倍 / 消融
BioViL-T §5.1 图像编码器
bz2 陷阱 §4.3 .gz 后缀
CO(纠错) §3.3 预测报告
CPaQA/CPbQA §4 FQA 变体
灾难性遗忘 §2.1 防遗忘 / 回放
FQA §3.1 CheXbert
IG §3.1 印象生成
IU-Xray §4.5 OOD 评测
MIMIC-NLE §3.1 RE 金标
MIDL 2025 §6.1 论文 v3
PEFT vs 端到端 §5.2 版本差
pseudo ground truth §3.2 vicuna-13b
Rad-ReStruct §3.1 RR / 前作
report dropping §3.4 反捷径
RE §3.1 解释
RQA §3.2 区域问答
RG §3.1 报告生成
stratified sampling §4.1 1/4 裁剪
SU §3.2 总结
two-turn structure §4.2 金标打底
VC §3.1 视图分类
vicuna-7b / 13b §5.1 / §3.2 主干 / 生成器
总量零披露 §4.1 构造规则
任务均分 §3.5 每图一任务
双分支 §5.1 +13.3%
评测隔离 §4.5 train-only
反捷径 §3.4 report dropping
524 对照 §6.2 instruct 二联
官方 typo §1 understaning

附录 D:文件清单与读取顺序(推荐入门路径)

  1. 先读页面:PhysioNet v1.1.0 页面的 Methods(任务构造)+ Data Description(字段与读取代码)+ Usage Notes(定位声明)——十分钟建立全局
  2. 再看论文:arXiv 2311.18681 v3 的附录 C(任务与 prompt 细节)+ §4(实验)——注意 v1/v3 训练方式口径差
  3. 对照源库:MIMIC-CXR-JPG(617)条目——理解 dicom_id 对齐
  4. 申请访问:PhysioNet Credentialed 三件套 → 下载 mimic_cxr_instruct_stratified.json.gz
  5. 正确读取:bz2.open(§9.1)——别信 .gz 后缀
  6. 统计自检:len(data) 得总量 + guess_task 聚类(§9.2)对照 11 条目
  7. 图像对齐:MIMIC-CXR-JPG 按 dicom_id 建索引(§9.3)→ 缺图清零
  8. 训练接入:两轮对话展开(§9.4)→ 自己的 SFT 框架;评测只碰 MIMIC test / IU-Xray

附录 E:十任务完整规格表(复现基准)

任务 全称 金标来源 生成方式 v1.1 变化 示例指令
RG Report Generation MIMIC-CXR 报告 官方固定 prompt 无 “act as a radiologist…write the finding section”
IG Impression Generation MIMIC-CXR 金标抽取 新增 “Summarize the radiology report findings into an impression section.”
FQA-c Findings QA (complete) CheXbert 标签 金标抽取 report dropping “List all the finding in this report.”
FQA-b Findings QA (binary) CheXbert 标签 金标抽取 report dropping “Is there evidence of <PATHOLOGY> in the report?”
RR Rad-ReStruct QA Rad-ReStruct 金标抽取 新增 + report dropping “Is there a density in the thorax? …What are the attributes?”
RE Reasoning/NLE MIMIC-NLE 金标抽取 无 “Why do you think the patient has <PATHOLOGY>?”
VC View Classification MIMIC-CXR metadata 金标抽取 新增 “Was this image taken from the frontal or lateral view”
RQA Region QA —(vicuna-13b) 伪金标 report dropping “Is the patient’s heart healthy?”
EL Easy Language —(vicuna-13b) 伪金标 无 “Explain this report in very easy terms, such that a child would understand.”
SU Summarization —(vicuna-13b) 伪金标 无 “Summarize this report with bullet points.”
CO Correction —(vicuna-13b×CheXbert 对比) 伪金标+预测报告 无 “I disagree…I think the patient has <MISSING>, but does not have <ADDED>.”

读表要点:金标列的"—"即伪金标任务;v1.1 变化列的 report dropping 只覆盖 QA 类(FQA-c/FQA-b/RR/RQA——Release Notes 的 CPbQA/CPaQA/RQA 缩写对应);CO 的构造链最长(生成→打标→对比→出题)。

附录 F:构造规则核算(总量推断的数学框架)

官方只给规则不给数——复算框架如下(供下载后验证):

  1. 候选池:MIMIC-CXR train 集(377,110 图中的 train 部分,官方分划约 33 万级图-报告对)
  2. 非空 findings 过滤:剔除 findings 段为空的报告(页面明示"non-empty findings section")
  3. 分层裁剪:positive findings 全保留;无 findings 裁到 1/4
  4. RG 样本:分层后的图集 → 每图 1 条 RG 样本
  5. instruct 样本:与 RG 同量(1:1 平衡),每图 1 条,11 条目均分
  6. 总量 = RG 数 + instruct 数 = 2 × RG 数

推断下界:MIMIC-CXR train 中 positive findings 比例通常约 70-75%,若 RG 样本在 10 万量级则总量 20 万级——但此为推理非事实,官方未确认。下载后 len(json.load(...)) 才是唯一可信数字。

附录 G:AI-Ready 评估细目(十维打分)

维度 分 依据
数据可得性 6 Credentialed 中间档;文本即全部(轻量);图像须对齐 MIMIC-CXR-JPG
格式标准化 5 自有格式(非 LLaVA 标准)——接入需自己写转换层;bz2 陷阱扣分
标注质量 6 金标/伪金标双轨诚实声明;CheXbert 自动层可含错;零人工抽检
文档完备 7 任务构造/prompt 结构/读取代码全披露;总量缺失+Overview 遗留扣分
可复现性 8 构造代码开源+prompt 模板公开+规则完整——可自建同构数据
伦理完备 5 一句话声明(时代局限);无 LLM API 合规专项(对照 524 三连选退)
规模 5 总量未知(无法核数);MIMIC train 量级但口径不透明
任务覆盖 8 10 任务名/11 条目——对话助手向最全的 v1.1 配方
生态整合 6 MIMIC 生态内通;非标准格式限制跨框架流动;模型在 GitHub/HF
长期维护 6 双版本演进记录清晰(+3 任务+report dropping);2025 后无更新存照

DAIMS 综合:6.6(数据 6 / 标注 6 / 方法 8 / 影响 7 / 规模 6 加权口径——详见 §7;与 623 REFLACX 同分档)。

附录 H:与 524 RadVLM 的全维对照(instruct 二联)

维度 523 RaDialog Instruct(本条) 524 RadVLM Instruction
发布时间 2024-03/07(两版) 2025-09(单版)
论文 2023-11(MIDL 2025 正式) 2025-02
团队 TUM 单系 5/6 人 UZH+ETH 双核 15 人(+日本 3)
任务数 10 名/11 条目 5 族 8 行(+对话)
grounding 无坐标任务 3 项(解剖/异常/短语)
对话 两轮结构化(金标打底) 多轮 87k(GPT-4o 全生成)
LLM 参与度 4/11 条目伪金标 清洗+对话全链
总量披露 零数字 表 1 精确到个位
格式 自有三字段 LLaVA 标准
压缩陷阱 bz2 冒充 gz 无
图像编码器 BioViL-T(域专用) SigLIP(通用)
LLM 基座 vicuna-7b LLaVA-OneVision-7B(Qwen)
训练方式 PEFT→端到端(两版) 端到端 1 epoch 双 lr
第一性目标 防遗忘 SOTA 配方
模型发布 GitHub/HF PhysioNet 双实体
伦理声明 一句话 三连选退详细链
消融证据 0.018→0.397(20 倍) 多任务小标注场景收益
DAIMS 6.6 7.4

读表要点:两代方案的差不是"对错"而是 15 个月的方法论演进——523 解决"能不能聊且不忘"(2023 问题),524 解决"能不能指、能不能合规"(2025 问题)。本库双条目合读=胸片对话助手演进的完整切片。

附录 I:引用模板

I.1 数据集引用(PhysioNet 官方口径)

@article{PhysioNet-radialog-instruct-dataset-1.1.0,
  author = {Pellegrini, Chantal and {\"O}zsoy, Ege and Busam, Benjamin and
            Navab, Nassir and Keicher, Matthias},
  title = {{RaDialog Instruct Dataset}},
  journal = {{PhysioNet}},
  year = {2024},
  month = jul,
  note = {Version 1.1.0},
  doi = {10.13026/40d2-wj86},
  url = {https://doi.org/10.13026/40d2-wj86}
}

I.2 论文引用(页面要求同时引)

@article{pellegrini2023radialog,
  title = {{RaDialog}: A Large Vision-Language Model for Radiology Report
           Generation and Conversational Assistance},
  author = {Pellegrini, Chantal and {\"O}zsoy, Ege and Busam, Benjamin and
            Wiestler, Benedikt and Navab, Nassir and Keicher, Matthias},
  journal = {arXiv preprint arXiv:2311.18681},
  year = {2023}
}

(v3 正式版:MIDL 2025,PMLR 卷号待出——引用时按会议最终版更新;v3 标题已改写)

I.3 平台引用

Pollard, T., Moody, B. E., Lehman, L., et al. (2026). PhysioNet as a global platform for biomedical research. Nature Health, 1(8), 792-795. https://doi.org/10.1038/s44360-026-00096-z

I.4 金标源引用义务

源 用途 引用要点
MIMIC-CXR RG/IG/VC 金标+图像 Johnson et al. 2019(本库 617)
MIMIC-NLE RE 金标 Kayser et al. 2022
Rad-ReStruct RR 金标 Pellegrini et al. 2023(一作前作)
CheXbert 标签引擎 Smit et al. 2020
BioViL-T 图像编码器 Bannur et al. 2023

I.5 致谢链(页面 Acknowledgements 完整转录)

BMBF(德国联邦教研部)DIVA 项目 13GW0469C|Bavarian StMWi ThoraXAI 项目 DIK-2302-0002。COI:无。Ethics:无特别声明。

附录 J:高频问题快答表(十连发)

问题 一句话答案 详处
总共多少条? 官方零披露——下载后 len(json) 自数 §4.1 / 附录 F
文件怎么读? bz2.open——.gz 后缀撒谎 §4.3 / 坑点1
任务几个? 10 名/11 条目("eight"是 v1.0 遗留) §3 / 坑点4
答案可靠吗? 6 类金标+4 类 vicuna 伪金标;官方不声称医学正确 §3.2 / 坑点3
图像在哪? 不随发——dicom_id 对齐 MIMIC-CXR-JPG §4.4 / 坑点5
两轮对话第一轮是谁答的? 训练=金标报告;推理=模型自己 §4.2
CO 任务的错误是真的吗? 构造的(vicuna 凭标签生成必错报告) §3.3 / 坑点7
评测用什么? MIMIC test / IU-Xray——本集样本是训练集 §4.5 / 坑点6
模型在哪下? GitHub/HF——PhysioNet 只有数据集 §5.4
价值证明? 消融 0.018→0.397(20 倍防遗忘证据) §5.3

附录 K:与同代方案横向对照

维度 RaDialog Instruct(本集) RadVLM Instruction(624) LLaVA-Med
领域 胸片对话全任务 胸片五任务+grounding 泛医学图文
金标比例 7/11 条目(其余 vicuna 伪金标) 全任务有源标注(对话 GPT-4o) GPT-4 蒸馏
坐标任务 无 3 项 无
标准格式 自有(3 字段) LLaVA 标准 LLaVA 标准
平台 PhysioNet Credentialed HuggingFace 开放
合规声明深度 一句话 三连选退+平台指南 MIT 宽松
防遗忘设计 显式(report dropping+任务多样性) 隐式(多任务本身) 无
消融证据 20 倍 QA 提升 多任务小标注收益 任务泛化

读表延伸——透明度系数观察:把"官方披露的数字密度"当数据集成熟度的一个旁路指标:本集页面/论文合计披露的有效规模数字为 0(只有比例规则);524 RadVLM 同口径为 14 个(表 1 八行+总量+对话分解);522 RadGraph2 为 9 个。三个同期指令/结构化数据集的披露密度 0:14:9 的差异与"团队数据工程文化"相关性大于与"数据质量"的相关性——使用者的启示:披露密度低不等于数据差,但意味着你的统计脚本要更厚(本条目 §9.2/§9.6 两个统计器就是为此准备的)。

附录 L:条目读法指南(三分钟版)

你要训练胸片对话助手? §3(任务配方)+ §4(构造规则)+ §9(读取管线)——bz2 陷阱与 dicom 对齐是前两个必须踩稳的点。

你研究持续学习/灾难性遗忘? §2.1(问题定义)+ §5.3(20 倍消融)+ 附录 E(任务规格表)——这是公开数据里少见的"任务多样性防遗忘"量化证据。

你做数据治理/合规? §8 误解三 + §4.3(bz2)+ 附录 H 对照列——"零数字披露+后缀撒谎"是数据集透明度的反面教材标本;524 是同代正面样板。

你是评审/调研者? §5.2(PEFT vs 端到端版本差)+ §10 信息缺口清单 + §11 事实清单第 36 条——引用口径的三处暗礁都在这。

你是教学者/写作者? §0.2 三个数字 + §3.3(CO 机关)+ 附录 F(核算框架)——"总量保密的数据集怎么写"是个绝佳的数据新闻练习题。

三分钟版总结:RaDialog Instruct Dataset 是胸片对话助手的第一代公开 instruct 方案——TUM 团队用 10 个任务(金标与 vicuna 伪金标各半)、两轮对话构造与 report dropping 反捷径设计,把"缓解灾难性遗忘"做成了数据集的正式使命(消融:QA F1 20 倍提升)。它总量保密、后缀撒谎、伦理一句话——第一代的粗糙与诚实并存;但任务配方与构造代码全开源,MIDL 2025 正式背书,与 524 RadVLM 构成本库"胸片 instruct 二联",合读即 15 个月的方法论演进史。

附录 M:工程边界案例大全(读取/转换/训练)

M.1 读取层

案例 正确姿势 错误姿势的报错
打开文件 bz2.open(path, 'rt', encoding='UTF-8') gzip.open → BadGzipFile
大文件内存 json.load 一次载入(纯文本体量可控) ijson 流式亦可(bz2 流上逐条)
Windows 编码 显式 UTF-8 GBK 默认 → UnicodeDecodeError
重复加载 解析结果缓存为 parquet/pickle 每轮训练重解 bz2(纯时间浪费)

M.2 转换层

案例 处理
<IMG> 占位 保留原样进训练管线(模型侧替换为视觉 token);文本清洗时跳过
dicom_id 一律字符串;与 MIMIC-CXR-JPG metadata csv 的 dicom_id 列左对齐 join
多轮结构 第一轮答案固定金标报告;自定义框架需模拟该结构而非拍平单轮
report dropping v1.1 的 QA 样本 instruction 可能含部分/无报告上下文——统计时按模式分桶

M.3 训练层

案例 处理
任务均衡 11 条目官方已均分——若自行重采样保持均衡或做任务加权
伪金标降权 RQA/EL/SU/CO 可降 loss 权重(0.5 起试)——官方未给方案,属使用者自决
评测隔离 训练集 dicom 池永不进评测;MIMIC test 泄漏自检脚本必跑
复现对表 引用成绩注明论文版本(v1 PEFT / v3 端到端)+任务+指标三元组
金标/伪金标分轨 FQA/RE 等金标任务可单独抽出做高置信 SFT;RQA/EL/SU/CO 另轨——两轨别混权重
变体去重审计 每任务 10 条 prompt 模板——同一 dicom 只应出现一次;出现多次说明数据被重复构造

附录 N:任务判别关键词库(统计脚本用)

任务 高置信关键词(instruction 字段)
RG “write the finding section” / “act as a radiologist”
IG “impression section”
FQA-c “List all the finding”
FQA-b “Is there evidence of”
RR “What are the attributes” / “Rad-ReStruct 式问答结构”
RE “Why do you think”
VC “frontal or lateral” / “perspective” / “AP, PA”
RQA “heart” / “lung” + healthy/ question 句式(与 FQA 区分:区域而非病理标签)
EL “very easy terms” / “child” / “simpler”
SU “bullet points” / “Summarize”
CO “I disagree” / “Please adapt the report”

使用说明:关键词按优先级顺序匹配(RG 最先——它是第一轮任务;CO 最后——含特殊句式);UNKNOWN 桶应 <5%,超限说明 prompt 模板有变体需扩充词库。此库为推断工具,官方唯一权威分类是构造代码(GitHub data/ 管线)。

扩展建议:先用本库跑一遍 UNKNOWN 率——若 RR 与 RQA 混淆(两者都问解剖结构),加"attributes"(RR 专属)与"region-specific"(RQA)两个判别词;FQA 与 RQA 的分界是"病理标签 vs 身体区域"——出现 CheXpert 14 类词(effusion/cardiomegaly 等)走 FQA,出现 heart/lungs/mediastinum 走 RQA。两个统计脚本(§9.2/§9.6)与本库配套使用,即可在官方零披露下重建完整数据画像。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • reflacx-xray-localization — 共享标签:医学影像 / 医疗NLP / 多模态 / X光影像
  • radvlm-instruction-dataset — 共享标签:医学影像 / 医疗NLP / 多模态 / X光影像
  • mimic-cxr — 共享标签:医学影像 / 多模态 / X光影像
  • latte-cxr — 共享标签:医学影像 / 多模态 / X光影像
  • ms-cxr-t — 共享标签:医学影像 / 医疗NLP / 多模态 / X光影像
  • rsna-series — 共享标签:医学影像 / 多模态 / X光影像
  • mimic-iv-note — 共享标签:医学影像 / 医疗NLP / X光影像
  • ms-cxr — 共享标签:医学影像 / 多模态 / X光影像
  • gmai-mmbench — 共享标签:医学影像 / 医疗NLP / 多模态
  • chexpert-plus — 共享标签:医学影像 / 医疗NLP / X光影像

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集