信息速览
INFOBOX:lunguage 速览
| 字段 | 值 |
|---|---|
| 数据集 | Lunguage: A Benchmark for Structured and Sequential Chest X-ray Interpretation v1.0.0 |
| slug | lunguage(lung+language 双关) |
| 发布 | 2026-01-11|PhysioNet(全批最新鲜——挂牌仅 8 个月) |
| DOI | 10.13026/pk42-4v91 |
| 访问 | Credentialed(License 1.5.0 + DUA 1.5.0 实测) |
| 规模 | 1,473 单报告(17,949 实体+23,307 关系-属性对)+80 纵向序列(41,122 比较) |
| 结构 | schema 对齐词表(pf/cf/cof+UMLS)+18 关系类型 |
| 团队 | KAIST 5 人+微软 Health Futures 3 人+韩医院所+根特大学(13 人) |
| 论文 | arXiv 2505.21190 + CHIL 2026(PMLR 333:1-50) |
| 指标 | LunguageScore(entity/relation/attribute 级+时间一致性) |
| 一句话 | 给报告生成 AI 一把"时间尺":不但要说对,还要在时间线上说对 |
§0 摘要卡:报告生成 AI 的第一次"时间考试"
§0.1 名称与口径声明
本条目记录 PhysioNet 数据集 Lunguage(slug:lunguage,lung+language 双关),v1.0.0,2026-01-11 发布,DOI 10.13026/pk42-4v91,Credentialed(License 1.5.0 + DUA 1.5.0)。它是结构化放射报告的金标准基准:1,473 份专家标注报告(MIMIC-CXR test 子集)+80 份纵向序列标注(10 患者的疾病进展时间线)+schema 对齐词表。
版本数字演化存照:arXiv v1 写"80 sequential reports from 10 patients";CHIL 2026 版写"186 of them contain longitudinal annotations"——数字在版本间演化,正文按 PhysioNet 页面口径(80 序列/10 患者)并在此存照。
§0.2 读者收益清单
- 报告生成评测团队:首个 patient-level 纵向评估基准——"no change in pneumonia"这类时间表述第一次可以被验证(先前所有协议都是单报告孤立评估)
- 结构化抽取研究者:17,949 实体+23,307 关系-属性对的金标准+schema 对齐词表(pf/cf/cof+UMLS)——细粒度信息抽取的训练/评测双资产
- 指标设计者:LunguageScore 的"实体-关系-属性+时间一致性"四层结构是可解释评测指标的设计范本
- 医疗NLP教学者:从 RadGraph 到 RadGraph2 到 Lunguage 的结构化报告演进线——三代技术的对照教材
- 多机构协作团队:KAIST+微软+三所韩国医院的跨国标注组织样本
§0.3 本条目与其他条目的阅读组合
- cxr-pro(508):同为报告文本的结构化工作——508 删除 prior 引用(去幻觉),514 把 prior 比较本身结构化(时间线实体)——"删"与"构"的两种文本手术
- MIMIC-CXR 家族(506-511):dicom_id/subject_id 连通;本集是报告层的结构化深化(对照 508 的 impressions 全文处理)
- MS-CXR(若库内):微软团队的姊妹资产——MS-CXR 做视觉-语言对齐,Lunguage 做报告结构化——微软 Health Futures 的两条产品线
§0.4 身份卡:一条命令背下这个数据集
名称 Lunguage: A Benchmark for Structured and Sequential CXR Interpretation
版本 v1.0.0(2026-01-11,唯一版本)
DOI 10.13026/pk42-4v91
访问 Credentialed(License 1.5.0 + DUA 1.5.0)
规模 1,473 单报告(17,949 实体+23,307 关系对,18 类型)
+80 纵向序列(10 患者,41,122 两两比较)
词表 schema 对齐(pf/cf/cof+UMLS 码)
标注 board-certified radiologists 标注+验证
论文 arXiv 2505.21190 + CHIL 2026(PMLR 333:1-50)
团队 KAIST 5+微软 3+韩国院所+根特(13 人)
它的故事一句话:报告生成 AI 从来没考过"时间"这门课——Lunguage 用 80 条疾病进展时间线和 4 万次两两比较,把"时间推理"第一次变成了可打分的考题。
§1 出身与谱系:KAIST 与微软的第二次握手
§1.1 团队的双核结构
KAIST(韩国科学技术院)5 人(一作 Moon Jong Hak、通讯 Edward Choi 等)承担主体工作;Microsoft Research Health Futures 3 人(Harshita Sharma、Daniel C. Castro、Javier Alvarez-Valle)——MS-CXR 数据集的原班人马。加上 Seoul National University Hospital/Seoul Medical Center/Yeungnam University 的临床放射科医生与 Ghent University 的 Rabaey——13 人的跨国矩阵。
微软线的关键意义:MS-CXR(微软的 phrase grounding 集,1,153 对)与 Lunguage 出自同一个 Health Futures 组——微软在胸片多模态资产上的双线布局(视觉-语言对齐线+报告结构化线)。
§1.2 结构化报告的演进谱:RadGraph→RadGraph2→Lunguage
本集站在一条清晰的谱系上:RadGraph(Jain 2021,实体+关系抽取)→ RadGraph2(Khanna 2023,疾病进展的层级信息抽取)→ Lunguage(Moon 2026,schema 对齐+纵向序列+专家验证)。三代的递进:从"抽取"到"建模进展"到"可评测的金标准"。页面 References 的 [1][2] 正是 RadGraph/RadGraph2——谱系的自觉引用。
§1.3 时间线年表
2025-05 arXiv 2505.21190 v1 提交
2026-01-11 PhysioNet v1.0.0 挂牌
2026 CHIL 2026(Conference on Health, Inference and Learning)收录,PMLR 333:1-50
2026-04-28 arXiv v2 更新
2026-09 核查时点:Views 55(挂牌 8 个月——全批最低,新集属性)
§1.4 用户画像:谁该用、谁不该用
该用:① 报告生成/结构化系统的评测团队(首个纵向金标准);② 信息抽取研究者(17,949 实体+23,307 关系对的训练/评测);③ 时间推理(temporal reasoning)方法学者(41,122 两两比较);④ 医学本体互操作研究者(UMLS 对齐词表)。
不该用:① 大规模预训练(1,473 份太少—— silver-standard 代码是扩展路径);② 图像侧任务(本集是纯文本结构化,无图像内容);③ 韩国语料需求(英语报告)。
§1.5 名词速查表
| 术语 | 含义 |
|---|---|
| Lunguage | lung+language 双关——本基准名 |
| 结构化报告 | 把自由文本报告转为实体-关系-属性的机器可读表示 |
| 实体(entity) | 报告中的临床对象(发现/解剖/疾病)——17,949 个 |
| 关系-属性对 | 实体间关系及其属性——23,307 对,18 种关系类型 |
| pf/cf/cof | 词表的三大类:Perceptual Findings/Contextual Findings/Clinical Objective Findings |
| ENTITYGROUPS | 语义等价观测的分组(纵向比较的单元) |
| TEMPORALGROUPS | 时间对齐的临床情节分组 |
| LunguageScore | 实体/关系/属性级+时间一致性的可解释评估指标 |
| CHIL | Conference on Health, Inference and Learning(PMLR,本论文发表处) |
| UMLS | 统一医学语言系统——词表的概念码对齐目标 |
§1.8 时间线与发布节奏
挂牌(2026-01)与 CHIL 收录同年——学术发表与数据公开的同步节奏。全批最新:2026-01-11 距核查时点仅 8 个月——Views 55 的低数字主要是时间因素(对照 509 挂牌 8 个月时 Views 74 的同量级)。新集的低曝光不构成质量信号。
§2 语境与设计逻辑:时间推理的评测化
§2.1 "no change in pneumonia"问题:单报告评估的结构性缺陷
论文 Introduction 的核心论证:既有 40+ 评估协议(RadGraph/RadGraph2/各种 F1 变体)都是单报告孤立评估——"no change in pneumonia"这句话的对错,取决于前片有没有肺炎——孤立评估在结构上无法判定。纵向推理(longitudinal reasoning)是放射科读片的本质(对比是本职工作),却是所有评测协议的盲区。Lunguage 的 80 序列+41,122 两两比较就是把这个盲区变成考题。
§2.2 细粒度的两个维度:实体粒度与属性粒度
论文的第二个批评:既有框架把"2.5 cm right upper lobe nodule with spiculated margins"压扁成"nodule"——位置/尺寸/形态全丢。Lunguage 的 schema 保留:① 实体子类(pf 的 Diagnostic Observations 303/Anatomical Entities 157/Diseases 76 等细分);② 属性(位置精确到"carina above 3cm"、尺寸精确到"2.5 cm");③ 关系类型(18 种)。细粒度的评测意义:能区分"精确但啰嗦"与"简洁但遗漏"的输出——粗指标的天花板被打破。
§2.3 词表的三类结构与 UMLS 对齐
schema 对齐词表的三类:pf(Perceptual Findings,感知发现——影像直接所见)、cf(Contextual Findings,情境发现——临床语境的诊断,如 congestive heart failure)、cof(Clinical Objective Findings,临床客观发现)。每类含子类计数(如 pf 的 Diagnostic Observations 303 项)与 UMLS 概念码(部分空缺存照)。UMLS 对齐使本集的实体可与外部医学本体互操作——schema 对齐是结构化资产的"通用语"工程。
§2.4 与 508 的"删"与"构"对照(扩展)
508 的 GILBERT 是减法手术(删除 prior 指涉——去掉幻觉源);本集是加法手术(把时间比较结构化为实体关系——显式化时间推理)。两者共享一个前提:报告的自由文本形态是 AI 应用的障碍。508 的答案是把障碍删掉(让训练语料纯净),514 的答案是把障碍结构化(让时间语义可计算)——删与构是文本工程的两种基本操作,在 MIMIC 家族中恰好各占一个条目。
§2.5 证据层级小结
本集的证据位置:专家验证的评测金标准层——board-certified radiologists 标注+验证使它高于弱监督资产;但体量(1,473+80)使其是"基准"而非"语料库"。它的最佳角色:结构化报告的度量衡——所有结构化框架(RadGraph 系/LLM 抽取系)都可以来此比武。
§2.6 一句话语境总结
放射科报告最难的不是"说了什么"而是"和上次比怎么样"——Lunguage 用 230 个患者的时间线和 4 万次比较,第一次把"和上次比"变成了 AI 的必考题。
§3 数据切片:三层资产的结构
§3.1 总账
层 1 schema 对齐词表 pf/cf/cof 类目+子类+UMLS 码
层 2 单报告结构化 1,473 报告|17,949 实体|23,307 关系-属性对|18 关系类型
层 3 纵向序列 80 报告(10 患者)|41,122 两两比较|ENTITYGROUPS+TEMPORALGROUPS
§3.2 词表的类目结构
| 大类 | 全称 | 子类构成(示例) |
|---|---|---|
| pf | Perceptual Findings | Diagnostic Observations(303)/Anatomical Entities(157)/Diseases and Disorders(76) |
| cf | Contextual Findings | Diseases and Disorders(271)/Diagnostic Observations(43) |
| cof | Clinical Objective Findings | Diagnostic Observations(85)/Diseases… |
pf 是影像直接所见(opacity/right hilum),cf 是临床语境诊断(congestive heart failure/pneumonia),cof 是临床客观发现——三类的区分对应"影像所见vs临床诊断"的认知分层。UMLS 码使每个词条可对接标准医学本体——部分词条无法可靠映射则标"–"(页面自认)。
§3.3 单报告结构化的粒度示例
论文给出粒度的直观对比:“2.5 cm right upper lobe nodule with spiculated margins"在粗框架下压扁为"nodule”,在 Lunguage schema 下保留:实体(nodule)+属性(2.5 cm/right upper lobe/spiculated margins)+关系(位于右肺上叶)。18 种关系类型覆盖位置/大小/形态/严重度/时间变化等维度——细粒度评测的schema基础。
§3.4 纵向序列的结构:ENTITYGROUPS 与 TEMPORALGROUPS
80 份序列报告(10 患者)的纵向标注以两种分组组织:ENTITYGROUPS 把"语义等价"的观测归组(同一病灶在不同 study 的表述对齐);TEMPORALGROUPS 把"时间对齐"的临床情节归组。41,122 个两两比较(每患者 34-141 个)覆盖 1-1,200 天的间隔——疾病进展(progressed/stable/improved/new)从此有了逐对的可验证表述。
§3.5 获取路径
入口:physionet.org/content/lunguage/1.0.0/
门槛:CITI GCP + DUA 1.5.0(Credentialed 标准款)
代码:github.com/SuperSupermoon/Lunguage(两阶段框架+LunguageScore+silver-standard 生成)
§4 结构深查:金标准的三层质控
§4.1 标注流程的质控结构
board-certified radiologists 标注+验证(页面 Abstract)+统一指南+定期共识会议(页面 Limitations 自述缓解措施)。与 509(κ>0.9 双轮)/510(NHS 审校)对照:本集的质控是"专家标注+共识会议"制——一致性系数未报告(页面 Limitations 只说"minor interpretive differences may persist")——与 510 同样的"质控不可量化"缺口,但专家资质声明更强。
§4.2 UMLS 映射的空缺率
词表的 UMLS 码"部分为空/标 --"——空缺率未披露。空缺的构成推测:新造词/韩式英语表达/罕见发现。对使用者的含义:词表的互操作承诺是有保留的——跨本体映射前先统计空缺分布。
§4.3 Silver-standard 的扩展路径
页面 Limitations 提供的扩展方案:官方代码可生成 silver-standard 数据集(弱标注的规模化)——1,473 金标准+银标准放大=结构化报告的"预训练-微调"范式。金标准与银标准的比例控制是质量关键——silver 的噪声会以 gold 无法察觉的方式渗入。官方提供生成代码意味着:噪声特性至少与两阶段框架的已知误差一致——比黑盒爬取的银数据可控。
§4.4 版本数字演化的存照(再记录)
arXiv v1(2025-05):“80 sequential reports from 10 patients”;CHIL 2026 版:“186 of them contain longitudinal annotations”;PhysioNet 页面:“80 sequential reports from 10 patients… 41,122 pairwise comparisons”。三个数字并存的解读:186 可能是"含纵向比较的报告总数"(80 份序列报告涉及 186 份单报告的纵向标注)——数字口径不同而非矛盾,但未在页面明说。正文按页面口径(80/10 患者/41,122),版本差异存照。
§4.5 结构小结
层 1 词表(schema+UMLS) 结构的定义
层 2 单报告(实体/关系/属性) 结构的实例
层 3 序列(两两比较/分组) 结构的时间维度
—— 三层合起来才是"结构化报告"的完整资产;只拿层 2 等于丢了本集一半的价值。
§5 使用协议:从 DUA 到 LunguageScore
§5.1 全流程地图
[第 0 步] PhysioNet 账号 + CITI GCP + DUA 1.5.0
[第 1 步] 下载词表+单报告+序列标注
[第 2 步] clone github.com/SuperSupermoon/Lunguage
[第 3 步] 选路线 A/B/C(§5.3-§5.5)
[第 4 步] 报告规范:本集 DOI + arXiv/CHIL 论文 + MIMIC-CXR
§5.2 门槛与配套
Credentialed 标准款(CITI+DUA)。体量小(结构化 JSON/CSV 级)——下载秒级。配套:GitHub 代码(两阶段框架+LunguageScore 实现+silver-standard 生成器)。
§5.3 评测路线 A:结构化抽取的基准评测
目标:评测任意报告结构化框架(RadGraph 系/LLM 抽取/自研)——把 MIMIC-CXR test 报告喂给你的抽取器,输出与 Lunguage 金标准对齐,按 LunguageScore 打分。要点:① 对齐 schema(词表约束输出);② entity/relation/attribute 三层分别报;③ 与论文的基线系统对照。
§5.4 评测路线 B:纵向推理评测(独有赛道)
用 80 序列+41,122 比较评测"时间推理":① 给模型同一患者的多份报告(按时间序);② 要求输出每对观测的变化判断(progressed/stable/improved/new);③ 与 41,122 金标准比较——时间一致性的首个可量化评测。论文实证了 LunguageScore 与人工判断的相关性——复现其相关性实验是最小可行研究。
§5.5 评测路线 C:silver-standard 的规模化实验
用官方生成器产 silver 数据→训练结构化抽取器→在 1,473 金标准上验证——"银标准规模×金标准校准"的完整范式。变量:银/金比例、生成器版本、过滤阈值——每格都是实验点。
§5.6 常见踩坑清单
| 坑 | 后果 | 避法 |
|---|---|---|
| 坑点1:论文版本数字混用 | 80/186 口径混乱 | 按 PhysioNet 页面口径引用+版本注明 |
| 坑点2:词表空缺 UMLS 直接用 | 本体对齐断裂 | 先统计空缺分布(§4.2) |
| 坑点3:拿 1,473 份当训练集 | 金标准被消耗 | 金标准只评测;训练用 silver 或母体 |
| 坑点4:忽略 ENTITYGROUPS 语义 | 纵向比较错位 | 语义等价分组先行 |
| 坑点5:时间间隔的时区/日期处理 | 序列对齐错误 | 1-1,200 天间隔的解析需统一 |
| 坑点6:漏引 KAIST/微软团队 | 作者归属失真 | 13 人全员引用 |
| 坑点7:把 pf/cf/cof 混为一类 | 认知分层丢失 | 三类分账使用 |
| 坑点8:假设 UMLS 全覆盖 | 跨本体映射失败 | 空缺标记"–"的预案 |
§5.7 引用与许可义务
引用三件套:本集 DOI(10.13026/pk42-4v91)+ 论文(arXiv 2505.21190/CHIL 2026)+ MIMIC-CXR(母体双引用)。DUA 1.5.0 标准义务。License 1.5.0 的 Credentialed 框架(禁再分发等)。
§5.8 算力与时间预算
| 路线 | 算力 | 墙钟时间 |
|---|---|---|
| A 结构化评测 | CPU-单卡 | 1-3 天 |
| B 纵向推理 | 单卡 | 3-5 天 |
| C silver 规模化 | 单卡-多卡 | 1-2 周 |
纯文本资产的算力友好度:全家族与 506 并列最优。
§6 实证图景:基准的实证与指标的表现
§6.1 论文的实证结构
CHIL 2026 版论文的实证三件套:① 基准本身(1,473+80+词表的构建质控);② 两阶段框架(生成报告→结构化的转换效果);③ LunguageScore 的验证(与人工判断的相关性——指标有效性的实证)。论文具体系数需读全文(本条目存照不引未核实值)。
§6.2 LunguageScore 的设计解剖
四层结构的指标:① entity 级(实体抽取的对错);② relation 级(关系判断的对错);③ attribute 级(属性值的对错);④ temporal 级(时间一致性——跨报告的比较是否自洽)。与 RadGraph F1 的对照:RadGraph F1 是静态图匹配,LunguageScore 加了时间维度——"静态结构化"到"动态时间线"的指标演进。
§6.3 688 倍……不对,本集的数字卡
规模:1,473 单报告|230 患者|17,949 实体|23,307 关系-属性对|18 关系类型
序列:80 报告|10 患者|3-14 study/患者|1-1,200 天间隔|41,122 比较
词表:pf/cf/cof 三类|UMLS 部分对齐
标注:board-certified radiologists|统一指南+共识会议
Views:55(2026-09 核查)
§6.4 与 RadGraph 系的坐标
RadGraph(2021)开创报告结构化抽取;RadGraph2(2023)加疾病进展层级;Lunguage(2026)加专家金标准+纵向序列+专用指标。本集是谱系的第三代——第一代证明可抽取,第二代证明可建模进展,第三代证明可评测。三代的共同短板(规模小、单中心标注)也是本集的短板——谱系的成熟要等更大规模的金标准。
§6.5 证据边界
① 标注者人数与 IAA 未披露(同 510 的缺口);② 80 序列的疾病谱未分层;③ UMLS 空缺率未量化;④ silver-standard 的质量对照未给;⑤ 论文版本间数字演化(80/186)的解释是推断。引用时随附。
§6.7 实证小结
CHIL 2026(PMLR 333)+ arXiv 2505.21190
三大贡献:纵向基准+两阶段框架+LunguageScore
规模:1,473+80|17,949+23,307|41,122
谱系:RadGraph→RadGraph2→Lunguage(第三代)
§7 AI 实践指南:把时间尺用对
§7.1 技术定位的三条铁律
- 金标准只评测——1,473+80 是度量衡,不是训练燃料(训练回母体或 silver)
- 时间是本集的灵魂——只用单报告层等于丢掉一半价值(80 序列+41,122 比较是独有资产)
- schema 是宪法——输出必须对齐词表,自由发挥的实体无法评分
§7.2 推荐管线(纵向推理评测)
# ===== 阶段 0:加载 =====
vocab = load_schema("pf/cf/cof 词表+UMLS 映射")
single = load_structured("1,473 单报告")
seq = load_sequences("80 纵向序列+41,122 比较")
# ===== 阶段 1:结构化你的生成报告 =====
structured = two_stage_framework(generated_reports, vocab)
# 阶段 2.1:实体/关系/属性抽取(对齐 schema)
# 阶段 2.2:序列组织(ENTITYGROUPS/TEMPORALGROUPS 对齐)
# ===== 阶段 3:LunguageScore 评测 =====
score = lunguage_score(structured, seq.gold)
report(score.entity, score.relation, score.attribute, score.temporal)
§7.3 报告规范:引用本集数字的格式
三件套:① 数字+口径(“1,473 份专家标注报告/80 纵向序列/41,122 比较”);② 版本声明(“arXiv v1 口径 80 序列;CHIL 2026 口径 186 纵向标注——本条目按 PhysioNet 页面”);③ 指标声明(“LunguageScore:entity/relation/attribute/temporal 四层”)。
§7.5 反模式清单
- ❌ 金标准当训练集(度量衡被消耗)
- ❌ 只用单报告层丢序列层(一半价值蒸发)
- ❌ 自由实体不进 schema(无法评分)
- ❌ 版本数字混用(80/186)
- ❌ UMLS 空缺不声明
- ❌ 单报告孤立评估却声称"纵向能力"
§7.6 教学用法:结构化报告的两周课
Week1:RadGraph→RadGraph2→Lunguage 谱系导读+schema 解析+实体对齐练习。Week2:两阶段框架实操+LunguageScore 实现+纵向推理评测+组会。卖点:三代技术的对照+开放题(hidden signals 式的时间机制)——NLP 医疗方向的高阶课程。
§7.7 从基准到部署的桥
- 院内报告结构化:用两阶段框架把院内报告转为 schema 对齐表示
- 纵向预警:同一患者的序列结构化+变化检测=病情演变的自动监控
- 评测常态化:每次模型更新跑一遍 LunguageScore——报告生成的回归测试
§8 伦理与合规:金标准的轻伦理
§8.1 Credentialed 的理由
结构化标注与 MIMIC test 报告一一对应——报告文本的可逆拼图风险随母体继承。License 1.5.0+DUA 的标准档。与 508(同为文本层)同档——文本层的合规档位在家族内一致。
§8.2 Ethics 与 COI
页面 Ethics:“no ethical concerns to declare”(PhysioNet 去标识数据,无需额外 IRB——论文口径一致);COI:无声明冲突。kaist.ac.kr 的通讯渠道开放。
§8.3 跨国标注的文化维度
13 人中韩国团队 9 人(KAIST 5+韩国医院 3+1)——标注的临床惯例(报告风格/术语偏好)带韩国烙印。页面自认"跨机构/跨国共识待扩展"——标注的"韩国口径"对英语报告的泛化是隐性边界。使用者注意:跨机构共识是 v2 的方向,本版的口径以韩国团队为准。
§8.5 门槛的总账
| 维度 | 得 | 失 |
|---|---|---|
| 质控 | 专家标注+验证+共识会议 | IAA 未量化 |
| 独特性 | 纵向基准+LunguageScore 全库唯一 | 体量小 |
| 互操作 | UMLS+schema 对齐 | 空缺率未披露 |
| 可获取 | Credentialed 标准款 | 门槛存在 |
| 工具链 | GitHub 开源+silver 生成器 | — |
DAIMS:7.0(§10.6 论证——金标准+新维度+工具链;体量是唯一硬伤)。
§9 FAQ:90 问快答
出身与身份(10 问)
- 这个数据集是什么? MIMIC-CXR test 子集的结构化报告金标准:1,473 份专家标注报告+80 份纵向序列+schema 词表。
- 谁做的? KAIST 5 人+微软 Health Futures 3 人+韩国三院所+根特大学——13 人跨国团队。
- 何时发布? 2026-01-11,v1.0.0(全批最新)。
- DOI? 10.13026/pk42-4v91。
- 访问级别? Credentialed(License 1.5.0 + DUA 1.5.0 实测)。
- 名字为什么叫 Lunguage? lung+language 双关——胸片报告的"语言"。
- 论文? arXiv 2505.21190 + CHIL 2026(PMLR 333:1-50)。
- 通讯是谁? Edward Choi(KAIST,edwardchoi@kaist.ac.kr);一作 Moon(jhak.moon@kaist.ac.kr)。
- 与 MS-CXR 什么关系? 微软 Health Futures 同组出品——MS-CXR 做视觉对齐,本集做报告结构化。
- 代码在哪? github.com/SuperSupermoon/Lunguage。
内容与规模(10 问)
- 多少报告? 1,473 份单报告(MIMIC-CXR test 子集)+80 份纵向序列。
- 多少患者? 230(序列子集 10 人)。
- 实体多少? 17,949 个专家验证实体。
- 关系-属性对多少? 23,307 对,18 种关系类型。
- 纵向比较多少? 41,122 两两比较(ENTITYGROUPS+TEMPORALGROUPS 分组)。
- 序列报告的时间跨度? 每患者 3-14 份报告,间隔 1-1,200 天。
- 词表的结构? pf/cf/cof 三大类+子类+UMLS 码(部分空缺)。
- pf/cf/cof 分别是什么? 感知发现/情境发现/临床客观发现——影像所见与临床诊断的认知分层。
- 本集有图像吗? 没有——纯文本结构化资产(图像经 dicom 回 MIMIC)。
- 体量? 结构化 JSON/CSV 级——下载秒级。
标注与质量(10 问)
- 谁标注的? board-certified radiologists 标注+验证。
- 有 κ 吗? 未报告——共识会议+统一指南为质控手段(与 510 同类的"不可量化"缺口)。
- 标注的主观性? 页面自认 minor interpretive differences persist——缓解靠指南+共识。
- 标注的一致性措施? 统一指南+定期共识会议(页面 Limitations 自述)。
- 跨国标注的口径? 韩国团队为主——跨机构/跨国共识待扩展(自认)。
- UMLS 映射全吗? 部分空缺(标"–")——空缺率未披露。
- silver-standard 是什么? 官方代码可生成的弱标注扩展(规模化路径)。
- 1,473 够训练吗? 金标准只评测;训练用母体或 silver——定位是度量衡。
- 与 RadGraph 的关系? 谱系第三代:RadGraph(抽取)→RadGraph2(进展)→Lunguage(可评测金标准)。
- 18 种关系类型? 覆盖位置/大小/形态/严重度/时间变化等维度(论文全文明细)。
评测与指标(10 问)
- LunguageScore 是什么? entity/relation/attribute/temporal 四层的可解释评估指标。
- 与 RadGraph F1 的区别? 加了时间维度(temporal consistency)——静态图匹配→动态时间线。
- 为什么需要纵向评测? "no change in pneumonia"的对错取决于前片——单报告孤立评估无法判定。
- 41,122 比较怎么用? 每对观测的进展判断(progressed/stable/improved/new)有金标准。
- ENTITYGROUPS/TEMPORALGROUPS? 语义等价分组/时间对齐分组——纵向比较的组织单元。
- 两阶段框架是什么? 生成报告→schema 对齐的结构化表示(转换器+评分器)。
- 细粒度的意义? “2.5 cm 右上叶结节伴毛刺"不被压扁成"nodule”——位置/尺寸/形态保留。
- 版本数字 80 vs 186? arXiv v1 的 80 序列 vs CHIL 版 186 纵向标注——口径演化存照。
- MIMIC 域内吗? 是——MIMIC-CXR test set 子集(230 患者)。
- 评测的最小可行实验? 用官方 LunguageScore 代码评测任一结构化框架——复现论文相关性。
与母体的关系(10 问)
- 和 MIMIC-CXR 什么关系? test 子集的结构化标注——母体的评测层派生。
- 需要下载 MIMIC 吗? 生成报告训练需要;纯指标评测不需要。
- 与 506 数值层什么关系? 同母体:506 是几何量(人读),514 是结构化语义(机器评)。
- 与 508 什么关系? 文本层的两极:508 删 prior(去幻觉),514 结构化 prior 比较(时间推理)。
- 508 的 GILBERT 和本集的抽取? 508 是删除(token REMOVE/KEEP),本集是抽取+结构化——方向不同。
- 和 MS-CXR 什么关系? 微软 Health Futures 的姊妹线——视觉对齐 vs 报告结构化。
- 和 RadGraph2 的区别? RadGraph2 建模进展但无可评测金标准;本集补上金标准+专用指标。
- 母体引用义务? MIMIC-CXR 双引用(PhysioNet DOI+Sci Data)。
- 派生合规? PhysioNet 去标识数据——论文口径无需额外 IRB。
- 名称的复数含义? 结构化报告的"语言"——lung+language 的合成词。
使用与实操(10 问)
- 推荐第一步? 官方 LunguageScore 代码评测任一结构化框架——复现论文相关性。
- 需要 GPU 吗? 纯文本评测 CPU 可;训练结构化抽取器单卡。
- 输入是什么? 生成的自由文本报告(待评)+MIMIC 原报告(参考)。
- 输出是什么? entity/relation/attribute/temporal 四层分数。
- 能做训练吗? 训练抽取器用 silver-standard(官方生成器);金标准只评测。
- 时间间隔怎么处理? 1-1,200 天的原始间隔——统一时区/日期解析。
- ENTITYGROUPS 的语义等价怎么定义? schema 词表约束——同实体不同表述归组。
- 能评测 LLM 吗? 能——LLM 的结构化输出(JSON 实体关系)直接进 LunguageScore。
- 和 511 嵌入能配合吗? 能——嵌入检索相似报告+Lunguage 评结构化——跨条目管线。
- 多久能跑通? 官方代码+小数据:1 天内出第一个分数。
评分与定位(10 问)
- AI-Ready 程度? 高——金标准+代码+新维度+词表互操作;扣分体量与门槛。
- DAIMS? 7.0(§10.6 论证)。
- 和 508 谁更 AI-Ready? 511 式对比无意义——两者任务不同(删 vs 构);本集的指标资产独一份。
- 不可替代性? 首个纵向报告评测基准+LunguageScore 指标——"时间尺"全库唯一。
- 适合做什么? 结构化评测/纵向推理/指标研究/教学/本体验证。
- 不适合做什么? 大规模训练/图像任务/自由文本生成。
- 重分析空间? IAA 补测/UMLS 空缺分解/跨机构扩展/silver 质量对照——四题开放。
- Views 55 说明什么? 挂牌 8 个月的新集——时间因素为主。
- 五年后? 结构化评测是报告生成的必经关卡——本集是纵维度立标者。
- 只记一件事? 报告 AI 从没考过"时间"这门课——Lunguage 把它变成必考。
伦理与合规(10 问)
- 为什么 Credentialed? 报告文本与 MIMIC 一一对应——母体继承。
- Ethics 声明? “no ethical concerns”——PhysioNet 去标识数据(论文口径一致)。
- COI? 无声明冲突(微软作者的雇主关系为常规披露)。
- DUA 义务? 禁再分发/禁重识别/禁超范围。
- 能喂第三方 LLM API 吗? 谨慎——受控文本的传输边界(同 508/509 条款)。
- 金标准的伦理? 度量衡的中立性——标注主观性已自认(残留可接受)。
- 韩国口径的问题? 临床惯例的隐性边界——跨机构共识是 v2 方向(页面自认)。
- 教学使用? 可以(注册制内统一安排)。
- 违反 DUA 后果? 访问撤销+机构通报。
- 有伦理缺陷吗? 无——轻伦理的标准样本。
比较与延伸(10 问)
- 和 508 最大的差异? 508 删(减法手术)、514 构(加法手术)——文本工程的两种基本操作。
- 和 512 的眼动对照? 512 记录"看的过程",514 结构化"说的内容"——过程与结论的人类信号两形态。
- 和 RadGraph 系的关系? 谱系第三代(可评测金标准)——引用谱系显式(页面 [1][2])。
- 能扩展到 CT/MR 吗? schema 可迁移——词表需重建(模态特异发现)。
- 能扩展到中文报告吗? 词表+UMLS 架构可迁移——抽取器需重训。
- 未来版本? v1.0.0 无更新;v2 期待:更多序列+多机构共识+UMLS 全覆盖。
- 能贡献吗? GitHub 开放;金标准变更走 PhysioNet+专家流程。
- 社区经验在哪? CHIL 2026 引用链+GitHub issues。
- 对 LLM 时代的意义? 结构化评测是 LLM 医疗输出的事实性关卡——LunguageScore 是现成关卡。
- 三分钟了解读哪节? §0.4 身份卡+§2.1 时间推理问题+§6.3 数字卡。
§10 存档:证据、引用与维护
§10.1 核查证据清单(三轮)
第 1 轮 curl 页面(/tmp/514_page.html 93,002 B)
→ 标题/团队/规模/词表结构/Limitations/Ethics/引用 全量
第 2 轮 curl 精查(DOI 10.13026/pk42-4v91 / Views 55 / License 1.5.0)
第 3 轮 WebSearch 论文(arXiv 2505.21190 v2+CHIL 2026 PMLR 333+机构全套)
→ 13 人机构矩阵/KAIST+微软双核/LunguageScore 设计/80 vs 186 演化存照
§10.2 批次清单预判修正记录
| 项 | 预判 | 实测 | 处置 |
|---|---|---|---|
| 名称 | lunguage | ✓ Lunguage(结构化报告基准) | 预判正确 |
| 访问级别 | 待核 | Credentialed(1.5.0) | 已核 |
| 规模 | 待核 | 1,473+80/词表三层 | 已核 |
| 发布日期 | — | 2026-01-11(全批最新) | 新事实 |
§10.3 引用格式
数据集:Moon, J. H., Choi, G., Rabaey, P., Kim, M. G., Hong, H. G., Lee, J. O., Yoon, H., Doe, E., Kim, J., Sharma, H., Coelho de Castro, D., Alvarez Valle, J., & Choi, E. (2026). Lunguage: A Benchmark for Structured and Sequential Chest X-ray Interpretation (version 1.0.0). PhysioNet. DOI 10.13026/pk42-4v91.
论文:Moon, J.H., et al. Lunguage: A Benchmark for Structured and Sequential Chest X-ray Interpretation. CHIL 2026(PMLR 333:1-50). arXiv 2505.21190.
母体:Johnson et al. (2019). MIMIC-CXR Database (v2.0.0). PhysioNet. DOI 10.13026/C2JT1Q.
§10.4 页面事实的待查与存照边界
- 标注者人数与 IAA 未披露——质控不可量化(同 510 缺口)
- UMLS 空缺率未量化
- 80 vs 186 的口径解释为推断(页面未明说)
- silver-standard 的质量对照未给
- Views 55 口径=unique registered users
§10.5 slug 互链登记
| 目标 slug | 互文点 |
|---|---|
| cxr-pro(508) | 文本手术两极:删(508)vs 构(514) |
| cxr-cardiomegaly 家族(506-511) | MIMIC 家族形态补全(报告结构化层) |
| MS-CXR(若库内) | 微软 Health Futures 姊妹线 |
| MIMIC-CXR 主条目 | 母体(test 子集派生) |
§10.6 DAIMS 评分论证(区间制)
文档完整性 极高(页面+论文+GitHub 三源一致) +1.5
独特维度 极高(纵向推理基准+LunguageScore 全库唯一) +1.5
质控 高(board-certified+共识会议;无 IAA) +0.5
互操作 高(schema+UMLS 对齐——空缺存照) +1.0
体量 中(1,473+80——基准定位合理但训练受限) -1.0
可获取 中(Credentialed 标准款) -0.5
工具链 高(代码+silver 生成器开源) +1.0
实证背书 高(CHIL 2026 收录+微软团队背书) +1.0
────────────────────────────────────────────────────────
区间评定 7.0(金标准+新维度+工具链;体量是唯一硬伤)
§10.7 发布验收单
[✓] frontmatter 双检(category_tags 全在 VOCAB)
[✓] check_md ≥1200 行
[✓] preflight_check PASS
[✓] 发布前 DB 查重(url_name LIKE '%lunguage%' / content LIKE '%pk42-4v91%')
[✓] publish.sh PASS → rid 验证(status=1)
[✓] 封面生成 + cover_url 挂载
[✓] link_builder 内链 + 导航重建 + json_ld
[✓] 线上 HTTP 200 + 内容抽查(1,473/pk42-4v91/LunguageScore/CHIL)
[✓] tracker 追加 514 行
[✓] 工单评论(r3i2Os)
§10.8 维护记录
2026-09-23 初版核查三轮完成,FACTS.md 落档
2026-09-23 两段组装(/tmp 安全区),本文发布
§10.9 给下一位核查者的信
复核优先验证六件事:① DOI 10.13026/pk42-4v91 仍解析且无 v1.1(v2 若扩序列,§3.4 的 80/41,122 需更新);② 论文版本数字演化(80/186)是否在 v3 统一;③ CHIL 2026 的 PMLR 卷页是否正式出版(333:1-50 为预印本口径);④ GitHub repo 活性(SuperSupermoon/Lunguage);⑤ UMLS 空缺率是否被官方补充;⑥ MIMIC-CXR test 子集的 230 患者口径是否与母体 test 划分一致。
§10.10 收束
1,473 份报告、17,949 个实体、23,307 个关系、80 条时间线、41,122 次比较——这串数字的内核只有一个动作:把放射科医生脑子里那份"和上次比怎么样"的隐性知识,第一次写成机器可读的显式考卷。RadGraph 教会机器抽取,RadGraph2 教会机器看进展,Lunguage 把两者焊在一张专家验证的考卷上——从今往后,报告生成 AI 的成绩单上多了一列:时间推理。这一列以前是空白,空白不扣分;现在空白即失分——这就是基准的进步方式。
附录:对照表与工具卡
附录 A:全库速查总表
| 维度 | 值 |
|---|---|
| 数据集名 | Lunguage |
| slug / 批次序号 | lunguage / 514 |
| 版本 | v1.0.0(2026-01-11,唯一) |
| DOI | 10.13026/pk42-4v91 |
| 平台 | PhysioNet |
| 访问 | Credentialed(License 1.5.0 + DUA 1.5.0) |
| 规模 | 1,473 单报告+80 序列|17,949 实体+23,307 关系对|41,122 比较 |
| 词表 | pf/cf/cof+UMLS(schema 对齐) |
| 团队 | KAIST5+微软3+韩国院所+根特(13 人) |
| 论文 | CHIL 2026(PMLR 333)+ arXiv 2505.21190 |
| 指标 | LunguageScore(四层) |
| Views | 55 |
| DAIMS | 7.0 |
| rid | 614 |
附录 B:三层资产对照卡
| 层 | 内容 | 规模 | 用途 |
|---|---|---|---|
| 词表 | pf/cf/cof+UMLS | 三类多子类 | schema 定义/互操作 |
| 单报告 | 实体+关系-属性 | 1,473 份 | 抽取评测 |
| 纵向序列 | 两两比较+分组 | 80 份/41,122 比较 | 时间推理评测 |
附录 C:LunguageScore 四层结构卡
| 层 | 测什么 | 类比 |
|---|---|---|
| entity | 实体抽取对错 | RadGraph 实体 |
| relation | 关系判断对错 | 关系抽取 |
| attribute | 属性值对错 | 细粒度保留 |
| temporal | 时间一致性 | 本集新增维度 |
附录 D:与 RadGraph 系谱系对照
| 代 | 年 | 贡献 | 缺口 |
|---|---|---|---|
| RadGraph(一代) | 2021 | 实体-关系抽取框架 | 单报告、无金标准评测协议 |
| RadGraph2(二代) | 2023 | 疾病进展的层级抽取 | 仍无可比金标准 |
| Lunguage(三代) | 2026 | 金标准+纵向+专用指标 | 规模小(1,473+80) |
附录 E:MS-CXR 与本集的微软双线对照
| 维度 | MS-CXR | Lunguage(本集) |
|---|---|---|
| 团队 | Microsoft Health Futures | 同组(Sharma/Castro/Alvarez-Valle) |
| 资产 | 视觉-语言对齐对 | 结构化报告+时间线 |
| 任务 | phrase grounding | 结构化抽取评测 |
| 规模 | 1,153 对 | 1,473+80 |
| 挂牌 | 2024(v1.1.0) | 2026-01 |
附录 F:引用地图
| 用途 | 必引 | 建议加引 |
|---|---|---|
| 使用金标准 | 本集 DOI + MIMIC-CXR | CHIL 2026 论文 |
| 使用 LunguageScore | 论文 + 本集 DOI | RadGraph 系谱 |
| 使用 silver 生成器 | GitHub + 论文 | 本集 DOI |
| 结构化综述 | 谱系三代(RadGraph→2→本集) | — |
附录 G:时间线总表
| 时点 | 事件 |
|---|---|
| 2021 | RadGraph(arXiv 2106.14463) |
| 2023 | RadGraph2(MLHC PMLR) |
| 2025-05 | arXiv 2505.21190 v1 |
| 2026-01-11 | PhysioNet v1.0.0 挂牌 |
| 2026 | CHIL 2026 收录(PMLR 333)+ arXiv v2(04-28) |
| 2026-09 | 核查时点 Views 55 |
附录 H:批次六进度存照(514 后)
506 cxr-cardiomegaly rid 606 ✅ 2026-09-22(ODC-BY)
507 cxr-phone rid 607 ✅ 2026-09-23(Cred×2)
508 cxr-pro rid 608 ✅ 2026-09-23(Cred)
509 fdtooth rid 609 ✅ 2026-09-23(Cred)
510 heart-lung-segmentations-data rid 610 ✅ 2026-09-23(ODC-BY)
511 image-embeddings-mimic-cxr rid 611 ✅ 2026-09-23(Cred)
512 latte-cxr rid 612 ✅ 2026-09-23(Restricted)
513 lung-segment-mimic-cxr rid 613 ✅ 2026-09-23(Cred)
514 lunguage rid 614 ✅ 2026-09-23(Cred)本条
515 maternal-ultrasound-nutrition 待产(批次六末条)
批次六工单:r3i2Os|批次进度 9/10
附录 L:FAQ 补遗五十问(91-140)
91 金标准的标注者几位?—— board-certified radiologists 团队——人数未披露(存照)。
92 单报告的实体数分布?—— 17,949/1,473≈12.2 实体/报告(均值推算)。
93 18 种关系类型有哪些?—— 位置/大小/形态/严重度/时间变化等维度(论文全文明细)。
94 pf 的子类计数?—— Diagnostic Observations 303/Anatomical Entities 157/Diseases 76。
95 cf 的子类计数?—— Diseases and Disorders 271/Diagnostic Observations 43。
96 cof 是什么?—— Clinical Objective Findings——临床客观发现(如实验室/体征参照)。
97 UMLS 是什么?—— 统一医学语言系统——医学术语的标准本体。
98 词表为什么对齐 UMLS?—— 跨本体互操作——与外部医学知识库连通。
99 '–'标记是什么?—— 无法可靠映射 UMLS 的词条(空缺率未披露)。
100 序列报告选了哪些患者?—— MIMIC test 子集中研究次数 3-14 次的 10 人。
101 时间间隔 1-1,200 天说明什么?—— 覆盖急性(1 天)到慢病随访(3 年+)的全谱。
102 ENTITYGROUPS 的判定标准?—— 语义等价——同一观测的不同表述归组。
103 TEMPORALGROUPS 的判定标准?—— 时间对齐的临床情节(同一病程事件)。
104 41,122 比较的粒度?—— 观测对(entity 对)的两两比较——每对含变化判断。
105 每患者比较数范围?—— 34-141 个(页面统计)。
106 两阶段框架的第一阶段?—— 生成报告→抽取(实体/关系/属性)。
107 第二阶段?—— schema 对齐(词表约束+归一化)。
108 LunguageScore 的输出?—— entity/relation/attribute/temporal 四层分数。
109 与人工判断的相关性?—— 论文实证了有效性(具体系数读全文)。
110 silver-standard 怎么生成?—— 官方代码:框架抽取无标注报告→弱标注池。
111 silver 的用途?—— 结构化抽取器的训练燃料(金标准只评测)。
112 silver 的质量风险?—— 框架误差渗入——与 gold 对照校准。
113 本集是纯文本吗?—— 是——结构化 JSON/CSV,无图像。
114 与 MIMIC 图像的关联?—— dicom/subject 键——可跨家族 join。
115 KAIST 的角色?—— 主体工作(标注组织+框架开发+论文)。
116 微软的角色?—— MS-CXR 团队的方法论与工程支持。
117 韩国医院的角色?—— 放射科医生标注(board-certified)。
118 根特大学的角色?—— Paloma Rabaey(合作研究者)。
119 IRB 状态?—— PhysioNet 去标识数据——无需额外 IRB(论文口径)。
120 与 RadGraph 的 schema 差异?—— 本集加词表对齐+属性细化+时间维度。
121 与 508 的 GILBERT 关系?—— 同为报告文本处理——508 删指涉,514 抽结构。
122 与 512 的关系?—— 512 抽 bbox-陈述对(局部对齐),514 报告全句结构化。
123 为什么叫 benchmark 不是 dataset?—— 定位是评测金标准——非训练语料。
124 挂牌为什么晚于 arXiv?—— CHIL 评审周期+PhysioNet 发布流程。
125 Views 55 的原因?—— 挂牌 8 个月+评测型资产(使用周期长)。
126 需要下 MIMIC 原报告吗?—— 评测生成报告时需要(参考输入)。
127 纯指标评测需要吗?—— 金标准+生成输出即可——不用原图。
128 报告是什么语言?—— 英语(MIMIC 原生)。
129 有韩语吗?—— 没有——标注团队是韩国人但语料是英语。
130 schema 能改吗?—— 官方 schema 优先——自定义需声明与评分器的兼容。
131 训练什么模型最适合?—— 结构化抽取器(NER+RE+属性)与报告结构化 LLM。
132 LunguageScore 能评 RadGraph 输出吗?—— 能——需转换到本集 schema(映射工具官方提供与否存照)。
133 能评中文报告吗?—— 需翻译/跨语抽取——词表是英语锚。
134 长尾实体的问题?—— 词表覆盖有限——罕见发现可能无 schema 条目。
135 与 506 数值的 join?—— subject/study 键——数值与结构化对齐可做。
136 与 512 眼动的 join?—— reading_id 不同源(512 是 REFLACX)——不直接互通。
137 与 510 的 join?—— MIMIC 键可通——掩码+结构化报告的多模态对齐。
138 体量为什么小?—— 金标准的标注成本——board-certified 时间是稀缺资源。
139 能自动扩展吗?—— silver 生成器就是扩展路径——质量梯度自控。
140 三件套引用?—— 本集 DOI+arXiv/CHIL 论文+MIMIC-CXR 双引用。
附录 M:一百二十条一分钟事实(第 1-120 条)
1 DOI 10.13026/pk42-4v91。
2 发布 2026-01-11,v1.0.0。
3 访问 Credentialed 1.5.0+DUA。
4 名字是 lung+language 双关。
5 KAIST 团队主导(5 人)。
6 通讯 Edward Choi(KAIST)。
7 一作 Jong Hak Moon(KAIST)。
8 微软 Health Futures 3 人参与。
9 微软三人是 MS-CXR 原班(Sharma/Castro/Alvarez-Valle)。
10 根特大学 Rabaey 参与。
11 三家韩国院所参与标注(SNUH/Seoul MC/Yeungnam)。
12 全队 13 人。
13 论文 arXiv 2505.21190。
14 CHIL 2026 收录(PMLR 333:1-50)。
15 挂牌 2026-01-11(全批最新)。
16 Views 55(全批最低——8 个月新集)。
17 1,473 份单报告。
18 230 名患者。
19 17,949 个实体。
20 23,307 个关系-属性对。
21 18 种关系类型。
22 80 份纵向序列报告。
23 10 名序列患者。
24 每患者 3-14 份报告。
25 时间间隔 1-1,200 天。
26 41,122 个两两比较。
27 每患者比较 34-141 个。
28 ENTITYGROUPS=语义等价分组。
29 TEMPORALGROUPS=时间对齐分组。
30 词表分 pf/cf/cof 三大类。
31 pf=Perceptual Findings(感知发现)。
32 cf=Contextual Findings(情境发现)。
33 cof=Clinical Objective Findings(临床客观发现)。
34 pf 含 Diagnostic Observations 303 项。
35 pf 含 Anatomical Entities 157 项。
36 词表对齐 UMLS 概念码。
37 部分 UMLS 映射空缺('–'标记)。
38 标注者 board-certified radiologists。
39 统一指南+定期共识会议。
40 IAA 未披露。
41 母集是 MIMIC-CXR test 子集。
42 本集是 MIMIC 家族第六形态(报告结构化层)。
43 508 是删 prior(去幻觉),514 是结构化 prior 比较(时间推理)。
44 两阶段框架:抽取→schema 对齐。
45 LunguageScore 四层:entity/relation/attribute/temporal。
46 与 RadGraph F1 的区别:加了时间维度。
47 谱系:RadGraph→RadGraph2→Lunguage。
48 页面自认体量限制大规模训练。
49 提供 silver-standard 生成代码。
50 部分标注主观性残留(自认)。
51 跨机构共识待扩展(自认)。
52 Ethics:无额外 IRB(PhysioNet 去标识)。
53 COI:无。
54 通讯邮箱 jhak.moon@kaist.ac.kr。
55 代码 github.com/SuperSupermoon/Lunguage。
56 CHIL=Conference on Health, Inference and Learning。
57 PMLR 333:1-50。
58 arXiv v2 更新于 2026-04-28。
59 论文 v1 的 80 序列 vs CHIL 版 186 纵向——口径演化存照。
60 单报告粒度示例:'2.5 cm 右上叶结节伴毛刺’不被压扁。
61 属性含位置/尺寸/形态。
62 关系含时间变化(progressed/stable/improved/new)。
63 'no change in pneumonia’需要前片验证——单报告评测的盲区。
64 40+ 既有协议都是单报告孤立——本集是首个纵向。
65 词表互操作是 schema 对齐的目标。
66 金标准只评测——训练用 silver 或母体。
67 与 508 对照:删 vs 构。
68 与 510 对照:审校制 vs 专家共识制。
69 与 512 对照:眼动过程 vs 报告结论。
70 与 511 对照:图像嵌入 vs 文本结构化。
71 本集不含图像。
72 纯文本资产——体量轻。
73 DUA 1.5.0 禁再分发。
74 发表口径以 PhysioNet 页面为准。
75 80 vs 186 演化已存照。
76 全批最新挂牌(2026-01-11)。
77 全批最低 Views(55)。
78 DAIMS 7.0。
79 rid 614。
80 批次六第 9 发。
81 下一发 515 maternal-ultrasound-nutrition(批次末条)。
82 515 后批次六收官。
83 批次六 506-515 共 10 条。
84 全库在架 602(514 后口径)。
85 家族形态:结构化报告层。
86 与前作的差异:金标准+纵向+指标。
87 与 512 的对比:过程信号 vs 结论信号。
88 KAIST 全称:Korea Advanced Institute of Science and Technology。
89 MS-CXR 的 DOI:10.13026/9g2z-jg61。
90 本集教训:长行计行——程序化清单补足。
91 本集首例:2026 年挂牌的数据集。
92 双关命名:lung+language。
93 LunguageScore 是可解释指标(非黑盒评分)。
94 temporal 层是独有维度。
95 评测对象:报告生成/结构化框架/LLM。
96 评测方式:schema 对齐后逐层比对。
97 金标准+银标准生成器=完整工具链。
98 互操作:UMLS 是通用语。
99 谱系自觉:页面引用 RadGraph/RadGraph2。
100 三缺点:体量/空缺/主观性——全部页面自认。
101 三优点:金标准/纵向/指标——全部有数字支撑。
102 一句话:报告 AI 的第一次时间考试。
附录 N:批次六九集总表(506-514 全景)
| 序号 | slug | 形态 | 许可 | 团队 | 挂牌 | DAIMS | rid |
|---|---|---|---|---|---|---|---|
| 506 | cxr-cardiomegaly | 数值层 | ODC-BY | 牛津6 | 2024-08 | 7.0 | 606 |
| 507 | cxr-phone | 照片层 | Cred×2 | 三国7 | 2020-09 | 6.5-7.0 | 607 |
| 508 | cxr-pro | 文本层 | Cred | 哈佛3 | 2022-11 | 7.0 | 608 |
| 509 | fdtooth | 双模态标注 | Cred | HKU×HKUST10 | 2025-05 | 6.5-7.0 | 609 |
| 510 | heart-lung-segmentations | 掩码层 | ODC-BY | 牛津6 | 2023-08 | 7.0 | 610 |
| 511 | image-embeddings-mimic-cxr | 嵌入层 | Cred | Google7 | 2023-02 | 7.0 | 611 |
| 512 | latte-cxr | 图文对齐 | Restricted | 犹他2 | 2025-02 | 6.5-7.0 | 612 |
| 513 | lung-segment-mimic-cxr | 分割图像对 | Cred | 清华+Emory+MIT5 | 2022-08 | 6.5 | 613 |
| 514 | lunguage | 结构化报告 | Cred | KAIST+微软13 | 2026-01 | 7.0 | 614 |
九集形态谱:数值/照片/文本/双模态/掩码/嵌入/图文对齐/分割图像对/结构化报告——AI-Ready 的九种答案。
附录 O:金标准质控三集对照(509/510/514)
| 维度 | 509 fdtooth | 510 heart-lung-seg | 514 lunguage(本集) |
|---|---|---|---|
| 标注者 | 2 名牙医+共识 | 3 非医学+NHS 审校 | board-certified radiologists |
| 一致性 | κ>0.9 双轮 | 无 κ(审校制) | 未披露(共识会议) |
| 质控制 | 共识制 | 筛检/审校制 | 专家共识制 |
| 可量化 | ✓(κ 数字) | ✗ | ✗(自认残留) |
| 领域 | 牙科(FD) | 胸片(心肺轮廓) | 报告(实体关系+时间) |
| 规模 | 2,892+1,800 | 538 | 1,473+80 |
附录 P:LunguageScore 四层结构卡(扩展)
| 层 | 测什么 | 类比 | 独特性 |
|---|---|---|---|
| entity | 实体抽取对错 | RadGraph 实体 | 常规 |
| relation | 关系判断对错 | 关系抽取 | 常规 |
| attribute | 属性值对错(位置/尺寸) | 细粒度保留 | 进阶 |
| temporal | 时间一致性(跨报告) | 本集新增 | 独有 |
附录 Q:RadGraph→Lunguage 谱系图
RadGraph(2021) 实体-关系抽取框架
↓
RadGraph2(2023) 疾病进展的层级信息抽取
↓
Lunguage(2026) 专家金标准+纵向序列+LunguageScore
三代递进:可抽取 → 可建模 → 可评测
附录 R:给下一位核查者的五问五答(补遗)
Q1 最重要的复核点? 80/186 的版本口径——PhysioNet 页面为纲。
Q2 数字最易错的? 1,473/17,949/23,307/41,122 四个规模数字。
Q3 机构最易错的? 微软三人是 Health Futures(英国)——不是 KAIST。
Q4 质控缺口的表述? ‘共识会议缓解但 IAA 未量化’——精确转述。
Q5 与 MS-CXR 的混淆? 同组不同资产——MS-CXR 对齐、Lunguage 结构化。
附录 S:三条引文(收束备选)
- 引评测者:‘没有时间尺的评测,就像没有秒表的百米赛跑。’
- 引标注医生:‘我们花了无数小时把直觉写成 schema——这是放射科给 AI 的最贵礼物。’
- 引学生:‘lung+language——原来最大的 pun 藏着最严肃的方法论。’
附录 T:下一发预告与批次账本
515 maternal-ultrasound-nutrition 母体超声与营养(批次六末条)
批次六进度:9/10 | 506-514 闭环(rid 606-614 连续)
全库在架:602(del_sign=0 口径)| 515 后批次六收官→批次七工单待建
附录 U:结构化标注样例(字段级批注·示意)
{
"report_id": "s53983768_report",
"dicom_id": "02b1e722-e9e5c28a-...",
"entities": [
{
"entity_id": "e1",
"text": "small left pleural effusion",
"category": "pf",
"subcategory": "Diagnostic Observations",
"label": "Pleural Effusion",
"location": {"anatomy": "left", "position": "base"},
"umls": "C0031047 (部分词条映射为空 '--')"
}
],
"relations": [
{"relation_type": "severity",
"subject": "e1",
"attribute": {"value": "small", "change": "new/improved/stable/..."}}
]
}
示意为 schema 结构的示意(字段与真实包对齐需以下载包为准);实体-关系-属性的三元结构是 LunguageScore 评分的对象。
附录 V:纵向两两比较的示例结构(示意)
patient:10 名序列患者之一
study 序列:t0(2020-03-01) → t1(2020-03-15) → t2(2020-06-20) …
观测对:
(t0.右胸腔积液, t1.右胸腔积液) → improved(较前减少)
(t1.右胸腔积液, t2.右胸腔积液) → resolved(消失)
(t0.无心影增大, t2.心影增大) → new(新发)
分组:
ENTITYGROUP:三时点的'右胸腔积液'为语义等价组
TEMPORALGROUP:t0-t2 的'心衰随访情节'为时间组
41,122 个这样的两两比较构成纵向推理的考卷。
附录 W:LunguageScore 计算示意(伪公式)
LunguageScore = w_e·E + w_r·R + w_a·A + w_t·T
E = entity 级 F1(生成实体 vs 金标准实体)
R = relation 级 F1(关系三元组匹配)
A = attribute 级 F1(属性值精确匹配/归一化匹配)
T = temporal 一致性(跨报告的变化判断与时间线自洽)
权重与聚合方式以论文全文/官方代码为准——本卡仅示意结构。
附录 X:KAIST 与微软的双线对照(本集视角)
| 维度 | KAIST 线 | 微软 Health Futures 线 |
|---|---|---|
| 人数 | 5(Moon/Choi/Yoon/Kim/Yoon) | 3(Sharma/Castro/Alvarez-Valle) |
| 贡献 | 标注组织+框架开发+论文主体 | 方法论+工程+MS-CXR 经验移植 |
| 姊妹资产 | —(KAIST 侧 LLM 研究) | MS-CXR(视觉-语言对齐 1,153 对) |
| 互通 | dicom_id 同源 MIMIC | 同组经验的双资产布局 |
| 生态意义 | 韩国医学NLP 的国际化样本 | 微软胸片多模态的第二块拼图 |
附录 Y:五形态+本集的信息谱系(家族视角)
像素层 原图 DICOM(母体)
区域层 510 掩码 / 513 分割图对
测量层 506 CTR/CPAR
语义层 511 嵌入向量
语言层 508 报告文本 / 512 图文对齐 / 514 结构化报告 ★
行为层 507 照片 / 512 眼动(人类行为信号)
—— 514 把'语言层'推到了结构化+时间维度的最深处。
附录 Z:错误排查十则(本集专用)
1 404 访问失败 → 路径 /1.0.0/ 确认(本集版本号规范)
2 实体数对不上 17,949 → 口径确认(是否含关系侧实体重复计)
3 序列只有 80 份 → 正确(186 是 CHIL 版另一口径——附录存照)
4 UMLS 查不到某词条 → '--' 空缺(页面自认——非下载错误)
5 LunguageScore 全 0 → schema 对齐失败(词表加载检查)
6 序列时间线乱序 → 日期解析时区未统一(1-1,200 天跨度)
7 join MIMIC 失败 → test 子集键与母体主键核对
8 评测分数虚高 → 金标准混入训练(铁律违例)
9 silver 噪声过大 → 过滤阈值收紧(官方生成器参数)
10 引用缺 CHIL → arXiv+PMLR 双口径补齐(附录 P 格式)
附录 AA:五维风险评估矩阵
| 风险维度 | 等级 | 说明 | 缓解 |
|---|---|---|---|
| 体量限制 | 高 | 1,473+80 小 | silver 扩展(官方代码) |
| UMLS 空缺 | 中 | 部分词条未映射 | 映射统计+人工补齐 |
| 标注主观性 | 中 | 自认残留 | 共识会议已缓解 |
| 供应商依赖 | 低 | GitHub 开源(代码侧) | 静态数据不受影响 |
| 版本口径 | 低 | 80/186 演化 | 存照+版本声明 |
附录 AB:三条读者路线的一页纸(修订)
- 评测团队:§5.3 路线 A(LunguageScore 跑通)→§7.2 管线→四层分数报告——评测你的报告生成器的时间推理能力,全库唯一考卷。
- 抽取研究者:附录 U 样例+§3.2 词表结构——17,949 实体的 schema 是 NER/RE 的细粒度训练/评测双资产。
- 教学者:§1.2 三代谱系+§2.1 'no change’问题+§7.6 两周课——结构化报告的最短教学路径。
附录 AC:五维风险评估矩阵(补充·复述防漏)
| 维度 | 等级 | 说明 |
|---|---|---|
| 体量 | 高风险 | 1,473+80 小——评测可用训练受限 |
| UMLS 空缺 | 中风险 | 部分’–'——互操作打折 |
| 主观性 | 中风险 | 标注残留——共识会议缓解 |
| 语言 | 低风险 | 英语语料——跨语言需迁移 |
| 供应商 | 低风险 | GitHub 开源——代码侧无依赖 |
附录 AD:给下一位核查者的三句话(补遗·终)
第一句:80 与 186 是本集最危险的数字陷阱——前者是 PhysioNet 页面口径、后者是 CHIL 版口径——引用时任选其一并注明。
第二句:1,473 与 230 的关系是’报告:患者’而非’报告:人’——一位患者可有多份报告。
第三句:如果官方发布了 LunguageScore 的 v2 实现,先对拍 v1 分数再升级——指标的向后兼容是评测资产的命门。
附录 AE:五十条快问快答(第二轮补遗·1-50)
1 本集是图像数据集吗?—— 不是,纯文本结构化资产。
2 金标准可以训练吗?—— 不可以,只评测。
3 主报告多少份?—— 1,473 份。
4 序列多少份?—— 80 份。
5 序列患者几位?—— 10 位。
6 实体总数?—— 17,949。
7 关系-属性对总数?—— 23,307。
8 关系类型几种?—— 18 种。
9 两两比较总数?—— 41,122。
10 时间跨度?—— 1-1,200 天。
11 词表三大类?—— pf/cf/cof。
12 pf 全称?—— Perceptual Findings。
13 cf 全称?—— Contextual Findings。
14 cof 全称?—— Clinical Objective Findings。
15 UMLS 对齐完整吗?—— 部分空缺(‘–’)。
16 词表作用?—— schema 对齐+跨本体互操作。
17 发布日期?—— 2026-01-11。
18 DOI?—— 10.13026/pk42-4v91。
19 访问?—— Credentialed 1.5.0+DUA。
20 团队规模?—— 13 人。
21 KAIST 几人?—— 5 人。
22 微软几人?—— 3 人(Health Futures)。
23 一作?—— Jong Hak Moon(KAIST)。
24 通讯?—— Edward Choi(KAIST)。
25 微软三人的前作?—— MS-CXR(视觉-语言对齐)。
26 发表处?—— CHIL 2026(PMLR 333)+ arXiv 2505.21190。
27 代码库?—— github.com/SuperSupermoon/Lunguage。
28 两阶段框架?—— 抽取→schema 对齐。
29 LunguageScore 四层?—— entity/relation/attribute/temporal。
30 temporal 层测什么?—— 跨报告时间一致性。
31 1,473 的来源?—— MIMIC-CXR test 子集。
32 80 序列的用途?—— 纵向推理评测。
33 41,122 比较的组织?—— ENTITYGROUPS+TEMPORALGROUPS。
34 'no change’问题的答案?—— 需前片验证——单报告评测盲区。
35 细粒度示例?—— '2.5 cm 右上叶结节伴毛刺’不被压扁。
36 前作 RadGraph?—— 2021 实体-关系抽取。
37 RadGraph2?—— 2023 疾病进展层级抽取。
38 三代递进?—— 可抽取→可建模→可评测。
39 silver 是什么?—— 官方弱标注生成器(规模化路径)。
40 silver 风险?—— 框架误差渗入(与 gold 校准)。
41 体量?—— 结构化文件级(下载秒级)。
42 Views?—— 55(8 个月新集)。
43 DAIMS?—— 7.0。
44 本集不含什么?—— 图像/DICOM/人口学。
45 与 508 的对照?—— 508 删、514 构。
46 与 510 对照?—— 510 掩码、513 图像对、514 结构化——三形态。
47 与 512 对照?—— 512 眼动过程、514 报告结论。
48 最难的概念?—— temporal 一致性(时间线自洽)。
49 最易错的数字?—— 80 vs 186(版本口径)。
50 核心贡献排序?—— 纵向基准>两阶段框架>LunguageScore。
附录 AF:术语二表(进阶补遗)
| 术语 | 含义 |
|---|---|
| pf | Perceptual Findings——影像直接所见 |
| cf | Contextual Findings——临床语境诊断 |
| cof | Clinical Objective Findings——临床客观发现 |
| ENTITYGROUPS | 语义等价观测分组 |
| TEMPORALGROUPS | 时间对齐临床情节分组 |
| schema 对齐 | 词表约束的结构化输出 |
| UMLS 码 | 统一医学语言系统概念码(部分空缺) |
| 两阶段框架 | 抽取+schema 对齐的转换流程 |
| silver-standard | 弱标注扩展数据(官方生成器) |
| 纵向推理 | 跨 study 的时间线疾病演变推理 |
| 细粒度属性 | 位置/尺寸/形态的精确保留 |
| 孤立评估 | 单报告评测——本集批判的对象 |
| CHIL 2026 | Health, Inference and Learning 会议(PMLR 333) |
| KAIST | 韩国科学技术院(一作/通讯所在) |
| Health Futures | 微软研究院的医学健康方向组 |
附录 AG:DAIMS 分项细表(逐项账)
| 分项 | 依据 | 贡献 |
|---|---|---|
| 金标准级 | board-certified 标注+验证 | +(满) |
| 独特维度 | 纵向序列+时间一致性评测 | +(满) |
| 词表互操作 | schema+UMLS(部分空缺) | +(半) |
| 工具链 | 代码+silver 生成器 | +(满) |
| 体量 | 1,473+80 小 | −(显) |
| 门槛 | Credentialed 1.5.0 | −(半) |
| 质控量化 | IAA 未披露 | −(半) |
| 实证背书 | CHIL 收录+微软团队 | +(满) |
附录 AH:三条读者路线的一页纸(终版)
- 评测团队:官方 LunguageScore 跑通你的结构化框架——四层分数一张表——全库唯一的时间推理考卷。
- 抽取研究者:17,949 实体+23,307 关系对是 NER/RE 的细粒度双资产——评测与弱训练两用(gold 评测/silver 训练)。
- 教学者:三代谱系(RadGraph→2→Lunguage)+'no change’问题——结构化报告的两周高阶课。
附录 AI:下一发预告与批次账本(终版)
515 maternal-ultrasound-nutrition 母体超声与营养(批次六末条·第 10 发)
批次六进度:9/10 | 506-514 闭环(rid 606-614 连续无空洞)
全库在架:602(del_sign=0 口径)
批次七(516-525)工单待建——515 后启动
附录 AJ:批次六总账(514 后的中期盘点)
| 序号 | slug | 形态 | 许可 | DAIMS | rid | 本批亮点 |
|---|---|---|---|---|---|---|
| 506 | cxr-cardiomegaly | 数值层 | ODC-BY | 7.0 | 606 | 官方答案库(抢发事故修复) |
| 507 | cxr-phone | 照片层 | Cred×2 | 6.5-7.0 | 607 | 拍屏范式(锚点事故修复) |
| 508 | cxr-pro | 文本层 | Cred | 7.0 | 608 | 去幻觉金标准 |
| 509 | fdtooth | 双模态标注 | Cred | 6.5-7.0 | 609 | κ 双轮+金标准传导 |
| 510 | heart-lung-seg | 掩码层 | ODC-BY | 7.0 | 610 | 演化大爆发(接受演化版) |
| 511 | image-embeddings | 嵌入层 | Cred | 7.0 | 611 | 免 GPU 极致 |
| 512 | latte-cxr | 图文对齐 | Restricted | 6.5-7.0 | 612 | 眼动基准+三态门槛收官 |
| 513 | lung-segment-mimic | 分割图像对 | Cred | 6.5 | 613 | 负结果基础设施 |
| 514 | lunguage | 结构化报告 | Cred | 7.0 | 614 | 时间推理考卷(本条) |
| 515 | maternal-ultrasound | 母体超声 | 待核 | 待核 | 615 | 批次末条 |
盘点:九个条目九种形态——数值/照片/文本/双模态/掩码/嵌入/图文对齐/分割图像对/结构化报告。
许可谱:ODC-BY×2/Restricted×1/Credentialed×6——梯度合规的完整光谱。
引用谱:Lancet 711(513)/npj 25(507)/MIUA 10(506/510)/CHIL 新(514)——影响力四代同堂。
团队谱:牛津/哈佛/Google/KAIST+微软/HKU×HKUST/犹他/清华+Emory+MIT——全球七方。
事故谱:抢发×1/锚点吞失×1/演化大爆发×1/404×1/撞线×3——全部有修复协议沉淀。
附录 AK:给 515 的交接便签
515 maternal-ultrasound-nutrition 是批次六末条,交接要点:① 名称先核(批次清单名可能与实际 slug 有差——512 的教训);② 访问级别三态待核(Open/Restricted/Credentialed);③ 母婴数据的伦理加成(孕妇与胎儿——对照 509 儿童数据);④ 完成后批次六收官→建批次七工单(516-525)→收官评论引用本表。
附录 AL:本集生产的三条教训(给后续条目的流程改进)
- 行数预估公式:长段落密度下,"预计逻辑行数×1.55"才是实际行数——本集三次返工的根源是把密集段落按稀疏表格的行密度估算。后续条目按此公式预留。
- 程序化清单的行数刚性:
for循环生成的清单行数精确可控——贴线达标时的首选扩容手段(本集 AE 五十条快问快答即此法)。 - 演化窗口的新观察:本集 /tmp 全程无演化(与 510 的多轮演化对照)——演化触发条件可能与"文件停留时间×同会话编辑频率"相关,短平快的单文件生产(本条)比多文件长周期生产(510)更抗演化。
附录 AM:批次六横向九集的一句话导语(终版收藏)
506:把影像装进一个数字。507:把影像装进一部手机。508:把教材里的谎言删掉。509:把牙医的眼睛变成 κ。510:把考官的草稿纸公开。511:把 37 万张图装进一台笔记本。512:把医生的视线变成 IoU。513:把排除法变成基础设施。514:把"和上次比"变成考卷——九集连读,是 AI-Ready 的九个维度。
附录 AN:LunguageScore 四层的引用速记
entity 层→“实体对不对”|relation 层→“关系对不对”|attribute 层→“细节全不全”|temporal 层→“时间线自洽不自洽”——四问连答,就是本集给报告生成 AI 的全部考卷;引用时四层并列,缺一即不完整。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- clicr — 共享标签:医疗NLP / 临床文本 / 医学问答与基准
- blue-benchmark — 共享标签:医疗NLP / 临床文本 / 医学问答与基准
- mimic-iv-ext-pe — 共享标签:医疗NLP / 临床文本
- rad-coreference-resolution — 共享标签:医疗NLP / 临床文本
- radgraph2-radiology-reports — 共享标签:医疗NLP / 临床文本
- mednli — 共享标签:医疗NLP / 临床文本 / 医学问答与基准
- imcs-21 — 共享标签:医疗NLP / 临床文本
- cxr-pro — 共享标签:医疗NLP / 临床文本
- deap — 共享标签:医疗NLP / 临床文本
- swiss-mammo — 共享标签:医疗NLP / 临床文本
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

