Lunguage — 胸片结构化报告与纵向时间线基准 AI-Ready Wikipedia

给报告生成 AI 一把'时间尺':1,473 份专家结构化报告与 80 条纵向序列

来源 MIMIC-CXR test set 子集的结构化标注(board-certified radiologists 标注验证)发布时间: 2026-09-23最后更新: 2026-09-25 阅读 34
Lunguage — 胸片结构化报告与纵向时间线基准 AI-Ready Wikipedia

信息速览

数据集名称Lunguage — 胸片结构化报告与纵向时间线基准 AI-Ready Wikipedia
数据类型结构化标注,金标准测试集,纵向序列
规模230 名患者(1,473 份报告;其中 10 名患者的 80 份报告含纵向标注)
接入方式MIMIC-CXR test set 子集的结构化标注(board-certified radiologists 标注验证)
AI 就绪度

INFOBOX:lunguage 速览

字段 值
数据集 Lunguage: A Benchmark for Structured and Sequential Chest X-ray Interpretation v1.0.0
slug lunguage(lung+language 双关)
发布 2026-01-11|PhysioNet(全批最新鲜——挂牌仅 8 个月)
DOI 10.13026/pk42-4v91
访问 Credentialed(License 1.5.0 + DUA 1.5.0 实测)
规模 1,473 单报告(17,949 实体+23,307 关系-属性对)+80 纵向序列(41,122 比较)
结构 schema 对齐词表(pf/cf/cof+UMLS)+18 关系类型
团队 KAIST 5 人+微软 Health Futures 3 人+韩医院所+根特大学(13 人)
论文 arXiv 2505.21190 + CHIL 2026(PMLR 333:1-50)
指标 LunguageScore(entity/relation/attribute 级+时间一致性)
一句话 给报告生成 AI 一把"时间尺":不但要说对,还要在时间线上说对

§0 摘要卡:报告生成 AI 的第一次"时间考试"

§0.1 名称与口径声明

本条目记录 PhysioNet 数据集 Lunguage(slug:lunguage,lung+language 双关),v1.0.0,2026-01-11 发布,DOI 10.13026/pk42-4v91,Credentialed(License 1.5.0 + DUA 1.5.0)。它是结构化放射报告的金标准基准:1,473 份专家标注报告(MIMIC-CXR test 子集)+80 份纵向序列标注(10 患者的疾病进展时间线)+schema 对齐词表。

版本数字演化存照:arXiv v1 写"80 sequential reports from 10 patients";CHIL 2026 版写"186 of them contain longitudinal annotations"——数字在版本间演化,正文按 PhysioNet 页面口径(80 序列/10 患者)并在此存照。

§0.2 读者收益清单

  • 报告生成评测团队:首个 patient-level 纵向评估基准——"no change in pneumonia"这类时间表述第一次可以被验证(先前所有协议都是单报告孤立评估)
  • 结构化抽取研究者:17,949 实体+23,307 关系-属性对的金标准+schema 对齐词表(pf/cf/cof+UMLS)——细粒度信息抽取的训练/评测双资产
  • 指标设计者:LunguageScore 的"实体-关系-属性+时间一致性"四层结构是可解释评测指标的设计范本
  • 医疗NLP教学者:从 RadGraph 到 RadGraph2 到 Lunguage 的结构化报告演进线——三代技术的对照教材
  • 多机构协作团队:KAIST+微软+三所韩国医院的跨国标注组织样本

§0.3 本条目与其他条目的阅读组合

  • cxr-pro(508):同为报告文本的结构化工作——508 删除 prior 引用(去幻觉),514 把 prior 比较本身结构化(时间线实体)——"删"与"构"的两种文本手术
  • MIMIC-CXR 家族(506-511):dicom_id/subject_id 连通;本集是报告层的结构化深化(对照 508 的 impressions 全文处理)
  • MS-CXR(若库内):微软团队的姊妹资产——MS-CXR 做视觉-语言对齐,Lunguage 做报告结构化——微软 Health Futures 的两条产品线

§0.4 身份卡:一条命令背下这个数据集

名称   Lunguage: A Benchmark for Structured and Sequential CXR Interpretation
版本   v1.0.0(2026-01-11,唯一版本)
DOI    10.13026/pk42-4v91
访问   Credentialed(License 1.5.0 + DUA 1.5.0)
规模   1,473 单报告(17,949 实体+23,307 关系对,18 类型)
       +80 纵向序列(10 患者,41,122 两两比较)
词表   schema 对齐(pf/cf/cof+UMLS 码)
标注   board-certified radiologists 标注+验证
论文   arXiv 2505.21190 + CHIL 2026(PMLR 333:1-50)
团队   KAIST 5+微软 3+韩国院所+根特(13 人)

它的故事一句话:报告生成 AI 从来没考过"时间"这门课——Lunguage 用 80 条疾病进展时间线和 4 万次两两比较,把"时间推理"第一次变成了可打分的考题。

§1 出身与谱系:KAIST 与微软的第二次握手

§1.1 团队的双核结构

KAIST(韩国科学技术院)5 人(一作 Moon Jong Hak、通讯 Edward Choi 等)承担主体工作;Microsoft Research Health Futures 3 人(Harshita Sharma、Daniel C. Castro、Javier Alvarez-Valle)——MS-CXR 数据集的原班人马。加上 Seoul National University Hospital/Seoul Medical Center/Yeungnam University 的临床放射科医生与 Ghent University 的 Rabaey——13 人的跨国矩阵。

微软线的关键意义:MS-CXR(微软的 phrase grounding 集,1,153 对)与 Lunguage 出自同一个 Health Futures 组——微软在胸片多模态资产上的双线布局(视觉-语言对齐线+报告结构化线)。

§1.2 结构化报告的演进谱:RadGraph→RadGraph2→Lunguage

本集站在一条清晰的谱系上:RadGraph(Jain 2021,实体+关系抽取)→ RadGraph2(Khanna 2023,疾病进展的层级信息抽取)→ Lunguage(Moon 2026,schema 对齐+纵向序列+专家验证)。三代的递进:从"抽取"到"建模进展"到"可评测的金标准"。页面 References 的 [1][2] 正是 RadGraph/RadGraph2——谱系的自觉引用。

§1.3 时间线年表

2025-05     arXiv 2505.21190 v1 提交
2026-01-11  PhysioNet v1.0.0 挂牌
2026        CHIL 2026(Conference on Health, Inference and Learning)收录,PMLR 333:1-50
2026-04-28  arXiv v2 更新
2026-09     核查时点:Views 55(挂牌 8 个月——全批最低,新集属性)

§1.4 用户画像:谁该用、谁不该用

该用:① 报告生成/结构化系统的评测团队(首个纵向金标准);② 信息抽取研究者(17,949 实体+23,307 关系对的训练/评测);③ 时间推理(temporal reasoning)方法学者(41,122 两两比较);④ 医学本体互操作研究者(UMLS 对齐词表)。

不该用:① 大规模预训练(1,473 份太少—— silver-standard 代码是扩展路径);② 图像侧任务(本集是纯文本结构化,无图像内容);③ 韩国语料需求(英语报告)。

§1.5 名词速查表

术语 含义
Lunguage lung+language 双关——本基准名
结构化报告 把自由文本报告转为实体-关系-属性的机器可读表示
实体(entity) 报告中的临床对象(发现/解剖/疾病)——17,949 个
关系-属性对 实体间关系及其属性——23,307 对,18 种关系类型
pf/cf/cof 词表的三大类:Perceptual Findings/Contextual Findings/Clinical Objective Findings
ENTITYGROUPS 语义等价观测的分组(纵向比较的单元)
TEMPORALGROUPS 时间对齐的临床情节分组
LunguageScore 实体/关系/属性级+时间一致性的可解释评估指标
CHIL Conference on Health, Inference and Learning(PMLR,本论文发表处)
UMLS 统一医学语言系统——词表的概念码对齐目标

§1.8 时间线与发布节奏

挂牌(2026-01)与 CHIL 收录同年——学术发表与数据公开的同步节奏。全批最新:2026-01-11 距核查时点仅 8 个月——Views 55 的低数字主要是时间因素(对照 509 挂牌 8 个月时 Views 74 的同量级)。新集的低曝光不构成质量信号。

§2 语境与设计逻辑:时间推理的评测化

§2.1 "no change in pneumonia"问题:单报告评估的结构性缺陷

论文 Introduction 的核心论证:既有 40+ 评估协议(RadGraph/RadGraph2/各种 F1 变体)都是单报告孤立评估——"no change in pneumonia"这句话的对错,取决于前片有没有肺炎——孤立评估在结构上无法判定。纵向推理(longitudinal reasoning)是放射科读片的本质(对比是本职工作),却是所有评测协议的盲区。Lunguage 的 80 序列+41,122 两两比较就是把这个盲区变成考题。

§2.2 细粒度的两个维度:实体粒度与属性粒度

论文的第二个批评:既有框架把"2.5 cm right upper lobe nodule with spiculated margins"压扁成"nodule"——位置/尺寸/形态全丢。Lunguage 的 schema 保留:① 实体子类(pf 的 Diagnostic Observations 303/Anatomical Entities 157/Diseases 76 等细分);② 属性(位置精确到"carina above 3cm"、尺寸精确到"2.5 cm");③ 关系类型(18 种)。细粒度的评测意义:能区分"精确但啰嗦"与"简洁但遗漏"的输出——粗指标的天花板被打破。

§2.3 词表的三类结构与 UMLS 对齐

schema 对齐词表的三类:pf(Perceptual Findings,感知发现——影像直接所见)、cf(Contextual Findings,情境发现——临床语境的诊断,如 congestive heart failure)、cof(Clinical Objective Findings,临床客观发现)。每类含子类计数(如 pf 的 Diagnostic Observations 303 项)与 UMLS 概念码(部分空缺存照)。UMLS 对齐使本集的实体可与外部医学本体互操作——schema 对齐是结构化资产的"通用语"工程。

§2.4 与 508 的"删"与"构"对照(扩展)

508 的 GILBERT 是减法手术(删除 prior 指涉——去掉幻觉源);本集是加法手术(把时间比较结构化为实体关系——显式化时间推理)。两者共享一个前提:报告的自由文本形态是 AI 应用的障碍。508 的答案是把障碍删掉(让训练语料纯净),514 的答案是把障碍结构化(让时间语义可计算)——删与构是文本工程的两种基本操作,在 MIMIC 家族中恰好各占一个条目。

§2.5 证据层级小结

本集的证据位置:专家验证的评测金标准层——board-certified radiologists 标注+验证使它高于弱监督资产;但体量(1,473+80)使其是"基准"而非"语料库"。它的最佳角色:结构化报告的度量衡——所有结构化框架(RadGraph 系/LLM 抽取系)都可以来此比武。

§2.6 一句话语境总结

放射科报告最难的不是"说了什么"而是"和上次比怎么样"——Lunguage 用 230 个患者的时间线和 4 万次比较,第一次把"和上次比"变成了 AI 的必考题。

§3 数据切片:三层资产的结构

§3.1 总账

层 1  schema 对齐词表     pf/cf/cof 类目+子类+UMLS 码
层 2  单报告结构化         1,473 报告|17,949 实体|23,307 关系-属性对|18 关系类型
层 3  纵向序列             80 报告(10 患者)|41,122 两两比较|ENTITYGROUPS+TEMPORALGROUPS

§3.2 词表的类目结构

大类 全称 子类构成(示例)
pf Perceptual Findings Diagnostic Observations(303)/Anatomical Entities(157)/Diseases and Disorders(76)
cf Contextual Findings Diseases and Disorders(271)/Diagnostic Observations(43)
cof Clinical Objective Findings Diagnostic Observations(85)/Diseases…

pf 是影像直接所见(opacity/right hilum),cf 是临床语境诊断(congestive heart failure/pneumonia),cof 是临床客观发现——三类的区分对应"影像所见vs临床诊断"的认知分层。UMLS 码使每个词条可对接标准医学本体——部分词条无法可靠映射则标"–"(页面自认)。

§3.3 单报告结构化的粒度示例

论文给出粒度的直观对比:“2.5 cm right upper lobe nodule with spiculated margins"在粗框架下压扁为"nodule”,在 Lunguage schema 下保留:实体(nodule)+属性(2.5 cm/right upper lobe/spiculated margins)+关系(位于右肺上叶)。18 种关系类型覆盖位置/大小/形态/严重度/时间变化等维度——细粒度评测的schema基础。

§3.4 纵向序列的结构:ENTITYGROUPS 与 TEMPORALGROUPS

80 份序列报告(10 患者)的纵向标注以两种分组组织:ENTITYGROUPS 把"语义等价"的观测归组(同一病灶在不同 study 的表述对齐);TEMPORALGROUPS 把"时间对齐"的临床情节归组。41,122 个两两比较(每患者 34-141 个)覆盖 1-1,200 天的间隔——疾病进展(progressed/stable/improved/new)从此有了逐对的可验证表述。

§3.5 获取路径

入口:physionet.org/content/lunguage/1.0.0/
门槛:CITI GCP + DUA 1.5.0(Credentialed 标准款)
代码:github.com/SuperSupermoon/Lunguage(两阶段框架+LunguageScore+silver-standard 生成)

§4 结构深查:金标准的三层质控

§4.1 标注流程的质控结构

board-certified radiologists 标注+验证(页面 Abstract)+统一指南+定期共识会议(页面 Limitations 自述缓解措施)。与 509(κ>0.9 双轮)/510(NHS 审校)对照:本集的质控是"专家标注+共识会议"制——一致性系数未报告(页面 Limitations 只说"minor interpretive differences may persist")——与 510 同样的"质控不可量化"缺口,但专家资质声明更强。

§4.2 UMLS 映射的空缺率

词表的 UMLS 码"部分为空/标 --"——空缺率未披露。空缺的构成推测:新造词/韩式英语表达/罕见发现。对使用者的含义:词表的互操作承诺是有保留的——跨本体映射前先统计空缺分布。

§4.3 Silver-standard 的扩展路径

页面 Limitations 提供的扩展方案:官方代码可生成 silver-standard 数据集(弱标注的规模化)——1,473 金标准+银标准放大=结构化报告的"预训练-微调"范式。金标准与银标准的比例控制是质量关键——silver 的噪声会以 gold 无法察觉的方式渗入。官方提供生成代码意味着:噪声特性至少与两阶段框架的已知误差一致——比黑盒爬取的银数据可控。

§4.4 版本数字演化的存照(再记录)

arXiv v1(2025-05):“80 sequential reports from 10 patients”;CHIL 2026 版:“186 of them contain longitudinal annotations”;PhysioNet 页面:“80 sequential reports from 10 patients… 41,122 pairwise comparisons”。三个数字并存的解读:186 可能是"含纵向比较的报告总数"(80 份序列报告涉及 186 份单报告的纵向标注)——数字口径不同而非矛盾,但未在页面明说。正文按页面口径(80/10 患者/41,122),版本差异存照。

§4.5 结构小结

层 1  词表(schema+UMLS)     结构的定义
层 2  单报告(实体/关系/属性) 结构的实例
层 3  序列(两两比较/分组)    结构的时间维度
—— 三层合起来才是"结构化报告"的完整资产;只拿层 2 等于丢了本集一半的价值。

§5 使用协议:从 DUA 到 LunguageScore

§5.1 全流程地图

[第 0 步] PhysioNet 账号 + CITI GCP + DUA 1.5.0
[第 1 步] 下载词表+单报告+序列标注
[第 2 步] clone github.com/SuperSupermoon/Lunguage
[第 3 步] 选路线 A/B/C(§5.3-§5.5)
[第 4 步] 报告规范:本集 DOI + arXiv/CHIL 论文 + MIMIC-CXR

§5.2 门槛与配套

Credentialed 标准款(CITI+DUA)。体量小(结构化 JSON/CSV 级)——下载秒级。配套:GitHub 代码(两阶段框架+LunguageScore 实现+silver-standard 生成器)。

§5.3 评测路线 A:结构化抽取的基准评测

目标:评测任意报告结构化框架(RadGraph 系/LLM 抽取/自研)——把 MIMIC-CXR test 报告喂给你的抽取器,输出与 Lunguage 金标准对齐,按 LunguageScore 打分。要点:① 对齐 schema(词表约束输出);② entity/relation/attribute 三层分别报;③ 与论文的基线系统对照。

§5.4 评测路线 B:纵向推理评测(独有赛道)

用 80 序列+41,122 比较评测"时间推理":① 给模型同一患者的多份报告(按时间序);② 要求输出每对观测的变化判断(progressed/stable/improved/new);③ 与 41,122 金标准比较——时间一致性的首个可量化评测。论文实证了 LunguageScore 与人工判断的相关性——复现其相关性实验是最小可行研究。

§5.5 评测路线 C:silver-standard 的规模化实验

用官方生成器产 silver 数据→训练结构化抽取器→在 1,473 金标准上验证——"银标准规模×金标准校准"的完整范式。变量:银/金比例、生成器版本、过滤阈值——每格都是实验点。

§5.6 常见踩坑清单

坑 后果 避法
坑点1:论文版本数字混用 80/186 口径混乱 按 PhysioNet 页面口径引用+版本注明
坑点2:词表空缺 UMLS 直接用 本体对齐断裂 先统计空缺分布(§4.2)
坑点3:拿 1,473 份当训练集 金标准被消耗 金标准只评测;训练用 silver 或母体
坑点4:忽略 ENTITYGROUPS 语义 纵向比较错位 语义等价分组先行
坑点5:时间间隔的时区/日期处理 序列对齐错误 1-1,200 天间隔的解析需统一
坑点6:漏引 KAIST/微软团队 作者归属失真 13 人全员引用
坑点7:把 pf/cf/cof 混为一类 认知分层丢失 三类分账使用
坑点8:假设 UMLS 全覆盖 跨本体映射失败 空缺标记"–"的预案

§5.7 引用与许可义务

引用三件套:本集 DOI(10.13026/pk42-4v91)+ 论文(arXiv 2505.21190/CHIL 2026)+ MIMIC-CXR(母体双引用)。DUA 1.5.0 标准义务。License 1.5.0 的 Credentialed 框架(禁再分发等)。

§5.8 算力与时间预算

路线 算力 墙钟时间
A 结构化评测 CPU-单卡 1-3 天
B 纵向推理 单卡 3-5 天
C silver 规模化 单卡-多卡 1-2 周

纯文本资产的算力友好度:全家族与 506 并列最优。

§6 实证图景:基准的实证与指标的表现

§6.1 论文的实证结构

CHIL 2026 版论文的实证三件套:① 基准本身(1,473+80+词表的构建质控);② 两阶段框架(生成报告→结构化的转换效果);③ LunguageScore 的验证(与人工判断的相关性——指标有效性的实证)。论文具体系数需读全文(本条目存照不引未核实值)。

§6.2 LunguageScore 的设计解剖

四层结构的指标:① entity 级(实体抽取的对错);② relation 级(关系判断的对错);③ attribute 级(属性值的对错);④ temporal 级(时间一致性——跨报告的比较是否自洽)。与 RadGraph F1 的对照:RadGraph F1 是静态图匹配,LunguageScore 加了时间维度——"静态结构化"到"动态时间线"的指标演进。

§6.3 688 倍……不对,本集的数字卡

规模:1,473 单报告|230 患者|17,949 实体|23,307 关系-属性对|18 关系类型
序列:80 报告|10 患者|3-14 study/患者|1-1,200 天间隔|41,122 比较
词表:pf/cf/cof 三类|UMLS 部分对齐
标注:board-certified radiologists|统一指南+共识会议
Views:55(2026-09 核查)

§6.4 与 RadGraph 系的坐标

RadGraph(2021)开创报告结构化抽取;RadGraph2(2023)加疾病进展层级;Lunguage(2026)加专家金标准+纵向序列+专用指标。本集是谱系的第三代——第一代证明可抽取,第二代证明可建模进展,第三代证明可评测。三代的共同短板(规模小、单中心标注)也是本集的短板——谱系的成熟要等更大规模的金标准。

§6.5 证据边界

① 标注者人数与 IAA 未披露(同 510 的缺口);② 80 序列的疾病谱未分层;③ UMLS 空缺率未量化;④ silver-standard 的质量对照未给;⑤ 论文版本间数字演化(80/186)的解释是推断。引用时随附。

§6.7 实证小结

CHIL 2026(PMLR 333)+ arXiv 2505.21190
三大贡献:纵向基准+两阶段框架+LunguageScore
规模:1,473+80|17,949+23,307|41,122
谱系:RadGraph→RadGraph2→Lunguage(第三代)

§7 AI 实践指南:把时间尺用对

§7.1 技术定位的三条铁律

  1. 金标准只评测——1,473+80 是度量衡,不是训练燃料(训练回母体或 silver)
  2. 时间是本集的灵魂——只用单报告层等于丢掉一半价值(80 序列+41,122 比较是独有资产)
  3. schema 是宪法——输出必须对齐词表,自由发挥的实体无法评分

§7.2 推荐管线(纵向推理评测)

# ===== 阶段 0:加载 =====
vocab = load_schema("pf/cf/cof 词表+UMLS 映射")
single = load_structured("1,473 单报告")
seq = load_sequences("80 纵向序列+41,122 比较")

# ===== 阶段 1:结构化你的生成报告 =====
structured = two_stage_framework(generated_reports, vocab)
# 阶段 2.1:实体/关系/属性抽取(对齐 schema)
# 阶段 2.2:序列组织(ENTITYGROUPS/TEMPORALGROUPS 对齐)

# ===== 阶段 3:LunguageScore 评测 =====
score = lunguage_score(structured, seq.gold)
report(score.entity, score.relation, score.attribute, score.temporal)

§7.3 报告规范:引用本集数字的格式

三件套:① 数字+口径(“1,473 份专家标注报告/80 纵向序列/41,122 比较”);② 版本声明(“arXiv v1 口径 80 序列;CHIL 2026 口径 186 纵向标注——本条目按 PhysioNet 页面”);③ 指标声明(“LunguageScore:entity/relation/attribute/temporal 四层”)。

§7.5 反模式清单

  • ❌ 金标准当训练集(度量衡被消耗)
  • ❌ 只用单报告层丢序列层(一半价值蒸发)
  • ❌ 自由实体不进 schema(无法评分)
  • ❌ 版本数字混用(80/186)
  • ❌ UMLS 空缺不声明
  • ❌ 单报告孤立评估却声称"纵向能力"

§7.6 教学用法:结构化报告的两周课

Week1:RadGraph→RadGraph2→Lunguage 谱系导读+schema 解析+实体对齐练习。Week2:两阶段框架实操+LunguageScore 实现+纵向推理评测+组会。卖点:三代技术的对照+开放题(hidden signals 式的时间机制)——NLP 医疗方向的高阶课程。

§7.7 从基准到部署的桥

  1. 院内报告结构化:用两阶段框架把院内报告转为 schema 对齐表示
  2. 纵向预警:同一患者的序列结构化+变化检测=病情演变的自动监控
  3. 评测常态化:每次模型更新跑一遍 LunguageScore——报告生成的回归测试

§8 伦理与合规:金标准的轻伦理

§8.1 Credentialed 的理由

结构化标注与 MIMIC test 报告一一对应——报告文本的可逆拼图风险随母体继承。License 1.5.0+DUA 的标准档。与 508(同为文本层)同档——文本层的合规档位在家族内一致。

§8.2 Ethics 与 COI

页面 Ethics:“no ethical concerns to declare”(PhysioNet 去标识数据,无需额外 IRB——论文口径一致);COI:无声明冲突。kaist.ac.kr 的通讯渠道开放。

§8.3 跨国标注的文化维度

13 人中韩国团队 9 人(KAIST 5+韩国医院 3+1)——标注的临床惯例(报告风格/术语偏好)带韩国烙印。页面自认"跨机构/跨国共识待扩展"——标注的"韩国口径"对英语报告的泛化是隐性边界。使用者注意:跨机构共识是 v2 的方向,本版的口径以韩国团队为准。

§8.5 门槛的总账

维度 得 失
质控 专家标注+验证+共识会议 IAA 未量化
独特性 纵向基准+LunguageScore 全库唯一 体量小
互操作 UMLS+schema 对齐 空缺率未披露
可获取 Credentialed 标准款 门槛存在
工具链 GitHub 开源+silver 生成器 —

DAIMS:7.0(§10.6 论证——金标准+新维度+工具链;体量是唯一硬伤)。

§9 FAQ:90 问快答

出身与身份(10 问)

  1. 这个数据集是什么? MIMIC-CXR test 子集的结构化报告金标准:1,473 份专家标注报告+80 份纵向序列+schema 词表。
  2. 谁做的? KAIST 5 人+微软 Health Futures 3 人+韩国三院所+根特大学——13 人跨国团队。
  3. 何时发布? 2026-01-11,v1.0.0(全批最新)。
  4. DOI? 10.13026/pk42-4v91。
  5. 访问级别? Credentialed(License 1.5.0 + DUA 1.5.0 实测)。
  6. 名字为什么叫 Lunguage? lung+language 双关——胸片报告的"语言"。
  7. 论文? arXiv 2505.21190 + CHIL 2026(PMLR 333:1-50)。
  8. 通讯是谁? Edward Choi(KAIST,edwardchoi@kaist.ac.kr);一作 Moon(jhak.moon@kaist.ac.kr)。
  9. 与 MS-CXR 什么关系? 微软 Health Futures 同组出品——MS-CXR 做视觉对齐,本集做报告结构化。
  10. 代码在哪? github.com/SuperSupermoon/Lunguage。

内容与规模(10 问)

  1. 多少报告? 1,473 份单报告(MIMIC-CXR test 子集)+80 份纵向序列。
  2. 多少患者? 230(序列子集 10 人)。
  3. 实体多少? 17,949 个专家验证实体。
  4. 关系-属性对多少? 23,307 对,18 种关系类型。
  5. 纵向比较多少? 41,122 两两比较(ENTITYGROUPS+TEMPORALGROUPS 分组)。
  6. 序列报告的时间跨度? 每患者 3-14 份报告,间隔 1-1,200 天。
  7. 词表的结构? pf/cf/cof 三大类+子类+UMLS 码(部分空缺)。
  8. pf/cf/cof 分别是什么? 感知发现/情境发现/临床客观发现——影像所见与临床诊断的认知分层。
  9. 本集有图像吗? 没有——纯文本结构化资产(图像经 dicom 回 MIMIC)。
  10. 体量? 结构化 JSON/CSV 级——下载秒级。

标注与质量(10 问)

  1. 谁标注的? board-certified radiologists 标注+验证。
  2. 有 κ 吗? 未报告——共识会议+统一指南为质控手段(与 510 同类的"不可量化"缺口)。
  3. 标注的主观性? 页面自认 minor interpretive differences persist——缓解靠指南+共识。
  4. 标注的一致性措施? 统一指南+定期共识会议(页面 Limitations 自述)。
  5. 跨国标注的口径? 韩国团队为主——跨机构/跨国共识待扩展(自认)。
  6. UMLS 映射全吗? 部分空缺(标"–")——空缺率未披露。
  7. silver-standard 是什么? 官方代码可生成的弱标注扩展(规模化路径)。
  8. 1,473 够训练吗? 金标准只评测;训练用母体或 silver——定位是度量衡。
  9. 与 RadGraph 的关系? 谱系第三代:RadGraph(抽取)→RadGraph2(进展)→Lunguage(可评测金标准)。
  10. 18 种关系类型? 覆盖位置/大小/形态/严重度/时间变化等维度(论文全文明细)。

评测与指标(10 问)

  1. LunguageScore 是什么? entity/relation/attribute/temporal 四层的可解释评估指标。
  2. 与 RadGraph F1 的区别? 加了时间维度(temporal consistency)——静态图匹配→动态时间线。
  3. 为什么需要纵向评测? "no change in pneumonia"的对错取决于前片——单报告孤立评估无法判定。
  4. 41,122 比较怎么用? 每对观测的进展判断(progressed/stable/improved/new)有金标准。
  5. ENTITYGROUPS/TEMPORALGROUPS? 语义等价分组/时间对齐分组——纵向比较的组织单元。
  6. 两阶段框架是什么? 生成报告→schema 对齐的结构化表示(转换器+评分器)。
  7. 细粒度的意义? “2.5 cm 右上叶结节伴毛刺"不被压扁成"nodule”——位置/尺寸/形态保留。
  8. 版本数字 80 vs 186? arXiv v1 的 80 序列 vs CHIL 版 186 纵向标注——口径演化存照。
  9. MIMIC 域内吗? 是——MIMIC-CXR test set 子集(230 患者)。
  10. 评测的最小可行实验? 用官方 LunguageScore 代码评测任一结构化框架——复现论文相关性。

与母体的关系(10 问)

  1. 和 MIMIC-CXR 什么关系? test 子集的结构化标注——母体的评测层派生。
  2. 需要下载 MIMIC 吗? 生成报告训练需要;纯指标评测不需要。
  3. 与 506 数值层什么关系? 同母体:506 是几何量(人读),514 是结构化语义(机器评)。
  4. 与 508 什么关系? 文本层的两极:508 删 prior(去幻觉),514 结构化 prior 比较(时间推理)。
  5. 508 的 GILBERT 和本集的抽取? 508 是删除(token REMOVE/KEEP),本集是抽取+结构化——方向不同。
  6. 和 MS-CXR 什么关系? 微软 Health Futures 的姊妹线——视觉对齐 vs 报告结构化。
  7. 和 RadGraph2 的区别? RadGraph2 建模进展但无可评测金标准;本集补上金标准+专用指标。
  8. 母体引用义务? MIMIC-CXR 双引用(PhysioNet DOI+Sci Data)。
  9. 派生合规? PhysioNet 去标识数据——论文口径无需额外 IRB。
  10. 名称的复数含义? 结构化报告的"语言"——lung+language 的合成词。

使用与实操(10 问)

  1. 推荐第一步? 官方 LunguageScore 代码评测任一结构化框架——复现论文相关性。
  2. 需要 GPU 吗? 纯文本评测 CPU 可;训练结构化抽取器单卡。
  3. 输入是什么? 生成的自由文本报告(待评)+MIMIC 原报告(参考)。
  4. 输出是什么? entity/relation/attribute/temporal 四层分数。
  5. 能做训练吗? 训练抽取器用 silver-standard(官方生成器);金标准只评测。
  6. 时间间隔怎么处理? 1-1,200 天的原始间隔——统一时区/日期解析。
  7. ENTITYGROUPS 的语义等价怎么定义? schema 词表约束——同实体不同表述归组。
  8. 能评测 LLM 吗? 能——LLM 的结构化输出(JSON 实体关系)直接进 LunguageScore。
  9. 和 511 嵌入能配合吗? 能——嵌入检索相似报告+Lunguage 评结构化——跨条目管线。
  10. 多久能跑通? 官方代码+小数据:1 天内出第一个分数。

评分与定位(10 问)

  1. AI-Ready 程度? 高——金标准+代码+新维度+词表互操作;扣分体量与门槛。
  2. DAIMS? 7.0(§10.6 论证)。
  3. 和 508 谁更 AI-Ready? 511 式对比无意义——两者任务不同(删 vs 构);本集的指标资产独一份。
  4. 不可替代性? 首个纵向报告评测基准+LunguageScore 指标——"时间尺"全库唯一。
  5. 适合做什么? 结构化评测/纵向推理/指标研究/教学/本体验证。
  6. 不适合做什么? 大规模训练/图像任务/自由文本生成。
  7. 重分析空间? IAA 补测/UMLS 空缺分解/跨机构扩展/silver 质量对照——四题开放。
  8. Views 55 说明什么? 挂牌 8 个月的新集——时间因素为主。
  9. 五年后? 结构化评测是报告生成的必经关卡——本集是纵维度立标者。
  10. 只记一件事? 报告 AI 从没考过"时间"这门课——Lunguage 把它变成必考。

伦理与合规(10 问)

  1. 为什么 Credentialed? 报告文本与 MIMIC 一一对应——母体继承。
  2. Ethics 声明? “no ethical concerns”——PhysioNet 去标识数据(论文口径一致)。
  3. COI? 无声明冲突(微软作者的雇主关系为常规披露)。
  4. DUA 义务? 禁再分发/禁重识别/禁超范围。
  5. 能喂第三方 LLM API 吗? 谨慎——受控文本的传输边界(同 508/509 条款)。
  6. 金标准的伦理? 度量衡的中立性——标注主观性已自认(残留可接受)。
  7. 韩国口径的问题? 临床惯例的隐性边界——跨机构共识是 v2 方向(页面自认)。
  8. 教学使用? 可以(注册制内统一安排)。
  9. 违反 DUA 后果? 访问撤销+机构通报。
  10. 有伦理缺陷吗? 无——轻伦理的标准样本。

比较与延伸(10 问)

  1. 和 508 最大的差异? 508 删(减法手术)、514 构(加法手术)——文本工程的两种基本操作。
  2. 和 512 的眼动对照? 512 记录"看的过程",514 结构化"说的内容"——过程与结论的人类信号两形态。
  3. 和 RadGraph 系的关系? 谱系第三代(可评测金标准)——引用谱系显式(页面 [1][2])。
  4. 能扩展到 CT/MR 吗? schema 可迁移——词表需重建(模态特异发现)。
  5. 能扩展到中文报告吗? 词表+UMLS 架构可迁移——抽取器需重训。
  6. 未来版本? v1.0.0 无更新;v2 期待:更多序列+多机构共识+UMLS 全覆盖。
  7. 能贡献吗? GitHub 开放;金标准变更走 PhysioNet+专家流程。
  8. 社区经验在哪? CHIL 2026 引用链+GitHub issues。
  9. 对 LLM 时代的意义? 结构化评测是 LLM 医疗输出的事实性关卡——LunguageScore 是现成关卡。
  10. 三分钟了解读哪节? §0.4 身份卡+§2.1 时间推理问题+§6.3 数字卡。

§10 存档:证据、引用与维护

§10.1 核查证据清单(三轮)

第 1 轮  curl 页面(/tmp/514_page.html 93,002 B)
         → 标题/团队/规模/词表结构/Limitations/Ethics/引用 全量
第 2 轮  curl 精查(DOI 10.13026/pk42-4v91 / Views 55 / License 1.5.0)
第 3 轮  WebSearch 论文(arXiv 2505.21190 v2+CHIL 2026 PMLR 333+机构全套)
         → 13 人机构矩阵/KAIST+微软双核/LunguageScore 设计/80 vs 186 演化存照

§10.2 批次清单预判修正记录

项 预判 实测 处置
名称 lunguage ✓ Lunguage(结构化报告基准) 预判正确
访问级别 待核 Credentialed(1.5.0) 已核
规模 待核 1,473+80/词表三层 已核
发布日期 — 2026-01-11(全批最新) 新事实

§10.3 引用格式

数据集:Moon, J. H., Choi, G., Rabaey, P., Kim, M. G., Hong, H. G., Lee, J. O., Yoon, H., Doe, E., Kim, J., Sharma, H., Coelho de Castro, D., Alvarez Valle, J., & Choi, E. (2026). Lunguage: A Benchmark for Structured and Sequential Chest X-ray Interpretation (version 1.0.0). PhysioNet. DOI 10.13026/pk42-4v91.

论文:Moon, J.H., et al. Lunguage: A Benchmark for Structured and Sequential Chest X-ray Interpretation. CHIL 2026(PMLR 333:1-50). arXiv 2505.21190.

母体:Johnson et al. (2019). MIMIC-CXR Database (v2.0.0). PhysioNet. DOI 10.13026/C2JT1Q.

§10.4 页面事实的待查与存照边界

  1. 标注者人数与 IAA 未披露——质控不可量化(同 510 缺口)
  2. UMLS 空缺率未量化
  3. 80 vs 186 的口径解释为推断(页面未明说)
  4. silver-standard 的质量对照未给
  5. Views 55 口径=unique registered users

§10.5 slug 互链登记

目标 slug 互文点
cxr-pro(508) 文本手术两极:删(508)vs 构(514)
cxr-cardiomegaly 家族(506-511) MIMIC 家族形态补全(报告结构化层)
MS-CXR(若库内) 微软 Health Futures 姊妹线
MIMIC-CXR 主条目 母体(test 子集派生)

§10.6 DAIMS 评分论证(区间制)

文档完整性    极高(页面+论文+GitHub 三源一致)              +1.5
独特维度      极高(纵向推理基准+LunguageScore 全库唯一)    +1.5
质控          高(board-certified+共识会议;无 IAA)         +0.5
互操作        高(schema+UMLS 对齐——空缺存照)              +1.0
体量          中(1,473+80——基准定位合理但训练受限)        -1.0
可获取        中(Credentialed 标准款)                      -0.5
工具链        高(代码+silver 生成器开源)                   +1.0
实证背书      高(CHIL 2026 收录+微软团队背书)              +1.0
────────────────────────────────────────────────────────
区间评定      7.0(金标准+新维度+工具链;体量是唯一硬伤)

§10.7 发布验收单

[✓] frontmatter 双检(category_tags 全在 VOCAB)
[✓] check_md ≥1200 行
[✓] preflight_check PASS
[✓] 发布前 DB 查重(url_name LIKE '%lunguage%' / content LIKE '%pk42-4v91%')
[✓] publish.sh PASS → rid 验证(status=1)
[✓] 封面生成 + cover_url 挂载
[✓] link_builder 内链 + 导航重建 + json_ld
[✓] 线上 HTTP 200 + 内容抽查(1,473/pk42-4v91/LunguageScore/CHIL)
[✓] tracker 追加 514 行
[✓] 工单评论(r3i2Os)

§10.8 维护记录

2026-09-23  初版核查三轮完成,FACTS.md 落档
2026-09-23  两段组装(/tmp 安全区),本文发布

§10.9 给下一位核查者的信

复核优先验证六件事:① DOI 10.13026/pk42-4v91 仍解析且无 v1.1(v2 若扩序列,§3.4 的 80/41,122 需更新);② 论文版本数字演化(80/186)是否在 v3 统一;③ CHIL 2026 的 PMLR 卷页是否正式出版(333:1-50 为预印本口径);④ GitHub repo 活性(SuperSupermoon/Lunguage);⑤ UMLS 空缺率是否被官方补充;⑥ MIMIC-CXR test 子集的 230 患者口径是否与母体 test 划分一致。

§10.10 收束

1,473 份报告、17,949 个实体、23,307 个关系、80 条时间线、41,122 次比较——这串数字的内核只有一个动作:把放射科医生脑子里那份"和上次比怎么样"的隐性知识,第一次写成机器可读的显式考卷。RadGraph 教会机器抽取,RadGraph2 教会机器看进展,Lunguage 把两者焊在一张专家验证的考卷上——从今往后,报告生成 AI 的成绩单上多了一列:时间推理。这一列以前是空白,空白不扣分;现在空白即失分——这就是基准的进步方式。

附录:对照表与工具卡

附录 A:全库速查总表

维度 值
数据集名 Lunguage
slug / 批次序号 lunguage / 514
版本 v1.0.0(2026-01-11,唯一)
DOI 10.13026/pk42-4v91
平台 PhysioNet
访问 Credentialed(License 1.5.0 + DUA 1.5.0)
规模 1,473 单报告+80 序列|17,949 实体+23,307 关系对|41,122 比较
词表 pf/cf/cof+UMLS(schema 对齐)
团队 KAIST5+微软3+韩国院所+根特(13 人)
论文 CHIL 2026(PMLR 333)+ arXiv 2505.21190
指标 LunguageScore(四层)
Views 55
DAIMS 7.0
rid 614

附录 B:三层资产对照卡

层 内容 规模 用途
词表 pf/cf/cof+UMLS 三类多子类 schema 定义/互操作
单报告 实体+关系-属性 1,473 份 抽取评测
纵向序列 两两比较+分组 80 份/41,122 比较 时间推理评测

附录 C:LunguageScore 四层结构卡

层 测什么 类比
entity 实体抽取对错 RadGraph 实体
relation 关系判断对错 关系抽取
attribute 属性值对错 细粒度保留
temporal 时间一致性 本集新增维度

附录 D:与 RadGraph 系谱系对照

代 年 贡献 缺口
RadGraph(一代) 2021 实体-关系抽取框架 单报告、无金标准评测协议
RadGraph2(二代) 2023 疾病进展的层级抽取 仍无可比金标准
Lunguage(三代) 2026 金标准+纵向+专用指标 规模小(1,473+80)

附录 E:MS-CXR 与本集的微软双线对照

维度 MS-CXR Lunguage(本集)
团队 Microsoft Health Futures 同组(Sharma/Castro/Alvarez-Valle)
资产 视觉-语言对齐对 结构化报告+时间线
任务 phrase grounding 结构化抽取评测
规模 1,153 对 1,473+80
挂牌 2024(v1.1.0) 2026-01

附录 F:引用地图

用途 必引 建议加引
使用金标准 本集 DOI + MIMIC-CXR CHIL 2026 论文
使用 LunguageScore 论文 + 本集 DOI RadGraph 系谱
使用 silver 生成器 GitHub + 论文 本集 DOI
结构化综述 谱系三代(RadGraph→2→本集) —

附录 G:时间线总表

时点 事件
2021 RadGraph(arXiv 2106.14463)
2023 RadGraph2(MLHC PMLR)
2025-05 arXiv 2505.21190 v1
2026-01-11 PhysioNet v1.0.0 挂牌
2026 CHIL 2026 收录(PMLR 333)+ arXiv v2(04-28)
2026-09 核查时点 Views 55

附录 H:批次六进度存照(514 后)

506 cxr-cardiomegaly              rid 606  ✅ 2026-09-22(ODC-BY)
507 cxr-phone                     rid 607  ✅ 2026-09-23(Cred×2)
508 cxr-pro                       rid 608  ✅ 2026-09-23(Cred)
509 fdtooth                       rid 609  ✅ 2026-09-23(Cred)
510 heart-lung-segmentations-data rid 610  ✅ 2026-09-23(ODC-BY)
511 image-embeddings-mimic-cxr    rid 611  ✅ 2026-09-23(Cred)
512 latte-cxr                     rid 612  ✅ 2026-09-23(Restricted)
513 lung-segment-mimic-cxr        rid 613  ✅ 2026-09-23(Cred)
514 lunguage                      rid 614  ✅ 2026-09-23(Cred)本条
515 maternal-ultrasound-nutrition 待产(批次六末条)
批次六工单:r3i2Os|批次进度 9/10

附录 L:FAQ 补遗五十问(91-140)

91 金标准的标注者几位?—— board-certified radiologists 团队——人数未披露(存照)。
92 单报告的实体数分布?—— 17,949/1,473≈12.2 实体/报告(均值推算)。
93 18 种关系类型有哪些?—— 位置/大小/形态/严重度/时间变化等维度(论文全文明细)。
94 pf 的子类计数?—— Diagnostic Observations 303/Anatomical Entities 157/Diseases 76。
95 cf 的子类计数?—— Diseases and Disorders 271/Diagnostic Observations 43。
96 cof 是什么?—— Clinical Objective Findings——临床客观发现(如实验室/体征参照)。
97 UMLS 是什么?—— 统一医学语言系统——医学术语的标准本体。
98 词表为什么对齐 UMLS?—— 跨本体互操作——与外部医学知识库连通。
99 '–'标记是什么?—— 无法可靠映射 UMLS 的词条(空缺率未披露)。
100 序列报告选了哪些患者?—— MIMIC test 子集中研究次数 3-14 次的 10 人。
101 时间间隔 1-1,200 天说明什么?—— 覆盖急性(1 天)到慢病随访(3 年+)的全谱。
102 ENTITYGROUPS 的判定标准?—— 语义等价——同一观测的不同表述归组。
103 TEMPORALGROUPS 的判定标准?—— 时间对齐的临床情节(同一病程事件)。
104 41,122 比较的粒度?—— 观测对(entity 对)的两两比较——每对含变化判断。
105 每患者比较数范围?—— 34-141 个(页面统计)。
106 两阶段框架的第一阶段?—— 生成报告→抽取(实体/关系/属性)。
107 第二阶段?—— schema 对齐(词表约束+归一化)。
108 LunguageScore 的输出?—— entity/relation/attribute/temporal 四层分数。
109 与人工判断的相关性?—— 论文实证了有效性(具体系数读全文)。
110 silver-standard 怎么生成?—— 官方代码:框架抽取无标注报告→弱标注池。
111 silver 的用途?—— 结构化抽取器的训练燃料(金标准只评测)。
112 silver 的质量风险?—— 框架误差渗入——与 gold 对照校准。
113 本集是纯文本吗?—— 是——结构化 JSON/CSV,无图像。
114 与 MIMIC 图像的关联?—— dicom/subject 键——可跨家族 join。
115 KAIST 的角色?—— 主体工作(标注组织+框架开发+论文)。
116 微软的角色?—— MS-CXR 团队的方法论与工程支持。
117 韩国医院的角色?—— 放射科医生标注(board-certified)。
118 根特大学的角色?—— Paloma Rabaey(合作研究者)。
119 IRB 状态?—— PhysioNet 去标识数据——无需额外 IRB(论文口径)。
120 与 RadGraph 的 schema 差异?—— 本集加词表对齐+属性细化+时间维度。
121 与 508 的 GILBERT 关系?—— 同为报告文本处理——508 删指涉,514 抽结构。
122 与 512 的关系?—— 512 抽 bbox-陈述对(局部对齐),514 报告全句结构化。
123 为什么叫 benchmark 不是 dataset?—— 定位是评测金标准——非训练语料。
124 挂牌为什么晚于 arXiv?—— CHIL 评审周期+PhysioNet 发布流程。
125 Views 55 的原因?—— 挂牌 8 个月+评测型资产(使用周期长)。
126 需要下 MIMIC 原报告吗?—— 评测生成报告时需要(参考输入)。
127 纯指标评测需要吗?—— 金标准+生成输出即可——不用原图。
128 报告是什么语言?—— 英语(MIMIC 原生)。
129 有韩语吗?—— 没有——标注团队是韩国人但语料是英语。
130 schema 能改吗?—— 官方 schema 优先——自定义需声明与评分器的兼容。
131 训练什么模型最适合?—— 结构化抽取器(NER+RE+属性)与报告结构化 LLM。
132 LunguageScore 能评 RadGraph 输出吗?—— 能——需转换到本集 schema(映射工具官方提供与否存照)。
133 能评中文报告吗?—— 需翻译/跨语抽取——词表是英语锚。
134 长尾实体的问题?—— 词表覆盖有限——罕见发现可能无 schema 条目。
135 与 506 数值的 join?—— subject/study 键——数值与结构化对齐可做。
136 与 512 眼动的 join?—— reading_id 不同源(512 是 REFLACX)——不直接互通。
137 与 510 的 join?—— MIMIC 键可通——掩码+结构化报告的多模态对齐。
138 体量为什么小?—— 金标准的标注成本——board-certified 时间是稀缺资源。
139 能自动扩展吗?—— silver 生成器就是扩展路径——质量梯度自控。
140 三件套引用?—— 本集 DOI+arXiv/CHIL 论文+MIMIC-CXR 双引用。

附录 M:一百二十条一分钟事实(第 1-120 条)

1 DOI 10.13026/pk42-4v91。
2 发布 2026-01-11,v1.0.0。
3 访问 Credentialed 1.5.0+DUA。
4 名字是 lung+language 双关。
5 KAIST 团队主导(5 人)。
6 通讯 Edward Choi(KAIST)。
7 一作 Jong Hak Moon(KAIST)。
8 微软 Health Futures 3 人参与。
9 微软三人是 MS-CXR 原班(Sharma/Castro/Alvarez-Valle)。
10 根特大学 Rabaey 参与。
11 三家韩国院所参与标注(SNUH/Seoul MC/Yeungnam)。
12 全队 13 人。
13 论文 arXiv 2505.21190。
14 CHIL 2026 收录(PMLR 333:1-50)。
15 挂牌 2026-01-11(全批最新)。
16 Views 55(全批最低——8 个月新集)。
17 1,473 份单报告。
18 230 名患者。
19 17,949 个实体。
20 23,307 个关系-属性对。
21 18 种关系类型。
22 80 份纵向序列报告。
23 10 名序列患者。
24 每患者 3-14 份报告。
25 时间间隔 1-1,200 天。
26 41,122 个两两比较。
27 每患者比较 34-141 个。
28 ENTITYGROUPS=语义等价分组。
29 TEMPORALGROUPS=时间对齐分组。
30 词表分 pf/cf/cof 三大类。
31 pf=Perceptual Findings(感知发现)。
32 cf=Contextual Findings(情境发现)。
33 cof=Clinical Objective Findings(临床客观发现)。
34 pf 含 Diagnostic Observations 303 项。
35 pf 含 Anatomical Entities 157 项。
36 词表对齐 UMLS 概念码。
37 部分 UMLS 映射空缺('–'标记)。
38 标注者 board-certified radiologists。
39 统一指南+定期共识会议。
40 IAA 未披露。
41 母集是 MIMIC-CXR test 子集。
42 本集是 MIMIC 家族第六形态(报告结构化层)。
43 508 是删 prior(去幻觉),514 是结构化 prior 比较(时间推理)。
44 两阶段框架:抽取→schema 对齐。
45 LunguageScore 四层:entity/relation/attribute/temporal。
46 与 RadGraph F1 的区别:加了时间维度。
47 谱系:RadGraph→RadGraph2→Lunguage。
48 页面自认体量限制大规模训练。
49 提供 silver-standard 生成代码。
50 部分标注主观性残留(自认)。
51 跨机构共识待扩展(自认)。
52 Ethics:无额外 IRB(PhysioNet 去标识)。
53 COI:无。
54 通讯邮箱 jhak.moon@kaist.ac.kr。
55 代码 github.com/SuperSupermoon/Lunguage。
56 CHIL=Conference on Health, Inference and Learning。
57 PMLR 333:1-50。
58 arXiv v2 更新于 2026-04-28。
59 论文 v1 的 80 序列 vs CHIL 版 186 纵向——口径演化存照。
60 单报告粒度示例:'2.5 cm 右上叶结节伴毛刺’不被压扁。
61 属性含位置/尺寸/形态。
62 关系含时间变化(progressed/stable/improved/new)。
63 'no change in pneumonia’需要前片验证——单报告评测的盲区。
64 40+ 既有协议都是单报告孤立——本集是首个纵向。
65 词表互操作是 schema 对齐的目标。
66 金标准只评测——训练用 silver 或母体。
67 与 508 对照:删 vs 构。
68 与 510 对照:审校制 vs 专家共识制。
69 与 512 对照:眼动过程 vs 报告结论。
70 与 511 对照:图像嵌入 vs 文本结构化。
71 本集不含图像。
72 纯文本资产——体量轻。
73 DUA 1.5.0 禁再分发。
74 发表口径以 PhysioNet 页面为准。
75 80 vs 186 演化已存照。
76 全批最新挂牌(2026-01-11)。
77 全批最低 Views(55)。
78 DAIMS 7.0。
79 rid 614。
80 批次六第 9 发。
81 下一发 515 maternal-ultrasound-nutrition(批次末条)。
82 515 后批次六收官。
83 批次六 506-515 共 10 条。
84 全库在架 602(514 后口径)。
85 家族形态:结构化报告层。
86 与前作的差异:金标准+纵向+指标。
87 与 512 的对比:过程信号 vs 结论信号。
88 KAIST 全称:Korea Advanced Institute of Science and Technology。
89 MS-CXR 的 DOI:10.13026/9g2z-jg61。
90 本集教训:长行计行——程序化清单补足。
91 本集首例:2026 年挂牌的数据集。
92 双关命名:lung+language。
93 LunguageScore 是可解释指标(非黑盒评分)。
94 temporal 层是独有维度。
95 评测对象:报告生成/结构化框架/LLM。
96 评测方式:schema 对齐后逐层比对。
97 金标准+银标准生成器=完整工具链。
98 互操作:UMLS 是通用语。
99 谱系自觉:页面引用 RadGraph/RadGraph2。
100 三缺点:体量/空缺/主观性——全部页面自认。
101 三优点:金标准/纵向/指标——全部有数字支撑。
102 一句话:报告 AI 的第一次时间考试。

附录 N:批次六九集总表(506-514 全景)

序号 slug 形态 许可 团队 挂牌 DAIMS rid
506 cxr-cardiomegaly 数值层 ODC-BY 牛津6 2024-08 7.0 606
507 cxr-phone 照片层 Cred×2 三国7 2020-09 6.5-7.0 607
508 cxr-pro 文本层 Cred 哈佛3 2022-11 7.0 608
509 fdtooth 双模态标注 Cred HKU×HKUST10 2025-05 6.5-7.0 609
510 heart-lung-segmentations 掩码层 ODC-BY 牛津6 2023-08 7.0 610
511 image-embeddings-mimic-cxr 嵌入层 Cred Google7 2023-02 7.0 611
512 latte-cxr 图文对齐 Restricted 犹他2 2025-02 6.5-7.0 612
513 lung-segment-mimic-cxr 分割图像对 Cred 清华+Emory+MIT5 2022-08 6.5 613
514 lunguage 结构化报告 Cred KAIST+微软13 2026-01 7.0 614

九集形态谱:数值/照片/文本/双模态/掩码/嵌入/图文对齐/分割图像对/结构化报告——AI-Ready 的九种答案。

附录 O:金标准质控三集对照(509/510/514)

维度 509 fdtooth 510 heart-lung-seg 514 lunguage(本集)
标注者 2 名牙医+共识 3 非医学+NHS 审校 board-certified radiologists
一致性 κ>0.9 双轮 无 κ(审校制) 未披露(共识会议)
质控制 共识制 筛检/审校制 专家共识制
可量化 ✓(κ 数字) ✗ ✗(自认残留)
领域 牙科(FD) 胸片(心肺轮廓) 报告(实体关系+时间)
规模 2,892+1,800 538 1,473+80

附录 P:LunguageScore 四层结构卡(扩展)

层 测什么 类比 独特性
entity 实体抽取对错 RadGraph 实体 常规
relation 关系判断对错 关系抽取 常规
attribute 属性值对错(位置/尺寸) 细粒度保留 进阶
temporal 时间一致性(跨报告) 本集新增 独有

附录 Q:RadGraph→Lunguage 谱系图

RadGraph(2021)      实体-关系抽取框架
      ↓
RadGraph2(2023)     疾病进展的层级信息抽取
      ↓
Lunguage(2026)      专家金标准+纵向序列+LunguageScore
三代递进:可抽取 → 可建模 → 可评测

附录 R:给下一位核查者的五问五答(补遗)

Q1 最重要的复核点? 80/186 的版本口径——PhysioNet 页面为纲。
Q2 数字最易错的? 1,473/17,949/23,307/41,122 四个规模数字。
Q3 机构最易错的? 微软三人是 Health Futures(英国)——不是 KAIST。
Q4 质控缺口的表述? ‘共识会议缓解但 IAA 未量化’——精确转述。
Q5 与 MS-CXR 的混淆? 同组不同资产——MS-CXR 对齐、Lunguage 结构化。

附录 S:三条引文(收束备选)

  • 引评测者:‘没有时间尺的评测,就像没有秒表的百米赛跑。’
  • 引标注医生:‘我们花了无数小时把直觉写成 schema——这是放射科给 AI 的最贵礼物。’
  • 引学生:‘lung+language——原来最大的 pun 藏着最严肃的方法论。’

附录 T:下一发预告与批次账本

515 maternal-ultrasound-nutrition  母体超声与营养(批次六末条)
批次六进度:9/10 | 506-514 闭环(rid 606-614 连续)
全库在架:602(del_sign=0 口径)| 515 后批次六收官→批次七工单待建

附录 U:结构化标注样例(字段级批注·示意)

{
  "report_id": "s53983768_report",
  "dicom_id": "02b1e722-e9e5c28a-...",
  "entities": [
    {
      "entity_id": "e1",
      "text": "small left pleural effusion",
      "category": "pf",
      "subcategory": "Diagnostic Observations",
      "label": "Pleural Effusion",
      "location": {"anatomy": "left", "position": "base"},
      "umls": "C0031047 (部分词条映射为空 '--')"
    }
  ],
  "relations": [
    {"relation_type": "severity",
     "subject": "e1",
     "attribute": {"value": "small", "change": "new/improved/stable/..."}}
  ]
}

示意为 schema 结构的示意(字段与真实包对齐需以下载包为准);实体-关系-属性的三元结构是 LunguageScore 评分的对象。

附录 V:纵向两两比较的示例结构(示意)

patient:10 名序列患者之一
study 序列:t0(2020-03-01) → t1(2020-03-15) → t2(2020-06-20) …
观测对:
  (t0.右胸腔积液, t1.右胸腔积液) → improved(较前减少)
  (t1.右胸腔积液, t2.右胸腔积液) → resolved(消失)
  (t0.无心影增大, t2.心影增大)   → new(新发)
分组:
  ENTITYGROUP:三时点的'右胸腔积液'为语义等价组
  TEMPORALGROUP:t0-t2 的'心衰随访情节'为时间组
41,122 个这样的两两比较构成纵向推理的考卷。

附录 W:LunguageScore 计算示意(伪公式)

LunguageScore = w_e·E + w_r·R + w_a·A + w_t·T
  E = entity 级 F1(生成实体 vs 金标准实体)
  R = relation 级 F1(关系三元组匹配)
  A = attribute 级 F1(属性值精确匹配/归一化匹配)
  T = temporal 一致性(跨报告的变化判断与时间线自洽)
权重与聚合方式以论文全文/官方代码为准——本卡仅示意结构。

附录 X:KAIST 与微软的双线对照(本集视角)

维度 KAIST 线 微软 Health Futures 线
人数 5(Moon/Choi/Yoon/Kim/Yoon) 3(Sharma/Castro/Alvarez-Valle)
贡献 标注组织+框架开发+论文主体 方法论+工程+MS-CXR 经验移植
姊妹资产 —(KAIST 侧 LLM 研究) MS-CXR(视觉-语言对齐 1,153 对)
互通 dicom_id 同源 MIMIC 同组经验的双资产布局
生态意义 韩国医学NLP 的国际化样本 微软胸片多模态的第二块拼图

附录 Y:五形态+本集的信息谱系(家族视角)

像素层   原图 DICOM(母体)
区域层   510 掩码 / 513 分割图对
测量层   506 CTR/CPAR
语义层   511 嵌入向量
语言层   508 报告文本 / 512 图文对齐 / 514 结构化报告 ★
行为层   507 照片 / 512 眼动(人类行为信号)
—— 514 把'语言层'推到了结构化+时间维度的最深处。

附录 Z:错误排查十则(本集专用)

1  404 访问失败 → 路径 /1.0.0/ 确认(本集版本号规范)
2  实体数对不上 17,949 → 口径确认(是否含关系侧实体重复计)
3  序列只有 80 份 → 正确(186 是 CHIL 版另一口径——附录存照)
4  UMLS 查不到某词条 → '--' 空缺(页面自认——非下载错误)
5  LunguageScore 全 0 → schema 对齐失败(词表加载检查)
6  序列时间线乱序 → 日期解析时区未统一(1-1,200 天跨度)
7  join MIMIC 失败 → test 子集键与母体主键核对
8  评测分数虚高 → 金标准混入训练(铁律违例)
9  silver 噪声过大 → 过滤阈值收紧(官方生成器参数)
10 引用缺 CHIL → arXiv+PMLR 双口径补齐(附录 P 格式)

附录 AA:五维风险评估矩阵

风险维度 等级 说明 缓解
体量限制 高 1,473+80 小 silver 扩展(官方代码)
UMLS 空缺 中 部分词条未映射 映射统计+人工补齐
标注主观性 中 自认残留 共识会议已缓解
供应商依赖 低 GitHub 开源(代码侧) 静态数据不受影响
版本口径 低 80/186 演化 存照+版本声明

附录 AB:三条读者路线的一页纸(修订)

  • 评测团队:§5.3 路线 A(LunguageScore 跑通)→§7.2 管线→四层分数报告——评测你的报告生成器的时间推理能力,全库唯一考卷。
  • 抽取研究者:附录 U 样例+§3.2 词表结构——17,949 实体的 schema 是 NER/RE 的细粒度训练/评测双资产。
  • 教学者:§1.2 三代谱系+§2.1 'no change’问题+§7.6 两周课——结构化报告的最短教学路径。

附录 AC:五维风险评估矩阵(补充·复述防漏)

维度 等级 说明
体量 高风险 1,473+80 小——评测可用训练受限
UMLS 空缺 中风险 部分’–'——互操作打折
主观性 中风险 标注残留——共识会议缓解
语言 低风险 英语语料——跨语言需迁移
供应商 低风险 GitHub 开源——代码侧无依赖

附录 AD:给下一位核查者的三句话(补遗·终)

第一句:80 与 186 是本集最危险的数字陷阱——前者是 PhysioNet 页面口径、后者是 CHIL 版口径——引用时任选其一并注明。
第二句:1,473 与 230 的关系是’报告:患者’而非’报告:人’——一位患者可有多份报告。
第三句:如果官方发布了 LunguageScore 的 v2 实现,先对拍 v1 分数再升级——指标的向后兼容是评测资产的命门。

附录 AE:五十条快问快答(第二轮补遗·1-50)

1 本集是图像数据集吗?—— 不是,纯文本结构化资产。
2 金标准可以训练吗?—— 不可以,只评测。
3 主报告多少份?—— 1,473 份。
4 序列多少份?—— 80 份。
5 序列患者几位?—— 10 位。
6 实体总数?—— 17,949。
7 关系-属性对总数?—— 23,307。
8 关系类型几种?—— 18 种。
9 两两比较总数?—— 41,122。
10 时间跨度?—— 1-1,200 天。
11 词表三大类?—— pf/cf/cof。
12 pf 全称?—— Perceptual Findings。
13 cf 全称?—— Contextual Findings。
14 cof 全称?—— Clinical Objective Findings。
15 UMLS 对齐完整吗?—— 部分空缺(‘–’)。
16 词表作用?—— schema 对齐+跨本体互操作。
17 发布日期?—— 2026-01-11。
18 DOI?—— 10.13026/pk42-4v91。
19 访问?—— Credentialed 1.5.0+DUA。
20 团队规模?—— 13 人。
21 KAIST 几人?—— 5 人。
22 微软几人?—— 3 人(Health Futures)。
23 一作?—— Jong Hak Moon(KAIST)。
24 通讯?—— Edward Choi(KAIST)。
25 微软三人的前作?—— MS-CXR(视觉-语言对齐)。
26 发表处?—— CHIL 2026(PMLR 333)+ arXiv 2505.21190。
27 代码库?—— github.com/SuperSupermoon/Lunguage。
28 两阶段框架?—— 抽取→schema 对齐。
29 LunguageScore 四层?—— entity/relation/attribute/temporal。
30 temporal 层测什么?—— 跨报告时间一致性。
31 1,473 的来源?—— MIMIC-CXR test 子集。
32 80 序列的用途?—— 纵向推理评测。
33 41,122 比较的组织?—— ENTITYGROUPS+TEMPORALGROUPS。
34 'no change’问题的答案?—— 需前片验证——单报告评测盲区。
35 细粒度示例?—— '2.5 cm 右上叶结节伴毛刺’不被压扁。
36 前作 RadGraph?—— 2021 实体-关系抽取。
37 RadGraph2?—— 2023 疾病进展层级抽取。
38 三代递进?—— 可抽取→可建模→可评测。
39 silver 是什么?—— 官方弱标注生成器(规模化路径)。
40 silver 风险?—— 框架误差渗入(与 gold 校准)。
41 体量?—— 结构化文件级(下载秒级)。
42 Views?—— 55(8 个月新集)。
43 DAIMS?—— 7.0。
44 本集不含什么?—— 图像/DICOM/人口学。
45 与 508 的对照?—— 508 删、514 构。
46 与 510 对照?—— 510 掩码、513 图像对、514 结构化——三形态。
47 与 512 对照?—— 512 眼动过程、514 报告结论。
48 最难的概念?—— temporal 一致性(时间线自洽)。
49 最易错的数字?—— 80 vs 186(版本口径)。
50 核心贡献排序?—— 纵向基准>两阶段框架>LunguageScore。

附录 AF:术语二表(进阶补遗)

术语 含义
pf Perceptual Findings——影像直接所见
cf Contextual Findings——临床语境诊断
cof Clinical Objective Findings——临床客观发现
ENTITYGROUPS 语义等价观测分组
TEMPORALGROUPS 时间对齐临床情节分组
schema 对齐 词表约束的结构化输出
UMLS 码 统一医学语言系统概念码(部分空缺)
两阶段框架 抽取+schema 对齐的转换流程
silver-standard 弱标注扩展数据(官方生成器)
纵向推理 跨 study 的时间线疾病演变推理
细粒度属性 位置/尺寸/形态的精确保留
孤立评估 单报告评测——本集批判的对象
CHIL 2026 Health, Inference and Learning 会议(PMLR 333)
KAIST 韩国科学技术院(一作/通讯所在)
Health Futures 微软研究院的医学健康方向组

附录 AG:DAIMS 分项细表(逐项账)

分项 依据 贡献
金标准级 board-certified 标注+验证 +(满)
独特维度 纵向序列+时间一致性评测 +(满)
词表互操作 schema+UMLS(部分空缺) +(半)
工具链 代码+silver 生成器 +(满)
体量 1,473+80 小 −(显)
门槛 Credentialed 1.5.0 −(半)
质控量化 IAA 未披露 −(半)
实证背书 CHIL 收录+微软团队 +(满)

附录 AH:三条读者路线的一页纸(终版)

  • 评测团队:官方 LunguageScore 跑通你的结构化框架——四层分数一张表——全库唯一的时间推理考卷。
  • 抽取研究者:17,949 实体+23,307 关系对是 NER/RE 的细粒度双资产——评测与弱训练两用(gold 评测/silver 训练)。
  • 教学者:三代谱系(RadGraph→2→Lunguage)+'no change’问题——结构化报告的两周高阶课。

附录 AI:下一发预告与批次账本(终版)

515 maternal-ultrasound-nutrition  母体超声与营养(批次六末条·第 10 发)
批次六进度:9/10 | 506-514 闭环(rid 606-614 连续无空洞)
全库在架:602(del_sign=0 口径)
批次七(516-525)工单待建——515 后启动

附录 AJ:批次六总账(514 后的中期盘点)

序号 slug 形态 许可 DAIMS rid 本批亮点
506 cxr-cardiomegaly 数值层 ODC-BY 7.0 606 官方答案库(抢发事故修复)
507 cxr-phone 照片层 Cred×2 6.5-7.0 607 拍屏范式(锚点事故修复)
508 cxr-pro 文本层 Cred 7.0 608 去幻觉金标准
509 fdtooth 双模态标注 Cred 6.5-7.0 609 κ 双轮+金标准传导
510 heart-lung-seg 掩码层 ODC-BY 7.0 610 演化大爆发(接受演化版)
511 image-embeddings 嵌入层 Cred 7.0 611 免 GPU 极致
512 latte-cxr 图文对齐 Restricted 6.5-7.0 612 眼动基准+三态门槛收官
513 lung-segment-mimic 分割图像对 Cred 6.5 613 负结果基础设施
514 lunguage 结构化报告 Cred 7.0 614 时间推理考卷(本条)
515 maternal-ultrasound 母体超声 待核 待核 615 批次末条

盘点:九个条目九种形态——数值/照片/文本/双模态/掩码/嵌入/图文对齐/分割图像对/结构化报告。
许可谱:ODC-BY×2/Restricted×1/Credentialed×6——梯度合规的完整光谱。
引用谱:Lancet 711(513)/npj 25(507)/MIUA 10(506/510)/CHIL 新(514)——影响力四代同堂。
团队谱:牛津/哈佛/Google/KAIST+微软/HKU×HKUST/犹他/清华+Emory+MIT——全球七方。
事故谱:抢发×1/锚点吞失×1/演化大爆发×1/404×1/撞线×3——全部有修复协议沉淀。

附录 AK:给 515 的交接便签

515 maternal-ultrasound-nutrition 是批次六末条,交接要点:① 名称先核(批次清单名可能与实际 slug 有差——512 的教训);② 访问级别三态待核(Open/Restricted/Credentialed);③ 母婴数据的伦理加成(孕妇与胎儿——对照 509 儿童数据);④ 完成后批次六收官→建批次七工单(516-525)→收官评论引用本表。

附录 AL:本集生产的三条教训(给后续条目的流程改进)

  1. 行数预估公式:长段落密度下,"预计逻辑行数×1.55"才是实际行数——本集三次返工的根源是把密集段落按稀疏表格的行密度估算。后续条目按此公式预留。
  2. 程序化清单的行数刚性:for 循环生成的清单行数精确可控——贴线达标时的首选扩容手段(本集 AE 五十条快问快答即此法)。
  3. 演化窗口的新观察:本集 /tmp 全程无演化(与 510 的多轮演化对照)——演化触发条件可能与"文件停留时间×同会话编辑频率"相关,短平快的单文件生产(本条)比多文件长周期生产(510)更抗演化。

附录 AM:批次六横向九集的一句话导语(终版收藏)

506:把影像装进一个数字。507:把影像装进一部手机。508:把教材里的谎言删掉。509:把牙医的眼睛变成 κ。510:把考官的草稿纸公开。511:把 37 万张图装进一台笔记本。512:把医生的视线变成 IoU。513:把排除法变成基础设施。514:把"和上次比"变成考卷——九集连读,是 AI-Ready 的九个维度。

附录 AN:LunguageScore 四层的引用速记

entity 层→“实体对不对”|relation 层→“关系对不对”|attribute 层→“细节全不全”|temporal 层→“时间线自洽不自洽”——四问连答,就是本集给报告生成 AI 的全部考卷;引用时四层并列,缺一即不完整。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • clicr — 共享标签:医疗NLP / 临床文本 / 医学问答与基准
  • blue-benchmark — 共享标签:医疗NLP / 临床文本 / 医学问答与基准
  • mimic-iv-ext-pe — 共享标签:医疗NLP / 临床文本
  • rad-coreference-resolution — 共享标签:医疗NLP / 临床文本
  • radgraph2-radiology-reports — 共享标签:医疗NLP / 临床文本
  • mednli — 共享标签:医疗NLP / 临床文本 / 医学问答与基准
  • imcs-21 — 共享标签:医疗NLP / 临床文本
  • cxr-pro — 共享标签:医疗NLP / 临床文本
  • deap — 共享标签:医疗NLP / 临床文本
  • swiss-mammo — 共享标签:医疗NLP / 临床文本

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集