RadGraph2 — 放射报告时序实体关系标注 AI-Ready Wikipedia

放射报告时序信息抽取:4 叶子扩到 12 叶子的层级 schema——疾病进展与装置变化首次成为标注对象

来源 MIMIC-CXR-JPG 与 CheXpert 报告:600 份原 RadGraph dev/test 重标 + 200 份新采样,4 名 board-certified 放射科医生 + 1 名 academic hospitalist(Datasaur 平台)发布时间: 2026-09-24最后更新: 2026-09-25 阅读 24
RadGraph2 — 放射报告时序实体关系标注 AI-Ready Wikipedia

信息速览

数据集名称RadGraph2 — 放射报告时序实体关系标注 AI-Ready Wikipedia
数据类型人工标注,临床文本,结构化标注
规模800 份人工标注报告(575 训练/75 验证/150 测试)+ 227,568 份自动标注报告(MIMIC 227,068/CheXpert 500)——MIMIC-CXR-JPG 与 CheXp
接入方式MIMIC-CXR-JPG 与 CheXpert 报告:600 份原 RadGraph dev/test 重标 + 200 份新采样,4 名 board-certified 放射科医生 + 1 名 academic hospitalist(Datasaur 平台)
AI 就绪度

数据集封面

INFOBOX:radgraph2-radiology-reports 速览

字段 值
数据集 RadGraph2: Tracking Findings Over Time in Radiology Reports v1.0.0
slug radgraph2-radiology-reports
发布 2024-08-08(单版本)|PhysioNet
DOI 10.13026/q65y-9688(v1.0.0)/ 10.13026/qptf-zh55(latest)
访问 Credentialed(License 1.5.0 + DUA 1.5.0 + CITI 课程)
母集 DUA 1.5.0 + CITI 课程)
母集 RadGraph v1.0.0(rid 561——“Please cite them when using this project”)
任务 放射报告信息抽取(实体+关系)+ 疾病进展追踪(change 实体族)
规模 800 手工(575/75/150)+ 227,568 自动(227,068+500)
Schema 层级实体树:12 叶子(8 CHAN + ANAT-DP + 3 OBS)× 3 关系
标注者 4 名 board-certified 放射科医生 + 1 名 academic hospitalist(Datasaur)
模型 HGIE(DyGIE++ 同架构 + 层级识别训练)——F1 micro 0.88/0.74
论文 MLHC 2023,PMLR 219:381-402(arXiv 2308.05046)
团队 Stanford/MIT/Harvard/Hanyang/Vinbrain——Rajpurkar 团队 8 人(双同等贡献)
本库近邻 radgraph(561)|等贡献)
本库近邻 radgraph(561)|mimic-cxr-jpg(617)|chexpert(5)|rad-corefere(617)|graph(561)|mimic-cxr-jpg(617)|chexpert(5)|rad-coreference-resolution(5)|imic-cxr-jpg(617)|chexpert(5)|rad-coreference-resolution(621)

§0 摘要卡

§0.1 一(621) |

§0 摘要卡

§0.1 一句话定位

RadGraph2 是 Rajpurkar 团队对其 2021 年 RadGraph 数据集的时序扩展卷:在原有"实体+关系"知识图谱 schema 上新增 8 个 change 叶子实体——把放射报告里"与上次检查相比"的叙述(新出现/恶化/好转/痊愈/装置进出与移位)首次变成结构化标注对象。800 份人工标注报告 + 22.7 万份模型自动标注,配一个用"层级识别训练"涨点的 HGIE 模型。

§0.2 三分钟要点

  • 任务升级:从"单次检查里有什么"到"与上次相比变了什么"——页面 Background 原话:“the first dataset with dense annotations of both entities and relations in radiology reports that includes fine-grained characterisation of changes from priors”
  • 规模:800 手工(575 train/75 dev/150 test;test = 100 MIMIC + 50 CheXpert)+ 227,068 MIMIC 自动 + 500 CheXpert 自动——双源测试集是硬设计(跨机构泛化可测)
  • Schema:12 叶子层级实体树 = 8 CHAN(CHAN-NC/CON-AP/CON-WOR/CON-IMP/CON-RES/DEV-AP/DEV-PLACE/DEV-DISA)+ ANAT-DP + 3 OBS(DP/U/DA);关系三标签沿用 RadGraph(modify/located_at/suggestive_of,定义微调)
  • 标注:5 人团队(4 board-certified 放射 + 1 hospitalist),Datasaur 平台;600 份旧报告重标(change 优先、非 change 少动)+ 200 份新报告(benchmark 模型预标注起步)
  • 模型:HGIE = DyGIE++ 同架构 + 层级识别(HR)训练——BERT backbone 输出 12 个条件概率标量,Bayes 链式法则反推无条件概率,两阶段训练;F1 micro 0.88(MIMIC test)/0.74(CheXpert test)
  • 论文:MLHC 2023(PMLR 219:381-402,arXiv 2308.05046)——先论文后数据一年

§0.3 数据画像(一眼版)

维度 值
语言 英语
域 胸片放射报告(MIMIC-CXR-JPG + CheXpert)
标注单元 整份报告(Findings/Impression 段)
金标 800 报告 = 23,457 实体 + 17,373 关系(论文口径)
Silver 227,568 报告(HGIE benchmark 自动标注)
格式 JSON 字典(与 RadGraph 同构)
访问 Credentialed 三件套
许可 PhysioNet Credentialed Health Data License 1.5.0

§0.4 谁该用/不该用

该用:训练放射报告信息抽取模型;疾病进展/时序推理系统(诊疗轨迹分析、病情预警);多模态报告生成系统的结构化"内容层";跨机构泛化评测(MIMIC vs CheXpert 双源 test)。

不该用:期待影像——本集只有文本;单机构生产环境直接部署(Limitations 明说机构多样性不足);把 inference 数据当金标——它全是模型输出。

§1 身份卡:RadGraph2 的前世今生

RadGraph2(v1.0.0,2024-08-08 挂牌)是 PhysioNet 上的 Credentialed 数据集,DOI 10.13026/q65y-9688(锁版本)/ qptf-zh55(latest)。它的 Parent Projects 一栏明明白白写着 derived from RadGraph v1.0.0(Jain et al. 2021,DOI 10.13026/hm87-5p47)——页面还专门加了一句 “Please cite them when using this project”:用 RadGraph2 必须同时引母集。

命名里的 “2” 容易让人以为是"扩大版"——不对,它是维度升级:原 RadGraph 只看"这一次检查"(实体+关系快照),RadGraph2 把时间轴拉进来(与 priors 对比的变化)。800 份报告里 600 份是原 RadGraph dev+test 的重标(按新 schema),200 份是新增的 MIMIC-CXR 采样。

Views 144(2026-09 快照,挂牌两 采样。

Views 144(2026-09 快照,挂牌两年)——不算热闹,但它的母集 RadGraph 是医学报告知识图谱赛道的事实标准(Chiu 2022/Li 2022/Yang 2022/Stupp 2022/Wu 2023 等大量下游工作),RadGraph2 的 change 层是这条赛道上第一个带时序标注的货。

§2 背景:为什么"与上次相比"是最难标的部分

§2.1 单次快照的天花板

MIMIC-CXR-JPG 与 CheXpert 的五值标签(正/负/不确定等)是"单次检查"粒度——它们回答"这张片子有什么",回答不了"比上次好了还是坏了"。而放射报告的 IMPRESSION 里恰恰全是比较级叙述:“new left basilar opacity”“slightly worse pulmonary edema”“improvement in the mild pulmonary edema”“has resolved”“has been extubated”。这些对比信息是临床决策的核心输入(病情轨迹判断),却在所有既有标注集里缺席——页面 Background 的原话是"these comparisons can provide highly useful information on the progression of a patient’s medical conditions and their general healthcare trajectory"。

§2.2 变化叙事的标注难点

变化标注比实体标注难在三个自由度:变化对象(哪个病灶/装置)、变化方向(出现/恶化/好转/痊愈/进出/移位)、变化锚点(跟哪次 prior 比)。同一句话 “the left pleural drain has been advanced to the left apex” 里,“advanced” 既是变化词又是方向描述。RadGraph2 的解法是把变化做成实体(change entity)而非关系属性——变化词本身成为一个节点,用 modify/located_at/suggestive_of 三种关系挂回观察和解剖。

§2.3 RadGraph 基因

RadGraph(Jain 2021)确立了"放射报告→知识图谱"的范式:4 个叶子实体(ANAT-DP/OBS-DP/OBS-U/OBS-DA)+ 3 种关系,500+100 份人工标注,benchmark 模型 F1 0.82/0.73,外加 220,763 份自动标注的 inference 集——这套 schema 已被报告生成(两阶段"先抽内容再按风格生成")、多模态学习等大量下游采用。RadGraph2 全盘继承 4 个旧叶子和 3 种关系(定义微调),只加 8 个 CHAN 叶子——向下兼容是刻意设计,RadGraph 生态的工具链和基线可以直接迁移。

§2.4 MLHC 2023 论文的故事线

论文标题的关键词是 “Hierarchical Information Extraction”:与其让模型在 12 个平铺标签里选,不如利用标签间的天然层级(CHAN-CON-WOR 和 CHAN-CON-AP 都是"病情变化")——构造实体分类树,训练时按"父类为正的条件概率"逐层学,推理时用 Bayes 链式法则合成无条件概率。消融结果干净利落:HGIE 与 DyGIE++ 同架构,只差训练方式,HGIE 全面占优——层级本身值分。

§2.5 两代 schema 演化对照表

维度 RadGraph(2021) RadGraph2(2023/2024)
实体叶子 4(ANAT-DP/OBS-DP/OBS-U/OBS-DA) 12(+8 CHAN)
关系 3(modify/located_at/suggestive_of) 3(定义微调)
时间维度 无——单次检查快照 有——priors 对比是核心
金标 500 dev + 100 test 800(575/75/150)
标注者 医生团队 4 放射 + 1 hospitalist(Datasaur)
测试集来源 MIMIC/CheXpert 各 100 100 MIMIC + 50 CheXpert
Benchmark DyGIE++ 系,F1 0.82/0.73 HGIE,F1 0.88/0.74
Inference 220,763 自动 227,068+500 自动
向下兼容 — 4 叶子+3 关系全保留,工具链直通

读表的压缩叙事:一代管"有什么",二代管"变了什么"——schema 加 8 个叶子,任务加一个维度,benchmark 模型加一个训练机制(HR),其他一切刻意不动。

§3 数据构成:600 重标 + 200 新采 + 22.7 万自动

§3.1 手工标注 800 报告的账本

分块 数量 来源 标注起点
原 RadGraph dev+test 重标 600 RadGraph dev(500)+ test(100) 旧标注整体保留,重点改 change
新增 MIMIC 采样 200 RadGraph inference 数据集 MIMIC 部分 RadGraph Benchmark 模型输出预标注
合计 800

划分:575 train / 75 dev / 150 test(test = 100 MIMIC-CXR-JPG + 50 CheXpert);患者集合不相交;“our partitioning retains the placement of reports from the original RadGraph”——原报告在 dev 还是 test 的位置不变,保证与母集基线可比。

机器预标注起步的 200 份与 521 RadCoref 的 Longdoc 预标注、519 MS-CXR-T 的 ImaGenome silver 预标是同一个配方家族:模型先粗标,人再裁——在预算约束下这是标注效率与召回的最优折中,如今已是临床 NLP 标注的事实标准。

§3.2 五人标注团队与迭代式 schema 开发

标注面板:4 名 board-certified 放射科医生 + 1 名 academic hospitalist(页面 Methods 原话 “we liaised with a team of four board-certified radiologists and one academic hospitalist”)。注意这 5 人不在作者名单里(作者 8 人负责 schema 设计与论文),也不在致谢名单里(致谢 6 人是"initial stage"帮助者)——三批人马各司其职。

Schema 不是一次定稿:迭代式开发——每轮设计一批 change 实体 → 试标若干报告 → 收医生反馈 → 修订 → 下一轮,直到"coverage, faithfulness, and reliability"满意。页面特别提到关注点:“cases in which the used schema led to ambiguity or failed to capture information”。

§3.3 重标指令的"最小干预"原则

论文附录 B 的标注指令原文给出了重标的边界:

“Your main task is to look for any comparisons to the prior radiology examinations mentioned in the reports and ensure that they are correctly marked using the appropriate Change entities… try not to make extensive changes to the entities and relations not related to changes.”

翻译成质量工程语言:600 份重标报告的 change 层是全量新标,而非 change 层沿用 RadGraph 旧标注(被认为"labeled with sufficient quality")。这个设计省预算,代价是历史标注噪声可能被继承——标注者仍被授权"correct blatant mistakes in any aspect"。使用者在对比 RadGraph2 与原 RadGraph 的非 change 标注时应意识到:两者高度重合但不保证逐 token 一致。

§3.4 Inference 数据:22.7 万自动标注的三口径

口径来源 MIMIC 部分 CheXpert 部分 合计
Abstract(概数) “more than 220,000” — 220,000+
论文发表时点(emergentmind 转述) 220,763 500 221,263
Files Description(页面文件级) 227,068 500 227,568

三数字并存不仲裁:227,068 是挂牌时文件的真实行数(最准),220,763 是论文写作时点的快照,220,000+ 是 Abstract 的概数修辞——推断差异源于挂牌前数据继续扩容,页面未解释。引用建议:规模引用用 227,068+500(以文件为准),历史对比时用 220,763(以论文为准)。

§3.5 22.7 万自动标注的内存账与加载姿势

inference-mimic.json 单文件 22.7 万份报告的 JSON——按金标标注密度推算(800 份 ≈ 2.4 万实体),全量约 680 万个实体条目。json.load() 一次全读在 32 GB 内存机器上会吃掉 15-25 GB——不是不能读,是没必要。三个加载姿势:

  1. 流式分批(ijson 库):按报告键逐个 yield,统计类任务边读边算;
  2. 首层采样:json.load 只读前 N 万份做弱监督试点,验证管线后再扩全量;
  3. 预转换落盘:一次解析后转 Parquet/JSONL 分片(按 folder 前 10 个患者分桶),后续任务直接走列式加载。

inference-chexpert.json 只有 500 份——可以随手全读,当"CheXpert 源 silver 样本"单独分析(它的错误率约 26%,比 MIMIC 源的 12% 高一倍,弱监督时建议降权或混洗)。

§4 Schema 全解剖:12 叶子层级树

§4.1 实体族谱

三大类 → 12 叶子(仅叶子作标签):

ANAT(解剖)
└── ANAT-DP(确定存在)          # "The left lung..."(left/lung 各一个实体)

OBS(观察)
├── OBS-DP(确定存在)           # "moderate cardiomegaly"(moderate/cardiomegaly 各一个)
├── OBS-U(不确定)              # "Infection cannot be excluded."
└── OBS-DA(确定不存在)         # "There is no pneumothorax."

CHAN(变化)—— RadGraph2 新增
├── CHAN-NC(无变化)            # "Moderately severe bibasilar atelectasis persists."(persists)
├── CHAN-CON(病情变化)
│   ├── CHAN-CON-AP(新出现)    # "There is also a new left basilar opacity..."(new)
│   ├── CHAN-CON-WOR(恶化)     # "...pulmonary edema is slightly worse."(worse)
│   ├── CHAN-CON-IMP(好转)     # "...there is improvement in the mild pulmonary edema..."
│   └── CHAN-CON-RES(痊愈)     # "...opacities have resolved."(resolved)
└── CHAN-DEV(装置变化)
    ├── CHAN-DEV-AP(装置出现)  # "The patient has received the new feeding tube."(new)
    ├── CHAN-DEV-PLACE(装置移位)# "Left pleural drain has been advanced to the left apex."(advanced)
    └── CHAN-DEV-DISA(装置移除) # "In the interval, the patient has been extubated..."

§4.2 三关系与连接规则

关系 含义 允许的实体对 示例
modify 前者修饰后者 (OBS-,OBS-) / (ANAT-DP,ANAT-DP) / (CHAN-,) / (OBS-,CHAN-) “right” → “lung”
located_at 观察定位于解剖 (OBS-*,ANAT-DP) “clear” → “lungs”
suggestive_of 前者提示后者状态 (OBS-,OBS-) / (CHAN-,OBS-) / (OBS-,CHAN-) “opacity” → “pneumonia”

注意 (OBS-,CHAN-) 与 (CHAN-,) 的存在让 change 实体成为图里的枢纽节点——一个 CHAN-CON-WOR 可以同时连着"哪个病灶"(modify 入边)和"病灶在哪"(located_at 链)。这正是"变化可追踪"的图论基础。

§4.3 层级树的训练学价值

标签不是平铺的——CHAN-CON-WOR 与 CHAN-CON-AP 的父节点都是 CHAN-CON,CHAN-CON 与 CHAN-DEV 的父节点都是 CHAN。论文的核心洞察:“inherent relationships between the various entities”——让模型先学会"这是不是一个变化",再学"是什么方向的变化",分层攻难。HR 系统输出 12 个标量,每个是"父实体为正条件下该叶子为真"的条件概率;推理时全部叶子要无条件预测,用 Bayes 链式法则合成。两阶段训练:阶段一在父正条件下学(聚焦叶子区分),阶段二全数据+标准交叉熵+小学习率微调(改善父级预测)。

§5 模型族成绩单:HGIE 与它的基线们

§5.1 双测试集主成绩

测试集 页面口径(F1 micro) 论文精细口径
MIMIC-CXR-JPG 部分(100 份) 0.88 0.879
CheXpert 部分(50 份) 0.74 0.739

14 个点的双源落差本身就是数据:MIMIC-CXR 报告与 CheXpert 报告的风格/机构差异直接反映在模型泛化上——这也是 test 集刻意双源设计的价值(单源 test 会掩盖这个落差)。

§5.2 同架构消融:层级训练值多少分

论文 Table 6(在 RadGraph 1.0 上横评):

模型 MIMIC F1 micro/macro CheXpert F1 micro/macro
DyGIE++(RadBERT) 0.826 / 0.787 0.726 / 0.694
PURE(RadBERT) 0.814 / 0.746 0.723 / 0.675
HGIE(RadBERT) 0.852 / 0.791 0.744 / 0.723

HGIE 与 DyGIE++ 同架构,只差训练方式——“utilizing the entity taxonomy during training leads to better performance”。在 RadGraph2 上 HGIE 同样全面占优(strict relation extraction 为主指标)。

§5.3 六种初始化横评(表 5)

初始化 MIMIC F1 micro(depth 2) CheXpert F1 micro(depth 2)
BERT Base 0.841 0.702
BioBERT 0.856 0.726
ClinicalBERT 0.852 0.722
PubMedBERT 0.881 0.741
BlueBERT 0.824 0.685
RadBERT 0.883 0.742

初始化 delta 高达 0.040(HGIE)> DyGIE++ 0.031 > PURE 0.026——领域适配初始化(RadBERT)对小 schema 任务的涨点不可忽视。

§5.4 深度消融:浅层级更好训

表 5 同时给了 taxonomy depth 3 vs 2 的对比:depth 2 ≥ depth 3(RadBERT:0.883 vs 0.879 MIMIC;0.742 vs 0.739 CheXpert)。层级树不是越深越好——两层(大类→叶子)已足够提供训练信号,三层反而稀释梯度。

§5.5 交叉对比:RadGraph2 模型 vs RadGraph 模型(交集评测)

把两代 benchmark 模型放在"交集 schema"(剪掉 RadGraph2 独有实体/关系)上对比:

实体(表 3,F1):

类型 MIMIC:RadGraph / RadGraph2 CheXpert:RadGraph / RadGraph2
ANAT-DP 0.968 / 0.983 0.941 / 0.880
OBS-DP 0.922 / 0.963 0.884 / 0.939
OBS-U 0.700 / 0.798 0.714 / 0.812
OBS-DA 0.952 / 0.813 0.910 / 0.823

关系(表 4,F1):

关系 MIMIC:RadGraph / RadGraph2 CheXpert:RadGraph / RadGraph2
modify 0.804 / 0.906 0.709 / 0.777
located_at 0.861 / 0.826 0.779 / 0.712
suggestive_of 0.685 / 0.838 0.588 / 0.730
F1 micro 0.823 / 0.874 0.725 / 0.746

读表要点:关系任务 3/4 胜(论文:“more difficult relation extraction task”),suggestive_of 涨幅最大(+0.153 MIMIC);OBS-DA 与 located_at 反而降——论文如实报告。实体的 OBS-DA 降分可能与 change 实体抢占"否定"语义空间有关("resolved"同时是变化与不存在)——页面与论文均未深究,存照。

§6 文件结构与 JSON 格式

§6.1 六文件清单

RadGraph2.zip
├── README.md
├── train.json               # 575 报告(全 MIMIC-CXR-JPG)
├── dev.json                 # 75 报告(全 MIMIC-CXR-JPG)
├── test.json                # 150 = 100 MIMIC + 50 CheXpert
├── inference-chexpert.json  # 500 报告(benchmark 模型标注)
└── inference-mimic.json     # 227,068 报告(benchmark 模型标注)

§6.2 JSON 结构五键

{
  "p10/p10000032/s50414267.txt": {
    "text": "报告全文",
    "data_split": "train",
    "data_source": "MIMIC-CXR",
    "is_original": true,
    "entities": {
      "0": {
        "tokens": "cardiomegaly",
        "label": "OBS-DP",
        "start_ix": 12,
        "end_ix": 12,
        "relations": [["located_at", "1"]]
      }
    }
  }
}
  • 键 = 报告 ID:MIMIC 格式 <folder>/<patient>/<study>.txt;CheXpert 纯数字
  • is_original:True = 原 RadGraph 报告(600 份),False = 新增 200 份——inference 数据无此键
  • 实体五键:tokens / label / start_ix / end_ix(token 下标 0 起,单 token 时两者相等)/ relations([关系标签, 目标实体 ID] 元组列表)
  • 格式与 RadGraph 同构(analogical)——RadGraph 生态的加载器/评测器直通

§7 AI-Ready 十问 + DAIMS

§7.1 十问速答

# 问题 答案
1 任务定义是什么? 放射报告实体+关系抽取,新增疾病进展追踪(change 实体族)
2 一条样本长什么样? 一份报告的 JSON:text + 实体字典(12 类叶子标签)+ 关系边表
3 样本量? 金标 800(575/75/150)+ 自动标注 227,568(227,068+500)
4 来源与授权链? MIMIC-CXR-JPG + CheXpert 报告 → 8 人团队重标/增标 → PhysioNet Credentialed
5 标注协议? Datasaur 平台,5 人(4 放射+1 hospitalist),迭代式 schema;600 份重标(change 全新标/非 change 少动)+ 200 份预标注起步
6 质量控制? 医生团队全量人工;κ 页面缺席(论文转述 median pairwise κ 0.9963,待证)
7 基准与 SOTA? HGIE F1 micro 0.88/0.74(双 test);同架构消融证明层级训练有效
8 已知偏差? 双源(MIMIC/CheXpert)不代表全机构多样性;非 change 层继承旧标注;英语-only
9 许可与访问? Credentialed 三件套;须同引母集 RadGraph
10 空白与机会? 时序链接(跨报告对齐)未标;CT/MR 域零覆盖;HGIE 官方代码未发布

§7.2 DAIMS 速览卡

DAIMS:
  dataset_name: "RadGraph2"
  version: "v1.0.0"
  release_date: "2024-08-08"
  doi: "10.13026/q65y-9688"
  access_level: "Credentialed"
  license: "PhysioNet Credentialed Health Data License 1.5.0 + DUA 1.5.0"
  task: "information extraction(实体+关系)+ disease progression tracking(change 实体)"
  domain: "胸片放射报告文本"
  source: "MIMIC-CXR-JPG + CheXpert(derived from RadGraph v1.0.0)"
  language: "英语"
  gold_scale: "800 reports(train 575 / dev 75 / test 150=100+50)"
  gold_annotations: "23,457 entity spans + 17,373 relations(论文口径)"
  silver_scale: "227,568 reports(MIMIC 227,068 + CheXpert 500,HGIE benchmark 自动标注)"
  entity_schema: "12 叶子层级树:8 CHAN + ANAT-DP + 3 OBS"
  relation_schema: "modify / located_at / suggestive_of"
  annotation_platform: "Datasaur"
  annotators: "4 board-certified radiologists + 1 academic hospitalist"
  annotation_mode: "600 重标(change 优先最小干预)+ 200 预标注起步新标"
  agreement: "页面未给(论文转述 median pairwise κ 0.9963——待证)"
  benchmark_model: "HGIE(DyGIE++ 同架构 + hierarchical recognition,BERT backbone,两阶段训练)"
  benchmark_score: "F1 micro 0.88(MIMIC test)/ 0.74(CheXpert test)"
  best_backbone: "RadBERT(六初始化横评最优;taxonomy depth 2 >= 3)"
  publication: "MLHC 2023, PMLR 219:381-402(arXiv 2308.05046)"
  ethics: "母数据集已去标识,无需 IRB;COI 无"

§8 常见误解 + 八大坑点

§8.1 三个高频误解

  1. “RadGraph2 = 更大的 RadGraph”——错。它的核心增量是时间维度(change 实体族),不是规模。800 vs 母集 500+100 的金标增量有限;真正的新东西是"与上次相比"被结构化了。
  2. “22.7 万报告可以当训练集随便用”——inference 数据是 HGIE(F1 0.88/0.74)的输出,每份携带 12%/26% 左右的错误率(按双源 F1 推算)。当弱监督/预训练素材可以,当评测真值不行。
  3. “test 集 150 份不够看”——双源设计(100 MIMIC + 50 CheXpert)是刻意为之:0.88 vs 0.74 的 14 点落差揭示了跨机构泛化的真实难度,单源大 test 反而看不到。

§8.2 八大坑点表

# 坑点 事实 规避姿势
坑点1 Inference 三口径 220,000+ / 220,763 / 227,068 并存 规模引用用 227,068+500(文件级);历史对比用论文口径
坑点2 作者名单 数据集 8 人(含 Pile)vs 论文 7 人(无 Pile);一作排序互换 引用数据集用 Dejl 第一;引用论文用 Khanna 第一
坑点3 is_original 键 600 份 True/200 份 False;inference 数据没有这个键 解析时按 data_split 分支处理,勿假设键存在
坑点4 非 change 层噪声继承 重标指令"尽量少动非 change 部分"——旧标注噪声可能保留 用交集 schema 评测时注意与原 RadGraph 标注非逐 token 一致
坑点5 test 双源混淆 150 = 100 MIMIC + 50 CheXpert,两源难度差 14 点 分源报告成绩(0.88/0.74),勿只报合并分
坑点6 κ 缺席 页面无一 IAA 数字;论文转述 0.9963 异常高且待证 不在正文引用 κ;需 IAA 时回到论文原文核实
坑点7 /latest/ URL 404 latest DOI 存在但 URL 不重定向(与 521 不同) 一律用 /1.0.0/ 或锁版本 DOI 10.13026/q65y-9688
坑点8 母集引用义务 Parent Projects 明文 “Please cite them when using this project” 引用链:RadGraph2 DOI + RadGraph DOI + MLHC 论文

§9 工作实例:从 JSON 到疾病轨迹

§9.1 加载与统计 change 实体分布

import json
from collections import Counter

data = json.load(open("test.json"))
chan_counter = Counter()
for rid, report in data.items():
    for ent in report["entities"].values():
        if ent["label"].startswith("CHAN"):
            chan_counter[ent["label"]] += 1
print(chan_counter.most_common())
# 预期画像:CHAN-NC 最多("stable/unchanged"高频),CON-AP/CON-WOR 次之

§9.2 提取"变化三元组"(什么变了/怎么变/在哪)

def extract_changes(report):
    """从单份报告抽取 (变化词, 方向, 关联观察/解剖) 轨迹元组"""
    ents = report["entities"]
    out = []
    for eid, ent in ents.items():
        if not ent["label"].startswith("CHAN"):
            continue
        for rel_label, target_id in ent.get("relations", []):
            tgt = ents.get(str(target_id), {})
            out.append({
                "change_token": " ".join(ent["tokens"]) if isinstance(ent["tokens"], list) else ent["tokens"],
                "change_type": ent["label"],
                "rel": rel_label,
                "target_token": tgt.get("tokens", "?"),
                "target_label": tgt.get("label", "?"),
            })
    return out

for rid in list(data)[:3]:
    print(rid, extract_changes(data[rid]))

§9.3 弱监督管线:拿 inference 数据做预训练

# inference-mimic.json 227,068 份自动标注——体量堪比 RadGraph 原版 inference 集
inf = json.load(open("inference-mimic.json"))
man = {**json.load(open("train.json")), **json.load(open("dev.json"))}
# 两阶段:先 22.7 万 silver 粗训,再 575+75 金标 fine-tune
# 注意:silver 错误率约 12%(MIMIC 源)——fine-tune 阶段必须用金标收口

§9.4 与 RadCoref 组成结构化报告全栈

报告文本
  ├─ RadGraph2(rid 622):实体+关系+变化 → 知识图谱层
  ├─ RadCoref(rid 621):共指簇 → 指代消解层
  └─ MS-CXR-T(rid 519):时序图像对 → 影像时序层
三层对齐后:每句的"它/该区域"(RadCoref)→ 每个病灶节点(RadGraph2)→ 每次检查间的变化(RadGraph2 CHAN)——完整疾病轨迹

§10 FAQ:128 问速查

FAQ-基础身份(20 问)

Q1:RadGraph2 是什么?

Q2:RadGraph2 的全称是什么?

Q3:RadGraph2 的 slug 是什么?

Q4:RadGraph2 在 PhysioNet 上的 DOI 是什么?

Q5:RadGraph2 什么时候发布的?

Q6:RadGraph2 的 latest DOI 是什么?

Q7:RadGraph2 和 RadGraph 是什么关系?

Q8:RadGraph2 的任务是什么?

Q9:RadGraph2 是图像数据集吗?

Q10:RadGraph2 属于哪个访问等级?

Q11:RadGraph2 有几个版本?

Q12:RadGraph2 的 Topics 有哪些?

Q13:RadGraph2 的 Views 是多少?

Q14:RadGraph2 的官方论文发在哪?

Q15:RadGraph2 的代码在哪里?

Q16:RadGraph2 的母数据集是谁?

Q17:为什么用 RadGraph2 要同时引 RadGraph?

Q18:RadGraph2 的 RRID 是什么?

Q19:RadGraph2 覆盖哪些报告来源?

Q20:‘Tracking Findings Over Time’ 是什么意思?

FAQ-规模与划分(18 问)

Q21:RadGraph2 有多少份人工标注报告?

Q22:train/dev/test 各多少份?

Q23:test 集怎么构成的?

Q24:为什么 test 要 MIMIC 和 CheXpert 双源?

Q25:dev 集 75 份来自哪里?

Q26:inference 数据有多少份?

Q27:inference-mimic.json 有多少份?

Q28:inference-chexpert.json 有多少份?

Q29:inference 规模为什么有三个数字?

Q30:227,068 和 220,763 哪个对?

Q31:金标里有多少实体和关系?

Q32:关系数比 RadGraph 多多少?

Q33:800 份报告怎么来的?

Q34:600 份重标报告来自哪里?

Q35:200 份新报告怎么采的?

Q36:train 集为什么全来自 MIMIC?

Q37:患者集合划分有什么保证?

Q38:划分保留了 RadGraph 的什么?

FAQ-Schema 与标签体系(22 问)

Q39:RadGraph2 的实体分几大类?

Q40:RadGraph2 有多少个叶子实体?

Q41:CHAN 族实体有哪些?

Q42:CHAN-NC 是什么?

Q43:CHAN-CON-AP 是什么?

Q44:CHAN-CON-WOR 是什么?

Q45:CHAN-CON-IMP 是什么?

Q46:CHAN-CON-RES 是什么?

Q47:CHAN-DEV 族实体有哪些?

Q48:CHAN-DEV-PLACE 的例子是什么?

Q49:CHAN-DEV-DISA 的例子是什么?

Q50:ANAT-DP 是什么?

Q51:OBS 实体有几种?

Q52:OBS-DP/OBS-U/OBS-DA 有什么区别?

Q53:RadGraph2 比 RadGraph 多了哪些实体?

Q54:关系有几种?

Q55:modify 关系连接哪些实体对?

Q56:located_at 关系连接哪些实体对?

Q57:suggestive_of 关系连接哪些实体对?

Q58:change 实体在图里的角色是什么?

Q59:层级实体树的深度是多少?

Q60:叶子实体才作标签是什么意思?

FAQ-标注流程(17 问)

Q61:标注在什么平台上进行?

Q62:标注者有几个人?

Q63:标注者是什么背景?

Q64:hospitalist 是什么?

Q65:标注者就是作者吗?

Q66:600 份重标的指令是什么?

Q67:'最小干预’原则是什么?

Q68:非 change 部分可以改吗?

Q69:200 份新报告的标注起点是什么?

Q70:RadGraph Benchmark 模型在标注里的角色?

Q71:schema 是怎么定稿的?

Q72:迭代式 schema 开发是什么?

Q73:标注一致性 κ 是多少?

Q74:页面给了 IAA 数字吗?

Q75:0.9963 这个 κ 可信吗?

Q76:标注和致谢名单是同一批人吗?

Q77:Datasaur 得到了什么致谢?

FAQ-模型与成绩(22 问)

Q78:HGIE 是什么?

Q79:HGIE 和 DyGIE++ 什么关系?

Q80:层级识别(HR)系统是什么?

Q81:12 个标量输出是什么意思?

Q82:条件概率怎么转成无条件概率?

Q83:HGIE 的训练分几阶段?

Q84:阶段一训练什么?

Q85:阶段二训练什么?

Q86:HGIE 的成绩是多少?

Q87:页面 0.88/0.74 与论文 0.879/0.739 什么关系?

Q88:为什么 MIMIC 和 CheXpert 测试差 14 个点?

Q89:六种初始化里哪个最好?

Q90:RadBERT 初始化为什么好?

Q91:初始化 delta 有多大?

Q92:taxonomy 深度 2 和 3 哪个好?

Q93:HGIE 在 RadGraph 1.0 上成绩如何?

Q94:DyGIE++ 在 RadGraph2 上的成绩?

Q95:PURE 模型的成绩?

Q96:strict relation extraction 指标是什么?

Q97:交叉对比表里哪些项反而降了?

Q98:OBS-DA 为什么降分?

Q99:located_at 为什么降分?

FAQ-文件与格式(13 问)

Q100:RadGraph2 的文件清单?

Q101:train.json 里是什么?

Q102:test.json 的双源怎么体现?

Q103:JSON 的键是什么格式?

Q104:CheXpert 报告的键长什么样?

Q105:实体字典有哪几个键?

Q106:start_ix 和 end_ix 怎么用?

Q107:relations 字段什么格式?

Q108:is_original 键是什么?

Q109:inference 数据有 is_original 吗?

Q110:格式和 RadGraph 兼容吗?

Q111:data_split 有哪几种值?

Q112:data_source 有哪几种值?

FAQ-访问与许可(10 问)

Q113:怎么获取 RadGraph2?

Q114:Credentialed 访问要什么条件?

Q115:DUA 1.5.0 是什么?

Q116:CITI 要求什么课程?

Q117:能再分发吗?

Q118:许可是什么?

Q119:文件区为什么显示 Data Not Available?

Q120:有 Total Size 吗?

Q121:/latest/ URL 为什么 404?

Q122:应该引用哪些文献?

FAQ-伦理与合规(5 问)

Q123:RadGraph2 的伦理声明是什么?

Q124:需要 IRB 吗?

Q125:数据有 PHI 吗?

Q126:COI 声明是什么?

Q127:敏感数据怎么处理?

FAQ-团队与论文链(19 问)

Q128:RadGraph2 是谁做的?

Q129:作者有几个人?

Q130:第一作者是谁?

Q131:Adam Dejl 是谁?

Q132:Sameer Khanna 是谁?

Q133:Patricia Therese Pile 在论文里吗?

Q134:双同等贡献是哪两组?

Q135:通讯作者是谁?

Q136:Pranav Rajpurkar 的背景?

Q137:团队来自哪些机构?

Q138:Vinbrain 是什么?

Q139:致谢名单有谁?

Q140:David Sontag 的角色?

Q141:论文的完整引用?

Q142:PMLR 卷号页码?

Q143:arXiv 编号?

Q144:论文什么时候提交的?

Q145:先论文还是先数据?

Q146:和 RadGraph 论文是什么关系?

FAQ-近邻与生态(10 问)

Q147:本库里有哪些近邻条目?

Q148:RadGraph(rid 561)和 RadGraph2 的关系?

Q149:和 RadCoref(rid 621)什么关系?

Q150:和 MS-CXR-T 什么关系?

Q151:CheXpert 在本库的条目?

Q152:结构化报告全栈是什么?

Q153:RadGraph 的下游应用有哪些?

Q154:报告生成的两阶段范式是什么?

Q155:change 实体能用来做什么?

Q156:疾病轨迹怎么构建?

FAQ-使用与复现(28 问)

Q157:官方推荐用途?

Q158:能拿 inference 数据当金标吗?

Q159:inference 数据的正确用法?

Q160:弱监督两阶段怎么设计?

Q161:能做跨科室迁移吗?

Q162:能用于 CT/MR 报告吗?

Q163:复现 HGIE 需要什么?

Q164:官方代码发布了吗?

Q165:超参在哪里?

Q166:怎么报告评测结果?

Q167:change 实体分布统计怎么写?

Q168:'变化三元组’怎么提取?

Q169:22.7 万 JSON 怎么加载不爆内存?

Q170:ijson 流式解析怎么写?

Q171:inference 数据要转 Parquet 吗?

Q172:inference-chexpert.json 为什么单独处理?

Q173:CheXpert 源 silver 的错误率多高?

Q174:弱监督时 silver 要降权吗?

Q175:金标收口为什么必须?

Q176:评测用哪个文件?

Q177:dev 75 份怎么用?

Q178:模型选择会用掉 test 吗?

Q179:strict 指标和 relaxed 指标差在哪?

Q180:下游任务有哪些可做?

Q181:报告生成怎么用 RadGraph2?

Q182:多模态学习怎么接入?

Q183:诊疗轨迹分析怎么做?

Q184:病情预警系统怎么建?

FAQ 共 184 问——每问即一个检索意图锚点,答案散布于 §0-§9 与附录各节;为站内搜索与 AI 检索提供问题空间全覆盖索引。

§11 事实清单:逐条存照(每条可溯源至页面快照或论文交叉)

  1. 身份:RadGraph2: Tracking Findings Over Time in Radiology Reports——PhysioNet v1.0.0(2024-08-08 挂牌,单版本,Release Notes 一行 Initial release)。
  2. DOI v1.0.0:10.13026/q65y-9688;latest:10.13026/qptf-zh55;/latest/ URL 不重定向(404)——只认版本号。
  3. 访问:Credentialed——License 1.5.0 + DUA 1.5.0 + CITI ‘Data or Specimens Only Research’ 三件套。
  4. Parent Projects:derived from RadGraph v1.0.0(Jain 2021,DOI 10.13026/hm87-5p47)——‘Please cite them when using this project’。
  5. 定位(页面 Background 原话):‘the first dataset with dense annotations of both entities and relations in radiology reports that includes fine-grained characterisation of changes from priors’。
  6. Topics 6 个:relation extraction / chest x-rays / disease progression / information extraction / radiology reports / named entity recognition。
  7. Views:144(2026-09 快照,挂牌两年)。
  8. Files 区 ‘Data Not Available’——地区/登录限制,无 Total Size。
  9. RRID:SCR_007345(PhysioNet 平台通用模板)。
  10. 数据集作者 8 人:Adam Dejl*、Sameer Khanna*、Patricia Therese Pile、Kibo Yoon、Steven QH Truong、Hanh Duong、Agustina Saenz**、Pranav Rajpurkar**(*一作双星同等贡献;**通讯双星同等贡献)。
  11. 作者名单差异存照:论文 7 人(无 Pile);论文第一作者 Khanna vs 数据集引用第一作者 Dejl——排序互换。
  12. 机构(ar5iv):Stanford / MIT / Harvard Medical School / Hanyang Univ. / Vinbrain(Truong 与 Duong)。
  13. 致谢(initial stage):Eléa Bach、Valentina Carducci、Elaine Ye、Mengyao Zheng、Madhur Nayan、David Sontag + Datasaur 团队(免费平台与导入支持)。
  14. 标注团队:4 名 board-certified 放射科医生 + 1 名 academic hospitalist——不与作者/致谢名单重叠。
  15. 论文:Khanna S, Dejl A, Yoon K, Truong SQ, Duong H, Saenz A, Rajpurkar P. MLHC 2023, PMLR 219:381-402;arXiv 2308.05046(2023-08-09 提交)。
  16. 先论文后数据:MLHC 2023-08 → 挂牌 2024-08-08(差一年)。
  17. 金标 800 报告 = 575 train(全 MIMIC)/ 75 dev(全 MIMIC)/ 150 test(100 MIMIC + 50 CheXpert)。
  18. 800 = 600(原 RadGraph dev+test 重标)+ 200(RadGraph inference MIMIC 部分随机采样,benchmark 模型预标注起步)。
  19. 患者集合跨划分不相交;划分保留原 RadGraph 报告的位置(可比性设计)。
  20. 论文口径标注量:23,457 entity spans + 17,373 relations;关系数较 RadGraph 增 ~20%(change 弧)。
  21. Schema:三大类(anatomy/observation/change)→ 12 叶子(仅叶子作标签);RadGraph 4 叶子(ANAT-DP/OBS-DP/OBS-U/OBS-DA)+ 新增 8 CHAN 叶子。
  22. CHAN 8 叶子:CHAN-NC(无变化)/CHAN-CON-AP(新出现)/CHAN-CON-WOR(恶化)/CHAN-CON-IMP(好转)/CHAN-CON-RES(痊愈)/CHAN-DEV-AP(装置出现)/CHAN-DEV-PLACE(装置移位)/CHAN-DEV-DISA(装置移除)。
  23. 关系 3 种沿用 RadGraph(定义微调):modify / located_at / suggestive_of;(CHAN-,) 与 (OBS-,CHAN-) 使 change 成为图枢纽。
  24. 每类叶子配页面原句示例(CHAN-CON-RES:‘opacities have resolved’;CHAN-DEV-PLACE:‘Left pleural drain has been advanced to the left apex’ 等)。
  25. 重标指令(论文附录 B 原话):‘try not to make extensive changes to the entities and relations not related to changes’——change 层全量新标、非 change 层最小干预(可修 blatant mistakes)。
  26. schema 迭代式开发:设计→试标→医生反馈→修订循环,直至 coverage/faithfulness/reliability 满意。
  27. 标注平台 Datasaur;附录 B 含平台操作细节(箭头关系下拉菜单选第二项等)。
  28. inference 三口径存照:Abstract ‘220,000+’ / 论文转述 220,763+500 / Files Description 227,068+500——并列不仲裁,推断为挂牌前扩容。
  29. HGIE = DyGIE++ 同架构 + 层级识别(HR)训练——‘utilizing the entity taxonomy during training leads to better performance’(同架构消融)。
  30. HR 机制:BERT backbone 输出 12 标量(各叶子’父为正条件下为真’的条件概率);推理用 Bayes 链式法则反推无条件概率。
  31. 两阶段训练:阶段一父正条件下学(聚焦叶子区分);阶段二全数据+标准交叉熵+小学习率(改善父级预测)。
  32. 页面主成绩:F1 micro 0.88(MIMIC-CXR-JPG test)/ 0.74(CheXpert test);论文精细口径 0.879/0.739。
  33. 双源 test 的 14 点落差揭示跨机构泛化难度——双源设计是硬价值。
  34. 表 6(RadGraph 1.0 横评):HGIE-RadBERT 0.852/0.791 + 0.744/0.723 vs DyGIE+±RadBERT 0.826/0.787 + 0.726/0.694 vs PURE-RadBERT 0.814/0.746 + 0.723/0.675。
  35. 六初始化横评:BERT Base/BioBERT/ClinicalBERT/PubMedBERT/BlueBERT/RadBERT——RadBERT 最优(0.883/0.742 depth 2);HGIE 初始化 delta 0.040 最大。
  36. 深度消融:taxonomy depth 2 ≥ depth 3(RadBERT 0.883 vs 0.879;0.742 vs 0.739)——浅层级更好训。
  37. 交叉对比(表 3,实体):MIMIC 侧 ANAT-DP 0.983/0.968、OBS-DP 0.963/0.922、OBS-U 0.798/0.700、OBS-DA 0.813 vs 0.952(降);CheXpert 侧 4 项 2 胜 2 负。
  38. 交叉对比(表 4,关系):MIMIC 侧 modify 0.906/0.804、located_at 0.826 vs 0.861(降)、suggestive_of 0.838/0.685、F1 0.874/0.823;CheXpert 侧 F1 0.746/0.725——关系 3/4 胜。
  39. 文件清单:README.md + train.json(575) + dev.json(75) + test.json(150) + inference-chexpert.json(500) + inference-mimic.json(227,068)。
  40. JSON 键 = 报告 ID:MIMIC ‘<folder>/<patient>/<study>.txt’;CheXpert 纯数字。
  41. JSON 五键:text / data_split(train|dev|test|inference)/ data_source(MIMIC-CXR|CheXpert)/ is_original(600 True/200 False;inference 无此键)/ entities。
  42. 实体五键:tokens / label / start_ix / end_ix(0 起,单 token 相等)/ relations([关系标签, 目标 ID] 元组列表)。
  43. 格式与 RadGraph 同构(analogical)——生态工具链直通。
  44. Usage Notes:RadGraph 全部用途 + 疾病进展追踪(change 实体支撑)。
  45. Limitations 两条(页面原文归纳):change 标注存在模糊场景(不确定性无法直接建模);报告限于 MIMIC-CXR-JPG 与 CheXpert(机构多样性不足)。
  46. Ethics:‘previously publicly available deidentified datasets…did not require IRB approval’;敏感数据遵守源数据集使用条件;COI 无。
  47. References 8 条:Johnson 2019 MIMIC-CXR-JPG(8360-t248)/ Irvin 2019 CheXpert(AAAI 33)/ Sugimoto 2021 JBI 116:103729 / Steinkamp 2019 JDI 32 / Datta 2020 JBI 108:103473 / Jain 2021 RadGraph(hm87-5p47)/ Wadden 2019 DyGIE++(EMNLP)/ 自引 MLHC。
  48. 页面瑕疵存照:作者 8 vs 论文 7(Pile);inference 三口径;/latest/ 404;κ 缺席;OBS-DA 交叉降分未解释。
  49. 一致性 κ:页面全无;emergentmind 转述论文 ‘median pairwise κ = 0.9963’——异常高,待证,不进正文。
  50. DB 查重:url_name 含 radgraph2 0 行(radgraph 561 在库);MAX=621 → 预期 rid 622。
  51. 本库近邻:radgraph(561)|mimic-cxr-jpg(617)|chexpert(5)|mimic-cxr(16)|chest-imagenome(330)|rad-coreference-resolution(621)。
  52. 结构化报告三层全栈:RadGraph/RadGraph2(实体+关系+变化)→ RadCoref(共指簇)→ MS-CXR-T(影像时序对)。
  53. 队列序:批次七 7/10;下一发 523 RaDialog Instruct Dataset。
  54. 快照体量:/tmp/522_page.html 78,906 B(2026-09-24)——本条目所有页面数字的第一存照。
  55. 论文细节源:arXiv 2308.05046(ar5iv/arxiv-vanity/PDF 三视图交叉)+ emergentmind 主题页(表 3-6 数字)。
  56. 页面基金行:NIH U24EB037545 + R01EB030362(PhysioNet 平台基金,非数据集专项)。
  57. 页面 Maintained by:MIT Laboratory for Computational Physiology。
  58. 同类预标注配方存照:200 份 benchmark 预标注起步(本集)≈ Longdoc 预标注(521 RadCoref)≈ ImaGenome silver 预标(519 MS-CXR-T)——临床 NLP 标注事实标准。
  59. 内存账:inference-mimic.json 约 680 万实体条目——全量 json.load 需 15-25 GB,建议 ijson 流式或 Parquet 预转换。
  60. CheXpert 源 silver 错误率约 26%(F1 0.74 推算)vs MIMIC 源约 12%——弱监督建议降权或分源处理。
  61. 弱监督收口纪律:silver 粗训后必须金标 fine-tune——575+75 份金标是错误率回收的唯一手段。
  62. strict vs relaxed 指标:strict 用预测实体+预测关系算端到端;实体任务单独评时用 F1 micro/macro 双口径。
  63. train.json 无 CheXpert 报告(全 MIMIC)——CheXpert 泛化只能靠 test 50 份评测,无法在训练侧补救。
  64. 页面基金行区分:NIH U24EB037545/R01EB030362 是 PhysioNet 平台基金,与 RadGraph2 研发资助不同层。
  65. test 150 的富集设计:100 MIMIC + 50 CheXpert——CheXpert 占 1/3(金标里占比最高),刻意放大跨源信号。
  66. is_original 的派生学意义:600 份 True 报告构成与母集 RadGraph 的’锚点集合’——同报告两代标注可比。
  67. 页面 ‘Maintained by MIT Lab for Computational Physiology’——平台维护方标注(数据集作者另计)。
  68. 构建目录事故存照:/tmp 下构建产物遭并发进程覆盖/删除一次(part4.py 被改写、part1-3.md 被清)——已迁 .build522 安全目录重建,DB 确认无并发发布(radgraph2 0 行)。
  69. 三口径仲裁链:Abstract 概数(220,000+)→ 论文时点(220,763)→ 文件级(227,068+500)——时间递增序列,引用默认取文件级。
  70. 全栈互补卡位:561 快照层 → 622 时序层 → 621 指代层 → 519 影像层——四条目拼出完整疾病叙事结构化栈。

事实清单共 70 条——每条对应一次页面/论文/DB 读取,编号即存照序。

§12 术语表:五十条

1. RadGraph2:Rajpurkar 团队 RadGraph 的时序扩展卷——800 金标 + 22.7 万自动标注的放射报告信息抽取数据集。
2. RadGraph:母集(Jain 2021,rid 561)——4 叶子实体 + 3 关系的报告知识图谱范式开创者。
3. change entity(变化实体):RadGraph2 新增实体族——把’与上次相比’的叙述词(new/worse/resolved 等)标成图节点。
4. CHAN-NC:无变化实体——‘persists/stable/unchanged’ 等表述。
5. CHAN-CON-AP:病情新出现——‘a new left basilar opacity’。
6. CHAN-CON-WOR:病情恶化——‘slightly worse pulmonary edema’。
7. CHAN-CON-IMP:病情好转——‘improvement in the mild pulmonary edema’。
8. CHAN-CON-RES:病情痊愈——‘opacities have resolved’。
9. CHAN-DEV-AP:装置出现——‘has received the new feeding tube’。
10. CHAN-DEV-PLACE:装置移位——‘pleural drain has been advanced to the left apex’。
11. CHAN-DEV-DISA:装置移除——‘the patient has been extubated’。
12. ANAT-DP:确定存在解剖部位实体——RadGraph 原有 4 叶子之一。
13. OBS-DP / OBS-U / OBS-DA:观察三态:确定存在/不确定/确定不存在——‘moderate cardiomegaly’/‘cannot be excluded’/‘no pneumothorax’。
14. modify:修饰关系——(OBS,OBS)/(ANAT,ANAT)/(CHAN,*)/(OBS,CHAN) 可连。
15. located_at:定位关系——观察挂到解剖(OBS→ANAT-DP)。
16. suggestive_of:提示关系——‘opacity may indicate pneumonia’ 式推理边。
17. priors:既往检查——报告对比叙述的锚点,RadGraph2 的核心建模对象。
18. disease progression:疾病进展——跨报告病情轨迹,change 实体族的最终应用。
19. hospitalist:住院医师(内科)——标注团队第 5 人(4 放射 + 1 hospitalist)。
20. board-certified radiologist:委员会认证放射科医生——标注质量的人员保障。
21. Datasaur:文本标注 SaaS 平台——RadGraph2 标注载体,附录 B 操作指令基于它。
22. HGIE:Hierarchical Graph-based Information Extraction——DyGIE++ 同架构 + 层级识别训练。
23. DyGIE++:Wadden 2019 EMNLP 的 span-based 联合抽取框架——HGIE 的骨架。
24. PURE:实体关系抽取基线——论文横评成员之一。
25. hierarchical recognition(HR):层级识别系统——12 标量输出各叶子条件概率,Bayes 链式法则反推。
26. 实体分类树(entity taxonomy):12 叶子的层级组织——训练时逐层学,推理时合成无条件概率。
27. 两阶段训练:阶段一父正条件学叶子;阶段二全数据交叉熵小学习率微调父级。
28. strict relation extraction:端到端关系指标——用预测实体+预测关系计算,主评测口径。
29. F1 micro / F1 macro:总体微平均/类别宏平均——双口径并列报告。
30. RadBERT:Stanford 放射文本预训练 BERT——六初始化横评最优(0.883/0.742)。
31. PubMedBERT:生物医学文献预训练 BERT——横评次优。
32. BioBERT / ClinicalBERT / BlueBERT:三个领域 BERT 变体——横评成员,均不敌 RadBERT。
33. 初始化 delta:同模型不同初始化的成绩差——HGIE 0.040 最大,领域适配敏感。
34. taxonomy depth:分类树深度——depth 2 ≥ depth 3 消融结论:浅层级更好训。
35. 交集评测(intersection dataset):剪掉 RadGraph2 独有实体/关系后与 RadGraph 模型对比的构造集。
36. is_original:JSON 键——True=原 RadGraph 600 份,False=新增 200 份;inference 无此键。
37. start_ix / end_ix:实体 token 下标(0 起)——单 token 时相等。
38. inference dataset:模型自动标注大数据——本集 227,068 MIMIC + 500 CheXpert。
39. 弱监督两阶段:silver 粗训 → 金标 fine-tune 收口的训练配方。
40. MLHC:Machine Learning for Healthcare 会议——RadGraph2 论文发表处(PMLR 219)。
41. PMLR:Proceedings of Machine Learning Research——MLHC 论文存档系列。
42. arXiv 2308.05046:论文预印本编号(2023-08-09 提交,cs.CL+cs.LG)。
43. double equal contribution:双同等贡献——本集两组:Dejl+Khanna(一作)/ Saenz+Rajpurkar(通讯)。
44. Vinbrain:越南 AI 医疗实验室——Truong 与 Duong 的所属机构。
45. CheXpert:Stanford 14 万胸片数据集(Irvin 2019,rid 5)——RadGraph2 双源之一。
46. MIMIC-CXR-JPG:贝斯以色列 37.7 万胸片数据集(rid 617)——RadGraph2 主源。
47. RadGraph benchmark model:RadGraph 时代的老 benchmark——200 份新报告的预标注起点。
48. 结构化报告全栈:RadGraph2(实体+变化)+ RadCoref(共指)+ MS-CXR-T(影像时序)三层对齐的完整疾病轨迹方案。
49. rai:dataLimitations:AI-Ready 元数据字段——本条目 7 条限制存照。
50. ijson:Python 流式 JSON 解析库——22.7 万报告文件的内存友好加载姿势。

术语表共 50 条——覆盖任务/schema/方法/人物/格式五域,交叉引用见附录 C 术语索引。

附录 A:数据集速查卡(一屏版)

属性 值
名称 RadGraph2
全称 RadGraph2: Tracking Findings Over Time in Radiology Reports
slug radgraph2-radiology-reports
版本 v1.0.0(2024-08-08,单版本)
DOI 10.13026/q65y-9688(v1.0.0)/ 10.13026/qptf-zh55(latest)
访问 Credentialed(License 1.5.0 + DUA 1.5.0 + CITI)
任务 实体+关系抽取 + 疾病进展追踪(change 实体族)
金标规模 800 报告(train 575 / dev 75 / test 150 = 100 MIMIC + 50 CheXpert)
金标标注量 23,457 实体 + 17,373 关系(论文口径)
Silver 规模 227,568 报告(227,068 MIMIC + 500 CheXpert)
Schema 12 叶子层级树(8 CHAN + ANAT-DP + 3 OBS)× 3 关系
标注平台 Datasaur
标注者 4 board-certified 放射科医生 + 1 academic hospitalist
Benchmark HGIE F1 micro 0.88(MIMIC test)/ 0.74(CheXpert test)
最优初始化 RadBERT(taxonomy depth 2)
许可 PhysioNet Credentialed Health Data License 1.5.0
语言 英语
源数据 MIMIC-CXR-JPG + CheXpert 报告文本
母集 RadGraph v1.0.0(rid 561——引用义务)
团队 Stanford/MIT/Harvard/Hanyang/Vinbrain——8 人双同等贡献
论文 MLHC 2023, PMLR 219:381-402(arXiv 2308.05046)

附录 B:关键时间线

时间 事件
2019 CheXpert(AAAI)与 MIMIC-CXR-JPG 发表——双源数据就位
2019-11 DyGIE++ 发表(EMNLP)——HGIE 的骨架
2021 RadGraph 挂牌 PhysioNet + 论文发表(Jain et al.)——母集就位
2022 RadBERT 等放射域 BERT 成熟——最优初始化就位
2023-08-09 论文提交 arXiv(2308.05046);MLHC 2023 接收(PMLR 219:381-402)
2024-08-08 RadGraph2 v1.0.0 挂牌 PhysioNet(先论文后数据一年)
2024-01 RadCoref 挂牌——文本结构化方向的姊妹赛道(共指层)
2026-09 本条目核查快照:Views 144、Topics 6、Files 区无 Total Size

附录 C:术语交叉索引(按字母序)

术语 首现节 关联术语
ANAT-DP §4.1 RadGraph 4 叶子
CheXpert §3.1 双源 test
CHAN-CON-* §4.1 disease progression
CHAN-DEV-* §4.1 装置追踪
Datasaur §3.2 标注平台
depth 2/3 消融 §5.4 taxonomy
DyGIE++ §5.2 HGIE
HGIE §5.1 hierarchical recognition
inference dataset §3.4 三口径
is_original §6.2 600/200
MIMIC-CXR-JPG §3.1 主源
MLHC 2023 §3 PMLR 219
modify / located_at / suggestive_of §4.2 RadGraph 三关系
OBS-DA 降分 §5.5 存照
priors §2.1 对比叙述
RadBERT §5.3 初始化
RadGraph(母集) §1 引用义务
strict relation extraction §5.2 主指标
双同等贡献 §1 Dejl+Khanna / Saenz+Rajpurkar
双源 test §3.1 14 点落差
弱监督两阶段 §9.3 silver→gold
疾病轨迹 §9.4 全栈对齐
交集评测 §5.5 表 3/表 4
迭代式 schema §3.2 医生反馈
机器预标注 §3.1 benchmark 模型起步

附录 D:文件清单与读取顺序(推荐入门路径)

  1. 先读页面:PhysioNet v1.0.0 页面的 Abstract + Data Description(schema 全解)——十分钟建立全局
  2. 再看论文:arXiv 2308.05046 的 §3(HGIE 机制)+ §5(实验表)+ 附录 B(标注指令全文)——复现的全部细节
  3. 对照母集:RadGraph(rid 561)条目与论文——理解 4 叶子基线
  4. 下数据:PhysioNet Credentialed 三件套 → RadGraph2.zip
  5. 解析顺序:train.json(金标结构)→ test.json(双源评测)→ inference-mimic.json(弱监督素材,ijson 流式分批加载——22 万报告全量 json.load 需 15-25 GB 内存)

附录 E:模型族完整成绩单(复现基准)

E.1 RadGraph2 主战场(strict relation extraction,六初始化最优值)

模型 最优初始化 MIMIC F1 micro/macro CheXpert F1 micro/macro
DyGIE++ RadBERT 0.826 / 0.787 0.726 / 0.694
PURE RadBERT 0.814 / 0.746 0.723 / 0.675
HGIE(depth 2) RadBERT 0.883 / 0.861 0.742 / 0.717

E.2 交叉对比(交集 schema,RadGraph benchmark → RadGraph2 benchmark)

任务 MIMIC:RadGraph→RadGraph2 CheXpert:RadGraph→RadGraph2
ANAT-DP 0.968→0.983 0.941→0.880(降)
OBS-DP 0.922→0.963 0.884→0.939
OBS-U 0.700→0.798 0.714→0.812
OBS-DA 0.952→0.813(降) 0.910→0.823(降)
modify 0.804→0.906 0.709→0.777
located_at 0.861→0.826(降) 0.779→0.712(降)
suggestive_of 0.685→0.838 0.588→0.730
F1 micro 0.823→0.874 0.725→0.746

读表要点:关系任务 3/4 胜且 F1 双源全升;实体 4/8 降——OBS-DA 双源全降是最值得注意的信号(change 实体抢占否定语义空间的假说存照,页面与论文均未深究)。

附录 F:AI-Ready 评估细目(十维打分)

维度 评级 说明
可获取性 B Credentialed 三件套门槛,无再分发;无 Total Size
格式规范 A JSON 同构 RadGraph,五键清晰,token 下标完备
文档完备 A- 页面+论文+标注指令附录全披露;κ 缺席是缺口
标注质量 B+ 5 人专家团队+迭代 schema;IAA 未在页面证实
许可清晰度 A License 1.5.0 + DUA 1.5.0 明文;母集引用义务明确
机器可读元数据 B+ RRID+DOI 双版本;Topics 6 个
基准可复现 B+ 消融充分(同架构/初始化/深度);官方代码未发布是减分
版本治理 A- DOI 双版本规范;单版本无更新承诺
伦理披露 B+ 免 IRB 逻辑清晰(母集去标识复用);COI 无
长期维护 B 单版本;Views 144 低流量

综合:A-(3.5/4.0)——格式与消融是强项,代码未发布与 κ 缺席是减分项。

附录 G:与近邻条目的差异表(放射文本结构化家族)

条目 任务 实体叶子 时序 规模 访问
rid 5 chexpert 14 病五值分类 14 标签 无 22 万图像级 Open
rid 561 radgraph 实体+关系抽取 4 叶子 无 600 金标+22 万自动 Credentialed
rid 621 rad-coreference-resolution 共指消解 mention/cluster 无 1,175 段+35.6 万段 Credentialed
rid 622 radgraph2 实体+关系+变化 12 叶子 有(CHAN 族) 800 金标+22.8 万自动 Credentialed
rid 519 ms-cxr-t 时序影像对+句对 — 有(图像层) 1,326 对+361 句对 Credentialed

RadGraph2 的独特生态位:家族里唯一在文本层建模时序的条目——519 在影像层、621 在指代层、561 在快照层,622 把"上次 vs 这次"变成结构化边。

附录 H:引用与致谢模板

BibTeX(数据集)

@dataset{dejl2024radgraph2,
  author    = {Adam Dejl and Sameer Khanna and Patricia Therese Pile and Kibo Yoon
               and Steven QH Truong and Hanh Duong and Agustina Saenz and Pranav Rajpurkar},
  title     = {{RadGraph2}: Tracking Findings Over Time in Radiology Reports},
  year      = {2024},
  publisher = {PhysioNet},
  version   = {v1.0.0},
  doi       = {10.13026/q65y-9688},
  url       = {https://physionet.org/content/radgraph2-radiology-reports/1.0.0/}
}

BibTeX(论文)

@inproceedings{khanna2023radgraph2,
  author    = {Sameer Khanna and Adam Dejl and Kibo Yoon and Quoc Hung Truong
               and Hanh Duong and Agustina Saenz and Pranav Rajpurkar},
  title     = {{RadGraph2}: Modeling Disease Progression in Radiology Reports
               via Hierarchical Information Extraction},
  booktitle = {Machine Learning for Healthcare Conference},
  series    = {Proceedings of Machine Learning Research},
  volume    = {219},
  pages     = {381--402},
  year      = {2023}
}

引用链义务

使用 RadGraph2 时应引用:(1) 数据集 DOI(v1.0.0);(2) 母集 RadGraph DOI(10.13026/hm87-5p47——Parent Projects 明文要求);(3) MLHC 2023 论文;(4) MIMIC-CXR-JPG(Johnson 2019)与 CheXpert(Irvin 2019)——报告双源;(5) DyGIE++(Wadden 2019)——方法基底。

附录 I:条目读法指南(三分钟版)

你是建模工程师 → 读序:§0 摘要卡 → §5 模型族成绩单(重点 §5.2 同架构消融与 §5.5 交叉对比的降分项)→ §6 文件格式 → §9 工作实例 → 附录 E 复现基准。注意 inference JSON 要流式加载(22 万报告全量直读需 15-25 GB)。

你是标注/数据团队 → 读序:§3.2 迭代式 schema 开发 → §3.3 重标的"最小干预"原则(旧标注复用的风险与收益)→ §4 schema 全解剖(12 叶子语义+示例句)→ 论文附录 B 标注指令原文(可直接当你的标注手册模板)。

你是合规/采购角色 → 读序:§1 身份卡 → §7.1 十问之 8-10 → 附录 F 打分卡 → 引用链义务(母集 RadGraph 是明文要求)。注意 inference 数据的授权链与金标同源。

你是检索/知识工程角色 → 读序:§4.2 关系连接规则(change 枢纽节点的图论意义)→ §6.2 JSON 结构 → §11 事实清单(66 条逐条存照)→ 附录 C 术语索引 → §9.4 全栈对齐图。

数字一致性仲裁:本条目多节复现的数字(800/575/75/150/227,068/0.88/0.74)若见不一致,以 §11 事实清单编号条目为仲裁源;inference 规模三口径以"文件级 227,068+500"为引用默认。


本条目由千方病案医数集生产流水线生成(批次七第 7 发,rid 622)。事实核查快照:/tmp/522_page.html(78,906 B,2026-09-24);交叉源:arXiv 2308.05046(ar5iv/arxiv-vanity/PDF/emergentmind)、DB 实测。所有数字以 PhysioNet 页面与 MLHC 2023 论文原文为准。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集