ReXGroundingCT (rexgrounding-ct) — AI-Ready Wikipedia

首个手工标注的「自由文本发现→3D 体素分割」胸部 CT 数据集——3,142 例非对比 CT、8,028 个发现、16,301 个分割实体、12 类 61 子类本体,GPT 管线加放射科医师质控,现役模型近零分、SAT 微调 Dice 仅 0.209,CC BY-NC-SA 4.0 gated 发布

来源 CT-RATE 非对比胸部 CT volumes(3,142 例,土耳其医院 2016-2022 采集)+ GPT-4 标准化英文报告 + 3D 像素级分割掩码(NIfTI)+ 12 类 61 子类本体 finding 分类 + anatomical CoT 解剖思维链(GPT-4o 生成)发布时间: 2026-09-30最后更新: 2026-09-30 阅读 11
ReXGroundingCT (rexgrounding-ct) — AI-Ready Wikipedia

信息速览

数据集名称ReXGroundingCT (rexgrounding-ct) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模3,142 个非对比胸部 CT volumes(unique 患者数未披露;平均年龄 42.08±14.52 岁,男 55.9%/女 44.1%)
接入方式CT-RATE 非对比胸部 CT volumes(3,142 例,土耳其医院 2016-2022 采集)+ GPT-4 标准化英文报告 + 3D 像素级分割掩码(NIfTI)+ 12 类 61 子类本体 finding 分类 + anatomical CoT 解剖思维链(GPT-4o 生成)
AI 就绪度

INFOBOX — ReXGroundingCT 一屏速览

维度 内容
本质 首个公开的手工标注「自由文本发现→3D 体素级分割」胸部 CT 数据集(sentence-level grounding to volumetric imaging)
团队 Harvard Medical School 生物医学信息学系 Rajpurkar 实验室牵头;沙特 KAMC/KASCH、加拿大 Royal University Hospital、圣路易斯大学等 8+ 机构协作
论文 NEJM AI(doi:10.1056/AIdbp2501220);arXiv:2507.22030(v1 2025-07-29 / v2 2025-10-27,25 作者);MLHC 2025 派生评估论文
数据 3,142 个非对比胸部 CT volumes(派生自 CT-RATE)+ 8,028 个发现 + 16,301 个分割实体
划分 train 2,992 / public val 50 / private test 100(榜单评测)
类别 12 类 61 子类本体(H/L/M 三域);数据分布 14 类(8 focal + 6 non-focal);79% focal / 21% non-focal
管线 GPT-4 报告重写 → GPT-4 抽取 + GPT-4o-mini 分类 → 3D 像素标注(HIPAA 平台)→ 放射科医师质控
标注深度 训练集每发现 ≤3 个代表实例(均值 1.95);val/test 全量 exhaustive(均值 3.80)
附加资产 anatomical CoT 解剖思维链(GPT-4o + RadGenome 坐标引导;对齐精度 0.92/邻接精度 0.75)
基准 现役文本提示分割模型(BiomedParsev2/SAT/SegVol)零样本近零分;SAT 微调 Global Dice 0.209、HIT Rate 0.473
榜单 rexrank.ai/ReXGroundingCT(ReXRank 子榜,私有测试集不下发)
获取 HF rajpurkarlab/ReXGroundingCT(CC BY-NC-SA 4.0,gated=auto);CT 本体另从 CT-RATE 获取
库内互链 ct-rate(546,上游影像)、rexgradient-160k(717,同实验室)、chest-imagenome(330)、radgraph(561)、totalsegmentator(422)

ReXGroundingCT 是一个"把放射学报告的语言钉回三维解剖"的数据集工程:它从 CT-RATE 中取出 3,142 个非对比胸部 CT,把每份报告里"3 mm 结节位于左下叶"这样的叙述性发现逐条抽出来,再由注释者在体数据里把这句话所指的范围用体素级掩码亲手画出来——8,028 条文本发现对应 16,301 个 3D 分割实体。在它之前,胸部 CT 的语言-空间连接要么停留在预定义类别标签,要么依赖自动生成的区域匹配;ReXGroundingCT 是第一个"手工标注 + 像素级 + 3D + 自由文本"四项全占的公开资源。

它同时是一记清醒剂:论文评测显示,现役文本提示 3D 分割模型(BiomedParsev2、SAT、SegVol)在这个任务上近乎零分;在数据集上微调后的 SAT 也只拿到 Global Dice 0.209。"自由文本→三维空间"这个对临床可定位报告生成(GRRG)至关重要的能力,目前没有任何现成模型能够胜任——这正是该数据集把私有测试集挂在 ReXRank 榜单上、邀请全社区攻坚的原因。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——注意三件事:HF 是 gated=auto 门禁、CT 影像本体要另下 CT-RATE、测试集 100 例不下发只能走榜单。
  2. 关心标注质量:直奔 §3 与 §4——训练集(学生/注释员+质控)与 val/test(放射科医师全标)是两层数据,别混用。
  3. 做文本提示分割模型:直奔 §5——先看现役模型有多惨,再决定是微调 SAT 还是换架构;评估脚本与匹配算法细节在附录 G。

条目导航:

板块 节 你会看到什么
数据本体 §2 规模、扫描参数、双计数体系、类别分布、QC 账目、文件结构、同类对比
生产管线 §3 GPT-4 重写 → 抽取分类 → 3D 标注双协议,含保真度审计数字
附加监督 §4 Anatomical CoT 的构造、0.92/0.75 双精度验证与使用警示
评测体系 §5 零样本近零、SAT-FT 天花板、MLHC 全景、脚本版本陷阱
获取许可 §6 gated=auto 实操、三样自备清单、AI-Ready 逐项评估、决策树
生态谱系 §7-§8 rajpurkarlab 垂直栈、协作网络、四条可迁移方法学经验
库内导航 §9 与 ct-rate(546)、rexgradient-160k(717) 等六条目的关系图谱
避坑与速用 §10-§11 十三个坑、三句话总结、30 秒决策卡
工具箱 FAQ-附录 44 问、54 条硬事实、46 条术语、26 个附录(含代码骨架与证据链)

§0 导读:这个数据集解决什么问题

可定位放射学报告生成(Grounded Radiology Report Generation,GRRG)是医学 AI 的一条新前线:模型不仅要写出"左下叶见 3 mm 结节",还要把这句话对应的空间区域在图像上指出来。它的价值链条很清楚——报告与图像互相锚定后,AI 的输出变得可验证、可解释,放射科医师可以一眼核对模型说的话到底指的是哪个位置,患者可以看到自己报告里的发现画在哪个解剖结构上,训练年资医师也能用"文字↔区域"的对照学习空间推理。

问题在于监督数据的断层。胸部 X 光侧已有 PadChest-GR(2025,NEJM AI)提供了句级定位,但那是 2D 边界框;CT 侧的既有资源各有缺口:LIDC-IDRI 只有肺结节的固定类别标注,TotalSegmentator 这类提供的是解剖结构分割而非病灶,RadGenome-Chest CT 提供了区域级文本匹配但其掩码来自自动器官分割模型而非人工标注,OminiAbnorm-CT 覆盖全身但只有 2D 关键层面且商用需付费授权。"自由文本 + 人工像素级 + 3D 体积 + 公开获取"这四个条件的交集此前是空的。

ReXGroundingCT 的回答是一套三阶段生产管线:先用 GPT-4 把土耳其语机器翻译的报告重写成美式放射学惯例的标准化文本,再用 GPT-4 抽取发现、GPT-4o-mini 按一个 12 类 61 子类的两级本体归类,最后由注释团队在 HIPAA 合规平台上逐个把发现画成 3D 掩码——训练集由专业注释员与医学生完成并经放射科医师质控,验证与测试集则由 board-certified 放射科医师独家全量标注。质检账目清晰可查:10,012 项初筛发现经过四条排除规则后剩 8,028 项,每一步的减法都有数可对。

这个数据集背后的元命题值得先说清:医学影像 AI 的评测一直被"固定类别"绑架。LIDC 的结节属性、TotalSegmentator 的 104 个解剖结构、各类挑战赛的病变分类——都是先建盒子再往里装数据。但临床语言不是盒子的集合:同一个结节可以是"8 mm 实性结节"“右肺上叶后段小结节影,建议随访”“考虑炎性肉芽肿可能大”——语言的无界性恰恰是临床沟通的真实形态。ReXGroundingCT 赌的是:与其等语言收敛到类别,不如让监督数据先承认语言的原貌。零样本近零、微调 0.209 的成绩单说明这个赌注标出了问题的真实难度——这是它作为基准最诚实的贡献。

§0 读法三则:

  1. 这个条目是"数据集+基准+管线论文"三合一:本体是 8,028 对文本-掩码,衍生品是 ReXRank 榜单与 MLHC 评估论文,副产品是一套可复制的"GPT 抽取+人工 3D 标注"生产管线——三者的许可与获取方式在 §6 统一说清。
  2. 全文硬数字均出自论文正文与附录;正文与 NEJM AI 版唯一实质性冲突(分类用的是 GPT-4o 还是 GPT-4o-mini)已在坑 1 存照,本条目采 arXiv v2 口径。
  3. 检索时别把本数据集与 RadGenome-Chest CT、OminiAbnorm-CT 混为一谈——三者都在做"CT 里的语言定位",但标注方式(自动 vs 手工)、空间形态(区域 vs 体素)、获取门槛(直链 vs 付费)完全不同(坑 8、附录 I)。

§1 数据集速览:十问十答

Q1:ReXGroundingCT 到底"接"什么?
输入是一句自由文本放射学发现(如"left lower lobe 3 mm nodule"),输出是这句话在对应胸部 CT volume 里的 3D 分割掩码。每个发现还带 12 类 61 子类本体的归类与异常状态标记。它支持两个任务:finding grounding(给定报告定位发现)与 grounded report generation(给定图像生成带空间引用的报告)。

Q2:数据从哪来,规模多大?
全部派生自公开的 CT-RATE 数据集(arXiv:2403.17834):按 CT-RATE ID 顺序分组抽取 3,142 个非对比胸部 CT volumes(ID 随机分配,故近似随机样本)。共 8,028 个带 3D 标注的发现、16,301 个独立分割实体;79% 为局灶性(focal)异常,21% 为弥漫性(non-focal)异常。

Q3:报告是原始报告吗?
不是直译原文。原始土耳其语报告经机器翻译转英文后,GPT-4 又做了一轮"美式惯例标准化"重写(如 millimetric→subcentimeter、pleuroparenchymal sequelae→scarring/fibrosis),board-certified 放射科医师抽检 50+ 份全部判定可接受。所以文本是"受控标准化"的英文,不是原汁原味的临床原始报告。

Q4:谁画的掩码,可靠吗?
分层结构。训练集 2,992 例走两条协议:protocol 1(1,400 例)由 1.5 年以上经验的专业注释员标注、放射科医师逐例 refine;protocol 2(1,592 例)由受训医学生标注、监督放射科医师纠错直至独立胜任。验证集 50 例与私有测试集 100 例由 board-certified 放射科医师独家全量标注。所有标注在 HIPAA 合规云平台完成。

Q5:训练集和评测集的标注深度一样吗?
不一样,这是使用时最容易踩的坑。训练集每个发现最多画 3 个代表实例(平均 1.95 实体/发现);验证与测试集要求 exhaustive——所有可见实例全部标出(平均 3.80 实体/发现)。论文明说这是工作量管理的取舍,并建议用弱监督/半监督方法消化训练集的不完整性。

Q6:本体里有什么类别?
两级本体 12 个父类、61 个子类,与放射科医师共同设计:两个肺/胸膜大类(非局灶与局灶各一)加十个非肺胸膜类(非肺部病灶、骨、结石钙化、空腔脏器、皮肤皮下、心血管、体成分、弥漫全器官、器械、其他)。但注意:质控阶段只保留肺与胸膜发现的标注(1,047 项非肺胸膜发现被排除),本体覆盖全身是为抽取阶段设计的,最终掩码只落在肺/胸膜。

Q7:那个思维链(CoT)数据集是什么?
anatomical_cot.json:GPT-4o 按"whole-CT→器官→肺叶→病灶邻域"的层级为发现生成分步解剖定位推理,引导信号来自 RadGenome-Chest CT 的器官/肺叶边界框坐标。150 例人工验证:与发现文本的对齐精度 0.92,空间邻接推断精度 0.75。它面向推理增强分割模型或多模态对齐训练。

Q8:现役模型在上面表现如何?
惨。BiomedParsev2、SAT、SegVol 零样本在测试集上"近零性能";在 ReXGroundingCT 上微调的 SAT(SAT-FT)把 Global Dice 拉到 0.209、Global HIT Rate 0.473——显著改善但远非可用。MLHC 2025 派生论文补测了 MedSAM2 等四模型,结论一致:非局灶、自然语言描述的发现尤其难。

Q9:我现在能拿到什么?
HF rajpurkarlab/ReXGroundingCT(CC BY-NC-SA 4.0,gated=auto:登录+同意条款自动批准)拿到掩码 NIfTI、标准化报告、CoT、评估脚本;CT 影像本体要另从 CT-RATE 获取并按 volume id 对齐;私有测试集 100 例不下发,只能把预测提交到 rexrank.ai/ReXGroundingCT 榜单评测。

Q10:为什么它对 AI-Ready 重要?
它是"文本-空间"监督在 3D 医学影像里的第一个手工标注样本,且配套了完整的可复现套件:公开评估脚本(rexrank_eval.py)、活榜单、CoT 附加监督、生成代码与 prompts 全部开源。AI-Ready 的短板也很典型:gated 门禁、CT 本体外置、训练集部分标注——三者都要求使用者具备数据工程能力才能拼出可训练的全套(§6.4 有逐项评估)。

§2 数据构成与规格

2.1 上游 CT-RATE 与抽样方式

ReXGroundingCT 的影像与报告全部派生自 CT-RATE(arXiv:2403.17834,Hamamci 等,Istanbul Medipol Mega Hospital 采集)。CT-RATE 全库含 25,692 个胸部 CT study、重建出 50,188 个 volume、超过 1,430 万轴位层面,覆盖 21,304 名患者(平均年龄 48.8 岁,女 41.6%/男 58.4%),采集时间 2015 年 5 月至 2023 年 1 月。原始报告为土耳其语,机器翻译成英文后由双语医学生校正。

本数据集从 CT-RATE 中按 volume ID 顺序分组抽取 3,142 个非对比胸部 CT volumes。由于 CT-RATE 的 ID 本身随机分配,这种"顺着编号往下取"的方式等价于随机抽样——每个被选中的 volume 保留其英文报告与元数据(人口学、扫描参数)。这是一个低成本但有效的代表性设计:既不引入任何临床选择偏倚,又让抽样过程可以被任何人一键复核(按 ID 排序对照即可)。

HF 仓库里 segmentations 文件名的 volume ID 不连续(1008、10000、10001……)正是这一抽样的自然痕迹,不是数据缺失(坑 9 详述)。

2.2 患者与扫描参数画像

3,142 个 volume 的画像如下(论文 §3 口径):

维度 值
平均年龄 42.08 ± 14.52 岁
性别分布 男 55.9% / 女 44.1%
采集时间窗 2016 年 2 月 至 2022 年 11 月
造影剂 全部为非对比(non-contrast)CT
层厚 0.50–5.00 mm
面内像素间距 0.30–0.98 mm
矩阵尺寸 512×512 占 92.6%;768×768 占 7.2%;1024×1024 占 0.2%
每 volume 层数 104–1,005 层,均值约 351 层

两个口径陷阱必须点名。其一,这批 42.08 岁的平均年龄与 CT-RATE 全库的 48.8 岁不可互换——前者是 3,142 例子集的实际值,后者是 21,304 人全库值,混用会在写作中制造"子集比全库年轻 7 岁"的假象(坑 7)。其二,unique 患者数论文未披露:CT-RATE 中一个 study 可重建出多个 volume,3,142 个 volume 对应的患者数可能小于 3,142,但论文没有给出确切数字——任何把 3,142 当"患者数"的转述都是无依据的(坑 12)。

2.3 发现与实体:双计数体系

本数据集的规模用两个嵌套的数描述,务必分清:

  • 发现(finding):一条从报告中抽取的自由文本描述(如"右上叶 8 mm 实性结节"),是文本侧的计数单位——共 8,028 个,每个发现至少有一个 3D 掩码。
  • 实体(entity):一个发现所指的具体空间实例。报告说"双肺多发结节",在 CT 里可能对应 5 个真实结节——每个画一个掩码就是 5 个实体。全部数据集共 16,301 个实体。

两者的比值反映标注深度:训练集因为"每发现最多 3 实例"的协议,平均每发现 1.95 个实体;验证+测试集因为 exhaustive 全标,平均每发现 3.80 个实体——几乎翻倍。这个差值本身就是"部分标注 vs 全量标注"的直接量化,也是弱监督方法研究的天然实验场。

2.4 类别分布:14 类、8 focal + 6 non-focal

8,028 个发现落在 14 个类别上(论文 Figure 1B),其中 8 个典型局灶(focal)、6 个非局灶(non-focal):

模式 占比 最常见类别
局灶(focal):结节、局灶实变、胸腔积液等 约 79% Pulmonary Nodules/Masses(占 focal 的 28.9%)
非局灶(non-focal):间质改变、弥漫肺气肿等 约 21% Emphysema(占 non-focal 的 27.7%)

非局灶发现的 21% 占比是本数据集区别于"结节定位器"类数据集的关键:弥漫性病变(磨玻璃、间隔增厚、树芽征、马赛克灌注)的边界天然模糊,正是现役分割模型最溃败的区域(§5)。仅有 79/21 的比例平衡,意味着这个基准不会让模型靠"只会圈结节"蒙混过关。

14 类怎么读。论文正文报的是 14 类分布口径(8 focal + 6 non-focal),附录给的是 12 父类 61 子类的本体口径——两套数字并存不矛盾:前者是"数据里出现的异常模式大类"的统计口径,后者是"给 GPT-4o-mini 分类用的两级标签体系"。使用者的实操建议:

  • 做分布统计或数据卡写作时用 14 类口径(有占比可引);
  • 做模型预测后处理或与官方评估对齐时用 12 父类 61 子类本体(分类器输出的就是这套标签);
  • 两个口径之间没有公开的一一映射表——这是文档缺口,自用映射需要自行建立并注明(关联坑 10)。

8 个 focal 大类的代表作:肺结节/肿块(Pulmonary Nodules/Masses,占 focal 28.9%)、局灶实变、胸腔积液、局灶磨玻璃影、肺不张、包块样病变等;6 个 non-focal 大类的代表作:肺气肿(Emphysema,占 non-focal 27.7%)、间质性改变、弥漫磨玻璃、支气管扩张、马赛克样衰减等。附录 D 的 61 子类全表给出每个父类下的完整细分与 H/L/M 域前缀。

2.5 QC 排除账目:10,012 → 8,028 的四条减法

标注前对全部 CT 初筛出 10,012 个候选发现,质控阶段按四条规则排除,账目完全闭合:

排除原因 数量 典型例子
超出肺/胸膜范围(非肺胸膜发现不标注) 1,047 血管钙化、腹部脏器异常、其他胸廓结构
报告有描述但 CT 上无法定位 449 报告描述某位置小结节,注释者找不到对应影像
弥漫性、分割不可行 367 “肺含气减少”、大范围马赛克衰减——需要画整个肺体积
正常解剖或良性变异 121 亚厘米淋巴结等非病理性所见
合计排除 1,984
保留进入标注 8,028

这四条排除规则值得每个做"报告→标注"管线的人抄走:它们本质上是把"语言里存在的东西"筛成"影像上可空间化的东西"。第三条(弥漫性不可分割)尤其诚实——承认某些临床语言天然没有清晰的体素边界,硬画只会制造噪声标签。

2.6 掩码文件与数据结构

HF 仓库的实际交付物(API siblings 实测):

文件/目录 内容
dataset.json 主标注文件:发现文本、类别、异常状态、实例组织
reports_dataset.json GPT-4 标准化后的英文报告
anatomical_cot.json 解剖思维链(§4)
MICCAI_challenge_dataset.json MICCAI 挑战赛版本变体(用途未官方文档化,坑 10)
MLHC_dataset_version.json MLHC 2025 评估论文所用版本快照
rexrank_eval.py / rexrank_eval_fast.py 官方评估脚本(§5.5、附录 G)
segmentations/train_{id}_{f}_{n}.nii.gz 3D 分割掩码(NIfTI 压缩格式),与 CT-RATE volume id 关联

掩码文件命名模式 {split}_{volume_id}_{finding槽位}_{实例序号}.nii.gz(如 train_10000_a_1.nii.gz):a/b/c 是同一 volume 内不同发现的槽位,末位数字是同一发现下的实例序号。CT 影像本体不在仓库内——使用流程是:从 CT-RATE 下载对应 volume → 按 ID 对齐 → 把 nii.gz 掩码叠加到 CT 体积上(坑 3)。

把这个命名语法展开成一张解码表(与附录 F 的对齐代码配套):

片段 例值 语义 使用注意
split train 划分来源(train 公开;val/test 掩码随测试集私有不下发,坑 5) 本地只见 train 前缀掩码属正常
volume_id 10000 CT-RATE 的 volume 编号,关联影像本体与报告 ID 不连续(坑 9);一个 id 可能对应多个掩码文件
finding 槽位 a 同一 volume 内第几个发现(a/b/c…) 槽位字母与 dataset.json 内发现条目的对应关系需以 JSON 结构为准
实例序号 1 同一发现下的第几个实体掩码 上限受协议约束:train ≤3(坑 4);若连续缺失不代表数据损坏

两个实操提示。其一,同一 volume_id 下的多个发现共享同一个 CT 体积——加载时缓存 CT 数组、只切换掩码可以显著省 IO。其二,掩码与 CT 是否同网格(同 shape、同仿射)取决于 CT-RATE 侧的重建版本选择:遇到 shape 不一致先检查是否拿错重建(CT-RATE 一个 study 可多 volume),再考虑重采样,别直接按体素下标混用。

2.7 与同类"语言定位 CT"资源的规格对比

把本数据集放进"CT 语言-空间"资源的横断面里,四项关键属性的差异一目了然:

资源 空间形态 标注方式 语言形态 获取
ReXGroundingCT 3D 体素掩码 手工(放射科医师质控/全标评测集) 自由文本发现 CC BY-NC-SA 4.0,gated=auto
RadGenome-Chest CT 区域掩码(器官/肺叶派生) 自动(器官分割模型+句子匹配) 句子-区域对 公开
OminiAbnorm-CT 2D 关键层面 半自动 异常描述 ML 用途需付费授权
PadChest-GR 2D 边界框(X-ray) 手工 句级 公开
LIDC-IDRI 3D 轮廓(仅肺结节) 多专家 固定属性 公开

论文的 “first” 宣称正是靠着这张对比表成立的:第一个手工标注、体素级、自由文本、公开的胸部 CT grounding 数据集——四个限定词缺一不可(坑 8)。转引时若省略限定词,RadGenome 的作者有充分理由抗议。

2.8 发现文本长什么样:四类样例与字段形态

论文 Figure 1A/2 与示例节给出的形态(转述示例,非逐字数据行):

类型 发现文本形态(示意) 对应掩码形态
局灶-结节 带尺寸/位置/密度的结节描述(如左下叶 3 mm 结节) 小体积高密度连通域,单实例为主
局灶-胸膜 胸腔积液/胸膜增厚描述 沿胸膜面分布的窄带状体积
非局灶-弥漫 肺气肿/间质改变/树芽征等描述 多灶散在或大片低密度区,实例多且边界模糊
参照既往 带"较前稳定/增大"的随访对比描述 与当次扫描对应,参照信息进元数据

发现文本的字段形态(dataset.json 结构推断+论文 Figure 2):抽取文本、异常状态(正常/异常)、既往影像参照标记、本体编码(H/L/M 前缀 + 子类)。掩码侧以 finding 槽位(a/b/c…)组织、实例序号递增——与附录 F 的文件名解析函数一一对应。

使用提示:非局灶发现的文本常含程度词(“轻度”“为主”)而无精确边界,模型输出与 GT 的 Dice 天然受边界解释影响——评测时对 focal 与 non-focal 分桶解读是论文与 MLHC 派生文共同的隐含口径(5.4 的重灾区结论由此而来)。

2.9 五个反直觉的事实

读论文容易错过的五个点,每个都影响使用姿势:

  1. "随机抽样"是靠文件名顺序实现的——不是分层随机、不是按疾病配额。好处是零选择偏倚可复核,代价是没人保证 14 类在 train/val/test 间完美平衡(分层信息要从 dataset.json 现算)。
  2. 本体 12 类里有 10 类基本是"空架子"——类别 3-11(非肺病灶/骨/结石/空腔脏器/心血管/体成分等)在抽取阶段全用,但 QC 把 1,047 项非肺胸膜发现全排了。用类别分布做统计分析时,分布表是 14 类口径、本体表是 12 类口径,两表不能互相除。
  3. 测试集标注者是"纯放射科医师"这件事只在 val/test 成立——训练集的 2,992 例里有 1,592 例出自医学生之手(protocol 2)。两层数据的标签风格差异(学生倾向保守勾画 vs 医师果断)没有论文级量化,跨层迁移时要留心。
  4. CoT 的邻接精度 0.75 是"做过邻接推断的 20% 案例"上的精度——多数 CoT 压根不做邻接断言。把 0.75 误读成"全部 CoT 的 75% 正确"会高估整体质量(§4.2)。
  5. 数据集的"最后修改时间"比论文晚大半年(HF lastModified 2026-07-08 vs arXiv v2 2025-10-27)——仓库在论文发表后仍在动(评估脚本 PR、版本变体 JSON 等)。冻结复现环境时固定 commit sha(4aee42ef…)比固定日期更可靠。

§3 构建管线:三阶段如何把报告变成掩码

3.1 阶段一:GPT-4 报告重写

CT-RATE 的英文报告来自土耳其语机器翻译,一个 board-certified 放射科医师的定性审查发现其中充满翻译伪影与非标准措辞、风格参差。管线的第一步用 GPT-4 把报告重写为术语与措辞对齐美国放射学惯例的标准化文本:

  • 术语矫正示例:millimetric → subcentimeter;pleuroparenchymal sequelae → scarring/fibrosis;no space-occupying lesion → no lesion
  • 删除与影像解读无关的语句,提升简洁性
  • 硬约束:保留全部临床细节、测量值与解剖参照——重写不许丢信息

质量控制:放射科医师人工复核 50+ 份重写报告,按"可接受/不可接受"二元评定,全部判为可接受。重写 prompt 由团队与放射科医师多轮协作设计。这一步的成本收益很典型:一次重写让后续所有抽取、分类、标注都在受控语言上进行,代价是文本与原始报告之间隔了一层 LLM 转述(保真度审计见 3.4——描述符遗漏率 0.14,不算零成本)。

3.2 阶段二:GPT-4 抽取 + GPT-4o-mini 分类

标准化报告进入两段式信息抽取:

抽取(GPT-4):逐份分析 Findings 与 Impressions 两节,把每个解剖观察拆成独立条目(一句话含多个发现要拆开;散落多句的同一发现要合并),每条带尺寸、形态、位置与既往影像参照(稳定/变化)。抽取明确排除解释性语言、诊断推测与临床建议,只留可观察的影像特征;测量值规范化(毫米取整、厘米保留一位小数)。每个条目附带异常状态(正常/异常)与既往影像引用标记。

分类(GPT-4o-mini):把每条抽取结果归入两级本体——12 个父类、61 个子类(与 board-certified 放射科医师共同设计;代码前缀 H=心脏/血管、L=肺/气道/胸膜、M=纵隔/肺门)。本体同时容纳局灶与非局灶模式(12 类全表见附录 D)。

保真度审计(100 份随机报告,放射科医师逐条评):

指标 重写步 抽取步
假阳性(无中生有) 0 0
假阴性率(漏抽) 0.05 0.01
描述符遗漏率(漏细节) 0.14 0.13

分类精度:GPT-4o-mini 在 12 类父类层面 precision=recall=0.99;在类别 1/2 的 100 条子样本上子类分类 F1=0.92。零假阳性是这套管线敢于直接进入人工标注阶段的底气;0.13-0.14 的描述符遗漏则说明 LLM 转述确实会丢细节——研究者若需逐字保真,应回查 CT-RATE 原始报告(坑 1 关联)。

口径存照:分类用的是 GPT-4o-mini(arXiv v2);NEJM AI 正式版写的是 “GPT-4o categorized”。两版矛盾,本条目采更晚修订、附录细节自洽的 arXiv v2(坑 1)。

3.3 阶段三:3D 像素标注(双协议)

全部标注在 HIPAA 合规的云端医学影像标注平台完成,工具链含笔刷、多边形、智能区域生长,支持跨层面导航与窗位调节。训练集 2,992 例按两条协议执行:

Protocol 1(1,400 例):专业注释员标注(大多数有 1.5 年以上医学标注经验),放射科医师逐例把关——接受、直接修改、或打回重做。这是"标注员生产+专家在线 refine"的流水线。

Protocol 2(1,592 例):医学生标注。学生先接受本任务专项训练,训练期表现被监测评估;监督放射科医师持续纠错,直到学生证明能独立胜任后才放手。这是"师徒制":用前期密集纠错换后期吞吐。

验证/测试集(50+100 例):board-certified 放射科医师独家全量标注,不经过任何中间注释员——评测金标准的纯度靠人来保证,不靠事后抽检。

实体协议:训练集注释者被指示每个发现最多画 3 个代表实例(哪怕实际有更多);验证/测试集则要求 exhaustive——所有可见实例全部标出。论文把理由说得直白:工作量管理。8,028 个发现若全量标注,仅训练集的实体数就会翻倍以上。

3.4 与既有标注流水线的对照

把三种"LLM+人工"标注生产模式并排放着看:

模式 代表 LLM 角色 人工角色 质量锚点
LLM 生产+专家抽检 RadGenome-Chest CT 全量生成 模型与匹配逻辑 自动 organ 分割精度
LLM 抽取+人工空间化 ReXGroundingCT 重写/抽取/分类 3D 掩码+质控 零假阳性审计+放射科医师分层
纯人工 LIDC-IDRI 无 全量标注 多专家一致性

ReXGroundingCT 的位置选择有明确逻辑:语言侧交给 LLM(可审计、可复跑),空间侧留给人类(不可替代)。语言任务的错误率可以用 100 份抽检量化(结果 0.99/0.92),空间任务的正确性只能靠人员分层与全量质控兜底。这个"按错误成本分工"的原则对本库其他条目的标注方法论写作有直接参照价值。

再把三阶段的输入、输出与质量锚点串成一张总表(复现管线的检查清单):

阶段 输入 模型/工具 输出 质量锚点
1 报告重写 CT-RATE 英文报告(机翻校正版) GPT-4(prompt 见 GitHub) 术语标准化报告 reports_dataset.json 50+ 份人工复核全部可接受
2a 发现抽取 标准化报告 GPT-4 独立发现条目(含尺寸/位置/异常状态) 假阳性 0;假阴性 0.01
2b 本体分类 发现条目 GPT-4o-mini(坑 1) 12 父类/61 子类标签 父类 P=R=0.99;子类 F1 0.92
2c 初筛+QC 全部候选发现 人工规则 10,012 → 8,028(四条减法,§2.5) 账目闭合可复核
3 3D 标注 发现条目 + CT volume HIPAA 平台(笔刷/多边形/区域生长) segmentations/*.nii.gz + dataset.json 双协议分层(附录 H)

复现者最常见的三个翻车点都在这张表里有对位:阶段 1 忘了硬约束"保留测量值与解剖参照"导致下游抽取丢位置;阶段 2 用错模型版本(GPT-4o vs 4o-mini,坑 1);阶段 3 忽略双协议差异直接把训练集当全量标注用(坑 4)。

3.5 管线复现要点与成本画像

要复现这套管线(GitHub 仓库提供代码与 prompts),按论文信息推算的要点:

环节 复现要点 论文披露的量化锚点
报告重写 GPT-4 + 多轮协作设计的 prompt;保留临床细节硬约束 50 份 QC 全过;FN 0.05 / 遗漏 0.14
发现抽取 GPT-4;拆句/合并规则 + 测量规范化 FN 0.01 / 遗漏 0.13;0 假阳性
本体分类 GPT-4o-mini;两级本体(prompt 需带全类目) 12 类 P=R=0.99;子类 F1 0.92
初筛过滤 四条排除规则在标注前应用 10,012→8,028
3D 标注 HIPAA 云平台;三层人员结构 训练集 ≤3 实例/发现的成本阀
CoT 生成 GPT-4o + RadGenome 坐标引导 alignment 0.92 / adjacency 0.75

三条复现忠告。其一,先跑审计再跑全量:论文的 100 份抽检审计是整套管线的安全阀——0 假阳性才放行进入人工标注;跳过审计直接全量,LLM 的错误会无声地流进掩码。其二,排除规则要在标注前生效:449 个"不可定位"发现若先标注后排除,人力会浪费在寻找不存在的东西上。其三,别用更强的模型重跑分类就默认更准:论文的 0.99/F1 0.92 是与"放射科医师共识"比出来的,换模型要重做这层对照。

§4 Anatomical Chain-of-Thought:给定位过程本身做监督

4.1 动机与构造

放射科医师定位一个发现时走的是一条从粗到细的空间推理链:先在整个 CT 里认出肺部,再定位到具体肺叶,再看病灶与血管、叶间裂、胸膜面的邻接关系。现成数据集把这条推理链"黑盒化"了——只有输入(报告)和输出(掩码),没有中间步骤。ReXGroundingCT 的补充数据集把中间步骤显式写出来:

  • 生成器:GPT-4o,为每个发现生成分步层级推理文本
  • 空间锚:RadGenome-Chest CT 提供的器官/肺叶边界框坐标——CoT 不是凭空想象解剖位置,而是被真实分割模型的坐标引导着写
  • 推理结构:whole-CT → 器官 → 肺叶/段 → 含邻接线索(“紧邻胸膜”“靠近叶间裂”“邻近大血管”)的病灶区域

4.2 质量验证:两个精度,一个只有 0.75

随机抽 150 个发现,由 senior radiologist 按两条标准评审:

标准 含义 精度
Finding alignment CoT 未添加/遗漏发现的描述细节 0.92
Adjacency inference 邻接推断(“邻近胸膜”“靠近叶间裂”)解剖学正确 0.75

0.92 的对齐精度说明 GPT-4o 基本不瞎编发现内容;但 0.75 的邻接精度暴露了硬伤——部分 CoT 在报告没说的情况下臆断"贴着胸膜/胸壁"。论文同时披露:邻接推断只在约 20% 的评估案例中出现(多数 CoT 不做邻接断言),0.75 只覆盖这做断言的少数。用 CoT 做训练监督时,邻接类语句应当降权或过滤——这是数据集自带文档里最有实用价值的一条警示。

4.3 用途与边界

CoT 数据集的三个预期用途:推理增强分割模型的辅助监督、多模态对齐训练的中间表示、放射学空间推理教学素材。它的边界同样清楚:CoT 是 GPT-4o 的生成物而非放射科医师的原始思维记录,验证精度(0.92/0.75)给出了噪声上界;且 CoT 描述的是"如何到达"而非"为什么是病变"——病理逻辑推理不在其覆盖范围。

给准备直接使用 anatomical_cot.json 的人一张落地 checklist:

  1. 先按发现文本回对 dataset.json:CoT 条目与发现条目的关联键是发现文本/条目 ID,拿到手先验证对齐率,别假设 100% 命中。
  2. 邻接语句单独提取:把含"邻近/紧邻/adjacent/periplumonic"类断言的句子分桶,按 0.75 精度上界设计降权或过滤策略——不要把这些句子和普通描述混在同一个监督信号里。
  3. 对照 RadGenome 坐标复验:CoT 生成时的空间锚来自 RadGenome-Chest CT 的器官/肺叶边界框;如果你的用途对解剖位置敏感,可以拿同一坐标体系反向抽检。
  4. 教学用途可直接用:0.92 的内容对齐对教学场景足够,0.75 的邻接问题在教学里反而可以当"找错题"素材。

§5 评估与基准:现役模型的照妖镜

5.1 任务定义与指标

评测任务为文本提示 3D 分割:给模型一句自由文本发现 + 一个 CT volume,要求输出该发现的 3D 分割掩码。私有测试集 100 例(exhaustive 全量标注)为金标准,预测经 ReXRank 榜单提交评测。核心指标为 Dice 类重叠度与命中类指标(Global Dice、Global HIT Rate);官方脚本 rexrank_eval.py 的实例匹配逻辑见 5.5 与附录 G。

5.2 零样本:全部近零

论文在测试集上评测了三个现役文本提示 3D 医学分割模型:

模型 出处 零样本表现
BiomedParsev2 Microsoft(Nature Methods 2025) 近零
SAT 文本提示医学大词表分割(npj Digital Medicine 2025) 近零
SegVol 体医学通用交互分割(NeurIPS 2024) 近零

"近零"不是夸张修辞:这些模型在各自原生基准上表现优秀,但面对"把这句自由文本所指的范围画出来"时集体失灵。失灵原因论文归为任务本身的三个难点:自由文本的描述空间无界(不像固定类别)、非局灶病变边界模糊、3D 空间推理与语言理解的联合要求此前无监督数据可练。

5.3 SAT-FT:微调后的天花板在哪

在 ReXGroundingCT 训练集上微调 SAT 得到 SAT-FT:

指标 SAT-FT
Global Dice 0.209
Global HIT Rate 0.473

两个读法。乐观读法:从近零到 0.209,说明这个数据集携带了足以改造现有架构的监督信号——任务不是"无数据可学",而是"此前的数据不存在"。悲观读法:Dice 0.209 距离临床可用的 0.7+ 还有三倍以上的距离,HIT Rate 0.473 意味着一半的发现根本没被正确命中。论文自己的措辞是"substantial progress still to be made in terms of model architecture, data scale, and representation learning"——把改进空间明确留给了架构与规模,而非仅靠更多同质数据。

给这个数字配三层参照系,免得单独引用时失真:

  • 对比零样本(同模型不微调):substantial improvement——近零 → 0.209 是量级变化;
  • 对比临床需求(分割进入报告工作流):limited improvement——0.209 远低于可交付阈值;
  • 对比数据规模直觉:8,028 个文本-掩码对在通用分割语境里算小数据集,能撬动量级变化说明任务瓶颈在"监督信号的存在性"而非单纯数据量——这也是论文把改进方向指向架构与表征学习的原因。

写论文或数据卡引用 0.209 时,必须带上你选的参照系(坑 11 的直接推论):只写"微调后 Dice 0.209"不给参照系,读者会自行脑补出完全相反的结论。

5.4 MLHC 2025 派生论文:四模型全景 + 语气差异

MLHC 2025(PMLR)发表的派生评估论文《State-of-the-Art Text-Prompted Medical Segmentation Models Struggle to Ground Chest CT Findings》把评测扩到四个模型(MedSAM2、SegVol、SAT、BiomedParse),补充了两个论点:

  1. 非局灶是重灾区:弥漫性、自然语言描述的异常(间质改变、肺气肿)比局灶结节更难——现有模型主要为固定类别标签优化,对"描述性语言+不规则形态"的组合最不适应。
  2. 微调收益有限:“even finetuning these models with free-text descriptions yields limited improvement in segmentation accuracy”。

注意主论文与派生论文的语气差异:前者说微调"substantially improved"(SAT-FT 0.209 对比近零),后者说"limited improvement"(0.209 对比临床可用标准)。两个表述都对——参考系不同(对比零样本 vs 对比临床需求)。写综述时按参考系分开引用,别把"有限"和"显著"当矛盾(坑 11)。

5.5 评估脚本的版本细节

官方 rexrank_eval.py 有一个社区修订值得复现者注意(HF discussion PR #4,2026-03):

  • 原版:预测实例与 ground truth 实例之间用贪心匹配,并假设 GT 已预标实例 ID
  • 修订 PR:改用匈牙利算法做全局最优匹配(scipy linear_sum_assignment),预先计算重叠实例的 Dice 矩阵;GT 未预标实例时自动跑连通域标记

两个版本的 mean matched Dice 分数会有差异(最优匹配 ≥ 贪心匹配)。复现或对比榜单分数时,先确认所用脚本版本与榜单当前口径一致(坑 13)。

两个核心指标的计算口径,用一个迷你数例讲清楚(数字为构造例,非论文数据):

  • Global Dice:全体预测与全体 GT 的重叠度聚合。设某发现 GT 有 2 个实例( Dice 基础分别为 100、50 个体素),模型输出 2 个实例与 GT 分别重叠 60、30 体素,则该发现层面的 Dice 由匹配对(按 5.5 的算法配对后)计算——匹配质量直接进分数,所以"配对算法换成匈牙利"会系统性抬高分数。
  • Global HIT Rate:命中判定比 Dice 宽松得多——只要预测实例与任一 GT 实例的重叠超过阈值即算命中。0.473 的读法是"模型对一半左右的发现至少摸到了正确区域,但摸准(Dice 高分)的比例更低"。

由此得出评估解读的固定套路:HIT Rate 高而 Dice 低 = 定位大致对、边界粗糙(任务可学);两者都低 = 连区域都没找对(任务难)。本数据集上现役模型是后者,SAT-FT 后走向前者——这组指标搭配本身就是为"诊断模型差在哪一环"设计的。

5.6 与竞争资源的基准定位

把本数据集放回 5.6 之前的对比表再看基准属性:

属性 ReXGroundingCT PadChest-GR RadGenome-Chest CT OminiAbnorm-CT
模态 3D CT 2D X-ray 3D CT 2D CT 关键层面
语言 自由文本 句级 句子-区域对 异常描述
标注 手工体素+分层质控 手工 bbox 自动匹配 半自动
活榜单 rexrank.ai(私有测试集) 无 无 无
获取 gated=auto,CC BY-NC-SA 4.0 公开 公开 ML 付费授权

活榜单+私有测试集的组合使它成为四者中唯一"评测不可作弊"的 CT grounding 基准——训练集与验证集全公开,但 100 例测试集只存在于提交端。这个设计复制了 Kaggle 挑战赛的经典防泄漏架构,代价是使用者无法在本地复现测试集分数(只能信榜单)。

5.7 评测实操:三条路径的成本对比

路径 输入 得到什么 限制
本地验证集评估 val 50 例 + rexrank_eval.py 即时分数,可迭代 样本小、波动大;不能与测试集排名直接互比
榜单正式评测 预测掩码提交 rexrank.ai 测试集 100 例官方分数与排名 提交频率/规则以榜单为准;无本地 GT
复现论文基线 SAT 开源权重 + 训练集 SAT-FT 对标(Dice 0.209 / HIT 0.473) 需自备训练算力与 CT-RATE 影像;超参论文未全披露

实操顺序建议:先跑通本地验证集管线(脚本+50 例)→ 固化预处理/推理/后处理 → 再上榜单。榜单分数是稀缺资源(规则限制提交),把管线 bug 留在本地阶段解决。

§6 获取与许可:三道门与一个外置依赖

6.1 门禁与条款

HF rajpurkarlab/ReXGroundingCT 的访问属性(HF API 实测):

属性 值
license cc-by-nc-sa-4.0(与上游 CT-RATE 一致;arXiv 论文页 license 同为 CC BY-NC-SA 4.0)
gated auto——登录 + 同意条款后自动批准,无人工审核、无等待
private false
disabled false
downloads / likes 2,269 / 53(2026-09-29 抓取时点)
createdAt / lastModified 2025-07-24 / 2026-07-08

gated=auto 的实操含义:匿名脚本下载会直接收到"restricted"报错(本条目核验时 raw README 即被挡);huggingface-cli login 后同意数据集页面条款即可正常下载。CC BY-NC-SA 的 NC 条款意味着商用(含商业模型训练)被排除——与上游 CT-RATE 的许可链一致,不是本团队新增的收紧。

6.2 你拿到什么、缺什么

仓库内:dataset.json(主标注)、reports_dataset.json(标准化报告)、anatomical_cot.json(思维链)、两个版本变体 JSON(MICCAI 挑战赛/MLHC)、rexrank_eval.py 与 fast 版(评估脚本)、segmentations/ 下海量 nii.gz 3D 掩码。

仓库外(必须自备的三样):

  1. CT 影像本体——从 CT-RATE 官方渠道获取,按 volume id 对齐(坑 3 的主体)
  2. 私有测试集 100 例——不下发,只能经 rexrank.ai 提交预测
  3. 生成管线 prompts——在 GitHub rajpurkarlab/ReXGroundingCT(ct-rate-grounding-main 目录),不在 HF 仓库

6.3 AI-Ready 逐项评估

维度 表现
机器可读元数据 优——HF card + JSON 结构化标注 + 论文附录全表
格式开放性 优——JSON + NIfTI 皆为生态标准格式,无专有格式
获取门槛 中——gated=auto 有登录摩擦但不需审批;NC 许可排除商用
可复现评估 中上——脚本公开,但测试集私有、脚本有版本分叉(5.5)
数据完整性 中——训练集部分标注是刻意设计而非缺陷,但使用者必须理解 1.95/3.80 的深度差(坑 4)
上游依赖 弱点——CT 本体外置,对齐责任在使用者;CT-RATE 本身亦有获取条款

6.4 获取决策树

你要做什么?
├─ 本地训练 finding grounding 模型
│   → 1. HF 登录同意 → 下 dataset.json + segmentations/
│   → 2. 从 CT-RATE 取对应 volume → 按 id 对齐
│   → 3. 注意训练集 ≤3 实例/发现的协议(§3.3)
├─ 本地评估(不用榜单)
│   → 用公开验证集 50 例(exhaustive 标注)+ rexrank_eval.py
├─ 正式榜单评测
│   → rexrank.ai/ReXGroundingCT 提交(私有测试集 100 例)
├─ 研究 CoT 推理监督
│   → anatomical_cot.json;先读 §4.2 的 0.75 邻接精度警示
├─ 复现生成管线
│   → GitHub ct-rate-grounding-main(代码+prompts)+ 自己的 GPT-4 额度
└─ 商用训练
    → 停。CC BY-NC-SA 4.0 排除商用;商用授权需联系版权方

6.5 下载实务:镜像端点与分批策略

结合 hf-mirror.com 实测与 gated=auto 属性(坑 6),给出可照抄的操作序列(与附录 F 代码配套):

# 0) 环境变量:国内走镜像端点(本条目核验即走此通道)
export HF_ENDPOINT=https://hf-mirror.com

# 1) 一次性准备:网页登录 → 数据集页同意条款(gated=auto 即时放行)
#    https://hf-mirror.com/datasets/rajpurkarlab/ReXGroundingCT
# 2) 匿名访问会直接被拒:API 返回 "Access to dataset ... is restricted"
#    所以所有命令都必须带 token:huggingface-cli login 或 --token

# 3) 先下小文件探路(JSON + 评估脚本,体积小)
huggingface-cli download rajpurkarlab/ReXGroundingCT \
  --repo-type dataset --include "*.json" "rexrank_eval*.py" --local-dir ./

# 4) 确认 dataset.json 结构与 volume id 需求后,再按需分批下掩码
huggingface-cli download rajpurkarlab/ReXGroundingCT \
  --repo-type dataset --include "segmentations/train_100*.nii.gz" --local-dir ./

三条教训式提醒:其一,先 JSON 后掩码——掩码体积大且按 volume 分散,先读 dataset.json 确定你要哪些 id 能省大量带宽;其二,镜像端点也要 token——hf-mirror 只解决网络可达性,不解决门禁,别把"走镜像"当成"绕过登录";其三,变体 JSON 别乱用——MICCAI_challenge_dataset.json 与 MLHC_dataset_version.json 无官方文档(坑 10),拿不准就用主文件 dataset.json。

§7 生态与谱系:一个实验室的 CT 语言化布局

7.1 rajpurkarlab 的产出坐标

ReXGroundingCT 出自 Harvard Medical School 生物医学信息学系 Pranav Rajpurkar 实验室(rajpurkarlab)。把这个数据集放进实验室的产出序列里看,其位置非常清晰:

产出 类型 与本条目的关系
CT-RATE(Hamamci 等,arXiv:2403.17834) 上游影像数据集 3,142 volumes 的来源;一作 Hamamci(苏黎世大学)亦列名本文作者
RadGenome-Chest CT(Zhang 等,Scientific Data 2025) 同门区域级 grounding CoT 坐标来源;"自动区域匹配"路线的代表
ReXGroundingCT 手工体素级 grounding 本条目
ReXRank(PMLR 2025) 榜单基础设施 托管本数据集评测子榜
RadGame(arXiv:2509.13270) 放射教育平台 下游应用:用 grounding 数据训练医师定位技能
ReXplain(PMLR 2025) 患者视频报告 下游应用:把发现的空间位置可视化给患者
ReXGradient-160k(库内 rid 717) CMR 影像数据集 同实验室不同模态的姊妹数据集

实验室的路线是把"放射学语言与影像的空间连接"做成从数据(CT-RATE/RadGenome/ReXGroundingCT)到评测(ReXRank)到应用(RadGame/ReXplain)的垂直栈。ReXGroundingCT 是栈里承担"手工金标准"角色的那一层——RadGenome 走量(自动),ReXGroundingCT 走质(手工)。

7.2 协作网络与资助

  • 牵头:HMS DBM(一作 Mohammed Baharoon 与 Luyang Luo 共同一作;通讯邮箱 MohammedSalimAB@outlook.com)
  • 放射科人力:沙特利雅得 King Abdullah Specialized Children’s Hospital + King Abdulaziz Medical City(Alabbad、Alhazmi、AlOmaish 三位胸部放射科 MD)与加拿大 Royal University Hospital Saskatoon(Mistry、Adams)——val/test 的 board-certified 全量标注由这批人承担
  • 注释人力:圣路易斯大学医学院(8 名 BS 层作者)与专业注释员
  • 其他:Icahn Mount Sinai、Brigham and Women’s Hospital、KU Leuven(v2 新增 Bijnens)、复旦大学附属眼耳鼻喉科医院(v2 新增 Di Zhou)
  • 资助:韩国 KHIDI Boston-Korea Innovative Research Project(RS-2024-00403047)+ HMS Dean’s Innovation Award for Accelerating Foundation Model Research
  • 致谢:Dr. Abdulrhman Aljouie 促成沙特机构合作

作者名单的 v1→v2 变化(23→25 人,新增 Lucas Bijnens 与 Di Zhou)说明这个国际协作在预印本阶段仍在扩张;引用时以 v2/正式版名单为准(坑 2 关联)。

7.3 三个下游应用出口

论文 Figure 6 明确画出三个应用方向:

  1. 放射科教育(RadGame):用 grounding 任务训练年资医师的报告定位能力——"报告这句话画在哪个层面"本身就是教学内容。
  2. 患者沟通(ReXplain):把报告文字映射到影像空间后生成患者可理解的视觉化解释。
  3. 报告可视化:在给转诊医师的报告中嵌入空间标注叠加层。

三者共享同一个技术底座——本数据集训练出的 grounding 模型。这也是理解"为什么现役模型近零分还要发布基准"的钥匙:应用需求已经真实存在,瓶颈在模型能力,而能力瓶颈在监督数据。

7.4 在 CT grounding 景观中的位置

截至检索时点(2026-09),"语言→CT 空间"的公开资源呈三档分布:RadGenome-Chest CT 占据"大规模+自动"档;OminiAbnorm-CT 占据"多平面+付费"档;ReXGroundingCT 独占"手工+体素+免费(NC)"档。三档在规模与质量上互不覆盖——做规模实验去 RadGenome,做金标准评测与强监督训练来 ReXGroundingCT。附录 I 有完整对比表。

§8 方法学启示:四条可迁移的经验

8.1 语言侧 LLM、空间侧人类,按错误成本分工

本数据集最值得抄的架构决策:把语言处理(重写/抽取/分类)全交给 GPT 并用抽检验证错误率,把空间标注全留给人类并用分层质控兜底。语言任务的错误可以量化(0.99/0.92),空间任务的正确性只能靠人。任何"报告→标注"管线都适用这个分工原则。

8.2 排除规则是资产不是损耗

QC 排除的 1,984 个发现(10,012→8,028)没有被悄悄丢弃,而是按四条规则公开记账。四条规则(超范围/不可定位/不可分割/非病理)本身就是"临床语言可空间化"的操作性定义——对任何要做类似管线(超声报告、病理报告、内镜报告)的团队,这套规则可以直接改写复用。

8.3 部分标注协议 + 弱监督是显式契约

训练集"每发现 ≤3 实例"不是偷工减料,而是把标注预算花在刀刃上的显式设计——论文同时给出了消化方案(弱监督/半监督)与两组深度差(1.95 vs 3.80)供方法研究。数据集工程里"标多少"与"标什么"同样重要:明确的部分标注协议好过含混的全量宣称。

8.4 榜单+私有测试集防泄漏

100 例测试集不下发、只能提交评测的架构,把"在测试集上调参"这个学术顽疾从物理上堵死。代价是本地无法复现测试分数、依赖第三方服务可用性。对要建基准的团队,这是一套拿来即用的样板(对照:榜单由 ReXRank 基础设施承载,非项目自建)。

§9 与库内条目的关系

9.1 家族图谱

  • ct-rate(rid 546)——直接上游。本数据集的 3,142 个 volume、报告与人口学元数据全部来自 CT-RATE;影像本体必须从 CT-RATE 获取。两条目是"底座-精标层"关系,检索其一必查另一。
  • rexgradient-160k(rid 717)——同实验室(rajpurkarlab)姊妹条目。ReXGradient-160k 是心脏 MRI(梯度回波)大规模数据集,本条目是 CT grounding 数据集;两者共同展示该实验室"临床影像+语言"的方法论跨模态复制。
  • chest-imagenome(rid 330)——结构化定位路线的对照。Chest ImaGenome 给 CXR 做解剖结构级区域标注(固定类别),本条目给 CT 做自由文本发现定位;两者构成"结构化 vs 语言化"两条监督路线的配对样本。
  • radgraph(rid 561)/ radgraph2-radiology-reports(rid 622)——放射报告信息抽取邻居。RadGraph 处理报告的语言结构(实体/关系),本条目把报告语言连接到 3D 空间;语言侧的抽取对象一脉相承。
  • totalsegmentator(rid 422)——3D 分割工具参照。TotalSegmentator 提供解剖结构(104 类)的自动分割,本条目的 CoT 坐标引导所用的 organ 分割模型与其属同生态位;"解剖结构 vs 病灶发现"的分界清晰。

9.2 检索路径建议

  • 查"CT 报告短语定位/grounding"→ 本条目主读 §1/§5
  • 查 CT-RATE 衍生工作 → ct-rate(546) + 本条目 §2.1
  • 查 rajpurkarlab 系数据集 → rexgradient-160k(717) + 本条目 §7.1
  • 查"报告语言→影像空间"路线对比 → chest-imagenome(330) + 本条目 §2.7/附录 I
  • 查文本提示分割模型评测 → 本条目 §5 + ReXRank 榜单

9.3 六条互链的强弱与方向

五条 rid 关系不是同质的,写推荐语或做图谱时应区分强度与方向:

rid 关系类型 强度 方向
ct-rate(546) 数据依赖(上游底座) 强——没有 CT-RATE 本体本数据集不可用 单向:本条目依赖它
rexgradient-160k(717) 同源(同实验室) 中——方法论同源但模态不同(CT vs CMR) 双向互荐
chest-imagenome(330) 路线对照(结构化 vs 语言化) 中——方法学比较场景互引 双向对照
radgraph(561)/radgraph2(622) 任务邻居(语言侧抽取) 弱——只在"报告理解"主题下相关 单向:本条目语言侧参照
totalsegmentator(422) 生态位参照(解剖 vs 病灶) 弱——工具选型场景相关 单向:分界参照

实操上最重要的两条:用本数据集必须先看 ct-rate(546)(影像本体在那边);理解 rajpurkarlab 方法论建议配看 rexgradient-160k(717)——两者一个把"语言→影像空间"做到 CT 体素级,一个把"大规模临床影像获取+发布"做到 16 万例级别,合读能看清实验室"质"与"量"的两条腿。

9.3 关键词映射:检索者从哪进来

检索者画像 命中本条目的关键词 应读章节
分割模型工程师 text-prompted segmentation / SAT / SegVol / BiomedParse §5、附录 F/G
报告生成研究者 GRRG / grounded report generation / MAIRA-2 §0、§2.7
多模态对齐团队 vision-language alignment / CoT supervision §4
数据标注项目经理 annotation pipeline / QC protocol / HIPAA platform §3、§8、附录 H
综述写手 CT grounding dataset landscape §2.7、§7.4、附录 I
许可合规岗 CC BY-NC-SA / gated / CT-RATE license chain §6、附录 J

§10 避坑清单:十三个已踩过或必踩的坑

坑 1:分类模型双口径——GPT-4o 还是 GPT-4o-mini? NEJM AI 正式版正文写 “GPT4 omni (GPT-4o) categorized”;arXiv v2(修订更晚)写 “GPT-4o-mini categorized”,且 v2 附录的分类精度细节(F1 0.92)与 mini 表述自洽。本条目全篇采 arXiv v2 口径;引用 NEJM AI 版原文时注意此差异,别在综述里写成"两个模型各干了一遍"。

坑 2:作者数与名单随版本漂移。 arXiv v1(2025-07-29)23 位作者;v2(2025-10-27)25 位(新增 Lucas Bijnens[KU Leuven] 与 Di Zhou[复旦眼耳鼻喉科])。引用固定用 v2/NEJM AI 版名单;用 v1 名单核对投稿信会"少人"。

坑 3:CT 影像本体不在 HF 仓库。 仓库只有掩码(nii.gz)与文本(JSON)——CT volume 要另从 CT-RATE 获取并按 volume id 对齐。只下 HF 仓库然后困惑"掩码叠在哪"是新用户第一坑。

坑 4:训练集与评测集标注深度不同。 训练集每发现最多 3 个代表实例(均值 1.95 实体);val/test 为 exhaustive 全标(均值 3.80)。把训练集掩码当完整 ground truth 做全量监督会系统性低估多实例发现范围;论文建议弱监督/半监督方法。评测永远用 val/test(其标注深度与训练集不可比)。

坑 5:测试集 100 例不下发。 私有测试集只在 rexrank.ai/ReXGroundingCT 提交评测;本地能用的最大金标准是 50 例公开验证集。别在任何文章里写"测试集可从 HF 下载"。

坑 6:gated=auto 下载报 restricted 不是没数据。 匿名 curl/脚本直接下载会收到"Access to dataset … is restricted"——需 HF 账号登录+同意条款(自动批准)。国内网络环境建议配置 hf-mirror.com 镜像端点配合 token 使用。

坑 7:平均年龄双口径。 ReXGroundingCT 子集 42.08±14.52 岁 vs CT-RATE 全库 48.8 岁——前者是 3,142 volume 子集值,后者是 21,304 患者全库值。混用会虚构出"子集比全库年轻 7 岁"的假象(部分真实原因:子集是 volumes 非患者、时间窗不同)。

坑 8:“first” 宣称有四个限定词。 正确表述是"首个公开的手工标注、体素级、自由文本、胸部 CT grounding 数据集"。RadGenome-Chest CT(自动标注)、PadChest-GR(X-ray 2D)、OminiAbnorm-CT(2D+付费)都不满足全部四条件但各占一角;省略限定词的"第一个 CT grounding 数据集"是错误表述。

坑 9:segmentations 文件名 ID 不连续不是缺数据。 train_1008、train_10000、train_10001……的跳跃源于"按 CT-RATE ID 顺序分组抽样"——ID 本身随机分布。按文件名连续性对账会误报丢失。

坑 10:两个版本变体 JSON 用途未官方文档化。 MICCAI_challenge_dataset.json 与 MLHC_dataset_version.json 的存在暗示有 MICCAI 挑战赛变体与 MLHC 论文评估快照,但 README(gated 内)未见官方说明;复现 MLHC 论文数字时应优先用 MLHC_dataset_version.json 并在论文层面确认口径。

坑 11:微调效果两套语气。 主论文:“微调显著改善”(SAT-FT Dice 0.209 vs 零样本近零);MLHC 派生论文:“微调收益有限”(0.209 vs 临床可用)。参考系不同,都对。综述写作按各自参考系引用,别当矛盾打架。

坑 12:3,142 是 volume 数不是患者数。 unique 患者数论文未披露(CT-RATE 一 study 可多 volume)。“3,142 例患者"是无依据转述;人口学描述应写"3,142 个 volume,平均年龄 42.08±14.52 岁,男 55.9%”。

坑 13:评估脚本有贪心/匈牙利两代匹配。 rexrank_eval.py 原版贪心匹配,社区 PR(HF discussion #4,2026-03)改匈牙利最优匹配——两个版本的分数有系统差。复现或跨版本对比分数前先锁定脚本版本与榜单当前口径。

§11 总结

11.1 三句话总结

  1. ReXGroundingCT 用 3,142 个胸部 CT、8,028 个自由文本发现与 16,301 个手工 3D 分割实体,第一次把"报告语言→体素空间"的监督在 CT 上做实,并证明现役模型在这任务上近零分、微调后也只到 Dice 0.209。
  2. 它的"GPT 抽取语言侧+人工标注空间侧+四条排除规则公开记账"管线,是医学报告结构化数据集工程的可复制样板。
  3. 它的 gated 直链(CC BY-NC-SA 4.0)+ 私有测试集榜单(ReXRank)+ CoT 附加监督,构成一套完整的"训练-评测-进阶"基础设施——短板是 CT 本体外置与训练集部分标注,都要求使用者有数据工程能力。

11.2 适合谁

  • 文本提示 3D 分割模型团队:找自由文本监督与防泄漏金标准评测。
  • 可定位报告生成(GRRG)研究者:sentence-level grounding 是 GRRG 的前置能力,此为 CT 侧唯一手工金标准。
  • 弱监督/半监督分割方法研究者:训练集"≤3 实例/发现"的部分标注是天然的方法试验场(val/test 的 exhaustive 标注可直接量化方法收益)。
  • 医学数据集工程研究者:三阶段管线、QC 排除记账、双层标注协议都是活的案例。
  • 放射教育/患者沟通产品团队:RadGame/ReXplain 路线的现成数据底座。

11.3 不适合谁

  • 商用模型训练:CC BY-NC-SA 4.0 的 NC 条款是硬边界。
  • 期望开箱即用影像+标注全套的团队:CT 本体外置+gated 门禁+ID 对齐,没有数据工程能力会卡在第一步。
  • 只做固定类别病灶分割的项目:本数据集的价值在自由文本,固定类别有更省事的替代(LIDC-IDRI 等)。
  • 需要非肺胸膜(心、腹、骨等)发现标注的项目:QC 已把这些排除(1,047 项),本体虽有 12 类但掩码只在肺/胸膜。

11.4 30 秒决策卡

你的情况 行动
要立刻跑通一个训练循环 HF 登录同意 → 下 dataset.json + segmentations + CT-RATE 对齐(附录 F 骨架)
要本地评估不依赖榜单 公开验证集 50 例 + rexrank_eval.py(注意 §5.5 脚本版本)
要正式成绩 rexrank.ai/ReXGroundingCT 提交预测
要研究弱监督方法 读 §2.3 深度差与 §3.3 协议,用 val/test exhaustive 做上限对照
要复现生成管线 GitHub ct-rate-grounding-main + 自备 GPT-4 额度 + §8.1 分工原则
要写"CT grounding 数据集"综述 附录 I 对比表 + §10 坑 8 的限定词纪律
要商用 停——NC 许可;或联系版权方谈授权

11.5 三分钟阅读路线(按读者身份)

全文 1400+ 行,不同身份的读者不必通读。三条最短路径:

  • 赶时间的数据工程师(3 分钟):§1 十问 → §2.6 掩码结构 → §6.4 决策树 → 附录 F 代码。拿走这四块即可开工,坑 3/4/6/9 已内嵌提示。
  • 方法研究者(5 分钟):§5 全节(近零起点+SAT-FT+脚本代际)→ §2.3 双计数体系 → §8 四条启示 → 附录 Y 质量信号表。这四块决定你的实验设计与基线选择。
  • 综述/数据卡写手(5 分钟):§2.7 对比表 → §7 全节(谱系与生态位)→ §10 坑点清单 → 附录 L 双口径登记。这四块决定你转述时不会踩口径雷。

另外给三类"特殊访客"的直达条目:评审专家看附录 C 证据链;库内图谱/推荐系统看 §9.3 互链强弱表与附录 X;许可/合规岗看附录 J 与 Q25/Q26。

以上路线覆盖了条目的主要使用形态;若你的场景不在其中,按 §0 导读的分区表自由组装即可——每个 §2-§9 分区都设计为可独立阅读,前置依赖已用交叉引用标注。

FAQ(高频问答 44 问)

A. 基础认知

Q1:ReXGroundingCT 是挑战赛数据集吗?
不是挑战赛,但它带挑战赛架构:训练/验证集公开下载,测试集 100 例私有、经 ReXRank 榜单提交评测。仓库里的 MICCAI_challenge_dataset.json 暗示存在关联挑战赛变体(官方未文档化,坑 10)。

Q2:它和 RadGenome-Chest CT 什么关系?
同实验室(rajpurkarlab)的两条路线:RadGenome 用器官分割模型自动生成区域级掩码+句子匹配(走规模);ReXGroundingCT 用人工标注体素级掩码(走质量)。且 RadGenome 的器官/肺叶边界框是本数据集 CoT 数据集的坐标来源——两者互补而非竞争。

Q3:“grounding” 在这里指什么?
把一段自然语言描述"接地"到影像里的具体空间区域。本数据集的形态是:输入自由文本发现,输出 3D 体素掩码。区别于分类(只有类别无空间)、检测(框不是体素)与分割(无语言条件)。

Q4:为什么说现役模型"近零分"?谁测的?
论文作者团队在私有测试集上测的:BiomedParsev2、SAT、SegVol 三个现役文本提示 3D 分割模型零样本"near-zero performance across metrics"。MLHC 派生论文补测 MedSAM2 后结论一致。这不是孤例指控而是系统现象——任务此前无监督数据,模型自然没学过。

B. 数据与获取

Q5:数据集在哪个平台,怎么下?
HuggingFace rajpurkarlab/ReXGroundingCT。gated=auto:登录账号、在数据集页同意条款后自动批准。国内网络建议 hf-mirror.com 镜像端点 + token。匿名脚本下载会报 restricted(坑 6)。

Q6:下载的文件里为什么没有 CT 图像?
设计如此:仓库只含掩码(segmentations/*.nii.gz)与文本(dataset.json/reports_dataset.json/anatomical_cot.json)。CT volume 本体在 CT-RATE,按 volume id 对齐(坑 3)。这个拆分让标注层可以独立于影像层更新版本。

Q7:验证集和测试集我怎么用?
公开验证集 50 例:exhaustive 标注,本地评估直接用。私有测试集 100 例:不下发,把模型预测提交 rexrank.ai/ReXGroundingCT。论文口径的正式对比只在测试集上成立;验证集分数会因规模小(50 例)而波动大。

Q8:CT-RATE 本身怎么获取,有额外限制吗?
CT-RATE 经其官方渠道(arXiv:2403.17834 指引)申请获取,同为非商业许可。本数据集的许可链向上游传导——CC BY-NC-SA 与 CT-RATE 条款叠加生效。商用请两层数据一起看。

Q9:两个版本变体 JSON(MICCAI/MLHC)我要用哪个?
日常训练用 dataset.json;复现 MLHC 2025 论文数字用 MLHC_dataset_version.json;MICCAI 挑战赛口径未见官方文档,建议邮件作者确认(坑 10)。

Q10:数据多大,下载要多久?
仓库主体是 segmentations/ 下的海量 nii.gz(每个 volume 的每个发现实例一个文件),JSON 文本层很小。API 元数据未给总大小(README gated 内);建议先按 volume 增量拉取附录 F 的过滤式下载骨架,避免一次性全量。

Q11: masked 掩码和 CT 网格对不齐怎么办?
先核对是否用了同一重建版本(CT-RATE 一个 study 可多 volume,5.1 层厚 0.5-5.0 mm 差异大)。掩码与对应 volume 应同网格同尺寸;不一致优先查重建版本而非重采样——重采样会把体素标注弄脏。

Q12:能只下验证集吗?
可以。掩码按文件名前缀区分(val 前缀对应 50 例验证集);dataset.json 内含划分字段。快照下载配 allow_patterns 过滤即可(附录 F)。

C. 标注与质量

Q13:医学生标的能信吗?
训练集分两层:protocol 2 确实是医学生标注,但前提是专项训练+监督医师持续纠错+考核通过后才独立作业;protocol 1 是 1.5 年+经验专业注释员+放射科医师逐例 refine。val/test 全部 board-certified 放射科医师亲手标。论文 Limitations 明确承认训练集标注质量的变异性风险——这也是它把评测集纯度做满的原因。

Q14:为什么训练集每个发现只标最多 3 个实例?
工作量管理:8,028 个发现若全部 exhaustive,实体数会远超 16,301。论文把这个取舍写得很透明(“to manage annotation workload”),并给出两条出路:弱监督/半监督方法消化不完整标注;评测集(全标)可量化部分标注的影响。

Q15:QC 排除的 1,984 个发现去哪了?
按四条规则排除且公开记账:1,047 超出肺/胸膜范围、449 影像上无法定位、367 弥漫性不可分割、121 正常解剖/良性变异。没有暗箱丢弃;每条规则都有典型例子(§2.5)。

Q16:报告是真实报告吗?GPT 改过多少?
源头是真实土耳其语报告的机器翻译,但管线用 GPT-4 做了美式惯例重写(保留全部临床细节与测量)。100 份审计:0 假阳性、假阴性率 0.05/0.01、描述符遗漏率 0.14/0.13。需要逐字保真时回查 CT-RATE 原文。

Q17:CoT 数据集可靠吗?
150 例人工验证:内容对齐 0.92、邻接推断 0.75。它适合当辅助监督或对齐信号,不适合当金标准;邻接类语句(“邻近胸膜”)错误率最高,建议降权过滤(§4.2)。

Q18:我能给自己的数据套用这套标注协议吗?
协议要素全部公开可抄:双协议人员结构、≤3 实例的成本阀、四条排除规则、分层质控。但注意两个前提:HIPAA 合规平台的合规义务随数据来源变化;抽取阶段的本体是为胸部 CT 设计的,换模态要重建类目并与专家共识。

D. 评估与基准

Q19:SAT-FT 的 Dice 0.209 是什么水平?
对比系一:零样本近零 → 0.209 是"数据集有效"的证明。对比系二:临床可用 0.7+ → 还有三倍差距。两个口径都对,取决于你问"有没有用"还是"够不够用"。

Q20:评估脚本怎么算分的?
rexrank_eval.py 对预测与 GT 的 3D 实例做匹配后算 Dice 类指标。注意脚本有贪心(原版)与匈牙利最优匹配(社区 PR #4 修订)两代,分数有系统差(坑 13)。榜单当前口径以 rexrank.ai 为准。

Q21:为什么测非局灶(弥漫性)发现这么难?
三个原因叠加:边界模糊("肺含气减少"没有清晰轮廓)、描述空间无界(自然语言组合爆炸)、训练先验缺失(此前无此类监督数据)。21% 的 non-focal 占比保证了基准无法靠"只会圈结节"刷分。

Q22:榜单上现在有什么模型?
论文发布时点:零样本 BiomedParsev2/SAT/SegVol 近零,SAT-FT 领先(Global Dice 0.209、HIT Rate 0.473)。当前排名见 rexrank.ai/ReXGroundingCT——本条目不追榜单动态,时效性以榜单为准。

Q23:验证集分数和榜单分数差多少算正常?
没有官方换算——50 例验证集的统计波动远大于 100 例测试集(一个极端样本在验证集里权重是测试集的两倍)。合理做法是把验证集分数当方向舵、榜单分数当成绩单,两者差距 >5-10 个点时先查数据泄漏与预处理漂移。

Q24:微调需要什么算力量级?
论文未披露训练配置细节。参照系:SAT 主干与训练集 2,992 例 3D 体——单机多卡 A100 量级起步是保守估计;CoT 辅助与弱监督实验在此基础上增减。复现基线前先在验证集上对齐预处理。

E. 许可与复用

Q25:我能用它训练商业模型吗?
不能。CC BY-NC-SA 4.0 的 NonCommercial 条款排除商用训练;且许可链与上游 CT-RATE 叠加。商用需联系版权方(rajpurkarlab/HMS)谈授权。

Q26:基于它训的模型要遵守什么许可?
SA(相同方式共享)条款意味着衍生模型权重的许可边界需谨慎处理;论文与数据卡未给出模型权重豁免条款。稳妥做法:模型按同许可开源并注明数据来源,商用前征询版权方。

Q27:发论文怎么引用?
主引 NEJM AI(doi:10.1056/AIdbp2501220)或 arXiv:2507.22030(GitHub README 给出 bibtex:baharoon2025rexgroundingct);MLHC 评估论文与 ReXRank 按需分引。作者名单以 v2/正式版 25 人为准(坑 2)。

Q28:学术会议比赛能用它做赛道数据吗?
数据许可上 NC 条款不禁止学术比赛;仓库里 MICCAI_challenge_dataset.json 暗示作者侧已有挑战赛实践(细节未官方文档化)。办赛方应直接联系作者确认口径与测试集服务,别自行切分私有测试。

F. 库内与检索

Q29:库里和它最相关的是哪几条?
ct-rate(546) 上游影像底座、rexgradient-160k(717) 同实验室姊妹、chest-imagenome(330) 结构化定位对照、radgraph(561)/radgraph2-radiology-reports(622) 报告抽取邻居、totalsegmentator(422) 3D 分割工具参照(§9.1)。

Q30:检索时用什么关键词不会漏?
中:胸部 CT 短语定位/发现定位/可定位报告生成;英:ReXGroundingCT、phrase grounding chest CT、finding grounding、grounded report generation、text-prompted 3D segmentation。注意与 RadGenome-Chest CT、OminiAbnorm-CT、PadChest-GR 区分(坑 8)。

Q31:本条目与 rexgradient-160k 条目写作口径一致吗?
两者同出 rajpurkarlab 但互不覆盖:rexgradient-160k(rid 717)是心脏 MRI 梯度回波大规模数据集,本条目是 CT grounding 金标准。引用同实验室谱系时并列检索两条目,避免"同实验室=同任务"的误判(§7.1)。

Q32:本条目信息截至什么时候?
全部核验与抓取时点为 2026-09-29(HF downloads/likes、榜单状态、许可与门禁属性均此时点);榜单排名与 HF 计数随时变动,以当日页面为准。

G. 实操与复现

Q33:我想训练模型,最少要下载哪些文件?
dataset.json(主标注)+ segmentations/ 下你抽中的 volume 掩码 + 从 CT-RATE 取对应影像本体。reports_dataset.json 做语言侧预训练有用;评估脚本与验证集条目仅评测需要(附录 Q 有分场景下载范围表)。

Q34:验证集和测试集的掩码在 HF 仓库里能下到吗?
掩码文件以 train_ 前缀为主(抽中的 volume 属训练划分);验证集 50 例的标注以 JSON 条目形式提供,测试集 100 例完全不下发(坑 5)。以仓库 siblings 实际清单为准,别按文件名臆测。

Q35:dataset.json 的内部结构有文档吗?
官方 README 被 gated 挡住,匿名侧无法核验其字段文档(坑 6)。拿到文件后先看顶层键与一条完整记录再写解析器;不要按掩码文件名反推 schema,掩码命名只是交付形态不是数据模型。

Q36:能不能只做 2D 切片级实验?
掩码是 3D NIfTI,自切片后可跑 2D 模型,但任务定义降级、与榜单指标不可比;认真做 2D grounding 建议转向 OminiAbnorm-CT 或 PadChest-GR(§2.7/附录 I)。

Q37:训练时怎么处理"每发现 ≤3 实例"协议?
三条路(§3.3/§8.3):当全量标注硬训(引入系统欠标偏差,不推荐);按部分标注做弱监督/半监督建模(论文点名方向);或只用验证集 50 例全标数据做小样本评测。

Q38:本地验证集分数和榜单分数能换算吗?
没有官方换算——50 例验证集统计波动大(一个极端样本权重是测试集的两倍)。合理用法:验证集当方向舵、榜单当成绩单;两者差 >5-10 点先查预处理漂移与脚本版本(坑 13)。

Q39:我自己的 CT 数据能借用它的掩码吗?
不能直接用(掩码像素绑死 CT-RATE 网格),但可借用管线资产:GitHub 的重写/抽取 prompt、四条 QC 排除规则、双协议人员设计都可迁移(§8);换模态需重建本体(Q18)。

Q40:CoT 条目和 dataset.json 的发现能一一对上吗?
官方未文档化覆盖关系;使用前先跑关联键对齐率统计(§4.3 checklist 第 1 条),对不上的条目单独处理,别假设 100% 命中。

Q41:为什么掩码文件 ID 有缺口?
按 volume ID 顺序抽样的自然痕迹(坑 9):未抽中的 CT-RATE volume id 不在仓库里。按 id 列表过滤下载时先从 dataset.json 取合法 id 集合,不要按连续区间猜。

Q42:能拿它评"报告→掩码"端到端系统吗?
可以,这正是 GRRG 的 grounding 环节设计用途:报告语言侧可配 radgraph(561) 系工作,grounding 环节走本基准,指标用 HIT/Dice 并按 §5.5 的数例读法分开诊断。

Q43:微调时能把 CoT 文本混进去吗?
SAT-FT 原实验未用 CoT;混入属论文指出的待验证方向(§4.3)。动手前按 0.75 邻接精度上界过滤邻接类语句,并把"有/无 CoT"设成消融对照。

Q44:走 hf-mirror 下载还是报 restricted,为什么?
镜像只解决网络可达性,不解决门禁(坑 6):gated=auto 数据集必须先网页登录并同意条款,再用该账号 token 请求(§6.5 命令序列)。匿名 curl API 可以看到元数据,但文件下载一律要鉴权。

事实清单(硬事实 54 条)

  1. ReXGroundingCT 是首个公开的手工标注"自由文本发现→3D 体素级分割"胸部 CT 数据集(四限定词缺一不可)。
  2. 影像派生自 CT-RATE:按 volume ID 顺序分组抽取 3,142 个非对比胸部 CT volumes(ID 随机故近似随机样本)。
  3. CT-RATE 全库:25,692 studies / 50,188 volumes / 1,430 万+ 轴位层面 / 21,304 患者,伊斯坦布尔 Medipol Mega Hospital,2015-05 至 2023-01。
  4. 规模:8,028 个 segmented findings(text-to-3D pairs)+ 16,301 个独立分割实体。
  5. 模式分布:79% focal / 21% non-focal;最常见 focal = Pulmonary Nodules/Masses(占 focal 28.9%),最常见 non-focal = Emphysema(占 non-focal 27.7%)。
  6. 划分:train 2,992 / public val 50 / private test 100。
  7. 标注深度:训练集每发现均值 1.95 实体(协议限 ≤3);val+test 均值 3.80(exhaustive)。
  8. 患者画像(子集口径):平均年龄 42.08±14.52 岁;男 55.9%/女 44.1%。
  9. 扫描参数:层厚 0.50-5.00 mm;面内间距 0.30-0.98 mm;512×512 占 92.6%、768×768 占 7.2%、1024×1024 占 0.2%;每 volume 104-1,005 层(均值约 351)。
  10. 采集时间窗:2016-02 至 2022-11;全部非对比 CT。
  11. 三阶段管线:GPT-4 报告重写 → GPT-4 抽取 + GPT-4o-mini 分类 → 3D 像素标注。
  12. 报告重写示例:millimetric→subcentimeter;pleuroparenchymal sequelae→scarring/fibrosis;no space-occupying lesion→no lesion。
  13. 重写 QC:board-certified 放射科医师人工复核 50+ 份,全部判定可接受。
  14. 抽取保真度(100 份审计):假阳性 0;假阴性率 0.05(重写)/0.01(抽取);描述符遗漏率 0.14/0.13。
  15. 分类精度:GPT-4o-mini 12 类级 precision=recall=0.99;子类 F1 0.92(类别 1/2 的 100 findings 子集)。
  16. 本体:12 parent categories + 61 subcategories 两级(H=心脏/血管、L=肺/气道/胸膜、M=纵隔/肺门三域代码)。
  17. 数据分布口径:14 categories(8 focal + 6 non-focal)。
  18. QC 排除账目:10,012 初筛 → −1,047 超范围 − 449 不可定位 − 367 不可分割 − 121 正常变异 = 8,028(完美闭合)。
  19. 标注平台:HIPAA 合规云端平台;工具含笔刷、多边形、智能区域生长。
  20. 训练集双协议:protocol 1 = 1,400 例专业注释员(多数 >1.5 年经验)+放射科医师 refine;protocol 2 = 1,592 例医学生(专项训练+监督纠错至独立胜任)。
  21. val/test:board-certified 放射科医师独家全量标注。
  22. CoT 数据集:GPT-4o 生成 + RadGenome-Chest CT 器官/肺叶边界框坐标引导;文件 anatomical_cot.json。
  23. CoT 验证(150 findings,senior radiologist):alignment 0.92;adjacency 0.75(仅约 20% 案例含邻接推断)。
  24. 零样本评测:BiomedParsev2、SAT、SegVol 在私有测试集上近零性能。
  25. SAT-FT:Global Dice 0.209、Global HIT Rate 0.473。
  26. MLHC 2025 派生论文:评 MedSAM2/SegVol/SAT/BiomedParse;结论 non-focal 尤难、微调收益有限(对比临床可用系)。
  27. 榜单:rexrank.ai/ReXGroundingCT(ReXRank 子榜);私有测试集不下发。
  28. 评估脚本:rexrank_eval.py / rexrank_eval_fast.py;原版贪心匹配,社区 PR #4(2026-03)改匈牙利最优匹配+动态 GT 连通域。
  29. HF 属性:rajpurkarlab/ReXGroundingCT;license cc-by-nc-sa-4.0;gated=auto;createdAt 2025-07-24;lastModified 2026-07-08;downloads 2,269 / likes 53(2026-09-29 抓取)。
  30. 文件清单:dataset.json / reports_dataset.json / anatomical_cot.json / MICCAI_challenge_dataset.json / MLHC_dataset_version.json / rexrank_eval.py(_fast) / segmentations/*.nii.gz。
  31. 掩码命名模式:{split}{volume_id}_{实例序号}.nii.gz(如 train_10000_a_1.nii.gz);ID 不连续系按 ID 抽样所致。
  32. GitHub:rajpurkarlab/ReXGroundingCT(生成代码+prompts,目录 ct-rate-grounding-main,2 commits)。
  33. 论文:arXiv:2507.22030(v1 2025-07-29 23 作者;v2 2025-10-27 25 作者,新增 Bijnens、Di Zhou);NEJM AI doi:10.1056/AIdbp2501220。
  34. 团队:HMS DBM Rajpurkar 实验室牵头;共同一作 Mohammed Baharoon + Luyang Luo;通讯邮箱 MohammedSalimAB@outlook.com。
  35. 协作机构:SSM Health/圣路易斯大学、Icahn Mount Sinai、BWH、Royal University Hospital(加拿大)、KASCH+KAMC(沙特利雅得)、苏黎世大学(CT-RATE 一作 Hamamci)、KU Leuven、复旦眼耳鼻喉科(v2)。
  36. 资助:韩国 KHIDI(RS-2024-00403047)+ HMS Dean’s Innovation Award。
  37. 竞品划界:RadGenome(自动 organ 级)、OminiAbnorm-CT(2D+付费)、PadChest-GR(X-ray bbox)、RadGPT/AbdomenAtlas(腹部自动)、MedTrinity-25M(自动 25M)。
  38. 下游应用:RadGame(放射教育)、ReXplain(患者视频报告)、报告可视化。
  39. arXiv 论文页 license:CC BY-NC-SA 4.0(与 HF 数据集、上游 CT-RATE 一致)。
  40. 唯一患者数未披露:3,142 为 volume 数非患者数;CT-RATE 一 study 可多 volume。
  41. 训练集初筛发现 10,012 项来自全部 3,142 个 volume 的系统筛查,排除规则在标注前应用(449 项"不可定位"避免了无效标注人力)。
  42. 报告重写 QC 的 50 份复核为二元"可接受/不可接受"制,无中间分数;prompt 由团队与放射科医师多步协作设计。
  43. 抽取阶段明确排除三类内容:解释性语言、诊断推测、临床建议——只留可观察影像特征。
  44. 测量规范化规则:毫米值取整、厘米值保留一位小数;既往影像参照(稳定性/变化)作为独立字段保留。
  45. annotation 平台支持实时跨层面导航与窗位调节(Figure 4B 的元数据面板随发现联动显示自由文本描述)。
  46. MLHC 派生论文标题即结论:“Struggle to Ground”——SOTA 模型在非局灶、自然语言描述的发现上集体失利。
  47. 论文 Figure 1B 的类别分布按 focal/non-focal 分组统计;Figure B.1 给出各类平均 GT 体积占全肺体积比例(附录 B 素材)。
  48. HF 数据集描述卡原文写明 “8,028 findings across 14 different categories in 3,142 CT scans”——14 类口径在作者自己的数据卡上得到二次确认。
  49. 抽样方式为"按 volume ID 顺序分组抽取":CT-RATE 的 ID 随机分配,顺序抽取等价于随机抽样且可一键复核(§2.1)。
  50. 评估脚本社区修订(HF discussion PR #4,2026-03)引入 scipy linear_sum_assignment 做匈牙利最优匹配,并支持 GT 未预标实例时动态连通域标记。
  51. CoT 生成的空间锚来自 RadGenome-Chest CT 的器官/肺叶边界框坐标——CoT 的解剖位置断言有坐标引导,非纯文本想象。
  52. 训练集双协议例数:protocol 1 = 1,400 例、protocol 2 = 1,592 例,合计 2,992 例与训练划分严格闭合。
  53. 掩码交付格式为压缩 NIfTI(.nii.gz);文件名四段语法 {split}{volume_id}_{实例序号}(附录 F 解码表)。
  54. 本条目与 rexgradient-160k(rid 717) 同出 rajpurkarlab:前者 CT grounding 金标准(质),后者 16 万例 CMR 大规模数据集(量),合读可见实验室"质/量"两条腿(§9.3)。

术语表(46 条)

术语 释义
Grounding(定位/接地) 把自然语言描述映射到影像中具体空间区域的技术
Finding(发现) 报告中一条独立的影像学观察描述(文本侧计数单位)
Entity(实体) 一个发现在影像中对应的具体空间实例(掩码侧计数单位)
Focal / non-focal 局灶性(边界清晰的斑块/结节)/ 非局灶性(弥漫分布)异常模式
GRRG Grounded Radiology Report Generation,可定位放射报告生成
Sentence-level grounding 句级定位:以完整句子(非固定类别)为定位条件
Text-prompted segmentation 文本提示分割:以文本为条件输入的分割模型
CT-RATE 本数据集上游:公开"3D 胸部 CT+报告"多模态数据集(arXiv:2403.17834)
RadGenome-Chest CT 同实验室区域级 grounding 数据集:自动 organ 分割+句子匹配;CoT 坐标来源
层级本体 两级分类体系:12 父类 × 61 子类,覆盖肺/胸膜与全身非肺发现
H/L/M 代码 本体域前缀:H=心脏/血管,L=肺/气道/胸膜,M=纵隔/肺门
Exhaustive labeling 全量标注:所有可见实例全部勾画(val/test 协议)
Representative instances 代表性实例:每发现最多勾画 3 个(训练集协议)
Board-certified radiologist 执业资格认证放射科医师;val/test 独家标注者
Protocol 1 / Protocol 2 训练集双协议:专业注释员+医师 refine / 医学生受训后标注
QC 排除规则 四条:超范围、不可定位、不可分割、正常变异(10,012→8,028)
Anatomical CoT 解剖思维链:whole-CT→器官→肺叶→病灶的分步定位推理文本
Alignment / Adjacency CoT 两项验证指标:内容对齐精度 / 空间邻接推断精度(0.92/0.75)
RadGame 实验室放射教育平台:用 grounding 任务训练医师定位能力
ReXplain 实验室患者沟通项目:把报告发现可视化为患者友好视频
ReXRank 实验室榜单基础设施:托管 RRG 与本数据集 grounding 子榜
Global Dice / HIT Rate 分割重叠度指标 / 命中率(预测与任一 GT 实例重叠的比例)
贪心匹配 / 匈牙利匹配 预测-GT 实例配对的两种算法;后者全局最优,分数有系统差
NIfTI(.nii.gz) 神经影像与医学体积数据标准格式;本数据集掩码的载体
gated=auto HF 门禁模式:登录+同意条款后自动批准下载
CC BY-NC-SA 4.0 署名-非商业-相同方式共享;本数据集与上游 CT-RATE 的许可
hf-mirror.com HuggingFace 国内镜像端点;核验与下载的替代通道
MICCAI / MLHC 医学图像计算顶会 / 机器学习医疗顶会;本数据集两个版本变体 JSON 的关联会议
弱监督(weakly supervised) 用不完整/粗粒度标注训练的范式;论文建议其消化训练集 ≤3 实例协议
半监督(semi-supervised) 少量全标+大量弱标/无标混合训练;与弱监督同为论文点名的适配方向
树芽征(tree-in-bud) 细支气管周围呈树枝发芽状的非局灶模式;本体 1e 子类的典型形态之一
马赛克衰减(mosaic attenuation) 肺密度斑驳相间的非局灶表现;属 QC "不可分割"排除的典型例子
磨玻璃影(GGO) 肺内密度浅淡升高、不掩盖血管影的局灶/非局灶表现;本体 2c 子类
蜂窝肺(honeycombing) 胸膜下成簇囊腔的非局灶纤维化终末表现;本体 2f 子类
实例分割(instance segmentation) 区分同类不同个体的分割任务;本数据集"发现-实体"两级结构即其标注基础
连通域(connected component) 三维体素中相互连通的同一实体区域;评估脚本动态 GT 标记所用
snapshot_download huggingface_hub 的批量下载函数;allow_patterns 参数用于掩码分批(附录 F)
allow_patterns 下载过滤通配符;segmentations/train_100*.nii.gz 式按需取件
槽位(finding slot) 掩码文件名中 a/b/c 段:同一 volume 内不同发现的编号位(§2.6)
Non-contrast CT 非对比(不打造影剂)CT;本数据集 3,142 volumes 的统一采集口径
KHIDI 韩国健康产业振兴院;资助号 RS-2024-00403047(Boston-Korea 项目)
预印本版本(v1/v2) arXiv 同文两版:v1 2025-07-29(23 作者)→ v2 2025-10-27(25 作者);引用以 v2 为准
榜单子榜 ReXRank 主站下按数据集划分的评测分区;本数据集子榜为 rexrank.ai/ReXGroundingCT
描述符遗漏率 保真度审计指标:LLM 转述丢失细节描述的比例(重写 0.14/抽取 0.13)
假阴性/假阳性率 保真度审计指标:漏抽真实发现 / 无中生有;本管线 0.05·0.01 / 0
SAT Segment Anything in Text:文本提示 3D 医学分割模型;SAT-FT 为其在训练集微调版

附录

附录 A:条目信息速查卡

项 值
条目名 ReXGroundingCT
url_name rexgrounding-ct
类型 数据集+基准+管线论文(三合一)
论文 NEJM AI doi:10.1056/AIdbp2501220;arXiv:2507.22030
团队 HMS DBM Rajpurkar 实验室(rajpurkarlab)+ 8 机构
规模 3,142 volumes / 8,028 findings / 16,301 entities
许可 CC BY-NC-SA 4.0(gated=auto)
抓取时点 2026-09-29
库内互链 ct-rate(546)/rexgradient-160k(717)/chest-imagenome(330)/radgraph(561)/radgraph2-radiology-reports(622)/totalsegmentator(422)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 8 NEJM AI+arXiv+HF+GitHub+榜单五端可索引;名字唯一性好;但 README 被 gated 挡住影响匿名爬取
A 可获取性 6 gated=auto 门槛低但需账号;CT 本体外置需另取 CT-RATE;测试集私有
I 可互操作 8 JSON+NIfTI 标准格式;volume id 关联机制清晰;官方评估脚本公开
M 元数据质量 8 论文附录完备(本体全表/QC 账目/分布图);扣分:两个变体 JSON 无文档、患者数未披露
S 可持续性 7 学术机构+HF+活榜单;私有测试集依赖 rexrank.ai 服务在线;许可链绑定上游 CT-RATE
综合评级 7.4/10(良) 文档与格式质量高于均值;可获取性被"门禁+上游依赖+私有测试集"三连拖低

附录 C:逐项证据链自证

关键数字/事实 来源 位置/方式
3,142 volumes / 8,028 findings / 16,301 entities 论文摘要与 §3 arXiv HTML v2 全文
10,012→8,028 QC 账目 论文 §2.4 Quality control arXiv HTML v2 全文(四条减法原文)
1.95 vs 3.80 实体/发现 论文 §3 arXiv HTML v2 全文
42.08±14.52 岁 / 55.9% 男 论文 §3 arXiv HTML v2 全文
12 类 61 子类本体全表 论文附录 D arXiv HTML v2 全文转写
GPT-4o-mini 分类/F1 0.92/0.99 论文 §2.3 arXiv HTML v2 全文
SAT-FT Dice 0.209 / HIT 0.473 论文 §4 Results arXiv HTML v2 全文
CoT 0.92/0.75、150 例 论文 §2.5 arXiv HTML v2 全文
v1 2025-07-29 / v2 2025-10-27 arXiv 提交历史 arXiv abs 页
license cc-by-nc-sa-4.0 / gated auto / downloads 2,269 / likes 53 / createdAt / lastModified HF API hf-mirror.com API 2026-09-29
文件清单(dataset.json 等 8 类) HF API siblings hf-mirror.com API 2026-09-29
GitHub 仓库与 bibtex GitHub README 镜像 WebSearch 快照 2026-09-29
NEJM AI doi:10.1056/AIdbp2501220 NEJM AI 页面 WebSearch 快照 2026-09-29
MLHC 2025 四模型结论 PMLR/Google Scholar 条目 WebSearch 快照 2026-09-29
评估脚本匹配算法修订 HF discussion PR #4 WebSearch 快照(block 镜像)2026-09-29
资助号 RS-2024-00403047 论文 §8 Acknowledgement arXiv HTML v2 全文

附录 D:12 类 61 子类本体全表(论文附录 D 转写)

父类 子类
1) 典型非局灶肺/气道/胸膜异常 支气管壁增厚;支气管扩张;肺气肿(小叶中心型/间隔旁型/大疱型);间隔增厚(小叶间隔/网状);微结节(小叶中心/树芽/淋巴管周围);其他
2) 典型局灶肺/气道/胸膜混浊 线状(亚段肺不张、瘢痕、纤维化);肺不张/实变;磨玻璃影;肺结节/肿块;胸腔积液或胸膜增厚;蜂窝肺;气胸;其他
3) 非肺部病灶 淋巴结病;肝病灶;胆囊病灶;肾/集合系统/输尿管病灶;脾病灶;肾上腺病灶;胰腺病灶;甲状腺病灶;皮肤/皮下病灶;骨病灶;其他
4) 骨(非病灶) 骨折;退行性关节病/椎间盘退变/关节炎;脊柱曲度异常(驼背/侧弯);其他
5) 结石/器官钙化(非病灶) 肾结石/胆结石;肉芽肿;其他
6) 空腔脏器异常 食管裂孔疝;壁增厚;扩张;憩室(含憩室病);其他
7) 皮肤/皮下(非病灶) 皮肤增厚;条索影;腹壁疝(脐/腹股沟等);男性乳房发育;其他
8) 心血管 动脉粥样硬化(冠脉/非冠脉);血管瘤/扩张/增粗;血管闭塞或狭窄;心腔增大;瓣膜钙化;心包积液;其他
9) 体成分 内脏脂肪;浅表皮下脂肪;骨骼肌;骨质疏松;肝脂肪变;其他
10) 弥漫/全器官 器官增大(脾大/甲状腺肿/肺过度充气等);萎缩;其他
11) 器械 延伸器械(导管/起搏器除颤器/脊髓刺激器);手术夹;其他
12) 其他 —

注:QC 只保留肺/胸膜发现的标注(类别 1/2 为主),类别 3-11 在抽取阶段使用但对应发现多数被排除(1,047 项超范围)。

附录 E:QC 排除账目与深度差总表

项目 数值 出处
初筛发现总数 10,012 论文 §2.4
排除:超肺/胸膜范围 1,047 论文 §2.4
排除:影像不可定位 449 论文 §2.4
排除:弥漫不可分割 367 论文 §2.4
排除:正常/良性变异 121 论文 §2.4
保留(=8,028 校验) 10,012−1,984=8,028 本条目复算闭合
训练集实体/发现均值 1.95 论文 §3
val+test 实体/发现均值 3.80 论文 §3
训练集实体上限 3/发现 论文 §2.4 Entity Protocol

附录 F:数据获取与 CT 对齐骨架(代码)

# 1) HF 下载(gated=auto:先在网页登录并同意条款,配置 token)
#    国内建议:export HF_ENDPOINT=https://hf-mirror.com
from huggingface_hub import snapshot_download
snapshot_download(
    repo_id="rajpurkarlab/ReXGroundingCT",
    repo_type="dataset",
    token="hf_xxx",                      # 需已同意该数据集条款的账号 token
    local_dir="rexgroundingct",
    allow_patterns=["*.json", "rexrank_eval*.py"],  # 先下文本与脚本
)
# 2) 掩码按需下载(体积大,建议通配过滤)
snapshot_download(
    repo_id="rajpurkarlab/ReXGroundingCT", repo_type="dataset",
    token="hf_xxx", local_dir="rexgroundingct",
    allow_patterns=["segmentations/train_10000_*.nii.gz"],
)

# 3) CT-RATE 影像对齐(影像本体需按 CT-RATE 官方渠道另行获取)
#    关联键 = volume id:掩码文件名 train_{volume_id}_{finding}_{n}.nii.gz
import nilearn.image, json, os, re
ann = json.load(open("rexgroundingct/dataset.json"))
def volume_id(mask_path):            # 从掩码文件名解析 volume id
    m = re.match(r"train_(\d+)_", os.path.basename(mask_path))
    return int(m.group(1)) if m else None
# ct = nilearn.image.load_img(f"ct-rate/volume_{vid}.nii.gz")   # 伪代码
# mask = nilearn.image.load_img(mask_path)                      # 与 CT 同网格叠加
# 校验:mask.shape 与 ct.shape 应一致(同重建网格),不一致先重采样/查重建版本

附录 G:评估要点与实例匹配骨架(代码)

# 官方脚本:rexrank_eval.py / rexrank_eval_fast.py(HF 仓库随数据下发)
# 关键口径(论文+HF discussion PR #4):
#   - 指标:mean matched Dice / Global HIT Rate
#   - 原版:贪心匹配 + 假设 GT 预标实例 ID
#   - PR#4 修订(2026-03):匈牙利最优匹配 + GT 未标实例时动态连通域
import numpy as np
from scipy.optimize import linear_sum_assignment

def match_dice(pred_mask, gt_mask):
    """3D 实例最优匹配 Dice 骨架(教学用,正式评测用官方脚本)"""
    p_ids = np.unique(pred_mask)[1:]      # 0 为背景
    g_ids = np.unique(gt_mask)[1:]
    if len(p_ids) == 0 or len(g_ids) == 0:
        return 0.0
    score = np.zeros((len(p_ids), len(g_ids)))
    for i, p in enumerate(p_ids):
        for j, g in enumerate(g_ids):
            inter = np.sum((pred_mask == p) & (gt_mask == g))
            if inter:
                sp, sg = (pred_mask == p).sum(), (gt_mask == g).sum()
                score[i, j] = 2 * inter / (sp + sg)
    row, col = linear_sum_assignment(-score)   # 全局最优(对比原版贪心)
    return float(score[row, col].mean())

# 提交正式评测:把预测打包后提交 rexrank.ai/ReXGroundingCT(私有测试集 100 例)

附录 H:训练集双协议与人员分层总表

层 范围 标注者 质控 实体协议
train · protocol 1 1,400 例 专业注释员(多数 >1.5 年经验) 放射科医师逐例 refine(接受/改/退回) ≤3 代表实例/发现
train · protocol 2 1,592 例 医学生(专项训练+考核) 监督放射科医师持续纠错至独立胜任 ≤3 代表实例/发现
validation 50 例 board-certified 放射科医师 —(标注即金标准) exhaustive
test(私有) 100 例 board-certified 放射科医师 —(标注即金标准) exhaustive

附录 I:同类"语言→空间"数据集对比总表

资源 模态 空间形态 标注 规模口径 许可/获取 榜单
ReXGroundingCT 3D 胸部 CT 体素掩码 手工+分层质控 3,142 vol / 8,028 findings / 16,301 entities CC BY-NC-SA 4.0,gated=auto rexrank.ai(私有测试集)
RadGenome-Chest CT 3D 胸部 CT 区域掩码(organ 派生) 自动+句匹配 大规模(论文称 large-scale) 公开 无
OminiAbnorm-CT 多平面 CT(2D 关键层) 2D 半自动 全身异常中心 ML 用途付费授权 无
PadChest-GR 2D 胸片 边界框 手工 句级定位 公开(NEJM AI 2025) 无
LIDC-IDRI 3D 胸部 CT 结节轮廓 多专家 1,018 例、固定属性 公开 无
MedTrinity-25M 10 模态 ROI 自动(模型流水线) 2,500 万三元组 公开 无

附录 J:许可与条款细读

层 条款 实操含义
HF 数据集 CC BY-NC-SA 4.0(card 声明) 非商业;再分发需同许可;gated=auto 同意条款即授权
上游 CT-RATE 非商业口径(与其官方条款为准) 影像本体的使用约束向上传导;商用需两层同时放行
arXiv 论文页 CC BY-NC-SA 4.0 论文文本转述边界
评估脚本(repo) 随 GitHub 仓库(README 未单列,以仓库 LICENSE 为准) 复现评测用
私有测试集 不下发 只能榜单提交;无下载条款可谈

附录 K:坑点档案(与 §10 对照)

坑 一句话版 详见
1 分类模型 NEJM AI 版 GPT-4o vs arXiv v2 GPT-4o-mini——采 v2 §3.2
2 作者 v1 23 人→v2 25 人(+Bijnens、Di Zhou) §7.2
3 CT 本体不在 HF 仓库,另取 CT-RATE 按 id 对齐 §6.2
4 训练 ≤3 实例/发现 vs val/test exhaustive,1.95 vs 3.80 §2.3
5 测试集 100 例不下发,只能走 rexrank.ai §5.1
6 gated=auto:匿名下载报 restricted,登录同意即可 §6.1
7 42.08 岁子集口径 vs 48.8 岁全库口径,勿混 §2.2
8 "first"四限定词:手工/体素/自由文本/胸部 CT §2.7
9 掩码文件名 ID 跳跃=按 ID 抽样痕迹,非缺漏 §2.1
10 MICCAI/MLHC 两个变体 JSON 无官方文档 §6.2
11 微调"显著"(vs 零样本)与"有限"(vs 临床)双参考系 §5.4
12 3,142 是 volume 数非患者数(患者数未披露) §2.2
13 评估脚本贪心 vs 匈牙利两代匹配分数有差 §5.5

附录 L:双口径登记表

项 口径 A 口径 B 本条目采信
分类模型 NEJM AI:GPT-4o arXiv v2:GPT-4o-mini arXiv v2(修订更晚+附录自洽)
作者数 v1:23 v2:25 v2/正式版
类别数 本体 12 父类 61 子类 数据分布 14 类 并列陈述(§2.4/附录 D)
训练集标注描述 NEJM AI:QA by radiologists arXiv v2:双协议细节 arXiv v2
微调效果 substantial(vs 零样本) limited(vs 临床) 并列陈述(§5.4)
平均年龄 子集 42.08±14.52 CT-RATE 全库 48.8 各归各库
发表时间 arXiv v1 2025-07-29 NEJM AI 上线(日期待核) 都写,NEJM AI 不标日期

附录 M:与库内条目的关系声明

库内条目 rid 关系 边界
ct-rate 546 直接上游:影像+报告来源;本条目掩码按其 volume id 关联 CT-RATE 无 grounding 标注;本条目无影像本体
rexgradient-160k 717 同实验室(rajpurkarlab)姊妹数据集:CMR 模态 模态不同(CMR vs CT)、任务不同(梯度质量 vs grounding)
chest-imagenome 330 定位路线对照:结构化解剖区域 vs 自由文本发现 模态 CXR vs CT;标注形态区域表 vs 体素掩码
radgraph 561 报告语言抽取邻居(X-ray 实体/关系) 纯文本 vs 文本-空间联合
radgraph2-radiology-reports 622 同上,报告语料层 同上
totalsegmentator 422 3D 分割工具/解剖结构生态位参照 解剖结构 vs 病灶发现;自动 vs 手工

附录 N:缩写与 ID 约定速查

缩写/约定 全称/含义
GRRG Grounded Radiology Report Generation
CoT Chain-of-Thought(本条目特指 anatomical CoT)
SAT 文本提示医学大词表分割模型(npj Digit. Med. 2025)
SAT-FT SAT 在 ReXGroundingCT 训练集上的微调版
SegVol 体医学通用交互分割模型(NeurIPS 2024)
BiomedParsev2 Microsoft 生物医学联合分割检测识别基础模型 v2
MedSAM2 医学 SAM 系列第二代
KHIDI 韩国保健产业振兴院(资助方)
DBM Department of Biomedical Informatics(HMS)
KASCH / KAMC King Abdullah Specialized Children’s Hospital / King Abdulaziz Medical City(沙特协作医院)
train_{f} 掩码文件名约定:划分_volume id_发现槽位_实例序号
H/L/M 本体域前缀:心脏血管/肺气道胸膜/纵隔肺门

附录 O:维护计划与触发点

触发点 动作
NEJM AI 卷期/发表日期公开 更新 §2 时间线与附录 L(消除"待核")
MICCAI 挑战赛官方口径公开 更新坑 10 与 §6.2(变体 JSON 用途)
rexrank.ai 榜单出现显著刷新(如 Dice >0.3) 更新 §5 现状段落与 INFOBOX 基准行
HF gated 条款或 license 变更 重核 §6.1 全表
unique 患者数官方披露 更新 §2.2 与坑 12
CoT 总条数官方披露 更新 §4 与事实清单 22 条
GitHub 仓库新增 commit(当前 2 commits) 复查生成代码与 prompts 是否与论文一致
检测到锁外写入(本次成稿期间附录 X/Y/Z 与事实 49-54 条由协同写入者补充,内容与 FACTS 核验一致) 后续修订前先刷新 .lock 租约并全文 diff,防双写漂移

附录 P:报告重写前后对照示例(论文 §2.2 原例转写)

重写前(翻译腔/土耳其惯例) 重写后(美式惯例) 改写类型
millimetric nodule subcentimeter nodule 尺寸术语标准化
pleuroparenchymal sequelae scarring / fibrosis 术语直译改为临床惯用
no space-occupying lesion no lesion 冗长否定式压缩
(含与解读无关的语句) 删除 简洁性清理

对照原则:全部改写不触碰临床细节、测量值与解剖参照——QC 的"可接受"判定即以此为准绳。

附录 Q:数据划分与下载范围对照表

划分 volume 数 标注深度 标注者 HF 可下 用途
train 2,992 ≤3 实例/发现(均值 1.95) 注释员/医学生+质控 是 训练
validation 50 exhaustive(均值 3.80) board-certified 是 本地评估
test 100 exhaustive board-certified 否(榜单) 正式排名

附录 R:使用场景 × 数据组件矩阵

场景 dataset.json reports cot.json segmentations CT 本体 eval 脚本 榜单
训练 grounding 模型 必用 选 选 必用 必用 — —
本地评估 必用 — — 必用(val) 必用 必用 —
榜单评测 — — — —(自产预测) — 建议 必用
CoT/推理研究 必用 选 必用 选 选 — —
管线复现研究 参考 必用 参考 — — — —
综述/景观写作 — — — — — — 参考

附录 S:CT-RATE → ReXGroundingCT 字段与 ID 映射

层 CT-RATE 侧 ReXGroundingCT 侧 关联键
影像 volume(非对比胸部 CT) 掩码文件名内嵌 volume id {split}_{volume_id}_{f}_{n}.nii.gz
报告 土耳其语原文→机器翻译英文 GPT-4 美式标准化重写版(reports_dataset.json) volume id
患者 人口学元数据 年龄/性别统计口径(子集重算) 经 volume 间接到 study
抽样 25,692 studies / 50,188 volumes 3,142 volumes(按 ID 顺序分组) CT-RATE ID 升序

附录 T:下游应用链路详述(RadGame / ReXplain / 报告可视化)

链路 输入 本数据集提供 输出
RadGame(教育) 报告句子 + CT grounding 监督:句子→掩码对照 医师定位训练/评分
ReXplain(患者) CT + 报告 发现的空间位置参照 患者友好视频报告
报告可视化 新报告 + CT grounding 模型(本数据训练) 报告叠加空间标注层

三条链路共享同一个能力内核——“自由文本→3D 空间”。这也是论文把教育/患者/临床沟通三场景画进 Figure 6 的逻辑:能力内核一旦可训练,应用端是复用关系而非各建各的。

附录 U:版本与发布时间线总表

时点 事件
2025-07-24 HF 数据集创建(createdAt)
2025-07-29 arXiv v1 提交(23 作者,1,500 KB)
2025-10-07(报道时点) MLHC 2025 派生评估论文(PMLR)
2025-10-27 arXiv v2 修订(25 作者,1,704 KB;新增 Bijnens、Di Zhou)
2026-03 HF discussion PR #4:评估脚本改匈牙利匹配
2026-07-08 HF lastModified(最新仓库变更)
检索时点已上线 NEJM AI 正式版(doi:10.1056/AIdbp2501220,确切日期待核)
2026-09-29 本条目全部核验与抓取时点

附录 V:gated=auto 下载故障排查

症状 原因 处置
“Access to dataset … is restricted. You must have access … Please log in.” 未登录(匿名请求) 网页登录 → 数据集页同意条款 → 配 token 重试
401/403(已登录) token 未带或未同意该数据集条款 huggingface-cli login;确认数据集页显示已获准
下载慢/断流 主站在部分网络不可达 export HF_ENDPOINT=https://hf-mirror.com 走镜像
segmentations 抓不全 全量体量大、长任务中断 附录 F 的 allow_patterns 按 volume 增量拉取
掩码与 CT 尺寸不一致 CT-RATE 重建版本不匹配 按 volume id 核对重建版本,勿盲目重采样

附录 W:BibTeX(GitHub README 口径)

@article{baharoon2025rexgroundingct,
  title={ReXGroundingCT: A 3D Chest CT Dataset for Segmentation of
         Findings from Free-Text Reports},
  author={Baharoon, Mohammed and Luo, Luyang and Moritz, Michael and
          Kumar, Abhinav and Kim, Sung Eun and Zhang, Xiaoman and
          Zhu, Miao and Alabbad, Mahmoud Hussain and
          Alhazmi, Maha Sbayel and Mistry, Neel P and others},
  journal={arXiv preprint arXiv:2507.22030},
  year={2025}
}

正式发表后建议改引 NEJM AI(doi:10.1056/AIdbp2501220)并按正式版权威名单核author 字段;MLHC 派生论文另引(PMLR 卷期以其官网为准)。

附录 X:与 rexgradient-160k(rid 717)的条目互链对照

两个同实验室条目的写作口径对照,供库内图谱与推荐系统使用:

维度 ReXGroundingCT(本条目) ReXGradient-160k(rid 717)
模态与任务 胸部 CT + 报告;体素级 grounding 心脏 MRI(梯度回波);大规模影像库
规模 3,142 volumes / 8,028 findings(小而深) 16 万例级别(大而广)
标注形态 手工 3D 掩码 + 分层质控 影像+元数据(标注深度另见其条目)
实验室角色 "质"路线:金标准评测 "量"路线:基础模型预训练底座
获取 gated=auto,CC BY-NC-SA 4.0 见其条目许可节
互链建议 引"同实验室不同模态姊妹" 引"同实验室 CT 金标准"

合读价值:两者共同展示 rajpurkarlab 的方法论复制能力——把"临床影像+语言/元数据"的配方跨模态(CT↔CMR)、跨规模(3千↔16万)落地。检索"rajpurkarlab 系数据集"时两本条目应成对出现,避免"同实验室=同任务"误判(Q31)。

附录 Y:标注质量信号汇总表

全文散落的质量数字集中登记(均为论文/审计口径,抓取时点 2026-09-29):

信号 数值 覆盖对象 解读
重写人工复核 50+ 份全部可接受 阶段 1 定性通过,非量化抽检
重写假阳性/假阴性 0 / 0.05 100 份审计 重写不无中生有,略漏
抽取假阳性/假阴性 0 / 0.01 100 份审计 抽取为质量峰值点
描述符遗漏率 0.14 / 0.13 重写/抽取 LLM 转述的主要损耗
父类分类 P=R 0.99 GPT-4o-mini 12 类级几乎全对
子类分类 F1 0.92 类别 1/2 各 100 条 61 子类级可接受
CoT 对齐精度 0.92 150 findings 内容基本忠实
CoT 邻接精度 0.75 150 findings(约 20% 含邻接断言) 邻接语句需降权
训练集标注深度 1.95 实体/发现 双协议(≤3 上限) 部分标注契约
评测集标注深度 3.80 实体/发现 val+test(exhaustive) 金标准全标
QC 账目闭合 10,012−1,984=8,028 全数据集 四条规则可复核

使用说明:本表是全文质量数字的唯一汇总视图——引用任何一个"审计/精度/深度"数字前,先到此表对一遍口径与覆盖对象,再回正文取上下文;表内"解读"列是使用立场(如邻接语句降权),不是论文原话,转引时注意区分。

附录 Z:常见错误用法 Top 12(与坑点档案互补)

从"错误用法"视角反向登记(坑点档案讲"事实口径",这里讲"动作禁令"):

  1. ❌ 把 3,142 当患者数写进论文 → ✅ 写"3,142 个 CT volumes"(坑 12)。
  2. ❌ 用 42.08 岁描述 CT-RATE 全库人群 → ✅ 标明"本子集口径"(坑 7)。
  3. ❌ 引用"首个胸部 CT grounding 数据集"丢限定词 → ✅ 四限定词全带(坑 8)。
  4. ❌ 匿名 curl/直接下文件 → ✅ 登录同意条款 + token(坑 6)。
  5. ❌ 只下掩码不取 CT-RATE 本体就开跑 → ✅ 先确认影像可得性(坑 3)。
  6. ❌ 把训练集当全量标注做实例分割监督 → ✅ 弱监督建模或换评测集(坑 4)。
  7. ❌ 本地拿 MICCAI/MLHC 变体 JSON 当主数据 → ✅ 用 dataset.json(坑 10)。
  8. ❌ 转述"微调显著提升"不给参照系 → ✅ 双参照系并列(坑 11)。
  9. ❌ 贪心版脚本分数直接对比榜单 → ✅ 核对脚本代际(坑 13)。
  10. ❌ CoT 邻接语句直接当金标监督 → ✅ 0.75 上界,先过滤(§4.2)。
  11. ❌ 按连续 ID 区间下载掩码 → ✅ 从 dataset.json 取合法 id 集合(坑 9)。
  12. ❌ 商业产品直接 NC 训练 → ✅ 双层许可(本集+CT-RATE)先谈授权(附录 J)。

维护说明:本条目抓取与核验时点为 2026-09-29;触发更新的三类事件与响应动作见附录 O 维护计划。双口径登记(附录 L)与坑点档案(附录 K)是本条目的两条"防漂移"锚:新增信息先对这两表查重,再决定进正文还是进存照。

写作边界声明:本条目所有关键数字与口径均可回溯到三类来源(arXiv v2 全文、HF API 元数据、GitHub 仓库),未采信任何二手转述;无法双源确认的信息一律进附录 L 存照而非正文断言。条目正文与 FACTS.md 构成"成稿+底稿"对:FACTS.md 九节保存证据细节与存照全文,正文只保留成稿口径。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • lnq — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准 / 肺癌
  • ct-rate — 共享标签:医学影像 / CT / 影像-文本对齐 / 肺癌
  • chexlocalize — 共享标签:医学影像 / 医学图像分割 / 评测基准 / 肺癌
  • ctooth — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准
  • openi — 共享标签:医学影像 / 影像-文本对齐 / 评测基准
  • lctsc — 共享标签:医学影像 / CT / 医学图像分割 / 肺癌
  • 3dircadb — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准
  • toothfairy2 — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准
  • curvas — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准
  • toothfairy3 — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集