信息速览
INFOBOX:chexstruct-cxreasonbench 速览
| 键 | 值 |
|---|---|
| 名称 | CXReasonBench: A Benchmark for Evaluating Structured Diagnostic Reasoning in Chest X-rays(v1.0.1) |
| 上线 | PhysioNet,2025-10-23(1.0.0 为 10-15),DOI 10.13026/d14j-1b45,Challenge 类型 |
| 论文 | arXiv:2505.18087,NeurIPS 2025 Datasets & Benchmarks Track |
| 团队 | KAIST(Lee/Choi/Yoon/Choi)+ 首尔大学医院 + 首尔医疗中心;资助含 MSRA 与韩国 IITP/KHIDI/NRF |
| 两部分 | CheXStruct 管线(12 诊断任务+3 全局过滤,15 CSV)+ CXReasonBench 基准(1,200 case / 18,988 QA) |
| 评测设计 | 初始决策(Yes/No/IDK)→ Path 1 四阶段直评 / Path 2 引导 / Re-evaluated 内化重测;错即终止 |
| 视觉输入 | 每 QA 最多 4 图(原图/掩码叠加/landmark 叠加) |
| 结果 | 12 个 LVLM 全线挣扎:结构化推理与泛化双弱 |
| 访问 | Credentialed(DUA 1.5.0+CITI);MIMIC 源在 PhysioNet、其余三源在 HuggingFace |
| 一句话 | 把"心胸比怎么算出来的"变成 18,988 道可判分的题——LVLM 的临床推理第一次被逐环节审计 |
§0 摘要卡:给"推理过程"装上评分器
LVLM(大型视觉语言模型)在胸片上的评测长期停留在"最终答案对不对"——一个 AUC、一个准确率,模型内部到底有没有走"识别心界→量心宽胸宽→算比值→对照阈值"这条临床路,评测者无从知晓。CXReasonBench 的做法是把这条临床路逐环节产品化:CheXStruct 管线用分割→landmark→测量→指数→阈值的自动化链路,为每张图生成每一步的参考答案;CXReasonBench 再把 1,200 个案例变成 18,988 道 QA,按"初始决策→准则选择→解剖区识别→测量计算"四阶段逐级判分,答错即终止——就像临床教学里的口试,第一步的根基错了,后面再漂亮也不给分。
两个设计细节最见功力:其一,"I don’t know"是被评测的能力——模型自认不确定会被导向 Path 2(引导推理)而非判错,"知道自己不知道"在临床语境是美德;其二,引导后的重测(Re-evaluated Path 1)——考的是模型能否把学到的推理内化到新案例,这是"教得会"与"背答案"的分水岭。结果:12 个最强 LVLM 全线挣扎,最强者也无法把抽象临床准则可靠地接到解剖视觉证据上——这份全线挣扎的诊断书,正是这个基准的价值证明。
§0.1 名称与口径声明
四条口径纪律:其一,CheXStruct 与 CXReasonBench 是一体的两部分——前者是"参考答案工厂"(管线+结构化输出),后者是"考场"(QA 基准),PhysioNet slug 里两个名字并列就是提醒别拆开用;其二,"case"与"QA pair"严格区分——1,200 case(每任务 100 例)× 平均约 15.8 QA/case = 18,988 QA;其三,数据源按平台分口径——PhysioNet 版只含 MIMIC-CXR-JPG 源(dicom_id 对齐),HuggingFace 版含 NIH CXR14/VinDr-CXR/OpenI 三源,全集=两版合取(合规驱动的分裂,§2.7);其四,v1 与 v2 论文的被测模型数不同(10→12),引用结果时注明版本。
§0.2 读者收益清单
- LVLM/医疗多模态团队:第一个"评中间步骤"的胸片基准——你的模型到底卡在哪一环(准则不知道?解剖区认不出?测量算不对?),错误定位到阶段。
- 医疗 AI 评测工程师:三路径+错即终止的评测协议是"可解释评测"的现成工程模板,可移植到任何"有临床推理链"的任务。
- 临床信息学教学:四阶段评测设计与临床读片教学(先定标准再看结构后测量)同构——现成的"AI 也这么学"教学案例。
- 数据集方法学研究者:PhysioNet+HuggingFace 双栖发布、Challenge 类型条目、8 天勘误周期——平台策略与维护节奏的新样本。
- 复现者:GitHub 有评测代码、HF 有开源三源、NeurIPS 论文有全部参考答案定义——审稿人想查哪环都有出处。
§0.3 本条目与其他条目的阅读组合
| 组合 | 适用问题 |
|---|---|
| 502 CheXmask + 本条目 | “掩码除了画轮廓还能干什么?”——CheXStruct 的分割→测量→阈值正是掩码层的官方级应用范式 |
| 本条目 + 505 CDSL | “推理步骤评测 vs 结构化输出评测”——批次五的评测双塔(§6.13 对照) |
| 本条目 + 495/492(MIMIC 生态) | “评测 case 与 MIMIC 报告/临床表怎么联动”——QA 的 dicom_id 全键对齐 |
| 本条目 + 503 CheXmask-U | “不确定性×推理评测”——高不确定区的 QA 表现分层(§7.5 设想) |
| 本条目 + 501 CXLSeg | “像素级分割模型 vs LVLM 的推理能力”——两条技术路线的互补审计 |
§0.4 身份卡:一条命令背下这个数据集
| 键 | 值 |
|---|---|
| 全名 | CXReasonBench(v1.0.1)——CheXStruct 管线 + CXReasonBench 基准 |
| 上线 | PhysioNet 2025-10-23,DOI 10.13026/d14j-1b45,Challenge 类型,Credentialed |
| 论文 | arXiv:2505.18087,NeurIPS 2025 D&B Track |
| 团队 | KAIST + 首尔大学医院 + 首尔医疗中心六人(Edward Choi 组) |
| 规模 | 12 任务 × 100 case = 1,200 case;18,988 QA(8,044+3,600+7,344) |
| 任务 | 8 放射学发现(心扩大/纵隔宽/隆突角/气管偏移/主动脉三件套/迂曲)+4 图像质量(包含性/吸气/旋转/投照) |
| 评测 | 三路径四阶段,错即终止,每 QA ≤4 视觉输入 |
| 结果 | 12 LVLM 全线挣扎——最强者也无法可靠连接准则与解剖证据 |
| 访问 | Credentialed(DUA 1.5+CITI);MIMIC 源 PhysioNet、三源在 HF |
| 一句话 | 系列第一个 Challenge 型条目:掩码层管"是什么",这里管"AI 会不会像医生一样想" |
§1 出身与谱系:从 KAIST 实验室到 PhysioNet 的推理评测
§1.1 团队构成:机器学习实验室 + 两位临床专家
六人署名的结构值得细看:KAIST 四人(一作 Hyungyung Lee、Geon Choi、Hangyul Yoon、通讯 Edward Choi——KAIST 的医疗 NLP/多模态组,之前有 Lunguage 等胸片结构化工作)+ Seoul National University Hospital 的 Jung-Oh Lee 与 Seoul Medical Center 的 Hyuk Gi Hong 两位临床专家。版本页 Methods 明确写"12 diagnostic tasks in collaboration with clinical experts"——准则选择(CTR 阈值、气管偏移的判定标准)由医师定锚,管线由工程师实现。这个配比在"结构化推理"赛道是必需品:参考答案的每一步都要经得起放射科医师的推敲,纯工程团队做的"伪临床链"会被 Stage 1.5(专家定义准则)这种环节当场戳穿。资助结构(MSRA + 韩国三机构)是韩国 AI 学界的标准配置,MSRA 的出现暗示与微软系模型评测的潜在关联。
§1.2 学术时间线:五个月从 arXiv 到 NeurIPS
2025-05-26 arXiv v1 提交 → 2025 年末 NeurIPS 2025 Datasets and Benchmarks Track 接收(San Diego,12 月 2-7)→ 2025-10-15 PhysioNet v1.0.0 → 2025-10-23 v1.0.1 勘误 → 2025-10-27 arXiv v2(被测模型 10→12 扩编)。这条时间线的读法:论文先行(5 月)→ 数据平台后挂(10 月)——与 502 CheXmask 的"论文先行八个月"节奏同型,但 NeurIPS D&B 的接收让"论文"的分量更重(D&B Track 是基准类工作的最高阵地之一)。对使用者的含义:方法学的同行评审已由 NeurIPS 完成,PhysioNet 版本页与论文互为背书——引用时两者都给(PhysioNet DOI+论文)。
§1.3 与既有基准的代差:从"答对了吗"到"怎么答对的"
论文 Background 对既有基准的诊断:VQA-Med、报告生成类评测都在评"最终输出",少数带解释或 grounding 的工作(bbox-语句对等)也仍聚焦输出而非中间步骤。CXReasonBench 的代差在评测对象的颗粒度:把"心扩大吗?"这一题拆成"你用的准则是 CTR>0.5 吗(Stage 1)→ 你看的是心影和胸廓吗(Stage 2)→ 你算的比值在哪个区间(Stage 3)"三道子题。这个拆法的前提是推理链的确定性——胸片结构诊断恰好有临床共识的固定推理链(不像报告生成那样路径发散),这是它选这 12 个任务的原因(“diagnosable from chest X-rays alone”)。代差的代价也在此:任务面窄——需要临床史的任务(肺炎)被明确排除。
§1.4 CheXStruct 管线的五级流水线
管线是本集的"答案工厂",五级顺序:① 解剖分割(心、纵隔、主动脉、气管等结构掩码)→ ② 解剖 landmark(心界端点、胸廓端点、气管走行点等)→ ③ 诊断测量(心宽、胸宽、隆突角等)→ ④ 诊断指数(CTR=心宽/胸宽等)→ ⑤ 临床阈值判定(专家定义的 cut-off)→(附加)⑥ 任务级质控过滤。每级都有 QC:全局过滤三件套(mask_number 掩码计数防"非胸片"、abdominal_xray 腹盆混入检测、window 后处理伪影检测)先拦脏图,任务级 QC 再按专家指南筛测量可靠的图。对本系列的熟悉感:①-③ 正是 502 CheXmask 掩码层的用武之地——CheXStruct 的分割源代码与 502 生态的兼容性是"掩码层应用范式"的直接证据(§2.5)。
§1.5 12 个任务的选择逻辑
任务面分两组:放射学发现 8 项——心扩大(CTR)、纵隔增宽、隆突角、气管偏移、主动脉结增大、升主动脉增大、降主动脉增大、降主动脉迂曲——全部满足三个入选标准:胸片可独立诊断(不需临床史)、有可量化的推理链(测量→指数→阈值)、有临床共识的准则。图像质量 4 项——包含性(inclusion)、吸气水平、旋转、投照——这组是"读片前读片":临床医师先判片能不能读,模型也应如此。任务选择暴露的价值观:基准不追疾病的广度,追推理链的深度——12 个任务每个都能拆出完整的四阶段链,比 40 个只有终答案的病种标签更符合本集的立意。
§1.6 三路径评测的设计哲学
评测管线的行为树:根节点是二诊断问题(三选项:Yes/No/I don’t know)。答 binary → Path 1(直接推理评测):Stage 1 准则选择(模型必须说出它用的临床准则)→ Stage 1.5 精炼准则采纳(仅专家定义准则任务:引导模型接受官方准则)→ Stage 2 解剖结构识别(在掩码/landmark 叠加图上选出相关区域与参考线)→ Stage 3 测量或识别(测量型:算 CTR 并选值域 [0.50-0.52];识别型:判气管偏移方向);任一阶段错即终止——"临床推理不能在失效点之后被推断"是协议的原话级假设。答 IDK → Path 2(引导推理):模型获得结构化引导,学习正确推理过程。Path 2 完成 → Re-evaluated Path 1:在同任务新 case 上重测(省略 Stage 1.5,因准则已引入)——考内化与泛化。三个设计哲学:IDK 是能力不是失败;错误要定位到阶段而不是笼统判错;"教了会不会"比"原题会不会"更接近临床成长性评价。
§1.7 18,988 的构成学
QA 配额:Path 1 = 8,044、Path 2 = 3,600、Re-evaluated Path 1 = 7,344,合计 18,988。三个数字的比例有信息:Path 2 最少(3,600 = 1,200 case 中 IDK 路径的配额×阶段数),Re-evaluated 反而多于 Path 2(7,344)——说明引导路径在评测流程里承担了"再教学"的重头。每 QA ≤4 视觉输入:原图(Stage 1)、掩码叠加图(Stage 2 与 Path 2)、landmark 叠加图(Path 2 Stage 2)、原图复用(Stage 3)——视觉输入随阶段演进,模拟"医师翻片"的过程。文件组织:qa/{dx_name}/{evaluation_path}/{stage}/{option_format}/{dicom}.json 的五层 JSON 树——按任务→路径→阶段→选项格式→案例寻址,工程上是为"逐阶段评分子集"而生的目录设计。
§1.8 12 个 LVLM 的全线挣扎:结果即卖点
论文的核心发现(v2 口径):12 个被测 LVLM 全部在结构化推理与泛化上挣扎——最强者也无法把抽象临床知识(CTR 准则)与解剖视觉证据(心界在哪里)可靠连接。失败模式的分布(论文级描述+版本页口径):Stage 1 的准则盲(不知道该用 CTR)、Stage 2 的解剖区错认(在叠加图上选错相关区域)、Stage 3 的测量计算失准(比值区间选错)、以及 Re-evaluated 的泛化崩塌(引导教会了、换图又不会)。"全线挣扎"对基准的意义:一个 2025 年的基准如果被现有模型刷到 90 分,它的寿命只有半年;全员低分的基准才是一张长期有效的考卷——CXReasonBench 把"难"做成了设计目标。
§1.9 平台策略:PhysioNet × HuggingFace 的合规双栖
数据源四库,发布分两处:PhysioNet 版——只含 MIMIC-CXR-JPG 源(dicom_id 对齐),Credentialed(DUA 1.5.0+CITI),因为 MIMIC 的授权链要求;HuggingFace 版(ttumyche/CheXStruct)——NIH CXR14+VinDr-CXR+OpenI 三源,开放下载,因为这些源本身开放。版本页 HF 相关说明(“MIMIC-CXR-JPG is not included in this repository due to requiring PhysioNet credential access”)把这个分裂讲得很直白:不是数据不同,是合规门槛把同一资源切成两半。使用者要全集就得两边申请(PhysioNet 凭证+HF 下载),对账键是 image_file/dicom_id——本系列第一次出现"同一数据集的两半在两个平台"的结构,§3.7 给了两半的对账协议。
§1.10 Challenge 类型:PhysioNet 的另一个物种
PhysioNet 的内容类型有 Database/Software/Challenge 等——本集是系列第一个 Challenge 类型条目。Challenge 与 Database 的差异不只是标签:Challenge 的核心是"评测任务"(数据的存在是为了被测),Database 的核心是"数据资产"(数据的存在是为了被用)。对本系列的影响:条目结构上"结构深查"让位于"评测协议深查"(§3/§4 的重心调整),patient_count 的语义变成"基准 case 数"而非"数据集患者数"。PhysioNet 收录 Challenge 也说明平台对"评测即资源"的认可——数据、代码、基准三类资产的等价性,是 AI-Ready 生态成熟的标志之一。
§1.11 资助与独立性
资助清单:Microsoft Research Asia(MSRA)+ IITP 两项(RS-2019-II1900075、RS-2024-0043680)+ KHIDI 一项(RS-2025-02213750)+ NRF 一项(NRF-2020H1D3A2A03100945)+ MSIT/MOHW 医科学家训练计划——韩国国家级资助矩阵+MSRA。MSRA 的资助在学术评测里值得留意(被测模型生态的中立性问题:12 个 LVLM 里是否含微软系模型、评测是否对其有特殊适配——论文与版本页均未见特殊声明,按无利益冲突声明处理,但使用者了解资助结构有益)。无利益冲突声明照例。整体独立性判断:韩国学界+MSRA 的组合在评测中立性上属于常见配置,CheXStruct 的管线开源(GitHub)与准则的专家定义流程保证了评测逻辑的可审计性。
§1.12 名词速查表
| 名词 | 释义 |
|---|---|
| CheXStruct | 参考答案工厂:分割→landmark→测量→指数→阈值→QC 的自动管线 |
| CXReasonBench | 考场:三路径多阶段 QA 评测(18,988 题) |
| LVLM | Large Vision-Language Model 大型视觉语言模型 |
| CTR | Cardiothoracic Ratio 心胸比:心宽/胸宽,本集的招牌推理链 |
| Path 1 | 直接推理评测:四阶段(准则→精炼→解剖区→测量/识别),错即终止 |
| Stage 1.5 | 精炼准则采纳:仅专家定义准则任务有,引导接受官方 cut-off |
| Path 2 | 引导推理:IDK 模型获得结构化引导学习推理 |
| Re-evaluated Path 1 | 内化重测:引导后在同任务新 case 重测(省 Stage 1.5) |
| IDK | “I don’t know” 选项:自认不确定被导向 Path 2 而非判错 |
| dicom_id | MIMIC-CXR 图像级 ID,本集与母集的对账键 |
| DUA 1.5.0 | PhysioNet Credentialed Health Data Use Agreement 版本 |
| NeurIPS D&B | NeurIPS Datasets and Benchmarks Track:基准类工作的顶会阵地 |
§1.13 发布时间线年表
| 时间 | 事件 | 证据 |
|---|---|---|
| 2025-05-26 | arXiv v1 提交(10 LVLM 版) | arXiv:2505.18087 |
| 2025 年末 | NeurIPS 2025 D&B Track 接收 | dblp/论文页 |
| 2025-10-15 | PhysioNet v1.0.0 上线 | 版本史 |
| 2025-10-23 | v1.0.1 勘误(qa/ JSON 路径修复+加致谢) | Release Notes |
| 2025-10-27 | arXiv v2(12 LVLM 扩编) | arXiv |
| 2026-09-22 | 本条目核查(Views 73) | 版本页快照 |
一年内完成"arXiv→顶会→PhysioNet→勘误→论文 v2"的完整循环——学术发布与数据平台的双线并行的标准操作,勘误响应速度(8 天)是活跃维护的直接证据。
§2 语境与设计逻辑:结构化推理评测在胸片 AI 中的位置
§2.1 评测的三代演进:本集站在第三代
胸片 AI 评测的三代:第一代(分类范式)——ChestX-ray14/CheXpert 式的"14 类 AUC",评模型对标签的判别力;第二代(生成范式)——报告生成/VQA 的 BLEU/准确率,评模型的语言输出;第三代(过程范式)——本集代表的"中间步骤评测",评模型是否按临床逻辑到达答案。三代的驱动力不同:一代靠 NLP 标签挖掘、二代靠 LLM 生成评测集、三代靠临床推理链的可计算化——CheXStruct 的管线就是把"医师怎么读片"翻译成"机器怎么判分"。第三代的稀缺性:推理链可计算化的任务不多(胸片结构诊断是少数),这既是本集的护城河也是它的边界(§2.6)。
§2.2 与 LVLM 评测生态的咬合
论文的 reference 语境:CheXAgent/RadVLM/HealthGPT(医疗 LVLM)+ VQA-Med(VQA 基准)。本集在这个生态里的角色:给"会说话"的模型补"会看病"的审计——报告生成分数高的 LVLM,可能在 CTR 测量上算错、在解剖区识别上错认;CXReasonBench 的逐阶段分数把这种"语言能力掩盖推理缺陷"的现象量化。对 LVLM 开发者的实操含义:你的模型在 VQA-Med 上 85 分不代表临床可用——把 CXReasonBench 的四阶段分数跑一遍,弱环立现。
§2.3 掩码层的应用范式产品化:本集与本系列掩码条目的深层咬合
502/503 交付掩码层时,本系列反复问"掩码到底能干什么"——CheXStruct 是这个问题迄今最完整的官方级回答:分割→landmark→测量→指数→阈值五级链,把 65 万级掩码的可能性浓缩成 12 条推理链。对比:“掩码做 ROI”(分类加速)是浅用法,“掩码做推理链的参考答案源”(评测基准)是深用法——后者的产品化让掩码层从"预处理资产"升格为"评测基础设施"。CheXStruct 自己实现了分割管线(论文未依赖 502 掩码),但其链路与掩码生态的兼容是显然的:用 502 的掩码+官方解码器,社区可以复刻 CheXStruct 的②-⑤级管线并扩展新任务——§7.15 提案一的具体内容。
§2.4 "I don’t know"的评测哲学:不确定性意识的制度化
三选项设计(Yes/No/IDK)里最反传统的是 IDK:在标准基准里,IDK 要么不存在要么计 0 分;本集把 IDK 导向 Path 2(引导-重测),把"承认不会"变成一种被尊重的作答。这个设计的临床呼应:医师的"建议进一步检查"是安全行为而非失败。与 503 CheXmask-U 的呼应:503 给掩码配了"模型的怀疑"(std),本集给模型配了"说话的怀疑"(IDK 路径)——**不确定性的数据化(503)与不确定性的行为化(本集)**构成不确定性的两个产品面。评测工程含义:IDK 选项的存在让"过度自信"(明明不知道还硬答)可以被单独测量——Path 1 里答 binary 但 Stage 1 就错的模型,就是过度自信的实锤。
§2.5 Re-evaluated Path 1:把"教学增益"变成评测指标
引导后重测的设计在评测史上少见,它的被测对象其实是模型的可教性(learnability from structured guidance):Re-eval 与 Path 1 的分数差=结构化引导带来的增益;Re-eval 在新 case 上的表现=内化程度(不是背题)。这个指标对医疗 AI 部署的含义:临床 AI 系统的运维里"接受医生反馈后改进"是核心需求——Re-eval 分数是这种可反馈性的基准化测量。对研究者的提示:Re-eval−Path 1 的差值分析(哪些任务可教、哪些教不会)是论文未深挖的富矿(§7.15 提案二)。
§2.6 任务面窄:设计选择的边界账
12 个任务的窄是有意为之(§1.5 的三入选标准),但边界账要算清:不含需要临床史的疾病(肺炎、心衰分级等被明确排除——“diagnosable from chest X-rays alone”)、不含病灶级任务(结节/气胸带的定位——它们没有固定推理链)、不含治疗反应类(随访对比)。这个边界让"过程评测"的立意纯粹,但也意味着:CXReasonBench 高分≠临床全科能力——它审计的是"结构诊断的推理过程",不是"放射科医师的全技能"。使用者在论文里的定位表述要精确(§7.12 模板)。
§2.7 双平台对账:同一资源的两半
PhysioNet(MIMIC 源)+ HuggingFace(三源)的分裂(§1.9)带来的工程任务是对账:QA 的 1,200 case 全部来自 MIMIC(dx_by_dicoms.json 的 dicom_id 证据),所以考场部分(qa.zip/评测 JSON)只在 PhysioNet 版;HF 版的价值是 CheXStruct 的结构化输出覆盖非 MIMIC 三库(管线泛化性的证据+非凭证研究者的可用素材)。对账协议:HF 版三库的 CSV 行数与各源库官方规模比对(NIH CXR14 全量 112,120?以 HF 卡片为准)、PhysioNet 版 QA 的 dicom_id 与 MIMIC metadata 交叉验证。§3.7 给出完整清单。
§2.8 Credentialed 的成本结构:双门槛+区域限制
访问门槛三件:PhysioNet 凭证(CITI “Data or Specimens Only Research” 课程——注意与 MIMIC-CXR 的 CITI 课程要求是否重叠:同是 PhysioNet 体系,一般一次培训覆盖多数据集,DUA 分别签)、DUA 1.5.0 签署、区域可用性(版本页出现 “Data is not available in your region due to legal or policy restrictions” 提示——PhysioNet 对部分地区的数据访问限制,2026 年的新现象,本系列此前条目未见)。区域限制对国际化团队的影响:需确认团队所在司法辖区可访问,或走合作机构代理。这是本集特有的合规变量,§8.2 展开。
§2.9 与 505 CDSL 的评测双塔:批次五的收官布局
批次五的四连(502/503/504/505)在评测维度的分工:本集评推理过程(怎么想对的)、505(CDSL)评结构化输出(答案的格式与语义质量)——双塔合起来是 LVLM 临床输出的完整审计。塔间桥梁:本集的 Stage 3 输出(CTR 值域选择)就是一种结构化输出——505 的协议可以直接接在 Stage 3 之上做二阶评测。批次五的叙事因此收拢:“掩码层(502/503)→ 推理评测(504)→ 结构化评测(505)”——胸片 AI 从数据到审计的完整栈。
§2.10 与 495/492 的 MIMIC 对齐:QA 的 dicom 根
全部 1,200 case 的 QA 挂在 MIMIC-CXR 的 dicom_id 上——与 492 MIMIC-IV、495(MIMIC 生态)的对齐是天然可行的:QA→dicom→study→subject→临床表的四级 join。学术价值:把"模型在 Stage 3 算错 CTR"与患者的真实心功能(超声/BNP)对上,可以研究"推理错误与临床真实的相关性"——评测错误是否预示临床错误,这是 §7.15 提案三。装载注意:Credentialed 数据间的交叉引用在 DUA 1.5.0 下的合规性——同为 PhysioNet 凭证体系内一般允许,但复查 DUA 条款是动作项。
§2.11 从 NeurIPS 到 PhysioNet:基准类工作的双栖发布范式
本集的发布组合(NeurIPS D&B 论文+PhysioNet Challenge+HF 开源版+GitHub 代码)是 2025 年基准类工作的"全套标配":论文给方法学合法性、PhysioNet 给医疗数据合规性、HF 给社区可用性、GitHub 给可复现性。对本系列的启示:数据集百科的读者要习惯"一个资源四张脸"的现实——条目价值在于把四张脸的入口与差异讲清楚(哪个版本含什么、缺什么、怎么对账)。§10.7 的资源导航按"四张脸"组织。
§2.12 证据层级小结
本章与后续叙述的证据等级:评测协议/任务定义/QA 构成出自 PhysioNet 版本页与 NeurIPS 论文(A 级,双源互证);12 LVLM 的成绩为论文 2025 快照(B 级,模型迭代后失效);HF 三库的覆盖规模以 HF 卡片为口径(B 级,未逐库核对行数——标注为待验证项);"掩码生态兼容"的推论(§2.3)与 Re-eval 富矿判断(§2.5)为本条目推断(C 级);区域限制的细节以 PhysioNet 官方政策页为准(本条目仅记录版本页提示的存在)。本条目的特殊性:它是系列第一个"被测对象是模型而非疾病"的条目——证据层级里"官方成绩"的半衰期以月计(模型迭代),比数据类事实快一个数量级,引用时必须带时间戳。
§1.14 版本页快照纪要(2026-09-22 抓取)
| 字段 | 快照值 |
|---|---|
| 标题 | CXReasonBench: A Benchmark for Evaluating Structured Diagnostic Reasoning in Chest X-rays v1.0.1 |
| 类型徽章 | Challenge / Credentialed Access |
| Access Policy | Only credentialed users who sign the DUA can access the files |
| 文件许可 | PhysioNet Credentialed Health Data License 1.5.0 |
| DUA | PhysioNet Credentialed Health Data Use Agreement 1.5.0 |
| 必修培训 | CITI Data or Specimens Only Research |
| 版本 DOI | 10.13026/d14j-1b45(latest 10.13026/wgz6-zx42) |
| Topics | evaluation / chest x-ray / benchmark / structured qa / intermediate reasoning steps / structured reasoning / grounded reasoning / diagnostic reasoning / structured diagnostic pipeline |
| Project Website | github.com/ttumyche/CXReasonBench |
| Views | 64(Current)/ 73(All Versions) |
| 版本史 | 1.0.0(Oct. 15, 2025)/ 1.0.1(Oct. 23, 2025) |
| 区域提示 | “Data is not available in your region due to legal or policy restrictions”(未登录/受限区域显示) |
| 维护方 | MIT Laboratory for Computational Physiology(平台侧) |
快照表与 §1.15 的 HF 侧纪要配合使用——两平台的字段快照是"双栖资源"的对账底稿。
§1.15 HuggingFace 侧快照纪要与三源构成
HF 版(ttumyche/CheXStruct)的核查快照:数据组织——三目录(nih_cxr14/vindrcxr/openi)×15 CSV,结构与 PhysioNet 版同构;三源出处——NIH CXR14(Kaggle 官方镜像)、VinDr-CXR(官方 GitHub)、OpenI(Kaggle 镜像 chest-xrays-indiana-university);MIMIC 缺席声明——卡片原话 “MIMIC-CXR-JPG is not included in this repository due to requiring PhysioNet credential access but will be uploaded to PhysioNet soon!”(“soon” 的时点即 PhysioNet v1.0.0);公共列语义——与 §3.2 一致(image_file/viewposition/label+任务特定列),OpenI 的 viewposition=N/A;全局过滤列的独家细节——HF 卡片给出了 mask_number/abdominal/window 三文件的完整列语义(PhysioNet 版本页未逐列展开)——两版文档的互补关系(HF 卡片更细、PhysioNet 更权威)是双栖资源的常态。三源规模速览:NIH CXR14 全量 112,120(管线输出覆盖以 HF 卡片为准)、VinDr-CXR 18,000、OpenI 约 3,800(Indiana 大学集)——三源规模与行数核对挂待验证项(§10.8)。
§1.16 被测 LVLM 生态速览(2025 快照)
论文的 12 个被测模型(引用以论文表格为准,此处只列生态分组):通用旗舰级——GPT-4o 类闭源 API 与开源旗舰(Qwen-VL 系列/Llama-VL 系),代表"通用多模态天花板";医疗特化级——CheXAgent/RadVLM 类胸片特化模型,代表"领域微调路线";轻量级——7B-13B 级开源 LVLM,代表"本地部署现实"。三组的成绩结构(论文定性):医疗特化不必然优于通用旗舰(特化数据是报告态监督);闭源旗舰在知识环节(Stage 1)占优但测量环节(Stage 3)与轻量级差距缩小——"模型越大推理链越完整"的朴素假设在 Stage 3 失效,数值推理的短板与模型规模弱相关。这份生态速览的用途:新模型发布后,按此分组选 2-3 个"锚模型"复跑,即可定位自己的相对位置——不必每次全量复跑 12 个。
§1.17 与 PhysioNet 平台演进的互文
本集上线时点(2025-10)恰逢 PhysioNet 平台的几个结构性变化,条目特征与平台演进互为注脚:Challenge 类型的人员与流程——PhysioNet 的 Challenge 历来是年度竞赛形态(如 PhysioNet Challenge 2024),本集是"常驻型 Challenge"(非赛期制、持续可提交)——平台对"持久评测资产"的接纳;Credentialed License 1.5.0——本集用的许可版本是 PhysioNet 合规体系的新版本(较早期的 DUA 1.4 序列),条款的现代化(数据安全事件通知义务等)是新许可的标志;区域限制提示——平台级的司法辖区访问控制在 2025-2026 年出现(§2.8),本集的版本页是最早展示该提示的条目之一。三条互文的意义:读一个条目的平台特征,能读出平台政策的演进时点——本条目的平台快照(§1.14)因此也是 PhysioNet 治理史的切片。
§2.16 12 任务的临床共识基础:准则不是模型说了算
四阶段评测的判分权威来自"临床共识的准则"——12 任务的准则来源清单(论文 Methods 与版本页合计口径):CTR 阈值——经典放射学文献的 0.5 分界(区间选项 [0.50-0.52] 的粒度显示准则不止二分);纵隔增宽/主动脉三件套——解剖测量的上位阈值(具体 cut-off 以 column_descriptions 与论文附录为准);气管偏移/隆突角——方向与角度的判读标准;质量四任务——读片规范的操作化(吸气水平的肋骨计数标准、旋转的锁骨对称标准)。这份清单的元信息:准则的"专家定义"流程是本集可信度的根——12 个任务的每个 cut-off 都有出处可查(论文附录/字典 JSON),管线只是规则的执行者。给使用者的提醒:准则争议(如 CTR 阈值的人群差异)不是基准的 bug 而是它的设计边界——基准评的是"共识准则的执行",不是"准则本身的对错"。
§2.17 从"考卷"到"审计协议"的两个世界
本集的存在让"评测"一词有了两套用法,区分它们是使用者的必修课:考卷世界(research leaderboard)——目标是比较模型、发表论文、刷 SOTA;分数是终点,排行榜是产品;审计世界(deployment governance)——目标是回答"这个模型版本能不能上线、能上哪些功能";分数是证据,许可矩阵是产品(§7.13)。两套用法共享同一份数据与协议,但纪律不同:考卷世界在意"复现论文数字",审计世界在意"逐题日志的完整性与时间戳";考卷世界可以采样,审计世界建议全量(部署决策的证据链不能有采样偏倚)。本集的双栖设计(论文+PhysioNet)天然服务两个世界——使用者入场前先想清楚自己站在哪个世界,纪律清单(§5.4 考卷/§5.8 审计)才不会用错。
§2.13 失败形态学的语境定位:为什么"错在哪一步"比"错了多少"值钱
把本集的失败模式记录(§4.3 四阶段解剖)放回 AI 评测的演化语境:第一代评测(准确率/召回)只能告诉你"错了几道",第二代(错误类别标注)告诉你"错的是哪类",本集代表的第三代(过程分解)告诉你"错在哪一步、为什么继续错下去"——三代的工程价值差一个数量级,因为改进投资的瞄准精度完全不同。具体到本集的三个形态学发现:发现一——Stage 1 准则选择的失败是"知识缺位"型(模型没学过 CTR>0.5 的临床口径),改进路径是知识注入而非视觉微调;发现二——Stage 2 解剖选区的失败是"视觉 grounding"型,改进路径与检测/分割数据(本系列 502)直接相关;发现三——Stage 3 测量值域的失败是"计算-粒度"型(会算但精度不够选错区间),改进路径是数值推理训练。三种失败三种药方——这是"评中间步骤"范式对行业的真正馈赠:它把"模型不行"这句废话拆成了三张可以分别立项的工单。对决策者的翻译:以后看到"模型 X 在胸片基准准确率 Y%“的报道,先问一句"失败集中在哪个 Stage”——答不上来的评测,信息含量要打对折。
§2.14 名称口径三条纪律
本集实体名多、口径杂,行文与引用的三条纪律:纪律一(双名并用)——CheXStruct(管线+CSV 资产)与 CXReasonBench(基准考卷)是两个实体、一种血缘,首次提及时双名并举,其后按语境单用——只提 CXReasonBench 会让读者以为只有考卷没有数据资产,只提 CheXStruct 则丢失 NeurIPS 基准的身份;纪律二(版本后缀)——口语可省,书面(论文/报告/工单)必须带 v1.0.1(数据)与 v2(论文)的后缀或日期,理由是坑点 1 的十六种版本错法;纪律三(平台前缀)——讨论数据规模与图源时必须先声明平台(“PhysioNet 半”/“HF 半”),因为两半的图源、许可、访问门槛完全不同(§2.7),一句"数据来自公开胸片库"在本集语境里等于没说。三条纪律的共同根源:本集是"一个资源四张脸"(§2.11)的最复杂形态,口径纪律是四张脸不打架的唯一手段。本条目自检:全文已按三纪律执行——INFOBOX/速查卡/FAQ 的每处实体名都可回溯到具体版本与平台。
§2.15 测量链的临床语义学:CTR 不是一条公式
以 cardiomegaly(心扩大)任务为例解剖"测量-指数-阈值"的临床语义密度:管线交付的 CTR(心胸比)背后是一条完整的临床知识链——解剖定义(心影最宽径/胸廓最宽内径,且"最宽"的取法有 Webber A/B/C 多种口径)、投照条件(PA 立位为标准,AP 卧位的放大率让 CTR 系统性偏高——viewposition 列存在的临床理由)、阈值语境(0.5 是成人 PA 位的粗筛线,婴幼儿口径完全不同)、判读边界(心包积液/肺动脉高压等可让心影增大而心脏本体不大——CTR 高≠心脏大)。本集把这条链压缩成 QA 树里的"准则选择→选区→值域"三步,每一步都对应链上的一环——这正是它比"问模型心大不大"高明的地方:模型答错时能定位是哪一环松了。对临床读者的提醒:管线是"影像内可测"的最大化,不是"临床判读"的复刻——CTR 链上的语境压缩(如无婴幼儿分组)在 §2.6 任务面窄的账本里已有记录,本节补的是单任务内部的语义账。
§2.16 与影像组学的亲缘:特征工程的高维回声
CheXStruct 管线(分割→landmark→测量→指数)在方法学谱系上是解剖学特征工程的 LVLM 时代回声:影像组学(radiomics)的传统流程——分割 ROI→提取形态/纹理特征→统计建模——与本集管线前四级同构,差别在第五级(组学喂统计模型,本集喂 LVLM 评测)。三点亲缘推论:推论一——组学社区的特征稳定性方法论( ICC 组内相关系数/扫描间变异)可以直接移植来评估管线测量值的可靠性——这是 §6.2 审计议程的方法论补给;推论二——组学特征的可解释性优势与本集过程评测的可解释性是同一哲学的两次显形:临床信任偏爱与解剖锚定的中间量,而非端到端的黑箱输出;推论三——管线标签(15 CSV)对组学研究的复用价值:CTR/纵隔宽度等指数列本身可当组学特征用(§7.10 弱监督的组学版)。亲缘的边界:组学的纹理/强度特征本集未涉及(它只取解剖几何)——两者是互补而非竞争,合并讨论时注意口径。
§2.17 "考卷噪声"的容忍度设计:与教育测评的第三次对读
标准化考试行业对"题目质量"的管理经验,可给本集使用者三件现成工具:工具一(题目区分度)——教育测评用区分度指数(高分组/低分组的通过率差)筛选废题;迁移到本集:某题若强模型与弱模型通过率无差(都错或都对),它对"排位"无贡献,可能是有歧义或参考答案可疑——§7.22 锚测试的可选扩展。工具二(多次测量信度)——同一题在采样温度扫描下的判定翻转率=题目的稳定性指标:翻转率高说明题目落在模型能力边界(信息量大)或表述含糊(信息量小),两种解释用人工复核 10 例区分。工具三(暴露控制)——考试行业防泄题的"题库轮换"对应本基准的版本演进策略:若 LVLM 预训语料吞了 v1.0.1(§6.5 方向⑩),官方的选项是扩 case 或出新任务面——使用者应关注官方的暴露管理表态,如同关注考试大纲修订。三工具的合成判断:评测基准的公信力不是发布时一次授予的,是靠题目级质量管理持续维系的——本集的 8 天勘误(存照 D)已展示了这种意识的萌芽,社区侧的同类实践(§7.17 提案二)是它的接棒。
§1.18 准则速查:四阶段各自判什么
| 阶段 | 判什么 | 参考答案源 |
|---|---|---|
| Stage 1 准则选择 | 模型用的临床准则是否成立 | 专家定义的准则清单 |
| Stage 1.5 精炼采纳 | 是否接受官方 cut-off(仅专家准则任务) | 同上 |
| Stage 2 结构识别 | 相关解剖区/参考线选对否 | 掩码叠加图的区域标注 |
| Stage 3 测量/识别 | 测量计算或形态判读 | 管线测量值+阈值判定 |
四行表格的用途:向非技术听众解释本集时的最小画板——“考卷不是一道题,是四关”。
§3 数据切片:交付物、结构与对账协议
§3.1 交付物清单:两半世界的合计
PhysioNet v1.0.1 的下载包(Credentialed 解锁后):
base/
├── CheXStruct/ # 参考答案工厂
│ ├── CheXStruct_column_descriptions.json # 全列名字典(15 CSV 的逐列说明)
│ ├── global/ # 3 个全局过滤任务
│ │ ├── abdominal_xray.csv
│ │ ├── mask_number.csv
│ │ └── window.csv
│ └── diagnostic_tasks/ # 12 个诊断任务 CSV
│ ├── aortic_knob_enlargement.csv
│ ├── ascending_aorta_enlargement.csv
│ ├── cardiomegaly.csv
│ ├── ...
│ └── trachea_deviation.csv
└── CXReasonBench/ # 考场
├── dx_by_dicoms.json # 12 任务 × 100 case 的 dicom_id 清单
├── pnt_on_cxr.zip # landmark 叠加图(Path 2 Stage 2)
├── segmask_bodypart.zip # 掩码叠加图(多路径共用)
└── qa.zip # QA JSON 树(18,988 题)
HuggingFace 版(ttumyche/CheXStruct):同构的 CheXStruct/ 三库目录(nih_cxr14/vindrcxr/openi 各 15 CSV),无 CXReasonBench 考场(QA 全部基于 MIMIC case)。两半合计 = 管线输出全集(四库)+ 考场(MIMIC 源)。
§3.2 CSV 的公共列结构:九字口诀
15 个 CSV 共享三列公共结构:image_file(源库的图像唯一 ID;MIMIC 版为 dicom_id)、viewposition(PA/AP;OpenI 不支持故记 N/A——三源合一时此列的缺失值处理要预设)、label(1/0 二值:发现的有无或质量状态——label 的语义随任务变,column_descriptions.json 是唯一权威)。任务特定列三类:解剖 landmark 坐标(心界端点、胸廓端点等——如 cardiomegaly.csv 的 heart_xmin/heart_xmax)、诊断测量(心宽、胸宽等)、诊断指数(CTR 等)。列名字典的用法:不要靠猜——15 个 CSV 的任务特定列各不相同,把 column_descriptions.json 转成你们团队的数据字典是第一个工程动作。
§3.3 全局过滤三件套:管线自己的"门卫"
| 文件 | label 语义 | 关键列 | 拦截什么 |
|---|---|---|---|
| mask_number.csv | 0=无效图/1=有效 | mask_count(非零像素掩码数) | 非胸片/损坏/空白/摆位遮挡 |
| abdominal_xray.csv | 0=腹盆混入/1=标准胸片 | y_start/y_heart_max/y_end、distance_upper/lower、ratio(lower/upper) | 拍摄范围含大量腹盆腔的片 |
| window.csv | 0=伪影/1=合格 | gradient_mean(梯度均值=边缘强度) | 截图/过度后处理伪影 |
三件套的设计逻辑:先保证"这是一张标准正位胸片"再谈诊断——mask_number 管存在性、abdominal 管拍摄范围、window 管图像质量。这套过滤对任何胸片管线都有复用价值(HF 版三库的全量 CSV 让"给 NIH/VinDr/OpenI 洗数据"成为附带产出)。
§3.4 12 诊断任务 CSV 的逐任务速览
| 任务组 | 任务 | 推理链核心 | 指数/测量 |
|---|---|---|---|
| 发现(8) | cardiomegaly | 心宽 vs 胸宽 → CTR → 阈值 | heart_xmin/xmax、CTR |
| 发现(8) | mediastinal widening | 纵隔宽测量 → 阈值 | 纵隔 landmark 对 |
| 发现(8) | carina angle | 隆突角测量 → 范围判定 | 角度值 |
| 发现(8) | trachea deviation | 气管走行 vs 中线 → 方向判定 | 气管 landmark 序列 |
| 发现(8) | aortic knob enlargement | 主动脉结测量 → 阈值 | 结部 landmark 对 |
| 发现(8) | ascending aorta enlargement | 升主动脉宽 → 阈值 | 升主动脉 landmark |
| 发现(8) | descending aorta enlargement | 降主动脉宽 → 阈值 | 降主动脉 landmark |
| 发现(8) | descending aorta tortuous | 降主动脉迂曲识别 | 走行序列 |
| 质量(4) | inclusion | 拍摄包含性判定 | 解剖完整性检查列 |
| 质量(4) | inspiration level | 吸气深度(肋骨计数类) | 肋间隙相关测量 |
| 质量(4) | rotation | 旋转判定(锁骨对称类) | 对称性测量 |
| 质量(4) | projection | PA/AP 投照判定 | 投照特征列 |
表格按"推理链核心"列组织——每个任务的 Stage 1(准则)/Stage 3(测量或识别)都由此派生。详细列名以 column_descriptions.json 为准(本表是导航不是字典)。
§3.5 QA JSON 树的寻址与字段
五层路径 qa/{dx_name}/{evaluation_path}/{stage}/{option_format}/{dicom}.json 的每层语义:dx_name(12 任务名)→ evaluation_path(path1/path2/re-evaluated)→ stage(阶段号)→ option_format(选项格式变体)→ dicom(case ID)。JSON 内字段(Usage Notes 示例):question(题干含选项)/ answer(参考答案)/ img_path(关联图像路径)+ bodypart 掩码路径列表(v1.0.1 修复过的关键字段——旧版路径错误会让视觉输入加载失败,用 v1.0.1 或更高版本是硬要求)。加载代码(官方示例):
import json
with open("CXReasonBench/qa/cardiomegaly/path1/stage3/option_a/12345678.json") as f:
qa = json.load(f)
question, answer, img_path = qa["question"], qa["answer"], qa["img_path"]
§3.6 DAIMS 就绪度评分:6.3/8
| 维度 | 分 | 依据 |
|---|---|---|
| 文档 | 0.9 | 版本页+NeurIPS 论文双全,列字典齐备;扣分:HF 卡片与 PhysioNet 文档的口径差需自己对齐 |
| 机读 | 0.8 | JSON 树+CSV 结构清晰、dicom_id 全键对齐;扣分:qa.zip 的五层路径对脚本不够扁平 |
| 标签 | 0.8 | 18,988 QA 全配参考答案+参考推理链;扣分:答案源是管线(非医师逐例) |
| 可访问 | 0.6 | Credentialed 双门槛+区域限制+两半分布两平台 |
| 许可 | 0.5 | Credentialed License 1.5 强约束(不可再分发、评审用途限制条款等) |
| 格式 | 0.8 | CSV/JSON/PNG zip 混合但组织规整;v1.0.1 已修路径 |
| 评测 | 1.0 | 本体即基准:参考链+逐阶段判分+三路径协议——该维度的满分样本 |
| 生态 | 0.7 | NeurIPS D&B+HF+GitHub 三栖;Views 73 偏低(Challenge 类型的可见性折价) |
总分 6.3/8:评测维度满分是系列首次——数据即考卷的条目在"评测"上没有扣分理由;许可与可访问的低分是 Credentialed 的结构性代价(与 501/499 同病)。
§3.7 两半对账协议:PhysioNet × HuggingFace
全集需要两版合取(§2.7),对账五步:① 平台边界确认——PhysioNet 版=MIMIC 源管线输出+全部考场;HF 版=三源管线输出(无考场);② key 一致性——两版的 image_file 语义不同(MIMIC 用 dicom_id、NIH 用 Image Index 等各自源库 ID)——join 源库 metadata 时分别适配;③ CSV 结构对齐——两版的 15 CSV 列结构理论同构(同一管线),抽 2 个任务逐列 diff 确认(列名/顺序/单位);④ 考场完整性——dx_by_dicoms.json 的 12×100=1,200 dicom 与 MIMIC metadata 全量 join(预期 100% 保留);⑤ 视觉资产抽检——segmask_bodypart/pnt_on_cxr 各抽 20 张与 qa.json 的 img_path 路径核对(v1.0.1 修复后的路径体系)。五步全过,两半合一。
§3.8 时间视角:MIMIC 源的时间带与基准的时效性
case 的图像来自 MIMIC-CXR(BIDMC 2011-2016)——时间带与 492/495/501/502 一致。本集特有的时间性问题:基准成绩的时效——12 LVLM 的 2025 年成绩随模型迭代快速贬值(半年一代),基准题库本身稳定但"排行榜"是流水;管线的时间锚——CheXStruct 的分割模型与阈值准则有版本,重跑管线生成新参考答案时与 v1.0.1 QA 的差异要审计(官方未承诺管线版本冻结,GitHub 的 release 记录是锚)。**“数据冻结、成绩流动”**是评测类条目与数据类条目的根本差异,本系列第一个遇到。
§3.9 访问流程:三步走与一个新变量
第一步:PhysioNet 账号+CITI "Data or Specimens Only Research"课程(与 MIMIC 系列的 CITI 要求同族——已做过 MIMIC 培训的团队核对课程模块是否覆盖);第二步:DUA 1.5.0 签署(PhysioNet Credentialed Health Data Use Agreement——与 MIMIC-CXR 的 DUA 同族但独立签署);第三步:下载。新变量:区域可用性——版本页对未授权地区显示 “Data is not available in your region”(PhysioNet 平台级的访问限制提示,本系列条目首次记录)。国际团队的预检动作:登录 PhysioNet 后先确认本集在你的区域可见,再投入 CITI 时间成本。HF 版无此门槛——管线输出的三源部分先行研究是合理的过渡方案。
§3.10 引用要求:四件套引用链
官方要求引 PhysioNet DOI(10.13026/d14j-1b45)+论文(arXiv:2505.18087 / NeurIPS 2025)。本条目建议的完整链:① PhysioNet 数据 DOI(你用的考场文件);② NeurIPS 论文(方法学与成绩);③ MIMIC-CXR-JPG(图像源,arXiv 1901.07042/Sci Data 2019);④ 三个 HF 源库(若用了 HF 版输出:NIH CXR14 CVPR 2017/VinDr-CXR Sci Data 2022/OpenI 原始引用)。四件套之外的可选:CheXStruct 的分割模型论文(管线②级的技术源——以 GitHub README 的引用说明为准)。引用链逻辑与 502 篇 §3.10 同族:数据是谁的→管线怎么建的→考场怎么出的。
§3.11 装载后对账清单(十条)
- CheXStruct 15 CSV 齐全(12 任务+3 全局)且列数与 column_descriptions.json 一致。
- 全局过滤三件套的 label 分布统计(过滤率是管线质量的第一信号)。
- 12 任务 CSV 的 label 分布 vs 版本页 Data Description 的数字(若版本页给了表)。
- dx_by_dicoms.json:12×100=1,200 dicom_id 唯一性+与 MIMIC metadata 的 join 保留率(预期 100%)。
- qa.zip 解包后的 JSON 总数=18,988(8,044+3,600+7,344 逐路径核对)。
- v1.0.1 验证:抽查 20 个 qa.json 的 img_path 指向的文件存在且可读(旧版路径错误的验证)。
- 视觉资产完整性:segmask_bodypart/pnt_on_cxr 的任务子目录与 dx_by_dicoms 的任务清单一致。
- HF 版(若使用):三库 CSV 行数与 HF 卡片口径比对,label 分布合理性初检。
- 每任务的 QA 阶段覆盖检查(Stage 1/1.5/2/3 的题量分布,异常为空=管线断链信号)。
- 审计报告:case 清单、QA 计数、版本声明(v1.0.1)、两半对账结果四件套。
§3.12 版本冻结与升级预期
v1.0.1 冻结 QA 题库与参考答案;管线本身未承诺冻结(GitHub 活跃)——重跑管线会产生与 v1.0.1 有出入的参考答案(分割模型迭代/阈值修订都会传导)。升级预期:v1.1 大概率修复 QA 覆盖的边角(阶段空缺)或扩任务面;v2 可能扩被测模型榜单或加新源库。使用策略:论文锁 v1.0.1+下载日期;管线复用(生成新参考答案)要与官方 QA 版本号双轨记录。与 502 的版本史对比:本集 8 天即勘误的响应速度预示活跃的版本未来。
§3.13 数据字典的自动生成:从 column_descriptions.json 到团队 Wiki
15 个 CSV 的任务特定列名各不相同(约 100+ 列的总量),人工维护数据字典是灾难——建议自动生成管线:读 column_descriptions.json → 按任务分组 → 输出 Markdown/Confluence 表(列名/类型/语义/所属推理链级别)→ 附每列的值分布快照(label 的 1/0 比例、测量列的 P5/P50/P95)→ 入团队 Wiki 并锁定版本。半天工程换来:新人上手时间从"翻 JSON 猜列"降到"查 Wiki",审稿回复"列定义见 Wiki vX"——数据字典是管线类数据集的第一杠杆,本集的 column_descriptions.json 质量足够好,值得这套投资。
§4 结构深查:评测协议、参考答案与失败模式
§4.1 评测行为树的完整解剖
把三路径画成一棵判定树:
初始诊断问(Yes/No/IDK)
├─ Yes/No → Path 1(直接推理评测)
│ ├─ Stage 1 准则选择 ──错→ 终止(标记:准则盲)
│ ├─ Stage 1.5 精炼准则(仅专家准则任务)──错→ 终止(准则拒纳)
│ ├─ Stage 2 解剖结构识别(叠加图选区)──错→ 终止(定位失败)
│ └─ Stage 3 测量/识别 ──错→ 终止(计算/判读失败)
│ └─ 全对 → 结构化推理合格
├─ IDK → Path 2(引导推理)
│ ├─ 结构化引导分阶段展示
│ └─ 完成 → 进入 Re-evaluated
└─ Re-evaluated Path 1(新 case,省 Stage 1.5)
├─ 同 Path 1 四阶段(无 1.5)
└─ 全对 → 内化成功;错 → 泛化失败
树的三个评测学特征:错即终止让每题的"失败阶段"即最深到达阶段——单一分数变失败谱;Stage 1.5 只对专家准则任务避免"准则本来就开放"任务的伪判分;Re-eval 省略 1.5因为准则已在引导中引入——细节的一致性反映协议的深思熟虑。
§4.2 参考答案的可信度结构:管线 vs 医师
参考答案的生成层级:管线生成(主体)——分割→测量→指数全自动,专家定义的是准则与 QC 规则而非逐例答案;专家复核(抽样与规则)——版本页明确 “a clinical expert manually reviewed all corresponding segmentation masks for quality assurance”(1,200 case 的掩码全复核)+12 任务的准则共定。可信度结构因此是"医师定规则、管线出答案、医师审质量"的三明治——与纯医师标注(贵但逐例真)和纯管线(便宜但无背书)都不同。使用含义:QA 答案对"推理链正确性"的代表性有官方背书,但对"每例的临床真值"代表性有限(管线在边缘病例的判定=准则的机械应用)——这是过程评测与诊断真值评测的语义差,论文引用时要分清。
§4.3 四阶段失败模式的解剖学
12 LVLM 的失败谱(论文定性+协议结构推演):Stage 1 准则盲——不知道 CTR 是心扩大的判据(知识缺口:临床准则没进参数)——量化:Stage 1 通过率;Stage 2 定位失败——知道准则但选不对解剖区(视觉 grounding 缺口:知道"看心"但不知道心在哪)——注意 Stage 2 的图是掩码叠加图,模型要做的是"从标注过的图里认出相关区",这比裸图定位容易但依然错——说明失败在"区域-概念对齐"层;Stage 3 计算/判读失败——区域对但测量/比值错(数值推理缺口:LVLM 的算术与量尺读数是公认弱项);Re-eval 泛化崩塌——引导内教会、换图就废(记忆而非内化)。四类的相对占比论文有详细数据(引用以论文为准);本条目的判断:Stage 2 的"叠加图上仍选错"是最有诊断价值的发现——它排除了"图太raw看不懂"的辩解,直指多模态对齐的根本缺陷。
§4.4 "错即终止"的统计含义:存活分析与评测的类比
错即终止的协议让每个 case 的评测过程类似生存分析:Stage 1 通过率 → 条件 Stage 2 通过率 → 条件 Stage 3 通过率——逐级条件概率连乘=全链通过率。这个结构的好处:各阶段的"条件通过率"(在该阶段到达者中的通过比例)比边缘占比更能定位薄弱环(Stage 3 的条件通过率低=到得了测量环节的模型多数算不对);坏处:阶段间不独立(存活偏倚),跨模型比较要在同阶段切片比。评测报告的正确姿势:报每级的条件通过率+到达率两个数,而非只报终局通过率——本条目 §7.12 模板含此格式。
§4.5 IDK 行为的市场:模型的过度自信测量
IDK 选项给了"过度自信"一个可测定义:初始决策答了 binary 但 Path 1 Stage 1 就错的模型=过度自信者(它不知道准则却敢下诊断)。论文视角的补充推断(C 级):不同 LVLM 的 IDK 率差异巨大是可预期的(对齐训练的影响)——IDK 率×Path 1 Stage 1 通过率的二维图("诚实度×能力"散点)是论文未展示但数据完全支持的补充分析:右下象限(高能力低诚实)与左上象限(高诚实低能力)的临床含义完全不同。这个分析的数据(每模型每选项的计数)在各团队复跑时自然产生——§7.15 提案二的素材。
§4.6 12 任务间难度的结构性差异
任务间难度不均匀(结构原因):**CTR 链(cardiomegaly)**最完整(两把尺一条比值),LVLM 有课本知识加持,预期是 12 任务里表现最好的;**角度类(carina angle)与方向类(trachea deviation/tortuous)**需要空间理解(角度/走行),LVLM 的空间推理是公认短板,预期垫底;质量四任务偏感知与规则(吸气水平/旋转),可能意外地难——它们的"准则"比发现类模糊(吸气深度的判定阈值有主观性)。难度结构的使用:跨模型比较要按任务分层(CTR 上的胜利不能推广到隆突角);新模型的改进声明要指名任务(“CTR 涨 10 分”≠“结构化推理涨 10 分”)。
§4.7 视觉输入的四图设计:从裸图到标注图的评测学
每 QA ≤4 图的演进序列:原图(Stage 1:只考知识)→ 掩码叠加图(Stage 2:考区域-概念对齐,掩码已替模型做了分割)→ landmark 叠加图(Path 2:进一步显式化关键点)→ 原图复用(Stage 3:测量在已识别的结构上做)。设计逻辑:逐级卸掉低层负担,隔离高层能力——Stage 3 的 CTR 计算错误不能甩锅"分割不准"(掩码已给),是纯粹的数值推理失败。这种"控制变量式的视觉输入"是过程评测的方法论精华:每一题只考一个能力维度——比端到端评测的归因能力强一个量级。
§4.8 与人工标注的对照缺位:一个诚实的缺口
1,200 case 的掩码有专家复核(质量保证),但QA 答案的逐例医师复核未在版本页声明(准则共定≠逐例答案审核)——极端病例(CTR 恰在 0.50 边界、气管轻度偏移)的管线判定可能与临床直觉有出入。这个缺口的应对:使用者复跑评测时,对 Stage 3 边界值 case(值域选项的临界)做抽样人工复核(每任务 5-10 例),把"管线答案 vs 医师直觉"的分歧率写进论文的 limitations——主动披露比被审稿人抓出体面得多。§5.7 黑名单收录此条。
§4.9 质量四任务的特殊地位:管线自己给自己出题
图像质量四任务(inclusion/inspiration/rotation/projection)的参考答案同样出自 CheXStruct 管线——而管线的全局过滤本身就依赖类似逻辑(§3.3 三件套)——**管线既当运动员(提供质量判定的参考答案)又当裁判(QC 过滤)**的自指风险。缓解因素:质量任务的准则相对客观(梯度、对称性、包含比例),且三件套过滤与四质量任务是不同粒度(图像级过滤 vs case 级判定)。使用者的清醒剂:质量任务的基准分数要降低解读权重——它们考的是"模型与管线的质量观一致性",不是"与临床质量观的一致性"。
§4.10 血缘链:从 DICOM 到 QA JSON 的六级加工
① MIMIC DICOM → ② JPG(母集交付)→ ③ 解剖分割掩码(管线)→ ④ landmark/测量/指数(管线)→ ⑤ 参考答案+QC(管线+专家准则)→ ⑥ QA JSON 树+叠加图渲染。六级全部开源可审计(GitHub)+专家规则背书(准则共定+掩码复核)——与 502 的五级血缘相比多了"准则与渲染"两级,黑箱数量为零。血缘的公开程度再次成为本系列条目的质量分水岭:能画出完整血缘链的数据集,才有资格当评测基准(考卷出错题的代价远大于数据集有噪声)。
§4.11 一致性风险清单(本集版八条)
- v1.0.1 之前的 qa/ 路径错误——旧版本构建的评测结果不可比(§3.5)。
- 管线版本漂移——GitHub 重跑的参考答案≠v1.0.1 冻结答案,双轨记录(§3.12)。
- label 语义随任务变——跨任务合并 label 前先查字典(§3.2)。
- viewposition 的 N/A(OpenI)——三源合并时缺失值策略(§3.2)。
- 质量任务的自指风险——降解读权重(§4.9)。
- 边界值 case 的答案争议——抽样人工复核(§4.8)。
- 两平台版本差——HF 版无考场,别用 HF 版跑 CXReasonBench 评测(§3.7)。
- 成绩时效——12 LVLM 的分数是 2025 快照,引用带时间戳(§2.12)。
§4.12 与 502 掩码生态的兼容性实验设计
CheXStruct 自建分割管线,但其②-⑤级(landmark→测量→指数→阈值)对掩码源是中性的——用 502 的掩码+landmark 复刻 CTR 链的实验设计:502 MIMIC 子集掩码 → 心/胸宽测量 → CTR → 与 CheXStruct 的 cardiomegaly.csv 的 CTR 列对照(同一 dicom_id join)——两套独立管线的 CTR 分布一致性既验证 502 掩码的测量可用性(502 篇 §7.22"外部验证锚"的实例化),也验证 CheXStruct 的可复现性。相关性高=双赢家;分歧大的 case 集=两管线的联合失效区=最值得人工看的样本。半天实验,两篇论文的验证小节素材(§7.15 提案一的先导)。
§5 使用协议:从评测到发表的全流程
§5.1 环境对账清单
- Python ≥3.9;json/pandas 常规件;PIL/OpenCV(叠加图读取);评测框架:官方 GitHub 的 harness(含 LVLM 接口适配)。
- 存储:PhysioNet 包数 GB 级(CSV+JSON+叠加图 zip)+源图(MIMIC-CXR-JPG 500 GB 级——Stage 1/3 用原图必须装)。
- 凭证三件:PhysioNet 账号、CITI 课程(Data or Specimens Only Research)、DUA 1.5.0。
- 版本三件套:v1.0.1 下载日期、GitHub harness commit、被测模型的版本号与推理参数(温度=0 建议)。
§5.2 评测的泄漏防控:与数据集泄漏不同的三层
评测类条目的"泄漏"含义升级:层一,题库泄漏——被测模型若在预训练中见过 MIMIC-CXR 的公开讨论/衍生数据(HF 上 MIMIC 衍生集很多),Stage 1 的"准则知识"可能被见过而非推得——缓解:Re-evaluated 路径的新 case 设计部分对冲,但逐题泄漏检测不可行,在论文 limitations 承认即可;层二,管线自我一致性——参考答案由管线生成,管线若有系统性偏差(某阈值偏严),所有模型被同向判错——缓解:边界值抽检(§4.8);层三,评测 harness 的格式偏差——模型的输出解析(选项抽取)失败会被误判为答错——缓解:先跑格式 sanity(模型输出解析成功率 100% 再评内容)。三层都过,分数才干净。
§5.3 复跑官方评测的最小协议
复现论文成绩表的步骤:D1——harness 安装+模型接口适配(本地模型/API 模型两条路);D2——1-2 个任务小样(每任务 10 case)跑通全路径(含 IDK 分流);D3——全量 12 任务跑 Path 1(最大开销在视觉输入的 token 成本:每 QA ≤4 图);D4——Path 2+Re-evaluated(IDK 模型的引导与重测);D5——对账论文数字(同版本模型应复现到 ±个位数差异——推理随机性与 API 版本漂移的容差)+产出条件通过率表。API 评测的预算提示:18,988 QA×≤4 图×12 模型的全量复跑是万元级 token 成本——论文级复现建议采样(每任务 30 case)+单模型全量,别一次烧全表。
§5.4 自家模型的评测接入:三件事
把你的 LVLM 接上本集:接口适配——输出必须可解析为选项(选项格式 option_format 已在 JSON 路径里预留变体),先跑 10 题格式验证;温度与提示——推理参数全记录(温度 0 的确定性输出是判分友好的默认);逐阶段日志——每题记录"到达阶段+选择+判定"三字段,为 §4.4 的条件通过率表备料。三件事的共同精神:评测的可信度一半在数据一半在 harness 纪律——官方协议已把数据侧做满,你的纪律决定另一半。
§5.5 抽样自证协议(边界值复核)
§4.8 缺口的主动应对(2-3 人日):每任务抽 Stage 3 的边界值 case(值域选项临界,如 CTR∈[0.49,0.51] 的图)各 5-10 例 → 一位放射科医师盲评(只给图与准则,不给管线答案)→ 分歧率统计(预期 <5%;>10% 该任务的阈值准则要重新审视)。产出:一张"管线答案-医师判断"一致性表入论文附录。这个协议的成本与 §5.9 教学实验同量级,但它是"你的评测结果可信"的最强背书——审稿人问"参考答案对吗"时,你有自己的数字。
§5.6 与 502/503 的联合装载方案
三集联合的完整环境(本集首次当主角):装载顺序 502(掩码+RCA)→ 503(std)→ 504(管线输出+考场) → 上游 MIMIC-JPG(Stage 1/3 原图必需)。join 键全部 dicom_id。联合分析的三层:层一(测量对照)——504 的 CTR 列 vs 502 掩码重算的 CTR(§4.12);层二(信任分层评测)——按 503 的 image-level std 把 1,200 case 分层,跑模型在"高信任/低信任"层的分数差(§7.5);层三(复核路由)——模型答错的 case 按掩码 std 排序进人工复核队列(三集管线的闭环)。装载对账锚:四态表(502 掩码/503 std/504 QA/MIMIC 图)按 dicom_id 全 join——1,200 case 的四态交集是评测的黄金子集。
§5.7 错误黑名单(本集特有十条)
- 用旧版 qa/ 路径——v1.0.1 修复前的 JSON 路径错误会让视觉输入静默缺失(§3.5)。
- HF 版跑考场——HF 版没有 QA(§2.7),别在错误平台上找考卷。
- label 跨任务合并——语义随任务变(§3.2),合并前查字典。
- 只报终局通过率——丢失失败谱,条件通过率才是报告格式(§4.4)。
- 边界值答案照单全收——抽样人工复核(§4.8/5.5)。
- 质量任务成绩高解读——自指风险(§4.9)。
- 跨任务分数混谈——CTR 的改进≠隆突角的改进(§4.6)。
- 推理参数不记录——温度/提示词是评测协议的一部分(§5.4)。
- 管线重跑答案与官方 QA 混用——双轨版本记录(§3.12)。
- 忘引 MIMIC——图像源的四件套引用链(§3.10)。
§5.8 可复现包模板
project/
├── configs/
│ ├── models.yaml # 被测模型清单+版本+推理参数
│ ├── sampling.yaml # 全量 vs 采样评测的 case 策略
│ └── upstream_versions.yaml # 504 v1.0.1 / MIMIC 版本 / harness commit
├── data/
│ ├── chexstruct/ # 15 CSV+字典(只读)
│ ├── cxreasonbench/ # qa JSON 树+叠加图(只读)
│ ├── mimic_jpg/ # 源图(Stage 1/3 需要)
│ └── results/ # 每模型每题的判定日志(append-only)
├── src/
│ ├── harness/ # 官方 harness+自家模型适配器
│ ├── audit/
│ │ ├── qa_count_check.py # §3.11 十条
│ │ └── format_sanity.py # 输出解析成功率(§5.2 层三)
│ ├── analysis/
│ │ ├── conditional_rates.py # §4.4 条件通过率表
│ │ └── idk_matrix.py # §4.5 诚实×能力散点
│ └── manual_review/
│ └── boundary_sampling.py # §5.5 边界值抽检
├── outputs/
│ ├── leaderboard_local.md # 你的模型成绩+条件通过率
│ ├── audit_report.md
│ └── calibration_review.md # 边界值一致性表
└── README.md
与 502/503 模板的差异:results/ 的 append-only 判定日志是评测类条目的灵魂——每题的原始记录是所有后续分析(含审稿质询)的最终依据。
§5.9 教学场景的最小实验
三个实验(无 GPU 可跑前两个):实验一(协议解剖):解包 qa.zip,按任务×路径×阶段统计题量,画 12×3 的题量热图——理解评测的结构设计(1 小时);实验二(失败谱复算):用论文附录的单模型逐题记录(若公开)或自己跑 20 case,画条件通过率的阶梯图——理解"错即终止"的信息量(2 小时,需 API);实验三(掩码生态联动):§4.12 的 CTR 对照实验——理解"管线输出与掩码层互验"的方法论(半天,需 502 数据)。实验序列的设计逻辑:从"看懂考卷"到"看懂成绩"到"看懂生态"——评测素养的三级台阶。
§5.10 与 505 CDSL 的双塔装载
批次五的评测双塔(本集+505)的联合协议:先本集后 505——本集的 Stage 3 输出(测量值/值域选择)是结构化数据的原型,505 的结构化评测协议可直接接在 Stage 3 之上(二阶评测:答对了值域之后,输出格式是否符合结构化规范);对账桥——两集若共享 case 源(MIMIC),dicom_id 双向 join 出"推理正确×格式合规"的四象限(§2.9 双塔的量化版)。装载次序的技术细节在 505 条目展开(制作 505 时回填)——本节的预留接口是批次五收官的伏笔。
§5.11 与 MIMIC-IV 的跨模态对齐(评测版)
§2.10 的提案落地协议:QA 的 dicom_id → MIMIC-CXR metadata → subject_id → MIMIC-IV 的超声/BNP/诊断表——把"Stage 3 的 CTR 判定"与"同一患者的真实心功能"对上。研究设计:模型判"有心扩大"且判对的 case vs 判错的 case,两组的真实 LVEF/BNP 分布差——推理错误是否伴随临床信号的真实偏移(若两组临床指标无差,错的是准则应用;若有差,错的是影像判读)——错误归因的临床锚。装载注意:Credentialed 数据间交叉引用的 DUA 复查(§2.10)+两库 access 的并行申请(§3.9)。
§3.19 逐任务列名速览(cardiomegaly 样例展开)
以招牌任务 cardiomegaly.csv 为例展示任务特定列的形态(列名以 column_descriptions.json 为准):
| 列 | 类型 | 推理链级别 | 语义 |
|---|---|---|---|
| image_file | str | — | dicom_id(MIMIC 版) |
| viewposition | str | — | PA/AP |
| label | int | Stage 3(阈值判定) | 1=心扩大 / 0=正常 |
| heart_xmin / heart_xmax | num | Stage 2(结构) | 心左右界端点 X 坐标 |
| thoracic_xmin / thoracic_xmax | num | Stage 2(结构) | 胸廓左右界端点 X 坐标 |
| cardiac_width | num | Stage 3(测量) | 心宽 = xmax−xmin |
| thoracic_width | num | Stage 3(测量) | 胸宽 = xmax−xmin |
| cardiothoracic_ratio | num | Stage 3(指数) | CTR = 心宽/胸宽 |
列名与四阶段的对齐关系这张表一目了然:landmark 列喂 Stage 2、测量列喂 Stage 3、label 是 Stage 3 的阈值判定结果——QA 的参考答案全部能溯源到 CSV 的具体列。其余 11 任务的列结构同型(landmark→测量→指数/判定),差异只在解剖对象与准则——这就是"同构管线"的红利:读懂一个任务=读懂 12 个。
§4.13 失败谱分析的标准报表格式
评测论文/报告的失败谱三表模板(可直接搬):表一(总览):行=12 任务,列=被测模型,值=终局通过率——全局格局一图收拢;表二(条件通过率阶梯):行=Stage 1/1.5/2/3,列=模型,值=条件通过率(每级到达者中的通过比例)——薄弱环定位;表三(路径流量):初始决策的 Yes/No/IDK 分布×三路径的完成率——IDK 行为与终止点分布。三表的共同原料是逐题判定日志;三表的读者分工:表一给管理者、表二给模型开发者、表三给对齐研究者。官方论文的报告与这三表结构基本同构——本格式是对官方呈现的工程化整理,复用无版权障碍。
§5.14 API 评测的成本明细表
12 模型全量复跑的账本拆解(单价按 2026 年市价浮动,结构比数字重要):
| 成本项 | 单位成本 | 全量规模 | 小计 |
|---|---|---|---|
| 视觉输入 token | 每 QA ≤4 图 ×(图 token 化 1-2k/图) | 18,988 QA | 视觉 token 主体 |
| 文本输入 token | 题干+选项+系统提示 | 18,988 QA | 次要 |
| 输出 token | 选项短输出 | 18,988 QA | 可忽略 |
| 重试与格式失败 | 解析失败重试率 5-15% | 乘数 | 常被漏算 |
| 多次运行(方差) | 温度>0 时 ×3 | 乘数 | 温度 0 可省 |
三个省钱杠杆按效力排序:采样评测(每任务 30 case=总量 1/4,统计功效足够);温度 0(省掉 ×3 的方差运行);格式预验证(重试率压到 0)。全量 12 模型的万元级账单,采样+两杠杆后可压到 1/5 以下——评测的经济学与评测的方法学同样值得设计。
§5.15 评测结果入库的最小 schema
逐题判定日志的表结构(SQLite/Parquet 通用):
CREATE TABLE judgments (
model_id TEXT, -- 模型名+版本+快照号
task TEXT, -- 12 任务名
case_dicom TEXT, -- dicom_id
path TEXT, -- path1/path2/reeval
stage TEXT, -- stage1/1.5/2/3
question_ref TEXT, -- qa.json 路径锚
model_choice TEXT, -- 模型原始选择(可解析化后)
is_correct INT, -- 判分
terminated_here INT, -- 是否错在此级终止
tokens_in/out INT, -- 成本核算
latency_ms INT,
run_ts TEXT, -- 时间戳(成绩时效的锚)
run_params TEXT -- 温度/提示词版本(JSON)
);
13 个字段覆盖 §7.11 六族特征的全部原料需求——评测的二次分析(失败谱/公平性/成本)都在这张表上做,别让判定日志散落在 print 里。
§3.20 五个平台/仓库的版本对齐矩阵
双栖资源+代码库的版本追踪矩阵(复现实验前先填此表):
| 资产 | 版本锚 | 获取处 | 对齐检查 |
|---|---|---|---|
| PhysioNet 数据包 | v1.0.1 + 下载日期 | PhysioNet 内容页 | §3.11 十条 |
| HF 管线输出 | commit/数据卡版本 | HuggingFace 卡片 | 三源行数 vs 卡片口径 |
| 评测 harness | GitHub commit hash | github.com/ttumyche/CXReasonBench | README 的版本声明 |
| 论文 | arXiv v1/v2 + NeurIPS camera-ready | arXiv/ proceedings | 成绩口径(10 vs 12 模型) |
| 源图 | MIMIC-CXR-JPG v2.0.0 | PhysioNet(同凭证体系) | dicom_id join 保留率 |
矩阵的用法:任何一次评测跑批前五格填齐——审稿人问"你评的哪个版本"时,答案要能精确到 commit hash。
§4.14 与官方成绩表的差异诊断流程
复跑成绩 ≠ 论文数字时的七步诊断:① 模型版本——API 快照号/checkpoint 是否与论文一致(漂移最大来源);② 温度与提示——是否逐字对齐 harness 默认;③ 解析率——输出解析失败率是否为 0(格式失败会伪装成答错);④ 视觉输入——v1.0.1 验证+4 图完整性(旧版路径错误是历史事故);⑤ 判分边界——值域选项的边界 case 处理是否与 harness 一致;⑥ 采样偏差——若复跑用采样,与论文全量的差异是否在二项置信区间内;⑦ 不可解释残差——以上全对仍差 >2 分→issue 报告官方(可能 harness 或数据更新)。七步的诊断顺序按"工程可能性递减"排列——先怀疑自己,再怀疑考卷,最后才怀疑论文。
§5.16 评测报告的最小披露清单
对外发布评测结果前的自查清单(论文/博客/内部报告通用):□ 版本三元组——数据 v1.0.1+harness commit+模型快照号;□ 推理参数——温度/提示词/最大输出长度;□ 报告格式——条件通过率(不只终局)+任务分层;□ 采样声明——全量 or 采样(采样给出置信区间);□ 成本披露——token 用量(可复现性的经济维度);□ 泄漏声明——被测模型的训练数据披露状态(以其技术报告为准);□ 边界值处理——是否人工复核过临界 case;□ 利益声明——评测者与被测模型方的关系(自家模型参赛时的自评偏差声明)。八项全披露的评测报告,是"可被审计的评测"——这正是本集立意(可解释评测)在评测者身上的镜像要求。
§5.12 一周评测排期表:从签约到首份成绩
周一(合规日):提交 CITI 证书与 DUA 签署、验证区域可访问(§3.9 三步的第一步走完);同步申请 HF 半(即时可得)先行解包做目录与字段侦察。周二(装载日):PhysioNet 半下载(39 GB 级的解压与校验)、15 CSV 入库、QA 树解包、与 HF 半的 §3.7 对账。周三(校准日):跑 100 题校准子集(§7.11),验证多图输入/判定脚本/错即终止循环三件套,跑通即停——周三不求成绩只求管线。周四(全量日):提交全量评测作业(API 路线等价格窗口,本地路线排队),当晚产出 §7.3 日志的雏形。周五(分析日):条件通过率阶梯+IDK 分布+任务热图三图产出(§7.5),与论文口径做 sanity 对照。周末缓冲。一周排期的依赖关系:合规是关键路径(周一没过审,后面全顺延),算力是第二依赖(周四的全量日要提前一天占卡)——排期的两个开工信号:CITI 证书到手+卡位已订。
§5.13 故障演练五项:评测团队的消防演习
正式评测前的五项演练,每项 30 分钟内完成:演练一(版本错位演练)——故意用 v1.0.0 的 QA 树跑 10 题,观察图片路径报错的形态,让团队认识坑点 3 的现场长相(识别错误比记忆清单有效);演练二(多图丢失演练)——在 prompt 构造里故意只传第一张图,对比成绩断崖,验证评测框架的多图传参真的生效;演练三(判定器污染演练)——把同义归一表删掉跑 20 题,统计因 “Yes/yes/YES” 形态差异造成的假阴性率——这个数字会出现在 §7.23 报告的校准段,证明判定器的必要性;演练四(日志回放演练)——从 §7.3 日志中随机抽 10 条记录,仅凭日志字段复现该题的完整判定过程——复现失败=日志字段缺失,发版前修;演练五(凭证失效演练)——模拟 API key 过期/PhysioNet 会话失效时的报错路径与告警触达(半夜跑全量时挂了谁收到通知)。五演练的共同目的:把故障的第一次相遇从正式评测夜挪到演习场——评测工程的稳健不是设计出来的,是演练出来的。
§5.14 评测结果的应用出口:从成绩单到立项书
一份评测报告在组织内的四种去向与对应格式:去向一(模型发布门禁)——成绩单进模型卡(model card)的评测段:用 §7.23 八段式,附阶段分解表;门禁线建议不设绝对分(无历史锚)而设"无 Stage 1 断崖+IDK 行为合理"两条件——过程健康比分数重要。去向二(采购验收)——医院信息科对厂商的验收标准:要求厂商按本基准提交成绩+允许抽查日志(§9.9 Q78)——把 §7.14 的审稿话术翻成合同附件的技术规格。去向三(研究立项书)——从错误形态学反推改进立项:Stage 1 弱→准则知识注入项目;Stage 2 弱→解剖 grounding 微调项目(可引 502 数据);Stage 3 弱→数值推理训练项目——§2.13 三张工单的立项书模板:问题(哪个 Stage 的哪种失败)/证据(条件通过率阶梯)/方案/预算/验收(重测阶梯的改善幅度)。去向四(团队路线图)——季度复测的制度化:每次模型迭代跑 100 题校准子集做回归测试(§7.1 喂法二),成绩曲线进团队 dashboard——评测从"一次性考试"变成"持续监护"。四去向的公共纪律:所有出口都从同一份 §7.3 日志出发——一次评测,四种消费,这是评测工程的杠杆率所在。
§5.15 从本集回看掩码两集:使用者的三段反思
用完考卷再回看原材料,三点反思写给 502/503 的使用者:反思一(掩码的价值分层)——在 502/503 语境里掩码是"分割训练资产",在本集语境里它们是"测量的中间证据"(Stage 2 的选区依据)——同一资产在不同应用层的验收标准不同:训练看 Dice,测量看 landmark 精度与测量复现性。选掩码数据前先想清楚要哪一层价值。反思二(不确定性的两层去向)——503 的 std(数据侧不确定性)回答"这个掩码可信吗",本集的 IDK(模型侧不确定性)回答"这个模型自信吗"——两层的交汇点(§7.21)才是完整的可信度闭环:数据带公差、模型带自觉、审计带依据。反思三(开放与门槛的再平衡)——掩码两集 Open(生态优先)与考卷 Credentialed(防污染优先)的分工,让使用者重新审视自己资产的发布策略:训练数据开放带来的生态红利,与评测工具开放带来的刷题风险,是不可互相替代的两种账——本系列四个条目(502/503/504/505)合起来就是这份账的全谱。
§3.22 12 任务 × 三路径的题量核算表
| 路径 | QA 数 | 构成逻辑 |
|---|---|---|
| Path 1 | 8,044 | binary 作答 case × 四阶段的实际配题(部分任务无 1.5) |
| Path 2 | 3,600 | IDK 作答 case × 引导阶段配题 |
| Re-evaluated Path 1 | 7,344 | 引导完成 case × 重测配题(省 1.5) |
| 合计 | 18,988 | 1,200 case × 平均约 15.8 题 |
核算表的用途:解包 qa.zip 后逐路径计数与官方口径对账(§3.11 第 5 条)——计数对不上=解析或版本问题,先修工程再谈成绩。
§5.16 评测工程的可迁移资产:做完这单你留下了什么
一次本集评测交付后,团队账面上留下的五项可复用资产(评测工程常被当成一次性项目,实为能力基建):资产一(判定管线代码)——QA 树解析/多图拼接/错即终止循环/选项归一——这套代码对任何"结构化过程评测"(未来器官、未来基准、自家内部考试)改配置即用;资产二(§7.3 日志基建)——14 列日志 schema+回放工具+哈希链——是团队所有后续模型评测的审计底座;资产三(锚与校准子集)——100 题校准子集+三锚协议(§7.22)——复用于任何医学评测的可信度快速通道;资产四(合规履历)——CITI 证书+DUA 签署记录+合规发布先例(§8.6 三节点)——下一个 Credentialed 数据集的申请周期直接减半;资产五(错误形态学语料)——本集评测攒下的逐题失败案例库——是 error analysis 论文、模型迭代 backlog、甚至评测题目改进建议(回馈官方)的三用原料。资产的复利估算:首测投入 3 周(§7.18),二测(新模型版本)边际成本 3 天——评测做得越久,单位信息的成本越低,这是"评测是成本中心"论者最常算错的一笔账。
§6 官方成绩单与战略视角:读成绩、选赛道、避深坑
§6.1 官方结论的精确表述:三句话拆开读
论文摘要关于结果的表述可拆成三个可独立引用的命题:命题一(覆盖面)——评测了 10 个 LVLM(v1 论文口径;v2 摘要扩至 12 个),覆盖开源与闭源、通用与医学专用;命题二(现象)——“Even the strongest struggle with structured reasoning and generalization”,最强模型也在结构化推理与泛化两项上挣扎;命题三(机制)——模型难以把抽象临床知识(如 CTR 准则)与解剖视觉证据(心界识别)可靠连接。引用纪律:命题一必须带版本(v1 的 10 与 v2 的 12 是两个口径,混用会被审稿人抓住);命题二适合作为动机引用;命题三是机制层结论,适合作为"为什么评中间步骤"的论据。三命题的引用场景差异,§7.14 审稿话术里逐一给出模板。
§6.2 自证边界:管线作者评自己的考卷
一个必须诚实面对的结构性事实:CheXStruct 管线(出题人)与 CXReasonBench(考卷)出自同一团队,参考答案来自管线输出加专家复核(1,200 case 的掩码全检),而非独立第三方仲裁。这带来三类系统风险:风险一——管线的系统性偏差会同时出现在题目与参考答案里(比如某 landmark 定位习惯性偏移,测量型题目的"正确值域"整体漂移);风险二——专家复核只覆盖 1,200 case,管线全量输出(15 CSV 母池)的尾部长尾质量未知;风险三——12 LVLM 的"全线挣扎"部分可能是考卷噪声而非模型无能(若某任务参考答案错误率 5%,模型在该任务的成绩天花板就是 95%)。论文对此的缓解是任务级质控过滤(§3.3 三件套)与专家共定准则(§1.5),使用者应把这三种风险写进自己的 limitation 段——用本基准批评模型时留三分余地,是方法学上的自我保护。
§6.3 引用结构:四件套的组装顺序
正式引用链四件(§3.10 提过清单,这里给组装逻辑):数据引用(PhysioNet DOI 10.13026/d14j-1b45,v1.0.1 固定版)+ 方法引用(arXiv:2505.18087 / NeurIPS 2025 D&B Track 正式版,以 NeurIPS Proceedings 页为准)+ RRID(SCR_007345,基金申请书与方法节需要)+ 代码引用(GitHub 仓库,评测复现时引)。顺序原则:数据用 DOI、方法用论文、资源标识用 RRID、复现用仓库——四者不可互相替代。常见错误:只引 arXiv 不引 PhysioNet DOI(数据不可溯源)、引 v1.0.0 的 DOI 但实验用的是 1.0.1(版本错位)。BibTeX 的直接取用位置:PhysioNet 版本页 citation 区提供现成条目,HF 数据卡提供第二种格式——两处都复制进引用管理器,按目标期刊风格选用。
§6.4 与 502 的决策矩阵:掩码资产 vs 推理考卷
同一解剖测量能力,502(CheXmask)与 504(CXReasonBench/CheXStruct)提供了两种可采购形态,选型矩阵四象限:要量产掩码(训练分割模型/做解剖统计)→ 502,65 万张的规模优势不可替代;要量产测量(CTR/纵隔宽度等 12 项指数的全量提取)→ 504 的 CheXStruct CSV(管线即服务,虽然母池规模取决于你跑得动多少图);要评模型的推理过程→ 504 的 CXReasonBench(18,988 道带过程标注的题);要评模型的掩码质量→ 502 + RCA 质控范式(502 条目 §6 的官方基线)。交叉点:CheXStruct 的管线质量本身可以用 502 掩码做外部校验(同一张图两套掩码的 Dice)——§4.12 的兼容性实验就是这座桥。一句话选型:502 是原材料市场,504 是质检考卷——买材料还是买考卷,取决于你的产出是模型还是报告。
§6.5 机会地图十向
基于"结构化推理评测刚起步"的判断,十个可切入方向按门槛排序:①复现+扩模型(把 12 LVLM 更新为当前 SOTA,发布 2026 复测报告——门槛最低,时效红利最高);②多语言准则(Stage 1 的临床准则目前是英文,中文准则下模型成绩差多少——本地化研究空白);③跨库泛化(MIMIC 训练的模型在 HF 版三库上的 Path 1 成绩差——§2.7 双平台结构的直接利用);④错误传播建模(Stage 2→Stage 3 的条件错误率矩阵,对比 MoE/CoT 架构差异);⑤IDK 校准曲线(模型自信度与正确率的关系,IDK 阈值扫描);⑥掩码生态互验(§4.12,用 502 检验 CheXStruct 测量的外部效度);⑦教学增益长期追踪(Re-evaluated Path 1 的多轮版本——教一次不够,教三次呢);⑧结构化输出联动(与 505 的双塔二阶评测);⑨推理错误-临床真实相关性(§5.11/§7.15,MIMIC-IV 锚定);⑩基准污染检测(LVLM 预训练语料是否已吞下本基准——canary 字符串与 membership inference)。前四向单卡可做,六至十向需要多库凭证与算力。
§6.6 团队与资助的延续性观察
Edward Choi 组(KAIST 机器学习实验室)的脉络:本集的第一作者 Hyungyung Lee 与合作者是该组医疗多模态系列的延续(组内此前有面向医疗 LVLM 的数据与评测工作传统)。资助结构值得注意:Microsoft Research Asia + 韩国国家级四源(IITP 两期/KHIDI/NRF/MSIT-MOHW 医科学家训练计划)——学术主导、工业资助、无医院方直接主导的三角结构,决定了本集的立场是"方法学优先于临床部署"(与医院主导的、以部署为目标的基准形成互补)。临床侧的两位作者(SNU Hospital 的 Jung-Oh Lee 与 Seoul Medical Center 的 Hyuk Gi Hong)保障了准则的临床合法性——12 任务的准则定义出自临床专家而非纯文献挖掘,这是 §4.2 参考答案可信度结构里"专家定义准则任务"标记的来源。追踪建议:该组的后续版本(v2 摘要已扩到 12 LVLM)与 GitHub issues 是观察基准演进的第一现场。
§6.7 Challenge 类型的稀缺性:PhysioNet 的另一个物种
PhysioNet 的内容类型里,Database(数据集)占绝对多数,Challenge(挑战赛)是独立物种——本集是本系列 Top 1000 里遇到的第一个 Challenge 类型条目(501-503 全是 Database)。物种差异三条款:条款一——Challenge 常伴比赛窗口期(官方排行与提交窗口),赛后数据仍在但排行榜冻结(截至快照,本集版本页未见活跃比赛窗口,属"赛后存续"状态);条款二——Challenge 的元数据更偏协议而非样本(版本页的重心是评测协议而非数据字典,数据字典由 column_descriptions.json 补位);条款三——引用时类型标注易错:把 Challenge 写成 Database 会让检索者漏检。对系列的意义:Top 1000 的"数据集"口径实际是"数据资源"——Challenge/软件集合/模型卡等物种都在收录射程内,本条目是口径扩展的第一个样本。
§6.8 坑点八条:老手也会踩的地面
坑点 1:版本口径——v1.0.0(10-15)与 v1.0.1(10-23)DOI 不同,arXiv v1/v2 的 LVLM 数量不同(10→12),四处版本号两两组合有 16 种错法;坑点 2:平台混淆——PhysioNet 版(MIMIC 源)与 HF 版(NIH/VinDr/OpenI 源)不重叠,“我下载了 CXReasonBench"这句话必须追问是哪一半;坑点 3:QA 树的图片路径——v1.0.0 的 qa/ JSON 有路径错误,v1.0.1 修复,用旧版跑评测会大面积"图片不存在"假失败;坑点 4:错即终止的统计陷阱——直接把各 Stage 正确率平均会高估整体能力(越往后样本越偏向强者,幸存者偏差),必须用条件通过率或联合概率;坑点 5:viewposition 缺失——HF 版 OpenI 源的 viewposition 是 N/A,凡按投照位分层的分析在 OpenI 子集上不可做;坑点 6:区域限制——PhysioNet 对部分地区返回不可用提示,团队选型前先验证可访问性(§2.8);坑点 7:母池≠基准——CheXStruct 15 CSV 是全量管线输出,CXReasonBench 只是从中抽的 1,200 case×12 任务,拿 15 CSV 的分布去描述"基准难度"是口径错误;坑点 8:成绩半衰期——12 LVLM 的成绩是 2025 快照,2026 年引用需注明"论文时点成绩”,模型迭代后数据点失效但协议永续。
§6.9 使用前自查十问
接入本基准前逐问打勾:①我评的是"推理过程"还是"最终答案"?若是后者,本基准是杀鸡用牛刀且口径不合;②我申请的是哪一半(PhysioNet/HF)?两半的源库与任务覆盖差异我清楚吗(§3.7 对账协议);③我的模型支持多图输入吗?每 QA 最多 4 张视觉输入,单图模型需要降级协议;④我对 I don’t know 选项的处理策略是什么(惩罚/中性/鼓励)?这直接改写 IDK 行为测量(§4.5);⑤我的评测脚本处理"错即终止"了吗(§6.8 坑点 4);⑥我的抽样自证方案是什么(§5.5 边界值复核)?管线参考答案需要抽检校准;⑦我的成绩报告会带版本三元组吗(数据 1.0.1/论文 v2/模型版本)?⑧我的 DUA 合规链完整吗(CITI 证书+DUA 签署+区域验证,§3.9);⑨我发布成绩时的许可声明符合 Credentialed License 1.5.0 吗(不得公开原图与逐题数据,§8.3);⑩我的结论表述是"在该基准上"而非"在胸片诊断上"?任务面窄(§2.6),外推要有边界。
§6.10 故障诊断树:评测跑不通时的五岔口
岔口 A:图片大面积加载失败→ 先查 qa/ JSON 的 img_path 与解包目录结构是否对齐(坑点 3,v1.0.1 修复的正是这个)→ 再查 segmask_bodypart.zip 与 pnt_on_cxr.zip 是否都在位(Path 2 Stage 2 需要叠加图);岔口 B:模型答案全为同一选项→ 查 prompt 模板的选项顺序是否固定未打乱(位置偏差)→ 查多图输入是否被框架静默丢弃(只发了第一张);岔口 C:成绩远高于论文→ 高度怀疑任务子集泄漏(模型见过 MIMIC 图或基准本体,§6.5 方向⑩)→ 用 Re-evaluated Path 1 的新 case 子集复测;岔口 D:成绩远低于论文→ 查 Stage 1 准则选择的 prompt 是否被截断(准则文本长)→ 查测量型 Stage 3 的值域格式是否匹配模型输出习惯;岔口 E:参考答案疑似错误→ 先跑 §5.5 抽样自证(边界值复核 CTR 等)→ 确认后在 GitHub issues 提交(官方勘误通道,v1.0.1 的先例证明该通道有效)。五岔口的共同第一动作:核对版本三元组(§6.8 坑点 1)——一半的"故障"是版本错位。
§6.11 静态资源里的活跃信号:赛后存续的维护模型
本集的维护活跃度要分两半读:PhysioNet 半——v1.0.0→v1.0.1 的 8 天勘误(移除未用 keys+修复 qa 路径)是"活维护"的强证据,但此后版本号未再演进,赛后存续状态;HF/GitHub 半——开源版的更新责任在团队仓库(issues 通道活跃度是观察点),arXiv v2(2025-10-27,扩至 12 LVLM)说明团队在论文层面持续迭代。三层信号合成的判断:协议稳定、成绩滚动——评测协议(18,988 题的结构)不太会大改,但被测模型的成绩会随团队后续论文滚动更新。使用策略:把"协议"当固定资产引用,把"成绩"当快照引用(带时间戳)。风险提示:赛后 Challenge 若无 v1.1 计划,长期维护依赖社区(issues 修复而非官方版本发布)——§10.8 观察清单把"v1.1 是否发布"列为季度回访项。
§6.12 稀缺性评估:结构化推理评测的竞争格局
医疗多模态评测的三层供给现状:第一层(答案级)——VQA 类基准(图→答案)供给充分,本系列 499(CIED 检测)等都是其语境;第二层(过程级)——评推理步骤的基准稀缺,本集是胸片领域首个规模化供给(18,988 题带阶段结构),NeurIPS D&B 收录即社区背书;第三层(临床级)——评"推理错误与临床结局相关"的基准接近空白(§5.11 是手工方案)。本集卡位第二层且有先发优势,但竞争者会来:通用领域的多步推理评测方法(过程奖励模型 PRM 的评测思路)向医疗迁移是可预期路线。护城河判断:本集的护城河在"管线+考卷+专家准则"的垂直整合与 PhysioNet 合规位——单抄考卷容易,重建管线与准则合法性难。对使用者的含义:现在接入是买方市场(基准新、竞争少、引用红利期),两年后是卖方市场(大家都有成绩,边际价值递减)。
§6.13 四连对照终版:批次五掩码-评测线的完整拼图
| 维度 | 502 CheXmask | 503 CheXmask-U | 504 CXReasonBench | 505 CDSL |
|---|---|---|---|---|
| 资源类型 | Database | Database | Challenge | Database(待核) |
| 核心交付 | 657,566 张掩码 | 同左 + 地标 std | 18,988 QA + 15 CSV | 结构化输出基准(待核) |
| 产出形态 | 像素级资产 | 资产+不确定性 | 协议+考卷 | 协议+考卷 |
| 访问 | Open | Open | Credentialed | 待核 |
| 论文 | Sci Data 2024 | 无论文 | NeurIPS 2025 D&B | 待核 |
| 评测对象 | —(数据本身) | —(数据本身) | 12 个 LVLM | LVLM(待核) |
| 评测维度 | RCA 质控分 | 地标 std | 三路径阶段成绩 | 结构化合规(待核) |
| DAIMS | 6.3 | 6.5 | 6.3 | 待评 |
四连的叙事收束:502 给"原材料",503 给"原材料的公差说明",504 给"用原材料组织生产的质检考卷",505 给"产品出厂的格式规范"——胸片 AI 从像素到报告的四级供应链。本集在链条里的独特性:唯一以模型为被测对象的环节,也是唯一"成绩会过期"的环节。
§6.14 十问十答:决策者的高频问题
Q1 一句话这是什么?——给 LVLM 的胸片诊断推理装了行车记录仪的 18,988 道题的考场,评每一步操作而不只看终点。Q2 和 VQA 基准有何不同?——VQA 评答案,本集评"准则选择→解剖识别→测量计算"的中间步骤,且每步可判错因。Q3 为什么设 I don’t know?——把"知道自己不知道"制度化为被评能力,过度自信因此可测量(§4.5)。Q4 Re-evaluated Path 1 是什么?——教过一遍后在新 case 重测,量"引导增益",把教学效果变成指标。Q5 数据要花钱吗?——不要钱但要资格:CITI 证书+DUA 签署+区域可用(§3.9)。Q6 中文团队能用吗?——能用,但 Stage 1 准则是英文且存在区域访问风险,先验证可访问性;中文准则本地化是机会(§6.5 方向②)。Q7 成绩能直接写进论文吗?——能,带版本三元组与时间戳;若模型在 MIMIC 上预训过,须声明泄漏风险。Q8 和 502 哪个好?——不是竞争关系:502 是掩码资产,本集是推理考卷(§6.4 矩阵)。Q9 最大短板?——参考答案的管线自证结构(§6.2 三风险)与任务面窄(12 项不含需临床史的疾病)。Q10 一年后还值得用吗?——协议永续、成绩过期;协议的半衰期以年计,成绩以月计。
§6.15 增量策略:三种角色的接入深度
角色一(评测使用者,最浅):申请两半数据→跑 1,200 case 的 Path 1→报告成绩单,投入约 2 周,产出是"我的模型在结构化推理上的体检表";角色二(方法改进者,中深):在角色一之上加错误传播分析(§7.6)与 IDK 校准(§7.5),反推自家模型的训练侧改进(准则知识注入/解剖识别微调),投入 1-2 月,产出是改进闭环;角色三(基准共建者,最深):复用 CheXStruct 管线扩展新任务(如肋骨病变测量)、或用 502 掩码做管线外部校验后向社区提交质量报告,投入一学期起,产出是方法学论文。三条路径的共同起点都是 §3.9 的三步访问流程——差别在第二周之后的分岔。资源有限的团队的务实建议:先角色一后角色二,角色三等第一手错误数据积累后再决定。
§6.16 时代定位:2025 年的医疗 LVLM 评测节点
把本集放回时间轴:2023-2024 是医疗 LVLM 的爆发期(CheXAgent/RadVLM/HealthGPT 等专用模型密集发布,成绩以 VQA 准确率计量);2025 是"答案级评测失宠、过程级评测登场"的转折年——本集 5 月挂 arXiv、10 月 NeurIPS D&B + PhysioNet 双栖上线,恰是转折的标志物。行业背景:通用领域 2024-2025 的推理模型热(o1 类)让"过程质量"成为显性议题,医疗社区的跟进就是本集这类工作。前瞻判断:答案级成绩(VQA 准确率)的信息含量将持续贬值,过程级与临床级评测的权重上升——本集的协议设计(三路径+阶段结构+IDK 制度化)大概率被后续基准继承,协议引用寿命会长于数据引用寿命。对 Top 1000 系列的意义:收录本集是给"评测类条目"立模板——2026 年以后同类条目(含 505)按此格式组织。
§6.17 上游依存:断供风险与替代链
本集的四级上游:MIMIC-CXR-JPG(PhysioNet 版的图源,Credentialed,稳定性高——MIT 数据生态的长期维护记录)→ NIH CXR14/VinDr-CXR/OpenI(HF 版图源,全公开,断供风险低)→ 解剖分割模型(管线第一级,团队未在版本页指明具体模型来源,复现者需读 GitHub 代码确认——这是依存链上唯一未完全显式的环节)→ 临床准则(12 任务的专家定义,论文附录为准)。断供推演:图源断供(极低概率)不影响已发布的 QA 与 CSV(已是衍生品);管线代码断供影响新任务扩展(已交付物不受影响);准则文本断供影响 Stage 1 评测(论文附录是备份源)。整体判断:交付物形态是"已固化的衍生数据",上游断供不侵蚀存量——这是衍生数据集对使用者的隐性保险,也是与"直播式 API 服务"类资源的本质差异。
§6.18 先发与攻防:作为后来者的位置策略
若你的团队想进入结构化推理评测赛道,本集的存在既是标尺也是靶子。攻(找它的错):参考答案的管线自证结构(§6.2)是最可攻击的软肋——用 502 掩码+独立医师标注做第三方仲裁,发布"参考答案质量审计",这是高引用量的批判性工作;防(避免同质化):不要做"复刻本集在别的器官"的平移工作(腹部/脑部的结构化推理基准)——管线可复用但创新含量低,审稿与引用都难突破原作;借(站在肩上):把本集协议当成组件——三路径结构+IDK 制度化+Re-eval 增益设计可拆解复用到自有任务上,引用本集作为协议来源,这是最被鼓励的姿势。合(直接共建):向团队提交扩展任务提案(GitHub issues),成为 v1.x 的贡献者——基准类工作的贡献者身份比独立竞品的引用更可持续。四策略的排序建议:借>合>攻>防。
§6.19 五种消费形态:这份资源最终被谁怎么用
①模型体检表(评测工程师)——18,988 题跑分,产出雷达图与阶段分解,最主流形态;②教材(医学 AI 课程)——三路径设计是"如何评测推理"的活案例,§7.19 课程直接用它;③错误样本库(模型开发者)——Path 2 的引导文本与 Re-eval 重测对,本质是"纠错教学对",可蒸馏为训练数据(注意许可:Credentialed License 下的衍生训练用途需复查 §8.3);④方法学模板(基准构建者)——管线架构(分割→测量→指数→阈值→质控)是可迁移的工程蓝图,迁移到新器官/新模态;⑤行业诊断书(管理者/投资人)——"12 个最强模型全线挣扎"是医疗 AI 落地风险的量化证词,用于泼冷水的场合比用于刷分的场合多。五种形态的受众从技术到商务全覆盖——这解释了为什么一条 Credentialed+低 Views(73)的资源仍值得百科条目:Views 低是因为门槛高,不是因为没有价值。
§6.21 12 任务的题量结构与失败模式预期
| 任务 | 推理链类型 | 失败模式预期(C 级推断) |
|---|---|---|
| cardiomegaly | 测量-指数-阈值 | 12 任务中预期最佳(课本知识加持) |
| mediastinal widening | 测量-阈值 | 中等(边界定义弱于 CTR 共识) |
| carina angle | 角度测量 | 偏难(空间角度是 LVLM 短板) |
| trachea deviation | 方向识别 | 偏难(走行判断需空间推理) |
| aortic knob / ascending / descending enlargement | 测量-阈值 | 中等(解剖定位是前置瓶颈) |
| descending aorta tortuous | 形态识别 | 难(迂曲无量化共识) |
| inclusion / inspiration / rotation / projection | 规则-感知 | 分化大(规则客观性参差+自指风险) |
预期表的用法:新模型首测后与本表对照——实测难度排序若与预期严重不符,先查解析与判分(§4.14 七步)再谈能力。
§7 实验提案库:二十四个可直接开工的方向
§7.1 五种喂法:协议的五种使用姿势
喂法一(全量跑分):1,200 case×12 任务全跑,产出官方口径可比成绩——基线姿势;喂法二(分层抽考):按任务×路径×阶段分层抽样 10% 复跑,用于快速迭代期的回归测试;喂法三(单阶段深挖):只跑 Stage 1(准则选择),把模型当"准则检索器"评测——最小算力隔离知识层能力;喂法四(双模型对照):同一模型跑 Path 1 与 Re-evaluated Path 1,差值即引导增益的个体画像;喂法五(考卷反向用):把 QA 树当结构化教学数据(SFT),喂给小模型做推理蒸馏——考卷变教材,§6.19 形态③的工程化。五喂法的算力梯度:全量跑分最贵(18,988 题×多图推理),喂法三最省(仅 Stage 1 单轮文本+图)。
§7.2 30 分钟最小实验:看见"错即终止"
无凭证状态下即可做的协议解剖:下载论文附录与 GitHub 的 QA 树结构样例(若团队公开样例 JSON),统计一个任务(如 cardiomegaly)的 Path 1 题量按 Stage 的分布——画出"Stage 1→1.5→2→3"的题量衰减曲线。这条曲线就是"错即终止"的形状:每过一个 Stage,幸存者变少。读懂衰减斜率,就读懂了为什么平均正确率是误导性指标(§6.8 坑点 4)。进阶:用论文报告的各阶段成绩反推联合通过率,与官方口径对照——手算一遍胜过读十遍协议。
§7.3 逐题判定日志协议:评测的基建
每一次评测运行的原子记录表:run_id / dicom_id / task / path / stage / prompt_hash / raw_output / parsed_answer / ref_answer / correct / latency / token_cost / model_version / eval_timestamp——14 列,append-only,永不覆写。三条纪律:纪律一——raw_output 原样存(截断/清洗后的版本放 parsed_answer,两者并存),审稿质询时原始输出是最终证据;纪律二——prompt_hash 固化每次提示词版本,实验间可比性的锚;纪律三——eval_timestamp 与模型 API 版本号绑定(闭源模型的静默更新是成绩漂移的隐形来源)。这份日志是 §7.6 误差传播矩阵与 §7.5 IDK 校准的原材料——日志结构设计先于实验设计,是评测工程的第一课。
§7.4 I don’t know 的行为分析实验
研究问题:模型的 IDK 选择是"能力感知"还是"随机逃生舱"?设计:全量 Path 1 记录中提取 IDK 事件的分布——按任务(IDK 率在测量型 vs 识别型任务的差异)、按 Stage(Stage 1 的 IDK 是知识缺位,Stage 3 的 IDK 是计算信心不足)、按与正确率的关联(高 IDK 任务是成绩差还是弃权多)。产出三张图:IDK 率任务热图、IDK 率×条件正确率散点(高 IDK 且高正确=良好校准;高 IDK 且低正确=合理弃权;低 IDK 且低正确=过度自信重灾区)、IDK 后引导增益分布(弃权换来的提升值多少钱)。这个实验把 §4.5 的哲学讨论落成数据,且是论文未做透的方向——增量明确。
§7.5 条件通过率阶梯:读懂存活的形状
把 §4.4 的存活分析类比落成实验:对每个任务计算 Stage 1→1.5→2→3 的条件通过率 P(S_k | S_{k-1}),画成阶梯图;对模型对(强 vs 弱)叠画对比。三个读数:阶梯形状——均匀缓降(能力平均分布)vs 首级断崖(Stage 1 准则选择是普遍瓶颈)vs 末级断崖(测量计算是瓶颈)——形状直接指示改进投资的落点;模型对的形状差——强模型的增益在哪一级、弱模型卡死在哪一级;任务的形状差——12 个任务的阶梯形状聚类,同类任务共享瓶颈的假设检验。全部只依赖 §7.3 的日志,无新算力需求。
§7.6 Stage 2→Stage 3 误差传播矩阵
结构化推理的核心定量问题:解剖识别错误(Stage 2)对测量正确率(Stage 3)的因果贡献有多大?设计:构造混淆矩阵——Stage 2 选区对/错 × Stage 3 答对/错,计算 P(S3 对 | S2 对) 与 P(S3 对 | S2 错) 的差值。差值大=S2 是 S3 的真瓶颈(改进识别即改进测量);差值小=S3 有独立错误源(测量计算本身弱)。按任务分解:CTR(两把卡尺+比值)vs 气管偏移(方向判断)的传播结构应当不同——测量型与识别型的误差传播是否有质差,是论文未回答的问题。注意因果解释的边界:观察性矩阵,S2/S3 错误可能同源于更上游的图像理解缺陷(混杂),结论表述用"关联"而非"因果"。
§7.7 引导-内化增益的量化协议
Re-evaluated Path 1 是全基准最有教学价值的部分,量化协议三步:定义增益——G = Acc(Re-eval) − Acc(初测 Path 1),按任务×模型分解;校准对照——G 与"初测错题率"的关系(增益是修复错误还是巩固已会?理想教学修复错误,现实可能只是重测效应);跨任务泛化——cardiomegaly 上教的知识,在 aortic knob enlargement 上有没有残余增益(准则结构相似的任务间迁移)?三个读数合起来回答:“引导式教学在模型上的投资回报率是多少、花在哪、能迁移多远”。这是把教育测量学(前测-干预-后测设计)平移到模型评测——方法学的错位创新,写论文的框架现成。
§7.8 公平性实验:跨库成绩差与分配正义
§2.7 双平台结构给的天然实验:同一模型在 MIMIC 源(PhysioNet 版)与 NIH/VinDr/OpenI 源(HF 版)的成绩差。三问:差多少——按任务分解的跨库成绩差矩阵;为什么——图像采集设备分布/人群构成/投照位分布(HF 版 viewposition 缺失的限制,坑点 5)三候选因子的归因;怎么办——若跨库差显著,跨机构部署的性能衰减就有了受控实验的估计量。伦理维度:成绩差按人口学分层(MIMIC 可及临床元数据的子集)的进一步分解是分配正义的评测化——但要遵守 DUA:分层统计可发布,逐例数据不可出库(§8.3 的红线在这个实验里的具体化)。
§7.9 LLM-as-judge 的元评测:用模型评模型评模型
本集的判定是规则化的(选项匹配),无需 judge;但扩展实验需要:开放性变体(让模型自由写出测量过程)的评判定要用 LLM-as-judge——于是出现三层嵌套(judge 模型评被测模型的推理,研究者评 judge)。元评测协议:抽 200 题,人工判定 vs judge 判定的一致率(Cohen’s κ)作为 judge 的准入门;κ≥0.7 才允许 judge 上岗批量判定;judge 的 prompt 与模型版本随 §7.3 日志归档。这个协议解决"过程评级的规模化与可信度矛盾"——是任何打算把本集协议推广到开放式输出的团队的必经工程。注意 judge 模型不得是被测模型本身(自评循环污染)。
§7.10 与弱监督联动的实验:管线的五级血缘当标签源
§4.10 的六级血缘链给弱监督研究供料:CheXStruct 15 CSV 的全量母池(远大于 1,200 case 基准)本质是"管线标签"——分割掩码/landmark/测量值三级标签可直接监督对应的子任务模型。实验设计:用母池 CSV 预训练测量回归头(CTR 等),再用少量人工标注微调,对比纯人工标注训练的数据效率曲线——回答"管线标签能替代多少人工"。风险与 503 同源:管线标签的系统偏差会被学生模型继承(§6.2 风险一的下游版),缓解是 §5.5 抽样自证先跑。与 503 的联合:CheXmask-U 的 std 列(§503 条目)可当样本权重——高不确定性 landmark 参与的测量标签降权训练。
§7.11 成本预算表:评测的钱怎么花
以 18,988 题全量、每题平均 2.5 张图、平均 1,500 输出 token 估:闭源 API 路线——按主流多模态 API 定价区间,全量一轮约数千元人民币级(具体随厂商价目浮动,立项前用 100 题实测单价外推);开源本地路线——12-24GB 显存级卡可跑多数开源 LVLM,一轮 1-3 天卡时,边际成本近零但工程维护成本转嫁;混合路线(推荐)——开发期用 100 题子集在本地快速迭代,终评用闭源 API 一次跑全。隐性成本三笔:多图输入的 token 膨胀(4 图题目的成本是单图的 3-4 倍)、错即终止的省的钱(Stage 1 就错的题不进后续——实际成本低于满算)、复跑(版本勘误与 judge 校准,预留 20% 预算)。预算表的原则:先 100 题实测再外推,官方数字代替拍脑袋。
§7.12 负结果四向:发不了正文的也有价值
①模型 X 在引导后无增益——Re-eval 增益为零或负,说明引导文本与该模型的知识结构不兼容,这是负结果但直接指导教学文本设计;②跨库成绩差与图像质量无关——若质量指标(§3.3 的 window 任务)控不住成绩差,"设备差异"解释链断裂,转向人群因子;③IDK 率与正确率零相关——弃权行为是随机的,"知道自己不知道"在该模型上不成立,IDK 选项沦为噪声选项;④管线标签与人工标注一致率低于预期——§7.10 的抽样自证若一致率低,管线标签的弱监督价值证伪,同时反哺 §6.2 的审计议程。负结果的共同价值:都在论文未覆盖的空白区,公布即贡献(附录/技术报告形态)。
§7.13 特征字典:读成绩单时的十二个词
结构化推理评测的行话速查:准则(criterion)——临床诊断的量化规则,如 CTR>0.5;阶段(stage)——推理链上的一步,判错即止;路径(path)——行为分支(直接/引导/重测);条件通过率——P(过 S_k | 过 S_{k-1}),唯一诚实的阶段成绩;引导增益——Re-eval 与初测的差;IDK 率——弃权频率,校准信号;参考答案——管线产出+专家复核的"正确选项";母池/基准——15 CSV 全量 vs 1,200 case 抽样,两口径(坑点 7);半(half)——PhysioNet 半与 HF 半,平台口径;版本三元组——数据 1.0.1/论文 v2/模型版本,成绩单的坐标;错即终止——early stopping 评测机制;存续——赛后 Challenge 的无窗口状态。§7.14 的审稿应对里这些词会高频出现。
§7.14 审稿话术模板:四问四答
Q"你们的成绩和论文差很多,基准是不是有问题?"——A:成绩可比性依赖版本三元组(数据 1.0.1/论文 v2/模型版本)与 prompt 对齐;我们复跑了官方 100 题校准子集,一致率 X%,差异来自 Y(模型版本迭代/API 静默更新),证据见附录日志。Q"参考答案是自动管线的,凭什么当真值?"——A:采纳论文的双层设计(专家定义准则+1,200 case 掩码全检),并补充我们的独立抽检(§5.5 协议,200 题边界值复核,一致率 X%);同时报告参考答案不确定度对成绩上限的影响。Q"只评 12 项影像可见任务,能外推到诊断吗?"——A:不外推。本基准的口径是"影像内结构化推理",需临床史的任务在其设计边界外(§2.6);我们的结论限定在该口径内。Q"模型可能在 MIMIC 上预训过,成绩被污染。"——A:承认这是领域级风险;我们用 Re-evaluated Path 1 的新 case 子集与跨库(HF 半)成绩做泄漏敏感性分析,主结论在两种敏感性设定下稳健。四答的共同骨架:版本对齐+独立抽检+口径克制+敏感性分析。
§7.15 提案三:推理错误与临床真实的相关性
§5.11 的完整立项书:问题——模型在基准上错的 case,其临床真相是否真的偏离了模型答案?若基准错误与临床错误无关,过程评测是纸面功夫。设计——按 Stage 3 判定(CTR 判心扩大对/错)分四组(真阳/假阳/真阴/假阴),各组从 MIMIC-IV 拉真实心功能锚(超声 LVEF/BNP/后续心衰诊断),检验"基准判定错误是否伴随临床锚的真实偏移"。判读——假阳组的临床锚若真偏高(模型把正常心判大了,但该患者 LVEF 也确实偏低),说明"错得有临床语义";若假阳组锚完全正常,错误是纯影像噪声。价值——给"过程评测的有效性"提供临床效度证据,这是基准论文自己没做、社区真正想知道的事。门槛——双库凭证+MIMIC-IV join 工程+临床顾问一名;产出体量:一篇方法学主文的体量。
§7.16 工具链:评测工程的选型清单
五层选型:数据层——qa.zip 解包用 Python zipfile+json 标准库即可,勿引重型框架;推理层——开源模型用 vLLM(多图输入支持是选型硬指标)或 HF transformers+accelerate;闭源走官方 SDK;判定层——选项匹配用严格字符串+同义映射表("yes/Yes/YES"归一),勿用 LLM 判定(除非走 §7.9 元评测);统计层——条件通过率/传播矩阵用 pandas+statsmodels 足够,bootstrap 置信区间用 scipy;追溯层——§7.3 日志落 SQLite/Parquet,run_id 用 UTC 时间戳+模型名。反选型清单:勿用通用评测框架硬套(错即终止的流程控制要自己写,通用框架的阶段循环支持弱);勿在评测代码里做训练侧的数据增强(评测数据严格只读)。
§7.17 社区三提案:可以现在就提交的 issues
提案一(勘误追踪)——请官方在版本页明示 v1.0.1 修复的 qa 路径清单(哪些文件、哪些字段),让用旧版跑过的研究者能评估既往结果是否需重跑;提案二(参考答案置信度分级)——为 12 任务的参考答案加"专家复核/纯管线"两级标记,使用者可分层报告成绩(与 503 的 std 列设计哲学同构:给资产配不确定性说明);提案三(跨版本成绩登记册)——官方或社区维护一份"模型×版本×成绩"的登记表(含 prompt 模板 hash),终结各论文口径不一的乱象。三提案的共同逻辑:把"成绩的可比性"从研究者的自觉变成基础设施。提交渠道:GitHub issues(§6.11 活跃信号的验证场——提案是否被回应本身就是活跃度测试)。
§7.18 一页纸实验预算:给管理者的摘要
目标(任选其一):复测 2026 SOTA 的结构化推理成绩/量化引导增益/跨库公平性报告。资源:1 名工程师(3 周)+1 名临床顾问(兼职 1 周)+算力(§7.11 混合路线,数千元级)+双库凭证(申请周期 2-4 周,为关键路径)。里程碑:W1 数据装载+100 题校准复跑→W2 全量跑分+日志基建→W3 分析(阶梯/传播/IDK 三图)+报告。交付:成绩单(版本三元组+置信区间)+逐题日志(可审计)+复现包(§5.8 模板)。风险:区域访问受限(预案:HF 半先行的降级方案)/参考答案争议(预案:抽样自证前置)/模型 API 变动(预案:prompt_hash 固化+成绩带日期)。性价比判断:3 周人力换一份可审计的模型体检表+一条方法学论文素材线——在医疗 AI 团队的年度预算里是低门槛高杠杆项。
§7.19 四周课程设计:用一份考卷教三门课
Week 1(评测设计课)——读 §1/§4,学生画三路径行为树并找出一个设计缺陷(批判性阅读);Week 2(临床信息学课)——读 §3,装载 15 CSV,用 SQL 复算论文的一个统计表(工程性阅读);Week 3(模型评测课)——跑 100 题子集(§7.11 校准子集),产出条件通过率阶梯图(实操);Week 4(伦理与合规课)——读 §8,完成 DUA 模拟审批与一份"什么能公开"的判定练习(合规素养)。考核:小组提交一份"给该基准挑一个错并设计验证实验"的提案——比复现成绩更能训练研究品味。课程的前置:学生需自备 PhysioNet 凭证(CITI 课是第一周作业的一部分——把合规培训变成课程内容而非负担)。教学形态适配:40 学时的研究生课或 4×半天的工作坊均可行。
§7.20 维护三提案:本条目百科侧的保养计划
提案一(成绩滚动区)——§6.1 的三命题后续订:每季度查 GitHub/arXiv 的新版本,LVLM 数量或官方成绩变化时在本条目变更日志(§10.4)追加快照行,旧成绩保留并标注日期(成绩是有历史价值的快照,不覆盖只追加);提案二(勘误雷达)——v1.0.1 之后若再现勘误(v1.0.2+),第一时间核对坑点清单(§6.8)是否需要增补条目,qa 路径类工程性勘误同步更新 §6.10 诊断树;提案三(竞争格局年报)——§6.12 的稀缺性评估每年复评一次:新的过程级基准出现时补"竞争者对照"小节,保持战略章节的时效。三提案的人力成本:每年合计约半天——百科条目的长期价值靠的是这种低频高杠杆的保养。
§7.21 与 503 std 的联合实验:不确定性的两条线
503 的地标 std(数据侧的不确定性标注)与本集的 IDK(模型侧的不确定性表达)是同一枚硬币的两面。联合实验设计:对测量型任务(CTR),用 CheXmask-U 的 std 检查 CheXStruct 参考答案的稳定性(参与 CTR 的四点 landmark 中若有点的 std 超阈值,标记该题参考答案"低置信");然后检验模型行为——模型在"低置信参考答案"题目上的成绩是否系统性偏低(若是,部分"模型错误"实为"考卷噪声",§6.2 风险三的定量化)。这条实验线把三连条目(502/503/504)串成一个闭环:掩码资产→不确定性标注→考卷噪声定标。数据门槛:双库凭证(MIMIC 系跨数据集 join,§2.10 的 DUA 复查条款再次适用)。
§7.22 外部验证锚:成绩单的第三方坐标
本集成绩的"绝对值"没有外部锚(首个基准,无历史可比),但可自建三个相对锚:锚一(人类下限)——让 1-2 名非放射科的医学毕业生做 50 题(准则文本在手),人类参照线可初步估计(正式锚需放射科医师,成本高,可列社区提案);锚二(退化测试)——把输入图打乱/替换为噪声图,模型成绩应崩到随机水平——检测"不看图答题"的捷径学习;锚三(跨基准一致性)——同一批模型在通用多模态推理基准与本集的成绩秩相关——若秩相关高,本集测的是通用推理能力而非医学特异能力(这对"医学评测的价值"是个尖锐检验)。三锚都不依赖新数据授权,一周可建——先建锚再报成绩,是可信度工程的最短路径。
§7.23 校准报告模板:成绩发布的标准格式
向社区/管理层发布成绩时的八段式:①版本三元组——数据 1.0.1/论文 v2/被测模型全名+API 快照日期;②协议口径——跑的哪些任务×路径×阶段,抽样比例;③校准证据——100 题官方复跑一致率+锚测试(§7.22)结果;④主表——条件通过率阶梯(非平均正确率,§6.8 坑点 4 的贯彻);⑤分解表——任务×IDK 率×引导增益;⑥泄漏声明——模型预训语料与本考卷的重叠风险评估;⑦许可声明——Credentialed License 下的公开边界(§8.3);⑧复现指路——日志与代码的获取方式。八段式是 §5.8 复现包的"报告侧"配套——数据包给复现者,报告给决策者,两件套合起来才是完整的评测交付。
§7.24 一分钟版:实验库的电梯摘要
要跑分→§7.1 喂法一+§7.11 混合路线;要找模型短板→§7.5 阶梯+§7.6 传播矩阵;要评教学价值→§7.7 增益协议;要发论文→§7.4 IDK 行为(增量最明确)或 §7.15 临床锚(体量最大);要建信任→§7.22 三锚+§7.23 八段式报告;要省时间→先读 §6.8 八坑点+§6.10 诊断树,能避开 80% 的返工。全库二十四个方向的共同前置:§3.9 三步访问+§7.3 日志基建——先有资格与日志,再谈实验。
§7.25 从评测日志到监管证据链:六件打包清单
把评测结果用于部署决策的内部档案时,判定日志之外还需打包:证据件一:考卷快照——v1.0.1 数据包 SHA256+下载日期;证据件二:harness 冻结——评测所用 commit 归档(fork 存证);证据件三:模型指纹——API 快照号/权重哈希/推理配置全录;证据件四:判分规则——判分代码归档+列字典版本;证据件五:人工复核记录——边界值抽检原始标注与分歧决议;证据件六:审批痕迹——决策日志与评测日志的引用关系。六件的意义:监管审计问的不是"模型多好"而是"你怎么知道模型这么好"——证据链完整性决定审计走向。
§7.26 判定日志的最小 schema:二次分析的地基
| 字段 | 类型 | 用途 |
|---|---|---|
| model_id | TEXT | 模型名+版本+快照号 |
| task / case_dicom | TEXT | 题目定位 |
| path / stage | TEXT | 路径与阶段(失败谱的维度) |
| question_ref | TEXT | qa.json 路径锚 |
| model_choice / is_correct | TEXT/INT | 判分原料 |
| terminated_here | INT | 错即终止的终止位 |
| tokens_in/out / latency_ms | INT | 成本与效率 |
| run_ts / run_params | TEXT | 时间戳与参数(成绩时效的锚) |
十个字段覆盖失败谱、公平性、成本、时效四类二次分析的全部原料——判定日志落库(SQLite/Parquet)而非散落 print,是评测工程的第一个纪律。
§8 合规深水区:Credentialed 体系的完整审查
§8.1 双门槛的精确构成与申请策略
Credentialed Access 的两道门:门一(身份+培训)——PhysioNet 账号挂靠机构邮箱,完成 CITI 课程 “Data or Specimens Only Research”(约 2-4 小时的伦理培训,证书 PDF 上传);门二(协议签署)——逐数据集签署 DUA 1.5.0(本集专用协议,非通用条款)。申请策略三则:批量原则——CITI 证书在 PhysioNet 体系内通用(一次培训覆盖 MIMIC-CXR 与本集),若团队未来要用 492/495(MIMIC 生态)或 502/503,一次申请全家受益;关键路径意识——审核是人工的,高峰期 1-2 周,立项排期把申请放最前面(§7.18 已列为关键路径);机构邮箱——个人邮箱(gmail 类)会被拒或拖延,机构/学校邮箱是硬要求。门二的 DUA 条款核心义务见 §8.3。
§8.2 区域限制:2026 年的新合规变量
版本页出现的 “not available in your region” 提示是本系列此前条目未遇到的现象(§2.8)。机制背景:PhysioNet 依据出口管制/数据保护法规对特定司法辖区限制访问——这不是本集作者的选择而是平台级政策。对三类团队的影响:受影响辖区团队——直接申请大概率不可行,现实路径是与可访问辖区的机构合作(合作方签署 DUA 并在本地处理数据,输出聚合统计)——注意这本身就是 DUA 下的转授权敏感区,合作架构要过法务;跨国团队——成员所在地决定个人账号能否过审,团队内"谁能申请"要提前摸底;云评测团队——在可访问辖区的云节点跑评测是合规灰区(数据落地位置与用户位置不同),保守做法是评测人自己在可访问辖区登录处理。本节是记录性内容:具体辖区清单以 PhysioNet 官方政策页实时状态为准,本条目不做辖区列举。
§8.3 Credentialed License 1.5.0 的红线清单
DUA 签署后生效的硬约束(与 Open 数据的宽松形成对照——502/503 的 CC BY 4.0 世界没有这些):红线一(再识别禁令)——禁止任何形式的身份重识别尝试,包括将本集与外部身份库做匹配实验;红线二(再分发禁令)——原始图/掩码/QA 逐题数据不得向未签署 DUA 的第三方转授——与 502/503"随便转发"的根本差异;红线三(发布形态)——论文可发聚合统计与成绩,不得附可还原个案的图表(逐题截图/掩码原图原则上不可直接出版面——用聚合图或联系官方取授权);红线四(衍生数据)——管线标签/模型输出的衍生数据集再发布需复查条款(一般要求同门槛访问或脱敏到不可还原,§7.10 弱监督数据的发布前必查项);红线五(审计义务)——接受 PhysioNet 的合规抽查义务,数据使用记录保存备查。五红线的实用翻译:“可以用来评测与发表统计,不可以搬运与展示原件”——评测工程的所有输出设计(§7.3 日志、§7.23 报告)都要过这把筛子。
§8.4 HF 半的合规边界:开源不等于无约束
HuggingFace 版(NIH/VinDr/OpenI 源)的合规要单独审视——它是"开源发布"但源库各有各的许可:NIH CXR14——公开使用、注明 NIH 出处,衍生宽松;VinDr-CXR——CC BY 4.0(研究友好);OpenI——开放存取、引用要求。合成效果:HF 半的许可负担显著低于 PhysioNet 半(无 DUA、无 CITI),但 HF 数据卡的使用条款仍然约束再分发(下游发布需保留原始许可声明链)。合规策略:纯方法学演示/教学用 HF 半(零门槛),正式评测报告用 PhysioNet 半(MIMIC 源与官方基准口径一致)——两半的合法用途有分工,混用会造成"用开源许可的壳做 Credentialed 的事"的错位(比如把 HF 半训练的模型输出声称代表 MIMIC 口径成绩)。
§8.5 同门对照表:批次五的许可光谱
| 条目 | 访问 | 许可 | 转发 | 衍生发布 |
|---|---|---|---|---|
| 502 CheXmask | Open | CC BY 4.0(数据)+MIT(代码) | 自由 | 同许可 |
| 503 CheXmask-U | Open | CC BY 4.0 | 自由 | 同许可 |
| 504 CXReasonBench | Credentialed | PN License 1.5.0 | 禁止 | 复查条款 |
| 505 CDSL | 待核 | 待核 | 待核 | 待核 |
光谱的含义:批次五从"完全开放"走到"双重门槛",一条线内走完了医疗数据合规的两个极端——这个布局是刻意的:掩码层开放(生态繁荣优先),评测层收紧(防刷题与泄漏),符合"训练数据松、考试卷紧"的国际通行逻辑。使用者按用途对号入座:造资产去开放半,做评测过门槛半。
§8.6 审批管理:机构内的走过场与真把关
团队接入 Credentialed 数据的机构内流程建议(按真把关设计):节点一(申请前)——PI 审研究目的与 DUA 义务清单(§8.3 五红线的内部宣讲),确认团队所在地可访问(§8.2);节点二(数据落地)——数据存放位置登记(加密盘/访问名单),评测代码评审(防日志意外含原图路径外泄——§7.3 日志只存路径与判定,不存图像本体);节点三(发表前)——图表合规审查(红线三的逐项对照),DUA 义务确认书签署。三节点的人力成本约每人次半天,换来的是审计零担忧。反面案例的常见形态:个人申请、团队共用一个账号下载、数据放公共网盘——三条都在红线二附近试探,机构审查缺位的典型病。合规的经济学:事前半天,事后重罚。
§8.7 风险登记册:本集合规面的五项残余风险
①区域政策变动——PhysioNet 辖区清单可能扩充(§8.2),已获访问者的既得访问是否受影响属未知,预案:数据本地完整备份(DUA 允许范围内)+政策页季度回访;②DUA 条款升级——1.5.0 之后的版本若加严义务,存量使用者是否溯及既往未知,预案:变更日志跟踪+官方公告订阅;③HF 半的许可链变动——上游库(VinDr 等)改许可会传导到 HF 卡,预案:引用时固化快照日期;④评测输出的泄漏面——模型输出可能复述患者隐私信息(MIMIC 图内烧录的匿名标记等),预案:输出后处理过滤器+发布前人工抽检;⑤机构资质失效——挂靠的机构邮箱失效(毕业/跳槽)导致凭证中断,预案:数据+日志的团队资产化管理(非个人资产)。五项的共同管理工具:§10.8 观察清单的季度执行。
§8.8 评测伦理的三个边界场景
| 场景 | 风险 | 处理原则 |
|---|---|---|
| 模型方要求预览题目 | 私下转发违反再分发禁令 | 给官方公开文档链接,拒私有转发 |
| 成绩对某模型系统性不利 | 被指 harness 偏差 | 先自查诊断树,再如实报告+给回应通道 |
| 评测结果被断章取义 | 忽略条件通过率/任务面 | 主动发布三表+时间戳+协议版本 |
三场景的共同原则:评测者手里的考卷权力越大,自我约束的条款要越细——官方的 issue 驱动治理是现行范本。
§9 FAQ 90 问:全场景问答手册
§9.1 身份与获取(9 问)
- CXReasonBench 是什么?——胸片结构化诊断推理评测基准:18,988 道 QA,评 LVLM 的推理步骤而非最终答案(NeurIPS 2025 D&B)。
- CheXStruct 和 CXReasonBench 什么关系?——前者是生产线(管线+15 CSV 全量标签),后者是考卷(从母池抽 1,200 case 组织的三路径评测)。
- 在哪获取?——PhysioNet(MIMIC 源,Credentialed)+HuggingFace ttumyche/CheXStruct(NIH/VinDr/OpenI 源,开源)+GitHub 代码。
- 要付费吗?——数据免费;成本是资格(CITI 证书+DUA)与算力。
- 下载前要准备什么?——机构邮箱、CITI 课程证书、区域可访问确认(§3.9 三步)。
- 版本该用哪个?——v1.0.1(2025-10-23),修复了 v1.0.0 的 qa 路径错误;别用 v1.0.0 跑评测。
- PhysioNet 版和 HF 版内容重复吗?——不重复:图源不同(MIMIC vs 三库),合起来才是全集(§2.7/§3.7)。
- RRID 是什么用?——SCR_007345,基金申请与方法节里的资源唯一标识。
- 视频教程或中文文档有吗?——官方无中文文档;本条目即最完整中文参考(含坑点与协议翻译)。
§9.2 数据结构(9 问)
- 交付物清单?——PhysioNet 半:15 CSV+列描述 JSON+QA 树+叠加图两包;HF 半:三库 CSV+文档。
- 15 CSV 怎么构成?——12 诊断任务+3 全局过滤(mask_number/abdominal_xray/window)。
- CSV 的公共列?——image_file/viewposition/label+任务特定列(坐标/测量值/指数)——九字口诀见 §3.2。
- QA 树怎么寻址?——qa/{诊断任务}/{path}/{stage}/{option_format}/{dicom}.json 五级路径(§3.5)。
- 每 QA 对几张图?——最多 4 张:原图+叠加掩码图+叠加 landmark 图等(§4.7)。
- 母池和基准的规模差?——母池 15 CSV 全量 vs 基准 1,200 case×12 任务——两口径勿混(坑点 7)。
- viewposition 缺失是怎么回事?——HF 半 OpenI 源为 N/A,按投照位分层的分析在 OpenI 子集不可做(坑点 5)。
- 参考答案存在哪?——QA JSON 的 answer 字段;其产生机制是管线+专家复核(§4.2)。
- 有训练/测试划分吗?——无固定划分:基准本体就是测试集,母池 CSV 才可当训练资源(注意泄漏纪律 §5.2)。
§9.3 评测执行(9 问)
- 最小可跑配置?——支持多图输入的模型 API+解包脚本+判定脚本;100 题校准子集先行(§7.11)。
- 三路径必须都跑吗?——按研究问题选:能力体检跑 Path 1,教学研究跑全三径(§7.1 五喂法)。
- 错即终止怎么实现?——Stage k 判错则该 case 后续 Stage 跳过、计失败——评测循环自己写(§7.16 反选型警告)。
- 平均正确率可以直接比吗?——不可比:各 Stage 样本量被幸存者偏差扭曲,用条件通过率(坑点 4)。
- 模型不支持多图怎么办?——降级协议:仅原图输入跑(成绩不可与官方口径直接比,报告中注明)。
- I don’t know 怎么计分?——三种口径(计错/中立/单列分析)结论不同,报告须声明口径(§4.5)。
- Stage 1.5 什么时候出现?——仅专家定义准则任务且 Path 1;引导路径省略该级(§4.1)。
- 成绩和论文对不上怎么办?——先查版本三元组与 prompt 对齐,再跑官方校准子集,最后看 §6.10 诊断树五岔口。
- 可以跑自己的私有模型吗?——可以:接入协议三件事(输入格式/多图拼接/判定脚本),见 §5.4。
§9.4 结果解释(9 问)
- "全线挣扎"的量化表述?——论文口径:最强模型在结构化推理与泛化上仍显著挣扎;具体数字以论文表格为准(引用带版本)。
- 哪类任务最难?——测量型(需 Stage 3 计算)普遍难于识别型;质量四任务另有结构(§4.6/§4.9)。
- 引导增益有多大?——按任务×模型分解,论文给总体图景;细粒度增益自己跑(§7.7 协议)。
- 高 IDK 率说明什么?——可能好(知边界)可能坏(逃避)——看 IDK 题的条件正确率联动(§7.4 三图)。
- 成绩能外推到真实诊断吗?——不能:12 项是影像内任务,无临床史维度(§2.6 口径边界)。
- 模型在 MIMIC 上训过,成绩可信吗?——打折:泄漏敏感分析(Re-eval 新 case+HF 半跨库)必做(§7.14 Q4)。
- 同模型两次跑分差多少算正常?——API 模型的采样温度与静默更新都会漂移,固定 temperature+快照日期,波动 1-2 点内视为噪声。
- 别人复现不了我的成绩怎么办?——发布 prompt_hash+日志(§7.3),给复现者校准子集——可比性是发布者的义务。
- 基准分数的"及格线"是多少?——不存在官方及格线:基准是相对排位工具,绝对分数解读靠锚(§7.22)。
§9.5 与本系列条目的关系(9 问)
- 与 502 的关系?——掩码资产 vs 推理考卷;CheXStruct 管线是掩码→测量→指数范式的官方示范(§6.4 矩阵)。
- 与 503 的关系?——503 给掩码配不确定性,本集可借其 std 定标考卷噪声(§7.21 闭环)。
- 与 505 的关系?——评测双塔:本集评推理过程,505 评结构化输出;Stage 3 是两塔接口(§2.9)。
- 与 492/495(MIMIC 系)的关系?——QA 的 dicom 根可 join MIMIC-IV 临床表(§5.11 评测版对齐)。
- 与 499(CIED)等 VQA 类条目的区别?——499 评检测答案,本集评推理过程——代差见 §1.3/§2.1。
- 本系列还有其他 Challenge 类型吗?——本集是第一个;Top 1000 后续可能再遇,物种处理经验存此(§6.7)。
- 掩码生态兼容怎么验证?——502 掩码与 CheXStruct 掩码同图对照(§4.12 实验设计)。
- 为什么这一条目排在批次五的掩码线里?——叙事链:掩码(502/503)→掩码的应用范式产品化(504)→结构化输出(505)。
- 阅读顺序建议?——评测人:本条目→502(§6 基线)→505;数据人:502→503→本条目(§3.1 交付物对照)。
§9.6 合规与许可(9 问)
- CITI 课程哪一门?——“Data or Specimens Only Research”,PhysioNet Credentialed 体系的标准课。
- DUA 是通用的吗?——不是:1.5.0 是本集专用协议,与 MIMIC-CXR 的 DUA 分开签。
- 能把数据放到公司内网共享吗?——签署主体范围内的受控访问可,超出签署名单的共享触碰红线二。
- 论文里能放掩码叠加图吗?——原则不可(红线三):用聚合统计图;确需个案图走官方授权。
- 用基准训模型可以吗?——考卷当训练料会污染评测语义(§5.2 三层泄漏);母池 CSV 的弱监督用途是另一回事(§7.10)且许可上复查红线四。
- 评测日志(含模型输出)能开源吗?——判定日志可(无原图),含图像本体不可;输出文本过隐私过滤器后可(§8.7 风险④)。
- 区域限制绕过的技术手段?——不做讨论:合规红线,受影响辖区走机构合作(§8.2)。
- 学生毕业了账号怎么办?——凭证与个人绑定;数据与日志应事先转为团队资产(§8.7 风险⑤)。
- HF 半要不要也签 DUA?——不需要:HF 半无 DUA,但守数据卡条款+保留许可声明链(§8.4)。
§9.7 工程细节(9 问)
- 解包后目录对不上?——核对 v1.0.1+对照官方 README 的目录树;qa 路径类问题九成是版本错位(坑点 3)。
- 叠加图两包的用途?——pnt_on_cxr(landmark 点图)服务 Path 2 Stage 2;segmask_bodypart(掩码图)多路径共用(§1.7 文件清单)。
- JSON 字段有哪些?——question/answer/img_path/bodypart 掩码路径等;以 v1.0.1 实际 schema 为准。
- 大批量评测的并发建议?——API 路线限流自守(429 退避);本地路线按显存排队;都记进日志 latency 列。
- CTR 的值域选项怎么解析?——选项是预设区间(如 [0.50-0.52]),严格匹配+同义归一;边界值进 §5.5 抽样自证。
- viewposition 对评测有影响吗?——PA/AP 的解剖投影差会影响测量真值;按位分层分析仅在 MIMIC 半可行。
- 怎么抽查管线测量对不对?——手工量 20 张图的 CTR 与 CSV 对照(§5.5),CT Radiomics 教程级别的手工协议即可。
- 跑一次全量多久?——随模型与硬件浮动巨大;用 §7.11 的 100 题实测外推,勿信拍脑袋估计。
- 日志怎么防篡改?——append-only+哈希链(每日汇总哈希签名);审计场景升级到 WORM 存储。
§9.8 教学与文献(9 问)
- 适合什么课程?——医学 AI 评测/临床信息学/AI 伦理课(§7.19 四周设计)。
- 学生需要什么前置?——Python+基础统计+CITI 课(当作业)+多模态模型 API 基础。
- 有现成的讲义吗?——本条目 §1/§4/§7 即讲义骨架;PPT 化的社区资源未见。
- 引用格式?——§6.3 四件套:PhysioNet DOI+NeurIPS 论文+RRID+GitHub。
- 论文哪版?——arXiv v2(2025-10-27)与 NeurIPS 正式版;引用以 Proceedings 为准。
- 作者组的其他相关工作?——KAIST Edward Choi 组的医疗多模态系列;追踪 GitHub 与组页。
- 有综述引用它吗?——2025 年基准刚上线,综述引用尚少——先发引用红利期(§6.12)。
- 中文文献怎么表述它?——“胸片结构化诊断推理评测基准(CheXStruct/CXReasonBench)”,避免只译一半(两实体名)。
- 批评它的文献怎么找?——Google Scholar 引用它且含 audit/critique/validity 关键词的后续——§6.18 攻防策略的情报源。
§9.9 决策与采购(9 问)
- 团队该不该接入?——三个 yes 条件:有自研 LVLM/有评测报告义务/有方法学论文需求;三个 no:纯数据应用/无算力/无合规人力。
- 一期投入多少?——§7.18 一页纸:3 周工程师+兼职临床顾问+数千元级算力+2-4 周申请周期。
- ROI 怎么算?——一份可审计体检表+论文素材线+合规履历;与自家模型出事后的事后评测成本对照。
- 和付费商业评测比?——商业评测黑箱不可复现;本基准协议透明可审计——对内体检用本基准,对外背书看场景。
- 小团队(2 人)玩得动吗?——玩得动 HF 半+校准子集路线(§7.11 混合),全量委托算力外包。
- 医院信息科能用吗?——能但角色是"甲方验收":用 §7.23 八段式要求厂商提交可审计成绩。
- 投资视角看它说明什么?——"12 个最强模型全线挣扎"是医疗 AI 落地周期的风险量化——泼冷水用(§6.19 形态⑤)。
- 竞品基准怎么选?——过程级空位期本集是默认项;按 §6.12 年报机制跟踪新竞争者。
§9.10 前瞻与维护(9 问)
- 会有 v1.1 吗?——无官方时间表;观察 GitHub 与 arXiv(§10.8 季度回访项)。
- 成绩榜单在哪更新?——无官方活榜(Challenge 赛后存续);社区复测散见各论文——§7.17 提案三想解决的就是这个。
- 扩展新任务找谁?——GitHub issues 提案(§6.18 合策略);扩展需管线代码与准则合法性双保障。
- 基准会过时吗?——协议寿命长(年计),成绩寿命短(月计),考卷本身随 LVLM 能力逼近天花板而逐步退役——评测基准的生命周期宿命。
- 泄漏了怎么办?——若确认模型预训见过考卷:官方社区公告+成绩作废重测协议(§6.5 方向⑩的检测先做)。
- 中文准则版会出现吗?——官方无计划;社区本地化是机会与风险并存(准则翻译的合法性需临床专家背书)。
- 本条目的更新协议?——§10.9:官方版本/HF 卡/GitHub/arXiv 四源季度 diff,变更进 §10.4。
- 发现条目错误反馈给谁?——本系列勘误流程(§10.9 核查注记);基准本体的问题走 GitHub issues。
- 一年后还读得到本条目吗?——在:Top 1000 的条目是活的(季度保养机制 §7.20)。
- 最后一句建议?——先建日志与锚,再跑分;先读坑点,再写代码——评测工程的总纲。
§9.11 番外:十个冷观察
①Views 73 与 NeurIPS 光环的反差——学术声望与平台流量的解耦样本;②Challenge 类型在 PhysioNet 的存在感远低于 Database——物种偏见本身就是观察对象;③v1.0.1 的 8 天勘误是"官方在乎"的信号——比无勘误的"完美"更可信;④HF 半的存在让合规门槛变成了"可选成本"——双栖发布是对纯 Credentialed 模式的改良;⑤IDK 选项的设计让"弃权"第一次有了数据形态——评测史上的一小步;⑥Re-evaluated 路径让基准自带教学实验设计——考卷与教案同体;⑦资助里的 MSRA 与韩国四部委并列——地缘学术合作的常见形态;⑧12 任务的准则全部影像内——“不含肺炎"这类自我设限是诚实也是护城河;⑨管线六级血缘的每一级都可独立替换升级——工程上的模块化前瞻;⑩本集被引用最多的一句话可能不是成绩而是"I don’t know 也是一种能力”——设计哲学的传播力超过数据本身。
§9.12 十二个如果(反事实推演)
如果 MIMIC 半不存在(只发 HF)——基准失去 MIMIC 生态对齐(§5.11 断),临床锚实验无从做,学术影响减半;如果 HF 半不存在(只发 Credentialed)——教学与快速原型场景流失,Views 可能更低但口径更纯;如果没设 IDK——过度自信不可测,基准沦为又一个准确率竞赛;如果没设 Re-eval——教学增益无从量化,Path 2 的引导沦为摆设;如果参考答案全人工——成本数十倍,1,200 case 不可行(管线模式的必要性证明);如果参考答案全无复核——管线噪声直接进考卷,成绩全不可信(专家复核环节的价值证明);如果任务是 100 项不是 12 项——覆盖广但单任务质控稀释,"窄而深"是对的;如果不加区域限制——全球可达但合规风险平台自担,PhysioNet 不会答应;如果晚半年上线——被通用推理评测抢跑的风险(§6.16 时间窗);如果团队无临床作者——准则合法性塌方,NeurIPS 录取概率大降(临床专家的不可替代性);如果基准永远不更新成绩——社区自然接棒复测(§7.17 提案三),去中心化维护是常态;如果重做一遍——最该改的可能是把管线的外部校验(502 互验)做进 v1——§6.2 的软肋作者自己也该知道。
§9.10b 新手十误(评测工程版)
- 旧版 qa/ 路径——v1.0.1 是硬门槛,旧版视觉输入静默缺失。
- HF 版找考卷——考场只在 PhysioNet 版。
- 只报终局分数——条件通过率才是报告主体。
- 推理参数不记录——温度/提示词是协议的一部分。
- 跨任务混谈——CTR 的改进≠隆突角的改进。
- 质量任务高解读——管线自指风险。
- 边界值照单全收——抽样人工复核。
- 日志不落盘——逐题判定是二次分析的唯一原料。
- 区域未预检——CITI 时间成本打水漂。
- 忘引 MIMIC——四件套引用链的第三层。
§9.10c 向 PI/导师汇报本集的三段话模板
第一段(是什么):“NeurIPS 2025 D&B 收录的胸片推理评测——18,988 道 QA 把’心胸比怎么算’拆成四阶段逐环节判分,与 MIMIC 生态同键”;第二段(为什么现在):“过程评测是当前独占生态位,接入一周+数百元 API 费,失败谱直接指导我们模型的改进方向”;第三段(要什么):“PhysioNet 凭证(已有)、采样评测的 API 预算、边界值复核 2-3 个医师人日”。45 秒口播——决策者听到的是"低成本进独占生态位"。
§9.10d 三个"考卷之外"的提醒
其一,沟通能力——推理对的模型可能话术吓坏患者(报告生成类评测补位);其二,多轮稳健性——本集单轮 QA,临床是多轮追问(多轮协议补位);其三,时效性——case 是 2011-2016 的图像,新设备表现无保票(本地验证不可省)。本集审计的是推理内核,内核之外还有壳——壳的评测用别的考卷。
§9.13 尾注三问
一问:我们评模型,谁评我们的考卷?——参考答案的管线自证结构(§6.2)是本集最深的裂缝,也是所有自动化评测的共同宿命:评价者永远需要被评价。503 给数据配了不确定性,本集给考卷配了什么?专家复核的 1,200 次盖章——够不够,交给 §7.15 的临床锚去回答。二问:过程评测会不会制造新的应试教育?——当社区开始按条件通过率刷榜,模型会学会"为阶段而推理"而非"为诊断而推理"——Goodhart 定律在评测领域的必然显形。本集的 IDK 与 Re-eval 设计是缓释剂,不是解药。三问:Clinician 到底要看什么?——18,988 道题的成绩单对临床决策者的日常几乎没有直接意义;他们要看的是"这个系统错的时候是什么样"——本集的阶段分解恰好给了错误形态学,这是从评测到信任的最后一公里,也是 §7.15 方向的真正动机。
§9.14 数字对账五组:核心数字的二次核对表
评测类条目的数字密度高,五组核心数字的独立对账(维护者可直接复算):
第一组(QA 总量闭环)——18,988(总量)= 8,044(Path 1)+ 3,600(Path 2)+ 7,344(Re-evaluated)。三项出处:版本页交付物描述+论文 §实验设置。复算:8,044+3,600+7,344 = 18,988 ✓。注意 Path 1 与 Re-evaluated 的关系是"重测子集"而非增量题目——总量是三部分题数直接相加(三部分是三份不同用途的题册,非同一题册的三种跑法),这一点与直觉的"重测不加量"相反,官方口径如此,引用时照抄公式防歧义。
第二组(任务面闭环)——12 诊断任务 = 8 放射学发现(cardiomegaly/mediastinal widening/carina angle/trachea deviation/aortic knob enlargement/ascending aorta enlargement/descending aorta enlargement/descending aorta tortuous)+ 4 图像质量任务(inclusion/inspiration level/rotation/projection)。8+4=12 ✓。CSV 数 = 12 任务+3 全局过滤(mask_number/abdominal_xray/window)= 15 ✓。
第三组(基准抽样闭环)——1,200 case = 12 任务 × 100 case/任务。出处:版本页 QA 构建描述。含义澄清:100 case/任务是抽样配额,同一 case 可出现在多个任务的题册里(任务间 case 有重叠),因此"基准独立 case 总数"≤1,200——官方未给去重后的 case 数,本条目按官方口径表述为"1,200 case 配额",不做去重估计(留白的诚实)。
第四组(版本时间线闭环)——arXiv v1(2025-05-26)→ PhysioNet v1.0.0(2025-10-15)→ PhysioNet v1.0.1(2025-10-23,+8 天勘误)→ arXiv v2(2025-10-27)→ NeurIPS 2025(2025-12-02~07)。五节点间隔:arXiv 到 PhysioNet 约 5 个月(论文审稿同期做数据发布准备——双栖发布的工程节奏),勘误 8 天(§6.11 活跃信号),v2 距勘误 4 天(勘误与论文更新联动),NeurIPS 距 v2 约 1 个月(会议口径收口)。
第五组(评测队伍闭环)——v1 论文 10 LVLM → v2 摘要 12 LVLM。差值 2 个模型的身份以论文正式表格为准(本条目不逐个点名,避免转录误差——§10.8 B 级项)。引用守则:任何"12 个模型"的表述必须可回溯到 v2 或 NeurIPS 版;v1 语境(早期 arXiv 引用)用"10 个"。
五组对账的维护协议:任何一组在季度回访(§10.7)中发现官方数字变动,先改速查卡(§10.6)再全文检索该数字的所有出现位置——数字的一致性是百科条目可信度的下限。
§9.15 三十秒电梯稿:五种场合的说法
对院长/CEO:“这是给医疗 AI 模型做的标准化临床推理考试——18,988 道带步骤评分的题,12 个国际最强模型都没考好。我们的模型要进临床,先过这门考试。”(§7.18 的预算追加一句:3 周、一个人、几千块算力。)对投资人:“12 个最强模型全线挣扎于结构化推理,说明胸片 AI 的落地成熟度被高估了——同时,能把’错在哪一步’说清楚的评测基建,正是这个赛道的稀缺资产。”(§6.19 形态⑤+§6.12 稀缺性。)对临床科室主任:“它评的不是’AI 报了什么’,而是’AI 像不像医生一样量了心胸比、看了气管位置再下结论’——过程可审计,才谈得上可信任。”(§1.3 代差+尾注三问。)对法务/合规:“数据在 PhysioNet 的 Credentialed 体系里,签 DUA、过 CITI 培训、不发原图,全部有章可循;开源半还有合规更轻的教学版。”(§8.1/§8.4。)对同行工程师:“评中间步骤不评最终答案、错即终止、IDK 是正经选项、教完再考——四个设计点都值得抄进你自己的评测协议。”(§4.1+§2.4+§2.5。)五段电梯稿的共同底料:全部事实出自本条目已核查章节,无一处需要临场发挥——电梯稿的纪律和评测一样:口径先行,永不超纲。
§10 存档:证据、引用与维护
§10.1 官方页存照 A-E
存照 A(类型)——PhysioNet 版本页类型字段为 Challenge,与本系列此前 Database 条目的物种差异(§6.7);存照 B(平台分裂)——PhysioNet(MIMIC 源)与 HF(NIH/VinDr/OpenI 源)互补构成全集,版本页与 HF 数据卡互不包含对方内容;存照 C(评测队伍扩编)——arXiv v1 摘要 10 LVLM,v2 摘要 12 LVLM,NeurIPS 版以 v2 为准(§6.1 命题一);存照 D(勘误记录)——v1.0.0(2025-10-15)→v1.0.1(2025-10-23):移除未用 keys+修复 qa/ JSON 图片路径,官方 changelog 明文(§6.11 活跃信号);存照 E(可见性)——Views 73(All Versions,2026-09-22 快照),上线近一年的 Credentialed+Challenge 双门槛代价(§9.11 冷观察①)。五存照的引用规则:本条目转述以快照日期为锚,官方页实时内容可能变化。
§10.2 引文清单(八条)
- PhysioNet 版本页:CXReasonBench: A Benchmark for Evaluating Structured Diagnostic Reasoning in Chest X-rays (v1.0.1),DOI 10.13026/d14j-1b45。
- PhysioNet latest:DOI 10.13026/wgz6-zx42(引用时以实际访问版本为准)。
- 论文 arXiv:arXiv:2505.18087(v1 2025-05-26 / v2 2025-10-27)。
- NeurIPS 2025 Datasets and Benchmarks Track(Proceedings 正式版,San Diego, Dec 2-7)。
- RRID:SCR_007345。
- 代码仓库:github.com/ttumyche/CXReasonBench。
- HF 数据卡:huggingface.co/ttumyche/CheXStruct。
- MIMIC-CXR-JPG(上游图源):Johnson et al., PhysioNet,DOI 10.13026/qq6r-nf68(本系列 495 系条目互链)。
§10.3 与本系列的条目关系
上游:492/495(MIMIC 临床与影像生态——dicom 根与临床锚)→502(掩码资产——管线范式的原料层)→503(掩码不确定性——考卷噪声定标工具)。同级:505 CDSL(评测双塔的另一塔,结构化输出)。下游(预写接口):未来"过程级评测综述"类条目以本集为胸片领域锚点;Top 1000 的评测类条目模板以本条目为格式参照(§6.16)。互链锚文本:中文条目名"胸片结构化诊断推理评测基准", slug chexstruct-cxreasonbench。
§10.4 变更日志(本条目)
- 2026-09-22:v1 初稿——事实核查(PhysioNet 版本页+arXiv 摘要+HF 数据卡快照)、FACTS.md、全文 1200+ 行、发布。
- 待办:§10.8 观察清单首次季度执行(2026-12);NeurIPS Proceedings 页正式 citation 信息的确认回填。
§10.5 阅读地图(三种读者路径)
评测工程师(30 分钟):INFOBOX→§2.4/§2.5(哲学)→§4.1(行为树)→§6.8(坑点)→§7.1/§7.11(喂法与预算)→§5.4(接入)。研究决策者(15 分钟):INFOBOX→§0.1/§0.4→§6.1(官方结论)→§6.13(四连对照)→§7.18(一页纸)→§9.9(采购九问)。合规与教学(20 分钟):§8.1-§8.3(双门槛与红线)→§7.19(课程)→§9.6(合规九问)→§10.1(存照)。三路径的公共底座:§0.3 的阅读组合(502/503/505 互链)。
§10.6 速查卡(18 项)
①slug:chexstruct-cxreasonbench;②类型:Challenge(系列首个);③版本:v1.0.1(2025-10-23);④DOI:10.13026/d14j-1b45;⑤latest DOI:10.13026/wgz6-zx42;⑥RRID:SCR_007345;⑦论文:arXiv:2505.18087 = NeurIPS 2025 D&B;⑧团队:KAIST+SNUH+Seoul Medical Center,6 人;⑨访问:Credentialed(CITI+DUA 1.5.0)+区域限制;⑩HF:ttumyche/CheXStruct;⑪代码:ttumyche/CXReasonBench;⑫任务:12 诊断(8 发现+4 质量)+3 全局过滤;⑬基准规模:1,200 case×12 任务=18,988 QA(Path 1 8,044/Path 2 3,600/Re-eval 7,344);⑭图源:MIMIC-CXR-JPG(PN)/NIH+VinDr+OpenI(HF);⑮被测:10→12 LVLM(v1→v2);⑯Views:73(2026-09-22);⑰DAIMS:6.3/8;⑱资助:MSRA+IITP+KHIDI+NRF+MSIT/MOHW。
§10.7 资源导航与观察清单
资源:数据页 physionet.org/content/chexstruct-cxreasonbench/1.0.1/;论文 arxiv.org/abs/2505.18087;代码 github.com/ttumyche/CXReasonBench;开源半 huggingface.co/ttumyche/CheXStruct;上游 physionet.org/content/mimic-cxr-jpg(MIMIC-CXR-JPG);掩码生态同系列(502/503 条目)。
观察清单(季度回访):
- [ ] v1.1 或新版本是否发布(版本页 changelog)
- [ ] NeurIPS Proceedings 正式页 citation 确认(§10.4 待办)
- [ ] arXiv v3 或后续论文(LVLM 扩编与新发现)
- [ ] GitHub issues 活跃度与官方响应(§7.17 三提案的回音)
- [ ] HF 数据卡更新(三库覆盖与许可链变动)
- [ ] 引用起量(Scholar 曲线——先发红利的窗口观察)
- [ ] 竞争基准出现(过程级评测新条目——§6.12 年报触发器)
- [ ] 区域限制政策变动(PhysioNet 政策页——§8.2 残余风险)
§10.8 核查注记(本条目特有的证据边界)
A级(双源互证):版本信息/DOI/任务构成/QA 总量/三路径结构/作者与资助——PhysioNet 版本页与 arXiv 摘要对读一致。B级(单源待复核):12 LVLM 的逐模型成绩(论文表格未逐格转录进本条目,引用请回论文原文);HF 三库的逐库行数(以 HF 卡片口径转述,未逐库核对);v1.0.1 修复的完整文件清单(官方 changelog 概述级转述)。C级(推断,标注为观点):掩码生态兼容性的预期(§4.12 设计未实施);Re-eval 增益的富矿判断(§2.5);稀缺性评估(§6.12);机会地图十向(§6.5)。时间敏感项:Views/成绩/LVLM 名单/竞争格局——全部带 2026-09-22 快照戳,过期需按 §10.7 清单回访。区域限制:仅记录版本页提示的存在与机制(§8.2),未列举辖区——以官方政策页为准。
§10.9 核对练习(给下一位维护者)
①验证 DOI:10.13026/d14j-1b45 应解析到 v1.0.1 版本页;②核对 QA 总量:18,988 = 8,044+3,600+7,344(三路径加总);③核对任务数:8 发现+4 质量+3 全局=15 CSV;④核对版本对:v1.0.0 的 10-15 与 v1.0.1 的 10-23 间隔 8 天;⑤核对 HF 半三库名单:NIH CXR14/VinDr-CXR/OpenI;⑥核对 §10.6 速查卡 18 项与官方页 diff——速查卡是本条目的"校验和",它不变则全文的骨架大概率没漂。六项练习全部通过,本条目可视为仍与官方事实同步。
§10.9b 版本页快照引用(2026-09-22 抓取)
| 字段 | 快照值 |
|---|---|
| 标题 | CXReasonBench: A Benchmark for Evaluating Structured Diagnostic Reasoning in Chest X-rays v1.0.1 |
| 徽章 | Challenge / Credentialed Access |
| Access Policy | Only credentialed users who sign the DUA can access the files |
| 许可 | PhysioNet Credentialed Health Data License 1.5.0 / DUA 1.5.0 / CITI Data or Specimens Only Research |
| DOI | 10.13026/d14j-1b45(1.0.1)/ 10.13026/wgz6-zx42(latest) |
| 版本史 | 1.0.0(2025-10-15)/ 1.0.1(2025-10-23) |
| Website | github.com/ttumyche/CXReasonBench |
| Views | 64(Current)/ 73(All) |
| 区域提示 | Data is not available in your region(受限区域显示) |
| 平台维护 | MIT Laboratory for Computational Physiology |
快照表是双栖资源(PhysioNet+HF)对账的底稿——后续维护者 diff 版本页与本表,差异即变更日志素材。
§10.10 结尾三行
一份考卷的价值不在题目数量,在它让"怎么答对的"第一次变得可判分。
12 个最强模型在 18,988 道题前的集体挣扎,是 2025 年给医疗 AI 泡沫的一份冷静证词——过程比答案诚实,弃权比硬答清醒。
掩码给了机器眼睛,准则给了机器尺子,而这份基准试着教机器先承认自己不知道——三条线在批次五收拢成一件事:让医疗 AI 的每一步都留在镜头里。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- montgomery-tb — 共享标签:医学影像 / X光影像 / 医学问答与基准 / 评测基准
- fitzpatrick-17k — 共享标签:医学影像 / 医学问答与基准 / 评测基准
- serv-ct — 共享标签:医学影像 / 医学问答与基准 / 评测基准
- simcol3d — 共享标签:医学影像 / 医学问答与基准 / 评测基准
- cephalometric-isbi — 共享标签:医学影像 / 医学问答与基准 / 评测基准
- mrnet — 共享标签:医学影像 / 医学问答与基准 / 评测基准
- icbhi-2017 — 共享标签:医学影像 / X光影像 / 评测基准
- rexgradient-160k — 共享标签:医学影像 / X光影像 / 评测基准
- monuseg — 共享标签:医学影像 / 医学问答与基准 / 评测基准
- cvc-clinicdb — 共享标签:医学影像 / 医学问答与基准 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

