Swiss-Mammo — 德文乳腺报告合成数据集 AI-Ready Wikipedia

28 份医生手写的德文乳腺报告:训练语料被锁死后,合成数据的'替代发布'方法论教科书

来源 radiology resident 手写(无生成式 AI 参与)+ senior breast imaging 放射科医生独立审查;结构模仿瑞士大学医院真实报告;gte-Qwen2-1.5B-instruct 嵌入相似度验证;配套 JMIR 2025;27:e68427(DOI 10.2196/68427)发布时间: 2026-09-25最后更新: 2026-09-25 阅读 26
Swiss-Mammo — 德文乳腺报告合成数据集 AI-Ready Wikipedia

信息速览

数据集名称Swiss-Mammo — 德文乳腺报告合成数据集 AI-Ready Wikipedia
数据类型合成数据,标注数据,评测基准
规模28 份德文报告(+28 份英文翻译)——全库最小数据集;BI-RADS 0-6 每类 4 份均衡分层;全部虚构、零真实患者数据
接入方式radiology resident 手写(无生成式 AI 参与)+ senior breast imaging 放射科医生独立审查;结构模仿瑞士大学医院真实报告;gte-Qwen2-1.5B-instruct 嵌入相似度验证;配套 JMIR 2025;27:e68427(DOI 10.2196/68427)
AI 就绪度

INFOBOX:swiss-mammo 速览

字段 值
数据集 Swiss-Mammo v1.0.0(2025-04-30)→ v1.0.1(2025-06-24)
slug swiss-mammo(批次预判 Restricted 命中)
DOI v1.0.0 = 10.13026/mrg5-ja22 / v1.0.1 = 10.13026/95cy-rc09 / latest = 10.13026/gqzb-fg27(三 DOI 格局)
访问 Restricted(Restricted License 1.5.0 + Restricted DUA;注册+签约,无 CITI)——纯合成数据挂 Restricted 的悖论档(对照 526 ReXErr 合成却 ODbL 全开)
规模 28 份德文报告 + 28 份英译 = 全库最小(对照 561 金标 800、521 段 950)
分层 BI-RADS 0-6 × 每类 4 份(v1.0.0 摘要误写 “three”,v1.0.1 官方修正为 four)
制作 resident 手写(明文无生成式 AI)+ senior 放射科医生审查;结构模仿瑞士大学医院报告
语言 德文原文 + 英文翻译(人工+工具辅助,无正式语言验证)
语义验证 gte-Qwen2-1.5B-instruct 嵌入:vs 真实 28 份 0.78 / vs 真实 210 份 0.76 / vs ChatGPT 生成 21 份 0.58——手写合成与真实几乎同档、LLM 生成断层
存在理由 JMIR 论文 210 份真实标注语料被机构禁发——医生手写合成数据是"替代发布物"(论文原话 institutional restrictions)
配套论文 JMIR 2025;27:e68427(DOI 10.2196/68427,PMID 40279645,发表 2025-04-25——挂牌前 5 天)
论文方法 BERT(110M)+ frame semantics(Fillmore/Steinkamp 2019)两步管线:QA 抽 fact + NER 抽 anchor/modifier
论文成绩 QA F1 90.49%(SQuAD_v2)/ NER F1 0.81(9-fold);管线精度 facts 96.1%/entities 99.6%;Apple M1 Max 训练+无 GPU VM 部署,20 秒/报告 vs Llama 3.3 的 7 分钟(21 倍差)
团队 数据集署名 3 人(Reichenpfader/von Däniken/Bonel)——JMIR 论文 10 人(+ID SUISSE AG 与 ID BERLIN 两企业)
流量 Views 29(current)/133(all)——全库最低流量纪录(对照 521 的 39、525 的 679)
一句话 28 份手写德文报告,讲透"真实数据锁死之后合成基准怎么建、怎么自证、怎么用"的完整方法论

§0 摘要卡:全库最小数据集的最大方法论密度

§0.1 它是什么

Swiss-Mammo 是 28 份医生手写的德文乳腺 X 线报告(每类 BI-RADS 0-6 各 4 份,均衡分层),每份配英文翻译,四段式结构(临床指征/影像发现/评估/建议)。它由 Bern 应用科大的 Reichenpfader 团队制作:一名放射科住院医生手写(页面明文 “without the use of generative AI”),一位资深乳腺放射科医生独立审查。它的小是有原因的:这不是训练集,是基准评测集——配套的 JMIR 论文(BERT+frame semantics 德文报告信息抽取)的真实训练语料(210 份标注报告)因机构限制禁止发布,团队便用医生手写的合成报告建立可公开的评估基准,并用 gte-Qwen2 嵌入的余弦相似度自证语义保真:手写合成 vs 真实报告 0.76-0.78,几乎追平真实报告组间相似度 0.79;而 ChatGPT 生成的对照仅 0.57-0.59——人写虚构与 LLM 生成之间存在可测量的语义指纹断层。

§0.2 三个数字

  • 28:报告总数(4×7)——全库最小,比第二小的 RadGraph 金标(800)小一个数量级还多;但 28 份的配套叙事(相似度验证+JMIR 管线+版本考古)信息密度全库前列
  • 0.76 vs 0.58:手写合成与 ChatGPT 生成对真实报告的相似度分野——"synthetic"一词下两种制作路线的语义距离差 0.2,这是本库"合成数据三分法"的量化证据
  • 20 秒 vs 7 分钟:110M BERT 管线与 Llama 3.3 prompting 的单报告抽取耗时——精确率还双赢(96.1%/99.6% vs 91.4%/87.3%),小模型+任务专属设计的效率实证

§0.3 它怎么用

三类用法:①德文医疗 IE 基准——按 BI-RADS 分层的评测集,测 LLM/BERT 从德文报告抽 BI-RADS、病灶属性、建议等结构化字段的能力(JMIR 论文用 2 名放射科医生对 21 份前身做了人工评测模板);②frame semantics 方法论复刻——论文代码+模型+Docker 镜像全开放,28 份可作为零成本试运行数据;③合成基准构建教学样本——相似度验证的 .py 随数据集发布,"如何自证合成数据保真"可以照抄。

§0.4 联动提示

本条与 526 ReXErr(前一条目)构成"合成数据两极":526 用 GPT-4o 给 20 万份真实报告注错(规模路线,ODbL 全开),527 用医生手写虚构 28 份(合规路线,Restricted)——合成数据的访问档与规模成反比的怪象在相邻两条目完美呈现。与 528 TN-Mammo(下一发)开启乳腺影像家族;与 561 RadGraph/622 RadGraph2 同属报告结构化赛道但语种(德文)与任务(frame semantics vs 实体关系)皆异。版本考古控注意:v1.0.0 摘要写 “three reports per category”(21 份时代残留),v1.0.1 官方修正为 four——引用时认准 28=4×7。

§0.5 三个反直觉

反直觉一:最小的数据集配了最重的验证。28 份报告的相似度验证、医生双审、配套论文的人工评估(2 放射科医生逐份评 21 份前身)——验证成本与数据体量成反比。逻辑:评测基准的每份数据都会被反复用来打分,单份的噪声会系统性污染所有评测结果;训练集的噪声会被规模稀释,评测集的噪声会被规模放大。28 份的"重验证"是评测集定位的必然配置。

反直觉二:合成数据的访问档比真实派生数据更严。526 ReXErr(LLM 注错 20 万真实报告)全开放 ODbL,本条(零真实数据)反而 Restricted。合成性不决定开放性——发布机构的数据文化决定。对使用者的实际含义:别用"合成=随便下"的直觉规划工作流,PhysioNet 每条都要看 Access 档。

反直觉三:德语是稀缺性来源而非障碍。英语医学 NLP 卷得飞起(MIMIC 系一家就贡献本库 30+ 条目),德语医学文本的公开基准接近真空(medBERT.de 是少数例外)。28 份德文报告的不可替代性 > 28 万份英文报告的第 n 个复刻——语种生态位是数据集竞争的降维打击。

§0.6 它在库内的独特性自检

  • 唯一非英语报告文本条目(德语)——语种稀缺性全库唯一
  • 唯一"医生手写无 AI"的合成条目——合成光谱的人写端点
  • 唯一"训练数据禁发→合成替代"叙事的条目——合规替代方法论首例
  • 唯一配套论文发表于挂牌前 5 天的条目(526 先论文半年、522 先一年)——论文-数据一体化发布的最紧耦合

§1 条目定位:数据禁令催生的合成基准

§1.1 存在的第一因:210 份真实语料的发布禁令

JMIR 论文方法节有一句决定性的话:“To foster the traceability of our results, qualitative evaluation was performed by two radiologists using high-quality, clinician-written synthetic data, as the publication of the training dataset is prohibited due to institutional restrictions.”——论文的 210 份真实德文乳腺报告标注语料(Inselspital 临床语料库,3 名临床医生终标,Krippendorff α 三轮迭代到 facts 0.83)因为机构限制无法发布。团队的三步应对构成了本条目的完整因果链:训练数据被锁 → 医生手写合成评估集顶上(论文里 21 份)→ 扩容 28 份挂牌 PhysioNet。Swiss-Mammo 不是"又一个合成数据集",它是"真实数据不可得时如何建设可发布基准"的方法论展示品——先自证保真(相似度指纹),再声明局限(四连 Limitations),最后把验证代码一起发布。

§1.2 相似度指纹:合成数据的自证方法论

页面 Methods 节的 Similarity Assessment 是本条目的技术核心:用 gte-Qwen2-1.5B-instruct(多语通用文本嵌入)把四个语料对两两算余弦相似度——Swiss-Mammo vs 真实 28 份(dataset A)= 0.78,vs 真实 210 份(dataset B)= 0.76;ChatGPT 生成的 21 份(dataset C)vs 真实 = 0.57-0.59;手写合成 vs ChatGPT = 0.58。三个读数画出清晰的两个簇:人写虚构紧贴真实分布(与真实组间基线 0.79 仅差 0.01-0.03),LLM 生成掉出 0.6 以下。这套验证的成本极低(sentence-transformers 一段脚本,代码随数据集发布),可复用性极强——任何"手写/审查合成数据"都可以照此自证。注意单值无置信区间的局限(见 §12 缺口存照)。

§1.3 全库最小与流量最低的双纪录

28 份的规模 + Views 29/133 的流量,让本条同时持有全库"最小体量"与"最低流量"两项纪录。这恰是它的生态位真相:不是资源型数据集,是方法论型数据集——下载它的人不是为了 28 份文本,是为了复刻一条"合成基准建设+自证+配套论文"的完整路径。对照姊妹条目:526 ReXErr(前一条目)走 LLM 量产路线拿规模,本条走手写虚构路线拿信任;两者叠加,"synthetic"在医学数据语境里的全部含义(规模合成/保真合成/合规合成)在批次八前两条内集齐。


§2 团队与版本:3 人署名背后的 10 人论文

§2.1 数据集 3 人 vs 论文 10 人

PhysioNet 条目署名 3 人:Daniel Reichenpfader(Bern 应用科大 patient-centered digital health 研究所 + Geneva 大学 PhD 项目,MSc)、Sandro von Däniken(Inselspital 放射科 MD)、Harald Marcel Bonel(Inselspital 放射科 MD,senior 审查者)。但配套 JMIR 论文署名 10 人——隐身的 7 人包括 Jonas Knupp(ID SUISSE AG)、André Sander(ID BERLIN)两家医疗信息化企业人员,以及 Inselspital 放疗科的 Gaio/Dennstädt 与 Cereghetti/Hiltbrunner/Nairz。企业人员的角色(frame semantics 产品化方向)在论文中未逐人说明——数据集署名收窄到"制作-审查"核心三人,方法论与工程团队留在论文署名里,这是"数据集条目"与"方法论文"分工署名的典型样态。

§2.2 手写者之谜

页面写报告由 “a radiology resident with clinical training in breast imaging” 手写——但三人署名中 Reichenpfader 是 MSc(计算机背景,论文里的 fact schema 起草者),von Däniken 与 Bonel 是放射科医生(后者是审查的 senior)。resident 是谁?两信源(页面+论文)均未具名。按审查分工(Bonel 是 “senior radiologist specialized in breast imaging”),resident 最可能是 von Däniken——但这是推断,存照不实锤。手写者身份的匿名化也侧面说明:合成数据的"作者信任"绑定在机构(Inselspital)与审查机制(senior 独立审查)上,而非个人。

§2.3 版本时间线与三 DOI

时间 事件
2024-10-18 RadEx 框架+研究 OSF preprint(论文前身材料)
2024-11-07 JMIR 投稿(submitted)
2025-01-02 审稿意见返回
2025-02-20 修回
2025-03-16 接收(accepted)
2025-04-25 JMIR 正式发表(J Med Internet Res 2025;27:e68427)
2025-04-30 PhysioNet 挂牌 v1.0.0(发表后 5 天)
2025-06-24 v1.0.1(修正摘要 three→four + 更新论文引用)

三 DOI:v1.0.0 = 10.13026/mrg5-ja22(锁旧版);v1.0.1 = 10.13026/95cy-rc09(锁修正版);latest = 10.13026/gqzb-fg27(浮动)。引用建议:页面 BibTeX 默认给 v1.0.1 的 95cy-rc09;引用 v1.0.0 者注意其摘要是含错误的旧版。

§2.4 v1.0.1 变更声明(官方原文)

“This release corrects a minor error in the abstract: Specifically, we clarified that the Swiss-Mammo dataset currently contains four reports per BI-RADS category. We also updated the reference to the original publication as the title was changed after submission.”——两处修正对应两个故事:①"three"是论文评估集 21 份(3×7)时代的数字残留(本条目推断:28 份扩容后摘要忘了同步),官方自认并修正;②标题变更=JMIR 编辑规范要求缩写 BERT 首次出现展开为 “Bidirectional Encoder Representations From Transformers (BERT)”——论文内容零变化的机械性改题。教训:PhysioNet 摘要数字可能与正文脱节,多版本页面对比是标准核查动作。


§3 数据解剖:56 个文本文件与一个 CSV

§3.1 文件组织

两种格式双轨发布(页面 Data Description):

SwissMammo_001_BR2_DE.txt   ← 德文原文
SwissMammo_001_BR2_EN.txt   ← 英文翻译
…(共 28×2 = 56 个 UTF-8 txt)
SwissMammo.csv              ← 表格版(ID / BIRADS / Text_de / Text_en)
code/                       ← 相似度评估 .py(sentence-transformers)

命名规范 SwissMammo_<ID>_BR<BI-RADS>_<DE|EN>.txt:ID 001-028 零填充;BI-RADS 取双乳较高类别(双侧不一致时按高者归档——工程细节);语言后缀 DE/EN。CSV 列四枚:ID(如 003)、BIRADS(整数 0-6)、Text_de、Text_en。Technical Notes 提醒 German umlauts(ä/ö/ü)按 UTF-8 解码——文本管线的老朋友(对照 523 的 bz2 陷阱、526 的 errror 拼写,本条文件系统无陷阱但编码有提醒)。

§3.2 报告结构:四段式模板

每份报告四段(页面 “Report structure”):Clinical Indication(临床指征)→ Imaging Findings(影像发现)→ Assessment(评估,含 BI-RADS 类别)→ Recommendation(建议,如适用)。这个结构模仿瑞士大学医院的 mammography 报告惯例(“follow a standardized mammography reporting structure”),与 ACR 的 BI-RADS 指南结构对齐——JMIR 论文的 fact schema 正是按 BI-RADS 指南起草,报告结构与 schema 的对齐是抽取任务可做的前提。

§3.3 分层的含义与代价

BI-RADS 0-6 每类 4 份的均衡设计服务于"分类别评测":每类的抽取/分类表现可以单独算分,不被类别失衡污染。代价是页面 Technical Notes 明文承认的:“Stratification means that the dataset does not reflect the true prevalence of BI-RADS categories in the general population”——真实筛查人群中 BI-RADS 0/1/2 占绝对多数、4-6 稀少,均衡分层是评测视角而非流行病学视角。用本数据统计任何"类别分布"结论都是错的——它只回答"模型在每一类上表现如何",不回答"患者人群长什么样"。


§4 相似度验证:0.78 / 0.76 / 0.58 的三档读数

§4.1 实验设计

四个语料、六个配对、对称矩阵(页面 Methods “Similarity Assessment”):

Swiss-Mammo A(真实 28 份) B(真实 210 份) C(ChatGPT 21 份)
Swiss-Mammo – 0.78 0.76 0.58
A 0.78 – 0.79 0.59
B 0.76 0.79 – 0.57
C 0.58 0.59 0.57 –

嵌入模型 gte-Qwen2-1.5B-instruct(多语通用文本嵌入,arXiv 2308.03281,Li et al. 的 multi-stage contrastive 训练系)+ sentence-transformers 实现;评估代码随数据集的 code 文件夹发布(页面 “If you wish to reproduce or extend our analysis, we provide a corresponding .py file”)。

§4.2 三个簇的解读

  • 真实簇内部 0.79(A vs B)——同一临床语料库两次分层抽样的自然相似度基线
  • 手写合成簇 0.76-0.78(Swiss-Mammo vs A/B)——比真实基线仅低 0.01-0.03,页面结论:“only a minor decrease in average cosine similarity”
  • LLM 生成簇 0.57-0.59(C vs 真实/Swiss-Mammo)——掉出 0.6,页面用词 “substantially lower similarity scores”,判定 “reduced semantic alignment with real clinical narratives”

三个数字构成"合成数据三分法"的量化证据链:手写虚构(人脑生成、真实风格模仿)与 LLM 生成(统计生成、风格漂移)是两种不同的合成——0.2 的相似度鸿沟就是语义指纹。页面将此作为 benchmark 效用的论据:“This analysis supports the utility of the synthetic reports for benchmarking and evaluation tasks, particularly when compared to generic LLM-generated text.”

§4.3 方法论的可迁移性与边界

这套自证流程的组件(嵌入模型选型+余弦矩阵+对照集设计)成本低到任何团队都能复刻。三个边界:①单值无方差——28 份的相似度无置信区间,0.76 vs 0.79 的 0.03 差异是否显著未检验;②嵌入模型依赖——gte-Qwen2 的多语语义空间里"像不像"不等于"对不对"(医学事实错误的句子可以语义相似);③对照组规模不对等(21 vs 28 vs 210)——C 组 21 份 ChatGPT 生成报告的 prompt 未披露,其"差"可能是 prompt 差而非 LLM 天性。结论:相似度指纹是必要非充分验证——真正的语义保真还要靠 JMIR 论文里那套人工评测(2 放射科医生逐份评)兜底。


§5 配套论文:BERT + Frame Semantics 的完整成绩单

§5.1 方法论源流:Fillmore → Steinkamp → RadEx

frame semantics(框架语义学,Fillmore 1985/2006)的核心:词语的意义要在"框架"(scenario 及其角色关系)中理解。Steinkamp et al 2019 把它变成医学 IE 的信息模型——fact = 连续文本 span = anchor(事实的唯一关键词/短语)+ modifiers(可选修饰属性),让临床医生自己定义要抽什么(可复用的原子信息类型)。Steinkamp 用 pre-transformer 的 BiGRU 实现;本文(Reichenpfader et al)升级为 BERT 架构并套进自家 RadEx 框架(arXiv 2024-06-14 preprint,“A framework for structured information extraction from radiology reports based on large language models”)。

§5.2 标注工程:210 份语料的三阶段加工

初始 fact schema 由 1 计算机科学家(Reichenpfader)+1 医学计算机科学家(Knupp)按 BI-RADS 指南起草 → 2 名临床医生(1 放射+1 放射肿瘤)迭代增补 → 质量改进 3 轮(每轮 4 clinicians 中的 2 人标 7 份新报告,差异集体讨论,schema 同步修订)→ 终标 210 份(仅 clinical findings 段)由 3 clinicians 完成。工具:Inception 标注平台本地部署(版本 26.8→30 跨版本迁移)。

IAA(Krippendorff α unitizing)三轮轨迹(Table 2):

轮次 facts α anchors α modifiers α
Round 1 0.49 0.42 0.50
Round 2 0.74 0.64 0.60
Round 3 0.83 0.61 0.61

facts 层收敛良好(0.49→0.83),anchors 第 3 轮回落(0.64→0.61)、modifiers 低位徘徊——unitizing 任务(文本单元切分+归类双步)的 IAA 天然比 521 rad-coref 的分类任务(α 0.79-0.87)难做高。

§5.3 schema 演化:24+66 → 14+40 的两道筛

初始 schema 覆盖完整报告:24 facts + 66 modifiers。两道筛选后变成最终抽取目标 14 fact types + 40 entity types(14 anchor + 26 modifier):①零实例筛——210 份建模集中 4 facts+26 modifiers 从未出现( mammography findings 段触发不了);②最小类频筛——6 facts+14 modifiers 标注 <20 次被排除(阈值 20)。最终建模集含 2,519 个标注 fact 实例(NER 转换后 2,772 facts——两口径并存:前者是 schema 合规实例数,后者是含任务转换的总数)。对照 526 ReXErr 的稀疏类目策略:ReXErr 用 tag 频率倒数加权补偿稀疏类,本文直接排除稀疏类——加权保覆盖、排除保精度,两种哲学。

§5.4 四模型变体与两步管线

全部基于 classical BERT(110M 参数):

变体 构造 Perplexity
medBERT.de 基线(470 万德语医学文档预训练) 1.21
InselBERT_multi medBERT.de + 多模态报告 MLM(“Insel”=Inselspital) 1.12
InselBERT_mammo_03 乳腺子集 MLM 3 epochs 1.11
InselBERT_mammo_10 乳腺子集 MLM 10 epochs 1.09

MLM 超参:lr 2e-5、wd 0.01、masking 0.15、3 epochs。两步管线:QA 模型(SQuAD_v2 抽取式,按 fact type 逐个提问抽 span)→ NER 模型(IOB 序列标注,span 内切 anchor/modifier)。部署:BentoML 打包 Docker(3.68 GB)→ 无 GPU VM(7.7 Gi RAM)→ 单报告 <20 秒。

§5.5 成绩单与两个负结果

量化(Table 4/5):QA F1 = medBERT.de 90.09 / multi 89.78 / mammo_03 90.49(最优) / mammo_10 90.4(95% CI 重叠——差异不显著);NER F1 = 四变体全部 0.81(9-fold,SD ≤0.008)。

负结果一:领域再预训练无下游收益。perplexity 单调改善(1.21→1.09)但 QA/NER 两任务提升均在 CI 内——“Further pretraining on hospital data reduced model perplexity, although it did not significantly impact the 2 downstream tasks”。对照 524 RadVLM 的"数据配方决定一切"叙事:在 110M 小模型+小标注集场景,再预训练的收益被微调抹平。

负结果二:SNOMED-CT 归一化仅 64.29%。抽取后的概念归一化(SNOMED-CT+Wingert 术语)3,582 concepts 中 2,303 plausible——管线最弱环节,原因是大量 implausible SNOMED-CT 概念(论文建议约束 subtype 关系可改进)。抽取 90%+ 与归一化 64% 的落差说明:结构化报告的最后一公里(术语挂接)比抽取本身难。

§5.6 与 Llama 3.3 的正面对决

论文用 best-practice prompting 的 Llama 3.3(Meta 开源)做生成式抽取对照:

指标 InselBERT 管线 Llama 3.3
facts 精度 96.1% 91.4%(正文;摘要写 91.2%——官方数字漂移存照)
entities 精度 99.6% 87.3%
单报告耗时 <20 秒(无 GPU) 7 分钟(21 倍差)
部署 3.68 GB Docker / 7.7 Gi RAM GPU 推理
失败模式 否定句误判(Table 6) 幻觉+schema 越界

Llama 3.3 的两类病:①false positive 幻觉——源文档没有的信息被抽出(“the model tends to hallucinate especially for false positive extractions”);②schema 越界——抽 BI-RADS 时捎带病灶尺寸(“extracting additional information not defined in the fact schema”)。BERT 管线的失败更"体面"——全部 fact 错分集中在 3 个文本 span(“No retracted areas”/“No evidence of malignancy”/“Mamilla distance 54mm”)与单词 “No”(Dignity modifier)——否定句是主要错误模式(negation detection 是 frame semantics 的已知边界,论文结论自认)。204 个对的实例与 8 个错的实例加起来就是"encoder 可解释性"的具体形状:错误可枚举、可归因、可修。

§5.7 算力叙事:Apple M1 Max 的含金量

“Model pretraining and fine-tuning were performed on a single Apple M1 Max chip.”——整条流水线(含领域 MLM 预训练)在一台笔记本芯片上完成,部署在无 GPU 的机构 VM。对照 524 RadVLM 的 CSCS Alps 超算与 7B 模型:110M BERT + 210 份标注 + M1 Max = 人类可比的抽取质量(论文结论原话 “even with a small annotated dataset and a relatively small language model, the quality of IE is comparable to human performance”)。这是医疗 NLP 的另一条路线证明:任务窄、schema 明确、输出可解释的场景里,小模型+好设计没有被 LLM 时代淘汰。

§5.8 训练超参全表(复现者直取)

环节 超参 值
MLM(领域再预训练) epochs / lr / wd / masking 3 / 2e-5 / 0.01 / 0.15
QA 微调 lr / epochs / max seq / stride 3e-5 / 5 / 384 / 128
QA 数据划分 train/test/val 70%/15%/15%(1,972/274/273 examples)
NER 微调 lr / max epochs / wd / batch / optimizer 5e-5 / 100 / 1e-2 / 16 / AdamW
NER 早停 patience(test 集下降轮数) 5(保存最优回滚加载)
NER 评估 折数/划分 9-fold(80/10/10,val 折间共享)
QA 评估 置信区间 bootstrap 599 resamples @95%
硬件 训练 Apple M1 Max 单机
部署 打包/运行环境/耗时 BentoML Docker 3.68 GB / 7.7 Gi RAM VM / <20 秒

复现提示:论文声明 seed 手动设定但未公布值——严格复现需自行扫描 seed;早停回滚机制(best model reload)是 NER 稳定性的关键细节,漏掉会引入最后几个 epoch 的过拟合噪声。


§6 生态位:德语、乳腺、frame semantics 的三重稀缺

§6.1 语种稀缺

德文临床 NLP 语料极稀——论文 Related Work 里的德文基座只有 medBERT.de(470 万文档)。乳腺报告的德文公开基准在 Swiss-Mammo 之前为零。本条是德语乳腺影像 IE 的第一个公开评测集——502 万德语人口(瑞士+德国+奥地利核心区)的乳腺筛查质控研究从此有了现成基准。

§6.2 任务稀缺:frame semantics vs 主流范式

主流医学 IE 是 NER+RE(561 RadGraph 系)或 QA/LLM 抽取;frame semantics 路线(临床医生自定义 fact schema + anchor/modifier 结构)在小众但有两个独优点:①可定制——“enables customizable information extraction”,加新 fact type 不改架构;②可解释——抽取结果直接锚定原文 span(“the output of our pipeline is directly linked to the free-text in the report”),临床审计友好。论文对 GLiNER 的讨论承认 encoder 系灵活抽取的趋势,但坚持任务专属优化在临床场景的精度优势。

§6.3 库内坐标

联动条目 关系
526 ReXErr(前一条目) 合成数据两极:LLM 注错 200k+/Open vs 手写虚构 28/Restricted
528 TN-Mammo(下一发) 乳腺影像家族:本条管文本、528 管图像
561 RadGraph / 622 RadGraph2 报告结构化同行:英语实体关系 vs 德语 frame semantics
521 rad-coref IAA 方法论对照:分类任务 α 0.79-0.87 vs unitizing 任务 α 0.42-0.83
524 RadVLM 算力光谱两极:CSCS Alps 7B vs Apple M1 Max 110M

§6.4 瑞士医疗数据文化的侧写

本条目背后是瑞士医疗数据治理的典型形态:大学医院(Inselspital)的临床语料禁发(即使标注后去标识)——机构限制优先于科研开放;应用科大(BFH)作为学术-产业的桥接层,用合成数据绕开禁令完成方法学发布;两家信息化企业(ID SUISSE/ID BERLIN)在论文署名里候场(产品化路线)。对照美国生态(MIMIC 全开放)与英国生态(NHS 数据沙箱):瑞士模式=紧数据+松方法——方法论文与合成基准全开放,真实数据锁死。这解释了为什么 frame semantics 的可定制性被强调(“enables customizable information extraction … with additional annotation efforts”)——其他机构要复用,只能自建标注,工具链开放性是瑞士团队的补偿设计。


§7 使用指南:谁该下载这 28 份

§7.1 三类用户画像

①德语医疗 NLP 团队:唯一的德文乳腺报告公开基准,直接测模型 BI-RADS 分类与字段抽取;②报告结构化工程组:frame semantics 的 fact schema 定义、标注 guideline、两步管线代码、Docker 镜像全开放——照抄一套"临床医生可自定义"的抽取系统;③数据集建设者:相似度验证 .py + 对照组设计 = "合成基准自证"的模板,任何手写/审查合成数据都可复用。

§7.2 访问与合规

Restricted 档:PhysioNet 注册 + 签 Restricted DUA(无 CITI 培训强制——同 525 REFLACX 档位形态)。纯合成数据本无 PHI 风险,Restricted 是发布方的保守选择(§2/§10 详述悖论)。引用义务双份:PhysioNet 标准引用(RRID SCR_007345)+ JMIR 论文(页面 “Additionally, please cite the original publication” 明文)。无 Parent Projects——不欠母集引用(对照 526 的 MIMIC-CXR 引用义务)。

§7.3 坑点表(十条,标准格式)

坑点 典型翻车 绕行姿势
坑点1:拿摘要 three 当真 写成 21 份(3×7)报告 v1.0.1 已修正 four——28=4×7,认准 v1.0.1 口径
坑点2:synthetic 脑补成 AI 生成 把本条归入 LLM 合成家族 页面明文 “without the use of generative AI”——人写虚构
坑点3:28 份当训练集 训练完直接过拟合报告风格 它是评测基准;训练另找数据(对照附录 O 分层账本)
坑点4:均衡分层当流行率 用 BI-RADS 分布推人群统计 Technical Notes 明文否认——评测视角设计
坑点5:0.76 当"与真实无异" 夸大相似度结论 真实基线 0.79 有 0.03 差,且单值无 CI——必要非充分证据
坑点6:摘要 91.2% 与正文 91.4% 混引 Llama 3.3 精度引错版本 认正文 91.4(附录 E.5 存照)
坑点7:21 份两处混用 把 dataset C 当论文评估集 数字巧合属性不同:C=ChatGPT 对照/评估集=手写
坑点8:引用漏 JMIR 论文 只引 PhysioNet 页面双引用义务明文——论文必须同引
坑点9:EN 版做德语 NLP 英译噪声污染实验 英译无语言学验证——德文版才是主语料
坑点10:2,519/2,772 混用 fact 总数引用漂移 前者建模集合规实例、后者 NER 转换总数——两口径并存存照

§8 批评视角:28 份能证明什么、不能证明什么

§8.1 不能证明的

  • 人群级结论:均衡分层+全虚构——任何流行病学、分布假设检验在此无意义
  • 模型泛化性:单机构(Inselspital)报告风格——页面 Limitations 明文 “might not be generalizable to other institutional reporting standards”;瑞士德语与德国德语的临床文书差异(缩写习惯、医院模板)未被覆盖
  • 真实文书的全貌:不含缩写、不含错误、不含涂抹修改(“do not capture the full complexity or variability of real clinical documentation (including e.g., abbreviations or errors)”)——太干净的语料测不出模型对"脏数据"的鲁棒性。对照 526 ReXErr 专门注入错误——527 的干净与 526 的有毒恰好是鲁棒性测试光谱的两端
  • 英译质量:人工+工具辅助、无形式语言学验证——EN 版只能当参考读,严谨的德文 NLP 工作用 DE 版

§8.2 能证明的

  • 合成基准的自证方法(相似度指纹+人工审查+代码公开)——方法论完整可迁移
  • frame semantics 管线的可行性——JMIR 论文的 96.1%/99.6% 精度与 20 秒/报告的成本
  • 小模型+窄任务的生存空间——Llama 3.3 对决的完胜(精度+速度+部署门槛)
  • 数据禁令的应对范式——机构锁数据时,合成替代的完整动作清单

§8.3 公允定位

Swiss-Mammo 的 28 份是"种子"不是"森林":它不解决规模问题(那是 526/523 们的活),它解决合法性与方法论示范问题——当机构不放数据时,怎么用最小成本建设一个可发布、可信、可复用的替代基准。全库最小+全库最低流量+方法论最完整三顶帽子一起戴,这正是"评测基准"与"资源数据集"的分野。


§9 版本考古专题:three→four 的官方自认

§9.1 错误的形态

v1.0.0 摘要:“The reports are stratified across BI-RADS categories 0 through 6, with three reports per category.”——3×7=21 ≠ 28,与同页 Methods 节 “four examples per BI-RADS category” 直接矛盾。同一页面摘要与正文数字打架,这是页面写作质量事故;但 Methods 与数据文件(28 份)自始正确。

§9.2 错误的来源(推断链,标注为推断)

JMIR 论文的人工评估用 “a manually generated synthetic dataset of 21 reports”(=3×7)→ 正式挂牌扩容到 28(=4×7)→ v1.0.0 摘要写作时沿用了 21 份时代的 “three reports per category” 表述 → v1.0.1 修正。"three"是演化残留而非随机笔误——版本考古的价值在于此:错误本身携带了数据集从 21→28 的生长史。

§9.3 修正的机制

v1.0.1 变更声明点名两处:摘要数字(three→four)+ 论文引用(标题变更——BERT 缩写展开的编辑规范改题)。注意 v1.0.1 未声明数据文件变更——修正限于页面文本,文件层 diff 无从验证(Files 区地区限制,本条目存照)。给库内读者的操作建议:任何引用 Swiss-Mammo 数字的场合,以 v1.0.1 页面+数据文件实际 count 为准;引用 v1.0.0 DOI(mrg5-ja22)的文献自带 “three” 错误,需读者自查。


§10 FAQ:速查索引(按主题分组)

FAQ-1 基础认知(8 问)

Q1:Swiss-Mammo 是什么?

28 份医生手写的德文乳腺 X 线报告合成数据集(每份配英文翻译),BI-RADS 0-6 七类每类 4 份均衡分层,由 Bern 应用科大+Inselspital 团队发布于 PhysioNet(v1.0.0 2025-04-30 / v1.0.1 2025-06-24)。

Q2:为什么只有 28 份?

它是评测基准不是训练集。它的前身是 JMIR 论文里 21 份(3×7)人工评估集,挂牌时扩容为 28 份(4×7)。设计目标是在每类 BI-RADS 上有足够的评测样本,而非提供训练规模。

Q3:synthetic 在这里指什么?

指’不基于真实患者记录’(fully synthetic, identifiers 与 dates 全虚构),而非’AI 生成’——页面明文报告由 radiology resident 手写,without the use of generative AI。

Q4:报告是什么语言?

德文原文 + 英文翻译双语对(56 个 txt 文件 + 1 个 CSV)。英译为人工+自动工具辅助,未经正式语言学验证——严谨工作用德文版。

Q5:BI-RADS 是什么?

Breast Imaging-Reporting and Data System,美国放射学会(ACR)的乳腺影像报告与数据系统,0-6 七级分类(0 需回看/1 阴性/2 良性/3 可能良性/4 可疑/5 高度可疑恶性/6 活检证实恶性),乳腺报告的结构化标准。

Q6:数据集怎么访问?

PhysioNet Restricted 档:注册账号+签 Restricted DUA 即可下载,无 CITI 培训强制。纯合成数据挂 Restricted 是发布方的保守选择。

Q7:数据文件长什么样?

txt 按 SwissMammo_<ID>BR<类别><DE|EN>.txt 命名(ID 001-028 零填充);CSV 四列 ID/BIRADS/Text_de/Text_en;报告四段式:Clinical Indication/Imaging Findings/Assessment(含 BI-RADS)/Recommendation。

Q8:和真实报告的区别是什么?

内容是虚构的(不基于任何真实患者),但语言风格模仿瑞士大学医院真实 mammography 报告;且刻意’干净’——不含真实文书的缩写、错误与混乱(页面 Limitations 自认)。

FAQ-2 版本与数字(6 问)

Q9:v1.0.0 和 v1.0.1 有什么区别?

v1.0.1(2025-06-24)官方变更声明:修正摘要错误(three→four reports per category)+ 更新论文引用(标题变更)。未声明数据文件变更。

Q10:摘要的 three reports 是怎么回事?

v1.0.0 摘要写 ‘three reports per category’(3×7=21)与 Methods 节 ‘four’(28)矛盾。本条目推断:21 是论文评估集时代(3×7=21 份)的数字残留,扩容 28 后摘要没同步。v1.0.1 官方修正。

Q11:应该引用哪个 DOI?

v1.0.0=10.13026/mrg5-ja22(摘要是含错旧版);v1.0.1=10.13026/95cy-rc09(修正版);latest=10.13026/gqzb-fg27(浮动)。一般引用 v1.0.1。

Q12:论文标题为什么变了?

投稿版 ‘Enhancing BERT with Frame Semantics…’,发表版把 BERT 展开为 ‘Bidirectional Encoder Representations From Transformers (BERT)’——JMIR 编辑规范要求缩写首次出现用全称,机械性改题。

Q13:JMIR 论文什么时候发表的?

J Med Internet Res 2025;27:e68427,2025-04-25 发表(DOI 10.2196/68427,PMID 40279645)——PhysioNet 挂牌(2025-04-30)前 5 天。OSF preprint 2024-10-18,JMIR 投稿 2024-11-07。

Q14:Project Views 为什么这么低?

current 29/all 133——全库最低流量。原因:体量小+德语垂直+挂牌时间短+用途窄(评测基准而非资源库)。低流量与高方法论密度并存。

FAQ-3 制作与验证(6 问)

Q15:报告是谁写的?

一位有乳腺影像临床训练的 radiology resident 手写(未具名)——数据集 3 位署名作者中 von Däniken 与 Bonel 是放射科医生 MD,Reichenpfader 是计算机背景 MSc;resident 最可能是 von Däniken(推断,未实锤)。

Q16:审查机制是什么?

全部 28 份由 senior breast imaging 放射科医生独立审查,确保临床合理性与语言学准确性。审查记录未随数据发布(对照 526 ReXErr 的 clinician-review.csv 公开)。

Q17:相似度验证是怎么做的?

gte-Qwen2-1.5B-instruct 句子嵌入+余弦相似度,四个语料两两对照:Swiss-Mammo vs 真实 28 份 0.78、vs 真实 210 份 0.76、ChatGPT 生成的 21 份 vs 真实 0.57-0.59。验证代码随数据集发布。

Q18:为什么用 ChatGPT 生成报告做对照?

dataset C(21 份 ChatGPT 报告)是’通用 LLM 生成’的对照组——0.57-0.59 的低相似度证明手写合成与真实分布更近。注意:C 组的 prompt 未披露,其’差’可能是 prompt 差而非 LLM 天性上限。

Q19:dataset B 的 210 份和论文训练集是同一批吗?

页面说 ‘a separate stratified dataset of 210 real reports sampled from the same mammography corpus’——同一临床语料库、同规模分层抽样,但措辞 separate;论文那 210 份被禁发,此处更可能是不同实例。未实锤,存照。

Q20:0.76 的相似度能证明’和真实一样’吗?

不能证明’一样’。真实组间基线 0.79,手写合成 0.76-0.78 有 0.01-0.03 差距;且单值无置信区间、嵌入相似不等于事实正确。它是必要非充分的保真证据,人工审查是另一支柱。

FAQ-4 配套论文(JMIR e68427)(10 问)

Q21:论文的抽取任务是什么?

从德文 mammography 报告的 clinical findings 段抽取 14 种 fact types 和 40 种 entity types(14 anchor+26 modifier)——fact 是连续文本 span(anchor 唯一关键词+可选 modifiers),信息模型源自 frame semantics(Fillmore)经 Steinkamp 2019 医学化。

Q22:标注数据怎么来的?

Inselspital 真实报告 210 份:schema 三阶段演化(初始 24 facts+66 modifiers → 零实例筛 → 最小类频 20 筛 → 14+40);4 clinicians 三轮迭代(每轮 2 人标 7 份),IAA 用 Krippendorff α unitizing(facts 0.49→0.74→0.83);终标 3 clinicians 完成,共 2,519 个 fact 实例。

Q23:为什么训练数据不发布?

论文原话:‘the publication of the training dataset is prohibited due to institutional restrictions’——Inselspital 的机构限制。这正是 Swiss-Mammo(手写合成)存在的第一因:替代发布物。

Q24:论文训练了哪些模型?

四个 BERT(110M)变体:medBERT.de 基线(470 万德语医学文档预训练)、InselBERT_multi(+多模态报告 MLM)、InselBERT_mammo_03/10(乳腺子集 MLM 3/10 epochs)。两步管线:QA 抽 fact span(SQuAD_v2 格式)+ NER 切 anchor/modifier(IOB)。

Q25:成绩怎么样?

QA F1 90.49%(最优变体 mammo_03,SQuAD_v2,95% CI 87.53-92.47);NER F1 0.81(9-fold CV);全管线人工评估 facts 96.1%、entities 99.6% 精度;SNOMED-CT 归一化仅 64.29%(最弱环节)。

Q26:领域预训练有用吗?

对 perplexity 有用(1.21→1.09 单调降),对下游任务无显著提升(CI 全重叠)——论文的负结果。小模型+小标注集场景,微调抹平了预训练收益。

Q27:和 Llama 3.3 比呢?

完胜:facts 96.1% vs 91.4%(正文口径;摘要 91.2% 有出入)、entities 99.6% vs 87.3%、单报告 20 秒 vs 7 分钟(21 倍)、无 GPU 3.68 GB Docker vs GPU 推理。Llama 3.3 的病:false positive 幻觉+schema 越界(抽 BI-RADS 时捎带病灶尺寸)。

Q28:BERT 管线会错在哪?

否定句。全部 fact 错分集中在 3 个文本 span(‘No retracted areas’/‘No evidence of malignancy’/‘Mamilla distance 54mm’)+单词 ‘No’(Dignity modifier)——negation detection 是 frame semantics 的已知边界(论文结论自认)。

Q29:训练用了什么硬件?

单台 Apple M1 Max(论文原话 ‘a single Apple M1 Max chip’)完成预训练+微调;部署在无 GPU VM(7.7 Gi RAM)。对照大模型时代的算力叙事,这是小模型路线的算力宣言。

Q30:代码和模型开放吗?

论文 data availability 声明:源代码+训练模型+容器化管线镜像全开放(OSF/Zenodo——Zenodo record 14793527);数据集 code 文件夹含相似度评估脚本。

FAQ-5 使用与坑位(7 问)

Q31:适合训练模型吗?

不适合——28 份是评测集。训练请看论文的合成数据策略或用 LLM 扩增(但相似度指纹警告:LLM 生成与真实分布 0.2 的鸿沟)。

Q32:评测该怎么设计?

按 BI-RADS 分层报告成绩(每类 4 份);抽取任务对照 JMIR 的 fact/anchor/modifier 三层;德文任务忽略 EN 翻译(未经语言学验证);报告单类成绩时注意每类仅 4 份的方差。

Q33:最大的坑是什么?

把 synthetic 读成 AI 生成(页面明文手写无 AI);把摘要 three 当真(v1.0.1 已修正);把均衡分层当流行率(Technical Notes 明文否认);拿英译版做德语 NLP。

Q34:英译版可以用于英文 NLP 吗?

谨慎。翻译是人工+自动工具辅助、无正式语言学验证(页面 Limitations 明文)——英文版参考可、评测慎用,尤其术语细节(德文医学术语的英译等价性未验证)。

Q35:BI-RADS 多双侧报告怎么算?

文件命名的 BI-RADS 取双乳较高类别(命名规范明文)——跨类别统计时注意这个归档规则,单侧分析需要回文本重新判定。

Q36:和 526 ReXErr 怎么选?

做英文胸片错误检测→526(200k+ 份 LLM 注错,ODbL 全开);做德文乳腺抽取评测或学合成基准方法论→527(28 份手写+全套自证模板)。合成光谱两极:规模合成 vs 信任合成。

Q37:德语 umlauts 有坑吗?

Technical Notes 提醒 ä/ö/ü 与其他变音符号按 UTF-8 解码——用错编码会静默损坏文本,读文件显式指定 encoding=‘utf-8’。

FAQ-6 批判性视角(5 问)

Q38:这份数据集最大的局限是什么?

规模(28 份无统计功效)+单机构风格(瑞士一院模板)+过净(无缩写无错误)——三者叠加意味着它只能测’受控条件下的抽取上限’,测不了真实世界性能。页面 Limitations 四连自认。

Q39:Restricted 档对合成数据有必要吗?

伦理上无必要(页面自认 no ethics concerns)——纯合成无 PHI。Restricted 是发布方保守选择(可能受母集机构数据文化影响)。对照 526 ReXErr 合成却 ODbL 全开——合成数据的访问档由风险偏好决定而非数据属性。

Q40:相似度验证有什么方法论缺陷?

单值无方差;嵌入相似≠事实正确;对照组 prompt 未披露;四语料规模不对等(21/28/210)。它证明’手写比 LLM 生成更贴近真实分布’这个相对结论,不证明绝对保真。

Q41:resident 匿名是问题吗?

是信息缺口——手写者资历(resident 年级、乳腺影像训练时长)直接影响数据可信度评估。数据集的信任绑在机构+senior 审查上而非个人资质公示。

Q42:如果 LLM 生成的报告改得好,能追上 0.76 吗?

开放问题。dataset C 只测了 2024-25 年 ChatGPT+未披露 prompt 的一种配置;few-shot+风格微调+医学语料 continued pretraining 的 LLM 生成未测。0.58 是’通用 LLM 直接生成’的读数,不是 LLM 路线的天花板。

FAQ-7 深挖追问(进阶 8 问)

Q43:Krippendorff α 的 unitizing 变体和普通 Cohen κ 差在哪?
unitizing 处理"文本单元边界本身有分歧"的任务(标注者先要切分 span 再归类),κ 假设单元边界已定只分类别。本条目的 fact span 切分天然是 unitizing 场景——α 0.83 的 facts 收敛已经不错,anchors/modifiers 的低位徘徊部分反映了切分歧义的传递。

Q44:为什么 anchors 的 IAA 第三轮回落?
可能原因:Round 3 引入了新的 fact 类(23/22 vs Round 2 的 22/21),新类目的 anchor 判定规则尚未沉淀;或样本小(每轮 7 份)的波动。论文未分析回落原因——存照。

Q45:两步管线(QA→NER)为什么不做端到端?
设计选择:QA 按 fact type 逐个提问(每报告跑多次管线)换来 schema 驱动的可控性——新增 fact type 只改问题不改模型;端到端多标签抽取虽快但加类需重训。代价:单报告 <20 秒里含多次前向(对比端到端的单次前向,20 秒已经很快)。

Q46:Dignity(良恶性)为什么会被 ‘No’ 触发?
德文报告里 Dignity 相关表述常与否定共现(“kein Malignitätsnachweis” 无恶性证据)——NER 模型把孤立否定词误绑到 Dignity anchor。这是 negation 与实体绑定耦合的教科书案例。

Q47:64.29% 的归一化失败都是假阳性吗?
不是——是"implausible concepts"(语义不合理挂接),如把描述性表述挂到不相关的 SNOMED 概念。论文建议约束 subtype 关系(每个实体类型只允许特定语义层次的候选)可改进——这是知识图谱约束解码的思路。

Q48:28 份里有没有正常的"双侧不同类别"样本?
命名规范只留"取高者"的痕迹(BR 后缀),文本内部会写双侧各自的类别。下载后可统计——本条目核查时 Files 区受限,无法预核——存照为待验证项。

Q49:这个数据集会被 LLM 时代淘汰吗?
反向思考:LLM 时代更需要它——LLM 抽取的幻觉问题(论文 Llama 3.3 对照实测)恰好需要受控基准来量化;28 份+人工审查记录的"干净评测面"是 LLM 评测的稀缺资源。淘汰论不成立,但护城河是方法论(指纹自证+frame schema)而非数据本身。

Q50:如果我想复制这套流程到别的机构/语言?
论文 RadEx 框架+Zenodo 代码是完整模板:①临床医生定义 fact schema(BI-RADS 指南起步)②三轮标注迭代(IAA 监控)③210 份级标注④BERT 微调⑤合成评估集+相似度指纹自证⑥BentoML 部署。估算:标注 3 人月+工程 1 人月+一台 MacBook——附录 H.4 的算力光谱证明了可行性。

(FAQ 深挖组合计 8 问;全 FAQ 50 问)


§11 事实清单:逐条存照(每条可溯源至页面快照/PMC 全文/v1.0.1 变更声明)

  1. 全名 Swiss-Mammo: A physician-written, synthetic dataset of German mammography reports;slug swiss-mammo。
  2. v1.0.0 挂牌 2025-04-30;v1.0.1 2025-06-24;三 DOI:mrg5-ja22(v1.0.0)/ 95cy-rc09(v1.0.1)/ gqzb-fg27(latest)。
  3. 访问档 Restricted:Restricted Health Data License 1.5.0 + Restricted DUA;注册+签约即可,无 CITI 强制(同 525 REFLACX 档位形态)。
  4. 页面 Ethics 原话 ‘As this is a purely synthetic dataset, no real patient data was used, and there are no ethics concerns to declare’——纯合成挂 Restricted 的悖论存照。
  5. 规模 28 份德文报告+28 份英译——全库最小数据集(对照 561 金标 800、521 段 950、525 读片 3,052)。
  6. BI-RADS 0-6 七类每类 4 份(28=4×7);v1.0.0 摘要误写 ‘three’,v1.0.1 官方变更声明修正为 ‘four’。
  7. v1.0.1 变更声明原话:‘This release corrects a minor error in the abstract … We also updated the reference to the original publication as the title was changed after submission.’
  8. 文件命名 SwissMammo_<ID>BR<BI-RADS><DE|EN>.txt,ID 001-028 零填充,BI-RADS 双乳取较高类别;CSV 四列 ID/BIRADS/Text_de/Text_en。
  9. 报告四段式:Clinical Indication / Imaging Findings / Assessment(含 BI-RADS) / Recommendation(如适用)。
  10. 页面 Abstract 明文 ‘manually created by a radiology resident without the use of generative AI’ + ‘independently reviewed by a senior radiologist specialized in breast imaging’。
  11. 数据集署名 3 人:Daniel Reichenpfader(BFH+Geneva,MSc)、Sandro von Däniken(Inselspital 放射科 MD)、Harald Marcel Bonel(Inselspital MD,senior 审查)。
  12. JMIR 论文署名 10 人:+Knupp(ID SUISSE AG)/Gaio/Dennstädt(放疗科)/Cereghetti/Sander(ID BERLIN)/Hiltbrunner/Nairz/Denecke(BFH 教授)。
  13. 手写 resident 未具名——本条目推断最可能 von Däniken(未实锤存照)。
  14. 相似度验证模型 gte-Qwen2-1.5B-instruct(arXiv 2308.03281),sentence-transformers 实现,代码随数据集发布。
  15. 相似度矩阵:Swiss-Mammo vs A(真实 28)0.78 / vs B(真实 210)0.76 / vs C(ChatGPT 21)0.58;A vs B 0.79(真实基线);C vs 真实 0.57-0.59。
  16. 页面结论:‘only a minor decrease’(0.79→0.76)vs ChatGPT ‘substantially lower similarity scores(<0.6)’。
  17. dataset C = 21 份 ChatGPT 生成报告——与论文评估集 21 份数字巧合但属性不同(对照 vs 评估集)。
  18. 配套论文:J Med Internet Res 2025;27:e68427(DOI 10.2196/68427,PMID 40279645,PMCID PMC12064967);OSF preprint 2024-10-18;submitted 2024-11-07;accepted 2025-03-16;published 2025-04-25。
  19. 论文标题变更:BERT→‘Bidirectional Encoder Representations From Transformers (BERT)’(JMIR 缩写展开规范)。
  20. 论文方法源自 Steinkamp et al 2019(DOI 10.1007/s10278-019-00234-y)的 fact 信息模型+Fillmore frame semantics;作者自家 RadEx 框架(arXiv 2024-06-14)。
  21. fact = 连续文本 span = anchor(唯一关键词/短语)+ modifiers(可选修饰)。
  22. 标注语料 210 份真实报告(Inselspital)——‘publication of the training dataset is prohibited due to institutional restrictions’(禁发原话)。
  23. schema 演化:初始 24 facts+66 modifiers → 零实例筛(-4 facts/-26 modifiers)→ 最小类频 20 筛(-6 facts/-14 modifiers)→ 最终 14 fact types+40 entity types。
  24. 建模集 2,519 个标注 fact 实例(NER 转换后 2,772 facts——两口径并存)。
  25. 标注三阶段:初始化(DR+JK 起草+2 临床医生增补)→ 质量改进 3 轮(4 clinicians 每轮 2 人标 7 份)→ 终标(3 clinicians,仅 findings 段)。
  26. IAA = Krippendorff α unitizing 三轮:facts 0.49→0.74→0.83;anchors 0.42→0.64→0.61(R3 回落);modifiers 0.50→0.60→0.61。
  27. 标注工具 Inception 本地部署(版本 26.8→30 迁移);CAS(Common Analysis Structure)格式;spaCy 分词+自有缩写表。
  28. 四模型变体(全 BERT 110M):medBERT.de(470 万德语医学文档预训练基线)/ InselBERT_multi / InselBERT_mammo_03/10(乳腺子集 MLM 3/10 epochs)。
  29. MLM 超参:lr 2e-5、wd 0.01、masking 0.15、3 epochs。
  30. 两步管线:QA(SQuAD_v2 抽取式)抽 fact span → NER(IOB 序列标注)切 anchor/modifier;QA 划分 70/15/15=1,972/274/273 examples;lr 3e-5、5 epochs、seq 384、stride 128。
  31. NER 训练 9-fold CV(80/10/10);lr 5e-5、max 100 epochs、wd 1e-2、batch 16、AdamW、early stopping patience 5。
  32. Perplexity:1.21(medBERT.de)→1.12(multi)→1.11(mammo_03)→1.09(mammo_10)——单调降但下游无显著提升(负结果一)。
  33. QA F1(Table 4):90.09/89.78/90.49(最优 mammo_03)/90.4;EM 79.49/78.02/80.59/79.85——CI 全重叠(负结果一的下游侧写)。
  34. NER F1(Table 5):四变体全部 0.81(9-fold,SD ≤0.008);accuracy 0.82。
  35. 部署:BentoML 打包 Docker 3.68 GB → 无 GPU VM(7.7 Gi RAM+3.8 Gi Swap)→ 单报告 <20 秒。
  36. 人工评估:2 放射科医生评 21 份合成报告(‘manually generated synthetic dataset of 21 reports’)——Swiss-Mammo 28 份的前身(21→28 演化链)。
  37. 管线抽取:205 facts(14 types)→197 正确(96.1%);497 entities(24 types)→495 正确(99.6%);10/14 fact types+23/24 modifier types 精度 100%。
  38. 错分全集中:‘No retracted areas’(Foreign material 1+Asymmetry 3)/‘No evidence of malignancy’(Foreign material 1+Recommendation 2)/‘Mamilla distance 54mm’(Mamilla region 1)/‘No’(Dignity 2)——否定句主模式。
  39. SNOMED-CT+Wingert 归一化:3,582 concepts→2,303 plausible(64.29%)——管线最弱环节。
  40. Llama 3.3 对照:facts 91.4%(正文;摘要 91.2%——漂移存照)/entities 87.3%;幻觉(false positive extraction)+schema 越界(BI-RADS 捎带病灶尺寸);单报告 7 分钟。
  41. 20 秒 vs 7 分钟=21 倍速度差;3.68 GB 无 GPU vs GPU 推理——encoder 路线的成本完胜。
  42. 训练硬件:单台 Apple M1 Max(论文原话)——对照 524 RadVLM 的 CSCS Alps 超算,本库算力光谱两极。
  43. 论文结论原话:‘even with a small annotated dataset and a relatively small language model, the quality of IE is comparable to human performance’。
  44. Steinkamp 2019 对照:91% F1/16 fact types vs 本文 90.49%/14 fact types;Steinkamp 2 类占 73.14% 失衡 vs 本文最小类频排除。
  45. GLiNER 讨论:encoder 系灵活抽取趋势承认,临床域证据仅 PII/PHI,本文任务专属优化精度更优。
  46. 页面 Limitations 四连:合成不代表真实分布/不含缩写与错误/瑞士单院结构/英译无形式验证。
  47. Technical Notes:BI-RADS 均衡分层≠真实流行率;German umlauts UTF-8 保留提醒。
  48. Topics:radiology / mammography / structured reporting / bi-rads。
  49. Project Views 29(current)/133(all versions)——全库最低流量纪录。
  50. 引用义务双份:PhysioNet 标准(RRID SCR_007345)+JMIR 论文;无 Parent Projects(不欠母集引用)。
  51. 代码资产:论文侧 OSF+Zenodo(record 14793527)源码/模型/容器;数据集侧 code 文件夹相似度评估脚本。

(事实清单主批 51 条 + 附录 U 补遗 8 条 = 59 条)


§12 术语表:五十条

术语 释义
BI-RADS 美国放射学会乳腺影像报告与数据系统,0-6 七级(0 需补充评估/1 阴性/2 良性/3 可能良性/4 可疑/5 高度可疑/6 活检证实恶性)。本数据集按 0-6 七类每类 4 份分层。
Swiss-Mammo 本条目数据集名——28 份医生手写德文乳腺报告(+英译),PhysioNet Restricted 档。
synthetic(合成) 此处指不基于真实患者记录的虚构文本(identifiers/dates 全虚构),非 AI 生成——页面明文 resident 手写无生成式 AI。
frame semantics(框架语义学) Fillmore 提出的语言学理论:词语意义依托’框架’(scenario+角色关系)理解。医学 IE 中经 Steinkamp 2019 转译为 fact 信息模型。
fact frame semantics 信息模型的原子单元:一段连续文本 span,含唯一 anchor(关键词)与若干可选 modifiers(修饰属性)。由临床医生自定义类型,可复用。
anchor fact 的核心关键词/短语——fact 的唯一必选成分,NER 层抽取的 14 类实体之一。
modifier fact 的可选修饰属性(位置/尺寸/变化/否定等)——建模集 26 类实体之一。
fact schema 抽取目标的结构化定义:初始 24 facts+66 modifiers → 两道筛后 14 fact types+40 entity types。
Krippendorff α(unitizing) 多标注者一致性系数的 unitizing 变体,适用于文本单元切分+归类任务。本条三轮:facts 0.49→0.74→0.83。
Inception 开源文本标注平台(本地部署),本条目标注工具,版本 26.8→30。
CAS Common Analysis Structure,UIMA 生态的文本标注通用结构——本条目标注数据的交换格式。
medBERT.de 德语医学 BERT 基座:470 万德语医学文档(临床笔记/文献等)再预训练的 BERT——本文四变体的共同起点。
InselBERT 本文自产变体族名——‘Insel’=Inselspital(伯尔尼大学医院’岛屿’医院);multi=多模态 MLM 版,mammo_03/10=乳腺子集 MLM 3/10 epochs 版。
MLM Masked Language Modeling,BERT 式自监督预训练目标:遮 15% token 预测。本文领域再预训练的训练目标。
SQuAD_v2 斯坦福问答数据集 2.0 的评测协议(含不可答问题)——本文 QA 模型的训练格式与评测口径(F1/EM)。
seqeval 序列标注评测库——NER 模型的 F1/precision/recall/accuracy 口径。
IOB 格式 Inside-Outside-Beginning 序列标注编码:token 级实体边界标记——NER 训练数据的标注格式。
9-fold CV 九折交叉验证:每折 80% 训练/10% 测试/10% 共享验证——本文 NER 模型的评估设计。
perplexity(困惑度) 语言模型预测难度的指数化度量——本文领域 MLM 的效果指标(1.21→1.09)。
BentoML 开源模型服务框架——本文管线的打包(‘Bento’)与 Docker 化部署工具。
gte-Qwen2-1.5B-instruct 多语通用文本嵌入模型(阿里通义系,arXiv 2308.03281 多阶段对比学习)——本条目相似度验证的嵌入引擎。
cosine similarity(余弦相似度) 向量夹角的相似性度量——本文四语料两两对照的语义距离口径。
semantic fingerprint(语义指纹) 本条目方法论术语:不同生成路线在嵌入空间的分布差异——手写 0.76-0.78 vs LLM 0.57-0.59 的 0.2 鸿沟。
dataset A/B/C 相似度验证对照组命名:A=真实 28 份;B=真实 210 份;C=ChatGPT 生成 21 份。
RadEx 作者团队的放射报告 IE 框架(arXiv 2024-06-14 preprint)——本论文方法的架构母体。
Steinkamp 2019 fact 信息模型的医学化首作(J Med Internet Res 系,BiGRU 实现)——本文方法的直系前作。
negation detection(否定检测) 识别文本中否定语义的子任务——本文管线的主要错误模式('No’开头的 span 全军覆没)。
false positive extraction 生成式抽取的幻觉形态之一:源文档没有的信息被抽出——Llama 3.3 对照组的主要病症。
schema 越界 生成式抽取的第二病症:输出超出 fact schema 定义范围(抽 BI-RADS 时捎带病灶尺寸)。
SNOMED-CT Systematized Nomenclature of Medicine-Clinical Terms,医学术语系统——本文归一化目标之一(64.29% plausible)。
Wingert terminology 德语医学术语系统(Wingert 编制)——SNOMED 之外的第二个归一化目标,论文建议约束 subtype 改进归一化。
normalization(归一化) 抽取后的实体挂接标准术语——管线最弱环节(64.29%)。
BI-RADS stratification BI-RADS 均衡分层设计(每类 4 份)——评测视角的均衡 vs 人群流行率的不均衡(Technical Notes 明文区分)。
Restricted DUA PhysioNet Restricted 数据使用协议——注册+签约即可(无 CITI),本条目访问门槛。
PhysioNet Restricted License 1.5.0 本条目文件许可——对照 Credentialed 1.5.0(多 CITI 要求)与 ODbL(全开放)。
JMIR Journal of Medical Internet Reseaach——配套论文期刊(2024 IF 约 5.8 的数字健康旗舰刊),CC-BY 开放获取。
e68427 JMIR 论文编号(v27i1e68427=卷 27 文章 e68427),DOI 10.2196/68427。
PMID 40279645 论文 PubMed 标识;PMCID PMC12064967 为 PMC 全文库标识。
ID SUISSE AG / ID BERLIN 论文 10 人署名中的两家医疗信息化企业(St. Gallen/Berlin)——frame semantics 产品化方向的产业伙伴。
Inselspital 伯尔尼大学医院(德语区最大医院之一,‘岛屿医院’)——真实语料来源机构(禁发方)与审查医生所在机构。
BFH Bern University of Applied Sciences(伯尔尼应用科技大学)Institute for Patient-Centered Digital Health——第一作者与 PI 所在研究所。
radiology resident 放射科住院医师——本条目报告手写者身份(未具名,推断为 von Däniken)。
senior radiologist 资深放射科医生——审查者(Bonel,乳腺影像专科)。
dignity 本文 schema 的 modifier 类之一(肿瘤学语境的良恶性判定,德语 Dignität)——错分示例中的主角(单词 ‘No’ 误判为 Dignity)。
mamilla 乳头的解剖学术语(拉丁)——schema 中 Mamilla region fact 的错分示例(‘Mamilla distance 54mm’ 误判为 region 描述)。
system prompt vs user prompt(对照笔记) 本条目不涉及——526 的 GPT-4o 注错用长 prompt 工程,本条目零 LLM 参与,prompt 概念只出现在 dataset C 的未披露生成配置。
全库最小 28 份——比第二小的 561 RadGraph 金标(800)小一个数量级还多;与 Views 29(全库最低流量)构成双纪录。
21→28 演化 论文评估集 21 份(3×7)→ 挂牌 28 份(4×7)→ v1.0.0 摘要 ‘three’ 为残留 → v1.0.1 修正。版本考古核心证据链。
合成三分法 本库方法论:人写虚构(本条)/LLM 变换(526 注错)/LLM 生成(523 伪金标、dataset C)——三种合成三种信任策略。
苹果 M1 Max 路线 单笔记本芯片完成预训练+微调的算力叙事——对照 CSCS Alps 超算(524)的算力光谱另一极。

(术语表合计 50 条)


附录 A:30 秒速查卡

你想知道 答案
这是什么 28 份医生手写德文乳腺报告+英译,BI-RADS 0-6 均衡分层,PhysioNet Restricted
谁做的 Bern 应用科大+Inselspital;resident 手写+senior 审查;页面明文无生成式 AI
为什么这么小 评测基准不是训练集;前身是 JMIR 论文 21 份评估集,挂牌扩容 28
为什么合成 论文 210 份真实标注语料被机构禁发——合成数据是替代发布物
可信吗 gte-Qwen2 相似度 vs 真实 0.76-0.78(真实基线 0.79;ChatGPT 对照仅 0.58)+医生审查
引用什么 PhysioNet v1.0.1 DOI 10.13026/95cy-rc09 + JMIR 2025;27:e68427(DOI 10.2196/68427)双引用
版本坑 v1.0.0 摘要 ‘three’ 系 21 份时代残留,v1.0.1 官方修正 ‘four’(28=4×7)
论文成绩 BERT+frame semantics:QA F1 90.49%/NER 0.81/管线精度 96.1%/99.6%;完胜 Llama 3.3
算力故事 Apple M1 Max 训练+无 GPU VM 部署 20 秒/报告 vs Llama 3.3 的 7 分钟
最大局限 28 份无统计功效+单机构风格+过净(无缩写无错误)——只测受控上限

附录 B:时间线全表

时间 事件 证据
2024-06-14 RadEx 框架 arXiv preprint(作者团队,方法母体) 论文 ref 29
2024-10-18 研究材料 OSF preprint 论文 ref 61
2024-11-07 JMIR 投稿 PMC 全文 submission 时间戳
2025-01-02 审稿意见返回 PMC 全文
2025-02-20 修回 PMC 全文
2025-03-16 接收 PMC 全文
2025-04-25 JMIR 正式发表(27:e68427) PMC 全文
2025-04-30 PhysioNet 挂牌 v1.0.0(发表后 5 天) 页面 Versions
2025-06-24 v1.0.1(摘要 three→four + 论文引用更新) 页面变更声明
2026-09-24 本条目核查时 Views 29/133 页面快照

附录 C:文件资产全索引

资产 内容 获取
56 个 txt SwissMammo_001-028 × DE/EN,UTF-8(ä/ö/ü 保留) PhysioNet Files(签 DUA 后)
SwissMammo.csv ID/BIRADS/Text_de/Text_en 四列表格版 同上
code/ 相似度脚本 gte-Qwen2 嵌入+余弦矩阵(sentence-transformers) 同上
OSF 材料 RadEx 框架 preprint+研究结果 osf.io 公开
Zenodo 14793527 论文源代码+训练模型+容器化管线镜像 zenodo.org 公开
PMC12064967 JMIR 论文全文(含 Table 1-6 与补充材料链接) PMC 公开
PhysioNet 页面 v1.0.0/v1.0.1 页面正文+相似度表+变更声明 公开(无 DUA)

命名规范细节:ID 零填充三位(001-028);BR 后跟 0-6 整数(双乳取较高类别);语言后缀 DE/EN。CSV 的 BIRADS 列为整数型——pandas 读取时注意不要当字符串排序(003 vs 3)。


附录 D:相似度矩阵的完整读法

D.1 矩阵原文(页面 Methods 节转录)

Swiss-Mammo Dataset A Dataset B Dataset C
Swiss-Mammo – 0.78 0.76 0.58
Dataset A 0.78 – 0.79 0.59
Dataset B 0.76 0.79 – 0.57
Dataset C 0.58 0.59 0.57 –

D.2 四语料档案

语料 规模 属性 来源
Swiss-Mammo 28 医生手写合成(本条目) PhysioNet 公开
Dataset A 28 真实报告分层抽样 瑞士医院语料库(不公开)
Dataset B 210 真实报告分层抽样(同库另一批) 同上(不公开;与论文建模集同规模,是否同批未实锤)
Dataset C 21 ChatGPT 生成 prompt 未披露

D.3 六个配对的叙事角色

配对 值 角色
A vs B 0.79 真实分布的自然基线(同库两次抽样的组间距离)
Swiss-Mammo vs A 0.78 手写合成贴真实:差 0.01——‘minor decrease’
Swiss-Mammo vs B 0.76 换真实对照仍贴:差 0.03——稳健性检查
C vs A 0.59 LLM 掉队第一证:差 0.20
C vs B 0.57 LLM 掉队第二证:‘substantially lower’
Swiss-Mammo vs C 0.58 两种合成互斥:人写与 LLM 生成分属两簇

D.4 方法论边界(诚实清单)

  1. 单值无置信区间——28 份的均值对抽样波动敏感,0.03 的差距是否显著未检验
  2. 嵌入模型单点——gte-Qwen2 的语义空间定义了’像’,换模型(如 multilingual-e5)排序可能变
  3. 语义相似≠事实正确——‘左侧肿块 3cm’ 与 ‘右侧肿块 5cm’ 相似度极高但事实不同
  4. C 组生成配置不透明——prompt/模型版本/温度未知,0.58 是’通用直接生成’的读数而非 LLM 上限
  5. 语料规模不对等(21/28/210)——组内方差对均值的影响不一致

附录 E:JMIR 论文成绩全表转录

E.1 Table 2:IAA 三轮(Krippendorff α unitizing)

轮次 facts α anchors α modifiers α 标注 fact 类(n/n) modifier 类 n
Round 1 0.49 0.42 0.50 24/— 46
Round 2 0.74 0.64 0.60 22/21 45
Round 3 0.83 0.61 0.61 23/22 48

读法:facts 层收敛良好;anchors 第 3 轮回落(0.64→0.61);modifiers 三轮低位(0.50-0.61)——unitizing 任务的 IAA 天花板比分类任务低。对照库内 521 rad-coref(合并 α 0.79-0.87,Passonneau 加权)——任务类型决定 IAA 量级。

E.2 Table 3:领域再预训练的 perplexity

模型 medBERT.de InselBERT_multi mammo_03 mammo_10
Perplexity 1.21 1.12 1.11 1.09

E.3 Table 4:QA(SQuAD_v2,95% CI,599 resamples)

指标 medBERT.de InselBERT_multi mammo_03 mammo_10
Exact match 79.49 (75.77-83.3, SE 1.84) 78.02 (74.25-81.70, SE 1.91) 80.59 (77.33-83.99, SE 1.69) 79.85 (76.33-83.41, SE 1.85)
Averaged F1 90.09 (87.89-92.46, SE 1.16) 89.78 (87.53-92.01, SE 1.13) 90.49 (88.36-92.47, SE 1.06) 90.4 (88.28-92.53, SE 1.11)

读法:四变体 CI 全重叠——再预训练对 QA 无显著增益(负结果)。摘要引用的 90.4% 实为 mammo_10 值与 mammo_03 的 90.49 之间取整。

E.4 Table 5:NER(9-fold CV,mean±SD)

指标 medBERT.de InselBERT_multi mammo_03 mammo_10
Mean F1 0.81 (0.007) 0.81 (0.007) 0.81 (0.008) 0.81 (0.001)
Mean recall 0.81 (0.008) 0.81 (0.01) 0.82 (0.01) 0.81 (0.007)
Mean precision 0.82 (0.009) 0.81 (0.007) 0.81 (0.01) 0.81 (0.009)
Mean accuracy 0.82 (0.005) 0.82 (0.006) 0.82 (0.006) 0.82 (0.005)

E.5 定性管线评估(21 份前身报告,2 放射科医生)

项 InselBERT 管线 Llama 3.3
facts 精度 197/205 = 96.1% 91.4%(正文)/91.2%(摘要——漂移存照)
entities 精度 495/497 = 99.6% 87.3%
满分级类 10/14 fact types + 23/24 modifiers —
单报告耗时 <20 秒(无 GPU) 7 分钟(21 倍差)
部署 3.68 GB Docker / 7.7 Gi RAM VM GPU 推理
失败模式 否定句 3 span+‘No’ 幻觉+schema 越界

E.6 Table 6:全部错分实例(原表转录)

错分文本 span 误判为(n) 正确类型
“No retracted areas” Foreign material described (1), Asymmetry described (3) Additional result
“No evidence of malignancy” Foreign material described (1), Recommendation for further examination (2) Additional result
“Mamilla distance 54mm” Mamilla region described (1) Position (mamilla distance)
“No” Dignity (2) Negation

读法:8 个错分实例 100% 与否定/数字上下文相关——'No’开头的 span 触发 anchor 误绑定;'54mm’的数值上下文干扰 region 判定。frame semantics 的 anchor 绑定机制对否定词敏感是可解释的失败(正因可解释,修复路径明确:negation-aware anchor 绑定)。

E.7 归一化(管线最弱环节)

术语系统 抽取概念总数 plausible 比例
SNOMED-CT + Wingert 3,582 2,303 64.29%

附录 F:21→28 演化链考证(版本考古专论)

F.1 证据链五环

  1. v1.0.0 摘要:‘with three reports per category’(=21)——与 Methods ‘four examples per BI-RADS category’(=28)同页矛盾
  2. v1.0.1 变更声明:官方承认摘要错误并修正为 four
  3. JMIR 论文:‘a manually generated synthetic dataset of 21 reports’(2 放射科医生人工评估所用)——3×7=21
  4. 挂牌规模:28=4×7——比论文评估集多 7 份(每类 +1)
  5. 推断:21 份时代(论文评估)→ 扩容 28(挂牌)→ 摘要沿用旧表述 ‘three’ → v1.0.1 修正

F.2 演化的动因推断

为什么从 3/类扩到 4/类?可能:①每类 4 份让’留一法’评测(leave-one-out)成为可能(3 份 train+1 份 test per class);②28 比 21 多 33% 评测样本;③双乳不同类别的报告(取较高者)需要缓冲名额。论文与页面均未说明——存照为开放问题。

F.3 对使用者的操作结论

  • 引用数字一律以 v1.0.1+文件实际 count 为准(28/4×7)
  • 引用 v1.0.0 DOI(mrg5-ja22)的文献自带 ‘three’ 污染,二手引用需回溯
  • 论文里的 21 份评估集与挂牌 28 份的差异(7 份新增)无公开说明——严格复现论文人工评估需注意评估集≠挂牌全集

附录 G:DAIMS 十维自评

维度 分 依据
可发现性 8 PhysioNet 独立条目+Topics 标签+JMIR 互引;但 slug 与缩写需外部检索学习
可获取性 6 Restricted DUA 门槛(低门槛但有);对纯合成数据而言偏保守
可读性(格式) 9 txt+CSV 双格式、命名规范、UTF-8、无压缩陷阱——全库格式最干净的条目之一
文档完备 8 页面精炼完整+论文全开放+相似度代码随发;缺独立 data dictionary(CSV 列自明)
标注质量 7 senior 审查+论文侧三轮 IAA 迭代;但数据集本体无逐份质检记录公开
伦理合规 10 零真实数据零伦理负担(页面自认)——本维度满分样本
规模 2 28 份全库最低——评测集定位下的及格线设计
可复现 9 相似度脚本+论文代码+模型+Docker 全公开——方法论全链路可复刻
社区治理 6 无版本路线图/无维护声明/单版本修正;低流量下社区反馈机制未受考验
AI-Ready 度 8 CSV 直接可用+BI-RADS 标签结构化+双语对齐;德语分词需自备
加权总分 7.6 伦理/可复现满分,规模单一维度拖分——'方法论满分、体量垫底’的典型形状

附录 H:与库内条目的系统对照

H.1 合成数据三分法(本条目方法论主线)

维度 527 Swiss-Mammo(人写虚构) 526 ReXErr(LLM 变换) 523 RaDialog(LLM 生成伪金标)
合成方式 resident 手写+senior 审查 GPT-4o 向真实报告注入错误 vicuna-13b zero-shot 生成
底料 零(凭临床经验虚构) MIMIC-CXR 227,835 报告 MIMIC-CXR 报告
规模 28 200k+ 零披露(页面/论文均无)
信任策略 相似度指纹 0.76-0.78+人工审查 83/17 人工抽检+错误类目可控 20 倍消融(QA F1 0.397 vs 0.018)
访问档 Restricted Open ODbL Credentialed
LLM 依赖 零(验证用嵌入模型) GPT-4o+Llama 3.1 vicuna-13b
主要用途 评测基准 错误检测训练 对话微调

H.2 报告结构化赛道(语种与任务轴)

条目 语种 任务 表示法 规模
561 RadGraph 英 实体+关系抽取 14 类实体/3 类关系 金标 800+推理 10,942
622 RadGraph2 英 时序变化抽取 12 类 CHAN 扩展 220,763
521 rad-coref 英 共指消解 簇标注 金标 1,475 段
527 Swiss-Mammo 德 fact 抽取(QA+NER) frame semantics(anchor+modifier) 基准 28

H.3 IAA 方法论对照

条目 任务类型 一致性口径 量级
527(论文标注) unitizing(切分+归类) Krippendorff α facts 0.49→0.83(三轮)
521 rad-coref 分类(共指标签) Passonneau 加权 κ 0.79-0.87(合并)
522 RadGraph2 实体+关系标注 κ 0.79/0.87/0.80
524 RadVLM 无人工标注 — LLM 自动化

H.4 算力光谱

条目 模型规模 训练硬件 部署
524 RadVLM 7B(LLaVA-OneVision) CSCS Alps 超算(Swiss AI Initiative) GPU 集群
523 RaDialog LLM 对话系统 TUM 集群 GPU
527(论文管线) 110M(BERT) 单台 Apple M1 Max 无 GPU VM 20 秒/报告

附录 I:引用模板

I.1 数据集(APA)

Reichenpfader, D., von Däniken, S., & Bonel, H. M. (2025). Swiss-Mammo: A physician-written, synthetic dataset of German mammography reports (version 1.0.1). PhysioNet. RRID:SCR_007345. https://doi.org/10.13026/95cy-rc09

I.2 配套论文(必须同引)

Reichenpfader, D., Knupp, J., von Däniken, S. U., Gaio, R., Dennstädt, F., Cereghetti, G. M., Sander, A., Hiltbrunner, H., Nairz, K., & Denecke, K. (2025). Enhancing Bidirectional Encoder Representations From Transformers (BERT) With Frame Semantics to Extract Clinically Relevant Information From German Mammography Reports: Algorithm Development and Validation. Journal of Medical Internet Research, 27, e68427. https://doi.org/10.2196/68427

I.3 BibTeX(数据集 v1.0.1)

@article{PhysioNet-swiss-mammo-1.0.1,
  author = {Reichenpfader, Daniel and {von D\"aniken}, Sandro and Bonel, Harald Marcel},
  title = {{Swiss-Mammo: A physician-written, synthetic dataset of German mammography reports}},
  journal = {{PhysioNet}}, year = {2025}, month = apr,
  note = {Version 1.0.1}, doi = {10.13026/95cy-rc09}}

注意:作者姓 von Däniken 的 ä 在 BibTeX 需转义 {"a};引用 v1.0.0 时 DOI 换 mrg5-ja22 但注意其摘要是含错旧版。


附录 J:分层读法指南(按身份选路径)

  • 评测工程师(想测德文 IE):附录 C 文件索引 → §3.1 命名规范 → 直接 CSV 入手 → 按 BI-RADS 分层报告成绩;德文分词自备(spaCy de_core_news+医学缩写扩展)
  • 方法论研究者(想学合成基准建设):§1.1 存在理由 → §4 相似度验证 → 附录 D 边界清单 → 复刻 ‘手写+指纹自证’ 模板
  • frame semantics 实践者(想搭抽取管线):附录 E.1-E.2 标注与 IAA → §5.3 schema 演化 → Zenodo 代码 → 28 份做端到端试运行
  • 数据集策展人(想理解版本治理):§2.3 时间线 → §9 版本考古 → 附录 F 演化链——'摘要残留错误如何被版本机制修复’的完整案例
  • ** skeptical reviewer**(想挑战可信度):§8 批评视角 → 附录 D.4 方法论边界 → §12 缺口存照——所有’不能证明’已列全

附录 K:合成数据信任策略的三个流派(方法论专论)

医学合成数据的公信力问题:合成即’造假’的直觉质疑如何化解?本库三条目给出三种范式:

流派一:指纹自证(本条目)——用嵌入空间的可测量证据(手写合成 vs 真实 0.76-0.78,与真实基线 0.79 几乎持平;LLM 生成 0.58 断层)证明分布贴近,辅以医生审查+代码公开。适用:小规模评测基准。成本:一段脚本。弱点:语义相似≠事实正确,无 CI。

流派二:类目可控+抽检验收(526 ReXErr)——错误按 12 类设计、注入频率公式化可预测(Table 5 三重自洽),83/17 人工抽检给出不合理率上限。适用:大规模训练数据。成本:百级人工审查。弱点:类目频率由母集文本特征决定而非错误流行率(分布错位)。

流派三:下游效用证明(523 RaDialog)——不直接验证合成质量,用 20 倍消融(用 vs 不用伪金标:QA F1 0.397 vs 0.018)证明合成数据有下游价值。适用:伪金标任务。成本:一次消融实验。弱点:‘有用’不等于’正确’——模型可能学到伪金标的系统性偏置。

三流派可组合:本条目=指纹+审查;526=类目+抽检;若 523 加做相似度指纹、526 加做下游消融,信任链更完整。合成数据的信任不是一个开关,是一组可组合的证据。


附录 L:全库’小而美’条目对照

条目 规模 定位 流量 与本条的共性
527 Swiss-Mammo 28 报告 德语 IE 基准+方法论示范 29/133(最低) —
561 RadGraph 金标 800 报告 结构化开山金标 中高 金标不怕小,怕不可信
521 rad-coref 1,475 段 共指金标 39 低流量+高方法论密度
525 REFLACX 3,052 读片 眼动过程数据 679 小而特(过程数据首例)

共性规律:小体量条目的生存逻辑是’不可替代性’而非’规模’——金标质量(561/521)、独特维度(525 眼动)、语种+方法双稀缺(本条)。评测基准的竞争维度是可信度密度,不是行数。


附录 M:使用前检查清单(10 项)

  1. ☐ 确认用途匹配:评测基准(✓)/训练集(✗)
  2. ☐ 引用双份:PhysioNet v1.0.1(95cy-rc09)+JMIR e68427
  3. ☐ 数字口径:28=4×7(勿用 v1.0.0 摘要的 three)
  4. ☐ 语言选择:德文主用,英译仅参考(无语言学验证)
  5. ☐ 编码:UTF-8 显式指定(ä/ö/ü)
  6. ☐ 分层理解:每类 4 份是评测设计非流行率
  7. ☐ BI-RADS 归档:双乳取高侧——跨类统计注意
  8. ☐ 合成性质声明:引用时注明 physician-written synthetic(勿写成 AI-generated)
  9. ☐ 相似度引用:0.76-0.78 手写合成 / 0.58 ChatGPT 对照——勿混为’与真实相同’(基线 0.79)
  10. ☐ 论文数字:Llama 3.3 facts 用正文 91.4%(勿引摘要 91.2%)

附录 N:快问快答(一页纸)

问 答
几份报告? 28(4×BI-RADS 0-6)+28 英译
谁写的? 放射科 resident 手写+senior 审查;无生成式 AI
为什么小? 评测基准;前身 21 份(论文评估集)
为什么合成? 210 份真实语料被机构禁发
可信吗? 相似度 0.76-0.78 vs 真实基线 0.79(ChatGPT 仅 0.58)
什么许可? Restricted License 1.5.0+DUA(注册+签约,无 CITI)
什么语言? 德文+英译(德文为主)
论文在哪? JMIR 2025;27:e68427,DOI 10.2196/68427
论文成绩? QA F1 90.49%/NER 0.81/精度 96.1%+99.6%
Llama 3.3 呢? 91.4%/87.3%,7 分钟/报告(21 倍慢)
训练用什么硬件? 单台 Apple M1 Max
部署要 GPU 吗? 不要——3.68 GB Docker,7.7 Gi RAM
最弱环节? SNOMED-CT 归一化 64.29%
主要错误模式? 否定句('No’开头的 span)
版本坑? v1.0.0 摘要 three→v1.0.1 修正 four
流量? 29/133——全库最低
与 526 什么关系? 合成光谱两极:手写 28 份/Restricted vs LLM 注错 200k+/Open
一句话 用 28 份手写报告讲透’真实数据锁死后合成基准怎么建’

附录 O:28 份报告的规格矩阵(BI-RADS 分层账本)

按命名规范重建的完整规格(ID 连续 001-028;每类 4 份;本表为规范推导的账本——具体每份的双乳类别细节需下载后按文本核对):

| BI-RADS | 临床含义 | 席位 | 文件 ID 段 | 双语文件数 |
| 0 | 需补充评估(回看/追加摄影) | 4 | BR0 系列 | 8 |
| 1 | 阴性(对称、无异常) | 4 | BR1 系列 | 8 |
| 2 | 良性发现(描述性) | 4 | BR2 系列 | 8 |
| 3 | 可能良性(短期随访) | 4 | BR3 系列 | 8 |
| 4 | 可疑异常(活检考虑) | 4 | BR4 系列 | 8 |
| 5 | 高度提示恶性 | 4 | BR5 系列 | 8 |
| 6 | 活检证实恶性 | 4 | BR6 系列 | 8 |
| 合计 | — | 28 | 七段 | 56 |

读法与用途:

  • 评测时按行分组报告成绩——每类 4 份意味着单类成绩的最小波动单位是 25%(1/4),单类置信区间极宽,谨慎解读
  • 跨类对比(如 BI-RADS 1 vs 4 的抽取难度差)是本数据集的招牌用法——均衡设计使对比不被类别失衡污染
  • 双乳异类报告按高类别归档——BR4 席位里可能藏着"左 4 右 2"的混合样本,严格单侧分析需回原文
  • BI-RADS 6(活检证实)的 4 份是全库罕见的"确诊恶性"评测样本——多数筛查语料里 6 类占比 <1%,这里每类均权

附录 P:德文医学 NLP 工具链上手指南

Swiss-Mammo 是德文语料,使用前的工具准备清单(对照英语管线的额外步骤):

P.1 分词与句法

工具 用途 备注
spaCy de_core_news_lg 德文分词/POS/依赖 本条目论文同款(spaCy+自有缩写表);医学文本建议加缩写扩展
SoMaJo 临床文本分句 德文临床分句的专用强项(缩写歧义处理)
GermaNet 德语词汇语义网络 英语 WordNet 的德语对应——语义扩展用

P.2 嵌入与表示

模型 维度 说明
gte-Qwen2-1.5B-instruct 多语 本条目相似度验证同款——直接复用其结果口径
medBERT.de 110M 论文基座——470 万德语医学文档预训练,医学领域首选
German BERT (dbmdz) 110M 通用德语备选
multilingual-e5 多语 嵌入模型更换时的对照基准(附录 D.4 边界 2)

P.3 术语资源

资源 角色
SNOMED-CT 德语版 归一化目标之一(论文口径 64.29% plausible)
Wingert terminology 德语医学术语系统——论文建议约束 subtype 关系提升归一化
ICD-10-GM 德国修改版 ICD——诊断编码的本地化标准
OPS 德国手术操作编码(乳腺活检/手术报告会涉及)

P.4 编码与文本处理红旗

  1. UTF-8 显式声明(ä/ö/ü/ß 静默损坏风险——Technical Notes 原话提醒)
  2. 德文复合词(Brustkrebsfrüherkennung 类)不拆分——分词器处理复合名词时保留原形
  3. 缩写歧义(“MA” 可指 Mamma-Carcinom 等多义)——论文用自有缩写表解歧,复刻者需自建
  4. 数值格式(德式小数逗号 “4,3 cm” vs 英式 “4.3 cm”)——本条目双语对是现成的格式对照教材

附录 Q:前瞻对照——528 TN-Mammo 与乳腺影像家族开篇

批次八的乳腺影像双子(527 文本+528 图像)构成家族开篇,预期对照:

维度 527 Swiss-Mammo(本条) 528 TN-Mammo(下一发)
模态 纯文本报告(双语) 多视图乳腺 X 线图像
规模 28 份 待核(三阴乳腺癌数据集——临床子群聚焦)
合成性 100% 手写虚构 真实图像(预期)
访问档 Restricted Restricted(批次预判)
语种 德+英 待核(预期英)
侧重点 报告结构化评测 影像分类/检测
家族角色 “报告怎么说” “图像长什么样”

联动伏笔:本条的 BI-RADS 分层账本(附录 O)与 528 的病理标签(三阴/非三阴)在乳腺影像工作流上互补——影像模型出 BI-RADS 级别预测,文本模型抽取报告结构化字段,两者在真实乳腺中心的 AI 辅助流水线上汇合。本库乳腺影像家族(本条+528)与既有胸片家族(616-625+526)形成"两腺并行"的批次八格局。


附录 R:检索词与引用对照表(研究者的查找指南)

R.1 多版本引用对照

你要引用 DOI 注意
数据集 v1.0.0(历史版) 10.13026/mrg5-ja22 摘要含 three 错误(21 份时代残留)
数据集 v1.0.1(修正版,推荐) 10.13026/95cy-rc09 four=28=4×7 正确口径
数据集 latest(浮动) 10.13026/gqzb-fg27 未来版本会变
JMIR 论文 10.2196/68427 PMID 40279645 / PMCID PMC12064967
RadEx 框架 arXiv(2024-06-14) 方法论母体
Steinkamp 2019 10.1007/s10278-019-00234-y fact 信息模型首作
gte-Qwen2 arXiv 2308.03281 相似度验证嵌入模型
PhysioNet 平台 10.1038/s44360-026-00096-z 平台统一引用(Nature Health 2026)

R.2 检索词表(按意图)

意图 推荐检索词
找本条目 swiss-mammo / Swiss-Mammo PhysioNet / German mammography dataset
找论文 Reichenpfader frame semantics / JMIR e68427 / BERT mammography German
找同类德语资源 medBERT.de / German clinical NLP / deutscher radiologiebericht datensatz
找合成基准方法论 synthetic benchmark validation / cosine similarity dataset / physician-written synthetic
找 frame semantics Steinkamp fact extraction / Fillmore frame semantics clinical / anchor modifier radiology
找乳腺报告结构化 BI-RADS extraction / mammography report NLP / structured reporting breast

R.3 二手引用污染排查

引用本条目时警惕三种二手污染:①引 v1.0.0 摘要的 “three reports”(正确 4);②引摘要的 Llama 91.2%(正文 91.4);③把 dataset C(ChatGPT 对照)当论文评估集(两者都叫 21 份但属性不同)。本条目 §9/附录 F 已存照——二手文献出现这三个数字时回溯一手源。


附录 S:核查方法存照(本条目怎么核的)

  1. 版本探测:latest/1.0/1.0.0/1.0.1 四 URL 探测——1.0.0 与 1.0.1 双 200(其余 404),发现双版本格局
  2. 页面双抓:v1.0.0(46,390 B)与 v1.0.1(17,621 字符文本)全解析对比——锁定 three→four 变更声明
  3. 论文三路:JMIR 官网 403(反爬)→ PMC JS 壳 21 KB 无正文 → eutils efetch XML 152 KB 全文到手——PMC efetch 是 JMIR 全文的稳定通道(方法论存照)
  4. WebSearch 交叉:JMIR 官网摘要/Google Scholar/OpenAIRE 三源互证(作者 10 人名单、时间线、F1 数字)
  5. 数字自洽:28=4×7(与 v1.0.1 修正互证);2,519 vs 2,772 两口径定位(schema 实例 vs NER 转换);96.1%=197/205、99.6%=495/497(精确复算 ✓);64.29%=2,303/3,582(✓)
  6. 库内联动:521/522/524/525/526 的 FACTS 交叉引用——IAA 口径、算力光谱、合成三分法

附录 T:批次八衔接说明(本条目在批次账本中的位置)

批次八(order 526-535)是"PhysioNet 放射收尾五连 + Grand Challenge 挑战赛开篇五连"的双段结构。本条目(527)的位置与承重:

位置 条目 状态
526 ReXErr-v1(LLM 注错 200k+/ODbL) 并行会话在产(本会话让出,FACTS+part1 资产已让渡)
527 Swiss-Mammo(本条目) 本会话生产
528 TN-Mammo(三阴乳腺癌多视图图像) 待产——乳腺双子下一发
529 VinDr-PCXR(儿童胸片) 待产
530 VinDr-SpineXR(脊柱 X 光) 待产
531-535 Grand Challenge 挑战赛五连 待产

本条目的三条批次级贡献:

  1. 合成数据光谱的双极闭合(与 526 相邻):人写虚构(28/Restricted)↔ LLM 注错(200k+/Open)——"synthetic"的语义边界在相邻两条内全部划定
  2. 乳腺影像家族开篇:本条管文本(BI-RADS 分层账本),528 管图像(三阴亚型)——附录 Q 已埋联动伏笔
  3. 批次八首个 Restricted 档:继批次七的 Credentialed 四连(512/522/523/524)后,Restricted 档预判命中(swiss-mammo 页面 Access Policy 在开工前即从批次清单标注转入核查确认)

协调机制存照:本会话开工前检测到并行会话接手 526(.build526 full.md 加厚中),当即让出并在批次 8 工单(rXhZzd)留协调评论(cmt_ad29be3)——521 双发事故的教训(查重-发布紧邻+错位生产)在批次八开篇即落地执行。


附录 U:事实清单补遗(核查补充批,8 条)

  1. JMIR 论文页脚版权行确认 CC-BY 4.0 开放获取——论文全文可自由转载(PMC 镜像合法)。
  2. 论文 Multimedia Appendix 2-7 齐备(标注界面截图/示例/统计细节/管线图/Llama 实现细节)——JMIR 补充材料体系完整。
  3. 论文 ref 29 RadEx preprint 的 arXiv 编号在 PMC 转录中缺失(仅 “arXiv Preprint posted online June 14 2024”)——严格引用需检索 arXiv 站内(存照)。
  4. 数据集页面无 “Files” 明细表(地区限制下 Files 区显示受限说明)——文件清单以页面 Data Description 文字+命名规范重建(附录 C)。
  5. v1.0.1 页面的相似度表与 v1.0.0 完全一致(0.78/0.76/0.58 矩阵未变)——变更仅限摘要与引用(附录 F 旁证)。
  6. 论文 “two radiologists”(定性评估)与数据集 “a senior radiologist”(审查)的关系未说明——评估者是否含 Bonel 未实锤(存照)。
  7. SwissMammo.csv 的分隔符/引号规范未在页面说明(默认 CSV 约定)——德文引号「」与逗号小数的转义需实测(下载后验证项)。
  8. 本条目核查快照:/tmp/527_page.txt(v1.0.0)、/tmp/527_page_101.txt(v1.0.1)、/tmp/527_pmc.txt(PMC XML 全文 77,028 字符)——快照留存供复查。

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集