信息速览
INFOBOX:swiss-mammo 速览
| 字段 | 值 |
|---|---|
| 数据集 | Swiss-Mammo v1.0.0(2025-04-30)→ v1.0.1(2025-06-24) |
| slug | swiss-mammo(批次预判 Restricted 命中) |
| DOI | v1.0.0 = 10.13026/mrg5-ja22 / v1.0.1 = 10.13026/95cy-rc09 / latest = 10.13026/gqzb-fg27(三 DOI 格局) |
| 访问 | Restricted(Restricted License 1.5.0 + Restricted DUA;注册+签约,无 CITI)——纯合成数据挂 Restricted 的悖论档(对照 526 ReXErr 合成却 ODbL 全开) |
| 规模 | 28 份德文报告 + 28 份英译 = 全库最小(对照 561 金标 800、521 段 950) |
| 分层 | BI-RADS 0-6 × 每类 4 份(v1.0.0 摘要误写 “three”,v1.0.1 官方修正为 four) |
| 制作 | resident 手写(明文无生成式 AI)+ senior 放射科医生审查;结构模仿瑞士大学医院报告 |
| 语言 | 德文原文 + 英文翻译(人工+工具辅助,无正式语言验证) |
| 语义验证 | gte-Qwen2-1.5B-instruct 嵌入:vs 真实 28 份 0.78 / vs 真实 210 份 0.76 / vs ChatGPT 生成 21 份 0.58——手写合成与真实几乎同档、LLM 生成断层 |
| 存在理由 | JMIR 论文 210 份真实标注语料被机构禁发——医生手写合成数据是"替代发布物"(论文原话 institutional restrictions) |
| 配套论文 | JMIR 2025;27:e68427(DOI 10.2196/68427,PMID 40279645,发表 2025-04-25——挂牌前 5 天) |
| 论文方法 | BERT(110M)+ frame semantics(Fillmore/Steinkamp 2019)两步管线:QA 抽 fact + NER 抽 anchor/modifier |
| 论文成绩 | QA F1 90.49%(SQuAD_v2)/ NER F1 0.81(9-fold);管线精度 facts 96.1%/entities 99.6%;Apple M1 Max 训练+无 GPU VM 部署,20 秒/报告 vs Llama 3.3 的 7 分钟(21 倍差) |
| 团队 | 数据集署名 3 人(Reichenpfader/von Däniken/Bonel)——JMIR 论文 10 人(+ID SUISSE AG 与 ID BERLIN 两企业) |
| 流量 | Views 29(current)/133(all)——全库最低流量纪录(对照 521 的 39、525 的 679) |
| 一句话 | 28 份手写德文报告,讲透"真实数据锁死之后合成基准怎么建、怎么自证、怎么用"的完整方法论 |
§0 摘要卡:全库最小数据集的最大方法论密度
§0.1 它是什么
Swiss-Mammo 是 28 份医生手写的德文乳腺 X 线报告(每类 BI-RADS 0-6 各 4 份,均衡分层),每份配英文翻译,四段式结构(临床指征/影像发现/评估/建议)。它由 Bern 应用科大的 Reichenpfader 团队制作:一名放射科住院医生手写(页面明文 “without the use of generative AI”),一位资深乳腺放射科医生独立审查。它的小是有原因的:这不是训练集,是基准评测集——配套的 JMIR 论文(BERT+frame semantics 德文报告信息抽取)的真实训练语料(210 份标注报告)因机构限制禁止发布,团队便用医生手写的合成报告建立可公开的评估基准,并用 gte-Qwen2 嵌入的余弦相似度自证语义保真:手写合成 vs 真实报告 0.76-0.78,几乎追平真实报告组间相似度 0.79;而 ChatGPT 生成的对照仅 0.57-0.59——人写虚构与 LLM 生成之间存在可测量的语义指纹断层。
§0.2 三个数字
- 28:报告总数(4×7)——全库最小,比第二小的 RadGraph 金标(800)小一个数量级还多;但 28 份的配套叙事(相似度验证+JMIR 管线+版本考古)信息密度全库前列
- 0.76 vs 0.58:手写合成与 ChatGPT 生成对真实报告的相似度分野——"synthetic"一词下两种制作路线的语义距离差 0.2,这是本库"合成数据三分法"的量化证据
- 20 秒 vs 7 分钟:110M BERT 管线与 Llama 3.3 prompting 的单报告抽取耗时——精确率还双赢(96.1%/99.6% vs 91.4%/87.3%),小模型+任务专属设计的效率实证
§0.3 它怎么用
三类用法:①德文医疗 IE 基准——按 BI-RADS 分层的评测集,测 LLM/BERT 从德文报告抽 BI-RADS、病灶属性、建议等结构化字段的能力(JMIR 论文用 2 名放射科医生对 21 份前身做了人工评测模板);②frame semantics 方法论复刻——论文代码+模型+Docker 镜像全开放,28 份可作为零成本试运行数据;③合成基准构建教学样本——相似度验证的 .py 随数据集发布,"如何自证合成数据保真"可以照抄。
§0.4 联动提示
本条与 526 ReXErr(前一条目)构成"合成数据两极":526 用 GPT-4o 给 20 万份真实报告注错(规模路线,ODbL 全开),527 用医生手写虚构 28 份(合规路线,Restricted)——合成数据的访问档与规模成反比的怪象在相邻两条目完美呈现。与 528 TN-Mammo(下一发)开启乳腺影像家族;与 561 RadGraph/622 RadGraph2 同属报告结构化赛道但语种(德文)与任务(frame semantics vs 实体关系)皆异。版本考古控注意:v1.0.0 摘要写 “three reports per category”(21 份时代残留),v1.0.1 官方修正为 four——引用时认准 28=4×7。
§0.5 三个反直觉
反直觉一:最小的数据集配了最重的验证。28 份报告的相似度验证、医生双审、配套论文的人工评估(2 放射科医生逐份评 21 份前身)——验证成本与数据体量成反比。逻辑:评测基准的每份数据都会被反复用来打分,单份的噪声会系统性污染所有评测结果;训练集的噪声会被规模稀释,评测集的噪声会被规模放大。28 份的"重验证"是评测集定位的必然配置。
反直觉二:合成数据的访问档比真实派生数据更严。526 ReXErr(LLM 注错 20 万真实报告)全开放 ODbL,本条(零真实数据)反而 Restricted。合成性不决定开放性——发布机构的数据文化决定。对使用者的实际含义:别用"合成=随便下"的直觉规划工作流,PhysioNet 每条都要看 Access 档。
反直觉三:德语是稀缺性来源而非障碍。英语医学 NLP 卷得飞起(MIMIC 系一家就贡献本库 30+ 条目),德语医学文本的公开基准接近真空(medBERT.de 是少数例外)。28 份德文报告的不可替代性 > 28 万份英文报告的第 n 个复刻——语种生态位是数据集竞争的降维打击。
§0.6 它在库内的独特性自检
- 唯一非英语报告文本条目(德语)——语种稀缺性全库唯一
- 唯一"医生手写无 AI"的合成条目——合成光谱的人写端点
- 唯一"训练数据禁发→合成替代"叙事的条目——合规替代方法论首例
- 唯一配套论文发表于挂牌前 5 天的条目(526 先论文半年、522 先一年)——论文-数据一体化发布的最紧耦合
§1 条目定位:数据禁令催生的合成基准
§1.1 存在的第一因:210 份真实语料的发布禁令
JMIR 论文方法节有一句决定性的话:“To foster the traceability of our results, qualitative evaluation was performed by two radiologists using high-quality, clinician-written synthetic data, as the publication of the training dataset is prohibited due to institutional restrictions.”——论文的 210 份真实德文乳腺报告标注语料(Inselspital 临床语料库,3 名临床医生终标,Krippendorff α 三轮迭代到 facts 0.83)因为机构限制无法发布。团队的三步应对构成了本条目的完整因果链:训练数据被锁 → 医生手写合成评估集顶上(论文里 21 份)→ 扩容 28 份挂牌 PhysioNet。Swiss-Mammo 不是"又一个合成数据集",它是"真实数据不可得时如何建设可发布基准"的方法论展示品——先自证保真(相似度指纹),再声明局限(四连 Limitations),最后把验证代码一起发布。
§1.2 相似度指纹:合成数据的自证方法论
页面 Methods 节的 Similarity Assessment 是本条目的技术核心:用 gte-Qwen2-1.5B-instruct(多语通用文本嵌入)把四个语料对两两算余弦相似度——Swiss-Mammo vs 真实 28 份(dataset A)= 0.78,vs 真实 210 份(dataset B)= 0.76;ChatGPT 生成的 21 份(dataset C)vs 真实 = 0.57-0.59;手写合成 vs ChatGPT = 0.58。三个读数画出清晰的两个簇:人写虚构紧贴真实分布(与真实组间基线 0.79 仅差 0.01-0.03),LLM 生成掉出 0.6 以下。这套验证的成本极低(sentence-transformers 一段脚本,代码随数据集发布),可复用性极强——任何"手写/审查合成数据"都可以照此自证。注意单值无置信区间的局限(见 §12 缺口存照)。
§1.3 全库最小与流量最低的双纪录
28 份的规模 + Views 29/133 的流量,让本条同时持有全库"最小体量"与"最低流量"两项纪录。这恰是它的生态位真相:不是资源型数据集,是方法论型数据集——下载它的人不是为了 28 份文本,是为了复刻一条"合成基准建设+自证+配套论文"的完整路径。对照姊妹条目:526 ReXErr(前一条目)走 LLM 量产路线拿规模,本条走手写虚构路线拿信任;两者叠加,"synthetic"在医学数据语境里的全部含义(规模合成/保真合成/合规合成)在批次八前两条内集齐。
§2 团队与版本:3 人署名背后的 10 人论文
§2.1 数据集 3 人 vs 论文 10 人
PhysioNet 条目署名 3 人:Daniel Reichenpfader(Bern 应用科大 patient-centered digital health 研究所 + Geneva 大学 PhD 项目,MSc)、Sandro von Däniken(Inselspital 放射科 MD)、Harald Marcel Bonel(Inselspital 放射科 MD,senior 审查者)。但配套 JMIR 论文署名 10 人——隐身的 7 人包括 Jonas Knupp(ID SUISSE AG)、André Sander(ID BERLIN)两家医疗信息化企业人员,以及 Inselspital 放疗科的 Gaio/Dennstädt 与 Cereghetti/Hiltbrunner/Nairz。企业人员的角色(frame semantics 产品化方向)在论文中未逐人说明——数据集署名收窄到"制作-审查"核心三人,方法论与工程团队留在论文署名里,这是"数据集条目"与"方法论文"分工署名的典型样态。
§2.2 手写者之谜
页面写报告由 “a radiology resident with clinical training in breast imaging” 手写——但三人署名中 Reichenpfader 是 MSc(计算机背景,论文里的 fact schema 起草者),von Däniken 与 Bonel 是放射科医生(后者是审查的 senior)。resident 是谁?两信源(页面+论文)均未具名。按审查分工(Bonel 是 “senior radiologist specialized in breast imaging”),resident 最可能是 von Däniken——但这是推断,存照不实锤。手写者身份的匿名化也侧面说明:合成数据的"作者信任"绑定在机构(Inselspital)与审查机制(senior 独立审查)上,而非个人。
§2.3 版本时间线与三 DOI
| 时间 | 事件 |
|---|---|
| 2024-10-18 | RadEx 框架+研究 OSF preprint(论文前身材料) |
| 2024-11-07 | JMIR 投稿(submitted) |
| 2025-01-02 | 审稿意见返回 |
| 2025-02-20 | 修回 |
| 2025-03-16 | 接收(accepted) |
| 2025-04-25 | JMIR 正式发表(J Med Internet Res 2025;27:e68427) |
| 2025-04-30 | PhysioNet 挂牌 v1.0.0(发表后 5 天) |
| 2025-06-24 | v1.0.1(修正摘要 three→four + 更新论文引用) |
三 DOI:v1.0.0 = 10.13026/mrg5-ja22(锁旧版);v1.0.1 = 10.13026/95cy-rc09(锁修正版);latest = 10.13026/gqzb-fg27(浮动)。引用建议:页面 BibTeX 默认给 v1.0.1 的 95cy-rc09;引用 v1.0.0 者注意其摘要是含错误的旧版。
§2.4 v1.0.1 变更声明(官方原文)
“This release corrects a minor error in the abstract: Specifically, we clarified that the Swiss-Mammo dataset currently contains four reports per BI-RADS category. We also updated the reference to the original publication as the title was changed after submission.”——两处修正对应两个故事:①"three"是论文评估集 21 份(3×7)时代的数字残留(本条目推断:28 份扩容后摘要忘了同步),官方自认并修正;②标题变更=JMIR 编辑规范要求缩写 BERT 首次出现展开为 “Bidirectional Encoder Representations From Transformers (BERT)”——论文内容零变化的机械性改题。教训:PhysioNet 摘要数字可能与正文脱节,多版本页面对比是标准核查动作。
§3 数据解剖:56 个文本文件与一个 CSV
§3.1 文件组织
两种格式双轨发布(页面 Data Description):
SwissMammo_001_BR2_DE.txt ← 德文原文
SwissMammo_001_BR2_EN.txt ← 英文翻译
…(共 28×2 = 56 个 UTF-8 txt)
SwissMammo.csv ← 表格版(ID / BIRADS / Text_de / Text_en)
code/ ← 相似度评估 .py(sentence-transformers)
命名规范 SwissMammo_<ID>_BR<BI-RADS>_<DE|EN>.txt:ID 001-028 零填充;BI-RADS 取双乳较高类别(双侧不一致时按高者归档——工程细节);语言后缀 DE/EN。CSV 列四枚:ID(如 003)、BIRADS(整数 0-6)、Text_de、Text_en。Technical Notes 提醒 German umlauts(ä/ö/ü)按 UTF-8 解码——文本管线的老朋友(对照 523 的 bz2 陷阱、526 的 errror 拼写,本条文件系统无陷阱但编码有提醒)。
§3.2 报告结构:四段式模板
每份报告四段(页面 “Report structure”):Clinical Indication(临床指征)→ Imaging Findings(影像发现)→ Assessment(评估,含 BI-RADS 类别)→ Recommendation(建议,如适用)。这个结构模仿瑞士大学医院的 mammography 报告惯例(“follow a standardized mammography reporting structure”),与 ACR 的 BI-RADS 指南结构对齐——JMIR 论文的 fact schema 正是按 BI-RADS 指南起草,报告结构与 schema 的对齐是抽取任务可做的前提。
§3.3 分层的含义与代价
BI-RADS 0-6 每类 4 份的均衡设计服务于"分类别评测":每类的抽取/分类表现可以单独算分,不被类别失衡污染。代价是页面 Technical Notes 明文承认的:“Stratification means that the dataset does not reflect the true prevalence of BI-RADS categories in the general population”——真实筛查人群中 BI-RADS 0/1/2 占绝对多数、4-6 稀少,均衡分层是评测视角而非流行病学视角。用本数据统计任何"类别分布"结论都是错的——它只回答"模型在每一类上表现如何",不回答"患者人群长什么样"。
§4 相似度验证:0.78 / 0.76 / 0.58 的三档读数
§4.1 实验设计
四个语料、六个配对、对称矩阵(页面 Methods “Similarity Assessment”):
| Swiss-Mammo | A(真实 28 份) | B(真实 210 份) | C(ChatGPT 21 份) | |
|---|---|---|---|---|
| Swiss-Mammo | – | 0.78 | 0.76 | 0.58 |
| A | 0.78 | – | 0.79 | 0.59 |
| B | 0.76 | 0.79 | – | 0.57 |
| C | 0.58 | 0.59 | 0.57 | – |
嵌入模型 gte-Qwen2-1.5B-instruct(多语通用文本嵌入,arXiv 2308.03281,Li et al. 的 multi-stage contrastive 训练系)+ sentence-transformers 实现;评估代码随数据集的 code 文件夹发布(页面 “If you wish to reproduce or extend our analysis, we provide a corresponding .py file”)。
§4.2 三个簇的解读
- 真实簇内部 0.79(A vs B)——同一临床语料库两次分层抽样的自然相似度基线
- 手写合成簇 0.76-0.78(Swiss-Mammo vs A/B)——比真实基线仅低 0.01-0.03,页面结论:“only a minor decrease in average cosine similarity”
- LLM 生成簇 0.57-0.59(C vs 真实/Swiss-Mammo)——掉出 0.6,页面用词 “substantially lower similarity scores”,判定 “reduced semantic alignment with real clinical narratives”
三个数字构成"合成数据三分法"的量化证据链:手写虚构(人脑生成、真实风格模仿)与 LLM 生成(统计生成、风格漂移)是两种不同的合成——0.2 的相似度鸿沟就是语义指纹。页面将此作为 benchmark 效用的论据:“This analysis supports the utility of the synthetic reports for benchmarking and evaluation tasks, particularly when compared to generic LLM-generated text.”
§4.3 方法论的可迁移性与边界
这套自证流程的组件(嵌入模型选型+余弦矩阵+对照集设计)成本低到任何团队都能复刻。三个边界:①单值无方差——28 份的相似度无置信区间,0.76 vs 0.79 的 0.03 差异是否显著未检验;②嵌入模型依赖——gte-Qwen2 的多语语义空间里"像不像"不等于"对不对"(医学事实错误的句子可以语义相似);③对照组规模不对等(21 vs 28 vs 210)——C 组 21 份 ChatGPT 生成报告的 prompt 未披露,其"差"可能是 prompt 差而非 LLM 天性。结论:相似度指纹是必要非充分验证——真正的语义保真还要靠 JMIR 论文里那套人工评测(2 放射科医生逐份评)兜底。
§5 配套论文:BERT + Frame Semantics 的完整成绩单
§5.1 方法论源流:Fillmore → Steinkamp → RadEx
frame semantics(框架语义学,Fillmore 1985/2006)的核心:词语的意义要在"框架"(scenario 及其角色关系)中理解。Steinkamp et al 2019 把它变成医学 IE 的信息模型——fact = 连续文本 span = anchor(事实的唯一关键词/短语)+ modifiers(可选修饰属性),让临床医生自己定义要抽什么(可复用的原子信息类型)。Steinkamp 用 pre-transformer 的 BiGRU 实现;本文(Reichenpfader et al)升级为 BERT 架构并套进自家 RadEx 框架(arXiv 2024-06-14 preprint,“A framework for structured information extraction from radiology reports based on large language models”)。
§5.2 标注工程:210 份语料的三阶段加工
初始 fact schema 由 1 计算机科学家(Reichenpfader)+1 医学计算机科学家(Knupp)按 BI-RADS 指南起草 → 2 名临床医生(1 放射+1 放射肿瘤)迭代增补 → 质量改进 3 轮(每轮 4 clinicians 中的 2 人标 7 份新报告,差异集体讨论,schema 同步修订)→ 终标 210 份(仅 clinical findings 段)由 3 clinicians 完成。工具:Inception 标注平台本地部署(版本 26.8→30 跨版本迁移)。
IAA(Krippendorff α unitizing)三轮轨迹(Table 2):
| 轮次 | facts α | anchors α | modifiers α |
|---|---|---|---|
| Round 1 | 0.49 | 0.42 | 0.50 |
| Round 2 | 0.74 | 0.64 | 0.60 |
| Round 3 | 0.83 | 0.61 | 0.61 |
facts 层收敛良好(0.49→0.83),anchors 第 3 轮回落(0.64→0.61)、modifiers 低位徘徊——unitizing 任务(文本单元切分+归类双步)的 IAA 天然比 521 rad-coref 的分类任务(α 0.79-0.87)难做高。
§5.3 schema 演化:24+66 → 14+40 的两道筛
初始 schema 覆盖完整报告:24 facts + 66 modifiers。两道筛选后变成最终抽取目标 14 fact types + 40 entity types(14 anchor + 26 modifier):①零实例筛——210 份建模集中 4 facts+26 modifiers 从未出现( mammography findings 段触发不了);②最小类频筛——6 facts+14 modifiers 标注 <20 次被排除(阈值 20)。最终建模集含 2,519 个标注 fact 实例(NER 转换后 2,772 facts——两口径并存:前者是 schema 合规实例数,后者是含任务转换的总数)。对照 526 ReXErr 的稀疏类目策略:ReXErr 用 tag 频率倒数加权补偿稀疏类,本文直接排除稀疏类——加权保覆盖、排除保精度,两种哲学。
§5.4 四模型变体与两步管线
全部基于 classical BERT(110M 参数):
| 变体 | 构造 | Perplexity |
|---|---|---|
| medBERT.de | 基线(470 万德语医学文档预训练) | 1.21 |
| InselBERT_multi | medBERT.de + 多模态报告 MLM(“Insel”=Inselspital) | 1.12 |
| InselBERT_mammo_03 | 乳腺子集 MLM 3 epochs | 1.11 |
| InselBERT_mammo_10 | 乳腺子集 MLM 10 epochs | 1.09 |
MLM 超参:lr 2e-5、wd 0.01、masking 0.15、3 epochs。两步管线:QA 模型(SQuAD_v2 抽取式,按 fact type 逐个提问抽 span)→ NER 模型(IOB 序列标注,span 内切 anchor/modifier)。部署:BentoML 打包 Docker(3.68 GB)→ 无 GPU VM(7.7 Gi RAM)→ 单报告 <20 秒。
§5.5 成绩单与两个负结果
量化(Table 4/5):QA F1 = medBERT.de 90.09 / multi 89.78 / mammo_03 90.49(最优) / mammo_10 90.4(95% CI 重叠——差异不显著);NER F1 = 四变体全部 0.81(9-fold,SD ≤0.008)。
负结果一:领域再预训练无下游收益。perplexity 单调改善(1.21→1.09)但 QA/NER 两任务提升均在 CI 内——“Further pretraining on hospital data reduced model perplexity, although it did not significantly impact the 2 downstream tasks”。对照 524 RadVLM 的"数据配方决定一切"叙事:在 110M 小模型+小标注集场景,再预训练的收益被微调抹平。
负结果二:SNOMED-CT 归一化仅 64.29%。抽取后的概念归一化(SNOMED-CT+Wingert 术语)3,582 concepts 中 2,303 plausible——管线最弱环节,原因是大量 implausible SNOMED-CT 概念(论文建议约束 subtype 关系可改进)。抽取 90%+ 与归一化 64% 的落差说明:结构化报告的最后一公里(术语挂接)比抽取本身难。
§5.6 与 Llama 3.3 的正面对决
论文用 best-practice prompting 的 Llama 3.3(Meta 开源)做生成式抽取对照:
| 指标 | InselBERT 管线 | Llama 3.3 |
|---|---|---|
| facts 精度 | 96.1% | 91.4%(正文;摘要写 91.2%——官方数字漂移存照) |
| entities 精度 | 99.6% | 87.3% |
| 单报告耗时 | <20 秒(无 GPU) | 7 分钟(21 倍差) |
| 部署 | 3.68 GB Docker / 7.7 Gi RAM | GPU 推理 |
| 失败模式 | 否定句误判(Table 6) | 幻觉+schema 越界 |
Llama 3.3 的两类病:①false positive 幻觉——源文档没有的信息被抽出(“the model tends to hallucinate especially for false positive extractions”);②schema 越界——抽 BI-RADS 时捎带病灶尺寸(“extracting additional information not defined in the fact schema”)。BERT 管线的失败更"体面"——全部 fact 错分集中在 3 个文本 span(“No retracted areas”/“No evidence of malignancy”/“Mamilla distance 54mm”)与单词 “No”(Dignity modifier)——否定句是主要错误模式(negation detection 是 frame semantics 的已知边界,论文结论自认)。204 个对的实例与 8 个错的实例加起来就是"encoder 可解释性"的具体形状:错误可枚举、可归因、可修。
§5.7 算力叙事:Apple M1 Max 的含金量
“Model pretraining and fine-tuning were performed on a single Apple M1 Max chip.”——整条流水线(含领域 MLM 预训练)在一台笔记本芯片上完成,部署在无 GPU 的机构 VM。对照 524 RadVLM 的 CSCS Alps 超算与 7B 模型:110M BERT + 210 份标注 + M1 Max = 人类可比的抽取质量(论文结论原话 “even with a small annotated dataset and a relatively small language model, the quality of IE is comparable to human performance”)。这是医疗 NLP 的另一条路线证明:任务窄、schema 明确、输出可解释的场景里,小模型+好设计没有被 LLM 时代淘汰。
§5.8 训练超参全表(复现者直取)
| 环节 | 超参 | 值 |
|---|---|---|
| MLM(领域再预训练) | epochs / lr / wd / masking | 3 / 2e-5 / 0.01 / 0.15 |
| QA 微调 | lr / epochs / max seq / stride | 3e-5 / 5 / 384 / 128 |
| QA 数据划分 | train/test/val | 70%/15%/15%(1,972/274/273 examples) |
| NER 微调 | lr / max epochs / wd / batch / optimizer | 5e-5 / 100 / 1e-2 / 16 / AdamW |
| NER 早停 | patience(test 集下降轮数) | 5(保存最优回滚加载) |
| NER 评估 | 折数/划分 | 9-fold(80/10/10,val 折间共享) |
| QA 评估 | 置信区间 | bootstrap 599 resamples @95% |
| 硬件 | 训练 | Apple M1 Max 单机 |
| 部署 | 打包/运行环境/耗时 | BentoML Docker 3.68 GB / 7.7 Gi RAM VM / <20 秒 |
复现提示:论文声明 seed 手动设定但未公布值——严格复现需自行扫描 seed;早停回滚机制(best model reload)是 NER 稳定性的关键细节,漏掉会引入最后几个 epoch 的过拟合噪声。
§6 生态位:德语、乳腺、frame semantics 的三重稀缺
§6.1 语种稀缺
德文临床 NLP 语料极稀——论文 Related Work 里的德文基座只有 medBERT.de(470 万文档)。乳腺报告的德文公开基准在 Swiss-Mammo 之前为零。本条是德语乳腺影像 IE 的第一个公开评测集——502 万德语人口(瑞士+德国+奥地利核心区)的乳腺筛查质控研究从此有了现成基准。
§6.2 任务稀缺:frame semantics vs 主流范式
主流医学 IE 是 NER+RE(561 RadGraph 系)或 QA/LLM 抽取;frame semantics 路线(临床医生自定义 fact schema + anchor/modifier 结构)在小众但有两个独优点:①可定制——“enables customizable information extraction”,加新 fact type 不改架构;②可解释——抽取结果直接锚定原文 span(“the output of our pipeline is directly linked to the free-text in the report”),临床审计友好。论文对 GLiNER 的讨论承认 encoder 系灵活抽取的趋势,但坚持任务专属优化在临床场景的精度优势。
§6.3 库内坐标
| 联动条目 | 关系 |
|---|---|
| 526 ReXErr(前一条目) | 合成数据两极:LLM 注错 200k+/Open vs 手写虚构 28/Restricted |
| 528 TN-Mammo(下一发) | 乳腺影像家族:本条管文本、528 管图像 |
| 561 RadGraph / 622 RadGraph2 | 报告结构化同行:英语实体关系 vs 德语 frame semantics |
| 521 rad-coref | IAA 方法论对照:分类任务 α 0.79-0.87 vs unitizing 任务 α 0.42-0.83 |
| 524 RadVLM | 算力光谱两极:CSCS Alps 7B vs Apple M1 Max 110M |
§6.4 瑞士医疗数据文化的侧写
本条目背后是瑞士医疗数据治理的典型形态:大学医院(Inselspital)的临床语料禁发(即使标注后去标识)——机构限制优先于科研开放;应用科大(BFH)作为学术-产业的桥接层,用合成数据绕开禁令完成方法学发布;两家信息化企业(ID SUISSE/ID BERLIN)在论文署名里候场(产品化路线)。对照美国生态(MIMIC 全开放)与英国生态(NHS 数据沙箱):瑞士模式=紧数据+松方法——方法论文与合成基准全开放,真实数据锁死。这解释了为什么 frame semantics 的可定制性被强调(“enables customizable information extraction … with additional annotation efforts”)——其他机构要复用,只能自建标注,工具链开放性是瑞士团队的补偿设计。
§7 使用指南:谁该下载这 28 份
§7.1 三类用户画像
①德语医疗 NLP 团队:唯一的德文乳腺报告公开基准,直接测模型 BI-RADS 分类与字段抽取;②报告结构化工程组:frame semantics 的 fact schema 定义、标注 guideline、两步管线代码、Docker 镜像全开放——照抄一套"临床医生可自定义"的抽取系统;③数据集建设者:相似度验证 .py + 对照组设计 = "合成基准自证"的模板,任何手写/审查合成数据都可复用。
§7.2 访问与合规
Restricted 档:PhysioNet 注册 + 签 Restricted DUA(无 CITI 培训强制——同 525 REFLACX 档位形态)。纯合成数据本无 PHI 风险,Restricted 是发布方的保守选择(§2/§10 详述悖论)。引用义务双份:PhysioNet 标准引用(RRID SCR_007345)+ JMIR 论文(页面 “Additionally, please cite the original publication” 明文)。无 Parent Projects——不欠母集引用(对照 526 的 MIMIC-CXR 引用义务)。
§7.3 坑点表(十条,标准格式)
| 坑点 | 典型翻车 | 绕行姿势 |
|---|---|---|
| 坑点1:拿摘要 three 当真 | 写成 21 份(3×7)报告 | v1.0.1 已修正 four——28=4×7,认准 v1.0.1 口径 |
| 坑点2:synthetic 脑补成 AI 生成 | 把本条归入 LLM 合成家族 | 页面明文 “without the use of generative AI”——人写虚构 |
| 坑点3:28 份当训练集 | 训练完直接过拟合报告风格 | 它是评测基准;训练另找数据(对照附录 O 分层账本) |
| 坑点4:均衡分层当流行率 | 用 BI-RADS 分布推人群统计 | Technical Notes 明文否认——评测视角设计 |
| 坑点5:0.76 当"与真实无异" | 夸大相似度结论 | 真实基线 0.79 有 0.03 差,且单值无 CI——必要非充分证据 |
| 坑点6:摘要 91.2% 与正文 91.4% 混引 | Llama 3.3 精度引错版本 | 认正文 91.4(附录 E.5 存照) |
| 坑点7:21 份两处混用 | 把 dataset C 当论文评估集 | 数字巧合属性不同:C=ChatGPT 对照/评估集=手写 |
| 坑点8:引用漏 JMIR 论文 | 只引 PhysioNet | 页面双引用义务明文——论文必须同引 |
| 坑点9:EN 版做德语 NLP | 英译噪声污染实验 | 英译无语言学验证——德文版才是主语料 |
| 坑点10:2,519/2,772 混用 | fact 总数引用漂移 | 前者建模集合规实例、后者 NER 转换总数——两口径并存存照 |
§8 批评视角:28 份能证明什么、不能证明什么
§8.1 不能证明的
- 人群级结论:均衡分层+全虚构——任何流行病学、分布假设检验在此无意义
- 模型泛化性:单机构(Inselspital)报告风格——页面 Limitations 明文 “might not be generalizable to other institutional reporting standards”;瑞士德语与德国德语的临床文书差异(缩写习惯、医院模板)未被覆盖
- 真实文书的全貌:不含缩写、不含错误、不含涂抹修改(“do not capture the full complexity or variability of real clinical documentation (including e.g., abbreviations or errors)”)——太干净的语料测不出模型对"脏数据"的鲁棒性。对照 526 ReXErr 专门注入错误——527 的干净与 526 的有毒恰好是鲁棒性测试光谱的两端
- 英译质量:人工+工具辅助、无形式语言学验证——EN 版只能当参考读,严谨的德文 NLP 工作用 DE 版
§8.2 能证明的
- 合成基准的自证方法(相似度指纹+人工审查+代码公开)——方法论完整可迁移
- frame semantics 管线的可行性——JMIR 论文的 96.1%/99.6% 精度与 20 秒/报告的成本
- 小模型+窄任务的生存空间——Llama 3.3 对决的完胜(精度+速度+部署门槛)
- 数据禁令的应对范式——机构锁数据时,合成替代的完整动作清单
§8.3 公允定位
Swiss-Mammo 的 28 份是"种子"不是"森林":它不解决规模问题(那是 526/523 们的活),它解决合法性与方法论示范问题——当机构不放数据时,怎么用最小成本建设一个可发布、可信、可复用的替代基准。全库最小+全库最低流量+方法论最完整三顶帽子一起戴,这正是"评测基准"与"资源数据集"的分野。
§9 版本考古专题:three→four 的官方自认
§9.1 错误的形态
v1.0.0 摘要:“The reports are stratified across BI-RADS categories 0 through 6, with three reports per category.”——3×7=21 ≠ 28,与同页 Methods 节 “four examples per BI-RADS category” 直接矛盾。同一页面摘要与正文数字打架,这是页面写作质量事故;但 Methods 与数据文件(28 份)自始正确。
§9.2 错误的来源(推断链,标注为推断)
JMIR 论文的人工评估用 “a manually generated synthetic dataset of 21 reports”(=3×7)→ 正式挂牌扩容到 28(=4×7)→ v1.0.0 摘要写作时沿用了 21 份时代的 “three reports per category” 表述 → v1.0.1 修正。"three"是演化残留而非随机笔误——版本考古的价值在于此:错误本身携带了数据集从 21→28 的生长史。
§9.3 修正的机制
v1.0.1 变更声明点名两处:摘要数字(three→four)+ 论文引用(标题变更——BERT 缩写展开的编辑规范改题)。注意 v1.0.1 未声明数据文件变更——修正限于页面文本,文件层 diff 无从验证(Files 区地区限制,本条目存照)。给库内读者的操作建议:任何引用 Swiss-Mammo 数字的场合,以 v1.0.1 页面+数据文件实际 count 为准;引用 v1.0.0 DOI(mrg5-ja22)的文献自带 “three” 错误,需读者自查。
§10 FAQ:速查索引(按主题分组)
FAQ-1 基础认知(8 问)
Q1:Swiss-Mammo 是什么?
28 份医生手写的德文乳腺 X 线报告合成数据集(每份配英文翻译),BI-RADS 0-6 七类每类 4 份均衡分层,由 Bern 应用科大+Inselspital 团队发布于 PhysioNet(v1.0.0 2025-04-30 / v1.0.1 2025-06-24)。
Q2:为什么只有 28 份?
它是评测基准不是训练集。它的前身是 JMIR 论文里 21 份(3×7)人工评估集,挂牌时扩容为 28 份(4×7)。设计目标是在每类 BI-RADS 上有足够的评测样本,而非提供训练规模。
Q3:synthetic 在这里指什么?
指’不基于真实患者记录’(fully synthetic, identifiers 与 dates 全虚构),而非’AI 生成’——页面明文报告由 radiology resident 手写,without the use of generative AI。
Q4:报告是什么语言?
德文原文 + 英文翻译双语对(56 个 txt 文件 + 1 个 CSV)。英译为人工+自动工具辅助,未经正式语言学验证——严谨工作用德文版。
Q5:BI-RADS 是什么?
Breast Imaging-Reporting and Data System,美国放射学会(ACR)的乳腺影像报告与数据系统,0-6 七级分类(0 需回看/1 阴性/2 良性/3 可能良性/4 可疑/5 高度可疑恶性/6 活检证实恶性),乳腺报告的结构化标准。
Q6:数据集怎么访问?
PhysioNet Restricted 档:注册账号+签 Restricted DUA 即可下载,无 CITI 培训强制。纯合成数据挂 Restricted 是发布方的保守选择。
Q7:数据文件长什么样?
txt 按 SwissMammo_<ID>BR<类别><DE|EN>.txt 命名(ID 001-028 零填充);CSV 四列 ID/BIRADS/Text_de/Text_en;报告四段式:Clinical Indication/Imaging Findings/Assessment(含 BI-RADS)/Recommendation。
Q8:和真实报告的区别是什么?
内容是虚构的(不基于任何真实患者),但语言风格模仿瑞士大学医院真实 mammography 报告;且刻意’干净’——不含真实文书的缩写、错误与混乱(页面 Limitations 自认)。
FAQ-2 版本与数字(6 问)
Q9:v1.0.0 和 v1.0.1 有什么区别?
v1.0.1(2025-06-24)官方变更声明:修正摘要错误(three→four reports per category)+ 更新论文引用(标题变更)。未声明数据文件变更。
Q10:摘要的 three reports 是怎么回事?
v1.0.0 摘要写 ‘three reports per category’(3×7=21)与 Methods 节 ‘four’(28)矛盾。本条目推断:21 是论文评估集时代(3×7=21 份)的数字残留,扩容 28 后摘要没同步。v1.0.1 官方修正。
Q11:应该引用哪个 DOI?
v1.0.0=10.13026/mrg5-ja22(摘要是含错旧版);v1.0.1=10.13026/95cy-rc09(修正版);latest=10.13026/gqzb-fg27(浮动)。一般引用 v1.0.1。
Q12:论文标题为什么变了?
投稿版 ‘Enhancing BERT with Frame Semantics…’,发表版把 BERT 展开为 ‘Bidirectional Encoder Representations From Transformers (BERT)’——JMIR 编辑规范要求缩写首次出现用全称,机械性改题。
Q13:JMIR 论文什么时候发表的?
J Med Internet Res 2025;27:e68427,2025-04-25 发表(DOI 10.2196/68427,PMID 40279645)——PhysioNet 挂牌(2025-04-30)前 5 天。OSF preprint 2024-10-18,JMIR 投稿 2024-11-07。
Q14:Project Views 为什么这么低?
current 29/all 133——全库最低流量。原因:体量小+德语垂直+挂牌时间短+用途窄(评测基准而非资源库)。低流量与高方法论密度并存。
FAQ-3 制作与验证(6 问)
Q15:报告是谁写的?
一位有乳腺影像临床训练的 radiology resident 手写(未具名)——数据集 3 位署名作者中 von Däniken 与 Bonel 是放射科医生 MD,Reichenpfader 是计算机背景 MSc;resident 最可能是 von Däniken(推断,未实锤)。
Q16:审查机制是什么?
全部 28 份由 senior breast imaging 放射科医生独立审查,确保临床合理性与语言学准确性。审查记录未随数据发布(对照 526 ReXErr 的 clinician-review.csv 公开)。
Q17:相似度验证是怎么做的?
gte-Qwen2-1.5B-instruct 句子嵌入+余弦相似度,四个语料两两对照:Swiss-Mammo vs 真实 28 份 0.78、vs 真实 210 份 0.76、ChatGPT 生成的 21 份 vs 真实 0.57-0.59。验证代码随数据集发布。
Q18:为什么用 ChatGPT 生成报告做对照?
dataset C(21 份 ChatGPT 报告)是’通用 LLM 生成’的对照组——0.57-0.59 的低相似度证明手写合成与真实分布更近。注意:C 组的 prompt 未披露,其’差’可能是 prompt 差而非 LLM 天性上限。
Q19:dataset B 的 210 份和论文训练集是同一批吗?
页面说 ‘a separate stratified dataset of 210 real reports sampled from the same mammography corpus’——同一临床语料库、同规模分层抽样,但措辞 separate;论文那 210 份被禁发,此处更可能是不同实例。未实锤,存照。
Q20:0.76 的相似度能证明’和真实一样’吗?
不能证明’一样’。真实组间基线 0.79,手写合成 0.76-0.78 有 0.01-0.03 差距;且单值无置信区间、嵌入相似不等于事实正确。它是必要非充分的保真证据,人工审查是另一支柱。
FAQ-4 配套论文(JMIR e68427)(10 问)
Q21:论文的抽取任务是什么?
从德文 mammography 报告的 clinical findings 段抽取 14 种 fact types 和 40 种 entity types(14 anchor+26 modifier)——fact 是连续文本 span(anchor 唯一关键词+可选 modifiers),信息模型源自 frame semantics(Fillmore)经 Steinkamp 2019 医学化。
Q22:标注数据怎么来的?
Inselspital 真实报告 210 份:schema 三阶段演化(初始 24 facts+66 modifiers → 零实例筛 → 最小类频 20 筛 → 14+40);4 clinicians 三轮迭代(每轮 2 人标 7 份),IAA 用 Krippendorff α unitizing(facts 0.49→0.74→0.83);终标 3 clinicians 完成,共 2,519 个 fact 实例。
Q23:为什么训练数据不发布?
论文原话:‘the publication of the training dataset is prohibited due to institutional restrictions’——Inselspital 的机构限制。这正是 Swiss-Mammo(手写合成)存在的第一因:替代发布物。
Q24:论文训练了哪些模型?
四个 BERT(110M)变体:medBERT.de 基线(470 万德语医学文档预训练)、InselBERT_multi(+多模态报告 MLM)、InselBERT_mammo_03/10(乳腺子集 MLM 3/10 epochs)。两步管线:QA 抽 fact span(SQuAD_v2 格式)+ NER 切 anchor/modifier(IOB)。
Q25:成绩怎么样?
QA F1 90.49%(最优变体 mammo_03,SQuAD_v2,95% CI 87.53-92.47);NER F1 0.81(9-fold CV);全管线人工评估 facts 96.1%、entities 99.6% 精度;SNOMED-CT 归一化仅 64.29%(最弱环节)。
Q26:领域预训练有用吗?
对 perplexity 有用(1.21→1.09 单调降),对下游任务无显著提升(CI 全重叠)——论文的负结果。小模型+小标注集场景,微调抹平了预训练收益。
Q27:和 Llama 3.3 比呢?
完胜:facts 96.1% vs 91.4%(正文口径;摘要 91.2% 有出入)、entities 99.6% vs 87.3%、单报告 20 秒 vs 7 分钟(21 倍)、无 GPU 3.68 GB Docker vs GPU 推理。Llama 3.3 的病:false positive 幻觉+schema 越界(抽 BI-RADS 时捎带病灶尺寸)。
Q28:BERT 管线会错在哪?
否定句。全部 fact 错分集中在 3 个文本 span(‘No retracted areas’/‘No evidence of malignancy’/‘Mamilla distance 54mm’)+单词 ‘No’(Dignity modifier)——negation detection 是 frame semantics 的已知边界(论文结论自认)。
Q29:训练用了什么硬件?
单台 Apple M1 Max(论文原话 ‘a single Apple M1 Max chip’)完成预训练+微调;部署在无 GPU VM(7.7 Gi RAM)。对照大模型时代的算力叙事,这是小模型路线的算力宣言。
Q30:代码和模型开放吗?
论文 data availability 声明:源代码+训练模型+容器化管线镜像全开放(OSF/Zenodo——Zenodo record 14793527);数据集 code 文件夹含相似度评估脚本。
FAQ-5 使用与坑位(7 问)
Q31:适合训练模型吗?
不适合——28 份是评测集。训练请看论文的合成数据策略或用 LLM 扩增(但相似度指纹警告:LLM 生成与真实分布 0.2 的鸿沟)。
Q32:评测该怎么设计?
按 BI-RADS 分层报告成绩(每类 4 份);抽取任务对照 JMIR 的 fact/anchor/modifier 三层;德文任务忽略 EN 翻译(未经语言学验证);报告单类成绩时注意每类仅 4 份的方差。
Q33:最大的坑是什么?
把 synthetic 读成 AI 生成(页面明文手写无 AI);把摘要 three 当真(v1.0.1 已修正);把均衡分层当流行率(Technical Notes 明文否认);拿英译版做德语 NLP。
Q34:英译版可以用于英文 NLP 吗?
谨慎。翻译是人工+自动工具辅助、无正式语言学验证(页面 Limitations 明文)——英文版参考可、评测慎用,尤其术语细节(德文医学术语的英译等价性未验证)。
Q35:BI-RADS 多双侧报告怎么算?
文件命名的 BI-RADS 取双乳较高类别(命名规范明文)——跨类别统计时注意这个归档规则,单侧分析需要回文本重新判定。
Q36:和 526 ReXErr 怎么选?
做英文胸片错误检测→526(200k+ 份 LLM 注错,ODbL 全开);做德文乳腺抽取评测或学合成基准方法论→527(28 份手写+全套自证模板)。合成光谱两极:规模合成 vs 信任合成。
Q37:德语 umlauts 有坑吗?
Technical Notes 提醒 ä/ö/ü 与其他变音符号按 UTF-8 解码——用错编码会静默损坏文本,读文件显式指定 encoding=‘utf-8’。
FAQ-6 批判性视角(5 问)
Q38:这份数据集最大的局限是什么?
规模(28 份无统计功效)+单机构风格(瑞士一院模板)+过净(无缩写无错误)——三者叠加意味着它只能测’受控条件下的抽取上限’,测不了真实世界性能。页面 Limitations 四连自认。
Q39:Restricted 档对合成数据有必要吗?
伦理上无必要(页面自认 no ethics concerns)——纯合成无 PHI。Restricted 是发布方保守选择(可能受母集机构数据文化影响)。对照 526 ReXErr 合成却 ODbL 全开——合成数据的访问档由风险偏好决定而非数据属性。
Q40:相似度验证有什么方法论缺陷?
单值无方差;嵌入相似≠事实正确;对照组 prompt 未披露;四语料规模不对等(21/28/210)。它证明’手写比 LLM 生成更贴近真实分布’这个相对结论,不证明绝对保真。
Q41:resident 匿名是问题吗?
是信息缺口——手写者资历(resident 年级、乳腺影像训练时长)直接影响数据可信度评估。数据集的信任绑在机构+senior 审查上而非个人资质公示。
Q42:如果 LLM 生成的报告改得好,能追上 0.76 吗?
开放问题。dataset C 只测了 2024-25 年 ChatGPT+未披露 prompt 的一种配置;few-shot+风格微调+医学语料 continued pretraining 的 LLM 生成未测。0.58 是’通用 LLM 直接生成’的读数,不是 LLM 路线的天花板。
FAQ-7 深挖追问(进阶 8 问)
Q43:Krippendorff α 的 unitizing 变体和普通 Cohen κ 差在哪?
unitizing 处理"文本单元边界本身有分歧"的任务(标注者先要切分 span 再归类),κ 假设单元边界已定只分类别。本条目的 fact span 切分天然是 unitizing 场景——α 0.83 的 facts 收敛已经不错,anchors/modifiers 的低位徘徊部分反映了切分歧义的传递。
Q44:为什么 anchors 的 IAA 第三轮回落?
可能原因:Round 3 引入了新的 fact 类(23/22 vs Round 2 的 22/21),新类目的 anchor 判定规则尚未沉淀;或样本小(每轮 7 份)的波动。论文未分析回落原因——存照。
Q45:两步管线(QA→NER)为什么不做端到端?
设计选择:QA 按 fact type 逐个提问(每报告跑多次管线)换来 schema 驱动的可控性——新增 fact type 只改问题不改模型;端到端多标签抽取虽快但加类需重训。代价:单报告 <20 秒里含多次前向(对比端到端的单次前向,20 秒已经很快)。
Q46:Dignity(良恶性)为什么会被 ‘No’ 触发?
德文报告里 Dignity 相关表述常与否定共现(“kein Malignitätsnachweis” 无恶性证据)——NER 模型把孤立否定词误绑到 Dignity anchor。这是 negation 与实体绑定耦合的教科书案例。
Q47:64.29% 的归一化失败都是假阳性吗?
不是——是"implausible concepts"(语义不合理挂接),如把描述性表述挂到不相关的 SNOMED 概念。论文建议约束 subtype 关系(每个实体类型只允许特定语义层次的候选)可改进——这是知识图谱约束解码的思路。
Q48:28 份里有没有正常的"双侧不同类别"样本?
命名规范只留"取高者"的痕迹(BR 后缀),文本内部会写双侧各自的类别。下载后可统计——本条目核查时 Files 区受限,无法预核——存照为待验证项。
Q49:这个数据集会被 LLM 时代淘汰吗?
反向思考:LLM 时代更需要它——LLM 抽取的幻觉问题(论文 Llama 3.3 对照实测)恰好需要受控基准来量化;28 份+人工审查记录的"干净评测面"是 LLM 评测的稀缺资源。淘汰论不成立,但护城河是方法论(指纹自证+frame schema)而非数据本身。
Q50:如果我想复制这套流程到别的机构/语言?
论文 RadEx 框架+Zenodo 代码是完整模板:①临床医生定义 fact schema(BI-RADS 指南起步)②三轮标注迭代(IAA 监控)③210 份级标注④BERT 微调⑤合成评估集+相似度指纹自证⑥BentoML 部署。估算:标注 3 人月+工程 1 人月+一台 MacBook——附录 H.4 的算力光谱证明了可行性。
(FAQ 深挖组合计 8 问;全 FAQ 50 问)
§11 事实清单:逐条存照(每条可溯源至页面快照/PMC 全文/v1.0.1 变更声明)
- 全名 Swiss-Mammo: A physician-written, synthetic dataset of German mammography reports;slug swiss-mammo。
- v1.0.0 挂牌 2025-04-30;v1.0.1 2025-06-24;三 DOI:mrg5-ja22(v1.0.0)/ 95cy-rc09(v1.0.1)/ gqzb-fg27(latest)。
- 访问档 Restricted:Restricted Health Data License 1.5.0 + Restricted DUA;注册+签约即可,无 CITI 强制(同 525 REFLACX 档位形态)。
- 页面 Ethics 原话 ‘As this is a purely synthetic dataset, no real patient data was used, and there are no ethics concerns to declare’——纯合成挂 Restricted 的悖论存照。
- 规模 28 份德文报告+28 份英译——全库最小数据集(对照 561 金标 800、521 段 950、525 读片 3,052)。
- BI-RADS 0-6 七类每类 4 份(28=4×7);v1.0.0 摘要误写 ‘three’,v1.0.1 官方变更声明修正为 ‘four’。
- v1.0.1 变更声明原话:‘This release corrects a minor error in the abstract … We also updated the reference to the original publication as the title was changed after submission.’
- 文件命名 SwissMammo_<ID>BR<BI-RADS><DE|EN>.txt,ID 001-028 零填充,BI-RADS 双乳取较高类别;CSV 四列 ID/BIRADS/Text_de/Text_en。
- 报告四段式:Clinical Indication / Imaging Findings / Assessment(含 BI-RADS) / Recommendation(如适用)。
- 页面 Abstract 明文 ‘manually created by a radiology resident without the use of generative AI’ + ‘independently reviewed by a senior radiologist specialized in breast imaging’。
- 数据集署名 3 人:Daniel Reichenpfader(BFH+Geneva,MSc)、Sandro von Däniken(Inselspital 放射科 MD)、Harald Marcel Bonel(Inselspital MD,senior 审查)。
- JMIR 论文署名 10 人:+Knupp(ID SUISSE AG)/Gaio/Dennstädt(放疗科)/Cereghetti/Sander(ID BERLIN)/Hiltbrunner/Nairz/Denecke(BFH 教授)。
- 手写 resident 未具名——本条目推断最可能 von Däniken(未实锤存照)。
- 相似度验证模型 gte-Qwen2-1.5B-instruct(arXiv 2308.03281),sentence-transformers 实现,代码随数据集发布。
- 相似度矩阵:Swiss-Mammo vs A(真实 28)0.78 / vs B(真实 210)0.76 / vs C(ChatGPT 21)0.58;A vs B 0.79(真实基线);C vs 真实 0.57-0.59。
- 页面结论:‘only a minor decrease’(0.79→0.76)vs ChatGPT ‘substantially lower similarity scores(<0.6)’。
- dataset C = 21 份 ChatGPT 生成报告——与论文评估集 21 份数字巧合但属性不同(对照 vs 评估集)。
- 配套论文:J Med Internet Res 2025;27:e68427(DOI 10.2196/68427,PMID 40279645,PMCID PMC12064967);OSF preprint 2024-10-18;submitted 2024-11-07;accepted 2025-03-16;published 2025-04-25。
- 论文标题变更:BERT→‘Bidirectional Encoder Representations From Transformers (BERT)’(JMIR 缩写展开规范)。
- 论文方法源自 Steinkamp et al 2019(DOI 10.1007/s10278-019-00234-y)的 fact 信息模型+Fillmore frame semantics;作者自家 RadEx 框架(arXiv 2024-06-14)。
- fact = 连续文本 span = anchor(唯一关键词/短语)+ modifiers(可选修饰)。
- 标注语料 210 份真实报告(Inselspital)——‘publication of the training dataset is prohibited due to institutional restrictions’(禁发原话)。
- schema 演化:初始 24 facts+66 modifiers → 零实例筛(-4 facts/-26 modifiers)→ 最小类频 20 筛(-6 facts/-14 modifiers)→ 最终 14 fact types+40 entity types。
- 建模集 2,519 个标注 fact 实例(NER 转换后 2,772 facts——两口径并存)。
- 标注三阶段:初始化(DR+JK 起草+2 临床医生增补)→ 质量改进 3 轮(4 clinicians 每轮 2 人标 7 份)→ 终标(3 clinicians,仅 findings 段)。
- IAA = Krippendorff α unitizing 三轮:facts 0.49→0.74→0.83;anchors 0.42→0.64→0.61(R3 回落);modifiers 0.50→0.60→0.61。
- 标注工具 Inception 本地部署(版本 26.8→30 迁移);CAS(Common Analysis Structure)格式;spaCy 分词+自有缩写表。
- 四模型变体(全 BERT 110M):medBERT.de(470 万德语医学文档预训练基线)/ InselBERT_multi / InselBERT_mammo_03/10(乳腺子集 MLM 3/10 epochs)。
- MLM 超参:lr 2e-5、wd 0.01、masking 0.15、3 epochs。
- 两步管线:QA(SQuAD_v2 抽取式)抽 fact span → NER(IOB 序列标注)切 anchor/modifier;QA 划分 70/15/15=1,972/274/273 examples;lr 3e-5、5 epochs、seq 384、stride 128。
- NER 训练 9-fold CV(80/10/10);lr 5e-5、max 100 epochs、wd 1e-2、batch 16、AdamW、early stopping patience 5。
- Perplexity:1.21(medBERT.de)→1.12(multi)→1.11(mammo_03)→1.09(mammo_10)——单调降但下游无显著提升(负结果一)。
- QA F1(Table 4):90.09/89.78/90.49(最优 mammo_03)/90.4;EM 79.49/78.02/80.59/79.85——CI 全重叠(负结果一的下游侧写)。
- NER F1(Table 5):四变体全部 0.81(9-fold,SD ≤0.008);accuracy 0.82。
- 部署:BentoML 打包 Docker 3.68 GB → 无 GPU VM(7.7 Gi RAM+3.8 Gi Swap)→ 单报告 <20 秒。
- 人工评估:2 放射科医生评 21 份合成报告(‘manually generated synthetic dataset of 21 reports’)——Swiss-Mammo 28 份的前身(21→28 演化链)。
- 管线抽取:205 facts(14 types)→197 正确(96.1%);497 entities(24 types)→495 正确(99.6%);10/14 fact types+23/24 modifier types 精度 100%。
- 错分全集中:‘No retracted areas’(Foreign material 1+Asymmetry 3)/‘No evidence of malignancy’(Foreign material 1+Recommendation 2)/‘Mamilla distance 54mm’(Mamilla region 1)/‘No’(Dignity 2)——否定句主模式。
- SNOMED-CT+Wingert 归一化:3,582 concepts→2,303 plausible(64.29%)——管线最弱环节。
- Llama 3.3 对照:facts 91.4%(正文;摘要 91.2%——漂移存照)/entities 87.3%;幻觉(false positive extraction)+schema 越界(BI-RADS 捎带病灶尺寸);单报告 7 分钟。
- 20 秒 vs 7 分钟=21 倍速度差;3.68 GB 无 GPU vs GPU 推理——encoder 路线的成本完胜。
- 训练硬件:单台 Apple M1 Max(论文原话)——对照 524 RadVLM 的 CSCS Alps 超算,本库算力光谱两极。
- 论文结论原话:‘even with a small annotated dataset and a relatively small language model, the quality of IE is comparable to human performance’。
- Steinkamp 2019 对照:91% F1/16 fact types vs 本文 90.49%/14 fact types;Steinkamp 2 类占 73.14% 失衡 vs 本文最小类频排除。
- GLiNER 讨论:encoder 系灵活抽取趋势承认,临床域证据仅 PII/PHI,本文任务专属优化精度更优。
- 页面 Limitations 四连:合成不代表真实分布/不含缩写与错误/瑞士单院结构/英译无形式验证。
- Technical Notes:BI-RADS 均衡分层≠真实流行率;German umlauts UTF-8 保留提醒。
- Topics:radiology / mammography / structured reporting / bi-rads。
- Project Views 29(current)/133(all versions)——全库最低流量纪录。
- 引用义务双份:PhysioNet 标准(RRID SCR_007345)+JMIR 论文;无 Parent Projects(不欠母集引用)。
- 代码资产:论文侧 OSF+Zenodo(record 14793527)源码/模型/容器;数据集侧 code 文件夹相似度评估脚本。
(事实清单主批 51 条 + 附录 U 补遗 8 条 = 59 条)
§12 术语表:五十条
| 术语 | 释义 |
|---|---|
| BI-RADS | 美国放射学会乳腺影像报告与数据系统,0-6 七级(0 需补充评估/1 阴性/2 良性/3 可能良性/4 可疑/5 高度可疑/6 活检证实恶性)。本数据集按 0-6 七类每类 4 份分层。 |
| Swiss-Mammo | 本条目数据集名——28 份医生手写德文乳腺报告(+英译),PhysioNet Restricted 档。 |
| synthetic(合成) | 此处指不基于真实患者记录的虚构文本(identifiers/dates 全虚构),非 AI 生成——页面明文 resident 手写无生成式 AI。 |
| frame semantics(框架语义学) | Fillmore 提出的语言学理论:词语意义依托’框架’(scenario+角色关系)理解。医学 IE 中经 Steinkamp 2019 转译为 fact 信息模型。 |
| fact | frame semantics 信息模型的原子单元:一段连续文本 span,含唯一 anchor(关键词)与若干可选 modifiers(修饰属性)。由临床医生自定义类型,可复用。 |
| anchor | fact 的核心关键词/短语——fact 的唯一必选成分,NER 层抽取的 14 类实体之一。 |
| modifier | fact 的可选修饰属性(位置/尺寸/变化/否定等)——建模集 26 类实体之一。 |
| fact schema | 抽取目标的结构化定义:初始 24 facts+66 modifiers → 两道筛后 14 fact types+40 entity types。 |
| Krippendorff α(unitizing) | 多标注者一致性系数的 unitizing 变体,适用于文本单元切分+归类任务。本条三轮:facts 0.49→0.74→0.83。 |
| Inception | 开源文本标注平台(本地部署),本条目标注工具,版本 26.8→30。 |
| CAS | Common Analysis Structure,UIMA 生态的文本标注通用结构——本条目标注数据的交换格式。 |
| medBERT.de | 德语医学 BERT 基座:470 万德语医学文档(临床笔记/文献等)再预训练的 BERT——本文四变体的共同起点。 |
| InselBERT | 本文自产变体族名——‘Insel’=Inselspital(伯尔尼大学医院’岛屿’医院);multi=多模态 MLM 版,mammo_03/10=乳腺子集 MLM 3/10 epochs 版。 |
| MLM | Masked Language Modeling,BERT 式自监督预训练目标:遮 15% token 预测。本文领域再预训练的训练目标。 |
| SQuAD_v2 | 斯坦福问答数据集 2.0 的评测协议(含不可答问题)——本文 QA 模型的训练格式与评测口径(F1/EM)。 |
| seqeval | 序列标注评测库——NER 模型的 F1/precision/recall/accuracy 口径。 |
| IOB 格式 | Inside-Outside-Beginning 序列标注编码:token 级实体边界标记——NER 训练数据的标注格式。 |
| 9-fold CV | 九折交叉验证:每折 80% 训练/10% 测试/10% 共享验证——本文 NER 模型的评估设计。 |
| perplexity(困惑度) | 语言模型预测难度的指数化度量——本文领域 MLM 的效果指标(1.21→1.09)。 |
| BentoML | 开源模型服务框架——本文管线的打包(‘Bento’)与 Docker 化部署工具。 |
| gte-Qwen2-1.5B-instruct | 多语通用文本嵌入模型(阿里通义系,arXiv 2308.03281 多阶段对比学习)——本条目相似度验证的嵌入引擎。 |
| cosine similarity(余弦相似度) | 向量夹角的相似性度量——本文四语料两两对照的语义距离口径。 |
| semantic fingerprint(语义指纹) | 本条目方法论术语:不同生成路线在嵌入空间的分布差异——手写 0.76-0.78 vs LLM 0.57-0.59 的 0.2 鸿沟。 |
| dataset A/B/C | 相似度验证对照组命名:A=真实 28 份;B=真实 210 份;C=ChatGPT 生成 21 份。 |
| RadEx | 作者团队的放射报告 IE 框架(arXiv 2024-06-14 preprint)——本论文方法的架构母体。 |
| Steinkamp 2019 | fact 信息模型的医学化首作(J Med Internet Res 系,BiGRU 实现)——本文方法的直系前作。 |
| negation detection(否定检测) | 识别文本中否定语义的子任务——本文管线的主要错误模式('No’开头的 span 全军覆没)。 |
| false positive extraction | 生成式抽取的幻觉形态之一:源文档没有的信息被抽出——Llama 3.3 对照组的主要病症。 |
| schema 越界 | 生成式抽取的第二病症:输出超出 fact schema 定义范围(抽 BI-RADS 时捎带病灶尺寸)。 |
| SNOMED-CT | Systematized Nomenclature of Medicine-Clinical Terms,医学术语系统——本文归一化目标之一(64.29% plausible)。 |
| Wingert terminology | 德语医学术语系统(Wingert 编制)——SNOMED 之外的第二个归一化目标,论文建议约束 subtype 改进归一化。 |
| normalization(归一化) | 抽取后的实体挂接标准术语——管线最弱环节(64.29%)。 |
| BI-RADS stratification | BI-RADS 均衡分层设计(每类 4 份)——评测视角的均衡 vs 人群流行率的不均衡(Technical Notes 明文区分)。 |
| Restricted DUA | PhysioNet Restricted 数据使用协议——注册+签约即可(无 CITI),本条目访问门槛。 |
| PhysioNet Restricted License 1.5.0 | 本条目文件许可——对照 Credentialed 1.5.0(多 CITI 要求)与 ODbL(全开放)。 |
| JMIR | Journal of Medical Internet Reseaach——配套论文期刊(2024 IF 约 5.8 的数字健康旗舰刊),CC-BY 开放获取。 |
| e68427 | JMIR 论文编号(v27i1e68427=卷 27 文章 e68427),DOI 10.2196/68427。 |
| PMID 40279645 | 论文 PubMed 标识;PMCID PMC12064967 为 PMC 全文库标识。 |
| ID SUISSE AG / ID BERLIN | 论文 10 人署名中的两家医疗信息化企业(St. Gallen/Berlin)——frame semantics 产品化方向的产业伙伴。 |
| Inselspital | 伯尔尼大学医院(德语区最大医院之一,‘岛屿医院’)——真实语料来源机构(禁发方)与审查医生所在机构。 |
| BFH | Bern University of Applied Sciences(伯尔尼应用科技大学)Institute for Patient-Centered Digital Health——第一作者与 PI 所在研究所。 |
| radiology resident | 放射科住院医师——本条目报告手写者身份(未具名,推断为 von Däniken)。 |
| senior radiologist | 资深放射科医生——审查者(Bonel,乳腺影像专科)。 |
| dignity | 本文 schema 的 modifier 类之一(肿瘤学语境的良恶性判定,德语 Dignität)——错分示例中的主角(单词 ‘No’ 误判为 Dignity)。 |
| mamilla | 乳头的解剖学术语(拉丁)——schema 中 Mamilla region fact 的错分示例(‘Mamilla distance 54mm’ 误判为 region 描述)。 |
| system prompt vs user prompt(对照笔记) | 本条目不涉及——526 的 GPT-4o 注错用长 prompt 工程,本条目零 LLM 参与,prompt 概念只出现在 dataset C 的未披露生成配置。 |
| 全库最小 | 28 份——比第二小的 561 RadGraph 金标(800)小一个数量级还多;与 Views 29(全库最低流量)构成双纪录。 |
| 21→28 演化 | 论文评估集 21 份(3×7)→ 挂牌 28 份(4×7)→ v1.0.0 摘要 ‘three’ 为残留 → v1.0.1 修正。版本考古核心证据链。 |
| 合成三分法 | 本库方法论:人写虚构(本条)/LLM 变换(526 注错)/LLM 生成(523 伪金标、dataset C)——三种合成三种信任策略。 |
| 苹果 M1 Max 路线 | 单笔记本芯片完成预训练+微调的算力叙事——对照 CSCS Alps 超算(524)的算力光谱另一极。 |
(术语表合计 50 条)
附录 A:30 秒速查卡
| 你想知道 | 答案 |
|---|---|
| 这是什么 | 28 份医生手写德文乳腺报告+英译,BI-RADS 0-6 均衡分层,PhysioNet Restricted |
| 谁做的 | Bern 应用科大+Inselspital;resident 手写+senior 审查;页面明文无生成式 AI |
| 为什么这么小 | 评测基准不是训练集;前身是 JMIR 论文 21 份评估集,挂牌扩容 28 |
| 为什么合成 | 论文 210 份真实标注语料被机构禁发——合成数据是替代发布物 |
| 可信吗 | gte-Qwen2 相似度 vs 真实 0.76-0.78(真实基线 0.79;ChatGPT 对照仅 0.58)+医生审查 |
| 引用什么 | PhysioNet v1.0.1 DOI 10.13026/95cy-rc09 + JMIR 2025;27:e68427(DOI 10.2196/68427)双引用 |
| 版本坑 | v1.0.0 摘要 ‘three’ 系 21 份时代残留,v1.0.1 官方修正 ‘four’(28=4×7) |
| 论文成绩 | BERT+frame semantics:QA F1 90.49%/NER 0.81/管线精度 96.1%/99.6%;完胜 Llama 3.3 |
| 算力故事 | Apple M1 Max 训练+无 GPU VM 部署 20 秒/报告 vs Llama 3.3 的 7 分钟 |
| 最大局限 | 28 份无统计功效+单机构风格+过净(无缩写无错误)——只测受控上限 |
附录 B:时间线全表
| 时间 | 事件 | 证据 |
|---|---|---|
| 2024-06-14 | RadEx 框架 arXiv preprint(作者团队,方法母体) | 论文 ref 29 |
| 2024-10-18 | 研究材料 OSF preprint | 论文 ref 61 |
| 2024-11-07 | JMIR 投稿 | PMC 全文 submission 时间戳 |
| 2025-01-02 | 审稿意见返回 | PMC 全文 |
| 2025-02-20 | 修回 | PMC 全文 |
| 2025-03-16 | 接收 | PMC 全文 |
| 2025-04-25 | JMIR 正式发表(27:e68427) | PMC 全文 |
| 2025-04-30 | PhysioNet 挂牌 v1.0.0(发表后 5 天) | 页面 Versions |
| 2025-06-24 | v1.0.1(摘要 three→four + 论文引用更新) | 页面变更声明 |
| 2026-09-24 | 本条目核查时 Views 29/133 | 页面快照 |
附录 C:文件资产全索引
| 资产 | 内容 | 获取 |
|---|---|---|
| 56 个 txt | SwissMammo_001-028 × DE/EN,UTF-8(ä/ö/ü 保留) | PhysioNet Files(签 DUA 后) |
| SwissMammo.csv | ID/BIRADS/Text_de/Text_en 四列表格版 | 同上 |
| code/ 相似度脚本 | gte-Qwen2 嵌入+余弦矩阵(sentence-transformers) | 同上 |
| OSF 材料 | RadEx 框架 preprint+研究结果 | osf.io 公开 |
| Zenodo 14793527 | 论文源代码+训练模型+容器化管线镜像 | zenodo.org 公开 |
| PMC12064967 | JMIR 论文全文(含 Table 1-6 与补充材料链接) | PMC 公开 |
| PhysioNet 页面 v1.0.0/v1.0.1 | 页面正文+相似度表+变更声明 | 公开(无 DUA) |
命名规范细节:ID 零填充三位(001-028);BR 后跟 0-6 整数(双乳取较高类别);语言后缀 DE/EN。CSV 的 BIRADS 列为整数型——pandas 读取时注意不要当字符串排序(003 vs 3)。
附录 D:相似度矩阵的完整读法
D.1 矩阵原文(页面 Methods 节转录)
| Swiss-Mammo | Dataset A | Dataset B | Dataset C | |
|---|---|---|---|---|
| Swiss-Mammo | – | 0.78 | 0.76 | 0.58 |
| Dataset A | 0.78 | – | 0.79 | 0.59 |
| Dataset B | 0.76 | 0.79 | – | 0.57 |
| Dataset C | 0.58 | 0.59 | 0.57 | – |
D.2 四语料档案
| 语料 | 规模 | 属性 | 来源 |
|---|---|---|---|
| Swiss-Mammo | 28 | 医生手写合成(本条目) | PhysioNet 公开 |
| Dataset A | 28 | 真实报告分层抽样 | 瑞士医院语料库(不公开) |
| Dataset B | 210 | 真实报告分层抽样(同库另一批) | 同上(不公开;与论文建模集同规模,是否同批未实锤) |
| Dataset C | 21 | ChatGPT 生成 | prompt 未披露 |
D.3 六个配对的叙事角色
| 配对 | 值 | 角色 |
|---|---|---|
| A vs B | 0.79 | 真实分布的自然基线(同库两次抽样的组间距离) |
| Swiss-Mammo vs A | 0.78 | 手写合成贴真实:差 0.01——‘minor decrease’ |
| Swiss-Mammo vs B | 0.76 | 换真实对照仍贴:差 0.03——稳健性检查 |
| C vs A | 0.59 | LLM 掉队第一证:差 0.20 |
| C vs B | 0.57 | LLM 掉队第二证:‘substantially lower’ |
| Swiss-Mammo vs C | 0.58 | 两种合成互斥:人写与 LLM 生成分属两簇 |
D.4 方法论边界(诚实清单)
- 单值无置信区间——28 份的均值对抽样波动敏感,0.03 的差距是否显著未检验
- 嵌入模型单点——gte-Qwen2 的语义空间定义了’像’,换模型(如 multilingual-e5)排序可能变
- 语义相似≠事实正确——‘左侧肿块 3cm’ 与 ‘右侧肿块 5cm’ 相似度极高但事实不同
- C 组生成配置不透明——prompt/模型版本/温度未知,0.58 是’通用直接生成’的读数而非 LLM 上限
- 语料规模不对等(21/28/210)——组内方差对均值的影响不一致
附录 E:JMIR 论文成绩全表转录
E.1 Table 2:IAA 三轮(Krippendorff α unitizing)
| 轮次 | facts α | anchors α | modifiers α | 标注 fact 类(n/n) | modifier 类 n |
|---|---|---|---|---|---|
| Round 1 | 0.49 | 0.42 | 0.50 | 24/— | 46 |
| Round 2 | 0.74 | 0.64 | 0.60 | 22/21 | 45 |
| Round 3 | 0.83 | 0.61 | 0.61 | 23/22 | 48 |
读法:facts 层收敛良好;anchors 第 3 轮回落(0.64→0.61);modifiers 三轮低位(0.50-0.61)——unitizing 任务的 IAA 天花板比分类任务低。对照库内 521 rad-coref(合并 α 0.79-0.87,Passonneau 加权)——任务类型决定 IAA 量级。
E.2 Table 3:领域再预训练的 perplexity
| 模型 | medBERT.de | InselBERT_multi | mammo_03 | mammo_10 |
|---|---|---|---|---|
| Perplexity | 1.21 | 1.12 | 1.11 | 1.09 |
E.3 Table 4:QA(SQuAD_v2,95% CI,599 resamples)
| 指标 | medBERT.de | InselBERT_multi | mammo_03 | mammo_10 |
|---|---|---|---|---|
| Exact match | 79.49 (75.77-83.3, SE 1.84) | 78.02 (74.25-81.70, SE 1.91) | 80.59 (77.33-83.99, SE 1.69) | 79.85 (76.33-83.41, SE 1.85) |
| Averaged F1 | 90.09 (87.89-92.46, SE 1.16) | 89.78 (87.53-92.01, SE 1.13) | 90.49 (88.36-92.47, SE 1.06) | 90.4 (88.28-92.53, SE 1.11) |
读法:四变体 CI 全重叠——再预训练对 QA 无显著增益(负结果)。摘要引用的 90.4% 实为 mammo_10 值与 mammo_03 的 90.49 之间取整。
E.4 Table 5:NER(9-fold CV,mean±SD)
| 指标 | medBERT.de | InselBERT_multi | mammo_03 | mammo_10 |
|---|---|---|---|---|
| Mean F1 | 0.81 (0.007) | 0.81 (0.007) | 0.81 (0.008) | 0.81 (0.001) |
| Mean recall | 0.81 (0.008) | 0.81 (0.01) | 0.82 (0.01) | 0.81 (0.007) |
| Mean precision | 0.82 (0.009) | 0.81 (0.007) | 0.81 (0.01) | 0.81 (0.009) |
| Mean accuracy | 0.82 (0.005) | 0.82 (0.006) | 0.82 (0.006) | 0.82 (0.005) |
E.5 定性管线评估(21 份前身报告,2 放射科医生)
| 项 | InselBERT 管线 | Llama 3.3 |
|---|---|---|
| facts 精度 | 197/205 = 96.1% | 91.4%(正文)/91.2%(摘要——漂移存照) |
| entities 精度 | 495/497 = 99.6% | 87.3% |
| 满分级类 | 10/14 fact types + 23/24 modifiers | — |
| 单报告耗时 | <20 秒(无 GPU) | 7 分钟(21 倍差) |
| 部署 | 3.68 GB Docker / 7.7 Gi RAM VM | GPU 推理 |
| 失败模式 | 否定句 3 span+‘No’ | 幻觉+schema 越界 |
E.6 Table 6:全部错分实例(原表转录)
| 错分文本 span | 误判为(n) | 正确类型 |
|---|---|---|
| “No retracted areas” | Foreign material described (1), Asymmetry described (3) | Additional result |
| “No evidence of malignancy” | Foreign material described (1), Recommendation for further examination (2) | Additional result |
| “Mamilla distance 54mm” | Mamilla region described (1) | Position (mamilla distance) |
| “No” | Dignity (2) | Negation |
读法:8 个错分实例 100% 与否定/数字上下文相关——'No’开头的 span 触发 anchor 误绑定;'54mm’的数值上下文干扰 region 判定。frame semantics 的 anchor 绑定机制对否定词敏感是可解释的失败(正因可解释,修复路径明确:negation-aware anchor 绑定)。
E.7 归一化(管线最弱环节)
| 术语系统 | 抽取概念总数 | plausible | 比例 |
|---|---|---|---|
| SNOMED-CT + Wingert | 3,582 | 2,303 | 64.29% |
附录 F:21→28 演化链考证(版本考古专论)
F.1 证据链五环
- v1.0.0 摘要:‘with three reports per category’(=21)——与 Methods ‘four examples per BI-RADS category’(=28)同页矛盾
- v1.0.1 变更声明:官方承认摘要错误并修正为 four
- JMIR 论文:‘a manually generated synthetic dataset of 21 reports’(2 放射科医生人工评估所用)——3×7=21
- 挂牌规模:28=4×7——比论文评估集多 7 份(每类 +1)
- 推断:21 份时代(论文评估)→ 扩容 28(挂牌)→ 摘要沿用旧表述 ‘three’ → v1.0.1 修正
F.2 演化的动因推断
为什么从 3/类扩到 4/类?可能:①每类 4 份让’留一法’评测(leave-one-out)成为可能(3 份 train+1 份 test per class);②28 比 21 多 33% 评测样本;③双乳不同类别的报告(取较高者)需要缓冲名额。论文与页面均未说明——存照为开放问题。
F.3 对使用者的操作结论
- 引用数字一律以 v1.0.1+文件实际 count 为准(28/4×7)
- 引用 v1.0.0 DOI(mrg5-ja22)的文献自带 ‘three’ 污染,二手引用需回溯
- 论文里的 21 份评估集与挂牌 28 份的差异(7 份新增)无公开说明——严格复现论文人工评估需注意评估集≠挂牌全集
附录 G:DAIMS 十维自评
| 维度 | 分 | 依据 |
|---|---|---|
| 可发现性 | 8 | PhysioNet 独立条目+Topics 标签+JMIR 互引;但 slug 与缩写需外部检索学习 |
| 可获取性 | 6 | Restricted DUA 门槛(低门槛但有);对纯合成数据而言偏保守 |
| 可读性(格式) | 9 | txt+CSV 双格式、命名规范、UTF-8、无压缩陷阱——全库格式最干净的条目之一 |
| 文档完备 | 8 | 页面精炼完整+论文全开放+相似度代码随发;缺独立 data dictionary(CSV 列自明) |
| 标注质量 | 7 | senior 审查+论文侧三轮 IAA 迭代;但数据集本体无逐份质检记录公开 |
| 伦理合规 | 10 | 零真实数据零伦理负担(页面自认)——本维度满分样本 |
| 规模 | 2 | 28 份全库最低——评测集定位下的及格线设计 |
| 可复现 | 9 | 相似度脚本+论文代码+模型+Docker 全公开——方法论全链路可复刻 |
| 社区治理 | 6 | 无版本路线图/无维护声明/单版本修正;低流量下社区反馈机制未受考验 |
| AI-Ready 度 | 8 | CSV 直接可用+BI-RADS 标签结构化+双语对齐;德语分词需自备 |
| 加权总分 | 7.6 | 伦理/可复现满分,规模单一维度拖分——'方法论满分、体量垫底’的典型形状 |
附录 H:与库内条目的系统对照
H.1 合成数据三分法(本条目方法论主线)
| 维度 | 527 Swiss-Mammo(人写虚构) | 526 ReXErr(LLM 变换) | 523 RaDialog(LLM 生成伪金标) |
|---|---|---|---|
| 合成方式 | resident 手写+senior 审查 | GPT-4o 向真实报告注入错误 | vicuna-13b zero-shot 生成 |
| 底料 | 零(凭临床经验虚构) | MIMIC-CXR 227,835 报告 | MIMIC-CXR 报告 |
| 规模 | 28 | 200k+ | 零披露(页面/论文均无) |
| 信任策略 | 相似度指纹 0.76-0.78+人工审查 | 83/17 人工抽检+错误类目可控 | 20 倍消融(QA F1 0.397 vs 0.018) |
| 访问档 | Restricted | Open ODbL | Credentialed |
| LLM 依赖 | 零(验证用嵌入模型) | GPT-4o+Llama 3.1 | vicuna-13b |
| 主要用途 | 评测基准 | 错误检测训练 | 对话微调 |
H.2 报告结构化赛道(语种与任务轴)
| 条目 | 语种 | 任务 | 表示法 | 规模 |
|---|---|---|---|---|
| 561 RadGraph | 英 | 实体+关系抽取 | 14 类实体/3 类关系 | 金标 800+推理 10,942 |
| 622 RadGraph2 | 英 | 时序变化抽取 | 12 类 CHAN 扩展 | 220,763 |
| 521 rad-coref | 英 | 共指消解 | 簇标注 | 金标 1,475 段 |
| 527 Swiss-Mammo | 德 | fact 抽取(QA+NER) | frame semantics(anchor+modifier) | 基准 28 |
H.3 IAA 方法论对照
| 条目 | 任务类型 | 一致性口径 | 量级 |
|---|---|---|---|
| 527(论文标注) | unitizing(切分+归类) | Krippendorff α | facts 0.49→0.83(三轮) |
| 521 rad-coref | 分类(共指标签) | Passonneau 加权 κ | 0.79-0.87(合并) |
| 522 RadGraph2 | 实体+关系标注 | κ | 0.79/0.87/0.80 |
| 524 RadVLM | 无人工标注 | — | LLM 自动化 |
H.4 算力光谱
| 条目 | 模型规模 | 训练硬件 | 部署 |
|---|---|---|---|
| 524 RadVLM | 7B(LLaVA-OneVision) | CSCS Alps 超算(Swiss AI Initiative) | GPU 集群 |
| 523 RaDialog | LLM 对话系统 | TUM 集群 | GPU |
| 527(论文管线) | 110M(BERT) | 单台 Apple M1 Max | 无 GPU VM 20 秒/报告 |
附录 I:引用模板
I.1 数据集(APA)
Reichenpfader, D., von Däniken, S., & Bonel, H. M. (2025). Swiss-Mammo: A physician-written, synthetic dataset of German mammography reports (version 1.0.1). PhysioNet. RRID:SCR_007345. https://doi.org/10.13026/95cy-rc09
I.2 配套论文(必须同引)
Reichenpfader, D., Knupp, J., von Däniken, S. U., Gaio, R., Dennstädt, F., Cereghetti, G. M., Sander, A., Hiltbrunner, H., Nairz, K., & Denecke, K. (2025). Enhancing Bidirectional Encoder Representations From Transformers (BERT) With Frame Semantics to Extract Clinically Relevant Information From German Mammography Reports: Algorithm Development and Validation. Journal of Medical Internet Research, 27, e68427. https://doi.org/10.2196/68427
I.3 BibTeX(数据集 v1.0.1)
@article{PhysioNet-swiss-mammo-1.0.1,
author = {Reichenpfader, Daniel and {von D\"aniken}, Sandro and Bonel, Harald Marcel},
title = {{Swiss-Mammo: A physician-written, synthetic dataset of German mammography reports}},
journal = {{PhysioNet}}, year = {2025}, month = apr,
note = {Version 1.0.1}, doi = {10.13026/95cy-rc09}}
注意:作者姓 von Däniken 的 ä 在 BibTeX 需转义 {"a};引用 v1.0.0 时 DOI 换 mrg5-ja22 但注意其摘要是含错旧版。
附录 J:分层读法指南(按身份选路径)
- 评测工程师(想测德文 IE):附录 C 文件索引 → §3.1 命名规范 → 直接 CSV 入手 → 按 BI-RADS 分层报告成绩;德文分词自备(spaCy de_core_news+医学缩写扩展)
- 方法论研究者(想学合成基准建设):§1.1 存在理由 → §4 相似度验证 → 附录 D 边界清单 → 复刻 ‘手写+指纹自证’ 模板
- frame semantics 实践者(想搭抽取管线):附录 E.1-E.2 标注与 IAA → §5.3 schema 演化 → Zenodo 代码 → 28 份做端到端试运行
- 数据集策展人(想理解版本治理):§2.3 时间线 → §9 版本考古 → 附录 F 演化链——'摘要残留错误如何被版本机制修复’的完整案例
- ** skeptical reviewer**(想挑战可信度):§8 批评视角 → 附录 D.4 方法论边界 → §12 缺口存照——所有’不能证明’已列全
附录 K:合成数据信任策略的三个流派(方法论专论)
医学合成数据的公信力问题:合成即’造假’的直觉质疑如何化解?本库三条目给出三种范式:
流派一:指纹自证(本条目)——用嵌入空间的可测量证据(手写合成 vs 真实 0.76-0.78,与真实基线 0.79 几乎持平;LLM 生成 0.58 断层)证明分布贴近,辅以医生审查+代码公开。适用:小规模评测基准。成本:一段脚本。弱点:语义相似≠事实正确,无 CI。
流派二:类目可控+抽检验收(526 ReXErr)——错误按 12 类设计、注入频率公式化可预测(Table 5 三重自洽),83/17 人工抽检给出不合理率上限。适用:大规模训练数据。成本:百级人工审查。弱点:类目频率由母集文本特征决定而非错误流行率(分布错位)。
流派三:下游效用证明(523 RaDialog)——不直接验证合成质量,用 20 倍消融(用 vs 不用伪金标:QA F1 0.397 vs 0.018)证明合成数据有下游价值。适用:伪金标任务。成本:一次消融实验。弱点:‘有用’不等于’正确’——模型可能学到伪金标的系统性偏置。
三流派可组合:本条目=指纹+审查;526=类目+抽检;若 523 加做相似度指纹、526 加做下游消融,信任链更完整。合成数据的信任不是一个开关,是一组可组合的证据。
附录 L:全库’小而美’条目对照
| 条目 | 规模 | 定位 | 流量 | 与本条的共性 |
|---|---|---|---|---|
| 527 Swiss-Mammo | 28 报告 | 德语 IE 基准+方法论示范 | 29/133(最低) | — |
| 561 RadGraph 金标 | 800 报告 | 结构化开山金标 | 中高 | 金标不怕小,怕不可信 |
| 521 rad-coref | 1,475 段 | 共指金标 | 39 | 低流量+高方法论密度 |
| 525 REFLACX | 3,052 读片 | 眼动过程数据 | 679 | 小而特(过程数据首例) |
共性规律:小体量条目的生存逻辑是’不可替代性’而非’规模’——金标质量(561/521)、独特维度(525 眼动)、语种+方法双稀缺(本条)。评测基准的竞争维度是可信度密度,不是行数。
附录 M:使用前检查清单(10 项)
- ☐ 确认用途匹配:评测基准(✓)/训练集(✗)
- ☐ 引用双份:PhysioNet v1.0.1(95cy-rc09)+JMIR e68427
- ☐ 数字口径:28=4×7(勿用 v1.0.0 摘要的 three)
- ☐ 语言选择:德文主用,英译仅参考(无语言学验证)
- ☐ 编码:UTF-8 显式指定(ä/ö/ü)
- ☐ 分层理解:每类 4 份是评测设计非流行率
- ☐ BI-RADS 归档:双乳取高侧——跨类统计注意
- ☐ 合成性质声明:引用时注明 physician-written synthetic(勿写成 AI-generated)
- ☐ 相似度引用:0.76-0.78 手写合成 / 0.58 ChatGPT 对照——勿混为’与真实相同’(基线 0.79)
- ☐ 论文数字:Llama 3.3 facts 用正文 91.4%(勿引摘要 91.2%)
附录 N:快问快答(一页纸)
| 问 | 答 |
|---|---|
| 几份报告? | 28(4×BI-RADS 0-6)+28 英译 |
| 谁写的? | 放射科 resident 手写+senior 审查;无生成式 AI |
| 为什么小? | 评测基准;前身 21 份(论文评估集) |
| 为什么合成? | 210 份真实语料被机构禁发 |
| 可信吗? | 相似度 0.76-0.78 vs 真实基线 0.79(ChatGPT 仅 0.58) |
| 什么许可? | Restricted License 1.5.0+DUA(注册+签约,无 CITI) |
| 什么语言? | 德文+英译(德文为主) |
| 论文在哪? | JMIR 2025;27:e68427,DOI 10.2196/68427 |
| 论文成绩? | QA F1 90.49%/NER 0.81/精度 96.1%+99.6% |
| Llama 3.3 呢? | 91.4%/87.3%,7 分钟/报告(21 倍慢) |
| 训练用什么硬件? | 单台 Apple M1 Max |
| 部署要 GPU 吗? | 不要——3.68 GB Docker,7.7 Gi RAM |
| 最弱环节? | SNOMED-CT 归一化 64.29% |
| 主要错误模式? | 否定句('No’开头的 span) |
| 版本坑? | v1.0.0 摘要 three→v1.0.1 修正 four |
| 流量? | 29/133——全库最低 |
| 与 526 什么关系? | 合成光谱两极:手写 28 份/Restricted vs LLM 注错 200k+/Open |
| 一句话 | 用 28 份手写报告讲透’真实数据锁死后合成基准怎么建’ |
附录 O:28 份报告的规格矩阵(BI-RADS 分层账本)
按命名规范重建的完整规格(ID 连续 001-028;每类 4 份;本表为规范推导的账本——具体每份的双乳类别细节需下载后按文本核对):
| BI-RADS | 临床含义 | 席位 | 文件 ID 段 | 双语文件数 |
| 0 | 需补充评估(回看/追加摄影) | 4 | BR0 系列 | 8 |
| 1 | 阴性(对称、无异常) | 4 | BR1 系列 | 8 |
| 2 | 良性发现(描述性) | 4 | BR2 系列 | 8 |
| 3 | 可能良性(短期随访) | 4 | BR3 系列 | 8 |
| 4 | 可疑异常(活检考虑) | 4 | BR4 系列 | 8 |
| 5 | 高度提示恶性 | 4 | BR5 系列 | 8 |
| 6 | 活检证实恶性 | 4 | BR6 系列 | 8 |
| 合计 | — | 28 | 七段 | 56 |
读法与用途:
- 评测时按行分组报告成绩——每类 4 份意味着单类成绩的最小波动单位是 25%(1/4),单类置信区间极宽,谨慎解读
- 跨类对比(如 BI-RADS 1 vs 4 的抽取难度差)是本数据集的招牌用法——均衡设计使对比不被类别失衡污染
- 双乳异类报告按高类别归档——BR4 席位里可能藏着"左 4 右 2"的混合样本,严格单侧分析需回原文
- BI-RADS 6(活检证实)的 4 份是全库罕见的"确诊恶性"评测样本——多数筛查语料里 6 类占比 <1%,这里每类均权
附录 P:德文医学 NLP 工具链上手指南
Swiss-Mammo 是德文语料,使用前的工具准备清单(对照英语管线的额外步骤):
P.1 分词与句法
| 工具 | 用途 | 备注 |
|---|---|---|
| spaCy de_core_news_lg | 德文分词/POS/依赖 | 本条目论文同款(spaCy+自有缩写表);医学文本建议加缩写扩展 |
| SoMaJo | 临床文本分句 | 德文临床分句的专用强项(缩写歧义处理) |
| GermaNet | 德语词汇语义网络 | 英语 WordNet 的德语对应——语义扩展用 |
P.2 嵌入与表示
| 模型 | 维度 | 说明 |
|---|---|---|
| gte-Qwen2-1.5B-instruct | 多语 | 本条目相似度验证同款——直接复用其结果口径 |
| medBERT.de | 110M | 论文基座——470 万德语医学文档预训练,医学领域首选 |
| German BERT (dbmdz) | 110M | 通用德语备选 |
| multilingual-e5 | 多语 | 嵌入模型更换时的对照基准(附录 D.4 边界 2) |
P.3 术语资源
| 资源 | 角色 |
|---|---|
| SNOMED-CT 德语版 | 归一化目标之一(论文口径 64.29% plausible) |
| Wingert terminology | 德语医学术语系统——论文建议约束 subtype 关系提升归一化 |
| ICD-10-GM | 德国修改版 ICD——诊断编码的本地化标准 |
| OPS | 德国手术操作编码(乳腺活检/手术报告会涉及) |
P.4 编码与文本处理红旗
- UTF-8 显式声明(ä/ö/ü/ß 静默损坏风险——Technical Notes 原话提醒)
- 德文复合词(Brustkrebsfrüherkennung 类)不拆分——分词器处理复合名词时保留原形
- 缩写歧义(“MA” 可指 Mamma-Carcinom 等多义)——论文用自有缩写表解歧,复刻者需自建
- 数值格式(德式小数逗号 “4,3 cm” vs 英式 “4.3 cm”)——本条目双语对是现成的格式对照教材
附录 Q:前瞻对照——528 TN-Mammo 与乳腺影像家族开篇
批次八的乳腺影像双子(527 文本+528 图像)构成家族开篇,预期对照:
| 维度 | 527 Swiss-Mammo(本条) | 528 TN-Mammo(下一发) |
|---|---|---|
| 模态 | 纯文本报告(双语) | 多视图乳腺 X 线图像 |
| 规模 | 28 份 | 待核(三阴乳腺癌数据集——临床子群聚焦) |
| 合成性 | 100% 手写虚构 | 真实图像(预期) |
| 访问档 | Restricted | Restricted(批次预判) |
| 语种 | 德+英 | 待核(预期英) |
| 侧重点 | 报告结构化评测 | 影像分类/检测 |
| 家族角色 | “报告怎么说” | “图像长什么样” |
联动伏笔:本条的 BI-RADS 分层账本(附录 O)与 528 的病理标签(三阴/非三阴)在乳腺影像工作流上互补——影像模型出 BI-RADS 级别预测,文本模型抽取报告结构化字段,两者在真实乳腺中心的 AI 辅助流水线上汇合。本库乳腺影像家族(本条+528)与既有胸片家族(616-625+526)形成"两腺并行"的批次八格局。
附录 R:检索词与引用对照表(研究者的查找指南)
R.1 多版本引用对照
| 你要引用 | DOI | 注意 |
|---|---|---|
| 数据集 v1.0.0(历史版) | 10.13026/mrg5-ja22 | 摘要含 three 错误(21 份时代残留) |
| 数据集 v1.0.1(修正版,推荐) | 10.13026/95cy-rc09 | four=28=4×7 正确口径 |
| 数据集 latest(浮动) | 10.13026/gqzb-fg27 | 未来版本会变 |
| JMIR 论文 | 10.2196/68427 | PMID 40279645 / PMCID PMC12064967 |
| RadEx 框架 | arXiv(2024-06-14) | 方法论母体 |
| Steinkamp 2019 | 10.1007/s10278-019-00234-y | fact 信息模型首作 |
| gte-Qwen2 | arXiv 2308.03281 | 相似度验证嵌入模型 |
| PhysioNet 平台 | 10.1038/s44360-026-00096-z | 平台统一引用(Nature Health 2026) |
R.2 检索词表(按意图)
| 意图 | 推荐检索词 |
|---|---|
| 找本条目 | swiss-mammo / Swiss-Mammo PhysioNet / German mammography dataset |
| 找论文 | Reichenpfader frame semantics / JMIR e68427 / BERT mammography German |
| 找同类德语资源 | medBERT.de / German clinical NLP / deutscher radiologiebericht datensatz |
| 找合成基准方法论 | synthetic benchmark validation / cosine similarity dataset / physician-written synthetic |
| 找 frame semantics | Steinkamp fact extraction / Fillmore frame semantics clinical / anchor modifier radiology |
| 找乳腺报告结构化 | BI-RADS extraction / mammography report NLP / structured reporting breast |
R.3 二手引用污染排查
引用本条目时警惕三种二手污染:①引 v1.0.0 摘要的 “three reports”(正确 4);②引摘要的 Llama 91.2%(正文 91.4);③把 dataset C(ChatGPT 对照)当论文评估集(两者都叫 21 份但属性不同)。本条目 §9/附录 F 已存照——二手文献出现这三个数字时回溯一手源。
附录 S:核查方法存照(本条目怎么核的)
- 版本探测:latest/1.0/1.0.0/1.0.1 四 URL 探测——1.0.0 与 1.0.1 双 200(其余 404),发现双版本格局
- 页面双抓:v1.0.0(46,390 B)与 v1.0.1(17,621 字符文本)全解析对比——锁定 three→four 变更声明
- 论文三路:JMIR 官网 403(反爬)→ PMC JS 壳 21 KB 无正文 → eutils efetch XML 152 KB 全文到手——PMC efetch 是 JMIR 全文的稳定通道(方法论存照)
- WebSearch 交叉:JMIR 官网摘要/Google Scholar/OpenAIRE 三源互证(作者 10 人名单、时间线、F1 数字)
- 数字自洽:28=4×7(与 v1.0.1 修正互证);2,519 vs 2,772 两口径定位(schema 实例 vs NER 转换);96.1%=197/205、99.6%=495/497(精确复算 ✓);64.29%=2,303/3,582(✓)
- 库内联动:521/522/524/525/526 的 FACTS 交叉引用——IAA 口径、算力光谱、合成三分法
附录 T:批次八衔接说明(本条目在批次账本中的位置)
批次八(order 526-535)是"PhysioNet 放射收尾五连 + Grand Challenge 挑战赛开篇五连"的双段结构。本条目(527)的位置与承重:
| 位置 | 条目 | 状态 |
|---|---|---|
| 526 | ReXErr-v1(LLM 注错 200k+/ODbL) | 并行会话在产(本会话让出,FACTS+part1 资产已让渡) |
| 527 | Swiss-Mammo(本条目) | 本会话生产 |
| 528 | TN-Mammo(三阴乳腺癌多视图图像) | 待产——乳腺双子下一发 |
| 529 | VinDr-PCXR(儿童胸片) | 待产 |
| 530 | VinDr-SpineXR(脊柱 X 光) | 待产 |
| 531-535 | Grand Challenge 挑战赛五连 | 待产 |
本条目的三条批次级贡献:
- 合成数据光谱的双极闭合(与 526 相邻):人写虚构(28/Restricted)↔ LLM 注错(200k+/Open)——"synthetic"的语义边界在相邻两条内全部划定
- 乳腺影像家族开篇:本条管文本(BI-RADS 分层账本),528 管图像(三阴亚型)——附录 Q 已埋联动伏笔
- 批次八首个 Restricted 档:继批次七的 Credentialed 四连(512/522/523/524)后,Restricted 档预判命中(swiss-mammo 页面 Access Policy 在开工前即从批次清单标注转入核查确认)
协调机制存照:本会话开工前检测到并行会话接手 526(.build526 full.md 加厚中),当即让出并在批次 8 工单(rXhZzd)留协调评论(cmt_ad29be3)——521 双发事故的教训(查重-发布紧邻+错位生产)在批次八开篇即落地执行。
附录 U:事实清单补遗(核查补充批,8 条)
- JMIR 论文页脚版权行确认 CC-BY 4.0 开放获取——论文全文可自由转载(PMC 镜像合法)。
- 论文 Multimedia Appendix 2-7 齐备(标注界面截图/示例/统计细节/管线图/Llama 实现细节)——JMIR 补充材料体系完整。
- 论文 ref 29 RadEx preprint 的 arXiv 编号在 PMC 转录中缺失(仅 “arXiv Preprint posted online June 14 2024”)——严格引用需检索 arXiv 站内(存照)。
- 数据集页面无 “Files” 明细表(地区限制下 Files 区显示受限说明)——文件清单以页面 Data Description 文字+命名规范重建(附录 C)。
- v1.0.1 页面的相似度表与 v1.0.0 完全一致(0.78/0.76/0.58 矩阵未变)——变更仅限摘要与引用(附录 F 旁证)。
- 论文 “two radiologists”(定性评估)与数据集 “a senior radiologist”(审查)的关系未说明——评估者是否含 Bonel 未实锤(存照)。
- SwissMammo.csv 的分隔符/引号规范未在页面说明(默认 CSV 约定)——德文引号「」与逗号小数的转义需实测(下载后验证项)。
- 本条目核查快照:/tmp/527_page.txt(v1.0.0)、/tmp/527_page_101.txt(v1.0.1)、/tmp/527_pmc.txt(PMC XML 全文 77,028 字符)——快照留存供复查。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- cxr-pro — 共享标签:医疗NLP / 临床文本 / 医学影像
- chexpert-plus — 共享标签:医疗NLP / 临床文本 / 医学影像
- mimic-iv-ext-pe — 共享标签:医疗NLP / 临床文本
- rad-coreference-resolution — 共享标签:医疗NLP / 临床文本
- radgraph2-radiology-reports — 共享标签:医疗NLP / 临床文本
- imcs-21 — 共享标签:医疗NLP / 临床文本
- vqa-rad — 共享标签:医疗NLP / 医学影像
- pmc-oa-subset — 共享标签:医疗NLP / 临床文本
- pharmaconer — 共享标签:医疗NLP / 临床文本
- lunguage — 共享标签:医疗NLP / 临床文本
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

