信息速览

INFOBOX:tn-mammo-breast-density 速览
| 字段 | 值 |
|---|---|
| 数据集 | TN-Mammo(内部名 TNMammo)v1.0.0 |
| slug | tn-mammo-breast-density(批次登记 ‘TN’ 为截断简称;TN = Thong Nhat Hospital,不是 triple negative) |
| 发布 | 2025-10-04(v1.0.0 单版本;1.0.1/latest 均 404) |
| DOI | v1.0.0 = 10.13026/1kx0-xc60 / latest = 10.13026/34kz-bk76(双 DOI) |
| 访问 | Restricted(Restricted License 1.5.0 + Restricted DUA,注册+签约,无 CITI——批次预判命中) |
| 规模 | 676 例 × 4 视图 = 2,704 张 JPEG(推算);年龄 18-91 岁 |
| 标签 | BI-RADS 乳腺密度 A-D 四级(双放射科医生双盲独立+科主任共识裁决);CSV 三列 ID/Labels/Age |
| 采集 | Thong Nhat Hospital(胡志明市)PACS,2022-01~2024-06,convenience sampling;排除既往癌/手术/妊娠/质量缺陷 |
| 格式 | DICOM→JPEG 转换(保真依据 Trieu 2023 Acad Radiol)——开源友好折中 |
| 代码 | github.com/LeHongCat/TNMammo(ResNet50+多视图融合+5-fold CV+CLAHE 管线;支持 DDSM/VinDr/ThongNhat 三库配置) |
| 团队 | 10 人三国:VNU-HCM 4 + Tan Tao 3 + Thong Nhat 1 + 韩国 Chung-Ang 1;Ha-Hieu Pham 为 VinDr 系桥接;AISIA Research Lab 支持 |
| 伦理 | Thong Nhat Hospital Ethics Committee No. 43/2024/CN-BVTN-HDDD(2024-03-04)——医院级伦理批件 |
| 论文 | 无期刊论文(PhysioNet+GitHub 双资产;引用块注释占位;第三方描述论文 2025-12 抢注见 §10) |
| 流量 | Views 277(单版本)——中低流量 |
| 一句话 | 越南统一医院的 676 例轻量密度库——"小而专"的种群补充,BI-RADS 密度轴的图像侧落地 |
§0 摘要卡:TN 的三义与一库的轻量野心
§0.1 它是什么
TN-Mammo 是胡志明市 Thong Nhat Hospital(统一医院,TN 的来源) 2022-2024 年采集的乳腺钼靶数据集:676 例受检者、每例标准四视图(左右乳 × 头尾位 CC/内外斜位 MLO,推算 2,704 张 JPEG)、BI-RADS 乳腺密度 A-D 四级标签——由两名放射科医生双盲独立评估、分歧经科主任会诊共识裁决。年龄跨度 18-91 岁,CSV 三列(ID/Labels/Age)。它由 VNU-HCM 计算机系主任 Binh Nguyen 领衔的 10 人团队(含 Tan Tao 医学院+IT 学院、数据医院医生、韩国中央大学合著者、VinDr 系的 Ha-Hieu Pham)发布,ResNet50 五折交叉验证与 CLAHE 预处理管线全开源。定位是"小而专"的种群补充型密度分类库——不与 VinDr-Mammo(同国 20,000 例检测大库)比规模,专补"多视图完整+双盲标注+东南亚种群"三个既有库的短板。
§0.2 三个数字
- 676×4=2,704:例数×视图数(总图数为推算——页面未直说,这是本条披露习惯的第一格)
- A-D:BI-RADS 密度四级(ACR 五版体系)——密度既是癌症独立风险因子又是病灶遮蔽因子(致密腺体降低钼靶敏感性),一标签双临床意义
- 18-91:年龄跨度(Labels CSV 的 Age 列)——注意与第三方论文声称的"42-74"硬冲突(§10 二手污染红线)
§0.3 它怎么用
三类用法:①密度分类模型训练/评测——四视图多路输入(GitHub 的多视图融合架构可直接复用);②跨库泛化对照——代码原生支持 DDSM/VinDr/ThongNhat 三库配置,测种群迁移;③低资源地区筛查 AI 的公平性研究——东南亚种群的设备分布与腺体密度分布与欧美库的差异本身就是研究问题。不适合:病灶检测(无框标签)、多模态融合(单模态)、大规模预训练(676 例太小)。
§0.4 联动提示
本条与 527 例太小)。
§0.4 联动提示
本条与 527 Swiss-Mammo 构成乳腺双子:527 管报告文本的 BI-RADS 0-6 评估类别(合成/德语),528 管影像的 BI-RADS A-D 密度分级(真实/越南)——BI-RADS 体系的两个轴(评估类别 vs 密度分型)在相邻两条分别落地。与 529 VinDr-PCXR/530 VinDr-SpineXR 构成越南三连:Ha-Hieu Pham 从本条作者变为后两条的 VinDr 主创——批次八内部的越南医学 AI 版图连续性。TN 的三义辨析(Thong Nhat ≠ triple negative ≠ Thanh Nguyen)是本条目的版本考古头条。
§0.5 三个反直觉
反直觉一:最小的"金标"配最大的保密。676 例轻量库挂 Restricted(注册+DUA),而同批的 526 ReXErr(20 万份合成错误报告)全开放——但这次的 Restricted 有实质风险依据(真实医学影像+年龄字段的再识别可能),与 527 Swiss-Mammo(纯虚构文本仍 Restricted)的过度保守形成光谱第三格:同为 Restricted,风险本体完全不同。访问档的判断要回归数据本体,不能看档位猜风险。
反直觉二:流程最重的库恰恰没有一致性数字。双盲双评+科主任裁决的三步流程是标注协议的"重装配置",但 IAA(κ/α)零披露——流程的仪式感与量化的缺席并存。对照 561 RadGraph(κ 0.80+)、621(α 0.79-0.87)的"流程+数字"双披露,本条是"流程披露完整、量化验证缺席"的银标形态。教训:信任需要可审计的数字,仪式本身不是证据。
反直觉三:数据集还没发论文,别人的论文先发了。官方论文未产(GitHub Citation 块注释占位),Cairo Journal 的 7 位第三方作者却抢先发表了"描述论文"——还把年龄写错(42-74 vs 官方 18-91)、把 TN 展开错(Thanh Nguyen vs Thong Nhat)。学术描述权真空的代价实录:你不描述自己的数据集,别人会替你描述——而且可能描述错。
§0.6 它在库内的独特性自检
- 唯一乳腺钼靶影像条目(本库乳腺家族影像侧首例——527 是文本侧)
- 唯一"双盲+共识裁决"标注协议条目(对照 VinDr 的多医生仲裁、561 的标注员团队)
- 唯一医院级伦理批件在案条目(Thong Nhat Ethics Committee 43/2024/CN-BVTN-HDDD——对照 MIMIC 系的美国大学 IRB)
- 唯一"第三方论文抢注"案例条目(学术治理的灰色地带存照)
- 唯一 DICOM→JPEG 折中决策明文化的影像库(格式选择即用户声明)
§0.7 数字速记(写作引用速查)
| 数字 | 含义 | 状态 |
|---|---|---|
| 676 | 例数(subjects) | 页面明文 ✓ |
| 4 | 每例视图数(CC/MLO × 左右) | 页面明文 ✓ |
| 2,704 | 总图数(676×4) | 推算(页面未直说) |
| 18-91 | 年龄跨度(岁) | CSV 明文 ✓ |
| A-D | 密度四级 | 页面明文 ✓ |
| 2 | 双盲评估医生数 | 页面明文 ✓ |
| 10 | 作者人数(三国) | 页面署名 ✓ |
| 5 | GitHub 交叉验证折数 | README 明文 ✓ |
| 43/2024 | 伦理批件编号 | 页面 Ethics ✓ |
| 277 | Project Views | 页面快照 ✓ |
| 18 个月 | 采集窗口(2022-01~2024-06) | 页面 Methods ✓ |
(未披露数字提醒:IAA、baseline 精度、A-D 分布、设备信息——四个缺口见 §12。)
§1 条目定位:轻量库的生存逻辑
§1.1 为什么是 676 例
乳腺公开库的规模谱系:MIAS(1994)322 图 → DDSM(1997)~10,000 图 → INbreast(2012)410 图 → OPTIMAM/CSAW(2020)百万级 → VinDr-Mammo(2023)20,000 例 → NYU BCSD(2019)百万级。TN-Mammo 的 676 例在谱系里是"轻量端"——但它竞争的不是规模,是组合稀缺性:多视图完整(四联标准位)+双盲双评(而非单评或自动)+东南亚种群(欧美主导的领域里的人口多样性)+完整标注流程披露。页面 Known Limitations 第一条就自认规模天花板——“With only 676 exams, the dataset may limit the performance of deep learning models that require large-scale data”。它的用法是评测与微调,不是从头预训练。
§1.2 密度为什么值得单独立库
乳腺密度(纤维腺体组织占比)的双重临床身份是本条目的立库逻辑:①独立风险因子——致密型(C/D)人群乳腺癌风险显著升高;②遮蔽因子——致密腺体在钼靶上与肿瘤同灰阶,“the sensitivity of mammography is also significantly reduced in patients with dense breast tissue”(页面 Background 引 Kolb 2002 的 22,825 例筛查证据)。密度分类因此既是风险分层工具又是影像质控指标——密度标签是乳腺 AI 流水线的前置环节(先判密度再定解读策略)。现有库要么密度标签缺失要么非双盲——本条的密度专注定位由此成立。
§1.3 DICOM→JPEG 的折中决策
原始 DICOM 转最小压缩 JPEG 发布(页面引 Trieu 2023 Acad Radiol 的放射科培训研究佐证保真)——“JPEG files are lighter while still preserving image quality … reduces storage and computational requirements”。这是开源友好与像素保真的折中:对照组 VinDr-Mammo 发布 DICOM 原件(专业保真、下载巨大),本条发布 JPEG(轻量、即用)。代价是像素级研究(噪声分析、伪影检测)不可做;收益是低带宽地区(数据集的目标社区)的可用性。数据集的格式选择本身就是它的目标用户声明。
§2 团队:三国十人与越南 AI 生态
§2.1 十人名单的结构
一作 Binh Nguyen 是 VNU-HCM(越南国家大学胡志明市分校)University of Science 计算机系主任——学术资历高配的数据集条目。团队四股势力:VNU-HCM 计算机系 4 人(算法侧)+ Tan Tao University 3 人(医学院 Loc Vu 提供放射科专业、IT 学院 2 人提供工程)+ Thong Nhat Hospital 1 人(Thuan Huynh,院内医生——采集接口)+ 韩国 Chung-Ang University 1 人(Byung-Woo Hong,图像处理)。医学院+计算机系+医院的三方组合是临床数据集的标准编队,韩国合著者的加入暗示方法学(图像处理/CLAHE 类)的国际协作。
§2.2 Ha-Hieu Pham:VinDr 网络的桥接
共同作者 Ha-Hieu Pham 是越南医学 AI 的关键节点人物——VinDr-Mammo(本库 529 的姐妹库)、VinDr-PCXR(529)、VinDr-SpineXR(530)等 VinDr 系列的核心成员。他的在列意味着本条目与 VinDr 生态共享方法学网络(AISIA Research Lab 的支持致谢同证)。批次八的 528-530 三连因此有人物连续性:越南医学 AI 的两条产品线(医院自主采集 vs VinDr 联盟大库)在同一批人物网络里并行。
§2.3 AISIA 与越南生态
致谢点名 AISIA Research Lab(VNU-HCM 的 AI 实验室)——越南医学 AI 的主力孵化器,VinDr 系列的实验基地。本条目的"越南自主采集"叙事由此完整:不依赖海外联盟,本地医院(Thong Nhat)+本地高校(VNU-HCM/Tan Tao)+本地实验室(AISIA)的全本地生产链,仅韩国一国国际协作——对照 MIMIC 体系的美欧跨国网络、VinDr 的越南-日本(Fujitsu)合作,这是第三种主权模式。
§3 数据解剖:目录树与三列 CSV
§3.1 发布物结构
datasets/TNMammo/
├── images/
│ └── [encrypted ID]/
│ ├── left_cc.jpg
│ ├── left_mlo.jpg
│ ├── right_cc.jpg
│ └── right_mlo.jpg (676 目录 × 4 文件)
└── TNMammo_labels.csv (676 行 × 3 列:ID/Labels/Age)
页面明文的项目目录就这两件(annotation files + images 子文件夹)——无 data dictionary、无设备元数据、无 DICOM 头信息保留(JPEG 转换的代价)。CSV 三列里 Age 是唯一人口学变量——无种族/家族史/筛查轮次等扩展字段(对照 VinDr-Mammo 的多列元数据)。最小化发布是刻意选择还是工力未逮,页面未说明。
§3.2 四视图的临床语义
每例四联标准位是乳腺筛查的完整采集协议:**CC(头尾位)**提供乳腺中央与内侧的俯视投影、**MLO(内外斜位)**额外覆盖外上象限(癌发最高区域)与腋尾——双乳双位合计四图才能覆盖乳腺全域。多视图融合(本条 GitHub 的卖点之一)因此不是锦上添花而是临床必选:单视图漏诊率与双视图+多视图存在结构性差异(页面引用 TwoViewDensityNet 等双视图工作为前作)。数据集的"Multi-view Dataset"自我命名强调的正是这个完整性——对照单视图历史库(部分 MIAS/DDSM 子集)的先天残缺。
§3.3 密度四级的 ACR 体系
BI-RADS 密度分型(ACR 五版):A = 几乎全脂肪(breast is almost entirely fat)、B = 散在纤维腺体(scattered fibroglandular densities)、C = 不均匀致密(heterogeneously dense,可遮蔽小病灶)、D = 极致密(extremely dense,遮蔽风险最高)。四级由两名放射科医生按同一 ACR 标准双盲评估——注意密度分型与 BI-RADS 评估类别(527 的 0-6)是两个正交轴:前者描述组织构成(风险与遮蔽),后者描述发现与处置建议。527/528 相邻两条正好把两个轴各做一端。
§3.4 采集协议与排除标准
- 窗口:2022-01 ~ 2024-06(18 个月)
- 来源:Thong Nhat Hospital 乳腺筛查人群(筛查性而非诊断性偏倚——健康人群密度分布为主)
- 抽样:convenience sampling(页面 Methods 自认)——便利抽样的选择偏差无量化讨论(Limitations 第四条间接承认单源问题)
- 排除:既往乳腺癌史、乳腺手术史、妊娠期、图像质量缺陷(运动/技术误差)——四类排除保证"健康筛查人群+可用图像"的数据卫生
- 设备:未披露(PACS 下载但设备型号/分辨率/压缩参数全缺)——复现研究的设备方差盲区
§4 标注协议:双盲+共识的流程与它的数字缺席
§4.1 流程三步
①两名放射科医生双盲独立评估每例的密度与朝向(double-blind——互不见对方的结论);②分歧通过科主任会诊裁决;③共识结果作为发布标签(“consensus results were used to train the model”)。这个三步流程是乳腺密度标注的教科书配置——对照 VinDr-Mammo 的"3 放射科医生 majority vote"、CSAW 的单人筛查reader、DDSM 的病理金标:双盲+第三方裁决在流程强度上位居中上。
§4.2 但是——IAA 数字零披露
流程的强度无法替代量化的验证:两名医生的双盲一致性(κ 或 agreement rate)页面与 GitHub 均未给出。这造成一个信任评估的空窗:读者知道流程严谨(双盲+裁决),但不知道两位医生实际分歧多大——密度分型的观察者间变异在文献中本就显著(ACR 四级的判读分歧率有研究报 10-20% 区间),无 IAA 的密度标签只能"信任流程"。对照本库 561 RadGraph(κ 0.80+)、621 rad-coref(α 0.79-0.87)、622 RadGraph2(0.9963 待证)的全披露——本条是"流程披露完整、量化验证缺席"的典型形态。写作与复现红线:不得将"双盲"转述为"高一致性"——两回事。
§4.3 orientation 标签的声称-发布缺口
页面 Abstract 与 Methods 声称标注了 “breast density and orientation”——朝向标记(图像左右方位的机器可读标注,预处理辅助)——但发布的 TNMammo_labels.csv 只有 ID/Labels/Age 三列,orientation 无处存放(可能在图像文件名隐含或根本未随发布)。这是本条第二个"声称-发布"缺口(第一个是 Technical Validation 节,§6)。使用前须自行从图像像素判断方位或按文件名约定处理。
§4.4 朝向标签的用途推断(为什么会有它)
orientation(图像朝向)虽未随 CSV 发布,但它在采集侧的存在可以推断:乳腺钼靶的左右/方位错标是临床质控的经典问题(患者体位标记错误的文献报告率约 0.5-2%),双盲标注朝向的最直接用途是方位质控(确保 left_cc 真的是左乳头尾位)——这也是 DICOM→JPEG 转换后丢失的 DICOM 头信息(Laterality/ImageOrientation)的补救层。发布侧的缺失让质控层不可审计——使用者拿到的是"据信方位正确"的图像。若需严格验证,可训练方位分类器自查(乳腺致密体的镜像不对称性可学)。
§5 GitHub 代码栈与基线实验的数字缺席
§5.1 代码资产清单
github.com/LeHongCat/TNMammo(LeHongCat = 共同作者 Cat Le 的账号):
| 资产 | 内容 |
|---|---|
| train.py / train_all_folds.py | 单折/全折训练(–num_folds 5 五折交叉验证) |
| train_better.py | 增强训练脚本(进阶配置) |
| evaluate.py | 评估入口 |
| models.py | ResNet50(ImageNet 预训练)骨干+多视图特征提取/融合+FC 密度头 |
| preprocessing.ipynb | 预处理管线:乳腺区域裁剪→归一化→CLAHE 增强→resize |
| ThongNhat_config.yml | 配置(数据/模型/超参/优化/增广) |
| environment.yml / requirements.txt | 环境复现 |
| ex_mammo.png | 示例图 |
§5.2 跨库设计的伏笔
配置文件体系支持 DDSM / VinDr / ThongNhat 三库(README Features 明文)——同一条管线跑三个库的对照实验是代码架构的预置能力。这暗示团队的实验设计包含跨库泛化对照(越南库 vs 美国库 vs 同国大库的性能迁移)——但实验结果数字全库无公开。
§5.3 Technical Validation 节的承诺缺席(页面瑕疵存照)
页面 Methods 原话:“We have performed some existing experiments on this dataset. In addition, we have performed some normalization techniques. The technical validation of this dataset, described further below, serves as proof of the dataset’s quality.”——然而正文直到 Release Notes/Ethics/Acknowledgements 都没有 Technical Validation 节。承诺的验证内容(“described further below”)实际缺席——baseline 精度、A-D 分布统计、质量检查数字全部无处可寻。这是 PhysioNet 页面的写作事故(对照 527 的 three/four 摘要残留——两个相邻条目各带一处页面瑕疵,批次八的"页面考古"主线)。使用者的处境:只能自己跑 GitHub 代码生成 baseline(环境与配置齐全,复现门槛低)。
§6 越南语境:流行病学动因与种群补位
§6.1 GLOBOCAN 2022 的越南数字
页面 Background 引用的越南流行病学:2022 年新发 24,563 例(越南 33 类癌中第二,仅次于肺癌——占全球女性新发 2,308,897 例的约 1.06%)、死亡 10,008 例(第四)。全球口径:乳腺癌占女性新发 11.6%、死亡 665,684 例(第四)。发展中国家叙事:“patients often pay little attention to proactively examining symptoms of early-stage breast cancer”——晚发现→晚治疗→低生存率,早筛基础设施(含 AI 辅助)的需求由此成立。
§6.2 30 年乳腺库谱系中的位置
页面 Figure 1+References 综述的谱系:MIAS(1994,英国,322 图,胶片数字化)→ DDSM(1997,美国,~2,620 studies/10,000 图,胶片)→ INbreast(2012,葡萄牙,115 例/410 图,首个 FFDM 公开库)→ OPTIMAM(2020,英国,大规模+临床数据)→ CSAW(2020,瑞典,百万级筛查队列)→ NYU BCSD(2019,美国,百万级)→ VinDr-Mammo(2023,越南,20,000 例 FFDM)→ TN-Mammo(2025,越南,676 例)。谱系趋势:胶片→数字、单视图→多视图、小库→大库、单国→多国种群。本条的卡位:多视图完整+双盲标注+东南亚种群的轻量精品(与同国大库 VinDr-Mammo 的规模路线错位)。
§6.3 与 VinDr-Mammo 的同国双库对照
| 维度 | TN-Mammo(本条) | VinDr-Mammo(同国前作) |
|---|---|---|
| 规模 | 676 例/2,704 图 | 20,000 例/80,000 图 |
| 任务 | 密度 A-D 单任务 | 病灶检测+密度+BIRADS 类别多任务 |
| 标注 | 双盲+科主任共识 | 多医生+仲裁 |
| 来源 | 单医院(Thong Nhat) | 多医院联盟(VinDr 网络) |
| 格式 | JPEG | DICOM |
| 设备多样性 | 单源 | 多源 |
| 人物桥接 | Ha-Hieu Pham 共同作者 | 同一 VinDr 网络 |
两库互补而非竞争:本条是轻量评测+单源深度(同一设备的密度分布内省),VinDr 是大规模训练+多源泛化。跨库实验(GitHub 预置三库配置)可以把两库串成"越南乳腺 AI"的完整评测链。
§6.4 越南医疗影像生态的三层结构
本条目所处的生态(结合致谢与人物网络):顶层——VinDr 联盟(VinBigData+Fujitsu 合作的全国性大库系列,本库 529/530 的主创);中层——AISIA Research Lab(VNU-HCM 的 AI 实验室,学术孵化器,本条实验支持方);基层——医院自主项目(Thong Nhat 的 PACS 数据+院内医生,本条本体)。三层的关系不是竞争而是梯队:基层项目验证采集流程与标注协议(小步快跑),中层提供方法学支持(算法与人力),顶层聚合规模化(多院联盟大库)。Ha-Hieu Pham 横跨三层的署名轨迹(本条共同作者+VinDr 核心)是梯队连通性的活证据。越南模式的启示:低资源地区不必等顶层大库——基层小库+中层方法学即可启动本国的医学 AI 数据资产建设(对照 527 的瑞士单院模式、MIMIC 的美国基金会模式——三种主权路径)。
§6.5 密度流行病学的跨人群速览(写作参照,非本库数据)
密度分型的跨人群差异是本条目种群叙事的文献背景(以下为公开文献的常见区间,非本库数据——引用需回原文核对):
| 人群 | 致密型(C+D)占比的文献常见区间 | 备注 |
|---|---|---|
| 美国白人女性 | ~40-45% | DD SM/BCSC 队列口径 |
| 东亚女性(中/日/韩) | ~50-60%+ | 多研究一致的偏高区间 |
| 东南亚(越南/泰国) | 文献较少,预期介于两者偏东亚侧 | 本条目恰补该区间 |
| 年龄趋势 | 致密型比例随年龄下降 | Age 列(18-91)的价值所在 |
(本表为文献常识级整理,作为本条目种群叙事的背景板——具体数字引用需回各流行病学原文,不从本表直引。)
用法注意:TNMammo 的 A-D 分布(未披露)若发布后显示 C+D 占比落在东亚偏高区间,将印证种群叙事;若显著偏离,则是采样偏倚的信号——分布数字本身是采样质量的试金石(又一次说明 A-D 分布披露的缺失有多关键)。
§7 使用指南:谁该下载这 2,704 张图
§7.1 三类用户画像
①密度分类研究者:现成的四视图+四级金标,GitHub 管线直接复现 baseline,五折结果可报告;②种群公平性研究者:越南种群的密度分布(亚洲女性致密型比例高的文献共识)与设备生态是公平性研究的天然素材——跨库迁移实验(DDSM/VinDr→TN-Mammo 或反向)预置了配置;③低资源地区 AI 部署者:JPEG 轻量+CLAHE 预处理+ResNet50 常规架构——整条管线在普通 GPU 甚至 CPU 推理可行,适合医疗基础设施受限场景的落地参考。
§7.2 访问与合规
Restricted 档:注册+签 Restricted DUA(无 CITI)。真实医学影像+年龄字段构成再识别风险基础——本条的 Restricted 有实质风险依据(对照 527 全虚构仍 Restricted 的过度保守)。引用义务单一:PhysioNet 标准引用(Nguyen B., Le C., Vu L., et al. 2025. RRID:SCR_007345. DOI 10.13026/1kx0-xc60)——无论文同引义务(不得引用 Cairo Journal 第三方论文的数字,§10 红线)。
§7.3 坑点表
| 坑点 | 典型翻车 | 绕行姿势 |
|---|---|---|
| 坑点1:TN 当 triple negative | 误归入三阴乳腺癌数据集家族 | TN = Thong Nhat Hospital——密度任务与三阴无关 |
| 坑点2:引 Cairo Journal 数字 | 写成 42-74 岁/56.3±8.7 | 官方页面明文 18-91——第三方论文数字硬冲突不可信 |
| 坑点3:orientation 当发布标签 | 找 CSV 第四列 | Abstract 声称但 CSV 只有 ID/Labels/Age——缺口存照 |
| 坑点4:找 baseline 精度 | 以为 Technical Validation 节存在 | 该节承诺后缺席——自己跑 GitHub 代码 |
| 坑点5:双盲当 IAA | 写"一致性高" | 流程背书≠数字背书——κ/α 未披露 |
| 坑点6:2,704 当页面原文 | 引用"页面给出 2,704" | 是 676×4 推算——页面未直说总图数 |
| 坑点7:引 34kz-bk76 当版本 DOI | 锁错版本 | v1.0.0=1kx0-xc60;34kz-bk76 是 latest |
| 坑点8:期待病灶标签 | 拿它做检测任务 | 只有密度 A-D(Known Limitations 明文) |
| 坑点9:忘了 Restricted | 直接爬数据 | 影像+年龄的再识别风险——签 DUA |
| 坑点10:与 VinDr-Mammo 混淆 | 引错规模/任务 | 同国不同库:20,000 例多任务 vs 676 例密度 |
§7.4 五折交叉验证的按例划分警告
页面 Usage Notes 的防泄漏提醒(“Ensure proper data splitting … to avoid data leakage”)在本库有具体的几何含义:同一例的四视图必须同折。若按图划分(2,704 张独立抽),同一患者的 left_cc 与 right_mlo 会分属训练与测试——同源图像的相似度会让测试集虚高 10-30 个百分点(乳腺影像的文献常见教训)。GitHub 的 fold 划分粒度需自查(train.py 的数据加载器逻辑):正确实现应按 ID 分组(GroupKFold 思路)。复现者的第一件事:验证折的粒度是例级不是图级。
§8 批评视角:轻量库的四重天花板与流程信任的边界
§8.1 官方自认的四连局限
页面 Known Limitations 原话四连:①规模——676 例限制大规模深度学习性能;②标签范围——仅密度 A-D,“restricts its use for lesion detection or abnormality classification”;③模态——仅钼靶,无超声/MRI 补充;④人群多样性——单源采集影响泛化。四条都是硬边界:这个库的应用空间被官方精确圈定在"密度分类+多视图方法学+种群研究"三格。
§8.2 流程信任的哲学问题
本条的标注质量论证依赖"流程描述"(双盲+共识+科主任)而非"量化结果"(IAA)——这提出了一个数据集治理的一般问题:流程透明能不能替代结果透明? 支持方:流程可审计(每一步可复查),IAA 只是流程的一个统计输出;反对方:IAA 是唯一能把"两位医生分歧多大"量化的指标,没有它,密度标签的噪声水平(文献区间 10-20% 判读分歧)只能靠猜。本库的立场(对照 561/621/622 的 IAA 全披露传统):流程+数字双披露才是金标,缺一为银。本条是银标——可用,但引用其标签精度时须保守。
§8.3 发布节奏的第三形态
对照本库三条同期条目的发布节奏:526/527 是"论文先行,数据随后"(526 半年、527 五天);本条是**“代码先行,论文待产”**(GitHub 2025-02 → 挂牌 2025-10 → 论文未发)——第三方描述论文(Cairo Journal 2025-12)反而先于官方论文出现。第三形态的风险:学术优先权与数据描述权的错位(别人替你描述你的数据集,还描述错了——§10)。对数据集作者的教训:官方论文尽快发,或者至少在 README 放一个官方描述文档(目前 README 的 Citation 块还是注释占位)。
§9.4 库内影像数据集的"格式决策"对照
| 条目 | 原始格式 | 发布格式 | 决策逻辑 |
|---|---|---|---|
| 528 TN-Mammo(本条) | DICOM | JPEG(最小压缩) | 轻量开源友好——低带宽社区优先 |
| 529 VinDr-PCXR(预期) | DICOM | PNG/DICOM | 保真优先(VinDr 系惯例) |
| 617 COM | 保真优先(VinDr 系惯例) | ||
| 617 MIMIC-CXR-JPG | DICOM | JPEG(官方再分发) | 母集即 JPEG 的官方转换 |
| 623 REFLACX | DICOM+私有格式 | PNG+MATLAB | 过程数据保真 |
| 620 myocardial-perfusion-spect | DICOM | DICOM | 原生保留 |
格式决策的三种哲学:保真优先(DICOM 原生,像素研究可做)、可用性优先(JPEG/PNG 轻量,低门槛社区友好)、过程保真(采集原生格式全链保留)。本条的可用性优先与它的低资源社区定位自洽——代价(压缩率不可审计、像素研究不可做)在 §3.4 已存照。选择没有对错,但格式选择必须与目标用户声明一致——本条做对了这一点。
§8.4 与库内"小库生存法则"的呼应
本条目的生存逻辑与库内小库先例(附录 L of 527 同主题的姊妹论证)形成三案例:561 RadGraph 金标(800 报告,靠标注一致性立信)、521 rad-coref(1,475 段,靠任务首创立信)、本条(676 例,靠种群组合立信)。三案例的共同点:小库必须回答"为什么不用大库替代你"——各自的答案是金标质量、任务首发、种群+协议组合。本条的组合(四视图完整+双盲共识+越南)中前两项可被 VinDr-Mammo 部分替代,唯种群与单院深度不可替代——这也是它最稳的生态位表述。
§9 生态位:BI-RADS 双轴与越南三连
§9.1 BI-RADS 双轴在批次八的落地
BI-RADS 体系有两个正交轴:评估类别(0-6,发现与处置)与密度分型(A-D,组织构成)。乳腺双子的分工:527 Swiss-Mammo 的报告承载评估类别轴(德文报告里的 BI-RADS 0-6 表述抽取),528 本条的影像承载密度分型轴(四视图的 A-D 判读)——两库合起来覆盖 BI-RADS 的完整语义空间(虽然是文本与影像、合成与真实的四种组合中的对角两种)。
§9.2 越南三连与 Ha-Hieu Pham 桥接
批次八的 528/529/530 三条全是越南团队(本条+VinDr-PCXR+VinDr-SpineXR 预期)——Ha-Hieu Pham 在本条是共同作者(#5 位),在 VinDr 系是核心(PCXR/SpineXR 的一作团队成员)。人物连续性让批次八成为"越南医学 AI 版图"专题:Thong Nhat 医院线(本条)+VinDr 联盟线(529/530)双线并行——本库第一次出现如此密集的单国集群(对照 527 瑞士单条、523 德国单条)。
§9.3 库内密度研究资产盘点
本条入库后,乳腺密度研究的资产链:527(报告侧密度表述/BI-RADS 类别文本)→ 528(影像侧密度金标)→ 529 VinDr-PCXR(儿童胸片,非乳腺但同团队方法学)→ 528 的 GitHub 跨库配置(DDSM/VinDr-Mammo/ThongNhat)。密度分类的跨库-跨模态研究(影像密度 vs 报告密度表述的一致性)在本库资产内可以首次完整搭建——这是条目联动的实际研究价值。
§10 FAQ:速查索引(按主题分组)
FAQ-1 基础认知(8 问)
Q1:TN-Mammo 是什么?
越南 Thong Nhat Hospital(统一医院)2022-2024 采集的乳腺钼靶数据集:676 例×四视图(left/right × CC/MLO),BI-RADS 乳腺密度 A-D 四级标签,双放射科医生双盲评估+科主任共识裁决,年龄 18-91 岁。PhysioNet 2025-10-04 挂牌 v1.0.0,Restricted 档。
Q2:TN 是什么缩写?
Thong Nhat Hospital(统一医院)——数据来源医院,GitHub README 明文 ‘ThongNhat-Mammo dataset’。不是 triple negative(三阴乳腺癌——本数据集是密度任务与三阴无关),更不是第三方论文声称的 ‘Thanh Nguyen Mammography’。
Q3:规模多大?
676 例受检者,每例 4 张(双侧 CC+MLO 标准位),推算 2,704 张 JPEG。官方页面未直说总图数——2,704 是 676×4 的推算。页面自认 676 例对大规模深度学习偏小(Known Limitations 第一条)。
Q4:标签是什么?
BI-RADS 乳腺密度 A-D 四级(ACR 五版:A 几乎全脂肪/B 散在纤维腺体/C 不均匀致密/D 极致密)。CSV 三列:ID(加密患者号)/Labels(A-D)/Age(18-91 岁)。仅密度——无病灶检测标签。
Q5:标注怎么做的?
两名放射科医生双盲独立评估(互不见对方结论),分歧经科主任会诊裁决,共识结果作为发布标签。流程是教科书配置,但 IAA(一致性系数)未披露——质量背书靠流程不靠数字。
Q6:怎么访问?
PhysioNet Restricted 档:注册+签 Restricted DUA 即可(无 CITI 强制)。真实医学影像+年龄的再识别风险是 Restricted 的实质依据。
Q7:图像什么格式?
DICOM→最小压缩 JPEG 转换(页面引 Trieu 2023 Acad Radiol 佐证保真)——开源友好折中:轻量即用,但像素级研究(噪声/伪影分析)不可做。目录结构 images/[加密ID]/[view].jpg。
Q8:和 VinDr-Mammo 什么关系?
同国不同库:VinDr-Mammo 是 20,000 例多医院联盟大库(病灶检测+密度多任务,DICOM),本条是 676 例单医院轻量库(纯密度,JPEG)。共同作者 Ha-Hieu Pham 是 VinDr 网络成员——人物桥接、生态互补。
FAQ-2 版本与引用(6 问)
Q9:应该引用哪个 DOI?
v1.0.0 = 10.13026/1kx0-xc60(锁版本,推荐);latest = 10.13026/34kz-bk76(浮动)。第三方论文引用的 34kz-bk76 是 latest 而非版本 DOI。
Q10:有期刊论文吗?
没有。PhysioNet+GitHub 双资产发布,GitHub 的 Citation 块还是注释占位([Author names])。发布节奏是’代码先行(2025-02)、论文待产’——第三方描述论文(Cairo Journal 2025-12,非原团队)反而先出现。
Q11:Cairo Journal 那篇论文可信吗?
不可信、不引用。那是 7 位阿拉伯姓名作者写的第三方描述论文(非原团队),数字与官方硬冲突:声称 TN=‘Thanh Nguyen Mammography’(官方=Thong Nhat Hospital)、年龄 42-74/56.3±8.7(官方 CSV 明文 18-91)、纳入’40-75 岁’(官方无此区间)。一切以 PhysioNet 页面+GitHub 为准。
Q12:GitHub 仓库有什么?
github.com/LeHongCat/TNMammo(LeHongCat=共同作者 Cat Le):train.py/train_all_folds.py(5 折交叉验证)/evaluate.py/models.py(ResNet50+多视图融合)/preprocessing.ipynb(裁剪-归一化-CLAHE-resize 管线)/ThongNhat_config.yml/environment.yml。还支持 DDSM/VinDr 配置——跨库实验预置。
Q13:baseline 精度是多少?
无公开数字。页面 Methods 承诺 ‘technical validation … described further below’ 但正文根本没有该节——承诺缺席的页面瑕疵。ResNet50+五折的精度只能自己跑 GitHub 代码复现。
Q14:Project Views 多少?
277(单版本)——挂牌 11 个月的中低流量。对照 527 Swiss-Mammo 的 29(全库最低)、521 的 39。
FAQ-3 数据细节(7 问)
Q15:四视图是什么?
left_cc(左头尾位)/left_mlo(左内外斜位)/right_cc/right_mlo——乳腺筛查的标准四联采集。CC 看中央内侧、MLO 额外覆盖外上象限(癌发最高区域)与腋尾。多视图完整是本条自我命名强调点。
Q16:BI-RADS 密度 A-D 怎么理解?
ACR 五版的组织构成四分型:A 几乎全脂肪/B 散在纤维腺体/C 不均匀致密/D 极致密。双重临床意义:C/D 是癌症独立风险因子,且致密腺体遮蔽病灶(降低钼靶敏感性)。注意密度分型与 BI-RADS 评估类别 0-6(527 的轴)是两个正交体系。
Q17:年龄分布怎么样?
Labels CSV 的 Age 列明文范围 18-91 岁——横跨极年轻到高龄。注意第三方论文声称的 42-74/56.3±8.7 与此硬冲突,以官方为准。无更细的年龄分布直方图披露。
Q18:采集怎么排除的?
四类排除:既往乳腺癌史/乳腺手术史/妊娠期/图像质量缺陷(运动、技术误差)。窗口 2022-01~2024-06(18 个月),convenience sampling(便利抽样——选择偏差无量化讨论)。
Q19:orientation 标签在哪?
无处可寻。页面 Abstract 声称标注了 ‘density and orientation’,但发布的 CSV 只有 ID/Labels/Age 三列——声称与发布的缺口(使用前需从文件名约定或像素自行判方位)。
Q20:A-D 每类多少例?
未披露。页面无分布统计,Technical Validation 节又缺席——类别均衡性未知,采样策略(分层与否)未知。下载后自行 count。
Q21:图像设备型号是什么?
未披露。PACS 下载但设备厂商/型号/分辨率/压缩参数全缺——设备方差是复现研究的盲区(Limitations 第四条’device diversity’间接承认)。
FAQ-4 使用与坑位(6 问)
Q22:适合什么任务?
密度分类(监督学习/特征提取/多视图融合三用途,页面 Usage Notes 明文)+跨库泛化研究(GitHub 预置 DDSM/VinDr/ThongNhat 三库配置)。不适合:病灶检测(无框标签)、多模态融合(单模态)、大规模预训练(676 例太小)。
Q23:CLAHE 是什么?
Contrast Limited Adaptive Histogram Equalization(限制对比度自适应直方图均衡)——GitHub 预处理管线的增强步骤,乳腺钼靶的标准预处理(脂肪/腺体对比度增强)。管线完整四步:乳腺区域裁剪→归一化→CLAHE→resize。
Q24:怎么防数据泄漏?
页面 Usage Notes 明文提醒 ‘Ensure proper data splitting (e.g., train/validation/test sets) to avoid data leakage’——按例(ID)划分而非按图划分(同一例的四视图必须同折)。GitHub 的五折 CV 按折划分,复现时确认折的粒度是例级。
Q25:多视图融合怎么做?
GitHub models.py 的架构:ResNet50(ImageNet 预训练)分别提取四视图特征→特征融合→FC 密度分类。融合策略(concat/attention/双线性)可自行替换——四视图对称结构适合实验各种融合方案。
Q26:密度标签的噪声有多大?
未知——IAA 未披露。文献里 ACR 四级密度判读的观察者间分歧率一般在 10-20% 区间(C/D 边界尤甚)。引用标签精度时保守处理,复现时建议自测标注噪声(如在测试集上对照两位原始读者)。
Q27:和 527 Swiss-Mammo 怎么联动?
乳腺双子:527 是报告文本的 BI-RADS 评估类别 0-6 轴(合成德语报告),528 是影像的密度 A-D 轴(真实越南图像)——BI-RADS 两个正交轴各占一端。密度研究可跨两库:影像密度分布 vs 报告密度表述。
FAQ-5 批判性视角(5 问)
Q28:这个数据集最大的问题是什么?
IAA 缺失+Technical Validation 缺席的组合——标注质量与基线性能双双没有数字背书,只能靠流程描述与代码复现。它的’质量证明’承诺(页面 Methods 原话)在正文里找不到对应节。
Q29:便利抽样影响多大?
未量化。convenience sampling 意味着样本不是人群随机样本——筛查意愿、就诊门槛等选择偏差混入密度分布。用本条推算越南人群密度流行率会引入偏差——它只能代表’Thog Nhat 医院筛查人群’。
Q30:单源单设备是致命的吗?
对泛化研究是。单一医院=单一设备链+单一技师团队+单一人群——跨设备泛化(乳腺 AI 部署的核心挑战)在本库内无法研究。GitHub 的跨库配置(DDSM/VinDr)是唯一补救路径。
Q31:676 例能发 PhysioNet 吗?
能——PhysioNet 无规模门槛,INbreast(410 图)等经典前作同样小规模。价值判断标准是标注质量与文档完备度,不是行数。但 676 例的密度库相对同国 VinDr-Mammo(20,000)确实生态位重叠——互补性论证(单源深度 vs 多源广度)是本条存在的理由。
Q32:第三方论文抢注说明什么?
学术生态的灰色地带:官方论文未发表期间,第三方(非原团队)可在其他期刊发表’描述别人数据集’的论文——且数字还写错了(42-74 vs 18-91)。教训有二:数据集作者应尽快发官方论文;数据集使用者应永远回溯一手源。
FAQ-6 深挖追问(进阶 10 问)
Q33:双盲标注的"双盲"具体指什么?
指两名放射科医生互相看不到对方的评估结果(独立判读),不是医学试验里的双盲给药。每例的密度判定两人背靠背完成,分歧交给科主任——这个三角结构(读者A/读者B/裁决者)在放射标注文献里叫 adjudication protocol。
Q34:科主任裁决会不会引入权威偏倚?
会——裁决者的结论天然权重高于两名初始读者,且裁决过程不留痕(无裁决理由记录)。更透明的替代:三人各判+多数投票,或分歧例保留双人标签。本条选择了最常见的临床惯例(主任裁决)而非最透明的科研惯例——组织文化的烙印。
Q35:为什么密度任务适合 676 例的小库?
密度是全乳腺的整体属性(不是病灶级标注)——标注成本低、可双盲、可全量覆盖。病灶级标注(框/掩码)的标注成本是密度级的 10-50 倍,676 例预算只够密度。这就是"任务复杂度决定库的可行规模"——小库选全局任务(密度)是理性配置。
Q36:18-91 岁的跨度意味着什么?
极宽——横跨育龄期到高龄。年轻女性致密型比例高(C/D 多)、年长女性脂肪型比例高(A/B 多)——Age 列与 Labels 列天然强相关。这既是研究素材(年龄-密度关系可建模)也是混淆源(年龄混淆的密度分类器需去偏)。42-74 的第三方声称会掩盖这个跨度价值。
Q37:DDSM/VinDr/ThongNhat 跨库配置怎么用?
ThongNhat_config.yml 是本库配置;换成 DDSM/VinDr 的配置文件即可让同一条管线跑另两库——标签体系对齐(密度四级)后,可做:VinDr 训练→ThongNhat 测试的迁移、三库混合训练的泛化、种群偏移的定量分析。注意 VinDr-Mammo 的密度标签也是 A-D(同 ACR 体系)——标签空间兼容。
Q38:CLAHE 会不会改变密度本身的表现?
会——CLAHE 增强局部对比度,可能放大腺体纹理的视觉强度。密度分类若在 CLAHE 后图像上训练,部署时(无 CLAHE 的原始图)会有预处理域差。两个处方:训练与推理保持同一预处理管线(GitHub 的做法);或报告"原始图 vs CLAHE 图"的双性能对照(复现者可加做)。
Q39:ResNet50 在 2025 年是不是太老了?
作为 baseline 不老——密度分类是中等复杂度任务(全局纹理+构成比例),ResNet50 级别足够打 baseline(文献里密度 SOTA 也多用 ResNet/EfficientNet 级骨干+多视图融合)。复现者可自行升级(ViT/ConvNeXt 骨干),但 ResNet50 的五折结果已是可报告的底线。
Q40:676 例的统计功效够做什么?
够:密度四分类的 baseline 建立(每类若 150± 例,四类差异检测功效充足)、跨库迁移评估(迁移损失的粗测)。不够:亚组分析(年龄×密度的交叉分层后每格样本量骤减)、SOTA 打榜(与 20,000 例库的数字没有可比性)。用库前先算功效。
Q41:这个库能和中国人群的乳腺研究对接吗?
间接可以——越南与中国的东南亚/东亚人群乳腺密度分布有文献层面的可比性(亚洲女性致密型比例偏高的共识),但本库内没有中国人群乳腺库(库内乳腺家族=527 德语文本+528 越南影像)。对接路径:跨库文献对照而非库内直接实验。
Q42:如果官方论文最终发了,会有 IAA 数字吗?
大概率有——期刊评审(Sci Data 型数据描述刊)通常会要求标注一致性。这也提示使用策略:引用本库时若需精度敏感结论,等官方论文的 IAA 或自行复现标注一致性实验;描述性引用(数据集存在与规模)不受影响。
FAQ-7 研究设计问答(8 问)
Q43:我想做"越南 vs 美国"密度分布对比,直接用两库的标签统计行吗?
行——但有两个前提:①确认两库的采样协议差异(TNMammo 是筛查人群便利抽样、DDSM 是活检复核病例为主——人群基础不同);②在论文里明确"库分布≠人群分布"(各自都有采样偏移)。直接统计+偏移声明,是最诚实的跨库描述性对比。
Q44:同一例四视图的标签是共享的吗?
是——CSV 每行一例,Labels 是例级标签(双侧乳腺共用一个密度分级,按 ACR 惯例以较致密侧为准——页面未明说双侧融合规则,存照为待验证项)。这意味着单侧输入模型训练时的标签其实来自双侧联合判读——单侧分析的标签噪声略高。
Q45:可以用这个库做对象检测预训练吗?
不建议——无框标注(Known Limitations 明文),预训练只能自监督(DINO/MAE 类)或用密度分类头弱监督。检测预训练请用 VinDr-Mammo(有 BoundingBox)。
Q46:CLAHE 的 clip limit 默认多少?
README 未给——藏在 preprocessing.ipynb 里(下载代码后查看)。复现者如果换库对比(DDSM 库通常用 clipLimit=2.0/tileSize=8×8 的默认),需统一参数或消融。
Q47:JPEG 转换的压缩参数是什么?
未披露——"minimally compressed"的量化定义(质量因子 90?95?)无文档。像素保真的实际水平只能从图内元数据或与 DICOM 原件的对照反推(原件不发布——无法反推,存照)。这是 JPEG 决策的隐藏代价:压缩率不可审计。
Q48:能把这个库和 519 MS-CXR-T 那样的扰动框架结合吗?
理论上可以——密度分类器的扰动敏感性测试(对致密区域做局部强度扰动→观察预测翻转)。但 519 的扰动是基于配对"正常-反事实"图像对的(有造反事实的金标流程),本库无反事实对——只能做无金标的敏感性分析(弱一档)。方法论移植需降级使用。
Q49:哪个国家的乳腺库与本库最互补?
从种群维度:任何欧美大库(DDSM/CSAW/NYU)都提供"种群对照面";从设备维度:多源库(VinDr/OPTIMAM)提供"设备对照面"。本库的单源特性决定了它更适合当迁移的目标域(测试集)而非源域(训练集)——小库当靶、大库当锤,是最经济的使用姿势。
Q50:官方论文如果只发数据描述(Sci Data 型),会补什么?
按 Sci Data 惯例预期补:Technical Validation 节(承诺过的)——A-D 分布统计+IAA(Krippendorff κ 或 agreement)+baseline 模型成绩+图像质量检查报告。这四项就是当前的全部缺口——官方论文的补位价值就在于此。发布后本条目 FACTS 应更新(版本考古续篇)。
(FAQ 研究设计组合计 8 问;全 FAQ 50 问)
§11 事实清单:逐条存照(每条可溯源至页面快照/GitHub README/WebSearch 交叉)
- 全名 TN-Mammo: A Multi-view Mammography Dataset for Breast Density Classification;内部名 TNMammo;slug tn-mammo-breast-density。
- TN = Thong Nhat Hospital(胡志明市统一医院)——GitHub README 明文 ‘ThongNhat-Mammo dataset’;不是 triple negative,不是第三方声称的 Thanh Nguyen。
- 挂牌 2025-10-04,v1.0.0 单版本(1.0.1/latest 探测 404)。
- 双 DOI:v1.0.0 = 10.13026/1kx0-xc60;latest = 10.13026/34kz-bk76。
- 访问档 Restricted(Restricted Health Data License 1.5.0 + Restricted DUA;注册+签约,无 CITI)——批次预判 Restricted 命中。
- 规模 676 例×4 视图(left_cc/left_mlo/right_cc/right_mlo)——2,704 张 JPEG 为 676×4 推算(页面未直说)。
- 标签 CSV 三列:ID(加密患者号)/Labels(密度 A/B/C/D)/Age(18-91 岁)。
- 密度 A-D = ACR 五版 BI-RADS 密度分型:A 几乎全脂肪/B 散在纤维腺体/C 不均匀致密/D 极致密。
- 密度双重临床身份:癌症独立风险因子+病灶遮蔽因子(页面 Background 引 Kolb 2002 的 22,825 例筛查证据)。
- 标注协议:两名放射科医生双盲独立评估+分歧经科主任会诊共识裁决(‘consensus results were used to train the model’)。
- IAA 数字零披露——双盲流程有、一致性系数无(页面/GitHub 均无 κ/α)。
- orientation 标签声称(Abstract ‘density and orientation’)但 CSV 三列无此列——声称-发布缺口。
- 采集窗口 2022-01~2024-06(18 个月),Thong Nhat Hospital PACS,convenience sampling。
- 四类排除:既往乳腺癌/乳腺手术/妊娠/图像质量缺陷(运动/技术误差)。
- DICOM→最小压缩 JPEG 转换(引 Trieu 2023 Acad Radiol 保真研究)——开源友好折中。
- 10 人团队三国:VNU-HCM University of Science 4(Binh Nguyen 计算机系主任一作/Cat Le/Quynh Nguyen/Nghiem Diep Tuong)+ Tan Tao University 3(Loc Vu 医学院/Phuong Anh Vu/Cao Tien Dung IT)+ Thong Nhat Hospital 1(Thuan Huynh)+ 韩国 Chung-Ang University 1(Byung-Woo Hong)。
- Ha-Hieu Pham(#5 位)为 VinDr 系核心成员(VinDr-Mammo/PCXR/SpineXR)——本条与 529/530 的人物桥接。
- AISIA Research Lab(VNU-HCM AI 实验室)+ Tan Tao University 致谢支持。
- 伦理批件:Thong Nhat Hospital Ethics Committee No. 43/2024/CN-BVTN-HDDD(2024-03-04 胡志明市签发)——医院级伦理。
- GitHub github.com/LeHongCat/TNMammo(LeHongCat=Cat Le):train.py/train_all_folds.py(5-fold)/evaluate.py/models.py/preprocessing.ipynb/ThongNhat_config.yml/environment.yml。
- 模型架构:ResNet50(ImageNet 预训练)+多视图特征提取融合+FC 密度头。
- 预处理管线:乳腺区域裁剪→归一化→CLAHE 增强→resize。
- 跨库设计:代码支持 DDSM/VinDr/ThongNhat 三库配置(跨库泛化实验预置)。
- Technical Validation 节承诺缺席:页面 Methods 原话 ‘described further below’ 但正文无该节——baseline 精度无公开数字(页面瑕疵存照)。
- 无期刊论文:PhysioNet+GitHub 双资产发布;GitHub Citation 块注释占位 [Author names]。
- 发布节奏第三形态:代码先行(2025-02-24/26 commits)→ 挂牌(2025-10-04)→ 论文待产——第三方描述论文反而先出现。
- 第三方论文:Cairo Journal of Science(مجلة العلوم الشاملة)2025-12-06,vol 10(38):2065-2083,作者 Hanan Alsagheer/Amir EL-sseid 等 7 人(阿拉伯姓名,非原团队)。
- 二手污染三连(红线):第三方声称 TN=‘Thanh Nguyen Mammography’(官方=Thong Nhat)、年龄 42-74/56.3±8.7(官方=18-91)、纳入’40-75’(官方无)——数字不可信不引用。
- GLOBOCAN 2022 越南:24,563 新例(33 类癌第二)/10,008 死亡(第四);全球乳腺癌占女性新发 11.6%、死亡 665,684。
- 30 年乳腺库谱系:MIAS(1994,322 图)→DDSM(1997,~10,000)→INbreast(2012,410 图 FFDM)→OPTIMAM(2020)→CSAW(2020,百万级)→NYU BCSD(2019)→VinDr-Mammo(2023,20,000 例)→TN-Mammo(2025,676 例)。
- 页面 Known Limitations 四连:676 例规模限制/仅密度标签(限制病灶检测)/仅钼靶单模态/单源人群设备多样性。
- 页面 Usage Notes 三用途:监督学习分类/特征提取/多视图融合分析;防泄漏提醒:按例划分避免同例四视图跨折。
- COI:无已知竞争性财务利益。
- Views 277(单版本,挂牌 11 个月)——中低流量。
- 引用义务单一:PhysioNet APA(Nguyen B., Le C., Vu L., Nguyen Q., Pham H., Vu P. A., Huynh T., Tien Dung C., Diep Tuong N., & Hong B. 2025. RRID:SCR_007345. DOI 10.13026/1kx0-xc60)——无论文同引。
- Parent Projects:无——独立采集非派生。
- 页面无 Topics 行(Discovery 区比 527 更素)。
- 数据卫生:院内工作站匿名化(PACS→workstation→anonymize)+ID 加密(目录名即加密态)。
- 页面正文结构:Abstract/Background/Methods/Data Description/Usage Notes/Release Notes(‘first public release’ 一句话)/Ethics/Acknowledgements/COI/References(29 条)。
- Reference 28(JPEG 保真):Trieu PDY et al. Acad Radiol 2023;30(8):1748-55——放射科培训视角的最小压缩 JPEG 研究。
- Reference 20:VinDr-Mammo(Nguyen HT et al. Sci Data 2023;10:277)——同国前作+团队桥接的文献证据。
- Reference 29:TNMammo GitHub(Accessed 2025-09-12)。
- 乳腺密度流行病学背景:致密型腺体降低钼靶敏感性(尤其年长患者)——密度分类是筛查 AI 的前置质控环节。
- 多视图临床语义:CC 覆盖中央内侧、MLO 额外覆盖外上象限(癌发最高区域)与腋尾——四联才全域。
- INbreast(2012)前例:115 例/410 图同样小规模成为经典——PhysioNet 无规模门槛,质量与文档才是标准。
- Convenience sampling 自认——选择偏差无量化讨论(Limitations 间接承认单源问题)。
- 设备元数据零披露:厂商/型号/分辨率/压缩参数全缺——跨设备泛化研究盲区。
- A-D 分布未披露:每类例数/均衡性未知——下载后自行 count。
- 数据格式选择即用户声明:JPEG 轻量面向低带宽地区可用性(对照 VinDr-Mammo 的 DICOM 专业保真)。
- Usage Notes 双处重复伦理声明:‘should be used responsibly in accordance with ethical and legal guidelines, especially for medical applications’。
- 本条与 527 的 BI-RADS 双轴:评估类别 0-6(527 报告侧)vs 密度分型 A-D(528 影像侧)——两个正交体系。
- 本条与 529/530 的越南三连:Ha-Hieu Pham 人物连续性——批次八的越南医学 AI 版图专题。
- 引用 DOI 时的作者姓名注意:Tien Dung Cao 与 Diep Tuong Nghiem 的姓-名顺序(越南姓名结构)在 BibTeX 里为 {Tien Dung}, Cao 与 {Diep Tuong}, Nghiem。
§12 术语表:五十条
| 术语 | 释义 |
|---|---|
| TN-Mammo | 本条目数据集名——Thong Nhat Hospital 乳腺钼靶库(TN=医院名缩写)。 |
| Thong Nhat Hospital | 胡志明市统一医院——数据来源机构;越南统一后更名的国家级医院之一。 |
| BI-RADS | 美国放射学会乳腺影像报告与数据系统。两个正交轴:评估类别 0-6(发现与处置)与密度分型 A-D(组织构成)。 |
| 乳腺密度(breast density) | 纤维腺体组织与脂肪组织的构成比例——ACR 四分型 A-D。独立风险因子+病灶遮蔽因子双重身份。 |
| A/B/C/D | ACR 密度四级:A 几乎全脂肪/B 散在纤维腺体/C 不均匀致密/D 极致密。 |
| CC(craniocaudal) | 头尾位投照——乳腺 X 线标准位之一,覆盖中央与内侧。 |
| MLO(mediolateral oblique) | 内外斜位投照——额外覆盖外上象限(癌发最高区域)与腋尾。 |
| 多视图(multi-view) | 双侧×双位四联采集——乳腺筛查完整协议;本条命名强调点。 |
| 双盲评估(double-blind) | 两名放射科医生互不见对方结论独立判读——本条标注协议核心。 |
| 共识裁决(consensus adjudication) | 分歧经科主任会诊定案——本条标签的最终来源。 |
| IAA | Inter-Annotator Agreement 标注者间一致性——本条未披露的量化指标(κ/α)。 |
| CLAHE | 限制对比度自适应直方图均衡——GitHub 预处理管线的增强步骤。 |
| ResNet50 | ImageNet 预训练的 50 层残差网络——GitHub baseline 骨干。 |
| 五折交叉验证(5-fold CV) | 数据分五折轮换训练验证——GitHub train_all_folds.py 的评估设计。 |
| 数据泄漏(data leakage) | 同一例的四视图跨训练/测试折导致的性能虚高——页面明文警告,按例划分防泄漏。 |
| convenience sampling | 便利抽样——可及性驱动的非随机采样;本条自认,选择偏差未量化。 |
| PACS | Picture Archiving and Communication System 医院影像归档系统——本条原始数据出口。 |
| DICOM | 医学数字成像通信标准——原始格式;本条转换为 JPEG 发布。 |
| JPEG 转换 | 最小压缩 JPEG 发布决策——轻量开源友好 vs 像素保真的折中(引 Trieu 2023)。 |
| 加密 ID | 目录名的患者标识为加密态——匿名化措施。 |
| VinDr-Mammo | 同国前作:20,000 例多医院联盟乳腺库(Sci Data 2023)——与本条互补的大规模路线。 |
| VinDr 网络 | 越南医学 AI 数据集系列(Mammo/PCXR/SpineXR/CXR 等)——Ha-Hieu Pham 为桥接人物。 |
| AISIA Research Lab | VNU-HCM 的 AI 实验室——越南医学 AI 孵化器,本条实验支持方。 |
| VNU-HCM | 越南国家大学胡志明市分校——一作团队所在(University of Science 计算机系)。 |
| Tan Tao University | 越南私立大学——医学院(Loc Vu)+IT 学院(Cao Tien Dung)双向参与。 |
| Chung-Ang University | 韩国中央大学——Byung-Woo Hong 的国际协作席位。 |
| GLOBOCAN | 国际癌症研究机构的全球癌症统计——2022 年越南乳腺数据(24,563 新例/10,008 死亡)的出处。 |
| Technical Validation | 页面 Methods 承诺的验证节——正文缺席(页面瑕疵存照)。 |
| Cairo Journal of Science | 第三方描述论文的发表期刊(2025-12-06,非原团队)——数字与官方硬冲突,不引用。 |
| 二手引用污染 | 本条目方法论术语:第三方论文的 TN 展开/年龄区间/纳入标准三处与官方冲突——回溯一手源铁律。 |
| MIAS | Mammographic Image Analysis Society 数据库(1994,322 图)——乳腺库谱系起点。 |
| DDSM | Digital Database for Screening Mammography(1997,美国,~10,000 图)——GitHub 跨库配置之一。 |
| INbreast | 葡萄牙 FFDM 库(2012,410 图)——小规模经典前例(PhysioNet 无规模门槛的佐证)。 |
| CSAW | 瑞典百万级筛查队列(2020)——谱系的大规模端。 |
| OPTIMAM | 英国大规模乳腺库(2020)——图像+临床数据双轨。 |
| NYU BCSD | NYU Breast Cancer Screening Dataset(2019,百万级)——大规模端另一例。 |
| FFDM | Full-Field Digital Mammography 全视野数字乳腺 X 线——INbreast 以来的主流采集形态。 |
| Restricted DUA | PhysioNet Restricted 数据使用协议——注册+签约即可(无 CITI),本条访问门槛。 |
| 加密患者 ID | 目录名即加密态标识——匿名化链路的最后一环。 |
| 密度四分类(density classification) | 本条任务定义:四视图输入→A/B/C/D 输出。 |
| 特征融合(feature fusion) | GitHub models.py 的多视图架构组件——四视图特征合并后进分类头。 |
| 乳腺区域裁剪 | 预处理第一步:去除背景黑边定位乳腺区——GitHub 管线组件。 |
| 归一化(normalization) | 预处理第二步:像素值标准化。 |
| resize | 预处理第四步:缩放到模型输入尺寸。 |
| 5-fold CV 按例划分 | 防泄漏的正确粒度:同一例四视图必须同折。 |
| Label 列 | TNMammo_labels.csv 的密度标签列(A/B/C/D 字符)。 |
| Age 列 | 患者年龄列(18-91 岁跨度)——唯一人口学变量。 |
| Encrypted ID 列 | 加密患者号列——与目录名对应的主键。 |
| 越南三连 | 批次八的 528/529/530 全越南团队集群——本库首次单国密集入库。 |
| BI-RADS 双轴 | 本条目方法论术语:评估类别轴(527)vs 密度分型轴(528)——乳腺双子各占一端。 |
(术语表合计 50 条)
附录 A:30 秒速查卡
| 你想知道 | 答案 |
|---|---|
| 这是什么 | 越南 Thong Nhat Hospital 的 676 例乳腺钼靶密度库(四视图,BI-RADS A-D) |
| TN 是什么 | Thong Nhat Hospital 医院名——不是 triple negative、不是 Thanh Nguyen |
| 标签怎么来的 | 两名放射科医生双盲独立+科主任共识裁决(IAA 数字未披露) |
| 访问 | Restricted(注册+签 DUA,无 CITI)——真实影像的实质风险依据 |
| 引用什么 | PhysioNet v1.0.0 DOI 10.13026/1kx0-xc60(34kz-bk76 是 latest) |
| 有论文吗 | 无期刊论文(PhysioNet+GitHub 双资产;第三方论文不可信见 §10) |
| baseline 多少分 | 未公开——Technical Validation 节承诺缺席;自己跑 GitHub 代码 |
| 年龄多大 | 18-91 岁(CSV Age 列)——勿引第三方的 42-74 |
| GitHub 有什么 | ResNet50+五折 CV+CLAHE 管线+DDSM/VinDr/ThongNhat 跨库配置 |
| 最大局限 | 676 例规模+仅密度标签+单模态+单源(官方四连自认) |
附录 B:时间线全表
| 时间 | 事件 | 证据 |
|---|---|---|
| 2022-01 | Thong Nhat Hospital 采集开始(18 个月窗口) | 页面 Methods |
| 2024-03-04 | 伦理批准 No. 43/2024/CN-BVTN-HDDD | 页面 Ethics |
| 2024-06 | 采集结束 | 页面 Methods |
| 2025-02-24/26 | GitHub 代码提交(coding) | GitHub commit 历史 |
| 2025-06-11 | GitHub README 更新 | GitHub commit 历史 |
| 2025-09-12 | 页面 GitHub 链接访问标注 | 页面 ref 29 |
| 2025-10-04 | PhysioNet 挂牌 v1.0.0 | 页面 Versions |
| 2025-12-06 | 第三方描述论文(Cairo Journal,非原团队) | Scholar 索引 |
| 2026-09-24 | 本条目核查时 Views 277 | 页面快照 |
附录 C:文件资产全索引
| 资产 | 内容 | 获取 |
|---|---|---|
| images/[ID]/[view].jpg | 676 目录 × 4 视图(left_cc/left_mlo/right_cc/right_mlo) | PhysioNet Files(签 DUA 后) |
| TNMammo_labels.csv | 676 行 × 3 列:ID/Labels(A-D)/Age(18-91) | 同上 |
| GitHub 代码 | train/evaluate/models/preprocessing/config/environment | github.com/LeHongCat/TNMammo 公开 |
| 页面正文 | 摘要/背景/方法/数据描述/使用说明/伦理 | 公开 |
缺失资产清单(对照同类库):data dictionary(CSV 列自明无词典)、设备元数据(厂商/型号/分辨率)、DICOM 原件、A-D 分布统计、官方论文。
附录 D:BI-RADS 密度四级的临床语义
| 级别 | ACR 定义 | 钼靶敏感性 | 风险含义 |
|---|---|---|---|
| A | 几乎全脂肪(almost entirely fat) | 高(病灶对比度好) | 基线风险 |
| B | 散在纤维腺体(scattered fibroglandular) | 较高 | 基线风险 |
| C | 不均匀致密(heterogeneously dense) | 降低(小病灶可被遮蔽) | 风险升高 |
| D | 极致密(extremely dense) | 最低(遮蔽风险最高) | 风险最高 |
双轴辨析:密度分型(本条,组织构成)vs BI-RADS 评估类别 0-6(527 报告侧,发现与处置)——正交体系,勿混。密度分型的临床动作:C/D 人群可能建议补充超声/MRI(致密腺体的钼靶盲区)。
附录 E:30 年乳腺库谱系对照(页面 Figure 1 + References 转录)
| 库 | 年份 | 国家 | 规模 | 格式 | 标注 | 意义 |
|---|---|---|---|---|---|---|
| MIAS | 1994 | 英国 | 322 图(161 例) | 胶片数字化 1024×1024 | 异常位置 | 谱系起点 |
| DDSM | 1997 | 美国 | ~2,620 studies/10,000 图 | 胶片 | 病理验证 | 首个大规模 |
| INbreast | 2012 | 葡萄牙 | 115 例/410 图 | FFDM | 多样发现 | 首个 FFDM 公开库 |
| OPTIMAM | 2020 | 英国 | 大规模 | FFDM | 图像+临床 | 临床数据双轨 |
| CSAW | 2020 | 瑞典 | 百万级 | FFDM | 筛查队列 | 人口学队列 |
| NYU BCSD | 2019 | 美国 | 百万级 | FFDM | 筛查 | 深度学习时代 |
| VinDr-Mammo | 2023 | 越南 | 20,000 例/80,000 图 | DICOM | 多医生+仲裁 | 东南亚大规模 |
| TN-Mammo | 2025 | 越南 | 676 例/2,704 图 | JPEG | 双盲+共识 | 轻量精品+密度专注 |
谱系读法:规模从百级到百万级(×3000),格式从胶片到数字,标注从单评到双盲共识,种群从英美到全球。本条的卡位逻辑:不求规模,求’多视图完整+双盲标注+东南亚种群’的组合稀缺性。
附录 F:TN-Mammo vs VinDr-Mammo 全维对照(同国双库)
| 维度 | TN-Mammo(本条) | VinDr-Mammo |
|---|---|---|
| 挂牌 | 2025-10-04 | 2022-03-21(本库 529 预告的同国前作) |
| 例数 | 676 | 20,000 |
| 图数 | 2,704(JPEG) | 80,000(DICOM) |
| 任务 | 密度 A-D 单任务 | 病灶检测(BoundingBox)+密度+BIRADS 类别多任务 |
| 标注 | 双盲双评+科主任共识 | 多医生独立+仲裁 |
| IAA | 未披露 | 有(仲裁机制) |
| 来源 | 单医院(Thong Nhat) | 多医院联盟 |
| 设备多样性 | 单源 | 多源 |
| 格式 | JPEG(轻量) | DICOM(保真) |
| 年龄 | 18-91 | 成人筛查人群 |
| 团队 | VNU-HCM+Tan Tao+Thong Nhat+Chung-Ang | VinDr 联盟(Fujitsu 合作) |
| 人物桥接 | Ha-Hieu Pham(共同作者 #5) | Ha-Hieu Pham(核心成员) |
| 生态位 | 轻量评测+单源深度+密度专注 | 大规模训练+多源泛化+多任务 |
互补性结论:两库不是竞争关系——本条的单源密度分布内省(同一设备的系统性密度特征)与 VinDr 的多源泛化测试互补;GitHub 的跨库配置让’VinDr 训练→ThongNhat 评测’的迁移实验开箱即用。
附录 G:DAIMS 十维自评
| 维度 | 分 | 依据 |
|---|---|---|
| 可发现性 | 7 | PhysioNet 独立条目+Topics 缺失拖分;slug 与简称(TN)需外部检索学习 |
| 可获取性 | 6 | Restricted DUA 门槛(低但有);真实影像的合理档位 |
| 可读性(格式) | 7 | 目录规范+CSV 简洁;无 data dictionary、无设备元数据拖分 |
| 文档完备 | 7 | 页面完整+README 详尽;Technical Validation 节缺席+A-D 分布缺失拖分 |
| 标注质量 | 6 | 双盲+共识流程满分;IAA 数字缺席+orientation 标签缺口拖分 |
| 伦理合规 | 9 | 医院级伦理批件编号在案+院内匿名化+加密 ID+使用警告——流程全披露 |
| 规模 | 4 | 676 例/2,704 图轻量——评测可用训练不足 |
| 可复现 | 7 | 代码+环境+配置全开;baseline 数字缺席需自行复现拖分 |
| 社区治理 | 5 | 无官方论文+引用块注释占位+第三方论文抢注风险暴露治理短板 |
| AI-Ready 度 | 7 | CSV+目录规范+代码管线齐备;元数据薄+无官方划分拖分 |
| 加权总分 | 6.7 | 伦理流程强、数字背书弱——'流程满分、数字半分’的典型形状 |
附录 H:与库内条目的系统对照
H.1 乳腺双子(527+528)
| 维度 | 527 Swiss-Mammo | 528 TN-Mammo(本条) |
|---|---|---|
| 模态 | 报告文本(双语) | 影像(四视图 JPEG) |
| BI-RADS 轴 | 评估类别 0-6 | 密度分型 A-D |
| 合成性 | 100% 手写虚构 | 100% 真实采集 |
| 规模 | 28 份 | 676 例/2,704 图 |
| 访问档 | Restricted(纯合成悖论) | Restricted(真实风险合理) |
| 语种 | 德+英 | 无文本(影像) |
| 验证 | 相似度指纹 0.76-0.78 | 双盲+共识(IAA 缺席) |
| LLM 依赖 | 零 | 零 |
| 论文 | JMIR 已发 | 未发(第三方抢注) |
两库 Restricted 档的风险基础不同:527 是发布方保守(零风险数据过度保护),528 是实质风险(真实影像+年龄)。同为 Restricted,理由迥异——访问档的语义要回归风险本体。
H.2 越南三连(528+529+530)
| 条目 | 模态 | 团队 | 桥接人物 |
|---|---|---|---|
| 528 TN-Mammo | 乳腺钼靶 | VNU-HCM+Tan Tao+Thong Nhat | Ha-Hieu Pham(共同作者) |
| 529 VinDr-PCXR | 儿童胸片 | VinDr 联盟 | Ha-Hieu Pham(VinDr 核心) |
| 530 VinDr-SpineXR | 脊柱 X 光 | VinDr 联盟 | Ha-Hieu Pham(VinDr 核心) |
H.3 密度/密度相关资产链
| 链节 | 条目 | 密度角色 |
|---|---|---|
| 影像密度金标 | 528(本条) | A-D 四级四视图 |
| 报告密度表述 | 527 | BI-RADS 0-6 文本(含密度描述) |
| 跨库配置 | 528 GitHub | DDSM/VinDr-Mammo/ThongNhat 三库管线 |
研究提案:'影像密度 vs 报告密度表述’的跨模态一致性——同一人群的影像密度(528 型)与报告表述(527 型)的对应关系,本库资产内可完整搭建(两库不同人群,需各自采集配对数据——方法论示范价值)。
附录 I:引用模板
I.1 数据集(APA)
Nguyen, B., Le, C., Vu, L., Nguyen, Q., Pham, H., Vu, P. A., Huynh, T., Tien Dung, C., Diep Tuong, N., & Hong, B. (2025). TN-Mammo: A Multi-view Mammography Dataset for Breast Density Classification (version 1.0.0). PhysioNet. RRID:SCR_007345. https://doi.org/10.13026/1kx0-xc60
I.2 BibTeX
@article{PhysioNet-tn-mammo-breast-density-1.0.0,
author = {Nguyen, Binh and Le, Cat and Vu, Loc and Nguyen, Quynh and Pham, Ha-Hieu and Vu, Phuong Anh and Huynh, Thuan and {Tien Dung}, Cao and {Diep Tuong}, Nghiem and Hong, Byung-Woo},
title = {{TN-Mammo: A Multi-view Mammography Dataset for Breast Density Classification}},
journal = {{PhysioNet}}, year = {2025}, month = oct,
note = {Version 1.0.0}, doi = {10.13026/1kx0-xc60}}
注意:①引用 v1.0.0(1kx0-xc60)勿用 latest(34kz-bk76);②越南姓名 {Tien Dung}, Cao 与 {Diep Tuong}, Nghiem 的姓-名结构已按官方 BibTeX 处理;③无需同引期刊论文(不存在),可加引 GitHub 代码仓库。
附录 J:分层读法指南(按身份选路径)
- 密度分类研究者:附录 A 速查 → §3 数据解剖 → §5 代码栈 → GitHub 复现五折 baseline → 报告时注明 IAA 未披露的标签噪声保守区间
- 公平性研究者:§6 越南语境 → 附录 F 同国双库对照 → §8.3 单源偏差 → 设计跨库迁移实验(DDSM/VinDr→TNMammo)
- 多视图方法学者:§3.2 四视图临床语义 → §5.1 models.py 融合架构 → 自定义融合策略实验(四视图对称结构适合消融)
- 数据集策展人:§4 标注协议 → §8.2 流程信任哲学 → §10 二手污染存照——'流程 vs 数字’与’官方 vs 抢注’两个治理案例
- skeptical reviewer:§8.1 四连局限 → §4.2 IAA 缺席 → 附录 G DAIMS 6.7 分——所有弱点已自评在案
附录 K:二手引用污染专题(Cairo Journal 事件全档案)
K.1 事件还原
2025-12-06,《مجلة العلوم الشاملة》(Cairo Journal of Science,埃及/利比亚综合期刊)vol 10(38):2065-2083 刊出 ‘TN-Mammo: A Curated Multi-View Mammography Dataset with Consensus Radiologist Annotations for Breast Density Stratification in a Vietnamese Cohort’——作者 Hanan Alsagheer、Amir EL-sseid、Fatah Mohamed Shakrum、Ebtisam Mohamed Fakroun、Mohamed EL-sseid、Abdussalam Ali Ahmed、Yasser Fathi Nassar、Abdulgader Alsharif 共 7 人(阿拉伯姓名,无一是原团队的越南/韩国成员)。
K.2 数字硬冲突三连
| 项目 | 第三方论文声称 | 官方(PhysioNet 页面+CSV) |
|---|---|---|
| TN 展开 | ‘Thanh Nguyen Mammography’ | Thong Nhat Hospital(GitHub ‘ThongNhat-Mammo’) |
| 年龄范围 | 42-74 岁,均值 56.3±8.7 | 18-91 岁(TNMammo_labels.csv Age 列) |
| 纳入标准 | ‘Age 40-75’ | 无此区间(排除标准为既往癌/手术/妊娠/质量缺陷) |
K.3 性质判定
①非原团队:7 位作者与 10 人官方名单零交集;②数字冲突:三处核心事实与一手源矛盾(官方 CSV 的 Age 列是机器可查的硬证据);③引用对象:该论文引用的数据集 DOI(34kz-bk76)倒是真 latest DOI——引用了真数据集、写错了数字。性质:未经原团队参与的数据集描述论文,数字可靠性不成立。
K.4 使用者守则
- 不引用该论文的任何数字(TN 展开/年龄/纳入标准/分布统计全不可信)
- 可存照为学术生态案例:'描述别人数据集’的论文类型+抢注现象+数字失真风险
- 回溯铁律:任何二手文献的数据集数字,回溯 PhysioNet 页面与 CSV 验证——本例中 Age 列(18-91)是机器可查的最终裁判
- 对原团队的教训:官方论文尽快发表,避免描述权真空期被第三方填注(哪怕填错)
附录 L: Technical Validation 缺席事件的复现指引
页面承诺的验证节缺席(§5.3)意味着 baseline 数字需要使用者自行生成。GitHub 代码的复现路径:
- 环境:
conda env create -f environment.yml(或 pip install -r requirements.txt) - 数据:PhysioNet 下载后按 datasets/TNMammo/ 结构组织(images/[ID]/[view].jpg + TNMammo_labels.csv)
- 预处理:运行 preprocessing.ipynb(乳腺区域裁剪→归一化→CLAHE→resize 四步)
- 单折验证:
python train.py --config_path ThongNhat_config.yml --fold 0 - 全折评估:
python train_all_folds.py --config_path ThongNhat_config.yml --num_folds 5后python evaluate.py --config_path ThongNhat_config.yml - 跨库对照(可选):切换 config 为 DDSM/VinDr 跑同管线——迁移实验开箱即用
复现时注意:①按例划分(同例四视图同折)防泄漏;②CLAHE 参数未在 README 给出(notebook 内查看);③seed 未说明——严格复现需 seed 扫描;④报告结果时注明’自行复现,非官方数字’。
附录 M:分层账本与推断边界
| 声称 | 状态 | 依据 |
|---|---|---|
| 676 例 | 页面明文 ✓ | Abstract/Data Description |
| 2,704 图 | 推算(676×4) | 目录规则(每例四文件)——页面未直说 |
| 18-91 岁 | CSV 列明文 ✓ | Data Description |
| A-D 四级 | 页面明文 ✓ | Abstract/Data Description |
| 双盲双评 | 页面明文 ✓ | Abstract/Methods |
| IAA | 未披露 | 全信源无数字 |
| baseline 精度 | 未披露 | Technical Validation 节缺席 |
| A-D 分布 | 未披露 | 无统计节 |
| orientation 标签 | 声称但未发布 | Abstract 声称 vs CSV 三列 |
| 设备信息 | 未披露 | 全信源无 |
推断边界铁律:上表’推算’与’未披露’行的数字,写作时必须保留状态标注——把推断写成原文是本库红线(对照 523 附录 F 的核算框架模式)。
附录 N:发布节奏的三形态对照(方法论专论)
| 形态 | 案例 | 顺序 | 风险 |
|---|---|---|---|
| 论文先行 | 526 ReXErr(arXiv→挂牌隔半年);522 RadGraph2(MLHC→挂牌一年) | 论文→数据 | 数据披露滞后于方法 |
| 论文-数据连发 | 527 Swiss-Mammo(JMIR 发表→挂牌 5 天) | 论文→数据(紧凑) | 几乎无——最佳实践 |
| 代码先行论文待产 | 528 TN-Mammo(GitHub→挂牌→论文未发) | 代码→数据→论文? | 描述权真空被第三方抢注(§10 实录) |
三形态的可信度排序:连发 > 先行 > 待产。第三形态的补救清单:官方预印本(arXiv 30 分钟)≥ 官方技术报告(Zenodo DOI)≥ README 详版描述——任何一种都比’引用块注释占位’强。TN-Mammo 的 Cairo Journal 抢注事件(哪怕数字全错)在 Google Scholar 已可被检索——数据集的学术叙事一旦被别人开写,纠正成本远高于抢先发布。
附录 O:使用前检查清单(10 项)
- ☐ 确认任务匹配:密度分类/多视图方法学/种群公平性(✓);病灶检测/多模态/预训练(✗)
- ☐ 引用 v1.0.0 DOI(1kx0-xc60)——勿用 latest(34kz-bk76)
- ☐ 年龄写 18-91(官方)——勿引第三方 42-74
- ☐ TN 展开写 Thong Nhat Hospital——勿写 triple negative / Thanh Nguyen
- ☐ 签 Restricted DUA——真实影像+年龄的再识别风险
- ☐ 按例划分防泄漏——同例四视图同折
- ☐ 标签噪声保守声明——IAA 未披露,引用精度时注明
- ☐ baseline 标注’自行复现’——Technical Validation 缺席,无官方数字
- ☐ orientation 自行处理——CSV 无此列
- ☐ 勿引 Cairo Journal 论文——数字三处硬冲突(附录 K)
附录 P:快问快答(一页纸)
| 问 | 答 |
|---|---|
| 几例几图? | 676 例 × 4 视图 = 2,704 JPEG(图数为推算) |
| 标签? | BI-RADS 密度 A-D(CSV 三列 ID/Labels/Age) |
| 谁标的? | 两放射科医生双盲+科主任共识(IAA 未披露) |
| TN 什么意思? | Thong Nhat Hospital——不是三阴 |
| 哪国人做的? | 越南(VNU-HCM+Tan Tao+Thong Nhat)+韩国 1 人 |
| 与 VinDr-Mammo? | 同国互补:676 单源密度 vs 20,000 多源多任务 |
| 访问? | Restricted(注册+DUA,无 CITI) |
| 论文? | 无(GitHub 代替;第三方论文不可信) |
| baseline? | 未公开——自己跑 GitHub(ResNet50+五折+CLAHE) |
| 年龄范围? | 18-91 岁(官方 CSV) |
| 伦理? | Thong Nhat 伦理委员会 43/2024/CN-BVTN-HDDD |
| 流量? | 277 views——中低 |
| 与 527 关系? | 乳腺双子:密度轴(影像)vs 评估类别轴(报告) |
| 一句话 | 越南统一医院的轻量密度金标——流程满分数字半分,种群公平性研究的东南亚素材 |
附录 Q:越南乳腺癌流行病学背景板(页面 Background 转录+整理)
| 指标 | 全球(GLOBOCAN 2022) | 越南(2022) |
|---|---|---|
| 女性新发病例 | 2,308,897(33 类癌中第二,仅次于肺癌) | 24,563(国内第二) |
| 占女性新发比例 | 11.6% | — |
| 死亡 | 665,684(第四位) | 10,008(国内第四) |
| 诊断时晚期占比(发展中国家叙事) | — | 晚期比例高(早筛参与度低的页面叙事) |
页面叙事链:早筛参与度低 → 晚发现 → 治疗难度大 → 生存率低 → AI 辅助筛查的需求。本条目的立项逻辑嵌在这个链条里:密度分类是早筛 AI 的前置质控(致密型人群的钼靶敏感性下降需要分流策略)。方法论注意:页面未给越南密度分布的流行病学基线(各 A-D 级的人群占比)——这正是本库可以回答(用 676 例)却未在页面回答的问题(A-D 分布未披露的又一次代价)。
附录 R:乳腺密度标注的 IAA 文献参考区间(为什么缺席是硬伤)
页面未披露 IAA,但文献里密度分型的观察者间一致性有成熟区间(写作引用时的保守参照):
| 研究场景 | 一致性口径 | 典型区间 |
|---|---|---|
| ACR 四级(A-D)双医生 | 完全一致率 | ~70-85% |
| A vs B+C vs D(粗分) | 完全一致率 | ~85-95% |
| 四级 κ | Cohen κ | ~0.55-0.75 |
| C/D 边界分歧 | 分歧占比 | 最高(10-20% 区间的主体) |
两条推论:①本条的双盲+共识协议若配 IAA 披露,预期落在 κ 0.6-0.75 区间(共识裁决后标签的一致性会高于原始双盲值——裁决把分歧收敛了);②裁决后标签的一致性数字与双盲一致性数字是两个不同的量——页面若补 IAA,需明确报的是哪个。复现者的实践含义:密度标签的 10-20% 潜在分歧率意味着单标签训练的密度分类器天花板受标注噪声约束——噪声鲁棒训练(label smoothing/软标签)是有价值的加层。
附录 S:三个现成的研究设计提案(用本库可立即执行)
S.1 迁移学习基线(入门级)
- 设计:ImageNet 预训练 ResNet50 → TNMammo 微调(五折)vs VinDr-Mammo 预训练 → TNMammo 微调(五折)
- 对比:从零 vs 同国大库迁移的密度分类精度差
- 预期叙事:同国(越南)迁移优于 ImageNet——种群/设备域差的实证
- 成本:GitHub 管线+两次训练,单 GPU 数小时
S.2 种群偏移定量(进阶级)
- 设计:DDSM(美国)/VinDr-Mammo(越南大库)/TNMammo(越南单院)三库互测矩阵(3×3 训练-测试组合)
- 指标:每格的 accuracy/F1/混淆矩阵——量化"设备域+人群域+采集协议"三重偏移的贡献
- 预期发现:跨设备域的性能降幅 > 同设备跨人群降幅(或相反——待实证)
- 意义:为"低资源地区部署美国/欧洲预训练模型"提供偏移定量模板
S.3 标注噪声鲁棒性(方法论级)
- 设计:在五折训练里加 label smoothing(ε=0.05/0.1/0.2)vs 硬标签对照
- 依据:密度判读 10-20% 分歧率的文献区间(附录 R)——硬标签把裁决噪声当真值
- 预期:软标签在小样本(676 例)上的泛化增益更明显
- 意义:给出"小库+噪声标签"场景的训练配方
附录 T:与 525 REFLACX 的对照(同为医院自主采集的小库)
| 维度 | 528 TN-Mammo(本条) | 525 REFLACX |
|---|---|---|
| 采集模式 | 医院 PACS(Thong Nhat) | Utah 校医院实验室 |
| 规模 | 676 例/2,704 图 | 2,616 图/3,052 读片 |
| 任务 | 密度分类(全局标签) | 眼动过程+椭圆定位+肺心框 |
| 标注 | 双盲+共识(IAA 缺席) | 五医生子集+质量控制 62 次剔除全录 |
| 格式决策 | DICOM→JPEG(轻量化) | MATLAB/Psychtoolbox 4K 采集原生 |
| 伦理 | 越南医院级批件 | 美国大学 IRB+NIH 资助 |
| 发布节奏 | 代码先行论文待产 | Sci Data 论文先行 |
| 访问档 | Restricted | |
| 库内角色 | 密度轴(乳腺影像侧) | 过程数据维度开启 |
共性规律:医院/实验室自主采集的小库都选 Restricted(即使内容差异巨大)——自主采集方对数据的主权意识强于派生数据方(对照 526 的 ODbL:母集已公开,派生自然开放)。两库的对照还揭示:标注质量的披露文化决定库的可信度上限——REFLACX 把 62 次剔除全录(细节透明),本条连 IAA 都没有(数字缺席)——同为小库,透明度差异决定引用者的放心程度。
附录 U:事实清单补遗(核查补充批,7 条)
- 页面 ref 3 的参考文献条目异常:‘Campbell SL, Gear CW. The index of general nonlinear DAEs. Numer Math. 1995’——一篇数值分析论文出现在乳腺癌背景的引用位(疑似引用编号错位/自动生成事故)——页面引用质量的又一瑕疵存照(对照 three/four 残留)。
- 页面 Release Notes 全文仅一句:‘This is the first public release of the TNMammo dataset.’——最简版发布说明(对照 527 v1.0.1 的双修正声明)。
- GitHub ex_mammo.png(示例钼靶图)2025-02-26 提交——代码仓库与挂牌的时间间隔 7 个月(等待期用途推断:伦理终审/PhysioNet 审核)。
- 页面 Acknowledgements 双感谢结构:Thong Nhat Hospital(数据)+AISIA/Tan Tao(实验与算法)——数据方与算法方的分工在致谢里显式。
- 页面 Usage Notes 的 Potential Applications 三分法(Supervised Learning/Feature Extraction/Multi-View Analysis)与 GitHub Features 四分法(Multi-view analysis/4 分类/多库支持/CV+评估+预处理)互补——页面面向用户、README 面向工程。
- 本条目核查快照:/tmp/528_page.txt(v1.0.0 页面 30,482 字符)、GitHub README WebFetch 快照——快照留存供复查。
- PhysioNet 官方 Databases 索引页(/about/database/)将本条列于 Open Access 区块的邻近位置但实际是 Restricted——索引页的区块划分与实际档位以条目页为准(索引页只按字母序不按档位——浏览检索时注意)。
附录 V:四视图规格账本与目录矩阵(规范推导)
按命名规范重建的完整目录账本(676 目录 × 4 文件;ID 连续性与连续区间需下载后核验——本表为规范推导账本):
| 视图 | 文件名模式 | 覆盖区域 | 数量 |
| left_cc | left_cc.jpg | 左乳中央+内侧(头尾位) | 676 |
| left_mlo | left_mlo.jpg | 左乳全域+外上象限+腋尾(斜位) | 676 |
| right_cc | right_cc.jpg | 右乳中央+内侧(头尾位) | 676 |
| right_mlo | right_mlo.jpg | 右乳全域+外上象限+腋尾(斜位) | 676 |
| 合计 | — | 每例四联全域覆盖 | 2,704 |
CC 与 MLO 的互补几何:CC 是从头侧向足侧的投照(胸大肌可见度低、内侧覆盖好);MLO 是 30-60° 斜角投照(胸大肌显影、外上象限——癌发最高区域——覆盖最好)。四联的意义:单视图的乳腺覆盖盲区由另一视图补齐——多视图融合模型的解剖学理由。
目录矩阵的使用检查:①每目录必须恰 4 文件(缺一即数据不完整——下载后 find images -name "*.jpg" | wc -l 应=2,704);②CSV 的 ID 集合与目录名集合应完全一致(comm 校验);③Labels 的值域应恰为 {A,B,C,D}(枚举校验);④Age 应全为正整数(类型校验)。四步校验是数据入库的第一小时动作。
附录 W:批评对话体——三位质疑者与回应
质疑者 A(统计学家):“676 例的四分类,你的置信区间有多宽?”
回应:按 A-D 若均衡(各 ~169 例),四分类 accuracy 的 95% CI 半宽约 ±3.5%(n=676);若分布偏斜(如 A 占 40%、D 占 10%),稀有类的类内 CI 更宽。这是页面 A-D 分布未披露的实际代价——复现者连 CI 都算不准,只能假设均衡给下界。分布披露是统计可用性的第一块砖。
质疑者 B(放射科医生):“密度判读 10-20% 的分歧率,你的共识标签还剩多少信息?”
回应:共识裁决把分歧收敛为单一标签——但收敛的方向(裁决者的偏好)成为标签的隐藏偏置。文献对照:裁决后标签的一致性(对金标准如病理密度或 MRI 定量)通常优于任一单读者,但"优于"的幅度取决于裁决者的经验——本条的科主任资历未披露。诚实的说法:标签是’医院实践标准的共识’,不是’定量金标’(MRI 或 Volpara 自动密度的对照缺失)。
质疑者 C( fairness 研究者):“单院便利抽样,你凭什么代表越南?”
回应:不代表——本条只代表 Thong Nhat 医院筛查人群。页面 Limitations 第四条自认(“single source … affect model generalization”)。公允的用法:把本条当一个东南亚城市公立医院的数据点(n=1 的案例研究),与其他国家的其他医院数据点比较——种群结论需要多数据点汇聚,单库结论止步于"该医院人群"。
三位质疑者的共同指向:本条的可用性边界比页面声称的更窄——但边界内的价值(密度 basline、迁移靶域、公平性素材)依然成立。透明披露边界恰恰是本条页面比多数同类库诚实的地方(四连 Limitations)。
附录 X:与 519 MS-CXR-T 的"扰动"方法论对照
| 维度 | 519 MS-CXR-T | 528 TN-Mammo(本条) |
|---|---|---|
| 扰动类型 | 局部病灶强度扰动(正常-反事实对) | 无扰动(原始采集) |
| 金标 | 扰动区域+转移分数(人工验证) | 密度四级(双盲+共识) |
| 任务 | 局部异常的可解释性对齐 | 全局密度分类 |
| 与本条的结合点 | — | 扰动敏感性测试的参考框架 |
结合提案(降级版):用 519 的"局部扰动→预测翻转"思路测本条密度模型的决策依据——对乳腺区域做局部强度/纹理扰动,观察密度预测的翻转率与翻转位置。与 519 的差别:无反事实金标(519 有 MIT 人工验证的扰动对),本提案只能做无金标的敏感性画像(哪里扰动最敏感=模型认为哪里最"致密")。结论:方法论可移植但金标降级——519 的"扰动+金标"完整范式仍是库内独一档。
附录 Y:批次八账本(截至本条)
| 位置 | 条目 | 状态 | 生产会话 |
|---|---|---|---|
| 526 | ReXErr-v1 | 并行会话在产(本会话让出 FACTS+part1) | 并行 |
| 527 | Swiss-Mammo | ✅ rid 627 上线(双发处置:DELETE 626 留 627) | 本会话 |
| 528 | TN-Mammo(本条) | 本会话在产 | 本会话 |
| 529 | VinDr-PCXR | 待产(越南三连第二发) | — |
| 530 | VinDr-SpineXR | 待产(越南三连第三发) | — |
| 531-535 | Grand Challenge 五连 | 待产 | — |
本条目的三条批次级贡献:
- 乳腺家族影像侧开篇(527 文本+528 影像)——BI-RADS 双轴在批次八内集齐
- 越南三连启幕——本条+529+530 的 Ha-Hieu Pham 人物线贯穿
- 两个治理案例入库——Technical Validation 承诺缺席(页面质量)+第三方论文抢注(学术生态)——批次八的"页面考古/学术生态"双主题由 527/528 各扛一案
下一发预排:529 VinDr-PCXR(延续越南线,Scientific Data 论文+多医院联盟的标准强库——与本条的"轻量+无论文"形成三连内部的对照)。
附录 Z:一页纸数据卡(机器可读风格汇总)
dataset_id: tn-mammo-breast-density
version: 1.0.0
published: 2025-10-04
doi_version: 10.13026/1kx0-xc60
doi_latest: 10.13026/34kz-bk76
rrid: SCR_007345
access: Restricted (License 1.5.0 + DUA, no CITI)
modality: mammography (FFDM → minimal-compression JPEG)
subjects: 676
views_per_subject: 4 (left_cc, left_mlo, right_cc, right_mlo)
images_total: 2704 (derived: 676 x 4)
age_range: 18-91
labels: BI-RADS density A/B/C/D (subject-level)
annotation: double-blind dual radiologist + head adjudication
iaa: NOT DISCLOSED
baseline_metrics: NOT DISCLOSED (Technical Validation section absent)
train_val_test: NOT PROVIDED (5-fold CV in GitHub code, group-by-ID)
source_hospital: Thong Nhat Hospital, Ho Chi Minh City
collection_window: 2022-01 to 2024-06
sampling: convenience
exclusions: prior breast cancer / breast surgery / pregnancy / quality defects
ethics_approval: No. 43/2024/CN-BVTN-HDDD (2024-03-04)
team: 10 authors, 3 countries (VN x9 institutions + KR x1)
key_person: Ha-Hieu Pham (VinDr network bridge)
code: github.com/LeHongCat/TNMammo (ResNet50 + 5-fold + CLAHE)
companion_paper: NONE (third-party paper 2025-12 NOT authoritative)
known_limitations: size 676 / density-only labels / single modality / single source
views_count: 277
library_rid: 627 (swiss-mammo was 627; THIS IS 628 -> confirm at publish)
(本数据卡为本条目核查汇总——library_rid 行在发布时回填;格式照 527 模板,便于库内机器检索。)
附录 AA:更新触发器(官方论文发布后的版本考古预案)
本条目预留三个更新触发点(官方动态的监控清单):
- 官方论文发布(预期补齐:IAA 数字、A-D 分布、Technical Validation 数字、设备信息)→ FACTS §4/§6/§11 更新 + 条目正文 §4/§5 增补 + 本附录记录版本
- v1.0.1/新版本发布(可能内容:orientation 标签补发、官方划分补发、新增受检者)→ 版本考古节更新 + DOI 对照表追加
- Cairo Journal 论文的引用扩散监测(Google Scholar 引用该二手论文的文献)→ 若高被引则本条目的"二手污染"警示升级为"污染传播链"记录——学术生态的负面案例存档价值
附录 AB:与库内“乳房/乳腺”字面条目的检索对照
| 条目 | 乳腺相关内容 | 与本条的关系 |
|---|---|---|
| 527 Swiss-Mammo | BI-RADS 0-6 报告文本(德语) | 双轴互补(评估类别 vs 密度) |
| 528 TN-Mammo(本条) | BI-RADS A-D 影像金标 | — |
| 529 VinDr-PCXR(预告) | 非乳腺(儿童胸片) | 团队连续性(Ha-Hieu Pham) |
| 617 MIMIC-CXR-JPG | 非乳腺(胸片) | 无直接关系(检索噪音源) |
检索提示:站内搜索“mammo”会同时命中 MIMIC-CXR(mammography 词汇干扰不存在但 mammo 前缀相近)、Swiss-Mammo、TN-Mammo——精确检索用全 slug。本条目 slug(tn-mammo-breast-density)与 527(swiss-mammo)的后缀差异(breast-density 有/无)反映各自任务重心——命名即定位的又一个案例。
(附录 AB 完——条目全文完)
全文结束存照:本条目核查完成于 2026-09-25(批次八第 2.5 条),快照留存 /tmp/528_page.txt 与 GitHub README 快照;官方论文发布后按附录 AA 触发器更新。继续跑,不停。
遗留验证项汇总(下载后 10 分钟完成)
| 项 | 命令/动作 | 预期 |
|---|---|---|
| 总图数 | find images -name “*.jpg” \ | wc -l |
| 目录-CSV 一致 | comm 校验 ID 集合 | 双向无差集 |
| Labels 值域 | cut -d, -f2 \ | sort -u |
| A-D 分布 | cut -d, -f2 \ | sort \ |
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- udiat — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 肿瘤学
- oasbud — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 肿瘤学
- ham10000 — 共享标签:医学影像 / 图像分类 / 肿瘤学
- ddti — 共享标签:医学影像 / 图像分类 / 肿瘤学
- busi — 共享标签:医学影像 / 乳腺影像 / 图像分类
- inbreast — 共享标签:医学影像 / 乳腺影像 / 图像分类
- bach — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 肿瘤学
- panda — 共享标签:医学影像 / 图像分类 / 肿瘤学
- breakhis — 共享标签:医学影像 / 图像分类 / 肿瘤学
- bracs — 共享标签:医学影像 / 图像分类 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

