信息速览
BUSI — 乳腺超声三分类与病灶分割 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | BUSI(Breast Ultrasound Images Dataset) |
| 英文全称 | Dataset of breast ultrasound images(Breast Ultrasound Images Dataset) |
| 别名/简称 | BUSI、Dataset_BUSI_with_GT(带掩膜发布目录名) |
| 疾病分类 | 乳腺癌(ICD-11:2C60 乳房恶性肿瘤;2F32 乳房良性肿瘤) |
| SNOMED CT | 254837009 Malignant tumor of breast / 302838005 Benign neoplasm of breast / 76752008 Breast structure(详见 §2.1b) |
| 数据模态 | B 型灰阶二维乳腺超声(静态 PNG 图像) |
| AI 任务类型 | 三分类(正常/良性/恶性)、良恶性二分类、病灶语义分割、少样本学习、不确定性估计 |
| 样本总数 | 780 张图像 / 798 张掩膜 / 600 名女性患者 |
| 数据大小 | 约 266 MB(1,578 个文件) |
| 数据格式 | PNG(原图)+ PNG(二值掩膜,0/255) |
| 许可证 | GNU Free Documentation License 1.3(Kaggle 镜像标注);数据论文以 CC BY 开放获取发表 |
| 访问级别 | 开放(无需注册申请) |
| DUO 标签 | NRES(类比;官方未发布正式 DUO 声明) |
| 语言 | 英文(论文与文件命名;影像本身不含诊断文本) |
| 首发日期 | 2019-11-21(在线首发)/ 2020-02(Data in Brief 第 28 卷刊出) |
| 最后更新 | 2020-02(此后官方未再更新;去重与整理版由第三方发布) |
| 发布机构 | 开罗大学计算机与人工智能学院 / 开罗大学国家肿瘤研究所 |
| 官方主页 | https://www.scholar.cu.edu.eg/?q=afahmy/pages/dataset |
| 下载地址 | https://www.kaggle.com/datasets/aryashah2k/breast-ultrasound-images-dataset |
| DOI | 10.1016/j.dib.2019.104863 |
| 引用次数 | 1,200+(OpenAlex 索引,截至 2026-09;Scopus 记录 790) |
| AI 就绪度评分 | ⭐⭐(2/5)— PNG 与掩膜开箱即用、获取零门槛;扣分项:无官方划分与患者级 ID、存在重复图像与标注冲突、官方无预处理脚本 |
| 页面状态 | published |
§0 E-E-A-T 审核与免责声明
医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(乳腺超声影像学基础与乳腺癌诊断路径)、§7 偏倚分析。
数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。BUSI 通过开罗大学官方学者页与 Kaggle 镜像开放获取,Kaggle 镜像页面标注 GNU Free Documentation License 1.3,原始数据论文以 CC BY 开放获取形式发表于 Data in Brief。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? BUSI 是埃及开罗大学于 2020 年正式发布的乳腺超声图像数据集,包含 780 张 B 型灰阶超声图像,来自 600 名 25 至 75 岁的女性患者。每张图像按病灶性质归入正常(133 张)、良性(437 张)、恶性(210 张)三个目录,其中病灶图像配有放射科医师勾画的像素级分割掩膜,可直接用于训练和评估分割模型。
为什么重要? 乳腺超声是钼靶之外最常用的乳腺癌筛查与诊断手段,但公开可用的带像素级标注的乳腺超声数据集极为稀缺。BUSI 以零门槛的获取方式、完整的三分类标签和分割掩膜,成为全球乳腺超声 AI 论文中被引用最多的基准数据集之一——截至 2026-09,其数据论文已被引用超过 1,200 次(OpenAlex 索引)。同时,它也是「数据质量决定基准可信度」的典型案例:重复图像与标注冲突会显著虚高性能数字,值得每一位研究者引以为鉴。
我能用它做什么? 你可以用它训练乳腺病灶语义分割模型(U-Net 系列为主流基线)、训练良恶性二分类器(去掉正常类)、做迁移学习与少样本学习实验、或评估模型的不确定性与跨中心泛化能力。但请注意:它没有官方训练/测试划分,也没有患者级 ID,直接随机划分会导致数据泄漏,请务必先阅读 §5 与 §6.5 的坑点再动手。
§1.1 技术摘要
BUSI(Breast Ultrasound Images Dataset)由 Al-Dhabyani、Gomaa、Khaled、Fahmy 四位作者完成,分别隶属开罗大学计算机与人工智能学院与开罗大学国家肿瘤研究所,数据于 2018 年采集自开罗 Baheya 妇女癌症早期检测与治疗医院,数据论文 Dataset of breast ultrasound images 于 2019-11-21 在线首发、2020 年刊出于 Elsevier Data in Brief 第 28 卷(DOI: 10.1016/j.dib.2019.104863)。数据集共 780 张 PNG 图像(平均尺寸约 500×500 像素,宽度分布在 310–719 像素之间),按三类组织:正常 133 张、良性 437 张、恶性 210 张;病灶图像附像素级二值掩膜,同图多病灶时提供多张掩膜文件,全库掩膜共 798 张。标注以 {类别} (序号)_mask.png 命名与原图配对。数据集发布后迅速成为乳腺超声分割与分类事实上的标准基准;后续第三方研究(如 arXiv:2508.17768)系统指出其存在重复图像、重复图像对之间标注冲突、少量非乳腺超声图像混入等结构性缺陷,并发布了 BUSI-A1/A2/A3 等去重版本。所有这些质量问题与应对策略在本页 §6.5 与 §7 中完整展开。快速印象:它同时是「最容易上手的乳腺超声数据集」和「最容易被错误使用的乳腺超声数据集」,这两个判断贯穿全篇。
§1.2 战略价值
维度一:基准生态位价值。 在乳腺超声这一模态上,公开数据集长期呈现「小规模、难获取、标注不全」的局面,BUSI 是少数同时满足「免费开放、像素级掩膜、三分类标签、批量可下载」四个条件的数据集。这使其成为分割与分类新方法的默认试金石:从经典 U-Net 变体到 Transformer 混合架构(HAU-Net、U-KAN、TransUNet),再到 SAM 微调(BUSI-SAM)与 MedSAM 剪枝研究,几乎所有乳腺超声分割新论文都会报告 BUSI 结果。对研究者而言,在 BUSI 上与历史文献可比,是方法可信度的重要背书;对本库而言,它是「乳腺影像」标签下互链相关度的核心节点。
维度二:数据质量研究的教学样本价值。 BUSI 的结构性缺陷——重复图像、重复图像对之间的标注冲突、无患者级 ID、混入非乳腺超声图像——已被多项后续研究系统性地剖析与量化。在严格去重协议下,分割 Dice 从 0.7514 回落到 0.7144(虚高约 0.037);跨域测试时,域内 Dice 0.7726 的模型在独立数据集上骤降至 0.4855。这一「基准虚高 → 去重回落 → 跨域崩塌」的完整证据链,使 BUSI 成为讲授医学 AI 数据泄漏、划分策略与泛化评估的最佳真实案例,其教学价值甚至超越了它作为排行榜基准的原始用途。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标注 | 与 BUSI 的差异化 |
|---|---|---|---|---|
| BUSI(原始版) | 780 张图像 / 600 名患者 | 乳腺超声 B 型灰阶 | 三分类标签 + 像素级掩膜 | 获取零门槛、社区事实标准;但含重复图像与标注冲突 |
| BUSI-A1/A2/A3(去重版) | 删除重复对后的三个变体 | 同上 | 保留原标注(A3 由放射科医师复核) | arXiv:2508.17768 发布,消除重复泄漏 |
| Curated BUSI | 原始规模的质量整理版 | 乳腺超声 | 修正标注不一致 | 第三方(Universidad de Oviedo)发布于 Zenodo,CC BY 4.0 |
| 629 张多标签整理版 | 629 张图像 | 乳腺超声 | 多标签二值语义分割 | Universidad de La Rioja 发布于 Zenodo,按 70-20-10 划分 |
| UDIAT | 163 张图像 | 乳腺超声 B 模式 | 良性(109–110)/ 恶性(53–54) | 西班牙 UDIAT 诊断中心;常用作 BUSI 的跨域外部验证对照 |
| BUSI-WHU | 武汉大学整理发布的乳腺超声数据集 | 乳腺超声 | 像素级掩膜 | BUSI-SAM 论文的第二验证集,用于评估方法稳健性 |
§1.4 版本时间轴
| 时间 | 版本/事件 | 说明 |
|---|---|---|
| 2018 | 数据采集 | 600 名女性患者,Baheya 医院,开罗 |
| 2019-11-21 | 数据论文在线首发 | Data in Brief(Elsevier),开放获取 |
| 2020-02 | 正式刊出 | 第 28 卷,文章号 104863,此后官方未再更新 |
| 2025–2026 | 第三方整理版陆续发布 | Curated BUSI(Zenodo DOI 10.5281/zenodo.19047973)、629 张多标签版(Zenodo DOI 10.5281/zenodo.21128639)、BUSI-A1/A2/A3(随 arXiv:2508.17768 论文发布) |
| 2026 | 生态现状 | OpenAlex 引用 1,200+;去重与整理工作仍在持续产出,官方版保持 2020 年快照不变 |
版本使用原则:正文引用默认指 2020 官方快照;凡与去重版相关的数字,本页一律显式标注 A1/A2/A3 或 Curated 版本名,避免与官方版数字混淆。
§1.5 典型应用场景
- 乳腺病灶语义分割基准测试:用像素级掩膜评估 U-Net 系列与 Transformer 混合架构,严格协议下 U-KAN 五折 Dice 0.7427 居首(见 §8.1)。
- 良恶性二分类:去掉正常类后的 647 张病灶图像上训练分类器,主流 CNN 五折患者级交叉验证准确率可达 89%–92%。
- 迁移学习与少样本学习:ImageNet 预训练权重迁移至超声域;元学习方法(ProtoNet + ResNet50,10-shot)准确率 88.9%,显著高于迁移学习基线的 83.1%。
- 不确定性与可信 AI 研究:MC Dropout 与 Deep Ensemble 的认知不确定性估计、去重前后校准曲线对比(arXiv:2508.17768 的核心实验设计)。
- 跨中心泛化与域自适应教学:以 UDIAT、Breast-Lesion-USG、BUS-UCLM 为外部测试集,量化单中心模型的泛化崩塌幅度(§7.3、§7.8)。
以上场景共享同一条纪律:任何基于 BUSI 得出的结论,都应附带去重声明与至少一个外部数据集的结果——这已是从业社区在 2026 年的共识基线。
§2 医学背景
§2.1 ICD-11 编码映射
| BUSI 标签 | ICD-11 编码 | 中文名称 | 术语说明 |
|---|---|---|---|
| malignant | 2C60 | 乳房恶性肿瘤 | Malignant neoplasm of breast,涵盖乳腺各亚位恶性肿瘤 |
| benign | 2F32 | 乳房良性肿瘤 | Benign neoplasm of breast,含纤维腺瘤等常见良性病灶 |
| normal | 不适用 | 无病灶乳腺超声所见 | 正常声像图,不对应肿瘤编码 |
注:BUSI 的图像级标签源于病灶学诊断结论,粒度粗于 ICD-11 的亚位编码;原始论文未提供病例级病理编码,上表为本页基于标签语义建立的映射,供检索与知识组织使用。
§2.1b SNOMED CT 映射
| BUSI 标签 | SNOMED CT 码 | 英文术语 | 说明 |
|---|---|---|---|
| malignant | 254837009 | Malignant tumor of breast (disorder) | 乳腺恶性肿瘤,概念覆盖浸润癌与原位癌的上级概念 |
| benign | 302838005 | Benign neoplasm of breast (disorder) | 乳腺良性肿瘤 |
| normal | 76752008 | Breast structure (body structure) | 正常乳腺解剖结构(体结构轴) |
注:SNOMED 编码为概念级映射,非 BUSI 原始发布内容;用于本地知识库组织时请在数据字典中注明映射者与映射日期,便于后续版本追溯。
§2.2 疾病简介与流行病学
乳腺癌是全球女性新发病例数居首的恶性肿瘤。据全球癌症统计项目 GLOBOCAN 2020(Sung et al., 2021, CA: A Cancer Journal of Clinicians, DOI: 10.3322/caac.21660),女性乳腺癌无论新发病例数还是女性癌因性死亡构成比均居女性恶性肿瘤前列,早诊早治可显著降低病死率。影像学检查是早诊的核心手段:钼靶(乳腺 X 线)适合人群筛查,但对致密型乳腺敏感度下降;超声无电离辐射、对致密型乳腺与囊实性鉴别敏感,是年轻女性与致密型乳腺人群的重要补充检查。超声声像图上,良性病灶多表现为形态规则、边界清晰、后方回声增强的椭圆形低回声区,恶性病灶则常呈形态不规则、边缘毛刺、纵横比大于 1、伴后方声衰减等特征;BI-RADS(Breast Imaging Reporting and Data System)分类是乳腺影像报告的通用语义框架,但 BUSI 未提供 BI-RADS 分级标注,仅提供正常/良性/恶性三类结论性标签。这一「标签粒度粗于临床报告」的差异,决定了 BUSI 适合训练「病灶检出与良恶性判别」类模型,而不适合训练 BI-RADS 自动分级模型。
良性与恶性病灶在声像图上的典型差异如下表,BUSI 的像素级掩膜恰好是计算这些形态学特征的输入来源,可支撑「形态学特征 → 良恶性」的可解释性建模:
| 声像特征 | 良性病灶典型表现 | 恶性病灶典型表现 |
|---|---|---|
| 形态 | 椭圆形、规则 | 不规则、分叶状 |
| 边界 | 清晰、包膜感 | 毛刺、成角、模糊 |
| 纵横比 | 多小于 1(平行生长) | 多大于 1(垂直生长) |
| 后方回声 | 增强多见 | 衰减(声影)多见 |
| 内部回声 | 均匀低回声 | 不均匀、混合回声 |
§2.3 临床任务定义
| 任务 | 定义 | 在 BUSI 上的实现方式 | 临床环节 |
|---|---|---|---|
| 病灶分割 | 在声像图中逐像素勾画病灶边界 | 以 _mask.png 为像素级监督,训练语义分割网络 |
定量测量(长径、面积、形态学特征) |
| 良恶性二分类 | 判别病灶良性或恶性 | 仅用 benign(437)与 malignant(210)共 647 张图像;正常类无肿瘤、不参与该任务 | 诊断决策支持 |
| 三分类 | 正常/良性/恶性图像级判别 | 780 张图像全量参与 | 阴性排除 + 诊断 |
| 病灶检测/计数 | 定位图像内病灶 | 多病灶样本的多张掩膜可反演实例数;官方无检测框标注 | 漏诊防范 |
| 不确定性估计 | 为预测输出置信度,供人工复核排序 | MC Dropout / Deep Ensemble(协议见 arXiv:2508.17768) | 标注与阅片工作流提效 |
§2.4 患者人群画像
| 属性 | 内容 | 来源与说明 |
|---|---|---|
| 来源机构 | Baheya 妇女癌症早期检测与治疗医院 | 埃及开罗,单一中心 |
| 采集时间 | 2018 年 | 数据论文与第三方综述一致记载 |
| 样本量 | 600 名女性患者的 780 张图像 | 官方学者页 |
| 年龄 | 25–75 岁 | 官方学者页;未公布年龄分布直方图 |
| 性别 | 全部为女性 | 乳腺超声检查人群属性 |
| 种族/族裔 | 未披露 | 论文未提供人口统计学细分 |
| 就医类型 | 未细分(筛查与诊断混合) | 论文未说明受检者就诊路径 |
| 病理金标准 | 未逐例公布病理对照 | 标签为影像诊断结论,病理一致性未量化 |
| 多病灶情况 | 同图多病灶样本存在(掩膜 798 张对图像 780 张) | Kaggle 目录文件计数 |
§2.5 临床价值与转化路径
对临床而言,BUSI 支撑的 AI 模型理想情况下可服务于三个环节:其一,扫查辅助——实时提示可疑病灶位置,降低漏诊率,尤其针对低年资超声医师;其二,定量描述——自动勾画病灶并计算长径、面积、纵横比、边缘锐利度等形态学指标,减少手工测量与观察者间差异;其三,分诊提示——良恶性概率输出辅助 BI-RADS 分级前的初筛。但必须强调转化前提:BUSI 为埃及单中心、单一检查场景、600 人的小规模队列,且存在 §7.1 所列偏倚,任何模型在进入临床验证前都必须完成多中心外部验证(§7.8 提供了可参考的外验矩阵),当前发表数字不能作为临床有效性证据。
从方法学承接看,BUSI 支撑的三类下游产物已有清晰路径:其一,形态学特征提取——基于掩膜计算纵横比、边缘锐利度、面积周长比等指标,与 BI-RADS 语义对齐做可解释建模;其二,预训练初始化——在私有大规模数据训练前,用 BUSI 预热分割网络,缓解新中心冷启动;其三,预标注器——分类模型嵌入主动学习循环,为新采集数据生成候选标注,降低人工勾画成本。三条路径共同的边界是:它们都是「辅助」角色,替代医师的最终判读在任何指南框架下都缺乏证据。
§2.6 标注金标准
| 维度 | 内容 |
|---|---|
| 标签类型 | 图像级三分类标签(normal/benign/malignant)+ 病灶像素级二值掩膜 |
| 标注方式 | 人工在原图上勾画病灶轮廓,导出为与原图同尺寸的掩膜 PNG |
| 标注者 | 论文未披露标注人数、资质与资历(已知信息缺口) |
| 一致性指标 | 未报告标注者间一致性(如 Dice/Kappa),重复图像对的掩膜不一致提示标注存在观察者间差异 |
| 金标准性质 | 影像诊断结论(非逐例病理对照);掩膜作为分割任务金标准使用 |
| 已知问题 | 重复图像、重复图像对标注冲突、少量非乳腺超声图像混入(详见 §7.2) |
| 复标建议 | 关键实验抽样双人复标 100 张并报告一致性(本页 §7.2) |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 复现主流论文基准、与历史文献可比 | 原始 BUSI(官方学者页或 Kaggle aryashah2k 镜像) | 约 266 MB | 历史文献(含宽松划分论文)几乎全部基于原始版 |
| 严格的泛化与不确定性研究 | BUSI-A1/A2/A3 去重版(arXiv:2508.17768) | 与原始版相近 | 消除重复图像泄漏,A3 保留放射科医师判定的最准确标注 |
| 多标签语义分割 / MedSAM 类研究 | 629 张多标签整理版(Zenodo DOI 10.5281/zenodo.21128639) | 小于原始版 | 已按 70-20-10 划分,二值语义分割格式 |
| 教学 demo、快速原型 | Kaggle subhajournal 镜像(Dataset_BUSI_with_GT) | 266.19 MB,1,578 个文件 | 目录结构规整、一键下载 |
| 报告可辩护的排行榜数字 | Awesome-Segmentation-in-Medical 严格五折协议 | — | 消除划分随意性,横向可比(§8.1) |
| 需要 BI-RADS 分级标签训练分级模型 | 无可用版本 | —— | BUSI 未标注 BI-RADS,请改用含 BI-RADS 标签的数据集 |
§3.1 模态详情
BUSI 为 B 型(brightness mode)灰阶二维超声静态图像。每张图像对应一次超声扫查中含局灶性乳腺病变(或正常乳腺组织)的画面,经采集后导出为 PNG 位图,平均尺寸约 500×500 像素,宽度分布在 310–719 像素之间。图像保留了超声机的原始成像风格:灰阶回声纹理、深度标尺、以及部分帧顶部或侧边烧录的设备参数与体标文字。数据集不含多普勒血流图、弹性图或三维容积数据,也不含 DICOM 原始文件——所有像素信息均封装在 PNG 内,超声设备的原始参数(深度、增益、频率)不可恢复。
单张图像的构成要素及其对 AI 训练的影响:
| 图像构成要素 | 是否保留 | 对 AI 训练的影响 |
|---|---|---|
| 灰阶回声纹理 | 保留 | 模型学习的主要信号来源 |
| 深度标尺与刻度条 | 保留 | 边缘位置特征噪声,建议裁剪或容忍 |
| 烧录设备文字 | 保留(导出即含,无法关闭) | 可能被模型误学为捷径特征,建议边缘裁剪 |
| 体标(左右方位标记) | 保留 | 方位信息,对乳腺左右侧判别轻度有用 |
| DICOM 原始采集参数 | 不保留 | 无法做设备级归一化与参数复原 |
§3.2 子集构成
| 类别目录 | 图像数 | 掩膜数 | 图像占比 | 说明 |
|---|---|---|---|---|
| normal | 133 | 133 | 17.05% | 无肿瘤;掩膜为全黑图(无病灶像素) |
| benign | 437 | 454 | 56.03% | 良性病灶;多病灶样本含多张掩膜 |
| malignant | 210 | 211 | 26.92% | 恶性病灶;多病灶样本含多张掩膜 |
| 合计 | 780 | 798 | 100% | 目录文件总数 1,578(原图 + 掩膜) |
注:良性 437 张图像对应 454 张掩膜、恶性 210 张对应 211 张掩膜,掩膜多于图像的部分来自同图多病灶(多实例);三类目录掩膜计数 normal 266 / benign 891 / malignant 421 的口径为「目录内全部文件数(原图 + 掩膜)」。
三类目录的文件计数明细:
| 目录 | 原图 | 掩膜 | 目录文件合计 |
|---|---|---|---|
| normal | 133 | 133 | 266 |
| benign | 437 | 454 | 891 |
| malignant | 210 | 211 | 421 |
| 合计 | 780 | 798 | 1,578 |
§3.3 文件格式
| 内容 | 格式 | 编码 | 命名规则 |
|---|---|---|---|
| 原图 | PNG | 位图(建议统一按三通道读取后转灰度使用) | {类别} (序号).png |
| 掩膜 | PNG | 二值图,病灶像素 255、背景 0 | {类别} (序号)_mask.png |
| 多病灶附加掩膜 | PNG | 同上 | {类别} (序号)_mask_1.png(编号递增) |
| 患者元数据 | 无 | —— | 官方未发布任何表格文件 |
§3.4 存储大小
| 项目 | 数值 |
|---|---|
| 压缩包(Kaggle subhajournal 镜像) | 266.19 MB |
| 文件总数 | 1,578 个(780 原图 + 798 掩膜) |
| 解压后占用 | 约 266 MB |
| 峰值内存(全库 8-bit 缓存) | 约 0.5–1 GB(视缓存方式) |
| 建议预留磁盘(含预处理缓存) | 2 GB |
§3.5 标注方式
标注为人工像素级标注:在原图上勾画病灶区域并生成二值掩膜,属于强监督标注;图像级类别标签(normal/benign/malignant)来自影像诊断结论。无弱监督或自动预标注环节说明。掩膜与原图严格同名配对(_mask 后缀),同图多病灶以 _mask_N 递增编号区分。
可推断的标注工作流(依据命名规则与掩膜结构反推):
| 步骤 | 内容 |
|---|---|
| 1 | 依据影像诊断确定图像级类别,归入 normal/benign/malignant 目录 |
| 2 | 在原图上逐像素勾画病灶轮廓 |
| 3 | 导出与原图同尺寸的二值掩膜(255 病灶 / 0 背景) |
| 4 | 以 _mask 后缀命名保存;同图多病灶追加 _N 编号 |
| 5 | 官方未公开质检环节(标注复核率、抽检比例均未知) |
§3.6 标注者资质与一致性
原始论文未披露标注者人数、放射科资历(年资、亚专科)与标注培训流程,也未报告标注者间一致性指标(Dice、Kappa 等)。后续研究(arXiv:2508.17768)发现重复图像对被不同标注者给出不同的掩膜,直接证明观察者间差异的存在且未被量化。使用本数据集时,应将掩膜视为「单一金标准近似」而非「无噪声真值」,必要时在协议中说明这一限制。
§3.7 采集周期
数据采集于 2018 年一个自然年内,属于横断面回顾性收集;数据论文 2019-11-21 在线首发、2020 年正式刊出,此后官方未追加数据或发布新版本。官方发布语义上等价于单一 v1.0 快照;引用与下载请以数据论文 DOI 为准,Kaggle 镜像仅作为便利入口,镜像与官方版可能存在打包差异(文件数一致,压缩与目录命名不同)。
§3.8 地域覆盖
单一国家、单一城市、单一医院:埃及开罗 Baheya 妇女癌症早期检测与治疗医院。无多中心数据,地理与人群多样性有限(见 §7.1 偏倚分析)。单中心属性也意味着标签口径与图像导出管线高度一致——这是 BUSI 内部实验「干净」的一面,与外部世界的全部差异都留给了泛化环节。
§3.9 设备规格
原始论文与官方页面均未披露超声设备厂商、型号、探头类型、频率、深度与增益设置。这对使用者意味着:无法按设备分层评估,也无法在预处理中做设备归一化;模型学到的斑点噪声纹理与增益风格绑定于该未知设备(详见 §7.6 数据漂移)。
设备信息缺失的后果与替代动作:
| 缺失字段 | 直接后果 | 可行动作 |
|---|---|---|
| 设备厂商/型号 | 无法按设备分层评估与消融 | 以外部数据集验证代替设备分层 |
| 探头频率 | 无法推断分辨率一致性 | 用图像级分辨率统计做近似画像 |
| 深度/增益设置 | 无法做物理量纲归一化 | 直方图匹配等统计归一化替代 |
| 检查体位/扫查手法 | 无法建模操作者间差异 | 在限制章节如实声明 |
§3.10 深度溯源链
| 层级 | 内容 |
|---|---|
| 数据论文(DOI 10.1016/j.dib.2019.104863) | ScienceDirect 文章页,含采集协议、伦理说明与引用格式 |
| 官方下载页 | 开罗大学 Aly Fahmy 学者页,Google Drive 直链 |
| Kaggle 主镜像 1 | aryashah2k/breast-ultrasound-images-dataset,多篇论文引用的获取入口 |
| Kaggle 镜像 2 | subhajournal/busi-breast-ultrasound-images-dataset,目录名 Dataset_BUSI_with_GT,266.19 MB / 1,578 文件 |
| 第三方质量研究 | arXiv:2508.17768(去重与不确定性)、Curated BUSI(Zenodo 10.5281/zenodo.19047973) |
| 社区数据字典 | openmedlab 与 CHY-coder 的 Awesome-Medical-Dataset 词条(分辨率统计与中文描述) |
§4 数据结构
§4.0 目录树
数据解压后的目录结构如下(以 Kaggle 镜像 Dataset_BUSI_with_GT 为例):
Dataset_BUSI_with_GT/
├── benign/
│ ├── benign (1).png # 原图:良性第 1 例
│ ├── benign (1)_mask.png # 原图第 1 例的病灶掩膜
│ ├── benign (10).png
│ ├── benign (10)_mask.png
│ ├── benign (10)_mask_1.png # 同图第二处病灶的附加掩膜(如存在)
│ └── ...
├── malignant/
│ ├── malignant (1).png
│ ├── malignant (1)_mask.png
│ ├── malignant (1)_mask_1.png
│ └── ...
└── normal/
├── normal (1).png
├── normal (1)_mask.png # 正常类掩膜为全黑图(无病灶像素)
└── ...
三点命名规则注释:其一,序号在类别目录内从 1 起计数,跨类别可重复(benign (10) 与 malignant (10) 互不相关);其二,文件名含空格与圆括号,shell 中必须加引号、Python 中建议 re.escape;其三,掩膜文件名 = 原图文件名 + _mask(多病灶再追加 _N),不存在掩膜前缀指向其他原图的情况。
§4.1 DAIMS 字段字典
BUSI 无表格化元数据文件,全部信息编码在目录名与文件名中。下表按 DAIMS 规范将其显式化:
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| 类别目录 | 目录名 | 三分类标签的唯一来源 | benign/ |
图像级分类监督 | 标签为影像结论,未提供病理逐例对照 | 无缺失 | normal / benign / malignant |
| 文件序号 | 文件名整数 | 类别内唯一序号 | benign (10) |
图像级唯一标识 | 序号不连续,跨类别无全局唯一 ID | 无缺失 | 1–437(依类别) |
| 原图像素 | PNG 位图 | 灰阶超声声像图,含烧录的设备文字与体标 | benign (10).png |
分类/分割输入 | 尺寸不一(宽 310–719 像素),需 resize | 无缺失 | 平均约 500×500 像素 |
| 掩膜像素 | PNG 二值图 | 病灶区域 255、背景 0 | benign (10)_mask.png |
语义分割监督 | 标注者间一致性未量化 | 掩膜全黑 = 无病灶(正常类常态) | |
| 多掩膜后缀 | 文件名后缀 | 同图多病灶的多张掩膜 | benign (10)_mask_1.png |
实例计数、多目标分割 | 多掩膜间可能存在重叠 | 无后缀 = 单病灶 | N ≥ 1 |
| 烧录文本区 | 像素区域 | 图像边缘的设备参数、深度标尺、体标 | 顶部/侧边条带 | 预处理裁剪对象 | 无官方字段,位置不定 | 不适用 | 不定长 |
| 患者级 ID | 缺失字段 | 官方未提供患者标识 | 不存在 | 患者级划分(无法直接实现) | —— | 信息性缺失:字段不存在 | 不适用 |
| 采集元数据 | 缺失字段 | 设备型号、探头频率、深度未记录 | 不存在 | 设备归一化(无法实现) | —— | 信息性缺失:字段不存在 | 不适用 |
| 类别标签语义 | 目录名 | 影像诊断结论而非病理逐例对照 | malignant/ |
分类监督与临床叙事 | 与病理一致性未量化 | 信息性缺失:无病理字段 | 3 类 |
| 图像分辨率 | 像素尺寸 | 宽 310–719 像素、平均约 500×500 | 约 500×500 | resize 与裁剪策略依据 | 直接 resize 有纵横比失真风险 | 无缺失 | 宽 310–719 像素 |
§4.2 标签分布
| 口径 | 分布 | 不平衡比 |
|---|---|---|
| 图像级三分类(全量 780 张) | normal 133(17.05%)/ benign 437(56.03%)/ malignant 210(26.92%) | benign : malignant ≈ 2.08 : 1 |
| 良恶性二分类(去掉 normal,647 张) | benign 67.49% / malignant 32.51% | ≈ 2.08 : 1 |
| 像素级(病灶图内) | 病灶面积约占图像 5%–20% | 像素级类别不平衡约 1:4 至 1:20 |
| 多标签口径(629 张整理版) | 二值语义分割 + 自带 70-20-10 划分 | 衍生版自带划分(Zenodo 10.5281/zenodo.21128639) |
§4.3 关键统计
| 统计项 | 数值 | 备注 |
|---|---|---|
| 图像总数 | 780 | 三目录合计 |
| 掩膜总数 | 798 | 多病灶样本产生多掩膜 |
| 文件总数 | 1,578 | 原图 + 掩膜 |
| 患者数 | 600 | 全部女性,25–75 岁 |
| 平均图像尺寸 | 约 500×500 像素 | PNG |
| 宽度范围 | 310–719 像素 | 需统一 resize 或按掩膜裁剪 ROI |
| 多病灶样本掩膜增量 | benign +17、malignant +1 | 掩膜数减图像数 |
| 二分类可用图像 | 647 张(benign + malignant) | 去掉 normal 类后的病灶图像 |
| 分割可用图像 | 647 张病灶图 | normal 类掩膜为全黑、无病灶像素 |
| 去重后规模 | 依去重策略而定(BUSI-A1/A2/A3 三个变体) | arXiv:2508.17768 发布 |
| 论文被引 | 1,200+(OpenAlex,截至 2026-09) | 研究领域分布:人工智能 875、放射与核医学 605、计算机视觉与模式识别 507 |
§4.4 数据层级
标准医学影像数据集的层级为「患者 → 检查 → 序列 → 切片」,BUSI 在该链路上从最顶层断裂:
患者(600 名,无 ID,不可辨识)
└── 检查(次数未知,无检查 ID)
└── 图像(780 张,唯一可操作层级:类别目录 + 序号)
└── 掩膜(798 张,与图像文件名配对)
实际可用的分组键只有「类别目录 + 文件序号」,即图像级;任何声称「患者级划分」的 BUSI 实验,若无外部证据支撑,均值得存疑。
层级断裂带来三点直接后果:第一,泄漏治理只能推进到「图像去重」层面,患者级重复(同一患者的两张不同图像)在原理上不可检测;第二,纵向分析(随访、疗效对比)无法开展;第三,凡以「600 名患者」为分母推导的统计结论(患病率、检出率)都缺乏支撑——780 张图像在 600 名患者间的实际分布从未公开。
§4.5 缺失值与信息性缺失
| 缺失类型 | 内容 | 建议处理 |
|---|---|---|
| 表格缺失值 | 不适用(无表格元数据) | —— |
| 掩膜全黑(normal 类) | 非缺失,语义为「无病灶」 | 分割训练时正常类可作为纯背景样本;分类训练时提供阴性对照 |
| 患者级 ID 缺失 | 信息性缺失(字段不存在) | 无法恢复;以图像级划分 + 去重 + 外部验证组合缓解 |
| 采集元数据缺失 | 信息性缺失(字段不存在) | 无法恢复;在论文限制章节如实声明 |
| 标注缺失 | 个别图像掩膜疑似缺失或与描述不符(社区报告) | 配对校验:图像数与掩膜数按前缀核对,缺失者剔除并记录 |
| 重复图像 | 内容重复副本散布于三类目录 | 字节/感知哈希去重(§6.3),去重清单存档备查 |
信息性缺失的处理原则:能用显式信号表达的(如全黑掩膜表示「无病灶」)保持现状并在代码中显式判断;无法恢复的(患者 ID、设备参数)不做任何伪造填充,宁可保留缺失并在论文中如实声明。
§5 划分与使用建议
§5.1 官方划分
BUSI 官方未发布任何训练/验证/测试划分文件,也未提供患者级 ID。原始论文只给出数据组织描述,划分完全留给使用者。这意味着任何论文中的「标准划分」都只是作者自己的选择,跨论文数字不可直接比较。
这一空缺由社区各自填补,并直接催生了 BUSI 文献的「数字通胀」现象:当划分可自由选择时,作者天然倾向于让验证集变得更容易。第三方去重研究给出的对照最直观——同一 nnUNet 框架模型在不去重的常规划分上 Dice 0.7514,去重后 0.7144,约 0.037 的差值就是「划分自由度」的价格。
因此,使用 BUSI 的第一条纪律是把划分当作实验设计的一部分提前固定:先去重、再划分、冻结清单,最后才开始调参。
§5.2 社区惯例划分
| 惯例 | 比例 | 使用场景 | 风险 |
|---|---|---|---|
| 图像级随机划分 | 80/10/10 或 70/30 | 多数早期论文 | 重复图像与同患者图像跨集泄漏,指标虚高 |
| 图像级 K 折交叉验证 | 5 折 | 基准仓库(Awesome-Segmentation-in-Medical) | 严格统一协议下数字可信、横向可比 |
| 去重后划分 | BUSI-A1/A2/A3 | 泛化与不确定性研究 | 与不去重文献不可比(偏低约 0.037 Dice) |
推荐实现(去重 + 按组划分):
import hashlib, pathlib
from sklearn.model_selection import GroupShuffleSplit
def file_md5(p):
return hashlib.md5(pathlib.Path(p).read_bytes()).hexdigest()
# 1) 以原始字节 MD5 去重(比感知哈希更严格,先保底)
seen, keep = {}, []
for png in sorted(pathlib.Path("Dataset_BUSI_with_GT").rglob("*.png")):
if "_mask" in png.stem:
continue
h = file_md5(png)
if h not in seen:
seen[h] = png
keep.append(png) # keep: 去重后的原图清单
# 2) 无患者级 ID,无法真患者级分组;以去重后图像为单位划分并在论文中如实声明
groups = [p.parent.name for p in keep] # 近似占位分组键:类别目录
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
train_idx, test_idx = next(gss.split(keep, groups=groups))
train_set = [keep[i] for i in train_idx]
test_set = [keep[i] for i in test_idx]
注:上例 groups 传入的类别目录只是演示接口用法的近似占位,并非真正的患者分组;发表工作中请以去重后的图像级划分执行,并在论文中如实声明「无患者级 ID」的局限。
§5.3 泄漏风险(重点)
BUSI 的泄漏有两条独立通道,必须分别处理:
- 重复图像通道:原始数据中存在内容相同的重复图像,且重复对之间标注不一致。图像级随机划分会把同一图像的副本分进训练集与测试集,模型实质上是在「背诵」测试集。量化证据:同一方法在 BUSI-Full 上 Dice 0.7514,去重后(BUSI-A1)降至 0.7144,虚高约 0.037(arXiv:2508.17768)。
- 同患者多图通道:780 张图像来自 600 名患者,平均每名患者约 1.3 张,同一患者的多张图像(同一台设备、同一乳房、相近扫查条件)高度相关。由于没有患者级 ID,这条通道无法完全关闭,只能通过字节级/感知哈希去重、跨数据集外部验证、以及在论文中如实声明局限来缓解。
两条通道及相关风险的量化对照:
| 风险通道 | 量化证据 | 来源 |
|---|---|---|
| 重复图像泄漏 | Dice 0.7514(不去重)→ 0.7144(去重后 A1),虚高约 0.037 | arXiv:2508.17768 |
| 同患者多图泄漏 | 无患者 ID,无法直接量化;间接表现为外验降幅大于去重降幅 | 同上 |
| 域移位(外验) | 域内 0.7726 → 域外 0.4855 | 同上 |
§5.4 交叉验证建议
- 分割任务:采用 Awesome-Segmentation-in-Medical 的严格五折协议(先去重,再图像级五折,统一预处理与训练预算),报告均值±标准差。
- 分类任务:采用患者级五折 CV 的文献协议(如 §8.1 分类榜来源)时,注意其「患者级」实际依赖原始收集中的分组假设,公开复现时只能做到图像级五折,应在文中说明。
- 所有折外评估必须先完成去重,否则 CV 方差会被泄漏压缩,产生「方差很小、泛化很好」的假象。
- 论文报告协议四要素:数据版本(原始/去重)、划分方式与清单、输入管线、指标定义——缺一项,数字即不可复现。
§5.5 外部验证建议
| 外部数据集 | 用途 | 获取 |
|---|---|---|
| UDIAT(西班牙,163 张:良性 109–110 / 恶性 53–54) | BUSI 最常用的跨域对照 | 学术合作获取 |
| Breast-Lesion-USG | 域外测试与不确定性量化(arXiv:2508.17768 的 OOD 集) | 公开 |
| BUS-UCLM(西班牙) | 跨中心分割外验 | Mendeley Data 公开 |
外验时的标签口径务必先行对齐:UDIAT 仅含良恶性两类,不参与 normal 类评估;各外部集的掩膜定义(仅病灶 vs 含全乳轮廓)也可能不同,需先做标签语义核对再计算 Dice,否则「下降幅度」里会混入定义差噪声。
§6 AI 就绪指南
§6.0 云端快速启动
BUSI 体积仅约 266 MB,任何 Colab/Kaggle 免费实例均可整库载入内存级缓存。Kaggle Notebook 内可直接挂载官方镜像数据集,免下载;Colab 建议使用 kagglehub(见 §6.2),其会把数据缓存到本地(Linux 下位于 ~/.cache/kagglehub),重复实验无需重复下载。无需 GPU 集群,单卡 T4 即可完成 U-Net 级别的全量训练。
§6.1 快速上手
以下最小示例假设数据已解压至 data_root(即 Dataset_BUSI_with_GT 所在目录),data_root 与目录名直接拼接得到三类子目录路径;最小可用子集为 benign + malignant 两类共 647 张图(二分类)或全部 780 张(分割)。
import cv2, numpy as np, pathlib
data_root = pathlib.Path("Dataset_BUSI_with_GT") # 解压后的数据根目录
# 目录结构与 data_root 的拼接关系:data_root / 类别名 / 文件名
cls_dir = data_root / "benign"
imgs = sorted(cls_dir.glob("*.png"))
orig = [p for p in imgs if "_mask" not in p.stem]
masks = [p for p in imgs if "_mask" in p.stem]
print(len(orig), len(masks)) # 437 454 —— 每类自检图像/掩膜数量关系
img = cv2.imread(str(orig[0]), cv2.IMREAD_COLOR)
print(img.shape) # 尺寸不一,宽 310–719,需 resize
一条常用的全库自检脚本(核对三类目录计数与掩膜配对完整性,新环境必跑):
import re, pathlib
root = pathlib.Path("Dataset_BUSI_with_GT")
for cls in ("normal", "benign", "malignant"):
pngs = [p for p in (root/cls).glob("*.png") if "_mask" not in p.stem]
masks = [p for p in (root/cls).glob("*.png") if "_mask" in p.stem]
orphan = [p.name for p in pngs
if not list((root/cls).glob(re.escape(p.stem) + "_mask*.png"))]
print(cls, "原图", len(pngs), "掩膜", len(masks), "无掩膜原图", orphan)
# 预期输出:normal 133/133/[]、benign 437/454/[]、malignant 210/211/[]
§6.2 数据获取
| 渠道 | 地址 | 大小 | 前置条件 |
|---|---|---|---|
| 官方学者页 | scholar.cu.edu.eg/?q=afahmy/pages/dataset | 约 266 MB | 无,直接下载 |
| Kaggle 镜像 1 | aryashah2k/breast-ultrasound-images-dataset | 约 266 MB | Kaggle 账号 |
| Kaggle 镜像 2 | subhajournal/busi-breast-ultrasound-images-dataset | 266.19 MB | Kaggle 账号 |
| Zenodo 衍生版(629 张多标签) | DOI 10.5281/zenodo.21128639 | 小于原始版 | 需要多标签分割或自带划分时使用 |
# 方式一:kaggle CLI(需在 ~/.kaggle/kaggle.json 配置 API Token)
kaggle datasets download -d aryashah2k/breast-ultrasound-images-dataset
unzip -q breast-ultrasound-images-dataset.zip -d Dataset_BUSI_with_GT
# 方式二:kagglehub(Python 内直接调用,自动缓存)
import kagglehub
path = kagglehub.dataset_download("aryashah2k/breast-ultrasound-images-dataset")
print("缓存路径:", path)
下载完成后建议先运行 §6.1 的自检脚本核对 1,578 个文件是否完整、掩膜是否全部可配对,再进入预处理环节。
§6.3 预处理全流程
完整流程:掩膜配对 → 字节级去重 → 非乳腺图筛查 → 掩膜合并 → ROI 裁剪 → resize → 归一化。
import re, cv2, pathlib, numpy as np
import hashlib
def collect_samples(root):
"""收集 (原图, [掩膜列表], 类别) 三元组;自动处理多掩膜与文件名空格括号。"""
root = pathlib.Path(root)
samples = []
for cls in ("normal", "benign", "malignant"):
for png in sorted((root / cls).glob("*.png")):
if "_mask" in png.stem:
continue # 跳过掩膜文件本身
prefix = png.stem # 例如 benign (10)
masks = sorted((root / cls).glob(f"{re.escape(prefix)}_mask*.png"))
samples.append((png, masks, cls))
return samples
def dedup(samples):
"""按原始字节 MD5 去重:同一文件内容的重复副本只保留首个。"""
seen, out = set(), []
for png, masks, cls in samples:
h = hashlib.md5(png.read_bytes()).hexdigest()
if h not in seen:
seen.add(h)
out.append((png, masks, cls))
return out
def load_pair(png, masks, size=256):
"""读取原图并合并全部掩膜;返回归一化图像与二值掩膜。"""
img = cv2.cvtColor(cv2.imread(str(png)), cv2.COLOR_BGR2RGB)
m = np.zeros(img.shape[:2], np.uint8)
for mp in masks:
m |= (cv2.imread(str(mp), 0) > 127).astype(np.uint8)
if m.sum() > 0: # 有病灶时按掩膜外扩裁剪 ROI
ys, xs = np.where(m)
y0, y1 = max(ys.min()-20, 0), min(ys.max()+20, img.shape[0])
x0, x1 = max(xs.min()-20, 0), min(xs.max()+20, img.shape[1])
img, m = img[y0:y1, x0:x1], m[y0:y1, x0:x1]
img = cv2.resize(img, (size, size)).astype(np.float32) / 255.0
m = cv2.resize(m, (size, size), interpolation=cv2.INTER_NEAREST)
return img, m
说明:多掩膜取并集是语义分割的标准处理(全部病灶同属前景类);若任务升级为实例分割,则改为逐掩膜保留实例 ID,并对重叠像素按首个实例归属。
§6.4 PyTorch DataLoader
import torch
from torch.utils.data import Dataset, DataLoader
IMAGENET_MEAN = np.array([0.485, 0.456, 0.406], np.float32)
IMAGENET_STD = np.array([0.229, 0.224, 0.225], np.float32)
CLASS2IDX = {"normal": 0, "benign": 1, "malignant": 2}
class BUSIDataset(Dataset):
"""samples 由 §6.3 的 collect_samples + dedup 产出。"""
def __init__(self, samples, size=256, task="seg"):
self.samples, self.size, self.task = samples, size, task
def __len__(self):
return len(self.samples)
def __getitem__(self, idx):
png, masks, cls = self.samples[idx]
img, m = load_pair(png, masks, self.size)
img = (img - IMAGENET_MEAN) / IMAGENET_STD
x = torch.from_numpy(img).permute(2, 0, 1) # 3,H,W
if self.task == "seg":
return x, torch.from_numpy(m[None].astype(np.float32))
return x, torch.tensor(CLASS2IDX[cls])
train_ds = BUSIDataset(train_samples, task="seg")
train_dl = DataLoader(train_ds, batch_size=8, shuffle=True,
num_workers=4, pin_memory=True)
for x, y in train_dl: # x: (8,3,256,256) y: (8,1,256,256)
break
配套的最小训练循环(分割骨干自备,此处演示损失与优化器接线):
import torch.nn as nn
model = ... # 任意分割网络:输入 (B,3,256,256),输出 (B,1,256,256) logits
opt = torch.optim.AdamW(model.parameters(), lr=1e-4, weight_decay=1e-4)
bce = nn.BCEWithLogitsLoss()
def dice_loss(logit, target, eps=1.0):
p = torch.sigmoid(logit)
return 1 - (2 * (p * target).sum() + eps) / (p.sum() + target.sum() + eps)
for epoch in range(30):
model.train()
for x, y in train_dl:
logit = model(x.cuda())
loss = bce(logit, y.cuda()) + dice_loss(logit, y.cuda())
opt.zero_grad()
loss.backward()
opt.step()
§6.5 坑点清单(8 个真实失败模式)
以下 8 个坑点全部来自 BUSI 真实存在的失败模式,证据链见各条「参考」;顺序按「数据 → 标注 → 预处理 → 评估」的使用生命周期排列,建议新项目在写第一行训练代码前通读一遍。
⚠️ 坑点 1:图像级随机划分遇上重复图像——分割 Dice 系统性虚高(分类:数据泄漏)
问题:原始 BUSI 含内容相同的重复图像,社区普遍按图像随机划分,重复副本同时落入训练与验证集,模型在测试集上「见过原题」。严格实验测得泄漏虚高约 0.037 Dice(BUSI-Full 0.7514 对 去重 BUSI-A1 0.7144)。
症状:训练若干 epoch 后验证 Dice 快速逼近训练 Dice、方差极小;换随机种子结果异常稳定;与严格协议文献对比时数字明显偏高。
解决:
- 简单方法:按文件名字节 MD5 全库去重后再划分(§6.3
dedup)。- 进阶方法:在 MD5 之上叠加感知哈希(imagehash.phash),捕捉重压缩/微调尺寸的「准重复」,阈值取 Hamming 距离 ≤ 4。
- SOTA 方法:直接采用论文发布的去重版 BUSI-A1/A2/A3 或 Curated BUSI,并在论文中注明版本与来源。
参考:arXiv:2508.17768;Curated BUSI(Zenodo)
⚠️ 坑点 2:无患者级 ID——同患者多图跨集不可控(分类:数据泄漏)
问题:780 张图像来自 600 名患者,官方未提供患者 ID,同一患者的多张图像无法在划分时强制同侧,形成第二条泄漏通道。
症状:去重后指标仍高于跨中心外验一大截;逐类误差分析发现「同一病灶的多个视角」分属训练与测试。
解决:
- 简单方法:接受图像级划分的局限,在论文限制章节如实声明。
- 进阶方法:用预训练编码器提取图像嵌入并做聚类(如 KMeans k=600),以簇 ID 近似患者分组执行 GroupKFold。
- SOTA 方法:把结论建立在跨数据集外部验证上(UDIAT / Breast-Lesion-USG / BUS-UCLM),域内数字只作为参考下界。
参考:Awesome-Segmentation-in-Medical;§7.8 外验矩阵
⚠️ 坑点 3:重复图像对的标注冲突——同一病灶两张互斥金标准(分类:标签理解)
问题:重复图像由不同标注者分别勾画,掩膜并不相同;训练时两个版本都被当作金标准,损失函数在互斥监督间振荡。
症状:个别样本训练损失长期不收敛;对特定图像的预测掩膜形状不稳定;可视化解剖位置相同但边界差异大的掩膜对。
解决:
- 简单方法:去重时固定保留先出现的副本。
- 进阶方法:对重复对计算掩膜间 Dice,仅保留掩膜面积更接近该类别面积中位数的副本。
- SOTA 方法:采用 BUSI-A3——由放射科医师逐对判定并保留最准确标注的版本。
参考:arXiv:2508.17768
⚠️ 坑点 4:混入非乳腺超声图像——上颌骨与牙齿扫描(分类:工程陷阱)
问题:原始发布中 inadvertently 混入了少量非乳腺(上颌骨/牙齿)超声图像,数据论文未声明;直接全量训练会污染模型。
症状:抽样可视化时发现解剖结构完全不符的帧;训练集上出现离群高损失样本;域分类器把少数样本判为「其他」。
解决:
- 简单方法:人工全量可视化筛查(780 张的工作量约 1–2 小时),剔除并记录文件名。
- 进阶方法:用 ImageNet 预训练 CNN 提特征 + One-Class SVM 或孤立森林做离群筛,人工复核 top-50。
- SOTA 方法:采用 Curated BUSI 等已剔除质量问题的整理版。
参考:arXiv:2508.17768;Curated BUSI
⚠️ 坑点 5:掩膜数量与图像数量不匹配——多掩膜与全黑掩膜(分类:工程陷阱)
问题:掩膜 798 张多于原图 780 张(多病灶样本多掩膜),而 normal 类的掩膜是全黑图;直接按「一图一掩膜」假设写配对代码会报错或漏样本。
症状:DataLoader 长度对不上;分割损失出现整批为 0 的目标(全黑掩膜批次);多病灶图只学了一个病灶。
解决:
- 简单方法:按文件名前缀 glob 收集全部
_mask*并逐像素取并集(§6.3load_pair)。- 进阶方法:分割任务剔除全黑掩膜样本、仅用 647 张病灶图;正常类保留给分类任务做阴性对照。
- SOTA 方法:把多掩膜转为实例级标注(连通域分析),同时支持实例分割与计数评估。
参考:Kaggle 数据页目录统计
⚠️ 坑点 6:双重类别不平衡——图像级 2:1 与像素级 1:4–1:20 叠加(分类:偏倚陷阱)
问题:图像级上 benign:malignant ≈ 2.08:1(去掉 normal 后 67.49% 对 32.51%);像素级上病灶仅占 5%–20% 面积,不平衡比约 1:4 至 1:20。交叉熵会被背景主导,模型倾向预测「无病灶」。
症状:分割准确率高达 95%+ 但 Dice 只有 0.5 甚至更低;恶性类召回率显著低于良性类。
解决:
- 简单方法:BCE + Dice 组合损失,或对恶性类图像过采样。
- 进阶方法:Focal Loss(γ=2)处理像素级不平衡 + 加权采样处理图像级不平衡。
- SOTA 方法:Dice Loss 主导(对不平衡天然鲁棒)+ 深监督;报告逐类 Dice 与 PR 曲线而非总体准确率。
参考:像素不平衡量化研究
⚠️ 坑点 7:文件名空格括号 + 尺寸不一 + 烧录文本——预处理三连陷阱(分类:预处理陷阱)
问题:文件名形如
benign (10).png(含空格与圆括号),shell 脚本与部分 glob 模式易出错;图像宽度横跨 310–719 像素,直接 resize 到 256×256 会非线性压缩病灶形态;部分帧边缘有烧录的设备文字与体标。
症状:bash 循环因未加引号断行;同一病灶在不同 resize 下纵横比失真,模型对真实比例外推差;文本区域被误学为特征。
解决:
- 简单方法:Python
pathlib+re.escape处理路径(§6.3),resize 前先按掩膜外扩裁剪 ROI。- 进阶方法:统一短边 padding 到正方形再 resize,保持纵横比;裁掉图像边缘 5%–10% 的文本条带。
- SOTA 方法:nnUNet 风格的各向异性重采样 + 强度归一化(z-score),并审计烧录文本去除效果。
参考:分辨率统计
⚠️ 坑点 8:跨域评估想当然——域内 0.77 到域外 0.49 的骤降(分类:评估误用)
问题:单中心数据上训练的分割模型跨域性能崩塌:同一方法在 Breast-Lesion-USG 分布内 Dice 0.7726,换到去重 BUSI-A3 域外仅 0.4855;零样本迁移极端案例下 Dice 可低至个位数百分比。用域内数字宣称「接近临床可用」是常见误用。
症状:排行榜高分模型换到任何外部数据集后排名大幅洗牌;不确定性图在外部数据上失效。
解决:
- 简单方法:固定报告「内部 Dice + 外部 Dice」两个数字,禁止只报内部。
- 进阶方法:采用严格五折协议(Awesome-Segmentation-in-Medical)内部评估 + UDIAT 外部评估的双层报告。
- SOTA 方法:域自适应/测试时适应(TTA)+ MC Dropout 与 Deep Ensemble 校准评估;少量目标域数据(约 70 张)可恢复约 92.5% 源域性能(HyFormer-Net 的量化结论)。
参考:arXiv:2508.17768;Freivald et al., CESCG 2026;arXiv:2511.01013
§6.6 数据增强策略
| 类别 | 操作 | 说明 |
|---|---|---|
| ✅ 安全 | 水平翻转 | 乳腺左右侧天然镜像,保留解剖合理性 |
| ✅ 安全 | 小角度旋转(±15°)、平移、缩放 | 模拟探头摆放差异 |
| ✅ 安全 | 高斯噪声、高斯模糊、对比度/亮度抖动 | 模拟增益与声学窗差异 |
| ✅ 安全 | 弹性形变(轻度) | 病灶形态多样性,掩膜同步变换 |
| ❌ 危险 | 大角度旋转(>30°) | 破坏「病灶浅层、胸壁深层」的先验方向性 |
| ❌ 危险 | 垂直翻转 | 同上,翻转声束传播方向 |
| ❌ 危险 | 灰度反转/直方图均衡过度 | 无回声囊性与高回声钙化的语义会被破坏 |
| ✅ 安全 | 掩膜与图像同步变换(同一随机参数) | 任何几何增强必须同步掩膜,否则监督错位 |
| ✅ 安全 | 限制对比度直方图均衡(CLAHE,温和参数) | 模拟增益调节;需固定参数并同步应用于图像与评估集 |
| ❌ 危险 | 强 Cutout/擦除掩膜区域 | 可能擦掉病灶本体,制造错误监督 |
注:公开评估显示标准增强对超声图像的收益有限,小规模图像级数据才是泛化瓶颈(Nature 综述性证据),应把精力优先投给去重与外部验证。
§6.7 模型推荐
| 任务 | 推荐模型 | 参考性能 | 特点 |
|---|---|---|---|
| 分割基线 | U-Net | 五折 Dice 0.7095(严格协议) | 一切对比的起点 |
| 分割进阶 | Attention U-Net | 五折 Dice 0.7400 | 注意力门控,参数量适中 |
| 分割进阶 | UNet++ | 五折 Dice 0.7307 | 嵌套稠密跳连 |
| 分割 SOTA(严格协议) | U-KAN | 五折 Dice 0.7427 | KAN 混合架构,严格协议榜首 |
| 分割(自报数字) | HAU-Net | Dice 83.11% | CNN-Transformer 混合,L-G Transformer 替代跳连 |
| 分割(轻量端侧) | SCA-InceptionUNeXt | Dice 81.66% | 参数量比 U-Net 少 26.11M |
| 分割(SAM 系) | BUSI-SAM | mIoU 89.29% | SAM 微调,需谨慎对待划分协议差异 |
| 分类基线 | ResNet50 / EfficientNetB7 | 五折患者级 CV 91.98% | ImageNet 预训练迁移 |
| 分类进阶 | ViT B/32 | 准确率 86.7%、AUC 0.95 | 小数据下与 CNN 互有胜负 |
| 分类(少样本) | ProtoNet + ResNet50 | 10-shot 88.9% | 超迁移学习基线 83.1% |
| 分割(多任务外验导向) | BI-RADS 特征一致性多任务网络 | BUSI 外验 Dice 0.66(基线 0.56) | arXiv:2511.15968,专为跨域设计 |
| 分类(经典对照) | VGG19 | 五折患者级 CV 89.47% | 斑点噪声滤波 + ROI 高亮变体可达 87.8% |
§6.8 硬件需求
| 场景 | GPU 显存 | 批大小(256×256) | 预估单次训练 |
|---|---|---|---|
| U-Net 微调 | 6–8 GB | 8–16 | 数十分钟(单卡 T4) |
| Transformer 混合(HAU-Net/U-KAN) | 12–16 GB | 8 | 1–2 小时 |
| SAM 微调(BUSI-SAM 类) | 24 GB | 2–4 | 数小时 |
| CPU 推理(ONNX) | 不适用 | 1 | 单张 <100 ms(轻量模型) |
| CPU 预处理(去重/自检) | 不适用(内存任务) | —— | 全库哈希扫描 <5 分钟 |
显存按 batch=8、256×256 输入估算,开启混合精度可再降约四成;使用 SAM 类大模型时建议冻结图像编码器、仅微调解码器,以适配消费级显卡。
§6.9 评估指标代码
import torch
def dice_iou(pred, target, eps=1e-7):
"""pred/target: (B,1,H,W),取值 {0,1}。返回逐样本 Dice 与 IoU 的批均值。"""
pred, target = pred.bool(), target.bool()
inter = (pred & target).sum(dim=(1, 2)).float()
union = (pred | target).sum(dim=(1, 2)).float()
dice = (2 * inter + eps) / (pred.sum(dim=(1, 2)) + target.sum(dim=(1, 2)) + eps)
iou = (inter + eps) / (union + eps)
return dice.mean().item(), iou.mean().item()
# 使用示例
# dice, iou = dice_iou((logit > 0.5).float(), mask)
分类任务额外报告 AUC、敏感度、特异度与 PR-AUC:
import numpy as np
from sklearn.metrics import roc_auc_score, confusion_matrix
def binary_metrics(y_true, prob, thr=0.5):
"""y_true: 0/1(1 为恶性);prob: 恶性概率。返回二分类核心指标。"""
pred = (np.asarray(prob) >= thr).astype(int)
tn, fp, fn, tp = confusion_matrix(y_true, pred).ravel()
return {
"auc": roc_auc_score(y_true, prob),
"sensitivity": tp / (tp + fn),
"specificity": tn / (tn + fp),
"precision": tp / max(tp + fp, 1),
}
不确定性研究额外报告 ECE(期望校准误差)与 NLL。指标请始终逐图计算后再平均(图均 Dice),如使用全库体素 Dice 请单独标注口径,两者混写是复现争议的高发点。
§6.10 MLOps 笔记
- 数据版本化:把「原始版 / MD5 去重版 / phash 去重版」作为三个独立数据版本登记(DVC 或等价物),实验配置必须引用版本哈希。
- 划分快照:每次划分把样本文件名清单写入实验记录,保证审稿人可复现。
- 指标警报:监控验证 Dice 与训练 Dice 的差值,差值 <0.02 且绝对值 >0.78 时触发泄漏审查。
- 外部数据集门禁:发布前在 UDIAT 或 Breast-Lesion-USG 上跑一次固定评估,作为 CI 中的泛化冒烟测试。
- 标注冲突登记:去重阶段发现的掩膜冲突样本清单入库存档,供后续人工复核。
- 外部复现包:发布时附「依赖清单 + 数据 MD5 清单 + 划分清单」三件套,审稿人可一键对齐实验条件。
- 双协议看板:严格协议与自报协议数字分开陈列,CI 中禁止两者混用同一基线做回归比较。
- 数据来源声明:实验记录须包含数据版本 URL 与下载日期;官方学者页与 Kaggle 镜像混用时逐张核对哈希。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 单中心偏倚 | 全部 780 张图像来自开罗 Baheya 医院单一设备链 | 高 | 跨数据集外验(UDIAT/BUS-UCLM);域自适应 |
| 重复图像偏倚 | 存在内容重复图像,随机划分导致泄漏虚高约 0.037 Dice | 高 | 字节/感知哈希去重;采用 BUSI-A1/A2/A3 |
| 标注冲突偏倚 | 重复图像对的掩膜不一致,观察者间差异未量化 | 中 | 采用 BUSI-A3(放射科医师复核版);报告标注协议 |
| 类别不平衡 | 图像级 benign:malignant ≈ 2.08:1;像素级 1:4–1:20 | 中 | Dice/Focal 损失、加权采样、逐类指标 |
| 混入非目标图像 | 少量上颌骨/牙齿超声被误归入 | 中 | 离群筛查剔除;采用 Curated BUSI |
| 人口学覆盖缺口 | 无种族、BMI、乳腺密度、绝经状态字段 | 中(公平性评估不可行) | 如实声明;结合带元数据的新数据集 |
| 设备信息缺失 | 厂商/探头/参数未记录 | 中 | 无法设备归一化;限制章节声明 |
| 时间冻结偏倚 | 全部数据来自 2018 年单一采集窗口,无纵向覆盖 | 低-中 | 用近年公开数据集复核时序稳健性 |
| 标注协议不透明 | 标注者资历/人数/质检流程未披露 | 低-中 | 抽样复标验证;引用时注明协议缺失 |
§7.2 标注质量
标注为人工像素级勾画,掩膜与原图严格同名配对,命名规范一致——这是 BUSI 标注体系的优点。缺陷集中在三点:其一,无一致性量化,论文未报告标注者间 Dice/Kappa;其二,重复图像对标注冲突已被 arXiv:2508.17768 证实(不同标注者对同一图像给出不同掩膜),这也是其发布 A1/A2/A3 三个去重方案的直接动因;其三,标签语义粒度粗,仅到「正常/良性/恶性」,无 BI-RADS、无组织学亚型、无病理逐例对照。综合评价:掩膜可用于分割监督,但应视为「有噪声金标准」,关键实验建议双人独立复标一个小规模验证子集(如 100 张),报告复标一致性,并据此对全库掩膜做不确定性加权,或至少在误差分析中单独讨论复标不一致样本。
§7.3 泛化性
| 部署场景 | 失效风险 | 证据 |
|---|---|---|
| 跨医院(不同设备/厂商) | 高:斑点纹理与增益风格漂移,Dice 骤降 | 域内 0.7726 → 域外 0.4855(arXiv:2508.17768) |
| 零样本跨数据集 | 极高:可能出现灾难性失败 | HyFormer-Net 零样本迁移 Dice 仅 5.8%(arXiv:2511.01013) |
| 少量目标域微调 | 中:约 70 张目标域数据可恢复约 92.5% 源域性能 | arXiv:2511.01013 |
| 跨人群(埃及之外) | 中-高:人口学未披露,无法预判亚组表现 | 单中心 600 人队列,无族裔字段 |
| 高分排行榜模型互换测试集 | 高:排名大幅洗牌 | CESCG 2026 跨域观察(Freivald et al.) |
| 增强策略敏感 | 中:标准增强对超声收益有限 | 小规模图像级数据才是泛化瓶颈(Sci Rep 2025 证据) |
§7.4 伦理与合规
数据论文声明图像经匿名化处理:不含患者姓名、病历号、出生日期与精确检查日期,仅披露 25–75 岁的年龄段与 2018 年的采集年份;PNG 内可能残留烧录的设备文字(无个人身份信息字段)。数据以开放获取发布(数据论文 CC BY;Kaggle 镜像标注 GFDL 1.3),下载无需注册或签署协议。原始论文经机构伦理审查(具体批件号未公开),使用者应遵守所在机构的二次研究伦理要求,不得试图通过图像重建或去匿名化还原患者身份,不得将模型输出用于诊断决策而无临床验证。发表基于 BUSI 的成果时,建议在方法章节复述其匿名化与开放获取属性,并将「公开可得」与「无需伦理审查」区分表述——后者取决于所在机构政策。
§7.5 公平性
数据集覆盖 25–75 岁全部女性,但未披露年龄分布、种族构成、乳腺密度与社会经济属性,任何公平性亚组分析在现有公开信息下不可行。地理上限于埃及单一中心,模型在其他人群上的表现差异只能通过外部数据集间接评估。若项目有公平性合规要求(如模型卡、监管申报),BUSI 只能作为训练/预训练资源,公平性证据必须来自带完整人口学标签的前瞻性数据。年龄维度上,25–75 岁的宽区间覆盖了主要高发年龄带,但缺少分段统计,无法验证模型在青年与老年亚组上的均衡性,建议结合外部数据集补充分层评估。
§7.6 数据漂移
采集锁定在 2018 年单一设备链,不存在时间维度的多批次数据,因此「漂移监控」在数据集内部无从谈起;真正的漂移风险发生在部署时:目标医院的设备厂商、探头频率、图像导出方式、患者构成都会与 Baheya 2018 产生系统性差异。建议:上线前用目标医院数据计算图像级统计距离(如灰度直方图 Wasserstein 距离)做接受度测试;推理服务内置输入分布监控,直方图距离超阈值时告警。
可落地的漂移监控三步法:第一步,基线画像——对 BUSI 全库计算灰度直方图、斑点熵与分辨率分布并入库存档;第二步,线上比对——对生产流量逐批计算同一组统计量与基线的距离(如 Wasserstein-1 距离);第三步,阈值治理——距离超过基线分布 95 分位即触发回归测试,连续超限则启动目标域微调或再评估流程。
§7.7 DAIMS 24 项数据质量评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式可用性 | ❌ | 无表格元数据,信息全部编码于目录名/文件名 |
| 2 | 唯一标识 | ⚠️ | 文件名在类别内唯一,但无全局图像 ID,无患者级 ID |
| 3 | 特殊字符处理 | ⚠️ | 文件名含空格与圆括号(benign (10).png),脚本需转义 |
| 4 | 重复行/重复样本 | ❌ | 存在重复图像,已证实导致泄漏虚高 |
| 5 | 缺失值编码 | ❌ | 无字段即无编码;掩膜缺失仅靠配对校验发现 |
| 6 | 标签可辨识性 | ✅ | 三类标签由目录名直接给出,无歧义 |
| 7 | 罕见类分组 | ⚠️ | 无亚型细分,恶性 210 张内无法再分层 |
| 8 | 偏倚评估 | ⚠️ | 单中心/不平衡已知并量化,人口学偏倚不可评估 |
| 9 | 数据字典 | ⚠️ | 官方仅论文描述;本页 §4.1 为社区补全版 |
| 10 | 信息性缺失解释 | ❌ | 官方未解释患者 ID 与设备字段缺失原因 |
| 11 | 设备记录 | ❌ | 厂商/型号/参数完全缺失 |
| 12 | 共线性 | ❌ | 无表格特征,不适用 |
| 13 | 编码映射 | ✅ | normal/benign/malignant 语义直白,ICD-11/SNOMED 映射见 §2.1 |
| 14 | 时间戳处理 | ❌ | 无逐例时间戳,仅年份 2018 |
| 15 | 划分建议 | ❌ | 官方无划分文件与建议 |
| 16 | 泄漏讨论 | ⚠️ | 官方未提及;社区已系统量化(虚高约 0.037 Dice) |
| 17 | 标签分布 | ✅ | 133/437/210 清晰披露,可复算 |
| 18 | 测量偏倚 | ⚠️ | 操作者依赖的采集方式已知,但无操作者字段 |
| 19 | 外部验证建议 | ⚠️ | 官方无建议;社区已建立 UDIAT 等外验惯例 |
| 20 | 版本记录 | ⚠️ | 单一官方版本;第三方去重版存在但非官方 |
| 21 | 预处理脚本 | ❌ | 官方未提供,需社区方案(本页 §6.3) |
| 22 | 合规要求 | ✅ | 开放获取(GFDL 1.3 / CC BY),无注册门槛 |
| 23 | 多模态对齐 | ❌ | 单模态图像数据集,不适用 |
| 24 | 去标识化 | ✅ | 无直接标识符;仅年龄段与年份披露 |
DAIMS 评分:9.5 / 24
评分解读:9.5 分处于「可用但需重度治理」区间。得分项集中在标签可辨识性、合规与去标识化——这些是数据集发布规范层面的基本功;失分项集中在结构化元数据(宽格式、字典、时间戳、设备)、划分治理(无官方划分、泄漏未讨论)与质量保障(重复样本、一致性未量化)——这些恰是 AI 就绪度的核心。与 2020 年前后发布的同时代数据集相比属于中游水平,但作为被引用超 1,200 次的基准,其质量治理明显落后于其生态影响力,这一落差本身就是使用风险的来源。
对你意味着什么:如果你只是跑通模型 demo,直接下载即可,零门槛;如果你要发表基准数字,必须先完成 §6.3 的去重与 §5.2 的划分快照,并采用 §8.1 的严格协议,否则审稿人与后续复现者都会质疑你的数字;如果你要做临床转化叙事,BUSI 只能承担「预训练 + 方法验证」角色,所有泛化结论必须由 §7.8 的外部数据集支撑;如果你的工作依赖患者级或设备级分层(公平性、漂移、亚组分析),请直接换用带完整元数据的数据集,BUSI 无法满足。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| UDIAT(163 张) | 西班牙 UDIAT 诊断中心 | 良恶性分类/分割外验 | 依方法而异 | 显著下降 | BUSI 最常用的跨域对照,良性 109–110/恶性 53–54 |
| Breast-Lesion-USG | 独立收集 | 分割域外测试 | Dice 0.4855(IoU 0.4309) | 域内 0.7726 → 域外 0.4855 | 去重 BUSI-A3 域外评估;不确定性方法需在 OOD 复核 |
| BUS-UCLM | 西班牙(BrEaST→BUSI 方向) | 分割外验 | Dice 0.66 对 0.56(多任务 vs 基线,p<0.001) | 外验下 Dice 低于 0.7 | BI-RADS 特征一致性正则可提升外验表现(arXiv:2511.15968) |
| 零样本跨数据集迁移 | HyFormer-Net 协议 | 分割零样本 | Dice 5.8% | 灾难性失败 | 架构先进性无法克服域移位(arXiv:2511.01013) |
| 约 70 张目标域微调 | HyFormer-Net 协议 | 少样本域适应 | 恢复约 92.5% 源域性能 | — | 临床可行的最小标注预算参考值 |
注:「相对内部变化」仅列方向与幅度量级;跨论文外验数字受目标集预处理与标签口径影响,引用时请回溯各原始文献的协议章节。
§8 基准性能与生态
§8.1 排行榜
严格协议分割榜(Awesome-Segmentation-in-Medical 公平基准:统一去重、统一五折、统一训练预算;数值相互可比):
| 排名 | 模型 | Dice(五折均值) | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | U-KAN | 0.7427 | 2023 | KAN 与 CNN 混合编码器 | Awesome-Segmentation-in-Medical 公平基准(GitHub) | 有 |
| 2 | Attention U-Net | 0.7400 | 2018 | 注意力门控跳连 | 同上(复现协议) | 有 |
| 3 | UNet++ | 0.7307 | 2018 | 嵌套稠密跳连 | 同上 | 有 |
| 4 | TransUnet | 0.7226 | 2021 | ViT 编码器 + CNN 解码器 | 同上 | 有 |
| 5 | CMUNeXt | 0.7217 | 2023 | 倒瓶颈轻量块 | 同上 | 有 |
| 6 | UNet 3+ | 0.7194 | 2020 | 全尺度跳连 | 同上 | 有 |
| 7 | U-Net | 0.7095 | 2015 | 编码器-解码器基线 | 同上 | 有 |
| 8 | UNeXt | 0.6955 | 2022 | MLP 化轻量架构 | 同上 | 有 |
| 9 | MedT | 0.5759 | 2021 | LoGo 分支 Transformer | 同上 | 有 |
宽松/自报数字榜(划分协议各异,不可与上表直接比较,仅列代表工作):
| 模型 | 自报性能 | 完整引用 |
|---|---|---|
| HAU-Net | BUSI Dice 83.11%(转引自 Sci Rep 基准研究) | Zhang H, Lian J, Yi Z, Wu R, Lu X, Ma P, Ma Y. HAU-Net: Hybrid CNN-transformer for breast ultrasound image segmentation. Biomedical Signal Processing and Control(文章页) |
| CResU-Net | Dice 82.88%、IoU 77.5%、AUC 90.3%,8.88M 参数 | Derakhshandeh S, Mahloojifar A. Modifying the U-Net’s Encoder-Decoder Architecture for Segmentation of Tumors in Breast Ultrasound Images. arXiv:2409.00647 |
| SCA-InceptionUNeXt | Dice 81.66%,参数量比 U-Net 少 26.11M | 转引自 Sci Rep 基准研究,10.1038/s41598-025-97718-5 |
| BUSI-SAM | mIoU 89.29%、OA 98.59% | Segment Anything for Breast Cancer Ultrasound Image. Signal, Image and Video Processing, 2025. DOI: 10.1007/s11760-025-05032-4 |
| Attention U-Net(Sulaiman 等) | Dice 0.92、准确率 0.98 | Sulaiman A, Anand V, Gupta S, et al. Attention Based UNet Model for Breast Cancer Segmentation Using BUSI Dataset. Scientific Reports, 2024 |
数值不可直接比较的原因:训练/测试比例不同、去重与否不同、输入分辨率与 ROI 裁剪不同、评估指标定义(逐图 Dice 均值 vs 全库体素 Dice)不同——严格协议最高分 0.7427 与自报最高分 0.9+ 之间的差距主要由协议而非模型能力贡献。
引用建议:方法论文正文以严格协议数字为准,自报数字一律以「作者自报(协议未统一)」脚注给出;两者混排进同一张表是 BUSI 相关文献最常见的误导形态。
§8.2 SOTA 总结与选型建议
截至 2026-09 的可辩护结论:在严格协议下,BUSI 分割的合理性能区间是 Dice 0.70–0.75,U-KAN 与 Attention U-Net 处于第一梯队;自报协议下的 0.83–0.99 数字大多包含划分红利,引用时必须注明协议。分类任务的合理区间是准确率 86%–92%(五折患者级 CV),融合病灶内外组织与迁移学习的方法可达 94.62%(AUC 0.9711)。选型建议:方法研究选 U-KAN/AttUNet 做主对比 + U-Net 做基线;落地原型选 SCA-InceptionUNeXt 类轻量网络;SAM 系方法适合交互式标注工具而非独立诊断器。文献间数字差异的主因排序为:划分协议 > 去重与否 > 输入分辨率 > 指标定义,任意一项更换即可造成 0.03–0.10 量级的波动,比较前先核对四要素。
§8.3 评测协议
| 协议要素 | 推荐设置 |
|---|---|
| 数据版本 | 去重后版本(BUSI-A1/A2/A3 或 MD5+phash 自去重),并在论文写明 |
| 划分 | 五折交叉验证(图像级),划分清单随论文发布 |
| 输入 | 掩膜引导 ROI 裁剪 + 256×256 resize(保持纵横比 padding) |
| 损失 | Dice Loss 或 BCE+Dice;类别加权 |
| 指标 | 逐图 Dice/IoU 均值±标准差;分类报告 AUC/敏感度/特异度 |
| 外验 | UDIAT 或 Breast-Lesion-USG 固定评估 |
| 显著性 | 多随机种子(≥3)+ 配对检验 |
| 类别口径 | 分割仅用 647 张病灶图或全量 780 张,需在协议中写明 |
| 外验集 | 固定一个外部数据集(UDIAT 或 Breast-Lesion-USG)纳入最终报告 |
§8.4 相关数据集
| 数据集 | 机构 | 规模 | 关系 |
|---|---|---|---|
| UDIAT-Dataset | 西班牙 UDIAT 诊断中心 | 163 张(良性 109–110 / 恶性 53–54) | 跨域外验标准对照 |
| Breast-Lesion-USG | 独立研究团队 | 独立收集 | arXiv:2508.17768 的 OOD 测试集 |
| BUS-UCLM | 西班牙卡斯蒂利亚-拉曼恰大学 | 公开 | 跨中心外验 |
| BrEaST | 波兰 | 公开 | arXiv:2511.15968 的训练集(反向以 BUSI 为外验) |
| BUSI-WHU | 武汉大学 | 公开 | BUSI-SAM 论文的第二验证集 |
| Curated BUSI | Universidad de Oviedo | 原始规模整理版 | 质量修正版(Zenodo 10.5281/zenodo.19047973) |
| 629 张多标签版 | Universidad de La Rioja | 629 张 | MedSAM 剪枝研究配套(Zenodo 10.5281/zenodo.21128639) |
| BUSI-WHU | 武汉大学 | 公开 | BUSI-SAM 第二验证集(Mendeley Data) |
§8.5 关键论文 Top 10
- Al-Dhabyani W, Gomaa M, Khaled H, Fahmy A. Dataset of breast ultrasound images. Data in Brief, 2020, 28:104863. DOI: 10.1016/j.dib.2019.104863 —— 数据集原始论文,三类 780 张图像与掩膜的完整描述。
- Gómez-Flores W, Albuquerque Pereira WC. A comparative study of pre-trained convolutional neural networks for semantic segmentation of breast tumors in ultrasound. Computers in Biology and Medicine, 2020, 126:104036. DOI: 10.1016/j.compbiomed.2020.104036 —— 预训练骨干在 BUSI 分割上的系统性对比。
- Zhang H, Lian J, Yi Z, et al. HAU-Net: Hybrid CNN-transformer for breast ultrasound image segmentation. Biomedical Signal Processing and Control(文章页)—— L-G Transformer 替代跳连的混合架构代表作。
- Nastase I-N, Moldovanu S, Biswas KC, Moraru L. Role of inter- and extra-lesion tissue, transfer learning, and fine-tuning in the robust classification of breast lesions. Scientific Reports, 2024. DOI: 10.1038/s41598-024-74316-5 —— 病灶内外组织融合分类,准确率 94.62%、AUC 0.9711。
- Towards Trustworthy Breast Tumor Segmentation in Ultrasound using Monte Carlo Dropout and Deep Ensembles for Epistemic Uncertainty Estimation. arXiv:2508.17768, 2025 —— 证实重复图像与标注冲突,发布 BUSI-A1/A2/A3 去重协议与不确定性基准。
- Pawłowska A, et al.(Universidad de Oviedo). Curated BUSI. Zenodo. DOI: 10.5281/zenodo.19047973 —— 系统质量分析(重复图像、标注不一致、混入非乳腺图像)与修正版发布。
- Freivald et al. Semi-Supervised Breast Ultrasound Segmentation via Text-Guided Foundation Model. CESCG 2026 —— 文本引导基础模型半监督分割与跨域排名洗牌观察。
- Rahman MA. HyFormer-Net: A Synergistic CNN-Transformer with Interpretable Multi-Scale Fusion for Breast Lesion Segmentation and Classification in Ultrasound Images. arXiv:2511.01013, 2025 —— 零样本迁移 5.8% Dice 的灾难性失败量化与 70 张微调恢复规律。
- Zhang J, et al. Externally Validated Multi-Task Learning via Consistency Regularization Using Differentiable BI-RADS Features for Breast Ultrasound Tumor Segmentation. arXiv:2511.15968, 2025 —— BrEaST 训练、BUSI 外验的多任务一致性正则。
- Sulaiman A, Anand V, Gupta S, et al. Attention Based UNet Model for Breast Cancer Segmentation Using BUSI Dataset. Scientific Reports, 2024 —— 注意力门控 U-Net 在 BUSI 上的应用与评估细节。
§8.6 社区活跃度
数据论文被引 1,200+(OpenAlex,截至 2026-09;Scopus 记录 790),研究领域分布为人工智能 875、放射与核医学 605、计算机视觉与模式识别 507——AI 方法论文占比过半,说明其身份更接近「算法基准」而非「临床资源」。Kaggle 两个镜像长期被论文引用为获取入口;Awesome-Segmentation-in-Medical 等开源公平基准仓库将其纳入 10+ 模型 × 5 数据集统一评测。第三方质量分析与去重版本的持续产出(2025–2026 年仍有新整理版发布)表明社区对该数据集的维护兴趣已从「用」转向「修」。对复现者的启示:与其追逐 0.9+ 的自报数字,不如把方法对比建立在「严格协议 + 外部验证」的工作上——这类工作的绝对数字更低,但增量结论可信。
§8.7 生态快照
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| 官方学者页 | 数据下载 | https://www.scholar.cu.edu.eg/?q=afahmy/pages/dataset | 官方一手来源 |
| Kaggle 主镜像 | 数据镜像 | aryashah2k/breast-ultrasound-images-dataset | 论文引用最多的获取入口 |
| Kaggle 规整镜像 | 数据镜像 | subhajournal/busi-breast-ultrasound-images-dataset | 目录规整、266.19 MB / 1,578 文件 |
| Awesome-Segmentation-in-Medical | 基准代码 | GitHub | 严格五折公平基准,防泄漏协议 |
| Awesome-Medical-Dataset | 元信息目录 | CHY-coder/Awesome-Medical-Dataset | 版本与元信息速查 |
| openmedlab 数据字典 | 元信息目录 | Awesome-Medical-Dataset(openmedlab) | 分辨率统计与中文描述 |
| Curated BUSI | 修正版数据 | Zenodo DOI 10.5281/zenodo.19047973 | 质量修正版 |
| 629 张多标签版 | 衍生数据 | Zenodo DOI 10.5281/zenodo.21128639 | 多标签二值分割 + 70-20-10 划分 |
§9 相关资源与引用
§9.1 官方资源
- 数据下载(官方):开罗大学 Aly Fahmy 学者页
- 数据论文全文(开放获取):ScienceDirect
- Kaggle 镜像:aryashah2k 版、subhajournal 版
- 严格基准协议:Awesome-Segmentation-in-Medical
- 质量修正版:Curated BUSI(Zenodo)
- 去重与不确定性研究全文:arXiv:2508.17768
- SAM 微调代表工作:BUSI-SAM,DOI 10.1007/s11760-025-05032-4
§9.2 BibTeX
@article{Al-Dhabyani2020,
title = {Dataset of breast ultrasound images},
author = {Al-Dhabyani, Walid and Gomaa, Mohammed and Khaled, Hussien and Fahmy, Aly},
journal = {Data in Brief},
volume = {28},
pages = {104863},
year = {2020},
publisher = {Elsevier},
doi = {10.1016/j.dib.2019.104863}
}
@article{GomezFlores2020,
title = {A comparative study of pre-trained convolutional neural networks
for semantic segmentation of breast tumors in ultrasound},
author = {G{\'o}mez-Flores, Wagner and Albuquerque Pereira, Wagner Coelho},
journal = {Computers in Biology and Medicine},
volume = {126},
pages = {104036},
year = {2020},
doi = {10.1016/j.compbiomed.2020.104036}
}
@article{Nastase2024,
title = {Role of inter- and extra-lesion tissue, transfer learning, and
fine-tuning in the robust classification of breast lesions},
author = {Nastase, Iulia-Nela and Moldovanu, Simona and Biswas, Keka C. and Moraru, Luminita},
journal = {Scientific Reports},
volume = {14},
year = {2024},
doi = {10.1038/s41598-024-74316-5}
}
@misc{TrustworthyBUSI2025,
title = {Towards Trustworthy Breast Tumor Segmentation in Ultrasound using
Monte Carlo Dropout and Deep Ensembles for Epistemic Uncertainty Estimation},
year = {2025},
publisher = {arXiv},
howpublished = {arXiv:2508.17768},
url = {https://arxiv.org/abs/2508.17768}
}
@misc{CuratedBUSI2025,
title = {Curated {BUSI}: a quality-curated version of the
Breast Ultrasound Images Dataset},
author = {{Universidad de Oviedo}},
year = {2025},
publisher = {Zenodo},
doi = {10.5281/zenodo.19047973}
}
@article{Zhang2024HAUNet,
title = {{HAU-Net}: Hybrid {CNN}-transformer for breast ultrasound image segmentation},
author = {Zhang, Huaikun and Lian, Jing and Yi, Zetong and Wu, Ruichao
and Lu, Xiangyu and Ma, Pei and Ma, Yide},
journal = {Biomedical Signal Processing and Control},
year = {2024},
url = {https://www.sciencedirect.com/science/article/pii/S1746809423008601}
}
@misc{Rahman2025HyFormer,
title = {{HyFormer-Net}: A Synergistic {CNN}-Transformer with Interpretable
Multi-Scale Fusion for Breast Lesion Segmentation and Classification
in Ultrasound Images},
author = {Rahman, Mohammad Amanour},
year = {2025},
publisher = {arXiv},
howpublished = {arXiv:2511.01013},
url = {https://arxiv.org/abs/2511.01013}
}
@misc{Zhang2025BIRADS,
title = {Externally Validated Multi-Task Learning via Consistency Regularization
Using Differentiable {BI-RADS} Features for Breast Ultrasound Tumor Segmentation},
author = {Zhang, Jingru and others},
year = {2025},
publisher = {arXiv},
howpublished = {arXiv:2511.15968},
url = {https://arxiv.org/abs/2511.15968}
}
@inproceedings{Freivald2026,
title = {Semi-Supervised Breast Ultrasound Segmentation via
Text-Guided Foundation Model},
author = {{Freivald et al.}},
booktitle = {Central European Seminar on Computer Graphics for Students
(CESCG)},
year = {2026},
url = {https://cescg.org/wp-content/uploads/2026/04/Freivald-Semi-Supervised-Breast-Ultrasound-Segmentation-via-Text-Guided-Foundation-Model.pdf}
}
§9.3 引用指南
使用 BUSI 数据时,最低引用义务为 Al-Dhabyani et al. 2020(数据论文);若采用了去重协议,请同时引用 arXiv:2508.17768 与 Curated BUSI(Zenodo);若使用严格基准数字做对比,请引用 Awesome-Segmentation-in-Medical 仓库并注明五折协议;若将本页 §6.3/§6.4 的预处理与划分代码用于发表工作,请在致谢中注明本页面。凡引用本页面,请以页面底部 DOI 与发布日期为准。同一工作同时使用原始版与去重版时,请在数据可用性声明中分别列出版本来源与下载日期,避免审稿人误判版本混用。
§10 AI 使用声明卡
§10.1 AI 模型列表
| 模型 | 用途 |
|---|---|
| 千方写作助手(大语言模型) | 条目初稿撰写、结构与格式规范执行 |
| 千方检索助手(检索增强大语言模型) | 事实核查、引用元信息补全 |
§10.2 AI 参与范围
AI 负责资料检索、事实汇编、初稿撰写与格式校对;章节结构、标签体系与发布流程由编辑部规范约束;所有医学判断性内容(§2 医学背景、§7 偏倚与公平性结论)均经人工交叉审核;代码示例为 AI 起草后经人工走查,但未在发布流程中逐行执行验证,使用者应在自有环境中先行测试。
分工边界:AI 未参与任何原始数据的下载、解压或统计实测;页面中所有计数(133/437/210、798、1,578 等)均直接引自 §10.3 来源清单;凡来源未覆盖的属性(设备型号、标注者资历、伦理批件号)一律如实声明「未披露」,未做任何推断填充。
§10.3 输入来源列表
- Al-Dhabyani W, et al. Dataset of breast ultrasound images. Data in Brief, 2020. DOI: 10.1016/j.dib.2019.104863 — https://www.sciencedirect.com/science/article/pii/S2352340919312181
- 开罗大学官方数据页 — https://www.scholar.cu.edu.eg/?q=afahmy/pages/dataset
- Kaggle 主镜像 — https://www.kaggle.com/datasets/aryashah2k/breast-ultrasound-images-dataset
- Kaggle 规整镜像(266.19 MB / 1,578 文件)— https://www.kaggle.com/datasets/subhajournal/busi-breast-ultrasound-images-dataset/data
- Towards Trustworthy Breast Tumor Segmentation in Ultrasound(去重与不确定性)— https://ar5iv.arxiv.org/html/2508.17768
- Curated BUSI(质量分析与修正版)— https://portalinvestigacion.uniovi.es/documentos/69c416ee51799c7f541aa040
- 629 张多标签整理版 — https://investigacion.unirioja.es/documentos/6a46a25f978c1c22a69a640b
- Awesome-Segmentation-in-Medical 严格基准 — https://github.com/Jonghwan-dev/Awesome-Segmentation-in-Medical
- HAU-Net 原论文 — https://www.sciencedirect.com/science/article/pii/S1746809423008601
- Sci Rep 基准研究(HAU-Net/SCA-InceptionUNeXt/ViT/元学习数字)— https://www.nature.com/articles/s41598-025-97718-5
- Nastase et al. 2024(融合分类 94.62%)— https://www.nature.com/articles/s41598-024-74316-5
- 五折患者级 CV 分类基准 — https://europepmc.org/article/view/PMC12602234/table/T4/version/1
- Freivald et al., CESCG 2026(跨域外验)— https://cescg.org/wp-content/uploads/2026/04/Freivald-Semi-Supervised-Breast-Ultrasound-Segmentation-via-Text-Guided-Foundation-Model.pdf
- HyFormer-Net(零样本迁移与少样本恢复)— https://ar5iv.labs.arxiv.org/html/2511.01013
- Zhang J et al.(BI-RADS 多任务外验)— https://arxiv.org/abs/2511.15968v1
- 像素级不平衡量化研究 — https://pmc.ncbi.nlm.nih.gov/articles/PMC12289783/pdf/12539_2025_Article_726.pdf
- 引用计量(OpenAlex/Rankless)— https://www.rankless.org/hit-papers/10.1016/j.dib.2019.104863
- openmedlab 数据字典 — https://github.com/openmedlab/Awesome-Medical-Dataset/blob/a3ffcf65befff35c2097b95c4e4d3f5ea553fc81/resources/BUSI.md
- BUSI-SAM(Segment Anything for Breast Cancer Ultrasound Image)— https://doi.org/10.1007/s11760-025-05032-4
- CResU-Net(U-Net 编解码改造,arXiv:2409.00647)— https://www.arxiv.org/pdf/2409.00647
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1 概览与 §3 规格(规模数字、日期、链接) | 千方病案医学编辑部 | 对照 FACTS.md 与原始来源逐条核数 | ✅ 已通过 |
| §2 医学背景(ICD-11/SNOMED 映射、疾病描述) | 千方病案医学编辑部(医学编辑) | 编码表复核与文献比对 | ✅ 已通过 |
| §4 DAIMS 字典与 §5 划分策略 | 医疗 AI 数据工程师 | 代码走查 + 目录结构实测 | ✅ 已通过 |
| §6 代码示例与 8 个坑点 | 医疗 AI 数据工程师 | 逻辑审查与社区证据核对 | ✅ 已通过 |
| §7 DAIMS 24 项与外验矩阵 | 千方病案医学编辑部(医学编辑 + 数据工程师) | 双人复核 | ✅ 已验证 |
| §8 基准数字与引用完整性 | 千方病案医学编辑部 | 逐条回溯来源 URL | ✅ 已验证 |
| §10 声明卡与页面状态 | 千方病案医学编辑部 | 与 §0 审核记录交叉核对 | ✅ 已通过 |
§10.5 AI 生成章节标注
全部章节由 AI 辅助生成初稿;其中 §1.0 速览、§6.5 坑点、§7.7 DAIMS 解读为 AI 起草后人工改写定稿;§2.2 疾病简介、§7.4 伦理、§7.5 公平性为人工重点改写模块;所有数字均回溯至 §10.3 所列来源。章节级的人工改写痕迹保留于终稿措辞;格式与锚点由校验脚本复核。
§10.6 最后人工审核
最后人工审核日期:2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- inbreast — 共享标签:医学影像 / 乳腺影像 / 医学图像分割 / 图像分类 / 乳腺癌
- udiat — 共享标签:医学影像 / 乳腺影像 / 医学图像分割 / 图像分类 / 乳腺癌
- bus-bra — 共享标签:医学影像 / 乳腺影像 / 医学图像分割 / 图像分类 / 乳腺癌
- cbis-ddsm — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
- cmmd — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
- odelia — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
- tn-mammo-breast-density — 共享标签:医学影像 / 乳腺影像 / 图像分类
- bach — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
- echonet-dynamic — 共享标签:医学影像 / 医学图像分割 / 图像分类
- ddti — 共享标签:医学影像 / 医学图像分割 / 图像分类
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

