BUS-BRA (bus-bra) — 巴西 INCA 1064 患者乳腺超声 CAD 评估集:病理+BI-RADS 2–5+分割掩膜三标注与官方标准化折 — AI-Ready Wikipedia

BUS-BRA 乳腺超声数据集条目:1,064 患者 1,875 张 B-mode 图,同含活检病理(良/恶性)、资深超声医师 BI-RADS 2–5 分级与手工分割掩膜三类标注,附带官方 5 折/10 折交叉验证划分;CC BY-4.0 于 Zenodo 公开直链(BUSBRA.zip 133.9MB),Medical Physics 2024(DOI 10.1002/mp.16812)配套论文;并收录第三方审计发现——官方划分仅图像级互斥、非患者级,修正后分割/分类指标显著回落

来源 Zenodo 记录 10.5281/zenodo.8231412(BUSBRA.zip,133.9 MB,md5 1f8b2be6476d58fc97bfb5e5a1ea9bab)——含 PNG 图像 + PNG 二值分割掩膜 + 逐图 CSV 元数据(BI-RADS / pathology / histology / 患者标识);配套代码 github.com/wgomezf/BUS-BRA发布时间: 2026-09-30最后更新: 2026-09-30 阅读 12
BUS-BRA (bus-bra) — 巴西 INCA 1064 患者乳腺超声 CAD 评估集:病理+BI-RADS 2–5+分割掩膜三标注与官方标准化折 — AI-Ready Wikipedia

信息速览

数据集名称BUS-BRA (bus-bra) — 巴西 INCA 1064 患者乳腺超声 CAD 评估集:病理+BI-RADS 2–5+分割掩膜三标注与官方标准化折 — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模1,064 名女性患者(对应 1,875 张 B-mode 超声图;平均约 1.76 张/患者,含双侧与多切面)
接入方式Zenodo 记录 10.5281/zenodo.8231412(BUSBRA.zip,133.9 MB,md5 1f8b2be6476d58fc97bfb5e5a1ea9bab)——含 PNG 图像 + PNG 二值分割掩膜 + 逐图 CSV 元数据(BI-RADS / pathology / histology / 患者标识);配套代码 github.com/wgomezf/BUS-BRA
AI 就绪度

INFOBOX — BUS-BRA 一屏速览

维度 内容
本质 巴西 INCA 采集的乳腺超声(BUS)公开数据集,同含病理+BI-RADS+掩膜三标注+官方标准折
全称 BUS-BRA: A Breast Ultrasound Dataset for Assessing Computer-aided Diagnosis Systems
命名 BUS(Breast UltraSound)+BRA(Brazil,巴西)
采集地 巴西里约热内卢国家癌症研究所(INCA, Rio de Janeiro)
版权/分发 PEB/COPPE-UFRJ(里约联邦大学生物医学工程计划)持版权并首席分发;Cinvestav(墨西哥)持续开发
论文 Medical Physics 2024, vol.51(4):3110-3123(DOI 10.1002/mp.16812;2023-11-08 在线先行)
首发 Zenodo 10.5281/zenodo.8231412,version 1.0,2023-03-13
规模 1,064 患者 / 1,875 张 B-mode 图(平均约 1.76 张/患者)
扫描仪 4 台:GE Logiq 5、GE Logiq 7、Toshiba Aplio 300、GE U-Systems
标注 活检病理(良/恶性)+BI-RADS 2/3/4/5+手工二值分割掩膜+组织学(28 类)
官方折 标准化 5 折与 10 折交叉验证划分(图像级互斥)
病灶级分布 病例级 722 良性/342 恶性(论文/Zenodo)|图级 1,268 良性/607 恶性(第三方重算)
BI-RADS 分布 2:562|3:463|4:693|5:157(图级,第三方口径)
官方评估 DeepLabV3+ 语义分割(骨干 ResNet18/ResNet50)+ ResNet 分类,Matlab 2022b
关键风险 官方折非患者级互斥——第三方审计实证为数据泄漏,修正后指标大跌
许可 CC BY-4.0(Zenodo 官方;署名即可再分发/商用)
获取 Zenodo records/8231412 直链下 BUSBRA.zip(133.9 MB,md5 1f8b2be6476d58fc97bfb5e5a1ea9bab)
库内互链 busi(乳腺超声对照,rid 539)、cbis-ddsm(rid 541)、inbreast(rid 542)、brset(rid 351)等

BUS-BRA 是一份"把乳腺超声 CAD 评测所需的三样东西凑齐"的数据集:它不满足于只给图像和良恶性标签,而是同时提供了资深超声医师的 BI-RADS 分级、活检证实的病理结果与逐像素的病灶分割掩膜,再配上官方钦定的 5 折/10 折交叉验证划分——四件套合一,让"良性 vs 恶性"这一对老问题第一次能在统一的、可复现的评测台上被公平比较。它来自巴西里约热内卢国家癌症研究所(INCA)的临床超声室,1,064 名女性患者、1,875 张 B 模式图像,于 2023 年 3 月以 CC BY-4.0 的宽松许可托管在 Zenodo 上,配套论文发表于 Medical Physics 2024。

但 BUS-BRA 的故事里有一个必须单独拎出来的章节:它引以为傲的"官方标准折"经第三方审计被证实只做到图像级互斥、没做到患者级互斥——同一位患者的不同切面图可能同时出现在训练集和测试集里,构成典型的数据泄漏(data leakage)。当修正为严格的患者级划分后,报告过的分割与分类指标出现断崖式回落(分割 88.27%→73.99%)。这使 BUS-BRA 在"数据集可用性"之外,又成了一个研究"划分协议如何决定模型上限"的活教材。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——Zenodo 单链 BUSBRA.zip 直接下,CC BY-4.0,无门禁;但要记住引用论文是使用条件。
  2. 关心评测可信度:直奔 §4 的划分与泄漏专节与 §7 基准——官方折的坑与第三方修正后的数字是最有价值的部分。
  3. 做分割/分类建模:直奔 §2 规格与 §5 任务标注——注意良恶性计数有病例级/图级两套口径(坑 1),别混引。

§0 导读:这个数据集解决什么问题

乳腺超声(breast ultrasound, BUS)是乳腺影像里最"易得"也最"难评"的模态。易得,是因为它无电离辐射、设备普及、可实时动态观察;难评,是因为超声图像天生高噪、斑点(speckle)弥漫、肿瘤边界模糊,且高度依赖操作者手法——同一病灶不同切面、不同机器、不同医师,图像长相可以差很远。这直接导致两个长期困扰 CAD(computer-aided diagnosis,计算机辅助诊断)研究的痛点:评测口径不统一与标签不完整。

口径不统一,体现在"良性 vs 恶性"二分类之外,临床真正用于决策的是 BI-RADS(Breast Imaging-Reporting and Data System,乳腺影像报告与数据系统)分级——从 2(良性)到 5(高度可疑恶性)。很多公开数据集只给良恶性,模型学不到 BI-RADS 的连续性判断;标签不完整,则体现在分割任务与分类任务往往落在不同数据上,一个数据集给掩膜、另一个给病理,无法在同一批图上同时评测"能不能把肿瘤圈准"和"能不能把类型判对"。

BUS-BRA 的回答是把这几件事绑到同一批图上:每张图同时有 (1) 活检证实的病理标签、(2) 资深超声医师的 BI-RADS 分级、(3) 手工勾画的分割掩膜,另外补上 (4) 组织学类型。再往上加一层"官方标准折"——把数据切成固定的 5 折和 10 折,让所有人在同一划分上训练与测试,结果才可比。这就是论文标题里 “for Assessing Computer-aided Diagnosis Systems”(用于评估计算机辅助诊断系统)的字面含义:它把自己定位成评测台,而不只是一堆图片。

0.1 乳腺超声 CAD 的三个老问题

要理解 BUS-BRA 的取舍,得先看清它想解决的三个具体问题:

  • 标注稀疏:乳腺超声公开集里,给掩膜的往往不给病理、给病理的往往不给 BI-RADS、给 BI-RADS 的规模又很小。研究者在"我想同时评测分割和分级"时无集可用,只能拼凑,导致结果互不可比。
  • 评测不可复现:没有统一划分,每篇论文自己切数据,"我 90%、你 88%“背后可能是不同的测试集,数字没有可比性。BUS-BRA 用官方标准折正面回应这一点——这恰是它标题里"Assessing”(评估)的落点。
  • 规模与可获取性不足:多数早期 BUS 集只有百量级图像且需申请,深度模型容易过拟合、复现门槛高。BUS-BRA 一次给到 1,875 图并直链开放。

三个问题里,BUS-BRA 最用力解决的是第二个(评测),也因此最依赖"划分的正确性"——而后来的审计发现,恰恰是这一点出了患者级泄漏的问题(§4),构成它故事里最具反讽意味的一环。

0.1b 与本库其他条目的定位关系

放到千方病案医数集的语境里,BUS-BRA 填补的是"乳腺超声(BUS)评测基准"这一格:

  • 库内乳腺影像条目多为钼靶(cbis-ddsm 541、inbreast 542、vindr-mammo 543)或病理(breakhis 126、bach 118、breastpathq 268),超声模态此前只有 busi(539)一个较弱代表(无 BI-RADS、无标准折、规模小)。
  • BUS-BRA 进入后,与 busi(539)形成"乳腺超声双子座":一个担当训练/评测台(本集),一个常作外部验证;再与 brset(351)构成"超声分割"子群。
  • 对做"乳腺 AI 全模态"研究的检索者,BUS-BRA 是超声环的关键补全——从钼靶到超声到病理,库内首次可以在同一坐标下摆齐三模态。

因此本条目的价值不只是"多了一个数据集",而是把库内乳腺影像的模态版图补完整(§9 详述互链)。

0.2 为什么是"超声":模态特性决定的建模难点

BUS-BRA 是超声数据集,这个模态选择决定了它的技术气质。超声图像的三个特性直接塑造了建模难点:

  1. 斑点噪声(speckle noise):相干成像的固有乘积噪声,表现为弥漫的颗粒纹理,会淹没低对比度的病灶边缘。这是超声与 CT/MRI 最大的视觉差异,也是为什么"去斑点滤波"被论文列为潜在应用。
  2. 操作者依赖(operator dependence):探头角度、压力、增益全由医师实时调整,同一病灶两次扫查的图可以明显不同。BUS-BRA 的多切面结构(同患者多图)正是这一特性的产物。
  3. 边界模糊(blurred margins):良恶性判别的关键征象之一是边缘形态(毛刺、成角、微分叶),但超声边界常不连续,使分割与分类都更难。

这三个特性叠在一起,解释了两件事:为什么 BUS-BRA 要把"分割掩膜"和"BI-RADS 分级"都给出来(单靠像素难判别,需要结构化的专家知识);也为什么"跨设备泛化"(4 台扫描仪)值得单列为一类应用。

§0 读法三则:

  1. 这个条目是"数据集 + 评测基准 + 划分方法学案例"三合一:本体是 1,875 张带三标注的超声图,评测价值来自官方标准折,方法学价值来自官方折被审计出的患者级泄漏(§4、§7)。
  2. 全文数字多为一手三源互证(Zenodo/论文/GitHub 文字近乎逐字一致);但良恶性计数存在病例级/图级两套口径(坑 1)、BI-RADS 逐类计数仅见第三方(坑 3),引用前务必对口径。
  3. 检索时"BUS-BRA"与"BUSI"是两个不同数据集,不是别名也不是版本:BUSI 在埃及、780 图、无 BI-RADS;BUS-BRA 在巴西、1,875 图、含 BI-RADS 与标准折(坑 2)。

§1 数据集速览:十问十答

Q1:BUS-BRA 的"1,064 患者 / 1,875 张"从哪来?
全部采集于巴西里约热内卢国家癌症研究所(INCA)的临床超声检查。1,064 名女性患者共 1,875 张 B 模式(B-mode)乳腺超声图,平均约 1.76 张/患者——部分患者提供了多个切面甚至双侧图像,这也是"患者数 ≠ 图像数"以及后文各种计数口径分歧的根源。

Q2:图像和标签分别是什么格式?
图像与掩膜均为 PNG;元数据为独立的 CSV 文件(逐图一行,含 BI-RADS、病理、组织学、患者标识等字段)。图像尺寸随图而异(论文原文 dimensions vary),未做统一裁剪或缩放——这意味着直接入模前通常需要自行归一化尺寸,也意味着你要把尺寸当作预处理超参数而非固定常数。

Q3:三类标注分别是谁做的、可靠吗?
分割掩膜与 BI-RADS 分级由一位资深超声医师(senior ultrasonographer)手工完成;病理标签来自活检(biopsy)证实的临床结果,属于"金标准"性质。注意标注者是单个人、不是多专家委员会,论文未报告观察者间一致性(interobserver agreement)——这是本数据集在标签可靠性上的主要保留项(§5)。

Q4:良性和恶性到底各多少例?
这正是最容易踩的坑。病例(肿瘤)级是 722 良性 / 342 恶性(论文摘要与 Zenodo 描述口径);图像级则是 1,268 良性 / 607 恶性(第三方按实际图数重算)。两套数字都"对",只是计的层级不同——多图患者会把图像级计数推高。本条目以图级为主口径并同时标注病例级(坑 1)。

Q5:BI-RADS 分级怎么分布?
图级口径:BI-RADS 2 有 562 张(30.0%)、3 有 463 张(24.7%)、4 有 693 张(37.0%)、5 有 157 张(8.4%),合计 1,875。要特别注意:这组逐类数字出自第三方论文(BUSTR、Brunel 两源互证),BUS-BRA 官方文档只说"categories 2, 3, 4, and 5",并未给逐类表(坑 3)。

Q6:组织学(histology)有哪些类型?
共 28 种,第三方论文公开了 Top-10:纤维腺瘤(Fibroadenoma)835 张、浸润性导管癌(Invasive Ductal Carcinoma)520 张、囊肿(Cyst)142 张、纤维囊性变(Fibrocystic Changes)106 张,其后依次为浸润性小叶癌 42、导管内乳头状瘤 41、硬化性腺病 37、增生 31、脂肪瘤 17、叶状肿瘤 13。余 18 类未完整披露(坑 3 相关)。

Q7:官方"标准折"到底是什么、有什么问题?
官方提供 5 折与 10 折两套标准化交叉验证划分,声称"每折图像互斥"。问题在于:它只保证图像级互斥,不保证患者级互斥——官方文档自己(MDPI CMT-BUSNet 转述)说明"作者不保证患者级分离,因为部分患者贡献了来自不同扫描平面的多张图像"。第三方 PerceptGuide v1.0.1 的审计给出了后果:原划分存在数据泄漏,按患者级重划后分割 88.27%→73.99%、分类 86.92%→77.10%(§4、坑 5)。

Q8:官方用什么方法做基准?
论文自带的评估框架是语义分割 DeepLabV3+,骨干网络用 ResNet18 / ResNet50;分类同样基于 ResNet18/ResNet50 特征;实现语言/环境为 Matlab 2022b,配 5 折交叉验证复现。GitHub 仓库分成 Segmentation 与 Classification 两套框架,各含各自的项目文件与运行脚本(§7)。

Q9:我现在能拿到什么、要不要申请?
全量直接下,无门禁。Zenodo 记录 10.5281/zenodo.8231412 提供 BUSBRA.zip(133.9 MB,md5 1f8b2be6476d58fc97bfb5e5a1ea9bab)一行命令即可下载;代码在 github.com/wgomezf/BUS-BRA。许可 CC BY-4.0——署名即可再分发、修改、商用。唯一约束是"任何基于 BUS-BRA 的研究必须引用 Medical Physics 2024 论文"。

Q10:为什么它对 AI-Ready 重要?
它是"四件套标注 + 官方标准折 + 最宽松许可 + 单链直下"的组合样本:三标注(病理/BI-RADS/掩膜)解决了评测口径不统一,标准折解决了可比性,CC BY-4.0 与 Zenodo 直链解决了可获取性,而且规模(1,875 图)足够跑动深度模型。它同时是本库中"数据集自带已知方法学缺陷(患者级泄漏)“的典型案例——AI-Ready 不等于"无隐患”,把隐患写清楚同样是就绪的一部分。

Q11:为什么是巴西的数据?有地域偏倚吗?
BUS-BRA 采集于巴西里约热内卢的国家癌症研究所(INCA),是单一国家、单一机构的数据。这带来一个必须承认的局限:人群构成、设备品牌(4 台均为 GE/Toshiba 等主流厂商机型)、扫描习惯都带巴西单一中心色彩,模型在巴西数据上训练后到其他人群/设备的泛化性需要外部验证(BUSI/UDIAT/BrEaST 正是常用外部队)。不过,4 台不同扫描仪至少提供了设备层面的多样性,比"单机数据集"更接近多中心场景。

Q12:它和 BUSI 到底谁大、该用哪个?
规模上 BUS-BRA(1,875 图 / 1,064 患者)大于 BUSI(780 图 / 600 患者);标注上 BUS-BRA 多出 BI-RADS 与官方标准折,BUSI 的"正常"类别是 BUS-BRA 没有的(BUSI 三分类:正常/良性/恶性)。选择建议:需要 BI-RADS、需要标准折、需要更大规模 → BUS-BRA;需要"正常"类别或做埃及/中东场景 → BUSI。两者常一起用:BUS-BRA 训练、BUSI 外部验证。切忌当成同一份数据(坑 2)。

Q13:商用会不会有法律风险?
按 Zenodo 官方许可 CC BY-4.0,商用是允许的(唯一硬性义务是署名)。但有两个提醒:(1) 别被第三方站标成 GPL-3.0 的口径误导(坑 4),以 Zenodo 为准;(2) 数据集本身是医学影像,即便许可宽松,落到具体产品时仍受当地医疗数据与器械法规约束(许可 ≠ 合规),这部分需自行咨询法律。

Q14:数据集里有没有患者隐私信息?
公开的是 B-mode 超声图 + 掩膜 + 结构化元数据(病理/BI-RADS/组织学/患者标识),患者标识是研究用假名(不是姓名/病历号)。但原图带有设备叠加文字(也可能含检查号等),第三方预处理用强度截断抑制部分叠加层。作为使用者,不应尝试从图像中还原任何身份信息,也不要把伪名当可关联标识使用——这是医学数据伦理的基本要求。

Q15:如果我只想做"良恶性二分类",最快多快能跑起来?
最短路径:下载 BUSBRA.zip → 解压 → 读 CSV 取 patient_id 与 pathology → 以 patient_id 分组做 GroupKFold → 图像 resize 统一尺寸 → 训练一个 ImageNet 预训练的 ResNet → 报告敏感度/AUC。掩膜与 BI-RADS 可暂不用。唯一不能省的是 patient_id 分组——省了就会复现官方折的泄漏(§4)。预计上手时间主要花在下载与预处理,而非模型。

§1.5 一表读全:BUS-BRA 数字总账

在进入细节前,先把全文会反复出现的数字集中成一张账,标注口径与出处——这是本条目"防混引"的第一道闸门。

数字 含义 口径 出处 本条目用法
1,064 女性患者数 患者级 三源一致 主口径
1,875 B-mode 超声图数 图像级 三源一致 主口径
~1.76 平均图数/患者 派生 1875 ÷ 1064 说明多图现象
722 / 342 良性 / 恶性 病例级 论文摘要、Zenodo 标记为病例级
1,268 / 607 良性 / 恶性 图像级 第三方重算 主口径(图级)
562 / 463 / 693 / 157 BI-RADS 2/3/4/5 图像级 第三方(BUSTR/Brunel) 标注第三方
28 组织学类型总数 病例级 第三方(Top-10 公开) 标注仅 Top-10 可得
4 扫描仪台数 设备级 第三方论文 域差异论据
5 / 10 官方折数 划分级 官方 评测协议
88.27 / 86.92 修正前 分割/分类 图像级折 PerceptGuide 标注"含泄漏水分"
73.99 / 77.10 修正后 分割/分类 患者级折 PerceptGuide v1.0.1 严谨基线
133.9 MB 压缩包大小 文件级 Zenodo API 下载参考
4,809 下载次数 统计 Zenodo(2026-09-30) 使用广度佐证

用法三条:(1) 凡引用良恶性数字,必写明"病例级/图像级";(2) 凡引用 BI-RADS/组织学逐类数字,必注明第三方出处;(3) 凡引用分割/分类指标,必注明划分协议(图像级/患者级)。

三源互证说明:1,064 / 1,875 / 722 / 342 四个数字在 Zenodo 描述、GitHub README、论文摘要三处的文字近乎逐字相同(作者把同一段叙述复制到三个渠道),因此相互印证强度高;而 1,268 / 607 及 BI-RADS 逐类数字则来自独立第三方重算,属外部证据,价值在于"用元数据自己数一遍"消解了口径歧义。

§2 数据构成与规格

2.1 规模三层口径:患者 / 图像 / 病灶

BUS-BRA 的规模要分三层理解,混层就会得到互相矛盾的数字:

层级 计数 说明
患者(patients) 1,064 全部为女性患者,三源(Zenodo/论文/GitHub)一致
图像(images) 1,875 B-mode 超声 PNG 图,平均约 1.76 张/患者
病灶/病例(cases/tumors) 1,064(即病例数≈患者数) 每患者按一例处理,故病例级计数与患者数对齐

“每患者一例、但可有多个切面图"是理解全部数字的关键:病例级写 1,064,图像级写 1,875,差值 811 张就是"同一位患者的额外切面/双侧图”。论文摘要与 Zenodo 描述的 722 良性/342 恶性合计恰为 1,064,说明那是病例级口径;第三方重算的 1,268 良性/607 恶性合计为 1,875,是图像级口径(坑 1)。

2.2 采集设备与成像条件

属性 规格
模态 B 模式(B-mode)灰阶超声
扫描仪 4 台:GE Logiq 5、GE Logiq 7、Toshiba Aplio 300、GE U-Systems
图像尺寸 随图而异(论文原文:dimensions vary across the dataset),未统一
图像格式 PNG(灰阶)
掩膜格式 PNG(二值:肿瘤区 vs 正常区)
元数据格式 独立 CSV(逐图字段)
采集机构 巴西里约热内卢国家癌症研究所(INCA)临床超声检查

四台不同扫描仪带来真实的域间差异(domain shift):不同厂商的增益曲线、斑点纹理、聚焦与动态范围不同,同一病灶在不同机器上呈现的灰度分布并不一致。这既是挑战(跨设备泛化),也是价值(更贴近多中心真实场景,比单机数据集更能暴露模型对设备指纹的过拟合)。第三方论文在预处理阶段常需对原图做 1/99 百分位强度截断,以抑制设备叠加的标尺、文字等伪影(artifacts)——这反向印证原图确实带有这类叠加层(坑 6)。

2.3 标注体系:三标注 + 一附加

标注 取值 来源 层级
病理(pathology) 良性 / 恶性(biopsy-proven) 临床活检 病例级(逐图继承)
BI-RADS 2 / 3 / 4 / 5 资深超声医师评估 图像级
分割掩膜(mask) 二值:肿瘤 vs 正常 资深超声医师手工勾画 像素级
组织学(histology) 28 类(含纤维腺瘤、IDC 等) 临床病理 病例级

这四类标注的组合决定了 BUS-BRA 能支撑的任务跨度:像素级(分割)、图像级(BI-RADS 分级)、病例级(良恶性分类、组织学分型)。值得注意的是掩膜是二值而非多类——第三方(MDPI YOLO 论文)明确指出"BUS-BRA 的掩膜是二值的,因此类别标签取自随附的元数据",即掩膜只回答"哪里是病灶",不回答"是哪一类病灶",类别信息要从 CSV 里取。这一点在做多类分割时是硬约束。

2.4 良恶性与 BI-RADS 的分布

病理分布(双口径):

口径 良性 恶性 合计 恶性占比
病例/肿瘤级(论文摘要、Zenodo) 722 342 1,064 32.1%
图像级(第三方重算) 1,268 607 1,875 32.4%

两套口径下恶性占比都约在 32%,说明多图现象在良恶性之间基本同比例分布、未造成严重的方向性偏斜——这是本数据集相对友好的地方(约 1:2 的良恶比,虽有类不平衡但不极端)。

BI-RADS 分布(图级,第三方口径):

BI-RADS 含义 图数 占比
2 良性(benign) 562 30.0%
3 可能良性(probably benign) 463 24.7%
4 可疑(suspicious) 693 37.0%
5 高度可疑恶性(highly suggestive of malignancy) 157 8.4%
合计 — 1,875 100%

分布上,BI-RADS 4 占比最高(37%),2 与 3 合计过半(54.7%),5 最少(8.4%)。这与真实临床筛查队列的形态相符——大量良性/可能良性发现,少量高度可疑。对建模的含义:BI-RADS 5 样本仅 157 张,做四级分类时最小类的召回率会很不稳定;很多第三方工作干脆把它退化成"BI-RADS ≤3 vs ≥4"的二分类来规避类不平衡。

2.5 组织学分布 Top-10

组织学类型(中文/英文) 图数
纤维腺瘤(Fibroadenoma) 835
浸润性导管癌(Invasive Ductal Carcinoma, IDC) 520
囊肿(Cyst) 142
纤维囊性变(Fibrocystic Changes) 106
浸润性小叶癌(Invasive Lobular Carcinoma, ILC) 42
导管内乳头状瘤(Intraductal Papilloma) 41
硬化性腺病(Sclerosing Adenosis) 37
增生(Hyperplasia) 31
脂肪瘤(Lipoma) 17
叶状肿瘤(Phyllodes Tumor) 13

来源:BUSTR(arXiv:2511.20956)Table 2,明确标注为"Top 10 of 28"。两个观察:其一,纤维腺瘤 + 浸润性导管癌两类合计 1,355 张(约 72%),其余 26 类共享剩余 28%,长尾极长——任何组织学分型的尝试都会被头部两类主导;其二,组织学粒度上是"良性病变类型"(纤维腺瘤、囊肿)与"恶性亚型"(IDC、ILC)混排,做"良性 vs 恶性"分类时,组织学字段可以帮助构造更细的监督信号,但要注意良性侧的类别远多于恶性侧。

2.5b 组织学与病理的对应关系

把组织学 Top-10 按病理归并,能看清标签体系的层级一致性:

病理 典型组织学类型 Top-10 中的图数合计
良性 纤维腺瘤、囊肿、纤维囊性变、导管内乳头状瘤、硬化性腺病、增生、脂肪瘤 835+142+106+41+37+31+17 = 1,209
恶性 浸润性导管癌、浸润性小叶癌 520+42 = 562
交界/可变 叶状肿瘤(Phyllodes,可良性/恶性/交界) 13

两点提示:其一,Top-10 里良性侧图数(1,209)远超恶性侧(562),与全集合良恶比(约 2:1)方向一致;其二,叶状肿瘤是交界性病变,按"良性 vs 恶性"简化时归属存在争议,建模时需自行决定二分归属,这是组织学标签精细度带来的额外决策。整体看,BUS-BRA 的病理/组织学字段构成一个两级标签体系(粗:良恶性;细:组织学),研究者可按任务需要选择粒度。

2.5d 为什么会有这么多良性样本

很多做二分类的读者会问:为什么良性远多于恶性(约 2:1)?这不是采样失误,而是乳腺超声检查的真实分布:

  • 乳腺超声的日常适应证大量是良性病变的评估与随访(囊肿、纤维腺瘤、纤维囊性变),恶性只是少数;
  • 数据来自 INCA 的常规临床检查,不是"只收恶性病例"的研究队列,因此自然呈现筛查队列的分布;
  • 这也解释了为什么 BI-RADS 2/3(良性/可能良性)合计过半——大多数受检者本就不是恶性。

对建模的含义是双面的:好处是贴近真实临床先验(模型的假阴性代价可被合理评估);坏处是类不平衡会让"全预测良性"这种平凡解拿到 ~68% 准确率,因此必须报敏感度/AUC 而非只看 accuracy。若要人为平衡类分布,需用重加权/过采样,并注意不要破坏患者级划分(§4.7)。

2.5c 图像尺寸与预处理的影响

论文明确图像尺寸"随图而异",这在实践中意味着一次预处理决策链:

环节 选项 对结果的影响
尺寸统一 缩放 / 填充 / 裁剪 改变病灶相对像素面积,影响 Dice/IoU
强度归一化 min-max / z-score / 1-99 截断 抑制设备伪影与增益差异
灰度处理 保持单通道 / 复制为三通道 影响能否用 ImageNet 预训练骨干
掩膜对齐 随图同步变换 不一致会直接破坏分割监督

其中尺寸统一与掩膜对齐必须联动:图像若做了缩放,掩膜必须用同样的变换(且最近邻插值以免引入非二值像素)。这是医学分割数据预处理最常见的翻车点之一。BUS-BRA 因尺寸不统一,把这个决策显式交给了使用者——建议在论文里报告所用的尺寸与插值方法,否则他人难以复现你的 Dice。

2.6 与库内相邻数据集的规格对照

数据集 机构/年份 患者 图像 模态 BI-RADS 掩膜 标准折
BUS-BRA(本条目) 巴西 INCA / 2023 1,064 1,875 超声 2–5 二值 5/10 折
BUSI(rid 539) 埃及 Baheya / 2018 600 780 超声 无 三类标注图 无
UDIAT(BUSI-Dataset-B) 西班牙 Parc Taulí / 2012 — 163 超声 无 有无病灶 无
BrEaST 波兰 / 2019 — 256 超声 有 有 无

一句话定位:在乳腺超声公开集里,BUS-BRA 是规模最大且唯一同时给齐病理+BI-RADS+掩膜+官方折的组合;BUSI 更大规模上逊色且缺 BI-RADS;UDIAT 图数最少但常被当外部验证集;BrEaST 标注丰富但仅 256 图。这也是第三方论文反复把它当"主训练集"、把 BUSI/UDIAT/BrEaST 当"外部验证集"的原因(§7)。

2.7 样本来源与选择:它是不是"随机样本"

一个常被忽略的问题是:这 1,875 张图是不是从 INCA 全部超声检查里随机抽的?公开信息里未见明确的随机抽样声明。能确定的是:

  • 数据来自 INCA 的临床检查,而非为建模专门设计的采集协议;
  • 病例需有"可供标注的病灶"(用于勾画掩膜),因此无病灶的纯筛查图可能未被纳入——这意味着 BUS-BRA 不是"全部乳腺超声"的无偏代表,而是"含可标注病灶"的子集;
  • 多图患者的存在说明部分病例做了多切面留图,但留图的规则(临床习惯)未公开。

对使用者的含义:不要把 BUS-BRA 当作"乳腺超声人群的无偏快照"。它的良恶比、BI-RADS 分布、病灶构成都是"含病灶子集"的分布,与"全部受检者"的分布不同。做患病率相关的推论(如"恶性占比 32%“作为人群患病率)会犯生态谬误——这里的 32% 是"被标注病灶中恶性的比例”,不是"受检人群中恶性的比例"。

§3 采集与标注流程

3.1 从临床到公开:一条怎样的管线

BUS-BRA 的采集扎根于 INCA 的常规乳腺超声检查流程,而非为建模专门征募的"干净"志愿者。这意味着数据带有一线临床的真实面貌:设备不统一(4 台)、检查不标准化(切面由医师现场决定)、结果不预设(活检与否由临床判断)。数据集的整理工作因此主要落在标注与元数据工程上,而不是图像采集本身。

流程可拆为四步:

  1. 临床采集:患者在 INCA 接受 B 模式乳腺超声检查,医师按临床需要留存切面图像;同一患者可能留下单张或多张(含双侧)。
  2. 病理归集:对接受活检的病灶,取得病理结果(良性/恶性)及组织学类型,作为"金标准"标签。
  3. 影像标注:由一位资深超声医师对图像逐一勾画病灶分割掩膜,并给出 BI-RADS 分级(2/3/4/5)。
  4. 元数据汇编与划分:把逐图的病理、BI-RADS、组织学、患者标识整理成 CSV,并生成官方 5 折/10 折划分索引,连同图像与掩膜打包为 BUSBRA.zip。

3.2 掩膜标注的性质

掩膜是二值地面真值(binary ground truth),即把每个像素判为"肿瘤区"或"正常区"。手工勾画意味着边界精度取决于标注医师对病灶边界的判断——超声边界本就模糊,不同医师可能给出不同的轮廓,而 BUS-BRA 只有单医师版本、无多标注对照。对建模的两个提醒:

  • 用这类掩膜训练分割模型时,模型学到的是"这位医师的边界风格",而非被证明唯一的解剖真值;报告 Dice/IoU 时应对这一上限有预期。
  • 二值掩膜不含类别,若要做"多类病灶分割",得自行把 CSV 里的组织学/病理字段与掩膜做关联,且只能在病灶级(一个连通域一个类)近似处理。

3.3 BI-RADS 单评估者的边界

BI-RADS 分级由同一位置深超声医师完成。BI-RADS 本身是"标准化沟通语言",其设计目标之一就是降低主观性,但临床研究显示不同医师、不同年资间仍存在可观的分级差异。BUS-BRA 采用单评估者方案,好处是分级标准内部一致(同一人、同一尺度),代价是无法给出评估者间一致性,也无从判断这位医师相对"共识"的偏移方向。使用者应当把它当作"一位专家的判断真值",而不是"专家委员会共识真值"(坑 7 相关的可靠性保留)。

3.4 官方划分的生成逻辑与原罪

官方划分(5 折 / 10 折)是 BUS-BRA 对社区最重要的贡献之一——它让不同论文的数字可比。但它的生成逻辑里埋着本条目最需要被记住的问题:

  • 官方保证每一折的图像互不重叠(image-disjoint)。
  • 官方未保证每一折的患者互不重叠——数据集作者在文档中明确"不保证患者级分离,因为部分患者贡献了多张来自不同扫描平面的图像"(MDPI CMT-BUSNet 引述)。

后果是:同一位患者的 A 切面可能进了训练折、B 切面进了测试折。由于同患者的图像高度相似,这构成近重复泄漏(near-duplicate leakage),会把测试指标抬到虚高。第三方 PerceptGuide v1.0.1 的审计把这一泄漏定量化了(§4.4、§7.3):按患者级重划后,分割指标从 88.27% 掉到 73.99%,分类从 86.92% 掉到 77.10%——跌幅即泄漏的"水分"。这解释了为什么 BUS-BRA 上一些漂亮的早期数字难以被后续工作在严格协议下复现。

3.5 元数据结构:CSV 里的逐图字段

BUS-BRA 把"图像之外的一切"收进独立 CSV,逐图一行。第三方论文用过的主要字段可归纳为:

字段类别 内容 粒度 用途
标识 图像 ID、患者标识 图/患者 划分、去重、关联掩膜
病理 良性 / 恶性 病例级 分类任务标签
分级 BI-RADS 2 / 3 / 4 / 5 图像级 分级任务标签
组织学 28 类之一 病例级 细粒度分型、类别关联
图像属性 尺寸、来源设备(间接) 图像级 预处理、域分析

这份 CSV 的结构决定了 BUS-BRA 能做几件事:因为有患者标识,才可能做患者级重划(§4.3 的修复工艺全依赖此字段);因为病理与组织学同表,才能从二值掩膜反查类别;因为BI-RADS 独立成列,才能做四级分级而非简单二分。反过来说,如果某个下游工作拿到的只是图像与掩膜(丢了 CSV),上述能力就都不存在——所以务必要连 CSV 一起下载与版本控制。

3.6 数据质量细节:伪影、尺寸与不平衡

三个需要在使用前处理的质量问题:

  1. 设备叠加伪影:原 B 模式图普遍带有设备渲染的标尺、文字、增益条与光标标记。第三方预处理(如 MDPI YOLO 论文)以 1/99 百分位强度截断来抑制它们,避免模型把"标尺"当成病灶线索。这是一个必须在预处理阶段处理的隐患(坑 6)。
  2. 尺寸不统一:图像尺寸"随图而异",深度学习入模前必须统一尺寸(缩放、填充或裁剪)。不同缩放策略会影响病灶的相对像素面积,进而影响分割指标——建议在报告中说明所用的尺寸归一化方法。
  3. 类不平衡:恶性约 32%、BI-RADS 5 仅 8.4%、组织学长尾极大。做分类/分级时需考虑重加权、分层采样或退化为粗分类(如 BI-RADS ≤3 vs ≥4)来缓解。

3.7 标注的粒度选择:病例级还是图像级

除"计数口径"外,标注本身也涉及粒度问题,需在使用前想清楚:

标注 天然粒度 能否下放到图像级
病理(良/恶) 病例级 可——同患者图继承同一标签
组织学 病例级 可——同患者图继承
BI-RADS 图像级 本就是逐图
分割掩膜 像素级 本就是逐图

两个推论:其一,病例级标签下放是"重复计数"的来源——把 1,064 个病例标签摊到 1,875 张图上,才产生 1,268/607 的图像级数字(坑 1);其二,这让"每患者一票"与"每图一票"的评测结果不同——若按图计权,多图患者会被过采样。严谨做法是:明确报告是按图还是按患者统计指标,必要时给出两种口径。

这三点合起来说明:BUS-BRA 的"可直接用"是数据层面的(下得到),而非管线层面的(拿来即训)。它省掉了申请与合规成本,但仍要求使用者做标准的医学影像预处理。

§4 划分、泄漏与数据可信度

4.1 为什么"划分"值得单开一节

对多数数据集,交叉验证划分只是附录里的一行设定;但对 BUS-BRA,划分恰是它最有讨论价值的对象。原因有三:其一,官方把"标准化折"当作核心卖点写进标题与摘要;其二,这套折经审计被发现存在患者级泄漏,直接影响任何引用其上指标的可信度;其三,修正泄漏本身成了一套可迁移的方法学范例,被后续论文采用。因此本节不把划分当技术细节,而当数据可信度的核心变量处理。

4.2 官方折的宣称与实情

维度 官方宣称 实际情况
折数 5 折 + 10 折两套 一致
互斥粒度 “图像互斥”(image-disjoint) 一致——但仅到图像级
患者级互斥 未宣称 未保证:同患者多图可跨折(作者文档自陈)
可复现性 提供固定划分索引 索引随数据集打包,可复现
跨论文可比性 意在统一评测口径 部分达成——但由于泄漏,早期数字被高估

问题的性质很明确:这不是"官方撒谎",而是"官方声明了一个较弱(图像级)的保证,使用者却常常默认了更强(患者级)的保证"。在医学影像里,患者级互斥是防止泄漏的行业底线,因为同患者的图像共享解剖、病灶与设备指纹,图像级互斥不足以保证训练/测试独立同分布假设成立。

4.3 泄漏的机制:为什么同患者多图会毁掉评测

想象一位患者有 3 张图(不同切面),官方划分把其中 1 张放入测试折、2 张放入训练折。训练时模型"见过"该患者的病灶在另外两个视角下的样子(大小、边缘、内部回声、周边腺体纹理),测试时面对同病灶的第三个视角,等于开了卷答题。这种泄漏在图像的像素级统计上留下可被模型利用的"指纹":

  • 重复纹理:同一台设备、同一位患者、同一次检查,斑点噪声的空间相关性、增益分布高度相似。
  • 病灶泄漏:同一病灶的不同切面在形态上高度相关,模型可以记住"这个病灶长什么样"而非学会"恶性病灶的通用特征"。
  • 背景泄漏:周围正常腺体的结构在患者内高度一致,构成可识别的背景模板。

三类泄漏叠加,使测试指标系统性偏高。跌幅有多大?第三方给出了量化答案。

4.4 第三方审计:泄露的定量证据

PerceptGuide v1.0.1 修正记录(github.com/Zehui-Lin/PerceptGuide 发布说明)是迄今最直接的一手证据:

原始数据划分未强制患者级分离,意味着同一患者的图像可能同时出现在训练集与测试集。这是一种数据泄漏(data leakage),会导致无效的模型评估。

该工作将划分修正为患者级分离后,在 BUS-BRA 上报告:

任务 原始(图像级划分) 修正(患者级划分) 跌幅
分割(seg) 88.27% 73.99% −14.28 个百分点
分类(cls) 86.92% 77.10% −9.82 个百分点

超过 14 个百分点的分割指标回落,足以改变一篇论文的结论方向。这组数字的价值不止于"BUS-BRA 的数字要打折",更在于它给整个乳腺超声 CAD 圈一个警示:报告高分割分数时,先确认划分是不是患者级。

4.4b 跌幅为何是"证据"而非"噪声"

有人可能质疑:指标掉下来会不会只是随机波动?这需要厘清方法论。患者级修正引进的唯一变化,是把同患者的其他图像从测试集移出训练集。如果模型学的确是"恶性病灶的通用特征",那么少看几张同患者的相似图不该造成十几点的落差;落差如此之大,恰恰反证了模型此前依赖了患者内相似性(记忆而非泛化)。这正是"跌幅即泄漏量"的推理依据:

  • 若落差很小(1-2 点)→ 泄漏轻微或模型本就在学通用特征;
  • 若落差很大(>10 点)→ 模型高度依赖患者内相似性,前期指标虚高。

BUS-BRA 的 14.28 点属于后者,因此它的历史高分列表需要整体审慎对待。这也解释了为什么后续严谨工作会在 Method 里专门声明"我们采用患者级划分"——这句话在 BUS-BRA 上不是客套,而是结果是否可信的分水岭。

另一路举证——MDPI YOLO 论文的补救范式:该工作没有停在"指出问题",而是给出了修复工艺:用 StratifiedGroupKFold(以患者标识分组、按病理分层)重做 10 折,严格保证每位患者只映射到一折,并在流水线里断言"每个患者标识只出现于一折"。这成了 BUS-BRA 上"如何正确划分"的参考实现。

4.4c 泄漏对三类任务的差异化影响

泄漏对不同任务的影响并不等价,理解差异有助于判断哪些文献数字更该打折:

任务 泄漏影响 原因
图像级分类(良恶性) 较大 同患者良恶性一致,模型可"认出患者"直接答题
像素级分割 最大 同一病灶不同切面形态高度重叠,边界可被记忆
BI-RADS 分级 较大 分级含患者内一致性,同患者多图答案相近

因此对分割类高分(88%+)应先打最重的问号;对分类结果同样需谨慎;只有外部验证(BUSI/UDIAT/BrEaST)上的数字不受本数据集内部泄漏影响。这就是为什么严谨论文会把内部患者级划分与外部验证并列报告——两者分别防守"内部泄漏"与"过拟合本集"两种失效模式。

4.5 怎么用这套数据才不踩泄漏

给使用者的一份操作清单:

  1. 不要默认官方折是患者级的。若要用官方折做基准以对接文献,必须显式声明"图像级划分,存在患者级泄漏",并把数字与之对标的文献同样标注。
  2. 自建划分时强制患者级互斥。以 CSV 里的患者标识为 group、以病理为 stratify,用 GroupKFold / StratifiedGroupKFold。
  3. 加断言。在数据加载阶段断言"训练集患者标识 ∩ 测试集患者标识 = ∅“,让泄漏在流水线里"跑不起来”。
  4. 报告两套数字。若必须与历史文献对比,同时给出"官方折"与"患者级折"两套结果,让读者看到水分有多少——这本身是有信息量的实验。
  5. 区分内部与外部验证。BUS-BRA 内部按患者级划分 + 在 BUSI/UDIAT/BrEaST 上做外部验证,是当前较稳妥的协议(§7)。

4.6 这不降低数据集价值,反而抬高了它

有一种误读是"既然有泄漏,这数据集就不能用了"。恰恰相反:泄漏是当时划分协议的技术局限,不是数据本身的缺陷。图像、掩膜、病理、BI-RADS 都还在,患者标识也在(正因为有此字段才能做患者级重划)。BUS-BRA 的贡献在于它把一个抽象的"划分很重要"命题变成了一次可复现的实证——修正前/后的对比数字是可以直接放进论文 Method 节的证据。它是"如何在真实数据集上做可信评测"的公开教案。

4.7 如何在代码里实现患者级划分

把 §4.5 的清单落到具体实现上,一份可复用的患者级划分骨架(伪代码,示意逻辑而非特定库):

读 CSV → 得到每图的 (image_id, patient_id, pathology, birads)
以 patient_id 为 group,以 pathology(或 birads)为 stratify
调用 StratifiedGroupKFold(n_splits=10, shuffle=True, random_state=42)
    → 得到每折的 训练/测试 图像索引
断言:对每一折,
    set(train.patient_id) ∩ set(test.patient_id) == 空集
若断言失败 → 抛出异常,禁止训练
把折索引落盘(CSV/JSON),随实验一起版本化

关键设计点:

  • 分组键必须是 patient_id,不能是 image_id——这是"图像级 vs 患者级"在代码里的唯一分界。
  • 分层键用 pathology 或 birads——保证每折的类分布接近总体,避免某折恶性全落训练集。
  • 断言要放在数据加载层、每次运行都执行——不要只在"划分脚本"里检查一次,因为下游可能用手工拼的索引绕过。
  • 折索引落盘——让数字可复现,也让评审者能核对划分是否真的患者级。

这段骨架是 BUS-BRA 上做"可信评测"的最短路径;把它接到 §4.5 的清单第 3、4 条,就构成了完整的防泄漏闭环。

4.8 一个反问:为什么官方当初没做患者级划分

理解"为什么没做",有助于判断这个问题在其他数据集上是否也会重演。可能的原因:

  1. 面向分割的惯性:图像级互斥是语义分割数据的常规做法(图像是独立样本的假设在许多自然图像场景成立),团队可能沿用了这一默认。
  2. 图像数 vs 患者数的错位:官方叙事强调"1,875 张图"的规模,而患者级划分要求以 1,064 为单位切分,会让每折的有效样本量减少,指标方差增大——团队可能出于"保持每折样本量"的考量选了图像级。
  3. 多图患者占比不高导致的低估:平均 1.76 图/患者、多数患者仅 1 图,可能让团队低估了少数多图患者带来的泄漏效应。
  4. 当时的社区惯例:2023 年其划分时,患者级互斥在超声 CAD 圈尚未成为普遍要求。

这四点合起来说明:患者级泄漏是一个"系统性的、容易在多个数据集上重演"的问题,而非某个团队的疏忽。这也正是 BUS-BRA 审计意义超出单个数据集的原因——它提示每一份医学影像数据集都该自问"我的划分是患者级的吗"。

§5 任务与标注

5.1 三大任务的定义

BUS-BRA 官方定位支持三类任务,对应三种标注:

任务 输入 输出 监督来源 粒度
病灶分割(segmentation) B-mode 超声图 二值掩膜(肿瘤/正常) 医师手工勾画 像素级
病理分类(pathology classification) 超声图(+可选掩膜) 良性/恶性 活检病理 图像/病例级
BI-RADS 分类(BI-RADS classification) 超声图 2/3/4/5 医师评估 图像级

分割与分类可以耦合(先分割出病灶区域、再在病灶区域上分类),论文与 GitHub 的代码框架也体现了这种"分割辅助分类"的思路。

5.2 官方评估框架的技术构成

论文自带的评估框架规格:

组件 规格
分割网络 DeepLabV3+ 语义分割
骨干网络 ResNet18 / ResNet50
分类网络 基于 ResNet18 / ResNet50 特征
实现环境 Matlab 2022b
验证协议 5 折交叉验证
代码仓库 github.com/wgomezf/BUS-BRA(Segmentation / Classification 两套框架)

选择 DeepLabV3+ 的用意是把 BUS-BRA 定位成"语义分割评测台"——它给的是像素级掩膜,自然以语义分割为主任务。ResNet18/50 的搭配则给了"轻量 vs 重度骨干"的对照。需要注意的是实现语言是 Matlab,对 Python 生态的使用者,要么复现框架、要么直接取数据自行搭 PyTorch 管线——官方给的主要是数据与协议,而非必须照搬的代码。

5.3 标注可靠性的三个保留项

保留项 具体 影响
单标注者 掩膜与 BI-RADS 均出自一位资深超声医师 无观察者间一致性;标签带这位医师的个体风格
二值掩膜 掩膜只区分肿瘤/正常,不含类别 多类分割需从 CSV 关联,且只能在病灶级近似
无中心化复评 未见多中心交叉复核流程公开 跨设备的标注一致性无独立验证

这三点不构成"不能用",但构成了"报告结果时要说清楚"的义务:单标注真值是一个合理但非唯一的地面真值,模型的指标上限有一部分是"与这位医师的对齐度"而非"与生物学事实的距离"。

5.3b BI-RADS 分级:判读逻辑与建模意涵

BI-RADS(Breast Imaging-Reporting and Data System)由美国放射学会(ACR)制定,是乳腺影像的标准化报告语言,其核心是把影像发现映射到一个 0–6 的分级,用以规范后续处理。BUS-BRA 覆盖的是其中 2–5 四档:

分级 临床含义 处置倾向 BUS-BRA 图数
2 良性(benign) 常规随访 562
3 可能良性(probably benign) 短期复查(通常 6 个月) 463
4 可疑(suspicious) 建议活检 693
5 高度可疑恶性 强烈建议活检 157

对建模的三点意涵:

  1. 分级不是良恶性的粗细版,而是"行动导向"的量表。BI-RADS 3 与 4 之间是"再观察"与"做活检"的临床分水岭,模型若在此界附近出错,临床后果远大于 2/3 之间出错。因此评估分级模型时,混淆矩阵在 3↔4 界上的表现比总体准确率更有意义。
  2. 分级与病理不完全对应。BI-RADS 5 也可能活检为良性(假阳性),BI-RADS 3 也可能最终为恶性。BUS-BRA 同时给了 BI-RADS 与病理,正好可以量化这种"影像判断 vs 组织学事实"的不一致——这是纯病理标签集做不到的分析。
  3. 最小类(BI-RADS 5,157 张)制约四级分类。做四级分类时,8.4% 的样本量会让该类指标剧烈波动;多数工作因此退化为二分类(如 ≤3 vs ≥4)或采用代价敏感学习。

5.4 潜在应用清单(论文列举 + 本文补充)

论文列举的应用方向:病灶检测与分割、病理良恶性分类、BI-RADS 自动分级、去斑点滤波(despeckle filtering)、对比度增强、特征工程。本文基于数据集特性补充:

  • 跨设备泛化研究:4 台扫描仪天然构成域划分,可做"留一台设备出(leave-one-machine-out)"的泛化测试。
  • 多任务学习:分割+分类+BI-RADS 三级监督可联合训练,研究任务间的知识迁移。
  • 弱监督与半监督:掩膜只在部分研究用到,可研究"仅用图像级标签训练分割"。
  • 数据集划分方法学研究:官方折 vs 患者级折的对照本身就是现成实验台(§4)。
  • 不确定性建模:单标注者意味着真值有噪声,适合研究标签噪声下的鲁棒训练。

5.5 与其他 BUS 数据集在任务覆盖上的差异

数据集 分割掩膜 病理分类 BI-RADS 标准折 规模
BUS-BRA 二值 有 2–5 5/10 折 1,875 图
BUSI(rid 539) 三分类标注 有 无 无 780 图
UDIAT 有无病灶 有 无 无 163 图
BrEaST 有 有 有 无 256 图

BUS-BRA 的差异点集中在"BI-RADS + 标准折 + 规模"三者同时具备;这也是它被第三方论文选定为跨数据集实验的主训练集的直接原因——训练集要规模大、标注全,外部验证集要独立,BUSI/UDIAT/BrEaST 恰好补齐了后者的角色。

5.6 从标注到标签:一次任务的端到端拆解

以"病灶分割"为例,走一遍从原始数据到训练张量的完整链路,标出每一步 BUS-BRA 的特殊注意点:

步骤 通用做法 BUS-BRA 特殊点
1 下载解压 取图像+掩膜 顺带取 CSV,别丢元数据
2 读元数据 建索引 用 patient_id 建 group
3 划分 train/val/test 患者级(§4.7),非图像级
4 尺寸统一 resize 到固定尺寸 掩膜同步最近邻插值
5 强度归一 z-score / 截断 1/99 截断抑制伪影
6 增广 翻转/旋转/弹性 注意勿跨患者混增广
7 训练 分割网络 可按需换 DeepLabV3+ 以外
8 评测 Dice/IoU 逐折 报均值±std,标注划分协议
9 外部验证 换数据集 BUSI/UDIAT/BrEaST

这份链路的价值在于:BUS-BRA 的"坑"几乎都集中在第 2、3、4、5 步——而这些恰是通用教程里最容易被跳过、也最容易让结果失真的步骤。把这张表当作 checklist,可以避免绝大多数常见错误。

5.7 分类任务的标签选择:病理 vs BI-RADS

BUS-BRA 同时给了两套可用于分类的标签,选择哪套取决于研究目标:

目标 用哪套标签 理由
判别"是不是癌" 病理(良性/恶性) 组织学金标准,二分类清晰
辅助"要不要活检" BI-RADS(2–5) 模拟临床决策分级
影像-病理对照研究 两套都用 量化影像判断与组织学的不一致
与文献对齐 看文献用哪套 多数分类论文用病理

两点提醒:其一,两套标签不等价——BI-RADS 是影像判断,病理是组织学事实,二者存在系统性不一致(影像可能高估或低估),这本身是可研究的对象;其二,报告时必须写清用的是哪套标签,因为"BUS-BRA 分类准确率 90%"若不说明标签,读者无法判断其含义。BUS-BRA 同时提供两套标签,是它的优势,但也因此更需要使用者明确交代口径。

5.8 一个最小的可运行示例(伪代码)

给"想立刻上手"的读者一个最小骨架,串起本条目强调的所有要点:

# 1. 读元数据(务必含 patient_id)
meta = read_csv("metadata.csv")   # 1,875 行
assert len(meta) == 1875

# 2. 患者级划分(防泄漏的关键)
groups = meta["patient_id"]
strata = meta["pathology"]
folds  = StratifiedGroupKFold(n_splits=10).split(meta, strata, groups)
for tr, te in folds:
    assert set(groups[tr]).isdisjoint(set(groups[te]))   # 患者级互斥断言

# 3. 图像与掩膜同步预处理
x = load_image(meta["image_path"]); m = load_mask(meta["mask_path"])
x, m = resize(x, (256,256)), resize_nearest(m, (256,256))   # 掩膜最近邻
x = percentile_clip(x, 1, 99)                                # 抑制伪影

# 4. 训练 + 评测(分割报 Dice/IoU,分类报敏感度/AUC)
...

# 5. 若要与文献对比,另跑一版"官方折"并标注协议差异

这段骨架的每一行都对应本条目的一处告诫:patient_id 分组(§4.7)、互斥断言(§4.5)、掩膜最近邻(§2.5c)、百分位截断(§3.6)、双协议对照(§7.6)。把它贴在实验代码里,等于随身带着这份条目的避坑清单。

§6 获取与许可

6.1 两件资产、两个入口

资产 入口 许可 门槛
数据本体(1,875 图 + 掩膜 + CSV 元数据 + 划分索引) Zenodo records/8231412(BUSBRA.zip,133.9 MB) CC BY-4.0 无,直链下载
代码(分割/分类框架,Matlab) github.com/wgomezf/BUS-BRA 见仓库声明 无
论文 DOI 10.1002/mp.16812(Medical Physics,订阅制) Wiley 口径 订阅/机构访问

与库内许多"注册墙 / 请求制"数据集不同,BUS-BRA 的获取极为顺畅:一个 Zenodo 直链、一个压缩包、无需申请、无需注册。这是它在 AI-Ready 维度上的核心优势。

6.1b 下载与校验实操

一次完整的获取流程:

  1. 下载:从 https://zenodo.org/records/8231412 下载 BUSBRA.zip(133.9 MB)。可直接用 Zenodo 提供的直链,或 wget/curl 拉取。
  2. 校验:以 md5 1f8b2be6476d58fc97bfb5e5a1ea9bab 校验下载完整性——这是可复现研究应有的标准动作,能排除传输损坏。
  3. 解压:解压后应见图像目录、掩膜目录与 CSV 元数据;先核对 CSV 行数与 1,875 是否吻合,作为"数据完整"的第一道自检。
  4. 版本固定:在项目里记录版本 DOI 10.5281/zenodo.8231412 与 md5,确保将来他人能拿到同一份数据。
  5. 引用:在任何发布物中附论文引用(DOI 10.1002/mp.16812)+ 数据 DOI + 许可 CC BY-4.0。

对 CI/管道环境,建议把 md5 写进下载脚本的断言里——一旦 Zenodo 侧文件变动(虽有版本 DOI 兜底),断言会立即暴露。

6.1c 与代码仓库的配合

github.com/wgomezf/BUS-BRA 提供 Segmentation 与 Classification 两套 Matlab 框架。使用路径二选一:

  • 复现路线:装 Matlab 2022b,按 README 跑 5 折复现官方结果——好处是能与论文表格对齐,坏处是依赖商业软件。
  • 迁移路线:只用官方数据与划分协议,在 PyTorch 里自行实现 DeepLabV3+/ResNet——好处是生态友好、便于扩展,坏处是"官方实现细节"(预处理、超参、评估脚本)需自行推断。

两条路线的共同前提都是:先把 CSV 读进来、把患者标识用起来(§3.5)——否则会重复踩患者级泄漏的坑。

6.2 一手下载信息(三源核验)

项 值 来源
Zenodo 记录 https://zenodo.org/records/8231412 Zenodo API/页面
版本 DOI 10.5281/zenodo.8231412 Zenodo
概念 DOI(版本族父) 10.5281/zenodo.7730708 Zenodo(conceptrecid 7730708)
文件名 BUSBRA.zip Zenodo API files 列表
大小 133.9 MB(133,917,740 字节) Zenodo API
md5 1f8b2be6476d58fc97bfb5e5a1ea9bab Zenodo API checksum
首发日期 2023-03-13(publication_date) Zenodo
最后修改 2024-09-25(revision 5) Zenodo
是否最新版 is_last: true(单一 1.0 版) Zenodo API

下载用量(抓取时点 2026-09-30):Zenodo 记录显示 downloads 4,809(unique 3,473)、views 9,782(unique 8,749)、version_downloads 4,288——即约 4,800 次下载,属乳腺超声公开集里使用广泛的档位。

6.3 版本链

BUS-BRA 目前只有单一 1.0 版本,但存在"概念 DOI / 版本 DOI"两层:

  • 概念 DOI(父,10.5281/zenodo.7730708):指向该数据集的最新版本;未来若发新版,父 DOI 会自动指向新版,适合在"总是想要最新版"的场景引用。
  • 版本 DOI(10.5281/zenodo.8231412):锁定 version 1.0,适合在可复现研究里引用(保证永远拿到同一份数据)。

引用规范上:引用具体数据用版本 DOI,声明版本族用概念 DOI。由于目前只有 1.0,两者实际指向同一份数据,但为将来计,工程里建议记录版本 DOI(可复现优先)。

6.4 许可条款:CC BY-4.0 的边界

许可:CC BY-4.0(Creative Commons Attribution 4.0 International)——Creative Commons 家族里最宽松的一档:

允许 说明
再分发 可自由复制、分发数据
修改 可基于数据做衍生(重新标注、裁剪、增强)
商用 可用于商业产品与商业模型训练
唯一义务 署名(Attribution):标注来源与许可

使用条件(作者附加):任何源自 BUS-BRA 使用的研究必须引用 Medical Physics 2024 论文(DOI 10.1002/mp.16812)。这不是 CC BY-4.0 协议本身的要求,而是作者的学术规范请求,但在实践上是硬约束——用它就必须引。

许可冲突存照(坑 4):第三方聚合站 SonoDQS(ultrasound-open-access.nidusai.ca)把 BUS-BRA 标为 GPL-3.0,与 Zenodo 官方 CC BY-4.0 冲突。以官方 Zenodo 记录为准(CC BY-4.0)。GPL-3.0 是软件许可、且含传染性 copyleft,若误按此理解数据许可,会把本可自由商用的数据误当受限——务必以 Zenodo 页面徽标与 API 字段为准。

6.4b 许可对比:为什么 CC BY-4.0 是"最好用"的一档

把常见的数据许可放一起对比,能看清 CC BY-4.0 的位置:

许可 商用 修改 再分发 主要限制 对 AI 训练的影响
CC BY-4.0(本集) ✅ ✅ ✅ 署名 最自由,可闭源/商用
CC BY-SA ✅ ✅ ✅ 署名 + 相同方式共享 衍生数据须同许可,有传染
CC BY-NC ❌ ✅ ✅ 禁商用 不能用于商业模型
CC BY-NC-SA ❌ ✅ ✅ 禁商用 + 同许可 最受限的 CC 之一
研究专用 / upon request 视协议 视协议 视协议 需申请 门槛最高
无明确许可 ? ? ? 默认保留一切权利 法律风险最高

BUS-BRA 落在表格第一行:允许商用、允许修改、允许再分发,唯一义务是署名。对需要训练商业模型(或闭源产品)的团队,这是最省心的许可档位之一;相比库内常见的"研究专用/CC BY-NC"数据集,BUS-BRA 的可商用属性是其 AI-Ready 得分的加分项。务必注意的是:“许可宽松"不等于"无需顾虑”——医学数据的合规(§1 Q13)与伦理(§1 Q14)是许可之外的独立约束。

6.5 AI-Ready 评估(DAIMS 检查)

以库内 AI-Ready 检查单(DAIMS 维度)过一遍 BUS-BRA:

DAIMS 维度 评估 依据
Data Availability(可获取性) 优 Zenodo 单链直下,无门禁、无注册,133.9 MB 轻量
Annotation Quality(标注质量) 良 三标注齐备且含活检金标准;但单标注者、二值掩膜、无一致性报告
Integrity(完整性与一致性) 中 官方折存在患者级泄漏(§4);良恶性双口径易混引(坑 1)
Metadata(元数据) 良 CSV 逐图字段清晰(BI-RADS/病理/组织学/患者标识),支持患者级操作
Standardization(标准化与可比性) 中偏优 有官方 5/10 折提升可比性,但划分缺陷削弱其效力

综合:AI-Ready 等级"中偏上"——可获取性、元数据、任务覆盖面高于同域均值;主要失分项是划分完整性与单标注者的质量不确定性。相对库内"请求制"条目(如 panda-plus 的掩码),BUS-BRA 的可获取性档位明显更友好。

6.6 可获取性光谱上的位置

档位 库内参照 本条目对应
注册墙(最严) 部分挑战赛数据集 —
请求制 panda-plus 掩码本体 —
Registry 收录 AWS Registry 型 —
平台托管直链 Zenodo 型 BUS-BRA(Zenodo,CC BY-4.0)
公开直链 HF/Zenodo 直链型 BUS-BRA(同)

BUS-BRA 落在"平台托管 + 公开直链"最宽松的两档:Zenodo 提供持久 DOI、版本管理、checksum(md5)与访问统计,CC BY-4.0 提供法律确定性。对需要"今天就能下、明天就能训、后天能商用"的研究与工程,这是最理想的一档。

§7 评估与基准

7.1 官方评估框架与指标

官方(论文)以 DeepLabV3+(ResNet18/50 骨干) 做语义分割、以对应特征做分类,在 5 折交叉验证下报告结果,实现依赖 Matlab 2022b。常报指标:分割用 Dice 系数(DSC)与交并比(IoU),分类用准确率/敏感度/特异度/AUC 等。

一处必须声明的局限:论文的官方具体指标数值未能从公开摘要逐表取得(Wiley 全文订阅墙)。因此本条目引用第三方复现值时明确标注为第三方口径;需要官方精确值时,应以论文正文表格为准(遗留疑点,§9)。

7.1b 分割与分类指标该怎么读

三个容易误读的指标细节:

  1. Dice(DSC)与 IoU 的关系:Dice = 2·|A∩B| / (|A|+|B|),IoU = |A∩B| / |A∪B|,二者单调相关但不等价(同一预测 Dice 约为 IoU 的换算上限更高)。报告时同一类指标内比较,不要拿 Dice 和 IoU 互比。BUS-BRA 上 Dice 82%–90% 对应 IoU 约 73%–83%,与公式关系一致。
  2. 小病灶放大误差:Dice/IoU 对病灶大小敏感——小结节的几个像素边界误差就能显著拉低分数。因此同一模型在不同数据集上的 Dice 不能直接比,除非病灶尺度分布相近。
  3. 分类须报敏感度:在恶性约 32% 的不平衡下,总体准确率会被良性主导(全预测良性即可~68%)。医学场景更关心**恶性召回(敏感度)**与 AUC,报告时应包含这些而非只有 accuracy。

7.2 第三方复现基线(用于标定位置)

以下均为基于 BUS-BRA 的第三方工作,用于说明"当前分数区间",非官方值:

工作 任务 BUS-BRA 上表现
Frontiers in Oncology 2025(doi:10.3389/fonc.2025.1672274) 分割 U-Net:Dice 82.10% / IoU 73.52%;DeepLabV3+:86.43% / 77.98%;SAM-VMamba 最高 90.25% / 82.54%
MDPI CMT-BUSNet(Diagnostics 16(8):1203) 分割 BUS-BRA 内训、BUSI 外验,报 DSC/IoU/HD95/Boundary IoU 逐折均值
D-DDPM(扩散模型,2025) 生成/分割 以 BUS-BRA 为训练集(尺寸大、样本多样),UDIAT 与 BrEaST 做外部验证
BoostCNN(UMB 2026) 分类 BUS-BRA 训练,BUSI/BrEaST 外部验证
联邦学习(arXiv:2506.23334v2) 良恶性二分类 BUS-BRA + BUSI + UDIAT 三集联邦;BUS-BRA 取 1,268 良 / 607 恶

区间观察:分割 Dice 大致落在 82%–90%(U-Net 到 SAM-VMamba),这个区间对"二值病灶分割"是合理的高分区间——但也必须叠加 §4.4 的告诫:这些数字若在图像级划分下取得,带有泄漏水分;严格患者级划分下的可比基线应参考 PerceptGuide 修正后的 73.99%(分割)/ 77.10%(分类)。

7.3 修正前后的基准对照(本条目最重要的一组数字)

协议 分割 分类 来源
官方折(图像级互斥) 88.27% 86.92% PerceptGuide 复现(修正前)
患者级互斥(修正后) 73.99% 77.10% PerceptGuide v1.0.1
差(水分) −14.28 −9.82 —

这组对照是 BUS-BRA 上一切指标引用前必须过的一道闸:报告某篇 BUS-BRA 论文的分数时,先问它的划分是图像级还是患者级。同一模型、同一数据,协议不同,分数可以差十几个点。

7.4 BUS-BRA 在跨数据集评测中的角色

第三方论文的常见范式是"BUS-BRA 训练 + BUSI/UDIAT/BrEaST 外部验证":BUS-BRA 因规模大、标注全、含标准折而被选为训练集;BUSI(埃及,780 图)、UDIAT(西班牙,163 图)、BrEaST(波兰,256 图)因来源独立而被选为外部验证集。这个范式的意义在于检验跨中心/跨设备泛化——而 BUS-BRA 自身 4 台扫描仪的多样性,也让"内部跨设备"与"外部跨中心"构成两层泛化测试。

7.5 与其他乳腺超声数据集的基准对照表

数据集 图数 论文/年份 常被用作 与本集关系
BUS-BRA 1,875 Med Phys 2024 主训练集 / 评测台 本条目
BUSI 780 2018 外部验证 同模态、更小、无 BI-RADS
UDIAT 163 2012 外部验证 同模态、最小
BrEaST 256 2019 外部验证 同模态、三标注但小
BUS-UCLM — 西班牙 UCLM 外部验证 同模态

一句话:在乳腺超声公开集里,BUS-BRA 是当前"规模 + 标注完整度"的标杆,第三方频繁称其为"最大的、同时提供分割掩膜+病理+BI-RADS 三标注的公开乳腺超声集"。它的基准价值不在"分数最高",而在"评测口径最全、最可比"。

7.6 建议的评测协议(面向复现者)

综合 §4 与本节,给出一套"可在论文里直接写"的 BUS-BRA 评测协议:

  1. 数据准备:下载 BUSBRA.zip,md5 校验,读 CSV,确认 1,875 行,建立 patient_id 索引。
  2. 划分:以 patient_id 为 group、pathology 为 stratify,做 10 折 StratifiedGroupKFold;落盘折索引;加载层断言患者级互斥。
  3. 内部评测:在患者级 10 折上报告 Dice/IoU(分割)与 敏感度/特异度/AUC(分类)的均值±标准差。
  4. 外部验证:在 BUSI(780 图)与 UDIAT(163 图)上零样本评估,报告外部指标;如需,注明 BrEaST(256 图)。
  5. 对照报告:若要与历史文献比,附加"官方折下的结果"一栏,并在表注写明两者划分差异——把水分显式暴露。
  6. 可复现交付:随论文发布折索引、预处理脚本与随机种子。

六步中第 2、5 步是 BUS-BRA 特有的必做项(源于其官方折的缺陷);其余为通用最佳实践。照此协议产出的数字,可与 PerceptGuide 的 73.99%/77.10% 直接对标,也经得起"划分是否患者级"的追问。

7.7 指标报告的常见伪影

三点会让 BUS-BRA 上的报告"看起来更好但不可比":

  • 只报最优折:把 5/10 折里最好的一折当结果,忽略方差。应报均值±标准差。
  • 只用 image-level accuracy:类不平衡下被良性主导。应补敏感度/AUC。
  • 不区分内外部:把 BUS-BRA 内部指标与外部验证指标混在一张表里而不标注,读者无法判断泛化性。

把这三点写进论文的"评测规范"段,是 BUS-BRA 用户的基本素养。

7.8 与库内评测基准类条目的对照

BUS-BRA 在"评测基准"这一维度上,与库内其他基准类条目的共性与差异:

条目 基准形态 独特之处 与 BUS-BRA 的共性
BUS-BRA 三标注 + 官方标准折 划分泄漏的实证对象 —
busi(539) 三分类 + 掩膜 含"正常"类别 乳腺超声、可做外部验证
brset(351) 超声分割 同模态分割 超声 + 像素级标注
cbis-ddsm(541) 钼靶分类/检测 跨模态大字集 乳腺、公开、可直链

共性在于"公开 + 标注 + 可评测",差异在于 BUS-BRA 是其中唯一自带标准折、且标准折被审计出问题的条目。这让它在库内的角色有些特殊:既是被用的基准,也是被研究的方法学案例。

§8 生态与影响

8.1 出处谱系与作者群

BUS-BRA 的产出横跨巴西与墨西哥两个机构:

角色 姓名 机构 ORCID
通讯 / 一作 Wilfrido Gómez-Flores Cinvestav(墨西哥,IPN)Tamaulipas 0000-0001-6758-6155
作者 Maria Julia Gregorio-Calas Universidade Estácio de Sá(巴西里约) —
作者 Wagner Coelho de Albuquerque Pereira PEB/COPPE, UFRJ(巴西里约) 0000-0001-5880-3242

版权方/首席分发方是 PEB/COPPE-UFRJ(里约联邦大学生物医学工程计划),采集执行方是 INCA(巴西国家癌症研究所),Cinvestav 负责数据集与代码的持续开发。作者声明无利益冲突,未见专项资助声明。

8.2 生态位置:被谁用、怎么用

BUS-BRA 在发布后(2023-2024)迅速成为乳腺超声 CAD 论文的常用底座,第三方使用形态大致四类:

  1. 分割方法对比(Frontiers 2025 等):把 U-Net、DeepLabV3+、Transformer/Mamba 类模型放在 BUS-BRA 上比 Dice/IoU。
  2. 分类/联邦学习(arXiv:2506.23334v2 等):以 BUS-BRA 为主训练集,BUSI/UDIAT 为参与方,研究跨中心联邦。
  3. 生成式增强(D-DDPM 等):用扩散模型在 BUS-BRA 上做数据增强或生成,拿 UDIAT/BrEaST 做外部验证。
  4. 划分方法学(PerceptGuide、MDPI YOLO 等):把 BUS-BRA 当作"划分泄漏"的实证对象与修复范例。

第 4 类是本数据集最有意思的"意外用途":一个数据集的价值不止于被训练,还在于被审计。BUS-BRA 因规模足够大、又自带"图像级 vs 患者级"的可比划分,成了划分方法学研究的天然实验台。

8.2b 一个数据集的三层使用价值

把 BUS-BRA 的用途拆成三层,能看清它为何在发布后扩散得较快:

层 使用者要什么 BUS-BRA 提供 典型工作
数据层 图 + 标签 1,875 图 + 三标注,直链 各类分割/分类论文
协议层 可比的划分 官方 5/10 折索引 需对齐文献的数字
方法层 可审计的对象 患者标识 + 已知泄漏 划分方法学、泄漏研究

多数数据集只到"数据层";BUS-BRA 因同时给了协议(标准折)与患者标识(可重划),把"协议层"与"方法层"也占了。这解释了为什么它既被当训练集,又被当方法学靶子——它在生态里的位置比"又一份超声数据"要复杂。

8.3 对乳腺超声 AI 生态的三点影响

  • 抬高评测门槛:BUS-BRA 把"三标注 + 标准折"做成默认期待,后续数据集若只给良恶性标签会显得不够。
  • 暴露普遍隐患:它的患者级泄漏并非孤例——许多医学数据集都有同类问题,BUS-BRA 的审计推动社区开始例行检查划分的患者级互斥。
  • 提供修复范式:StratifiedGroupKFold + 断言的患者级重划流程,已被后续论文采纳为模板。

8.4 局限与未来方向

局限 现状 可能的改进方向
单标注者 一人完成掩膜 + BI-RADS 多专家标注并报告一致性
患者级泄漏 官方折仅图像级互斥 发布修订版患者级划分索引
二值掩膜 不含类别 增加多类掩膜
组织学不完整 仅公开 Top-10 补全 28 类全表
类不平衡 恶性约 32%、BI-RADS 5 仅 8.4% 提供分层采样/重加权参考

这些局限多属"可修复的工程问题",不涉及数据的根本缺陷。

8.5 引用它的论文都在做什么

从抓取到的第三方工作看,BUS-BRA 主要出现在四类研究的 Method 段:

  • 分割论文:把 BUS-BRA 作为"带像素级真值的超声分割基准",与新方法(Transformer/Mamba/扩散)对比。
  • 分类论文:作为"规模足够大、带 BI-RADS 的超声分类训练集",常配 BUSI 外部验证。
  • 联邦/跨中心论文:作为多中心联邦学习的一方(BUS-BRA + BUSI + UDIAT)。
  • 方法学论文:作为划分泄漏与修复的实证对象(PerceptGuide、MDPI YOLO)。

这四类合起来说明:BUS-BRA 的引用动机已从"我要数据"扩展到"我要一个可信的评测场景"——后者正是它标题里"for Assessing"的兑现。

8.6 与乳腺病理/钼靶数据集的互补关系

乳腺 AI 的完整版图横跨三种模态,BUS-BRA 是"超声"这一格的支柱:

模态 代表数据集(库内) 与 BUS-BRA 的互补
超声(US) BUS-BRA、busi(539)、brset(351) 本集所在格
钼靶(Mammography) cbis-ddsm(541)、inbreast(542)、vindr-mammo(543) 不同模态、同解剖
MRI duke-breast-mri(440) 不同模态
病理(Pathology) breakhis(126)、bach(118)、breastpathq(268)、bcss(258) 从影像到显微的终检环节

一个典型的多模态研究叙事是"超声筛查发现可疑 → 钼靶/MRI 进一步评估 → 病理确诊",BUS-BRA 落在这个链条的第一环(筛查),与库内病理类条目构成"从筛查到确诊"的对照谱系。这也是 §9.4 互链表的用意:让读者能从 BUS-BRA 出发,横向走到同模态(busi/brset)与跨模态(钼靶/病理)的相邻条目。

8.7 时间线

时间 事件
2023-01/02 概念 DOI(10.5281/zenodo.7730708)出现,数据集处于未发布态
2023-03-13 Zenodo version 1.0 正式发布(10.5281/zenodo.8231412)
2023-03-14 GitHub 代码仓库(wgomezf/BUS-BRA)初始提交
2023-08-09 代码压缩包上传;Zenodo 记录创建
2023-11-08 Medical Physics 论文在线先行(Early View)
2024-04 论文正刊刊出(vol.51(4):3110-3123)
2024-07-30 GitHub README 更新
2024-09-25 Zenodo 记录最后修改(revision 5)
2025–2026 第三方大规模采用与划分审计(PerceptGuide 等)

时间线显示:数据先于论文(2023-03 vs 2023-11),这在数据集型工作中属常见节奏——先把数据放出去,再用论文描述它。也正因数据先行,早期使用者可能基于"未配论文"的版本工作,引用时更需核对版本 DOI。

§9 与库内条目的关系

9.1 家族图谱(乳腺与超声两条线)

乳腺影像线:

  • busi(rid 539):最直接对照——同模态乳腺超声、780 图、无 BI-RADS、无标准折。BUS-BRA 可视为"带 BI-RADS 与标准折、规模翻倍"的升级型;两者是并列数据集,非别名、非版本(坑 2 的核心)。
  • cbis-ddsm(rid 541)、inbreast(rid 542)、vindr-mammo(rid 543)、swiss-mammo(rid 627)、tn-mammo-breast-density(rid 628):乳腺**钼靶(mammography)**家族——不同模态(X 线 vs 超声)的对照。
  • duke-breast-mri(rid 440):乳腺 MRI——不同模态对照。
  • breastpathq(rid 268)、breakhis(rid 126)、bach(rid 118)、bcss(rid 258):乳腺病理家族——从影像到显微的跨尺度对照。
  • brset(rid 351):乳腺超声分割——最接近的同模态近亲。

超声模态线:

  • us-nerve-seg(rid 537):超声神经分割——同成像模态(超声)、不同解剖域,可用于讨论超声域的通用性质。
  • mass(rid 272):乳腺相关影像集合。

9.1b 与其他乳腺超声数据集的细分对照

把 BUS-BRA 放进乳腺超声(BUS)这个子域,与三个常被一起提及的集对照:

维度 BUS-BRA BUSI UDIAT BrEaST
国家/机构 巴西 INCA 埃及 Baheya 西班牙 Parc Taulí 波兰
年份 2023 2018 2012 2019
图像数 1,875 780 163 256
患者数 1,064 600 — —
类别体系 良/恶 + BI-RADS 2–5 正常/良性/恶性 良/恶 良/恶 + BI-RADS
分割掩膜 二值 三分类标注 有无病灶 有
官方标准折 有(5/10 折) 无 无 无
许可 CC BY-4.0 见来源 见来源 见来源
常被用作 主训练集 外部验证 外部验证 外部验证

读法:BUS-BRA 在"规模 + 标注维度 + 标准折 + 许可"四项上都占优,唯一不占优的是"正常"类别(BUSI 有、BUS-BRA 无——因为它只收含病灶的图,§2.7)。这解释了为何跨数据集实验普遍以 BUS-BRA 为训练轴心。

9.2 检索路径建议

  • 精确检索词:“BUS-BRA”(连字符)+ “breast ultrasound” + “BI-RADS”;勿把它与 “BUSI” 混检(坑 2)。
  • 目标为直接可用数据:Zenodo records/8231412 → BUSBRA.zip(CC BY-4.0)→ 代码 github.com/wgomezf/BUS-BRA。
  • 目标为可信评测:先读 §4 划分泄漏 → 自建患者级折 → 与 PerceptGuide 修正值(73.99%/77.10%)对标 → 再引用文献分数并标注协议。
  • 目标为跨数据集泛化:BUS-BRA 训练 + BUSI/UDIAT/BrEaST 外部验证。

9.3 引用规范

引用 BUS-BRA 数据须同时引:Gómez-Flores W, Gregorio-Calas MJ, Coelho de Albuquerque Pereira W. “BUS-BRA: A breast ultrasound dataset for assessing computer-aided diagnosis systems.” Medical Physics, 2024;51(4):3110-3123. DOI 10.1002/mp.16812,并注明数据 DOI 10.5281/zenodo.8231412 与许可 CC BY-4.0。

9.4 库内互链速查

库内条目 rid 与 BUS-BRA 的关系 建议互链理由
busi 539 同模态乳腺超声(仅 780 图、无 BI-RADS) 首选互链,需明写区别
brset 351 同模态乳腺超声分割 同任务近亲
cbis-ddsm 541 乳腺钼靶 跨模态对照
inbreast 542 乳腺钼靶数字库 跨模态对照
vindr-mammo 543 乳腺钼靶(越南) 跨模态对照
swiss-mammo 627 乳腺钼靶 跨模态对照
tn-mammo-breast-density 628 乳腺钼靶密度 跨模态对照
duke-breast-mri 440 乳腺 MRI 跨模态对照
breastpathq 268 乳腺病理 WSI 跨尺度对照
breakhis 126 乳腺病理显微 跨尺度对照
bach 118 乳腺病理显微 跨尺度对照
bcss 258 乳腺细胞分割 跨尺度对照
us-nerve-seg 537 超声神经分割 同模态不同域
mass 272 乳腺影像集合 同域

互链策略:busi(539)与 brset(351)为强链(同模态、同任务,读者最可能横向比较);其余乳腺影像与病理条目为弱链(跨模态/跨尺度背景)。所有 rid 均以 DB url_name 反查核验,未使用位置对齐。

9.5 互链一句话理由

目标条目 rid 一句话理由
busi 539 “同是乳腺超声,BUS-BRA 是它的带 BI-RADS 放大版”
brset 351 “同做乳腺超声分割,可对比掩膜风格”
cbis-ddsm 541 “同是乳腺公开集,钼靶 vs 超声”
inbreast 542 “钼靶数字库,跨模态参照”
breastpathq 268 “从超声筛查到病理确诊的下游环节”

§10 避坑清单:十个已踩过的坑

坑 1:良恶性计数有病例级 / 图级两套口径,混引即错。论文摘要与 Zenodo 的"722 良性 / 342 恶性"是病例(肿瘤)级(合计 1,064);第三方重算的"1,268 良性 / 607 恶性"是图像级(合计 1,875)。二者不矛盾但层级不同——用错口径会导致占比、类权重、基线全线偏移。引用时必须写明是病例级还是图级。

坑 2:“BUS-BRA” ≠ “BUSI”,不是别名也不是版本。BUSI 是埃及 Baheya 医院 2018 年的 600 患者 / 780 图数据集,无 BI-RADS、无标准折;BUS-BRA 是巴西 INCA 的 1,064 患者 / 1,875 图数据集,含 BI-RADS 与 5/10 折。检索与引用务必区分,切忌互相张冠李戴(本库已有 busi 条目 rid 539,两者应为互链而非合并)。

坑 3:BI-RADS 逐类计数与组织学 Top-10 均出自第三方,非官方。562/463/693/157 这组 BI-RADS 分布与 Top-10 组织学表都来自第三方论文(BUSTR、Brunel),BUS-BRA 官方文档只说"categories 2, 3, 4, and 5",未给逐类表;28 类组织学也仅公开 Top-10。引用时标注口径来源,勿写成"官方数字"。

坑 4:许可冲突——以 Zenodo 官方 CC BY-4.0 为准。第三方聚合站 SonoDQS 把 BUS-BRA 标为 GPL-3.0(软件许可、含传染性 copyleft),与 Zenodo 官方的 CC BY-4.0 冲突。误按 GPL 理解会错判"能否商用/能否闭源衍生"。一律以 Zenodo 记录页徽标与 API license.id = cc-by-4.0 为准。

坑 5:官方标准折不是患者级互斥——存在数据泄漏。官方折只保证图像级互斥;同患者多图可跨折。这是本条目最需要广而告之的坑:直接引用 BUS-BRA 上的高分(如 88%+ 分割)前,先确认划分协议;严格患者级下可比基线会低十几个点(73.99% / 77.10%)。

坑 6:原图含设备叠加伪影,预处理要截断。B 模式原图带厂商叠加的文字、标尺、增益条等,第三方预处理常以 1/99 百分位强度截断抑制,避免模型学到这些"非解剖"线索。直接用原图训练而不处理,可能让模型过拟合到设备指纹。

坑 7:单标注者、无观察者间一致性报告。掩膜与 BI-RADS 均出自一人,没有多专家对照,因此标签可靠性带个体偏差、无法量化解剖层面的不确定性。报告指标时说明这一上限,不要把 BUS-BRA 的真值当作"生物学only真值"。

坑 8:掩膜是二值的,类别信息不在掩膜里。掩膜只区分肿瘤/正常,做多类分割必须从 CSV 元数据取病理/组织学,且只能在病灶级近似关联。误把掩膜当多类掩膜会得到错误的分割监督。

坑 9:论文在线年与卷期年双口径。论文 2023-11-08 在线先行(Early View),卷期归属 2024(vol.51(4):3110-3123)。第三方引用有写 2023 的、有写 2024 的——本条目统一按正刊 2024,并注明在线 2023-11。

坑 10:实现语言是 Matlab,别假设有官方 PyTorch 代码。官方框架为 Matlab 2022b(DeepLabV3+)。Python 使用者需自行复现或搭管线;官方给的是数据与协议,不是即插即用的 Python 训练脚本。

10.1 使用前自检单

把上面前十个坑压缩成一份开工前检查单:

# 检查项 通过标准
1 良恶性数字口径 明写"病例级"或"图像级"
2 数据集身份 确认是 BUS-BRA 而非 BUSI
3 BI-RADS/组织学来源 标注"第三方口径"
4 许可 以 Zenodo 的 CC BY-4.0 为准
5 划分协议 患者级互斥 + 断言
6 伪影处理 已做强度截断
7 标注者局限 报告中说明单标注者
8 掩膜类型 二值;类别从 CSV 取
9 论文年份 统一为 2024(正刊)
10 代码语言 预期 Matlab,非 PyTorch

十项全过,才能说"这份 BUS-BRA 结果可提交/可对比"。

10.2 坑点的三组归类

十个坑可归为三组,便于记忆与排查:

组别 涉及坑 本质 防范动作
口径类 坑 1、坑 3、坑 9 同一事实有多个层面的数字/年份 引用时写明层级与来源
身份类 坑 2、坑 4 数据集身份或许可被误认 以官方 Zenodo 为准核对
协议类 坑 5、坑 6、坑 7、坑 8、坑 10 划分/预处理/标注/代码的实践陷阱 患者级划分 + 标准化预处理

三组中协议类最危险——它会直接改变模型指标,且往往在使用者毫无察觉时发生(因为代码能跑通、数字也"好看")。口径类与身份类则主要影响文献可比性与合规性。按这个分组做自查,比逐条记忆十个坑更高效。

§11 总结

BUS-BRA 把乳腺超声 CAD 评测里长期分散的四件东西——活检证实的病理、专家的 BI-RADS 分级、手工的分割掩膜、官方的标准折——一次性绑到同一批 1,875 张图上,并以 CC BY-4.0 + Zenodo 单链的方式零门槛公开。它因此成为当前乳腺超声公开集里"规模最大、标注最全、最易获取"的标杆,也是第三方跨中心研究首选的主训练集。

但它同时是一面镜子:它引以为傲的标准折被第三方审计出只做到图像级互斥、未做到患者级互斥,构成数据泄漏;修正为患者级后,分割指标从 88.27% 跌到 73.99%、分类从 86.92% 跌到 77.10%。这十几点的落差,比任何论文的增长曲线都更值得记住——它提醒每一位使用者:先问划分,再看分数。

对使用者的三条落地建议:

  1. 数据获取零障碍:Zenodo records/8231412 直下 BUSBRA.zip,署名 + 引用论文即可用,含商用。
  2. 评测必须患者级:不要默认官方折安全;用患者标识做 StratifiedGroupKFold 并加断言,与修正基线(73.99% / 77.10%)对标。
  3. 口径必须标明:良恶性写清病例级还是图级,BI-RADS/组织学标注第三方来源,许可一律以 Zenodo 为准。

BUS-BRA 的价值不在于它"分数最高",而在于它把可获取性、标注完整度与评测诚实度三件事同时摆上台面——包括它自身划分协议的那道疤。一个愿意被审计、也经得起被审计的数据集,才是真正"AI-Ready"的数据集。

§12 附录:数据字典、术语与来源

12.1 术语表(首现英文对照)

缩略/术语 英文全称 中文释义
BUS Breast UltraSound 乳腺超声
BRA Brazil 巴西(数据集命名来源)
CAD Computer-Aided Diagnosis 计算机辅助诊断
BI-RADS Breast Imaging-Reporting and Data System 乳腺影像报告与数据系统
B-mode Brightness mode B 模式(灰阶)超声
ROI Region of Interest 感兴趣区(病灶区域)
DSC/Dice Dice Similarity Coefficient Dice 相似系数
IoU Intersection over Union 交并比
HD95 95th percentile Hausdorff Distance 95 分位豪斯多夫距离
IDC Invasive Ductal Carcinoma 浸润性导管癌
ILC Invasive Lobular Carcinoma 浸润性小叶癌
WSI Whole Slide Image 全切片图像(乳腺病理对照,非本集)
INCA Instituto Nacional de Câncer 巴西国家癌症研究所
PEB Programa de Engenharia Biomédica 生物医学工程计划
COPPE — UFRJ 研究生院与研究中心(工程)
UFRJ Universidade Federal do Rio de Janeiro 里约热内卢联邦大学
Cinvestav Centro de Investigación y de Estudios Avanzados del IPN 墨西哥国立理工学院高级研究中心
ACR American College of Radiology 美国放射学会(BI-RADS 制定方)

12.2 数据字典(CSV 主要字段)

字段(示意名) 类型 含义 取值/说明
image_id 字符串 图像唯一标识 关联 PNG 图与掩膜
patient_id 字符串 患者标识 划分分组键(§4.7)
pathology 类别 病理结果 benign / malignant
birads 序数 BI-RADS 分级 2 / 3 / 4 / 5
histology 类别 组织学类型 28 类之一
label/mask 路径 掩膜文件引用 二值 PNG

说明:字段名以数据集实际 CSV 为准,上表为语义整理(第三方论文中沿用的字段含义)。核心是 patient_id 必须被使用——它是患者级划分的全部依据。

12.3 复现记录(本条目核验过程)

步骤 动作 结果
存在性核验 Zenodo API 抓取 records/8231412 存在,CC BY-4.0,BUSBRA.zip 133.9MB
论文核验 Medical Physics 2024 / ADS 摘要 存在,DOI 10.1002/mp.16812
代码核验 github.com/wgomezf/BUS-BRA 存在,Matlab 框架
数字三源互证 Zenodo/GitHub/论文 1,064/1,875/722/342 逐字一致
图级数字核验 第三方(BUSTR/Brunel 等) 1,268/607、BI-RADS 逐类、组织学 Top-10
泄漏核验 PerceptGuide v1.0.1 发布说明 修正 88.27→73.99、86.92→77.10
查重 DB url_name ILIKE ‘%bus%’ 仅命中 busi(539);无 bus-bra
库内互链 DB url_name 反查 rid busi 539 / brset 351 等(§9.4)

12.4 来源清单(URL)

  • 一手:https://zenodo.org/records/8231412;https://zenodo.org/api/records/8231412;https://doi.org/10.1002/mp.16812;https://github.com/wgomezf/BUS-BRA。
  • 论文摘要复本:ADS https://ui.adsabs.harvard.edu/abs/2024MedPh..51.3110G/abstract;Wiley https://onlinelibrary.wiley.com/doi/full/10.1002/mp.16812。
  • 第三方(图级数字 / BI-RADS / 组织学 / 划分审计):arXiv:2506.23334v2;arXiv:2511.20956(BUSTR);UMB BoostCNN;https://doi.org/10.3389/fonc.2025.1672274(Frontiers);MDPI CMT-BUSNet(Diagnostics 16(8):1203);MDPI YOLO(2813-477X/4/3/28);Brunel 全文 PDF;PerceptGuide v1.0.1 发布说明。
  • 许可冲突存照:https://ultrasound-open-access.nidusai.ca/(SonoDQS,标 GPL-3.0)。

12.5 待核与遗留疑点

# 疑点 现状 处理
1 官方分割/分类精确指标 Wiley 订阅墙,摘要未给逐表 引第三方并标注
2 "722/342"为病例级还是肿瘤级 摘要未明确 按"活检肿瘤病例"字面处理
3 725/345 患者口径(BoostCNN)与 1,064 不符 725+345=1,070≠1,064 存照,疑为另一算法
4 官方逐折患者/图计数 未公开 存照
5 图像尺寸统一值 “随图而异” 需下载实测
6 组织学余 18 类 仅 Top-10 公开 存照
7 原图伪影种类与比例 仅知需截断 存照

以上疑点不影响主线结论,但属"引用时需注明"的边界。BUS-BRA 是一份高质量、可直链、标注齐全的数据集;使用者只要把**口径(病例级/图级)、协议(患者级划分)、许可(CC BY-4.0)**三件事记牢,就能安全、可复现地使用它。

12.6 一句话记忆卡

给需要快速回忆的读者:

BUS-BRA = 巴西 1,064 患者 / 1,875 张乳腺超声 + 病理 + BI-RADS 2–5 + 分割掩膜 + 5/10 折,Zenodo 单链 CC BY-4.0;用之前先做患者级划分——官方折有泄漏。

四要素:规模(1,875)· 三标注(病理/BI-RADS/掩膜)· 官方折(有但需修正)· 许可(CC BY-4.0)。

12.7 本条目编制说明

  • 本条目依据千方病案医数集 AI-Ready Wikipedia 规范编制,事实以三源互证为准:Zenodo 官方记录(一手)、Medical Physics 2024 论文(摘要复本)、GitHub 仓库,辅以多篇第三方论文作为图级数字与审计证据来源。
  • 所有与官方口径存在出入之处(良恶性计数、BI-RADS 逐类、许可冲突、划分泄漏)均已逐条存照并在正文标注来源层级。
  • 正文以中文为主,术语首现标英文;URL 占位统一为 https://www.qianfanghub.com/ai-ready-dataset/bus-bra/760。
  • 条目不代表对数据集的推荐或背书,仅为面向 AI 就绪度的信息整理。

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • busi — 共享标签:医学影像 / 乳腺影像 / 医学图像分割 / 图像分类 / 乳腺癌
  • inbreast — 共享标签:医学影像 / 乳腺影像 / 医学图像分割 / 图像分类 / 乳腺癌
  • udiat — 共享标签:医学影像 / 乳腺影像 / 医学图像分割 / 图像分类 / 乳腺癌
  • oasbud — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 评测基准
  • cbis-ddsm — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
  • cmmd — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
  • hyperkvasir — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 评测基准
  • bach — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
  • panda-plus — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 评测基准
  • odelia — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集