信息速览
INFOBOX — BUS-BRA 一屏速览
维度 内容 本质 巴西 INCA 采集的乳腺超声(BUS)公开数据集,同含病理+BI-RADS+掩膜三标注+官方标准折 全称 BUS-BRA: A Breast Ultrasound Dataset for Assessing Computer-aided Diagnosis Systems 命名 BUS(Breast UltraSound)+BRA(Brazil,巴西) 采集地 巴西里约热内卢国家癌症研究所(INCA, Rio de Janeiro) 版权/分发 PEB/COPPE-UFRJ(里约联邦大学生物医学工程计划)持版权并首席分发;Cinvestav(墨西哥)持续开发 论文 Medical Physics 2024, vol.51(4):3110-3123(DOI 10.1002/mp.16812;2023-11-08 在线先行) 首发 Zenodo 10.5281/zenodo.8231412,version 1.0,2023-03-13 规模 1,064 患者 / 1,875 张 B-mode 图(平均约 1.76 张/患者) 扫描仪 4 台:GE Logiq 5、GE Logiq 7、Toshiba Aplio 300、GE U-Systems 标注 活检病理(良/恶性)+BI-RADS 2/3/4/5+手工二值分割掩膜+组织学(28 类) 官方折 标准化 5 折与 10 折交叉验证划分(图像级互斥) 病灶级分布 病例级 722 良性/342 恶性(论文/Zenodo)|图级 1,268 良性/607 恶性(第三方重算) BI-RADS 分布 2:562|3:463|4:693|5:157(图级,第三方口径) 官方评估 DeepLabV3+ 语义分割(骨干 ResNet18/ResNet50)+ ResNet 分类,Matlab 2022b 关键风险 官方折非患者级互斥——第三方审计实证为数据泄漏,修正后指标大跌 许可 CC BY-4.0(Zenodo 官方;署名即可再分发/商用) 获取 Zenodo records/8231412直链下 BUSBRA.zip(133.9 MB,md5 1f8b2be6476d58fc97bfb5e5a1ea9bab)库内互链 busi(乳腺超声对照,rid 539)、cbis-ddsm(rid 541)、inbreast(rid 542)、brset(rid 351)等
BUS-BRA 是一份"把乳腺超声 CAD 评测所需的三样东西凑齐"的数据集:它不满足于只给图像和良恶性标签,而是同时提供了资深超声医师的 BI-RADS 分级、活检证实的病理结果与逐像素的病灶分割掩膜,再配上官方钦定的 5 折/10 折交叉验证划分——四件套合一,让"良性 vs 恶性"这一对老问题第一次能在统一的、可复现的评测台上被公平比较。它来自巴西里约热内卢国家癌症研究所(INCA)的临床超声室,1,064 名女性患者、1,875 张 B 模式图像,于 2023 年 3 月以 CC BY-4.0 的宽松许可托管在 Zenodo 上,配套论文发表于 Medical Physics 2024。
但 BUS-BRA 的故事里有一个必须单独拎出来的章节:它引以为傲的"官方标准折"经第三方审计被证实只做到图像级互斥、没做到患者级互斥——同一位患者的不同切面图可能同时出现在训练集和测试集里,构成典型的数据泄漏(data leakage)。当修正为严格的患者级划分后,报告过的分割与分类指标出现断崖式回落(分割 88.27%→73.99%)。这使 BUS-BRA 在"数据集可用性"之外,又成了一个研究"划分协议如何决定模型上限"的活教材。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——Zenodo 单链
BUSBRA.zip直接下,CC BY-4.0,无门禁;但要记住引用论文是使用条件。 - 关心评测可信度:直奔 §4 的划分与泄漏专节与 §7 基准——官方折的坑与第三方修正后的数字是最有价值的部分。
- 做分割/分类建模:直奔 §2 规格与 §5 任务标注——注意良恶性计数有病例级/图级两套口径(坑 1),别混引。
§0 导读:这个数据集解决什么问题
乳腺超声(breast ultrasound, BUS)是乳腺影像里最"易得"也最"难评"的模态。易得,是因为它无电离辐射、设备普及、可实时动态观察;难评,是因为超声图像天生高噪、斑点(speckle)弥漫、肿瘤边界模糊,且高度依赖操作者手法——同一病灶不同切面、不同机器、不同医师,图像长相可以差很远。这直接导致两个长期困扰 CAD(computer-aided diagnosis,计算机辅助诊断)研究的痛点:评测口径不统一与标签不完整。
口径不统一,体现在"良性 vs 恶性"二分类之外,临床真正用于决策的是 BI-RADS(Breast Imaging-Reporting and Data System,乳腺影像报告与数据系统)分级——从 2(良性)到 5(高度可疑恶性)。很多公开数据集只给良恶性,模型学不到 BI-RADS 的连续性判断;标签不完整,则体现在分割任务与分类任务往往落在不同数据上,一个数据集给掩膜、另一个给病理,无法在同一批图上同时评测"能不能把肿瘤圈准"和"能不能把类型判对"。
BUS-BRA 的回答是把这几件事绑到同一批图上:每张图同时有 (1) 活检证实的病理标签、(2) 资深超声医师的 BI-RADS 分级、(3) 手工勾画的分割掩膜,另外补上 (4) 组织学类型。再往上加一层"官方标准折"——把数据切成固定的 5 折和 10 折,让所有人在同一划分上训练与测试,结果才可比。这就是论文标题里 “for Assessing Computer-aided Diagnosis Systems”(用于评估计算机辅助诊断系统)的字面含义:它把自己定位成评测台,而不只是一堆图片。
0.1 乳腺超声 CAD 的三个老问题
要理解 BUS-BRA 的取舍,得先看清它想解决的三个具体问题:
- 标注稀疏:乳腺超声公开集里,给掩膜的往往不给病理、给病理的往往不给 BI-RADS、给 BI-RADS 的规模又很小。研究者在"我想同时评测分割和分级"时无集可用,只能拼凑,导致结果互不可比。
- 评测不可复现:没有统一划分,每篇论文自己切数据,"我 90%、你 88%“背后可能是不同的测试集,数字没有可比性。BUS-BRA 用官方标准折正面回应这一点——这恰是它标题里"Assessing”(评估)的落点。
- 规模与可获取性不足:多数早期 BUS 集只有百量级图像且需申请,深度模型容易过拟合、复现门槛高。BUS-BRA 一次给到 1,875 图并直链开放。
三个问题里,BUS-BRA 最用力解决的是第二个(评测),也因此最依赖"划分的正确性"——而后来的审计发现,恰恰是这一点出了患者级泄漏的问题(§4),构成它故事里最具反讽意味的一环。
0.1b 与本库其他条目的定位关系
放到千方病案医数集的语境里,BUS-BRA 填补的是"乳腺超声(BUS)评测基准"这一格:
- 库内乳腺影像条目多为钼靶(cbis-ddsm 541、inbreast 542、vindr-mammo 543)或病理(breakhis 126、bach 118、breastpathq 268),超声模态此前只有 busi(539)一个较弱代表(无 BI-RADS、无标准折、规模小)。
- BUS-BRA 进入后,与 busi(539)形成"乳腺超声双子座":一个担当训练/评测台(本集),一个常作外部验证;再与 brset(351)构成"超声分割"子群。
- 对做"乳腺 AI 全模态"研究的检索者,BUS-BRA 是超声环的关键补全——从钼靶到超声到病理,库内首次可以在同一坐标下摆齐三模态。
因此本条目的价值不只是"多了一个数据集",而是把库内乳腺影像的模态版图补完整(§9 详述互链)。
0.2 为什么是"超声":模态特性决定的建模难点
BUS-BRA 是超声数据集,这个模态选择决定了它的技术气质。超声图像的三个特性直接塑造了建模难点:
- 斑点噪声(speckle noise):相干成像的固有乘积噪声,表现为弥漫的颗粒纹理,会淹没低对比度的病灶边缘。这是超声与 CT/MRI 最大的视觉差异,也是为什么"去斑点滤波"被论文列为潜在应用。
- 操作者依赖(operator dependence):探头角度、压力、增益全由医师实时调整,同一病灶两次扫查的图可以明显不同。BUS-BRA 的多切面结构(同患者多图)正是这一特性的产物。
- 边界模糊(blurred margins):良恶性判别的关键征象之一是边缘形态(毛刺、成角、微分叶),但超声边界常不连续,使分割与分类都更难。
这三个特性叠在一起,解释了两件事:为什么 BUS-BRA 要把"分割掩膜"和"BI-RADS 分级"都给出来(单靠像素难判别,需要结构化的专家知识);也为什么"跨设备泛化"(4 台扫描仪)值得单列为一类应用。
§0 读法三则:
- 这个条目是"数据集 + 评测基准 + 划分方法学案例"三合一:本体是 1,875 张带三标注的超声图,评测价值来自官方标准折,方法学价值来自官方折被审计出的患者级泄漏(§4、§7)。
- 全文数字多为一手三源互证(Zenodo/论文/GitHub 文字近乎逐字一致);但良恶性计数存在病例级/图级两套口径(坑 1)、BI-RADS 逐类计数仅见第三方(坑 3),引用前务必对口径。
- 检索时"BUS-BRA"与"BUSI"是两个不同数据集,不是别名也不是版本:BUSI 在埃及、780 图、无 BI-RADS;BUS-BRA 在巴西、1,875 图、含 BI-RADS 与标准折(坑 2)。
§1 数据集速览:十问十答
Q1:BUS-BRA 的"1,064 患者 / 1,875 张"从哪来?
全部采集于巴西里约热内卢国家癌症研究所(INCA)的临床超声检查。1,064 名女性患者共 1,875 张 B 模式(B-mode)乳腺超声图,平均约 1.76 张/患者——部分患者提供了多个切面甚至双侧图像,这也是"患者数 ≠ 图像数"以及后文各种计数口径分歧的根源。
Q2:图像和标签分别是什么格式?
图像与掩膜均为 PNG;元数据为独立的 CSV 文件(逐图一行,含 BI-RADS、病理、组织学、患者标识等字段)。图像尺寸随图而异(论文原文 dimensions vary),未做统一裁剪或缩放——这意味着直接入模前通常需要自行归一化尺寸,也意味着你要把尺寸当作预处理超参数而非固定常数。
Q3:三类标注分别是谁做的、可靠吗?
分割掩膜与 BI-RADS 分级由一位资深超声医师(senior ultrasonographer)手工完成;病理标签来自活检(biopsy)证实的临床结果,属于"金标准"性质。注意标注者是单个人、不是多专家委员会,论文未报告观察者间一致性(interobserver agreement)——这是本数据集在标签可靠性上的主要保留项(§5)。
Q4:良性和恶性到底各多少例?
这正是最容易踩的坑。病例(肿瘤)级是 722 良性 / 342 恶性(论文摘要与 Zenodo 描述口径);图像级则是 1,268 良性 / 607 恶性(第三方按实际图数重算)。两套数字都"对",只是计的层级不同——多图患者会把图像级计数推高。本条目以图级为主口径并同时标注病例级(坑 1)。
Q5:BI-RADS 分级怎么分布?
图级口径:BI-RADS 2 有 562 张(30.0%)、3 有 463 张(24.7%)、4 有 693 张(37.0%)、5 有 157 张(8.4%),合计 1,875。要特别注意:这组逐类数字出自第三方论文(BUSTR、Brunel 两源互证),BUS-BRA 官方文档只说"categories 2, 3, 4, and 5",并未给逐类表(坑 3)。
Q6:组织学(histology)有哪些类型?
共 28 种,第三方论文公开了 Top-10:纤维腺瘤(Fibroadenoma)835 张、浸润性导管癌(Invasive Ductal Carcinoma)520 张、囊肿(Cyst)142 张、纤维囊性变(Fibrocystic Changes)106 张,其后依次为浸润性小叶癌 42、导管内乳头状瘤 41、硬化性腺病 37、增生 31、脂肪瘤 17、叶状肿瘤 13。余 18 类未完整披露(坑 3 相关)。
Q7:官方"标准折"到底是什么、有什么问题?
官方提供 5 折与 10 折两套标准化交叉验证划分,声称"每折图像互斥"。问题在于:它只保证图像级互斥,不保证患者级互斥——官方文档自己(MDPI CMT-BUSNet 转述)说明"作者不保证患者级分离,因为部分患者贡献了来自不同扫描平面的多张图像"。第三方 PerceptGuide v1.0.1 的审计给出了后果:原划分存在数据泄漏,按患者级重划后分割 88.27%→73.99%、分类 86.92%→77.10%(§4、坑 5)。
Q8:官方用什么方法做基准?
论文自带的评估框架是语义分割 DeepLabV3+,骨干网络用 ResNet18 / ResNet50;分类同样基于 ResNet18/ResNet50 特征;实现语言/环境为 Matlab 2022b,配 5 折交叉验证复现。GitHub 仓库分成 Segmentation 与 Classification 两套框架,各含各自的项目文件与运行脚本(§7)。
Q9:我现在能拿到什么、要不要申请?
全量直接下,无门禁。Zenodo 记录 10.5281/zenodo.8231412 提供 BUSBRA.zip(133.9 MB,md5 1f8b2be6476d58fc97bfb5e5a1ea9bab)一行命令即可下载;代码在 github.com/wgomezf/BUS-BRA。许可 CC BY-4.0——署名即可再分发、修改、商用。唯一约束是"任何基于 BUS-BRA 的研究必须引用 Medical Physics 2024 论文"。
Q10:为什么它对 AI-Ready 重要?
它是"四件套标注 + 官方标准折 + 最宽松许可 + 单链直下"的组合样本:三标注(病理/BI-RADS/掩膜)解决了评测口径不统一,标准折解决了可比性,CC BY-4.0 与 Zenodo 直链解决了可获取性,而且规模(1,875 图)足够跑动深度模型。它同时是本库中"数据集自带已知方法学缺陷(患者级泄漏)“的典型案例——AI-Ready 不等于"无隐患”,把隐患写清楚同样是就绪的一部分。
Q11:为什么是巴西的数据?有地域偏倚吗?
BUS-BRA 采集于巴西里约热内卢的国家癌症研究所(INCA),是单一国家、单一机构的数据。这带来一个必须承认的局限:人群构成、设备品牌(4 台均为 GE/Toshiba 等主流厂商机型)、扫描习惯都带巴西单一中心色彩,模型在巴西数据上训练后到其他人群/设备的泛化性需要外部验证(BUSI/UDIAT/BrEaST 正是常用外部队)。不过,4 台不同扫描仪至少提供了设备层面的多样性,比"单机数据集"更接近多中心场景。
Q12:它和 BUSI 到底谁大、该用哪个?
规模上 BUS-BRA(1,875 图 / 1,064 患者)大于 BUSI(780 图 / 600 患者);标注上 BUS-BRA 多出 BI-RADS 与官方标准折,BUSI 的"正常"类别是 BUS-BRA 没有的(BUSI 三分类:正常/良性/恶性)。选择建议:需要 BI-RADS、需要标准折、需要更大规模 → BUS-BRA;需要"正常"类别或做埃及/中东场景 → BUSI。两者常一起用:BUS-BRA 训练、BUSI 外部验证。切忌当成同一份数据(坑 2)。
Q13:商用会不会有法律风险?
按 Zenodo 官方许可 CC BY-4.0,商用是允许的(唯一硬性义务是署名)。但有两个提醒:(1) 别被第三方站标成 GPL-3.0 的口径误导(坑 4),以 Zenodo 为准;(2) 数据集本身是医学影像,即便许可宽松,落到具体产品时仍受当地医疗数据与器械法规约束(许可 ≠ 合规),这部分需自行咨询法律。
Q14:数据集里有没有患者隐私信息?
公开的是 B-mode 超声图 + 掩膜 + 结构化元数据(病理/BI-RADS/组织学/患者标识),患者标识是研究用假名(不是姓名/病历号)。但原图带有设备叠加文字(也可能含检查号等),第三方预处理用强度截断抑制部分叠加层。作为使用者,不应尝试从图像中还原任何身份信息,也不要把伪名当可关联标识使用——这是医学数据伦理的基本要求。
Q15:如果我只想做"良恶性二分类",最快多快能跑起来?
最短路径:下载 BUSBRA.zip → 解压 → 读 CSV 取 patient_id 与 pathology → 以 patient_id 分组做 GroupKFold → 图像 resize 统一尺寸 → 训练一个 ImageNet 预训练的 ResNet → 报告敏感度/AUC。掩膜与 BI-RADS 可暂不用。唯一不能省的是 patient_id 分组——省了就会复现官方折的泄漏(§4)。预计上手时间主要花在下载与预处理,而非模型。
§1.5 一表读全:BUS-BRA 数字总账
在进入细节前,先把全文会反复出现的数字集中成一张账,标注口径与出处——这是本条目"防混引"的第一道闸门。
| 数字 | 含义 | 口径 | 出处 | 本条目用法 |
|---|---|---|---|---|
| 1,064 | 女性患者数 | 患者级 | 三源一致 | 主口径 |
| 1,875 | B-mode 超声图数 | 图像级 | 三源一致 | 主口径 |
| ~1.76 | 平均图数/患者 | 派生 | 1875 ÷ 1064 | 说明多图现象 |
| 722 / 342 | 良性 / 恶性 | 病例级 | 论文摘要、Zenodo | 标记为病例级 |
| 1,268 / 607 | 良性 / 恶性 | 图像级 | 第三方重算 | 主口径(图级) |
| 562 / 463 / 693 / 157 | BI-RADS 2/3/4/5 | 图像级 | 第三方(BUSTR/Brunel) | 标注第三方 |
| 28 | 组织学类型总数 | 病例级 | 第三方(Top-10 公开) | 标注仅 Top-10 可得 |
| 4 | 扫描仪台数 | 设备级 | 第三方论文 | 域差异论据 |
| 5 / 10 | 官方折数 | 划分级 | 官方 | 评测协议 |
| 88.27 / 86.92 | 修正前 分割/分类 | 图像级折 | PerceptGuide | 标注"含泄漏水分" |
| 73.99 / 77.10 | 修正后 分割/分类 | 患者级折 | PerceptGuide v1.0.1 | 严谨基线 |
| 133.9 MB | 压缩包大小 | 文件级 | Zenodo API | 下载参考 |
| 4,809 | 下载次数 | 统计 | Zenodo(2026-09-30) | 使用广度佐证 |
用法三条:(1) 凡引用良恶性数字,必写明"病例级/图像级";(2) 凡引用 BI-RADS/组织学逐类数字,必注明第三方出处;(3) 凡引用分割/分类指标,必注明划分协议(图像级/患者级)。
三源互证说明:1,064 / 1,875 / 722 / 342 四个数字在 Zenodo 描述、GitHub README、论文摘要三处的文字近乎逐字相同(作者把同一段叙述复制到三个渠道),因此相互印证强度高;而 1,268 / 607 及 BI-RADS 逐类数字则来自独立第三方重算,属外部证据,价值在于"用元数据自己数一遍"消解了口径歧义。
§2 数据构成与规格
2.1 规模三层口径:患者 / 图像 / 病灶
BUS-BRA 的规模要分三层理解,混层就会得到互相矛盾的数字:
| 层级 | 计数 | 说明 |
|---|---|---|
| 患者(patients) | 1,064 | 全部为女性患者,三源(Zenodo/论文/GitHub)一致 |
| 图像(images) | 1,875 | B-mode 超声 PNG 图,平均约 1.76 张/患者 |
| 病灶/病例(cases/tumors) | 1,064(即病例数≈患者数) | 每患者按一例处理,故病例级计数与患者数对齐 |
“每患者一例、但可有多个切面图"是理解全部数字的关键:病例级写 1,064,图像级写 1,875,差值 811 张就是"同一位患者的额外切面/双侧图”。论文摘要与 Zenodo 描述的 722 良性/342 恶性合计恰为 1,064,说明那是病例级口径;第三方重算的 1,268 良性/607 恶性合计为 1,875,是图像级口径(坑 1)。
2.2 采集设备与成像条件
| 属性 | 规格 |
|---|---|
| 模态 | B 模式(B-mode)灰阶超声 |
| 扫描仪 | 4 台:GE Logiq 5、GE Logiq 7、Toshiba Aplio 300、GE U-Systems |
| 图像尺寸 | 随图而异(论文原文:dimensions vary across the dataset),未统一 |
| 图像格式 | PNG(灰阶) |
| 掩膜格式 | PNG(二值:肿瘤区 vs 正常区) |
| 元数据格式 | 独立 CSV(逐图字段) |
| 采集机构 | 巴西里约热内卢国家癌症研究所(INCA)临床超声检查 |
四台不同扫描仪带来真实的域间差异(domain shift):不同厂商的增益曲线、斑点纹理、聚焦与动态范围不同,同一病灶在不同机器上呈现的灰度分布并不一致。这既是挑战(跨设备泛化),也是价值(更贴近多中心真实场景,比单机数据集更能暴露模型对设备指纹的过拟合)。第三方论文在预处理阶段常需对原图做 1/99 百分位强度截断,以抑制设备叠加的标尺、文字等伪影(artifacts)——这反向印证原图确实带有这类叠加层(坑 6)。
2.3 标注体系:三标注 + 一附加
| 标注 | 取值 | 来源 | 层级 |
|---|---|---|---|
| 病理(pathology) | 良性 / 恶性(biopsy-proven) | 临床活检 | 病例级(逐图继承) |
| BI-RADS | 2 / 3 / 4 / 5 | 资深超声医师评估 | 图像级 |
| 分割掩膜(mask) | 二值:肿瘤 vs 正常 | 资深超声医师手工勾画 | 像素级 |
| 组织学(histology) | 28 类(含纤维腺瘤、IDC 等) | 临床病理 | 病例级 |
这四类标注的组合决定了 BUS-BRA 能支撑的任务跨度:像素级(分割)、图像级(BI-RADS 分级)、病例级(良恶性分类、组织学分型)。值得注意的是掩膜是二值而非多类——第三方(MDPI YOLO 论文)明确指出"BUS-BRA 的掩膜是二值的,因此类别标签取自随附的元数据",即掩膜只回答"哪里是病灶",不回答"是哪一类病灶",类别信息要从 CSV 里取。这一点在做多类分割时是硬约束。
2.4 良恶性与 BI-RADS 的分布
病理分布(双口径):
| 口径 | 良性 | 恶性 | 合计 | 恶性占比 |
|---|---|---|---|---|
| 病例/肿瘤级(论文摘要、Zenodo) | 722 | 342 | 1,064 | 32.1% |
| 图像级(第三方重算) | 1,268 | 607 | 1,875 | 32.4% |
两套口径下恶性占比都约在 32%,说明多图现象在良恶性之间基本同比例分布、未造成严重的方向性偏斜——这是本数据集相对友好的地方(约 1:2 的良恶比,虽有类不平衡但不极端)。
BI-RADS 分布(图级,第三方口径):
| BI-RADS | 含义 | 图数 | 占比 |
|---|---|---|---|
| 2 | 良性(benign) | 562 | 30.0% |
| 3 | 可能良性(probably benign) | 463 | 24.7% |
| 4 | 可疑(suspicious) | 693 | 37.0% |
| 5 | 高度可疑恶性(highly suggestive of malignancy) | 157 | 8.4% |
| 合计 | — | 1,875 | 100% |
分布上,BI-RADS 4 占比最高(37%),2 与 3 合计过半(54.7%),5 最少(8.4%)。这与真实临床筛查队列的形态相符——大量良性/可能良性发现,少量高度可疑。对建模的含义:BI-RADS 5 样本仅 157 张,做四级分类时最小类的召回率会很不稳定;很多第三方工作干脆把它退化成"BI-RADS ≤3 vs ≥4"的二分类来规避类不平衡。
2.5 组织学分布 Top-10
| 组织学类型(中文/英文) | 图数 |
|---|---|
| 纤维腺瘤(Fibroadenoma) | 835 |
| 浸润性导管癌(Invasive Ductal Carcinoma, IDC) | 520 |
| 囊肿(Cyst) | 142 |
| 纤维囊性变(Fibrocystic Changes) | 106 |
| 浸润性小叶癌(Invasive Lobular Carcinoma, ILC) | 42 |
| 导管内乳头状瘤(Intraductal Papilloma) | 41 |
| 硬化性腺病(Sclerosing Adenosis) | 37 |
| 增生(Hyperplasia) | 31 |
| 脂肪瘤(Lipoma) | 17 |
| 叶状肿瘤(Phyllodes Tumor) | 13 |
来源:BUSTR(arXiv:2511.20956)Table 2,明确标注为"Top 10 of 28"。两个观察:其一,纤维腺瘤 + 浸润性导管癌两类合计 1,355 张(约 72%),其余 26 类共享剩余 28%,长尾极长——任何组织学分型的尝试都会被头部两类主导;其二,组织学粒度上是"良性病变类型"(纤维腺瘤、囊肿)与"恶性亚型"(IDC、ILC)混排,做"良性 vs 恶性"分类时,组织学字段可以帮助构造更细的监督信号,但要注意良性侧的类别远多于恶性侧。
2.5b 组织学与病理的对应关系
把组织学 Top-10 按病理归并,能看清标签体系的层级一致性:
| 病理 | 典型组织学类型 | Top-10 中的图数合计 |
|---|---|---|
| 良性 | 纤维腺瘤、囊肿、纤维囊性变、导管内乳头状瘤、硬化性腺病、增生、脂肪瘤 | 835+142+106+41+37+31+17 = 1,209 |
| 恶性 | 浸润性导管癌、浸润性小叶癌 | 520+42 = 562 |
| 交界/可变 | 叶状肿瘤(Phyllodes,可良性/恶性/交界) | 13 |
两点提示:其一,Top-10 里良性侧图数(1,209)远超恶性侧(562),与全集合良恶比(约 2:1)方向一致;其二,叶状肿瘤是交界性病变,按"良性 vs 恶性"简化时归属存在争议,建模时需自行决定二分归属,这是组织学标签精细度带来的额外决策。整体看,BUS-BRA 的病理/组织学字段构成一个两级标签体系(粗:良恶性;细:组织学),研究者可按任务需要选择粒度。
2.5d 为什么会有这么多良性样本
很多做二分类的读者会问:为什么良性远多于恶性(约 2:1)?这不是采样失误,而是乳腺超声检查的真实分布:
- 乳腺超声的日常适应证大量是良性病变的评估与随访(囊肿、纤维腺瘤、纤维囊性变),恶性只是少数;
- 数据来自 INCA 的常规临床检查,不是"只收恶性病例"的研究队列,因此自然呈现筛查队列的分布;
- 这也解释了为什么 BI-RADS 2/3(良性/可能良性)合计过半——大多数受检者本就不是恶性。
对建模的含义是双面的:好处是贴近真实临床先验(模型的假阴性代价可被合理评估);坏处是类不平衡会让"全预测良性"这种平凡解拿到 ~68% 准确率,因此必须报敏感度/AUC 而非只看 accuracy。若要人为平衡类分布,需用重加权/过采样,并注意不要破坏患者级划分(§4.7)。
2.5c 图像尺寸与预处理的影响
论文明确图像尺寸"随图而异",这在实践中意味着一次预处理决策链:
| 环节 | 选项 | 对结果的影响 |
|---|---|---|
| 尺寸统一 | 缩放 / 填充 / 裁剪 | 改变病灶相对像素面积,影响 Dice/IoU |
| 强度归一化 | min-max / z-score / 1-99 截断 | 抑制设备伪影与增益差异 |
| 灰度处理 | 保持单通道 / 复制为三通道 | 影响能否用 ImageNet 预训练骨干 |
| 掩膜对齐 | 随图同步变换 | 不一致会直接破坏分割监督 |
其中尺寸统一与掩膜对齐必须联动:图像若做了缩放,掩膜必须用同样的变换(且最近邻插值以免引入非二值像素)。这是医学分割数据预处理最常见的翻车点之一。BUS-BRA 因尺寸不统一,把这个决策显式交给了使用者——建议在论文里报告所用的尺寸与插值方法,否则他人难以复现你的 Dice。
2.6 与库内相邻数据集的规格对照
| 数据集 | 机构/年份 | 患者 | 图像 | 模态 | BI-RADS | 掩膜 | 标准折 |
|---|---|---|---|---|---|---|---|
| BUS-BRA(本条目) | 巴西 INCA / 2023 | 1,064 | 1,875 | 超声 | 2–5 | 二值 | 5/10 折 |
| BUSI(rid 539) | 埃及 Baheya / 2018 | 600 | 780 | 超声 | 无 | 三类标注图 | 无 |
| UDIAT(BUSI-Dataset-B) | 西班牙 Parc Taulí / 2012 | — | 163 | 超声 | 无 | 有无病灶 | 无 |
| BrEaST | 波兰 / 2019 | — | 256 | 超声 | 有 | 有 | 无 |
一句话定位:在乳腺超声公开集里,BUS-BRA 是规模最大且唯一同时给齐病理+BI-RADS+掩膜+官方折的组合;BUSI 更大规模上逊色且缺 BI-RADS;UDIAT 图数最少但常被当外部验证集;BrEaST 标注丰富但仅 256 图。这也是第三方论文反复把它当"主训练集"、把 BUSI/UDIAT/BrEaST 当"外部验证集"的原因(§7)。
2.7 样本来源与选择:它是不是"随机样本"
一个常被忽略的问题是:这 1,875 张图是不是从 INCA 全部超声检查里随机抽的?公开信息里未见明确的随机抽样声明。能确定的是:
- 数据来自 INCA 的临床检查,而非为建模专门设计的采集协议;
- 病例需有"可供标注的病灶"(用于勾画掩膜),因此无病灶的纯筛查图可能未被纳入——这意味着 BUS-BRA 不是"全部乳腺超声"的无偏代表,而是"含可标注病灶"的子集;
- 多图患者的存在说明部分病例做了多切面留图,但留图的规则(临床习惯)未公开。
对使用者的含义:不要把 BUS-BRA 当作"乳腺超声人群的无偏快照"。它的良恶比、BI-RADS 分布、病灶构成都是"含病灶子集"的分布,与"全部受检者"的分布不同。做患病率相关的推论(如"恶性占比 32%“作为人群患病率)会犯生态谬误——这里的 32% 是"被标注病灶中恶性的比例”,不是"受检人群中恶性的比例"。
§3 采集与标注流程
3.1 从临床到公开:一条怎样的管线
BUS-BRA 的采集扎根于 INCA 的常规乳腺超声检查流程,而非为建模专门征募的"干净"志愿者。这意味着数据带有一线临床的真实面貌:设备不统一(4 台)、检查不标准化(切面由医师现场决定)、结果不预设(活检与否由临床判断)。数据集的整理工作因此主要落在标注与元数据工程上,而不是图像采集本身。
流程可拆为四步:
- 临床采集:患者在 INCA 接受 B 模式乳腺超声检查,医师按临床需要留存切面图像;同一患者可能留下单张或多张(含双侧)。
- 病理归集:对接受活检的病灶,取得病理结果(良性/恶性)及组织学类型,作为"金标准"标签。
- 影像标注:由一位资深超声医师对图像逐一勾画病灶分割掩膜,并给出 BI-RADS 分级(2/3/4/5)。
- 元数据汇编与划分:把逐图的病理、BI-RADS、组织学、患者标识整理成 CSV,并生成官方 5 折/10 折划分索引,连同图像与掩膜打包为
BUSBRA.zip。
3.2 掩膜标注的性质
掩膜是二值地面真值(binary ground truth),即把每个像素判为"肿瘤区"或"正常区"。手工勾画意味着边界精度取决于标注医师对病灶边界的判断——超声边界本就模糊,不同医师可能给出不同的轮廓,而 BUS-BRA 只有单医师版本、无多标注对照。对建模的两个提醒:
- 用这类掩膜训练分割模型时,模型学到的是"这位医师的边界风格",而非被证明唯一的解剖真值;报告 Dice/IoU 时应对这一上限有预期。
- 二值掩膜不含类别,若要做"多类病灶分割",得自行把 CSV 里的组织学/病理字段与掩膜做关联,且只能在病灶级(一个连通域一个类)近似处理。
3.3 BI-RADS 单评估者的边界
BI-RADS 分级由同一位置深超声医师完成。BI-RADS 本身是"标准化沟通语言",其设计目标之一就是降低主观性,但临床研究显示不同医师、不同年资间仍存在可观的分级差异。BUS-BRA 采用单评估者方案,好处是分级标准内部一致(同一人、同一尺度),代价是无法给出评估者间一致性,也无从判断这位医师相对"共识"的偏移方向。使用者应当把它当作"一位专家的判断真值",而不是"专家委员会共识真值"(坑 7 相关的可靠性保留)。
3.4 官方划分的生成逻辑与原罪
官方划分(5 折 / 10 折)是 BUS-BRA 对社区最重要的贡献之一——它让不同论文的数字可比。但它的生成逻辑里埋着本条目最需要被记住的问题:
- 官方保证每一折的图像互不重叠(image-disjoint)。
- 官方未保证每一折的患者互不重叠——数据集作者在文档中明确"不保证患者级分离,因为部分患者贡献了多张来自不同扫描平面的图像"(MDPI CMT-BUSNet 引述)。
后果是:同一位患者的 A 切面可能进了训练折、B 切面进了测试折。由于同患者的图像高度相似,这构成近重复泄漏(near-duplicate leakage),会把测试指标抬到虚高。第三方 PerceptGuide v1.0.1 的审计把这一泄漏定量化了(§4.4、§7.3):按患者级重划后,分割指标从 88.27% 掉到 73.99%,分类从 86.92% 掉到 77.10%——跌幅即泄漏的"水分"。这解释了为什么 BUS-BRA 上一些漂亮的早期数字难以被后续工作在严格协议下复现。
3.5 元数据结构:CSV 里的逐图字段
BUS-BRA 把"图像之外的一切"收进独立 CSV,逐图一行。第三方论文用过的主要字段可归纳为:
| 字段类别 | 内容 | 粒度 | 用途 |
|---|---|---|---|
| 标识 | 图像 ID、患者标识 | 图/患者 | 划分、去重、关联掩膜 |
| 病理 | 良性 / 恶性 | 病例级 | 分类任务标签 |
| 分级 | BI-RADS 2 / 3 / 4 / 5 | 图像级 | 分级任务标签 |
| 组织学 | 28 类之一 | 病例级 | 细粒度分型、类别关联 |
| 图像属性 | 尺寸、来源设备(间接) | 图像级 | 预处理、域分析 |
这份 CSV 的结构决定了 BUS-BRA 能做几件事:因为有患者标识,才可能做患者级重划(§4.3 的修复工艺全依赖此字段);因为病理与组织学同表,才能从二值掩膜反查类别;因为BI-RADS 独立成列,才能做四级分级而非简单二分。反过来说,如果某个下游工作拿到的只是图像与掩膜(丢了 CSV),上述能力就都不存在——所以务必要连 CSV 一起下载与版本控制。
3.6 数据质量细节:伪影、尺寸与不平衡
三个需要在使用前处理的质量问题:
- 设备叠加伪影:原 B 模式图普遍带有设备渲染的标尺、文字、增益条与光标标记。第三方预处理(如 MDPI YOLO 论文)以 1/99 百分位强度截断来抑制它们,避免模型把"标尺"当成病灶线索。这是一个必须在预处理阶段处理的隐患(坑 6)。
- 尺寸不统一:图像尺寸"随图而异",深度学习入模前必须统一尺寸(缩放、填充或裁剪)。不同缩放策略会影响病灶的相对像素面积,进而影响分割指标——建议在报告中说明所用的尺寸归一化方法。
- 类不平衡:恶性约 32%、BI-RADS 5 仅 8.4%、组织学长尾极大。做分类/分级时需考虑重加权、分层采样或退化为粗分类(如 BI-RADS ≤3 vs ≥4)来缓解。
3.7 标注的粒度选择:病例级还是图像级
除"计数口径"外,标注本身也涉及粒度问题,需在使用前想清楚:
| 标注 | 天然粒度 | 能否下放到图像级 |
|---|---|---|
| 病理(良/恶) | 病例级 | 可——同患者图继承同一标签 |
| 组织学 | 病例级 | 可——同患者图继承 |
| BI-RADS | 图像级 | 本就是逐图 |
| 分割掩膜 | 像素级 | 本就是逐图 |
两个推论:其一,病例级标签下放是"重复计数"的来源——把 1,064 个病例标签摊到 1,875 张图上,才产生 1,268/607 的图像级数字(坑 1);其二,这让"每患者一票"与"每图一票"的评测结果不同——若按图计权,多图患者会被过采样。严谨做法是:明确报告是按图还是按患者统计指标,必要时给出两种口径。
这三点合起来说明:BUS-BRA 的"可直接用"是数据层面的(下得到),而非管线层面的(拿来即训)。它省掉了申请与合规成本,但仍要求使用者做标准的医学影像预处理。
§4 划分、泄漏与数据可信度
4.1 为什么"划分"值得单开一节
对多数数据集,交叉验证划分只是附录里的一行设定;但对 BUS-BRA,划分恰是它最有讨论价值的对象。原因有三:其一,官方把"标准化折"当作核心卖点写进标题与摘要;其二,这套折经审计被发现存在患者级泄漏,直接影响任何引用其上指标的可信度;其三,修正泄漏本身成了一套可迁移的方法学范例,被后续论文采用。因此本节不把划分当技术细节,而当数据可信度的核心变量处理。
4.2 官方折的宣称与实情
| 维度 | 官方宣称 | 实际情况 |
|---|---|---|
| 折数 | 5 折 + 10 折两套 | 一致 |
| 互斥粒度 | “图像互斥”(image-disjoint) | 一致——但仅到图像级 |
| 患者级互斥 | 未宣称 | 未保证:同患者多图可跨折(作者文档自陈) |
| 可复现性 | 提供固定划分索引 | 索引随数据集打包,可复现 |
| 跨论文可比性 | 意在统一评测口径 | 部分达成——但由于泄漏,早期数字被高估 |
问题的性质很明确:这不是"官方撒谎",而是"官方声明了一个较弱(图像级)的保证,使用者却常常默认了更强(患者级)的保证"。在医学影像里,患者级互斥是防止泄漏的行业底线,因为同患者的图像共享解剖、病灶与设备指纹,图像级互斥不足以保证训练/测试独立同分布假设成立。
4.3 泄漏的机制:为什么同患者多图会毁掉评测
想象一位患者有 3 张图(不同切面),官方划分把其中 1 张放入测试折、2 张放入训练折。训练时模型"见过"该患者的病灶在另外两个视角下的样子(大小、边缘、内部回声、周边腺体纹理),测试时面对同病灶的第三个视角,等于开了卷答题。这种泄漏在图像的像素级统计上留下可被模型利用的"指纹":
- 重复纹理:同一台设备、同一位患者、同一次检查,斑点噪声的空间相关性、增益分布高度相似。
- 病灶泄漏:同一病灶的不同切面在形态上高度相关,模型可以记住"这个病灶长什么样"而非学会"恶性病灶的通用特征"。
- 背景泄漏:周围正常腺体的结构在患者内高度一致,构成可识别的背景模板。
三类泄漏叠加,使测试指标系统性偏高。跌幅有多大?第三方给出了量化答案。
4.4 第三方审计:泄露的定量证据
PerceptGuide v1.0.1 修正记录(github.com/Zehui-Lin/PerceptGuide 发布说明)是迄今最直接的一手证据:
原始数据划分未强制患者级分离,意味着同一患者的图像可能同时出现在训练集与测试集。这是一种数据泄漏(data leakage),会导致无效的模型评估。
该工作将划分修正为患者级分离后,在 BUS-BRA 上报告:
| 任务 | 原始(图像级划分) | 修正(患者级划分) | 跌幅 |
|---|---|---|---|
| 分割(seg) | 88.27% | 73.99% | −14.28 个百分点 |
| 分类(cls) | 86.92% | 77.10% | −9.82 个百分点 |
超过 14 个百分点的分割指标回落,足以改变一篇论文的结论方向。这组数字的价值不止于"BUS-BRA 的数字要打折",更在于它给整个乳腺超声 CAD 圈一个警示:报告高分割分数时,先确认划分是不是患者级。
4.4b 跌幅为何是"证据"而非"噪声"
有人可能质疑:指标掉下来会不会只是随机波动?这需要厘清方法论。患者级修正引进的唯一变化,是把同患者的其他图像从测试集移出训练集。如果模型学的确是"恶性病灶的通用特征",那么少看几张同患者的相似图不该造成十几点的落差;落差如此之大,恰恰反证了模型此前依赖了患者内相似性(记忆而非泛化)。这正是"跌幅即泄漏量"的推理依据:
- 若落差很小(1-2 点)→ 泄漏轻微或模型本就在学通用特征;
- 若落差很大(>10 点)→ 模型高度依赖患者内相似性,前期指标虚高。
BUS-BRA 的 14.28 点属于后者,因此它的历史高分列表需要整体审慎对待。这也解释了为什么后续严谨工作会在 Method 里专门声明"我们采用患者级划分"——这句话在 BUS-BRA 上不是客套,而是结果是否可信的分水岭。
另一路举证——MDPI YOLO 论文的补救范式:该工作没有停在"指出问题",而是给出了修复工艺:用 StratifiedGroupKFold(以患者标识分组、按病理分层)重做 10 折,严格保证每位患者只映射到一折,并在流水线里断言"每个患者标识只出现于一折"。这成了 BUS-BRA 上"如何正确划分"的参考实现。
4.4c 泄漏对三类任务的差异化影响
泄漏对不同任务的影响并不等价,理解差异有助于判断哪些文献数字更该打折:
| 任务 | 泄漏影响 | 原因 |
|---|---|---|
| 图像级分类(良恶性) | 较大 | 同患者良恶性一致,模型可"认出患者"直接答题 |
| 像素级分割 | 最大 | 同一病灶不同切面形态高度重叠,边界可被记忆 |
| BI-RADS 分级 | 较大 | 分级含患者内一致性,同患者多图答案相近 |
因此对分割类高分(88%+)应先打最重的问号;对分类结果同样需谨慎;只有外部验证(BUSI/UDIAT/BrEaST)上的数字不受本数据集内部泄漏影响。这就是为什么严谨论文会把内部患者级划分与外部验证并列报告——两者分别防守"内部泄漏"与"过拟合本集"两种失效模式。
4.5 怎么用这套数据才不踩泄漏
给使用者的一份操作清单:
- 不要默认官方折是患者级的。若要用官方折做基准以对接文献,必须显式声明"图像级划分,存在患者级泄漏",并把数字与之对标的文献同样标注。
- 自建划分时强制患者级互斥。以 CSV 里的患者标识为 group、以病理为 stratify,用
GroupKFold/StratifiedGroupKFold。 - 加断言。在数据加载阶段断言"训练集患者标识 ∩ 测试集患者标识 = ∅“,让泄漏在流水线里"跑不起来”。
- 报告两套数字。若必须与历史文献对比,同时给出"官方折"与"患者级折"两套结果,让读者看到水分有多少——这本身是有信息量的实验。
- 区分内部与外部验证。BUS-BRA 内部按患者级划分 + 在 BUSI/UDIAT/BrEaST 上做外部验证,是当前较稳妥的协议(§7)。
4.6 这不降低数据集价值,反而抬高了它
有一种误读是"既然有泄漏,这数据集就不能用了"。恰恰相反:泄漏是当时划分协议的技术局限,不是数据本身的缺陷。图像、掩膜、病理、BI-RADS 都还在,患者标识也在(正因为有此字段才能做患者级重划)。BUS-BRA 的贡献在于它把一个抽象的"划分很重要"命题变成了一次可复现的实证——修正前/后的对比数字是可以直接放进论文 Method 节的证据。它是"如何在真实数据集上做可信评测"的公开教案。
4.7 如何在代码里实现患者级划分
把 §4.5 的清单落到具体实现上,一份可复用的患者级划分骨架(伪代码,示意逻辑而非特定库):
读 CSV → 得到每图的 (image_id, patient_id, pathology, birads)
以 patient_id 为 group,以 pathology(或 birads)为 stratify
调用 StratifiedGroupKFold(n_splits=10, shuffle=True, random_state=42)
→ 得到每折的 训练/测试 图像索引
断言:对每一折,
set(train.patient_id) ∩ set(test.patient_id) == 空集
若断言失败 → 抛出异常,禁止训练
把折索引落盘(CSV/JSON),随实验一起版本化
关键设计点:
- 分组键必须是 patient_id,不能是 image_id——这是"图像级 vs 患者级"在代码里的唯一分界。
- 分层键用 pathology 或 birads——保证每折的类分布接近总体,避免某折恶性全落训练集。
- 断言要放在数据加载层、每次运行都执行——不要只在"划分脚本"里检查一次,因为下游可能用手工拼的索引绕过。
- 折索引落盘——让数字可复现,也让评审者能核对划分是否真的患者级。
这段骨架是 BUS-BRA 上做"可信评测"的最短路径;把它接到 §4.5 的清单第 3、4 条,就构成了完整的防泄漏闭环。
4.8 一个反问:为什么官方当初没做患者级划分
理解"为什么没做",有助于判断这个问题在其他数据集上是否也会重演。可能的原因:
- 面向分割的惯性:图像级互斥是语义分割数据的常规做法(图像是独立样本的假设在许多自然图像场景成立),团队可能沿用了这一默认。
- 图像数 vs 患者数的错位:官方叙事强调"1,875 张图"的规模,而患者级划分要求以 1,064 为单位切分,会让每折的有效样本量减少,指标方差增大——团队可能出于"保持每折样本量"的考量选了图像级。
- 多图患者占比不高导致的低估:平均 1.76 图/患者、多数患者仅 1 图,可能让团队低估了少数多图患者带来的泄漏效应。
- 当时的社区惯例:2023 年其划分时,患者级互斥在超声 CAD 圈尚未成为普遍要求。
这四点合起来说明:患者级泄漏是一个"系统性的、容易在多个数据集上重演"的问题,而非某个团队的疏忽。这也正是 BUS-BRA 审计意义超出单个数据集的原因——它提示每一份医学影像数据集都该自问"我的划分是患者级的吗"。
§5 任务与标注
5.1 三大任务的定义
BUS-BRA 官方定位支持三类任务,对应三种标注:
| 任务 | 输入 | 输出 | 监督来源 | 粒度 |
|---|---|---|---|---|
| 病灶分割(segmentation) | B-mode 超声图 | 二值掩膜(肿瘤/正常) | 医师手工勾画 | 像素级 |
| 病理分类(pathology classification) | 超声图(+可选掩膜) | 良性/恶性 | 活检病理 | 图像/病例级 |
| BI-RADS 分类(BI-RADS classification) | 超声图 | 2/3/4/5 | 医师评估 | 图像级 |
分割与分类可以耦合(先分割出病灶区域、再在病灶区域上分类),论文与 GitHub 的代码框架也体现了这种"分割辅助分类"的思路。
5.2 官方评估框架的技术构成
论文自带的评估框架规格:
| 组件 | 规格 |
|---|---|
| 分割网络 | DeepLabV3+ 语义分割 |
| 骨干网络 | ResNet18 / ResNet50 |
| 分类网络 | 基于 ResNet18 / ResNet50 特征 |
| 实现环境 | Matlab 2022b |
| 验证协议 | 5 折交叉验证 |
| 代码仓库 | github.com/wgomezf/BUS-BRA(Segmentation / Classification 两套框架) |
选择 DeepLabV3+ 的用意是把 BUS-BRA 定位成"语义分割评测台"——它给的是像素级掩膜,自然以语义分割为主任务。ResNet18/50 的搭配则给了"轻量 vs 重度骨干"的对照。需要注意的是实现语言是 Matlab,对 Python 生态的使用者,要么复现框架、要么直接取数据自行搭 PyTorch 管线——官方给的主要是数据与协议,而非必须照搬的代码。
5.3 标注可靠性的三个保留项
| 保留项 | 具体 | 影响 |
|---|---|---|
| 单标注者 | 掩膜与 BI-RADS 均出自一位资深超声医师 | 无观察者间一致性;标签带这位医师的个体风格 |
| 二值掩膜 | 掩膜只区分肿瘤/正常,不含类别 | 多类分割需从 CSV 关联,且只能在病灶级近似 |
| 无中心化复评 | 未见多中心交叉复核流程公开 | 跨设备的标注一致性无独立验证 |
这三点不构成"不能用",但构成了"报告结果时要说清楚"的义务:单标注真值是一个合理但非唯一的地面真值,模型的指标上限有一部分是"与这位医师的对齐度"而非"与生物学事实的距离"。
5.3b BI-RADS 分级:判读逻辑与建模意涵
BI-RADS(Breast Imaging-Reporting and Data System)由美国放射学会(ACR)制定,是乳腺影像的标准化报告语言,其核心是把影像发现映射到一个 0–6 的分级,用以规范后续处理。BUS-BRA 覆盖的是其中 2–5 四档:
| 分级 | 临床含义 | 处置倾向 | BUS-BRA 图数 |
|---|---|---|---|
| 2 | 良性(benign) | 常规随访 | 562 |
| 3 | 可能良性(probably benign) | 短期复查(通常 6 个月) | 463 |
| 4 | 可疑(suspicious) | 建议活检 | 693 |
| 5 | 高度可疑恶性 | 强烈建议活检 | 157 |
对建模的三点意涵:
- 分级不是良恶性的粗细版,而是"行动导向"的量表。BI-RADS 3 与 4 之间是"再观察"与"做活检"的临床分水岭,模型若在此界附近出错,临床后果远大于 2/3 之间出错。因此评估分级模型时,混淆矩阵在 3↔4 界上的表现比总体准确率更有意义。
- 分级与病理不完全对应。BI-RADS 5 也可能活检为良性(假阳性),BI-RADS 3 也可能最终为恶性。BUS-BRA 同时给了 BI-RADS 与病理,正好可以量化这种"影像判断 vs 组织学事实"的不一致——这是纯病理标签集做不到的分析。
- 最小类(BI-RADS 5,157 张)制约四级分类。做四级分类时,8.4% 的样本量会让该类指标剧烈波动;多数工作因此退化为二分类(如 ≤3 vs ≥4)或采用代价敏感学习。
5.4 潜在应用清单(论文列举 + 本文补充)
论文列举的应用方向:病灶检测与分割、病理良恶性分类、BI-RADS 自动分级、去斑点滤波(despeckle filtering)、对比度增强、特征工程。本文基于数据集特性补充:
- 跨设备泛化研究:4 台扫描仪天然构成域划分,可做"留一台设备出(leave-one-machine-out)"的泛化测试。
- 多任务学习:分割+分类+BI-RADS 三级监督可联合训练,研究任务间的知识迁移。
- 弱监督与半监督:掩膜只在部分研究用到,可研究"仅用图像级标签训练分割"。
- 数据集划分方法学研究:官方折 vs 患者级折的对照本身就是现成实验台(§4)。
- 不确定性建模:单标注者意味着真值有噪声,适合研究标签噪声下的鲁棒训练。
5.5 与其他 BUS 数据集在任务覆盖上的差异
| 数据集 | 分割掩膜 | 病理分类 | BI-RADS | 标准折 | 规模 |
|---|---|---|---|---|---|
| BUS-BRA | 二值 | 有 | 2–5 | 5/10 折 | 1,875 图 |
| BUSI(rid 539) | 三分类标注 | 有 | 无 | 无 | 780 图 |
| UDIAT | 有无病灶 | 有 | 无 | 无 | 163 图 |
| BrEaST | 有 | 有 | 有 | 无 | 256 图 |
BUS-BRA 的差异点集中在"BI-RADS + 标准折 + 规模"三者同时具备;这也是它被第三方论文选定为跨数据集实验的主训练集的直接原因——训练集要规模大、标注全,外部验证集要独立,BUSI/UDIAT/BrEaST 恰好补齐了后者的角色。
5.6 从标注到标签:一次任务的端到端拆解
以"病灶分割"为例,走一遍从原始数据到训练张量的完整链路,标出每一步 BUS-BRA 的特殊注意点:
| 步骤 | 通用做法 | BUS-BRA 特殊点 |
|---|---|---|
| 1 下载解压 | 取图像+掩膜 | 顺带取 CSV,别丢元数据 |
| 2 读元数据 | 建索引 | 用 patient_id 建 group |
| 3 划分 | train/val/test | 患者级(§4.7),非图像级 |
| 4 尺寸统一 | resize 到固定尺寸 | 掩膜同步最近邻插值 |
| 5 强度归一 | z-score / 截断 | 1/99 截断抑制伪影 |
| 6 增广 | 翻转/旋转/弹性 | 注意勿跨患者混增广 |
| 7 训练 | 分割网络 | 可按需换 DeepLabV3+ 以外 |
| 8 评测 | Dice/IoU 逐折 | 报均值±std,标注划分协议 |
| 9 外部验证 | 换数据集 | BUSI/UDIAT/BrEaST |
这份链路的价值在于:BUS-BRA 的"坑"几乎都集中在第 2、3、4、5 步——而这些恰是通用教程里最容易被跳过、也最容易让结果失真的步骤。把这张表当作 checklist,可以避免绝大多数常见错误。
5.7 分类任务的标签选择:病理 vs BI-RADS
BUS-BRA 同时给了两套可用于分类的标签,选择哪套取决于研究目标:
| 目标 | 用哪套标签 | 理由 |
|---|---|---|
| 判别"是不是癌" | 病理(良性/恶性) | 组织学金标准,二分类清晰 |
| 辅助"要不要活检" | BI-RADS(2–5) | 模拟临床决策分级 |
| 影像-病理对照研究 | 两套都用 | 量化影像判断与组织学的不一致 |
| 与文献对齐 | 看文献用哪套 | 多数分类论文用病理 |
两点提醒:其一,两套标签不等价——BI-RADS 是影像判断,病理是组织学事实,二者存在系统性不一致(影像可能高估或低估),这本身是可研究的对象;其二,报告时必须写清用的是哪套标签,因为"BUS-BRA 分类准确率 90%"若不说明标签,读者无法判断其含义。BUS-BRA 同时提供两套标签,是它的优势,但也因此更需要使用者明确交代口径。
5.8 一个最小的可运行示例(伪代码)
给"想立刻上手"的读者一个最小骨架,串起本条目强调的所有要点:
# 1. 读元数据(务必含 patient_id)
meta = read_csv("metadata.csv") # 1,875 行
assert len(meta) == 1875
# 2. 患者级划分(防泄漏的关键)
groups = meta["patient_id"]
strata = meta["pathology"]
folds = StratifiedGroupKFold(n_splits=10).split(meta, strata, groups)
for tr, te in folds:
assert set(groups[tr]).isdisjoint(set(groups[te])) # 患者级互斥断言
# 3. 图像与掩膜同步预处理
x = load_image(meta["image_path"]); m = load_mask(meta["mask_path"])
x, m = resize(x, (256,256)), resize_nearest(m, (256,256)) # 掩膜最近邻
x = percentile_clip(x, 1, 99) # 抑制伪影
# 4. 训练 + 评测(分割报 Dice/IoU,分类报敏感度/AUC)
...
# 5. 若要与文献对比,另跑一版"官方折"并标注协议差异
这段骨架的每一行都对应本条目的一处告诫:patient_id 分组(§4.7)、互斥断言(§4.5)、掩膜最近邻(§2.5c)、百分位截断(§3.6)、双协议对照(§7.6)。把它贴在实验代码里,等于随身带着这份条目的避坑清单。
§6 获取与许可
6.1 两件资产、两个入口
| 资产 | 入口 | 许可 | 门槛 |
|---|---|---|---|
| 数据本体(1,875 图 + 掩膜 + CSV 元数据 + 划分索引) | Zenodo records/8231412(BUSBRA.zip,133.9 MB) |
CC BY-4.0 | 无,直链下载 |
| 代码(分割/分类框架,Matlab) | github.com/wgomezf/BUS-BRA | 见仓库声明 | 无 |
| 论文 | DOI 10.1002/mp.16812(Medical Physics,订阅制) | Wiley 口径 | 订阅/机构访问 |
与库内许多"注册墙 / 请求制"数据集不同,BUS-BRA 的获取极为顺畅:一个 Zenodo 直链、一个压缩包、无需申请、无需注册。这是它在 AI-Ready 维度上的核心优势。
6.1b 下载与校验实操
一次完整的获取流程:
- 下载:从
https://zenodo.org/records/8231412下载BUSBRA.zip(133.9 MB)。可直接用 Zenodo 提供的直链,或wget/curl拉取。 - 校验:以 md5
1f8b2be6476d58fc97bfb5e5a1ea9bab校验下载完整性——这是可复现研究应有的标准动作,能排除传输损坏。 - 解压:解压后应见图像目录、掩膜目录与 CSV 元数据;先核对 CSV 行数与 1,875 是否吻合,作为"数据完整"的第一道自检。
- 版本固定:在项目里记录版本 DOI
10.5281/zenodo.8231412与 md5,确保将来他人能拿到同一份数据。 - 引用:在任何发布物中附论文引用(DOI 10.1002/mp.16812)+ 数据 DOI + 许可 CC BY-4.0。
对 CI/管道环境,建议把 md5 写进下载脚本的断言里——一旦 Zenodo 侧文件变动(虽有版本 DOI 兜底),断言会立即暴露。
6.1c 与代码仓库的配合
github.com/wgomezf/BUS-BRA 提供 Segmentation 与 Classification 两套 Matlab 框架。使用路径二选一:
- 复现路线:装 Matlab 2022b,按 README 跑 5 折复现官方结果——好处是能与论文表格对齐,坏处是依赖商业软件。
- 迁移路线:只用官方数据与划分协议,在 PyTorch 里自行实现 DeepLabV3+/ResNet——好处是生态友好、便于扩展,坏处是"官方实现细节"(预处理、超参、评估脚本)需自行推断。
两条路线的共同前提都是:先把 CSV 读进来、把患者标识用起来(§3.5)——否则会重复踩患者级泄漏的坑。
6.2 一手下载信息(三源核验)
| 项 | 值 | 来源 |
|---|---|---|
| Zenodo 记录 | https://zenodo.org/records/8231412 | Zenodo API/页面 |
| 版本 DOI | 10.5281/zenodo.8231412 | Zenodo |
| 概念 DOI(版本族父) | 10.5281/zenodo.7730708 | Zenodo(conceptrecid 7730708) |
| 文件名 | BUSBRA.zip | Zenodo API files 列表 |
| 大小 | 133.9 MB(133,917,740 字节) | Zenodo API |
| md5 | 1f8b2be6476d58fc97bfb5e5a1ea9bab |
Zenodo API checksum |
| 首发日期 | 2023-03-13(publication_date) | Zenodo |
| 最后修改 | 2024-09-25(revision 5) | Zenodo |
| 是否最新版 | is_last: true(单一 1.0 版) |
Zenodo API |
下载用量(抓取时点 2026-09-30):Zenodo 记录显示 downloads 4,809(unique 3,473)、views 9,782(unique 8,749)、version_downloads 4,288——即约 4,800 次下载,属乳腺超声公开集里使用广泛的档位。
6.3 版本链
BUS-BRA 目前只有单一 1.0 版本,但存在"概念 DOI / 版本 DOI"两层:
- 概念 DOI(父,
10.5281/zenodo.7730708):指向该数据集的最新版本;未来若发新版,父 DOI 会自动指向新版,适合在"总是想要最新版"的场景引用。 - 版本 DOI(
10.5281/zenodo.8231412):锁定 version 1.0,适合在可复现研究里引用(保证永远拿到同一份数据)。
引用规范上:引用具体数据用版本 DOI,声明版本族用概念 DOI。由于目前只有 1.0,两者实际指向同一份数据,但为将来计,工程里建议记录版本 DOI(可复现优先)。
6.4 许可条款:CC BY-4.0 的边界
许可:CC BY-4.0(Creative Commons Attribution 4.0 International)——Creative Commons 家族里最宽松的一档:
| 允许 | 说明 |
|---|---|
| 再分发 | 可自由复制、分发数据 |
| 修改 | 可基于数据做衍生(重新标注、裁剪、增强) |
| 商用 | 可用于商业产品与商业模型训练 |
| 唯一义务 | 署名(Attribution):标注来源与许可 |
使用条件(作者附加):任何源自 BUS-BRA 使用的研究必须引用 Medical Physics 2024 论文(DOI 10.1002/mp.16812)。这不是 CC BY-4.0 协议本身的要求,而是作者的学术规范请求,但在实践上是硬约束——用它就必须引。
许可冲突存照(坑 4):第三方聚合站 SonoDQS(ultrasound-open-access.nidusai.ca)把 BUS-BRA 标为 GPL-3.0,与 Zenodo 官方 CC BY-4.0 冲突。以官方 Zenodo 记录为准(CC BY-4.0)。GPL-3.0 是软件许可、且含传染性 copyleft,若误按此理解数据许可,会把本可自由商用的数据误当受限——务必以 Zenodo 页面徽标与 API 字段为准。
6.4b 许可对比:为什么 CC BY-4.0 是"最好用"的一档
把常见的数据许可放一起对比,能看清 CC BY-4.0 的位置:
| 许可 | 商用 | 修改 | 再分发 | 主要限制 | 对 AI 训练的影响 |
|---|---|---|---|---|---|
| CC BY-4.0(本集) | ✅ | ✅ | ✅ | 署名 | 最自由,可闭源/商用 |
| CC BY-SA | ✅ | ✅ | ✅ | 署名 + 相同方式共享 | 衍生数据须同许可,有传染 |
| CC BY-NC | ❌ | ✅ | ✅ | 禁商用 | 不能用于商业模型 |
| CC BY-NC-SA | ❌ | ✅ | ✅ | 禁商用 + 同许可 | 最受限的 CC 之一 |
| 研究专用 / upon request | 视协议 | 视协议 | 视协议 | 需申请 | 门槛最高 |
| 无明确许可 | ? | ? | ? | 默认保留一切权利 | 法律风险最高 |
BUS-BRA 落在表格第一行:允许商用、允许修改、允许再分发,唯一义务是署名。对需要训练商业模型(或闭源产品)的团队,这是最省心的许可档位之一;相比库内常见的"研究专用/CC BY-NC"数据集,BUS-BRA 的可商用属性是其 AI-Ready 得分的加分项。务必注意的是:“许可宽松"不等于"无需顾虑”——医学数据的合规(§1 Q13)与伦理(§1 Q14)是许可之外的独立约束。
6.5 AI-Ready 评估(DAIMS 检查)
以库内 AI-Ready 检查单(DAIMS 维度)过一遍 BUS-BRA:
| DAIMS 维度 | 评估 | 依据 |
|---|---|---|
| Data Availability(可获取性) | 优 | Zenodo 单链直下,无门禁、无注册,133.9 MB 轻量 |
| Annotation Quality(标注质量) | 良 | 三标注齐备且含活检金标准;但单标注者、二值掩膜、无一致性报告 |
| Integrity(完整性与一致性) | 中 | 官方折存在患者级泄漏(§4);良恶性双口径易混引(坑 1) |
| Metadata(元数据) | 良 | CSV 逐图字段清晰(BI-RADS/病理/组织学/患者标识),支持患者级操作 |
| Standardization(标准化与可比性) | 中偏优 | 有官方 5/10 折提升可比性,但划分缺陷削弱其效力 |
综合:AI-Ready 等级"中偏上"——可获取性、元数据、任务覆盖面高于同域均值;主要失分项是划分完整性与单标注者的质量不确定性。相对库内"请求制"条目(如 panda-plus 的掩码),BUS-BRA 的可获取性档位明显更友好。
6.6 可获取性光谱上的位置
| 档位 | 库内参照 | 本条目对应 |
|---|---|---|
| 注册墙(最严) | 部分挑战赛数据集 | — |
| 请求制 | panda-plus 掩码本体 | — |
| Registry 收录 | AWS Registry 型 | — |
| 平台托管直链 | Zenodo 型 | BUS-BRA(Zenodo,CC BY-4.0) |
| 公开直链 | HF/Zenodo 直链型 | BUS-BRA(同) |
BUS-BRA 落在"平台托管 + 公开直链"最宽松的两档:Zenodo 提供持久 DOI、版本管理、checksum(md5)与访问统计,CC BY-4.0 提供法律确定性。对需要"今天就能下、明天就能训、后天能商用"的研究与工程,这是最理想的一档。
§7 评估与基准
7.1 官方评估框架与指标
官方(论文)以 DeepLabV3+(ResNet18/50 骨干) 做语义分割、以对应特征做分类,在 5 折交叉验证下报告结果,实现依赖 Matlab 2022b。常报指标:分割用 Dice 系数(DSC)与交并比(IoU),分类用准确率/敏感度/特异度/AUC 等。
一处必须声明的局限:论文的官方具体指标数值未能从公开摘要逐表取得(Wiley 全文订阅墙)。因此本条目引用第三方复现值时明确标注为第三方口径;需要官方精确值时,应以论文正文表格为准(遗留疑点,§9)。
7.1b 分割与分类指标该怎么读
三个容易误读的指标细节:
- Dice(DSC)与 IoU 的关系:Dice = 2·|A∩B| / (|A|+|B|),IoU = |A∩B| / |A∪B|,二者单调相关但不等价(同一预测 Dice 约为 IoU 的换算上限更高)。报告时同一类指标内比较,不要拿 Dice 和 IoU 互比。BUS-BRA 上 Dice 82%–90% 对应 IoU 约 73%–83%,与公式关系一致。
- 小病灶放大误差:Dice/IoU 对病灶大小敏感——小结节的几个像素边界误差就能显著拉低分数。因此同一模型在不同数据集上的 Dice 不能直接比,除非病灶尺度分布相近。
- 分类须报敏感度:在恶性约 32% 的不平衡下,总体准确率会被良性主导(全预测良性即可~68%)。医学场景更关心**恶性召回(敏感度)**与 AUC,报告时应包含这些而非只有 accuracy。
7.2 第三方复现基线(用于标定位置)
以下均为基于 BUS-BRA 的第三方工作,用于说明"当前分数区间",非官方值:
| 工作 | 任务 | BUS-BRA 上表现 |
|---|---|---|
| Frontiers in Oncology 2025(doi:10.3389/fonc.2025.1672274) | 分割 | U-Net:Dice 82.10% / IoU 73.52%;DeepLabV3+:86.43% / 77.98%;SAM-VMamba 最高 90.25% / 82.54% |
| MDPI CMT-BUSNet(Diagnostics 16(8):1203) | 分割 | BUS-BRA 内训、BUSI 外验,报 DSC/IoU/HD95/Boundary IoU 逐折均值 |
| D-DDPM(扩散模型,2025) | 生成/分割 | 以 BUS-BRA 为训练集(尺寸大、样本多样),UDIAT 与 BrEaST 做外部验证 |
| BoostCNN(UMB 2026) | 分类 | BUS-BRA 训练,BUSI/BrEaST 外部验证 |
| 联邦学习(arXiv:2506.23334v2) | 良恶性二分类 | BUS-BRA + BUSI + UDIAT 三集联邦;BUS-BRA 取 1,268 良 / 607 恶 |
区间观察:分割 Dice 大致落在 82%–90%(U-Net 到 SAM-VMamba),这个区间对"二值病灶分割"是合理的高分区间——但也必须叠加 §4.4 的告诫:这些数字若在图像级划分下取得,带有泄漏水分;严格患者级划分下的可比基线应参考 PerceptGuide 修正后的 73.99%(分割)/ 77.10%(分类)。
7.3 修正前后的基准对照(本条目最重要的一组数字)
| 协议 | 分割 | 分类 | 来源 |
|---|---|---|---|
| 官方折(图像级互斥) | 88.27% | 86.92% | PerceptGuide 复现(修正前) |
| 患者级互斥(修正后) | 73.99% | 77.10% | PerceptGuide v1.0.1 |
| 差(水分) | −14.28 | −9.82 | — |
这组对照是 BUS-BRA 上一切指标引用前必须过的一道闸:报告某篇 BUS-BRA 论文的分数时,先问它的划分是图像级还是患者级。同一模型、同一数据,协议不同,分数可以差十几个点。
7.4 BUS-BRA 在跨数据集评测中的角色
第三方论文的常见范式是"BUS-BRA 训练 + BUSI/UDIAT/BrEaST 外部验证":BUS-BRA 因规模大、标注全、含标准折而被选为训练集;BUSI(埃及,780 图)、UDIAT(西班牙,163 图)、BrEaST(波兰,256 图)因来源独立而被选为外部验证集。这个范式的意义在于检验跨中心/跨设备泛化——而 BUS-BRA 自身 4 台扫描仪的多样性,也让"内部跨设备"与"外部跨中心"构成两层泛化测试。
7.5 与其他乳腺超声数据集的基准对照表
| 数据集 | 图数 | 论文/年份 | 常被用作 | 与本集关系 |
|---|---|---|---|---|
| BUS-BRA | 1,875 | Med Phys 2024 | 主训练集 / 评测台 | 本条目 |
| BUSI | 780 | 2018 | 外部验证 | 同模态、更小、无 BI-RADS |
| UDIAT | 163 | 2012 | 外部验证 | 同模态、最小 |
| BrEaST | 256 | 2019 | 外部验证 | 同模态、三标注但小 |
| BUS-UCLM | — | 西班牙 UCLM | 外部验证 | 同模态 |
一句话:在乳腺超声公开集里,BUS-BRA 是当前"规模 + 标注完整度"的标杆,第三方频繁称其为"最大的、同时提供分割掩膜+病理+BI-RADS 三标注的公开乳腺超声集"。它的基准价值不在"分数最高",而在"评测口径最全、最可比"。
7.6 建议的评测协议(面向复现者)
综合 §4 与本节,给出一套"可在论文里直接写"的 BUS-BRA 评测协议:
- 数据准备:下载
BUSBRA.zip,md5 校验,读 CSV,确认 1,875 行,建立 patient_id 索引。 - 划分:以 patient_id 为 group、pathology 为 stratify,做 10 折
StratifiedGroupKFold;落盘折索引;加载层断言患者级互斥。 - 内部评测:在患者级 10 折上报告 Dice/IoU(分割)与 敏感度/特异度/AUC(分类)的均值±标准差。
- 外部验证:在 BUSI(780 图)与 UDIAT(163 图)上零样本评估,报告外部指标;如需,注明 BrEaST(256 图)。
- 对照报告:若要与历史文献比,附加"官方折下的结果"一栏,并在表注写明两者划分差异——把水分显式暴露。
- 可复现交付:随论文发布折索引、预处理脚本与随机种子。
六步中第 2、5 步是 BUS-BRA 特有的必做项(源于其官方折的缺陷);其余为通用最佳实践。照此协议产出的数字,可与 PerceptGuide 的 73.99%/77.10% 直接对标,也经得起"划分是否患者级"的追问。
7.7 指标报告的常见伪影
三点会让 BUS-BRA 上的报告"看起来更好但不可比":
- 只报最优折:把 5/10 折里最好的一折当结果,忽略方差。应报均值±标准差。
- 只用 image-level accuracy:类不平衡下被良性主导。应补敏感度/AUC。
- 不区分内外部:把 BUS-BRA 内部指标与外部验证指标混在一张表里而不标注,读者无法判断泛化性。
把这三点写进论文的"评测规范"段,是 BUS-BRA 用户的基本素养。
7.8 与库内评测基准类条目的对照
BUS-BRA 在"评测基准"这一维度上,与库内其他基准类条目的共性与差异:
| 条目 | 基准形态 | 独特之处 | 与 BUS-BRA 的共性 |
|---|---|---|---|
| BUS-BRA | 三标注 + 官方标准折 | 划分泄漏的实证对象 | — |
| busi(539) | 三分类 + 掩膜 | 含"正常"类别 | 乳腺超声、可做外部验证 |
| brset(351) | 超声分割 | 同模态分割 | 超声 + 像素级标注 |
| cbis-ddsm(541) | 钼靶分类/检测 | 跨模态大字集 | 乳腺、公开、可直链 |
共性在于"公开 + 标注 + 可评测",差异在于 BUS-BRA 是其中唯一自带标准折、且标准折被审计出问题的条目。这让它在库内的角色有些特殊:既是被用的基准,也是被研究的方法学案例。
§8 生态与影响
8.1 出处谱系与作者群
BUS-BRA 的产出横跨巴西与墨西哥两个机构:
| 角色 | 姓名 | 机构 | ORCID |
|---|---|---|---|
| 通讯 / 一作 | Wilfrido Gómez-Flores | Cinvestav(墨西哥,IPN)Tamaulipas | 0000-0001-6758-6155 |
| 作者 | Maria Julia Gregorio-Calas | Universidade Estácio de Sá(巴西里约) | — |
| 作者 | Wagner Coelho de Albuquerque Pereira | PEB/COPPE, UFRJ(巴西里约) | 0000-0001-5880-3242 |
版权方/首席分发方是 PEB/COPPE-UFRJ(里约联邦大学生物医学工程计划),采集执行方是 INCA(巴西国家癌症研究所),Cinvestav 负责数据集与代码的持续开发。作者声明无利益冲突,未见专项资助声明。
8.2 生态位置:被谁用、怎么用
BUS-BRA 在发布后(2023-2024)迅速成为乳腺超声 CAD 论文的常用底座,第三方使用形态大致四类:
- 分割方法对比(Frontiers 2025 等):把 U-Net、DeepLabV3+、Transformer/Mamba 类模型放在 BUS-BRA 上比 Dice/IoU。
- 分类/联邦学习(arXiv:2506.23334v2 等):以 BUS-BRA 为主训练集,BUSI/UDIAT 为参与方,研究跨中心联邦。
- 生成式增强(D-DDPM 等):用扩散模型在 BUS-BRA 上做数据增强或生成,拿 UDIAT/BrEaST 做外部验证。
- 划分方法学(PerceptGuide、MDPI YOLO 等):把 BUS-BRA 当作"划分泄漏"的实证对象与修复范例。
第 4 类是本数据集最有意思的"意外用途":一个数据集的价值不止于被训练,还在于被审计。BUS-BRA 因规模足够大、又自带"图像级 vs 患者级"的可比划分,成了划分方法学研究的天然实验台。
8.2b 一个数据集的三层使用价值
把 BUS-BRA 的用途拆成三层,能看清它为何在发布后扩散得较快:
| 层 | 使用者要什么 | BUS-BRA 提供 | 典型工作 |
|---|---|---|---|
| 数据层 | 图 + 标签 | 1,875 图 + 三标注,直链 | 各类分割/分类论文 |
| 协议层 | 可比的划分 | 官方 5/10 折索引 | 需对齐文献的数字 |
| 方法层 | 可审计的对象 | 患者标识 + 已知泄漏 | 划分方法学、泄漏研究 |
多数数据集只到"数据层";BUS-BRA 因同时给了协议(标准折)与患者标识(可重划),把"协议层"与"方法层"也占了。这解释了为什么它既被当训练集,又被当方法学靶子——它在生态里的位置比"又一份超声数据"要复杂。
8.3 对乳腺超声 AI 生态的三点影响
- 抬高评测门槛:BUS-BRA 把"三标注 + 标准折"做成默认期待,后续数据集若只给良恶性标签会显得不够。
- 暴露普遍隐患:它的患者级泄漏并非孤例——许多医学数据集都有同类问题,BUS-BRA 的审计推动社区开始例行检查划分的患者级互斥。
- 提供修复范式:
StratifiedGroupKFold+ 断言的患者级重划流程,已被后续论文采纳为模板。
8.4 局限与未来方向
| 局限 | 现状 | 可能的改进方向 |
|---|---|---|
| 单标注者 | 一人完成掩膜 + BI-RADS | 多专家标注并报告一致性 |
| 患者级泄漏 | 官方折仅图像级互斥 | 发布修订版患者级划分索引 |
| 二值掩膜 | 不含类别 | 增加多类掩膜 |
| 组织学不完整 | 仅公开 Top-10 | 补全 28 类全表 |
| 类不平衡 | 恶性约 32%、BI-RADS 5 仅 8.4% | 提供分层采样/重加权参考 |
这些局限多属"可修复的工程问题",不涉及数据的根本缺陷。
8.5 引用它的论文都在做什么
从抓取到的第三方工作看,BUS-BRA 主要出现在四类研究的 Method 段:
- 分割论文:把 BUS-BRA 作为"带像素级真值的超声分割基准",与新方法(Transformer/Mamba/扩散)对比。
- 分类论文:作为"规模足够大、带 BI-RADS 的超声分类训练集",常配 BUSI 外部验证。
- 联邦/跨中心论文:作为多中心联邦学习的一方(BUS-BRA + BUSI + UDIAT)。
- 方法学论文:作为划分泄漏与修复的实证对象(PerceptGuide、MDPI YOLO)。
这四类合起来说明:BUS-BRA 的引用动机已从"我要数据"扩展到"我要一个可信的评测场景"——后者正是它标题里"for Assessing"的兑现。
8.6 与乳腺病理/钼靶数据集的互补关系
乳腺 AI 的完整版图横跨三种模态,BUS-BRA 是"超声"这一格的支柱:
| 模态 | 代表数据集(库内) | 与 BUS-BRA 的互补 |
|---|---|---|
| 超声(US) | BUS-BRA、busi(539)、brset(351) | 本集所在格 |
| 钼靶(Mammography) | cbis-ddsm(541)、inbreast(542)、vindr-mammo(543) | 不同模态、同解剖 |
| MRI | duke-breast-mri(440) | 不同模态 |
| 病理(Pathology) | breakhis(126)、bach(118)、breastpathq(268)、bcss(258) | 从影像到显微的终检环节 |
一个典型的多模态研究叙事是"超声筛查发现可疑 → 钼靶/MRI 进一步评估 → 病理确诊",BUS-BRA 落在这个链条的第一环(筛查),与库内病理类条目构成"从筛查到确诊"的对照谱系。这也是 §9.4 互链表的用意:让读者能从 BUS-BRA 出发,横向走到同模态(busi/brset)与跨模态(钼靶/病理)的相邻条目。
8.7 时间线
| 时间 | 事件 |
|---|---|
| 2023-01/02 | 概念 DOI(10.5281/zenodo.7730708)出现,数据集处于未发布态 |
| 2023-03-13 | Zenodo version 1.0 正式发布(10.5281/zenodo.8231412) |
| 2023-03-14 | GitHub 代码仓库(wgomezf/BUS-BRA)初始提交 |
| 2023-08-09 | 代码压缩包上传;Zenodo 记录创建 |
| 2023-11-08 | Medical Physics 论文在线先行(Early View) |
| 2024-04 | 论文正刊刊出(vol.51(4):3110-3123) |
| 2024-07-30 | GitHub README 更新 |
| 2024-09-25 | Zenodo 记录最后修改(revision 5) |
| 2025–2026 | 第三方大规模采用与划分审计(PerceptGuide 等) |
时间线显示:数据先于论文(2023-03 vs 2023-11),这在数据集型工作中属常见节奏——先把数据放出去,再用论文描述它。也正因数据先行,早期使用者可能基于"未配论文"的版本工作,引用时更需核对版本 DOI。
§9 与库内条目的关系
9.1 家族图谱(乳腺与超声两条线)
乳腺影像线:
- busi(rid 539):最直接对照——同模态乳腺超声、780 图、无 BI-RADS、无标准折。BUS-BRA 可视为"带 BI-RADS 与标准折、规模翻倍"的升级型;两者是并列数据集,非别名、非版本(坑 2 的核心)。
- cbis-ddsm(rid 541)、inbreast(rid 542)、vindr-mammo(rid 543)、swiss-mammo(rid 627)、tn-mammo-breast-density(rid 628):乳腺**钼靶(mammography)**家族——不同模态(X 线 vs 超声)的对照。
- duke-breast-mri(rid 440):乳腺 MRI——不同模态对照。
- breastpathq(rid 268)、breakhis(rid 126)、bach(rid 118)、bcss(rid 258):乳腺病理家族——从影像到显微的跨尺度对照。
- brset(rid 351):乳腺超声分割——最接近的同模态近亲。
超声模态线:
- us-nerve-seg(rid 537):超声神经分割——同成像模态(超声)、不同解剖域,可用于讨论超声域的通用性质。
- mass(rid 272):乳腺相关影像集合。
9.1b 与其他乳腺超声数据集的细分对照
把 BUS-BRA 放进乳腺超声(BUS)这个子域,与三个常被一起提及的集对照:
| 维度 | BUS-BRA | BUSI | UDIAT | BrEaST |
|---|---|---|---|---|
| 国家/机构 | 巴西 INCA | 埃及 Baheya | 西班牙 Parc Taulí | 波兰 |
| 年份 | 2023 | 2018 | 2012 | 2019 |
| 图像数 | 1,875 | 780 | 163 | 256 |
| 患者数 | 1,064 | 600 | — | — |
| 类别体系 | 良/恶 + BI-RADS 2–5 | 正常/良性/恶性 | 良/恶 | 良/恶 + BI-RADS |
| 分割掩膜 | 二值 | 三分类标注 | 有无病灶 | 有 |
| 官方标准折 | 有(5/10 折) | 无 | 无 | 无 |
| 许可 | CC BY-4.0 | 见来源 | 见来源 | 见来源 |
| 常被用作 | 主训练集 | 外部验证 | 外部验证 | 外部验证 |
读法:BUS-BRA 在"规模 + 标注维度 + 标准折 + 许可"四项上都占优,唯一不占优的是"正常"类别(BUSI 有、BUS-BRA 无——因为它只收含病灶的图,§2.7)。这解释了为何跨数据集实验普遍以 BUS-BRA 为训练轴心。
9.2 检索路径建议
- 精确检索词:“BUS-BRA”(连字符)+ “breast ultrasound” + “BI-RADS”;勿把它与 “BUSI” 混检(坑 2)。
- 目标为直接可用数据:Zenodo
records/8231412→BUSBRA.zip(CC BY-4.0)→ 代码github.com/wgomezf/BUS-BRA。 - 目标为可信评测:先读 §4 划分泄漏 → 自建患者级折 → 与 PerceptGuide 修正值(73.99%/77.10%)对标 → 再引用文献分数并标注协议。
- 目标为跨数据集泛化:BUS-BRA 训练 + BUSI/UDIAT/BrEaST 外部验证。
9.3 引用规范
引用 BUS-BRA 数据须同时引:Gómez-Flores W, Gregorio-Calas MJ, Coelho de Albuquerque Pereira W. “BUS-BRA: A breast ultrasound dataset for assessing computer-aided diagnosis systems.” Medical Physics, 2024;51(4):3110-3123. DOI 10.1002/mp.16812,并注明数据 DOI 10.5281/zenodo.8231412 与许可 CC BY-4.0。
9.4 库内互链速查
| 库内条目 | rid | 与 BUS-BRA 的关系 | 建议互链理由 |
|---|---|---|---|
| busi | 539 | 同模态乳腺超声(仅 780 图、无 BI-RADS) | 首选互链,需明写区别 |
| brset | 351 | 同模态乳腺超声分割 | 同任务近亲 |
| cbis-ddsm | 541 | 乳腺钼靶 | 跨模态对照 |
| inbreast | 542 | 乳腺钼靶数字库 | 跨模态对照 |
| vindr-mammo | 543 | 乳腺钼靶(越南) | 跨模态对照 |
| swiss-mammo | 627 | 乳腺钼靶 | 跨模态对照 |
| tn-mammo-breast-density | 628 | 乳腺钼靶密度 | 跨模态对照 |
| duke-breast-mri | 440 | 乳腺 MRI | 跨模态对照 |
| breastpathq | 268 | 乳腺病理 WSI | 跨尺度对照 |
| breakhis | 126 | 乳腺病理显微 | 跨尺度对照 |
| bach | 118 | 乳腺病理显微 | 跨尺度对照 |
| bcss | 258 | 乳腺细胞分割 | 跨尺度对照 |
| us-nerve-seg | 537 | 超声神经分割 | 同模态不同域 |
| mass | 272 | 乳腺影像集合 | 同域 |
互链策略:busi(539)与 brset(351)为强链(同模态、同任务,读者最可能横向比较);其余乳腺影像与病理条目为弱链(跨模态/跨尺度背景)。所有 rid 均以 DB url_name 反查核验,未使用位置对齐。
9.5 互链一句话理由
| 目标条目 | rid | 一句话理由 |
|---|---|---|
| busi | 539 | “同是乳腺超声,BUS-BRA 是它的带 BI-RADS 放大版” |
| brset | 351 | “同做乳腺超声分割,可对比掩膜风格” |
| cbis-ddsm | 541 | “同是乳腺公开集,钼靶 vs 超声” |
| inbreast | 542 | “钼靶数字库,跨模态参照” |
| breastpathq | 268 | “从超声筛查到病理确诊的下游环节” |
§10 避坑清单:十个已踩过的坑
坑 1:良恶性计数有病例级 / 图级两套口径,混引即错。论文摘要与 Zenodo 的"722 良性 / 342 恶性"是病例(肿瘤)级(合计 1,064);第三方重算的"1,268 良性 / 607 恶性"是图像级(合计 1,875)。二者不矛盾但层级不同——用错口径会导致占比、类权重、基线全线偏移。引用时必须写明是病例级还是图级。
坑 2:“BUS-BRA” ≠ “BUSI”,不是别名也不是版本。BUSI 是埃及 Baheya 医院 2018 年的 600 患者 / 780 图数据集,无 BI-RADS、无标准折;BUS-BRA 是巴西 INCA 的 1,064 患者 / 1,875 图数据集,含 BI-RADS 与 5/10 折。检索与引用务必区分,切忌互相张冠李戴(本库已有 busi 条目 rid 539,两者应为互链而非合并)。
坑 3:BI-RADS 逐类计数与组织学 Top-10 均出自第三方,非官方。562/463/693/157 这组 BI-RADS 分布与 Top-10 组织学表都来自第三方论文(BUSTR、Brunel),BUS-BRA 官方文档只说"categories 2, 3, 4, and 5",未给逐类表;28 类组织学也仅公开 Top-10。引用时标注口径来源,勿写成"官方数字"。
坑 4:许可冲突——以 Zenodo 官方 CC BY-4.0 为准。第三方聚合站 SonoDQS 把 BUS-BRA 标为 GPL-3.0(软件许可、含传染性 copyleft),与 Zenodo 官方的 CC BY-4.0 冲突。误按 GPL 理解会错判"能否商用/能否闭源衍生"。一律以 Zenodo 记录页徽标与 API license.id = cc-by-4.0 为准。
坑 5:官方标准折不是患者级互斥——存在数据泄漏。官方折只保证图像级互斥;同患者多图可跨折。这是本条目最需要广而告之的坑:直接引用 BUS-BRA 上的高分(如 88%+ 分割)前,先确认划分协议;严格患者级下可比基线会低十几个点(73.99% / 77.10%)。
坑 6:原图含设备叠加伪影,预处理要截断。B 模式原图带厂商叠加的文字、标尺、增益条等,第三方预处理常以 1/99 百分位强度截断抑制,避免模型学到这些"非解剖"线索。直接用原图训练而不处理,可能让模型过拟合到设备指纹。
坑 7:单标注者、无观察者间一致性报告。掩膜与 BI-RADS 均出自一人,没有多专家对照,因此标签可靠性带个体偏差、无法量化解剖层面的不确定性。报告指标时说明这一上限,不要把 BUS-BRA 的真值当作"生物学only真值"。
坑 8:掩膜是二值的,类别信息不在掩膜里。掩膜只区分肿瘤/正常,做多类分割必须从 CSV 元数据取病理/组织学,且只能在病灶级近似关联。误把掩膜当多类掩膜会得到错误的分割监督。
坑 9:论文在线年与卷期年双口径。论文 2023-11-08 在线先行(Early View),卷期归属 2024(vol.51(4):3110-3123)。第三方引用有写 2023 的、有写 2024 的——本条目统一按正刊 2024,并注明在线 2023-11。
坑 10:实现语言是 Matlab,别假设有官方 PyTorch 代码。官方框架为 Matlab 2022b(DeepLabV3+)。Python 使用者需自行复现或搭管线;官方给的是数据与协议,不是即插即用的 Python 训练脚本。
10.1 使用前自检单
把上面前十个坑压缩成一份开工前检查单:
| # | 检查项 | 通过标准 |
|---|---|---|
| 1 | 良恶性数字口径 | 明写"病例级"或"图像级" |
| 2 | 数据集身份 | 确认是 BUS-BRA 而非 BUSI |
| 3 | BI-RADS/组织学来源 | 标注"第三方口径" |
| 4 | 许可 | 以 Zenodo 的 CC BY-4.0 为准 |
| 5 | 划分协议 | 患者级互斥 + 断言 |
| 6 | 伪影处理 | 已做强度截断 |
| 7 | 标注者局限 | 报告中说明单标注者 |
| 8 | 掩膜类型 | 二值;类别从 CSV 取 |
| 9 | 论文年份 | 统一为 2024(正刊) |
| 10 | 代码语言 | 预期 Matlab,非 PyTorch |
十项全过,才能说"这份 BUS-BRA 结果可提交/可对比"。
10.2 坑点的三组归类
十个坑可归为三组,便于记忆与排查:
| 组别 | 涉及坑 | 本质 | 防范动作 |
|---|---|---|---|
| 口径类 | 坑 1、坑 3、坑 9 | 同一事实有多个层面的数字/年份 | 引用时写明层级与来源 |
| 身份类 | 坑 2、坑 4 | 数据集身份或许可被误认 | 以官方 Zenodo 为准核对 |
| 协议类 | 坑 5、坑 6、坑 7、坑 8、坑 10 | 划分/预处理/标注/代码的实践陷阱 | 患者级划分 + 标准化预处理 |
三组中协议类最危险——它会直接改变模型指标,且往往在使用者毫无察觉时发生(因为代码能跑通、数字也"好看")。口径类与身份类则主要影响文献可比性与合规性。按这个分组做自查,比逐条记忆十个坑更高效。
§11 总结
BUS-BRA 把乳腺超声 CAD 评测里长期分散的四件东西——活检证实的病理、专家的 BI-RADS 分级、手工的分割掩膜、官方的标准折——一次性绑到同一批 1,875 张图上,并以 CC BY-4.0 + Zenodo 单链的方式零门槛公开。它因此成为当前乳腺超声公开集里"规模最大、标注最全、最易获取"的标杆,也是第三方跨中心研究首选的主训练集。
但它同时是一面镜子:它引以为傲的标准折被第三方审计出只做到图像级互斥、未做到患者级互斥,构成数据泄漏;修正为患者级后,分割指标从 88.27% 跌到 73.99%、分类从 86.92% 跌到 77.10%。这十几点的落差,比任何论文的增长曲线都更值得记住——它提醒每一位使用者:先问划分,再看分数。
对使用者的三条落地建议:
- 数据获取零障碍:Zenodo
records/8231412直下BUSBRA.zip,署名 + 引用论文即可用,含商用。 - 评测必须患者级:不要默认官方折安全;用患者标识做
StratifiedGroupKFold并加断言,与修正基线(73.99% / 77.10%)对标。 - 口径必须标明:良恶性写清病例级还是图级,BI-RADS/组织学标注第三方来源,许可一律以 Zenodo 为准。
BUS-BRA 的价值不在于它"分数最高",而在于它把可获取性、标注完整度与评测诚实度三件事同时摆上台面——包括它自身划分协议的那道疤。一个愿意被审计、也经得起被审计的数据集,才是真正"AI-Ready"的数据集。
§12 附录:数据字典、术语与来源
12.1 术语表(首现英文对照)
| 缩略/术语 | 英文全称 | 中文释义 |
|---|---|---|
| BUS | Breast UltraSound | 乳腺超声 |
| BRA | Brazil | 巴西(数据集命名来源) |
| CAD | Computer-Aided Diagnosis | 计算机辅助诊断 |
| BI-RADS | Breast Imaging-Reporting and Data System | 乳腺影像报告与数据系统 |
| B-mode | Brightness mode | B 模式(灰阶)超声 |
| ROI | Region of Interest | 感兴趣区(病灶区域) |
| DSC/Dice | Dice Similarity Coefficient | Dice 相似系数 |
| IoU | Intersection over Union | 交并比 |
| HD95 | 95th percentile Hausdorff Distance | 95 分位豪斯多夫距离 |
| IDC | Invasive Ductal Carcinoma | 浸润性导管癌 |
| ILC | Invasive Lobular Carcinoma | 浸润性小叶癌 |
| WSI | Whole Slide Image | 全切片图像(乳腺病理对照,非本集) |
| INCA | Instituto Nacional de Câncer | 巴西国家癌症研究所 |
| PEB | Programa de Engenharia Biomédica | 生物医学工程计划 |
| COPPE | — | UFRJ 研究生院与研究中心(工程) |
| UFRJ | Universidade Federal do Rio de Janeiro | 里约热内卢联邦大学 |
| Cinvestav | Centro de Investigación y de Estudios Avanzados del IPN | 墨西哥国立理工学院高级研究中心 |
| ACR | American College of Radiology | 美国放射学会(BI-RADS 制定方) |
12.2 数据字典(CSV 主要字段)
| 字段(示意名) | 类型 | 含义 | 取值/说明 |
|---|---|---|---|
| image_id | 字符串 | 图像唯一标识 | 关联 PNG 图与掩膜 |
| patient_id | 字符串 | 患者标识 | 划分分组键(§4.7) |
| pathology | 类别 | 病理结果 | benign / malignant |
| birads | 序数 | BI-RADS 分级 | 2 / 3 / 4 / 5 |
| histology | 类别 | 组织学类型 | 28 类之一 |
| label/mask | 路径 | 掩膜文件引用 | 二值 PNG |
说明:字段名以数据集实际 CSV 为准,上表为语义整理(第三方论文中沿用的字段含义)。核心是 patient_id 必须被使用——它是患者级划分的全部依据。
12.3 复现记录(本条目核验过程)
| 步骤 | 动作 | 结果 |
|---|---|---|
| 存在性核验 | Zenodo API 抓取 records/8231412 |
存在,CC BY-4.0,BUSBRA.zip 133.9MB |
| 论文核验 | Medical Physics 2024 / ADS 摘要 | 存在,DOI 10.1002/mp.16812 |
| 代码核验 | github.com/wgomezf/BUS-BRA | 存在,Matlab 框架 |
| 数字三源互证 | Zenodo/GitHub/论文 | 1,064/1,875/722/342 逐字一致 |
| 图级数字核验 | 第三方(BUSTR/Brunel 等) | 1,268/607、BI-RADS 逐类、组织学 Top-10 |
| 泄漏核验 | PerceptGuide v1.0.1 发布说明 | 修正 88.27→73.99、86.92→77.10 |
| 查重 | DB url_name ILIKE ‘%bus%’ | 仅命中 busi(539);无 bus-bra |
| 库内互链 | DB url_name 反查 rid | busi 539 / brset 351 等(§9.4) |
12.4 来源清单(URL)
- 一手:
https://zenodo.org/records/8231412;https://zenodo.org/api/records/8231412;https://doi.org/10.1002/mp.16812;https://github.com/wgomezf/BUS-BRA。 - 论文摘要复本:ADS
https://ui.adsabs.harvard.edu/abs/2024MedPh..51.3110G/abstract;Wileyhttps://onlinelibrary.wiley.com/doi/full/10.1002/mp.16812。 - 第三方(图级数字 / BI-RADS / 组织学 / 划分审计):arXiv:2506.23334v2;arXiv:2511.20956(BUSTR);UMB BoostCNN;
https://doi.org/10.3389/fonc.2025.1672274(Frontiers);MDPI CMT-BUSNet(Diagnostics 16(8):1203);MDPI YOLO(2813-477X/4/3/28);Brunel 全文 PDF;PerceptGuide v1.0.1 发布说明。 - 许可冲突存照:
https://ultrasound-open-access.nidusai.ca/(SonoDQS,标 GPL-3.0)。
12.5 待核与遗留疑点
| # | 疑点 | 现状 | 处理 |
|---|---|---|---|
| 1 | 官方分割/分类精确指标 | Wiley 订阅墙,摘要未给逐表 | 引第三方并标注 |
| 2 | "722/342"为病例级还是肿瘤级 | 摘要未明确 | 按"活检肿瘤病例"字面处理 |
| 3 | 725/345 患者口径(BoostCNN)与 1,064 不符 | 725+345=1,070≠1,064 | 存照,疑为另一算法 |
| 4 | 官方逐折患者/图计数 | 未公开 | 存照 |
| 5 | 图像尺寸统一值 | “随图而异” | 需下载实测 |
| 6 | 组织学余 18 类 | 仅 Top-10 公开 | 存照 |
| 7 | 原图伪影种类与比例 | 仅知需截断 | 存照 |
以上疑点不影响主线结论,但属"引用时需注明"的边界。BUS-BRA 是一份高质量、可直链、标注齐全的数据集;使用者只要把**口径(病例级/图级)、协议(患者级划分)、许可(CC BY-4.0)**三件事记牢,就能安全、可复现地使用它。
12.6 一句话记忆卡
给需要快速回忆的读者:
BUS-BRA = 巴西 1,064 患者 / 1,875 张乳腺超声 + 病理 + BI-RADS 2–5 + 分割掩膜 + 5/10 折,Zenodo 单链 CC BY-4.0;用之前先做患者级划分——官方折有泄漏。
四要素:规模(1,875)· 三标注(病理/BI-RADS/掩膜)· 官方折(有但需修正)· 许可(CC BY-4.0)。
12.7 本条目编制说明
- 本条目依据千方病案医数集 AI-Ready Wikipedia 规范编制,事实以三源互证为准:Zenodo 官方记录(一手)、Medical Physics 2024 论文(摘要复本)、GitHub 仓库,辅以多篇第三方论文作为图级数字与审计证据来源。
- 所有与官方口径存在出入之处(良恶性计数、BI-RADS 逐类、许可冲突、划分泄漏)均已逐条存照并在正文标注来源层级。
- 正文以中文为主,术语首现标英文;URL 占位统一为
https://www.qianfanghub.com/ai-ready-dataset/bus-bra/760。 - 条目不代表对数据集的推荐或背书,仅为面向 AI 就绪度的信息整理。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- busi — 共享标签:医学影像 / 乳腺影像 / 医学图像分割 / 图像分类 / 乳腺癌
- inbreast — 共享标签:医学影像 / 乳腺影像 / 医学图像分割 / 图像分类 / 乳腺癌
- udiat — 共享标签:医学影像 / 乳腺影像 / 医学图像分割 / 图像分类 / 乳腺癌
- oasbud — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 评测基准
- cbis-ddsm — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
- cmmd — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
- hyperkvasir — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 评测基准
- bach — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
- panda-plus — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 评测基准
- odelia — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

