信息速览
UDIAT (udiat) — 乳腺 B 型超声病灶检测与良恶性分类数据集
一句话定义:UDIAT Breast Ultrasound Dataset B 是 2012 年采集于西班牙巴塞罗那都会圈 Sabadell 市 Parc Taulí 医院 UDIAT 诊断中心的 163 张乳腺 B 型超声(B-mode)图像(110 张良性 / 53 张恶性),每张均配一位放射科医师手工描边的病灶分割掩码,由 Manchester Metropolitan University(MMU)Moi Hoon Yap 课题组联合西班牙团队于 2017 年在 IEEE Journal of Biomedical and Health Informatics 上公开,通过签署许可协议请求获取。
| 项目 | 内容 |
|---|---|
| 正选 slug | udiat |
| 全称 | UDIAT Breast Ultrasound Dataset B |
| 文献别名 | Dataset B、UDIAT dataset、UDIAT-B |
| 本质 | 乳腺 B-mode 超声静态单帧图像 + 病灶专家描边 + 良恶性二分类标签 |
| 图像总数 | 163 张(每张来自不同女性) |
| 类别分布 | 110 良性 / 53 恶性(恶性占比约 32.5%) |
| 图像尺寸 | 均值约 760 × 570 px(各张不一,非统一分辨率) |
| 设备 | Siemens ACUSON Sequoia C512 + 17L5 HD 线阵探头(8.5 MHz) |
| 采集时间 / 地点 | 2012 年 / 西班牙 Sabadell,Parc Taulí 医院 UDIAT 诊断中心 |
| 标注 | 放射科医师手工描边病灶轮廓(像素级掩码) |
| 核心任务 | 病灶检测 / 良恶性分类 / 像素级分割 |
| 公开年 | 2017(在线)/ 2018(IEEE JBHI 22 卷 4 期) |
| 获取方式 | 请求制:机构邮箱 + 授权代表批准 + 签署 Licence Agreement,审批最长 10 个工作日 |
| 许可性质 | 研究用途专有许可,非 CC 开放许可,禁止二次分发 |
| 官方入口 | MMU Moi Hoon Yap 数据集页 |
| 通用任务 | 乳腺超声 AI 的低资源基准、自监督/对比学习预训练下游、合成数据评估 |
| 库内互链 | busi(539)、camus(533)、echonet-dynamic(526)、echonet-lvh(530)、ddti(536)、maternal-ultrasound-nutrition(615) 等 |
§0 导读
如果你只读三段话,请读这三段。
第一段:它是什么。 UDIAT 是目前乳腺超声人工智能研究中被引用最多的小型公共数据集之一。它由 163 张 B 型超声(灰度、二维、静态单帧)图像组成,每一张都来自一位不同的女性,每一张都包含至少一个病灶,并且每一张都配有一位经验丰富的放射科医师逐像素手工描边的病灶掩码。其中 110 张为良性,53 张为恶性。图像于 2012 年采集自西班牙加泰罗尼亚地区 Sabadell 市的 Parc Taulí 综合医院 UDIAT 诊断中心,使用 Siemens ACUSON Sequoia C512 超声系统配合 17L5 HD 线阵探头(8.5 MHz)。
第二段:它为什么重要。 2017 年,Manchester Metropolitan University 的 Moi Hoon Yap 团队联合 Parc Taulí 临床方与 University of Girona 在 IEEE Journal of Biomedical and Health Informatics(IEEE JBHI)发表了 “Automated Breast Ultrasound Lesions Detection using Convolutional Neural Networks” 一文。该论文的公开动机非常明确:乳腺超声领域当时严重缺乏公共数据集,导致不同算法之间无法横向比较。论文公开了 Dataset B(即 UDIAT,163 张)用于研究目的,并同时对比了另一份 Dataset A(306 张,2001 年的商业化教学文件)。这份数据集的出现,让乳腺超声的检测、分类与分割研究第一次有了一个可复现、有专家标注意义上可对齐的公共参照。
第三段:用它的三个前提。 第一,它是请求制许可——你需要用机构邮箱提交许可协议、由所在机构的授权代表批准,审批最长 10 个工作日;它不是可以直接下载的 CC 开放数据。第二,它非常小——163 张、单中心、单机型,且没有官方 train/val/test 划分,因此跨论文的数值不可直接横比。第三,它极易与 OASBUD 被混淆——文献常把这两份"乳腺超声公共数据集"并列引用,但 UDIAT 是西班牙的 163 张 B-mode 静态图(请求制),而 OASBUD 是波兰华沙的 200 条原始射频(raw RF)信号(Zenodo 开放,CC 4.0),两者在模态、规模、许可上完全不同,必须按官方元数据严格区分。
本条目的一条纪律:所有涉及镜像、Kaggle 转载、社区二次分发的下载链接,均不作为本数据集的权威来源。唯一权威入口是 MMU 的官方页与许可协议。任何把 UDIAT 写成"公开可自由下载"的表述都是错误的。
§0.1 本条目阅读路线图
本条目约 1400+ 行,为不同读者提供三条路线:
路线 A——快速了解(10 分钟):读 §0 导读 → §0.1 本节 → §1 十问十答 → §11 总结的三句话与 30 秒决策卡。这条路线回答"UDIAT 是什么、能不能用、怎么用"。
路线 B——数据选型(30 分钟):在路线 A 基础上,加读 §2 数据构成与规格 → §4 辨析(UDIAT vs OASBUD/Dataset A/BUSI)→ §6 获取与许可 → 附录 B DAIMS 评估 → 附录 D 数据获取决策树。这条路线服务于"我该选哪份乳腺超声数据"。
路线 C——深度研究(完整):通读 §0-§11,重点看 §3 标注流水线、§5 衍生基准、§8 方法学启示、§10 避坑清单、附录 C 逐项证据链。这条路线服务于要写论文、做复现或做数据卡片的研究者。
阅读时请始终记住三句话:图像不是信号(区分 OASBUD);请求制不是开放(许可门槛);无官方划分(数值不可横比)。这三条贯穿全条目。
§1 十问十答
Q1:UDIAT 和"Dataset B"是同一份东西吗?
是。UDIAT Breast Ultrasound Dataset B 在 Yap et al. 2017 论文中被称为 Dataset B;社区与后续文献多直接称其为 UDIAT 或 UDIAT-B。"UDIAT"本身是机构名缩写——Unitat de Diagnòstic per la Imatge d’Alt Taulí(Parc Taulí 高诊断影像单元,加泰罗尼亚语),因为数据由该中心提供,所以数据集以机构命名。首次出现时应说明三者的等价关系。
Q2:到底有多少张图、多少良性多少恶性?
163 张,其中 110 张良性、53 张恶性(恶性约 32.5%)。这是 Yap et al. 2017 原文、IEEE Xplore 页面、PubMed 摘要与 MMU 官方页一致支持的主流口径。需要存照的是:个别衍生论文(如 DAU-Net,PMC11142567)写的是 109 良性 / 54 恶性,与主流口径相差 1 张。本条目以 110/53 为准,并在正文中显式标注这一罕见的口径出入。
Q3:这 163 张图是 163 个病人吗?
论文口径是"163 images from different women",即每张图像来自一位不同的女性。请注意区分"图像数"与"病灶数"——每张图像可能包含一个或多个病灶,因此 163 是图像计数,不是病灶计数。
Q4:图像是什么模态?多大?
B 型超声(B-mode),二维灰度,静态单帧。图像尺寸不统一,均值约 760 × 570 px,因此深度学习预处理时通常需要 resize 或 padding。设备为 Siemens ACUSON Sequoia C512 超声系统配 17L5 HD 线阵探头(linear array,8.5 MHz)。
Q5:有标注吗?标注是什么形式?
有,而且质量较高。每张图像都配有一个像素级病灶掩码(segmentation mask),由经验丰富的放射科医师手工描边(原文口径:“lesions were delineated by experienced radiologists”)——不是众包标注。良恶性标签则用于分类任务。下载包中还包含一个 DatasetB.xlsx 元数据表。
Q6:它支持哪些任务?
三类:(一)分类——病灶良恶性二分类;(二)检测/定位——病灶检测与定位(bounding box / region proposal);(三)分割——像素级病灶分割。由于自带专家掩码,它同时服务检测和分割,这在小型医学数据集里是比较少见的组合。
Q7:它和 BUSI 是什么关系?
两者都是乳腺超声数据集,经常被并列引用,但差异明显。BUSI(Baheya 医院,埃及)有 780 张图,是三分类(benign / malignant / normal),规模更大、含正常类;UDIAT 是 163 张、二分类、西班牙、请求制。在本库中,busi(539) 是 UDIAT 最直接的对照条目。
Q8:它和 OASBUD 是同一份数据吗?
不是,必须严格区分。 UDIAT 是西班牙的 163 张 B-mode 静态图像(请求制许可);OASBUD 是波兰华沙的 200 条原始射频(raw RF)超声信号(100 个病灶 × 2 个正交扫描),52 恶 + 48 良,来自 78 名女性,2013–2015 年采集,Zenodo 开放(CC 4.0)。两者在信号形态、机构、国家、年份、许可上全都不同,只是文献常把它们并列为"乳腺超声公共数据集"。
Q9:下载许可怎么拿?
三步:(1) 填写 Breast Ultrasound Dataset B 的 Licence Agreement;(2) 必须使用机构邮箱(institutional email)提交;(3) 必须由所在大学/机构的授权代表(authorised representative / Supervisor / Professor)批准。没有授权代表的申请会被自动拒绝。提交入口为页面内嵌的 Microsoft Forms,审批最长 10 个工作日,批准后发送下载信息。协议文件为 BUS_ReleaseAgreement.pdf。
Q10:它是 CC 许可吗?能再分发吗?
不是 CC 许可,不能随意再分发。 它是研究用途专有许可(research purposes,需签署协议)。写条目、写论文时不可将其标注为 CC BY 或任何 CC 系列许可;任何"公开可自由下载"的镜像(如 Kaggle 上的社区转载)都不是权威来源,且许可与完整性存疑。
§1.1 一屏速览:UDIAT 数字卡片
| 数字 | 含义 | 备注 |
|---|---|---|
| 163 | 图像总数 | 每张来自不同女性 |
| 110 | 良性图像数 | 67.5% |
| 53 | 恶性图像数 | 32.5%(主流口径) |
| 32.5% | 恶性占比 | 注意不代表筛查人群 |
| 760×570 | 平均图像尺寸(px) | 各张尺寸不统一 |
| 8.5 MHz | 探头频率 | 17L5 HD 线阵 |
| 2012 | 采集年份 | 公开于 2017/2018 |
| 10 | 审批最长工作日 | 请求制 |
| 22(4):1218-1226 | 论文卷期页码 | IEEE JBHI |
| 28796627 | PMID | DOI 10.1109/JBHI.2017.2731873 |
三个"不等于":163 张 ≠ 163 个病灶(每张可含多个病灶);110/53 ≠ 唯一口径(另有 109/54);请求制 ≠ 开放获取。
§2 数据构成与规格
2.1 总量与类别分布
UDIAT Breast Ultrasound Dataset B 的规模可以用两句话说完:163 张图像,110 张良性,53 张恶性。 malignancy 占比约 32.5%,属于典型的类别不均衡但未极端失衡的分布(约 2:1)。论文对每一张图像的来源表述是 “163 images from different women”,因此在图像层面,可以近似认为每张图对应一位不同女性。
必须强调"近似"二字。论文并未逐一公布每位女性的年龄、病史或随访信息,公开渠道也没有病人级别的详细人口学表。因此做病人级分析(如按年龄分层)时,本数据集能提供的支撑非常有限。
| 类别 | 图像数 | 占比 |
|---|---|---|
| 良性(benign) | 110 | 67.5% |
| 恶性(malignant) | 53 | 32.5% |
| 合计 | 163 | 100% |
口径存照:绝大多数权威来源(Yap et al. 2017 原文、IEEE Xplore、PubMed 摘要、MMU 官方页)一致给出 110 / 53。极少数衍生文献(如 DAU-Net,PMC11142567)给出 109 / 54,与主流相差 1 张。本条目以主流 110/53 为准,此处显式存照,供读者在跨文献比对时警觉。
2.2 病灶亚型细分
Yap et al. 2017 对 Dataset B 的病灶给出了比"良性/恶性"更细一层的组织学分类。这是 UDIAT 相对许多同类小型数据集的一个信息优势——它不止给二分类标签,还给出了亚型构成。
恶性 53 张的构成:
| 亚型 | 英文 | 数量 |
|---|---|---|
| 浸润性导管癌 | invasive ductal carcinoma (IDC) | 40 |
| 导管原位癌 | ductal carcinoma in situ (DCIS) | 4 |
| 浸润性小叶癌 | invasive lobular carcinoma (ILC) | 2 |
| 其他未明恶性 | other / unspecified malignant | 7 |
| 合计 | 53 |
良性 110 张的构成:
| 亚型 | 英文 | 数量 |
|---|---|---|
| 囊肿 | cysts | 65 |
| 纤维腺瘤 | fibroadenoma | 39 |
| 其他良性 | other benign | 6 |
| 合计 | 110 |
这一细分极具实用价值。恶性子类中 IDC 占 40/53(约 75%),说明恶性侧以最常见的浸润性导管癌为主,DCIS(原位癌)与 ILC(小叶癌)属于少数类。做亚型分类或做"少见癌型识别"研究时,DCIS 与 ILC 的样本量(各 4 张、2 张)远不足以支撑独立训练,只能作为定性观察或并入总类的代价。良性侧则以**囊肿(65 张)与纤维腺瘤(39 张)**为主——这两个恰好是乳腺超声中最常见、也最需要与恶性病灶鉴别诊断的良性病变,因此数据集的良性侧在"临床鉴别价值"上是合理的。
2.3 图像规格与采集设备
| 规格项 | 值 | 说明 |
|---|---|---|
| 模态 | B-mode 超声 | 二维灰度,非弹性、非多普勒、非造影 |
| 维度 | 2D 静态单帧 | 不含时间序列(不是 cine / 动态) |
| 平均尺寸 | 约 760 × 570 px | 各张尺寸不统一 |
| 位深/色彩 | 灰度(PNG) | 原始格式为 PNG |
| 设备 | Siemens ACUSON Sequoia C512 | 单一机型 |
| 探头 | 17L5 HD 线阵探头 | 频率 8.5 MHz |
| 采集时间 | 2012 年 | 同年同期单中心采集 |
| 采集地点 | UDIAT Diagnostic Centre, Parc Taulí | Sabadell, Spain |
这里有三个必须记住的工程后果。
第一,尺寸不统一。 均值 760×570 px 只是统计均值,各张图像分辨率不同。任何深度学习流程都必须在预处理阶段做 resize(或固定尺寸 crop/padding)。直接 batching 会失败,而不同的 resize 策略(拉伸 vs 等比填充)会显著影响分割 Dice——这是复现他人结果时常见的第一号差异来源。
第二,单中心单机型。 全部图像来自同一家医院、同一台设备、同一个探头,甚至很可能来自同一批操作规范。这意味着数据集的域偏移(domain shift)风险很低但泛化性证据很弱**:在 UDIAT 上训练并在 UDIAT 上测试会显得性能良好,但这不能证明模型能迁移到其他厂商、其他探头、其他人群。跨中心验证是本数据集最明显的短板。
第三,线阵探头 + 8.5 MHz 的成像特性。 17L5 HD 是高频线阵探头,适合浅表组织(乳腺正好属于浅表)。这决定了图像的空间分辨率与穿透深度特性——高频换能器分辨率高、穿透浅,因此图像中的深部结构信噪比可能较低。评估一个模型在 UDIAT 上的分割边界精度时,这一物理限制会影响"标注边界本身的不确定性"。
2.4 下载包结构与元数据表
申请获批后,下载包的组织结构如下:
<下载包根目录>/
├── GT/ # ground-truth 掩码(专家描边病灶轮廓)
│ └── *.png
├── original/ # 原始 B-mode 超声图像
│ └── *.png
└── DatasetB.xlsx # 元数据/标签表
original/:163 张原始灰度超声图像。GT/:与每张原图对应的病灶分割掩码(ground truth)。以图像文件名匹配。DatasetB.xlsx:图像级元数据表,包含标签等信息。
待核:
DatasetB.xlsx的列结构与正式字段定义缺少公开权威 schema。原始文件只在获批后才能获得,而各衍生论文对字段的描述并不一致(有的说有类别列,有的说有文件名与标签两列)。因此条目不做字段级断言,只说明其存在与用途。这是本数据集一个真实的文档缺口。
2.5 与 Dataset A 的区别(易混点)
Yap et al. 2017 在同一篇论文中同时使用了 Dataset A 与 Dataset B。两者不是同一份数据:
| 维度 | Dataset A | Dataset B(= UDIAT) |
|---|---|---|
| 图像数 | 306 张 | 163 张 |
| 来源 | 2001 年商业化教学媒体文件 | 2012 年 UDIAT 临床采集 |
| 获取 | 需付费购买(Prapavesis 教学媒体) | 请求制(研究许可) |
| 与本条目关系 | 不属于 UDIAT | 本条目对象 |
Dataset A 常被误解为 UDIAT 的一部分。它其实是更早的、商业化的教学资料,不是本数据集。在文献检索时若看到"306 images",那是 Dataset A;看到"163 images",才是 Dataset B / UDIAT。
§3 标注流水线
3.1 谁在标注
UDIAT 的标注主体是经验丰富的放射科医师(experienced radiologists)。论文原文口径为 “the lesions were delineated by experienced radiologists”。这与许多依赖众包(crowdsourcing)或非专家标注的小型数据集形成鲜明对比:UDIAT 的掩码是专家手工描边,而非自动生成或众包拼接。
这一点的实际意义是:163 张的规模虽然小,但标注的信息密度和可信度较高。对于像素级分割任务而言,专家描边的边界质量直接决定了 Dice 等指标的可信上限。UDIAT 的 GT 在同一批专家标准下产生,掩码一致性较好。
3.2 标注了什么
每一张图像都带有两层信息:
- 类别标签:良性 / 恶性(并附有 §2.2 的亚型细分)。
- 像素级掩码:病灶轮廓(lesion contour)。这是逐像素分割标注,不是 bounding box。
掩码的用途覆盖检测与分割两种范式:
- 检测任务:可以从掩码的外接框(bounding box)派生检测框——这正是后续多篇工作的做法。
- 分割任务:直接把掩码作为分割 GT。
3.3 派生标注(重要:非官方)
UDIAT 本身不提供官方 train/val/test 划分。这是使用该数据集时最关键的一条纪律。你在文献中看到的所有"训练/验证/测试"划分,几乎都是研究者自划分。最常被引用的是:
Shin et al. 2019(arXiv:1710.03778)的 UDIAT-DXLoc 划分。 该工作(弱监督病灶定位+分类)做了两件事:
- 从分割边界生成 bounding box,把分割 GT 转成检测标注;
- 将数据划分为 UDIAT-DXLoc-Tr(123 张 = 90 良性 + 33 恶性) 与 UDIAT-DXLoc-Ts(40 张 = 20 良性 + 20 恶性)。
这是研究者自划分,不是官方切分。它之所以被广泛沿用,只是因为引用它的人多;但必须清楚,任何声称"UDIAT-DXLoc 是官方划分"的说法都是错的。
其他常见自划分还包括 113/50(arXiv:2212.04097)以及 80/10/10 等。这些划分的比例、分层方式各不相同,直接导致不同论文报告的同一指标不可横比。
3.4 标注流水线的启示
UDIAT 的标注流程揭示了一条在医学影像数据集建设中被反复验证的经验:在样本稀缺的领域,专家标注的"每张信息量"比总样本量更重要。163 张专家描边图能支撑起一个持续被引用的基准,靠的不是数量,而是"图像 + 亚型标签 + 像素级专家掩码"这一高密度组合。对后续数据集建设者而言,UDIAT 的正面示范是"标注质量优先",其负面示范则是"单中心 + 无官方划分 + 无病人级元数据"带来的复现困难。
3.5 标注的已知局限
- 无官方划分:所有划分均为研究自定,评测口径不统一。
- 无多标注者一致性:公开渠道未报告 inter-rater 一致性(如多专家描边的 Dice/IoU 一致性),因此掩码本身的标注不确定性缺乏量化。
- 无病人级元数据:无年龄、病史、随访等,限制病人级分析。
- 亚型样本极不均衡:DCIS 4 张、ILC 2 张,难以支撑亚型独立建模。
- 单机型单中心:标注采自同一设备标准,跨域泛化证据缺失。
3.6 标注与标签的关系(易混点澄清)
初学者常把 UDIAT 的三层信息混为一谈,这里明确区分:
| 层 | 内容 | 形式 | 对应任务 |
|---|---|---|---|
| 图像层 | 原始 B-mode 灰度图 | PNG(original/) |
输入 |
| 标签层 | 良性 / 恶性(+ 亚型) | 分类标签(DatasetB.xlsx 等) |
分类 |
| 标注层 | 病灶像素级轮廓 | PNG 掩码(GT/) |
分割 / 检测 |
关键:分类标签不是由掩码自动导出的,掩码也不是分类标签的可视化。二者是两套独立标注:标签来自临床病理/诊断结论,掩码来自放射科医师的影像描边。因此,一篇论文若只做分类,可以用标签而不必处理掩码;若只做分割,可以用掩码而不必依赖标签。理解这一分层,才能正确设计任务与选择评估指标。
3.7 与"图像级"标注的对照
UDIAT 的标注粒度是图像级 + 像素级,缺的是病人级与时间级:
- 有图像级:每张图的良恶性与亚型。
- 有像素级:每张图的病灶轮廓。
- 无病人级:不提供患者 ID 关联、年龄、病史、随访。
- 无时间级:单次静态采集,无纵向时间点。
这一"两极有、中间与纵向无"的标注结构,决定了 UDIAT 只能服务"单时点、单病灶"的任务范式,不能服务"患者轨迹"或"随访变化"类研究。研究者在设计课题时若需要纵向数据,必须另寻数据集,不能指望 UDIAT 补上。
§2.5 数据质量与潜在偏倚(补充)
前文 §2 已给出规格,这里补充讨论数据质量与偏倚,供研究设计时评估。
2.5.1 采集偏倚
- 地域偏倚:全部来自西班牙加泰罗尼亚单一地区人群,人种与流行病学特征单一。
- 机构偏倚:单一医院的转诊人群,病灶谱可能与该院专科方向相关。
- 设备偏倚:单机型(Siemens ACUSON Sequoia C512 + 17L5 HD),图像纹理、增益、动态范围一致,但也意味着与其他厂商设备存在系统性差异。
- 操作者偏倚:同一批超声技师的操作习惯会固化图像风格。
2.5.2 类别偏倚
- 恶性占比 32.5%,高于一般筛查人群的恶性率(筛查人群中恶性率通常远低于此),因为数据集是"含病灶病例"的回顾性收集,不是筛查队列。这一点在做"筛查场景"研究时必须注意:UDIAT 的类先验不代表筛查人群。
- 良性以囊肿(65)与纤维腺瘤(39)为主,良性谱相对集中,缺少其他少见良性病变类型。
- 恶性以 IDC(40)为主,DCIS(4)与 ILC(2)稀少。
2.5.3 标注偏倚
- 单批专家描边,无交叉复核记录,无一致性量化。
- 边界定义标准(是否包含声影、是否包含晕环)未公开,不同研究者的掩码可能不可直接比较。
2.5.4 对研究设计的启示
若研究目标是"评估模型在真实临床分布下的表现",UDIAT 的类别先验与单中心偏倚会带来乐观偏差。若研究目标是"验证方法在受控小样本上的可行性",这些偏倚影响较小。选型时先问:我要的是"临床真实"还是"方法可行"? 前者慎用 UDIAT,后者可用。
§4 辨析:UDIAT vs Dataset A vs OASBUD vs BUSI
UDIAT 是乳腺超声研究中最容易与三份数据混淆的数据集。本章把四份数据一次讲清。
4.1 与 OASBUD 的区分(最高优先级)
这是全条目最需要强调的一条。UDIAT ≠ OASBUD,但文献把二者并列引用(甚至在同一句里)的频率极高。
| 维度 | UDIAT(Dataset B) | OASBUD |
|---|---|---|
| 国家 | 🇪🇸 西班牙(Sabadell) | 🇵🇱 波兰(华沙) |
| 机构 | Parc Taulí 医院 UDIAT 中心 | 华沙肿瘤研究所(Maria Skłodowska-Curie) |
| 信号形态 | B-mode 二维灰度图像 | 原始射频(raw RF)超声信号 |
| 数据单位 | 163 张图像 | 200 条 RF 采集(100 病灶 × 2 正交扫描) |
| 类别 | 110 良性 / 53 恶性 | 48 良性 / 52 恶性 |
| 受试者 | 163 位不同女性(图像级) | 78 名女性 |
| 采集期 | 2012 年 | 2013-11 ~ 2015-10 |
| 设备 | Siemens ACUSON Sequoia C512 + 17L5 HD | Ultrasonix SonixTouch Research + L14-5/38 |
| 许可 | 请求制(研究用途,非 CC) | Zenodo 开放,CC 4.0 |
| 标识 | MMU 数据集页 | DOI 10.5281/zenodo.545928 |
| 模态本质 | 图像(已波束形成后的灰度) | 信号(波束形成前的原始 RF) |
核心差异一句话:UDIAT 给的是图像,OASBUD 给的是原始信号。OASBUD 的 raw RF 需要研究者自己做波束形成、包络检波等信号处理才能得到 B-mode 图像——这也正是 OASBUD 的独特价值(支持信号级算法研究)。而 UDIAT 直接提供的是成型的 B-mode 图像,任务重心在图像域的检测/分类/分割。
因此:若一篇论文说"在 UDIAT 上做了 raw RF 的波束形成",那基本是把 OASBUD 张冠李戴了;反过来,若说"OASBUD 有 163 张 B-mode 图",同样是混引。本条目存照此辨析,供读者在遇到混引时自行校正。
4.2 与 Dataset A 的区分
见 §2.5。Dataset A(306 张、2001 年、商业化教学文件、需付费)不属于 UDIAT。它只是 Yap 2017 论文里用于对比的另一份数据。
4.3 与 BUSI 的区分
| 维度 | UDIAT | BUSI(busi, 库内 rid 539) |
|---|---|---|
| 国家 | 🇪🇸 西班牙 | 🇪🇬 埃及(Baheya 医院) |
| 图像数 | 163 | 780 |
| 分类 | 二分类(良性/恶性) | 三分类(benign / malignant / normal) |
| 含正常类 | 否(每张均含病灶) | 是 |
| 标注 | 专家描边掩码 | 掩码(+ 类别) |
| 许可 | 请求制 | 开放(CC BY 类) |
| 规模关系 | 小 | 大(约为 UDIAT 的 4.8 倍) |
BUSI 是 UDIAT 在库内最直接的对照:同为乳腺超声、同带分割掩码,但 BUSI 规模更大、三分类、含 normal 类、且许可更开放。若一项研究想论证"模型跨数据集泛化",UDIAT→BUSI 或 BUSI→UDIAT 是常见的跨中心/跨国家组合。
4.4 一句话对照表
UDIAT:西班牙 · 163 张 B-mode 图 · 110/53 · 专家掩码 · 请求制。
OASBUD:波兰 · 200 条 raw RF 信号 · 48/52 · Zenodo CC 4.0。
Dataset A:306 张 · 2001 · 商业化教学 · 付费 · 非 UDIAT。
BUSI:埃及 · 780 张 · 三分类含 normal · 开放。
§5 衍生基准与研究生态
5.1 它不是竞赛数据集
首先要明确:UDIAT 没有挑战赛(challenge)、没有官方排行榜(leaderboard)、没有统一的评测服务器。这一点常被误期待。想找"UDIAT 排行榜"的读者会落空。所有报告在 UDIAT 上的数值,都来自各研究团队自定的划分与自定的指标口径,彼此之间只具备"趋势参照"意义,不具备"榜单排名"意义。
5.2 原论文(Yap et al. 2017)自身设定的基准
Yap et al. 2017 论文本身就是一个检测基准的设定者。它对比了两类方法:
深度学习方法(论文提出的三类):
- Patch-based LeNet
- U-Net
- 预训练 FCN-AlexNet 的迁移学习
四种经典病灶检测算法(作为对照):
- Radial Gradient Index(RGI,径向梯度指数)
- Multifractal Filtering(多重分形滤波)
- Rule-based Region Ranking(基于规则的区域排序)
- Deformable Part Models(可变形部件模型,DPM)
论文结论的主线是:深度方法在 TPF(true positive fraction)、FP/image(每图假阳性数)、F-measure 上整体优于经典算法。这一结论在 2017 年具有相当的示范意义——它把 CNN 方法引入了乳腺超声病灶检测这一当时以经典图像处理为主流的领域。
论文使用的检测评估指标为:
- TPF(True Positive Fraction,真阳性率)
- FP/image(False Positives per image,每图假阳性)
- F-measure(F 值)
5.3 主要衍生工作谱系
UDIAT 被大量后续工作作为基准或预训练目标。以下按任务归类(均需注明:这些工作的数据划分与指标口径均为各自自定,非官方):
(一)弱监督 / 半监督定位 + 分类
- Shin et al. 2019(arXiv:1710.03778):提出从分割边界生成 bounding box,并划分 UDIAT-DXLoc-Tr(123)/ Ts(40)。这是被引用最多的"非官方标准划分",常被误当成官方切分。
(二)分割
- Meta-USCL / 对比学习预训练类工作(如 arXiv:2212.04097):以 UDIAT 作为分割下游,报告 Dice / PPV / Sensitivity,常用 113/50 划分。
- 多篇 U-Net 变体与注意力分割网络以 UDIAT 为验证集之一。
(三)自监督 / 对比学习预训练的目标域
- 多篇超声基础模型(ultrasound foundation model)论文把 UDIAT 作为 linear probe 或 fine-tune 的目标下游数据集之一,用以检验预训练表征在低资源场景下的迁移能力。这是 UDIAT 近年的一个新角色:从"独立基准"变成"预训练评测靶场"。
(四)生成 / 合成数据评估
- DDPM 系列与 GAN 类工作常以 UDIAT 的小样本特性做合成数据增强实验——因为数据小,所以"加合成样本是否有用"这一问题在 UDIAT 上特别容易观察到效果差异。
5.4 指标口径汇总
| 任务 | 常用指标 |
|---|---|
| 分类 | AUC、Accuracy、Sensitivity、Specificity |
| 检测 | TPF、FP/image、F-measure |
| 分割 | Dice、Jaccard (IoU)、PPV、Sensitivity |
5.5 使用 UDIAT 做基准的三条纪律
- 必须报告自己的划分:因为没有官方划分,读者无法判断数值可比性,唯一负责的做法是明写训练/验证/测试的图像数与类别构成。
- 不要跨论文直接比数值:163 张、单中心、划分不稳定,跨研究同指标差异常常来自划分而非方法。
- 不要声称 SOTA:在无官方榜单的数据集上宣称 state-of-the-art 缺乏共同体认可,宜表述为"在本文划分下取得"。
5.6 数据集的历史定位
从 2012 年采集、2017 年公开的时间线看,UDIAT 属于乳腺超声 AI 公共数据集的早期代表。它的历史贡献有三:一是首次为乳腺超声病灶检测提供了可复现的公共图像基准;二是同步提供专家分割掩码,使检测与分割可共享同一份数据;三是以一篇高被引论文把 CNN 方法引入该任务。它的局限(小、单中心、请求制、无官方划分)也正是整个领域早期数据状况的缩影。
§6 获取与许可(实操)
6.1 许可性质(先说结论)
UDIAT 是请求制(request-based)的研究用途许可数据集,不是 CC 开放许可。
- 允许:经批准后用于研究目的。
- 禁止:未经许可的二次分发、商业使用、转公开镜像。
- 引用义务:使用时应引用 Yap et al. 2017。
若在论文、报告或数据卡片中把 UDIAT 标为 “CC BY”、“CC0”、“public domain” 或"公开可自由下载",均属事实错误。
6.2 官方获取流程(逐步)
官方入口为 MMU 的 Moi Hoon Yap 数据集页:http://www2.docm.mmu.ac.uk/STAFF/m.yap/dataset.php。流程如下:
第 1 步:找到 Breast Ultrasound Dataset B 的 Licence Agreement。
页面上挂有该数据集的许可协议。协议文件为 BUS_ReleaseAgreement.pdf(页面内 files/ 路径下)。
第 2 步:用机构邮箱填写许可协议。
必须使用机构邮箱(institutional email address)。用个人邮箱(如 Gmail)提交通常不被接受。
第 3 步:由机构授权代表批准。
必须由所在大学/机构的授权代表(authorised representative,通常是 Supervisor 或 Professor)批准。 没有授权代表的申请会被自动拒绝。这是该数据集流程中最容易卡住的一环——个人研究者、独立学者、无法提供机构担保的申请者要提前确认自己是否有合规的授权代表。
第 4 步:通过 Microsoft Forms 提交。
提交入口是页面内嵌的 Microsoft Forms。
第 5 步:等待审批。
审批最长 10 个工作日(up to 10 working days)。批准后会收到下载信息。
6.3 获取前的检查清单
- [ ] 我是否持有有效的机构邮箱?
- [ ] 我是否有一位愿意签字的授权代表(导师/教授/机构负责人)?
- [ ] 我是否已阅读并理解
BUS_ReleaseAgreement.pdf的使用限制? - [ ] 我是否会在成果中引用 Yap et al. 2017?
- [ ] 我是否承诺不二次分发?
- [ ] 我是否预留了至少 10 个工作日的审批时间?
6.4 版本链与镜像辨析(防坑)
| 入口 | 性质 | 处理建议 |
|---|---|---|
| MMU 官方页 + BUS_ReleaseAgreement.pdf | ✅ 官方唯一权威 | 一切以它为准 |
goo.gl/SJmoti |
⚠️ 论文时代的历史短链 | 存照为"历史入口",非现役;大概率已失效/重定向 |
| Kaggle 社区镜像 | ❌ 非官方 | 许可与完整性存疑,不作为权威来源 |
| HuggingFace | ❌ 无官方 gated repo | 不要臆造 UDIAT 的 HF 直链(这一点与 panda-plus 有公开 HF 直链形成对比) |
历史短链 goo.gl/SJmoti 出现在 Yap 2017 与 Shin et al. 2019 的引用中,属于"论文时代入口"。受沙箱网络限制,本条目未实抓其当前状态(是否失效/重定向至 MMU 页),故按"论文时代入口"表述,不做"仍有效"的断言。
6.5 获批后的使用规范
- 引用:Yap, M.H., Pons, G., Marti, J., Ganau, S., Sentis, M., Zwiggelaar, R., Davison, A.K. and Marti, R. (2017), Automated Breast Ultrasound Lesions Detection using Convolutional Neural Networks. IEEE Journal of Biomedical and Health Informatics, 22(4):1218-1226.
- 数据卡片标注:许可一栏应写"研究用途专有许可(request-based)",而非 CC。
- 不得再分发:包括不得上传至公开网盘、不得作为其他论文的补充材料公开原始图像。
- 衍生物发布:若发布基于 UDIAT 训练的模型权重,需核对协议是否允许;保守做法是同时说明"模型训练使用了经许可获取的 UDIAT 数据"。
6.6 申请失败的常见原因与对策
| 失败原因 | 表现 | 对策 |
|---|---|---|
| 使用个人邮箱 | Gmail/QQ 邮箱提交 | 改用机构域名邮箱(.edu.cn 或单位域名) |
| 无授权代表 | 未填写导师/教授信息 | 先与导师确认愿意签署,再提交 |
| 用途描述含糊 | 只写"做研究" | 具体写明课题、任务(检测/分类/分割)、成果形式 |
| 未填完整协议 | 协议字段缺失 | 逐项核对 BUS_ReleaseAgreement.pdf 的全部字段 |
| 重复提交 | 同一机构多次提交不同申请 | 由授权代表统一提交或说明关联 |
| 未预留时间 | 项目已启动才申请 | 把数据获取列为项目关键路径首项 |
6.7 时间与成本评估
- 时间成本:从准备到拿到数据,典型 1-2 周(含审批 ≤10 工作日)。若遇假期或补充材料,可能延长。
- 合规成本:需授权代表签署,涉及机构层面的数据合规流程。
- 机会成本:若无法满足条件,需转向 BUSI(539) 等开放数据,此时应重新评估研究设计是否需要"专家掩码"这一特性。
6.8 一个务实的双轨策略
对于有条件的研究团队,建议双轨并行:
- 轨道一(开放数据):立即用 BUSI(539) 或 OASBUD 搭建管线、跑通代码、确定评估协议。
- 轨道二(UDIAT 申请):同步启动 UDIAT 的申请流程。
这样,即使 UDIAT 审批延误或未获批,项目主线仍可用开放数据推进;一旦获批,再把 UDIAT 作为"专家掩码验证集"或"跨域实验目标域"接入。这一策略把请求制带来的时间风险降到最低。
§7 生态与影响
7.1 在乳腺影像数据版图中的位置
乳腺影像 AI 的数据生态大致沿三条模态线展开:
- 钼靶 / X 线(mammography):CBIS-DDSM(541)、INbreast(542)、VinDr-Mammo(543)、Swiss-Mammo(627) 等,规模普遍更大、以筛查为主。
- 超声(ultrasound):UDIAT(本条目)、BUSI(539)、OASBUD 等,靠近诊断与鉴别,样本量普遍偏小。
- 病理 / MRI:BreakHis、breastpathq、Duke-Breast-MRI 等,模态更专、任务更细分。
UDIAT 位于超声这条线上的"早期公共基准"位置。它不像钼靶数据集那样有几十万级的规模,但它提供了乳腺超声这个临床常用、但公共数据长期稀缺模态上的一个可复现锚点。在乳腺影像的完整链路(筛查→诊断→活检)中,超声主要对应"诊断与鉴别"环节,UDIAT 的"每张含病灶 + 良恶性标签 + 专家掩码"正好服务这一环节的算法研发。
7.2 对研究范式的影响
UDIAT 的影响可以从三个角度观察:
(1)把 CNN 引入乳腺超声检测。 Yap 2017 用深度方法对经典算法形成体系化优势,是这个方向的方法论转折点之一。
(2)推动了"小样本医学数据集"的标注范式讨论。 UDIAT 用 163 张专家描边图支撑起长期引用,客观上强化了"标注质量优先于样本数量"的共识,也暴露了"无官方划分导致复现困难"的问题。
(3)成为预训练评测的常用靶场。 随着超声基础模型兴起,UDIAT 因其小、精、可请求获得,成为检验预训练表征迁移能力的常用下游之一。
7.3 影响力边界(要诚实)
UDIAT 不是"大而全"的数据集。它的影响力集中在方法研究与概念验证层面,而不是临床部署层面。理由有三:样本量太小,单中心单机型,且请求制许可限制了大范围复现。把它当作"临床级训练数据"是不恰当的;把它当作"算法想法快速验证的公共小型基准"才是准确的定位。
7.4 生态互链
在本库中,UDIAT 与以下条目构成可互链关系:
- 同域超声(乳腺):busi(539) —— 最直接对照。
- 同模态超声(泛):camus(533)(心脏)、echonet-dynamic(526) / echonet-lvh(530)(心脏)、maternal-ultrasound-nutrition(615)(母胎)、ddti(536)(甲状腺)。
- 乳腺其他模态:cbis-ddsm(541)、inbreast(542)、vindr-mammo(543)、swiss-mammo(627)、brset(351)。
- 小样本专家标注范式:oimhs(745) 及皮肤镜系列(PH2、ISIC、derm7pt、MED-NODE)。
- 同期小样本对照:panda(560)、panda-plus。
§8 方法学启示
8.1 关于数据规模
163 张能做什么、不能做什么,是使用 UDIAT 的第一课。
- 能:验证一个新的检测/分割/分类思路是否"至少可行";做小样本学习、迁移学习、自监督预训练的评测;做合成数据增强的效果观察。
- 不能:训练一个从零开始的大模型;宣称泛化到临床;做病人级纵向分析;做亚型(DCIS/ILC)独立建模。
一个务实的原则:把 UDIAT 当作"最小可复现实验场",而不是"性能证明场"。在这上面跑通,只说明方法没有根本缺陷,不说明方法足够好。
8.2 关于划分与复现
UDIAT 最深的教训是"没有官方划分 → 无法公平横比"。这引出一条通用方法学纪律:
在小数据集上报告结果时,划分本身应被视为实验方法的一部分,必须与超参数、指标口径一同报告。
具体的可操作建议:
- 报告划分的图像数与类别构成(不要只写比例)。
- 使用分层(stratified)划分,避免随机划分造成的类别失衡。
- 若沿用他人划分(如 UDIAT-DXLoc),明确说明来源与"非官方"性质。
- 报告多次随机划分的均值与方差,而非单次划分的最佳值。
8.3 关于跨域泛化
单中心单机型的 UDIAT 是研究"域偏移"的天然素材:在 UDIAT 上训练、在 BUSI 或其他超声数据上测试,往往会看到明显性能下降。这提示:
- 数据集的价值不只在"训练",也在"作为域偏移的一方"。UDIAT→BUSI 的跨域实验是评估泛化能力的常用设置。
- 在小数据集上做设备无关(device-invariant)学习、域适应(domain adaptation)时,UDIAT 可作为单域源或单域目标。
- 报告跨域结果时,必须说明目标域的机型与采集条件差异,否则"跨域"结论不可靠。
8.4 关于标注与分割
UDIAT 的专家描边掩码提示了一个常被忽视的问题:GT 本身有不确定性。即使全部由专家描边,病灶边界在超声上常常模糊(尤其恶性病灶的浸润边缘)。因此:
- 分割指标(Dice/IoU)报高不等于"分割准确",可能只是"与这一位/这一批专家的描边风格一致"。
- 缺乏多标注者一致性数据,意味着无法量化 GT 的噪声上限。
- 做分割模型评估时,宜补充边界距离类指标(如 HD95),而非只看区域重叠。
8.5 关于许可与可复现性
UDIAT 的请求制许可是一把双刃剑:
- 正面:保护了临床数据,防止滥用与二次分发。
- 负面:增加了复现门槛(需要机构邮箱与授权代表),且审批时间(最长 10 个工作日)会拖慢研究节奏。
方法学启示是:在依赖请求制数据集的工作中,可复现性的第一道坎不是代码,而是数据获取。因此更应把代码、划分文件、预处理脚本、随机种子全部公开,以最大化可复现部分。
§9 与库内条目的关系
本章说明 UDIAT 在千方病案医数集(qianfanghub.com)库内的定位与互链关系。以下 rid 均为库内条目编号。
9.1 最直接对照:busi(539)
BUSI(Breast Ultrasound Images Dataset,Baheya 医院,埃及,780 张,三分类) 是 UDIAT 在库内最直接的兄弟条目。两者同为乳腺超声、同带分割掩码,差异在于规模(780 vs 163)、分类(三分类含 normal vs 二分类)、许可(开放 vs 请求制)、国家。任何"乳腺超声小样本 vs 大规模"的对比、"跨中心泛化"的实验,都会同时涉及这两条。建议在 busi(539) 与 udiat 之间建立双向互链。
9.2 乳腺其他模态对照
- cbis-ddsm(541):乳腺钼靶 DDSM 精选,规模大,代表"筛查模态"。
- inbreast(542):乳腺钼靶全视野数字,含专家标注。
- vindr-mammo(543):越南乳腺钼靶,多中心。
- swiss-mammo(627):瑞士乳腺钼靶。
- brset(351):乳腺影像数据集。
这些条目与 UDIAT 构成"乳腺影像多模态"互链群:钼靶(筛查)vs 超声(诊断)vs 病理/MRI。
9.3 通用超声模态互链
- camus(533):心脏超声(CAMUS),2D 超声模态兄弟。
- echonet-dynamic(526) / echonet-lvh(530):EchoNet 心脏超声动态 / 左心室肥厚,动态超声对照。
- maternal-ultrasound-nutrition(615):母胎超声。
- ddti(536):DDTI 甲状腺超声,同为"浅表器官超声 + 病灶分割"范式,与 UDIAT 的临床形态非常接近。
9.4 小样本专家标注范式互链
- oimhs(745):眼科超声/影像,同为"小样本 + 专家标注"。
- 皮肤镜系列(PH2、ISIC-2018、derm7pt、MED-NODE):同为"小样本 + 专家标注 + 分割"范式,可作方法论对照。
9.5 同期小样本对照
- panda(560) / panda-plus:前列腺 MRI,同为小样本医学影像的公共基准演进案例(panda-plus 是 panda 的扩展),可与 UDIAT 对照观察"小数据集如何演进"。
9.6 互链点汇总表
| 类别 | 库内条目 | rid |
|---|---|---|
| 乳腺超声(最直接) | busi | 539 |
| 乳腺钼靶 | cbis-ddsm | 541 |
| 乳腺钼靶 | inbreast | 542 |
| 乳腺钼靶 | vindr-mammo | 543 |
| 乳腺钼靶 | swiss-mammo | 627 |
| 乳腺(泛) | brset | 351 |
| 甲状腺超声 | ddti | 536 |
| 心脏超声 | camus | 533 |
| 心脏超声 | echonet-dynamic | 526 |
| 心脏超声 | echonet-lvh | 530 |
| 母胎超声 | maternal-ultrasound-nutrition | 615 |
| 眼科 imaging | oimhs | 745 |
| 前列腺 MRI | panda | 560 |
| 前列腺 MRI | panda-plus | — |
§10 避坑清单
以下 8 个坑点,是使用和引用 UDIAT 时最常踩的。每条都给出"错误做法 → 正确做法"。
坑点 1:把 UDIAT 与 OASBUD 混引(最高频)
错误做法:说"UDIAT 有 200 条 raw RF 信号"或"OASBUD 有 163 张 B-mode 图";在同一句里把二者当作同质数据并列而不加区分。
正确做法:UDIAT = 西班牙 · 163 张 B-mode 图 · 请求制;OASBUD = 波兰 · 200 条 raw RF 信号 · Zenodo CC 4.0。并列引用时必须分别标注国别、信号形态与许可。核心判据:图像 vs 信号。
坑点 2:良恶性计数口径不存照(110/53 vs 109/54)
错误做法:直接写"53 恶性"而不说明存在 109/54 的冲突口径;或在跨文献比对时无视这一差异。
正确做法:以主流权威口径 110 良性 / 53 恶性为准,并显式存照 DAU-Net(PMC11142567)的 109/54 口径。涉及数值复现时优先看原论文。
坑点 3:把年份写成单一值(2017 vs 2018)
错误做法:只写 2017 或只写 2018,导致引用年份与 DOI 检索不一致。
正确做法:双写并存照——“2017 年在线发表(Epub 2017-08-07)/ 2018 年 IEEE JBHI 22(4) 卷期正式见刊”。引用时以 2017 为引用惯例年份。
坑点 4:把 UDIAT 当成 CC 开放数据
错误做法:在 data card 或论文里标注 “CC BY 4.0”、“public domain”,或提供直链下载。
正确做法:标注"研究用途专有许可(request-based,需签署 Licence Agreement)",并说明获取需机构邮箱 + 授权代表批准。
坑点 5:把 Dataset A 当成 UDIAT 的一部分
错误做法:写"UDIAT 有 306 张图"。
正确做法:306 张是 Dataset A(2001 年商业化教学文件,需付费,非 UDIAT);UDIAT 是 Dataset B(163 张)。
坑点 6:声称 UDIAT 有官方 train/val/test 划分
错误做法:把 UDIAT-DXLoc-Tr(123)/Ts(40) 当成官方划分引用而不注明来源。
正确做法:明确 UDIAT 无官方划分;UDIAT-DXLoc 是 Shin et al. 2019 的研究者自划分。报告结果时必须写明自己的划分。
坑点 7:默认图像尺寸统一
错误做法:按 760×570 直接 batch,或声称"图像统一为 760×570"。
正确做法:760×570 是均值,各张尺寸不一,预处理必须 resize/pad;并说明所用 resize 策略(影响分割指标)。
坑点 8:把社区镜像/HF 当官方入口
错误做法:给出 Kaggle 镜像链接或臆造 HuggingFace gated repo 作为权威下载源。
正确做法:唯一权威入口是 MMU 官方页 + BUS_ReleaseAgreement.pdf;goo.gl/SJmoti 仅为论文时代历史短链;Kaggle 镜像非官方、许可存疑。
坑点 9:把"每张含病灶"当成"只有一个病灶"
错误做法:默认一图一病灶,按图像数=病灶数统计。
正确做法:论文明确"每张图像包含一个或多个病灶",163 是图像计数;若需病灶级统计,需从掩码中提取连通域计数,不能想当然。
坑点 10:用 UDIAT 的类先验代表筛查人群
错误做法:拿 UDIAT 的 32.5% 恶性率去推断筛查人群恶性率,或据此设定临床阈值。
正确做法:UDIAT 是"含病灶病例"的回顾性收集,类先验不代表筛查队列;做筛查相关结论须另用筛查队列数据。
坑点 11:忽略"无多标注者一致性"对指标解释的影响
错误做法:把 Dice 0.9 直接解读为"分割已接近人类水平"。
正确做法:UDIAT 未公布多专家一致性,GT 噪声上限未知;报分割结果宜补充边界距离指标并谨慎解读。
坑点 12:把衍生工作时间点当成数据集时间点
错误做法:因某篇 2022 年论文用了 UDIAT,就说"UDIAT 是 2022 年的数据集"。
正确做法:数据集采集于 2012 年、公开于 2017/2018 年;衍生工作时间点与数据集时间点无关。
坑点小结表
| 编号 | 坑点 | 一句话纠正 |
|---|---|---|
| 1 | UDIAT/OASBUD 混引 | 图像 vs 原始信号 |
| 2 | 良恶性口径 | 110/53 为准,109/54 存照 |
| 3 | 年份单一化 | 2017 在线 / 2018 卷期 |
| 4 | 当成 CC 数据 | 实为请求制 |
| 5 | Dataset A 混入 | 306 张非 UDIAT |
| 6 | 官方划分幻觉 | 无官方划分 |
| 7 | 尺寸假设统一 | 均值 760×570,各张不一 |
| 8 | 镜像当官方 | 仅 MMU 页权威 |
| 9 | 一图一病灶 | 每张可含多病灶 |
| 10 | 类先验误用 | 不代表筛查人群 |
| 11 | GT 无噪声假设 | 无一致性量化 |
| 12 | 衍生年当数据年 | 采集 2012 / 公开 2017-2018 |
§11 总结
11.1 三句话版本
- UDIAT Breast Ultrasound Dataset B 是 2012 年采集于西班牙 Parc Taulí 医院 UDIAT 诊断中心的 163 张乳腺 B 型超声图像(110 良性 / 53 恶性),每张配 Experts 手工描边的病灶掩码。
- 它在 2017 年由 Moi Hoon Yap 团队在 IEEE JBHI 上公开,用以缓解乳腺超声公共数据集稀缺、算法无法横向比较的问题,是这一领域被引用最多的小型公共基准之一。
- 它通过签署许可协议请求获取(机构邮箱 + 授权代表,最长 10 个工作日),不是 CC 开放数据;且它极易与波兰的 OASBUD 混引,必须按"图像 vs 原始信号"严格区分。
11.2 适合谁用
- 想快速验证乳腺超声检测 / 分类 / 分割新方法的概念验证研究者。
- 做小样本学习、迁移学习、自监督/对比学习预训练评测的研究者(UDIAT 常作下游目标域)。
- 研究域偏移与跨域泛化的研究者(UDIAT ↔ BUSI 等跨中心实验)。
- 研究合成数据增强效果的团队(小样本使增益易观察)。
- 需要一个有专家像素级掩码的乳腺超声基准来做标注范式对比的研究者。
11.3 不适合谁用
- 想训练大模型或从零开始的团队——163 张远远不够。
- 需要做病人级纵向/随访分析的研究——无病人级元数据。
- 需要多中心/多机型泛化证明的工作——单中心单机型。
- 需要临床级性能声明的场景——数据集规模不支持。
- 需要免费直链下载的用户——请求制有门槛。
- 想找官方排行榜/挑战赛的用户——不存在。
11.4 30 秒决策卡
要乳腺超声的免费开放数据? → 看 BUSI(539) 或 OASBUD(Zenodo CC 4.0)。
要专家像素级掩码、不介意请求制? → 用 UDIAT。
要做跨域实验? → UDIAT ↔ BUSI 是经典组合。
要做预训练评测靶场? → UDIAT 是常用下游之一。
要 163 张里"每张含病灶 + 良恶性 + 掩码"? → UDIAT 正好。
要 200 条 raw RF 信号? → 那是 OASBUD,不是 UDIAT。
常见问题 FAQ
A 组:基本信息
A1. UDIAT 的全称是什么?
UDIAT Breast Ultrasound Dataset B。其中 “UDIAT” 来自提供数据的机构 Unitat de Diagnòstic per la Imatge d’Alt Taulí。
A2. 它有几个名字?
至少三个:官方论文名 Dataset B;社区通用名 UDIAT;变体 UDIAT-B。三者等价。
A3. 谁做的?
Manchester Metropolitan University(MMU)Moi Hoon Yap 课题组,联合西班牙 Parc Taulí / UDIAT 临床方与 University of Girona。
A4. 什么时候公开的?
2017 年在线(IEEE JBHI),2018 年卷期正式见刊。
A5. 数据什么时候采集的?
2012 年,于西班牙 Sabadell 的 Parc Taulí 医院 UDIAT 诊断中心。
A6. 在哪家期刊发表的?
IEEE Journal of Biomedical and Health Informatics(IEEE JBHI),22 卷 4 期,1218-1226 页。
A7. DOI 和 PMID 是什么?
DOI:10.1109/JBHI.2017.2731873;PMID:28796627。
A8. 为什么叫 “Dataset B”?
因为论文同时使用了 Dataset A(306 张,商业教学文件)与 Dataset B(163 张,本研究公开);本条目对象是后者。
B 组:数据构成
B1. 有多少张图?
163 张。
B2. 良性多少、恶性多少?
110 良性 / 53 恶性。个别文献写 109/54,属口径出入。
B3. 是 163 个病人吗?
论文口径是"163 images from different women",近似每张一位不同女性。
B4. 图像是什么模态?
B 型超声(B-mode),二维灰度,静态单帧。
B5. 图像多大?
均值约 760×570 px,各张尺寸不统一。
B6. 用什么设备采的?
Siemens ACUSON Sequoia C512 超声系统 + 17L5 HD 线阵探头(8.5 MHz)。
B7. 每张都有病灶吗?
是,每张图像包含一个或多个病灶。
B8. 163 是图像数还是病灶数?
图像数。每张可能含多个病灶,病灶总数未在公开渠道单列。
B9. 文件格式?
PNG。
B10. 下载包里有什么?
GT/(掩码)、original/(原图)、DatasetB.xlsx(元数据表)。
C 组:标注与任务
C1. 有分割标注吗?
有,像素级病灶掩码。
C2. 谁标注的?
经验丰富的放射科医师手工描边。
C3. 是众包标注吗?
不是,是专家标注。
C4. 支持哪些任务?
分类(良恶性)、检测/定位、像素级分割。
C5. 有官方 train/val/test 划分吗?
没有。 所有划分都是研究者自定。
C6. UDIAT-DXLoc 是什么?
Shin et al. 2019 的研究者自划分(Tr 123 / Ts 40),非官方。
C7. 有亚型标签吗?
有。恶性含 IDC 40、DCIS 4、ILC 2、其他 7;良性含囊肿 65、纤维腺瘤 39、其他 6。
C8. 有病人级元数据吗?
公开渠道无年龄、病史、随访等病人级信息。
D 组:许可与获取
D1. 能直接下载吗?
不能,需请求制。
D2. 怎么申请?
填 Licence Agreement → 机构邮箱提交 → 授权代表批准 → Microsoft Forms 提交 → 等待审批。
D3. 审批要多久?
最长 10 个工作日。
D4. 能用个人邮箱申请吗?
一般不行,要求机构邮箱。
D5. 没有授权代表会怎样?
申请会被自动拒绝。
D6. 是 CC 许可吗?
不是。是研究用途专有许可。
D7. 能再分发吗?
不能,禁止二次分发。
D8. 用的时候要不要引用?
要,引用 Yap et al. 2017。
D9. 官方入口在哪?
MMU 的 Moi Hoon Yap 数据集页。
D10. goo.gl/SJmoti 还有效吗?
这是论文时代的历史短链,大概率已失效/重定向,不作为现役入口。
D11. Kaggle 上的 UDIAT 是官方的吗?
不是,社区镜像,许可与完整性存疑。
D12. HuggingFace 上有 UDIAT 吗?
没有官方 gated repo,不要臆造 HF 直链。
E 组:与其它数据集对比
E1. UDIAT 和 OASBUD 一样吗?
不一样。UDIAT 是西班牙 163 张 B-mode 图(请求制);OASBUD 是波兰 200 条 raw RF 信号(Zenodo CC 4.0)。
E2. UDIAT 和 BUSI 一样吗?
不一样。UDIAT 163 张二分类(西班牙);BUSI 780 张三分类含 normal(埃及)。
E3. UDIAT 和 Dataset A 一样吗?
不一样。Dataset A 是 306 张 2001 年商业教学文件,需付费,非 UDIAT。
E4. UDIAT 和 CBIS-DDSM 有什么不同?
模态不同:UDIAT 是超声,CBIS-DDSM(541) 是钼靶。
E5. UDIAT 和 DDTI 呢?
DDTI(536) 是甲状腺超声,UDIAT 是乳腺超声;范式相近,器官不同。
E6. 有别的乳腺超声公共数据集吗?
有,如 BUSI(开放)、OASBUD(开放)等。
F 组:使用与研究
F1. 163 张够训练深度模型吗?
够做概念验证、迁移学习、小样本研究;不够从零训练大模型。
F2. 能在 UDIAT 上宣称 SOTA 吗?
不宜。无官方榜单,宜表述为"在本文划分下"。
F3. 跨论文数值能直接比吗?
不建议。划分与指标口径不一。
F4. 常见评估指标有哪些?
分类 AUC/Acc/Sens/Spec;检测 TPF/FP-image/F-measure;分割 Dice/IoU/PPV/Sens。
F5. 能用于跨域实验吗?
能,UDIAT ↔ BUSI 等是常见设置。
F6. 能用于合成数据研究吗?
能,小样本特性使增强增益易观察。
F7. 能用于自监督预训练评测吗?
能,常用作下游目标域之一。
F8. 有没有官方代码仓?
Yap 论文未提供官方 repo;衍生工作各自开源,勿把衍生仓当官方仓。
F9. 图像尺寸不统一怎么处理?
resize 或 pad 到固定尺寸,并报告所用策略。
F10. 亚型能独立建模吗?
DCIS 4 张、ILC 2 张,样本远不足,不能独立建模。
事实清单
- UDIAT = UDIAT Breast Ultrasound Dataset B,论文名 Dataset B。
- UDIAT 是加泰罗尼亚语机构缩写 Unitat de Diagnòstic per la Imatge d’Alt Taulí。
- 图像总数 163 张。
- 良性 110 张,恶性 53 张(恶性约 32.5%)。
- 存照:DAU-Net(PMC11142567)写 109 良性 / 54 恶性。
- 每张图像来自一位不同女性(论文口径)。
- 模态为 B-mode,二维灰度,静态单帧。
- 图像均值约 760×570 px,尺寸不统一。
- 设备为 Siemens ACUSON Sequoia C512。
- 探头为 17L5 HD 线阵,8.5 MHz。
- 采集于 2012 年。
- 采集地为西班牙 Sabadell,Parc Taulí 医院 UDIAT 诊断中心。
- 论文发表于 IEEE JBHI,22(4):1218-1226。
- 论文 2017 年在线,2018 年卷期见刊(双口径)。
- DOI 10.1109/JBHI.2017.2731873。
- PMID 28796627。
- 作者含 Yap、Pons、Marti J.、Ganau、Sentis、Zwiggelaar、Davison、Marti R.。
- 出品方为 MMU + Parc Taulí/UDIAT + University of Girona。
- 每张图像含一个或多个病灶。
- 每张配专家描边的像素级掩码。
- 标注者为经验丰富的放射科医师。
- 恶性构成:IDC 40、DCIS 4、ILC 2、其他 7。
- 良性构成:囊肿 65、纤维腺瘤 39、其他 6。
- 支持分类、检测、分割三类任务。
- 数据集无官方 train/val/test 划分。
- UDIAT-DXLoc-Tr(123)/Ts(40) 是 Shin et al. 2019 自划分。
- 下载包含 GT/、original/、DatasetB.xlsx。
- 文件格式为 PNG。
- 获取方式为请求制。
- 需机构邮箱提交许可协议。
- 需授权代表批准,否则自动拒绝。
- 审批最长 10 个工作日。
- 协议文件为 BUS_ReleaseAgreement.pdf。
- 许可为研究用途专有许可,非 CC。
- 禁止二次分发。
- 官方入口为 MMU 数据集页。
- goo.gl/SJmoti 为论文时代历史短链。
- Kaggle 镜像非官方。
- 无官方 HuggingFace repo。
- 论文对比 Dataset A(306 张)与 Dataset B(163 张)。
- Dataset A 为 2001 年商业教学文件,需付费,非 UDIAT。
- 论文提出 Patch-based LeNet、U-Net、FCN-AlexNet 迁移三种深度方法。
- 论文对照 RGI、Multifractal Filtering、Rule-based Region Ranking、DPM 四种经典算法。
- 检测指标为 TPF、FP/image、F-measure。
- UDIAT 与 OASBUD 不同:图像 vs raw RF 信号。
- OASBUD 为波兰 200 条 raw RF,52 恶 + 48 良,78 女性。
- OASBUD 许可为 CC 4.0,DOI 10.5281/zenodo.545928。
- BUSI 为埃及 780 张三分类,含 normal 类。
- UDIAT 常被用作自监督/对比学习预训练的下游目标域。
- 使用 UDIAT 应引用 Yap et al. 2017。
术语表
| 术语 | 英文 | 释义 |
|---|---|---|
| B 型超声 | B-mode ultrasound | 以灰度显示回波强度的二维超声成像模式 |
| 乳腺超声 | breast ultrasound (BUS) | 乳腺的超声检查,常用于致密乳腺与病灶鉴别 |
| 病灶 | lesion | 组织中的异常区域,本数据集中均指乳腺病灶 |
| 掩码 | mask | 逐像素标注病灶轮廓的二值图像 |
| 分割 | segmentation | 逐像素划分目标区域的任务 |
| 检测 | detection / localization | 定位目标并给出边界框的任务 |
| 二分类 | binary classification | 良性 vs 恶性的两类别判定 |
| 良恶性 | benign / malignant | 病变的良性或恶性性质 |
| 浸润性导管癌 | IDC | 最常见的乳腺浸润癌类型 |
| 导管原位癌 | DCIS | 局限于导管内的非浸润癌 |
| 浸润性小叶癌 | ILC | 起源于小叶的浸润癌类型 |
| 纤维腺瘤 | fibroadenoma | 常见良性实性乳腺病变 |
| 囊肿 | cyst | 含液体的良性病变 |
| 真阳性率 | TPF | True Positive Fraction,检测召回度量 |
| 每图假阳性 | FP/image | 平均每张图像的误检数 |
| F 值 | F-measure | 精确率与召回率的调和平均 |
| Dice 系数 | Dice coefficient | 分割重叠度指标 |
| IoU | Jaccard index | 交并比,分割重叠度指标 |
| 域偏移 | domain shift | 训练域与测试域分布差异 |
| 迁移学习 | transfer learning | 将源域知识迁移到目标域 |
| 自监督学习 | self-supervised learning | 无需人工标签的表征学习 |
| 随机射频信号 | raw RF | 波束形成前的原始超声射频信号 |
| 波束形成 | beamforming | 由各阵元信号合成图像的过程 |
| 请求制许可 | request-based license | 需申请并获批方可获取的许可模式 |
| 授权代表 | authorised representative | 机构中代表申请者批准申请的人 |
附录
附录 A:核心元数据速查
| 字段 | 值 |
|---|---|
| slug | udiat |
| 全称 | UDIAT Breast Ultrasound Dataset B |
| 别名 | Dataset B / UDIAT / UDIAT-B |
| 图像数 | 163 |
| 良性 | 110 |
| 恶性 | 53 |
| 模态 | B-mode 2D 灰度 |
| 平均尺寸 | 760×570 px |
| 设备 | Siemens ACUSON Sequoia C512 |
| 探头 | 17L5 HD 8.5 MHz |
| 采集年 | 2012 |
| 地点 | Sabadell, Spain(Parc Taulí / UDIAT) |
| 论文 | IEEE JBHI 22(4):1218-1226 (2017/2018) |
| DOI | 10.1109/JBHI.2017.2731873 |
| PMID | 28796627 |
| 许可 | 请求制(研究用途) |
| 官方入口 | MMU Yap 数据集页 |
附录 B:DAIMS 评估全表
DAIMS 是千方病案医数集对数据集条目采用的五维评估框架:Discoverability(可发现性)、Accessibility(可获取性)、Interoperability(可互操作)、Metadata(元数据质量)、Sustainability(可持续性)。以下为 UDIAT 的逐维评分(1-10)。
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 7 | 论文高被引、PMID/DOI 可检索、MMU 页面可索引;但页面为个人主页而非专门数据门户,"UDIAT"名与 OASBUD/BUSI 易混,拉低可发现精度 |
| A 可获取性 | 4 | 最大失分项:请求制 + 机构邮箱 + 授权代表 + 最长 10 工作日,无公开直链;个人研究者门槛高,Kaggle 镜像又非官方 |
| I 可互操作 | 6 | PNG 原图 + PNG 掩码 + XLSX 表,通用但非医学标准格式;无 DICOM、无官方转换脚本、无标准化数据集 card |
| M 元数据质量 | 6 | 论文提供类别/亚型/设备/尺寸等信息;但 DatasetB.xlsx 字段无公开 schema、无病人级元数据、无多标注者一致性数据 |
| S 可持续性 | 5 | 依托 MMU 个人主页长期挂着,机构层面稳定;但审批依赖人工、无平台级托管(对比 HF/Kaggle 直链),单点依赖风险偏高 |
| 综合评级 | 5.6/10(中等) | 科学价值高、标注质量高,但可获取性(4)与可持续性(5)显著拖低总分;请求制是决定性短板 |
评级说明:UDIAT 的 DAIMS 综合分偏低,不代表其学术价值低。它反映的是"数据集工程化程度"——请求制许可、无官方划分、无标准格式、无平台托管,这些是 2017 年小型医学数据集的普遍特征。读者在做数据选型时,应把 DAIMS 分与"科学适配度"分开看:若研究需要专家像素级掩码且能通过机构申请,UDIAT 的科学价值远超其 DAIMS 分数。
附录 C:逐项证据链自证
| 关键数字/说法 | 来源 | 位置 |
|---|---|---|
| 163 张图像 | 论文原文 / MMU 官方页 | 摘要与数据集说明 |
| 110 良性 / 53 恶性 | 论文 / IEEE Xplore / PubMed 摘要 | 摘要与结果 |
| 109 良性 / 54 恶性 | DAU-Net 论文 | PMC11142567(冲突口径存照) |
| 40 IDC / 4 DCIS / 2 ILC / 7 其他 | 论文 | 数据集与病灶分类节 |
| 65 囊肿 / 39 纤维腺瘤 / 6 其他 | 论文 | 数据集与病灶分类节 |
| 760×570 px 均值 | 论文 / 衍生文献 | 数据描述 |
| Siemens ACUSON Sequoia C512 + 17L5 HD 8.5 MHz | 论文 / MMU 官方页 | 采集设备说明 |
| 2012 年采集 | 论文 / 多篇衍生文献 | 数据采集说明 |
| DOI 10.1109/JBHI.2017.2731873 / PMID 28796627 | IEEE / PubMed | 论文标识 |
| 2017 在线 / 2018 卷期 | IEEE(Epub 2017-08-07)/ PubMed(2018 Jul) | 双口径存照 |
| 请求制 + 机构邮箱 + 授权代表 + ≤10 工作日 | MMU 官方页 | 获取流程 |
| BUS_ReleaseAgreement.pdf | MMU 官方页 files/ 路径 | 许可协议文件 |
| UDIAT-DXLoc-Tr 123 / Ts 40 | Shin et al. 2019 | arXiv:1710.03778(非官方划分) |
| OASBUD 200 raw RF / 52 恶 + 48 良 / 78 女性 / CC 4.0 | OASBUD | Zenodo DOI 10.5281/zenodo.545928 |
附录 D:数据获取决策树
你需要乳腺超声数据,下一步取决于你的条件:
├── 能提供机构邮箱 + 授权代表(导师/教授)批准
│ ├── 需要专家像素级掩码
│ │ └── 申请 UDIAT(填 Licence Agreement → 授权代表批准 → ≤10 工作日)
│ └── 只需要二分类、规模更大且开放
│ └── 改用 BUSI(539)(开放、780 张、三分类)
├── 无法提供机构邮箱或授权代表
│ ├── 需要开放数据
│ │ └── BUSI(539) 或 OASBUD(Zenodo CC 4.0)
│ └── 需要 raw RF 信号(非图像)
│ └── OASBUD(DOI 10.5281/zenodo.545928)
└── 只想先跑通管线
└── 用 BUSI 搭建流程,同时并行申请 UDIAT
附录 E:任务-指标-预处理对照
| 任务 | 输入形式 | 预处理关键点 | 输出 | 推荐指标 |
|---|---|---|---|---|
| 良恶性分类 | 图像(整图或 ROI) | resize 归一、类别加权(110:53) | 二分类概率 | AUC、Accuracy、Sensitivity、Specificity |
| 病灶检测 | 整图 | 由 GT 掩码派生 bbox;划分需分层 | 检测框 | TPF、FP/image、F-measure |
| 像素级分割 | 整图 | resize/pad 保比例;GT 对齐 | 掩码 | Dice、IoU、PPV、Sensitivity |
附录 F:小样本训练策略速查
| 策略 | 适用场景 | 备注 |
|---|---|---|
| 迁移学习 | 从 ImageNet/超声预训练权重微调 | Yap 2017 已用 FCN-AlexNet 迁移 |
| 数据增强 | 旋转/翻转/弹性/亮度扰动 | 需报告增强策略,否则不可比 |
| 交叉验证 | 缓解划分不稳定 | 报告多次划分均值±方差 |
| 合成数据增强 | 极小样本 | UDIAT 常被用于此类实验 |
| 自监督预训练 | 表征学习 | 以 UDIAT 作下游目标域 |
| 域适应 | 跨中心(UDIAT↔BUSI) | 需报告目标域机型差异 |
附录 G:论文引用格式
APA:
Yap, M. H., Pons, G., Marti, J., Ganau, S., Sentis, M., Zwiggelaar, R., Davison, A. K., & Marti, R. (2017). Automated breast ultrasound lesions detection using convolutional neural networks. IEEE Journal of Biomedical and Health Informatics, 22(4), 1218–1226. https://doi.org/10.1109/JBHI.2017.2731873
BibTeX:
@article{yap2017udiat,
title = {Automated Breast Ultrasound Lesions Detection Using Convolutional Neural Networks},
author = {Yap, Moi Hoon and Pons, Gerard and Marti, Joan and Ganau, Sergi and
Sentis, Melcior and Zwiggelaar, Reyer and Davison, Adrian K. and
Marti, Robert},
journal = {IEEE Journal of Biomedical and Health Informatics},
volume = {22},
number = {4},
pages = {1218--1226},
year = {2018},
doi = {10.1109/JBHI.2017.2731873},
note = {Epub 2017 Aug 7}
}
附录 H:任务与对应指标
| 任务 | 输入 | 输出 | 常用指标 |
|---|---|---|---|
| 分类 | 图像(可含 ROI) | 良性/恶性 | AUC, Acc, Sens, Spec |
| 检测 | 整图 | 病灶框 | TPF, FP/image, F-measure |
| 分割 | 整图 | 病灶掩码 | Dice, IoU, PPV, Sens |
附录 I:类不均衡速算
- 良性 110 / 恶性 53 → 良性:恶性 ≈ 2.08 : 1。
- 多数类(良性)基线准确率 ≈ 67.5%——任何分类模型需答对 >67.5% 才优于"全判良性"。
- 若随机划分不分层,测试集恶性比例波动会明显影响敏感度指标。
附录 J:常见划分一览(均为非官方)
| 来源 | 训练 | 验证/测试 | 备注 |
|---|---|---|---|
| Shin et al. 2019 (UDIAT-DXLoc) | 123 (90良+33恶) | 40 (20良+20恶) | 最常被引用,非官方 |
| arXiv:2212.04097 | 113 | 50 | 非官方 |
| 多篇通用 | 80% | 10%/10% | 非官方 |
附录 K:与 OASBUD 差异要点
| 要点 | UDIAT | OASBUD |
|---|---|---|
| 信号 vs 图像 | 图像 | 原始信号 |
| 国别 | 西班牙 | 波兰 |
| 许可 | 请求制 | CC 4.0 |
| 单位数 | 163 图 | 200 RF |
| 标识 | MMU 页 | Zenodo DOI |
附录 L:申请检查清单(可打印)
[ ] 机构邮箱可用
[ ] 授权代表(导师/教授)已同意
[ ] 已阅读 BUS_ReleaseAgreement.pdf
[ ] 已知悉仅限研究用途、禁止再分发
[ ] 已预留 ≥10 工作日审批时间
[ ] 已准备引用 Yap et al. 2017
附录 M:库内互链指引
- 乳腺超声对照:busi(539)
- 乳腺钼靶:cbis-ddsm(541)、inbreast(542)、vindr-mammo(543)、swiss-mammo(627)、brset(351)
- 泛超声:camus(533)、echonet-dynamic(526)、echonet-lvh(530)、maternal-ultrasound-nutrition(615)、ddti(536)
- 小样本范式:oimhs(745)、皮肤镜系列
- 同期小样本:panda(560)、panda-plus
附录 N:术语中英对照精简版
超声=ultrasound · 病灶=lesion · 掩码=mask · 分割=segmentation · 检测=detection · 良恶性=benign/malignant · 射频信号=raw RF · 请求制=request-based · 授权代表=authorised representative
附录 O:版本与常被误写项
| 常被误写 | 正确写法 |
|---|---|
| UDIAT 有 306 张 | UDIAT 163 张;306 是 Dataset A |
| UDIAT 是 CC BY | UDIAT 是请求制专有许可 |
| UDIAT 有官方划分 | 无官方划分 |
| UDIAT 是 2018 年论文 | 2017 在线 / 2018 卷期 |
| UDIAT 是 raw RF | UDIAT 是 B-mode 图像 |
| UDIAT 统一 760×570 | 均值 760×570,尺寸不一 |
| UDIAT 有 HF 直链 | 无官方 HF repo |
附录 P:中国研究者申请要点
- 使用高校/科研院所机构邮箱(.edu.cn 或单位域名邮箱)。
- 找到导师或课题组负责人作为授权代表签署。
- 提前准备英文申请书,阅读
BUS_ReleaseAgreement.pdf的英文条款。 - 时间上预留至少 2 周(含 10 工作日审批 + 沟通往返)。
- 获批后按协议要求,在成果中引用 Yap et al. 2017,且不得公开原始图像。
附录 Q:一句风险管理
UDIAT 的请求制许可意味着**“先拿到数据,再谈复现”。在所有依赖 UDIAT 的项目排期中,数据获取应作为关键路径的第一项**提前启动,而非视作"随时可下"的附属资源。
附录 R:相关文献线索
- Yap et al. 2017, IEEE JBHI(原论文)
- Shin et al. 2019, arXiv:1710.03778(UDIAT-DXLoc 划分)
- arXiv:2212.04097(分割 / 对比学习预训练,113/50 划分)
- DAU-Net, PMC11142567(109/54 口径存照来源)
- OASBUD, DOI 10.5281/zenodo.545928(区分对象)
附录 S:数据卡片模板建议
Dataset: UDIAT Breast Ultrasound Dataset B
Modality: B-mode ultrasound (2D, grayscale, static)
Images: 163 (benign 110 / malignant 53)
Annotation: expert-delineated lesion masks + binary labels
Device: Siemens ACUSON Sequoia C512, 17L5 HD (8.5 MHz)
Collection: 2012, Parc Taulí (UDIAT), Sabadell, Spain
Splits: none official
License: research-use, request-based (NOT CC)
Access: institutional email + authorised representative
Citation: Yap et al. 2017, IEEE JBHI 22(4):1218-1226
附录 T:为什么 163 张能长期被引用
因为它的组合稀缺:乳腺超声 + 每张含病灶 + 良恶性标签 + 亚型细分 + 专家像素级掩码 + 请求制可及。在小样本医学影像早期,几乎没有第二个数据集同时满足这些条件。这解释了"小规模"与"高引用"并不矛盾。
附录 U:与 panda-plus 的对照启示
panda-plus 展示了"小数据集如何通过扩展演进为大基准",而 UDIAT 至今仍保持 163 张的原始规模(无官方 UDIAT-plus)。两者对照,可观察医学数据集生态中"扩展路线"与"维持路线"的差异。
附录 V:数据获取时间线(典型)
Day 0 : 准备机构邮箱、确认授权代表
Day 1 : 填写 Licence Agreement 并提交
Day 1-10: 等待审批(最长 10 工作日)
Day ~11 : 获批,收到下载信息
Day ~12 : 下载、解压、核对 GT/original/DatasetB.xlsx
Day ~13 : 预处理(resize/pad)、划分、开始实验
附录 W:常见指标公式提示
- Sensitivity = TP / (TP + FN)
- Specificity = TN / (TN + FP)
- Dice = 2|A∩B| / (|A|+|B|)
- IoU = |A∩B| / |A∪B|
附录 X:常被并列引用的"乳腺超声公共数据集"清单
- UDIAT / Dataset B(西班牙,163 图,请求制)— 本条目
- OASBUD(波兰,200 raw RF,CC 4.0)
- BUSI(埃及,780 图,开放)
- 其他社区衍生子集(多非官方)
附录 Y:一句话记住 UDIAT
“西班牙 163 张专家描边乳腺超声图,请求制,2017 年 Yap 团队公开——图像,不是 raw RF 信号。”
附录 Z:与 BUSI 的镜像对照(跨中心)
| 项 | UDIAT | BUSI |
|---|---|---|
| 国家 | 西班牙 | 埃及 |
| 规模 | 163 | 780 |
| 分类 | 二分类 | 三分类 |
| normal 类 | 无 | 有 |
| 许可 | 请求制 | 开放 |
附录 AA:自检提示(写作者用)
- [ ] 是否写清了 UDIAT ≠ OASBUD?
- [ ] 是否双写年份 2017/2018?
- [ ] 是否存照 110/53 vs 109/54?
- [ ] 是否说明请求制非 CC?
- [ ] 是否说明无官方划分?
- [ ] 是否说明 Dataset A 非 UDIAT?
附录 AB:可信度分级
| 信息类型 | 可信度 | 来源 |
|---|---|---|
| 图像数、类别分布 | 高(三源一致) | 论文/PubMed/官方页 |
| 亚型构成 | 高 | 论文 |
| 设备型号 | 高 | 论文/官方页 |
| DatasetB.xlsx 字段 | 低(无公开 schema) | 待核 |
| goo.gl 短链现状 | 低(未实抓) | 待核 |
附录 AC:跨模态对照要点
超声(UDIAT/BUSI)vs 钼靶(CBIS-DDSM/INbreast):前者靠近诊断鉴别、样本小、灰度;后者靠近筛查、样本大、可带 BI-RADS。跨模态研究应注意成像物理差异导致的特征不可迁移性。
附录 AD:数据集"小"的三重含义
- 样本量小:163 张。
- 多样性小:单中心单机型。
- 元数据小:无病人级信息。
三者叠加决定了它只能作概念验证与预训练评测,不能作临床部署训练集。
附录 AE:一句话结论
UDIAT 是乳腺超声 AI 的"最小可复现实验场":小、精、请求制,用图像而非信号,易与 OASBUD 混引——用之前先把这四点记牢。
尾注
- 本条目事实以 Yap, M.H. et al. (2017), IEEE Journal of Biomedical and Health Informatics, 22(4):1218-1226(DOI 10.1109/JBHI.2017.2731873,PMID 28796627)与 MMU 官方数据集页为准。
- 抓取时点:2026-09-30。网络受限处(如 goo.gl 短链现状、PMC11142567 全文逐字)已标注为待核,未做绝对断言。
- 良恶性计数以主流 110/53 为本条目口径,109/54 作为冲突口径存照。
- 本条目为 AI-Ready Wikipedia 语料,供检索增强与知识对齐使用;所有许可与获取信息以 MMU 官方页最新公示为准。
- 互链条目 rid:busi(539)、cbis-ddsm(541)、inbreast(542)、vindr-mammo(543)、swiss-mammo(627)、brset(351)、ddti(536)、camus(533)、echonet-dynamic(526)、echonet-lvh(530)、maternal-ultrasound-nutrition(615)、oimhs(745)、panda(560)。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- busi — 共享标签:医学影像 / 乳腺影像 / 医学图像分割 / 图像分类 / 乳腺癌
- inbreast — 共享标签:医学影像 / 乳腺影像 / 医学图像分割 / 图像分类 / 乳腺癌
- bach — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌 / 肿瘤学
- bus-bra — 共享标签:医学影像 / 乳腺影像 / 医学图像分割 / 图像分类 / 乳腺癌
- ddti — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 肿瘤学
- tn-mammo-breast-density — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 肿瘤学
- odelia — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 乳腺癌
- oasbud — 共享标签:医学影像 / 乳腺影像 / 图像分类 / 肿瘤学
- breakhis — 共享标签:医学影像 / 图像分类 / 乳腺癌 / 肿瘤学
- bracs — 共享标签:医学影像 / 图像分类 / 乳腺癌 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

