信息速览

BreakHis — 乳腺癌组织病理图像数据库 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | BreakHis(Breast Cancer Histopathological Database) |
| 英文全称 | BreakHis: Breast Cancer Histopathological Database |
| 别名/简称 | BreakHis、BreaKHis、UFPR Breast Cancer Database |
| 疾病分类 | 乳腺良恶性肿瘤。ICD-11:2C61 乳腺浸润性癌 / 2C60 特殊类型乳腺癌 / 2C64 实性乳头状癌伴浸润 / 2F30 乳腺良性肿瘤(2F30.0 管状腺瘤、2F30.3 良性叶状肿瘤、2F30.5 纤维腺瘤) |
| SNOMED CT | 254837009 Malignant neoplasm of breast / 408643008 Infiltrating duct carcinoma of breast / 89740008 Lobular carcinoma / 64524002 Invasive papillary carcinoma / 1156873009 Fibroadenoma(详见 §2.2) |
| 数据模态 | 影像(乳腺 H&E 染色组织病理显微图像,非全切片 WSI) |
| AI 任务类型 | 图像二分类(良/恶性)、8 类亚型细分类、倍率鲁棒性研究、迁移学习基准 |
| 样本总数 | 7,909 张图像(良性 2,480 / 恶性 5,429),来自 82 名患者(24 良性 / 58 恶性) |
| 数据大小 | ~4 GB(BreaKHis_v1.tar.gz) |
| 数据格式 | PNG(700×460 px,RGB 3 通道,8-bit/通道) |
| 许可证 | CC BY 4.0,限非商业研究用途,发表须引用 Spanhol et al. 2016 |
| 访问级别 | 开放(官网直链下载,可选填写信息表单) |
| DUO 标签 | DS, NPUNCU, PUB |
| 语言 | 英文(文件名与文档) |
| 首发日期 | 2015-09(arXiv 预印本)/ 2016-07(IEEE TBME 正式发表) |
| 最后更新 | 2016(BreaKHis_v1 为唯一版本,此后冻结无更新) |
| 发布机构 | 巴西巴拉那联邦大学(UFPR)VRI 实验室 & P&D Laboratory |
| 官方主页 | https://web.inf.ufpr.br/vri/databases/breast-cancer-histopathological-database-breakhis/ |
| 下载地址 | http://www.inf.ufpr.br/vri/databases/BreaKHis_v1.tar.gz(官网)/ Kaggle ambarish/breakhis 镜像 |
| DOI | 10.1109/TBME.2015.2496264 |
| 引用次数 | 1,824+(OpenAlex,截至 2026-09;Google Scholar 口径更高) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 目录即标签、官方 5 折患者级划分脚本、下载零门槛;扣分项:无临床元数据、无像素级标注、患者数少、版本冻结 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、8 个组织学亚型的临床定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(SOB 文件名编码、目录结构)、§5 患者级划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与巴西巴拉那联邦大学(UFPR)、P&D Laboratory、IEEE 无任何商业利益关联。本页面不销售 BreakHis 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 UFPR、P&D Laboratory 或任何镜像平台(Kaggle/HuggingFace)的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。BreakHis 官方页面声明为 CC BY 4.0 并限非商业研究用途,且发表成果必须引用 Spanhol et al. 2016(IEEE TBME);不同镜像平台(Kaggle 等)的许可证标注可能不同,以官方页面为准。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
BreakHis 是巴西巴拉那联邦大学(UFPR)与 P&D 病理实验室于 2015-2016 年发布的乳腺癌组织病理图像公开数据库,包含 82 名患者手术活检组织的 7,909 张 H&E 染色显微图像,覆盖 40×/100×/200×/400× 四档放大倍率和 8 个组织学亚型(4 良性 + 4 恶性)。
它是计算病理学领域"第一个被社区广泛采纳的乳腺癌图像基准"——原始论文在 OpenAlex 的引用已超过 1,800 次(截至 2026-09),综述统计其在乳腺病理公开数据集中的使用率约 65%,居同类之首。它定义了一套沿用至今的评测纪律:患者级 70/30 五次试验划分 + 患者/图像双层准确率(PLA/ILA)——凡是不遵守这套纪律而报出的"99% 准确率",都值得怀疑(见 §6.5 坑点 1 与坑点 7)。
你可以用它来:训练并基准化乳腺病理图像良恶性分类器、做 8 类亚型细分类研究、验证模型跨放大倍率的鲁棒性、或作为计算病理学课程与迁移学习实验的标准教学数据集。
§1.1 摘要
BreakHis 由 Spanhol、Oliveira、Petitjean、Heutte 四人团队构建,图像采集自 2014 年 1-12 月巴西巴拉那 P&D Laboratory 的一项临床研究——所有因临床指征就诊于该实验室的患者均受邀参与,经 IRB 批准并签署书面知情同意。组织样本通过开放式手术活检(SOB)获取,经常规 FFPE 处理与 H&E 染色后,由经验丰富的病理医师做出诊断并经免疫组化等补充检查确认。成像设备为 Olympus BX-50 显微镜(3.3× 中继镜)配 Samsung SCC-131AN 数字相机,每张图像 700×460 像素、RGB 8-bit、PNG 无损保存。数据集只有 BreaKHis_v1 一个版本(约 4 GB),目录按「良恶性 → 亚型 → 切片 → 倍率」组织,标签与全部元信息均编码在目录路径与 SOB 文件名中。官方同步发布 mkfold 脚本,可一键生成复现原论文实验结构的 5 个患者级训练/测试折。
§1.2 战略价值分析
基准开创维度:2015 年之前,乳腺癌组织病理图像研究散落在各机构的私有数据上,不同论文使用不同采集设备、不同人群、不同评估指标,方法之间几乎无法比较。BreakHis 第一次把"公开数据 + 固定患者级划分 + 统一指标(PLA/ILA)"三件套带进了乳腺病理图像分类领域。Spanhol 等人在论文摘要中直言其动机:“不同论文使用不同评估方式,使得方法间难以比较”——BreakHis 正是为终结这种状态而生。此后 BACH/ICIAR2018、Camelyon、PCam 等一系列病理基准延续了同一思路,BreakHis 可视为计算病理学"基准时代"的开端之一。
评测纪律维度:BreakHis 对领域最深远的贡献不是图像本身,而是它强制推行的一条铁律——同一患者的图像必须整体落在训练集或测试集一侧。82 名患者、人均约 96 张图像的结构意味着,任何按图像随机划分的实验都会把同一患者(甚至同一组织视野的不同倍率)同时泄入训练与测试两侧,把准确率人为推高 10 个百分点以上。原论文同步发布 mkfold 五次试验划分文件,使后续工作可以在完全相同的患者分组上公平比较。今天回头看,2016-2019 年间大量在 BreakHis 上报告 >95% 的论文与严守患者级纪律的 85-90% 基线之间的落差,正是这条铁律重要性的最好注脚(详见 §6.5 坑点 1)。
生态推动维度:BreakHis 已成为病理图像分析领域的"Hello World"级基础设施——官方页面显示其被 141 个国家的用户下载 7,726 次(截至 2022-11-30);Kaggle 与 HuggingFace 存在多个高流量镜像;从 AlexNet 时代的 patch 融合 CNN 到 ViT 时代的半监督 Transformer,每一代图像分类技术几乎都先在 BreakHis 上"过一遍"。对教学而言,它是少数几个"一个下午就能完成下载-训练-评估全流程"的医疗图像数据集。
§1.3 横向对比
| 数据集 | 图像数/患者数 | 模态与倍率 | 标注粒度 | 核心差异化 |
|---|---|---|---|---|
| BreakHis | 7,909 / 82 | H&E 显微图像,40×-400× 四倍率 | 图像级(良/恶 + 8 亚型) | 乳腺病理分类事实基准;官方患者级划分;四倍率设计独有 |
| BACH / ICIAR2018 | 400 + 30 WSI / 未披露 | H&E 显微图像,200× | 图像级 4 类(Normal/Benign/InSitu/Invasive) | 含正常类与 WSI;规模小一个数量级 |
| Camelyon16/17 | 约 1,300 WSI / 400+ | 淋巴结 H&E 全切片 | 像素级转移灶标注 | 检测/分割任务;WSI 规模 |
| PatchCamelyon (PCam) | 327,680 patches / 源自 Camelyon | H&E 96×96 patch | patch 级二分类 | 量大但无患者元数据、无亚型 |
| TCGA-BRCA | 约 1,100 例 WSI | H&E 全切片 + 分子分型 | 病例级 + 组学 | 多模态、有临床结局;访问受控 |
| BreCaHAD | 162 / 未披露 | H&E 细胞级显微 | 细胞核/有丝分裂级 | 微观结构研究专用 |
BreakHis 的不可替代性在三点:四档放大倍率系统成像(独一份,支持倍率鲁棒性研究)、官方患者级五次试验划分(复现纪律最好)、以及"足够小可以单机训练、足够规范可以公平比较"的甜点规模。
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 2014-01 至 2014-12 | P&D Laboratory 临床研究采集期:82 名患者 SOB 活检样本制片与数字化 |
| 2015-09 | Spanhol et al. 论文 arXiv 预印本发布,数据集随 UFPR VRI 官网开放下载 |
| 2015-12 | IEEE TBME 在线发表(DOI: 10.1109/TBME.2015.2496264 注册生效) |
| 2016-07 | IEEE TBME 63 卷 7 期正式刊出(pp. 1455-1462) |
| 2016-07 | Spanhol et al. IJCNN 2016:首个 CNN 方案(AlexNet 变体 + patch 融合),PLA 90.0%(40×) |
| 2016-10 | Bayramoglu et al. ICPR 2016:首个倍率无关(magnification-independent)CNN |
| 2017 | Han et al.(Scientific Reports 7:41724)CSDCNN:8 分类患者级准确率 ≈93.2%,亚型细分类里程碑 |
| 2018-2019 | DenseNet(Nawaz)、ResNet-152(Motlagh)、IRRCNN(Alom)、MIL(Sudharshan, ESWA)等迁移学习与多示例方案密集涌现 |
| 2022-11-30 | 官方页面统计:被 141 个国家下载 7,726 次 |
| 2024-2025 | ViT/半监督时代:ATS-ViT、Hybrid Xception-Transformer 等;Gella 2024 报 99.99% 但评估口径存在泄漏(§6.5 坑点 7) |
§1.5 典型 AI 应用场景
- 乳腺病理良恶性二分类基准:BreakHis 的主战场任务——82 名患者、官方五次试验划分上比较新架构,是与十年文献对话的标准姿势。
- 8 类组织学亚型细分类:良性 4 亚型(腺病/纤维腺瘤/管状腺瘤/叶状肿瘤)+ 恶性 4 亚型(导管/小叶/黏液/乳头状癌),是细粒度病理分类的入门考场(注意 PT 仅 3 名患者的天然瓶颈,见 §6.5 坑点 4)。
- 跨倍率鲁棒性与多尺度方法研究:四档倍率系统成像为 magnification-dependent(MD)与 magnification-independent(MI)双协议提供了唯一现成的实验台。
- 迁移学习与教学:约 4 GB 体积 + 目录即标签,是"ImageNet 预训练 → 医疗微调"教学链路中最常用的医疗侧数据集之一;也是病理基础模型(foundation model)微调的常用下游评测集。
§2 医学背景
§2.1 ICD-11 疾病分类锚定
BreakHis 覆盖乳腺肿瘤的核心组织学谱系,8 个亚型到 ICD-11(WHO MMS v2025-01)的映射如下:
| BreakHis 亚型 | 中文名 | 良恶 | ICD-11 对应 | ICD-10 桥接 | 图像数(占比) |
|---|---|---|---|---|---|
| Adenosis (A) | 腺病 | 良性 | 非肿瘤性良性乳腺病(乳腺病谱系) | N60.2 乳腺纤维腺病 | 444(5.6%) |
| Fibroadenoma (F) | 纤维腺瘤 | 良性 | 2F30.5 乳腺纤维腺瘤 | D24 乳腺良性肿瘤 | 1,014(12.8%) |
| Tubular adenoma (TA) | 管状腺瘤 | 良性 | 2F30.0 乳腺管状腺瘤 | D24 | 453(5.7%) |
| Phyllodes tumor (PT) | 叶状肿瘤 | 良性(本库) | 2F30.3 乳腺良性叶状肿瘤 | D24 | 569(7.2%) |
| Ductal carcinoma (DC) | 浸润性导管癌 | 恶性 | 2C61 乳腺浸润性癌(主体类型) | C50 乳腺恶性肿瘤 | 3,451(43.6%) |
| Lobular carcinoma (LC) | 浸润性小叶癌 | 恶性 | 2C61 / 2C6Y 区间(特殊浸润类型) | C50 | 626(7.9%) |
| Mucinous carcinoma (MC) | 黏液癌 | 恶性 | 2C60 特殊类型乳腺癌 | C50 | 792(10.0%) |
| Papillary carcinoma (PC) | 乳头状癌 | 恶性 | 2C64 实性乳头状癌伴浸润(近似) | C50 | 560(7.1%) |
映射要点:(1) 腺病(adenosis)是增生性良性乳腺病而非真性肿瘤,ICD-11 中落在乳腺疾病章节而非肿瘤章节,本表以 ICD-10 N60.2 桥接;(2) BreakHis 的 PT 均为良性叶状肿瘤,恶性叶状肿瘤另有 ICD-11 2C63;(3) 导管癌占比 43.6% 与临床流行病学一致——浸润性导管癌(NST)约占全部乳腺癌的 70-80%,是最常见的乳腺癌组织学类型。
§2.2 SNOMED CT 映射
| BreakHis 亚型 | ICD-11 | SNOMED CT | SNOMED CT 术语 |
|---|---|---|---|
| 恶性肿瘤总览 | 2C6Z | 254837009 | Malignant neoplasm of breast (disorder) |
| Ductal carcinoma | 2C61 | 408643008 | Infiltrating duct carcinoma of breast (disorder);形态学 82711006(M-85003) |
| Lobular carcinoma | 2C61/2C6Y | 89740008 | Lobular carcinoma (morphologic abnormality)(M-85203) |
| Mucinous carcinoma | 2C60 | 72495009 | Mucinous adenocarcinoma(M-84803 对应概念) |
| Papillary carcinoma | 2C64 | 64524002 | Intraductal papillary adenocarcinoma with invasion (morphologic abnormality)(M-85033) |
| Fibroadenoma | 2F30.5 | 1156873009 | Fibroadenoma, no ICDO subtype (morphologic abnormality)(M-90100) |
形态学编码(M-code)依据英国皇家病理学会(RCPath)乳腺病理 SNOMED 编码附录;腺病、管状腺瘤、叶状肿瘤的细粒度 SNOMED CT 概念未在公开编码表中稳定对应,临床应用时建议在 SNOMED CT Browser 中以 “adenosis of breast” / “tubular adenoma of breast” / “benign phyllodes tumour” 检索最新概念。
§2.3 疾病简介
乳腺癌是全球女性发病率最高的恶性肿瘤:GLOBOCAN 2022 估计全球年新发约 230 万例、死亡约 67 万例,占女性癌症死亡的约 15%。组织病理学检查是乳腺癌确诊的金标准——影像筛查(钼靶/超声/MRI)只能给出 BI-RADS 风险评估,最终定性必须依靠活检组织的显微镜下形态学判读。判读要点包括:腺体结构是否紊乱、细胞核异型性程度、有无间质浸润与核分裂象。病理医师首先区分良恶性,再进一步判定组织学亚型——亚型直接影响预后评估与治疗策略(如黏液癌预后较好,浸润性导管癌需按分级分期系统治疗)。低年资医师间的判读一致性有限,这正是计算机辅助诊断(CAD)的临床切入点。
§2.4 临床任务定义
| AI 任务 | 临床对应 | 在 BreakHis 中的操作化 | 备注 |
|---|---|---|---|
| 良恶性鉴别(筛查辅助) | 活检组织的初筛分诊 | 二分类:B(2,480 张)vs M(5,429 张) | 官方协议主任务;恶性为 positive |
| 组织学亚型判定 | 病理报告中的类型诊断 | 8 分类:A/F/TA/PT/DC/LC/MC/PC | 亚型决定预后与治疗方向 |
| 放大倍率鲁棒性 | 病理医师低倍扫片→高倍确认的工作流 | MD(单倍率训练测试)/ MI(混倍率)双协议 | 对应临床"由低到高"阅片习惯 |
| 迁移学习基准 | 小样本医疗场景的通用方法论 | ImageNet 预训练 → BreakHis 微调 | 社区最常用用法 |
临床边界必须说清:BreakHis 图像是 700×460 像素的"视野级"裁剪图像,不是全切片(WSI);真实病理诊断需要在整张切片甚至多张切片间游走、结合临床信息与免疫组化。在 BreakHis 上达到 95% 不等于能做临床诊断——它证明的是"视野级形态可分性",这是 CAD 链条的第一环而非全部。
§2.5 患者人群特征
| 维度 | 特征 |
|---|---|
| 数据来源 | 单中心:P&D Laboratory – Pathological Anatomy and Cytopathology,巴西巴拉那州 |
| 采集时间 | 2014 年 1-12 月(文件名中两位年份字段均为 “14”) |
| 患者规模 | 82 名:良性 24 名 / 恶性 58 名 |
| 亚型患者分布 | 良性:F 10、TA 7、A 4、PT 3;恶性:DC 38、MC 9、PC 6、LC 5 |
| 入组方式 | 临床研究中因乳腺病变就诊且具活检指征的患者全部受邀;IRB 批准 + 书面知情同意 |
| 活检方式 | 开放式手术活检(SOB,surgical open biopsy / 部分乳房切除)——比粗针穿刺组织量更大 |
| 年龄/性别/种族 | 未公开(无临床元数据;巴西人群、推定女性为主,男性乳腺癌未见披露) |
| 人均图像数 | 约 96 张/患者(7,909 / 82),高度不均:DC 患者人均约 91 张,PT 患者人均约 190 张 |
| 伴随检查 | 诊断经免疫组化(IHC)等补充检查确认(IHC 图像不在库内) |
关键解读:82 名患者是理解 BreakHis 一切统计结论的"分母"。患者数而非图像数决定统计功效——8 分类任务中叶状肿瘤(PT)只有 3 名患者,任何患者级划分下测试集至多 1 名 PT 患者,亚型级指标的天然方差极大(见 §6.5 坑点 4)。
§2.6 金标准/参考标准
| 标注对象 | 标注方式 | 标注者 | 金标准性质 |
|---|---|---|---|
| 患者诊断(良/恶 + 亚型) | 常规组织病理诊断流程,H&E 切片镜检 | P&D Laboratory 经验丰富的病理医师(解剖病理与细胞病理专科) | 临床金标准;并经免疫组化等补充检查确认 |
| 图像级标签 | 患者级诊断直接继承到该患者全部图像 | —(无逐图复核) | 存在图像级标签噪声:单张 700×460 视野未必含典型肿瘤成分(见 §6.5 坑点 6) |
| 像素级标注(ROI/核/腺体) | 无 | 无 | 不提供——不支持分割/检测任务 |
伦理与脱敏:研究经机构伦理审查委员会(IRB)批准,全部患者签署书面知情同意,数据由源实验室匿名化处理后发布(Sudharshan et al. 2019 记载)。文件名中的切片编号(如 14-4659)为化名编号,不含任何直接身份标识。
§3 数据集规格
§3.0 版本抉择矩阵
BreakHis 只有 BreaKHis_v1 一个版本,不存在"选哪个版本"的问题;真正的选型问题是"该用 BreakHis 还是换别的乳腺病理数据集"。30 秒决策:
| 你的需求 | 推荐数据集 | 大小 | 理由 |
|---|---|---|---|
| 乳腺病理分类方法学基准、与十年文献可比 | BreakHis v1 | ~4 GB | 唯一带官方患者级划分与 PLA/ILA 指标的乳腺病理分类基准;引用 1,800+ 的对话基础 |
| 教学/快速原型/单机实验 | BreakHis v1(Kaggle 镜像) | ~4 GB | 目录即标签,半小时完成下载到训练;或先用 forderation/breakhis-400x(545 张 400× 子集)跑通管道 |
| 含"正常组织"类别的 4 分类 | BACH / ICIAR2018 | ~1 GB | BreakHis 无正常组织类;BACH 含 Normal/Benign/InSitu/Invasive,并有 30 张 WSI |
| 淋巴结转移检测、WSI 分割 | Camelyon16/17 | 数百 GB | 像素级标注的 WSI 检测基准,BreakHis 不支持 |
| 大规模 patch 预训练/线性探测 | PatchCamelyon (PCam) | ~7 GB | 327,680 张 patch,适合预训练与自监督,但无乳腺原发灶亚型 |
| 临床结局、分子分型、多组学 | TCGA-BRCA | TB 级 | 约 1,100 例 WSI + 组学 + 结局;受控访问,与 BreakHis 互补 |
一句话结论:方法学基准与教学首选 BreakHis;需要正常类、WSI、像素标注或临床结局时按上表换库。
§3.1 模态详细说明
BreakHis 为单一模态——乳腺组织 H&E 染色光学显微图像,四个放大倍率各一套:
- 40×(1,995 张):视野最大,看腺体架构与间质关系,最接近病理医师"低倍扫片"视角;良性病变的结构特征在此最清晰。
- 100×(2,081 张):架构与细胞形态的折中倍率,文献基线普遍在此表现最佳(Spanhol IJCNN 2016 PLA 88.4%、Han 2017 ILA 96.9%)。
- 200×(2,013 张):细胞核形态开始主导判别;社区实验最常用的单倍率(大量论文只报 200× 结果)。
- 400×(1,820 张):细胞级细节(核异型性、核分裂象),但视野小、组织代表性差、图像数最少,单倍率难度通常最高。
物理像素尺寸统一为 700×460(RGB,8-bit/通道,PNG 无损);原始相机分辨率为 752×582,发布前已裁剪去除无关区域。图像源自 SOB 手术活检样本的 FFPE 切片——不是冷冻切片、不是穿刺细胞学、不是 WSI。
§3.2 样本量拆分(8 亚型 × 4 倍率完整分布)
| 亚型(缩写) | 40× | 100× | 200× | 400× | 合计 | 患者数 |
|---|---|---|---|---|---|---|
| Adenosis (A) | 114 | 113 | 111 | 106 | 444 | 4 |
| Fibroadenoma (F) | 253 | 260 | 264 | 237 | 1,014 | 10 |
| Tubular adenoma (TA) | 109 | 121 | 108 | 115 | 453 | 7 |
| Phyllodes tumor (PT) | 149 | 150 | 140 | 130 | 569 | 3 |
| Ductal carcinoma (DC) | 864 | 903 | 896 | 788 | 3,451 | 38 |
| Lobular carcinoma (LC) | 156 | 170 | 163 | 137 | 626 | 5 |
| Mucinous carcinoma (MC) | 205 | 222 | 196 | 169 | 792 | 9 |
| Papillary carcinoma (PC) | 145 | 142 | 135 | 138 | 560 | 6 |
| 合计 | 1,995 | 2,081 | 2,013 | 1,820 | 7,909 | 82 |
| 聚合口径 | 良性 | 恶性 | 合计 |
|---|---|---|---|
| 40× | 625 | 1,370 | 1,995 |
| 100× | 644 | 1,437 | 2,081 |
| 200× | 623 | 1,390 | 2,013 |
| 400× | 588 | 1,232 | 1,820 |
| 总计 | 2,480 | 5,429 | 7,909 |
| 患者数 | 24 | 58 | 82 |
⚠️ 数字勘误提示:官方页面开头写有 “9,109 images”(正文与表格均为 7,909),系官方笔误,已被大量综述沿用(见 §6.5 坑点 3);官方页面 40× 良性列写 652,与行内合计 1,995 不自洽,多数文献(含 Sudharshan 2019 与 ATS-ViT 2022)按 625 记录——以本页亚型表(逐亚型合计反推 625)为准。
§3.3 数据格式详情
| 形态 | 格式 | 说明 |
|---|---|---|
| 发布文件 | BreaKHis_v1.tar.gz(PNG 无损) | UFPR 官网直链;Kaggle/HuggingFace 多个镜像 |
| 图像规格 | 700×460 px,RGB,8-bit/通道 | 统一尺寸,无需 resize 对齐(但输入 CNN 常需 224×224 等) |
| 标签载体 | 目录路径 + SOB 文件名 | 无 CSV/JSON 标签文件——目录即标签(见 §4.0/§4.1) |
| 官方划分 | mkfold.tar.gz(Python 脚本) | 生成 fold1-fold5 的患者级 train/test 目录结构 |
| 官方模型 | Caffe_models.tar.gz | 原论文策略 #4、fold 1、40×、第 80,000 次迭代快照(历史文物级) |
§3.4 存储大小
| 形态 | 大小 | 备注 |
|---|---|---|
| BreaKHis_v1.tar.gz | ~4 GB(Kaggle 元数据标 4.28 GB / 7,925 个文件) | 含 7,909 张 PNG + 目录结构 |
| 解压后 | ~4.5 GB | PNG 无损压缩率有限 |
| 400× 子集(社区裁剪版) | ~1 GB | Kaggle forderation/breakhis-400x(545 张) |
| 内存需求 | 全量转 float32 张量约 7 GB | 建议用 DataLoader 惰性加载,勿一次性读入内存 |
§3.5 标注方式
BreakHis 的标注是病例级临床诊断的图像级继承,分三层理解:
- 患者诊断层:P&D Laboratory 病理医师按常规临床流程对 H&E 切片做出良恶性与亚型诊断,并经免疫组化等补充检查确认——这是真正的金标准层。
- 切片/图像层:患者诊断直接赋给其名下全部切片与全部图像,无逐图 ROI 复核——图像层标签因此存在噪声(单张视野可能不含肿瘤成分)。
- 文件名编码层:标签随目录结构与文件名分发(
breast/benign/SOB/tubular_adenoma/SOB_B_TA-14-4659/40X/SOB_B_TA-14-4659-40-001.png),无独立标签文件。
§3.6 标注者资质
| 维度 | 说明 |
|---|---|
| 标注者 | P&D Laboratory 病理医师团队(解剖病理学与细胞病理学专科实验室) |
| 标注性质 | 临床常规诊断(非研究性二次标注),诊断经 IHC 等补充检查确认 |
| 一致性检验 | 官方未公布医师间一致性(kappa)数据——这是标签质量文档的主要缺口 |
| 去标识化 | 源实验室匿名化;IRB 批准 + 书面知情同意 |
§3.7 数据采集时间范围
2014 年 1 月至 12 月(文件名 <YEAR> 字段统一为 “14”)。数据集 2015 年随论文预印本公开,BreaKHis_v1 为唯一发布版本,此后无更新、无 changelog。
§3.8 地理覆盖
单中心——P&D Laboratory(巴西巴拉那州库里蒂巴地区)。全部样本来自该实验室的就诊人群,无多中心、无地域多样性。单中心 + 单设备 + 单染色协议是 BreakHis 泛化性限制的三连因(详见 §7.3)。
§3.9 采集设备规格
| 组件 | 规格 | 说明 |
|---|---|---|
| 显微镜 | Olympus BX-50 系统显微镜 | 配 3.3× 中继镜 |
| 相机 | Samsung SCC-131AN 数字彩色相机 | 原始分辨率 752×582,RGB |
| 物镜 | 4× / 10× / 20× / 40× | × 3.3× 中继镜 ≈ 等效 40×/100×/200×/400×(注:社区常按 1:10 标注倍率) |
| 制片 | FFPE 标准石蜡方法 + H&E 染色 | 常规临床流程 |
| 发布规格 | 700×460 px PNG(裁剪后) | 去除边缘无关区域 |
§3.10 深度溯源链
| 环节 | 系统/方法 | 关键转换 |
|---|---|---|
| 1. 临床入口 | P&D Laboratory 就诊患者(2014 年,具乳腺活检指征) | IRB 批准 + 书面知情同意入组 |
| 2. 组织获取 | 开放式手术活检(SOB / 部分乳房切除) | 比穿刺更大组织量,住院全麻下完成 |
| 3. 制片 | FFPE + H&E 染色(常规临床流程) | 标准石蜡方法保持组织结构 |
| 4. 诊断 | P&D 病理医师镜检 + IHC 补充确认 | 形成患者级金标准(良/恶 + 亚型) |
| 5. 数字化 | Olympus BX-50 + 3.3× 中继镜 + Samsung SCC-131AN | 四档倍率系统成像;病理医师选定视野 |
| 6. 后处理 | 裁剪至 700×460、PNG 保存 | 去除无关区域;患者诊断继承至每张图像 |
| 7. 发布 | UFPR VRI 官网 BreaKHis_v1.tar.gz(2015) | 匿名化文件名;mkfold 五次试验划分脚本同步发布 |
§4 数据结构详解
§4.0 目录结构预览
BreaKHis_v1/
└── histology_slides/
└── breast/
├── benign/
│ └── SOB/
│ ├── adenosis/
│ │ └── SOB_B_A-14-22549AB/ # 切片级目录(≈患者/病灶级)
│ │ ├── 40X/
│ │ │ ├── SOB_B_A-14-22549AB-40-001.png
│ │ │ └── ...
│ │ ├── 100X/
│ │ ├── 200X/
│ │ └── 400X/
│ ├── fibroadenoma/
│ │ └── SOB_B_F-14-23060AB/ ...(共 10 名患者多张切片)
│ ├── tubular_adenoma/
│ │ └── SOB_B_TA-14-4659/ ...
│ └── phyllodes_tumor/
│ └── SOB_B_PT-14-29315EF/ ...(仅 3 名患者)
└── malignant/
└── SOB/
├── ductal_carcinoma/
│ └── SOB_M_DC-14-12312/ ...(38 名患者,3,451 张)
├── lobular_carcinoma/
├── mucinous_carcinoma/
└── papillary_carcinoma/
SOB 文件名 BNF 解码(官方页面规范):
<BIOPSY_PROCEDURE>_<TUMOR_CLASS>_<TUMOR_TYPE>-<YEAR>-<SLIDE_ID>-<MAG>-<SEQ>.png
SOB _ B _ TA - 14 - 4659 - 40 - 001.png
BIOPSY_PROCEDURE ::= SOB(surgical open biopsy,全库唯一取值)
TUMOR_CLASS ::= M | B(恶性 / 良性)
TUMOR_TYPE ::= A | F | PT | TA(良性)/ DC | LC | MC | PC(恶性)
YEAR ::= 14(2014 年,全库唯一取值)
SLIDE_ID ::= 切片编号(含字母后缀如 22549AB,患者/病灶级聚合的关键)
MAG ::= 40 | 100 | 200 | 400
SEQ ::= 同倍率下的图像序号(001 起)
§4.1 DAIMS 标准化字段描述表
BreakHis 无 CSV 标签文件,"字段"全部由目录路径与文件名承载。按下表解析即可构建标准 DataFrame:
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| image | PNG 700×460×3 | H&E 显微图像本体 | — | 模型输入 | 四倍率近重复(同源 ROI) | 无缺失 | uint8 [0,255] |
| filename | string | 完整文件名(含全部元信息) | SOB_B_TA-14-4659-40-001.png | 元信息解析入口 | 无 | 无 | BNF 固定格式 |
| tumor_class | string | 良/恶二分类标签 | “B” | 主任务标签 | 患者诊断直接继承(图像级噪声) | 无缺失 | B / M |
| tumor_subtype | string | 8 类亚型标签 | “TA” | 细分类任务标签 | 同上 | 无缺失 | A/F/TA/PT/DC/LC/MC/PC |
| magnification | int | 放大倍率 | 40 | MD/MI 协议切分轴 | 目录名与文件名一致 | 无缺失 | 40/100/200/400 |
| slide_id | string | 切片编号(患者级划分代理键) | “14-4659” | GroupKFold 的 groups 键 | 同患者可有多张切片(后缀 AB/EF 等);严格患者级需按官方 fold 文件 | 无缺失 | 14-* 编号空间 |
| year | int | 采集年份 | 2014 | 无分析价值(单一年份) | — | 无缺失 | 2014 |
| seq | int | 同倍率图像序号 | 1 | 无 | — | 无缺失 | ≥1 |
工程铁律:
slide_id是最细的患者代理键,但同一患者的多张切片(如 22549AB 与 22549CD)共享患者身份。正式实验必须直接采用官方 mkfold 五次试验划分文件,不要自行从文件名"猜"患者映射——猜错一位患者就是一次静默泄漏(见 §6.5 坑点 2)。
§4.2 标签分布统计
| 任务 | 分布 | 说明 |
|---|---|---|
| 二分类(图像级) | 良性 2,480(31.4%)/ 恶性 5,429(68.6%) | 不平衡比 ≈ 1 : 2.19 |
| 二分类(患者级) | 良性 24(29.3%)/ 恶性 58(70.7%) | 与图像级接近 |
| 8 分类(图像级) | DC 43.6% / F 12.8% / MC 10.0% / LC 7.9% / PC 7.1% / PT 7.2% / TA 5.7% / A 5.6% | DC 一类占近半 |
| 8 分类(患者级) | DC 38 / F 10 / MC 9 / TA 7 / PC 6 / LC 5 / A 4 / PT 3 | PT 仅 3 名患者——亚型指标方差极大 |
| 倍率分布 | 40× 25.2% / 100× 26.3% / 200× 25.5% / 400× 23.0% | 近似均衡,400× 略少 |
§4.3 关键字段描述性统计
- 人均图像数 ≈ 96.5 张(中位数显著低于均值——图像数向 DC 大患者集中)。
- 每张切片通常对应 4 个倍率目录,但并非每张切片四倍率齐全(400× 总数最少即源于部分视野未采 400×)。
- 同一 ROI 的 40×/100×/200×/400× 图像间存在视觉嵌套关系(高倍视野 ⊂ 低倍视野)——这是"近重复"问题的解剖学根源。
- 单张 PNG 约 0.5-0.6 MB;全库读入为 uint8 张量约 7.3 GB(7,909 × 700 × 460 × 3 字节)。
§4.4 数据层级关系(患者 → 切片 → 倍率 → 图像)
PATIENT(82 人;无显式 patient_id,由官方 fold 文件定义分组)
└─ SLIDE(切片目录,如 SOB_M_DC-14-12312;一名患者可有多张切片)
└─ MAGNIFICATION(40X / 100X / 200X / 400X 四个子目录,可能不齐)
└─ IMAGE(SEQ 编号的 PNG;同一 ROI 跨倍率近重复)
- 泄漏的三条路径:(1) 同患者多切片跨集;(2) 同切片不同倍率跨集(MI 实验特有);(3) 同倍率下相邻视野(高度相似的连续帧)跨集。官方 mkfold 划分一次性封死全部三条——这就是必须使用它的理由。
- 文件名
SLIDE_ID中的字母后缀(AB/CD/EF)源自实验室编号习惯,不能当作不同患者处理,也不能保证同字母段即同患者——患者级映射以官方 fold 文件为唯一权威。
§4.5 缺失值情况与信息性缺失编码
| 缺失类型 | 字段 | 缺失机制 | 影响与对策 |
|---|---|---|---|
| 结构性缺失(整列不存在) | 年龄、性别、种族、ER/PR/HER2、分级、结局 | 数据集设计即不含临床元数据 | 公平性分析、生存分析、分子分型研究均不可做——需换 TCGA-BRCA 等 |
| 倍率不齐 | magnification | 部分视野未采全四档 | MI 实验按图像对齐统计时注意分母差异 |
| 标签噪声型"伪缺失" | 图像级标签 | 患者诊断继承,视野内可能无肿瘤 | 见 §6.5 坑点 6:MIL/注意力聚合可缓解 |
| 元数据文件缺失 | CSV/JSON 清单 | 官方不提供 | 自行用 §6.3 脚本扫描目录生成 manifest |
§5 数据划分与使用建议
§5.1 官方数据划分
官方协议(Spanhol 2016):按患者级 70% 训练 / 30% 测试随机划分,独立重复 5 次(5 trials),报告均值与标准差。官方发布 mkfold.tar.gz,运行 python mkfold.py 后生成 fold1-fold5 目录,每折内含该次试验的患者级 train/test 文件清单(通过目录软链/拷贝组织)。划分随数据集公开,保证任何两篇遵守协议的论文结果严格可比——这是 BreakHis 最宝贵的资产。
两个关键细节:
- 划分在每个倍率内部独立进行(MD 协议);原论文的基线实验按倍率分别训练与评估。
- 官方指标为 PLA(患者级准确率)与 ILA(图像级准确率),恶性为 positive(见 §6.9)。
§5.2 推荐划分策略
- 复现/对比文献:直接使用官方 mkfold fold1-5,报告 5 次试验的 mean±std——没有第二种"正确"姿势。
- 自建实验(无对照需求):按患者代理键(slide_id → 患者映射)做 GroupKFold;scikit-learn 用
GroupKFold(n_splits=5)或GroupShuffleSplit(test_size=0.3, n_splits=5),groups 必须来自官方 fold 文件的患者分组,而非自行猜测。 - 验证集从训练集内切:官方协议只有 train/test 两段;需要早停/调参时,从 70% 训练患者内再切 10-15% 患者做验证,不得动用 30% 测试患者。
- MI(倍率无关)实验:把四倍率合并后仍按同一患者分组划分——切勿先按图像随机再分组(见 §6.5 坑点 5)。
# ========================================
# BreakHis 患者级划分校验 — 任何自定义实验的必经步骤
# 前提:manifest.csv 已含 filename / tumor_class / subtype / mag / slide_id / patient_id 六列
# patient_id 必须来自官方 fold 文件映射,不能从文件名猜测
# ========================================
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit
df = pd.read_csv("manifest.csv")
gss = GroupShuffleSplit(n_splits=5, test_size=0.3, random_state=42)
for trial, (tr, te) in enumerate(gss.split(df, groups=df["patient_id"]), 1):
train_p = set(df.iloc[tr]["patient_id"]); test_p = set(df.iloc[te]["patient_id"])
assert train_p.isdisjoint(test_p), f"trial {trial} 存在患者泄漏!"
# 附加校验:同一 slide_id 不得跨集(切片级泄漏双保险)
assert set(df.iloc[tr]["slide_id"]).isdisjoint(df.iloc[te]["slide_id"])
print("5 次试验患者级零泄漏校验通过")
§5.3 数据泄漏风险防御
| # | 泄漏模式 | 严重程度 | 防御措施 |
|---|---|---|---|
| 1 | 按图像随机划分(同患者图像跨集) | 致命 | 官方 mkfold 划分;或 GroupShuffleSplit(groups=patient_id) |
| 2 | 自行从文件名猜患者映射,猜错即泄漏 | 高 | 患者分组只用官方 fold 文件 |
| 3 | MI 实验中同一切片的不同倍率跨集 | 高 | MI 也按患者分组划分;禁止"先把四倍率合并再随机" |
| 4 | 数据增强在划分前执行(旋转/翻转副本跨集) | 高 | 先划分后增强,增强只作用于训练侧 |
| 5 | stain 归一化/标准化统计量用全库计算 | 中 | 均值方差、归一化参考图只从训练折估计 |
| 6 | 在测试折上挑 checkpoint / 报"5 折最优" | 中 | 报 5 次试验 mean±std;checkpoint 由验证折决定 |
§5.4 交叉验证建议
- 标准:官方 5 次 70/30 试验即等效于患者级 5 次 Monte Carlo 交叉验证;若用 GroupKFold,建议 n_splits=5 且与官方 fold 患者分组对齐以便与文献对照。
- 小亚型(PT 3 人 / A 4 人)在任何划分下都无法形成统计学意义的独立测试——8 分类结果必须附混淆矩阵与患者级样本量说明。
- 超参搜索建议嵌套:外层官方 fold,内层从训练患者切验证。
§5.5 外部验证
BreakHis 训练模型的经典外部验证路径:BACH/ICIAR2018(同为乳腺原发灶 H&E 显微图像,含正常类,注意标签体系映射为良/恶或合并 InSitu+Invasive)、TCGA-BRCA WSI 裁剪视野(跨中心、跨扫描仪、跨染色协议的终极压力测试)、Databiox(922 张,伊朗人群,WHO 分级任务)。社区经验值:BreakHis 上 95%+ 的模型跨库到 BACH/TCGA 视野后普遍回落 5-15 个百分点(见 §7.8)。
§6 AI 就绪指南
§6.0 云端快速启动
Kaggle 零下载体验:Kaggle 数据集
ambarish/breakhis为官方 BreaKHis_v1 的完整镜像(4.28 GB / 7,925 文件),新建 Kaggle Notebook → Add Data 搜索 “breakhis” 即可免下载开工,免费 GPU(T4/P100)足够完成 ResNet 微调基线。教学场景可先用forderation/breakhis-400x(545 张 400× 子集,约 1 GB)跑通全流程。HuggingFace 生态:社区已上传若干 BreakHis 镜像与微调权重(如 Gella 2024 的
sloshywings/breakhis-model-ranger-rotations-5-fold-0),可直接datasets.load_dataset或加载权重做线性探测——注意镜像的标签目录结构与官方一致,但患者级划分仍需回到官方 mkfold 文件。
§6.1 快速上手(PyTorch 版)
# ========================================
# BreakHis 快速上手 — PyTorch 版(良恶性二分类,40× 单倍率)
# 环境要求: torch>=2.0, torchvision, pandas, scikit-learn
#
# ⚠️ 目录结构预期:
# 请将 BreaKHis_v1.tar.gz 解压至 ./data/ 目录,确保以下结构:
# ./data/BreaKHis_v1/histology_slides/breast/
# ├── benign/SOB/{adenosis,fibroadenoma,tubular_adenoma,phyllodes_tumor}/...
# └── malignant/SOB/{ductal,lobular,mucinous,papillary}_carcinoma/...
#
# 标签不在 CSV 中——从目录路径解析:
# ./data/BreaKHis_v1/histology_slides/breast/benign/SOB/tubular_adenoma/
# SOB_B_TA-14-4659/40X/SOB_B_TA-14-4659-40-001.png
# 即 tumor_class=B, subtype=TA, slide=14-4659, mag=40X, seq=001
# ========================================
from pathlib import Path
import re
import pandas as pd
ROOT = Path("./data/BreaKHis_v1/histology_slides/breast")
rows = []
pat = re.compile(r"SOB_([BM])_([A-Z]+)-(\d+-\w+)-(\d+)-(\d+)\.png")
for p in ROOT.rglob("*.png"):
m = pat.match(p.name)
cls, subtype, slide, mag, seq = m.groups()
rows.append(dict(path=str(p), tumor_class=cls, subtype=subtype,
slide_id=slide, mag=int(mag), seq=int(seq)))
df = pd.DataFrame(rows)
print(df.shape) # 期望 (7909, 6)——不是这个数先检查解压完整性
print(df["mag"].value_counts()) # 40:1995 / 100:2081 / 200:2013 / 400:1820
# 二分类 + 40× 子集
df40 = df[df["mag"] == 40].copy()
df40["label"] = (df40["tumor_class"] == "M").astype(int) # 恶性=1(官方 positive 约定)
from torch.utils.data import Dataset
from torchvision import transforms
from PIL import Image
class BreakHisDataset(Dataset):
def __init__(self, frame, tfm):
self.f, self.t = frame.reset_index(drop=True), tfm
def __len__(self): return len(self.f)
def __getitem__(self, i):
r = self.f.iloc[i]
return self.t(Image.open(r["path"]).convert("RGB")), r["label"]
tfm = transforms.Compose([
transforms.Resize((224, 224)),
transforms.ToTensor(),
transforms.Normalize([0.485, 0.456, 0.406], [0.229, 0.224, 0.225]), # ImageNet 统计
])
# 训练/测试划分:务必使用官方 mkfold 患者分组(§6.2),此处仅占位演示 Dataset 用法
§6.2 数据获取流程
| 获取方式 | 链接/位置 | 大小 | 流程 |
|---|---|---|---|
| 官网直链 | http://www.inf.ufpr.br/vri/databases/BreaKHis_v1.tar.gz | ~4 GB | 无需注册;官方请求下载后填写信息表单(姓名/邮箱/机构,非强制);下载页见官方主页 |
| 官方划分脚本 | http://www.inf.ufpr.br/lesoliveira/download/mkfold.tar.gz | 小 | 解压 → 把 BreaKHis_v1.tar.gz 拷入 → 解压 → python mkfold.py → 生成 fold1-5 |
| 官方 Caffe 模型 | http://www.inf.ufpr.br/lesoliveira/download/Caffe_models.tar.gz | 中 | 原论文策略 #4(fold 1, 40×)历史快照,仅供考古 |
| Kaggle 镜像 | kaggle.com/datasets/ambarish/breakhis | 4.28 GB | Kaggle 账号一键 Add Data / kaggle datasets download |
| HuggingFace 镜像 | 搜索 “breakhis” | ~4 GB | datasets.load_dataset,注意核对镜像完整性(7,909 张) |
合规要点(发表前必查):(1) 官方条款为 CC BY 4.0 + 限非商业研究用途;(2) 发表成果必须引用 Spanhol et al. 2016(IEEE TBME,DOI: 10.1109/TBME.2015.2496264);(3) 镜像平台标注的许可(如 CC BY-NC-SA)与官网表述并存时以官网为准(见 §6.5 坑点 8)。
§6.3 预处理 Pipeline
<details>
<summary><b>点击展开完整的 4 步预处理代码(生成 manifest → 染色归一化 → 张量管道)</b></summary>
# 步骤 1:扫描目录生成 manifest(整个数据集唯一的"标签文件",自行生成)
from pathlib import Path
import re, pandas as pd
ROOT = Path("./data/BreaKHis_v1/histology_slides/breast")
pat = re.compile(r"SOB_([BM])_([A-Z]+)-(\d+-\w+)-(\d+)-(\d+)\.png")
rows = []
for p in sorted(ROOT.rglob("*.png")):
cls, subtype, slide, mag, seq = pat.match(p.name).groups()
# 目录与文件名双源校验(防镜像被改动)
assert ("benign" if cls == "B" else "malignant") in str(p)
rows.append([str(p), cls, subtype, slide, int(mag), int(seq)])
df = pd.DataFrame(rows, columns=["path", "tumor_class", "subtype",
"slide_id", "mag", "seq"])
assert len(df) == 7909
df.to_csv("manifest.csv", index=False)
# 步骤 2:合并官方 mkfold 患者分组(fold1-5 的 train/test 文件清单)
# mkfold 生成的 fold 目录内含患者级文件列表;据此为 manifest 打上
# patient_id 与 split_trial{1..5} 两列——这是唯一权威的患者映射。
# 步骤 3:H&E 染色归一化(可选但推荐——跨切片染色差异是主要域偏移源)
# pip install staintools
import staintools
normalizer = staintools.StainNormalizer(method="macenko")
# ⚠️ 参考图只能来自训练折(防泄漏,§5.3 第 5 条)
ref = staintools.read_image("train_ref.png")
normalizer.fit(ref)
# 步骤 4:训练侧张量管道(Resize/增强/归一化)+ 评估侧确定性管道
from torchvision import transforms
train_tfm = transforms.Compose([
transforms.Resize((224, 224)),
transforms.RandomHorizontalFlip(), transforms.RandomVerticalFlip(),
transforms.RandomRotation(90),
transforms.ColorJitter(brightness=0.1, contrast=0.1, saturation=0.1, hue=0.02),
transforms.ToTensor(),
transforms.Normalize([0.485, 0.456, 0.406], [0.229, 0.224, 0.225]),
])
eval_tfm = transforms.Compose([
transforms.Resize((224, 224)),
transforms.ToTensor(),
transforms.Normalize([0.485, 0.456, 0.406], [0.229, 0.224, 0.225]),
])
</details>
三种社区主流输入策略(按文献频率排序):
- 整图 resize 到 224×224:最简单,与官方/综述基线可比性最好(Han 2017、IRRCNN 等均为此类)。
- patch 提取(32×32 / 64×64)+ 融合:Spanhol IJCNN 2016 的原始方案,sum/product/max 融合 patch 预测;适合显存受限或 MIL 框架。
- 多尺度拼接:同一图像的多缩放版本并联输入(MSI-MFNet 等),利用 BreakHis 独有的倍率结构。
§6.4 框架加载
# PyTorch:患者级 DataLoader(groups 来自官方 fold 清单)
from torch.utils.data import DataLoader
train_loader = DataLoader(BreakHisDataset(train_df, train_tfm),
batch_size=32, shuffle=True, num_workers=4)
val_loader = DataLoader(BreakHisDataset(val_df, eval_tfm),
batch_size=64, shuffle=False, num_workers=4)
# 类别不平衡:按训练折类别频率设权重(良性:恶性 ≈ 1:2.19)
import torch
w = torch.tensor([len(train_df) / train_df["label"].value_counts().sort_index()])
criterion = torch.nn.CrossEntropyLoss(weight=w.float())
# TensorFlow / Keras:image_dataset_from_directory 直接消费官方目录结构
import tensorflow as tf
ds = tf.keras.utils.image_dataset_from_directory(
"./data/BreaKHis_v1/histology_slides/breast", # benign/ 与 malignant/ 两级即二分类
image_size=(224, 224), batch_size=32, shuffle=True)
# ⚠️ 该 API 按文件随机 shuffle——做正式实验时必须改用官方 fold 清单 + tf.data 手动构建
§6.5 常见坑点
⚠️ 坑点 1:按图像随机划分——82 名患者瞬间变成"7,909 个独立样本"的幻觉(分类:数据泄漏)
问题:人均约 96 张图像、同一 ROI 四个倍率、同切片相邻视野——按图像随机划分会把同一患者(甚至同一视野的不同倍率)同时泄入训练与测试两侧,准确率被人为推高 10 个百分点以上。这是 BreakHis 文献中最大的系统性误差来源,也是大量 >97% 结果的真正成因。
症状:测试准确率显著高于官方基线(85-90%)且标准差极小;训练很快收敛到近 100%;换成官方 mkfold 划分后性能"断崖式"回落。
解决:(1) 一律使用官方 mkfold fold1-5 患者级划分;(2) 自建实验用
GroupShuffleSplit(groups=patient_id),划分后断言患者集合零交集(§5.2 代码);(3) 审稿/复现他人工作时,第一件事就是检查其划分单位是 patient 还是 image。参考:Spanhol et al. 2016(官方协议原文);Metric Learning in Histopathological Image Classification(PMC10347273)——专门批评了图像级划分导致的虚高结果。
⚠️ 坑点 2:患者 ID 不在任何文件里——从文件名"猜"患者映射是俄罗斯轮盘(分类:工程陷阱)
问题:数据集没有 patient_id 字段;文件名只有切片编号(如 14-22549AB)。同一患者可有多张切片(AB/CD/EF 后缀是实验室编号习惯而非患者分隔符),自行编写正则"聚类"患者极易把同一患者拆到两侧或把不同患者合并。
症状:自查"患者数"时得到 100+ 或 60- 的错误数字;按此划分的实验标准差异常大。
解决:患者级分组只来自官方 mkfold fold 清单;把它与 manifest 按文件名 join 后,再断言
nunique(patient_id) == 82。任何教程里出现的"slide_id 即 patient_id"写法都只是近似,不可用于论文实验。参考:官方 mkfold.tar.gz 说明(UFPR VRI 官网);§4.4 层级关系。
⚠️ 坑点 3:9,109 与 700×460 的"笔误链"——引用规格前先核对原始页面(分类:标签理解)
问题:官方页面开头写有 “9,109 images”,但正文与分布表均为 7,909——该笔误被 PeerJ、Frontiers 等多篇综述沿用至今。类似地,原始相机分辨率 752×582(Sudharshan 2019)与发布版 700×460 并存于文献,甚至出现 780×460 的二次误写。良性 40× 列官方页面写 652,与行内合计 1,995 不自洽(应为 625)。
症状:论文/报告中的规模数字互相矛盾;按 9,109 写实验设计,实际只有 7,909 张。
解决:一切规格以「亚型 × 倍率分布表」(§3.2,逐格合计 7,909)为基准;引用时核对官方页面表格而非其导语;写论文时标注"7,909 images (Spanhol et al., 2016)"。
参考:UFPR VRI 官方页面;Sudharshan et al. 2019(ESWA)Table 1;Bioengineering 2022, 9, 391 Table 2。
⚠️ 坑点 4:8 分类的"皇帝新衣"——PT 只有 3 名患者(分类:偏倚陷阱)
问题:8 类亚型分布看似丰富,但患者级分布极端不均:DC 38 名患者 vs PT 3 名、A 4 名。任何患者级划分下,PT 测试集至多 1 名患者——该类的召回率只有 0% 或 100% 两种可能,亚型级指标近乎无统计意义。
症状:8 分类 macro-F1 在 5 次试验间剧烈波动;PT/A 类结果在 confusion matrix 上全好或全坏;不同论文的 8 分类分数差 5-10 个点。
解决:(1) 8 分类结果必须附 5 次试验 mean±std 与完整混淆矩阵;(2) 亚型结论以 F/DC/MC/LC/PC 等患者数 ≥5 的类为主,PT/A 只作定性展示;(3) 二分类(B/M)才是 BreakHis 上统计稳健的对比任务;(4) 需要亚型严谨结论时转向 TCGA-BRCA。
参考:Metric Learning 论文(PMC10347273)Table 2(亚型患者数);§4.2 分布表。
⚠️ 坑点 5:MD 与 MI 是两个不同实验——混读论文数值就是关公战秦琼(分类:评估误用)
问题:文献存在两套协议——magnification-dependent(每个倍率单独训练测试,报 4 个数)与 magnification-independent(四倍率合并训练测试,报 1 个数)。两者难度与分母都不同,绝对数值不可直接比较;MI 实验若按图像随机划分还会引入"同切片跨倍率"泄漏(坑点 1 的变体)。
症状:把某论文 MI 的 96% 与另一篇 MD@40× 的 90% 直接对比;MI 实验结果好得"不真实"。
解决:(1) 读表前先确认协议口径(MD/MI、患者级/图像级、单折/5 折均值);(2) 自己的实验同时报 MD 四档 + MI 一组,全部基于官方患者分组;(3) MI 划分同样按 patient_id 分组,禁止"先合并再随机"。
参考:Bayramoglu et al. 2016(首个 MI 协议);Hybrid Xception-Transformer 2025(IEEE Access,同时报 MD 96.15-100% 与 MI 94.82-99.62%)。
⚠️ 坑点 6:图像级标签噪声——那张 700×460 的视野里可能没有肿瘤(分类:标签理解)
问题:标签是患者诊断的直接继承。病理医师选视野时以"代表该区域"为目的,但单张图像(尤其 40× 低倍)可能以间质/正常腺体为主,不含典型肿瘤形态——标签与图像内容存在系统性错配,本质是弱监督/多示例学习(MIL)问题。
症状:训练后期准确率停滞;注意力/Grad-CAM 热区与标签矛盾的图像比例不低;提升 label smoothing 后泛化反而变好。
解决:(1) MIL 框架:patch 为 instance、图像/患者为 bag(Sudharshan 2019 的 ESWA 方案);(2) 注意力池化或多示例聚合替代硬标签交叉熵;(3) 高 label smoothing(0.1)+ 早停;(4) 不要把 BreakHis 的图像级标签当作"像素级肿瘤存在"的声明去训练分割器。
参考:Sudharshan et al. 2019, Expert Systems with Applications 117:103-115(MIL 方案与原理解析)。
⚠️ 坑点 7:>99% 的 SOTA 宣称——先问三个问题再相信(分类:评估误用)
问题:2020 年后多篇工作宣称 BreakHis 上 98-100% 准确率,但评估口径常存在致命缺陷。最典型的是 Gella 2024(bioRxiv 2024.08.17.608410)的 99.99%——其论文明确写道指标在"训练集与验证集的并集"上计算,即包含模型见过的数据;另有论文只报 5 折中的最优折、或在图像级划分上评估。
症状:数值显著高于 Han 2017(PLA ~96%)/ IRRCNN(~97%)等严协议经典;方法与数据并无量级创新却"吊打"十年文献。
解决:读任何 BreakHis 高分论文先问三问——(1) 测试集是否患者级独立?(2) 报的是 5 折均值还是最优折?(3) 指标是否在训练数据上计算?三问有一问答不上,该数值只能当上限参考。自己的实验严守官方协议,报 mean±std。
参考:Gella 2024 bioRxiv 原文(其方法部分自述评估口径);§8.1 排行榜的口径标注。
⚠️ 坑点 8:License 口径不一致——商用前必须拿到书面确认(分类:工程陷阱)
问题:官方页面同时出现"CC BY 4.0 International License"与"free for non-commercial research use"两种表述(CC BY 4.0 本身允许商用,与非商业条款存在张力);Kaggle 镜像又标注 CC BY-NC-SA 4.0。三种口径并存,商用合规边界模糊。
症状:法务问"能不能商用"时查不到统一答案;不同镜像页面说法打架。
解决:(1) 研究与教学:放心使用,发表必引 Spanhol 2016;(2) 任何商业用途:按"非商业条款存在"的保守口径处理,使用前去信 UFPR VRI 实验室(官网有联系方式)取得书面许可;(3) 再分发时保留原始许可声明与引用要求;(4) 引用镜像数据时核对镜像是否完整(7,909 张)。
参考:UFPR VRI 官方页面 License 段;Kaggle 数据集页 License 字段。
版本提示:BreakHis 自 2015 年发布后冻结于 v1,无 changelog;个别文献出现的 “BreakHis Version 2” 系引用笔误(官方仅有 v1)。复现实验时无需考虑版本差异,但需注意镜像完整性(标准校验:7,909 张 PNG + 官方文件名规范)。
§6.6 数据增强
| ✅ 安全增强 | ❌ 危险增强(禁止) |
|---|---|
| 水平/垂直翻转(组织无方向先验) | 划分前增强(副本跨集泄漏) |
| 90° 整数倍旋转 | 弹性形变过度(破坏腺体结构语义) |
| 亮度/对比度/饱和度 ±10%、hue ±0.02(模拟染色差异) | 强 Cutout/Random Erasing 遮盖关键核区 |
| stain 归一化后的小幅扰动(Macenko 空间) | 把四倍率图像 resize 后当作"新样本"混入——近重复 |
| Mixup/CutMix(仅训练折内、同类优先) | GAN 合成图像混入测试集 |
§6.7 模型推荐
| 场景 | 推荐方案 | 训练要点 | 官方协议下预期(PLA,二分类) |
|---|---|---|---|
| 快速基线(CPU/单卡) | ResNet-50 ImageNet 预训练 + 整图 224×224 微调 | 分层学习率(backbone 1e-4 / head 1e-3),label smoothing 0.1 | 88-93% |
| 复现经典 | AlexNet 变体 + 64×64 patch + max 融合(Spanhol IJCNN 2016) | patch 训练 + 图像级融合 | 84-90%(40× 最高 90.0%) |
| 8 分类上限探索 | GoogLeNet 系 + 层级分类头(CSDCNN 思路) | 先 B/M 后亚型的层级结构 | 8 分类 PLA ≈ 93%(Han 2017) |
| 现代架构验证 | ViT-Small / DeiT + 强增重 + 余弦退火;或 ATS-ViT 半监督 | 小数据防过拟合:mixup、 stochastic depth | 视协议 95%+(需严审口径) |
| MIL/弱监督方向 | patch-instance + 注意力 MIL 池化 | bag=图像或患者,缓解标签噪声 | 与强基线相当但更稳健 |
§6.8 计算资源需求
| 硬件 | 最小配置 | 推荐配置 |
|---|---|---|
| 磁盘 | 10 GB(数据 + manifest + checkpoint) | 20 GB(含 5 折镜像与增强缓存) |
| 内存 | 8 GB | 16 GB(stain 归一化批处理) |
| GPU | 无强制(CPU 可跑 ResNet-18 基线,小时级) | 1 × 8-16 GB(ViT/全量 5 折 × 4 倍率) |
| 训练时间 | ResNet-50 单倍率单折约 10-20 分钟(单卡) | 完整 5 折 × 4 倍率 MD 协议 ≈ 20 组实验,单卡半天 |
| 云端替代 | Kaggle 免费 GPU(T4)足够 | Colab + Drive 挂载镜像 |
§6.9 评估指标
官方双层指标(Spanhol 2016 定义,恶性为 positive):
import numpy as np
def ila(y_true, y_pred):
"""ILA(Image Level Accuracy,图像识别率):全库口径正确率"""
return (np.asarray(y_true) == np.asarray(y_pred)).mean()
def pla(df, y_true, y_pred):
"""PLA(Patient Level Accuracy,患者识别率):
先算每名患者内部被正确分类的图像比例,再对患者取平均。
df 需含 patient_id 列(来自官方 fold 分组)。"""
df = df.assign(ok=(np.asarray(y_true) == np.asarray(y_pred)))
return df.groupby("patient_id")["ok"].mean().mean()
社区共识报告规范:(1) 主指标 PLA(临床视角"每个患者判对了多少")+ ILA 并列;(2) 5 次试验 mean±std;(3) 二分类附 sensitivity(恶性召回)/specificity 与混淆矩阵;(4) 8 分类附 macro-F1 与 per-class 召回,并标注各类患者数;(5) 说明 MD 还是 MI 协议。
§6.10 MLOps 笔记
- 镜像完整性校验:下载后第一件事——7,909 张 PNG、文件名 100% 匹配 SOB 正则、四倍率计数 1,995/2,081/2,013/1,820。
- manifest 入库:把 §6.3 生成的 manifest.csv 与 fold 分组文件纳入版本管理(DVC/git),这是全部实验的"单一事实源"。
- 协议即配置:实验配置文件中显式声明
protocol: md|mi、fold: 1-5、split: official-mkfold,杜绝"忘了自己怎么划的"。 - 模型卡必填:BreakHis 训练的模型对外发布时,模型卡必须写明评估口径(患者级/图像级、5 折均值/单折、MD/MI)——这是该社区十年来的主要信任问题。
- 引用合规:发表必须引用 Spanhol 2016(IEEE TBME);使用镜像时同时核对镜像页的补充引用要求。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 单中心偏倚 | 全部样本来自巴西 P&D Laboratory 一家实验室,就诊人群、制片流程、医师判读风格单一 | 高 | BACH/TCGA-BRCA/Databiox 外部验证;结论限定"视野级形态分类" |
| 类别不平衡偏倚 | 恶性:良性 ≈ 2.19:1(图像级);DC 占全库 43.6% | 中高 | 类别权重/重采样;报告 per-class 指标而非仅 accuracy |
| 患者级稀疏偏倚 | PT 仅 3 人、A 仅 4 人;亚型结论统计功效不足 | 高(对 8 分类) | 亚型结论限患者数 ≥5 的类;8 分类报混淆矩阵 |
| 选择偏倚 | 仅 SOB 手术活检患者——不含穿刺活检、筛查阴性、晚期无法手术人群 | 中 | 明确外推边界;不用于"筛查阴性排除"场景 |
| 设备/染色同质偏倚 | 单一显微镜 + 单一相机 + 单实验室染色协议;无扫描仪多样性 | 中高 | stain 归一化 + 染色扰动增强;跨库验证 |
| 视野选择偏倚 | 视野由病理医师按"代表性"选取——比真实随机视野更"干净" | 中 | 宣称性能时注明"医师预选视野"前提 |
| 时代偏倚 | 2014 年采集、2016 年冻结;不含近年设备与染色流程演进 | 低(形态学稳定) | 与近期数据集(Databiox/Baheya)交叉验证 |
| 元数据缺失偏倚 | 无年龄/性别/种族/受体状态——公平性无法审计 | 中 | 论文中显式声明该限制 |
§7.2 标注质量评估
| 标注层 | 可靠性 | 一致性 | 局限性 |
|---|---|---|---|
| 患者诊断(良/恶) | 高——专科病理实验室临床常规 + IHC 确认 | 官方未公布医师间 kappa | 无二次独立复核机制披露 |
| 患者诊断(亚型) | 中高——亚型间形态过渡带客观存在(如纤维腺瘤 vs 叶状肿瘤) | 同上 | 罕见亚型判读依赖单实验室经验 |
| 图像级标签 | 中——患者诊断直接继承,视野内容未逐图复核 | 存在系统性图像级噪声 | 低倍率视野可能不含肿瘤成分(坑点 6) |
| 像素级标注 | 无 | 无 | 不支持分割/检测/ROI 任务 |
§7.3 泛化性讨论
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 跨机构(P&D → 其他实验室) | 高 | 染色协议与成像设备差异是计算病理学的经典域偏移源;PeerJ 综述(cs-3645)将 “single-center; stain variation” 列为 BreakHis 核心局限 |
| 跨数据集(→ BACH/ICIAR2018) | 中高 | 标签体系不同(BACH 含 Normal/InSitu);社区报道回落 5-15 个百分点 |
| 跨任务(分类 → WSI 诊断) | 高 | BreakHis 是医师预选视野级图像,WSI 需先在数十亿像素中定位 ROI——“视野分类好"不推出"切片诊断好” |
| 跨人群(巴西 → 其他地域) | 中 | 无种族元数据可审计;乳腺肿瘤形态学人种差异研究不足,风险未知 |
| 跨时间(2014 → 当代数字病理) | 低-中 | 形态学稳定,但当代扫描仪分辨率/色彩科学不同,需 stain 归一化适配 |
§7.4 伦理考量
- 数据来自真实乳腺肿瘤患者手术活检,其中恶性患者占 70%;研究者应保持对患者与家属的尊重——图像背后是真实的疾病经历。
- 研究经机构 IRB 批准、全部患者签署书面知情同意、源实验室完成匿名化;文件名切片编号为化名标识,使用者不得尝试任何形式的再识别。
- 官方许可含非商业研究约束与强制引用义务(Spanhol et al. 2016);商业产品开发前必须取得 UFPR 书面授权(§6.5 坑点 8)。
- 无人口学元数据意味着无法审计模型在不同年龄/族群患者上的公平性——基于此数据的任何"临床可用"宣称都应附带该限制声明。
- 该数据集训练的模型只能定位"研究原型",不得用于真实患者分诊;良恶性判读是具有法律后果的医疗行为。
§7.5 公平性评估
BreakHis 不含年龄、性别、种族等敏感属性,无法进行常规人群公平性审计——这本身就是必须声明的局限。可做的替代性公平分析是按"亚型/倍率"分组的性能均衡审计:
# 亚型 × 倍率分组的召回率审计(性能公平性的可行代理)
import pandas as pd
from sklearn.metrics import recall_score
audit = (df_test.assign(pred=y_pred)
.groupby(["subtype", "mag"])
.apply(lambda g: pd.Series({
"recall": recall_score(g["label"], g["pred"]),
"n_images": len(g),
"n_patients": g["patient_id"].nunique()})))
print(audit) # 重点关注 n_patients <= 3 的格子——其数值不具统计意义
已知差异:纤维腺瘤 vs 叶状肿瘤是最常见的良恶混淆对(形态谱系连续);DC 因样本与患者数优势,模型对其偏向性最强——8 分类下小类的低召回部分源于此结构性偏袒。
§7.6 数据漂移提示
- 库内漂移:四倍率间输入分布差异是"内源域偏移"——MD 协议下 400× 通常最难(视野小、噪声大);MI 模型需对倍率不变性显式建模。
- 部署漂移:任何 BreakHis 训练的模型面对新实验室数据时,首查染色分布(Macenko 空间距离)与成像分辨率差异;PSI 显著时先做 stain 归一化再评估。
- 冻结数据集的"时代红利":2014 年的形态学金标准不会因时间失效,但当代扫描仪的色彩科学差异需作为部署前检查项。
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据为宽格式(每行一个样本) | ✅ | 一图一记录,目录即标签 |
| 2 | 有唯一标识符列 | ⚠️ | 文件名即唯一 ID,但无独立清单文件,需自行生成 manifest |
| 3 | 无 Unicode 或特殊字符 | ✅ | 文件名与目录为纯 ASCII(SOB BNF 规范) |
| 4 | 无重复行 | ⚠️ | 无完全重复;但同 ROI 四倍率近重复图像客观存在,无官方去重说明 |
| 5 | 缺失值已识别并编码 | ✅ | 图像与标签无缺失;元数据"整列不存在"已在 §4.5 声明 |
| 6 | 标签列被明确标识 | ✅ | tumor_class / tumor_subtype 双级标签,文件名编码规范公开 |
| 7 | 已对罕见类别(<3%)进行分组 | ❌ | A(5.6%)/TA(5.7%)未合并;患者级 PT 仅 3 人,无官方处理建议 |
| 8 | 偏倚评估已完成 | ✅ | §7.1 列出 8 类偏倚与缓解措施 |
| 9 | 有完整的数据字典 | ⚠️ | 官方仅文件名 BNF 与分布表;无字段级数据字典(本页 §4.1 补齐) |
| 10 | 对"信息性缺失"有明确编码解释 | ❌ | 无临床元数据,官方无从讨论信息性缺失机制 |
| 11 | 数据采集设备和设置已记录 | ✅ | Olympus BX-50 + 3.3× 中继镜 + Samsung SCC-131AN + 物镜组合完整记录 |
| 12 | 已移除完全共线性变量 | ⚠️ | 图像模态不适用;近重复图像未去重 |
| 13 | 对编码的映射标准已说明 | ⚠️ | 官方无 ICD/SNOMED 映射;本页 §2.1/§2.2 补齐 |
| 14 | 对时间戳的处理已明确说明 | ⚠️ | 仅文件名两位年份 “14”;无更细时间粒度(单年采集,影响有限) |
| 15 | 训练/验证/测试划分建议已给出 | ✅ | 官方 70/30 患者级 5 次试验 + mkfold 脚本公开划分 |
| 16 | 数据泄漏风险已被讨论 | ✅ | §5.3 六条泄漏路径 + 官方患者级协议 |
| 17 | 标签分布已被分析 | ✅ | §4.2 图像级/患者级双口径分布 |
| 18 | 选择性测量偏倚已被讨论 | ✅ | SOB 入组 + 医师预选视野双重选择机制(§7.1) |
| 19 | 外部验证建议已给出 | ✅ | §5.5 / §7.8:BACH、TCGA-BRCA、Databiox 路径 |
| 20 | 数据更新和版本信息已记录 | ⚠️ | 仅 v1 单版本,无 changelog(单版本下影响有限) |
| 21 | 最小必要预处理脚本已提供 | ⚠️ | 官方仅 mkfold 划分脚本;无官方预处理/加载代码(社区已补齐) |
| 22 | 合规使用要求已明确 | ✅ | 非商业 + CC BY 4.0 + 强制引用;IRB/知情同意有文献记载 |
| 23 | 多模态对齐方法已说明 | ❌ | 单模态数据集,无多模态对齐需求(按不适用记 0) |
| 24 | 去标识化方法已被记录 | ✅ | 源实验室匿名化 + IRB 批准 + 书面知情同意(Sudharshan 2019 记载) |
DAIMS 评分:16.5 / 24
评分解读:良好偏上——采集文档、官方协议与合规链条是教科书级,扣分集中在元数据缺失、近重复未处理与版本管理。
对你意味着什么:BreakHis 的 11 个 ✅ 项集中在"实验可复现性"这一维度——官方患者级划分、PLA/ILA 指标、设备记录、合规链条,在 2015 年发布的数据集中属于超前设计。扣分项分两类:不可修复的(无临床元数据 #10、单模态 #23、罕见亚型 #7)与可自行补齐的(manifest 生成 #2、stain 归一化 #21、ICD/SNOMED 映射 #13——本页 §2 与 §4 已全部补齐)。建议训练前执行:(1) 用 §6.3 脚本生成 manifest 并合并官方 fold 分组;(2) 二分类实验加类别权重(≈1:2.19);(3) 8 分类结果附混淆矩阵并对 PT/A 类结论保持克制;(4) 任何对外报告写明 MD/MI、折数与均值口径。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部测试集变化 | 关键发现 |
|---|---|---|---|---|---|
| BACH / ICIAR2018 | 葡萄牙 ICIAR 2018 挑战赛 | 良恶性迁移(合并 InSitu+Invasive 为恶性) | 社区报道准确率回落约 5-15% | ↓ 中高 | 标签体系差异(含 Normal 类)+ 不同染色/设备是主要跌落源;ViT 时代论文常以此做迁移演示 |
| IDC 穿刺图像集(paultimothymooney/breast-histopathology-images) | 美国(IDC 专用 patch 集) | IDC patch 二分类 | Hybrid Xception-Transformer 报约 91% | ↓ 中 | 从手术大视野到穿刺小 patch 的域差显著 |
| Databiox(伊朗,922 张) | Poursina Hakim 研究中心 | WHO 分级任务 | 与 BreakHis 联合训练报道 93%+ | 任务不同不可直比 | 跨洲人群 + iPhone 成像仍可做联合训练,染色归一化是关键 |
| TCGA-BRCA WSI 视野 | 美国多中心 | 视野级分类迁移 | 社区报道回落 10-20% | ↓ 高 | 扫描仪色彩科学与压缩伪影是 BreakHis 模型面对 WSI 的最大敌人 |
2026 年视角下 BreakHis 还值得用吗? 值得——但用途要摆正:它是方法学基准与教学基础设施,不是临床模型的训练场。在病理基础模型(UNI、CONCH 等)时代,BreakHis 的标准用法已变成"下游线性探测/轻量微调的评测集";其价值来自十年文献沉淀的可比性,而非 82 名患者本身的统计效力。
§8 基准性能与生态
§8.1 排行榜(按协议口径分组)
BreakHis 排行榜的第一原则是"口径先于数值":患者级 vs 图像级、MD vs MI、5 折均值 vs 单折最优,任何一项不同,绝对数值即不可直接比较。下表按"官方患者级 70/30 五次试验"协议(A 组)与其他口径(B 组)分列。
A 组:官方协议可比组(患者级 70/30,5 次试验,二分类):
| 排名 | 模型 | PLA / ILA | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | CSDCNN(二分类头) | PLA 97.1/95.7/96.5/95.7%(40/100/200/400×);ILA 95.8-96.9% | 2017 | 类结构感知深度网络 + 多尺度增强 | Han Z et al. “Breast cancer multi-classification from histopathological images with structured deep learning model.” Scientific Reports 7:41724 (2017). DOI: 10.1038/s41598-017-04075-z | 未公开 |
| 2 | IRRCNN | ILA 97.3-98.0%;PLA 96.3-97.7% | 2019 | Inception + 残差 + RCNN 混合块 | Alom MZ et al. “Breast cancer classification from histopathological images with inception recurrent residual convolutional neural network.” Journal of Digital Imaging 32:605-617 (2019) | 作者仓库 |
| 3 | AlexNet 变体 + patch max 融合 | PLA 90.0/88.4/84.6/86.1%;ILA 85.6/83.5/83.1/80.8% | 2016 | 64×64 patch 训练 + sum/product/max 融合 | Spanhol FA et al. “Breast cancer histopathological image classification using convolutional neural networks.” IJCNN 2016. DOI: 10.1109/IJCNN.2016.7727519 | Caffe 官方快照 |
| 4 | DeCAF 深度特征 + 分类器 | PLA 86.3% / ILA 84.2% | 2017 | 预训练 CNN 作特征提取器 + 传统分类器 | Spanhol FA et al. “Deep features for breast cancer histopathological image classification.” IEEE SMC 2017 | — |
| 5 | 手工特征(PFTAS + QDA) | PLA 80-85% | 2016 | 6 种纹理描述子 × 4 种分类器网格 | Spanhol FA et al. “A dataset for breast cancer histopathological image classification.” IEEE TBME 63(7):1455-1462 (2016). DOI: 10.1109/TBME.2015.2496264 | — |
B 组:其他口径代表工作(协议各异,数值不可与 A 组直接比较):
| 模型 | 性能指标 | 协议口径 | 年份 | 完整引用 |
|---|---|---|---|---|
| Han et al. CSDCNN(8 分类) | 8 分类 PLA 94.1/93.2/94.7/93.5% | 患者级,文献复用口径 | 2017 | Han Z et al., Scientific Reports 7:41724 (2017) |
| Nawaz et al. DenseNet | 8 分类 95.4% | 迁移学习,自定义划分 | 2018 | Nawaz M et al. Computers in Biology and Medicine 95:121-129 (2018) |
| Motlagh et al. ResNet_V1_152 | 二分类 98.7% / 8 分类 96.4% | 迁移学习,自定义划分 | 2018 | Motlagh NH et al. “Breast cancer histopathological image classification: a deep learning approach.” bioRxiv 242818 (2018) |
| Bayramoglu et al. single-task CNN | PLA 83.25%(MI);200× ILA 84.63%±2.72 | MI 协议 + 自定义 | 2016 | Bayramoglu N et al. “Deep learning for magnification independent breast cancer histopathology image classification.” ICPR 2016 |
| Sudharshan et al. MIL | MIL 框架,多倍率提升 | 官方 70/30 + MIL | 2019 | Sudharshan PJ et al. “Multiple instance learning for histopathological breast cancer image classification.” ESWA 117:103-115 (2019) |
| ATS-ViT | 半监督 ViT + 自适应 token 采样 | 官方划分复用 | 2022 | ATS-ViT, PMID: 35935827 (2022) |
| Hybrid Xception-Transformer | MD 96.15-100% / MI 94.82-99.62% | 自定义划分 | 2025 | IEEE Access, DOI: 10.1109/ACCESS.2025.10794751 (2025) |
| Gella ViT + Ranger | 99.99% | ⚠️ 在训练集+验证集并集上评估 | 2024 | Gella R. bioRxiv 2024.08.17.608410 (2024)——评估口径存在泄漏,仅作上限参考(§6.5 坑点 7) |
基线锚点:2016 年官方基线为 80-85%(手工特征)与 84-90%(CNN);十年间严协议下的可信上限约 96-97%(Han 2017 / IRRCNN)。超出此区间的宣称,请按 §6.5 坑点 7 的三问清单审查。
§8.2 SOTA 总结与选型建议
| 如果你… | 推荐方案 | 为什么 |
|---|---|---|
| 复现文献/与新方法公平对比 | 官方 mkfold + ResNet-50/ViT-S 微调,报 5 折 PLA/ILA mean±std | 与十年文献严格可比,审稿无懈可击 |
| 追求数值上限(方法学论文) | 层级分类(CSDCNN 思路)+ 强增强 + 多尺度 | 严协议下的可信上限区间 |
| 验证 MIL/弱监督想法 | Sudharshan MIL 框架(patch-instance + bag 聚合) | 直接命中图像级标签噪声的本质 |
| 验证基础模型迁移能力 | UNI/CONCH 等病理基础模型特征 + 线性探测 | 2024 年后社区标准用法,训练成本极低 |
| 课堂教学 | Kaggle 镜像 + ResNet-18 单倍率微调 | 一节课完成全流程,无需本地环境 |
§8.3 官方评测协议
Spanhol 2016 定义(沿用至今):患者级 70% 训练 / 30% 测试随机划分,独立重复 5 次报告均值与标准差;按倍率分别实验(MD);指标为 PLA(患者识别率,先患者内图像正确率再跨患者平均)与 ILA(图像识别率);恶性为 positive。mkfold.tar.gz 生成全部五次试验划分文件。Bayramoglu 2016 补充 MI 协议(四倍率合并,仍患者级划分)。
§8.4 相关数据集
| 数据集 | 关系 | 说明 |
|---|---|---|
| BACH / ICIAR2018 | 同类/外部验证 | 400 张 200× 图像 + 30 WSI;含 Normal 与 InSitu 类,标签体系互补 |
| Camelyon16/17 | 互补 | 淋巴结转移 WSI 检测基准;BreakHis 管原发灶形态 |
| PatchCamelyon (PCam) | 互补 | 327,680 张 96×96 patch;预训练/自监督首选,无乳腺亚型 |
| TCGA-BRCA | 互补/升级 | 约 1,100 例 WSI + 分子分型 + 结局;临床研究方向的正解 |
| BreCaHAD | 同类微观 | 162 张细胞级图像,有丝分裂/核标注 |
| Databiox | 同类/外部验证 | 922 张伊朗人群分级图像(Mendeley Data) |
| IDC histopathology(Kaggle) | 同类 | 约 27 万 IDC patch(50×50),穿刺场景 |
| BUSI | 跨模态 | 乳腺超声图像——多模态乳腺研究的超声侧 |
§8.5 关键论文 Top 10
- Spanhol FA, Oliveira LS, Petitjean C, Heutte L (2016), IEEE TBME 63(7):1455-1462. “A Dataset for Breast Cancer Histopathological Image Classification.” — 数据集本体与官方协议,权威引用入口。DOI: 10.1109/TBME.2015.2496264
- Spanhol FA et al. (2016), IJCNN. “Breast cancer histopathological image classification using Convolutional Neural Networks.” — 首个 CNN 方案(patch + 融合),PLA 90.0%(40×)。DOI: 10.1109/IJCNN.2016.7727519
- Han Z et al. (2017), Scientific Reports 7:41724. “Breast cancer multi-classification from histopathological images with structured deep learning model.” — CSDCNN,8 分类与严协议上限的里程碑。DOI: 10.1038/s41598-017-04075-z
- Bayramoglu N, Kannala J, Heikkilä J (2016), ICPR. “Deep learning for magnification independent breast cancer histopathology image classification.” — MI 协议开创者。
- Spanhol FA et al. (2017), IEEE SMC. “Deep features for breast cancer histopathological image classification.” — DeCAF 迁移特征路线的系统化。
- Alom MZ et al. (2019), Journal of Digital Imaging 32:605-617. “Breast cancer classification from histopathological images with inception recurrent residual convolutional neural network.” — IRRCNN,A 组排行榜头部。
- Sudharshan PJ et al. (2019), Expert Systems with Applications 117:103-115. “Multiple instance learning for histopathological breast cancer image classification.” — MIL 框架与图像级标签噪声的正解;同时是采集伦理细节的最佳二手来源。
- Nawaz M et al. (2018), Computers in Biology and Medicine 95:121-129. DenseNet 迁移学习 8 分类 95.4%。
- Budak U et al. (2019). “Classification of breast cancer histopathology images using a fully convolutional neural network and bidirectional long short-term memory.” — FCN+BiLSTM 的空间上下文建模尝试。
- Nahid MA, Kong Y (2018), Computer Methods and Programs in Biomedicine. CNN+LSTM 路线与系统性综述视角(91.0% @200×)。
§8.6 社区活跃度
| 维度 | 数据 |
|---|---|
| OpenAlex 引用(Spanhol 2016) | 1,824 次(截至 2026-09-05 API 快照);FWCI 59.4,被引百分位前 1% |
| Semantic Scholar 口径 | 约 1,425 次(scispace 快照) |
| IJCNN 2016 CNN 论文引用 | 约 937 次(scispace 快照) |
| 官方下载统计 | 7,726 次,来自 141 个国家(截至 2022-11-30,官方页面) |
| 乳腺病理公开数据集使用率 | 约 65%(PeerJ cs-3645 综述口径,同类第一) |
| 镜像生态 | Kaggle 多个镜像(ambarish/breakhis 为主流);HuggingFace 数据集与模型镜像若干 |
| 教学采用 | 全球计算病理学/医学图像课程的标准教学数据集 |
§8.7 生态快照
| 资源 | 类型 | 链接 | 热度(截至 2026-09,约) | 为什么值得关注 |
|---|---|---|---|---|
| UFPR VRI 官方页 + mkfold | 官方资源 | web.inf.ufpr.br/vri/databases/breast-cancer-histopathological-database-breakhis/ | 7,726 次下载(141 国) | 数据、划分脚本、Caffe 快照的唯一权威源 |
| Kaggle ambarish/breakhis | 镜像 | kaggle.com/datasets/ambarish/breakhis | 社区主流镜像 | 免下载进 Kaggle Notebook;完整 4.28 GB |
| Kaggle forderation/breakhis-400x | 镜像子集 | kaggle.com/datasets/forderation/breakhis-400x | 545 张 | 教学/管道调试最轻量入口 |
| NiFangBaAGe/FBCNN | 代码 | github.com/NiFangBaAGe/FBCNN | — | 细粒度双线性 CNN 复现代码(PMC7500315) |
| sloshywings/breakhis-model | 预训练模型 | huggingface.co/sloshywings/breakhis-model-ranger-rotations-5-fold-0 | — | Gella 2024 ViT 权重(注意其评估口径) |
| 病理基础模型(UNI/CONCH 等) | 预训练模型 | MahmoodLab(HF) | 高 | 2024 年后 BreakHis 的标准新玩法:特征提取 + 线性探测 |
§9 相关资源与引用
官方资源
- 数据集主页:https://web.inf.ufpr.br/vri/databases/breast-cancer-histopathological-database-breakhis/
- 数据集直链:http://www.inf.ufpr.br/vri/databases/BreaKHis_v1.tar.gz
- 官方 5 折划分脚本:http://www.inf.ufpr.br/lesoliveira/download/mkfold.tar.gz
- 官方 Caffe 模型快照:http://www.inf.ufpr.br/lesoliveira/download/Caffe_models.tar.gz
- Kaggle 主流镜像:https://www.kaggle.com/datasets/ambarish/breakhis
- 许可证:CC BY 4.0(限非商业研究用途,发表须引用)
BibTeX 引用(使用本数据集必须引用)
% 数据集论文(官方强制引用)
@article{spanhol2016dataset,
title={A dataset for breast cancer histopathological image classification},
author={Spanhol, Fabio Alexandre and Oliveira, Luiz S. and Petitjean, Caroline and Heutte, Laurent},
journal={IEEE Transactions on Biomedical Engineering},
volume={63},
number={7},
pages={1455--1462},
year={2016},
publisher={IEEE},
doi={10.1109/TBME.2015.2496264}
}
% 如使用官方 CNN 基线或 Caffe 快照,建议同时引用
@inproceedings{spanhol2016cnn,
title={Breast cancer histopathological image classification using convolutional neural networks},
author={Spanhol, Fabio Alexandre and Oliveira, Luiz S. and Petitjean, Caroline and Heutte, Laurent},
booktitle={2016 International Joint Conference on Neural Networks (IJCNN)},
pages={2560--2567},
year={2016},
organization={IEEE},
doi={10.1109/IJCNN.2016.7727519}
}
% 如使用 DeCAF 深度特征路线,建议同时引用
@inproceedings{spanhol2017decaf,
title={Deep features for breast cancer histopathological image classification},
author={Spanhol, Fabio Alexandre and Oliveira, Luiz S. and Cavalin, Paulo and Petitjean, Caroline and Heutte, Laurent},
booktitle={2017 IEEE International Conference on Systems, Man, and Cybernetics (SMC)},
year={2017},
organization={IEEE}
}
教程与学习资源
- 官方页面(含 BNF 文件名规范、mkfold 使用说明):UFPR VRI 官网数据集页
- Kaggle Notebooks:搜索 “BreakHis ResNet / ViT” 有大量可 fork 的教学笔记本
- 综述入门:PeerJ Computer Science (cs-3645) 乳腺病理数据集与模型综述;Wiley (7011984) BreakHis 深度学习综述(含分倍率结果汇总表)
原始论文
- Spanhol FA, Oliveira LS, Petitjean C, Heutte L (2016). “A Dataset for Breast Cancer Histopathological Image Classification.” IEEE Transactions on Biomedical Engineering 63(7):1455-1462. DOI: 10.1109/TBME.2015.2496264.
- Spanhol FA et al. (2016). “Breast cancer histopathological image classification using Convolutional Neural Networks.” IJCNN 2016:2560-2567. DOI: 10.1109/IJCNN.2016.7727519.
- Sudharshan PJ et al. (2019). “Multiple instance learning for histopathological breast cancer image classification.” Expert Systems with Applications 117:103-115(IRB/知情同意/匿名化等采集细节的最完整二手记载).
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| deep-model(WorkBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch(多源检索) | 2026-09-05 | 5 组检索:官方页面事实、引用量快照(OpenAlex API)、8 亚型分布、基准数值、ICD-11/SNOMED CT 编码交叉验证 |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从 UFPR VRI 官方页面、Spanhol 2016 原始论文、OpenAlex API 与社区综述中整理结构化信息;(2) 生成 §5/§6 的 Python 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
§10.3 输入来源
- UFPR VRI BreakHis 官方页面(规模、分布、BNF 文件名规范、mkfold、许可证、下载统计,WebFetch 2026-09-05)
- Spanhol FA et al. (2016), IEEE TBME 63(7):1455-1462 — 数据集原始论文(DOI: 10.1109/TBME.2015.2496264)
- OpenAlex API(DOI: 10.1109/TBME.2015.2496264 的 cited_by_count = 1,824,2026-09-05 快照)
- Sudharshan PJ et al. (2019), ESWA 117:103-115 — MIL 论文(患者数 24/58、IRB/知情同意/匿名化、752×582 原始分辨率、PLA 公式)
- Metric Learning in Histopathological Image Classification(PMC10347273)— 亚型患者数表(PT=3 等)、官方 70/30 划分描述
- Bioengineering 2022, 9, 391 — 亚型 × 倍率完整分布表、Olympus BX-50 + Samsung SCC-131AN 设备细节
- ATS-ViT 2022(PMID: 35935827)— 患者数表与设备描述交叉验证
- FBCNN(PMC7500315)— 亚型分布表交叉验证
- Wiley 7011984 综述 — Spanhol IJCNN 2016 / Han 2017 / Alom 2019 分倍率 PLA/ILA 数值表
- MDPI Sensors 2019(s20164373)— Bayramoglu 2016 200× 数值、Han 2017 96.7% 口径
- Frontiers in Genetics 2019(fgene.2019.00080)— Nawaz 2018 / Motlagh 2018 数值
- Gella R (2024), bioRxiv 2024.08.17.608410 — 99.99% 宣称及其评估口径自述(坑点 7)
- Hybrid Xception-Transformer (2025), IEEE Access 10794751 — MD/MI 数值
- PeerJ Computer Science cs-3645 — 数据集对比表、使用率 65%、局限清单
- AJP 2023(S0002944023003127)— 2014 年采集期、700×460 裁剪说明
- ICD-11 MMS v2025-01(findacode / worldoftaxonomy)— 2C60-2C64 / 2F30.x 编码核实
- RCPath 乳腺病理 SNOMED 编码附录 + NCBI MedGen — SNOMED CT 编码核实
- Kaggle ambarish/breakhis 与 kurshidbasheer 镜像页 — 镜像规格、CC BY-NC-SA 标注、文件计数
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED 映射、亚型定义、金标准) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(7,909 总数、亚型 × 倍率分布、设备) | 千方病案医学编辑部 | 与官方页面及三篇独立论文交叉比对 | ✅ 已验证 |
| §4 数据结构(SOB BNF、目录树、DAIMS 字段字典) | 千方病案医学编辑部 | 与官方 BNF 规范交叉比对 | ✅ 已验证 |
| §5 数据划分策略(官方 70/30 五次试验协议) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与原文及镜像规格比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 排行榜与引用数表述 | 千方病案医学编辑部 | 与原文及 OpenAlex 快照交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema v3.9 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
