信息速览
INFOBOX — EBHI-Seg 一屏速览
维度 内容 本质 结直肠肠镜活检 H&E 组织病理图像的像素级分割数据集(非分类集、非挑战赛) 发布方 东北大学 MIaMIA Group(Chen Li 组);病理来源中国医科大学附属肿瘤医院/辽宁省肿瘤医院 论文 Front Med (Lausanne). 2023;10:1114673(doi:10.3389/fmed.2023.1114673;PMID 36760405;PMC9902656) 数据 4,456 文件 = 2,228 切片图像 + 2,228 掩码;224×224 PNG;400× 单倍率 类别 六类:Normal / Polyp / Low-grade IN / High-grade IN / Serrated adenoma / Adenocarcinoma 逐类 Normal 76、Polyp 474、Low-grade IN 639、High-grade IN 186、Serrated adenoma 58、Adenocarcinoma 795(合 2,228) 获取 figshare 21540159 公开直链,单文件 EBHI-SEG.rar ≈ 276 MB,无门禁 许可 CC BY 4.0(数据集与论文同) 论文基线 经典机器学习最高 Dice 0.948;深度学习(U-Net/Seg-Net/MedT)最高 Dice 0.965 姊妹集 分类版 EBHI/EBH-HE-IDS(figshare 16999363,5,532 图、4 档倍率、5 类)——同源不同任务 库内互链 digestpath(338)、nct-crc-he-100k(148)、unitopatho(701)、consep(228)、cvc-colondb(142)
EBHI-Seg 是一个"把结肠病理切片逐像素画出来"的数据集:它不追求体积庞大,而是把 2,228 张结肠肠镜活检的 H&E 切片逐张配上一张像素级分割掩码,覆盖从正常黏膜、息肉、低/高级别上皮内瘤变、锯齿状腺瘤到腺癌的完整病变谱系。它的价值有三层——一是结直肠早筛场景稀缺的像素级监督(这是它的主要立意),二是自带一套经典机器学习与深度学习的分割基线(论文实测最高 Dice 0.965),三是完全开放的 CC BY 4.0 直链(无注册墙、无申请流程)。对想立刻上手结直肠组织病理分割的团队,它往往是最省事的第一步。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——figshare 公开直链,CC BY 4.0,一个 276 MB 的 rar 包,下载即用。
- 关心它和"EBHI"什么关系:直奔 §4 与 §9——EBHI-Seg 与分类版 EBHI 是同门姊妹集,别把它们当同一个数据集。
- 被各处出现的"图像数"搞晕:直奔 §10 坑 2 与附录 S——4,456 / 5,170 / 5,710 / 2,228 各有出处,本条目统一按 4,456 引用。
§0 导读:这个数据集解决什么问题
结直肠癌是全球发病率前三的恶性肿瘤,早期发现对治疗至关重要,而组织病理检查是诊断金标准。问题在于:组织病理图像的判读高度依赖病理医生,主观性强、工作量大、难以定量,而计算机辅助诊断(computer-aided diagnosis, CAD)恰恰需要大量"图像—真值"配对来训练与评测分割算法。组织病理分割数据集本身并不少(腺体分割、核分割赛道都有经典数据集),但以结直肠肠镜活检这一特定采样方式、且按肿瘤分化阶段分层标注像素级分割真值的公开集极少——这正是 EBHI-Seg 立项的出发点。
EBHI-Seg 的回答很直接:从辽宁省肿瘤医院/中国医科大学附属肿瘤医院的结肠肠镜活检标本中取材,按六类肿瘤分化阶段整理出 2,228 张 400× 倍率、224×224 像素的 H&E 切片图像,逐张配一张像素级二值分割掩码(ground truth),共 4,456 个文件;六类覆盖正常黏膜、息肉、低级别上皮内瘤变、高级别上皮内瘤变、锯齿状腺瘤、腺癌,串起结直肠"正常→瘤变→癌变"的完整病理谱系。数据集在 figshare 以 CC BY 4.0 完全公开。
论文的贡献不止于数据本身:它同时自查自评——用 5 种经典机器学习方法(k-means、MRF、OTSU、Watershed、Sobel)和 3 种深度学习方法(U-Net、Seg-Net、MedT)在 EBHI-Seg 上跑了分割实验,给出逐类 Dice/Jaccard/Precision/Recall 基线表。结论是深度学习显著优于经典方法(最高 Dice 0.965 vs 0.948),且不同方法在 EBHI-Seg 上区分度明显——这既证明了数据集的可用性,也为后续使用者提供了现成的对照起点。
§0 读法三则:
- 本条目是"数据集 + 方法论文"二合一:本体是 4,456 个图像—掩码文件,论文是它的说明书兼基线报告;数据集与论文同为 CC BY 4.0,引用与复用最宽松(§6)。
- 全文围绕一个核心数字误差展开:数据集真实规模是 4,456(2,228 切片 + 2,228 掩码),但 figshare 描述、arXiv 早期版本、乃至部分二手评测给出的 5,170 / 5,710 / 2,855 都是版本漂移的产物——坑 2 与附录 S 逐条存照。
- 检索时务必把 EBHI-Seg 与它的分类版姊妹集 EBHI(5,532 图、4 档倍率、5 类)分开;两者同门同源,任务不同、规模不同(§4、坑 1)。
§1 数据集速览:十三问十三答
Q1:EBHI-Seg 到底有多少张图?
正式论文口径:4,456 个文件 = 2,228 张切片图像 + 2,228 张对应 ground truth 掩码。很多二手来源(含 figshare 页面的旧描述)会写成 5,170 或 5,710 甚至 2,855——那些是预印本/初版残留,正式版是 4,456。若只统计"切片图像"(不含掩码),则是 2,228 张。
Q2:图像是什么规格?
每张 224×224 像素、*.png 格式、400× 倍率的 H&E 染色组织病理图。400× 由目镜 10× × 物镜 40× 组成,使用 Nissan Olympus 显微镜 + NewUsbCamera 采集软件。采样方式为肠镜活检(enteroscope biopsy / intestinal biopsy)。
Q3:六类分别是什么、各多少张?
| 类别(中/英) | 图像数 | 占比 |
|---|---|---|
| 正常 / Normal | 76 | 3.41% |
| 息肉 / Polyp | 474 | 21.27% |
| 低级别上皮内瘤变 / Low-grade IN | 639 | 28.68% |
| 高级别上皮内瘤变 / High-grade IN | 186 | 8.35% |
| 锯齿状腺瘤 / Serrated adenoma | 58 | 2.60% |
| 腺癌 / Adenocarcinoma | 795 | 35.68% |
| 合计 | 2,228 | 100% |
Q4:掩码是干什么用的、长什么样?
每张切片图像配一张同尺寸(224×224)像素级分割 ground truth 掩码,用于语义分割训练——即让模型逐像素判断"哪些区域属于该病变"。原始掩码为黑白二值图,下游社区常按类别着色以便可视化(§5)。
Q5:谁做的、数据从哪来?
东北大学(沈阳)医学与生物信息工程学院 MIaMIA Group(Chen Li 组),病理数据由中国医科大学附属肿瘤医院/辽宁省肿瘤医院病理科提供。论文称数据集由两名病理学家提供切片与标注、12 名生物医学研究者按规则制作;伦理批件 No. 202229。
Q6:怎么拿、要钱吗、有门槛吗?
零门槛:figshare 公开直链(record 21540159),单文件 EBHI-SEG.rar(约 276 MB),注册与否均可下载,CC BY 4.0 许可,署名即可自由使用/修改/再分发/商用。
Q7:论文跑了哪些基线、结果如何?
经典机器学习:k-means、MRF、OTSU、Watershed、Sobel 五种,最高 Dice 0.948;深度学习:U-Net、Seg-Net、MedT 三种,最高 Dice 0.965(Polyp 类的 U-Net)。深度学习整体显著优于经典方法,且 Seg-Net 以较小模型量取得约 0.88+ 的综合表现(§5)。
Q8:它和"EBHI"是同一个东西吗?
不是。EBHI(分类集,figshare 16999363) 与 EBHI-Seg(分割集,本条目) 是同门姊妹集:EBHI 有 5,532 张图、4 档倍率、5 类(无锯齿状腺瘤);EBHI-Seg 有 2,228 张切片+2,228 掩码、仅 400× 单倍率、6 类(新增锯齿状腺瘤)。两者共享病理来源与团队,但任务、规模、类别数都不同(§4)。
Q9:它为什么对 AI-Ready 重要?
它是**“完全开放 + 自带基线 + 患者标本贴近临床”**的罕见组合:CC BY 4.0 直链消除了几乎所有获取摩擦,论文自带对照基线降低了复现门槛,而肠镜活检标本比手术切除标本更贴近早筛场景。它以小体量(276 MB)提供了结直肠早筛分割的高质量起步数据。
Q10:它有什么局限?
体量小(2,228 张切片)、类别偏斜(Normal 仅 76、锯齿状腺瘤仅 58)、单一倍率、患者级数量未披露、掩码编码未明示(§10 与 §2)。它适合做快速基线、算法原型与早筛方法验证,但不适合作为大规模预训练语料或跨倍率泛化研究的主力。
Q11:它被广泛使用吗?
发布 3 年余获得约 66 次引用(Google Scholar,抓取时点 2026-09-30),有独立第三方评测(如 Barua et al. 2024 用 MobileViT-UNet 达 Dice 0.944)和多个 GitHub 复现仓库。属"中等热度、稳定增长"的工具型数据集——不是爆款,但在结直肠分割方向有稳定需求。
Q12:如果我只做结直肠分割,还需要别的数据集吗?
看目标。做算法原型/教学,EBHI-Seg 一个足够;做泛化验证,需补多中心数据(如库内 unitopatho,rid 701)或更大分割集(digestpath,rid 338);做预训练,需补大规模数据(NCT-CRC-HE-100K,rid 148)。EBHI-Seg 的合理角色是"起步与对照",不是"全部"。
Q13:它和结肠镜图像数据集(如 CVC-ColonDB)是一回事吗?
不是。EBHI-Seg 是"组织病理切片"图像(显微镜下的组织),CVC-ColonDB 是"结肠镜"图像(内镜下的肠腔视图)。前者是"取出来看",后者是"在体看"——分处早筛链条的病理诊断与内镜检出两个环节(§7.5、§9.1)。
§2 数据构成与规格
2.1 规模:一个必须钉死的数字
EBHI-Seg 的规模是本条目最需要小心的地方,因为同一个数据集在四处文档里出现了四套数字。先把权威口径钉死,其余口径留给坑 2 与附录 S 存照:
权威口径(Front Med 2023 §3.1 原文):数据集含 4,456 张组织病理图像,其中 2,228 张为组织病理切片图像、2,228 张为对应的 ground truth 图像。
即:2,228 张切片图像,每张配一张像素级分割掩码,图像与掩码各计一遍,总共 4,456 个文件。论文结论节再次确认 “4456 magnified 400× pathology images”。
四套口径对照(详见附录 S):
| 来源 | 表述 | 判定 |
|---|---|---|
| Front Med 2023 正式版(权威) | 4,456 = 2,228 切片 + 2,228 掩码 | 采用 |
| figshare 21540159 页面描述 | 同段并存 “5,170” 与 “5,710 = 2,855 + 2,855” | 初版残留,存照 |
| arXiv v1 摘要 | 5,170 | 初版残留,存照 |
| arXiv v3 正文 | 2,855 切片 + 2,855 掩码 | 初版残留,存照 |
用户最常踩的坑是:把 figshare 页面上那句 “5,170 images” 当成真实规模写进论文方法节。正确做法是引正式版 4,456(或明确说明"2,228 张切片图像 + 2,228 掩码")。
2.2 六类肿瘤分化阶段与逐类分布
数据集按**肿瘤分化阶段(tumor differentiation stage)**分六类,构成结直肠"正常→瘤变→癌"的病理谱系:
| 类别(中/英) | 图像数 | 掩码数 | 占比 | 病理要点 |
|---|---|---|---|---|
| 正常 / Normal | 76 | 76 | 3.41% | 结构规整的管状腺体,核几乎无分裂、单层排列 |
| 息肉 / Polyp | 474 | 474 | 21.27% | 黏膜表面赘生物,腔结构完整、核分裂基本无 |
| 低级别上皮内瘤变 / Low-grade IN | 639 | 639 | 28.68% | 腺样结构分支增多、排列致密,核增大、分裂增多(轻度-中度异型增生) |
| 高级别上皮内瘤变 / High-grade IN | 186 | 186 | 8.35% | 较低级别更明显的腔结构改变与核增大(重度异型增生,Padova 分级) |
| 锯齿状腺瘤 / Serrated adenoma | 58 | 58 | 2.60% | 少见病变,约占结肠息肉 1%,表面呈锯齿状/脑回状隐窝开口 |
| 腺癌 / Adenocarcinoma | 795 | 795 | 35.68% | 腔结构分布极不规则、边界难辨、核显著增大 |
| 合计 | 2,228 | 2,228 | 100% | — |
三个观察:
- 类别偏斜明显:腺癌(35.68%)与低级别上皮内瘤变(28.68%)合计超六成,而正常(3.41%)与锯齿状腺瘤(2.60%)合计不足 6%。这直接决定了 Normal 类在三深度学习网络上的指标显著偏低(论文明确归因于"normal 类样本少于其他类")。
- 锯齿状腺瘤是"第六类":这是 EBHI-Seg 相对于分类版 EBHI(5 类)新增的一类,也是两者最关键的区别(§4)。
- 谱系完整但非均衡:从正常到癌各阶段都有覆盖,但数量极不均衡——做分级/分期研究的团队必须做类别重采样或分层评估。
2.3 图像规格与采集
| 属性 | 规格 |
|---|---|
| 输入尺寸 | 224 × 224 像素 |
| 格式 | *.png |
| 放大倍率 | 400×(目镜 10× × 物镜 40×) |
| 染色 | H&E(苏木精-伊红) |
| 采样方式 | 肠镜活检(enteroscope biopsy / intestinal biopsy) |
| 组织来源 | 结肠组织切片 |
| 显微镜 | Nissan Olympus(日本) |
| 采集软件 | NewUsbCamera |
| 掩码 | 同尺寸(224×224)像素级二值 ground truth |
与姊妹集的关键差异:分类版 EBHI 提供 40× / 100× / 200× / 400× 四档倍率,而 EBHI-Seg 只有 400× 单一倍率。这意味着 EBHI-Seg 不支持跨倍率鲁棒性研究——若研究需要倍率维度,要么回到 EBHI 分类集,要么在自有数据上补做。
2.4 目录结构与文件命名
数据集以单个 rar 包发布,解压后为六类文件夹结构:
Dataset
├── Adenocarcinoma
│ ├── image
│ │ ├── GT2001837-1-400-001.png
│ │ ├── GT2001837-1-400-002.png
│ │ └── ...
│ └── label
│ ├── GT2001837-1-400-001.png
│ └── ...
├── High-grade IN
├── Low-grade IN
├── Normal
├── Polyp
└── Serrated adenoma
命名规则:<前缀>-<序号>-<倍率>-<切片号>.png,其中 -400- 表示 400× 倍率。image/ 与 label/ 两目录下的同名文件构成"切片—掩码"配对——这是训练分割模型时的关键对应关系。
2.5 标注规则:三条弱监督原则
论文给出三条图像级标注规则,用于把"一图多阶段"的实际情况归到单一类别:
- 单一阶段规则:图像中只有一个分化阶段且其余区域完整 → 该阶段即为标签;
- 最明显规则:图像中存在多个分化阶段 → 取最明显者;
- 最严重规则:多个阶段分布相近时 → 取最严重的阶段为标签。
这三条规则透露出一个对使用者极重要的信息:类别标签是"图像级弱监督"产物,而掩码是"像素级强监督"。两者在语义上并不完全等价——一张被标为"腺癌"的图里,掩码可能只圈出部分癌性区域,其余为非癌组织。研究者若把类别标签当作整图真值使用,会与掩码真值产生系统性偏差。
2.6 数据准备流程
论文描述:切片由两名病理学家(中国医科大学附属肿瘤医院/辽宁省肿瘤医院)提供并完成图像级标注,12 名生物医学研究者按上述三条规则整理、制作数据集。整个数据制作受伦理批件 No. 202229 约束(§3)。数据集于 2022-11-11 首次发布于 figshare,论文 2023-01-24 正式发表于 Frontiers in Medicine。
2.7 从原始扫描到 224×224 像素:预处理链路推断
论文只给出"图像输入尺寸 224×224 像素",并未逐步描述从原始显微镜视野到标准化小图的处理链。综合采集参数与社区派生实践,可推断大致链路(推断,非论文原文):
原始显微镜视野(目镜 10× × 物镜 40× = 400×,NewUsbCamera 采集)
│ 采集软件输出的原始尺寸通常为 2048×1536 或更大整数像素
▼
人工圈选感兴趣区域(ROI)与病变判定
│ 由病理学家/研究者在切片视场中定位病变结构
▼
裁剪/缩放为 224×224 像素
│ 这一步的具体缩放方法论文未披露(等比例缩放?直接重采样?)
▼
导出为 *.png(切片图像)
▼
逐像素标注 → 导出同名 ground truth 掩码(*.png)
三个不确定性(对复现与跨数据集对比有直接影响):
- 缩放比例与插值方法未披露:224×224 若从更大视野缩放而来,则每像素对应的物理尺度未知,无法与其它数据集做像素级对齐;
- 裁剪策略未披露:是否保留病变周围背景、是否居中、是否统一组织覆盖率,均无说明;
- Region-of-interest 选择的主体未明:论文只说由病理学家提供,未说是先圈 ROI 再标注,还是标注者自行取景。
对使用者而言,这意味着不要假设 EBHI-Seg 的 224×224 与其它 224×224 数据集(如 NCT-CRC-HE-100K)具有相同的物理视场——两者可以拼接训练,但不能做像素尺度对齐。
2.8 数据集划分与泄漏风险自查
论文给出了一套深学实验划分(§5.6),但并未承诺这套划分是数据集发布后的官方划分——它更像"论文实验时的划分"。这带来两个使用者必须自查的风险:
- 同源切片泄漏:数据集的患者级数量未披露(§3.2),若同一活检样本被切成多张 224×224 田字格而落入 train 与 test 两侧,会造成同源泄漏,使测试指标虚高。论文未做患者级划分声明,因此无法从文档层面排除。
- image/label 错位风险:掩码与切片靠同名文件配对(§2.4)。任何批量处理(改名、增强、重采样)若破坏了同名约定,就会造成图文错位——这是使用分割数据集最常见的工程事故。
自查建议(可脚本化):
# 1) 文件计数校验:六类 image 与 label 应各 2228
# 2) 同名配对校验:每类 image/ 下的文件名集合应等于 label/ 下的集合
# 3) 近似重复检测:对切片图像做感知哈希(pHash),排查跨类/跨划分的近似重复
# 4) 掩码非空校验:统计每张掩码的前景像素占比,筛出全黑(空掩码)与全白异常样本
第 4 条尤其重要:若某些图被标为病变类但掩码近乎全黑,说明标注规则(§2.5)与掩码制作之间存在不一致,会直接污染分割训练。
2.9 体量直觉:276 MB 意味着什么
整个数据集打包仅 276 MB(约 263 MiB),这个数字本身就传递了关键信息:
- 2,228 张 224×224 RGB PNG + 2,228 张同尺寸掩码,平均每张切片图约 100 KB 量级——属于"小图数据集",不是 WSI 级别;
- 可在普通笔记本上完整载入内存(解压后约数百 MB 量级),做实验无需大数据基础设施;
- 下载与传输成本极低——对比 WSI 数据集的数百 GB 到 TB 级,EBHI-Seg 是"背包级"数据集。
这决定了它的合理用途:算法原型、教学、快速对照实验;而不是替代 WSI 级数据做临床级训练。
2.10 类别不均衡的应对:从数据到损失函数
六类分布的极端不均衡(Adenocarcinoma 795 vs Serrated adenoma 58,约 13.7:1)是使用 EBHI-Seg 时最先遭遇的工程问题。可用的应对手段分三层:
| 层级 | 手段 | 说明 |
|---|---|---|
| 数据层 | 过采样稀有类 / 欠采样多数类 | 简单但可能造成过拟合稀有类或丢信息 |
| 数据层 | 类别归并 | 把 Low-grade IN + High-grade IN 合成"IN"、或 Normal + Polyp 合成"非恶性" |
| 损失层 | 类别加权交叉熵 | 给稀有类更高权重 |
| 损失层 | Dice loss / Tversky loss | 对小前景区域(如锯齿状腺瘤)更敏感,第三方多用 Dice loss |
| 评测层 | 逐类报告 + 宏平均 | 避免被多数类掩盖稀有类失效 |
关键提醒:论文未指定损失函数(第三方工作多用 Dice loss),也未报告宏平均指标。因此任何与论文基线的比较都须先对齐"用哪个聚合口径"——这是坑 7 的一部分。
2.11 标注粒度的一个易混点:切片级类别 vs 像素级掩码
EBHI-Seg 同时提供两种粒度的信息,务必分清其用途:
| 粒度 | 载体 | 生成方式 | 用途 | 陷阱 |
|---|---|---|---|---|
| 切片级类别 | 所在文件夹名 | 三条弱监督规则(最严重优先) | 图像分类、分层采样、数据组织 | 不等于整图真值(图内可能含多阶段) |
| 像素级掩码 | label/*.png | 逐像素标注 | 语义分割训练/评测 | 论文未明示编码;须核验 |
最常见的误用是:把"文件夹类别"当作整张图的分割真值去算全集 Dice——这会与像素级掩码真值冲突,得到无意义的指标。正确用法是把掩码作为分割真值、把文件夹类别作为弱标签或采样依据。
§3 标注与伦理
3.1 标注人员与分工
| 角色 | 人数/来源 | 职责 |
|---|---|---|
| 病理学家 | 2 名(辽宁省肿瘤医院病理科) | 提供切片、完成图像级标注(分化阶段判定) |
| 生物医学研究者 | 12 名(东北大学 MIaMIA 组等) | 按三条规则整理数据、制作数据集、生成分割掩码 |
| 数据准备/实验/写作 | 论文 18 作者分工 | 见本节下文作者贡献说明 |
论文作者分工(Author contributions)明文区分了"数据采集与医学知识"(Xiaoyan Li、Hongzan Sun)、“数据准备”(Weiming Hu、Haoyuan Chen 等多人)、“方法与实验”(Chen Li、Shouliang Qi)等角色,是判断"谁提供了医学真值、谁做了工程"的直接依据。
3.2 伦理与隐私
- 伦理批件:论文明确数据集"obtained from two histopathologists at the Cancer Hospital of China Medical University [proved by ‘Research Project Ethics Certification’ (No. 202229)]"——批件号 202229。
- 隐私处理:论文未单列去标识流程说明(组织病理切片本身不含面部等直接标识,通常经样本编号管理)。这是一处信息缺口:使用者无法从论文确认样本编号与患者身份的映射管理细节。
- 患者级数量未披露:论文只给图像数,未给唯一样本/患者数(§10 待核)——这使"是否存在同一患者的多张切片跨训练/测试集泄漏"无法从文档层面排除。
3.3 与分类版 EBHI 共享的伦理基础
EBHI-Seg 与分类版 EBHI(Phys Med 2023;107:102534)共享同一批病理来源与伦理框架(同两名病理学家、同医院、同神经网络的"最严重阶段"标注逻辑)。因此两者在伦理合规上是连续的,区别只在任务(分割 vs 分类)与数据形态(是否含像素级掩码)。
3.4 标注质量的透明边界
论文对标注质量的披露有限:没有报告病理学家之间的观察者间一致性(inter-rater agreement),也没有报告学生/研究者制作掩码与专家真值的偏差。已知的间接线索只有两条:一是 Normal 类在三深度学习网络上的低指标被归因于样本少而非标注差;二是掩码被描述为"ground truth"但未给出生成工具与质控流程。对使用者而言,应把 EBHI-Seg 的掩码视为单源专家标注(无多专家交叉验证),在需要高置信真值的场景里谨慎使用。
§4 与分类版 EBHI(姊妹集)的关系
4.1 同门三件套:EBH-HE-IDS → EBHI → EBHI-Seg
MIaMIA Group 在结直肠肠镜活检方向上产出了一套同源数据集谱系:
| 数据集 | figshare | 发布 | 规模 | 倍率 | 类别数 | 任务 |
|---|---|---|---|---|---|---|
| EBH-HE-IDS | 16999363 | 2021-11-13 | 5,532 | 40/100/200/400× | 5 | 分类(原始公开档) |
| EBHI(=EBH-HE-IDS 的论文名) | 16999363 | 2023 论文 | 5,532 | 40/100/200/400× | 5 | 分类(Phys Med 2023) |
| EBHI-Seg(本条目) | 21540159 | 2022-11-11 | 2,228 切片 + 2,228 掩码 | 400× 单档 | 6 | 分割(Front Med 2023) |
谱系逻辑:先有分类集 EBH-HE-IDS/EBHI(大、四档倍率、五类),后在其基础上做出分割重标注版 EBHI-Seg(小、单档倍率、新增锯齿状腺瘤第六类、每张配像素级掩码)。
4.2 三处必须分清的区别
| 维度 | EBHI(分类集) | EBHI-Seg(本条目) |
|---|---|---|
| 图像总数 | 5,532 | 2,228 切片(+2,228 掩码 = 4,456 文件) |
| 倍率 | 40/100/200/400× 四档 | 仅 400× |
| 类别数 | 5(无锯齿状腺瘤) | 6(含锯齿状腺瘤) |
| 任务 | 图像分类 | 图像分割 |
| 掩码 | 无 | 有(像素级 ground truth) |
| figshare | 16999363 | 21540159 |
| 论文 | Phys Med 2023;107:102534 | Front Med 2023;10:1114673 |
4.3 与库内 NCT-CRC-HE-100K 条目(rid 148)的衔接
库内 nct-crc-he-100k(rid 148) 条目正文的对照表中列有一行:“EBHI(ScienceDirect 协议)| 5,000 图像 | H&E,224×224 | 5 类息肉/腺体分类”。此处的 “EBHI” 指的是分类版 EBHI(5 类、4 档倍率),并非本条目 EBHI-Seg。两条目建立互链时必须明确区分:
- NCT-CRC-HE-100K(rid 148):结直肠组织学 patch 分类(100,000 张 224×224、9 类),源自 NCT/CRC 组织纹理;
- EBHI(分类版):5,532 张、4 档倍率、5 类,图像级分类;
- EBHI-Seg(本条目):2,228 切片 + 2,228 掩码、6 类、分割任务。
三者在"结直肠组织病理"这一总域下并列,构成"大规模弱标注 patch 分类(NCT)→ 中等规模多倍率分类(EBHI)→ 小规模像素级分割(EBHI-Seg)"的互补谱系。
4.4 使用者如何选
| 你的需求 | 推荐 |
|---|---|
| 大规模 patch 分类预训练 | NCT-CRC-HE-100K(rid 148,10 万张) |
| 多倍率 / 六类病变图像分类 | EBHI(分类版,5,532 张四档倍率) |
| 结直肠病变像素级分割 | EBHI-Seg(本条目,2,228 切片+2,228 掩码) |
| 早筛场景的算法原型 | EBHI-Seg(肠镜活检标本最贴近早筛) |
一句话:要分割选 EBHI-Seg,要分类选 EBHI,要规模选 NCT-CRC-HE-100K——三者同域互补,不应互相替代。
§5 评估与基线:论文自带的分割实验
5.1 评测指标与协议
论文用六项指标评测分割性能,构成一套较完整的评测面:
| 指标 | 含义 | 取值范围 |
|---|---|---|
| Dice ratio | 空间重叠相似度(F1 型) | [0,1],越大越好 |
| Jaccard index(IoU) | 交并比 | [0,1],越大越好 |
| Conformity coefficient(Confm Index) | 一致性系数(错分像素/正确像素之比) | [−∞,1],越大越好 |
| Precision | 查准率 | [0,1] |
| Recall | 查全率 | [0,1] |
| 混淆矩阵 | TP/TN/FP/FN 的二分类像素统计 | — |
注意 Conformity coefficient 的取值下界是 −∞(当 θ_TP=0 时判定为"失败"),这在论文表里表现为若干负值甚至 −30.85 的极端值——读表时不要误以为"指标异常",那是该系数定义使然(§10 坑 5)。
5.2 经典机器学习基线(Table 3)
五种经典方法、逐类结果(Dice / Jaccard / ConfmIndex / Precision / Recall):
| 类别 | 方法 | Dice | Jaccard | Confm | Precision | Recall |
|---|---|---|---|---|---|---|
| Normal | k-means | 0.648 | 0.488 | −0.184 | 0.646 | 0.663 |
| Normal | MRF | 0.636 | 0.473 | −0.230 | 0.637 | 0.658 |
| Normal | OTSU | 0.410 | 0.265 | −2.871 | 0.515 | 0.351 |
| Normal | Watershed | 0.461 | 0.300 | −1.375 | 0.668 | 0.356 |
| Normal | Sobel | 0.652 | 0.487 | −0.102 | 0.763 | 0.579 |
| Polyp | k-means | 0.592 | 0.430 | −0.528 | 0.546 | 0.663 |
| High-grade IN | OTSU | 0.249 | 0.150 | −12.06 | 0.373 | 0.191 |
| Low-grade IN | OTSU | 0.886 | 0.811 | 0.6998 | 0.832 | 0.979 |
| Adenocarcinoma | k-means | 0.633 | 0.481 | −0.414 | 0.655 | 0.645 |
| Serrated adenoma | Sobel | 0.698 | 0.541 | 0.7484 | 0.662 | 0.572 |
要点:
- 经典方法内部最优是 k-means:在多类上 Dice 约 0.55-0.65,MRF 与 Sobel 次之(约 0.6),Watershed 平均约 0.45 最弱,OTSU 表现"一般"。
- 一个刺眼的异常:OTSU 在 Low-grade IN 上 Dice 高达 0.886,却在其他类上普遍很差(High-grade IN 仅 0.249,Confm 低至 −12.06)。论文未对这一反常给出深入解释——方法—类别交互极强,单一方法不可通用。
- 经典方法整体最高 Dice 0.948(论文概览口径),但逐类稳定值远低于此,说明 0.948 是某类的最优而非全局均值。
5.3 深度学习基线(Table 5)
三种深度学习网络、逐类结果:
| 类别 | 网络 | Dice | Jaccard | Confm | Precision | Recall |
|---|---|---|---|---|---|---|
| Normal | U-Net | 0.411 | 0.263 | −2.199 | 0.586 | 0.328 |
| Normal | Seg-Net | 0.777 | 0.684 | −0.607 | 0.895 | 0.758 |
| Normal | MedT | 0.676 | 0.562 | −0.615 | 0.874 | 0.610 |
| Polyp | U-Net | 0.965 | (0.308*) | −1.514 | 0.496 | 0.470 |
| Polyp | Seg-Net | 0.937 | 0.886 | 0.858 | 0.916 | 0.965 |
| Polyp | MedT | 0.771 | 0.643 | 0.336 | 0.687 | 0.920 |
| High-grade IN | U-Net | 0.895 | 0.816 | 0.747 | 0.847 | 0.961 |
| High-grade IN | Seg-Net | 0.894 | 0.812 | 0.757 | 0.881 | 0.913 |
| High-grade IN | MedT | 0.824 | 0.707 | 0.556 | 0.740 | 0.958 |
| Low-grade IN | U-Net | 0.911 | 0.849 | 0.773 | 0.879 | 0.953 |
| Low-grade IN | Seg-Net | 0.924 | 0.864 | 0.826 | 0.883 | 0.977 |
| Low-grade IN | MedT | 0.889 | 0.808 | 0.730 | 0.876 | 0.916 |
| Adenocarcinoma | U-Net | 0.887 | 0.808 | 0.718 | 0.850 | 0.950 |
| Adenocarcinoma | Seg-Net | 0.865 | 0.775 | 0.646 | 0.792 | 0.977 |
| Adenocarcinoma | MedT | 0.735 | 0.595 | 0.197 | 0.662 | 0.864 |
| Serrated adenoma | U-Net | 0.938 | 0.886 | 0.865 | 0.899 | 0.983 |
| Serrated adenoma | Seg-Net | 0.907 | 0.832 | 0.794 | 0.859 | 0.963 |
| Serrated adenoma | MedT | 0.670 | 0.509 | −0.043 | 0.896 | 0.544 |
* Polyp-U-Net 的 Jaccard 单元格在原文表中数值(0.308)明显偏低与 Dice 0.965 不自洽,疑为原文排版/转录异常——引用该组合时须谨慎并核对原表(存照)。
5.4 三条论文结论
- 深度学习显著优于经典方法:结论节原文 “deep learning models are considerably superior to classical machine learning methods, and even the lowest MedT performance is still higher than the highest accuracy of classical machine learning methods”——最高 Dice 达 0.95 以上,Precision/Recall 均 0.90 以上。
- Normal 类是硬骨头:三网络在 Normal 上的指标显著低于其他类,论文归因于 “the normal category has fewer sample images than other categories”(76 张,$100% 中最少)——样本少 → 指标低的直接因果,是类别偏斜后果的实证。
- 方法区分度好:不同方法在 EBHI-Seg 上得到明显不同的指标,“therefore, EBHI-Seg can effectively evaluate the segmentation performance of different segmentation methods”——这是数据集在论文里被验证"可用"的核心论据。
5.5 实验环境
论文披露的软硬件配置(复现参照):
处理器: Intel Core i7-8700 @ 3.20GHz 六核
GPU: NVIDIA GeForce RTX 2080
核显: Intel UHD Graphics 630
硬盘: SAMSUNG SM961 NVMe 512GB SSD
主板: Dell 0NNNCT (C246)
主机: Dell Precision 3630 Tower
软件: CUDA 11.2 / torch 1.7.0 / torchvision 0.8.0 / python 3.8
配置属"单卡 2080 级",意味着 EBHI-Seg 的基线在中端硬件上即可复现——这是它作为"教学/起步数据集"的又一优势。
5.6 论文表 4:深学实验的数据划分
论文给出深学分区的训练/测试/predict 划分,反映其对样本的使用方式:
| 类别 | Train | Test | Predict |
|---|---|---|---|
| Normal | 30 | 30 | 16 |
| Polyp | 190 | 190 | 94 |
| Low-grade IN | 256 | 256 | 127 |
| High-grade IN | 74 | 74 | 38 |
| Serrated adenoma | 23 | 23 | 12 |
| Adenocarcinoma | 318 | 318 | 159 |
观察:train:test≈1:1、predict≈test 的一半——这是一套偏保守的小样本划分,未采用大规模交叉验证。使用者在自建划分时应注意与论文划分的区别(论文划分可作快速对照,但不宜作为唯一评测口径)。
5.7 第三方下游使用(生态证据)
EBHI-Seg 发布后已被多个独立工作引用为分割评测数据,构成其学术影响力的直接证据:
- Barua et al. 2024, PeerJ Computer Science 10:e2633:“Optimizing colorectal cancer segmentation with MobileViT-UNet and multi-criteria decision analysis”——首次将 MobileViT 用作 U-Net 编码器,在 EBHI-Seg 六类上达 Dice 0.944±0.030 / Jaccard 0.897±0.049 / Precision 0.955 / Recall 0.939,并用 TOPSIS 多准则决策排序模型。代码开源(Zenodo record 14048544、GitHub Barun-Barua/EBHI-seg-MobileVit-Unet)。
- 多套 GitHub 复现项目:sarah-antillia 的 ImageMask 与 Tensorflow 分割项目把 EBHI-Seg 转成 512×512 增强版(Apache-2.0 派生许可),说明其格式转换友好、社区可派生。
这类下游使用同时暴露一个细节:第三方在转引时大量复制了 figshare 的旧描述(5,170 / 2,855)——坑 2 的传播链正是从这里扩散的。
5.8 如何评测你的模型:一份最小对照协议
若要在 EBHI-Seg 上评测一个新分割模型并与论文基线对照,建议的最小协议:
- 数据划分:不要直接用论文划分当"官方划分"(它未声明种子);自行按类分层划分并固定随机种子、记录清单(§5.6、坑 7)。
- 前景定义:先确认掩码的前景语义(须核验,§附录 S),统一二值化阈值。
- 指标对齐:逐类报告 Dice / Jaccard / Precision / Recall;Conformity 单独列(定义域 [−∞,1],坑 5)。
- 聚合口径:说明是宏平均还是微平均——论文未给宏平均,直接比"最高 Dice"须注明是概览口径(坑 7)。
- 稀有类提示:Normal(76)与锯齿状腺瘤(58)单独标注样本数与统计功效不足。
- 可疑数字回核:与论文表 5 对照时,Polyp-U-Net 行的 Dice/Jaccard 不自洽,勿照抄(坑 8)。
- 损失函数声明:论文未指定;若用 Dice loss(第三方常用)须写明。
这套协议的价值在于让比较可比——EBHI-Seg 的开放与自带基线降低了门槛,但口径不对齐会让"我比论文高"的结论失真。
5.9 六项指标间的数学关系与读表自检
论文的六项指标并非彼此独立,存在若干可推导的恒等关系;掌握它们能在读表时当场发现疑似转录错误(坑 8 即是靠这一手段识别的):
- Dice 与 Jaccard 的单调对应:对同一次分割,Dice = 2·Jaccard / (1 + Jaccard),反之 Jaccard = Dice / (2 − Dice)。因此给定 Dice 就能唯一推出 Jaccard——任何不满足该关系的行都值得怀疑。例如 Dice 0.965 应对应 Jaccard ≈ 0.932(而非 0.308);Dice 0.937 对应 Jaccard ≈ 0.881(与论文 Polyp-SegNet 的 0.886 基本吻合,说明该行自洽)。
- Precision / Recall 与混淆矩阵的关系:Precision = TP/(TP+FP),Recall = TP/(TP+FN),二者与混淆矩阵四个计数一一对应;若论文同时给了混淆矩阵,可用它反算 Precision/Recall 做交叉校验。
- Conformity 与随机基线:Conformity 与 Matthews 相关系数同源,取值 0 表示与随机相当,负值表示劣于随机——这正是它与 Dice/Jaccard(下界 0)不可同尺度比较的根源(坑 5)。
- “最高 Dice” 的口径陷阱:论文概览口径的 0.948/0.965 是某类某方法的最优值,不等于任何宏平均或微平均。比较时须明确"最高值 vs 逐类均值 vs 全集均值"三者不可混用(坑 7)。
读表自检三步:先看 Dice-Jaccard 是否满足恒等式 → 再看 Precision/Recall 与混淆矩阵是否自洽 → 最后确认所比数字属同一聚合口径。三步过完,绝大多数转录与口径错误会当场暴露。
§6 获取与许可
6.1 一个 entry,零门槛
EBHI-Seg 的可获取性在库内属最宽松一档:
| 资产 | 入口 | 许可 | 门槛 |
|---|---|---|---|
| 数据集本体 | figshare record 21540159(doi 10.6084/m9.figshare.21540159.v1) | CC BY 4.0 | 无(公开直链,注册与否均可下载) |
| 论文 | doi:10.3389/fmed.2023.1114673(PMC9902656 全文) | CC BY 4.0 | 无 |
| 预印本 | arXiv:2212.00532 | arXiv 默认许可 | 无 |
- 直链:https://figshare.com/articles/dataset/EBHI-SEG/21540159/1
- API:https://api.figshare.com/v2/articles/21540159
- 下载文件:
EBHI-SEG.rar,size 276,013,249 B(≈276 MB / 263 MiB),md51daa1cc40177259e9cbe199b8e488327,直链 ndownloader.figshare.com/files/38179080 - 许可 URL:https://creativecommons.org/licenses/by/4.0/
6.2 CC BY 4.0 意味着什么
CC BY 4.0 是署名即可自由使用的许可——允许商用、修改、再分发、二次创作,唯一硬性义务是署名(cite 原始数据集 DOI)。对本条目的实际含义:
- 可商用:与许多"仅限学术研究(academic use only)"的病理数据集不同,EBHI-Seg 允许商业使用;
- 可再分发:可把数据打包进自己的资产;
- 可派生:可上采样、增强、重新着色掩码后发布派生集(已有社区这么做,注意保留署名);
- 义务:任何使用须引用 figshare DOI(10.6084/m9.figshare.21540159.v1)与论文(Front Med 2023;10:1114673)。
6.3 引用规范
数据集本体与论文是两个独立可引对象,规范做法同时引:
% 数据集本体(figshare 建议引法)
@misc{miaMIA2022ebhiseg,
author = {MIaMIA Group},
title = {EBHI-SEG},
year = {2022},
month = {11},
doi = {10.6084/m9.figshare.21540159.v1},
url = {https://figshare.com/articles/dataset/EBHI-SEG/21540159}
}
% 论文
@article{shi2023ebhiseg,
title = {EBHI-Seg: A novel enteroscope biopsy histopathological
hematoxylin and eosin image dataset for image segmentation tasks},
author = {Shi, Liyu and Li, Xiaoyan and Hu, Weiming and Chen, Haoyuan and
Chen, Jing and Fan, Zizhen and Gao, Minghe and Jing, Yujie and
Lu, Guotao and Ma, Deguo and Ma, Zhiyu and Meng, Qingtao and
Tang, Dechao and Sun, Hongzan and Grzegorzek, Marcin and
Qi, Shouliang and Teng, Yueyang and Li, Chen},
journal = {Frontiers in Medicine},
volume = {10},
pages = {1114673},
year = {2023},
doi = {10.3389/fmed.2023.1114673}
}
6.4 AI-Ready 评估:为什么它是"高可获取性"样本
以库内 AI-Ready 检查单过一遍:
- 机器可读元数据:figshare API 提供结构化元数据(license/files/doi/description)+ 论文开放获取全文——良好。
- 公开直链:数据集本体即直链(非请求制、非注册墙)——AI-Ready 最大加分项;对比库内 PANDA-PLUS 掩码的"请求制",EBHI-Seg 直接可用。
- 许可明确性:CC BY 4.0 单一授权、无再分发/商用歧义——最清晰一档。
- 可复现性:论文自带基线 + 划分 + 实验环境,单卡 2080 可复现。
- 文档自洽:规模数字四处漂移(坑 2)、掩码编码未明示(坑 4)——两处文档缺陷,需使用者自行对齐。
综合:AI-Ready 等级"高"——可获取性与许可达库内最优档,文档质量中等偏上,主要扣分项是规模口径不自洽(一处硬伤)与掩码编码缺失(一处信息缺口)。
6.5 与库内可获取性光谱的对照
| 档位 | 库内参照 | 本条目对应 |
|---|---|---|
| 注册墙(最严) | LMC2 型(注册+审批) | — |
| 请求制 | PANDA-PLUS 掩码(邮件申请) | — |
| 平台托管 | Zenodo 型 | — |
| 公开直链 | HF/Kaggle/Zenodo 直链型 | 本条目(figshare + CC BY 4.0) |
| 商用友好 | — | 本条目(CC BY 4.0 允许商用/再分发/派生) |
EBHI-Seg 的关键定位:它落在"公开直链 × 商用友好"的右上角——这是库内病理分割条目里较少见的位置。按"能否立刻下、能否商用"过滤时,它都会命中。
6.6 下载到使用的完整路径(含校验)
从"知道有这个数据集"到"跑通第一行训练代码"的完整路径:
1) 打开 figshare 页:https://figshare.com/articles/dataset/EBHI-SEG/21540159/1
2) 下载 EBHI-SEG.rar(或走 ndownloader.figshare.com/files/38179080)
3) 校验:md5 应为 1daa1cc40177259e9cbe199b8e488327;size 276,013,249 B
4) 解压 → 得到六类文件夹,每类下 image/ 与 label/
5) 自检:六类 image 与 label 文件数各应合计 2,228(总 4,456)
6) 读入配对:同目录同名文件配成 (image, mask)
7) 建模:按 §5 基线或自定网络训练/评测
8) 引用:写明 figshare DOI + 论文 DOI(CC BY 4.0 署名义务)
第 5 步的自检是整个流程里最容易被跳过、也最容易出问题的环节——文件名错位、文件缺失、掩码全黑都会在这里暴露。
6.7 引用与再分发的合规要点
- 必须署名:CC BY 4.0 的硬性义务,须标注 MIaMIA Group、数据集 DOI、论文 DOI,并指出是否修改。
- 可再分发:允许把数据打包进自己的资产或派生集,但须保留署名与许可声明。
- 可商用:无"仅学术"限制——这与许多病理数据集(“academic use only”)形成鲜明对比。
- 免责:数据为研究用途,不构成临床诊断依据(附录 N)。
6.8 与"请求制"数据集的对比:为什么直链重要
库内 PANDA-PLUS 的掩码是"请求制"(邮件申请、无公开直链),而 EBHI-Seg 是完全公开直链。这一差异对实际工作流的影响是数量级的:
| 维度 | 请求制(如 PANDA-PLUS 掩码) | 公开直链(如 EBHI-Seg) |
|---|---|---|
| 获取时间 | 数天到数周(等回复) | 数分钟 |
| 可否立刻实验 | 否 | 是 |
| 可复现性 | 依赖作者响应 | 完全可复现 |
| 商用 | 条款不明 | 明确允许(CC BY 4.0) |
| 自动化 | 难(人工) | 易(脚本下载) |
启示:数据集的"可获取性"直接决定其被使用的频率——EBHI-Seg 被广泛引用,公开直链是重要原因之一。
§7 生态与影响
7.1 MIaMIA Group 的结直肠病理数据谱系
EBHI-Seg 隶属于东北大学 Chen Li 组(MIaMIA Group)在消化道病理方向的数据集矩阵,同组成员产物还包括:
- EBH-HE-IDS / EBHI(2021-2022,分类,5,532 图四档倍率);
- EBHI-Seg(本条目,2022-2023,分割,2,228 切片+2,228 掩码);
- GasHisSDB / 胃组织病理子尺寸分类(同组在胃癌方向的数据集工作,论文见 Front Med 2022 系列)。
谱系特征是"同一批临床病理资源 → 多任务数据集切片":分类、分割、子尺寸分类各取所需,形成互补矩阵。这种"一源多用"是国内病理 AI 团队常见的数据工程策略。
7.2 在结直肠病理数据集景观中的位置
论文 Table 1 自列对照(论文口径):
| 数据集 | 类别 | 数量 | 尺寸 | 年 |
|---|---|---|---|---|
| 结直肠癌组织纹理集 | 淋巴滤泡/黏膜腺体/碎片/脂肪/肿瘤上皮等 | 5,000 | 74×74 μm | 2016 |
| NCT-CRC-HE-100K | MUS/NORM/STR/TUM/ADI/BACK/DEB/LYM/MUC | 100,000 | 224×224 px | 2016 |
| MICCAI’16 腺体分割挑战 | 良性/恶性 | 85 | 775×522 px | 2017 |
| CRC 数据集 | 非瘤/低级别/高级别 | 1,133 | 512×512 px | 2021 |
| 双重分类(FFPE HPs/SSAs) | FFPE 增生性息肉/无蒂锯齿状腺瘤 | 3,152 | 224×224 px | 2021 |
| TCGA 子集 | 正常/肿瘤 | 731 | 224×224 px | 2021 |
| UHCW 数据集 | 正常/肿瘤 | 4,292 | 224×224 px | 2021 |
| EBHI-Seg | 六类分化阶段(含分割掩码) | 4,456 | 224×224 px | 2023 |
定位一句话:EBHI-Seg 以"六类分化阶段 + 像素级分割掩码 + 单档 400× 肠镜活检"的组合区别于上述所有数据集——NCT-CRC-HE-100K 规模最大但只有 patch 分类标签;MICCAI’16 有分割但类别少、年代早;TCGA/UHCW 面向二分类。EBHI-Seg 的稀缺性在于按肿瘤分化阶段(而非简单善恶二分)分层的像素级分割真值。
7.3 引用热度与社区生态
- 引用量:Google Scholar 抓取时点 约 66 次引用(另一索引口径 45 次,Scopus),发布 3 年余,属"中等热度但稳定增长"的工具型数据集。
- 社区派生:多个 GitHub 仓库做了格式转换与增强(512×512、按类着色掩码、Tensorflow/PyTorch 双栈),说明派生门槛低、格式兼容好。
- 传播副作用:下游转引大量复制 figshare 旧描述的错误规模数字,形成"错误数字的传播链"——这是开放数据集文档不自洽的典型治理教训(§10 坑 2)。
7.4 对早筛与临床落地的意义
EBHI-Seg 的样本类型是肠镜活检(enteroscope biopsy)——这正是结直肠癌早期筛查的实际取材方式(相比手术切除标本,活检标本更小、更早、更贴近筛查场景)。因此它在结直肠早筛 CAD 算法验证上有直接价值:
- 方法原型:小体量、带真值、单卡可训,适合算法快速验证;
- 早筛语义:六类覆盖"正常→瘤变→癌",可支撑多阶段风险分层模型;
- 临床迁移的边界:2,228 张、单中心、单倍率,不足以独立支撑临床级模型的泛化验证——它的合理定位是"起点数据"而非"终点验证集"。
7.5 结直肠病理数据集的生态位:四类数据对照
把结直肠病理领域的公开数据集按"标注粒度 × 采样方式"排布,能看清 EBHI-Seg 的独特生态位:
| 生态位 | 标注粒度 | 代表数据集 | 典型规模 |
|---|---|---|---|
| 组织纹理 patch 分类 | 图像/块级 | NCT-CRC-HE-100K | 10 万张 |
| 多阶段病变分类 | 图像级 | EBHI(分类版) | 5,532 张 |
| 病变区域分割 | 像素级 | EBHI-Seg(本条目) | 2,228 切片 + 2,228 掩码 |
| 腺体/核实例分割 | 像素级 + 实例 | MICCAI’16 腺体分割、CoNSeP、PanNuke | 数十到数千 |
EBHI-Seg 占据的是**"像素级分割 + 按肿瘤分化阶段分层 + 肠镜活检采样"这一格。它的稀缺性来自组合而非单点:像素级分割数据集不少(腺体/核分割一抓一把),但按六类分化阶段分层、且专取肠镜活检标本**的公开集极少。这正是它被反复引用为"结直肠早筛分割基准"的原因。
7.6 下游使用中的常见改造
从第三方仓库可观察到 EBHI-Seg 的典型改造模式,这些改造反过来说明原始数据的接口特性:
- 尺寸上采样:原始 224×224 → 512×512(sarah-antillia 仓库),以适配偏大的分割网络输入;
- 掩码着色:原始黑白掩码 → 按类别着色,便于可视化与多类损失;
- 数据增强:垂直/水平翻转 + 90/180/270° 旋转(几何增强,不改变病理语义);
- 任务扩展:分割头 + 分类头联合(Unet++ + ResNeXt50),利用§2.5 的双层标签结构。
这些改造的共同点是不触碰原始像素语义——因为 EBHI-Seg 的像素本身是病理真值,任何改变像素值的处理(如强染色归一化)都可能破坏与原掩码的对应关系。
7.7 与同类"六类结直肠分割"的横向对照
在结直肠分割方向上,与 EBHI-Seg 可比的数据集各有侧重,横向对照如下(非论文 Table 1 口径,为本条目补充):
| 数据集 | 类别粒度 | 采样方式 | 掩码 | 体量 | 开放度 |
|---|---|---|---|---|---|
| EBHI-Seg | 六类分化阶段 | 肠镜活检 | 像素级 | 2,228 切片 | CC BY 4.0 直链 |
| MICCAI’16 腺体分割 | 腺体(良/恶性) | 切除标本 | 像素级 | 85 训练图 | 公开 |
| DigestPath(库内 338) | 结直肠病变 | 混合 | 像素级 | 大(竞赛级) | 见条目 |
| NCT-CRC-HE-100K | 组织纹理九类 | 混合 | 无(分类) | 100,000 | 公开直链 |
| CoNSeP/PanNuke | 核实例 | 多组织 | 像素级 + 实例 | 数百到数千 | 公开 |
EBHI-Seg 的差异点有二:一是类别按分化阶段而非简单二分(多数分割集只有"病变/背景"或"腺体/非腺体");二是采样方式专一(肠镜活检,贴合早筛)。代价是体量小、单倍率、单中心。
7.8 数据工程视角:EBHI-Seg 的可扩展方向
从"如果要在这份数据上再做一篇工作"的角度,EBHI-Seg 留出了几条明确的扩展线索,这些线索本身也反证了数据集的接口设计:
- 患者级去重与泄漏排查:论文未披露患者数,若能从原始病理编号反向重构患者级分组,就能首次回答"是否存在跨划分泄漏"——这是一个低成本高价值的元研究课题(§3.2、坑 7)。
- 掩码编码规范化:把"黑白前景掩码"整理为显式类别色表 + 校验脚本,可直接降低下游误用率(坑 4、附录 S)。
- 多中心外部验证:以 EBHI-Seg 为训练集、库内 unitopatho(rid 701,多中心结直肠)为外部集,即可构造一个"单中心训→多中心测"的泛化实验——填补论文未做外部验证的空白(§8.8)。
- 倍率鲁棒性研究:由于 EBHI-Seg 仅 400×,而分类版 EBHI 含四档倍率,可将两者组合构造跨倍率一致性研究(同源样本在不同倍率下的分割一致性)。
- 六类→临床二分的降级评测:把六类按临床风险归并为"低风险(Normal/Polyp)/ 高风险(HGIN/腺癌)"等二分,检验模型在临床可操作粒度上的表现,同时缓解长尾(Q30)。
这五条线的共同前提是不动原始像素与掩码的对应关系——任何改变像素值的预处理都要同步重算掩码,否则真值失效。
7.9 对数据集使用者的分层建议
综合本条目全部核验结论,不同类型的使用者应有不同的使用姿势:
| 使用者类型 | 建议用法 | 主要风险点 |
|---|---|---|
| 教学 / 入门 | 直接下载 276 MB 包,跑论文基线复现 | 掩码编码须先目视核验(坑 4) |
| 算法原型验证 | 自建分层划分 + 固定种子 + 逐类报告 | 不要照抄论文划分当"官方"(坑 7) |
| 模型对比研究 | 对照论文 Table 3/5,但须回核可疑数字 | Polyp-U-Net 行不自洽(坑 8) |
| 临床相关研究 | 仅作起点数据,必须补多中心外部验证 | 单中心、单倍率、患者数缺失(§8.8) |
| 数据治理研究 | 以坑 2 的"四处口径漂移"为案例 | 引用一律锚定正式版 4,456(坑 2) |
一句话总结:EBHI-Seg 是一份"接口清晰、边界明确、但需要使用者自行补齐文档缺口"的起步型分割数据集——它的价值不在于规模,而在于把"结直肠早筛的六阶段病理分级"做成了可训练、可复现、可派生的像素级基准。
§8 方法学启示
8.1 "像素级真值稀缺"是可解的小规模问题
结直肠病理领域不缺图像,缺的是像素级标注。EBHI-Seg 的路径是:不追求图像数量,而是把有限的人力(12 名研究者 + 2 名病理学家)集中用于逐张制作掩码,用 2,228 张的高质量像素级真值换取"可训练分割模型"的资格。这个取舍对资源有限的研究组有直接借鉴意义:在分割任务上,2,000 张精标 > 20,000 张粗标。
8.2 弱监督标签 + 强监督掩码的双层结构
EBHI-Seg 同时携带两层监督信号(§2.5):
- 图像级类别标签(六类分化阶段)——由"最严重优先"的弱监督规则生成;
- 像素级掩码——分割真值。
这为**多任务学习(分割 + 分类)**提供了天然接口:有下游工作(如 GitHub UnetPlusPlusWithClassification)正是利用这一结构做联合分割与分类。启示是:数据集设计时保留"类别标签 + 像素掩码"的配对关系,可显著拓宽下游可复用面。
8.3 自带基线降低复现门槛
EBHI-Seg 论文附带经典机器学习与深度学习的完整基线表(§5),并给出划分与实验环境。这使新方法无需从零建对照即可定位自身水平。方法论启示:数据集论文应自带基线——这是从"发数据"升级为"发可用基准"的关键一步,也是它被广泛引用的直接原因。
8.4 类别偏斜是分割数据集的普遍陷阱
Normal 仅 76 张导致三网络在该类指标骤降(§5.4),是"类别偏斜如何直接污染评测结论"的教科书案例。启示:分割数据集报告结果时必须逐类给出,全集均值会掩盖稀有类的失效;使用者在评测稀有类(此处为 Normal、锯齿状腺瘤)时须明确其统计功效不足。
8.5 单倍率设计的功能边界
EBHI-Seg 只提供 400×——这对需要倍率鲁棒性的研究是硬约束(对比其姊妹分类集 EBHI 的四档倍率)。启示:数据集在设计时若需支持"跨倍率泛化"研究,就必须在采集阶段保留多档倍率,事后无法补。使用者在选型时要先确认研究是否需要倍率维度,再决定选 EBHI 还是 EBHI-Seg。
8.6 文档自洽性:一个被低估的 AI-Ready 维度
EBHI-Seg 的最大软肋不是数据质量,而是同一个规模数字在四处文档里给了四个答案(§10 坑 2)。这直接导致下游大量复制错误数字。启示:开放数据集的文档必须单一真值源(single source of truth)——figshare 描述、论文、README 三处数字应一致;一旦漂移,错误会沿引用链无限扩散。
8.7 小数据集也能有高引用:定位比规模重要
EBHI-Seg 只有 2,228 张切片图、276 MB,却获得约 66 次引用,说明数据集的学术价值不取决于体量,而取决于它填补了什么空白。它填补的空白是"结直肠肠镜活检 + 六类分化阶段 + 像素级分割真值"。启示:在设计数据集时,先问"现有数据缺什么"(这里是活检场景的像素级多阶段分割),而非"我能做多大"。
8.8 单机构数据的泛化边界应显式声明
EBHI-Seg 病理来源单一(辽宁省肿瘤医院),这既是质量可控的优点,也是泛化的限制。论文未做多中心外部验证。启示:单机构数据集都应显式声明来源单一性,并建议使用者在跨机构场景中把"域偏移"作为必测项——多中心对照(如库内 unitopatho,rid 701)是必要的补充。
8.9 可获取性优先还是规模优先:两种数据集策略
对比库内两类病理数据集可见两条路线:一类追求规模与深度(NCT-CRC-HE-100K 10 万张、PANDA 万余张 WSI),另一类追求可获取性与精标(EBHI-Seg 2,228 张 + 直链 + CC BY 4.0)。两条路线的价值不可通约:前者服务预训练,后者服务快速验证与教学。启示:选题时应先明确服务对象——若目标是让社区"立刻跑起来",可获取性优先;若目标是"刷榜/预训练",规模优先。
§9 与库内条目的关系
9.1 家族图谱
- digestpath(rid 338):最贴切的方法论对照。消化道(结直肠)组织病理分割挑战赛,与本条目同为"结直肠分割"方向,但 DigestPath 侧重更大规模与竞赛评测,EBHI-Seg 侧重小规模精标与多阶段分层——两者构成"竞赛级 vs 起步级"的分割双档。
- nct-crc-he-100k(rid 148):结直肠组织学 patch 分类(10 万张、9 类)。与其正文对照表中已列的"EBHI(分类版)"是姊妹集,本条目(EBHI-Seg 分割版)应作为该对照行的任务升级对照追加互链(§4.3)。
- unitopatho(rid 701):结直肠癌组织病理分类(多中心),与本条目共享"结直肠组织病理"域,可作为多中心泛化的对照(本条目单中心)。
- consep(rid 228)/ pannuke(rid 218)/ monuseg(rid 30)/ bcss(rid 258):核/组织实例分割对照——它们做的是"计数与实例",EBHI-Seg 做的是"区域语义分割",任务粒度不同但同属病理分割谱系。
- cvc-colondb(rid 142):结肠镜视频息肉检测/分割——与 EBHI-Seg 的"活检标本分割"分处早筛链条的不同环节(内镜图像 vs 组织病理)。
- mhist(rid 168)/ lc25000(rid 178):组织学分类对照(本条目为分割任务)。
- paip(108)/ camelyon16(694)/17(699)/ pcam(158)/ midog(298):病理 AI 家族远邻(前列腺、乳腺、淋巴、有丝分裂)。
9.2 检索路径建议
- 检索词组合:“EBHI-Seg”(精确)+ “segmentation” + “colorectal”;或 figshare DOI “10.6084/m9.figshare.21540159”。
- 若目标是立刻可用数据:figshare 21540159 → 下
EBHI-SEG.rar(276 MB)→ 直接用 image/label 配对训练。 - 若要引用规模数字:引 Front Med 2023 §3.1 的 4,456(2,228+2,228),勿引 figshare 旧描述的 5,170/5,710(坑 2)。
- 若要区分姊妹集:EBHI(分类,16999363,5,532 图四档倍率五类)vs EBHI-Seg(分割,21540159,2,228 切片+2,228 掩码,六类)。
9.3 库内互链优先级
| 优先级 | 条目 | rid | 理由 |
|---|---|---|---|
| 1 | digestpath | 338 | 同为结直肠组织病理分割 |
| 2 | nct-crc-he-100k | 148 | 同域规模对照,已有姊妹集对照行 |
| 3 | unitopatho | 701 | 结直肠组织病理(多中心 vs 单中心) |
| 4 | consep | 228 | 病理分割方法论对照 |
| 5 | cvc-colondb | 142 | 结直肠早筛链条的另一环节 |
9.4 与库内病理分割家族的横向定位
把库内主要病理分割条目按"组织/器官 × 分割对象"排布,EBHI-Seg 的位置一目了然:
| 条目 | rid | 组织 | 分割对象 | 类别数 |
|---|---|---|---|---|
| monuseg | 30 | 淋巴结 | 细胞核实例 | 1 |
| consep | 228 | 结直肠 | 细胞核实例 | 多类 |
| pannuke | 218 | 多器官 | 细胞核实例 | 5 |
| bcss | 258 | 乳腺 | 细胞核/区域 | 多类 |
| ebhi-seg | 本条 | 结直肠(肠镜活检) | 病变区域(六类分化阶段) | 6 |
| digestpath | 338 | 消化道 | 病变区域 | 竞赛口径 |
| unitopatho | 701 | 结直肠 | (分类任务) | 多类 |
关键区别:EBHI-Seg 是"区域级语义分割 + 六类分化阶段",而 monuseg/consep/pannuke 做的是"细胞核实例分割"——任务粒度不同。理解这一点,就不会把 EBHI-Seg 与核分割数据集混为一类。
§10 避坑清单:八个已核实的坑
坑 1:“EBHI-Seg” 与分类版 “EBHI” 名称相邻,极易张冠李戴。 两个数据集同门同源、名称只差一个 “-Seg”:分类版 EBHI/EBH-HE-IDS(figshare 16999363,5,532 图、4 档倍率、5 类)与分割版 EBHI-Seg(21540159,2,228 切片 + 2,228 掩码、单 400×、6 类)。库内 NCT-CRC-HE-100K 条目(rid 148)正文对照表里列的"EBHI 5,000 图像、5 类"指的是分类版,不是本条目。选条、互链、检索时务必先判断是分类版还是分割版(§4、附录 H)。
坑 2:规模数字四处漂移(本条目头号数据坑)。 同一个数据集,正式论文写 4,456(2,228 切片 + 2,228 掩码),figshare 页面描述却同段并存 5,170 与 5,710(2,855+2,855),arXiv v1 摘要写 5,170、v3 正文写 2,855+2,855。figshare 描述发布后从未修订(API version 仍为 1,modified 与 created 同日)。引用一律以正式版 4,456 为准;若只统计切片图像则写 2,228。这是 EBHI-Seg 最易传播的错误——下游 GitHub/评测大量复制了 figshare 旧数字(§2.1、附录 L)。
坑 3:逐类数字被二手源整倍翻倍。 OpenMedLab / Dataset Ninja 等二手源的逐类表列 Normal 152 / Polyp 948 / Low-grade IN 1278 / High-grade IN 372 / Serrated adenoma 116 / Adenocarcinoma 1590——恰为论文各类的 2 倍(因其把"图像 + 掩码"各计一遍,合计 4,456)。引用逐类数字时须除以 2 才是切片图像数。
坑 4:掩码编码规范未明示。 论文与 figshare 均未给出掩码的灰度/颜色编码细则(原始为黑白掩码 vs 类别色),下游仓库多自行按类着色。使用前须以 rar 内实际文件为准,不要凭空假设颜色—类别映射(§2.4、附录 S)。
坑 5:Conformity coefficient 定义域 [−∞,1],可为负。 该指标下界是 −∞(θ_TP=0 判失败),论文表中出现 −30.85、−12.06 等极端负值属定义使然,不是"算错"或"数据异常"。读指标表时勿把它与 Dice/Jaccard 直接横向比大小(§5.1)。
坑 6:论文自身 “five types” 与六类实列不一致。 §3.1 末句写 “The data are grouped into five types described in detail in Section 2.2”,但 2.2 实际列了六类(含 Serrated adenoma)且 §3.1 开头逐类也列了六类。以六类为准(逐类数字之和 2,228 也要求六类),论文此句为笔误(§2.2)。
坑 7:划分未声明随机种子/患者级隔离;概览 Dice 与逐类口径不同。 论文深学划分(train:test≈1:1,§5.6)未声明随机种子、未做患者级隔离(患者数根本未披露);且"最高 Dice 0.948/0.965"是概览口径,逐类稳定值低于此。复现时须自定义划分并声明,跨研究比较时须对齐口径。
坑 8:Polyp-U-Net 行的 Dice 与 Jaccard 不自洽。 论文表 5 中 Polyp 类的 U-Net 一行,Dice 0.965 却搭配 Jaccard 0.308,二者数学上不自洽(Dice=2·IoU/(1+IoU),IoU 0.308 应对应 Dice≈0.47)。疑为原文排版转录异常。引用该组合时须谨慎并回原表核对(§5.3 脚注、附录 G 自检提示)。
§11 参考来源与延伸阅读
本条目全部硬事实的来源清单(三源互证),供复核:
| # | 来源 | 类型 | 用于 |
|---|---|---|---|
| 1 | Front Med (Lausanne) 2023;10:1114673(PMC9902656 全文) | 正式论文 | 规模、逐类、规格、伦理、基线、划分 |
| 2 | EuropePMC fullTextXML(PMC9902656) | 全文机器可读 | 正文精确引文核验 |
| 3 | figshare API /v2/articles/21540159 |
元数据 API | license、文件、md5、发布日 |
| 4 | figshare 数据集页 https://figshare.com/articles/dataset/EBHI-SEG/21540159/1 | 数据集页 | 描述文字(含 5,170/5,710 旧口径) |
| 5 | arXiv:2212.00532(v1-v3) | 预印本 | 版本漂移存照 |
| 6 | Dataset Ninja / OpenMedLab Awesome-Medical-Dataset | 第三方索引 | 逐类翻倍口径、objects 计数 |
| 7 | Phys Med 2023;107:102534 + figshare 16999363 | 姊妹集 | 分类版 EBHI 对照 |
| 8 | Barua et al. 2024, PeerJ CS 10:e2633 / Zenodo 14048544 | 第三方下游 | MobileViT-UNet 结果 |
| 9 | Google Scholar 引用页 | 引文计量 | 约 66 次引用 |
延伸阅读建议:想深入结直肠病理分割,先读本条目 §5(基线)再读姊妹集 EBHI 论文(分类视角);想理解该团队的数据工程思路,可对照其胃癌方向数据集工作;想理解"可获取性如何影响数据集使用",对照库内 PANDA-PLUS(请求制)条目。
§12 常见误解辨析(易错点澄清)
在检索与引用 EBHI-Seg 时,以下误解反复出现,逐条澄清:
误解 1:“EBHI-Seg 有 5,170 张图。”
错。5,170 出自 figshare 冻结描述与 arXiv v1 摘要,是发布期残留口径。正式版是 4,456(2,228 切片 + 2,228 掩码)(坑 2)。
误解 2:“EBHI-Seg 和 EBHI 是同一个数据集,只是叫法不同。”
错。是两个数据集:EBHI 是分类集(5,532 图、4 档倍率、5 类),EBHI-Seg 是分割集(2,228 切片+2,228 掩码、单 400×、6 类)。同门同源但任务、规模、类别数都不同(坑 1、§4)。
误解 3:“每类有 152/948/… 张图。”
错。那是"图像 + 掩码"各计一次的双倍口径(坑 3)。切片图像逐类应为 76/474/639/186/58/795。
误解 4:“切片所在文件夹的类别就是这张图的整图真值。”
不完全。切片级类别由"最严重优先"弱监督规则产生,图内可能含多阶段;真正的像素级真值是 label/ 下的掩码(§2.11)。
误解 5:“Conformity coefficient 是 0-1 的,出现负数说明代码错了。”
错。其定义域是 [−∞,1],负值是该系数定义使然(坑 5)。
误解 6:“论文里 Highest Dice 0.948 是经典方法的平均成绩。”
不完全。0.948 是概览口径的"最高"(某类最优),逐类稳定值低于此;深学组 0.965 同理(坑 7)。
误解 7:“EBHI-Seg 是结肠镜图像数据集。”
错。它是组织病理切片图像(显微镜下),不是结肠镜(内镜)图像。结肠镜图像数据集另属一类(如库内 cvc-colondb,rid 142)(§7.5)。
误解 8:"有官方排行榜可以刷。 "
错。无 leaderboard、无提交入口,只有论文自带基线(§5、Q26)。
误解 9:"可以直接拿来做临床诊断。 "
错。研究用数据集,单机构、单倍率、类别极不均衡、患者级信息缺失,不满足临床验证要求(§3.4、Q31)。
误解 10:“六类里的 Normal 和 Serrated adenoma 指标低,说明方法不行。”
错。主因是样本极少(76 与 58),属数据分布使然,非方法缺陷(§5.4、坑 7)。
FAQ(高频问答 32 问)
A. 基础认知
Q1:EBHI-Seg 是挑战赛吗?
不是。它没有比赛、没有 leaderboard、没有提交入口,是一个公开的结直肠肠镜活检组织病理图像 + 像素级分割掩码数据集,附带一篇方法学/基准论文与一套六指标评测基线。任务形态是语义分割,不是分类竞赛。
Q2:名字里的 EBHI 是什么?
Enteroscope Biopsy Histopathological Image(肠镜活检组织病理图像)。全称 EBHI-Seg——Enteroscope Biopsy Histopathological H&E Image Dataset for Image Segmentation Tasks。Seg 后缀指明这是分割版本,与之并列的还有分类版 EBHI(见 Q4)。
Q3:"肠镜活检"具体指什么样本?
结肠镜检查时从肠壁可疑病灶处**钳取(biopsy)**的组织小块,经 H&E(hematoxylin and eosin,苏木精-伊红)染色后制片、在 400× 下成像——即先内镜定位、再病理切片,属"内镜—病理"衔接环节的样本,而非直接拍摄肠腔的(肠镜)图像。
Q4:它和分类版 EBHI 是什么关系?
同门姊妹集,同源、同病理科室、同伦理批件。分类版即 EBH-HE-IDS(figshare 16999363,2021),5,532 图 / 4 档倍率 / 5 类,对应论文 Phys Med 2023;107:102534;EBHI-Seg(figshare 21540159,2022)则只保留 400×、切成 六类、并为每张切片配上像素级掩码。详见 §4 的对照表。
Q5:谁做的?
中国东北大学(沈阳)医学与生物信息工程学院 MIaMIA Group(Microscopic Image and Medical Image Analysis Group),病理样本来自中国医科大学附属肿瘤医院/辽宁省肿瘤医院病理科,另与德国吕贝克大学、波兰卡托维兹经济大学合作。一作 Liyu Shi,通讯 Xiaoyan Li(病理)与 Chen Li(东北大学)。
Q6:发表在哪里?
Frontiers in Medicine(Front Med, Lausanne)2023;10:1114673,doi:10.3389/fmed.2023.1114673,PMID 36760405,PMCID PMC9902656,2023-01-24 出版,CC BY 4.0 开放获取。预印本为 arXiv:2212.00532。
Q7:最大的卖点一句话?
它是目前为数不多按六类肿瘤分化阶段(正常→息肉→低级别上皮内瘤变→高级别上皮内瘤变→锯齿状腺瘤→腺癌)组织、并逐张配像素级 ground truth 的结直肠肠镜活检 H&E 分割集——把"结直肠早筛的病理分级"与"像素级分割"两件事叠在同一份公开数据上。
Q8:它自己有什么局限?
类别极度不均衡(Adenocarcinoma 795 张 vs Serrated adenoma 58 张、Normal 仅 76 张)、仅单一 400× 倍率、单机构病理来源、患者级数量未披露、掩码灰度编码未在论文中说明,以及多处规模口径漂移(见 §2 与坑 2)。
Q9:开源吗?
数据集本体完全公开直链:figshare 21540159 无需注册、无需申请、无门禁,license 为 CC BY 4.0。论文同样 CC BY 4.0 开放获取。
Q10:它是"五类"还是"六类"?
六类。论文 §3.1 末尾偶写 “five types” 属论文自身表述不一致(存照于坑 6);实际标题、节标题与全部表格均为 Normal / Polyp / Low-grade IN / High-grade IN / Serrated adenoma / Adenocarcinoma 六类。
B. 数据与获取
Q11:到底有多少张图?为什么网上数字都不一样?
以正式版论文为准:4,456 个文件 = 2,228 张切片图像 + 2,228 张对应 ground truth 掩码。"5,170""5,710"“2,855"均出自 figshare 冻结描述与 arXiv 早期版本,属发布期口径漂移(坑 2),全书一律按 4,456(2,228+2,228)成稿。若有人只报"2,228”,指的是切片图像数(不含掩码)。
Q12:为什么逐类数字有人报的是两倍?
因为部分二手镜像(如 Dataset Ninja)把"图像 + 掩码"各计一次。其表列 Normal 152 / Polyp 948 / Low-grade IN 1278 / High-grade IN 372 / Serrated adenoma 116 / Adenocarcinoma 1590——恰为论文逐类计数的 2 倍,合计 4,456。引用逐类数时须除以 2 才得切片图数(存照于坑 3)。
Q13:掩码是什么格式?
与原图同尺寸的二值/单类像素级掩码,随 figshare 的 EBHI-SEG.rar 一同打包,目录结构为每类下 image/ 与 label/ 两个子目录。论文与 figshare 均未明示掩码灰度编码细则——原始掩码普遍认为是黑白(前景/背景),下游常按类别着色使用,使用者须以 rar 内实际文件为准(遗留疑点,见坑 4)。
Q14:怎么下载?多大?
figshare 数据集页 https://figshare.com/articles/dataset/EBHI-SEG/21540159/1 ,单文件 EBHI-SEG.rar,size 276,013,249 B(≈276 MB / 263 MiB),md5 1daa1cc40177259e9cbe199b8e488327,直链走 ndownloader.figshare.com/files/38179080。本条目只登记校验值,不代管镜像。
Q15:能商用吗?
可以。CC BY 4.0 允许商业使用,条件是署名(attribution):须标明来源(MIaMIA Group / 论文 / figshare DOI)并指出是否修改。无"仅学术用途"限制,也无再分发限制。
Q16:下载后第一件事该做什么?
先核 md5(1daa1cc40177259e9cbe199b8e488327)确认包完整,再核对解压后六类文件数合计 4,456(每类 image 与 label 各占一半),最后随机抽样目视 image-label 配准是否逐张对应。
Q17:没有下载前怎么预估类别均衡情况?
直接看论文 Table 2(见 §2 对照表):Adenocarcinoma 35.68%、Low-grade IN 28.68%、Polyp 21.27% 三类占约 86%,而 High-grade IN 8.35%、Normal 3.41%、Serrated adenoma 2.60% 合计不足 15%。这是典型的病理长尾分布,建模前必须规划重采样/加权/分层。
Q18:患者级数量能查到吗?
查不到。论文只给图像数,未给唯一患者数或活检样本数,无法做患者级去重核验——这是本数据集的公开信息盲区之一(遗留疑点)。
C. 任务与评测
Q19:这是分类任务还是分割任务?
像素级语义分割(六类病变组织的区域级分割)。虽然每张切片在目录上归属一个类别文件夹(切片级弱标签),但数据集的评测目标是"逐像素判区域",论文给出的全部基线指标都是分割指标。
Q20:论文用哪些指标评测?
六项:Dice ratio、Jaccard index(IoU)、Conformity coefficient、Precision、Recall,外加混淆矩阵(TP/FP/TN/FN)。六项的完整定义、取值域与注意事项见 §5.1。
Q21:Conformity coefficient 为什么有人说是负的?
因为它的定义域是 [−∞, 1],不是 [0,1]。当分割结果比随机还差时会给负值(与 Matthews 相关系数同源)。因此不能把 Conformity 与 Dice/Jaccard 直接横向比大小,更不能因负值判定"代码跑错"(坑 5)。
Q22:经典机器学习基线里谁最强?
论文 Table 3 中,OTSU 在多个类别上领先(如 Low-grade IN 的 Dice 约 0.886、Jaccard 约 0.816),五方法(k-means、MRF、OTSU、Watershed、Sobel)里 Watershed 综合最弱(Dice 约 0.45 量级)。概览口径给出的最高 Dice 0.948 即出自经典组(坑 7 说明口径差异)。
Q23:深度学习基线里谁最强?重吗?
三网络对比中 U-Net 最高——Polyp 类 Dice 0.965;Seg-Net 综合约 0.88+ 且训练最省;MedT(Medical Transformer)约 0.75,模型大、训练慢。若追求性价比,Seg-Net 常被推荐为折中(§5.3)。
Q24:为什么 Normal 类指标普遍偏低?
样本太少——Normal 仅 76 张,属六类最小类之一,模型难以学到稳定特征;同时"正常黏膜"本身纹理单一,分割边界与背景的对比度低。这不是模型缺陷,是数据分布使然(§5.3 已提示,勿把 Normal 低分误读为"方法失效")。
Q25:U-Net 在 Polyp 上的 Dice 0.965 与 Jaccard 0.308 怎么同表并现?
这属于论文表格中的存疑项:Dice 0.965 与 Jaccard 0.308 在同一行极不自洽(Dice 与 Jaccard 存在固定单调关系,不可能一个近满值、一个近随机)。本条目在 §5.3 已加脚注存疑,附录 Q 的坑 8 明确列为不可直接引用的可疑数字——转引时请回核原表并注明疑点。
Q26:有官方 leaderboard 吗?
没有。论文只提供自带基线,无在线榜单、无提交系统。第三方结果(如 Barua et al. 2024 的 MobileViT-UNet,Dice 0.944±0.030)属研究者自行对比,口径未必与论文完全一致,横向比较需谨慎(§5.7)。
Q27:论文怎么划分训练/测试?
论文深学实验采用对称划分:Normal 30/30、Polyp 190/190、Low-grade IN 256/256、High-grade IN 74/74、Serrated adenoma 23/23、Adenocarcinoma 318/318(另有 predict 数单列)。细分口径见 §5.6。该划分未声明随机种子或患者级隔离,复现时须自行制定并声明(坑 7)。
D. 方法与工程
Q28:切片级类别标签是怎么定的?
按论文三条弱监督标注规则:①切片内只有单一分化阶段→该阶段即标签;②存在多个阶段→取最明显(most prominent)者;③多个阶段分布相近→取最严重(most severe)阶段。这意味着"一级标签"反映的是切片中最具临床意义的成分,而非"唯一成分"。
Q29:数据预处理推荐怎么做?
标准数字病理管线即可:统一读入 → 尺寸归一(原图 224×224,若模型要求更大需上采样并说明)→ 六类分层重采样或类别加权 → 划分固定随机种子 → 记录患者级不可得这一限制。stain normalization(如 Macenko)可选,但请在论文中声明。
Q30:可以只用某几个类吗(比如三分类)?
可以,且常见。多数下游工作会把六类归并(如把 Low-grade IN 与 High-grade IN 合成"IN"、或把 Normal 与 Polyp 归为"非恶性")以缓解长尾。归并后请在方法节写明归并规则,否则与他人结果不可比。
Q31:能直接用于临床诊断吗?
不能。这是研究用公开数据集:单机构来源、单倍率、边界掩盖、患者级信息缺失、类别严重不均衡——这些都不满足临床验证要求。任何宣称"在 EBHI-Seg 上高分即可临床落地"的表述都应被驳回。
Q32:本条目与库内其他病理条目冲突吗?
不冲突、互为补充。EBHI-Seg 定位为结直肠肠镜活检组织病理的六类像素级分割;库内 nct-crc-he-100k(148)是结直肠组织学分类、digestpath(338)是消化道病理分割挑战赛、cvc-colondb(142)是结肠镜息肉分割——四者构成"结直肠道"数据集家族的不同环节(§9)。
事实清单(硬事实 36 条)
- 全称 EBHI-Seg = Enteroscope Biopsy Histopathological H&E Image Dataset for Image Segmentation Tasks。
- 任务形态:医学图像语义分割(六类病变组织的像素级区域分割)。
- 正式论文:Front Med (Lausanne) 2023;10:1114673;doi 10.3389/fmed.2023.1114673。
- PMID 36760405;PMCID PMC9902656;出版日 2023-01-24。
- 预印本:arXiv:2212.00532(2022-12-01 首版)。
- 数据集本体:figshare 21540159,doi 10.6084/m9.figshare.21540159.v1,发布 2022-11-11T04:13:02Z。
- figshare 署名为机构账号 MIaMIA Group(非个人)。
- 权威规模:4,456 文件 = 2,228 切片图像 + 2,228 ground truth 掩码(论文 §3.1)。
- 六类逐类计数:Normal 76 / Polyp 474 / Low-grade IN 639 / High-grade IN 186 / Serrated adenoma 58 / Adenocarcinoma 795。
- 六类逐类占比:3.41% / 21.27% / 28.68% / 8.35% / 2.60% / 35.68%。
- 逐类之和 76+474+639+186+58+795 = 2,228,与正文一致。
- 放大倍率:仅 400×(目镜 10× × 物镜 40×)。
- 图像输入尺寸:224×224 像素;格式 *.png。
- 采样方式:intestinal biopsy(肠镜活检);H&E 染色。
- 显微镜:Nissan Olympus;采集软件:NewUsbCamera。
- figshare 包体量:EBHI-SEG.rar,276,013,249 B,md5
1daa1cc40177259e9cbe199b8e488327。 - 下载直链:ndownloader.figshare.com/files/38179080。
- 目录结构:六类顶层文件夹,每类下
image/与label/子目录。 - 文件名形如
GT2001837-1-400-001.png,其中-400-表示 400× 倍率。 - 数据准备:论文称由 12 名生物医学研究者按规则制作;两名病理学家提供切片与图像级标注。
- 伦理批件:“Research Project Ethics Certification” No. 202229。
- 标注三规则:单一阶段即标签 / 多阶段取最明显 / 分布相近取最严重。
- license:CC BY 4.0(数据集与论文一致)。
- 获取方式:figshare 公开直链,无门禁、无申请。
- 论文六项指标:Dice、Jaccard(IoU)、Conformity coefficient、Precision、Recall + 混淆矩阵。
- Conformity coefficient 定义域 [−∞, 1]。
- 经典机器学习五方法:k-means、MRF、OTSU、Watershed、Sobel。
- 经典组概览最高 Dice 0.948;OTSU 在 Low-grade IN 等类领先(Dice 约 0.886)。
- 深度学习三网络:U-Net、Seg-Net、MedT(Medical Transformer)。
- 深学最高 Dice 0.965(Polyp, U-Net);Normal 类因样本少三网络均偏低。
- 深学实验环境:Intel i7-8700 @3.20GHz / RTX 2080 / CUDA 11.2 / torch 1.7.0 / python 3.8。
- 论文划分:Normal 30/30、Polyp 190/190、Low-grade IN 256/256、High-grade IN 74/74、Serrated adenoma 23/23、Adenocarcinoma 318/318。
- 下游第三方:Barua et al. 2024, PeerJ CS 10:e2633,MobileViT-UNet 达 Dice 0.944±0.030 / Jaccard 0.897±0.049。
- 被引热度:Google Scholar 抓取时点约 66 次(Scopus 口径 45)。
- 姊妹分类集 EBH-HE-IDS:figshare 16999363,5,532 图 / 4 档倍率(40/100/200/400×)/ 5 类,对应 Phys Med 2023;107:102534。
- 资助:国家自然科学基金 No. 82220108007;北京希思科临床肿瘤学研究基金会 No. Y-tongshu2021/qn-0379。
术语表(30 条)
| 术语 | 中文 | 说明 |
|---|---|---|
| Enteroscope biopsy | 肠镜活检 | 结肠镜下从肠壁钳取的组织小块,本数据集的样本来源 |
| H&E | 苏木精-伊红染色 | 病理最常规染色;苏木精染核呈蓝紫、伊红染胞质呈粉红 |
| Segmentation | 分割 | 逐像素判定所属区域的任务形态,本数据集的评测目标 |
| Ground truth | 真值/金标准掩码 | 与原图同尺寸的像素级标注文件 |
| Mask | 掩码 | 编码前景/类别的像素级标注产物 |
| Normal | 正常 | 无病变的正常黏膜,76 张,六类中最少者之一 |
| Polyp | 息肉 | 黏膜隆起性病变,474 张 |
| Low-grade IN | 低级别上皮内瘤变 | Low-grade Intraepithelial Neoplasia,639 张,占比最高之一 |
| High-grade IN | 高级别上皮内瘤变 | High-grade Intraepithelial Neoplasia,186 张,癌前高危 |
| Serrated adenoma | 锯齿状腺瘤 | 特殊形态腺瘤,58 张,六类最少 |
| Adenocarcinoma | 腺癌 | 已浸润的恶性病变,795 张,占比最高 |
| Intraepithelial Neoplasia (IN) | 上皮内瘤变 | 上皮层的异型增生,按程度分低/高级别 |
| Serrated pathway | 锯齿状通路 | 经锯齿状腺瘤进展为结直肠癌的一条独立通路 |
| Weak supervision | 弱监督 | 仅有切片级标签、由规则反推像素级真值的标注范式 |
| Most prominent | 最明显 | 弱监督规则②:多阶段中占比/形态最突出者 |
| Most severe | 最严重 | 弱监督规则③:分布相近时取临床最严重阶段 |
| Dice ratio | Dice 系数 | 重叠度指标,2 |
| Jaccard index (IoU) | 交并比 | |
| Conformity coefficient | 一致性系数 | 类 Matthews 相关,定义域 [−∞,1] |
| Precision | 查准率 | TP/(TP+FP) |
| Recall | 查全率 | TP/(TP+FN),又称灵敏度 |
| Confusion matrix | 混淆矩阵 | TP/FP/TN/FN 的交叉计数表 |
| U-Net | U 型网络 | 编码器-解码器跳跃连接分割网络,本文最高 Dice 0.965 出处 |
| Seg-Net | 分割网络 | 轻量编码器-解码器分割网络,训练最省 |
| MedT | 医学 Transformer | Medical Transformer,本文三网络中最大最慢 |
| OTSU | 大津法 | 自适应阈值二值化经典算法,经典组表现最强之一 |
| Watershed | 分水岭 | 基于拓扑的经典分割算法,本文经典组最弱 |
| MIaMIA Group | 微观与医学图像分析组 | 东北大学(沈阳)团队,本数据集出品方 |
| 224×224 | 输入尺寸 | 论文口径的图像与掩码分辨率 |
| 400× | 放大倍率 | 目镜 10× × 物镜 40×,本数据集唯一倍率 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | EBHI-Seg |
| url_name | ebhi-seg |
| 类型 | 结直肠肠镜活检 H&E 图像分割数据集(像素级掩码) |
| 论文 | Front Med 2023;10:1114673(doi 10.3389/fmed.2023.1114673) |
| 预印本 | arXiv:2212.00532 |
| 数据本体 | figshare 21540159(doi 10.6084/m9.figshare.21540159.v1) |
| 团队 | 东北大学 MIaMIA Group + 辽宁省肿瘤医院病理科 |
| 规模 | 4,456 = 2,228 切片 + 2,228 掩码(六类) |
| 倍率 | 仅 400×;输入 224×224;png |
| 许可 | CC BY 4.0(数据集与论文同为) |
| 抓取时点 | 2026-09-30 |
| 库内互链 | digestpath(338)/nct-crc-he-100k(148)/unitopatho(701)/consep(228)/cvc-colondb(142) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | figshare 页 + 论文开放获取(PMC 全文)+ arXiv 预印本三入口;"EBHI-Seg"与分类版 EBHI 名称相邻易混(坑 1) |
| A 可获取性 | 9 | 数据集公开直链、无申请、无门禁、有 md5 可校验,单文件 276 MB 便于获得;唯一失分是掩码编码未说明(坑 4) |
| I 可互操作 | 7 | png 图像+掩码,主流框架可直读;但无官方加载脚本、无 DICOM/开放标注格式(如 COCO/GeoJSON)导出,需自建解析 |
| M 元数据质量 | 6 | 论文表格完备(逐类、划分、指标);但**规模四口径漂移(坑 2)+ 逐类被二手源翻倍(坑 3)+ 5/6 类表述不一(坑 6)**显著拉低 |
| S 可持续性 | 8 | 依托 figshare 长期托管(机构账号 MIaMIA Group),DOI 稳定,无个人邮箱单点;但 figshare 描述自 2022 发布后疑似未再修订 |
| 综合评级 | 7.6/10(中上) | 可获取性与可持续性突出(公开直链+DOI+md5),元数据质量因多处口径漂移被拉低;互操作性中等 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 4,456 = 2,228+2,228 | 论文 §3.1 正文 | PMC9902656 全文 |
| 六类逐类 76/474/639/186/58/795 | 论文 Table 2(类别分布) | PMC9902656 全文 |
| 400× / 224×224 / png | 论文 §2.2 与 §3.1 数据描述 | PMC9902656 全文 |
| 掩码目录 image/ + label/ | 论文数据组织描述 + rar 实包 | figshare 21540159 |
| 276,013,249 B / md5 1daa1cc4… | figshare API size/computed_md5 |
api.figshare.com/v2/articles/21540159 |
| CC BY 4.0 | figshare API license.value=1 + 论文版权声明 |
figshare 页脚/论文页脚 |
| 5,170 / 5,710 / 2,855 | figshare 冻结描述文字(同段并存矛盾) | figshare 21540159 描述区 |
| 5,170(摘要) | arXiv v1 摘要 | arXiv:2212.00532v1 |
| 2,855+2,855(正文) | arXiv v3 正文 | arXiv:2212.00532v3 |
| 逐类加倍(152/948/1278/372/116/1590) | Dataset Ninja 统计表 | datasetninja.com/ebhi-seg |
| 12,985 objects | Dataset Ninja 实例计数(非图像数) | datasetninja.com/ebhi-seg |
| Dice 0.948(经典)/ 0.965(深学) | 论文 Table 3 / Table 5 概览 | PMC9902656 全文 |
| 训练/测试划分(30/30…318/318) | 论文 Table 4 | PMC9902656 全文 |
| Dice 0.944±0.030 | Barua et al. 2024, PeerJ CS 10:e2633 | Zenodo 14048544 / GitHub |
| 约 66 次被引 | Google Scholar 抓取 | 2026-09-30 |
| 伦理批件 No. 202229 | 论文伦理声明 | PMC9902656 全文 |
| 基金 82220108007 / Y-tongshu2021/qn-0379 | 论文 Funding 节 | PMC9902656 全文 |
| 5,532 图 / 4 档 / 5 类(姊妹集) | EBHI 论文 Phys Med 2023;107:102534 + figshare 16999363 | PMC/figshare |
附录 D:数据获取决策树
你的目的是什么?
├── 只想快速拿到可用分割数据
│ └── figshare 21540159 直链下载 EBHI-SEG.rar → 核 md5 → 解压六类 image/label
├── 想做结直肠早筛的六类分割基线
│ ├── 1) 读论文 Table 3/5 建立复现基线(经典 + U-Net/Seg-Net/MedT)
│ ├── 2) 按论文 Table 4 或自定义划分固定种子
│ └── 3) 注意 Polyp Jaccard 0.308 存疑(坑 8)与 Normal 类小样本效应
├── 想做类别归并的研究(如三分类)
│ └── 先定归并规则(IN 合并 / 癌 vs 非癌)并写入方法节,否则不可比
├── 想引用"结直肠肠镜活检病理分割"数据
│ └── 引 Front Med 2023;10:1114673 + figshare 21540159,规模写 4,456(2,228+2,228)
└── 想找分类而非分割的结直肠病理数据
└── 姊妹集 EBH-HE-IDS(5,532 图 / 5 类 / 4 档)或库内 nct-crc-he-100k(148)
附录 E:六类标签语义与使用规范
| 类别 | 英文 | 病理语义 | 训练建议 |
|---|---|---|---|
| 正常 | Normal | 无病变黏膜 | 仅 76 张,勿单类过采样至失真;建议并入"非病变"或重加权 |
| 息肉 | Polyp | 黏膜隆起性病变(含增生性/炎性) | 与 IN/癌的边界靠形态,慎与其他类混并 |
| 低级别上皮内瘤变 | Low-grade IN | 轻中度异型增生 | 639 张,占比高、常为模型主导类,评估需看逐类指标 |
| 高级别上皮内瘤变 | High-grade IN | 重度异型增生(癌前高危) | 186 张,临床最关键却样本偏少,单独报告召回 |
| 锯齿状腺瘤 | Serrated adenoma | 锯齿状通路的腺瘤 | 仅 58 张,六类最少;勿与普通腺瘤混并 |
| 腺癌 | Adenocarcinoma | 浸润性恶性病变 | 795 张,占比最高;注意与 High-grade IN 的边界混淆 |
附录 F:最小复现骨架(伪代码)
阶段 0 获取
- figshare 21540159 下载 EBHI-SEG.rar
- md5 校验 = 1daa1cc40177259e9cbe199b8e488327
- 解压,确认六类各自 image/ 与 label/ 文件数合计 4,456
阶段 1 数据管线
- 读入 png 对(image, label),统一归一化到 224×224
- 类别 → 分层重采样或类别加权(Adenocarcinoma 35.68% vs Serrated 2.60%)
- 固定随机种子做划分,记录"患者级不可得"这一限制
阶段 2 模型
- 基线:U-Net(复现 Polyp Dice 0.965 上限参照)
- 性价比:Seg-Net;大模型对照:MedT
- 经典对照(可选):OTSU / k-means / Watershed
阶段 3 评测
- 逐类报告 Dice / Jaccard / Precision / Recall
- Conformity 单独列(定义域 [−∞,1],不与 Dice 并列比大小)
- 输出混淆矩阵;Normal 类单独标注小样本提示
阶段 4 存照
- 记录随机种子、划分清单、是否做 stain normalization
附录 G:指标计算公式表
| 指标 | 公式 | 取值域 | 注意 |
|---|---|---|---|
| Dice ratio | 2·TP / (2·TP + FP + FN) | [0,1] | 与 Jaccard 单调相关:Dice = 2J/(1+J) |
| Jaccard (IoU) | TP / (TP + FP + FN) | [0,1] | 同上,可据此交叉校验表内数字自洽性 |
| Conformity coeff. | (TP·TN − FP·FN) / √((TP+FP)(TP+FN)(TN+FP)(TN+FN)) | [−∞,1] | 可负;不等价于准确率 |
| Precision | TP / (TP + FP) | [0,1] | 单看会忽略漏检 |
| Recall | TP / (TP + FN) | [0,1] | 即灵敏度,医学场景常优先 |
| F1(派生) | 2PR / (P + R) | [0,1] | 论文未直接用,可自行派生 |
一致性自检提示:任一行若 Dice 与 Jaccard 不满足 Dice = 2J/(1+J),该行数字必有误——Polyp U-Net 行的 Dice 0.965 与 Jaccard 0.308 即属此类(坑 8)。
附录 H:EBHI-Seg 与姊妹分类集 EBHI 对照表(论文 Table 1 口径)
| 维度 | EBHI-Seg(分割) | EBHI / EBH-HE-IDS(分类) |
|---|---|---|
| figshare | 21540159 | 16999363 |
| 发布 | 2022-11-11 | 2021-11-13 |
| 论文 | Front Med 2023;10:1114673 | Phys Med 2023;107:102534 |
| 文件量 | 4,456(2,228 图 + 2,228 掩码) | 5,532 图 |
| 倍率 | 仅 400× | 40/100/200/400×(4 档) |
| 类别数 | 6(含 Serrated adenoma) | 5(无 Serrated adenoma) |
| 标注粒度 | 像素级分割掩码 | 切片级分类标签 |
| 任务 | 语义分割 | 图像分类 |
| 许可 | CC BY 4.0 | CC BY 4.0 |
| 同源 | 同 MIaMIA Group / 同病理科室 / 同伦理批件 202229 | 同左 |
附录 I:第三方下游结果登记表
| 研究 | 年份 | 方法 | 报告指标 | 备注 |
|---|---|---|---|---|
| 原论文(经典组) | 2023 | OTSU(Low-grade IN 最佳) | Dice ≈ 0.886 / Jaccard ≈ 0.816 | 概览最高 Dice 0.948 |
| 原论文(深学组) | 2023 | U-Net | Dice 0.965(Polyp) | Polyp 行 Jaccard 0.308 存疑(坑 8) |
| 原论文(深学组) | 2023 | Seg-Net | 综合 ≈ 0.88+ | 训练最省,性价比高 |
| 原论文(深学组) | 2023 | MedT | ≈ 0.75 | 模型大、训练慢 |
| Barua et al. | 2024 | MobileViT-UNet + Dice loss | Dice 0.944±0.030 / Jaccard 0.897±0.049 | PeerJ CS 10:e2633;Zenodo 14048544 |
| 社区复现 | 2023- | TensorFlow/PyTorch 各仓库 | 各异 | 口径不一,横比须谨慎(如 sarah-antillia 系 Apache-2.0 派生) |
附录 J:检索路径示范(关键词组合)
想找 EBHI-Seg 本体:
"EBHI-Seg" OR "EBHI-SEG" site:figshare.com
"Enteroscope Biopsy Histopathological" segmentation dataset
doi:10.3389/fmed.2023.1114673
想找结直肠病理分割的同类数据:
"colorectal" "histopathology" "segmentation" dataset
DigestPath(库内 338)/ CRAG / GlaS 等
"colorectal polyp" segmentation → CVC-ColonDB / Kvasir-SEG
想找分类而非分割:
"EBHI" 5,532 → 落回分类版 EBH-HE-IDS(figshare 16999363)
NCT-CRC-HE-100K(库内 148)
想核对规模口径:
"4,456" "2,228" EBHI-Seg(论文口径)
"5,710" "2,855" EBHI(figshare 描述口径,坑 2)
附录 K:坑点档案(与 §10 对照)
| 坑 | 一句话档案 | 触发场景 |
|---|---|---|
| 坑 1 | “EBHI-Seg” 与分类版 “EBHI” 名称相邻,极易张冠李戴 | 选条/互链/检索 |
| 坑 2 | 规模四口径漂移:4,456 / 5,170 / 5,710 / 2,855 | 数字抽取/引用 |
| 坑 3 | 逐类数字被二手源整倍翻倍(含掩码计数) | 二手转引逐类数 |
| 坑 4 | 掩码灰度/类别编码细则未在论文与发布页说明 | 建模/预处理 |
| 坑 5 | Conformity coefficient 定义域 [−∞,1],可负 | 指标解读 |
| 坑 6 | 论文自身 “five types” 与六类实列不一致 | 类别数核对 |
| 坑 7 | 划分未声明随机种子/患者级隔离;概览 Dice 与逐类口径不同 | 复现/公平比较 |
| 坑 8 | Polyp U-Net 行 Dice 0.965 与 Jaccard 0.308 不自洽 | 引用具体数字 |
附录 L:双口径登记表
| 项 | 口径 A(权威 · 本条目采用) | 口径 B(存照) | 处理 |
|---|---|---|---|
| 总文件数 | 4,456(论文 §3.1) | 5,170(figshare/arXiv v1)、5,710(figshare 描述/arXiv v3) | 正文一律 4,456,异口径入坑 2 |
| 切片图数 | 2,228 | 2,855 | 正文 2,228 |
| 掩码数 | 2,228 | 2,855 | 正文 2,228 |
| 类别数 | 6(标题/节/表实列) | 5(论文偶写 “five types”) | 正文 6 类,坑 6 |
| 逐类计数 | 76/474/639/186/58/795 | 152/948/1278/372/116/1590(2 倍口径) | 正文用前者,坑 3 |
| 经典最高 Dice | 0.948(概览) | 逐类约 0.886(Low-grade IN, OTSU) | 两口径并列说明,坑 7 |
| 实例对象数 | —(非图像数) | 12,985 objects(Dataset Ninja) | 明确标注非图像数 |
| 被引数 | 约 66(Google Scholar) | 45(Scopus) | 两口径并存 |
附录 M:与库内条目的关系声明
| 库内条目 | rid | 关系 |
|---|---|---|
| digestpath | 338 | 最贴切的方法论对照:同为结直肠/消化道组织病理分割 |
| nct-crc-he-100k | 148 | 同域分类集(100k patch / 9 类);其正文对照表列的 “EBHI 5,000 图” 实为分类版 EBHI,非本条目 |
| unitopatho | 701 | 结直肠癌组织病理分类(多中心),同域异任务 |
| consep | 228 | 结直肠核实例分割对照 |
| cvc-colondb | 142 | 结肠镜息肉分割(视频帧),同"结直肠道"早筛链路 |
互链优先级建议:digestpath(338) > nct-crc-he-100k(148) > unitopatho(701) > consep(228) > cvc-colondb(142)。
附录 N:许可条款细读(CC BY 4.0)
| 权利/义务 | 内容 |
|---|---|
| 允许 | 复制、分发、改编、商业使用 |
| 条件 | 署名(BY):给出适当署名、许可链接,并指出是否作出修改 |
| 无额外限制 | 不得施加法律条款或技术措施限制他人合法使用 |
| 署名建议 | 引论文(Front Med 2023;10:1114673)+ figshare DOI 10.6084/m9.figshare.21540159.v1 + MIaMIA Group |
| 免责 | 无担保;研究用途,不构成临床器械/诊断依据 |
| 论文侧 | 论文同为 CC BY 4.0,转载图表亦需署名 |
附录 O:本条目生产档案
| 项 | 值 |
|---|---|
| 代理名 | agent-c-ebhiseg |
| 正选 slug | ebhi-seg |
| 派发时间 | 2026-09-30T19:51:42 |
| 锁创建 | 2026-09-30T19:55(agent-c-ebhiseg) |
| 抓取与核验时点 | 2026-09-30 |
| 查重结论 | url_name ILIKE '%ebhi%' → 0 行;不撞库 |
| 生成方式 | 5 part 直写(私有区 .parts_agent-c-ebhiseg/)后 cat 拼接 |
| 校验 | check_md.py + preflight_check.py 双零 |
附录 P:FAIR / AI-Ready 检查单
| 原则 | 状态 | 说明 |
|---|---|---|
| Findable(可发现) | ✅ | figshare DOI + 论文 PMC + arXiv 三重可索引 |
| Accessible(可获取) | ✅ | 公开直链、无门禁、md5 可校验 |
| Interoperable(可互操作) | ◐ | png 通用,但无官方加载脚本/开放标注格式导出 |
| Reusable(可复用) | ✅ | CC BY 4.0,允许商用与改编,须署名 |
| AI-Ready 元数据 | ◐ | 类别/划分/指标完整;规模口径与掩码编码缺说明 |
| AI-Ready 标注质量 | ✅ | 病理学家切片标 + 12 人制作 + 伦理批件 202229 |
| AI-Ready 可复现 | ◐ | 未给随机种子与患者级隔离,划分需自行重定义 |
附录 Q:缩写速查
| 缩写 | 全称 | 中文 |
|---|---|---|
| EBHI | Enteroscope Biopsy Histopathological Image | 肠镜活检组织病理图像 |
| EBHI-Seg | … Dataset for Image Segmentation | 上述图像的分割数据集 |
| EBH-HE-IDS | EBHI H&E Image Dataset | 分类版姊妹集名 |
| H&E | Hematoxylin and Eosin | 苏木精-伊红染色 |
| IN | Intraepithelial Neoplasia | 上皮内瘤变 |
| IoU | Intersection over Union | 交并比(Jaccard) |
| MedT | Medical Transformer | 医学 Transformer 网络 |
| MIaMIA | Microscopic Image and Medical Image Analysis | 微观与医学图像分析组 |
| PIN | —(本条目无此缩写,防误写) | — |
附录 R:基于本数据集的研究检查清单(12 项)
- 规模一律写 4,456(2,228 图 + 2,228 掩码),勿混用 5,170/5,710/2,855。
- 明确任务为语义分割,不是分类;切片级标签只是弱监督来源。
- 逐类引用时确认是否被二手源翻倍(除以 2 得切片图数)。
- 类别极不均衡 → 必须说明重采样/加权/归并策略。
- 归并类别时写明归并规则,否则跨研究不可比。
- Conformity coefficient 单独列,不与 Dice/Jaccard 并列比大小。
- 引用 Polyp 行数字前核 Dice 与 Jaccard 自洽性(坑 8)。
- Normal 类低分标注"小样本效应",勿归因于方法失败。
- 声明划分方式与随机种子;说明患者级隔离不可得。
- 若用 stain normalization,请在方法节声明。
- 引用署名遵 CC BY 4.0:论文 + figshare DOI + MIaMIA Group。
- 明确"研究用途、非临床诊断依据"的免责声明。
附录 S:掩码格式核验清单(发布前自检用)
| 检查项 | 期望 | 不可得时的处置 |
|---|---|---|
| 掩码尺寸 = 原图尺寸 | 是 | 若否,记录实际尺寸并说明是否需 resize |
| 掩码为二值还是类别色 | 论文未明示 | 目视抽样 + 读像素值判定,写入方法节 |
| image 与 label 文件数一一对应 | 各类相等 | 若不等,定位缺失并记录 |
| 六类文件夹命名 | Normal/Polyp/Low-grade IN/High-grade IN/Serrated adenoma/Adenocarcinoma | 若平台改名,建立映射表 |
| 文件名倍率标记 | -400- |
若不符,回核 figshare 包版本 |
附录 T:维护计划与触发点
| 触发点 | 动作 |
|---|---|
| figshare 21540159 出现 v2+ | 复核规模口径是否修订,更新坑 2 存照 |
| 论文有勘误/再版 | 复核 Dice 0.965 与 Jaccard 0.308 矛盾是否被纠正(坑 8) |
| 掩码编码被官方说明 | 更新附录 S 与坑 4 |
| 出现患者级信息 | 补录患者/样本数,取消相应遗留疑点 |
| 被引数显著变化 | 更新 §7.3 热度数字 |
| 库内新增结直肠病理条目 | 更新 §9 与附录 M 互链表 |
附录 U:作者贡献速查(论文口径)
| 角色分类 | 作者 |
|---|---|
| 数据采集与医学知识 | Xiaoyan Li、Hongzan Sun |
| 数据准备与整理 | Weiming Hu、Haoyuan Chen、Jing Chen、Zizhen Fan、Minghe Gao、Yujie Jing、Guotao Lu、Deguo Ma、Zhiyu Ma、Qingtao Meng、Dechao Tang |
| 实验与结果分析 | Liyu Shi、Marcin Grzegorzek、Yueyang Teng |
| 方法与写作 | Shouliang Qi、Chen Li(通讯) |
附录 V:规模数字速查卡(贴墙用)
| 你要写的东西 | 正确写法 | 禁止写法 |
|---|---|---|
| 总文件数 | 4,456 | 5,170 / 5,710 |
| 切片图像数 | 2,228 | 2,855 |
| 掩码数 | 2,228 | 2,855 |
| 类别数 | 6 | 5 |
| 逐类 Normal | 76 | 152 |
| 逐类 Adenocarcinoma | 795 | 1590 |
| 最高 Dice(深学) | 0.965(Polyp-U-Net,概览口径) | 当作平均 |
| 许可 | CC BY 4.0 | 仅学术用途 |
附录 W:一分钟定性卡
| 问题 | 一句话答案 |
|---|---|
| 是什么 | 结直肠肠镜活检 H&E 组织病理的六类像素级分割数据集 |
| 谁做的 | 东北大学 MIaMIA Group + 辽宁省肿瘤医院 |
| 多大 | 4,456 文件 = 2,228 切片 + 2,228 掩码,约 276 MB |
| 怎么拿 | figshare 21540159 公开直链 |
| 什么许可 | CC BY 4.0(可商用,须署名) |
| 有什么用 | 结直肠早筛分割算法原型、基线对照、教学 |
| 局限 | 小、偏斜、单倍率、单机构、患者级未知 |
| 最易错的 | 规模数字(写 4,456 不写 5,170)与姊妹集混淆 |
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 O。事实陈述以正式论文 Front Med (Lausanne) 2023;10:1114673(PMC9902656 全文)、figshare 数据集页 21540159 及其 API、arXiv:2212.00532 三源互证为源;规模四口径漂移、逐类被二手源翻倍、论文自身 5/6 类表述不一、Polyp 行 Dice/Jaccard 不自洽等原始文档缺陷已在 §10 与附录 K、L 存照。本条目与库内 digestpath(338)、nct-crc-he-100k(148)、unitopatho(701)、consep(228)、cvc-colondb(142) 等条目互链,构成结直肠病理与消化道早筛数据集家族的检索面。后续维护触发点见附录 T。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- mhist — 共享标签:病理图像 / 结直肠癌 / 图像分类
- lc25000 — 共享标签:病理图像 / 结直肠癌 / 肿瘤学 / 图像分类
- glas — 共享标签:病理图像 / 医学图像分割 / 结直肠癌 / 肿瘤学
- crag — 共享标签:病理图像 / 医学图像分割 / 结直肠癌 / 肿瘤学
- panda-plus — 共享标签:病理图像 / 医学图像分割 / 肿瘤学 / 图像分类
- cima — 共享标签:病理图像 / 结直肠癌 / 肿瘤学
- pannuke — 共享标签:病理图像 / 医学图像分割 / 肿瘤学
- consep — 共享标签:病理图像 / 医学图像分割 / 结直肠癌
- lizard — 共享标签:病理图像 / 医学图像分割 / 肿瘤学
- ddti — 共享标签:医学图像分割 / 肿瘤学 / 图像分类
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

