GastroEndoNet (gastroendonet) — 胃食管反流病与结直肠息肉四分类内窥镜图像数据集 — AI-Ready Wikipedia

孟加拉 Dhaka 单中心内窥镜室 4,006 张原始图像(GERD / GERD Normal / Polyp / Polyp Normal 四类)× 6 种几何光度增强 = 24,036 张 512×512 JPG,Mendeley Data v3 公开直下,附伦理批号与两代内镜设备清单

来源 孟加拉 Dhaka Gulshan-2 的 Zainul Haque Sikder Women's Medical College & Hospital 内窥镜室采集的消化道内镜图像(Olympus EVIS EXERA III / GIF-190 与 Pentax Medical EG29-i10),原始像素 440–960 经 bicubic 重采样至 512×512 JPG;外加 6 种几何/光度增强副本;明细见正文附录发布时间: 2026-09-30最后更新: 2026-09-30 阅读 12
GastroEndoNet (gastroendonet) — 胃食管反流病与结直肠息肉四分类内窥镜图像数据集 — AI-Ready Wikipedia

信息速览

数据集名称GastroEndoNet (gastroendonet) — 胃食管反流病与结直肠息肉四分类内窥镜图像数据集 — AI-Ready Wikipedia
数据类型影像数据,原始数据,增强数据
规模未披露(4,006 张原始图像的患者级来源人数论文未给出)
接入方式孟加拉 Dhaka Gulshan-2 的 Zainul Haque Sikder Women's Medical College & Hospital 内窥镜室采集的消化道内镜图像(Olympus EVIS EXERA III / GIF-190 与 Pentax Medical EG29-i10),原始像素 440–960 经 bicubic 重采样至 512×512 JPG;外加 6 种几何/光度增强副本;明细见正文附录
AI 就绪度

INFOBOX — GastroEndoNet 一屏速览

维度 内容
本质 胃食管反流病(GERD)+ 结直肠息肉四分类内窥镜图像数据集(单源派生化,非跨机构汇聚)
论文 Data in Brief, Vol. 60, 111572, 2025 Jun|DOI 10.1016/j.dib.2025.111572|PMID 40470347|PMC12136698
数据页 Mendeley Data,DOI 10.17632/ffyn828yf4.3(v3,公开日期 2025-02-27)
团队 Daffodil International University(Dhaka)+ Premier University(Chattogram),7 位作者
采集地 孟加拉 Dhaka Gulshan-2 的 Zainul Haque Sikder Women’s Medical College & Hospital 内窥镜室
规模 24,036 张 512×512 JPG = 原始 4,006 × 6 种增强(v3 口径)
四类 GERD 974|GERD Normal 1,103|Polyp 779|Polyp Normal 1,150(原始图,各 ×6)
增强 60° 旋转、90° 旋转、水平翻转、缩放、亮度调整、错切——每张原图各生成 6 副本
设备 Olympus EVIS EXERA III(GIF-190 胃镜)+ Pentax Medical EG29-i10(消化道内镜)
任务 四分类图像分类(图像级单标签;无框、无掩码)
伦理 伦理批号 REC-FSIT-2024-08-24(Daffodil International University 伦理审查委员会)
许可 CC BY-NC-ND 4.0(非商业 + 禁止演绎);论文/OpenAIRE 口径冲突见坑 5
获取 Mendeley Data 公开直下(无需注册、无需申请);论文与机构页为旁证入口
库内互链 gastrovision(203)、hyperkvasir(693)、kvasir-seg(112)、polypgen(183)、cvc-colondb(142)、ldpolypvideo(163)

GastroEndoNet 是一本"一鱼六吃"的内窥镜图册:它没有去跨医院、跨国家地搜罗数据,而是把孟加拉 Dhaka 一家医院内窥镜室里拍下的 4,006 张原始消化道内镜图像,用六种几何与光度变换(旋转、翻转、缩放、调亮度、错切)各自复制成六份,凑成 24,036 张 512×512 的 JPG,再按"GERD / 正常食管"与"息肉 / 正常结肠"两组"病变 vs 对照"配成四类。它是一个典型的单源派生型(single-source derived)数据集——数据量看着不小,但"独立信息"只在那 4,006 张里,其余五分之四都是同源增强副本。理解这一点,是使用这个数据集的全部起点。

它想解决的问题也很直白:公开的消化道内镜数据集要么偏息肉、要么偏某个大会挑战赛,很少有同时覆盖食管侧 GERD 与结直肠侧息肉的"双任务合体"版本,而两者恰恰是消化内镜筛查里最常被 AI 关注的两个目标。GastroEndoNet 把这两个目标塞进同一个四类框架,配上一份清楚的伦理批号和两代设备清单,以 Mendeley Data 公开直下(无需注册、无需申请) 的低门槛发布,方便小团队快速起步做内镜分类模型的打通性实验。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——Mendeley Data 两个 zip 包(增强包 1.51 GB + 原始包 759 MB)即可直下,无需注册;但许可含 ND(禁止演绎) 条款,二次发布须原样(坑 5)。
  2. 关心数字口径:直奔 §4 数据构成——4,006 与 4,604、24,036 与 27,624 两套数字来自不同版本(v3 vs v1),本文双口径并存并标注版本(坑 3)。
  3. 要拿它做基准/训练:直奔 §7 评估与 §10 避坑清单——最重要的动作是先按原始文件去重再划分 train/test,否则增强副本跨集泄漏会显著虚高指标(坑 6)。

§0 导读:这个数据集解决什么问题

消化内镜(gastrointestinal endoscopy)是消化道疾病诊断的主力手段:胃镜看食管与胃,结肠镜看结直肠。在 AI 辅助诊断的语境里,内镜图像有两大热门任务——食管侧的胃食管反流病(Gastroesophageal Reflux Disease, GERD)识别,和结直肠侧的息肉(polyp)检测与分类。前者关系到反流性食管炎、Barrett 食管等病变的早期发现,后者直接关系到结直肠癌(colorectal cancer)的癌前病变筛查。两者同属消化道,却长期各自为战:公开数据集要么专攻息肉(CVC-ColonDB、LDPolypVideo、PolypGen 等),要么是覆盖面广但各类混杂的多类别合集(HyperKvasir、GastroVision 等),很少有一个数据集同时把"食管侧病变/正常"和"结肠侧病变/正常"配成对齐的四类对照。

GastroEndoNet 就是冲着这个空缺来的。它把采集自一家医院的消化道内镜图像整理成四类:

  • GERD:食管侧的反流性病变图像;
  • GERD Normal:食管侧的正常对照;
  • Polyp:结直肠侧的息肉图像;
  • Polyp Normal:结直肠侧的正常对照。

这是一个精心设计的"病变 vs 该器官正常"配对框架:模型不仅要能区分"病变/正常",还要能在两个解剖部位之间不混淆。论文把它定位为支持 GERD 检测与息肉检测两个下游任务的数据基座。

0.1 为什么内镜分类数据集容易"看起来很大"

在理解 GastroEndoNet 的数字之前,必须先理解一个关键事实:内镜图像数量与独立临床信息量不是一回事。同一个病灶、同一段肠腔,稍微旋转一点、翻个面、调亮一点,就能生成好几张"新"图像。数据增强(data augmentation)在医学图像里被广泛使用,用来扩充训练集、提升模型对几何与光度变化的鲁棒性。

GastroEndoNet 把增强从"训练时在线生成"提前到了"离线预生成并入库",因此它的 24,036 这个总数需要拆开看:

  • 4,006 张是真正的原始(original / primary)图像;
  • 每张原始图用 6 种变换各生成 1 个副本,即 4,006 × 6 = 24,036;
  • 换句话说,五分之四(约 83%)的"数据"是原始图的同源派生副本。

这不是造假,而是明示的设计选择——论文明写这是"增强后的数据集"。但它决定了这个数据集的两个使用要诀:训练时它是有用的扩增池;评测时必须按原始文件去重,否则同源泄漏会严重虚高指标(详见坑 6)。

0.2 本条目要处理的三个"数字迷雾"

写这个条目,最需要谨慎的是三处数字口径:

  1. primary 数量:论文 Abstract 与 Mendeley v3 页写 4,006(总计 24,036);而 Mendeley v1(2024-10-07)页写 4,604(总计 27,624)。两者不是笔误,是版本差异(v2/v3 做了去重)。更有意思的是,第三方文献(Diagnostics 2025, 15, 2714)明确引用了 v1 的 URL,写 “original 4604 images”——说明 v1 口径在学术文献里已被独立引用,本条目必须双口径并存。
  2. 四类分布:v3 口径为 974 / 1,103 / 779 / 1,150;v1 口径为 1,076 / 1,168 / 1,188 / 1,172。引用时务必注明版本。
  3. 许可口径:数据集页写 CC BY-NC-ND 4.0,论文刊物侧元数据写 “cc by-nc”,OpenAIRE 写 “CC BY NC”。三者以数据集页为权威,但差异(尤其是 ND 后缀)对能否发布改动版影响很大。

§0 读法三则:

  1. 本条目是"数据集 + 数据描述论文(Data Article)"二合一:没有方法创新,价值全在数据的组织方式、覆盖范围与可获取性上。
  2. 全文硬数字以一手来源(Mendeley Data v3 页 + Data in Brief 论文)为准;与 v1 页、第三方引用的冲突已在 §9 逐条存照。
  3. 检索时若看到"24,036"和"27,624"并存,不要以为其中一个错了——它们是同一数据集的两个版本(坑 3)。

0.3 本条目在千方病案医数集里的定位

在千方病案医数集的库内,消化道内镜方向的条目已经不少:HyperKvasir(rid 693)是大而全的胃肠内镜多类合集,Kvasir 家族(kvasir-seg 112、kvasir-instrument 213、kvasir-capsule 123)覆盖分割、器械与胶囊内镜,GastroVision(rid 203)是胃肠内镜多类分类集,息肉系有 CVC-ColonDB(142)、BKAI-IGH-NeoPolyp(84)、LDPolypVideo(163)、PolypGen(183)、Real-Colon(778)等。但专门以"GERD"为核心标签的条目此前是空缺——GERD 通常只在 HyperKvasir、GastroVision 等大合集里以某个子类身份出现,缺少一个以它为独立建模目标的条目。

GastroEndoNet 落库,正好把这个空缺补上,并且把"食管侧 + 结肠侧"两个部位的对照关系放进同一个四类框架,为库内的"消化道内镜"谱系增加了一个跨部位双任务的分类基准。关于它与库内各条目的具体关系与互链理由,详见 §9。

§1 数据集速览:十问十答

Q1:GastroEndoNet 到底有多少张图像?

取决于版本。v3(最新,2025-02-27)为 24,036 张,其中原始图 4,006 张、增强副本 20,030 张。v1(2024-10-07 首发)为 27,624 张,原始图 4,604 张。论文 Abstract 与 Mendeley v3 页一致采用 4,006 / 24,036。第三方文献(Diagnostics 2025, 15, 2714)引用的是 v1 的 4,604 口径。

Q2:"4,006 × 6 = 24,036"这个 6 是什么?

是六种数据增强变换,每张原始图各生成 1 个副本:60° 旋转、90° 旋转、水平翻转、缩放(scaling)、亮度调整(brightness adjustment)、错切(shearing)。六种变换的都是几何或光度层面的,不改变图像的类别标签。

Q3:四类是哪四类,各多少张?

  • GERD(反流性病变食管):原始 974 张 → 增强后 5,844 张;
  • GERD Normal(正常食管):原始 1,103 张 → 增强后 6,618 张;
  • Polyp(结直肠息肉):原始 779 张 → 增强后 4,674 张;
  • Polyp Normal(正常结肠):原始 1,150 张 → 增强后 6,900 张。

四类原始图合计 974 + 1,103 + 779 + 1,150 = 4,006(✓ 自洽);增强后合计 5,844 + 6,618 + 4,674 + 6,900 = 24,036(✓ 自洽)。

Q4:图像是什么规格?

统一 512 × 512 像素的 JPG 单文件单图。原始图像的像素尺寸范围在 440–960 之间(长边/短边),发布前用 bicubic 重采样统一缩放到 512×512。无 DICOM 元数据,无患者面部或其他可识别信息。

Q5:数据是从哪来的、谁采的?

采集地是孟加拉国 Dhaka 市 Gulshan-2 区(Road-104, House-5, Dhaka-1212)的 Zainul Haque Sikder Women’s Medical College & Hospital (Pvt.) Ltd. 内窥镜室。数据归属与论文作者单位是 Daffodil International University(Dhaka,主)与 Premier University(Chattogram)。共 7 位作者。

Q6:用的什么内镜设备?

论文给出两款:Olympus EVIS EXERA III(其中含 GIF-190 胃镜)与 Pentax Medical EG29-i10(消化道内镜)。两代不同厂商的设备混合采集,这一点在评估跨设备泛化时值得注意。

Q7:任务是什么?标注到什么粒度?

四分类图像分类,标签是图像级单标签(每张图一个类别)。没有病灶边界框、没有像素级分割掩码、没有多标签、没有患者级随访标签。因此它只支持分类任务,不支持检测或分割研究。

Q8:怎么获取?要注册或申请吗?

不需要。 数据集托管在 Mendeley Data,DOI 为 10.17632/ffyn828yf4.3(v3),公开直下,无需注册、无需申请——这一点与许多"请求制(upon request)"的临床数据集形成鲜明对比,是本数据集的一大优势。页面提供两个 zip:Augmented_Resized Image.zip(1.51 GB)与 Original Image.zip(759 MB)。

Q9:许可是什么?能商用吗?

数据集页标注 CC BY-NC-ND 4.0——NC(非商业)+ ND(禁止演绎)双重限制。这意味着:企业不得用于商业用途;且不得发布基于它的改动版本,再分发须原样。论文刊物侧的 Europe PMC 元数据记为 “cc by-nc”(缺 ND),OpenAIRE 记为 “CC BY NC”,存在三口径冲突(坑 5),以数据集页为准。

Q10:有没有官方划分和 benchmark?

没有。 论文是 Data Article 型,未发布官方 train/val/test 划分文件,也没有 leaderboard。论文给出了一些基线分类实验(CNN 类模型四分类)以证明数据集可学,但那是"可行性验证"而非"权威基准"。使用者须自行设计划分协议——切记按原始文件去重(坑 6)。

十问十答小结:GastroEndoNet 是一个门槛低(公开直下)、覆盖跨界(食管 + 结肠)、组织清晰(四类对照)但规模有水分(增强占 5/6)、许可偏严(NC + ND)、无官方基准的内窥镜分类数据集。它的价值在于"起步友好"与"GERD 覆盖",它的陷阱在于"数字口径"与"同源泄漏"。

§2 数据集身份卡:一张表看懂 GastroEndoNet

字段 内容
官方全称 GastroEndoNet: An endoscopic image dataset for GERD and polyp detection
slug gastroendonet
本质 单源派生型(single-source derived)四分类内窥镜图像数据集
论文 Data in Brief, Vol. 60, 111572, 2025 Jun(DOI 10.1016/j.dib.2025.111572;PMID 40470347;PMC12136698)
数据托管 Mendeley Data(DOI 10.17632/ffyn828yf4.3,v3)
总量(v3) 24,036 张 512×512 JPG(原始 4,006 + 增强 20,030)
总量(v1) 27,624 张(原始 4,604)
类别 4 类:GERD / GERD Normal / Polyp / Polyp Normal
任务 图像分类(图像级单标签)
采集地 孟加拉 Dhaka Gulshan-2,Zainul Haque Sikder Women’s Medical College & Hospital
设备 Olympus EVIS EXERA III(GIF-190)+ Pentax Medical EG29-i10
分辨率 512×512(原始 440–960 经 bicubic 缩放)
格式 JPG
伦理批号 REC-FSIT-2024-08-24
许可 CC BY-NC-ND 4.0
获取 Mendeley Data 公开直下(免注册、免申请)
官方划分 无(须自定协议)

2.1 身份辨识三要点

要点一:它是"数据集论文"而不是"方法论文"。 Data in Brief 是 Elsevier 旗下的数据描述期刊,专门发表"数据集说明"类文章(Data Article)。这类文章的核心是描述数据如何采集、如何组织、如何使用,而非提出新模型或新算法。因此 GastroEndoNet 的论文里不会有 SOTA 对比表、不会有新网络结构,只有数据规格、伦理说明和少量"可学性验证"实验。拿它当"方法 baseline"引用是误用。

要点二:它是"单源派生"而不是"跨机构汇聚"。 很多知名医学数据集是跨医院、跨国家汇聚的(如 MIMIC 汇聚一家医院的多年记录、PANDA 汇聚 Radboud + Karolinska)。GastroEndoNet 不是——它来自一家医院的内窥镜室,所有图像同一来源、同一批设备、同一职业群体(孟加拉女性医疗中心患者)。这种"单源"特性决定了它的外部效度(external validity)有限,跨人群/跨设备泛化需另行验证。

要点三:它是"离线预增强"而不是"原始原始"。 24,036 这个数字里,约 83% 是 6 倍增强副本。使用者若不注意,容易把"图像张数"误当"独立样本数",进而在划分数据集或报告规模时出错(坑 3、坑 6)。

2.2 命名规范与检索陷阱

  • 规范名:GastroEndoNet(一个词,驼峰式,首字母 G、E、N 大写)。
  • 检索 slug:gastroendonet(全小写,库内 URL 用)。
  • 常见误写:Gastro-EndoNet、GastroEndonet、Gastro_Endo_Net、GERD-Polyp Dataset、GastroEndoscopyNet——这些都不是官方名,检索可能落空或命中无关项。
  • 与相邻概念混淆:
    1. GastroVision(库内 rid 203)——胃肠内镜多类数据集,名字像但是另一个数据集,绝非别名;
    2. HyperKvasir(rid 693)——Kvasir 系最大胃肠内镜合集,也含 GERD 子类,但来源与规模都不同;
    3. ENDONET / EndoNet——已有文献中的内镜深度估计或手术阶段识别网络名,与 GastroEndoNet 无任何关系,切勿混用。
  • 检索建议:用"GastroEndoNet" + “Mendeley” 或 “ffyn828yf4” 精确定位;用 DOI 10.17632/ffyn828yf4 最稳妥。

2.3 GastroEndoNet 的一句话定位

它是"食管侧 GERD + 结肠侧息肉"双任务合体的四分类内窥镜图像集,采自孟加拉一家医院,以原始 4,006 张图经 6 倍增强得 24,036 张,Mendeley Data 公开直下,供小团队做内镜分类模型的起步与打通实验。

2.4 与库内条目的定位差异

库内条目 主任务 覆盖部位 与 GastroEndoNet 的关系
HyperKvasir (693) 分类 + 分割 全消化道 更全但更杂;GastroEndoNet 更聚焦 GERD/息肉对照
GastroVision (203) 多类分类 上/下消化道 类更多;GastroEndoNet 类更少但有"病变 vs 正常"配对
Kvasir-SEG (112) 分割 结直肠 像素级掩码;GastroEndoNet 只有图像级标签
CVC-ColonDB (142) 检测/分割 结直肠 有边界框/掩码;GastroEndoNet 无
LDPolypVideo (163) 视频检测 结直肠 视频流;GastroEndoNet 是单帧图
PolypGen (183) 检测/分割 结直肠多中心 多中心;GastroEndoNet 单中心
Real-Colon (778) 检测 结直肠 真实场景视频;GastroEndoNet 是静态图

定位结论:GastroEndoNet 在库内是唯一以 GERD 为独立标签、且把食管侧与结肠侧配成对齐四类的分类数据集,与息肉系数据集互补而非替代。

§2.5 术语表(术语首现英文对照)

中文 英文 说明
胃食管反流病 GERD / gastroesophageal reflux disease 胃内容物反流至食管引起的疾病,可致食管黏膜炎症
反流性食管炎 reflux esophagitis / erosive esophagitis GERD 的食管黏膜炎症表现,内镜下可见黏膜破损
巴雷特食管 Barrett’s esophagus GERD 的并发症,食管下段鳞状上皮被柱状上皮取代
息肉 polyp 黏膜表面突出的赘生物,结直肠息肉是结直肠癌前期病变
结直肠癌 colorectal cancer 起源于结肠或直肠的恶性肿瘤
内窥镜 endoscopy 经自然腔道插入内镜观察消化道内部
胃镜 gastroscopy / upper GI endoscopy 经口进入检查食管、胃、十二指肠
结肠镜 colonoscopy 经肛门进入检查结肠与直肠
图像分类 image classification 给整张图像分配一个类别标签
数据增强 data augmentation 通过几何/光度变换扩充训练样本
旋转 rotation 图像绕中心旋转,本文用 60° 与 90°
水平翻转 horizontal flip 图像左右镜像
缩放 scaling / resizing 改变图像尺寸比例
亮度调整 brightness adjustment 改变整体明暗
错切 shearing 沿某一方向倾斜图像,产生剪切变形
双三次插值 bicubic interpolation 一种高质量图像重采样方法
四分类 four-class classification 类别数为 4 的分类任务
图像级标签 image-level label 标签作用于整张图,无位置信息
同一来源泄漏 same-source leakage 同源派生样本跨训练/测试集造成的信息泄漏
非商业 NC / non-commercial 许可条款,禁止商业使用
禁止演绎 ND / no derivatives 许可条款,禁止发布改动版本
伦理审查委员会 REC / Research Ethics Committee 机构内负责研究伦理审批的委员会
知情同意 informed consent 患者同意其数据被用于研究
去标识化 de-identification 移除可识别患者身份的信息

2.6 为什么"GERD"和"息肉"能放进同一个数据集

乍看之下,GERD(食管疾病)与息肉(结直肠疾病)分属消化道两端,放一起似乎牵强。但放在内镜 AI的语境里,这个组合有内在逻辑:

  1. 同一成像模态:两者都是用白光内镜(white-light endoscopy)在消化道腔内拍摄的彩色图像,视觉特征相似(黏膜、血管、腔壁),共享大量底层表征。
  2. 同一临床流程:一次消化道内镜检查可以同时上、下消化道(胃镜 + 结肠镜,或分次进行),四类标签对应内镜医生在报告里最常写的几种结论。
  3. 同一建模范式:都是"病变 vs 正常"的判别问题,可以共享网络骨架与训练策略,研究"多部位共享模型"的可行性。
  4. 互补的临床价值:GERD 关联食管腺癌风险,息肉关联结直肠癌风险——都是"内镜可及、早筛有效"的病变,AI 辅助筛查的收益面重叠。

当然,这种"跨部位合体"也有代价:模型可能学到"图像整体色调/构图"来判断部位(食管图与结肠图在色温、腔径上有系统差异),从而在"GERD vs GERD Normal"细分时反而有偏。这是使用四类框架时要留意的(详见 §7、坑 7)。

2.7 消化道内镜 AI 的背景

要理解 GastroEndoNet 的位置,需要一点消化道内镜 AI 的背景知识。

上消化道侧(食管-胃):AI 研究集中在食管癌/巴雷特食管筛查、幽门螺杆菌相关胃炎识别、早期胃癌检出等。GERD 及其并发症(反流性食管炎、巴雷特食管)是食管腺癌的前驱,内镜下可见黏膜破损、齿状线上移等特征,是分类模型的可学目标。但公开的"纯 GERD"分类数据集稀缺,GERD 多作为大合集里的一个子类出现。

下消化道侧(结直肠):这是内镜 AI 最成熟的战场,息肉检测/分类已是 FDA 获批产品的功能(如结肠镜 AI 辅助检测)。息肉按形态(Paris 分型)、按病理(腺瘤性/增生性)、按大小(≤5mm / 5-10mm / >10mm)多个维度分类,公开数据集众多(库内就有 5 个以上)。

GastroEndoNet 的差异:它不做检测(无框)、不做分割(无掩码),只做四类图像级分类,且刻意把食管侧与结肠侧配齐。它更像一个"多部位分类打通实验"的素材包,而非"专攻某一任务的高精度基准"。

2.8 数据集命名与编号规律

  • Mendeley Data 的 DOI 结构:10.17632/<8位字母数字>.3,末尾 .3 表示版本号 3。换成 .1、.2 即指向 v1、v2。引用时务必带版本号,否则会指向"最新版"(默认 v3),与文献里的 v1 口径不符(坑 4)。
  • Data in Brief 的卷期:Vol. 60, 111572,是 2025 年的 60 卷 111572 号文章。DOI 后缀 10.1016/j.dib.2025.111572 里的年份 2025 与在线发表日期一致。
  • 库内 slug 命名:全小写连写(gastroendonet),与官方名的大小写形式不同,但这是千方病案医数集的统一规范。

§3 机构与人物:谁做了 GastroEndoNet

3.1 七位作者

论文署名 7 位作者,机构高度集中于孟加拉两所大学:

  1. Abu Kowshir Bitto —— Daffodil International University;
  2. Md Hasan Imam Bijoy —— 通讯/团队核心之一,Daffodil International University;
  3. Kamrul Hassan Shakil —— Daffodil International University;
  4. Aka Das —— Daffodil International University;
  5. Khalid Been Badruzzaman Biplob —— Daffodil International University;
  6. Imran Mahmud —— Daffodil International University 信息科学与技术学院;
  7. Sayed Md. Minhaz Hossain —— Premier University(Chattogram)。

(注:作者的具体分工论文未逐一细列,以上角色标注以署名与机构页为准;数据采集由合作医院内镜室完成。)

3.2 机构地图

机构 角色 位置
Daffodil International University (DIU) 数据归属与论文主力单位;FSIT 学院 孟加拉 Dhaka
Premier University 合作单位(论文作者之一) 孟加拉 Chattogram
Zainul Haque Sikder Women’s Medical College & Hospital 数据采集地(内窥镜室) 孟加拉 Dhaka,Gulshan-2,Road-104 House-5

注意:数据采集发生在 Zainul Haque Sikder Women’s Medical College & Hospital,而数据归属与论文由 Daffodil International University 主导。引用时不要把采集医院当作数据归属机构。

3.3 一处必须澄清的来源地

这个数据集的所有图像都采自孟加拉国(Bangladesh),具体是 Dhaka 市的 Gulshan-2 区。它是南亚人群的内窥镜数据,不得与印度、中东或其他地区的内镜数据集混淆。人群特征是评估泛化性时的关键变量——一个在孟加拉女性医疗中心患者身上训练的模型,迁移到其他种族/性别分布的人群时性能可能变化(坑 8)。

3.4 时间线

时间 事件
2024-08-24 伦理批号 REC-FSIT-2024-08-24 获批(Daffodil International University)
2024-10-07 Mendeley Data v1 首发(27,624 张,primary 4,604)
2025-02-26 Mendeley Data v2(去重后条目)
2025-02-27 Mendeley Data v3(24,036 张,primary 4,006)
2025(Jun) 论文发表:Data in Brief, Vol. 60, 111572
2025-06-04(前后) PMID 40470347 / PMC12136698 索引完成
2025(15, 2714) 第三方 Diagnostics 论文引用 v1 口径(accessed 2025-02-03)

3.5 研究脉络与团队背景

GastroEndoNet 的作者团队(以 Daffodil International University 为核心)在内窥镜/胃肠影像方向有连续产出。从公开检索看,该组围绕消化道内镜做过多个数据集与分类工作:穿孔检测(perforation detection)、息肉分类、胃部疾病分类等。GastroEndoNet 可以看作他们把 GERD + 息肉两个任务"合体" 的产物——不是在方法上创新,而是在数据组织上做了一个"跨部位四类配对"的整合。

这带来一个用户视角的判断:这个团队的强项是"数据集工程"与"可获取性"(把数据整理清楚、公开发布、免注册直下),而不是"方法新颖性"。使用它时,把它当作素材与起点,而不是权威基准,是更稳妥的预期。

3.6 数据采集的临床背景

数据采自一家女性医疗中心(Women’s Medical College & Hospital),这提示患者群体以女性为主(论文未明确披露性别分布,仅从机构名称推断)。采集在内窥镜室常规检查中完成,图像去标识化后整理入库。伦理审批由 Daffodil International University 的伦理审查委员会(REC-FSIT)以批号 REC-FSIT-2024-08-24 批准。患者的知情同意按机构流程取得(论文表述为符合机构与伦理要求)。

使用提示:机构名含"Women’s"意味着样本可能以女性患者为主,若用于研究性别相关的消化道疾病差异,需注意样本选择的偏向性;反过来说,若研究本就不涉及性别,这一偏向影响有限,但"单性别中心"仍是一个外部效度限制(§10 存照)。

§4 数据构成的硬数字

4.1 规模与分布

v3 口径(最新,本文默认口径):

类别 原始图数 增强倍数 增强后总数
GERD 974 ×6 5,844
GERD Normal 1,103 ×6 6,618
Polyp 779 ×6 4,674
Polyp Normal 1,150 ×6 6,900
合计 4,006 ×6 24,036

自洽校验:974 + 1,103 + 779 + 1,150 = 4,006(✓);5,844 + 6,618 + 4,674 + 6,900 = 24,036(✓);4,006 × 6 = 24,036(✓)。

v1 口径(首发版,供存照):

类别 原始图数 增强后总数
GERD 1,076 6,456
GERD Normal 1,168 7,008
Polyp 1,188 7,128
Polyp Normal 1,172 7,032
合计 4,604 27,624

两套四类数字逐类都不同,说明 v2/v3 的"去重"是按类别做过的,不只是删掉重复文件。第三方文献 Diagnostics 2025, 15, 2714 引用 v1 的四类 1,076 / 1,168 / 1,188 / 1,172,与原 v1 页一致(坑 3、存照 A/B)。

4.2 采集条件

  • 采集地点:孟加拉 Dhaka 市 Gulshan-2 区(Road-104, House-5, Dhaka-1212)的 Zainul Haque Sikder Women’s Medical College & Hospital (Pvt.) Ltd. 内窥镜室。
  • 设备:Olympus EVIS EXERA III(含 GIF-190 胃镜)+ Pentax Medical EG29-i10。两代、两厂商设备混合。
  • 成像模态:白光内镜(white-light endoscopy)彩色图像。
  • 部位:上消化道(食管,GERD 相关)与下消化道(结直肠,息肉相关)。
  • 采集期:论文未逐图披露具体日期跨度;伦理批号日期为 2024-08-24,数据首发 2024-10-07,故采集应在 2024 年内完成(具体区间未公开)。

4.3 图像规格

  • 统一分辨率:512 × 512 像素。
  • 原始像素范围:440–960(长边/短边),经 bicubic(双三次插值) 重采样至 512×512。
  • 格式:JPG,单文件单图。
  • 元数据:无 DICOM 标签,无 EXIF 临床信息(已去标识)。
  • 色彩:彩色(RGB)。

关于 440–960 的说明:论文提到原始图像像素尺寸分布在 440–960 之间,但未说明这个范围是全量统计还是抽样统计(遗留疑点)。统一缩放到 512×512 后,原本小于 512 的图像被放大、大于 512 的被缩小,都可能引入重采样模糊或锯齿,这对细粒度病变识别(尤其小的平坦型息肉)可能有影响。

4.4 类别分布的显著边界情况

  • 最平衡的类:GERD Normal(1,103)与 Polyp Normal(1,150)是最大的两类,说明"正常对照"样本采集较充分。
  • 最少的类:Polyp(779)最少,比最多的 Polyp Normal(1,150)少约 32%。
  • 最不平衡比:Polyp : Polyp Normal ≈ 779 : 1,150 ≈ 1 : 1.48。相比动辄 1:10 以上的极端不平衡内镜数据集,这个比例算温和,但仍会带来"正常类主导"的风险(§7)。
  • 部位平衡:食管侧(GERD + GERD Normal = 974 + 1,103 = 2,077)与结肠侧(Polyp + Polyp Normal = 779 + 1,150 = 1,929)几乎对半,说明设计上刻意做了部位平衡。
  • 病变 vs 正常平衡:病变类(GERD + Polyp = 974 + 779 = 1,753)vs 正常类(GERD Normal + Polyp Normal = 1,103 + 1,150 = 2,253),比例约 1 : 1.29,正常类略占多数。

4.5 数字口径冲突(存照)

冲突一:primary 数。

  • 论文 Abstract、PMC12136698、Mendeley v3 页:4,006(总计 24,036);
  • Mendeley v1 页(2024-10-07)、Diagnostics 2025, 15, 2714:4,604(总计 27,624)。
  • 判定:版本差,非笔误。v3 比 v1 少 598 张 primary(去重的结果)。

冲突二:四类分布。

  • v3:974 / 1,103 / 779 / 1,150;
  • v1:1,076 / 1,168 / 1,188 / 1,172。
  • 判定:逐类不同,属版本差;引用第三方论文数字时须核对其引用的版本(URL 末尾 /1 表示 v1)。

冲突三:文件体积。

  • Mendeley v3 页:Augmented_Resized Image.zip 1.51 GB + Original Image.zip 759 MB ≈ 2.24 GB。
  • 判定:以 Mendeley v3 页为准;不同镜像或缓存若显示他值,须以官方页复核(存照 D)。

4.6 与其他公开消化道内镜数据集的规模对比

数据集 图像/样本量 任务 部位 标注粒度
GastroEndoNet 24,036(原始 4,006) 四分类 食管 + 结肠 图像级
HyperKvasir 10,662 分类 + 分割 全消化道 图像级 + 掩码
Kvasir-SEG 1,000 分割 结肠 像素级掩码
CVC-ColonDB 380 检测/分割 结肠 掩码 + 框
PolypGen 3,762 检测/分割 结肠多中心 掩码
LDPolypVideo 40,266 帧 视频检测 结肠 框
GastroVision 8,000+ 多类分类 上/下消化道 图像级

解读:GastroEndoNet 的 24,036 在"张数"上不算小,但若看独立原始图(4,006),它的规模落在中等区间——比 Kvasir-SEG(1,000)、CVC-ColonDB(380)大,但远小于 HyperKvasir(10,662)、LDPolypVideo(40,266 帧)。把 24,036 与 HyperKvasir 的 10,662 直接比"谁大"是不恰当的:前者含 6 倍增强副本,后者是独立图像。

4.7 数据文件的组织形式(据 Mendeley 页面)

Mendeley Data 页面提供两个压缩包:

  1. Augmented_Resized Image.zip(1.51 GB):包含增强并缩放后的图像,即全部或大部分 24,036 张(含原始图对应的缩放版本 + 6 种增强副本),按四类分目录组织。
  2. Original Image.zip(759 MB):包含原始图像(4,006 张),即未经增强的"干净"版本。

组织推断:两个包分开命名,暗示发布方也希望使用者能拿到"原始 vs 增强"的清晰区分——这对按原始文件去重划分(坑 6)是有利的。建议以 Original Image.zip 为划分依据、以 Augmented_Resized Image.zip 为训练扩增池。

4.8 数据质量与增强工艺的讨论

4.8.1 增强的六种变换

论文明确的六种增强:60° 旋转、90° 旋转、水平翻转、缩放、亮度调整、错切。按性质可分为两组:

  • 几何变换:60° 旋转、90° 旋转、水平翻转、缩放、错切——改变像素空间位置;
  • 光度变换:亮度调整——改变像素强度。

评价:这六种都是标准且相对温和的增强。使用它们的好处是提升模型对视角、尺度、明暗的鲁棒性;局限是它们不引入新的解剖结构或病理形态——旋转一张息肉图不会产生"另一种息肉"。因此增强副本不能替代真实数据多样性,尤其不能解决"单中心、单人群"的根本局限。

4.8.2 增强带来的"类别与部位耦合"风险

由于四个类别本身对应"食管/结肠 × 病变/正常",而食管图与结肠图在白光内镜下有系统的外观差异(腔径、色温、黏膜纹理),模型有可能走捷径:先用"这是食管还是结肠"的外观线索判断部位,再用"病变还是正常"的线索判断类别。这种"部位捷径"在四类框架下可能让"部位判定"异常容易,但对真正的"GERD vs GERD Normal"细分类未必有辅益。评测时应报告按部位的混淆矩阵,而不是只看四分类总体准确率(坑 7)。

4.8.3 与"金标准"概念的关系

GastroEndoNet 的标签是图像级单标签,来自内镜检查的临床结论(病变/正常)。它不是像素级病理金标准——没有病理活检对照、没有多专家共识标注记录。这意味着标签可能与病理真值存在偏差(如内镜下判为正常、活检却发现早期病变)。对于只做"分类模型打通实验"的用法,这个偏差可以接受;对于"评估诊断精度"的用法,须谨慎(§7.6)。

4.8.4 数据偏倚的维度

偏倚维度 具体情况
机构偏倚 单中心(Zainul Haque Sikder Women’s Medical College & Hospital)
地理偏倚 单国(孟加拉 Dhaka)
人群偏倚 女性医疗中心,可能以女性患者为主
设备偏倚 仅两款设备(Olympus + Pentax),无跨厂商多样性
时间偏倚 采集集中于 2024 年
任务偏倚 仅图像级分类,无检测/分割

4.8.5 图像格式与存储的考量

512×512 JPG 的存储效率高(原始包仅 759 MB / 4,006 张约 190 KB/张),便于快速下载与本地训练。代价是:JPG 是有损压缩,对高频细节(细小血管、微小平坦病变)有损失;且统一缩放到 512×512 会让原始分辨率较高的图(如 960)损失细节。若研究关注微小病变,建议向作者索取更高分辨率原图(但 ND 许可可能限制再分发)。

4.8.6 采集设备的混合含义

Olympus EVIS EXERA III(GIF-190)与 Pentax Medical EG29-i10 是两代不同厂商的设备。混合采集的好处是带来一定的设备多样性;坏处是"设备"与"部位/类别"可能耦合(例如若某设备主要拍胃镜、另一设备主要拍结肠镜),从而让模型学到"设备指纹"而非"病变特征"。论文未披露各设备在各类别下的采样分布(遗留疑点)。

4.9 数据规模在深度学习语境下的再评估

4.9.1 4,006 张原始图够不够?

对于"从头训练"(training from scratch)一个中等规模的 CNN,4,006 张(每类 779–1,150)是偏少的——现代内镜分类模型常在数万张独立图像上训练。这也是为什么数据集提供了 6 倍增强:扩充到 24,036 张能缓解过拟合,但增强副本的"信息增益"低于同等数量的独立图像。

4.9.2 患者级样本量的影响

论文未披露 4,006 张原始图来自多少例患者(遗留疑点)。若平均每例贡献多张(如同一患者多角度、多时间点),则"独立患者数"可能远小于 4,006,模型评估的统计效力受限,且"同一患者跨集"的泄漏风险上升。这是本数据集最需要补足的信息之一。

4.9.3 与后续大规模内镜数据集的对比

近年内镜 AI 数据集向"更大、更多中心"发展(如 PolypGen 的多中心设计、GastroVision 的多类覆盖)。GastroEndoNet 的定位不是"最大",而是"门槛最低 + GERD 覆盖"——它在可获取性(免注册直下)上优于许多同类,适合作为入门与快速验证的素材。

§5 任务与标注:一次覆盖四类分类

5.1 任务定义

GastroEndoNet 的核心任务是四分类图像分类(four-class image classification):

  • 输入:一张 512×512 内窥镜图像;
  • 输出:四个类别之一——GERD / GERD Normal / Polyp / Polyp Normal。

这个设计是"2 × 2 配对":两个解剖部位(食管、结肠)× 两个状态(病变、正常)。它天然支持三种评测视角:

  1. 四分类:直接分四类,考察模型能否同时区分部位与状态;
  2. 二分类(病变 vs 正常):合并为"异常(GERD ∪ Polyp)vs 正常(GERD Normal ∪ Polyp Normal)",考察病变判别能力;
  3. 部位内二分类:在食管内做"GERD vs GERD Normal",在结肠内做"Polyp vs Polyp Normal",考察细分类能力。

论文保留原始四类标签,因此三种视角都可从同一标签体系派生。

5.2 标注内容逐项拆解

标注项 有无 粒度 说明
类别标签 ✓ 图像级单标签 四类之一
增强类型标记 隐含 文件名/目录 6 种增强通过文件命名区分
病灶边界框 ✗ — 无
分割掩码 ✗ — 无
多标签 ✗ — 每图仅一标签
患者 ID ✗ — 未披露
病理对照 ✗ — 无活检金标准
临床元数据 ✗ — 无年龄/性别/病史

结论:标注是最小可用的分类监督。这既是它的简洁优点(易上手),也是它的能力边界(不能做定位或像素级任务)。

5.3 标注工具与流程

论文未详细披露标注工具与标注人员资质(如是否由内镜医生标注、是否有多人复核、Kappa 一致性如何)。从数据性质推断,类别标签应来自内镜检查的临床结论(内镜医生在检查中判断为 GERD/正常/息肉/正常),而非事后专门标注。关键缺口:无标注一致性报告(遗留疑点)。

5.4 四类标签的临床含义

类别 部位 状态 临床含义 相关风险
GERD 食管 病变 反流性食管炎/食管黏膜损伤 食管腺癌前驱
GERD Normal 食管 正常 无 GERD 表现的食管 —
Polyp 结直肠 病变 结直肠息肉 结直肠癌前驱
Polyp Normal 结直肠 正常 无息肉的结直肠 —

重要提示:这里的"Normal"是该部位的正常(食管正常 / 结肠正常),不是"同一个正常类"。四类框架的隐含假设是模型能区分"食管正常"与"结肠正常"——这在视觉上通常不难(部位外观差异大),但要注意别把"部位判别"当成"病变判别"的替身(§4.8.2、坑 7)。

5.5 从标注到建模:三类任务的数据流

路径一(四分类):

输入 512×512 JPG → CNN 骨干 → 4 类 softmax → 交叉熵损失

适用于"多部位分类打通"实验。注意类别不平衡与部位捷径。

路径二(二分类病变检测):

四类标签 → 合并{病变: GERD+Polyp, 正常: GERD Normal+Polyp Normal} → 二分类

适用于"AI 能否识别消化道异常"的一般问题。

路径三(部位内细分类):

先按部位分组 → 食管组做 GERD/GERD Normal 二分类;结肠组做 Polyp/Polyp Normal 二分类

最贴近临床(“已知在做胃镜,判断有无 GERD”),但需要模型或流程先确定部位。

5.6 评测协议的必备要素

由于无官方划分,使用者须自行设计协议,最低要求:

  1. 按原始文件去重:先以 Original Image.zip 的 4,006 张为"独立单元",把每张原始图连同其 6 个增强副本整组分到 train 或 test——绝不能把同一原始图的增强副本分到不同集合(坑 6)。
  2. 类别分层:保持四类在 train/val/test 的比例一致(或明确报告不平衡处理策略)。
  3. 部位分层报告:单独报告食管侧与结肠侧的指标。
  4. 多次随机种子:报告均值±标准差,避免单次划分的偶然性。

5.7 标注质量与标签体系的可信度

可信之处:标签类别清晰(四类),来源是临床结论,非众包随意标注。

存疑之处:

  • 无专家数量与一致性(Kappa)报告;
  • 无病理对照,无法验证"内镜判正常"是否为病理正常;
  • 无标注工具与流程细节;
  • 无患者级标签(无法评估同一患者的标签一致性)。

实践建议:把标签当作"内镜医生当时判断"的代理,而非"病理金标准"。做临床决策相关研究时,须在论文里明确这一局限(§10 存照、坑 8)。

5.8 标注成本与数据集工程的启示

5.8.1 标注工作量

GastroEndoNet 只需要图像级类别标签,因此标注成本低(一次检查的结论即可标注多张图)。这正是它能把 4,006 张原始图整理打包的原因——相比像素级掩码(一张图数十分钟),图像级标签几乎是"顺手记录"。代价是信息量低。

5.8.2 与"标注流水线式"数据集的对比

像 PANDA-PLUS(库内 panda-plus)那样做像素级注释的数据集,需要"学生初注 + 高年级复核 + 专家终审"的多层流水线,成本高但有细粒度价值。GastroEndoNet 走的是相反的路线:低成本、粗粒度、快速发布。两者没有优劣,只有适用场景不同——要像素级分析就别选 GastroEndoNet,要快速起步就用它。

5.8.3 数据集工程的三条经验

  1. 明确"原始 vs 增强"的计数:GastroEndoNet 明示了这点(分两个 zip),是好的实践;使用者要善用。
  2. 披露版本差异:v1→v2→v3 的变化应被引用者知悉,本文以双口径存照承接。
  3. 披露患者级信息:GastroEndoNet 在此有缺口(未披露患者数),这是后续数据集可改进之处。

§6 获取与许可:版本链与三口径冲突

6.1 获取渠道

GastroEndoNet 的获取门槛极低——这是它的核心优势之一。

渠道 地址 是否需要注册/申请 内容
Mendeley Data(主) DOI 10.17632/ffyn828yf4.3 否(公开直下) 两个 zip 包(增强 + 原始)
论文 DOI 10.1016/j.dib.2025.111572(PMC12136698) 否(开放获取) 数据描述与规格说明
机构页 Daffodil International University 相关实验室页 否 项目介绍与旁证
第三方索引 ArxivLens、DOAJ(Kabale 大学图书馆记录) 否 元数据索引

实操:直接访问 Mendeley Data 页面,点击下载 Augmented_Resized Image.zip(1.51 GB)与 Original Image.zip(759 MB)。无需注册、无需邮件申请、无需签署 DUA(数据使用协议)。这在临床数据集中属于最开放的一档——与 MIMIC-IV(需 CITI 培训 + 认证)、TCIA 部分集合(需申请)形成鲜明对比。

6.2 许可:一处必须存照的三口径冲突

来源 许可表述 是否含 ND
Mendeley Data 数据集页(权威) CC BY-NC-ND 4.0 含
论文刊物侧(Europe PMC 元数据) cc by-nc 不含
OpenAIRE 索引 CC BY NC 不含

判定原则:数据集许可以数据集托管页(Mendeley Data)为准,即 CC BY-NC-ND 4.0。理由:论文刊物元数据描述的是论文文本的许可,不是数据集本体的许可;数据集本体的许可由实际托管方声明。

CC BY-NC-ND 4.0 的含义:

  • BY(署名):使用须注明出处;
  • NC(非商业):不得用于商业目的;
  • ND(禁止演绎):不得发布基于本数据集的改动版/衍生版,再分发须原样。

ND 的实务影响(重要):

  • 你可以用它训练模型、发表研究结果(这是"使用",不是"发布演绎版");
  • 你不可以把"重新划分/重新标注/子集化"的数据集版本公开发布;
  • 你不可以把原图裁剪、拼接、再加工后作为新数据集分发;
  • 若需发布衍生数据集,须联系版权方另行取得授权(作者论文可能提供许可豁免,需以官方答复为准)。

合规三步核实法:(1)以 Mendeley 页当前标注为准(许可可能更新);(2)查阅论文的 rights 声明;(3)如涉商用或衍生发布,邮件联系通讯作者确认。切勿仅凭第三方索引的 “CC BY NC” 就当作可商用或无 ND 限制。

6.3 版本链与衍生谱系

v1(2024-10-07)  27,624 张 / primary 4,604
      │  去重
v2(2025-02-26)  条目收缩(具体数字未在页面完整披露)
      │  去重/整理
v3(2025-02-27)  24,036 张 / primary 4,006   ← 论文与 Entry 采用

引用规范:引用时必须带版本号。DOI 10.17632/ffyn828yf4 不带后缀默认指向最新版(v3);若引用文献里的 v1 数字(4,604),应写 10.17632/ffyn828yf4.1。DataCite DOI 支持版本后缀,这是核验口径的关键(坑 4)。

6.4 其他访问方式

  • 镜像:经 hf-mirror.com 检索与 WebSearch 双查,未发现 GastroEndoNet 的 HuggingFace 官方或社区镜像(遗留疑点 1)。因此目前唯一权威入口是 Mendeley Data。
  • 论文附录:Data in Brief 论文可能附数据字典与文件清单,可作为组织方式的参照。
  • 免注册直下带来的"无使用追踪":与需要注册的数据集不同,GastroEndoNet 无法统计下载量/使用量,因此"引用度"只能靠文献引用间接估计。

6.5 训练/测试划分

无官方划分。论文未提供 train/val/test 文件,也无划分脚本。因此所有划分都是使用者自定。最重要的划分原则见 §5.6 与坑 6:按原始文件去重划分。

6.6 获取决策树

需要消化道内镜图像做分类?
├─ 要像素级掩码/边界框? → 否,本数据集无 → 改用 Kvasir-SEG / CVC-ColonDB / PolypGen
├─ 要 GERD 标签? → 是,本数据集有 GERD 类 → 继续
│    └─ 要"病变 vs 正常"配对设计? → 是 → 本数据集适用
├─ 要做商用产品或发布衍生数据集? → 谨慎:NC + ND 双重限制,须另行授权(坑 5)
├─ 关心跨中心泛化? → 本数据集单中心,须额外验证(坑 8)
└─ 只想快速起步/打通实验 → 本数据集最合适(免注册直下)

6.7 许可问题对研究可复现性的影响

ND 条款带来一个微妙的可复现性张力:你可以复现别人的实验结果,但不能"冻结并重新发布"你用的数据快照。这意味着:

  • 论文里若说"使用 GastroEndoNet v3",读者须自行去 Mendeley 下载 v3——但若未来 Mendeley 只保留最新版,v3 可能不易获取;
  • 版本间的数字差异(4,006 vs 4,604)会直接影响实验规模,必须写明版本,否则复现者可能下错版本。

实践建议:论文方法部分明确写"GastroEndoNet v3(DOI 10.17632/ffyn828yf4.3),原始图 4,006 张",并记录下载日期,便于他人核对。

6.8 与库内可获取性光谱的对照

获取难度 代表条目 机制
最开放(免注册直下) GastroEndoNet、CVC-ColonDB、Kvasir-SEG 公开链接
需平台账号 HyperKvasir、GastroVision 平台注册
需申请/DUA PolypGen、部分 TCIA 集合 申请审批
需培训认证 MIMIC-IV 系 CITI + 认证

GastroEndoNet 处于"最开放"一档,这在内镜数据集里是不小的加分项——许多息肉数据集需要向作者申请或经平台审核。

§7 评估与基准:原论文的可学性验证

7.1 论文的定位:可行性验证而非权威基准

Data Article 的惯例是给出少量分类实验证明"数据集可学",而非建立 leaderboard。GastroEndoNet 论文即按此惯例,用 CNN 类模型做四分类实验,报告 accuracy / precision / recall / F1 等常规指标,用以说明"这些数据能训练出有判别力的模型"。这些数字是"可行性证据",不是"必须超越的 benchmark"。

重要提醒:由于论文未公开固定的划分脚本与随机种子,论文报告的数值无法被严格复现(划分不同则数值不同)。因此不要把论文数值当作"官方分数线"来对标——这是 Data Article 型数据集的通病(坑 7)。

7.2 常规评测指标

四分类任务的标准指标:

指标 定义 关注点
Accuracy 全类正确率 整体表现,但受类别不平衡影响
Precision(per-class) 预测为该类的样本中真正是该类的比例 假阳性代价
Recall(per-class) 该类样本中被正确识别的比例 假阴性代价(医学上常更重要)
F1(per-class / macro) Precision 与 Recall 的调和平均 平衡两类错误
Confusion Matrix 4×4 混淆矩阵 看错分模式(部位混淆?病变混淆?)
AUC(per-class, one-vs-rest) ROC 曲线下面积 阈值无关的判别力

医学场景建议:优先报告 per-class recall。因为"漏诊一个息肉/GERD"的代价高于"误报一个正常",总体 accuracy 会被占比最大的正常类主导而掩盖漏诊问题。

7.3 预期的性能结构与陷阱

结构预期:

  • 四分类中"部位判别"(食管 vs 结肠)通常较易,因为外观差异大;
  • 真正的难点在部位内细分类(GERD vs GERD Normal;Polyp vs Polyp Normal),这些类间差异更细微;
  • 因此四分类总体 accuracy 可能"虚高"——高 accuracy 可能主要来自部位判别,而非病变判别。

陷阱:若只看四分类 accuracy,可能得出"模型很好"的错觉。必须分解:分别报告食管侧、结肠侧的混淆矩阵与 F1。

7.4 同源泄漏:最致命的评测陷阱

问题:如果按"图像"随机划分 train/test,那么同一张原始图的一个增强副本可能在 train、另一个在 test。由于两者是同源变换(只是旋转/翻转/调亮),test 样本的"近亲"就在 train 里——模型记住了近亲,就能在 test 上拿高分。这不是真实泛化能力,而是记忆泄漏(memorization leakage)。

后果:报告的指标会显著虚高,且越依赖增强的数据集虚高越严重。GastroEndoNet 的 24,036 中有 20,030 是增强副本,泄漏风险极高。

正确做法:

1. 以 Original Image.zip 的 4,006 张为"独立单元";
2. 为每张原始图建立 "原始图 → 其 6 个增强副本" 的映射(按文件名);
3. 整组(原始 + 6 增强)分到 train 或 test;
4. 绝不拆散同一组。

这是使用本数据集的第一要务(坑 6)。

7.5 类别不平衡的处理

Polyp(779)与 Polyp Normal(1,150)之比约 1:1.48。处理选项:

  1. 类别加权损失:给少数类更高权重;
  2. 重采样:过采样少数类 / 欠采样多数类(但注意别引入新的泄漏);
  3. 分层划分:保证各集类别比例一致;
  4. 报告 macro-F1:不被多数类主导。

不推荐:为提高少数类样本而"再生成增强副本"——因为原数据集已有 6 倍增强,再加增强会加剧同源比例,且不增加独立信息。

7.6 标签噪声与病理金标准缺失

由于标签来自内镜结论而非病理活检,存在标签噪声:内镜下"判为正常"的食管/结肠可能实际有显微镜下病变。这会给四分类设定一个性能天花板——即使模型完美,也只能逼近"内镜医生当时的判断",而非"病理真值"。

应对:在论文中明确定位——本数据集研究的是"内镜结论级"分类,而非"病理级"诊断。若要病理级,需数据集提供活检对照(本数据集无)。

7.7 建议的基准使用协议

若要在论文里把 GastroEndoNet 当基准用,建议的协议:

  1. 声明版本与规模:如 “GastroEndoNet v3, 4,006 original images”;
  2. 按原始文件去重划分(§7.4);
  3. 固定划分并公开划分文件(但不发布数据快照,遵守 ND);
  4. 报告四分类 + 部位内二分类两套指标;
  5. 报告 macro-F1 与 per-class recall;
  6. 多次种子取均值±标准差;
  7. 明确标签粒度局限(§7.6)。

7.8 后续研究在 GastroEndoNet 上的使用

第三方文献已在两代口径上引用 GastroEndoNet:

  • Diagnostics 2025, 15, 2714(MDPI):引用 v1 口径(accessed 2025-02-03),写 “original 4604 images”,四类 1,076 / 1,168 / 1,188 / 1,172。用于息肉/GERD 分类与增强策略比较。
  • 该引用坐实了 v1 口径在学术文献中的独立存在,是本文双口径存照的直接证据(存照 A/B)。

对使用者的启示:看到别人论文里写 4,604 别以为错了——那可能是引用了 v1。横向比较时先统一版本。

§8 坑点清单(Pitfalls):使用 GastroEndoNet 前必须知道的八件事

坑 1:GastroEndoNet 与 GastroVision 极易混淆,但绝不是别名

现象:两者名字都有 “Gastro”,都是消化道内镜分类数据集,检索时容易串。

真相:

  • GastroEndoNet(本条目):孟加拉单中心,4,006 原始图 / 24,036 总量,四类(GERD / GERD Normal / Polyp / Polyp Normal),Mendeley Data 托管;
  • GastroVision(库内 rid 203):另一数据集,类更多、来源不同。

规避:用 DOI(10.17632/ffyn828yf4)或精确名 “GastroEndoNet” 检索,勿用 “Gastro” 泛搜。

坑 2:把 24,036 当作"独立样本数"

现象:报告"我们用了 24,036 张内窥镜图像"。

真相:24,036 中只有 4,006 张是独立原始图,其余 20,030 张是 6 倍同源增强副本。

规避:报告规模时写"4,006 原始图(24,036 含 6 倍增强)",并说明增强倍数。

坑 3:类别分布有多套数字,必须核对版本

现象:看到 974/1,103/779/1,150 与 1,076/1,168/1,188/1,172 两套数字,不知哪个对。

真相:前者是 v3,后者是 v1。都"对",只是版本不同。

规避:引用时写明版本号与 DOI 后缀(.3 vs .1);本文 §4.1、§4.5 已双口径并存。

坑 4:Mendeley DOI 不带版本号会指向最新版

现象:文献里引用 10.17632/ffyn828yf4(无后缀),但期望的是 v1 数字。

真相:DataCite DOI 无后缀默认解析到最新版(v3)。要引用 v1 须用 .1。

规避:必须带版本后缀;核对文献数字时先确认其 URL 末尾版本。

坑 5:许可三口径冲突,ND 条款是隐藏的硬约束

现象:数据集页写 CC BY-NC-ND 4.0,某些索引写 CC BY NC,误以为可以发布衍生版。

真相:以数据集页为准 = NC + ND 双重限制。ND 意味着不得发布改动版/衍生版数据集。

规避:商用与衍生发布前必须核实并取得授权;训练模型与发表结果不受影响。

坑 6:不做原始文件去重划分 → 同源泄漏 → 指标虚高

现象:随机按图像划分 train/test,得到很高的准确率,但换真实场景就崩。

真相:同一原始图的增强副本被分到 train 与 test,模型靠"记忆近亲"得分。本数据集增强占 5/6,泄漏风险极大。

规避:按原始文件整组划分(原始 + 其 6 个增强副本同进同出)。这是使用本数据集最重要的操作(§7.4)。

坑 7:四分类高准确率可能主要来自"部位判别"而非"病变判别"

现象:四分类 accuracy 很高,便宣称"模型能识别 GERD 和息肉"。

真相:食管图与结肠图外观差异大,“区分部位"很容易;真正的难点是部位内的"病变 vs 正常”。

规避:分解报告——食管侧(GERD vs GERD Normal)与结肠侧(Polyp vs Polyp Normal)的分类指标单独给出;看混淆矩阵是否主要错在部位内。

坑 8:单中心单人群 + 零病理对照 → 泛化与真值双重局限

现象:在 GastroEndoNet 上训练得很好的模型,直接推广到其他医院数据。

真相:(1)数据来自孟加拉一家女性医疗中心,单中心、单人群、单国;(2)标签是内镜结论,无病理对照。

规避:跨中心/跨人群评估须另行验证;论文里明确"内镜结论级、非病理级"的定位。

坑 9(补充):错切(shearing)对解剖结构的扭曲

现象:把增强图当"真实图像"用,忽略了 shearing 会改变解剖比例。

真相:错切是几何变换,会扭曲内镜腔的真实形状。旋转、翻转保持形状,但缩放、错切改变几何比例。

规避:做需要准确形状/比例的任务(如病灶尺寸估计)时,优先用原始图,谨慎使用 shearing 增强副本。

坑 10(补充):把"免注册直下"当作"无任何限制"

现象:以为公开直下 = 公有领域,随意使用与再分发。

真相:免注册只是获取门槛低,与使用许可是两回事。CC BY-NC-ND 才是使用规则(坑 5)。

规避:区分"可获取"与"可商用/可演绎",勿混为一谈。

§8.9 坑点的组织逻辑

上述十个坑可分为三类:

  • 计数类(坑 2、3、4):关于"数字怎么算"——规模、分布、版本;
  • 评测类(坑 6、7):关于"怎么评"——泄漏、指标分解;
  • 合规与定性类(坑 1、5、8、9、10):关于"怎么定性"——身份、许可、泛化、增强性质、获取与许可之别。

§8.10 一份可直接使用的检查清单

使用 GastroEndoNet 前,逐条打勾:

  • [ ] 我引用的版本是 v3(4,006/24,036)还是 v1(4,604/27,624)?
  • [ ] 我报告的规模是否区分了"原始"与"增强"?
  • [ ] 我的 train/test 是否按原始文件去重划分?
  • [ ] 我是否报告了部位内二分类指标,而非只看四分类 accuracy?
  • [ ] 我是否核查了当前许可(CC BY-NC-ND 4.0)并遵守 NC + ND?
  • [ ] 我是否说明了单中心/单人群的泛化局限?
  • [ ] 我是否说明了标签为"内镜结论级"而非"病理级"?
  • [ ] 我是否避免了把错切/缩放的增强图用于形状敏感任务?

§9 存照与待核

9.1 双口径/多口径冲突逐条存照

存照 A:primary 数量(v3 vs v1)

口径 来源 primary 总张数
v3(最新) 论文 Abstract、PMC12136698、Mendeley v3 页 4,006 24,036
v1(首发) Mendeley v1 页、Diagnostics 2025, 15, 2714 4,604 27,624

判定:版本差,非笔误。v2/v3 做了去重。处理:正文正交双写并标版本。

存照 B:四类分布(v3 vs v1)

口径 GERD GERD Normal Polyp Polyp Normal 合计
v3 974 1,103 779 1,150 4,006
v1 1,076 1,168 1,188 1,172 4,604

判定:逐类不同,属版本差。第三方文献引用 v1,勿视为错误。处理:§4.1 双表并列。

存照 C:license 三口径

来源 表述 含 ND
Mendeley Data 数据集页(权威) CC BY-NC-ND 4.0 是
Europe PMC(论文刊物侧) cc by-nc 否
OpenAIRE CC BY NC 否

判定:以数据集页为准。处理:§6.2 三口径并存 + 合规三步核实法。

存照 D:采集体积口径

来源 表述
Mendeley v3 页 增强包 1.51 GB + 原始包 759 MB ≈ 2.24 GB

判定:以 Mendeley v3 页为准;他处若显示不同值须复核。处理:§4.5 记录。

9.2 遗留疑点(查不到 / 待核)

  1. HuggingFace 镜像未最终确认:经 hf-mirror.com 检索与 WebSearch 双查,未发现 GastroEndoNet 的 HF 官方或社区镜像。hf-mirror.com 对非中国大陆 IP 会跳转原站,沙箱侧无法完整复核。结论:目前以 Mendeley Data 为唯一权威入口。
  2. v1→v2→v3 的"去重"规则未披露:论文只说明做了去重(规模从 4,604 收缩到 4,006),但未说明重复图判定算法/阈值(是感知哈希?像素级重复?近重复?)。无法评估去重是否可能误删有效样本。
  3. 患者级人数未披露:4,006 张原始图出自多少例患者、每例多少张,论文未给出。影响:无法评估患者级数据独立性,也无法评估"同一患者跨集泄漏"的风险。
  4. 原始像素范围 440–960 的取样口径未说明:是全量统计还是抽样统计,论文未明。
  5. 官方代码仓库未找到:未见明确的 GitHub 主仓(可能仅在论文附录或未公开)。划分脚本与基线代码的可得性存疑。
  6. 标注工具与标注人员资质未披露:无标注一致性(Kappa)报告,无法评估标签可靠性。
  7. 各设备在各类别下的采样分布未披露:Olympus 与 Pentax 两设备各拍了多少各类图像,未知,影响"设备-类别耦合"评估。

9.3 核验证据链(三源互证)

来源类型 具体来源 核验内容
数据托管页(一手) Mendeley Data 10.17632/ffyn828yf4.3 规模 24,036 / primary 4,006、四类分布、体积、许可 CC BY-NC-ND 4.0
论文(一手) Data in Brief, Vol. 60, 111572(DOI 10.1016/j.dib.2025.111572) Abstract、规格、设备、伦理批号、增强方法
索引(二手核验) PMC12136698 / PMID 40470347 论文元数据、摘要一致性
第三方文献 Diagnostics 2025, 15, 2714(MDPI) 坐实 v1 口径(4,604)被独立引用
机构页/索引 DIU 实验室页、ArxivLens、Kabale 大学 DOAJ 记录 存在性旁证

9.4 生态互链点(库内条目 + rid)

同域(内窥镜/胃肠)强互链:

库内条目 rid 互链理由
gastrovision 203 胃肠内镜多类分类,同属"消化道内镜分类";含 GERD 亚类
hyperkvasir 693 Kvasir 系最大胃肠内镜合集,含分类 + 分割,GERD/息肉均覆盖
kvasir-seg 112 Kvasir 家族分割(息肉像素级掩码),与本条目的粗粒度分类互补
kvasir-instrument 213 Kvasir 家族器械检测
kvasir-capsule 123 Kvasir 家族胶囊内镜
cvc-colondb 142 息肉检测/分割,同任务不同粒度
bkai-igh-neopolyp 84 息肉分割
ldpolypvideo 163 息肉视频检测
polypgen 183 息肉检测/分割(多中心)
real-colon 778 真实结肠检测
endoscapes 353 腹腔镜手术场景(跨科对照)
slam-3d-endoscopic 82 内镜 SLAM/三维重建方向

互链理由分类:

  1. 同器官-同任务(息肉分类/检测):cvc-colondb、bkai-igh-neopolyp、ldpolypvideo、polypgen、real-colon;
  2. 同器官-不同任务(分割/器械/胶囊/SLAM):kvasir-seg、kvasir-instrument、kvasir-capsule、slam-3d-endoscopic、endoscapes;
  3. 同域-多类合集:gastrovision、hyperkvasir。

库内定位提示:GastroEndoNet 是本库首个以 GERD 为独立标签的条目,填补了 GERD 方向空缺(此前 GERD 仅作为 hyperkvasir、gastrovision 的子类出现)。落库后建议在上述条目的"相关数据集"段落补双向链接。

9.5 库内条目的生态对照

维度 GastroEndoNet HyperKvasir Kvasir-SEG PolypGen
任务 四分类 分类 + 分割 分割 检测/分割
标注粒度 图像级 图像级 + 掩码 像素级 像素级
覆盖部位 食管 + 结肠 全消化道 结肠 结肠
GERD 标签 有(独立类) 有(子类) 无 无
获取门槛 免注册 平台注册 免注册 申请
规模(独立图) 4,006 10,662 1,000 3,762
中心数 单中心 单中心 单中心 多中心

§10 生态、影响与扩展阅读

10.1 学术影响

GastroEndoNet 于 2025 年中发表,属于新近发布的数据集,学术影响仍在积累中。从公开检索看,它已被内镜 AI 相关论文(如 Diagnostics 2025, 15, 2714)引用作为分类/增强策略研究的素材。作为 Data in Brief 的 Data Article,它的"影响力"更多体现在被用作方法验证的数据来源,而非成为领域标准基准。

10.2 在消化道内镜数据集谱系中的位置

消化道内镜数据集可按两个轴划分:

  • 任务轴:分类 / 检测 / 分割;
  • 覆盖轴:单部位 / 多部位 / 全消化道。

GastroEndoNet 落在"分类 + 多部位(食管 + 结肠)"的象限,且以 GERD 为差异化标签。它的邻居是 HyperKvasir(分类 + 分割 + 全消化道)与 GastroVision(多类分类 + 全消化道),但它的"病变 vs 正常配对"设计是自己独有的。

10.3 与其他内镜任务的交叉

  • 与息肉检测:GastroEndoNet 提供息肉分类(有/无),可作为检测模型的分类头训练素材或预训练来源;
  • 与 GERD 分级:本数据集只有二元(GERD / 正常),不含反流性食管炎的洛杉矶分级(LA grade A-D),无法直接做分级研究;
  • 与多任务学习:四类的"部位 × 状态"结构天然适合多任务学习(部位分类 + 病变分类)的验证。

10.4 临床落地价值与局限

价值:

  • 免注册直下,降低内镜 AI 研究的启动门槛;
  • GERD 与息肉双覆盖,适合做"消化道异常筛查"的通用分类尝试;
  • 四类配对设计清晰,便于教学与快速实验。

局限:

  • 单中心、单人群,泛化性未验证;
  • 图像级标签无定位信息,无法直接用于"病灶定位"类临床辅助;
  • 无病理对照,标签精度上限为"内镜结论级";
  • 增强占 5/6,独立信息量有限。

结论:GastroEndoNet 适合做教学、打通实验、增强策略研究、预训练素材;不适合做临床诊断精度的最终评测或跨中心泛化的权威验证。

10.5 扩展阅读路径

  1. 原始来源:Mendeley Data 10.17632/ffyn828yf4.3;论文 DOI 10.1016/j.dib.2025.111572(PMC12136698)。
  2. 同域对照:本库 hyperkvasir(693)、gastrovision(203)、kvasir-seg(112)。
  3. 息肉任务:本库 polypgen(183)、cvc-colondb(142)、ldpolypvideo(163)。
  4. 方法论:关于数据增强与同源泄漏的讨论,见本条目 §7.4、坑 6。

10.6 一句话总结

GastroEndoNet 是一个"入门友好、覆盖跨界、组织清晰,但规模有水分、单源且许可偏严"的消化道内镜四分类数据集——用它起步很好,用它下结论需谨慎。

10.7 DAIMS 评估表

DAIMS(Data and AI Maturity/Interoperability/Metadata Score,本库用的数据集就绪度评估框架)逐项评估:

# 维度 评分 说明
1 数据可获取性 ★★★★★ 免注册直下,Mendeley Data 公开
2 许可清晰度 ★★★☆☆ 数据集页明确 CC BY-NC-ND 4.0,但三口径冲突需存照
3 元数据完整性 ★★★☆☆ 有论文规格说明,但缺患者级信息、缺划分文件
4 数据规模 ★★★☆☆ 24,036 张看似大,独立原始图仅 4,006
5 标注粒度 ★★☆☆☆ 仅图像级单标签,无框/掩码
6 标注质量证据 ★★☆☆☆ 无一致性报告、无病理对照
7 类别平衡性 ★★★★☆ 最不平衡比 1:1.48,较温和
8 任务多样性 ★★☆☆☆ 仅分类
9 泛化性证据 ★★☆☆☆ 单中心单人群,无跨中心验证
10 版本管理 ★★★★☆ Mendeley 有 v1/v2/v3 版本链与 DOI 后缀
11 伦理合规 ★★★★☆ 有伦理批号 REC-FSIT-2024-08-24,去标识
12 可复现性 ★★★☆☆ 数据可得,但无官方划分脚本,划分不可完全复现
13 文档说明 ★★★★☆ 论文规格说明较完整
14 社区使用度 ★★☆☆☆ 新近发布,影响在积累中
15 影像质量 ★★★☆☆ 512×512 JPG,有损压缩,原分辨率 440–960
16 多模态性 ★☆☆☆☆ 纯图像,无文本/临床元数据
17 患者级可追溯 ★☆☆☆☆ 未披露患者 ID 与人数
18 部位覆盖 ★★★★☆ 食管 + 结肠双部位
19 疾病覆盖 ★★★☆☆ GERD + 息肉,不含其他消化道疾病
20 标准化程度 ★★★☆☆ 统一 512×512,但无 DICOM/统一命名规范说明
21 更新维护 ★★★☆☆ 有版本迭代历史,后续维护未知
22 引用规范 ★★★★☆ DOI + 版本后缀支持明确引用
23 硬件门槛 ★★★★★ 2.24 GB,普通设备可处理
24 使用友好度 ★★★★★ 分类任务最简单,上手快

综合评级:适合入门与快速验证(可获取性、使用友好度均满分),但在标注粒度、泛化性证据、患者级信息上明显偏弱,属于"够用但不够精"的中等就绪度数据集。

10.8 附录:GastroEndoNet 关键事实速查表

事实 数值/内容
官方全称 GastroEndoNet: An endoscopic image dataset for GERD and polyp detection
slug gastroendonet
论文 Data in Brief, Vol. 60, 111572, 2025 Jun
论文 DOI 10.1016/j.dib.2025.111572
PMID / PMC 40470347 / PMC12136698
Mendeley DOI 10.17632/ffyn828yf4.3(v3)
总量(v3) 24,036
原始图(v3) 4,006
总量(v1) 27,624
原始图(v1) 4,604
四类(v3) 974 / 1,103 / 779 / 1,150
增强方式 60° 旋转、90° 旋转、水平翻转、缩放、亮度调整、错切
分辨率 512×512
原始像素 440–960(bicubic 缩放)
格式 JPG
设备 Olympus EVIS EXERA III(GIF-190)+ Pentax Medical EG29-i10
采集地 Zainul Haque Sikder Women’s Medical College & Hospital, Gulshan-2, Dhaka-1212, Bangladesh
归属机构 Daffodil International University + Premier University
作者数 7
伦理批号 REC-FSIT-2024-08-24
许可 CC BY-NC-ND 4.0
体积 1.51 GB(增强)+ 759 MB(原始)≈ 2.24 GB
获取 Mendeley Data 公开直下
官方划分 无

10.9 数据的可复现性讨论

10.9.1 复现原论文需要哪些材料

  • Mendeley Data v3 的两个 zip 包;
  • 论文的规格说明(类别定义、预处理链);
  • 论文报告的模型与超参(若给出);
  • 最难的一环:由于无官方划分脚本,复现者需自定划分——因此数值不可严格复现。

10.9.2 复现的常见失败点

  1. 下错版本:下了 v1(4,604)却对标论文 v3(4,006)的数字;
  2. 划分泄漏:按图像随机划分导致指标虚高,与论文数字不可比;
  3. 类别不平衡处理不同:加权/重采样策略不同会显著改结果;
  4. 预处理不同:是否在 512×512 上再归一化、用何种归一化,都会影响结果。

10.10 对消化道内镜 AI 领域的启示

  1. “张数"不是"信息量”:增强副本再多也不等于独立数据,报告规模应区分原始与增强——GastroEndoNet 明示了这点,值得其他数据集效仿,但引用者也须读懂。
  2. 可获取性是硬价值:免注册直下显著降低复现与比较的成本,很多"更大更权威"的数据集因获取门槛高而实际使用受限。
  3. "配对设计"值得推广:"病变 vs 同部位正常"的配对框架清晰、易评测,避免了多类混杂带来的解释困难。
  4. 单中心是通病:医学影像数据集普遍单中心,跨中心泛化是社区共同课题。

10.11 与其他消化道数据集的联合使用

  • 与 HyperKvasir / GastroVision 联合:可作为"额外 GERD/息肉训练素材",但须注意类别定义对齐与去重(避免与这些集合重叠的图像);
  • 与 Kvasir-SEG / PolypGen 联合:GastroEndoNet 无掩码,不能直接为分割任务供标签,但可作分类预训练;
  • 联合使用的核心风险:跨数据集的图像重复——若两个数据集含相同图像,联合训练会造成隐性泄漏。使用前须做跨集去重(感知哈希比对)。

10.12 结语

GastroEndoNet 的价值不在"大"或"精",而在"门槛低、覆盖全、组织清"。它把消化道内镜分类最常见的两个目标(GERD、息肉)用一套干净的四类框架打包,公开直下,让任何团队都能在几分钟内开始内镜 AI 实验。对初学者和快速验证者,它是友好的起点;对追求临床精度或跨中心泛化的研究者,它是必须谨慎对待的有限素材。读它的数字要读版本,用它的数据要先去重,引它的许可要认 ND。

FAQ(高频问答 32 问)

A. 基础认知

A1:GastroEndoNet 是什么?
一个消化道内窥镜图像四分类数据集,覆盖食管侧 GERD 与结直肠侧息肉,由孟加拉 Daffodil International University 团队发布,托管于 Mendeley Data。

A2:它和 GastroVision、HyperKvasir 是同一个东西吗?
不是。GastroVision(rid 203)与 HyperKvasir(rid 693)是另外的胃肠内镜数据集。三者名字相近但来源、规模、标签体系都不同(坑 1)。

A3:它是挑战赛数据集吗?
不是。它是 Data in Brief 发表的 Data Article,无竞赛、无 leaderboard。

A4:谁做的?
Daffodil International University(Dhaka)与 Premier University(Chattogram)的 7 位作者,数据采集于 Zainul Haque Sikder Women’s Medical College & Hospital。

A5:采自哪个国家?
孟加拉国(Bangladesh),Dhaka 市 Gulshan-2 区。

A6:用的什么设备?
Olympus EVIS EXERA III(含 GIF-190)与 Pentax Medical EG29-i10,两款混合。

A7:是什么时候发布的?
Mendeley v1 于 2024-10-07;论文 2025 年 6 月发表在 Data in Brief(Vol. 60, 111572)。最新数据版本 v3 为 2025-02-27。

A8:它是新的还是老的?
新近发布(2024-2025),学术影响仍在积累。

B. 数据与获取

B1:一共多少张图?
v3 口径 24,036 张(原始 4,006);v1 口径 27,624 张(原始 4,604)。默认讨论用 v3。

B2:为什么有两个总数?
因为版本不同(v1 vs v3),v2/v3 做了去重(坑 3、存照 A)。

B3:24,036 是怎么来的?
原始 4,006 张 × 6 种增强 = 24,036(4,006 × 6 = 24,036)。

B4:六种增强是什么?
60° 旋转、90° 旋转、水平翻转、缩放、亮度调整、错切(坑 9 提到错切对形状的影响)。

B5:四类各多少张(v3)?
GERD 974、GERD Normal 1,103、Polyp 779、Polyp Normal 1,150(原始图)。

B6:图像多大?
512×512 像素,JPG 格式。

B7:原始分辨率是多少?
原始像素 440–960,统一 bicubic 缩放到 512×512。

B8:怎么下载?
Mendeley Data,DOI 10.17632/ffyn828yf4.3,免注册直下。两个 zip:增强包 1.51 GB + 原始包 759 MB。

B9:要申请吗?
不用。公开直下,无需注册、无需 DUA(这是它的优势)。

B10:有没有 HuggingFace 镜像?
未发现(遗留疑点 1);以 Mendeley Data 为唯一权威入口。

C. 数据组织与标注

C1:怎么做标注?
图像级单标签,无边界框、无分割掩码(§5.2)。

C2:有患者 ID 吗?
没有,患者级信息未披露(遗留疑点 3)。

C3:有病理对照吗?
没有,标签来自内镜结论而非活检(§7.6)。

C4:能用来做检测或分割吗?
不能——没有框和掩码(§5.2、§10.4)。

C5:类别平衡吗?
较温和:最不平衡比约 1:1.48(Polyp : Polyp Normal)。

C6:为什么把 GERD 和息肉放一起?
两者同为消化道内镜常见目标、同成像模态、同为"病变 vs 正常"判别问题(§2.6)。

C7:GERD Normal 和 Polyp Normal 是同一个"正常"类吗?
不是。前者是食管正常,后者是结肠正常(§5.4)。

D. 许可与合规

D1:许可是什么?
CC BY-NC-ND 4.0(Mendeley 数据集页权威口径)。

D2:能商用吗?
不能。NC 条款禁止商业使用(坑 5)。

D3:能发布我改过的版本吗?
不能。ND 条款禁止发布演绎版本(坑 5)。但训练模型、发表结果是允许的。

D4:为什么有的地方写 CC BY NC?
论文刊物侧元数据与 OpenAIRE 索引的简写,缺 ND;以数据集页为准(存照 C)。

D5:商用前要做什么?
先核实当前许可 + 联系通讯作者取得授权(§6.2 合规三步核实法)。

E. 评测与使用

E1:有官方 train/test 划分吗?
没有,须自定协议(§5.6、§6.5)。

E2:最关键的评测注意事项是什么?
按原始文件去重划分——同一原始图的 6 个增强副本必须整组进同一个集合,否则同源泄漏导致指标虚高(坑 6)。

E3:有官方 benchmark 分数吗?
没有权威 leaderboard;论文只有可行性验证实验,且因无固定划分而不可严格复现(§7.1)。

E4:四分类准确率高就说明模型好吗?
不一定。四分类高准确率可能主要来自"部位判别"(食管 vs 结肠),而非"病变判别"(坑 7)。须分解报告。

E5:应该报告什么指标?
四分类指标 + 部位内二分类指标,优先 per-class recall 与 macro-F1(§7.2、§7.7)。

E6:类别不平衡怎么办?
类别加权、重采样、分层划分、报告 macro-F1(§7.5)。不推荐再额外做增强。

E7:能和其他数据集联合训练吗?
可以,但须先做跨集去重(感知哈希),避免隐性泄漏(§10.11)。

F. 复现与工程

F1:能严格复现论文数字吗?
不能。无官方划分脚本,数值依赖划分方式(§10.9)。

F2:复现最容易失败在哪?
下错版本、划分泄漏、不平衡处理不同、预处理不同(§10.9.2)。

F3:下载要多久?
2.24 GB,普通网络几分钟到十几分钟。

F4:本地训练门槛高吗?
不高。512×512 JPG,2.24 GB,普通 GPU 甚至 CPU 都能跑通小模型。

事实清单(硬事实 40 条)

# 事实 来源
1 官方全称 GastroEndoNet: An endoscopic image dataset for GERD and polyp detection 论文标题
2 论文发表于 Data in Brief, Vol. 60, 111572, 2025 Jun 论文
3 论文 DOI 10.1016/j.dib.2025.111572 论文
4 PMID 40470347 PubMed 索引
5 PMC12136698 PMC 索引
6 数据托管于 Mendeley Data 数据页
7 Mendeley DOI(v3)10.17632/ffyn828yf4.3 数据页
8 Mendeley 公开日期 2025-02-27(v3) 数据页
9 v1 首发 2024-10-07 数据页
10 v3 总量 24,036 张 数据页/论文
11 v3 原始图 4,006 张 数据页/论文 Abstract
12 v1 总量 27,624 张 数据页
13 v1 原始图 4,604 张 数据页
14 四类:GERD / GERD Normal / Polyp / Polyp Normal 论文
15 v3 四类原始图 974 / 1,103 / 779 / 1,150 数据页
16 v1 四类原始图 1,076 / 1,168 / 1,188 / 1,172 数据页
17 增强 6 种:60° 旋转、90° 旋转、水平翻转、缩放、亮度调整、错切 论文
18 4,006 × 6 = 24,036(自洽) 计算
19 分辨率 512×512 论文
20 原始像素范围 440–960 论文
21 缩放方法 bicubic 论文
22 格式 JPG 数据页
23 设备 Olympus EVIS EXERA III(GIF-190) 论文
24 设备 Pentax Medical EG29-i10 论文
25 采集地 Zainul Haque Sikder Women’s Medical College & Hospital 论文
26 采集地地址 Gulshan-2, Road-104, House-5, Dhaka-1212, Bangladesh 论文
27 归属机构 Daffodil International University 论文
28 合作机构 Premier University(Chattogram) 论文
29 作者数 7 论文
30 伦理批号 REC-FSIT-2024-08-24 论文
31 许可 CC BY-NC-ND 4.0 Mendeley 数据页
32 论文侧许可表述 cc by-nc Europe PMC
33 OpenAIRE 表述 CC BY NC OpenAIRE
34 增强包体积 1.51 GB Mendeley 数据页
35 原始包体积 759 MB Mendeley 数据页
36 总下载体积约 2.24 GB 计算
37 获取方式公开直下(免注册) Mendeley 数据页
38 无官方 train/val/test 划分 论文/数据页
39 第三方引用 Diagnostics 2025, 15, 2714 用 v1 口径 4,604 MDPI 论文
40 标签为图像级单标签,无框/掩码 论文

事实来源说明

本清单以一手来源(Mendeley Data 数据页 + Data in Brief 论文)为准;二手索引(PMC/PMID/OpenAIRE)用于交叉核验;第三方文献(Diagnostics 2025, 15, 2714)用于坐实 v1 口径的独立存在。凡一手与二手冲突处,均在 §9.1 存照。

术语表(补充,接 §2.5)

中文 英文 补充说明
数据描述论文 Data Article Data in Brief 的文体,专述数据集
单源派生 single-source derived 从一个来源派生扩充,非跨机构汇聚
同源泄漏 same-source leakage 派生副本跨集导致的信息泄漏
分层划分 stratified split 保持各类别比例的划分
宏平均 F1 macro-F1 各类 F1 的算术平均,不受类规模影响
逐类召回 per-class recall 每一类各自的召回率
混淆矩阵 confusion matrix 真值 × 预测的列联表
一对其余 one-vs-rest 多分类转二分类的 AUC 计算方式
感知哈希 perceptual hash 图像相似度取指纹,用于跨集去重
部位捷径 site shortcut 模型用部位外观而非病变特征做判别
内镜结论级 endoscopy-conclusion level 标签精度上限为当时的内镜判断
病理级 pathology level 以活检/病理为金标准的精度
洛杉矶分级 LA grade 反流性食管炎的 A-D 分级(本数据集无)
去标识化 de-identification 移除可识别患者信息

附录

附录 A:条目信息速查卡

项 值
slug gastroendonet
中文名 胃食管反流病与结直肠息肉四分类内窥镜图像数据集
默认版本 v3(4,006 / 24,036)
主 DOI 10.17632/ffyn828yf4.3
论文 DOI 10.1016/j.dib.2025.111572
许可 CC BY-NC-ND 4.0
获取 Mendeley Data 公开直下
核心坑 坑 3(版本数字)、坑 6(同源泄漏)、坑 5(许可 ND)

附录 B:DAIMS 评估全表

见 §10.7(24 项逐项评分,综合评级"够用但不够精")。

附录 C:逐项证据链自证

结论 证据
数据集真实存在 Mendeley Data 页 + 论文 + PMC 索引 + 第三方引用
规模 24,036/4,006(v3) 论文 Abstract + Mendeley v3 页
规模 27,624/4,604(v1) Mendeley v1 页 + Diagnostics 2025, 15, 2714
许可 CC BY-NC-ND 4.0 Mendeley 数据集页
采集地孟加拉 论文 + 机构页
免注册直下 Mendeley 下载页实测

附录 D:数据获取决策树

见 §6.6。

附录 E:四类标签映射与使用规范

类别 部位 状态 合并方案
GERD 食管 病变 病变类
GERD Normal 食管 正常 正常类
Polyp 结肠 病变 病变类
Polyp Normal 结肠 正常 正常类

使用规范:报告二分类时须注明合并方案;报告四分类时须分部位统计。

附录 F:增强变换清单与建议

变换 类型 形状保持 建议
60° 旋转 几何 是(旋转不改变形状) 可用
90° 旋转 几何 是 可用
水平翻转 几何 是(镜像) 可用,但注意左右解剖含义
缩放 几何 是(等比) 可用,注意尺度变化
亮度调整 光度 是 可用,提升明暗鲁棒性
错切 几何 否(改变比例) 形状敏感任务慎用(坑 9)

附录 G:按原始文件去重的伪代码

# 假定文件名可解析出原始图 ID(如 orig_0001_aug60.jpg → orig_0001)
groups = {}
for f in all_files:            # 遍历 Original + Augmented 两个包
    oid = parse_original_id(f) # 解析同一原始图的 ID
    groups.setdefault(oid, []).append(f)

# 整组划分:同一 oid 的所有文件进同一个集合
train, val, test = [], [], []
for oid, files in stratified_groups(groups):   # 按类别分层
    split = assign_split(oid)   # 随机/按比例决定该组归属
    (train if split=='train' else val if split=='val' else test).extend(files)
# 关键:绝不把同一 oid 的文件拆到不同集合

附录 H:评测骨架(伪代码)

for seed in seeds:
    split = dedup_stratified_split(seed)          # 附录 G 的划分
    model = train(train_set)
    # 四分类
    report_four_class_metrics(model, test_set)    # acc / macro-F1 / 混淆矩阵
    # 部位内二分类
    report_binary_metrics(model, test_set, site='esophagus')  # GERD vs Normal
    report_binary_metrics(model, test_set, site='colon')      # Polyp vs Normal
    report_per_class_recall(model, test_set)
aggregate_seeds()  # 报告均值 ± 标准差

附录 I:统计指标计算表

指标 公式
Accuracy (TP+TN) / N
Precision_c TP_c / (TP_c + FP_c)
Recall_c TP_c / (TP_c + FN_c)
F1_c 2·P_c·R_c / (P_c + R_c)
macro-F1 (1/C)·Σ F1_c

附录 J:双口径登记表

项 v1 v3 判定
发布日 2024-10-07 2025-02-27 版本差
原始图 4,604 4,006 去重
总张数 27,624 24,036 去重
GERD 1,076 974 去重
GERD Normal 1,168 1,103 去重
Polyp 1,188 779 去重
Polyp Normal 1,172 1,150 去重

附录 K:许可条款细读

条款 含义 对使用的影响
BY(署名) 须注明出处 论文/产品须致谢与引用
NC(非商业) 禁商用 企业使用受限
ND(禁止演绎) 禁发布改动版 不能公开部署二次发布的数据集版本

附录 L:常见误引与纠正

误引 纠正
“GastroEndoNet 有 24,036 张独立图像” 独立原始图仅 4,006
“GastroEndoNet 可商用” 不可(NC)
“GastroEndoNet 可发布衍生数据集” 不可(ND)
“GastroEndoNet 数据来自印度” 来自孟加拉
“GastroEndoNet 有息肉边界框” 无,仅图像级标签

附录 M:与库内条目的关系声明

GastroEndoNet 与库内 hyperkvasir(693)、gastrovision(203)、kvasir-seg(112)、kvasir-instrument(213)、kvasir-capsule(123)、cvc-colondb(142)、bkai-igh-neopolyp(84)、ldpolypvideo(163)、polypgen(183)、real-colon(778)、endoscapes(353)、slam-3d-endoscopic(82) 构成消化道内镜谱系;本条目是其中首个以 GERD 为独立标签的条目。建议双向互链。

附录 N:检索决策树

想找 GERD 内镜分类数据?
├─ 要独立 GERD 标签 → GastroEndoNet
├─ 要大合集含 GERD 子类 → HyperKvasir / GastroVision
想找息肉数据?
├─ 要分类 → GastroEndoNet / HyperKvasir
├─ 要检测/分割 → PolypGen / CVC-ColonDB / Kvasir-SEG / LDPolypVideo

附录 O:检索路径示范(关键词组合)

  • 关键词组合 1:GastroEndoNet + Mendeley → 直达数据页;
  • 关键词组合 2:ffyn828yf4 → 唯一命中 Mendeley DOI;
  • 关键词组合 3:GERD polyp endoscopy dataset → 命中论文与相关综述;
  • 关键词组合 4:GastroEndoNet site:pmc.ncbi.nlm.nih.gov → 命中 PMC12136698;
  • 关键词组合 5:GastroEndoNet original 4604 → 命中引用 v1 的第三方文献。

附录 P:本条目生产档案

  • 代理名:agent-b-gastroendo;
  • 正选 slug:gastroendonet(无备选);
  • 开工三查:锁文件 .lock(agent-b-gastroendo 2026-09-30T22:14)、私有区 .parts_agent-b-gastroendo_1790777646/、ps aux | grep -c "[c]odebuddy" = 8;
  • 私有区 10 秒 md5 稳定性采样:通过(空目录,d41d8cd9…);
  • 成稿方式:5 part 直写私有区 → cat 拼接;
  • 自检:check_md.py + preflight_check.py 双零。

附录 Q:FAIR/AI-Ready 检查单

原则 评估
Findable(可发现) ★★★★☆ — DOI + Mendeley 页 + 论文索引齐备
Accessible(可获取) ★★★★★ — 公开直下,免注册
Interoperable(可互操作) ★★★☆☆ — JPG 通用,但无标准化元数据/字典文件
Reusable(可复用) ★★★☆☆ — 许可限 NC+ND,缺患者级与划分信息
AI-Ready ★★★☆☆ — 分类可用,增强需去重,无 detection/segmentation 支持

尾注

本条目基于 2026-09-30 的公开检索与一手来源核验撰写。所有硬数字以 Mendeley Data v3 数据页与 Data in Brief 论文为准;v1 口径(4,604 / 27,624)作为版本差异存照于 §9.1,第三方文献(Diagnostics 2025, 15, 2714)对该口径的引用亦已记录。许可以数据集页 CC BY-NC-ND 4.0 为准,论文刊物侧与 OpenAIRE 的简写口径差异存照于 §6.2。

互链条目声明:本条目的相关数据集定位面向库内消化道内镜谱系,具体互链对象与 rid 见 §9.4。本条目为库内首个以 GERD 为独立标签的条目,落库后建议与下列条目建立双向互链:gastrovision(203)、hyperkvasir(693)、kvasir-seg(112)、kvasir-instrument(213)、kvasir-capsule(123)、cvc-colondb(142)、bkai-igh-neopolyp(84)、ldpolypvideo(163)、polypgen(183)、real-colon(778)、endoscapes(353)、slam-3d-endoscopic(82)。

维护触发点:

  1. Mendeley Data 发布 v4 或更新版本时,须复核规模与四类分布并更新 §4.1、§9.1;
  2. 数据集页 license 变更时,须更新 §6.2 与 frontmatter 的 license 字段;
  3. 发现 HuggingFace 镜像时,须更新 §6.4 与遗留疑点 1;
  4. 论文作者披露 患者级信息或划分脚本时,须更新 §9.2 遗留疑点 3、5;
  5. 出现权威第三方 benchmark(公开 leaderboard)时,须补入 §7;
  6. 库内 GERD 方向新增条目时,须同步更新 §9.4 互链点。

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • bkai-igh-neopolyp — 共享标签:内窥镜影像 / 医学影像 / 结直肠癌 / 肿瘤学
  • gastrovision — 共享标签:内窥镜影像 / 图像分类 / 医学影像
  • lc25000 — 共享标签:图像分类 / 医学影像 / 结直肠癌 / 肿瘤学
  • rare25 — 共享标签:内窥镜影像 / 图像分类 / 医学影像 / 肿瘤学
  • ldpolypvideo — 共享标签:内窥镜影像 / 医学影像 / 结直肠癌
  • cima — 共享标签:医学影像 / 结直肠癌 / 肿瘤学
  • ham10000 — 共享标签:图像分类 / 医学影像 / 肿瘤学
  • odir — 共享标签:内窥镜影像 / 图像分类 / 医学影像
  • kvasir-capsule — 共享标签:内窥镜影像 / 图像分类 / 医学影像
  • ddti — 共享标签:图像分类 / 医学影像 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集