信息速览
INFOBOX — GastroEndoNet 一屏速览
维度 内容 本质 胃食管反流病(GERD)+ 结直肠息肉四分类内窥镜图像数据集(单源派生化,非跨机构汇聚) 论文 Data in Brief, Vol. 60, 111572, 2025 Jun|DOI 10.1016/j.dib.2025.111572|PMID 40470347|PMC12136698 数据页 Mendeley Data,DOI 10.17632/ffyn828yf4.3(v3,公开日期 2025-02-27) 团队 Daffodil International University(Dhaka)+ Premier University(Chattogram),7 位作者 采集地 孟加拉 Dhaka Gulshan-2 的 Zainul Haque Sikder Women’s Medical College & Hospital 内窥镜室 规模 24,036 张 512×512 JPG = 原始 4,006 × 6 种增强(v3 口径) 四类 GERD 974|GERD Normal 1,103|Polyp 779|Polyp Normal 1,150(原始图,各 ×6) 增强 60° 旋转、90° 旋转、水平翻转、缩放、亮度调整、错切——每张原图各生成 6 副本 设备 Olympus EVIS EXERA III(GIF-190 胃镜)+ Pentax Medical EG29-i10(消化道内镜) 任务 四分类图像分类(图像级单标签;无框、无掩码) 伦理 伦理批号 REC-FSIT-2024-08-24(Daffodil International University 伦理审查委员会) 许可 CC BY-NC-ND 4.0(非商业 + 禁止演绎);论文/OpenAIRE 口径冲突见坑 5 获取 Mendeley Data 公开直下(无需注册、无需申请);论文与机构页为旁证入口 库内互链 gastrovision(203)、hyperkvasir(693)、kvasir-seg(112)、polypgen(183)、cvc-colondb(142)、ldpolypvideo(163)
GastroEndoNet 是一本"一鱼六吃"的内窥镜图册:它没有去跨医院、跨国家地搜罗数据,而是把孟加拉 Dhaka 一家医院内窥镜室里拍下的 4,006 张原始消化道内镜图像,用六种几何与光度变换(旋转、翻转、缩放、调亮度、错切)各自复制成六份,凑成 24,036 张 512×512 的 JPG,再按"GERD / 正常食管"与"息肉 / 正常结肠"两组"病变 vs 对照"配成四类。它是一个典型的单源派生型(single-source derived)数据集——数据量看着不小,但"独立信息"只在那 4,006 张里,其余五分之四都是同源增强副本。理解这一点,是使用这个数据集的全部起点。
它想解决的问题也很直白:公开的消化道内镜数据集要么偏息肉、要么偏某个大会挑战赛,很少有同时覆盖食管侧 GERD 与结直肠侧息肉的"双任务合体"版本,而两者恰恰是消化内镜筛查里最常被 AI 关注的两个目标。GastroEndoNet 把这两个目标塞进同一个四类框架,配上一份清楚的伦理批号和两代设备清单,以 Mendeley Data 公开直下(无需注册、无需申请) 的低门槛发布,方便小团队快速起步做内镜分类模型的打通性实验。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——Mendeley Data 两个 zip 包(增强包 1.51 GB + 原始包 759 MB)即可直下,无需注册;但许可含 ND(禁止演绎) 条款,二次发布须原样(坑 5)。
- 关心数字口径:直奔 §4 数据构成——
4,006与4,604、24,036与27,624两套数字来自不同版本(v3 vs v1),本文双口径并存并标注版本(坑 3)。 - 要拿它做基准/训练:直奔 §7 评估与 §10 避坑清单——最重要的动作是先按原始文件去重再划分 train/test,否则增强副本跨集泄漏会显著虚高指标(坑 6)。
§0 导读:这个数据集解决什么问题
消化内镜(gastrointestinal endoscopy)是消化道疾病诊断的主力手段:胃镜看食管与胃,结肠镜看结直肠。在 AI 辅助诊断的语境里,内镜图像有两大热门任务——食管侧的胃食管反流病(Gastroesophageal Reflux Disease, GERD)识别,和结直肠侧的息肉(polyp)检测与分类。前者关系到反流性食管炎、Barrett 食管等病变的早期发现,后者直接关系到结直肠癌(colorectal cancer)的癌前病变筛查。两者同属消化道,却长期各自为战:公开数据集要么专攻息肉(CVC-ColonDB、LDPolypVideo、PolypGen 等),要么是覆盖面广但各类混杂的多类别合集(HyperKvasir、GastroVision 等),很少有一个数据集同时把"食管侧病变/正常"和"结肠侧病变/正常"配成对齐的四类对照。
GastroEndoNet 就是冲着这个空缺来的。它把采集自一家医院的消化道内镜图像整理成四类:
- GERD:食管侧的反流性病变图像;
- GERD Normal:食管侧的正常对照;
- Polyp:结直肠侧的息肉图像;
- Polyp Normal:结直肠侧的正常对照。
这是一个精心设计的"病变 vs 该器官正常"配对框架:模型不仅要能区分"病变/正常",还要能在两个解剖部位之间不混淆。论文把它定位为支持 GERD 检测与息肉检测两个下游任务的数据基座。
0.1 为什么内镜分类数据集容易"看起来很大"
在理解 GastroEndoNet 的数字之前,必须先理解一个关键事实:内镜图像数量与独立临床信息量不是一回事。同一个病灶、同一段肠腔,稍微旋转一点、翻个面、调亮一点,就能生成好几张"新"图像。数据增强(data augmentation)在医学图像里被广泛使用,用来扩充训练集、提升模型对几何与光度变化的鲁棒性。
GastroEndoNet 把增强从"训练时在线生成"提前到了"离线预生成并入库",因此它的 24,036 这个总数需要拆开看:
- 4,006 张是真正的原始(original / primary)图像;
- 每张原始图用 6 种变换各生成 1 个副本,即 4,006 × 6 = 24,036;
- 换句话说,五分之四(约 83%)的"数据"是原始图的同源派生副本。
这不是造假,而是明示的设计选择——论文明写这是"增强后的数据集"。但它决定了这个数据集的两个使用要诀:训练时它是有用的扩增池;评测时必须按原始文件去重,否则同源泄漏会严重虚高指标(详见坑 6)。
0.2 本条目要处理的三个"数字迷雾"
写这个条目,最需要谨慎的是三处数字口径:
- primary 数量:论文 Abstract 与 Mendeley v3 页写 4,006(总计 24,036);而 Mendeley v1(2024-10-07)页写 4,604(总计 27,624)。两者不是笔误,是版本差异(v2/v3 做了去重)。更有意思的是,第三方文献(Diagnostics 2025, 15, 2714)明确引用了 v1 的 URL,写 “original 4604 images”——说明 v1 口径在学术文献里已被独立引用,本条目必须双口径并存。
- 四类分布:v3 口径为 974 / 1,103 / 779 / 1,150;v1 口径为 1,076 / 1,168 / 1,188 / 1,172。引用时务必注明版本。
- 许可口径:数据集页写 CC BY-NC-ND 4.0,论文刊物侧元数据写 “cc by-nc”,OpenAIRE 写 “CC BY NC”。三者以数据集页为权威,但差异(尤其是 ND 后缀)对能否发布改动版影响很大。
§0 读法三则:
- 本条目是"数据集 + 数据描述论文(Data Article)"二合一:没有方法创新,价值全在数据的组织方式、覆盖范围与可获取性上。
- 全文硬数字以一手来源(Mendeley Data v3 页 + Data in Brief 论文)为准;与 v1 页、第三方引用的冲突已在 §9 逐条存照。
- 检索时若看到"24,036"和"27,624"并存,不要以为其中一个错了——它们是同一数据集的两个版本(坑 3)。
0.3 本条目在千方病案医数集里的定位
在千方病案医数集的库内,消化道内镜方向的条目已经不少:HyperKvasir(rid 693)是大而全的胃肠内镜多类合集,Kvasir 家族(kvasir-seg 112、kvasir-instrument 213、kvasir-capsule 123)覆盖分割、器械与胶囊内镜,GastroVision(rid 203)是胃肠内镜多类分类集,息肉系有 CVC-ColonDB(142)、BKAI-IGH-NeoPolyp(84)、LDPolypVideo(163)、PolypGen(183)、Real-Colon(778)等。但专门以"GERD"为核心标签的条目此前是空缺——GERD 通常只在 HyperKvasir、GastroVision 等大合集里以某个子类身份出现,缺少一个以它为独立建模目标的条目。
GastroEndoNet 落库,正好把这个空缺补上,并且把"食管侧 + 结肠侧"两个部位的对照关系放进同一个四类框架,为库内的"消化道内镜"谱系增加了一个跨部位双任务的分类基准。关于它与库内各条目的具体关系与互链理由,详见 §9。
§1 数据集速览:十问十答
Q1:GastroEndoNet 到底有多少张图像?
取决于版本。v3(最新,2025-02-27)为 24,036 张,其中原始图 4,006 张、增强副本 20,030 张。v1(2024-10-07 首发)为 27,624 张,原始图 4,604 张。论文 Abstract 与 Mendeley v3 页一致采用 4,006 / 24,036。第三方文献(Diagnostics 2025, 15, 2714)引用的是 v1 的 4,604 口径。
Q2:"4,006 × 6 = 24,036"这个 6 是什么?
是六种数据增强变换,每张原始图各生成 1 个副本:60° 旋转、90° 旋转、水平翻转、缩放(scaling)、亮度调整(brightness adjustment)、错切(shearing)。六种变换的都是几何或光度层面的,不改变图像的类别标签。
Q3:四类是哪四类,各多少张?
- GERD(反流性病变食管):原始 974 张 → 增强后 5,844 张;
- GERD Normal(正常食管):原始 1,103 张 → 增强后 6,618 张;
- Polyp(结直肠息肉):原始 779 张 → 增强后 4,674 张;
- Polyp Normal(正常结肠):原始 1,150 张 → 增强后 6,900 张。
四类原始图合计 974 + 1,103 + 779 + 1,150 = 4,006(✓ 自洽);增强后合计 5,844 + 6,618 + 4,674 + 6,900 = 24,036(✓ 自洽)。
Q4:图像是什么规格?
统一 512 × 512 像素的 JPG 单文件单图。原始图像的像素尺寸范围在 440–960 之间(长边/短边),发布前用 bicubic 重采样统一缩放到 512×512。无 DICOM 元数据,无患者面部或其他可识别信息。
Q5:数据是从哪来的、谁采的?
采集地是孟加拉国 Dhaka 市 Gulshan-2 区(Road-104, House-5, Dhaka-1212)的 Zainul Haque Sikder Women’s Medical College & Hospital (Pvt.) Ltd. 内窥镜室。数据归属与论文作者单位是 Daffodil International University(Dhaka,主)与 Premier University(Chattogram)。共 7 位作者。
Q6:用的什么内镜设备?
论文给出两款:Olympus EVIS EXERA III(其中含 GIF-190 胃镜)与 Pentax Medical EG29-i10(消化道内镜)。两代不同厂商的设备混合采集,这一点在评估跨设备泛化时值得注意。
Q7:任务是什么?标注到什么粒度?
四分类图像分类,标签是图像级单标签(每张图一个类别)。没有病灶边界框、没有像素级分割掩码、没有多标签、没有患者级随访标签。因此它只支持分类任务,不支持检测或分割研究。
Q8:怎么获取?要注册或申请吗?
不需要。 数据集托管在 Mendeley Data,DOI 为 10.17632/ffyn828yf4.3(v3),公开直下,无需注册、无需申请——这一点与许多"请求制(upon request)"的临床数据集形成鲜明对比,是本数据集的一大优势。页面提供两个 zip:Augmented_Resized Image.zip(1.51 GB)与 Original Image.zip(759 MB)。
Q9:许可是什么?能商用吗?
数据集页标注 CC BY-NC-ND 4.0——NC(非商业)+ ND(禁止演绎)双重限制。这意味着:企业不得用于商业用途;且不得发布基于它的改动版本,再分发须原样。论文刊物侧的 Europe PMC 元数据记为 “cc by-nc”(缺 ND),OpenAIRE 记为 “CC BY NC”,存在三口径冲突(坑 5),以数据集页为准。
Q10:有没有官方划分和 benchmark?
没有。 论文是 Data Article 型,未发布官方 train/val/test 划分文件,也没有 leaderboard。论文给出了一些基线分类实验(CNN 类模型四分类)以证明数据集可学,但那是"可行性验证"而非"权威基准"。使用者须自行设计划分协议——切记按原始文件去重(坑 6)。
十问十答小结:GastroEndoNet 是一个门槛低(公开直下)、覆盖跨界(食管 + 结肠)、组织清晰(四类对照)但规模有水分(增强占 5/6)、许可偏严(NC + ND)、无官方基准的内窥镜分类数据集。它的价值在于"起步友好"与"GERD 覆盖",它的陷阱在于"数字口径"与"同源泄漏"。
§2 数据集身份卡:一张表看懂 GastroEndoNet
| 字段 | 内容 |
|---|---|
| 官方全称 | GastroEndoNet: An endoscopic image dataset for GERD and polyp detection |
| slug | gastroendonet |
| 本质 | 单源派生型(single-source derived)四分类内窥镜图像数据集 |
| 论文 | Data in Brief, Vol. 60, 111572, 2025 Jun(DOI 10.1016/j.dib.2025.111572;PMID 40470347;PMC12136698) |
| 数据托管 | Mendeley Data(DOI 10.17632/ffyn828yf4.3,v3) |
| 总量(v3) | 24,036 张 512×512 JPG(原始 4,006 + 增强 20,030) |
| 总量(v1) | 27,624 张(原始 4,604) |
| 类别 | 4 类:GERD / GERD Normal / Polyp / Polyp Normal |
| 任务 | 图像分类(图像级单标签) |
| 采集地 | 孟加拉 Dhaka Gulshan-2,Zainul Haque Sikder Women’s Medical College & Hospital |
| 设备 | Olympus EVIS EXERA III(GIF-190)+ Pentax Medical EG29-i10 |
| 分辨率 | 512×512(原始 440–960 经 bicubic 缩放) |
| 格式 | JPG |
| 伦理批号 | REC-FSIT-2024-08-24 |
| 许可 | CC BY-NC-ND 4.0 |
| 获取 | Mendeley Data 公开直下(免注册、免申请) |
| 官方划分 | 无(须自定协议) |
2.1 身份辨识三要点
要点一:它是"数据集论文"而不是"方法论文"。 Data in Brief 是 Elsevier 旗下的数据描述期刊,专门发表"数据集说明"类文章(Data Article)。这类文章的核心是描述数据如何采集、如何组织、如何使用,而非提出新模型或新算法。因此 GastroEndoNet 的论文里不会有 SOTA 对比表、不会有新网络结构,只有数据规格、伦理说明和少量"可学性验证"实验。拿它当"方法 baseline"引用是误用。
要点二:它是"单源派生"而不是"跨机构汇聚"。 很多知名医学数据集是跨医院、跨国家汇聚的(如 MIMIC 汇聚一家医院的多年记录、PANDA 汇聚 Radboud + Karolinska)。GastroEndoNet 不是——它来自一家医院的内窥镜室,所有图像同一来源、同一批设备、同一职业群体(孟加拉女性医疗中心患者)。这种"单源"特性决定了它的外部效度(external validity)有限,跨人群/跨设备泛化需另行验证。
要点三:它是"离线预增强"而不是"原始原始"。 24,036 这个数字里,约 83% 是 6 倍增强副本。使用者若不注意,容易把"图像张数"误当"独立样本数",进而在划分数据集或报告规模时出错(坑 3、坑 6)。
2.2 命名规范与检索陷阱
- 规范名:GastroEndoNet(一个词,驼峰式,首字母 G、E、N 大写)。
- 检索 slug:
gastroendonet(全小写,库内 URL 用)。 - 常见误写:Gastro-EndoNet、GastroEndonet、Gastro_Endo_Net、GERD-Polyp Dataset、GastroEndoscopyNet——这些都不是官方名,检索可能落空或命中无关项。
- 与相邻概念混淆:
- GastroVision(库内 rid 203)——胃肠内镜多类数据集,名字像但是另一个数据集,绝非别名;
- HyperKvasir(rid 693)——Kvasir 系最大胃肠内镜合集,也含 GERD 子类,但来源与规模都不同;
- ENDONET / EndoNet——已有文献中的内镜深度估计或手术阶段识别网络名,与 GastroEndoNet 无任何关系,切勿混用。
- 检索建议:用"GastroEndoNet" + “Mendeley” 或 “ffyn828yf4” 精确定位;用 DOI
10.17632/ffyn828yf4最稳妥。
2.3 GastroEndoNet 的一句话定位
它是"食管侧 GERD + 结肠侧息肉"双任务合体的四分类内窥镜图像集,采自孟加拉一家医院,以原始 4,006 张图经 6 倍增强得 24,036 张,Mendeley Data 公开直下,供小团队做内镜分类模型的起步与打通实验。
2.4 与库内条目的定位差异
| 库内条目 | 主任务 | 覆盖部位 | 与 GastroEndoNet 的关系 |
|---|---|---|---|
| HyperKvasir (693) | 分类 + 分割 | 全消化道 | 更全但更杂;GastroEndoNet 更聚焦 GERD/息肉对照 |
| GastroVision (203) | 多类分类 | 上/下消化道 | 类更多;GastroEndoNet 类更少但有"病变 vs 正常"配对 |
| Kvasir-SEG (112) | 分割 | 结直肠 | 像素级掩码;GastroEndoNet 只有图像级标签 |
| CVC-ColonDB (142) | 检测/分割 | 结直肠 | 有边界框/掩码;GastroEndoNet 无 |
| LDPolypVideo (163) | 视频检测 | 结直肠 | 视频流;GastroEndoNet 是单帧图 |
| PolypGen (183) | 检测/分割 | 结直肠多中心 | 多中心;GastroEndoNet 单中心 |
| Real-Colon (778) | 检测 | 结直肠 | 真实场景视频;GastroEndoNet 是静态图 |
定位结论:GastroEndoNet 在库内是唯一以 GERD 为独立标签、且把食管侧与结肠侧配成对齐四类的分类数据集,与息肉系数据集互补而非替代。
§2.5 术语表(术语首现英文对照)
| 中文 | 英文 | 说明 |
|---|---|---|
| 胃食管反流病 | GERD / gastroesophageal reflux disease | 胃内容物反流至食管引起的疾病,可致食管黏膜炎症 |
| 反流性食管炎 | reflux esophagitis / erosive esophagitis | GERD 的食管黏膜炎症表现,内镜下可见黏膜破损 |
| 巴雷特食管 | Barrett’s esophagus | GERD 的并发症,食管下段鳞状上皮被柱状上皮取代 |
| 息肉 | polyp | 黏膜表面突出的赘生物,结直肠息肉是结直肠癌前期病变 |
| 结直肠癌 | colorectal cancer | 起源于结肠或直肠的恶性肿瘤 |
| 内窥镜 | endoscopy | 经自然腔道插入内镜观察消化道内部 |
| 胃镜 | gastroscopy / upper GI endoscopy | 经口进入检查食管、胃、十二指肠 |
| 结肠镜 | colonoscopy | 经肛门进入检查结肠与直肠 |
| 图像分类 | image classification | 给整张图像分配一个类别标签 |
| 数据增强 | data augmentation | 通过几何/光度变换扩充训练样本 |
| 旋转 | rotation | 图像绕中心旋转,本文用 60° 与 90° |
| 水平翻转 | horizontal flip | 图像左右镜像 |
| 缩放 | scaling / resizing | 改变图像尺寸比例 |
| 亮度调整 | brightness adjustment | 改变整体明暗 |
| 错切 | shearing | 沿某一方向倾斜图像,产生剪切变形 |
| 双三次插值 | bicubic interpolation | 一种高质量图像重采样方法 |
| 四分类 | four-class classification | 类别数为 4 的分类任务 |
| 图像级标签 | image-level label | 标签作用于整张图,无位置信息 |
| 同一来源泄漏 | same-source leakage | 同源派生样本跨训练/测试集造成的信息泄漏 |
| 非商业 | NC / non-commercial | 许可条款,禁止商业使用 |
| 禁止演绎 | ND / no derivatives | 许可条款,禁止发布改动版本 |
| 伦理审查委员会 | REC / Research Ethics Committee | 机构内负责研究伦理审批的委员会 |
| 知情同意 | informed consent | 患者同意其数据被用于研究 |
| 去标识化 | de-identification | 移除可识别患者身份的信息 |
2.6 为什么"GERD"和"息肉"能放进同一个数据集
乍看之下,GERD(食管疾病)与息肉(结直肠疾病)分属消化道两端,放一起似乎牵强。但放在内镜 AI的语境里,这个组合有内在逻辑:
- 同一成像模态:两者都是用白光内镜(white-light endoscopy)在消化道腔内拍摄的彩色图像,视觉特征相似(黏膜、血管、腔壁),共享大量底层表征。
- 同一临床流程:一次消化道内镜检查可以同时上、下消化道(胃镜 + 结肠镜,或分次进行),四类标签对应内镜医生在报告里最常写的几种结论。
- 同一建模范式:都是"病变 vs 正常"的判别问题,可以共享网络骨架与训练策略,研究"多部位共享模型"的可行性。
- 互补的临床价值:GERD 关联食管腺癌风险,息肉关联结直肠癌风险——都是"内镜可及、早筛有效"的病变,AI 辅助筛查的收益面重叠。
当然,这种"跨部位合体"也有代价:模型可能学到"图像整体色调/构图"来判断部位(食管图与结肠图在色温、腔径上有系统差异),从而在"GERD vs GERD Normal"细分时反而有偏。这是使用四类框架时要留意的(详见 §7、坑 7)。
2.7 消化道内镜 AI 的背景
要理解 GastroEndoNet 的位置,需要一点消化道内镜 AI 的背景知识。
上消化道侧(食管-胃):AI 研究集中在食管癌/巴雷特食管筛查、幽门螺杆菌相关胃炎识别、早期胃癌检出等。GERD 及其并发症(反流性食管炎、巴雷特食管)是食管腺癌的前驱,内镜下可见黏膜破损、齿状线上移等特征,是分类模型的可学目标。但公开的"纯 GERD"分类数据集稀缺,GERD 多作为大合集里的一个子类出现。
下消化道侧(结直肠):这是内镜 AI 最成熟的战场,息肉检测/分类已是 FDA 获批产品的功能(如结肠镜 AI 辅助检测)。息肉按形态(Paris 分型)、按病理(腺瘤性/增生性)、按大小(≤5mm / 5-10mm / >10mm)多个维度分类,公开数据集众多(库内就有 5 个以上)。
GastroEndoNet 的差异:它不做检测(无框)、不做分割(无掩码),只做四类图像级分类,且刻意把食管侧与结肠侧配齐。它更像一个"多部位分类打通实验"的素材包,而非"专攻某一任务的高精度基准"。
2.8 数据集命名与编号规律
- Mendeley Data 的 DOI 结构:
10.17632/<8位字母数字>.3,末尾.3表示版本号 3。换成.1、.2即指向 v1、v2。引用时务必带版本号,否则会指向"最新版"(默认 v3),与文献里的 v1 口径不符(坑 4)。 - Data in Brief 的卷期:Vol. 60, 111572,是 2025 年的 60 卷 111572 号文章。DOI 后缀
10.1016/j.dib.2025.111572里的年份 2025 与在线发表日期一致。 - 库内 slug 命名:全小写连写(
gastroendonet),与官方名的大小写形式不同,但这是千方病案医数集的统一规范。
§3 机构与人物:谁做了 GastroEndoNet
3.1 七位作者
论文署名 7 位作者,机构高度集中于孟加拉两所大学:
- Abu Kowshir Bitto —— Daffodil International University;
- Md Hasan Imam Bijoy —— 通讯/团队核心之一,Daffodil International University;
- Kamrul Hassan Shakil —— Daffodil International University;
- Aka Das —— Daffodil International University;
- Khalid Been Badruzzaman Biplob —— Daffodil International University;
- Imran Mahmud —— Daffodil International University 信息科学与技术学院;
- Sayed Md. Minhaz Hossain —— Premier University(Chattogram)。
(注:作者的具体分工论文未逐一细列,以上角色标注以署名与机构页为准;数据采集由合作医院内镜室完成。)
3.2 机构地图
| 机构 | 角色 | 位置 |
|---|---|---|
| Daffodil International University (DIU) | 数据归属与论文主力单位;FSIT 学院 | 孟加拉 Dhaka |
| Premier University | 合作单位(论文作者之一) | 孟加拉 Chattogram |
| Zainul Haque Sikder Women’s Medical College & Hospital | 数据采集地(内窥镜室) | 孟加拉 Dhaka,Gulshan-2,Road-104 House-5 |
注意:数据采集发生在 Zainul Haque Sikder Women’s Medical College & Hospital,而数据归属与论文由 Daffodil International University 主导。引用时不要把采集医院当作数据归属机构。
3.3 一处必须澄清的来源地
这个数据集的所有图像都采自孟加拉国(Bangladesh),具体是 Dhaka 市的 Gulshan-2 区。它是南亚人群的内窥镜数据,不得与印度、中东或其他地区的内镜数据集混淆。人群特征是评估泛化性时的关键变量——一个在孟加拉女性医疗中心患者身上训练的模型,迁移到其他种族/性别分布的人群时性能可能变化(坑 8)。
3.4 时间线
| 时间 | 事件 |
|---|---|
| 2024-08-24 | 伦理批号 REC-FSIT-2024-08-24 获批(Daffodil International University) |
| 2024-10-07 | Mendeley Data v1 首发(27,624 张,primary 4,604) |
| 2025-02-26 | Mendeley Data v2(去重后条目) |
| 2025-02-27 | Mendeley Data v3(24,036 张,primary 4,006) |
| 2025(Jun) | 论文发表:Data in Brief, Vol. 60, 111572 |
| 2025-06-04(前后) | PMID 40470347 / PMC12136698 索引完成 |
| 2025(15, 2714) | 第三方 Diagnostics 论文引用 v1 口径(accessed 2025-02-03) |
3.5 研究脉络与团队背景
GastroEndoNet 的作者团队(以 Daffodil International University 为核心)在内窥镜/胃肠影像方向有连续产出。从公开检索看,该组围绕消化道内镜做过多个数据集与分类工作:穿孔检测(perforation detection)、息肉分类、胃部疾病分类等。GastroEndoNet 可以看作他们把 GERD + 息肉两个任务"合体" 的产物——不是在方法上创新,而是在数据组织上做了一个"跨部位四类配对"的整合。
这带来一个用户视角的判断:这个团队的强项是"数据集工程"与"可获取性"(把数据整理清楚、公开发布、免注册直下),而不是"方法新颖性"。使用它时,把它当作素材与起点,而不是权威基准,是更稳妥的预期。
3.6 数据采集的临床背景
数据采自一家女性医疗中心(Women’s Medical College & Hospital),这提示患者群体以女性为主(论文未明确披露性别分布,仅从机构名称推断)。采集在内窥镜室常规检查中完成,图像去标识化后整理入库。伦理审批由 Daffodil International University 的伦理审查委员会(REC-FSIT)以批号 REC-FSIT-2024-08-24 批准。患者的知情同意按机构流程取得(论文表述为符合机构与伦理要求)。
使用提示:机构名含"Women’s"意味着样本可能以女性患者为主,若用于研究性别相关的消化道疾病差异,需注意样本选择的偏向性;反过来说,若研究本就不涉及性别,这一偏向影响有限,但"单性别中心"仍是一个外部效度限制(§10 存照)。
§4 数据构成的硬数字
4.1 规模与分布
v3 口径(最新,本文默认口径):
| 类别 | 原始图数 | 增强倍数 | 增强后总数 |
|---|---|---|---|
| GERD | 974 | ×6 | 5,844 |
| GERD Normal | 1,103 | ×6 | 6,618 |
| Polyp | 779 | ×6 | 4,674 |
| Polyp Normal | 1,150 | ×6 | 6,900 |
| 合计 | 4,006 | ×6 | 24,036 |
自洽校验:974 + 1,103 + 779 + 1,150 = 4,006(✓);5,844 + 6,618 + 4,674 + 6,900 = 24,036(✓);4,006 × 6 = 24,036(✓)。
v1 口径(首发版,供存照):
| 类别 | 原始图数 | 增强后总数 |
|---|---|---|
| GERD | 1,076 | 6,456 |
| GERD Normal | 1,168 | 7,008 |
| Polyp | 1,188 | 7,128 |
| Polyp Normal | 1,172 | 7,032 |
| 合计 | 4,604 | 27,624 |
两套四类数字逐类都不同,说明 v2/v3 的"去重"是按类别做过的,不只是删掉重复文件。第三方文献 Diagnostics 2025, 15, 2714 引用 v1 的四类 1,076 / 1,168 / 1,188 / 1,172,与原 v1 页一致(坑 3、存照 A/B)。
4.2 采集条件
- 采集地点:孟加拉 Dhaka 市 Gulshan-2 区(Road-104, House-5, Dhaka-1212)的 Zainul Haque Sikder Women’s Medical College & Hospital (Pvt.) Ltd. 内窥镜室。
- 设备:Olympus EVIS EXERA III(含 GIF-190 胃镜)+ Pentax Medical EG29-i10。两代、两厂商设备混合。
- 成像模态:白光内镜(white-light endoscopy)彩色图像。
- 部位:上消化道(食管,GERD 相关)与下消化道(结直肠,息肉相关)。
- 采集期:论文未逐图披露具体日期跨度;伦理批号日期为 2024-08-24,数据首发 2024-10-07,故采集应在 2024 年内完成(具体区间未公开)。
4.3 图像规格
- 统一分辨率:512 × 512 像素。
- 原始像素范围:440–960(长边/短边),经 bicubic(双三次插值) 重采样至 512×512。
- 格式:JPG,单文件单图。
- 元数据:无 DICOM 标签,无 EXIF 临床信息(已去标识)。
- 色彩:彩色(RGB)。
关于 440–960 的说明:论文提到原始图像像素尺寸分布在 440–960 之间,但未说明这个范围是全量统计还是抽样统计(遗留疑点)。统一缩放到 512×512 后,原本小于 512 的图像被放大、大于 512 的被缩小,都可能引入重采样模糊或锯齿,这对细粒度病变识别(尤其小的平坦型息肉)可能有影响。
4.4 类别分布的显著边界情况
- 最平衡的类:GERD Normal(1,103)与 Polyp Normal(1,150)是最大的两类,说明"正常对照"样本采集较充分。
- 最少的类:Polyp(779)最少,比最多的 Polyp Normal(1,150)少约 32%。
- 最不平衡比:Polyp : Polyp Normal ≈ 779 : 1,150 ≈ 1 : 1.48。相比动辄 1:10 以上的极端不平衡内镜数据集,这个比例算温和,但仍会带来"正常类主导"的风险(§7)。
- 部位平衡:食管侧(GERD + GERD Normal = 974 + 1,103 = 2,077)与结肠侧(Polyp + Polyp Normal = 779 + 1,150 = 1,929)几乎对半,说明设计上刻意做了部位平衡。
- 病变 vs 正常平衡:病变类(GERD + Polyp = 974 + 779 = 1,753)vs 正常类(GERD Normal + Polyp Normal = 1,103 + 1,150 = 2,253),比例约 1 : 1.29,正常类略占多数。
4.5 数字口径冲突(存照)
冲突一:primary 数。
- 论文 Abstract、PMC12136698、Mendeley v3 页:4,006(总计 24,036);
- Mendeley v1 页(2024-10-07)、Diagnostics 2025, 15, 2714:4,604(总计 27,624)。
- 判定:版本差,非笔误。v3 比 v1 少 598 张 primary(去重的结果)。
冲突二:四类分布。
- v3:974 / 1,103 / 779 / 1,150;
- v1:1,076 / 1,168 / 1,188 / 1,172。
- 判定:逐类不同,属版本差;引用第三方论文数字时须核对其引用的版本(URL 末尾
/1表示 v1)。
冲突三:文件体积。
- Mendeley v3 页:
Augmented_Resized Image.zip1.51 GB +Original Image.zip759 MB ≈ 2.24 GB。 - 判定:以 Mendeley v3 页为准;不同镜像或缓存若显示他值,须以官方页复核(存照 D)。
4.6 与其他公开消化道内镜数据集的规模对比
| 数据集 | 图像/样本量 | 任务 | 部位 | 标注粒度 |
|---|---|---|---|---|
| GastroEndoNet | 24,036(原始 4,006) | 四分类 | 食管 + 结肠 | 图像级 |
| HyperKvasir | 10,662 | 分类 + 分割 | 全消化道 | 图像级 + 掩码 |
| Kvasir-SEG | 1,000 | 分割 | 结肠 | 像素级掩码 |
| CVC-ColonDB | 380 | 检测/分割 | 结肠 | 掩码 + 框 |
| PolypGen | 3,762 | 检测/分割 | 结肠多中心 | 掩码 |
| LDPolypVideo | 40,266 帧 | 视频检测 | 结肠 | 框 |
| GastroVision | 8,000+ | 多类分类 | 上/下消化道 | 图像级 |
解读:GastroEndoNet 的 24,036 在"张数"上不算小,但若看独立原始图(4,006),它的规模落在中等区间——比 Kvasir-SEG(1,000)、CVC-ColonDB(380)大,但远小于 HyperKvasir(10,662)、LDPolypVideo(40,266 帧)。把 24,036 与 HyperKvasir 的 10,662 直接比"谁大"是不恰当的:前者含 6 倍增强副本,后者是独立图像。
4.7 数据文件的组织形式(据 Mendeley 页面)
Mendeley Data 页面提供两个压缩包:
Augmented_Resized Image.zip(1.51 GB):包含增强并缩放后的图像,即全部或大部分 24,036 张(含原始图对应的缩放版本 + 6 种增强副本),按四类分目录组织。Original Image.zip(759 MB):包含原始图像(4,006 张),即未经增强的"干净"版本。
组织推断:两个包分开命名,暗示发布方也希望使用者能拿到"原始 vs 增强"的清晰区分——这对按原始文件去重划分(坑 6)是有利的。建议以 Original Image.zip 为划分依据、以 Augmented_Resized Image.zip 为训练扩增池。
4.8 数据质量与增强工艺的讨论
4.8.1 增强的六种变换
论文明确的六种增强:60° 旋转、90° 旋转、水平翻转、缩放、亮度调整、错切。按性质可分为两组:
- 几何变换:60° 旋转、90° 旋转、水平翻转、缩放、错切——改变像素空间位置;
- 光度变换:亮度调整——改变像素强度。
评价:这六种都是标准且相对温和的增强。使用它们的好处是提升模型对视角、尺度、明暗的鲁棒性;局限是它们不引入新的解剖结构或病理形态——旋转一张息肉图不会产生"另一种息肉"。因此增强副本不能替代真实数据多样性,尤其不能解决"单中心、单人群"的根本局限。
4.8.2 增强带来的"类别与部位耦合"风险
由于四个类别本身对应"食管/结肠 × 病变/正常",而食管图与结肠图在白光内镜下有系统的外观差异(腔径、色温、黏膜纹理),模型有可能走捷径:先用"这是食管还是结肠"的外观线索判断部位,再用"病变还是正常"的线索判断类别。这种"部位捷径"在四类框架下可能让"部位判定"异常容易,但对真正的"GERD vs GERD Normal"细分类未必有辅益。评测时应报告按部位的混淆矩阵,而不是只看四分类总体准确率(坑 7)。
4.8.3 与"金标准"概念的关系
GastroEndoNet 的标签是图像级单标签,来自内镜检查的临床结论(病变/正常)。它不是像素级病理金标准——没有病理活检对照、没有多专家共识标注记录。这意味着标签可能与病理真值存在偏差(如内镜下判为正常、活检却发现早期病变)。对于只做"分类模型打通实验"的用法,这个偏差可以接受;对于"评估诊断精度"的用法,须谨慎(§7.6)。
4.8.4 数据偏倚的维度
| 偏倚维度 | 具体情况 |
|---|---|
| 机构偏倚 | 单中心(Zainul Haque Sikder Women’s Medical College & Hospital) |
| 地理偏倚 | 单国(孟加拉 Dhaka) |
| 人群偏倚 | 女性医疗中心,可能以女性患者为主 |
| 设备偏倚 | 仅两款设备(Olympus + Pentax),无跨厂商多样性 |
| 时间偏倚 | 采集集中于 2024 年 |
| 任务偏倚 | 仅图像级分类,无检测/分割 |
4.8.5 图像格式与存储的考量
512×512 JPG 的存储效率高(原始包仅 759 MB / 4,006 张约 190 KB/张),便于快速下载与本地训练。代价是:JPG 是有损压缩,对高频细节(细小血管、微小平坦病变)有损失;且统一缩放到 512×512 会让原始分辨率较高的图(如 960)损失细节。若研究关注微小病变,建议向作者索取更高分辨率原图(但 ND 许可可能限制再分发)。
4.8.6 采集设备的混合含义
Olympus EVIS EXERA III(GIF-190)与 Pentax Medical EG29-i10 是两代不同厂商的设备。混合采集的好处是带来一定的设备多样性;坏处是"设备"与"部位/类别"可能耦合(例如若某设备主要拍胃镜、另一设备主要拍结肠镜),从而让模型学到"设备指纹"而非"病变特征"。论文未披露各设备在各类别下的采样分布(遗留疑点)。
4.9 数据规模在深度学习语境下的再评估
4.9.1 4,006 张原始图够不够?
对于"从头训练"(training from scratch)一个中等规模的 CNN,4,006 张(每类 779–1,150)是偏少的——现代内镜分类模型常在数万张独立图像上训练。这也是为什么数据集提供了 6 倍增强:扩充到 24,036 张能缓解过拟合,但增强副本的"信息增益"低于同等数量的独立图像。
4.9.2 患者级样本量的影响
论文未披露 4,006 张原始图来自多少例患者(遗留疑点)。若平均每例贡献多张(如同一患者多角度、多时间点),则"独立患者数"可能远小于 4,006,模型评估的统计效力受限,且"同一患者跨集"的泄漏风险上升。这是本数据集最需要补足的信息之一。
4.9.3 与后续大规模内镜数据集的对比
近年内镜 AI 数据集向"更大、更多中心"发展(如 PolypGen 的多中心设计、GastroVision 的多类覆盖)。GastroEndoNet 的定位不是"最大",而是"门槛最低 + GERD 覆盖"——它在可获取性(免注册直下)上优于许多同类,适合作为入门与快速验证的素材。
§5 任务与标注:一次覆盖四类分类
5.1 任务定义
GastroEndoNet 的核心任务是四分类图像分类(four-class image classification):
- 输入:一张 512×512 内窥镜图像;
- 输出:四个类别之一——GERD / GERD Normal / Polyp / Polyp Normal。
这个设计是"2 × 2 配对":两个解剖部位(食管、结肠)× 两个状态(病变、正常)。它天然支持三种评测视角:
- 四分类:直接分四类,考察模型能否同时区分部位与状态;
- 二分类(病变 vs 正常):合并为"异常(GERD ∪ Polyp)vs 正常(GERD Normal ∪ Polyp Normal)",考察病变判别能力;
- 部位内二分类:在食管内做"GERD vs GERD Normal",在结肠内做"Polyp vs Polyp Normal",考察细分类能力。
论文保留原始四类标签,因此三种视角都可从同一标签体系派生。
5.2 标注内容逐项拆解
| 标注项 | 有无 | 粒度 | 说明 |
|---|---|---|---|
| 类别标签 | ✓ | 图像级单标签 | 四类之一 |
| 增强类型标记 | 隐含 | 文件名/目录 | 6 种增强通过文件命名区分 |
| 病灶边界框 | ✗ | — | 无 |
| 分割掩码 | ✗ | — | 无 |
| 多标签 | ✗ | — | 每图仅一标签 |
| 患者 ID | ✗ | — | 未披露 |
| 病理对照 | ✗ | — | 无活检金标准 |
| 临床元数据 | ✗ | — | 无年龄/性别/病史 |
结论:标注是最小可用的分类监督。这既是它的简洁优点(易上手),也是它的能力边界(不能做定位或像素级任务)。
5.3 标注工具与流程
论文未详细披露标注工具与标注人员资质(如是否由内镜医生标注、是否有多人复核、Kappa 一致性如何)。从数据性质推断,类别标签应来自内镜检查的临床结论(内镜医生在检查中判断为 GERD/正常/息肉/正常),而非事后专门标注。关键缺口:无标注一致性报告(遗留疑点)。
5.4 四类标签的临床含义
| 类别 | 部位 | 状态 | 临床含义 | 相关风险 |
|---|---|---|---|---|
| GERD | 食管 | 病变 | 反流性食管炎/食管黏膜损伤 | 食管腺癌前驱 |
| GERD Normal | 食管 | 正常 | 无 GERD 表现的食管 | — |
| Polyp | 结直肠 | 病变 | 结直肠息肉 | 结直肠癌前驱 |
| Polyp Normal | 结直肠 | 正常 | 无息肉的结直肠 | — |
重要提示:这里的"Normal"是该部位的正常(食管正常 / 结肠正常),不是"同一个正常类"。四类框架的隐含假设是模型能区分"食管正常"与"结肠正常"——这在视觉上通常不难(部位外观差异大),但要注意别把"部位判别"当成"病变判别"的替身(§4.8.2、坑 7)。
5.5 从标注到建模:三类任务的数据流
路径一(四分类):
输入 512×512 JPG → CNN 骨干 → 4 类 softmax → 交叉熵损失
适用于"多部位分类打通"实验。注意类别不平衡与部位捷径。
路径二(二分类病变检测):
四类标签 → 合并{病变: GERD+Polyp, 正常: GERD Normal+Polyp Normal} → 二分类
适用于"AI 能否识别消化道异常"的一般问题。
路径三(部位内细分类):
先按部位分组 → 食管组做 GERD/GERD Normal 二分类;结肠组做 Polyp/Polyp Normal 二分类
最贴近临床(“已知在做胃镜,判断有无 GERD”),但需要模型或流程先确定部位。
5.6 评测协议的必备要素
由于无官方划分,使用者须自行设计协议,最低要求:
- 按原始文件去重:先以
Original Image.zip的 4,006 张为"独立单元",把每张原始图连同其 6 个增强副本整组分到 train 或 test——绝不能把同一原始图的增强副本分到不同集合(坑 6)。 - 类别分层:保持四类在 train/val/test 的比例一致(或明确报告不平衡处理策略)。
- 部位分层报告:单独报告食管侧与结肠侧的指标。
- 多次随机种子:报告均值±标准差,避免单次划分的偶然性。
5.7 标注质量与标签体系的可信度
可信之处:标签类别清晰(四类),来源是临床结论,非众包随意标注。
存疑之处:
- 无专家数量与一致性(Kappa)报告;
- 无病理对照,无法验证"内镜判正常"是否为病理正常;
- 无标注工具与流程细节;
- 无患者级标签(无法评估同一患者的标签一致性)。
实践建议:把标签当作"内镜医生当时判断"的代理,而非"病理金标准"。做临床决策相关研究时,须在论文里明确这一局限(§10 存照、坑 8)。
5.8 标注成本与数据集工程的启示
5.8.1 标注工作量
GastroEndoNet 只需要图像级类别标签,因此标注成本低(一次检查的结论即可标注多张图)。这正是它能把 4,006 张原始图整理打包的原因——相比像素级掩码(一张图数十分钟),图像级标签几乎是"顺手记录"。代价是信息量低。
5.8.2 与"标注流水线式"数据集的对比
像 PANDA-PLUS(库内 panda-plus)那样做像素级注释的数据集,需要"学生初注 + 高年级复核 + 专家终审"的多层流水线,成本高但有细粒度价值。GastroEndoNet 走的是相反的路线:低成本、粗粒度、快速发布。两者没有优劣,只有适用场景不同——要像素级分析就别选 GastroEndoNet,要快速起步就用它。
5.8.3 数据集工程的三条经验
- 明确"原始 vs 增强"的计数:GastroEndoNet 明示了这点(分两个 zip),是好的实践;使用者要善用。
- 披露版本差异:v1→v2→v3 的变化应被引用者知悉,本文以双口径存照承接。
- 披露患者级信息:GastroEndoNet 在此有缺口(未披露患者数),这是后续数据集可改进之处。
§6 获取与许可:版本链与三口径冲突
6.1 获取渠道
GastroEndoNet 的获取门槛极低——这是它的核心优势之一。
| 渠道 | 地址 | 是否需要注册/申请 | 内容 |
|---|---|---|---|
| Mendeley Data(主) | DOI 10.17632/ffyn828yf4.3 |
否(公开直下) | 两个 zip 包(增强 + 原始) |
| 论文 | DOI 10.1016/j.dib.2025.111572(PMC12136698) |
否(开放获取) | 数据描述与规格说明 |
| 机构页 | Daffodil International University 相关实验室页 | 否 | 项目介绍与旁证 |
| 第三方索引 | ArxivLens、DOAJ(Kabale 大学图书馆记录) | 否 | 元数据索引 |
实操:直接访问 Mendeley Data 页面,点击下载 Augmented_Resized Image.zip(1.51 GB)与 Original Image.zip(759 MB)。无需注册、无需邮件申请、无需签署 DUA(数据使用协议)。这在临床数据集中属于最开放的一档——与 MIMIC-IV(需 CITI 培训 + 认证)、TCIA 部分集合(需申请)形成鲜明对比。
6.2 许可:一处必须存照的三口径冲突
| 来源 | 许可表述 | 是否含 ND |
|---|---|---|
| Mendeley Data 数据集页(权威) | CC BY-NC-ND 4.0 | 含 |
| 论文刊物侧(Europe PMC 元数据) | cc by-nc | 不含 |
| OpenAIRE 索引 | CC BY NC | 不含 |
判定原则:数据集许可以数据集托管页(Mendeley Data)为准,即 CC BY-NC-ND 4.0。理由:论文刊物元数据描述的是论文文本的许可,不是数据集本体的许可;数据集本体的许可由实际托管方声明。
CC BY-NC-ND 4.0 的含义:
- BY(署名):使用须注明出处;
- NC(非商业):不得用于商业目的;
- ND(禁止演绎):不得发布基于本数据集的改动版/衍生版,再分发须原样。
ND 的实务影响(重要):
- 你可以用它训练模型、发表研究结果(这是"使用",不是"发布演绎版");
- 你不可以把"重新划分/重新标注/子集化"的数据集版本公开发布;
- 你不可以把原图裁剪、拼接、再加工后作为新数据集分发;
- 若需发布衍生数据集,须联系版权方另行取得授权(作者论文可能提供许可豁免,需以官方答复为准)。
合规三步核实法:(1)以 Mendeley 页当前标注为准(许可可能更新);(2)查阅论文的 rights 声明;(3)如涉商用或衍生发布,邮件联系通讯作者确认。切勿仅凭第三方索引的 “CC BY NC” 就当作可商用或无 ND 限制。
6.3 版本链与衍生谱系
v1(2024-10-07) 27,624 张 / primary 4,604
│ 去重
v2(2025-02-26) 条目收缩(具体数字未在页面完整披露)
│ 去重/整理
v3(2025-02-27) 24,036 张 / primary 4,006 ← 论文与 Entry 采用
引用规范:引用时必须带版本号。DOI 10.17632/ffyn828yf4 不带后缀默认指向最新版(v3);若引用文献里的 v1 数字(4,604),应写 10.17632/ffyn828yf4.1。DataCite DOI 支持版本后缀,这是核验口径的关键(坑 4)。
6.4 其他访问方式
- 镜像:经 hf-mirror.com 检索与 WebSearch 双查,未发现 GastroEndoNet 的 HuggingFace 官方或社区镜像(遗留疑点 1)。因此目前唯一权威入口是 Mendeley Data。
- 论文附录:Data in Brief 论文可能附数据字典与文件清单,可作为组织方式的参照。
- 免注册直下带来的"无使用追踪":与需要注册的数据集不同,GastroEndoNet 无法统计下载量/使用量,因此"引用度"只能靠文献引用间接估计。
6.5 训练/测试划分
无官方划分。论文未提供 train/val/test 文件,也无划分脚本。因此所有划分都是使用者自定。最重要的划分原则见 §5.6 与坑 6:按原始文件去重划分。
6.6 获取决策树
需要消化道内镜图像做分类?
├─ 要像素级掩码/边界框? → 否,本数据集无 → 改用 Kvasir-SEG / CVC-ColonDB / PolypGen
├─ 要 GERD 标签? → 是,本数据集有 GERD 类 → 继续
│ └─ 要"病变 vs 正常"配对设计? → 是 → 本数据集适用
├─ 要做商用产品或发布衍生数据集? → 谨慎:NC + ND 双重限制,须另行授权(坑 5)
├─ 关心跨中心泛化? → 本数据集单中心,须额外验证(坑 8)
└─ 只想快速起步/打通实验 → 本数据集最合适(免注册直下)
6.7 许可问题对研究可复现性的影响
ND 条款带来一个微妙的可复现性张力:你可以复现别人的实验结果,但不能"冻结并重新发布"你用的数据快照。这意味着:
- 论文里若说"使用 GastroEndoNet v3",读者须自行去 Mendeley 下载 v3——但若未来 Mendeley 只保留最新版,v3 可能不易获取;
- 版本间的数字差异(4,006 vs 4,604)会直接影响实验规模,必须写明版本,否则复现者可能下错版本。
实践建议:论文方法部分明确写"GastroEndoNet v3(DOI 10.17632/ffyn828yf4.3),原始图 4,006 张",并记录下载日期,便于他人核对。
6.8 与库内可获取性光谱的对照
| 获取难度 | 代表条目 | 机制 |
|---|---|---|
| 最开放(免注册直下) | GastroEndoNet、CVC-ColonDB、Kvasir-SEG | 公开链接 |
| 需平台账号 | HyperKvasir、GastroVision | 平台注册 |
| 需申请/DUA | PolypGen、部分 TCIA 集合 | 申请审批 |
| 需培训认证 | MIMIC-IV 系 | CITI + 认证 |
GastroEndoNet 处于"最开放"一档,这在内镜数据集里是不小的加分项——许多息肉数据集需要向作者申请或经平台审核。
§7 评估与基准:原论文的可学性验证
7.1 论文的定位:可行性验证而非权威基准
Data Article 的惯例是给出少量分类实验证明"数据集可学",而非建立 leaderboard。GastroEndoNet 论文即按此惯例,用 CNN 类模型做四分类实验,报告 accuracy / precision / recall / F1 等常规指标,用以说明"这些数据能训练出有判别力的模型"。这些数字是"可行性证据",不是"必须超越的 benchmark"。
重要提醒:由于论文未公开固定的划分脚本与随机种子,论文报告的数值无法被严格复现(划分不同则数值不同)。因此不要把论文数值当作"官方分数线"来对标——这是 Data Article 型数据集的通病(坑 7)。
7.2 常规评测指标
四分类任务的标准指标:
| 指标 | 定义 | 关注点 |
|---|---|---|
| Accuracy | 全类正确率 | 整体表现,但受类别不平衡影响 |
| Precision(per-class) | 预测为该类的样本中真正是该类的比例 | 假阳性代价 |
| Recall(per-class) | 该类样本中被正确识别的比例 | 假阴性代价(医学上常更重要) |
| F1(per-class / macro) | Precision 与 Recall 的调和平均 | 平衡两类错误 |
| Confusion Matrix | 4×4 混淆矩阵 | 看错分模式(部位混淆?病变混淆?) |
| AUC(per-class, one-vs-rest) | ROC 曲线下面积 | 阈值无关的判别力 |
医学场景建议:优先报告 per-class recall。因为"漏诊一个息肉/GERD"的代价高于"误报一个正常",总体 accuracy 会被占比最大的正常类主导而掩盖漏诊问题。
7.3 预期的性能结构与陷阱
结构预期:
- 四分类中"部位判别"(食管 vs 结肠)通常较易,因为外观差异大;
- 真正的难点在部位内细分类(GERD vs GERD Normal;Polyp vs Polyp Normal),这些类间差异更细微;
- 因此四分类总体 accuracy 可能"虚高"——高 accuracy 可能主要来自部位判别,而非病变判别。
陷阱:若只看四分类 accuracy,可能得出"模型很好"的错觉。必须分解:分别报告食管侧、结肠侧的混淆矩阵与 F1。
7.4 同源泄漏:最致命的评测陷阱
问题:如果按"图像"随机划分 train/test,那么同一张原始图的一个增强副本可能在 train、另一个在 test。由于两者是同源变换(只是旋转/翻转/调亮),test 样本的"近亲"就在 train 里——模型记住了近亲,就能在 test 上拿高分。这不是真实泛化能力,而是记忆泄漏(memorization leakage)。
后果:报告的指标会显著虚高,且越依赖增强的数据集虚高越严重。GastroEndoNet 的 24,036 中有 20,030 是增强副本,泄漏风险极高。
正确做法:
1. 以 Original Image.zip 的 4,006 张为"独立单元";
2. 为每张原始图建立 "原始图 → 其 6 个增强副本" 的映射(按文件名);
3. 整组(原始 + 6 增强)分到 train 或 test;
4. 绝不拆散同一组。
这是使用本数据集的第一要务(坑 6)。
7.5 类别不平衡的处理
Polyp(779)与 Polyp Normal(1,150)之比约 1:1.48。处理选项:
- 类别加权损失:给少数类更高权重;
- 重采样:过采样少数类 / 欠采样多数类(但注意别引入新的泄漏);
- 分层划分:保证各集类别比例一致;
- 报告 macro-F1:不被多数类主导。
不推荐:为提高少数类样本而"再生成增强副本"——因为原数据集已有 6 倍增强,再加增强会加剧同源比例,且不增加独立信息。
7.6 标签噪声与病理金标准缺失
由于标签来自内镜结论而非病理活检,存在标签噪声:内镜下"判为正常"的食管/结肠可能实际有显微镜下病变。这会给四分类设定一个性能天花板——即使模型完美,也只能逼近"内镜医生当时的判断",而非"病理真值"。
应对:在论文中明确定位——本数据集研究的是"内镜结论级"分类,而非"病理级"诊断。若要病理级,需数据集提供活检对照(本数据集无)。
7.7 建议的基准使用协议
若要在论文里把 GastroEndoNet 当基准用,建议的协议:
- 声明版本与规模:如 “GastroEndoNet v3, 4,006 original images”;
- 按原始文件去重划分(§7.4);
- 固定划分并公开划分文件(但不发布数据快照,遵守 ND);
- 报告四分类 + 部位内二分类两套指标;
- 报告 macro-F1 与 per-class recall;
- 多次种子取均值±标准差;
- 明确标签粒度局限(§7.6)。
7.8 后续研究在 GastroEndoNet 上的使用
第三方文献已在两代口径上引用 GastroEndoNet:
- Diagnostics 2025, 15, 2714(MDPI):引用 v1 口径(accessed 2025-02-03),写 “original 4604 images”,四类 1,076 / 1,168 / 1,188 / 1,172。用于息肉/GERD 分类与增强策略比较。
- 该引用坐实了 v1 口径在学术文献中的独立存在,是本文双口径存照的直接证据(存照 A/B)。
对使用者的启示:看到别人论文里写 4,604 别以为错了——那可能是引用了 v1。横向比较时先统一版本。
§8 坑点清单(Pitfalls):使用 GastroEndoNet 前必须知道的八件事
坑 1:GastroEndoNet 与 GastroVision 极易混淆,但绝不是别名
现象:两者名字都有 “Gastro”,都是消化道内镜分类数据集,检索时容易串。
真相:
- GastroEndoNet(本条目):孟加拉单中心,4,006 原始图 / 24,036 总量,四类(GERD / GERD Normal / Polyp / Polyp Normal),Mendeley Data 托管;
- GastroVision(库内 rid 203):另一数据集,类更多、来源不同。
规避:用 DOI(10.17632/ffyn828yf4)或精确名 “GastroEndoNet” 检索,勿用 “Gastro” 泛搜。
坑 2:把 24,036 当作"独立样本数"
现象:报告"我们用了 24,036 张内窥镜图像"。
真相:24,036 中只有 4,006 张是独立原始图,其余 20,030 张是 6 倍同源增强副本。
规避:报告规模时写"4,006 原始图(24,036 含 6 倍增强)",并说明增强倍数。
坑 3:类别分布有多套数字,必须核对版本
现象:看到 974/1,103/779/1,150 与 1,076/1,168/1,188/1,172 两套数字,不知哪个对。
真相:前者是 v3,后者是 v1。都"对",只是版本不同。
规避:引用时写明版本号与 DOI 后缀(.3 vs .1);本文 §4.1、§4.5 已双口径并存。
坑 4:Mendeley DOI 不带版本号会指向最新版
现象:文献里引用 10.17632/ffyn828yf4(无后缀),但期望的是 v1 数字。
真相:DataCite DOI 无后缀默认解析到最新版(v3)。要引用 v1 须用 .1。
规避:必须带版本后缀;核对文献数字时先确认其 URL 末尾版本。
坑 5:许可三口径冲突,ND 条款是隐藏的硬约束
现象:数据集页写 CC BY-NC-ND 4.0,某些索引写 CC BY NC,误以为可以发布衍生版。
真相:以数据集页为准 = NC + ND 双重限制。ND 意味着不得发布改动版/衍生版数据集。
规避:商用与衍生发布前必须核实并取得授权;训练模型与发表结果不受影响。
坑 6:不做原始文件去重划分 → 同源泄漏 → 指标虚高
现象:随机按图像划分 train/test,得到很高的准确率,但换真实场景就崩。
真相:同一原始图的增强副本被分到 train 与 test,模型靠"记忆近亲"得分。本数据集增强占 5/6,泄漏风险极大。
规避:按原始文件整组划分(原始 + 其 6 个增强副本同进同出)。这是使用本数据集最重要的操作(§7.4)。
坑 7:四分类高准确率可能主要来自"部位判别"而非"病变判别"
现象:四分类 accuracy 很高,便宣称"模型能识别 GERD 和息肉"。
真相:食管图与结肠图外观差异大,“区分部位"很容易;真正的难点是部位内的"病变 vs 正常”。
规避:分解报告——食管侧(GERD vs GERD Normal)与结肠侧(Polyp vs Polyp Normal)的分类指标单独给出;看混淆矩阵是否主要错在部位内。
坑 8:单中心单人群 + 零病理对照 → 泛化与真值双重局限
现象:在 GastroEndoNet 上训练得很好的模型,直接推广到其他医院数据。
真相:(1)数据来自孟加拉一家女性医疗中心,单中心、单人群、单国;(2)标签是内镜结论,无病理对照。
规避:跨中心/跨人群评估须另行验证;论文里明确"内镜结论级、非病理级"的定位。
坑 9(补充):错切(shearing)对解剖结构的扭曲
现象:把增强图当"真实图像"用,忽略了 shearing 会改变解剖比例。
真相:错切是几何变换,会扭曲内镜腔的真实形状。旋转、翻转保持形状,但缩放、错切改变几何比例。
规避:做需要准确形状/比例的任务(如病灶尺寸估计)时,优先用原始图,谨慎使用 shearing 增强副本。
坑 10(补充):把"免注册直下"当作"无任何限制"
现象:以为公开直下 = 公有领域,随意使用与再分发。
真相:免注册只是获取门槛低,与使用许可是两回事。CC BY-NC-ND 才是使用规则(坑 5)。
规避:区分"可获取"与"可商用/可演绎",勿混为一谈。
§8.9 坑点的组织逻辑
上述十个坑可分为三类:
- 计数类(坑 2、3、4):关于"数字怎么算"——规模、分布、版本;
- 评测类(坑 6、7):关于"怎么评"——泄漏、指标分解;
- 合规与定性类(坑 1、5、8、9、10):关于"怎么定性"——身份、许可、泛化、增强性质、获取与许可之别。
§8.10 一份可直接使用的检查清单
使用 GastroEndoNet 前,逐条打勾:
- [ ] 我引用的版本是 v3(4,006/24,036)还是 v1(4,604/27,624)?
- [ ] 我报告的规模是否区分了"原始"与"增强"?
- [ ] 我的 train/test 是否按原始文件去重划分?
- [ ] 我是否报告了部位内二分类指标,而非只看四分类 accuracy?
- [ ] 我是否核查了当前许可(CC BY-NC-ND 4.0)并遵守 NC + ND?
- [ ] 我是否说明了单中心/单人群的泛化局限?
- [ ] 我是否说明了标签为"内镜结论级"而非"病理级"?
- [ ] 我是否避免了把错切/缩放的增强图用于形状敏感任务?
§9 存照与待核
9.1 双口径/多口径冲突逐条存照
存照 A:primary 数量(v3 vs v1)
| 口径 | 来源 | primary | 总张数 |
|---|---|---|---|
| v3(最新) | 论文 Abstract、PMC12136698、Mendeley v3 页 | 4,006 | 24,036 |
| v1(首发) | Mendeley v1 页、Diagnostics 2025, 15, 2714 | 4,604 | 27,624 |
判定:版本差,非笔误。v2/v3 做了去重。处理:正文正交双写并标版本。
存照 B:四类分布(v3 vs v1)
| 口径 | GERD | GERD Normal | Polyp | Polyp Normal | 合计 |
|---|---|---|---|---|---|
| v3 | 974 | 1,103 | 779 | 1,150 | 4,006 |
| v1 | 1,076 | 1,168 | 1,188 | 1,172 | 4,604 |
判定:逐类不同,属版本差。第三方文献引用 v1,勿视为错误。处理:§4.1 双表并列。
存照 C:license 三口径
| 来源 | 表述 | 含 ND |
|---|---|---|
| Mendeley Data 数据集页(权威) | CC BY-NC-ND 4.0 | 是 |
| Europe PMC(论文刊物侧) | cc by-nc | 否 |
| OpenAIRE | CC BY NC | 否 |
判定:以数据集页为准。处理:§6.2 三口径并存 + 合规三步核实法。
存照 D:采集体积口径
| 来源 | 表述 |
|---|---|
| Mendeley v3 页 | 增强包 1.51 GB + 原始包 759 MB ≈ 2.24 GB |
判定:以 Mendeley v3 页为准;他处若显示不同值须复核。处理:§4.5 记录。
9.2 遗留疑点(查不到 / 待核)
- HuggingFace 镜像未最终确认:经 hf-mirror.com 检索与 WebSearch 双查,未发现 GastroEndoNet 的 HF 官方或社区镜像。hf-mirror.com 对非中国大陆 IP 会跳转原站,沙箱侧无法完整复核。结论:目前以 Mendeley Data 为唯一权威入口。
- v1→v2→v3 的"去重"规则未披露:论文只说明做了去重(规模从 4,604 收缩到 4,006),但未说明重复图判定算法/阈值(是感知哈希?像素级重复?近重复?)。无法评估去重是否可能误删有效样本。
- 患者级人数未披露:4,006 张原始图出自多少例患者、每例多少张,论文未给出。影响:无法评估患者级数据独立性,也无法评估"同一患者跨集泄漏"的风险。
- 原始像素范围 440–960 的取样口径未说明:是全量统计还是抽样统计,论文未明。
- 官方代码仓库未找到:未见明确的 GitHub 主仓(可能仅在论文附录或未公开)。划分脚本与基线代码的可得性存疑。
- 标注工具与标注人员资质未披露:无标注一致性(Kappa)报告,无法评估标签可靠性。
- 各设备在各类别下的采样分布未披露:Olympus 与 Pentax 两设备各拍了多少各类图像,未知,影响"设备-类别耦合"评估。
9.3 核验证据链(三源互证)
| 来源类型 | 具体来源 | 核验内容 |
|---|---|---|
| 数据托管页(一手) | Mendeley Data 10.17632/ffyn828yf4.3 |
规模 24,036 / primary 4,006、四类分布、体积、许可 CC BY-NC-ND 4.0 |
| 论文(一手) | Data in Brief, Vol. 60, 111572(DOI 10.1016/j.dib.2025.111572) | Abstract、规格、设备、伦理批号、增强方法 |
| 索引(二手核验) | PMC12136698 / PMID 40470347 | 论文元数据、摘要一致性 |
| 第三方文献 | Diagnostics 2025, 15, 2714(MDPI) | 坐实 v1 口径(4,604)被独立引用 |
| 机构页/索引 | DIU 实验室页、ArxivLens、Kabale 大学 DOAJ 记录 | 存在性旁证 |
9.4 生态互链点(库内条目 + rid)
同域(内窥镜/胃肠)强互链:
| 库内条目 | rid | 互链理由 |
|---|---|---|
| gastrovision | 203 | 胃肠内镜多类分类,同属"消化道内镜分类";含 GERD 亚类 |
| hyperkvasir | 693 | Kvasir 系最大胃肠内镜合集,含分类 + 分割,GERD/息肉均覆盖 |
| kvasir-seg | 112 | Kvasir 家族分割(息肉像素级掩码),与本条目的粗粒度分类互补 |
| kvasir-instrument | 213 | Kvasir 家族器械检测 |
| kvasir-capsule | 123 | Kvasir 家族胶囊内镜 |
| cvc-colondb | 142 | 息肉检测/分割,同任务不同粒度 |
| bkai-igh-neopolyp | 84 | 息肉分割 |
| ldpolypvideo | 163 | 息肉视频检测 |
| polypgen | 183 | 息肉检测/分割(多中心) |
| real-colon | 778 | 真实结肠检测 |
| endoscapes | 353 | 腹腔镜手术场景(跨科对照) |
| slam-3d-endoscopic | 82 | 内镜 SLAM/三维重建方向 |
互链理由分类:
- 同器官-同任务(息肉分类/检测):cvc-colondb、bkai-igh-neopolyp、ldpolypvideo、polypgen、real-colon;
- 同器官-不同任务(分割/器械/胶囊/SLAM):kvasir-seg、kvasir-instrument、kvasir-capsule、slam-3d-endoscopic、endoscapes;
- 同域-多类合集:gastrovision、hyperkvasir。
库内定位提示:GastroEndoNet 是本库首个以 GERD 为独立标签的条目,填补了 GERD 方向空缺(此前 GERD 仅作为 hyperkvasir、gastrovision 的子类出现)。落库后建议在上述条目的"相关数据集"段落补双向链接。
9.5 库内条目的生态对照
| 维度 | GastroEndoNet | HyperKvasir | Kvasir-SEG | PolypGen |
|---|---|---|---|---|
| 任务 | 四分类 | 分类 + 分割 | 分割 | 检测/分割 |
| 标注粒度 | 图像级 | 图像级 + 掩码 | 像素级 | 像素级 |
| 覆盖部位 | 食管 + 结肠 | 全消化道 | 结肠 | 结肠 |
| GERD 标签 | 有(独立类) | 有(子类) | 无 | 无 |
| 获取门槛 | 免注册 | 平台注册 | 免注册 | 申请 |
| 规模(独立图) | 4,006 | 10,662 | 1,000 | 3,762 |
| 中心数 | 单中心 | 单中心 | 单中心 | 多中心 |
§10 生态、影响与扩展阅读
10.1 学术影响
GastroEndoNet 于 2025 年中发表,属于新近发布的数据集,学术影响仍在积累中。从公开检索看,它已被内镜 AI 相关论文(如 Diagnostics 2025, 15, 2714)引用作为分类/增强策略研究的素材。作为 Data in Brief 的 Data Article,它的"影响力"更多体现在被用作方法验证的数据来源,而非成为领域标准基准。
10.2 在消化道内镜数据集谱系中的位置
消化道内镜数据集可按两个轴划分:
- 任务轴:分类 / 检测 / 分割;
- 覆盖轴:单部位 / 多部位 / 全消化道。
GastroEndoNet 落在"分类 + 多部位(食管 + 结肠)"的象限,且以 GERD 为差异化标签。它的邻居是 HyperKvasir(分类 + 分割 + 全消化道)与 GastroVision(多类分类 + 全消化道),但它的"病变 vs 正常配对"设计是自己独有的。
10.3 与其他内镜任务的交叉
- 与息肉检测:GastroEndoNet 提供息肉分类(有/无),可作为检测模型的分类头训练素材或预训练来源;
- 与 GERD 分级:本数据集只有二元(GERD / 正常),不含反流性食管炎的洛杉矶分级(LA grade A-D),无法直接做分级研究;
- 与多任务学习:四类的"部位 × 状态"结构天然适合多任务学习(部位分类 + 病变分类)的验证。
10.4 临床落地价值与局限
价值:
- 免注册直下,降低内镜 AI 研究的启动门槛;
- GERD 与息肉双覆盖,适合做"消化道异常筛查"的通用分类尝试;
- 四类配对设计清晰,便于教学与快速实验。
局限:
- 单中心、单人群,泛化性未验证;
- 图像级标签无定位信息,无法直接用于"病灶定位"类临床辅助;
- 无病理对照,标签精度上限为"内镜结论级";
- 增强占 5/6,独立信息量有限。
结论:GastroEndoNet 适合做教学、打通实验、增强策略研究、预训练素材;不适合做临床诊断精度的最终评测或跨中心泛化的权威验证。
10.5 扩展阅读路径
- 原始来源:Mendeley Data
10.17632/ffyn828yf4.3;论文 DOI10.1016/j.dib.2025.111572(PMC12136698)。 - 同域对照:本库 hyperkvasir(693)、gastrovision(203)、kvasir-seg(112)。
- 息肉任务:本库 polypgen(183)、cvc-colondb(142)、ldpolypvideo(163)。
- 方法论:关于数据增强与同源泄漏的讨论,见本条目 §7.4、坑 6。
10.6 一句话总结
GastroEndoNet 是一个"入门友好、覆盖跨界、组织清晰,但规模有水分、单源且许可偏严"的消化道内镜四分类数据集——用它起步很好,用它下结论需谨慎。
10.7 DAIMS 评估表
DAIMS(Data and AI Maturity/Interoperability/Metadata Score,本库用的数据集就绪度评估框架)逐项评估:
| # | 维度 | 评分 | 说明 |
|---|---|---|---|
| 1 | 数据可获取性 | ★★★★★ | 免注册直下,Mendeley Data 公开 |
| 2 | 许可清晰度 | ★★★☆☆ | 数据集页明确 CC BY-NC-ND 4.0,但三口径冲突需存照 |
| 3 | 元数据完整性 | ★★★☆☆ | 有论文规格说明,但缺患者级信息、缺划分文件 |
| 4 | 数据规模 | ★★★☆☆ | 24,036 张看似大,独立原始图仅 4,006 |
| 5 | 标注粒度 | ★★☆☆☆ | 仅图像级单标签,无框/掩码 |
| 6 | 标注质量证据 | ★★☆☆☆ | 无一致性报告、无病理对照 |
| 7 | 类别平衡性 | ★★★★☆ | 最不平衡比 1:1.48,较温和 |
| 8 | 任务多样性 | ★★☆☆☆ | 仅分类 |
| 9 | 泛化性证据 | ★★☆☆☆ | 单中心单人群,无跨中心验证 |
| 10 | 版本管理 | ★★★★☆ | Mendeley 有 v1/v2/v3 版本链与 DOI 后缀 |
| 11 | 伦理合规 | ★★★★☆ | 有伦理批号 REC-FSIT-2024-08-24,去标识 |
| 12 | 可复现性 | ★★★☆☆ | 数据可得,但无官方划分脚本,划分不可完全复现 |
| 13 | 文档说明 | ★★★★☆ | 论文规格说明较完整 |
| 14 | 社区使用度 | ★★☆☆☆ | 新近发布,影响在积累中 |
| 15 | 影像质量 | ★★★☆☆ | 512×512 JPG,有损压缩,原分辨率 440–960 |
| 16 | 多模态性 | ★☆☆☆☆ | 纯图像,无文本/临床元数据 |
| 17 | 患者级可追溯 | ★☆☆☆☆ | 未披露患者 ID 与人数 |
| 18 | 部位覆盖 | ★★★★☆ | 食管 + 结肠双部位 |
| 19 | 疾病覆盖 | ★★★☆☆ | GERD + 息肉,不含其他消化道疾病 |
| 20 | 标准化程度 | ★★★☆☆ | 统一 512×512,但无 DICOM/统一命名规范说明 |
| 21 | 更新维护 | ★★★☆☆ | 有版本迭代历史,后续维护未知 |
| 22 | 引用规范 | ★★★★☆ | DOI + 版本后缀支持明确引用 |
| 23 | 硬件门槛 | ★★★★★ | 2.24 GB,普通设备可处理 |
| 24 | 使用友好度 | ★★★★★ | 分类任务最简单,上手快 |
综合评级:适合入门与快速验证(可获取性、使用友好度均满分),但在标注粒度、泛化性证据、患者级信息上明显偏弱,属于"够用但不够精"的中等就绪度数据集。
10.8 附录:GastroEndoNet 关键事实速查表
| 事实 | 数值/内容 |
|---|---|
| 官方全称 | GastroEndoNet: An endoscopic image dataset for GERD and polyp detection |
| slug | gastroendonet |
| 论文 | Data in Brief, Vol. 60, 111572, 2025 Jun |
| 论文 DOI | 10.1016/j.dib.2025.111572 |
| PMID / PMC | 40470347 / PMC12136698 |
| Mendeley DOI | 10.17632/ffyn828yf4.3(v3) |
| 总量(v3) | 24,036 |
| 原始图(v3) | 4,006 |
| 总量(v1) | 27,624 |
| 原始图(v1) | 4,604 |
| 四类(v3) | 974 / 1,103 / 779 / 1,150 |
| 增强方式 | 60° 旋转、90° 旋转、水平翻转、缩放、亮度调整、错切 |
| 分辨率 | 512×512 |
| 原始像素 | 440–960(bicubic 缩放) |
| 格式 | JPG |
| 设备 | Olympus EVIS EXERA III(GIF-190)+ Pentax Medical EG29-i10 |
| 采集地 | Zainul Haque Sikder Women’s Medical College & Hospital, Gulshan-2, Dhaka-1212, Bangladesh |
| 归属机构 | Daffodil International University + Premier University |
| 作者数 | 7 |
| 伦理批号 | REC-FSIT-2024-08-24 |
| 许可 | CC BY-NC-ND 4.0 |
| 体积 | 1.51 GB(增强)+ 759 MB(原始)≈ 2.24 GB |
| 获取 | Mendeley Data 公开直下 |
| 官方划分 | 无 |
10.9 数据的可复现性讨论
10.9.1 复现原论文需要哪些材料
- Mendeley Data v3 的两个 zip 包;
- 论文的规格说明(类别定义、预处理链);
- 论文报告的模型与超参(若给出);
- 最难的一环:由于无官方划分脚本,复现者需自定划分——因此数值不可严格复现。
10.9.2 复现的常见失败点
- 下错版本:下了 v1(4,604)却对标论文 v3(4,006)的数字;
- 划分泄漏:按图像随机划分导致指标虚高,与论文数字不可比;
- 类别不平衡处理不同:加权/重采样策略不同会显著改结果;
- 预处理不同:是否在 512×512 上再归一化、用何种归一化,都会影响结果。
10.10 对消化道内镜 AI 领域的启示
- “张数"不是"信息量”:增强副本再多也不等于独立数据,报告规模应区分原始与增强——GastroEndoNet 明示了这点,值得其他数据集效仿,但引用者也须读懂。
- 可获取性是硬价值:免注册直下显著降低复现与比较的成本,很多"更大更权威"的数据集因获取门槛高而实际使用受限。
- "配对设计"值得推广:"病变 vs 同部位正常"的配对框架清晰、易评测,避免了多类混杂带来的解释困难。
- 单中心是通病:医学影像数据集普遍单中心,跨中心泛化是社区共同课题。
10.11 与其他消化道数据集的联合使用
- 与 HyperKvasir / GastroVision 联合:可作为"额外 GERD/息肉训练素材",但须注意类别定义对齐与去重(避免与这些集合重叠的图像);
- 与 Kvasir-SEG / PolypGen 联合:GastroEndoNet 无掩码,不能直接为分割任务供标签,但可作分类预训练;
- 联合使用的核心风险:跨数据集的图像重复——若两个数据集含相同图像,联合训练会造成隐性泄漏。使用前须做跨集去重(感知哈希比对)。
10.12 结语
GastroEndoNet 的价值不在"大"或"精",而在"门槛低、覆盖全、组织清"。它把消化道内镜分类最常见的两个目标(GERD、息肉)用一套干净的四类框架打包,公开直下,让任何团队都能在几分钟内开始内镜 AI 实验。对初学者和快速验证者,它是友好的起点;对追求临床精度或跨中心泛化的研究者,它是必须谨慎对待的有限素材。读它的数字要读版本,用它的数据要先去重,引它的许可要认 ND。
FAQ(高频问答 32 问)
A. 基础认知
A1:GastroEndoNet 是什么?
一个消化道内窥镜图像四分类数据集,覆盖食管侧 GERD 与结直肠侧息肉,由孟加拉 Daffodil International University 团队发布,托管于 Mendeley Data。
A2:它和 GastroVision、HyperKvasir 是同一个东西吗?
不是。GastroVision(rid 203)与 HyperKvasir(rid 693)是另外的胃肠内镜数据集。三者名字相近但来源、规模、标签体系都不同(坑 1)。
A3:它是挑战赛数据集吗?
不是。它是 Data in Brief 发表的 Data Article,无竞赛、无 leaderboard。
A4:谁做的?
Daffodil International University(Dhaka)与 Premier University(Chattogram)的 7 位作者,数据采集于 Zainul Haque Sikder Women’s Medical College & Hospital。
A5:采自哪个国家?
孟加拉国(Bangladesh),Dhaka 市 Gulshan-2 区。
A6:用的什么设备?
Olympus EVIS EXERA III(含 GIF-190)与 Pentax Medical EG29-i10,两款混合。
A7:是什么时候发布的?
Mendeley v1 于 2024-10-07;论文 2025 年 6 月发表在 Data in Brief(Vol. 60, 111572)。最新数据版本 v3 为 2025-02-27。
A8:它是新的还是老的?
新近发布(2024-2025),学术影响仍在积累。
B. 数据与获取
B1:一共多少张图?
v3 口径 24,036 张(原始 4,006);v1 口径 27,624 张(原始 4,604)。默认讨论用 v3。
B2:为什么有两个总数?
因为版本不同(v1 vs v3),v2/v3 做了去重(坑 3、存照 A)。
B3:24,036 是怎么来的?
原始 4,006 张 × 6 种增强 = 24,036(4,006 × 6 = 24,036)。
B4:六种增强是什么?
60° 旋转、90° 旋转、水平翻转、缩放、亮度调整、错切(坑 9 提到错切对形状的影响)。
B5:四类各多少张(v3)?
GERD 974、GERD Normal 1,103、Polyp 779、Polyp Normal 1,150(原始图)。
B6:图像多大?
512×512 像素,JPG 格式。
B7:原始分辨率是多少?
原始像素 440–960,统一 bicubic 缩放到 512×512。
B8:怎么下载?
Mendeley Data,DOI 10.17632/ffyn828yf4.3,免注册直下。两个 zip:增强包 1.51 GB + 原始包 759 MB。
B9:要申请吗?
不用。公开直下,无需注册、无需 DUA(这是它的优势)。
B10:有没有 HuggingFace 镜像?
未发现(遗留疑点 1);以 Mendeley Data 为唯一权威入口。
C. 数据组织与标注
C1:怎么做标注?
图像级单标签,无边界框、无分割掩码(§5.2)。
C2:有患者 ID 吗?
没有,患者级信息未披露(遗留疑点 3)。
C3:有病理对照吗?
没有,标签来自内镜结论而非活检(§7.6)。
C4:能用来做检测或分割吗?
不能——没有框和掩码(§5.2、§10.4)。
C5:类别平衡吗?
较温和:最不平衡比约 1:1.48(Polyp : Polyp Normal)。
C6:为什么把 GERD 和息肉放一起?
两者同为消化道内镜常见目标、同成像模态、同为"病变 vs 正常"判别问题(§2.6)。
C7:GERD Normal 和 Polyp Normal 是同一个"正常"类吗?
不是。前者是食管正常,后者是结肠正常(§5.4)。
D. 许可与合规
D1:许可是什么?
CC BY-NC-ND 4.0(Mendeley 数据集页权威口径)。
D2:能商用吗?
不能。NC 条款禁止商业使用(坑 5)。
D3:能发布我改过的版本吗?
不能。ND 条款禁止发布演绎版本(坑 5)。但训练模型、发表结果是允许的。
D4:为什么有的地方写 CC BY NC?
论文刊物侧元数据与 OpenAIRE 索引的简写,缺 ND;以数据集页为准(存照 C)。
D5:商用前要做什么?
先核实当前许可 + 联系通讯作者取得授权(§6.2 合规三步核实法)。
E. 评测与使用
E1:有官方 train/test 划分吗?
没有,须自定协议(§5.6、§6.5)。
E2:最关键的评测注意事项是什么?
按原始文件去重划分——同一原始图的 6 个增强副本必须整组进同一个集合,否则同源泄漏导致指标虚高(坑 6)。
E3:有官方 benchmark 分数吗?
没有权威 leaderboard;论文只有可行性验证实验,且因无固定划分而不可严格复现(§7.1)。
E4:四分类准确率高就说明模型好吗?
不一定。四分类高准确率可能主要来自"部位判别"(食管 vs 结肠),而非"病变判别"(坑 7)。须分解报告。
E5:应该报告什么指标?
四分类指标 + 部位内二分类指标,优先 per-class recall 与 macro-F1(§7.2、§7.7)。
E6:类别不平衡怎么办?
类别加权、重采样、分层划分、报告 macro-F1(§7.5)。不推荐再额外做增强。
E7:能和其他数据集联合训练吗?
可以,但须先做跨集去重(感知哈希),避免隐性泄漏(§10.11)。
F. 复现与工程
F1:能严格复现论文数字吗?
不能。无官方划分脚本,数值依赖划分方式(§10.9)。
F2:复现最容易失败在哪?
下错版本、划分泄漏、不平衡处理不同、预处理不同(§10.9.2)。
F3:下载要多久?
2.24 GB,普通网络几分钟到十几分钟。
F4:本地训练门槛高吗?
不高。512×512 JPG,2.24 GB,普通 GPU 甚至 CPU 都能跑通小模型。
事实清单(硬事实 40 条)
| # | 事实 | 来源 |
|---|---|---|
| 1 | 官方全称 GastroEndoNet: An endoscopic image dataset for GERD and polyp detection | 论文标题 |
| 2 | 论文发表于 Data in Brief, Vol. 60, 111572, 2025 Jun | 论文 |
| 3 | 论文 DOI 10.1016/j.dib.2025.111572 | 论文 |
| 4 | PMID 40470347 | PubMed 索引 |
| 5 | PMC12136698 | PMC 索引 |
| 6 | 数据托管于 Mendeley Data | 数据页 |
| 7 | Mendeley DOI(v3)10.17632/ffyn828yf4.3 | 数据页 |
| 8 | Mendeley 公开日期 2025-02-27(v3) | 数据页 |
| 9 | v1 首发 2024-10-07 | 数据页 |
| 10 | v3 总量 24,036 张 | 数据页/论文 |
| 11 | v3 原始图 4,006 张 | 数据页/论文 Abstract |
| 12 | v1 总量 27,624 张 | 数据页 |
| 13 | v1 原始图 4,604 张 | 数据页 |
| 14 | 四类:GERD / GERD Normal / Polyp / Polyp Normal | 论文 |
| 15 | v3 四类原始图 974 / 1,103 / 779 / 1,150 | 数据页 |
| 16 | v1 四类原始图 1,076 / 1,168 / 1,188 / 1,172 | 数据页 |
| 17 | 增强 6 种:60° 旋转、90° 旋转、水平翻转、缩放、亮度调整、错切 | 论文 |
| 18 | 4,006 × 6 = 24,036(自洽) | 计算 |
| 19 | 分辨率 512×512 | 论文 |
| 20 | 原始像素范围 440–960 | 论文 |
| 21 | 缩放方法 bicubic | 论文 |
| 22 | 格式 JPG | 数据页 |
| 23 | 设备 Olympus EVIS EXERA III(GIF-190) | 论文 |
| 24 | 设备 Pentax Medical EG29-i10 | 论文 |
| 25 | 采集地 Zainul Haque Sikder Women’s Medical College & Hospital | 论文 |
| 26 | 采集地地址 Gulshan-2, Road-104, House-5, Dhaka-1212, Bangladesh | 论文 |
| 27 | 归属机构 Daffodil International University | 论文 |
| 28 | 合作机构 Premier University(Chattogram) | 论文 |
| 29 | 作者数 7 | 论文 |
| 30 | 伦理批号 REC-FSIT-2024-08-24 | 论文 |
| 31 | 许可 CC BY-NC-ND 4.0 | Mendeley 数据页 |
| 32 | 论文侧许可表述 cc by-nc | Europe PMC |
| 33 | OpenAIRE 表述 CC BY NC | OpenAIRE |
| 34 | 增强包体积 1.51 GB | Mendeley 数据页 |
| 35 | 原始包体积 759 MB | Mendeley 数据页 |
| 36 | 总下载体积约 2.24 GB | 计算 |
| 37 | 获取方式公开直下(免注册) | Mendeley 数据页 |
| 38 | 无官方 train/val/test 划分 | 论文/数据页 |
| 39 | 第三方引用 Diagnostics 2025, 15, 2714 用 v1 口径 4,604 | MDPI 论文 |
| 40 | 标签为图像级单标签,无框/掩码 | 论文 |
事实来源说明
本清单以一手来源(Mendeley Data 数据页 + Data in Brief 论文)为准;二手索引(PMC/PMID/OpenAIRE)用于交叉核验;第三方文献(Diagnostics 2025, 15, 2714)用于坐实 v1 口径的独立存在。凡一手与二手冲突处,均在 §9.1 存照。
术语表(补充,接 §2.5)
| 中文 | 英文 | 补充说明 |
|---|---|---|
| 数据描述论文 | Data Article | Data in Brief 的文体,专述数据集 |
| 单源派生 | single-source derived | 从一个来源派生扩充,非跨机构汇聚 |
| 同源泄漏 | same-source leakage | 派生副本跨集导致的信息泄漏 |
| 分层划分 | stratified split | 保持各类别比例的划分 |
| 宏平均 F1 | macro-F1 | 各类 F1 的算术平均,不受类规模影响 |
| 逐类召回 | per-class recall | 每一类各自的召回率 |
| 混淆矩阵 | confusion matrix | 真值 × 预测的列联表 |
| 一对其余 | one-vs-rest | 多分类转二分类的 AUC 计算方式 |
| 感知哈希 | perceptual hash | 图像相似度取指纹,用于跨集去重 |
| 部位捷径 | site shortcut | 模型用部位外观而非病变特征做判别 |
| 内镜结论级 | endoscopy-conclusion level | 标签精度上限为当时的内镜判断 |
| 病理级 | pathology level | 以活检/病理为金标准的精度 |
| 洛杉矶分级 | LA grade | 反流性食管炎的 A-D 分级(本数据集无) |
| 去标识化 | de-identification | 移除可识别患者信息 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| slug | gastroendonet |
| 中文名 | 胃食管反流病与结直肠息肉四分类内窥镜图像数据集 |
| 默认版本 | v3(4,006 / 24,036) |
| 主 DOI | 10.17632/ffyn828yf4.3 |
| 论文 DOI | 10.1016/j.dib.2025.111572 |
| 许可 | CC BY-NC-ND 4.0 |
| 获取 | Mendeley Data 公开直下 |
| 核心坑 | 坑 3(版本数字)、坑 6(同源泄漏)、坑 5(许可 ND) |
附录 B:DAIMS 评估全表
见 §10.7(24 项逐项评分,综合评级"够用但不够精")。
附录 C:逐项证据链自证
| 结论 | 证据 |
|---|---|
| 数据集真实存在 | Mendeley Data 页 + 论文 + PMC 索引 + 第三方引用 |
| 规模 24,036/4,006(v3) | 论文 Abstract + Mendeley v3 页 |
| 规模 27,624/4,604(v1) | Mendeley v1 页 + Diagnostics 2025, 15, 2714 |
| 许可 CC BY-NC-ND 4.0 | Mendeley 数据集页 |
| 采集地孟加拉 | 论文 + 机构页 |
| 免注册直下 | Mendeley 下载页实测 |
附录 D:数据获取决策树
见 §6.6。
附录 E:四类标签映射与使用规范
| 类别 | 部位 | 状态 | 合并方案 |
|---|---|---|---|
| GERD | 食管 | 病变 | 病变类 |
| GERD Normal | 食管 | 正常 | 正常类 |
| Polyp | 结肠 | 病变 | 病变类 |
| Polyp Normal | 结肠 | 正常 | 正常类 |
使用规范:报告二分类时须注明合并方案;报告四分类时须分部位统计。
附录 F:增强变换清单与建议
| 变换 | 类型 | 形状保持 | 建议 |
|---|---|---|---|
| 60° 旋转 | 几何 | 是(旋转不改变形状) | 可用 |
| 90° 旋转 | 几何 | 是 | 可用 |
| 水平翻转 | 几何 | 是(镜像) | 可用,但注意左右解剖含义 |
| 缩放 | 几何 | 是(等比) | 可用,注意尺度变化 |
| 亮度调整 | 光度 | 是 | 可用,提升明暗鲁棒性 |
| 错切 | 几何 | 否(改变比例) | 形状敏感任务慎用(坑 9) |
附录 G:按原始文件去重的伪代码
# 假定文件名可解析出原始图 ID(如 orig_0001_aug60.jpg → orig_0001)
groups = {}
for f in all_files: # 遍历 Original + Augmented 两个包
oid = parse_original_id(f) # 解析同一原始图的 ID
groups.setdefault(oid, []).append(f)
# 整组划分:同一 oid 的所有文件进同一个集合
train, val, test = [], [], []
for oid, files in stratified_groups(groups): # 按类别分层
split = assign_split(oid) # 随机/按比例决定该组归属
(train if split=='train' else val if split=='val' else test).extend(files)
# 关键:绝不把同一 oid 的文件拆到不同集合
附录 H:评测骨架(伪代码)
for seed in seeds:
split = dedup_stratified_split(seed) # 附录 G 的划分
model = train(train_set)
# 四分类
report_four_class_metrics(model, test_set) # acc / macro-F1 / 混淆矩阵
# 部位内二分类
report_binary_metrics(model, test_set, site='esophagus') # GERD vs Normal
report_binary_metrics(model, test_set, site='colon') # Polyp vs Normal
report_per_class_recall(model, test_set)
aggregate_seeds() # 报告均值 ± 标准差
附录 I:统计指标计算表
| 指标 | 公式 |
|---|---|
| Accuracy | (TP+TN) / N |
| Precision_c | TP_c / (TP_c + FP_c) |
| Recall_c | TP_c / (TP_c + FN_c) |
| F1_c | 2·P_c·R_c / (P_c + R_c) |
| macro-F1 | (1/C)·Σ F1_c |
附录 J:双口径登记表
| 项 | v1 | v3 | 判定 |
|---|---|---|---|
| 发布日 | 2024-10-07 | 2025-02-27 | 版本差 |
| 原始图 | 4,604 | 4,006 | 去重 |
| 总张数 | 27,624 | 24,036 | 去重 |
| GERD | 1,076 | 974 | 去重 |
| GERD Normal | 1,168 | 1,103 | 去重 |
| Polyp | 1,188 | 779 | 去重 |
| Polyp Normal | 1,172 | 1,150 | 去重 |
附录 K:许可条款细读
| 条款 | 含义 | 对使用的影响 |
|---|---|---|
| BY(署名) | 须注明出处 | 论文/产品须致谢与引用 |
| NC(非商业) | 禁商用 | 企业使用受限 |
| ND(禁止演绎) | 禁发布改动版 | 不能公开部署二次发布的数据集版本 |
附录 L:常见误引与纠正
| 误引 | 纠正 |
|---|---|
| “GastroEndoNet 有 24,036 张独立图像” | 独立原始图仅 4,006 |
| “GastroEndoNet 可商用” | 不可(NC) |
| “GastroEndoNet 可发布衍生数据集” | 不可(ND) |
| “GastroEndoNet 数据来自印度” | 来自孟加拉 |
| “GastroEndoNet 有息肉边界框” | 无,仅图像级标签 |
附录 M:与库内条目的关系声明
GastroEndoNet 与库内 hyperkvasir(693)、gastrovision(203)、kvasir-seg(112)、kvasir-instrument(213)、kvasir-capsule(123)、cvc-colondb(142)、bkai-igh-neopolyp(84)、ldpolypvideo(163)、polypgen(183)、real-colon(778)、endoscapes(353)、slam-3d-endoscopic(82) 构成消化道内镜谱系;本条目是其中首个以 GERD 为独立标签的条目。建议双向互链。
附录 N:检索决策树
想找 GERD 内镜分类数据?
├─ 要独立 GERD 标签 → GastroEndoNet
├─ 要大合集含 GERD 子类 → HyperKvasir / GastroVision
想找息肉数据?
├─ 要分类 → GastroEndoNet / HyperKvasir
├─ 要检测/分割 → PolypGen / CVC-ColonDB / Kvasir-SEG / LDPolypVideo
附录 O:检索路径示范(关键词组合)
- 关键词组合 1:
GastroEndoNet+Mendeley→ 直达数据页; - 关键词组合 2:
ffyn828yf4→ 唯一命中 Mendeley DOI; - 关键词组合 3:
GERD polyp endoscopy dataset→ 命中论文与相关综述; - 关键词组合 4:
GastroEndoNet site:pmc.ncbi.nlm.nih.gov→ 命中 PMC12136698; - 关键词组合 5:
GastroEndoNet original 4604→ 命中引用 v1 的第三方文献。
附录 P:本条目生产档案
- 代理名:agent-b-gastroendo;
- 正选 slug:gastroendonet(无备选);
- 开工三查:锁文件
.lock(agent-b-gastroendo 2026-09-30T22:14)、私有区.parts_agent-b-gastroendo_1790777646/、ps aux | grep -c "[c]odebuddy"= 8; - 私有区 10 秒 md5 稳定性采样:通过(空目录,d41d8cd9…);
- 成稿方式:5 part 直写私有区 → cat 拼接;
- 自检:check_md.py + preflight_check.py 双零。
附录 Q:FAIR/AI-Ready 检查单
| 原则 | 评估 |
|---|---|
| Findable(可发现) | ★★★★☆ — DOI + Mendeley 页 + 论文索引齐备 |
| Accessible(可获取) | ★★★★★ — 公开直下,免注册 |
| Interoperable(可互操作) | ★★★☆☆ — JPG 通用,但无标准化元数据/字典文件 |
| Reusable(可复用) | ★★★☆☆ — 许可限 NC+ND,缺患者级与划分信息 |
| AI-Ready | ★★★☆☆ — 分类可用,增强需去重,无 detection/segmentation 支持 |
尾注
本条目基于 2026-09-30 的公开检索与一手来源核验撰写。所有硬数字以 Mendeley Data v3 数据页与 Data in Brief 论文为准;v1 口径(4,604 / 27,624)作为版本差异存照于 §9.1,第三方文献(Diagnostics 2025, 15, 2714)对该口径的引用亦已记录。许可以数据集页 CC BY-NC-ND 4.0 为准,论文刊物侧与 OpenAIRE 的简写口径差异存照于 §6.2。
互链条目声明:本条目的相关数据集定位面向库内消化道内镜谱系,具体互链对象与 rid 见 §9.4。本条目为库内首个以 GERD 为独立标签的条目,落库后建议与下列条目建立双向互链:gastrovision(203)、hyperkvasir(693)、kvasir-seg(112)、kvasir-instrument(213)、kvasir-capsule(123)、cvc-colondb(142)、bkai-igh-neopolyp(84)、ldpolypvideo(163)、polypgen(183)、real-colon(778)、endoscapes(353)、slam-3d-endoscopic(82)。
维护触发点:
- Mendeley Data 发布 v4 或更新版本时,须复核规模与四类分布并更新 §4.1、§9.1;
- 数据集页 license 变更时,须更新 §6.2 与 frontmatter 的 license 字段;
- 发现 HuggingFace 镜像时,须更新 §6.4 与遗留疑点 1;
- 论文作者披露 患者级信息或划分脚本时,须更新 §9.2 遗留疑点 3、5;
- 出现权威第三方 benchmark(公开 leaderboard)时,须补入 §7;
- 库内 GERD 方向新增条目时,须同步更新 §9.4 互链点。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- bkai-igh-neopolyp — 共享标签:内窥镜影像 / 医学影像 / 结直肠癌 / 肿瘤学
- gastrovision — 共享标签:内窥镜影像 / 图像分类 / 医学影像
- lc25000 — 共享标签:图像分类 / 医学影像 / 结直肠癌 / 肿瘤学
- rare25 — 共享标签:内窥镜影像 / 图像分类 / 医学影像 / 肿瘤学
- ldpolypvideo — 共享标签:内窥镜影像 / 医学影像 / 结直肠癌
- cima — 共享标签:医学影像 / 结直肠癌 / 肿瘤学
- ham10000 — 共享标签:图像分类 / 医学影像 / 肿瘤学
- odir — 共享标签:内窥镜影像 / 图像分类 / 医学影像
- kvasir-capsule — 共享标签:内窥镜影像 / 图像分类 / 医学影像
- ddti — 共享标签:图像分类 / 医学影像 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

