PolypDB (polypdb) — 三中心五模态结肠镜息肉图像数据集 — AI-Ready Wikipedia

挪威/瑞典/越南三中心 3934 张息肉图像的像素级分割掩码与检测框,覆盖 BLI/FICE/LCI/NBI/WLI 五种内镜成像模态,附分割/检测/联邦学习基线——首个开源五模态息肉数据集,OSF 公开直链

来源 三中心结肠镜检查视频抽帧序列(Norway/Sweden/Vietnam)+ 像素级分割掩码(Labelbox 标注,≥2 名高级胃肠病专家交叉复核)+ 边界框检测标注 + 模态/中心双视图划分文件(COCO 格式标签)发布时间: 2026-09-30最后更新: 2026-09-30 阅读 9
PolypDB (polypdb) — 三中心五模态结肠镜息肉图像数据集 — AI-Ready Wikipedia

信息速览

数据集名称PolypDB (polypdb) — 三中心五模态结肠镜息肉图像数据集 — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模未披露(3934 张图像,抽帧自真实结肠镜检查视频;三中心:挪威 Bærum、瑞典 Karolinska、越南 HMU/IGH)
接入方式三中心结肠镜检查视频抽帧序列(Norway/Sweden/Vietnam)+ 像素级分割掩码(Labelbox 标注,≥2 名高级胃肠病专家交叉复核)+ 边界框检测标注 + 模态/中心双视图划分文件(COCO 格式标签)
AI 就绪度

INFOBOX — PolypDB 一屏速览

维度 内容
本质 首个开源五模态三中心结肠镜息肉数据集(分割掩码+检测框),非挑战赛、公开直链
团队 Northwestern University 主导(通讯 Debesh Jha),联合挪威/瑞典/越南三中心,共 24 作者
论文 arXiv:2409.00045(v1 2024-08-19 / v2 2025-01-03;cs.CV;CC BY 4.0)
数据 3934 张息肉图像,最小 1280×720,JPEG;像素级分割掩码 + 边界框
模态 五模态:BLI / FICE / LCI / NBI / WLI(图像增强内镜 IEE 全覆盖)
中心 三中心:挪威 Bærum(2724)、瑞典 Karolinska(40)、越南 BKAI(1200)
任务 息肉分割 + 息肉检测 + 联邦学习(center-wise FedAvg)
基线 分割 8 方法 + 检测 5 YOLO + 联邦 10 模型(论文宣称口径见 §5)
最佳分割 SSFormer-L 与 PVT-CASCADE 综合最优(WLI mIoU 0.8821 / LCI 0.8567)
最佳检测 YOLOv10 / YOLOv9 主导(FICE mAP50 0.887 / LCI 0.995)
获取 公开直链:OSF https://osf.io/pr7ms/(无需注册/申请);代码 GitHub DebeshJha/PolypDB
许可 论文 CC BY 4.0;数据集许可未明确(README 称 MIT 无 LICENSE 文件)
库内互链 HyperKvasir(上游未标注类)、Kvasir-SEG、BKAI-IGH NeoPolyp(越南上游)、PolypGen、LDPolypVideo

PolypDB 回答的是息肉 AI 里一个长期被回避的问题:当一家医院训练的分割模型换到另一家医院的内镜室,它还能看清息肉吗? 息肉分割数据集过去大多是单中心、单模态的——模型在 Kvasir-SEG 上刷到 0.9 的 Dice,到了换设备、换染色模式、换人种的场景就崩。PolypDB 的做法是把"多中心+多模态"直接做成数据集的骨架:挪威、瑞典、越南三家医院,BLI、FICE、LCI、NBI、WLI 五种内镜成像模态,3934 张图像全部配像素级掩码和检测框,再按模态和中心两个维度切出基准——让模型在训练时就被迫面对"分布漂移",而不是等部署时才发现。

导语读法三则:

  1. 只想下数据:直奔 §6——OSF 公开直链(osf.io/pr7ms)无需申请,是库内难得的"零门槛"息肉数据集。
  2. 关心基线结果:直奔 §5——分割看 SSFormer-L / PVT-CASCADE,检测看 YOLOv10 / YOLOv9;注意表 IV 的 BLI/NBI 行雷同(坑 4)。
  3. 做通用化/联邦学习:直奔 §3 与 §7——模态视图与中心视图两种切法,外加 FedAvg 三中心实验,是本研究区别于普通息肉数据集的真正增量。

§0 导读:这个数据集解决什么问题

结直肠癌(Colorectal Cancer, CRC)是全球第三大癌症发病、第二大癌症死因:2020 年约 190 万新发病例、约 93.5 万人死亡。结肠镜(colonoscopy)是 CRC 筛查与癌前病变(息肉)切除的金标准,但它是操作者依赖的检查——腺瘤漏检率(adenoma miss-rate)文献报道高达 20%–24%,被漏掉的息肉可能在数年后发展为"结肠镜后结直肠癌"(post-colonoscopy CRC)或间期癌(interval cancer)。计算机辅助检测(CADe)系统已经商用于息肉检测,但多数只在息肉上打一个边界框,并不帮助医生精确勾勒息肉边界、确认是否完整切除——而完整切除正是避免复发与间期癌的关键。

要训练能真正辅助"分割+完整切除确认"的模型,缺的恰恰是公开、多中心、大规模、多样化的数据集。PolypDB 论文开篇的洞察是:现有公开息肉数据集(Table I 列举)要么单中心、要么单模态,没有一个同时具备"多模态 + 多中心 + 胃肠病专家验证真值"三要素。PolypDB 是首个开源的五模态息肉数据集——把 BLI、FICE、LCI、NBI、WLI 五种成像方式(图像增强内镜 Image-Enhanced Endoscopy, IEE)汇聚到同一套标注规范下,并横跨挪威、瑞典、越南三国人群与 Fujinon/Olympus 两套设备。

§0 读法三则:

  1. 这个条目是"数据集 + 基准论文 + 标注方法论 + 联邦学习实践"四合一:核心资产是 3934 张带掩码与检测框的图像,副产品是模态/中心双视图基准与三中心 FedAvg 实验。
  2. 全文数字均出自论文正文与 Table I–VI;正文自相冲突处(模态合计 3904 vs 总数 3934、检测方法数 5 vs 6、注释团队 8 vs 10)已在坑 A/B/C 逐条存照。
  3. 检索时若把"PolypDB"与"PolypGen"(另一多中心息肉数据集,rid 183)或"LDPolypVideo"(视频息肉,rid 163)混为一谈会出错——三者是不同数据集(坑见 §10)。

0.1 为什么"息肉分割"值得一个专门的数据集

息肉(polyp)是结直肠黏膜表面的隆起病变,是结直肠癌最主要的癌前形态。从腺瘤性息肉到腺癌通常经历"增生→低级别腺瘤→高级别腺瘤→原位癌→浸润癌"的多步演进,历时 5-10 年——这段窗口正是筛查与干预的价值所在。结肠镜检查时医生用内镜前端摄像头逐段观察肠壁,发现息肉即用活检钳取样或用圈套器切除(polypectomy)。因此,**看得见(检测)与看得准边界(分割)**是两件关键的事:

  • **检测(detection)**回答"画面里有没有息肉、在哪里"——用边界框(bounding box)框出即可。商用 CADe 系统主要做这件事,在息肉上画一个绿色方框提示医生。
  • **分割(segmentation)**回答"息肉的像素边界在哪里"——需要像素级掩码(mask)。它服务于更精细的任务:判断息肉是否被完整切除(切缘阴性)、估算息肉面积、为内镜下"光学活检"(optical biopsy,即时判断息肉性质而不必取病理)提供形态学证据。

息肉分割之所以难,论文列出了五类挑战:(i) 息肉在发育阶段形态会随时间变化;(ii) 息肉的形状、大小、颜色、外观可能与周围黏膜高度相似(低对比);(iii) 有时有黏液覆盖息肉形成"伪装",连经验丰富的内镜医生都可能被骗;(iv) 成像设备引入的伪影——模糊、眩光、光照过强/过弱、反光亮点、低对比区;(v) 手术器械与肠道残留物干扰边界判断。所有这些因素共同导致"息肉与背景的分割边界模糊",是大肠镜 AI 的公认难点。

0.2 "多中心"为什么比"大规模"更重要

一个直觉误区是"数据集越大越好"。但在医学影像 AI 里,数据分布的多样性(diversity)往往比绝对规模更决定模型的泛化力。原因是:模型学到的是训练分布的特征,若训练数据全部来自同一家医院、同一台设备、同一类人群,模型会过拟合这些"偶然的共性"——部署到新场景时,设备差异、人群差异、操作差异会同时构成分布漂移(distribution shift),精度断崖式下跌。

PolypDB 的论文对此有明确表述:“Training DL algorithms on multi-center datasets can improve the generalizability and robustness of the network.”(在多中心数据集上训练深度学习算法可提升网络的泛化性与鲁棒性)。多中心的价值具体体现在三处:

  1. 捕获区域与人口统计学差异:不同地区 CRC 发病率不同,多中心数据能覆盖更广的人口代表性。
  2. 纳入不同设备与成像协议:Olympus、Fujinon、Pentax 三大品牌的内镜图像处理管道各异,模型必须对"设备指纹"不敏感。
  3. 暴露真实世界的成像条件差异:不同医院的操作习惯、肠道准备质量、光照条件构成天然的扰动谱。

这三条正是 PolypDB 用"三中心 + 五模态"来落实的设计哲学——它不是在"量"上做文章,而是在"结构化多样性"上做文章。

0.3 与其他息肉数据集的定位差异(先给结论)

在论文 Table I 的"≥1000 样本"息肉数据集景观里,PolypDB 的差异化定位可用三句话概括:

  1. 规模上它不是最大:Kvasir-Capsule(474 万图,但为胶囊内镜)、HyperKvasir(11 万图,但含多种 GI 病变非纯息肉)在量上远超;纯息肉分割集里 CVC-VideoClinicDB(11954)与 ASU-Mayo(18781)曾更大,但均已下架不可获取。
  2. 模态多样性上它独一无二:Kvasir-SEG、BKAI-IGH 等多为单模态(WLI),PolypDB 是首个含五种 IEE 模态的开源息肉数据集。
  3. 中心覆盖上它最完整:PolypGen 虽多中心,但中心数与模态数不及 PolypDB;PolypDB 同时提供模态视图与中心视图两种切分。

理解了这三点,就能理解为什么一篇"数据集论文"值得被 AI-Ready Wikipedia 收录——它的贡献不是"又发了一堆图",而是把"多模态多中心"这个评测维度制度化进了数据集结构。

0.4 为什么 PolypDB 值得收录进 AI-Ready Wikipedia

AI-Ready Wikipedia 的收录标准是"可作为 AI 训练/评测资产、且元数据可核验、获取路径清晰"的数据集。PolypDB 满足以下四条:

  1. 真实的公开资产:3934 张图像 + 掩码 + 检测框,OSF 公开直链,非概念、非申请制。
  2. 可核验的元数据:arXiv 论文(CC BY 4.0)+ GitHub README + OSF 项目页三源互证规模、模态、中心、许可。
  3. 完整的任务定义:分割、检测、联邦三套任务与基线(Table III/IV/V),度量指标明确(mIoU/mDSC/mAP/F2)。
  4. 结构化多样性:五模态 × 三中心 × 双视图,让数据集自带上"域泛化评测"能力。

同时,它也是本库内"公开直链型息肉数据集"的代表——与请求制/注册墙型数据集形成可获取性光谱的对照。它的许可模糊问题(§6.3)则是一个反面教材,提醒数据发布者"LICENSE 文件不能只写在 README 里"。

§1 数据集速览:十问十答

Q1:PolypDB 的"3934 张"是什么?
3934 张来自真实结肠镜检查视频抽帧的静态息肉图像(still polyp images),每张配像素级分割掩码与边界框真值。它不含视频序列本体——论文表述是"ground truth from real colonoscopy videos",即真值追溯自真实视频,图像是抽取的帧。规模定位:在论文 Table I 的"≥1000 样本"息肉数据集对照中,PolypDB(3934)低于 CVC-VideoClinicDB(11954,已下架)、ASU-Mayo(18781,已下架),但高于 Kvasir-SEG(1000)、BKAI-IGH(1000)、PolypGen(1531)。

Q2:五个模态分别是什么?
图像增强内镜(IEE)的五种主流数字染色模式:WLI(White Light Imaging,白光成像,常规模式)、NBI(Narrow Band Imaging,窄带成像,Olympus 系)、BLI(Blue Light Imaging,蓝光成像,Fujinon 系)、LCI(Linked Color Imaging,联动彩色成像,Fujinon 系)、FICE(Flexible spectral Imaging Color Enhancement,柔性光谱成像色彩增强)。五模态的意义在于:不同设备品牌(Fujinon/Olympus/Pentax)与不同染色策略会对同一息肉呈现不同颜色与纹理,模型必须对"成像管道差异"鲁棒。

Q3:三个中心分别在哪?
(1)Bærum Hospital, Vestre Viken Hospital Trust(挪威)——Center 1,主力贡献者,设备 Olympus Evis Exera III / CF 190;(2)Karolinska University Hospital(瑞典斯德哥尔摩)——Center 2,样本最少,Olympus 设备;(3)Hanoi Medical University (HMU) + Institute of Gastroenterology and Hepatology (IGH)(越南河内)——Center 3,合并且计为单中心(同城同人群同设备 Fujinon)。三地覆盖北欧与东南亚两类人群,是"人口代表性"设计。

Q4:数据到底怎么来的?
两个关键来源:Center 1 从 HyperKvasir 数据集的未标注类中识别息肉帧——HyperKvasir 有 99417 帧内镜图像,团队从中挑出 3000 张 WLI 候选,标注后采纳 2588 张,另选 136 张 NBI;Center 3 复用 **BKAI-IGH(越南)**的 1200 张图像(其中 BKAI 提供 1000 WLI + 60 LCI + 70 FICE + 70 BLI);Center 2(Karolinska)则按 GDPR 完全匿名后贡献 30 WLI + 10 NBI。这条"旧数据重标注"路径与 PANDA-PLUS 对 PANDA 的做法同构——把别人未利用的未标注资源盘活成带像素级真值的资产。

Q5:标注由谁做、怎么保证质量?
标注在 Labelbox 在线平台完成,由一名有数据治理经验的资深研究助理用 Wacom Cintiq 数位屏逐帧勾勒(用单人描边以减少手工勾勒的异质性)。质控是双层的:每条标注由至少两名高级胃肠病专家交叉复核,另指定一名独立高级胃肠病专家复核全部 3934 张图像。复核内容包括"该帧是否真为息肉"(剔除无息肉帧)与"标注是否临床可接受"(修正错误标注)。

Q6:分割和检测两种任务都支持吗?
是。团队为所有图像同时提供边界框与像素级标注,因此同一数据集既可用于息肉分割(segmentation),也可用于息肉检测(object detection)。模态视图下提供"images + 分割真值掩码"(用于分割)与"images + 边界框信息"(用于检测);中心视图下每中心含 images、分割真值、边界框三件套。图像与掩码同名,便于配对加载。

Q7:图像规格与训练配置是什么?
纳入图像的最小分辨率为 1280×720,全部 JPEG 压缩。训练时分割任务统一 resize 到 512×512,检测任务统一 resize 到 640×480。划分比例 80% 训练 / 10% 验证 / 10% 测试。分割用 PyTorch 1.9、NVIDIA RTX 3090、BCE+Dice 损失、Adam、lr 1e-4、200 epoch、batch 12;检测用 AdamW、lr 1e-4、batch 16、YOLO 全家族统一超参。

Q8:它和 Kvasir-SEG 等老数据集是什么关系?
血缘很近但定位不同。Kvasir-SEG(rid 112,1000 张息肉分割)是 Jha 等 2020 年的单模态(WLI)分割数据集;PolypDB 的图像来源之一就是 HyperKvasir(Kvasir-SEG 的姊妹数据集)的未标注类,且团队把 WLI 之外的四种模态补齐。所以 PolypDB ≈ “Kvasir 家族未标注资源 + 四模态扩展 + 三中心 + 专家全量复核”。论文 Table I 把 Kvasir-SEG、HyperKvasir、Kvasir-Capsule、CVC-VideoClinicDB、ASU-Mayo、BKAI-IGH、PolypGen 列为对照。

Q9:我现在能立刻下载吗?
能——这是它与许多"注册墙/请求制"数据集的最大区别。数据在 OSF https://osf.io/pr7ms/ 公开直链,无需注册、无需申请(论文与 GitHub 均直接指向该地址)。代码与数据集划分、COCO 标签在 GitHub DebeshJha/PolypDB 公开。

Q10:为什么它对 AI-Ready 重要?
它是库内少数"多模态+多中心+公开直链+双视图组织"四位一体的内镜数据集样本:可获取性满分(无门槛直链),组织方式自带"域泛化评测"结构(模态视图/中心视图),且提供分割/检测/联邦三套基线。对做内镜 AI 通用化研究的团队,它同时是训练集和"分布漂移压力测试台"。

1.1 补充问答:研究者最常问的五个问题

Q11:五个模态的样本量分别是多少?
按论文 §III-A 的实验口径:WLI 3558、NBI 146、LCI 60、BLI 70、FICE 70(合计 3904,与总数 3934 差 30)。WLI 占 91%,是绝对主力;BLI/FICE/LCI 各仅 60-70 张。做多模态研究时务必注意少数模态的样本量——60 张的 10% 测试集只有 6 张,指标噪声大。

Q12:数据集的"三中心"是否平衡?
极不平衡。Bærum(挪威)2724 张、越南(HMU+IGH,论文合并为单中心)1200 张、Karolinska(瑞典)仅 40 张。占比约 69% : 30% : 1%。因此 center-wise 结论(尤其联邦学习的 Karolinska 结果)基于很小的样本,引用时须谨慎。

Q13:它支持息肉分类(腺瘤/增生)吗?
不支持。PolypDB 只提供区域级分割掩码与检测框,不含组织学类型标签、不含 Paris 形态分型、不含息肉大小标签。要做息肉性质分类需另找带病理标签的数据集,或把 PolypDB 作为分割预处理环节。

Q14:它和 HyperKvasir 是什么关系?会不会重复?
上游血缘关系,但不重复。PolypDB Center 1 的 2588 张 WLI + 136 张 NBI 取自 HyperKvasir 的未标注类(HyperKvasir 原数据集对这些帧没有息肉真值),PolypDB 首次为它们赋予像素级掩码与检测框。所以 HyperKvasir 是"原材料供应商",PolypDB 是"加工成品"——两者互补而非重复。

Q15:论文有没有正式期刊版?
截至本次抓取(2026-09-30),三轮搜索未见 PolypDB 的正式期刊发表记录。可引用的规范来源是 arXiv:2409.00045(v2,2025-01-03)。GitHub README 引用块给出的 10.1109/TMI.2024.1234567 是占位符(尾号 1234567),不可使用。

Q16:数据集的划分文件怎么用?
GitHub 仓库的 dataset-split/ 目录提供固定的 80%/10%/10% 划分。强烈建议使用官方划分而非自行随机切分——因为多篇后续论文会基于官方划分报告结果,自行切分会破坏可比性。检测任务额外用 coco_labels/ 的 COCO 格式标签。

Q17:能不能只下载某个模态/中心?
可以。因为数据集按模态视图与中心视图组织,若只需 WLI 可从 WLI/ 目录下取;若只研究挪威中心可从 Simula/(或 Bærum/)取。这种"按需下载"的可组合性是双视图组织的直接好处。

Q18:PolypDB 有没有数据加载的官方代码?
GitHub 仓库提供数据集划分、COCO 标签与目录结构说明,但未附官方训练/评估代码(如 DataLoader、模型训练脚本)。这是一个小遗憾——复现基线需自行编写训练代码,参照论文超参(§11.2)。相比之下,PANDA-PLUS-Bench 提供了 Google Colab 开箱即评。

1.2 一句话画像:PolypDB 的三个身份

为了帮读者快速建立心智模型,把 PolypDB 的三个身份并列:

身份 一句话 对应资产
数据容器 3934 张三中心五模态息肉图像 + 像素级掩码 + 检测框 OSF osf.io/pr7ms
评测基准 分割 8 方法 / 检测 5 YOLO / 联邦 10 模型的公开基线 论文 Table III/IV/V
工程范例 公开直链 + 双视图组织 + 全量专家终审的数据集样板 OSF + GitHub + 论文

三种身份对应三类使用者:找数据的、做评测的、学数据工程的。本条目 §2–§3 服务第一类,§5 服务第二类,§3/§8 服务第三类。

1.3 最后一问:PolypDB 的"数据集贡献"到底新在哪

有人会问:息肉分割数据集已经很多(Kvasir-SEG、CVC 系列、PolypGen……),PolypDB 到底新增了什么?答案可以压缩成三点:

  1. 模态:它是第一个把 BLI/FICE/LCI/NBI/WLI 五种内镜成像模态集齐的开源息肉数据集——这填补了"多模态"空白。
  2. 中心:它覆盖挪威/瑞典/越南三国、Olympus/Fujinon 两套设备——提供了跨中心跨设备的评测基础。
  3. 结构:它不只是"一堆图",而是模态视图 + 中心视图 + 联邦基线的完整评测套件——让"泛化"可测、可复现。

如果只记一句:PolypDB 的贡献不是"更多图",而是"更结构化的图"——它把数据集的多样性与评测维度绑定,这是它区别于前代息肉数据集的核心。

§2 数据构成与规格

2.1 规模、来源与中心构成

PolypDB 宣称总量为 3934 张息肉图像,分布来自三个医学中心。各中心的采集与采纳路径如下:

中心 国家 采集设备 数据来源路径 采纳图像数
Center 1:Bærum Hospital, Vestre Viken Hospital Trust 挪威 Olympus Evis Exera III, CF 190 HyperKvasir 未标注类识别 3000 WLI 候选 → 采纳 2588;另选 136 NBI 2724(2588 WLI + 136 NBI)
Center 2:Karolinska University Hospital 瑞典 Olympus Evis Exera III, CF 190 全 GI 道图像中筛息肉,GDPR 完全匿名 40(30 WLI + 10 NBI)
Center 3:HMU + IGH(论文合并为单中心) 越南 Fujinon 系统 HMU 600 + IGH 600;BKAI 构成为 1000 WLI+60 LCI+70 FICE+70 BLI 1200
合计 — — — 3934(论文口径)

中心分布极不均衡:Bærum 2724 张(约 69%)、越南 1200 张(约 30%)、Karolinska 仅 40 张(约 1%)。这与任务头"三中心"的平衡印象相反——Karolinska 本质是补充性的小样本,其统计结论(尤其联邦学习 center-wise)受此硬约束。任何"跨中心泛化"结论都必须先对齐这个 2724:1200:40 的构成。

两个上游血缘必须记清:

  1. HyperKvasir(rid 693)→ PolypDB Center 1:HyperKvasir 含 99417 帧内镜图像与 374 段视频,PolypDB 从中"打捞"未标注的息肉帧并首次赋予真值。论文强调这一点的价值:“we are making use of unlabelled frames, which were never explored for the development of new tools.”——即把从未被利用的未标注数据盘活。
  2. BKAI-IGH(rid 84)→ PolypDB Center 3:越南 1200 张图像中,BKAI 部分(1000 WLI+60 LCI+70 FICE+70 BLI)与已入库的 BKAI-IGH NeoPolyp 数据集同源。PolypDB ≠ BKAI-IGH,但包含其图像,二者是聚合与单中心的关系。

2.2 模态构成与"3904 vs 3934"的数字缺口

论文 §III-A 给出实验所用的模态级图像数,这是全文最可核验的模态分布:

模态 图像数 全称 设备/品牌
WLI 3558 White Light Imaging(白光成像) Olympus / Fujinon 通用
NBI 146 Narrow Band Imaging(窄带成像) Olympus 系
LCI 60 Linked Color Imaging(联动彩色成像) Fujinon 系
BLI 70 Blue Light Imaging(蓝光成像) Fujinon 系
FICE 70 Flexible spectral Imaging Color Enhancement(柔性光谱色彩增强) Fujinon 系
合计 3904 — —

关键缺口:3558+146+60+70+70 = 3904,与全文宣称的总数 3934 相差 30 张。论文对此未作解释。可能的来源是 Center 2(Karolinska)的 30 张 WLI 在模态统计中未被计入(3558 若不含 Karolinska 的 30 张则更接近其他口径),但论文未说明——这构成需存照的双口径(坑 A)。引用时务必写明你用的是哪个数。

从占比看,WLI 占 91%(3558/3904),而 BLI/FICE/LCI 各仅 60-70 张、NBI 146 张——"五模态"的说法在覆盖广度上成立,但在样本量上四模态是少数派。这直接影响各模态基准的统计功效:LCI 仅 60 张时,10% 测试集只有 6 张,任何单模态指标的置信区间都相当宽。

2.3 双视图组织:模态视图与中心视图

PolypDB 的一个结构特色是同一批图像按两种维度切分组织,供不同研究目标取用:

视图 子目录 每目录内容 适用任务
模态视图 BLI / FICE / LCI / NBI / WLI images + annotations(分割掩码) 研究"不同成像模态对分割的影响"
中心视图 Simula / Karolinska / BKAI(GitHub 口径) images + annotations + bounding_boxes 研究"跨中心分布漂移与泛化"

目录命名坑:GitHub README 的中心视图目录写作 Simula / Karolinska / Vietnam(另一处写 Simula/Karolinska/BKAI),而论文 center-wise 实验结果标注为 BKAI / Karolinska / Bærum。三处名称指向同一批中心但用词不一——“Simula”(挪威 SimulaMet 研究机构)与"Bærum 医院"并非同一实体,检索文件树时务必以实际目录内容为准(坑 E)。

2.4 图像规格与格式

属性 规格
图像格式 JPEG(全部图像统一 JPEG 压缩)
最小分辨率 1280 × 720 像素(纳入标准硬门槛)
分割输入尺寸 512 × 512(训练时统一 resize)
检测输入尺寸 640 × 480(训练时统一 resize)
掩码配对 图像与分割真值同名,便于配对加载
标注工具 Labelbox(在线平台)+ Wacom Cintiq(描边数位屏)
检测标签格式 COCO 格式(GitHub coco_labels/ 目录)
划分文件 GitHub dataset-split/ 目录,80%/10%/10%

2.5 纳入与排除标准:数据质量的门槛

PolypDB 通过严格的纳入/排除标准保证图像质量,这是"curated"(精编)一词的实质:

纳入标准(Inclusion):原生结直肠息肉图像;WLI 或 FICE 模式;最小分辨率 1280×720;息肉边界必须清晰可辨;肠道准备评分 BBPS ≥ 2(Boston Bowel Preparation Score,波士顿肠道准备评分,衡量视野清洁度,≥2 表示肠道清洁良好)。

排除标准(Exclusion):息肉已被切除或在网兜中运送的帧;图像质量差的帧(模糊、抖动、过暗、有反光/眩光、被粪便/血液/黏液遮挡);注射了蓝色染料或圈套器套住息肉颈部的帧;切除创面被血覆盖、残留息肉不清的帧;无法判断是息肉还是工具残留的帧;显示正常解剖结构或处于其他图像增强模式(BLI/LCI,当用于分割纳入时)的帧;含内镜器械(cap、注射针、圈套器、活检钳、夹子)的帧。

这套标准的临床合理性在于:息肉分割模型若在"血糊糊的创面"或"器械遮挡"帧上训练,会学到与息肉形态无关的伪特征。PolypDB 选择只保留"边界清晰、肠道清洁、无器械干扰"的干净帧——代价是图像偏向理想条件,真实手术中大量低质量帧被排除在外(这一取舍对"真实世界鲁棒性"的影响需在选型时权衡)。

2.6 伦理与隐私

三中心各自完成合规流程(论文 Table II):Bærum 获数据监察批准、伦理豁免、无需患者同意;Karolinska 按 GDPR 完全匿名(fully anonymized)、需书面知情同意(written informed consent);越南 HMU/IGH 完全匿名、无需额外伦理批准。三地流程共同覆盖三项:必要时取得患者知情同意、经数据监察机构/伦理委员会审核、按本国隐私法规在导出前去标识化。团队在"潜在收益高于潜在风险"的判断下公开该数据集——对医学影像数据集而言,这是标准的伦理正当性论证。

2.7 目录结构与实践加载

PolypDB 的目录结构在 GitHub README 中有完整描述,两种视图的树形如下(据 README 原文):

模态视图(Modality-based):

PolypDB/
├── BLI/
│   ├── images/
│   └── annotations/
├── FICE/
│   ├── images/
│   └── annotations/
├── LCI/
│   ├── images/
│   └── annotations/
├── NBI/
│   ├── images/
│   └── annotations/
└── WLI/
    ├── images/
    └── annotations/

中心视图(Center-wise):

PolypDB/
├── Simula/
│   ├── images/
│   ├── annotations/
│   └── bounding_boxes/
├── Karolinska/
│   ├── images/
│   ├── annotations/
│   └── bounding_boxes/
└── BKAI/
    ├── images/
    ├── annotations/
    └── bounding_boxes/

(注意:README 正文另有一处把第三目录写作 Vietnam/,与 BKAI/ 指同一中心——见坑 5。)

实践加载三步:

  1. 从 OSF(osf.io/pr7ms)下载数据,按 README 目录结构解压到对应文件夹;
  2. 分割任务:在对应视图下,images/ 与 annotations/ 中同名文件配对(图像与掩码同名是设计约定,简化 DataLoader 配对逻辑);
  3. 检测任务:使用中心视图下的 bounding_boxes/,或 GitHub 仓库的 coco_labels/(COCO 格式 JSON);划分用仓库的 dataset-split/(80/10/10)。

配对约定的工程价值:图像与掩码同名可让 Dataset.__getitem__ 直接从文件名派生掩码路径,无需额外映射表——这是大型分割数据集常见的工程简化,PolypDB 沿用了这一惯例。

2.8 图像偏斜的统计含义

把模态与中心的样本量放到一张表里,能看清 PolypDB 的"长尾结构":

维度 主导项 主导占比 长尾项 长尾占比
模态 WLI(3558) 约 91% BLI/FICE/LCI(各 60-70) 各约 2%
中心 Bærum(2724) 约 69% Karolinska(40) 约 1%
任务 分割(全量) 100% 检测(中心视图) 子集

对使用者的三条建议:

  1. 训练多模态模型时须做类别/模态平衡:若直接按原始分布采样,WLI 会主导梯度,BLI/FICE/LCI 学不好。建议按模态重采样或加权。
  2. 做中心泛化研究时须报告各中心样本量:Karolinska 的 40 张不足以支撑强结论,应作为"示例性"而非"显著性"证据。
  3. 引用单模态指标时须注样本量:LCI mIoU 0.8567 看着漂亮,但基于 60 张(测试集 6 张),置信区间极宽,不可与 WLI(3558 张)的指标等量齐观。

2.9 数据集要解决的五个分割难点

论文在引言中系统列出了息肉分割之所以困难的五类原因,这也是 PolypDB 图像"多样性"的来源——理解它们才能理解数据集价值:

难点 具体表现 对模型的影响
(i) 形态时间演化 息肉在发育阶段形态随病程变化 训练集需覆盖不同发展阶段
(ii) 低对比 息肉形状/大小/颜色/外观与周围黏膜高度相似 边界模糊,模型易漏切或过切
(iii) 黏液伪装 黏液覆盖息肉形成"迷彩",连专家都可能被骗 即使 SOTA 也可能误判
(iv) 成像伪影 模糊、眩光、光照过强/过弱、反光、低对比 引入与病变无关的伪特征
(v) 器械与残留干扰 手术器械、肠道残留物遮挡边界 边界判断受污染

这五点的工程含义:一个高质量息肉分割数据集的价值,不在于"图多",而在于是否覆盖了这些难点的多样性。PolypDB 用五模态(对应难点 iv 的设备差异)与三中心(对应难点 i 的人群差异)来扩展这种覆盖。但要注意:PolypDB 的排除标准主动剔除了低质量帧(模糊/眩光/器械遮挡),所以它在难点 (iii)(iv)(v) 上的覆盖是被"提纯"过的——PolypDB 偏向理想成像条件,真实手术中的糟粕帧被排除在外。这是精度与真实性的取舍,选型时须知。

2.10 类别体系:只有"息肉 vs 背景"

与 PANDA-PLUS 的多类掩码(Benign/GP3/GP4/GP5/Ignore 五类)不同,PolypDB 的分割掩码是二值的:息肉区域(foreground)vs 背景/正常黏膜(background)。这带来三处使用约束:

  1. 无法用于"息肉类型分割":不能区分腺瘤性、增生性、锯齿状病变——这些需要病理或内镜形态标签。
  2. 区域定义偏"ROI":掩码标注的是"被息肉覆盖的区域",不细分内部结构。
  3. 检测框 vs 分割掩码:检测任务用边界框(bounding box),分割任务用像素掩码;论文为所有图像同时提供两者,故两个任务共用同一批图像。

这一简化的合理性:息肉分割的主流下游任务是"完整切除确认"(判断切缘是否有残留)与"面积估算",这些只需二值区域掩码即可。分类与分型是另一条任务线(光学活检),需要不同的标签体系——PolypDB 明确不越界。

2.11 五模态的临床与工程含义详解

五种成像模态不只是"不同的滤镜",它们背后是不同的临床用途与技术原理:

模态 全称 技术原理 临床用途 品牌生态
WLI White Light Imaging 标准白光照明 常规观察、最通用 全品牌
NBI Narrow Band Imaging 窄带蓝绿光(415/540nm)突出表面微血管与黏膜纹理 早期癌、微小病变观察 Olympus
BLI Blue Light Imaging 蓝光+荧光,增强表面血管与黏膜对比 病变检测与分型 Fujinon
LCI Linked Color Imaging 联动增强红白对比,提升黏膜色彩分离度 炎症、病变边界观察 Fujinon
FICE Flexible spectral Imaging Color Enhancement 光谱估计后重组波长,模拟多种染色 病变增强(类似 NBI 效果) Fujinon

工程含义:

  1. 设备生态差异:NBI 是 Olympus 的招牌技术,BLI/LCI/FICE 是 Fujinon 的技术——PolypDB 同时覆盖两家,对"跨品牌模型"研究有独特价值。
  2. 图像分布差异大:同一息肉在 WLI 与 BLI 下的颜色分布截然不同(蓝光模式下红绿通道被抑制),这解释了 §5.1 中各模态指标的巨大差异。
  3. 模态专属模型 vs 统一模型:论文结果显示"单一方法无全模态最优"(§5.1),提示实际部署中可能需要"按模态选模型"或"训练模态感知的统一模型"——这是 PolypDB 提出的开放问题。

2.12 上游数据集复用链的完整图谱

PolypDB 的图像来源可画成一条清晰的复用链,理解它对"避免重复下载"和"追溯数据血缘"至关重要:

NCBI/公开资源生态
├── HyperKvasir(110,079 图 + 374 视频,含未标注类)
│   └── → PolypDB Center 1:打捞 3000 WLI 候选 → 采纳 2588 WLI
│       └── → 打捞 136 NBI
├── BKAI-IGH(越南息肉数据集)
│   └── → PolypDB Center 3:1200 张(1000 WLI + 60 LCI + 70 FICE + 70 BLI)
└── Karolinska 医院原始数据(GDPR 匿名)
    └── → PolypDB Center 2:40 张(30 WLI + 10 NBI)
        ↓
    PolypDB 聚合 = Center1 + Center2 + Center3 = 3934 张(论文口径)

三条血缘的实践意义:

  1. 与 HyperKvasir 去重:若你已下载 HyperKvasir,其"未标注类"中的息肉帧已被 PolypDB 重新标注——两者有图像重叠,但标注状态不同(HyperKvasir 无息肉掩码,PolypDB 有)。
  2. 与 BKAI-IGH 去重:PolypDB 的越南部分 = BKAI-IGH 的图像,做"跨数据集训测"时须警惕两者不是独立的测试集。
  3. Karolinska 独占:只有 40 张,且不来自其他公开数据集,是 PolypDB 唯一的"独家数据"——但也正因为量少,其统计价值有限。

这一复用链的启示:PolypDB 的价值不在于"采集了多少新数据",而在于"把分散在多个公开数据集里的息肉图像,用统一的标注规范与专家质控重新组织成多模态多中心的整体"。这是一种"数据编排(data curation)"的贡献,与"数据采集(data collection)"同样重要。

§3 标注方法论:单人描边 + 双专家交叉复核 + 独立全量终审

3.1 三层质控结构

PolypDB 的标注流程设计可归纳为"机械劳动集中、判断分散复核":

环节 执行者 职责 覆盖范围
描边(annotation) 1 名资深研究助理(数据治理背景) 用 Labelbox + Wacom Cintiq 逐帧勾勒息肉 ROI 区域 全部 3934 张
交叉复核(cross-verification) 每张由至少 2 名高级胃肠病专家 判断帧是否真含息肉 + 标注是否临床可接受 全部图像(每张≥2 人)
独立终审(independent review) 1 名独立高级胃肠病专家 复核全部 3934 张图像 全量 100%

设计要义:描边用单人是为了消除"多个标注者对同一形态的不同描边习惯"带来的异质性(论文原文:“to minimize the heterogeneity in the manual delineation process”);而复核用多人 + 全量终审是为了覆盖单人可能的系统性偏差。这与 PANDA-PLUS 的"学生初注→高年级复核→专家终审"三层流水线是同一思路的不同实现——PolypDB 把"劳动层"压缩到一人(因为有数位屏工具降低门槛),把"判断层"扩展为双专家+独立终审。

3.2 复核流程的两道关

每张图像在终审时依次过两关:

  1. 帧级关(是否含息肉):胃肠病专家先判断"这一帧是否代表结肠息肉、是否应纳入数据集"。不含息肉或无法确认的帧被剔除——这解释了为什么从 3000 张 WLI 候选中最终只采纳 2588 张(其余按排除标准剔除)。
  2. 标注级关(标注是否准确):专家检查帧内每个息肉的标注是否"correct"且临床可接受,不准确的标注被调整,非息肉图像被移除。

3.3 与库内其他息肉数据集标注工艺的对照

把库内息肉数据集的标注方式横向摆开,能看到"规模—保真度—成本"的三角取舍:

数据集 规模 标注层级 质控方式 模态覆盖
Kvasir-SEG(rid 112) 1000 图 像素级掩码 专家标注 单模态(WLI)
BKAI-IGH NeoPolyp(rid 84) 1000 图 像素级掩码 专家标注 单中心(越南)
PolypGen(rid 183) 1531 图 + 2000 帧 像素级掩码 多中心专家 单模态为主
PolypDB(本条目) 3934 图 像素级掩码+检测框 单人描边+≥2 专家交叉+独立全量终审 五模态 IEE

PolypDB 的位置:规模上它不是最大(CVC-VideoClinicDB/ASU-Mayo 更大但已下架),但它是**唯一同时具备"五模态 + 三中心 + 双任务标注 + 全量独立终审"**的组合。对使用者而言,其标注质量的核心卖点是"独立专家复核 100% 图像"——这在千张级数据集里属于高成本配置。

3.4 标注粒度的临床取舍

PolypDB 的掩码回答的是"息肉占哪些像素"(二值/区域级 ROI),不是"息肉属于哪一病理类型"(无组织学分级标签),也不含"息肉大小/形态(Paris 分型)"标签。这意味着:

  1. 支持:息肉区域分割(二分类 foreground/background)、息肉检测(bounding box)。
  2. 不支持:腺瘤 vs 增生性息肉的分类、SSL(sessile serrated lesion,无蒂锯齿状病变)识别、息肉恶性程度预测——这些需要病理或内镜形态学标签,PolypDB 未提供。
  3. 对"光学活检"(optical biopsy,内镜下即时判断息肉类型)类研究,PolypDB 只能作为分割预处理,不能作为分类监督。

3.5 标注成本经济学:为什么"单人描边+多人复核"是合理设计

标注像素级医学掩码的成本结构值得拆解。对息肉分割任务而言,单张图像的成本大致分三段:

成本段 工作量 可摊销性
描边(机械劳动) 沿息肉边界逐点勾勒 高(可培训、可工具加速)
判定(专业判断) 判断边界何处属息肉/黏膜 低(需胃肠病专业知识)
复核(质量控制) 交叉检查、修正错误 中(可分层,专家只查关键处)

PolypDB 的设计把"描边"交给单人(降低多人描边的异质性),把"判定与复核"交给多名专家(≥2 名交叉 + 1 名独立全量)——这是对成本结构的精准匹配:机械劳动集中化以保一致性,专业判断分散化以保可靠性;而用 Wacom Cintiq 数位屏进一步降低"描边"的边际成本。

对比 PANDA-PLUS 的三层流水线(学生→高年级→专家):PANDA-PLUS 用"学生劳动力"压缩描边成本、用"专家终审"保质量;PolypDB 用"单人+数位屏"压缩描边成本、用"双专家交叉+独立终审"保质量。两者殊途同归——核心都是把专家的稀缺时间从机械劳动中解放出来。区别在于 PANDA-PLUS 的规模更大(546 张 WSI,每张 gigapixel),需要学生分层;PolypDB 的规模是数千张小图,单人描边已可承受。

3.6 质量控制的可验证性

一个质控流程好不好,看它是否可被使用者独立验证。PolypDB 的质控有三条可追溯线索:

  1. 纳入/排除标准的显式化:论文列出完整的纳入与排除条件(分辨率、BBPS、边界清晰度、无器械等),使用者可据此判断"我的场景是否符合数据分布"。
  2. 中心级数据采集记录:论文 Table II 记录每个中心的设备型号与伦理流程,可追溯"某张图来自什么设备、什么合规背景"。
  3. 复审层级的书面描述:"≥2 名专家交叉 + 1 名独立全量终审"是可复制的流程模板。

不足:PolypDB 未公开标注一致性指标(如专家间 IoU/Dice),也未逐张给出"由哪几位专家复核"的元数据——这意味着使用者无法量化"标注噪声有多大"。相比之下,PANDA-PLUS 公开了重标注与原标签的一致性统计。这是 PolypDB 在"标注透明性"上可改进之处。

3.7 与"众包标注"的对照

另一条常见的低成本标注路线是众包(crowdsourcing),即让非专家群体大量标注、用聚合(如多数投票)去噪。PolypDB 明确选择了"少而精"而非"多而杂":

路线 标注者 质控 规模上限 适用
众包聚合 非专家群体 多人投票去噪 极大 标注标准极清晰、可判定的任务
PolypDB 模式 单人描边 + 专家复核 交叉+全量终审 数千级 需要专业判断的医学分割
纯专家手标 专家本人 专家间一致性 百张级 最高保真、小样本基准

息肉分割需要判断"边界何处属病变黏膜",这是有专业门槛的判定,非专家众包难以胜任——这正是 PolypDB 选"单人描边+专家复核"的原因。三条路线各对应不同的"成本-保真度"权衡点,PolypDB 落在"数千张级、专业保真"的位置。

§4 与既有息肉数据集的关系边界

4.1 论文 Table I 的景观定位

论文用一张对照表(Table I)把"≥1000 样本"的结肠息肉数据集摆在一起,PolypDB 的定位一目了然:

数据集 内容 规模 可获取性 模态
Kvasir-SEG 息肉 1000 图(含掩码) open academic 单模态 WLI
HyperKvasir GI 发现+息肉 110,079 图 + 374 视频 open academic 混合
Kvasir-Capsule GI 发现+息肉 4,741,504 图 open academic 胶囊内镜
CVC-VideoClinicDB 息肉 11,954 图(含掩码) by request(已下架) 视频帧
ASU-Mayo polyp DB 息肉 18,781 图(含掩码) by request(已下架) 视频帧
BKAI-IGH 息肉 1000 图(含掩码) open academic 单中心越南
PolypGen 息肉 1531 图 + 2000 视频帧 open academic 多中心
PolypDB(本条目) 息肉 3934 图(3 中心) open academic 五模态 IEE

论文表下脚注说明:† 含分割真值掩码;⋄ 视频胶囊内镜;∙ 已不可获取。两个曾经的规模之王(CVC-VideoClinicDB 11954、ASU-Mayo 18781)都已下架——这恰恰凸显 PolypDB "open academic + 公开直链"的可贵:规模不是第一,但"现在还能下载"是第一。

4.2 与库内既有条目的三条关系线

关系线一:血缘上游(被动继承)

  • HyperKvasir(rid 693):PolypDB Center 1 的 2588 WLI + 136 NBI 直接来自 HyperKvasir 未标注类,是最硬的血缘链。
  • BKAI-IGH NeoPolyp(rid 84):PolypDB Center 3 的越南图像与 BKAI 同源,PolypDB 包含 BKAI 图像但定位不同(三中心聚合 vs 越南单中心)。

关系线二:同域对照(横向可比)

  • Kvasir-SEG(rid 112):同为 Jha 团队的息肉分割数据集,PolypDB 可视为其"多模态+多中心"扩展版;研究者常在三者间做跨数据集泛化评测。
  • PolypGen(rid 183):同样主打多中心泛化,但模态以 WLI 为主;PolypDB 在模态多样性上更全面。
  • LDPolypVideo(rid 163):息肉视频数据集,与 PolypDB 的"视频抽帧成静态图"形成互补——PolypDB 是帧级静态,LDPolypVideo 保留时序。

关系线三:下游/邻域(任务接续)

  • NCT-CRC-HE-100K(rid 148):结直肠癌组织病理分类(同一疾病的病理侧,模态不同)。
  • GastroVision(rid 203)/ EndoSLAM(rid 408)/ Endoscapes(rid 353):GI 内镜与腹腔镜邻域数据集,同属"内镜 AI 数据生态"。

4.3 "PolypDB ≠ 其他 polyp 数据集"的边界声明

检索者最容易犯的错是把同域数据集混为一谈。明确边界:

  1. PolypDB ≠ PolypGen:PolypGen(Ali 等 2023)是另一个多中心息肉检测分割数据集,规模 1531 图 + 2000 帧,样本量与 PolypDB(3934)不同,团队也不同(PolypGen 以 Leeds/Oxford 的 Sharib Ali 为主导,与 PolypDB 的 Northwestern/Jha 是不同主导方,虽有作者交叉)。
  2. PolypDB ≠ LDPolypVideo:后者是视频数据集,前者是静态帧数据集。
  3. PolypDB ≠ BKAI-IGH:PolypDB 的越南部分来自 BKAI,但 PolypDB 是三中心五模态聚合,BKAI-IGH 是越南单中心——是"包含"而非"等同"关系。
  4. 本库无 polypdb 别名撞库(DB 查重仅命中 bkai-igh-neopolyp/polypgen/ldpolypvideo 三条不同条目),slug 唯一。

4.4 与 PANDA-PLUS 的模式同构(跨模态方法论对照)

一个值得库内交叉阅读的方法论对照:PolypDB 的 Center 1 与 PANDA-PLUS 采用了同一种"旧数据重标注"策略——都从既有公开数据集(HyperKvasir / PANDA)中挖出未被利用的未标注资源,重新赋予高质量标签:

维度 PANDA-PLUS(病理 WSI) PolypDB(内镜)
上游 PANDA 挑战赛 WSI HyperKvasir 未标注类 + BKAI
增量 像素级 Gleason 掩码 像素级息肉掩码(+四模态扩展)
质控 学生+高年级+专家终审 单人描边+双专家交叉+独立全量终审
核心发现 原 PANDA 高级别标签系统性错误 多模态多中心可提升泛化(未做原标签审计)

两者都回答"如何用有限专家资源把旧数据升级为 AI-Ready 资产",但 PANDA-PLUS 附带对上游标签的批判审计,PolypDB 则附带多模态基准——前者是"质检报告",后者是"扩展包"。

4.5 与库内 Kvasir 家族的三代演进

把 Jha/Riegler/de Lange 挪威系的工作按时间线排开,能看到息肉数据集的"三代演进":

代际 数据集 年份 规模 模态 核心增量 库内 rid
一代 Kvasir-SEG 2020 1000 图 单模态 WLI 首个大规模息肉分割基准 112
一代 HyperKvasir 2020 11 万图/374 视频 混合 GI 综合 GI 内镜多分类资源 693
二代 Kvasir-Capsule 2021 474 万图 胶囊内镜 胶囊内镜视频资源 123
二代 Kvasir-Instrument 2021 内镜器械 单模态 器械分割 213
三代 PolypDB 2024 3934 图 五模态 多中心+多模态+联邦基准 本条目

演进逻辑:一代解决"从无到有"(首个公开息肉分割集),二代拓展模态/对象(胶囊内镜、器械),三代解决"泛化"(多中心多模态)。PolypDB 站在 Kvasir 家族的肩膀上——它的图像来源(HyperKvasir)正是家族成员——但把焦点从"规模"转向"多样性"。这条谱系也解释了为什么 PolypDB 作者阵容里有多位 Kvasir 系列的常客(Jha、Riegler、Halvorsen、de Lange)。

4.6 与越南 BKAI 系的关系:包含而非等同

BKAI-IGH NeoPolyp(rid 84)是越南背景的息肉分割数据集(BKAI = Hanoi University of Science and Technology 的 BKAI 研究中心,IGH = Institute of Gastroenterology and Hepatology)。PolypDB 的 Center 3 明确复用了 BKAI 的越南图像:

  • BKAI 贡献:1000 WLI + 60 LCI + 70 FICE + 70 BLI = 1200 张(与 PolypDB Center 3 的 1200 张吻合)。
  • 关系:PolypDB 包含 BKAI-IGH 的图像,但增加了 Bærum 与 Karolinska 两个中心、补齐了 NBI 模态、统一了标注规范、提供了跨中心基准。
  • 实践含义:若已下载 BKAI-IGH,再下 PolypDB 会发现越南部分是重叠的——做去重研究时须注意这一包含关系。

4.7 数据集选型决策树

给"该选哪个息肉数据集"一个可直接操作的决策树:

你的任务是什么?
├─ 单模态 WLI 息肉分割(小规模入门)
│   └─ → Kvasir-SEG(rid 112,1000 图)
├─ 多模态息肉分割(关注设备差异)
│   └─ → PolypDB(本条目,五模态)
├─ 多中心泛化/域适应研究
│   ├─ 以模态为漂移源 → PolypDB 模态视图
│   ├─ 以中心为漂移源 → PolypDB 中心视图 / PolypGen(rid 183)
│   └─ 隐私约束下的协作 → PolypDB 联邦基线(FedAvg)
├─ 息肉视频时序分析
│   └─ → LDPolypVideo(rid 163)
└─ 结直肠癌病理(组织学)
    └─ → NCT-CRC-HE-100K(rid 148)

这张树的每一分支都对应一个库内条目——息肉 AI 的数据生态在库内已形成从"内镜成像"到"组织病理"、从"静态帧"到"视频"、从"单模态"到"五模态"的完整覆盖。

4.8 与库内三个最相关条目的深度对照

把 PolypDB 与库内最相关的三个息肉数据集逐维度对照,供选型直接查表:

维度 PolypDB(本条目) PolypGen(rid 183) LDPolypVideo(rid 163) Kvasir-SEG(rid 112)
数据类型 静态图像 图像 + 视频帧 视频 静态图像
规模 3934 图 1531 图 + 2000 帧 视频序列(1.6 万+帧) 1000 图
模态 五模态(BLI/FICE/LCI/NBI/WLI) 单模态为主(WLI) 单模态(WLI) 单模态(WLI)
中心数 3 多中心 单/多中心 单中心
标注 分割掩码 + 检测框 分割掩码 检测框 分割掩码
基线 分割 8 + 检测 5 + 联邦 10 分割/检测 检测/跟踪 分割
获取 OSF 公开直链 部分申请 公开 公开
任务侧重 多模态多中心泛化 多中心泛化 时序检测 基础分割

选型速答:

  • 要多模态→ PolypDB。
  • 要多中心泛化对照→ PolypDB + PolypGen。
  • 要视频/时序→ LDPolypVideo。
  • 要入门小规模分割→ Kvasir-SEG。

4.9 与 BKAI-IGH(rid 84)的定量重叠分析

PolypDB 与 BKAI-IGH 的重叠是库内最需要澄清的"数据血缘":

项 BKAI-IGH NeoPolyp PolypDB Center 3 重叠判定
WLI 1000 1000(BKAI 部分) 完全重叠
LCI — 60 PolypDB 新增
FICE — 70 PolypDB 新增
BLI — 70 PolypDB 新增
NBI — 0 均无
总量 1000 1200 越南部分 PolypDB ⊇ BKAI

结论:PolypDB 的越南部分包含 BKAI-IGH 的全部图像(1000 WLI)并新增 200 张多模态图像(60 LCI + 70 FICE + 70 BLI = 200)。因此:

  1. 若做"PolypDB vs BKAI-IGH"的跨集评测,越南部分是泄漏的(两者同图),只能用 PolypDB 的挪威/瑞典部分 vs BKAI。
  2. 若引用"越南息肉数据",PolypDB 的越南部分是 BKAI-IGH 的超集。
  3. 互链时须写明"PolypDB 的越南中心复用并扩展了 BKAI-IGH",避免读者误以为二者独立。

4.10 一句话记住 PolypDB 的边界

  • 它给你:3934 张多模态多中心息肉图像的区域掩码与检测框,以及三套可对标基线。
  • 它不给:息肉的组织学类型、Paris 分型、大小分级、视频时序。
  • 它包含:HyperKvasir 的息肉帧、BKAI-IGH 的越南图像(做去重与跨集评测时须留意)。
  • 它的门槛:零——OSF 公开直链。

把握这四条边界,就能在实际项目中正确使用 PolypDB,避免"以为它有分类标签"或"把它和 BKAI 当独立测试集"这类常见误用。

§5 基准结果:分割、检测与联邦学习三套基线

5.1 分割基线(8 方法 × 5 模态)

论文用 8 个分割方法在五个模态上分别评测,指标为 mIoU、mDSC(mean Dice Similarity Coefficient)、Recall、Precision、F2。各模态最佳结果(clean 条件):

模态 最佳方法 mIoU mDSC Recall Precision F2
BLI DuAT(PVTv2-B2) 0.6979 0.8048 0.9082 0.7647 0.8501
FICE SSFormer-L(MiT-PLD-B4) 0.7607 0.8300 0.8713 0.8013 0.8526
LCI SSFormer-L 0.8567 0.9207 0.9057 0.9466 0.9106
NBI PVT-CASCADE(PVTv2-B2) 0.7769 0.8586 0.9385 0.8320 0.8941
WLI SSFormer-L 0.8821 0.9294 0.9314 0.9438 0.9288

四个直接可读的结论:

  1. WLI 整体最高、BLI/FICE 整体最低:WLI 最佳 mIoU 0.8821,而 BLI 最佳仅 0.6979、FICE 0.7607——相差约 12-18 个点。原因是 WLI/FICE 训练样本充足(WLI 3558、FICE 70)但 BLI 仅 70 张,且白光成像对息肉与黏膜的对比度最符合常规标注习惯;蓝光/色彩增强模式改变了颜色分布,模型迁移困难。
  2. 无单一方法横扫全模态:DuAT 赢 BLI、PVT-CASCADE 赢 NBI、SSFormer-L 赢 FICE/LCI/WLI。这表明"选对架构"高度依赖模态——没有一个通用最优分割器,这正是多模态基准的价值。
  3. SSFormer-L 最稳定:五个模态中拿下三个第一、两个第二,综合最强。其主干是 MiT-PLD-B4(SegFormer 系列的轻量 transformer)。
  4. PVT-CASCADE 与 DuAT 分列二强:都基于 PVTv2-B2 主干,说明该骨干对息肉分割的全局上下文建模有效(论文将 PVT-CASCADE 的成功归因于 PVTv2-B2 的全局+局部特征提取能力)。

全方法逐模态补充(部分):U-Net 在所有模态垫底(BLI mIoU 仅 0.1822、FICE 0.1384),显示原始 U-Net 在息肉边界模糊与低对比场景下严重失效;PraNet、CaraNet、TGANet 居中;DeepLabV3+ 在 LCI(0.8066)和 WLI(0.8650)表现稳健但未夺冠。

5.1.1 完整分割结果表(8 方法 × 关键模态)

为便于对标,这里给出各方法的完整 clean 分割指标(mIoU / mDSC):

WLI(样本最多,最稳定):

方法 主干 mIoU mDSC Recall Precision F2
U-Net — 0.7452 0.8250 0.8275 0.8936 0.8203
DeepLabV3+ ResNet50 0.8650 0.9168 0.9183 0.9380 0.9157
PraNet Res2Net50 0.8570 0.9089 0.9046 0.9460 0.9042
CaraNet Res2Net101 0.8582 0.9128 0.9149 0.9322 0.9114
TGANet ResNet50 0.8536 0.9088 0.9165 0.9284 0.9104
PVT-CASCADE PVTv2-B2 0.8731 0.9219 0.9268 0.9372 0.9227
DuAT PVTv2-B2 0.8695 0.9197 0.9170 0.9437 0.9168
SSFormer-L MiT-PLD-B4 0.8821 0.9294 0.9314 0.9438 0.9288

LCI(样本仅 60,指标偏高但置信区间宽):

方法 主干 mIoU mDSC Recall Precision F2
U-Net — 0.3513 0.4712 0.5526 0.7644 0.4955
DeepLabV3+ ResNet50 0.8066 0.8898 0.8694 0.9294 0.8758
PraNet Res2Net50 0.7936 0.8825 0.8890 0.8992 0.8834
CaraNet Res2Net101 0.7600 0.8576 0.8335 0.9190 0.8398
TGANet ResNet50 0.8358 0.9061 0.8816 0.9474 0.8899
PVT-CASCADE PVTv2-B2 0.8344 0.9065 0.9074 0.9205 0.9056
DuAT PVTv2-B2 0.8551 0.9194 0.9200 0.9247 0.9191
SSFormer-L MiT-PLD-B4 0.8567 0.9207 0.9057 0.9466 0.9106

NBI(样本 146):

方法 主干 mIoU mDSC Recall Precision F2
U-Net — 0.2161 0.2986 0.6472 0.2622 0.3905
DeepLabV3+ ResNet50 0.6881 0.7733 0.8279 0.8511 0.7939
PraNet Res2Net50 0.6749 0.7473 0.7816 0.8836 0.7618
CaraNet Res2Net101 0.7249 0.8090 0.8312 0.8781 0.8194
TGANet ResNet50 0.7317 0.8402 0.8368 0.8645 0.8354
PVT-CASCADE PVTv2-B2 0.7769 0.8586 0.9385 0.8320 0.8941
DuAT PVTv2-B2 0.7494 0.8260 0.8662 0.8741 0.8476
SSFormer-L MiT-PLD-B4 0.7608 0.8432 0.9089 0.8462 0.8664

BLI(样本 70,除 LCI 外最难):

方法 主干 mIoU mDSC Recall Precision F2
U-Net — 0.1822 0.2855 0.6862 0.2180 0.3962
DeepLabV3+ ResNet50 0.6055 0.7293 0.8462 0.7146 0.7751
PraNet Res2Net50 0.6581 0.7831 0.8876 0.7390 0.8348
CaraNet Res2Net101 0.5853 0.7237 0.6895 0.8052 0.6978
TGANet ResNet50 0.5217 0.6520 0.8108 0.6344 0.7076
PVT-CASCADE PVTv2-B2 0.6737 0.7873 0.8750 0.7748 0.8205
DuAT PVTv2-B2 0.6979 0.8048 0.9082 0.7647 0.8501
SSFormer-L MiT-PLD-B4 0.6750 0.7848 0.8436 0.7708 0.8091

FICE(样本 70,SSFormer-L 最优):

方法 主干 mIoU mDSC Recall Precision F2
U-Net — 0.1384 0.2021 0.5600 0.1425 0.2840
DeepLabV3+ ResNet50 0.6129 0.6759 0.6653 0.9441 0.6668
PraNet Res2Net50 0.6013 0.6513 0.6559 0.7984 0.6530
CaraNet Res2Net101 0.5694 0.6286 0.6082 0.8135 0.6146
TGANet ResNet50 0.5922 0.6898 0.7086 0.7279 0.6960
PVT-CASCADE PVTv2-B2 0.7209 0.7799 0.8110 0.7588 0.7971
DuAT PVTv2-B2 0.5589 0.6746 0.9082 0.5867 0.7729
SSFormer-L MiT-PLD-B4 0.7607 0.8300 0.8713 0.8013 0.8526

从这五张表可提炼三个方法论观察:

  1. U-Net 的崩塌是数据驱动的:在 WLI(大样本)上 U-Net 还能到 0.7452,但在 FICE/BLI(小样本、色彩偏移)上跌到 0.13-0.18——说明朴素 CNN 对模态差异极度敏感。
  2. transformer 主干的稳定性优势:PVTv2-B2 与 MiT-PLD-B4 在五个模态上都没有崩塌(最低也有 0.55+),是"跨模态鲁棒"的关键。
  3. 高 Precision 陷阱:DeepLabV3+ 在 FICE 上 Precision 高达 0.9441,但 mIoU 仅 0.6129、mDSC 0.6759——高精度低召回意味着它只敢在"最有把握"处画掩码,漏掉大量息肉区域。只看 Precision 会误判模型能力。

5.2 检测基线(YOLO 家族)

检测用 YOLOv5/v7/v8/v9/v10 五个版本,指标 mAP50、mAP50-95、mAP75、Precision、Recall。各模态代表结果:

模态 最佳方法(mAP50) mAP50 mAP50-95 备注
BLI YOLOv9 0.688 0.558 YOLOv8 precision 1.000
FICE YOLOv10 0.887 0.752 YOLOv10 precision 1.000 recall 0.853
LCI YOLOv10 0.995 0.831 YOLOv9 mAP50-95 0.878 最优;YOLOv9 recall 1.000
NBI YOLOv9 0.688 0.558 数值与 BLI 完全相同(见坑 4)
WLI YOLOv6(正文)/ YOLOv5(表内) 0.925 / 0.916 0.766 表 IV 无 YOLOv6 行(见坑 B)

读检测结果的三个注意点:

  1. LCI 检测几近完美(mAP50 0.995)但样本仅 60 张——10% 测试集约 6 张,指标波动极大,不可外推。
  2. 表 IV 的 BLI 与 NBI 行数值逐格雷同(0.659/0.502/0.559/1.000/0.318 等六个数完全一致),几乎可断定是制表时的复制错误。NBI 检测结果不可引用(坑 4)。
  3. WLI 检测的"最佳方法"存在正文与表格冲突:正文 §III-C 称"YOLOv6 取得最高 mAP50 0.9250",但表 IV 列出了 5 个 YOLO 版本不含 v6,表内最高是 YOLOv5 的 0.916。这是坑 B 的延伸,引用时以表内可核验值为准。

5.2.1 完整检测结果表(5 YOLO × 各模态)

WLI(大样本,指标最可信):

方法 mAP50 mAP50-95 mAP75 Precision Recall
YOLOv8 0.913 0.766 0.868 0.883 0.880
YOLOv10 0.555 0.391 0.434 0.603 0.525
YOLOv9 0.912 0.757 0.836 0.899 0.856
YOLOv7 0.902 0.710 0.807 0.925 0.872
YOLOv5 0.916 0.766 0.852 0.918 0.872

FICE(YOLOv10 领先):

方法 mAP50 mAP50-95 mAP75 Precision Recall
YOLOv8 0.759 0.667 0.759 0.981 0.625
YOLOv10 0.887 0.752 0.875 1.000 0.853
YOLOv9 0.856 0.711 0.737 0.937 0.750
YOLOv7 0.734 0.642 0.734 0.856 0.750
YOLOv5 0.781 0.674 0.781 0.901 0.625

LCI(小样本,指标畸高,慎引):

方法 mAP50 mAP50-95 mAP75 Precision Recall
YOLOv8 0.833 0.771 0.833 1.000 0.667
YOLOv10 0.995 0.831 0.995 1.000 0.854
YOLOv9 0.972 0.878 0.972 0.857 1.000
YOLOv7 0.754 0.581 0.754 0.833 0.833
YOLOv5 0.833 0.687 0.833 1.000 0.667

BLI(YOLOv9 领先;注:NBI 行数值与此表完全相同,见坑 4):

方法 mAP50 mAP50-95 mAP75 Precision Recall
YOLOv8 0.659 0.502 0.559 1.000 0.318
YOLOv10 0.534 0.416 0.485 0.840 0.500
YOLOv9 0.688 0.558 0.638 0.846 0.500
YOLOv7 0.398 0.321 0.362 0.818 0.409
YOLOv5 0.618 0.499 0.534 0.899 0.404

检测结果的四个观察:

  1. 无单一版本横扫:WLI 是 YOLOv5/v8 领先,FICE/LCI 是 YOLOv10,BLI 是 YOLOv9——检测最优版本同样高度依赖模态。
  2. Recoil 普遍偏低:BLI 各方法 Recall 仅 0.318-0.500,说明模型在蓝光图像上"漏检"严重(论文原文指出低 Recall 反映"改善模型预测正例、减少漏检"的挑战)。
  3. Precision 虚高陷阱:BLI 上 YOLOv8 Precision=1.000 但 Recall 仅 0.318——只框最确信的少数息肉,漏掉大多数。这是"高精度低召回"的典型,不能单独看 Precision。
  4. YOLOv10 在 WLI 异常低(mAP50 0.555)与它在 FICE/LCI 领先形成反差——提示 YOLOv10 的端到端设计在本数据集的大样本 WLI 上未发挥优势,可能是训练配置或数据特性所致。

5.3 联邦学习基线(center-wise FedAvg)

这是 PolypDB 区别于普通息肉数据集的关键增量:论文用 FedAvg(Federated Averaging) 算法在三个中心上做联邦分割实验,模拟"数据不出院"的协作训练。注意:联邦实验只用 WLI 图像(三中心唯一共有的模态),且因 Center 1(136 张 NBI)与 Center 2(10 张 NBI)NBI 样本过少而将 NBI 排除。

平均结果与各中心结果(WLI,mIoU / mDSC):

范围 最佳方法 mIoU mDSC 说明
平均(Average) SSFormer-L(MiT-B4) 0.9214 0.9550 PVT-CASCADE 0.9105 / DuAT 0.9109 紧随
BKAI(越南) SSFormer-L 0.9426 0.9696 PVT-CASCADE recall 最高 0.9757
Karolinska(瑞典) DuAT(PVTv2-B2) 0.9396 0.9683 SSFormer-L 0.9186 次之
Bærum(挪威) SSFormer-L 0.9123 0.9487 PVT-CASCADE 与之接近

四个结论:

  1. 联邦学习显著优于单模态中心内训练:联邦平均 mIoU 0.9214 远高于 §5.1 中 WLI 单体训练的 0.8821(SSFormer-L)。这说明三中心数据聚合(即使不出院)对 WLI 分割有实质提升。
  2. SSFormer-L 在联邦场景同样最稳:四组结果中三组第一。
  3. 中心间差异存在但不大:BKAI 最佳(0.9426)> Karolinska(0.9396)> Bærum(0.9123),最大差距约 3 个点。Bærum 虽样本最多(WLI 2588)反而最低,暗示"数据量不是唯一决定因素,中心和设备的分布差异更关键"。
  4. 隐私价值:联邦实验证明"数据不离开医院也能训出接近集中式的模型",这对受 GDPR/HIPAA 约束的医疗机构是重要落地论据(论文 §IV-C 专节讨论)。

联邦方法数与宣称口径冲突:论文摘要/贡献点称联邦用"six federated learning approaches",但 Table V 实列 10 个模型(TransNetR、U-Net、U-NeXt、DeepLabV3+、PraNet、CaraNet、TGANet、PVT-CASCADE、DuAT、SSFormer-L)——口径不一(并入坑 B 的方法数问题)。

5.3.1 完整联邦结果表(Average + 三中心)

Average(三中心等权聚合):

方法 主干 mIoU mDSC Recall Precision F2
TransNetR ResNet50 0.8771 0.9218 0.9289 0.9400 0.9236
U-Net — 0.6362 0.7349 0.7929 0.7648 0.7562
U-NeXt — 0.7049 0.7837 0.7977 0.8554 0.7853
DeepLabV3+ ResNet50 0.9022 0.9423 0.9426 0.9539 0.9408
PraNet Res2Net50 0.9048 0.9438 0.9390 0.9593 0.9397
CaraNet Res2Net101 0.8941 0.9362 0.9324 0.9528 0.9325
TGANet ResNet50 0.8837 0.9290 0.9445 0.9299 0.9345
PVT-CASCADE PVTv2-B2 0.9105 0.9477 0.9541 0.9492 0.9504
DuAT PVTv2-B2 0.9109 0.9478 0.9485 0.9550 0.9465
SSFormer-L MiT-B4 0.9214 0.9550 0.9503 0.9642 0.9517

Bærum(挪威中心):

方法 mIoU mDSC Recall Precision F2
U-Net 0.5683 0.6798 0.7534 0.7074 0.7066
U-NeXt 0.6610 0.7465 0.7645 0.8342 0.7486
DeepLabV3+ 0.8876 0.9323 0.9326 0.9476 0.9302
PraNet 0.8934 0.9356 0.9282 0.9569 0.9296
CaraNet 0.8834 0.9289 0.9215 0.9499 0.9226
TGANet 0.8662 0.9161 0.9385 0.9153 0.9244
PVT-CASCADE 0.8990 0.9399 0.9452 0.9442 0.9417
DuAT 0.8985 0.9391 0.9399 0.9489 0.9372
SSFormer-L 0.9123 0.9487 0.9416 0.9614 0.9439

Karolinska(瑞典中心,样本最小):

方法 mIoU mDSC Recall Precision F2
U-Net 0.6511 0.7287 0.6607 0.9820 0.6830
U-NeXt 0.6711 0.7414 0.7173 0.9449 0.7255
DeepLabV3+ 0.9159 0.9547 0.9225 0.9916 0.9349
PraNet 0.8968 0.9428 0.9087 0.9847 0.9216
CaraNet 0.8921 0.9406 0.9100 0.9802 0.9213
TGANet 0.8285 0.8959 0.9883 0.8340 0.9461
PVT-CASCADE 0.9006 0.9438 0.9148 0.9829 0.9255
DuAT 0.9396 0.9683 0.9510 0.9869 0.9578
SSFormer-L 0.9186 0.9555 0.9257 0.9915 0.9370

BKAI(越南中心):

方法 mIoU mDSC Recall Precision F2
U-Net 0.8072 0.8714 0.8788 0.9193 0.8729
U-NeXt 0.8018 0.8661 0.8660 0.9087 0.8635
DeepLabV3+ 0.9358 0.9656 0.9663 0.9678 0.9656
PraNet 0.9331 0.9640 0.9669 0.9643 0.9654
CaraNet 0.9198 0.9537 0.9613 0.9563 0.9578
TGANet 0.9311 0.9629 0.9608 0.9684 0.9612
PVT-CASCADE 0.9369 0.9659 0.9757 0.9592 0.9713
DuAT 0.9397 0.9679 0.9714 0.9661 0.9698
SSFormer-L 0.9426 0.9696 0.9726 0.9685 0.9711

三个中心对比的读法:

  1. 同一模型在不同中心的排序会变:Average 与 BKAI/Bærum 上 SSFormer-L 第一,但 Karolinska 上 DuAT 第一(0.9396 vs SSFormer-L 0.9186)——说明"最优模型"是中心相关的。
  2. U-Net 在 Karolinska 上 Recall 崩到 0.6607:小样本下朴素 CNN 的泛化力最弱。
  3. 中心间差异约 3 个点:BKAI 最佳方法 0.9426 > Karolinska 0.9396 > Bærum 0.9123——Bærum 样本最多但指标最低,说明样本量不是唯一决定因素。

5.4 对抗鲁棒性(附加实验)

论文额外做了 FGSM(Fast Gradient Sign Method) 对抗攻击实验(Table VI),评估分割模型在输入被添加微小扰动时的鲁棒性——这对医学影像意义重大,因为分割/检测的细微失真可能直接导致误诊:

  • 最脆弱:U-Net(WLI 受攻击后 mIoU 仅 0.0985,几乎完全失效)。
  • 最鲁棒:PVT-CASCADE(WLI 0.6038、BLI 0.5153、FICE 0.4159、NBI 0.2560)与 SSFormer-L(WLI 0.5831、LCI 0.5476)。
  • 结论:基于 transformer 主干(PVTv2/MiT)的模型不仅精度高,抗对抗扰动能力也更强——论文据此主张 PolypDB 不仅可用于精度基准,还可用于鲁棒性研究。

FGSM 攻击下各模型 mIoU(WLI 列,节选 Table VI):

方法 主干 WLI mIoU(攻击后) 相对干净时跌幅
U-Net — 0.0985 从 0.7452 崩至近零(−0.65)
DeepLabV3+ ResNet50 0.4930 从 0.8650 跌至 0.4930
PraNet Res2Net50 0.5732 从 0.8570 跌至 0.5732
CaraNet Res2Net101 0.5363 从 0.8582 跌至 0.5363
TGANet ResNet50 0.4413 从 0.8536 跌至 0.4413
DuAT PVTv2-B2 0.5476 从 0.8695 跌至 0.5476
PVT-CASCADE PVTv2-B2 0.6038 从 0.8731 跌至 0.6038(最鲁棒)
SSFormer-L MiT-PLD-B4 0.5831 从 0.8821 跌至 0.5831

对抗实验的两点解读:

  1. 所有模型在 FGSM 下都显著退化:clean mIoU 0.85-0.88 的模型受攻击后普遍跌到 0.44-0.60,说明息肉分割模型对输入扰动缺乏鲁棒性——这在临床上是隐患(图像压缩、传输噪声都可能触发)。
  2. 主干选择决定鲁棒性:transformer 主干(PVTv2/MiT)普遍比 CNN 主干(ResNet/Res2Net)更抗扰动,尤其 U-Net 受攻击后几乎失效。这与"transformer 学到的特征更全局、更不易被局部扰动破坏"的直觉一致。

5.5 把三套基线放在一起读

分割、检测、联邦三套基线合起来,能给出一条"息肉 AI 部署路线图":

部署阶段 用哪套基线 关注指标
单院部署 分割(Table III)/ 检测(Table IV) mIoU/mDSC、mAP50
多院协作(数据不出院) 联邦(Table V) 平均 + per-center mIoU
安全敏感场景 对抗(Table VI) FGSM 后 mIoU
模态适配 分割逐模态 按模态选模型(无全能模型)

一个关键的工程结论:PolypDB 的三套基线共同说明"息肉 AI 没有银弹"——没有全模态最优的分割器,没有全版本最优的检测器,没有全中心最优的联邦模型。选型必须落到具体场景(哪个中心、哪个模态、是否联邦、是否对抗敏感),这正是 PolypDB 作为"多维度评测台"的价值。

§6 获取与许可:公开直链的门

6.1 三件资产、三个入口

资产 入口 许可 门槛
数据集本体(3934 图+掩码+检测框) OSF https://osf.io/pr7ms/ 未明确(README 称 MIT 但无 LICENSE 文件;OSF license=None) 无(公开直链)
代码/划分/COCO 标签 GitHub DebeshJha/PolypDB README 称 MIT(无 LICENSE 文件) 无
论文 arXiv:2409.00045 CC BY 4.0 无

6.2 可获取性的最大优点:零门槛

PolypDB 在库内息肉数据集里是可获取性最优的一档:OSF 公开直链,无需注册账号、无需提交申请、无需机构审批。这与库内其他模式的对比:

档位 库内参照 本条目对应
注册墙 TCIA/IDC 型 —
请求制 PANDA-PLUS 掩码(rid 560 系) —
平台托管 Zenodo 型 OSF 托管(本条目)
公开直链 HuggingFace/Zenodo 直链型 PolypDB 本体(无门槛)

对工程实践的含义:可以直接把 osf.io/pr7ms 接入数据管线,无需等待审批——这是它相比 PolypGen(部分子集需申请)、BKAI-IGH(部分版本有访问条件)的实操优势。

6.3 许可的灰色地带(重要风险提示)

PolypDB 的许可状况是本条目最需要警示的地方:

  1. 论文有明确许可:arXiv 页脚标注 CC BY 4.0——可自由分享、改编、商用(需署名)。
  2. 数据集许可未明确:GitHub README 末尾写 “This project is licensed under the MIT License - see the LICENSE file for details”,但仓库根目录并无 LICENSE 文件(文件列表只有 coco_labels/、dataset-split/、README.md 及图片)。OSF API 亦返回 license: None、node_license: None。
  3. 衍生模型许可属灰色地带:因数据集本体无明确再分发条款,“用 PolypDB 训练的模型权重能否商用”、"能否再分发图像子集"均无白纸黑字依据。
  4. 引用 DOI 坑:GitHub 引用块给出 doi = {10.1109/TMI.2024.1234567}——这是占位符(尾号 1234567),PolypDB 并未在该 DOI 发表。正确引用应使用 arXiv:2409.00045(或 arXiv DOI 10.48550/arXiv.2409.00045)。

实操建议:学术用途可直接下数据并引用 arXiv 论文;若计划商用或再分发,应主动联系通讯作者(Debesh Jha,debeshjha1@gmail.com)确认许可。切勿把 README 的"MIT"当作已生效许可——它缺少 LICENSE 文件载体。

6.4 AI-Ready 评估

以库内 AI-Ready 检查单过一遍:

  • 机器可读元数据:论文开放获取(CC BY 4.0)+ GitHub README(含目录结构、引用格式)+ COCO 标签 JSON——良好。
  • 公开直链:OSF 公开直链,无门槛——满分项,库内息肉数据集中的可获取性标杆。
  • 许可明确性:失分项——数据集许可未声明(README 称 MIT 无 LICENSE 文件),再分发/商用边界模糊。
  • 可复现性:提供数据集划分文件、COCO 标签、训练超参(epoch/lr/batch/损失函数全给出)——良好;但未提供官方训练代码仓库(仅划分与标签)。
  • 文档自洽:多处数字冲突(模态合计 3904 vs 3934、检测方法 5 vs 6、注释团队 8 vs 10、表 IV BLI/NBI 行雷同)——失分项,自动化抓取需指定以 Table I–VI 为准。
  • 结构与标注质量:双视图组织、像素级掩码、双专家交叉+独立全量终审——优秀。

综合:AI-Ready 等级"中高"——可获取性与标注质量是强项(公开直链 + 全量终审),许可明确性与文档自洽性是短板。对"能否立刻下载"这一最硬指标,PolypDB 表现优于库内多数请求制/注册制数据集。

6.5 合规使用指引:三种用途三套注意

按使用目的分,PolypDB 有三套不同的注意事项:

用途 可做 需注意
学术研究 下载、训练、发表 引用 arXiv:2409.00045(非占位 DOI);说明数据来源与模态
模型商用 训练商用模型 先确认许可——数据集许可未声明,联系通讯作者
数据再分发 转发子集 高风险——README 称 MIT 但无 LICENSE 文件,再分发前须获作者明确授权

关于"病人隐私"的合规边界:三中心已完成去标识化(GDPR 匿名、当地伦理审核),因此使用者无需再对图像做隐私处理——但需遵守各来源国法规(尤其欧盟 GDPR 背景的 Karolinska 图像)。研究者在美国场景下,PolypDB 属"去标识化的公开数据集",通常不构成人类受试者研究(non-human-subjects research),但仍建议所在机构 IRB 备案。

6.6 与 OSF 托管的可获取性优势

PolypDB 选择 OSF(Open Science Framework)作为托管平台,这一选择本身有可获取性意义:

  1. 无需账号即可下载:OSF 公开项目支持匿名下载,无注册墙。
  2. 版本可追溯:OSF 记录 date_created(2024-08-18)与 date_modified(2025-03-03),可追溯数据集版本。
  3. 稳定直链:osf.io/pr7ms 是持久标识,不像某些个人网盘链接会失效。
  4. 可与 GitHub 分工:数据放 OSF(大文件托管)、代码与标签放 GitHub(版本控制)——这是开源医学数据集的常见最佳实践。

对比库内其他托管模式:Zenodo(有 DOI、适合发布快照)、HuggingFace(适合 ML 数据集集成)、TCIA(医学影像专用、需注册)。OSF 的优势是"零门槛 + 持久链接",缺点是无强制 license 字段(本项目即填 None),这是许可模糊的技术根源之一。

§7 通用化与联邦学习:PolypDB 的真正增量

7.1 为什么"多中心多模态"是内镜 AI 的刚需

内镜 AI 面临的核心痛点不是"在单个数据集上刷不高分",而是"换个场景就失效"。造成失效的分布漂移(distribution shift)有三个来源:

  1. 设备漂移:Olympus / Fujinon / Pentax 的图像处理管道不同,同一息肉在 BLI 与 NBI 下的颜色/纹理差异巨大。
  2. 人群漂移:北欧人群与东南亚人群的肠道解剖、饮食习惯、息肉流行病学不同。
  3. 操作漂移:不同操作者的进镜手法、退镜速度、取景习惯影响帧的构图。

PolypDB 的设计直接对这些漂移做实验:模态视图测第 1 类漂移(同一中心、不同模态),中心视图 + 联邦实验测第 2、3 类漂移(不同中心、不同人群/设备)。这让它从"又一个大号息肉数据集"升级为"分布漂移实验台"。

7.2 联邦学习在结肠镜应用的隐私逻辑

论文 §IV-C 明确点出联邦学习的临床动机:数据隐私。结肠镜图像含可识别的患者信息,受 GDPR/HIPAA 等法规约束,医院往往不能把原始图像外传集中训练。FedAvg 让各中心在本地训练、只上传模型权重,使"多中心协作"与"数据不出院"兼容——PolypDB 的三中心联邦实验(§5.3)对此提供了实证:平均 mIoU 0.9214 证明联邦聚合可接近(甚至超越单中心)性能。

7.3 论文承认的局限与未来方向

论文在结论与讨论中坦承三处局限:

  1. 现有方法对边界与低对比息肉仍不足:模型在"难分割息肉"(与背景黏膜相似、有黏液伪装、小型/扁平病灶)上表现差,尤其是平坦型 SSL——论文原文指出这是右侧结肠镜后 CRC 的主因,也是未来研究重点。
  2. 样本量偏斜:Karolinska 仅 40 张、部分模态仅 60-70 张,限制了精细的 center-wise/模态-wise 统计。
  3. 未来方向 = 视频数据集:团队明确表示下一步要发布"comprehensive video dataset"——捕捉实时结肠镜中息肉检测与分割的动态时序信息(当前 PolypDB 是静态帧)。这指向与库内 LDPolypVideo(rid 163)类似的赛道。

7.4 与库内通用化数据集的思想共鸣

PolypDB 的"多中心+模态基准"思路与库内若干数据集同族:

  • PolypGen(rid 183):同样以多中心泛化为卖点,PolypDB 在多模态维度上更全。
  • REG²(rid 639)/ TopAneu(rid 632):多中心挑战赛型,同样以"跨中心泛化"为核心评测目标。
  • PANDA-PLUS(rid 560):同样采用"旧数据重标注"策略(见 §4.4),但侧重标签质量审计而非多模态扩展。

一个共通的方法论趋势:数据集的价值正在从"规模"转向"结构化的多样性"——不是图像越多越好,而是要把设备、人群、模态、操作者等漂移源显式地组织进数据集设计里,让模型在训练阶段就"见过世面"。PolypDB 是这一趋势在内镜影像领域的代表案例。

7.5 联邦实验的实现细节与复现要点

论文给了联邦分割实验的完整超参,便于复现:

项 配置
聚合算法 FedAvg(weights aggregated equally,等权聚合)
优化器 AdamW(weight decay 0.05,momentum 0.9)
batch size 32
epoch 100
初始学习率 0.001
学习率调度 cosine annealing,每 30 epoch 降为 1/10
归一化 按各中心自身图像的均值与标准差归一化

最后一条(按中心归一化)是联邦学习的关键工程技巧:不同中心的图像亮度/色彩分布不同,若用统一统计量归一化会引入偏差;按各中心自身统计量归一化可部分消除"设备指纹"造成的分布差异。这是复现联邦基线时最容易忽略、却最影响结果的一步。

联邦评测的读法:论文同时报告 average 与三个 per-center 结果(§5.3)。只看 average 会掩盖"某个中心表现异常"的信息——本研究中 Karolinska 上 DuAT 胜出(0.9396)而其他中心是 SSFormer-L 胜出,这种"最优模型随中心切换"的现象正是中心异质性的体现,也说明联邦场景下"一个模型通吃所有中心"未必成立。

7.6 与集中式训练的思想对照

PolypDB 的联邦实验提供了一个可对照的量:联邦平均(SSFormer-L 0.9214)vs 单中心 WLI 训练(SSFormer-L 0.8821),前者高出约 4 个点。这带来一个常被忽略的洞见:联邦学习不只是"隐私妥协方案",在多中心场景下它还可能是"性能增强方案"——因为各中心的图像互为对方的"域增强数据",聚合的权重隐式地学到了更广的分布。这与"集中式训练=性能上限、联邦=次优"的直觉相反。当然,前提是各中心数据量不至于过小(Karolinska 仅 40 张时其贡献有限)。

7.7 落地场景:谁会用 PolypDB 做什么

把使用场景具体化:

  1. 内镜设备厂商:用 PolypDB 训练跨品牌兼容的息肉分割模型——五模态覆盖 Fujinon/Olympus,正好对应"一套模型适配多设备"的需求。
  2. 医院 AI 团队:用联邦基线搭建"多院区协作、数据不出院"的分割系统——论文已给出 FedAvg 的可复现配置(§7.5)。
  3. 学术研究者:把 PolypDB 当"域泛化基准"——报告模型在五个模态/三个中心上的方差,量化泛化力。
  4. 数据工程团队:把 PolypDB 当"公开直链数据集样板"——学习其双视图组织与全量终审的质控设计。

§8 方法学启示:三条可迁移的经验

8.1 "旧数据重标注"是高性价比的数据扩容路径

PolypDB Center 1 的做法(从 HyperKvasir 99417 帧中打捞 3000 张未标注息肉候选,标注后采纳 2588 张)示范了一条可复制路径:公开数据集里大量"未标注"或"弱标注"的帧,是等待被赋予真值的沉睡资产。与之同构的是 PANDA-PLUS 对 PANDA 未标注/切片级标签的重标注。

对数据工程的可迁移要点:

  • 先在一批公开数据里识别候选帧(可用弱模型或关键词检索),再用专家标注/复核把候选转成真值;
  • 未被利用的类别(unlabelled class)往往被研究者忽视,是低成本扩充的富矿;
  • 关键是标注规范与质量门——PolypDB 用纳入/排除标准 + 双专家交叉 + 独立终审保住了质量。

8.2 把"分布漂移"显式编进数据集结构

PolypDB 最值得借鉴的设计不是数据本身,而是组织方式:同一批图像,按模态切一份(测设备/染色漂移),按中心切一份(测人群/操作漂移),再配联邦实验(测隐私约束下的协作)。这把"泛化能力"从一个事后评测指标,变成了数据集自带的、可复现的实验维度。

对选型者的映射:如果你的项目关心"跨机构部署",优先选自带 center-wise / site-wise 切分的数据集;如果关心"多设备兼容",优先选自带模态/协议切分的数据集。PolypDB 同时满足两者。

8.3 联邦学习作为隐私合规下的协作范式

在数据不能集中的医疗场景,FedAvg 三中心实验提供了"既能协作又不出院"的实证。可迁移的经验:

  • 联邦聚合的收益在中心间分布差异大时更明显(本研究中 Bærum 单体最低但聚合后反超);
  • 联邦评测需按中心分别报告(average + per-center),只看平均会掩盖中心间差异;
  • 隐私不是免费午餐——联邦的通信开销、中心异质性(non-IID 数据)是落地难点,PolypDB 用统一归一化(各中心按自身均值方差归一化)部分缓解。

8.4 给数据集设计者的六条清单

从 PolypDB 的实现里抽取一份"数据集设计 checklist":

  1. 双视图组织:按至少两个正交维度(此处是模态与中心)切分数据,让不同研究目标各取所需。
  2. 图像与掩码同名:简化配对加载逻辑,降低使用门槛。
  3. 提供划分文件:给出固定 train/val/test 划分(80/10/10),保证跨论文结果可比。
  4. 全量专家终审:质量控制覆盖 100% 样本,而非抽样——尤其在规模可控(数千张)时值得投入。
  5. 公开直链:优先选 OSF/Zenodo 等无需审批的托管,最大化可复现性。
  6. 许可白纸黑字:PolypDB 的反面教材——README 声称 MIT 却无 LICENSE 文件,应引以为戒,务必附实际 LICENSE。

8.5 给模型开发者的三条落地规则

  1. 报告多模态结果时按模态分别报告 + 注样本量:PolypDB 的 LCI(60 张)与 WLI(3558 张)不可等量齐观。
  2. 训练时做模态/中心重采样:原始分布高度偏斜(WLI 91%),直接采样会让少数模态欠拟合。
  3. 做跨中心评测时报告中心间方差:单看某个中心的漂亮指标会误导部署决策。

8.6 从 PolypDB 看"数据集论文"的三个层次

一篇好的数据集论文(data paper)通常有三层贡献,PolypDB 三层都占:

层次 内容 PolypDB 对应
第一层:数据 提供以前没有的数据/标注 首个五模态息肉数据集(3934 图 + 掩码 + 检测框)
第二层:基准 给出可对标的方法评测 分割 8 方法 + 检测 5 YOLO + 联邦 10 模型
第三层:洞见 提出可迁移的方法论/发现 "多模态多中心可提升泛化"的实证 + 联邦优于单中心

多数数据论文只做第一层(发数据、无系统基准);较好的做到第二层(发数据+基准);优秀的做到第三层(用数据回答一个科学问题)。PolypDB 的第三层贡献是:它用三中心五模态的对照实验,量化了"多样性对泛化的增益"——这不仅是一个数据集的发布,更是对"什么让内镜 AI 更鲁棒"这一问题的回答。

对读者的启示:评估一个数据集的价值,除了看规模与获取门槛,还要看它是否提供了"可证伪的科学洞见"。PolypDB 的 FedAvg 实验(联邦平均 0.9214 > 单中心 0.8821)就是一个可被后续研究证实或证伪的实证命题。

§9 与库内条目的关系

9.1 家族图谱

  • HyperKvasir(rid 693):最硬的直接上游。PolypDB Center 1 的 2588 WLI + 136 NBI 来自 HyperKvasir 未标注类——"旧数据新标签"血缘。
  • BKAI-IGH NeoPolyp(rid 84):越南上游。PolypDB Center 3 的 1200 张图像含 BKAI 的 1000 WLI + 60 LCI + 70 FICE + 70 BLI;PolypDB 包含 BKAI 但非等同。
  • Kvasir-SEG(rid 112):同作者(Jha)的息肉分割数据集,单模态 WLI;PolypDB 是其多模态多中心扩展,二者常做跨集泛化评测。
  • PolypGen(rid 183):另一多中心息肉数据集,规模 1531 图 + 2000 帧;与 PolypDB 同为"多中心泛化"赛道,主要差异在模态覆盖与规模。
  • LDPolypVideo(rid 163):息肉视频数据集,与 PolypDB(静态帧)互补;PolypDB 的未来方向(视频数据集)可能与其同域。
  • Kvasir-Capsule(rid 123)/ Kvasir-Instrument(rid 213):Kvasir 家族成员,内镜邻域。
  • CVC-ClinicDB(rid 133)/ CVC-ColonDB(rid 142)/ ETIS-Larib(rid 153):经典息肉分割数据集(Bernal 家族),论文 Table I 谱系对照。
  • GastroVision(rid 203)/ EndoSLAM(rid 408)/ Endoscapes(rid 353)/ CholecSeg8k(rid 233)/ CholecT50(rid 223):GI 内镜与腹腔镜邻域数据集。
  • NCT-CRC-HE-100K(rid 148):结直肠癌组织病理分类(同疾病、不同模态侧)。
  • PANDA-PLUS(rid 560):跨模态的"旧数据重标注"方法论对照(见 §4.4)。

9.2 检索路径建议

  • 检索词组合:“PolypDB”(精确短语)+ “colonoscopy” + “multi-center”;资源入口 osf.io/pr7ms 与 github.com/DebeshJha/PolypDB。
  • 勿混淆:PolypDB ≠ PolypGen(rid 183)≠ LDPolypVideo(rid 163)≠ BKAI-IGH(rid 84);三者是不同数据集。
  • 想直接下数据:OSF 公开直链(无需注册)→ 需注意许可未明确(坑 6)。
  • 想引基线结果:引论文 Table III(分割)、Table IV(检测)、Table V(联邦),注意表 IV 的 BLI/NBI 行雷同(坑 4)。
  • 想做通用化评测:用模态视图(测设备漂移)+ 中心视图(测人群漂移),参照 §5.3 联邦基线。

9.3 库内息肉/内镜数据集互链矩阵

为便于跨条目导航,给出 PolypDB 与库内相关条目的对照矩阵:

库内条目 rid 与 PolypDB 的关系 互链价值
HyperKvasir 693 直接上游(Center 1 图像来源) 追溯 PolypDB 图像血缘
BKAI-IGH NeoPolyp 84 上游(Center 3 越南图像来源) 越南部分重叠说明
Kvasir-SEG 112 同作者同域(单模态息肉分割) 单模态 vs 多模态对照
Kvasir-Capsule 123 同家族(胶囊内镜) 内镜模态扩展
Kvasir-Instrument 213 同家族(器械分割) 器械干扰对照
PolypGen 183 同赛道(多中心息肉) 多中心泛化对照
LDPolypVideo 163 互补(视频 vs 静态帧) PolypDB 未来方向参照
CVC-ClinicDB 133 经典息肉分割 历史谱系
CVC-ColonDB 142 经典息肉分割 历史谱系
ETIS-Larib 153 经典息肉分割 历史谱系
GastroVision 203 内镜邻域 内镜数据生态
EndoSLAM 408 内镜邻域 内镜数据生态
Endoscapes 353 内镜/手术邻域 手术场景对照
NCT-CRC-HE-100K 148 同疾病(结直肠癌)病理侧 内镜 vs 病理
PANDA-PLUS 560 方法论对照(旧数据重标注) 标注策略对照

互链建议:核心血缘互链 HyperKvasir(693)、BKAI-IGH(84);同赛道互链 PolypGen(183);互补互链 LDPolypVideo(163);方法论互链 PANDA-PLUS(560)。其余作为生态背景。

9.4 一个"息肉 AI 全链路"阅读路径

若读者想从业余到系统了解息肉 AI,可按以下顺序跨条目阅读:

  1. 入门:Kvasir-SEG(112)——认识息肉分割任务与基本格式。
  2. 进阶:PolypDB(本条目)——理解多模态、多中心、检测与联邦。
  3. 视频/时序:LDPolypVideo(163)——从静态帧进入实时检测。
  4. 泛化评测:PolypGen(183)——多中心泛化的另一视角。
  5. 病理侧:NCT-CRC-HE-100K(148)——从内镜走向组织病理。
  6. 方法论:PANDA-PLUS(560)——学习数据集的标注质控与标签审计。

这条路径把库内的息肉相关条目串成"任务→数据→泛化→病理→方法论"的完整学习地图。

§10 避坑清单:七个已踩过的坑

坑 1(A):模态计数与总数不符。论文 §III-A 明确列出 “3558 WLI + 146 NBI + 60 LCI + 70 BLI + 70 FICE”,合计 3904;但全文宣称总数 3934,差 30 张。论文未解释差额。引用时须注明用的是哪个数;若按总量写 3934,则模态明细合计为 3904 已是另一口径(可能涉及 Karolinska 30 张 WLI 的计入方式)。

坑 2(B):检测方法数与联邦方法数口径冲突。摘要与 GitHub 称 “six standard benchmark polyp detection methods”,正文贡献点却写 “five object detection methods”,Table IV 实列 5 个 YOLO(v5/v7/v8/v9/v10);正文 §III-C 文字又出现表中没有的 YOLOv6(WLI mAP50 0.925)。联邦方面摘要称 “six federated learning approaches”,Table V 实列 10 个模型。凡涉及"方法数"的引用都需核对到表。

坑 3(C):注释团队人数冲突。摘要写 “team of 10 gastroenterologists”(10 名胃肠病专家);正文 §II-D 写 “8 gastroenterologists + 1 senior researcher”(8 名专家 + 1 名资深研究者)。两个数不同,引用时注明出处。

坑 4(D):表 IV 的 BLI 与 NBI 行数值逐格雷同。两模态的 mAP50/mAP50-95/mAP75/Precision/Recall 六个数完全一致(0.659/0.502/0.559/1.000/0.318),几乎可断定是制表复制错误。NBI 检测结果不可独立引用;引用时应以 BLI 行对应 BLI、对 NBI 持保留态度。

坑 5(E):GitHub 中心目录名与论文不一致。GitHub README 中心视图写作 Simula / Karolinska / Vietnam(或 Simula/Karolinska/BKAI),而论文 center-wise 结果为 BKAI / Karolinska / Bærum。“Simula”(挪威 SimulaMet 研究机构)与 Bærum 医院非同一实体。检索文件树与对齐结果时以实际目录内容为准。

坑 6(F):数据集许可无核验载体。GitHub README 称 “MIT License - see the LICENSE file”,但仓库根目录无 LICENSE 文件;OSF 项目 license=None/node_license=None。唯一明确的许可是论文的 CC BY 4.0。数据集再分发/商用条款未明示,衍生模型许可属灰色地带,商用前须联系作者确认。

坑 7(G):GitHub 引用块的 DOI 是占位符。README 引用块写 doi = {10.1109/TMI.2024.1234567},尾号 1234567 是明显占位符,PolypDB 并未在该 DOI 发表(三轮搜索未见 PolypDB 正式期刊版)。引用应使用 arXiv:2409.00045。

坑 8(附):中心样本量极不均衡。Bærum 2724 张 ≈ 69%、越南 1200 张 ≈ 30%、Karolinska 仅 40 张 ≈ 1%。跨中心/联邦结论受此结构硬约束,勿把三中心当平衡样本;Karolinska 的 center-wise 结果基于约 30 张 WLI,置信区间宽。

10.1 七坑速查表

坑 一句话 影响 应对
A 模态合计 3904 ≠ 总数 3934 引用数字口径不一 分开报,注明差额
B 检测/联邦方法数 5 vs 6 vs 10 方法数引用错 以表格实际列数为准
C 注释团队 8 vs 10 人 团队规模引用错 注明出处(摘要/正文)
D 表 IV 的 BLI/NBI 行雷同 NBI 检测结果不可用 不引用 NBI 检测数
E GitHub 目录名 Simula/Vietnam ≠ 论文 BKAI/Bærum 目录对齐出错 以实际目录内容为准
F 许可无 LICENSE 文件(README 称 MIT) 商用/再分发风险 联系作者确认
G 引用 DOI 是占位符 1234567 引用无效 用 arXiv:2409.00045
H 中心样本极不均衡(1% vs 69%) 跨中心结论不稳 报告样本量、慎推泛化

10.2 类比:PolypDB 的坑集中在"文档层"而非"数据层"

值得强调:PolypDB 的八个坑没有一个是数据本身的错误——它们全是论文/README 的文档表述不一致(数字口径、目录命名、许可声明、DOI 占位)。数据本体(3934 张图像 + 掩码 + 检测框)质量有全量专家终审背书,是可靠的。

这一区分的实践意义:

  • 用数据:可放心——图像与标注质量有质控保障。
  • 引论文数字:须谨慎——多处口径冲突,务必核对到表格。
  • 引许可:须求助作者——README 声明无文件支撑。

换言之,PolypDB 是"好数据 + 尚需打磨的文档"的组合。这不影响它作为高质量训练/评测资产的价值,但要求引用者多一道核验手续。

§11 DAIMS 评估

以 Data and AI Maturity/Readiness Schema(DAIMS)六维给 PolypDB 打分(0-5,5 最优):

维度 评分 依据
Data Availability(可获取性) 5/5 OSF 公开直链无门槛(osf.io/pr7ms),无需注册/申请;库内息肉数据集可获取性标杆
Annotation Quality(标注质量) 5/5 单人描边(含数位屏)+ ≥2 名高级胃肠病专家交叉复核 + 1 名独立专家全量终审 3934 张
Integrity & Provenance(来源与完整性) 4/5 三中心伦理流程完整(GDPR 匿名、知情同意)、上游血缘清晰(HyperKvasir/BKAI);但模态计数与总数差 30 张、表 IV 数值雷同扣分
Metadata & Documentation(元数据) 4/5 README + 论文 + COCO 标签 + 划分文件齐全;但四处数字口径冲突、代码仓库未附官方训练脚本
Structure & Interoperability(结构与互操作) 5/5 模态视图/中心视图双组织、图像掩码同名、COCO 检测格式、80/10/10 划分——标准且开箱可用
Licensing(许可清晰度) 3/5 论文 CC BY 4.0 明确;数据集本身许可未声明(README 称 MIT 无 LICENSE 文件,OSF license=None),再分发/商用边界模糊

综合:AI-Ready 等级"中高"(26/30)——可获取性、标注质量、结构互操作三项满分,是本数据集的核心竞争力;短板集中在许可明确性与文档自洽性。对研究者而言,“能不能马上用”(能)与"能不能放心商用"(存疑)是两个必须分开判断的问题。

11.1 统计卫生:读 PolypDB 数字的六条守则

PolypDB 论文里数字口径冲突较多,为避免误引,给出六条守则:

  1. 总数与模态合计要分开报。全文总数是 3934,但 §III-A 的模态明细合计是 3904(差 30)。若你按模态做实验,报 3904;若引用数据集总量,报 3934 并注明与明细的差额。
  2. 小样本模态的指标加置信区间。LCI(60)、BLI/FICE(各 70)的 10% 测试集仅 6-7 张,mIoU 的点估计不可外推;报这些指标时应注明测试集大小。
  3. 检测结果警惕"表内复制错误"。表 IV 的 BLI 与 NBI 行逐格雷同,NBI 检测结果不可引用;引用 WLI 检测时以表内 YOLOv5/v8(0.916/0.913)为准,而非正文提到的 YOLOv6(0.925,表中无)。
  4. 分割选最优时按模态分别选。没有全模态最优方法:BLI 选 DuAT、NBI 选 PVT-CASCADE、FICE/LCI/WLI 选 SSFormer-L。
  5. 联邦结果看 average 也要看 per-center。Karolinska 上 DuAT 反超 SSFormer-L,"最优模型随中心切换"是重要信息,只报 average 会丢。
  6. 别把"六方法/six approaches"当精确计数。论文对检测方法数(5 vs 6)、联邦方法数(6 vs 表内 10)、注释团队人数(8 vs 10)口径不一——引用具体方法数时以表格实际列数为准。

11.2 复现清单(给想复现基线的人)

步骤 关键配置 来源
数据获取 OSF osf.io/pr7ms 下载 论文/GitHub
划分 80% 训练 / 10% 验证 / 10% 测试 论文 §III-A / GitHub dataset-split
分割输入 resize 512×512 论文 §III-A
检测输入 resize 640×480 论文 §III-A
分割损失 BCE + Dice 论文 §III-A
分割优化器 Adam, lr 1e-4, 200 epoch, batch 12 论文 §III-A
检测优化器 AdamW, lr 1e-4, batch 16 论文 §III-A
联邦聚合 FedAvg, 等权, AdamW(wd=0.05), batch 32, 100 epoch 论文 §III-A
环境 PyTorch 1.9, NVIDIA RTX 3090 论文 §III-A
增强(分割) 随机旋转/水平翻转/垂直翻转/course dropout 论文 §III-A
增强(检测) 随机翻转/旋转/模糊/mixup/mosaic/cutmix 论文 §III-A

§12 总结

12.1 三句话总结

  1. PolypDB 是首个开源的五模态三中心结肠镜息肉数据集:3934 张图像带像素级分割掩码与检测框,覆盖 BLI/FICE/LCI/NBI/WLI,源自挪威/瑞典/越南三中心。
  2. 它的核心增量是"结构化的多样性":模态视图(测设备漂移)+ 中心视图(测人群漂移)+ 联邦学习实验(测隐私约束协作),把泛化能力编进数据集设计,而非事后评测。
  3. 它的最大优点是零门槛获取、最大风险是许可模糊:OSF 公开直链随取随用,但数据集许可未声明(README 称 MIT 无 LICENSE 文件),商用/再分发前必须联系作者。

12.2 适合谁

  • 内镜 AI 分割/检测团队:需要多模态、多中心的息肉训练与评测数据。
  • 通用化/域适应研究者:自带模态与中心双视图,是现成的分布漂移实验台。
  • 联邦学习研究者:附三中心 FedAvg 基线与隐私合规论证。
  • 关注 AI-Ready 数据工程的团队:公开直链 + 双专家复核 + 双视图组织是活的工程范例。

12.3 不适合谁

  • 需要息肉病理分类/形态学标签的项目:PolypDB 只有区域掩码与检测框,无组织学分级、无 Paris 分型。
  • 需要视频时序信息的项目:PolypDB 是静态帧,视频数据集是团队承诺的"未来方向"(当前需看 LDPolypVideo 等,rid 163)。
  • 需要许可白纸黑字用于商用的项目:数据集许可未明确,须先与通讯作者确认。
  • 需要机构平衡采样的跨中心研究:2724:1200:40 的中心偏斜是硬约束,Karolinska 子集过小。

12.4 一句话定位

PolypDB 是内镜影像领域"把多样性做成结构"的代表数据集——它不追求最大规模,而是用五模态、三中心、双视图、联邦实验,把"模型能不能跨设备跨人群工作"这个部署时的终极问题,提前搬进了训练与评测的桌面。

12.5 综合评分卡

评估维度 评分 理由
数据规模 ★★★★☆ 3934 图在纯息肉数据集中居前列(但低于已下架的 CVC-VideoClinicDB/ASU-Mayo)
模态多样性 ★★★★★ 唯一开源五模态息肉数据集(BLI/FICE/LCI/NBI/WLI)
中心多样性 ★★★★☆ 三中心跨国(挪威/瑞典/越南),但分布极不均(69%:30%:1%)
标注质量 ★★★★★ 单人描边 + ≥2 专家交叉 + 独立全量终审 3934 张
任务完整性 ★★★★★ 分割 + 检测 + 联邦三套任务与基线
可获取性 ★★★★★ OSF 公开直链,零门槛下载
许可明确性 ★★☆☆☆ 数据集许可未声明(README 称 MIT 无 LICENSE 文件)
文档自洽性 ★★★☆☆ 多处数字口径冲突(坑 A-G)
工程友好度 ★★★★☆ 双视图 + 同名配对 + COCO 标签 + 官方划分;但无官方训练代码

综合:8.5/10——一个"数据与结构优秀、文档与许可待打磨"的高价值数据集。适合作为内镜 AI 多模态多中心研究的核心资产,但引用时需自行核对数字口径、商用前需确认许可。

12.6 如果你只想记住三件事

  1. 它是什么:首个开源的五模态(BLI/FICE/LCI/NBI/WLI)三中心(挪威/瑞典/越南)结肠镜息肉数据集,3934 张图像带像素级掩码与检测框。
  2. 它好在哪:OSF 公开直链零门槛,双视图(模态/中心)自带域泛化评测结构,分割/检测/联邦三套可对标基线。
  3. 它要小心什么:数据集许可未明确(README 称 MIT 无 LICENSE 文件);论文多处数字口径冲突(模态合计 3904 vs 总数 3934、表 IV 的 BLI/NBI 行雷同);引用用 arXiv:2409.00045 而非占位 DOI。

§13 附录

13.1 数据来源与引用速查

项目 值
数据集名 PolypDB
全称 PolypDB: A Curated Multi-Center Dataset for Development of AI Algorithms in Colonoscopy
arXiv 2409.00045(v1 2024-08-19 / v2 2025-01-03)
arXiv DOI 10.48550/arXiv.2409.00045
论文 license CC BY 4.0
数据下载 https://osf.io/pr7ms/
代码/划分/COCO 标签 https://github.com/DebeshJha/PolypDB
数据量 3934 张息肉图像(模态明细合计 3904)
模态 BLI / FICE / LCI / NBI / WLI
中心 Bærum(挪威)/ Karolinska(瑞典)/ HMU+IGH(越南)
通讯作者 Debesh Jha(debeshjha1@gmail.com / debesh.jha@usd.edu)
主导机构 Northwestern University, Machine & Hybrid Intelligence Lab, Dept. of Radiology
资助 NIH R01-CA246704, R01-CA240639, U01-DK127384-02S1, U01-CA268808
引用规范 使用 arXiv:2409.00045;勿用 GitHub README 的占位 DOI 10.1109/TMI.2024.1234567

13.2 关键时间线

时间 事件
2024-08-18 OSF 项目 pr7ms 创建(OSF API date_created)
2024-08-19 arXiv v1 提交(33,328 KB)
2024-09-16 GitHub README 更新
2024-10-09 GitHub coco_labels 与 dataset-split 目录提交
2024-12-17 GitHub 合并 detection labels 更新 PR(最后一次代码更新)
2025-01-03 arXiv v2 修订(47,679 KB,当前版本)
2025-03-03 OSF 项目最后修改(OSF API date_modified)
2026-09-30 本条目抓取时点(未见正式期刊版)

13.3 术语表(首现英文对照)

中文 英文(缩写) 说明
结肠镜 colonoscopy 结直肠检查金标准,操作者依赖
息肉 polyp 结直肠黏膜隆起病变,CRC 主要癌前形态
结直肠癌 Colorectal Cancer (CRC) 全球第三大癌症发病、第二大癌症死因
腺瘤漏检率 adenoma miss-rate 文献报道 20%–24%
结肠镜后结直肠癌 post-colonoscopy CRC / interval cancer 间隔期发现的癌
图像增强内镜 Image-Enhanced Endoscopy (IEE) BLI/FICE/LCI/NBI 等数字染色模式的统称
白光成像 White Light Imaging (WLI) 常规白光模式
窄带成像 Narrow Band Imaging (NBI) Olympus 系窄带光模式
蓝光成像 Blue Light Imaging (BLI) Fujinon 系蓝光模式
联动彩色成像 Linked Color Imaging (LCI) Fujinon 系色彩增强模式
柔性光谱成像色彩增强 Flexible spectral Imaging Color Enhancement (FICE) Fujinon 系光谱增强模式
波士顿肠道准备评分 Boston Bowel Preparation Score (BBPS) 肠道清洁度评分,≥2 纳入
分割 segmentation 像素级掩码任务
检测 detection 边界框任务
交并比 Intersection over Union (IoU) 分割指标,mIoU 为其均值
Dice 相似系数 Dice Similarity Coefficient (DSC) 分割指标,mDSC 为其均值
平均精度 mean Average Precision (mAP) 检测指标
联邦学习 Federated Learning (FL) 数据不出院的协作训练
联邦平均 Federated Averaging (FedAvg) FL 聚合算法
无蒂锯齿状病变 Sessile Serrated Lesion (SSL) 难检测的平坦型息肉
分布漂移 distribution shift 训练与部署分布不一致
快速梯度符号法 Fast Gradient Sign Method (FGSM) 对抗攻击方法
通用数据保护条例 General Data Protection Regulation (GDPR) 欧盟隐私法规

13.4 一手来源 URL 清单

13.5 三条检索建议(收尾)

  1. 搜"PolypDB"时加限定词:“PolypDB” + “multi-center” / “colonoscopy” / “osf.io/pr7ms”,避免与 PolypGen、LDPolypVideo 混淆。
  2. 要引用时用 arXiv 编号:arXiv:2409.00045,而非 GitHub 占位 DOI。
  3. 要下数据直奔 OSF:osf.io/pr7ms 公开直链,无需注册;但商用/再分发前先确认许可(见坑 6)。

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • real-colon — 共享标签:医学影像 / 内窥镜影像 / 目标检测 / 结直肠癌 / 评测基准
  • ldpolypvideo — 共享标签:医学影像 / 内窥镜影像 / 目标检测 / 结直肠癌
  • bkai-igh-neopolyp — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 结直肠癌
  • cvc-clinicdb — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 评测基准
  • cvc-colondb — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 评测基准
  • giana — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 结直肠癌
  • prostate158 — 共享标签:医学影像 / 医学图像分割 / 目标检测 / 评测基准
  • kvasir-seg — 共享标签:内窥镜影像 / 医学图像分割 / 结直肠癌
  • sun-database — 共享标签:医学影像 / 内窥镜影像 / 目标检测 / 结直肠癌
  • heico — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 结直肠癌

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集