信息速览
INFOBOX — PolypDB 一屏速览
维度 内容 本质 首个开源五模态三中心结肠镜息肉数据集(分割掩码+检测框),非挑战赛、公开直链 团队 Northwestern University 主导(通讯 Debesh Jha),联合挪威/瑞典/越南三中心,共 24 作者 论文 arXiv:2409.00045(v1 2024-08-19 / v2 2025-01-03;cs.CV;CC BY 4.0) 数据 3934 张息肉图像,最小 1280×720,JPEG;像素级分割掩码 + 边界框 模态 五模态:BLI / FICE / LCI / NBI / WLI(图像增强内镜 IEE 全覆盖) 中心 三中心:挪威 Bærum(2724)、瑞典 Karolinska(40)、越南 BKAI(1200) 任务 息肉分割 + 息肉检测 + 联邦学习(center-wise FedAvg) 基线 分割 8 方法 + 检测 5 YOLO + 联邦 10 模型(论文宣称口径见 §5) 最佳分割 SSFormer-L 与 PVT-CASCADE 综合最优(WLI mIoU 0.8821 / LCI 0.8567) 最佳检测 YOLOv10 / YOLOv9 主导(FICE mAP50 0.887 / LCI 0.995) 获取 公开直链:OSF https://osf.io/pr7ms/(无需注册/申请);代码 GitHub DebeshJha/PolypDB 许可 论文 CC BY 4.0;数据集许可未明确(README 称 MIT 无 LICENSE 文件) 库内互链 HyperKvasir(上游未标注类)、Kvasir-SEG、BKAI-IGH NeoPolyp(越南上游)、PolypGen、LDPolypVideo
PolypDB 回答的是息肉 AI 里一个长期被回避的问题:当一家医院训练的分割模型换到另一家医院的内镜室,它还能看清息肉吗? 息肉分割数据集过去大多是单中心、单模态的——模型在 Kvasir-SEG 上刷到 0.9 的 Dice,到了换设备、换染色模式、换人种的场景就崩。PolypDB 的做法是把"多中心+多模态"直接做成数据集的骨架:挪威、瑞典、越南三家医院,BLI、FICE、LCI、NBI、WLI 五种内镜成像模态,3934 张图像全部配像素级掩码和检测框,再按模态和中心两个维度切出基准——让模型在训练时就被迫面对"分布漂移",而不是等部署时才发现。
导语读法三则:
- 只想下数据:直奔 §6——OSF 公开直链(osf.io/pr7ms)无需申请,是库内难得的"零门槛"息肉数据集。
- 关心基线结果:直奔 §5——分割看 SSFormer-L / PVT-CASCADE,检测看 YOLOv10 / YOLOv9;注意表 IV 的 BLI/NBI 行雷同(坑 4)。
- 做通用化/联邦学习:直奔 §3 与 §7——模态视图与中心视图两种切法,外加 FedAvg 三中心实验,是本研究区别于普通息肉数据集的真正增量。
§0 导读:这个数据集解决什么问题
结直肠癌(Colorectal Cancer, CRC)是全球第三大癌症发病、第二大癌症死因:2020 年约 190 万新发病例、约 93.5 万人死亡。结肠镜(colonoscopy)是 CRC 筛查与癌前病变(息肉)切除的金标准,但它是操作者依赖的检查——腺瘤漏检率(adenoma miss-rate)文献报道高达 20%–24%,被漏掉的息肉可能在数年后发展为"结肠镜后结直肠癌"(post-colonoscopy CRC)或间期癌(interval cancer)。计算机辅助检测(CADe)系统已经商用于息肉检测,但多数只在息肉上打一个边界框,并不帮助医生精确勾勒息肉边界、确认是否完整切除——而完整切除正是避免复发与间期癌的关键。
要训练能真正辅助"分割+完整切除确认"的模型,缺的恰恰是公开、多中心、大规模、多样化的数据集。PolypDB 论文开篇的洞察是:现有公开息肉数据集(Table I 列举)要么单中心、要么单模态,没有一个同时具备"多模态 + 多中心 + 胃肠病专家验证真值"三要素。PolypDB 是首个开源的五模态息肉数据集——把 BLI、FICE、LCI、NBI、WLI 五种成像方式(图像增强内镜 Image-Enhanced Endoscopy, IEE)汇聚到同一套标注规范下,并横跨挪威、瑞典、越南三国人群与 Fujinon/Olympus 两套设备。
§0 读法三则:
- 这个条目是"数据集 + 基准论文 + 标注方法论 + 联邦学习实践"四合一:核心资产是 3934 张带掩码与检测框的图像,副产品是模态/中心双视图基准与三中心 FedAvg 实验。
- 全文数字均出自论文正文与 Table I–VI;正文自相冲突处(模态合计 3904 vs 总数 3934、检测方法数 5 vs 6、注释团队 8 vs 10)已在坑 A/B/C 逐条存照。
- 检索时若把"PolypDB"与"PolypGen"(另一多中心息肉数据集,rid 183)或"LDPolypVideo"(视频息肉,rid 163)混为一谈会出错——三者是不同数据集(坑见 §10)。
0.1 为什么"息肉分割"值得一个专门的数据集
息肉(polyp)是结直肠黏膜表面的隆起病变,是结直肠癌最主要的癌前形态。从腺瘤性息肉到腺癌通常经历"增生→低级别腺瘤→高级别腺瘤→原位癌→浸润癌"的多步演进,历时 5-10 年——这段窗口正是筛查与干预的价值所在。结肠镜检查时医生用内镜前端摄像头逐段观察肠壁,发现息肉即用活检钳取样或用圈套器切除(polypectomy)。因此,**看得见(检测)与看得准边界(分割)**是两件关键的事:
- **检测(detection)**回答"画面里有没有息肉、在哪里"——用边界框(bounding box)框出即可。商用 CADe 系统主要做这件事,在息肉上画一个绿色方框提示医生。
- **分割(segmentation)**回答"息肉的像素边界在哪里"——需要像素级掩码(mask)。它服务于更精细的任务:判断息肉是否被完整切除(切缘阴性)、估算息肉面积、为内镜下"光学活检"(optical biopsy,即时判断息肉性质而不必取病理)提供形态学证据。
息肉分割之所以难,论文列出了五类挑战:(i) 息肉在发育阶段形态会随时间变化;(ii) 息肉的形状、大小、颜色、外观可能与周围黏膜高度相似(低对比);(iii) 有时有黏液覆盖息肉形成"伪装",连经验丰富的内镜医生都可能被骗;(iv) 成像设备引入的伪影——模糊、眩光、光照过强/过弱、反光亮点、低对比区;(v) 手术器械与肠道残留物干扰边界判断。所有这些因素共同导致"息肉与背景的分割边界模糊",是大肠镜 AI 的公认难点。
0.2 "多中心"为什么比"大规模"更重要
一个直觉误区是"数据集越大越好"。但在医学影像 AI 里,数据分布的多样性(diversity)往往比绝对规模更决定模型的泛化力。原因是:模型学到的是训练分布的特征,若训练数据全部来自同一家医院、同一台设备、同一类人群,模型会过拟合这些"偶然的共性"——部署到新场景时,设备差异、人群差异、操作差异会同时构成分布漂移(distribution shift),精度断崖式下跌。
PolypDB 的论文对此有明确表述:“Training DL algorithms on multi-center datasets can improve the generalizability and robustness of the network.”(在多中心数据集上训练深度学习算法可提升网络的泛化性与鲁棒性)。多中心的价值具体体现在三处:
- 捕获区域与人口统计学差异:不同地区 CRC 发病率不同,多中心数据能覆盖更广的人口代表性。
- 纳入不同设备与成像协议:Olympus、Fujinon、Pentax 三大品牌的内镜图像处理管道各异,模型必须对"设备指纹"不敏感。
- 暴露真实世界的成像条件差异:不同医院的操作习惯、肠道准备质量、光照条件构成天然的扰动谱。
这三条正是 PolypDB 用"三中心 + 五模态"来落实的设计哲学——它不是在"量"上做文章,而是在"结构化多样性"上做文章。
0.3 与其他息肉数据集的定位差异(先给结论)
在论文 Table I 的"≥1000 样本"息肉数据集景观里,PolypDB 的差异化定位可用三句话概括:
- 规模上它不是最大:Kvasir-Capsule(474 万图,但为胶囊内镜)、HyperKvasir(11 万图,但含多种 GI 病变非纯息肉)在量上远超;纯息肉分割集里 CVC-VideoClinicDB(11954)与 ASU-Mayo(18781)曾更大,但均已下架不可获取。
- 模态多样性上它独一无二:Kvasir-SEG、BKAI-IGH 等多为单模态(WLI),PolypDB 是首个含五种 IEE 模态的开源息肉数据集。
- 中心覆盖上它最完整:PolypGen 虽多中心,但中心数与模态数不及 PolypDB;PolypDB 同时提供模态视图与中心视图两种切分。
理解了这三点,就能理解为什么一篇"数据集论文"值得被 AI-Ready Wikipedia 收录——它的贡献不是"又发了一堆图",而是把"多模态多中心"这个评测维度制度化进了数据集结构。
0.4 为什么 PolypDB 值得收录进 AI-Ready Wikipedia
AI-Ready Wikipedia 的收录标准是"可作为 AI 训练/评测资产、且元数据可核验、获取路径清晰"的数据集。PolypDB 满足以下四条:
- 真实的公开资产:3934 张图像 + 掩码 + 检测框,OSF 公开直链,非概念、非申请制。
- 可核验的元数据:arXiv 论文(CC BY 4.0)+ GitHub README + OSF 项目页三源互证规模、模态、中心、许可。
- 完整的任务定义:分割、检测、联邦三套任务与基线(Table III/IV/V),度量指标明确(mIoU/mDSC/mAP/F2)。
- 结构化多样性:五模态 × 三中心 × 双视图,让数据集自带上"域泛化评测"能力。
同时,它也是本库内"公开直链型息肉数据集"的代表——与请求制/注册墙型数据集形成可获取性光谱的对照。它的许可模糊问题(§6.3)则是一个反面教材,提醒数据发布者"LICENSE 文件不能只写在 README 里"。
§1 数据集速览:十问十答
Q1:PolypDB 的"3934 张"是什么?
3934 张来自真实结肠镜检查视频抽帧的静态息肉图像(still polyp images),每张配像素级分割掩码与边界框真值。它不含视频序列本体——论文表述是"ground truth from real colonoscopy videos",即真值追溯自真实视频,图像是抽取的帧。规模定位:在论文 Table I 的"≥1000 样本"息肉数据集对照中,PolypDB(3934)低于 CVC-VideoClinicDB(11954,已下架)、ASU-Mayo(18781,已下架),但高于 Kvasir-SEG(1000)、BKAI-IGH(1000)、PolypGen(1531)。
Q2:五个模态分别是什么?
图像增强内镜(IEE)的五种主流数字染色模式:WLI(White Light Imaging,白光成像,常规模式)、NBI(Narrow Band Imaging,窄带成像,Olympus 系)、BLI(Blue Light Imaging,蓝光成像,Fujinon 系)、LCI(Linked Color Imaging,联动彩色成像,Fujinon 系)、FICE(Flexible spectral Imaging Color Enhancement,柔性光谱成像色彩增强)。五模态的意义在于:不同设备品牌(Fujinon/Olympus/Pentax)与不同染色策略会对同一息肉呈现不同颜色与纹理,模型必须对"成像管道差异"鲁棒。
Q3:三个中心分别在哪?
(1)Bærum Hospital, Vestre Viken Hospital Trust(挪威)——Center 1,主力贡献者,设备 Olympus Evis Exera III / CF 190;(2)Karolinska University Hospital(瑞典斯德哥尔摩)——Center 2,样本最少,Olympus 设备;(3)Hanoi Medical University (HMU) + Institute of Gastroenterology and Hepatology (IGH)(越南河内)——Center 3,合并且计为单中心(同城同人群同设备 Fujinon)。三地覆盖北欧与东南亚两类人群,是"人口代表性"设计。
Q4:数据到底怎么来的?
两个关键来源:Center 1 从 HyperKvasir 数据集的未标注类中识别息肉帧——HyperKvasir 有 99417 帧内镜图像,团队从中挑出 3000 张 WLI 候选,标注后采纳 2588 张,另选 136 张 NBI;Center 3 复用 **BKAI-IGH(越南)**的 1200 张图像(其中 BKAI 提供 1000 WLI + 60 LCI + 70 FICE + 70 BLI);Center 2(Karolinska)则按 GDPR 完全匿名后贡献 30 WLI + 10 NBI。这条"旧数据重标注"路径与 PANDA-PLUS 对 PANDA 的做法同构——把别人未利用的未标注资源盘活成带像素级真值的资产。
Q5:标注由谁做、怎么保证质量?
标注在 Labelbox 在线平台完成,由一名有数据治理经验的资深研究助理用 Wacom Cintiq 数位屏逐帧勾勒(用单人描边以减少手工勾勒的异质性)。质控是双层的:每条标注由至少两名高级胃肠病专家交叉复核,另指定一名独立高级胃肠病专家复核全部 3934 张图像。复核内容包括"该帧是否真为息肉"(剔除无息肉帧)与"标注是否临床可接受"(修正错误标注)。
Q6:分割和检测两种任务都支持吗?
是。团队为所有图像同时提供边界框与像素级标注,因此同一数据集既可用于息肉分割(segmentation),也可用于息肉检测(object detection)。模态视图下提供"images + 分割真值掩码"(用于分割)与"images + 边界框信息"(用于检测);中心视图下每中心含 images、分割真值、边界框三件套。图像与掩码同名,便于配对加载。
Q7:图像规格与训练配置是什么?
纳入图像的最小分辨率为 1280×720,全部 JPEG 压缩。训练时分割任务统一 resize 到 512×512,检测任务统一 resize 到 640×480。划分比例 80% 训练 / 10% 验证 / 10% 测试。分割用 PyTorch 1.9、NVIDIA RTX 3090、BCE+Dice 损失、Adam、lr 1e-4、200 epoch、batch 12;检测用 AdamW、lr 1e-4、batch 16、YOLO 全家族统一超参。
Q8:它和 Kvasir-SEG 等老数据集是什么关系?
血缘很近但定位不同。Kvasir-SEG(rid 112,1000 张息肉分割)是 Jha 等 2020 年的单模态(WLI)分割数据集;PolypDB 的图像来源之一就是 HyperKvasir(Kvasir-SEG 的姊妹数据集)的未标注类,且团队把 WLI 之外的四种模态补齐。所以 PolypDB ≈ “Kvasir 家族未标注资源 + 四模态扩展 + 三中心 + 专家全量复核”。论文 Table I 把 Kvasir-SEG、HyperKvasir、Kvasir-Capsule、CVC-VideoClinicDB、ASU-Mayo、BKAI-IGH、PolypGen 列为对照。
Q9:我现在能立刻下载吗?
能——这是它与许多"注册墙/请求制"数据集的最大区别。数据在 OSF https://osf.io/pr7ms/ 公开直链,无需注册、无需申请(论文与 GitHub 均直接指向该地址)。代码与数据集划分、COCO 标签在 GitHub DebeshJha/PolypDB 公开。
Q10:为什么它对 AI-Ready 重要?
它是库内少数"多模态+多中心+公开直链+双视图组织"四位一体的内镜数据集样本:可获取性满分(无门槛直链),组织方式自带"域泛化评测"结构(模态视图/中心视图),且提供分割/检测/联邦三套基线。对做内镜 AI 通用化研究的团队,它同时是训练集和"分布漂移压力测试台"。
1.1 补充问答:研究者最常问的五个问题
Q11:五个模态的样本量分别是多少?
按论文 §III-A 的实验口径:WLI 3558、NBI 146、LCI 60、BLI 70、FICE 70(合计 3904,与总数 3934 差 30)。WLI 占 91%,是绝对主力;BLI/FICE/LCI 各仅 60-70 张。做多模态研究时务必注意少数模态的样本量——60 张的 10% 测试集只有 6 张,指标噪声大。
Q12:数据集的"三中心"是否平衡?
极不平衡。Bærum(挪威)2724 张、越南(HMU+IGH,论文合并为单中心)1200 张、Karolinska(瑞典)仅 40 张。占比约 69% : 30% : 1%。因此 center-wise 结论(尤其联邦学习的 Karolinska 结果)基于很小的样本,引用时须谨慎。
Q13:它支持息肉分类(腺瘤/增生)吗?
不支持。PolypDB 只提供区域级分割掩码与检测框,不含组织学类型标签、不含 Paris 形态分型、不含息肉大小标签。要做息肉性质分类需另找带病理标签的数据集,或把 PolypDB 作为分割预处理环节。
Q14:它和 HyperKvasir 是什么关系?会不会重复?
上游血缘关系,但不重复。PolypDB Center 1 的 2588 张 WLI + 136 张 NBI 取自 HyperKvasir 的未标注类(HyperKvasir 原数据集对这些帧没有息肉真值),PolypDB 首次为它们赋予像素级掩码与检测框。所以 HyperKvasir 是"原材料供应商",PolypDB 是"加工成品"——两者互补而非重复。
Q15:论文有没有正式期刊版?
截至本次抓取(2026-09-30),三轮搜索未见 PolypDB 的正式期刊发表记录。可引用的规范来源是 arXiv:2409.00045(v2,2025-01-03)。GitHub README 引用块给出的 10.1109/TMI.2024.1234567 是占位符(尾号 1234567),不可使用。
Q16:数据集的划分文件怎么用?
GitHub 仓库的 dataset-split/ 目录提供固定的 80%/10%/10% 划分。强烈建议使用官方划分而非自行随机切分——因为多篇后续论文会基于官方划分报告结果,自行切分会破坏可比性。检测任务额外用 coco_labels/ 的 COCO 格式标签。
Q17:能不能只下载某个模态/中心?
可以。因为数据集按模态视图与中心视图组织,若只需 WLI 可从 WLI/ 目录下取;若只研究挪威中心可从 Simula/(或 Bærum/)取。这种"按需下载"的可组合性是双视图组织的直接好处。
Q18:PolypDB 有没有数据加载的官方代码?
GitHub 仓库提供数据集划分、COCO 标签与目录结构说明,但未附官方训练/评估代码(如 DataLoader、模型训练脚本)。这是一个小遗憾——复现基线需自行编写训练代码,参照论文超参(§11.2)。相比之下,PANDA-PLUS-Bench 提供了 Google Colab 开箱即评。
1.2 一句话画像:PolypDB 的三个身份
为了帮读者快速建立心智模型,把 PolypDB 的三个身份并列:
| 身份 | 一句话 | 对应资产 |
|---|---|---|
| 数据容器 | 3934 张三中心五模态息肉图像 + 像素级掩码 + 检测框 | OSF osf.io/pr7ms |
| 评测基准 | 分割 8 方法 / 检测 5 YOLO / 联邦 10 模型的公开基线 | 论文 Table III/IV/V |
| 工程范例 | 公开直链 + 双视图组织 + 全量专家终审的数据集样板 | OSF + GitHub + 论文 |
三种身份对应三类使用者:找数据的、做评测的、学数据工程的。本条目 §2–§3 服务第一类,§5 服务第二类,§3/§8 服务第三类。
1.3 最后一问:PolypDB 的"数据集贡献"到底新在哪
有人会问:息肉分割数据集已经很多(Kvasir-SEG、CVC 系列、PolypGen……),PolypDB 到底新增了什么?答案可以压缩成三点:
- 模态:它是第一个把 BLI/FICE/LCI/NBI/WLI 五种内镜成像模态集齐的开源息肉数据集——这填补了"多模态"空白。
- 中心:它覆盖挪威/瑞典/越南三国、Olympus/Fujinon 两套设备——提供了跨中心跨设备的评测基础。
- 结构:它不只是"一堆图",而是模态视图 + 中心视图 + 联邦基线的完整评测套件——让"泛化"可测、可复现。
如果只记一句:PolypDB 的贡献不是"更多图",而是"更结构化的图"——它把数据集的多样性与评测维度绑定,这是它区别于前代息肉数据集的核心。
§2 数据构成与规格
2.1 规模、来源与中心构成
PolypDB 宣称总量为 3934 张息肉图像,分布来自三个医学中心。各中心的采集与采纳路径如下:
| 中心 | 国家 | 采集设备 | 数据来源路径 | 采纳图像数 |
|---|---|---|---|---|
| Center 1:Bærum Hospital, Vestre Viken Hospital Trust | 挪威 | Olympus Evis Exera III, CF 190 | HyperKvasir 未标注类识别 3000 WLI 候选 → 采纳 2588;另选 136 NBI | 2724(2588 WLI + 136 NBI) |
| Center 2:Karolinska University Hospital | 瑞典 | Olympus Evis Exera III, CF 190 | 全 GI 道图像中筛息肉,GDPR 完全匿名 | 40(30 WLI + 10 NBI) |
| Center 3:HMU + IGH(论文合并为单中心) | 越南 | Fujinon 系统 | HMU 600 + IGH 600;BKAI 构成为 1000 WLI+60 LCI+70 FICE+70 BLI | 1200 |
| 合计 | — | — | — | 3934(论文口径) |
中心分布极不均衡:Bærum 2724 张(约 69%)、越南 1200 张(约 30%)、Karolinska 仅 40 张(约 1%)。这与任务头"三中心"的平衡印象相反——Karolinska 本质是补充性的小样本,其统计结论(尤其联邦学习 center-wise)受此硬约束。任何"跨中心泛化"结论都必须先对齐这个 2724:1200:40 的构成。
两个上游血缘必须记清:
- HyperKvasir(rid 693)→ PolypDB Center 1:HyperKvasir 含 99417 帧内镜图像与 374 段视频,PolypDB 从中"打捞"未标注的息肉帧并首次赋予真值。论文强调这一点的价值:“we are making use of unlabelled frames, which were never explored for the development of new tools.”——即把从未被利用的未标注数据盘活。
- BKAI-IGH(rid 84)→ PolypDB Center 3:越南 1200 张图像中,BKAI 部分(1000 WLI+60 LCI+70 FICE+70 BLI)与已入库的 BKAI-IGH NeoPolyp 数据集同源。PolypDB ≠ BKAI-IGH,但包含其图像,二者是聚合与单中心的关系。
2.2 模态构成与"3904 vs 3934"的数字缺口
论文 §III-A 给出实验所用的模态级图像数,这是全文最可核验的模态分布:
| 模态 | 图像数 | 全称 | 设备/品牌 |
|---|---|---|---|
| WLI | 3558 | White Light Imaging(白光成像) | Olympus / Fujinon 通用 |
| NBI | 146 | Narrow Band Imaging(窄带成像) | Olympus 系 |
| LCI | 60 | Linked Color Imaging(联动彩色成像) | Fujinon 系 |
| BLI | 70 | Blue Light Imaging(蓝光成像) | Fujinon 系 |
| FICE | 70 | Flexible spectral Imaging Color Enhancement(柔性光谱色彩增强) | Fujinon 系 |
| 合计 | 3904 | — | — |
关键缺口:3558+146+60+70+70 = 3904,与全文宣称的总数 3934 相差 30 张。论文对此未作解释。可能的来源是 Center 2(Karolinska)的 30 张 WLI 在模态统计中未被计入(3558 若不含 Karolinska 的 30 张则更接近其他口径),但论文未说明——这构成需存照的双口径(坑 A)。引用时务必写明你用的是哪个数。
从占比看,WLI 占 91%(3558/3904),而 BLI/FICE/LCI 各仅 60-70 张、NBI 146 张——"五模态"的说法在覆盖广度上成立,但在样本量上四模态是少数派。这直接影响各模态基准的统计功效:LCI 仅 60 张时,10% 测试集只有 6 张,任何单模态指标的置信区间都相当宽。
2.3 双视图组织:模态视图与中心视图
PolypDB 的一个结构特色是同一批图像按两种维度切分组织,供不同研究目标取用:
| 视图 | 子目录 | 每目录内容 | 适用任务 |
|---|---|---|---|
| 模态视图 | BLI / FICE / LCI / NBI / WLI | images + annotations(分割掩码) | 研究"不同成像模态对分割的影响" |
| 中心视图 | Simula / Karolinska / BKAI(GitHub 口径) | images + annotations + bounding_boxes | 研究"跨中心分布漂移与泛化" |
目录命名坑:GitHub README 的中心视图目录写作 Simula / Karolinska / Vietnam(另一处写 Simula/Karolinska/BKAI),而论文 center-wise 实验结果标注为 BKAI / Karolinska / Bærum。三处名称指向同一批中心但用词不一——“Simula”(挪威 SimulaMet 研究机构)与"Bærum 医院"并非同一实体,检索文件树时务必以实际目录内容为准(坑 E)。
2.4 图像规格与格式
| 属性 | 规格 |
|---|---|
| 图像格式 | JPEG(全部图像统一 JPEG 压缩) |
| 最小分辨率 | 1280 × 720 像素(纳入标准硬门槛) |
| 分割输入尺寸 | 512 × 512(训练时统一 resize) |
| 检测输入尺寸 | 640 × 480(训练时统一 resize) |
| 掩码配对 | 图像与分割真值同名,便于配对加载 |
| 标注工具 | Labelbox(在线平台)+ Wacom Cintiq(描边数位屏) |
| 检测标签格式 | COCO 格式(GitHub coco_labels/ 目录) |
| 划分文件 | GitHub dataset-split/ 目录,80%/10%/10% |
2.5 纳入与排除标准:数据质量的门槛
PolypDB 通过严格的纳入/排除标准保证图像质量,这是"curated"(精编)一词的实质:
纳入标准(Inclusion):原生结直肠息肉图像;WLI 或 FICE 模式;最小分辨率 1280×720;息肉边界必须清晰可辨;肠道准备评分 BBPS ≥ 2(Boston Bowel Preparation Score,波士顿肠道准备评分,衡量视野清洁度,≥2 表示肠道清洁良好)。
排除标准(Exclusion):息肉已被切除或在网兜中运送的帧;图像质量差的帧(模糊、抖动、过暗、有反光/眩光、被粪便/血液/黏液遮挡);注射了蓝色染料或圈套器套住息肉颈部的帧;切除创面被血覆盖、残留息肉不清的帧;无法判断是息肉还是工具残留的帧;显示正常解剖结构或处于其他图像增强模式(BLI/LCI,当用于分割纳入时)的帧;含内镜器械(cap、注射针、圈套器、活检钳、夹子)的帧。
这套标准的临床合理性在于:息肉分割模型若在"血糊糊的创面"或"器械遮挡"帧上训练,会学到与息肉形态无关的伪特征。PolypDB 选择只保留"边界清晰、肠道清洁、无器械干扰"的干净帧——代价是图像偏向理想条件,真实手术中大量低质量帧被排除在外(这一取舍对"真实世界鲁棒性"的影响需在选型时权衡)。
2.6 伦理与隐私
三中心各自完成合规流程(论文 Table II):Bærum 获数据监察批准、伦理豁免、无需患者同意;Karolinska 按 GDPR 完全匿名(fully anonymized)、需书面知情同意(written informed consent);越南 HMU/IGH 完全匿名、无需额外伦理批准。三地流程共同覆盖三项:必要时取得患者知情同意、经数据监察机构/伦理委员会审核、按本国隐私法规在导出前去标识化。团队在"潜在收益高于潜在风险"的判断下公开该数据集——对医学影像数据集而言,这是标准的伦理正当性论证。
2.7 目录结构与实践加载
PolypDB 的目录结构在 GitHub README 中有完整描述,两种视图的树形如下(据 README 原文):
模态视图(Modality-based):
PolypDB/
├── BLI/
│ ├── images/
│ └── annotations/
├── FICE/
│ ├── images/
│ └── annotations/
├── LCI/
│ ├── images/
│ └── annotations/
├── NBI/
│ ├── images/
│ └── annotations/
└── WLI/
├── images/
└── annotations/
中心视图(Center-wise):
PolypDB/
├── Simula/
│ ├── images/
│ ├── annotations/
│ └── bounding_boxes/
├── Karolinska/
│ ├── images/
│ ├── annotations/
│ └── bounding_boxes/
└── BKAI/
├── images/
├── annotations/
└── bounding_boxes/
(注意:README 正文另有一处把第三目录写作 Vietnam/,与 BKAI/ 指同一中心——见坑 5。)
实践加载三步:
- 从 OSF(osf.io/pr7ms)下载数据,按 README 目录结构解压到对应文件夹;
- 分割任务:在对应视图下,
images/与annotations/中同名文件配对(图像与掩码同名是设计约定,简化 DataLoader 配对逻辑); - 检测任务:使用中心视图下的
bounding_boxes/,或 GitHub 仓库的coco_labels/(COCO 格式 JSON);划分用仓库的dataset-split/(80/10/10)。
配对约定的工程价值:图像与掩码同名可让 Dataset.__getitem__ 直接从文件名派生掩码路径,无需额外映射表——这是大型分割数据集常见的工程简化,PolypDB 沿用了这一惯例。
2.8 图像偏斜的统计含义
把模态与中心的样本量放到一张表里,能看清 PolypDB 的"长尾结构":
| 维度 | 主导项 | 主导占比 | 长尾项 | 长尾占比 |
|---|---|---|---|---|
| 模态 | WLI(3558) | 约 91% | BLI/FICE/LCI(各 60-70) | 各约 2% |
| 中心 | Bærum(2724) | 约 69% | Karolinska(40) | 约 1% |
| 任务 | 分割(全量) | 100% | 检测(中心视图) | 子集 |
对使用者的三条建议:
- 训练多模态模型时须做类别/模态平衡:若直接按原始分布采样,WLI 会主导梯度,BLI/FICE/LCI 学不好。建议按模态重采样或加权。
- 做中心泛化研究时须报告各中心样本量:Karolinska 的 40 张不足以支撑强结论,应作为"示例性"而非"显著性"证据。
- 引用单模态指标时须注样本量:LCI mIoU 0.8567 看着漂亮,但基于 60 张(测试集 6 张),置信区间极宽,不可与 WLI(3558 张)的指标等量齐观。
2.9 数据集要解决的五个分割难点
论文在引言中系统列出了息肉分割之所以困难的五类原因,这也是 PolypDB 图像"多样性"的来源——理解它们才能理解数据集价值:
| 难点 | 具体表现 | 对模型的影响 |
|---|---|---|
| (i) 形态时间演化 | 息肉在发育阶段形态随病程变化 | 训练集需覆盖不同发展阶段 |
| (ii) 低对比 | 息肉形状/大小/颜色/外观与周围黏膜高度相似 | 边界模糊,模型易漏切或过切 |
| (iii) 黏液伪装 | 黏液覆盖息肉形成"迷彩",连专家都可能被骗 | 即使 SOTA 也可能误判 |
| (iv) 成像伪影 | 模糊、眩光、光照过强/过弱、反光、低对比 | 引入与病变无关的伪特征 |
| (v) 器械与残留干扰 | 手术器械、肠道残留物遮挡边界 | 边界判断受污染 |
这五点的工程含义:一个高质量息肉分割数据集的价值,不在于"图多",而在于是否覆盖了这些难点的多样性。PolypDB 用五模态(对应难点 iv 的设备差异)与三中心(对应难点 i 的人群差异)来扩展这种覆盖。但要注意:PolypDB 的排除标准主动剔除了低质量帧(模糊/眩光/器械遮挡),所以它在难点 (iii)(iv)(v) 上的覆盖是被"提纯"过的——PolypDB 偏向理想成像条件,真实手术中的糟粕帧被排除在外。这是精度与真实性的取舍,选型时须知。
2.10 类别体系:只有"息肉 vs 背景"
与 PANDA-PLUS 的多类掩码(Benign/GP3/GP4/GP5/Ignore 五类)不同,PolypDB 的分割掩码是二值的:息肉区域(foreground)vs 背景/正常黏膜(background)。这带来三处使用约束:
- 无法用于"息肉类型分割":不能区分腺瘤性、增生性、锯齿状病变——这些需要病理或内镜形态标签。
- 区域定义偏"ROI":掩码标注的是"被息肉覆盖的区域",不细分内部结构。
- 检测框 vs 分割掩码:检测任务用边界框(bounding box),分割任务用像素掩码;论文为所有图像同时提供两者,故两个任务共用同一批图像。
这一简化的合理性:息肉分割的主流下游任务是"完整切除确认"(判断切缘是否有残留)与"面积估算",这些只需二值区域掩码即可。分类与分型是另一条任务线(光学活检),需要不同的标签体系——PolypDB 明确不越界。
2.11 五模态的临床与工程含义详解
五种成像模态不只是"不同的滤镜",它们背后是不同的临床用途与技术原理:
| 模态 | 全称 | 技术原理 | 临床用途 | 品牌生态 |
|---|---|---|---|---|
| WLI | White Light Imaging | 标准白光照明 | 常规观察、最通用 | 全品牌 |
| NBI | Narrow Band Imaging | 窄带蓝绿光(415/540nm)突出表面微血管与黏膜纹理 | 早期癌、微小病变观察 | Olympus |
| BLI | Blue Light Imaging | 蓝光+荧光,增强表面血管与黏膜对比 | 病变检测与分型 | Fujinon |
| LCI | Linked Color Imaging | 联动增强红白对比,提升黏膜色彩分离度 | 炎症、病变边界观察 | Fujinon |
| FICE | Flexible spectral Imaging Color Enhancement | 光谱估计后重组波长,模拟多种染色 | 病变增强(类似 NBI 效果) | Fujinon |
工程含义:
- 设备生态差异:NBI 是 Olympus 的招牌技术,BLI/LCI/FICE 是 Fujinon 的技术——PolypDB 同时覆盖两家,对"跨品牌模型"研究有独特价值。
- 图像分布差异大:同一息肉在 WLI 与 BLI 下的颜色分布截然不同(蓝光模式下红绿通道被抑制),这解释了 §5.1 中各模态指标的巨大差异。
- 模态专属模型 vs 统一模型:论文结果显示"单一方法无全模态最优"(§5.1),提示实际部署中可能需要"按模态选模型"或"训练模态感知的统一模型"——这是 PolypDB 提出的开放问题。
2.12 上游数据集复用链的完整图谱
PolypDB 的图像来源可画成一条清晰的复用链,理解它对"避免重复下载"和"追溯数据血缘"至关重要:
NCBI/公开资源生态
├── HyperKvasir(110,079 图 + 374 视频,含未标注类)
│ └── → PolypDB Center 1:打捞 3000 WLI 候选 → 采纳 2588 WLI
│ └── → 打捞 136 NBI
├── BKAI-IGH(越南息肉数据集)
│ └── → PolypDB Center 3:1200 张(1000 WLI + 60 LCI + 70 FICE + 70 BLI)
└── Karolinska 医院原始数据(GDPR 匿名)
└── → PolypDB Center 2:40 张(30 WLI + 10 NBI)
↓
PolypDB 聚合 = Center1 + Center2 + Center3 = 3934 张(论文口径)
三条血缘的实践意义:
- 与 HyperKvasir 去重:若你已下载 HyperKvasir,其"未标注类"中的息肉帧已被 PolypDB 重新标注——两者有图像重叠,但标注状态不同(HyperKvasir 无息肉掩码,PolypDB 有)。
- 与 BKAI-IGH 去重:PolypDB 的越南部分 = BKAI-IGH 的图像,做"跨数据集训测"时须警惕两者不是独立的测试集。
- Karolinska 独占:只有 40 张,且不来自其他公开数据集,是 PolypDB 唯一的"独家数据"——但也正因为量少,其统计价值有限。
这一复用链的启示:PolypDB 的价值不在于"采集了多少新数据",而在于"把分散在多个公开数据集里的息肉图像,用统一的标注规范与专家质控重新组织成多模态多中心的整体"。这是一种"数据编排(data curation)"的贡献,与"数据采集(data collection)"同样重要。
§3 标注方法论:单人描边 + 双专家交叉复核 + 独立全量终审
3.1 三层质控结构
PolypDB 的标注流程设计可归纳为"机械劳动集中、判断分散复核":
| 环节 | 执行者 | 职责 | 覆盖范围 |
|---|---|---|---|
| 描边(annotation) | 1 名资深研究助理(数据治理背景) | 用 Labelbox + Wacom Cintiq 逐帧勾勒息肉 ROI 区域 | 全部 3934 张 |
| 交叉复核(cross-verification) | 每张由至少 2 名高级胃肠病专家 | 判断帧是否真含息肉 + 标注是否临床可接受 | 全部图像(每张≥2 人) |
| 独立终审(independent review) | 1 名独立高级胃肠病专家 | 复核全部 3934 张图像 | 全量 100% |
设计要义:描边用单人是为了消除"多个标注者对同一形态的不同描边习惯"带来的异质性(论文原文:“to minimize the heterogeneity in the manual delineation process”);而复核用多人 + 全量终审是为了覆盖单人可能的系统性偏差。这与 PANDA-PLUS 的"学生初注→高年级复核→专家终审"三层流水线是同一思路的不同实现——PolypDB 把"劳动层"压缩到一人(因为有数位屏工具降低门槛),把"判断层"扩展为双专家+独立终审。
3.2 复核流程的两道关
每张图像在终审时依次过两关:
- 帧级关(是否含息肉):胃肠病专家先判断"这一帧是否代表结肠息肉、是否应纳入数据集"。不含息肉或无法确认的帧被剔除——这解释了为什么从 3000 张 WLI 候选中最终只采纳 2588 张(其余按排除标准剔除)。
- 标注级关(标注是否准确):专家检查帧内每个息肉的标注是否"correct"且临床可接受,不准确的标注被调整,非息肉图像被移除。
3.3 与库内其他息肉数据集标注工艺的对照
把库内息肉数据集的标注方式横向摆开,能看到"规模—保真度—成本"的三角取舍:
| 数据集 | 规模 | 标注层级 | 质控方式 | 模态覆盖 |
|---|---|---|---|---|
| Kvasir-SEG(rid 112) | 1000 图 | 像素级掩码 | 专家标注 | 单模态(WLI) |
| BKAI-IGH NeoPolyp(rid 84) | 1000 图 | 像素级掩码 | 专家标注 | 单中心(越南) |
| PolypGen(rid 183) | 1531 图 + 2000 帧 | 像素级掩码 | 多中心专家 | 单模态为主 |
| PolypDB(本条目) | 3934 图 | 像素级掩码+检测框 | 单人描边+≥2 专家交叉+独立全量终审 | 五模态 IEE |
PolypDB 的位置:规模上它不是最大(CVC-VideoClinicDB/ASU-Mayo 更大但已下架),但它是**唯一同时具备"五模态 + 三中心 + 双任务标注 + 全量独立终审"**的组合。对使用者而言,其标注质量的核心卖点是"独立专家复核 100% 图像"——这在千张级数据集里属于高成本配置。
3.4 标注粒度的临床取舍
PolypDB 的掩码回答的是"息肉占哪些像素"(二值/区域级 ROI),不是"息肉属于哪一病理类型"(无组织学分级标签),也不含"息肉大小/形态(Paris 分型)"标签。这意味着:
- 支持:息肉区域分割(二分类 foreground/background)、息肉检测(bounding box)。
- 不支持:腺瘤 vs 增生性息肉的分类、SSL(sessile serrated lesion,无蒂锯齿状病变)识别、息肉恶性程度预测——这些需要病理或内镜形态学标签,PolypDB 未提供。
- 对"光学活检"(optical biopsy,内镜下即时判断息肉类型)类研究,PolypDB 只能作为分割预处理,不能作为分类监督。
3.5 标注成本经济学:为什么"单人描边+多人复核"是合理设计
标注像素级医学掩码的成本结构值得拆解。对息肉分割任务而言,单张图像的成本大致分三段:
| 成本段 | 工作量 | 可摊销性 |
|---|---|---|
| 描边(机械劳动) | 沿息肉边界逐点勾勒 | 高(可培训、可工具加速) |
| 判定(专业判断) | 判断边界何处属息肉/黏膜 | 低(需胃肠病专业知识) |
| 复核(质量控制) | 交叉检查、修正错误 | 中(可分层,专家只查关键处) |
PolypDB 的设计把"描边"交给单人(降低多人描边的异质性),把"判定与复核"交给多名专家(≥2 名交叉 + 1 名独立全量)——这是对成本结构的精准匹配:机械劳动集中化以保一致性,专业判断分散化以保可靠性;而用 Wacom Cintiq 数位屏进一步降低"描边"的边际成本。
对比 PANDA-PLUS 的三层流水线(学生→高年级→专家):PANDA-PLUS 用"学生劳动力"压缩描边成本、用"专家终审"保质量;PolypDB 用"单人+数位屏"压缩描边成本、用"双专家交叉+独立终审"保质量。两者殊途同归——核心都是把专家的稀缺时间从机械劳动中解放出来。区别在于 PANDA-PLUS 的规模更大(546 张 WSI,每张 gigapixel),需要学生分层;PolypDB 的规模是数千张小图,单人描边已可承受。
3.6 质量控制的可验证性
一个质控流程好不好,看它是否可被使用者独立验证。PolypDB 的质控有三条可追溯线索:
- 纳入/排除标准的显式化:论文列出完整的纳入与排除条件(分辨率、BBPS、边界清晰度、无器械等),使用者可据此判断"我的场景是否符合数据分布"。
- 中心级数据采集记录:论文 Table II 记录每个中心的设备型号与伦理流程,可追溯"某张图来自什么设备、什么合规背景"。
- 复审层级的书面描述:"≥2 名专家交叉 + 1 名独立全量终审"是可复制的流程模板。
不足:PolypDB 未公开标注一致性指标(如专家间 IoU/Dice),也未逐张给出"由哪几位专家复核"的元数据——这意味着使用者无法量化"标注噪声有多大"。相比之下,PANDA-PLUS 公开了重标注与原标签的一致性统计。这是 PolypDB 在"标注透明性"上可改进之处。
3.7 与"众包标注"的对照
另一条常见的低成本标注路线是众包(crowdsourcing),即让非专家群体大量标注、用聚合(如多数投票)去噪。PolypDB 明确选择了"少而精"而非"多而杂":
| 路线 | 标注者 | 质控 | 规模上限 | 适用 |
|---|---|---|---|---|
| 众包聚合 | 非专家群体 | 多人投票去噪 | 极大 | 标注标准极清晰、可判定的任务 |
| PolypDB 模式 | 单人描边 + 专家复核 | 交叉+全量终审 | 数千级 | 需要专业判断的医学分割 |
| 纯专家手标 | 专家本人 | 专家间一致性 | 百张级 | 最高保真、小样本基准 |
息肉分割需要判断"边界何处属病变黏膜",这是有专业门槛的判定,非专家众包难以胜任——这正是 PolypDB 选"单人描边+专家复核"的原因。三条路线各对应不同的"成本-保真度"权衡点,PolypDB 落在"数千张级、专业保真"的位置。
§4 与既有息肉数据集的关系边界
4.1 论文 Table I 的景观定位
论文用一张对照表(Table I)把"≥1000 样本"的结肠息肉数据集摆在一起,PolypDB 的定位一目了然:
| 数据集 | 内容 | 规模 | 可获取性 | 模态 |
|---|---|---|---|---|
| Kvasir-SEG | 息肉 | 1000 图(含掩码) | open academic | 单模态 WLI |
| HyperKvasir | GI 发现+息肉 | 110,079 图 + 374 视频 | open academic | 混合 |
| Kvasir-Capsule | GI 发现+息肉 | 4,741,504 图 | open academic | 胶囊内镜 |
| CVC-VideoClinicDB | 息肉 | 11,954 图(含掩码) | by request(已下架) | 视频帧 |
| ASU-Mayo polyp DB | 息肉 | 18,781 图(含掩码) | by request(已下架) | 视频帧 |
| BKAI-IGH | 息肉 | 1000 图(含掩码) | open academic | 单中心越南 |
| PolypGen | 息肉 | 1531 图 + 2000 视频帧 | open academic | 多中心 |
| PolypDB(本条目) | 息肉 | 3934 图(3 中心) | open academic | 五模态 IEE |
论文表下脚注说明:† 含分割真值掩码;⋄ 视频胶囊内镜;∙ 已不可获取。两个曾经的规模之王(CVC-VideoClinicDB 11954、ASU-Mayo 18781)都已下架——这恰恰凸显 PolypDB "open academic + 公开直链"的可贵:规模不是第一,但"现在还能下载"是第一。
4.2 与库内既有条目的三条关系线
关系线一:血缘上游(被动继承)
- HyperKvasir(rid 693):PolypDB Center 1 的 2588 WLI + 136 NBI 直接来自 HyperKvasir 未标注类,是最硬的血缘链。
- BKAI-IGH NeoPolyp(rid 84):PolypDB Center 3 的越南图像与 BKAI 同源,PolypDB 包含 BKAI 图像但定位不同(三中心聚合 vs 越南单中心)。
关系线二:同域对照(横向可比)
- Kvasir-SEG(rid 112):同为 Jha 团队的息肉分割数据集,PolypDB 可视为其"多模态+多中心"扩展版;研究者常在三者间做跨数据集泛化评测。
- PolypGen(rid 183):同样主打多中心泛化,但模态以 WLI 为主;PolypDB 在模态多样性上更全面。
- LDPolypVideo(rid 163):息肉视频数据集,与 PolypDB 的"视频抽帧成静态图"形成互补——PolypDB 是帧级静态,LDPolypVideo 保留时序。
关系线三:下游/邻域(任务接续)
- NCT-CRC-HE-100K(rid 148):结直肠癌组织病理分类(同一疾病的病理侧,模态不同)。
- GastroVision(rid 203)/ EndoSLAM(rid 408)/ Endoscapes(rid 353):GI 内镜与腹腔镜邻域数据集,同属"内镜 AI 数据生态"。
4.3 "PolypDB ≠ 其他 polyp 数据集"的边界声明
检索者最容易犯的错是把同域数据集混为一谈。明确边界:
- PolypDB ≠ PolypGen:PolypGen(Ali 等 2023)是另一个多中心息肉检测分割数据集,规模 1531 图 + 2000 帧,样本量与 PolypDB(3934)不同,团队也不同(PolypGen 以 Leeds/Oxford 的 Sharib Ali 为主导,与 PolypDB 的 Northwestern/Jha 是不同主导方,虽有作者交叉)。
- PolypDB ≠ LDPolypVideo:后者是视频数据集,前者是静态帧数据集。
- PolypDB ≠ BKAI-IGH:PolypDB 的越南部分来自 BKAI,但 PolypDB 是三中心五模态聚合,BKAI-IGH 是越南单中心——是"包含"而非"等同"关系。
- 本库无 polypdb 别名撞库(DB 查重仅命中 bkai-igh-neopolyp/polypgen/ldpolypvideo 三条不同条目),slug 唯一。
4.4 与 PANDA-PLUS 的模式同构(跨模态方法论对照)
一个值得库内交叉阅读的方法论对照:PolypDB 的 Center 1 与 PANDA-PLUS 采用了同一种"旧数据重标注"策略——都从既有公开数据集(HyperKvasir / PANDA)中挖出未被利用的未标注资源,重新赋予高质量标签:
| 维度 | PANDA-PLUS(病理 WSI) | PolypDB(内镜) |
|---|---|---|
| 上游 | PANDA 挑战赛 WSI | HyperKvasir 未标注类 + BKAI |
| 增量 | 像素级 Gleason 掩码 | 像素级息肉掩码(+四模态扩展) |
| 质控 | 学生+高年级+专家终审 | 单人描边+双专家交叉+独立全量终审 |
| 核心发现 | 原 PANDA 高级别标签系统性错误 | 多模态多中心可提升泛化(未做原标签审计) |
两者都回答"如何用有限专家资源把旧数据升级为 AI-Ready 资产",但 PANDA-PLUS 附带对上游标签的批判审计,PolypDB 则附带多模态基准——前者是"质检报告",后者是"扩展包"。
4.5 与库内 Kvasir 家族的三代演进
把 Jha/Riegler/de Lange 挪威系的工作按时间线排开,能看到息肉数据集的"三代演进":
| 代际 | 数据集 | 年份 | 规模 | 模态 | 核心增量 | 库内 rid |
|---|---|---|---|---|---|---|
| 一代 | Kvasir-SEG | 2020 | 1000 图 | 单模态 WLI | 首个大规模息肉分割基准 | 112 |
| 一代 | HyperKvasir | 2020 | 11 万图/374 视频 | 混合 GI | 综合 GI 内镜多分类资源 | 693 |
| 二代 | Kvasir-Capsule | 2021 | 474 万图 | 胶囊内镜 | 胶囊内镜视频资源 | 123 |
| 二代 | Kvasir-Instrument | 2021 | 内镜器械 | 单模态 | 器械分割 | 213 |
| 三代 | PolypDB | 2024 | 3934 图 | 五模态 | 多中心+多模态+联邦基准 | 本条目 |
演进逻辑:一代解决"从无到有"(首个公开息肉分割集),二代拓展模态/对象(胶囊内镜、器械),三代解决"泛化"(多中心多模态)。PolypDB 站在 Kvasir 家族的肩膀上——它的图像来源(HyperKvasir)正是家族成员——但把焦点从"规模"转向"多样性"。这条谱系也解释了为什么 PolypDB 作者阵容里有多位 Kvasir 系列的常客(Jha、Riegler、Halvorsen、de Lange)。
4.6 与越南 BKAI 系的关系:包含而非等同
BKAI-IGH NeoPolyp(rid 84)是越南背景的息肉分割数据集(BKAI = Hanoi University of Science and Technology 的 BKAI 研究中心,IGH = Institute of Gastroenterology and Hepatology)。PolypDB 的 Center 3 明确复用了 BKAI 的越南图像:
- BKAI 贡献:1000 WLI + 60 LCI + 70 FICE + 70 BLI = 1200 张(与 PolypDB Center 3 的 1200 张吻合)。
- 关系:PolypDB 包含 BKAI-IGH 的图像,但增加了 Bærum 与 Karolinska 两个中心、补齐了 NBI 模态、统一了标注规范、提供了跨中心基准。
- 实践含义:若已下载 BKAI-IGH,再下 PolypDB 会发现越南部分是重叠的——做去重研究时须注意这一包含关系。
4.7 数据集选型决策树
给"该选哪个息肉数据集"一个可直接操作的决策树:
你的任务是什么?
├─ 单模态 WLI 息肉分割(小规模入门)
│ └─ → Kvasir-SEG(rid 112,1000 图)
├─ 多模态息肉分割(关注设备差异)
│ └─ → PolypDB(本条目,五模态)
├─ 多中心泛化/域适应研究
│ ├─ 以模态为漂移源 → PolypDB 模态视图
│ ├─ 以中心为漂移源 → PolypDB 中心视图 / PolypGen(rid 183)
│ └─ 隐私约束下的协作 → PolypDB 联邦基线(FedAvg)
├─ 息肉视频时序分析
│ └─ → LDPolypVideo(rid 163)
└─ 结直肠癌病理(组织学)
└─ → NCT-CRC-HE-100K(rid 148)
这张树的每一分支都对应一个库内条目——息肉 AI 的数据生态在库内已形成从"内镜成像"到"组织病理"、从"静态帧"到"视频"、从"单模态"到"五模态"的完整覆盖。
4.8 与库内三个最相关条目的深度对照
把 PolypDB 与库内最相关的三个息肉数据集逐维度对照,供选型直接查表:
| 维度 | PolypDB(本条目) | PolypGen(rid 183) | LDPolypVideo(rid 163) | Kvasir-SEG(rid 112) |
|---|---|---|---|---|
| 数据类型 | 静态图像 | 图像 + 视频帧 | 视频 | 静态图像 |
| 规模 | 3934 图 | 1531 图 + 2000 帧 | 视频序列(1.6 万+帧) | 1000 图 |
| 模态 | 五模态(BLI/FICE/LCI/NBI/WLI) | 单模态为主(WLI) | 单模态(WLI) | 单模态(WLI) |
| 中心数 | 3 | 多中心 | 单/多中心 | 单中心 |
| 标注 | 分割掩码 + 检测框 | 分割掩码 | 检测框 | 分割掩码 |
| 基线 | 分割 8 + 检测 5 + 联邦 10 | 分割/检测 | 检测/跟踪 | 分割 |
| 获取 | OSF 公开直链 | 部分申请 | 公开 | 公开 |
| 任务侧重 | 多模态多中心泛化 | 多中心泛化 | 时序检测 | 基础分割 |
选型速答:
- 要多模态→ PolypDB。
- 要多中心泛化对照→ PolypDB + PolypGen。
- 要视频/时序→ LDPolypVideo。
- 要入门小规模分割→ Kvasir-SEG。
4.9 与 BKAI-IGH(rid 84)的定量重叠分析
PolypDB 与 BKAI-IGH 的重叠是库内最需要澄清的"数据血缘":
| 项 | BKAI-IGH NeoPolyp | PolypDB Center 3 | 重叠判定 |
|---|---|---|---|
| WLI | 1000 | 1000(BKAI 部分) | 完全重叠 |
| LCI | — | 60 | PolypDB 新增 |
| FICE | — | 70 | PolypDB 新增 |
| BLI | — | 70 | PolypDB 新增 |
| NBI | — | 0 | 均无 |
| 总量 | 1000 | 1200 | 越南部分 PolypDB ⊇ BKAI |
结论:PolypDB 的越南部分包含 BKAI-IGH 的全部图像(1000 WLI)并新增 200 张多模态图像(60 LCI + 70 FICE + 70 BLI = 200)。因此:
- 若做"PolypDB vs BKAI-IGH"的跨集评测,越南部分是泄漏的(两者同图),只能用 PolypDB 的挪威/瑞典部分 vs BKAI。
- 若引用"越南息肉数据",PolypDB 的越南部分是 BKAI-IGH 的超集。
- 互链时须写明"PolypDB 的越南中心复用并扩展了 BKAI-IGH",避免读者误以为二者独立。
4.10 一句话记住 PolypDB 的边界
- 它给你:3934 张多模态多中心息肉图像的区域掩码与检测框,以及三套可对标基线。
- 它不给:息肉的组织学类型、Paris 分型、大小分级、视频时序。
- 它包含:HyperKvasir 的息肉帧、BKAI-IGH 的越南图像(做去重与跨集评测时须留意)。
- 它的门槛:零——OSF 公开直链。
把握这四条边界,就能在实际项目中正确使用 PolypDB,避免"以为它有分类标签"或"把它和 BKAI 当独立测试集"这类常见误用。
§5 基准结果:分割、检测与联邦学习三套基线
5.1 分割基线(8 方法 × 5 模态)
论文用 8 个分割方法在五个模态上分别评测,指标为 mIoU、mDSC(mean Dice Similarity Coefficient)、Recall、Precision、F2。各模态最佳结果(clean 条件):
| 模态 | 最佳方法 | mIoU | mDSC | Recall | Precision | F2 |
|---|---|---|---|---|---|---|
| BLI | DuAT(PVTv2-B2) | 0.6979 | 0.8048 | 0.9082 | 0.7647 | 0.8501 |
| FICE | SSFormer-L(MiT-PLD-B4) | 0.7607 | 0.8300 | 0.8713 | 0.8013 | 0.8526 |
| LCI | SSFormer-L | 0.8567 | 0.9207 | 0.9057 | 0.9466 | 0.9106 |
| NBI | PVT-CASCADE(PVTv2-B2) | 0.7769 | 0.8586 | 0.9385 | 0.8320 | 0.8941 |
| WLI | SSFormer-L | 0.8821 | 0.9294 | 0.9314 | 0.9438 | 0.9288 |
四个直接可读的结论:
- WLI 整体最高、BLI/FICE 整体最低:WLI 最佳 mIoU 0.8821,而 BLI 最佳仅 0.6979、FICE 0.7607——相差约 12-18 个点。原因是 WLI/FICE 训练样本充足(WLI 3558、FICE 70)但 BLI 仅 70 张,且白光成像对息肉与黏膜的对比度最符合常规标注习惯;蓝光/色彩增强模式改变了颜色分布,模型迁移困难。
- 无单一方法横扫全模态:DuAT 赢 BLI、PVT-CASCADE 赢 NBI、SSFormer-L 赢 FICE/LCI/WLI。这表明"选对架构"高度依赖模态——没有一个通用最优分割器,这正是多模态基准的价值。
- SSFormer-L 最稳定:五个模态中拿下三个第一、两个第二,综合最强。其主干是 MiT-PLD-B4(SegFormer 系列的轻量 transformer)。
- PVT-CASCADE 与 DuAT 分列二强:都基于 PVTv2-B2 主干,说明该骨干对息肉分割的全局上下文建模有效(论文将 PVT-CASCADE 的成功归因于 PVTv2-B2 的全局+局部特征提取能力)。
全方法逐模态补充(部分):U-Net 在所有模态垫底(BLI mIoU 仅 0.1822、FICE 0.1384),显示原始 U-Net 在息肉边界模糊与低对比场景下严重失效;PraNet、CaraNet、TGANet 居中;DeepLabV3+ 在 LCI(0.8066)和 WLI(0.8650)表现稳健但未夺冠。
5.1.1 完整分割结果表(8 方法 × 关键模态)
为便于对标,这里给出各方法的完整 clean 分割指标(mIoU / mDSC):
WLI(样本最多,最稳定):
| 方法 | 主干 | mIoU | mDSC | Recall | Precision | F2 |
|---|---|---|---|---|---|---|
| U-Net | — | 0.7452 | 0.8250 | 0.8275 | 0.8936 | 0.8203 |
| DeepLabV3+ | ResNet50 | 0.8650 | 0.9168 | 0.9183 | 0.9380 | 0.9157 |
| PraNet | Res2Net50 | 0.8570 | 0.9089 | 0.9046 | 0.9460 | 0.9042 |
| CaraNet | Res2Net101 | 0.8582 | 0.9128 | 0.9149 | 0.9322 | 0.9114 |
| TGANet | ResNet50 | 0.8536 | 0.9088 | 0.9165 | 0.9284 | 0.9104 |
| PVT-CASCADE | PVTv2-B2 | 0.8731 | 0.9219 | 0.9268 | 0.9372 | 0.9227 |
| DuAT | PVTv2-B2 | 0.8695 | 0.9197 | 0.9170 | 0.9437 | 0.9168 |
| SSFormer-L | MiT-PLD-B4 | 0.8821 | 0.9294 | 0.9314 | 0.9438 | 0.9288 |
LCI(样本仅 60,指标偏高但置信区间宽):
| 方法 | 主干 | mIoU | mDSC | Recall | Precision | F2 |
|---|---|---|---|---|---|---|
| U-Net | — | 0.3513 | 0.4712 | 0.5526 | 0.7644 | 0.4955 |
| DeepLabV3+ | ResNet50 | 0.8066 | 0.8898 | 0.8694 | 0.9294 | 0.8758 |
| PraNet | Res2Net50 | 0.7936 | 0.8825 | 0.8890 | 0.8992 | 0.8834 |
| CaraNet | Res2Net101 | 0.7600 | 0.8576 | 0.8335 | 0.9190 | 0.8398 |
| TGANet | ResNet50 | 0.8358 | 0.9061 | 0.8816 | 0.9474 | 0.8899 |
| PVT-CASCADE | PVTv2-B2 | 0.8344 | 0.9065 | 0.9074 | 0.9205 | 0.9056 |
| DuAT | PVTv2-B2 | 0.8551 | 0.9194 | 0.9200 | 0.9247 | 0.9191 |
| SSFormer-L | MiT-PLD-B4 | 0.8567 | 0.9207 | 0.9057 | 0.9466 | 0.9106 |
NBI(样本 146):
| 方法 | 主干 | mIoU | mDSC | Recall | Precision | F2 |
|---|---|---|---|---|---|---|
| U-Net | — | 0.2161 | 0.2986 | 0.6472 | 0.2622 | 0.3905 |
| DeepLabV3+ | ResNet50 | 0.6881 | 0.7733 | 0.8279 | 0.8511 | 0.7939 |
| PraNet | Res2Net50 | 0.6749 | 0.7473 | 0.7816 | 0.8836 | 0.7618 |
| CaraNet | Res2Net101 | 0.7249 | 0.8090 | 0.8312 | 0.8781 | 0.8194 |
| TGANet | ResNet50 | 0.7317 | 0.8402 | 0.8368 | 0.8645 | 0.8354 |
| PVT-CASCADE | PVTv2-B2 | 0.7769 | 0.8586 | 0.9385 | 0.8320 | 0.8941 |
| DuAT | PVTv2-B2 | 0.7494 | 0.8260 | 0.8662 | 0.8741 | 0.8476 |
| SSFormer-L | MiT-PLD-B4 | 0.7608 | 0.8432 | 0.9089 | 0.8462 | 0.8664 |
BLI(样本 70,除 LCI 外最难):
| 方法 | 主干 | mIoU | mDSC | Recall | Precision | F2 |
|---|---|---|---|---|---|---|
| U-Net | — | 0.1822 | 0.2855 | 0.6862 | 0.2180 | 0.3962 |
| DeepLabV3+ | ResNet50 | 0.6055 | 0.7293 | 0.8462 | 0.7146 | 0.7751 |
| PraNet | Res2Net50 | 0.6581 | 0.7831 | 0.8876 | 0.7390 | 0.8348 |
| CaraNet | Res2Net101 | 0.5853 | 0.7237 | 0.6895 | 0.8052 | 0.6978 |
| TGANet | ResNet50 | 0.5217 | 0.6520 | 0.8108 | 0.6344 | 0.7076 |
| PVT-CASCADE | PVTv2-B2 | 0.6737 | 0.7873 | 0.8750 | 0.7748 | 0.8205 |
| DuAT | PVTv2-B2 | 0.6979 | 0.8048 | 0.9082 | 0.7647 | 0.8501 |
| SSFormer-L | MiT-PLD-B4 | 0.6750 | 0.7848 | 0.8436 | 0.7708 | 0.8091 |
FICE(样本 70,SSFormer-L 最优):
| 方法 | 主干 | mIoU | mDSC | Recall | Precision | F2 |
|---|---|---|---|---|---|---|
| U-Net | — | 0.1384 | 0.2021 | 0.5600 | 0.1425 | 0.2840 |
| DeepLabV3+ | ResNet50 | 0.6129 | 0.6759 | 0.6653 | 0.9441 | 0.6668 |
| PraNet | Res2Net50 | 0.6013 | 0.6513 | 0.6559 | 0.7984 | 0.6530 |
| CaraNet | Res2Net101 | 0.5694 | 0.6286 | 0.6082 | 0.8135 | 0.6146 |
| TGANet | ResNet50 | 0.5922 | 0.6898 | 0.7086 | 0.7279 | 0.6960 |
| PVT-CASCADE | PVTv2-B2 | 0.7209 | 0.7799 | 0.8110 | 0.7588 | 0.7971 |
| DuAT | PVTv2-B2 | 0.5589 | 0.6746 | 0.9082 | 0.5867 | 0.7729 |
| SSFormer-L | MiT-PLD-B4 | 0.7607 | 0.8300 | 0.8713 | 0.8013 | 0.8526 |
从这五张表可提炼三个方法论观察:
- U-Net 的崩塌是数据驱动的:在 WLI(大样本)上 U-Net 还能到 0.7452,但在 FICE/BLI(小样本、色彩偏移)上跌到 0.13-0.18——说明朴素 CNN 对模态差异极度敏感。
- transformer 主干的稳定性优势:PVTv2-B2 与 MiT-PLD-B4 在五个模态上都没有崩塌(最低也有 0.55+),是"跨模态鲁棒"的关键。
- 高 Precision 陷阱:DeepLabV3+ 在 FICE 上 Precision 高达 0.9441,但 mIoU 仅 0.6129、mDSC 0.6759——高精度低召回意味着它只敢在"最有把握"处画掩码,漏掉大量息肉区域。只看 Precision 会误判模型能力。
5.2 检测基线(YOLO 家族)
检测用 YOLOv5/v7/v8/v9/v10 五个版本,指标 mAP50、mAP50-95、mAP75、Precision、Recall。各模态代表结果:
| 模态 | 最佳方法(mAP50) | mAP50 | mAP50-95 | 备注 |
|---|---|---|---|---|
| BLI | YOLOv9 | 0.688 | 0.558 | YOLOv8 precision 1.000 |
| FICE | YOLOv10 | 0.887 | 0.752 | YOLOv10 precision 1.000 recall 0.853 |
| LCI | YOLOv10 | 0.995 | 0.831 | YOLOv9 mAP50-95 0.878 最优;YOLOv9 recall 1.000 |
| NBI | YOLOv9 | 0.688 | 0.558 | 数值与 BLI 完全相同(见坑 4) |
| WLI | YOLOv6(正文)/ YOLOv5(表内) | 0.925 / 0.916 | 0.766 | 表 IV 无 YOLOv6 行(见坑 B) |
读检测结果的三个注意点:
- LCI 检测几近完美(mAP50 0.995)但样本仅 60 张——10% 测试集约 6 张,指标波动极大,不可外推。
- 表 IV 的 BLI 与 NBI 行数值逐格雷同(0.659/0.502/0.559/1.000/0.318 等六个数完全一致),几乎可断定是制表时的复制错误。NBI 检测结果不可引用(坑 4)。
- WLI 检测的"最佳方法"存在正文与表格冲突:正文 §III-C 称"YOLOv6 取得最高 mAP50 0.9250",但表 IV 列出了 5 个 YOLO 版本不含 v6,表内最高是 YOLOv5 的 0.916。这是坑 B 的延伸,引用时以表内可核验值为准。
5.2.1 完整检测结果表(5 YOLO × 各模态)
WLI(大样本,指标最可信):
| 方法 | mAP50 | mAP50-95 | mAP75 | Precision | Recall |
|---|---|---|---|---|---|
| YOLOv8 | 0.913 | 0.766 | 0.868 | 0.883 | 0.880 |
| YOLOv10 | 0.555 | 0.391 | 0.434 | 0.603 | 0.525 |
| YOLOv9 | 0.912 | 0.757 | 0.836 | 0.899 | 0.856 |
| YOLOv7 | 0.902 | 0.710 | 0.807 | 0.925 | 0.872 |
| YOLOv5 | 0.916 | 0.766 | 0.852 | 0.918 | 0.872 |
FICE(YOLOv10 领先):
| 方法 | mAP50 | mAP50-95 | mAP75 | Precision | Recall |
|---|---|---|---|---|---|
| YOLOv8 | 0.759 | 0.667 | 0.759 | 0.981 | 0.625 |
| YOLOv10 | 0.887 | 0.752 | 0.875 | 1.000 | 0.853 |
| YOLOv9 | 0.856 | 0.711 | 0.737 | 0.937 | 0.750 |
| YOLOv7 | 0.734 | 0.642 | 0.734 | 0.856 | 0.750 |
| YOLOv5 | 0.781 | 0.674 | 0.781 | 0.901 | 0.625 |
LCI(小样本,指标畸高,慎引):
| 方法 | mAP50 | mAP50-95 | mAP75 | Precision | Recall |
|---|---|---|---|---|---|
| YOLOv8 | 0.833 | 0.771 | 0.833 | 1.000 | 0.667 |
| YOLOv10 | 0.995 | 0.831 | 0.995 | 1.000 | 0.854 |
| YOLOv9 | 0.972 | 0.878 | 0.972 | 0.857 | 1.000 |
| YOLOv7 | 0.754 | 0.581 | 0.754 | 0.833 | 0.833 |
| YOLOv5 | 0.833 | 0.687 | 0.833 | 1.000 | 0.667 |
BLI(YOLOv9 领先;注:NBI 行数值与此表完全相同,见坑 4):
| 方法 | mAP50 | mAP50-95 | mAP75 | Precision | Recall |
|---|---|---|---|---|---|
| YOLOv8 | 0.659 | 0.502 | 0.559 | 1.000 | 0.318 |
| YOLOv10 | 0.534 | 0.416 | 0.485 | 0.840 | 0.500 |
| YOLOv9 | 0.688 | 0.558 | 0.638 | 0.846 | 0.500 |
| YOLOv7 | 0.398 | 0.321 | 0.362 | 0.818 | 0.409 |
| YOLOv5 | 0.618 | 0.499 | 0.534 | 0.899 | 0.404 |
检测结果的四个观察:
- 无单一版本横扫:WLI 是 YOLOv5/v8 领先,FICE/LCI 是 YOLOv10,BLI 是 YOLOv9——检测最优版本同样高度依赖模态。
- Recoil 普遍偏低:BLI 各方法 Recall 仅 0.318-0.500,说明模型在蓝光图像上"漏检"严重(论文原文指出低 Recall 反映"改善模型预测正例、减少漏检"的挑战)。
- Precision 虚高陷阱:BLI 上 YOLOv8 Precision=1.000 但 Recall 仅 0.318——只框最确信的少数息肉,漏掉大多数。这是"高精度低召回"的典型,不能单独看 Precision。
- YOLOv10 在 WLI 异常低(mAP50 0.555)与它在 FICE/LCI 领先形成反差——提示 YOLOv10 的端到端设计在本数据集的大样本 WLI 上未发挥优势,可能是训练配置或数据特性所致。
5.3 联邦学习基线(center-wise FedAvg)
这是 PolypDB 区别于普通息肉数据集的关键增量:论文用 FedAvg(Federated Averaging) 算法在三个中心上做联邦分割实验,模拟"数据不出院"的协作训练。注意:联邦实验只用 WLI 图像(三中心唯一共有的模态),且因 Center 1(136 张 NBI)与 Center 2(10 张 NBI)NBI 样本过少而将 NBI 排除。
平均结果与各中心结果(WLI,mIoU / mDSC):
| 范围 | 最佳方法 | mIoU | mDSC | 说明 |
|---|---|---|---|---|
| 平均(Average) | SSFormer-L(MiT-B4) | 0.9214 | 0.9550 | PVT-CASCADE 0.9105 / DuAT 0.9109 紧随 |
| BKAI(越南) | SSFormer-L | 0.9426 | 0.9696 | PVT-CASCADE recall 最高 0.9757 |
| Karolinska(瑞典) | DuAT(PVTv2-B2) | 0.9396 | 0.9683 | SSFormer-L 0.9186 次之 |
| Bærum(挪威) | SSFormer-L | 0.9123 | 0.9487 | PVT-CASCADE 与之接近 |
四个结论:
- 联邦学习显著优于单模态中心内训练:联邦平均 mIoU 0.9214 远高于 §5.1 中 WLI 单体训练的 0.8821(SSFormer-L)。这说明三中心数据聚合(即使不出院)对 WLI 分割有实质提升。
- SSFormer-L 在联邦场景同样最稳:四组结果中三组第一。
- 中心间差异存在但不大:BKAI 最佳(0.9426)> Karolinska(0.9396)> Bærum(0.9123),最大差距约 3 个点。Bærum 虽样本最多(WLI 2588)反而最低,暗示"数据量不是唯一决定因素,中心和设备的分布差异更关键"。
- 隐私价值:联邦实验证明"数据不离开医院也能训出接近集中式的模型",这对受 GDPR/HIPAA 约束的医疗机构是重要落地论据(论文 §IV-C 专节讨论)。
联邦方法数与宣称口径冲突:论文摘要/贡献点称联邦用"six federated learning approaches",但 Table V 实列 10 个模型(TransNetR、U-Net、U-NeXt、DeepLabV3+、PraNet、CaraNet、TGANet、PVT-CASCADE、DuAT、SSFormer-L)——口径不一(并入坑 B 的方法数问题)。
5.3.1 完整联邦结果表(Average + 三中心)
Average(三中心等权聚合):
| 方法 | 主干 | mIoU | mDSC | Recall | Precision | F2 |
|---|---|---|---|---|---|---|
| TransNetR | ResNet50 | 0.8771 | 0.9218 | 0.9289 | 0.9400 | 0.9236 |
| U-Net | — | 0.6362 | 0.7349 | 0.7929 | 0.7648 | 0.7562 |
| U-NeXt | — | 0.7049 | 0.7837 | 0.7977 | 0.8554 | 0.7853 |
| DeepLabV3+ | ResNet50 | 0.9022 | 0.9423 | 0.9426 | 0.9539 | 0.9408 |
| PraNet | Res2Net50 | 0.9048 | 0.9438 | 0.9390 | 0.9593 | 0.9397 |
| CaraNet | Res2Net101 | 0.8941 | 0.9362 | 0.9324 | 0.9528 | 0.9325 |
| TGANet | ResNet50 | 0.8837 | 0.9290 | 0.9445 | 0.9299 | 0.9345 |
| PVT-CASCADE | PVTv2-B2 | 0.9105 | 0.9477 | 0.9541 | 0.9492 | 0.9504 |
| DuAT | PVTv2-B2 | 0.9109 | 0.9478 | 0.9485 | 0.9550 | 0.9465 |
| SSFormer-L | MiT-B4 | 0.9214 | 0.9550 | 0.9503 | 0.9642 | 0.9517 |
Bærum(挪威中心):
| 方法 | mIoU | mDSC | Recall | Precision | F2 |
|---|---|---|---|---|---|
| U-Net | 0.5683 | 0.6798 | 0.7534 | 0.7074 | 0.7066 |
| U-NeXt | 0.6610 | 0.7465 | 0.7645 | 0.8342 | 0.7486 |
| DeepLabV3+ | 0.8876 | 0.9323 | 0.9326 | 0.9476 | 0.9302 |
| PraNet | 0.8934 | 0.9356 | 0.9282 | 0.9569 | 0.9296 |
| CaraNet | 0.8834 | 0.9289 | 0.9215 | 0.9499 | 0.9226 |
| TGANet | 0.8662 | 0.9161 | 0.9385 | 0.9153 | 0.9244 |
| PVT-CASCADE | 0.8990 | 0.9399 | 0.9452 | 0.9442 | 0.9417 |
| DuAT | 0.8985 | 0.9391 | 0.9399 | 0.9489 | 0.9372 |
| SSFormer-L | 0.9123 | 0.9487 | 0.9416 | 0.9614 | 0.9439 |
Karolinska(瑞典中心,样本最小):
| 方法 | mIoU | mDSC | Recall | Precision | F2 |
|---|---|---|---|---|---|
| U-Net | 0.6511 | 0.7287 | 0.6607 | 0.9820 | 0.6830 |
| U-NeXt | 0.6711 | 0.7414 | 0.7173 | 0.9449 | 0.7255 |
| DeepLabV3+ | 0.9159 | 0.9547 | 0.9225 | 0.9916 | 0.9349 |
| PraNet | 0.8968 | 0.9428 | 0.9087 | 0.9847 | 0.9216 |
| CaraNet | 0.8921 | 0.9406 | 0.9100 | 0.9802 | 0.9213 |
| TGANet | 0.8285 | 0.8959 | 0.9883 | 0.8340 | 0.9461 |
| PVT-CASCADE | 0.9006 | 0.9438 | 0.9148 | 0.9829 | 0.9255 |
| DuAT | 0.9396 | 0.9683 | 0.9510 | 0.9869 | 0.9578 |
| SSFormer-L | 0.9186 | 0.9555 | 0.9257 | 0.9915 | 0.9370 |
BKAI(越南中心):
| 方法 | mIoU | mDSC | Recall | Precision | F2 |
|---|---|---|---|---|---|
| U-Net | 0.8072 | 0.8714 | 0.8788 | 0.9193 | 0.8729 |
| U-NeXt | 0.8018 | 0.8661 | 0.8660 | 0.9087 | 0.8635 |
| DeepLabV3+ | 0.9358 | 0.9656 | 0.9663 | 0.9678 | 0.9656 |
| PraNet | 0.9331 | 0.9640 | 0.9669 | 0.9643 | 0.9654 |
| CaraNet | 0.9198 | 0.9537 | 0.9613 | 0.9563 | 0.9578 |
| TGANet | 0.9311 | 0.9629 | 0.9608 | 0.9684 | 0.9612 |
| PVT-CASCADE | 0.9369 | 0.9659 | 0.9757 | 0.9592 | 0.9713 |
| DuAT | 0.9397 | 0.9679 | 0.9714 | 0.9661 | 0.9698 |
| SSFormer-L | 0.9426 | 0.9696 | 0.9726 | 0.9685 | 0.9711 |
三个中心对比的读法:
- 同一模型在不同中心的排序会变:Average 与 BKAI/Bærum 上 SSFormer-L 第一,但 Karolinska 上 DuAT 第一(0.9396 vs SSFormer-L 0.9186)——说明"最优模型"是中心相关的。
- U-Net 在 Karolinska 上 Recall 崩到 0.6607:小样本下朴素 CNN 的泛化力最弱。
- 中心间差异约 3 个点:BKAI 最佳方法 0.9426 > Karolinska 0.9396 > Bærum 0.9123——Bærum 样本最多但指标最低,说明样本量不是唯一决定因素。
5.4 对抗鲁棒性(附加实验)
论文额外做了 FGSM(Fast Gradient Sign Method) 对抗攻击实验(Table VI),评估分割模型在输入被添加微小扰动时的鲁棒性——这对医学影像意义重大,因为分割/检测的细微失真可能直接导致误诊:
- 最脆弱:U-Net(WLI 受攻击后 mIoU 仅 0.0985,几乎完全失效)。
- 最鲁棒:PVT-CASCADE(WLI 0.6038、BLI 0.5153、FICE 0.4159、NBI 0.2560)与 SSFormer-L(WLI 0.5831、LCI 0.5476)。
- 结论:基于 transformer 主干(PVTv2/MiT)的模型不仅精度高,抗对抗扰动能力也更强——论文据此主张 PolypDB 不仅可用于精度基准,还可用于鲁棒性研究。
FGSM 攻击下各模型 mIoU(WLI 列,节选 Table VI):
| 方法 | 主干 | WLI mIoU(攻击后) | 相对干净时跌幅 |
|---|---|---|---|
| U-Net | — | 0.0985 | 从 0.7452 崩至近零(−0.65) |
| DeepLabV3+ | ResNet50 | 0.4930 | 从 0.8650 跌至 0.4930 |
| PraNet | Res2Net50 | 0.5732 | 从 0.8570 跌至 0.5732 |
| CaraNet | Res2Net101 | 0.5363 | 从 0.8582 跌至 0.5363 |
| TGANet | ResNet50 | 0.4413 | 从 0.8536 跌至 0.4413 |
| DuAT | PVTv2-B2 | 0.5476 | 从 0.8695 跌至 0.5476 |
| PVT-CASCADE | PVTv2-B2 | 0.6038 | 从 0.8731 跌至 0.6038(最鲁棒) |
| SSFormer-L | MiT-PLD-B4 | 0.5831 | 从 0.8821 跌至 0.5831 |
对抗实验的两点解读:
- 所有模型在 FGSM 下都显著退化:clean mIoU 0.85-0.88 的模型受攻击后普遍跌到 0.44-0.60,说明息肉分割模型对输入扰动缺乏鲁棒性——这在临床上是隐患(图像压缩、传输噪声都可能触发)。
- 主干选择决定鲁棒性:transformer 主干(PVTv2/MiT)普遍比 CNN 主干(ResNet/Res2Net)更抗扰动,尤其 U-Net 受攻击后几乎失效。这与"transformer 学到的特征更全局、更不易被局部扰动破坏"的直觉一致。
5.5 把三套基线放在一起读
分割、检测、联邦三套基线合起来,能给出一条"息肉 AI 部署路线图":
| 部署阶段 | 用哪套基线 | 关注指标 |
|---|---|---|
| 单院部署 | 分割(Table III)/ 检测(Table IV) | mIoU/mDSC、mAP50 |
| 多院协作(数据不出院) | 联邦(Table V) | 平均 + per-center mIoU |
| 安全敏感场景 | 对抗(Table VI) | FGSM 后 mIoU |
| 模态适配 | 分割逐模态 | 按模态选模型(无全能模型) |
一个关键的工程结论:PolypDB 的三套基线共同说明"息肉 AI 没有银弹"——没有全模态最优的分割器,没有全版本最优的检测器,没有全中心最优的联邦模型。选型必须落到具体场景(哪个中心、哪个模态、是否联邦、是否对抗敏感),这正是 PolypDB 作为"多维度评测台"的价值。
§6 获取与许可:公开直链的门
6.1 三件资产、三个入口
| 资产 | 入口 | 许可 | 门槛 |
|---|---|---|---|
| 数据集本体(3934 图+掩码+检测框) | OSF https://osf.io/pr7ms/ | 未明确(README 称 MIT 但无 LICENSE 文件;OSF license=None) | 无(公开直链) |
| 代码/划分/COCO 标签 | GitHub DebeshJha/PolypDB | README 称 MIT(无 LICENSE 文件) | 无 |
| 论文 | arXiv:2409.00045 | CC BY 4.0 | 无 |
6.2 可获取性的最大优点:零门槛
PolypDB 在库内息肉数据集里是可获取性最优的一档:OSF 公开直链,无需注册账号、无需提交申请、无需机构审批。这与库内其他模式的对比:
| 档位 | 库内参照 | 本条目对应 |
|---|---|---|
| 注册墙 | TCIA/IDC 型 | — |
| 请求制 | PANDA-PLUS 掩码(rid 560 系) | — |
| 平台托管 | Zenodo 型 | OSF 托管(本条目) |
| 公开直链 | HuggingFace/Zenodo 直链型 | PolypDB 本体(无门槛) |
对工程实践的含义:可以直接把 osf.io/pr7ms 接入数据管线,无需等待审批——这是它相比 PolypGen(部分子集需申请)、BKAI-IGH(部分版本有访问条件)的实操优势。
6.3 许可的灰色地带(重要风险提示)
PolypDB 的许可状况是本条目最需要警示的地方:
- 论文有明确许可:arXiv 页脚标注 CC BY 4.0——可自由分享、改编、商用(需署名)。
- 数据集许可未明确:GitHub README 末尾写 “This project is licensed under the MIT License - see the LICENSE file for details”,但仓库根目录并无 LICENSE 文件(文件列表只有 coco_labels/、dataset-split/、README.md 及图片)。OSF API 亦返回
license: None、node_license: None。 - 衍生模型许可属灰色地带:因数据集本体无明确再分发条款,“用 PolypDB 训练的模型权重能否商用”、"能否再分发图像子集"均无白纸黑字依据。
- 引用 DOI 坑:GitHub 引用块给出
doi = {10.1109/TMI.2024.1234567}——这是占位符(尾号 1234567),PolypDB 并未在该 DOI 发表。正确引用应使用 arXiv:2409.00045(或 arXiv DOI 10.48550/arXiv.2409.00045)。
实操建议:学术用途可直接下数据并引用 arXiv 论文;若计划商用或再分发,应主动联系通讯作者(Debesh Jha,debeshjha1@gmail.com)确认许可。切勿把 README 的"MIT"当作已生效许可——它缺少 LICENSE 文件载体。
6.4 AI-Ready 评估
以库内 AI-Ready 检查单过一遍:
- 机器可读元数据:论文开放获取(CC BY 4.0)+ GitHub README(含目录结构、引用格式)+ COCO 标签 JSON——良好。
- 公开直链:OSF 公开直链,无门槛——满分项,库内息肉数据集中的可获取性标杆。
- 许可明确性:失分项——数据集许可未声明(README 称 MIT 无 LICENSE 文件),再分发/商用边界模糊。
- 可复现性:提供数据集划分文件、COCO 标签、训练超参(epoch/lr/batch/损失函数全给出)——良好;但未提供官方训练代码仓库(仅划分与标签)。
- 文档自洽:多处数字冲突(模态合计 3904 vs 3934、检测方法 5 vs 6、注释团队 8 vs 10、表 IV BLI/NBI 行雷同)——失分项,自动化抓取需指定以 Table I–VI 为准。
- 结构与标注质量:双视图组织、像素级掩码、双专家交叉+独立全量终审——优秀。
综合:AI-Ready 等级"中高"——可获取性与标注质量是强项(公开直链 + 全量终审),许可明确性与文档自洽性是短板。对"能否立刻下载"这一最硬指标,PolypDB 表现优于库内多数请求制/注册制数据集。
6.5 合规使用指引:三种用途三套注意
按使用目的分,PolypDB 有三套不同的注意事项:
| 用途 | 可做 | 需注意 |
|---|---|---|
| 学术研究 | 下载、训练、发表 | 引用 arXiv:2409.00045(非占位 DOI);说明数据来源与模态 |
| 模型商用 | 训练商用模型 | 先确认许可——数据集许可未声明,联系通讯作者 |
| 数据再分发 | 转发子集 | 高风险——README 称 MIT 但无 LICENSE 文件,再分发前须获作者明确授权 |
关于"病人隐私"的合规边界:三中心已完成去标识化(GDPR 匿名、当地伦理审核),因此使用者无需再对图像做隐私处理——但需遵守各来源国法规(尤其欧盟 GDPR 背景的 Karolinska 图像)。研究者在美国场景下,PolypDB 属"去标识化的公开数据集",通常不构成人类受试者研究(non-human-subjects research),但仍建议所在机构 IRB 备案。
6.6 与 OSF 托管的可获取性优势
PolypDB 选择 OSF(Open Science Framework)作为托管平台,这一选择本身有可获取性意义:
- 无需账号即可下载:OSF 公开项目支持匿名下载,无注册墙。
- 版本可追溯:OSF 记录 date_created(2024-08-18)与 date_modified(2025-03-03),可追溯数据集版本。
- 稳定直链:
osf.io/pr7ms是持久标识,不像某些个人网盘链接会失效。 - 可与 GitHub 分工:数据放 OSF(大文件托管)、代码与标签放 GitHub(版本控制)——这是开源医学数据集的常见最佳实践。
对比库内其他托管模式:Zenodo(有 DOI、适合发布快照)、HuggingFace(适合 ML 数据集集成)、TCIA(医学影像专用、需注册)。OSF 的优势是"零门槛 + 持久链接",缺点是无强制 license 字段(本项目即填 None),这是许可模糊的技术根源之一。
§7 通用化与联邦学习:PolypDB 的真正增量
7.1 为什么"多中心多模态"是内镜 AI 的刚需
内镜 AI 面临的核心痛点不是"在单个数据集上刷不高分",而是"换个场景就失效"。造成失效的分布漂移(distribution shift)有三个来源:
- 设备漂移:Olympus / Fujinon / Pentax 的图像处理管道不同,同一息肉在 BLI 与 NBI 下的颜色/纹理差异巨大。
- 人群漂移:北欧人群与东南亚人群的肠道解剖、饮食习惯、息肉流行病学不同。
- 操作漂移:不同操作者的进镜手法、退镜速度、取景习惯影响帧的构图。
PolypDB 的设计直接对这些漂移做实验:模态视图测第 1 类漂移(同一中心、不同模态),中心视图 + 联邦实验测第 2、3 类漂移(不同中心、不同人群/设备)。这让它从"又一个大号息肉数据集"升级为"分布漂移实验台"。
7.2 联邦学习在结肠镜应用的隐私逻辑
论文 §IV-C 明确点出联邦学习的临床动机:数据隐私。结肠镜图像含可识别的患者信息,受 GDPR/HIPAA 等法规约束,医院往往不能把原始图像外传集中训练。FedAvg 让各中心在本地训练、只上传模型权重,使"多中心协作"与"数据不出院"兼容——PolypDB 的三中心联邦实验(§5.3)对此提供了实证:平均 mIoU 0.9214 证明联邦聚合可接近(甚至超越单中心)性能。
7.3 论文承认的局限与未来方向
论文在结论与讨论中坦承三处局限:
- 现有方法对边界与低对比息肉仍不足:模型在"难分割息肉"(与背景黏膜相似、有黏液伪装、小型/扁平病灶)上表现差,尤其是平坦型 SSL——论文原文指出这是右侧结肠镜后 CRC 的主因,也是未来研究重点。
- 样本量偏斜:Karolinska 仅 40 张、部分模态仅 60-70 张,限制了精细的 center-wise/模态-wise 统计。
- 未来方向 = 视频数据集:团队明确表示下一步要发布"comprehensive video dataset"——捕捉实时结肠镜中息肉检测与分割的动态时序信息(当前 PolypDB 是静态帧)。这指向与库内 LDPolypVideo(rid 163)类似的赛道。
7.4 与库内通用化数据集的思想共鸣
PolypDB 的"多中心+模态基准"思路与库内若干数据集同族:
- PolypGen(rid 183):同样以多中心泛化为卖点,PolypDB 在多模态维度上更全。
- REG²(rid 639)/ TopAneu(rid 632):多中心挑战赛型,同样以"跨中心泛化"为核心评测目标。
- PANDA-PLUS(rid 560):同样采用"旧数据重标注"策略(见 §4.4),但侧重标签质量审计而非多模态扩展。
一个共通的方法论趋势:数据集的价值正在从"规模"转向"结构化的多样性"——不是图像越多越好,而是要把设备、人群、模态、操作者等漂移源显式地组织进数据集设计里,让模型在训练阶段就"见过世面"。PolypDB 是这一趋势在内镜影像领域的代表案例。
7.5 联邦实验的实现细节与复现要点
论文给了联邦分割实验的完整超参,便于复现:
| 项 | 配置 |
|---|---|
| 聚合算法 | FedAvg(weights aggregated equally,等权聚合) |
| 优化器 | AdamW(weight decay 0.05,momentum 0.9) |
| batch size | 32 |
| epoch | 100 |
| 初始学习率 | 0.001 |
| 学习率调度 | cosine annealing,每 30 epoch 降为 1/10 |
| 归一化 | 按各中心自身图像的均值与标准差归一化 |
最后一条(按中心归一化)是联邦学习的关键工程技巧:不同中心的图像亮度/色彩分布不同,若用统一统计量归一化会引入偏差;按各中心自身统计量归一化可部分消除"设备指纹"造成的分布差异。这是复现联邦基线时最容易忽略、却最影响结果的一步。
联邦评测的读法:论文同时报告 average 与三个 per-center 结果(§5.3)。只看 average 会掩盖"某个中心表现异常"的信息——本研究中 Karolinska 上 DuAT 胜出(0.9396)而其他中心是 SSFormer-L 胜出,这种"最优模型随中心切换"的现象正是中心异质性的体现,也说明联邦场景下"一个模型通吃所有中心"未必成立。
7.6 与集中式训练的思想对照
PolypDB 的联邦实验提供了一个可对照的量:联邦平均(SSFormer-L 0.9214)vs 单中心 WLI 训练(SSFormer-L 0.8821),前者高出约 4 个点。这带来一个常被忽略的洞见:联邦学习不只是"隐私妥协方案",在多中心场景下它还可能是"性能增强方案"——因为各中心的图像互为对方的"域增强数据",聚合的权重隐式地学到了更广的分布。这与"集中式训练=性能上限、联邦=次优"的直觉相反。当然,前提是各中心数据量不至于过小(Karolinska 仅 40 张时其贡献有限)。
7.7 落地场景:谁会用 PolypDB 做什么
把使用场景具体化:
- 内镜设备厂商:用 PolypDB 训练跨品牌兼容的息肉分割模型——五模态覆盖 Fujinon/Olympus,正好对应"一套模型适配多设备"的需求。
- 医院 AI 团队:用联邦基线搭建"多院区协作、数据不出院"的分割系统——论文已给出 FedAvg 的可复现配置(§7.5)。
- 学术研究者:把 PolypDB 当"域泛化基准"——报告模型在五个模态/三个中心上的方差,量化泛化力。
- 数据工程团队:把 PolypDB 当"公开直链数据集样板"——学习其双视图组织与全量终审的质控设计。
§8 方法学启示:三条可迁移的经验
8.1 "旧数据重标注"是高性价比的数据扩容路径
PolypDB Center 1 的做法(从 HyperKvasir 99417 帧中打捞 3000 张未标注息肉候选,标注后采纳 2588 张)示范了一条可复制路径:公开数据集里大量"未标注"或"弱标注"的帧,是等待被赋予真值的沉睡资产。与之同构的是 PANDA-PLUS 对 PANDA 未标注/切片级标签的重标注。
对数据工程的可迁移要点:
- 先在一批公开数据里识别候选帧(可用弱模型或关键词检索),再用专家标注/复核把候选转成真值;
- 未被利用的类别(unlabelled class)往往被研究者忽视,是低成本扩充的富矿;
- 关键是标注规范与质量门——PolypDB 用纳入/排除标准 + 双专家交叉 + 独立终审保住了质量。
8.2 把"分布漂移"显式编进数据集结构
PolypDB 最值得借鉴的设计不是数据本身,而是组织方式:同一批图像,按模态切一份(测设备/染色漂移),按中心切一份(测人群/操作漂移),再配联邦实验(测隐私约束下的协作)。这把"泛化能力"从一个事后评测指标,变成了数据集自带的、可复现的实验维度。
对选型者的映射:如果你的项目关心"跨机构部署",优先选自带 center-wise / site-wise 切分的数据集;如果关心"多设备兼容",优先选自带模态/协议切分的数据集。PolypDB 同时满足两者。
8.3 联邦学习作为隐私合规下的协作范式
在数据不能集中的医疗场景,FedAvg 三中心实验提供了"既能协作又不出院"的实证。可迁移的经验:
- 联邦聚合的收益在中心间分布差异大时更明显(本研究中 Bærum 单体最低但聚合后反超);
- 联邦评测需按中心分别报告(average + per-center),只看平均会掩盖中心间差异;
- 隐私不是免费午餐——联邦的通信开销、中心异质性(non-IID 数据)是落地难点,PolypDB 用统一归一化(各中心按自身均值方差归一化)部分缓解。
8.4 给数据集设计者的六条清单
从 PolypDB 的实现里抽取一份"数据集设计 checklist":
- 双视图组织:按至少两个正交维度(此处是模态与中心)切分数据,让不同研究目标各取所需。
- 图像与掩码同名:简化配对加载逻辑,降低使用门槛。
- 提供划分文件:给出固定 train/val/test 划分(80/10/10),保证跨论文结果可比。
- 全量专家终审:质量控制覆盖 100% 样本,而非抽样——尤其在规模可控(数千张)时值得投入。
- 公开直链:优先选 OSF/Zenodo 等无需审批的托管,最大化可复现性。
- 许可白纸黑字:PolypDB 的反面教材——README 声称 MIT 却无 LICENSE 文件,应引以为戒,务必附实际 LICENSE。
8.5 给模型开发者的三条落地规则
- 报告多模态结果时按模态分别报告 + 注样本量:PolypDB 的 LCI(60 张)与 WLI(3558 张)不可等量齐观。
- 训练时做模态/中心重采样:原始分布高度偏斜(WLI 91%),直接采样会让少数模态欠拟合。
- 做跨中心评测时报告中心间方差:单看某个中心的漂亮指标会误导部署决策。
8.6 从 PolypDB 看"数据集论文"的三个层次
一篇好的数据集论文(data paper)通常有三层贡献,PolypDB 三层都占:
| 层次 | 内容 | PolypDB 对应 |
|---|---|---|
| 第一层:数据 | 提供以前没有的数据/标注 | 首个五模态息肉数据集(3934 图 + 掩码 + 检测框) |
| 第二层:基准 | 给出可对标的方法评测 | 分割 8 方法 + 检测 5 YOLO + 联邦 10 模型 |
| 第三层:洞见 | 提出可迁移的方法论/发现 | "多模态多中心可提升泛化"的实证 + 联邦优于单中心 |
多数数据论文只做第一层(发数据、无系统基准);较好的做到第二层(发数据+基准);优秀的做到第三层(用数据回答一个科学问题)。PolypDB 的第三层贡献是:它用三中心五模态的对照实验,量化了"多样性对泛化的增益"——这不仅是一个数据集的发布,更是对"什么让内镜 AI 更鲁棒"这一问题的回答。
对读者的启示:评估一个数据集的价值,除了看规模与获取门槛,还要看它是否提供了"可证伪的科学洞见"。PolypDB 的 FedAvg 实验(联邦平均 0.9214 > 单中心 0.8821)就是一个可被后续研究证实或证伪的实证命题。
§9 与库内条目的关系
9.1 家族图谱
- HyperKvasir(rid 693):最硬的直接上游。PolypDB Center 1 的 2588 WLI + 136 NBI 来自 HyperKvasir 未标注类——"旧数据新标签"血缘。
- BKAI-IGH NeoPolyp(rid 84):越南上游。PolypDB Center 3 的 1200 张图像含 BKAI 的 1000 WLI + 60 LCI + 70 FICE + 70 BLI;PolypDB 包含 BKAI 但非等同。
- Kvasir-SEG(rid 112):同作者(Jha)的息肉分割数据集,单模态 WLI;PolypDB 是其多模态多中心扩展,二者常做跨集泛化评测。
- PolypGen(rid 183):另一多中心息肉数据集,规模 1531 图 + 2000 帧;与 PolypDB 同为"多中心泛化"赛道,主要差异在模态覆盖与规模。
- LDPolypVideo(rid 163):息肉视频数据集,与 PolypDB(静态帧)互补;PolypDB 的未来方向(视频数据集)可能与其同域。
- Kvasir-Capsule(rid 123)/ Kvasir-Instrument(rid 213):Kvasir 家族成员,内镜邻域。
- CVC-ClinicDB(rid 133)/ CVC-ColonDB(rid 142)/ ETIS-Larib(rid 153):经典息肉分割数据集(Bernal 家族),论文 Table I 谱系对照。
- GastroVision(rid 203)/ EndoSLAM(rid 408)/ Endoscapes(rid 353)/ CholecSeg8k(rid 233)/ CholecT50(rid 223):GI 内镜与腹腔镜邻域数据集。
- NCT-CRC-HE-100K(rid 148):结直肠癌组织病理分类(同疾病、不同模态侧)。
- PANDA-PLUS(rid 560):跨模态的"旧数据重标注"方法论对照(见 §4.4)。
9.2 检索路径建议
- 检索词组合:“PolypDB”(精确短语)+ “colonoscopy” + “multi-center”;资源入口
osf.io/pr7ms与github.com/DebeshJha/PolypDB。 - 勿混淆:PolypDB ≠ PolypGen(rid 183)≠ LDPolypVideo(rid 163)≠ BKAI-IGH(rid 84);三者是不同数据集。
- 想直接下数据:OSF 公开直链(无需注册)→ 需注意许可未明确(坑 6)。
- 想引基线结果:引论文 Table III(分割)、Table IV(检测)、Table V(联邦),注意表 IV 的 BLI/NBI 行雷同(坑 4)。
- 想做通用化评测:用模态视图(测设备漂移)+ 中心视图(测人群漂移),参照 §5.3 联邦基线。
9.3 库内息肉/内镜数据集互链矩阵
为便于跨条目导航,给出 PolypDB 与库内相关条目的对照矩阵:
| 库内条目 | rid | 与 PolypDB 的关系 | 互链价值 |
|---|---|---|---|
| HyperKvasir | 693 | 直接上游(Center 1 图像来源) | 追溯 PolypDB 图像血缘 |
| BKAI-IGH NeoPolyp | 84 | 上游(Center 3 越南图像来源) | 越南部分重叠说明 |
| Kvasir-SEG | 112 | 同作者同域(单模态息肉分割) | 单模态 vs 多模态对照 |
| Kvasir-Capsule | 123 | 同家族(胶囊内镜) | 内镜模态扩展 |
| Kvasir-Instrument | 213 | 同家族(器械分割) | 器械干扰对照 |
| PolypGen | 183 | 同赛道(多中心息肉) | 多中心泛化对照 |
| LDPolypVideo | 163 | 互补(视频 vs 静态帧) | PolypDB 未来方向参照 |
| CVC-ClinicDB | 133 | 经典息肉分割 | 历史谱系 |
| CVC-ColonDB | 142 | 经典息肉分割 | 历史谱系 |
| ETIS-Larib | 153 | 经典息肉分割 | 历史谱系 |
| GastroVision | 203 | 内镜邻域 | 内镜数据生态 |
| EndoSLAM | 408 | 内镜邻域 | 内镜数据生态 |
| Endoscapes | 353 | 内镜/手术邻域 | 手术场景对照 |
| NCT-CRC-HE-100K | 148 | 同疾病(结直肠癌)病理侧 | 内镜 vs 病理 |
| PANDA-PLUS | 560 | 方法论对照(旧数据重标注) | 标注策略对照 |
互链建议:核心血缘互链 HyperKvasir(693)、BKAI-IGH(84);同赛道互链 PolypGen(183);互补互链 LDPolypVideo(163);方法论互链 PANDA-PLUS(560)。其余作为生态背景。
9.4 一个"息肉 AI 全链路"阅读路径
若读者想从业余到系统了解息肉 AI,可按以下顺序跨条目阅读:
- 入门:Kvasir-SEG(112)——认识息肉分割任务与基本格式。
- 进阶:PolypDB(本条目)——理解多模态、多中心、检测与联邦。
- 视频/时序:LDPolypVideo(163)——从静态帧进入实时检测。
- 泛化评测:PolypGen(183)——多中心泛化的另一视角。
- 病理侧:NCT-CRC-HE-100K(148)——从内镜走向组织病理。
- 方法论:PANDA-PLUS(560)——学习数据集的标注质控与标签审计。
这条路径把库内的息肉相关条目串成"任务→数据→泛化→病理→方法论"的完整学习地图。
§10 避坑清单:七个已踩过的坑
坑 1(A):模态计数与总数不符。论文 §III-A 明确列出 “3558 WLI + 146 NBI + 60 LCI + 70 BLI + 70 FICE”,合计 3904;但全文宣称总数 3934,差 30 张。论文未解释差额。引用时须注明用的是哪个数;若按总量写 3934,则模态明细合计为 3904 已是另一口径(可能涉及 Karolinska 30 张 WLI 的计入方式)。
坑 2(B):检测方法数与联邦方法数口径冲突。摘要与 GitHub 称 “six standard benchmark polyp detection methods”,正文贡献点却写 “five object detection methods”,Table IV 实列 5 个 YOLO(v5/v7/v8/v9/v10);正文 §III-C 文字又出现表中没有的 YOLOv6(WLI mAP50 0.925)。联邦方面摘要称 “six federated learning approaches”,Table V 实列 10 个模型。凡涉及"方法数"的引用都需核对到表。
坑 3(C):注释团队人数冲突。摘要写 “team of 10 gastroenterologists”(10 名胃肠病专家);正文 §II-D 写 “8 gastroenterologists + 1 senior researcher”(8 名专家 + 1 名资深研究者)。两个数不同,引用时注明出处。
坑 4(D):表 IV 的 BLI 与 NBI 行数值逐格雷同。两模态的 mAP50/mAP50-95/mAP75/Precision/Recall 六个数完全一致(0.659/0.502/0.559/1.000/0.318),几乎可断定是制表复制错误。NBI 检测结果不可独立引用;引用时应以 BLI 行对应 BLI、对 NBI 持保留态度。
坑 5(E):GitHub 中心目录名与论文不一致。GitHub README 中心视图写作 Simula / Karolinska / Vietnam(或 Simula/Karolinska/BKAI),而论文 center-wise 结果为 BKAI / Karolinska / Bærum。“Simula”(挪威 SimulaMet 研究机构)与 Bærum 医院非同一实体。检索文件树与对齐结果时以实际目录内容为准。
坑 6(F):数据集许可无核验载体。GitHub README 称 “MIT License - see the LICENSE file”,但仓库根目录无 LICENSE 文件;OSF 项目 license=None/node_license=None。唯一明确的许可是论文的 CC BY 4.0。数据集再分发/商用条款未明示,衍生模型许可属灰色地带,商用前须联系作者确认。
坑 7(G):GitHub 引用块的 DOI 是占位符。README 引用块写 doi = {10.1109/TMI.2024.1234567},尾号 1234567 是明显占位符,PolypDB 并未在该 DOI 发表(三轮搜索未见 PolypDB 正式期刊版)。引用应使用 arXiv:2409.00045。
坑 8(附):中心样本量极不均衡。Bærum 2724 张 ≈ 69%、越南 1200 张 ≈ 30%、Karolinska 仅 40 张 ≈ 1%。跨中心/联邦结论受此结构硬约束,勿把三中心当平衡样本;Karolinska 的 center-wise 结果基于约 30 张 WLI,置信区间宽。
10.1 七坑速查表
| 坑 | 一句话 | 影响 | 应对 |
|---|---|---|---|
| A | 模态合计 3904 ≠ 总数 3934 | 引用数字口径不一 | 分开报,注明差额 |
| B | 检测/联邦方法数 5 vs 6 vs 10 | 方法数引用错 | 以表格实际列数为准 |
| C | 注释团队 8 vs 10 人 | 团队规模引用错 | 注明出处(摘要/正文) |
| D | 表 IV 的 BLI/NBI 行雷同 | NBI 检测结果不可用 | 不引用 NBI 检测数 |
| E | GitHub 目录名 Simula/Vietnam ≠ 论文 BKAI/Bærum | 目录对齐出错 | 以实际目录内容为准 |
| F | 许可无 LICENSE 文件(README 称 MIT) | 商用/再分发风险 | 联系作者确认 |
| G | 引用 DOI 是占位符 1234567 | 引用无效 | 用 arXiv:2409.00045 |
| H | 中心样本极不均衡(1% vs 69%) | 跨中心结论不稳 | 报告样本量、慎推泛化 |
10.2 类比:PolypDB 的坑集中在"文档层"而非"数据层"
值得强调:PolypDB 的八个坑没有一个是数据本身的错误——它们全是论文/README 的文档表述不一致(数字口径、目录命名、许可声明、DOI 占位)。数据本体(3934 张图像 + 掩码 + 检测框)质量有全量专家终审背书,是可靠的。
这一区分的实践意义:
- 用数据:可放心——图像与标注质量有质控保障。
- 引论文数字:须谨慎——多处口径冲突,务必核对到表格。
- 引许可:须求助作者——README 声明无文件支撑。
换言之,PolypDB 是"好数据 + 尚需打磨的文档"的组合。这不影响它作为高质量训练/评测资产的价值,但要求引用者多一道核验手续。
§11 DAIMS 评估
以 Data and AI Maturity/Readiness Schema(DAIMS)六维给 PolypDB 打分(0-5,5 最优):
| 维度 | 评分 | 依据 |
|---|---|---|
| Data Availability(可获取性) | 5/5 | OSF 公开直链无门槛(osf.io/pr7ms),无需注册/申请;库内息肉数据集可获取性标杆 |
| Annotation Quality(标注质量) | 5/5 | 单人描边(含数位屏)+ ≥2 名高级胃肠病专家交叉复核 + 1 名独立专家全量终审 3934 张 |
| Integrity & Provenance(来源与完整性) | 4/5 | 三中心伦理流程完整(GDPR 匿名、知情同意)、上游血缘清晰(HyperKvasir/BKAI);但模态计数与总数差 30 张、表 IV 数值雷同扣分 |
| Metadata & Documentation(元数据) | 4/5 | README + 论文 + COCO 标签 + 划分文件齐全;但四处数字口径冲突、代码仓库未附官方训练脚本 |
| Structure & Interoperability(结构与互操作) | 5/5 | 模态视图/中心视图双组织、图像掩码同名、COCO 检测格式、80/10/10 划分——标准且开箱可用 |
| Licensing(许可清晰度) | 3/5 | 论文 CC BY 4.0 明确;数据集本身许可未声明(README 称 MIT 无 LICENSE 文件,OSF license=None),再分发/商用边界模糊 |
综合:AI-Ready 等级"中高"(26/30)——可获取性、标注质量、结构互操作三项满分,是本数据集的核心竞争力;短板集中在许可明确性与文档自洽性。对研究者而言,“能不能马上用”(能)与"能不能放心商用"(存疑)是两个必须分开判断的问题。
11.1 统计卫生:读 PolypDB 数字的六条守则
PolypDB 论文里数字口径冲突较多,为避免误引,给出六条守则:
- 总数与模态合计要分开报。全文总数是 3934,但 §III-A 的模态明细合计是 3904(差 30)。若你按模态做实验,报 3904;若引用数据集总量,报 3934 并注明与明细的差额。
- 小样本模态的指标加置信区间。LCI(60)、BLI/FICE(各 70)的 10% 测试集仅 6-7 张,mIoU 的点估计不可外推;报这些指标时应注明测试集大小。
- 检测结果警惕"表内复制错误"。表 IV 的 BLI 与 NBI 行逐格雷同,NBI 检测结果不可引用;引用 WLI 检测时以表内 YOLOv5/v8(0.916/0.913)为准,而非正文提到的 YOLOv6(0.925,表中无)。
- 分割选最优时按模态分别选。没有全模态最优方法:BLI 选 DuAT、NBI 选 PVT-CASCADE、FICE/LCI/WLI 选 SSFormer-L。
- 联邦结果看 average 也要看 per-center。Karolinska 上 DuAT 反超 SSFormer-L,"最优模型随中心切换"是重要信息,只报 average 会丢。
- 别把"六方法/six approaches"当精确计数。论文对检测方法数(5 vs 6)、联邦方法数(6 vs 表内 10)、注释团队人数(8 vs 10)口径不一——引用具体方法数时以表格实际列数为准。
11.2 复现清单(给想复现基线的人)
| 步骤 | 关键配置 | 来源 |
|---|---|---|
| 数据获取 | OSF osf.io/pr7ms 下载 | 论文/GitHub |
| 划分 | 80% 训练 / 10% 验证 / 10% 测试 | 论文 §III-A / GitHub dataset-split |
| 分割输入 | resize 512×512 | 论文 §III-A |
| 检测输入 | resize 640×480 | 论文 §III-A |
| 分割损失 | BCE + Dice | 论文 §III-A |
| 分割优化器 | Adam, lr 1e-4, 200 epoch, batch 12 | 论文 §III-A |
| 检测优化器 | AdamW, lr 1e-4, batch 16 | 论文 §III-A |
| 联邦聚合 | FedAvg, 等权, AdamW(wd=0.05), batch 32, 100 epoch | 论文 §III-A |
| 环境 | PyTorch 1.9, NVIDIA RTX 3090 | 论文 §III-A |
| 增强(分割) | 随机旋转/水平翻转/垂直翻转/course dropout | 论文 §III-A |
| 增强(检测) | 随机翻转/旋转/模糊/mixup/mosaic/cutmix | 论文 §III-A |
§12 总结
12.1 三句话总结
- PolypDB 是首个开源的五模态三中心结肠镜息肉数据集:3934 张图像带像素级分割掩码与检测框,覆盖 BLI/FICE/LCI/NBI/WLI,源自挪威/瑞典/越南三中心。
- 它的核心增量是"结构化的多样性":模态视图(测设备漂移)+ 中心视图(测人群漂移)+ 联邦学习实验(测隐私约束协作),把泛化能力编进数据集设计,而非事后评测。
- 它的最大优点是零门槛获取、最大风险是许可模糊:OSF 公开直链随取随用,但数据集许可未声明(README 称 MIT 无 LICENSE 文件),商用/再分发前必须联系作者。
12.2 适合谁
- 内镜 AI 分割/检测团队:需要多模态、多中心的息肉训练与评测数据。
- 通用化/域适应研究者:自带模态与中心双视图,是现成的分布漂移实验台。
- 联邦学习研究者:附三中心 FedAvg 基线与隐私合规论证。
- 关注 AI-Ready 数据工程的团队:公开直链 + 双专家复核 + 双视图组织是活的工程范例。
12.3 不适合谁
- 需要息肉病理分类/形态学标签的项目:PolypDB 只有区域掩码与检测框,无组织学分级、无 Paris 分型。
- 需要视频时序信息的项目:PolypDB 是静态帧,视频数据集是团队承诺的"未来方向"(当前需看 LDPolypVideo 等,rid 163)。
- 需要许可白纸黑字用于商用的项目:数据集许可未明确,须先与通讯作者确认。
- 需要机构平衡采样的跨中心研究:2724:1200:40 的中心偏斜是硬约束,Karolinska 子集过小。
12.4 一句话定位
PolypDB 是内镜影像领域"把多样性做成结构"的代表数据集——它不追求最大规模,而是用五模态、三中心、双视图、联邦实验,把"模型能不能跨设备跨人群工作"这个部署时的终极问题,提前搬进了训练与评测的桌面。
12.5 综合评分卡
| 评估维度 | 评分 | 理由 |
|---|---|---|
| 数据规模 | ★★★★☆ | 3934 图在纯息肉数据集中居前列(但低于已下架的 CVC-VideoClinicDB/ASU-Mayo) |
| 模态多样性 | ★★★★★ | 唯一开源五模态息肉数据集(BLI/FICE/LCI/NBI/WLI) |
| 中心多样性 | ★★★★☆ | 三中心跨国(挪威/瑞典/越南),但分布极不均(69%:30%:1%) |
| 标注质量 | ★★★★★ | 单人描边 + ≥2 专家交叉 + 独立全量终审 3934 张 |
| 任务完整性 | ★★★★★ | 分割 + 检测 + 联邦三套任务与基线 |
| 可获取性 | ★★★★★ | OSF 公开直链,零门槛下载 |
| 许可明确性 | ★★☆☆☆ | 数据集许可未声明(README 称 MIT 无 LICENSE 文件) |
| 文档自洽性 | ★★★☆☆ | 多处数字口径冲突(坑 A-G) |
| 工程友好度 | ★★★★☆ | 双视图 + 同名配对 + COCO 标签 + 官方划分;但无官方训练代码 |
综合:8.5/10——一个"数据与结构优秀、文档与许可待打磨"的高价值数据集。适合作为内镜 AI 多模态多中心研究的核心资产,但引用时需自行核对数字口径、商用前需确认许可。
12.6 如果你只想记住三件事
- 它是什么:首个开源的五模态(BLI/FICE/LCI/NBI/WLI)三中心(挪威/瑞典/越南)结肠镜息肉数据集,3934 张图像带像素级掩码与检测框。
- 它好在哪:OSF 公开直链零门槛,双视图(模态/中心)自带域泛化评测结构,分割/检测/联邦三套可对标基线。
- 它要小心什么:数据集许可未明确(README 称 MIT 无 LICENSE 文件);论文多处数字口径冲突(模态合计 3904 vs 总数 3934、表 IV 的 BLI/NBI 行雷同);引用用 arXiv:2409.00045 而非占位 DOI。
§13 附录
13.1 数据来源与引用速查
| 项目 | 值 |
|---|---|
| 数据集名 | PolypDB |
| 全称 | PolypDB: A Curated Multi-Center Dataset for Development of AI Algorithms in Colonoscopy |
| arXiv | 2409.00045(v1 2024-08-19 / v2 2025-01-03) |
| arXiv DOI | 10.48550/arXiv.2409.00045 |
| 论文 license | CC BY 4.0 |
| 数据下载 | https://osf.io/pr7ms/ |
| 代码/划分/COCO 标签 | https://github.com/DebeshJha/PolypDB |
| 数据量 | 3934 张息肉图像(模态明细合计 3904) |
| 模态 | BLI / FICE / LCI / NBI / WLI |
| 中心 | Bærum(挪威)/ Karolinska(瑞典)/ HMU+IGH(越南) |
| 通讯作者 | Debesh Jha(debeshjha1@gmail.com / debesh.jha@usd.edu) |
| 主导机构 | Northwestern University, Machine & Hybrid Intelligence Lab, Dept. of Radiology |
| 资助 | NIH R01-CA246704, R01-CA240639, U01-DK127384-02S1, U01-CA268808 |
| 引用规范 | 使用 arXiv:2409.00045;勿用 GitHub README 的占位 DOI 10.1109/TMI.2024.1234567 |
13.2 关键时间线
| 时间 | 事件 |
|---|---|
| 2024-08-18 | OSF 项目 pr7ms 创建(OSF API date_created) |
| 2024-08-19 | arXiv v1 提交(33,328 KB) |
| 2024-09-16 | GitHub README 更新 |
| 2024-10-09 | GitHub coco_labels 与 dataset-split 目录提交 |
| 2024-12-17 | GitHub 合并 detection labels 更新 PR(最后一次代码更新) |
| 2025-01-03 | arXiv v2 修订(47,679 KB,当前版本) |
| 2025-03-03 | OSF 项目最后修改(OSF API date_modified) |
| 2026-09-30 | 本条目抓取时点(未见正式期刊版) |
13.3 术语表(首现英文对照)
| 中文 | 英文(缩写) | 说明 |
|---|---|---|
| 结肠镜 | colonoscopy | 结直肠检查金标准,操作者依赖 |
| 息肉 | polyp | 结直肠黏膜隆起病变,CRC 主要癌前形态 |
| 结直肠癌 | Colorectal Cancer (CRC) | 全球第三大癌症发病、第二大癌症死因 |
| 腺瘤漏检率 | adenoma miss-rate | 文献报道 20%–24% |
| 结肠镜后结直肠癌 | post-colonoscopy CRC / interval cancer | 间隔期发现的癌 |
| 图像增强内镜 | Image-Enhanced Endoscopy (IEE) | BLI/FICE/LCI/NBI 等数字染色模式的统称 |
| 白光成像 | White Light Imaging (WLI) | 常规白光模式 |
| 窄带成像 | Narrow Band Imaging (NBI) | Olympus 系窄带光模式 |
| 蓝光成像 | Blue Light Imaging (BLI) | Fujinon 系蓝光模式 |
| 联动彩色成像 | Linked Color Imaging (LCI) | Fujinon 系色彩增强模式 |
| 柔性光谱成像色彩增强 | Flexible spectral Imaging Color Enhancement (FICE) | Fujinon 系光谱增强模式 |
| 波士顿肠道准备评分 | Boston Bowel Preparation Score (BBPS) | 肠道清洁度评分,≥2 纳入 |
| 分割 | segmentation | 像素级掩码任务 |
| 检测 | detection | 边界框任务 |
| 交并比 | Intersection over Union (IoU) | 分割指标,mIoU 为其均值 |
| Dice 相似系数 | Dice Similarity Coefficient (DSC) | 分割指标,mDSC 为其均值 |
| 平均精度 | mean Average Precision (mAP) | 检测指标 |
| 联邦学习 | Federated Learning (FL) | 数据不出院的协作训练 |
| 联邦平均 | Federated Averaging (FedAvg) | FL 聚合算法 |
| 无蒂锯齿状病变 | Sessile Serrated Lesion (SSL) | 难检测的平坦型息肉 |
| 分布漂移 | distribution shift | 训练与部署分布不一致 |
| 快速梯度符号法 | Fast Gradient Sign Method (FGSM) | 对抗攻击方法 |
| 通用数据保护条例 | General Data Protection Regulation (GDPR) | 欧盟隐私法规 |
13.4 一手来源 URL 清单
- 论文 arXiv 摘要页:https://arxiv.org/abs/2409.00045
- 论文 arXiv HTML 全文:https://arxiv.org/html/2409.00045v2
- 论文 arXiv PDF:https://arxiv.org/pdf/2409.00045
- 数据下载(OSF):https://osf.io/pr7ms/
- OSF API 元数据:https://api.osf.io/v2/nodes/pr7ms/
- 代码仓库:https://github.com/DebeshJha/PolypDB
- 通讯作者邮箱:debeshjha1@gmail.com / debesh.jha@usd.edu
13.5 三条检索建议(收尾)
- 搜"PolypDB"时加限定词:“PolypDB” + “multi-center” / “colonoscopy” / “osf.io/pr7ms”,避免与 PolypGen、LDPolypVideo 混淆。
- 要引用时用 arXiv 编号:arXiv:2409.00045,而非 GitHub 占位 DOI。
- 要下数据直奔 OSF:osf.io/pr7ms 公开直链,无需注册;但商用/再分发前先确认许可(见坑 6)。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- real-colon — 共享标签:医学影像 / 内窥镜影像 / 目标检测 / 结直肠癌 / 评测基准
- ldpolypvideo — 共享标签:医学影像 / 内窥镜影像 / 目标检测 / 结直肠癌
- bkai-igh-neopolyp — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 结直肠癌
- cvc-clinicdb — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 评测基准
- cvc-colondb — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 评测基准
- giana — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 结直肠癌
- prostate158 — 共享标签:医学影像 / 医学图像分割 / 目标检测 / 评测基准
- kvasir-seg — 共享标签:内窥镜影像 / 医学图像分割 / 结直肠癌
- sun-database — 共享标签:医学影像 / 内窥镜影像 / 目标检测 / 结直肠癌
- heico — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 结直肠癌
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

