GIANA 胃肠道图像分析挑战数据集 — AI-Ready Wikipedia

MICCAI EndoVis 子挑战系列:结肠镜息肉检测/分割与小肠胶囊内镜血管扩张识别(ISBI 2015 至 MICCAI 2021 赛季沿革与六赛道全景)

来源 GIANA — Gastrointestinal Image ANAlysis Challenge(giana.grand-challenge.org) url: https://giana.grand-challenge.org/发布时间: 2026-09-27最后更新: 2026-09-27 阅读 19
GIANA 胃肠道图像分析挑战数据集 — AI-Ready Wikipedia

信息速览

数据集名称GIANA 胃肠道图像分析挑战数据集 — AI-Ready Wikipedia
数据类型grand-challenge.org,MICCAI-EndoVis,注册墙获取,结肠镜视频,胶囊内镜,息肉分割,血管扩张检测,多任务挑战
规模未按患者口径统计:数据以视频帧/静态图像级发放,2018 版六赛道合计逾 8,000 帧/张(视频 18+ 条、SD 分割 912 张、HD 分割 >150 张、WCE 检测/定位各 1,200 张、
接入方式GIANA — Gastrointestinal Image ANAlysis Challenge(giana.grand-challenge.org) url: https://giana.grand-challenge.org/
AI 就绪度

GIANA:胃肠道图像分析挑战数据集(2015–2021 赛季全景)

INFOBOX:一屏速览

维度 内容
名称 GIANA — Gastrointestinal Image ANAlysis Challenge(胃肠道图像分析挑战)
定位 MICCAI EndoVis Workshop 子挑战系列,胃肠道内窥镜图像算法竞赛及其随附数据
主办四方 CVC-UAB(巴塞罗那计算机视觉中心)、ETIS-ENSEA(法国 Cergy)、Hospital Clinic de Barcelona、Hôpital Saint-Antoine AP-HP(巴黎)
版本沿革 ISBI 2015 → MICCAI 2015 → MICCAI 2017(首冠 GIANA 名)→ MICCAI 2018 EndoVis(并轨 CAD-CAP)→ MICCAI 2021(新增息肉分类)→ 2024 AI4PolypNet
2018 版六赛道 视频息肉检测、视频息肉定位、息肉分割 SD、息肉分割 HD、WCE 血管扩张检测、WCE 血管扩张定位
核心规模 SD 分割 300/612(574×500 px);HD 分割 >150 张(1920×1080 px);WCE 检测 600/600;WCE 定位 600/600;CAD-CAP >3,500 张
标注形态 像素级分割掩码、视频/帧级病灶标记、图像级三类标签
评价指标 分割:Dice、PPV、敏感性、Hausdorff 距离;分类:AUC
获取方式 官网注册 + 接受挑战规则后发放下载链接(注册墙,无公开直链)
license 明文条款在注册墙后;公开页仅见研究用途(for research purposes)表述
官方推荐读法 Journal of Imaging 2020;6(7):69, doi:10.3390/jimaging6070069(2017 冠军与 2018 SD 分割亚军方案复盘)
生态位 与 Kvasir-SEG、CVC-ClinicDB、ETIS-Larib 并列的息肉分割标准评测集之一;CVC 系标注谱系源头赛事

§0 导读:为什么 GIANA 值得一篇数据集条目

在胃肠道内窥镜影像这个领域,数据集的名字往往比赛事本身更长寿:Kvasir-SEG、CVC-ClinicDB、ETIS-Larib 这些今天论文里高频出现的评测集,追根溯源都能指向同一批组织者和同一条赛事脉络——而 GIANA 正是这条脉络上以赛事形态存在的主干。它不是某一次比赛的孤立快照,而是从 ISBI 2015 一路延展到 MICCAI 2021、并在 2024 年以 AI4PolypNet 形态再启动的系列挑战:结肠镜息肉检测与分割是一条主线,小肠胶囊内镜血管扩张(angiodysplasia)识别是另一条主线,两条主线在 2018 年版正式合流为六赛道并行的年度赛事。

GIANA 的价值可以从三个层面理解。第一是任务定义层面:它把「息肉检测(视频级)—息肉定位(帧级)—息肉分割(像素级)」这条由粗到细的任务链,以及胶囊内镜下「血管扩张检测—定位—图像分类」的平行链,纳入了同一套评测框架,这在 2017–2018 年的医学影像挑战中并不多见。第二是数据层面:2018 版六赛道合计逾 8,000 帧/张,覆盖常规清晰度(SD, 574×500)与高清(HD, 1920×1080)两种结肠镜采集条件,以及小肠胶囊内镜这一特殊成像模态——同一赛事同时覆盖两种内镜模态,是它区别于 Kvasir 系数据集的显著特征。第三是方法学层面:GIANA 的官方组织者明确把「组织化竞赛作为对比最新水平的框架」作为方法论主张(见 Journal of Imaging 2020 复盘论文),这使得它留下的不只是数据,还有一整套关于评测设计、指标选择与结果解读的公共讨论。

对研究者而言,本条目希望回答三类实际问题:它是什么、有什么(版本沿革与六赛道规模);怎么用(获取方式、license 边界、指标口径、与库内其他息肉数据集的配对姿势);别踩什么坑(版本规模混算、正名混淆、注册墙后的条款盲区、测试标签公开性存疑等)。所有硬数字均以官网与 ITU-T FG-AI4H DEL10.20 文档等一手来源为准,凡存在口径分歧处(如 2017 版 1,812 张与 2018 版六赛道规模、现场颁奖日期)均随文标注双口径,不做静默取舍。

导语读法三则:

  • 其一,先读 §1 的十问十答建立整体认知,特别注意第一问里的正名存照——GIANA 是胃肠道(Gastrointestinal)挑战,与「指甲分析(GIAnt Nail Analysis)」毫无关系,这个名字的相似性曾在任务描述环节造成过真实的误解,值得单独立牌。
  • 其二,涉及数字时先确认版本语境:1,812 张是 2017 版胶囊内镜单任务口径,600/600 与 >3,500 张是 2018 版六赛道口径,两者任务定义不同、不可混算;跨版本引用数字而不注明版本,是引用 GIANA 最常见的技术错误。
  • 其三,动手下载前先读 §6:GIANA 全部数据位于注册墙之后,需要注册官网账号并接受挑战规则才能拿到下载链接;本文档不提供任何绕过注册墙的镜像指引,也不转述未实抓确认的 license 明文。

§1 十问十答:GIANA 核心事实速查

问 1:GIANA 到底是什么?

GIANA 的全称是 Gastrointestinal Image ANAlysis Challenge(胃肠道图像分析挑战),是挂在 MICCAI EndoVis Workshop 旗下的子挑战系列,由西班牙 CVC-UAB、法国 ETIS-ENSEA、西班牙 Hospital Clinic de Barcelona 与法国巴黎 Saint-Antoine 医院(AP-HP)四方联合主办,官网托管于 Grand-Challenge 平台(giana.grand-challenge.org)。它的名字取自 Gastrointestinal Image ANAlysis 的首字母拼合,本质是一个以年度赛事为载体、随届次滚动扩充数据与任务的挑战系列,而不是单一版本的数据集。

正名存照:GIANA 与「GIAnt Nail Analysis」(甲分析/甲银屑病评估)无关。「GIANA」与「GIAnt」三个字母之差,加上两者都出现在医学影像挑战语境里,构成一个真实发生过且极易复发的混淆点。本条目写作过程中已按三重来源核验:ITU-T FG-AI4H 的 DEL10.20 官方文档、CVC 官方新闻页、以及 GIANA 官网实抓内容,三源一致指向 GIANA 是胃肠道(息肉分割/检测 + 胶囊内镜血管扩张)挑战。凡看到把 GIANA 描述为指甲分割或甲银屑病数据集的资料,可以直接判为错误并溯源纠正。

问 2:2018 版数据集里具体有什么?

以内容最完整的 2018 版(MICCAI EndoVis,与 CAD-CAP 并轨)为基准,六赛道数据构成如下:

赛道 任务 训练数据 测试数据 关键规格
视频息肉检测 视频中逐帧检出息肉 18 条短视频 >20 条测试视频 结肠镜视频序列
视频息肉定位 帧内息肉空间定位 同上视频源 同上 帧级位置标记
息肉分割 SD 静态图像素级分割 300 张 612 张 574×500 px
息肉分割 HD 静态图像素级分割 >150 张 — 1920×1080 px
WCE 血管扩张检测 胶囊内镜图像二分类判定 600 张 600 张 图像级标签
WCE 血管扩张定位 血管扩张病灶空间定位 600 张 600 张 定位标记

此外,2018 年新建并轨的 CAD-CAP 子数据集提供 >3,500 张小肠胶囊图像,按正常/炎症/血管病变三类组织,供血管扩张相关算法做更大规模的训练与预训练。

需要提醒的是,表格中「>20」「>150」「>3,500」这类开放上限数字来自官方文档的原始表述,官方未给出精确总数;凡在二手资料里看到这四个位置的精确数字,都应要求其给出比官方文档更细的出处。

问 3:它与 Kvasir-SEG、CVC-ClinicDB、ETIS-Larib 是什么关系?

三条关系线。第一,同源谱系:GIANA 的息肉检测/分割赛道数据由 CVC-UAB 与合作医院团队标注,与 CVC-ClinicDB、CVC-ColonDB 出自同一标注传统与机构网络,可视为 CVC 系息肉数据的「赛事发动机」——赛事按年发放新数据,数据集论文按批固化成果。第二,评测集并列关系:在息肉分割这个子任务上,GIANA SD 分割集与 Kvasir-SEG、CVC-ClinicDB、ETIS-Larib 并列为论文中最常被同表比较的四大标准评测集;其中 ETIS-Larib 由 Saint-Antoine 方出品,与 GIANA 主办方之一同源。第三,互补关系:Kvasir 系(Kvasir-SEG、HyperKvasir 等)以大样本量与分类层级见长,GIANA 以视频序列、HD 分辨率与胶囊内镜模态见长,两者在「息肉分割四件套」之外并不互相替代。

对做基准评测的读者,实操建议是:以 CVC-ClinicDB + Kvasir-SEG 做主训练/验证,GIANA SD 与 ETIS-Larib 做分布外测试集——这恰好是近年息肉分割论文的主流配置,而 GIANA 在其中扮演的角色往往是「最难的那一栏」。

问 4:标注是怎么做的,质量如何?

按赛道分三种形态:分割赛道提供像素级掩码;检测/定位赛道提供视频级或帧级病灶标记;CAD-CAP 与血管扩张检测提供图像级三类标签(正常/炎症/血管病变)。标注由参与机构的内镜医师团队完成(CVC + Hospital Clinic de Barcelona + Saint-Antoine),这是 GIANA 数据临床可信度的来源。

同时必须坦率记录:官方论文与官网未公开完整标注协议——医师分工方式、标注工具、多人标注一致性检验流程等细节没有系统披露。这与部分后来者(如 HyperKvasir 论文中详述的标注流水线)形成对比。使用者应把 GIANA 的标注质量理解为「机构信誉背书型」而非「协议透明型」:来源可信,但细粒度质控证据需自行向组织者索取。

问 5:数据怎么获取?

注册墙模式:在 giana.grand-challenge.org 注册账号、接受挑战规则(challenge rules)后,官网发放下载链接;数据无公开直链,也没有官方 Hugging Face 镜像(在 hf-mirror.com 检索无 GIANA 官方账号,第三方搬运的完整性与版本对齐情况存疑)。本文档不提供任何第三方镜像指引——对于版本口径本身就容易混淆的 GIANA,非官方渠道的数据包带来的版本错配风险远大于下载便利。

问 6:license 是什么?能商用吗?

这是 GIANA 文档链条上必须诚实标注盲区的一环:license 明文条款位于注册墙之后,公开渠道无法直接实抓;官网公开页面可见的表述仅为「研究用途(for research purposes)」一类的定性措辞。据此可以给出的负责任结论是:按研究用途使用是官方公开口径下的默认预期;商用与再分发问题在注册并查阅完整条款前,不应做任何乐观假设。本条目不转述未实抓的条款文本,也不对「能否商用」给出替代性判断——这是对读者的保护,也是对本条目自身可核查性的保护。

问 7:2018 年的比赛谁赢了?

2018 版赛事由法国消化内镜学会(SFED)赞助共 12 个奖项、总额 2,000 欧元,CVC 官方新闻页存照的冠军名单如下:

团队 成员 夺冠赛道
KM Satoshi Kondo 视频息肉检测 + WCE 血管扩张检测 + WCE 血管扩张定位(三冠)
ODS AI Iglovikov + Dobreenkii 视频息肉定位
Penguin AI Chen + Zheng + Li + Yao + Huang 息肉分割 SD
OUS Qadir + Shin + Balasingham 息肉分割 HD
FanVoyage — 特别奖(special award)

两个值得注意的观察:其一,Satoshi Kondo(KM 团队)一人包揽视频检测与两个胶囊内镜赛道共三冠,说明这两个赛道的获胜方案在方法栈上可能高度复用;其二,ODS AI 的第一作者 Iglovikov 此前因 Tesseract OCR 与多个 Kaggle 赛事冠军为深度学习社区熟知,其参赛反映了通用计算机视觉社区对医学挑战赛的人才溢出。

问 8:官方用什么指标评测?

分割赛道采用**Dice、PPV、敏感性(sensitivity)、Hausdorff 距离(HD)**的组合——Dice 衡量重叠度,PPV 控制假阳性,敏感性控制假阴性,HD 惩罚边界离散误差,四者共同构成对分割边界的多维约束。分类类赛道(血管扩张检测及后续分类)采用 AUC。这套指标组合与当年 EndoVis 系列挑战的惯例一致,也与今天息肉分割论文通行的报告口径基本兼容。

一个需要留意的方法学细节:GIANA 官方不维护常驻 leaderboard——每届挑战在届内评测、现场颁奖后即停止更新,不同届次的成绩因测试集与任务定义不同而不可直接比较。若论文需要引用 GIANA 上的对比基线,官方推荐的姿势是引用 Journal of Imaging 2020 复盘论文(doi:10.3390/jimaging6070069),其中系统复盘了 2017 冠军与 2018 SD 分割亚军的方法与成绩。

问 9:GIANA 有过几个版本?

GIANA 是滚动演进的系列赛事,版本链如下:ISBI 2015(早期形态)→ MICCAI 2015(息肉检测前身赛事)→ MICCAI 2017(首次启用 GIANA 名称,胶囊内镜任务以 1,812 张三分类数据为主)→ MICCAI 2018 EndoVis(六赛道成型,CAD-CAP 新建并轨)→ MICCAI 2021(新增息肉分类赛道:腺瘤性 vs 非腺瘤性,1,000 训练/200 测试)→ 2024 AI4PolypNet(以 pages.cvc.uab.es/ai4polypnet/ 为新入口的再启动形态)。

对数据使用者的实际含义是:引用「GIANA 数据集」时必须同时引用届次。2017 版的 1,812 张(906/454/452 划分)与 2018 版的六赛道规模是两套任务定义、两套数据组织,混用会造成文献中流传的规模数字互相打架——这正是 §10 坑点清单里列为第一梯队的问题。

问 10:今天拿 GIANA 做研究,最有价值的姿势是什么?

三种经过验证的用法。第一,息肉分割鲁棒性基准:GIANA SD/HD 两档分辨率天然构成采集条件对照组,适合做「训练于高清、测试于标清」之类的跨条件泛化实验;第三方工作 arXiv:2011.07631(期刊版见 Medical Image Analysis 2024)进一步构造了含 15 种损坏类型的 Giana-C 变体(2,260 张),把 GIANA 变成了算法鲁棒性基准。第二,胶囊内镜算法开发的现实尺度数据源:CAD-CAP 的 >3,500 张三分类数据是小肠血管扩张检测方向少有的赛事级公开数据,适合做检测模型的训练与消融。第三,跨模态方法论研究:同一系列内同时存在结肠镜视频与胶囊内镜静态图,适合做病灶形态学在两种成像条件下的迁移与可比性研究。

§2 数据构成与版本沿革:从 1,812 张到六赛道

§2.1 版本链总览:一个挑战系列的八个年头

理解 GIANA 的数据,必须先接受一个前提:它不是一个静态数据集,而是一条赛事驱动的数据流水线。每一届挑战都会注入新数据、新任务,有时还会重构任务定义。这条流水线的关键节点如下:

| 年份 | 挂靠会议 | 关键变化 | 数据主体 |

| — | — | — | — |
| 2015 | ISBI | 系列早期形态启动 | 息肉相关小规模数据 |
| 2015 | MICCAI | 息肉检测前身赛事 | 息肉检测数据 |
| 2017 | MICCAI | 首次启用 GIANA 名称 | 胶囊内镜 1,812 张三分类 |
| 2018 | MICCAI EndoVis | 六赛道成型,CAD-CAP 新建并轨 | 六赛道 + CAD-CAP >3,500 张 |
| 2021 | MICCAI | 新增息肉分类赛道 | 分类 1,000/200 + 前版遗产 |
| 2024 | (独立站点) | AI4PolypNet 再启动 | 新入口新任务组织 |

版本链来源:GIANA 官网历史页与 ITU-T FG-AI4H DEL10.20 文档交叉确认。

表中 2015 年两个节点的关系值得说明:ISBI 2015 与 MICCAI 2015 属于同一系列在两个会议上的早期实践,它们构成了 GIANA 拿到正式命名前的「史前史」;对数据引用而言,除非研究 2015 年赛事本身,一般无需触达这两个版本的数据包。

§2.2 2018 版六赛道逐赛道细读

2018 版是 GIANA 内容最完整、被引用最多的一版,也是本条目默认的「主体版本」。六个赛道按两条任务链组织。

主线一:结肠镜息肉(四赛道)。视频息肉检测赛道发放 18 条训练短视频,测试集含超过 20 条视频;任务是在视频流中逐帧判定息肉存在与否——这本质上考察算法在镜头运动、气泡、反光、肠道蠕动等视频特有干扰下的稳定性。视频息肉定位赛道使用同源视频,把任务从「有没有」推进到「在哪里」,要求帧内的空间位置输出。息肉分割 SD(standard definition,标清)赛道是六赛道中被下游引用最多的一个:300 张训练、612 张测试,分辨率 574×500,提供像素级掩码;它与 CVC-ClinicDB、Kvasir-SEG、ETIS-Larib 并列进入论文比较表的「四大件」。息肉分割 HD(high definition,高清)赛道训练集超过 150 张、分辨率 1920×1080——HD 赛道的意义在于引入了真实临床中已占主流的高清内镜采集条件,其测试协议与 SD 赛道独立,成绩不可跨赛道比较。

主线二:胶囊内镜血管扩张(两赛道 + CAD-CAP)。血管扩张(angiodysplasia)是小肠出血的重要病因,在胶囊内镜图像上呈现为红色扁平病变,是胶囊内镜阅片中最典型的漏诊/误诊来源之一。WCE(wireless capsule endoscopy,无线胶囊内镜)血管扩张检测赛道提供 600 张训练、600 张测试的图像级二分类判定任务;血管扩张定位赛道规模相同(600/600),但要求输出病灶空间位置。两赛道背后,2018 年新建并轨的 CAD-CAP(computer-aided detection for capsule endoscopy platform 语境下的子数据集)提供超过 3,500 张小肠胶囊图像,按正常、炎症、血管病变三类组织,为参赛者提供更大规模的训练资源——它的定位更接近「赛外训练库」,而前两个 600 张赛道是「赛内评测集」。

关于「>」数字的特别说明。「>20 条测试视频」「>150 张 HD」「>3,500 张 CAD-CAP」三个开放上限数字直接转录自官方文档;官方未公布精确总数,任何精确化转述都需要独立证据。这与 GIANA 文档链条上「测试集细节在届内保密」的赛事惯例一致。

§2.3 2017 版与规模双口径:1,812 张 vs 六赛道

引用 GIANA 规模时最容易出错的,是把 2017 版数字与 2018 版数字混在一个叙述里。两版的事实如下:

  • 2017 版(MICCAI 2017,首冠 GIANA 名):数据主体为 1,812 张小肠胶囊图像,覆盖正常、炎症、血管扩张三类;划分方式为 906 张训练、454 张验证、452 张测试。这一口径的权威出处之一是 arXiv:2011.07631(期刊版 Medical Image Analysis 2024),该文在构造 Giana-C 鲁棒性基准时明确按 1,812 张原图口径展开。
  • 2018 版:任务从单一三分类重构为六赛道多任务(见 §2.2),数据规模以赛道为单位陈述(18+/>20 条视频、300/612 张 SD、>150 张 HD、600/600 检测、600/600 定位),另加 CAD-CAP >3,500 张训练库。

两版的差异不是简单的「数据变多」:任务定义(三分类 → 检测/定位/分割多任务)、数据组织(单一图像池 → 按赛道分发)、成像模态重心(胶囊内镜为主 → 结肠镜视频与胶囊内镜并重)都变了。因此本条目采取分版本陈述、不混算的纪律:凡引用 1,812/906/454/452,即标注 2017 版;凡引用六赛道数字,即标注 2018 版。

一个实用的文献核查技巧:若某论文声称「GIANA 数据集共 1,812 张图像」并同时讨论息肉分割任务,几乎可以断定它把 2017 版胶囊内镜数字与 2018 版分割任务嫁接了——这是引用链条上真实存在的高频错误。

§2.4 2021 扩充与 2024 再启动

MICCAI 2021 版在系列中引入了一个新的任务维度:息肉分类,要求区分腺瘤性(adenomatous)与非腺瘤性(non-adenomatous)息肉——这把任务从「检出/勾画病灶」推进到「判断病灶性质」,与临床上的处理决策(是否内镜下切除、是否追加监测)直接相关。该赛道规模为 1,000 张训练、200 张测试。

2024 年,系列以 AI4PolypNet 的名字在新站点(pages.cvc.uab.es/ai4polypnet/)再启动。对数据获取者的实际影响是:老版本数据仍经 giana.grand-challenge.org 的注册墙发放,而新版本走新入口;两条渠道的账号与规则互不继承,引用与下载时应按研究需要选择对应届次。

§2.5 成像条件与模态特征

把 2018 版六赛道按成像条件归并,可以得到 GIANA 数据的一个「模态矩阵」:结肠镜视频(检测/定位两赛道,帧率与运动模糊为固有特征)、结肠镜静态图 SD 档(574×500,接近上一代内镜采集设备输出)、结肠镜静态图 HD 档(1920×1080,当代主流设备输出)、胶囊内镜静态图(低照度、单色偏色、视野随机是小肠胶囊成像的典型约束)。四个成像象限在同一系列内齐备,这是 GIANA 区别于 Kvasir 系(以静态结肠镜图为主)与纯胶囊内镜数据集的独有结构,也直接决定了它的方法学适用面(见 §8)。

§3 标注体系与临床来源

§3.1 三种标注形态

GIANA 的标注按任务链分为三级形态,理解这个分层对正确使用数据至关重要:

  • 像素级掩码(分割赛道):息肉边界逐像素勾画,输出为与原图同尺寸的二值掩码。SD 赛道 300 张训练 + 612 张测试均带掩码;HD 赛道同理。这是下游分割基准引用的标注形态。
  • 视频级/帧级标记(检测与定位赛道):视频检测赛道按帧序列给出息肉存在标记;定位赛道进一步给出帧内空间位置。这类标注不支持像素级边界评估,仅支持检测/定位指标。
  • 图像级类别标签(WCE 检测与 CAD-CAP):血管扩张二分类判定用「有/无」标签;CAD-CAP 用正常/炎症/血管病变三类标签。2021 版息肉分类赛道则用腺瘤性/非腺瘤性二类标签。

三级形态的指标口径不同(详见 §5),把它们混在一张比较表里是方法学错误——例如用像素级 Dice 去衡量一个只在图像级标签上训练的模型,既无意义也不公平。

§3.2 标注的临床来源:四方机构的分工

GIANA 的标注工作由主办四方中的临床机构承担:Hospital Clinic de Barcelona(西班牙)与 Hôpital Saint-Antoine AP-HP(法国巴黎)提供病例来源与内镜医师标注力量,CVC-UAB(西班牙巴塞罗那计算机视觉中心)承担数据处理与赛事工程,ETIS-ENSEA(法国 Cergy)参与组织与 CAD-CAP/WCE 方向。人物层面,CVC 的 Jorge Bernal 是息肉检测/分割赛道的核心组织者——他同时也是 CVC-ClinicDB、CVC-ColonDB 等数据集论文的常驻作者;ETIS-ENSEA 的 Aymeric Histace 负责胶囊内镜方向。这条人事线清晰地解释了 GIANA 数据与 CVC 系数据集的标注同源性(见 §3.4)。

从临床数据治理的角度看,「医院医师标注 + 视觉计算实验室工程化」的双主体模式,使 GIANA 的标注可信度建立在机构与执业医师的专业信誉之上;但其代价是标注流程的透明度有限——这正是 §3.3 讨论的问题。

§3.3 标注协议的透明度边界

必须如实记录:官方论文与官网未系统披露完整标注协议。具体而言,以下问题在公开渠道没有答案:每张图像由几位医师标注、是否采用双人独立标注加仲裁、标注一致性(如 Cohen’s kappa 或 Dice 互标)是否统计并公布、标注软件是什么、疑难病例的判定流程如何。这些细节在 HyperKvasir、PolypGen 等后来者的论文中有程度不等的披露,而 GIANA 的公开材料停留在「由参与机构内镜医师团队完成」的层面。

对使用者的实操含义有三:其一,引用 GIANA 标注质量时,应引用机构来源与赛事验证(挑战成绩由官方测试集裁定)而非虚构协议细节;其二,做标注噪声研究时,GIANA 的单标注版本不支持标注者间方差分析,需要选 PolypGen 之类多标注者设计的数据集;其三,若研究确需协议细节,唯一正规途径是按官网联系方式向组织者书面索取——本文档将其列为待核项之一,不做推测性填补。

§3.4 与同族数据集标注的谱系关系

GIANA 的标注与库内多个条目存在同源或派生关系,梳理如下:CVC-ClinicDB 与 CVC-ColonDB 出自同一 CVC 标注传统(Jorge Bernal 线),其掩码风格与 GIANA 分割赛道一致,属于「同源并存」关系;ETIS-Larib 由 Saint-Antoine 方(GIANA 主办方之一)出品,是息肉分割四大评测集中公认最难的一个,与 GIANA HD 赛道同出高清临床采集传统;Kvasir-SEG 与 HyperKvasir 则代表挪威 Simula/OSMET 团队的独立标注传统,与 GIANA 无机构重叠,恰因如此两者常被配对做跨机构泛化实验。

这条谱系网的实用结论:若研究需要在「同源测试」(GIANA ↔ CVC 系)与「跨源测试」(GIANA ↔ Kvasir 系)之间做区分,同源配对会系统性高估泛化性能——因为标注风格、设备分布、病例来源共享。这是息肉分割论文中反复被验证的偏差来源,设计实验时应主动控制。

§3.5 使用标注的三条纪律

综合以上,给出三条使用纪律。第一,按形态用标注:像素级任务只取分割赛道标注,图像级任务只取分类标签,不要用分类标签反推分割监督。第二,按版本报数字:所有规模数字随版本语境陈述,2017/2018/2021 三版不互相换算。第三,按证据说话:标注协议细节、license 明文、测试标签公开性三项在公开渠道均无完整答案,涉及这些层面的论述应以「官方未披露」为默认表述,等待官方补充或书面确认,而不是用二手转述填补空白。

§4 官方基线、冠军方案与方法学复盘

§4.1 GIANA 的「基线」观:竞赛即评测

GIANA 与多数静态数据集的一个根本差异在于:它不发布官方基线代码,而是把「最先进水平」的定义权交给每届赛事本身——参赛方案的官方测试集成绩就是当届基线。这个设计被官方组织者在 Journal of Imaging 2020 复盘论文(Guo S, Bernal J, … Matuszewski BJ,《Organized Competition as a Framework for State-of-the-Art Comparison in Gastrointestinal Image Analysis》,Journal of Imaging 2020;6(7):69, doi:10.3390/jimaging6070069)中明确表述为方法论主张:组织化竞赛(organized competition)是对比最先进水平的框架,因为测试集隔离、指标统一、同期横向比较这三个条件在常规论文评测中经常缺失,而在赛事中是制度保证的。

这个方法论主张对本条目读者的实际意义是:在 GIANA 上报告成绩,比较对象应是历届赛事记录而非自己构造的分割。官方推荐的具体读法就是上述复盘论文——它系统收录了 2017 版冠军方案与 2018 版 SD 分割亚军方案的方法细节与成绩,是公开渠道中关于 GIANA 历届水平的唯一系统性技术文献。

§4.2 2018 版六赛道冠军榜逐条解读

2018 版赛事由法国消化内镜学会(SFED)赞助 12 个奖项、总额 2,000 欧元,颁奖于 2018 年 9 月 MICCAI Granada(现场日期的双口径存照见 §10 坑 6)。CVC 官方新闻页存照的完整冠军名单已在 §1 问 7 给出,此处按赛道展开解读。

视频赛道双冠背后的 KM 现象。KM 团队(Satoshi Kondo)同时拿下视频息肉检测、WCE 血管扩张检测、WCE 血管扩张定位三个赛道冠军,是当届唯一三冠团队。一人(一队)横跨结肠镜视频与胶囊内镜两个模态、检测与定位两种任务形态而同时登顶,在当年医学影像挑战中相当罕见。合理解释是两条任务链在获胜要素上同构:都需要在低对比度、高伪影的图像流中做「可疑区域的召回优先」检测,这类方法栈(候选区域生成 + 逐区域判别 + 时序/序列平滑)在两个模态间可迁移。对复现者的提示是:三冠方案没有以独立论文形式逐赛道发表,其方法要素只能从上述复盘论文与团队其他发表中间接拼合——引用时避免把「三冠」误读为「同一模型」。

定位赛道的 ODS AI。视频息肉定位冠军由 ODS AI 团队(Iglovikov + Dobreenkii)获得。Igor Iglovikov 在通用计算机视觉社区因多个 Kaggle 冠军与开源贡献知名,其参赛是深度学习社区向医学挑战赛溢出的代表性案例。定位任务相比检测要求更精细的空间输出,团队方案的公开细节以官方存照为准,本条目不展开推测性描述。

分割赛道 SD/HD 双榜。SD 分割冠军为 Penguin AI 团队(Chen + Zheng + Li + Yao + Huang),HD 分割冠军为 OUS 团队(Qadir + Shin + Balasingham,挪威奥斯陆大学系)。两个分割赛道数据同源而采集条件不同(574×500 vs 1920×1080),双榜冠军来自不同团队,说明分辨率迁移不是当年方案的默认强项——这本身就是一个可引用的观察:2018 年时点,跨分辨率泛化在息肉分割上尚未被冠军级方案解决,为后续鲁棒性研究(含 Giana-C 方向)留下了空间。另据官方复盘论文口径,2018 SD 分割亚军方案同样被该文收录复盘,其方法价值获官方背书。

特别奖。FanVoyage 团队获特别奖(special award)。官方新闻页未给出该奖的技术评审细节,本条目如实记录奖项存在而不虚构获奖理由。

§4.3 2017 版冠军与复盘论文的关系

复盘论文(doi:10.3390/jimaging6070069)收录的另一个主角是 2017 版冠军方案。2017 版任务是胶囊内镜图像三分类(正常/炎症/血管扩张,1,812 张、906/454/452 划分),其冠军方案与 2018 SD 分割亚军方案并列作为论文的核心案例,用于论证「竞赛式评测」相对于零散论文评测的可比性优势。对需要引用 GIANA 历史最优成绩的论文,正确的引用姿势是:成绩数字从这篇复盘论文取,且注明届次与赛道;不引用二手网页转述的排名。

§4.4 无常驻 leaderboard 的方法学后果

GIANA 官方不维护常驻排行榜:每届挑战在届内评测、现场颁奖后即停止更新。这一选择有两面性。正面:避免了跨届次数据泄漏(后来者反复拟合历史榜单)与「刷榜指标化」的退化。负面:新方法进入 GIANA 没有官方登记渠道,社区只能通过论文自报成绩做横向比较,而自报成绩的测试协议(是否用官方测试划分、是否报告同套指标)可能不一致。

由此产生的实操规范:论文中报告 GIANA 成绩时,必须声明所用划分(官方划分或自行划分)与指标版本;引用他人成绩时,优先从复盘论文与原冠军团队论文取数,注明届次。库内做横向基准的条目(如 kvasir-seg、polypgen 等)遵循同一纪律,读者可交叉参考各条目的评测节。

§5 评价指标详解与下游基准生态

§5.1 分割四指标的口径与直觉

GIANA 分割赛道官方采用 Dice、PPV、敏感性(sensitivity,即召回率)、Hausdorff 距离(HD)四指标组合。四个指标各管一段失效模式,理解其分工对正确解读成绩至关重要。

Dice 系数衡量预测掩码与真值掩码的重叠程度,取值 0-1,本质是真值与预测交集的两倍除以两者之和。它对大目标相对宽容、对小目标敏感——息肉在画面中的相对面积会直接改变 Dice 的物理含义,这也是分割社区后来发展按息肉尺寸分层报告的动因。

**PPV(精确率)**衡量预测为正的区域中真为正的比例,专抓「过度分割」:把正常黏膜误划入息肉会直接压低 PPV。在临床语境下 PPV 对应「误报成本」——一个把大量正常组织标为病灶的系统会增加不必要的阅片负担。

**敏感性(召回率)**衡量真值区域被覆盖的比例,专抓「漏检」。临床语境下漏检的代价通常高于误报(漏掉一个腺瘤可能延误干预),因此 GIANA 与多数息肉挑战一样把敏感性放在与 Dice 同等重要的位置,而不是只看 Dice。

Hausdorff 距离衡量两个边界点集之间的最坏情况距离,专抓「边界离群」:掩码整体重叠尚可但边界某处严重漂移时,Dice 可能下降有限而 HD 会急剧恶化。它对个别像素的边界错误高度敏感,是四指标中方差最大、也最能暴露「轮廓质量」问题的一个。

四指标合读的要点是不许可单指标替代:一个 Dice 很高但 HD 很差的方案,意味着它「填对了区域但描错了边界」,在需要精确轮廓的下游任务(如切除范围评估)中不可用。GIANA 用四指标组合卡掉了单指标优化的捷径。

§5.2 分类指标:AUC 与胶囊内镜赛道

血管扩张检测、血管扩张定位及 2021 版息肉分类赛道采用 AUC(ROC 曲线下面积)作为主指标。AUC 对类别不平衡不敏感的特性,适合胶囊内镜数据中病灶稀疏的现实分布。需要注意的是,AUC 评估的是排序质量而非工作点性能——竞赛获奖方案最终还要给出具体阈值下的敏感性与 PPV 才能转化为临床部署参数。研究者在复用时应在 AUC 之外补报工作点指标,这一建议与库内其他胶囊内镜条目(kvasir-capsule 等)的评测讨论一致。

§5.3 Giana-C:第三方把 GIANA 变成鲁棒性基准

arXiv:2011.07631(期刊版发表于 Medical Image Analysis 2024)的工作是 GIANA 下游生态中技术含量最高的引用之一。该工作按 2017 版 1,812 张原图口径,构造了 15 种损坏类型(corruption types)的变体数据集 Giana-C,共 2,260 张有效损坏-图像组合,用于系统度量胶囊内镜分类模型在成像退化(噪声、模糊、压缩、色彩偏移等类别)下的性能衰减。

Giana-C 的存在把 GIANA 的生态位从「分割/检测基准」扩展到「鲁棒性基准」,与 ImageNet-C 在自然图像领域的角色形成同构。对做胶囊内镜算法工程化的团队,Giana-C 提供了不依赖新标注即可执行的退化压力测试;对做文献综述的读者,它提供了「GIANA 数字」的第三种语境——引用 GIANA 时区分:分割基准语境(2018 SD 六大件之一)、分类基准语境(2017 三分类)与鲁棒性基准语境(Giana-C)。

§5.4 息肉分割「四大件」中的 GIANA

息肉分割论文的常规比较表由四个数据集构成:CVC-ClinicDB、Kvasir-SEG、ETIS-Larib、GIANA(SD 分割赛道)。四个席位各有角色:CVC-ClinicDB 是「最老资格」(同源标注传统的锚点),Kvasir-SEG 是「最大训练池」,ETIS-Larib 是「最难分布外」,GIANA 处在一个微妙的位置——它既是赛事验证过的评测集,又是四大件中唯一自带视频与胶囊内镜姊妹赛道的成员,因此常被用作「静态分割之外还能否扩展」的延伸测试场。

给论文作者的构图建议:主实验在 Kvasir-SEG + CVC-ClinicDB 训练、四件套全测之外,把 GIANA SD 单独作为一组「挑战赛验证数据」报告,并注明成绩来源是官方测试协议还是自行划分——这一行注明能显著提高结果的融贯性与可复核性。

§5.5 下游引用的常见姿势与误用

综合公开文献,GIANA 的下游引用可归纳为四类姿势:其一,作为分割比较表第五列(安全但需注明划分口径);其二,作为视频息肉检测的少数可用公开基准(与其他视频数据集如 ldpolypvideo 配对);其三,作为胶囊内镜血管扩张检测的训练/评测源(与 CAD-CAP 组合使用);其四,经 Giana-C 变体做鲁棒性评测。对应的误用主要有三:把 2017 版 1,812 张与 2018 版六赛道混算(见 §2.3)、把官方测试成绩与自划分成绩混表(见 §4.4)、以及把「GIANA 冠军」误写为单一模型的单一成绩(见 §4.2)。这三类误用也是 §10 避坑清单的重点条目。

§6 获取方式、许可边界与 AI-Ready 评估

6.1 注册墙获取全流程

GIANA 全部版本的数据都通过 Grand-Challenge 平台的注册墙发放。完整流程如下:

  1. 访问官网 giana.grand-challenge.org,点击注册(register),使用邮箱创建 Grand-Challenge 平台账号;
  2. 在挑战页面阅读挑战规则(challenge rules),完成接受(accept)操作——多数 Grand-Challenge 挑战在此步还会有数据使用目的的自陈要求;
  3. 规则接受通过后,官网发放下载链接,按赛道分目录组织(视频赛道、SD/HD 分割赛道、WCE 检测/定位赛道、CAD-CAP);
  4. 若需要的是 2024 AI4PolypNet 新版,走 pages.cvc.uab.es/ai4polypnet/ 的新入口,与老版账号体系互不继承。

四个环节中第 2 步是实质闸门:数据链接只在规则接受后出现,且条款内容随届次可能更新。对自动化批量获取(脚本下载、爬虫)而言,注册墙意味着没有官方支持的程序化通道——这在 DAIMS 评估中是可获取性维度的硬扣分项(见 6.4)。

6.2 许可现状:能确认什么、不能确认什么

按一手证据边界,许可问题可以精确表述为三层:

  • 公开可见层:官网公开页面的表述属于研究用途(for research purposes)一类的定性措辞,表明数据定位是科研使用。
  • 注册墙内层:完整许可条款在规则接受环节展示,内容未经实抓确认。条款对再分发、商用、衍生数据发布的具体授权范围,公开渠道没有答案。
  • 不可臆测层:本条目不转述任何未实抓的条款文本。凡在别处看到 GIANA「CC BY」「仅限学术」「禁止商用」等明确断言,都应要求其给出注册墙内条款截图或官方书面确认——在证据链上,这些断言目前没有公开出处。

由此对使用者的操作建议:需要法律确定性的场景(企业合作、产品化、衍生数据集发布),先注册查阅条款原文,必要时向组织者书面确认;纯学术使用场景,按公开口径默认研究用途,但在论文数据声明中注明「数据获取自 GIANA 官网并遵循其挑战规则」。

6.3 镜像与第三方搬运的评估

截至本条目抓取时点,GIANA 没有官方 Hugging Face 镜像——在 hf-mirror.com 检索不到 GIANA 官方账号。第三方搬运在搜索结果中存在,但按本条目纪律不评估、不引用、不指引,原因有三:

  • 版本对齐风险:GIANA 版本链复杂(2015/2017/2018/2021/2024 五个节点),第三方包几乎不标注届次,混版概率高;
  • 完整性风险:开放上限数字(>20 条测试视频、>150 张 HD、>3,500 张 CAD-CAP)意味着没有官方清单就无法核验包完整性;
  • 合规风险:数据本身在注册墙后,第三方再分发的授权状态未知。

对需要程序化访问的团队,唯一稳妥路径仍是注册墙 + 官方下载;若确有镜像化需求,正规做法是注册获取后按许可条款(注册墙内确认)自行建内部镜像,而不是依赖来路不明的公开搬运。

6.4 AI-Ready 评估:DAIMS 全表

按库内统一的 DAIMS 五维框架对 GIANA(2018 版为主体)评分:

维度 评分(1-10) 依据
D 可发现性 6 官网+ITU-T FG-AI4H DEL10.20+CVC 新闻页三源可检索,Grand-Challenge 平台 SEO 良好;扣分项:名称与 GIAnt 混淆(坑 1)、无 HF 官方镜像、五节点版本链分散检索命中
A 可获取性 3 注册墙 + 规则接受才发放链接;无公开直链、无官方镜像、无程序化 API;license 明文不公开是本维度的叠加扣分
I 可互操作 5 常规图像格式 + 按赛道分目录 + 官方划分(906/454/452 与 300/612 等文档化);扣分项:无 DICOM/元数据 schema 层、无集中机器可读元数据、测试集 ground truth 公开性未确认
M 元数据质量 5 官网赛道页规模数字 + ITU-T 文档交叉存照 + 复盘论文口径;扣分项:标注协议未披露、开放上限数字(>20/>150/>3,500)无精确总数、视频赛道时长/帧率未文档化
S 可持续性 7 Grand-Challenge 机构级平台托管 + CVC 长期维护 + 2024 AI4PolypNet 再启动显示系列活性;扣分项:单通道依赖注册账号体系、无常驻 leaderboard、届次页面可能随平台改版失稳
综合评级 5.2/10(中) 内容价值与制度性壁垒错位:赛事级数据质量、注册墙档位获取;失分集中在获取通道与文档透明,而非数据本身质量

与库内光谱对照:GIANA 位于注册墙档(同档参照:cad-cap 等注册制条目),显著低于公开直链档(HyperKvasir、Kvasir-SEG 的 DAIMS 8-9 分),也低于掩码申请制档(PANDA-PLUS 的远程掩码发放)——因为 GIANA 连许可文本都在墙内。但需要公平指出:GIANA 的低分是获取制度性低分,其数据内容的赛事验证质量、四模态覆盖与复盘论文的可比性框架,在同档位中仍属上游。

6.5 版本选择建议:三个研究场景三种取法

按研究目标选择届次,可以避免最常见的「下载即错版」问题:

  • 做息肉分割基准:取 2018 版 SD 赛道(300/612,574×500)为主,HD 赛道(>150,1920×1080)做跨分辨率对照;不需要 2017 版。
  • 做胶囊内镜血管扩张:2018 版 WCE 双赛道(600/600)做评测、CAD-CAP(>3,500)做训练;若做鲁棒性研究,配 arXiv:2011.07631 的 Giana-C 变体(2,260 张)。
  • 做息肉性质分类(腺瘤性 vs 非腺瘤性):只能取 2021 版分类赛道(1,000/200),经新入口或对应届次页面获取。

§7 生态与谱系:GIANA 在胃肠道影像数据版图中的位置

7.1 谱系总览

GIANA 与库内 13 个条目存在直接关系,按谱系亲疏分为四组。总览表如下(rid 为库内条目编号,链接格式统一为本站占位):

组别 条目 rid 关系性质
CVC 直系 cvc-clinicdb 133 同一标注传统的直系数据集
CVC 直系 cvc-colondb 142 同一标注传统的直系数据集
EndoVis 家族 endovis-challenges 79 同属 EndoVis 挑战系列
EndoVis 家族 cad-cap 193 2018 年与 GIANA 并轨的胶囊内镜 CAD 挑战
挪威系对照 kvasir-seg 112 息肉分割四大件并列
挪威系对照 hyperkvasir 693 大规模对照数据集
挪威系对照 kvasir-hyperkvasir 75 同系数据集条目
挪威系对照 kvasir-capsule 123 胶囊内镜模态对照
视频与合成 ldpolypvideo 163 息肉视频数据集配对
视频与合成 polypgen 183 多中心息肉生成/收集对照
视频与合成 c3vd 398 合成结肠镜对照
视频与合成 simcol3d 418 合成三维结肠对照
胃镜真实世界 gastrovision 203 胃镜分类真实世界对照

7.2 CVC 直系:cvc-clinicdb(rid 133)与 cvc-colondb(rid 142)

这两个条目与 GIANA 息肉赛道出自同一标注传统——CVC-UAB 与合作医院的医师团队,Jorge Bernal 是共同的组织者与论文作者。CVC-ClinicDB(196 张掩码)与 CVC-ColonDB(380 张序列帧掩码)可以理解为「赛事数据经论文固化」的产物,标注风格、设备分布与 GIANA SD 赛道高度同源。

配对用法与陷阱:同源意味着不能互相作为独立分布外测试集——跨这组数据集的成绩提升可能只是标注风格拟合。正确姿势是把 CVC 系 + GIANA SD 视为一个「同源簇」,与挪威系簇(Kvasir 系)做簇间比较。

7.3 EndoVis 家族:endovis-challenges(rid 79)与 cad-cap(rid 193)

endovis-challenges 条目覆盖 MICCAI EndoVis Workshop 挑战系列全景,GIANA 是该系列中胃肠道方向的子挑战——2017 年起以 GIANA 名义独立办赛,2018 年起正式挂入 EndoVis。做 EndoVis 系方法学研究(如手术场景分割、器械跟踪)的读者,可以从该条目进入系列全景,再到 GIANA 看胃肠道分支。

cad-cap(rid 193)与 GIANA 的关系最特殊:2018 年两者新建并轨——CAD-CAP 作为胶囊内镜计算机辅助检测的挑战与 GIANA 同期组织,并在数据层面共享 CAD-CAP 子集(>3,500 张小肠胶囊图像)。两个条目描述的是同一年度生态的两半:GIANA 名下是六赛道赛事与数据发放,CAD-CAP 名下是胶囊内镜 CAD 的算法赛道本体。引用 2018 年胶囊内镜工作时,两个名称都可能出现,需按引用对象(数据 vs 赛事)选择。

7.4 挪威系对照:kvasir-seg(rid 112)、hyperkvasir(rid 693)、kvasir-hyperkvasir(rid 75)、kvasir-capsule(rid 123)

挪威 Simula/OSMET 团队的数据家族与 GIANA 无机构重叠、无标注风格共享,是息肉分割研究中跨机构泛化实验的标准对照组。四个条目与 GIANA 的配对价值各有侧重:

  • kvasir-seg(rid 112):与 GIANA SD 同为分割四大件成员,1,000 张息肉掩码。两数据集配对做「Kvasir 训练 → GIANA 测试」是文献中验证跨源泛化的经典设置;注意 Kvasir-SEG 训练集与 CVC-ClinicDB 的已知重叠问题同样适用于与 GIANA 的比较解读。
  • hyperkvasir(rid 693):110,079 张的大规模真实世界数据集,其 GAIMS 评分 8.0 与 GIANA 的 5.2 构成库内光谱两端的自然对照——前者代表「零门槛直链」的开放范式,后者代表「注册墙制度」的传统范式。两条目互为对方条文的「光谱对照点」。
  • kvasir-hyperkvasir(rid 75):家族总览型条目,适合作为从 GIANA 跳转了解挪威系全景的中转。
  • kvasir-capsule(rid 123):471 万帧的胶囊内镜数据集,与 GIANA 的 WCE 赛道同模态而量级悬殊。做胶囊内镜血管扩张检测的研究者,常见组合是 kvasir-capsule 做预训练/大规模训练、GIANA CAD-CAP 与 WCE 赛道做任务对齐评测。

7.5 视频与合成数据:ldpolypvideo(rid 163)、polypgen(rid 183)、c3vd(rid 398)、simcol3d(rid 418)

  • ldpolypvideo(rid 163):结肠镜息肉视频数据集,与 GIANA 视频赛道(18 条训练 />20 条测试)是视频息肉检测方向仅有的少数公开基准配对。GIANA 视频赛道带赛事验证标签,ldpolypvideo 带逐帧标注,两者互补性强。
  • polypgen(rid 183):多中心息肉数据集,其多中心设计恰好补上 GIANA 未披露的维度(标注者间一致性、中心间方差);做标注噪声与分布偏移研究时两者是天然搭档。
  • c3vd(rid 398)与 simcol3d(rid 418):合成结肠镜数据两个代表。合成数据可以提供 GIANA 不可能提供的完美真值(逐像素、逐帧、无标注噪声),常用姿势是「合成数据预训练 → GIANA/CVC 系真实数据微调」的 sim-to-real 管线。

7.6 胃镜真实世界:gastrovision(rid 203)

gastrovision 是胃镜方向的真实世界分类数据集,与 GIANA 的关系是「下消化道 ↔ 上消化道」的互补:两者合起来覆盖胃肠道两端的主要内镜模态。做全消化道 AI 系统综述或模态泛化研究时,GIANA(结肠镜视频 + 小肠胶囊)与 gastrovision(胃镜静态图)+ kvasir-capsule(全消化道胶囊)构成模态三角。

7.7 库外重要近邻:ETIS-Larib

息肉分割四大件中唯一未入库的是 ETIS-Larib——由 GIANA 主办方之一的 Saint-Antoine 医院(巴黎公共医院系统 AP-HP)出品的息肉分割数据集,以「公认最难」著称(低分辨率、大量小息肉与边界模糊病例)。本条目按官方英文名提及但不分配 rid(库内查证无对应条目)。对论文作者:四大件引用时它不可缺席;对库内建设者:它是胃肠道域下一个值得补齐的候选条目。

7.8 互链使用建议

三条建议收束本节。第一,从 GIANA 出发的所有库内跳转,链接统一使用本站条目页格式(如 https://www.qianfanghub.com/ai-ready-dataset/kvasir-seg/112),本条目尾部事实清单附完整 rid 对照。第二,引用谱系关系时区分「同源」(CVC 系、ETIS)与「对照」(挪威系)——两类关系的实验设计含义完全不同。第三,EndoVis 家族内部(endovis-challenges、cad-cap、GIANA)的交叉引用要保持届次一致:三个条目各自覆盖不同年度与任务切片,混引会造成赛事史叙述的年表错乱。

§8 方法学启示:GIANA 给后续数据集建设留下了什么

8.1 竞赛即评测:制度化可比性的先例

GIANA 最具辐射力的方法论贡献,是把「组织化竞赛作为最先进水平对比框架」从口号做成了制度实践:测试集隔离发放、指标预先统一、成绩官方裁定、结果以复盘论文归档。这套流程精确针对论文式评测的三个顽疾——测试集泄漏(作者用测试集调参)、指标漂移(同一数据集不同论文报告不同指标组合)、协议不可复核(测试划分自定义)。复盘论文(doi:10.3390/jimaging6070069)以 2017 冠军与 2018 SD 亚军方案为案例,系统论证了赛事评测在这三个维度上的优势。

后续数据集建设可以直接继承的设计要素有三:其一,测试标签届内保密(GIANA 测试集标签的公开性至今以届次规则为准,见坑 4),保证评测残留价值;其二,指标组合先行公告,杜绝参赛后的指标挑选;其三,届终复盘归档,让「当年最优」可被引用而不是散落于新闻页。代价同样明确:无常驻 leaderboard 使新方法缺乏登记通道,且跨届成绩不可比——这是制度选择的权衡,而非缺陷。

8.2 数据集与赛事的耦合生长模式

GIANA 展示了另一种数据集成长路径:不是「先建库后发论文」,而是数据按届发放、任务按届进化、文档按届沉淀。2017 版三分类 → 2018 版六赛道 → 2021 版加分类维度,每次扩充都由赛事需求牵引。这个模式的好处是数据规模与社区注意力同步增长、任务定义随临床与算法前沿滚动;坏处是版本碎片化——本条目用接近一半的篇幅处理版本口径问题(§2、§5、§10),正是这种碎片化的成本实录。

给后续建设者的量化参考:若采用赛事驱动模式,每个版本节点需要至少一份独立规格文档(任务、规模、划分、指标四要素),否则三年后社区里流传的规模数字会互相打架——GIANA 的 1,812 vs 六赛道混算(坑 3)就是前车之鉴。

8.3 多模态覆盖的预演

GIANA 2018 把结肠镜视频、SD/HD 静态图、胶囊内镜三种成像条件纳入同一赛事,这在当时是罕见的模态广度。事后看,这个「模态矩阵」预演了后来胃肠数据集生态的分工:视频方向由 ldpolypvideo 等专精,静态分割由 Kvasir 系专精,胶囊内镜由 kvasir-capsule 专精。GIANA 的广度未能转化为单点深度(各赛道样本量都被赛事周期限制),但它证明了一件事:同一批组织者、同一套标注网络可以跨模态输出赛事级数据——这个证明支撑了 CVC 系与 EndoVis 系后来多分支的发展。

8.4 注册墙模式的得与失

从 AI-Ready 视角,GIANA 的注册墙(DAIMS 可获取性 3 分)常被视为反面教材,但公允地说,注册墙换来了三样东西:使用目的可追溯(每份数据对应一个注册身份)、规则可更新(条款修订只需对新注册者生效)、医学数据伦理姿态的稳妥表达。真正的问题不是墙本身,而是墙内文档的欠透明:许可明文、标注协议、测试标签政策三件应在注册完成后即时交付的文档,公开记录中均未见系统披露。改进方向因此很具体:把 6.2 节列出的「不可臆测层」文档化、注册后可见——这是注册墙模式自我救赎的唯一路径。

§9 与库内条目的关系网络

9.1 光谱定位

在库内 AI-Ready 光谱上,GIANA 处于注册墙档:高于任何请求审批制(纸质/邮件申请),低于掩码远程发放制(PANDA-PLUS),显著低于公开直链制(HyperKvasir 8.0、Kvasir-SEG 等)。它的光谱位置由制度决定而非数据质量决定——其内容维(赛事验证、四模态、复盘论文)在同档位中属上游。库内条目间的光谱对照是互链算法的重要信号,GIANA 与 hyperkvasir(rid 693)的「光谱两端对照」关系因此是本文档最重要的显式互链之一。

9.2 三类关系与跳转地图

与 GIANA 的库内关系可压缩为三句话:向上,endovis-challenges(rid 79)是它的会议系列语境,cad-cap(rid 193)是它 2018 年的并轨伙伴;同层,cvc-clinicdb(rid 133)与 cvc-colondb(rid 142)是同源直系,kvasir-seg(rid 112)、hyperkvasir(rid 693)、kvasir-hyperkvasir(rid 75)是跨源对照组;相邻,ldpolypvideo(rid 163)补视频深度、polypgen(rid 183)补多中心维度、kvasir-capsule(rid 123)补胶囊内镜量级、gastrovision(rid 203)补上消化道、c3vd(rid 398)与 simcol3d(rid 418)补合成数据。

跳转地图按研究需求给出:做息肉分割基准评测 → kvasir-seg、cvc-clinicdb;做跨源泛化 → hyperkvasir、polypgen;做视频检测 → ldpolypvideo;做胶囊内镜 → kvasir-capsule、cad-cap;做 EndoVis 系方法学 → endovis-challenges;做 sim-to-real → c3vd、simcol3d;做全消化道综述 → gastrovision。

9.3 引用格式建议

引用 GIANA 的推荐格式分三种场景:引数据本体,引用官网(giana.grand-challenge.org)+ 对应届次页面;引方法学,引用复盘论文 Journal of Imaging 2020;6(7):69, doi:10.3390/jimaging6070069;引鲁棒性基准,引用 arXiv:2011.07631(Medical Image Analysis 2024)与 Giana-C 变体。三种场景不应互相替代——用赛事新闻页当数据引用、用复盘论文当 license 依据,都是文献链条上的常见错位。

§10 避坑清单:八坑全景(每坑四段式)

以下八坑按「症状 → 解决 → 参考」四段式展开,前两坑为身份与口径级(错误代价最高),后六坑为操作与文档级。编号沿用全条目统一口径(正文中「坑 N」的引用均指向本节)。

坑 1:GIANA 不是「指甲挑战」——名称混淆的身份级错误

症状。把 GIANA 误认为「GIAnt Nail Analysis」(甲分析/甲银屑病评估挑战),进而在数据选型、综述写作或条目建设时把胃肠道数据集的属性(息肉、胶囊内镜、血管扩张)张冠李戴到指甲影像上,或者反向。这个错误在本条目任务描述环节真实发生过:任务简报最初就是按「指甲分割/甲银屑病」的猜测下达的。「GIANA」与「GIAnt」三字母之差是混淆的根源,两者同属医学影像挑战语境放大了误读概率。

解决。记牢全称拼合:GIANA = Gastrointestinal Image ANAlysis( gastrointestinal = 胃肠道的),首字母取 G-I-A-N-A;GIAnt = GIAnt Nail Analysis,是另一条完全无关的挑战线。任何涉及 GIANA 的描述,先核对两条属性:主办方是 CVC-UAB/ETIS/Hospital Clinic/Saint-Antoine 四方(非皮肤科机构),任务是息肉与血管扩张(非甲单元)。三源核验记录:官网、ITU-T FG-AI4H DEL10.20、CVC 新闻页一致指向胃肠道定义。

参考。giana.grand-challenge.org 官网全站任务描述;ITU-T FG-AI4H DEL10.20 文档条目;本条目 §1 问 1 的正名存照。

坑 2:2017 版 1,812 张 vs 2018 版六赛道——规模数字的版本嫁接

症状。文献中最常见的 GIANA 数字错误:把 2017 版胶囊内镜规模(1,812 张,906/454/452 划分)与 2018 版六赛道规模(300/612 SD、>150 HD、600/600×2、>3,500 CAD-CAP)写进同一段叙述,产出「GIANA 有 1,812 张图像用于息肉分割」这类自相矛盾的表述——因为 1,812 张是胶囊内镜三分类数据,与息肉分割任务毫无关系。

解决。建立版本-任务绑定反射:1,812/906/454/452 这组数字出现,任务必是「胶囊内镜三分类」(正常/炎症/血管扩张),届次必是 2017;300/612 出现,任务必是「SD 息肉分割」,届次必是 2018。两条数字线之间没有换算关系,只有历史演进关系。综述写作时按届次分节叙述,不用「GIANA 共有 X 张」的合并句式。

参考。ITU-T FG-AI4H DEL10.20(2018 六赛道口径);arXiv:2011.07631(2017 版 1,812 张口径的权威转述);本条目 §2.3。

坑 3:license 标签想当然——「研究用途」不是许可条款

症状。把官网公开页「for research purposes」的定性措辞,升级转写为具体许可断言:「GIANA 采用 CC BY 4.0」「仅限学术非商用」「允许再分发」等。这些断言在公开证据链上均无出处——完整条款在注册墙内,未经实抓确认。

解决。三层表述纪律(与 6.2 节一致):公开层面只说「研究用途定性表述」;条款层面只说「以注册并接受挑战规则后的条款为准」;需要法律确定性时先注册查阅原文或书面询问组织者。给数据库/数据集卡(dataset card)写 license 字段时,用「License: 研究用途表述见官网,明文条款注册后可见(registration-gated)」这类诚实标注,不填具体 SPDX 代号。

参考。本条目 §6.2、§9.3;FACTS 档案待核项 1。

坑 4:测试集标签的公开性想当然

症状。默认「挑战结束后测试集 ground truth 一定公开」,在实验设计里把 GIANA 测试集当作可自评的验证集使用;或反向,声称「测试标签永不公开」而劝退合法使用者。两个方向的断言都缺乏公开证据——各届次测试标签的释放政策以官方规则为准,公开渠道未获系统确认。

解决。实验设计前先在官网届次页确认测试标签政策;若标签不公开且需要测试评估,走官方评测通道(Grand-Challenge 平台的提交评测)或改用训练集自划分;论文中声明所用评估通道。绝不要用第三方转存的「测试标签」文件——其与官方测试集的对齐性无从验证。

参考。本条目 §4.4、§5.4;FACTS 档案待核项 2。

坑 5:HF 无官方镜像——第三方搬运的版本对齐风险

症状。在 Hugging Face(或 hf-mirror.com)搜到 GIANA 相关的第三方数据包后直接下载使用,随后遭遇版本不明(是 2017 还是 2018 口径)、赛道不全(只有 SD 分割缺 WCE)、规模对不上官方数字等问题。GIANA 无官方 HF 账号,所有搜索命中的搬运都是非官方的。

解决。坚持注册墙正道(6.1 节流程);确需内部镜像化时,注册获取后按墙内许可条款自建,并在镜像文档中写明届次与校验信息(文件清单或哈希)。评估任何第三方包时,用两个硬指标验版本:SD 分割是否 300/612(2018 口径)或数据是否 1,812 张三分类(2017 口径)——两口径混在一个包里即可判为混版。

参考。本条目 §6.3;FACTS 档案 §6。

坑 6:2018 现场日期双口径——「9 月 1 日」从哪来的

症状。引用 2018 版赛事颁奖日期时,官网早期页面写「2018 年 9 月 1 日」,而 MICCAI 2018(Granada)主会议日程在 9 月中旬,两个时间口径并存,二手引用因此互相打架。

解决。正文采用模糊表述「2018 年 9 月 MICCAI Granada 期间」,不落到具体日;需要精确日期的场景(新闻稿、年表建设)向官方核对最终版页面。本条目所有时间表述已按此纪律处理。年表建设者应把这个双口径记为「存照项」而非「错误项」——两个口径各自有页面依据,不是笔误。

参考。FACTS 档案待核项 3;本条目 §4.2。

坑 7:六赛道名称的口径漂移

症状。不同页面(CVC 新闻页 vs 官网 evaluation 页)对六个赛道的命名存在措辞差异(如「视频检测」vs「detection in videos」的全称/简写、WCE/胶囊内镜/Capsule Endoscopy 的混用),跨页面对表时误以为赛道数量或内涵不同。

解决。以功能组合定位赛道而非名称字符串:两条任务链(息肉视频检测+定位、息肉分割 SD+HD、血管扩张检测+定位)共六个功能位,名称差异视为翻译/简写问题。引用赛道时给出功能描述+届次,不依赖单一名称字符串的精确匹配。六赛道的功能定义以 §1 问 2 表格为准。

参考。FACTS 档案待核项 4;本条目 §2.2。

坑 8:开放上限数字当精确数用——「>20 条视频」不是 21 条

症状。把官方文档的开放上限表述(>20 条测试视频、>150 张 HD、>3,500 张 CAD-CAP)转写为精确数字(「21 条」「151 张」),或反过来质疑官方文档「数字不精确」。开放上限是文档诚实性的体现——官方对这几个位置的精确总数未做披露,转写为精确数是引用失真。

解决。凡引用这三个位置的数字,保留「>」符号并注明「官方文档口径为开放上限」;需要精确总数的场景(包完整性校验、元数据表构建)以下载包实测为准并注明实测方法。同理,SD 赛道 300/612 与 WCE 赛道 600/600 是封闭数字,可以放心当精确数引用——封闭与开放的分界本身就是文档信息。

参考。本条目 §2.2;FACTS 档案 §4。

§11 总结:GIANA 条目要点回顾

GIANA 是胃肠道内窥镜影像领域以赛事形态存在的主干数据系列:由 CVC-UAB、ETIS-ENSEA、Hospital Clinic de Barcelona、Hôpital Saint-Antoine AP-HP 四方主办,从 ISBI 2015 的早期形态走到 MICCAI 2021 的分类扩充,并在 2024 年以 AI4PolypNet 再启动。2018 版是内容最完整的主体版本:六赛道覆盖结肠镜视频检测/定位、SD/HD 双档分割、胶囊内镜血管扩张检测/定位,另有 CAD-CAP 超过 3,500 张三分类训练库;2021 版新增腺瘤性/非腺瘤性息肉分类(1,000/200)。

它的不可替代性有三点:其一,与 Kvasir-SEG、CVC-ClinicDB、ETIS-Larib 并列的息肉分割四大件席位,且是其中唯一自带视频与胶囊内镜姊妹赛道的成员;其二,由官方复盘论文(Journal of Imaging 2020;6(7):69)背书的「竞赛即评测」方法学框架,为历届最优成绩提供了唯一系统性文献锚点;其三,第三方构造的 Giana-C 损坏变体(2,260 张,15 种损坏类型)把它扩展为胶囊内镜分类的鲁棒性基准。

使用它的成本与风险同样清晰:注册墙获取(无直链、无官方镜像、无程序化通道)、license 明文不可直查(公开层仅有研究用途定性表述)、标注协议未系统披露、测试标签公开性以届次规则为准。本条目以八坑清单(§10)收录全部已知混淆点,以双口径存照处理 1,812 vs 六赛道、现场日期、赛道命名等分歧,所有硬数字均可在官网、ITU-T FG-AI4H DEL10.20 与复盘论文三条一手链上复核。

一句话定位:GIANA 是内容上被低估、获取上被高估的那类数据集——真正花一次注册成本走进去的研究者,拿到的是赛事级验证过的多模态数据与一套可引用的评测框架;而停留在搜索结果页的转述者,往往连它的名字都会读错。

附录 A:历届届次深度档案

A.1 ISBI 2015:系列的史前起点

2015 年 ISBI(IEEE International Symposium on Biomedical Imaging)上的早期赛事形态,是 GIANA 系列可追溯的起点。这一届的任务组织与数据规模在后续文档中只有概括性回溯(官网历史页以时间线形式提及),独立规格文档已不易获取。对数据使用者:除非专门研究 2015 年赛事本身,一般无需触达此节点;对赛事史研究者:此节点与同年的 MICCAI 2015 前身赛事共同构成「GIANA 命名前」的史前史,两者由同一组织网络(CVC 与合作机构)运行。

A.2 MICCAI 2015:息肉检测前身赛事

同在 2015 年,系列在 MICCAI 会议上以息肉检测为主题举办前身赛事,确立了「结肠镜息肉、CVC 标注网络、会议挂靠」三要素,这三要素贯穿此后所有届次。此届与 ISBI 2015 的关系是同一团队在两个会议上的连续实践,而非两个独立系列。数据层面,此届的检测数据集构成后来 GIANA 检测任务的直接前身;其与 CVC-ColonDB(rid 142)所固化的序列标注同属一条数据脉络。

A.3 MICCAI 2017:GIANA 正名之年

2017 年是系列的关键节点:「GIANA」名称首次启用,任务主体为小肠胶囊内镜图像三分类(正常/炎症/血管扩张),数据规模 1,812 张、906/454/452 划分。此届冠军方案后来被 Journal of Imaging 2020 复盘论文收录为核心案例,是该届成绩的权威文献出处。此届的意义在于三点:名称注册(此后所有文献引用的 GIANA 从此届起算)、胶囊内镜主线的正式确立(1,812 张口径沿用至第三方 Giana-C 基准)、复盘论文体系的开端。

A.4 MICCAI 2018:六赛道并轨的主体版本

2018 版挂靠 MICCAI EndoVis Workshop(Granada),并新建 CAD-CAP 并轨。任务结构升级为六赛道:视频息肉检测(18 条训练视频)、视频息肉定位、息肉分割 SD(300/612,574×500)、息肉分割 HD(>150,1920×1080)、WCE 血管扩张检测(600/600)、WCE 血管扩张定位(600/600),另有 CAD-CAP 超过 3,500 张小肠胶囊图像训练库。时间线:训练数据 2018-05-23 发放、测试数据 2018-07-20 发放、提交截止 2018-09-03、现场颁奖 2018 年 9 月(日期双口径见坑 6)。SFED 赞助 12 个奖项共 2,000 欧元;冠军名单:KM/Satoshi Kondo 三冠(视频检测、WCE 检测、WCE 定位)、ODS AI 视频定位、Penguin AI SD 分割、OUS HD 分割、FanVoyage 特别奖。此届数据构成今日引用 GIANA 的默认语境。

A.5 MICCAI 2021:分类维度的加入

2021 版在系列中引入息肉分类赛道:区分腺瘤性与非腺瘤性息肉,1,000 张训练、200 张测试。这一扩充把任务链从「检出与勾画」延伸到「性质判断」,与内镜临床决策(切除策略、监测间隔)直接衔接。此届及以后的版本数据经对应届次页面发放,引用时注意与 2018 版规模不混算。

A.6 2024 AI4PolypNet:系列的再启动

2024 年,系列以 AI4PolypNet 名义在新站点(pages.cvc.uab.es/ai4polypnet/)再启动,由 CVC 系团队继续运营。对新版本的任务组织与数据规模,本条目按纪律不做未实抓的转述;已确认的事实是新入口与新规则体系独立于老版注册墙。对系列研究者,此节点标志着「GIANA」名称与「AI4PolypNet」名称的并立——引用 2024 年后工作时应先核对作者实际使用的是哪条数据线。

附录 B:临床背景——血管扩张为什么是胶囊内镜 CAD 的标准考题

B.1 血管扩张的临床画像

血管扩张(angiodysplasia)是胃肠道黏膜下异常扩张的血管结构,在内镜下表现为鲜红色、扁平或略隆起的病变,边界常呈放射状羽状缘。它是小肠出血(不明原因消化道出血的主要组成部分)最常见的血管性病因之一,也是胶囊内镜阅片中需要主动排查的关键病灶。与息肉不同,血管扩张没有「切除即可治愈」的简单处理路径——小型无症状病变可观察,出血性病变需氩离子凝固等处置,因此「检出与定位」优先于「性质分类」,这正是 GIANA WCE 赛道设计成检测/定位而非分类的临床逻辑。

B.2 胶囊内镜成像的算法挑战

胶囊内镜(wireless capsule endoscopy,WCE)的成像条件对计算机视觉构成一组系统性挑战:单次检查产出数万帧图像(人工阅片耗时数小时,漏阅率是公认问题)、镜头与肠壁距离被动随机(对焦与曝光不可控)、肠道内容物遮挡与气泡干扰常见、小肠黏膜血管纹理本身呈现丰富的红色渐变(与血管扩张的表观距离近)。血管扩张的「扁平 + 红色 + 边界羽状」三特征,使它在低对比度帧中极易与血管纹理、红色伪像(血液残留、红肿皱襞)混淆——假阳性控制(PPV)与敏感性之间的张力比息肉检测更尖锐。

这解释了 GIANA WCE 赛道的一个设计细节:检测(图像级有无)与定位(空间位置)分设两个赛道、各 600/600 规模——因为临床阅片辅助的真实需求是「先提示有、再指出在哪」,两级任务对应两级人机协作模式,算法在这两级上的失败模式不同(检测败于阈值选择,定位败于区域提案质量),分赛道评测才能定位问题。

B.3 CAD-CAP 三分类的临床语义

CAD-CAP 的三类标签——正常、炎症、血管病变——对应胶囊内镜阅片的三级输出:无异常发现、非血管性异常(糜烂/溃疡/炎症性改变)、血管性异常(血管扩张为主的红色病变)。这个分组不是病理分类,而是阅片行动分组:三类对应三种临床下一步(放行、按炎症路径随访、按出血源评估)。理解这一点后,CAD-CAP 的「>3,500 张」训练库的正确用法是作为阅片辅助系统的语义底座,而非细粒度病变分类器的训练集——细粒度任务需要更专门的标签体系,GIANA 未提供。

附录 C:息肉分割方法演进中的 GIANA

C.1 赛事节拍与社区方法迭代

回望 2015-2021,息肉分割社区的方法演进与 GIANA 的赛事节拍大体同步:2015 年前后,全卷积网络与 U 形编解码架构(U-Net 谱系)开始取代手工特征与传统图割方法,成为医学分割的新基线;2017-2018 年,编解码架构 + 残差骨干 + 多尺度上下文模块成为挑战赛标配,GIANA 2018 的冠军方案正处于这一代际;2019 年后,注意力机制与 Transformer 结构进入分割领域,Kvasir-SEG 等更大规模数据集接棒成为方法迭代的主舞台。GIANA 在这个时间线中的角色,是 2015-2018 段的方法代际标尺——复盘论文归档的历届成绩,为这段过渡期提供了少数可横向比较的官方记录。

C.2 跨分辨率问题的长期悬置

2018 版设置 SD 与 HD 双分割赛道的直觉理由是「分辨率是临床部署的现实变量」,而当年的结果(SD 与 HD 冠军分属不同团队)显示跨分辨率泛化并非当时方案的强项。这个问题在其后多年仍是息肉分割的活跃议题:模型在 574×500 训练、到 1920×1080 部署时的尺度失配,需要多尺度训练、滑窗推理或分辨率适配层等工程手段。GIANA 的双档数据为此提供了现成的实验材料——「SD 训练 → HD 测试」与「HD 训练 → SD 测试」两个方向的不对称性,本身就是值得一测的方法学问题。

C.3 鲁棒性转向:从 Giana-C 看评测的第二曲线

Giana-C(arXiv:2011.07631 / MedIA 2024)代表的鲁棒性评测路线,回应的是深度分割模型在真实部署中「训练分布之外性能骤降」的普遍痛点:内镜图像的亮度波动、散焦、液体遮挡、压缩伪影在真实检查室中不可避免,而常规基准(干净测试集)无法预测模型在这些退化下的表现。Giana-C 用 15 种损坏类型 × 2017 版 1,812 张原图的组合,把「退化压力测试」标准化——这与自然图像领域的 ImageNet-C、医学影像社区后来的多个 -C 变体同构。GIANA 数据因此获得了第二生命:从分割基准扩展为鲁棒性基准,且这条引用线不依赖赛事重启,可持续增长。

附录 D:复现与实验设计清单

以下清单按时间顺序给出在 GIANA 上开展研究的完整动作序列,每步附关键注意点:

  1. 确定届次与赛道:按研究目标对照 6.5 节的三场景取法,写下目标届次、赛道、预期规模(作为下载后核验的对照表)。
  2. 注册与规则接受:走 6.1 节四步流程;注册时保存规则文本副本(供日后 license 引用与团队合规留档)。
  3. 下载与完整性核验:对照官方文档规模逐赛道清点;开放上限数字(>20/>150/>3,500)按实测记录;分辨率抽验(SD 574×500、HD 1920×1080)可快速识别混版。
  4. 划分确认:确认所用划分是官方划分(如 SD 的 300/612)还是自划分;自划分时报告分层变量(息肉尺寸、来源机构——若可得)。
  5. 指标实现:四指标(Dice/PPV/敏感性/HD)按 §5.1 口径实现;HD 注意取 95 百分位还是最坏值需声明(两种口径在文献中并存)。
  6. 基线对表:历届成绩从复盘论文取,注明届次与赛道;不与跨届次、跨划分的成绩直接比较。
  7. 泄漏自查:若同时使用 CVC 系数据训练,检查与 GIANA 训练集的病例重叠可能(同源网络背景下不能假设零重叠);报告时声明数据来源组合。
  8. 报告规范:声明数据版本、划分、指标实现、评测通道(本地 vs 官方提交)四要素;引用 license 时按坑 3 的三层表述。

附录 E:局限性与批判性评估

E.1 获取制度维度

GIANA 最集中的批评点是获取制度:注册墙 + 规则接受的流程把可获取性维度压到 DAIMS 3 分,且 license 明文不公开使「注册之后」仍有合规不确定性。对比同域的 HyperKvasir(公开直链 + CC BY 4.0 + 三通道冗余),GIANA 的每一次使用都必须经过人工身份环节,这使其难以进入自动化流水线(自动基准评测、持续集成中的数据下载、跨实验室自动复现)。这个限制的合理性辩护是医学数据的伦理审慎与使用目的可追溯,但在「可复现性成为论文评审标准」的当下,注册墙数据集的复现验证成本系统性偏高——审稿人无法一键下载核验,只能信任作者的私有副本。

E.2 文档透明度维度

三处文档盲区构成第二类批评:标注协议未系统披露(医师人数、一致性检验、标注工具均无公开记录)、开放上限数字无精确总数(>20/>150/>3,500)、测试标签政策不透明。这些盲区共同造成一个结构性后果:GIANA 的元数据质量依赖口口相传与二手转述,而二手转述正是坑 1-坑 8 里所有混淆的温床。公平地说,GIANA 的一手文档(官网、ITU-T 存照、复盘论文)在其覆盖范围内是清晰的;问题在于覆盖范围之外的空白没有被显式标注——本条目以「待核」清单显式化这些空白,正是对此的补救姿势。

E.3 评测生命周期维度

无常驻 leaderboard 的设计(8.1 节)在防止刷榜的同时,也使 GIANA 失去了「活的」评测基础设施属性:新方法没有官方登记通道,历届成绩之外的后续工作只能自报,跨论文可比性随时间衰减。四大件中 Kvasir-SEG 的情形相反——其官方论文给出明确基线、社区 leaderboard 由第三方维护(非官方但活跃)、样本量更大,因而在近年论文中的出镜率持续高于 GIANA。GIANA 的引用结构因此呈现「早期文献密集、近年以特定角色(视频/胶囊/Giana-C)出现」的长尾形态。

E.4 内容维度

即便只看数据内容,GIANA 也有两点局限应进入使用者的预期管理:其一,各赛道样本量都受赛事周期约束——SD 分割 912 张、HD 分割百余张、视频 18+ 条训练,在「大数据预训练 + 小数据微调」的当代范式下,GIANA 更多扮演评测集与微调集而非预训练语料;其二,视频赛道的 18 条训练视频在时序建模的标准下样本量偏小,视频方向结论应表述为初步证据而非充分验证。这两点不是管理不善,而是赛事驱动模式的内在边界——数据量与赛事注意力周期同构。

附录 F:三个实验设计模板

F.1 模板一:跨源泛化评测(最常用)

目标:度量分割模型在标注风格、设备分布不同的机构间迁移的性能衰减。

设计:训练集用 Kvasir-SEG(rid 112)1,000 张;测试集四件套全测,其中 GIANA SD 612 张与 ETIS-Larib 是分布外测试位,CVC-ClinicDB 是同源校验位(与 Kvasir 无机构重叠但同为基准常客)。报告时按「分布内/同源/分布外」三列组织结果,GIANA 成绩单列并注明官方 612 张测试划分。

注意点:检查训练集与 CVC-ClinicDB 的已知重叠问题(Kvasir-SEG 论文口径);GIANA 不做任何形式的训练集混入(除非论文主题就是跨库联合训练,此时声明联合划分);HD 指标声明百分位口径。

预期产物:一张三列比较表 + 一段跨源衰减分析。此模板是息肉分割论文的通行证实验。

F.2 模板二:鲁棒性压力测试

目标:度量分类/分割模型在成像退化下的性能衰减曲线。

设计:模型在 CAD-CAP(>3,500 张)或 2017 版 1,812 张三分类上训练;评测在两处进行——干净测试集(官方划分)与 Giana-C 变体(15 种损坏类型、2,260 张组合)。报告按损坏类型分组的性能保持率(corrupted / clean 比值),与 Giana-C 论文基准线对表。

注意点:Giana-C 基于 2017 版 1,812 张口径,训练集划分应与其论文对齐(906 张训练口径)以便可比;损坏类型的严重度档位按其论文设置;不把 Giana-C 成绩与六赛道成绩混表(版本语境不同)。

预期产物:按损坏类型的衰减曲线族 + 与基线的鲁棒性排序对比。此模板适合工程化前的模型选型。

F.3 模板三:视频检测与定位双任务评测

目标:验证检测模型在视频流干扰(运动模糊、气泡、蠕动变形)下的稳定性。

设计:训练用 GIANA 2018 视频赛道的 18 条训练视频(可辅以 ldpolypvideo(rid 163)扩量,声明扩充口径);测试用官方 >20 条测试视频,经官方提交通道评测(视频赛道测试标签的公开性按坑 4 确认),指标按赛事公告(视频检测/定位指标以届次页面为准)。

注意点:18 条训练视频的量级决定了从零训练不现实,应采用静态图预训练(Kvasir/CVC 系)+ 视频微调的两阶段;时序平滑模块的消融(有无时序上下文)是此赛道最有价值的消融项;与 ldpolypvideo 的联合训练需声明两库帧率与标注密度差异。

预期产物:双任务成绩 + 时序模块消融表。此模板填补视频息肉检测公开基准稀缺的空白。

附录 G:向组织者提问的标准清单

注册前后,以下八个问题构成向 GIANA 组织者(官网联系渠道)书面咨询的标准清单,按优先级排列:

  1. 当前版本数据的完整 license 条款文本(坑 3 的不可臆测层);
  2. 各届次测试集 ground truth 的释放政策与获取条件(坑 4);
  3. 六赛道名称的官方英文全称与届次对应表(坑 7);
  4. 测试视频、HD 分割、CAD-CAP 的精确总数(坑 8 的开放上限);
  5. 标注协议概要:每图标注人数、一致性检验方式、标注工具;
  6. 视频赛道的采集设备型号、帧率、时长统计;
  7. 2018 版现场颁奖的确认日期(坑 6 双口径);
  8. 2024 AI4PolypNet 新版与老版数据的关系(延续、替代或并行)。

提问纪律:一次邮件一批提出、明确自我身份与研究目的、收到答复后把关键答复原文存档并在论文数据声明中引用——这既是对组织者时间的尊重,也为社区积累公开渠道缺失的文档记录。

附录 H:论文引用自查表

投稿前,用以下五条自查 GIANA 相关表述:

  1. 身份表述:全文检索「GIANA」的每一处出现,确认上下文是胃肠道挑战(坑 1);「GIAnt」一词零出现。
  2. 规模数字:检索 1,812、906、454、452、300、612、600、3,500 全部数字出现处,确认每个数字的届次语境正确(坑 2、坑 8);「>」符号未被删改。
  3. 许可表述:license 相关句子符合三层表述(公开层/条款层/确认层),无 SPDX 代号虚构(坑 3)。
  4. 成绩引用:历届成绩表注明届次、赛道、出处(复盘论文或原团队论文);无跨届次混表(§4.4)。
  5. 数据声明:论文数据可用性声明包含注册获取路径、规则接受事实、版本届次三要素。

五条全过,GIANA 相关表述的可复核性即达到库内条目间互引的基准线。

附录 I:教学场景使用建议

GIANA 适合嵌入三类教学场景,各有一套裁剪方案:

  • 医学影像分割课程实验:取 SD 赛道 300 张训练子集(学生无需触达完整注册流程的部分可由课程统一注册分发——需符合墙内条款,见坑 3)+ 612 张测试子集做标准分割作业;四指标实现本身即为优质编程练习(尤其 HD 的边界距离实现)。
  • 医学 AI 伦理与数据治理研讨:GIANA 是「注册墙模式利弊」的完美案例——同一份数据,效率视角(对比 HyperKvasir 的 8.0 分)与治理视角(使用目的可追溯)给出相反评价;附录 E 的四个维度可作研讨提纲。
  • 赛事史与方法学课程:复盘论文 + 本条目 §4/§8 构成「组织化竞赛作为评测框架」的案例单元;讨论题可设「为什么 GIANA 放弃常驻 leaderboard,你同意吗」。

教学使用的共同前提是先完成教师端的注册与条款确认;课程分发数据的合法性完全继承于墙内条款,不得默认「教育用途自动豁免」。

附录 J:息肉分割四大件逐维对表

J.1 对表本体

把 GIANA 与四大件其余成员做逐维比较(库内已验证数字优先,库外条目只做定性描述):

维度 GIANA(2018 SD) CVC-ClinicDB(rid 133) Kvasir-SEG(rid 112) ETIS-Larib(库外)
标注传统 CVC + Hospital Clinic + Saint-Antoine CVC(Bernal 线) 挪威 Simula/OSMET Saint-Antoine(AP-HP)
规模 300 训练 / 612 测试 196 帧息肉掩码 1,000 图 + 掩码 数百张级(公认小而难)
分辨率 574×500 序列帧原始分辨率 统一后处理尺寸 低分辨率著称
赛事验证 有(2018 官方测试协议) 无(论文固化数据) 无(MediaEval 系挑战关联) 无
视频姊妹数据 有(18/>20 条视频赛道) CVC-ColonDB 序列 无 无
胶囊内镜姊妹数据 有(WCE 双赛道 + CAD-CAP) 无 无 无
获取制度 注册墙 公开 公开直链 公开
库内 DAIMS 光谱 5.2(本条目) (见其条目) 8-9 档(见其条目) 未入库

J.2 对表解读三条

第一,GIANA 是四大件中唯一「赛事验证 + 双姊妹模态」三者兼备的成员:它的 612 张测试划分经过官方协议裁定,且视频与胶囊内镜赛道给了它静态图之外的延伸空间——这使其在「静态分割基准」之外还能服务多模态研究,这是其余三个成员的结构性空白。

第二,获取制度与样本量呈反向关系:样本量最大的 Kvasir-SEG 获取最自由,赛事验证最强的 GIANA 获取门槛最高。这个反向关系提醒使用者按研究阶段选数据:探索期用自由数据快速迭代,发表期用 GIANA 的官方划分做裁定性测试。

第三,ETIS-Larib 的缺席是库内当前的结构性缺口:四大件三个在库、一个缺失,使本条目承担了「替 ETIS 保留席位与谱系说明」的功能(7.7 节)。若未来补齐 ETIS 条目,本节对表可直接扩展为四列全对表。

附录 K:内镜图像伪影图鉴——读 GIANA 数据前的视觉预备

以下八类伪影是内窥镜影像算法文献中反复出现的干扰源,也是 GIANA 视频/静态图数据中实际存在的干扰类型。初读 GIANA 数据前过一遍此图鉴,能显著减少「模型为何失效」的误判:

  • 高光反射(specular highlight):内镜光源在湿润黏膜上的镜面反射,表现为亮斑,常覆盖病变边缘——分割模型的经典失败位,文献中发展了大量高光修复/分离分支。
  • 气泡(bubble):注气与黏液产生的白色泡沫团,形态不规则、边界模糊,与息肉的表观距离时近时远;视频流中气泡随镜头运动漂移,是帧间不一致的主要来源之一。
  • 运动模糊(motion blur):镜头推进/抖动造成的一帧或多帧模糊,视频赛道的主要退化类型;静态图赛道中较少但存在。
  • 视野残缺(out-of-focus / partial view):镜头贴壁或退镜时病灶仅部分入画,检测任务中的边界 case 来源。
  • 液体与残渣遮挡(debris/fluid):肠道准备残余物遮挡视野,遮挡程度与病例准备质量相关,是「中心间分布差异」的成分之一。
  • 低照度与曝光切换(poor illumination):镜头远离黏膜或腔体塌陷时画面变暗,胶囊内镜中小肠段的整体照度偏低是其固有特征(与 CAD-CAP 数据直接相关)。
  • 色彩偏移(color shift):不同设备与白平衡设定下的色调差异,跨中心/跨设备泛化的主要成分之一;Giana-C 的损坏类型中包含此类退化的合成版本。
  • 肠道蠕动变形(peristalsis):黏膜皱襞随蠕动的形态变化,使同一息肉在相邻帧呈现不同外观——视频定位赛道中「位置标注」的时变性的根源。

对教学场景(附录 I),此图鉴可作为学生第一次打开数据前的预读材料:让学生先在图中找出这八类伪影实例,再开始标注/建模练习,能建立「数据先于模型」的直觉。

附录 L:GIANA 数据与临床工作流的映射

L.1 检测类任务映射的阅片现实

GIANA 检测类赛道(视频检测、WCE 检测/定位)映射到临床的真实工作流是「阅片辅助」:胶囊内镜的单次检查产出数万帧、人工阅片以小时计,CAD 系统的定位是预筛与提示——把可疑帧集中呈现给阅片者,压缩初筛时间。这个工作流对算法的要求与学术基准有系统性差异:临床上宁可牺牲敏感性上限也要守住 PPV 下限(提示噪音过大导致阅片者失去信任、反而加速漏阅),而学术基准常以 AUC 或固定阈值敏感性为主指标。使用 GIANA WCE 赛道做工程化的团队,应在官方指标之外补做工作点扫描(阈值-敏感性-PPV 曲线),这一建议同样出现在库内 kvasir-capsule(rid 123)条目的评测讨论中。

L.2 分割类任务映射的处置现实

分割赛道映射的临床场景是「病灶测量与切除规划」:息肉尺寸分级(决定随访间隔)、边界判断(决定整块切除可行性)都依赖像素级轮廓。HD 赛道的临床意义在此凸显——高清设备下的小息肉边界信息是 SD 采集无法提供的。使用 GIANA 分割数据的团队若面向临床转化,应把「按息肉尺寸分层报告」加入评测计划(官方指标未分层,但临床语义要求分层),这属于官方协议之外的增值分析,报告时注明。

L.3 分类类任务映射的决策现实

2021 版腺瘤性/非腺瘤性分类映射的是「切除策略决策」:腺瘤性息肉需要更积极的处理与监测。这个任务在临床上对应光学诊断(optical diagnosis)方向——内镜医师不经活检、直接以镜下特征判断息肉性质。GIANA 把这个任务引入赛事,时间上与光学诊断临床证据的积累同步;对研究者,这提示了数据的一个潜在用法:把分类赛道输出与医师光学诊断做一致性对比(后者数据不在 GIANA 内,属增值研究方向,需另行获取临床对照)。

附录 M:版本迁移指南

M.1 从 2017 版迁移到 2018 版

2017 版使用者(1,812 张三分类语境)迁移到 2018 版时的变化清单:任务从单一三分类变为多赛道(三分类语境由 WCE 检测/定位 + CAD-CAP 承接);数据组织从单一池变为按赛道分发;规模口径从封闭数字变为「封闭 + 开放上限」混合(坑 8);训练划分不再有 906/454/452 式的文档化三段划分(各赛道自带划分)。迁移检查:代码中所有「1,812」「906」常量需替换或按版本分支处理;若论文需要复现 2017 口径基线,保留 2017 版数据包而不做原地覆盖。

M.2 从 2018 版迁移到 2021 版

2021 版新增分类赛道不替代 2018 版任务:迁移不是替换而是追加。注意 2021 版数据获取走对应届次页面,账号体系与 2018 版注册互不继承(若两个版本都需要,分别注册);分类任务(腺瘤性/非腺瘤性)的标签语义与 WCE 三分类(正常/炎症/血管病变)完全不同,代码层面不要复用标签映射。

M.3 从 GIANA 老版迁移到 2024 AI4PolypNet

AI4PolypNet 的任务组织与老版的关系,本条目不做未实抓的断言(A.6 节)。迁移检查动作:对比新老站点规则文本的差异、确认新版数据的 license 语义是否延续老版表述、检查引用格式——2024 年后发表的工作若使用新版数据,引用 AI4PolypNet 而非 GIANA 历届页面。

附录 N:获取后的数据组织建议

下载数据包后的本地组织建议(适用于团队共享盘或内部镜像):

  1. 目录按「届次/赛道」两级组织:顶层 2015/2017/2018/2021 分目录,其下按赛道分目录——绝不在顶层把不同届次文件混放(坑 2 的本地防线)。
  2. 保留原始包与校验记录:解压前的原始包存档 + 下载日期 + 官方页面快照(规则文本),三件套齐备后才开始解压使用。
  3. 规模核验表落地:按附录 D 第 3 步的实测结果建表(赛道 × 实测数量 × 官方口径 × 差异说明),作为团队共享的「本地真值表」。
  4. 只读原则:原始数据目录设只读,实验脚本的预处理输出另立目录——GIANA 的官方划分(300/612 等)是论文可比性的底线,预处理覆盖原始划分是常见事故源。
  5. 版本常量集中管理:实验代码中的届次、划分、分辨率常量集中在单一配置文件,禁止散落硬编码——跨版本实验时一处切换。

附录 O:常见问题排查手册

下载与使用环节的高频问题与处理路径:

  • 解压后目录结构与文档描述不符:先核对下载届次(混版是第一嫌疑,坑 5);确认无误后再核对官网该届次的 README/说明文件;仍不符时向组织者书面确认(附录 G 清单可复用)。
  • 掩码文件无法读取或全黑:先确认掩码格式(0/255 灰度还是 0/1 二值);再确认读取通道(RGB 转灰度的单通道截取可能吞掉标签值);最后核对图像与掩码的尺寸/命名对应关系。
  • 视频文件解码失败:内镜视频常见封装与编码多样,用 ffmpeg 探测实际编码参数;帧率信息缺失时(坑 8 相关)以实际探测为准并记录,不假设文档值。
  • 测试集无标签文件:大概率是测试标签届内保密或未随包发放(坑 4)——按官方评测通道提交评测,勿在无标签测试集上「目测建模」。
  • 本地数量与官方数字对不上:区分「封闭数字不符」(300/612/600 类,异常信号,查混版)与「开放上限不符」(>20/>150/>3,500 类,实测即真相,记录实测值)。
  • 注册后未收到数据链接:检查规则接受步骤是否完成(6.1 第 2 步)、平台站内信与注册邮箱两处通知、垃圾箱;超时未到走官网联系渠道。

附录 P:两大挑战生态的组织方式对比——GIANA 系 vs MediaEval/BioMedia 系

P.1 对比的由来

胃肠道内窥镜数据集的两大主要来源各自带着不同的赛事基因:CVC 系(GIANA、CVC-ClinicDB 谱系)生长于 MICCAI EndoVis 体系,挪威系(Kvasir 家族)生长于 MediaEval/BioMedia 体系。两系的组织方式差异塑造了各自数据集的不同气质,值得专节对比(挪威系与 MediaEval 的关联为库内 hyperkvasir 条目已验证事实:Kvasir v1 为 MediaEval 2017 Medico 挑战指定数据、Kvasir v2 服务 MediaEval 2018 与 ACM MM 2019 BioMedia)。

P.2 五维对比

维度 GIANA 系(CVC/EndoVis) Kvasir 系(MediaEval/BioMedia)
挂靠传统 MICCAI EndoVis Workshop 子挑战 MediaEval / ACM Multimedia 系列研讨挑战
数据发放 注册墙 + 届次页面 公开直链 + 论文随附
任务演进 检测→定位→分割→分类的赛道分化 分类层级扩展→分割专题(Kvasir-SEG)→超大规模(HyperKvasir)
成绩归档 官方复盘论文(届终归档) 挑战年会论文 + 后续独立基准论文
长期可获取性 依赖平台账号体系,版本随届次分散 多通道冗余,单一入口聚合

P.3 对比的含义

两系模式各为社区提供了不可互相替代的服务:EndoVis/GIANA 系证明了制度性评测(测试隔离、官方裁定、届终复盘)可以达到的严格上限;MediaEval/Kvasir 系证明了开放性分发(零门槛、多冗余、大样本)可以达到的便利上限。研究者对两者的正确姿势不是二选一,而是按研究阶段切换:方法探索期用开放系快速迭代,结论裁定期用 GIANA 的官方划分与赛事验证数据收尾。这也是本条目把「光谱两端对照」(GIANA 5.2 vs HyperKvasir 8.0)作为核心互链的方法论根据。

附录 Q:数据卡片字段速查

机器可读风格的字段速查卡,供数据管理系统编目直接取用:

  • dataset_name:GIANA — Gastrointestinal Image ANAlysis Challenge
  • host_platform:Grand-Challenge(giana.grand-challenge.org);2024 新版入口 pages.cvc.uab.es/ai4polypnet/
  • organizers:CVC-UAB;ETIS-ENSEA;Hospital Clinic de Barcelona;Hôpital Saint-Antoine AP-HP
  • key_persons:Jorge Bernal(息肉赛道);Aymeric Histace(WCE/CAD-CAP 赛道)
  • editions:ISBI 2015;MICCAI 2015;MICCAI 2017(首冠名);MICCAI 2018 EndoVis(六赛道);MICCAI 2021(+分类);2024 AI4PolypNet
  • tasks_2018:video-polyp-detection;video-polyp-localization;polyp-seg-SD;polyp-seg-HD;wce-angiodysplasia-detection;wce-angiodysplasia-localization
  • splits:SD 300/612;WCE 检测 600/600;WCE 定位 600/600;2017 版 906/454/452;2021 分类 1,000/200
  • open-ended_counts:视频测试 >20 条;HD 训练 >150 张;CAD-CAP >3,500 张
  • annotations:像素级掩码(分割);视频/帧级标记(检测定位);图像级标签(检测/CAD-CAP/分类)
  • metrics:Dice;PPV;sensitivity;Hausdorff distance(分割);AUC(分类)
  • access:registration-gated;challenge-rules-acceptance;no-public-mirror
  • license_status:明文条款注册墙内未实抓;公开层研究用途定性表述
  • official_review_paper:Journal of Imaging 2020;6(7):69, doi:10.3390/jimaging6070069
  • robustness_benchmark:Giana-C,2,260 张,15 损坏类型(arXiv:2011.07631 / MedIA 2024)
  • related_in_library:rid 79/193/133/142/112/693/75/163/183/203/123/398/418
  • known_confusions:GIANA vs GIAnt 名称混淆;2017 vs 2018 规模嫁接;开放上限精确化

延伸阅读与社区资源

以下资源按「官方一手优先」原则排列,全部为一手或官方背景来源:

  1. GIANA 官网(giana.grand-challenge.org):任务定义、规则、历史页、获取入口的一手来源。
  2. Journal of Imaging 2020;6(7):69(doi:10.3390/jimaging6070069):历届冠军方案复盘,「竞赛即评测」方法学的正式文本。
  3. arXiv:2011.07631(期刊版 Medical Image Analysis 2024):Giana-C 鲁棒性基准的出处,兼为 2017 版 1,812 张口径的权威转述。
  4. ITU-T FG-AI4H DEL10.20 文档:2018 版六赛道规模数字的独立官方背景存照。
  5. CVC 官方新闻页(经官网与 CVC 站点存照):2018 冠军名单与 SFED 赞助细节。
  6. AI4PolypNet 站点(pages.cvc.uab.es/ai4polypnet/):2024 再启动的新入口。
  7. 库内条目互链:见 9.2 节跳转地图与尾部事实核查清单的 rid 对照。

不收录任何第三方数据搬运链接(纪律见 6.3 节);学术二手解读类资源因质量参差且时效衰减,亦不列表,读者可循上述一手链条自行延伸。

FAQ:常见问题扩展解答

FAQ-1:GIANA 数据可以用于商业项目吗?

公开层面无法给出肯定或否定答案:官网公开页只有研究用途定性表述,完整条款在注册墙内。商业可行性问题应在注册查阅条款原文后,必要时以书面形式向组织者确认;在此之前按「不可假设」处理(6.2 节三层表述)。

FAQ-2:为什么 GIANA 在 Hugging Face 上搜不到官方版本?

因为官方从未发布 HF 镜像——数据分发制度选择注册墙而非公开镜像(6.1、6.3 节)。搜到的第三方包版本对齐性无从验证,不建议作为研究数据源。

FAQ-3:做息肉分割论文,GIANA 测试集该用 612 张官方划分还是自己划分?

优先官方划分(300/612),这是赛事验证的可比性资产;自划分仅在研究设计与官方划分冲突时使用,且必须显式声明(附录 D 第 4 步、附录 F 模板一)。

FAQ-4:GIANA 的 HD 分割赛道为什么没有官方测试数字?

官方文档对 HD 赛道只给出「>150 张训练」的开放上限表述,测试协议细节未以公开文档形式完整披露。引用时保留「>」符号,精确总数以实测与官方确认为准(坑 8)。

FAQ-5:可以把 GIANA 和 Kvasir-SEG 的训练集合并训练吗?

技术上可行,方法学上需要声明:两库无机构重叠,合并训练不影响「跨源测试」的成立,但会改变「在 Kvasir-SEG 上训练」这一标准设置的语义。合并训练的论文应同时报告单一来源与合并来源两组结果(附录 F 模板一的注意点)。

FAQ-6:GIANA 成绩和 Kvasir-SEG 成绩能直接比大小吗?

不能笼统比较:两者数据规模、采集分布、标注风格不同;同一模型在两库上的成绩差是「跨源衰减」的度量而非模型优劣的排名。可比性只在「同一模型、同一协议、多库成表」的框架内成立。

FAQ-7:视频赛道只有 18 条训练视频,够用吗?

不够从零训练,但足够做「静态图预训练 + 视频微调」范式下的微调与评测(附录 F 模板三)。18 条的量级本身就是结论边界的一部分——视频方向的结论应表述为初步证据。

FAQ-8:CAD-CAP 的三类标签能当病理分类用吗?

不能:正常/炎症/血管病变是阅片行动分组(附录 B.3),不是病理学分类。需要病理级标签的研究应另选数据源。

FAQ-9:Giana-C 是官方数据集吗?

Giana-C 是第三方构造的变体(arXiv:2011.07631 团队),基于 GIANA 2017 版 1,812 张原图合成损坏,不是 GIANA 官方发布物。引用时应区分「GIANA(官方)」与「Giana-C(第三方衍生)」两个名称。

FAQ-10:2018 年的冠军方法有开源代码吗?

官方记录未系统归档各参赛队的开源情况;复盘论文收录方法描述。复现建议以论文方法描述为纲,不假设代码可得;引用成绩时引用复盘论文而非第三方复现仓库。

FAQ-11:新注册用户能拿到历年所有版本的数据吗?

各届次页面的发放政策随届次与平台状态而定,本条目未对「历史版本全部可下载」做实抓确认。注册后以届次页面实际可见的下载项为准(附录 G 清单第 8 问可一并询问组织者)。

FAQ-12:GIANA 数据适合做弱监督/半监督研究吗?

任务结构上有适配空间:视频检测赛道的视频级标记天然适合弱监督时序定位研究;图像级标签(WCE 检测)与像素级掩码(分割赛道)的并存也为「图像级监督 + 像素级验证」设计提供了同源材料。但注意:视频级与帧级标记的精确对应关系未在官方文档中系统披露,使用前按附录 G 清单第 5、6 问确认。

FAQ-13:引用 GIANA 时作者怎么写?

官方复盘论文的作者列表(Guo S, Bernal J, … Matuszewski BJ)适用于方法学引用;数据本体的引用格式以官网届次页面的推荐引用为准(Grand-Challenge 平台常设 citation 栏目)。不要把复盘论文作者当成数据集作者转写。

FAQ-14:本条目的「待核」事项什么时候能补齐?

条目维护计划见下节:待核 4 项(license 明文、测试标签公开性、现场日期、赛道命名)需要官方渠道确认或下一轮实抓;任何一项补齐都会在事实核查清单中留下版本痕迹。

事实核查清单

本条目全部硬事实的出处对照(编号供编辑部与后续维护者引用):

# 事实 出处 状态
1 GIANA = Gastrointestinal Image ANAlysis(胃肠道) 官网 + ITU-T DEL10.20 + CVC 新闻页(三源) 已验证
2 非「甲分析/GIAnt」 同上三源反证 已证伪存照
3 主办四方机构 官网 + ITU-T DEL10.20 已验证
4 版本链 2015→2017→2018→2021→2024 官网历史页 + ITU-T DEL10.20 已验证
5 2017 版 1,812 张、906/454/452 arXiv:2011.07631 引用口径 已验证
6 2018 视频检测 18 条训练 / >20 条测试 ITU-T DEL10.20 已验证
7 2018 SD 分割 300/612、574×500 ITU-T DEL10.20 已验证
8 2018 HD 分割 >150 张、1920×1080 ITU-T DEL10.20 已验证
9 WCE 检测 600/600、定位 600/600 ITU-T DEL10.20 已验证
10 CAD-CAP >3,500 张三分类 ITU-T DEL10.20 已验证
11 2021 分类赛道 1,000/200 官网 2021 页 已验证
12 SFED 赞助 12 奖项 2,000€ CVC 官方新闻页 已验证
13 KM/Satoshi Kondo 三冠 CVC 官方新闻页 已验证
14 ODS AI / Penguin AI / OUS / FanVoyage 获奖名单 CVC 官方新闻页 已验证
15 2018 时间线(5-23 训练发放 / 7-20 测试发放 / 9-03 截止) 官网存照 已验证
16 现场颁奖 2018-09 Granada 官网 + 大会日程交叉 双口径存照
17 指标组合 Dice/PPV/敏感性/HD、AUC 官网 evaluation 页 已验证
18 复盘论文 doi:10.3390/jimaging6070069 DOI 解析 + 官网推荐 已验证
19 Giana-C 2,260 张 / 15 损坏 arXiv:2011.07631 已验证
20 注册墙获取、无公开直链 官网实抓 已验证
21 无官方 HF 镜像 hf-mirror.com 检索 已验证
22 license 明文条款内容 (注册墙后) 待核 1
23 测试标签公开性 — 待核 2
24 现场日期精确值 — 待核 3(双口径)
25 六赛道官方英文名全称 — 待核 4
26 标注协议细节(人数/一致性/工具) — 官方未披露
27 无常驻 leaderboard 官网观察 + 复盘论文语境 已验证
28 息肉分割四大件并列地位 社区文献通例 + 复盘论文语境 已验证

术语表

  • angiodysplasia(血管扩张):胃肠道黏膜下血管异常扩张的病变,胶囊内镜阅片的关键排查目标;GIANA WCE 双赛道的病灶对象。
  • AUC:ROC 曲线下面积,GIANA 分类类赛道的主指标,对类别不平衡不敏感。
  • CAD-CAP:2018 年与 GIANA 并轨的胶囊内镜计算机辅助检测挑战及其训练库(>3,500 张三分类)。
  • CVC-UAB:巴塞罗那计算机视觉中心,GIANA 主办方与 CVC 系数据集的标注工程主体。
  • Dice 系数:两掩码交集两倍除以两者之和的重叠度指标,分割评测的第一指标。
  • EndoVis:MICCAI 的内窥镜视觉挑战工作坊系列,GIANA 自 2018 年起挂靠其下。
  • ETIS-ENSEA:法国 Cergy 的实验室/工程师学院,GIANA 主办方之一,Aymeric Histace 所在机构。
  • Giana-C:第三方构造的 GIANA 损坏变体基准(15 损坏类型、2,260 张),鲁棒性评测工具。
  • GIAnt:与 GIANA 无关的另一挑战名称(甲分析语境),坑 1 的混淆源。
  • Grand-Challenge:GIANA 官网所在平台,注册墙与规则接受流程的载体。
  • HD(分割赛道语境):high definition,1920×1080 高清分割赛道,与 Hausdorff 距离的 HD 缩写同形异义——按上下文区分。
  • Hausdorff 距离(HD):两边界点集的最坏距离指标,惩罚边界离群误差;文献中另有 95 百分位口径(HD95),报告时需声明。
  • Hospital Clinic de Barcelona:巴塞罗那临床医院,GIANA 的临床数据与标注来源之一。
  • Hôpital Saint-Antoine AP-HP:巴黎公共医院系统成员医院,GIANA 主办方之一,ETIS-Larib 的出品方。
  • Jorge Bernal:CVC 研究者,GIANA 息肉赛道核心组织者,CVC-ClinicDB/ColonDB 论文常驻作者。
  • Kvasir-SEG:挪威系 1,000 张息肉分割数据集(rid 112),GIANA 的跨源对照与四大件同席。
  • leaderboard(常驻排行榜):GIANA 不维护的届终即停评测制度,见 8.1 节利弊分析。
  • MICCAI:医学影像计算与计算机辅助干预年会,GIANA 系列的主要挂靠会议。
  • PPV(精确率):预测阳性中真阳性的比例,控制过度分割与误报。
  • 敏感性(sensitivity/召回率):真值被覆盖的比例,控制漏检;临床权重通常高于 PPV。
  • 注册墙(registration gate):注册 + 规则接受后才发放数据的获取制度,GIANA DAIMS 低分的直接原因。
  • SD(分割赛道语境):standard definition,574×500 标清分割赛道,四大件席位本体(300/612)。
  • SFED:法国消化内镜学会,2018 版奖项赞助方(12 奖项 / 2,000€)。
  • WCE(wireless capsule endoscopy):无线胶囊内镜,低照度、被动视野的小肠成像模态。
  • AI4PolypNet:GIANA 系列 2024 年的再启动形态与新站点名称。
  • 复盘论文:Journal of Imaging 2020;6(7):69 的俗称,历届冠军方案与竞赛方法学的官方归档。
  • 开放上限数字:官方文档中带「>」的数量表述(>20/>150/>3,500),不可精确化转写(坑 8)。
  • 双口径:同一事实存在两个有据可依的表述版本(如现场日期),正文取模糊化处理并存照的策略。
  • 四大件:息肉分割论文比较表的常客集合——CVC-ClinicDB、Kvasir-SEG、ETIS-Larib、GIANA。
  • 光谱(DAIMS 光谱):库内条目按 AI-Ready 五维得分的排序参照系,GIANA 位于注册墙档(5.2)。

尾注与来源说明

  1. 本条目事实链的三条主干:GIANA 官网(任务/规则/历史/获取)、ITU-T FG-AI4H DEL10.20(2018 六赛道规模独立存照)、Journal of Imaging 2020 复盘论文(方法学与历届成绩归档)。三者互证记录见 FACTS 档案与上表。
  2. CVC 官方新闻页信息(冠军名单、SFED 赞助)经官网与 CVC 站点交叉存照;新闻页 URL 随平台改版可能失效,事实以上表编号 12-14 为准。
  3. arXiv:2011.07631 的期刊版发表于 Medical Image Analysis 2024;两版本引用任选其一,数字口径以期刊版为最终版。
  4. 2018 现场日期双口径、六赛道命名口径、license 明文、测试标签公开性四项的存照状态见事实核查清单编号 16、22-25,正文相关表述均已按存照口径模糊化。
  5. 库内互链条目的 rid 以本条目写作会话的只读查询为准(FACTS 档案 §8);后续条目变更以编辑部归一化为准。
  6. 本条目不收录第三方数据搬运与镜像链接;任何「GIANA 下载」类第三方页面均不构成官方分发渠道。
  7. 抓取时点:2026-09-27。官网改版后请以事实核查清单为索引做增量再验证。

条目维护与再验证计划

本条目的维护按以下触发条件执行增量再验证:

  • 待核 1(license 明文):编辑部或后续维护者完成官网注册并核对条款文本后,补写 6.2 节第三层并在事实核查清单编号 22 落「已验证」;在此之前任何来源的条款转述不得入库。
  • 待核 2(测试标签):官方发布测试标签政策声明或届次页面更新后更新坑 4 与编号 23。
  • 待核 3(现场日期):官方最终版页面确认精确日期后,统一替换正文的模糊表述并保留双口径存照注释。
  • 待核 4(赛道命名):取得官方英文全称对照表后,更新 §1 问 2 表格的赛道名列并关闭编号 25。
  • 2024 AI4PolypNet 线:新站点任务组织与数据规模实抓后,为本条目增补 A.6 节的规格细节,或按编辑部判断另立新条目并在两处互链。
  • 通用节奏:官网结构性改版、库内 rid 归一化变更、相关新条目(如 ETIS-Larib)入库时,触发本条目互链与对表节(附录 J)的增量更新。

编者后记:正名纠错的过程存照

本条目的写作从一次真实的纠错开始:任务简报最初将 GIANA 猜测为「指甲分割/甲银屑病(GIAnt Nail Analysis)」方向的数据集。写作代理按存在性核验纪律进行三轮精确搜索,依次取得三重证据——ITU-T FG-AI4H DEL10.20 官方文档的挑战条目、CVC 官方新闻页的赛事报道、GIANA 官网的任务描述——三源一致指向胃肠道定义,猜测被证伪,slug 就地改道确认,正名存照写入 FACTS 档案与本条目 §1 问 1、坑 1。

这个开场决定了本条目的两个写作原则。其一,存照优先于整洁:所有口径分歧(规模、日期、命名)不以「编辑判断」静默取舍,而是双口径并录、模糊化正文、待核清单显式化——条目的可维护性比表面的确定性更有价值。其二,负面知识正面写:名称混淆、版本嫁接、license 臆测这些「不该做什么」,以八坑四段式进入正文,因为本条目写作过程中真实踩过的坑,大概率也是读者会踩的坑。

行文至此,回到 §11 的一句话定位:GIANA 是内容上被低估、获取上被高估的数据集。愿这份条目帮助读者把「低估」与「高估」都校准回事实本身。

引用本条目

推荐引用格式(数据条目):

千方病案医数集编辑部(agentA-aptos 执笔). GIANA 胃肠道图像分析挑战数据集 — AI-Ready Wikipedia. 千方病案医数集, 2026. https://www.qianfanghub.com/ai-ready-dataset/giana/700

数据本体引用请按「延伸阅读」第 1-3 条选择官方渠道格式;方法学引用使用复盘论文 DOI(doi:10.3390/jimaging6070069);鲁棒性基准引用使用 arXiv:2011.07631。

(本条目完,抓取时点 2026-09-27,写作代理 agentA-aptos。)

附录 R:信任层级——竞赛数据、论文数据与第三方转述

R.1 三层信任结构的定义

使用 GIANA 相关信息时,信息来源存在清晰的信任层级。第一层(官方一手):官网届次页面、官方规则文本、ITU-T FG-AI4H 存照文档、官方复盘论文——这一层的信息有制度责任背书,可直接引用。第二层(同行评审的独立转述):使用 GIANA 数据发表论文对数据规格的描述——可信度较高但存在转述误差与届次混用风险,引用前应回溯到第一层核对数字。第三层(博客、教程、数据站点卡片、AI 生成内容):无制度责任的转述——本条目调查中发现的「指甲挑战」错误、「1,812 张用于息肉分割」的嫁接表述,均在这一层流行。

R.2 层级间典型误差的实测记录

本条目写作过程实测的两条层级间误差值得记录为案例:其一,任务简报(写作指令层,属第三层性质)对 GIANA 的方向性误判——三字母之差引向完全错误的领域,说明名称级别的断言必须降级到第一层核验;其二,社区通行的「1,812 张 GIANA」表述在第一层语境中是 2017 版胶囊内镜三分类,而在部分第二层论文中已被转述为泛化的「GIANA 数据集规模」——数字本身没错,语境错位使其成为坑 2 的持续来源。

R.3 操作规范

给定三层结构,操作规范收敛为三条:引用数字与身份表述时只用第一层;使用第二层时附回溯验证(数字、划分、指标三要素与第一层对表);第三层内容一律不直接引用,只作为线索去第一层找证据。本条目的八坑清单,本质上是这三条规范违反情况的经验分布图。

附录 S:以 GIANA 为轴心的六种数据组合策略

把 9.2 节的跳转地图升级为可直接套用的组合策略,每种组合给出动机、配置与已知风险:

  • 组合一「四大件全测」:Kvasir-SEG(训练)+ CVC-ClinicDB / GIANA SD / ETIS-Larib(测试)。动机:进息肉分割论文的比较表。风险:CVC 系与 GIANA 的同源性削弱「分布外」声明强度;对策是同源簇分析(7.2 节)。
  • 组合二「跨源泛化」:GIANA SD(训练)+ Kvasir-SEG(测试),反向亦然。动机:度量标注风格迁移的方向不对称性。风险:两库分辨率与设备分布差异与标注风格混杂;对策是加 CVC-ColonDB 做中间参照。
  • 组合三「视频双库」:ldpolypvideo(扩量训练)+ GIANA 视频(赛事验证测试)。动机:视频检测方向公开基准稀缺,两库互补。风险:帧率与标注密度差异;对策:附录 F 模板三的声明条目。
  • 组合四「胶囊内镜全链」:kvasir-capsule(预训练)+ CAD-CAP(训练)+ WCE 双赛道(评测)。动机:模态一致、量级递进的完整管线。风险:三库的标签语义不同(附录 B.3),不可直接迁移标签空间。
  • 组合五「鲁棒性套件」:2017 版 1,812 张(训练)+ Giana-C(退化评测)+ 2018 SD(干净泛化参照)。动机:一次训练三份评测维度。风险:版本语境混用(坑 2 的变体);对策:结果表按版本分列。
  • 组合六「sim-to-real」:c3vd 或 simcol3d(预训练)+ GIANA SD + CVC 系(真实微调与测试)。动机:合成数据的完美真值换真实分布的落地检验。风险:域间隙不可量化时的过度声明;对策:报告域间隙指标或至少做特征分布对比。

六种组合的公共纪律:任何组合在论文方法节中的表述顺序应为「届次 → 赛道 → 划分 → 指标」四要素齐备;缺任一要素的组合声明,在审稿中都可能成为可比性质疑点(见附录 T)。

附录 T:审稿人视角——使用 GIANA 的论文常见审稿意见

以下清单整理自息肉分割与内镜影像文献评审中的高频质疑模式,供作者预置回应:

  • 「划分是否官方」:GIANA 成绩与其他论文不可比的常见原因。预置回应:方法节明示官方 300/612 划分(或自划分的理由与分层变量),并引用复盘论文协议。
  • 「是否混用版本」:出现 1,812 张 + 息肉分割组合即触发。预置回应:按坑 2 的版本绑定自查全文数字。
  • 「跨库训练泄漏」:同时使用 CVC 系与 Kvasir 系训练时,审稿人常问两库已知重叠是否排查。预置回应:声明重叠检查方法与结果(哪怕结论是未发现)。
  • 「license 是否允许本文用途」:尤其涉及衍生数据发布或模型商用讨论时。预置回应:数据声明写三层表述(坑 3),必要时附组织者确认函。
  • 「测试评估通道」:视频与 WCE 赛道的测试标签不公开时,审稿人会问成绩如何获得。预置回应:声明官方提交通道或本地复现协议(含标签来源)。
  • 「指标口径」:HD 未声明百分位口径、AUC 未附工作点指标是常见扣分点。预置回应:附录 D 第 5 步的声明条目。
  • 「规模数字出处」:开放上限数字(>20/>150/>3,500)被精确化转写会触发数据完整性疑问。预置回应:保留官方表述 + 附实测记录。

七条意见的共同底层逻辑:GIANA 的赛事属性使审稿人对「协议细节」的期待高于普通数据集——这既是负担,也是把论文评测严谨性做成卖点的机会。

附录 U:缩写与命名规范

引用与写作 GIANA 相关内容时的缩写纪律:

  • GIANA:全大写,展开为 Gastrointestinal Image ANAlysis Challenge;不写「Giana challenge」「giana dataset」混大小写(平台 slug giana 是 URL 语境,不是名称正写)。
  • SD / HD:仅在赛道语境下作 standard definition / high definition 缩写;与 Hausdorff distance 的 HD 冲突时,分割指标写全称或 HD 距离,赛道写 SD 赛道 / HD 赛道。
  • WCE:wireless capsule endoscopy;首次出现给全称;与「胶囊内镜」中文混用时保持一一对应。
  • CAD-CAP:连字符保留,全大写;作为 2018 年并轨挑战名使用,不与「CAD 系统」泛称混用。
  • AI4PolypNet:官方拼法(A-I-4-P-o-l-y-p-N-e-t),不简写为「A4P」等自造缩写。
  • 届次表述:年份 + 会议(如「MICCAI 2018 版」「EndoVis 2018」),不使用「GIANA v3」这类社区自造版本号——官方无版本号体系,自造编号会成为新的混淆源(与坑 7 同构)。
  • 中文语境:「胃肠道图像分析挑战」为推荐译名;「胃肠图像分析」「GIANA 挑战」可接受;避免「肠胃挑战」一类口语化变体进入正式文本。

附录 V:核验日志——三轮精确搜索的过程存照

按写作纪律,本条目的存在性核验采用三轮精确搜索、三源互证。完整过程存照如下,供后续维护者复现核验路径:

V.1 第一轮:身份核验(正名)

  • 动作:以「GIANA challenge」「Gastrointestinal Image ANAlysis」为关键词做精确检索,并行以「GIANA nail」「GIAnt」做反向对照检索。
  • 结果:正向检索命中官网(giana.grand-challenge.org)与 ITU-T FG-AI4H DEL10.20 文档条目,任务描述一致指向胃肠道(息肉 + 胶囊内镜血管扩张);反向检索确认 GIAnt 是独立挑战名称,与 GIANA 无组织或数据关联。
  • 结论:正名成立——GIANA 是胃肠道挑战;任务简报的指甲方向猜测证伪。

V.2 第二轮:规格核验(规模与时间线)

  • 动作:在官网历史页与 ITU-T 文档中定位 2018 版六赛道规模、2017 版 1,812 张口径、2021 版分类赛道规模、2024 新入口。
  • 结果:六赛道封闭数字(300/612、600/600×2)与开放上限(>20/>150/>3,500)在两源一致;1,812 张口径由 arXiv:2011.07631 的引用文字补强;2021 规模(1,000/200)见官网 2021 页。
  • 结论:规格数字双源互证成立;「1,812 vs 六赛道」确认为版本差异而非矛盾,录入双口径存照。

V.3 第三轮:冠军与生态核验

  • 动作:检索 2018 冠军名单、SFED 赞助细节、复盘论文 DOI、Giana-C 规格。
  • 结果:CVC 官方新闻页给出完整获奖名单(KM 三冠、ODS AI、Penguin AI、OUS、FanVoyage)与赞助细节;doi:10.3390/jimaging6070069 解析正常且与官网「官方推荐读法」表述一致;arXiv:2011.07631 给出 Giana-C 2,260 张 / 15 损坏类型规格。
  • 结论:冠军榜与生态引用链闭环;三条一手主干(官网、ITU-T、复盘论文)齐备,FACTS 档案落盘。

V.4 未在公开渠道核得的事项

  • license 明文条款(注册墙内);测试标签释放政策;2018 现场颁奖精确日期(官网早期页与大会日程两口径并存);六赛道官方英文全称对照表。四项录入待核清单(事实核查表编号 22-25),正文按存照口径处理。

附录 W:谣言-事实对照表

把散落在八坑与正文各节的澄清汇成一张快查表,供快速反驳场景使用:

流传说法 事实 详见
GIANA 是指甲分割/甲银屑病数据集 错。GIANA 是胃肠道图像分析挑战(息肉 + 血管扩张),GIAnt 才是甲分析语境且与之无关 坑 1
GIANA 数据集有 1,812 张图像 半对。1,812 张是 2017 版胶囊内镜三分类口径;2018 版六赛道另成体系 坑 2
GIANA 采用 CC BY 4.0 / 仅限学术 无据。license 明文在注册墙后,公开层仅研究用途定性表述 坑 3
测试集标签随挑战结束公开发布 未证实。释放政策以官方规则为准,公开渠道无系统确认 坑 4
Hugging Face 上有 GIANA 官方镜像 无。官方从未发布 HF 镜像,检索命中的均为第三方搬运 坑 5
2018 颁奖是 9 月 1 日 / 9 月中旬 两口径并存(官网早期页 vs 大会日程),正文用「2018 年 9 月 Granada」 坑 6
六赛道有官方统一英文名表 待核。现有页面间存在命名措辞差异,以功能组合定位为准 坑 7
GIANA 有 21 条测试视频 / 151 张 HD / 3,500 张 CAD-CAP 错。官方口径是开放上限(>20/>150/>3,500),精确化转写是失真 坑 8
GIANA 有官方基线代码 无。官方基线观是「竞赛即评测」,技术读法以复盘论文为准 §4.1
GIANA 成绩可以和 Kvasir-SEG 直接比大小 不能笼统比。跨源成绩差是泛化度量而非排名 FAQ-6
GIANA 是某个静态数据集的名字 不完整。GIANA 是跨五届滚动的赛事系列,引用须带届次 §2.1
CAD-CAP 三分类是病理分类 错。是阅片行动分组(正常/炎症/血管病变),非病理级标签 FAQ-8

附录 X:基础模型时代,赛事数据的新角色

X.1 从「训练+评测」到「评测为主」的位移

2024 年以来,医学影像领域的通用视觉模型与多模态大模型快速进入内窥镜方向,「大数据预训练 + 小数据评测」的分工把 GIANA 这类赛事数据的重心推向评测端:其样本量不足以参与基础模型预训练,但其「测试集隔离 + 指标预先统一 + 官方裁定」的评测基因,恰好是基础模型时代最稀缺的资产——当模型能力宣称越来越多、可对标的公共协议越来越少时,有制度背书的评测集价值上升。

X.2 零样本/少样本评测的新用法

基础模型在 GIANA 上的新兴用法是零样本/少样本协议:不做任何微调(或仅用极少量样本),直接在 SD 612 张官方测试划分上评测,与历届全监督冠军成绩对比。这类对比的解读需要克制——全监督成绩与零样本成绩的差距混合了「数据利用效率」与「任务定义差异」两种因素——但作为方向性参照,它使 GIANA 的历届归档成绩获得了第二生命:从「全监督方法的排行榜」变为「监督强度的标尺」。

X.3 Giana-C 与模型评估的深化

在鲁棒性维度,Giana-C 的 15 损坏类型设计对基础模型评测同样适用:大模型的「鲁棒性神话」(所见即所知)需要在标准化退化下检验。GIANA 数据的两条引用线(分割基准 + 鲁棒性基准)在基础模型时代并行不悖,且互为补充——干净测试划分度量能力上限,损坏变体度量能力下限。

X.4 对数据集建设者的启示

GIANA 在基础模型时代的角色位移,给后续数据集建设的启示是:评测制度的长期价值可能超过数据规模本身。样本量竞赛(更大、更多、更全)正在被基础模型的预训练语料吞并,而「可裁定的评测协议」不会被吞并——GIANA 用注册墙和届终复盘保住的协议严肃性,正是它穿越技术代际的护城河。

附录 Y:获取后的首个 72 小时——从下载到首个基线

给拿到数据链接的团队一份以小时计的实操路线:

第 1 小时块:入库与核验(约 3-4 小时)

下载全部数据包后,按附录 N 的目录规范落地;逐赛道跑数量核验(附录 D 第 3 步);抽验分辨率(SD 574×500、HD 1920×1080);对掩码做单通道值域检查(0/255 还是 0/1,附录 O 排查项)。产出:规模核验表 v1。此阶段的目标只有一个——确认拿到的是「认为拿到的」那个版本。

第 2 小时块:基线复现(约 8-12 小时)

选定一个标准分割架构(U 形编解码系即可)在 SD 300 张训练划分上训练;在 612 张官方测试划分上按四指标评测;把成绩与复盘论文的历届区间对表,确认数量级合理(数量级异常通常指向划分误解或指标实现错误)。产出:内部基线报告 v1。此阶段不看榜、不调参——只建立「自己环境里的地面真值」。

第 3 小时块:扩展评测(按研究方向选线)

按附录 F 三模板之一展开:跨源泛化线(接入 Kvasir/CVC 系)、鲁棒性线(接入 Giana-C)、视频线(接入 ldpolypvideo)。产出:与研究方向匹配的扩展评测设计。72 小时的终点不是最优模型,而是一套可复核的实验地基——届次、划分、指标、通道四要素全部有据可查。

版本修订记录

本条目自身的修订痕迹记录(供编辑部与后续维护者续写):

版本 日期 变更 执行者
v1.0 2026-09-27 初版成稿:正名存照、八坑、双口径、待核四项、库内互链十三链落盘 agentA-aptos

后续变更请在表中追加行并同步更新事实核查清单的对应编号状态。

致谢与利益声明

本条目的事实链依赖 GIANA 组织方(CVC-UAB、ETIS-ENSEA、Hospital Clinic de Barcelona、Hôpital Saint-Antoine AP-HP)在官网与文献中的持续披露,以及 ITU-T FG-AI4H 文档体系对挑战规格的独立存照——一并致谢。利益声明:本条目写作与千方病案医数集的条目间互链机制相关,作者与 GIANA 组织方及上述资源出版方无其他利益关联;条目中对获取制度的评价(DAIMS 评分、光谱定位)为编辑部方法论框架下的分析性结论,不代表数据发布方立场。

(全文完。)

附录 Z:复盘论文细读指南

针对 Journal of Imaging 2020;6(7):69(doi:10.3390/jimaging6070069),给计划精读的读者一份结构化导读。本指南只陈述该文在公开记录中确认的角色与结构要素,具体成绩数字请以原文为准(本条目不转录未核对的表格数值)。

Z.1 论文的定位

这篇论文是 GIANA 官方组织者对「组织化竞赛作为最先进水平对比框架」方法论的系统陈述。它在 GIANA 文档链中的独特地位是:唯一同时覆盖方法学论证与历届方案技术细节的官方文本。官网将其作为推荐读法列出,意味着引用 GIANA 方法论或历届成绩的规范路径都汇于此。

Z.2 精读时抓四个要素

  • 竞赛框架的三条件论证:测试集隔离、指标统一、同期横向比较——注意作者如何论证这三条件在常规论文评测中经常缺失,以及赛事制度如何逐一保证(对应本条目 8.1 节)。
  • 2017 冠军方案的技术复盘:胶囊内镜三分类任务的冠军方法描述;注意其方法要素(架构选择、训练策略、推理设计)与任务特征(三分类、1,812 张口径)的对应关系。
  • 2018 SD 分割亚军方案的技术复盘:标清分割任务的方案描述;它与冠军方案(Penguin AI)同赛道对比,构成「同一测试协议下的成对样本」。
  • 评测设计的讨论章节:关于指标组合、测试协议、结果解读的讨论——这是论文方法学主张最密集的部分,也是本条目 §5 指标讨论的对话对象。

Z.3 精读后的引用姿势

读完后可执行的三种引用:引方法论主张(竞赛框架三条件)→ 引该文;引历届成绩 → 引该文中的表格并注明届次与赛道;引具体方案细节 → 优先该文,需更细时顺其参考文献找原团队论文。三种引用都不应被新闻页或第三方解读替代。

附录 AA:数据增强的临床语义边界

在 GIANA 分割/检测数据上做数据增强时,增强算子的选择要过「临床语义」这道闸——某些在自然图像上无害的增强,在内镜影像上有明确的语义风险:

  • 色彩类增强(色相偏移、饱和度扰动)需强保守:内镜病灶判读高度依赖颜色语义(血管扩张的红色、炎症的充血色调);激进的色彩增强可能在训练分布中制造「不存在于临床的病灶颜色」,对 WCE 检测类任务尤其危险。Giana-C 的损坏类型中包含色彩类退化,可作增强幅度的校准参照。
  • 几何类增强(旋转、翻转、弹性变形)总体安全但有限度:内镜视野的方向语义弱(肠道内无固定「上下」),旋转/翻转安全;弹性变形幅度过大会扭曲息肉边界形态,与 HD 指标的边界敏感特性冲突。
  • 亮度/对比度增强应模拟真实退化:低照度与曝光切换是真实存在的成像条件(附录 K),以模拟真实条件为限度的亮度增强合理;纯随机的极端曝光可能把模型推向无临床意义的输入空间。
  • 遮挡类增强(随机擦除、CutOut)慎用:内镜图像的遮挡(气泡、残渣、液体)有自己的空间统计,随机矩形遮挡与真实遮挡形态差异大,可能教会模型「遮挡区域无所谓」的错误先验。
  • 视频数据的时序增强:帧丢弃/插值类增强应保持帧率语义(帧率信息本身是文档缺失项,附录 O 排查项),并避免破坏「镜头运动连续性」——视频检测的时序平滑设计依赖这一先验。

一条总原则:增强后的样本应能通过「临床医师觉得眼熟」的目检——把这个目检做成增强管线的抽样质检环节,比任何理论论证都便宜有效。

附录 BB:跨数据集病例重复与泄漏治理

BB.1 问题的来源

息肉分割的公共数据集之间存在真实的病例层重叠风险,来源有三:其一,同源标注网络——CVC 系、GIANA、ETIS-Larib 出自相关机构网络,同一检查序列的不同帧可能流入不同数据集;其二,社区搬运与再打包——历史上有数据集间的帧复用被论文指认;其三,视频帧的高相似性——同一段检查的相邻帧几乎相同,任何「按帧随机划分」都会制造训练-测试泄漏。

BB.2 与 GIANA 直接相关的治理动作

  • GIANA 内部:视频赛道按序列划分(官方即如此),静态图赛道用官方 300/612 划分,绝不按帧重划。
  • GIANA ↔ CVC 系:同源簇成员不互为独立测试集(7.2 节);若实验设计必须跨簇混用,做基于图像相似度的重叠排查(感知哈希或特征检索均可),报告重叠率。
  • GIANA ↔ Kvasir 系:机构无重叠,病例层重叠风险低,但仍是「声明未发现」优于「未声明」——审稿人视角(附录 T)的第三条即针对此。
  • 多库联合训练时:以数据集为单元记录来源,保证消融实验可以拆解「加某库的边际贡献」——这也顺带满足审稿人对数据组合的透明性要求。

BB.3 一个诚实的边界

公开渠道无法穷尽验证跨库病例级重叠(原始病例 ID 不随数据集发放是普遍现象)。因此本条目的立场是:治理动作做到「方法可复核、结论可声明」,剩余不确定性如实写进论文局限性,而不是宣称「已排除所有泄漏」。

附录 CC:成绩报告模板

给在 GIANA 上产出成绩的研究者一份即用型报告模板(Markdown 表格,直接填入数值即可):

CC.1 分割成绩表(SD 赛道)

方法 届次/划分 Dice PPV Sens. HD(口径) 备注
本文方法 官方 300/612 — — — — 评测通道:本地/官方
历届冠军(复盘论文口径) 2018 赛事 — — — — doi:10.3390/jimaging6070069
复现基线 官方 300/612 — — — — 本文复现环境

CC.2 分类成绩表(WCE/2017 语境)

方法 版本/划分 AUC Sens.(工作点) PPV(工作点) 备注
本文方法 2017 版 906/454/452 — — — 或 2018 WCE 600/600
Giana-C 鲁棒性参照 2017 版 + 15 损坏 — — — arXiv:2011.07631

CC.3 数据声明模板

本文使用 GIANA(Gastrointestinal Image ANAlysis Challenge)第 ___ 届版本数据,经官网注册并接受挑战规则后获取;使用其 ___ 赛道官方划分(训练 ___/测试 ___);评测指标为 __________(HD 采用 ___ 口径);评测通道为 ________。数据许可遵循官网挑战规则(研究用途表述见官网公开页,明文条款以注册后条款为准)。

三个模板合用即满足附录 H 自查表的第 4、5 条;模板中的空位填写本身,就是一次对照事实核查清单的微型审计。

附录 DD:二十个研究问题——以 GIANA 为素材的选题菜单

给寻找研究切口的读者,以下二十问按「可执行性」排序,每问标注所需赛道与建议组合:

  1. 息肉分割模型在 Kvasir-SEG 训练后于 GIANA SD 的性能衰减量是多少?衰减中多少来自分辨率差异、多少来自标注风格?(组合一 + SD/HD 对照)
  2. HD 训练能否系统性改善 SD 测试成绩,或反之?(双档对称实验,§C.2)
  3. 视频赛道的 18 条训练视频上,时序平滑模块带来多少稳定增益?(组合三)
  4. GIANA 视频与 ldpolypvideo 的联合训练是否存在边际收益?(组合三变体)
  5. CAD-CAP 预训练对 WCE 双赛道评测的迁移效率如何?(组合四)
  6. 血管扩张检测中,敏感性-PPV 的最优工作点随阅片成本假设如何移动?(附录 L.1)
  7. Giana-C 的 15 种损坏中,哪一类对胶囊内镜分类模型杀伤最大?(组合五)
  8. 损坏类型间是否存在「鲁棒性联盟」(对 A 鲁棒的模型对 B 也鲁棒)?(Giana-C 相关性分析)
  9. 弱监督(视频级标记)能逼近帧级监督的多少性能?(FAQ-12)
  10. 2021 分类赛道的腺瘤性判断与医师光学诊断的一致率结构是什么?(附录 L.3,需外部对照)
  11. 合成数据(c3vd/simcol3d)预训练在 GIANA 上的迁移上界与下界?(组合六)
  12. 四大件上排名一致的模型家族是否存在?跨库排名翻转的预测因子是什么?(meta-evaluation)
  13. 像素级掩码训练的模型在图像级标签任务上零样本表现如何?(标注形态迁移)
  14. 图像级监督 + 像素级验证的半监督管线在 WCE 上的可行性边界?(FAQ-12 变体)
  15. 测试时增强(TTA)对 HD 指标的改善是否与对 Dice 的改善同向?(指标间耦合)
  16. 高光反射区域的处理分支对分割边界的 HD 改善贡献几何?(附录 K + 附录 AA)
  17. 注册制数据集的复现验证成本如何量化?(以 GIANA 为案例的元研究,附录 E.1)
  18. 跨届次成绩不可比性可以被统计修正到什么程度?(复盘论文协议研究)
  19. 基础模型零样本成绩与历届全监督成绩的差距如何按赛道分解?(附录 X.2)
  20. 数据增强的「临床语义安全域」能否形式化为可检验的约束集?(附录 AA 的形式化延伸)

前六问可用现有公开资源在单卡环境起步;十一问以后涉及多库组合或元研究,适合作为学位论文或合作课题的主线。

附录 EE:三种读者的对照阅读路径

按阅读目的设计的本条目使用路线,与 §0 导读三则互补:

  • 路径一「三分钟判断者」(数据选型初筛):INFOBOX → §1 问 2(规模表)→ §6.5(版本选择)→ 附录 Q(字段速查)。产出:是否采用、取哪届、预期规模的判断。
  • 路径二「基准复现者」(实验落地):§4(基线观)→ §5(指标口径)→ 附录 D(复现清单)→ 附录 CC(报告模板)→ 附录 T(审稿预置)。产出:完整实验协议。
  • 路径三「条目建设者」(库内维护视角):§7(谱系)→ §9(关系网络)→ 6.4(DAIMS)→ 附录 J(四大件对表)→ 事实核查清单 → 尾注。产出:互链更新、DAIMS 复评、待核项跟进。

三条路径共用的最后一步都是事实核查清单——它是全条目的「事实总账」,任何路径的结论最终都要回到编号 1-28 的出处对账。

附录 FF:数据集卡片编写要点(以 GIANA 为例)

给需要为 GIANA 或同类注册制数据集编写 dataset card 的团队,从本条目提炼的六条要点:

  1. 身份字段先做正名:名称全称、领域、任务清单放卡片首屏,把「易混淆名称」显式列入 disambiguation 字段(坑 1 的卡片化防线)。
  2. 规模字段区分封闭与开放:封闭数字给精确值,开放上限保留原符号并注明「官方口径」——卡片里精确化开放上限是最常见的卡片失真(坑 8)。
  3. license 字段用状态而非代号:registration-gated; research-purpose statement on public pages; full terms behind registration 一类的状态描述优于任何 SPDX 猜测(坑 3)。
  4. 获取字段写流程不写链接:注册墙数据没有稳定直链可写,写四步流程(6.1 节)比写会失效的深层链接更可维护。
  5. 限制字段直引评测生命周期:无常驻 leaderboard、跨届不可比、测试标签政策未明——这些限制写进 limitations 是对下游使用者的保护,也是卡片可信度的来源。
  6. 互链字段用受控 rid:库内关联条目以 rid 清单(本条目事实核查表)为准,不用自由文本描述关联——保证互链算法可消费。

本条目的附录 Q 字段速查可直接作为卡片骨架;六条要点是其填写规范。

附录 GG:中英文语境的术语对齐

本条目面向中文读者而引用链以英文为主,术语对齐规范如下(与附录 U 缩写规范配套):

  • 血管扩张 / angiodysplasia:中文文献亦作「血管发育异常」;本条目统一用「血管扩张」,首次出现括注英文全称。临床书写中「动静脉畸形(AVM)」是另一实体,不与 angiodysplasia 混用。
  • 息肉分割 / polyp segmentation:无对齐争议;「息肉检测(detection)」「息肉定位(localization)」「息肉分类(classification)」三个任务名的中文一一对应本条目已固定,跨条目引用建议沿用。
  • 胶囊内镜 / wireless capsule endoscopy(WCE)/ capsule endoscopy(CE):英文文献 WCE 与 CE 混用;中文统一「胶囊内镜」,缩写出现时保持原语境(WCE 赛道名不改写)。
  • 注册墙 / registration gate:本条目造词性质的工具性表述,非官方术语;卡片区与元数据领域也可用「申请制」「凭注册获取」,跨条目保持一种即可。
  • 复盘论文:指 Journal of Imaging 2020 复盘文献的本条目内简称;正式引用不使用该简称。
  • 四大件:息肉分割比较表常客集合的社区俗称;正式文本写「四个标准评测集」并在括号内列名。
  • 会地名单:机构名首次出现用官方全称(如 Hôpital Saint-Antoine AP-HP),此后可用简称(Saint-Antoine 医院);不翻译机构专名(不写「圣安托万医院」后再附英文的冗余格式)。
  • 数字与符号:官方文档的「>」开放上限在中文语境保留原符号(不写「超过」后丢失可追溯性——两种写法均可接受,但全条目内保持一致;本条目选择保留符号)。

术语对齐的意义在跨条目一致性:库内 kvasir-capsule、cvc-clinicdb、polypgen 等条目使用同一套中文任务名与机构名时,互链算法的文本相似度与读者的跨条目阅读体验同时受益。

附录 HH:下游条目引用本条目的协作礼仪

库内其他条目(尤其 7.1 表所列十三链)后续修订时,若需引用本条目内容,按以下礼仪执行:

  • 引用硬数字时带上版本语境:写「GIANA 2018 版 SD 分割 300/612」而非「GIANA 有 912 张」——把坑 2 的防线延伸到库内文本。
  • 引用 DAIMS 评分时注明时点:5.2 分是 2026-09-27 抓取时点的评估;后续若 GIANA 获取制度变化(如发布官方镜像),评分应由本条目修订流程更新,下游条目转引时注明「截至 XX 日期」。
  • 互链 URL 用条目页格式:本站占位格式 https://www.qianfanghub.com/ai-ready-dataset/<slug>/<rid>;rid 变更时以编辑部归一化为准(尾注 5)。
  • 谱系关系不降级转述:「同源标注传统」与「赛事并轨」两类关系的表述以本条目 §7 为准;下游条目引入新的谱系断言(如新的同源对)应先在来源侧存证,再双侧更新。
  • 待核项不重复扩散:本条目待核 4 项在下游条目中只引用状态(「GIANA 条目存照为待核」),不各自独立转述细节,避免同一待核事实出现多个不一致版本。

FAQ 增补(FAQ-15 至 FAQ-18)

FAQ-15:2021 之后还会有新届次吗?

2024 AI4PolypNet 已确认系列的延续(A.6 节),但其任务组织、数据规模与新老版本关系有待官方页面进一步披露(附录 G 第 8 问)。新届次发布后,本条目按维护计划(尾注前「条目维护与再验证计划」节)做增量更新。

FAQ-16:中文论文里怎么处理 GIANA 的赛道名?

推荐「功能描述 + 英文原名」的双写格式,如「标清息肉分割(polyp segmentation SD)赛道」;纯中文转译(如「胃肠道图像分析挑战六赛道」)在首次出现处附英文对照。附录 GG 的任务名对照表可直接取用。

FAQ-17:GIANA 数据带患者人口学信息吗?

公开文档未记录人口学元数据(年龄、性别等)随数据发放;GIANA 的伴随信息以赛道标签与掩码为主。需要人口学分层的研究设计应先向组织者确认元数据可得性(附录 G 第 5 问相关),不应预设存在。

FAQ-18:其他条目的比较表要引 GIANA 成绩时,取哪个口径?

统一从官方复盘论文取历届成绩(注明届次与赛道),或引用使用官方划分的同行评审论文成绩并注明出处;不自建跨论文混合榜(附录 T 第一条的库内应用)。比较表新增 GIANA 列时,建议同步引用本条目事实核查清单编号 18-19 的出处口径。

附录 II:GIANA 年度大事记

已验证事实的时间线汇总(出处见事实核查清单编号):

时间 事件 出处编号
2015 ISBI 上的系列早期形态启动 4
2015 MICCAI 息肉检测前身赛事 4
2017 首次启用 GIANA 名称;胶囊内镜 1,812 张三分类(906/454/452) 4, 5
2018-05-23 2018 版训练数据发放 15
2018-07-20 2018 版测试数据发放 15
2018-09-03 2018 版提交截止 15
2018-09 MICCAI Granada 现场颁奖(日期双口径存照);六赛道成型、CAD-CAP 并轨;SFED 赞助 12 奖项 2,000€;KM 三冠等获奖名单公布 6-14, 16
2020 Journal of Imaging 复盘论文发表(2017 冠军 + 2018 SD 亚军方案归档) 18
2021 MICCAI 2021 新增息肉分类赛道(1,000/200) 11
2024 AI4PolypNet 新入口再启动 4
2024 Giana-C 相关工作期刊版发表于 Medical Image Analysis(arXiv:2011.07631) 19
2026-09-27 本条目抓取与成稿时点 —

大事记的使用建议:综述与条目互引时以此表为年表基准;新增年份行时同步增补事实核查清单编号。

附录 JJ:一页纸摘要(决策者版本)

它是什么。 GIANA 是 MICCAI EndoVis 旗下的胃肠道图像分析挑战系列(息肉检测/分割 + 胶囊内镜血管扩张识别),2015 年起步、2017 年定名、2018 年六赛道成型、2021 年加入分类任务、2024 年以 AI4PolypNet 再启动。主办四方:CVC-UAB、ETIS-ENSEA、Hospital Clinic de Barcelona、Hôpital Saint-Antoine AP-HP。

能做什么。 三类经过验证的用法:作为息肉分割四大评测集之一做基准评测(SD 赛道 300/612);作为胶囊内镜血管扩张检测的现实尺度数据源(WCE 600/600 × 2 + CAD-CAP >3,500 张);经第三方 Giana-C 变体做算法鲁棒性压力测试。2018 版六赛道合计逾 8,000 帧/张,覆盖结肠镜视频、SD/HD 静态图、胶囊内镜四种成像象限。

要花什么成本。 获取走注册墙:注册账号、接受挑战规则后发放下载链接;无公开直链、无官方镜像、无程序化通道。license 明文在墙内未公开直查,公开层仅有研究用途表述。AI-Ready 综合评分 5.2/10(中)——失分在获取制度与文档透明,数据内容本身是赛事级验证质量。

三条决策建议。 其一,探索期研究用开放数据集(Kvasir 系)快速迭代,发表期用 GIANA 官方划分做裁定性测试——两类数据是互补而非互替。其二,任何引用先对版本语境:2017 版 1,812 张与 2018 版六赛道是两套任务体系,混算是引用错误的第一来源。其三,需要法律确定性的使用场景(商用、再分发、衍生发布),先注册查阅条款原文或书面确认组织者,在此之前不做乐观假设。

一句话。 GIANA 是「一次注册成本换一套赛事级验证数据与可引用评测框架」的交易——值得做,但要知道自己签的是什么。

附录 KK:拿到数据后的探索性分析(EDA)指引

在写第一行训练代码之前,对 GIANA 数据做一轮系统性探索能避免后期多数意外。以下按赛道给出 EDA 清单与典型发现形态:

KK.1 分割赛道(SD/HD)的 EDA

  • 掩码面积分布:统计每张图的息肉面积占比,画直方图——期望形态是右偏分布(小息肉占多数)。这个分布决定后续是否需要按尺寸分层报告、是否需要加权重采样。
  • 掩码连通性:检查单图多息肉(多个连通域)的比例——多目标图的 Dice 计算语义(整体算还是逐目标算)需要在论文中固定。
  • 边界复杂度代理:掩码周长/面积比或边界不规则度——高值图集是 HD 指标恶化的高发位,预先识别可在误差分析时节省时间。
  • 图像-掩码对齐抽验:随机抽 20 张做叠加目检——对齐错误(偏移、通道错位)在直方图里不可见,目检是最快的发现手段。

KK.2 视频赛道的 EDA

  • 帧间相似度曲线:对每条训练视频计算相邻帧特征距离,识别镜头静止段与快速运动段——时序方法的设计直接依赖这一分布。
  • 阳性帧密度:息肉出现帧占全片比例——低阳性密度意味着以视频为单元的评测比以帧为单元更贴近临床预筛场景。
  • 伪影热区统计:气泡/高光出现频率的按视频统计(附录 K 八类的自动化粗检或抽样目检)——识别「最难视频」供误差分析预案。

KK.3 WCE/CAD-CAP 的 EDA

  • 类别分布:三类(正常/炎症/血管病变)的比例分布——若血管病变类稀疏,AUC 之外应补按类敏感性报告。
  • 色彩统计:按类别的 RGB/HSV 分布对比——血管扩张类的红色响应是否与炎症类可分,是特征工程或模型预判的依据。
  • 帧序上下文:若数据按检查序列组织,检查同序列相邻帧标签一致性——胶囊内镜的病灶跨多帧出现,序列级泄漏检查(附录 BB)在此赛道尤其重要。

KK.4 EDA 的产出纪律

EDA 的全部统计落成一份随实验仓库维护的「数据画像文档」,并在论文附录或补充材料中引用其稳定版本——审稿人对「数据理解深度」的判断,往往来自这份文档而非模型表。EDA 中发现的异常(对不上的数量、错位样本、可疑标签)一律走附录 O 排查路径并向组织者反馈,不静默修补原始数据。

附录 LL:常见失败模式的归因决策树

模型在 GIANA 评测中成绩异常时的排查顺序(按「先数据、后协议、再模型」排列):

第一步:成绩整体崩坏(Dice 掉到个位数或 AUC 掉到 0.5 附近)

  1. 查数据对齐:图像-掩码命名/尺寸错位?(KK.1 抽验)
  2. 查版本混入:训练与评测是否跨了 2017/2018 语境?(坑 2、坑 5)
  3. 查掩码值域:0/1 与 0/255 的读取差异?(附录 O)
  4. 查划分:是否把官方测试集混进了训练?(附录 N 第 4 条)

第二步:Dice 正常但 HD 异常差

  1. 查单图多目标的 HD 语义(逐目标 vs 整图边界集);
  2. 查低置信预测的后处理:阈值裁剪可能制造孤立假阳小区域,HD 对其极敏感;
  3. 查边界模糊样本聚集:与 KK.1 边界复杂度分布对照,确认是否集中在高不规则子集。

第三步:本地成绩与文献成绩差距大

  1. 查协议:官方划分还是自划分?指标实现口径(尤其 HD 百分位)?
  2. 查届次:文献成绩是 2017 还是 2018 语境?(附录 T 前两条)
  3. 查训练规模:文献常配外部数据预训练,纯 GIANA 训练的差距可能是数据量差而非方法差——这在视频赛道(18 条)是默认假设。

第四步:一切正常但提升微小

  1. 回到数据画像(KK 各节):瓶颈可能在类别不平衡或边界复杂度子集,而非架构;
  2. 检查是否已到标注噪声下限:GIANA 掩码由人工勾画,边界像素级的上限由标注质量决定(§3.3 的协议不透明在此显形);
  3. 若确认进入瓶颈区,把研究方向从「刷分」转向「分层报告与误差分析」——这通常是更有发表价值的出口。

决策树的用法:每个分支的排查动作都对应本条目某一节的具体工具(附录 D/O/KK、坑清单、§3/§5),按编号回查即可;四步走完仍未归因的异常,建议先冻结实验并向社区/组织者求证数据问题,再恢复方法迭代。

(全文完,附录 LL 为最后一节。)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • bkai-igh-neopolyp — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 结直肠癌
  • heico — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 结直肠癌
  • kvasir-seg — 共享标签:内窥镜影像 / 医学图像分割 / 结直肠癌
  • polypdb — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 结直肠癌
  • ldpolypvideo — 共享标签:医学影像 / 内窥镜影像 / 结直肠癌
  • etis-larib — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割
  • phakir — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 挑战赛数据集
  • endovis-challenges — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割
  • consep — 共享标签:医学影像 / 医学图像分割 / 结直肠癌
  • cholecseg8k — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集