信息速览
INFOBOX — HyperKvasir 一屏速览
维度 内容 本质 Kvasir 家族的全面扩张版:常规胃镜/肠镜图像+视频一体,2020 年发布时点"最大公开消化道数据集" 团队 SimulaMet/OsloMet/UiO/Bærum 医院 等 14 单位 19 位作者,前 5 人同等贡献,通讯 Pål Halvorsen 论文 Scientific Data 2020;7:283,doi:10.1038/s41597-020-00622-y(2020-08-28 发表,CC BY 4.0) 数据 110,079 图 = 10,662 标注(23 类)+ 99,417 未标注;另 1,000 息肉分割 + 374 条视频(30 类) 采集 Bærum 医院(Vestre Viken),2008-2016 年常规检查,Picsara 影像库导出,Olympus/Pentax 设备 标注 三步法:专家定类 → 两名初级医生/博士生预标 → 专家复核修正;分割走 Labelbox 双层流程 谱系 Kvasir(4,000→8,000)→ HyperKvasir → Kvasir-SEG / Kvasir-Capsule / Kvasir-Instrument 官方基线 分类 micro F1 0.910(ResNet-152+DenseNet-161 集成)/ macro F1 0.619(DenseNet-161) 分割基准 论文不做分割基线;1,000 张掩码下游自定划分,Res34UNet IoU 0.9482 等第三方数字可引 许可 CC BY 4.0(数据+论文),OSF + datasets.simula.no 公开直链无注册墙;HF 镜像卡误标 MIT(坑 4) AI-Ready 亮点 直链+标准格式+CSV 映射+官方 k 折划分+ARFF 特征——"半监督友好"设计在 2020 年属先锋 库内互链 Kvasir-SEG(112)、Kvasir-Capsule(123)、Kvasir-Instrument(213)、旧合并条目(75)、CVC 系列(133/142/153)
HyperKvasir 是"把一个数据集做成一个生态"的样本:2017 年 Simula 团队发布 4,000 张内镜图像的 Kvasir 时,医学影像社区还在为"能不能拿到几百张带标签的内镜图"发愁;三年后,同一批团队把 Bærum 医院影像库里沉睡的 2008-2016 年检查原片整体搬出,交出了 110,079 张图像与 374 条视频——其中 10,662 张由资深胃肠医师标注成 23 类,1,000 张息肉图带像素级掩码,而剩下 99,417 张未标注图像被刻意保留并随集发布:这在 2020 年的医学影像数据集里是罕见的"半监督友好"设计,等于公开承认"标注是瓶颈,未标注数据也是资产"。它同时把解剖标志(anatomical landmarks)、黏膜观察质量(Boston 肠道准备评分)、病理发现与治疗干预四个维度纳入同一个类目体系,让一台内镜检查的全流程第一次有了完整的机器可读刻画。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——OSF/datasets.simula.no 直链 + CC BY 4.0,无注册墙,注意 58.6GB 全量包与分块包的选择。
- 做分类/半监督:直奔 §2 类目体系与 §4 官方基线——23 类分布表和 macro/micro 落差是类别不平衡的直接教材。
- 做息肉分割:直奔 §3 分割子集与 §5 下游基准——注意官方未定义划分,数字横比前先对齐协议(坑 6 是 Kvasir-SEG 同源泄漏风险)。
§0 导读:这个数据集解决什么问题
内镜是消化道疾病诊断的金标准,但它的效能受操作者水平波动严重制约——文献引用的常规数字是结肠镜平均 20% 的息肉漏检率。AI 辅助诊断被寄望于补上这一差距,而深度学习需要海量标注样本;医学数据的现实却是:法律限制层层、专家时间昂贵、标注工具匮乏。HyperKvasir 论文开篇把这三重瓶颈写得很直白,并给出自己的解法——与其攒一个"小而全标"的集子,不如把"全标"与"未标"两批数据同时放开,让监督学习与半监督学习各取所需。
这个解法落在四个具体的数据记录上。第一,10,662 张图像带 23 类标签,类目体系按"解剖部位 × 发现类型"组织,从上消化道的 Z 线、幽门,到下消化道的回肠、盲肠,从反流性食管炎、巴雷特食管到溃疡性结肠炎分级、息肉与痔疮——这是当时公开内镜数据里最细的疾病覆盖面。第二,1,000 张息肉图带像素级掩码与边界框,与同团队同期发布的 Kvasir-SEG 同源同规模,构成息肉分割的标准素材。第三,99,417 张未标注图像——比标注集大近十倍——配 GitHub 上的预提取全局特征与聚类指派(ARFF 格式),专门喂给半监督/自监督/无监督方法。第四,374 条标注视频(30 个视频级发现类),把"静态图像分类"扩展到"动态检查过程理解"。
§0 读法三则:
- 这个条目覆盖四个异构子集,各自的任务、标注粒度与许可约束不同(§2、§3、§6)——"HyperKvasir 有多少数据"这个问题的答案取决于你在问哪个子集,别用 110,079 一个数走天下。
- 视频数量存在 374(论文)vs 373(官网现版/GitHub)双口径,视频时长/帧数也有两套口径(坑 1、坑 2);本条目正文以论文口径为主并随注。
- 本条目与库内 Kvasir-SEG(rid 112)是"姊妹条目"关系:1,000 息肉分割图与 Kvasir-SEG 高度同源,两库同用会引入泄漏(坑 6)——跨库评测设计者必读。
§1 数据集速览:十问十答
Q1:HyperKvasir 到底有多少数据?
分四块答:标注图像 10,662 张(23 类)、未标注图像 99,417 张、分割图像 1,000 张(息肉+掩码+边界框)、视频 374 条(论文口径;官网现版写 373,坑 1)。图像总数 110,079 = 10,662 + 99,417;加上视频帧后总量约 100 万级。
Q2:名字里的 Hyper 是什么意思?
“Hyper"即"超出/扩展”——相对前作 Kvasir(8,000 图、8 类)的全面扩张:标注图扩到 10,662 张、类目扩到 23 类,外加未标注图、分割图与视频三块全新资产。论文拼写 HyperKvasir,仓库与 URL 拼写 Hyper-Kvasir(坑 7)。
Q3:23 类是怎么组织的?
按四大维度:解剖标志(anatomical landmarks,4,104 张:cecum/ileum/pylorus/z-line/retroflex-rectum/retroflex-stomach)、病理发现(pathological findings,2,642 张)、治疗干预(therapeutic interventions,1,991 张:dyed-lifted-polyps/dyed-resection-margins)、黏膜观察质量(quality of mucosal views,1,925 张:BBPS 评分等)。病理发现依世界内镜组织 MST 术语定义,BBPS 用波士顿肠道准备评分。
Q4:谁标的、怎么保证质量?
三步法:资深胃肠内镜医师定类并撰写类目描述 → 两名初级医生/博士生预标 → 资深医师逐张复核修正;无法达成共识的样本直接弃用、以新图替换。分割子集走 Labelbox 平台:初级医生+博士生预分割,胃肠医师逐张核验修正。
Q5:类目平衡吗?
不平衡,而且是刻意保留的真实分布:最大类 bbps-2-3 有 1,148 张,最小类 hemorrhoids 只有 6 张,ileum 9 张、barretts 41 张——长尾极小类只有个位数样本。论文明确把这当作研究挑战的一部分呈现(“方法应能从少量训练样本中学习”)。
Q6:未标注图像有什么用、怎么用?
99,417 张未标注图是本集的招牌资产:官方配了预提取的全局特征与聚类指派(GitHub ARFF 文件,WEKA 可直接读),论文用最佳分类模型给未标注集打了伪标签以展示其构成(normal pylorus 预测最多)。半监督/自监督方法可将其作为无标签池——这是多数同期内镜数据集不具备的。
Q7:分割子集和 Kvasir-SEG 什么关系?
同规模(1,000 张)、同医院(Bærum)、同标注流程(论文把分割标注流程的详细描述转引 Kvasir-SEG 论文),官方明确说分割图取自本集 polyps 类文件夹(与其中 1,028 张有重复),但未逐一声明与 Kvasir-SEG 是否逐张同一批图——第三方汇总资料直接写"相同"。谨慎起见:两个集子别同时当独立测试集用(坑 6)。
Q8:视频部分怎么标?
374 条 AVI 视频按"整条视频的主发现"标成 30 类,由一名资深胃肠医师整体判定;一条视频可含多个发现(如息肉+染色+切除边缘),细节写进 video-labeling.csv。官网现版口径:约 11.62 小时、1,059,519 帧、171 处标注发现(论文口径 9.78 小时/889,372 帧,坑 2)。
Q9:能商用吗?
CC BY 4.0 允许商用(署名即可),附加条款只有一条:使用数据或报告实验结果必须引用论文。这是医学影像数据集里相当宽松的许可——但注意 HF 官方镜像卡误标 MIT(坑 4),以官方 CC BY 4.0 为准。
Q10:为什么它对 AI-Ready 重要?
它是"无注册墙直链 + 标准格式(JPEG/AVI/CSV/JSON/ARFF)+ 官方划分 + 机器可读元数据"的完整组合,2020 年发布时在医学影像数据集里属于 AI-Ready 先锋;唯一的失分项是分辨率/帧率等关键规格只在论文图里(无数字表格)与多年累积的双口径文档(视频数、时长、HF license 标签),自动化抓取需按本条目存照口径处理。
§2 数据构成与规格
2.1 四大数据记录总表
论文 Table 2 的官方口径(本条目全部硬数字的锚点):
| 数据记录 | 文件量 | 描述 | 体量(论文) | 官网下载包 |
|---|---|---|---|---|
| Labeled images | 10,662 张 | 23 类发现标签,JPEG | 3,960 MB | hyper-kvasir-labeled-images.zip 3.9GB |
| Segmented images | 1,000 张 | 息肉分割掩码 + 边界框 | 57 MB | hyper-kvasir-segmentation.zip 46MB |
| Unlabeled images | 99,417 张 | 无标签原片 | 29,940 MB | hyper-kvasir-unlabeled-images.zip 29.4GB |
| Videos | 374 条(论文) | 30 个视频级发现类,AVI | 32,539 MB | hyper-kvasir-videos.zip 25.2GB |
| 全量 | — | — | — | hyper-kvasir.zip 58.6GB |
三个口径细节:体量数字论文与下载包有出入(58.6GB vs 62.5GB 分块合计——压缩层级差异),引用时注明口径;官网现版把视频写作 373 条/25.2GB(坑 1);HF 官方镜像(SimulaMet-HOST/HyperKvasir)2025-05 上传了四个分块 zip 的完整镜像(63.45GB 存储,gated=false)。
2.2 采集与设备链路
| 属性 | 规格 |
|---|---|
| 采集机构 | Bærum 医院(Vestre Viken Hospital Trust)消化科;Vestre Viken 服务 49 万人,其中 18.9 万覆盖于 Bærum |
| 采集时段 | 2008-2016 年前瞻性常规临床检查(非为建数据集专门采集) |
| 导出源 | Picsara 影像文档数据库(CSAM,挪威)——电子病历系统的插件,2016 年统一取回 |
| 设备 | Olympus(Olympus Europe)与 Pentax(Pentax Medical Europe)标准内镜设备 |
| 隐私处理 | 元数据全删、文件名随机化(UUID 型),由医院内部 IT 部门从中央服务器导出 |
| 预处理 | 零预处理、零增强——论文原文 “the data has not been pre-processed or augmented in any way” |
| 特殊伪影 | 部分图像/视频带 Olympus ScopeGuide 画中画缩略图(左下角绿色框,定位用) |
| 分辨率/帧率 | 论文仅以 Fig. 2(110,079 图分辨率分布)/ Fig. 3(374 视频统计)呈现,正文无数字表——引用分辨率时只能引"分布不均一",勿编造具体数值 |
"零预处理"声明对 AI-Ready 有直接意义:拿到手的就是内镜室原片,所有质量控制(ScopeGuide 缩略图裁剪、模糊帧过滤、分辨率归一)都由使用者自行决策——这与 Kvasir-SEG"专家预筛过的干净集"形成互补(库内 rid 112 条目把这一差异作为其"精选偏倚"限制的对冲方案)。
2.3 23 类类目体系全展开
标注图像按"部位 × 类型"两轴组织,四维归纳与逐类计数(per-class 计数引 Dataset Ninja 对发布压缩包的逐文件夹实测,总和精确=10,662):
解剖标志(anatomical landmarks,4,104 张)——检查完整性确认与定位参照:
| 类名 | 中文 | 张数 |
|---|---|---|
| normal-cecum | 正常盲肠 | 1,009 |
| normal-pylorus | 正常幽门 | 999 |
| normal-z-line | 正常 Z 线(齿状线) | 932 |
| retroflex-stomach | 反转 view 胃底 | 764 |
| retroflex-rectum | 反转 view 直肠 | 391 |
| ileum | 末端回肠 | 9 |
病理发现(pathological findings,2,642 张)——按 MST 术语:
| 类名 | 中文 | 张数 |
|---|---|---|
| polyps | 息肉 | 1,028 |
| esophagitis-a | 反流性食管炎 A 级 | 403 |
| esophagitis-b-d | 反流性食管炎 B-D 级 | 260 |
| ulcerative-colitis-grade-1/2/3 | 溃疡性结肠炎 Mayo 1/2/3 级 | 201/443/133 |
| impacted-stool | 粪便嵌塞 | 131 |
| barretts | 巴雷特食管(长段) | 41 |
| barretts-short-segment | 巴雷特食管(短段) | 53 |
| hemorrhoids | 痔疮 | 6 |
治疗干预(therapeutic interventions,1,991 张):dyed-lifted-polyps(染色抬举后息肉)1,002 张、dyed-resection-margins(切除后边缘染色)989 张——息肉内镜下治疗的两个标准步骤,是"术中流程识别"任务的监督信号。
黏膜观察质量(quality of mucosal views,1,925 张):bbps-0-1 646 张、bbps-2-3 1,148 张——波士顿肠道准备评分(Boston Bowel Preparation Scale,BBPS)的粗化二档,外加溃疡性结肠炎的过渡档(grade 0-1 35 张 / 1-2 11 张 / 2-3 28 张; ulcerative colitis 的 0-1/1-2/2-3 三档按黏膜观察质量维度归档)。
部位两分法:下消化道(lower GI)7,210 张 + 上消化道(upper GI)3,452 张。
2.4 类目设计的三个医学决策
- 食管炎二分类:低级别反流性食管炎的观察者间变异大(论文引内镜文献佐证),因此拆成 esophagitis-a(洛杉矶 A 级)与 esophagitis-b-d(B-D 级)二类——把"最易吵起来的边界"变成显式分类决策,同时测模型能否复现人类分级的一致区间。
- 巴雷特长/短段:按 Prague 分类以 3 cm 纵向扩展为界拆 barretts 与 barretts-short-segment——两类样本量(41/53)都在小样本区,反映该病本身在常规检查中的低检出率。
- UC 分级双轨:Mayo 内镜分级 1/2/3 三档与观察质量档 0-1/1-2/2-3 并存——前者是疾病严重度,后者是黏膜可视化程度,两套刻度各有用途;论文明确说"易偏倚的发现被合并成一类"是刻意的防偏设计。
2.5 未标注图像:99,417 张的定位与用法
未标注文件夹(unlabeled)是 images 文件夹的子文件夹,与 23 个标注类平行。它的三种用法:
- 半监督/自监督无标签池:99,417 ≈ 标注集的 9.3 倍,规模在 2020 年的公开内镜资源里独一档——同团队次年发布的 Kvasir-Capsule(rid 123)把这一思想推到胶囊内镜的百万帧量级。
- 聚类与表征学习素材:GitHub 提供预提取的全局特征与聚类指派(ARFF 文件,WEKA 兼容、可转 CSV)——使用者不必先跑特征提取即可开展无监督实验。
- 伪标签分布探查:论文用两个最佳分类模型(DenseNet-161 与 ResNet-152+DenseNet-161 集成,split_0/split_1)给全部未标注图打伪标签:预测最多的是 normal pylorus,最少的是 hemorrhoids 与 UC grade 1-2——与标注集的类分布方向一致,间接说明未标注池与标注池同分布。
注意伪标签只是"构成示意":其精度受分类基线本身的 macro F1 0.6 上下限约束,不能当作未标注集的真值标签使用,更不能直接拿去监督训练还声称"零标注成本"。
2.6 视频数据:从"图像分类"到"检查过程"
374 条 AVI 视频(论文口径)按整条视频的主发现标成 30 类——注意 30 类与图像 23 类不是同一套类目体系(视频类含检查流程性内容),数量也不可互换(坑 8)。逐条视频由一名资深胃肠医师整体判定,video-labeling.csv 保留多发现描述(一条息肉治疗视频可同时含 polyps、dyed-lifted-polyps、dyed-resection-margins 三类)。视频记录的是真实临床检查的完整片段,包含镜头移动、冲洗、模糊等"不干净"时刻——这使它天然适合做 CADe/CADx 系统的在线验证素材与"图像分类模型的真实分布压力测试集"(库内 Kvasir-SEG 条目正是把 HyperKvasir 视频帧列为部署前复测的对冲资源)。
官网现版补充口径(2026-06 更新版页面):373 条视频、约 11.62 小时、1,059,519 帧、171 处标注发现——与论文 374 条/9.78 小时/889,372 帧并存为双口径(坑 2)。“171 处标注发现"指逐条人工评估后确认的发现总数(一条视频可含多处发现),不是类数也不是视频数;HF 卡片把它误写成"171 sequences”,引用时以官网原文为准。
2.7 上消化道与下消化道:两类检查的任务画像
把 23 类按部位拆开统计(数字与 §2.3 逐类计数自洽),能看清两条检查流水线的不同研究价值:
| 部位 | 构成 | 合计 |
|---|---|---|
| 上消化道(3,452 张) | 解剖标志:pylorus 999 + z-line 932 + retroflex-stomach 764 = 2,695;病理发现:esophagitis-a 403 + esophagitis-b-d 260 + barretts-short-segment 53 + barretts 41 = 757 | 2,695 + 757 |
| 下消化道(7,210 张) | 解剖标志:cecum 1,009 + retroflex-rectum 391 + ileum 9 = 1,409;治疗干预 1,991;黏膜质量:bbps 1,794 + UC 档 851;病理发现:polyps 1,028 + impacted-stool 131 + hemorrhoids 6 = 1,165 | 1,409 + 1,991 + 2,645 + 1,165 |
两条画像的任务含义:
- 上消化道 = 诊断分类主场:病理发现占比 21.9%(757/3,452),集中在食管炎与巴雷特——这是"看图诊病"类研究的素材;但注意正常标志类占 78%,做疾病判别时要自行组织正负样本比例。
- 下消化道 = 筛查流程主场:解剖标志+治疗干预+黏膜质量合计 6,045 张(83.8%),构成"插管到位→评估肠道准备→发现→治疗→确认切除"的完整流程监督;息肉本身 1,028 张只是其中一环。
- ileum 只有 9 张的解剖学原因:末端回肠仅在回盲瓣插管成功时短暂入镜,是"检查完整性确认"的瞬时画面——极小类不是标注缺陷而是检查流程的自然反映;同理 hemorrhoids(6 张)在筛查性肠镜中极少被专门拍照。
- 上消化道没有视频级病理分级的对位:视频 30 类按检查流程组织,与图像的病理细分级不完全对应——跨模态研究要重建映射(附录 J)。
对选型者的含义:做上消化道疾病 AI,HyperKvasir 是"分类标签最全"的公开素材(对比库内 GastroVision rid 203 的 8 类平衡设计);做下消化道筛查 AI,它的价值在流程语义与阴性帧(cecum/bbps 类),而息肉分割素材应与 Kvasir-SEG(rid 112)配合使用。
2.8 数据卫生细节清单
论文正文散落着五处容易被忽略的数据卫生声明,集中存档如下:
- 零预处理声明:“the data has not been pre-processed or augmented in any way”——拿到的是检查室原片;一切归一化/去伪影决策都属使用者的方法节内容。
- 重复图替换史:Kvasir polyps 类的重复图在收编时被结肠息肉高质量新图替换——HyperKvasir polyps 类与 Kvasir polyps 类不是逐张继承关系,跨库联合训练前仍需哈希审计。
- 分割图与 polyps 类的官方重复:1,000 张分割图取自 labeled 的 polyps 类(1,028 张)——同一张图可能同时以"分类样本"与"分割样本"双重身份出现,多任务训练时注意样本加权。
- ScopeGuide 画中画:部分图像/视频左下角带 Olympus ScopeGuide 绿色缩略图——它是采集设备的真实伪影,也是最容易造成"模型学会认缩略图而非病变"的捷径特征(shortcut feature);跨库训练(如 Kvasir-SEG 用黑色框替代、CVC 系无缩略图)时必须统一处理策略。
- 弃用制留下的"可标注性过滤器":无法达成专家共识的样本被替换而非保留——数据集的疾病分布因此是"经标注可行性过滤后的分布",任何患病率/流行病学推断都要绕开这个过滤器(这也是"数据集不用于流行病学"的隐性理由)。
§3 标注体系:三步法与双层复核
3.1 图像标注三步法
论文 Methods 对标注流程的原文拆解:
| 步骤 | 执行者 | 动作 | 质控点 |
|---|---|---|---|
| 第 1 步 定类 | 项目内资深胃肠内镜医师 | 依据医学相关性与已采集数据决定类目体系,逐类撰写详细描述 | 类目定义先行(防标注员自由发挥) |
| 第 2 步 预标 | 两名初级医生或博士生 | 对图像子集按类目预标 | 双人参与(交叉校验的雏形) |
| 第 3 步 终审 | 资深医师 | 逐张检查预标结果并修正 | 无共识样本弃用并以新图替换(宁缺毋滥) |
与 PANDA-PLUS 式"学生标+专家全量终审"流水线(库内 rid 同族条目方法论)相比,HyperKvasir 三步法的特征是弃用制:分歧样本不进入数据集,而是换一张新图顶上——这保证了入库标签的一致性下限,但代价是数据分布被"可标注性"过滤过(难判病例系统性偏少),分析疾病患病率时必须记得这一点。
3.2 标注人力与机构背景
论文口径:每条标注数据至少由一名资深胃肠内镜医师经手,医师来自三个机构——Bærum 医院、挪威癌症登记处(Cancer Registry of Norway)、瑞典 Karolinska 大学医院;另有"一名或多名医疗领域从业者"(初级医生、博士生)参与。作者名单里的 Sigrun L. Eskeland(Bærum)、Kristin Ranheim Randel(癌症登记处/UiO)、Peter T. Schmidt(Karolinska)与 Thomas de Lange(Bærum/Sahlgrenska/Augere)构成临床侧的核心链路。跨机构(挪威-瑞典)标注配置在 2020 年的单一数据集里并不多见,但论文未披露医师人数、标注时长与一致性系数(kappa)——标注质量的定量证据是缺失的,只能信"资深医师终审"的流程承诺。
3.3 分割子集的 Labelbox 双层流程
1,000 张息肉图的像素掩码流程:
- 平台:Labelbox(商业标注平台,支持像素级精确勾画);1,000 张图批量上传。
- 预分割:一名初级医生 + 一名博士生先行勾画。
- 终审:一名胃肠内镜医师逐张核验并修正掩码。
- 产出:与原图同名的白前景/黑背景掩码(JPEG),边界框取息肉最外层像素(JSON 文件)。
掩码语义简单干净:息肉组织=白色前景,其余=黑色背景;一张图可含多个息肉(Dataset Ninja 实测 1,000 张图含 1,064 个掩码对象与 1,071 个 bbox,即约 6% 的图有多个息肉)。标注流程的详细描述与用例论文转引了 Kvasir-SEG 论文(Jha et al., MMM 2020)——两个子集的标注流程同构,这也是坑 6"同源风险"的流程层证据。
3.4 与 Kvasir v1/v2 的关系:去重与替换
论文明确记录了一个数据卫生细节:Kvasir 数据集的 polyps 类在原发布中存在重复图像,HyperKvasir 收编时把这些重复替换为结肠息肉的高质量新图(并进入分割流程)。因此:HyperKvasir 的 polyps 类(1,028 张)≠ Kvasir polyps 类(1,000 张)的逐张超集;跨库使用 Kvasir 与 HyperKvasir 做联合训练时,仍建议按文件名哈希自查近重复帧(库内 Kvasir-SEG 条目的"近重复帧审计"检查单可直接复用)。
同时要分清两个"1,000":HyperKvasir segmented_images(1,000 张)与 Kvasir-SEG(1,000 张)是同规模、同医院、同标注流程、大概率高度重叠的两个发布物(坑 6);而 segmented_images 与 HyperKvasir 自家 labeled_images 的 polyps 类(1,028 张)是官方明示的包含关系(1,000 取自 1,028)。三个集合在论文里的角色各不相同,混用前先想清楚你的"测试集独立性"由哪个边界保证。
3.5 标注的已知局限(论文自曝)
- 观察者变异:即便多名医师过手,低级别反流性食管炎与溃疡性结肠炎等交界类的判定仍可能带偏倚——论文引用既往研究佐证这类分歧的普遍性,并以类目合并(esophagitis 二分类、UC 分档)作为缓解手段。
- 无一致性系数量化:论文未报告标注者间 kappa——"资深医师终审"是流程声明而非测量结果。
- 弃用制的分布代价:无共识样本被替换意味着入库图像偏向"形态典型"的病例,罕见表现与模糊病例系统性偏少。
- 视频粒度粗:视频标签是"整条视频主发现",帧级时间轴标注未系统提供——做息肉实时检测(CADe)需要逐帧监督时,视频部分只能当验证素材而非训练真值。
3.6 Kvasir v1 八类 → HyperKvasir 二十三类的映射对照
HyperKvasir 论文没有给出与前作的显式映射表;下表按类目语义重建,供跨库(旧合并条目 rid 75 ↔ 本条目)对齐使用:
| Kvasir v1/v2 类(8 类) | HyperKvasir 对应 | 变化 |
|---|---|---|
| polyps | polyps(1,028 张)+ segmented(1,000 张) | 扩容;重复图被替换为新图 |
| esophagitis | esophagitis-a + esophagitis-b-d | 一拆二(防低级别观察者分歧) |
| ulcerative colitis | UC grade 1/2/3 + grade 0-1/1-2/2-3 | 一拆六(疾病分级 + 观察质量双轨) |
| z-line | normal-z-line | 更名+扩容(1,000→932) |
| pylorus | normal-pylorus | 更名+扩容(1,000→999) |
| cecum | normal-cecum | 更名+扩容(1,000→1,009) |
| dyed and lifted polyps | dyed-lifted-polyps | 延续(1,002 张) |
| dyed resection margins | dyed-resection-margins | 延续(989 张) |
| —(新增) | ileum / retroflex-stomach / retroflex-rectum | 解剖标志补全 |
| —(新增) | barretts / barretts-short-segment | 巴雷特双类 |
| —(新增) | hemorrhoids / impacted-stool | 痔疮与粪便 |
| —(新增) | bbps-0-1 / bbps-2-3 | 肠道准备质量 |
两个使用提醒:一是 v1 的 8 类每类 1,000 张均衡设计在 HyperKvasir 中被真实分布取代——任何"Kvasir 均衡基准上训、HyperKvasir 真实分布上测"的迁移实验,测的既是泛化也是分布漂移;二是三张正常标志类(z-line/pylorus/cecum)在两代间语义相同,是跨库对齐最稳的锚点类。
§4 官方基线实验:论文的技术验证怎么做的
4.1 实验设置
论文 Technical Validation 节给出三类实验:多类分类基线、未标注集伪标签构成分析、聚类实验(特征与指派文件放 GitHub)。分类实验使用官方 k 折划分(split_0 与 split_1 两折,划分文件在 GitHub official_splits 目录,论文正文未给出各折的具体张数——复现者应直接下载划分文件而非从正文反推),报告两折平均。五个方法:ResNet-50 / ResNet-152 / DenseNet-161 三个 ImageNet 预训练单模型,加两个集成(双模型平均、双模型+MLP),对照 Random Guessing 与 Majority Class 两个下界。指标:macro 与 micro 两套 Precision/Recall/F1,外加 MCC(Matthews 相关系数)。
4.2 五方法成绩单(Table 3 官方口径,两折平均)
| 方法 | macro P | macro R | macro F1 | micro F1 | MCC |
|---|---|---|---|---|---|
| Pre-Trained ResNet-50 | 0.589 | 0.536 | 0.530 | 0.839 | 0.826 |
| Pre-Trained ResNet-152 | 0.639 | 0.605 | 0.606 | 0.906 | 0.898 |
| Pre-Trained DenseNet-161 | 0.640 | 0.616 | 0.619 | 0.907 | 0.899 |
| Averaged ResNet-152 + DenseNet-161 | 0.633 | 0.615 | 0.617 | 0.910 | 0.902 |
| ResNet-152 + DenseNet-161 + MLP | 0.612 | 0.606 | 0.605 | 0.909 | 0.902 |
| Random Guessing | 0.044 | 0.038 | 0.034 | 0.044 | 0.000 |
| Majority Class | 0.004 | 0.043 | 0.008 | 0.108 | N/A |
4.3 怎么读这张表(三条守则)
- macro 与 micro 的落差是主角:micro F1 0.910 vs macro F1 0.619——近 0.3 的差距不是模型不行,而是 23 类分布从 1,148 张到 6 张的极端长尾。micro 指标被大类(bbps-2-3、polyps、cecum 等)主导,macro 指标被极小类(hemorrhoids 6 张、ileum 9 张)拖垮。报告 HyperKvasir 分类结果时必须同时给两套,只报 micro 的"高精度"或只报 macro 的"低分"都是选择性引用。
- 集成不解决长尾:双模型集成只把 macro F1 从 0.619 拉到 0.617(反而略降)——长尾问题靠架构与集成无效,需要重采样/重加权/少样本学习,这正是论文把不平衡当作核心挑战写进官网文案的原因。
- MCC 0.9 的语境:MCC 对偏斜数据比 F1 稳健,0.899-0.902 的 MCC 说明多数类预测质量扎实;但它同样主要由大类贡献——与守则 1 合读。
4.4 混淆矩阵的医学信号
论文 Fig. 8 给出两个最佳模型的混淆矩阵,主要误判轴集中在上消化道黏膜交界类:Z-line ↔ esophagitis ↔ Barrett’s 互相渗透。论文对此的解读很克制:“至少 Z 线、食管炎与巴雷特食管之间的混淆与人类评估这些病变时的变异相似”——即模型把"医学上本来就难分"的边界学成了"自己也不确定",这与标注侧"弃用制"留下的一致性下限并不矛盾:模型在专家能分清的样本上达到高一致,在专家靠合并类目绕开的模糊区上暴露同样的不确定性。这对"用 confusion matrix 反推标注噪声"的审计思路是一个正面案例。
4.5 论文刻意没做的实验:分割基线
值得注意的"缺席":尽管发布了 1,000 张掩码,论文的 Technical Validation 没有做任何分割实验——分割掩码的用例说明直接转引 Kvasir-SEG 论文。原因不难理解:同团队在同期独立发布的 Kvasir-SEG 论文里已经把"1,000 张息肉图+掩码"的基准角色讲透(含 U-Net 风格基线与 Dice/IoU 协议),HyperKvasir 论文把分割叙事整体委托给了它。对使用者的含义:在 HyperKvasir 分割集上报告结果时,官方没有可对标的 baseline 数字与官方划分,一切横比都必须先对齐划分协议(见 §5.3)。
4.6 指标定义速查:本条目出现的每个数字怎么算
| 指标 | 定义 | 在本集的读法 |
|---|---|---|
| micro-F1 | 全局 TP/FP/FN 汇总后算 F1(逐样本等权) | 0.910——被大类主导,反映"常见检查项"的总体水平 |
| macro-F1 | 逐类 F1 的算术平均(逐类等权) | 0.619——6 张的 hemorrhoids 与 1,148 张的 bbps-2-3 同权 |
| MCC | 马修斯相关系数,兼看四象限的平衡一致性 | 0.902——偏斜数据下比 F1 稳健,但仍偏大类 |
| IoU(Jaccard) | 交集/并集(像素级) | 分割下游主指标;Res34UNet 0.9482 为自定划分口径 |
| Dice(F1 像素版) | 2×交集/(pred+gt) | 与 IoU 单调关联,息肉分割文献惯用 |
| mIoU | 逐图 IoU 的平均 | 帧级/图像级平均口径,横比时先确认分母 |
三条防误读提醒:
- macro 与 micro 之间没有"谁真谁假"——它们分别回答"常见类学得如何"与"稀有类学得如何",只引一个等于隐去一半结论(官方基线 0.910 vs 0.619 的 0.29 差距就是本集不平衡系数的直接影像)。
- MCC 与 accuracy 在极端不平衡下的排序可以相反;跨论文比较时先确认指标家族再比数值。
- Dice 与 IoU 的换算依赖类别占比,无法用固定公式互转——文献表格里混列两者时(如 §5.2),要回到各自原文核对计算口径。
§5 下游生态:从 2020 到 2026 的基准演化
5.1 生态位:三块数据的三个社区
| 子集 | 主要消费社区 | 典型用法 |
|---|---|---|
| 10,662 标注图(23 类) | 医学图像分类、多标签/长尾学习 | 分类 backbone 对比、类别不平衡方法研究、跨库迁移 |
| 99,417 未标注图 | 半监督/自监督/无监督学习 | 预训练、伪标签、对比学习、域适应 |
| 1,000 分割图 | 息肉分割社区 | 与 Kvasir-SEG 并列的分割评测场(自定划分) |
| 374 条视频 | CADe/过程理解 | 在线检测验证、真实分布压力测试 |
5.2 分割下游的数字样例(自定划分,勿直接横比)
HyperKvasir 分割集没有官方划分,下游论文各显神通;引用这些数字时必须连同其划分协议一起引:
| 模型(年份) | 报告口径 | 数字 | 协议提示 |
|---|---|---|---|
| Res34UNet(ACM 2025) | HyperKvasir test IoU / Dice | 0.9482 / 97% | 论文自有划分;同模型 KvasirSEG Dice 92.64%——同模型跨库差 4+ pp 说明 HyperKvasir 测试分布更"顺" |
| UPolypSeg | KvasirSEG 口径 Dice 96.86(对照系) | — | 该文以 KvasirSEG 为主场,HyperKvasir 仅对照 |
| MAPSeg(Frontiers 2026) | Hyper-Kvasir in-distribution IoU 0.48±0.22 | 低样本自监督协议 | 异常检测式设定(PaDiM/IGD 同表对照),与全监督数字不可比 |
| DenseUNet / ColonSegNet / SegNet | 各自论文协议 | 多见于 KvasirSEG 主场 | 文献综述(AIR 2023)将 HyperKvasir 列为标准库之一 |
对这批数字的宏观判断:全监督方法在"自家划分"的 HyperKvasir 测试集上普遍能跑到 Dice 0.95 上下——分割集的难点不在绝对分数,而在(a)跨库泛化(HyperKvasir→ETIS/CVC-ColonDB 的掉分远大于库内分数)与(b)划分协议不统一造成的虚高。这也是库内 Kvasir-SEG 条目"永远做跨库 zero-shot 评估"守则的适用场景。
5.3 划分协议的三条实践建议
- 分类任务:直接用 GitHub
official_splits(split_0/split_1)——这是官方明示的公平比较口径(README 原文 “We recommend that users of this dataset use these splits in order to ensure a fair comparison of results”)。 - 分割任务:官方无划分。常见做法是从 1,000 张中按比例自切训练/验证/测试并在论文中写明;文献中流传的"880/100/120"划分未获官方来源确认(遗留疑点 3)——采用前先核实出处,并在论文中显式声明自己的划分。
- 半监督任务:99,417 张未标注池+10,662 张标注池的配比是官方设计;实验时不要把未标注池里的图混进测试集(同一检查的相邻帧可能同时出现在两池,建议按文件名前缀与时段做检查级切分自查)。
5.4 半监督生态位的一个横向对照
把"标注:未标注"配比当作数据集的设计参数看,Kvasir 家族自身的演化一目了然:
| 数据集(库内 rid) | 标注 | 未标注 | 配比 | 定位 |
|---|---|---|---|---|
| Kvasir v1/v2(无独立条目,并入旧 rid 75) | 8,000 | 0 | 纯监督 | 2017-2019 主流形态 |
| HyperKvasir(本条目) | 10,662+1,000 | 99,417 | ~1:8.5 | 2020:无标注池首次成主角 |
| Kvasir-Capsule(123) | 4,741,621 帧中标注图 4,738+视频 117 | 469 万帧 | ~1:1000 | 2021:胶囊内镜极端配比 |
| Kvasir-Instrument(213) | 5,941 帧+117 视频掩码 | — | 分割专用 | 2021:器械分割垂直集 |
这个演化线与医学影像社区的方法论迁移同频:当半监督/自监督成为标配,数据集的"未标注资产价值"开始与"标注规模"平起平坐。HyperKvasir 是这条曲线上的第一个常规内镜节点,其 GitHub ARFF 特征文件的设计(连特征提取都替你做了)则是"降低无监督门槛"的诚意之举。
5.5 引用热度与社区足迹
- Scopus 口径 458 次引用(OUCI 记录,2026 抓取);Google Scholar 口径更高(姊妹篇 Kvasir-SEG 以 2,500+ 成为分割基准引用王,HyperKvasir 作为"家族总集"被大量综述收录)。
- GitHub simula/hyper-kvasir:官方代码仓(分类/聚类实验脚本 + official_splits + ARFF 特征);第三方存在同名镜像仓。
- HF 官方镜像 SimulaMet-HOST/HyperKvasir(2025-05 上传):downloads 134 / likes 3(2026-09-27 hf-mirror 实测)——低热度高保真:镜像价值在于给被墙环境提供 programmable 入口,而非社区活跃度指标。
- 第三方生态:datasetninja(Supervisely 格式转换+逐类统计)、Zenodo 第三方模型仓(Mayer et al. 2023 的 13 个 landmark 分类模型)、Kaggle/MMAI 教学社区——"数据集即基础设施"的长尾使用面。
5.6 跨库评测协议模板:HyperKvasir 在环的五步设计
以内镜 AI 论文最常见的"主训练集+外部验证"需求为例,把 HyperKvasir 及其库内邻接条目编成一个可复用的协议:
| 步骤 | 动作 | 涉及库内条目 | 陷阱对冲 |
|---|---|---|---|
| 1. 主训练集选型 | 息肉分割选 Kvasir-SEG(协议成熟);多类分类选本集(official_splits) | 112 / 本条目 | 分类勿用自切划分刷点 |
| 2. 同源去重 | 与 Kvasir-SEG/本集分割包联用时逐张 pHash 去重(附录 Z 骨架) | 112 ↔ 本条目 | 坑 6 同源泄漏 |
| 3. 内部验证 | 按官方划分留出;分类 macro/micro 同报;分割 mIoU+Dice 同报 | 本条目 | §4.3 守则 |
| 4. 外部验证 | 测试集轮换:ETIS-Larib → CVC-ColonDB → CVC-ClinicDB(难度递增口径) | 153 / 142 / 133 | 每库预处理对齐(resize 策略/ScopeGuide 裁剪) |
| 5. 真实分布复测 | 视频帧或未标注池抽样做部署前压力测试 | 本条目(视频/未标注) | 单中心限制写进 limitations |
三点协议说明:其一,步骤 4 的三库都是"小而难"的经典测试集(196/380/612 张),与 HyperKvasir 的规模差两个数量级——迁移掉分主要来自设备/医院域差而非规模,论文里应把"跨域"与"跨规模"分开声明。其二,步骤 2 的去重必须覆盖三个边界:本集 segmented ↔ Kvasir-SEG(坑 6)、本集 segmented ↔ 本集 labeled polyps(官方明示包含)、本集 labeled ↔ Kvasir v1 polyps(官方明示替换史)。其三,若研究声明"半监督",步骤 5 的无标签池抽样复测能直接暴露伪标签放大偏差的效应——这是 HyperKvasir 独有的自检手段(近 10 万张未标注池是现成的压力测试素材)。
5.7 论文数据声明写作模板(Data Availability Statement)
使用本数据集发表论文时,数据声明段可直接套用以下骨架(对应官网 Terms of Use 的引用义务):
数据可用性声明模板:
- 训练/评测数据:本研究使用了公开的 HyperKvasir 数据集
[Borgli et al., Sci Data 2020;7:283, doi:10.1038/s41597-020-00622-y],
可于 https://datasets.simula.no/hyper-kvasir 与
https://osf.io/mh9sj 免费获取(CC BY 4.0)。
- 划分协议:分类实验采用官方 k 折划分(split_0/split_1,
github.com/simula/hyper-kvasir);分割实验为本研究的自定义划分
(比例 X/Y/Z,随机种子 S),划分清单见补充材料。
- 跨库评测:外部验证采用 [ETIS-Larib / CVC-ColonDB / CVC-ClinicDB]
(各自引用),与训练集的近重复帧审计(pHash 阈值 T)结果见附录。
- 代码:本文代码发布于 [your repo],复现步骤见 README。
三点写作提醒:其一,声明里同时给出论文 DOI 与数据集 OSF/官网两个入口,审稿人复现时不再需要检索;其二,凡自定划分必写"比例+种子+清单获取方式"——官方无分割划分是公开事实,含糊其辞会被视为隐瞒协议;其三,若使用了 Kvasir-SEG 与本集分割包的并集,必须写明去重审计结果(坑 6),否则两集同源问题会成为审稿意见的固定攻击点。
§6 获取与许可:无注册墙的直链设计
6.1 三条获取通道
| 通道 | 入口 | 内容 | 门槛 |
|---|---|---|---|
| 官网直链 | datasets.simula.no/hyper-kvasir | 5 个 zip(全量 58.6GB + 4 分块) | 无注册、无审批,点击即下 |
| OSF | osf.io/mh9sj(DOI 10.17605/OSF.IO/MH9SJ) | 与官网同源的完整数据+元数据 | 无 |
| HuggingFace 镜像 | SimulaMet-HOST/HyperKvasir(2025-05 官方上传) | 4 个分块 zip(63.45GB),gated=false | 无;被墙环境走 hf-mirror.com |
配套资源:GitHub simula/hyper-kvasir(实验代码 + official_splits + ARFF 特征)、论文机器可读元数据(figshare 10.6084/m9.figshare.12759833)、联系人 steven@simula.no / michael@simula.no / paalh@simula.no。主数据集不在 Zenodo——Zenodo 上能搜到的是第三方衍生模型(坑 3)。
6.2 许可条款细读
- 数据集:CC BY 4.0(论文 Data Records 原文 + 官网 Terms of Use)。署名即可自由使用、修改、再分发、商用;附加约束仅一条——使用数据或报告基于其的实验结果时必须引用论文(doi:10.1038/s41597-020-00622-y)。
- 论文:CC BY 4.0 开放获取(© The Author(s) 2020)。
- HF 镜像卡异常:SimulaMet-HOST/HyperKvasir 的 cardData 字段 license 标 “mit”——与官方 CC BY 4.0 冲突(坑 4)。HF 的 license 标签影响自动合规扫描器的判断;工程管线若从 HF 卡片读许可,应显式覆盖为官方 CC BY 4.0 并留档。
- 隐私与伦理:挪威数据保护局(Datatilsynet)批准;区域伦理委员会(REK South-East Norway)免审批(数据采集不干扰诊疗);全匿名+元数据删除+文件名随机化,按挪威法律与 GDPR 可公开共享——使用者无需再过隐私审批即可分发衍生品,这是 CC BY 4.0 之外的"第二重开放"。
6.3 下载与存储实操
全量包(一次性拿全):hyper-kvasir.zip 58.6GB
分块包(按需选配):
hyper-kvasir-labeled-images.zip 3.9GB ← 分类任务
hyper-kvasir-segmentation.zip 46MB ← 分割任务(性价比之王)
hyper-kvasir-unlabeled-images.zip 29.4GB ← 半监督/自监督
hyper-kvasir-videos.zip 25.2GB ← CADe/过程理解
# HuggingFace 镜像加载(被墙环境:export HF_ENDPOINT=https://hf-mirror.com)
from huggingface_hub import hf_hub_download
# 官方镜像为原始 zip 打包(非 datasets 脚本格式),取 zip 后自行解压
p = hf_hub_download("SimulaMet-HOST/HyperKvasir",
"hyper-kvasir-segmentation.zip",
repo_type="dataset")
# 解压后目录:segmented-images/{images, masks}(同名 JPEG 成对)+ bboxes.json
三类使用者的最小路径:只想做分割 → 46MB 分割包 + 官方 GitHub 脚本;做分类 → 3.9GB 标注包 + official_splits;做半监督 → 3.9GB+29.4GB 两包(磁盘预算 35GB 内,不必下 58.6GB 全量)。
6.4 AI-Ready 评估:DAIMS 全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | 三通道直链+论文+GitHub+HF 镜像;名称双拼(HyperKvasir/Hyper-Kvasir)轻微分散检索命中 |
| A 可获取性 | 9 | 无注册墙直链+CC BY 4.0+镜像完备;扣分项:58.6GB 大包对低带宽地区不友好(分割包 46MB 已对冲) |
| I 可互操作 | 8 | JPEG/AVI/CSV/JSON/ARFF 全标准格式+官方划分+逐类文件夹结构;扣分:无 DICOM/元数据 schema 层,视频帧级标注缺失 |
| M 元数据质量 | 7 | 论文 Table 2/3+CSV 映射+figshare 机器可读元数据;扣分:分辨率/帧率只在图里、视频数与时长双口径(坑 1/2)、HF license 标签错误(坑 4) |
| S 可持续性 | 8 | Simula 机构托管 6 年+、OSF 双备份、HF 官方镜像三重冗余;机构级联系人明确 |
| 综合评级 | 8.0/10(高) | 医学影像数据集 AI-Ready 光谱的开放端标杆;失分集中在文档口径漂移而非制度性壁垒 |
与库内光谱对照:HyperKvasir 位于"公开直链"档(同档:Kvasir-SEG、Kvasir-Capsule),显著高于请求制(PANDA-PLUS 掩码)与注册墙(LMC2)档位;其特色是**“三通道冗余+零门槛”**——同一份数据在机构官网、OSF、HF 各有一份完整副本,单点失效风险接近于零。
6.5 下载与使用的常见故障对策
| 症状 | 原因 | 对策 |
|---|---|---|
| 官网/OSF 下载缓慢或中断 | 58.6GB 单包跨洲传输 | 改分块包按需取;或走 HF 镜像(hf-mirror 中转) |
| HF load_dataset 报错 | 官方镜像是 raw zip 而非 datasets 脚本格式 | 用 hf_hub_download 取 zip 后手动解压(§6.3 代码) |
| HF 卡显示 license: mit | 卡片元数据标注错误(坑 4) | 以官方 CC BY 4.0 为准,管线内显式覆盖 |
| 搜 “Hyper Kvasir Zenodo” 找不到官方数据 | 官方不在 Zenodo(坑 3) | 认准 OSF DOI 10.17605/OSF.IO/MH9SJ |
| 解压后找不到未标注图 | unlabeled 是 images 目录的子目录 | 检查 images/unlabeled/ 二级结构 |
| 图像分辨率千奇百怪 | 原片分布不均一(论文 Fig. 2) | 设计 resize/裁剪策略并写进方法节,勿假设统一尺寸 |
| 训练集分数虚高 | 测试帧与训练帧近重复(同一检查相邻帧) | 按检查级切分 + pHash 审计(附录 Z) |
| 极小类训练崩坏 | 6-30 张类权重爆炸 | 附录 Y 权重截断策略 |
6.6 AI-Ready 视角下的"第二重开放":隐私免审
多数医疗数据集的开放度卡在隐私审批:即便数据方愿意公开,使用方还要过自家伦理委员会的匿名化确认。HyperKvasir 把这一步前置化了——匿名化由医院 IT 部门在导出前完成(元数据全删+文件名随机化),法律口径(挪威+GDPR)明确写进论文,使用方的伦理审查因此从"隐私审批"降为"引用已发表免责声明"的常规流程。对跨国研究组,这直接省掉数周到数月的合规时延——这是 DAIMS 五维之外的隐性开放维度,也是 CC BY 4.0 匿名影像集相对 DICOM 患者数据集的结构性优势。
§7 生态与谱系:一个数据集如何长成一个家族
7.1 Kvasir 家族时间线
| 年份 | 成员 | 规模 | 角色 |
|---|---|---|---|
| 2017 | Kvasir v1 | 4,000 图 / 8 类 | 家族起点(MediaEval 2017 Medico 指定数据) |
| 2018-2019 | Kvasir v2 | 8,000 图 / 8 类+扩展类 | 扩容版(MediaEval 2018/ACM MM 2019 BioMedia) |
| 2020-08 | HyperKvasir(本条目) | 110,079 图 + 374 视频 + 1,000 分割 | 规模与覆盖面旗舰 |
| 2020-10 | Kvasir-SEG(rid 112) | 1,000 息肉图+掩码 | 分割基准旗舰(MMM 2020) |
| 2021 | Kvasir-Capsule(rid 123) | 471 万帧胶囊内镜 | 胶囊内镜旗舰(Scientific Data 姊妹篇) |
| 2021 | Kvasir-Instrument(rid 213) | 5,941 帧+视频掩码 | 器械分割垂直集 |
家族设计哲学一以贯之:真实临床原片、专家标注、CC 开放许可、OSF/simula.no 直链、配套挑战赛(Kvasir 时代经 MediaEval/BioMedia 起家,HyperKvasir 时代起改为"官方划分+公开基线"的基准化路线)。HyperKvasir 是家族里唯一覆盖"图+视频+分割+未标注"四种资产的全能成员,也是其余成员的"母集背景板"——Kvasir-SEG 的分割图、Kvasir-Instrument 的器械帧都能在这 110,079 张的采集语境里找到来源。
值得展开的是这次"从挑战赛到基准化"的路线转变。Kvasir v1/v2 的时代,Simula 把数据集运营成 MediaEval Medico(2017/2018)与 ACM MM BioMedia(2019)的官方素材,靠竞赛拉动采用率——竞赛给了数据集曝光,但也把数据集锁死在竞赛的固定划分与赛题口径里。HyperKvasir 换了一条路:不办赛,而是把公平比较的基础设施直接做进发布物——官方 k 折划分(“We recommend that users of this dataset use these splits in order to ensure a fair comparison of results”)、五个方法的公开基线(Table 3)、可下载的实验代码与特征文件。事后看这条路线的成效:Kvasir-SEG 沿袭基准化路线成为息肉分割的事实标准(rid 112 条目有完整排行榜),而 HyperKvasir 的 official_splits 成为多类分类论文的标准引用点——"把划分与基线当数据集的一部分发布"自此成为 Kvasir 家族的默认配置,也被后来的 GastroVision(rid 203)等直接继承。同期注意一个边界:MediaEval 2020 的 Medico 任务用的是 Kvasir-SEG(息肉分割主题),不是 HyperKvasir——把 HyperKvasir 写成"MediaEval 2020 指定数据"是常见的二手错误。
7.2 与同期内镜数据集的景观对照(论文 Table 1 口径摘译)
| 数据集 | 发现 | 规模 | 获取 |
|---|---|---|---|
| CVC-356 / CVC-ClinicDB / CVC-VideoClinicDB(rid 133 族) | 息肉 | 356/612/11,954 图 | by request / open academic |
| CVC-ColonDB(rid 142) | 息肉 | 380 图 | by request |
| ETIS-Larib(rid 153) | 息肉 | 196 图 | open academic |
| ASU-Mayo polyp database | 息肉 | 18,781 图 | by request |
| KID | 多类(胶囊内镜) | 2,371 图+47 视频 | open academic |
| Kvasir v1 | 8 类 | 8,000 图 | open academic |
| Kvasir-SEG(rid 112) | 息肉分割 | 1,000 图+掩码 | open academic |
| HyperKvasir | 23 类+30 视频类+分割 | 110,079 图+374 视频 | CC BY 4.0 直链 |
论文自己画的这张景观表把 2020 年的格局说得很清楚:息肉分割赛道已有 CVC/ETIS/Kvasir-SEG 一批小而精的玩家,而"多类、多部位、带视频、带未标注池"的组合维度上是 HyperKvasir 独一份。今天补看这张表还要加两行:多中心息肉集 PolypGen(rid 183)与上消化道分类集 GastroVision(rid 203)——前者补了跨中心泛化维度,后者在上消化道细分类上走得更深,两者都是 HyperKvasir 的直接下游竞品/互补品。
7.3 商业与临床转化端口
作者侧的公司 Augere Medical AS(Oslo,挪威)承担了视频标注平台的建设(论文 Methods 明确写视频标注使用 Augere 的平台);Hanna Borgli 的 2026 博士论文(UiO,内镜分割自动 prompt 生成方向)是家族学术血脉的延续。与"发表论文即结束"的一次性数据集不同,Kvasir 家族的持续运营模式(机构托管+镜像+联系人制度)本身就是数据集可持续性的活教材。
§8 方法学启示:三条可迁移的经验
8.1 "标注+未标注"同发的半监督设计
HyperKvasir 用 1:8.5 的标注未标注配比宣告了一个立场:医学数据集的公共产品价值不止于监督信号。配 GitHub 预提取特征(ARFF)的细节尤其值得学习——它把"开始做无监督实验"的门槛从"先跑通特征提取管线"降到"读一个文件"。可迁移做法:任何标注数据集发布时,把采集过程里的"剩余数据"(未过筛、未标注)一并评估发布价值,并为无标签池提供最小可用的特征/元数据副产品。
8.2 类目体系即医学知识工程
23 类不是拍摄清单的自然分组,而是一次显式的医学知识工程:BBPS/MST/Prague/Mayo 四套临床量表被翻译成机器可学的类目,且每个易争议边界(低级别食管炎、巴雷特长短段、UC 分级)都以"拆类或合并"的方式做了显式决策。可迁移做法:设计医学标注类目时,把"临床量表→类目"的映射表写进论文——HyperKvasir 的 §Methods 类目描述节就是范本;反之,把量表隐式塞进类目而不解释合并/拆分理由,会让下游模型的不确定性与医学的不确定性搅在一起无法归因。
8.3 弃用制标注的代价与收益
"无共识样本弃用换新图"是一把双刃剑:收益是入库标签的一致性下限(分类基线能在专家无分歧的样本上跑出 0.91 micro F1),代价是分布被"可标注性"过滤(难例系统性偏少)+无 kappa 量化。可迁移做法:若采用弃用制,至少记录弃用率与弃用样本的类别分布——HyperKvasir 未披露弃用率,这是复现者无法补测的盲区;后来者(如库内多条件标注条目)已普遍转向"记录分歧而非丢弃分歧"的分布化标注路线。
§9 与库内条目的关系
9.1 家族与竞品图谱
- Kvasir-SEG(rid 112):同族姊妹+同源分割子集。两库的 1,000 张息肉掩码高度同源(坑 6)——互链时注明"分割任务先读 112(协议成熟、官方引用条款清晰),HyperKvasir 分割集作为其采集语境的扩展视角";跨库评测时二选一,勿双测。
- Kvasir-Capsule(rid 123):家族胶囊内镜分支。未标注池配比(1:1000)是 HyperKvasir(1:8.5)设计思想的极端版;两库连读即"Simula 无标注资产化"方法论的常规镜+胶囊镜双案例。
- Kvasir-Instrument(rid 213):家族器械分支;HyperKvasir 视频里的器械画面是其采集语境的天然来源。
- kvasir-hyperkvasir(rid 75):旧版合并条目(Kvasir+HyperKvasir 合著,旧标题格式)。本条目发布后形成"旧合并+新完整版"并存;旧条目的 Kvasir v1/v2 背景叙述仍有效,规模数字以本条目为准。
- CVC-ClinicDB(133)/ CVC-ColonDB(142)/ ETIS-Larib(153):息肉分割跨库泛化的标准三件套——HyperKvasir 分割模型的外部验证首选("库内分数虚高、ETIS 现原形"是这些条目共同的检查单结论)。
- LDPolypVideo(163)/ PolypGen(183):视频息肉与多中心息肉赛道——HyperKvasir 视频子集(30 类、帧级标注缺失)在 CADe 训练上的短板由 163 补,跨中心泛化短板由 183 补。
- GastroVision(203):上消化道多类分类的直接竞品——8 类精标设计 vs HyperKvasir 23 类长尾设计,是"类目宽度 vs 类目平衡"的方法论对照。
- BKAI-IGH NeoPolyp(84):息肉分割+分型(增生性/腺瘤性)——比 HyperKvasir 分割集多了病理亚型维度。
9.2 检索路径建议
- 检索词组合:“HyperKvasir” 与 “Hyper-Kvasir” 双拼都要搜(坑 7);“HyperKvasir” + “segmentation” 找分割下游,+ “semi-supervised” 找无标注池用法。
- 找数据:优先官网五 zip 按需下载(§6.3 最小路径);被墙环境走 HF 镜像。
- 找基线:分类引论文 Table 3(micro/macro 同报),分割无官方基线——引 §5.2 数字时必须连同划分协议。
- 引用家族背景:Kvasir v1/v2 的挑战赛史(MediaEval/BioMedia)在旧合并条目(rid 75)里,规模数字以本条目为准。
9.3 互链锚点执行清单(发布侧)
发布后由主会话串行执行(本代理不写库、不改他条目),建议的锚点文本与目标:
| 源条目(rid) | 锚点文本建议 | 目标 |
|---|---|---|
| kvasir-seg(112) | “姊妹扩展 HyperKvasir(11 万张全消化道)” | /ai-ready-dataset/hyperkvasir/693 |
| kvasir-capsule(123) | “同家族常规内镜旗舰 HyperKvasir” | 同上 |
| kvasir-instrument(213) | “家族总集 HyperKvasir” | 同上 |
| kvasir-hyperkvasir(75) | “完整版 HyperKvasir 条目” | 同上 |
| gastrovision(203) | “全消化道长尾对照 HyperKvasir” | 同上 |
| 本条目(hyperkvasir) | 互链回指 112/123/213/75/133/142/153/163/183/203/84 | 各条 URL |
执行原则:旧合并条目(75)的回链务必保留——它承载 Kvasir v1/v2 的挑战赛史,是家族叙事的另一半;本条目发布不撤 75,只做新旧分工声明(附录 M)。
§10 避坑清单:八个已踩过的坑
坑 1:视频数 374 vs 373 双口径。论文摘要、正文、Data Records 表三处一致写 374;GitHub README、官网现版(2026-06 更新)、第三方 Zenodo 模型卡写 373。本条目正文以论文口径 374 为主、随注 373;引用前先定口径并全篇一致。
坑 2:视频时长/帧数两套账。论文:9.78 小时 / 889,372 帧;官网现版:11.62 小时 / 1,059,519 帧 / 171 处标注发现。差异可能源于统计时点或包含量修视频的口径变化,官方未解释。HF 官方卡片又把"171 annotated findings"误写为"171 sequences"——三层数字三层所指(视频数/帧数/发现数),引用时逐项对原文。
坑 3:主数据集不在 Zenodo。HyperKvasir 官方托管是 OSF(10.17605/OSF.IO/MH9SJ)+ datasets.simula.no 直链;Zenodo 搜 “Hyper Kvasir” 命中的是第三方衍生模型(如 Mayer et al. 2023 的 13 个 landmark 分类模型)。把 Zenodo 链接当官方出处写进论文是常见错误。
坑 4:HF 官方镜像卡 license 标错。SimulaMet-HOST/HyperKvasir 的 HF cardData license 字段写 “mit”,官方许可是 CC BY 4.0。自动化合规扫描若读 HF 标签会得出错误结论;管线中应显式覆盖并留档。
坑 5:机构误记 NTNU/St. Olavs。论文 19 位作者的 14 个署名单位里没有 NTNU,采集医院是 Bærum(Vestre Viken),不是 Trondheim 的 St. Olavs。部分二手综述与旧候选清单把 Kvasir 家族与 NTNU 绑定,属于以讹传讹——以论文署名页为准。
坑 6:与 Kvasir-SEG 的同源泄漏风险。两个"1,000 张息肉+掩码"集子同医院、同流程、同规模;第三方资料直接写"分割图像与 Kvasir-SEG 相同",官方未逐一确认。在两个集子上分别做训练/测试会人为制造"好成绩";跨库评测设计者应把两者视为同一数据池的两个发布物处理。
坑 7:一名两拼。论文拼 HyperKvasir,仓库/URL/部分文献拼 Hyper-Kvasir(数据集 URL 即 hyper-kvasir)。检索、建库、写 BibTeX 时两个拼写都会命中不同文献集合,需合并去重。
坑 8:三个"类数"三个所指。图像 23 类 / 视频 30 类 / 官网 171 处标注发现(HF 卡又误写 171 sequences)——三者互不通用;23 类的逐类计数只存在于论文 Fig. 4(图,无数字表),本条目引 Dataset Ninja 实测值(总和=10,662 自洽校验通过)。
§11 总结
11.1 三句话总结
- HyperKvasir 用 110,079 张图 + 374 条视频把"常规内镜检查"整体数字化:23 类标注覆盖解剖标志、疾病、治疗干预与肠道准备质量四维,是公开内镜数据里覆盖面最全的单一集。
- 它的设计旗帜是"标注是瓶颈,未标注数据也是资产"——99,417 张未标注图+预提取 ARFF 特征,让它成为半监督/自监督医学影像研究的标准底座(Kvasir-Capsule 的极端配比是其思想续作)。
- CC BY 4.0+三通道直链+官方划分+标准格式的组合使它稳居库内 AI-Ready 光谱开放端(DAIMS 8.0);主要陷阱集中在文档口径漂移(视频数/时长/license 标签)与 Kvasir-SEG 同源泄漏,均有存照解法。
11.2 适合谁
- 内镜图像分类团队:23 类长尾分类是比 8 类 Kvasir 更真实的基准,official_splits 直接可用。
- 半监督/自监督研究者:近 10 万张同分布无标签池在同类公开资源里仍属稀缺。
- 息肉分割入门者:46MB 分割包+GitHub 脚本是最低成本起点(进阶请转 Kvasir-SEG 条目的协议与排行榜)。
- 数据集工程研究者:类目知识工程、弃用制标注、无标注资产化三个方法论案例集于一身。
11.3 不适合谁
- 需要帧级视频监督的 CADe 训练(视频只有视频级主发现标签;转 LDPolypVideo)。
- 需要跨中心泛化声明的研究(单中心 2008-2016 采集;转 PolypGen)。
- 需要病理亚型/组织学标签的研究(23 类全是内镜形态学;息肉分型转 BKAI-IGH NeoPolyp)。
- 需要平衡类分布的小样本学习评测(最小类仅 6 张——这既是特色也是硬约束)。
11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 想快速跑通内镜分割 | 46MB 分割包 + Kvasir-SEG 条目(rid 112)协议,注意坑 6 泄漏 |
| 做多类分类刷点 | labeled-images 3.9GB + official_splits;micro/macro 必须同报 |
| 做半监督/自监督 | 3.9GB+29.4GB 双包;测试集自查无标注池泄漏(§5.3-3) |
| 要商用 | CC BY 4.0 允许商用,引用论文即可;别信 HF 卡的 MIT 标签(坑 4) |
| 写综述画景观 | 论文 Table 1 + §7.2 对照表 + rid 183/203 补 2023-2024 生态 |
| 引用数字 | 视频数先选口径(坑 1),类数分清 23/30/171(坑 8) |
FAQ(高频问答 42 问)
A. 基础认知
Q1:HyperKvasir 是挑战赛数据集吗?
不是。它没有比赛、没有 leaderboard,是学术团队发布的研究数据集。其前作 Kvasir 曾是 MediaEval 2017/2018 与 ACM MM 2019 BioMedia 的指定数据,但 HyperKvasir 本身走"论文+官方划分+公开基线"的基准化路线。
Q2:和 Kvasir 是什么关系?
直接后代。Kvasir(2017,4,000 图 8 类,后扩 8,000)的前 4,000 张就取自同一 Picsara 影像库;HyperKvasir 是同一采集源的全面扩张——标注类目从 8 类到 23 类,并新增未标注池、分割集与视频。Kvasir polyps 类的重复图在 HyperKvasir 中已被高质量新图替换。
Q3:和 Kvasir-SEG 是什么关系?
同族姊妹+同源分割子集:同为 1,000 张息肉图+像素掩码+边界框、同在 Bærum 医院、标注流程同构(HyperKvasir 论文把分割标注的详细描述转引 Kvasir-SEG 论文)。官方未逐一声明两批图是否逐张相同,第三方资料多写"相同"——工程上应视为同一数据池的两个发布物(坑 6)。
Q4:发布时点与论文?
Scientific Data 2020-08-28 发表(7:283,doi:10.1038/s41597-020-00622-y);Received 2019-12-31 / Accepted 2020-07-21。开放获取,论文与数据均 CC BY 4.0。
Q5:谁做的?
19 位作者、14 个机构:SimulaMet、OsloMet、UiO、Bærum 医院、UiT、Karolinska、癌症登记处、Klagenfurt、SINTEF、Bergen、Augere Medical、Sahlgrenska、Ersta。一作 Hanna Borgli,通讯 Pål Halvorsen;前 5 位作者同等贡献。无 NTNU(坑 5)。
Q6:最大的卖点一句话?
2020 年时点最大公开消化道数据集,且"标注集+近 10 万张未标注池+分割集+视频"四资产同发——把半监督学习的基础设施第一次搬进了常规内镜领域。
Q7:它自己承认什么局限?
观察者变异偏倚(低级别食管炎、UC 等交界类)、单中心采集、类别极端不平衡(6 张到 1,148 张)、视频只有视频级标签、部分图像带 ScopeGuide 画中画伪影。论文与 HF 卡片均有自述。
Q8:开源程度?
全开放:数据 CC BY 4.0 直链、实验代码 GitHub、官方划分公开、ARFF 特征公开、论文开放获取。没有请求制环节、没有注册墙。
Q9:数据是原片还是处理过的?
原片。论文原文声明零预处理、零增强;元数据全删、文件名随机化是隐私处理,不改像素。ScopeGuide 画中画缩略图等采集伪影原样保留。
Q10:为什么叫 Hyper?
相对 Kvasir 的"超集/扩张"之意——标注图扩容、类目扩容、再加三种新资产(未标注、分割、视频)。论文拼写 HyperKvasir,URL 拼写 hyper-kvasir(坑 7)。
B. 数据与获取
Q11:四个子集的准确数字?
标注图 10,662(23 类,3,960MB);未标注图 99,417(29,940MB);分割图 1,000(57MB,含掩码+bbox);视频 374 条(论文口径,32,539MB,30 个视频级类)。图像合计 110,079。
Q12:去哪下、下哪个包?
官网 datasets.simula.no/hyper-kvasir 或 OSF osf.io/mh9sj:全量 58.6GB 或分块(标注 3.9GB/分割 46MB/未标注 29.4GB/视频 25.2GB)。按任务选块,不必下全量(§6.3 最小路径)。
Q13:视频到底是 374 还是 373 条?
论文三处写 374;官网现版与 GitHub README 写 373(坑 1)。引用时选定口径并注明来源;本条目正文以论文口径为主。
Q14:视频的时长与帧数?
论文:9.78 小时/889,372 帧;官网现版:11.62 小时/1,059,519 帧/171 处标注发现(坑 2)。两套口径均出自官方,官方未解释差异。
Q15:图像分辨率是多少?
不均一,论文仅以 Fig. 2 给出 110,079 图的分辨率分布图,正文无数值表——不要引用任何"固定分辨率"数字。视频分辨率/帧率同理在 Fig. 3。
Q16:标注 CSV 在哪?
labeled 图像的映射在 image-labels.csv,视频在 video-labeling.csv(含一条视频多发现的详细描述)。这是把"文件夹结构"翻译成"文件级标签表"的机器可读层。
Q17:未标注图有没有配套特征?
有。GitHub 提供 ARFF 格式的预提取全局特征与聚类指派(WEKA 兼容,可转 CSV)——不用先跑特征提取即可开展无监督实验。
Q18:可以用模型直接 load 吗?
HF 镜像(SimulaMet-HOST/HyperKvasir)是原始 zip 打包而非 datasets 脚本格式,需 hf_hub_download 取 zip 后自行解压(被墙环境 export HF_ENDPOINT=https://hf-mirror.com)。四个 zip 与官网分块一一对应。
Q19:能商用吗?
CC BY 4.0 允许商用(署名+引用论文)。HF 镜像卡误标 MIT(坑 4),以官方 CC BY 4.0 为准;隐私侧数据全匿名、无需额外审批。
Q20:下载需要注册或申请吗?
不需要。三通道(官网/OSF/HF)全部零门槛直链——这在医学影像数据集中属最开放档。
C. 类目与标注
Q21:23 类完整清单?
解剖标志 6 类(cecum/pylorus/z-line/retroflex-stomach/retroflex-rectum/ileum)、病理发现 10 类(polyps/esophagitis-a/esophagitis-b-d/UC grade 1/2/3/impacted-stool/barretts/barretts-short-segment/hemorrhoids)、治疗干预 2 类(dyed-lifted-polyps/dyed-resection-margins)、黏膜观察质量 5 类(bbps-0-1/bbps-2-3/UC grade 0-1/1-2/2-3)。逐类张数见 §2.3。
Q22:最大和最小的类差多少倍?
bbps-2-3 1,148 张 vs hemorrhoids 6 张——约 191 倍。ileum(9)、UC grade 1-2(11)、UC grade 2-3(28)都在个位到两位数区间。这是真实临床分布+弃用制标注的叠加结果。
Q23:为什么 esophagitis 只分 A 和 B-D 两类?
低级别(洛杉矶 A 级)与更高级别的观察者一致性差异大,论文刻意二分类:既保留分级信息,又把最不可靠的细分级(B/C/D 之间)合并。这是"把医学不确定性翻译成类目设计"的典型决策。
Q24:标注者是谁?经验如何?
≥1 名资深胃肠内镜医师(Bærum 医院/挪威癌症登记处/Karolinska)+ 一或多名初级医生/博士生;三步法(定类→预标→终审修正),无共识样本弃用替换。未披露人数、工时与 kappa。
Q25:分割掩码怎么标出来的?
Labelbox 平台:初级医生+博士生预分割 → 胃肠医师逐张核验修正。掩码白=息肉、黑=背景;bbox 取息肉最外像素存 JSON。1,000 张图含约 1,064 个息肉对象(约 6% 图像多息肉)。
Q26:视频怎么标的?
Augere Medical 平台,一名资深胃肠医师按整条视频主发现判成 30 类;一条视频可含多类(息肉治疗视频典型地含 polyps+dyed-lifted+margins 三类),细节入 video-labeling.csv。
Q27:图像 23 类和视频 30 类是一套体系吗?
不是。视频类目含检查流程性内容,与图像 23 类不一一对应,数量也不可互换(坑 8)。跨模态映射需自行建立。
Q28:ScopeGuide 缩略图是什么、要不要处理?
部分图像/视频左下角有 Olympus ScopeGuide 的绿色画中画(肠镜定位显示)。做跨库训练时建议统一处理(裁剪或掩蔽)——Kvasir-SEG 条目对此有同款问题的处理讨论。
D. 评测与基准
Q29:官方分类基线的最好成绩?
micro F1 0.910(ResNet-152+DenseNet-161 集成)/ macro F1 0.619(DenseNet-161)/ MCC 0.902。两折(split_0/1)平均。
Q30:为什么 micro F1 那么高、macro F1 只有 0.6?
23 类从 1,148 张到 6 张的极端长尾:micro 被大类主导,macro 被极小类拖垮。两者必须同报,只报一个都是选择性引用(§4.3 守则)。
Q31:官方有没有分割基线和分割划分?
都没有。论文不做分割实验(用例转引 Kvasir-SEG 论文),官方也未定义 1,000 张的 train/val/test——下游自定划分,横比前必须对齐协议。文献流传的"880/100/120"未见官方出处(遗留疑点 3)。
Q32:分割任务在 HyperKvasir 上能到多少分?
全监督方法在自家划分的测试集上普遍 Dice 0.95 上下(如 Res34UNet IoU 0.9482/Dice 97%)。但绝对分数意义有限:跨库(→ETIS/CVC-ColonDB)掉分才是泛化能力的试金石。
Q33:训练/测试划分用哪套?
分类:GitHub official_splits(官方推荐,公平比较口径)。分割:自切并声明协议。半监督:注意标注池与未标注池可能含同一检查的相邻帧,测试前按检查级做泄漏自查。
Q34:能把 HyperKvasir 和 Kvasir-SEG 同时当测试集吗?
不能(坑 6)。两者高度同源,双测等于同一数据池数两次;跨库评测设计应二选一或做逐张去重。
E. 生产与库内
Q35:本条目为什么叫 hyperkvasir 而库内已有 kvasir-hyperkvasir?
rid 75 是早期合并条目(Kvasir+HyperKvasir 合著、旧标题格式);本条目为完整版 HyperKvasir 独立成稿,规模/类目/基线数字以本条目为准,两处互链互补。
Q36:一句话记住本条目与其他 Kvasir 条目的分工?
Kvasir-SEG(112)管"分割协议与排行榜"、Kvasir-Capsule(123)管"胶囊内镜与极端未标注配比"、Kvasir-Instrument(213)管"器械分割"、本条目管"全消化道全景+半监督底座+家族谱系"。
Q37:阴性帧从哪来?
标注集的正常类(normal-cecum/pylorus/z-line、bbps 类等 4,104 张解剖标志)是现成的"无病变"素材——库内 Kvasir-SEG 条目的特异性测试方案(混入阴性帧)即以此为基础。
Q38:和 GastroVision 怎么选?
上消化道多类分类:要类目平衡与上消化道纵深选 GastroVision(8 类精标);要覆盖面+视频+未标注池选本集。两者互为"宽度 vs 平衡"的方法论对照。
Q39:SD 期刊的机器可读元数据在哪?
Scientific Data 为论文配套了 figshare 元数据记录(10.6084/m9.figshare.12759833),含测量类型与技术类型描述——适合自动化抓取入口。
Q40:本条目后续会更新什么?
维护触发点见附录 T:优先级最高的是官方对 373/374 与时长双口径的统一说明,其次是 official_splits 逐折张数的文件级核验与分割划分的官方化。
Q41:为什么条目花这么多篇幅存照双口径?
因为 HyperKvasir 的文档体系横跨论文(2020 冻结)、GitHub、官网(2026 仍滚动更新)与 HF 卡四层,各层演进步调不一——视频数、时长、license 标签三处漂移都是真实检索中会撞上的坑。AI-Ready 质检的价值正在于把这些漂移变成可查的对照表(附录 S)。
Q42:如果只记住一件事?
它是"把检查室整体搬进公共数据"的样本:110,079 张原片+374 条视频覆盖一台内镜检查的完整语义(从解剖定位到治疗干预),而其真正的远见在 99,417 张未标注图——2020 年就为半监督时代备好了基础设施。
F. 复现与工程细节(续)
Q43:最低配机器能做什么实验?
46MB 分割包(1,000 图+掩码)在 CPU/单卡上即可跑通小分辨率 U-Net 复现与评估脚本;ARFF 特征文件配合传统聚类(K-Means/层次聚类)完全离线可做。3.9GB 标注包在单卡上做 224×224 输入的 DenseNet-161 微调也在学生级算力内——HyperKvasir 是少数"全程不需要集群"的大数据集。
Q44:ARFF 里到底存了什么特征?
论文口径是"提取的全局特征(global features)与无监督聚类指派",用于论文的聚类实验与未标注构成分析;具体提取器与维度细节在 GitHub 仓库的聚类实验文件里。引用时写"官方预提取全局特征"即可,勿在论文里虚构特征器型号。
Q45:溃疡性结肠炎的两套分档怎么选?
做疾病严重度研究用 Mayo 口径三档(grade 1/2/3,共 777 张);做图像质量/肠道可视性研究用观察档三档(0-1/1-2/2-3,共 74 张)——后者样本极小,只够做探索性分析。两档并存是刻意的双轨设计,不要混成一个六分类。
Q46:治疗干预类(dyed-lifted/resection-margins)有什么下游价值?
这是公开内镜数据里少见的"术中流程"监督信号:可训练手术阶段识别、EMR 步骤检测、以及"检查报告自动生成"里的操作语义单元。1,991 张的规模对流程识别任务是够用的起点。
Q47:半监督的 1:8.5 配比能改吗?
能。官方配比是发布形态不是实验约束——常见做法是从 10,662 张标注中按 1%/5%/10%/100% 划档做标注效率曲线,99,417 张无标签池全程固定。这正好构成一条标准的 semi-supervised scaling curve。
Q48:有 DICOM 或检查元数据吗?
没有。发布物是 JPEG/AVI 原片+CSV 标签表,无 DICOM 层、无患者级元数据(隐私处理的必然结果)。需要 DICOM 工作流的研究要自行封装转换,且转换不改变"无患者属性"的事实。
Q49:一张图里多个息肉的情况多吗?
约 6%:1,000 张分割图含 1,064 个掩码对象/1,071 个 bbox(Dataset Ninja 实测)。做检测(非分割)时 bbox 文件按对象级解析,勿假设一图一框。
Q50:怎么引用"最大公开消化道数据集"这个宣称?
写"发布时点(2020)最大的公开消化道图像与视频数据集"并引论文——这是论文原文口径。2026 年复核:常规内镜维度它仍是同族最大(Kvasir-Capsule 的 471 万帧属胶囊内镜模态),但"最大"必须限定模态与时点,绝对化表述会被审稿人抓住。
事实清单(硬事实 42 条)
- HyperKvasir 总量:110,079 张图像 + 374 条视频(论文口径;官网现版 373 条,坑 1)。
- 四数据记录(Table 2):标注图 10,662 张 23 类(3,960MB)/ 分割图 1,000 张(57MB)/ 未标注图 99,417 张(29,940MB)/ 视频 374 条 30 类(32,539MB)。
- 10,662 = 99,417 + 10,662 校验:110,079 图像总数 = 标注 + 未标注。
- 23 类四大归纳:解剖标志 4,104 / 病理发现 2,642 / 治疗干预 1,991 / 黏膜观察质量 1,925。
- 部位归纳:下消化道 7,210 + 上消化道 3,452 = 10,662。
- 逐类计数(Dataset Ninja 实测,总和=10,662 自洽):bbps-2-3 1,148 / polyps 1,028 / cecum 1,009 / dyed-lifted-polyps 1,002 / pylorus 999 / dyed-resection-margins 989 / z-line 932 / retroflex-stomach 764 / bbps-0-1 646 / UC grade-2 443 / esophagitis-a 403 / retroflex-rectum 391 / esophagitis-b-d 260 / UC grade-1 201 / UC grade-3 133 / impacted-stool 131 / barretts-short-segment 53 / barretts 41 / UC grade-0-1 35 / UC grade-2-3 28 / UC grade-1-2 11 / ileum 9 / hemorrhoids 6。
- 分割子集:1,000 张原图+白前景掩码(同名 JPEG)+边界框(JSON);约 1,064 个息肉对象/1,071 个 bbox;与 labeled polyps 类 1,028 张部分重复(官方明示)。
- 视频:论文 9.78h/889,372 帧 vs 官网现版 11.62h/1,059,519 帧/171 处标注发现(坑 2);HF 卡误写 “171 sequences”。
- 采集:Bærum 医院(Vestre Viken,服务 49 万人/18.9 万覆盖 Bærum)消化科,2008-2016 年常规检查,2016 年自 Picsara(CSAM)导出。
- 设备:Olympus(Olympus Europe)+ Pentax(Pentax Medical Europe)标准内镜;部分图像带 Olympus ScopeGuide 画中画。
- 隐私:挪威数据保护局批准;REK South-East 免审批;全匿名、元数据删除、文件名随机化;GDPR 可公开共享。
- 数据零预处理零增强(论文原文声明)。
- 论文:Scientific Data 2020;7:283,doi:10.1038/s41597-020-00622-y;Received 2019-12-31/Accepted 2020-07-21/发表 2020-08-28;PMC7455694/PMID 32859981。
- 作者 19 人 14 机构;前 5 人(Borgli/Thambawita/Smedsrud/Hicks/Jha)同等贡献;通讯 Pål Halvorsen;无 NTNU 署名(坑 5)。
- 标注三步法:资深胃肠医师定类并撰写类目描述 → 两名初级医生/博士生预标 → 资深医师复核修正;无共识样本弃用替换。
- 标注医师来源:Bærum 医院、挪威癌症登记处、Karolinska 大学医院(瑞典)。
- 分割标注:Labelbox 平台,初级医生+博士生预分割,胃肠医师逐张核验修正;流程描述转引 Kvasir-SEG 论文。
- 视频标注:Augere Medical AS(Oslo)平台;整条视频主发现判 30 类;一视频可多类;video-labeling.csv 存多发现描述。
- 类目体系四维:解剖标志/黏膜观察质量(BBPS)/病理发现(MST 术语)/治疗干预。
- 防偏类目决策:esophagitis 拆 A 与 B-D 二类;Barrett’s 按 Prague 拆长/短段(3cm 界);UC 分级多档并存;“易偏倚发现合并成一类”(论文原文)。
- 谱系:Picsara(2008-2016)→ Kvasir v1 4,000 图 8 类(2017)→ v2 8,000 → HyperKvasir 10,662 图 23 类(2020-08);Kvasir polyps 类重复图被替换为高质量新图。
- 分类基线(Table 3,split_0+1 平均):ResNet-50 micro F1 0.839/MCC 0.826;ResNet-152 0.906/0.898;DenseNet-161 macro F1 0.619(最佳)micro 0.907;集成双模型 micro F1 0.910(最佳)/MCC 0.902;+MLP 0.909。
- 下界对照:Random Guessing micro F1 0.044;Majority Class 0.108。
- macro-micro 落差(0.910 vs 0.619)为类别极端不平衡的直接镜像;集成不改善 macro。
- 混淆矩阵主轴:Z-line ↔ esophagitis ↔ Barrett’s(上消化道交界类);论文称与人类变异相似。
- 未标注构成实验:最佳两模型给 99,417 张打伪标签——normal pylorus 预测最多,hemorrhoids/UC grade 1-2 最少。
- GitHub 提供 ARFF 全局特征与聚类指派(WEKA 兼容)。
- 官方划分:GitHub official_splits 的 k 折(split_0/split_1),官方推荐用于公平比较;正文未披露各折张数。
- 论文不做分割基线;官方未定义分割集划分("880/100/120"说法无官方出处,遗留疑点 3)。
- 下游分割样例:Res34UNet HyperKvasir test IoU 0.9482/Dice 97%(ACM 2025);MAPSeg 自监督低样本 IoU 0.48±0.22(Frontiers 2026)。
- 许可:数据集 CC BY 4.0(官方原文+官网 Terms),附加引用条款;论文 CC BY 4.0 开放获取。
- HF 官方镜像 SimulaMet-HOST/HyperKvasir 卡片 license 误标 “mit”(坑 4);实测 gated=false、63.45GB、downloads 134/likes 3(2026-09-27 hf-mirror)。
- 托管:OSF osf.io/mh9sj(DOI 10.17605/OSF.IO/MH9SJ)+ datasets.simula.no/hyper-kvasir;主数据集不在 Zenodo(坑 3)。
- 下载包:全量 58.6GB;labeled 3.9GB/segmentation 46MB/unlabeled 29.4GB/videos 25.2GB。
- 机器可读元数据:figshare 10.6084/m9.figshare.12759833(SD 配套)。
- GitHub simula/hyper-kvasir:classification_experiments/clustering_experiments/official_splits/scripts;README 写 373 视频(坑 1 的 GitHub 层)。
- 联系人:steven@simula.no / michael@simula.no / paalh@simula.no;HF 卡 contact vajira@simula.no。
- 引用热度:OUCI 记录 Scopus 458 次(2026 抓取);姊妹篇 Kvasir-SEG 2,500+ 为家族引用王。
- 图像+视频帧总量:论文口径约 100 万;GitHub README 口径 110 万+;第三方综述 1.17M——无权威定值(遗留疑点 5)。
- 第三方生态:Dataset Ninja(Supervisely 格式+逐类统计)、Zenodo 第三方模型仓(Mayer et al. 2023,zenodo.7785986 等)、Kaggle 教学 Notebook。
- Borgli 2026 UiO 博士论文(内镜分割 prompt 生成)为家族学术延续;Augere Medical AS 为作者侧转化端口并承建视频标注平台。
- 论文 Table 1 景观表收录 CVC 系(356/612/11,954/380 图)、ASU-Mayo 18,781 图、ETIS 196 图、KID 2,371 图+47 视频等——多数标注 by request,反衬 HyperKvasir 直链开放的稀缺性。
术语表(34 条)
| 术语 | 释义 |
|---|---|
| HyperKvasir / Hyper-Kvasir | 同一数据集的两拼(论文 vs URL/仓库,坑 7) |
| Kvasir 家族 | Simula 系内镜数据集族:v1/v2、HyperKvasir、Kvasir-SEG、Kvasir-Capsule、Kvasir-Instrument |
| 解剖标志(anatomical landmark) | 用于定位与确认检查完整性的解剖结构(Z 线、幽门、盲肠等),本集 6 类 |
| Z-line | 食管-胃交界齿状线,上消化道检查的关键定位标志 |
| retroflex view | 内镜反转视角,用于观察胃底与直肠近肛缘的盲区 |
| BBPS | Boston Bowel Preparation Scale,波士顿肠道准备评分(0-3 分/段),结肠镜质量指标 |
| MST | Minimal Standard Terminology,世界内镜组织(WEO)的内镜发现标准术语 |
| Prague 分类 | 巴雷特食管的长度分级标准(圆周/纵向扩展),长短段以 3cm 为界 |
| Mayo 内镜分级 | 溃疡性结肠炎内镜严重度 0-3 级 |
| esophagitis-a / b-d | 反流性食管炎洛杉矶 A 级与 B-D 级的二分类(防低级别观察者分歧) |
| dyed-lifted-polyps | 黏膜下注射抬举+染色后的息肉(EMR 术前状态) |
| dyed-resection-margins | 息肉切除后创缘染色(确认切除干净的术中标记) |
| 息肉(polyp) | 黏膜面隆起性病变,结肠癌筛查的核心目标 |
| 像素级掩码 | 白=息肉/黑=背景的二值分割真值(与原图同名 JPEG) |
| 边界框(bounding box) | 息肉最外层像素构成的矩形,JSON 存储 |
| Labelbox | 商业图像标注平台,本集分割掩码的标注工具 |
| Picsara | 挪威 CSAM 公司的影像文档数据库,医院电子病历插件,本集数据源 |
| ScopeGuide | Olympus 电磁定位系统;部分图像左下角有其画中画缩略图(需预处理统一) |
| 半监督学习 | 同时利用标注与未标注数据的训练范式,本集 99,417 张未标注图为此设计 |
| 标注效率曲线 | 用 1%/5%/10%/100% 标注量划档评估的实验设计(半监督标配,附录 I/Q47) |
| 捷径特征(shortcut feature) | 模型学到的与任务无关的判别线索(如 ScopeGuide 缩略图),跨库训练的隐患 |
| pHash | 感知哈希,跨库近重复帧审计的工具(附录 Z) |
| 弃用制标注 | 无共识样本弃用换新图的质量策略(本集三步法第 3 步) |
| 自监督学习 | 从未标注数据自造监督信号(对比学习等)的预训练范式 |
| 伪标签 | 用已训模型给未标注数据打的预测标签(本集构成分析实验所用) |
| ARFF | Attribute-Relation File Format,WEKA 生态的数据格式,官方特征的载体 |
| official_splits | GitHub 官方 k 折划分文件,分类任务的公平比较口径 |
| MCC | Matthews 相关系数,偏斜数据下比 F1 稳健的二/多类一致指标 |
| macro / micro 平均 | 逐类等权平均 vs 逐样本等权平均——长尾分类必须同报的两套指标 |
| mIoU / Dice | 分割任务标准指标(交并比/Dice 系数),下游分割论文主报 |
| CADe / CADx | 计算机辅助检测/诊断,内镜 AI 的两大任务族 |
| 弃用制标注 | 无共识样本弃用换新图的质量策略(本集三步法第 3 步) |
| 观察者变异 | 不同医师对同一病变判读分歧(低级别食管炎/UC 为高发区) |
| CC BY 4.0 | 署名即可自由使用/修改/商用/再分发的许可(本集数据与论文许可) |
| OSF | Open Science Framework,开放科学托管平台,本集官方主仓(osf.io/mh9sj) |
| datasets.simula.no | Simula 数据集门户,本集直链下载站 |
| gated dataset | HF 需门禁的数据集;SimulaMet-HOST/HyperKvasir 为 gated=false |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability 五维数据集质量框架 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | HyperKvasir |
| url_name | hyperkvasir |
| 类型 | 多资产研究数据集(标注图+未标注图+分割图+视频) |
| 论文 | Scientific Data 2020;7:283(doi:10.1038/s41597-020-00622-y) |
| 团队 | SimulaMet 等 14 机构 19 人(通讯 Pål Halvorsen) |
| 规模 | 110,079 图(10,662 标注+99,417 未标注)+1,000 分割+374 视频 |
| 许可 | CC BY 4.0(数据+论文),附加引用条款 |
| 获取 | OSF / datasets.simula.no / HF 镜像,三通道零门槛直链 |
| 抓取时点 | 2026-09-27 |
| 库内互链 | kvasir-seg(112)/kvasir-capsule(123)/kvasir-instrument(213)/kvasir-hyperkvasir(75)/cvc-clinicdb(133)/cvc-colondb(142)/etis-larib(153)/ldpolypvideo(163)/polypgen(183)/gastrovision(203)/bkai-igh-neopolyp(84) |
附录 B:DAIMS 评估全表
见 §6.4(D 8 / A 9 / I 8 / M 7 / S 8,综合 8.0/10 高)。评估基准:库内 AI-Ready 检查单+FAIR 四原则;对比锚:Kvasir-SEG(分割专精,rid 112)、Kvasir-Capsule(极端未标注配比,rid 123)、PANDA-PLUS(请求制对照)。
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置/方式 |
|---|---|---|
| 110,079 图+374 视频(摘要/正文/Table 2 三处一致) | 论文全文 | Europe PMC PMC7455694 全文 XML 实抓 2026-09-27 |
| 10,662/99,417/1,000/374 与 MB 体量 | 论文 Table 2 | 同上 |
| 23 类全表 A-W | 论文 Fig. 8 图注 | 同上 |
| 分类基线 Table 3 全表 | 论文 Technical Validation | 同上 |
| 9.78h/889,372 帧/30 类/AVI | 论文 Labeled videos 节 | 同上 |
| OSF DOI 10.17605/OSF.IO/MH9SJ + simula.no + CC BY 4.0 | 论文 Data Records 节 | 同上 |
| 三步标注法/弃用制/Labelbox 双层/零预处理 | 论文 Methods 节 | 同上 |
| 伦理(Datatilsynet/REK South-East/GDPR) | 论文 Methods 节 | 同上 |
| 官网现版 373 视频/11.62h/1,059,519 帧/171 处/46MB 包 | datasets.simula.no/hyper-kvasir | WebFetch 实抓 2026-09-27 |
| 下载包五件套与体积 | 官网 Download 表 | 同上 |
| 逐类计数 23 类(总和=10,662) | datasetninja.com/hyper-kvasir | WebFetch 实抓 2026-09-27 |
| 机构 14 单位/作者 19 人 | 论文署名页+CNKI Scholar 记录 | 搜索快照 2026-09-27 |
| HF 镜像 gated=false/63.45GB/downloads 134/license 标 mit | hf-mirror API | curl 实测 2026-09-27 |
| GitHub 仓结构与 official_splits 推荐/README 373 口径 | GitHub README(镜像快照) | 搜索快照 2026-09-27 |
| Zenodo 第三方模型仓(Mayer et al. 2023) | zenodo.org/records/7785986 | 搜索快照 2026-09-27 |
| Res34UNet IoU 0.9482/Dice 97% | ACM DOI 10.1145/3723178.3723297 | 搜索快照 2026-09-27 |
| MAPSeg IoU 0.48±0.22 | Frontiers DOI 10.3389/FDGTH.2026.1797571 | 搜索快照 2026-09-27 |
| Scopus 引用 458 | OUCI works 页 | 搜索快照 2026-09-27 |
附录 D:数据获取决策树
需求是什么?
├── 息肉分割
│ ├── 要成熟协议与排行榜 → 库内 Kvasir-SEG(rid 112)条目 + 46MB 分割包
│ └── 要 HyperKvasir 口径 → 同一 46MB 包,自定划分并声明(勿与 112 双测,坑 6)
├── 多类分类
│ ├── 公平比较 → labeled-images 3.9GB + GitHub official_splits
│ └── 长尾研究 → 同上;micro/macro 同报,极小类(<30 张)单独处置
├── 半监督/自监督/预训练
│ └── 3.9GB + 29.4GB 双包;GitHub ARFF 特征先跑通聚类实验
├── 视频理解 / CADe 验证
│ ├── 只要验证素材 → videos 25.2GB(视频级 30 类)
│ └── 要帧级监督训练 → 转 LDPolypVideo(rid 163)
└── 合规审查
├── license → CC BY 4.0(官方口径;勿读 HF 卡的 MIT,坑 4)
└── 隐私 → 全匿名+Datatilsynet/REK 存照(§6.2-4)
附录 E:四子集规格对照表
| 属性 | labeled | unlabeled | segmented | videos |
|---|---|---|---|---|
| 数量 | 10,662 | 99,417 | 1,000 | 374(论文) |
| 格式 | JPEG | JPEG | JPEG(图+掩码同名)+JSON bbox | AVI |
| 标注粒度 | 图像级 23 类 | 无 | 像素级+框级 | 视频级 30 类 |
| 体量 | 3,960MB(包 3.9GB) | 29,940MB(包 29.4GB) | 57MB(包 46MB) | 32,539MB(包 25.2GB) |
| 官方划分 | official_splits k 折 | 无(全部作无标签池) | 无 | 无 |
| 元数据 | image-labels.csv | GitHub ARFF 特征 | bboxes.json | video-labeling.csv |
| 主要任务 | 分类/长尾 | 半监督/自监督 | 分割/检测 | 过程理解/验证 |
附录 F:23 类与临床量表映射表
| 类目 | 所依量表/标准 | 分级要点 |
|---|---|---|
| esophagitis-a / b-d | 洛杉矶分级(Lundell) | A=黏膜破褶顶<5mm;B-D 按扩展合并 |
| barretts / barretts-short-segment | Prague 分类 | 短段=纵向扩展<3cm |
| ulcerative-colitis grade 1/2/3 | Mayo 内镜分级 | 1=红斑血管纹消失;3=自发出血溃疡 |
| UC grade 0-1/1-2/2-3 | 黏膜观察质量档 | 观察质量过渡档(归 quality 维度) |
| bbps-0-1 / bbps-2-3 | Boston 肠道准备评分 | 0=不可见;1=部分可见;2-3=大部分/全可见 |
| 其余 6 解剖标志类 | 内镜定位惯例 | 确认回盲部/十二指肠到达等检查完整性 |
| dyed-lifted / resection-margins | EMR 术式流程 | 治疗干预的两步状态 |
附录 G:官方分类基线复现骨架(代码)
# 依据论文 Technical Validation + GitHub 官方划分的复现骨架
from pathlib import Path
from torchvision import transforms, models
import torch, torch.nn as nn
CLASSES = ["bbps-0-1","bbps-2-3","barretts","barretts-short-segment",
"cecum","dyed-and-lifted-polyps","dyed-resection-margins",
"esophagitis-a","esophagitis-b-d","hemorrhoids","ileum",
"impacted-stool","polyps","pylorus","retroflex-rectum",
"retroflex-stomach","ulcerative-colitis-grade-0-1",
"ulcerative-colitis-grade-1","ulcerative-colitis-grade-1-2",
"ulcerative-colitis-grade-2","ulcerative-colitis-grade-2-3",
"ulcerative-colitis-grade-3","z-line"] # 23 类(文件夹名口径)
def load_split(root, split="split_0"):
# official_splits 提供 train/val/test 的文件清单(论文未在正文给张数)
manifest = Path(root) / "official_splits" / split
return read_manifest(manifest) # -> [(path, label), ...]
def build_model():
m = models.densenet161(weights="IMAGENET1K_V1") # Pre-Trained DenseNet-161
m.classifier = nn.Linear(m.classifier.in_features, len(CLASSES))
return m # macro F1 0.619 / micro F1 0.907(论文两折平均口径)
# 评估要点:
# 1) 同报 macro 与 micro F1(0.910/0.619 落差即不平衡信号,勿单报)
# 2) split_0 与 split_1 平均后与 Table 3 对表
# 3) 集成对照:ResNet-152 + DenseNet-161 概率平均 -> micro 0.910 / MCC 0.902
附录 H:分割包使用骨架(代码)
import json, numpy as np
from PIL import Image
from pathlib import Path
root = Path("segmented-images") # hyper-kvasir-segmentation.zip 解压后
imgs, masks = root/"images", root/"masks" # 同名 JPEG 成对
bboxes = json.load(open(root/"bboxes.json"))
def iou_dice(pred: np.ndarray, gt: np.ndarray):
inter = (pred & gt).sum(); union = (pred | gt).sum()
iou = inter / union
dice = 2 * inter / (pred.sum() + gt.sum())
return iou, dice
def load_pair(name):
img = np.array(Image.open(imgs/name).convert("RGB"))
mask = (np.array(Image.open(masks/name).convert("L")) > 127) # 白=息肉
return img, mask
# 协议自查清单(官方无划分,发布结果前逐条声明):
# [ ] train/val/test 划分比例与随机种子
# [ ] 是否与 Kvasir-SEG 做过逐张去重(坑 6)
# [ ] 是否与 labeled polyps 类 1,028 张的去重关系(官方明示的包含关系)
# [ ] 报告 mIoU+Dice 双指标
附录 I:半监督实验设计要点
- 无标签池规模:99,417 ≈ 标注集 9.3 倍——FixMatch/MeanTeacher 类方法的标准配比区间(1:5~1:10),无需重采样。
- 特征起点:GitHub ARFF 全局特征可直接做聚类/检索预实验,验证表征质量后再决定是否自训 backbone。
- 池泄漏自查:标注与未标注图来自同一检查流——按采集时段/检查ID 聚类抽验两池近邻(感知哈希),确保验证/测试集的近重复帧不落在无标签池训练侧。
- 伪标签参考线:官方伪标签构成实验(normal pylorus 最多、hemorrhoids/UC grade 1-2 最少)可作为你的模型预测分布的 sanity check 基线。
附录 J:视频子集的使用边界
| 能做 | 不能做 |
|---|---|
| 检查流程阶段识别(定位/治疗/观察) | 逐帧息肉检测训练(无帧级框) |
| 图像分类模型的真实分布压力测试 | 视频级疾病诊断声明(标签=主发现,非全帧) |
| 多发现共现分析(video-labeling.csv) | 30 类与 23 类的自动映射(体系不同) |
| 在线系统延迟/吞吐验证(AVI 原片) | 跨中心泛化声明(单中心) |
附录 K:伦理与隐私合规档案
| 项 | 口径 |
|---|---|
| 伦理审批 | 区域伦理委员会(REK South-East Norway)免审批(采集不干扰诊疗) |
| 数据保护 | 挪威数据保护局(Datatilsynet)批准 |
| 患者同意 | 免除(数据全匿名) |
| 匿名化措施 | 元数据全删+文件名随机化+医院 IT 部门统一导出 |
| 再分发 | 挪威法律+GDPR 口径下可公开共享;CC BY 4.0 允许衍生分发(保留署名) |
| 使用者义务 | 引用论文(官网 Terms of Use 明示) |
附录 L:Kvasir 家族总表(与库内条目对照)
| 成员 | 年份 | 库内条目(rid) | 规模 | 本条目关系 |
|---|---|---|---|---|
| Kvasir v1 | 2017 | (并入旧 rid 75) | 4,000 图 8 类 | 前作 |
| Kvasir v2 | 2018-2019 | (并入旧 rid 75) | 8,000 图 | 前作扩容 |
| HyperKvasir | 2020 | 本条目 | 110,079 图+374 视频 | — |
| Kvasir-SEG | 2020 | kvasir-seg(112) | 1,000 图+掩码 | 同源分割子集(坑 6) |
| Kvasir-Capsule | 2021 | kvasir-capsule(123) | 471 万帧 | 思想续作(极端无标注配比) |
| Kvasir-Instrument | 2021 | kvasir-instrument(213) | 5,941 帧+掩码 | 器械分支 |
附录 M:与旧合并条目(rid 75)的分工声明
| 维度 | kvasir-hyperkvasir(rid 75,旧) | hyperkvasir(本条目) |
|---|---|---|
| 覆盖 | Kvasir+HyperKvasir 合并概述 | HyperKvasir 完整独立成稿 |
| 标题格式 | 旧版(无 AI-Ready 后缀) | 新版 AI-Ready 规范 |
| 数字口径 | 发布时点快照 | 2026-09-27 三源核验(含双口径存照) |
| 阅读顺序 | 查 Kvasir v1/v2 挑战赛背景读 75 | 查 HyperKvasir 细节读本条 |
| 维护 | 主会话决定 | 本条目为家族数字基准源 |
附录 N:内镜数据集景观扩展表(2020 论文 Table 1 + 2023-2026 补充)
| 数据集 | 年 | 库内 rid | 规模 | 任务 | 获取 |
|---|---|---|---|---|---|
| CVC-ClinicDB | 2015 | 133 | 612 图 | 息肉分割 | open academic |
| ETIS-Larib | 2014 | 153 | 196 图 | 息肉分割 | open academic |
| CVC-ColonDB | — | 142 | 380 图 | 息肉分割 | by request |
| Kvasir-SEG | 2020 | 112 | 1,000 图+掩码 | 息肉分割 | 直链 |
| HyperKvasir | 2020 | 本条 | 110,079 图+374 视频 | 分类/分割/半监督/视频 | CC BY 4.0 直链 |
| LDPolypVideo | 2021 | 163 | 大规模视频+框 | 息肉检测 | 直链 |
| Kvasir-Capsule | 2021 | 123 | 471 万帧 | 胶囊内镜多任务 | 直链 |
| Kvasir-Instrument | 2021 | 213 | 5,941 帧 | 器械分割 | 直链 |
| PolypGen | 2021 | 183 | 多中心图+视频 | 息肉分割/检测 | 申请 |
| BKAI-IGH NeoPolyp | 2022 | 84 | 1,200 图 | 分割+分型 | 注册 |
| GastroVision | 2024 | 203 | 8,000 图 8 类 | 上消化分类 | CC 直链 |
读表要点:HyperKvasir 是表中唯一"四资产同发"的条目;2021 后的成员在各自垂直维度(视频/胶囊/器械/多中心/亚型/平衡分类)超越它,但没有替代其全景定位。
附录 O:坑点档案(与 §10 对照)
| 坑 | 一句话档案 | 触发场景 |
|---|---|---|
| 坑 1 | 视频数 374(论文)vs 373(官网现版/GitHub) | 引用/著录 |
| 坑 2 | 视频时长 9.78h/889,372 帧 vs 11.62h/1,059,519 帧/171 处 | 引用/著录 |
| 坑 3 | 主数据集在 OSF+simula.no,不在 Zenodo | 数据引用 |
| 坑 4 | HF 镜像卡 license 误标 MIT(官方 CC BY 4.0) | 合规扫描 |
| 坑 5 | 机构误记 NTNU/St. Olavs(实为 Bærum/Vestre Viken 等) | 综述转引 |
| 坑 6 | 与 Kvasir-SEG 分割子集同源泄漏 | 评测设计 |
| 坑 7 | HyperKvasir / Hyper-Kvasir 一名两拼 | 检索/BibTeX |
| 坑 8 | 23 类/30 类/171 处三个"类数"与逐类数字只在图里 | 数字抽取 |
附录 P:双口径登记表(坑点展开)
| # | 项 | 口径 A | 口径 B | 处理 |
|---|---|---|---|---|
| 1 | 视频条数 | 374(论文摘要/正文/Table 2) | 373(官网现版/GitHub README/Zenodo 第三方) | 正文按论文,随注 B 口径 |
| 2 | 视频时长/帧数 | 9.78h/889,372 帧(论文) | 11.62h/1,059,519 帧(官网现版) | 按引用目的选口径并注明 |
| 3 | 图+帧总量 | 约 100 万(论文) | 1,100,000+(GitHub README)/1.17M(IEEE 综述) | 引论文口径"约 100 万" |
| 4 | 数据 license | CC BY 4.0(官方) | mit(HF 卡 cardData) | 一律按官方 CC BY 4.0 |
| 5 | 分割包体量 | 57MB(论文 Table 2 解包口径) | 46MB(官网 zip 包) | 注明"包 vs 解包" |
| 6 | 分割集与 Kvasir-SEG | 高度同源(同院同流程同规模) | “相同”(第三方汇总) | 官方未逐张确认——存照不决断 |
附录 Q:逐类数字的自洽校验
Dataset Ninja 逐类计数之和 = 10,662(与官方标注集总数精确一致);四大类之和(4,104+2,642+1,991+1,925)= 10,662;两部位之和(7,210+3,452)= 10,662——三套口径互洽。掩码对象 1,064/bbox 1,071 均大于图数 1,000,与"一图多息肉"一致。凡自动化抽取脚本应以"总和=10,662"为校验闸门。
附录 R:检索决策树
你想找什么?
├── HyperKvasir 原始数据
│ └── datasets.simula.no/hyper-kvasir(五 zip)/ osf.io/mh9sj / HF SimulaMet-HOST
├── 论文与元数据
│ └── doi:10.1038/s41597-020-00622-y(PMC7455694)+ figshare 12759833
├── 官方划分与实验代码
│ └── github.com/simula/hyper-kvasir(official_splits + ARFF)
├── 息肉分割协议与排行榜
│ └── 库内 kvasir-seg(rid 112)条目(本条目分割集与其同源,坑 6)
├── 第三方衍生模型
│ └── Zenodo zenodo.7785986 等(Mayer et al. 2023 landmark 分类器)——注意非官方仓(坑 3)
└── "Hyper-Kvasir NTNU"?
└── 机构记忆错误(坑 5)——论文无 NTNU 署名,采集在 Bærum 医院
附录 S:维护触发点
| 触发点 | 条件 | 动作 | 优先级 |
|---|---|---|---|
| 双口径统一 | 官方统一 373/374 与时长口径 | 重写坑 1/2 与附录 P | 1 |
| 分割划分官方化 | 官方发布 1,000 张的官方划分 | 更新 §5.3、遗留疑点 3 | 2 |
| official_splits 文件级核验 | 获得各折张数 | 补 §4.1 与事实清单 28 | 3 |
| HF license 修正 | HF 卡改标 CC BY 4.0 | 撤销坑 4 存照 | 4 |
| 家族新成员 | Kvasir 系新数据集发布 | 附录 L 扩行 | 5 |
附录 T:FAIR/AI-Ready 检查单
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 全局唯一标识 | ✅ | 论文 DOI + OSF DOI + figshare 元数据 DOI |
| F2 富元数据 | ✅ | 论文 Table 2/3 + CSV 映射 + 逐类文件夹结构 |
| A1 可访问协议 | ✅ | 三通道 HTTP 直链,零注册 |
| A2 元数据可访问 | ✅ | 即便不下数据,论文+官网+GitHub 全开放 |
| I1 互操作格式 | ✅ | JPEG/AVI/CSV/JSON/ARFF 全标准 |
| I2 词汇表引用 | ✅ | BBPS/MST/Prague/Mayo 标准量表 |
| R1 来源溯源 | ✅ | Picsara→Kvasir→HyperKvasir 谱系明示 |
| R3 可复现流程 | ✅ | 官方划分+实验代码+ARFF 特征 |
| AI-Ready 综合 | 高(8.0) | 扣分仅在文档口径漂移(坑 1/2/4/8) |
附录 U:缩写速查
| 缩写 | 全称 |
|---|---|
| BBPS | Boston Bowel Preparation Scale |
| MST | Minimal Standard Terminology |
| UC | Ulcerative Colitis(溃疡性结肠炎) |
| EMR | Endoscopic Mucosal Resection(内镜黏膜切除术) |
| MCC | Matthews Correlation Coefficient |
| mIoU | mean Intersection over Union |
| Dice | Dice Similarity Coefficient |
| CADe / CADx | Computer-Aided Detection / Diagnosis |
| ARFF | Attribute-Relation File Format |
| OSF | Open Science Framework |
| REK | Regional Committees for Medical and Health Research Ethics(挪威) |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability |
| WEO | World Endoscopy Organization |
附录 V:基于本数据集的研究检查清单(12 项)
- 许可核对:CC BY 4.0——署名+引用论文即可,商用允许;别读 HF 卡的 MIT 标签(坑 4)。
- 口径声明:视频数/时长引用前选口径(坑 1/2);类数分清 23/30/171(坑 8)。
- 划分声明:分类用 official_splits;分割自切并声明协议+种子(官方无划分)。
- 双集去重:与 Kvasir-SEG 联用时先逐张哈希去重(坑 6);与 labeled polyps 类联用注意官方明示的包含关系。
- 指标双报:分类 micro/macro 同报(0.910/0.619 的落差是结论的一部分,不是矛盾)。
- 极小类处置:hemorrhoids(6)/ileum(9)/UC grade 1-2(11)不建议入训练主力;报告时写绝对数。
- 无标注池卫生:半监督实验前做标注池-无标签池近重复抽验(附录 I-3)。
- 伪影预处理:ScopeGuide 画中画统一裁剪/掩蔽策略写入方法节。
- 分辨率策略:分布不均一(论文 Fig. 2),resize/裁剪策略显式声明,勿引用"固定分辨率"。
- 视频粒度:视频级主发现标签 ≠ 帧级真值;CADe 训练转 LDPolypVideo(rid 163)。
- 引用完整:用数据引 Borgli et al. 2020(doi:10.1038/s41597-020-00622-y);分割协议溯源另引 Kvasir-SEG 论文。
- 时点存照:官网数字滚动更新(2026-06 版与 2020 论文已有多处漂移),引用注明抓取日期。
附录 W:引文规范
@article{borgli2020hyperkvasir,
title = {HyperKvasir, a comprehensive multi-class image and video
dataset for gastrointestinal endoscopy},
author = {Borgli, Hanna and Thambawita, Vajira and Smedsrud, Pia H. and
Hicks, Steven and Jha, Debesh and Eskeland, Sigrun L. and
Randel, Kristin Ranheim and Pogorelov, Konstantin and
Lux, Mathias and Nguyen, Duc Tien Dang and Johansen, Dag and
Griwodz, Carsten and Stensland, H{\aa}kon K. and
Garcia-Ceja, Enrique and Schmidt, Peter T. and
Hammer, Hugo L. and Riegler, Michael A. and
Halvorsen, P{\aa}l and de Lange, Thomas},
journal = {Scientific Data},
volume = {7},
number = {1},
pages = {283},
year = {2020},
doi = {10.1038/s41597-020-00622-y}
}
数据引用:Borgli H, et al. (2020). The HyperKvasir Dataset. Open Science Framework. doi:10.17605/OSF.IO/MH9SJ——论文参考文献 51 即数据集本体引用条目。
附录 Y:类别不平衡应对工具箱(23 类专用)
本集 1,148:6 的类间比例(约 191×)是任何分类实验绕不开的第一现实。按证据强度排序的对策矩阵:
| 对策 | 适用性 | 本集专用参数建议 | 风险 |
|---|---|---|---|
| 类别加权交叉熵 | 首选基线 | 权重 ∝ 1/√n_c 或有效样本数公式(β=0.999) | 极小类权重爆炸,需截断 |
| Focal Loss | 与加权可叠加 | γ=2 起步 | 对 6-30 张类仍不够 |
| 过采样(图片级) | 小类复制+强增强 | ileum/hemorrhoids 过采样至 ≥200 张当量 | 过拟合风险,配 cutout/mixup |
| 两阶段解耦训练 | 表征+分类头分开 | 先均衡化表征训练,再类平衡重采样训练头 | 需要两轮训练预算 |
| 层次化评估 | 报告口径而非训练技巧 | 23 类 → 4 大类 → 2 部位三级聚合报告 | 不解决训练问题,只改善归因 |
| 极小类合并评估 | 严谨性要求 | hemorrhoids/ileum(<10 张)在主表中标注"不参与 macro"或单列 | 与论文基线口径不一致时需注明 |
# 有效样本数类权重(Cui et al. 式)——本集逐类计数直接可用
import math
COUNTS = {"bbps-2-3":1148,"polyps":1028,"cecum":1009,"dyed-lifted-polyps":1002,
"pylorus":999,"dyed-resection-margins":989,"z-line":932,
"retroflex-stomach":764,"bbps-0-1":646,"ulcerative-colitis-grade-2":443,
"esophagitis-a":403,"retroflex-rectum":391,"esophagitis-b-d":260,
"ulcerative-colitis-grade-1":201,"ulcerative-colitis-grade-3":133,
"impacted-stool":131,"barretts-short-segment":53,"barretts":41,
"ulcerative-colitis-grade-0-1":35,"ulcerative-colitis-grade-2-3":28,
"ulcerative-colitis-grade-1-2":11,"ileum":9,"hemorrhoids":6}
def class_weights(beta=0.9999):
effective = {c: (1 - beta**n) / (1 - beta) for c, n in COUNTS.items()}
w = {c: 1.0 / e for c, e in effective.items()}
s = sum(w.values()) / len(w)
return {c: v / s for c, v in w.items()} # 归一化到均值 1
# 提示:hemorrhoids(6) 的权重约为 bbps-2-3(1148) 的数十倍——
# 若训练不稳,对 n<10 的类设权重上限(如 20)并在论文中声明截断规则。
评估协议三条:其一,主表报 per-class F1 全表(23 行一列不少)+ macro/micro/MCC 汇总——只报汇总的分都会被大类美化。其二,与官方 Table 3 对比时严格用 official_splits 与两折平均。其三,任何"极小类剔除/合并"的处理都要在主表与脚注双处声明——这是审稿人对长尾数据集的第一质疑点。
附录 Z:近重复帧审计骨架(代码)
跨库联用的泄漏防线(对应坑 6 与检查清单第 4 项):
# pip install imagehash pillow
from pathlib import Path
from PIL import Image
import imagehash, collections
def phash_index(folder, exts=(".jpg", ".jpeg")):
idx = {}
for p in sorted(Path(folder).rglob("*")):
if p.suffix.lower() in exts:
try:
idx[str(p)] = imagehash.phash(Image.open(p), hash_size=16)
except Exception:
pass
return idx
def near_dup_report(idx_a, idx_b, threshold=8):
"""跨集合近重复:汉明距离 <= threshold 视为疑似同帧/近帧。"""
hits = []
b_items = list(idx_b.items())
for pa, ha in idx_a.items():
for pb, hb in b_items:
if ha - hb <= threshold:
hits.append((pa, pb, ha - hb))
return hits
# 审计三边界:
# 1) hyperkvasir/segmented-images/images vs kvasir-seg/images (坑 6 主边界)
# 2) hyperkvasir/segmented-images/images vs hyperkvasir/labeled/polyps(官方明示包含)
# 3) hyperkvasir/labeled vs kvasir-v1-polyps(官方明示替换史,仍建议复核)
# 处置约定:命中帧只允许出现在一个集合的训练/测试角色里;
# 论文数据节写明审计阈值(hash_size=16 时 threshold<=8 约等视觉同帧)与命中数。
补充说明:文件名层面两代数据集都是随机化命名(UUID 型),文件名对账无效,感知哈希是唯一可行的跨库审计手段;官方未提供逐张跨库映射表(遗留疑点),因此审计结果本身值得作为论文附录发布——Kvasir 家族的"同源考古"目前是社区空白,做一次就比所有人多一块拼图。
附录 AA:与 GastroVision(rid 203)的选型对照
同为 Simula 系上消化道相关数据集,两者的设计哲学截然相反:
| 维度 | HyperKvasir(本条目) | GastroVision |
|---|---|---|
| 覆盖 | 全消化道(上+下) | 上消化道为主 |
| 类目宽度 | 23 类(真实长尾) | 8 类(刻意平衡) |
| 类平衡 | 最小 6 张/最大 1,148 张 | 每类约 1,000 张 |
| 视频 | 374 条(30 类) | 无 |
| 未标注池 | 99,417 张 | 无 |
| 分割 | 1,000 张掩码 | 无 |
| 采集 | 单中心 2008-2016 | 多中心 |
| 许可 | CC BY 4.0 | CC BY 4.0 |
选型口诀:做"长尾/半监督/全流程"研究选本集,做"干净基准/多中心泛化声明"选 GastroVision;两者可构成"宽域预训练(HyperKvasir 99k 无标注)→ 窄域精评(GastroVision 均衡测试)"的两段式管线——这是目前库内可直接执行的跨条目组合之一。
附录 AB:2020 论文口径 vs 2026 官网口径逐项对照
自动化抓取与人工引用都应以本表为"选口径"的第一站:
| 项 | 论文(2020-08-28 冻结) | 官网(2026-06 更新版) | 采信建议 |
|---|---|---|---|
| 视频条数 | 374 | 373 | 引论文写 374;引官网写 373,注明出处 |
| 视频时长 | 9.78 小时 | 约 11.62 小时 | 同上 |
| 视频帧数 | 889,372 | 1,059,519 | 同上 |
| 视频标注 | 30 个发现类(video-labeling.csv) | 171 处标注发现 | 两个数字并存不冲突(类数 vs 处数) |
| 图像总数 | 110,079(=10,662+99,417) | 110,079(页面另写 111,079 含分割包语境) | 以 110,079 为准(110,079=标注+未标注) |
| 分割包体量 | 57 MB(Table 2,解包口径) | 46 MB(zip 包口径) | 注明"包/解包" |
| 图+帧总量 | 约 100 万 | —(GitHub README:1,100,000+) | 引论文口径 |
| 数据许可 | CC BY 4.0 | CC BY 4.0(Terms of Use) | 一致;HF 卡 MIT 为误标 |
| 标注图类数 | 23 类 | 23 类 | 一致 |
| 未标注图 | 99,417 | 99,417 | 一致 |
| 主托管 | OSF DOI 10.17605/OSF.IO/MH9SJ | osf.io/mh9sj + 官网直链 | 一致;Zenodo 均非官方 |
两处官网页面自身的小漂移一并存照:Dataset Ninja 抓取页写 “111,079 images”(其把分割包的 1,000 张计入总数语境)与官方"110,079 images"的差异属于统计口径(含/不含分割包与未标注池的组合方式),不是数据错误;HF 卡的 “374 endoscopy videos (11.62 hours)” 则是把论文视频数与官网时长拼接——引用 HF 卡文字需逐项回源。
- 生产通道:agentA-hyperkvasir 独立成稿(库内旧合并条目 kvasir-hyperkvasir rid 75 仍在库,本条为完整版 HyperKvasir)
- 事实研究:WebSearch×5+WebFetch×4+Europe PMC 全文 XML 实抓+datasets.simula.no 官网实抓+datasetninja 实抓+hf-mirror API 实测,共约 14 轮
- FACTS.md:writing/hyperkvasir/FACTS.md 九节
- 成稿方式:五块直写拼接(/tmp/hyperkvasir_agentA-hyperkvasir_part1-5.md → cat),接缝处留空行
- 坑点:§10 八则(坑 1-8"坑 N:"编号制)
- 开工三查:锁自持(12:02:12 CST);codebuddy 进程数 4;slug 查重通过(kvasir 系 4 条目在库,hyperkvasir 未占用)
- 互链计划:正文内链 8 处(kvasir-seg 112/kvasir-capsule 123/kvasir-instrument 213/kvasir-hyperkvasir 75/cvc 系 133/142/153/ldpolypvideo 163/polypgen 183/gastrovision 203/bkai-igh-neopolyp 84)
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-27,抓取与核验时点见附录 A 与附录 C。事实陈述以论文(Scientific Data 2020;7:283,doi:10.1038/s41597-020-00622-y,PMC7455694 全文实抓)、官网 datasets.simula.no(2026-06 更新版实抓)、Dataset Ninja 逐类实测与 hf-mirror API 实测为源;视频数/时长双口径、HF license 标签漂移、机构误传(NTNU)等原始文档与二手文献缺陷已在坑点与附录 P 存照。条目与库内 Kvasir-SEG(rid 112)、Kvasir-Capsule(rid 123)、Kvasir-Instrument(rid 213)、旧合并条目(rid 75)、CVC-ClinicDB(rid 133)、CVC-ColonDB(rid 142)、ETIS-Larib(rid 153)、LDPolypVideo(rid 163)、PolypGen(rid 183)、GastroVision(rid 203)、BKAI-IGH NeoPolyp(rid 84)等条目互链,构成 Kvasir 家族与内镜影像检索面的完整闭环。后续维护触发点见附录 S。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- kvasir-hyperkvasir — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 图像分类
- cvc-clinicdb — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 评测基准
- cvc-colondb — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 评测基准
- slam-laparoscopic-motions — 共享标签:医学影像 / 内窥镜影像 / 图像分类 / 评测基准
- etis-larib — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割
- gastrovision — 共享标签:医学影像 / 内窥镜影像 / 图像分类
- brixia-peru — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 评测基准
- intra — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 评测基准
- bus-bra — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 评测基准
- rare25 — 共享标签:医学影像 / 内窥镜影像 / 图像分类 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

