REAL-Colon (real-colon) — 真实世界多中心全结肠镜视频逐帧标注数据集 — AI-Ready Wikipedia

60 段完整结肠镜手术视频 / 275 万原生帧 / 35 万边界框 / 132 息肉的 CC BY 4.0 开放结肠镜 AI 训练与评测资源——多中心真实阴性帧分布,覆盖检测、追踪与分级任务

来源 四个临床队列(001 Cosmo 美国 RCT / 002 意大利单中心研究 / 003 奥地利 St. Pölten / 004 日本 Sano Hospital)的完整结肠镜手术视频(1920×1080 原生帧,ProRes→JPEG)+ 逐帧息肉边界框 XML(MS COCO 模板)+ video_info.csv + lesion_info.csv 临床与病理元数据发布时间: 2026-09-30最后更新: 2026-09-30 阅读 8
REAL-Colon (real-colon) — 真实世界多中心全结肠镜视频逐帧标注数据集 — AI-Ready Wikipedia

信息速览

数据集名称REAL-Colon (real-colon) — 真实世界多中心全结肠镜视频逐帧标注数据集 — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模60 例患者(每队列 15 例,共 4 队列 / 6 中心 / 3 大洲);均龄 64.6±10.7 岁,男性 55%;14 例(23%)无息肉
接入方式四个临床队列(001 Cosmo 美国 RCT / 002 意大利单中心研究 / 003 奥地利 St. Pölten / 004 日本 Sano Hospital)的完整结肠镜手术视频(1920×1080 原生帧,ProRes→JPEG)+ 逐帧息肉边界框 XML(MS COCO 模板)+ video_info.csv + lesion_info.csv 临床与病理元数据
AI 就绪度

INFOBOX — REAL-Colon 一屏速览

维度 内容
本质 真实世界多中心完整结肠镜手术视频逐帧息肉边界框数据集(非静止图像集、非短片段)
团队 Cosmo Intelligent Medical Devices(爱尔兰)主导;数据来自 4 队列 / 6 中心 / 3 大洲
论文 Scientific Data 11, 539 (2024)(doi:10.1038/s41597-024-03359-0;arXiv:2403.02163)
数据 60 段视频 / 2,757,723 帧 / 351,264 边界框 / 132 息肉
规格 1920×1080 原生帧;YUV 4:2:2 10-bit → ProRes → JPEG;Olympus 与 Fujifilm 内镜
标注 逐帧边界框(MS COCO 模板 XML);逆向逐帧协议;10 名标注专员 + 专家监督
临床元数据 年龄/性别/内镜品牌/FPS/帧数/息肉数/BBPS + 息肉大小/位置/组织病理
阴性帧 87.6%(2,415,614 帧无框)——保留真实术中"绝大多数帧无息肉"的比例
基线结果 SSD:最优 AP 0.216 / AP50 0.338 / TPR 0.505 / FPR 0.054(全阳性+全阴性训练)
难点 早期出现帧(<1s)AP 仅 0.138;Diminutive 息肉 AP 0.347 vs 大息肉 0.120
获取 figshare+ 公开直链(约 1TB);配套代码 GitHub CC BY 4.0
许可 CC BY 4.0(数据集 + 代码 + 论文,单一许可无异构)
库内互链 CVC-ColonDB(142)、Kvasir-SEG(112)、PolypGen(183)、LDPolypVideo(163)、SUN Database(173)、HyperKvasir(693)

REAL-Colon 是一个"把结肠镜 AI 从实验室完美截图拉回真实手术室"的数据集:大多数公开息肉数据集给的是"挑好的、降采样的静止图或短片段",而真实结肠镜里 87.6% 的帧根本没有息肉——REAL-Colon 第一次把 60 段完整手术视频、275 万原生帧连同这个真实比例一起交出来,并给每个出现过息肉逐帧画框。它的意义不只在"更大",更在于让 CADe 系统按真实临床节奏(连续视频、长阴性段、息肉短暂消失又出现)被训练和评测。

导语读法三则:

  1. 只想下数据:直奔 §5 获取与许可——figshare+ 公开直链、CC BY 4.0、约 1TB,无需申请,这是库内少见的"全开放"样本。
  2. 关心任务定义:直奔 §3 标注规格与 §4 基线结果——逆帧标注、tracklet 概念、SSD 基线与早期检测难点连读。
  3. 要用它做评测:直奔 §4.3 性能分组表与 §7 与库内其他息肉数据集的对照——阴/阳性帧比例是本数据集最大的差异化变量。

§0 导读:这个数据集解决什么问题

结直肠癌(colorectal cancer, CRC)是全球发病率最高的癌症之一,年新发约 200 万例,而 95% 以上源自可切除的癌前息肉(腺瘤)。结肠镜是筛查金标准,但它的效果高度依赖医师的技熟练度与警觉度——"漏诊息肉"是真实且常见的临床问题,也是 AI 辅助(CADe 检测 / CADx 诊断)最直接的用武之地。问题在于:训练与评测这些 AI 的公开数据集,长期与手术室现实脱节。

脱节有三处。第一处是粒度:多数公开集是静止图像或几秒短片段,而真实结肠镜是一个连续数十分钟的视频流,息肉要在一帧帧的时序推理中被"看见、跟住、认准"。第二处是阴性帧比例:真实结肠镜 80-90% 的帧没有息肉,但公开集往往只挑含息肉的帧、砍掉大片阴性帧,导致模型在训练时从未见过"绝大多数时候没有东西"的真实分布,上线后要么漏检要么狂报假警(false positive)造成医师疲劳。第三处是来源单一:多数集来自一两家中心,模型跨机构泛化能力无从验证。

REAL-Colon 的回答是一个完整的三位一体:真实数据(60 段完整手术视频、275.7 万原生帧、87.6% 阴性帧、4 队列 6 中心 3 大洲)、真实标注(逐帧边界框、逆向逐帧协议、10 名专员 + 专家监督、与 eCRF 交叉核验)、真实评测(SSD 基线按阴/阳性帧比例、息肉大小、组织病理、解剖位置分组评测)。它由医疗器械厂商 Cosmo Intelligent Medical Devices(GI Genius 开发者)牵头,把原本只服务自身器械审批的私有数据开放出来,并以 CC BY 4.0 单一许可发布——这在结肠镜 AI 数据里几乎是罕见的开放度。

§0 读法三则:

  1. 这个条目是"数据集 + 基线论文"二合一:数据本体是 60 段视频与 35 万框,论文本体是一套 SSD 基线评测与其方法学论点——两者同一 DOI 体系(figshare+ 数据 / Scientific Data 论文)。
  2. 全文硬数字(2,757,723 / 351,264 / 132 / 60)在 figshare+ 页面、GitHub README、论文正文三源逐字一致(本条目实测三源),可直接引用;摘要中的"2.7M / 350k"是约数,见坑 3。
  3. 检索时若把数据集写成"REAL-Colon images"或"REAL-Colon segmentation"会错位——它是**视频 + 边界框(bounding box)**数据集,不是图像集、也不是分割(segmentation)数据集(坑 2)。

§1 数据集速览:二十问二十答

Q1:REAL-Colon 的"60 段视频"从哪来?
来自四个临床队列,每个队列 15 例。001 是 Cosmo 赞助、用于 GI Genius 美国审批的随机对照试验(NCT03954548,2020-02 至 2021-05,横跨意/英/美,但只取 3 个美国中心);002 是意大利单中心前瞻研究(NCT04884581);003 来自奥地利 St. Pölten 大学医院内部科研采集;004 来自日本兵库 Sano Hospital 消化中心。合起来覆盖 6 个医疗中心、3 大洲。

Q2:数据规格是什么?
原生 1920×1080 隔行高清视频,用专业录机以 YUV 4:2:2 / 10-bit 采集(无色彩与分辨率损失),Apple ProRes 压缩,再用 ffmpeg 以 -qscale:v/-qmin/-qmax=1 转成 JPEG 逐帧。内镜设备为 Olympus 与 Fujifilm 两家。

Q3:到底有多少数据?
60 段视频、2,757,723 帧、351,264 个边界框、132 个切除息肉;约 1TB 原始数据。其中 87.6%(2,415,614 帧)无任何框,12.4%(342,109 帧)含至少一个框。

Q4:标注的是什么形式?
逐帧边界框(bounding box)——每个出现过息肉的帧,给每个息肉画一个矩形框,存成遵循 MS COCO 模板的 XML。export_coco_format.py 可批量转 COCO 格式。注意:不是分割掩码,像素级分割需自行推导。

Q5:谁标的,怎么保证质量?
10 名医学图像标注专员在消化内科专家监督下作业,采用逆向逐帧协议:从息肉被完整切除的那一帧开始,倒着一帧帧往前标到它首次出现,避免因息肉暂时消失而断链。标注经每周迭代会议 refine,并与每例的电子病例报告表(eCRF)逐条交叉核验。

Q6:为什么阴性帧这么多是卖点?
真实结肠镜中 80-90% 的帧无息肉,但公开集常把这些帧砍掉。REAL-Colon 保留全量阴性帧(87.6%),让模型在"绝大多数时候没有目标"的真实分布下训练——论文证明加入全部阴性帧后 SSD 的 AP 从 0.165(无阴性帧)升到 0.216,同时假警率 FPR 从 0.080 降到 0.054。

Q7:基线模型是什么、结果如何?
用一个现成的 SSD 检测器(NVIDIA DeepLearningExamples 实现),300×300 输入、batch 96、Tesla V100。最优配置(全阳性帧 + 全阴性帧,179 万训练图)达到 AP 0.216 / AP50 0.338 / AP75 0.245 / FPR 0.054 / TPR 0.505。

Q8:最难的部分是什么?
两个:一是早期出现帧——息肉刚进入视野的第一秒内检测最难(<1s AP 仅 0.138,<3s 0.179,全阳性帧 0.217);二是小息肉——Diminutive 息肉 AP 0.347 反而高于大息肉 0.120(大息肉常贴近画面边缘、过曝或部分遮挡)。

Q9:我现在能拿到什么、要申请吗?
不用申请。数据集在 figshare+ 公开直链下载(DOI 10.25452/figshare.plus.22202866),CC BY 4.0 可自由再分发;配套 Python 代码在 GitHub(cosmoimd/real-colon-dataset,同为 CC BY 4.0),模型训练代码在 cosmoimd/DeepLearningExamples。

Q10:为什么它对 AI-Ready 重要?
它是库内少见的"单一许可、零门槛、全开放"的临床视频数据集:CC BY 4.0 + 公开直链 + 完整临床病理元数据 + 官方基线代码,AI-Ready 光谱上可获取性与可互操作性都拿到高分——代价是约 1TB 的存储/带宽门槛与 12 个视频的小测试集。

补充问答:更细的十个常见问题

Q11:数据集名字里的 “REAL” 是"真实"还是缩写?
两者都是:它既是英文单词 real(真实),也恰好是 Real-world multi-center Endoscopy Annotated video Library 的首字母缩写。这是精心设计的命名。

Q12:1920×1080 的帧为什么 XML 里写 width=1240?
样例 XML 中 <width>1240</width>——这是标注工具内部裁剪后记录的值(帧被裁到内镜视野内,即去掉了黑色边框),而原始采集分辨率是 1920×1080。使用时应以实际解压帧尺寸为准,不要硬编码 1240。

Q13:为什么叫 “video Library” 而不是 “dataset”?
强调它是一批完整录制的视频(library,库),而非挑选后的图像集合。这个措辞本身就是对"挑帧数据集"惯例的批评。

Q14:60 段视频有多长?
总帧数 2,757,723,帧率(fps)逐视频记录在 video_info.csv。按常见 25-30 fps 估算,总时长量级在数十小时;测试集中最长的一段视频为 60 分钟。

Q15:为什么测试集有 591,647 帧,比全数据集的 1/5 还多?
因为划分是按视频(12/60 = 20% 视频),而测试集帧数包含了这些视频的全部帧(含大量阴性帧)。591,647 是"12 个测试视频的总帧数",不是抽样。

Q16:可以用它训练 YOLO / Faster R-CNN 吗?
可以。export_coco_format.py 转出的 COCO JSON 是通用检测格式,YOLO(需转 YOLO txt)、Faster R-CNN(COCO 原生支持)等都能接入。论文基线用的是 SSD,但不是唯一选择。

Q17:息肉尺寸的"Diminutive"阈值是多少?
论文未在方法中给出 REAL-Colon 的显式阈值,文献中 Diminutive 通常指 ≤5mm。lesion_info.csv 有 size[mm] 精确值,可按需自定义分组。

Q18:为什么要区分"增生性息肉在乙状结肠-直肠"?
因为该部位的增生性息肉与右侧结肠的增生性息肉生物学行为与癌变风险不同,临床警惕度也不同。论文 Table 4 单列它以演示"位置+病理联合评测"的必要性。

Q19:数据里有没有标注"息肉是否被漏诊"?
没有。REAL-Colon 标注的是被切除的息肉,不包含医师漏掉、未切除的息肉。因此无法直接用于"漏诊率"研究——这是一个重要的边界。

Q20:我能否只下载某个队列?
可以。数据按 {SSS}-{VVV} 分文件夹组织,可按队列(001-004)选择性下载。但 figshare_dataset.py 默认下全量,需自行修改下载范围。

§2 数据构成与规格

2.1 队列、中心与"60 段"的来历

REAL-Colon 的 60 段视频不是随手凑的,而是从一个 368 段视频的初始池里按一套"罚分系统"筛出来的。四个队列各自独立取样 15 段,最终拼成 60 段。

队列 来源与性质 中心/国家 时间
001 Cosmo 赞助的 RCT(NCT03954548),用于 GI Genius 美国审批 3 个美国中心(原试验横跨意/英/美) 2020-02 至 2021-05
002 单中心前瞻非营利研究(NCT04884581) 意大利 2021-05 至 2021-07
003 内部科研采集(St. Pölten 大学医院消化/肝病/风湿科) 奥地利 —
004 内部科研采集(Sano Hospital 消化中心) 日本兵库(Hyogo) —

"4 队列 vs 6 中心"不是矛盾:论文正文两处表述并存——"four data cohorts"指四个独立数据来源,“six medical centers"指这些来源覆盖的医疗机构数(001 队列本身横跨 3 个美国中心)。使用者引用时按语境取其一即可,但不要写成"6 个队列”。

2.2 两步选取:罚分系统如何防止样本偏斜

选取分两阶段(论文 Figure 1):

阶段一(罚分):对池中每段视频按"偏离理想录制条件"的程度累计罚分,分三档:

  • 低罚分(-2):息肉可见超过 10 分钟(会让视频时长被长切除操作拉偏);多个息肉用同一器械同时切除(易造成视频息肉与病理描述对应关系模糊)。
  • 中罚分(-4):缺少术前后出结肠片段(AI 需在肠外场景也能工作,删掉会引入偏置);退镜时结肠各段无法全部辨认;进行了非息肉活检/切除。
  • 高罚分(-6):视频直接从肠内开始;显示吻合口;切除病灶组织学信息不全;非息肉(淋巴滤泡、溃疡、脂肪瘤、健康组织)组织学结果不明确(可能暗示随机活检或错误切除)。

阶段二(人工选取):优先选取罚分最低者,同时保持代表性——即便在高罚分视频中也确保所选队列的平均病灶数与全集均值接近,从而保留原始分布。入选数据集中最高罚分为 -4。

这套机制的意义在于:它把"手术过程本身的质量波动"显式建模,而不是随机抽样。对使用者的含义是——这批视频在"可被 AI 理解"的意义上是经过清洗的,不会混入大量组织学含糊的噪声样本。

2.3 视频规格与采集

属性 规格
原生分辨率 1920×1080(隔行 interlaced)
采集格式 YUV 4:2:2 色度抽样、10-bit 位深(专业录机,无色彩/分辨率损失)
压缩 Apple ProRes 编解码器(先压缩,保画质)
帧导出 ffmpeg 转 JPEG,-qscale:v/-qmin/-qmax=1(最小化压缩影响)
内镜品牌 Olympus 与 Fujifilm 两家(Standard endoscopy equipment)
隐私处理 源端编辑去除 EMR 屏幕数据;帧被裁到内镜视野范围内
患者入选 ≥40 岁,因 CRC 筛查/息肉切除后监测/FIT 阳性/症状诊断而行结肠镜
患者排除 CRC 或 IBD 史、结肠切除史、急诊结肠镜、正在抗血栓治疗

采集流程四队列一致:专业录机采集原生流 → ProRes 压缩 → ffmpeg 逐帧导 JPEG。这一链条确保了"帧就是手术室真实看到的画面",而非事后挑选或美化——这正是数据集名字里 “real-world”(真实世界)的落点。

2.4 全匿名化协议

在视频与临床数据从各研究转交给 Cosmo 之前,已执行完整匿名化协议:

  1. 移除全部直接标识符(含个人联系方式);
  2. 视频在源端编辑,抹除 EMR 本地系统在屏幕上显示的任何数据,确保帧中不含可暴露患者或手术身份的信息;
  3. eCRF 在源端移除全部直接标识符;
  4. 所有帧裁剪到内镜视野内;
  5. 只有人口学准标识符(年龄、性别)被共享给 Cosmo。

论文称该协议在严格的安全与隐私措施支持下,“有效降低了 GDPR 与 HIPAA 条款下的数据管理义务”。注意措辞是"降低义务"而非"完全豁免"——再分发时仍应自行评估当地合规边界(见坑 6)。

2.5 临床元数据:每例记录了什么

所有临床变量随数据分发,2019 有 video_info.csv 与 lesion_info.csv 两张表(列名以 GitHub README 为准):

video_info.csv(视频/患者级):

列 含义
unique_video_name 视频名,格式 SSS-VVV(study 001-004 - video 001-015)
age 患者年龄
sex 患者性别
endoscope_brand 内镜品牌(Fuji 或 Olympus)
fps 视频帧率
num_frames 视频帧数
num_lesions 切除病灶数
bbps Boston Bowel Preparation Scale 肠道准备评分(0-9)

lesion_info.csv(病灶/息肉级):

列 含义
unique_object_id 病灶 ID,格式 unique_video_name_x
unique_video_name 所属视频名
size [mm] 病灶大小(毫米)
site 解剖位置
histology_extended 扩展组织病理(来自 eCRF 病理报告)
histology_class 归入类别:adenoma(AD) / hyperplastic polyp(HP) / sessile serrated lesion(SSL) / NO POLYP / traditional serrated adenoma(TSA) / OTHER

BBPS 的临床价值:肠道准备质量(0-9 分,越高越干净)直接影响息肉检出率,把它作为数据集的逐例元数据,意味着研究者可以据此分析"肠道准备差→模型性能下降"这类真实临床问题,而不只是盯着检测框。

2.6 人群与息肉的分布画像

论文给出的分布硬数字(Figure 2/3):

维度 分布
患者年龄 均龄 64.6 ± 10.7 岁
患者性别 男性 55%
无息肉视频 14/60(23%)——强调数据集覆盖"健康阴性病例"
组织病理(132 息肉) 腺瘤性 40% / 非腺瘤性 40% / 其他 1 个(纤维性肛管息肉)
非息肉病灶 19/132(14%) 组织学实非息肉(淋巴滤泡/淋巴聚集/溃疡/脂肪瘤/健康组织)
息肉尺寸 分 Diminutive(小)与非 Diminutive
解剖位置 分结肠各段,含 sigmoid-rectum(乙状结肠-直肠)等

两个反直觉事实:

  1. 14% 的"切除息肉"其实不是息肉——这恰恰是真实世界的写照:内镜医师会切除一些事后病理证明非息肉的组织(淋巴滤泡、溃疡等)。数据集忠实保留,但对 AI 训练的含义是:标注为 lesion 的框未必对应真息肉,做病理分类任务时必须看 histology_class。
  2. 腺瘤与非腺瘤各占 40%——近乎均衡,这对"肿瘤性 vs 非肿瘤性"分类评测是好事,但也意味着数据集的息肉类型分布未必等同真实人群(真实中腺瘤更常见)。

2.7 与同类数据集的关系边界

论文 Table 1/2 把 REAL-Colon 与公开息肉检测/表征数据集逐项对比,突出它的差异化定位:

数据集 年份 规模 分辨率 标注格式 含阴/阳性帧
CVC-ColonDB 2012 300 images 574×500 Segmentation 非/否
ETIS-Larib 2014 196 images 1225×966 Segmentation 是/否
CVC-ClinicDB 2015 612 images 384×288 Segmentation 是/否
ASU-Mayo 2015 18,781 images unknown Segmentation 非/是
CVC-ClinicVideoDB 2017 11,954 images 384×288 Segmentation 非/是
CVC-PolypHD 2018 56 images 1920×1080 Segmentation 是/否
Kvasir-SEG 2020 1000 images 1920×1072 与 332×487 Segmentation 是/否
PICCOLO 2020 3433 images 854×480 与 1920×1080 Segmentation 是/是
KUMC 2021 37,899 images various Bounding Box 非/是
SUN 2021 158,690 images 1240×1080 Bounding Box 非/是
LDPolypVideo 2021 40,187 images 560×480 Bounding Box 是/是
PolypGen 2023 6282 images various Segmentation 是/是
REAL-Colon 2023 2,757,723 images 1920×1080 Bounding Box 是/是

("含阴/阳性帧"列表示是否包含阴性帧/阳性帧;REAL-Colon 是唯一同时以全程序(full-procedure)视频形态、原生分辨率、含完整阴性帧与病理信息出现的条目。)

关键差异化三点:① 唯一的"全程序完整视频"(其他多为图像或短片段);② 唯一的原生 1920×1080 + 完整阴性帧比例;③ 唯一同时提供完整组织病理与尺寸信息。Table 2 中点明:只有 REAL-Colon 同时具备"完整组织病理 / 多息肉 / 非息肉阴性帧"三项。

2.8 文件清单与目录结构

下载后数据集在本地大致长这样(命名规则来自 figshare+ 描述与 GitHub README):

dataset/
├── 001-001_frames/            # 队列 001、视频 001 的逐帧 JPEG
├── 001-001_annotations/       # 对应逐帧 XML 边界框标注
├── 001-002_frames/
├── ...
├── 004-015_frames/
├── 004-015_annotations/
├── video_info.csv             # 每视频元数据(8 列)
├── lesion_info.csv            # 每病灶元数据(6 列)
└── dataset_description.md     # 数据集 README
组件 数量 内容
{SSS}-{VVV}_frames 60 每视频的逐帧 JPEG(1920×1080)
{SSS}-{VVV}_annotations 60 每视频的逐帧 XML(MS COCO 模板)
video_info.csv 1 视频/患者级元数据
lesion_info.csv 1 病灶级元数据
dataset_description.md 1 说明文档

命名解码:SSS = 队列号(001-004),VVV = 队列内视频号(001-015)。例如 002-007 表示"意大利队列的第 7 段视频"。这个双层编号是理解数据集组织结构的钥匙——它让你既能按队列分析(不同中心的风格差异),也能按视频定位单例。

配套代码仓库的内容(cosmoimd/real-colon-dataset):

文件 作用
figshare_dataset.py 自动从 figshare 下载全量到 ./dataset
dataset_stats.py 复现论文统计与图表
bounding_boxes_plots.py 复现边界框分布图
export_coco_format.py 转 COCO 格式供检测训练
explore_data.ipynb 随机抽样可视化 + 临床信息查看
polyp_detection/ 息肉检测子目录(README + 代码)
requirements.txt 依赖清单
download_dataset.sh 下载脚本

2.9 数据质量的三个"真实世界"印记

REAL-Colon 反复强调 “real-world”(真实世界),这不是营销词,而是三个可核验的设计选择:

  1. 不做美颜:帧直接来自手术室录机,没有挑帧、没有裁剪掉不利画面(仅裁到内镜视野)、没有剔除质量差段。这与"从视频里挑出最漂亮的含息肉帧"的数据集路线截然不同。
  2. 不回避脏标注:14% 的切除病灶组织学非息肉,仍按 lesion 保留在标注里——因为内镜医师在术中就切了它,AI 若看不到这类"假目标"就会脱离临床。
  3. 不隐藏缺失:23% 的视频没有任何息肉(阴性病例),完整保留,用以评测"模型会不会在干净病例里乱报"。

§3 标注规格:逆帧协议与 tracklet

3.1 标注形式与文件组织

每个出现过息肉的帧对应一个 XML 文件,遵循 MS COCO 模板(实为 VOC 风格的 XML 写法)。一个典型框的 XML 结构(GitHub README 原文样例):

<annotation>
    <version_fmt>1.0</version_fmt>
    <folder>string</folder>
    <filename>SSS-VVV_t.jpg</filename>
    <source>
        <database>cosmoimd</database>
        <release>v1.0_20230228</release>
    </source>
    <size>
        <width>1240</width>
        <height>1080</height>
        <depth>3</depth>
    </size>
    <object>
        <name>lesion</name>
        <unique_id>videoname_lesionid</unique_id>
        <box_id>1</box_id>
        <bndbox>
            <xmin>540</xmin>
            <xmax>1196</xmax>
            <ymin>852</ymin>
            <ymax>1070</ymax>
        </bndbox>
    </object>
</annotation>

注意 release 字段写作 v1.0_20230228,与 figshare+ 的 Version 1(2023-03-11)时间轴接近但不完全吻合——这是标注工具内部的发布标记,不代表数据集版本号(见坑 5)。

3.2 逆向逐帧协议:为什么从切除帧倒着标

标注协议的核心是逆向逐帧(reverse frame-by-frame):标注员从息肉被完整切除的那一帧开始,倒着一帧帧往回标,直到它首次出现的那一帧。

为什么这么做?因为息肉在手术中会反复消失又出现(被水、气泡、肠壁褶皱遮挡),如果从前往后正着标,一旦息肉暂时消失,标注员就"丢了"这个目标,容易把同一条息肉的轨迹断成互不关联的段落。从确定性最高的"切除帧"倒推,可以保证整条轨迹挂靠在同一个息肉身份上,即便中途不可见。

结果:132 个息肉合计产生 351,264 个框。每息肉的框在一段时间序列上分布,用"消失超过 1 秒"作为切分新 tracklet 的判据时,仅 10/132 个息肉拥有连续不中断的单一 tracklet——其余都被切成多段。

3.3 tracklet:息肉追踪任务的现实

论文用 Figure 5 专门讨论 tracklet(轨迹片段):

  • 用 1 秒阈值(消失>1s 即算新 tracklet)切分时,只有 10/132 息肉是单段连续的;
  • 用 15 秒阈值切分时,仍有 100 多个 tracklet 残留——这些代表"消失很久又重现"的最难案例。

对 AI 的含义:在真实结肠镜里,“重新识别同一个息肉”(re-identification)是刚性需求——每次息肉从画面消失又回来,系统若不能把它认成同一个,就得从头重启时序分析。REAL-Colon 的数据结构天然支持这类追踪研究,而多数静止图像数据集完全无法表达这一任务。

3.4 息肉动态学:论文 Figure 4/6 的三条发现

论文的技术验证第一部分就解剖"息肉在真实视频里长什么样":

  1. 阴性帧主导:2,757,723 帧中 87.6%(2,415,614 帧)无任何框,仅 12.4%(342,109 帧)含框。含多个息肉的帧不足 0.3%(占阳性帧 2.7%),单帧最多 4 个息肉。对比 MS COCO / Kinetics 这类"一张图多个类别多目标"的常规计算机视觉,结肠镜检测是"绝大多数帧单目标甚至零目标"的极端任务。
  2. 息肉停留时间:每息肉平均出现 1 分 15 秒,最长超过 12 分钟。
  3. 医师会主动把息肉"摆到画面中央":Figure 6 的热力图显示,息肉刚出现时散布在画面各处、框小;随着时间推移,内镜医师倾向把息肉移到画面中心、框变大。左侧箱线图进一步显示——不论息肉实际大小(mm),早期框总是偏小;随检测推进,很多框占据超过画面 50%。结论:单凭框的尺寸无法可靠推断息肉真实大小,必须结合时空上下文推理。

这三条发现直接定义了 REAL-Colon 上"什么算难":早期帧、单目标、长时序、框尺寸与实际尺寸脱钩。

3.5 从边界框推导分割结果:可行性与代价

由于只有框没有掩码,做分割研究必须自行推导。三条可行路径与各自代价:

  1. 框内即前景(最简):把 bbox 内部全当息肉正样本。代价:框内大量背景(肠壁、水、气泡)被误标为前景,IoU 与真实掩码差距大,仅适合弱监督预训练。
  2. 框级弱监督分割(如 BoxInst、BoxTeacher 思路):用 bbox 监督训练分割网络,学习"框内哪部分才是目标"。代价:需要额外网络与训练预算,精度低于真掩码监督。
  3. 跨数据集迁移:从有掩码的数据集(Kvasir-SEG / CVC-ColonDB / PolypGen)学分割先验,再迁移到 REAL-Colon 的视频域。代价:域差异(图像 vs 视频、分辨率)需额外对齐。

重点:无论哪条路,都要意识到 REAL-Colon 的框是"给检测任务设计的",不是为分割标注的——不要假设框紧贴息肉边界。

3.6 标注质量的保障链条

论文虽未给出标注一致性的定量指标(如 IoU 一致率),但描述了一套多层保障:

环节 措施
人员筛选 10 名医学图像标注专员(“trained medical image annotations specialists”)
协议设计 逆向逐帧,保证同一息肉跨帧身份一致
专家监督 消化内科专家全程监督
迭代 refine 每周会议,标注员与专家协作修订
交叉核验 逐息肉与其 eCRF 交叉验证,消除视频标注与病理数据的不一致
复核 息肉信息由标注专员 + 至少一名有经验的消化内科医师双重核对

遗留:论文没有公开"多个标注员对同一帧标注的一致性"(inter-annotator agreement)数据——这是评估自制标注数据集质量的关键指标,REAL-Colon 仅以流程描述代替量化。

3.7 负样本的三种"层级"

REAL-Colon 的阴性信息有三层,容易被混为一谈:

层级 定义 规模
帧级阴性 该帧不含任何框 2,415,614 帧(87.6%)
视频级阴性 整段视频无任何息肉 14/60 视频(23%)
病灶级"非息肉" 被切除并标注为 lesion,但病理证明非息肉 19/132(14%)

做 CADe 训练时用的是帧级阴性;评测"模型在干净病例中的表现"用视频级阴性;而病灶级非息肉是更微妙的"假目标"——它让模型学习"什么样的隆起不该报",但同时也污染了"息肉检测"的正样本集(因为它们被框为 lesion)。

§4 基线评测:SSD 结果与三条结论

4.1 评测设置

论文用现成 SSD(Single Shot MultiBox Detector) 做技术验证——目的不是刷榜,而是证明数据集对训练有用。设置如下:

项 配置
检测器 SSD(NVIDIA DeepLearningExamples 实现)
输入分辨率 300×300
Batch size 96
硬件 Nvidia Tesla V100
数据增强 scaling / random cropping / horizontal flipping / normalization(同 MS COCO 仓库参数)
划分 每队列前 10 视频训练 / 次 2 视频验证 / 余 3 视频测试 → 40 训 / 8 验 / 12 测
测试集 12 个测试视频全帧 = 591,647 帧
模型选择 以验证集上 AP 最优者为最终模型

划分方式的含义:按队列内顺序切分(前 10/次 2/余 3),保证训练与测试都覆盖四个队列的不同中心,天然支持跨中心泛化评测。

4.2 主结果:阴性帧的价值(Table 3)

论文 Table 3 系统扫描"训练时给多少阳性帧、多少阴性帧"对性能的影响(测试统一在 591,647 帧测试集):

每病灶阳性帧数 阴性帧比例 训练图数 AP AP50 AP75 FPR TPR
100 0 11,141 0.107 0.181 0.117 0.123 0.463
1000 0 107,525 0.137 0.231 0.147 0.082 0.464
all 0 230,936 0.165 0.272 0.181 0.080 0.495
all 0.01 246,556 0.190 0.286 0.217 0.058 0.434
all 0.05 309,116 0.193 0.311 0.219 0.072 0.472
all 0.1 387,315 0.178 0.265 0.205 0.083 0.454
all all 1,794,907 0.216 0.338 0.245 0.054 0.505

读表三条:

  1. 阳性帧越多越好:即便这些阳性帧来自同一批息肉,仅把每病灶的阳性帧从 100 提到全量,AP 就从 0.107 升到 0.165。
  2. 阴性帧显著增益:在"全阳性帧"基础上加入阴性帧,AP 从 0.165 升至 0.216(相对提升约 31%),且 FPR 从 0.080 降至 0.054——阴性帧同时提升检出与压制假警。
  3. 最优需要"全都要":全阳性帧 + 全阴性帧(179 万训练图)为最佳。FPR 之所以关键,是因为真实临床中假警会造成医师操作疲劳,是 CADe 落地的核心障碍。

4.3 分组性能:谁容易、谁难(Table 4/5)

用最优模型(Table 3 末行)在不同子集上细分评测(AP/AR 均为 IoU 0.5-0.95):

子集 测试图数 测试息肉数 AP AR
Diminutive(小息肉) 52,133 17 0.347 0.450
Non-Diminutive(非小息肉) 29,973 4 0.120 0.260
Adenoma(腺瘤性) 37,264 12 0.427 0.498
Non-Adenoma(非腺瘤性) 40,525 8 0.145 0.295
Hyperplastic Sigma-Rectum(乙状结肠-直肠增生性) 10,217 5 0.387 0.505
Others 71,889 16 0.260 0.364
All 82,106 21 0.277 0.381

早期出现帧(Table 5):

出现时长 测试图数 AP AR
< 1s 570 0.138 0.254
< 3s 1,710 0.179 0.334
All 82,106 0.217 0.381

三条结论:

  1. 小息肉反而更好检(AP 0.347 vs 大息肉 0.120)——反直觉但可解释:大息肉常贴近画面边缘、过曝、或部分被水/气泡遮挡,论文 Figure 7 给出相应失败案例(小且远的息肉、被水/气泡覆盖的息肉、蓝光下框住的息肉、画面边缘过曝的大息肉)。
  2. 腺瘤性远好于非腺瘤性(0.427 vs 0.145)——腺瘤样本更多、形态更典型。
  3. 首秒检测是硬骨头(AP 0.138)——息肉刚出现时框小、位置散、对比弱,而临床最需要的恰恰是"尽早发现"。论文明确呼吁针对这一阶段做专门研究。

4.4 可复现入口

  • 论文 Figure 7 展示了最优模型在测试集上的假阴性(漏检)与假阳性(误报)样例;
  • 团队还发布了测试集中最长的一段视频(60 分钟、6 个息肉)的检测叠加视频(青色为预测框、白色为真值框),地址 figshare.com/s/fbb0834a21082984336c——这是最直观的"整段手术过程性能"演示;
  • 全部训练/测试代码在 github.com/cosmoimd/DeepLearningExamples,配合 real-colon-dataset 仓库的 COCO 导出脚本可端到端复现。

4.5 指标读法:AP、FPR、TPR 在结肠镜语境下各意味着什么

论文用的 COCO 风格指标在临床里需要"翻译":

指标 技术含义 临床含义
AP(IoU 0.5-0.95) 多阈值下平均精度,最严格综合分 综合检测质量,0.216 属"数据难、模型弱"的诚实基线
AP50 IoU 0.5 下的精度 "大致框住"的能力
AP75 IoU 0.75 下的精度 "框得准"的能力
TPR 阳性帧中报出至少一个框的比例 有多少帧"看到了息肉"(召回)
FPR 阴性帧中误报框的比例 有多少帧"无中生有"——直接对应医师被假警打扰的频率

为什么 FPR 对 CADe 是生死线:在真实手术中,一段 30 分钟、数千帧的视频里只要假警率高一点,医师就会被持续闪烁的警报搞得烦躁乃至关掉系统。论文把 FPR 与 TPR 并列报告,正是把"临床可用性"而非仅仅"检测精度"作为核心。最优模型 FPR 0.054(约 5.4% 的阴性帧误报)在临床上仍偏高,说明这正是该数据集指向的改进方向。

基线的高低要放进语境看:AP 0.216 听起来很低,但这是在"原生分辨率全程序视频 + 真实阴性帧分布 + COCO 严格 AP"三重困难下的数字,与在"挑好的静止图 + 宽松阈值"上刷出的 0.9+ 不可比。论文刻意选择通用 SSD 而非调优到极致的检测器,就是为了给出一个"诚实、可复制"的起点。

4.6 与论文结论对话:三条值得记的方法学判断

  1. "阴性帧有益"被反复验证:Table 3 中 AP 随阴性帧从 0% → all 单调上升(0.165→0.216),FPR 同步下降(0.080→0.054)。这不是偶然,而是因为模型需要"见过正常"才能定义"异常"。
  2. "早发现"是未解难题:Table 5 的 <1s AP 0.138 直接量化了"息肉刚出现时最难检测"。论文原文呼吁对早期阶段做专门研究——这为后续工作留下明确的开放问题。
  3. "位置 + 病理联合评测"是临床相关性的体现:Table 4 单列"乙状结肠-直肠的增生性息肉"(AP 0.387),因为该位置该类型的生物学行为与癌变风险不同于其他部位。这种"按临床亚型分组评测"的做法,比单一总 AP 更能暴露模型的偏科。

§5 获取与许可:全开放的直链数据集

5.1 三层资产、一道门

与库内许多"本体请求制、衍生开放"的数据集不同,REAL-Colon 是单一许可、全部公开直链:

资产 位置 许可 门槛
数据本体(60 视频帧 + 标注 + CSV) figshare+(DOI 10.25452/figshare.plus.22202866) CC BY 4.0 公开直链,无需申请
数据探索/导出代码 GitHub cosmoimd/real-colon-dataset CC BY 4.0 公开
模型训练/测试代码 GitHub cosmoimd/DeepLearningExamples 见仓库 公开
论文 Scientific Data 11, 539 (2024) CC BY 4.0 开放获取

CC BY 4.0 的含义:只要署名(attribution),即可自由使用、修改、分发,包括商业用途——这是四类 CC 许可里最宽松的一档。对一个含真实患者临床准标识符的医学视频数据集而言,这个开放度相当激进,也是 REAL-Colon 的核心卖点。

5.2 下载实操

GitHub README 给出的一键流程:

# 运行 figshare_dataset.py 自动下载全量到 ./dataset
python figshare_dataset.py
# 输出目录可用 DOWNLOAD_DIR 变量修改

关键提醒:数据集约 1TB,视网络与硬件,下载可能需要数天,请提前规划存储与带宽。下载后每个 {SSS}-{VVV}_frames 是逐帧 JPEG,{SSS}-{VVV}_annotations 是对应 XML。

5.3 版本链

figshare+ 的版本历史:

版本 日期(figshare+) 说明
Version 1 2023-03-11 首次发布
Version 2 2024-02-29 当前版本

注意:figshare+ 页面只列版本日期,未提供 changelog——Version 1→2 的具体变更内容无从查证(见 §9 遗留疑点)。引用时务必写明版本(Version 2, 2024-02-29)与 DOI,避免版本漂移。XML 内 release 字段标 v1.0_20230228,早于 figshare Version 1 的 2023-03-11,属标注工具内部标记而非数据集版本号(坑 5)。

5.4 AI-Ready 评估

  • 可发现性:高——论文开放获取、figshare+ 与 GitHub 双入口、DOI 可解析、dataset_description.md 说明完备。
  • 可获取性:满分档——公开直链、无需申请、CC BY 4.0 可再分发。唯一门槛是约 1TB 的体量。
  • 可互操作性:高——MS COCO 模板 XML + 官方 COCO 导出脚本 + 标准 CSV 元数据,可直接接入主流检测框架。
  • 元数据质量:高——video_info/lesion_info 两表覆盖人口学、器械、肠道准备、病理、尺寸、位置;CLAUDE 建议使用时核对 README 列名与实际 CSV。
  • 可持续性:figshare+ 与 GitHub 均为稳定平台;但数据集由厂商(Cosmo)主导,长期维护承诺未公开声明。
  • AI-Ready 综合:库内少见的"单一许可全开放"样本,可获取性维度接近满分;唯一减分项是 12 视频测试集规模与 1TB 体量。

5.5 与库内可获取性光谱的对照

REAL-Colon 在库内同类中属于"最开放"一端:

条目 许可/获取模式 相对 REAL-Colon
REAL-Colon CC BY 4.0,figshare+ 直链 基准(最开放)
CVC-ColonDB(142) 公开下载,学术惯例 相近
Kvasir-SEG(112) CC BY 4.0(Simula 开放) 相近
SUN Database(173) 申请制/协议 更严
KUMC / PICCOLO 申请或受限 更严

5.6 许可与合规的实操清单

使用 REAL-Colon(尤其商用或再分发)前,建议逐项确认:

事项 状态 说明
数据集本体许可 ✅ CC BY 4.0 可商用、可改编、可再分发
署名要求 ⚠️ 必须 需给出署名、许可链接、是否修改
论文引用 ⚠️ 建议 作者"鼓励在使用时致谢"论文
代码许可 ✅ 见仓库 real-colon-dataset 为 CC BY 4.0
隐私合规 ⚠️ 自评估 含年龄/性别准标识符;论文称匿名化"降低"而非"豁免"GDPR/HIPAA 义务
模型衍生品 ⚠️ 自评估 用数据训练出的模型权重是否可商用,取决于本地法域与数据条款的交互
患者同意 ✅ 已获 四队列患者均书面同意其匿名数据用于研究

关键提醒:CC BY 4.0 解决的是"版权"层面的自由,不解决"数据保护法"层面的义务。两者是不同法域的问题,不能因为许可是 CC BY 就跳过隐私合规评估。

§6 方法学启示与生态影响

6.1 论文的三条可迁移经验

  1. 阴性帧是资产,不是噪声。传统数据集为省空间/求"干净"而裁剪阴性帧,REAL-Colon 反其道保留全量阴性帧,并用实验证明它能同时提升检出(AP)与压低假警(FPR)。这对一切"目标稀疏"的医学视频任务(胶囊内镜、超声扫查、病理全片巡览)都可迁移。
  2. 标注协议要对抗"目标短暂消失"。逆帧标注(从切除帧倒推)是对时序目标身份持续性的一种工程解法,值得所有含"物体反复出入画面"的标注任务借鉴。
  3. 框尺寸 ≠ 真实尺寸。Figure 6 证明医师会主动把息肉摆到画面中央放大,导致框尺寸与病理尺寸脱钩——这提醒做"息肉测径"研究的人:不要用 bbox 面积回归真实大小。

6.2 对结肠镜 AI 生态的影响

  • 提供真实评测床:REAL-Colon 之前的公开集让模型"在挑好的图上刷分",REAL-Colon 让评测回到完整手术过程的速率与假警约束下。
  • 厂商开放数据:由 GI Genius 厂商 Cosmo 主动开放本用于自身器械审批的数据,为"监管级数据公开"提供了一个样本——数据来源的 RCT(NCT03954548)正是 GI Genius 美国审批的关键试验。
  • 基线可复现:NVIDIA SSD 这一"非 SOTA 但通用"的检测器被选作基线,降低了复现门槛,也把注意力从"刷榜"引向"数据本身的价值"。
  • 衍生研究:数据集设计明确支持检测(detection)、追踪(tracking)、表征分类(characterization)、测径(sizing)、位置特异评测等多任务,为后续工作留出接口。

6.3 在前列腺/内镜数据集景观中的位置

论文 Table 1/2 已给出定位(见 §2.7):REAL-Colon 是唯一以全程序视频 + 原生分辨率 + 完整阴性帧 + 完整病理出现的结肠镜数据集。它不取代分割类数据集(CVC-ColonDB、Kvasir-SEG 提供像素级掩码),而是补上"视频时序 + 真实分布"这一维度——两者是互补而非竞争关系。

6.4 使用建议:适合谁、不适合谁

适合:

  • 开发/评测结肠镜 CADe(息肉检测)与追踪系统的团队;
  • 研究"目标稀疏 + 长时序视频"检测方法的研究者;
  • 关注假警率(FPR)与医师疲劳问题的临床 AI 团队;
  • 需要真实阴性帧分布做负样本挖掘的方法学研究。

不太适合:

  • 做像素级分割训练——本数据集只给边界框,需自行推导;
  • 做光学活检/病理分类的端到端训练——组织病理标签是病灶级而非像素级;
  • 存储/带宽受限者——约 1TB 体量与数天级下载是硬门槛;
  • 需要大样本多器械泛化的研究——仅 2 个内镜品牌、60 例。

6.5 数据集在 AI 医疗开放运动中的坐标

REAL-Colon 的出现可以放进一个更大的趋势来看:医疗器械厂商开始把监管级数据开放为公共资源。

  • 传统格局:高质量、多中心、带完整病理的临床视频,多被厂商或大 consortium 私藏,用于自身器械的审批与迭代。学术界只能用"小而美"的静止图像集做研究,导致研究模型与临床落地模型之间存在数据代差。
  • REAL-Colon 的破局:Cosmo 把本用于 GI Genius 美国审批的 RCT 数据(NCT03954548 的一部分)开放,配 CC BY 4.0 与官方基线代码。这不仅让学术界能在大规模真实视频上工作,也让"监管级数据"成为可复现研究的公共资产。
  • 论文自述的目标正是"bridge the gap between open and privately-funded research"(弥合开放研究与私人资助研究之间的鸿沟)。

这一定位意味着什么:REAL-Colon 的价值不只在数据本身,还在于它示范了一种"厂商开放 + 学术界受益 + 评测标准统一"的生态模式。若更多厂商跟进,结肠镜 AI 的评测将从"各自在私有集上报数"转向"在公共真实集上对标"。

6.6 对后续数据集的启示清单

REAL-Colon 的做法可为下一代医学视频数据集提供七条可借鉴的设计原则:

原则 具体做法
保留真实分布 不裁剪阴性帧,保留 87.6% 真实比例
完整程序录制 录整段手术,而非挑片段
原生分辨率 不降采样,保留 1920×1080
多中心异构 4 队列 6 中心 3 大洲
元数据完备 人口学 + 器械 + BBPS + 病理 + 尺寸 + 位置
开放许可 CC BY 4.0 单一许可,公开直链
基线可复现 官方代码 + 通用检测器 + 明确划分

这七条合起来,构成了一份"如何做一个 AI-Ready 医学视频数据集"的实操清单。

§7 与库内条目的关系

7.1 家族图谱

REAL-Colon 在库内属于"消化道内镜 AI 数据集"家族,与以下条目强相关:

息肉检测/分割同任务:

  • CVC-ColonDB(rid 142)——结肠镜息肉分割经典基准(2012,300 图),论文 Table 1 直接对比对象;REAL-Colon 补上视频维度。
  • Kvasir-SEG(rid 112)——Simula 出品的息肉分割数据集(1000 图),同为 CC BY 开放,REAL-Colon 的"开放"气质与之相近。
  • PolypGen(rid 183)——多中心息肉检测分割泛化基准,与 REAL-Colon 的"多中心"诉求同源,但 PolypGen 为分割、REAL-Colon 为检测框 + 视频。
  • LDPolypVideo(rid 163)——大规模结肠镜视频息肉检测,与 REAL-Colon 同属"视频+框"路线,是最接近的对照条目。
  • SUN Database(rid 173)——昭和大学结肠镜视频数据库,同含完整病理信息,常与 REAL-Colon 在 Table 1/2 中并列对比。
  • BKAI-IGH NeoPolyp(rid 84)——结肠镜息肉分割与肿瘤性检测。

消化道内镜其他家族:

  • HyperKvasir(rid 693)/ Kvasir & HyperKvasir(rid 75)/ Kvasir-Capsule(rid 123)/ Kvasir-Instrument(rid 213)——Kvasir 系列覆盖图像、胶囊内镜、器械分割。
  • GastroVision(rid 203)——胃肠道内镜多类影像分类。
  • GIANA(rid 700)——胃肠道图像分析挑战赛。

内镜/手术导航邻近域:

  • EndoSLAM(rid 408)/ EndoMapper(rid 428)/ SLAM 3D Endoscopic(rid 82)——内镜定位与三维重建。
  • Endoscapes(rid 353)——腹腔镜手术安全视野评估(非同器官但同"手术视频理解")。
  • EndoVis Challenges(rid 79)——内窥镜视觉挑战赛。

7.2 检索路径建议

  1. 从"息肉检测"入手 → CVC-ColonDB(142) / Kvasir-SEG(112) / PolypGen(183) / LDPolypVideo(163);
  2. 从"真实世界视频"入手 → REAL-Colon 是库内唯一的全程序结肠镜视频条目,可与 LDPolypVideo(163) 对照(后者分辨率较低、非全程序);
  3. 从"结肠镜数据集谱系"入手 → 结合 SUN Database(173),两者都以"完整病理 + 视频"著称;
  4. 从"内镜通用 AI"入手 → HyperKvasir(693) / Kvasir 家族 / GastroVision(203)。

7.3 与库内 PANDA-PLUS 类"标签质量"议题的呼应

REAL-Colon 与库内 panda-plus(rid 560)虽属不同器官,但共享一个议题:真实临床数据的"脏"是可被建模的价值。PANDA-PLUS 暴露前列腺标签的高级别错误,REAL-Colon 则坦承"14% 的切除病灶其实不是息肉"——两者都把真实世界的噪声显式保留并标注,而非清洗成理想样本。这类数据集的共同价值在于:让模型在"世界本来的样子"上被训练。

7.4 与库内内镜导航类条目的边界

库内另有一批"内镜定位/重建/器械"条目——EndoSLAM(408)、EndoMapper(428)、SLAM 3D Endoscopic(82)、Endoscapes(353)、Kvasir-Instrument(213)、EndoVis(79)。它们与 REAL-Colon 的边界要分清:

条目 关注点 与 REAL-Colon 的关系
EndoSLAM(408) 内镜 SLAM 定位与建图 同为内镜视频,但任务是定位非检测
EndoMapper(428) 完整标定内镜手术数据 数据形态相近,任务不同
Endoscapes(353) 腹腔镜安全视野评估 手术视频理解,非同器官
Kvasir-Instrument(213) 内镜器械分割 目标从息肉变为器械
EndoVis(79) 内窥镜视觉挑战赛 挑战赛平台,任务集合

一句话区分:REAL-Colon 回答"肠壁上的息肉在哪",导航类条目回答"内镜在体内的哪里、朝哪走"——两者共同构成内镜 AI 的完整拼图,但数据与标注不可互换。

§8 任务清单:这个数据集能支撑哪些 AI 任务

8.1 核心任务矩阵

任务 输入→输出 数据集支撑 难度备注
息肉检测(CADe) 帧 → 边界框 351,264 框全量支撑 基线 AP 0.216,早期帧最难
息肉追踪(tracking) 视频 → 目标轨迹 tracklet 结构原生支持 132 息肉仅 10 个连续可见
息肉表征分类(CADx) 帧/框 → 病理类别 histology_class 标签 腺瘤 40% / 非腺瘤 40% 近均衡
息肉测径(sizing) 视频 → 尺寸 mm ≤ 含 size[mm] 元数据 框尺寸与实际尺寸脱钩(Fig 6)
位置特异性评测 帧 → 定位相关性能 site + histology 联合 乙状结肠-直肠增生性息肉专项
肠道准备影响分析 视频+BBPS → 性能 bbps 逐例元数据 可研究"准备差→检出降"
假警抑制(FPR) 阴性帧 → 无误报 87.6% 阴性帧 CADe 落地关键
早期发现(early detection) 首秒帧 → 检出 <1s / <3s 子集 AP 0.138,被明确列为开放难题

8.2 负样本挖掘与不平衡学习

REAL-Colon 对"极度不平衡"研究尤其有价值:87.6% 帧为阴性、单帧多息肉 <0.3%、单帧最多 4 个息肉。这为 focal loss、难负样本挖掘、采样策略等方法提供了真实分布下的评测场。论文 Table 3 本身就是一份"阴/阳性帧比例 × 性能"的系统实验。

8.3 不直接支持的任务

  • 像素级分割:无掩码,需自行从框推导或另用分割数据集;
  • 光学活检(optical biopsy)端到端:病理标签为病灶级;
  • 多器械泛化:仅 Olympus/Fujifilm 两家;
  • 跨族人群泛化:患者主要来自美国/意大利/奥地利/日本,族裔分布未披露。

8.4 任务难度分级(按论文数据)

把论文的分组结果翻译成"做哪类任务最难":

任务难度 现象 论文证据
★★★ 最难 息肉刚出现首秒内检测 <1s AP 0.138
★★★ 最难 大息肉(边缘/过曝/遮挡) Non-Diminutive AP 0.120
★★ 较难 非腺瘤性息肉表征 Non-Adenoma AP 0.145
★★ 较难 长时间消失后重现的追踪 15s 阈值下残留 >100 tracklet
★ 中等 一般息肉检测 All AP 0.217
★ 较易 小息肉检测 Diminutive AP 0.347
★ 较易 腺瘤性息肉检测 Adenoma AP 0.427

反直觉提示:这张表里"小息肉"比"大息肉"容易,与常识相反,原因在 §4.3 已述(大息肉常处画面边缘/过曝/被遮挡)。

8.5 与临床工作流的对接点

REAL-Colon 的任务矩阵可以直接映射到结肠镜检查的临床环节:

临床环节 对应 AI 任务 数据集支撑
进镜/退镜全程观察 实时检测(CADe) 全程序视频 + 阴性帧
发现疑似息肉后持续观察 追踪(tracking) tracklet 结构
判断是否肿瘤性 表征分类(CADx) histology_class
判断是否需要切除 尺寸估计 size[mm] + 位置
评估检查质量 肠道准备影响分析 BBPS 元数据

这张映射的价值在于:它提示研究者——REAL-Colon 不只是一个检测数据集,而是一整套"结肠镜 AI 任务栈"的真实数据底座。

8.6 迁移与衍生方向

基于 REAL-Colon 可自然延伸的研究方向:

  1. 域适应:美国/意大利/奥地利/日本四队列,天然构成跨中心域适应实验床;
  2. 时序建模:用逐帧框训练 3D/时序检测器(非单帧 SSD);
  3. 半监督/自监督:87.6% 阴性帧是天然的未标注池;
  4. 主动学习:哪些帧最值得标注?早期帧与难样本是候选;
  5. 模型校准:FPR/TPR 权衡研究,直接对应临床可用性;
  6. 合成数据验证:生成式模型合成的息肉帧能否在真实分布上泛化。

§9 数据质量、局限与遗留疑点

9.1 已知局限(论文自述 + 推断)

  1. 测试集偏小:12 个视频 / 591,647 帧。虽然帧数看似大,但视频级样本仅 12 例,跨中心泛化结论的统计功效有限。
  2. "息肉"不全是息肉:14%(19/132)组织学实非息肉,标注仍为 lesion——病理分类任务需按 histology_class 过滤。
  3. 器械与中心偏少:2 内镜品牌、6 中心,代表性有限。
  4. 框尺寸与真实尺寸相关弱:不宜用 bbox 回归息肉 mm 尺寸。
  5. 标注工具专有:Cosmo 内部工具未公开,第三方无法完全复刻标注流程。

9.2 双口径存照(本条目处理原则)

  • 摘要 vs 精确值:摘要"2.7M 帧 / 350k 框"与精确值"2,757,723 帧 / 351,264 框"并存——本条目正文一律用精确值,摘要约数仅作背景。
  • _annotations vs _annotation:figshare+ 描述写单数 {SSS}-{VVV}_annotation,论文与 GitHub README 写复数 {SSS}-{VVV}_annotations——以解压实际为准,本条目一并存照。
  • 数据集标题大小写:figshare+ “REAL-colon” vs 论文/GitHub “REAL-Colon”——取论文口径。

9.3 遗留疑点

  • figshare+ Version 1→2 的具体变更内容未公开(无 changelog);
  • 数据集总下载量/文件清单未公开(仅"约 1TB");
  • 各队列的族裔/地区分布未披露;
  • 数据集长期维护与版本更新计划未公开承诺;
  • figshare+ 页面抓取时 licence 字段渲染为空白——但论文正文与 GitHub 双源确认 CC BY 4.0,判定为页面渲染问题而非许可缺失。

§10 避坑清单:八个已踩过的坑

坑 1:把它当"图像数据集"或"分割数据集"。REAL-Colon 是**视频 + 边界框(bounding box)**数据集,结构与 CVC-ColonDB / Kvasir-SEG 这类"图像 + 分割掩码"完全不同。要分割结果需自行从框推导,或改用专门的分割数据集。

坑 2:摘要数字当精确值引用。论文摘要写"2.7M frames / 350k annotations",但精确值是 2,757,723 帧 / 351,264 框。做统计或对齐时务必用精确值(figshare+/GitHub/正文三源一致)。

坑 3:“60 段视频"不是"60 个中心"或"6 个队列”。60 是视频数;数据来自 4 个队列;这些队列覆盖 6 个医疗中心;每个队列 15 例。别把队列数、中心数、视频数混写。

坑 4:阴性帧多不是缺陷,是核心特征。87.6% 帧无息肉是真实结肠镜的写照,也是该数据集区别于其他公开集的关键。不要按"含息肉帧比例"去清洗它。

坑 5:XML 里的 release 字段不是数据集版本号。标签写 v1.0_20230228,是标注工具内部标记;figshare+ 的实际版本是 Version 2(2024-02-29)。引用版本以 figshare+ 为准。

坑 6:CC BY 4.0 ≠ 无隐私义务。数据集虽是 CC BY 4.0,但含年龄/性别等准标识符。论文称匿名化"降低了 GDPR/HIPAA 义务",并非完全豁免——再分发前须自行评估当地法规。

坑 7:不要用 bbox 面积推断息肉大小。论文 Figure 6 证明医师会主动把息肉摆到画面中央放大,框尺寸与实际 mm 尺寸脱钩。"息肉测径"研究必须结合时空上下文,不能只看框。

坑 8:约 1TB、下载需数天。全量数据约 1TB,README 明确提示可能耗时数天。做实验前先规划存储与带宽,或按需只取部分队列。

§11 总结

11.1 三句话总结

  1. REAL-Colon 是首个以完整手术视频 + 原生分辨率 + 真实阴性帧比例出现的开放结肠镜 AI 数据集(60 视频 / 275.7 万帧 / 35.1 万框 / 132 息肉)。
  2. 它以 CC BY 4.0 单一许可公开直链发布,并由厂商官方提供 SSD 基线与全套代码,把结肠镜 AI 评测从"挑好的图"拉回真实手术过程。
  3. 它最大的差异化价值在阴性帧(87.6%)与时序结构(tracklet / 逆帧标注)——这两点让它同时支撑检测、追踪、假警抑制等多任务。

11.2 适合谁

  • 结肠镜 CADe/CADx 算法开发者;
  • 视频目标检测与追踪方法研究者;
  • 医学数据集标注方法论与负样本研究者;
  • 需要真实临床视频做端到端评测的团队。

11.3 不适合谁

  • 需要像素级分割掩码者;
  • 存储/带宽受限者(约 1TB);
  • 需要多器械/多族裔大规模泛化者;
  • 需要大视频级测试集者(测试集仅 12 视频)。

11.4 30 秒决策卡

你的需求 决策
训练结肠镜息肉检测器 ✅ 强烈推荐,含真实阴性帧
做息肉追踪 ✅ 推荐,tracklet 结构原生支持
做像素分割 ⚠️ 需自行从框推导,或改用 Kvasir-SEG
做病理分类 ⚠️ 标签为病灶级,非像素级
存储 <100GB ❌ 放弃,约 1TB
需要伦理零门槛 ⚠️ CC BY 4.0 但含准标识符,自评估

FAQ(高频问答 24 问)

A. 基础认知

1. REAL-Colon 是什么?
一个 60 段真实世界完整结肠镜手术视频的逐帧息肉边界框数据集,CC BY 4.0 开放。

2. REAL 是什么缩写?
REAL-world multi-center Endoscopy Annotated video Library(真实世界多中心内镜标注视频库),后缀 -Colon 指结肠镜。

3. 谁做的?
Cosmo Intelligent Medical Devices(爱尔兰,GI Genius 厂商)主导,联合日本 Sano Hospital、奥地利 St. Pölten 大学医院、罗马 Ospedale Nuovo Regina Margherita。

4. 论文发在哪?
Scientific Data 11, 539 (2024),DOI 10.1038/s41597-024-03359-0。

5. 核心数字?
60 视频 / 2,757,723 帧 / 351,264 框 / 132 息肉 / 87.6% 阴性帧。

6. 和 SUN Database、LDPolypVideo 什么关系?
同为结肠镜视频/帧数据集,论文 Table 1/2 中并列对比;REAL-Colon 的差异在"全程序视频 + 原生帧 + 完整阴性帧 + 完整病理"。

B. 数据与获取

7. 怎么下载?
figshare+(DOI 10.25452/figshare.plus.22202866)公开直链,或用 GitHub 的 figshare_dataset.py 一键下载。

8. 要申请吗?
不用,公开直链,无需申请。

9. 许可是什么?
CC BY 4.0(数据 + 代码 + 论文),可自由使用、修改、分发,含商用。

10. 多大?
约 1TB,下载可能需数天。

11. 当前版本?
figshare+ Version 2(2024-02-29);Version 1 为 2023-03-11。

12. 帧是什么格式?
JPEG(由 ProRes 经 ffmpeg 导出),原生 1920×1080。

C. 标注与元数据

13. 标注是什么形式?
逐帧边界框,XML(MS COCO 模板),可导出为 COCO。

14. 有分割掩码吗?
没有,只有框。

15. 谁标的?
10 名医学图像标注专员,消化内科专家监督。

16. 什么协议?
逆向逐帧——从切除帧倒着标到首次出现帧。

17. 有临床数据吗?
有:video_info.csv(年龄/性别/器械/FPS/帧数/息肉数/BBPS)与 lesion_info.csv(大小/位置/组织病理)。

18. 组织病理类别有哪些?
AD(腺瘤)/ HP(增生性)/ SSL(无蒂锯齿状)/ NO POLYP / TSA / OTHER。

19. 为什么 14% 的"息肉"不是息肉?
真实世界写照——医师会切除事后病理证明非息肉的组织(淋巴滤泡/溃疡等),数据集忠实保留。

D. 基线结果

20. 基线模型是什么?
SSD(NVIDIA DeepLearningExamples 实现),300×300,Tesla V100。

21. 最优 AP?
AP 0.216 / AP50 0.338 / AP75 0.245 / FPR 0.054 / TPR 0.505。

22. 最难的部分?
早期出现帧(<1s AP 0.138)与小 sample 类别;大息肉(0.120)反而比小息肉(0.347)难。

E. 使用与库内

23. 能做分割训练吗?
不能直接用,需从框推导或另用分割数据集。

24. 库内哪些条目相关?
CVC-ColonDB(142)、Kvasir-SEG(112)、PolypGen(183)、LDPolypVideo(163)、SUN(173)、HyperKvasir(693)、GastroVision(203) 等。

事实清单(硬事实 30 条)

  1. 全称:Real-world multi-center Endoscopy Annotated video Library(REAL-Colon)。
  2. 论文:Biffi et al., Scientific Data 11, 539 (2024),DOI 10.1038/s41597-024-03359-0。
  3. Preprint:arXiv:2403.02163(2024-03-04)。
  4. PMID 38796533 / PMCID PMC11127922。
  5. 视频数:60 段。
  6. 队列数:4(001-004),每队列 15 例。
  7. 中心数:6,覆盖 3 大洲。
  8. 总帧数:2,757,723。
  9. 边界框:351,264。
  10. 切除息肉:132。
  11. 阴性帧:2,415,614(87.6%)。
  12. 阳性帧:342,109(12.4%)。
  13. 含多息肉帧:<0.3%(占阳性帧 2.7%),最多 4 个/帧。
  14. 分辨率:1920×1080 隔行。
  15. 采集:YUV 4:2:2 10-bit → ProRes → JPEG。
  16. 内镜品牌:Olympus / Fujifilm。
  17. 患者均龄:64.6±10.7 岁。
  18. 男性比例:55%。
  19. 无息肉视频:14/60(23%)。
  20. 非息肉病灶:19/132(14%)。
  21. 腺瘤性/非腺瘤性:各 40%。
  22. 平均息肉出现时长:1 分 15 秒;最长 >12 分钟。
  23. 连续可见息肉:10/132(1 秒阈值)。
  24. 标注专员:10 名。
  25. 标注协议:逆向逐帧。
  26. 数据 license:CC BY 4.0。
  27. 托管:figshare+ DOI 10.25452/figshare.plus.22202866。
  28. 版本:V1 2023-03-11 / V2 2024-02-29。
  29. 基线:SSD,AP 0.216 / AP50 0.338 / FPR 0.054 / TPR 0.505。
  30. 测试集:12 视频 / 591,647 帧。

术语表(28 条)

术语 释义
REAL-Colon 本数据集名,真实世界多中心内镜标注视频库(结肠镜)
结肠镜 / colonoscopy 用内镜从肛门进入检查结肠的筛查手段
结直肠癌 / CRC Colorectal cancer,结肠与直肠的恶性肿瘤
息肉 / polyp 肠壁上的隆起病变,多数为癌前腺瘤
腺瘤 / adenoma 最常见的癌前息肉类型(AD)
增生性息肉 / HP Hyperplastic polyp,通常非肿瘤性
无蒂锯齿状病灶 / SSL Sessile serrated lesion,有癌变潜能
TSA Traditional serrated adenoma,传统锯齿状腺瘤
CADe / CADx 计算机辅助检测 / 诊断
边界框 / bounding box 包围目标的矩形框(xmin/ymin/xmax/ymax)
分割 / segmentation 像素级类别标注(本数据集不含)
逐帧标注 / frame-by-frame 每一帧都单独标注
逆向逐帧 / reverse frame-by-frame 从切除帧倒推标注到首次出现帧的协议
tracklet 目标连续可见的一段轨迹;消失>1s 即切分新段
阴性帧 / negative frame 不含任何息肉框的帧
阳性帧 / positive frame 含至少一个息肉框的帧
AP Average Precision,COCO 风格平均精度(IoU 0.5-0.95)
AP50 / AP75 IoU 阈值 0.5 / 0.75 下的 AP
TPR / FPR 真阳性率(报出率)/ 假阳性率(假警率)
AR Average Recall,平均召回
Diminutive 小息肉(通常 ≤5mm)
BBPS Boston Bowel Preparation Scale,肠道准备评分 0-9
eCRF Electronic Case Report Form,电子病例报告表
MS COCO 通用目标检测数据集/标注格式
SSD Single Shot MultiBox Detector,单阶段目标检测器
ProRes Apple 专业视频编解码器
全程序 / full-procedure 从进镜到退镜的完整手术录制
figshare+ figshare 面向大型数据集的托管平台

附录

附录 A:条目信息速查卡

项 值
条目名 REAL-Colon
url_name real-colon
类型 数据集 + 基线论文(二合一)
论文 Scientific Data 11, 539 (2024)(DOI 10.1038/s41597-024-03359-0)
Preprint arXiv:2403.02163
团队 Cosmo Intelligent Medical Devices 主导,联合日/奥/意三中心
规模 60 视频 / 2,757,723 帧 / 351,264 框 / 132 息肉
规格 1920×1080,逐帧边界框(MS COCO 模板)
许可 CC BY 4.0(数据 + 代码 + 论文)
获取 figshare+ DOI 10.25452/figshare.plus.22202866(公开直链,约 1TB)
抓取时点 2026-09-30
库内互链 cvc-colondb(142)/kvasir-seg(112)/polypgen(183)/ldpolypvideo(163)/sun-database(173)/hyperkvasir(693)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 9 论文开放获取 + figshare+ DOI + GitHub 双入口 + dataset_description.md,索引充分
A 可获取性 9 CC BY 4.0 公开直链、无需申请;减分项仅约 1TB 体量与下载耗时
I 可互操作 8 MS COCO 模板 XML + 官方 COCO 导出脚本 + 标准 CSV;无 DICOM/开放视频容器
M 元数据质量 8 video_info/lesion_info 覆盖人口学/器械/BBPS/病理/尺寸/位置;XML release 字段易被误读为版本号
S 可持续性 7 figshare+ 与 GitHub 平台稳定、CC BY 可镜像;但单一厂商主导、无公开长期维护承诺
综合评级 8.2/10(优) 库内可获取性最高的一档结肠镜数据集;短板在测试集规模与体量门槛

附录 C:逐项证据链自证

关键数字 来源 位置
60 视频 / 4 队列 / 6 中心 / 3 大洲 论文 Methods「Data Cohorts」+ figshare+ 描述 PMC 全文 / figshare+
2,757,723 帧 figshare+ 描述 + GitHub README + 论文「Polyp Detection Annotation」 三源一致
351,264 框 figshare+ 描述 + GitHub README + 论文 三源一致
132 息肉 figshare+ 描述 + GitHub README + 论文 三源一致
87.6% 阴性帧(2,415,614)/ 12.4% 阳性帧(342,109) 论文 Technical Validation「Polyp Dynamics」 arXiv/PMC 全文
<0.3% 多息肉帧(阳性帧 2.7%,最多 4 个) 论文 Technical Validation arXiv 全文
1920×1080 / YUV 4:2:2 10-bit / ProRes 论文 Methods「Video recording」 arXiv 全文
64.6±10.7 岁 / 男性 55% / 14/60 无息肉 论文 Methods「Clinical Data」 arXiv 全文
19/132(14%)非息肉 / 腺瘤 40% 非腺瘤 40% 论文 Methods「Polyp Histopathological Information」 arXiv 全文
每息肉均 1 分 15 秒 / 最长 >12 分钟 论文 Technical Validation「Polyp Dynamics」 arXiv 全文
10/132 连续可见(1s 阈值) 论文 Figure 5 arXiv 全文
10 名标注专员 / 逆向逐帧协议 论文 Methods「Polyp Detection Annotation」 arXiv 全文
SSD 最优 AP 0.216 / AP50 0.338 / FPR 0.054 / TPR 0.505 论文 Table 3 arXiv 全文
分组 AP(Diminutive 0.347 / Non-Diminutive 0.120 / Adenoma 0.427 / Non-Adenoma 0.145) 论文 Table 4 arXiv 全文
早期帧 AP(<1s 0.138 / <3s 0.179) 论文 Table 5 arXiv 全文
测试集 12 视频 / 591,647 帧 论文 Table 3 说明 arXiv 全文
划分 40 训 / 8 验 / 12 测 论文 Technical Validation arXiv 全文
CC BY 4.0 GitHub README「License」+ 论文「Data Records」 双源一致
DOI 10.25452/figshare.plus.22202866 / V1 2023-03-11 / V2 2024-02-29 figshare+ 页面 figshare+
约 1TB / 下载数天 GitHub README「Dataset Download」 GitHub

附录 D:数据获取决策树

你的任务是什么?
├─ 息肉检测(框) ────────────► 直接使用 REAL-Colon 全量(约 1TB)
│                                └─ 存储不足?按队列取(每队列 15 视频)
├─ 息肉追踪(tracklet) ───────► 用 XML unique_id 串联帧,1s 阈值切 tracklet
├─ 息肉表征分类(病理) ───────► 结合 lesion_info.csv 的 histology_class
├─ 像素级分割 ────────────────► 改用 Kvasir-SEG(112)/CVC-ColonDB(142)/PolypGen(183)
├─ 负样本/不平衡研究 ─────────► 用 87.6% 阴性帧;参考论文 Table 3 采样实验
└─ 早期发现研究 ──────────────► 用 <1s / <3s 子集(Table 5 口径)

附录 E:阴/阳性帧比例对照(论文 Table 3 全转)

每病灶阳性帧 阴性帧占比 训练图数 AP AP50 AP75 FPR TPR
100 0 11,141 0.107 0.181 0.117 0.123 0.463
1000 0 107,525 0.137 0.231 0.147 0.082 0.464
all 0 230,936 0.165 0.272 0.181 0.080 0.495
all 1% 246,556 0.190 0.286 0.217 0.058 0.434
all 5% 309,116 0.193 0.311 0.219 0.072 0.472
all 10% 387,315 0.178 0.265 0.205 0.083 0.454
all all 1,794,907 0.216 0.338 0.245 0.054 0.505

附录 F:分组性能总表(论文 Table 4 全转)

子集 测试图数 测试息肉数 AP AR
Diminutive 52,133 17 0.347 0.450
Non-Diminutive 29,973 4 0.120 0.260
Adenoma 37,264 12 0.427 0.498
Non-Adenoma 40,525 8 0.145 0.295
Hyperplastic Sigma-Rectum 10,217 5 0.387 0.505
Others 71,889 16 0.260 0.364
All 82,106 21 0.277 0.381

附录 G:早期出现帧性能(论文 Table 5 全转)

出现时长 测试图数 AP AR
< 1s 570 0.138 0.254
< 3s 1,710 0.179 0.334
All 82,106 0.217 0.381

附录 H:同类公开数据集对照(论文 Table 1 全转)

数据集 年份 规模 分辨率 标注格式 阴性帧 阳性帧
CVC-ColonDB 2012 300 images 574×500 Segmentation 非 否
ETIS-Larib 2014 196 images 1225×966 Segmentation 是 否
CVC-ClinicDB 2015 612 images 384×288 Segmentation 是 否
ASU-Mayo 2015 18,781 images unknown Segmentation 非 是
CVC-ClinicVideoDB 2017 11,954 images 384×288 Segmentation 非 是
CVC-PolypHD 2018 56 images 1920×1080 Segmentation 是 否
Kvasir-SEG 2020 1000 images 1920×1072 / 332×487 Segmentation 是 否
PICCOLO 2020 3433 images 854×480 / 1920×1080 Segmentation 是 是
KUMC 2021 37,899 images various Bounding Box 非 是
SUN 2021 158,690 images 1240×1080 Bounding Box 非 是
LDPolypVideo 2021 40,187 images 560×480 Bounding Box 是 是
PolypGen 2023 6282 images various Segmentation 是 是
REAL-Colon 2023 2,757,723 images 1920×1080 Bounding Box 是 是

附录 I:COCO 导出骨架(基于官方脚本)

# 参考 github.com/cosmoimd/real-colon-dataset/export_coco_format.py
# 1) 下载数据集到 ./dataset(figshare_dataset.py)
# 2) 遍历 {SSS}-{VVV}_annotations 下的逐帧 XML
# 3) 解析 <object>/<bndbox> 的 xmin/ymin/xmax/ymax
# 4) 按 COCO 结构组织 images / annotations / categories
#    类别: lesion(1);per-lesion 身份用 <unique_id>
# 5) 输出标注 JSON 供检测框架(如 detectron2 / mmdetection)加载

附录 J:XML 标注字段说明

字段 含义
version_fmt 标注格式版本
folder / filename 所属目录 / 帧文件名(SSS-VVV_t.jpg)
source/database cosmoimd
source/release 标注工具发布标记(勿当作数据集版本号)
size 帧宽/高/通道(宽 1240、高 1080、深 3)
object/name 固定为 lesion
object/unique_id videoname_lesionid,跨帧串联同一息肉
object/box_id 该图内第几个框
object/bndbox xmin/xmax/ymin/ymax

附录 K:临床变量与病理类别映射

histology_class 中文 肿瘤性
adenoma (AD) 腺瘤 是
traditional serrated adenoma (TSA) 传统锯齿状腺瘤 是
sessile serrated lesion (SSL) 无蒂锯齿状病灶 是(有潜能)
hyperplastic polyp (HP) 增生性息肉 否
NO POLYP 非息肉(淋巴滤泡/溃疡/脂肪瘤等) 否
OTHER 其他(如纤维性肛管息肉) 视情况

附录 L:采集与匿名化 SOP 摘要

步骤 要点
1 采集 专业录机 YUV 4:2:2 10-bit @1920×1080;Olympus/Fujifilm 内镜
2 压缩 Apple ProRes
3 帧导出 ffmpeg → JPEG,qscale/qmin/qmax=1
4 匿名化 源端去 EMR 屏幕数据;eCRF 去直接标识符;帧裁到内镜视野
5 共享 仅年龄、性别等准标识符传给 Cosmo
6 标注 逆向逐帧,10 专员 + 专家,每周迭代,与 eCRF 交叉核验

附录 M:许可条款细读(CC BY 4.0)

条款 含义
署名(BY) 使用须给出适当署名、许可链接、是否修改
商用 允许
改编 允许
再分发 允许,含商用
附加限制 不得增加法律或技术限制阻止他人做许可允许的事
注意 不豁免隐私/人格权;含准标识符时仍需自行评估合规

附录 N:引用模板

Biffi, C., Antonelli, G., Bernhofer, S., Hassan, C., Hirata, D., Iwatate, M.,
Maieron, A., Salvagnini, P., & Cherubini, A. (2024). REAL-Colon: A dataset for
developing real-world AI applications in colonoscopy. Scientific Data, 11, 539.
https://doi.org/10.1038/s41597-024-03359-0

数据集: REAL-colon dataset, figshare+. https://doi.org/10.25452/figshare.plus.22202866

附录 O:坑点档案(与 §10 对照)

坑 一句话 出处
坑 1 是视频+框,非图像+分割 论文 Table 1 标注格式列
坑 2 摘要约数 vs 精确值 摘要 “2.7M/350k” vs figshare 2,757,723/351,264
坑 3 60 视频 ≠ 6 队列 ≠ 6 中心 论文 Methods 双表述
坑 4 阴性帧多是特征非缺陷 论文 Technical Validation
坑 5 XML release 非版本号 样例 v1.0_20230228 vs figshare V2
坑 6 CC BY 4.0 ≠ 无隐私义务 论文 anonymization 措辞
坑 7 bbox 面积 ≠ 息肉真实大小 论文 Figure 6
坑 8 约 1TB、下载数天 GitHub README

附录 P:双口径登记表

项 口径 A 口径 B 条目处理
帧数 摘要 2.7M figshare/GitHub/正文 2,757,723 用精确值
框数 摘要 350k 2,757,723 同源 351,264 用精确值
标注文件夹名 figshare+ _annotation 论文/GitHub _annotations 存照,以解压为准
数据集名大小写 figshare+ “REAL-colon” 论文/GitHub “REAL-Colon” 取论文口径
队列/中心 4 cohorts 6 medical centers 两者并存,勿混写

附录 Q:检索决策树

搜索 REAL-Colon?
├─ 找数据集本体 ──► figshare+ DOI 10.25452/figshare.plus.22202866
├─ 找论文 ────────► DOI 10.1038/s41597-024-03359-0 / arXiv:2403.02163
├─ 找代码 ────────► github.com/cosmoimd/real-colon-dataset
├─ 找模型训练 ────► github.com/cosmoimd/DeepLearningExamples
└─ 找库内同类 ────► cvc-colondb(142)/kvasir-seg(112)/polypgen(183)/ldpolypvideo(163)/sun-database(173)

附录 R:维护计划与触发点

触发点 动作
figshare+ 发布 Version 3 更新版本链与变更内容
论文被大量引用/出现衍生基准 更新 §6 生态与 §7 互链
库内新增结肠镜相关条目 补充 §7 家族图谱与互链
许可/获取方式变更 更新 §5 与 frontmatter license

附录 S:库内互链优先表

优先 rid slug 关系
★★★ 142 cvc-colondb 同任务经典基准,论文 Table 1 对比
★★★ 112 kvasir-seg 同任务分割,同 CC 开放
★★★ 163 ldpolypvideo 同"视频+框"路线最接近
★★ 173 sun-database 同含完整病理,Table 1/2 并列
★★ 183 polypgen 同"多中心"诉求
★★ 693 hyperkvasir 消化道内镜通用
★ 203 gastrovision 胃肠道内镜分类
★ 84 bkai-igh-neopolyp 结肠镜息肉分割
★ 700 giana 胃肠道图像分析挑战

附录 T:一句话定位

REAL-Colon 是迄今为止唯一以"完整手术视频 + 原生分辨率 + 真实阴性帧比例 + 完整病理"形态出现、且以 CC BY 4.0 单一许可全公开的结肠镜 AI 数据集——它把结肠镜算法的评测从精心挑选的图像拉回到真实手术台。

附录 U:常见误解澄清表

常见误解 事实
它是图像数据集 是视频数据集(60 段完整手术)
它有分割掩码 只有边界框,无像素掩码
它主要含息肉帧 恰恰相反,87.6% 是阴性帧
数据要申请 公开直链,CC BY 4.0,无需申请
60 段视频 = 60 个患者来源中心 60 视频来自 4 队列 / 6 中心
AP 0.216 说明数据集差 是"原生视频 + 真实分布 + COCO 严格 AP"下的诚实基线,不可与刷榜数字比
标注的息肉都是真息肉 14% 病理非息肉,只是内镜医师切了并被标注
XML 的 release 是版本号 是标注工具内部标记;数据集版本看 figshare+

附录 V:使用前自检清单

  • [ ] 确认任务是否需要分割掩码(若需要,改用 Kvasir-SEG / CVC-ColonDB / PolypGen);
  • [ ] 规划约 1TB 存储与数天级下载时间;
  • [ ] 阅读 dataset_description.md 与实际 CSV 列名(防列名漂移);
  • [ ] 明确病理分类任务要按 histology_class 过滤 NO POLYP;
  • [ ] 不要用 bbox 面积回归息肉 mm 尺寸;
  • [ ] 商用/再分发前做隐私合规自评估;
  • [ ] 若做跨中心泛化,注意四队列的分布差异;
  • [ ] 引用时给出论文 DOI + 数据集 DOI + 版本号。

附录 W:关键日期时间线

日期 事件
2023-02-28 标注工具 release 标记 v1.0(XML 内)
2023-03-11 figshare+ Version 1 发布
2023-07-04 论文投稿(Received)
2024-02-29 figshare+ Version 2 发布
2024-03-04 arXiv:2403.02163 v1 提交
2024-05-10 论文接收(Accepted)
2024-05 论文正式发表(Scientific Data 11, 539)

附录 X:术语中英对照速查

中文 英文 缩写
结肠镜 colonoscopy —
结直肠癌 colorectal cancer CRC
息肉 polyp —
腺瘤 adenoma AD
增生性息肉 hyperplastic polyp HP
无蒂锯齿状病灶 sessile serrated lesion SSL
传统锯齿状腺瘤 traditional serrated adenoma TSA
计算机辅助检测 computer-aided detection CADe
计算机辅助诊断 computer-aided diagnosis CADx
边界框 bounding box bbox
肠道准备评分 Boston Bowel Preparation Scale BBPS
电子病例报告表 electronic Case Report Form eCRF
阴性帧 negative frame —
阳性帧 positive frame —

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • sun-database — 共享标签:医学影像 / 内窥镜影像 / 目标检测 / 手术视频 / 结直肠癌
  • polypdb — 共享标签:医学影像 / 内窥镜影像 / 目标检测 / 评测基准 / 结直肠癌
  • ldpolypvideo — 共享标签:医学影像 / 内窥镜影像 / 目标检测 / 结直肠癌
  • cad-cap — 共享标签:医学影像 / 内窥镜影像 / 目标检测 / 手术视频
  • heico — 共享标签:医学影像 / 内窥镜影像 / 手术视频 / 结直肠癌
  • slam-laparoscopic-motions — 共享标签:医学影像 / 内窥镜影像 / 手术视频 / 评测基准
  • slam-3d-endoscopic — 共享标签:医学影像 / 内窥镜影像 / 手术视频
  • polypgen — 共享标签:医学影像 / 内窥镜影像 / 手术视频 / 评测基准
  • jigsaws — 共享标签:医学影像 / 内窥镜影像 / 手术视频
  • m2cai16-tool — 共享标签:医学影像 / 内窥镜影像 / 手术视频

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集