SARS-CoV-2 CT Scan Collection (sar-covid) — AI-Ready Wikipedia

Angelov 与 Soares 2020 年 4 月发布的新冠胸部 CT 二分类图像集:医院真实患者轴位切片 2482 张(阳性 1252/阴性 1230),配套可解释分类器 xDNN 报 F1 97.31%,另有患者级三分类扩展版 4173 张,是 2020 年下载量最大的 COVID-CT 数据集之一

来源 多家医院真实患者胸部 CT 轴位切片(PNG):COVID 阳性 1252 张(文件名 Covid (N).png)+ 非阳性 1230 张(文件名 1-N.png);Kaggle V2 242.23 MB;另有后续研究者重组的患者级三分类扩展版(COVID-19/Healthy/Others,4173 张)发布时间: 2026-09-28最后更新: 2026-09-28 阅读 12
SARS-CoV-2 CT Scan Collection (sar-covid) — AI-Ready Wikipedia

信息速览

数据集名称SARS-CoV-2 CT Scan Collection (sar-covid) — AI-Ready Wikipedia
数据类型影像数据,原始数据,人工标注
规模2482 张 CT 轴位切片(COVID 阳性 1252 + 阴性 1230;主版本无患者 ID);扩展版 210 例患者(80+50+80)4173 张
接入方式多家医院真实患者胸部 CT 轴位切片(PNG):COVID 阳性 1252 张(文件名 Covid (N).png)+ 非阳性 1230 张(文件名 1-N.png);Kaggle V2 242.23 MB;另有后续研究者重组的患者级三分类扩展版(COVID-19/Healthy/Others,4173 张)
AI 就绪度

INFOBOX — SARS-CoV-2 CT scan collection 一屏速览

维度 内容
本质 医院真实患者胸部 CT 轴位切片的二分类图像集(COVID-19 vs non-COVID),2020 年新冠爆发早期的代表性公开数据
团队 英国 University of Exeter:Plamen Angelov(通讯)+ Eduardo Almeida Soares(预印本早期记录 2 作者;现行页面 5 作者,见坑 3)
论文 medRxiv 预印本 doi:10.1101/2020.04.24.20078584(2020-04-24 投稿,未正式见刊);方法论文 Neural Networks 130:185-194(2020,doi:10.1016/j.neunet.2020.07.010)
数据 主版本 2482 张轴位切片 = COVID 阳性 1252(Covid (N).png)+ 阴性 1230(1-N.png);Kaggle V2 242.23 MB
扩展版 4173 张 / 210 例患者三分类(COVID-19 80 例 2168 张 + Healthy 50 例 758 张 + Others 80 例 1247 张),60/40 subject-wise,见于 Alshazly et al. 2021
标注 切片级类别标签(放射科医生确认阳性);无像素掩码、无边框、主版本无患者 ID
旗舰成绩 xDNN 可解释分类器 F1 97.31%(2 类切片级);COVID-Nets 第三方基准 93.87%(3 类患者级 subject-wise)——两者口径不可直接比(坑 8)
获取 Kaggle plameneduardo/sarscov2-ctscan-dataset(usability 8.75,Views 175K / Downloads 28.1K)+ GitHub MATLAB 代码库
许可 CC BY-NC-SA 4.0(非商业+相同方式共享传染);GitHub 代码无许可条款声明
撞名警示 与库内 covid-ct(UCSD 的 COVID-CT-Dataset)同名异实,作者 GitHub README 也自称 “COVID-CT dataset”(坑 1、坑 4)
库内互链 covid-ct(307)、covid-19-radiography(217)、bimcv-covid(207)、mosmeddata(297)、midrc-ricord(227)、covidx-cxr(197)、ct-rate(546)、lung-pet-ct-dx(475)

SARS-CoV-2 CT scan collection 是一个"应急时刻的朴素数据集":2020 年 4 月,新冠大流行第一波高峰,埃克塞特大学的 Plamen Angelov 与 Eduardo Almeida Soares 把医院真实患者的一批胸部 CT 轴位切片整理成两个文件夹——阳性 1252 张、阴性 1230 张——连同他们自己提出的可解释分类器 xDNN 一起发布,预印本报告 F1 97.31%。它没有花哨的标注体系、没有患者元数据、甚至没有统一的图像尺寸,却在几个月内成为全球 COVID 影像研究引用与下载最多的数据集之一:对急着找数据的 2020 年研究者来说,"简单、干净、能跑"本身就是稀缺品。

五年之后回头看,它的价值与它的缺陷同样清晰:切片级标签带来的患者级泄漏、扩展版与主版本并存的双口径、与另一支团队的 COVID-CT-Dataset 撞名造成的检索混乱——这些恰恰使它成为研究"应急数据集工程"的最佳标本。本条目按"是什么—怎么构成—怎么评—怎么取—怎么用"展开,所有双口径冲突逐条存照于 §10 与附录 L。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——单一 Kaggle 渠道直下,但注意 CC BY-NC-SA 的非商业传染条款。
  2. 要出分数:先读 §5 基准与 §10 坑 8——97.31% 是切片级随机划分的成绩,直接对标你的患者级成绩是方法论错误。
  3. 写综述或做数据集研究:§4 景观对照 + §9 库内关系 + 附录 L 双口径登记表可以直接引用。

§0 导读:这个数据集解决什么问题

2020 年初,COVID-19 的影像学证据(胸部 CT 上的磨玻璃影、铺路石征)被反复报道为核酸检测之外的重要辅助手段,而核酸检测在疫情高峰期存在周转慢、假阴性率高的问题。于是"用深度学习从 CT 上识别 COVID-19"成了当时最拥挤的研究赛道之一——但这条赛道在 2020 年 3 月之前几乎没有像样的公共燃料:没有大规模、免注册、直接可下载的 CT 数据集。

SARS-CoV-2 CT scan collection 就是给这条赛道补的第一桶油之一。它的解决方案分三层。第一层是数据本体:2482 张来自医院真实患者的轴位 CT 切片,二分类、基本均衡(1252 vs 1230),PNG 格式直下直用,不需要注册申请、不需要联系作者。第二层是方法配对:作者同时发布 xDNN(explainable-by-design deep neural network)的 MATLAB 实现与预训练模型文件,预印本与期刊版(Neural Networks 2020)报告 F1 97.31%,并把"可解释性"作为卖点——在医疗 AI 信任问题刚被摆上台面的 2020 年,"数据+可解释方法"的组合拳有相当的示范意义。第三层是生态位:因为发布早、门槛低,它成了 2020-2021 年大量 COVID-CT 论文的默认基准之一,后续研究者又在它基础上重组出患者级三分类扩展版(4173 张、210 例、60/40 subject-wise),使它同时具备了"二分类主版本"与"三分类患者级版本"两个形态。

§0 读法三则:

  1. 这个条目是"数据集+方法论文+第三方扩展"三件套:本体是 2482 张切片二分类(Kaggle 在售口径),扩展版 4173 张三分类从未在作者原始渠道发布——两者许可与出处不同(§2.4、§6)。
  2. 全文硬数字均出自 Kaggle 页面、medRxiv/Europe PMC 元数据、Neural Networks 论文与 Alshazly et al. 2021 四类来源;已知冲突(文件数 ±1、标题作者双口径、引用数两口径、图像尺寸三口径)全部在 §10 与附录 L 存照。
  3. 检索时若把 “COVID-CT” 当作本数据集的名字,会落入库内 covid-ct(rid 307,UCSD 团队)条目——两支团队、两种数据、两个故事(坑 1)。

全篇数字导航(先记住这七个数,读正文就有坐标系):

  • 2482:主版本切片总数(1252 阳性 + 1230 阴性);
  • 4173 / 210:扩展版切片数 / 患者数(三分类,第三方重组);
  • 97.31%:xDNN 的 F1(切片级口径,含泄漏红利);
  • 93.87%:COVID-Nets 准确率(扩展版患者级口径);
  • 242.23 MB:Kaggle V2 全量体积;
  • CC BY-NC-SA 4.0:数据许可(NC 禁商业、SA 传染);
  • 8 条:库内互链条目数(rid 297/227/546/475/217/307/197/207)。

这七个数在正文中反复出现;任何一处与你手上的实测不一致,优先核对口径(§5.3),再查 §10 存照清单。

§1 数据集速览:十问十答

Q1:这个数据集里到底有什么?
2482 张胸部 CT 轴位切片,PNG 格式,分两个目录:COVID 阳性 1252 张(文件名 Covid (N).png,N 从 1 到 1252)、非阳性 1230 张(文件名 1.png 到 1230.png)。切片来自医院真实患者,阳性病例经放射科医生确认。没有体积序列、没有患者 ID、没有像素级掩码——就是一张张独立的图。

Q2:图像规格是什么?
非统一尺寸的 PNG 灰度/近灰度图。各文献测得的尺寸区间互不一致(约从 104×119 到 484×456,见坑 6),使用前必须统一缩放或裁剪。无 DICOM 原始头信息,无法恢复层厚、窗宽窗位、设备型号等采集参数。

Q3:在哪里下载?
Kaggle:plameneduardo/sarscov2-ctscan-dataset。当前 V2 版本 242.23 MB,页面可用性评分 8.75,标签为 Image / Computer Science / Computer Vision / Coronavirus / Medicine。页面统计 Views 17.5 万、Downloads 2.81 万。无需联系作者,注册 Kaggle 即可下载。

Q4:能用在我的项目里吗?许可怎么算?
数据许可为 CC BY-NC-SA 4.0:署名 + 非商业 + 相同方式共享。学术与科研用途基本无障碍;商业产品、商业服务直接使用需要另行评估(NC 条款);衍生数据集必须以相同许可发布(SA 传染)。注意配套的 GitHub MATLAB 代码没有许可条款,默认版权保留,严格意义上只可浏览不可复用(坑 7)。

Q5:有没有患者划分?会不会数据泄漏?
主版本没有患者 ID,这是它被后续文献批评最多的硬伤:同一患者的多张相邻切片几乎必然高度相似,随机划分训练/测试集时两边都会出现同一患者的切片,模型可以靠"记住这个病人"而不是"学会看磨玻璃影"拿高分。扩展版(4173 张、210 例)补上了患者分组,支持 60/40 subject-wise 划分——Alshazly 等的第三方基准就是在这个口径下做的(§2.4、§5)。

Q6:基准成绩到底多少?
两个口径:作者 xDNN 在主版本 2482 张切片级二分类上 F1 97.31%;Alshazly et al. 2021 的 COVID-Nets 在扩展版 4173 张、三分类、60/40 患者级划分上准确率 93.87%。前者含患者泄漏乐观偏差,后者才是患者级口径的诚实数字——两者不可直接比较(坑 8)。

Q7:2482 和 4173 是什么关系?
同一数据集的两个形态。2482(2 类)是作者 2020 年 4 月发布、Kaggle 在售的主版本;4173(3 类:COVID-19/Healthy/Others,210 例患者)是后续研究者(Alshazly et al. 2021 的 COVID-Nets 论文使用的重组版)在主版本基础上扩展的患者级版本,从未在作者原始渠道发布(坑 2)。

Q8:它和库内 covid-ct 条目是什么关系?
没有关系,只是撞名。库内 covid-ct(rid 307)是 UCSD AI4H 团队 Zhao 与 Xie 的 COVID-CT-Dataset(arXiv:2003.13865),图像是从论文配图里提取的 349+397/463 张;本条目是 Exeter 团队的医院原始 CT 2482 张。更麻烦的是,本数据集作者的 GitHub README 也自称 “COVID-CT dataset”——检索与引用时务必核对 DOI 或 Kaggle slug(坑 1、坑 4)。

Q9:训练前要做哪些预处理?
统一尺寸(建议 224×224 或 229×229 以适配常见骨干);灰度归一化;若做患者级评估,必须用扩展版并按 subject 划分;若坚持用主版本,至少要在论文里明示划分方式为切片级随机划分并讨论泄漏风险。类别层面主版本基本均衡(1252 vs 1230),不需要重采样;扩展版三分类需要处理 2168/758/1247 的不平衡。

Q10:引用格式怎么写?
引 medRxiv 预印本:Angelov P, Soares EA. “SARS-CoV-2 CT-scan dataset: A large dataset of real patients CT scans for SARS-CoV-2 (COVID-19) identification.” medRxiv 2020.04.24.20078584。若用到 xDNN 方法与 97.31%,加引 Angelov P, Soares EA. Neural Networks 130:185-194 (2020), doi:10.1016/j.neunet.2020.07.010。用扩展版 4173 时必须引 Alshazly et al., PeerJ Computer Science 7:e655 (2021)(附录 M 有完整 BibTeX)。

§2 数据构成与规格

2.1 规模、构成与均衡度

主版本(Kaggle 在售口径)的构成一目了然:

目录 文件数 文件名模式 含义
COVID 1252 Covid (1).png … Covid (1252).png 放射科确认的 COVID-19 阳性切片
non-COVID 1230 1.png … 1230.png 非阳性切片(健康或其他肺部情况)
合计 2482 — 二分类、类别基本均衡(比例约 1.018:1)

Kaggle 页面 Summary 栏显示的文件总数为 2481,与 Files 明细逐目录求和的 2482 相差 1 张——这是页面统计口径差而非数据本身矛盾,本条目以明细求和 2482 为准(坑 4)。类别基本均衡意味着二分类任务不需要类别加权或重采样,这在"拿来就能跑"的意义上降低了使用门槛,也是它比同期许多严重不平衡的数据集更受欢迎的原因之一。

需要特别强调"切片"与"患者"的区别:2482 是切片数,不是患者数。主版本不提供患者 ID,预印本未披露阳性切片覆盖多少名患者。扩展版口径下COVID-19 一类涉及 80 例患者 2168 张切片——平均每人 27 张,这个"人均切片数"提示主版本的阳性类同样存在大量同患者近重复切片(§3.3)。

2.2 文件组织与命名

数据集的组织方式是"两个文件夹、无清单文件、无元数据表":

  • 目录结构:顶层两个目录,无 train/val/test 预划分类目录,无 CSV 清单,无 README。使用者自行划分。
  • 命名不对称:阳性目录的文件名带空格与括号(Covid (1252).png),阴性目录是纯数字。这种不对称在脚本里很容易踩到 glob 与正则的坑(附录 E 给出解析骨架)。
  • 格式:PNG,8 位。无 DICOM。所有原始采集参数(层厚、卷积核、窗宽窗位、设备厂商)不可恢复——这是"论文配图/导出图像级发布"路线的通病,但对纯分类任务影响有限。
  • 体积:V2 全量 242.23 MB,单张平均约 97 KB——小图、低色深,是"导出后压缩"的产物,不是原始 DICOM 转档。

2.3 图像尺寸:三个口径三个区间

图像尺寸不统一,且不同文献测出的区间互不一致,这是本数据集被引用时最常见的低级错误来源。三种实测口径并存:

口径来源 报告区间
PMC 文献实测 324×412 至 484×456
MDPI 文献实测 104×119 至 416×512
Awesome 脚本统计 最小 [182,129]、中位 [390,240]、最大 [484,416]

三个区间互有出入的原因可能包括:统计样本不同(全集 vs 子集)、是否计入异常小图、宽高顺序约定不同。本条目不下"正确区间"的断言,只给定性结论:尺寸高度离散(短边从约 100 到 400+ 像素),任何使用前必须统一重采样,引用具体区间时注明出处(坑 6)。

2.4 扩展版:4173 张、210 例、三分类

扩展版不是作者的第二次发布,而是后续研究者在主版本基础上的重组与扩展,其口径由使用它的 COVID-Nets 论文(Alshazly et al., PeerJ Computer Science 2021, doi:10.7717/peerjcs.655)完整记载:

类别 患者数 切片数 说明
COVID-19 80 2168 阳性,按患者归组
Healthy 50 758 健康对照
Others 80 1247 非 COVID 的其他肺部异常(细菌性肺炎等)
合计 210 4173 三分类、患者级标注

关键改进与注意事项:

  1. 患者级归组:每张切片关联到患者,使 subject-wise 划分成为可能。Alshazly 等采用 60/40 的患者级训练/测试划分,杜绝了主版本的泄漏问题。
  2. 类别不再均衡:2168/758/1247 的比例约为 2.9:1:1.6,三分类实验需要加权损失或重采样——原 2482 版的"均衡"优势在扩展版不复存在。
  3. "Others"类的方法学意义:加入非 COVID 肺部异常对照,把任务从"有没有异常"升级为"是不是 COVID"——这是对主版本"阳性 vs 万物"设计的直接修正(§8.1)。
  4. 出处与许可:扩展版从未在作者 Kaggle/GitHub 发布,其获取需依赖 COVID-Nets 论文的发布渠道或自行按论文描述重组;重组的授权链条未明示,引用与再分发时必须同时标注原数据集与重组论文。

2.5 元数据缺位:一张"哑图"集

主版本在元数据维度几乎是一张白纸,逐项列清:

元数据维度 是否提供 影响
患者 ID/人口学(年龄、性别) 否 无法做人群亚组分析,无法严格患者级划分
切片层位/层厚 否 无法重建体积上下文,无法区分同一病灶的不同切面
采集设备/重建参数 否 无法做设备去偏(debiasing),模型可能学到设备指纹
采集医院/地域 否(仅"来自医院的真实患者") 无法评估地域泛化性
PCR/临床确认信息 否(仅称阳性经放射科医生确认) 标签金标准强度未知,无核酸检测一致性数据
像素级标注 否 不支持分割、定位、病灶量化任务

这份缺位清单不是吹毛求疵:2020 年应急语境下"先有图再说"可以理解,但 2021 年之后的 BIMCV-COVID+(带完整 DICOM 与分割标注)、MIDRC-RICORD(带患者级金标准)等数据集正是沿着"补元数据"的方向完成了超越(§4.3)。

2.6 与同期 COVID-CT 数据集的规格对照

把本数据集放回 2020-2021 年的 COVID 影像数据集景观中(详细叙事见 §4,此处只比硬规格):

数据集 模态 规模 标注粒度 患者级信息
SARS-CoV-2 CT scan collection(本条目) CT 切片 2482 张(主)/4173 张(扩展) 切片级 2 类 / 患者级 3 类 扩展版有
COVID-CT-Dataset(UCSD,库内 covid-ct 307) CT 切片 349+397/463 张 切片级 无
COVID-19 Radiography Database(库内 covid-19-radiography 217) X 光为主 万级,多类 图像级多类 无
BIMCV-COVID+(库内 bimcv-covid 207) CT+X 光 数千研究 研究级+病灶级 有(DICOM 完整)
MosMedData+(库内 mosmeddata 297) CT 体积 1110 例 体积级五级 有
MIDRC-RICORD(库内 midrc-ricord 227) CT 体积 约 1000 例 病灶级金标准 有

本数据集的相对位置:规模上介于 UCSD COVID-CT(数百张)与 BIMCV(数千研究)之间;标注粒度上是"图像级"路线的典型代表;患者级信息是它相对 UCSD 版的唯一结构性优势(且要靠扩展版兑现)。

§3 任务与标注

3.1 任务定义:两个版本、两种任务

主版本任务:图像级二分类——给定一张轴位 CT 切片,判断是否为 COVID-19 阳性。输入 2482 张 PNG 之一,输出二值标签。预印本与 Neural Networks 论文的评测均在此口径:切片级、随机划分、2 类。

扩展版任务:患者级三分类——给定一张切片(关联到患者),在 COVID-19 / Healthy / Others 三类中判断。评测口径(以 COVID-Nets 为代表):subject-wise 60/40 划分、3 类。

两个任务共享同一批影像血统,但不是同一道题:三分类引入"Others"对照后,模型必须区分 COVID 与其他肺炎,难度实质上升;患者级划分又去掉了泄漏红利,分数天花板显著低于切片级口径(§5.3 的 97.31% vs 93.87% 就是这两个效应的直接体现)。

3.2 标注形态与确认流程

本数据集的"标注"是类别标签层面的极简形态:

  • 阳性侧:预印本称影像来自经放射科医生确认的 COVID-19 患者。未披露确认是否基于 PCR 金标准、是否双盲复核、各院标签标准是否一致。
  • 阴性侧:1230 张"非阳性"的构成未细分——健康人、其他肺炎、术后改变等各占多少没有公开清单。这一点在扩展版中被补齐(Healthy 与 Others 分开),但主版本内部是个黑箱。
  • 流程披露:无标注指南、无仲裁流程、无观察者间一致性实验。这与 2020 年应急发布的节奏一致,但意味着"标签质量"只能靠下游复现间接检验。

3.3 切片级标签的先天缺陷:泄漏与重复

这是后续文献对本数据集最集中的批评,值得完整展开:

  1. 同患者近重复:一次 CT 扫描产生几十至几百张相邻切片,相邻切片的图像内容高度相似。主版本无患者 ID,同一患者的切片散落在任意位置。
  2. 随机划分即泄漏:常用的"80/20 随机划分"会让同一患者的切片同时出现在训练与测试集。模型只需把"这位患者的肺长什么样"记下来,就能在测试集上对这位患者的其他切片答对——高分中有多少来自"学会识别肺炎模式"、多少来自"记住具体病人",无法区分。
  3. 乐观偏差的量级:同类数据集上的对照实验(含 COVID-Nets 论文内的切片级 vs 患者级对比)显示,患者级划分的准确率普遍比切片级随机划分低几个到十几个百分点。97.31% 的 F1 必须放在这个背景里读(坑 8)。
  4. 为什么问题至今仍在:因为 Kaggle 主版本没有患者 ID,任何只用主版本的工作都无法事后修复这个问题——只能换扩展版,或者明示口径并接受解读折扣。

3.4 扩展版的修正:subject-wise 的标准姿势

扩展版把"患者"变成一等公民,其标准实验协议(沿 COVID-Nets 口径):

  • 按患者分组,60% 患者(含其全部切片)进训练集,40% 进测试集;
  • 三分类下报告总体准确率与各类别指标,处理类别不平衡(2168/758/1247);
  • 因为切断了患者泄漏,报告的数字才是"模型看到新病人时的表现"。

使用扩展版时有两个附带义务:一是必须同时引用原数据集(medRxiv 预印本)与重组论文(Alshazly et al. 2021),因为患者归组与 Others 类构成是后者的工作;二是不可把扩展版成绩与主版本历史成绩混表——划分口径不同,混表会制造"方法退化"的假象。

§4 同期景观:与 COVID 影像数据集的比较发现

4.1 发布时间线上的卡位

把 2020 年 3-5 月 COVID 影像数据集的密集发布期排成时间线,本数据集的位置一目了然:

  • 2020-03 中旬:UCSD 团队发布 COVID-CT-Dataset 首版(349 张,从论文配图提取);
  • 2020-04-24:本数据集预印本投稿,随附 Kaggle 发布(2482 张,医院原始切片);
  • 2020-04-30 前后:COVID-19 Radiography Database 多轮扩容(X 光为主);
  • 2020 年夏起:BIMCV-COVID+、MosMedData 等带元数据的新一代数据集陆续上线。

本数据集发布在"配图提取"路线(规模小、质量参差)与"元数据完备"路线(工程量大、来得慢)之间的空档:比配图提取版大数倍且是真实患者数据,比元数据完备版早数月且零门槛。这个卡位解释了它早期爆发式的采用率。

4.2 与 UCSD COVID-CT-Dataset 的正面对比

两者是最常被混为一谈的一对(坑 1 的根源),逐项拆开:

维度 SARS-CoV-2 CT scan collection(本条目) COVID-CT-Dataset(UCSD)
团队 Exeter 大学 Angelov/Soares UCSD AI4H(Zhao、Xie 等)
论文 medRxiv 2020.04.24.20078584 arXiv:2003.13865
图像来源 医院真实患者(授权未公开细节) 已发表论文的配图截图提取
规模 2482(主版本,单批发布) 349 起家,多批扩至 349+397/463
类别 二分类均衡(1252/1230) COVID vs non-COVID,比例失衡
患者信息 主版本无;扩展版有 无
文件名 Covid (N).png / N.png 沿用论文图号
配套方法 xDNN(MATLAB)+ F1 97.31% 配套基线(ResNet 系)

混用的后果是具体的:检索 “COVID-CT dataset” 时两条数据都会命中;引用链上把两者的 DOI 互换会造成"规模 2482 vs 数百张"的叙事错乱;跨库对比实验若把两者当同一数据集的不同版本,结论直接作废。本库在 covid-ct(rid 307)条目与本条目均做了撞名辨析,互为镜像(§9)。

4.3 质量升级路径:从"哑图集"到"带标注的体积集"

以本数据集为起点,COVID-CT 数据质量的三级跳路线清晰可见:

  1. 第一级(本数据集所属):切片级标签 + 无元数据。代表:本数据集主版本、UCSD COVID-CT。适合快速原型与教学,结论外推需谨慎。
  2. 第二级:切片级标签 + 患者归组 + 多类对照。代表:本数据集扩展版(4173)、部分机构内部数据集。患者级评估成为可能。
  3. 第三级:体积序列 + 病灶级标注 + DICOM 完整元数据。代表:BIMCV-COVID+(207)、MIDRC-RICORD(227)、MosMedData+(297)。支持分割、定量、纵向研究。

这条升级路径的方法学启示(§8.1 展开)是:数据集的"代际"由标注粒度与患者级结构决定,而不由张数决定。4173 张的扩展版在方法学上优于 2482 张的主版本,正如 1000 例带病灶标注的 RICORD 优于 4000 张哑图。

2.7 采集与构成叙事:预印本说了什么、没说什么

把预印本对数据来源的全部披露摊开,是一份很薄的清单:

说了的:

  • 图像来自医院真实患者(real patients)的胸部 CT;
  • 阳性病例由放射科医生确认;
  • 主版本为二分类、两类规模接近(1252/1230);
  • 发布形态为独立轴位切片(非体积序列)。

没说的:

  • 医院/国家的数量与名单,以及逐院样本量分布;
  • 患者总数(切片数 2482 对应多少患者);
  • 阳性确认是否以核酸检测(PCR)为金标准;
  • 阴性 1230 张的内部构成(健康人、其他肺炎、术后改变等各占多少);
  • 采集时间窗、设备分布、重建协议;
  • 伦理审批号与数据共享协议(患者知情同意的处理方式)。

这份"未披露清单"不是要否定数据集的历史功绩——2020 年 4 月的时间压力下,多数应急数据集都选择了先发布。但它划定了使用边界:任何依赖来源同质性假设的分析(按医院分层、按设备去偏、按人群外推)在本数据集上都不可能执行。需要在论文里写"数据覆盖哪些人群、什么设备"的作者,要么换数据集,要么把这一局限如实写进 limitations。

2.8 均衡设计的两面:门槛的降低与叙事的简化

1252/1230 的近乎完美均衡值得单独一节讨论,因为它既是卖点也是误导源。

作为卖点:均衡意味着最小类别加权、最直接的 accuracy/F1 解读、最平滑的训练动态——这让"下载到出 baseline"的时间压缩到小时级,是它在教学与快速验证场景里长盛不衰的直接原因。

作为误导源:现实临床中的 COVID 检测任务从不均衡——大流行高峰期送检人群的阳性率、常规筛查的阳性率都与 50% 相去甚远。在本数据集上报告的 accuracy 96% 一类数字,换算到 5% 阳性率的真实场景,精确率会坍缩到完全不可用的水平(class balance 与临床先验不匹配的经典陷阱)。此外,均衡掩盖了"阴性构成"的复杂性:把健康人、细菌性肺炎、其他病毒性肺炎全并进一个阴性类,等于让模型学"COVID vs 其余一切"——这个任务定义下的高分,不能自动翻译成"能鉴别 COVID 与其他肺炎"。

扩展版把 Healthy 与 Others 拆开(§2.4)正是对这一简化叙事的直接回应——作者之外的社区用数据组织方式修正了任务定义。

3.5 标注质量的下游证据:从分数异常到结构复盘

标注流程未披露,但下游文献留下了一些可以拼合的间接证据:

  1. 分数带异常平:切片级口径下大量工作集中在 95%-99%(§5.4),分数带的顶部拥挤且区分度低——这与"标签简单清晰 + 泄漏垫底"的组合一致:标签本身少有歧义(二分类、切片级),错误空间小,天花板被结构问题而非标注问题钉住。
  2. 患者级口径的回落幅度:扩展版上同一批骨干从切片级口径回落数个百分点——回落主要来自泄漏消除与三分类难度,但部分也来自"同患者切片跨类标注一致性"的暴露:同一患者相邻切片被分属不同处理的情形,间接说明主版本的标签是按切片、非按患者赋予的。
  3. 无一例"标签大规模翻案"研究:与 PANDA 高级别标签系统性错误(本库 panda-plus 条目的核心发现)不同,没有文献报告本数据集存在批量错标——这可以谨慎地读作"二分类标签质量可用",但证据强度有限(无系统复审研究)。

综合判断(供成稿引用时校准语气):标签在"切片级二分类"任务定义内基本可靠;任务定义本身的局限(无患者结构、阴性黑箱)比标签错误更是问题的主体。

3.6 标注工艺对比:三种发布哲学

把本数据集放在同期数据集的"标注工艺光谱"上,三种哲学清晰可辨:

工艺 代表 标注成本 结构信息 适合场景
极简目录即标签 本数据集主版本 极低 无 快速原型、教学、早期验证
重组与归组 本数据集扩展版(第三方) 中(依赖原数据可归组性) 患者级 严格评测、方法学论文
前瞻性结构化采集 MIDRC-RICORD、BIMCV-COVID+ 高(协议、金标准、多专家) 病灶级+DICOM 临床级验证、监管路径

本数据集占据光谱最左端并把它做到极致。这个位置的真正风险是被误用:使用者把"目录即标签"的极简形态当成完整标注体系,在其上做出超出任务定义的结论(如宣称"可用于临床筛查")。成稿的立场:数据没有错,错的是超出口径的解读——这也是本条目把"口径意识"作为贯穿主题的原因(§5.3、坑 8)。

4.4 跨数据集泛化:文献里的观察

COVID-CT 分类工作的另一个常见设计是"本数据集训练、别家数据集测试"(或反之)的跨库泛化。文献中的重复观察值得记录:

  1. 跨库普遍掉分:无论本数据集与 UCSD COVID-CT 互测,还是 CT 库与 X 光库互测,跨库成绩普遍比库内低 10-30 个百分点——来源差异(医院切片 vs 配图提取)、采集协议差异、预处理差异叠加的结果。
  2. 本数据集的"医院切片"属性是双刃剑:作为训练源,它比配图提取版更接近真实成像分布;作为测试源,它对"真实世界部署"的代表性也更高——但仅对"轴位切片"这一输入形态成立。
  3. 同源偏差的教训:多库联合训练时若不做来源去偏,模型会学出"这条数据来自哪个数据集"的捷径特征——多篇论文报告了剔除来源指纹后跨库成绩的进一步变化。这与 §2.5 设备指纹缺失互为镜像:元数据缺位让你连去偏都无从下手。

4.5 择集决策矩阵:什么时候选它、什么时候别选

给检索者一张直接的决策矩阵:

你的需求 选本数据集? 理由与替代
二分类快速 baseline / 教学 选 零门槛+均衡+体积小(§6.4)
切片级大训练源 谨慎 2482 张在 2026 年已不算大;无元数据限制去偏
患者级严格评测 换/扩展 主版本不可能;用扩展版(引 Alshazly 2021)或直接换 227/207/297
分割/定位/量化 不选 无像素级标注(§2.5)
体积/纵向研究 不选 切片级发布,无层厚无序列
影像-文本/多模态 不选 无报告文本;转 ct-rate(546)
商业部署训练源 先谈授权 NC 条款挡路(坑 7)
数据集方法论教学案例 选 撞名、泄漏、双口径全是活教材(§8)

2.9 一次"拿图即用"的真实成本核算

"零门槛"宣传的是下载环节;把数据变成可训练形态的真实工时,值得算一笔账(按单人、熟悉 PyTorch 的假设):

环节 工时 内容
注册+下载 10 分钟 Kaggle 账号 + API 下载 242.23 MB
清点核验 20 分钟 附录 E 清单重建,核对 1252/1230
尺寸普查 20 分钟 批量读头、输出分布、异常图清单
预处理管线 1-2 小时 resize/归一化/增强,跑通 ImageFolder
划分设计 30 分钟-2 小时 切片级随机(快);或改为扩展版患者级(需先拿到/重组数据)
口径写作 30 分钟 把 §5.5 五步协议落进实验记录
合计 约 3-5 小时 对比"申请制数据集"动辄数天的等待,仍属低成本

结论:它的"即用性"宣传成立,但"即用"的含义是半天内可训练,不是五分钟出结论——把两者混同正是 §3.3 系列问题的社会心理根源:跑通太容易,反思容易被跳过。

3.7 延伸问答:为什么没有众包标注、没有一致性实验

两个常被问到的"为什么没有":

为什么没有众包细化标注? 2020 年 4 月的发布目标是最小可用(minimum viable dataset):分类标签是当时临床叙事(“CT 有助于识别 COVID”)与社区需求(“有图能训练”)的最小交集。像素级标注的边际收益(支持分割/定位)在应急期属于第二优先级——事实上直到 BIMCV-COVID+ 与 RICORD 上线,社区才真正拿到第一Tier 的像素级/病灶级 COVID-CT 监督。

为什么没有标注者一致性数据? 一致性实验(多人独立标注同一子集、算 kappa)的成本主要在专家时间。应急期既没有多位可动员的放射科医生,也没有等待一致性数据的时间窗。后果是:标签质量只能靠下游表现间接推断(§3.5),而这个推断链本身也有不确定性——两个不确定叠加,就是本条目把标注质量维度的 DAIMS 评分压到 2/5 的原因(附录 B)。

这两个"没有"合起来给出一条经验:一致性数据是数据集的"标定证书",可以后补但不可跳过;后补的成本随时间指数上升(用户越多、基于它的结论越多、翻案成本越高)。

§5 基准与评估:两个口径的数字怎么读

5.1 xDNN:作者的旗舰成绩 F1 97.31%

与数据集同批发布的 xDNN(explainable-by-design deep neural network)是本数据集的第一个基准:

  • 方法要点:xDNN 是 Angelov 团队提出的可解释深度网络框架,训练后以原型(prototype)分解决策依据,对每个预测给出"像哪些原型、不像哪些原型"的构成解释——在医疗 AI 强调可信任的 2020 年,这是它的差异化卖点。
  • 发布载体:MATLAB 实现(xDNN_SARS.m + 闭源编译件 xDNN.p + 预训练 .mat),托管于 GitHub 仓库 Plamen-Eduardo/xDNN-SARS-CoV-2-CT-Scan,最后提交 2020-05-12。
  • 成绩:主版本 2482 张、切片级二分类,F1 97.31%。该数字同时出现在 Kaggle 页面描述与 Neural Networks 期刊论文(130:185-194, 2020, doi:10.1016/j.neunet.2020.07.010, PMID 32682084)中,双源一致。
  • 读法警告:这是切片级随机划分口径的成绩,含患者泄漏乐观偏差(§3.3、坑 8)——它衡量的是"该方法在该口径下的上限",不是"临床可用性"。

5.2 COVID-Nets:第三方患者级基准 93.87%

Alshazly 等的 COVID-Nets 论文(PeerJ Computer Science 7:e655, 2021, doi:10.7717/peerjcs.655)是对本数据集最系统的第三方评测:

  • 口径:扩展版 4173 张、三分类(COVID-19/Healthy/Others)、60/40 subject-wise 划分。
  • 内容:系统比较多个 ImageNet 预训练骨干(VGG、ResNet、DenseNet、MobileNet、EfficientNet 等)微调与集成,报告准确率、灵敏度、特异度、F1 及混淆矩阵。
  • 代表成绩:最佳配置总体准确率 93.87%。
  • 附带贡献:正是这篇论文的患者归组工作,使数据集拥有了"扩展版"这个形态——主版本到扩展版的升级路径(§2.4)由第三方完成,这在数据集演化史上并不多见。

5.3 为什么 97.31% 与 93.87% 不可直接比较

把两个数字并排放在同一张表里是本数据集最常被犯的引用错误。差异来自三个正交维度:

维度 xDNN 97.31% COVID-Nets 93.87%
类别数 2 类(COVID vs 非) 3 类(COVID/Healthy/Others)
划分单位 切片级随机(含泄漏) 患者级 subject-wise(无泄漏)
方法来源 作者方法+作者评测 第三方骨干微调+集成

三重效应叠加:三分类比二分类难;患者级划分比切片级难;第三方方法未必优于作者方法。任何一个维度单独拆开都能解释几个百分点——三个一起,10 分以内的差距完全在预期内。正确用法:引用 97.31% 时必须注明"切片级随机划分口径";引用 93.87% 时必须注明"扩展版三分类患者级 60/40 口径";严禁两者同表混排(坑 8)。

5.4 后续文献的引用模式与分数带

2020-2022 年间引用本数据集的论文形成一条可辨识的分数带:

  • 切片级口径(多数):准确率普遍报在 95%-99% 区间,越往后越"卷"——这个区间的边际信息量很低,因为天花板被泄漏垫高。
  • 患者级口径(少数、且逐年增多):分数显著下沉,方法学论文开始明确标注 subject-wise——这批工作构成"诚实评测"的谱系,COVID-Nets 是其中的代表节点。
  • 批判性引用:一批方法学论文把本数据集当作"切片级数据集缺陷"的典型案例来解剖(与 UCSD COVID-CT 并列),其引用价值在"教训"而非"分数"。

检索者使用建议:如果你要在这个数据集上报告新分数,先决定口径(§3.1 的两个任务二选一),再决定对照对象(同口径的历史数字),最后在论文里明示划分协议——三步缺一不可。

§6 获取与许可:一门一锁一警示

6.1 三条渠道各拿什么

渠道 地址 拿什么 门槛
Kaggle(主渠道) plameneduardo/sarscov2-ctscan-dataset 全部 2482 张切片(V2,242.23 MB) 注册 Kaggle 即可直下
GitHub(代码渠道) Plamen-Eduardo/xDNN-SARS-CoV-2-CT-Scan xDNN MATLAB 代码 + 预训练 .mat 直接访问;最后提交 2020-05-12
medRxiv(论文渠道) doi:10.1101/2020.04.24.20078584 预印本全文(数据描述、方法叙述) 直接访问

注意边界:GitHub 仓库不含图像,只有代码与模型;Kaggle 仓库不含扩展版 4173;扩展版需要按 §2.4 所述依赖 COVID-Nets 论文渠道或自行重组。

6.2 Kaggle 版本链与页面统计

  • 版本链:V1(2020-04 首发口径)→ V2(当前版本,242.23 MB)。Kaggle 标注更新频率为 Monthly,但 V2 之后未见有实质内容变更的记录——把"Monthly"读成"活跃维护"会误判。
  • 页面统计(本条目生产时点):Views 约 175K,Downloads 约 28.1K,可用性评分 8.75,Tags: Image / Computer Science / Computer Vision / Coronavirus / Medicine。
  • 文件数 ±1:Summary 栏 2481 vs Files 明细求和 2482(坑 4),以明细为准。
  • 复现建议:下载后第一件事是重建文件清单(目录+文件名+尺寸三列表,附录 E 骨架),与本文 §2.1 的数字核对——任何对不上的偏差都应在实验记录里存照,而不是默默继续。

6.3 许可细读:CC BY-NC-SA 4.0 的三条款

数据集许可为 CC BY-NC-SA 4.0,三个字母各管一件事:

  1. BY(署名):使用时必须注明出处——引用 medRxiv DOI + 标注数据集名称是最低配置。
  2. NC(非商业):不得以"主要意图为商业优势或金钱报酬"的方式使用。学术发表、课程教学、非营利研究一般安全;商业产品内嵌、付费服务调用需要另行与权利人确认。对"NC"的边界判例可参考 Creative Commons 官方 FAQ,但最稳妥的路径是问作者。
  3. SA(相同方式共享):如果你重分发本数据集或其衍生数据集,必须沿用 CC BY-NC-SA 4.0。传染性意味着:基于 2482 张切片做的任何再打包(去重、重命名、合并其他数据)都不能改用更宽的许可(如 CC BY-4.0)发布。

两个常被忽略的相邻资产:

  • GitHub 代码无许可条款:仓库未附 LICENSE 文件,默认版权全保留——严格意义上不可复用其代码,只能参考思路。基于 xDNN.p 闭源编译件的调用也在灰色地带(坑 7)。
  • 论文本体:medRxiv 预印本按 medRxiv 平台条款分发,作者未声明额外的数据再授权要求;Neural Networks 论文按 Elsevier 订阅条款分发。

6.4 AI-Ready 评估:可及性满分,工程性中游

按"拿过来能不能直接喂给模型"的标准逐项打分:

维度 评价
获取门槛 优——注册即下,无需申请、无需邮件、无等待
格式即用 中——PNG 直读,但尺寸离散必须统一重采样
标签即用 优——目录即标签,命名规则简单(但注意括号与空格)
划分即用 差——无预划分、无患者 ID(扩展版另算),泄漏风险需自行管理
元数据 差——无(§2.5 全表)
许可清晰度 中——数据许可明确(NC/SA 有约束);代码无许可、扩展版授权链未明示

一句话结论:它是"五分钟跑通第一个 baseline"的典范,也是"第五个 epoch 之后开始怀疑人生"的典型——工程上手极快,方法学严谨化极难,两句话都是真的。

§7 生态与影响

7.1 引用生态:两条 Scholar 记录的汇合

本数据集的引用统计有个技术性怪相:Google Scholar 上存在两条计引记录,一条约 535 次、一条约 697 次——分别对应 medRxiv 预印本的不同索引版本(同名异版被 Scholar 未合并)。读引用量的正确姿势:

  • 总引用量级:两条合计远超千次,是 2020 年 COVID 影像数据集中引用最高的梯队;
  • 单条口径:写综述时引用量建议表述为"Scholar 两条记录合计千余次(535/697,见坑 5)",避免单引一条造成低估;
  • 另一支相关计引:Neural Networks 的 xDNN 方法论文自身约 426-427 次——方法与数据两条引用链并行,是"数据集+方法捆绑发布"策略的典型遗产。

7.2 衍生使用:谁在用、怎么用

按用途分四类:

  1. 直接训练/评测:2020-2021 年大量 COVID-CT 分类论文以本数据集(常与 UCSD COVID-CT、SARS-COV-2 Ct-Scan 等并称)为基准之一,分数带见 §5.4。
  2. 重组扩展:COVID-Nets(Alshazly et al. 2021)的患者归组三分类扩展版,本条目 §2.4 已详述——这是影响最深远的单一衍生工作。
  3. 方法学解剖对象:把本数据集当"切片级数据集缺陷标本"的批判性研究,与 §3.3、§8 的叙事一脉相承。
  4. 教学与综述常客:因获取零门槛、结构极简,成为医学影像数据管理课程与 COVID 数据集综述里的常驻对比项。

7.3 在库内 COVID 影像景观中的位置

本库收录的 COVID 相关条目构成一条从"应急哑图"到"结构化金标准"的谱系,本数据集位于谱系早期:

  • 同期同类:covid-ct(307,UCSD 配图提取)——规模更小、来源更杂,但发布更早一周余;
  • 模态互补:covid-19-radiography(217)、covidx-cxr(197)——X 光路线,设备普及率高于 CT,单图信息量低于 CT;
  • 结构化升级:bimcv-covid(207)带 DICOM 与分割、mosmeddata(297)带体积与五级评分、midrc-ricord(227)带病灶级金标准——三者共同构成"第二代",本数据集是被它们替代的"第一代"代表;
  • 纵向延伸:ct-rate(546)把胸部 CT 带入影像-文本对齐时代,lung-pet-ct-dx(475)把 PET-CT 引入肺部诊断——两者展示同一模态在 2024 年后的形态,与本数据集的 2020 年形态对照使用叙事效果最佳。

7.4 撞名的生态代价:一个命名公共品的失败案例

"COVID-CT"这个短语在 2020 年至少属于三拨人:UCSD 的数据集、本数据集作者的 GitHub 自称(坑 4)、以及泛指"COVID 的 CT 研究"的普通短语。三义并行的代价:

  • 检索污染:裸搜 “COVID-CT dataset” 无法区分两条数据,衍生出大量张冠李戴的引用;
  • 元数据漂移:本数据集在部分第三方列表里被记成 UCSD 的别名,反之亦然;
  • 本库的应对:slug 用 sar-covid(避让 covid-ct)、两个条目互相辨析(§9)、把"撞名"本身写成坑 1——检索者应当把 slug 与 DOI 双锚点作为引用习惯。

5.5 引用分数的五步协议

任何把本数据集分数写进论文或报告的场景,建议走完这五步再落笔:

  1. 定口径:主版本切片级二分类,还是扩展版患者级三分类?(§3.1)两者不可互换。
  2. 定划分:随机划分要写比例与种子;患者级要写 subject-wise 的分组依据与占比(60/40 是 COVID-Nets 口径,不是唯一合法选项)。
  3. 定对照:只与同口径历史数字比较;跨口径比较必须显式声明不可直接性。
  4. 定指标:类别均衡时 accuracy 尚可接受;患者级三分类(2168/758/1247)必须补宏平均 F1、各类灵敏度/特异度与混淆矩阵。
  5. 定声明:limitations 里写明主版本的泄漏结构风险与本数据集的元数据缺位(§2.5)——这五步里前四步是技术动作,第五步是学术诚信动作。

这套协议的产出可以直接对标附录 I 的 xDNN 核对单:你的实验若能在五步协议下与 xDNN 口径对齐,比较才有意义;若不能,就诚实地说"口径不同,仅供参考"。

6.5 Kaggle 页面字段速查

检索者打开 Kaggle 页面时会用到的全部关键字段(本条目生产时点实测):

字段 值 用途提示
数据集名 SARS-CoV-2 CT scan collection 与预印本标题的 “dataset” 拼写差异属正常
slug plameneduardo/sarscov2-ctscan-dataset 引用与脚本下载用这个,不要用页面标题
版本 V2(242.23 MB) 下载历史版本可在 Versions 页回溯
可用性评分 8.75 Kaggle 社区评分,非同行评审结论
License CC BY-NC-SA 4.0 §6.3 三条款细读
标签 Image / Computer Science / Computer Vision / Coronavirus / Medicine Kaggle 话题体系,与本库 category_tags 体系无关
更新频率 Monthly 实质冻结(§6.2),按静态数据集管理
统计 Views 175K / Downloads 28.1K 引用量之外衡量采用率的辅助指标

脚本化下载建议走 Kaggle 官方 API(kaggle datasets download plameneduardo/sarscov2-ctscan-dataset),下载后按附录 E 清单重建并核对 1252/1230——API 下载与浏览器下载的内容一致性同样值得存档一句。

6.6 下载后的十分钟体检流程

拿到 242.23 MB 的压缩包后,建议按固定顺序做十分钟体检(全部可在笔记本上完成):

  1. 解压并清点(2 分钟):目录数、文件数、按附录 E 重建清单,核对 1252/1230 与总 2482。
  2. 尺寸普查(2 分钟):批量读图头,输出 min/median/max 尺寸与异常小图清单——把你的实测区间与坑 6 的三口径对照,记录差异。
  3. 可视化抽样(2 分钟):每类随机抽 12 张拼图目检——确认没有非 CT 图混入、没有明显截断或损坏文件。
  4. 标签结构核验(2 分钟):目录名与文件名模式核对(附录 E 的正则),统计 idx<0 的异常命名文件。
  5. 划分预演(2 分钟):写下你的划分方案(切片级 or 扩展版患者级)与种子,先在清单上(而非图像上)验证划分的类分布——划分错误在清单层修,比在训练循环里调试便宜一个数量级。

体检产物(清单 CSV、尺寸统计、抽样拼图)建议与实验代码同库存档:这既是复现材料,也是未来审稿人问"你怎么处理数据"时的现成答案。

7.5 五年后再看:2026 视角的再评价

把时间快进到 2026 年,本数据集的角色已经完成了一次静默的转变:

  • 从前沿到教材:2020 年它是前沿弹药,2026 年它是教科书案例——COVID 影像综述、数据集方法论课程、医学影像数据管理培训里,它以"第一代应急数据集代表"的身份稳定出场。
  • 从基准到背景:新方法论文不再以"在本数据集上 SOTA"为卖点(分数带早已饱和且口径可疑),转而引用它做背景叙事或负面对照。
  • 从作品到标本:它最有生命力的用途是"数据集工程教学标本"——一个数据集能同时演示撞名、泄漏、双口径、许可传染、维护退场五个课题,这在数据集文献里并不多见。
  • 未完成的后事:预印本始终未正式见刊、患者 ID 始终未补、扩展版授权链始终未明——三件"未完成"让它保持了 2020 年的原始样貌,也保证了本条目存照清单的长期相关性。

对库内使用者的含义:把本条目当"历史锚点 + 教学案例"用,收益最大;当"现役训练数据"用,收益有限且要带全套口径警告。

7.6 综述里的三类引用姿势

浏览 COVID 影像综述文献,对本数据集的引用可归纳为三类姿势,各有各的正确与危险:

  1. 规模/时间线引用(“2020 年 4 月发布的 2482 张 CT 切片数据集”)——最安全,出错概率低,注意别把 2482 写成 4173 或反之(坑 2)。
  2. 成绩引用(“xDNN 报 F1 97.31%”)——中等危险,必须带"切片级随机划分"限定语,否则会被懂行的审稿人抓住(坑 8)。
  3. 谱系引用(“与 UCSD COVID-CT 并列为早期两大 COVID-CT 数据集”)——最危险,一旦把两者的来源/规模互换(医院切片 vs 配图提取),整段叙事失效;务必双 DOI 锚定(坑 1)。

本条目 §4、§10 与附录 M 的设计目标,就是让三类姿势都有可核对的落点。

6.7 与库内可获取性光谱的对照

把库内医学影像条目的获取模式排成光谱,本数据集的位置与邻居一目了然:

获取模式 库内代表 门槛 本数据集
直链下载(注册即得) 本数据集、UCSD covid-ct 最低 所在位置
平台托管+条款点击 covid-19-radiography 等 低 —
申请制(邮件+用途说明) mosmeddata(297) 中 —
请求制(资格审查) panda-plus 掩码 高 —
受控挑战赛渠道 midrc-ricord(227) 中高 —

本数据集处在光谱最左端——这与它"第一代应急数据集"的身份一致:可获取性顶格,结构化程度垫底,两者在同一数据集上呈跷跷板关系。这个跷跷板在库内不是孤例,而是 2020-2021 年发布的数据集的普遍剖面;2023 年后的新条目(如 ct-rate 的 HF 托管形态)才开始同时做高两端。

7.7 衍生品清单:它留下过什么

按"实物程度"从高到低盘点本数据集的衍生资产:

  1. 扩展版 4173(最重资产):第三方重组的患者级三分类版本(§2.4),是唯一被后续研究持续引用的"再发布级"衍生品。
  2. 基准协议遗产:60/40 subject-wise 划分协议(随扩展版确立)成为后续 COVID-CT 患者级评测的通用起点。
  3. 方法学批判文献:以它为案例的切片级数据集批评研究(§3.3、§4.4)——衍生品不一定是数据,也可以是结论。
  4. 教学引用:数据集工程课程与综述中的常驻案例(§7.5),本库本条目本身即最新一例。
  5. 训练库的隐藏存在:无数模型在训练日志里用过它,但没有留下可引用的独立资产——这部分"隐性使用"只能从采用率统计(Downloads 28.1K)间接感知。

清空的另一面也值得记录:没有官方后续版本、没有官方维护的 leaderboard、没有官方数据卡——所有衍生品的维护主体都是社区而非作者。这是"发布即退场"模式的完整样本。

§8 方法学启示:三条可迁移的经验

8.1 标注粒度与患者结构决定数据集代际

本数据集主版本与扩展版的差距(2482 哑图 vs 4173 患者级)是"代际升级"的完整标本:升级没有发生在作者手里,而是由第三方(COVID-Nets 论文)完成——前提是原始数据保留了重组所需的信息(同患者切片可辨识、可归组)。可迁移的判断标准:评测一个影像数据集时,先问三个问题——划分单位是什么?患者可追溯吗?对照类构成合理吗? 三个答案决定它是"第一代"还是"第二代",比张数与分辨率更能预测你的实验结论是否站得住。

8.2 应急数据集的"先发布、后完善"是双刃剑

时间线复盘:2020-04-24 抢在需求峰值发布(占位成功),元数据与患者结构留给社区补齐(扩展版由第三方补成),Kaggle 标注 Monthly 更新但实质冻结(维护退场)。三条经验:

  1. 早期发布的红利真实存在——零门槛+均衡+够大,让它赢了 2020 年上半年的采用率竞赛;
  2. 欠下的结构债不会自动偿还——患者 ID 缺位导致五年后所有主版本工作仍带泄漏阴影,且无法事后修复;
  3. 第三方可以补结构,但补不了出处——扩展版的患者归组可以重做,逐院伦理与采集协议的缺失则永远无法追溯(§2.5)。

8.3 "数据+可解释方法"捆绑发布的得与失

作者把 xDNN 与数据集捆绑发布,形成双引用链(数据链 535/697,方法链 426-427)。所得:两条链互相导流,数据集获得方法论叙事(“不只是图,还有可信的用法”),方法获得应用场景。所失:闭源 MATLAB(xDNN.p 无源码、无许可)削弱了可解释主张本身——一个宣称 explainable-by-design 的方法,使用者无法审计其实现,可解释性退化为论文里的图示。教训:捆绑发布要配套开源许可,否则方法端的信用无法传导到数据端。

§9 与库内条目的关系

9.1 家族图谱:八条互链点

本条目在库内的互链网络(rid 为库内记录 ID):

rid 条目 关系 建议互链方向
307 covid-ct 撞名异实(UCSD 配图提取版 vs 本条目医院切片版) 双向辨析,检索排雷
217 covid-19-radiography 同期 COVID 影像,X 光为主、规模万级 模态对照
197 covidx-cxr X 光基准,多源汇集 模态对照
207 bimcv-covid 第二代 COVID-CT:DICOM 完整+分割标注 代际升级对照
297 mosmeddata 第二代:CT 体积+五级质量评分 代际升级对照
227 midrc-ricord 挑战赛金标准:病灶级患者级标注 代际升级对照
546 ct-rate 大规模胸部 CT+报告文本对 后续形态对照
475 lung-pet-ct-dx PET-CT 肺部诊断 模态扩展对照

9.2 检索路径建议

按检索意图选路径:

  • 查"COVID-CT 数据集":先到 covid-ct(307)与本条目(sar-covid)核对 DOI/slug 排除撞名(坑 1),再按数据来源(配图提取 vs 医院切片)选对象;
  • 做 COVID 分类综述:本条目 §4.1 时间线 + §2.6 规格对照表可直接引用,X 光侧补 covid-19-radiography(217)与 covidx-cxr(197);
  • 找患者级/病灶级金标准:本条目仅扩展版可用(且授权链要引用 Alshazly 2021),更稳妥走 bimcv-covid(207)、midrc-ricord(227)、mosmeddata(297);
  • 做影像-文本/多模态:本条目无文本标注,直接转 ct-rate(546);
  • 讲数据集演化史:本条目 §8.1 代际叙事 + 上表三代对照,是现成的案例骨架。

§10 避坑清单:八个已踩过的坑

坑 1:COVID-CT 撞名,两条数据两拨人。库内 covid-ct(rid 307)是 UCSD AI4H 的 COVID-CT-Dataset(arXiv:2003.13865,论文配图提取 349+397/463 张);本条目是 Exeter 的医院切片 2482 张(medRxiv 2020.04.24.20078584)。裸搜 “COVID-CT dataset” 两者都会命中,引用时锚定 DOI 或 Kaggle slug。

坑 2:2482 与 4173 是两个形态。2482(2 类)是作者 Kaggle 在售主版本;4173(3 类、210 例患者)是 Alshazly et al. 2021 重组的扩展版,从未在作者渠道发布。用扩展版必须同时引两篇文献;把 4173 写成"作者发布"是常见事实错误。

坑 3:预印本标题与作者数双口径。Europe PMC 早期记录(PPR156325,firstIndexDate 2020-05-05)标题为 “EXPLAINABLE-BY-DESIGN…”、作者 2 人(Angelov/Soares);medRxiv 当前页面标题为 “SARS-CoV-2 CT-scan dataset: A large dataset…”、作者 5 人。同一记录经历改名与作者扩列。本条目按现行标题引用,其余 3 名作者因页面反爬未能核全姓名(遗留疑点),不列名单。

坑 4:文件数 ±1 与 “COVID-CT dataset” 自称。Kaggle Summary 栏 2481 vs Files 明细求和 2482,以明细为准。另注意作者 GitHub README 把本数据集混称为 “COVID-CT dataset”——撞名混乱的半数来源是作者自己的命名(与坑 1 联动)。

坑 5:引用数两条 Scholar 记录。约 535 与约 697 并存(同预印本不同索引版本未合并)。写引用量用"两条记录合计千余次"表述,别单引一条。

坑 6:图像尺寸三个口径三个区间。PMC 文献 324×412-484×456;MDPI 文献 104×119-416×512;Awesome 脚本 min[182,129]/median[390,240]/max[484,416]。互不一致,只下"尺寸离散、必须重采样"的定性结论;引具体区间必须带出处。

坑 7:许可三层,别一揽子引用。数据 CC BY-NC-SA 4.0(NC 禁商业、SA 传染,衍生数据集不得换宽许可);GitHub 代码无 LICENSE 文件(默认版权保留,不可复用,xDNN.p 还是无源码的闭源编译件);扩展版 4173 的重组授权链条未明示。三件资产三套规则,衍生工作前逐项确认。

坑 8:97.31% 不能当患者级成绩用。xDNN 的 F1 97.31% 是切片级随机划分口径(主版本无患者 ID,同患者切片横跨训练/测试集,泄漏红利垫高分数);93.87% 是扩展版三分类患者级 60/40 口径。两者类别数、划分单位、方法来源三个维度都不同,同表混排即方法论事故。

§11 总结

11.1 三句话总结

  1. SARS-CoV-2 CT scan collection 是 2020 年 4 月发布的 2482 张医院真实患者 CT 切片二分类集(1252/1230),以零门槛、均衡、可解释方法捆绑三项特征成为当年采用率最高的 COVID-CT 数据集之一。
  2. 它的方法学遗产是双面的:xDNN 的 F1 97.31% 代表切片级口径的乐观上限,第三方患者级扩展版(4173 张、210 例、93.87%)才补上了诚实评测的地板——两者的差距本身就是患者泄漏风险的量化教材。
  3. 它的检索遗产是"COVID-CT 撞名"这个持续五年的公共混乱源——在本库中以 slug sar-covid 独立成条,与 covid-ct(rid 307)双向辨析。

11.2 适合谁

  • 快速搭 baseline / 教学演示:注册即下、目录即标签、五分钟跑通;
  • COVID 影像综述与数据集演化研究:双口径存照、撞名案例、代际叙事都是现成素材;
  • 可解释机器学习方法研究:xDNN 的原型分解思路 + "捆绑发布的信用传导"教训(§8.3);
  • 需要"第一代 vs 第二代"对照实验设计的团队:§4.3、§9.1 的三代谱系可直接用作实验框架。

11.3 不适合谁

  • 需要患者级严格评估且只能用主版本的项目——无患者 ID 是硬伤,换扩展版或换数据集;
  • 需要分割、定位、病灶量化监督的团队——无像素级标注,直接走 bimcv-covid(207)/midrc-ricord(227);
  • 需要体积序列、层厚、纵向随访的应用——切片级哑图结构无法支持;
  • 商业产品直接集成——CC BY-NC-SA 的 NC 条款挡在前面,先谈授权。

11.4 30 秒决策卡

你的情况 行动
要立刻下数据跑通 Kaggle plameneduardo/sarscov2-ctscan-dataset(CC BY-NC-SA 4.0),先读 §2.2 命名坑
要出论文分数 定口径(§3.1)→ 同口径对照(§5.3)→ 论文明示划分协议;用扩展版必引 Alshazly 2021
在主版本上拿了 95%+ 先读 §3.3 与坑 8——你的分数含泄漏红利,报告时必须限定口径
写 COVID 数据集综述 §4 景观 + §2.6 对照表 + 附录 L 双口径登记表可直接引用
需要金标准患者级数据 转库内 midrc-ricord(227)/bimcv-covid(207)/mosmeddata(297)
要引用本数据集 附录 M BibTeX;标题按 medRxiv 现行版,年份 2020

11.5 一图流总结(文本版)

SARS-CoV-2 CT scan collection(sar-covid)
│
├─ 数据本体
│   ├─ 主版本 2482 张 = COVID 1252 + non-COVID 1230(Kaggle V2, 242.23 MB)
│   └─ 扩展版 4173 张 / 210 例 = 2168 + 758 + 1247(第三方重组, Alshazly 2021)
│
├─ 方法捆绑
│   ├─ xDNN(MATLAB, 闭源 .p, 无 LICENSE)
│   └─ F1 97.31%(切片级口径 ⚠ 泄漏红利)
│
├─ 第三方基准
│   └─ COVID-Nets 93.87%(扩展版, 60/40 subject-wise)
│
├─ 许可
│   ├─ 数据:CC BY-NC-SA 4.0(NC 禁商业, SA 传染)
│   └─ 代码:无许可(版权保留)
│
└─ 三大遗产
    ├─ 教材级泄漏案例(切片级 vs 患者级的差距)
    ├─ 教材级撞名案例(vs UCSD COVID-CT, 库内 rid 307)
    └─ 教材级双口径案例(6 条存照见附录 L)

8.4 第四条经验:均衡不是护身符

§2.8 已从任务定义角度拆了"均衡"的误导性,这里把它升格为一条通用经验:类别均衡只解决"训练动力学"问题,不解决"任务定义"问题。本数据集的 1252/1230 让无数 baseline 顺利跑通,但"阴性=其余一切"的定义让其中多数 baseline 回答的不是临床想问的问题。可迁移的判断:拿到任何均衡数据集,先问"均衡是自然形成的还是构建时刻意凑的?删掉的样本去了哪里?两类的内部构成是什么?"——三个答案决定均衡是福利还是烟雾弹。扩展版拆出 Others 类(§2.4)证明:修正任务定义的钥匙,往往在"被合并的少数类"手里。

8.5 反向输出:给数据集作者的检查单

把本数据集的全部教训反转成"发布前检查单",供本库与社区的数据集作者使用(每一条都对应本条目的一处存照或坑点):

  1. 患者结构:患者 ID 能发布则发布;不能发布则发布患者分组哈希——总之一句话,让使用者能做 subject-wise 划分(对应 §3.3 泄漏)。
  2. 来源披露:医院/机构数量与逐院样本量至少给分布,不给名单(对应 §2.7 未披露清单)。
  3. 阴性构成:对照类的内部构成是任务定义的一部分,黑箱对照等于没定义任务(对应 §2.8)。
  4. 命名独占:发布前检索目标名称,确认不与既有数据集撞名;GitHub README 里的自称要与正式名一致(对应坑 1、坑 4)。
  5. 许可三件套:数据、代码、论文分开声明;代码仓库必须挂 LICENSE 文件(对应坑 7)。
  6. 元数据底线:采集时间窗、设备分布、尺寸分布三项最基础的元数据应随包发布(对应 §2.5、坑 6)。
  7. 版本纪律:版本号变更要与内容变更一一对应;"Monthly 更新"这类平台字段不要当营销文案填(对应 §6.2)。
  8. 单点事实自洽:页面 Summary 与文件明细、论文摘要与正文表格的数字必须一致——±1 也是漂移(对应坑 4)。

这份检查单与库内 panda-plus 条目附录的标注流水线 SOP 互补:那边管"怎么标",这边管"怎么发"。

9.3 与 covid-ct(rid 307)的镜像辨析声明

两个条目互为镜像辨析,此处给本条目侧的完整版本:

  • 不是:上下游关系(谁衍生自谁——无);同一数据的两个版本(来源不同);互为别名(slug 与 DOI 均独立)。
  • 是:同期(2020 年 3-4 月,相差约五周)、同类(COVID 胸部 CT 切片二分类)、同运(都成了 2020-2021 年的高采用基准)、同题(都活在"COVID-CT"这个被三义共用的短语阴影下)。
  • 差异核心:来源路线——UCSD 从已发表论文配图提取(349 起家、多批扩容、无患者信息),Exeter 从医院整理原始切片(2482 一批发布、扩展版患者级)。路线差异直接决定下游能力:跨库泛化实验、真实分布代表性、患者级评估,本数据集侧均占优;发布速度、免伦理包袱的再分发便利性,UCSD 侧占优。
  • 引用锚点:本条目 medRxiv DOI 10.1101/2020.04.24.20078584;covid-ct 条目 arXiv:2003.13865。任何语境下两者都不得互为对方的引用。

8.6 案例教学:三个"如果当初"

用反事实推演把本数据集的教训做成三个教学案例(每个案例先给"如果当初",再对照实际发生的后果):

案例一:如果当初发布患者分组哈希。成本:发布前对每张切片标注患者编号并做不可逆哈希,一天工作量。后果对照:主版本将天然支持 subject-wise 划分,97.31% 之后的十年争论(泄漏、口径、分数带)根本不会存在;COVID-Nets 式的第三方重组也不必发生。教训权重:这是本数据集唯一一个"低成本、高回报、且当时就做得到"的改动——其余欠账多少有些时代因素,这一条没有。

案例二:如果当初给 GitHub 仓库挂一个 LICENSE。成本:选一个许可(MIT/Apache-2.0 均可),一行文件。后果对照:xDNN 的可解释主张可以传导给社区(§8.3),后续方法学论文可以合法复用实现做对照实验,作者团队也会收获方法链之外的工程引用。实际后果:无许可=不可复用,闭源 .p 文件雪上加霜,可解释方法的社区审计为零。教训:可解释性宣称与闭源实现是自相矛盾的组合。

案例三:如果当初检索一遍 “COVID-CT”。成本:发布前十分钟的关键词检索。后果对照:会发现 UCSD 数据集一个月前已用近似名称发布,作者可以主动选择差异化命名(如 “Exeter-CT” 或以团队命名),本库的坑 1、坑 4、§9.3 整节都不会存在。实际后果:五年检索混乱,两个数据集的引用与叙事互相渗透,本库不得不在两个条目里各写一节辨析。教训:命名是公共品,撞名的代价由全社区支付。

三个案例的共同点:预防成本都以小时计,后果成本以年计——这正是"应急数据集工程"最值得写进方法论教材的一页。

9.4 检索关键词地图

围绕本数据集的检索意图与关键词组合(含应避开的雷区词):

意图 推荐关键词组合 雷区
找本数据集本体 “SARS-CoV-2 CT-scan dataset” + medRxiv;sarscov2-ctscan-dataset 裸搜 “COVID-CT dataset”(坑 1)
找 UCSD 那条 “COVID-CT-Dataset” + arXiv 2003.13865;covid-ct(库内) 同上
找扩展版 “COVID-Nets” + PeerJ + 4173;subject-wise COVID CT 搜 “作者发布 4173”(作者未发布,坑 2)
找 xDNN 方法 “explainable deep neural networks” + Angelov;Neural Networks xDNN 拿 97.31% 当患者级成绩(坑 8)
找患者级金标准替代 MIDRC-RICORD;BIMCV-COVID+;MosMedData+ —
找方法学批评 slice-level dataset leakage;patient-wise split COVID —

雷区词的共同点是语义正确但实体歧义:词本身没错,错在搜索引擎无法替你区分同名实体。解法统一:关键词后永远缀一个唯一锚点(DOI、arXiv 号、slug)。

9.5 本条目在库内的叙事接口

给本库后续条目(尤其 COVID 谱系新增条目)预留的叙事接口——后续写手可直接引用本条目的这些锚点:

  • 撞名辨析:引用 §9.3 与坑 1,可跳过重复考证直接落笔;
  • 代际叙事:引用 §4.3 三级跳与 §9.1 三代对照表,作为"我这条数据集处于第几代"的参照系;
  • 泄漏教学:引用 §3.3 与坑 8,作为切片级数据集风险的标准表述;
  • 许可范例:引用 §6.3 的 NC/SA 细读,作为"传染性许可"的讲解样例;
  • 双口径方法论:引用附录 L 登记表,作为双口径存照格式的范例之一。

接口的存在前提是本条目事实层的稳定性:六个存照若有任何一条被后续证据推翻,请同步检查上述五个接口的下游引用(附录 Q 维护计划的扩展条款)。

FAQ(高频问答 28 问)

A. 基础认知

Q1:这个数据集的官方名字到底是什么?
预印本现行标题为 “SARS-CoV-2 CT-scan dataset: A large dataset of real patients CT scans for SARS-CoV-2 (COVID-19) identification”;Kaggle slug 是 sarscov2-ctscan-dataset;早期索引曾用 “EXPLAINABLE-BY-DESIGN…” 标题(坑 3)。本库 slug 为 sar-covid。四个名字指同一对象。

Q2:谁发布的?
英国埃克塞特大学(University of Exeter)的 Plamen Angelov(通讯)与 Eduardo Almeida Soares。medRxiv 现行页面列 5 名作者,早期 EPMC 记录仅 2 人(坑 3);本条目只核实并列出这 2 名核心作者。

Q3:什么时候发布的?
预印本 2020-04-24 投稿 medRxiv(DOI 10.1101/2020.04.24.20078584);Europe PMC 收录于 2020-05-05;配套 GitHub 代码最后提交 2020-05-12;方法论文见刊于 Neural Networks 130 卷(2020)。

Q4:它有多大?
主版本 2482 张轴位 CT 切片(阳性 1252 + 阴性 1230),Kaggle V2 共 242.23 MB。扩展版 4173 张、210 例患者、三分类——但扩展版不是作者发布的(坑 2)。

Q5:是 CT 体积(序列)还是单张切片?
单张独立切片。无体积重建、无层厚信息、无患者 ID。想做体积级/纵向研究请转 mosmeddata(297)或 midrc-ricord(227)。

Q6:它是第一个 COVID-CT 公开数据集吗?
不是。UCSD 的 COVID-CT-Dataset(arXiv:2003.13865)2020 年 3 月中旬先发布,但只有数百张且是从论文配图提取的。本数据集是第一个大规模、医院原始、免申请的版本之一。

B. 数据与获取

Q7:怎么下载?
Kaggle 数据集页 plameneduardo/sarscov2-ctscan-dataset,注册后直接下载 V2(242.23 MB)。无需联系作者、无需说明用途。

Q8:下载后目录结构是什么样?
两个目录:COVID(1252 张,文件名 Covid (N).png)与 non-COVID(1230 张,文件名 1.png 至 1230.png)。无清单文件、无 README、无预划分。

Q9:文件名有什么坑?
阳性文件名含空格和括号,shell 脚本的 glob、正则、pandas 路径拼接都要小心;阴性文件名是纯数字且与阳性编号体系无关——1.png 与 Covid (1).png 不是配对关系。附录 E 给了清单重建骨架。

Q10:Kaggle 页面写 2481 个文件,论文说 2482,听谁的?
以 Files 明细逐目录求和的 2482 为准(1252+1230)。Summary 栏的 2481 是页面统计口径差(坑 4)。下载后自己数一遍并存档清单。

Q11:扩展版 4173 张从哪拿?
作者渠道没有。它由 Alshazly et al. 2021(PeerJ CS 7:e655)重组发布,需按该论文的渠道获取或按其描述自行重组;使用时必须同时引用原数据集与重组论文(坑 2)。

Q12:更新频率是?
Kaggle 标注 Monthly 更新,但 V2 之后未见实质变更。把它当"已冻结的历史数据集"管理即可。

C. 任务与标注

Q13:标签是怎么来的?
切片级类别标签。阳性称经放射科医生确认;阴性构成未细分(主版本);未披露标注指南、复核流程与观察者间一致性数据。

Q14:有没有分割掩码?
没有。无像素级标注、无边框。需要分割监督转 bimcv-covid(207)或 midrc-ricord(227)。

Q15:主版本能做患者级划分吗?
不能——无患者 ID,且无法事后恢复。患者级评估必须用扩展版(§2.4)。

Q16:类别平衡吗?
主版本基本均衡(1252 vs 1230,约 1.018:1),无需重采样。扩展版三分类不平衡(2168/758/1247),需要加权损失或重采样。

Q17:预处理建议?
统一尺寸(224×224 或 229×229)、灰度归一化、(若坚持主版本)明示切片级随机划分口径。尺寸区间见坑 6——不要引用未带出处的具体区间。

D. 基准与统计

Q18:最高分是多少?
两个口径两套数字:xDNN 在主版本切片级二分类 F1 97.31%;COVID-Nets 在扩展版患者级三分类 60/40 划分准确率 93.87%。不可互比(坑 8)。

Q19:97.31% 可以写进我的论文当 SOTA 对照吗?
可以引用但必须限定口径:“切片级随机划分”。若你的实验是患者级,把它当对照属于口径错误。

Q20:为什么切片级分数普遍虚高?
同一患者的相邻切片高度相似且无患者 ID,随机划分使同患者切片横跨训练/测试集,模型可以"记住病人"。这是切片级数据集的通病,不是本数据集独有(§3.3)。

Q21:xDNN 代码能直接跑吗?
MATLAB 环境 + 仓库内脚本(xDNN_SARS.m)与预训练 .mat 可以按 README 运行;但 xDNN.p 是闭源编译件且仓库无 LICENSE,不可复用代码进你的项目(坑 7)。

Q22:引用量多少?
Scholar 两条记录约 535 与约 697(同预印本异版未合并),合计千余次;xDNN 方法论文另计约 426-427 次(坑 5)。

E. 库内与引用

Q23:库内 covid-ct 和这个是同一个吗?
不是。covid-ct(rid 307)= UCSD 配图提取版;本条目 = Exeter 医院切片版。作者 GitHub README 的 “COVID-CT dataset” 自称加剧了混乱(坑 1、坑 4)。

Q24:本条目的库内互链有哪些?
covid-ct(307)、covid-19-radiography(217)、covidx-cxr(197)、bimcv-covid(207)、mosmeddata(297)、midrc-ricord(227)、ct-rate(546)、lung-pet-ct-dx(475),共 8 条(§9.1)。

Q25:BibTeX 怎么写?
附录 M 有数据集预印本、方法论文、第三方扩展三份完整 BibTeX,按需取用。

Q26:它和 X 光数据集(covid-19-radiography 等)怎么选?
CT 灵敏度叙事更强但设备门槛高、本数据集规模有限;X 光数据规模大、普及面广。综述与多模态工作建议两组并用(§7.3)。

Q27:这个数据集还有维护吗?出问题找谁?
实质冻结。技术问题可在 Kaggle 讨论区留言;学术问题按预印本通讯作者(Angelov)邮件联系。无官方维护承诺。

Q28:一句话评价这个数据集?
2020 年应急数据工程的典型标本:获取体验满分、方法学地基有裂缝、命名公共品维护失败——三条经验都比数据本身更长寿(§8)。

F. 工程实操

Q29:PyTorch 里怎么读这个数据集?
用 torchvision.datasets.ImageFolder 指向解压根目录即可自动按子目录打标签;但阳性文件名的空格与括号不影响 ImageFolder(它只看目录),影响的是你自己的清单脚本——先跑附录 E 重建清单再做 dataloader,别让 DataLoader 直接扫盘。

Q30:尺寸参差怎么处理最稳?
统一 resize 到 224×224 是最省事的选择;要保留纵横比就用 resize+center-crop。不建议随机裁剪到过小尺寸——短边最小的图只有约 100 像素,激进下采样会把磨玻璃影这类低对比征象直接抹掉。

Q31:怎么做一个"诚实"的切片级实验?
在主版本上做切片级划分时,至少报告:划分比例与随机种子、类分布核对结果、以及 limitations 里明示同患者切片可能跨集(§3.3)。有余力就按文件名排序做顺序分块划分并对比——若两种划分成绩差异巨大,泄漏效应就在你的具体切分里现形了。

Q32:想用预训练骨干,选什么起点?
2020 年文献多用 ImageNet 预训练 ResNet/DenseNet 系;COVID-Nets 的系统对比(§5.2)可直接作为选型参考。2026 年视角下,医用预训练骨干更优,但注意 NC 许可与骨干许可的叠加合规。

Q33:数据要增强吗?
翻转、旋转、亮度扰动常规可用;弹性形变与激进仿射慎用(解剖结构失真对"读片"类任务不友好)。增强只对训练集启用,验证/测试集保持确定性预处理——老生常谈,但在交差压力下最常见的翻车点依旧是它。

Q34:怎么引用 Kaggle 上的具体版本?
正文引 DOI(学术锚点),脚注或数据可用性声明里补 Kaggle slug 与版本号(V2)与下载日期——Kaggle 内容可能变化,下载日期是复现性的关键元数据。

G. 库内流程

Q35:本条目是怎么生产出来的?
按本库纪律包流程:开工三查(锁、临时文件唯一化、环境检查)→ 三轮三源存在性核验(Kaggle/GitHub/Europe PMC)→ 库内 slug 查重(0 命中)→ FACTS 事实底稿 → 成稿 → 双脚本自检。生产档案见附录 Y。

Q36:为什么 slug 是 sar-covid 而不是 covid-ct 或 sarscov2-ctscan?
slug 需要避让库内既有条目(covid-ct 已被 UCSD 条目占用)并在检索中保持唯一;sar-covid 取自 SARS-CoV-2 的通用缩写,短、可读、不撞库。

Q37:库内还有哪些条目和它最像?
最像的是 covid-ct(307)——像到必须整节辨析(§9.3);其次是同期 X 光条目(217/197)与第二代 CT 条目(207/297/227),它们构成景观对照而非相似实体。

Q38:发现条目事实有错怎么办?
走本库条目修订流程:先核对 FACTS.md 存照(错误可能已在双口径登记),再触发附录 Q 的对应维护点;涉及互链接口(§9.5)的修订需同步下游条目。

事实清单(硬事实 44 条)

  1. 数据集全称(现行):SARS-CoV-2 CT-scan dataset: A large dataset of real patients CT scans for SARS-CoV-2 (COVID-19) identification。
  2. 本库 slug:sar-covid;库内查重 0 命中(url_name ILIKE sar-covid / sarscov2 均无)。
  3. 发布者:University of Exeter,Plamen Angelov(通讯)与 Eduardo Almeida Soares。
  4. 预印本投稿日期:2020-04-24,medRxiv,DOI 10.1101/2020.04.24.20078584。
  5. Europe PMC 记录号 PPR156325,firstIndexDate 2020-05-05。
  6. 早期 EPMC 记录标题 “EXPLAINABLE-BY-DESIGN…”、2 作者;medRxiv 现行 5 作者(存照)。
  7. 主版本规模:2482 张轴位 CT 切片。
  8. 类别构成:COVID 阳性 1252 张 + 阴性 1230 张。
  9. 阳性文件名模式:Covid (N).png,N=1…1252。
  10. 阴性文件名模式:1.png 至 1230.png。
  11. Kaggle Summary 文件数 2481,明细求和 2482,差 1(存照)。
  12. Kaggle slug:plameneduardo/sarscov2-ctscan-dataset;当前版本 V2。
  13. V2 体量:242.23 MB,PNG 编码。
  14. Kaggle usability 评分 8.75。
  15. Kaggle Tags:Image / Computer Science / Computer Vision / Coronavirus / Medicine。
  16. 页面统计:Views 约 175K,Downloads 约 28.1K。
  17. 更新频率标注 Monthly,实质冻结。
  18. 数据许可:CC BY-NC-SA 4.0(Kaggle 页面标注)。
  19. GitHub 仓库:Plamen-Eduardo/xDNN-SARS-CoV-2-CT-Scan,最后提交 2020-05-12。
  20. GitHub 仓库内容:MATLAB 代码 xDNN_SARS.m、闭源编译件 xDNN.p、预训练模型 *.mat;不含图像。
  21. GitHub 仓库无 LICENSE 文件;README 自称 “COVID-CT dataset”(存照)。
  22. 方法论文:Angelov & Soares, Neural Networks 130:185-194 (2020),DOI 10.1016/j.neunet.2020.07.010,PMID 32682084。
  23. xDNN 旗舰成绩:主版本 F1 97.31%(切片级二分类,Kaggle 页面与期刊论文双源一致)。
  24. 扩展版规模:4173 张、210 例患者、三分类。
  25. 扩展版构成:COVID-19 80 例 2168 张 + Healthy 50 例 758 张 + Others 80 例 1247 张。
  26. 扩展版划分:60/40 subject-wise。
  27. 扩展版口径来源:Alshazly et al., PeerJ Computer Science 7:e655 (2021),DOI 10.7717/peerjcs.655。
  28. COVID-Nets 最佳准确率:93.87%(扩展版患者级口径)。
  29. 主版本无患者 ID、无切片层位、无设备参数、无医院归属明细。
  30. 阳性标签称经放射科医生确认;无标注指南与一致性数据披露。
  31. 图像尺寸多口径:324×412-484×456(PMC);104×119-416×512(MDPI);min[182,129]/median[390,240]/max[484,416](Awesome 脚本)(存照)。
  32. Scholar 引用两条记录:约 535 与约 697(存照)。
  33. xDNN 方法论文 Scholar 引用约 426-427。
  34. 库内 covid-ct(rid 307)为 UCSD COVID-CT-Dataset(arXiv:2003.13865,349+397/463 张配图提取),与本数据集同名异实。
  35. 库内互链 8 条 rid:297、227、546、475、217、307、197、207。
  36. 本条目页面占位 URL:https://www.qianfanghub.com/ai-ready-dataset/sar-covid/705。
  37. 预印本未披露:医院名单、患者总数、PCR 金标准确认、阴性内部构成、伦理批号(§2.7 未披露清单)。
  38. 主版本任务定义为"COVID vs 其余一切"的切片级二分类;阴性类为黑箱对照(§2.8)。
  39. 扩展版任务定义升级为"COVID vs Healthy vs Others"的患者级三分类,Others 为非 COVID 肺部异常(§2.4)。
  40. 切片级口径分数带集中于 95%-99%(2020-2022 文献观察),患者级口径分数普遍回落数个百分点(§5.4)。
  41. 跨库泛化实验普遍掉分 10-30 个百分点(文献重复观察,§4.4)。
  42. Kaggle 官方 API 下载命令:kaggle datasets download plameneduardo/sarscov2-ctscan-dataset(§6.5)。
  43. 阳性文件名含空格与括号(Covid (N).png),阴性文件名为纯数字,两套编号体系互不对应(§2.2、附录 E)。
  44. GitHub 仓库最后提交 2020-05-12 与预印本 2020-04-24 相距 18 天,构成"论文-数据-代码"三件套的最小时间窗(§6.1)。

术语表(32 条)

  1. 轴位切片(axial slice):CT 体积扫描中垂直于身体长轴的单层图像;本数据集的发布单位。
  2. 磨玻璃影(GGO, ground-glass opacity):CT 上云雾状密度增高影,COVID-19 的典型影像征象之一。
  3. 铺路石征(crazy paving):磨玻璃影叠加小叶间隔增厚的影像模式,COVID-19 进展期常见。
  4. 切片级标签(slice-level label):以单张切片为标注单位;本数据集主版本形态。
  5. 患者级/subject-wise 划分:按患者(而非按切片)划分训练/测试集,杜绝同患者切片跨集泄漏。
  6. 患者级泄漏(patient leakage):同一患者的数据同时进入训练与测试集导致的性能高估。
  7. xDNN(explainable-by-design deep neural network):Angelov 团队提出的可解释深度网络框架,以原型分解决策依据;配套本数据集发布。
  8. 原型分解(prototype decomposition):xDNN 的解释机制——把预测表示为若干原型成分的贡献构成。
  9. F1 分数:精确率与召回率的调和平均;xDNN 成绩 97.31% 的指标。
  10. COVID-Nets:Alshazly 等的预训练骨干微调与集成体系,在本数据集扩展版上给出系统性第三方基准。
  11. Others 类:扩展版中"非 COVID 的其他肺部异常"对照类,把任务从"有无异常"升级为"是否 COVID"。
  12. CC BY-NC-SA 4.0:署名-非商业-相同方式共享许可;SA 条款对衍生数据集有传染性。
  13. medRxiv:健康科学预印本平台;本数据集论文的发布与存档处。
  14. Europe PMC:欧洲生物信息学研究所维护的文献库;本条目核验预印本元数据的权威源之一。
  15. DOI(Digital Object Identifier):数字对象唯一标识符;本条目引用以 DOI 为锚点。
  16. Kaggle usability 评分:Kaggle 对数据集文档、标签、可读性的综合评分(本数据集 8.75/10)。
  17. 双重计算记录:同一论文在 Google Scholar 因版本未合并产生的多条计引记录(本数据集 535/697)。
  18. 撞名(name collision):不同团队的数据集使用相同/相近名称导致检索与引用混乱;本数据集与 UCSD COVID-CT-Dataset 的关系。
  19. 配图提取路线:从已发表论文截取图像组建数据集的做法(UCSD 版路线),对比本数据集的医院原始路线。
  20. DICOM:医学数字成像与通信标准;本数据集未采用(PNG 发布),采集参数不可恢复。
  21. PNG:无损位图格式;本数据集的图像编码。
  22. 数据冻结(data freeze):数据集停止实质更新进入静态维护状态;V2 后的 Kaggle 仓库状态。
  23. 类别均衡(class balance):各类样本量接近;主版本 1252/1230 近乎均衡,扩展版不均衡。
  24. 基准口径(benchmark protocol):类别数、划分单位、划分比例、指标构成的完整实验设定;比较分数前必须核对口径。
  25. 租赁锁(lease lock):本库生产流程中防止多写手并发编辑同一条目的锁文件机制。
  26. FAIR 原则:可发现、可访问、可互操作、可复用的数据管理原则;附录 O 按此逐项评估本数据集。
  27. ImageFolder:torchvision 按目录结构自动打标签的数据加载机制;本数据集最省事的 PyTorch 入口(FAQ Q29)。
  28. resize+center-crop:保留纵横比的标准化预处理组合,适合本数据集的尺寸离散特性(FAQ Q30)。
  29. 宏平均 F1(macro-F1):各类 F1 的算术平均,不受类别规模支配;三分类不平衡场景(2168/758/1247)的首选指标(§5.5)。
  30. 混淆矩阵:逐类互混计数表;患者级三分类论文的必备产出(§5.2)。
  31. 来源指纹(source fingerprint):模型学到的"样本来自哪个数据集/设备"的捷径特征,跨库联合训练的干扰源(§4.4)。
  32. 数据可用性声明(data availability statement):论文中说明数据获取渠道、版本与日期的标准段落;引用 Kaggle 数据的下载日期写在这里(FAQ Q34)。

附录

附录 A:条目信息速查卡

项 值
slug / rid sar-covid(本库新立条目)
名称 SARS-CoV-2 CT scan collection
团队 University of Exeter(Angelov & Soares)
论文 medRxiv DOI 10.1101/2020.04.24.20078584(2020-04-24);Neural Networks 130:185-194(2020)
规模 主版本 2482 张(1252/1230);扩展版 4173 张 / 210 例(Alshazly 2021 重组)
任务 图像级二分类;扩展版患者级三分类
成绩 xDNN F1 97.31%(切片级);COVID-Nets 93.87%(患者级三分类)
许可 CC BY-NC-SA 4.0(数据);代码无许可
获取 Kaggle plameneduardo/sarscov2-ctscan-dataset(V2,242.23 MB)
互链 rid 297/227/546/475/217/307/197/207
条目 URL https://www.qianfanghub.com/ai-ready-dataset/sar-covid/705

附录 B:DAIMS 评估全表

DAIMS 五维(Data availability, Annotation quality, Integrity, Methodology usability, Sustainability)逐项评估:

维度 得分(1-5) 评语
D — 数据可获取性 5 Kaggle 注册即下,免申请免等待;GitHub+论文双备份渠道
A — 标注质量 2 切片级标签仅经放射科医生确认,无流程披露、无一致性数据、无像素级监督;阴性构成黑箱
I — 完整性 3 主版本数字自洽(±1 存照),但无患者 ID、无元数据、无逐院信息,完整性天花板低
M — 方法学可用性 3 上手极快(目录即标签);划分协议自行负责,泄漏风险管理完全依赖使用者素养
S — 可持续性 2 实质冻结;无维护承诺;代码无许可不可复用;扩展版授权链未明示

总分:15/25——"获取满分、结构欠费"的典型剖面:作为应急期公共品合格,作为长期科研基础设施需要向第二代(207/227/297)迁移。

附录 C:逐项证据链自证

条目事实 证据源 核验方式
2482 = 1252+1230 Kaggle Files 明细 实抓页面逐目录计数
V2 242.23MB / 8.75 / Tags Kaggle 页面 实抓
Views 175K / Downloads 28.1K Kaggle 页面 实抓
CC BY-NC-SA 4.0 Kaggle License 栏 实抓
GitHub 结构与提交时间 GitHub 仓库 实抓(最后提交 2020-05-12)
medRxiv DOI 与投稿日 Europe PMC REST API(resultType=core) 实抓(PPR156325)
xDNN 期刊版 DOI/PMID Europe PMC + PubMed 实抓(10.1016/j.neunet.2020.07.010 / PMID 32682084)
F1 97.31% Kaggle 页面描述 + 期刊论文 双源一致
扩展版 4173/210 例/60-40 Alshazly et al. 2021(PeerJ CS 10.7717/peerjcs.655) 实抓
93.87% 同上 实抓
撞名辨析 库内 covid-ct 条目 FACTS(rid 307)+ arXiv:2003.13865 交叉比对
slug 查重 0 命中 qf_psql.sh 查询 ai_ready_dataset 执行记录

附录 D:数据获取决策树

需要 COVID 胸部影像数据
├─ 只要快速跑通二分类 baseline
│   └─ 本数据集主版本(Kaggle 直下)→ §2.2 命名坑 + §3.3 泄漏警告
├─ 需要患者级严格评估
│   ├─ 接受三分类 → 扩展版 4173(引 Alshazly 2021)或
│   └─ 需要金标准/病灶级 → midrc-ricord(227) / bimcv-covid(207)
├─ 需要 X 光(设备门槛低)
│   └─ covid-19-radiography(217) / covidx-cxr(197)
├─ 需要 CT 体积+分级 → mosmeddata(297)
├─ 需要影像-文本对 → ct-rate(546)
└─ 需要 PET-CT → lung-pet-ct-dx(475)

附录 E:文件清单重建骨架(Python)

import re
from pathlib import Path

ROOT = Path("sarscov2-ctscan-dataset")  # 解压后根目录
records = []
for png in ROOT.rglob("*.png"):
    rel = png.relative_to(ROOT)
    label = "covid" if rel.parts[0].lower() == "covid" else "non_covid"
    m = re.search(r"Covid \((\d+)\)\.png$", png.name)
    idx = int(m.group(1)) if m else (int(png.stem) if png.stem.isdigit() else -1)
    records.append({"path": str(rel), "label": label, "idx": idx})

n_pos = sum(r["label"] == "covid" for r in records)
n_neg = sum(r["label"] == "non_covid" for r in records)
print(f"positive={n_pos} (expect 1252), negative={n_neg} (expect 1230)")
# 注意:阳性文件名含空格与括号;idx<0 的异常文件单独存照,勿静默丢弃

附录 F:与库内条目关系声明(rid 表)

本条目与库内 8 条互链条目的关系声明见 §9.1 表格;其中 covid-ct(rid 307)为撞名异实关系(非上下游、非衍生),其余 7 条为景观对照关系。两个条目的 FACTS 与成稿均已互相写入辨析段落,互链双向成立。

附录 G:COVID 影像数据集景观总表

数据集 年份 模态 规模 标注 患者级 许可要点
本条目(主版本) 2020-04 CT 切片 2482 二分类切片级 无 CC BY-NC-SA 4.0
本条目(扩展版) 2021 重组 CT 切片 4173/210 例 三分类患者级 有 授权链未明示
UCSD COVID-CT(307) 2020-03 CT 切片 349+397/463 二分类切片级 无 开放(配图提取)
COVID-19 Radiography(217) 2020 起 X 光 万级 多类图像级 无 开放
COVINDEX(197) 2021 X 光 数千研究 多任务 部分 开放
BIMCV-COVID+(207) 2020-21 CT+X 光 数千研究 研究级+病灶级 有 开放(DICOM)
MosMedData+(297) 2021 CT 体积 1110 例 五级质量评分 有 申请制
MIDRC-RICORD(227) 2021 CT 体积 约 1000 例 病灶级金标准 有 开放(挑战赛)

附录 H:许可条款细读

  1. 数据本体(CC BY-NC-SA 4.0):署名义务以引用 DOI+数据集名为最低满足;NC 条款边界判读参考 Creative Commons 官方 FAQ;SA 条款要求衍生数据集沿用同许可——不得改发 CC BY-4.0 或公有领域。
  2. 代码(无许可):GitHub 默认版权保留,禁止复用、修改、再分发;xDNN.p 为闭源编译件,连"读"都仅限反编译灰色地带——引用思路可以,搬代码不行。
  3. 扩展版(4173):授权链未明示。稳妥路径:自行重组(从主版本+扩展论文描述)并在论文中完整披露重组流程,许可随主版本走 CC BY-NC-SA 4.0。
  4. 论文:medRxiv 预印本按平台条款自由阅读下载;Neural Networks 论文为 Elsevier 订阅内容。

附录 I:xDNN 评估口径核对单

引用或复现 xDNN 97.31% 前逐项核对:

  • [ ] 口径为切片级随机划分(主版本 2482,2 类)
  • [ ] 论文中明示"切片级口径、含同患者切片跨集风险"
  • [ ] 未与患者级成绩(93.87% 等)同表混排
  • [ ] MATLAB 复现仅按 README 运行原仓库,未复用代码进自家代码库
  • [ ] 引用同时给出 medRxiv DOI 与 Neural Networks DOI

附录 J:扩展版数据字典(按 Alshazly 2021 口径)

字段 类型 说明
image PNG CT 轴位切片
patient_id 整数/字符串 患者分组标识(重组版新增)
label 0=COVID-19, 1=Healthy, 2=Others
split 60/40 subject-wise 划分(建议复现时自行按患者重划并披露随机种子)
计数 — COVID-19 2168 / Healthy 758 / Others 1247;患者 80/50/80

附录 K:坑点档案(与 §10 对照)

坑 一句话 首次发现场景
坑 1 COVID-CT 撞名,两拨人两条数据 slug 查重+库内 covid-ct FACTS 比对
坑 2 2482 主版本 vs 4173 扩展版 COVID-Nets 论文与 Kaggle 数字冲突排查
坑 3 预印本标题/作者双口径 Europe PMC 与 medRxiv 页面比对
坑 4 文件数 ±1 与 GitHub 自称 “COVID-CT dataset” Kaggle Summary vs Files 明细
坑 5 Scholar 引用 535/697 双记录 引用生态调查
坑 6 图像尺寸三口径三区间 三种文献实测区间交叉
坑 7 许可三层异构 Kaggle License 栏+GitHub 无 LICENSE
坑 8 97.31% 切片级口径误用 基准口径差异分析

附录 L:双口径登记表

编号 口径 A 口径 B 处置
1 EPMC 早期:标题 “EXPLAINABLE-BY-DESIGN…”、2 作者 medRxiv 现行:大标题、5 作者 择现行;存照
2 主版本 2482(2 类) 扩展版 4173(3 类) 双形态并行;明示出处
3 Kaggle Summary 2481 Files 明细 2482 择明细;存照
4 GitHub README 自称 “COVID-CT dataset” 正式名 SARS-CoV-2 CT-scan dataset 择正式名;辨析段
5 Scholar 记录约 535 Scholar 记录约 697 合计表述;存照
6 尺寸 324×412-484×456(PMC) 104×119-416×512(MDPI);Awesome 三值 定性结论;区间全存照

附录 M:引文规范(BibTeX)

@article{sarscov2ct2020,
  author  = {Angelov, Plamen and Soares, Eduardo Almeida},
  title   = {SARS-CoV-2 {CT}-scan dataset: A large dataset of real patients {CT} scans
             for {SARS-CoV-2} ({COVID-19}) identification},
  journal = {medRxiv},
  year    = {2020},
  doi     = {10.1101/2020.04.24.20078584}
}

@article{angelov2020xdnn,
  author  = {Angelov, Plamen and Soares, Eduardo Almeida},
  title   = {Towards explainable deep neural networks ({xDNN})},
  journal = {Neural Networks},
  volume  = {130},
  pages   = {185--194},
  year    = {2020},
  doi     = {10.1016/j.neunet.2020.07.010}
}

@article{alshazly2021covidxct,
  author  = {Alshazly, Hanan and Linse, Christoph and Barth, Erhardt and Martinetz, Thomas},
  title   = {{COVID-Nets}: a survey of {CNN} architectures for {CT}-based {COVID-19} diagnosis},
  journal = {PeerJ Computer Science},
  volume  = {7},
  pages   = {e655},
  year    = {2021},
  doi     = {10.7717/peerjcs.655}
}

使用规则:用主版本引第一条;涉及 xDNN 方法或 97.31% 加引第二条;用扩展版 4173 或 93.87% 必须加引第三条。第二条标题以期刊页为最终核对对象(本条目生产时点核对为 Neural Networks 130:185-194)。

附录 N:检索决策树

你拿着 "COVID-CT" 这个词检索
├─ 想要 Exeter 医院切片 2482 张 → 本条目 sar-covid(medRxiv DOI 10.1101/2020.04.24.20078584)
├─ 想要 UCSD 配图提取版 → 库内 covid-ct(rid 307,arXiv:2003.13865)
└─ 只是泛泛搜 COVID CT 研究
    ├─ 要患者级金标准 → midrc-ricord(227) / bimcv-covid(207)
    ├─ 要 X 光 → covid-19-radiography(217) / covidx-cxr(197)
    └─ 要影像-文本 → ct-rate(546)

附录 O:FAIR/AI-Ready 检查单

项 判定 说明
F 可发现 部分 有 DOI 与 Kaggle slug;但 “COVID-CT” 检索词被撞名污染
A 可访问 优 注册即下,免申请;协议标准 HTTPS
I 可互操作 中 PNG 通用;但无 DICOM/无标准元数据 schema
R 可复用 中 许可明确(NC/SA 约束);无患者 ID 限制复用场景
AI-Ready 工程面 中上 目录即标签、体积小、均衡;尺寸离散与无划分需自行处理

附录 P:缩写速查

缩写 全称
GGO Ground-Glass Opacity,磨玻璃影
xDNN explainable-by-design Deep Neural Network
DICOM Digital Imaging and Communications in Medicine
PMC PubMed Central
DOI Digital Object Identifier
NC/SA NonCommercial / ShareAlike(CC 许可条款)
subject-wise 按患者划分的实验协议
SOTA State of the Art
rid 本库记录 ID(record id)

附录 Q:维护计划与触发点

  • 触发点 1:Kaggle 若出现 V3 或文件数变更——更新 §2.1、§6.2 与坑 4,重跑文件清单核对。
  • 触发点 2:medRxiv 记录若正式见刊或作者列表再变更——更新 §2、坑 3 与附录 M。
  • 触发点 3:Scholar 双记录若合并——更新坑 5 与 §7.1 的引用量表述。
  • 触发点 4:扩展版若获作者官方渠道发布或授权声明——更新 §2.4、坑 2 与附录 H。
  • 常规:年度复核 Kaggle 页面统计(Views/Downloads)与链接可达性。

附录 R:主版本与扩展版逐项对照总表

维度 主版本(作者发布) 扩展版(第三方重组)
发布时间/渠道 2020-04,Kaggle+预印本 2021,Alshazly et al. 论文
任务 图像级二分类 患者级三分类(COVID/Healthy/Others)
规模 2482 张 4173 张 / 210 例
类别构成 1252/1230 均衡 2168/758/1247 不平衡
患者信息 无 有(患者 ID + 60/40 subject-wise)
许可 CC BY-NC-SA 4.0 授权链未明示(随主版本从宽解读为 CC BY-NC-SA 4.0)
获取 Kaggle 直下 论文渠道或自行重组
引用义务 medRxiv DOI medRxiv DOI + PeerJ CS DOI 双引
适用 快速 baseline、教学 严格评测、方法学论文
对应坑点 坑 4、坑 8 坑 2、坑 7

附录 S:推荐训练配置与超参起点

按"复现 2020 年文献 baseline + 2026 年工程习惯"的混合立场给出起点配置(非官方口径,仅为可运行的合理默认):

# 输入管线(PyTorch 风格伪代码骨架)
TRAIN_TF = [Resize(256), CenterCrop(224), RandomHorizontalFlip(),
            ToTensor(), Normalize(imagenet_mean_std)]
EVAL_TF  = [Resize(256), CenterCrop(224), ToTensor(),
            Normalize(imagenet_mean_std)]

# 训练配置
backbone     = "resnet50(imagenet)"   # 或按 COVID-Nets 选型表取 DenseNet121
head         = Linear(2048, 2)        # 主版本二分类;扩展版改 3
loss         = CrossEntropyLoss()     # 扩展版加 class weights {1.0, 2.9, 1.7}
optimizer    = AdamW(lr=3e-4, weight_decay=1e-4)
scheduler    = cosine, warmup 1 epoch
epochs       = 10(切片级);20(扩展版患者级,数据量小收敛慢)
batch_size   = 64(切片级);32(扩展版)
seed         = 固定并记录(划分种子与初始化种子分开管理)

三条纪律:划分种子与训练种子分开记录;验证集只从训练划分内部再切(扩展版不得把 test 划分当验证用);所有数字报告时附口径五步协议(§5.5)的核对结论。

附录 T:常见报错与排查

症状 根因 处置
清单数出 2481/2483 与 Summary 口径差 / 解压不完整 以附录 E 重建清单为准;缺文件重下
文件名解析失败 阳性名含空格与括号 用附录 E 的正则 Covid \((\d+)\)\.png$
训练 loss 不降 学习率过大或未归一化 检查 Normalize 是否套用;lr 降一个量级
验证成绩异常高(>99%) 划分泄漏或标签泄漏进特征 核对划分单位;检查文件路径是否含标签信息进模型
跨库测试分数骤降 来源差异(§4.4) 正常现象;报告时写明跨库设定
ImageFolder 类名混乱 根目录混入非数据文件 清空无关文件,仅留两个类别目录
Kaggle API 下载 403 未接受数据集条款 网页端先接受一次再走 API

附录 U:数据集卡片(Dataset Card)草样

按社区数据集卡片惯例给本数据集的浓缩卡(可直接搬进你的 repo):

  • 名称:SARS-CoV-2 CT scan collection(本库 slug:sar-covid)
  • 发布方:University of Exeter(Plamen Angelov、Eduardo Almeida Soares)
  • 发布时间:2020-04-24(medRxiv DOI 10.1101/2020.04.24.20078584)
  • 内容:2482 张胸部 CT 轴位切片 PNG(COVID 1252 / non-COVID 1230)
  • 任务:切片级二分类;扩展版患者级三分类(4173 张/210 例,第三方重组)
  • 标注:目录即标签;阳性经放射科医生确认;无像素级标注、无患者 ID(主版本)
  • 划分:无官方划分;扩展版 60/40 subject-wise(Alshazly 2021 口径)
  • 许可:CC BY-NC-SA 4.0;配套代码无许可
  • 已知局限:患者泄漏风险、元数据缺位、尺寸离散、阴性构成黑箱
  • 引用:附录 M 三份 BibTeX 按用途取用
  • 维护状态:实质冻结(V2 后无实质变更)

附录 V:伦理与合规自查单

基于本数据集开展研究或二次分发前的合规自查:

  1. 用途是否落在非商业范围(NC 条款)?商业用途是否已启动授权沟通?
  2. 衍生数据集是否沿用 CC BY-NC-SA 4.0(SA 传染)?
  3. 引用是否含 DOI 锚点与下载日期?
  4. 论文 limitations 是否披露:患者泄漏风险、标签确认流程未详、阴性构成未细分?
  5. 涉及扩展版时是否双引(原数据集 + Alshazly 2021)?
  6. 是否复用了无许可的 GitHub 代码(应仅参考思路)?
  7. 结果表述是否避免了"可用于临床诊断"类超出口径的宣称?
  8. 患者隐私:数据集本身已匿名化为切片图像,但二次发布衍生可视化结果时是否复查了可识别性( rare 标记物、文字水印、设备 UI 残留)?

附录 W:关键文献与锚点清单

本条目事实层引用的全部一手锚点(只列已核验项,不注未核验的次级文献):

锚点 类型 用途
DOI 10.1101/2020.04.24.20078584(medRxiv) 数据集预印本 主引用锚点
Europe PMC 记录 PPR156325 预印本元数据 时间线与标题双口径核验
DOI 10.1016/j.neunet.2020.07.010(Neural Networks 130:185-194) 方法论文 xDNN 与 F1 97.31% 出处
DOI 10.7717/peerjcs.655(PeerJ CS 7:e655) 第三方评测 扩展版 4173/210 例与 93.87% 出处
arXiv:2003.13865 撞名数据集论文 与库内 covid-ct(307)辨析
Kaggle plameneduardo/sarscov2-ctscan-dataset(V2) 数据主渠道 规模/许可/统计核验
GitHub Plamen-Eduardo/xDNN-SARS-CoV-2-CT-Scan 代码渠道 结构与时间线核验

使用纪律:正文任何硬数字都能在 7 行之内回溯到本表;回溯不到的数字不应出现在正文。

附录 X:双形态实验设计模板

同一篇论文里同时使用主版本与扩展版时的标准设计模板(可直接套用):

  1. 实验一(切片级 baseline):主版本 2482 张,80/20 随机划分(种子固定),二分类,报告 accuracy/F1/混淆矩阵;声明含泄漏风险。
  2. 实验二(患者级主实验):扩展版 4173 张/210 例,60/40 subject-wise(分组种子固定),三分类,报告宏平均 F1 + 各类灵敏度/特异度 + 混淆矩阵;此为论文主表。
  3. 实验三(口径对照,可选但推荐):在扩展版上额外做一次切片级随机划分,与实验二同方法对比——量化泄漏红利,回应审稿人最常见的问题。
  4. 报告规范:三个实验分表呈现,表题注明口径;严禁跨表混排分数;limitations 引用 §3.3 与坑 8。

附录 Y:本条目生产档案

  • 写手:agent-a-sarcovid(主会话派发,任务书 rsi_dispatch/task_sar-covid.md,生成时间 2026-09-28T13:03:48)
  • 流程:开工三查(租约锁 writing/sar-covid/.lock;临时文件 /tmp/sar-covid_agent-a-sarcovid_part*.md;环境检查)→ 三轮三源核验 → 别名/撞库核验 → 研究 → FACTS.md → 5+3 part 直写拼接成稿 → 双脚本自检 → 汇报
  • 核验轮次:第 1 轮 WebSearch 双源命中;第 2 轮 Kaggle+GitHub 实抓;第 3 轮 Europe PMC REST API 元数据确认;库内 qf_psql.sh slug 查重 0 命中;与 covid-ct(rid 307)FACTS 交叉比对确认同名异实
  • 存照纪律:双口径 6 条全部进 §10 与附录 L;遗留疑点 4 条记录于 FACTS.md 第 9 节,成稿未对其下断言
  • 铁律遵守:未修改 scripts/、production_tracker.md、他条目目录、数据库与 publish.sh;锁文件仅写本 slug 目录

附录 Z:30 秒电梯稿(三个版本)

对管理者:这是一个 2020 年的新冠 CT 数据集,2482 张图、两个类别、下载二十八万次级、许可非商业。今天它的主要价值是教学案例与历史锚点;新项目要做患者级严格评估,请用库内的第二代数据集。

对工程师:Kaggle 注册即下,五分钟跑通 baseline;但划分要自己管、尺寸要统一、阳性文件名有空格括号。切片级分数普遍虚高,写报告时把口径钉死。

对研究者:它同时是高分基准和方法学反面教材——97.31% 与 93.87% 的差距就是患者泄漏的价格。引用它时锚定 DOI,别用 “COVID-CT dataset” 这个被三义共用的短语。

附录 AA:核心术语中英对照总表

本条目正文与图表出现的高频术语,检索外文文献时的对照锚点:

中文 英文
轴位切片 axial slice
磨玻璃影 ground-glass opacity (GGO)
铺路石征 crazy paving pattern
切片级标签 slice-level label
患者级划分 patient-wise / subject-wise split
患者级泄漏 patient leakage
可解释深度神经网络 explainable-by-design deep neural network (xDNN)
原型分解 prototype decomposition
非COVID肺部异常 other (non-COVID) pulmonary abnormalities
类别均衡 class balance
类别加权 class weighting
预训练骨干 pre-trained backbone
微调 fine-tuning
混淆矩阵 confusion matrix
宏平均 F1 macro-averaged F1 score
数据冻结 data freeze
数据可用性声明 data availability statement
数据集卡片 dataset card / model card 惯例同源
配图提取 figure extraction(从论文截取图像组建数据集)
来源指纹 source fingerprint / shortcut feature
跨库泛化 cross-dataset generalization
伦理审批 ethics approval / IRB
非商业许可 NonCommercial (NC) license
相同方式共享 ShareAlike (SA)
双口径 dual reporting / conflicting versions(本库存照用语)
撞名 name collision

检索提示:本数据集相关外文检索优先用 “SARS-CoV-2 CT-scan dataset”(带连字符与冠词的预印本原题写法)与 “sarscov2 ctscan”(Kaggle slug 词根)两组词形;“COVID-CT” 一词在英文文献中同样被多义使用,需以 DOI 消歧。

尾注

本条目由写手 agent-a-sarcovid 依据任务书 rsi_dispatch/task_sar-covid.md 生产,事实底稿见同目录 FACTS.md。核验流程:三轮三源(Kaggle 实抓、GitHub 实抓、Europe PMC REST API)+ 库内 slug 查重(0 命中)+ 与库内 covid-ct(rid 307)撞名辨析(同名异实,准入)。全部双口径冲突 6 条逐条存照于 §10 与附录 L,遗留疑点 4 条见 FACTS.md 第 9 节。生产时点:2026-09-28。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • covid-ct — 共享标签:医学影像 / CT / 图像分类 / COVID-19
  • bimcv-covid — 共享标签:医学影像 / CT / COVID-19
  • stoic — 共享标签:医学影像 / CT / COVID-19
  • radimagenet — 共享标签:医学影像 / CT / 图像分类
  • ct-rate — 共享标签:医学影像 / CT / 图像分类
  • brax — 共享标签:医学影像 / CT / 图像分类
  • covid-19-radiography — 共享标签:医学影像 / 图像分类 / COVID-19
  • mosmeddata — 共享标签:医学影像 / CT / COVID-19
  • cardiac-implantable-device-cxr — 共享标签:医学影像 / 图像分类
  • chest-x-ray-segmentation — 共享标签:医学影像 / 图像分类

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集