PI-CAI — 前列腺 MRI 癌症 AI 基准 AI-Ready Wikipedia

1,500 例多中心前列腺 bpMRI,csPCa 检测与 PI-RADS 分级基准

来源 Radboud University Medical Center(Diagnostic Image Analysis Group,PI-CAI Consortium) url: https://pi-cai.grand-challenge.org/发布时间: 2026-09-19最后更新: 2026-09-25 阅读 26
PI-CAI — 前列腺 MRI 癌症 AI 基准 AI-Ready Wikipedia

信息速览

数据集名称PI-CAI — 前列腺 MRI 癌症 AI 基准 AI-Ready Wikipedia
数据类型1,500 例 bpMRI 检查,约 27.6GB MHA 压缩包,CC BY-NC 4.0 非商业,病灶级 AP + 患者级 AUROC
规模1,500 例 MRI 检查(9,129 名患者的完整队列子集)
接入方式Radboud University Medical Center(Diagnostic Image Analysis Group,PI-CAI Consortium) url: https://pi-cai.grand-challenge.org/
AI 就绪度

PI-CAI — 前列腺 MRI 癌症 AI 基准 AI-Ready Wikipedia


INFOBOX

数据集名称 The PI-CAI Challenge: Public Training and Development Dataset
英文全称 Prostate Imaging: Cancer AI Challenge — Public Training and Development Dataset
别名/简称 PI-CAI、PI-CAI 2022、PI-CAI Public、PI-CAI Public Training and Development Dataset
疾病分类 前列腺癌(ICD-11:2C82 前列腺恶性肿瘤;相关:2C82.0 前列腺腺癌)
SNOMED CT 399068003 Malignant tumor of prostate / 41216001 Prostate structure / 712989004 Prostate-specific antigen measurement / 36976004 Magnetic resonance imaging of prostate(详见 §2.1b)
数据模态 双参数磁共振成像(bpMRI:T2W 轴位/矢状位/冠状位 + 高 b 值 DWI + ADC)、结构化临床变量、病灶级 3D 掩膜标注
AI 任务类型 3D 病灶检测、患者级二分类诊断(csPCa 有无)、医学图像分割、PI-RADS 分级辅助、半监督学习、多序列融合
样本总数 1,500 例 MRI 检查(含 328 例来自 **
**数据);完整语料 9,000–11,000 例
数据大小 约 27.6 GB(5 折 ZIP 压缩包);标注与临床信息约数百 MB
数据格式 MHA/MHD(MetaImage)影像、NIfTI/NRRD 标注、CSV/JSON 临床信息与检测图
许可证 Creative Commons Attribution-NonCommercial 4.0 International(CC BY-NC 4.0)
访问级别 注册后开放(Zenodo 直接下载,需注册 Grand Challenge 参与挑战赛)
DUO 标签 GRU, NPUNCU, IRB
语言 英文
首发日期 2022-05-05(Public Training and Development Dataset 发布)
最后更新 2026-07-13(picai_labels 补充全部 1,500 例常规临床 PI-RADS 评分)
发布机构 Radboud University Medical Center(联合 Ziekenhuis Groep Twente、UMC Groningen、NTNU)
官方主页 https://pi-cai.grand-challenge.org/
下载地址 https://zenodo.org/record/6624726 (影像)/ https://github.com/DIAGNijmegen/picai_labels (标注)
DOI 10.5281/zenodo.6624726(数据集)/ 10.1016/S1470-2045(24)00220-1(论文)
引用次数 259+(Synapse 学术快照,截至 2026-09;Semantic Scholar 收录 105 次施引)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 官方 5 折划分 + 完整预处理与评估工具链 + 官方 Docker 基线;扣分项:序列未共配准需自行处理、公开集无固定 train/val/test 划分、205 例阳性仅近期才有专家标注
页面状态 published

§0 E-E-A-T 信任声明与免责声明

§0.1 内容审核声明

本条目由千方病案医学编辑部组织撰写与交叉审核,遵循医疗 AI 数据集百科(AI-Ready Wikipedia)的内容规范 v3.9。审核范围与责任分工如下:

  • 医学审核:[千方病案医学编辑部]交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 双映射、csPCa 定义、PI-RADS v2.1 分级体系)、§7 偏倚分析、§7.3 泛化性评估。
  • 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
  • 审核日期:2026-09-05
  • 信息来源:本条目全部事实性陈述来源于 PI-CAI 挑战赛官方文档、Zenodo 数据集记录、DIAGNijmegen 官方代码仓库,以及 Saha et al. 2024(The Lancet Oncology)等同行评审文献。所有关键数字均标注出处,见 §9 与 §10.3。

§0.2 免责声明

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。PI-CAI 公开数据集采用 CC BY-NC 4.0 许可,明确禁止商业用途;隐藏调优与测试队列不对公众开放。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。

§0.3 版本与时效性

本条目对应 PI-CAI Public Training and Development Dataset(1,500 例,DOI 10.5281/zenodo.6624726)及其配套标注仓库 picai_labels。数据集本体自 2022 年发布后未再改动,但标注侧持续更新:2025-07-01 补齐全部 1,500 例的人工专家标注,2026-07-13 追加全部病例的常规临床 PI-RADS 评分。最后人工审核日期为 2026-09-05。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? PI-CAI 是一套面向前列腺癌磁共振影像的开源数据集与算法基准,由荷兰 Radboud 大学医学中心牵头组织。公开部分包含 1,500 例男性的前列腺双参数 MRI(bpMRI)检查——每位受检者都有 T2 加权成像、高 b 值扩散加权成像(DWI)和表观扩散系数图(ADC)三套断层影像,外加年龄、PSA 等化验与扫描参数。数据集配套了由专家医生逐层勾画的癌灶轮廓,以及每个病例最终的组织病理学结论。

为什么重要? 前列腺 MRI 的解读高度依赖放射科医师的经验,不同医生对同一张片子常常给出不一致的 PI-RADS 评分。PI-CAI 用 1,000 例隐藏测试病例,把 293 个来自全球的 AI 算法与 62 名执业放射科医师放在同一张考卷上比较——这是该领域迄今规模最大、设计最严格的头对头验证。结论是:最优 AI 集成模型的诊断 AUC 达到 0.91,显著高于医师平均的 0.86。

我能用它做什么? 你可以下载 1,500 例公开数据,在官方提供的 5 折划分上训练 3D 病灶检测或患者级诊断模型,用官方工具链 picai_prep 做预处理、picai_eval 做评测,并直接对比官方基线 U-Net/nnU-Net/nnDetection 与排行榜成绩。由于标注只覆盖全部阳性病例、且序列未共配准,这份数据也是研究半监督学习与多序列对齐的天然试验场。任何临床级应用都必须另做前瞻性验证。

§1.1 摘要

PI-CAI(Prostate Imaging: Cancer AI)是由 Radboud University Medical Center 联合 Ziekenhuis Groep Twente、University Medical Center Groningen 与 Norwegian University of Science and Technology 组织的国际算法挑战赛与配套公开数据集,并由 MIDL、MICCAI、欧洲泌尿生殖放射学会(ESUR)与欧洲泌尿外科学会(EAU)背书,Amazon Web Services 赞助。挑战赛聚焦于在双参数 MRI(bpMRI)上自动检测和诊断临床显著前列腺癌(clinically significant prostate cancer,csPCa,定义为 ISUP 分级 ≥ 2)。

研究设计由 16 位前列腺 AI、放射学与泌尿外科专家组成的国际科学顾问委员会共同确定。挑战赛分为开放开发阶段(7 个月)与封闭测试阶段(4 个月):前者的 1,500 例公开数据供全球团队训练模型,通过 Docker 容器形式每周提交一次,在 100 例隐藏调优队列上生成实时排行榜;后者由组织方用公开集加 7,607 例私有隔离训练集(合计 9,207 例)重训排名前 5 的算法,再在 1,000 例隐藏测试队列上重新评测。最终,前 5 名算法被等权集成为一个 AI 系统,与 62 名放射科医师在 400 例阅片者研究子集上进行配对、非劣效性验证。结果发表于 The Lancet Oncology(2024)。

§1.2 战略价值

维度一:为前列腺 AI 提供首个"真正未见"的验证基准。 在 PI-CAI 之前,该领域唯一的公开基准是 PROSTATEx,但其测试集仅 140 例 mpMRI,全部来自同一中心、同一厂商,且测试影像公开可下载——参赛者理论上可以针对测试集调参,无法给出无偏结论。PI-CAI 用 1,000 例隐藏测试队列(含来自未见挪威中心的 197 例外部病例)和每周一次、运行在 grand-challenge.org 平台上的 Docker 容器评测,从机制上保证测试影像对算法不可见、预测不可篡改。Saha et al., 2024, Lancet Oncol

维度二:把"AI vs 医师"从概念验证推进到统计学可检验的对照实验。 挑战赛不仅报告 AI 的 AUC,还组织 20 个国家、45 个中心的 62 名放射科医师在 400 例子集上做两轮盲法阅片(先 bpMRI、后完整 mpMRI),并用配对设计与置换检验做统计推断。这使"AI 是否不劣于甚至优于平均医师"成为一个可证伪的科学命题,而非厂商宣传语。该研究同时给出临床路径层面的收益估计:在相同敏感度下假阳性减少 50.4%,ISUP 1 级的过度诊断减少 20.0%。

维度三:工程化的开放工具链降低了复现门槛。 PI-CAI 不只发布数据,还发布了官方基线(U-Net / nnU-Net / nnDetection,各有监督与半监督两版)、预处理库 picai_prep(转换为 nnU-Net Raw Data Archive 格式)、评估库 picai_eval(含官方排序指标与置换检验),以及固定且无患者重叠的 5 折划分。这种"数据 + 划分 + 代码 + 评测"四位一体的交付方式,使它成为影像 AI 数据集工程的参考范式。

§1.3 同类数据集横向对比

数据集 规模 模态 标注内容 参考标准 差异化定位
PI-CAI 1,500 例公开(全语料 9,000–11,000 例) bpMRI(T2W + DWI + ADC,无 DCE) 病灶级 3D 勾画(ISUP 分级标签)+ 患者级诊断标签 + 临床变量 组织病理(ISUP ≥ 2 阳性)+ ≥ 3 年随访确认阴性 隐藏测试队列 + 阅片者研究,AI 与 62 名医师头对头
PROSTATEx 346 例(训练 204 / 测试 140) mpMRI(含 DCE) 病灶级标注 + PI-RADS 评分 活检 Gleason 分级 已被 PI-CAI 取代;其全部病例已并入 PI-CAI 公开集(328 例)
PROSTATEx-2 112 例 mpMRI(含 DCE) 5 级 PI-RADS 分级 活检 + 根治标本 侧重点为 PI-RADS 分级而非癌灶检测
Prostate-MRI-US-Biopsy 多例(TCIA 托管) mpMRI + 超声引导活检 活检靶点坐标 活检病理 融合 MRI-超声配准场景
PANDA 10,616 例全切片图像 病理 WSI Gleason 分级 + ISUP 分组 病理金标准 病理域而非影像域,常与 PI-CAI 并列为前列腺 AI 双基准

上表中 PROSTATEx 的测试集仅来自单一中心与单一厂商,且影像公开;PI-CAI 则以多中心、多厂商、隐藏测试集与阅片者研究补足了这些短板。需要注意的是,PI-CAI 公开集包含 328 例 PROSTATEx 病例,二者不应叠加使用,否则会造成数据重复与评估污染。

§1.4 版本时间轴

日期 事件 影响
2022-05-05 Public Training and Development Dataset(1,500 例)在 Zenodo 发布 开放开发阶段启动,全球团队可下载训练
2022-05 挑战赛注册开放,五折划分与基线代码同步公开 参赛者可复现官方基线
2022-11 挑战赛正式开赛(grand-challenge.org 平台) 每周一次的 Docker 容器评测启动
2023-07-17 获奖结果公布(Guerbet Research 夺冠) 累计 320+ 团队参与
2024-06-11 Saha et al. 论文在线发表(The Lancet Oncology) 结果经同行评审固化
2024-07 论文正式刊出,25(7):879–887 领域基准确立
2025-07-01 picai_labels 补齐 205 例缺乏人工标注的阳性病例(Pooch et al., 2025) 1,500 例全部具备人类专家标注
2026-07-13 picai_labels 发布全部 1,500 例的常规临床 PI-RADS 评分 可用于难度分层与模型校准

§1.5 典型应用场景

  1. 3D 病灶检测与分割算法研发:在非共配准的多序列 bpMRI 上预测 csPCa 病灶检测图,用病灶级 AP 与 FROC/SensX 评测。适合 nnDetection、nnU-Net、Mask R-CNN 类方法的基准对比。
  2. 患者级二分类诊断模型:从 bpMRI(±临床变量)预测该患者是否携带 ISUP ≥ 2 的 csPCa,用患者级 AUROC 评测,直接对标 62 名医师的表现。
  3. 半监督与弱监督学习:公开集中 205 例阳性在 2025 年前仅有 AI 派生标注,另有 1,075 例阴性完全无需勾画,是研究一致性正则、伪标签、正-未标注学习的真实场景。
  4. 多序列配准与非标准化强度鲁棒性研究:序列未共配准、ADC 绝对值跨中心不可比,为域自适应、强度标准化、跨序列融合方法提供了天然的困难样本。
  5. AI 辅助诊断的人机对比与阅片者研究设计:可复用其多阅片者、多病例(MRMC)配对设计与统计分析方法,作为其他影像 AI 临床验证研究的模板。

§2 医学背景

§2.1 ICD-11 疾病编码映射

标签 ICD-11 编码 中文名称 说明
csPCa 阳性 2C82 前列腺恶性肿瘤 PI-CAI 阳性定义为 ISUP 分级 ≥ 2 的前列腺腺癌
前列腺腺癌 2C82.0 前列腺腺癌 占前列腺恶性肿瘤绝大多数
惰性前列腺癌 2C82.Y / 2C82.Z 前列腺恶性肿瘤(其他/未特指) ISUP 1 级,本数据集中视为阴性
良性前列腺组织 GA90 / GA91 前列腺增生 / 前列腺炎 活检或 MRI 阴性,本数据集中视为阴性
血清 PSA 升高 MA18.1 / 相关实验室异常 前列腺特异性抗原升高 纳入队列的常见触发因素

说明:PI-CAI 的标签体系以 ISUP(International Society of Urological Pathology,国际泌尿病理学会)分级分组为核心,而非直接采用 ICD 编码。上表为临床语义映射,用于跨数据集检索与队列对齐;实际建模时请以数据集自带的 ISUP 标签为准。ISUP 分级分组与 Gleason 评分对应关系为:ISUP 1 = Gleason ≤ 6,ISUP 2 = Gleason 3+4 = 7,ISUP 3 = Gleason 4+3 = 7,ISUP 4 = Gleason 8,ISUP 5 = Gleason 9–10。

§2.1b SNOMED CT 概念映射

标签 ICD-11 SNOMED CT 码 术语
前列腺恶性肿瘤 2C82 399068003 Malignant tumor of prostate
前列腺腺癌 2C82.0 254900004 Carcinoma of prostate
前列腺结构 — 41216001 Prostate structure
磁共振成像(前列腺) — 36976004 Magnetic resonance imaging of prostate
前列腺特异抗原测定 — 712989004 Prostate-specific antigen measurement
经直肠超声引导前列腺活检 — 44513006 Transrectal ultrasound guided biopsy of prostate
根治性前列腺切除术 — 26294005 Radical prostatectomy
前列腺体积 — 448171004 Prostate volume

§2.2 疾病背景与流行病学

前列腺癌是全球男性第二大常见癌症。挑战赛官方综述给出的流行病学数字为:全球每年新增约 140 万例诊断,约 35 万例死亡,占男性癌症死亡的 6.8%;而在挑战赛方案书中,csPCa 的年度估算为约 100 万例确诊、30 万例死亡。年龄、家族史与非裔血统是主要风险因素。

临床上的核心矛盾在于"检测不足"与"过度诊断"并存。PSA 筛查提高了早期检出率,却也大量检出终生不会致病的惰性癌(ISUP 1 级),带来不必要的穿刺、手术与心理负担。因此现代诊疗路径将"临床显著前列腺癌"(csPCa,ISUP ≥ 2)作为干预阈值:只有这类肿瘤才需要积极治疗。欧洲泌尿外科学会(EAU)推荐在穿刺前先行多参数 MRI,以减少无谓活检并提高阳性穿刺率。

MR 影像的解读依赖 PI-RADS v2.1 半定量评分系统,其判读需要相当的经验积累,不同阅片者之间的一致性问题长期存在。这正是 PI-CAI 选择"检测 + 诊断"任务、并以放射科医师群体作为对照的临床动因。

§2.3 临床任务定义

临床环节 任务定义 PI-CAI 对应设置
筛查 在无症状人群中识别需进一步检查者 不涉及(队列为疑似 csPCa 的症状/指标触发人群)
诊断(患者级) 判断该患者是否携带 csPCa(ISUP ≥ 2) 核心任务之一,输出 [0,1] 的病例级似然,用 AUROC 评测
检测(病灶级) 在 3D 影像中定位 csPCa 病灶 核心任务之一,输出与 T2W 同尺寸的 3D 检测图,用 AP/FROC 评测
分级 按 PI-RADS v2.1 对病灶分级 2026 年补充发布的常规临床 PI-RADS 评分可用于校准与难度分层
预后 预测复发、进展或生存 不涉及

注意区分"检测"与"诊断"两个层级:检测是病灶级(要求定位准确、可评估重叠度),诊断是患者级(只要求一个概率分数)。挑战赛的官方排序指标是两者的平均,即 (AUROC + AP) / 2,这意味着只擅长其中一项的模型无法取得高排名。

§2.4 患者人群特征

维度 描述
来源 荷兰 3 个中心(Radboud UMC、Ziekenhuis Groep Twente、UMC Groningen/PCNN)与挪威 1 个中心(St. Olav’s Hospital, Trondheim)
采集时间 2012–2021 年
性别 全部为男性
年龄 数据集提供 patient_age 字段(每例的 MRI 检查时年龄),详见 §4.1
纳入标准 疑似携带 csPCa 的男性(如 PSA 升高或直肠指检 DRE 异常)
排除标准 有既往治疗史者;有既往 ISUP ≥ 2 病史者
种族/地域 以荷兰与挪威人群为主,族裔构成在官方文档中未细分
就医类型 二级/三级转诊医院的前列腺癌诊断路径(回顾性便利抽样)

需要强调:该队列系便利抽样(convenience sampling),官方明确说明其不代表参与站点的标准诊疗水平,既不应据此推断人群患病率,也不应用于 AI 系统的临床级标定。

§2.5 临床价值

PI-CAI 的临床意义在于验证了"AI 可作为前列腺 MRI 一线诊断的支持工具"。在 400 例阅片者研究子集上,集成 AI 的 AUC 为 0.91,显著高于 62 名医师的平均 0.86;在与医师相同的敏感度下,AI 的假阳性减少约一半,惰性癌检出减少 20%。这意味着在理论上,AI 辅助可以降低不必要的穿刺与过度诊断。

但研究同时给出了重要的负面结论:在全部 1,000 例测试集上,与常规多学科实践中的历史阅片相比,AI 的非劣效性未被确认(特异度 68.9% vs 69.0%,差值的 95% Wald 置信区间下界 −0.04 大于非劣效界值 −0.05)。换言之,AI 优于"用 PI-RADS 独立阅片的医师平均",但尚未证明优于"整个临床路径(含多学科会诊)的既有标准"。研究者据此明确指出,下一步需要前瞻性验证,而非直接临床部署。

§2.6 金标准与标注规范

维度 训练集(Public Training and Development) 隐藏调优/测试队列
阳性定义 组织学确诊 ISUP ≥ 2 组织学确诊 ISUP ≥ 2
阴性定义 组织学 ISUP ≤ 1,或 MRI PI-RADS ≤ 2 组织学 ISUP ≤ 1,或 MRI PI-RADS ≤ 2
随访 无随访 ≥ 3 年随访确认(荷兰病例经国家病理登记 PALGA 核对)
标注方式 手动逐层勾画 csPCa 病灶;阴性病例标注为空掩膜 不公开(仅用于评测)
标注者 RUMC 或 UMCG 的 10 名受训研究者或 1 名放射科住院医师,受 3 名专家放射科医师监督 组织方内部流程
工具 ITK-SNAP v3.80 组织方内部流程
标注性质 专家标注为多分类(ISUP ≤ 1, 2, 3, 4, 5);AI 派生标注为二分类(ISUP ≤ 1 或 ≥ 2) 不公开

金标准的一个关键设计是"MRI 阴性也可判为阴性":MRI 结果为 PI-RADS 1–2 的男性通常不做穿刺,无法获得组织学证据,若仅以组织学为金标准会系统性漏掉真阴性。PI-CAI 因此在训练集中沿用 PROSTATEx 的参考标准(组织学或 MRI 阴性均可),而在隐藏调优与测试队列中进一步加入 ≥ 3 年随访,用后续是否出现前列腺癌证据来确认阴性判定,从而降低验证偏倚。


§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本/资源 规模 理由
训练 3D 病灶检测或患者级诊断模型 Public Training and Development Dataset(影像)+ picai_labels(标注) 1,500 例 / 约 27.6 GB 唯一公开可下载的带标注影像子集,官方提供 5 折划分与基线代码
复现论文中的 AI vs 医师对比 无法本地复现 1,000 例隐藏测试 + 400 例阅片者研究 测试队列不公开,需通过 grand-challenge.org 提交容器参与评测
研究半监督/弱监督方法 公开集 + AI 派生标注(csPCa_lesion_delineations/AI) 1,500 例 含 205 例此前仅有 AI 标注的阳性病例,可构造正-未标注场景
需要全部 1,500 例的人工专家标注 picai_labels 的 human_expert/Pooch25 + original 1,500 例 2025-07-01 起专家标注覆盖全部病例
评估模型相对放射科医师的难度 picai_labels 的常规临床 PI-RADS 评分 1,500 例 2026-07-13 起可用,官方提醒该队列为便利抽样、不可用于基准标定
快速验证流水线是否跑通 官方基线仓库的 test 目录样本 单例 免去下载全量数据,用于确认 Docker 与预处理环境正确

§3.1 模态详情

PI-CAI 采用的是**双参数 MRI(biparametric MRI, bpMRI)**协议,即不使用动态对比增强(DCE)序列。每个病例至少包含三个必需序列:

序列 文件后缀 获取平面 关键属性
T2 加权成像 _t2w.mha 轴位(必需) 解剖结构基准序列,模型输出必须与 T2W 的空间维度与分辨率一致
高 b 值扩散加权成像 _hbv.mha 轴位(必需) b 值 ≥ 1000 s/mm²,b 值随病例提供
表观扩散系数图 _adc.mha 轴位(必需) 由 DWI 计算,绝对强度跨中心不可比
矢状位 T2W _sag.mha 矢状位(可选) 仅部分病例提供(公开集)
冠状位 T2W _cor.mha 冠状位(可选) 仅部分病例提供(公开集)

隐藏调优与测试队列的每个病例恰好包含五个序列(轴位/矢状位/冠状位 T2W + DWI + ADC)。DCE 序列不提供给任何 AI 算法;在测试队列中,部分病例的 DCE 仅供参与阅片者研究的放射科医师使用。

除影像外,每例还附带基本临床变量(患者年龄、前列腺体积、PSA、PSA 密度)与采集变量(扫描仪厂商、型号、高 b 值 DWI 的 b 值)。

§3.2 按子集样本数

子集 病例数 可用性 用途
Public Training and Development Dataset 1,500 公开(CC BY-NC 4.0) 模型训练与开发,含 328 例 PROSTATEx 病例
其中:良性或惰性 PCa 1,075 公开 标签应为空掩膜或全 0
其中:csPCa 阳性 425 公开 标签应含取值 2–5 的病灶块
其中:具备人类专家标注的阳性 220(原始)/ 425(2025-07 后) 公开 2025-07-01 前仅 220 例有专家标注
隐藏调优队列(Hidden Tuning) 100 不公开 开放开发阶段的实时排行榜
隐藏测试队列(Hidden Testing) 1,000 不公开 最终排名;含 197 例外部未见中心病例
其中:阅片者研究子集 400 不公开 62 名放射科医师两轮盲法阅片
私有/隔离训练集(Private/Sequestered) 7,607 不公开 封闭测试阶段组织方重训前 5 名算法
全量语料 9,000–11,000 不公开 挑战赛整体队列

§3.3 数据格式

内容 格式 说明
影像 MHA / MHD(MetaImage,ITK 原生) 由 SimpleITK/ITK 直接读取;ZIP 分 5 折打包
病灶标注 NIfTI(.nii.gz)/ NRRD(.nrrd) 专家原始标注与重采样至 T2W 分辨率两种版本
全腺体分割 NIfTI / NRRD AI 派生(Bosma22b),供预处理裁剪使用
临床信息 CSV(marksheet.csv) 每行一次检查,含患者与检查 ID、PSA、体积、年龄等
评分与资源 JSON 年度评分、检查清单等附加资源
模型输出(提交用) MHA / TIF(检测图)+ JSON(病例级似然) 官方接口定义:/output/images/cspca-detection-map/ 与 /output/cspca-case-level-likelihood.json

§3.4 存储大小

  • Hugging Face 镜像记录显示,1,500 例公开集合并后的总文件大小为 27.6 GB。
  • 原始 Zenodo 发布为 5 个 ZIP 分卷(fold0–fold4),逐折下载,便于断点续传。
  • 预处理后(nnU-Net Raw Data Archive 格式、统一 spacing)体积会因重采样而变化,官方建议预留充足的中间存储。官方 Docker 解压示例使用 --memory=8gb,预处理示例使用 --memory=16gb,可据此估算内存下限。
  • 标注与临床信息体量很小(数百 MB 量级),可忽略不计。

§3.5 标注方式

PI-CAI 的标注是混合来源的,这是理解该数据集的关键:

  1. 人类专家标注(gold-standard):由 RUMC/UMCG 的 10 名受训研究者或 1 名放射科住院医师,在 3 名专家放射科医师监督下完成。使用 ITK-SNAP v3.80 逐层勾画 csPCa 病灶。原始标注的坐标分辨率不统一——部分在 T2W 分辨率下绘制,部分在 DWI/ADC 分辨率下绘制,但都保证与 DWI/ADC 上的观察对应。仓库另提供统一重采样至 T2W 分辨率的版本,供模型输出对齐使用。截至原始发布,专家标注覆盖 1,295 / 1,500(86%)病例;2025-07-01 追加 Pooch et al. 2025 的 205 例后,覆盖全部 1,500 例。
  2. AI 派生标注(弱标签):RUMC 用半监督学习策略(Bosma et al., 2022)为全部 1,500 例生成 csPCa 病灶标注,另以类似方式生成全部病例的前列腺全腺体分割。官方明示这些自动标注"可能包含错误或分割缺陷"。
  3. 患者级标签:由参考标准(组织病理 ISUP 或 MRI PI-RADS)确定,是最终诊断任务的真值。

因此,1,500 例中只有约 425 例真正含病灶,且早期版本中只有 220 例的人工勾画直接可用;其余阳性病例的勾画来自 AI。这是典型的弱监督/半监督场景,而非完全人工标注的干净数据集。

§3.6 标注者资质与一致性

标注团队由 RUMC 与 UMCG 的 10 名受训研究者 + 1 名放射科住院医师组成,全部在 3 名专家放射科医师(据挑战赛方案,专家经验超过 25 年)监督下作业。病灶勾画工具为 ITK-SNAP v3.80。官方文档未给出标注者间一致性(如 Dice 或 kappa)的量化指标,这本身是一项已知局限:使用者无法从公开资料判断标注噪声的量级。此外,参考标准本身混合了组织学与影像学两种证据来源,两者的诊断确定性并不等同。

§3.7 采集周期

影像采集跨度为 2012–2021 年,覆盖四个中心。训练与调优数据来自荷兰三个中心(11 个站点),测试数据来自荷兰与挪威四个中心(12 个站点)。长跨度采集意味着设备、协议与临床实践在十年间发生过演进,数据集内部存在时间维度上的协议异质性。

§3.8 地域覆盖

国家 中心 站点数(测试集口径)
荷兰 Radboud University Medical Center(RUMC) 参与 12 站点中的一部分
荷兰 Ziekenhuis Groep Twente(ZGT) 同上
荷兰 University Medical Center Groningen / Prostaat Centrum Noord-Nederland 同上
挪威 St. Olav’s Hospital, Trondheim University Hospital(STOH) 作为外部未见中心,贡献 197 例

测试队列中的外部部分(挪威 197 例)是评估跨中心泛化性的关键,但其规模仅占测试集的约 20%,且挪威中心与荷兰中心在人群与设备上仍有相似性。

§3.9 设备与采集规格

维度 规格
扫描仪厂商 Siemens Healthineers、Philips Medical Systems
线圈 表面线圈(surface coils)
磁场强度 官方数据页未逐例披露;社区记录中公开集可见 1.5T 与 3.0T 机型
T2W 采集平面 轴位(必需)、矢状位与冠状位(公开集可选,隐藏队列必需)
DWI 轴位,高 b 值 ≥ 1000 s/mm²,逐例提供 b 值
ADC 轴位,由 DWI 计算
对比剂 不使用(bpMRI 协议,无 DCE)
采集参数记录 每例记录扫描仪厂商、型号、扩散 b 值

§3.10 深度溯源链

临床来源(2012–2021,四中心)
  └─ RUMC / ZGT / UMCG-PCNN(荷兰)  +  STOH(挪威)
      └─ 回顾性筛选:疑似 csPCa 男性,排除既往治疗或 ISUP ≥ 2 病史
          └─ IRB 豁免知情同意(匿名临床数据的回顾性科研使用)
              └─ 影像去标识化 + 匿名化 ID(patient_id / study_id)
                  └─ Zenodo record 6624726(CC BY-NC 4.0,5 折 ZIP)
                      └─ 标注与临床信息:github.com/DIAGNijmegen/picai_labels
                          ├─ csPCa_lesion_delineations/human_expert(专家标注)
                          ├─ csPCa_lesion_delineations/AI(Bosma22a 自动标注)
                          ├─ anatomical_delineations/whole_gland/AI(Bosma22b)
                          └─ clinical_information/marksheet.csv(临床变量)
                              └─ 官方工具链:picai_prep(预处理)→ picai_baseline(训练)→ picai_eval(评测)

§4 数据结构

§4.0 目录树

下载并解压全部 5 折、克隆标注仓库后,建议的目录结构如下(与官方基线文档一致):

/input/
├── images/                                  # 从 Zenodo 5 折 ZIP 解压的影像
│   ├── 10000_1000000_t2w.mha                # 轴位 T2 加权(必需,基准分辨率)
│   ├── 10000_1000000_hbv.mha                # 高 b 值 DWI(必需)
│   ├── 10000_1000000_adc.mha                # ADC 图(必需)
│   ├── 10000_1000000_sag.mha                # 矢状位 T2W(可选,仅部分病例)
│   ├── 10000_1000000_cor.mha                # 冠状位 T2W(可选,仅部分病例)
│   └── ...                                  # 共 1,500 例,命名规则 {patient_id}_{study_id}_{序列}.mha
│
├── picai_labels/                            # git clone 的标注仓库
│   ├── csPCa_lesion_delineations/
│   │   ├── human_expert/
│   │   │   ├── original/                    # 原始专家标注(分辨率依标注者而异)
│   │   │   │   ├── 10000_1000000.nii.gz
│   │   │   │   └── ...
│   │   │   ├── resampled/                   # 重采样至 T2W 分辨率(模型输出对齐用)
│   │   │   └── Pooch25/                     # 2025 年补充的 205 例专家标注
│   │   └── AI/
│   │       └── Bosma22a/                    # 全部 1,500 例的 AI 派生病灶标注
│   ├── anatomical_delineations/
│   │   └── whole_gland/
│   │       └── AI/Bosma22b/                 # 全部 1,500 例的前列腺全腺体分割
│   ├── clinical_information/
│   │   └── marksheet.csv                    # 临床与采集变量(每行一次检查)
│   └── additional_resources/
│
├── workdir/                                 # 中间产物(预处理结果、检查点)
│   ├── nnUNet_raw_data/                     # picai_prep 转换后的 nnU-Net 格式
│   ├── splits/
│   │   └── picai_nnunet/                    # 导出到磁盘的 5 折划分
│   └── results/[model name]/                # 训练检查点(支持暂停/恢复)
│
└── output/                                  # 训练输出:模型权重、预处理计划

§4.1 DAIMS 字段字典

下表覆盖核心表 clinical_information/marksheet.csv 的主要字段,以及影像与标注侧的关键元数据。字段名严格对应官方命名。

字段名 类型 说明 示例值 AI 用途 观测误差 缺失编码 取值范围
patient_id 字符串 匿名患者 ID 10000 患者级分组,防止跨折泄漏 无 不允许缺失 整型字符串
study_id 字符串 匿名检查 ID;同一患者可有多个 study 1000000 主键;数据集划分与索引的最细粒度 无 不允许缺失 整型字符串
mri_date 日期(已匿名) MRI 检查的匿名化日期 2018-01-01(偏移后) 时间趋势分析;不可还原真实日期 日期已整体偏移/截断 可缺失 匿名日期
patient_age 整数 MRI 时的患者年龄(岁) 67 诊断模型的临床协变量 报告误差 可缺失(未报告) 约 40–90
psa 浮点 血清 PSA(ng/mL),来自放射报告 9.3 强预测因子,提升患者级 AUC 检测方法差异、报告四舍五入 可缺失(未报告) 约 0.1–100+
prostate_volume 浮点 前列腺体积(mL),报告值 45.0 计算 PSA 密度;腺体大小分层 椭球模型近似误差 可缺失(未报告) 约 10–200
psad 浮点 PSA 密度(官方标注单位 ng/mL²),报告值 0.465 风险分层 可能与 PSA/体积不一致(舍入) 可缺失(未报告) 约 0.01–10
histopath_type 类别 组织取样方式 MRBx 标签确定性分层 系统穿刺可能低估 缺失=未做取样 SysBx / MRBx / SysBx+MRBx / RP
scanner_manufacturer 类别 扫描仪厂商 Philips Medical Systems 域偏移分析与域自适应 无 可缺失 Siemens Healthineers / Philips
scanner_model_name 类别 扫描仪型号 Ingenia 设备分层评估 无 可缺失 型号字符串
diffusion_high_bvalue 整数 高 b 值 DWI 的 b 值(s/mm²) 2000 强度标准化;序列可比性 采集协议差异 可缺失 ≥ 1000
sequence 类别 影像序列类型 t2w / hbv / adc / sag / cor 多序列融合、通道选择 无 必需序列不可缺失 五类
ISUP(标注体素值) 整数(标签) 病灶掩膜体素取值 0 / 2 / 3 / 4 / 5 多分类或二分类(≥ 2)监督信号 勾画者间差异、分辨率差异 0 = 无病灶 0–5
case_csPCa(派生) 布尔(标签) 病例级是否 csPCa 1 患者级诊断目标 参考标准不确定性 由掩膜派生 0 / 1
cspca-detection-map(输出) 浮点体积 模型预测的 3D 检测图,与 T2W 同尺寸 [0,1] 体素值 病灶级评测输入 取决于模型 — 0–1
cspca-case-level-likelihood(输出) 浮点 病例级 csPCa 似然 0.87 患者级 AUROC 输入 取决于模型聚合函数 — 0–1

关于 psad 单位:官方仓库将 PSA 密度标注为 ng/mL²,这是其文档的原始写法;临床常规中 PSA 密度单位通常写作 ng/mL/mL 或 ng/mL²。此处保留官方表述,建模时无需换算。

§4.2 标签分布

类别 病例数 占比 说明
良性/惰性前列腺癌(阴性) 1,075 71.7% 标签应为空或全 0
csPCa 阳性(ISUP ≥ 2) 425 28.3% 标签含取值 2–5 的病灶块
合计 1,500 100% —

在阳性病例内部,若按 ISUP 分级细分,专家标注掩膜的体素取值为 2、3、4、5 分别对应 ISUP 2–5 级。需要注意的是,官方公布的 71.7% / 28.3% 是"病例级"的划分;病灶级分布更不均衡,绝大多数体素为背景。

这一阳阴比(约 1 : 2.5)在临床筛查场景中属于"富集阳性"的设计——真实筛查人群的 csPCa 患病率远低于 28%。因此模型直接部署到筛查场景时,阳性预测值会大幅下降。

§4.3 关键统计

统计量 数值 来源
公开病例数 1,500 官方数据页
全语料规模 9,000–11,000 例 官方数据页
论文训练/调优队列 9,207 例(3 中心 11 站点) Saha et al., 2024
论文测试队列 1,000 例(4 中心 12 站点,含外部 197 例) Saha et al., 2024
论文总回顾队列 10,207 次检查 / 9,129 名患者 Saha et al., 2024
阅片者 62 名放射科医师,45 中心,20 国家 AJR 评论文章
参赛算法 293 个(开放开发阶段) BJUI 评论文章
参与团队 320+ 学术与产业团队 Guerbet 新闻稿
人工共配准病例 54 / 9,107(全语料) Hugging Face 数据集卡
专家标注覆盖率 1,295 / 1,500(86%)→ 2025-07 后 1,500 / 1,500 picai_labels
总文件大小 约 27.6 GB Hugging Face 数据集卡

§4.4 数据层级

患者(patient_id)
  └─ 检查 / study(study_id)           ← 主键粒度,同一患者可有多次检查
      ├─ 影像序列(sequence)
      │   ├─ t2w(轴位,必需,模型输出基准分辨率)
      │   ├─ hbv(高 b 值 DWI,必需)
      │   ├─ adc(必需)
      │   ├─ sag(可选,公开集)
      │   └─ cor(可选,公开集)
      ├─ 临床与采集变量(marksheet.csv 的一行)
      ├─ 病灶标注(3D 掩膜 → 每层 2D 切片 × 若干层)
      └─ 前列腺全腺体分割(AI 派生,3D 掩膜)

关键点:主键是 study_id 而非 patient_id。同一患者可能有多次检查,其标签可能不同(例如某患者 2018 年的检查为阴性、2020 年为阳性),因此必须按 study 粒度组织数据,同时按 patient 粒度做划分以避免泄漏。

§4.5 缺失值与信息性缺失编码

PI-CAI 采用空值即缺失的语义,不做特殊编码(区别于 MIMIC 的哨兵值约定)。缺失并非随机,而是具有信息性:

字段 缺失含义 是否信息性 处理建议
psa 该检查的放射报告中未报告 PSA 是(可能提示临床路径差异) 用中位数填补并加缺失指示变量;或训练仅影像模型
prostate_volume 报告未给出体积 是 可用 AI 全腺体分割自动计算替代(隐藏队列即采用此回退策略)
psad 报告未给出 PSA 密度 是 隐藏队列中由专家放射科医师回顾性计算;本地可用 psa / volume 近似
patient_age 未报告 弱信息性 少见,可填补
histopath_type 未进行组织取样 是(可能为 MRI 阴性未穿刺) 不应填补;与阴性标签语义相关
scanner_*、diffusion_high_bvalue 未记录 弱信息性 作为类别/数值协变量,缺失单列一类

关键风险:把缺失当作随机噪声处理会引入偏倚。例如未做穿刺的病例更可能是 MRI 阴性,若简单剔除这些行,会人为抬高阳性率。


§5 数据划分与使用建议

§5.1 官方划分

PI-CAI 官方提供两套固定划分,均以 study_id 为划分单位,并保证患者不重叠:

  1. 全量划分(picai_baseline.splits.picai):覆盖全部 1,500 例,5 折交叉验证。
  2. 有标注子集划分(picai_baseline.splits.picai_nnunet):仅覆盖具备专家标注的病例,是前者的子集,便于在有监督设置下比较。

载入方式:

from picai_baseline.splits.picai import train_splits, valid_splits

for fold, ds_config in train_splits.items():
    print(f"Fold {fold} | 训练集 {len(ds_config['subject_list'])} 例")

for fold, ds_config in valid_splits.items():
    print(f"Fold {fold} | 验证集 {len(ds_config['subject_list'])} 例")

也可导出到磁盘,供命令行评估工具校验病例覆盖:

python -m picai_baseline.splits.picai_nnunet --output "/workdir/splits/picai_nnunet"

需要注意的重要事实:公开集没有固定的 train/val/test 划分。Zenodo 上的 fold0–fold4 只是物理分卷(便于下载),并不等同于交叉验证折;真正的划分需通过上述 API 获取。

§5.2 社区惯例划分

做法 说明 适用场景
官方 5 折交叉验证 直接调用 picai_baseline.splits,患者不重叠 论文级可比结果,推荐默认
有标注子集 5 折 仅用专家标注病例 有监督基线复现
半监督设置 训练时纳入全部 1,500 例,其中 205 例用 AI 派生标注;验证仍用专家标注子集 探索弱监督方法
单一固定留出集 从 5 折中取 fold0 作验证、其余作训练 快速实验;需在论文中说明
完全自划分 自行随机划分 不推荐,难以与其他工作比较,且易引入患者泄漏

§5.3 泄漏风险(重点)

这是使用 PI-CAI 时最容易造成评估虚高的环节,主要有三条路径:

路径一:患者级泄漏。 同一患者可能有多次检查,且不同检查的标签可能不同。若按 study 随机划分而不约束 patient,同一患者的不同检查会同时出现在训练集与验证集。由于两次检查在解剖结构、PSA、扫描仪上高度相关,验证集指标会被显著抬高。官方划分已规避此问题,自行划分时必须显式按 patient_id 做 GroupSplit。

路径二:与 PROSTATEx 的重复。 公开集的 1,500 例中包含 328 例来自 PROSTATEx 的病例。若你另外下载 PROSTATEx 并合并训练,会造成数据重复;若你的验证集来自 PROSTATEx 而训练集来自 PI-CAI,则存在直接泄漏。官方明确建议只使用 PI-CAI 公开集,不要与之叠加 PROSTATEx。

路径三:AI 派生标注的交叉污染。 用 AI 派生标注(Bosma22a)训练、又在同一批病例的人工标注上评估,会高估模型能力——因为 AI 标注与人工标注在那些病例上高度一致。正确做法是仅在训练期使用 AI 标注,评估严格限定在专家标注病例上。

检测泄漏的快速代码:

import pandas as pd

# 检查训练/验证折之间是否存在患者重叠
for fold in range(5):
    train_pids = {s.split("_")[0] for s in train_splits[fold]["subject_list"]}
    valid_pids = {s.split("_")[0] for s in valid_splits[fold]["subject_list"]}
    overlap = train_pids & valid_pids
    assert not overlap, f"Fold {fold} 存在患者泄漏: {len(overlap)} 名患者"
print("全部 5 折均无患者重叠")

§5.4 交叉验证建议

  • 优先使用官方 5 折,以便与排行榜、论文及社区结果直接比较。
  • 报告指标时同时给出每折结果 + 均值 ± 标准差,而非只报最好一折。
  • 由于阳性率仅 28.3% 且折间病例数有限(每折约 300 例),单折 AUC 的置信区间较宽,建议配合 bootstrap 估计不确定性,官方评估库 picai_eval 已内置该功能。
  • 若改动预处理(如重采样 spacing),必须对全部 5 折执行同一流程后再比较,避免预处理与折的交互混淆结论。

§5.5 外部验证建议

  • 可用的外部资源:TCIA 的 Prostate-MRI-US-Biopsy 队列(曾有研究用其做外部验证,PI-CAI 训练模型在其上 AUC 为 0.83)。
  • 最理想的验证:通过 grand-challenge.org 提交 Docker 容器,在 1,000 例隐藏测试集(含挪威外部中心 197 例)上评测,这是与论文数字可比的唯一途径。
  • 本地外部验证的注意事项:必须重新拟合强度标准化器(尤其 ADC 与 DWI),不能沿用训练集的绝对强度先验;同时核对外部数据的序列命名与朝向约定。
  • 报告要求:明确区分"内部测试(同中心未见病例)"与"外部测试(未见中心)"结果,二者差距通常反映真实的泛化缺口。

§6 AI 就绪指南

§6.0 云端快速启动

由于全量数据约 27.6 GB、3D 训练对显存要求较高,云端环境是推荐的起步方式。挑战赛官方文档明确支持 Google Colaboratory 与 Kaggle 作为开发平台。推荐的起步路径:

  1. 在 Colab/Kaggle 中克隆 picai_baseline 与 picai_labels(两者都很小)。
  2. 只下载 1–2 个 fold 的影像(约 5–6 GB / fold)做流水线验证。
  3. 用官方提供的单例测试样本确认预处理与推理链路正确。
  4. 跑通后再扩容到全量 5 折做正式训练。

§6.1 快速上手:目录约定与最小可用子集

代码块的目录结构预期:以下所有脚本均假设当前工作目录包含三个顶层目录(与官方基线一致):

  • /input/images/ —— 从 Zenodo 5 折 ZIP 解压出的 .mha 影像,命名规则为 {patient_id}_{study_id}_{序列}.mha。
  • /input/picai_labels/ —— clone 得到的标注仓库,内含 clinical_information/marksheet.csv 与 csPCa_lesion_delineations/。
  • /workdir/ —— 全部中间产物与检查点的落盘位置。

data_root 拼接关系:影像路径由 {data_root}/images/{patient_id}_{study_id}_{sequence}.mha 拼出;标注路径由 {data_root}/picai_labels/csPCa_lesion_delineations/human_expert/resampled/{patient_id}_{study_id}.nii.gz 拼出。临床信息统一读取 {data_root}/picai_labels/clinical_information/marksheet.csv,以 study_id 为键关联。

最小可用子集:仅需 1 例病例的 3 个必需序列(t2w/hbv/adc)+ 1 个标注文件 + marksheet.csv 中对应的一行,即可验证从读取、预处理、前向推理到评测的完整链路。官方基线仓库的 test/ 目录即为此用途。

# 环境准备(建议 Python 3.9–3.11;官方容器基于此区间构建)
pip install picai-baseline picai-prep picai-eval SimpleITK numpy pandas torch

# 目录骨架(与官方文档一致)
mkdir -p /input/images /input/picai_labels /workdir/nnUNet_raw_data /output

# 获取标注(体积小,先克隆)
git clone https://github.com/DIAGNijmegen/picai_labels /input/picai_labels

§6.2 数据获取

资源 获取方式 大小 许可
影像(5 折) Zenodo record 6624726,逐折下载 ZIP 约 27.6 GB 合计 CC BY-NC 4.0
标注 git clone https://github.com/DIAGNijmegen/picai_labels 数百 MB 见仓库 LICENSE
官方基线代码 git clone https://github.com/DIAGNijmegen/picai_baseline 数十 MB 见仓库 LICENSE
评估库 pip install picai-eval(Apache 2.0) 极小 Apache 2.0
挑战赛评测 grand-challenge.org 注册后提交 Docker 容器 — 挑战赛规则

下载脚本(支持断点续传,-C - 是关键):

cd /input

# 逐折下载(-C - 表示断点续传,网络中断后可重复执行)
for i in 0 1 2 3 4; do
  curl -C - "https://zenodo.org/api/records/6624726/files/picai_public_images_fold${i}.zip/content" \
       --output "picai_public_images_fold${i}.zip"
done

# 解压(如本机无 unzip,可用官方 Docker 镜像替代,见下)
for i in 0 1 2 3 4; do
  unzip -q "picai_public_images_fold${i}.zip" -d /input/images/
done

若环境中没有 unzip,官方提供了容器化替代方案:

docker run --cpus=2 --memory=8gb --rm -v /path/to/input:/input \
  joeranbosma/picai_nnunet:latest \
  unzip /input/picai_public_images_fold0.zip -d /input/images/

⚠️ 申请要点:公开集无需签署独立的 DUA,注册 Grand Challenge 账号即可访问;但许可为非商业,任何商业用途需另行洽谈。隐藏调优与测试队列不对公众开放,只能通过官方评测服务间接使用。

§6.3 预处理全流程

PI-CAI 影像的预处理有三条硬性约束,直接决定后续能否正常训练:

  1. 序列未共配准:T2W、DWI、ADC 的分辨率与朝向各不相同,必须重采样到统一空间。官方提供两种策略:逐病例在序列间统一分辨率,或将整个数据集重采样到统一分辨率。
  2. ADC/DWI 强度非标准化:绝对值跨中心不可比,必须做强度归一化(如基于前列腺区域的分位数裁剪)。
  3. 输出必须对齐 T2W:官方评测要求预测的检测图与对应 T2W 影像具有相同的空间维度与分辨率,因此所有标注也需重采样到 T2W 分辨率(human_expert/resampled/ 即为此准备)。

官方推荐的转换流程是先把数据整理为 nnU-Net Raw Data Archive 格式:

# 半监督准备(纳入 AI 派生标注,使用全部 1,500 例)
python src/picai_baseline/prepare_data_semi_supervised.py

# 有监督准备(仅使用专家标注病例)
python src/picai_baseline/prepare_data.py

# 官方半监督 U-Net 基线使用的数据集级 spacing(3.0mm 层厚 × 0.5mm × 0.5mm 面内)
# --spacing 3.0 0.5 0.5

对应的 Python 侧关键步骤(脱离官方脚本时自行实现的最小版本):

import numpy as np
import SimpleITK as sitk

def load_and_resample(path: str, target_spacing=(3.0, 0.5, 0.5)) -> tuple:
    """读取 MHA 并重采样到目标 spacing。返回 (数组, 新 spacing)。"""
    img = sitk.ReadImage(path)
    original_spacing = img.GetSpacing()
    original_size = img.GetSize()
    new_size = [
        int(round(original_size[i] * (original_spacing[i] / target_spacing[i])))
        for i in range(3)
    ]

    resampler = sitk.ResampleImageFilter()
    resampler.SetOutputSpacing(target_spacing)
    resampler.SetSize(new_size)
    resampler.SetOutputDirection(img.GetDirection())
    resampler.SetOutputOrigin(img.GetOrigin())
    # 影像用线性插值,标签必须用最近邻,否则会引入不存在的类别值
    resampler.SetInterpolator(sitk.sitkLinear)
    resampled = resampler.Execute(img)

    arr = sitk.GetArrayFromImage(resampled).astype(np.float32)
    return arr, target_spacing


def normalize_prostate_zone(volume: np.ndarray, gland_mask: np.ndarray = None,
                            lower_pct: float = 2.5, upper_pct: float = 99.5) -> np.ndarray:
    """强度归一化。

    关键:不要在全局体素上估计分位数——空气与肠道会产生极值。
    若提供前列腺分割掩膜,应仅在腺体内估计;否则至少裁掉背景。
    """
    roi = volume[gland_mask > 0] if gland_mask is not None else volume[volume > 0]
    if roi.size == 0:
        roi = volume
    lo, hi = np.percentile(roi, [lower_pct, upper_pct])
    if hi <= lo:
        return np.zeros_like(volume)
    return np.clip((volume - lo) / (hi - lo), 0.0, 1.0).astype(np.float32)

注意 ADC 的归一化与其他序列不同:ADC 图在病灶处通常偏低,且其动态范围受 b 值数量与场强影响极大。建议对 ADC 单独做标准化,并在论文中明确说明使用的是何种方案(如 z-score、分位数裁剪或病例内 min-max),因为不同选择会显著影响可比较性。

§6.4 PyTorch DataLoader(完整可运行)

下述 Dataset 直接读取 MHA 影像与 NIfTI 标注,按 study_id 关联临床变量,可用于 3D 分割/检测任务。

import os
from pathlib import Path

import numpy as np
import pandas as pd
import SimpleITK as sitk
import torch
from torch.utils.data import Dataset, DataLoader


class PICAIDataset(Dataset):
    """PI-CAI 公开训练集的 3D 多序列数据集。

    预期目录:
        {data_root}/images/{patient_id}_{study_id}_{sequence}.mha
        {data_root}/picai_labels/csPCa_lesion_delineations/human_expert/resampled/{patient_id}_{study_id}.nii.gz
        {data_root}/picai_labels/clinical_information/marksheet.csv
    """

    SEQUENCES = ("t2w", "hbv", "adc")

    def __init__(self, data_root: str, subject_list: list,
                 target_spacing=(3.0, 0.5, 0.5), patch_size=(20, 256, 256)):
        self.data_root = Path(data_root)
        self.subject_list = subject_list
        self.target_spacing = target_spacing
        self.patch_size = patch_size
        self.marksheet = pd.read_csv(
            self.data_root / "picai_labels" / "clinical_information" / "marksheet.csv",
            dtype={"patient_id": str, "study_id": str},
        ).set_index("study_id")

    def __len__(self) -> int:
        return len(self.subject_list)

    def _load_image(self, patient_id: str, study_id: str, seq: str) -> np.ndarray:
        path = self.data_root / "images" / f"{patient_id}_{study_id}_{seq}.mha"
        img = sitk.ReadImage(str(path))
        # 各序列分辨率不同,统一重采样到目标 spacing
        orig_spacing, orig_size = img.GetSpacing(), img.GetSize()
        new_size = [int(round(orig_size[i] * orig_spacing[i] / self.target_spacing[i]))
                    for i in range(3)]
        r = sitk.ResampleImageFilter()
        r.SetOutputSpacing(self.target_spacing)
        r.SetSize(new_size)
        r.SetOutputDirection(img.GetDirection())
        r.SetOutputOrigin(img.GetOrigin())
        r.SetInterpolator(sitk.sitkLinear)
        return sitk.GetArrayFromImage(r.Execute(img)).astype(np.float32)

    def _load_label(self, patient_id: str, study_id: str):
        path = (self.data_root / "picai_labels" / "csPCa_lesion_delineations"
                / "human_expert" / "resampled" / f"{patient_id}_{study_id}.nii.gz")
        if not path.exists():
            # 无专家标注的病例返回 None(半监督设置下可改为读取 AI 标注)
            return None
        lab = sitk.ReadImage(str(path))
        return sitk.GetArrayFromImage(lab).astype(np.int16)

    def __getitem__(self, idx: int) -> dict:
        subject = self.subject_list[idx]
        patient_id, study_id = subject.split("_")

        # 多序列在通道维堆叠;各序列独立标准化
        channels = []
        for seq in self.SEQUENCES:
            vol = self._load_image(patient_id, study_id, seq)
            roi = vol[vol > 0] if (vol > 0).any() else vol
            lo, hi = np.percentile(roi, [2.5, 99.5])
            vol = np.clip((vol - lo) / max(hi - lo, 1e-6), 0, 1)
            channels.append(vol)
        image = np.stack(channels, axis=0)  # (3, D, H, W)

        label = self._load_label(patient_id, study_id)
        if label is None:
            label = np.zeros_like(image[0], dtype=np.int16)

        # 简易随机裁剪到固定 patch(训练用;推理时请用滑窗)
        d, h, w = image.shape[1:]
        pd_, ph, pw = self.patch_size
        sd = np.random.randint(0, max(d - pd_, 0) + 1)
        sh = np.random.randint(0, max(h - ph, 0) + 1)
        sw = np.random.randint(0, max(w - pw, 0) + 1)
        image = image[:, sd:sd + pd_, sh:sh + ph, sw:sw + pw]
        label = label[sd:sd + pd_, sh:sh + ph, sw:sw + pw]

        # 病例级标签:任一 ISUP ≥ 2 体素即视为阳性
        case_label = int((label >= 2).any())

        row = self.marksheet.loc[study_id]
        clinical = np.array([
            float(row.get("patient_age", np.nan)),
            float(row.get("psa", np.nan)),
            float(row.get("prostate_volume", np.nan)),
        ], dtype=np.float32)
        clinical = np.nan_to_num(clinical, nan=-1.0)  # 缺失用 -1 显式标记

        return {
            "image": torch.from_numpy(image),                       # (3, D, H, W)
            "label": torch.from_numpy(label.astype(np.int64)),      # (D, H, W)
            "case_label": torch.tensor(case_label, dtype=torch.long),
            "clinical": torch.from_numpy(clinical),
            "subject": subject,
        }


# ---- 实例化 ----
DATA_ROOT = "/input"

from picai_baseline.splits.picai import train_splits, valid_splits

train_ds = PICAIDataset(DATA_ROOT, train_splits[0]["subject_list"])
valid_ds = PICAIDataset(DATA_ROOT, valid_splits[0]["subject_list"])

train_loader = DataLoader(train_ds, batch_size=2, shuffle=True,
                          num_workers=4, pin_memory=True, drop_last=True)
valid_loader = DataLoader(valid_ds, batch_size=1, shuffle=False, num_workers=2)

batch = next(iter(train_loader))
print(batch["image"].shape, batch["label"].shape, batch["case_label"])

§6.5 常见坑点

⚠️ 坑点 1:把 fold0–fold4 当成官方 train/val/test 划分(分类:数据泄漏)

问题:Zenodo 发布把 1,500 例影像物理切分成 picai_public_images_fold0..4.zip 五个压缩包,很多人误以为这就是官方交叉验证折,于是用 fold0–3 训练、fold4 测试。实际上这只是便于下载与校验的分卷,病例在折间的分布是任意的,且未按患者去重。这样做会得到既不可比又可能泄漏的结果。

症状:报告的数字无法与官方基线或论文对齐(往往偏高或偏低);换一组分卷重跑结果剧烈波动;若某患者的多张病例恰好分散在不同分卷,训练/测试直接泄漏。

解决:

  1. 简单方法:只用 picai_baseline.splits.picai 提供的划分,不要自己按 ZIP 分卷切分。
  2. 进阶方法:载入官方划分后显式断言无患者重叠(见 §5.3 代码),并把断言写进训练脚本的启动检查。
  3. SOTA 方法:在官方划分基础上叠加分层(按 csPCa 阳性率与扫描仪厂商分层),减少折间方差;报告 5 折均值 ± 标准差而非单折。
    参考:https://github.com/DIAGNijmegen/picai_baseline ;https://huggingface.co/datasets/MedOtter/PI-CAI

⚠️ 坑点 2:把 T2W 的标注直接套到 DWI/ADC 上(分类:预处理陷阱)

问题:专家标注的原始版本分辨率不统一——部分勾画在 T2W 分辨率下完成,部分在 DWI/ADC 分辨率下完成。若你只读取 human_expert/original/ 而不检查其空间信息,就会把某序列分辨率的掩膜错误地叠加到另一序列上,造成空间错位。而官方评测要求预测检测图与 T2W 影像同尺寸同分辨率,错位的标签会系统性污染监督信号。

症状:训练 loss 下降缓慢且平台很高;预测的检测块总是偏移若干体素;可视化时病灶轮廓明显"错位";评测时 AP 远低于官方基线但 loss 看似正常。

解决:

  1. 简单方法:统一使用 csPCa_lesion_delineations/human_expert/resampled/,该目录已重采样至 T2W 分辨率。
  2. 进阶方法:若必须使用 original 版本,读取时比对标注与影像的 GetSize()、GetSpacing()、GetDirection(),不一致则用 sitk.ResampleImageFilter 重采样,标签必须使用 sitkNearestNeighbor(线性插值会产生 1.5 这类不存在的类别值)。
  3. SOTA 方法:在 dataloader 中把"标注与影像空间一致性校验"做成断言或单元测试,纳入 CI;对每例输出 mask/volume 的空间元数据快照,便于回溯。
    参考:https://github.com/DIAGNijmegen/picai_labels

⚠️ 坑点 3:把 ADC 的绝对强度当作可比定量值(分类:预处理陷阱)

问题:官方数据页明确警告:ADC 的绝对强度值不具普遍性或独立的临床意义——不同于 CT 的 Hounsfield 单位(−1000 HU 永远是空气),ADC 值会随 b 值数量与取值、场强、厂商及个体差异大幅变化。若直接把原始 ADC 值送进网络,或在训练集上拟合全局缩放参数再用于其他中心,模型会学到"中心特有的强度偏移"而非病灶特征。

症状:跨中心/跨扫描仪评估时性能断崖式下跌;同一病例换台机器重采后预测翻转;模型在内部验证集上表现良好但外部集 AUC 掉 10 个点以上。

解决:

  1. 简单方法:对每例、每序列独立做病例内归一化(min-max 或分位数裁剪),而不是全局标准化。
  2. 进阶方法:仅在前列腺腺体内估计分位数(需要全腺体分割,官方提供 AI 派生版本),排除空气与肠道极值干扰。
  3. SOTA 方法:把 ADC 的绝对强度信息解耦——改用标准化后的相对强度,并引入扫描仪厂商/型号作为域标签做域自适应(如 DANN、CORAL),或训练时做强度增强以提升鲁棒性。
    参考:https://pi-cai.grand-challenge.org/DATA/

⚠️ 坑点 4:按 patient_id 划分却按 study_id 建模,或反之(分类:数据泄漏)

问题:PI-CAI 中同一患者可有多次检查,且不同检查的标签可能不同(官方文档举例:患者 11054 在 2018 年的检查为阴性、2020 年的检查为阳性)。若在划分时按 study 随机切分,同一患者的不同检查会跨越训练/测试;若在合并数据时按 patient 聚合标签,又会把阴性与阳性检查混为一谈。官方统计显示此类"同患者前后不一致"的情形在阴性病例中占比不足 1%,但一旦落入测试集,造成的评估偏倚远大于其比例。

症状:测试集指标明显高于交叉验证;模型在测试集上"记住"了某位患者的解剖特征;同一患者的两次检查预测高度一致但都错误。

解决:

  1. 简单方法:划分用 patient_id(GroupSplit),建模与评测用 study_id,字段分离不混用。
  2. 进阶方法:在 marksheet.csv 上统计每位患者的 study 数量,把"多次检查患者"单独列出做敏感性分析,确认其不主导指标。
  3. SOTA 方法:把"标签以 study 为单位独立确定"这一语义写进数据卡与论文方法学部分;若确实需要患者级结论,明确定义聚合规则(如任一 study 阳性即患者阳性)并与 study 级结果分别报告。
    参考:https://github.com/edupooch/picai_labels

⚠️ 坑点 5:直接使用 AI 派生标注训练,却用它做验证(分类:标签理解)

问题:csPCa_lesion_delineations/AI/Bosma22a/ 覆盖全部 1,500 例,看起来"标注齐全",但官方明示这些自动标注可能包含错误或分割缺陷(全腺体分割中的病例 11050_1001070 即被点名)。更严重的是,若你用 AI 标注训练、又用同一批病例的 AI 标注验证,等于在评估模型复现另一个模型的能力,而非真实病灶检测能力。2025-07 之前,425 例阳性中只有 220 例有人工专家标注,这一陷阱极易踩中。

症状:验证集 Dice/AP 虚高,但与官方排行榜或论文数字差距巨大;换用专家标注评估时性能骤降;不同随机种子间结果异常稳定(因为标签本身就是模型产物)。

解决:

  1. 简单方法:训练可以用 AI 标注(半监督设置),但验证与测试必须严格限定在专家标注病例上。
  2. 进阶方法:2025-07-01 后使用 human_expert/Pooch25/ 补齐的 205 例,使专家标注覆盖全部 1,500 例,可彻底摆脱对 AI 标注的依赖;若追求可复现的历史结果,则需明确记录所用的标注版本。
  3. SOTA 方法:采用半监督学习框架(如一致性正则、伪标签 + 置信度筛选、Mean Teacher),把 AI 标注作为"未标注样本的伪标签"而非真值,并在训练中动态评估伪标签质量。
    参考:https://github.com/DIAGNijmegen/picai_labels ;Bosma et al., 2022

⚠️ 坑点 6:病灶级标签为空不等于病例为阴性(分类:标签理解)

问题:公开集有 1,075 例"标签应为空或全 0",但其中包含两类情况:真正良性的病例,以及虽为阳性(csPCa)却未被勾画的病例。官方在 2025-07 之前明确说明:425 例阳性中只有 220 例有人工勾画,其余 205 例"尚未被标注"——它们的掩膜在人类专家目录下也是空的。若你把"空掩膜"一律当作阴性标签,会把约 205 例阳性误标为阴性,直接污染患者级诊断任务的监督信号。

症状:患者级分类的召回率异常低;模型倾向于判阴性;混淆矩阵中假阴性集中在特定 ID 区间;训练集统计出的阳性率(约 14%)低于官方公布的 28.3%。

解决:

  1. 简单方法:患者级标签不要从掩膜派生,而应使用 marksheet.csv 中的组织病理字段或官方提供的病例级标签。
  2. 进阶方法:区分"空掩膜 = 真阴性"与"空掩膜 = 未标注",可用 AI 派生标注(Bosma22a)作为"是否可能含病灶"的旁证,交叉核对这 205 例。
  3. SOTA 方法:采用正-未标注学习(PU learning)或噪声标签学习框架,显式建模"部分阳性未被标注"这一机制,而非假定标注完备。
    参考:https://pi-cai.grand-challenge.org/DATA/ ;https://github.com/DIAGNijmegen/picai_labels

⚠️ 坑点 7:忽视序列未共配准,直接按体素做多序列融合(分类:预处理陷阱)

问题:T2W、DWI、ADC 是分别采集的,分辨率与朝向各不相同,全语料 9,107 例中仅 54 例被人工共配准。若你直接按数组索引把三个序列堆叠成通道,实际上是把不同物理位置的体素当作同一位置——模型看到的是错位的解剖与扩散信息。

症状:多序列模型的性能反而不如单用 T2W;可视化时三个通道的解剖结构明显无法重合;模型对配准误差极度敏感,换一台机器重跑结果差异大。

解决:

  1. 简单方法:放弃严格的体素级共配准,改为"每序列独立重采样到统一 spacing 与尺寸"(官方 picai_prep 的默认做法),让三者在网格上对齐——注意这仍不等于解剖对齐。
  2. 进阶方法:在预处理中做刚性配准(DWI/ADC → T2W),可用 SimpleITK 的 ImageRegistrationMethod 或 ANTs;配准后必须重新检查病灶标注是否仍与影像吻合。
  3. SOTA 方法:训练模型容忍不对齐——如对每个序列独立编码后再融合(而非早期通道拼接)、引入空间注意力让模型自行学习对应关系、或对序列做随机空间抖动增强。
    参考:https://huggingface.co/datasets/MedOtter/PI-CAI ;https://pi-cai.grand-challenge.org/DATA/

⚠️ 坑点 8:把公开集当成代表性人群或临床基准(分类:偏倚陷阱)

问题:官方在 2026-07-13 的标注更新中明确声明:公开集系便利抽样(convenience sampling),不代表参与站点的标准诊疗水平,既不应据此推断临床实践,也不得用于对 AI 系统做基准标定。此外,队列为"疑似 csPCa"的富集人群,阳性率 28.3%,远高于真实筛查人群;厂商仅 Siemens 与 Philips 两家;人群以荷兰、挪威白人男性为主。这些特性使模型在此数据上的表现不能外推到其他人群、其他设备或筛查场景。

症状:论文中声称"AI 达到临床级性能"却被审稿人质疑;模型在真实筛查队列中阳性预测值崩塌(因患病率远低于 28%);非白人人群或 GE、Canon 设备上性能显著下降。

解决:

  1. 简单方法:在任何报告性能的句子中显式限定适用人群与设备范围,并引用官方声明说明本数据集非代表性样本。
  2. 进阶方法:用 scanner_manufacturer 等字段做分层评估,报告各子群性能而非只报总体;计算并报告在不同患病率假设下的 PPV/NPV(用贝叶斯重加权把 28.3% 调整到目标人群的患病率)。
  3. SOTA 方法:多队列外部验证 + 公平性审计——在 TCIA 等独立队列(如 Prostate-MRI-US-Biopsy)上验证,并按年龄、PSA 分层报告 AUROC,参照已有工作(如 Nature Communications 2025 报告的外部 AUC 0.93、TCIA 0.83)建立基线预期。
    参考:https://de.github.com/DIAGNijmegen/picai_labels ;https://www.nature.com/articles/s41467-025-66593-z

§6.6 数据增强:安全与危险

增强操作 判定 说明
随机翻转(左右/前后) ✅ 安全 前列腺解剖缺乏强方向先验;但左右翻转会改变病灶的左右叶归属,若任务涉及侧别定位需谨慎
随机旋转(±15° 内) ✅ 安全 需同步应用到影像与掩膜
随机缩放(0.85–1.15) ✅ 安全 模拟腺体大小差异;必须同步缩放掩膜
随机裁剪 / patch 采样 ✅ 安全 官方基线即采用 patch 训练;需要用滑窗推理还原全图
弹性形变(弱参数) ✅ 安全 模拟解剖变异;参数过强会破坏病灶形态
Gamma / 亮度对比扰动 ✅ 安全 有助于缓解跨中心强度差异,尤其对 ADC/DWI
高斯噪声 / 模糊 ✅ 安全 改善对采集噪声的鲁棒性
上下翻转(头脚翻转) ❌ 危险 破坏前列腺与精囊、膀胱、直肠的解剖方位关系,是强先验
沿 Z 轴强拉伸/压缩 ❌ 危险 破坏层厚物理意义;不同病例层厚本就不同,不应再人为放大
任意方向的强旋转(>45°) ❌ 危险 实际采集平面受限,训练分布外
对影像与掩膜应用不同变换 ❌ 危险 直接造成标签错位
MixUp / CutMix 作用于含病灶 patch ⚠️ 谨慎 在病灶级检测任务中,混合可能制造不存在的病灶与解剖组合,建议仅在患者级任务中使用

§6.7 模型推荐

模型 任务定位 相对优势 备注
nnU-Net 3D 分割/检测 官方基线之一,自配置能力强,社区复现最多 官方提供监督与半监督两版
nnDetection 3D 目标检测 官方基线之一,专为医学目标检测设计 官方称配置较复杂,但可提供强检测器
U-Net(3D) 快速原型 官方基线之一,训练快、结构简单 性能次优,适合打通流程
Mask R-CNN / 3D 检测器 病灶检测 实例级输出天然契合病灶级 AP 需自行处理 3D 与各向异性
Transformer(ViT/Swin 3D) 分割与分类 长程依赖建模,多序列融合潜力大 数据量 1,500 例下需强正则与预训练
多任务模型 检测 + 诊断联合 与官方排序指标 (AUROC+AP)/2 目标一致 可加临床变量分支提升患者级 AUC
GNN / 图方法 特征融合 社区后期排行榜出现图神经网络方案 多为论文自报告数字,未纳入官方评测,慎用

§6.8 硬件需求

场景 显存 内存 存储 说明
流程验证(单例推理) 4 GB 8 GB ~5 GB 官方 Docker 解压示例使用 --memory=8gb
预处理(全量 5 折) 不占显存 16 GB 30–60 GB 官方预处理示例使用 --memory=16gb;需容纳原始 + 重采样数据
3D U-Net patch 训练 12–16 GB 32 GB 80 GB+ batch size 2、patch 20×256×256 量级
nnU-Net / nnDetection 全量训练 16–24 GB 64 GB 150 GB+ 官方用 5 折训练;建议 SSD 存放影像
多折并行(5 折同时) 80 GB+ 或多卡 128 GB 300 GB+ 生产级复现配置

§6.9 评估指标代码

官方评估库 picai_eval 实现了挑战赛的完整指标体系。核心公式:

  • 患者级诊断:AUROC(病例级似然的 ROC 曲线下面积)
  • 病灶级检测:AP(Average Precision,由精确率-召回率曲线下面积定义)
  • 官方排序总分:(AUROC + AP) / 2
  • 次要分析:FROC 曲线与 SensX(在医师 PI-RADS ≥ X 工作点的假阳性水平下,AI 的敏感度)
from picai_eval import evaluate

# y_det: 预测的 3D 检测图(每例一个连通域 = 一个病灶,域内体素取值相同)
# y_true: 真值掩膜(病灶体素为 1,背景为 0,与检测图同尺寸)
metrics = evaluate(
    y_det=y_det,
    y_true=y_true,
    subject_list=subject_list,
    min_overlap=0.1,        # 判定 TP 所需的最小重叠(默认 IoU 0.1,与官方一致)
    overlap_func="IoU",     # 可选 "DSC" 或自定义函数
    case_confidence="max",  # 由病灶级置信度导出病例级置信度(默认取最大值)
)

print(f"AUROC = {metrics.auroc:.3f}")
print(f"AP    = {metrics.AP:.3f}")
print(f"官方总分 = {(metrics.auroc + metrics.AP) / 2:.3f}")

直接对全测试集做统计检验(AI vs AI / AI vs 医师):

import numpy as np
from picai_eval import evaluate

def permutation_test_auroc(y_det_a, y_det_b, y_true, n_perm: int = 1000, seed: int = 42):
    """双侧置换检验:比较两个模型的 AUROC 是否存在差异。

    做法:在病例层面随机交换两组预测的归属,重算 AUROC 差值的零分布。
    """
    rng = np.random.default_rng(seed)
    auc_a = evaluate(y_det=y_det_a, y_true=y_true).auroc
    auc_b = evaluate(y_det=y_det_b, y_true=y_true).auroc
    observed = auc_a - auc_b

    n = len(y_true)
    null = []
    for _ in range(n_perm):
        swap = rng.random(n) < 0.5
        perm_a = [a if s else b for a, b, s in zip(y_det_a, y_det_b, swap)]
        perm_b = [b if s else a for a, b, s in zip(y_det_a, y_det_b, swap)]
        null.append(evaluate(y_det=perm_a, y_true=y_true).auroc
                    - evaluate(y_det=perm_b, y_true=y_true).auroc)

    p_value = float(np.mean(np.abs(null) >= abs(observed)))
    return observed, p_value

§6.10 MLOps 笔记

环节 建议 理由
数据版本 记录影像 ZIP 的校验和与 picai_labels 的 commit hash 标注仓库在 2025-07 与 2026-07 两次更新,不锁版本则结果不可复现
预处理缓存 把重采样后的数组存为 .npy/.npz 或 nnU-Net 格式 每次训练现场重采样 27.6 GB 数据的代价过高
划分固化 导出官方 5 折划分到磁盘并纳入版本控制 避免不同运行间划分漂移;也便于命令行评估工具校验病例覆盖
评估口径 始终报告 AUROC、AP 与总分三者,并注明重叠阈值 只报一个指标无法与排行榜对齐;重叠阈值不同结果不可比
不确定性 用 bootstrap 或置换检验给出置信区间 测试集 1,000 例中阳性约 283 例,单点估计误差不可忽略
提交容器 容器必须完全离线、自包含权重与预处理逻辑 官方规则明确禁止运行时联网下载
实验追踪 记录扫描仪厂商/型号分布与缺失率 这些是最可能的域偏移来源,事后排查依赖此记录

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解方式
选择偏倚 队列为"疑似 csPCa"的回顾性便利抽样(PSA 升高或 DRE 异常),排除既往治疗或 ISUP ≥ 2 病史者 高 报告时明确限定适用人群;真实筛查场景需重新校准阈值
患病率偏倚 阳性率 28.3%,远高于真实筛查人群 高 用贝叶斯重加权把 PPV/NPV 折算到目标患病率
地理/族裔偏倚 仅荷兰(3 中心)与挪威(1 中心),以白人男性为主 高 跨种族、跨地区外部验证;报告分层性能
设备偏倚 仅 Siemens Healthineers 与 Philips Medical Systems 两家厂商 中高 在 GE/Canon/联影等设备上做外部验证;域自适应
中心偏倚 测试集 1,000 例中外部未见中心仅 197 例(约 20%) 中 单独报告内部/外部测试结果
验证偏倚 活检由原始影像与判读引导,阴性病例靠随访确认 中 官方已用 ≥ 3 年随访 + PALGA 登记缓解;报告时说明残留风险
标注偏倚 标注者间一致性未量化;205 例阳性直到 2025 年才有专家勾画 中 使用 Pooch25 版本;对关键结论做标注来源敏感性分析
阅片者偏倚 常规实践阅片混合 PI-RADS v1/v2.0/v2.1 三个版本 中 引用时注明该限制;不把 0.86 视为单一评分体系下的成绩

§7.2 标注质量

  • 优势:参考标准采用组织病理(ISUP ≥ 2 阳性)+ 影像/随访确认阴性的双重证据,隐藏队列另加 ≥ 3 年随访,在同类数据集中属严谨水平;全部病例最终的专家标注在 2025-07 后已完整覆盖。
  • 局限:官方未公布标注者间一致性指标;原始标注的空间分辨率依标注者与中心而异(有的在 T2W 网格,有的在 ADC/DWI 网格);病灶级标注仅覆盖 csPCa,未标注良性结节与其他病变。
  • 实际影响:病灶级任务对标注噪声最敏感,AP 的绝对值会受标注完整性与重叠判定影响;因此跨数据集比较 AP 数值意义有限,宜在同一数据集的同一划分内比较。

§7.3 泛化性评估

场景 失效风险 证据
换用未参与训练的厂商(GE、Canon、联影等) 高 训练与测试均仅含 Siemens 与 Philips 两家;ADC/DWI 强度高度依赖厂商与协议
应用于真实筛查人群(患病率远低于 28%) 高 队列为疑似 csPCa 富集人群;官方称公开集系便利抽样、不具代表性
应用于非白人族裔人群 高 队列以荷兰、挪威人群为主,官方文档未细分组裔
换用不同 b 值协议(如 b=1500 vs b=2000) 中高 ADC 绝对值随 b 值数量与取值变化,官方数据页明确警示
外部未见中心(如挪威 STOH) 中 测试集含 197 例外部中心病例;论文报告整体性能良好,但外部子集规模有限
其他独立队列(如 TCIA Prostate-MRI-US-Biopsy) 中 有研究报告 PI-CAI 训练模型在该队列上 AUC 为 0.83,低于其外部测试的 0.93
同中心未见病例(内部测试) 低 1000 例测试集的主体即此类,性能与论文一致
与常规多学科临床路径对比 中高 非劣效性未被确认(特异度 68.9% vs 69.0%,CI 下界 −0.04 大于界值 −0.05)
前瞻性/真实世界部署 高 论文结论明确要求前瞻性验证;尚无前瞻性随机证据

§7.4 伦理与合规

  • 伦理审批:四个参与中心的机构审查委员会(IRB)均豁免了患者知情同意,理由是回顾性使用匿名化临床数据。
  • 隐私保护:全部影像与临床数据完全匿名化;患者与检查标识替换为匿名 ID;日期已做匿名化处理;不发布任何自由文本病历。
  • 使用限制:CC BY-NC 4.0 明确禁止商业用途;隐藏调优与测试队列不公开,只能通过官方平台间接评测。
  • 临床转化:论文结论明确要求前瞻性验证后方可临床部署;任何基于本数据集的模型宣称"可用于临床"都缺乏充分证据。
  • 公平性:队列的地域与族裔单一性构成公平性风险,见 §7.5。

§7.5 公平性

PI-CAI 的公平性风险集中于人群构成单一与设备覆盖有限两点。评测时建议至少做两项分层:

  1. 按 scanner_manufacturer / scanner_model_name 分层报告 AUROC 与 AP。
  2. 按 patient_age 与 psa 分层报告,识别是否存在对高龄或低 PSA 人群的系统性漏诊。

由于官方文档未提供族裔标签,种族维度的公平性评估在当前版本中无法进行,这本身是一项应被明确记录的局限。后续研究(如 Nature Communications 2025 的多族裔研究方案)正是为填补这一空白。

§7.6 数据漂移

漂移来源 表现 应对
时间漂移 采集跨 2012–2021 年,协议与设备在十年间演进 用 mri_date 做时间分层;避免用早期数据训练的模型直接评估晚期病例
标注版本漂移 picai_labels 在 2025-07 与 2026-07 两次更新 锁定 commit hash;在论文中说明所用标注版本
协议漂移 各中心 b 值、层厚、场强不一致 逐例读取 diffusion_high_bvalue 并纳入协变量或做分层评估
临床路径漂移 指南更新导致穿刺阈值变化(如 PI-RADS 3 的处理策略) 关注标签定义的时间一致性;在方法学中说明

§7.7 DAIMS 24 项评估

# 检查项 状态 说明
1 宽格式/长格式一致性 ✅ 影像为逐序列独立文件,标注为逐病例 3D 掩膜,结构统一
2 唯一标识符 ✅ patient_id + study_id 双主键,命名规则 {patient_id}_{study_id}_{seq} 一致
3 特殊字符处理 ✅ ID 为纯数字字符串,文件名不含空格与特殊字符
4 重复行检查 ✅ marksheet.csv 以 study_id 唯一;官方 5 折划分保证患者不重叠
5 缺失编码一致性 ⚠️ 采用空值表示缺失,未使用统一哨兵编码;各字段语义需查文档
6 标签标识清晰 ✅ 掩膜体素值 0–5 对应 ISUP ≤ 1 至 ISUP 5,官方给出明确映射表
7 罕见类分组建议 ⚠️ ISUP 4/5 病例数较少但未提供分组建议;二分类(≥ 2)相对稳健
8 偏倚评估 ⚠️ 官方声明便利抽样不具代表性,但未提供量化的偏倚分析
9 数据字典 ✅ 官方 README 与 marksheet.csv 提供字段释义与单位
10 信息性缺失解释 ⚠️ 文档说明"缺失=未报告",但未量化缺失率与缺失模式的信息性
11 设备记录 ✅ 逐例记录扫描仪厂商、型号与扩散 b 值
12 共线性检查 ⚠️ PSA 密度与 PSA、前列腺体积存在代数共线,未提供处理建议
13 编码映射(ICD/SNOMED) ⚠️ 标签为 ISUP/Gleason 体系,未提供 ICD-11/SNOMED 官方映射
14 时间戳处理 ⚠️ mri_date 为匿名化日期,仅保留相对顺序,不可还原真实时间
15 划分建议 ✅ 官方提供 5 折划分(全量与有标注子集两套),保证患者不重叠
16 泄漏讨论 ✅ 官方明确提示与 PROSTATEx 的包含关系并建议不要叠加使用
17 标签分布报告 ✅ 官方公布 1,075 阴性 / 425 阳性(71.7% / 28.3%)
18 测量偏倚评估 ⚠️ 参考标准混合组织学与影像学证据;活检取样误差与验证偏倚已有讨论
19 外部验证建议 ✅ 测试集含 197 例未见中心病例;社区有 TCIA 外部验证实例
20 版本记录 ✅ Zenodo DOI 固定,picai_labels 提供明确的更新日志(2025-07、2026-07)
21 预处理脚本 ✅ 官方 picai_prep 与 picai_baseline 提供端到端预处理与训练脚本
22 合规要求 ✅ CC BY-NC 4.0,四中心 IRB 豁免知情同意,文档完整披露
23 多模态对齐 ⚠️ 影像、临床变量、标注均以 study_id 关联;但影像序列间未共配准(仅 54/9,107 人工配准)
24 去标识化 ✅ 全部数据匿名化,ID 替换、日期匿名化,不含自由文本与直接标识符

DAIMS 评分:16.5 / 24

评分解读:良好(可立即用于研究,但需自行补齐若干工程约定)。PI-CAI 在"数据可获取性、官方划分、预处理与评估工具链、版本可追溯"这几个对 AI 复现最关键的维度上表现优异(15 个 ✅ 全部集中于此),这使它在影像 AI 数据集中属于第一梯队。扣分集中在未提供显式约定的元数据细节:缺失编码不统一、无官方 ICD/SNOMED 映射、时间戳被匿名化、偏倚分析定性而非定量、序列未共配准。

对你意味着什么:拿到 PI-CAI 后,你不需要从零搭建流水线——直接用官方 5 折划分、picai_prep 预处理、picai_eval 评测即可。但你需要自己补三件事:其一,把缺失值策略写进数据卡(不要默认缺失随机);其二,明确标注版本(若用 2025-07 之前的版本,205 例阳性没有专家勾画,患者级标签必须另取来源);其三,把多序列对齐方案写清楚(官方既不提供共配准影像,也不保证体素级对应)。做完这三件事,这份数据集的 AI 就绪度实际上接近 5 分。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
PI-CAI 隐藏测试集(1000 例,含 197 例外部中心) 荷兰 3 中心 + 挪威 1 中心 患者级 csPCa 诊断 AI 集成 AUROC 0.91(95% CI 0.87–0.94) 与 62 名医师 0.86 相比显著更优(p<0.0001) 内部未见病例 + 部分外部中心;常规临床路径对比非劣效性未确认
PI-CAI 隐藏测试集(封闭测试阶段,前 5 名算法重训后) 同上 患者级诊断 + 病灶级检测 官方总分 = (AUROC + AP)/2 — 组织方用 9,207 例(公开 + 私有)重训,统计检验后公布前三名
TCIA Prostate-MRI-US-Biopsy The Cancer Imaging Archive 患者级 csPCa 诊断 AUC 0.83 低于其外部测试的 0.93 独立队列上的泛化缺口约 10 个百分点
多中心真实世界前瞻性队列(1978 例连续检查) 中国多中心(ProAI 系统,Nature Communications 2025) 患者级 csPCa 诊断 AUC 0.92,放射科工作量降低 32% 与其开发集性能持平 证明自动化决策支持可维持性能并降低工作量;但该系统非 PI-CAI 参赛模型

说明:表中仅收录有同行评审支撑的结果。PI-CAI 的隐藏测试集不对公众开放,因此所有非参赛方报告的性能都不可能与论文数字严格可比;跨数据集比较时必须同时说明人群、设备与参考标准的差异。


§8 基准性能与生态

§8.1 排行榜

PI-CAI 的最终排名在封闭测试阶段产生:组织方用公开集(1,500 例)+ 私有隔离集(7,607 例)共 9,207 例重训各队提交的算法,再在 1,000 例隐藏测试队列上重新评测。下表列出有公开记录的关键结果。

排名 模型 性能 年份 关键技术 完整引用 代码
1(冠军) Guerbet Research 参赛算法 冠军(封闭测试阶段) 2023 未在挑战赛文档中详细披露 Guerbet. Guerbet wins PI-CAI Grand Challenge on detection of prostate cancer. 企业新闻稿, 2023-07-17. https://www.guerbet.com/news/guerbet-wins-pi-cai-grand-challenge-detection-prostate-cancer 未公开
前 5(集成) PI-CAI 集成系统(5 模型等权) AUROC 0.91(95% CI 0.87–0.94) 2024 5 个顶尖算法的等权集成;bpMRI 输入 Saha A, Bosma JS, Twilt JJ, et al. Lancet Oncol 2024;25(7):879–887. DOI 10.1016/S1470-2045(24)00220-1 各队提交容器,未统一开源
7(封闭测试最终) PIMed-Stanford(隐私 + 公开训练) AUROC 0.900 / AP 0.659 / 总分 0.779;Sens3 0.776 2025 在私有 + 公开数据上训练 PI-CAI Challenge Closed Testing Phase — Testing Leaderboard, grand-challenge.org. https://grand-challenge.org/algorithms/pi-cai-pubpriv-pimed 未公开
基线 nnDetection(半监督) AUROC 0.874 / AP 0.546 / 总分 0.710 2022 官方 nnDetection 基线 + AI 派生标注 DIAGNijmegen. Baseline AI Models for Prostate Cancer Detection in MRI. https://github.com/DIAGNijmegen/picai_baseline GitHub(开源)
基线 nnU-Net(半监督)/ U-Net(半监督) 低于 nnDetection 基线 2022 官方分割基线 同上 GitHub(开源)
社区论文(非官方评测) MAPI-GNN 自报告 AUC 98.38(5 折交叉验证) 2025 多激活平面交互图神经网络 MAPI-GNN: Multi-Activation Plane Interaction Graph Neural Network for Multimodal Medical Diagnosis(论文自报告) 见论文

数值不可直接比较的原因:官方排行榜数字来自隐藏测试集(1000 例)上的统一评测,而社区论文的数字多来自公开集 5 折交叉验证的自报告结果,两者在病例集合、重叠阈值、病例级置信度聚合函数上均可能不同。因此上表中 MAPI-GNN 一类的结果不能与论文的 AUROC 0.91 直接对比。任何声称超越 SOTA 的工作都应通过 grand-challenge.org 的官方评测通道验证。

§8.2 SOTA 总结与选型建议

  • 要复现论文级数字:必须走官方评测通道;本地无法访问 1,000 例隐藏测试集。
  • 本地开发的合理目标:在官方 5 折的验证集上,nnDetection 半监督基线是明确的参照线(官方总分 0.710 量级)。若你的模型在验证集总分显著低于此,应优先排查数据管线而非模型结构。
  • 选型建议:以检测任务为主选 nnDetection 或 3D 检测器;以分割为主选 nnU-Net;以患者级诊断为主可用分类网络 + 临床变量融合。多任务联合(检测 + 诊断)与官方排序指标的目标最一致。
  • 提升方向的优先级:从坑点分析看,收益最大的通常不是换更深的网络,而是(1)正确的患者级标签来源,(2)序列对齐与 ADC 强度标准化,(3)验证集严格限定在专家标注病例上,(4)充分利用未标注/弱标注病例做半监督。

§8.3 评测协议

要素 官方规定
患者级指标 AUROC
病灶级指标 AP(平均精度)
官方排序指标 (AUROC + AP) / 2
次要分析 FROC 曲线与 SensX(在医师 PI-RADS ≥ X 工作点的假阳性水平下 AI 的敏感度)
TP 判定 病灶候选与真值病灶的重叠度 ≥ 最小阈值(默认 IoU 0.1,可改 DSC)
病例级置信度 由病灶级置信度导出(默认取最大值)
连通性定义 3×3×3 邻域内与中心体素相连(26 连通)
输出格式 检测图须与对应 T2W 影像同尺寸同分辨率;病例级似然为 [0,1] 浮点
统计检验 置换检验与自助法,支持 AI vs AI / AI vs 医师比较
提交形式 完全自动的 Docker 容器,离线运行(不允许联网)
数据集 关系 说明
PROSTATEx 前代基准 / 已被纳入 346 例 mpMRI;其全部病例(含训练与测试)已并入 PI-CAI 公开集(328 例)。作为独立基准已被弃用
PROSTATEx-2 同源 专注 PI-RADS 5 级分级任务
Prostate-MRI-US-Biopsy 外部验证队列 TCIA 托管,含 MRI-超声融合活检靶点;常用于 PI-CAI 模型的外部验证
PANDA 互补基准 10,616 例前列腺病理全切片,Gleason 分级任务;与 PI-CAI 常并列使用
TCGA-PRAD 互补资源 前列腺腺癌基因组与病理数据,用于分子层面研究

§8.5 关键论文

  1. Saha A, Bosma JS, Twilt JJ, van Ginneken B, Bjartell A, Padhani AR, Bonekamp D, Villeirs G, Salomon G, Giannarini G, Kalpathy-Cramer J, Barentsz J, Maier-Hein KH, Rusu M, Rouvière O, van den Bergh R, Panebianco V, Kasivisvanathan V, Obuchowski NA, Yakar D, Elschot M, Veltman J, Fütterer JJ, de Rooij M, Huisman H, and the PI-CAI consortium. “Artificial intelligence and radiologists in prostate cancer detection on MRI (PI-CAI): an international, paired, non-inferiority, confirmatory study.” The Lancet Oncology, 2024, 25(7): 879–887. DOI: 10.1016/S1470-2045(24)00220-1。贡献:挑战赛的权威结果论文,报告 AI 集成 AUROC 0.91 vs 62 名医师 0.86,是本文档全部基准数字的最终出处。

  2. Saha A, Twilt JJ, Bosma JS, et al. “The PI-CAI Challenge: Public Training and Development Dataset.” Zenodo, 2022. DOI: 10.5281/zenodo.6624726。贡献:公开数据集的正式记录,定义了 1,500 例样本构成、CC BY-NC 4.0 许可与 5 折发布方式。

  3. Pooch EHP, et al. 2025(通过 picai_labels 仓库发布)。贡献:补齐 205 例此前仅有 AI 标注的阳性病例的人类专家勾画,使 1,500 例全部具备专家标注,是本数据集标注质量的关键升级。

  4. Bosma JS, Saha A, Hosseinzadeh M, et al. “Semi-supervised learning with CsPCa detection” (Bosma et al., 2022a/2022b)。贡献:提供全部 1,500 例的 AI 派生病灶标注与前列腺全腺体分割,是半监督基线的数据基础。

  5. Eklund M. “Artificial intelligence for scoring prostate MRI: ready for prospective evaluation.” The Lancet Oncology, 2024. DOI: 10.1016/S1470-2045(24)00284-5。贡献:对 PI-CAI 结果的同期评论,指出测试队列异质性有限、潜在验证偏倚与高级别癌结局缺失等限制。

  6. Benndorf M, Oerther B. “Beyond the AJR: Large-Scale Evidence for Good Diagnostic Accuracy of Automated Artificial Intelligence–Based Prostate MRI Interpretation Calls for Prospective Evaluation.” AJR Am J Roentgenol, 2025, 224(4). DOI: 10.2214/AJR.24.31860。贡献:独立评论,量化说明测试集构成(1,000 例、400 例阅片子集、62 名阅片者)并强调前瞻性验证的必要性。

  7. Twilt JJ, Saha A, Bosma JS, Giannarini G, Padhani AR, Yakar D, Elschot M, Veltman J, Fütterer JJ, Huisman H, de Rooij M; PI-CAI Consortium. “Evaluating an AI-driven Triaging Workflow for MRI-based Clinically Significant Prostate Cancer Diagnosis: A Simulation Study.” Radiology: Imaging Cancer, 2026, 8(3): e250461. DOI: 10.1148/rycan.250461。贡献:将 PI-CAI 的 AI 系统置于分诊工作流中做模拟评估,是把基准结果推向临床流程的关键后续研究。

  8. Sunoqrot MRS, Saha A, Hosseinzadeh M, Elschot M, Huisman H. “Artificial Intelligence for Prostate MRI: Open Datasets, Available Applications, and Grand Challenges.” European Radiology Experimental, 2022. DOI: 10.1186/s41747-022-00288-8。贡献:系统梳理前列腺 MRI 的公开数据集与应用,是理解 PI-CAI 在生态中位置的重要综述。

  9. Turkbey B, Rosenkrantz AB, Haider MA, et al. “Prostate Imaging Reporting and Data System Version 2.1: 2019 Update of Prostate Imaging Reporting and Data System Version 2.” European Urology, 2019, 76(3): 340–351。贡献:PI-RADS v2.1 的规范定义,是理解本数据集临床任务与医师对照表现的前提。

  10. Ronneberger O, Fischer P, Brox T. “U-Net: Convolutional Networks for Biomedical Image Segmentation.” MICCAI, 2015;以及 Isensee F, et al. “nnU-Net: a self-configuring method for deep learning-based biomedical image segmentation.” Nature Methods, 2021, 18: 203–211。贡献:官方基线所采用的两个核心网络架构的原始文献,是复现基线的必要背景。

§8.6 社区活跃度

  • 持续基准化:PI-CAI 已从一次性挑战赛演进为持续运行的基准平台(pi-cai.org),官方称其社区覆盖 15+ 国家、50+ 数据中心、60+ 放射科医师。
  • 镜像与衍生分发:Hugging Face 上存在第三方镜像(MedOtter/PI-CAI),近一个月下载量 24,610 次,显示稳定的使用需求。
  • 工具链维护:picai_baseline、picai_prep、picai_eval 均有独立的 PyPI 包与活跃维护记录(picai-eval 最新版 1.4.13,2025-01-16 发布)。
  • 标注持续更新:picai_labels 在 2025-07 与 2026-07 两次重要更新,说明标注侧仍在被主动维护。
  • 学术影响:论文 FWCI 高达 96.8,被引 259+(Synapse 快照),Semantic Scholar 收录 105 次施引;衍生研究覆盖外部验证、多族裔扩展、工作流分诊等方向。

§8.7 生态快照

资源 类型 链接 Star / 活跃度(截至 2026-09) 推荐理由
picai_baseline 官方基线代码 https://github.com/DIAGNijmegen/picai_baseline 官方维护,含 U-Net/nnU-Net/nnDetection 复现基线与搭建提交容器的起点
picai_labels 官方标注仓库 https://github.com/DIAGNijmegen/picai_labels 66 stars / 28 forks 全部标注与临床信息的唯一官方来源
picai_prep 预处理工具 https://pypi.org/project/picai-baseline 随 picai_baseline 一并安装 转换为 nnU-Net 格式,含重采样逻辑
picai_eval 官方评估库 https://pypi.org/project/picai-eval/ 最新版 1.4.13(2025-01-16) 与排行榜完全一致的指标实现
PI-CAI 挑战赛主页 官方文档 https://pi-cai.grand-challenge.org/ 常年维护 数据、规则、提交接口的权威说明
PI-CAI 持续基准平台 官方倡议 https://pi-cai.org/ 15+ 国家 / 50+ 数据中心 了解后续基准演进与协作网络
Zenodo 数据集记录 数据托管 https://zenodo.org/record/6624726 DOI 固定 唯一官方影像下载源
Hugging Face 镜像 社区镜像 https://huggingface.co/datasets/MedOtter/PI-CAI 月下载 24,610 便于快速取用,但需自行核对与官方版本一致

§9 相关资源与引用

§9.1 官方资源

§9.2 教程与文档

§9.3 引用指南

若使用 PI-CAI 的影像、标注、模型或基准结果,官方要求引用挑战赛的结果论文:

@article{saha2024picai,
  title   = {Artificial intelligence and radiologists in prostate cancer detection on MRI (PI-CAI):
             an international, paired, non-inferiority, confirmatory study},
  author  = {Saha, Anindo and Bosma, Joeran S and Twilt, Jasper J and van Ginneken, Bram and
             Bjartell, Anders and Padhani, Anwar R and Bonekamp, David and Villeirs, Geert and
             Salomon, Georg and Giannarini, Gianluca and others},
  journal = {The Lancet Oncology},
  volume  = {25},
  number  = {7},
  pages   = {879--887},
  year    = {2024},
  doi     = {10.1016/S1470-2045(24)00220-1}
}

若仅使用公开训练与开发数据集,建议同时引用数据集记录:

@dataset{picai_public_training_2022,
  title     = {The PI-CAI Challenge: Public Training and Development Dataset},
  author    = {Saha, Anindo and Twilt, Jasper J and Bosma, Joeran S and others},
  year      = {2022},
  publisher = {Zenodo},
  doi       = {10.5281/zenodo.6624726},
  url       = {https://doi.org/10.5281/zenodo.6624726}
}

若使用了 2025 年补齐的 205 例专家标注,官方要求额外引用 Pooch et al., 2025(详见 picai_labels 仓库 README)。


§10 AI 使用声明卡

§10.1 使用的 AI 模型

本条目由千方病案医学编辑部使用大语言模型辅助撰写,工作流包括:公开资料检索、事实清单整理、初稿生成、格式规范校验。全部事实性内容(规模数字、日期、许可证、性能指标、引用信息)均以官方文档与同行评审文献为准,并逐条保留来源链接,见 §10.3。

§10.2 AI 参与范围

环节 参与方式 说明
资料检索 AI 辅助 按挑战赛官方主页、Zenodo 记录、GitHub 仓库、期刊论文四类来源检索
事实清单 AI 生成 + 人工核对 每条事实附来源 URL,规模与日期数字须与官方页面一致
章节初稿 AI 生成 §1–§10 的叙述性文字与表格
代码示例 AI 生成 + 人工审阅 §6 的预处理、DataLoader、评估代码;以官方 picai_baseline/picai_eval 文档为准
坑点提炼 AI 综合 + 人工审阅 从官方文档警告、仓库 README、评论文章中提取真实失败模式
格式校验 自动化脚本 由 scripts/check_md.py 校验结构、行数、词表与纯净度
最终审定 人工 千方病案医学编辑部复核全部事实与表述

§10.3 输入来源列表

  1. Saha A, Bosma JS, Twilt JJ, van Ginneken B, Bjartell A, Padhani AR, et al. Artificial intelligence and radiologists in prostate cancer detection on MRI (PI-CAI): an international, paired, non-inferiority, confirmatory study. The Lancet Oncology. 2024;25(7):879–887. DOI: 10.1016/S1470-2045(24)00220-1
  2. Saha A, Twilt JJ, Bosma JS, et al. The PI-CAI Challenge: Public Training and Development Dataset. Zenodo. 2022. DOI: 10.5281/zenodo.6624726
  3. PI-CAI Challenge. Data Splits (Datasets: Imaging, Labels). https://pi-cai.grand-challenge.org/DATA/
  4. PI-CAI Challenge. Overview & Goals. https://pi-cai.grand-challenge.org/
  5. PI-CAI Challenge. AI: Phases, Rules. https://pi-cai.grand-challenge.org/AIPR/
  6. PI-CAI Challenge. AI: Algorithm Submissions. https://pi-cai.grand-challenge.org/ai-algorithm-submissions
  7. DIAGNijmegen. picai_labels: Annotations for the PI-CAI Challenge. https://github.com/DIAGNijmegen/picai_labels
  8. DIAGNijmegen. picai_baseline: Baseline AI Models for Prostate Cancer Detection in MRI. https://github.com/DIAGNijmegen/picai_baseline
  9. DIAGNijmegen. picai_eval: Evaluation Utilities for 3D Detection and Diagnosis in Medical Imaging. https://github.com/DIAGNijmegen/picai_eval
  10. picai-eval 1.4.13. PyPI. https://pypi.org/project/picai-eval/
  11. ClinicalTrials.gov. Artificial Intelligence and Radiologists at Prostate Cancer Detection in MRI: The PI-CAI Challenge. NCT05489341. https://clinicaltrials.gov/study/NCT05489341
  12. Benndorf M, Oerther B. Beyond the AJR: Large-Scale Evidence for Good Diagnostic Accuracy of Automated Artificial Intelligence–Based Prostate MRI Interpretation Calls for Prospective Evaluation. AJR Am J Roentgenol. 2025;224(4). DOI: 10.2214/AJR.24.31860
  13. Eklund M. Artificial intelligence for scoring prostate MRI: ready for prospective evaluation. The Lancet Oncology. 2024. DOI: 10.1016/S1470-2045(24)00284-5
  14. de Rooij M, et al. MRI, Prostate cancer diagnosis, and Artificial Intelligence; What are the implications? BJUI. DOI: 10.1111/bju.16540
  15. Guerbet. Guerbet wins PI-CAI Grand Challenge on detection of prostate cancer. 2023-07-17. https://www.guerbet.com/news/guerbet-wins-pi-cai-grand-challenge-detection-prostate-cancer
  16. PI-CAI: a landmark AI study for prostate cancer detection on MRI. European Radiology. DOI: 10.1007/s00330-025-11454-y
  17. MedOtter. PI-CAI: Prostate Imaging - Cancer AI Challenge (Public Training & Development). Hugging Face. https://huggingface.co/datasets/MedOtter/PI-CAI
  18. Twilt JJ, Saha A, Bosma JS, et al. Evaluating an AI-driven Triaging Workflow for MRI-based Clinically Significant Prostate Cancer Diagnosis: A Simulation Study. Radiol Imaging Cancer. 2026;8(3):e250461. DOI: 10.1148/rycan.250461
  19. Sunoqrot MRS, Saha A, Hosseinzadeh M, Elschot M, Huisman H. Artificial Intelligence for Prostate MRI: Open Datasets, Available Applications, and Grand Challenges. European Radiology Experimental. DOI: 10.1186/s41747-022-00288-8
  20. Turkbey B, Rosenkrantz AB, Haider MA, et al. Prostate Imaging Reporting and Data System Version 2.1: 2019 Update of PI-RADS Version 2. European Urology. 2019;76(3):340–351
  21. Automated MRI system for clinically significant prostate cancer detection, development, validation and real-world implementation. Nature Communications. 2025. DOI: 10.1038/s41467-025-66593-z

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§0 审核声明与免责声明 千方病案医学编辑部 规范逐条比对 ✅ 已通过
§1 概览与横向对比 千方病案医学编辑部 与官方数据页及论文交叉核对 ✅ 已通过
§2 医学背景与编码映射 千方病案医学编辑部 医学编辑复核 ICD-11/SNOMED CT 映射 ✅ 已通过
§3 数据集规格 千方病案医学编辑部 与官方数据页逐项比对 ✅ 已验证
§4 DAIMS 数据字典 千方病案医学编辑部 与 picai_labels 字段说明逐项比对 ✅ 已通过
§5 数据划分策略 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与坑点 千方病案医学编辑部 逻辑审查 + 与官方仓库文档比对 ✅ 已通过
§7 质量评估与 DAIMS 评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 排行榜与引用数表述 千方病案医学编辑部 与原文及学术快照交叉比对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。

§10.6 最后审核

本条目最后一次人工审核日期为 2026-09-05,与 §0.1 审核声明一致。审核范围包括全部事实性数字、代码示例的可运行性、引用完整性以及本文档的结构规范符合性。

页面状态:published(全部内容已完成审核并发布)



相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • atlas-liver-tumor — 共享标签:医学影像 / MRI / 肿瘤学 / 挑战赛数据集
  • promise12 — 共享标签:医学影像 / MRI / 肿瘤学 / 挑战赛数据集
  • prostatex — 共享标签:医学影像 / MRI / 肿瘤学 / 挑战赛数据集
  • chimera — 共享标签:医学影像 / MRI / 肿瘤学 / 挑战赛数据集
  • trackrad — 共享标签:医学影像 / MRI / 肿瘤学 / 挑战赛数据集
  • 3dteethland — 共享标签:医学影像 / 挑战赛数据集 / 目标检测
  • midog — 共享标签:医学影像 / 肿瘤学 / 目标检测
  • duke-breast-mri — 共享标签:医学影像 / MRI / 肿瘤学
  • ucsf-pdgm — 共享标签:医学影像 / MRI / 肿瘤学
  • fets — 共享标签:医学影像 / MRI / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集