信息速览

ACROBAT — 乳腺癌多染色 WSI 配准基准 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | ACROBAT |
| 英文全称 | AutomatiC Registration Of Breast cAncer Tissue |
| 别名/简称 | ACROBAT 2022 挑战数据集、ACROBAT 2023 挑战数据集 |
| 疾病分类 | ICD-11 2C60 乳腺恶性肿瘤(Breast carcinoma) |
| SNOMED CT | 254837009(Malignant tumour of breast,乳腺恶性肿瘤) |
| 数据模态 | 病理全切片图像(WSI:H&E + IHC 多染色) |
| AI 任务类型 | 多染色 WSI 配准、标注转移、stain-guided 学习、虚拟染色、无监督预训练 |
| 样本总数 | 4,212 张 WSI(来自 1,153 例患者) |
| 数据大小 | 约 482 GB(7 个 ZIP 分包,SHA1 校验) |
| 数据格式 | 金字塔 TIFF(generic tiled,OpenSlide 兼容) |
| 许可证 | CC-BY |
| 访问级别 | 开放(无需注册或申请) |
| DUO 标签 | NRES(无限制使用) |
| 语言 | 英语(文档、元数据与标注协议) |
| 首发日期 | 2022-04(ACROBAT 2022 挑战启动) |
| 最后更新 | 2023-08(Sci Data 数据集描述论文发表,SND Version 1 定稿) |
| 发布机构 | Karolinska Institutet(联合 University of Turku / Tampere University、ABCAP 联盟) |
| 官方主页 | https://acrobat.grand-challenge.org/ |
| 下载地址 | https://researchdata.se/en/catalogue/dataset/2022-190-1 |
| DOI | 10.48723/w728-p041(数据集);论文 doi:10.1038/s41597-023-02422-6 |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 官方三划分 + 验证集公开 landmark 与自动评估器,开箱即用;扣分项:训练集无标注、H&E 侧真值不公开、测试集评估需邮件申请且每 4 个月限 1 次 |
| 页面状态 | published |
§0 E-E-A-T 与审核声明
医学审核:千方病案医学编辑部。交叉审核:§2 医学背景(乳腺癌 ICD-11 与 SNOMED CT 映射、IHC 标志物临床意义)、§7 偏倚分析(单中心回顾性队列偏倚、标注一致性分析)。
数据工程审核:千方病案医学编辑部交叉审核。医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。ACROBAT 以 CC-BY 许可通过瑞典国家数据服务(SND)开放下载,无需注册或签署数据使用协议;向 SND 通报使用情况(request@snd.gu.se)为非强制建议。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? ACROBAT(AutomatiC Registration Of Breast cAncer Tissue)是一套来自瑞典常规诊断工作流的乳腺癌多染色病理全切片图像数据集。同一位患者的肿瘤组织被切成多张薄片,分别用 H&E(形态学常规染色)和 ER、PGR、HER2、KI67 四种免疫组化(IHC)染色,共 4,212 张全切片、覆盖 1,153 例病例,并且配套了 54,800 个人工标注的对应点(landmark)。
为什么重要? 在数字病理学中,把同一肿瘤的不同染色切片在空间上对齐(图像配准)是科研与临床的"使能技术":AI 模型可以用 IHC 作为局部标签训练 H&E 图像预测模型(stain-guided learning),医生也可以叠加不同染色评估切缘。但此前缺乏大规模、真实临床质量的公开配准数据集。ACROBAT 是迄今最大的此类公开数据集,2022 年挑战赛的冠军算法误差(60.1 µm)已达到两名人类专家标注一致性(67.0 µm)的水平。
我能用它做什么? 训练或评测多染色 WSI 配准算法;做 stain-guided 学习、虚拟染色/染色迁移、标注转移、3D 重建;用真实伪影数据研究算法鲁棒性;或作为大规模无监督/自监督预训练语料。CC-BY 许可下无需申请即可下载。
§1.1 技术摘要
ACROBAT 数据集源于 Karolinska Institutet 的 CHIME 研究队列:斯德哥尔摩 Södersjukhuset 医院 2012-2018 年诊断的连续女性乳腺癌病例,切片为常规诊断工作流的存档蜡块,由 3 台 Hamamatsu NanoZoomer 扫描仪数字化(原始约 0.23 µm/pixel),并以 10X(约 0.92 µm/pixel)金字塔 TIFF 形式发布(总体积 482 GB,原始 NDPI 约 10.13 TB)数据集论文。每例含 1 张 H&E 与 1-4 张 IHC 切片;训练集 750 例(3,406 张 WSI)无标注,供无监督方法优化;验证集 100 例(200 张 WSI)与测试集 303 例(606 张 WSI)附带 IHC 侧人工 landmark(验证集 10,040 个、测试集 44,760 个),由 13 名 ABCAP 联盟标注者完成,其中 2 名有病理学家训练背景挑战赛论文。配准算法将 IHC landmark 变换到 H&E 坐标系,官方主指标为每图像对 TRE 90th 百分位的中位数,通过官网自动评估器评分。ACROBAT 2022 挑战(MICCAI 2022)有 16 支队伍提交 221 次、8 个方法进入测试集评估;ACROBAT 2023(MICCAI 2023)改用 Docker 盲评与含未公开染色的 200 个测试例考察域偏移。两届挑战的完整结果、数据集的全部规格与使用边界,将在 §3-§8 逐层展开。
§1.2 战略价值
维度一:多染色配准的"事实基准"。 在 ACROBAT 之前,多染色组织学配准主要依赖 ANHIR 挑战(2019)的多器官数据集,缺少单一癌种、大规模、临床真实质量的 benchmark。ACROBAT 以 4,212 张 WSI 的规模、54,800 个 landmark 的标注密度和例行诊断伪影(折叠、笔 mark、气泡)的真实性,将 WSI 配准领域推向了"接近人类一致性"的时代:冠军算法中位 90th 百分位 TRE 60.1 µm,而两名人类专家标注的距离(DBA)为 67.0 µm挑战赛论文。此后几乎所有 WSI 配准论文(如 DeeperHistReg/RegWSI)都以 ACROBAT 为必测数据集。对领域的另一层贡献是"评估基础设施":长期开放的验证集评估器让方法比较摆脱了"各自为政的本地划分",这是很多医疗 AI 子领域至今没有的资源。
维度二:stain-guided 学习与基础模型的实验床。 官方明确列举的下游用途包括 stain-guided learning、虚拟染色、标注转移、伪影检测与无监督预训练数据集论文。对从事计算病理学基础模型(如后续的 HISTAI、Hibou 等工作均引用了 ACROBAT)的团队而言,它是少数能提供"同一切片多染色 + 人工对齐真值"的公开资源,可用于评估模型能否学到跨染色不变的形态学表征。
维度三:配准方法学的"公共考场"。 对算法研究者而言,ACROBAT 的价值不止于数据规模:它提供了可长期使用的验证集自动评估器(无限期开放、每日 2 次),让新方法可以在与 2022 年八强完全相同的口径下自我衡量;MedIA 2024 论文还公开了八种方法的完整比较与协变量分析(切片存龄、染色类型、组织类别对误差的影响),为方法设计提供了现成的"失败模式地图"。对教学场景,两届挑战赛的提交物(方法描述 + 部分开源代码)构成了从特征匹配到深度配准的完整案例库。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态/染色 | 标注 | 与 ACROBAT 的差异化 |
|---|---|---|---|---|
| ACROBAT | 4,212 张 WSI / 1,153 例 | 乳腺癌 H&E + ER/PGR/HER2/KI67 | 54,800 个人工 landmark(验证/测试集) | 最大规模、常规诊断质量、官方评估服务器 |
| ANHIR(2019) | 数百张组织学切片 | 多器官、多染色(含肺、乳腺、肾等) | 专家 landmark | 多器官泛化,但规模小、非单一癌种 |
| CAMELYON16 | 400 张淋巴结 WSI | H&E | 淋巴结转移区域标注 | 定位分割任务,无跨染色配准真值 |
| HyReCo | 少量连续/再染色切片对 | 结直肠 H&E + IHC | 连续切片对齐参考 | 小规模高质量连续切片,用于方法消融 |
§1.4 版本时间轴
| 时间 | 版本/事件 | 说明 |
|---|---|---|
| 2022-04 至 2022-09 | ACROBAT 2022 挑战(MICCAI 2022,新加坡) | 16 队 221 次验证集提交,8 方法进入测试评估 |
| 2023-08-24 | 数据集描述论文发表(Scientific Data 10:562),SND Version 1 定稿 | 4,212 张 WSI + 54,800 landmark 正式开放 |
| 2023 | ACROBAT 2023 挑战(MICCAI 2023,温哥华) | 新增 200 测试例(IHC-IHC 对 + 未公开 IHC 染色),Docker 盲评,4 队提交 |
| 2024-10 | ACROBAT 2022 挑战结果论文(Medical Image Analysis 97:103257) | 8 方法系统比较 + 协变量影响分析 |
| 2026-07 | 官网评估政策更新 | 测试集评估改为按申请进行,每算法每 4 个月限 1 次 |
§1.5 典型应用场景
- 多染色 WSI 配准算法研发与评测:将 IHC landmark 配准到 H&E,用官方自动评估器获得 TRE 排名。
- stain-guided 学习:以 IHC(如 KI67 增殖指数、HER2 膜染色)为局部监督信号,训练从 H&E 直接预测生物标志物状态的模型。
- 虚拟染色/染色迁移:在跨染色对齐图像上训练 GAN/Diffusion 模型,实现 H&E↔IHC 的虚拟转换。
- 标注转移:将病理医生在一张切片上的标注通过配准矩阵转移到同例其他染色切片,降低标注成本。
- 鲁棒性与伪影研究:数据集中刻意保留的折叠、笔 mark、气泡与玻璃裂纹,是测试配准/分割算法抗伪影能力的天然压力测试集。
- 多染色预训练与基础模型评测:以同例多染色图像对评估模型是否学到跨染色不变的形态学表征,为病理基础模型提供对比学习与检索评测素材。
- 教学与基准复现练习:两届挑战赛的公开方法描述与部分开源代码构成完整案例库,适合作为医学图像配准课程的实战素材。
§2 医学背景
§2.1 ICD-11 与 SNOMED CT 双映射
ACROBAT 数据集本身不提供病例级诊断标签(仅含染色类型与分辨率元数据),下表给出该数据集所覆盖疾病域的标准术语映射,供知识图谱对齐与检索场景使用。映射精度刻意停留在"乳腺恶性肿瘤"层级:数据集未披露病例的组织学亚型构成(浸润性导管癌、小叶癌等),把条目映射到亚型编码会制造没有数据支撑的精确性。
ICD-11 编码表
| 标签 | ICD-11 编码 | ICD-11 中文名称 | 说明 |
|---|---|---|---|
| 乳腺恶性肿瘤 | 2C60 | 乳腺恶性肿瘤(Breast carcinoma) | 数据集全部病例均为女性原发性乳腺癌切除标本 |
| 乳腺原位癌 | 2E65 | 乳腺原位癌(Carcinoma in situ of breast) | 常规诊断浸润性癌切除标本中可能伴随存在,数据集未提供区分标签 |
SNOMED CT 映射表
| 标签 | ICD-11 | SNOMED CT 码 | SNOMED 术语 |
|---|---|---|---|
| 乳腺恶性肿瘤 | 2C60 | 254837009 | Malignant tumour of breast(乳腺恶性肿瘤) |
| 免疫组织化学检测 | — | 697947002 | Immunohistochemistry procedure(免疫组织化学操作) |
§2.2 疾病简介与流行病学
乳腺癌是女性中最常见的恶性肿瘤之一,ACROBAT 数据集描述论文即以 GLOBOCAN 2020 全球癌症统计作为背景引用。乳腺癌的病理诊断与治疗决策高度依赖"形态学 + 生物标志物"双轨证据:H&E 染色提供组织形态(浸润模式、分级、切缘状态),而 IHC 染色提供受体状态。数据集所含四种常规诊断 IHC 染色的临床意义如下数据集论文:
| IHC 标志物 | 染色定位 | 临床意义 |
|---|---|---|
| ER(雌激素受体) | 核染色 | 阳性者可从内分泌治疗获益(ASO/CAP 检测指南为论文引用文献) |
| PGR(孕激素受体) | 核染色 | 与 ER 联合评估激素受体状态完整性 |
| HER2 | 膜染色 | HER2 过表达/扩增决定抗 HER2 靶向治疗(论文引用 ASCO/CAP 指南) |
| KI67 | 核染色 | 细胞增殖指数,反映肿瘤增殖活性(论文引用国际 Ki67 工作组建议) |
注意:数据集只提供染色图像,不提供各例的标志物阳阴性结果或评分,需研究者自行从图像或外部渠道获取。
基于这四种标志物的组合构成临床常规的乳腺癌分子分型框架:激素受体阳性(ER/PGR 阳性)肿瘤适用内分泌治疗;HER2 阳性肿瘤适用抗 HER2 靶向治疗;三阴性(三者均阴性)预后与治疗策略迥异;KI67 增殖指数辅助刻画增殖活跃程度。这一"形态学 + 标志物"双轨结构正是多染色配准的临床动机——同一肿瘤的形态(H&E)与分子(IHC)证据需要在空间上对齐才能联合判读。ACROBAT 数据集虽然不含病例级分型标签,但其四种 IHC 染色恰好覆盖了分型判定所需的全部常规染色,这使其成为 stain-guided 学习(从 H&E 预测标志物状态)的理想实验床。
§2.3 临床任务定义
ACROBAT 对应的核心临床操作是多染色切片的空间对齐(配准),在诊断与研究中的直接用途包括官网:
- 切缘评估:在浸润性癌的手术切除标本中,叠加 H&E 与 IHC 切片以评估切缘是否存在残留肿瘤——若切缘阳性,可能需要二次手术。未对齐时这一过程在显微镜下极为耗时。
- IHC 自动评分的上下文化:部分商业 IHC 评分软件会将 H&E 与 IHC 对齐,使病理医生能在形态学语境下审视自动评分结果。
- 肿瘤内异质性研究:对齐后可研究不同染色模式在同一肿瘤内的空间对应与分歧。
对 AI 而言,配准是"使能技术":它把"同一组织的两种染色视图"变成监督信号对,支撑 stain-guided 学习、虚拟染色与标注转移等下游任务。
从方法学看,WSI 配准按变换模型分为三个层级,难度与临床可用性递增:刚体/仿射配准(旋转、平移、缩放与剪切,处理切片上机方向差异)→ 全局非刚性配准(B-spline 等参数化形变,处理切片整体的拉伸)→ 局部非刚性/密集形变场(逐像素位移场,处理局部撕裂与折叠)。跨染色设定下通常采用"粗对齐 + 细化"两段式管线:先在低分辨率(4-16 µm/pixel)上解决大形变与方向,再在工作分辨率(1-2 µm/pixel)上优化局部形变。按实现范式又分为传统方法(SIFT/ORBF 特征 + RANSAC + 插值形变,无需训练)与深度学习方法(SuperPoint/SuperGlue 特征、或端到端形变场回归);2022 挑战八强中 6 支为特征匹配法、7 支含深度学习组件,说明两条路线在高精度区间已经会师挑战赛论文。
§2.4 患者人群
| 维度 | 内容 |
|---|---|
| 数据来源 | Södersjukhuset 医院(斯德哥尔摩,瑞典),CHIME 研究队列 |
| 采集时间 | 2012-2018 年诊断的连续病例 |
| 性别 | 全部为女性 |
| 疾病范围 | 原发性乳腺癌,手术切除标本(常规诊断工作流) |
| 年龄/种族 | 数据集不提供(元数据仅含染色类型与分辨率,无临床变量) |
| 就医类型 | 常规诊断(非筛查、非研究专采) |
这张人群表的"留白"本身携带信息:元数据最小化是回顾性开放数据在 GDPR 框架下的常见合规路径——年龄、种族、分期等变量一旦入库,即便脱敏也会显著提高再识别风险与发布门槛。使用者应把"无临床元数据"视为该数据集的固有边界,而非可以后续补齐的缺口;需要协变量的研究应从设计上选择其他数据源或自建队列。
§2.5 临床价值
对临床 AI 而言,ACROBAT 的价值在于把"真实诊断工作流中的对齐需求"变成了可量化的算法任务:挑战赛结果显示,现代配准算法的中位 90th 百分位 TRE(60.1 µm)已与两名人类专家的标注一致性(DBA 67.0 µm)相当,意味着在邻域级别(组织学区)机器对齐已可用于支撑切缘评估、IHC 评分上下文化等流程;但细胞级精度(约 20 µm)仍未稳定达成,且稀疏 landmark 评估无法完全保证点间区域的形变物理合理性挑战赛论文。
从部署视角看,“算法达到人类一致性"并不等价于"可以放心临床使用”:挑战赛的评估口径是稀疏点位上的误差分布,而临床失误往往发生在点间区域(如形变场把某个病灶区拉到错误位置但恰好没有 landmark 约束)。因此,把 ACROBAT 成绩转化为临床流程(切缘评估辅助、IHC 评分叠加)时,需补充稠密形变场的物理合理性检查与病理医生在环(human-in-the-loop)的界面设计——这也是论文讨论部分明确指出的方向。
§2.6 标注金标准
| 维度 | 内容 |
|---|---|
| 划分 | 训练 750 例(无标注)/ 验证 100 例 / 测试 303 例 |
| 标注对象 | 验证/测试集中每对 H&E-IHC 图像的 IHC 侧 landmark(每图目标 50 个) |
| 标注方式 | 两阶段人工标注:第一阶段直接放置对应点;第二阶段仅测试集,对 H&E 侧 landmark 注入 ±500 px(40X 下 ±115 µm)随机噪声后由第二标注者重新校正 |
| 标注者 | 13 名 ABCAP 研究联盟成员(均受过组织病理学教育),其中 2 名有病理学家训练背景;测试集每对图像由 2 名不同标注者独立标注 |
| 标注性质 | 点对应(landmark correspondence),非分割/分类语义标注;使用定制版 TissUUMaps 在 40X 分辨率下完成 |
这份金标准表的深层含义:ACROBAT 的"标注"定义得极窄——它只为配准这一个任务提供地面真值,不为分割、分级、标志物预测提供任何标签。这是数据集质量的来源(标注目标单一、协议严格),也是使用边界的来源(想从中提取诊断标签的研究者应当转向其他资源)。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 训练配准算法 + 验证集打榜 | SND 完整数据集 v1(train + valid ZIP) | 约 359 GB | 训练集 750 例无标注供无监督优化,验证集 100 例附 landmark 可提交官网评估 |
| 复现 ACROBAT 2022 测试结果 | SND 完整数据集 v1(含 test.zip) | 约 482 GB | 测试集 303 例附公开 IHC landmark,配准结果需提交官网或邮件申请评估 |
| 只需标注协议/评估代码 | GitHub 仓库 rantalainenGroup/ACROBAT | 数 MB | 含 landmark 可视化、TRE 指标计算代码与标注协议 |
| 域偏移盲评(2023 设定) | ACROBAT 2023 测试集 | 不公开下载 | 200 例含未公开 IHC 染色,仅接受 Docker 容器提交由主办方运行 |
矩阵的核心结论:绝大多数需求都应从"完整数据集 v1"出发——它是唯一同时包含训练、验证、测试三划分且可直接下载的版本;2023 域偏移测试集只存在于挑战赛语境,社区方法可在其设定下类比自测(训练染色与评估染色严格不相交),但无公开数据可比对名次。
§3.1 模态详情
数据集为单一模态——病理全切片图像(WSI),但含 5 种染色通道:H&E(每例 1 张)与 ER、PGR、HER2、KI67(每例 0-4 张,即"1-4 张 IHC")。核染色(ER、PGR、KI67)阳性信号位于细胞核,膜染色(HER2)阳性信号位于细胞膜,跨染色外观差异巨大,这正是配准任务的核心难点之一。所有 WSI 均为同一肿瘤蜡块的连续或非连续切片(切片不一定连续),意味着两张切片的组织内容可能不完全重合。
| 染色 | 阳性信号定位 | 典型外观特征 | 对配准的含义 |
|---|---|---|---|
| H&E | 形态学整体 | 紫蓝核 + 粉红胞质/基质,组织结构信息最全 | 通常作为配准目标(fixed)图 |
| ER | 细胞核 | 核内棕褐色颗粒,阳性比例因病例而异 | 与 PGR/KI67 外观相近,互相易混淆 |
| PGR | 细胞核 | 核内棕褐色颗粒,与 ER 几乎不可目视区分 | 文件名/元数据是唯一可靠区分依据 |
| KI67 | 细胞核 | 核内棕褐色颗粒,阳性率即增殖指数 | 阳性区呈斑片状分布 |
| HER2 | 细胞膜 | 肿瘤细胞膜棕褐色环形着色 | 外观与其他染色差异最大,匹配难度最高 |
实际操作提醒:五张染色切片在小缩略图下可能难以肉眼区分(尤其 ER 与 PGR),任何自动化流程都应以 df_acrobat_meta.csv 的染色字段而非图像外观作为配对依据。
§3.2 子集样本数
| 子集 | 病例数 | WSI 数 | 每例构成 | 标注 |
|---|---|---|---|---|
| 训练集 | 750 | 3,406 | 1 H&E + 1-4 IHC | 无 |
| 验证集 | 100 | 200 | 1 H&E + 1 随机 IHC | 10,040 个 IHC 侧 landmark(单标注者) |
| 测试集 | 303 | 606 | 1 H&E + 1 随机 IHC | 44,760 个 IHC 侧 landmark(双标注者) |
| 合计 | 1,153 | 4,212 | — | 54,800 个标注点 |
| 2023 域偏移测试集 | 200 | 400 | IHC-IHC 与 IHC-HE 对 | 不公开(Docker 盲评) |
子集构成的另一个观察角度:训练集承载了约 81% 的 WSI(3,406/4,212),是有意把"算力消耗大的无监督训练"与"标注成本高的评估"解耦——评估集刻意保持小而标注密(约 50 点/图),训练集则大而无标注。这一设计让"数据规模"与"标注质量"各自达到预算下的最优,也解释了为什么两届挑战的竞争都发生在验证/测试口径上。
§3.3 数据格式
| 项目 | 规格 |
|---|---|
| 图像格式 | 金字塔 TIFF(generic tiled TIFF,OpenSlide 兼容) |
| 发布分辨率 | 最高层 10X,约 0.92 µm/pixel(原始扫描为 40X 约 0.23 µm/pixel,发布时已降采样) |
| 文件命名 | caseid_stain_set.tiff(随机 case ID + 染色 + 划分集合) |
| 元数据表 | df_acrobat_meta.csv:每 WSI 一行(匿名 case ID、染色/IHC 抗体、各层 magnification 与 µm/pixel)+ df_acrobat_meta_readme.txt 列说明 |
| 完整性校验 | 各 ZIP 的 SHA1 校验和(zipfiles_sha1_checksums.txt)+ 文件清单(*_zip_listing.txt) |
| 标注格式 | IHC 侧 landmark 坐标(验证/测试集),配套 TissUUMaps 可视化与评估脚本 |
| 转换管线 | 原始 Hamamatsu NDPI 经 anonymize-slide 脱敏、libvips 转金字塔 TIFF |
格式选型的两个推论:generic tiled TIFF 意味着 openslide、tifffile、QuPath、DLUP 等主流工具全部可直接读取,无需厂商 SDK;而"最高层即 10X"意味着试图按 40X 惯例写死 MPP 的代码必然出错——金字塔属性里的 MPP 是权威值,文件名与目录都不是。
§3.4 存储大小
发布总体积约 482 GB(原始 NDPI 约 10.13 TB,10X 降采样压缩了约 21 倍)。SND 提供 7 个 ZIP 分包:train_part1.zip 71.47 GB、train_part2.zip 70.59 GB、train_part3.zip 75.91 GB、train_part4.zip 71.63 GB、train_part5.zip 69.09 GB、valid.zip 21.79 GB、test.zip 68.11 GB(researchdata.se 页面以 GiB 标注;下载页同时提供元数据与校验文件,合计 17 个文件、448.6 GiB)SND 数据集页。建议预留至少 1 TB 磁盘空间以容纳压缩包 + 解压副本。
磁盘规划的经验公式:压缩包(448.6 GiB)+ 解压副本(约 482 GB)+ patch 缓存与实验产物(视规模 100-500 GB)≈ 1.1-1.5 TB 的安全余量;若磁盘吃紧,压缩包在 SHA1 校验通过并解压完成后即可删除(需要重下时可随时从 SND 拉取),仅保留解压副本与校验记录。
§3.5 标注方式
标注为纯人工 landmark 点对应,不含任何自动或弱监督成分:
- 训练集无标注——使用训练数据的方法必须以无监督方式优化(允许使用外部数据训练)挑战赛论文。
- 验证/测试集公开 IHC 侧 landmark 坐标;H&E 侧真值由主办方持有,配准结果通过官网评估器自动评分。
- 测试集标注分两阶段:第二阶段注入 ±115 µm 噪声由不同标注者重标,防止标注记忆效应。
§3.6 标注者资质与一致性
13 名标注者均为 ABCAP 研究联盟(abcap.org)成员,受过组织病理学教育并具有 WSI 研究经验,其中 2 名有病理学家训练背景;标注使用为 ACROBAT 定制的 TissUUMaps 完成,全部标注在 40X 分辨率下生成挑战赛论文。一致性指标:测试集双标注者中,50% 的 landmark 距离小于 20 µm、80% 小于 60 µm;双标注者距离超过 115 µm 的 landmark 被剔除,剔除后剩余 landmark 少于 10 个的 WSI 整张剔除,最终 13,130 个 landmark / 297 张 WSI 进入官方性能评估。
对照一下数量级:20-60 µm 的标注者一致性落在"组织学邻域"尺度(腺体直径通常为数十至数百 µm),意味着标注精度足以支撑"组织学区对齐"这一临床需求,但达不到"单细胞对齐"(约 10-20 µm)——这与挑战赛论文"邻域级已达标、细胞级仍开放"的结论互为印证。评估自研方法时,建议把 20/60/115 µm 三个数字同时报告为参照系,而非只报主指标。
§3.7 采集周期
切片来自 2012-2018 年在 Södersjukhuset 诊断的连续病例(CHIME 研究队列);存档蜡块在研究启动后集中扫描数字化。训练/验证集为随机抽样,测试集按生物标志物状态与扫描仪型号分层抽样数据集论文。
“连续病例”(consecutive cases)的抽样设计对偏倚控制意义重大:它避免了"只挑典型/高质量病例"的选择偏倚,使数据集的伪影谱系、染色质量分布更接近真实诊断流水的自然构成——这正是官方反复强调"来自常规诊断工作流"的实质含义,也是它与精挑细选的研究型切片集最本质的区别。
§3.8 地域覆盖
单一中心:瑞典斯德哥尔摩 Södersjukhuset 医院(瑞典最大的急诊医院之一)。无多中心数据,泛化到其他染色协议或扫描设备的性能需自行验证——这正是 ACROBAT 2023 设置"未公开 IHC 染色"测试集的动机。
§3.9 设备规格
| 设备 | 数量 | 原始分辨率 | 用途 |
|---|---|---|---|
| Hamamatsu NanoZoomer XR | 2 台 | 约 0.23 µm/pixel(40X) | 高通量切片数字化 |
| Hamamatsu NanoZoomer S360 | 1 台 | 约 0.23 µm/pixel(40X) | 高通量切片数字化 |
发布版将所有 WSI 重采样至 10X(约 0.92 µm/pixel)金字塔 TIFF,数据体积从 10.13 TB 降至 482 GB;官方认为这对配准任务无损——现有 WSI 配准方法通常在远低于 40X 的放大倍率下工作挑战赛论文。
扫描设备对分析的一个隐性影响是色彩响应:三台 Hamamatsu 设备虽同厂同代,但个体间的色彩/锐化差异仍被官方用作测试集的分层维度,说明这一差异在统计上可测。研究跨扫描仪稳定性时,可利用 df_acrobat_meta.csv 与论文披露的分层抽样设计在测试集内构造"设备对照"子群,无需额外设备元数据。
§3.10 深度溯源链
完整溯源链:Södersjukhuset 常规诊断切片(2012-2018,CHIME 队列,伦理批准 ref 2017/2106-31)→ Karolinska Institutet 集中数字化(3 台 Hamamatsu 扫描仪,NDPI 格式)→ anonymize-slide 脱敏(删除 macro 图像、随机 case ID、覆写个人元数据)→ libvips 转换为 generic tiled 金字塔 TIFF(10X)→ SND 平台发布(CC-BY,DOI 10.48723/w728-p041)→ ABCAP 联盟 13 人两阶段 landmark 标注 → grand-challenge.org 挑战赛与自动评估。每一步均可在数据集论文与挑战赛论文中找到对应描述。
使用前可按此清单自查溯源完整性:① SND 页面的数据集版本与引用条目是否为 V1(2023);② 所下载 ZIP 的 SHA1 是否全部通过;③ df_acrobat_meta.csv 行数是否为 4,212;④ 各染色切片数与 §3.2 表是否一致;⑤ GitHub 仓库标注协议版本与论文描述是否一致(两阶段标注)。
§4 数据结构
§4.0 目录树
SND 下载并解压 7 个 ZIP 后的典型目录结构如下(<caseid> 为随机生成的匿名病例 ID,<STAIN> ∈ he/er/pgr/her2/ki67,以 df_acrobat_meta.csv 为准)。注意训练集 5 个分包解压后的 WSI 会合并到同一命名空间,目录树按"逻辑组织"而非"ZIP 边界"呈现:
acrobat/
├── df_acrobat_meta.csv # 每 WSI 一行的元数据表(1.11 MiB)
├── df_acrobat_meta_readme.txt # 元数据列说明
├── zipfiles_sha1_checksums.txt # 7 个 ZIP 的 SHA1 校验和
├── train_part1_zip_listing.txt # 各 ZIP 文件清单(下载前可预览内容)
├── train_part2_zip_listing.txt
├── train_part3_zip_listing.txt
├── train_part4_zip_listing.txt
├── train_part5_zip_listing.txt
├── valid_zip_listing.txt
├── test_zip_listing.txt
├── train_part1.zip ... train_part5.zip # 训练集 3,406 张 WSI(共约 359 GB)
│ └── <caseid>_<STAIN>_train.tiff # 金字塔 TIFF,10X 最高层
├── valid.zip # 验证集 200 张 WSI(21.79 GB)
│ └── <caseid>_<STAIN>_valid.tiff
└── test.zip # 测试集 606 张 WSI(68.11 GB)
└── <caseid>_<STAIN>_test.tiff
landmark 标注与评估代码从 GitHub 仓库 rantalainenGroup/ACROBAT 获取(不在 ZIP 包内)。目录树的三个工程要点:文件名自解释(caseid + 染色 + 划分),无需打开文件即可构建图像对清单;元数据表是所有批处理任务的唯一事实来源,任何文件名正则都应与元数据交叉校验;各 ZIP 的文件清单(*_zip_listing.txt)可在下载前确认所需 case 是否在特定分包中,对按需下载场景非常有用。
§4.1 DAIMS 字段字典
核心字段字典(基于 df_acrobat_meta.csv 与公开 landmark 文件;精确列名以 df_acrobat_meta_readme.txt 为准):
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| caseid | 文本 | 匿名随机病例 ID,同一病例所有切片共享 | A1B2 形式的随机 ID |
分组键:按病例聚合、划分数据集 | 无 | 无(无缺失) | 1,153 个唯一值 |
| stain | 文本 | 染色类型或 IHC 抗体 | he、er、pgr、her2、ki67 |
区分源/目标染色,构造配准对 | 无 | 无 | 5 个枚举值 |
| set | 文本 | 挑战赛划分归属 | train、valid、test |
决定是否可用于打榜评估 | 无 | 无 | 3 个枚举值 |
| microns_per_pixel | 浮点 | 最高分辨率层的像素物理尺寸 | 0.92 |
像素误差→物理距离(µm)换算 | 无 | 无 | 约 0.92(10X 层) |
| magnification | 整数 | 各分辨率层放大倍率 | 10、5、2.5 |
金字塔层选择 | 无 | 无 | 10X 及以下各层 |
| landmark_x / landmark_y | 浮点 | IHC 侧 landmark 坐标(验证/测试集,40X 标注坐标系换算值) | 像素坐标 | 配准监督信号与评估 | 见 §3.6 一致性 | 无 | 图像范围内 |
| landmark annotator | 整数/组合 | 测试集每图像对的双标注者组合标识(87 种组合) | 标注者编号 | 标注质量分析与层级建模 | 无 | 无 | 13 名标注者的组合空间 |
| annotator distance | 浮点 | 测试集双标注者对同一 landmark 的距离(µm) | 15.3 |
一致性过滤(>115 µm 剔除)的依据 | 即测量对象本身 | 无 | 0 - 数百 µm |
字段字典的使用要点:caseid、stain、set 三个字段即可唯一确定一张 WSI 并与其文件名互推;landmark 相关字段仅存在于验证/测试集,训练集没有对应行——以"是否出现 landmark 字段"判断一个 case 是否可用于打榜,比记住划分名单更不易出错。
§4.2 标签分布
数据集的"标签"即 landmark(仅验证/测试集):
- 总计 54,800 个人工标注点,平均每张图像 49.24 个 landmark,验证集 10,040 个、测试集 44,760 个挑战赛论文。
- 图像对覆盖:83% 的图像对恰有 50 个 landmark,6% 少于 50 个,11% 多于 50 个——少于目标数通常发生在跨染色外观差异过大、难以确认对应关系的图像对上。
- 测试集经一致性过滤(双标注者距离 >115 µm 剔除)后,13,130 个 landmark / 297 张 WSI 进入官方评估。
染色构成(由"每例 1 H&E + 1-4 IHC"与总数推导):H&E 共 1,153 张,IHC 共 3,059 张(平均每例约 2.65 张)。各 IHC 抗体的精确张数分布官方未单独披露。
§4.3 关键统计
| 统计项 | 数值 |
|---|---|
| 病例数 | 1,153(全部女性、原发性乳腺癌切除标本) |
| WSI 总数 | 4,212(H&E 1,153 + IHC 3,059) |
| 发布体积 | 482 GB(原始 NDPI 10.13 TB) |
| 发布分辨率 | 10X(约 0.92 µm/pixel)金字塔 TIFF |
| 标注点总数 | 54,800(评估用 13,130) |
| 标注者间一致性 | 50% <20 µm,80% <60 µm |
| 冠军算法误差(2022 测试集) | 中位 90th 百分位 TRE 60.1 µm(人类 DBA 参考 67.0 µm) |
对这些统计的使用建议:做资源规划时以体积与张数为准(§3.4 的磁盘预算);做方法设计时以标注统计为准——平均每图约 50 个 landmark 意味着单图监督信号稀疏,方法应能在低密度点位约束下稳定插值形变;做实验管理时以一致性数据为准——20/60 µm 两个分位数可以直接转化为自评估的"信号/噪声"分界线。
§4.4 数据层级
数据呈四层嵌套结构:患者/病例(匿名 case ID,1,153 个)→ 肿瘤蜡块(每病例 1 个,同 case 全部 WSI 来自同一蜡块但切片不一定连续)→ 切片/WSI(每蜡块 2-5 张:1 H&E + 1-4 IHC)→ 金字塔分辨率层(每 WSI 多层,最高 10X)。AI 工程中最重要的一条约束:case 是不可分割的原子单元,任何划分/聚合都必须以 case 为粒度(见 §5.3)。
患者(匿名 case ID,共 1,153 例)
└── 肿瘤蜡块(1 蜡块/例;切片不一定连续)
├── H&E 切片 → WSI(1 张/例)
│ └── 金字塔层:10X (0.92 µm/px) → 5X → 2.5X → ... → 低分辨率概览
├── IHC-ER 切片 → WSI(0 或 1 张/例)
│ └── 金字塔层:同上结构
├── IHC-PGR / IHC-HER2 / IHC-KI67 → WSI(各 0 或 1 张/例)
│ └── 金字塔层:同上结构
└── landmark(仅 valid/test 的 IHC 侧,每图约 50 点)
§4.5 缺失值与信息性缺失
| 现象 | 性质 | 处理建议 |
|---|---|---|
| 每例 IHC 数量不等(1-4 张) | 设计使然(取决于该病例常规诊断开了哪几种染色),非数据缺失 | 构建图像对时按 df_acrobat_meta.csv 逐例枚举,勿假设固定结构 |
| 部分图像对 landmark 少于 50 个 | 信息性缺失:跨染色对应点难以确认(外观差异过大) | 评估时直接使用官方过滤规则;训练时不要对这些对强行凑齐样本数 |
| 训练集无 landmark | 设计使然(考察无监督方法) | 用验证集反馈或官方评估器做模型选择,勿在测试集上调参 |
| 无临床元数据(年龄、分期、标志物状态) | 脱敏策略:仅保留染色与分辨率信息 | 需要临床协变量的研究需另寻数据源 |
这张表里的"信息性缺失"条目值得展开:landmark 少于 50 个的图像对并非标注缺陷,而是数据集诚实地记录了"这两张切片在视觉上难以找到足够多的确定对应点"——这类图像对恰恰是配准难度的天然标记,把它当作分层变量(易/难子群)来报告方法表现,往往比单一总分更有诊断价值。
§5 划分与使用建议
§5.1 官方划分
官方三划分为 train(750 例)/ valid(100 例)/ test(303 例),2022 挑战即按此执行;训练/验证集为随机抽样,测试集按生物标志物状态与扫描仪型号分层抽样数据集论文。验证集 landmark 公开且可每日提交 2 次获得自动评分;测试集无反馈,仅在挑战期后由主办方一次性评测。
分层抽样的意义值得注意:测试集在标志物状态与扫描仪两个维度上刻意对齐全数据集构成,因此测试集成绩对"真实病例构成"的代表性优于简单随机抽样;反之,如果研究者只用测试集的某个染色子群(如仅 HER2 对)做评估,就破坏了这一代表性设计,需要自行声明子群口径。三个划分互斥且按 case 切分,官方文件命名中的 set 后缀与 df_acrobat_meta.csv 的 set 列均可直接用于过滤。
§5.2 社区惯例
社区论文(如 RegWSI/DeeperHistReg)普遍沿用官方三划分报告验证集与测试集结果,部分工作同时在 ANHIR、HyReCo 上交叉评测以证明泛化性。在训练集内部自行切分的做法较少见——因为训练集无标注,只能做无监督/自监督优化,天然不存在"再划分"的需求。
这一"训练无标注、评估有真值"的不对称结构,实际上定义了社区的两个惯例:其一,方法论文把创新点集中在无监督可用的组件上(特征匹配、相似性度量、形变正则),而把需要监督的组件(如深度特征提取器)直接采用公开预训练权重;其二,论文报告结果时明确区分"验证集 leaderboard 成绩"与"官方测试成绩"两个口径,读者据此可判断方法是否经受过测试集级别的检验。
§5.3 泄漏风险(重点)
- case 级聚合:同一 case 的 H&E 与全部 IHC 来自同一肿瘤蜡块,组织内容高度相关。若自定义划分时把同 case 的 WSI 拆到不同集合,验证/测试误差会被严重低估。任何再划分必须按
caseid分组(GroupShuffleSplit / GroupKFold)。 - 验证集打榜次数:验证集每日可提交 2 次,频繁按 leaderboard 调参等于把验证集用作测试集——建议把自动反馈仅用于方法级决策,超参数选择用训练集内部协议。
- 外部数据:2022 挑战明确允许外部训练数据;若混入外部乳腺癌 IHC 数据,报告结果时必须声明,否则与"仅 ACROBAT 训练"的结果不可比。
- 官方划分解冻风险:测试集 IHC landmark 是公开的,因此测试集图像 + 公开 landmark 可被用于(也只应被用于)最终评估;把它纳入任何训练/调参流程都会使结果失效。
- 跨染色子集的选择偏倚:若只在"易配准"的染色对(如 ER-H&E)上调参和汇报,方法在 HER2-H&E 或 IHC-IHC 设定的退化会被隐藏;建议预注册各染色对的评估口径。
§5.4 交叉验证建议
在训练集内做方法消融时,建议按 case 分组做 5 折 GroupKFold,以染色对(如 ER-H&E 与 HER2-H&E)为分层因素,保证每折的染色构成一致;有监督组件(如特征匹配网络)若需要微调,只能用外部数据或训练集,禁止触碰 valid/test。
两条额外的交叉验证注意事项:其一,GroupKFold 的分组键必须是 case 而非图像对——同一 case 的多个 H&E-IHC 对共享蜡块与病例特征,按图像对分组等同于泄漏;其二,若消融实验涉及"染色对泛化"(如只用 ER-H&E 训练、在 HER2-H&E 上测试),折叠设计应保证训练折与验证折的染色集合完全不相交,此时官方 2023 挑战的"未公开染色"设定是最接近的参考模板。
§5.5 外部验证建议
单中心数据的外部验证建议方向:ANHIR(多器官多中心组织学配准)、HyReCo(连续/再染色切片)、或自采的异 scanner(非 Hamamatsu)乳腺癌 IHC 切片;ACROBAT 2023 的"未公开染色域偏移"设定提示——评估跨染色协议(如不同抗体克隆、不同显色底物)的泛化是当前公开评测的空白区。
| 外部验证方向 | 考察目标 | 预期主要挑战 |
|---|---|---|
| ANHIR | 跨器官/跨中心特征匹配与形变估计 | 组织结构差异大,乳腺特化特征可能失效 |
| HyReCo | 细胞级配准精度上限 | 连续切片内容重合度更高,误差下限不同 |
| 异 scanner 自采数据 | 色彩与分辨率适配 | 未覆盖的扫描仪色彩响应与压缩伪影 |
| 新 IHC 抗体/显色方案 | 染色协议域偏移 | 2023 设定的开放空白区,无公开基准 |
§6 AI 就绪指南
§6.0 云端快速启动
ACROBAT 没有官方 Kaggle/HuggingFace 云托管镜像,唯一官方下载渠道是瑞典国家数据服务 SND(researchdata.se),直接浏览器或 wget 均可。注意:约 482 GB 的体积超出 Colab 免费磁盘与多数云笔记本配额,云端使用建议挂载 ≥1 TB 的持久磁盘(如 GCP PD、AWS EBS)后整包下载解压;只想快速试跑可先下载 valid.zip(21.79 GB)——它是包含完整标注与评估通道的最小可用子集。
推荐的网络传输技巧:SND 下载支持断点续传(配合 wget -c / curl -C -),跨国链路慢时可放在夜间时段整包拉取;若团队多人使用,建议由一台中转机下载一次后经内网对象存储分发,并在分发前后各做一次 SHA1 校验——校验成本是分钟级的,而半途损坏的 ZIP 排查成本是小时级的。
§6.1 快速上手
代码运行前提:以下代码假设你已从 SND 下载并解压数据,目录结构为
data_root/valid/<caseid>_<STAIN>_valid.tiff(data_root即解压根目录,代码中所有路径按data_root + 文件名拼接);df_acrobat_meta.csv位于data_root/下。最小可用子集:valid.zip解压后的 200 张 WSI + 元数据表即可完成读取、可视化和提交官网评估的完整闭环。
# 读取 ACROBAT 金字塔 WSI 与元数据的最小示例
# 依赖:pip install openslide-python pandas
import openslide
import pandas as pd
from pathlib import Path
DATA_ROOT = Path("data_root") # 解压根目录;ZIP 解压后 WSI 在对应子目录
meta = pd.read_csv(DATA_ROOT / "df_acrobat_meta.csv")
print(meta.head()) # 每行一张 WSI:caseid / 染色 / 各层 magnification 与 µm/pixel
# 取一个验证集 case,读取 H&E 与一张 IHC 的低分辨率层(金字塔读取,不整图载入)
row = meta[meta["set"] == "valid"].iloc[0]
he_path = next(DATA_ROOT.rglob(f"{row.caseid}_he_*.tiff"))
ihc_path = next(DATA_ROOT.rglob(f"{row.caseid}_*_valid.tiff"))
slide_he, slide_ihc = openslide.OpenSlide(he_path), openslide.OpenSlide(ihc_path)
print(slide_he.level_count, slide_he.level_dimensions) # 金字塔层数与各层尺寸
print(slide_he.properties[openslide.PROPERTY_NAME_MPP_X]) # 最高层 µm/pixel(≈0.92)
# 读 10X 层的中央 2048x2048 区域做快速可视化
lvl = slide_he.level_count - 1
w, h = slide_he.level_dimensions[lvl]
patch = slide_he.read_region((w // 2 - 1024, h // 2 - 1024), lvl, (2048, 2048))
patch.save("he_center_preview.png") # RGBA,第四通道为透明度(病理 WSI 通常不透明)
landmark 可视化与官方 TRE 评估脚本在 GitHub 仓库:TissUUmaps 工程文件可叠加显示 IHC landmark 与你配准后的对应点。
一个不依赖额外服务的快速目检方法——把公开的 IHC landmark 画在切片缩略图上,人工核对点位是否落在合理组织结构上:
# 在 10X 层缩略图上叠加公开 landmark,用于标注质量抽查与配准结果目检
# 依赖:openslide-python, matplotlib;landmark 坐标按官方仓库给定格式读取
import openslide
import numpy as np
import matplotlib.pyplot as plt
def preview_with_landmarks(wsi_path: str, landmarks_l0_xy: np.ndarray,
out_png: str = "landmark_preview.png"):
slide = openslide.OpenSlide(wsi_path)
lvl = slide.level_count - 1 # 最低分辨率层做全片概览
img = slide.read_region((0, 0), lvl, slide.level_dimensions[lvl]).convert("RGB")
ds = slide.level_downsamples[lvl] # level-0 坐标 → 当前层坐标
xy = np.asarray(landmarks_l0_xy, dtype=float) / ds
fig, ax = plt.subplots(figsize=(10, 10))
ax.imshow(img)
ax.scatter(xy[:, 0], xy[:, 1], s=6, c="red", alpha=0.6)
ax.set_axis_off()
fig.savefig(out_png, dpi=150, bbox_inches="tight")
注意 landmark 坐标的参考系:官方标注在 40X 视野下生成、以 IHC 侧公开,使用前按 §6.5 坑点 1 的 MPP 换算对齐到你实际读取的金字塔层;配准结果提交时同样需要换算回官方要求的坐标系与单位。
§6.2 数据获取
官方下载页为 SND 数据集 2022-190-1(CC-BY,无需注册)。7 个 ZIP 分包与配套文件如下:
| 文件 | 大小 | 内容 |
|---|---|---|
| train_part1.zip - train_part5.zip | 71.47 / 70.59 / 75.91 / 71.63 / 69.09 GB | 训练集 3,406 张 WSI(无标注) |
| valid.zip | 21.79 GB | 验证集 200 张 WSI + 公开 IHC landmark 对应的图像 |
| test.zip | 68.11 GB | 测试集 606 张 WSI(IHC landmark 公开,H&E 真值保密) |
| df_acrobat_meta.csv / readme | 1.11 MiB / 2.91 KiB | 元数据表与列说明 |
| *_zip_listing.txt + zipfiles_sha1_checksums.txt | 数百 KiB | 文件清单与 SHA1 校验和 |
# 下载全部 7 个 ZIP(可用 wget -c 断点续传;SND 页面提供逐文件直链)
for f in train_part1 train_part2 train_part3 train_part4 train_part5 valid test; do
wget -c "https://researchdata.se/en/catalogue/dataset/2022-190-1/${f}.zip"
done
# 解压前先校验 SHA1(文件损坏率不为零,先校验再解压可省去数小时的排查)
sha1sum -c zipfiles_sha1_checksums.txt
# 按需解压:先解 valid.zip 即可跑通全流程(约 22 GB 磁盘占用)
unzip valid.zip -d acrobat/valid/
推荐的本地目录组织(与本文代码示例的 data_root 约定一致):把元数据与校验文件放根目录、各 ZIP 解压到以其划分命名的子目录,并保持 WSI 为只读——多实验共享时避免误写:
# 最终目录约定:data_root/{train,valid,test}/*.tiff + data_root/df_acrobat_meta.csv
mkdir -p acrobat/{train,valid,test}
unzip -n valid.zip -d acrobat/valid/ && unzip -n test.zip -d acrobat/test/
for p in 1 2 3 4 5; do unzip -n train_part${p}.zip -d acrobat/train/; done
chmod -R a-w acrobat/ # 共享集群上锁定只读(可选)
§6.3 预处理全流程
WSI 配准的标准预处理链路:金字塔分层读取 → 低分辨率粗对齐 → 高分辨率细化。官方建议直接利用金字塔各层,避免自行下采样的开销数据集论文。
整条链路的关键设计取舍有三处:工作分辨率的选择(精度与算力的平衡点通常在 1-4 µm/pixel);特征表示的选择(跨染色是否需要归一化或深度特征,见 §6.5 坑点 6);形变模型的容量(过强的形变能力会把"组织不重合"区域强行拉扯出物理不合理的映射,见坑点 3)。下面的代码覆盖前两处的最小实现。
# 预处理三步:单染色归一化特征提取 → 多分辨率配准 → 物理单位误差计算
# 依赖:pip install openslide-python numpy scikit-image opencv-python-headless
import openslide
import numpy as np
import cv2
def read_level(slide_path: str, target_mpp: float = 4.0, size: int = 4096):
"""读取金字塔中 µm/pixel 最接近 target_mpp 的层(配准通常在 2-8 µm/px 下进行)。
注意:read_region 的坐标始终是 level-0(最高分辨率)坐标系。"""
slide = openslide.OpenSlide(slide_path)
mpp0 = float(slide.properties[openslide.PROPERTY_NAME_MPP_X]) # ≈0.92 µm/px
best_lvl = min(range(slide.level_count),
key=lambda i: abs(mpp0 * slide.level_downsamples[i] - target_mpp))
w, h = slide.level_dimensions[best_lvl]
img = slide.read_region((0, 0), best_lvl, (w, h)).convert("RGB")
return cv2.cvtColor(np.array(img), cv2.COLOR_RGB2GRAY)
def coarse_align(gray_fixed, gray_moving):
"""低分辨率粗对齐:去饱和组织纹理 + ECC 或特征匹配估计全局仿射。
生产建议直接使用开源框架 DeeperHistReg / VALIS,此处仅示意最小流程。"""
sift = cv2.SIFT_create(nfeatures=8000)
k1, d1 = sift.detectAndCompute(gray_fixed, None)
k2, d2 = sift.detectAndCompute(gray_moving, None)
matcher = cv2.BFMatcher()
matches = matcher.knnMatch(d2, d1, k=2)
good = [m for m, n in matches if m.distance < 0.75 * n.distance] # Lowe ratio
src = np.float32([k2[m.queryIdx].pt for m in good]).reshape(-1, 1, 2)
dst = np.float32([k1[m.trainIdx].pt for m in good]).reshape(-1, 1, 2)
M, inliers = cv2.estimateAffinePartial2D(src, dst, method=cv2.RANSAC,
ransacReprojThreshold=5.0)
return M, inliers.mean() # 全局仿射 + 内点率(鲁棒性指标)
后续细化步骤:把粗对齐结果作为初始变换,在更低目标 MPP(1-2 µm/px)上做非刚性形变(B-spline 或深度学习位移场);完整可复用的实现见挑战赛 2023 冠军方法 RegWSI 的开源框架 DeeperHistReg(PyPI 包 + Docker 双发布)。
跨染色场景下的一个关键预处理组件是染色归一化(stain normalization)——把不同切片的染色强度分布映射到统一参考,能显著提高传统特征匹配的内点率:
# 简化版 Reinhard 风格颜色归一化(在 Lab 空间按均值/方差对齐参考图)
# 适合作为传统配准管线的预处理;深度特征管线(SuperPoint 等)通常无需此步
import numpy as np
import cv2
def reinhard_norm(img_bgr: np.ndarray, ref_bgr: np.ndarray) -> np.ndarray:
"""把 img_bgr 的 Lab 色彩统计对齐到 ref_bgr。两图均应为低分辨率采样。"""
img_lab = cv2.cvtColor(img_bgr, cv2.COLOR_BGR2Lab).astype(np.float32)
ref_mean, ref_std = cv2.meanStdDev(cv2.cvtColor(ref_bgr, cv2.COLOR_BGR2Lab).astype(np.float32))
img_mean, img_std = cv2.meanStdDev(img_lab)
normed = (img_lab - img_mean.reshape(1, 1, 3)) / (img_std.reshape(1, 1, 3) + 1e-8)
normed = normed * ref_std.reshape(1, 1, 3) + ref_mean.reshape(1, 1, 3)
return cv2.cvtColor(np.clip(normed, 0, 255).astype(np.uint8), cv2.COLOR_Lab2BGR)
多分辨率策略建议:粗对齐在 8-16 µm/pixel(金字塔高层)完成,特征匹配在 2-4 µm/pixel,非刚性细化在 1-2 µm/pixel;不要在最高分辨率层(0.92 µm/pixel)上做全局搜索——内存与时间开销都会爆炸,而精度收益集中在细化阶段。
§6.4 PyTorch DataLoader
# ACROBAT 图像对采样 Dataset:以 case 为单位配对 H&E(fixed) 与 IHC(moving),
# 在指定 µm/pixel 目标分辨率下从金字塔随机裁剪成对 patch(同一物理位置附近)。
# 依赖:torch, openslide-python, pandas
import openslide
import pandas as pd
import numpy as np
import torch
from torch.utils.data import Dataset, DataLoader
from pathlib import Path
class AcrobatPairDataset(Dataset):
"""最小可用子集:valid 子集(200 张 WSI = 100 对)。训练可用 train 子集同理构造。"""
def __init__(self, data_root, split="valid", patch_size=512, target_mpp=4.0):
self.root = Path(data_root)
self.meta = pd.read_csv(self.root / "df_acrobat_meta.csv")
self.meta = self.meta[self.meta["set"] == split]
self.pairs = []
for case_id, grp in self.meta.groupby("caseid"):
he = grp[grp["stain"].str.lower().str.contains("he")]
ihc = grp[~grp.index.isin(he.index)]
if len(he) and len(ihc):
self.pairs.append((case_id, he.index[0], ihc.index[0]))
self.patch_size, self.target_mpp = patch_size, target_mpp
def _find(self, row):
stain_tag = "he" if "he" in str(row["stain"]).lower() else str(row["stain"]).lower()
hits = list(self.root.rglob(f"{row['caseid']}_{stain_tag}_*.tiff"))
return hits[0]
def _read_pair_patch(self, he_path, ihc_path, center_frac=(0.5, 0.5)):
"""在两幅 WSI 的同比例物理位置各取一个 patch(粗对齐前的朴素配对采样;
严格训练应在粗对齐后的坐标系内采样,见 §6.5 坑点 8)。"""
patches = []
for path in (he_path, ihc_path):
slide = openslide.OpenSlide(path)
mpp0 = float(slide.properties[openslide.PROPERTY_NAME_MPP_X])
lvl = min(range(slide.level_count),
key=lambda i: abs(mpp0 * slide.level_downsamples[i] - self.target_mpp))
w, h = slide.level_dimensions[lvl]
cx, cy = int(w * center_frac[0]), int(h * center_frac[1])
s = self.patch_size
img = slide.read_region((max(cx - s // 2, 0), max(cy - s // 2, 0)),
lvl, (s, s)).convert("RGB")
patches.append(torch.from_numpy(np.array(img)).permute(2, 0, 1).float() / 255.0)
return patches # [he_patch, ihc_patch]
def __len__(self):
return len(self.pairs)
def __getitem__(self, idx):
case_id, he_idx, ihc_idx = self.pairs[idx]
he_img = self._find(self.meta.loc[he_idx])
ihc_img = self._find(self.meta.loc[ihc_idx])
he_patch, ihc_patch = self._read_pair_patch(he_img, ihc_img)
return {"case_id": case_id, "fixed": he_patch, "moving": ihc_patch}
loader = DataLoader(AcrobatPairDataset("data_root"), batch_size=4, num_workers=4)
for batch in loader:
print(batch["case_id"], batch["fixed"].shape, batch["moving"].shape)
break
在 DataLoader 之上叠加 transform 与训练循环的典型骨架(以无监督配准损失为例):
# 训练循环骨架:无监督图像相似性损失(NCC/MSE)+ 平滑正则,
# 监督信号只来自图像对本身——训练集没有 landmark(见 §3.5)
import torch.nn as nn
class UnsupRegLoss(nn.Module):
def __init__(self, lam_smooth=0.5):
super().__init__()
self.lam_smooth = lam_smooth
self.sim = nn.MSELoss() # 跨染色下 NCC 通常优于 MSE
def forward(self, fixed, moving, disp_field):
warped = _warp(moving, disp_field) # 空间变换网络,按框架实现
loss_sim = self.sim(warped, fixed)
grad = disp_field[..., 1:] - disp_field[..., :-1] # 一阶差分近似平滑项
loss_smooth = (grad ** 2).mean()
return loss_sim + self.lam_smooth * loss_smooth
model, optimizer = _build_registration_model(), torch.optim.Adam(
_build_registration_model().parameters(), lr=1e-4)
for epoch in range(epochs):
for batch in loader:
fixed, moving = batch["fixed"].cuda(), batch["moving"].cuda()
disp = model(fixed, moving)
loss = UnsupRegLoss()(fixed, moving, disp)
optimizer.zero_grad(); loss.backward(); optimizer.step()
注意:本节代码给出的是"最小可运行骨架",用于理解数据接口与损失结构;生产级实现建议直接采用 DeeperHistReg 等经过挑战赛验证的框架(§6.7),在其上做数据适配而非从零造轮子。
§6.5 坑点清单
⚠️ 坑点 1:把发布分辨率当 40X 原始扫描(分类:预处理陷阱)
问题:官方以 10X(约 0.92 µm/pixel)发布金字塔 TIFF,原始 40X(约 0.23 µm/pixel)扫描未随数据集分发。沿用"病理 WSI 默认 0.25 µm/px"的假设会导致像素-物理距离换算错约 3.7 倍,TRE 数值全部失真。
症状:自己算出的 TRE 与官网评估相差一个数量级;非刚性形变幅度估计异常偏大。
解决:
- 简单方法:所有距离换算一律乘以
df_acrobat_meta.csv中该 WSI 该层的 microns-per-pixel,或读 OpenSlide 属性PROPERTY_NAME_MPP_X。- 进阶方法:封装
px_to_um(coords, mpp)工具函数,在数据加载与评估两处统一调用,禁止散落硬编码。- SOTA 方法:配准 pipeline 全程以 µm 为工作单位(如 DeeperHistReg 的做法),仅在 IO 边界做像素换算。
参考:数据集论文 §Data Records;SND 元数据 readme
⚠️ 坑点 2:本地无法复现测试集 TRE(分类:评估误用)
问题:公开的只有 IHC 侧 landmark;H&E 侧真值由主办方持有,训练集则完全没有标注。很多团队把"本地测试误差"当官方成绩报告,实际上不可比。
症状:论文/报告中的 TRE 与 MedIA 2024 论文 Table 2 对不上;reviewer 质疑评估协议。
解决:
- 简单方法:模型选择与消融只用验证集官网自动评估器(每日 2 次提交,无限期开放)。
- 进阶方法:测试集评估通过官网"Email Organizer"申请,注意 2026-07 起政策为每算法每 4 个月限 1 次,需预留排期。
- SOTA 方法:对比方法时统一引用 MedIA 2024 论文报告的官方测试数值,自己复现的部分明确标注"验证集结果"。
参考:ACROBAT 官网;挑战赛论文
⚠️ 坑点 3:把"组织内容不重合"当算法失败(分类:标签理解)
问题:同一 case 的切片来自同一蜡块但不一定连续,厚度数微米的切片之间存在组织丢失/新增:部分区域只存在于单张切片中,物理上不存在对应点。
症状:某些图像对的 TRE 尾部极长(90th 百分位被拉高);目视检查"配错"的区域实际在一侧没有对应组织。
解决:
- 简单方法:报告指标时使用官方口径(每图像对 TRE 90th 百分位的中位数),理解它是为容忍尾部失效设计的。
- 进阶方法:自评估时模仿官方过滤——剔除与人类标注者一致性差(>115 µm)的 landmark 与 landmark 密度过低(<10 个)的 WSI。
- SOTA 方法:为形变场加"不可能映射"正则(拓扑保持/折叠惩罚),把不可对应区域显式建模为外点而非强行拉扯。
参考:挑战赛论文 §2.2-2.3
⚠️ 坑点 4:自定义划分按 WSI 而非 case 分组(分类:数据泄漏)
问题:同 case 的 H&E 与 IHC 来自同一蜡块,纹理与染色模式高度相关;按 WSI 随机划分会让"几乎相同的组织"同时出现在训练与验证侧,误差被系统性低估。
症状:自划分数值远好于官网验证集成绩;跨染色泛化实验(如只用 ER 训练)看不出泛化落差。
解决:
- 简单方法:任何再划分使用 GroupShuffleSplit/GroupKFold(group = caseid)。
- 进阶方法:跨染色泛化实验按官方 2023 思路设计——训练集染色与评估染色完全不相交。
- SOTA 方法:报告时同时给出"case 内插值"与"case 外推"两套结果,并声明测试集图像与公开 landmark 从未参与训练。
参考:数据集论文 §Methods(测试集分层抽样);ACROBAT 官网 2023 设定
⚠️ 坑点 5:前景分割删掉病灶与伪影区(分类:预处理陷阱)
问题:数据集刻意保留折叠、笔 mark、气泡、玻璃裂纹等真实伪影以考察鲁棒性。常见 Otsu/颜色阈值前景分割会把大片伪影或淡染组织误判为背景,而 landmark 恰恰可能落在被删区域。
症状:部分图像对 landmark 落在"分割出的背景"上被迫丢弃;内点率骤降但原因不明。
解决:
- 简单方法:不做显式前景分割,直接用 RANSAC 类方法过滤误匹配(2022 冠军 Gestalt Diagnostics 即刻意避免显式分割以提升伪影鲁棒性)。
- 进阶方法:仅在极低分辨率(如 16-32 µm/px)做粗组织定位用于引导搜索窗,不在工作分辨率上删内容。
- SOTA 方法:伪影感知的置信度加权——按局部梯度/纹理质量为匹配点加权,而非硬性二值化。
参考:挑战赛 2022 总结(Gestalt Diagnostics 冠军方法分析);数据集论文 §Technical Validation
⚠️ 坑点 6:跨染色直接用 RGB 强度匹配(分类:预处理陷阱)
问题:H&E 与 IHC、核染色(ER/PGR/KI67)与膜染色(HER2)之间的外观差异巨大,基于强度/纹理的传统匹配在同一染色内有效、跨染色大量失败。
症状:SIFT/ORB 内点率接近零;粗对齐给出完全错误的全局变换,后续非刚性细化无法挽救。
解决:
- 简单方法:先做 stain normalization(Macenko/Vahadane)再匹配,或用形态学边缘(组织边界、腺体结构)替代原始强度。
- 进阶方法:用 SuperPoint+SuperGlue 等深度特征做匹配——2022 八强中有 7 支采用深度学习特征匹配,6 支采用特征法而非强度法。
- SOTA 方法:RegWSI 的两步法——深度特征初始对齐 + 强度非刚性细化,不需要按数据集微调即可跨染色工作。
参考:挑战赛论文;RegWSI(ACROBAT 2023 冠军)
⚠️ 坑点 7:ZIP 分包校验与体积陷阱(分类:工程陷阱)
问题:448.6 GiB 分 7 包下载,部分下载损坏是常态;SND 页面以 GiB 标注而论文以 GB 描述,跨文档核对体积时容易误判下载是否完整。
症状:解压到一半报 CRC 错误;磁盘按 482 GB 预留却在"压缩包 + 解压副本 + 中间产物"叠加后爆盘。
解决:
- 简单方法:下载后先
sha1sum -c zipfiles_sha1_checksums.txt再解压;用*_zip_listing.txt预览内容决定只解压需要的子集。- 进阶方法:
unzip -n(不覆盖)支持断点式恢复;训练只用 train 包、评估只用 valid/test 包时分开解压。- SOTA 方法:预留 ≥1 TB 空间并配额监控;在共享集群上把解压后的只读目录用只读权限挂载给多用户。
参考:SND 数据集页(含各文件清单与校验和)
⚠️ 坑点 8:gigapixel WSI 整图载入与坐标系混用(分类:工程陷阱)
问题:单张 WSI 在 10X 下可达数万像素宽(数十亿像素),
np.array(openslide 读整图)会直接 OOM;OpenSlide 的read_region位置参数永远是 level-0 坐标系,与"当前层坐标"混用会产生错位 patch。
症状:worker 内存暴涨、DataLoader 卡死;配准结果整体有半 patch 的平移,粗对齐阶段内点率异常低。
解决:
- 简单方法:永远通过金字塔
read_region((x0_l0, y0_l0), level, size)分块读取;坐标换算封装成lvl_xy = l0_xy / level_downsamples[level]。- 进阶方法:DataLoader worker 数按"峰值内存 = workers × 单 patch 内存"预算;大图处理用 memory-map 式的 tile 迭代器。
- SOTA 方法:使用支持任意金字塔层输出与坐标系换算的框架(DeeperHistReg 支持至 220k × 220k 像素的 WSI 配准输出)。
参考:OpenSlide 基础 API 文档;DeeperHistReg
§6.6 数据增强
- ✅ 安全:随机旋转(90° 的倍数与扫描仪差异一致——WSI 无固有方向)、随机翻转、亮度/对比度抖动、随机缩放(在 2-8 µm/px 工作区间内)、随机 patch 位置采样、弹性形变(模拟切片制备形变,幅度控制在数十 µm 级)。
- ❌ 危险:跨染色颜色增强(会破坏"染色即模态"的监督结构——把 H&E 增强成 IHC 色调等于伪造数据);大幅度的 cutout/擦除(可能恰好擦掉 landmark 对应结构);任何依赖"两图同增强参数"假设却分别施加的增强(破坏对应关系)。
一条实用原则:空间增强必须对图像对(fixed/moving)施加同一变换参数或仅在 fixed 侧施加——配准任务的监督结构建立在两图的空间对应上,任何破坏对应关系的增强都会把任务变成噪声拟合;颜色类增强则只应作用于单侧或彻底禁用(见上)。弹性形变增强虽然能模拟制备形变、提升形变场泛化,但幅度上限建议控制在切片厚度的物理量级(数十 µm),过强的弹性形变会让模型学会"无视真实形变信号"。
§6.7 模型推荐
| 场景 | 推荐方案 | 起点 |
|---|---|---|
| 开箱即用的多染色配准 | DeeperHistReg(RegWSI,ACROBAT 2023 冠军) | PyPI 包 + Docker,无需微调 |
| 经典特征配准基线 | SIFT/SuperPoint + RANSAC + B-spline 细化 | OpenCV / kornia |
| 深度特征匹配 | SuperPoint + SuperGlue(2022 八强主流) | 官方预训练权重 |
| 端到端学习形变场 | VoxelMorph 类框架(无监督 NCC 损失) | 需按 §6.5 坑点 3/6 改造跨染色设定 |
| 树结构/分区配准 | 三角剖分分区 + 局部仿射(2022 冠军思路) | 需自行实现,论文公开 |
选型补充:DeeperHistReg 与传统管线的本质区别在于"免数据集微调"——若你的目标是发表新方法而非解决业务问题,建议以传统管线为 baseline、以 DeeperHistReg 为强 baseline 双向报告;若目标是业务落地,直接采用 DeeperHistReg 并把工程精力投入数据适配与监控。所有路线的共同前提是把 §6.5 的坑点 1(MPP 换算)与坑点 5(伪影)处理正确,这两项不依赖方法选择。
§6.8 硬件需求
| 配置 | CPU | 内存 | GPU | 磁盘 | 适用 |
|---|---|---|---|---|---|
| 最低可用 | 8 核 | 32 GB | 无 | 500 GB | 验证集粗对齐 + 官网评估闭环 |
| 推荐研发 | 16 核 | 64 GB | 1 × 24 GB(如 RTX 4090/A5000) | 1 TB | 全数据集预处理 + 深度特征匹配 |
| 大规模训练 | 32 核 | 128 GB | 2 × 40 GB+ | 2 TB | 端到端形变场训练 + 多实验并行 |
内存预算的粗略估算方法:单 worker 峰值 ≈ 同一时刻驻留的 patch 数 × 单 patch 内存(512 × 512 × 3 × 4 字节 ≈ 3 MB)+ OpenSlide 句柄与解码缓冲(每句柄约百 MB 级);因此瓶颈通常在"同时打开的 WSI 句柄数"而非 patch 大小。GPU 显存的消耗主体是形变场与特征图——在 2-4 µm/px 工作分辨率下,一张 4090 可容纳 batch 4-8 的 1024² 图像对训练;把目标分辨率提到 1 µm/px 以下时显存需求近似平方增长,建议改用多尺度策略而非硬调分辨率。
§6.9 评估指标代码
官方主指标:每图像对 TRE 90th 百分位的中位数(median of per-pair 90th percentiles of landmark distances),单位 µm官网。选择"90th 百分位的中位数"作为主指标而非均值,是挑战赛在鲁棒性与敏感性之间的刻意平衡:均值会被少数失败图像对主导,而 90th 百分位既容忍每对内少量不可对应的 landmark,又对系统性失效敏感;再取中位数聚合则防止个别极端图像对左右总排名。理解这一设计后,自评估时应同时报告 p50 与 p90 两个口径——两者差距过大即是方法稳定性不足的信号。复现计算如下:
实现这一指标时最常见的两个错误:把"全部 landmark 的 90th 百分位"(跨图像对混合计算)当成"每图像对 90th 百分位再取中位数"——前者会被 landmark 多的图像对主导;忘记乘 µm/pixel 直接用像素距离,数值差约 1.1 倍(1 px ≈ 0.92 µm,恰好在同一量级,错误不易察觉)。
# 官方主指标复现:输入为你的配准变换作用后的 H&E 预测点与官方目标点(同一坐标系)
# 注意先做 px -> µm 换算(见 §6.5 坑点 1),再计算距离
import numpy as np
def median_p90_tre(pred_xy_px: np.ndarray, target_xy_px: np.ndarray,
microns_per_pixel: float) -> float:
"""pred/target: (N, 2) 数组,同一图像对的配准后 landmark 与目标 landmark。
返回该图像对的 TRE 90th 百分位(µm)。多图像对再取中位数聚合。"""
dist_um = np.linalg.norm(pred_xy_px - target_xy_px, axis=1) * microns_per_pixel
return float(np.percentile(dist_um, 90))
# 多图像对聚合:官方排名依据 = 各图像对 p90 的中位数
# pair_p90 = [median_p90_tre(pred_i, tgt_i, mpp_i) for i in pairs]
# final_score = float(np.median(pair_p90))
补充指标(MedIA 2024 论文同报):TRE 中位数/均值(landmark 级)、平均距离缩减(top 方法 >95%)、以及与标注者间距离(DBA)的对照——DBA 是"人类一致性"基准(测试集 67.0 µm @ 中位 90th 百分位口径)。
# 完整评估流程示意:逐图像对计算 p90 TRE,再取中位数聚合,并与人类 DBA 对照
# pred_dict: {case_id: {"pred_xy": (N,2), "target_xy": (N,2), "mpp": 0.92}}
# target_xy 应来自官方评估通道返回值或官方公开 landmark 的对应目标(不可自造)
import numpy as np
def evaluate(pred_dict: dict, human_dba_um: float = 67.0) -> dict:
pair_p90, reductions = [], []
for case_id, rec in pred_dict.items():
pred = np.asarray(rec["pred_xy"], dtype=float)
tgt = np.asarray(rec["target_xy"], dtype=float)
mpp = float(rec["mpp"])
d_init = np.linalg.norm(rec.get("init_xy", tgt) - tgt, axis=1) * mpp
d_final = np.linalg.norm(pred - tgt, axis=1) * mpp
pair_p90.append(np.percentile(d_final, 90))
if d_init.size:
reductions.append(1.0 - d_final.mean() / d_init.mean())
return {
"median_p90_tre_um": float(np.median(pair_p90)), # 官方主指标
"mean_distance_reduction": float(np.mean(reductions)),
"vs_human_dba": float(np.median(pair_p90)) / human_dba_um, # <1 即优于人类一致性
}
解读参考线:2022 测试集冠军的主指标为 60.1 µm、人类双标注者一致性(DBA)为 67.0 µm,比值约 0.90;如果你的自评结果显著好于人类一致性,先怀疑评估协议有泄漏(见 §6.5 坑点 2/4),再庆祝。
§6.10 MLOps 笔记
- 数据版本化:SND Version 1(2023)是唯一数据版本;用 DVC/MLflow 把
zipfiles_sha1_checksums.txt的校验记录绑进实验元数据,保证可追溯。 - 评估服务依赖:验证集 leaderboard 是外部服务,提交次数有限(每日 2 次);把每次提交的配准 landmark 文件与返回分数存档,避免重复消耗提交额度。
- 测试集申请管理:测试评估(Email Organizer)每算法每 4 个月 1 次(2026-07 起政策),应作为里程碑事件而非迭代手段。
- 可复现性:报告结果时固定 openslide/libvips 版本(不同版本对某些 TIFF 压缩的解码行为可能有差异),并随代码发布配准后 landmark 文件而非只有指标。
- 磁盘与缓存治理:482 GB 数据 + 各分辨率缓存的中间产物增长很快;patch 缓存建议带 MPP 与金字塔层号命名(如
case_er_4.0mpp_l2/),避免不同实验的缓存互相污染。 - 提交物规范化:官方要求提交附公开算法描述(如 arXiv 链接)且开源代码可获奖项加分——把方法文档、代码仓库与提交 landmark 文件三者的版本号绑定发布,方便赛后复查与引用。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解 |
|---|---|---|---|
| 单中心偏倚 | 全部切片来自斯德哥尔摩 Södersjukhuset 一家医院,同一染色协议与同一实验室数字化 | 高 | 跨中心使用前先在小样本上验证;关注 ACROBAT 2023 域偏移设定 |
| 设备同质性 | 仅 3 台 Hamamatsu NanoZoomer 扫描仪,无其他厂商设备 | 中 | 对异 scanner 数据(Aperio、Leica 等)需自行测试色彩/分辨率适配 |
| 女性单病种 | 全部为女性原发性乳腺癌切除标本,器官与人群单一 | 中(任务内)/低(配准方法学研究) | 方法学研究可结合 ANHIR/HyReCo 做多器官验证 |
| 存档蜡块老化 | 切片来自 2012-2018 年存档;LME 分析显示存龄 5 年以上的切片配准误差近乎翻倍 | 中 | 训练/评估时按切片存龄分层报告;避免只用新蜡块数据微调 |
| 伪影保留 | 折叠、笔 mark、气泡刻意保留(为考察鲁棒性) | 低(设计使然) | 按 §6.5 坑点 5 设计伪影鲁棒方法;报告时区分伪影子群 |
这张偏倚表的整体结论:ACROBAT 的偏倚几乎全部来自"单一中心 + 最小元数据"这一发布设计的两面性——真实性与可控性兼备,但泛化外推必须自行举证。好消息是这些偏倚都有明确的缓解路径(外部验证、分层报告、归一化),且论文本身已经示范了其中大半的做法。
§7.2 标注质量
标注质量有量化背书:13 名受过组织病理学教育的标注者中 2 名有病理学家训练背景;测试集全部图像对经双标注者独立标注,50% 的 landmark 距离小于 20 µm、80% 小于 60 µm;测试数据另经一名专科病理医生在 40X 下复核确认可用性数据集论文。第二阶段注入 ±115 µm 噪声的重标设计有效防止了标注记忆。局限:验证集仅单标注者,无第二意见;landmark 密度(约 50 个/图)只能约束点位邻域,无法保证点间形变的物理合理性。
| 标注维度 | 验证集 | 测试集 |
|---|---|---|
| 标注者数量 | 1 人/图像对 | 2 人/图像对(87 种标注者组合) |
| 标注流程 | 单阶段直接放置 | 两阶段:直接放置 + 噪声注入重标(±115 µm) |
| landmark 总数 | 10,040 | 44,760(过滤后 13,130 进入评估) |
| 评估资格过滤 | 无 | 双标注者距离 >115 µm 的点剔除;剩余 <10 点的 WSI 剔除(297/303 例保留) |
| 额外复核 | — | 1 名专科病理医生 40X 全片复核 |
§7.3 泛化性
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 同中心同染色(训练分布内) | 低 | 2022 挑战冠军 TRE 60.1 µm ≈ 人类一致性 67.0 µm |
| 未公开 IHC 染色(域偏移) | 中-高 | ACROBAT 2023 专设 200 例未公开染色盲评;仅 4 队提交,难度显著高于 2022 |
| 其他器官/其他中心 | 高 | 数据集为单中心单病种;官方建议结合 ANHIR 验证多器官泛化 |
| 异 scanner(非 Hamamatsu) | 中-高 | 数据集内无此类数据;染色-扫描仪响应差异未覆盖 |
| 存龄 >5 年的蜡块 | 中 | LME 分析:存龄 5 年以上切片误差近乎翻倍(挑战赛论文) |
这张表实际上给出了使用者的两条行动准则:其一,凡声称"在 ACROBAT 上表现良好"的方法,都应进一步报告其在 2023 域偏移设定或多中心数据上的表现,否则结论只覆盖第一行场景;其二,泛化失败往往不是模型容量问题而是预处理假设问题(染色协议、扫描仪、蜡块存龄都会改变输入分布),按 §7.1 的缓解列逐项排查通常比换模型更有效。
§7.4 伦理
研究获斯德哥尔摩地区伦理审查机构批准(ref 2017/2106-31,修订 2018/1462-32、2019-02336);因回顾性设计豁免知情同意。数据发布前已完成系统脱敏:删除 macro 图像、随机化 case ID、覆写含个人信息元数据字段,SND 将数据集声明为不含个人数据。图像内容为组织切片,不含面部或可识别身份的人体特征。
从治理角度,这个"回顾性 + 豁免同意 + 系统脱敏 + 开放许可"的组合是欧洲临床数据开放共享的代表性实践;使用者在此基础上再分发的衍生数据集,仍应保持脱敏标准并注明原始许可(CC-BY 要求署名),不得对衍生数据施加超出原许可的限制。
§7.5 公平性
数据集不包含人口统计学元数据(年龄、种族等),无法进行分层公平性审计;人群范围限于瑞典斯德哥尔摩地区女性乳腺癌手术病例。将基于该数据训练的模型跨人群/跨医疗体系部署时,应假设存在人群代表性缺口并另行验证。
值得区分的是任务类型对公平性风险的传导方式:配准是"结构对齐"任务而非"诊断决策"任务,其误差分布更可能受染色协议与组织处理差异驱动,而非患者人群属性本身——这意味着用 ACROBAT 训练的配准组件在跨人群部署时的公平性风险相对可控;但由它赋能的下游任务(如 stain-guided 的标志物预测)会继承人群缺口,公平性审计应放在下游任务层面做。
§7.6 数据漂移
数据为静态存档(2012-2018 病例、2022 数字化、2023 定稿 v1),不存在持续采集带来的时间漂移;但"历史存档→当下临床"的漂移方向存在:染色试剂批次、扫描固件与临床流程在 2018 年后仍会演化。把 ACROBAT 上训练的模型用于当下临床数据时,至少应检查三个漂移源:染色强度分布(可用 §6.3 的归一化统计量做监控指标)、扫描仪构成(数据集只有 Hamamatsu 三型号)、蜡块处理流程(脱蜡、固定时间的年度差异会反映在组织形态上)。建议在部署管线中内置低分辨率 Lab 空间统计的分布监控,一旦当前临床数据的 Lab 均值/方差超出训练分布的若干倍标准差即触发告警。官方在 2026-07 仍通过新增评估请求支持社区验证,未见计划发布 v2 数据。
§7.7 DAIMS 24 项检查
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 元数据表每行一张 WSI,结构规整 |
| 2 | 唯一标识 | ✅ | 随机 case ID + 文件名编码 caseid_stain_set,全局唯一 |
| 3 | 特殊字符 | ✅ | 随机 ID 与枚举染色名均为纯字母数字,无特殊字符风险 |
| 4 | 重复行 | ✅ | 元数据每 WSI 一行,无重复 |
| 5 | 缺失编码 | ⚠️ | 无缺失值编码机制;每例 IHC 数量不等但元数据内无原因标记 |
| 6 | 标签标识 | ✅ | landmark 坐标定义清晰(IHC 侧、40X 坐标系),标注协议公开 |
| 7 | 罕见类分组 | ⚠️ | 无类别标签;各 IHC 抗体的切片数量分布未单独披露 |
| 8 | 偏倚评估 | ✅ | 论文含 LME 协变量分析(存龄、染色、组织类别等)与分层抽样 |
| 9 | 数据字典 | ✅ | df_acrobat_meta_readme.txt + 论文 Table 2 双重文档化 |
| 10 | 信息性缺失解释 | ✅ | landmark 少于 50 个的原因(跨染色外观差异)在论文中明确解释 |
| 11 | 设备记录 | ✅ | 3 台扫描仪型号记录完整,测试集按扫描仪分层抽样 |
| 12 | 共线性 | ✅ | 纯图像数据集,无表格特征共线性问题 |
| 13 | 编码映射 | ✅ | stain 枚举(H&E/ER/PGR/HER2/KI67)语义明确,与 ICD-11/SNOMED 映射见 §2 |
| 14 | 时间戳处理 | ⚠️ | 元数据无时间戳;切片存龄仅存在于论文层面分析 |
| 15 | 划分建议 | ✅ | 官方三划分明确且经两届挑战验证(见 §5) |
| 16 | 泄漏讨论 | ✅ | 官方制定防信息泄漏参赛规则;case 级聚合要求明确(见 §5.3) |
| 17 | 标签分布 | ⚠️ | landmark 总量与覆盖披露完整,但按染色/器官区域的分布未披露 |
| 18 | 测量偏倚 | ⚠️ | 测试集双标注一致性已量化;验证集单标注者无第二意见 |
| 19 | 外部验证建议 | ✅ | 官方列举下游任务;社区已有 ANHIR/HyReCo 交叉验证实践 |
| 20 | 版本记录 | ✅ | SND Version 1(2023)+ 论文/时间轴完整(见 §1.4) |
| 21 | 预处理脚本 | ⚠️ | 官方提供评估与可视化代码;NDPI→TIFF 脱敏转换管线仅开源工具级,无端到端脚本 |
| 22 | 合规要求 | ✅ | CC-BY 开放、SND 声明无个人数据、使用通报非强制 |
| 23 | 多模态对齐 | ✅ | 数据集核心资产即人工对齐真值(54,800 landmark) |
| 24 | 去标识化 | ✅ | 删 macro、随机 ID、覆写元数据、无个人数据声明四重保障 |
DAIMS 评分:21 / 24(✅ 18 项、⚠️ 6 项、❌ 0 项)
评分解读:21/24 属于高质量研究级数据集。扣分全部集中在"元数据工程"而非"数据本体":图像、划分、对齐标注、去标识化四项核心资产全部达标,这与它由同一团队为单一目标(配准挑战)精心构建的背景一致。6 个 ⚠️ 中,5 项(缺失编码、罕见类分组、时间戳、标签分布、测量偏倚)源于"元数据最小化"的脱敏策略——以不收集临床变量为代价换取发布合规;1 项(预处理脚本)反映官方把管线代码放在独立仓库而非数据包内。
对你意味着什么:如果你的任务是 WSI 配准、stain-guided 学习或标注转移,可以放心以 case 为粒度直接使用官方划分,不需要额外清洗;如果你的任务需要临床协变量(年龄、分期、标志物状态、时间线),这个数据集无法满足,需搭配外部队列(如 TCGA-BRCA)并放弃"同例对齐"优势;如果你要把模型推到多中心/异 scanner 环境,务必先在 ANHIR 或自有数据上做 §7.3 列出的泛化验证,并把切片存龄纳入分析变量。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| ANHIR | 多中心多器官组织学(2019 挑战) | 多染色组织学非刚性配准 | TRE | RegWSI 在 ANHIR 上"位居最佳方法之列",但非榜首 | 在乳腺癌单病种训练的方法可迁移至多器官设定,精度略有让步 |
| HyReCo | 再染色 + 连续切片参考集 | 再染色切片配准 | TRE | RegWSI 在 HyReCo 达到"细胞级配准精度" | 无需数据集微调的混合方法可跨切片类型保持精度 |
以上均为同行评审结果(RegWSI,CMPB 2024)。其余七种 2022 方法未见系统性的跨数据集外部验证报告。
§8 基准性能与生态
§8.1 排行榜
ACROBAT 2022 官方测试集(303 例,主指标 = 每图像对 TRE 90th 百分位的中位数):
| 排名 | 方法/团队 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | Gestalt Diagnostics | 中位 90th 百分位 TRE 60.1 µm | 2022 | 树状三角剖分分区 + 深度学习特征匹配,不依赖显式前景分割 | Weitz P., Valkonen M., Solorzano L. et al., 2024, Medical Image Analysis. doi:10.1016/j.media.2024.103257 | 部分八强方法代码开源(论文逐一给出链接) |
| 参考线 | 人类标注者一致性(DBA) | 67.0 µm | 2022 | 双标注者独立标注距离 | 同上 | — |
| 1(2023 设定) | RegWSI(Wodzinski 等) | ACROBAT 2023 冠军(Docker 盲评,数值见原论文) | 2023 | 深度特征初始对齐 + 强度非刚性细化,免微调 | Wodzinski M., Marini N., Atzori M., Müller H., 2024, Computer Methods and Programs in Biomedicine. doi:10.1016/j.cmpb.2024.108187 | DeeperHistReg(PyPI + Docker) |
⚠️ 数值不可直接比较:2022 测试集为 H&E-IHC 对 + landmark 提交,2023 测试集含 IHC-IHC 对与未公开染色、Docker 盲评,两届口径不同;2022 其余 7 个进入测试评估的方法数值见 MedIA 2024 论文 Table 2(官方未在网页端公开逐一数值)。八强方法范式统计:6/8 采用特征匹配、7/8 采用深度学习组件。
§8.2 SOTA 总结与选型建议
- 领域现状:ACROBAT 2022 确立了"算法逼近人类一致性"的结论,且概念迥异的方法(特征匹配、深度配准、树分区)性能趋同——选型时工程可用性比排行榜名次更重要。
- 开箱即用首选:DeeperHistReg(2023 冠军框架),免微调、跨染色、支持 220k × 220k 像素输出,PyPI/Docker 双发布。
- 追求鲁棒性:参考 2022 冠军 Gestalt Diagnostics 的设计决策——避免显式前景分割、RANSAC 式外点处理。
- 论文基线复现:统一引用 MedIA 2024 的官方测试数值;自研方法的改进量在验证集 leaderboard 上报告。
- 低算力起步:先用传统特征管线(SIFT + RANSAC + B-spline)在验证集上建立基线,再决定是否引入深度组件——2022 八强的范式统计表明两条路线精度趋同,基线不必然落后。
- 工程迁移:若已有医学影像配准管线(如基于 MONAI/VoxelMorph),把跨染色匹配作为主要适配点(§6.5 坑点 6),形变场与优化器部分可直接复用。
§8.3 评测协议
官方协议要点:训练集无标注、允许外部数据;验证集 IHC landmark 公开,注册后可提交配准结果(每日 2 次)获得自动 TRE 反馈;测试集 H&E 侧真值保密——2022 年由主办方赛末一次性评测,2026-07 起改为按申请评测(每算法每 4 个月限 1 次);2023 年起测试评估要求 Docker 容器提交以实现完全盲评。提交必须附公开的算法描述(如 arXiv 链接),否则不计名次;开源代码可获额外奖项资格官网。
| 协议要素 | ACROBAT 2022 | ACROBAT 2023 |
|---|---|---|
| 提交物 | 配准后的验证/测试 landmark 坐标 | Docker 容器(内部运行配准并输出变换后 landmark) |
| 测试集构成 | 303 例 H&E-IHC 对(公开四染色) | 200 例,含 IHC-IHC 对与未公开 IHC 染色 |
| 参与者对测试数据的可见性 | 可下载测试图像与公开 landmark | 完全盲(图像与染色由主办方持有) |
| 提交队伍/方法 | 16 队 221 次验证提交,8 方法入测试 | 4 支队伍提交 |
| 防作弊机制 | 同机构不同部门方可参赛 | Docker 盲评 + 未公开染色 |
| 附加激励 | 开源代码评奖加分 | 同左 |
参与协议的三条实操提醒:验证集提交前的注册在 grand-challenge.org 平台完成,算法描述链接(arXiv 等)是提交有效性的一部分,勿在截止后才补文档;Docker 提交(2023 设定)应在本地用相同基础镜像预演,容器内不可访问网络与测试图像之外的数据;若依赖 2026-07 后的测试评估申请,把"4 个月 1 次"的时间约束写进项目计划,避免论文截稿与评估排期冲突。
§8.4 相关数据集
| 数据集 | 关系 | 适用场景 |
|---|---|---|
| ANHIR | 前置挑战(2019),多器官多中心组织学配准 | 多器官泛化验证 |
| HyReCo | 同团队谱系的连续/再染色切片参考集 | 切片级精度消融 |
| Learn2Reg | 通用医学图像配准挑战(含多个模态任务) | 配准方法学横向比较 |
| CAMELYON16 / PANDA | 同为乳腺癌病理 WSI,但为检测/分级任务 | 下游任务对比、stain-guided 目标 |
| TCGA-BRCA | 公开乳腺癌 H&E WSI(含临床与基因组数据) | 需要临床协变量/预后标签的补充数据源(无跨染色对齐) |
组合使用建议:ACROBAT 负责跨染色对齐与 stain-guided 信号,TCGA-BRCA 负责临床终点与大队列,ANHIR/HyReCo 负责泛化声明——四者覆盖"对齐-预测-泛化"的完整证据链。
§8.5 关键论文
- Weitz P. et al., 2023, Scientific Data. doi:10.1038/s41597-023-02422-6 — 数据集描述论文:规模、脱敏管线、标注协议与下游用途的权威出处。
- Weitz P., Valkonen M. et al., 2024, Medical Image Analysis. doi:10.1016/j.media.2024.103257 — 2022 挑战结果:8 方法系统比较、LME 协变量分析、人类一致性对照。
- Wodzinski M. et al., 2024, Computer Methods and Programs in Biomedicine. doi:10.1016/j.cmpb.2024.108187 — ACROBAT 2023 冠军 RegWSI:免微调混合式配准与跨数据集验证。
- Wodzinski M., Marini N. et al., 2024, arXiv:2404.14434 — DeeperHistReg 框架:冠军方法的生产级开源实现。
- Rantalainen M. & Hartman J., 2023, SND 数据集引用(DOI 10.48723/w728-p041) — 数据集的正式引用条目。
- Murugesan G. K. et al.(HISTAI 作者组), 2025, arXiv:2505.12120 — 将 ACROBAT 列为多模态配准稀缺资源的大规模数据集综述。
阅读顺序建议: newcomers 先读 1(数据集是什么)再读 3(怎么用、怎么评);方法研究者直接读 2 与 3 的对比实验部分;工程集成者读 4(DeeperHistReg 文档)配合本条目 §6。
§8.6 社区活跃度
挑战赛官网验证集评估系统无限期开放,且 2026-07 官网仍在发布政策更新与评估支持公告,说明主办方持续维护;GitHub 仓库 rantalainenGroup/ACROBAT 提供评估与可视化代码;配准社区(Learn2Reg、DeeperHistReg 等项目)持续将 ACROBAT 用作标准评测集。数据集论文(2023)与挑战论文(2024)发表后均被后续 WSI 配准与基础模型工作引用(截至 2026-09,具体引用计数请以 Google Scholar 实时数据为准)。
对社区贡献者的三个接入点:其一,验证集评估无需任何申请,注册 grand-challenge.org 账号即可提交,是参与门槛最低的方式;其二,测试集评估申请(Email Organizer)适合已有成熟方法、需要论文级数据的团队,注意 4 个月限 1 次的排期约束;其三,GitHub 仓库接受与评估指标、可视化相关的问题与修复,标注协议文档则是理解公开数据语义的第一手材料。
§8.7 生态快照
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| 挑战赛官网 | 官方主页 + 评估服务 | https://acrobat.grand-challenge.org/ | 验证集自动评估、测试集评估申请入口 |
| SND 数据集页 | 官方下载 | https://researchdata.se/en/catalogue/dataset/2022-190-1 | 唯一官方下载渠道(CC-BY,含校验与清单) |
| GitHub 仓库 | 官方代码 | https://github.com/rantalainenGroup/ACROBAT | landmark 可视化、TRE 计算代码、标注协议 |
| DeeperHistReg | 开源框架 | PyPI / arXiv:2404.14434 | 2023 冠军方法,开箱即用的多染色配准 |
| TissUUMaps | 可视化工具 | https://tissuumaps.github.io/ | 官方标注工具底座,可叠加 landmark 查看 |
| ABCAP 联盟 | 标注组织 | https://abcap.org/ | 13 名标注者所属研究联盟 |
生态使用的整体建议:把官网当作"评估通道"、SND 当作"数据通道"、GitHub 当作"代码通道",三者职责分离且都由主办方维护——遇到问题时先判断属于哪条通道(评估结果异常找官网、文件损坏找 SND、指标计算歧义找 GitHub),可显著缩短排查路径。
§9 相关资源与引用
§9.1 官方资源索引
- 挑战赛官网:https://acrobat.grand-challenge.org/ — 任务设定、验证集评估入口、最新评估政策(2026-07 更新)。
- 任务与数据总览页:https://acrobat.grand-challenge.org/Overview/ — 数据构成、指标定义与提交规则的官方 TLDR。
- 数据下载(CC-BY):https://researchdata.se/en/catalogue/dataset/2022-190-1 — 唯一官方下载渠道,含 17 个文件(7 个 ZIP + 元数据 + 清单 + 校验和)。
- 官方代码仓库:https://github.com/rantalainenGroup/ACROBAT — TRE 评估指标代码、landmark 可视化工具、两阶段标注协议全文。
- 数据集描述论文:https://doi.org/10.1038/s41597-023-02422-6 — 规模、脱敏管线、技术验证的权威出处(开放获取)。
- 挑战赛结果论文:https://doi.org/10.1016/j.media.2024.103257 — 八强方法比较与协变量分析(需订阅或预印本)。
- MICCAI 官方挑战列表:http://miccai.org/sig/sig-challenges — ACROBAT 条目 DOI 10.5281/zenodo.6361804,MICCAI 挑战合规性背书。
- 数据集论文预印本:https://arxiv.org/abs/2211.13621 — 免订阅版本,含作者单位与资助信息全文。
- 冠军方法框架文档:DeeperHistReg(arXiv:2404.14434,PyPI 与 Docker 双发布)— 生产级多染色配准的参考实现。
§9.2 BibTeX 引用
@article{weitz2023multi,
title = {A Multi-Stain Breast Cancer Histological Whole-Slide-Image Data Set from Routine Diagnostics},
author = {Weitz, Philippe and Valkonen, Masi and Solorzano, Leslie and Hartman, Johan and Ruusuvuori, Pekka and Rantalainen, Mattias},
journal = {Scientific Data},
volume = {10},
pages = {562},
year = {2023},
doi = {10.1038/s41597-023-02422-6}
}
@article{weitz2024acrobat,
title = {The {ACROBAT} 2022 challenge: Automatic registration of breast cancer tissue},
author = {Weitz, Philippe and Valkonen, Masi and Solorzano, Leslie and Carr, Circe and Kartasalo, Kimmo and Hartman, Johan and Ruusuvuori, Pekka and Rantalainen, Mattias},
journal = {Medical Image Analysis},
volume = {97},
pages = {103257},
year = {2024},
doi = {10.1016/j.media.2024.103257}
}
@article{wodzinski2024regwsi,
title = {{RegWSI}: Whole slide image registration using combined deep feature- and intensity-based methods: Winner of the {ACROBAT} 2023 challenge},
author = {Wodzinski, Marek and Marini, Niccol{\`o} and Atzori, Manfredo and M{\"u}ller, Henning},
journal = {Computer Methods and Programs in Biomedicine},
volume = {250},
pages = {108187},
year = {2024},
doi = {10.1016/j.cmpb.2024.108187}
}
@misc{rantalainen2023acrobat,
title = {{ACROBAT} -- a multi-stain breast cancer histological whole-slide-image data set from routine diagnostics for computational pathology},
author = {Rantalainen, Mattias and Hartman, Johan},
year = {2023},
publisher = {Swedish National Data Service},
version = {V1},
doi = {10.48723/w728-p041},
url = {https://researchdata.se/en/catalogue/dataset/2022-190-1}
}
§9.3 引用指南
使用数据本体时引用 weitz2023multi 与 rantalainen2023acrobat;比较配准方法性能时引用 weitz2024acrobat(2022 官方测试结果)与 wodzinski2024regwsi(2023 域偏移结果)。向 SND 通报使用情况(request@snd.gu.se)为非强制但受官方鼓励。
两点引用实践建议:其一,比较类论文应同时注明所用指标口径(主指标 = 每图像对 TRE 90th 百分位的中位数,单位 µm)与评估通道(验证集官网评估或测试集官方评测),二者不可混排;其二,引用 landmark 数量时注意口径差异——54,800 为全部人工标注点,10,040/44,760 为验证/测试集 IHC 侧公开点,13,130 为过滤后的测试评估点,37,208 为第三方引用的对应关系数,混用会造成事实性错误。
§10 AI 使用声明卡
§10.1 AI 模型列表
| 模型 | 用途 | 版本/日期 |
|---|---|---|
| 大语言模型(CodeBuddy Code 内置模型) | 条目结构生成、初稿撰写、代码示例生成 | 2026-09 |
§10.2 AI 参与范围
AI 参与了本条目的结构设计、文字初稿、代码示例与表格整理。全部事实性内容(规模数字、日期、许可、指标、方法归属)均来自 §10.3 所列公开来源,并由人工对照来源逐项核验;流行病学与临床意义的表述限于来源文献明确支持的范围,未做外推。代码示例经 API 文档核对与逻辑走查,但未在完整数据副本上端到端执行——下载体积(约 482 GB)超出审核环境磁盘配额,使用者首次运行时应以 valid.zip 最小子集验证(§6.1),发现问题欢迎通过页面反馈渠道指出。
§10.3 输入来源列表
- ACROBAT 挑战赛官网主页(acrobat.grand-challenge.org),检索日期 2026-09-13。
- ACROBAT 挑战赛 Overview 页(acrobat.grand-challenge.org/Overview/),检索日期 2026-09-13。
- SND 数据集页:Rantalainen M. & Hartman J., 2023, researchdata.se/en/catalogue/dataset/2022-190-1,DOI 10.48723/w728-p041。
- Weitz P. et al., 2023, “A Multi-Stain Breast Cancer Histological Whole-Slide-Image Data Set from Routine Diagnostics”, Scientific Data 10:562. doi:10.1038/s41597-023-02422-6(PMC10449765 全文)。
- Weitz P., Valkonen M. et al., 2024, “The ACROBAT 2022 Challenge: Automatic Registration of Breast Cancer Tissue”, Medical Image Analysis 97:103257. doi:10.1016/j.media.2024.103257(uni-luebeck.de 与 trepo.tuni.fi 全文 PDF)。
- Tampere University Research Portal 论文条目(researchportal.tuni.fi/en/publications/9d6682da-d0ad-4eba-bce3-434c540fc80b)。
- Wodzinski M. et al., 2024, “RegWSI: …Winner of the ACROBAT 2023 challenge”, CMPB 250:108187. doi:10.1016/j.cmpb.2024.108187(PubMed 38657383)。
- Wodzinski M. et al., 2024, arXiv:2404.13108(RegWSI 预印本全文)。
- Wodzinski M. et al., 2024, arXiv:2404.14434(DeeperHistReg 框架)。
- HISTAI 数据集论文, 2025, arXiv:2505.12120(对 ACROBAT 的第三方引用与 37,208 landmark 表述)。
- MICCAI Society 官方挑战列表(miccai.org/sig/sig-challenges,ACROBAT DOI 10.5281/zenodo.6361804)。
- Lacuna 论文摘要页对 MedIA 2024 论文的关键数值提取(lacuna.tiptreesystems.com,冠军 TRE 60.1 µm、DBA 67.0 µm)。
- B2FIND 元数据条目(b2find.eudat.eu/dataset/10850b0c-54c5-51aa-b196-eb6d616596c3)。
- Sci Data 论文 arXiv 预印本 arXiv:2211.13621(作者单位与致谢/资助信息)。
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| frontmatter 与 INFOBOX 数字 | 千方病案医学编辑部 | 对照 FACTS.md 与来源逐项核对 | ✅ 已通过/已验证 |
| §2 医学背景与术语映射 | 千方病案医学编辑部 | ICD-11/SNOMED 编码与文献交叉核对 | ✅ 已通过/已验证 |
| §3-§5 规格、划分与泄漏分析 | 千方病案医学编辑部(数据工程) | 对照 SND 页面与两篇论文全文 | ✅ 已通过/已验证 |
| §6 代码示例与坑点 | 千方病案医学编辑部(数据工程) | API 文档核对 + 逻辑走查 | ✅ 已通过/已验证 |
| §7-§8 质量评估与排行榜 | 千方病案医学编辑部 | DAIMS 逐项复核、数值溯源 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
除 §0 免责声明沿用机构标准文本外,本条目其余章节均由 AI 生成初稿并经人工核验修订;事实性数字的最终定稿以 §10.3 来源为准。修订的重点区域包括:坑点部分的表述从通用建议收敛到 ACROBAT 特有失败模式;排行榜部分剔除了来源未逐一核实的名次与数值;ICD-11/SNOMED 映射限定在数据集疾病域内,未外推到具体组织学亚型(数据集不含亚型标签)。
§10.6 最后人工审核日期
2026-09-05
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- bcnb — 共享标签:医学影像 / 病理图像 / 乳腺癌
- breastpathq — 共享标签:医学影像 / 病理图像 / 乳腺癌
- camelyon16-17 — 共享标签:医学影像 / 病理图像 / 乳腺癌
- nucls — 共享标签:医学影像 / 病理图像 / 乳腺癌
- tupac16 — 共享标签:医学影像 / 病理图像 / 乳腺癌
- mitos-atypia-14 — 共享标签:医学影像 / 病理图像 / 乳腺癌
- herohe — 共享标签:医学影像 / 病理图像 / 乳腺癌
- cytoimagenet — 共享标签:医学影像 / 病理图像
- nih-malaria — 共享标签:医学影像 / 病理图像
- lightmycells2 — 共享标签:医学影像 / 病理图像
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
