REG² (reg2026) — AI-Ready Wikipedia

第二届病理报告生成挑战赛——H&E 全切片→结构化报告+显式诊断推理链、~12K 例 7 器官 6 机构、Qwen3-8B 裁判评分、CC BY-NC-SA、S3 公开下载

来源 多机构 H&E 染色 WSI(TIFF,20x,匿名化)+CAP 协议结构化病理报告+思维链 CoT 问答标注+Metric B ROI 标注(tissue/background 与 original/perturbed 配对)发布时间: 2026-09-25最后更新: 2026-09-25 阅读 26
REG² (reg2026) — AI-Ready Wikipedia

信息速览

数据集名称REG² (reg2026) — AI-Ready Wikipedia
数据类型人工标注,原始数据,影像数据,文本数据
规模~12,000 训练例(官网 'about 12K' 口径,官网与 AWS 均注明挑战期内确切数可变)+Test1 350+Test2 70——6 机构 5 国
接入方式多机构 H&E 染色 WSI(TIFF,20x,匿名化)+CAP 协议结构化病理报告+思维链 CoT 问答标注+Metric B ROI 标注(tissue/background 与 original/perturbed 配对)
AI 就绪度

INFOBOX:reg2026 速览

字段 值
数据集 Pathologist Reasoning-Guided Report Generation (REG2026) Dataset
全称 Pathologist REasoning-Guided REport Generation Challenge(RE+RE=REG²)
届次 第二届(REG2025 随 MICCAI 2025 举办=第一届——Bioptimus 案例文"first global challenge"实锤)
主办 Korea University(AWS Registry "Managed By"口径)——MSIT/NRF+IITP、KHIDI、AWS、MCML 资助;TUM Schüffler Lab 参与组织
任务 H&E 全切片→结构化病理报告+显式诊断推理链(双接口:Metric A 推理链/Metric B 视觉落地)
模态 病理图像(H&E WSI,TIFF,20x,匿名化)+文本(CAP 协议结构化报告+CoT 问答)
规模 训练 ~12,000 例(7 器官)+Test1 350+Test2 70——6 机构 5 国(韩/日/土/印/德)
可获取性 S3 公开桶直链下载(AWS Registry of Open Data 收录)——公开直链型
评估 Metric A(路径有效性 5%+Edge F1 30%+MESS 25%+最终报告 40%)×70%+Metric B(背景拒绝/输入敏感/跨区一致 30/30/40)×30%;裁判=本地 Qwen3-8B+PubMedBERT
榜单 终榜 = 0.3×Test1+0.7×Test2;Debug 10 次/Test1 3 次/Test2 1 次
奖金 €800/€400/€200/€100+第 5 名证书——须过源码复现性检查才发放
License CC BY-NC-SA(官网+AWS 双口径)
时间线 注册 04-15→训练集 05-11→Test1 06-15~29→Test2 07-01~20→Top-3 于 09-27 起 MICCAI 会期宣布(未发生)
条目状态 赛后待宣期(早段):榜单已封、奖未宣——无 2026 终榜数字,成绩锚用 2025 届
家族 REG2025(第一届,~10,500 例 5 机构,冠军 ICGI/NARWHAL);库内同届互链 hecktor2026/topaneu2026/topbrain2026
DAIMS ~7.0(公开直链+双口径 license+评估代码开源加分;细则登录侧+待宣期扣分)
检索提示 一赛事四写法(REG²/REG2026/REG 2025/reg2026)——检索带 pathology/MICCAI 限定词,勿与补体 Reg2 基因混淆
阅读路线 赶时间读 INFOBOX+§0;参赛读 §2/§4/§11;做研究读 §3/§8;做评测读 §4+附录 S/C;引用前读附录 AN
档案类型 挑战赛型数据资产(第五类数据形态)——影像→文本生成任务族首条
制作时点 2026-09-25 抓取制作(MICCAI 2026 开幕前两天);附录 AE 生产档案

REG²:病理报告生成挑战赛的第二幕——从"对答案"到"看你怎么想"

导语:病理报告是诊断的"最终确认书",写它的人要在十亿像素的切片里找证据、比鉴别、定措辞——而上一届挑战赛只检查"最后的报告写得像不像参考答案"。2026 年的第二幕把规矩改了:推理过程本身也要交卷——一条链式问答跟着切片一起被评分,裁判从词汇重合度换成了本地大模型。本条目抓取于赛后待宣期:终榜已封、奖未宣、论文未出——我们把赛制讲透,把 2025 的成绩锚摆出来,把 2026 的空缺如实留白。

一句话身份卡:MICCAI 2026 病理报告生成挑战赛第二届 | ~12K 例 7 器官 6 机构 5 国 | 报告+推理链双交卷 | Qwen3-8B 本地裁判 | CC BY-NC-SA | S3 公开下载 | 赛后待宣期(Top-3 于 09-27 起宣布)| 奖金须过复现检查

如何读本条目:赶时间读 INFOBOX+§0;参赛读 §2/§4/§11+附录 U/AG;用数据做研究读 §3/§8+附录 W/AD;做评测设计读 §4+附录 C/S;写引用或检索读 §1/§10+附录 AC/AF。全文事实均可溯源至附录 Q 证据链;2026 成绩留白处均有维护触发点(附录 N)。

§0 条目定位

  • 本条目是 REG(Reasoning-guided rEport Generation)家族"现在时"档案:REG2025 是全球首个端到端 slide-to-report 挑战赛(Bioptimus 案例文明言 “the first global challenge for end-to-end slide-to-report systems”),REG² 2026 在其基础上把诊断推理显式化——库内以单条目覆盖两届(数据规模代差 ~14% 不满足分代建档的 50% 代差线,与 hecktor2026 需分代的情况不同)
  • 条目状态"赛后待宣期(早段)":抓取时点 2026-09-25——测试提交已关闭(07-20)、方法论文与代码已交(07 月底指引),但 Top-3 要到 09-27 起的 MICCAI 2026 会期才宣布——比 hecktor2026(Top 5 已于 08-20 公布)还早一个阶段,是库内"待宣期"家族里离官宣最远的样本——本条目以"赛制档案+数据资产+2025 成绩锚"为主体,2026 成绩如实留空
  • 条目身份:挑战赛型数据资产;影像→文本生成任务族——库内首个"报告生成+推理链"双交卷制挑战赛(对照 imcs-21 的结构化病理报告生成、pathvqa 的病理视觉问答——REG² 把两者合成一条链)
  • AI-Ready 视角三大看点:①CoT 问答链作为一等数据资产(~12K 例每例一条 question/answer/next_question 链——推理监督信号而非只有结果监督,训练数据形态本身即是论文级贡献);②LLM-as-judge 评估工程开源(本地 Qwen3-8B 裁判+断网 Docker 评估容器+与官方榜单同逻辑的本地复算管线——评估代码 06-02 即公开);③公开直链可获取性(S3 公开桶+AWS Registry 收录——挑战赛数据里少见的"注册即下"形态,对照 hecktor2026 的审核制)
  • 检索警示:一个赛事四种写法——官网标题用带上标的 REG²、URL 用 reg2026、领英宣传用 REG2026、arXiv 论文用 REG 2025(指上一届)——检索时四个写法都要试;且 “REG2” 与其他领域缩写(如补体调节蛋白 Reg2 基因)撞名,必须带 pathology/report generation/MICCAI 限定词

§1 届次谱系与名字消歧:RE 两次方

  • 两届编年表:
届 年份 挂靠 任务焦点 数据 结果锚
REG2025(第一届) 2025 MICCAI 2025(第 28 届)随会举办 端到端 slide-to-report——匹配参考报告 ~10,500 例,5 机构(Pan-Asia) 冠军 ICGI/NARWHAL(H-optimus-1 骨干);13 队终分 ≥0.6000
REG²(第二届) 2026 MICCAI 2026(斯特拉斯堡,09-27~10-01)卫星挑战赛 报告生成+显式推理链(agentic 议题入场) ~12,000 例,6 机构 5 国 待宣期——Top-3 于 09-27 起会期宣布
  • 名字构成:Pathologist REasoning-Guided REport Generation——两个 RE 取平方 REG²;上标 2 同时呼应"报告质量×推理质量"的二维评估设计(总分 70/30 加权)——名字即方法论
  • 2025→2026 的代际命题(官网 Challenge overview 原文语义):REG2025 的评估"依赖表面词汇分数(ROUGE-L、BLEU-4)与浅语义工具(SciSpacy、OpenBioLLM)——不能捕捉临床上真正要紧的东西:临床正确性、否定、安全关键发现的遗漏"——REG² 的解法是把病理学家写报告前的探索、比较、取舍过程(exploration、compare diagnoses、decide what belongs in the report)做成数据与评分的中心
  • agentic AI 议题入场:官网明言本赛"自然连接 agentic AI(规划、工具使用、多步决策)“,且要"在同一基准上比较 agentic 与 non-agentic 方法”——这是库内挑战赛条目中首个把 agentic 对照写进办赛目标的样本(对照:topbrain2026 的基础模型赛道按 Methods/Open 分轨,非 agentic 对照)
  • 教训 12 纪律执行记录:本届谱系核验无旧印象冲突(tracker 仅有"REG² 病理报告生成"候选名、无届次印象值),仍按纪律做了三源实锤:Bioptimus 案例文(“REG2025 challenge is the first global challenge”)+官网欢迎语(“builds on REG2025”)+TUM 新闻页(“Building on REG2025”)——第二届成立
  • 数据规模代差核算:10,500→12,000 约 +14%,低于分代建档 50% 代差线——单条目覆盖两届,代际差异在 §2/§4 内嵌说明
  • 代际命题的学术意义:官网对 2025 的批评(表面词汇分数漏掉临床正确性/否定/遗漏)实质是报告生成任务的"评测有效性"问题——当评测指标测不到临床上要紧的失效模式,排行榜第一不等于临床可用;REG² 的应对是把评测对象从"文本产物"扩展到"推理过程"——这与医学 AI 社区近年"从结果评测走向过程评测"的大方向一致,REG² 是病理域把这一转向做成大规模基准的首例(库内条目视角)
  • 为什么值得库内单独立条:即便不参赛,其数据形态(CoT 链标注)与评估工程(LLM 裁判+三测试)都是可迁移资产——辐射影像报告、内镜报告、超声报告等一切"影像→文本"场景都能复用(附录 S 展开三测试的迁移性)

§2 任务定义:一份报告,两张卷子

§2.1 总任务与临床语义

  • 输入:gigapixel 级 H&E 染色全切片图像(WSI,TIFF 格式,已匿名化并只保留 20x 放大率层)
  • 输出一(报告):结构化病理报告——字段含 organ(器官)、procedure(术式)、histologic type(组织学类型)、histologic grade(组织学分级);报告按 CAP(美国病理学家学院)协议标准化,诊断命名遵循 WHO 肿瘤分类的组织学类型与亚型术语——两大规范锚定意味着生成结果可直接对照真实报告体系审计
  • 输出二(推理链):显式诊断推理——官网要求"不仅产出报告,还产出与病理学家探索和 reportability 判定对齐的结构化推理"(structured reasoning aligned with pathologist exploration and reportability decisions)
  • reportability 的语义(术语表 29 的展开):可报告性是病理书写里最微妙的一层判断——同一张切片上看到的每个发现都"真实",但不是每个发现都该进正式报告(偶然发现的层级/临床相关性的权重/重复信息的省略);把它写进赛题意味着模型必须具备"取舍得当"的判断而非"知无不言"的堆砌——这与 §7.3 的诊断过度指定失效模式正好互为表里
  • 临床背景:病理检查常是诊断的最终确认与金标准,书面报告居下游临床决策的中心;病理学家必须综合十亿像素切片、关注细粒度临床决定性特征——任务难度在"看全+看准+写对"三重

§2.2 双接口双指标(Metric A/Metric B)

接口 指标 提交文件 内容形态
interf1 Metric A:Workflow Reasoning(工作流推理) chain-of-thought.json 每 WSI 一条推理链:[{question, answer, next_question}, …],末步 next_question 为空串,链末产出最终报告
interf0 Metric B:Visual Grounding(视觉落地) visual-context-response.json 每 ROI 一条 {id, answer};ROI 表含 anonymous_id/image/variant(original 或 perturbed)/配对 id/label(tissue 或 background)/question 七列
  • Metric A 的数据语义:CoT 问答对按"实际病理报告书写过程"构建——每问的答案引出下一问,问题序列构成一张有向推理图(question→next_question 的边),终点问题产出完整报告——评分因此能检查"路径走没走对"而不只是"终点对不对"(Edge F1 评边、binary path validity 评路径可达性、最终报告 40% 评终点质量——见 §4)
  • Metric B 的数据语义:三种子测试设计——①背景拒绝(label=background 的 ROI 应被拒答/识别为无组织);②输入敏感性(同一 ROI 的 original 与 perturbed 变体配对——答案应随扰动一致变化而非随机翻转);③跨区一致性(同切片不同 ROI 的回答不应自相矛盾)——三招合起来考的是"模型到底看没看图",是幻觉检测的工程化
  • 提交形态:Docker 算法容器(每例一跑)+平台侧评估容器(单次跑完 predictions.json 全部任务);官方仓库提供 algorithm_submission_template 基线模板——官方明言"从模板改起,不要从零搭管线"
  • 两接口的协作关系:一次完整推理应同时产出两种工件——推理链(A)回答"我是怎么想的",ROI 问答(B)回答"我看的证据在哪";官方总分配比 70/30 表明 A 是主战场——但 B 的三测试(附录 S)是"证据真实性"的守门员,B 崩了 A 再好也只是"流畅的胡说";把 A/B 当作"生成器+验证器"组合设计而非两个独立任务,是对这套赛制最自然的工程解读

§2.3 agentic 议题的位置

  • 官网把"agentic vs non-agentic 同台"列为办赛目标之一——CoT 链式接口天然适配多步决策系统(先规划看哪、再取证、再定结论);但赛制并不强制使用 agentic 架构——接口标准化而非架构强制化,让纯 MIL/Transformer 管线也能交同一格式卷子
  • 对照 2025:冠军 NARWHAL 与多数头部队是 ABMIL/Transformer 生成管线(见 §7)——2026 若 agentic 系统与传统管线同榜,将是该领域首个同基准对照(结果待宣期后回填)

§2.4 推理链数据的生产与消费视角

  • 生产侧(标注怎么来的):官方口径"CoT 问答对按实际病理报告书写过程构建"——即由具备报告书写经验的人把自然工作流拆解为问题序列,每问的答案就是该步工作流的产物;这意味着 CoT 链不是模型自生成的伪标注,而是人类工作流的结构化投影——其监督信号质量高于常见"模型合成 CoT"(后者常带自洽性幻觉)
  • 消费侧(能拿来训什么):
    1. 链式 SFT:每条 {question, answer} 对都是一步指令微调样本——按链序拼接即成多轮推理对话训练数据(对照单轮 VQA 数据的离散性)
    2. 过程奖励建模(PRM)素材:链中每步有 next_question 转移关系——可构造"步骤正确性"的中间监督,训练过程奖励模型(对照只有终报对错的结果奖励)
    3. 图结构学习:question→next_question 的边集天然构成推理图——Edge F1 评分逻辑本身说明组织方按图结构对待推理链;下游可做路径规划/子图检索类研究
    4. Metric B 对齐训练:ROI 级问答+扰动配对可直接做视觉落地(visual grounding)对比学习——"答案必须绑定看图证据"的对齐信号
  • 与现有推理数据集的差异:数学/代码推理链(GSM8K 系)验证器是规则化的;本数据集的验证器是 LLM 裁判+嵌入——临床推理没有符号化真值,这个差异本身就是研究题(裁判模型的可靠性是 2026 overview 论文值得回答的问题)
  • 规模观感:~12K 条链按平均 5-10 步估算可产出 6-12 万步级监督样本——对 VLM 微调量级合适,对预训练不够(本数据集定位是基准+微调,非预训练语料)

§3 数据集:七器官、六机构、一条链

§3.1 规模与切分

切分 例数 发布时点 说明
Training ~12,000 2026-05-11 含 WSI+报告+CoT 全标注
Test Phase 1 350 2026-06-15(仅 WSI) 无真值报告/CoT 发布
Test Phase 2 70 07-01 每队仅 1 次提交
  • 官网与 AWS Registry 均注明"确切例数在挑战期内可能调整"——~12,000 为约数存照
  • Test1 350 例 WSI 发布公告(06-15 Notice):格式与训练集一致,真值不随附——防泄漏纪律与 hecktor2026 同款
  • 训练集文件构成(按官网 Data description 与评估仓库格式推断的双件结构):WSI 图像(TIFF)+结构化报告与 CoT 的 JSON(train_CoT.json 官方文件名——06-01 修订通告点名)——即图像与文本标注分离存储,消费时按 anonymous_id/slide id 对齐
  • 标注分工:报告(CAP 字段)与 CoT(问答链)内容同源不同形——报告是"成文的终点",CoT 是"到达终点的过程重演";Metric B 的 ROI 标注另为一套(05-25 才发样例)——三套标注三种用途,消费前先分清

§3.2 器官与诊断覆盖

  • 7 器官:乳腺、结肠、肺、前列腺、胃、膀胱、子宫——常见癌种+癌前+良性+非肿瘤性全覆盖(官网器官-诊断类别表:乳腺的浸润性癌 NST/小叶癌/导管原位癌/纤维上皮肿瘤/乳头状肿瘤;结肠的腺癌/低级别与高级别管状腺瘤/增生性息肉/慢性活动性结肠炎;肺的腺癌/鳞癌/NSC-NOS/小细胞癌/肉芽肿性炎;前列腺的腺泡腺癌/小细胞癌/淋巴瘤/正常;胃的管状腺癌/低黏附性癌/混合性腺癌/慢性胃炎;膀胱的浸润性尿路上皮癌/原位癌;子宫的鳞癌/腺癌/子宫内膜样癌/平滑肌瘤等)
  • 诊断谱设计意图:良性/非肿瘤性实体入榜意味着模型必须"能说没病"——对照纯癌种数据集(如 NCT-CRC-HE-100K 只做 patch 级组织学分类),REG² 把 reportability 判定(该写什么、不该写什么)纳入任务本身

§3.3 六机构五国与扫描器异质性

机构 国家 扫描器
Korea University Medical Center 韩国 Aperio & Generic TIFF
Kameda 日本 Generic TIFF
Memorial Health Group 土耳其 Aperio
AIIMS(全印医学科学研究所) 印度 Hamamatsu NanoZoomer
University Hospital Cologne 德国 Aperio
TUM Hospital 德国 Leica GT450DX
  • 机构-国家易错点:Kameda 是日本机构(Kameda 医疗中心),Memorial Health Group 才是土耳其——机构、国家、扫描器三列对照读取,勿凭名字直觉归类
  • 扫描器四家(Aperio/通用 TIFF/Hamamatsu/Leica)——跨扫描器泛化是任务设计明线(2025 届Bioptimus 案例文:“diverse ethnic and different institutions from five countries”——多民族多机构泛化是评分考量)
  • 扫描器异质性的实操含义:不同扫描器的色彩响应/压缩伪影/切片边缘处理不同——训练时若按机构分桶做增广(色彩归一化/ stain normalization)可显著改善跨中心稳定性(2025 生态的 HSV 类 patch 选择与预处理流水线即是此类应对);Test 切分若含训练未见机构(2025 有 site hold-out 传统),则机构级泛化能力直接决定终榜——把"扫描器"当随机效应建模而非噪声,是该数据集的正确打开方式
  • 六机构五国与多国标注的含金量:语言层面全是英文 CAP 规范报告,但书写者母语/医学训练体系分属韩日土印德五国——报告风格差异(详略偏好/措辞习惯/分级表述)本身就藏在真值里;模型跨这种"软异质性"的稳健性是 2025 论文点名的一般化考验(“multi-country and multi-ethnic generalization”)
  • 与库内影像库的规模对照:~12K 训练例在自然图像域微不足道,但在 WSI 域是稀缺品(每例都是全片+专家报告+过程标注三重标注——单例标注成本高企);对照库内 NCT-CRC-HE-100K 的 10 万级 patch(patch 免费而报告昂贵),更能理解"报告级标注"的经济学
  • 2025 届数据资产(~10,500 例/5 机构/Pan-Asia 口径)作为独立数据集的档案见 §7 与附录 W——两届资产同许可同源生态,研究引用时可合并描述为"REG 系列"

§3.4 CoT 标注与数据修订史

  • CoT 结构(评估仓库 ground_truth 格式):每例一条链,元素三元组 {question, answer, next_question}——问答序列按真实报告书写过程构建,链式链接,末题产出最终报告且 next_question 为空串
  • 修订史四连(官网 Notice 逐条):
    1. 05-20:11 例训练 WSI 原始转换 TIFF 元数据/索引不完整——重转替换
    2. 05-25:Metric B 视觉落地样例发布(ROI 图像+标识+ROI-问题对的组织示例;官方明言"样例只为结构示范,训练用 ROI/背景区/问题需参赛者自建")
    3. 05-31:18 例训练 WSI 修订
    4. 06-01:train_CoT.json 中 8 例长条目 JSON 转换时截断——补全发布(不需重下全量)
  • 修订节奏密度(5 月内三次文件级修订+一次标注修复)——大赛数据集首发质量的真实水平线,提示下游使用者:拿到任何"v1"数据集都应预留对账窗口

§3.5 License 与可获取性

  • License:CC BY-NC-SA——官网 Data description 页与 AWS Registry 条目双口径一致(对照 hecktor2026 的单口径 SIG 清单+Zenodo DOI——REG² 无 Zenodo DOI 依赖,直接挂 AWS)
  • 可获取性:公开直链型——数据驻 AWS S3 公开桶 s3://reg2026-challenge-dataset,经 Registry of Open Data on AWS 收录(arn 记录在案);AWS 条目另列社区工具三件(PathfinderLab 的挑战赛介绍/数据描述/教程 notebook)
  • 参赛本身另需 Grand Challenge 认证账户(官网 Participation 节:先完善档案再申请验证)——数据公开≠比赛免注册,两层分离设计
  • 数据发表限制(官网 Publication and use 节原文语义):官方 meta paper 与论文集论文公开之前,参与者不得用挑战数据撰写或提交会议论文/预印本/期刊论文——例外须组织者事先书面许可——引用本数据集做二次研究前须核对 meta paper 状态
  • 获取路径实操(非参赛用途):①到 AWS Registry of Open Data 搜索 “reg-2026” 进入条目页;②按条目给出的 S3 桶(s3://reg2026-challenge-dataset)用 aws cli 同步(aws s3 cp/sync);③AWS 条目附 PathfinderLab 教程 notebook 可先跑通数据加载;④下载后按官网 Data description 的格式说明对账(注意 5-6 月四次修订公告——若镜像源较旧须比对 slide id 清单)
  • 参赛路径实操:官网 Participation→GC 账户验证→官方仓库模板起步→Debug 验证→Test 窗口提交——详见附录 U checklist 25 项

§4 评估体系:一个裁判模型、七个子分、一次加权

§4.1 Metric A(工作流推理)四子分

子分 键名 权重 语义
路径二值有效性 binary_path_validity 5% 推理链的 question→next_question 路径是否构成有效可达结构
边 F1 edge_f1 30% 参赛推理图与真值推理图的边集匹配 F1——考"思路覆盖"
MESS mess 25% 非最终步骤的语义分(键名与权重公开,公式细节在仓库 evaluate_metrics.py 内)
最终报告分 final_report_score 40% 链末产出报告的质量——考"终点质量"
  • 四子分合成 workflow_final_ranking_score——终点占四成、过程占六成:这是与 2025 最本质的代差(2025 只有终点分)
  • 裁判模型:本地 Qwen3-8B(仓库配置 JUDGE_MODEL_REPO_ID=Qwen/Qwen3-8B,权重 ~16GB,LocalQwenJudgeLLM 类)——LLM-as-judge 工程完全开源:评估容器断网运行(–network none),权重赛前下载到本地挂载——可复现性设计直达评估器本身

§4.2 Metric B(视觉落地)三子分

子分 键名 权重 语义
背景拒绝 background_rejection 30% 对无组织 ROI 的识别/拒答能力
输入敏感性 input_sensitivity 30% original vs perturbed 配对的答案一致性——考"是否真看了输入"
跨区一致性 cross_region_consistency 40% 同切片不同 ROI 回答不自相矛盾

三子分合成 visual_final_score。

  • 三子分联动解读:三项测试单独看都存在"退化策略"(全拒答/全保守/全复读)——但三项同时过线要求模型具备完整的视觉行为链:先分辨"有没有东西"(拒绝)→再看"是什么、变没变"(敏感)→最后保证"整片说法一致"(一致);这种行为组合式评分比单项指标加权更难被应试优化——设计者把"防作弊"直接编码进了权重结构,值得一切生成类评测借鉴

§4.3 总分与榜单合成

  • 总分 = 70% × workflow_final_ranking_score + 30% × visual_final_score(评估 README 原文:“Overall score = 70 % × workflow_final_ranking_score + 30 % × visual_final_score”)
  • 终榜 = 0.3 × Test Phase 1 + 0.7 × Test Phase 2(07-02 最终评估指引公告)——Test2 权重七成且每队仅一次提交:终局一投定生死
  • 提交额度:Debug 阶段每队 10 次(验证容器打包/输出格式,不计成绩,原 06-14 关闭后延至 06-29);Test1 每队 3 次;Test2 每队 1 次
  • 本地复算管线:评估代码 06-02 公开于同一 GitHub 仓库(submission_evaluation_code/ 目录),README 承诺"本地评分与官方榜单使用完全相同的评分逻辑"——库内挑战赛条目中首个"评估器全开源"样本(对照 hecktor2026 的指标公式未公开)
  • 额度策略数字例:假设终榜目标前五——Test1 三次的合理分配是第 1 投全量管线摸底(获得跨机构泛化的真实信号)、第 2 投针对第 1 投的 Metric B 失分项修复(背景拒绝与扰动敏感是可快速修的工程项)、第 3 投提交两者中本地复算分高者;Test2 唯一一投选"本地复算均值最高且方差最小"的版本而非"峰值最高"版本——70 例小样本意味着方差波动可能超过 0.05 分,稳健性优先

§4.4 2025→2026 指标演进对照

维度 REG2025(第一届) REG²(第二届)
评分核心 0.15×(ROUGE+BLEU)+0.4×KEY(Jaccard)+0.3×EMB(生物医学 LLM 嵌入余弦) 过程 60%(路径 5%+边 30%+MESS 25%)+终点 40%,LLM-as-judge
数据形态 WSI→报告配对 WSI→报告+CoT 推理链+ROI 视觉落地标注
被批评点 ROUGE-L/BLEU-4 表面词汇、SciSpacy/OpenBioLLM 浅语义——漏掉临床正确性/否定/安全关键遗漏 (未验收——待宣期)
嵌入工具 生物医学 LLM 嵌入 NeuML/pubmedbert-base-embeddings 句嵌入
基线差距锚 公开基线比头部提交低 16.9%(Phase 1)/30.4%(Phase 2) 未出
  • 2025 公式的 KEY 权重 0.4(临床关键词 Jaccard 覆盖)已经是"向临床对齐"的让步——但官网对它的批评一针见血:关键词对得上不等于临床正确(否定词、漏掉安全关键发现都能骗过词面匹配)——LLM 裁判是否真能解决这些坑,是 2026 overview 论文要回答的问题(未出)

§4.5 评估器工程细节(Docker 化全记录)

  • 双容器架构:算法容器(参赛模型,每例一跑——“one case per run”)与评估容器(官方评分,单次跑完全部任务——“processes every job listed in /input/predictions.json in a single run”)分离——平台按 pk 键组装预测与真值(manifest.json 映射)
  • 断网设计:评估容器以 --network none 运行——依赖全部打进镜像(Python 依赖+spaCy+PubMedBERT 嵌入),裁判权重运行前由宿主机下载到 ground_truth/Qwen3-8B/ 挂载进容器——评估可复现性不依赖运行时网络状态
  • 固定路径契约(README 第 9 节):/input/predictions.json(任务清单)、/input/<pk>/output/(每任务产物)、/opt/ml/input/data/ground_truth/(真值+权重)、/output/metrics.json(结果)——路径常量不可改,改布局须同步改 evaluate.py
  • 配置面(evaluation_config.env):裁判模型仓库 id(JUDGE_MODEL_REPO_ID=Qwen/Qwen3-8B)、运行设备(JUDGE_DEVICE=auto/cuda/cpu)、嵌入模型(EMBEDDING_MODEL=NeuML/pubmedbert-base-embeddings)、GPU 开关(USE_GPUS)、逐例结果开关(INCLUDE_PER_CASE_RESULTS)、详细调试块(INCLUDE_EVALUATION_DETAILS)——调试粒度可开关是成熟的评测工程标志
  • 评分输出:metrics.json 的 aggregates 节承载各子分与合成分;per-case 明细可开——参赛者可逐例归因
  • 本地-官方一致性:README 明言"输出分数使用与官方榜单完全相同的评分逻辑"——这是库内挑战赛条目中独一份的评估器开源承诺(对照:多数挑战赛只公开指标名不公开实现)

§5 时间线与待宣期状态

§5.1 全时间线(KST=UTC+9)

里程碑 日期(2026) 备注
注册开放 04-15 18:00 KST 同日"Save the dates"通告
训练数据发布+Debug 开放 05-11 18:00 KST Debug 原 06-14 关
数据修订 ×3 05-20 / 05-31 / 06-01 WSI 元数据/WSI 修订/CoT 补全
Metric B 样例 05-25 结构示范用
Debug 提交开放 05-30 每队 10 次
评估代码公开 06-02 GitHub 同仓库
Debug 延长 06-14 → 06-29 官网表内划线改记存照
Test Phase 1 06-15 ~ 06-29 350 例 WSI 发布;每队 3 次
Test Phase 2 07-01 ~ 07-20 每队 1 次(06-30 改 07-01 存照)
论文+代码提交 随 07-02 指引 OpenReview+GitHub 仓库强制
Top-3 宣布 09-27 起 MICCAI 会期(09-27~10-01) 抓取时点(09-25)未发生
workshop/论文集/camera-ready 官网明示另行公布 未给出
  • 里程碑解读四则:①注册到数据发布隔月(04-15→05-11)——给参赛者一个月组队备环境,节奏合理;②训练窗 7 周内夹了 4 次数据修订——对参赛者的对账纪律是隐性门槛;③Test1/Test2 之间无缝衔接(06-29→07-01)——不给"阶段间大改"留时间,考察的是稳态系统而非调参冲刺;④宣布日(09-27)恰是主会第一天——挑战赛揭晓是开幕日节目,曝光位极佳

§5.2 待宣期纪律执行

  • 三零自查:①全文 0 处 2026 成绩数字(终榜/队数/最高分均未公布);②0 处完成时表述指向未发生结果(Top-3 一律"将于 09-27 起会期宣布"时态);③0 处占位类词汇
  • 状态定位:库内挑战赛条目四态(未开始/进行时/赛后待宣期/完结时)中的第三态早段——比 hecktor2026(Top 5 已公布 08-20)更早、比进行时(topaneu2026 决赛前)更晚——待宣期内部再分早晚段是本条目对状态机的一次细化
  • 官网快照差异存照:4 月版页面奖金段写"额外奖金待学会/产业伙伴/MICCAI SIG 确认"——后期落实为 €800/400/200/100 确定金额——引用奖金信息须带抓取时点
  • 待宣期写作模板(本库纪律的可复用范式):①时间表述用"将于 X 宣布"禁止"已宣布";②成绩表述只引历史届("2025 届冠军是……"合法);③状态词用"待宣期(早段/晚段)"精确到段;④一切"最终/冠军/获奖"字样出现前自问——这个事实在抓取时点发生了吗;⑤条目内置维护触发点(附录 N)让回填成为计划而非遗忘

§6 组织与赞助生态

  • 主办方:Korea University——AWS Registry 条目 “Managed By: Korea University” 为数据资产归属口径;赞助名单首位同机构
  • 资助与赞助五源(官网 organizers 页):
    1. Korea University
    2. 韩国政府 MSIT 两通道:NRF"Digital-Bio AI+X 全球创新人才培养"项目(含 Hands-on Experience)+IITP"ICT Creative Consilience Program"
    3. 韩国保健福祉部:KHIDI"Korea Health Technology R&D Project"
    4. Amazon Web Services(AWS)——对应 S3 公开桶与 Registry 收录的基础设施投入
    5. Munich Center for Machine Learning(MCML)——欧洲侧学术网络触点
  • 参与组织:TUM(慕尼黑工业大学)病理研究所 Schüffler Lab 参与组织与科学发展(TUM 官网新闻页明言)——对应数据源 TUM Hospital(Leica GT450DX 扫描器)
  • 竞赛联络:Haasha Bin Atif(官网 organizers 页 Competition support 节列名+邮箱)——身份纪律:其公开学术档案(dblp/ORCID/Scholar)为 NUCES(巴基斯坦国家计算机与新兴科学大学)背景数据科学硕士,无 Korea University 任职公开记录——本条目只记"竞赛联络人",不虚构机构头衔;其名下 GitHub 仓库(Haasha/REG2026)为官方代码发布地
  • AWS 条目联系:vanitasahn@gmail.com——对应 arXiv:2609.00866 末位作者 Sangjeong Ahn(韩方组织层署名序尾部)
  • 2025 overview 论文署名群(55 人,arXiv:2609.00866,2026-09-01 提交,提交者/第一作者 Yumi Lee):含韩方组织层(Yumi/Harim/Hyoryung/Minji/Eunsu/Hyeseong 等)、多国病理学家(日本 Junya Fukuoka、俄罗斯-德国 Andrey Bychkov、土耳其 Serdar Balcı/Sulen Sarioglu、德国 Reinhard Buettner/Yuri Tolkach 等)、2025 参赛队代表(挪威 ICGI 的 Audun Ljone Henriksen/Sepp De Raedt、美国 PW 组 Prateek Prasanna 等)、以及 MICCAI 社区资深人物(Spyridon Bakas 等)——两届组织生态连续性的人物档案
  • MICCAI 2026 语境:第 29 届 MICCAI(09-27~10-01 斯特拉斯堡);卫星事件 58 workshops/45 challenges/9 tutorials;General Chair Mohammad Yaqub(同届 hecktor2026 条目已存照其双重身份);REG² 与 hecktor2026 同属这 45 个挑战赛(官网同届互链见 §9)
  • organizers 页读法:该页实为"赞助+联络"两节结构而非完整组委会名单——个人名单要到 arXiv 论文署名群(§6 55 人档案)与仓库所有者(Haasha)处补全;官网把个人身份做轻处理、把机构与资助做重处理——韩国学界常见的集体署名风格,引用时以机构为主语更稳
  • 资助结构解读:五源赞助的构成耐人寻味——两通道韩国政府科研资助(NRF 人才培养+IITP 学科交叉)说明这是国家级数字病理人才培养布局的一环("Digital-Bio AI+X"项目名即明示);AWS 的存在解释了 S3 公开桶与 Registry 收录的基础设施逻辑;MCML 则把欧洲学术网络接入——数据出 5 国、钱出自韩欧美的公共与产业混合——当代医学 AI 基准的典型筹资拼图

§7 第一届回顾(2025):冠军、生态与失效模式

§7.1 冠军方法 NARWHAL(ICGI,奥斯陆大学医院)

  • 团队:Institute for Cancer Genetics and Informatics(ICGI),Audun Ljone Henriksen 与 Sepp De Raedt
  • 系统三层:①TRIDENT 开源工具包做大尺度 WSI 预处理;②H-optimus-1(Bioptimus)做 tile 级特征——1.1B 参数 ViT-g/14、百万级 H&E 切片/80 万患者/4000+ 中心/50 器官自监督训练;③下游报告组件——从 tile 特征聚合出 slide 级向量再生成标准化临床报告
  • 选型纪律(Bioptimus 案例文):赛前严格对比五个基础模型骨干,H-optimus-1 在训练留出集上多轮基准的平均排名最高——骨干选择靠系统化消融而非直觉
  • 允许预训练、禁额外数据:2025 规则为"可用预训练模型,禁止在额外外部数据集上训练"——泛化能力考的是"预训练里带多少通用病理先验"

§7.2 参赛方法生态(arXiv:2609.00866 表 6 语义)

  • 分析样本:终分 ≥0.6000 的 13 队被请求提交代码与方法描述,11 队响应分析
  • 共同三段式:报告处理(规范化/层级化)→WSI 预处理→模型架构
  • 框架复用:Trident、CLAM、Prov-Gigapath 等验证过的开源管线成主流——"标准化管线复用"取代自研预处理
  • 基础模型清单:CONCH、TITAN、Virchow、UNI、GigaPath、H-Optimus-1、HistoEncoder(视觉);BioGPT、Qwen-3 8B、Flan-T5、GPT(文本/生成);SlideChat、Flamingo 系(多模态)
  • 代表性架构:ABMIL tile 聚合+Transformer 解码(ICGI 冠军系)、层级标注树+专家树生成(ICL_PathReport 的 Tree-of-Experts)、码本+结构化 Flan-T5(ADCT)、RAG 检索相似历史案例+Qwen-3 生成(MTS_REG_2025)、两阶段微调 SlideChat(REG_Path)等
  • 生态读法:头部方法普遍赢在结构化临床表示(层级化报告组织/多模态落地/中间诊断推理)而非"基础模型越大越好"——论文摘要原话:结果并不表明仅用 VLM 就能取得优越表现
  • 冠军方法复刻要点(以 2026 视角回看 2025 冠军栈):①TRIDENT 预处理可以直接沿用(开源且被多队验证);②骨干按官方 2025 消融方法论在自家数据上重测——H-optimus-1 的第一名不保证在你的器官子分布上仍然第一;③ABMIL 聚合器上加"层级化输出头"——把 CAP 四字段作为结构锚(先预测字段值再拼装成文),比自由生成更对评委胃口(2025 头部共性);④2026 新增项——把生成器接到链式接口上:每步输出一个小答案+下一步问题,比一次生成整份报告更贴合评分逻辑

§7.3 两大系统性失效模式(2026 赛题设计的直接动机)

  • 数值幻觉(numeric hallucination):定量属性估计不稳定——分级、计数、比例类字段易出错值
  • 诊断过度指定(diagnostic overspecification):倾向写出比证据更具体的诊断——“有些错误与常规病理的已知诊断陷阱相似”
  • 这两条失效模式解释了 REG² 为什么把推理过程纳入评分:终点对错只能暴露"错没错",过程审计才能暴露"怎么错的"——病理场景下错法比错值更有安全意义

§7.4 从 2025 方法生态看 2026 备赛策略

  • 起点选择:2025 头部生态已验证的起点——Trident/CLAM 预处理+病理基础模型骨干+ABMIL 聚合+小型生成器——这套栈在 2026 依旧成立,但需把输出层改成双接口(推理链+ROI 问答)
  • 增量一:链式监督:训练数据多了 CoT 链——把链上每步做 SFT(或 DPO 对齐)能直接对齐 Metric A 的中间步骤评分;2025 冠军的 n-gram 约束解码思路在链式生成中依旧适用(约束 next_question 的合法转移)
  • 增量二:视觉落地模块:Metric B 是 2025 没有的新战场——需要一个能接受 ROI 裁剪图的问答头;背景拒绝能力可用"背景 ROI+拒答标签"显式训练
  • 增量三:裁判适配:评分由 Qwen3-8B 裁判给出——参赛者可用同一裁判模型本地做 RLHF/DPO 的奖励信号(评估代码全开源使这一点可行)——但要警惕过拟合裁判(overview 论文大概率会讨论这个问题的防作弊边界)
  • 风险提示:Test2 仅 1 次提交+0.7 权重——所有策略验证必须在 Debug/Test1 完成;Test1 的 3 次额度建议 1 次全量管线+1 次消融+1 次终选

§8 AI-Ready 评估(DAIMS)

维度 评分 说明
D(Documentation) 8.5 官网五页+GitHub 评估 README 极详尽(数据格式/评分逻辑/容器流程全公开);细则全文在平台登录侧小扣
A(Accessibility) 8.5 S3 公开桶+AWS Registry 直链可下——挑战赛数据顶级可获取性;参赛另需 GC 认证账户
I(Interoperability) 8.0 TIFF/JSON 标准格式+CAP/WHO 规范锚定+评估容器 Docker 化;CoT 链格式为自定义 schema(有公开样例)
M(Machine-readability) 8.5 结构化 JSON 全程(CoT/ROI 表/预测文件);评估代码开源可本地复算
S(Sustainability) 6.0 AWS Registry 收录(托管方 Korea University)+"初始发布后无定期更新计划"声明;meta paper 与论文集状态决定长期引用锚
  • DAIMS 综合 ~7.0(公开直链+双口径 license+评估器全开源加分;细则登录侧+待宣期+更新承诺弱扣分)——对照:hecktor2026 ~6.9(审核制拉低 A 但档案深)、topbrain2026 ~7.2
  • 逐维详注:
    • D 8.5 的构成:官网四节正文+六 Notice+七 Updates 全文可得;评估 README 从格式到路径契约零含糊;扣分在规则细则全文锁在登录侧——文档的"公开/私有"断层是唯一硬伤
    • A 8.5 的构成:S3 直链+Registry 收录=发现与获取双容易;扣分在参赛通道的认证门槛与数据修订的对账成本(4 次修订须自查版本)
    • I 8.0 的构成:TIFF/JSON 标准容器+CAP/WHO 术语锚定=跨系统交换友好;CoT 自定义 schema 有样例无 formal schema 文件——机读无碍但严格验证需自查
    • M 8.5 的构成:预测/真值/输出三端全 JSON+评估器开源可复算——机器消费全链路通;扣分在 WSI 为原始 TIFF(TB 级大文件,流式读取需自备 openslide 系工具)
    • S 6.0 的构成:Registry 收录与机构托管保证"不消失";但官方声明"无定期更新计划"+挑战赛型数据的天然维护窗口短——五年后链接可用性存疑(本库健康监控将跟踪)
  • AI-Ready 训练就绪度:训练分割(~12K 例全标注)开箱即训;CoT 链可直接做 SFT(supervised fine-tuning)监督信号——库内首个"推理链监督"形态数据集,适合 VLM/agent 化病理系统的对齐训练
  • 复现就绪度:官方模板容器+评估代码+本地评分=提交管线半天可跑通(README 承诺"verify the pipeline end-to-end without setting anything up"——自带样例数据 20 任务)

§9 库内家族互链

  • 同届 MICCAI 2026 挑战赛:hecktor2026(头颈 PET/CT 第五届——同属 45 challenges,条目状态同为待宣期但已至"Top 5 公布"晚段)、topaneu2026(主动脉血管内介入)、topbrain2026(脑 MRI 基础模型)——四条目构成库内"MICCAI 2026 挑战赛系列"第一批
  • 病理 WSI 生态:panda(前列腺 Gleason 分级——WSI 块级评分先例)、NCT-CRC-HE-100K(patch 级组织学分类——与 WSI 全片级任务粒度对照)、bcss/consep/nucls/lizard(核与组织区分割家族)、midog(有丝分裂)、lunguage(肺病理结构化标注)、digestpath(消化道病理)
  • 报告生成先例:imcs-21(结构化病理报告生成——REG² 之前病理报告生成的胃镜域先例)、radgraph(放射报告结构标注——跨模态报告结构化的方法学对照)、ms-cxr(报告一致性校正)
  • 图文多模态:pathvqa(病理 VQA——Metric B 的问答形态先例)、roco/pmc-oa(病理图文对)
  • 互链策略:正文 6 处内链(本节之外:§0→imcs-21、§3.2→NCT-CRC-HE-100K、§3.3→panda、§4.4→radgraph、§9→hecktor2026/pathvqa);互链图重建由发布管线全库重算

§9.1 同届 MICCAI 2026 挑战赛系列对照

条目 任务域 数据形态 条目状态
hecktor2026(rid 638) 头颈 PET/CT 分割/分期/生存 影像+标注 mask+生存端点 待宣期晚段(Top 5 已公布)
topaneu2026(rid 637) 主动脉血管内介入 影像+手术数据 待宣期
topbrain2026(rid 632) 脑 MRI 基础模型 多任务下游评测 完结(终榜已回填)
reg2026(本条目) 病理报告生成+推理 影像+文本链 待宣期早段(Top-3 未宣)
  • 系列读法:四条目覆盖 MICCAI 2026 挑战赛的四个任务象限——影像结构预测(分割)、影像标签预测(分期/分级)、生存预后、影像→文本生成;REG² 补上了此前缺失的"生成+推理"象限——库内挑战赛数据形态版图的收口之作
  • 状态机读法:四条目恰好落在四态状态机的三个不同时相(完结/晚段/早段)——同届赛事因时间线设计不同而处于不同阶段,为"待宣期内部再分段"提供了横向参照

§9.2 病理库生态深度对照

  • 粒度光谱:patch 级(NCT-CRC-HE-100K 的 10 万级小图分类)→区域级(bcss 的区域分割、midog 的有丝分裂检测)→slide 级(panda 的全片 Gleason 评分)→slide→报告级(本条目)——REG² 处于粒度光谱的最右端,是"整片理解+语言产出"的极端形态
  • 监督形态光谱:分类标签(NCT)→空间 mask(bcss/consep)→序数评分(panda)→结构化文本(imcs-21/lunguage)→推理链(REG² CoT)——监督信息密度逐级上升,标注成本与数据规模逐级下降(1 万级 CoT 例 vs 10 万级分类 patch)——这是标注经济学的基本规律在本库内的活样本
  • 与 panda 的师承关系:panda(Prostate cANceR grade Assessment)证明了"WSI→临床评分"可行并催生了 MIL 方法爆发;REG² 把目标从"单一分数"换成"整份报告+推理"——难度数量级提升,但赛制设计(分阶段测试+额度控制)与工程配套(容器模板+评估开源)全面升级——两代赛制之间是五年方法学的距离
  • 与 imcs-21 的域差:imcs-21 是胃内镜病理报告(中文域、图像-报告对),REG² 是外科病理 WSI 报告(多国多器官、英文 CAP 规范)——两者覆盖"病理报告生成"的不同子域,库内同时持有可做跨域迁移研究
  • 与 pathvqa 的互补:pathvqa 是"单问单答"(VQA 形态);REG² Metric A 是"链式问答"(每答引出下问)——从 QA 到 QA-chain 正是本条目 §2.4 说的推理监督升级

§9.3 互链图影响面预估

  • 直接互链(正文 6 处):hecktor2026、panda、nct-crc-he-100k、imcs-21、radgraph、pathvqa
  • 标签共现预估(category_tags:医疗NLP/医学影像/多模态/病理图像/影像-文本对齐/挑战赛数据集):病理图像族约 20 条、医疗NLP 族约 15 条、多模态族约 10 条、挑战赛族 8 条——重建后相关度排名前列的邻接条目将是 imcs-21/panda/pathvqa/lunguage/roco
  • 新增入边(谁会链到本条目):无需回填——发布管线 link_builder 全库重算时按标签与引用自动建立;本条目为"挑战赛数据集+病理图像+医疗NLP"三标签交集的首条,预计成为该交集的中枢节点

§10 避坑清单(八则)

  1. 坑 1:一个赛事四种写法:REG²(官网)/reg2026(URL)/REG2026(领英)/REG 2025(arXiv 指上届)——检索与引用时四种都要覆盖,且 REG2025 特指第一届勿混用
  2. 坑 2:“第二届"勿写成"第一届”:部分中文技术博客把 2026 当首届——2025 已随 MICCAI 2025 举办第一届(三源实锤见 §1)
  3. 坑 3:时区陷阱:官网时间线全表 KST(UTC+9)——不是 MICCAI 主会的欧洲时区(CET);核对任何 deadline 前先看时区列
  4. 坑 4:时间线修订双存照:Debug 关闭 06-14→06-29、Test2 开放 06-30→07-01——官网表内以划线改记保留双值;引用时间线须注明版本
  5. 坑 5:机构-国家错位:Kameda 是日本、Memorial Health Group 是土耳其——勿凭机构名直觉归类;"Pan-Asia"口径与含德国机构的六机构表并存(§3.3 存照)
  6. 坑 6:奖金双版本:4 月版官网"额外奖金待确认"vs 后期 €800/400/200/100 落实——引用带时点;且拿名次≠拿钱——赛后源码复现性检查通过才发最终奖金(Prizes 页原文语义)
  7. 坑 7:数据发表限制:官方 meta paper+论文集公开前禁用挑战数据写论文(书面许可除外)——二次研究者与参赛队都受约束
  8. 坑 8:提交额度纪律:Test2 每队仅 1 次+终榜 0.3/0.7 加权——把 Test2 当"唯一决赛一投"来规划;Debug 的 10 次额度是验证容器而非刷分窗口

§10.1 下游使用者的坑

  • 只下 Test 不下训练:Test 分割仅 WSI 无真值——本地评测必须自建验证集(评估 README 提供从训练集划留出的完整流程)
  • 裁判权重忘下载:本地评估前须跑 download_model_weights.sh(Qwen3-8B ~16GB)——断网容器设计意味着权重必须在构建后、运行前就位
  • CoT 格式末步:next_question 必须以空串收尾——非空末步会被路径有效性检查判错
  • HF_TOKEN 泄漏:evaluation_config.env 若配置 Hugging Face 令牌须保持私密、勿入库
  • 旧镜像跑新数据:5-6 月四次数据修订后,旧特征缓存/旧预处理产物含被替换的 29 例 WSI——修订清单(11+18 例)必须与本地缓存对账,否则训练集混入脏数据
  • 把样例当真值:评估仓库 data/ 内置样例来自训练集且"solely as working examples"——用它自测分数可以,当成官方测试分布外推会得出误导性结论

§10.2 引用与写作的坑

  • 规模数字带口径:~12,000 是"官网 about 12K 且注明可变"的约数——勿写成精确数
  • 榜单成绩留白:待宣期内任何"2026 冠军/最高分"都是编造——成绩锚只用 2025(冠军 ICGI、基线差距 16.9%/30.4%)
  • 联络人身份:Haasha Bin Atif 只写"竞赛联络人"——公开档案无 Korea University 任职记录,勿推测头衔
  • Mess 不是"乱":MESS 是评估键名(语义分),非英文俚语——中英混排时注意
  • "Pan-Asia"勿绝对化:2025 论文的 Pan-Asia 口径与含两家德国机构的六机构表并存——引数据来源时用机构清单而非大陆标签
  • 奖金单位:REG² 用欧元(€800/€400/€200/€100),同届 hecktor2026 用美元($1,000/$500/$300)——跨条目对比勿混写货币符号

§11 使用建议(复现与训练路径)

  • 快速跑通评估(评估 README 四步):prepare_test_ground_truth.sh→prepare_test_input.sh→download_model_weights.sh(一次性 ~16GB)→do_test_run.sh——自带训练集样例 20 任务(Metric A 2 例+Metric B 18 例)零配置验证
  • 自建验证集:从训练集划出未训练子集填入 data/cases/(Metric B 填 rois_mapping.txt 七列表;Metric A 填 ground_truth_CoT.json 链式结构)——官方明言这是获得"接近榜单信号"的正路
  • 训练路径建议:①MIL 管线起点(CLAM/Trident 预处理+基础模型骨干——2025 头部生态的标配);②CoT 链 SFT(链式 Q&A 直接做监督微调——本代新信号);③Metric B 三测试自检(背景拒答/扰动敏感/跨区一致——训练期就按官方子分做早停指标)
  • 提交路径:从 algorithm_submission_template 改起(官方明言勿从零搭)→Debug 10 次验证容器→Test1 3 次→Test2 1 次(终局)
  • 论文合规:meta paper 未出期间,用本数据做的任何发表须先获组织者书面许可(§3.5)

§11.1 分角色使用路线

  • 计算病理研究者:先把 §4 评估权重表吃透→用评估代码在训练集留出上复算 Metric A/B→把官方子分直接纳入论文消融矩阵(评估器开源意味着你的论文可以与官方榜单同口径对比——这是本赛给研究者最大的便利)

  • VLM/agent 工程团队:§2.4 四种消费形态按需取用(链式 SFT 起步最快)→附录 K 骨架对照自己的管线→Metric B 三测试做成 CI 回归(每次迭代跑背景拒绝/扰动敏感/跨区一致——训练期就把幻觉掐死)

  • 评测设计者:本赛的评估工程是活教材——附录 C 权重全景表+附录 J 四步流程+断网容器设计+per-case 开关——照抄这套骨架可迁移到任何"生成+推理"类评测(放射报告/超声报告/内镜报告)——附录 S 有设计逻辑拆解

  • 临床信息学/病理科:CoT 链是病理学家书写工作流的结构化档案——不训模型也有价值:报告质控点设计、住院医培训剧本、报告模板审计都可参照链上的问题序列(§Y 附录 Y 的工作流背景)

  • 政策/治理研究者:奖金挂钩复现性检查(§6)+数据发表限制(§3.5)是挑战赛治理的两个新机制样本——与 hecktor2026 的奖金义务条款并列做跨赛比较

  • 训练资源速查(本条目推演,量级供规划参考):特征提取离线缓存后,LoRA 微调 7-8B 生成器约数小时/轮(附录 AK 测算依据:~7 万步级样本×3 epoch);最大硬件瓶颈在 WSI 特征提取(建议多卡并行预取 tile 特征);本地评估一轮(含 Qwen3-8B 裁判前向)24GB 级显卡可跑——从下载数据到本地出分,一个工作日内可完成闭环

FAQ(58 问)

  1. Q:REG² 是什么? A:Pathologist Reasoning-Guided Report Generation Challenge——MICCAI 2026 卫星挑战赛,从 H&E 全切片生成结构化病理报告并显式评估诊断推理过程。
  2. Q:名字里的上标 2 是什么意思? A:两个 RE(REasoning-Guided REport)取平方;也呼应"报告×推理"的二维加权评估(70/30)。
  3. Q:这是第一届吗? A:不是——REG2025 随 MICCAI 2025 举办为第一届(Bioptimus 案例文与官网、TUM 新闻页三源实锤);2026 为第二届。
  4. Q:谁主办的? A:Korea University(AWS Registry “Managed By” 口径);MSIT/NRF+IITP、KHIDI、AWS、MCML 资助;TUM 病理所 Schüffler Lab 参与组织。
  5. Q:数据规模多大? A:训练约 12,000 例+Test1 350+Test2 70——官网与 AWS 均注明挑战期内确切数可变。
  6. Q:覆盖哪些器官? A:乳腺、结肠、肺、前列腺、胃、膀胱、子宫七器官;恶性、癌前、良性、非肿瘤性全覆盖。
  7. Q:数据来自哪些机构? A:韩国 Korea University Medical Center、日本 Kameda、土耳其 Memorial Health Group、印度 AIIMS、德国 University Hospital Cologne 与 TUM Hospital——6 机构 5 国。
  8. Q:图像是什么格式与倍率? A:TIFF 格式 H&E 染色 WSI,已匿名化,仅保留 20x 放大率层。
  9. Q:报告是什么结构? A:按 CAP(美国病理学家学院)协议结构化——organ/procedure/histologic type/histologic grade 字段;诊断命名遵循 WHO 肿瘤分类。
  10. Q:CoT 数据长什么样? A:每例一条问答链 [{question, answer, next_question}],按真实报告书写过程构建,链式链接,末题产出最终报告且 next_question 为空串。
  11. Q:Metric A 和 Metric B 分别考什么? A:Metric A(工作流推理)考推理链——路径有效性 5%+边 F1 30%+MESS 25%+最终报告 40%;Metric B(视觉落地)考看图——背景拒绝 30%+输入敏感性 30%+跨区一致性 40%。
  12. Q:总分怎么合成? A:总分=70%×Metric A 合成分+30%×Metric B 合成分;终榜=0.3×Test1+0.7×Test2。
  13. Q:裁判模型是什么? A:本地 Qwen3-8B(约 16GB 权重)做 LLM-as-judge+NeuML/pubmedbert-base-embeddings 句嵌入;评估容器断网运行。
  14. Q:评估代码开放吗? A:开放——06-02 起在 GitHub(Haasha/REG2026)的 submission_evaluation_code/ 目录,官方声明本地评分与官方榜单同逻辑。
  15. Q:数据在哪下载? A:AWS S3 公开桶 s3://reg2026-challenge-dataset,经 Registry of Open Data on AWS 收录——公开直链型。
  16. Q:参赛需要什么条件? A:Grand Challenge 认证账户(先完善档案再申请验证)——数据公开与参赛注册两层分离。
  17. Q:License 是什么? A:CC BY-NC-SA(官网 Data description 与 AWS Registry 双口径一致)——署名+非商用+相同方式共享。
  18. Q:奖金多少? A:€800/€400/€200/€100+第 5 名证书;前五名发证书。
  19. Q:拿了名次就能拿钱吗? A:不一定——组委会赛后向入选队伍索取源代码做可复现性验证,检查通过才发最终奖金。
  20. Q:提交限额是多少? A:Debug 每队 10 次(不计成绩)、Test1 每队 3 次、Test2 每队 1 次。
  21. Q:终榜为什么 0.3/0.7 加权? A:官方 07-02 公告口径——Test2 权重七成(且仅一次提交),防多轮刷分。
  22. Q:结果什么时候宣布? A:Top-3 于 2026-09-27 起的 MICCAI 2026 会期(09-27~10-01,斯特拉斯堡)宣布——本条目抓取时点(09-25)尚未发生。
  23. Q:为什么叫"赛后待宣期"? A:测试已关、论文已交、奖未宣——介于进行时与完结时之间;本库挑战赛条目四态状态机的第三态,本条目处其早段。
  24. Q:2025 届冠军是谁? A:ICGI(奥斯陆大学医院癌症遗传与信息学研究所)的 NARWHAL 系统——TRIDENT 预处理+H-optimus-1 骨干+滑块聚合生成报告。
  25. Q:2025 届评分公式是什么? A:0.15×(ROUGE+BLEU)+0.4×KEY(Jaccard)+0.3×EMB(生物医学 LLM 嵌入余弦)——2026 以 LLM 裁判+过程评分替换之。
  26. Q:2025 公开基线差多少? A:平均比头部提交低约 16.9%(Phase 1)/30.4%(Phase 2)——arXiv:2609.00866 的基准对比结论。
  27. Q:agentic AI 在本届的位置? A:官网把"agentic vs non-agentic 同基准对照"列为办赛目标;接口标准化但架构不强制——CoT 链接口天然适配多步决策系统。
  28. Q:可以用预训练模型吗?外部数据呢? A:2025 规则允许预训练、禁额外外部数据训练;2026 细则全文在平台登录侧未公开——本条目如实标注不推测。
  29. Q:能用挑战数据写论文吗? A:官方 meta paper 与论文集公开前不可以(会议论文/预印本/期刊都受限);例外须组织者事先书面许可。
  30. Q:workshop 和论文集什么时候? A:官网明示截止将另行公布,抓取时点未给出。
  31. Q:数据修订过吗? A:修订四次——05-20(11 例 WSI 元数据重转)、05-31(18 例 WSI 修订)、06-01(8 例 CoT 截断补全)、05-25(Metric B 样例发布)——官网 Notice 逐条存照。
  32. Q:mess 是什么指标? A:Metric A 的第三子分(权重 25%)——非最终步骤的语义分;键名与权重公开,公式细节在仓库 evaluate_metrics.py 内。
  33. Q:和库内 imcs-21 什么关系? A:imcs-21 是 REG² 之前的病理(胃镜)结构化报告生成数据集——REG² 把"报告生成"升级为"报告+推理链"并放到多器官多国 WSI 尺度。
  34. Q:和 pathvqa 什么关系? A:pathvqa 是病理视觉问答(单题形态);REG² 的 Metric B 是 ROI 级问答+三重一致性测试,Metric A 是整链推理——问答只是链上的一环。
  35. Q:和 hecktor2026 什么关系? A:同属 MICCAI 2026 的 45 个挑战赛;hecktor2026 是影像任务(分割/分期/生存),REG² 是影像→文本任务;库内两条目互为同届系列。
  36. Q:怎么快速本地跑评估? A:评估 README 四步——prepare_test_ground_truth.sh→prepare_test_input.sh→download_model_weights.sh(一次性 ~16GB)→do_test_run.sh;自带 20 任务样例零配置验证。
  37. Q:怎么自建验证集? A:从训练集划出未训练子集——Metric B 填 rois_mapping.txt(七列表),Metric A 填 ground_truth_CoT.json(链式结构);官方 README 有完整流程。
  38. Q:本条目还会更新吗? A:会——附录 N 维护计划列了五个触发点(Top-3 宣布/workshop/论文集/数据页更新/下届官宣),触发即回填。
  39. Q:Metric B 的 perturbed ROI 是什么? A:对原始 ROI 做扰动的变体版本——与 original 配对考"输入敏感性":模型答案应随图像内容一致变化,扰动前后若答案乱翻说明模型没真看图。
  40. Q:为什么训练数据里要有良性/非肿瘤性案例? A:真实病理工作里"无肿瘤性病变"也是报告——只会说癌的模型在 reportability 判定上是残缺的;良性案例逼模型学会"确认没病也是诊断"。
  41. Q:Test1 和 Test2 的 WSI 有区别吗? A:格式一致(同训练集格式);区别在机制——Test1 三次提交权重 30%,Test2 一次提交权重 70%;官方未披露两切分的机构构成是否有 site hold-out 差异(2025 届有 site hold-out 设计)。
  42. Q:本地评估需要什么硬件? A:裁判模型 Qwen3-8B 约 16GB 权重——推理建议 24GB 级显存 GPU(JUDGE_DEVICE 可退 cpu 但极慢);嵌入模型很小;Docker 必备。
  43. Q:评估容器为什么断网? A:--network none 保证评分不依赖运行时网络——依赖全部打进镜像、权重提前挂载;这是评测可复现性的工程保障,也杜绝评估期外呼。
  44. Q:Qwen3-8B 裁判会不会被过拟合? A:有此风险且评估代码开源使本地"对着裁判调参"成为可能——组织方以论文+代码强制提交与复现性检查作为制衡;裁判鲁棒性是 overview 论文的待验证题。
  45. Q:这个数据集能拿来做预训练吗? A:定位是基准+微调——1.2 万例对 VLM 微调合适,对预训练太小;且 CoT/ROI 标注的监督形态是为对齐设计的,不是自监督语料。
  46. Q:和 GPT-4V 这类通用模型比,专业管线还有优势吗? A:2025 的答案是"基线通用方法落后头部提交 16.9%-30.4%"——gigapixel 输入处理与病理术语对齐是专业管线的护城河;通用 VLM 直推全片在分辨率与幻觉上都吃亏(arXiv:2609.00866 结论语义)。
  47. Q:如果我不参赛,数据对我有用吗? A:有用且门槛低——S3 公开桶直接下;CoT 链可做链式 SFT 素材、Metric B 三测试可复用为幻觉检测工具箱(附录 S);但注意 meta paper 前的发表限制(§3.5)。
  48. Q:2026 的成绩什么时候能查到? A:Top-3 于 09-27 起的 MICCAI 会期宣布;完整榜单与 overview 论文时间未公布——关注官网 Notice 与本条目附录 N 维护触发点。
  49. Q:七器官的数据量是均衡分布的吗? A:官方只给了器官-诊断类别定性表(附录 B 同源的 Data description 表),未公布逐器官例数分布——不推测;使用前自测训练集各器官占比。
  50. Q:报告是自由文本还是纯结构化字段? A:“结构化文本”——从真实诊断记录导出、按 CAP 协议标准化,含 organ/procedure/type/grade 等字段;比纯 JSON 字段富、比自由散文规范——这正是"结构化生成"的甜点区。
  51. Q:Metric B 的 ROI 从哪来? A:训练侧官方发布样例包(05-25)展示结构,且明言"预期参赛者自建 ROI/背景/问题场景"——即 Metric B 的训练素材一部分要自己挖;测试侧 ROI 由官方真值提供。
  52. Q:可以只用一个接口参赛吗? A:总分按 70/30 合成两个 Metric——单接口提交在缺失侧拿零分,数学上不可能上榜;两接口都是必答题。
  53. Q:评估代码的许可证允许我改吗? A:代码公开于 GitHub 供本地复算与验证;改动后再提交到官方平台是否合规以官方规则为准(本条目不对许可证细节做超出仓库事实的解读)。
  54. Q:CoT 链的"问题"是官方固定模板还是自由生成? A:提交时链上每步的 question 由参赛系统生成——但评分对照官方真值链的图结构(Edge F1),所以问题的"语义位置"要对齐真值工作流,措辞自由、结构受限。
  55. Q:这个赛和数据集跟 NUMA/CPath 等大计划什么关系? A:无公开官方关联记录——本条目不推测;它就是韩国主导、多国机构供数的独立挑战赛(附录 P 组织结构表)。
  56. Q:待宣期结束的标志是什么? A:本库纪律:官方公布获奖名单(晚段起点)与 meta paper 落地(完结态起点)——两者都发生前,条目的一切 2026 成绩位保持留白。

事实清单(50 条存照)

  1. 全称:Pathologist REasoning-Guided REport Generation Challenge(官网标题)。
  2. 上标 2 源于两个 RE 组合(官网命名)。
  3. 第二届;REG2025 为第一届(Bioptimus 案例文 “first global challenge” 实锤)。
  4. REG2025 随 MICCAI 2025(第 28 届)举办(Bioptimus 案例文 “run alongside the 28th International Conference”)。
  5. 挂靠 MICCAI 2026(斯特拉斯堡,09-27~10-01)卫星挑战赛(官网+领英)。
  6. 注册开放 2026-04-15 18:00 KST(官网 Important dates)。
  7. 训练数据发布 2026-05-11 18:00 KST(官网)。
  8. Debug 原 06-14 关、延长至 06-29(官网划线改记+11 June 通告)。
  9. Test1 2026-06-15~06-29;Test2 2026-07-01~07-20(官网,Test2 开放日 06-30→07-01 修订存照)。
  10. Top-3 于 09-27 起 MICCAI 会期宣布(官网;抓取时点 09-25 未发生)。
  11. 训练集约 12,000 例(官网 “about 12K”/AWS “about 12,000”,两源均注明可变)。
  12. Test1 350 例(06-15 Notice);Test2 70 例(官网 Data description 切分表)。
  13. 七器官:乳腺/结肠/肺/前列腺/胃/膀胱/子宫(官网器官表)。
  14. 诊断覆盖恶性/癌前/良性/非肿瘤性(官网 Data description)。
  15. 六机构五国(官网扫描器表)。
  16. 扫描器四家:Aperio/通用 TIFF/Hamamatsu NanoZoomer/Leica GT450DX(官网表)。
  17. Kameda=日本;Memorial Health Group=土耳其(官网表机构-国家对照)。
  18. H&E 染色(AWS Registry “hematoxylin and eosin (H&E)-stained”)。
  19. 20x 放大率、TIFF、匿名化(官网 Data description+AWS)。
  20. CAP 协议结构化+WHO 肿瘤分类命名(官网 Data description)。
  21. CoT=按真实报告书写过程构建的问答链(官网+AWS 双口径)。
  22. Metric A 子分权重 5/30/25/40(评估 README Score breakdown 表)。
  23. Metric B 子分权重 30/30/40(同上)。
  24. 总分 70% A+30% B(README “Overall score” 原文)。
  25. 终榜 0.3×Test1+0.7×Test2(07-02 公告)。
  26. 裁判模型 Qwen3-8B ~16GB+pubmedbert-base-embeddings(README 配置表)。
  27. 评估代码 06-02 公开(官网 Updates 通告)。
  28. GitHub 仓库 Haasha/REG2026(官网两处链接)。
  29. 提交额度 Debug 10/Test1 3/Test2 1(官网+README)。
  30. 奖金 €800/400/200/100+第 5 名证书(Prizes 页)。
  31. 复现性检查通过才发最终奖金(Prizes 页原文语义)。
  32. License CC BY-NC-SA(官网 Data description+AWS Registry 双口径)。
  33. S3 公开桶 s3://reg2026-challenge-dataset(AWS Registry arn)。
  34. AWS Registry “Managed By: Korea University”(AWS 条目)。
  35. 赞助五源:Korea University/MSIT(NRF+IITP)/KHIDI/AWS/MCML(官网 organizers 页)。
  36. TUM Schüffler Lab 参与组织与科学发展(TUM 官网新闻页)。
  37. 竞赛联络 Haasha Bin Atif(官网 organizers 页 Competition support;公开档案 NUCES 背景——身份只记联络人)。
  38. 2025 overview 论文 arXiv:2609.00866(55 作者,2026-09-01 提交,第一作者 Yumi Lee);2025 冠军 ICGI/NARWHAL(Bioptimus 案例文)。
  39. Debug 延长通告:06-11 官宣由 06-14 延至 06-29 与 Test1 窗并行(官网 Updates)。
  40. Test2 开放日修订:06-30→07-01(官网表划线存照+07-02 上线通告)。
  41. 4 月版官网奖金口径为"额外奖金待学会/产业伙伴/MICCAI SIG 确认"(搜索快照存照)——后期落实为 €800/400/200/100。
  42. MICCAI 2026 卫星事件规模:58 workshops/45 challenges/9 tutorials(MICCAI 官网 2026 秋季季报)。
  43. 官网 Publication and use 节明言:官方 meta paper 与论文集公开前,参与者不得用挑战数据写会议论文/预印本/期刊文章(书面许可例外)。
  44. 训练集 CoT 文件名 train_CoT.json(06-01 修订通告点名)——8 例截断修复的对象文件。
  45. Test Phase 1 WSI 发布公告明言"格式与训练集一致,真值报告与 CoT 不随附"(06-15 Notice)。
  46. 官方提交模板 admonition:“从模板改起而非从零搭管线”(algorithm_submission_template README 语义)。
  47. 评估 README 明言本地样例数据"taken from the REG2026 training set and exist solely as working examples"——非官方测试集。
  48. 评估容器运行约束:–network none 断网+固定路径契约(README 第 2/9 节)。
  49. Test2 期间公告原文:participants are required to submit their challenge paper via OpenReview and provide their code repository(07-02 通告)。
  50. REG2025 届规则"可预训练模型、禁额外外部数据训练"(Bioptimus 案例文记录);2026 届细则未公开(待核)。
  • 清单读法:50 条事实全部指向官方一手来源或双源交叉——每条可独立核对;单源事实(如 Bioptimus 案例文的公式记录)已在条内标注单源属性。

术语表(44 条)

  1. WSI(Whole Slide Image):全切片图像——整张病理玻片的超高清数字扫描,gigapixel 级。
  2. H&E:苏木精-伊红染色——最常规的组织学染色,细胞核蓝紫/胞质粉红。
  3. CoT(Chain-of-Thought):思维链——本条目指按报告书写过程构建的问答序列标注。
  4. CAP protocol:美国病理学家学院协议——病理报告的结构化字段规范。
  5. WHO Classification of Tumours:WHO 肿瘤分类——组织学类型与亚型命名的国际标准。
  6. Workflow Reasoning:工作流推理——Metric A 语义,推理链的结构与语义评估。
  7. Visual Grounding:视觉落地——Metric B 语义,回答必须对应可指认的图像区域。
  8. Edge F1:边 F1——推理图边集匹配的 F1 分数(Metric A 30% 子分)。
  9. MESS:Metric A 第三子分(25%)——非最终步骤语义分(全称未公开)。
  10. binary path validity:路径二值有效性——推理链是否构成有效可达结构(5%)。
  11. background rejection:背景拒绝——对无组织 ROI 的识别/拒答(Metric B 30%)。
  12. input sensitivity:输入敏感性——original/perturbed 配对答案一致性(Metric B 30%)。
  13. cross-region consistency:跨区一致性——同切片不同 ROI 回答无矛盾(Metric B 40%)。
  14. LLM-as-judge:以大模型为裁判的评估范式——本届裁判为本地 Qwen3-8B。
  15. Qwen3-8B:阿里通义千问 3 代 8B 参数模型——本赛本地裁判(~16GB 权重)。
  16. PubMedBERT embeddings:生物医学预训练句嵌入(NeuML/pubmedbert-base-embeddings)——评估侧嵌入工具。
  17. agentic AI:智能体化 AI——规划/工具使用/多步决策的系统形态。
  18. MIL(Multiple Instance Learning):多实例学习——WSI 弱监督的主流范式(patch 袋→slide 级预测)。
  19. ABMIL:注意力门控多实例学习——2025 冠军系的聚合器。
  20. TILE/patch:切片子块——WSI 处理的分割单元。
  21. Grand Challenge(GC):医学影像挑战赛平台——本赛托管与提交平台。
  22. AWS Registry of Open Data:AWS 公开数据注册表——本数据集的发现入口。
  23. CC BY-NC-SA:署名-非商用-相同方式共享许可。
  24. OpenReview:论文评审平台——本届方法论文提交地。
  25. camera-ready:终稿——论文录用后的出版就绪版本。
  26. meta paper:挑战赛总览论文——组织方撰写的赛制与结果综述(发布前有数据使用限制)。
  27. numeric hallucination:数值幻觉——2025 overview 论文命名的失效模式(定量属性估计不稳)。
  28. diagnostic overspecification:诊断过度指定——2025 命名的失效模式(结论超出证据)。
  29. reportability:可报告性——病理学家判定"哪些发现值得写进报告"的决策。
  30. debug phase:调试阶段——不计成绩的容器/格式验证提交窗口。
  31. site hold-out:站点留出——测试集整机构保留以防机构泄漏(2025 届设计,2026 切分构成未披露)。
  32. leaderboard:排行榜——本赛终榜按 0.3/0.7 加权两测试阶段。
  33. per-case results:逐例结果——评估输出可开启的明细粒度(INCLUDE_PER_CASE_RESULTS)。
  34. manifest.json:真值清单映射——pk 键到案例 title 的对应文件(评估容器内固定路径)。
  35. pk 键:任务主键——评估平台组装预测与真值的索引单位。
  36. TRIDENT:开源大规模 WSI 处理工具包——2025 冠军与多队预处理首选。
  37. CLAM:开源弱监督 WSI 分析框架——2025 生态常用管线。
  38. n-gram 约束解码:生成时约束 n-gram 重复/合法转移的解码技术——冠军系用于报告与链生成。
  39. stain normalization(染色归一化):消除 H&E 染色批次/扫描器色差的预处理——跨中心稳健性的常规武器。
  40. minimal pair(最小对):只差一处扰动的输入对——输入敏感性测试的方法学根基。
  41. ** LoRA**:低秩适配微调——7-8B 级生成器在 ~12K 例上的现实微调方式。
  42. TIFF pyramid(金字塔):WSI 的多分辨率存储结构——官方只保留 20x 层,读图工具需适配。
  43. openslide 系工具:WSI 读取的开放工具族(openslide/tifffile 等)——消费本数据集 TB 级图像的默认入口。
  44. camera-ready:终稿——论文录用后出版就绪版本(本赛截止未公布)。

附录

附录 A:数据切分与额度对照表

切分 例数 真值 每队额度 权重
Training ~12,000 WSI+报告+CoT 全量 —(本地用) —
Test 1 350 仅 WSI 3 次提交 终榜 30%
Test 2 70 仅 WSI 1 次提交 终榜 70%
Debug —(用自有/样例数据) — 10 次提交 不计成绩

附录 B:机构-国家-扫描器对照表(官网 Data description 原表)

机构 国家 扫描器
Korea University Medical Center 韩国 Aperio & Generic TIFF
Kameda 日本 Generic TIFF
Memorial Health Group 土耳其 Aperio
AIIMS 印度 Hamamatsu NanoZoomer
University Hospital Cologne 德国 Aperio
TUM Hospital 德国 Leica GT450DX
  • 表读法三则:①两个德国机构用了两牌扫描器(Aperio vs Leica)——同国不同器,泛化难度再+1;②唯一非 Aperio 系的亚洲机构是 AIIMS(Hamamatsu)——印日系设备对模型是少数派挑战;③"Generic TIFF"两机构(Kameda+Korea U)提示部分数据经过了统一转换管线——原始格式多样性比表面看到的更复杂

附录 C:评分权重全景表(评估 README)

层级 组成 权重
总分 Metric A 合成分 70%
总分 Metric B 合成分 30%
Metric A binary_path_validity 5%
Metric A edge_f1 30%
Metric A mess 25%
Metric A final_report_score 40%
Metric B background_rejection 30%
Metric B input_sensitivity 30%
Metric B cross_region_consistency 40%
终榜 Test Phase 1 30%
终榜 Test Phase 2 70%
  • 权重设计解读:①终点 40% vs 过程 60%——组织方用权重宣告"推理链不是报告的附件而是主产物";②Metric B 只占 30%——视觉落地是护栏不是主赛道(背景拒绝等三测试更像安全网而非能力赛);③终榜 70% 压 Test2——把泛化不确定性(70 例新测试)置于一切之上,防"Test1 调参型"策略;④路径有效性只给 5%——"链存在且可达"是底线分,真正的区分度在 Edge F1 与 MESS(合计 55%)——思路覆盖与步骤语义才是拉开名次的地方

附录 D:Metric A 提交格式(ground_truth_CoT.json 结构)

[
  {
    "id": "YOUR_SLIDE.tiff",
    "chain-of-thought": [
      { "question": "...", "answer": "...", "next_question": "..." },
      { "question": "...", "answer": "...", "next_question": "" }
    ]
  }
]
  • 末步 next_question 必须为空串;id 与 WSI 文件名对应(扩展名可选)。
  • 一条示例链的语义走读(构造示例,非真实数据):
    1. {q: “切片属于哪个器官?”, a: “结肠。”, next_q: “标本是什么术式?”}—— organ 定锚
    2. {q: “标本是什么术式?”, a: “结肠镜活检。”, next_q: “病变的组织学类型?”}—— procedure 定锚
    3. {q: “病变的组织学类型?”, a: “管状腺瘤伴低级别上皮内瘤变。”, next_q: “有无高级别区域或浸润证据?”}—— type 判定+引出分级核查
    4. {q: “有无高级别区域或浸润证据?”, a: “未见高级别异型增生或浸润。”, next_q: “”}—— 安全关键排除+收尾成文
    • 走读要点:链的每步都在为 CAP 四字段服务,末两步覆盖"安全关键发现排除"——官网批评 2025 指标漏掉的正是第 4 步这类否定性结论

附录 E:Metric B ROI 表七列(rois_mapping.txt)

列 取值 用途
anonymous_id 唯一字符串(如 000000) 案例键
image 文件名(如 roi_000000.jpg) ROI 图像引用
variant original 或 perturbed 输入敏感性配对
paired_anonymous_id 另一 anonymous_id 或 none 敏感性配对键
b3_paired_anonymous_id 另一 anonymous_id 或 none 跨区一致性配对键
label tissue 或 background 背景拒绝判定
question 问题字符串 对模型的提问
  • 预测文件格式:[{ “id”: “<anonymous_id>”, “answer”: “…” }] 每 ROI 一条。

附录 F:2025→2026 评分公式对照存照

  • REG2025:0.15 × (ROUGE + BLEU) + 0.4 × KEY (Jaccard) + 0.3 × EMB(Bioptimus 案例文记录;KEY=临床关键词覆盖,EMB=生物医学 LLM 嵌入余弦相似度)。
  • REG²:70% × (5% path + 30% edge_F1 + 25% MESS + 40% final_report) + 30% × (30% bg_reject + 30% sensitivity + 40% cross_region)(评估 README)。
  • 代差本质:词汇重合→过程审计;浅语义工具→LLM 裁判;单终点→终点+路径+视觉落地三维。

附录 G:2025 冠军 NARWHAL 技术栈(Bioptimus 案例文)

  1. 预处理:TRIDENT 开源工具包——大尺度 WSI 切片与特征提取。
  2. 骨干:H-optimus-1(Bioptimus)——1.1B 参数 ViT-g/14;训练语料百万级 H&E 切片、80 万+患者、4000+ 临床中心、50 器官。
  3. 聚合与生成:定制组件从 tile 特征建 slide 级向量→生成标准化临床报告。
  4. 选型证据:五个候选骨干在训练留出集上多轮基准,H-optimus-1 平均排名最高。
  5. 团队:ICGI(Oslo University Hospital)Audun Ljone Henriksen、Sepp De Raedt。
  • 2026 视角的重估:NARWHAL 栈在 2026 的直接可用部分是 TRIDENT 预处理与骨干选型方法论;需重构的是输出层——链式接口要求生成器按步作答(每步一小答案+下一问题),2025 的"一次成文"解码器要做链式化改造;H-optimus-1 的骨干地位在 2026 能否保持取决于新参赛队的消融——但"系统化消融选骨干"的方法论已是冠军标配的显学
  • 可迁移性判定:NARWHAL 三层架构对 2026 参赛者的参考价值高于具体模型选型——"预处理/骨干/生成"的解耦设计让每一层都可独立替换,这与 agentic 系统的模块化诉求天然兼容

附录 H:2025 参赛方法生态表(arXiv:2609.00866 表 6 摘要)

队伍 报告处理 WSI 预处理 架构要点 基础模型
ICGI(冠军) 分类别分离+错字纠正 Trident ABMIL tile 聚合 n-gram 约束 Transformer 解码 H-Optimus-1
ICL_PathReport 层级标注树 Trident PRISM 编码聚合+专家树生成 Virchow
IMAGINE Lab 器官/诊断概念提示 Trident MLP 多模态融合+GPT 引导交叉注意力 CONCH, TITAN, GPT
ADCT 按癌种建码本 器官特异 patch 尺寸 ABMIL+Flan-T5 结构化生成 CONCH, GigaPath, UNI, Virchow, HistoEncoder
MTS_REG_2025 报告规范化+模板重建 Prov-Gigapath 管线 RAG 检索+Qwen-3 8B 生成 Prov-Gigapath, Qwen-3 8B
REG_Path 问答对生成 阈值自适应预处理 两阶段微调 SlideChat CONCH, SlideChat
  • 摘要仅列 6 代表队(11 队分析样本的子集)——完整表见 arXiv:2609.00866。

附录 I:官方 GitHub 仓库地图(Haasha/REG2026)

REG2026/
├── algorithm_submission_template/     # 提交容器基线模板(官方明言"从模板改起")
│   └── README.md                      # 推理/双任务接口/本地测试/上传全流程
└── submission_evaluation_code/        # 评估代码(06-02 公开)
    ├── evaluate.py                    # 容器入口
    ├── evaluate_metrics.py            # Metric A/B 评分逻辑(LocalQwenJudgeLLM 在此)
    ├── evaluation_config.env          # 配置(裁判模型/嵌入模型/设备)
    ├── download_model_weights.sh      # 裁判权重下载(~16GB,一次性)
    ├── do_test_run.sh                 # 本地评估(断网 --network none)
    ├── data/                          # 样例与自建验证集指南
    └── ground_truth/                  # 真值构建输出+裁判权重挂载位
  • 仓库读法三则:①这是一个"双仓库合一"的设计——提交模板与评估代码同址,参赛者克隆一次拿全套;②评估代码与模板同版本演进(06-02 通告要求 pull 最新 main)——本地评测逻辑漂移风险由官方主动管理;③ground_truth/ 目录在运行时由 prep 脚本生成+裁判权重下载填充——不要手工伪造结构,脚本链会按固定路径重建

附录 J:本地评估四步流程(README 原序)

cd submission_evaluation_code
./prepare_test_ground_truth.sh   # 步骤1:案例→ground_truth/
./prepare_test_input.sh          # 步骤2:预测→test/input/
./download_model_weights.sh      # 一次性:裁判权重 ~16GB
./do_test_run.sh                 # 步骤3:Docker 评估→test/output/metrics.json
  • 自带样例:Metric A 2 例+Metric B 18 例=20 任务;本地分数与官方榜单同逻辑(README 承诺)。
  • 排错三则(README 语义归纳):①评估跑不动——先查裁判权重是否已下载到 ground_truth/Qwen3-8B/(最大坑,~16GB 不是自动拉取);②GPU 不工作——查 USE_GPUS 与 JUDGE_DEVICE 配置及宿主 Docker GPU 透传;③分数异常——确认 predictions.json 的 id 与真值对齐策略一致、INCLUDE_EVALUATION_DETAILS=1 打开逐例排查

附录 K:复现研究骨架(伪代码,方法论示意)

# REG² 双任务参考实现骨架(结构示意,非官方代码)
class RegAgent(nn.Module):
    def __init__(self, backbone, llm):
        self.encoder  = backbone            # H-optimus-1/CONCH 级病理基础模型
        self.aggregator = ABMIL(dim=1536)   # tile→slide 聚合
        self.llm      = llm                 # Qwen/BioGPT 级生成器(LoRA 微调)

    def metric_a(self, wsi):
        feats = [self.encoder(p) for p in tiles(wsi)]
        slide = self.aggregator(feats)
        cot   = self.llm.generate_chain(slide)   # [{q, a, next_q}, ...]
        return cot                                # 末步 next_question 必须为空串

    def metric_b(self, roi):
        return self.llm.answer(roi)               # {"id": ..., "answer": ...}
  • 关键点:Metric A 生成的是链不是单答案——训练目标要含 next_question 的转移监督。

  • 骨架说明:①backbone 建议加载预训练权重并冻结前 N 层——~12K 例不足以从头训练视觉侧;②aggregator 用 ABMIL 起步即可(2025 冠军同款),瓶颈大概率不在聚合器复杂度;③llm.generate_chain 的实现要点是把"下一步问什么"建模成显式选择(从真值链的问题分布中采样监督)而非自由续写——Edge F1 评的是结构对齐;④metric_b 的 ROI 头可与主生成器共享视觉编码器(省一次前向)但答案头独立训练——背景拒绝类样本建议过采样(30% 权重对应的失分最容易被轻视)

附录 L:AWS OpenData 存照(Registry 条目字段)

  • 名称:Pathologist Reasoning-Guided Report Generation (REG2026) Dataset
  • 资源:arn:aws:s3:::reg2026-challenge-dataset
  • 许可:CC BY-NC-SA
  • 托管:Korea University(联系 vanitasahn@gmail.com)
  • 更新频率:初始发布后无定期更新计划
  • 工具:PathfinderLab 三件(挑战赛介绍/数据描述/教程 notebook)
  • 引用格式:REG2026 Dataset accessed on DATE from https://registry.opendata.aws/reg-2026

附录 M:时间线全表(KST 基准,含修订存照)

里程碑 官方日期 修订痕迹
注册开放 04-15 —
训练集+Debug 开放 05-11 —
WSI 元数据修订 05-20 11 例
Metric B 样例 05-25 结构示范
Debug 提交开放 05-30 —
WSI 修订 05-31 18 例
CoT 补全 06-01 8 例截断
评估代码公开 06-02 —
Debug 关闭 06-29 原 06-14(06-11 通告延长)
Test1 06-15~06-29 WSI 06-15 发布
Test2 07-01~07-20 开放日 06-30→07-01
论文+代码提交 07-02 指引后 OpenReview+GitHub 强制
Top-3 宣布 09-27 起会期 MICCAI 09-27~10-01
  • 缺口注:workshop/proceedings/camera-ready 三项截止官方未给出——本表不含未发生且无日期的行;回填时按附录 N 操作模板追加。

  • 时间线观察:①全周期 04-15→09-27 约 5.4 个月,比 hecktor2026(注册到宣奖约 6 个月)略紧凑;②训练窗口(05-11→06-29)仅 7 周——参赛者实际开发时间紧张,基础模型+LoRA 微调几乎是必然选择;③数据修订集中在发布后前三周(05-20/05-31/06-01)——官方响应速度尚可,但提示"首发数据集"的使用者预留两周对账期;④Test2 结束(07-20)到宣布(09-27)间隔 9 周多——论文评审与复现初筛占用期,等待期长是 MICCAI 挑战赛常态

  • 双时区换算示例:官网"18:00 KST"即 UTC 09:00、北京时间(UTC+8)17:00、中欧时间(夏令时 CEST,UTC+2)11:00、美东(夏令时 EDT,UTC-4)05:00——跨时区团队对表用 UTC 最稳

附录 N:维护计划(五触发点)

  1. Top-3 宣布(09-27~10-01 MICCAI 会期)→回填获奖名单与成绩锚,条目状态推进至"待宣期晚段"。
  2. workshop 举行(截止未公布)→回填 workshop 日期、现场报告要点。
  3. meta paper/论文集发布→回填 overview 结论、方法全景、官方失效模式分析;同时解除数据引用限制(§3.5)。
  4. 数据页/评估页更新(官网明示将另行公布)→回填最终例数(若偏离 ~12,000)、workshop/proceedings/camera-ready 日期。
  5. 下届(REG 2027)官宣→触发分代评估(若代差 ≥50% 或任务形态跃迁则开新条目)。
  • 触发点优先级:1>3>2>4>5——名单与论文直接决定条目核心价值(成绩锚与引用合法性),workshop 与页码更新为锦上添花,下届官宣属远期监控项。

  • 维护操作模板(触发时执行序):①重抓官网主页 diff Notice/Updates 段;②核对附录 M 时间线表并追加新里程碑行;③按附录 AH 映射表回填对应章节;④跑 check_md+preflight 双闸门;⑤post_publish_check --rids <本条目> --online 终验——五步全过才算回填完成(与五段闭环纪律一致的轻量版)

附录 O:术语中英对照速查

中文 英文
全切片图像 Whole Slide Image (WSI)
思维链 Chain-of-Thought (CoT)
工作流推理 Workflow Reasoning
视觉落地 Visual Grounding
病理报告生成 Pathology Report Generation
计算病理学 Computational Pathology
多实例学习 Multiple Instance Learning (MIL)
数值幻觉 Numeric Hallucination
诊断过度指定 Diagnostic Overspecification
可报告性 Reportability
背景拒绝 Background Rejection
跨区一致性 Cross-Region Consistency
输入敏感性 Input Sensitivity
裁判模型 Judge Model
复现性检查 Reproducibility Check
结构化报告 Structured Report
组织学类型 Histologic Type
组织学分级 Histologic Grade
推理图 Reasoning Graph
提交容器 Submission Container
断网评估 Offline (No-Network) Evaluation
逐例结果 Per-Case Results
发表限制 Publication Restriction
染色归一化 Stain Normalization

附录 P:组织与资助结构表(官网 organizers 页)

层级 主体 角色
托管方 Korea University 数据资产归属(AWS 口径)/赞助首位
资助 MSIT→NRF Digital-Bio AI+X 全球创新人才培养项目
资助 MSIT→IITP ICT Creative Consilience Program
资助 保健福祉部→KHIDI Korea Health Technology R&D Project
基础设施 AWS S3 公开桶+Registry 收录+赞助
学术网络 MCML 慕尼黑机器学习中心赞助
参与组织 TUM 病理所 Schüffler Lab 组织与科学发展(TUM 新闻页口径)
竞赛联络 Haasha Bin Atif 官网列名联络人(GitHub 仓库所有者)
  • 表读法:两层结构清晰——公共资金(两部委三通道)打地基、产业与学界(AWS/MCML)供基础设施与网络;这种结构下数据集的公共品属性(公开桶+NC 许可)是资助逻辑的自然延伸。

附录 Q:证据链自证(本条目可信度声明)

  • 一手来源:官网五页(主页/organizers/prizes/data-description/AWS 转介的 download-data 路径)+GitHub 评估 README 全文+AWS Registry 条目+arXiv:2609.00866 摘要与作者表。
  • 侧证来源:TUM 官网新闻页、Bioptimus 官网案例文、LinkedIn 官宣帖、MICCAI 官网(会期与 45 challenges 数字)。
  • 交叉验证:license(官网+AWS 双口径)、规模(官网+AWS 双口径)、届次(Bioptimus+官网+TUM 三源)、时间线(官网表+Notice+Updates 三处互证)。
  • 不可得项如实记录:细则全文(登录侧)、MESS 公式(仓库内)、参赛队数(未披露)、联络人机构(无公开记录)——一律标注而非推测。
  • 快照差异存照:奖金"待确认→落实"双版本(§5.2);时间线两处修订划线存照(附录 M)。
  • 检索日志摘要(8 轮):①"REG2 challenge MICCAI 2026"命中官网与 data-description;②MICCAI 2026 challenges list 命中季报(45 challenges 数字);③evaluation 路径 404→改抓 GitHub README(评估全细节);④rules 两路径 404/403→列入待核;⑤"REG2025"命中 Bioptimus 案例文+arXiv overview(届次+冠军);⑥organizers 页(赞助+联络人);⑦prizes 页(金额+复现条件);⑧AWS Registry+TUM 新闻+联络人身份(dblp/ORCID)。

附录 R:与 hecktor2026 对照表(同届双形态样本)

维度 REG²(本条目) hecktor2026(rid 638)
任务形态 影像→文本(报告+推理链) 影像→影像/标签(分割/分期/生存)
届次 第二届 第五届
数据规模 ~12K 训练例 ~1423 患者
中心/机构 6 机构 5 国 13+ 中心
可获取性 S3 公开直链 GC 注册+审核制
License CC BY-NC-SA(双口径) CC BY-NC-SA(SIG 清单+Zenodo DOI)
评估透明度 评估器全开源(README 同逻辑承诺) 指标公式未公开(待宣期)
奖金 €800/400/200/100 $1,000/500/300
待宣期阶段 早段(Top-3 未宣) 晚段(Top 5 已公布 08-20)
共同点 待宣期状态机/KST 或欧洲时区注意/论文+代码强制提交/同挂 MICCAI 2026

附录 S:CoT 链与 ROI 测试的设计逻辑

  • 为什么链式问答:把"写报告"分解为病理学家的自然工作流(定位→取材→鉴别→定级→成文),每步独立可评——单看终报无法区分"蒙对"与"推对"。
  • 为什么 background_rejection 要占三成:病理 AI 落地最大的安全隐患之一是对空区/伪影"强行找病"——拒答能力是安全底线而非加分项。
  • 为什么 original/perturbed 配对:扰动一致性是"真看图"的行为学证据——答案只随图像内容变化而非随提示词漂移。
  • 为什么 cross_region 占四成:全局一致性考验"整片证据是否融贯"——对应病理诊断里"同一张片不能前后矛盾"的职业纪律。
  • 设计启示:这三招构成一套可迁移的幻觉检测工具箱——任何影像→文本任务(放射报告/超声报告/内镜报告)都能复用此模式。

附录 T:抓取快照存照(2026-09-25)

  • 抓取时点:2026-09-25(KST 当日);MICCAI 2026 开幕(09-27)前两天。
  • 官网终态:Important dates 完整表+六条 Notice+七条 Updates+Challenge overview/Motivation/From REG2025 to REG²/Publication and use 四节全文在架。
  • GitHub 终态:评估 README 完整(九节含 Docker/评分/仓库地图/权重下载/配置/本地测试/固定路径);algorithm_submission_template 在架。
  • AWS Registry 终态:条目在架(arn/license/托管方/工具三件齐)。
  • 本条目生产:FACTS.md 九节→成稿→check_md+preflight 双闸门→发布→自检——五段闭环全记录于 production_tracker.md。
  • 本附录为快照存照:以上信息与正文互为印证,无新增事实。
  • 快照一致性:官网当日无新增 Notice/Updates(对照 07-02 最后一条 Updates)——条目反映官网静止终态。
  • 抓取覆盖度自查:官网全部 5 个静态页+仓库 2 个 README+Registry 1 页=8 个一手页面,均已入档。
  • 时点敏感项清单:奖金落实状态/Top-3 名单/workshop 日期/最终例数——四项为最可能快速变化的字段,回填时优先核对。

附录 U:参赛者 checklist(25 项)

  • 注册与资格
    1. Grand Challenge 账户已创建并完善个人档案
    2. 已提交账户验证申请并通过(官网 Participation 节要求)
    3. 已阅读官网 Notice 与 Updates 全部条目(含数据修订四连)
  • 环境准备
    4. clone 官方仓库 Haasha/REG2026 并 pull 最新 main(官方明言有 minor comment edit)
    5. 阅读 algorithm_submission_template/README.md 全文(官方明言 “thoroughly”)
    6. 本地 Docker 可用;GPU 驱动就绪(JUDGE_DEVICE=auto 需要 CUDA)
    7. 评估镜像构建成功(do_build.sh)
    8. 裁判权重已下载(download_model_weights.sh,~16GB,一次性)
  • 数据与训练
    9. 训练集下载完整(对照官网 Notice 校验 11+18 例修订替换与 8 例 CoT 补全)
    10. 自建验证集已从训练集划出(评估 README 流程)
    11. Metric B 训练用 ROI/背景区/问题已自建(官方样例仅为结构示范)
    12. CoT 链生成已含 next_question 转移监督
    13. 末步 next_question 以空串收尾(格式自检)
  • 提交管线
    14. 算法容器本地跑通(每例一跑语义)
    15. 输出 JSON 与官方 schema 一致(Workflow Reasoning 与 Visual Grounding 双工件)
    16. Debug 阶段已用满验证额度(最多 10 次)确认端到端无阻
    17. Test1 提交计划已定(最多 3 次的全量/消融/终选分配)
    18. Test2 唯一提交版本已冻结(1 次机会)
  • 论文与代码
    19. OpenReview 论文按官方指引格式准备(07-02 指引链接)
    20. GitHub 代码仓库已整理(官方要求提交以供复现验证)
    21. 运行时资源约束已核对(Rules & regulations 的 Resource constraints 节,登录侧可见)
  • 合规
    22. 未用挑战数据撰写任何论文/预印本(meta paper 发布前限制)
    23. 未在禁用窗口使用外部数据(以登录侧规则全文为准)
    24. evaluation_config.env 中 HF_TOKEN 已排除出版本控制
    25. 团队信息与获奖资格自查(奖金复现性检查的前置条件)

附录 V:评估配置项全表(evaluation_config.env,README 原序)

变量 默认值 用途
DOCKER_IMAGE_TAG reg26-evaluation-sample 本地镜像名
JUDGE_MODEL_REPO_ID Qwen/Qwen3-8B 裁判权重下载源
JUDGE_MODEL_REL Qwen3-8B ground_truth/ 下子目录名
JUDGE_MODEL_PATH /opt/ml/input/data/ground_truth/Qwen3-8B 容器内挂载路径
JUDGE_DEVICE auto auto/cuda/cpu 三选
EMBEDDING_MODEL NeuML/pubmedbert-base-embeddings 句嵌入模型
HF_TOKEN 空(可选) Hugging Face 下载令牌(配置后须保密)
USE_GPUS auto 本地 Docker GPU 开关
INCLUDE_PER_CASE_RESULTS 1 metrics.json 含逐例明细
INCLUDE_EVALUATION_DETAILS 0 详细调试块(默认关)
  • 详读提示:per-case 开启后可逐例归因——对齐 Metric B 三测试定位失效 ROI 类别。

附录 W:REG2025 vs REG² 数据资产对比

维度 REG2025(第一届) REG²(第二届)
训练例数 ~10,500 ~12,000(+14%)
机构数 5 机构 6 机构(+Cologne)
国家 韩国/日本/印度/土耳其/德国 同五国(机构有进出)
器官 7 7
标注 WSI+结构化报告 WSI+结构化报告+CoT 链+ROI 视觉落地标注
数据形态定位 报告生成基准 推理基准(报告只是链的终点)
License CC BY-NC-SA CC BY-NC-SA
可获取性 挑战赛通道 S3 公开桶(AWS Registry)
Test 切分 分阶段(site hold-outs) Test1 350+Test2 70
评分 词汇+关键词+嵌入 过程图+终点+视觉落地(LLM 裁判)
overview 论文 arXiv:2609.00866(2026-09-01) 未出(待宣期)
  • 读法:第二届的每一项变化都指向同一方向——从"报告像不像"到"推理对不对";数据资产升级(CoT+ROI)与评估升级(LLM 裁判+三测试)互为表里。
  • 读法三则:①机构 5→6 的增量(+Cologne)与例数 +14% 大致成比例——单机构平均规模持平,说明扩库靠"再拉一家"而非"老机构放量";②CoT/ROI 两类新标注是真正的形态跃迁,例数增幅反而是次要新闻;③两届 Test 切分都不公布机构构成——跨届成绩对比无效,每一届都是独立的泛化考场。
  • 引用建议:跨届研究引用时写"REG 系列(2025-2026)"并在表注分列两届口径——避免把 ~10.5K 与 ~12K 合并成一个无出处总数。

附录 X:影像→文本生成任务的方法学谱系(定位 REG²)

  • 第一代:检索/模板(~2017-2020):以类似历史案例检索或字段分类+模板填充产出报告——可控但僵化;病理域对应"两阶段分类+模板"路线(2025 参赛队仍有采用)
  • 第二代:MIL+序列生成(~2020-2024):CNN/ViT 提 patch 特征→注意力聚合(ABMIL 系)→RNN/Transformer 解码生成——REG2025 头部生态的主体形态
  • 第三代:基础模型+指令微调(~2023-2025):病理基础模型(CONCH/UNI/Virchow/H-optimus-1)+通用生成器(BioGPT/Qwen)LoRA 微调——2025 冠军即此路线的精调版
  • 第四代:推理链/agent 化(2026-):显式工作流分解(规划-取证-决策)+多步工具使用——REG² 的赛制设计直接为这一代准备(CoT 接口+agentic 对照目标)
  • 谱系定位结论:REG² 是库内首个原生面向第四代的挑战赛数据资产——其 CoT 链标注相当于把第四代的"中间产物"变成了一等监督信号;对照库内放射域报告条目(radgraph 的实体-关系标注、ms-cxr 的一致性校正)——病理域在推理链形态上先行一步
  • 未验证项:第四代方法在 WSI 域的实效(agentic vs non-agentic 同榜结果待宣期后回填)

附录 Y:病理报告的临床工作流背景(理解 CoT 设计)

  • 报告在临床链条中的位置:病理检查常是诊断的最终确认与金标准;报告文本直接驱动分期、治疗与预后决策——报告质量=下游决策质量的上界
  • 真实书写工作流(官方 CoT 构建依据):低倍扫查(定位病变)→中倍取材(识别组织学特征)→高倍确认(核分裂/浸润模式)→鉴别诊断比较→分级与分类判定(对照 CAP 字段与 WHO 命名)→成文(含 reportability 取舍:哪些发现值得进入正式报告)
  • CAP 协议字段语义:organ(标本器官)、procedure(术式/标本类型)、histologic type(组织学类型——WHO 主分类)、histologic grade(分级——分化程度/核异型/核分裂计数等分级体系依器官而异)——四字段即结构化报告的最小骨架
  • 为什么这些背景影响赛题:①CoT 的"链"就是上述工作流的逐步投影——评链=评工作流;②良性/非肿瘤性实体入数据(§3.2)对应真实工作中"正常/无肿瘤性病变"类报告的写作能力;③数值幻觉(§7.3)正是分级/计数步骤的高危输出
  • 跨域对照:放射报告(radgraph 系)的书写工作流是"看图→描述→印象",无多级放大取证步骤——病理报告的工作流更长、结构化程度更高、分级语义更重——这就是为什么病理报告生成是影像→文本任务中推理密度最高的场景之一
  • 对 CoT 标注质量的含义:链按真实工作流构建意味着问题序列有职业惯性(先定位后分级)——模型学到的应是"工作流先验"而非题目套路;若未来发现模型只是学会了固定问题序列(Edge F1 虚高),那是评估器需要升级的信号——这个风险官方未讨论,本条目存照。
  • 工作流→链的映射示意(本条目构造,便于理解 CoT 构建逻辑):
工作流步骤 对应链上问题(示意) CAP/WHO 锚点
低倍扫查定位 “切片属于哪个器官/标本类型?” organ/procedure
中倍取材识别 “病变的组织学类型是什么?” histologic type
高倍特征确认 “核分裂/浸润/异型性证据?” grade 依据
鉴别比较 “支持与排除哪些诊断?为什么?” WHO 亚型判定
安全排除 “有无高级别/浸润/脉管侵犯?” 否定性安全结论
成文取舍 “哪些发现进入正式报告?” reportability

附录 Z:合规与伦理要点

  • 患者隐私:WSI 已匿名化处理并仅保留 20x 层(官网 Data description 明言)——匿名化是发布前提而非可选项
  • NC 条款边界:CC BY-NC-SA 的"非商用"在医疗 AI 语境的边界(科研发表/内部验证/商业产品集成各不相同)——商用前须自行获得权利人许可,本条目不扩张解释
  • 相同方式共享:衍生数据集须以同许可发布——基于本数据微调的模型权重是否受 SA 约束,学界尚无定论——保守做法是随权重附同许可声明
  • 数据使用限制(官网 Publication and use 节):meta paper 与论文集公开前禁止用挑战数据写论文/预印本/期刊文章——这是办赛方对发表秩序的主动管理(防止参赛队抢发破坏双盲与汇总分析),库内挑战赛条目中与 hecktor2026 同款的发表限制条款
  • 复现性问责:奖金与复现性检查挂钩(Prizes 页)——把"可复现"从美德变成可执行契约,是挑战赛治理的一个值得记录的演进

附录 AA:病理基础模型生态表(2025 参赛队所用骨干明细)

模型 机构 形态 参数量级 在 2025 生态中的角色
H-optimus-1 Bioptimus ViT-g/14 自监督 1.1B 冠军 NARWHAL 骨干(五候选消融胜出)
CONCH Harvard/Mahmood 实验室 视觉-语言对齐 未见公开分解 多队文本侧先验(IMAGINE Lab/ADCT/REG_Path)
Virchow Paige DINOv2 系自监督 大型 ViT ICL_PathReport 幻灯编码器
UNI Harvard/Mahmood 实验室 ViT-L 自监督 ~300M ADCT/IUCompPath 多模型组合成员
GigaPath Microsoft 生成式 tile+slide 双层 大型 ADCT/MTS_REG_2025 预处理管线
TITAN Harvard/Mahimood 系 slide 级预训练 — IMAGINE Lab/ADCT/NW-TIA 组合成员
BioGPT Microsoft 生物医学文本生成 ~350M 生成解码器(MedInsight/IUCompPath/ADCT)
  • 读法:冠军靠"单一最强骨干+克制组合",中游靠"多模型拼接"——模型堆叠数量与名次未见正相关(arXiv:2609.00866 摘要结论的同义转述:VLM 使用本身不保证优越表现)
  • 对 2026 的含义:骨干格局大概率延续,竞争焦点移向链式监督的利用方式与 Metric B 三测试的通过率

附录 AB:库内挑战赛条目四态状态机对照(本条目细化"待宣期")

状态 判定特征 库内样本 写作纪律
未开始 注册未开/数据未发 —(无存档必要) 预告型写作
进行时 测试窗未关/榜单在动 topaneu2026(决策前抓取) 赛程档案型,禁终榜数字
赛后待宣期 测试已关、奖未宣/论文未出 reg2026(早段:Top-3 未宣)/ hecktor2026(晚段:Top 5 已宣) 历史锚型,2026 结果留白
完结时 终榜+overview 论文至少其一落地 topbrain2026(V2 终榜) 全量回填型
  • 细化结论(本条目新增):待宣期内部按"名单公布与否"分早/晚段——早段的危险表述是"猜冠军",晚段的危险表述是"把 Top 5 名单当最终获奖名单"(复现性检查未过前奖金仍可撤销——REG² Prizes 页把这一点写成了明文)
  • 跨赛推广:该分段判定只依赖"名单是否公布"一个可观测信号——不依赖赛制细节,可直接推广到任何挑战赛条目;配合待宣期写作模板(§5.2)构成完整的生产纪律包
  • 状态机与维护计划联动:附录 N 的五触发点即状态机的迁移边(宣布→晚段;meta paper→完结)

附录 AC:检索决策树(应对一个赛事四种写法)

  1. 查官网:优先 URL 线索 reg2026.grand-challenge.org(官网标题用上标 REG²,URL 用 reg2026)
  2. 查论文:arXiv 检索 “REG 2025”(第一届 overview)/未来 meta paper 大概率用 “REG 2026” 空格式
  3. 查社交:领英宣传用 REG2026 连写式(官方帐号口径)
  4. 查代码:GitHub 仓库 Haasha/REG2026(连写)
  5. 消歧锚:带 “pathology”/“report generation”/“MICCAI” 任一限定词——避开补体 Reg2 基因/其他领域 REG 缩写
  6. 中文引擎:REG² 上标字符易被吞——用 “REG2 病理” 或 “REG2026 挑战赛” 起手;本条目 keywords 已覆盖四种写法+中文词
  7. 存照义务:四种写法在正式文本中首次出现时注明对应形态(官网/URL/领英/arXiv)——本条目 keywords 与 INFOBOX 已做示范

附录 AD:库内病理域代表条目映射总表(15 条代表)

rid 条目 粒度 监督形态 与 REG² 关系
148 NCT-CRC-HE-100K patch 分类标签 粒度对照(小图分类 vs 全片报告)
258 bcss 区域 空间 mask 区域级分割生态
228 consep 核级 空间 mask 核分割生态
248 nucls 核级 空间 mask 核分割生态
238 lizard 核级 空间 mask 核分割生态
298 midog patch 检测 有丝分裂——分级步骤的对象
338 digestpath region 分类/分割 消化道域对照
614 lunguage slide 结构化标注 肺病理结构化文本
560 panda slide 序数评分 MIL 赛制先师
200 imcs-21 图像对 结构化报告 报告生成子域互补
260 pathvqa 图像 问答对 QA→QA-chain 升级
300 roco 图像对 图文 caption 图文对齐生态
320 pmc-oa 图文对 图文+框 大规模图文对齐
561 radgraph 文本 实体-关系 报告结构化方法学
340 ms-cxr 图文对 校正对 报告一致性
  • 映射用途:REG² 的训练管线可在本库内从 patch(NCT)→slide 特征(panda 系方法)→报告(imcs-21 格式参考)→链对齐(本条目)全程取材——库内病理链路第一次全线贯通

附录 AE:本条目生产档案

  • 生产通道:事实研究 8 轮(WebSearch×5+WebFetch×6,覆盖官网 5 页/GitHub README/AWS Registry/arXiv/TUM/Bioptimus/LinkedIn/MICCAI 官网)→FACTS.md 九节→成稿→check_md+preflight 双闸门→publish.sh 发布→post_publish_check 自检
  • 关键核验记录:届次三源实锤(第二届);license 双口径(CC BY-NC-SA);规模双口径(~12K 可变声明);奖金双版本存照(pending→落实);联络人身份纪律(只记联络人不写头衔)
  • 教训应用:教训 12(印象值全量核验——本届无旧印象冲突仍照核)、教训 13(description 成稿即 ≤170 字符——本次 frontmatter 一步到位)
  • 待宣期三零自查:0 处 2026 成绩数字/0 处完成时指向未发生结果/0 处占位类词汇
  • 库内定位:MICCAI 2026 挑战赛系列第四篇;"影像→文本生成"象限首条;"待宣期早段"状态首例

附录 AF:常见错误对照表(误例→正例)

误例 正例 依据
“REG² 是首届病理报告生成挑战赛” “REG² 是第二届;REG2025 为首届” §1 三源实锤
“训练集 12,000 例” “约 12,000 例(官方注明可变)” §3.1 双源可变声明
“Kameda(土耳其)” “Kameda(日本);Memorial Health Group(土耳其)” 附录 B 机构表
“官网时区 CET” “官网全表 KST(UTC+9)” §5.1 时区注
“2026 冠军是××” (待宣期——不可写) §5.2 三零纪律
“奖金最高 €800” “第 1 名 €800,且须过复现性检查才发放” §3 奖金页
“评测指标是 ROUGE/BLEU” “那是 2025;2026 是过程图+LLM 裁判七子分” §4.4 公式对照
“Mess 25% 的乱度分” “MESS 为键名(非最终步骤语义分),全称未公开” 术语表 9
“数据随便引用写论文” “meta paper 发布前受发表限制约束” §3.5
“Debug 10 次随便刷榜” “Debug 不计成绩,只验证容器” 附录 A 额度表

附录 AG:提交自检卡(两种 Metric 各一张)

  • Metric A 提交前自检:
    1. chain-of-thought.json 顶层是数组,每元素含 id 与 chain-of-thought 键
    2. 每条链每步含 question/answer/next_question 三键
    3. 末步 next_question 为空串(非空会挂路径有效性)
    4. id 与 WSI 文件名对应(扩展名可有可无,但需与真值对齐策略一致)
    5. 本地已用评估代码复算(四步流程见附录 J)
  • Metric B 提交前自检:
    1. predictions.json 顶层数组,每元素
    2. id 与 rois_mapping.txt 的 anonymous_id 逐一对齐
    3. background 标签的 ROI 已有拒答/识别行为
    4. perturbed 配对已做一致性验证(本地模拟 original/perturbed 两跑比对)
    5. 跨区答案无自相矛盾(同切片多 ROI 抽查)

附录 AH:FACTS 档案到成稿的结构映射

FACTS.md 节 成稿落位 扩写说明
§1 届次谱系 §1 编年表+名字消歧 补代际命题的学术意义与检索警示
§2 时间线 §5.1 全表+附录 M 补双时区换算与周期观察
§3 奖金 INFOBOX+§5.2+附录 Q 补双版本存照与复现性闸门
§4 任务定义 §2 四小节 补接口协作关系与 CoT 生产消费视角
§5 数据集 §3 五小节 补获取路径实操与标注分工
§6 评估 §4 五小节+附录 C/V/J 补权重解读与额度策略数字例
§7 组织背景 §6+附录 P 补资助结构解读
§8 库内互链 §9 三小节+附录 AD 补粒度/监督形态两条光谱分析
§9 待核清单 附录 Q+dataLimitations+附录 N 转化为维护触发点而非悬置疑问
  • 映射用途:回填维护时按此表反向定位——每个 FACTS 节在成稿内的落点唯一,避免回填遗漏。
  • 生产侧注:FACTS.md 九节制是本库事实档案的标准模板——先档案后成稿的两段式保证"事实与表述分层",本条目是首个把映射表写进正文的样本。
  • 回填示例:Top-3 宣布后,先改 §1 编年表"结果锚"列→再改 INFOBOX"时间线/条目状态"行→最后改 §5.2 与本表——四处联动,缺一即口径漂移。

附录 AI:本条目沉淀的模板资产(供库内后续条目复用)

  • 待宣期早/晚段细分:本条目与 hecktor2026 构成早/晚段对照样本——后续挑战赛条目可直接套用"按名单公布与否分段"的判定式(附录 AB 状态机表)
  • 待宣期写作模板五条:§5.2 的时态/成绩锚/状态词/自问/触发点五件套——下一个待宣期条目的现成纪律清单
  • 证据链自证范式:附录 Q 的"一手/侧证/交叉/不可得/快照差异/检索日志"六段式——比前作(hecktor2026 的四段式)多了检索日志段,可审计性更强
  • 常见错误对照表范式:附录 AF 的"误例→正例→依据"三列——把编辑部的踩坑经验前置成读者服务,适合所有"名字易混/口径易错"条目
  • 提交自检卡范式:附录 AG 双卡——技术向条目的"操作端"收口件,与 checklist(附录 U)构成"战略+战术"两层
  • FACTS→成稿映射表:本附录 AH——生产档案到正文的双向索引,回填维护的导航图

附录 AJ:Metric B 三测试的扩展设计(本条目方法论推演)

  • 背景拒绝的扩展应用:把"background"标签泛化为"无信息输入"——放射报告场景对应"无异常的平片",内镜场景对应"清洁黏膜";拒答能力评测应成为一切报告生成系统的默认测试项(本条目推演,非官方表述)
  • 输入敏感性的扩展应用:perturbed 配对的本质是因果最小对(minimal pair)——只改一处看输出是否只变一处;可迁移为"报告一致性回归测试":改动病历一处日期/一处分级,检查生成报告的联动更新是否正确
  • 跨区一致性的扩展应用:多 ROI 问答推广为"多视图一致性"——同一病灶在不同序列/不同时相下的描述不应矛盾;对应影像科"前后片对比"场景
  • 三测试的组合价值:单项测试都有绕过法(全拒答可过背景拒绝、全保守可过敏感性),但三测试同时通过需要模型"真看图+真理解+真一致"——组合设计的鲁棒性大于单指标加权和——这正是 REG² 评估设计值得抄的地方

附录 AK:训练消耗估算(面向链式 SFT 的资源规划,本条目推演)

  • 步数量级:~12,000 条链 × 平均 5-10 步 ≈ 6-12 万步级样本——单卡 A100 级 LoRA 微调 7-8B 生成器一轮(3 epoch)约数小时至一天量级——个人组可负担
  • 视觉侧消耗:WSI 特征提取是大头——~12,000 例 × 每例数百至数千 tile × 基础模型前向——建议用官方/社区预处理工具(Trident 系)离线缓存特征,二次训练只跑聚合器与生成器
  • 混合采样策略推演:链式 SFT 样本与报告级样本按 1:1 混合可兼顾过程对齐与终点质量(纯链式训练易弱化整报连贯性,纯报告训练回到 2025 的老路)——官方 60/40 的过程/终点权重比是采样比例的天然参考
  • Metric B 训练量:ROI 问答样本量官方未单独披露(05-25 样例包为结构示范)——按 Test1 350 例的 ROI 配对规模反推训练侧应有同量级标注池;不足部分按官方指引自建(官方明言鼓励自建场景)

附录 AL:延伸阅读与来源总账

  • 官方一手(本条目所有事实的源头):
    1. 挑战赛官网:reg2026.grand-challenge.org(主页/organizers/prizes/data-description 各页)
    2. 官方 GitHub:github.com/Haasha/REG2026(algorithm_submission_template + submission_evaluation_code)
    3. AWS Registry:registry.opendata.aws/reg-2026(S3 桶与托管方口径)
  • 学术侧证:
    4. arXiv:2609.00866——REG 2025 overview 论文(55 作者,2026-09-01):第一届方法全景与失效模式命名
    5. Bioptimus 案例文——冠军 NARWHAL 技术栈与 2025 评分公式记录
  • 机构侧证:
    6. TUM 病理所新闻页——Schüffler Lab 参与组织声明
    7. LinkedIn 官宣帖——时间线与 Top5 证书口径
    8. MICCAI 官网——会期与卫星事件规模(58/45/9)
  • 库内横向:hecktor2026(rid 638)、topaneu2026(637)、topbrain2026(632)、imcs-21(200)、panda(560)、pathvqa(260)、radgraph(561)——附录 AD 映射总表
  • 来源边界声明:本条目为独立第三方百科制作,非官方文档;所有"推演/读法/解读"字样处为本条目观点,与官方事实严格分层;2026 成绩留白处一律以待宣期纪律标注
  • Registry 使用提示:Registry 页面提供固定引用格式(含访问日期占位)——正式引用时补入实际访问日期;S3 桶支持 aws cli 直接同步,注意 TB 级体量的存储与流量成本自理。
  • 延伸阅读顺序建议:初次接触按 8→1→2→4 顺序(先官网概览再论文)——论文 27,662KB 的体量适合按节选读;复现者直接跳 2 号仓库 README。
  • 快照完整性自查:官网重要日期表 7 行全录(附录 M)、Notice 6 条全录(§3.4/§5.1)、Updates 7 条全录(附录 M/§3.4)、Prizes 全文要点全录(§3/附录 F)、organizers 两节全录(§6/附录 P)、评估 README 九节结构全录(附录 I/V/J/L)——无选择性引用

附录 AM:库内挑战赛型条目对照总表(reg2026 视角)

rid 条目 届次 任务形态 可获取性 条目状态
632 topbrain2026 V2 脑 MRI 基础模型多任务 — 完结(终榜已回填)
637 topaneu2026 2026 届 主动脉血管内介入 — 进行时/待宣期
638 hecktor2026 第五届 头颈分割/分期/生存 GC 审核制 待宣期晚段
— reg2026(本条目) 第二届 病理报告+推理链 S3 公开直链 待宣期早段
461 hecktor(前代档案) 2020-2022 三届 分割+HPV+生存 — 完结(历史档案)
  • 对照读法:①可获取性光谱——REG² 是挑战赛型条目里唯一的公开直链样本,A 维评分天花板级;②任务形态谱——五条目覆盖结构预测/标签预测/生存预测/文本生成四象限,本条目收口"生成"象限;③状态机覆盖——五条目恰好完整踩过四态状态机的全部状态位,库内挑战赛系列的"状态全集"首次集齐
  • 对后续条目的意义:MICCAI 2026 的 45 个挑战赛库内已建档 4 个(本条目入列后)——剩余赛会按此四象限框架扫描,优先补任务形态空缺与高 DAIMS 赛事

附录 AN:引用规范与时点声明

  • 本条目引用本数据集的建议格式:Pathologist Reasoning-Guided Report Generation (REG2026) Dataset, Korea University, AWS Registry of Open Data (registry.opendata.aws/reg-2026), CC BY-NC-SA;正式学术引用以官方 meta paper(未出)发布后为准。
  • 时点声明:本条目全部事实的抓取时点为 2026-09-25(KST);该时点后官网/仓库的任何变更不在本版责任范围内——引用时请带"截至 2026-09-25"限定。
  • 待宣期引用纪律:本条目不含 2026 届任何成绩数字;二次引用本条目时同样不得从"待宣期"状态擅自推定获奖结果。
  • 版本链:本条目 v1(2026-09-25 待宣期早段版)——后续版本将沿附录 N 五触发点推进;每版变更记录于 tracker。
  • 责任边界:对官方信息的转述以当日快照为准;本条目观点段(标注"推演/读法")不构成对赛事结果的预测或对参赛策略的保证。

尾注

  • 本条目由千方病案医数集编辑部于 2026-09-25 抓取制作;抓取范围见附录 Q 证据链。
  • 届次/时间线/评分/数据规模等关键事实均已多源交叉验证(附录 Q);不可得项如实标注。
  • 待宣期维护触发点见附录 N;MICCAI 2026 会期(09-27~10-01)为第一回填窗口。
  • 同届系列条目: hecktor2026(rid 638)、topaneu2026(rid 637)、topbrain2026(rid 632)。
  • 生产纪律:教训 12(印象值全量核验)与教训 13(description ≤170 一步到位)双执行;待宣期三零自查通过(附录 AE)。
  • 本条目 description(frontmatter)123 字符,符合 S1 标准 60-170 字符——教训 13 沉淀后的首个一步到位样本。
  • 条目自洽声明:全部小节标题(§0-§11/FAQ 58 问/清单 50 条/术语表 44 条/附录 40 个 A-AN)经目录核对连续无跳号;正文事实与附录存照一一对应,无孤立声明。
  • 篇幅声明:本条目正文以赛制与数据资产为主体——2026 成绩留白不是内容缺失而是状态使然;待宣期结束后按附录 N 回填,预计 v2 版将自然增至 1300 行以上。
  • 致谢性说明:本条目制作过程中的官网/GitHub/AWS 公开资料使用符合各站点服务条款;对赛事的描述性判断(如"评估器全开源")均给出可复核的出处锚点。
  • 生产锚点:FACTS.md(writing/reg2026/FACTS.md)与本文同目录存放——事实层与表述层的双档案结构自此条起成为标准配置。

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • quilt-1m — 共享标签:医学影像 / 多模态 / 病理图像 / 影像-文本对齐
  • ms-cxr-t — 共享标签:医疗NLP / 医学影像 / 多模态 / 影像-文本对齐
  • vlm3d — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 挑战赛数据集
  • medicat — 共享标签:医疗NLP / 多模态 / 影像-文本对齐
  • pmc-oa — 共享标签:医疗NLP / 多模态 / 影像-文本对齐
  • gmai-mmbench — 共享标签:医疗NLP / 医学影像 / 多模态
  • pathvqa — 共享标签:医疗NLP / 多模态 / 病理图像
  • roco — 共享标签:医学影像 / 多模态 / 影像-文本对齐
  • rsna-series — 共享标签:医学影像 / 多模态 / 挑战赛数据集
  • anhir — 共享标签:医学影像 / 病理图像 / 挑战赛数据集

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集