INFOBOX:reg2026 速览
| 字段 |
值 |
| 数据集 |
Pathologist Reasoning-Guided Report Generation (REG2026) Dataset |
| 全称 |
Pathologist REasoning-Guided REport Generation Challenge(RE+RE=REG²) |
| 届次 |
第二届(REG2025 随 MICCAI 2025 举办=第一届——Bioptimus 案例文"first global challenge"实锤) |
| 主办 |
Korea University(AWS Registry "Managed By"口径)——MSIT/NRF+IITP、KHIDI、AWS、MCML 资助;TUM Schüffler Lab 参与组织 |
| 任务 |
H&E 全切片→结构化病理报告+显式诊断推理链(双接口:Metric A 推理链/Metric B 视觉落地) |
| 模态 |
病理图像(H&E WSI,TIFF,20x,匿名化)+文本(CAP 协议结构化报告+CoT 问答) |
| 规模 |
训练 ~12,000 例(7 器官)+Test1 350+Test2 70——6 机构 5 国(韩/日/土/印/德) |
| 可获取性 |
S3 公开桶直链下载(AWS Registry of Open Data 收录)——公开直链型 |
| 评估 |
Metric A(路径有效性 5%+Edge F1 30%+MESS 25%+最终报告 40%)×70%+Metric B(背景拒绝/输入敏感/跨区一致 30/30/40)×30%;裁判=本地 Qwen3-8B+PubMedBERT |
| 榜单 |
终榜 = 0.3×Test1+0.7×Test2;Debug 10 次/Test1 3 次/Test2 1 次 |
| 奖金 |
€800/€400/€200/€100+第 5 名证书——须过源码复现性检查才发放 |
| License |
CC BY-NC-SA(官网+AWS 双口径) |
| 时间线 |
注册 04-15→训练集 05-11→Test1 06-15~29→Test2 07-01~20→Top-3 于 09-27 起 MICCAI 会期宣布(未发生) |
| 条目状态 |
赛后待宣期(早段):榜单已封、奖未宣——无 2026 终榜数字,成绩锚用 2025 届 |
| 家族 |
REG2025(第一届,~10,500 例 5 机构,冠军 ICGI/NARWHAL);库内同届互链 hecktor2026/topaneu2026/topbrain2026 |
| DAIMS |
~7.0(公开直链+双口径 license+评估代码开源加分;细则登录侧+待宣期扣分) |
| 检索提示 |
一赛事四写法(REG²/REG2026/REG 2025/reg2026)——检索带 pathology/MICCAI 限定词,勿与补体 Reg2 基因混淆 |
| 阅读路线 |
赶时间读 INFOBOX+§0;参赛读 §2/§4/§11;做研究读 §3/§8;做评测读 §4+附录 S/C;引用前读附录 AN |
| 档案类型 |
挑战赛型数据资产(第五类数据形态)——影像→文本生成任务族首条 |
| 制作时点 |
2026-09-25 抓取制作(MICCAI 2026 开幕前两天);附录 AE 生产档案 |
REG²:病理报告生成挑战赛的第二幕——从"对答案"到"看你怎么想"
导语:病理报告是诊断的"最终确认书",写它的人要在十亿像素的切片里找证据、比鉴别、定措辞——而上一届挑战赛只检查"最后的报告写得像不像参考答案"。2026 年的第二幕把规矩改了:推理过程本身也要交卷——一条链式问答跟着切片一起被评分,裁判从词汇重合度换成了本地大模型。本条目抓取于赛后待宣期:终榜已封、奖未宣、论文未出——我们把赛制讲透,把 2025 的成绩锚摆出来,把 2026 的空缺如实留白。
一句话身份卡:MICCAI 2026 病理报告生成挑战赛第二届 | ~12K 例 7 器官 6 机构 5 国 | 报告+推理链双交卷 | Qwen3-8B 本地裁判 | CC BY-NC-SA | S3 公开下载 | 赛后待宣期(Top-3 于 09-27 起宣布)| 奖金须过复现检查
如何读本条目:赶时间读 INFOBOX+§0;参赛读 §2/§4/§11+附录 U/AG;用数据做研究读 §3/§8+附录 W/AD;做评测设计读 §4+附录 C/S;写引用或检索读 §1/§10+附录 AC/AF。全文事实均可溯源至附录 Q 证据链;2026 成绩留白处均有维护触发点(附录 N)。
§0 条目定位
- 本条目是 REG(Reasoning-guided rEport Generation)家族"现在时"档案:REG2025 是全球首个端到端 slide-to-report 挑战赛(Bioptimus 案例文明言 “the first global challenge for end-to-end slide-to-report systems”),REG² 2026 在其基础上把诊断推理显式化——库内以单条目覆盖两届(数据规模代差 ~14% 不满足分代建档的 50% 代差线,与 hecktor2026 需分代的情况不同)
- 条目状态"赛后待宣期(早段)":抓取时点 2026-09-25——测试提交已关闭(07-20)、方法论文与代码已交(07 月底指引),但 Top-3 要到 09-27 起的 MICCAI 2026 会期才宣布——比 hecktor2026(Top 5 已于 08-20 公布)还早一个阶段,是库内"待宣期"家族里离官宣最远的样本——本条目以"赛制档案+数据资产+2025 成绩锚"为主体,2026 成绩如实留空
- 条目身份:挑战赛型数据资产;影像→文本生成任务族——库内首个"报告生成+推理链"双交卷制挑战赛(对照 imcs-21 的结构化病理报告生成、pathvqa 的病理视觉问答——REG² 把两者合成一条链)
- AI-Ready 视角三大看点:①CoT 问答链作为一等数据资产(~12K 例每例一条 question/answer/next_question 链——推理监督信号而非只有结果监督,训练数据形态本身即是论文级贡献);②LLM-as-judge 评估工程开源(本地 Qwen3-8B 裁判+断网 Docker 评估容器+与官方榜单同逻辑的本地复算管线——评估代码 06-02 即公开);③公开直链可获取性(S3 公开桶+AWS Registry 收录——挑战赛数据里少见的"注册即下"形态,对照 hecktor2026 的审核制)
- 检索警示:一个赛事四种写法——官网标题用带上标的 REG²、URL 用 reg2026、领英宣传用 REG2026、arXiv 论文用 REG 2025(指上一届)——检索时四个写法都要试;且 “REG2” 与其他领域缩写(如补体调节蛋白 Reg2 基因)撞名,必须带 pathology/report generation/MICCAI 限定词
§1 届次谱系与名字消歧:RE 两次方
| 届 |
年份 |
挂靠 |
任务焦点 |
数据 |
结果锚 |
| REG2025(第一届) |
2025 |
MICCAI 2025(第 28 届)随会举办 |
端到端 slide-to-report——匹配参考报告 |
~10,500 例,5 机构(Pan-Asia) |
冠军 ICGI/NARWHAL(H-optimus-1 骨干);13 队终分 ≥0.6000 |
| REG²(第二届) |
2026 |
MICCAI 2026(斯特拉斯堡,09-27~10-01)卫星挑战赛 |
报告生成+显式推理链(agentic 议题入场) |
~12,000 例,6 机构 5 国 |
待宣期——Top-3 于 09-27 起会期宣布 |
- 名字构成:Pathologist REasoning-Guided REport Generation——两个 RE 取平方 REG²;上标 2 同时呼应"报告质量×推理质量"的二维评估设计(总分 70/30 加权)——名字即方法论
- 2025→2026 的代际命题(官网 Challenge overview 原文语义):REG2025 的评估"依赖表面词汇分数(ROUGE-L、BLEU-4)与浅语义工具(SciSpacy、OpenBioLLM)——不能捕捉临床上真正要紧的东西:临床正确性、否定、安全关键发现的遗漏"——REG² 的解法是把病理学家写报告前的探索、比较、取舍过程(exploration、compare diagnoses、decide what belongs in the report)做成数据与评分的中心
- agentic AI 议题入场:官网明言本赛"自然连接 agentic AI(规划、工具使用、多步决策)“,且要"在同一基准上比较 agentic 与 non-agentic 方法”——这是库内挑战赛条目中首个把 agentic 对照写进办赛目标的样本(对照:topbrain2026 的基础模型赛道按 Methods/Open 分轨,非 agentic 对照)
- 教训 12 纪律执行记录:本届谱系核验无旧印象冲突(tracker 仅有"REG² 病理报告生成"候选名、无届次印象值),仍按纪律做了三源实锤:Bioptimus 案例文(“REG2025 challenge is the first global challenge”)+官网欢迎语(“builds on REG2025”)+TUM 新闻页(“Building on REG2025”)——第二届成立
- 数据规模代差核算:10,500→12,000 约 +14%,低于分代建档 50% 代差线——单条目覆盖两届,代际差异在 §2/§4 内嵌说明
- 代际命题的学术意义:官网对 2025 的批评(表面词汇分数漏掉临床正确性/否定/遗漏)实质是报告生成任务的"评测有效性"问题——当评测指标测不到临床上要紧的失效模式,排行榜第一不等于临床可用;REG² 的应对是把评测对象从"文本产物"扩展到"推理过程"——这与医学 AI 社区近年"从结果评测走向过程评测"的大方向一致,REG² 是病理域把这一转向做成大规模基准的首例(库内条目视角)
- 为什么值得库内单独立条:即便不参赛,其数据形态(CoT 链标注)与评估工程(LLM 裁判+三测试)都是可迁移资产——辐射影像报告、内镜报告、超声报告等一切"影像→文本"场景都能复用(附录 S 展开三测试的迁移性)
§2 任务定义:一份报告,两张卷子
§2.1 总任务与临床语义
- 输入:gigapixel 级 H&E 染色全切片图像(WSI,TIFF 格式,已匿名化并只保留 20x 放大率层)
- 输出一(报告):结构化病理报告——字段含 organ(器官)、procedure(术式)、histologic type(组织学类型)、histologic grade(组织学分级);报告按 CAP(美国病理学家学院)协议标准化,诊断命名遵循 WHO 肿瘤分类的组织学类型与亚型术语——两大规范锚定意味着生成结果可直接对照真实报告体系审计
- 输出二(推理链):显式诊断推理——官网要求"不仅产出报告,还产出与病理学家探索和 reportability 判定对齐的结构化推理"(structured reasoning aligned with pathologist exploration and reportability decisions)
- reportability 的语义(术语表 29 的展开):可报告性是病理书写里最微妙的一层判断——同一张切片上看到的每个发现都"真实",但不是每个发现都该进正式报告(偶然发现的层级/临床相关性的权重/重复信息的省略);把它写进赛题意味着模型必须具备"取舍得当"的判断而非"知无不言"的堆砌——这与 §7.3 的诊断过度指定失效模式正好互为表里
- 临床背景:病理检查常是诊断的最终确认与金标准,书面报告居下游临床决策的中心;病理学家必须综合十亿像素切片、关注细粒度临床决定性特征——任务难度在"看全+看准+写对"三重
§2.2 双接口双指标(Metric A/Metric B)
| 接口 |
指标 |
提交文件 |
内容形态 |
| interf1 |
Metric A:Workflow Reasoning(工作流推理) |
chain-of-thought.json |
每 WSI 一条推理链:[{question, answer, next_question}, …],末步 next_question 为空串,链末产出最终报告 |
| interf0 |
Metric B:Visual Grounding(视觉落地) |
visual-context-response.json |
每 ROI 一条 {id, answer};ROI 表含 anonymous_id/image/variant(original 或 perturbed)/配对 id/label(tissue 或 background)/question 七列 |
- Metric A 的数据语义:CoT 问答对按"实际病理报告书写过程"构建——每问的答案引出下一问,问题序列构成一张有向推理图(question→next_question 的边),终点问题产出完整报告——评分因此能检查"路径走没走对"而不只是"终点对不对"(Edge F1 评边、binary path validity 评路径可达性、最终报告 40% 评终点质量——见 §4)
- Metric B 的数据语义:三种子测试设计——①背景拒绝(label=background 的 ROI 应被拒答/识别为无组织);②输入敏感性(同一 ROI 的 original 与 perturbed 变体配对——答案应随扰动一致变化而非随机翻转);③跨区一致性(同切片不同 ROI 的回答不应自相矛盾)——三招合起来考的是"模型到底看没看图",是幻觉检测的工程化
- 提交形态:Docker 算法容器(每例一跑)+平台侧评估容器(单次跑完 predictions.json 全部任务);官方仓库提供 algorithm_submission_template 基线模板——官方明言"从模板改起,不要从零搭管线"
- 两接口的协作关系:一次完整推理应同时产出两种工件——推理链(A)回答"我是怎么想的",ROI 问答(B)回答"我看的证据在哪";官方总分配比 70/30 表明 A 是主战场——但 B 的三测试(附录 S)是"证据真实性"的守门员,B 崩了 A 再好也只是"流畅的胡说";把 A/B 当作"生成器+验证器"组合设计而非两个独立任务,是对这套赛制最自然的工程解读
§2.3 agentic 议题的位置
- 官网把"agentic vs non-agentic 同台"列为办赛目标之一——CoT 链式接口天然适配多步决策系统(先规划看哪、再取证、再定结论);但赛制并不强制使用 agentic 架构——接口标准化而非架构强制化,让纯 MIL/Transformer 管线也能交同一格式卷子
- 对照 2025:冠军 NARWHAL 与多数头部队是 ABMIL/Transformer 生成管线(见 §7)——2026 若 agentic 系统与传统管线同榜,将是该领域首个同基准对照(结果待宣期后回填)
§2.4 推理链数据的生产与消费视角
- 生产侧(标注怎么来的):官方口径"CoT 问答对按实际病理报告书写过程构建"——即由具备报告书写经验的人把自然工作流拆解为问题序列,每问的答案就是该步工作流的产物;这意味着 CoT 链不是模型自生成的伪标注,而是人类工作流的结构化投影——其监督信号质量高于常见"模型合成 CoT"(后者常带自洽性幻觉)
- 消费侧(能拿来训什么):
- 链式 SFT:每条 {question, answer} 对都是一步指令微调样本——按链序拼接即成多轮推理对话训练数据(对照单轮 VQA 数据的离散性)
- 过程奖励建模(PRM)素材:链中每步有 next_question 转移关系——可构造"步骤正确性"的中间监督,训练过程奖励模型(对照只有终报对错的结果奖励)
- 图结构学习:question→next_question 的边集天然构成推理图——Edge F1 评分逻辑本身说明组织方按图结构对待推理链;下游可做路径规划/子图检索类研究
- Metric B 对齐训练:ROI 级问答+扰动配对可直接做视觉落地(visual grounding)对比学习——"答案必须绑定看图证据"的对齐信号
- 与现有推理数据集的差异:数学/代码推理链(GSM8K 系)验证器是规则化的;本数据集的验证器是 LLM 裁判+嵌入——临床推理没有符号化真值,这个差异本身就是研究题(裁判模型的可靠性是 2026 overview 论文值得回答的问题)
- 规模观感:~12K 条链按平均 5-10 步估算可产出 6-12 万步级监督样本——对 VLM 微调量级合适,对预训练不够(本数据集定位是基准+微调,非预训练语料)
§3 数据集:七器官、六机构、一条链
§3.1 规模与切分
| 切分 |
例数 |
发布时点 |
说明 |
| Training |
~12,000 |
2026-05-11 |
含 WSI+报告+CoT 全标注 |
| Test Phase 1 |
350 |
2026-06-15(仅 WSI) |
无真值报告/CoT 发布 |
| Test Phase 2 |
70 |
07-01 |
每队仅 1 次提交 |
- 官网与 AWS Registry 均注明"确切例数在挑战期内可能调整"——~12,000 为约数存照
- Test1 350 例 WSI 发布公告(06-15 Notice):格式与训练集一致,真值不随附——防泄漏纪律与 hecktor2026 同款
- 训练集文件构成(按官网 Data description 与评估仓库格式推断的双件结构):WSI 图像(TIFF)+结构化报告与 CoT 的 JSON(train_CoT.json 官方文件名——06-01 修订通告点名)——即图像与文本标注分离存储,消费时按 anonymous_id/slide id 对齐
- 标注分工:报告(CAP 字段)与 CoT(问答链)内容同源不同形——报告是"成文的终点",CoT 是"到达终点的过程重演";Metric B 的 ROI 标注另为一套(05-25 才发样例)——三套标注三种用途,消费前先分清
§3.2 器官与诊断覆盖
- 7 器官:乳腺、结肠、肺、前列腺、胃、膀胱、子宫——常见癌种+癌前+良性+非肿瘤性全覆盖(官网器官-诊断类别表:乳腺的浸润性癌 NST/小叶癌/导管原位癌/纤维上皮肿瘤/乳头状肿瘤;结肠的腺癌/低级别与高级别管状腺瘤/增生性息肉/慢性活动性结肠炎;肺的腺癌/鳞癌/NSC-NOS/小细胞癌/肉芽肿性炎;前列腺的腺泡腺癌/小细胞癌/淋巴瘤/正常;胃的管状腺癌/低黏附性癌/混合性腺癌/慢性胃炎;膀胱的浸润性尿路上皮癌/原位癌;子宫的鳞癌/腺癌/子宫内膜样癌/平滑肌瘤等)
- 诊断谱设计意图:良性/非肿瘤性实体入榜意味着模型必须"能说没病"——对照纯癌种数据集(如 NCT-CRC-HE-100K 只做 patch 级组织学分类),REG² 把 reportability 判定(该写什么、不该写什么)纳入任务本身
§3.3 六机构五国与扫描器异质性
| 机构 |
国家 |
扫描器 |
| Korea University Medical Center |
韩国 |
Aperio & Generic TIFF |
| Kameda |
日本 |
Generic TIFF |
| Memorial Health Group |
土耳其 |
Aperio |
| AIIMS(全印医学科学研究所) |
印度 |
Hamamatsu NanoZoomer |
| University Hospital Cologne |
德国 |
Aperio |
| TUM Hospital |
德国 |
Leica GT450DX |
- 机构-国家易错点:Kameda 是日本机构(Kameda 医疗中心),Memorial Health Group 才是土耳其——机构、国家、扫描器三列对照读取,勿凭名字直觉归类
- 扫描器四家(Aperio/通用 TIFF/Hamamatsu/Leica)——跨扫描器泛化是任务设计明线(2025 届Bioptimus 案例文:“diverse ethnic and different institutions from five countries”——多民族多机构泛化是评分考量)
- 扫描器异质性的实操含义:不同扫描器的色彩响应/压缩伪影/切片边缘处理不同——训练时若按机构分桶做增广(色彩归一化/ stain normalization)可显著改善跨中心稳定性(2025 生态的 HSV 类 patch 选择与预处理流水线即是此类应对);Test 切分若含训练未见机构(2025 有 site hold-out 传统),则机构级泛化能力直接决定终榜——把"扫描器"当随机效应建模而非噪声,是该数据集的正确打开方式
- 六机构五国与多国标注的含金量:语言层面全是英文 CAP 规范报告,但书写者母语/医学训练体系分属韩日土印德五国——报告风格差异(详略偏好/措辞习惯/分级表述)本身就藏在真值里;模型跨这种"软异质性"的稳健性是 2025 论文点名的一般化考验(“multi-country and multi-ethnic generalization”)
- 与库内影像库的规模对照:~12K 训练例在自然图像域微不足道,但在 WSI 域是稀缺品(每例都是全片+专家报告+过程标注三重标注——单例标注成本高企);对照库内 NCT-CRC-HE-100K 的 10 万级 patch(patch 免费而报告昂贵),更能理解"报告级标注"的经济学
- 2025 届数据资产(~10,500 例/5 机构/Pan-Asia 口径)作为独立数据集的档案见 §7 与附录 W——两届资产同许可同源生态,研究引用时可合并描述为"REG 系列"
§3.4 CoT 标注与数据修订史
- CoT 结构(评估仓库 ground_truth 格式):每例一条链,元素三元组 {question, answer, next_question}——问答序列按真实报告书写过程构建,链式链接,末题产出最终报告且 next_question 为空串
- 修订史四连(官网 Notice 逐条):
- 05-20:11 例训练 WSI 原始转换 TIFF 元数据/索引不完整——重转替换
- 05-25:Metric B 视觉落地样例发布(ROI 图像+标识+ROI-问题对的组织示例;官方明言"样例只为结构示范,训练用 ROI/背景区/问题需参赛者自建")
- 05-31:18 例训练 WSI 修订
- 06-01:train_CoT.json 中 8 例长条目 JSON 转换时截断——补全发布(不需重下全量)
- 修订节奏密度(5 月内三次文件级修订+一次标注修复)——大赛数据集首发质量的真实水平线,提示下游使用者:拿到任何"v1"数据集都应预留对账窗口
§3.5 License 与可获取性
- License:CC BY-NC-SA——官网 Data description 页与 AWS Registry 条目双口径一致(对照 hecktor2026 的单口径 SIG 清单+Zenodo DOI——REG² 无 Zenodo DOI 依赖,直接挂 AWS)
- 可获取性:公开直链型——数据驻 AWS S3 公开桶
s3://reg2026-challenge-dataset,经 Registry of Open Data on AWS 收录(arn 记录在案);AWS 条目另列社区工具三件(PathfinderLab 的挑战赛介绍/数据描述/教程 notebook)
- 参赛本身另需 Grand Challenge 认证账户(官网 Participation 节:先完善档案再申请验证)——数据公开≠比赛免注册,两层分离设计
- 数据发表限制(官网 Publication and use 节原文语义):官方 meta paper 与论文集论文公开之前,参与者不得用挑战数据撰写或提交会议论文/预印本/期刊论文——例外须组织者事先书面许可——引用本数据集做二次研究前须核对 meta paper 状态
- 获取路径实操(非参赛用途):①到 AWS Registry of Open Data 搜索 “reg-2026” 进入条目页;②按条目给出的 S3 桶(s3://reg2026-challenge-dataset)用 aws cli 同步(aws s3 cp/sync);③AWS 条目附 PathfinderLab 教程 notebook 可先跑通数据加载;④下载后按官网 Data description 的格式说明对账(注意 5-6 月四次修订公告——若镜像源较旧须比对 slide id 清单)
- 参赛路径实操:官网 Participation→GC 账户验证→官方仓库模板起步→Debug 验证→Test 窗口提交——详见附录 U checklist 25 项
§4 评估体系:一个裁判模型、七个子分、一次加权
§4.1 Metric A(工作流推理)四子分
| 子分 |
键名 |
权重 |
语义 |
| 路径二值有效性 |
binary_path_validity |
5% |
推理链的 question→next_question 路径是否构成有效可达结构 |
| 边 F1 |
edge_f1 |
30% |
参赛推理图与真值推理图的边集匹配 F1——考"思路覆盖" |
| MESS |
mess |
25% |
非最终步骤的语义分(键名与权重公开,公式细节在仓库 evaluate_metrics.py 内) |
| 最终报告分 |
final_report_score |
40% |
链末产出报告的质量——考"终点质量" |
- 四子分合成
workflow_final_ranking_score——终点占四成、过程占六成:这是与 2025 最本质的代差(2025 只有终点分)
- 裁判模型:本地 Qwen3-8B(仓库配置 JUDGE_MODEL_REPO_ID=Qwen/Qwen3-8B,权重 ~16GB,LocalQwenJudgeLLM 类)——LLM-as-judge 工程完全开源:评估容器断网运行(–network none),权重赛前下载到本地挂载——可复现性设计直达评估器本身
§4.2 Metric B(视觉落地)三子分
| 子分 |
键名 |
权重 |
语义 |
| 背景拒绝 |
background_rejection |
30% |
对无组织 ROI 的识别/拒答能力 |
| 输入敏感性 |
input_sensitivity |
30% |
original vs perturbed 配对的答案一致性——考"是否真看了输入" |
| 跨区一致性 |
cross_region_consistency |
40% |
同切片不同 ROI 回答不自相矛盾 |
三子分合成 visual_final_score。
- 三子分联动解读:三项测试单独看都存在"退化策略"(全拒答/全保守/全复读)——但三项同时过线要求模型具备完整的视觉行为链:先分辨"有没有东西"(拒绝)→再看"是什么、变没变"(敏感)→最后保证"整片说法一致"(一致);这种行为组合式评分比单项指标加权更难被应试优化——设计者把"防作弊"直接编码进了权重结构,值得一切生成类评测借鉴
§4.3 总分与榜单合成
- 总分 = 70% × workflow_final_ranking_score + 30% × visual_final_score(评估 README 原文:“Overall score = 70 % × workflow_final_ranking_score + 30 % × visual_final_score”)
- 终榜 = 0.3 × Test Phase 1 + 0.7 × Test Phase 2(07-02 最终评估指引公告)——Test2 权重七成且每队仅一次提交:终局一投定生死
- 提交额度:Debug 阶段每队 10 次(验证容器打包/输出格式,不计成绩,原 06-14 关闭后延至 06-29);Test1 每队 3 次;Test2 每队 1 次
- 本地复算管线:评估代码 06-02 公开于同一 GitHub 仓库(submission_evaluation_code/ 目录),README 承诺"本地评分与官方榜单使用完全相同的评分逻辑"——库内挑战赛条目中首个"评估器全开源"样本(对照 hecktor2026 的指标公式未公开)
- 额度策略数字例:假设终榜目标前五——Test1 三次的合理分配是第 1 投全量管线摸底(获得跨机构泛化的真实信号)、第 2 投针对第 1 投的 Metric B 失分项修复(背景拒绝与扰动敏感是可快速修的工程项)、第 3 投提交两者中本地复算分高者;Test2 唯一一投选"本地复算均值最高且方差最小"的版本而非"峰值最高"版本——70 例小样本意味着方差波动可能超过 0.05 分,稳健性优先
§4.4 2025→2026 指标演进对照
| 维度 |
REG2025(第一届) |
REG²(第二届) |
| 评分核心 |
0.15×(ROUGE+BLEU)+0.4×KEY(Jaccard)+0.3×EMB(生物医学 LLM 嵌入余弦) |
过程 60%(路径 5%+边 30%+MESS 25%)+终点 40%,LLM-as-judge |
| 数据形态 |
WSI→报告配对 |
WSI→报告+CoT 推理链+ROI 视觉落地标注 |
| 被批评点 |
ROUGE-L/BLEU-4 表面词汇、SciSpacy/OpenBioLLM 浅语义——漏掉临床正确性/否定/安全关键遗漏 |
(未验收——待宣期) |
| 嵌入工具 |
生物医学 LLM 嵌入 |
NeuML/pubmedbert-base-embeddings 句嵌入 |
| 基线差距锚 |
公开基线比头部提交低 16.9%(Phase 1)/30.4%(Phase 2) |
未出 |
- 2025 公式的 KEY 权重 0.4(临床关键词 Jaccard 覆盖)已经是"向临床对齐"的让步——但官网对它的批评一针见血:关键词对得上不等于临床正确(否定词、漏掉安全关键发现都能骗过词面匹配)——LLM 裁判是否真能解决这些坑,是 2026 overview 论文要回答的问题(未出)
§4.5 评估器工程细节(Docker 化全记录)
- 双容器架构:算法容器(参赛模型,每例一跑——“one case per run”)与评估容器(官方评分,单次跑完全部任务——“processes every job listed in /input/predictions.json in a single run”)分离——平台按 pk 键组装预测与真值(manifest.json 映射)
- 断网设计:评估容器以
--network none 运行——依赖全部打进镜像(Python 依赖+spaCy+PubMedBERT 嵌入),裁判权重运行前由宿主机下载到 ground_truth/Qwen3-8B/ 挂载进容器——评估可复现性不依赖运行时网络状态
- 固定路径契约(README 第 9 节):/input/predictions.json(任务清单)、/input/<pk>/output/(每任务产物)、/opt/ml/input/data/ground_truth/(真值+权重)、/output/metrics.json(结果)——路径常量不可改,改布局须同步改 evaluate.py
- 配置面(evaluation_config.env):裁判模型仓库 id(JUDGE_MODEL_REPO_ID=Qwen/Qwen3-8B)、运行设备(JUDGE_DEVICE=auto/cuda/cpu)、嵌入模型(EMBEDDING_MODEL=NeuML/pubmedbert-base-embeddings)、GPU 开关(USE_GPUS)、逐例结果开关(INCLUDE_PER_CASE_RESULTS)、详细调试块(INCLUDE_EVALUATION_DETAILS)——调试粒度可开关是成熟的评测工程标志
- 评分输出:metrics.json 的 aggregates 节承载各子分与合成分;per-case 明细可开——参赛者可逐例归因
- 本地-官方一致性:README 明言"输出分数使用与官方榜单完全相同的评分逻辑"——这是库内挑战赛条目中独一份的评估器开源承诺(对照:多数挑战赛只公开指标名不公开实现)
§5 时间线与待宣期状态
§5.1 全时间线(KST=UTC+9)
| 里程碑 |
日期(2026) |
备注 |
| 注册开放 |
04-15 18:00 KST |
同日"Save the dates"通告 |
| 训练数据发布+Debug 开放 |
05-11 18:00 KST |
Debug 原 06-14 关 |
| 数据修订 ×3 |
05-20 / 05-31 / 06-01 |
WSI 元数据/WSI 修订/CoT 补全 |
| Metric B 样例 |
05-25 |
结构示范用 |
| Debug 提交开放 |
05-30 |
每队 10 次 |
| 评估代码公开 |
06-02 |
GitHub 同仓库 |
| Debug 延长 |
06-14 → 06-29 |
官网表内划线改记存照 |
| Test Phase 1 |
06-15 ~ 06-29 |
350 例 WSI 发布;每队 3 次 |
| Test Phase 2 |
07-01 ~ 07-20 |
每队 1 次(06-30 改 07-01 存照) |
| 论文+代码提交 |
随 07-02 指引 |
OpenReview+GitHub 仓库强制 |
| Top-3 宣布 |
09-27 起 MICCAI 会期(09-27~10-01) |
抓取时点(09-25)未发生 |
| workshop/论文集/camera-ready |
官网明示另行公布 |
未给出 |
- 里程碑解读四则:①注册到数据发布隔月(04-15→05-11)——给参赛者一个月组队备环境,节奏合理;②训练窗 7 周内夹了 4 次数据修订——对参赛者的对账纪律是隐性门槛;③Test1/Test2 之间无缝衔接(06-29→07-01)——不给"阶段间大改"留时间,考察的是稳态系统而非调参冲刺;④宣布日(09-27)恰是主会第一天——挑战赛揭晓是开幕日节目,曝光位极佳
§5.2 待宣期纪律执行
- 三零自查:①全文 0 处 2026 成绩数字(终榜/队数/最高分均未公布);②0 处完成时表述指向未发生结果(Top-3 一律"将于 09-27 起会期宣布"时态);③0 处占位类词汇
- 状态定位:库内挑战赛条目四态(未开始/进行时/赛后待宣期/完结时)中的第三态早段——比 hecktor2026(Top 5 已公布 08-20)更早、比进行时(topaneu2026 决赛前)更晚——待宣期内部再分早晚段是本条目对状态机的一次细化
- 官网快照差异存照:4 月版页面奖金段写"额外奖金待学会/产业伙伴/MICCAI SIG 确认"——后期落实为 €800/400/200/100 确定金额——引用奖金信息须带抓取时点
- 待宣期写作模板(本库纪律的可复用范式):①时间表述用"将于 X 宣布"禁止"已宣布";②成绩表述只引历史届("2025 届冠军是……"合法);③状态词用"待宣期(早段/晚段)"精确到段;④一切"最终/冠军/获奖"字样出现前自问——这个事实在抓取时点发生了吗;⑤条目内置维护触发点(附录 N)让回填成为计划而非遗忘
§6 组织与赞助生态
- 主办方:Korea University——AWS Registry 条目 “Managed By: Korea University” 为数据资产归属口径;赞助名单首位同机构
- 资助与赞助五源(官网 organizers 页):
- Korea University
- 韩国政府 MSIT 两通道:NRF"Digital-Bio AI+X 全球创新人才培养"项目(含 Hands-on Experience)+IITP"ICT Creative Consilience Program"
- 韩国保健福祉部:KHIDI"Korea Health Technology R&D Project"
- Amazon Web Services(AWS)——对应 S3 公开桶与 Registry 收录的基础设施投入
- Munich Center for Machine Learning(MCML)——欧洲侧学术网络触点
- 参与组织:TUM(慕尼黑工业大学)病理研究所 Schüffler Lab 参与组织与科学发展(TUM 官网新闻页明言)——对应数据源 TUM Hospital(Leica GT450DX 扫描器)
- 竞赛联络:Haasha Bin Atif(官网 organizers 页 Competition support 节列名+邮箱)——身份纪律:其公开学术档案(dblp/ORCID/Scholar)为 NUCES(巴基斯坦国家计算机与新兴科学大学)背景数据科学硕士,无 Korea University 任职公开记录——本条目只记"竞赛联络人",不虚构机构头衔;其名下 GitHub 仓库(Haasha/REG2026)为官方代码发布地
- AWS 条目联系:vanitasahn@gmail.com——对应 arXiv:2609.00866 末位作者 Sangjeong Ahn(韩方组织层署名序尾部)
- 2025 overview 论文署名群(55 人,arXiv:2609.00866,2026-09-01 提交,提交者/第一作者 Yumi Lee):含韩方组织层(Yumi/Harim/Hyoryung/Minji/Eunsu/Hyeseong 等)、多国病理学家(日本 Junya Fukuoka、俄罗斯-德国 Andrey Bychkov、土耳其 Serdar Balcı/Sulen Sarioglu、德国 Reinhard Buettner/Yuri Tolkach 等)、2025 参赛队代表(挪威 ICGI 的 Audun Ljone Henriksen/Sepp De Raedt、美国 PW 组 Prateek Prasanna 等)、以及 MICCAI 社区资深人物(Spyridon Bakas 等)——两届组织生态连续性的人物档案
- MICCAI 2026 语境:第 29 届 MICCAI(09-27~10-01 斯特拉斯堡);卫星事件 58 workshops/45 challenges/9 tutorials;General Chair Mohammad Yaqub(同届 hecktor2026 条目已存照其双重身份);REG² 与 hecktor2026 同属这 45 个挑战赛(官网同届互链见 §9)
- organizers 页读法:该页实为"赞助+联络"两节结构而非完整组委会名单——个人名单要到 arXiv 论文署名群(§6 55 人档案)与仓库所有者(Haasha)处补全;官网把个人身份做轻处理、把机构与资助做重处理——韩国学界常见的集体署名风格,引用时以机构为主语更稳
- 资助结构解读:五源赞助的构成耐人寻味——两通道韩国政府科研资助(NRF 人才培养+IITP 学科交叉)说明这是国家级数字病理人才培养布局的一环("Digital-Bio AI+X"项目名即明示);AWS 的存在解释了 S3 公开桶与 Registry 收录的基础设施逻辑;MCML 则把欧洲学术网络接入——数据出 5 国、钱出自韩欧美的公共与产业混合——当代医学 AI 基准的典型筹资拼图
§7 第一届回顾(2025):冠军、生态与失效模式
§7.1 冠军方法 NARWHAL(ICGI,奥斯陆大学医院)
- 团队:Institute for Cancer Genetics and Informatics(ICGI),Audun Ljone Henriksen 与 Sepp De Raedt
- 系统三层:①TRIDENT 开源工具包做大尺度 WSI 预处理;②H-optimus-1(Bioptimus)做 tile 级特征——1.1B 参数 ViT-g/14、百万级 H&E 切片/80 万患者/4000+ 中心/50 器官自监督训练;③下游报告组件——从 tile 特征聚合出 slide 级向量再生成标准化临床报告
- 选型纪律(Bioptimus 案例文):赛前严格对比五个基础模型骨干,H-optimus-1 在训练留出集上多轮基准的平均排名最高——骨干选择靠系统化消融而非直觉
- 允许预训练、禁额外数据:2025 规则为"可用预训练模型,禁止在额外外部数据集上训练"——泛化能力考的是"预训练里带多少通用病理先验"
§7.2 参赛方法生态(arXiv:2609.00866 表 6 语义)
- 分析样本:终分 ≥0.6000 的 13 队被请求提交代码与方法描述,11 队响应分析
- 共同三段式:报告处理(规范化/层级化)→WSI 预处理→模型架构
- 框架复用:Trident、CLAM、Prov-Gigapath 等验证过的开源管线成主流——"标准化管线复用"取代自研预处理
- 基础模型清单:CONCH、TITAN、Virchow、UNI、GigaPath、H-Optimus-1、HistoEncoder(视觉);BioGPT、Qwen-3 8B、Flan-T5、GPT(文本/生成);SlideChat、Flamingo 系(多模态)
- 代表性架构:ABMIL tile 聚合+Transformer 解码(ICGI 冠军系)、层级标注树+专家树生成(ICL_PathReport 的 Tree-of-Experts)、码本+结构化 Flan-T5(ADCT)、RAG 检索相似历史案例+Qwen-3 生成(MTS_REG_2025)、两阶段微调 SlideChat(REG_Path)等
- 生态读法:头部方法普遍赢在结构化临床表示(层级化报告组织/多模态落地/中间诊断推理)而非"基础模型越大越好"——论文摘要原话:结果并不表明仅用 VLM 就能取得优越表现
- 冠军方法复刻要点(以 2026 视角回看 2025 冠军栈):①TRIDENT 预处理可以直接沿用(开源且被多队验证);②骨干按官方 2025 消融方法论在自家数据上重测——H-optimus-1 的第一名不保证在你的器官子分布上仍然第一;③ABMIL 聚合器上加"层级化输出头"——把 CAP 四字段作为结构锚(先预测字段值再拼装成文),比自由生成更对评委胃口(2025 头部共性);④2026 新增项——把生成器接到链式接口上:每步输出一个小答案+下一步问题,比一次生成整份报告更贴合评分逻辑
§7.3 两大系统性失效模式(2026 赛题设计的直接动机)
- 数值幻觉(numeric hallucination):定量属性估计不稳定——分级、计数、比例类字段易出错值
- 诊断过度指定(diagnostic overspecification):倾向写出比证据更具体的诊断——“有些错误与常规病理的已知诊断陷阱相似”
- 这两条失效模式解释了 REG² 为什么把推理过程纳入评分:终点对错只能暴露"错没错",过程审计才能暴露"怎么错的"——病理场景下错法比错值更有安全意义
§7.4 从 2025 方法生态看 2026 备赛策略
- 起点选择:2025 头部生态已验证的起点——Trident/CLAM 预处理+病理基础模型骨干+ABMIL 聚合+小型生成器——这套栈在 2026 依旧成立,但需把输出层改成双接口(推理链+ROI 问答)
- 增量一:链式监督:训练数据多了 CoT 链——把链上每步做 SFT(或 DPO 对齐)能直接对齐 Metric A 的中间步骤评分;2025 冠军的 n-gram 约束解码思路在链式生成中依旧适用(约束 next_question 的合法转移)
- 增量二:视觉落地模块:Metric B 是 2025 没有的新战场——需要一个能接受 ROI 裁剪图的问答头;背景拒绝能力可用"背景 ROI+拒答标签"显式训练
- 增量三:裁判适配:评分由 Qwen3-8B 裁判给出——参赛者可用同一裁判模型本地做 RLHF/DPO 的奖励信号(评估代码全开源使这一点可行)——但要警惕过拟合裁判(overview 论文大概率会讨论这个问题的防作弊边界)
- 风险提示:Test2 仅 1 次提交+0.7 权重——所有策略验证必须在 Debug/Test1 完成;Test1 的 3 次额度建议 1 次全量管线+1 次消融+1 次终选
§8 AI-Ready 评估(DAIMS)
| 维度 |
评分 |
说明 |
| D(Documentation) |
8.5 |
官网五页+GitHub 评估 README 极详尽(数据格式/评分逻辑/容器流程全公开);细则全文在平台登录侧小扣 |
| A(Accessibility) |
8.5 |
S3 公开桶+AWS Registry 直链可下——挑战赛数据顶级可获取性;参赛另需 GC 认证账户 |
| I(Interoperability) |
8.0 |
TIFF/JSON 标准格式+CAP/WHO 规范锚定+评估容器 Docker 化;CoT 链格式为自定义 schema(有公开样例) |
| M(Machine-readability) |
8.5 |
结构化 JSON 全程(CoT/ROI 表/预测文件);评估代码开源可本地复算 |
| S(Sustainability) |
6.0 |
AWS Registry 收录(托管方 Korea University)+"初始发布后无定期更新计划"声明;meta paper 与论文集状态决定长期引用锚 |
- DAIMS 综合 ~7.0(公开直链+双口径 license+评估器全开源加分;细则登录侧+待宣期+更新承诺弱扣分)——对照:hecktor2026 ~6.9(审核制拉低 A 但档案深)、topbrain2026 ~7.2
- 逐维详注:
- D 8.5 的构成:官网四节正文+六 Notice+七 Updates 全文可得;评估 README 从格式到路径契约零含糊;扣分在规则细则全文锁在登录侧——文档的"公开/私有"断层是唯一硬伤
- A 8.5 的构成:S3 直链+Registry 收录=发现与获取双容易;扣分在参赛通道的认证门槛与数据修订的对账成本(4 次修订须自查版本)
- I 8.0 的构成:TIFF/JSON 标准容器+CAP/WHO 术语锚定=跨系统交换友好;CoT 自定义 schema 有样例无 formal schema 文件——机读无碍但严格验证需自查
- M 8.5 的构成:预测/真值/输出三端全 JSON+评估器开源可复算——机器消费全链路通;扣分在 WSI 为原始 TIFF(TB 级大文件,流式读取需自备 openslide 系工具)
- S 6.0 的构成:Registry 收录与机构托管保证"不消失";但官方声明"无定期更新计划"+挑战赛型数据的天然维护窗口短——五年后链接可用性存疑(本库健康监控将跟踪)
- AI-Ready 训练就绪度:训练分割(~12K 例全标注)开箱即训;CoT 链可直接做 SFT(supervised fine-tuning)监督信号——库内首个"推理链监督"形态数据集,适合 VLM/agent 化病理系统的对齐训练
- 复现就绪度:官方模板容器+评估代码+本地评分=提交管线半天可跑通(README 承诺"verify the pipeline end-to-end without setting anything up"——自带样例数据 20 任务)
§9 库内家族互链
- 同届 MICCAI 2026 挑战赛:hecktor2026(头颈 PET/CT 第五届——同属 45 challenges,条目状态同为待宣期但已至"Top 5 公布"晚段)、topaneu2026(主动脉血管内介入)、topbrain2026(脑 MRI 基础模型)——四条目构成库内"MICCAI 2026 挑战赛系列"第一批
- 病理 WSI 生态:panda(前列腺 Gleason 分级——WSI 块级评分先例)、NCT-CRC-HE-100K(patch 级组织学分类——与 WSI 全片级任务粒度对照)、bcss/consep/nucls/lizard(核与组织区分割家族)、midog(有丝分裂)、lunguage(肺病理结构化标注)、digestpath(消化道病理)
- 报告生成先例:imcs-21(结构化病理报告生成——REG² 之前病理报告生成的胃镜域先例)、radgraph(放射报告结构标注——跨模态报告结构化的方法学对照)、ms-cxr(报告一致性校正)
- 图文多模态:pathvqa(病理 VQA——Metric B 的问答形态先例)、roco/pmc-oa(病理图文对)
- 互链策略:正文 6 处内链(本节之外:§0→imcs-21、§3.2→NCT-CRC-HE-100K、§3.3→panda、§4.4→radgraph、§9→hecktor2026/pathvqa);互链图重建由发布管线全库重算
§9.1 同届 MICCAI 2026 挑战赛系列对照
| 条目 |
任务域 |
数据形态 |
条目状态 |
| hecktor2026(rid 638) |
头颈 PET/CT 分割/分期/生存 |
影像+标注 mask+生存端点 |
待宣期晚段(Top 5 已公布) |
| topaneu2026(rid 637) |
主动脉血管内介入 |
影像+手术数据 |
待宣期 |
| topbrain2026(rid 632) |
脑 MRI 基础模型 |
多任务下游评测 |
完结(终榜已回填) |
| reg2026(本条目) |
病理报告生成+推理 |
影像+文本链 |
待宣期早段(Top-3 未宣) |
- 系列读法:四条目覆盖 MICCAI 2026 挑战赛的四个任务象限——影像结构预测(分割)、影像标签预测(分期/分级)、生存预后、影像→文本生成;REG² 补上了此前缺失的"生成+推理"象限——库内挑战赛数据形态版图的收口之作
- 状态机读法:四条目恰好落在四态状态机的三个不同时相(完结/晚段/早段)——同届赛事因时间线设计不同而处于不同阶段,为"待宣期内部再分段"提供了横向参照
§9.2 病理库生态深度对照
- 粒度光谱:patch 级(NCT-CRC-HE-100K 的 10 万级小图分类)→区域级(bcss 的区域分割、midog 的有丝分裂检测)→slide 级(panda 的全片 Gleason 评分)→slide→报告级(本条目)——REG² 处于粒度光谱的最右端,是"整片理解+语言产出"的极端形态
- 监督形态光谱:分类标签(NCT)→空间 mask(bcss/consep)→序数评分(panda)→结构化文本(imcs-21/lunguage)→推理链(REG² CoT)——监督信息密度逐级上升,标注成本与数据规模逐级下降(1 万级 CoT 例 vs 10 万级分类 patch)——这是标注经济学的基本规律在本库内的活样本
- 与 panda 的师承关系:panda(Prostate cANceR grade Assessment)证明了"WSI→临床评分"可行并催生了 MIL 方法爆发;REG² 把目标从"单一分数"换成"整份报告+推理"——难度数量级提升,但赛制设计(分阶段测试+额度控制)与工程配套(容器模板+评估开源)全面升级——两代赛制之间是五年方法学的距离
- 与 imcs-21 的域差:imcs-21 是胃内镜病理报告(中文域、图像-报告对),REG² 是外科病理 WSI 报告(多国多器官、英文 CAP 规范)——两者覆盖"病理报告生成"的不同子域,库内同时持有可做跨域迁移研究
- 与 pathvqa 的互补:pathvqa 是"单问单答"(VQA 形态);REG² Metric A 是"链式问答"(每答引出下问)——从 QA 到 QA-chain 正是本条目 §2.4 说的推理监督升级
§9.3 互链图影响面预估
- 直接互链(正文 6 处):hecktor2026、panda、nct-crc-he-100k、imcs-21、radgraph、pathvqa
- 标签共现预估(category_tags:医疗NLP/医学影像/多模态/病理图像/影像-文本对齐/挑战赛数据集):病理图像族约 20 条、医疗NLP 族约 15 条、多模态族约 10 条、挑战赛族 8 条——重建后相关度排名前列的邻接条目将是 imcs-21/panda/pathvqa/lunguage/roco
- 新增入边(谁会链到本条目):无需回填——发布管线 link_builder 全库重算时按标签与引用自动建立;本条目为"挑战赛数据集+病理图像+医疗NLP"三标签交集的首条,预计成为该交集的中枢节点
§10 避坑清单(八则)
- 坑 1:一个赛事四种写法:REG²(官网)/reg2026(URL)/REG2026(领英)/REG 2025(arXiv 指上届)——检索与引用时四种都要覆盖,且 REG2025 特指第一届勿混用
- 坑 2:“第二届"勿写成"第一届”:部分中文技术博客把 2026 当首届——2025 已随 MICCAI 2025 举办第一届(三源实锤见 §1)
- 坑 3:时区陷阱:官网时间线全表 KST(UTC+9)——不是 MICCAI 主会的欧洲时区(CET);核对任何 deadline 前先看时区列
- 坑 4:时间线修订双存照:Debug 关闭 06-14→06-29、Test2 开放 06-30→07-01——官网表内以划线改记保留双值;引用时间线须注明版本
- 坑 5:机构-国家错位:Kameda 是日本、Memorial Health Group 是土耳其——勿凭机构名直觉归类;"Pan-Asia"口径与含德国机构的六机构表并存(§3.3 存照)
- 坑 6:奖金双版本:4 月版官网"额外奖金待确认"vs 后期 €800/400/200/100 落实——引用带时点;且拿名次≠拿钱——赛后源码复现性检查通过才发最终奖金(Prizes 页原文语义)
- 坑 7:数据发表限制:官方 meta paper+论文集公开前禁用挑战数据写论文(书面许可除外)——二次研究者与参赛队都受约束
- 坑 8:提交额度纪律:Test2 每队仅 1 次+终榜 0.3/0.7 加权——把 Test2 当"唯一决赛一投"来规划;Debug 的 10 次额度是验证容器而非刷分窗口
§10.1 下游使用者的坑
- 只下 Test 不下训练:Test 分割仅 WSI 无真值——本地评测必须自建验证集(评估 README 提供从训练集划留出的完整流程)
- 裁判权重忘下载:本地评估前须跑 download_model_weights.sh(Qwen3-8B ~16GB)——断网容器设计意味着权重必须在构建后、运行前就位
- CoT 格式末步:next_question 必须以空串收尾——非空末步会被路径有效性检查判错
- HF_TOKEN 泄漏:evaluation_config.env 若配置 Hugging Face 令牌须保持私密、勿入库
- 旧镜像跑新数据:5-6 月四次数据修订后,旧特征缓存/旧预处理产物含被替换的 29 例 WSI——修订清单(11+18 例)必须与本地缓存对账,否则训练集混入脏数据
- 把样例当真值:评估仓库 data/ 内置样例来自训练集且"solely as working examples"——用它自测分数可以,当成官方测试分布外推会得出误导性结论
§10.2 引用与写作的坑
- 规模数字带口径:~12,000 是"官网 about 12K 且注明可变"的约数——勿写成精确数
- 榜单成绩留白:待宣期内任何"2026 冠军/最高分"都是编造——成绩锚只用 2025(冠军 ICGI、基线差距 16.9%/30.4%)
- 联络人身份:Haasha Bin Atif 只写"竞赛联络人"——公开档案无 Korea University 任职记录,勿推测头衔
- Mess 不是"乱":MESS 是评估键名(语义分),非英文俚语——中英混排时注意
- "Pan-Asia"勿绝对化:2025 论文的 Pan-Asia 口径与含两家德国机构的六机构表并存——引数据来源时用机构清单而非大陆标签
- 奖金单位:REG² 用欧元(€800/€400/€200/€100),同届 hecktor2026 用美元($1,000/$500/$300)——跨条目对比勿混写货币符号
§11 使用建议(复现与训练路径)
- 快速跑通评估(评估 README 四步):prepare_test_ground_truth.sh→prepare_test_input.sh→download_model_weights.sh(一次性 ~16GB)→do_test_run.sh——自带训练集样例 20 任务(Metric A 2 例+Metric B 18 例)零配置验证
- 自建验证集:从训练集划出未训练子集填入 data/cases/(Metric B 填 rois_mapping.txt 七列表;Metric A 填 ground_truth_CoT.json 链式结构)——官方明言这是获得"接近榜单信号"的正路
- 训练路径建议:①MIL 管线起点(CLAM/Trident 预处理+基础模型骨干——2025 头部生态的标配);②CoT 链 SFT(链式 Q&A 直接做监督微调——本代新信号);③Metric B 三测试自检(背景拒答/扰动敏感/跨区一致——训练期就按官方子分做早停指标)
- 提交路径:从 algorithm_submission_template 改起(官方明言勿从零搭)→Debug 10 次验证容器→Test1 3 次→Test2 1 次(终局)
- 论文合规:meta paper 未出期间,用本数据做的任何发表须先获组织者书面许可(§3.5)
§11.1 分角色使用路线
-
计算病理研究者:先把 §4 评估权重表吃透→用评估代码在训练集留出上复算 Metric A/B→把官方子分直接纳入论文消融矩阵(评估器开源意味着你的论文可以与官方榜单同口径对比——这是本赛给研究者最大的便利)
-
VLM/agent 工程团队:§2.4 四种消费形态按需取用(链式 SFT 起步最快)→附录 K 骨架对照自己的管线→Metric B 三测试做成 CI 回归(每次迭代跑背景拒绝/扰动敏感/跨区一致——训练期就把幻觉掐死)
-
评测设计者:本赛的评估工程是活教材——附录 C 权重全景表+附录 J 四步流程+断网容器设计+per-case 开关——照抄这套骨架可迁移到任何"生成+推理"类评测(放射报告/超声报告/内镜报告)——附录 S 有设计逻辑拆解
-
临床信息学/病理科:CoT 链是病理学家书写工作流的结构化档案——不训模型也有价值:报告质控点设计、住院医培训剧本、报告模板审计都可参照链上的问题序列(§Y 附录 Y 的工作流背景)
-
政策/治理研究者:奖金挂钩复现性检查(§6)+数据发表限制(§3.5)是挑战赛治理的两个新机制样本——与 hecktor2026 的奖金义务条款并列做跨赛比较
-
训练资源速查(本条目推演,量级供规划参考):特征提取离线缓存后,LoRA 微调 7-8B 生成器约数小时/轮(附录 AK 测算依据:~7 万步级样本×3 epoch);最大硬件瓶颈在 WSI 特征提取(建议多卡并行预取 tile 特征);本地评估一轮(含 Qwen3-8B 裁判前向)24GB 级显卡可跑——从下载数据到本地出分,一个工作日内可完成闭环
FAQ(58 问)
- Q:REG² 是什么? A:Pathologist Reasoning-Guided Report Generation Challenge——MICCAI 2026 卫星挑战赛,从 H&E 全切片生成结构化病理报告并显式评估诊断推理过程。
- Q:名字里的上标 2 是什么意思? A:两个 RE(REasoning-Guided REport)取平方;也呼应"报告×推理"的二维加权评估(70/30)。
- Q:这是第一届吗? A:不是——REG2025 随 MICCAI 2025 举办为第一届(Bioptimus 案例文与官网、TUM 新闻页三源实锤);2026 为第二届。
- Q:谁主办的? A:Korea University(AWS Registry “Managed By” 口径);MSIT/NRF+IITP、KHIDI、AWS、MCML 资助;TUM 病理所 Schüffler Lab 参与组织。
- Q:数据规模多大? A:训练约 12,000 例+Test1 350+Test2 70——官网与 AWS 均注明挑战期内确切数可变。
- Q:覆盖哪些器官? A:乳腺、结肠、肺、前列腺、胃、膀胱、子宫七器官;恶性、癌前、良性、非肿瘤性全覆盖。
- Q:数据来自哪些机构? A:韩国 Korea University Medical Center、日本 Kameda、土耳其 Memorial Health Group、印度 AIIMS、德国 University Hospital Cologne 与 TUM Hospital——6 机构 5 国。
- Q:图像是什么格式与倍率? A:TIFF 格式 H&E 染色 WSI,已匿名化,仅保留 20x 放大率层。
- Q:报告是什么结构? A:按 CAP(美国病理学家学院)协议结构化——organ/procedure/histologic type/histologic grade 字段;诊断命名遵循 WHO 肿瘤分类。
- Q:CoT 数据长什么样? A:每例一条问答链 [{question, answer, next_question}],按真实报告书写过程构建,链式链接,末题产出最终报告且 next_question 为空串。
- Q:Metric A 和 Metric B 分别考什么? A:Metric A(工作流推理)考推理链——路径有效性 5%+边 F1 30%+MESS 25%+最终报告 40%;Metric B(视觉落地)考看图——背景拒绝 30%+输入敏感性 30%+跨区一致性 40%。
- Q:总分怎么合成? A:总分=70%×Metric A 合成分+30%×Metric B 合成分;终榜=0.3×Test1+0.7×Test2。
- Q:裁判模型是什么? A:本地 Qwen3-8B(约 16GB 权重)做 LLM-as-judge+NeuML/pubmedbert-base-embeddings 句嵌入;评估容器断网运行。
- Q:评估代码开放吗? A:开放——06-02 起在 GitHub(Haasha/REG2026)的 submission_evaluation_code/ 目录,官方声明本地评分与官方榜单同逻辑。
- Q:数据在哪下载? A:AWS S3 公开桶 s3://reg2026-challenge-dataset,经 Registry of Open Data on AWS 收录——公开直链型。
- Q:参赛需要什么条件? A:Grand Challenge 认证账户(先完善档案再申请验证)——数据公开与参赛注册两层分离。
- Q:License 是什么? A:CC BY-NC-SA(官网 Data description 与 AWS Registry 双口径一致)——署名+非商用+相同方式共享。
- Q:奖金多少? A:€800/€400/€200/€100+第 5 名证书;前五名发证书。
- Q:拿了名次就能拿钱吗? A:不一定——组委会赛后向入选队伍索取源代码做可复现性验证,检查通过才发最终奖金。
- Q:提交限额是多少? A:Debug 每队 10 次(不计成绩)、Test1 每队 3 次、Test2 每队 1 次。
- Q:终榜为什么 0.3/0.7 加权? A:官方 07-02 公告口径——Test2 权重七成(且仅一次提交),防多轮刷分。
- Q:结果什么时候宣布? A:Top-3 于 2026-09-27 起的 MICCAI 2026 会期(09-27~10-01,斯特拉斯堡)宣布——本条目抓取时点(09-25)尚未发生。
- Q:为什么叫"赛后待宣期"? A:测试已关、论文已交、奖未宣——介于进行时与完结时之间;本库挑战赛条目四态状态机的第三态,本条目处其早段。
- Q:2025 届冠军是谁? A:ICGI(奥斯陆大学医院癌症遗传与信息学研究所)的 NARWHAL 系统——TRIDENT 预处理+H-optimus-1 骨干+滑块聚合生成报告。
- Q:2025 届评分公式是什么? A:0.15×(ROUGE+BLEU)+0.4×KEY(Jaccard)+0.3×EMB(生物医学 LLM 嵌入余弦)——2026 以 LLM 裁判+过程评分替换之。
- Q:2025 公开基线差多少? A:平均比头部提交低约 16.9%(Phase 1)/30.4%(Phase 2)——arXiv:2609.00866 的基准对比结论。
- Q:agentic AI 在本届的位置? A:官网把"agentic vs non-agentic 同基准对照"列为办赛目标;接口标准化但架构不强制——CoT 链接口天然适配多步决策系统。
- Q:可以用预训练模型吗?外部数据呢? A:2025 规则允许预训练、禁额外外部数据训练;2026 细则全文在平台登录侧未公开——本条目如实标注不推测。
- Q:能用挑战数据写论文吗? A:官方 meta paper 与论文集公开前不可以(会议论文/预印本/期刊都受限);例外须组织者事先书面许可。
- Q:workshop 和论文集什么时候? A:官网明示截止将另行公布,抓取时点未给出。
- Q:数据修订过吗? A:修订四次——05-20(11 例 WSI 元数据重转)、05-31(18 例 WSI 修订)、06-01(8 例 CoT 截断补全)、05-25(Metric B 样例发布)——官网 Notice 逐条存照。
- Q:mess 是什么指标? A:Metric A 的第三子分(权重 25%)——非最终步骤的语义分;键名与权重公开,公式细节在仓库 evaluate_metrics.py 内。
- Q:和库内 imcs-21 什么关系? A:imcs-21 是 REG² 之前的病理(胃镜)结构化报告生成数据集——REG² 把"报告生成"升级为"报告+推理链"并放到多器官多国 WSI 尺度。
- Q:和 pathvqa 什么关系? A:pathvqa 是病理视觉问答(单题形态);REG² 的 Metric B 是 ROI 级问答+三重一致性测试,Metric A 是整链推理——问答只是链上的一环。
- Q:和 hecktor2026 什么关系? A:同属 MICCAI 2026 的 45 个挑战赛;hecktor2026 是影像任务(分割/分期/生存),REG² 是影像→文本任务;库内两条目互为同届系列。
- Q:怎么快速本地跑评估? A:评估 README 四步——prepare_test_ground_truth.sh→prepare_test_input.sh→download_model_weights.sh(一次性 ~16GB)→do_test_run.sh;自带 20 任务样例零配置验证。
- Q:怎么自建验证集? A:从训练集划出未训练子集——Metric B 填 rois_mapping.txt(七列表),Metric A 填 ground_truth_CoT.json(链式结构);官方 README 有完整流程。
- Q:本条目还会更新吗? A:会——附录 N 维护计划列了五个触发点(Top-3 宣布/workshop/论文集/数据页更新/下届官宣),触发即回填。
- Q:Metric B 的 perturbed ROI 是什么? A:对原始 ROI 做扰动的变体版本——与 original 配对考"输入敏感性":模型答案应随图像内容一致变化,扰动前后若答案乱翻说明模型没真看图。
- Q:为什么训练数据里要有良性/非肿瘤性案例? A:真实病理工作里"无肿瘤性病变"也是报告——只会说癌的模型在 reportability 判定上是残缺的;良性案例逼模型学会"确认没病也是诊断"。
- Q:Test1 和 Test2 的 WSI 有区别吗? A:格式一致(同训练集格式);区别在机制——Test1 三次提交权重 30%,Test2 一次提交权重 70%;官方未披露两切分的机构构成是否有 site hold-out 差异(2025 届有 site hold-out 设计)。
- Q:本地评估需要什么硬件? A:裁判模型 Qwen3-8B 约 16GB 权重——推理建议 24GB 级显存 GPU(JUDGE_DEVICE 可退 cpu 但极慢);嵌入模型很小;Docker 必备。
- Q:评估容器为什么断网? A:
--network none 保证评分不依赖运行时网络——依赖全部打进镜像、权重提前挂载;这是评测可复现性的工程保障,也杜绝评估期外呼。
- Q:Qwen3-8B 裁判会不会被过拟合? A:有此风险且评估代码开源使本地"对着裁判调参"成为可能——组织方以论文+代码强制提交与复现性检查作为制衡;裁判鲁棒性是 overview 论文的待验证题。
- Q:这个数据集能拿来做预训练吗? A:定位是基准+微调——1.2 万例对 VLM 微调合适,对预训练太小;且 CoT/ROI 标注的监督形态是为对齐设计的,不是自监督语料。
- Q:和 GPT-4V 这类通用模型比,专业管线还有优势吗? A:2025 的答案是"基线通用方法落后头部提交 16.9%-30.4%"——gigapixel 输入处理与病理术语对齐是专业管线的护城河;通用 VLM 直推全片在分辨率与幻觉上都吃亏(arXiv:2609.00866 结论语义)。
- Q:如果我不参赛,数据对我有用吗? A:有用且门槛低——S3 公开桶直接下;CoT 链可做链式 SFT 素材、Metric B 三测试可复用为幻觉检测工具箱(附录 S);但注意 meta paper 前的发表限制(§3.5)。
- Q:2026 的成绩什么时候能查到? A:Top-3 于 09-27 起的 MICCAI 会期宣布;完整榜单与 overview 论文时间未公布——关注官网 Notice 与本条目附录 N 维护触发点。
- Q:七器官的数据量是均衡分布的吗? A:官方只给了器官-诊断类别定性表(附录 B 同源的 Data description 表),未公布逐器官例数分布——不推测;使用前自测训练集各器官占比。
- Q:报告是自由文本还是纯结构化字段? A:“结构化文本”——从真实诊断记录导出、按 CAP 协议标准化,含 organ/procedure/type/grade 等字段;比纯 JSON 字段富、比自由散文规范——这正是"结构化生成"的甜点区。
- Q:Metric B 的 ROI 从哪来? A:训练侧官方发布样例包(05-25)展示结构,且明言"预期参赛者自建 ROI/背景/问题场景"——即 Metric B 的训练素材一部分要自己挖;测试侧 ROI 由官方真值提供。
- Q:可以只用一个接口参赛吗? A:总分按 70/30 合成两个 Metric——单接口提交在缺失侧拿零分,数学上不可能上榜;两接口都是必答题。
- Q:评估代码的许可证允许我改吗? A:代码公开于 GitHub 供本地复算与验证;改动后再提交到官方平台是否合规以官方规则为准(本条目不对许可证细节做超出仓库事实的解读)。
- Q:CoT 链的"问题"是官方固定模板还是自由生成? A:提交时链上每步的 question 由参赛系统生成——但评分对照官方真值链的图结构(Edge F1),所以问题的"语义位置"要对齐真值工作流,措辞自由、结构受限。
- Q:这个赛和数据集跟 NUMA/CPath 等大计划什么关系? A:无公开官方关联记录——本条目不推测;它就是韩国主导、多国机构供数的独立挑战赛(附录 P 组织结构表)。
- Q:待宣期结束的标志是什么? A:本库纪律:官方公布获奖名单(晚段起点)与 meta paper 落地(完结态起点)——两者都发生前,条目的一切 2026 成绩位保持留白。
事实清单(50 条存照)
- 全称:Pathologist REasoning-Guided REport Generation Challenge(官网标题)。
- 上标 2 源于两个 RE 组合(官网命名)。
- 第二届;REG2025 为第一届(Bioptimus 案例文 “first global challenge” 实锤)。
- REG2025 随 MICCAI 2025(第 28 届)举办(Bioptimus 案例文 “run alongside the 28th International Conference”)。
- 挂靠 MICCAI 2026(斯特拉斯堡,09-27~10-01)卫星挑战赛(官网+领英)。
- 注册开放 2026-04-15 18:00 KST(官网 Important dates)。
- 训练数据发布 2026-05-11 18:00 KST(官网)。
- Debug 原 06-14 关、延长至 06-29(官网划线改记+11 June 通告)。
- Test1 2026-06-15~06-29;Test2 2026-07-01~07-20(官网,Test2 开放日 06-30→07-01 修订存照)。
- Top-3 于 09-27 起 MICCAI 会期宣布(官网;抓取时点 09-25 未发生)。
- 训练集约 12,000 例(官网 “about 12K”/AWS “about 12,000”,两源均注明可变)。
- Test1 350 例(06-15 Notice);Test2 70 例(官网 Data description 切分表)。
- 七器官:乳腺/结肠/肺/前列腺/胃/膀胱/子宫(官网器官表)。
- 诊断覆盖恶性/癌前/良性/非肿瘤性(官网 Data description)。
- 六机构五国(官网扫描器表)。
- 扫描器四家:Aperio/通用 TIFF/Hamamatsu NanoZoomer/Leica GT450DX(官网表)。
- Kameda=日本;Memorial Health Group=土耳其(官网表机构-国家对照)。
- H&E 染色(AWS Registry “hematoxylin and eosin (H&E)-stained”)。
- 20x 放大率、TIFF、匿名化(官网 Data description+AWS)。
- CAP 协议结构化+WHO 肿瘤分类命名(官网 Data description)。
- CoT=按真实报告书写过程构建的问答链(官网+AWS 双口径)。
- Metric A 子分权重 5/30/25/40(评估 README Score breakdown 表)。
- Metric B 子分权重 30/30/40(同上)。
- 总分 70% A+30% B(README “Overall score” 原文)。
- 终榜 0.3×Test1+0.7×Test2(07-02 公告)。
- 裁判模型 Qwen3-8B ~16GB+pubmedbert-base-embeddings(README 配置表)。
- 评估代码 06-02 公开(官网 Updates 通告)。
- GitHub 仓库 Haasha/REG2026(官网两处链接)。
- 提交额度 Debug 10/Test1 3/Test2 1(官网+README)。
- 奖金 €800/400/200/100+第 5 名证书(Prizes 页)。
- 复现性检查通过才发最终奖金(Prizes 页原文语义)。
- License CC BY-NC-SA(官网 Data description+AWS Registry 双口径)。
- S3 公开桶 s3://reg2026-challenge-dataset(AWS Registry arn)。
- AWS Registry “Managed By: Korea University”(AWS 条目)。
- 赞助五源:Korea University/MSIT(NRF+IITP)/KHIDI/AWS/MCML(官网 organizers 页)。
- TUM Schüffler Lab 参与组织与科学发展(TUM 官网新闻页)。
- 竞赛联络 Haasha Bin Atif(官网 organizers 页 Competition support;公开档案 NUCES 背景——身份只记联络人)。
- 2025 overview 论文 arXiv:2609.00866(55 作者,2026-09-01 提交,第一作者 Yumi Lee);2025 冠军 ICGI/NARWHAL(Bioptimus 案例文)。
- Debug 延长通告:06-11 官宣由 06-14 延至 06-29 与 Test1 窗并行(官网 Updates)。
- Test2 开放日修订:06-30→07-01(官网表划线存照+07-02 上线通告)。
- 4 月版官网奖金口径为"额外奖金待学会/产业伙伴/MICCAI SIG 确认"(搜索快照存照)——后期落实为 €800/400/200/100。
- MICCAI 2026 卫星事件规模:58 workshops/45 challenges/9 tutorials(MICCAI 官网 2026 秋季季报)。
- 官网 Publication and use 节明言:官方 meta paper 与论文集公开前,参与者不得用挑战数据写会议论文/预印本/期刊文章(书面许可例外)。
- 训练集 CoT 文件名 train_CoT.json(06-01 修订通告点名)——8 例截断修复的对象文件。
- Test Phase 1 WSI 发布公告明言"格式与训练集一致,真值报告与 CoT 不随附"(06-15 Notice)。
- 官方提交模板 admonition:“从模板改起而非从零搭管线”(algorithm_submission_template README 语义)。
- 评估 README 明言本地样例数据"taken from the REG2026 training set and exist solely as working examples"——非官方测试集。
- 评估容器运行约束:–network none 断网+固定路径契约(README 第 2/9 节)。
- Test2 期间公告原文:participants are required to submit their challenge paper via OpenReview and provide their code repository(07-02 通告)。
- REG2025 届规则"可预训练模型、禁额外外部数据训练"(Bioptimus 案例文记录);2026 届细则未公开(待核)。
- 清单读法:50 条事实全部指向官方一手来源或双源交叉——每条可独立核对;单源事实(如 Bioptimus 案例文的公式记录)已在条内标注单源属性。
术语表(44 条)
- WSI(Whole Slide Image):全切片图像——整张病理玻片的超高清数字扫描,gigapixel 级。
- H&E:苏木精-伊红染色——最常规的组织学染色,细胞核蓝紫/胞质粉红。
- CoT(Chain-of-Thought):思维链——本条目指按报告书写过程构建的问答序列标注。
- CAP protocol:美国病理学家学院协议——病理报告的结构化字段规范。
- WHO Classification of Tumours:WHO 肿瘤分类——组织学类型与亚型命名的国际标准。
- Workflow Reasoning:工作流推理——Metric A 语义,推理链的结构与语义评估。
- Visual Grounding:视觉落地——Metric B 语义,回答必须对应可指认的图像区域。
- Edge F1:边 F1——推理图边集匹配的 F1 分数(Metric A 30% 子分)。
- MESS:Metric A 第三子分(25%)——非最终步骤语义分(全称未公开)。
- binary path validity:路径二值有效性——推理链是否构成有效可达结构(5%)。
- background rejection:背景拒绝——对无组织 ROI 的识别/拒答(Metric B 30%)。
- input sensitivity:输入敏感性——original/perturbed 配对答案一致性(Metric B 30%)。
- cross-region consistency:跨区一致性——同切片不同 ROI 回答无矛盾(Metric B 40%)。
- LLM-as-judge:以大模型为裁判的评估范式——本届裁判为本地 Qwen3-8B。
- Qwen3-8B:阿里通义千问 3 代 8B 参数模型——本赛本地裁判(~16GB 权重)。
- PubMedBERT embeddings:生物医学预训练句嵌入(NeuML/pubmedbert-base-embeddings)——评估侧嵌入工具。
- agentic AI:智能体化 AI——规划/工具使用/多步决策的系统形态。
- MIL(Multiple Instance Learning):多实例学习——WSI 弱监督的主流范式(patch 袋→slide 级预测)。
- ABMIL:注意力门控多实例学习——2025 冠军系的聚合器。
- TILE/patch:切片子块——WSI 处理的分割单元。
- Grand Challenge(GC):医学影像挑战赛平台——本赛托管与提交平台。
- AWS Registry of Open Data:AWS 公开数据注册表——本数据集的发现入口。
- CC BY-NC-SA:署名-非商用-相同方式共享许可。
- OpenReview:论文评审平台——本届方法论文提交地。
- camera-ready:终稿——论文录用后的出版就绪版本。
- meta paper:挑战赛总览论文——组织方撰写的赛制与结果综述(发布前有数据使用限制)。
- numeric hallucination:数值幻觉——2025 overview 论文命名的失效模式(定量属性估计不稳)。
- diagnostic overspecification:诊断过度指定——2025 命名的失效模式(结论超出证据)。
- reportability:可报告性——病理学家判定"哪些发现值得写进报告"的决策。
- debug phase:调试阶段——不计成绩的容器/格式验证提交窗口。
- site hold-out:站点留出——测试集整机构保留以防机构泄漏(2025 届设计,2026 切分构成未披露)。
- leaderboard:排行榜——本赛终榜按 0.3/0.7 加权两测试阶段。
- per-case results:逐例结果——评估输出可开启的明细粒度(INCLUDE_PER_CASE_RESULTS)。
- manifest.json:真值清单映射——pk 键到案例 title 的对应文件(评估容器内固定路径)。
- pk 键:任务主键——评估平台组装预测与真值的索引单位。
- TRIDENT:开源大规模 WSI 处理工具包——2025 冠军与多队预处理首选。
- CLAM:开源弱监督 WSI 分析框架——2025 生态常用管线。
- n-gram 约束解码:生成时约束 n-gram 重复/合法转移的解码技术——冠军系用于报告与链生成。
- stain normalization(染色归一化):消除 H&E 染色批次/扫描器色差的预处理——跨中心稳健性的常规武器。
- minimal pair(最小对):只差一处扰动的输入对——输入敏感性测试的方法学根基。
- ** LoRA**:低秩适配微调——7-8B 级生成器在 ~12K 例上的现实微调方式。
- TIFF pyramid(金字塔):WSI 的多分辨率存储结构——官方只保留 20x 层,读图工具需适配。
- openslide 系工具:WSI 读取的开放工具族(openslide/tifffile 等)——消费本数据集 TB 级图像的默认入口。
- camera-ready:终稿——论文录用后出版就绪版本(本赛截止未公布)。
附录
附录 A:数据切分与额度对照表
| 切分 |
例数 |
真值 |
每队额度 |
权重 |
| Training |
~12,000 |
WSI+报告+CoT 全量 |
—(本地用) |
— |
| Test 1 |
350 |
仅 WSI |
3 次提交 |
终榜 30% |
| Test 2 |
70 |
仅 WSI |
1 次提交 |
终榜 70% |
| Debug |
—(用自有/样例数据) |
— |
10 次提交 |
不计成绩 |
附录 B:机构-国家-扫描器对照表(官网 Data description 原表)
| 机构 |
国家 |
扫描器 |
| Korea University Medical Center |
韩国 |
Aperio & Generic TIFF |
| Kameda |
日本 |
Generic TIFF |
| Memorial Health Group |
土耳其 |
Aperio |
| AIIMS |
印度 |
Hamamatsu NanoZoomer |
| University Hospital Cologne |
德国 |
Aperio |
| TUM Hospital |
德国 |
Leica GT450DX |
- 表读法三则:①两个德国机构用了两牌扫描器(Aperio vs Leica)——同国不同器,泛化难度再+1;②唯一非 Aperio 系的亚洲机构是 AIIMS(Hamamatsu)——印日系设备对模型是少数派挑战;③"Generic TIFF"两机构(Kameda+Korea U)提示部分数据经过了统一转换管线——原始格式多样性比表面看到的更复杂
附录 C:评分权重全景表(评估 README)
| 层级 |
组成 |
权重 |
| 总分 |
Metric A 合成分 |
70% |
| 总分 |
Metric B 合成分 |
30% |
| Metric A |
binary_path_validity |
5% |
| Metric A |
edge_f1 |
30% |
| Metric A |
mess |
25% |
| Metric A |
final_report_score |
40% |
| Metric B |
background_rejection |
30% |
| Metric B |
input_sensitivity |
30% |
| Metric B |
cross_region_consistency |
40% |
| 终榜 |
Test Phase 1 |
30% |
| 终榜 |
Test Phase 2 |
70% |
- 权重设计解读:①终点 40% vs 过程 60%——组织方用权重宣告"推理链不是报告的附件而是主产物";②Metric B 只占 30%——视觉落地是护栏不是主赛道(背景拒绝等三测试更像安全网而非能力赛);③终榜 70% 压 Test2——把泛化不确定性(70 例新测试)置于一切之上,防"Test1 调参型"策略;④路径有效性只给 5%——"链存在且可达"是底线分,真正的区分度在 Edge F1 与 MESS(合计 55%)——思路覆盖与步骤语义才是拉开名次的地方
附录 D:Metric A 提交格式(ground_truth_CoT.json 结构)
[
{
"id": "YOUR_SLIDE.tiff",
"chain-of-thought": [
{ "question": "...", "answer": "...", "next_question": "..." },
{ "question": "...", "answer": "...", "next_question": "" }
]
}
]
- 末步 next_question 必须为空串;id 与 WSI 文件名对应(扩展名可选)。
- 一条示例链的语义走读(构造示例,非真实数据):
- {q: “切片属于哪个器官?”, a: “结肠。”, next_q: “标本是什么术式?”}—— organ 定锚
- {q: “标本是什么术式?”, a: “结肠镜活检。”, next_q: “病变的组织学类型?”}—— procedure 定锚
- {q: “病变的组织学类型?”, a: “管状腺瘤伴低级别上皮内瘤变。”, next_q: “有无高级别区域或浸润证据?”}—— type 判定+引出分级核查
- {q: “有无高级别区域或浸润证据?”, a: “未见高级别异型增生或浸润。”, next_q: “”}—— 安全关键排除+收尾成文
- 走读要点:链的每步都在为 CAP 四字段服务,末两步覆盖"安全关键发现排除"——官网批评 2025 指标漏掉的正是第 4 步这类否定性结论
附录 E:Metric B ROI 表七列(rois_mapping.txt)
| 列 |
取值 |
用途 |
| anonymous_id |
唯一字符串(如 000000) |
案例键 |
| image |
文件名(如 roi_000000.jpg) |
ROI 图像引用 |
| variant |
original 或 perturbed |
输入敏感性配对 |
| paired_anonymous_id |
另一 anonymous_id 或 none |
敏感性配对键 |
| b3_paired_anonymous_id |
另一 anonymous_id 或 none |
跨区一致性配对键 |
| label |
tissue 或 background |
背景拒绝判定 |
| question |
问题字符串 |
对模型的提问 |
- 预测文件格式:[{ “id”: “<anonymous_id>”, “answer”: “…” }] 每 ROI 一条。
附录 F:2025→2026 评分公式对照存照
- REG2025:
0.15 × (ROUGE + BLEU) + 0.4 × KEY (Jaccard) + 0.3 × EMB(Bioptimus 案例文记录;KEY=临床关键词覆盖,EMB=生物医学 LLM 嵌入余弦相似度)。
- REG²:
70% × (5% path + 30% edge_F1 + 25% MESS + 40% final_report) + 30% × (30% bg_reject + 30% sensitivity + 40% cross_region)(评估 README)。
- 代差本质:词汇重合→过程审计;浅语义工具→LLM 裁判;单终点→终点+路径+视觉落地三维。
附录 G:2025 冠军 NARWHAL 技术栈(Bioptimus 案例文)
- 预处理:TRIDENT 开源工具包——大尺度 WSI 切片与特征提取。
- 骨干:H-optimus-1(Bioptimus)——1.1B 参数 ViT-g/14;训练语料百万级 H&E 切片、80 万+患者、4000+ 临床中心、50 器官。
- 聚合与生成:定制组件从 tile 特征建 slide 级向量→生成标准化临床报告。
- 选型证据:五个候选骨干在训练留出集上多轮基准,H-optimus-1 平均排名最高。
- 团队:ICGI(Oslo University Hospital)Audun Ljone Henriksen、Sepp De Raedt。
- 2026 视角的重估:NARWHAL 栈在 2026 的直接可用部分是 TRIDENT 预处理与骨干选型方法论;需重构的是输出层——链式接口要求生成器按步作答(每步一小答案+下一问题),2025 的"一次成文"解码器要做链式化改造;H-optimus-1 的骨干地位在 2026 能否保持取决于新参赛队的消融——但"系统化消融选骨干"的方法论已是冠军标配的显学
- 可迁移性判定:NARWHAL 三层架构对 2026 参赛者的参考价值高于具体模型选型——"预处理/骨干/生成"的解耦设计让每一层都可独立替换,这与 agentic 系统的模块化诉求天然兼容
附录 H:2025 参赛方法生态表(arXiv:2609.00866 表 6 摘要)
| 队伍 |
报告处理 |
WSI 预处理 |
架构要点 |
基础模型 |
| ICGI(冠军) |
分类别分离+错字纠正 |
Trident ABMIL tile 聚合 |
n-gram 约束 Transformer 解码 |
H-Optimus-1 |
| ICL_PathReport |
层级标注树 |
Trident |
PRISM 编码聚合+专家树生成 |
Virchow |
| IMAGINE Lab |
器官/诊断概念提示 |
Trident |
MLP 多模态融合+GPT 引导交叉注意力 |
CONCH, TITAN, GPT |
| ADCT |
按癌种建码本 |
器官特异 patch 尺寸 |
ABMIL+Flan-T5 结构化生成 |
CONCH, GigaPath, UNI, Virchow, HistoEncoder |
| MTS_REG_2025 |
报告规范化+模板重建 |
Prov-Gigapath 管线 |
RAG 检索+Qwen-3 8B 生成 |
Prov-Gigapath, Qwen-3 8B |
| REG_Path |
问答对生成 |
阈值自适应预处理 |
两阶段微调 SlideChat |
CONCH, SlideChat |
- 摘要仅列 6 代表队(11 队分析样本的子集)——完整表见 arXiv:2609.00866。
附录 I:官方 GitHub 仓库地图(Haasha/REG2026)
REG2026/
├── algorithm_submission_template/ # 提交容器基线模板(官方明言"从模板改起")
│ └── README.md # 推理/双任务接口/本地测试/上传全流程
└── submission_evaluation_code/ # 评估代码(06-02 公开)
├── evaluate.py # 容器入口
├── evaluate_metrics.py # Metric A/B 评分逻辑(LocalQwenJudgeLLM 在此)
├── evaluation_config.env # 配置(裁判模型/嵌入模型/设备)
├── download_model_weights.sh # 裁判权重下载(~16GB,一次性)
├── do_test_run.sh # 本地评估(断网 --network none)
├── data/ # 样例与自建验证集指南
└── ground_truth/ # 真值构建输出+裁判权重挂载位
- 仓库读法三则:①这是一个"双仓库合一"的设计——提交模板与评估代码同址,参赛者克隆一次拿全套;②评估代码与模板同版本演进(06-02 通告要求 pull 最新 main)——本地评测逻辑漂移风险由官方主动管理;③ground_truth/ 目录在运行时由 prep 脚本生成+裁判权重下载填充——不要手工伪造结构,脚本链会按固定路径重建
附录 J:本地评估四步流程(README 原序)
cd submission_evaluation_code
./prepare_test_ground_truth.sh # 步骤1:案例→ground_truth/
./prepare_test_input.sh # 步骤2:预测→test/input/
./download_model_weights.sh # 一次性:裁判权重 ~16GB
./do_test_run.sh # 步骤3:Docker 评估→test/output/metrics.json
- 自带样例:Metric A 2 例+Metric B 18 例=20 任务;本地分数与官方榜单同逻辑(README 承诺)。
- 排错三则(README 语义归纳):①评估跑不动——先查裁判权重是否已下载到 ground_truth/Qwen3-8B/(最大坑,~16GB 不是自动拉取);②GPU 不工作——查 USE_GPUS 与 JUDGE_DEVICE 配置及宿主 Docker GPU 透传;③分数异常——确认 predictions.json 的 id 与真值对齐策略一致、INCLUDE_EVALUATION_DETAILS=1 打开逐例排查
附录 K:复现研究骨架(伪代码,方法论示意)
# REG² 双任务参考实现骨架(结构示意,非官方代码)
class RegAgent(nn.Module):
def __init__(self, backbone, llm):
self.encoder = backbone # H-optimus-1/CONCH 级病理基础模型
self.aggregator = ABMIL(dim=1536) # tile→slide 聚合
self.llm = llm # Qwen/BioGPT 级生成器(LoRA 微调)
def metric_a(self, wsi):
feats = [self.encoder(p) for p in tiles(wsi)]
slide = self.aggregator(feats)
cot = self.llm.generate_chain(slide) # [{q, a, next_q}, ...]
return cot # 末步 next_question 必须为空串
def metric_b(self, roi):
return self.llm.answer(roi) # {"id": ..., "answer": ...}
-
关键点:Metric A 生成的是链不是单答案——训练目标要含 next_question 的转移监督。
-
骨架说明:①backbone 建议加载预训练权重并冻结前 N 层——~12K 例不足以从头训练视觉侧;②aggregator 用 ABMIL 起步即可(2025 冠军同款),瓶颈大概率不在聚合器复杂度;③llm.generate_chain 的实现要点是把"下一步问什么"建模成显式选择(从真值链的问题分布中采样监督)而非自由续写——Edge F1 评的是结构对齐;④metric_b 的 ROI 头可与主生成器共享视觉编码器(省一次前向)但答案头独立训练——背景拒绝类样本建议过采样(30% 权重对应的失分最容易被轻视)
附录 L:AWS OpenData 存照(Registry 条目字段)
- 名称:Pathologist Reasoning-Guided Report Generation (REG2026) Dataset
- 资源:arn:aws:s3:::reg2026-challenge-dataset
- 许可:CC BY-NC-SA
- 托管:Korea University(联系 vanitasahn@gmail.com)
- 更新频率:初始发布后无定期更新计划
- 工具:PathfinderLab 三件(挑战赛介绍/数据描述/教程 notebook)
- 引用格式:REG2026 Dataset accessed on DATE from https://registry.opendata.aws/reg-2026
附录 M:时间线全表(KST 基准,含修订存照)
| 里程碑 |
官方日期 |
修订痕迹 |
| 注册开放 |
04-15 |
— |
| 训练集+Debug 开放 |
05-11 |
— |
| WSI 元数据修订 |
05-20 |
11 例 |
| Metric B 样例 |
05-25 |
结构示范 |
| Debug 提交开放 |
05-30 |
— |
| WSI 修订 |
05-31 |
18 例 |
| CoT 补全 |
06-01 |
8 例截断 |
| 评估代码公开 |
06-02 |
— |
| Debug 关闭 |
06-29 |
原 06-14(06-11 通告延长) |
| Test1 |
06-15~06-29 |
WSI 06-15 发布 |
| Test2 |
07-01~07-20 |
开放日 06-30→07-01 |
| 论文+代码提交 |
07-02 指引后 |
OpenReview+GitHub 强制 |
| Top-3 宣布 |
09-27 起会期 |
MICCAI 09-27~10-01 |
-
缺口注:workshop/proceedings/camera-ready 三项截止官方未给出——本表不含未发生且无日期的行;回填时按附录 N 操作模板追加。
-
时间线观察:①全周期 04-15→09-27 约 5.4 个月,比 hecktor2026(注册到宣奖约 6 个月)略紧凑;②训练窗口(05-11→06-29)仅 7 周——参赛者实际开发时间紧张,基础模型+LoRA 微调几乎是必然选择;③数据修订集中在发布后前三周(05-20/05-31/06-01)——官方响应速度尚可,但提示"首发数据集"的使用者预留两周对账期;④Test2 结束(07-20)到宣布(09-27)间隔 9 周多——论文评审与复现初筛占用期,等待期长是 MICCAI 挑战赛常态
-
双时区换算示例:官网"18:00 KST"即 UTC 09:00、北京时间(UTC+8)17:00、中欧时间(夏令时 CEST,UTC+2)11:00、美东(夏令时 EDT,UTC-4)05:00——跨时区团队对表用 UTC 最稳
附录 N:维护计划(五触发点)
- Top-3 宣布(09-27~10-01 MICCAI 会期)→回填获奖名单与成绩锚,条目状态推进至"待宣期晚段"。
- workshop 举行(截止未公布)→回填 workshop 日期、现场报告要点。
- meta paper/论文集发布→回填 overview 结论、方法全景、官方失效模式分析;同时解除数据引用限制(§3.5)。
- 数据页/评估页更新(官网明示将另行公布)→回填最终例数(若偏离 ~12,000)、workshop/proceedings/camera-ready 日期。
- 下届(REG 2027)官宣→触发分代评估(若代差 ≥50% 或任务形态跃迁则开新条目)。
-
触发点优先级:1>3>2>4>5——名单与论文直接决定条目核心价值(成绩锚与引用合法性),workshop 与页码更新为锦上添花,下届官宣属远期监控项。
-
维护操作模板(触发时执行序):①重抓官网主页 diff Notice/Updates 段;②核对附录 M 时间线表并追加新里程碑行;③按附录 AH 映射表回填对应章节;④跑 check_md+preflight 双闸门;⑤post_publish_check --rids <本条目> --online 终验——五步全过才算回填完成(与五段闭环纪律一致的轻量版)
附录 O:术语中英对照速查
| 中文 |
英文 |
| 全切片图像 |
Whole Slide Image (WSI) |
| 思维链 |
Chain-of-Thought (CoT) |
| 工作流推理 |
Workflow Reasoning |
| 视觉落地 |
Visual Grounding |
| 病理报告生成 |
Pathology Report Generation |
| 计算病理学 |
Computational Pathology |
| 多实例学习 |
Multiple Instance Learning (MIL) |
| 数值幻觉 |
Numeric Hallucination |
| 诊断过度指定 |
Diagnostic Overspecification |
| 可报告性 |
Reportability |
| 背景拒绝 |
Background Rejection |
| 跨区一致性 |
Cross-Region Consistency |
| 输入敏感性 |
Input Sensitivity |
| 裁判模型 |
Judge Model |
| 复现性检查 |
Reproducibility Check |
| 结构化报告 |
Structured Report |
| 组织学类型 |
Histologic Type |
| 组织学分级 |
Histologic Grade |
| 推理图 |
Reasoning Graph |
| 提交容器 |
Submission Container |
| 断网评估 |
Offline (No-Network) Evaluation |
| 逐例结果 |
Per-Case Results |
| 发表限制 |
Publication Restriction |
| 染色归一化 |
Stain Normalization |
附录 P:组织与资助结构表(官网 organizers 页)
| 层级 |
主体 |
角色 |
| 托管方 |
Korea University |
数据资产归属(AWS 口径)/赞助首位 |
| 资助 |
MSIT→NRF |
Digital-Bio AI+X 全球创新人才培养项目 |
| 资助 |
MSIT→IITP |
ICT Creative Consilience Program |
| 资助 |
保健福祉部→KHIDI |
Korea Health Technology R&D Project |
| 基础设施 |
AWS |
S3 公开桶+Registry 收录+赞助 |
| 学术网络 |
MCML |
慕尼黑机器学习中心赞助 |
| 参与组织 |
TUM 病理所 Schüffler Lab |
组织与科学发展(TUM 新闻页口径) |
| 竞赛联络 |
Haasha Bin Atif |
官网列名联络人(GitHub 仓库所有者) |
- 表读法:两层结构清晰——公共资金(两部委三通道)打地基、产业与学界(AWS/MCML)供基础设施与网络;这种结构下数据集的公共品属性(公开桶+NC 许可)是资助逻辑的自然延伸。
附录 Q:证据链自证(本条目可信度声明)
- 一手来源:官网五页(主页/organizers/prizes/data-description/AWS 转介的 download-data 路径)+GitHub 评估 README 全文+AWS Registry 条目+arXiv:2609.00866 摘要与作者表。
- 侧证来源:TUM 官网新闻页、Bioptimus 官网案例文、LinkedIn 官宣帖、MICCAI 官网(会期与 45 challenges 数字)。
- 交叉验证:license(官网+AWS 双口径)、规模(官网+AWS 双口径)、届次(Bioptimus+官网+TUM 三源)、时间线(官网表+Notice+Updates 三处互证)。
- 不可得项如实记录:细则全文(登录侧)、MESS 公式(仓库内)、参赛队数(未披露)、联络人机构(无公开记录)——一律标注而非推测。
- 快照差异存照:奖金"待确认→落实"双版本(§5.2);时间线两处修订划线存照(附录 M)。
- 检索日志摘要(8 轮):①"REG2 challenge MICCAI 2026"命中官网与 data-description;②MICCAI 2026 challenges list 命中季报(45 challenges 数字);③evaluation 路径 404→改抓 GitHub README(评估全细节);④rules 两路径 404/403→列入待核;⑤"REG2025"命中 Bioptimus 案例文+arXiv overview(届次+冠军);⑥organizers 页(赞助+联络人);⑦prizes 页(金额+复现条件);⑧AWS Registry+TUM 新闻+联络人身份(dblp/ORCID)。
附录 R:与 hecktor2026 对照表(同届双形态样本)
| 维度 |
REG²(本条目) |
hecktor2026(rid 638) |
| 任务形态 |
影像→文本(报告+推理链) |
影像→影像/标签(分割/分期/生存) |
| 届次 |
第二届 |
第五届 |
| 数据规模 |
~12K 训练例 |
~1423 患者 |
| 中心/机构 |
6 机构 5 国 |
13+ 中心 |
| 可获取性 |
S3 公开直链 |
GC 注册+审核制 |
| License |
CC BY-NC-SA(双口径) |
CC BY-NC-SA(SIG 清单+Zenodo DOI) |
| 评估透明度 |
评估器全开源(README 同逻辑承诺) |
指标公式未公开(待宣期) |
| 奖金 |
€800/400/200/100 |
$1,000/500/300 |
| 待宣期阶段 |
早段(Top-3 未宣) |
晚段(Top 5 已公布 08-20) |
| 共同点 |
待宣期状态机/KST 或欧洲时区注意/论文+代码强制提交/同挂 MICCAI 2026 |
|
附录 S:CoT 链与 ROI 测试的设计逻辑
- 为什么链式问答:把"写报告"分解为病理学家的自然工作流(定位→取材→鉴别→定级→成文),每步独立可评——单看终报无法区分"蒙对"与"推对"。
- 为什么 background_rejection 要占三成:病理 AI 落地最大的安全隐患之一是对空区/伪影"强行找病"——拒答能力是安全底线而非加分项。
- 为什么 original/perturbed 配对:扰动一致性是"真看图"的行为学证据——答案只随图像内容变化而非随提示词漂移。
- 为什么 cross_region 占四成:全局一致性考验"整片证据是否融贯"——对应病理诊断里"同一张片不能前后矛盾"的职业纪律。
- 设计启示:这三招构成一套可迁移的幻觉检测工具箱——任何影像→文本任务(放射报告/超声报告/内镜报告)都能复用此模式。
附录 T:抓取快照存照(2026-09-25)
- 抓取时点:2026-09-25(KST 当日);MICCAI 2026 开幕(09-27)前两天。
- 官网终态:Important dates 完整表+六条 Notice+七条 Updates+Challenge overview/Motivation/From REG2025 to REG²/Publication and use 四节全文在架。
- GitHub 终态:评估 README 完整(九节含 Docker/评分/仓库地图/权重下载/配置/本地测试/固定路径);algorithm_submission_template 在架。
- AWS Registry 终态:条目在架(arn/license/托管方/工具三件齐)。
- 本条目生产:FACTS.md 九节→成稿→check_md+preflight 双闸门→发布→自检——五段闭环全记录于 production_tracker.md。
- 本附录为快照存照:以上信息与正文互为印证,无新增事实。
- 快照一致性:官网当日无新增 Notice/Updates(对照 07-02 最后一条 Updates)——条目反映官网静止终态。
- 抓取覆盖度自查:官网全部 5 个静态页+仓库 2 个 README+Registry 1 页=8 个一手页面,均已入档。
- 时点敏感项清单:奖金落实状态/Top-3 名单/workshop 日期/最终例数——四项为最可能快速变化的字段,回填时优先核对。
附录 U:参赛者 checklist(25 项)
- 注册与资格
- Grand Challenge 账户已创建并完善个人档案
- 已提交账户验证申请并通过(官网 Participation 节要求)
- 已阅读官网 Notice 与 Updates 全部条目(含数据修订四连)
- 环境准备
4. clone 官方仓库 Haasha/REG2026 并 pull 最新 main(官方明言有 minor comment edit)
5. 阅读 algorithm_submission_template/README.md 全文(官方明言 “thoroughly”)
6. 本地 Docker 可用;GPU 驱动就绪(JUDGE_DEVICE=auto 需要 CUDA)
7. 评估镜像构建成功(do_build.sh)
8. 裁判权重已下载(download_model_weights.sh,~16GB,一次性)
- 数据与训练
9. 训练集下载完整(对照官网 Notice 校验 11+18 例修订替换与 8 例 CoT 补全)
10. 自建验证集已从训练集划出(评估 README 流程)
11. Metric B 训练用 ROI/背景区/问题已自建(官方样例仅为结构示范)
12. CoT 链生成已含 next_question 转移监督
13. 末步 next_question 以空串收尾(格式自检)
- 提交管线
14. 算法容器本地跑通(每例一跑语义)
15. 输出 JSON 与官方 schema 一致(Workflow Reasoning 与 Visual Grounding 双工件)
16. Debug 阶段已用满验证额度(最多 10 次)确认端到端无阻
17. Test1 提交计划已定(最多 3 次的全量/消融/终选分配)
18. Test2 唯一提交版本已冻结(1 次机会)
- 论文与代码
19. OpenReview 论文按官方指引格式准备(07-02 指引链接)
20. GitHub 代码仓库已整理(官方要求提交以供复现验证)
21. 运行时资源约束已核对(Rules & regulations 的 Resource constraints 节,登录侧可见)
- 合规
22. 未用挑战数据撰写任何论文/预印本(meta paper 发布前限制)
23. 未在禁用窗口使用外部数据(以登录侧规则全文为准)
24. evaluation_config.env 中 HF_TOKEN 已排除出版本控制
25. 团队信息与获奖资格自查(奖金复现性检查的前置条件)
附录 V:评估配置项全表(evaluation_config.env,README 原序)
| 变量 |
默认值 |
用途 |
| DOCKER_IMAGE_TAG |
reg26-evaluation-sample |
本地镜像名 |
| JUDGE_MODEL_REPO_ID |
Qwen/Qwen3-8B |
裁判权重下载源 |
| JUDGE_MODEL_REL |
Qwen3-8B |
ground_truth/ 下子目录名 |
| JUDGE_MODEL_PATH |
/opt/ml/input/data/ground_truth/Qwen3-8B |
容器内挂载路径 |
| JUDGE_DEVICE |
auto |
auto/cuda/cpu 三选 |
| EMBEDDING_MODEL |
NeuML/pubmedbert-base-embeddings |
句嵌入模型 |
| HF_TOKEN |
空(可选) |
Hugging Face 下载令牌(配置后须保密) |
| USE_GPUS |
auto |
本地 Docker GPU 开关 |
| INCLUDE_PER_CASE_RESULTS |
1 |
metrics.json 含逐例明细 |
| INCLUDE_EVALUATION_DETAILS |
0 |
详细调试块(默认关) |
- 详读提示:per-case 开启后可逐例归因——对齐 Metric B 三测试定位失效 ROI 类别。
附录 W:REG2025 vs REG² 数据资产对比
| 维度 |
REG2025(第一届) |
REG²(第二届) |
| 训练例数 |
~10,500 |
~12,000(+14%) |
| 机构数 |
5 机构 |
6 机构(+Cologne) |
| 国家 |
韩国/日本/印度/土耳其/德国 |
同五国(机构有进出) |
| 器官 |
7 |
7 |
| 标注 |
WSI+结构化报告 |
WSI+结构化报告+CoT 链+ROI 视觉落地标注 |
| 数据形态定位 |
报告生成基准 |
推理基准(报告只是链的终点) |
| License |
CC BY-NC-SA |
CC BY-NC-SA |
| 可获取性 |
挑战赛通道 |
S3 公开桶(AWS Registry) |
| Test 切分 |
分阶段(site hold-outs) |
Test1 350+Test2 70 |
| 评分 |
词汇+关键词+嵌入 |
过程图+终点+视觉落地(LLM 裁判) |
| overview 论文 |
arXiv:2609.00866(2026-09-01) |
未出(待宣期) |
- 读法:第二届的每一项变化都指向同一方向——从"报告像不像"到"推理对不对";数据资产升级(CoT+ROI)与评估升级(LLM 裁判+三测试)互为表里。
- 读法三则:①机构 5→6 的增量(+Cologne)与例数 +14% 大致成比例——单机构平均规模持平,说明扩库靠"再拉一家"而非"老机构放量";②CoT/ROI 两类新标注是真正的形态跃迁,例数增幅反而是次要新闻;③两届 Test 切分都不公布机构构成——跨届成绩对比无效,每一届都是独立的泛化考场。
- 引用建议:跨届研究引用时写"REG 系列(2025-2026)"并在表注分列两届口径——避免把 ~10.5K 与 ~12K 合并成一个无出处总数。
附录 X:影像→文本生成任务的方法学谱系(定位 REG²)
- 第一代:检索/模板(~2017-2020):以类似历史案例检索或字段分类+模板填充产出报告——可控但僵化;病理域对应"两阶段分类+模板"路线(2025 参赛队仍有采用)
- 第二代:MIL+序列生成(~2020-2024):CNN/ViT 提 patch 特征→注意力聚合(ABMIL 系)→RNN/Transformer 解码生成——REG2025 头部生态的主体形态
- 第三代:基础模型+指令微调(~2023-2025):病理基础模型(CONCH/UNI/Virchow/H-optimus-1)+通用生成器(BioGPT/Qwen)LoRA 微调——2025 冠军即此路线的精调版
- 第四代:推理链/agent 化(2026-):显式工作流分解(规划-取证-决策)+多步工具使用——REG² 的赛制设计直接为这一代准备(CoT 接口+agentic 对照目标)
- 谱系定位结论:REG² 是库内首个原生面向第四代的挑战赛数据资产——其 CoT 链标注相当于把第四代的"中间产物"变成了一等监督信号;对照库内放射域报告条目(radgraph 的实体-关系标注、ms-cxr 的一致性校正)——病理域在推理链形态上先行一步
- 未验证项:第四代方法在 WSI 域的实效(agentic vs non-agentic 同榜结果待宣期后回填)
附录 Y:病理报告的临床工作流背景(理解 CoT 设计)
- 报告在临床链条中的位置:病理检查常是诊断的最终确认与金标准;报告文本直接驱动分期、治疗与预后决策——报告质量=下游决策质量的上界
- 真实书写工作流(官方 CoT 构建依据):低倍扫查(定位病变)→中倍取材(识别组织学特征)→高倍确认(核分裂/浸润模式)→鉴别诊断比较→分级与分类判定(对照 CAP 字段与 WHO 命名)→成文(含 reportability 取舍:哪些发现值得进入正式报告)
- CAP 协议字段语义:organ(标本器官)、procedure(术式/标本类型)、histologic type(组织学类型——WHO 主分类)、histologic grade(分级——分化程度/核异型/核分裂计数等分级体系依器官而异)——四字段即结构化报告的最小骨架
- 为什么这些背景影响赛题:①CoT 的"链"就是上述工作流的逐步投影——评链=评工作流;②良性/非肿瘤性实体入数据(§3.2)对应真实工作中"正常/无肿瘤性病变"类报告的写作能力;③数值幻觉(§7.3)正是分级/计数步骤的高危输出
- 跨域对照:放射报告(radgraph 系)的书写工作流是"看图→描述→印象",无多级放大取证步骤——病理报告的工作流更长、结构化程度更高、分级语义更重——这就是为什么病理报告生成是影像→文本任务中推理密度最高的场景之一
- 对 CoT 标注质量的含义:链按真实工作流构建意味着问题序列有职业惯性(先定位后分级)——模型学到的应是"工作流先验"而非题目套路;若未来发现模型只是学会了固定问题序列(Edge F1 虚高),那是评估器需要升级的信号——这个风险官方未讨论,本条目存照。
- 工作流→链的映射示意(本条目构造,便于理解 CoT 构建逻辑):
| 工作流步骤 |
对应链上问题(示意) |
CAP/WHO 锚点 |
| 低倍扫查定位 |
“切片属于哪个器官/标本类型?” |
organ/procedure |
| 中倍取材识别 |
“病变的组织学类型是什么?” |
histologic type |
| 高倍特征确认 |
“核分裂/浸润/异型性证据?” |
grade 依据 |
| 鉴别比较 |
“支持与排除哪些诊断?为什么?” |
WHO 亚型判定 |
| 安全排除 |
“有无高级别/浸润/脉管侵犯?” |
否定性安全结论 |
| 成文取舍 |
“哪些发现进入正式报告?” |
reportability |
附录 Z:合规与伦理要点
- 患者隐私:WSI 已匿名化处理并仅保留 20x 层(官网 Data description 明言)——匿名化是发布前提而非可选项
- NC 条款边界:CC BY-NC-SA 的"非商用"在医疗 AI 语境的边界(科研发表/内部验证/商业产品集成各不相同)——商用前须自行获得权利人许可,本条目不扩张解释
- 相同方式共享:衍生数据集须以同许可发布——基于本数据微调的模型权重是否受 SA 约束,学界尚无定论——保守做法是随权重附同许可声明
- 数据使用限制(官网 Publication and use 节):meta paper 与论文集公开前禁止用挑战数据写论文/预印本/期刊文章——这是办赛方对发表秩序的主动管理(防止参赛队抢发破坏双盲与汇总分析),库内挑战赛条目中与 hecktor2026 同款的发表限制条款
- 复现性问责:奖金与复现性检查挂钩(Prizes 页)——把"可复现"从美德变成可执行契约,是挑战赛治理的一个值得记录的演进
附录 AA:病理基础模型生态表(2025 参赛队所用骨干明细)
| 模型 |
机构 |
形态 |
参数量级 |
在 2025 生态中的角色 |
| H-optimus-1 |
Bioptimus |
ViT-g/14 自监督 |
1.1B |
冠军 NARWHAL 骨干(五候选消融胜出) |
| CONCH |
Harvard/Mahmood 实验室 |
视觉-语言对齐 |
未见公开分解 |
多队文本侧先验(IMAGINE Lab/ADCT/REG_Path) |
| Virchow |
Paige |
DINOv2 系自监督 |
大型 ViT |
ICL_PathReport 幻灯编码器 |
| UNI |
Harvard/Mahmood 实验室 |
ViT-L 自监督 |
~300M |
ADCT/IUCompPath 多模型组合成员 |
| GigaPath |
Microsoft |
生成式 tile+slide 双层 |
大型 |
ADCT/MTS_REG_2025 预处理管线 |
| TITAN |
Harvard/Mahimood 系 |
slide 级预训练 |
— |
IMAGINE Lab/ADCT/NW-TIA 组合成员 |
| BioGPT |
Microsoft |
生物医学文本生成 |
~350M |
生成解码器(MedInsight/IUCompPath/ADCT) |
- 读法:冠军靠"单一最强骨干+克制组合",中游靠"多模型拼接"——模型堆叠数量与名次未见正相关(arXiv:2609.00866 摘要结论的同义转述:VLM 使用本身不保证优越表现)
- 对 2026 的含义:骨干格局大概率延续,竞争焦点移向链式监督的利用方式与 Metric B 三测试的通过率
附录 AB:库内挑战赛条目四态状态机对照(本条目细化"待宣期")
| 状态 |
判定特征 |
库内样本 |
写作纪律 |
| 未开始 |
注册未开/数据未发 |
—(无存档必要) |
预告型写作 |
| 进行时 |
测试窗未关/榜单在动 |
topaneu2026(决策前抓取) |
赛程档案型,禁终榜数字 |
| 赛后待宣期 |
测试已关、奖未宣/论文未出 |
reg2026(早段:Top-3 未宣)/ hecktor2026(晚段:Top 5 已宣) |
历史锚型,2026 结果留白 |
| 完结时 |
终榜+overview 论文至少其一落地 |
topbrain2026(V2 终榜) |
全量回填型 |
- 细化结论(本条目新增):待宣期内部按"名单公布与否"分早/晚段——早段的危险表述是"猜冠军",晚段的危险表述是"把 Top 5 名单当最终获奖名单"(复现性检查未过前奖金仍可撤销——REG² Prizes 页把这一点写成了明文)
- 跨赛推广:该分段判定只依赖"名单是否公布"一个可观测信号——不依赖赛制细节,可直接推广到任何挑战赛条目;配合待宣期写作模板(§5.2)构成完整的生产纪律包
- 状态机与维护计划联动:附录 N 的五触发点即状态机的迁移边(宣布→晚段;meta paper→完结)
附录 AC:检索决策树(应对一个赛事四种写法)
- 查官网:优先 URL 线索 reg2026.grand-challenge.org(官网标题用上标 REG²,URL 用 reg2026)
- 查论文:arXiv 检索 “REG 2025”(第一届 overview)/未来 meta paper 大概率用 “REG 2026” 空格式
- 查社交:领英宣传用 REG2026 连写式(官方帐号口径)
- 查代码:GitHub 仓库 Haasha/REG2026(连写)
- 消歧锚:带 “pathology”/“report generation”/“MICCAI” 任一限定词——避开补体 Reg2 基因/其他领域 REG 缩写
- 中文引擎:REG² 上标字符易被吞——用 “REG2 病理” 或 “REG2026 挑战赛” 起手;本条目 keywords 已覆盖四种写法+中文词
- 存照义务:四种写法在正式文本中首次出现时注明对应形态(官网/URL/领英/arXiv)——本条目 keywords 与 INFOBOX 已做示范
附录 AD:库内病理域代表条目映射总表(15 条代表)
| rid |
条目 |
粒度 |
监督形态 |
与 REG² 关系 |
| 148 |
NCT-CRC-HE-100K |
patch |
分类标签 |
粒度对照(小图分类 vs 全片报告) |
| 258 |
bcss |
区域 |
空间 mask |
区域级分割生态 |
| 228 |
consep |
核级 |
空间 mask |
核分割生态 |
| 248 |
nucls |
核级 |
空间 mask |
核分割生态 |
| 238 |
lizard |
核级 |
空间 mask |
核分割生态 |
| 298 |
midog |
patch |
检测 |
有丝分裂——分级步骤的对象 |
| 338 |
digestpath |
region |
分类/分割 |
消化道域对照 |
| 614 |
lunguage |
slide |
结构化标注 |
肺病理结构化文本 |
| 560 |
panda |
slide |
序数评分 |
MIL 赛制先师 |
| 200 |
imcs-21 |
图像对 |
结构化报告 |
报告生成子域互补 |
| 260 |
pathvqa |
图像 |
问答对 |
QA→QA-chain 升级 |
| 300 |
roco |
图像对 |
图文 caption |
图文对齐生态 |
| 320 |
pmc-oa |
图文对 |
图文+框 |
大规模图文对齐 |
| 561 |
radgraph |
文本 |
实体-关系 |
报告结构化方法学 |
| 340 |
ms-cxr |
图文对 |
校正对 |
报告一致性 |
- 映射用途:REG² 的训练管线可在本库内从 patch(NCT)→slide 特征(panda 系方法)→报告(imcs-21 格式参考)→链对齐(本条目)全程取材——库内病理链路第一次全线贯通
附录 AE:本条目生产档案
- 生产通道:事实研究 8 轮(WebSearch×5+WebFetch×6,覆盖官网 5 页/GitHub README/AWS Registry/arXiv/TUM/Bioptimus/LinkedIn/MICCAI 官网)→FACTS.md 九节→成稿→check_md+preflight 双闸门→publish.sh 发布→post_publish_check 自检
- 关键核验记录:届次三源实锤(第二届);license 双口径(CC BY-NC-SA);规模双口径(~12K 可变声明);奖金双版本存照(pending→落实);联络人身份纪律(只记联络人不写头衔)
- 教训应用:教训 12(印象值全量核验——本届无旧印象冲突仍照核)、教训 13(description 成稿即 ≤170 字符——本次 frontmatter 一步到位)
- 待宣期三零自查:0 处 2026 成绩数字/0 处完成时指向未发生结果/0 处占位类词汇
- 库内定位:MICCAI 2026 挑战赛系列第四篇;"影像→文本生成"象限首条;"待宣期早段"状态首例
附录 AF:常见错误对照表(误例→正例)
| 误例 |
正例 |
依据 |
| “REG² 是首届病理报告生成挑战赛” |
“REG² 是第二届;REG2025 为首届” |
§1 三源实锤 |
| “训练集 12,000 例” |
“约 12,000 例(官方注明可变)” |
§3.1 双源可变声明 |
| “Kameda(土耳其)” |
“Kameda(日本);Memorial Health Group(土耳其)” |
附录 B 机构表 |
| “官网时区 CET” |
“官网全表 KST(UTC+9)” |
§5.1 时区注 |
| “2026 冠军是××” |
(待宣期——不可写) |
§5.2 三零纪律 |
| “奖金最高 €800” |
“第 1 名 €800,且须过复现性检查才发放” |
§3 奖金页 |
| “评测指标是 ROUGE/BLEU” |
“那是 2025;2026 是过程图+LLM 裁判七子分” |
§4.4 公式对照 |
| “Mess 25% 的乱度分” |
“MESS 为键名(非最终步骤语义分),全称未公开” |
术语表 9 |
| “数据随便引用写论文” |
“meta paper 发布前受发表限制约束” |
§3.5 |
| “Debug 10 次随便刷榜” |
“Debug 不计成绩,只验证容器” |
附录 A 额度表 |
附录 AG:提交自检卡(两种 Metric 各一张)
- Metric A 提交前自检:
- chain-of-thought.json 顶层是数组,每元素含 id 与 chain-of-thought 键
- 每条链每步含 question/answer/next_question 三键
- 末步 next_question 为空串(非空会挂路径有效性)
- id 与 WSI 文件名对应(扩展名可有可无,但需与真值对齐策略一致)
- 本地已用评估代码复算(四步流程见附录 J)
- Metric B 提交前自检:
- predictions.json 顶层数组,每元素
- id 与 rois_mapping.txt 的 anonymous_id 逐一对齐
- background 标签的 ROI 已有拒答/识别行为
- perturbed 配对已做一致性验证(本地模拟 original/perturbed 两跑比对)
- 跨区答案无自相矛盾(同切片多 ROI 抽查)
附录 AH:FACTS 档案到成稿的结构映射
| FACTS.md 节 |
成稿落位 |
扩写说明 |
| §1 届次谱系 |
§1 编年表+名字消歧 |
补代际命题的学术意义与检索警示 |
| §2 时间线 |
§5.1 全表+附录 M |
补双时区换算与周期观察 |
| §3 奖金 |
INFOBOX+§5.2+附录 Q |
补双版本存照与复现性闸门 |
| §4 任务定义 |
§2 四小节 |
补接口协作关系与 CoT 生产消费视角 |
| §5 数据集 |
§3 五小节 |
补获取路径实操与标注分工 |
| §6 评估 |
§4 五小节+附录 C/V/J |
补权重解读与额度策略数字例 |
| §7 组织背景 |
§6+附录 P |
补资助结构解读 |
| §8 库内互链 |
§9 三小节+附录 AD |
补粒度/监督形态两条光谱分析 |
| §9 待核清单 |
附录 Q+dataLimitations+附录 N |
转化为维护触发点而非悬置疑问 |
- 映射用途:回填维护时按此表反向定位——每个 FACTS 节在成稿内的落点唯一,避免回填遗漏。
- 生产侧注:FACTS.md 九节制是本库事实档案的标准模板——先档案后成稿的两段式保证"事实与表述分层",本条目是首个把映射表写进正文的样本。
- 回填示例:Top-3 宣布后,先改 §1 编年表"结果锚"列→再改 INFOBOX"时间线/条目状态"行→最后改 §5.2 与本表——四处联动,缺一即口径漂移。
附录 AI:本条目沉淀的模板资产(供库内后续条目复用)
- 待宣期早/晚段细分:本条目与 hecktor2026 构成早/晚段对照样本——后续挑战赛条目可直接套用"按名单公布与否分段"的判定式(附录 AB 状态机表)
- 待宣期写作模板五条:§5.2 的时态/成绩锚/状态词/自问/触发点五件套——下一个待宣期条目的现成纪律清单
- 证据链自证范式:附录 Q 的"一手/侧证/交叉/不可得/快照差异/检索日志"六段式——比前作(hecktor2026 的四段式)多了检索日志段,可审计性更强
- 常见错误对照表范式:附录 AF 的"误例→正例→依据"三列——把编辑部的踩坑经验前置成读者服务,适合所有"名字易混/口径易错"条目
- 提交自检卡范式:附录 AG 双卡——技术向条目的"操作端"收口件,与 checklist(附录 U)构成"战略+战术"两层
- FACTS→成稿映射表:本附录 AH——生产档案到正文的双向索引,回填维护的导航图
附录 AJ:Metric B 三测试的扩展设计(本条目方法论推演)
- 背景拒绝的扩展应用:把"background"标签泛化为"无信息输入"——放射报告场景对应"无异常的平片",内镜场景对应"清洁黏膜";拒答能力评测应成为一切报告生成系统的默认测试项(本条目推演,非官方表述)
- 输入敏感性的扩展应用:perturbed 配对的本质是因果最小对(minimal pair)——只改一处看输出是否只变一处;可迁移为"报告一致性回归测试":改动病历一处日期/一处分级,检查生成报告的联动更新是否正确
- 跨区一致性的扩展应用:多 ROI 问答推广为"多视图一致性"——同一病灶在不同序列/不同时相下的描述不应矛盾;对应影像科"前后片对比"场景
- 三测试的组合价值:单项测试都有绕过法(全拒答可过背景拒绝、全保守可过敏感性),但三测试同时通过需要模型"真看图+真理解+真一致"——组合设计的鲁棒性大于单指标加权和——这正是 REG² 评估设计值得抄的地方
附录 AK:训练消耗估算(面向链式 SFT 的资源规划,本条目推演)
- 步数量级:~12,000 条链 × 平均 5-10 步 ≈ 6-12 万步级样本——单卡 A100 级 LoRA 微调 7-8B 生成器一轮(3 epoch)约数小时至一天量级——个人组可负担
- 视觉侧消耗:WSI 特征提取是大头——~12,000 例 × 每例数百至数千 tile × 基础模型前向——建议用官方/社区预处理工具(Trident 系)离线缓存特征,二次训练只跑聚合器与生成器
- 混合采样策略推演:链式 SFT 样本与报告级样本按 1:1 混合可兼顾过程对齐与终点质量(纯链式训练易弱化整报连贯性,纯报告训练回到 2025 的老路)——官方 60/40 的过程/终点权重比是采样比例的天然参考
- Metric B 训练量:ROI 问答样本量官方未单独披露(05-25 样例包为结构示范)——按 Test1 350 例的 ROI 配对规模反推训练侧应有同量级标注池;不足部分按官方指引自建(官方明言鼓励自建场景)
附录 AL:延伸阅读与来源总账
- 官方一手(本条目所有事实的源头):
- 挑战赛官网:reg2026.grand-challenge.org(主页/organizers/prizes/data-description 各页)
- 官方 GitHub:github.com/Haasha/REG2026(algorithm_submission_template + submission_evaluation_code)
- AWS Registry:registry.opendata.aws/reg-2026(S3 桶与托管方口径)
- 学术侧证:
4. arXiv:2609.00866——REG 2025 overview 论文(55 作者,2026-09-01):第一届方法全景与失效模式命名
5. Bioptimus 案例文——冠军 NARWHAL 技术栈与 2025 评分公式记录
- 机构侧证:
6. TUM 病理所新闻页——Schüffler Lab 参与组织声明
7. LinkedIn 官宣帖——时间线与 Top5 证书口径
8. MICCAI 官网——会期与卫星事件规模(58/45/9)
- 库内横向:hecktor2026(rid 638)、topaneu2026(637)、topbrain2026(632)、imcs-21(200)、panda(560)、pathvqa(260)、radgraph(561)——附录 AD 映射总表
- 来源边界声明:本条目为独立第三方百科制作,非官方文档;所有"推演/读法/解读"字样处为本条目观点,与官方事实严格分层;2026 成绩留白处一律以待宣期纪律标注
- Registry 使用提示:Registry 页面提供固定引用格式(含访问日期占位)——正式引用时补入实际访问日期;S3 桶支持 aws cli 直接同步,注意 TB 级体量的存储与流量成本自理。
- 延伸阅读顺序建议:初次接触按 8→1→2→4 顺序(先官网概览再论文)——论文 27,662KB 的体量适合按节选读;复现者直接跳 2 号仓库 README。
- 快照完整性自查:官网重要日期表 7 行全录(附录 M)、Notice 6 条全录(§3.4/§5.1)、Updates 7 条全录(附录 M/§3.4)、Prizes 全文要点全录(§3/附录 F)、organizers 两节全录(§6/附录 P)、评估 README 九节结构全录(附录 I/V/J/L)——无选择性引用
附录 AM:库内挑战赛型条目对照总表(reg2026 视角)
| rid |
条目 |
届次 |
任务形态 |
可获取性 |
条目状态 |
| 632 |
topbrain2026 |
V2 |
脑 MRI 基础模型多任务 |
— |
完结(终榜已回填) |
| 637 |
topaneu2026 |
2026 届 |
主动脉血管内介入 |
— |
进行时/待宣期 |
| 638 |
hecktor2026 |
第五届 |
头颈分割/分期/生存 |
GC 审核制 |
待宣期晚段 |
| — |
reg2026(本条目) |
第二届 |
病理报告+推理链 |
S3 公开直链 |
待宣期早段 |
| 461 |
hecktor(前代档案) |
2020-2022 三届 |
分割+HPV+生存 |
— |
完结(历史档案) |
- 对照读法:①可获取性光谱——REG² 是挑战赛型条目里唯一的公开直链样本,A 维评分天花板级;②任务形态谱——五条目覆盖结构预测/标签预测/生存预测/文本生成四象限,本条目收口"生成"象限;③状态机覆盖——五条目恰好完整踩过四态状态机的全部状态位,库内挑战赛系列的"状态全集"首次集齐
- 对后续条目的意义:MICCAI 2026 的 45 个挑战赛库内已建档 4 个(本条目入列后)——剩余赛会按此四象限框架扫描,优先补任务形态空缺与高 DAIMS 赛事
附录 AN:引用规范与时点声明
- 本条目引用本数据集的建议格式:Pathologist Reasoning-Guided Report Generation (REG2026) Dataset, Korea University, AWS Registry of Open Data (registry.opendata.aws/reg-2026), CC BY-NC-SA;正式学术引用以官方 meta paper(未出)发布后为准。
- 时点声明:本条目全部事实的抓取时点为 2026-09-25(KST);该时点后官网/仓库的任何变更不在本版责任范围内——引用时请带"截至 2026-09-25"限定。
- 待宣期引用纪律:本条目不含 2026 届任何成绩数字;二次引用本条目时同样不得从"待宣期"状态擅自推定获奖结果。
- 版本链:本条目 v1(2026-09-25 待宣期早段版)——后续版本将沿附录 N 五触发点推进;每版变更记录于 tracker。
- 责任边界:对官方信息的转述以当日快照为准;本条目观点段(标注"推演/读法")不构成对赛事结果的预测或对参赛策略的保证。
尾注
- 本条目由千方病案医数集编辑部于 2026-09-25 抓取制作;抓取范围见附录 Q 证据链。
- 届次/时间线/评分/数据规模等关键事实均已多源交叉验证(附录 Q);不可得项如实标注。
- 待宣期维护触发点见附录 N;MICCAI 2026 会期(09-27~10-01)为第一回填窗口。
- 同届系列条目: hecktor2026(rid 638)、topaneu2026(rid 637)、topbrain2026(rid 632)。
- 生产纪律:教训 12(印象值全量核验)与教训 13(description ≤170 一步到位)双执行;待宣期三零自查通过(附录 AE)。
- 本条目 description(frontmatter)123 字符,符合 S1 标准 60-170 字符——教训 13 沉淀后的首个一步到位样本。
- 条目自洽声明:全部小节标题(§0-§11/FAQ 58 问/清单 50 条/术语表 44 条/附录 40 个 A-AN)经目录核对连续无跳号;正文事实与附录存照一一对应,无孤立声明。
- 篇幅声明:本条目正文以赛制与数据资产为主体——2026 成绩留白不是内容缺失而是状态使然;待宣期结束后按附录 N 回填,预计 v2 版将自然增至 1300 行以上。
- 致谢性说明:本条目制作过程中的官网/GitHub/AWS 公开资料使用符合各站点服务条款;对赛事的描述性判断(如"评估器全开源")均给出可复核的出处锚点。
- 生产锚点:FACTS.md(writing/reg2026/FACTS.md)与本文同目录存放——事实层与表述层的双档案结构自此条起成为标准配置。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- quilt-1m — 共享标签:医学影像 / 多模态 / 病理图像 / 影像-文本对齐
- ms-cxr-t — 共享标签:医疗NLP / 医学影像 / 多模态 / 影像-文本对齐
- vlm3d — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 挑战赛数据集
- medicat — 共享标签:医疗NLP / 多模态 / 影像-文本对齐
- pmc-oa — 共享标签:医疗NLP / 多模态 / 影像-文本对齐
- gmai-mmbench — 共享标签:医疗NLP / 医学影像 / 多模态
- pathvqa — 共享标签:医疗NLP / 多模态 / 病理图像
- roco — 共享标签:医学影像 / 多模态 / 影像-文本对齐
- rsna-series — 共享标签:医学影像 / 多模态 / 挑战赛数据集
- anhir — 共享标签:医学影像 / 病理图像 / 挑战赛数据集
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。