TriALS (trials) — AI-Ready Wikipedia

首个非对比 CT 肝病变分割多中心基准(MICCAI 2025 挑战赛):150 例四期 CT、每例 5 套标注,STAPLE 融合三期信息构建平扫真值,人类平扫病灶精度仅 0.333 揭示感知壁垒,DKFZ 冠军队 MultiTalent 预训练三中心全第一,HuggingFace gated + CC BY-NC-4.0 公开

来源 四期腹部 CT(平扫/动脉/门脉/延迟)NIfTI 体数据(HU 原值,无重采样无归一化)+ 四期各自病灶分割标注 + combined 多期融合标注(elastix 配准 + STAPLE 融合 + 放射科顾问 QA),8 款扫描仪 3 厂商跨三中心发布时间: 2026-09-27最后更新: 2026-09-27 阅读 15
TriALS (trials) — AI-Ready Wikipedia

信息速览

数据集名称TriALS (trials) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模150 例患者 × 4 期 CT = 600 volumes(训练 80 = 埃及 60 + 中国 20;测试 70 = 埃及内部 28 + 中国内部 17 + 外部 25);每例 5 套标注
接入方式四期腹部 CT(平扫/动脉/门脉/延迟)NIfTI 体数据(HU 原值,无重采样无归一化)+ 四期各自病灶分割标注 + combined 多期融合标注(elastix 配准 + STAPLE 融合 + 放射科顾问 QA),8 款扫描仪 3 厂商跨三中心
AI 就绪度

INFOBOX — TriALS 一屏速览

维度 内容
本质 首个非对比增强 CT(NCCT)肝病变分割多中心基准:MICCAI 2025 官方挑战赛 + 数据集 + 论文三件套
核心范式 推理目标只用平扫,但 ground truth 由三期增强(动脉/门脉/延迟)标注辅助构建(Triphasic-Aided 的含义)
动机 对比剂短缺(成本/供应链)是非洲亚洲大量医院的现实——埃及队列 Omnipaque/Telebrix 混用即为其缩影
数据 150 例 × 4 期 = 600 volumes;训练 80(埃及 60+中国 20)+ 测试 70(埃及 28/中国 17/外部 25);每例 5 套标注
标注 两阶段人机混合(LiTS 算法预标 → 10 标注员 3D Slicer 复核 → 双人复核 → 顾问裁决)+ combined 四步流水线(elastix→STAPLE→顾问 QA)
人类基线 静脉期 inter-reader Dice 0.742;NCCT 仅 0.574(precision 0.333)——放射科医生自己在一期平扫上三分之二的病灶互相不认
冠军 Team MIC(DKFZ):nnU-Net ResEnc-L + MultiTalent 86 公开数据集预训练,Task 1 三中心全第一(0.791/0.721/0.750,均值 0.754)
核心发现 平扫感知壁垒:combined 0.429→0.471 可靠知识迁移提升,visible 0.553→0.552 停滞——预训练规模换不来平扫感知力
小病灶硬墙 <100 mm³ 病灶 Task 2 每 lesion F1<0.15,全部提交几乎检不出
评估 rank-then-aggregate;Task 1/visible 用 11 指标,combined 仅 6 检测导向指标(表面距离罚分 9,001)
对比模型 超 PASTA +28.2%/VoxTell +9.8%(外部 NCCT 绝对 Dice);VoxTell 权重含 TriALS 训练数据(数据优势存照)
获取 HF marwankefah/TriALS:gated + CC BY-NC-4.0(725 文件/36.67 GB);外部标签 embargo;代码与冠军权重公开(GitHub)
许可 数据 CC BY-NC-4.0|Zenodo 提案 CC BY-4.0|论文 CC BY 4.0——三件资产三套规则,别混
库内互链 lits(81,上游预标/预训练)、amos(76)/chaos(337)/sliver07(347,参赛队预训练)、atlas-liver-tumor(431)/3dircadb(357)/cadis(243,同域)、flare(387)/btcv(377)/word(412)/abdomenct-1k(402)/totalsegmentator(422,方法生态)

TriALS 是一个"让 AI 在没有对比剂的 CT 上找肝病灶"的基准:150 例患者每人扫了平扫、动脉、门脉、延迟四期 CT,算法的任务是在平扫上把肝病灶找出来并勾画——但真值标注不是在平扫上画的,而是先在对比最清楚的增强期上勾好,再用配准和标签融合把三期信息"折算"回平扫坐标系。这项设计直指一个被主流医学影像基准长期忽略的场景:非洲与亚洲大量医院因对比剂成本或供应链问题根本不做增强 CT,而现有模型几乎全部在增强数据上训练与验证。挑战赛的结果同样有信息量——冠军在静脉期达到了人类水平(0.791,超过 inter-reader 均值 4.9%),但在平扫上人类自己互认精度只有 0.574、病灶级精度仅 0.333,两届比赛下来"平扫可见病灶"的检出分数纹丝不动(0.553→0.552):预训练数据从 30 个公开集扩到 86 个,也换不来对平扫固有特征的感知力。

导语读法三则:

  1. 只想下数据:直奔 §7 获取与许可——注意 HF 是 gated 仓库且 CC BY-NC-4.0,外部测试集标签 embargo,Zenodo 上那个 DOI 只是提案 PDF。
  2. 关心挑战赛设计:直奔 §5 双范式与评估协议——visible/combined 两个 paradigm 的分数不可直接横比,combined 排名刻意排除了表面距离指标。
  3. 关心结果解读:直奔 §6 结果与发现——MIC 三中心全第一的数字、平扫感知壁垒的跨年证据、与 PASTA/VoxTell 对比的口径(VoxTell 有数据优势)。

§0 导读:这个数据集解决什么问题

对比剂(碘造影剂)是腹部 CT 诊断肝病变的标配:动脉期看富血供病灶、门脉期看静脉侵犯、延迟期看廓清模式。但注射对比剂需要静脉通路、碘剂过敏筛查、肾功能评估,还有每一支的真实成本与供应链——在撒哈拉以南非洲、南亚以及本文数据来源地埃及的基层医院,"只做平扫"不是临床选择而是资源约束。问题的荒谬之处在于:几乎所有公开的肝病变分割数据集(LiTS、CHAOS、AMOS……)都以增强期为主战场,模型在这种数据上刷出的高分,对一个只能提供平扫的医院毫无意义——文献里甚至没有一个是专门为"平扫肝病变分割"设计的多中心基准。

TriALS 的回答是一个四件套设计。第一件是数据:150 例患者、每例完整四期、8 款扫描仪 3 厂商、埃及与中国两所医院采集加第三所医院做外部测试,病灶谱覆盖肝细胞癌、转移瘤、胆管细胞癌与良性病变。第二件是标注范式:真值由两阶段人机混合流水线产出(LiTS 训练的算法预标 + 10 名放射科住院医师用 3D Slicer 复核修正 + 双人复核 + 资深顾问裁决),并在此基础上用 elastix 配准加 STAPLE 融合把四期标注合成一份"combined 标注"配准到平扫坐标系——它包含平扫上根本看不见的病灶。第三件是双范式评估:visible paradigm 只考"平扫可见病灶",combined paradigm 考"完整病灶负担",两者的分差直接量化隐性病灶的负担。第四件是人类基线:两名腹部放射科医生对 16 例双盲重标,得出静脉期 0.742、平扫 0.574 的 inter-reader 天花板——用与算法完全同口径的计量方式。

§0 读法三则:

  1. 这个条目是"数据集+挑战赛+方法论文"三合一:本体是 HF 上 36.67 GB 的 gated NIfTI 包,赛事记录是两届排行榜与 14 份技术方案,论文(arXiv:2605.16572)把三者串成完整的可复现叙事——三者许可各不相同(§7)。
  2. 全文统计数字均出自论文正文与表格(arXiv HTML 全文抓取时点 2026-09-27),关键数字在附录 C 有逐项来源索引;双口径与数字巧合已在 §10 与附录 S 存照。
  3. 检索时若拿 Zenodo DOI(10.5281/zenodo.15087645)找数据会一无所获——那个记录只是挑战赛提案 PDF,数据本体在 HuggingFace(坑 1)。

§1 数据集速览:十问十答

Q1:TriALS 的"Triphasic-Aided"是什么意思?
字面是"三期辅助":算法的输入与推理目标都是非对比平扫 CT,但标注真值借助动脉、门脉、延迟三个增强期的标注信息构建——增强期上病灶看得最清楚,把那里勾好的病灶"传导"回平扫,就得到一份包含平扫不可见病灶的完整真值。这也是 combined paradigm 的哲学:算法要预测的不是"你看见什么",而是"这里应该有什么"。

Q2:数据规模和划分?
150 例患者 × 4 期 = 600 volumes。训练 80 例(埃及 60 + 中国 20),测试 70 例分三个中心:埃及内部 28、中国内部 17、外部 25(南方医科大学南方医院,训练与内部测试都不含该机构)。每例 5 套标注:四期各自一套 + 一份配准到平扫坐标系的 combined 标注。测试标签在最终提交截止前保密。

Q3:图像是什么格式,做过预处理吗?
NIfTI(从 DICOM 原样转换),HU 值保留,无重采样、无强度归一化——组织方刻意把预处理责任留给参赛者,因为"真实世界异质数据下的预处理策略"本身就是挑战的一部分。组织方提供基于 nnU-Net 默认的参考预处理(前景自适应强度归一化、各向异性感知重采样),可用可不用。

Q4:扫描仪和数据多样性如何?
8 款机型、3 厂商:SIEMENS SOMATOM Force、SIEMENS SOMATOM Sensation 64、United Imaging uCT780、GE Discovery CT750 HD、GE Revolution EVO、GE Healthcare Optima、Toshiba Prime Aquilion、GE BrightSpeed CT。层厚 0.63-1.56 mm,面内间距 0.54-1.19 mm,512×512 矩阵全腹覆盖。三中心采集参数差异统计显著(9 组比较 8 组 p<0.006),但 Task 1 分割成绩跨中心差异反而不显著——当前方法对采集异质性有一定鲁棒性。

Q5:谁标注的,怎么保证质量?
两阶段:第一阶段用 LiTS 训练的算法加小规模人工试点做预分割(仅加速、不直接作真值);第二阶段 10 名放射科住院医师/专科医师(≥1 年腹部影像经验)在 3D Slicer 里逐例复核修正,每例标注再经第二人复核,分歧升级到 >10 年经验的资深放射顾问裁决。combined 标注另有一道腹部放射顾问 QA。标注门槛:病灶跨 ≥2 连续切片(约 ≥3 mm 最大径)。

Q6:人类在平扫上表现如何?
两名腹部放射科医生对 16 例(静脉期与平扫各 16 例)双盲独立标注:静脉期 per-case Dice 0.742(precision 0.833/recall 0.946),平扫只有 0.574(precision 0.333/recall 0.769)——一名医生认出的病灶,三分之二被另一名医生在平扫上漏认。这个数字是同口径的"算法天花板":平扫肝病变检测连人类都远未解决。

Q7:冠军是谁,赢在哪?
Team MIC(德国癌症研究中心 DKFZ):nnU-Net ResEnc-L 骨干 + MultiTalent 86 个公开数据集大规模预训练 + 肝区裁剪 + bootstrap 模型选择。Task 1 静脉期三中心全第一(埃及 0.791/中国 0.721/外部 0.750,均值 0.754),无任何中心特异适配,静脉期成绩落入人类置信区间。14 份方案里 12 份用 nnU-Net——但排名的最强预测因子是多数据集预训练而非架构。

Q8:"感知壁垒"是什么发现?
跨年对比(同一埃及测试集,MIC 是唯一两届都参赛的队伍):Task 1 从 0.742 升到 0.791(预训练从 30 个数据集扩到 86 个),combined 从 0.429 升到 0.471——但 visible(只考平扫可见病灶)从 0.553 到 0.552,纹丝不动。多期监督能做"知识迁移"(把增强期学到的病灶位置推给平扫推理),但不能增强"感知能力"(从平扫固有特征认出病灶)。这条停滞曲线是论文最刺眼的发现。

Q9:我现在能拿到什么?
HuggingFace marwankefah/TriALS:训练数据+全部标注(含四期原始 volumes、各期标注、combined 标注),gated 仓库(填表单:姓名/机构/国家/角色+非商业勾选),CC BY-NC-4.0,实测 725 文件/36.67 GB。外部测试集标签 embargo(向通讯作者申请验证用途)。评估代码、Docker 基线与冠军方法预训练权重在 GitHub xmed-lab/TriALS 公开。

Q10:跟 LiTS 这类老牌肝数据集什么关系?
不是替代是互补:LiTS 等数据集主战场是增强期分割,TriALS 把"平扫"立为独立赛道并用多期信息给真值提纯。它同时深度依赖这条生态链——预标算法用 LiTS 训练,冠军用 MultiTalent(86 数据集)预训练,多支参赛队用 LiTS/SLIVER07/CHAOS/AMOS 预训练。库内 lits/amos/chaos/sliver07 四个条目是它的直接上游(§9)。

§2 数据构成与规格

2.1 规模、划分与三中心结构

TriALS 本体是 150 例患者的完整四期腹部 CT(平扫 NC、动脉 ar、门脉 pv、延迟 del),共 600 volumes。划分上呈"一个训练池 + 三个测试中心"结构:

划分 例数 构成 用途
训练集 80 埃及 60 + 中国 20 赛前发布(HF 公开)
埃及内部测试 28 艾因夏姆斯大学医院 隐藏标签,终评解锁
中国内部测试 17 中山纪念医院 隐藏标签,终评解锁
外部测试 25 南方医科大学南方医院 隐藏标签且永久 embargo

外部集的选取刻意避开训练与内部测试机构——南方医院不在训练数据来源之列,用于独立检验泛化能力,其伦理审批由贡献机构在当地完成。三中心设计让挑战赛能同时报告"域内性能"(埃及/中国)与"跨域性能"(外部),这也是最终结果表能拆出"埃及最难"这一结论的前提(§6.2)。

原始采集量更大:埃及 352 volumes、中国 148 volumes(合计 500 volumes = 125 例)通过初筛,加上外部 25 例得 150 例。入组标准为成人(≥18 岁)、完整四期、临床放射报告至少一个肝病灶、影像质量可接受;排除标准为显著伪影、门脉主干完全性血栓、Child-Pugh C 级肝硬化。这个入排设计使数据集的病灶谱贴合"腹部放射科日常"——HCC、肝转移瘤、肝内胆管细胞癌与良性病变都有代表。

2.2 采集协议与扫描仪多样性

参数 数值
扫描仪 8 款机型 / 3 厂商(SIEMENS×2、GE×4、United Imaging×1、Toshiba×1)
管电压 100-120 kVp(电流调制至当地剂量参考水平)
层厚 0.63-1.56 mm(训练集均值 0.97±0.19 mm)
面内像素间距 0.54-1.19 mm(训练集均值 0.832±0.10 mm)
矩阵 512×512,全腹覆盖
动脉期 bolus tracking 降主动脉触发,约注射后 35-45 s
门脉期 动脉期后约 20 s(注射后 65-70 s)
延迟期 门脉期后 3 min
重建核 软组织或混合核,无边缘增强核
多期一致性 各期尽量同层厚重建

8 款机型的完整清单:SIEMENS SOMATOM Force、SIEMENS SOMATOM Sensation 64、United Imaging uCT780、GE Discovery CT750 HD、GE Revolution EVO、GE Healthcare Optima、Toshiba Prime Aquilion、GE BrightSpeed CT。这个列表的价值在肝病变分割基准里少见——多数公开集要么单中心单机型,要么不披露机型构成,而 TriALS 把机型-中心对应关系写进了论文 Table 1,可做扫描仪效应分析。

一个真实世界的细节值得单独立段:埃及队列的对比剂不固定。因供应链限制,可及则用非离子型 Omnipaque,必要时用离子型 Telebrix。这不是数据的瑕疵而是数据动机的缩影——"对比剂短缺"在这份数据里不是引言里的修辞,而是采集记录里的字段。

2.3 中心异质性:显著但被鲁棒性部分吸收

三中心的采集差异是统计显著的:

参数 埃及 中国 外部(南方医院)
面内分辨率(mm) 0.862±0.095 0.766±0.063 0.686±0.072
层数深度(slices) 578±137 — 240±69

层数深度差超过两倍(埃及 578 vs 外部 240),反映不同机构的扫描覆盖协议差异。9 组两两参数比较中 8 组 p<0.006(Mann-Whitney U,Benjamini-Hochberg FDR 校正 q=0.05;两个 ASSD 名义显著但未过 FDR,论文注明)。噪声底方面,西门子平台(埃及为主)平扫噪声高于中国与外部所用机型。

有意思的是结果端:尽管采集差异显著,Task 1 静脉期 Dice 的跨中心差异并不显著(p>0.20)——当前方法对增强期数据的采集异质性表现出相当的鲁棒性。论文同时自警:分割指标的中心比较用的是队伍级分数(n=6-7 队)而非逐例分数,统计功效有限,“不显著"应读作"证据不足"而非"等价”。另外没有任何参赛方法显式建模扫描仪厂商或中心身份——中心自适应(domain tokens、站点特异归一化层)仍是未开发的机会,平扫数据上尤其如此。

2.4 发布格式与预处理责任

数据以 NIfTI 分发(DICOM 原样转换),三个"没有"是刻意设计:没有重采样、没有强度归一化、没有裁剪——HU 原值直达用户。组织方的设计逻辑是:真实世界异质数据下的预处理策略(强度窗宽窗位、归一化、可选重采样)本身就是任务的一部分,统一预处理会把这层挑战抹掉。同时提供基于 nnU-Net 默认的参考预处理(前景自适应强度归一化、各向异性感知重采样)作为基线,参赛者自取。

对下游使用者,这意味着拿到数据的第一件事是自己写预处理管线——对 nnU-Net 用户这几乎零成本(框架自带),对自研管线团队则是一份额外的工程税。这也是把 TriALS 用作"现成训练集"和用作"方法学基准"的分水岭(§11.4)。

2.5 病灶谱与"无类型标注"的边界

数据集覆盖腹部放射科常见的肝病灶谱:肝细胞癌(HCC)、肝转移瘤、肝内胆管细胞癌、良性病变(血管瘤等)。但论文在局限一节明确自曝:没有病灶类型标注——每份掩码只回答"这里有个病灶",不回答"这是什么病灶"。意味着:

  1. 无法做病灶类型分层分析(如"HCC 与转移瘤的平扫可检测性差异");
  2. 训练出的模型是"泛病灶检测器",不能直接输出诊断类别;
  3. 需要类型感知下游任务(如 HCC 特异筛查)的团队要另找数据(库内 atlas-liver-tumor、3dircadb 可作互补,§9)。

病灶纳入的尺寸门槛:跨 ≥2 连续切片(按 1.25 mm 典型层厚约 ≥3 mm 最大径)——更小的病灶从标注端就被排除,这与 §6.3 的"<100 mm³ 几乎检不出"共同构成小病灶问题的两端。

2.6 与其他肝数据集的规格对照

数据集 期相 规模 标注 与 TriALS 的差异
LiTS 增强期为主(门脉) 201 例 + 130 测试 全肝+肿瘤 无平扫赛道、无人类基线
CHAOS CT 平扫+MRI CT 40 例 全肝(无病灶级) 平扫但无病灶标注、无多中心
AMOS 平扫+增强混合 500 例(CT 300) 多器官(肝整体) 无病灶级肝病变标注
3D-IRCADb 三期(部分例) 20 例 肝/血管/病灶 规模极小、单中心
TriALS 四期+平扫推理目标 150 例/600 volumes 病灶级×5 套+combined 唯一为平扫分割设计的多中心基准

这张表回答一个常见误问:“平扫肝图像不是 CHAOS 里就有吗?”——CHAOS 的平扫只有全肝轮廓,没有病灶级标注;TriALS 是第一个把"平扫+病灶级标注+多中心+人类基线"四要素凑齐的公开资源。

2.7 四期的临床语义:为什么四个期相都要标注

TriALS 要求每例完整四期才入组,这个设计值得展开——每个期相在肝病变诊断里有不可替代的角色,也正是"三期辅助标注"的知识来源:

期相 采集时点 临床观察目标 对标注的价值
平扫(NC) 注药前 出血/钙化/脂肪变/基础密度 推理目标模态;标注最难(对比度低)
动脉期 注药后约 35-45 s(bolus tracking 降主动脉触发) 富血供病灶(典型 HCC 快进快出强化) HCC 类病灶最显著的显示窗
门脉期 注药后约 65-70 s(动脉期后约 20 s) 门脉侵犯、乏血供转移瘤、整体病灶轮廓 转移瘤检出与病灶边界最清晰的期相
延迟期 门脉期后 3 min 廓清模式(鉴别 HCC 与血管瘤等) 强化模式的消退信息,鉴别诊断关键

四个期相各标一套的直接收益是病灶最显著期选择有了数据支撑:标注流水线把病灶掩码"从最显著期传播到其他期"(§3.1),而哪期最显著本身就因病灶类型而异——HCC 在动脉期、转移瘤在门脉期。STAPLE 融合(§3.3)等于把四个期相的互补信息折算成一份共识。这也解释了为什么 combined 标注能包含平扫不可见病灶:每个病灶至少在某一个增强期"亮过"。

对使用者的推论:如果你只想用 TriALS 做增强期分割研究(不碰平扫任务),四期各自的标注也允许这么做——这是 5 套标注结构的另一个用途,虽然它不是本数据集的主赛道。

§3 标注流水线:两阶段人机混合与 combined 四步

3.1 阶段一:算法预标——明确不作真值

预分割由一个在 LiTS 与小规模内部试点人工标注上训练的自动算法生成,覆盖全部 volumes。关键工艺是非刚性配准:把对比期对齐到平扫坐标系后,病灶掩码从"最显著期"(病灶显示最清楚的期相)传播到其余期相。论文原文明确这些自动预测"served solely to accelerate the manual annotation workflow"——不直接作为 ground truth。这条边界划得很清楚:算法预标只负责把标注员的起点从"空白画布"变成"待修草稿",质量责任全部落在阶段二。

3.2 阶段二:10 名标注员 + 双人复核 + 顾问裁决

环节 配置
人员 10 名训练标注员(放射科住院医师/专科医师,≥1 年专注腹部影像经验)
工具 3D Slicer
培训 录制视频标准化演示 + 与腹部放射顾问的答疑会
修正对象 全部自动分割逐例复核修正
纳入门槛 病灶跨 ≥2 连续切片(约 ≥3 mm 最大径)
复核 每例标注由第二标注员复核
升级机制 分歧升级至资深放射顾问(>10 年经验)共识裁决
特殊处理 模糊边界、单期可见病灶加 flag 附加复审

作者贡献声明里,标注协调由 Elbatel/Ghonim/Mao 负责,埃及标注主管为 A.Y.,14 名成员(Mo.G./K.O.N./Ma.E./M.D./A.M.A.S./Nou.E./Noh.E./A.Ab./Am.A./S.A.A./W.D./B.L./H.H./J.S.)执行病灶标注与跨期放射验证。这套"10 人+双人复核+顾问升级"的结构与放射科临床阅片的双签制度同构,标注质量的可追溯性优于单专家模式。

3.3 combined 标注:四步流水线

每例的第 5 套标注——配准到平扫坐标系的 combined 标注——由四步流水线产出(由 Elbatel 执行):

  1. 刚性配准:动脉、门脉、延迟期标注经 elastix 刚性配准对齐到平扫坐标系,校正呼吸运动与患者摆位差异;
  2. 非刚性精化:elastix 非刚性变换顺序精化(rigid→non-rigid),达到病灶边界的亚体素对齐;
  3. 标签融合:STAPLE 算法(SimpleITK 实现)融合四期单期标注生成概率共识——至少两期可见的病灶才纳入 combined 掩码;
  4. QA:腹部放射顾问逐例审核融合掩码是否完整表达跨期病灶负担,对照原始对比期图像纠正或剔除可见配准错误。

三重配准风险缓解(论文 Discussion 自述):肝区裁剪后配准(而非全腹)、顺序 rigid→non-rigid、STAPLE 融合过滤单期配准伪影加顾问人工验证。残余误差的承认也写得很坦白:跨期配准的空间不确定性会传导进真值边界——挑战赛的对策是在 combined paradigm 排名中排除全部表面距离指标(§5.4),让"配准噪声"不影响主要临床指标。

"至少两期可见"的纳入规则值得玩味:它既是质量阈值(单期独有病灶可能是伪影或配准失败),也是流行病学滤波(增强期上短暂的病灶强化模式被有意保留)。代价是只在单期一闪而过的真实病灶会被漏掉——这是流水线的已知边界。

3.4 每例 5 套标注的资产结构

标注 内容 对应文件模式
平扫标注 平扫上放射科可见的病灶 labelsTr(NC 口径)
动脉期标注 动脉期勾画的病灶 labelsTr(ar 口径)
门脉期标注 门脉期勾画的病灶 labelsTr(pv 口径)
延迟期标注 延迟期勾画的病灶 labelsTr(del 口径)
combined 标注 四期融合、配准到平扫坐标系、含平扫不可见病灶 labelsTr(combined 口径)

HF 实测文件树与此吻合:imagesTr 320 个 NIfTI(80 例×4 期)、labelsTr 400 个(80 例×5 套)。这 5 套标注的可分离发布是 TriALS 对方法学社区的最大贡献之一——研究者可以自己复现或改良融合策略、研究跨期标注一致性、或设计新的"辅助范式",而不必从原始 DICOM 重走全流程。

3.5 与库内标注流水线的工艺对照

TriALS 的标注工艺放在库内数据集的流水线光谱上看,位置更清晰:

数据集 人员结构 工具 复核机制 与 TriALS 的差异
TriALS 算法预标+10 标注员(≥1 年腹部经验)+双复核+顾问裁决 3D Slicer 双人+>10 年顾问升级 跨期配准+STAPLE 融合独有
PANDA-PLUS(库内 panda-plus) pre-med 学生初注+高年级复核+30 年专家终审 QuPath 专家逐腺体终审 单专家终审 vs TriALS 的委员会式升级
Lizard/NuCLS 类 多机构多专家 各异 多数投票/共识 无算法预标加速层
LiTS(库内 lits) 早期半自动+人工 — 单轮 质量协议无公开细度可比

两个结构性观察:其一,TriALS 的"算法预标+人工全量复核"模式介于"纯人工"与"纯算法"之间,它对算法预标的定位(仅加速、不作真值)与当今半自动标注工业实践一致;其二,与 PANDA-PLUS 的"单专家终审"不同,TriALS 用"双人复核+顾问升级"的委员会结构换取分歧处理的可追溯性——代价是协调成本,收益是 §4.1 的人类基线可直接量化标注不确定性。

3.6 复现这条流水线需要什么

资源 需求 备注
标注团队 10 名放射科住院医师/专科医师 + 2 名双盲复核 + 1 名资深顾问 论文规模;小规模复现可等比缩减但双复核不可省
软件 3D Slicer(标注);elastix/SimpleElastix(配准);SimpleITK STAPLE(融合) 全部开源
预标模型 LiTS 训练的分割模型(可用 nnU-Net 在 LiTS 上自训替代) 论文未发布预标模型本体
培训材料 录制视频标准化演示+答疑机制 论文提及机制未公开材料本体
伦理 机构伦理批件+去标识化流程 埃及侧 FWA 000017585 为范例

值得注意的是:HF 包发布了四期原始标注+combined 标注(§3.4),意味着融合阶段(步骤 3-4)可完全离线验证——研究者可以拿四期标注自己跑 STAPLE 与论文结果对照,不必重走标注阶段。这是 5 套标注全发布的方法学价值。

§4 人类基线:inter-reader 研究与双峰一致性

4.1 四期数字:对比剂把人类一致性抬高了 16.8%

两名腹部放射科医生对随机抽取的 16 例(静脉期 16 例 + 平扫 16 例,来自埃中合并队列)双盲独立标注,按与算法完全同口径的计量(未检出病灶计 FN、Dice=0;max volumetric overlap matching ≥10% IoU):

期相 per-case Dice 病灶级 precision 病灶级 recall
动脉期 0.784(四期最高) — —
静脉期 0.742±0.443(n=16) 0.833 0.946
延迟期 0.601 — —
平扫(NCCT) 0.574±0.490(n=16) 0.333 0.769

静脉期与平扫之间 16.8% 的绝对差,就是"对比剂对人类的价值"的直接计量。论文对 n=16 与宽置信区间做了诚实的自警:bootstrap(N=10,000)给出人类天花板 95% CI [0.540, 0.934]——区间宽得说明这只能是"approximate reference range rather than a precise threshold"。

4.2 平扫 precision 0.333:三分之二的病灶互相不认

平扫上 precision 0.333、recall 0.769 的不对称含义直白:放射科医生 A 认出的平扫病灶,三分之二被医生 B 漏认(高假发现率视角)或反之。这是整篇论文的题眼之一——如果专家自己在一期平扫上都互相只见三分之一的病灶,那么:

  1. 平扫标注本身就有内在不确定性(谁画的是"真值"?);
  2. AI 辅助的价值锚点变了——论文原话:“即使不完美的自动辅助,也可能优于专家在平扫上 0.333 的病灶级精度”;
  3. combined 标注范式的必要性成立——平扫单期标注不足以承载"完整病灶负担"这个临床目标。

4.3 双峰一致性:DSC≈1 或 DSC=0

inter-reader SD 大(0.443/0.490)的原因不是"勾画边缘不一致"而是可见性分歧:两人要么对病灶勾画完全一致(DSC≈1),要么对病灶是否存在完全分歧(DSC=0)——中间态罕见。这个双峰模式解释了两件事:其一,为什么人类天花板的置信区间那么宽(可见性分歧直接产生 0 分案例);其二,为什么平扫任务更像"检测问题"而非"分割问题"——难的不是边界,是"有没有"。

4.4 天花板的正确用法与两个警示

用法:0.742(静脉)与 0.574(平扫)是同口径经验上限——算法分数可与它们直接比,无需口径换算。冠军 MIC 静脉期 0.791 落入人类 CI [0.540, 0.934] 且超人类均值 4.9%,论文据此称其"consistent with human-level performance";平扫外部集最佳 0.651 已超 0.574 的人类天花板,但更难的埃及队列 0.471 仍低于天花板——平扫问题"not yet fully resolved"。

警示一:n=16 太小,天花板是参考线不是判决线。警示二:数字巧合——0.742 既是 2025 inter-reader 静脉期 Dice,也是 2024 版挑战赛 MIC 在埃及测试集的 Task 1 分数,两处含义完全不同,检索时极易撞车(坑 7,附录 S 有对照表)。

4.5 AI 辅助的价值锚点:0.333 的另一面

precision 0.333 常被读作"人类在平扫上很差",但论文给出了一个更实用的读法——它是 AI 辅助的价值下限:一个哪怕不完美的自动提示系统,只要能把放射科医生在平扫上漏掉的病灶"浮"出来供快速复核,就可能在真实工作流里优于两人独立阅片的互相漏认。论文原话:“Even imperfect automated assistance may improve on the 0.333 lesion-level precision that expert radiologists achieved when annotating non-contrast CT”。

这个论证有三个前提要同时成立,引用时应完整携带:

  1. 提示系统必须以"快速复核"为交互模式(human-in-the-loop),不是全自动诊断;
  2. 0.333 是病灶级 precision(不是 Dice),衡量的是"指认病灶"而非"勾画边界";
  3. 前提是该医院真的无法获得对比剂——否则门脉期阅片仍是更优路径。

这也让 TriALS 的临床叙事自洽:数据来自对比剂短缺的真实场景(埃及 Telebrix/Omnipaque 混用),人类基线暴露平扫阅片的互认缺口,combined 范式让模型提示"看不见的病灶",交互式分割作为落地路径——四件事在同一条逻辑链上。

4.6 用人类基线校准自己模型的正确姿势

你的模型 对照线 判读
静脉期分割,埃及测试 0.742(均值)/ CI [0.540, 0.934] 进 CI=人类水平(MIC 0.791 即此);只超均值不算强
平扫 combined,外部集 0.574 超 0.574(如 0.651)=超人类平扫互认,可宣传"超人类"但注明是平扫
平扫 combined,埃及 0.574 未超(0.471)=问题未解决;埃及是更难考场,勿拿外部数字混写
平扫 visible,任何中心 无直接天花板上界 visible 与 inter-reader 计量对象不同(visible 只含 NC 可见病灶),引用需谨慎

两个纪律:其一,人类基线是 n=16 的近似参考线(§4.1 自警),不要把"低于 0.574"当失败判决、把"高于"当成功保证;其二,对照时确认自己的分数是 per-case Dice 且同口径(漏检计 0),口径不同先换算再比。

§5 挑战赛设计:两届赛事、双范式与评估协议

5.1 两届赛事:2024 预演与 2025 正式版

TriALS 经历了两届赛事:

维度 2024 预演版 2025 正式版(MICCAI)
测试集 仅埃及内部测试集 埃及 28 + 中国 17 + 外部 25 三中心
队伍 6 队(纯埃及机构圈) 8 队参赛(新增跨三大洲 7 队)
任务 Task 1 + Task 2 Task 1 + Task 2(双 paradigm 完整版)
状态 预演/试点 MICCAI 2025 官方挑战赛(2025-09-27,半天场)

2024 版六队成绩(Task 1 per-case Dice,埃及测试集):MIC 0.742(DKFZ)、ViCOROB 0.698(Universitat de Girona)、IMR 0.666(上海交通大学)、CEMRG 0.576(Imperial College London)、BIGR 0.547(Erasmus MC)、PEDRETS 0.496(Innsbruck 医科大学)。2025 版新增:Eagles(NewGiza University,埃及)、WoodyLoveAI(NYCU,台湾)、PCLab-HIT(哈工大)、SlicenDice(Universidade do Porto,葡萄牙)、GenMI(MBZUAI,阿联酋)、CALADAN(KNUST,加纳)、MedAI(Korea University,韩国)。两届合计 13 支独立队伍、14 份方案(MIC 一队两届各一份)。

MIC 是唯一两届都参赛的队伍——论文据此强调跨年进步"reflects one team’s methodological refinement, specifically the expansion of pre-training from 30 to 86 public datasets, rather than a community-wide trend":这是单队迭代记录,不是社区趋势线。引用跨年数字时必须带上这个限定。

5.2 赛制与提交机制

  • 平台:Synapse(论文口径 syn53285416;MICCAI 官网 challenges 页列 syn65878273——双口径,坑 3);
  • 两阶段:开发期 2025 年 4-8 月(下载训练数据、验证集非正式反馈)→ 终评期 2025 年 9 月(Docker 容器提交);
  • 标准化执行:组织方统一硬件 NVIDIA RTX 3090 24 GB / 128 GB RAM / 32 CPU cores 跑容器——把硬件变量从排行榜中剔除;
  • 提交限额:每 task 最多 3 次验证提交 + 1 次最终提交;
  • 组织方关联队伍可参赛但不得奖、不上公开榜。

四项公平保障(论文 Methods 逐条列出):测试标签由独立数据管理团队生成保管(含关联队伍在内无人可及);全部提交走同一自动化 Synapse 流水线无人工干预;关联队伍同限额;最终排名与论文分析在截止后才计算,无事后优化窗口。这套流程与 BIAS(Biomedical Image Analysis ChallengeS)报告指南一致执行——在"挑战赛可信度"维度,TriALS 的设计文档完备度是同类中的高位。

5.3 双范式:visible 与 combined 考的不是一场试

Task 2(平扫)设两个评估范式,考的是两种不同的能力:

范式 对照真值 考察能力 2025 最佳成绩(中/埃/外)
visible 平扫单期标注(放射科平扫可见病灶) 从平扫固有特征感知病灶 0.621 / 0.552 / 0.674
combined 多期融合标注(完整病灶负担,含平扫不可见病灶) 预测平扫上看不见的病灶(知识迁移) 0.586 / 0.471 / 0.651

visible 分数天然高于 combined(它只考"看得见的"),两者分差 Δ=0.023-0.080 直接量化各中心的隐性病灶负担——埃及 Δ=0.080 最大,与其小病灶、对比剂依赖病灶占比高一致。论文反复强调 combined paradigm 才是挑战赛的首要临床目标:一个平扫 AI 如果只会找"平扫上明显的病灶",它漏掉的那部分恰好是放射科医生最需要 AI 补位的隐性病灶。

由此推出本条目最重要的读数纪律:visible 0.552 与 combined 0.471 不是"同一件事的两个数字"而是两场考试——跨范式横比、跨论文乱引、拿 visible 分数冒充 combined 能力,都是高频错误(坑 5)。

5.4 指标套件与 9,001 罚分

指标计算用 medpy(空间重叠)+ 自定义 Surface 类(距离);预测与参考先做连通分量分解,再用 lesion-matching 算法配对(一个预测跨多个参考病灶时合并计)。

分割指标 6 项(按匹配病灶逐一计算再平均,含惩罚):

  1. DSC(per-case 与 global 两种数据集聚合口径);
  2. VOE = 1 − Jaccard;
  3. RVD(相对体积差,排名按绝对值);
  4. ASSD(平均对称表面距离);
  5. RMSD(均方根对称表面距离);
  6. MSD(最大对称表面距离 = Hausdorff)。

检测指标 2 组(数据集级 TP/FP/FN 聚合):Precision/Recall @ IoU>0.5(严格匹配)与 @ IoU>0(宽松定位,任何非零体素重叠即算)。

惩罚惯例:漏检的参考病灶与虚假预测按最差值计——Dice=0、Jaccard=0、VOE=1.0、四个距离指标=9,001。这个数字超过数据集内任何可能的真实表面距离,其设计意图写在论文里:“确保跳过病灶比产生不完美分割受罚更重”。对参赛者,这意味着"少报病灶"是最劣策略——这套激励结构与筛查场景(漏诊代价高)对齐。

5.5 rank-then-aggregate:三种排名口径

排名采用 rank-then-aggregate(遵循 Reinke et al. 的挑战赛方法论):每个指标单独排名(低好指标升序、高好指标降序、RVD 按绝对值),最终榜位=各指标平均排名——尺度不变,鼓励"各项都稳"而非"单项爆表"。

排名口径 使用指标
Task 1(静脉期) 全部 11 项
Task 2 visible 全部 11 项(visible 真值有明确空间参照,距离指标有意义)
Task 2 combined 仅 6 项检测导向(per-case/global Dice、P/R@IoU>0.5、P/R@IoU>0)——排除全部表面距离与体积指标
Task 2 最终榜 visible 与 combined 两口径排名取平均

combined 排除距离指标的理由有二:其真值含平扫不可见病灶,边界精度的意义天然弱于检出完整性;更重要的是防配准噪声偏倚——combined 标注携带的跨期配准不确定性会污染距离类指标(§3.3)。漏交提交按最差值计(Dice=0、距离=9,001)。

5.6 统计与报告规范

  • 组间比较:Mann-Whitney U(双侧,α=0.05);9 组中心两两比较经 Benjamini-Hochberg FDR 校正(q=0.05);
  • 排名稳定性:per-case 分数 bootstrap 重采样 N=1,000 次重算排名——top-4 排名稳定(95% CI overlap <10%),MIC 在 Task 1 三中心的全部 bootstrap 迭代中恒第一,Task 2 多数迭代第一;
  • 相关分析:Spearman ρ + bootstrap CI(1,000 次);
  • 环境:Python 3.10 / NumPy 1.26 / SciPy 1.11 / scikit-learn 1.3 / Matplotlib 3.8;
  • 报告规范:BIAS(Biomedical Image Analysis ChallengeS)指南 + Reinke et al. 指标选择建议。

5.7 赛制模板清单:办赛者可复用的七件套

TriALS 的赛制设计文档完整度足以作为模板,为未来办赛者提炼七件可复用件:

  1. 双范式考题:同一输入(平扫)配两套真值(visible/combined),一次赛事同时测两种能力,且分差本身成为科学产出(隐性病灶负担 Δ);
  2. Docker+统一硬件:提交容器、RTX 3090 24 GB/128 GB RAM/32 核统一执行——硬件变量出榜前被剔除;
  3. 限次提交:每 task 3 次验证+1 次终评——防测试集过拟合的最低成本手段;
  4. 独立标签保管:测试标签由独立数据管理团队生成保管,包括组织方关联队伍在内无人可及;
  5. 关联队伍规则:允许参赛(贡献分析)但不得奖不上榜(保公平);
  6. rank-then-aggregate+定向指标剔除:combined 排名剔除距离指标防配准噪声——"指标选择服务任务语义"的示范;
  7. 同口径人类基线:inter-reader 用与算法完全一致的计量(含 FN=0 罚),人类线与机器线可比。

这套件与 FLARE(库内 rid 387)代表的 Synapse 系挑战赛流程同源,TriALS 的增量在双范式与定向指标剔除两件。引用 BIAS 指南与 Reinke et al. 是其方法论背书。

§6 结果与发现:三中心全第一、感知壁垒与方法归因

6.1 Task 1:冠军达到人类水平

冠军 Team MIC(DKFZ)方法栈:nnU-Net ResEnc-L U-Net 骨干 + MultiTalent 86 个公开数据集预训练 + 肝区裁剪 + bootstrap 模型选择;外部训练数据含 LiTS、HCC、LiverMets、HCC-TACE、WAW-TACE;1050 epochs、Dice+CE 损失。

中心 MIC per-case Dice 备注
埃及内部(28 例) 0.791 超人类 inter-reader 均值 4.9%,落入人类 CI [0.540, 0.934]
中国内部(17 例) 0.721
外部南方医院(25 例) 0.750 无中心特异适配
三中心均值 0.754 70 测试 volumes pooled median 0.83

MIC 三中心全第一且零中心特异适配;前三名聚集在 7% 以内,尾部队伍方差极大(埃及上单例 Dice 0.280-0.791)。Global Dice 一致高于 per-case Dice——大体敌人占满重叠指标、小病灶的失败被掩盖,这也是 dual 聚合口径并列报告的理由。14 份方案中 12 份用 nnU-Net 骨干、11 份用 Dice+CE 损失——架构高度收敛,但排名最强预测因子却是多数据集预训练(图 9a):训练策略与数据策划的贡献大于架构选择。

6.2 Task 2:平扫是另一场考试,埃及是最难的考场

范式 中国 埃及 外部
combined 最佳 0.586 0.471 0.651
visible 最佳 0.621 0.552 0.674
combined 各队均值 0.449 0.295 0.511

combined 成绩比静脉期绝对下降 10-32%。埃及是最难中心:各队 combined 均值仅 0.295(中国 0.449、外部 0.511)——埃及队列的面内分辨率最低(0.862 mm)且小病灶占比高。外部集最佳 0.651 已超人类平扫天花板 0.574,但埃及 0.471 仍低于天花板——论文的判断是平扫挑战"not yet fully resolved"。没有任何队伍在 Task 2 做到全中心 precision、recall 双超 0.8——论文原文:“non-contrast liver lesion detection remains an open problem”。

6.3 小病灶硬墙:<100 mm³ 的 F1<0.15

按病灶体积分层的结论跨队伍一致:Task 1 中 <100 mm³ 病灶每 lesion F1<0.35;Task 2 中 F1<0.15——几乎全部提交都检不出。机理是双重叠加:部分容积效应(病灶小于层厚分辨能力)+ 病灶-实质低对比(平扫没有强化差)。这个发现的临床含义直接:早期小转移灶的检出恰恰最能改变分期与治疗决策,而它正是当前方法在平扫上的全面盲区。它与标注端的 ≥3 mm 纳入门槛(§2.5)共同划定了这份数据的"小病灶边界"——用 TriALS 训练的模型不应被宣称能检出亚 3 mm 病灶。

6.4 跨年对比:combined 在涨,visible 在停滞

同一埃及测试集、同一队伍(MIC)、两届赛事:

指标 2024 2025 变化 解释
Task 1 per-case Dice 0.742 0.791 +4.9% MultiTalent 预训练 30→86 数据集
Task 2 combined 0.429 0.471 +4.2% 多期监督的知识迁移有效
Task 2 visible 0.553 0.552 −0.001 感知壁垒:停滞

这条不对称曲线是论文的核心发现:多期监督能做知识迁移(把增强期学到的病灶位置知识推给平扫推理,combined 涨),但不能增强感知能力(从平扫固有纹理特征认出病灶,visible 不动)。预训练从 30 个公开集扩到 86 个,visible 纹丝不动——论文结论:当前架构在平扫上撞到了感知壁垒,“scaling pre-training data alone cannot overcome”,需要质上不同的方法(纹理感知编码器、扩散式对比合成、交互式人机协同)。引用此表时注意两个限定:这是单队(MIC)迭代记录非社区趋势;visible 0.553 与 0.552 的"0.001 下降"不应读作退化(坑 5)。

6.5 与现成模型对比:PASTA 的泛化失败与 VoxTell 的数据优势

两个当代肝病变分割模型被拉到 TriALS 全部测试集上对标:PASTA(专为平扫设计、无 TriALS 微调)与 VoxTell(⚠️ 其 released weights 包含 TriALS 训练数据——与参赛队不在同一起跑线,引用对比数字必须注明,坑 6)。

场景 TriALS 最佳超出 PASTA 超出 VoxTell
静脉期·埃及 +9.1% +14.1%
静脉期·外部 +23.7% +6.4%
平扫 combined·埃及 +18.1% +14.1%
平扫 combined·外部 +28.2% +9.8%

两个细节值得放大。其一,PASTA 的泛化失败模式:埃及 0.700 → 外部 0.513,疑似其训练分布与埃及测试数据重叠——“专为平扫设计"不等于"跨中心可迁移”。其二,PASTA 作为平扫特化模型,combined Dice 在全部中心仍 <0.37,远低于 TriALS 多期训练方案——为平扫而设计的方法,反而输给了"用增强期知识武装平扫推理"的方案,这正是 Triphasic-Aided 范式的最强证据。

6.6 方法归因与未开发机会

论文对排名驱动因素的解剖(图 9):多数据集预训练是最强预测因子;引入外部数据的队伍倾向更高 Dice(但有例外);ensemble 推理相对单模型无系统优势——训练策略 > 推理时聚合。三个"无人做"的空白被点名:医学分割基础模型的零样本泛化、中心自适应(domain tokens/站点特异归一化层)、非 nnU-Net 架构路线(14 份方案 12 份 nnU-Net,探索空间窄——论文建议未来设专门赛道激励架构多样性)。

临床部署的含义(论文 Discussion 的落点):对比剂受限场景的 AI 不能只在增强数据上验证(会高估真实性能、掩盖平扫特异失败模式);combined 范式在认识论上更接近"病灶预测"而非"边界勾画";交互式分割(几次点击/涂抹的 human-in-the-loop)可能是比全自动管线更现实的落地路径——“不完美的自动辅助也可能优于专家 0.333 的平扫精度”。

6.7 埃及为什么最难:三个机理解释

"埃及 combined 各队均值仅 0.295(中国 0.449、外部 0.511)"是结果表里最大的中心间落差,论文的采集数据给出三个互不排斥的机理:

  1. 分辨率劣势:埃及面内 0.862±0.095 mm,是三中心最粗——小病灶的部分容积效应最强;而埃及恰恰是小病灶、对比剂依赖病灶占比最高的队列(visible−combined 差 Δ=0.080 也是三中心最大);
  2. 噪声底更高:埃及主力机型(西门子 SOMATOM 系)平扫噪声底高于中国/外部所用的 United Imaging 与 GE 机型——平扫信噪比进一步压低可检测性;
  3. 深度协议差异:埃及层数深度 578±137 vs 外部 240±69(>2 倍)——覆盖协议不同意味着重建参数与剂量分布不同,跨中心分布差异最大。

但注意论文的统计自警:这些是采集参数显著的机理线索,Task 1 Dice 的中心差异在队伍级检验中并不显著(p>0.20、n=6-7 队功效有限)——“埃及最难"在 combined/visible 的平扫成绩上成立(0.295 vs 0.449/0.511 的差距远超噪声),但把它归因到单一采集因素尚无正式检验背书。引用时写"与采集异质性一致"而非"由 X 导致”。

6.8 六个 setting 的成绩矩阵:一张表读全 TriALS

把两届、双任务、双范式全部放平(均为同一埃及测试集可比部分;外部/中国仅 2025 版):

Setting 2024 最佳(MIC) 2025 最佳(MIC) 增量 读法
Task 1 静脉期(埃及) 0.742 0.791 +4.9% 预训练 30→86 数据集驱动
Task 2 combined(埃及) 0.429 0.471 +4.2% 知识迁移有效
Task 2 visible(埃及) 0.553 0.552 −0.001 感知壁垒:停滞
Task 1(中国) — 0.721 — 仅 2025
Task 1(外部) — 0.750 — 仅 2025
Task 2 combined(外部) — 0.651 — 超人类平扫天花板

这张矩阵的另一层信息是序关系:任何 setting 下都有静脉期 > visible > combined——对比剂信息量、病灶可见性、任务难度的三层结构在三中心全部成立。第三行(visible 停滞)与第一二行(稳步上涨)的正交性,是"知识迁移 ≠ 感知能力"的证据骨架。

§7 获取与许可:四件资产四套规则

7.1 资产清单与获取门

资产 位置 许可 门
数据本体(训练数据+全部标注) HuggingFace marwankefah/TriALS CC BY-NC-4.0 gated 表单(姓名/机构/国家/角色+非商业勾选)
外部测试集标签 不公开 embargo 向通讯作者申请(验证用途)
评估代码/Docker 基线/冠军权重 GitHub xmed-lab/TriALS 开源(随 repo) 公开直链
挑战赛提案 PDF Zenodo 10.5281/zenodo.15087645 CC BY-4.0 公开直链
论文 arXiv:2605.16572 CC BY 4.0 公开直链

HF 实测(2026-09-27,经 hf-mirror API):725 文件、36.67 GB、downloads 456;仓库创建 2026-04-12、最后更新 2026-09-23——数据在挑战赛终评(2025.9)后约七个月、随论文阶段发布。文件树与论文口径互证:imagesTr 320 个(80 例×4 期)、labelsTr 400 个(80 例×5 套)。

7.2 gated 实操要点

  1. 访问 huggingface.co/datasets/marwankefah/TriALS 登录后填 gated 表单:姓名、机构、国家、角色、非商业用途勾选;
  2. 审批通过前 API 只返回元数据(license/tags/card 字段),不开放文件下载;
  3. 非商业是硬条款(CC BY-NC-4.0):商业训练、商业产品内嵌需另行联系作者——注意这与 Zenodo 提案、arXiv 论文的 CC BY-4.0 不同,别拿"论文是 CC BY"去推数据许可(坑 2);
  4. 大陆网络环境可走 hf-mirror.com 的 API 端点(/api/datasets/marwankefah/TriALS 与 /api/datasets/marwankefah/TriALS/tree/main?recursive=true)查元数据与文件树,下载仍需 HF 账号过 gate;
  5. 外部测试集(南方医院 25 例)标签不在包内(embargo),本地无法复现外部集成绩——需要外部验证数字时引论文或申请作者发放。

7.3 AI-Ready 评估:三轨结构与真实可得性

从"拿到数据到跑通第一个模型"的距离看:nnU-Net 用户距离最短——数据已是 NIfTI,框架自带预处理;自研管线用户需要自写强度归一化与重采样(§2.4 的"预处理责任转移");想复现挑战赛排名的团队还需 Docker 复刻 RTX 3090/128 GB 环境并从 GitHub 取评估代码。三轨中真正的长板是标注资产完整性(四期原始 volumes + 各期标注 + combined 标注全发布,可独立验证融合流水线),真正的短板是外部集不可复现(标签 embargo)——AI-Ready 光谱上属"训练侧全开放、测试侧半开放"的双轨结构。

7.4 与库内可获取性光谱的对照

光谱位置 库内示例 TriALS 的位置
全开放直链 本库多数 Kaggle/公开 HF 集 代码与论文此档
gated+宽松(自动过) 部分医学 HF 集 —
gated+表单审核 少数 数据本体在此档(NC + 表单)
请求制(邮件作者) PANDA-PLUS 掩码等 外部测试集标签此档
完全不公开 — 外部集影像的公开状态待核(§10 坑 8)

§8 生态与影响

8.1 上游生态:一条清晰的预训练链

TriALS 深嵌在公开医学分割数据集的生态链里:

  1. 预标层:标注流水线第一阶段算法用 LiTS 训练;
  2. 参赛队预训练层:MIC 用 MultiTalent(86 公开数据集,2024 版为 30 个)+ LiTS/HCC/LiverMets/HCC-TACE/WAW-TACE;IMR 用 SLIVER07、LiTS、CHAOS、AMOS;ViCOROB/PEDRETS 用 LiTS 预训练;CEMRG 用 SSL(无外部数据);BIGR 从零训练;
  3. 对照模型层:PASTA、VoxTell 均为公开权重模型。

这条链的实证价值:冠军与尾部的最大差异不在架构(12/14 是 nnU-Net)而在预训练数据策划——公开数据集生态的"复利"在 TriALS 排行榜上被直接量化。

8.2 资助、认可与主办结构

  • 资助:香港研究资助局 RGC T45-401/22-N;国家自然科学基金 NSFC 62306254、82001768;
  • 认可:MICCAI Society SIG-AFRICAI 官方认可——非洲 AI 医疗兴趣组的背书与"低资源场景"动机一致;
  • 主办结构:通讯作者 Elbatel(HKUST)构思设计并执行配准/融合/评估框架/排行榜;Ghonim(艾因夏姆斯)共同设计与埃及侧数据;Mao(中山纪念医院)与 Lin(南方医院)分别牵头中国训练侧与外部队列;Z.M. 与 R.S. 任挑战赛共同组织者;
  • MICCAI 2025 挑战赛日 2025-09-27,半天场(H)。

8.3 在肝病变分割数据集景观中的位置

TriALS 填补的位置是"平扫 × 病灶级 × 多中心 × 人类基线"的四要素交集(§2.6 对照表)。它的差异化不靠规模(150 例在动辄上千例的时代偏小——论文自警"modest by modern standards")而靠三件事:唯一以平扫为推理目标的官方挑战赛、每例 5 套标注的跨期资产结构、与算法同口径计量的 inter-reader 天花板。它明确自己不是终点:论文展望三洲扩展(拉美/撒哈拉以南非洲/南亚)、纵向数据(治疗响应)、三期联用(病灶定性)、交互式赛道。

8.4 对低资源 AI 落地的直接指向

TriALS 的目标用户画像写在它的采集记录里:非洲与亚洲的基层医院(放射科无稳定对比剂供应)。它给出的落地论证链:平扫 AI 的对照系不是增强 AI 而是"没有 AI";人类专家平扫病灶级精度 0.333 意味着不完美的自动辅助也有正向价值;combined 范式让模型"提示放射科医生看不见的病灶"成为可能但必须诚实标注其"预测"属性。任何引用 TriALS 结果写落地叙事时,应带上"visible 停滞"这条反向证据——全自动平扫检测尚有硬墙,human-in-the-loop 是当前最现实路径。

8.5 负结果的公共价值:感知壁垒作为社区知识

数据集论文多数以正结果收尾,TriALS 的社区价值却有一半在负结果:visible 范式的停滞(0.553→0.552)宣告"扩大预训练"这条最顺手的技术路线在平扫感知上失效。这类结论对生态的作用方式:

  1. 止损:正在用"更大预训练+增强数据"攻平扫检测的团队,可以据此重新分配算力——论文点名了质上不同的替代方向(纹理感知编码器、扩散式对比合成、交互式人机协同);
  2. 设靶:壁垒本身就是新基准线——后续工作只需在 visible 范式上对比 0.552,进步可量化;
  3. 纠偏:结合"AI 不能只在增强数据上验证"的部署论证,为低资源场景的论文评审提供了现成的反例库——增强数据上的 SOTA 不能推导平扫性能。

引负结果时的两个限定(§5.1、坑 5):这是单队迭代记录非社区趋势;停滞的量度是 visible 排行榜分数,其方差与测试集规模(n=28)相关。负结果的可信度建立在这些限定被如实携带的前提上。

§9 与库内条目的关系

9.1 家族图谱(rid 已 SQL 查实,2026-09-27)

上游生态链(预标/预训练直接依赖):

  • LiTS(rid 81):双重角色——TriALS 标注流水线预标算法的训练集;MIC/ViCOROB/PEDRETS/IMR 四支参赛队的预训练源。两库条目互读可拼出"肝病变分割的 LiTS 时代到平扫时代"的完整演进。
  • AMOS(rid 76):IMR 队(上海交大)预训练源之一;腹部多器官跨期数据集,与 TriALS 共享"平扫+增强混合"的采集现实。
  • CHAOS(rid 337):IMR 预训练源之一;也是"平扫 CT"数据的早期代表(但无病灶级标注,§2.6)——CHAOS 提供肝、TriALS 提供肝病灶。
  • SLIVER07(rid 347):IMR 预训练源之一;肝分割挑战赛的早期经典,TriALS 与它共享"挑战赛方法论"的谱系。

同域肝病变数据集(互补视角):

  • atlas-liver-tumor(rid 431):同域肝肿瘤标注资源,可补 TriALS 缺失的病灶类型维度线索(§2.5)。
  • 3D-IRCADb(rid 357):三期 CT 小样本(20 例)经典,与 TriALS 共享"跨期配准"工艺难题但无挑战赛规模;其血管/病灶多结构标注与 TriALS 的单一病灶标注互补。
  • CaDis(rid 243):腹部多器官+肿瘤分割,与 TriALS 在"多结构腹部标注"上相邻。

方法生态(挑战赛方法论与预训练候选):

  • FLARE(rid 387):多器官分割挑战赛(同样的 rank-then-aggregate/Synapse/Docker 赛制同源),是理解 TriALS 赛制设计的库内对照条目。
  • BTCV(rid 377)/WORD(rid 412)/AbdomenCT-1K(rid 402)/TotalSegmentator(rid 422):腹部 CT 生态的方法学与预训练候选池——TotalSegmentator 类大规模多器官模型是"先分割肝再找病灶"级联方案的天然上游。

9.2 检索路径建议

  • 检索词组合:“TriALS”(精确)+ “non-contrast CT” / “liver lesion”;慎用泛化词 “trials”(撞车临床注册库 ClinicalTrials.gov——本库已有相邻 slug clinicaltrials-gov,rid 556);
  • 找数据:HF marwankefah/TriALS(gated)→ GitHub xmed-lab/TriALS(代码/权重)→ Zenodo(仅提案 PDF,坑 1);
  • 引结果:Task 1 三中心数字引论文 Table 3,Task 2 引 Table 4,跨年对比引 Table 5 并注明"单队迭代"限定(§5.1);
  • 做平扫研究:先读 §4 人类基线(你的模型要不要跟 0.574 比,取决于你测哪个中心)。

§10 避坑清单:八个已踩过的坑

坑 1:Zenodo DOI 不是数据集 DOI。10.5281/zenodo.15087645 的记录本体是一份 105,980 字节的挑战赛提案 PDF(2025-03-26 发布,CC BY-4.0),不是数据。数据本体在 HuggingFace marwankefah/TriALS(gated)。大量二手引用把 Zenodo 当"数据集 DOI"转引,检索者循 DOI 只会拿到一份提案文档。

坑 2:三件资产三套许可,别一揽子引用。数据本体 CC BY-NC-4.0(HF gated,非商业硬条款)、Zenodo 提案 CC BY-4.0、arXiv 论文 CC BY 4.0。“论文开放许可"推不出"数据可商用”;商用训练/产品内嵌需另行联系作者。撰写引用时逐件标注。

坑 3:Synapse ID 双口径。论文 Methods 写 syn53285416;MICCAI 2025 官网 challenges 页列 syn65878273(疑为 2025 版新页面)。本条目正文以论文口径为主。两个 ID 都能搜到 TriALS 相关页面,引用时任选其一并注明口径,别混排在同一句里。

坑 4:机构与标题的常见误写。埃及侧机构是艾因夏姆斯大学(Ain Shams University),部分聚合源(如 OpenAIRE)误写为"爱资哈尔大学(Al-Azhar)"——两所开罗大学名 易混,以论文作者隶属为准。标题同理:正式标题是 “Triphasic-Aided Liver Lesion Segmentation Benchmark in Non-Contrast CT”,简写版常丢 “Benchmark”。

坑 5:visible 与 combined 不可横比。0.552(visible 埃及)与 0.471(combined 埃及)是两场考试的分数:前者只考平扫可见病灶,后者考含不可见病灶的完整负担。跨范式直比、拿 visible 分数冒充 combined 能力、把 0.553→0.552 读作"退化"(实为停滞,±0.001 在 n=28 的噪声内)都是高频错误。引用时必须带范式名。

坑 6:VoxTell 有数据优势。VoxTell 的 released weights 包含 TriALS 训练数据(论文原文承认),与参赛队"只给 80 例训练"不在同一起跑线;PASTA 则无 TriALS 微调。两行对比数字(+9.8% vs +28.2%)的含金量不同,转引时须注明口径,否则会高估/低估真实差距。

坑 7:0.742 的双重身份。0.742 既是 2025 论文 inter-reader 研究的静脉期人类一致性 Dice(n=16),也是 2024 版挑战赛 MIC 队在埃及测试集的 Task 1 分数。两处含义完全无关,检索/引用时务必核对上下文——这也是论文跨年对比表(0.742→0.791)读起来刺眼的原因:2024 的机器分数恰好等于 2025 的人类一致性。

坑 8:外部测试集的可见边界。外部集(南方医院 25 例)标签 embargo(贡献机构协议),HF 文件树实测亦未见外部集对应目录——外部集影像是否随 gated 包发布待注册后核实(本条目按"标签肯定不公开"撰写)。任何"本地复现外部集成绩"的计划都应预设受阻,先邮件作者。

§11 总结

11.1 三句话总结

  1. TriALS 把"平扫肝病变分割"立为独立基准:150 例四期 CT、三期辅助标注构建平扫真值、双范式评估,数据与全部标注在 HF gated(CC BY-NC-4.0)公开,代码与冠军权重在 GitHub 公开。
  2. 它的冠军(DKFZ/MIC)在静脉期达到人类水平(0.754 三中心均值、超人类均值 4.9%),靠的不是架构(12/14 都是 nnU-Net)而是 86 个公开数据集的预训练——公开数据生态的复利被排行榜直接量化。
  3. 它最有价值的产出是一个负结果:预训练翻倍扩张下,平扫可见病灶的检出纹丝不动(0.553→0.552)——"感知壁垒"宣告平扫检测无法靠增强数据的知识迁移解决,是低资源 AI 落地叙事里必须携带的反向证据。

11.2 适合谁

  • 平扫/低资源场景的肝病变检测团队:唯一的平扫病灶级多中心基准+人类基线。
  • 挑战赛方法论研究者:双范式、rank-then-aggregate、9,001 罚分、BIAS 规范执行的完整活样本。
  • 多期标注/标签融合研究者:每例 5 套标注全发布,STAPLE 流水线可独立验证与改良。
  • 需要跨期配准+融合教学案例的团队:elastix→STAPLE→QA 四步是可复用工艺。

11.3 不适合谁

  • 需要病灶类型标签(HCC vs 转移瘤)的项目——数据集明确不含类型标注。
  • 需要大训练集的团队——150 例偏小,论文自警测试集 17-28 例/中心。
  • 需要本地复现外部集成绩的评测方——外部标签 embargo,只能引论文或申请作者。
  • 商业用途——数据本体 CC BY-NC-4.0,商用需另行授权。

11.4 30 秒决策卡

你的情况 行动
立刻跑通第一个模型 HF gated 申请 + GitHub Docker 基线 + nnU-Net 默认预处理
做平扫检测方法研究 读 §4 人类基线 → §6.4 感知壁垒 → 设计"质不同"的方法再入场
复现/改良标签融合 §3.3 四步流水线 + HF 全标注资产(四期+combined 可独立验证)
引用挑战赛结果 Task 1 用 Table 3、Task 2 用 Table 4(带范式名)、跨年用 Table 5(带单队限定)
对标现成模型 §6.5 表 + 注明 VoxTell 数据优势(坑 6)
写低资源 AI 叙事 引 0.333 人类平扫精度 + visible 停滞双证据,勿只引 combined 涨幅
要病灶类型信息 换/补库内 atlas-liver-tumor(431)、3dircadb(357)

11.5 与相近条目/概念的区分速查

名称 是什么 与 TriALS 的关系
LiTS(库内 81) 增强期肝肿瘤分割老牌基准 TriALS 的预标训练集与多队预训练源;增强期主战场不同
CHAOS(库内 337) 平扫 CT+MRI 腹部数据 有平扫但无病灶级标注——TriALS 补"平扫×病灶"空位
FLARE(库内 387) 多器官分割挑战赛 赛制同源(Synapse/rank-then-aggregate),任务域不同
3D-IRCADb(库内 357) 三期 CT 小样本(20 例) 同有跨期配准难题;规模与病灶谱差异大
ClinicalTrials.gov(库内 556,slug 相邻) 临床试验注册库 与 TriALS 无关;检索 “trials” 撞车项
AMOS(库内 76) 腹部多器官跨期 IMR 队预训练源;无病灶级肝病变赛道
atlas-liver-tumor(库内 431) 肝肿瘤标注资源 补 TriALS 缺失的病灶类型维度

11.6 一分钟电梯陈述

TriALS 要回答的问题是:当医院做不起增强 CT 时,AI 还能在肝病变上帮上忙吗?它用 150 例四期 CT 构建了第一个为平扫设计的多中心基准——标注在增强期勾画、经配准与 STAPLE 融合折算回平扫,每例五套标注全发布;挑战赛按双范式评估(visible 考感知、combined 考预测),并配了同口径的人类基线(平扫互认精度仅 0.574、病灶级 0.333)。结果端两个结论同样重要:冠军(DKFZ)在静脉期达到人类水平,靠的是 86 个公开数据集的预训练而非架构;而预训练翻倍扩张下,平扫可见病灶的检出两年纹丝不动——感知壁垒是这条赛道当前最重要的公共知识。数据在 HF gated(CC BY-NC-4.0),代码与冠军权重在 GitHub,外部测试标签 embargo。

FAQ(高频问答 32 问)

A. 基础认知

Q1:TriALS 是什么?
MICCAI 2025 官方挑战赛 + 数据集 + 方法学论文的三件套,全称 Triphasic-Aided Liver Lesion Segmentation Benchmark in Non-Contrast CT。核心命题:算法只看平扫 CT,把肝病灶找出来——而真值由三期增强标注辅助构建。

Q2:为什么专门做"平扫"?
对比剂短缺是非洲、亚洲大量医院的现实(成本、供应链、碘过敏与肾功限制)。现有公开肝数据集几乎全以增强期为主,模型在增强数据上的高分对平扫-only 医院无意义。TriALS 数据本身也带着这个现实:埃及队列对比剂 Omnipaque/Telebrix 混用。

Q3:“Triphasic-Aided"到底"谁辅助谁”?
三期(动脉/门脉/延迟)辅助标注,不辅助推理:算法输入只有平扫;标注在增强期勾画最清楚,经配准与融合"折算"回平扫坐标系生成 combined 真值。

Q4:它是第一份平扫肝病变数据集吗?
不是第一份平扫(CHAOS 有平扫 CT),但是第一份多中心的"平扫肝病变分割"基准(论文自称 to our knowledge the first)——平扫+病灶级标注+多中心+人类基线四要素首次凑齐。

Q5:谁办的?
通讯作者 Marwan Elbatel(香港科技大学 HKUST)与 Mohamed Ghonim(埃及艾因夏姆斯大学)共同发起;中国侧由中山纪念医院与南方医院参与;MICCAI Society SIG-AFRICAI 官方认可;RGC 与 NSFC 资助。

B. 数据与获取

Q6:数据在哪下?多大?
HuggingFace marwankefah/TriALS,gated 仓库,实测 725 文件/36.67 GB。训练侧:imagesTr 320 个(80 例×4 期)+ labelsTr 400 个(80 例×5 套)。

Q7:gated 表单要填什么?
姓名、机构、国家、角色,加一项非商业用途勾选(数据 CC BY-NC-4.0)。审批通过后才能下载。

Q8:测试集也给我吗?
测试集影像与标签都在挑战赛时保密;终评后训练数据公开,但外部测试集(南方医院 25 例)标签永久 embargo(贡献机构数据协议),可向通讯作者申请验证用途。本地无法复现外部集成绩。

Q9:数据格式和预处理状态?
NIfTI(DICOM 原样转换),HU 原值,无重采样无归一化无裁剪。预处理责任在用户;组织方提供 nnU-Net 默认参考预处理。nnU-Net 用户几乎零成本,自研管线要自己写归一化与重采样。

Q10:扫描设备覆盖怎样?
8 款机型 3 厂商(SIEMENS×2、GE×4、United Imaging×1、Toshiba×1),层厚 0.63-1.56 mm、面内 0.54-1.19 mm、100-120 kVp、512×512 全腹。三中心参数差异统计显著但 Task 1 成绩跨中心差异不显著。

Q11:代码和冠军模型权重在哪?
GitHub xmed-lab/TriALS:评估代码、Docker 基线、脚本(eval_scripts 目录),top-ranked 方法预训练权重公开。

C. 标注与范式

Q12:每例为什么有 5 套标注?
四期各一套(各期勾画的病灶)+ 一份 combined(四期融合、配准到平扫坐标系)。5 套分开发布让研究者可复现/改良融合策略、研究跨期一致性。

Q13:combined 标注怎么来的?
四步:elastix 刚性配准→elastix 非刚性精化(亚体素)→STAPLE(SimpleITK)四期概率融合→腹部放射顾问逐例 QA。"至少两期可见"的病灶才纳入。

Q14:combined 里的"平扫不可见病灶"是什么意思?
增强期清楚显示但平扫上看不见(或看不出)的病灶——放射科医生凭平扫自己大概率漏掉的。combined paradigm 要求算法预测它们,这更像"病灶预测"而非"边界勾画"。

Q15:visible 与 combined 两个范式怎么选?
看你研究什么:visible 测"平扫感知"(认出看得见的),combined 测"完整负担预测"(挑战赛首要临床目标)。两者分数不可横比(坑 5)。

Q16:谁标注的?可靠吗?
LiTS 训练的算法预标(不作真值)→ 10 名放射科住院医师/专科医师(≥1 年腹部经验)3D Slicer 修正 → 双人复核 → >10 年顾问裁决 → combined 另有顾问 QA。病灶纳入门槛 ≥3 mm(跨 2 连续切片)。

D. 结果与统计

Q17:冠军是谁?分数多少?
Team MIC(DKFZ):nnU-Net ResEnc-L + MultiTalent 86 数据集预训练。Task 1 三中心全第一:埃及 0.791/中国 0.721/外部 0.750,均值 0.754;Task 2 combined 最佳 0.471(埃及)/0.586(中国)/0.651(外部)。

Q18:冠军达到人类水平了吗?
静脉期达到了:0.791 超人类 inter-reader 均值(0.742)4.9%,落入人类 95% CI [0.540, 0.934]。平扫没有全达标:外部 0.651 超 0.574 天花板,但埃及 0.471 仍低于它。

Q19:人类在平扫上什么水平?
两名腹部放射医生双盲标注 16 例:per-case Dice 0.574,病灶级 precision 仅 0.333——一人认出的病灶三分之二被另一人漏认。平扫检测连人类都远未解决。

Q20:"感知壁垒"是什么?
跨年(2024→2025,同队同测试集):combined 0.429→0.471 涨了,visible 0.553→0.552 没动——预训练从 30 个数据集扩到 86 个也无效。知识迁移有效、感知能力不涨,说明平扫检测需要质上不同的方法。

Q21:小病灶表现如何?
<100 mm³ 病灶 Task 1 每 lesion F1<0.35、Task 2 F1<0.15——几乎全部提交检不出。部分容积效应+平扫低对比双重叠加。数据端病灶纳入门槛 ≥3 mm,模型不应宣称能检亚 3 mm 病灶。

Q22:排名怎么算的?
rank-then-aggregate:11 项指标(Task 1/visible)或 6 项检测导向指标(combined)分别排名再取平均。漏检/虚报按最差值计(Dice=0、表面距离=9,001)。combined 排除距离指标是防配准噪声偏倚。

Q23:跟 PASTA/VoxTell 比怎么样?
平扫外部集 TriALS 最佳超 PASTA 28.2%、超 VoxTell 9.8%(绝对 Dice)。注意 VoxTell 权重含 TriALS 训练数据(数据优势);PASTA 埃及 0.700→外部 0.513 是典型泛化失败。

E. 许可与复用

Q24:我能商用吗?
数据本体 CC BY-NC-4.0——不能直接商用,需另行联系作者。Zenodo 提案与 arXiv 论文是 CC BY-4.0,但那不是数据许可(坑 2)。

Q25:我能用 TriALS 训练模型并发表吗?
学术用途可以(gated 表单+引用论文)。发布衍生模型时注意:数据 NC 条款对"模型权重是否算衍生品"存在解释空间,商用前向作者确认。

Q26:能和其他数据集混训吗?
可以且正是冠军打法(MultiTalent 86 数据集预训练)。混合时注意各数据集许可独立生效(LiTS 等各有口径),最终成果按最严格条款自查。

Q27:挑战赛提交方式还能复用吗?
赛制已结束但设计可复用:Docker 容器+标准化硬件(RTX 3090/128 GB/32 核)+限次提交+独立标签保管,这套流程文档完整,适合做新挑战赛模板。

F. 库内与工程细节

Q28:库内还有哪些相关条目?
上游:lits(81)、amos(76)、chaos(337)、sliver07(347);同域:atlas-liver-tumor(431)、3dircadb(357)、cadis(243);方法生态:flare(387)、btcv(377)、word(412)、abdomenct-1k(402)、totalsegmentator(422)。

Q29:TriALS 和 LiTS 什么关系?
三层:预标算法用 LiTS 训练;4 支参赛队用 LiTS 预训练;MIC 的 86 数据集预训练池也含 LiTS。LiTS 是增强期时代的主战场,TriALS 是平扫赛道。

Q30:为什么 slug 叫 trials?会不会撞车?
官方名 TriALS 取小写即 trials。库内已有相邻 slug clinicaltrials-gov(临床注册库,rid 556),检索"trials"会命中两域——本条目 title/keywords 均带 TriALS/liver 限定词区分。

Q31:预处理有什么推荐?
nnU-Net 默认(前景自适应强度归一化+各向异性感知重采样)即挑战赛参考基线。自研管线注意:HU 原值、层厚异质(0.63-1.56 mm)、埃及面内分辨率显著低于外部(0.862 vs 0.686 mm)——重采样策略对埃及小病灶成绩影响大。

Q32:想要病灶类型(HCC/转移瘤)怎么办?
TriALS 没有(论文局限自曝)。替代路径:库内 atlas-liver-tumor(431)、3dircadb(357) 有类型/结构维度;或等 TriALS 后续版本(论文展望病灶定性为未来方向)。

Q33:排行榜分数可信吗?
设计上可信度配置拉满:统一硬件执行、限次提交、独立标签保管、关联队伍不上榜、终评后才有排名、bootstrap 验证 top-4 稳定(CI overlap<10%)。剩余不确定性来自测试集规模(17-28 例/中心,CI 宽 0.13-0.27)——top 与尾部的差距可信,相邻队伍间的细微差距不可过度解读。

Q34:80 例训练集够不够用?
作为"从零训练监督数据"偏少;作为"预训练后微调集"是合理规模(冠军即 86 数据集预训练+微调打法)。论文对 150 例的定性是 “modest by modern standards”——它买的是标注质量与跨期结构,不是体量。

Q35:combined 标注能直接当平扫分割真值用吗?
能且这正是设计意图,但要清楚它的属性:含平扫不可见病灶(模型学的是"预测"而非"描摹")、携带跨期配准的残余误差(挑战赛为此在 combined 排名剔除距离指标)、"≥2 期可见"规则滤掉了单期短暂病灶。用于边界精度敏感的应用时要谨慎。

Q36:后续版本会有什么?
论文展望五项:三洲扩展(拉美/撒哈拉以南非洲/南亚)、纵向数据(治疗响应)、三期联用(病灶定性)、交互式分割赛道、激励架构多样性的专门赛道。均为论文表述的计划,无公开时间表——订阅 GitHub repo 跟踪。

事实清单(硬事实 36 条)

  1. 全称:TriALS——Triphasic-Aided Liver Lesion Segmentation Benchmark in Non-Contrast CT(arXiv 页眉口径)。
  2. arXiv 编号 2605.16572(v1,2026-05-15 提交),论文 license CC BY 4.0,65 名作者。
  3. Zenodo DOI 10.5281/zenodo.15087645(concept;version v1=15087646),发布 2025-03-26,本体为挑战赛提案 PDF(105,980 字节),license cc-by-4.0。
  4. HuggingFace marwankefah/TriALS:gated,cc-by-nc-4.0,createdAt 2026-04-12,lastModified 2026-09-23,downloads 456(2026-09-27 抓取)。
  5. HF 实测 725 文件/36.67 GB;imagesTr 320(80 例×4 期)+ labelsTr 400(80 例×5 套)。
  6. GitHub xmed-lab/TriALS:评估代码、Docker 基线、top-ranked 权重公开。
  7. 数据:150 例×4 期=600 volumes;每例 5 套标注。
  8. 埃及采集 352 volumes(艾因夏姆斯大学医院,FWA 000017585);中国 148 volumes(中山纪念医院);外部 25 例(南方医科大学南方医院)。
  9. 划分:训练 80(埃及 60+中国 20);测试埃及内部 28+中国内部 17+外部 25;测试标签终评前保密。
  10. 入组:≥18 岁、完整四期、放射报告 ≥1 肝病灶、质量可接受;排除:显著伪影、门脉主干完全血栓、Child-Pugh C。
  11. 病灶谱含 HCC/转移瘤/胆管细胞癌/良性;无病灶类型标注(论文局限自曝)。
  12. 8 款扫描仪 3 厂商:SOMATOM Force、SOMATOM Sensation 64、uCT780、Discovery CT750 HD、Revolution EVO、Optima、Prime Aquilion、BrightSpeed。
  13. 层厚 0.63-1.56 mm(训练均值 0.97±0.19);面内 0.54-1.19 mm(0.832±0.10);512×512;全腹。
  14. 动脉期约 35-45 s(bolus tracking)、门脉期 65-70 s、延迟期门脉后 3 min。
  15. 埃及对比剂 Omnipaque(非离子)/Telebrix(离子)混用(供应链限制)。
  16. 面内分辨率 Egypt 0.862±0.095 / China 0.766±0.063 / External 0.686±0.072 mm;层数 Egypt 578±137 vs External 240±69。
  17. 9 组两两参数比较 8 组 p<0.006(Mann-Whitney U+BH-FDR q=0.05);Task 1 Dice 跨中心 p>0.20 不显著。
  18. NIfTI 分发、HU 原值、无重采样/归一化;组织方提供 nnU-Net 默认参考预处理。
  19. 标注两阶段:LiTS 算法预标(不作真值)→10 标注员(≥1 年腹部经验)3D Slicer 修正→双人复核→>10 年顾问裁决。
  20. 病灶纳入门槛:跨 ≥2 连续切片(约 ≥3 mm 最大径)。
  21. combined 四步:elastix 刚性→非刚性精化→STAPLE(SimpleITK)融合(≥2 期可见才纳入)→顾问 QA。
  22. inter-reader(n=16 例/期,双盲):动脉 0.784、静脉 0.742±0.443(P 0.833/R 0.946)、延迟 0.601、平扫 0.574±0.490(P 0.333/R 0.769)。
  23. 人类天花板 bootstrap(N=10,000)95% CI [0.540, 0.934];双峰一致性(DSC≈1 或 =0)。
  24. 两届合计 13 独立队伍/14 方案;nnU-Net 骨干 12/14,Dice+CE 11/14;MIC 唯一两届参赛。
  25. 2024 版 6 队(埃及测试 Task 1):MIC 0.742/ViCOROB 0.698/IMR 0.666/CEMRG 0.576/BIGR 0.547/PEDRETS 0.496。
  26. 冠军 MIC 方法:ResEnc-L U-Net+MultiTalent 86 数据集预训练(2024 版 30 个)+肝区裁剪+bootstrap 模型选择;1050 epochs。
  27. Task 1 MIC:埃及 0.791/中国 0.721/外部 0.750,均值 0.754(pooled median 0.83);超人类均值 4.9%。
  28. Task 2 combined 最佳:0.586/0.471/0.651(中/埃/外);visible:0.621/0.552/0.674;combined 各队均值埃及仅 0.295。
  29. 无队伍 Task 2 全中心 P、R 双 >0.8(“remains an open problem”);<100 mm³ 病灶 Task 1 F1<0.35、Task 2 F1<0.15。
  30. 跨年(埃及测试集):Task 1 0.742→0.791(+4.9%);combined 0.429→0.471(+4.2%);visible 0.553→0.552(停滞=感知壁垒)。
  31. 对比:外部平扫超 PASTA +28.2%/VoxTell +9.8%;VoxTell 权重含 TriALS 训练数据;PASTA 埃及 0.700→外部 0.513(泛化失败)。
  32. 评估:11 指标(Task 1/visible)vs 6 检测导向(combined,排除距离/体积指标);漏检罚 Dice=0、距离=9,001;rank-then-aggregate。
  33. 排名稳定性:bootstrap N=1,000,top-4 稳定(CI overlap <10%);MIC Task 1 三中心全迭代第一。
  34. 赛制:Synapse(论文 syn53285416/官网 syn65878273 双口径);开发 2025.4-8、终评 2025.9;RTX 3090 24 GB/128 GB RAM/32 核;3 验证+1 终提交。
  35. 资助:RGC T45-401/22-N + NSFC 62306254/82001768;MICCAI Society SIG-AFRICAI 认可;MICCAI 2025 挑战赛日 2025-09-27 半天场(H)。
  36. 多数据集预训练为排名最强预测因子;ensemble 无系统优势;基础模型零样本、中心自适应、非 nnU-Net 路线均无人探索。

术语表(30 条)

  1. NCCT(Non-Contrast CT):非对比增强 CT,平扫——TriALS 的推理目标模态。
  2. Triphasic:三期(动脉/门脉/延迟),加平扫共四期——本数据集的采集结构。
  3. Combined paradigm:对多期融合标注(含平扫不可见病灶)的评估范式——挑战赛首要临床目标。
  4. Visible paradigm:仅对平扫单期标注(放射科平扫可见病灶)的评估范式。
  5. STAPLE:Simultaneous Truth and Performance Level Estimation,多标注概率共识融合算法(SimpleITK 实现)。
  6. elastix:开源医学图像配准工具包,TriALS 用于 rigid→non-rigid 顺序配准。
  7. Label fusion:标签融合——把多期/多标注合并为共识真值的过程。
  8. nnU-Net:自配置分割框架,14 份参赛方案中 12 份的骨干。
  9. MultiTalent:多数据集医学分割预训练方案,冠军 MIC 用 86 个公开数据集预训练。
  10. ResEnc-L:残差编码器大号 U-Net(nnU-Net 变体),MIC 的骨干配置。
  11. rank-then-aggregate:逐指标排名再取平均的挑战赛排名法(尺度不变)。
  12. BIAS guidelines:Biomedical Image Analysis ChallengeS 报告规范,TriALS 遵循执行。
  13. per-case Dice:逐 volume 二值 Dice 的均值;global Dice:全体病灶体素池化 Dice——大病灶主导后者。
  14. VOE:Volumetric Overlap Error = 1−Jaccard。
  15. RVD:Relative Volume Difference,排名按绝对值。
  16. ASSD/RMSD/MSD:平均/均方根/最大对称表面距离(MSD=Hausdorff)。
  17. 9,001 罚分:漏检/虚报病灶时距离指标的最差罚值——超过数据集内任何可能真实距离。
  18. IoU>0.5 / IoU>0:严格/宽松病灶匹配阈值(检测指标)。
  19. inter-reader variability:观察者间变异——两名放射医生的独立标注一致性,人类基线来源。
  20. 双峰一致性:DSC≈1 或 DSC=0 的极端分布——分歧在"可见性"而非"边界"。
  21. HCC:肝细胞癌;LiverMets:肝转移瘤——数据集病灶谱(无类型标注)。
  22. Child-Pugh C:肝硬化最重分级——TriALS 排除标准之一。
  23. bolus tracking:对比剂团注追踪触发扫描(动脉期 35-45 s)。
  24. HU(Hounsfield Unit):CT 值单位,数据保留原值不归一化。
  25. gated repo:HuggingFace 需填表审批的受限仓库——TriALS 数据本体发放方式。
  26. CC BY-NC-4.0:署名-非商业-相同方式共享许可——数据本体条款(非商业硬约束)。
  27. concept DOI / version DOI:Zenodo 的父/子 DOI(15087645/15087646)。
  28. Docker 容器提交:挑战赛终评的代码封装方式,组织方统一硬件执行。
  29. 感知壁垒(perceptual barrier):visible 范式分数停滞现象——预训练扩容换不来平扫固有特征的感知力。
  30. SIG-AFRICAI:MICCAI Society 非洲 AI 医疗兴趣组——TriALS 官方认可方。

附录

附录 A:条目信息速查卡

项 值
条目名 TriALS
url_name trials
类型 挑战赛数据集+赛事记录+方法论文(三合一)
论文 arXiv:2605.16572(2026-05-15,CC BY 4.0,65 作者)
赛事 MICCAI 2025 官方挑战赛(2025-09-27,H 半天场);2024 预演版
团队 HKUST(Elbatel)× Ain Shams(Ghonim)× 中山纪念医院 × 南方医院
规模 150 例×4 期=600 volumes;训练 80+测试 70;每例 5 套标注
数据 HF marwankefah/TriALS,gated,CC BY-NC-4.0,725 文件/36.67 GB
抓取时点 2026-09-27
库内互链 lits(81)/amos(76)/chaos(337)/sliver07(347)/atlas-liver-tumor(431)/3dircadb(357)/cadis(243)/flare(387)/btcv(377)/word(412)/abdomenct-1k(402)/totalsegmentator(422)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 7 arXiv+MICCAI 官网+GitHub 多入口可索引;但"TriALS"泛用词易撞车临床注册库,Zenodo 提案常被误当数据入口
A 可获取性 6 训练数据+全部标注 HF 公开(gated 自动/人工审批);外部标签 embargo;冠军权重公开——扣分在外部集不可复现与 NC 条款
I 可互操作 8 NIfTI 标准格式+nnU-Net 生态即插即用;HU 原值+无重采样是"原始友好"设计;跨期标注可分离加载
M 元数据质量 8 论文表格完备(采集参数/划分/指标定义/统计规范全披露);BIAS 规范执行;Synapse ID 双口径与 0.742 双重身份微降分
S 可持续性 7 三平台分发(HF/GitHub/arXiv)冗余良好;学术团队维护、作者活跃(HF 2026-09 仍更新);外部标签依赖个人邮件有单点风险
综合评级 7.2/10(中上偏良) 标注资产完整性与方法学透明度是长板;外部集不可复现与规模偏小是结构性短板

附录 C:逐项证据链自证

关键数字 来源 位置
150 例/600 volumes/80-28-17-25 划分 论文 Methods(Data split)+摘要 arXiv HTML 全文
埃及 352 volumes/FWA 000017585;中国 148 volumes 论文 Methods(Study design) arXiv HTML 全文
8 款扫描仪全清单与采集参数 论文 Methods(CT acquisition protocols) arXiv HTML 全文
inter-reader 0.742/0.574/0.784/0.601、P 0.333 论文 Results+Methods(Inter-rater)+Fig 2 arXiv HTML 全文
人类 CI [0.540, 0.934](N=10,000) 论文 Results(Human baseline) arXiv HTML 全文
MIC 0.791/0.721/0.750、均值 0.754、median 0.83 论文 Results(Task 1)+Table 3 arXiv HTML 全文
Task 2 combined 0.586/0.471/0.651;visible 0.621/0.552/0.674 论文 Results(Task 2)+Table 4 arXiv HTML 全文
跨年 0.742→0.791/0.429→0.471/0.553→0.552 论文 Results(Cross-year)+Table 5 arXiv HTML 全文
超 PASTA +28.2%/VoxTell +9.8%(外部 NCCT) 论文 Results(Comparison)+Fig 7 arXiv HTML 全文
9,001 罚分与 11/6 指标口径 论文 Methods(Evaluation metrics/Ranking) arXiv HTML 全文
MultiTalent 86 数据集预训练 论文 Results(Segmentation performance)+Table(method stack) arXiv HTML 全文
gated/cc-by-nc-4.0/725 文件/36.67 GB HF API(hf-mirror 端点)实测 2026-09-27 抓取
Zenodo 提案 PDF/cc-by-4.0/2025-03-26 Zenodo API records/15087645 2026-09-27 抓取
Synapse 双口径 论文 Methods(Challenge organisation)vs MICCAI 官网 challenges 页 双源对照

附录 D:数据获取决策树

需要 TriALS 数据
├─ 只要代码/权重/论文 → GitHub xmed-lab/TriALS + arXiv 2605.16572(无需审批)
├─ 要训练数据+标注(学术)
│   ├─ 有 HF 账号 → marwankefah/TriALS 填 gated 表单(NC 勾选)→ 审批 → 下载 36.67 GB
│   └─ 大陆网络 → hf-mirror API 查元数据/文件树;下载仍需 HF 过 gate
├─ 要外部测试集标签 → embargo,邮件通讯作者申请(预设受阻,引用论文数字替代)
├─ 要商用 → 数据 CC BY-NC-4.0 不覆盖,联系作者单独授权
└─ 只想找"数据集 DOI"引用 → 引 HF repo + arXiv;Zenodo 15087645 只是提案 PDF(坑 1)

附录 E:指标套件全表(11 项定义)

# 指标 定义 方向 Task 1/visible combined
1 per-case Dice 逐 volume 二值 Dice 均值 高好 ✓ ✓
2 global Dice 全体病灶体素池化 Dice 高好 ✓ ✓
3 Precision @ IoU>0.5 严格匹配病灶级精度 高好 ✓ ✓
4 Recall @ IoU>0.5 严格匹配病灶级召回 高好 ✓ ✓
5 Precision @ IoU>0 宽松定位精度 高好 ✓ ✓
6 Recall @ IoU>0 宽松定位召回 高好 ✓ ✓
7 VOE 1−Jaccard 低好 ✓ ✗
8 RVD 相对体积差(排名按绝对值) 低好 ✓ ✗
9 ASSD 平均对称表面距离 低好 ✓ ✗
10 RMSD 均方根对称表面距离 低好 ✓ ✗
11 MSD 最大对称表面距离(Hausdorff) 低好 ✓ ✗

惩罚惯例:FN/FP → Dice=0、Jaccard=0、VOE=1.0、RVD/ASSD/RMSD/MSD=9,001。Task 2 最终榜=visible 与 combined 两口径排名平均。

附录 F:combined 标注流水线复现骨架(伪代码)

# 依赖: SimpleITK, elastix(或 SimpleElastix 绑定)
# 输入: 四期影像 + 四期各自标注(NC/ar/pv/del),肝区裁剪体积
# 步骤 1-2: 顺序刚性→非刚性配准(各增强期 → NC 坐标系)
def build_combined(nc_img, phases):
    aligned = {}
    for name, (img, seg) in phases.items():
        # 先 rigid(校正呼吸运动/摆位),再非刚性精化(亚体素边界对齐)
        tx_rigid = elastix_rigid(fixed=nc_img, moving=img)
        tx_deform = elastix_nonrigid(fixed=nc_img, moving=img, init=tx_rigid)
        aligned[name] = warp_segmentation(seg, tx_deform, reference=nc_img)
    # 步骤 3: STAPLE 概率融合(SimpleITK)
    fused = sitk.STAPLE(list(aligned.values()), threshold=0.5)
    # 步骤 4(人工): 腹部放射顾问对照原始对比期逐例 QA——
    # 纠正/剔除可见配准错误;单期独有病灶按 "≥2 期可见" 规则复核
    return fused

注:真实流水线以论文 Methods 与官方 GitHub 评估脚本为准;本骨架仅为工艺结构示意(步骤顺序与"≥2 期可见"规则来自论文原文)。

附录 G:HF 数据获取与校验骨架(代码)

# pip install datasets huggingface_hub
# 前置: HF 账号过 marwankefah/TriALS gated 审批
from huggingface_hub import snapshot_download

snapshot_download(
    repo_id="marwankefah/TriALS",
    repo_type="dataset",
    local_dir="TriALS/",
    # token="hf_xxx"  # 过 gate 的账号 token
)
# 校验要点(论文+HF 实测口径):
# - imagesTr 计数 = 320(80 例 × 4 期: NC/ar/pv/del)
# - labelsTr 计数 = 400(80 例 × 5 套: 四期 + combined)
# - 总体 725 文件 / 36.67 GB
# - NIfTI HU 原值: 抽查体数据 intensity 范围应含负值(脂肪/空气)
# - 无外部测试集影像/标签目录(embargo)

附录 H:inter-reader 与人类基线数据表

量 数值 口径
静脉期 inter-reader per-case Dice 0.742±0.443(n=16) 与算法同口径(FN 计 Dice=0)
平扫 inter-reader per-case Dice 0.574±0.490(n=16) 同上
静脉期病灶级 P/R 0.833 / 0.946 max volumetric overlap ≥10% IoU 匹配
平扫病灶级 P/R 0.333 / 0.769 同上;P 低=高假发现率(2/3 互不认)
动脉期/延迟期 Dice 0.784 / 0.601 四期中最高/次低
人类天花板 95% CI [0.540, 0.934] bootstrap N=10,000;宽区间=n 小+双峰
冠军相对人类 +4.9%(静脉埃及) 0.791 vs 0.742;落入 CI=人类水平
平扫外部最佳 vs 天花板 0.651 vs 0.574 外部已超;埃及 0.471 未超

附录 I:2024 版六队方法配置表(论文口径)

队伍 机构 架构 预训练 预训练数据 Epochs 损失 T1 NC
MIC DKFZ(德) ResEnc-L U-Net MultiTalent(30 数据集) LiTS+多期 200 Dice+CE ✓ ✓
ViCOROB U. Girona(西) PlainConv/ResEnc LiTS 预训练 LiTS 1000 Dice+CE ✓ ✓
IMR 上海交大(中) PlainConv U-Net 肝分割(4 数据集) SLIVER07/LiTS/CHAOS/AMOS 1000 Dice+CE ✓ ✓
CEMRG Imperial(英) xLSTM-UNet SSL 师生 无 N/A 对比+Dice+CE ✓ ✓
PEDRETS Innsbruck(奥) MedNeXt-L(5×5) LiTS 预训练 LiTS 100+1000 Dice+CE ✓ ✓
BIGR Erasmus MC(荷) MedNeXt-L(5×5) 无 无 100/300 Dice+CE — ✓

2024 埃及测试 Task 1 per-case Dice:MIC 0.742 > ViCOROB 0.698 > IMR 0.666 > CEMRG 0.576 > BIGR 0.547 > PEDRETS 0.496。2025 版 MIC 升级为 MultiTalent 86 数据集、1050 epochs,预训练数据追加 HCC/LiverMets/HCC-TACE/WAW-TACE。

附录 J:2025 版结果登记表(论文口径)

指标 MIC(冠军) 备注
Task 1 埃及/中国/外部 0.791 / 0.721 / 0.750 三中心全第一,无中心适配
Task 1 三中心均值 0.754 pooled median 0.83(70 volumes)
Task 2 combined 中/埃/外 0.586 / 0.471 / 0.651 外部超人类天花板 0.574
Task 2 visible 中/埃/外 0.621 / 0.552 / 0.674 与 combined 不可横比(坑 5)
埃及 combined 各队均值 0.295(全队) vs 中国 0.449 / 外部 0.511——埃及最难
排名稳定性 Task 1 全迭代第一 bootstrap N=1,000,top-4 CI overlap<10%

附录 K:扫描仪与采集参数总表

机型 厂商 主要部署
SOMATOM Force SIEMENS 埃及为主
SOMATOM Sensation 64 SIEMENS 埃及为主
uCT780 United Imaging 中国
Discovery CT750 HD GE 中国/外部
Revolution EVO GE 中国/外部
Optima GE Healthcare 中国/外部
Prime Aquilion Toshiba —
BrightSpeed CT GE —

参数区间:100-120 kVp;层厚 0.63-1.56 mm(训练 0.97±0.19);面内 0.54-1.19 mm(0.832±0.10);512×512;软组织/混合重建核。期相时点:动脉 35-45 s(bolus tracking)、门脉 65-70 s、延迟门脉后 3 min。埃及对比剂 Omnipaque/Telebrix 混用。厂商效应:西门子平台(埃及)平扫噪声底高于 United Imaging/GE。

附录 L:中心异质性统计表

参数 埃及 中国 外部 组间检验
面内分辨率(mm) 0.862±0.095 0.766±0.063 0.686±0.072 8/9 组 p<0.006(BH-FDR q=0.05)
层数深度 578±137 — 240±69 差 >2 倍(覆盖协议不同)
Task 1 Dice 组间 — — — p>0.20 不显著(队伍级分数 n=6-7,功效有限)
两个 ASSD 名义显著 China vs Ext / Egypt vs Ext — — 未过 FDR,论文注明
平扫噪声底 西门子平台较高 United Imaging/GE 较低 同中国 影响平扫对比度

解读纪律:采集差异显著 + 分割成绩不显著=当前方法对静脉期采集异质性鲁棒;但这不能外推到平扫(埃及 combined 各队均值仅 0.295)。

附录 M:与库内条目关系声明

本条目(trials)与 12 条库内互链的关系分三类:上游依赖(lits=81:预标算法训练集+4 队预训练+MIC 预训练池成员;amos=76、chaos=337、sliver07=347:IMR 队预训练四件套的成员)——这些条目的规模/许可细节影响 TriALS 复现成本;同域互补(atlas-liver-tumor=431、3dircadb=357、cadis=243:肝病灶/三期 CT 的类型与结构维度补充)——TriALS 无病灶类型标注的缺口由它们部分补位;方法生态(flare=387:同源挑战赛方法论 rank-then-aggregate/Synapse/Docker;btcv=377、word=412、abdomenct-1k=402、totalsegmentator=422:腹部 CT 多器官生态,级联方案预训练候选)。互链算法按 category_tags(医学影像/CT/医学图像分割/挑战赛数据集/评测基准/肿瘤学)计算相关度。

附录 N:肝病变/肝分割公开数据集景观对照

数据集 期相 规模 病灶级标注 平扫推理赛道 人类基线 多中心
LiTS(库内 81) 增强为主 201+130 ✓(肝+肿瘤) ✗ ✗ ✓
CHAOS(库内 337) 平扫+MRI CT 40 ✗(仅全肝) 部分 ✗ ✗
AMOS(库内 76) 混合 500 ✗(多器官) 部分 ✗ ✓
3D-IRCADb(库内 357) 三期(部分) 20 ✓(+血管) ✗ ✗ ✗
SLIVER07(库内 347) 增强 20+10 测 ✗(仅肝) ✗ ✗ ✗
TriALS(本条目) 四期 150(600 vol) ✓×5 套/例 ✓(唯一) ✓(n=16 双盲) ✓(3 中心)

附录 O:许可条款细读(三件资产+embargo)

  1. 数据本体(HF marwankefah/TriALS):CC BY-NC-4.0——署名+非商业。衍生模型权重是否构成"衍生品"存在解释空间;商用(含商业产品内嵌、商业服务训练)须另行授权;再分发需同条款+署名。gated 表单是发放前置而非许可本身。
  2. Zenodo 提案(15087645):CC BY-4.0——但本体是提案 PDF,可自由引用提案文档,不代表数据许可。
  3. 论文(arXiv 2605.16572):CC BY 4.0——文本可自由引用/再分发(署名)。
  4. 外部测试集标签:embargo(贡献机构数据共享协议)——非许可条款而是访问限制,验证用途经通讯作者申请。
  5. 代码/权重(GitHub xmed-lab/TriALS):随 repo 许可(使用前以 repo LICENSE 文件为准)。

附录 P:gated 申请要点(供参考模板结构)

  1. 身份字段:全名、机构邮箱(建议机构域名邮箱提高通过率)、机构名、国家、角色(研究员/学生/工程师);
  2. 用途声明:勾选非商业用途;建议附一句话研究描述(如"肝病变分割方法研究,学术发表");
  3. 引用规范:获批使用后在成果中引用 arXiv:2605.16572 与 HF repo;
  4. 红线:不得转售/商用/未署名再分发;CC BY-NC-4.0 条款随数据生效;
  5. 若需外部测试标签:另邮件通讯作者(论文 Data Availability 口径),说明验证目的与范围。

附录 Q:坑点档案(与 §10 对照)

坑 一句话 严重度
1 Zenodo DOI 是提案 PDF 不是数据 高(引用链断裂)
2 三件资产三套许可(NC/BY/BY) 高(合规风险)
3 Synapse ID 双口径(53285416/65878273) 中(溯源混乱)
4 机构误写(爱资哈尔≠艾因夏姆斯)+标题丢 Benchmark 中
5 visible/combined 不可横比 高(数字误读)
6 VoxTell 数据优势(权重含训练数据) 中(对比失真)
7 0.742 双重身份(人类基线=2024 冠军分) 中(撞车混淆)
8 外部集标签 embargo、影像可得性待核 高(复现受阻)

附录 R:检索决策树

检索 TriALS 相关主题
├─ 找数据集本体 → HF marwankefah/TriALS(gated)
├─ 找方法/结果 → arXiv 2605.16572(HTML 全文可抓)
├─ 找赛事信息 → MICCAI 2025 官网 challenges 页(syn65878273)
│                或论文 Methods(syn53285416)——口径任选其一
├─ 找提案背景 → Zenodo 15087645(提案 PDF)
├─ "trials" 撞临床注册库 → 加 "liver" / "non-contrast CT" 限定
│   (库内相邻 slug: clinicaltrials-gov, rid 556)
└─ 找库内上游/互补 → §9.1 十二条 rid 图谱

附录 S:双口径与数字巧合登记表

项 口径 A 口径 B 处理
Synapse ID 论文 syn53285416 官网 syn65878273 正文以论文为主,官网注
Zenodo DOI concept 15087645 version 15087646 引用任一均可,注明概念/版本
标题 正式版含 “Benchmark” 简写常省略 全文按正式版
埃及机构 Ain Shams(论文) Al-Azhar(OpenAIRE 误写) 按论文
0.742 2025 inter-reader 静脉期 2024 MIC 埃及 Task 1 分 上下文区分(坑 7)
visible 0.553/0.552 2024/2025 跨年对比 — 停滞非退化
license 数据 cc-by-nc-4.0 提案/论文 cc-by-4.0 逐件标注(坑 2)
MultiTalent 预训练 2024 版 30 数据集 2025 版 86 数据集 语境区分

附录 T:维护计划与触发点

触发点 动作
HF gated 表单字段/条款变更 复核 §7.2 与附录 P
外部测试标签解禁或发放流程公开 更新坑 8、§7.1、附录 D
MICCAI 2026 及后续届次(三洲扩展/交互式赛道) 新条目或本条目增补
论文正式期刊发表(若高于 arXiv 版本) 更新 §2 论文口径与引用
top-ranked 权重发布位置变化 复核 §7.1 资产表
Zenodo 记录更新(提案之外的文件) 复核坑 1 结论
库内新增肝病变相关条目 复核 §9 家族图谱

附录 U:rank-then-aggregate 计算示例(教学)

设三队(A/B/C)在某中心的 Task 2 combined 上只有 6 项指标(检测导向),以两指标示意:

队 per-case Dice P@IoU>0.5 Dice 排名 P 排名 均值 榜位
A 0.50 0.60 2 2 2.0 2
B 0.55 0.45 1 3 2.0 2
C 0.48 0.65 3 1 2.0 2

(三队并列情形说明"均值"可能同分——真实榜以全部 6 指标与更多队伍打破平局。)要点:单项爆表(B 的 Dice 第一、C 的 P 第一)不保证总榜第一,rank-then-aggregate 奖励均衡;漏交队伍按最差值(Dice=0、距离=9,001)参与排名,等效垫底。真实规则见论文 Methods(Ranking methodology)。

附录 V:来源清单与抓取记录

来源 URL 抓取方式 时点
arXiv 论文 abs/HTML https://arxiv.org/abs/2605.16572 、https://arxiv.org/html/2605.16572v1 curl+UA(674KB HTML 转纯文本) 2026-09-27
Zenodo API https://zenodo.org/api/records/15087645 WebFetch(curl 直连被沙箱拦截) 2026-09-27
HF 元数据/文件树 https://huggingface.co/api/datasets/marwankefah/TriALS(及 /tree/main?recursive=true,经 hf-mirror 端点) curl(API 端点) 2026-09-27
GitHub https://github.com/xmed-lab/TriALS 论文转引+库内检索 2026-09-27
MICCAI 2025 官网 challenges 页 官网 challenges 列表 WebSearch 间接 2026-09-27
Synapse syn53285416(论文)/syn65878273(官网) 论文转引(Synapse 需 JS 无法直抓) 2026-09-27

附录 W:BibTeX 引用模板

@misc{trialls2026,
  title         = {TriALS: Triphasic-Aided Liver Lesion Segmentation Benchmark
                   in Non-Contrast CT},
  author        = {Elbatel, Marwan and Ghonim, Mohamed and Mao, Jiaji and
                   Lin, Zhuosheng and Eckstein, Katharina and others},
  year          = {2026},
  eprint        = {2605.16572},
  archivePrefix = {arXiv},
  primaryClass  = {cs.CV},
  url           = {https://arxiv.org/abs/2605.16572},
  note          = {MICCAI 2025 Challenge; data:
                   https://huggingface.co/datasets/marwankefah/TriALS (CC BY-NC-4.0)}
}

注:作者列表为示意(前五作者+et al 结构),引用时以 arXiv 页面完整作者列表为准;如需引挑战赛提案另加 Zenodo DOI 10.5281/zenodo.15087645(勿与数据本体混引,坑 1)。

附录 X:两届参赛队伍全景表

队伍 机构(国家/地区) 届次 2024 埃及 Task 1
MIC DKFZ(德国) 2024+2025(唯一双届) 0.742
ViCOROB Universitat de Girona(西班牙) 2024 0.698
IMR 上海交通大学(中国) 2024 0.666
CEMRG Imperial College London(英国) 2024 0.576
PEDRETS Medical University of Innsbruck(奥地利) 2024 0.496
BIGR Erasmus MC(荷兰) 2024 0.547
Eagles NewGiza University(埃及) 2025 —
WoodyLoveAI National Yang Ming Chiao Tung University(台湾) 2025 —
PCLab-HIT Harbin Institute of Technology(中国) 2025 —
SlicenDice Universidade do Porto(葡萄牙) 2025 —
GenMI MBZUAI(阿联酋) 2025 —
CALADAN KNUST(加纳) 2025 —
MedAI Korea University(韩国) 2025 —

合计 13 独立队伍/14 方案。2024 排名据论文 Table 5(埃及测试集 Task 1 per-case Dice);2025 各队完整逐队分数见论文 Table 3/4(本条目按冠军口径登记,逐队引用请回原文)。地区跨度:欧洲 5、东亚 4(含台湾)、中东/北非 2、南亚东南亚之外非洲 1、伊比利亚 1——2025 版实现"跨三大洲"。

附录 Y:病灶尺寸分层结果与临床含义

病灶尺寸 Task 1(静脉)每 lesion F1 Task 2(平扫)每 lesion F1 临床含义
≥100 mm³ 未单列(整体主贡献区) 未单列 常规可检出区
<100 mm³ <0.35 <0.15(几乎检不出) 小转移灶检出=分期与治疗决策的关键盲区

机理:部分容积效应(<100 mm³ ≈ 直径 <5.8 mm 球体,接近层厚分辨能力)+平扫病灶-实质低对比。数据端对应:标注纳入门槛 ≥3 mm 最大径(§2.5)——亚 3 mm 病灶不在真值内,任何基于 TriALS 的模型不可宣称可检出它们。论文展望的对应方向:纹理感知编码器、对比合成、交互式标注,均以突破小病灶平扫盲区为目标。

附录 Z:关键词与检索对照表

检索目标 推荐关键词组合 避免
数据集本体 “TriALS” + “liver” + “non-contrast CT” 裸 “trials”(撞临床注册库)
挑战赛成绩 “TriALS 2025” + “MICCAI” + “leaderboard” “TriALS challenge 2024”(预演版口径)
标注方法 “STAPLE” + “label fusion” + “multi-phase” + “liver” “annotation TriALS”(过泛)
感知壁垒论点 “visible paradigm” + “perceptual barrier” + “non-contrast” 只引 combined 数字(范式混淆)
配准工艺 “elastix” + “STAPLE” + “combined annotation” —
低资源叙事 “contrast agent shortage” + “liver” + “AI” —
库内检索 url_name=trials;标签:医学影像/CT/医学图像分割/挑战赛数据集/评测基准/肿瘤学 与 clinicaltrials-gov(556) 混淆

附录 AA:数据完整性自查清单(下载后)

  1. 文件总数 725、总大小约 36.67 GB(HF tree 口径,2026-09-27);
  2. imagesTr = 320 个 .nii.gz(80 例 × NC/ar/pv/del 四期);
  3. labelsTr = 400 个(80 例 × 四期标注+combined 五套);
  4. 抽查任一 volume:HU 原值(范围应含负值)、512×512、层厚落在 0.63-1.56 mm;
  5. 抽查任一例:combined 标注病灶数 ≥ 该例任一单期标注病灶数(融合"≥2 期可见"规则的自洽性检查);
  6. 确认无外部测试集影像/标签目录(有则异常,向作者反馈);
  7. 记录下载版本(lastModified 时间戳)以便成果可复现声明。

附录 AB:GitHub 基线动物园——LiTS 5-Fold 基准全表(xmed-lab/TriALS README,100 epoch)

挑战赛仓库为每款内置基线给出了统一协议(LiTS 5-fold、100 epoch、nnU-Net v2 训练器体系)的公开基准,是挑战赛前的方法选型公共参考系。全表转录如下(lesion=病灶级,liver=肝脏级;Dice/Jaccard 为百分比,RMSD 为 mm;括号内为 5-fold 标准差):

模型 Lesion Dice Lesion Jaccard Lesion RMSD Liver Dice Liver Jaccard Liver RMSD
nnUNet 2D 77.14 (±1.69) 64.05 (±2.19) 1.42 (±0.14) 95.30 (±0.96) 91.21 (±1.56) 9.24 (±1.33)
nnUNet 3D 76.29 (±2.98) 63.22 (±3.68) 1.60 (±0.24) 91.84 (±0.86) 85.45 (±1.29) 22.39 (±5.23)
SegResNet 76.15 (±1.36) 63.18 (±1.80) 1.93 (±0.74) 90.99 (±1.73) 83.97 (±2.86) 25.57 (±5.44)
SwinUNETR 74.21 (±1.92) 60.74 (±2.22) 1.86 (±0.39) 86.74 (±1.36) 77.24 (±1.73) 32.70 (±3.06)
U-Mamba (Bot) 77.31 (±2.34) 64.41 (±3.04) 1.74 (±0.42) 92.30 (±0.98) 86.12 (±1.60) 21.58 (±5.64)
LightM-UNet 76.77 (±1.58) 63.70 (±1.77) 1.97 (±0.71) 91.23 (±1.26) 84.37 (±1.89) 24.76 (±3.67)
MedNeXt-B (k5) 77.44 (±2.03) 64.57 (±2.67) 1.63 (±0.52) 93.60 (±1.25) 88.49 (±1.88) 17.28 (±3.45)
MedNeXt-L (k5) 77.85 (±2.79) 65.02 (±3.64) 1.48 (±0.30) 94.55 (±1.07) 90.00 (±1.77) 14.69 (±3.08)
SAMed-B 76.99 (±2.12) 63.84 (±2.62) 1.81 (±0.38) 94.24 (±0.49) 89.26 (±0.82) 20.79 (±4.70)
SAMed-H 78.60 (±1.56) 65.77 (±2.03) 1.50 (±0.15) 95.58 (±0.68) 91.65 (±1.14) 8.67 (±2.09)

另录:LiTS 5-fold 1000 epoch 加长赛(进行中)nnUNet 3D lesion Dice 79.57 (±1.33) / liver Dice 96.28 (±0.62)。三个读表要点:其一,2D 系在肝脏级大幅领先 3D 系(95.30 vs 91.84),与肝脏器官级分割"切片内信息足量"的常识一致;其二,Mamba 系(U-Mamba 77.31)与 MedNeXt 系(77.44/77.85)在病灶级追平甚至超过 nnUNet 同 epoch 配置,但 liver 级落后——架构创新的红利集中在病灶判别而非器官边界;其三,SAMed-H(SAM 调优系)六项全榜第一,提示大规模预训练底座的迁移价值——这也为冠军 MIC 走 MultiTalent 86 数据集预训练路线提供了仓库内的旁证。使用提醒:此表是 LiTS(增强期) 上的基线,不可与 TriALS 平扫/静脉期成绩直接混排。

附录 AC:平台统计与版本时间戳登记(抓取时点 2026-09-27)

平台 关键标识 时间戳/统计
Zenodo concept 10.5281/zenodo.15087645 / version 10.5281/zenodo.15087646 发布 2025-03-26(created 07:58:59 UTC);v1 唯一版本;635 downloads / 481 views / 549 unique downloads
Zenodo 文件 242-Triphasic-aided_…_2025-03-17T09-44-40.pdf 105,980 字节;md5 b25475af92665aaa5f96fb875fc3821a
HuggingFace marwankefah/TriALS created 2026-04-12 / lastModified 2026-09-23;456 downloads / 2 likes;gated;元数据 cc-by-nc-4.0
GitHub xmed-lab/TriALS 初始提交 2024-04-04;README 最后更新 2026-05-19;nnunv2 task2 dataset_conversion 2024-09-05;eval_scripts 最近提交 2025-08-04(检出计数语义修正)
arXiv 2605.16572v1 2026-05-15 19:23:35 UTC 提交;2,578 KB;cs.CV
Synapse syn53285416(2024 版)/ syn65878273(2025 版) 2024:2024-04-04 预注册、2024-08-08 开放提交;2025:数据页 wiki/631558
MICCAI 官网 conferences.miccai.org/2025 challenges 页 TriALS 2025 = Sept. 27 半日(H),Standard Challenges 板块

登记说明:以上时间戳与统计数为"抓取时点快照",平台计数(downloads/views/likes)会持续漂移,引用时应注明查询日期;Zenodo 文件 md5 与 arXiv 提交时刻为不变量,适合写入可复现性声明。GitHub commit 粒度信息来自仓库公开提交历史,其中 2025-08-04 的评估脚本提交(“Start counting detected lesions from zero…”)与论文所述"检出病灶从零计数、足够重叠才累加"的评估语义对应,是复现官方数字时必须对齐的代码版本锚点。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • toothfairy2 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • curvas — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • toothfairy3 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • stsr — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • segrap — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • kits23 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • kits — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • lits — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • flare — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • autopet-v — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集