信息速览
INFOBOX — TriALS 一屏速览
维度 内容 本质 首个非对比增强 CT(NCCT)肝病变分割多中心基准:MICCAI 2025 官方挑战赛 + 数据集 + 论文三件套 核心范式 推理目标只用平扫,但 ground truth 由三期增强(动脉/门脉/延迟)标注辅助构建(Triphasic-Aided 的含义) 动机 对比剂短缺(成本/供应链)是非洲亚洲大量医院的现实——埃及队列 Omnipaque/Telebrix 混用即为其缩影 数据 150 例 × 4 期 = 600 volumes;训练 80(埃及 60+中国 20)+ 测试 70(埃及 28/中国 17/外部 25);每例 5 套标注 标注 两阶段人机混合(LiTS 算法预标 → 10 标注员 3D Slicer 复核 → 双人复核 → 顾问裁决)+ combined 四步流水线(elastix→STAPLE→顾问 QA) 人类基线 静脉期 inter-reader Dice 0.742;NCCT 仅 0.574(precision 0.333)——放射科医生自己在一期平扫上三分之二的病灶互相不认 冠军 Team MIC(DKFZ):nnU-Net ResEnc-L + MultiTalent 86 公开数据集预训练,Task 1 三中心全第一(0.791/0.721/0.750,均值 0.754) 核心发现 平扫感知壁垒:combined 0.429→0.471 可靠知识迁移提升,visible 0.553→0.552 停滞——预训练规模换不来平扫感知力 小病灶硬墙 <100 mm³ 病灶 Task 2 每 lesion F1<0.15,全部提交几乎检不出 评估 rank-then-aggregate;Task 1/visible 用 11 指标,combined 仅 6 检测导向指标(表面距离罚分 9,001) 对比模型 超 PASTA +28.2%/VoxTell +9.8%(外部 NCCT 绝对 Dice);VoxTell 权重含 TriALS 训练数据(数据优势存照) 获取 HF marwankefah/TriALS:gated + CC BY-NC-4.0(725 文件/36.67 GB);外部标签 embargo;代码与冠军权重公开(GitHub)许可 数据 CC BY-NC-4.0|Zenodo 提案 CC BY-4.0|论文 CC BY 4.0——三件资产三套规则,别混 库内互链 lits(81,上游预标/预训练)、amos(76)/chaos(337)/sliver07(347,参赛队预训练)、atlas-liver-tumor(431)/3dircadb(357)/cadis(243,同域)、flare(387)/btcv(377)/word(412)/abdomenct-1k(402)/totalsegmentator(422,方法生态)
TriALS 是一个"让 AI 在没有对比剂的 CT 上找肝病灶"的基准:150 例患者每人扫了平扫、动脉、门脉、延迟四期 CT,算法的任务是在平扫上把肝病灶找出来并勾画——但真值标注不是在平扫上画的,而是先在对比最清楚的增强期上勾好,再用配准和标签融合把三期信息"折算"回平扫坐标系。这项设计直指一个被主流医学影像基准长期忽略的场景:非洲与亚洲大量医院因对比剂成本或供应链问题根本不做增强 CT,而现有模型几乎全部在增强数据上训练与验证。挑战赛的结果同样有信息量——冠军在静脉期达到了人类水平(0.791,超过 inter-reader 均值 4.9%),但在平扫上人类自己互认精度只有 0.574、病灶级精度仅 0.333,两届比赛下来"平扫可见病灶"的检出分数纹丝不动(0.553→0.552):预训练数据从 30 个公开集扩到 86 个,也换不来对平扫固有特征的感知力。
导语读法三则:
- 只想下数据:直奔 §7 获取与许可——注意 HF 是 gated 仓库且 CC BY-NC-4.0,外部测试集标签 embargo,Zenodo 上那个 DOI 只是提案 PDF。
- 关心挑战赛设计:直奔 §5 双范式与评估协议——visible/combined 两个 paradigm 的分数不可直接横比,combined 排名刻意排除了表面距离指标。
- 关心结果解读:直奔 §6 结果与发现——MIC 三中心全第一的数字、平扫感知壁垒的跨年证据、与 PASTA/VoxTell 对比的口径(VoxTell 有数据优势)。
§0 导读:这个数据集解决什么问题
对比剂(碘造影剂)是腹部 CT 诊断肝病变的标配:动脉期看富血供病灶、门脉期看静脉侵犯、延迟期看廓清模式。但注射对比剂需要静脉通路、碘剂过敏筛查、肾功能评估,还有每一支的真实成本与供应链——在撒哈拉以南非洲、南亚以及本文数据来源地埃及的基层医院,"只做平扫"不是临床选择而是资源约束。问题的荒谬之处在于:几乎所有公开的肝病变分割数据集(LiTS、CHAOS、AMOS……)都以增强期为主战场,模型在这种数据上刷出的高分,对一个只能提供平扫的医院毫无意义——文献里甚至没有一个是专门为"平扫肝病变分割"设计的多中心基准。
TriALS 的回答是一个四件套设计。第一件是数据:150 例患者、每例完整四期、8 款扫描仪 3 厂商、埃及与中国两所医院采集加第三所医院做外部测试,病灶谱覆盖肝细胞癌、转移瘤、胆管细胞癌与良性病变。第二件是标注范式:真值由两阶段人机混合流水线产出(LiTS 训练的算法预标 + 10 名放射科住院医师用 3D Slicer 复核修正 + 双人复核 + 资深顾问裁决),并在此基础上用 elastix 配准加 STAPLE 融合把四期标注合成一份"combined 标注"配准到平扫坐标系——它包含平扫上根本看不见的病灶。第三件是双范式评估:visible paradigm 只考"平扫可见病灶",combined paradigm 考"完整病灶负担",两者的分差直接量化隐性病灶的负担。第四件是人类基线:两名腹部放射科医生对 16 例双盲重标,得出静脉期 0.742、平扫 0.574 的 inter-reader 天花板——用与算法完全同口径的计量方式。
§0 读法三则:
- 这个条目是"数据集+挑战赛+方法论文"三合一:本体是 HF 上 36.67 GB 的 gated NIfTI 包,赛事记录是两届排行榜与 14 份技术方案,论文(arXiv:2605.16572)把三者串成完整的可复现叙事——三者许可各不相同(§7)。
- 全文统计数字均出自论文正文与表格(arXiv HTML 全文抓取时点 2026-09-27),关键数字在附录 C 有逐项来源索引;双口径与数字巧合已在 §10 与附录 S 存照。
- 检索时若拿 Zenodo DOI(10.5281/zenodo.15087645)找数据会一无所获——那个记录只是挑战赛提案 PDF,数据本体在 HuggingFace(坑 1)。
§1 数据集速览:十问十答
Q1:TriALS 的"Triphasic-Aided"是什么意思?
字面是"三期辅助":算法的输入与推理目标都是非对比平扫 CT,但标注真值借助动脉、门脉、延迟三个增强期的标注信息构建——增强期上病灶看得最清楚,把那里勾好的病灶"传导"回平扫,就得到一份包含平扫不可见病灶的完整真值。这也是 combined paradigm 的哲学:算法要预测的不是"你看见什么",而是"这里应该有什么"。
Q2:数据规模和划分?
150 例患者 × 4 期 = 600 volumes。训练 80 例(埃及 60 + 中国 20),测试 70 例分三个中心:埃及内部 28、中国内部 17、外部 25(南方医科大学南方医院,训练与内部测试都不含该机构)。每例 5 套标注:四期各自一套 + 一份配准到平扫坐标系的 combined 标注。测试标签在最终提交截止前保密。
Q3:图像是什么格式,做过预处理吗?
NIfTI(从 DICOM 原样转换),HU 值保留,无重采样、无强度归一化——组织方刻意把预处理责任留给参赛者,因为"真实世界异质数据下的预处理策略"本身就是挑战的一部分。组织方提供基于 nnU-Net 默认的参考预处理(前景自适应强度归一化、各向异性感知重采样),可用可不用。
Q4:扫描仪和数据多样性如何?
8 款机型、3 厂商:SIEMENS SOMATOM Force、SIEMENS SOMATOM Sensation 64、United Imaging uCT780、GE Discovery CT750 HD、GE Revolution EVO、GE Healthcare Optima、Toshiba Prime Aquilion、GE BrightSpeed CT。层厚 0.63-1.56 mm,面内间距 0.54-1.19 mm,512×512 矩阵全腹覆盖。三中心采集参数差异统计显著(9 组比较 8 组 p<0.006),但 Task 1 分割成绩跨中心差异反而不显著——当前方法对采集异质性有一定鲁棒性。
Q5:谁标注的,怎么保证质量?
两阶段:第一阶段用 LiTS 训练的算法加小规模人工试点做预分割(仅加速、不直接作真值);第二阶段 10 名放射科住院医师/专科医师(≥1 年腹部影像经验)在 3D Slicer 里逐例复核修正,每例标注再经第二人复核,分歧升级到 >10 年经验的资深放射顾问裁决。combined 标注另有一道腹部放射顾问 QA。标注门槛:病灶跨 ≥2 连续切片(约 ≥3 mm 最大径)。
Q6:人类在平扫上表现如何?
两名腹部放射科医生对 16 例(静脉期与平扫各 16 例)双盲独立标注:静脉期 per-case Dice 0.742(precision 0.833/recall 0.946),平扫只有 0.574(precision 0.333/recall 0.769)——一名医生认出的病灶,三分之二被另一名医生在平扫上漏认。这个数字是同口径的"算法天花板":平扫肝病变检测连人类都远未解决。
Q7:冠军是谁,赢在哪?
Team MIC(德国癌症研究中心 DKFZ):nnU-Net ResEnc-L 骨干 + MultiTalent 86 个公开数据集大规模预训练 + 肝区裁剪 + bootstrap 模型选择。Task 1 静脉期三中心全第一(埃及 0.791/中国 0.721/外部 0.750,均值 0.754),无任何中心特异适配,静脉期成绩落入人类置信区间。14 份方案里 12 份用 nnU-Net——但排名的最强预测因子是多数据集预训练而非架构。
Q8:"感知壁垒"是什么发现?
跨年对比(同一埃及测试集,MIC 是唯一两届都参赛的队伍):Task 1 从 0.742 升到 0.791(预训练从 30 个数据集扩到 86 个),combined 从 0.429 升到 0.471——但 visible(只考平扫可见病灶)从 0.553 到 0.552,纹丝不动。多期监督能做"知识迁移"(把增强期学到的病灶位置推给平扫推理),但不能增强"感知能力"(从平扫固有特征认出病灶)。这条停滞曲线是论文最刺眼的发现。
Q9:我现在能拿到什么?
HuggingFace marwankefah/TriALS:训练数据+全部标注(含四期原始 volumes、各期标注、combined 标注),gated 仓库(填表单:姓名/机构/国家/角色+非商业勾选),CC BY-NC-4.0,实测 725 文件/36.67 GB。外部测试集标签 embargo(向通讯作者申请验证用途)。评估代码、Docker 基线与冠军方法预训练权重在 GitHub xmed-lab/TriALS 公开。
Q10:跟 LiTS 这类老牌肝数据集什么关系?
不是替代是互补:LiTS 等数据集主战场是增强期分割,TriALS 把"平扫"立为独立赛道并用多期信息给真值提纯。它同时深度依赖这条生态链——预标算法用 LiTS 训练,冠军用 MultiTalent(86 数据集)预训练,多支参赛队用 LiTS/SLIVER07/CHAOS/AMOS 预训练。库内 lits/amos/chaos/sliver07 四个条目是它的直接上游(§9)。
§2 数据构成与规格
2.1 规模、划分与三中心结构
TriALS 本体是 150 例患者的完整四期腹部 CT(平扫 NC、动脉 ar、门脉 pv、延迟 del),共 600 volumes。划分上呈"一个训练池 + 三个测试中心"结构:
| 划分 | 例数 | 构成 | 用途 |
|---|---|---|---|
| 训练集 | 80 | 埃及 60 + 中国 20 | 赛前发布(HF 公开) |
| 埃及内部测试 | 28 | 艾因夏姆斯大学医院 | 隐藏标签,终评解锁 |
| 中国内部测试 | 17 | 中山纪念医院 | 隐藏标签,终评解锁 |
| 外部测试 | 25 | 南方医科大学南方医院 | 隐藏标签且永久 embargo |
外部集的选取刻意避开训练与内部测试机构——南方医院不在训练数据来源之列,用于独立检验泛化能力,其伦理审批由贡献机构在当地完成。三中心设计让挑战赛能同时报告"域内性能"(埃及/中国)与"跨域性能"(外部),这也是最终结果表能拆出"埃及最难"这一结论的前提(§6.2)。
原始采集量更大:埃及 352 volumes、中国 148 volumes(合计 500 volumes = 125 例)通过初筛,加上外部 25 例得 150 例。入组标准为成人(≥18 岁)、完整四期、临床放射报告至少一个肝病灶、影像质量可接受;排除标准为显著伪影、门脉主干完全性血栓、Child-Pugh C 级肝硬化。这个入排设计使数据集的病灶谱贴合"腹部放射科日常"——HCC、肝转移瘤、肝内胆管细胞癌与良性病变都有代表。
2.2 采集协议与扫描仪多样性
| 参数 | 数值 |
|---|---|
| 扫描仪 | 8 款机型 / 3 厂商(SIEMENS×2、GE×4、United Imaging×1、Toshiba×1) |
| 管电压 | 100-120 kVp(电流调制至当地剂量参考水平) |
| 层厚 | 0.63-1.56 mm(训练集均值 0.97±0.19 mm) |
| 面内像素间距 | 0.54-1.19 mm(训练集均值 0.832±0.10 mm) |
| 矩阵 | 512×512,全腹覆盖 |
| 动脉期 | bolus tracking 降主动脉触发,约注射后 35-45 s |
| 门脉期 | 动脉期后约 20 s(注射后 65-70 s) |
| 延迟期 | 门脉期后 3 min |
| 重建核 | 软组织或混合核,无边缘增强核 |
| 多期一致性 | 各期尽量同层厚重建 |
8 款机型的完整清单:SIEMENS SOMATOM Force、SIEMENS SOMATOM Sensation 64、United Imaging uCT780、GE Discovery CT750 HD、GE Revolution EVO、GE Healthcare Optima、Toshiba Prime Aquilion、GE BrightSpeed CT。这个列表的价值在肝病变分割基准里少见——多数公开集要么单中心单机型,要么不披露机型构成,而 TriALS 把机型-中心对应关系写进了论文 Table 1,可做扫描仪效应分析。
一个真实世界的细节值得单独立段:埃及队列的对比剂不固定。因供应链限制,可及则用非离子型 Omnipaque,必要时用离子型 Telebrix。这不是数据的瑕疵而是数据动机的缩影——"对比剂短缺"在这份数据里不是引言里的修辞,而是采集记录里的字段。
2.3 中心异质性:显著但被鲁棒性部分吸收
三中心的采集差异是统计显著的:
| 参数 | 埃及 | 中国 | 外部(南方医院) |
|---|---|---|---|
| 面内分辨率(mm) | 0.862±0.095 | 0.766±0.063 | 0.686±0.072 |
| 层数深度(slices) | 578±137 | — | 240±69 |
层数深度差超过两倍(埃及 578 vs 外部 240),反映不同机构的扫描覆盖协议差异。9 组两两参数比较中 8 组 p<0.006(Mann-Whitney U,Benjamini-Hochberg FDR 校正 q=0.05;两个 ASSD 名义显著但未过 FDR,论文注明)。噪声底方面,西门子平台(埃及为主)平扫噪声高于中国与外部所用机型。
有意思的是结果端:尽管采集差异显著,Task 1 静脉期 Dice 的跨中心差异并不显著(p>0.20)——当前方法对增强期数据的采集异质性表现出相当的鲁棒性。论文同时自警:分割指标的中心比较用的是队伍级分数(n=6-7 队)而非逐例分数,统计功效有限,“不显著"应读作"证据不足"而非"等价”。另外没有任何参赛方法显式建模扫描仪厂商或中心身份——中心自适应(domain tokens、站点特异归一化层)仍是未开发的机会,平扫数据上尤其如此。
2.4 发布格式与预处理责任
数据以 NIfTI 分发(DICOM 原样转换),三个"没有"是刻意设计:没有重采样、没有强度归一化、没有裁剪——HU 原值直达用户。组织方的设计逻辑是:真实世界异质数据下的预处理策略(强度窗宽窗位、归一化、可选重采样)本身就是任务的一部分,统一预处理会把这层挑战抹掉。同时提供基于 nnU-Net 默认的参考预处理(前景自适应强度归一化、各向异性感知重采样)作为基线,参赛者自取。
对下游使用者,这意味着拿到数据的第一件事是自己写预处理管线——对 nnU-Net 用户这几乎零成本(框架自带),对自研管线团队则是一份额外的工程税。这也是把 TriALS 用作"现成训练集"和用作"方法学基准"的分水岭(§11.4)。
2.5 病灶谱与"无类型标注"的边界
数据集覆盖腹部放射科常见的肝病灶谱:肝细胞癌(HCC)、肝转移瘤、肝内胆管细胞癌、良性病变(血管瘤等)。但论文在局限一节明确自曝:没有病灶类型标注——每份掩码只回答"这里有个病灶",不回答"这是什么病灶"。意味着:
- 无法做病灶类型分层分析(如"HCC 与转移瘤的平扫可检测性差异");
- 训练出的模型是"泛病灶检测器",不能直接输出诊断类别;
- 需要类型感知下游任务(如 HCC 特异筛查)的团队要另找数据(库内 atlas-liver-tumor、3dircadb 可作互补,§9)。
病灶纳入的尺寸门槛:跨 ≥2 连续切片(按 1.25 mm 典型层厚约 ≥3 mm 最大径)——更小的病灶从标注端就被排除,这与 §6.3 的"<100 mm³ 几乎检不出"共同构成小病灶问题的两端。
2.6 与其他肝数据集的规格对照
| 数据集 | 期相 | 规模 | 标注 | 与 TriALS 的差异 |
|---|---|---|---|---|
| LiTS | 增强期为主(门脉) | 201 例 + 130 测试 | 全肝+肿瘤 | 无平扫赛道、无人类基线 |
| CHAOS | CT 平扫+MRI | CT 40 例 | 全肝(无病灶级) | 平扫但无病灶标注、无多中心 |
| AMOS | 平扫+增强混合 | 500 例(CT 300) | 多器官(肝整体) | 无病灶级肝病变标注 |
| 3D-IRCADb | 三期(部分例) | 20 例 | 肝/血管/病灶 | 规模极小、单中心 |
| TriALS | 四期+平扫推理目标 | 150 例/600 volumes | 病灶级×5 套+combined | 唯一为平扫分割设计的多中心基准 |
这张表回答一个常见误问:“平扫肝图像不是 CHAOS 里就有吗?”——CHAOS 的平扫只有全肝轮廓,没有病灶级标注;TriALS 是第一个把"平扫+病灶级标注+多中心+人类基线"四要素凑齐的公开资源。
2.7 四期的临床语义:为什么四个期相都要标注
TriALS 要求每例完整四期才入组,这个设计值得展开——每个期相在肝病变诊断里有不可替代的角色,也正是"三期辅助标注"的知识来源:
| 期相 | 采集时点 | 临床观察目标 | 对标注的价值 |
|---|---|---|---|
| 平扫(NC) | 注药前 | 出血/钙化/脂肪变/基础密度 | 推理目标模态;标注最难(对比度低) |
| 动脉期 | 注药后约 35-45 s(bolus tracking 降主动脉触发) | 富血供病灶(典型 HCC 快进快出强化) | HCC 类病灶最显著的显示窗 |
| 门脉期 | 注药后约 65-70 s(动脉期后约 20 s) | 门脉侵犯、乏血供转移瘤、整体病灶轮廓 | 转移瘤检出与病灶边界最清晰的期相 |
| 延迟期 | 门脉期后 3 min | 廓清模式(鉴别 HCC 与血管瘤等) | 强化模式的消退信息,鉴别诊断关键 |
四个期相各标一套的直接收益是病灶最显著期选择有了数据支撑:标注流水线把病灶掩码"从最显著期传播到其他期"(§3.1),而哪期最显著本身就因病灶类型而异——HCC 在动脉期、转移瘤在门脉期。STAPLE 融合(§3.3)等于把四个期相的互补信息折算成一份共识。这也解释了为什么 combined 标注能包含平扫不可见病灶:每个病灶至少在某一个增强期"亮过"。
对使用者的推论:如果你只想用 TriALS 做增强期分割研究(不碰平扫任务),四期各自的标注也允许这么做——这是 5 套标注结构的另一个用途,虽然它不是本数据集的主赛道。
§3 标注流水线:两阶段人机混合与 combined 四步
3.1 阶段一:算法预标——明确不作真值
预分割由一个在 LiTS 与小规模内部试点人工标注上训练的自动算法生成,覆盖全部 volumes。关键工艺是非刚性配准:把对比期对齐到平扫坐标系后,病灶掩码从"最显著期"(病灶显示最清楚的期相)传播到其余期相。论文原文明确这些自动预测"served solely to accelerate the manual annotation workflow"——不直接作为 ground truth。这条边界划得很清楚:算法预标只负责把标注员的起点从"空白画布"变成"待修草稿",质量责任全部落在阶段二。
3.2 阶段二:10 名标注员 + 双人复核 + 顾问裁决
| 环节 | 配置 |
|---|---|
| 人员 | 10 名训练标注员(放射科住院医师/专科医师,≥1 年专注腹部影像经验) |
| 工具 | 3D Slicer |
| 培训 | 录制视频标准化演示 + 与腹部放射顾问的答疑会 |
| 修正对象 | 全部自动分割逐例复核修正 |
| 纳入门槛 | 病灶跨 ≥2 连续切片(约 ≥3 mm 最大径) |
| 复核 | 每例标注由第二标注员复核 |
| 升级机制 | 分歧升级至资深放射顾问(>10 年经验)共识裁决 |
| 特殊处理 | 模糊边界、单期可见病灶加 flag 附加复审 |
作者贡献声明里,标注协调由 Elbatel/Ghonim/Mao 负责,埃及标注主管为 A.Y.,14 名成员(Mo.G./K.O.N./Ma.E./M.D./A.M.A.S./Nou.E./Noh.E./A.Ab./Am.A./S.A.A./W.D./B.L./H.H./J.S.)执行病灶标注与跨期放射验证。这套"10 人+双人复核+顾问升级"的结构与放射科临床阅片的双签制度同构,标注质量的可追溯性优于单专家模式。
3.3 combined 标注:四步流水线
每例的第 5 套标注——配准到平扫坐标系的 combined 标注——由四步流水线产出(由 Elbatel 执行):
- 刚性配准:动脉、门脉、延迟期标注经 elastix 刚性配准对齐到平扫坐标系,校正呼吸运动与患者摆位差异;
- 非刚性精化:elastix 非刚性变换顺序精化(rigid→non-rigid),达到病灶边界的亚体素对齐;
- 标签融合:STAPLE 算法(SimpleITK 实现)融合四期单期标注生成概率共识——至少两期可见的病灶才纳入 combined 掩码;
- QA:腹部放射顾问逐例审核融合掩码是否完整表达跨期病灶负担,对照原始对比期图像纠正或剔除可见配准错误。
三重配准风险缓解(论文 Discussion 自述):肝区裁剪后配准(而非全腹)、顺序 rigid→non-rigid、STAPLE 融合过滤单期配准伪影加顾问人工验证。残余误差的承认也写得很坦白:跨期配准的空间不确定性会传导进真值边界——挑战赛的对策是在 combined paradigm 排名中排除全部表面距离指标(§5.4),让"配准噪声"不影响主要临床指标。
"至少两期可见"的纳入规则值得玩味:它既是质量阈值(单期独有病灶可能是伪影或配准失败),也是流行病学滤波(增强期上短暂的病灶强化模式被有意保留)。代价是只在单期一闪而过的真实病灶会被漏掉——这是流水线的已知边界。
3.4 每例 5 套标注的资产结构
| 标注 | 内容 | 对应文件模式 |
|---|---|---|
| 平扫标注 | 平扫上放射科可见的病灶 | labelsTr(NC 口径) |
| 动脉期标注 | 动脉期勾画的病灶 | labelsTr(ar 口径) |
| 门脉期标注 | 门脉期勾画的病灶 | labelsTr(pv 口径) |
| 延迟期标注 | 延迟期勾画的病灶 | labelsTr(del 口径) |
| combined 标注 | 四期融合、配准到平扫坐标系、含平扫不可见病灶 | labelsTr(combined 口径) |
HF 实测文件树与此吻合:imagesTr 320 个 NIfTI(80 例×4 期)、labelsTr 400 个(80 例×5 套)。这 5 套标注的可分离发布是 TriALS 对方法学社区的最大贡献之一——研究者可以自己复现或改良融合策略、研究跨期标注一致性、或设计新的"辅助范式",而不必从原始 DICOM 重走全流程。
3.5 与库内标注流水线的工艺对照
TriALS 的标注工艺放在库内数据集的流水线光谱上看,位置更清晰:
| 数据集 | 人员结构 | 工具 | 复核机制 | 与 TriALS 的差异 |
|---|---|---|---|---|
| TriALS | 算法预标+10 标注员(≥1 年腹部经验)+双复核+顾问裁决 | 3D Slicer | 双人+>10 年顾问升级 | 跨期配准+STAPLE 融合独有 |
| PANDA-PLUS(库内 panda-plus) | pre-med 学生初注+高年级复核+30 年专家终审 | QuPath | 专家逐腺体终审 | 单专家终审 vs TriALS 的委员会式升级 |
| Lizard/NuCLS 类 | 多机构多专家 | 各异 | 多数投票/共识 | 无算法预标加速层 |
| LiTS(库内 lits) | 早期半自动+人工 | — | 单轮 | 质量协议无公开细度可比 |
两个结构性观察:其一,TriALS 的"算法预标+人工全量复核"模式介于"纯人工"与"纯算法"之间,它对算法预标的定位(仅加速、不作真值)与当今半自动标注工业实践一致;其二,与 PANDA-PLUS 的"单专家终审"不同,TriALS 用"双人复核+顾问升级"的委员会结构换取分歧处理的可追溯性——代价是协调成本,收益是 §4.1 的人类基线可直接量化标注不确定性。
3.6 复现这条流水线需要什么
| 资源 | 需求 | 备注 |
|---|---|---|
| 标注团队 | 10 名放射科住院医师/专科医师 + 2 名双盲复核 + 1 名资深顾问 | 论文规模;小规模复现可等比缩减但双复核不可省 |
| 软件 | 3D Slicer(标注);elastix/SimpleElastix(配准);SimpleITK STAPLE(融合) | 全部开源 |
| 预标模型 | LiTS 训练的分割模型(可用 nnU-Net 在 LiTS 上自训替代) | 论文未发布预标模型本体 |
| 培训材料 | 录制视频标准化演示+答疑机制 | 论文提及机制未公开材料本体 |
| 伦理 | 机构伦理批件+去标识化流程 | 埃及侧 FWA 000017585 为范例 |
值得注意的是:HF 包发布了四期原始标注+combined 标注(§3.4),意味着融合阶段(步骤 3-4)可完全离线验证——研究者可以拿四期标注自己跑 STAPLE 与论文结果对照,不必重走标注阶段。这是 5 套标注全发布的方法学价值。
§4 人类基线:inter-reader 研究与双峰一致性
4.1 四期数字:对比剂把人类一致性抬高了 16.8%
两名腹部放射科医生对随机抽取的 16 例(静脉期 16 例 + 平扫 16 例,来自埃中合并队列)双盲独立标注,按与算法完全同口径的计量(未检出病灶计 FN、Dice=0;max volumetric overlap matching ≥10% IoU):
| 期相 | per-case Dice | 病灶级 precision | 病灶级 recall |
|---|---|---|---|
| 动脉期 | 0.784(四期最高) | — | — |
| 静脉期 | 0.742±0.443(n=16) | 0.833 | 0.946 |
| 延迟期 | 0.601 | — | — |
| 平扫(NCCT) | 0.574±0.490(n=16) | 0.333 | 0.769 |
静脉期与平扫之间 16.8% 的绝对差,就是"对比剂对人类的价值"的直接计量。论文对 n=16 与宽置信区间做了诚实的自警:bootstrap(N=10,000)给出人类天花板 95% CI [0.540, 0.934]——区间宽得说明这只能是"approximate reference range rather than a precise threshold"。
4.2 平扫 precision 0.333:三分之二的病灶互相不认
平扫上 precision 0.333、recall 0.769 的不对称含义直白:放射科医生 A 认出的平扫病灶,三分之二被医生 B 漏认(高假发现率视角)或反之。这是整篇论文的题眼之一——如果专家自己在一期平扫上都互相只见三分之一的病灶,那么:
- 平扫标注本身就有内在不确定性(谁画的是"真值"?);
- AI 辅助的价值锚点变了——论文原话:“即使不完美的自动辅助,也可能优于专家在平扫上 0.333 的病灶级精度”;
- combined 标注范式的必要性成立——平扫单期标注不足以承载"完整病灶负担"这个临床目标。
4.3 双峰一致性:DSC≈1 或 DSC=0
inter-reader SD 大(0.443/0.490)的原因不是"勾画边缘不一致"而是可见性分歧:两人要么对病灶勾画完全一致(DSC≈1),要么对病灶是否存在完全分歧(DSC=0)——中间态罕见。这个双峰模式解释了两件事:其一,为什么人类天花板的置信区间那么宽(可见性分歧直接产生 0 分案例);其二,为什么平扫任务更像"检测问题"而非"分割问题"——难的不是边界,是"有没有"。
4.4 天花板的正确用法与两个警示
用法:0.742(静脉)与 0.574(平扫)是同口径经验上限——算法分数可与它们直接比,无需口径换算。冠军 MIC 静脉期 0.791 落入人类 CI [0.540, 0.934] 且超人类均值 4.9%,论文据此称其"consistent with human-level performance";平扫外部集最佳 0.651 已超 0.574 的人类天花板,但更难的埃及队列 0.471 仍低于天花板——平扫问题"not yet fully resolved"。
警示一:n=16 太小,天花板是参考线不是判决线。警示二:数字巧合——0.742 既是 2025 inter-reader 静脉期 Dice,也是 2024 版挑战赛 MIC 在埃及测试集的 Task 1 分数,两处含义完全不同,检索时极易撞车(坑 7,附录 S 有对照表)。
4.5 AI 辅助的价值锚点:0.333 的另一面
precision 0.333 常被读作"人类在平扫上很差",但论文给出了一个更实用的读法——它是 AI 辅助的价值下限:一个哪怕不完美的自动提示系统,只要能把放射科医生在平扫上漏掉的病灶"浮"出来供快速复核,就可能在真实工作流里优于两人独立阅片的互相漏认。论文原话:“Even imperfect automated assistance may improve on the 0.333 lesion-level precision that expert radiologists achieved when annotating non-contrast CT”。
这个论证有三个前提要同时成立,引用时应完整携带:
- 提示系统必须以"快速复核"为交互模式(human-in-the-loop),不是全自动诊断;
- 0.333 是病灶级 precision(不是 Dice),衡量的是"指认病灶"而非"勾画边界";
- 前提是该医院真的无法获得对比剂——否则门脉期阅片仍是更优路径。
这也让 TriALS 的临床叙事自洽:数据来自对比剂短缺的真实场景(埃及 Telebrix/Omnipaque 混用),人类基线暴露平扫阅片的互认缺口,combined 范式让模型提示"看不见的病灶",交互式分割作为落地路径——四件事在同一条逻辑链上。
4.6 用人类基线校准自己模型的正确姿势
| 你的模型 | 对照线 | 判读 |
|---|---|---|
| 静脉期分割,埃及测试 | 0.742(均值)/ CI [0.540, 0.934] | 进 CI=人类水平(MIC 0.791 即此);只超均值不算强 |
| 平扫 combined,外部集 | 0.574 | 超 0.574(如 0.651)=超人类平扫互认,可宣传"超人类"但注明是平扫 |
| 平扫 combined,埃及 | 0.574 | 未超(0.471)=问题未解决;埃及是更难考场,勿拿外部数字混写 |
| 平扫 visible,任何中心 | 无直接天花板上界 | visible 与 inter-reader 计量对象不同(visible 只含 NC 可见病灶),引用需谨慎 |
两个纪律:其一,人类基线是 n=16 的近似参考线(§4.1 自警),不要把"低于 0.574"当失败判决、把"高于"当成功保证;其二,对照时确认自己的分数是 per-case Dice 且同口径(漏检计 0),口径不同先换算再比。
§5 挑战赛设计:两届赛事、双范式与评估协议
5.1 两届赛事:2024 预演与 2025 正式版
TriALS 经历了两届赛事:
| 维度 | 2024 预演版 | 2025 正式版(MICCAI) |
|---|---|---|
| 测试集 | 仅埃及内部测试集 | 埃及 28 + 中国 17 + 外部 25 三中心 |
| 队伍 | 6 队(纯埃及机构圈) | 8 队参赛(新增跨三大洲 7 队) |
| 任务 | Task 1 + Task 2 | Task 1 + Task 2(双 paradigm 完整版) |
| 状态 | 预演/试点 | MICCAI 2025 官方挑战赛(2025-09-27,半天场) |
2024 版六队成绩(Task 1 per-case Dice,埃及测试集):MIC 0.742(DKFZ)、ViCOROB 0.698(Universitat de Girona)、IMR 0.666(上海交通大学)、CEMRG 0.576(Imperial College London)、BIGR 0.547(Erasmus MC)、PEDRETS 0.496(Innsbruck 医科大学)。2025 版新增:Eagles(NewGiza University,埃及)、WoodyLoveAI(NYCU,台湾)、PCLab-HIT(哈工大)、SlicenDice(Universidade do Porto,葡萄牙)、GenMI(MBZUAI,阿联酋)、CALADAN(KNUST,加纳)、MedAI(Korea University,韩国)。两届合计 13 支独立队伍、14 份方案(MIC 一队两届各一份)。
MIC 是唯一两届都参赛的队伍——论文据此强调跨年进步"reflects one team’s methodological refinement, specifically the expansion of pre-training from 30 to 86 public datasets, rather than a community-wide trend":这是单队迭代记录,不是社区趋势线。引用跨年数字时必须带上这个限定。
5.2 赛制与提交机制
- 平台:Synapse(论文口径 syn53285416;MICCAI 官网 challenges 页列 syn65878273——双口径,坑 3);
- 两阶段:开发期 2025 年 4-8 月(下载训练数据、验证集非正式反馈)→ 终评期 2025 年 9 月(Docker 容器提交);
- 标准化执行:组织方统一硬件 NVIDIA RTX 3090 24 GB / 128 GB RAM / 32 CPU cores 跑容器——把硬件变量从排行榜中剔除;
- 提交限额:每 task 最多 3 次验证提交 + 1 次最终提交;
- 组织方关联队伍可参赛但不得奖、不上公开榜。
四项公平保障(论文 Methods 逐条列出):测试标签由独立数据管理团队生成保管(含关联队伍在内无人可及);全部提交走同一自动化 Synapse 流水线无人工干预;关联队伍同限额;最终排名与论文分析在截止后才计算,无事后优化窗口。这套流程与 BIAS(Biomedical Image Analysis ChallengeS)报告指南一致执行——在"挑战赛可信度"维度,TriALS 的设计文档完备度是同类中的高位。
5.3 双范式:visible 与 combined 考的不是一场试
Task 2(平扫)设两个评估范式,考的是两种不同的能力:
| 范式 | 对照真值 | 考察能力 | 2025 最佳成绩(中/埃/外) |
|---|---|---|---|
| visible | 平扫单期标注(放射科平扫可见病灶) | 从平扫固有特征感知病灶 | 0.621 / 0.552 / 0.674 |
| combined | 多期融合标注(完整病灶负担,含平扫不可见病灶) | 预测平扫上看不见的病灶(知识迁移) | 0.586 / 0.471 / 0.651 |
visible 分数天然高于 combined(它只考"看得见的"),两者分差 Δ=0.023-0.080 直接量化各中心的隐性病灶负担——埃及 Δ=0.080 最大,与其小病灶、对比剂依赖病灶占比高一致。论文反复强调 combined paradigm 才是挑战赛的首要临床目标:一个平扫 AI 如果只会找"平扫上明显的病灶",它漏掉的那部分恰好是放射科医生最需要 AI 补位的隐性病灶。
由此推出本条目最重要的读数纪律:visible 0.552 与 combined 0.471 不是"同一件事的两个数字"而是两场考试——跨范式横比、跨论文乱引、拿 visible 分数冒充 combined 能力,都是高频错误(坑 5)。
5.4 指标套件与 9,001 罚分
指标计算用 medpy(空间重叠)+ 自定义 Surface 类(距离);预测与参考先做连通分量分解,再用 lesion-matching 算法配对(一个预测跨多个参考病灶时合并计)。
分割指标 6 项(按匹配病灶逐一计算再平均,含惩罚):
- DSC(per-case 与 global 两种数据集聚合口径);
- VOE = 1 − Jaccard;
- RVD(相对体积差,排名按绝对值);
- ASSD(平均对称表面距离);
- RMSD(均方根对称表面距离);
- MSD(最大对称表面距离 = Hausdorff)。
检测指标 2 组(数据集级 TP/FP/FN 聚合):Precision/Recall @ IoU>0.5(严格匹配)与 @ IoU>0(宽松定位,任何非零体素重叠即算)。
惩罚惯例:漏检的参考病灶与虚假预测按最差值计——Dice=0、Jaccard=0、VOE=1.0、四个距离指标=9,001。这个数字超过数据集内任何可能的真实表面距离,其设计意图写在论文里:“确保跳过病灶比产生不完美分割受罚更重”。对参赛者,这意味着"少报病灶"是最劣策略——这套激励结构与筛查场景(漏诊代价高)对齐。
5.5 rank-then-aggregate:三种排名口径
排名采用 rank-then-aggregate(遵循 Reinke et al. 的挑战赛方法论):每个指标单独排名(低好指标升序、高好指标降序、RVD 按绝对值),最终榜位=各指标平均排名——尺度不变,鼓励"各项都稳"而非"单项爆表"。
| 排名口径 | 使用指标 |
|---|---|
| Task 1(静脉期) | 全部 11 项 |
| Task 2 visible | 全部 11 项(visible 真值有明确空间参照,距离指标有意义) |
| Task 2 combined | 仅 6 项检测导向(per-case/global Dice、P/R@IoU>0.5、P/R@IoU>0)——排除全部表面距离与体积指标 |
| Task 2 最终榜 | visible 与 combined 两口径排名取平均 |
combined 排除距离指标的理由有二:其真值含平扫不可见病灶,边界精度的意义天然弱于检出完整性;更重要的是防配准噪声偏倚——combined 标注携带的跨期配准不确定性会污染距离类指标(§3.3)。漏交提交按最差值计(Dice=0、距离=9,001)。
5.6 统计与报告规范
- 组间比较:Mann-Whitney U(双侧,α=0.05);9 组中心两两比较经 Benjamini-Hochberg FDR 校正(q=0.05);
- 排名稳定性:per-case 分数 bootstrap 重采样 N=1,000 次重算排名——top-4 排名稳定(95% CI overlap <10%),MIC 在 Task 1 三中心的全部 bootstrap 迭代中恒第一,Task 2 多数迭代第一;
- 相关分析:Spearman ρ + bootstrap CI(1,000 次);
- 环境:Python 3.10 / NumPy 1.26 / SciPy 1.11 / scikit-learn 1.3 / Matplotlib 3.8;
- 报告规范:BIAS(Biomedical Image Analysis ChallengeS)指南 + Reinke et al. 指标选择建议。
5.7 赛制模板清单:办赛者可复用的七件套
TriALS 的赛制设计文档完整度足以作为模板,为未来办赛者提炼七件可复用件:
- 双范式考题:同一输入(平扫)配两套真值(visible/combined),一次赛事同时测两种能力,且分差本身成为科学产出(隐性病灶负担 Δ);
- Docker+统一硬件:提交容器、RTX 3090 24 GB/128 GB RAM/32 核统一执行——硬件变量出榜前被剔除;
- 限次提交:每 task 3 次验证+1 次终评——防测试集过拟合的最低成本手段;
- 独立标签保管:测试标签由独立数据管理团队生成保管,包括组织方关联队伍在内无人可及;
- 关联队伍规则:允许参赛(贡献分析)但不得奖不上榜(保公平);
- rank-then-aggregate+定向指标剔除:combined 排名剔除距离指标防配准噪声——"指标选择服务任务语义"的示范;
- 同口径人类基线:inter-reader 用与算法完全一致的计量(含 FN=0 罚),人类线与机器线可比。
这套件与 FLARE(库内 rid 387)代表的 Synapse 系挑战赛流程同源,TriALS 的增量在双范式与定向指标剔除两件。引用 BIAS 指南与 Reinke et al. 是其方法论背书。
§6 结果与发现:三中心全第一、感知壁垒与方法归因
6.1 Task 1:冠军达到人类水平
冠军 Team MIC(DKFZ)方法栈:nnU-Net ResEnc-L U-Net 骨干 + MultiTalent 86 个公开数据集预训练 + 肝区裁剪 + bootstrap 模型选择;外部训练数据含 LiTS、HCC、LiverMets、HCC-TACE、WAW-TACE;1050 epochs、Dice+CE 损失。
| 中心 | MIC per-case Dice | 备注 |
|---|---|---|
| 埃及内部(28 例) | 0.791 | 超人类 inter-reader 均值 4.9%,落入人类 CI [0.540, 0.934] |
| 中国内部(17 例) | 0.721 | |
| 外部南方医院(25 例) | 0.750 | 无中心特异适配 |
| 三中心均值 | 0.754 | 70 测试 volumes pooled median 0.83 |
MIC 三中心全第一且零中心特异适配;前三名聚集在 7% 以内,尾部队伍方差极大(埃及上单例 Dice 0.280-0.791)。Global Dice 一致高于 per-case Dice——大体敌人占满重叠指标、小病灶的失败被掩盖,这也是 dual 聚合口径并列报告的理由。14 份方案中 12 份用 nnU-Net 骨干、11 份用 Dice+CE 损失——架构高度收敛,但排名最强预测因子却是多数据集预训练(图 9a):训练策略与数据策划的贡献大于架构选择。
6.2 Task 2:平扫是另一场考试,埃及是最难的考场
| 范式 | 中国 | 埃及 | 外部 |
|---|---|---|---|
| combined 最佳 | 0.586 | 0.471 | 0.651 |
| visible 最佳 | 0.621 | 0.552 | 0.674 |
| combined 各队均值 | 0.449 | 0.295 | 0.511 |
combined 成绩比静脉期绝对下降 10-32%。埃及是最难中心:各队 combined 均值仅 0.295(中国 0.449、外部 0.511)——埃及队列的面内分辨率最低(0.862 mm)且小病灶占比高。外部集最佳 0.651 已超人类平扫天花板 0.574,但埃及 0.471 仍低于天花板——论文的判断是平扫挑战"not yet fully resolved"。没有任何队伍在 Task 2 做到全中心 precision、recall 双超 0.8——论文原文:“non-contrast liver lesion detection remains an open problem”。
6.3 小病灶硬墙:<100 mm³ 的 F1<0.15
按病灶体积分层的结论跨队伍一致:Task 1 中 <100 mm³ 病灶每 lesion F1<0.35;Task 2 中 F1<0.15——几乎全部提交都检不出。机理是双重叠加:部分容积效应(病灶小于层厚分辨能力)+ 病灶-实质低对比(平扫没有强化差)。这个发现的临床含义直接:早期小转移灶的检出恰恰最能改变分期与治疗决策,而它正是当前方法在平扫上的全面盲区。它与标注端的 ≥3 mm 纳入门槛(§2.5)共同划定了这份数据的"小病灶边界"——用 TriALS 训练的模型不应被宣称能检出亚 3 mm 病灶。
6.4 跨年对比:combined 在涨,visible 在停滞
同一埃及测试集、同一队伍(MIC)、两届赛事:
| 指标 | 2024 | 2025 | 变化 | 解释 |
|---|---|---|---|---|
| Task 1 per-case Dice | 0.742 | 0.791 | +4.9% | MultiTalent 预训练 30→86 数据集 |
| Task 2 combined | 0.429 | 0.471 | +4.2% | 多期监督的知识迁移有效 |
| Task 2 visible | 0.553 | 0.552 | −0.001 | 感知壁垒:停滞 |
这条不对称曲线是论文的核心发现:多期监督能做知识迁移(把增强期学到的病灶位置知识推给平扫推理,combined 涨),但不能增强感知能力(从平扫固有纹理特征认出病灶,visible 不动)。预训练从 30 个公开集扩到 86 个,visible 纹丝不动——论文结论:当前架构在平扫上撞到了感知壁垒,“scaling pre-training data alone cannot overcome”,需要质上不同的方法(纹理感知编码器、扩散式对比合成、交互式人机协同)。引用此表时注意两个限定:这是单队(MIC)迭代记录非社区趋势;visible 0.553 与 0.552 的"0.001 下降"不应读作退化(坑 5)。
6.5 与现成模型对比:PASTA 的泛化失败与 VoxTell 的数据优势
两个当代肝病变分割模型被拉到 TriALS 全部测试集上对标:PASTA(专为平扫设计、无 TriALS 微调)与 VoxTell(⚠️ 其 released weights 包含 TriALS 训练数据——与参赛队不在同一起跑线,引用对比数字必须注明,坑 6)。
| 场景 | TriALS 最佳超出 PASTA | 超出 VoxTell |
|---|---|---|
| 静脉期·埃及 | +9.1% | +14.1% |
| 静脉期·外部 | +23.7% | +6.4% |
| 平扫 combined·埃及 | +18.1% | +14.1% |
| 平扫 combined·外部 | +28.2% | +9.8% |
两个细节值得放大。其一,PASTA 的泛化失败模式:埃及 0.700 → 外部 0.513,疑似其训练分布与埃及测试数据重叠——“专为平扫设计"不等于"跨中心可迁移”。其二,PASTA 作为平扫特化模型,combined Dice 在全部中心仍 <0.37,远低于 TriALS 多期训练方案——为平扫而设计的方法,反而输给了"用增强期知识武装平扫推理"的方案,这正是 Triphasic-Aided 范式的最强证据。
6.6 方法归因与未开发机会
论文对排名驱动因素的解剖(图 9):多数据集预训练是最强预测因子;引入外部数据的队伍倾向更高 Dice(但有例外);ensemble 推理相对单模型无系统优势——训练策略 > 推理时聚合。三个"无人做"的空白被点名:医学分割基础模型的零样本泛化、中心自适应(domain tokens/站点特异归一化层)、非 nnU-Net 架构路线(14 份方案 12 份 nnU-Net,探索空间窄——论文建议未来设专门赛道激励架构多样性)。
临床部署的含义(论文 Discussion 的落点):对比剂受限场景的 AI 不能只在增强数据上验证(会高估真实性能、掩盖平扫特异失败模式);combined 范式在认识论上更接近"病灶预测"而非"边界勾画";交互式分割(几次点击/涂抹的 human-in-the-loop)可能是比全自动管线更现实的落地路径——“不完美的自动辅助也可能优于专家 0.333 的平扫精度”。
6.7 埃及为什么最难:三个机理解释
"埃及 combined 各队均值仅 0.295(中国 0.449、外部 0.511)"是结果表里最大的中心间落差,论文的采集数据给出三个互不排斥的机理:
- 分辨率劣势:埃及面内 0.862±0.095 mm,是三中心最粗——小病灶的部分容积效应最强;而埃及恰恰是小病灶、对比剂依赖病灶占比最高的队列(visible−combined 差 Δ=0.080 也是三中心最大);
- 噪声底更高:埃及主力机型(西门子 SOMATOM 系)平扫噪声底高于中国/外部所用的 United Imaging 与 GE 机型——平扫信噪比进一步压低可检测性;
- 深度协议差异:埃及层数深度 578±137 vs 外部 240±69(>2 倍)——覆盖协议不同意味着重建参数与剂量分布不同,跨中心分布差异最大。
但注意论文的统计自警:这些是采集参数显著的机理线索,Task 1 Dice 的中心差异在队伍级检验中并不显著(p>0.20、n=6-7 队功效有限)——“埃及最难"在 combined/visible 的平扫成绩上成立(0.295 vs 0.449/0.511 的差距远超噪声),但把它归因到单一采集因素尚无正式检验背书。引用时写"与采集异质性一致"而非"由 X 导致”。
6.8 六个 setting 的成绩矩阵:一张表读全 TriALS
把两届、双任务、双范式全部放平(均为同一埃及测试集可比部分;外部/中国仅 2025 版):
| Setting | 2024 最佳(MIC) | 2025 最佳(MIC) | 增量 | 读法 |
|---|---|---|---|---|
| Task 1 静脉期(埃及) | 0.742 | 0.791 | +4.9% | 预训练 30→86 数据集驱动 |
| Task 2 combined(埃及) | 0.429 | 0.471 | +4.2% | 知识迁移有效 |
| Task 2 visible(埃及) | 0.553 | 0.552 | −0.001 | 感知壁垒:停滞 |
| Task 1(中国) | — | 0.721 | — | 仅 2025 |
| Task 1(外部) | — | 0.750 | — | 仅 2025 |
| Task 2 combined(外部) | — | 0.651 | — | 超人类平扫天花板 |
这张矩阵的另一层信息是序关系:任何 setting 下都有静脉期 > visible > combined——对比剂信息量、病灶可见性、任务难度的三层结构在三中心全部成立。第三行(visible 停滞)与第一二行(稳步上涨)的正交性,是"知识迁移 ≠ 感知能力"的证据骨架。
§7 获取与许可:四件资产四套规则
7.1 资产清单与获取门
| 资产 | 位置 | 许可 | 门 |
|---|---|---|---|
| 数据本体(训练数据+全部标注) | HuggingFace marwankefah/TriALS |
CC BY-NC-4.0 | gated 表单(姓名/机构/国家/角色+非商业勾选) |
| 外部测试集标签 | 不公开 | embargo | 向通讯作者申请(验证用途) |
| 评估代码/Docker 基线/冠军权重 | GitHub xmed-lab/TriALS |
开源(随 repo) | 公开直链 |
| 挑战赛提案 PDF | Zenodo 10.5281/zenodo.15087645 | CC BY-4.0 | 公开直链 |
| 论文 | arXiv:2605.16572 | CC BY 4.0 | 公开直链 |
HF 实测(2026-09-27,经 hf-mirror API):725 文件、36.67 GB、downloads 456;仓库创建 2026-04-12、最后更新 2026-09-23——数据在挑战赛终评(2025.9)后约七个月、随论文阶段发布。文件树与论文口径互证:imagesTr 320 个(80 例×4 期)、labelsTr 400 个(80 例×5 套)。
7.2 gated 实操要点
- 访问
huggingface.co/datasets/marwankefah/TriALS登录后填 gated 表单:姓名、机构、国家、角色、非商业用途勾选; - 审批通过前 API 只返回元数据(license/tags/card 字段),不开放文件下载;
- 非商业是硬条款(CC BY-NC-4.0):商业训练、商业产品内嵌需另行联系作者——注意这与 Zenodo 提案、arXiv 论文的 CC BY-4.0 不同,别拿"论文是 CC BY"去推数据许可(坑 2);
- 大陆网络环境可走 hf-mirror.com 的 API 端点(
/api/datasets/marwankefah/TriALS与/api/datasets/marwankefah/TriALS/tree/main?recursive=true)查元数据与文件树,下载仍需 HF 账号过 gate; - 外部测试集(南方医院 25 例)标签不在包内(embargo),本地无法复现外部集成绩——需要外部验证数字时引论文或申请作者发放。
7.3 AI-Ready 评估:三轨结构与真实可得性
从"拿到数据到跑通第一个模型"的距离看:nnU-Net 用户距离最短——数据已是 NIfTI,框架自带预处理;自研管线用户需要自写强度归一化与重采样(§2.4 的"预处理责任转移");想复现挑战赛排名的团队还需 Docker 复刻 RTX 3090/128 GB 环境并从 GitHub 取评估代码。三轨中真正的长板是标注资产完整性(四期原始 volumes + 各期标注 + combined 标注全发布,可独立验证融合流水线),真正的短板是外部集不可复现(标签 embargo)——AI-Ready 光谱上属"训练侧全开放、测试侧半开放"的双轨结构。
7.4 与库内可获取性光谱的对照
| 光谱位置 | 库内示例 | TriALS 的位置 |
|---|---|---|
| 全开放直链 | 本库多数 Kaggle/公开 HF 集 | 代码与论文此档 |
| gated+宽松(自动过) | 部分医学 HF 集 | — |
| gated+表单审核 | 少数 | 数据本体在此档(NC + 表单) |
| 请求制(邮件作者) | PANDA-PLUS 掩码等 | 外部测试集标签此档 |
| 完全不公开 | — | 外部集影像的公开状态待核(§10 坑 8) |
§8 生态与影响
8.1 上游生态:一条清晰的预训练链
TriALS 深嵌在公开医学分割数据集的生态链里:
- 预标层:标注流水线第一阶段算法用 LiTS 训练;
- 参赛队预训练层:MIC 用 MultiTalent(86 公开数据集,2024 版为 30 个)+ LiTS/HCC/LiverMets/HCC-TACE/WAW-TACE;IMR 用 SLIVER07、LiTS、CHAOS、AMOS;ViCOROB/PEDRETS 用 LiTS 预训练;CEMRG 用 SSL(无外部数据);BIGR 从零训练;
- 对照模型层:PASTA、VoxTell 均为公开权重模型。
这条链的实证价值:冠军与尾部的最大差异不在架构(12/14 是 nnU-Net)而在预训练数据策划——公开数据集生态的"复利"在 TriALS 排行榜上被直接量化。
8.2 资助、认可与主办结构
- 资助:香港研究资助局 RGC T45-401/22-N;国家自然科学基金 NSFC 62306254、82001768;
- 认可:MICCAI Society SIG-AFRICAI 官方认可——非洲 AI 医疗兴趣组的背书与"低资源场景"动机一致;
- 主办结构:通讯作者 Elbatel(HKUST)构思设计并执行配准/融合/评估框架/排行榜;Ghonim(艾因夏姆斯)共同设计与埃及侧数据;Mao(中山纪念医院)与 Lin(南方医院)分别牵头中国训练侧与外部队列;Z.M. 与 R.S. 任挑战赛共同组织者;
- MICCAI 2025 挑战赛日 2025-09-27,半天场(H)。
8.3 在肝病变分割数据集景观中的位置
TriALS 填补的位置是"平扫 × 病灶级 × 多中心 × 人类基线"的四要素交集(§2.6 对照表)。它的差异化不靠规模(150 例在动辄上千例的时代偏小——论文自警"modest by modern standards")而靠三件事:唯一以平扫为推理目标的官方挑战赛、每例 5 套标注的跨期资产结构、与算法同口径计量的 inter-reader 天花板。它明确自己不是终点:论文展望三洲扩展(拉美/撒哈拉以南非洲/南亚)、纵向数据(治疗响应)、三期联用(病灶定性)、交互式赛道。
8.4 对低资源 AI 落地的直接指向
TriALS 的目标用户画像写在它的采集记录里:非洲与亚洲的基层医院(放射科无稳定对比剂供应)。它给出的落地论证链:平扫 AI 的对照系不是增强 AI 而是"没有 AI";人类专家平扫病灶级精度 0.333 意味着不完美的自动辅助也有正向价值;combined 范式让模型"提示放射科医生看不见的病灶"成为可能但必须诚实标注其"预测"属性。任何引用 TriALS 结果写落地叙事时,应带上"visible 停滞"这条反向证据——全自动平扫检测尚有硬墙,human-in-the-loop 是当前最现实路径。
8.5 负结果的公共价值:感知壁垒作为社区知识
数据集论文多数以正结果收尾,TriALS 的社区价值却有一半在负结果:visible 范式的停滞(0.553→0.552)宣告"扩大预训练"这条最顺手的技术路线在平扫感知上失效。这类结论对生态的作用方式:
- 止损:正在用"更大预训练+增强数据"攻平扫检测的团队,可以据此重新分配算力——论文点名了质上不同的替代方向(纹理感知编码器、扩散式对比合成、交互式人机协同);
- 设靶:壁垒本身就是新基准线——后续工作只需在 visible 范式上对比 0.552,进步可量化;
- 纠偏:结合"AI 不能只在增强数据上验证"的部署论证,为低资源场景的论文评审提供了现成的反例库——增强数据上的 SOTA 不能推导平扫性能。
引负结果时的两个限定(§5.1、坑 5):这是单队迭代记录非社区趋势;停滞的量度是 visible 排行榜分数,其方差与测试集规模(n=28)相关。负结果的可信度建立在这些限定被如实携带的前提上。
§9 与库内条目的关系
9.1 家族图谱(rid 已 SQL 查实,2026-09-27)
上游生态链(预标/预训练直接依赖):
- LiTS(rid 81):双重角色——TriALS 标注流水线预标算法的训练集;MIC/ViCOROB/PEDRETS/IMR 四支参赛队的预训练源。两库条目互读可拼出"肝病变分割的 LiTS 时代到平扫时代"的完整演进。
- AMOS(rid 76):IMR 队(上海交大)预训练源之一;腹部多器官跨期数据集,与 TriALS 共享"平扫+增强混合"的采集现实。
- CHAOS(rid 337):IMR 预训练源之一;也是"平扫 CT"数据的早期代表(但无病灶级标注,§2.6)——CHAOS 提供肝、TriALS 提供肝病灶。
- SLIVER07(rid 347):IMR 预训练源之一;肝分割挑战赛的早期经典,TriALS 与它共享"挑战赛方法论"的谱系。
同域肝病变数据集(互补视角):
- atlas-liver-tumor(rid 431):同域肝肿瘤标注资源,可补 TriALS 缺失的病灶类型维度线索(§2.5)。
- 3D-IRCADb(rid 357):三期 CT 小样本(20 例)经典,与 TriALS 共享"跨期配准"工艺难题但无挑战赛规模;其血管/病灶多结构标注与 TriALS 的单一病灶标注互补。
- CaDis(rid 243):腹部多器官+肿瘤分割,与 TriALS 在"多结构腹部标注"上相邻。
方法生态(挑战赛方法论与预训练候选):
- FLARE(rid 387):多器官分割挑战赛(同样的 rank-then-aggregate/Synapse/Docker 赛制同源),是理解 TriALS 赛制设计的库内对照条目。
- BTCV(rid 377)/WORD(rid 412)/AbdomenCT-1K(rid 402)/TotalSegmentator(rid 422):腹部 CT 生态的方法学与预训练候选池——TotalSegmentator 类大规模多器官模型是"先分割肝再找病灶"级联方案的天然上游。
9.2 检索路径建议
- 检索词组合:“TriALS”(精确)+ “non-contrast CT” / “liver lesion”;慎用泛化词 “trials”(撞车临床注册库 ClinicalTrials.gov——本库已有相邻 slug
clinicaltrials-gov,rid 556); - 找数据:HF
marwankefah/TriALS(gated)→ GitHubxmed-lab/TriALS(代码/权重)→ Zenodo(仅提案 PDF,坑 1); - 引结果:Task 1 三中心数字引论文 Table 3,Task 2 引 Table 4,跨年对比引 Table 5 并注明"单队迭代"限定(§5.1);
- 做平扫研究:先读 §4 人类基线(你的模型要不要跟 0.574 比,取决于你测哪个中心)。
§10 避坑清单:八个已踩过的坑
坑 1:Zenodo DOI 不是数据集 DOI。10.5281/zenodo.15087645 的记录本体是一份 105,980 字节的挑战赛提案 PDF(2025-03-26 发布,CC BY-4.0),不是数据。数据本体在 HuggingFace marwankefah/TriALS(gated)。大量二手引用把 Zenodo 当"数据集 DOI"转引,检索者循 DOI 只会拿到一份提案文档。
坑 2:三件资产三套许可,别一揽子引用。数据本体 CC BY-NC-4.0(HF gated,非商业硬条款)、Zenodo 提案 CC BY-4.0、arXiv 论文 CC BY 4.0。“论文开放许可"推不出"数据可商用”;商用训练/产品内嵌需另行联系作者。撰写引用时逐件标注。
坑 3:Synapse ID 双口径。论文 Methods 写 syn53285416;MICCAI 2025 官网 challenges 页列 syn65878273(疑为 2025 版新页面)。本条目正文以论文口径为主。两个 ID 都能搜到 TriALS 相关页面,引用时任选其一并注明口径,别混排在同一句里。
坑 4:机构与标题的常见误写。埃及侧机构是艾因夏姆斯大学(Ain Shams University),部分聚合源(如 OpenAIRE)误写为"爱资哈尔大学(Al-Azhar)"——两所开罗大学名 易混,以论文作者隶属为准。标题同理:正式标题是 “Triphasic-Aided Liver Lesion Segmentation Benchmark in Non-Contrast CT”,简写版常丢 “Benchmark”。
坑 5:visible 与 combined 不可横比。0.552(visible 埃及)与 0.471(combined 埃及)是两场考试的分数:前者只考平扫可见病灶,后者考含不可见病灶的完整负担。跨范式直比、拿 visible 分数冒充 combined 能力、把 0.553→0.552 读作"退化"(实为停滞,±0.001 在 n=28 的噪声内)都是高频错误。引用时必须带范式名。
坑 6:VoxTell 有数据优势。VoxTell 的 released weights 包含 TriALS 训练数据(论文原文承认),与参赛队"只给 80 例训练"不在同一起跑线;PASTA 则无 TriALS 微调。两行对比数字(+9.8% vs +28.2%)的含金量不同,转引时须注明口径,否则会高估/低估真实差距。
坑 7:0.742 的双重身份。0.742 既是 2025 论文 inter-reader 研究的静脉期人类一致性 Dice(n=16),也是 2024 版挑战赛 MIC 队在埃及测试集的 Task 1 分数。两处含义完全无关,检索/引用时务必核对上下文——这也是论文跨年对比表(0.742→0.791)读起来刺眼的原因:2024 的机器分数恰好等于 2025 的人类一致性。
坑 8:外部测试集的可见边界。外部集(南方医院 25 例)标签 embargo(贡献机构协议),HF 文件树实测亦未见外部集对应目录——外部集影像是否随 gated 包发布待注册后核实(本条目按"标签肯定不公开"撰写)。任何"本地复现外部集成绩"的计划都应预设受阻,先邮件作者。
§11 总结
11.1 三句话总结
- TriALS 把"平扫肝病变分割"立为独立基准:150 例四期 CT、三期辅助标注构建平扫真值、双范式评估,数据与全部标注在 HF gated(CC BY-NC-4.0)公开,代码与冠军权重在 GitHub 公开。
- 它的冠军(DKFZ/MIC)在静脉期达到人类水平(0.754 三中心均值、超人类均值 4.9%),靠的不是架构(12/14 都是 nnU-Net)而是 86 个公开数据集的预训练——公开数据生态的复利被排行榜直接量化。
- 它最有价值的产出是一个负结果:预训练翻倍扩张下,平扫可见病灶的检出纹丝不动(0.553→0.552)——"感知壁垒"宣告平扫检测无法靠增强数据的知识迁移解决,是低资源 AI 落地叙事里必须携带的反向证据。
11.2 适合谁
- 平扫/低资源场景的肝病变检测团队:唯一的平扫病灶级多中心基准+人类基线。
- 挑战赛方法论研究者:双范式、rank-then-aggregate、9,001 罚分、BIAS 规范执行的完整活样本。
- 多期标注/标签融合研究者:每例 5 套标注全发布,STAPLE 流水线可独立验证与改良。
- 需要跨期配准+融合教学案例的团队:elastix→STAPLE→QA 四步是可复用工艺。
11.3 不适合谁
- 需要病灶类型标签(HCC vs 转移瘤)的项目——数据集明确不含类型标注。
- 需要大训练集的团队——150 例偏小,论文自警测试集 17-28 例/中心。
- 需要本地复现外部集成绩的评测方——外部标签 embargo,只能引论文或申请作者。
- 商业用途——数据本体 CC BY-NC-4.0,商用需另行授权。
11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 立刻跑通第一个模型 | HF gated 申请 + GitHub Docker 基线 + nnU-Net 默认预处理 |
| 做平扫检测方法研究 | 读 §4 人类基线 → §6.4 感知壁垒 → 设计"质不同"的方法再入场 |
| 复现/改良标签融合 | §3.3 四步流水线 + HF 全标注资产(四期+combined 可独立验证) |
| 引用挑战赛结果 | Task 1 用 Table 3、Task 2 用 Table 4(带范式名)、跨年用 Table 5(带单队限定) |
| 对标现成模型 | §6.5 表 + 注明 VoxTell 数据优势(坑 6) |
| 写低资源 AI 叙事 | 引 0.333 人类平扫精度 + visible 停滞双证据,勿只引 combined 涨幅 |
| 要病灶类型信息 | 换/补库内 atlas-liver-tumor(431)、3dircadb(357) |
11.5 与相近条目/概念的区分速查
| 名称 | 是什么 | 与 TriALS 的关系 |
|---|---|---|
| LiTS(库内 81) | 增强期肝肿瘤分割老牌基准 | TriALS 的预标训练集与多队预训练源;增强期主战场不同 |
| CHAOS(库内 337) | 平扫 CT+MRI 腹部数据 | 有平扫但无病灶级标注——TriALS 补"平扫×病灶"空位 |
| FLARE(库内 387) | 多器官分割挑战赛 | 赛制同源(Synapse/rank-then-aggregate),任务域不同 |
| 3D-IRCADb(库内 357) | 三期 CT 小样本(20 例) | 同有跨期配准难题;规模与病灶谱差异大 |
| ClinicalTrials.gov(库内 556,slug 相邻) | 临床试验注册库 | 与 TriALS 无关;检索 “trials” 撞车项 |
| AMOS(库内 76) | 腹部多器官跨期 | IMR 队预训练源;无病灶级肝病变赛道 |
| atlas-liver-tumor(库内 431) | 肝肿瘤标注资源 | 补 TriALS 缺失的病灶类型维度 |
11.6 一分钟电梯陈述
TriALS 要回答的问题是:当医院做不起增强 CT 时,AI 还能在肝病变上帮上忙吗?它用 150 例四期 CT 构建了第一个为平扫设计的多中心基准——标注在增强期勾画、经配准与 STAPLE 融合折算回平扫,每例五套标注全发布;挑战赛按双范式评估(visible 考感知、combined 考预测),并配了同口径的人类基线(平扫互认精度仅 0.574、病灶级 0.333)。结果端两个结论同样重要:冠军(DKFZ)在静脉期达到人类水平,靠的是 86 个公开数据集的预训练而非架构;而预训练翻倍扩张下,平扫可见病灶的检出两年纹丝不动——感知壁垒是这条赛道当前最重要的公共知识。数据在 HF gated(CC BY-NC-4.0),代码与冠军权重在 GitHub,外部测试标签 embargo。
FAQ(高频问答 32 问)
A. 基础认知
Q1:TriALS 是什么?
MICCAI 2025 官方挑战赛 + 数据集 + 方法学论文的三件套,全称 Triphasic-Aided Liver Lesion Segmentation Benchmark in Non-Contrast CT。核心命题:算法只看平扫 CT,把肝病灶找出来——而真值由三期增强标注辅助构建。
Q2:为什么专门做"平扫"?
对比剂短缺是非洲、亚洲大量医院的现实(成本、供应链、碘过敏与肾功限制)。现有公开肝数据集几乎全以增强期为主,模型在增强数据上的高分对平扫-only 医院无意义。TriALS 数据本身也带着这个现实:埃及队列对比剂 Omnipaque/Telebrix 混用。
Q3:“Triphasic-Aided"到底"谁辅助谁”?
三期(动脉/门脉/延迟)辅助标注,不辅助推理:算法输入只有平扫;标注在增强期勾画最清楚,经配准与融合"折算"回平扫坐标系生成 combined 真值。
Q4:它是第一份平扫肝病变数据集吗?
不是第一份平扫(CHAOS 有平扫 CT),但是第一份多中心的"平扫肝病变分割"基准(论文自称 to our knowledge the first)——平扫+病灶级标注+多中心+人类基线四要素首次凑齐。
Q5:谁办的?
通讯作者 Marwan Elbatel(香港科技大学 HKUST)与 Mohamed Ghonim(埃及艾因夏姆斯大学)共同发起;中国侧由中山纪念医院与南方医院参与;MICCAI Society SIG-AFRICAI 官方认可;RGC 与 NSFC 资助。
B. 数据与获取
Q6:数据在哪下?多大?
HuggingFace marwankefah/TriALS,gated 仓库,实测 725 文件/36.67 GB。训练侧:imagesTr 320 个(80 例×4 期)+ labelsTr 400 个(80 例×5 套)。
Q7:gated 表单要填什么?
姓名、机构、国家、角色,加一项非商业用途勾选(数据 CC BY-NC-4.0)。审批通过后才能下载。
Q8:测试集也给我吗?
测试集影像与标签都在挑战赛时保密;终评后训练数据公开,但外部测试集(南方医院 25 例)标签永久 embargo(贡献机构数据协议),可向通讯作者申请验证用途。本地无法复现外部集成绩。
Q9:数据格式和预处理状态?
NIfTI(DICOM 原样转换),HU 原值,无重采样无归一化无裁剪。预处理责任在用户;组织方提供 nnU-Net 默认参考预处理。nnU-Net 用户几乎零成本,自研管线要自己写归一化与重采样。
Q10:扫描设备覆盖怎样?
8 款机型 3 厂商(SIEMENS×2、GE×4、United Imaging×1、Toshiba×1),层厚 0.63-1.56 mm、面内 0.54-1.19 mm、100-120 kVp、512×512 全腹。三中心参数差异统计显著但 Task 1 成绩跨中心差异不显著。
Q11:代码和冠军模型权重在哪?
GitHub xmed-lab/TriALS:评估代码、Docker 基线、脚本(eval_scripts 目录),top-ranked 方法预训练权重公开。
C. 标注与范式
Q12:每例为什么有 5 套标注?
四期各一套(各期勾画的病灶)+ 一份 combined(四期融合、配准到平扫坐标系)。5 套分开发布让研究者可复现/改良融合策略、研究跨期一致性。
Q13:combined 标注怎么来的?
四步:elastix 刚性配准→elastix 非刚性精化(亚体素)→STAPLE(SimpleITK)四期概率融合→腹部放射顾问逐例 QA。"至少两期可见"的病灶才纳入。
Q14:combined 里的"平扫不可见病灶"是什么意思?
增强期清楚显示但平扫上看不见(或看不出)的病灶——放射科医生凭平扫自己大概率漏掉的。combined paradigm 要求算法预测它们,这更像"病灶预测"而非"边界勾画"。
Q15:visible 与 combined 两个范式怎么选?
看你研究什么:visible 测"平扫感知"(认出看得见的),combined 测"完整负担预测"(挑战赛首要临床目标)。两者分数不可横比(坑 5)。
Q16:谁标注的?可靠吗?
LiTS 训练的算法预标(不作真值)→ 10 名放射科住院医师/专科医师(≥1 年腹部经验)3D Slicer 修正 → 双人复核 → >10 年顾问裁决 → combined 另有顾问 QA。病灶纳入门槛 ≥3 mm(跨 2 连续切片)。
D. 结果与统计
Q17:冠军是谁?分数多少?
Team MIC(DKFZ):nnU-Net ResEnc-L + MultiTalent 86 数据集预训练。Task 1 三中心全第一:埃及 0.791/中国 0.721/外部 0.750,均值 0.754;Task 2 combined 最佳 0.471(埃及)/0.586(中国)/0.651(外部)。
Q18:冠军达到人类水平了吗?
静脉期达到了:0.791 超人类 inter-reader 均值(0.742)4.9%,落入人类 95% CI [0.540, 0.934]。平扫没有全达标:外部 0.651 超 0.574 天花板,但埃及 0.471 仍低于它。
Q19:人类在平扫上什么水平?
两名腹部放射医生双盲标注 16 例:per-case Dice 0.574,病灶级 precision 仅 0.333——一人认出的病灶三分之二被另一人漏认。平扫检测连人类都远未解决。
Q20:"感知壁垒"是什么?
跨年(2024→2025,同队同测试集):combined 0.429→0.471 涨了,visible 0.553→0.552 没动——预训练从 30 个数据集扩到 86 个也无效。知识迁移有效、感知能力不涨,说明平扫检测需要质上不同的方法。
Q21:小病灶表现如何?
<100 mm³ 病灶 Task 1 每 lesion F1<0.35、Task 2 F1<0.15——几乎全部提交检不出。部分容积效应+平扫低对比双重叠加。数据端病灶纳入门槛 ≥3 mm,模型不应宣称能检亚 3 mm 病灶。
Q22:排名怎么算的?
rank-then-aggregate:11 项指标(Task 1/visible)或 6 项检测导向指标(combined)分别排名再取平均。漏检/虚报按最差值计(Dice=0、表面距离=9,001)。combined 排除距离指标是防配准噪声偏倚。
Q23:跟 PASTA/VoxTell 比怎么样?
平扫外部集 TriALS 最佳超 PASTA 28.2%、超 VoxTell 9.8%(绝对 Dice)。注意 VoxTell 权重含 TriALS 训练数据(数据优势);PASTA 埃及 0.700→外部 0.513 是典型泛化失败。
E. 许可与复用
Q24:我能商用吗?
数据本体 CC BY-NC-4.0——不能直接商用,需另行联系作者。Zenodo 提案与 arXiv 论文是 CC BY-4.0,但那不是数据许可(坑 2)。
Q25:我能用 TriALS 训练模型并发表吗?
学术用途可以(gated 表单+引用论文)。发布衍生模型时注意:数据 NC 条款对"模型权重是否算衍生品"存在解释空间,商用前向作者确认。
Q26:能和其他数据集混训吗?
可以且正是冠军打法(MultiTalent 86 数据集预训练)。混合时注意各数据集许可独立生效(LiTS 等各有口径),最终成果按最严格条款自查。
Q27:挑战赛提交方式还能复用吗?
赛制已结束但设计可复用:Docker 容器+标准化硬件(RTX 3090/128 GB/32 核)+限次提交+独立标签保管,这套流程文档完整,适合做新挑战赛模板。
F. 库内与工程细节
Q28:库内还有哪些相关条目?
上游:lits(81)、amos(76)、chaos(337)、sliver07(347);同域:atlas-liver-tumor(431)、3dircadb(357)、cadis(243);方法生态:flare(387)、btcv(377)、word(412)、abdomenct-1k(402)、totalsegmentator(422)。
Q29:TriALS 和 LiTS 什么关系?
三层:预标算法用 LiTS 训练;4 支参赛队用 LiTS 预训练;MIC 的 86 数据集预训练池也含 LiTS。LiTS 是增强期时代的主战场,TriALS 是平扫赛道。
Q30:为什么 slug 叫 trials?会不会撞车?
官方名 TriALS 取小写即 trials。库内已有相邻 slug clinicaltrials-gov(临床注册库,rid 556),检索"trials"会命中两域——本条目 title/keywords 均带 TriALS/liver 限定词区分。
Q31:预处理有什么推荐?
nnU-Net 默认(前景自适应强度归一化+各向异性感知重采样)即挑战赛参考基线。自研管线注意:HU 原值、层厚异质(0.63-1.56 mm)、埃及面内分辨率显著低于外部(0.862 vs 0.686 mm)——重采样策略对埃及小病灶成绩影响大。
Q32:想要病灶类型(HCC/转移瘤)怎么办?
TriALS 没有(论文局限自曝)。替代路径:库内 atlas-liver-tumor(431)、3dircadb(357) 有类型/结构维度;或等 TriALS 后续版本(论文展望病灶定性为未来方向)。
Q33:排行榜分数可信吗?
设计上可信度配置拉满:统一硬件执行、限次提交、独立标签保管、关联队伍不上榜、终评后才有排名、bootstrap 验证 top-4 稳定(CI overlap<10%)。剩余不确定性来自测试集规模(17-28 例/中心,CI 宽 0.13-0.27)——top 与尾部的差距可信,相邻队伍间的细微差距不可过度解读。
Q34:80 例训练集够不够用?
作为"从零训练监督数据"偏少;作为"预训练后微调集"是合理规模(冠军即 86 数据集预训练+微调打法)。论文对 150 例的定性是 “modest by modern standards”——它买的是标注质量与跨期结构,不是体量。
Q35:combined 标注能直接当平扫分割真值用吗?
能且这正是设计意图,但要清楚它的属性:含平扫不可见病灶(模型学的是"预测"而非"描摹")、携带跨期配准的残余误差(挑战赛为此在 combined 排名剔除距离指标)、"≥2 期可见"规则滤掉了单期短暂病灶。用于边界精度敏感的应用时要谨慎。
Q36:后续版本会有什么?
论文展望五项:三洲扩展(拉美/撒哈拉以南非洲/南亚)、纵向数据(治疗响应)、三期联用(病灶定性)、交互式分割赛道、激励架构多样性的专门赛道。均为论文表述的计划,无公开时间表——订阅 GitHub repo 跟踪。
事实清单(硬事实 36 条)
- 全称:TriALS——Triphasic-Aided Liver Lesion Segmentation Benchmark in Non-Contrast CT(arXiv 页眉口径)。
- arXiv 编号 2605.16572(v1,2026-05-15 提交),论文 license CC BY 4.0,65 名作者。
- Zenodo DOI 10.5281/zenodo.15087645(concept;version v1=15087646),发布 2025-03-26,本体为挑战赛提案 PDF(105,980 字节),license cc-by-4.0。
- HuggingFace
marwankefah/TriALS:gated,cc-by-nc-4.0,createdAt 2026-04-12,lastModified 2026-09-23,downloads 456(2026-09-27 抓取)。 - HF 实测 725 文件/36.67 GB;imagesTr 320(80 例×4 期)+ labelsTr 400(80 例×5 套)。
- GitHub
xmed-lab/TriALS:评估代码、Docker 基线、top-ranked 权重公开。 - 数据:150 例×4 期=600 volumes;每例 5 套标注。
- 埃及采集 352 volumes(艾因夏姆斯大学医院,FWA 000017585);中国 148 volumes(中山纪念医院);外部 25 例(南方医科大学南方医院)。
- 划分:训练 80(埃及 60+中国 20);测试埃及内部 28+中国内部 17+外部 25;测试标签终评前保密。
- 入组:≥18 岁、完整四期、放射报告 ≥1 肝病灶、质量可接受;排除:显著伪影、门脉主干完全血栓、Child-Pugh C。
- 病灶谱含 HCC/转移瘤/胆管细胞癌/良性;无病灶类型标注(论文局限自曝)。
- 8 款扫描仪 3 厂商:SOMATOM Force、SOMATOM Sensation 64、uCT780、Discovery CT750 HD、Revolution EVO、Optima、Prime Aquilion、BrightSpeed。
- 层厚 0.63-1.56 mm(训练均值 0.97±0.19);面内 0.54-1.19 mm(0.832±0.10);512×512;全腹。
- 动脉期约 35-45 s(bolus tracking)、门脉期 65-70 s、延迟期门脉后 3 min。
- 埃及对比剂 Omnipaque(非离子)/Telebrix(离子)混用(供应链限制)。
- 面内分辨率 Egypt 0.862±0.095 / China 0.766±0.063 / External 0.686±0.072 mm;层数 Egypt 578±137 vs External 240±69。
- 9 组两两参数比较 8 组 p<0.006(Mann-Whitney U+BH-FDR q=0.05);Task 1 Dice 跨中心 p>0.20 不显著。
- NIfTI 分发、HU 原值、无重采样/归一化;组织方提供 nnU-Net 默认参考预处理。
- 标注两阶段:LiTS 算法预标(不作真值)→10 标注员(≥1 年腹部经验)3D Slicer 修正→双人复核→>10 年顾问裁决。
- 病灶纳入门槛:跨 ≥2 连续切片(约 ≥3 mm 最大径)。
- combined 四步:elastix 刚性→非刚性精化→STAPLE(SimpleITK)融合(≥2 期可见才纳入)→顾问 QA。
- inter-reader(n=16 例/期,双盲):动脉 0.784、静脉 0.742±0.443(P 0.833/R 0.946)、延迟 0.601、平扫 0.574±0.490(P 0.333/R 0.769)。
- 人类天花板 bootstrap(N=10,000)95% CI [0.540, 0.934];双峰一致性(DSC≈1 或 =0)。
- 两届合计 13 独立队伍/14 方案;nnU-Net 骨干 12/14,Dice+CE 11/14;MIC 唯一两届参赛。
- 2024 版 6 队(埃及测试 Task 1):MIC 0.742/ViCOROB 0.698/IMR 0.666/CEMRG 0.576/BIGR 0.547/PEDRETS 0.496。
- 冠军 MIC 方法:ResEnc-L U-Net+MultiTalent 86 数据集预训练(2024 版 30 个)+肝区裁剪+bootstrap 模型选择;1050 epochs。
- Task 1 MIC:埃及 0.791/中国 0.721/外部 0.750,均值 0.754(pooled median 0.83);超人类均值 4.9%。
- Task 2 combined 最佳:0.586/0.471/0.651(中/埃/外);visible:0.621/0.552/0.674;combined 各队均值埃及仅 0.295。
- 无队伍 Task 2 全中心 P、R 双 >0.8(“remains an open problem”);<100 mm³ 病灶 Task 1 F1<0.35、Task 2 F1<0.15。
- 跨年(埃及测试集):Task 1 0.742→0.791(+4.9%);combined 0.429→0.471(+4.2%);visible 0.553→0.552(停滞=感知壁垒)。
- 对比:外部平扫超 PASTA +28.2%/VoxTell +9.8%;VoxTell 权重含 TriALS 训练数据;PASTA 埃及 0.700→外部 0.513(泛化失败)。
- 评估:11 指标(Task 1/visible)vs 6 检测导向(combined,排除距离/体积指标);漏检罚 Dice=0、距离=9,001;rank-then-aggregate。
- 排名稳定性:bootstrap N=1,000,top-4 稳定(CI overlap <10%);MIC Task 1 三中心全迭代第一。
- 赛制:Synapse(论文 syn53285416/官网 syn65878273 双口径);开发 2025.4-8、终评 2025.9;RTX 3090 24 GB/128 GB RAM/32 核;3 验证+1 终提交。
- 资助:RGC T45-401/22-N + NSFC 62306254/82001768;MICCAI Society SIG-AFRICAI 认可;MICCAI 2025 挑战赛日 2025-09-27 半天场(H)。
- 多数据集预训练为排名最强预测因子;ensemble 无系统优势;基础模型零样本、中心自适应、非 nnU-Net 路线均无人探索。
术语表(30 条)
- NCCT(Non-Contrast CT):非对比增强 CT,平扫——TriALS 的推理目标模态。
- Triphasic:三期(动脉/门脉/延迟),加平扫共四期——本数据集的采集结构。
- Combined paradigm:对多期融合标注(含平扫不可见病灶)的评估范式——挑战赛首要临床目标。
- Visible paradigm:仅对平扫单期标注(放射科平扫可见病灶)的评估范式。
- STAPLE:Simultaneous Truth and Performance Level Estimation,多标注概率共识融合算法(SimpleITK 实现)。
- elastix:开源医学图像配准工具包,TriALS 用于 rigid→non-rigid 顺序配准。
- Label fusion:标签融合——把多期/多标注合并为共识真值的过程。
- nnU-Net:自配置分割框架,14 份参赛方案中 12 份的骨干。
- MultiTalent:多数据集医学分割预训练方案,冠军 MIC 用 86 个公开数据集预训练。
- ResEnc-L:残差编码器大号 U-Net(nnU-Net 变体),MIC 的骨干配置。
- rank-then-aggregate:逐指标排名再取平均的挑战赛排名法(尺度不变)。
- BIAS guidelines:Biomedical Image Analysis ChallengeS 报告规范,TriALS 遵循执行。
- per-case Dice:逐 volume 二值 Dice 的均值;global Dice:全体病灶体素池化 Dice——大病灶主导后者。
- VOE:Volumetric Overlap Error = 1−Jaccard。
- RVD:Relative Volume Difference,排名按绝对值。
- ASSD/RMSD/MSD:平均/均方根/最大对称表面距离(MSD=Hausdorff)。
- 9,001 罚分:漏检/虚报病灶时距离指标的最差罚值——超过数据集内任何可能真实距离。
- IoU>0.5 / IoU>0:严格/宽松病灶匹配阈值(检测指标)。
- inter-reader variability:观察者间变异——两名放射医生的独立标注一致性,人类基线来源。
- 双峰一致性:DSC≈1 或 DSC=0 的极端分布——分歧在"可见性"而非"边界"。
- HCC:肝细胞癌;LiverMets:肝转移瘤——数据集病灶谱(无类型标注)。
- Child-Pugh C:肝硬化最重分级——TriALS 排除标准之一。
- bolus tracking:对比剂团注追踪触发扫描(动脉期 35-45 s)。
- HU(Hounsfield Unit):CT 值单位,数据保留原值不归一化。
- gated repo:HuggingFace 需填表审批的受限仓库——TriALS 数据本体发放方式。
- CC BY-NC-4.0:署名-非商业-相同方式共享许可——数据本体条款(非商业硬约束)。
- concept DOI / version DOI:Zenodo 的父/子 DOI(15087645/15087646)。
- Docker 容器提交:挑战赛终评的代码封装方式,组织方统一硬件执行。
- 感知壁垒(perceptual barrier):visible 范式分数停滞现象——预训练扩容换不来平扫固有特征的感知力。
- SIG-AFRICAI:MICCAI Society 非洲 AI 医疗兴趣组——TriALS 官方认可方。
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | TriALS |
| url_name | trials |
| 类型 | 挑战赛数据集+赛事记录+方法论文(三合一) |
| 论文 | arXiv:2605.16572(2026-05-15,CC BY 4.0,65 作者) |
| 赛事 | MICCAI 2025 官方挑战赛(2025-09-27,H 半天场);2024 预演版 |
| 团队 | HKUST(Elbatel)× Ain Shams(Ghonim)× 中山纪念医院 × 南方医院 |
| 规模 | 150 例×4 期=600 volumes;训练 80+测试 70;每例 5 套标注 |
| 数据 | HF marwankefah/TriALS,gated,CC BY-NC-4.0,725 文件/36.67 GB |
| 抓取时点 | 2026-09-27 |
| 库内互链 | lits(81)/amos(76)/chaos(337)/sliver07(347)/atlas-liver-tumor(431)/3dircadb(357)/cadis(243)/flare(387)/btcv(377)/word(412)/abdomenct-1k(402)/totalsegmentator(422) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 7 | arXiv+MICCAI 官网+GitHub 多入口可索引;但"TriALS"泛用词易撞车临床注册库,Zenodo 提案常被误当数据入口 |
| A 可获取性 | 6 | 训练数据+全部标注 HF 公开(gated 自动/人工审批);外部标签 embargo;冠军权重公开——扣分在外部集不可复现与 NC 条款 |
| I 可互操作 | 8 | NIfTI 标准格式+nnU-Net 生态即插即用;HU 原值+无重采样是"原始友好"设计;跨期标注可分离加载 |
| M 元数据质量 | 8 | 论文表格完备(采集参数/划分/指标定义/统计规范全披露);BIAS 规范执行;Synapse ID 双口径与 0.742 双重身份微降分 |
| S 可持续性 | 7 | 三平台分发(HF/GitHub/arXiv)冗余良好;学术团队维护、作者活跃(HF 2026-09 仍更新);外部标签依赖个人邮件有单点风险 |
| 综合评级 | 7.2/10(中上偏良) | 标注资产完整性与方法学透明度是长板;外部集不可复现与规模偏小是结构性短板 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 150 例/600 volumes/80-28-17-25 划分 | 论文 Methods(Data split)+摘要 | arXiv HTML 全文 |
| 埃及 352 volumes/FWA 000017585;中国 148 volumes | 论文 Methods(Study design) | arXiv HTML 全文 |
| 8 款扫描仪全清单与采集参数 | 论文 Methods(CT acquisition protocols) | arXiv HTML 全文 |
| inter-reader 0.742/0.574/0.784/0.601、P 0.333 | 论文 Results+Methods(Inter-rater)+Fig 2 | arXiv HTML 全文 |
| 人类 CI [0.540, 0.934](N=10,000) | 论文 Results(Human baseline) | arXiv HTML 全文 |
| MIC 0.791/0.721/0.750、均值 0.754、median 0.83 | 论文 Results(Task 1)+Table 3 | arXiv HTML 全文 |
| Task 2 combined 0.586/0.471/0.651;visible 0.621/0.552/0.674 | 论文 Results(Task 2)+Table 4 | arXiv HTML 全文 |
| 跨年 0.742→0.791/0.429→0.471/0.553→0.552 | 论文 Results(Cross-year)+Table 5 | arXiv HTML 全文 |
| 超 PASTA +28.2%/VoxTell +9.8%(外部 NCCT) | 论文 Results(Comparison)+Fig 7 | arXiv HTML 全文 |
| 9,001 罚分与 11/6 指标口径 | 论文 Methods(Evaluation metrics/Ranking) | arXiv HTML 全文 |
| MultiTalent 86 数据集预训练 | 论文 Results(Segmentation performance)+Table(method stack) | arXiv HTML 全文 |
| gated/cc-by-nc-4.0/725 文件/36.67 GB | HF API(hf-mirror 端点)实测 | 2026-09-27 抓取 |
| Zenodo 提案 PDF/cc-by-4.0/2025-03-26 | Zenodo API records/15087645 | 2026-09-27 抓取 |
| Synapse 双口径 | 论文 Methods(Challenge organisation)vs MICCAI 官网 challenges 页 | 双源对照 |
附录 D:数据获取决策树
需要 TriALS 数据
├─ 只要代码/权重/论文 → GitHub xmed-lab/TriALS + arXiv 2605.16572(无需审批)
├─ 要训练数据+标注(学术)
│ ├─ 有 HF 账号 → marwankefah/TriALS 填 gated 表单(NC 勾选)→ 审批 → 下载 36.67 GB
│ └─ 大陆网络 → hf-mirror API 查元数据/文件树;下载仍需 HF 过 gate
├─ 要外部测试集标签 → embargo,邮件通讯作者申请(预设受阻,引用论文数字替代)
├─ 要商用 → 数据 CC BY-NC-4.0 不覆盖,联系作者单独授权
└─ 只想找"数据集 DOI"引用 → 引 HF repo + arXiv;Zenodo 15087645 只是提案 PDF(坑 1)
附录 E:指标套件全表(11 项定义)
| # | 指标 | 定义 | 方向 | Task 1/visible | combined |
|---|---|---|---|---|---|
| 1 | per-case Dice | 逐 volume 二值 Dice 均值 | 高好 | ✓ | ✓ |
| 2 | global Dice | 全体病灶体素池化 Dice | 高好 | ✓ | ✓ |
| 3 | Precision @ IoU>0.5 | 严格匹配病灶级精度 | 高好 | ✓ | ✓ |
| 4 | Recall @ IoU>0.5 | 严格匹配病灶级召回 | 高好 | ✓ | ✓ |
| 5 | Precision @ IoU>0 | 宽松定位精度 | 高好 | ✓ | ✓ |
| 6 | Recall @ IoU>0 | 宽松定位召回 | 高好 | ✓ | ✓ |
| 7 | VOE | 1−Jaccard | 低好 | ✓ | ✗ |
| 8 | RVD | 相对体积差(排名按绝对值) | 低好 | ✓ | ✗ |
| 9 | ASSD | 平均对称表面距离 | 低好 | ✓ | ✗ |
| 10 | RMSD | 均方根对称表面距离 | 低好 | ✓ | ✗ |
| 11 | MSD | 最大对称表面距离(Hausdorff) | 低好 | ✓ | ✗ |
惩罚惯例:FN/FP → Dice=0、Jaccard=0、VOE=1.0、RVD/ASSD/RMSD/MSD=9,001。Task 2 最终榜=visible 与 combined 两口径排名平均。
附录 F:combined 标注流水线复现骨架(伪代码)
# 依赖: SimpleITK, elastix(或 SimpleElastix 绑定)
# 输入: 四期影像 + 四期各自标注(NC/ar/pv/del),肝区裁剪体积
# 步骤 1-2: 顺序刚性→非刚性配准(各增强期 → NC 坐标系)
def build_combined(nc_img, phases):
aligned = {}
for name, (img, seg) in phases.items():
# 先 rigid(校正呼吸运动/摆位),再非刚性精化(亚体素边界对齐)
tx_rigid = elastix_rigid(fixed=nc_img, moving=img)
tx_deform = elastix_nonrigid(fixed=nc_img, moving=img, init=tx_rigid)
aligned[name] = warp_segmentation(seg, tx_deform, reference=nc_img)
# 步骤 3: STAPLE 概率融合(SimpleITK)
fused = sitk.STAPLE(list(aligned.values()), threshold=0.5)
# 步骤 4(人工): 腹部放射顾问对照原始对比期逐例 QA——
# 纠正/剔除可见配准错误;单期独有病灶按 "≥2 期可见" 规则复核
return fused
注:真实流水线以论文 Methods 与官方 GitHub 评估脚本为准;本骨架仅为工艺结构示意(步骤顺序与"≥2 期可见"规则来自论文原文)。
附录 G:HF 数据获取与校验骨架(代码)
# pip install datasets huggingface_hub
# 前置: HF 账号过 marwankefah/TriALS gated 审批
from huggingface_hub import snapshot_download
snapshot_download(
repo_id="marwankefah/TriALS",
repo_type="dataset",
local_dir="TriALS/",
# token="hf_xxx" # 过 gate 的账号 token
)
# 校验要点(论文+HF 实测口径):
# - imagesTr 计数 = 320(80 例 × 4 期: NC/ar/pv/del)
# - labelsTr 计数 = 400(80 例 × 5 套: 四期 + combined)
# - 总体 725 文件 / 36.67 GB
# - NIfTI HU 原值: 抽查体数据 intensity 范围应含负值(脂肪/空气)
# - 无外部测试集影像/标签目录(embargo)
附录 H:inter-reader 与人类基线数据表
| 量 | 数值 | 口径 |
|---|---|---|
| 静脉期 inter-reader per-case Dice | 0.742±0.443(n=16) | 与算法同口径(FN 计 Dice=0) |
| 平扫 inter-reader per-case Dice | 0.574±0.490(n=16) | 同上 |
| 静脉期病灶级 P/R | 0.833 / 0.946 | max volumetric overlap ≥10% IoU 匹配 |
| 平扫病灶级 P/R | 0.333 / 0.769 | 同上;P 低=高假发现率(2/3 互不认) |
| 动脉期/延迟期 Dice | 0.784 / 0.601 | 四期中最高/次低 |
| 人类天花板 95% CI | [0.540, 0.934] | bootstrap N=10,000;宽区间=n 小+双峰 |
| 冠军相对人类 | +4.9%(静脉埃及) | 0.791 vs 0.742;落入 CI=人类水平 |
| 平扫外部最佳 vs 天花板 | 0.651 vs 0.574 | 外部已超;埃及 0.471 未超 |
附录 I:2024 版六队方法配置表(论文口径)
| 队伍 | 机构 | 架构 | 预训练 | 预训练数据 | Epochs | 损失 | T1 | NC |
|---|---|---|---|---|---|---|---|---|
| MIC | DKFZ(德) | ResEnc-L U-Net | MultiTalent(30 数据集) | LiTS+多期 | 200 | Dice+CE | ✓ | ✓ |
| ViCOROB | U. Girona(西) | PlainConv/ResEnc | LiTS 预训练 | LiTS | 1000 | Dice+CE | ✓ | ✓ |
| IMR | 上海交大(中) | PlainConv U-Net | 肝分割(4 数据集) | SLIVER07/LiTS/CHAOS/AMOS | 1000 | Dice+CE | ✓ | ✓ |
| CEMRG | Imperial(英) | xLSTM-UNet | SSL 师生 | 无 | N/A | 对比+Dice+CE | ✓ | ✓ |
| PEDRETS | Innsbruck(奥) | MedNeXt-L(5×5) | LiTS 预训练 | LiTS | 100+1000 | Dice+CE | ✓ | ✓ |
| BIGR | Erasmus MC(荷) | MedNeXt-L(5×5) | 无 | 无 | 100/300 | Dice+CE | — | ✓ |
2024 埃及测试 Task 1 per-case Dice:MIC 0.742 > ViCOROB 0.698 > IMR 0.666 > CEMRG 0.576 > BIGR 0.547 > PEDRETS 0.496。2025 版 MIC 升级为 MultiTalent 86 数据集、1050 epochs,预训练数据追加 HCC/LiverMets/HCC-TACE/WAW-TACE。
附录 J:2025 版结果登记表(论文口径)
| 指标 | MIC(冠军) | 备注 |
|---|---|---|
| Task 1 埃及/中国/外部 | 0.791 / 0.721 / 0.750 | 三中心全第一,无中心适配 |
| Task 1 三中心均值 | 0.754 | pooled median 0.83(70 volumes) |
| Task 2 combined 中/埃/外 | 0.586 / 0.471 / 0.651 | 外部超人类天花板 0.574 |
| Task 2 visible 中/埃/外 | 0.621 / 0.552 / 0.674 | 与 combined 不可横比(坑 5) |
| 埃及 combined 各队均值 | 0.295(全队) | vs 中国 0.449 / 外部 0.511——埃及最难 |
| 排名稳定性 | Task 1 全迭代第一 | bootstrap N=1,000,top-4 CI overlap<10% |
附录 K:扫描仪与采集参数总表
| 机型 | 厂商 | 主要部署 |
|---|---|---|
| SOMATOM Force | SIEMENS | 埃及为主 |
| SOMATOM Sensation 64 | SIEMENS | 埃及为主 |
| uCT780 | United Imaging | 中国 |
| Discovery CT750 HD | GE | 中国/外部 |
| Revolution EVO | GE | 中国/外部 |
| Optima | GE Healthcare | 中国/外部 |
| Prime Aquilion | Toshiba | — |
| BrightSpeed CT | GE | — |
参数区间:100-120 kVp;层厚 0.63-1.56 mm(训练 0.97±0.19);面内 0.54-1.19 mm(0.832±0.10);512×512;软组织/混合重建核。期相时点:动脉 35-45 s(bolus tracking)、门脉 65-70 s、延迟门脉后 3 min。埃及对比剂 Omnipaque/Telebrix 混用。厂商效应:西门子平台(埃及)平扫噪声底高于 United Imaging/GE。
附录 L:中心异质性统计表
| 参数 | 埃及 | 中国 | 外部 | 组间检验 |
|---|---|---|---|---|
| 面内分辨率(mm) | 0.862±0.095 | 0.766±0.063 | 0.686±0.072 | 8/9 组 p<0.006(BH-FDR q=0.05) |
| 层数深度 | 578±137 | — | 240±69 | 差 >2 倍(覆盖协议不同) |
| Task 1 Dice 组间 | — | — | — | p>0.20 不显著(队伍级分数 n=6-7,功效有限) |
| 两个 ASSD 名义显著 | China vs Ext / Egypt vs Ext | — | — | 未过 FDR,论文注明 |
| 平扫噪声底 | 西门子平台较高 | United Imaging/GE 较低 | 同中国 | 影响平扫对比度 |
解读纪律:采集差异显著 + 分割成绩不显著=当前方法对静脉期采集异质性鲁棒;但这不能外推到平扫(埃及 combined 各队均值仅 0.295)。
附录 M:与库内条目关系声明
本条目(trials)与 12 条库内互链的关系分三类:上游依赖(lits=81:预标算法训练集+4 队预训练+MIC 预训练池成员;amos=76、chaos=337、sliver07=347:IMR 队预训练四件套的成员)——这些条目的规模/许可细节影响 TriALS 复现成本;同域互补(atlas-liver-tumor=431、3dircadb=357、cadis=243:肝病灶/三期 CT 的类型与结构维度补充)——TriALS 无病灶类型标注的缺口由它们部分补位;方法生态(flare=387:同源挑战赛方法论 rank-then-aggregate/Synapse/Docker;btcv=377、word=412、abdomenct-1k=402、totalsegmentator=422:腹部 CT 多器官生态,级联方案预训练候选)。互链算法按 category_tags(医学影像/CT/医学图像分割/挑战赛数据集/评测基准/肿瘤学)计算相关度。
附录 N:肝病变/肝分割公开数据集景观对照
| 数据集 | 期相 | 规模 | 病灶级标注 | 平扫推理赛道 | 人类基线 | 多中心 |
|---|---|---|---|---|---|---|
| LiTS(库内 81) | 增强为主 | 201+130 | ✓(肝+肿瘤) | ✗ | ✗ | ✓ |
| CHAOS(库内 337) | 平扫+MRI | CT 40 | ✗(仅全肝) | 部分 | ✗ | ✗ |
| AMOS(库内 76) | 混合 | 500 | ✗(多器官) | 部分 | ✗ | ✓ |
| 3D-IRCADb(库内 357) | 三期(部分) | 20 | ✓(+血管) | ✗ | ✗ | ✗ |
| SLIVER07(库内 347) | 增强 | 20+10 测 | ✗(仅肝) | ✗ | ✗ | ✗ |
| TriALS(本条目) | 四期 | 150(600 vol) | ✓×5 套/例 | ✓(唯一) | ✓(n=16 双盲) | ✓(3 中心) |
附录 O:许可条款细读(三件资产+embargo)
- 数据本体(HF marwankefah/TriALS):CC BY-NC-4.0——署名+非商业。衍生模型权重是否构成"衍生品"存在解释空间;商用(含商业产品内嵌、商业服务训练)须另行授权;再分发需同条款+署名。gated 表单是发放前置而非许可本身。
- Zenodo 提案(15087645):CC BY-4.0——但本体是提案 PDF,可自由引用提案文档,不代表数据许可。
- 论文(arXiv 2605.16572):CC BY 4.0——文本可自由引用/再分发(署名)。
- 外部测试集标签:embargo(贡献机构数据共享协议)——非许可条款而是访问限制,验证用途经通讯作者申请。
- 代码/权重(GitHub xmed-lab/TriALS):随 repo 许可(使用前以 repo LICENSE 文件为准)。
附录 P:gated 申请要点(供参考模板结构)
- 身份字段:全名、机构邮箱(建议机构域名邮箱提高通过率)、机构名、国家、角色(研究员/学生/工程师);
- 用途声明:勾选非商业用途;建议附一句话研究描述(如"肝病变分割方法研究,学术发表");
- 引用规范:获批使用后在成果中引用 arXiv:2605.16572 与 HF repo;
- 红线:不得转售/商用/未署名再分发;CC BY-NC-4.0 条款随数据生效;
- 若需外部测试标签:另邮件通讯作者(论文 Data Availability 口径),说明验证目的与范围。
附录 Q:坑点档案(与 §10 对照)
| 坑 | 一句话 | 严重度 |
|---|---|---|
| 1 | Zenodo DOI 是提案 PDF 不是数据 | 高(引用链断裂) |
| 2 | 三件资产三套许可(NC/BY/BY) | 高(合规风险) |
| 3 | Synapse ID 双口径(53285416/65878273) | 中(溯源混乱) |
| 4 | 机构误写(爱资哈尔≠艾因夏姆斯)+标题丢 Benchmark | 中 |
| 5 | visible/combined 不可横比 | 高(数字误读) |
| 6 | VoxTell 数据优势(权重含训练数据) | 中(对比失真) |
| 7 | 0.742 双重身份(人类基线=2024 冠军分) | 中(撞车混淆) |
| 8 | 外部集标签 embargo、影像可得性待核 | 高(复现受阻) |
附录 R:检索决策树
检索 TriALS 相关主题
├─ 找数据集本体 → HF marwankefah/TriALS(gated)
├─ 找方法/结果 → arXiv 2605.16572(HTML 全文可抓)
├─ 找赛事信息 → MICCAI 2025 官网 challenges 页(syn65878273)
│ 或论文 Methods(syn53285416)——口径任选其一
├─ 找提案背景 → Zenodo 15087645(提案 PDF)
├─ "trials" 撞临床注册库 → 加 "liver" / "non-contrast CT" 限定
│ (库内相邻 slug: clinicaltrials-gov, rid 556)
└─ 找库内上游/互补 → §9.1 十二条 rid 图谱
附录 S:双口径与数字巧合登记表
| 项 | 口径 A | 口径 B | 处理 |
|---|---|---|---|
| Synapse ID | 论文 syn53285416 | 官网 syn65878273 | 正文以论文为主,官网注 |
| Zenodo DOI | concept 15087645 | version 15087646 | 引用任一均可,注明概念/版本 |
| 标题 | 正式版含 “Benchmark” | 简写常省略 | 全文按正式版 |
| 埃及机构 | Ain Shams(论文) | Al-Azhar(OpenAIRE 误写) | 按论文 |
| 0.742 | 2025 inter-reader 静脉期 | 2024 MIC 埃及 Task 1 分 | 上下文区分(坑 7) |
| visible 0.553/0.552 | 2024/2025 跨年对比 | — | 停滞非退化 |
| license | 数据 cc-by-nc-4.0 | 提案/论文 cc-by-4.0 | 逐件标注(坑 2) |
| MultiTalent 预训练 | 2024 版 30 数据集 | 2025 版 86 数据集 | 语境区分 |
附录 T:维护计划与触发点
| 触发点 | 动作 |
|---|---|
| HF gated 表单字段/条款变更 | 复核 §7.2 与附录 P |
| 外部测试标签解禁或发放流程公开 | 更新坑 8、§7.1、附录 D |
| MICCAI 2026 及后续届次(三洲扩展/交互式赛道) | 新条目或本条目增补 |
| 论文正式期刊发表(若高于 arXiv 版本) | 更新 §2 论文口径与引用 |
| top-ranked 权重发布位置变化 | 复核 §7.1 资产表 |
| Zenodo 记录更新(提案之外的文件) | 复核坑 1 结论 |
| 库内新增肝病变相关条目 | 复核 §9 家族图谱 |
附录 U:rank-then-aggregate 计算示例(教学)
设三队(A/B/C)在某中心的 Task 2 combined 上只有 6 项指标(检测导向),以两指标示意:
| 队 | per-case Dice | P@IoU>0.5 | Dice 排名 | P 排名 | 均值 | 榜位 |
|---|---|---|---|---|---|---|
| A | 0.50 | 0.60 | 2 | 2 | 2.0 | 2 |
| B | 0.55 | 0.45 | 1 | 3 | 2.0 | 2 |
| C | 0.48 | 0.65 | 3 | 1 | 2.0 | 2 |
(三队并列情形说明"均值"可能同分——真实榜以全部 6 指标与更多队伍打破平局。)要点:单项爆表(B 的 Dice 第一、C 的 P 第一)不保证总榜第一,rank-then-aggregate 奖励均衡;漏交队伍按最差值(Dice=0、距离=9,001)参与排名,等效垫底。真实规则见论文 Methods(Ranking methodology)。
附录 V:来源清单与抓取记录
| 来源 | URL | 抓取方式 | 时点 |
|---|---|---|---|
| arXiv 论文 abs/HTML | https://arxiv.org/abs/2605.16572 、https://arxiv.org/html/2605.16572v1 | curl+UA(674KB HTML 转纯文本) | 2026-09-27 |
| Zenodo API | https://zenodo.org/api/records/15087645 | WebFetch(curl 直连被沙箱拦截) | 2026-09-27 |
| HF 元数据/文件树 | https://huggingface.co/api/datasets/marwankefah/TriALS(及 /tree/main?recursive=true,经 hf-mirror 端点) | curl(API 端点) | 2026-09-27 |
| GitHub | https://github.com/xmed-lab/TriALS | 论文转引+库内检索 | 2026-09-27 |
| MICCAI 2025 官网 challenges 页 | 官网 challenges 列表 | WebSearch 间接 | 2026-09-27 |
| Synapse | syn53285416(论文)/syn65878273(官网) | 论文转引(Synapse 需 JS 无法直抓) | 2026-09-27 |
附录 W:BibTeX 引用模板
@misc{trialls2026,
title = {TriALS: Triphasic-Aided Liver Lesion Segmentation Benchmark
in Non-Contrast CT},
author = {Elbatel, Marwan and Ghonim, Mohamed and Mao, Jiaji and
Lin, Zhuosheng and Eckstein, Katharina and others},
year = {2026},
eprint = {2605.16572},
archivePrefix = {arXiv},
primaryClass = {cs.CV},
url = {https://arxiv.org/abs/2605.16572},
note = {MICCAI 2025 Challenge; data:
https://huggingface.co/datasets/marwankefah/TriALS (CC BY-NC-4.0)}
}
注:作者列表为示意(前五作者+et al 结构),引用时以 arXiv 页面完整作者列表为准;如需引挑战赛提案另加 Zenodo DOI 10.5281/zenodo.15087645(勿与数据本体混引,坑 1)。
附录 X:两届参赛队伍全景表
| 队伍 | 机构(国家/地区) | 届次 | 2024 埃及 Task 1 |
|---|---|---|---|
| MIC | DKFZ(德国) | 2024+2025(唯一双届) | 0.742 |
| ViCOROB | Universitat de Girona(西班牙) | 2024 | 0.698 |
| IMR | 上海交通大学(中国) | 2024 | 0.666 |
| CEMRG | Imperial College London(英国) | 2024 | 0.576 |
| PEDRETS | Medical University of Innsbruck(奥地利) | 2024 | 0.496 |
| BIGR | Erasmus MC(荷兰) | 2024 | 0.547 |
| Eagles | NewGiza University(埃及) | 2025 | — |
| WoodyLoveAI | National Yang Ming Chiao Tung University(台湾) | 2025 | — |
| PCLab-HIT | Harbin Institute of Technology(中国) | 2025 | — |
| SlicenDice | Universidade do Porto(葡萄牙) | 2025 | — |
| GenMI | MBZUAI(阿联酋) | 2025 | — |
| CALADAN | KNUST(加纳) | 2025 | — |
| MedAI | Korea University(韩国) | 2025 | — |
合计 13 独立队伍/14 方案。2024 排名据论文 Table 5(埃及测试集 Task 1 per-case Dice);2025 各队完整逐队分数见论文 Table 3/4(本条目按冠军口径登记,逐队引用请回原文)。地区跨度:欧洲 5、东亚 4(含台湾)、中东/北非 2、南亚东南亚之外非洲 1、伊比利亚 1——2025 版实现"跨三大洲"。
附录 Y:病灶尺寸分层结果与临床含义
| 病灶尺寸 | Task 1(静脉)每 lesion F1 | Task 2(平扫)每 lesion F1 | 临床含义 |
|---|---|---|---|
| ≥100 mm³ | 未单列(整体主贡献区) | 未单列 | 常规可检出区 |
| <100 mm³ | <0.35 | <0.15(几乎检不出) | 小转移灶检出=分期与治疗决策的关键盲区 |
机理:部分容积效应(<100 mm³ ≈ 直径 <5.8 mm 球体,接近层厚分辨能力)+平扫病灶-实质低对比。数据端对应:标注纳入门槛 ≥3 mm 最大径(§2.5)——亚 3 mm 病灶不在真值内,任何基于 TriALS 的模型不可宣称可检出它们。论文展望的对应方向:纹理感知编码器、对比合成、交互式标注,均以突破小病灶平扫盲区为目标。
附录 Z:关键词与检索对照表
| 检索目标 | 推荐关键词组合 | 避免 |
|---|---|---|
| 数据集本体 | “TriALS” + “liver” + “non-contrast CT” | 裸 “trials”(撞临床注册库) |
| 挑战赛成绩 | “TriALS 2025” + “MICCAI” + “leaderboard” | “TriALS challenge 2024”(预演版口径) |
| 标注方法 | “STAPLE” + “label fusion” + “multi-phase” + “liver” | “annotation TriALS”(过泛) |
| 感知壁垒论点 | “visible paradigm” + “perceptual barrier” + “non-contrast” | 只引 combined 数字(范式混淆) |
| 配准工艺 | “elastix” + “STAPLE” + “combined annotation” | — |
| 低资源叙事 | “contrast agent shortage” + “liver” + “AI” | — |
| 库内检索 | url_name=trials;标签:医学影像/CT/医学图像分割/挑战赛数据集/评测基准/肿瘤学 | 与 clinicaltrials-gov(556) 混淆 |
附录 AA:数据完整性自查清单(下载后)
- 文件总数 725、总大小约 36.67 GB(HF tree 口径,2026-09-27);
- imagesTr = 320 个 .nii.gz(80 例 × NC/ar/pv/del 四期);
- labelsTr = 400 个(80 例 × 四期标注+combined 五套);
- 抽查任一 volume:HU 原值(范围应含负值)、512×512、层厚落在 0.63-1.56 mm;
- 抽查任一例:combined 标注病灶数 ≥ 该例任一单期标注病灶数(融合"≥2 期可见"规则的自洽性检查);
- 确认无外部测试集影像/标签目录(有则异常,向作者反馈);
- 记录下载版本(lastModified 时间戳)以便成果可复现声明。
附录 AB:GitHub 基线动物园——LiTS 5-Fold 基准全表(xmed-lab/TriALS README,100 epoch)
挑战赛仓库为每款内置基线给出了统一协议(LiTS 5-fold、100 epoch、nnU-Net v2 训练器体系)的公开基准,是挑战赛前的方法选型公共参考系。全表转录如下(lesion=病灶级,liver=肝脏级;Dice/Jaccard 为百分比,RMSD 为 mm;括号内为 5-fold 标准差):
| 模型 | Lesion Dice | Lesion Jaccard | Lesion RMSD | Liver Dice | Liver Jaccard | Liver RMSD |
|---|---|---|---|---|---|---|
| nnUNet 2D | 77.14 (±1.69) | 64.05 (±2.19) | 1.42 (±0.14) | 95.30 (±0.96) | 91.21 (±1.56) | 9.24 (±1.33) |
| nnUNet 3D | 76.29 (±2.98) | 63.22 (±3.68) | 1.60 (±0.24) | 91.84 (±0.86) | 85.45 (±1.29) | 22.39 (±5.23) |
| SegResNet | 76.15 (±1.36) | 63.18 (±1.80) | 1.93 (±0.74) | 90.99 (±1.73) | 83.97 (±2.86) | 25.57 (±5.44) |
| SwinUNETR | 74.21 (±1.92) | 60.74 (±2.22) | 1.86 (±0.39) | 86.74 (±1.36) | 77.24 (±1.73) | 32.70 (±3.06) |
| U-Mamba (Bot) | 77.31 (±2.34) | 64.41 (±3.04) | 1.74 (±0.42) | 92.30 (±0.98) | 86.12 (±1.60) | 21.58 (±5.64) |
| LightM-UNet | 76.77 (±1.58) | 63.70 (±1.77) | 1.97 (±0.71) | 91.23 (±1.26) | 84.37 (±1.89) | 24.76 (±3.67) |
| MedNeXt-B (k5) | 77.44 (±2.03) | 64.57 (±2.67) | 1.63 (±0.52) | 93.60 (±1.25) | 88.49 (±1.88) | 17.28 (±3.45) |
| MedNeXt-L (k5) | 77.85 (±2.79) | 65.02 (±3.64) | 1.48 (±0.30) | 94.55 (±1.07) | 90.00 (±1.77) | 14.69 (±3.08) |
| SAMed-B | 76.99 (±2.12) | 63.84 (±2.62) | 1.81 (±0.38) | 94.24 (±0.49) | 89.26 (±0.82) | 20.79 (±4.70) |
| SAMed-H | 78.60 (±1.56) | 65.77 (±2.03) | 1.50 (±0.15) | 95.58 (±0.68) | 91.65 (±1.14) | 8.67 (±2.09) |
另录:LiTS 5-fold 1000 epoch 加长赛(进行中)nnUNet 3D lesion Dice 79.57 (±1.33) / liver Dice 96.28 (±0.62)。三个读表要点:其一,2D 系在肝脏级大幅领先 3D 系(95.30 vs 91.84),与肝脏器官级分割"切片内信息足量"的常识一致;其二,Mamba 系(U-Mamba 77.31)与 MedNeXt 系(77.44/77.85)在病灶级追平甚至超过 nnUNet 同 epoch 配置,但 liver 级落后——架构创新的红利集中在病灶判别而非器官边界;其三,SAMed-H(SAM 调优系)六项全榜第一,提示大规模预训练底座的迁移价值——这也为冠军 MIC 走 MultiTalent 86 数据集预训练路线提供了仓库内的旁证。使用提醒:此表是 LiTS(增强期) 上的基线,不可与 TriALS 平扫/静脉期成绩直接混排。
附录 AC:平台统计与版本时间戳登记(抓取时点 2026-09-27)
| 平台 | 关键标识 | 时间戳/统计 |
|---|---|---|
| Zenodo | concept 10.5281/zenodo.15087645 / version 10.5281/zenodo.15087646 | 发布 2025-03-26(created 07:58:59 UTC);v1 唯一版本;635 downloads / 481 views / 549 unique downloads |
| Zenodo 文件 | 242-Triphasic-aided_…_2025-03-17T09-44-40.pdf | 105,980 字节;md5 b25475af92665aaa5f96fb875fc3821a |
| HuggingFace | marwankefah/TriALS | created 2026-04-12 / lastModified 2026-09-23;456 downloads / 2 likes;gated;元数据 cc-by-nc-4.0 |
| GitHub | xmed-lab/TriALS | 初始提交 2024-04-04;README 最后更新 2026-05-19;nnunv2 task2 dataset_conversion 2024-09-05;eval_scripts 最近提交 2025-08-04(检出计数语义修正) |
| arXiv | 2605.16572v1 | 2026-05-15 19:23:35 UTC 提交;2,578 KB;cs.CV |
| Synapse | syn53285416(2024 版)/ syn65878273(2025 版) | 2024:2024-04-04 预注册、2024-08-08 开放提交;2025:数据页 wiki/631558 |
| MICCAI 官网 | conferences.miccai.org/2025 challenges 页 | TriALS 2025 = Sept. 27 半日(H),Standard Challenges 板块 |
登记说明:以上时间戳与统计数为"抓取时点快照",平台计数(downloads/views/likes)会持续漂移,引用时应注明查询日期;Zenodo 文件 md5 与 arXiv 提交时刻为不变量,适合写入可复现性声明。GitHub commit 粒度信息来自仓库公开提交历史,其中 2025-08-04 的评估脚本提交(“Start counting detected lesions from zero…”)与论文所述"检出病灶从零计数、足够重叠才累加"的评估语义对应,是复现官方数字时必须对齐的代码版本锚点。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- toothfairy2 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
- curvas — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
- toothfairy3 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
- stsr — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
- segrap — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- kits23 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- kits — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- lits — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- flare — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- autopet-v — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

