TUS-REC2025 (tus-rec) — AI-Ready Wikipedia

UCL 主办的 MICCAI 2025 免标记 3D 自由手持超声重建挑战赛数据集——85 名志愿者 170 段前臂超声(约 26 万帧)带光学跟踪金标准位姿,四指标位移向量评估,冠军 ImFusion 0.622,训练数据注册获取且禁商用

来源 Ultrasonix(BK)超声仪 + 4DC7-3/40 凸阵探头采集的 2D 前臂超声帧序列(20 fps,480×640,6 MHz,9 cm 深度)+ NDI Polaris Vicra 光学跟踪器记录的逐帧金标准位姿(4×4 齐次变换矩阵)+ 每段 100 帧解剖标志点坐标 + pinhead 法标定矩阵(calib_matrix.csv)发布时间: 2026-09-27最后更新: 2026-09-27 阅读 15
TUS-REC2025 (tus-rec) — AI-Ready Wikipedia

信息速览

数据集名称TUS-REC2025 (tus-rec) — AI-Ready Wikipedia
数据类型影像数据,原始数据,人工标注
规模85 名志愿者(多种族、多性别、多年龄多样队列),170 段扫描序列(每人左、右前臂各 1 段);划分 50/3/32 名受试者 = 100/6/64 段(训练/验证/测试)
接入方式Ultrasonix(BK)超声仪 + 4DC7-3/40 凸阵探头采集的 2D 前臂超声帧序列(20 fps,480×640,6 MHz,9 cm 深度)+ NDI Polaris Vicra 光学跟踪器记录的逐帧金标准位姿(4×4 齐次变换矩阵)+ 每段 100 帧解剖标志点坐标 + pinhead 法标定矩阵(calib_matrix.csv)
AI 就绪度

INFOBOX — TUS-REC2025 一屏速览

维度 内容
本质 MICCAI 2025 官方挑战赛数据集:2D 超声帧序列 + 光学跟踪金标准 → 免跟踪器 3D 重建任务(非单一论文数据集)
主办 University College London(UCL,6 人)+ King’s College London(KCL,Tom Vercauteren),联系人 Qi Li
场合 MICCAI 2025(韩国大田,2025-09-23 至 27)官方挑战赛,与 ASMUS 2025 workshop 同场,SIGMUS 支持
数据 85 名志愿者 × 左右前臂 = 170 段扫描,约 26 万帧(帧数四口径见坑 3);20 fps,480×640,凸阵探头
金标准 NDI Polaris Vicra 光学跟踪位姿(仅作评测,不作算法输入)+ pinhead 法标定
划分 train/val/test = 50/3/32 名受试者(100/6/64 段,~164k/~9k/~90k 帧);测试集不公开
任务 估计帧间变换:输出 GP/GL/LP/LL 四组位移向量(不强制刚体矩阵)
评估 GPE/GLE/LPE/LLE 四项毫米误差 → 归一化排名,final score = 0.25×四项之和(越高越好)
结果 冠军 ImFusion 0.622±0.071(GPE 9.249 mm);亚军深圳大学 MUSIC Lab 0.620;季军 COCHE 0.503;baseline 0.163
诊断 local 误差亚毫米(相邻帧估计近乎解决)vs global 误差毫米级(长序列累积漂移未解决)——四指标暴露误差结构
获取 描述记录 open(CC BY-4.0)|验证数据 open|训练数据 restricted 注册获取(CC BY-NC-SA-4.0 禁商用)|测试集不公开
论文 联合挑战论文未发表(expected by end of 2026);前作论文 arXiv:2506.21765
库内互链 echonet-dynamic(526)、camus(533)、hc18(535)、ddti(536)、us-nerve-seg(537)、busi(539) 等超声家族

TUS-REC2025 是一场"把外部跟踪器从超声三维化里去掉"的挑战赛:它给参赛者 85 名志愿者、170 段前臂自由手持超声扫描(约 26 万帧),每帧都附带光学跟踪器记录的金标准位姿——但参赛算法不许用任何外部跟踪器,只准从图像序列本身推断探头怎么动、并把 2D 帧序列拼成 3D 体。名字里的 “Trackerless” 说的是任务目标,不是数据属性——这正是本条目要替你拆穿的第一层名实之辨(坑 1)。

导语读法三则:

  1. 只想下数据:直奔 §5 获取与许可——训练数据是注册获取且禁商用的,验证数据开放,测试集拿不到;别把 19 页 PDF 的描述记录当数据本体下(坑 2)。
  2. 想复现或参赛:直奔 §3 任务定义与 §4 评估体系——输出表示(位移向量)与排名公式(aggregate then rank)是两处最容易做错的工程细节。
  3. 关心方法学:直奔 §6 结果解读——local 亚毫米 vs global 毫米级的误差结构,是整个挑战赛设计最有诊断价值的产出。

§0 导读:这个数据集解决什么问题

三维超声(3D US)在临床上是有真需求的:定量生物测量、多模态配准、3D 可视化、介入引导,都需要一个体数据而不是一段 2D 视频。获得 3D 超声的传统路线有三条:买一台专用 3D 探头(2D 阵列,昂贵且视野受限)、用机械扫查装置(笨重)、或者给自由手持(freehand)2D 探头配一个外部位置跟踪器(光学或电磁)——第三条路线技术上成熟,但跟踪器带来额外成本、标定负担、视野遮挡与便携性损失,在资源受限的临床场景(急诊床旁、基层筛查、野战与低收入地区)尤其难落地。

免标记(trackerless)freehand 3D 重建是第三条路线的"减法版本":只用图像序列本身估计帧间变换。直觉上这是可行的——相邻帧的重叠区域携带探头运动的信息(散斑模式、组织结构的视差),早在 1997 年就有散斑去相关(speckle decorrelation)方法从图像对里恢复探头位移。深度学习时代,CNN 直接回归帧间变换(2018)、ConvLSTM 建模序列(2021)、transformer(2022)相继登场。但这个领域长期有个致命的方法学缺陷:每篇论文用自己的数据(挑战赛描述原文:“none of these studies used the same dataset”),且学习类方法的数据规模只有 12-40 名受试者——方法之间无法公平比较,"SOTA"无从谈起。

另一个被测量揭穿的幻觉是"局部准=全局准":帧间(相邻两帧)的位移估计误差可以做到亚毫米,但把几百帧的变换递归乘起来,误差像复利一样累积成轨迹漂移(cumulative drift)——全局上探头已经"飘"出几个厘米。只报告一个误差指标的工作,往往把这两层混在一起;要诊断方法的真实能力,需要把 local 与 global、pixel 与 landmark 四个维度分开测。

TUS-REC2025 的回答分三层。第一层是数据:85 名志愿者的左右前臂、170 段扫描、约 26 万帧,每帧带光学跟踪金标准——这是免跟踪重建方向规模最大的公开基准之一(此前学习类方法普遍只有 12-40 人),并且扫描协议加入了旋转等多样探头运动,比前作 2024 版更难。第二层是任务定义:参赛者输出的不是 3D 体也不是轨迹矩阵,而是四组位移向量(相对首帧/前一帧 × 逐像素/逐标志点),把"怎么重建"的自由留给方法、把"评什么"的口径统一给社区。第三层是评估:四项毫米误差(GPE/GLE/LPE/LLE)各自归一化后等权平均为 final score,"aggregate then rank"防止单一指标劫持排名——这套设计直接暴露了误差结构:冠军的相邻帧误差已经亚毫米(近乎解决),而整段序列的全局漂移仍在毫米级(未解决)。

§0 读法三则:

  1. 这个条目是"挑战赛+数据集+基准"三合一:本体是 170 段带金标准的扫描序列,衍生品是 leaderboard 与 baseline 代码,副产品是一套可复用的免跟踪重建评测协议——三者许可与获取方式各不相同(§5)。
  2. 全文统计数字均出自官网四页、Zenodo 官方记录与前作论文(arXiv:2506.21765);帧数、许可、DOI 等多口径处已在坑点与 §9 存照。
  3. 检索时注意:主 DOI(10.5281/zenodo.15052755)的记录本体只是一份 19 页 PDF 结构化描述,不是数据——数据在 Train 与 Validation 两条独立记录里(坑 2)。

§1 数据集速览:十问十答

Q1:TUS-REC2025 到底是什么——数据集、论文还是比赛?
三合一。它是 MICCAI 2025 官方挑战赛(2025-09-27 于韩国大田现场举办),赛题围绕一个公开数据集展开:UCL 团队采集的 85 名志愿者 170 段前臂自由手持超声。挑战赛以 Zenodo 记录群 + GitHub 官网 + docker 提交系统运行,会后转为 open call(post-challenge 截止 2025-10-13),持续接收提交并更新 leaderboard。

Q2:"Trackerless"是说数据没有跟踪器吗?
恰恰相反——这是个高频误读。数据集每帧都带 NDI Polaris Vicra 光学跟踪器记录的金标准位姿,用于评测;"trackerless"说的是参赛算法不得使用任何外部跟踪器输入,必须纯靠图像序列推断探头运动。名实之辨详见坑 1:数据有跟踪、任务免跟踪、金标准供评测,三句话缺一不可。

Q3:数据从哪来、扫的什么部位?
UCL 采集,85 名健康志愿者的左、右前臂(in vivo),每人 2 段扫描共 170 段。队列刻意覆盖多种族、多性别、多年龄(官网原文 “racial-, gender-, age-diverse”);无特殊排除标准(超声凝胶过敏与皮肤病患者除外)。选前臂是因为其伦理与实操可行性已被前人反复验证——这是通向更复杂临床应用前的"第一步"设计。

Q4:规模有多大?帧数到底是多少?
170 段、约 26 万帧。但"约"字下有四套口径并存:~1500 帧/段(官网 Images 段)、~1600 帧/段(Train Zenodo)、~260k 总帧(挑战赛描述)、272,000(邀请函 PDF);官网划分段给出 train/val/test ≈ 164k/9k/90k(总 ~263k)。本条目以官网划分段为主口径,其余存照(坑 3)。划分:50/3/32 名受试者 = 100/6/64 段。

Q5:参赛者要输出什么——3D 体?轨迹?
都不是(严格说:不只是)。官方要求输出四组位移向量:GP(相对首帧逐像素)、GL(相对首帧逐标志点)、LP(相对前一帧逐像素)、LL(相对前一帧逐标志点)。评测方用它们重建成帧并与金标准比对。输出表示刻意避开刚体矩阵——旋转矩阵参数化有 gimbal lock 与局部极小的坑(§3.3)。内部方法随便你用什么,网络输出位移向量即可。

Q6:怎么排名?
四项毫米级误差:GPE/GLE(global 像素/标志点重建误差)与 LPE/LLE(local 同两项),各自按"金标准=0 分、全单位矩阵=最差"归一化到 [0,1],再以 final score = 0.25×(GPE*+GLE*+LPE*+LLE*) 汇总,测试集全扫描平均,保留 3 位小数,越高越好;同分时 runtime 短者列前(总时长上限 6 小时)。这是 “aggregate then rank” 范式(Maier-Hein et al. 2018)。

Q7:比赛结果如何?
正式榜 7 个实体:冠军 ImFusion(德国/加拿大联合团队)final score 0.622±0.071(GPE 9.249 mm);亚军深圳大学 MUSIC Lab 0.620±0.060(GPE 9.851 mm);季军 COCHE(香港)0.503±0.134;主办方 baseline 仅 0.163±0.216。最有信息量的不是名次而是误差结构:冠军 local 误差 LPE 0.153 mm / LLE 0.120 mm(亚毫米,近乎解决),global 误差 GPE 9.2 mm(毫米级漂移仍在)——四指标设计正是为了让这一结构显形。

Q8:我现在能拿到什么?
三层:挑战赛结构化描述记录(19 页 PDF,open,CC BY-4.0);验证数据集(open,2025-06-23 发布,结构与测试集相同);训练数据集(restricted——Zenodo 文件区为空,经注册表单/访问请求发放)。测试集 64 段不公开,只能通过 docker 提交由主办方在测试集上运行。

Q9:能商用吗?
训练与验证数据不可。Train 记录 Data Usage Policy 原文:“commercial use of the training and validation data is prohibited”,许可 CC BY-NC-SA-4.0(署名-非商业-相同方式共享)。注意与挑战赛描述记录的 CC BY-4.0 分开——描述文档可以宽松引用,数据本体必须按 NC-SA 对待(坑 4)。

Q10:为什么它对 AI-Ready 重要?
它是"注册制训练数据 + 开放验证数据 + 不公开测试集 + docker 提交评测"的挑战赛光谱标准型:本体 AI-Ready 得分被 restricted 训练数据拖低,但官方 baseline 代码(Python 公开)、结构化描述(BIAS 模板 19 页)与开放验证集补上了可复现性入口——想立即上手的人可以用验证数据+baseline 代码跑通全管线,想出成绩的人必须走注册通道,想比测试分数的人只能提交 docker。三种入口对应三种用户,这种分层设计本身就是 AI-Ready 评估的活教材。

§1 补充:五个高频误解快查表

误解 事实 依据
“Trackerless 数据集 = 没有跟踪信息” 恰相反:每帧都带 NDI Polaris Vicra 光学跟踪金标准位姿;“trackerless” 只约束参赛算法的输入 官网 data.html “Labels / Transformations” 段
“DOI 10.5281/zenodo.15052755 能下到超声数据” 该记录本体是一个 107,736 字节的 19 页 PDF(挑战赛结构化描述);数据在独立记录 Zenodo API files 字段
“Train 集在 Zenodo 上点 Download 就能下” Train 记录 access_right=restricted、files 数组为空,需注册表单/访问请求 Zenodo API + Train 记录页
“数据集许可 CC BY-4.0” CC BY-4.0 只属于挑战赛描述 PDF;数据本体是 CC BY-NC-SA-4.0(禁商用) 两条 Zenodo 记录的 license 字段
“官方挑战赛论文已发表,引用它即可” 联合挑战论文主办方预告 “expected by end of 2026”,截至 2026-09 未发表 Train 记录 Data Usage Policy 节

§1 补充:数据集的四条使用路径

  1. 训练路径:Train 100 段序列 + 可选并入的 TUS-REC2024 四条记录——学习方法的主粮仓;受试者 ID 跨年一致,可显式做跨协议实验设计。
  2. 调参与验证路径:Validation 6 段序列结构与测试集完全相同(frames/ 与 transfs/ 分开 + dataset_keys.h5)——官方在此"提前演练"提交评测时的数据形态,走通管线再提交。
  3. 上榜路径:docker 化算法经 Microsoft Forms 提交,主办方在私有不公开的 64 段测试序列上评测——这是拿到官方 final score 的唯一途径。
  4. 方法研究路径:只读 19 页 BIAS 结构化描述 PDF(CC BY-4.0 直链)+ 官网 assessment 页,即可完整理解任务定义、指标公式与排名策略——不碰数据也能做评测方法学研究。

§2 数据构成与规格

2.1 队列、部位与规模

属性 规格
志愿者数 85 名(健康志愿者,in vivo)
扫描部位 左、右前臂(每人各 1 段)
扫描序列总数 170 段(85 × 2)
队列多样性 “racial-, gender-, age-diverse subject cohort”(官网原文;人口学细分未披露)
排除标准 超声凝胶过敏、皮肤病患者;前臂本身均健康
采集方 UCL(University College London)
扫描帧率 20 fps
单段时长 约 75-80 秒(按 ~1500-1600 帧/20 fps 折算)

为什么是前臂?挑战赛描述给出的理由是"伦理与实操可行性"(ethically and practically feasible):前臂志愿者研究在文献里已被反复采用(Prevost et al. 2018、Luo et al. 2022),无病灶、无伦理重负、扫描协议可标准化——它是通向更复杂临床应用(器官、胎儿、介入)之前的方法学试验场。这个设计的代价是:在本基准上练出的模型不能直接宣称适用于临床部位;它的价值在于方法与评测协议,不在于即用的临床模型。

队列规模的意义要放在领域背景里看:此前学习类免跟踪重建研究"relied on data from only 12-40 subjects"(挑战赛描述原文),85 人是此前研究规模的 2-7 倍,是免跟踪重建方向规模最大的公开基准之一。更大的队列意味着序列内与序列间的多样性(体型、皮肤、肌肉形态、扫查手法),模型不太可能靠记住几十个人的散斑纹理"作弊"。

2.2 设备与采集参数

参数 值
超声主机 Ultrasonix(BK, Europe)
探头 4DC7-3/40 凸阵探头(convex transducer)
跟踪设备 NDI Polaris Vicra 光学跟踪器(Northern Digital Inc., Canada)
分辨率 480 × 640(H × W)
帧率 20 fps
超声频率 6 MHz
动态范围 83 dB
总增益 48%
扫描深度 9 cm
散斑降噪 关闭(无 speckle reduction——保留原始散斑纹理)
时间同步 数据已做时间标定(temporally calibrated)——跟踪位姿与 US 帧时间戳对齐

三处参数选择值得展开:

  1. 凸阵探头而非线阵:凸阵视野呈扇形、深部更宽,是腹部与产科的常规配置;线阵(浅表高频)才是前臂浅表结构的"自然"选择。主办方选凸阵是为了让基准更接近未来临床应用(深部器官)的成像几何,而不是为浅表结构优化。对算法的含义:扇形视野下像素的物理位置随深度变化,逐像素位移的语义要结合标定矩阵解读。
  2. 关闭散斑降噪:散斑(speckle)既是免跟踪重建的信息载体(散斑去相关测位移的经典原理),也是深度模型的输入纹理。关闭降噪保留原始散斑,让"传统方法与深度方法在同一起跑线"——这是基准公平性的细节。
  3. 20 fps × 时间标定:帧间运动幅度与帧率直接相关(帧率低→帧间位移大→估计更难)。20 fps 属于常规采集帧率;时间标定保证第 i 帧对应的跟踪位姿就是该帧曝光时刻的位姿,评测的金标准没有时间错位。

2.3 扫描协议:扇摆、摇摆与 2025 新增的旋转

扫描协议是**旋转式(rotation)**的标准化动作序列:

  1. 探头置于肘部附近的固定接触点;
  2. 先沿皮肤-探头界面做短轴扇摆(short-axis fanning):探头以接触点为轴 side-to-side 扇形摆动;
  3. 再沿长轴摇摆(long-axis rocking):垂直方向摇摆;
  4. 探头旋转约 90 度,重复上述扇摆与摇摆。

与 TUS-REC2024 的 non-rotation 协议相比,2025 版加入旋转/倾斜等多样探头运动。这不是随意加难——临床扫查中探头旋转与斜角进针是常态(避开骨骼遮挡、改善声耦合),2024 的固定轴向协议训练出的方法在"探头转了 90 度"的场景下未必还成立。对参赛者的直接冲击是:帧间变换不再局限在小角度小位移区间,序列建模方法要处理更大姿态跨度;也意味着 2024 模型不能无成本迁移到 2025(这正是主办方想测的泛化差)。

2.4 划分与帧数口径

官方权威划分(官网 data.html):

集合 受试者数 扫描数 帧数(约) 可获取性
Train 50 100 ~164k restricted(注册获取)
Validation 3 6 ~9k open(Zenodo 直下)
Test 32 64 ~90k 不公开(docker 提交评测)
合计 85 170 ~263k —

帧数四口径存照(详见坑 3):

口径来源 说法
官网 data.html Images 段 “around 1500 frames for each scan”(×170 ≈ 255k)
Train Zenodo 记录 “around 1600 frames for each scan”(train 100 段 ≈ 160k)
Zenodo 挑战赛描述 “170 scans with about 260k frames”
邀请函 PDF “approximately optically-tracked 272,000 frames in total”
官网 data.html 划分段 train/val/test ≈ 164k/9k/90k(总 ~263k)

处理原则:成稿与引用以官网划分段(~164k/~9k/~90k)为主口径——它粒度最细、与划分结构直接对应;"约 26 万帧"作为概括表述可接受;272,000 是邀请函口径,与其他口径差约 3%,疑为含金标准位姿帧或早期统计,不建议在正式表述中使用。

2.5 文件结构与 h5 数据字典

训练集目录结构(官网 data.html 目录树逐字口径):

Freehand_US_data_train_2025/
  frames_transfs/
    000/
      RH_rotation.h5     # 受试者 000 右前臂旋转扫描:frames + tforms 同文件
      LH_rotation.h5     # 受试者 000 左前臂旋转扫描
    001/
      ...
    ...(共 50 个受试者文件夹,编号 000 起)
  landmarks/
    landmark_000.h5      # 每受试者一个标志点文件(含其 2 段扫描的标志点)
    ...
  calib_matrix.csv       # 标定矩阵

h5 数据字典:

键 形状 语义
frames [N, 480, 640] 灰度超声帧序列(20 fps)
tforms [N, 4, 4] 每帧金标准位姿:tracking tool space → optical camera space 的 4×4 齐次变换矩阵

landmarks 文件(每受试者一个 .h5,每段 100 个标志点):

列 含义 索引起点
第 1 列 帧索引(该标志点出现在哪一帧) 0 起
第 2/3 列 图像坐标系内的像素坐标 1 起(与标定一致)

两处索引起点不一致(帧 0 起、像素 1 起)是复现时的经典坑——写评测脚本时若把两者起点弄混,误差会以"恰好差一帧/一像素"的形式出现且不易察觉(坑 6)。

calib_matrix.csv 含两个关键量:scaling_from_pixel_to_mm(像素-毫米缩放)与 image → tracking tool space 的刚体变换。标定采用pinhead 法(针尖标定)。评测时,预测位移向量经标定矩阵进入毫米空间与金标准重建帧比对——所有 GPE/GLE/LPE/LLE 的"毫米"都由此而来。

验证集结构差异(与训练集不同、与测试集相同):

frames/         # 帧序列单独一个文件夹
transfs/        # 金标准位姿单独一个文件夹
dataset_keys.h5 # 全部扫描路径清单

验证集把 frames 与 transfs 分开存放并附 dataset_keys.h5 索引——这个结构正是测试集的结构,主办方让验证集"提前演练"提交评测时的数据形态。

文件名笔误存照:官网目录树注释写 RH_rotation.h5,Train Zenodo 描述写 RH_rotating.h5——同一文件两种写法(坑 7)。实际以解压后文件名为准。

2.6 与 TUS-REC2024 数据的衔接

TUS-REC2024 数据集(Zenodo 四条记录:Train Part1/2/3 + Validation)在 2025 年仍开放,作为可选附加训练数据。两届数据有一个人性化设计:patient IDs 一致——2024 的某号受试者与 2025 的同号受试者之间有可控的对应关系,参与者在合并训练时可以显式控制数据分布(避免同一人在两届数据里同时出现在训练与验证侧的泄漏)。

两届数据的差异在扫描协议:2024 为 non-rotation(固定轴向扇摆/摇摆),2025 加入旋转。这意味着"2024 数据 + 2025 任务"组合在分布上是有缝的——用 2024 数据预训练、2025 数据微调是官方认可的合法策略,但效果如何正是 leaderboard 上各队的隐形竞赛维度。2024 四条记录的 DOI 还有 concept/version 双写现象(官网用 concept DOI 11178508/11180794/11355499,Train 2025 页内链接用 version DOI 11178509/11180795/11355500——同一数据两套链接,坑 5 的延伸案例)。

2.7 使用前检查清单:拿到数据后先做什么

restricted 训练数据发放后,建议按顺序执行以下检查(每条对应一个已知坑或易错点):

步骤 检查项 对应坑
1 解压后 `ls -R head` 核对目录树:50 个受试者文件夹 × RH/LH 两个 .h5 + landmarks/ + calib_matrix.csv
2 文件名以实际为准建索引(RH_rotation/RH_rotating 两写并存,勿写死) 坑 7
3 逐文件读 h5 键:frames [N,480,640] 与 tforms [N,4,4] 帧数一致性 —
4 tforms 有限性检查(NaN/Inf 扫描)与齐次性检查(末行 [0,0,0,1]) —
5 landmarks 帧索引范围 [0, N-1] 与像素坐标范围 [1, 640]/[1, 480] 边界核查 坑 6
6 calib_matrix.csv 读入后与官网参数对照(480×640、9 cm 深度) —
7 抽 1 段扫描用 tforms 重建粗体并可视化(哪怕只是深度图投影)——肉眼确认位姿合理 —
8 记录你使用的帧数统计口径并写进实验配置(~164k 主口径) 坑 3

这套清单的价值在于把"数据看起来对"变成"数据确认对":本条目存照的全部文档级不一致(坑 3/6/7)都发生在"没跑 sanity check 直接上全量"的工作流里。第 7 步的可视化尤其重要——位姿链路错误(标定方向搞反、坐标系左右混淆)在数字指标上可能只表现为"分数偏低",在重建图上则一眼可见(体翻转、蛇形扭曲)。

§3 任务定义与输出表示

3.1 任务形式化

输入:一段 2D 超声帧序列 I₁, I₂, …, I_N(N ≈ 1500-1600,20 fps)。
目标:估计帧间变换 {T_j←i},使得仅用帧序列与其几何关系即可重建出与金标准重建体对齐的 3D 体。
禁止:使用任何外部位置跟踪器(光学/电磁/机械)信息作为输入。
金标准:NDI Polaris Vicra 光学跟踪位姿——只用于评测,不进入算法。

任务的麻烦在误差的复利结构:重建体是由逐帧变换递归拼接而成,第 j 帧相对首帧的位姿是前 j−1 个帧间变换的连乘积。相邻帧估计哪怕只有 0.1 度的角度误差与 0.05 mm 的平移误差,几百帧连乘后全局漂移也可达厘米级。这就是为什么 local 指标(相邻帧)近乎解决而 global 指标(全程序列)仍在毫米级——§6 的结果会把这个结构摆到台面上。

3.2 四组位移向量:GP/GL/LP/LL

官方要求的输出不是轨迹矩阵也不是 3D 体,而是四组位移向量(displacement vectors):

组 参考系 对象 语义
GP(global pixel) 首帧(global reference frame) 逐像素 每个像素从第 i 帧回到首帧坐标系的三维位移
GL(global landmark) 首帧 逐标志点 100 个预定义解剖标志点相对首帧的位移
LP(local pixel) 前一帧(local reference frame) 逐像素 每个像素从第 i 帧到第 i−1 帧的位移
LL(local landmark) 前一帧 逐标志点 标志点相对前一帧的位移

设计意图有三层:

  1. 统一评测口径:所有参赛队输出同构的四组量,评测方可以统一地"从位移重建帧→与金标准重建帧比对",不再需要为每家的输出格式写适配器(对比 2024 届的多样化提交格式)。
  2. 分解误差维度:global/local × pixel/landmark 的 2×2 正好把"漂移"与"局部估计"、"全场误差"与"关键结构误差"四个维度解耦——§6 的解读全靠这个分解。
  3. 不强制刚体:位移向量可以编码非刚体的形变残差(探头压力导致的组织形变),比强制输出 6-DoF 刚体矩阵的表达上限更高。

3.3 为什么不要求输出刚体矩阵

官网给出的理由(大意):旋转矩阵的欧拉角参数化存在 gimbal lock(万向节死锁),旋转估计的数值优化容易陷入局部极小;位移向量表示规避了这些坑,“允许近刚体但量化更准的重建”,同时不限制方法内部的设计自由。

工程上的注脚:网络最后一层输出 3 个平移分量 + 每像素/每标志点的位移残差,激活函数与损失设计都比"输出合法旋转矩阵"(需要正交化或四元数归一化)简单得多。监督信号(金标准变换的位移分解)是连续的、无奇异点的——这对回归任务的训练稳定性是实打实的友好。

3.4 金标准与标定:跟踪器在数据里、不在输入里

金标准链路:NDI Polaris Vicra 光学跟踪器 → 探头上的跟踪工具位姿(tool space)→ 经 calib_matrix.csv 的刚体变换对齐到图像空间 → 逐帧 tforms [N,4,4]。时间维度上,数据已做时间标定(temporally calibrated),位姿与帧时间戳对齐。

评测管线:参赛位移向量 → 重建各帧(经标定进入毫米空间)→ 与金标准重建帧逐像素/逐标志点算欧氏距离(mm)→ 按四指标汇总。跟踪位姿从头到尾只在评测侧出现——这正是本挑战赛"数据带跟踪、任务免跟踪"结构的落点(坑 1 的技术细节层)。

一个评测设计的细节:金标准本身的误差(光学跟踪精度 ≈ 亚毫米级 + 标定误差)构成所有指标的"地板"。归一化设计(§4.2)把"金标准重建"的误差定义为 0——即默认金标准无误差;这是基准的约定而非物理事实,解读极端精细的误差差异(如 0.001 mm 级)时应记得地板的存在。

3.5 Baseline:主办方自留的起跑线

Baseline 是主办方 UCL 的 Li et al. 系列算法(代码公开于 GitHub repo QiLi111/TUS-REC2025-Challenge_baseline,Python),方法谱系对应三篇论文:

论文 年份/场合 贡献
序列建模 + 未来/过去帧辅助变换估计 ISBI 2023(doi:10.1109/ISBI53787.2023.10230773) 帧间变换估计的序列化基础
长期依赖建模 IEEE TBME 2024(doi:10.1109/TBME.2023.3325551) 跨长序列的依赖捕捉
非刚体扩展 MICCAI 2024(doi:10.1007/978-3-031-72083-3_64) 位移表示下的非刚体处理

Baseline 的 final score 只有 0.163±0.216(GPE 26.110 mm)——与冠军 0.622 差了近 4 倍。这个差距本身是信息:它说明基准有充足的提升空间(不是"人人接近满分"的失效基准),同时 baseline 公开代码给了后来者一个能跑通全流程的真实起点。引用政策要求:使用数据须引用未来的 summary paper + 上述三篇方法论文(§5.4)。

3.6 从位移向量到 3D 体:重建管线拆解

参赛者输出四组位移向量之后,到"3D 体"之间发生了什么?把评测方的重建管线拆开看(本地复现时同理自建):

位移向量(GP/GL/LP/LL,任意一组)
   |  经 calib_matrix.csv:像素坐标 x scaling_from_pixel_to_mm → 毫米空间
逐帧像素的毫米空间坐标
   |  位移向量施加:源帧像素 → 目标参考系(首帧或前一帧)位置
参考系下的逐帧点云
   |  全帧融合:体素栅格化(插值:最近邻/线性)
3D 体(voxel grid)
   |  与金标准重建体逐像素对齐比较
GPE/GLE/LPE/LLE(mm)

三处工程细节决定复现质量:

  1. 插值选择:体素化时的插值策略直接影响逐像素误差的下限——最近邻引入量化误差,线性插值平滑散斑。评测方的插值实现是"地板误差"的一部分;自建管线时对齐官方实现(或容忍 0.1 mm 级系统差)。
  2. 参考系一致性:global 组(GP/GL)以首帧为参考、local 组(LP/LL)以前一帧为参考——混用参考系是新手最常见的管线 bug(表现为 local 指标异常大)。
  3. 凸阵几何:像素到毫米的映射沿探头扇形几何展开(凸阵的曲率半径与张角由标定隐含),不能套用线阵的等距假设——直接用 scaling × pixel index 会在深部引入系统性位置偏差。

3.7 任务视角定位:配准、里程计与 SLAM 的亲缘

免跟踪重建在计算机视觉的任务谱系里有三个近亲,理解亲缘关系有助于方法迁移:

近亲任务 共享什么 本任务的特殊性
图像配准(registration) 帧间变换估计的核心几何 配准通常一次估一对,这里要估计整条序列且误差累积
视觉里程计(visual odometry) 相邻帧运动估计 + 累积漂移问题 US 无纹理角点可用,散斑/组织结构替代自然特征
SLAM 漂移校正、回环检测的思想 US 场景"重访"定义模糊(软组织形变+声窗变化),经典回环难以直接搬用

2025 届结果(§6.3)已经证明:帧间估计(≈里程计的前端)接近解决、全局漂移(≈里程计的后端/回环)未解决——这意味着 SLAM 社区的后端思想(位姿图优化、回环约束、因子图)是尚未被充分开采的方法迁移方向。反方向的迁移也存在:US 重建的"可微重建"思想(重建损失直接回传到位姿估计)在传统视觉里程计里并不常见,是医学影像侧对更广社区可能的反哺。

对库内检索者的定位参考:本条目是库内少有的"几何重建型"条目——大多数影像条目是分类/分割/检测任务(输出语义标签),本条目输出几何变换(输出连续位姿场),评测哲学(毫米误差 vs Dice/accuracy)完全不同。做跨条目方法迁移时,先把"任务输出类型"对齐再谈网络结构。

§4 评估体系:四指标、归一化排名与规则细节

4.1 四项毫米误差的定义

指标 全称 参考系 对象 含义
GPE Global Pixel reconstruction error 相对首帧重建 全部像素 预测重建帧 vs 金标准重建帧的全像素平均欧氏距离(mm)
GLE Global Landmark reconstruction error 相对首帧重建 100 标志点 同上但只对预定义解剖标志点平均(mm)
LPE Local Pixel reconstruction error 相对前一帧重建 全部像素 local 参考系的逐像素误差(mm)
LLE Local Landmark reconstruction error 相对前一帧重建 100 标志点 local 参考系的标志点误差(mm)

读法:第一维(global/local)区分"整段序列累积到位"与"相邻帧估计";第二维(pixel/landmark)区分"全场几何"与"关键解剖结构"。GPE 9 mm 而 LPE 0.15 mm 的组合意味着:帧到帧贴得很准,但几百帧叠起来漂了 9 mm——这正是 §6 结果解读的核心结构。

为什么用"重建误差"而非"轨迹误差"?官方引用的方法学论证:Luo et al. 2023(Medical Image Analysis,doi:10.1016/j.media.2023.102810)论证距离空间误差优于变换参数空间误差(旋转角/平移的参数差不直接映射到临床关心的几何偏差);Wein et al. 2020(doi:10.1007/978-3-030-59716-0_49)同向。落到 Ultrasound 场景:医生在乎的是"重建的体长歪了没有",不是"旋转向量的第三个分量差了几度"。

4.2 归一化与排名:“aggregate then rank”

四项指标各自归一化到 [0,1](Maier-Hein et al. 2018,doi:10.1038/s41467-018-07619-7 的 “aggregate then rank” 范式):

GPE* = (GPE − largest_GPE) / (smallest_GPE − largest_GPE)
其中 smallest_GPE = 0(金标准重建的误差,定义为地板)
     largest_GPE  = 全部使用单位矩阵(identity transform)重建的误差(定义为天花板)

即:金标准=1 分,全躺平(什么都不估、每帧原位叠加)=0 分。GLE*/LPE*/LLE* 同构。

final score = 0.25·GPE + 0.25·GLE + 0.25·LPE* + 0.25·LLE***,对测试集所有扫描取平均,保留 3 位小数,越高越好。

另设四组参考分(不参与正式排名,供方法画像):

参考分 组成 画像维度
global score 0.5·GPE* + 0.5·GLE* 长程重建能力
local score 0.5·LPE* + 0.5·LLE* 相邻帧估计能力
pixel score 0.5·GPE* + 0.5·LPE* 全场几何能力
landmark score 0.5·GLE* + 0.5·LLE* 关键结构能力

归一化的用意是抗量纲劫持:GPE 是全像素平均(数值毫米级),LPE 是相邻帧误差(数值亚毫米级)——若直接加权平均原始毫米数,LPE/LLE 的贡献会被 GPE/GLE 淹没。各自归一化后再等权,四项才真正"等票"。这套设计的代价是:分数不可跨届直比(天花板 largest_GPE 取决于当届数据与金标准重建的实现),2024 与 2025 的 final score 不在一个标尺上(坑 8 的延伸)。

4.3 Runtime 与提交规则

规则 内容
runtime 定义 预测全部帧位姿的耗时,按扫描平均
同分规则 final score 相同时,runtime 短者列前
硬上限 全部测试扫描总 runtime ≤ 6 小时
失效条款 代码跑不通或指标算不出 = 0 分
提交形态 dockerized 算法,主办方在测试集上运行
参与政策 fully automatic 方法;公开+私有数据均允许但必须披露
机构回避 主办方所在机构成员可参加但不获奖、不进 leaderboard

三条规则的导向值得注意:6 小时上限与同分短者优先,是把"效率"写进评测基因(临床落地场景里重建速度不是奢侈品);0 分条款把可复现性变成硬约束(提交的 docker 必须真能跑);主办方回避条款是 “aggregate then rank” 系列方法学倡议里的标准防利益冲突设计。

4.4 刻意不纳入的指标

官网明确列出不纳入的指标:final drift(终帧漂移)、Dice overlap 等——原文理由是为精简评估(尽管这些指标在文献中常用)。这个取舍可以商榷:Dice 需要分割定义(前臂数据无病灶分割金标准,定义成本高),final drift 与 GPE 高度相关;但在解读时要注意——没有纳入不等于没有发生:一个 final score 0.62 的方法,其终帧漂移可能仍然显著,使用者不能因为 Dice 不在榜单就默认重建体"分割可用"。指标集定义了基准测什么,也定义了它不测什么。

4.5 读懂分数的四条守则

  1. 别只报 final score。0.622 与 0.620 的冠亚之争(差 0.002)远小于四指标内部的误差结构差异(GPE 9.249 vs 9.851 mm)——任何严肃的方法比较都应四项并报,最好附四组参考分画像。
  2. 分数是归一化的,别当毫米用。0.5 分不等于"误差是金标准与躺平的一半"——归一化是线性的,但测试集平均与 3 位小数舍入都在其上;要报毫米数请回 GPE/GLE/LPE/LLE 原始值。
  3. 同届内比名次,跨届比毫米。final score 不可跨届直比(天花板不同);GPE 等原始毫米误差跨届可比性更强,但仍受扫描协议差异(2025 加了旋转)限制。
  4. runtime 是并列维度。临床可部署性语境下,26.7 s(冠军)与 107.5 s(亚军)的差距和 0.002 分的差距可能同等重要——榜单把它作为同分裁决,方法论研究者应把它作为一等公民分析。

4.6 归一化数值算例:一个假想扫描上的完整计算

设某条测试扫描上,某提交方法的四项原始误差为:GPE = 12.000 mm、GLE = 9.000 mm、LPE = 0.200 mm、LLE = 0.160 mm。该扫描的"天花板"(全部用单位矩阵重建的误差)为:largest_GPE = 40.000 mm、largest_GLE = 30.000 mm、largest_LPE = 0.400 mm、largest_LLE = 0.320 mm;地板(金标准重建)全部为 0。

GPE* = (12.000 − 40.000) / (0 − 40.000) = 28.000 / 40.000 = 0.700
GLE* = (9.000 − 30.000) / (0 − 30.000)  = 21.000 / 30.000 = 0.700
LPE* = (0.200 − 0.400) / (0 − 0.400)    = 0.200 / 0.400   = 0.500
LLE* = (0.160 − 0.320) / (0 − 0.320)    = 0.160 / 0.320   = 0.500

final score(该扫描)= 0.25×0.700 + 0.25×0.700 + 0.25×0.500 + 0.25×0.500
                    = 0.175 + 0.175 + 0.125 + 0.125 = 0.600

三个读数:其一,“全躺平”(所有帧原位叠加)在这条扫描上正好对应 0 分——单位矩阵不是随意的坏方法,而是"什么都不估"的精确语义;其二,global 与 local 在归一化后可比(原始量纲差 100 倍的两类误差被拉回同一标尺);其三,该方法的 0.600 是"单扫描分",最终榜分还要在 64 段测试扫描上平均——SD 列(如冠军 final 0.622±0.071)描述的正是这个跨扫描波动。

4.7 指标设计三问三答

问:为什么 pixel 与 landmark 要分开测?
答:全像素平均(GPE/LPE)对"整幅图像的几何一致性"敏感,landmark 平均(GLE/LLE)对"解剖结构落位"敏感。一个方法可能全场平均不错但关键结构偏移( landmark 差),也可能标志点贴准了但全场分布歪——两组指标交叉才能定位误差的"形态"。

问:local 已经亚毫米了,为什么还要认真测 global?
答:因为两者测的是方法的不同组件。local 只考"帧间变换估计"这一个环节;global 考"估计 + 递归累积"的复合结果。临床上一个完整的扫查重建必须走完几百帧的累积链——global 不过关,local 再准也不可部署。2025 榜单 local 近解决而 global 未解决,正是把"该往哪里投入研究"指了出来。

问:为什么不用 Dice/重叠度这类"下游指标"?
答:官网 rationale 节给出了取舍——前臂数据没有分割金标准,Dice 的定义成本高且会引入分割器自身的偏差;GPE/GLE/LPE/LLE 与金标准重建帧直接比对,评估链路里没有第三方模型。基准设计的一般原则:每引入一个中间模型,评测的方差来源就多一层。

4.8 评估管线的工程实现:从提交到分数

把"一个 docker 镜像如何变成 leaderboard 上的一行"完整走一遍,评测的工程闭环如下:

阶段 动作 失败模式
1. 接收 提交表单登记 + docker 镜像入库 镜像过大/依赖缺失
2. 运行 主办方在测试集 64 段上逐一执行 代码跑不通 → 0 分(硬条款)
3. 计时 每段预测耗时记录,全扫描求和 超 6 小时上限 → 判不合格
4. 重建 位移向量 → 毫米空间 → 重建体 插值/参考系实现不一致
5. 误差 四项毫米误差逐段计算 索引起点混淆(坑 6)
6. 归一化 identity 天花板在测试集实测 天花板实现差异(跨届不可比的根源)
7. 汇总 final score 3 位小数 + runtime 平均 —
8. 排名 分数降序;同分 runtime 短者前 —

这张表对参赛者的含义:阶段 2/3 的失败模式与算法质量无关却直接清零——docker 环境冻结(含 CUDA 版本、依赖锁版本)与 runtime 预算管理是工程必修课;阶段 4-6 的实现细节在官方评估代码与验证集上先行对齐,是"验证集分数"与"测试集分数"可迁移性的前提。

§5 获取与许可:记录群、双 DOI 与注册制

5.1 四条(组)Zenodo 记录全景

记录 concept DOI version DOI 发布日 访问 许可 本体
挑战赛结构化描述 10.5281/zenodo.15052755 10.5281/zenodo.15119085(v2) 2025-03-21(v2 modified 2025-04-10) open CC BY-4.0 19 页 BIAS 模板 PDF(107,736 字节)
Train Dataset 10.5281/zenodo.15224703 10.5281/zenodo.15224704 2025-04-28(v1.0.0;modified 2025-11-17,revision 16) restricted CC BY-NC-SA-4.0 Zenodo 文件区为空——经注册/访问请求发放
Validation Dataset 10.5281/zenodo.15699958 10.5281/zenodo.15699959 2025-06-23 open open access 帧序列+位姿+dataset_keys.h5
前作 TUS-REC2024(可选附加训练数据) 11178508 / 11180794 / 11355499(Train Part1/2/3)+ Validation 12979481 11178509 / 11180795 / 11355500 等 2024 Train restricted / Validation open NC-SA 系 四条独立记录

抓取时点(2026-09-26)的 Zenodo stats:描述记录 views 1406 / downloads 1317;Train 记录 views 3109 / downloads 613——下载比(downloads/views)显著低于 open 记录的常态,与 restricted 的门槛一致。

主记录不是数据(坑 2):任务头给的概念 DOI 15052755 是挑战赛的"户口本"——19 页 PDF 描述(BIAS Initiative 结构化模板,含挑战赛目的/数据/任务/评估/规则全景),本体没有一帧超声。要数据去 Train(15224704)与 Validation(15699958);要理解规则读 15052755 的 PDF。

5.2 双 DOI 体系

Zenodo 为每条记录同时发两个 DOI:concept DOI(指向该概念的全部版本,跨版本稳定)与 version DOI(指向具体某个版本)。TUS-REC2025 三条 2025 记录都有两套(见上表),OpenAIRE 同时收录。引用建议:引 concept DOI(15052755/15224703/15699958)保证引用不因版本更新失效;引用特定实验口径(如"v1.0.0 训练数据")时才用 version DOI。2024 前作记录在官网与 Zenodo 页内就有 concept/version 两套链接并存的实际案例(坑 5)。

5.3 注册与提交的实操流程

想参赛/出测试分:
  1) Microsoft Forms 注册表单(一式)——注册开放自 2025-04-01
  2) 训练数据经 Train 记录的访问请求/注册表单发放(restricted 通道)
  3) 验证数据 Zenodo 直接下载(open)
  4) 本地训练 + 验证集自评(验证集结构与测试集相同,可演练)
  5) Microsoft Forms 提交表单(一式)+ docker 镜像提交
  6) 主办方在测试集(64 段)上运行 → 四指标 → leaderboard

只想复现/学习:
  验证数据(open)+ 官方 baseline 代码(GitHub)即可跑通全管线,
  无需注册——代价是没有训练数据,只能做推理侧或小样本实验。

时间线对照(官网口径,均 23:59 BST):2025-04-01 网站开放/注册开始 → 04-28 训练数据+baseline 发布 → 06-23 验证数据+提交代码发布 → 07-07 提交开始 → 08-31 提交截止 → 09-01 冠军公布 → 09-27 MICCAI 现场活动 → 10-13 赛后提交截止(post-challenge,open call 生命周期)。日期与 Zenodo 记录发布日精确互证(04-28=Train 发布日;06-23=Validation 发布日)。

5.4 许可与使用政策:三张通行证各管一段

资产 许可 关键条款
挑战赛描述 PDF CC BY-4.0 署名即可自由使用/分享/改编
Train + Validation 数据 CC BY-NC-SA-4.0 署名-非商业-相同方式共享;Data Usage Policy 原文 “commercial use of the training and validation data is prohibited”
测试集 无许可可言 不公开,仅 docker 提交评测
官方 baseline 代码 GitHub 公开(Python) 按 repo 内许可执行

Data Usage Policy 的完整口径(Train 记录原文大意):训练与验证数据可用于挑战范围及后续研究发表;商业用途禁止;用途模糊时应避免挑战范围外的再分发或使用。三处对使用者的实际约束:

  1. 商用模型训练出局:用本数据训练的模型权重若用于商业产品,许可链不清(NC 约束数据使用,模型权重的衍生属性在 NC-SA 语义下属灰色地带)——稳妥结论是不可商用。
  2. 再分发要同方式共享:SA 条款要求数据的再分发按 CC BY-NC-SA-4.0 继续——自建镜像、打包教程分发数据时注意携带许可。
  3. 引用义务:使用数据须引用(未来的)summary paper + Li 等三篇方法论文(ISBI 2023/TBME 2024/MICCAI 2024)。summary paper 截至 2026-09-26 未发表——引用回落到前作论文 arXiv:2506.21765 与三篇方法论文,并在 summary paper 发表后补引(坑 2 的引用侧)。

发表限制的细节:参赛团队可单独发表自己的方法,但只能在该联合挑战论文发表之后(expected by end of 2026)——这解释了为什么截至抓取时点,榜单上各队方法的正式论文极少(冠军 ImFusion 团队博客称其论文已挂 arXiv 但编号未公开核验)。

5.5 AI-Ready 评估:挑战赛光谱的标准型

以库内 AI-Ready 检查单过一遍:

检查项 评级 依据
机器可读元数据 良好 BIAS 结构化描述 19 页(含目的/数据/任务/评估/规则字段)+ Zenodo API 标准 JSON + GitHub 官网
公开直链 部分 Validation open;Train restricted 且 Zenodo 文件区为空——最大失分项
许可明确性 良好但异构 三层许可各自明确,但 CC BY-4.0(描述)与 CC BY-NC-SA-4.0(数据)并存,检索者易误引
可复现性 良好 baseline 代码公开(Python)+ 验证集结构与测试集一致 + docker 评测管线标准化
文档自洽 中 帧数四口径、文件名两写、2024 记录双链接——不影响主线但自动化抓取需指定主口径

综合:AI-Ready 等级"中"——元数据与可复现性基建高于多数挑战赛(BIAS 模板+baseline 代码+结构一致的验证集是三件加分器),可获取性被 restricted 训练数据与不公开测试集拖低(两者是挑战赛防泄漏的合理设计,但对 AI-Ready 得分是硬成本)。

5.6 库内可获取性光谱上的位置

档位 本条目对应
注册获取(restricted) 训练数据(Zenodo access request 通道)
平台托管 open 验证数据 + 描述记录(Zenodo)
不公开金标准 测试集(docker 提交评测)
代码资产直链 baseline 仓库(GitHub)

特色结构是"三层入口对应三类用户":学习者走 open 层(验证数据+baseline)、研究者走 restricted 层(注册拿训练数据)、竞争者走 docker 层(提交出测试分)。与纯"打包放 Zenodo"的单层公开相比,这种分层是挑战赛数据集在防泄漏与可及性之间的折中解——但它也意味着任何"本数据集开放"的一刀切表述都是错的(坑 4 的获取侧)。

5.7 注册与等待期的实操建议

restricted 训练数据的等待期是本数据集使用者最现实的成本。三条把等待变异步的策略:

  1. 验证集先行:验证数据 open 且结构与测试集一致——注册提交的同一天就可以用验证数据+baseline 代码把"加载→训练→推理→位移→重建→四指标"全管线跑通,等训练数据到位时只换数据不换代码。
  2. 2024 数据并行评估:TUS-REC2024 四记录虽也受限,但发布更早、历史请求通道成熟;若 2025 训练数据等待过长,可先在 2024 数据上完成方法原型(注意 non-rotation 分布缝)。
  3. 等待期做漂移分析:用验证集的 6 段扫描做"误差-序列长度"曲线实验——你的方法在第几帧开始发散?global 误差随帧数的增长是线性还是指数?这类分析不需要 100 段训练数据,但直接决定方法改进方向(§6.3 的诊断逻辑)。

5.8 AI-Ready 三视角详评

同一套获取结构,三种用户视角下的体验差异很大——这是"分层入口"设计的真实成本收益:

视角 体验 得/失
检索者(找数据的人) Zenodo 搜索/Google 命中描述记录 → 点开发现"不是数据" → 需再跳两跳到 Train/Validation 得:BIAS 描述让规则透明;失:主 DOI 不是数据本体,第一跳有挫折感(坑 2)
使用者(要用数据的人) 验证数据即下即用;训练数据要注册等审批 得:验证集结构=测试集,演练成本低;失:训练等待周期不确定,无法排期
评测者(要出分数的人) docker 提交,环境由主办方保证 得:评测环境统一,公平性好;失:本地分数不可直推(归一化天花板不同)

结论与 §5.5 一致但更具体:本数据集的 AI-Ready 短板集中在"训练数据的时间成本不可预期",而不是"数据不可得"——这与"注册墙+审批门"式数据集有本质区别(后者是资格问题,前者是排期问题)。写综述或做数据集选型时,建议把这两类注册制分开评级。

§6 挑战赛结果:榜单、误差结构与获奖者

6.1 正式榜(before submission deadline,7 个上榜实体)

名次 团队 final score(±SD) GPE (mm) GLE (mm) LPE (mm) LLE (mm) runtime (s)
1 ImFusion 0.622 ± 0.071 9.249 ± 2.906 6.986 ± 3.012 0.153 ± 0.020 0.120 ± 0.018 26.744 ± 2.997
2 MUSIC Lab(深圳大学) 0.620 ± 0.060 9.851 ± 3.140 8.116 ± 3.018 0.138 ± 0.018 0.116 ± 0.017 107.479 ± 24.052
3 COCHE(香港) 0.503 ± 0.134 13.892 ± 6.748 10.705 ± 4.628 0.172 ± 0.026 0.143 ± 0.029 43.054 ± 3.274
4 AGH-MedApp(波兰) 0.383 ± 0.128 18.605 ± 6.492 15.955 ± 5.850 0.179 ± 0.026 0.153 ± 0.031 40.367 ± 3.230
5 AMI-Lab(釜山大学,Korea) 0.301 ± 0.155 21.800 ± 6.477 19.645 ± 6.310 0.177 ± 0.027 0.157 ± 0.035 10.439 ± 0.683
6 QBME(上海交通大学) 0.188 ± 0.206 25.708 ± 8.263 21.728 ± 9.009 0.216 ± 0.026 0.183 ± 0.032 34.686 ± 2.808
7 Baseline(UCL 主办方) 0.163 ± 0.216 26.110 ± 7.256 23.681 ± 9.049 0.214 ± 0.025 0.181 ± 0.030 19.753 ± 1.570

另附官网同表的分数画像列(供解读对照):ImFusion global score 0.656 / local 0.588 / pixel 0.627 / landmark 0.617;MUSIC Lab global 0.623 / local 0.617 / pixel 0.639 / landmark 0.601——亚军局部更强、冠军全局更强的结构在参考分一栏同样显形。

人员与机构(前三名,官网 leaderboard 全披露):

  1. ImFusion:Paul Wilson, Matteo Ronchetti, Ruediger Goebl, Viktoria Markova, Sebastian Rosenzweig, Raphael Prevost, Parvin Mousavi, Oliver Zettinig——ImFusion GmbH(Germany)+ Queen’s University(Canada)。存照:团队成员 Raphael Prevost 与 2018 年首个深度学习免跟踪重建方法(挑战赛描述引文 Prevost et al. 2018)署名者同名,冠军团队博客称"论文已挂 arXiv、代码权重已公开";是否同一人未做传记级核验,引用时以团队与榜单口径为准。
  2. MUSIC Lab:Mingyuan Luo, Jiongquan Chen, Zhongnuo Yan, Xin Yang, Dong Ni——深圳大学(China)。这五人正是前作 TUS-REC2024 挑战论文(arXiv:2506.21765)作者团队的成员——上届论文作者组队参赛拿亚军。
  3. COCHE:Lei Zhao, Yuan Zhao, Kannie WY Chan——香港心脑血管健康工程中心(Centre for Cardiovascular Health Engineering)+ 香港城市大学。

6.2 赛后榜(including post-challenge submissions,9 实体)

post-challenge 窗口(截止 2025-10-13)新增两名:

名次 团队 final score 备注
5 T3DR 0.310 Dmytro Yesyp(AGH);“* Post-challenge submissions before 13 Oct 2025”
7 SMART Lab 0.235 上海大学;同上

前三名次在赛后榜保持不变。post-challenge 榜的价值在于持续基准活性:挑战赛不是一次性事件而是 open call(§5.3),新方法仍可进场对标——截至抓取时点(2026-09-26)榜单在 GitHub Pages 上公开可查。

6.3 结果的真正读法:四指标暴露的误差结构

把冠军数字单独拎出来看:

维度 数值 解读
LPE 0.153 mm / LLE 0.120 mm 亚毫米 相邻帧估计近乎解决——0.15 mm 已接近光学跟踪金标准的精度地板
GPE 9.249 mm / GLE 6.986 mm 毫米级 长序列累积漂移未解决——在 9 cm 深度、约 1500 帧的序列上,全局漂移仍是厘米内毫米级
SD:GPE 2.906 / final 0.071 扫描间方差可观 有的扫描漂得多、有的少——漂移与扫描内容(组织纹理、运动模式)强相关

三个推论:

  1. 挑战赛的诊断价值已经兑现:local 指标证明"帧间变换估计"这一环节接近天花板(再卷下去收益有限),global 指标证明"误差复利"才是真问题——下一阶段的创新应聚焦漂移校正(回环检测、全局优化、不确定性加权)而非继续堆帧间模型。
  2. 冠亚之争(0.622 vs 0.620)小于结构性差距:两队四项几乎同分,runtime 是显著差异(26.7 s vs 107.5 s,4 倍)——若按 §4.5 守则 4 把效率当一等公民,ImFusion 的优势在"同精度下快 4 倍",这正是临床部署的语言。
  3. baseline 0.163 与榜尾 0.188:QBME(0.188)仅比官方 baseline 高 0.025 分——跨过"baseline 水平"这条线本身就是门槛,7 个上榜实体中 5 个显著超越 baseline,说明基准有区分度且社区方法有实质进步。

6.4 与 TUS-REC2024 届的对照

维度 TUS-REC2024 TUS-REC2025
场合 MICCAI 2024 MICCAI 2025
注册队 43 支 未公布(待核)
有效提交 6 队 21 份 docker 方案 正式榜 7 实体(含 baseline)
扫描协议 non-rotation rotation(新增旋转)
任务输出 官方基线框架下的位移估计(届内约定) 四组位移向量(GP/GL/LP/LL,跨队同构)
挑战论文 已发(arXiv:2506.21765) 未发(expected by end of 2026)

两届之间最实质的可见进步是扫描协议的泛化压力(旋转)与持续运作机制(open call + 赛后榜);2025 届输出表示的 2×2 标准化(global/local × pixel/landmark)在官网 assessment 页有完整定义——注册队数从 43(2024)到未公布(2025)的信息缺口,提示读者谨慎做"参与度对比"——只能确认有效产出规模相近(榜单 7 vs 7 实体)。

6.5 从榜单读技术趋势:三个信号

把 7 个上榜实体与其分数放在一起,能读出三个超出名次的技术信号:

  1. 工业界工程化的胜利:冠军 ImFusion 是医疗影像软件公司(ImFusion GmbH),其 runtime 26.7 s 与稳定的 ±0.071 方差体现的是"产品级管线"(环境控制、推理优化、边界处理)而非单点算法突破——工业界与学术界的差距在工程闭环上。亚军深圳大学 MUSIC Lab(107.5 s)精度几乎持平但慢 4 倍,正是"算法够好、工程待优"的学界画像。
  2. 方差信息比均值信息更丰富:Baseline 的 ±0.216 巨大方差说明官方方法在某些扫描上接近失效(序列建模方法的不稳定面);ImFusion ±0.071 与 MUSIC ±0.060 的小方差说明头部方法的鲁棒性已达实用门槛。选型时方差与均值同看——医疗部署场景里"最差情况"比"平均情况"更致命。
  3. 地理分布的东亚集中度:7 实体中 4 个来自中国/韩国实验室(MUSIC Lab 深大、QBME 上交、AMI-Lab 釜山、SMART Lab 上大),加上香港 COCHE——超声 AI 研究在东亚的集群效应与库内其他超声条目的贡献者分布互为印证;欧洲(ImFusion、AGH)与北美(Queen’s via ImFusion 团队)由工业与跨机构合作补位。

对方法开发者的直接启示:榜单中段(COCHE 0.503 到 QBME 0.188)的分数间隔大(0.5→0.38→0.30→0.19),说明中腰部方法之间存在实质代差——基准尚未"卷平",后来者仍有清晰的爬升空间。

§7 生态与影响:谱系、脉络与临床定位

7.1 前作论文与领域谱系

TUS-REC2024 的挑战论文(arXiv:2506.21765,v1 2025-06-26 / v2 2025-11-13,27 位作者含获奖团队)是当前免跟踪重建领域的事实综述(在 2025 联合论文发表前)。其核心数据:43 支注册队、6 支队提交 21 份有效 docker 方案;提交方法的谱系涵盖 state space model / recurrent model / registration-driven volume refinement / attention mechanism / physics-informed model——五条技术路线在统一基准上的首次同台。

领域技术脉络(挑战赛描述的引文谱):

时代 代表工作 思路
非深度学习 Chen et al. 1997(散斑去相关);Prager et al. 2003(linear regression,Stalking/Stradwin 系) 从图像对/图像流的统计特性恢复位移
DL 元年 Prevost et al. 2018(首个 DL 方法,CNN vs 散斑去相关) 端到端回归帧间变换
序列建模 ConvLSTM(Luo et al. 2021) 时序依赖显式建模
注意力 transformers(Ning et al. 2022) 全局依赖
多模态辅助 IMU 辅助(Prevost 2018, Luo 2022, Guo 2022) 外部惯性信号补充(本挑战赛禁止)

脉络里的两个讽刺值得存照:其一,IMU 辅助路线在本挑战赛中被规则禁止——这恰恰是基准的价值:把"有传感器辅助"的的成绩与"纯图像"的成绩分开,免跟踪的主张才成立;其二,2025 冠军团队成员名单中有 Raphael Prevost——与 2018 年 DL 元年开创者(Prevost et al. 2018)署名者同名(§6.1 存照:是否同一人未做传记级核验);若为同一人,则是一个“开创者八年后在统一基准上以工业级工程能力(runtime 26.7 s)夺冠”的象征性闭环。

7.2 组织与支持生态

环节 实体
主办 UCL(Qi Li、Yuliang Huang、Shaheer U. Saeed、Dean C. Barratt、Matthew J. Clarkson、Yipeng Hu)+ KCL(Tom Vercauteren)
场合 MICCAI 2025 官方挑战赛(第 28 届,韩国大田,2025-09-23 至 27;现场活动 09-27 于 IBS-2F-100)
Workshop 第 6 届 ASMUS 2025(MICCAI 医学超声 workshop)同场
学术支持 MICCAI SIGMUS(医学超声特别兴趣组)
描述规范 BIAS Initiative(Biomedical Image Analysis ChallengeS)结构化模板,19 页 PDF
平台 GitHub(UCL GitHub Pages 官网 + GitHub repo + 提交系统)——BIAS 描述原文 “Report the platform used to run the challenge. https://github.com/UCL”
赞助 主办方称两家赞助商有意资助奖项,SIG 预算兜底;冠军/亚军加发证书,成功参与者发参与证书

生命周期类型为 Open call:会后持续接收提交(post-challenge deadline 2025-10-13),leaderboard 公开更新——挑战赛是基准的"启动仪式"而非终点。

7.3 临床意义与定位

挑战赛描述的临床意义链条:2D→3D 重建服务定量生物测量、多模态配准、3D 可视化与介入引导;免跟踪方案提供 “low-cost, portable, and widely deployable” 的体超声替代(前作 arXiv 摘要原文),对资源受限临床场景尤其有价值;斜角采集在临床常见(避开遮挡、改善声耦合)——2025 协议加入旋转正是对这一临床现实的模拟。

定位上的诚实边界(§2.1 已展开):健康志愿者前臂是方法学试验场,不是临床终点;基准测的是"纯图像能否重建几何",不是"重建体能否支撑诊断"。把 TUS-REC2025 上的分数直接外推为临床能力,是超出基准设计的主张。

7.4 展望:summary paper 与开放问题

三个待决事项构成后续生态的观察点:

  1. 联合挑战论文(expected by end of 2026):将包含数据集分析与结果分析,顶级团队受邀合著——它将成为免跟踪重建 2025 状态的权威综述,发表后本条目的引用结构应更新(§9 维护触发点)。
  2. 漂移问题的解法演进:2025 榜单确认 local 近解决、global 未解决——回环检测/全局图优化/序列级不确定性等路线是否出现在 post-challenge 提交中,是基准持续价值的风向标。
  3. 向临床部位的迁移基准:前臂之后,器官/胎儿/介入场景的免跟踪重建基准尚缺——TUS-REC 系列若延续,下一届的协议扩展方向比分数增长更值得关注。

7.5 对设备厂商与临床工作流的意义

把视角从算法社区拉远,免跟踪重建对医疗设备生态的潜在扰动有三层:

  1. 入门级设备的"三维化升级":大量在役的 2D 超声主机(含便携与掌上设备)不配位置跟踪、也不配 3D 探头;免跟踪重建若成熟,纯软件升级即可为存量设备附加 3D 采集能力——软件定义硬件的又一个案例。本基准(凸阵探头、常规帧率、关闭降噪的原始散斑)刻意贴近真实在役设备的工作条件。
  2. 工作流增量而非替换:免跟踪 3D 重建不要求医生改变扫查习惯(仍用普通 2D 探头),重建发生在采集之后——这与"换 3D 探头/装跟踪器"的重工作流路线形成互补。冠军方案 26.7 s 的重建耗时已进入"扫完即得"的临床可接受区间。
  3. 验证缺口仍在前方:前臂基准到临床部位(肝脏、心脏、产科)之间隔着器官运动、声窗受限、组织形变三座山;设备厂商若要把此类功能推向认证,需要的证据等级远超挑战赛榜单——本基准的角色是方法筛选器,不是注册证据。

对库内检索者的含义:把本条目放进"体超声/便携超声"的生态叙事里读,它的位置是"软件路线的公开基准起点";与 echonet-dynamic(设备端功能估计的先行商业化案例)对照,可以看到超声 AI 从"单帧判读"到"序列几何"的产业路线图正在合流。

§8 与库内条目的关系:超声家族图谱

8.1 八个真实互链点(库内查询 2026-09-26)

查询口径:url_name ILIKE '%ultrasound%' OR url_name ILIKE '%us%' OR title ILIKE '%超声%',剔除子串巧合误匹配后剩 8 个真实超声条目:

条目(record_id) 内容 与本条目的关系
echonet-dynamic(526) 心脏超声视频→左室功能估计 同为视频级超声任务(序列输入);EchoNet 是"序列→功能参数",本条目是"序列→3D 几何"——任务光谱的两侧
echonet-lvh(530) 左心室肥厚超声表型 超声视频临床任务;其"图像质量与采集变异"问题在本条目中由多样探头运动显式放大
camus(533) 心脏超声多结构分割金标准 2D 单帧分割系金标准;反衬本条目 3D 重建任务的几何本质——两者一起覆盖"分割 vs 重建"两大超声 AI 任务族
hc18(535) 胎儿头围超声测量基准 2D 单帧测量系;其"标准平面依赖"与本条目"任意扫查路径"形成采集自由度对照
us-nerve-seg(537) 颈部超声臂丛神经分割 2D 分割系;同为"健康/无症状结构"的超声基准(神经 vs 前臂肌肉骨骼)
ddti(536) 甲状腺结节超声分割 2D 分割系;静态图像 vs 动态序列的典型对照
busi(539) 乳腺超声三分类与病灶分割 2D 分类/分割系;超声家族中下载热度最高的条目之一,可作流量入口互链
maternal-ultrasound-nutrition(615) 孕期母体超声与营养 同为"非 DICOM 原生格式"的超声数据集;其科研队列模式与本条目的志愿者队列模式同构

互链叙事的三条主线:(1) 任务维度——库内超声条目绝大多数是 2D 单帧分类/分割/测量(busi/ddti/camus/hc18/us-nerve-seg),本条目是唯一的 3D 序列重建,填补"几何重建"空位;(2) 序列维度——echonet-dynamic/echonet-lvh 与本条目共享"视频级输入"的问题结构(时序建模、帧间一致性);(3) 工程维度——maternal-ultrasound-nutrition 与本条目共享"原生格式非 DICOM、需按 h5/专用格式进管线"的 AI-Ready 特征。

8.2 检索警示:误匹配排除

%us% 子串匹配的高误报率在本库有活例:uspto-50k(324)是美国专利局 USPTO 的化学反应提取数据集(药物发现与化学域),与超声无关——按 url_name 检索超声家族时必须显式排除(坑 5 的检索侧)。其余命中(virus-registry/monuseg/health-data-nexus/all-of-us/tuh-eeg-corpus 等)同为子串巧合,不互链。

8.3 检索路径建议

  • 检索词组合:“TUS-REC2025”(精确)+ “trackerless” + “freehand ultrasound”;勿与 TUS-REC2024 混淆(引用时核对 DOI 15224703/15699958 归属 2025)。
  • 若目标是快速上手:Validation 记录(open)+ baseline repo(GitHub)先行,训练数据注册并行等待。
  • 若目标是方法对比:引前作论文 arXiv:2506.21765(2024 届五条技术路线)+ 2025 leaderboard 四指标原始毫米值(§6.1),final score 只作名次参考(§4.5 守则 1)。
  • 若目标是超声家族综述:本条目 + camus + echonet-dynamic + busi 三类(重建/序列分割/单帧分类)合读,可覆盖超声 AI 任务光谱的三极。

§9 方法学启示:六条可迁移的经验

9.1 把"任务命名"与"数据属性"分开

"Trackerless 3D Freehand Ultrasound Reconstruction Challenge"这个名字里,“Trackerless"修饰的是任务(算法不得使用跟踪器),而数据集恰恰带着跟踪器——所有评测金标准都来自它。这个命名策略在检索与转引中造成了实际的理解负担(坑 1)。可迁移的原则:给数据集命名时,把"数据包含什么"与"任务禁止什么"分开表述;凡"任务型命名”(trackerless/annotation-free/reference-free)的数据集,第一条说明就应写清金标准从哪来。

9.2 “用有跟踪的数据考无跟踪的算法”

凡是"去依赖化"研究(去跟踪、去造影剂、去多模态)都面临同一困境:被去掉的依赖恰恰是唯一可信的金标准来源——去掉它之后,"做得对不对"失去了裁判。TUS-REC 的解法是把依赖保留在评测侧、从算法输入侧剥离:光学跟踪位姿始终留在主办方手里,只在打分时生成金标准重建帧;参赛 docker 拿到的输入从头到尾只有图像序列。这一范式可平移到免配准影像融合(用配准金标准考免配准方法)、免标注分割(用专家掩码考自监督分割)等领域——共同要点是:金标准通道与算法输入通道物理隔离,且隔离方式写进提交协议(docker 黑盒)而不靠自觉。

9.3 归一化排名是挑战赛评测的公共品

“aggregate then rank”(Maier-Hein et al. 2018)在本挑战赛的落地有三个值得复用的细节:天花板/地板物理化(金标准=满分、单位矩阵=零分,归一化不是抽象统计而是基准内可复现的两个真实端点);多指标等权合成前的量纲归一(防止毫米级 GPE 淹没亚毫米级 LPE);主办方回避与 runtime 并列(防利益冲突+效率进评测)。任何"多指标合成一个 leaderboard 分数"的场景都可直接借用这套模板——它把"为什么是这个分数"变成三句话能说清的算术。

9.4 输出表示的标准化比指标统一更难也更值钱

2024→2025 两届之间最实质的进化不是新指标,而是输出表示的跨队同构(四组位移向量)。它的价值链:统一输出→统一重建管线→统一误差计算→跨队可比且可复用评测代码。代价是主办方要替社区预判"什么是好的输出表示"(本例:位移向量 vs 刚体矩阵,§3.3 的理由链)。给后续挑战赛设计者的启示:输出表示的决策要在赛事设计期完成并写成文档(本例写进了 BIAS 描述),赛后再改输出格式等于换基准。

9.5 open call + docker 黑盒:基准的"活体运维"

挑战赛结束基准就死掉,是医学影像竞赛的常态。TUS-REC 系列用两个机制对抗它:其一,open call 生命周期——赛后持续接收提交(post-challenge 截止 2025-10-13,榜单继续演化),让新方法随时进场对标;其二,docker 黑盒评测——测试集永不公开、评测环境统一、runtime 可比、跑不通记 0 分,使榜单长期可信。代价也明摆着:外部研究者无法本地复现官方测试分数。TUS-REC 的补偿是"全部指标原始值公开"(assessment 页原文)与验证集结构等于测试集结构——用透明度与可演练性弥补不可复现性。这套"活体运维"组合拳,对国内挑战赛与基准建设者的参考价值不亚于数据集本身。

9.6 从"一个分数"到"误差结构画像"

四指标设计的最大产出不是名次而是诊断:local 亚毫米(帧间估计解决)+ global 毫米(漂移未解决)的组合,把社区注意力从"继续卷帧间模型"转向"漂移校正"。单一指标做不到这一点——final score 里 local 与 global 的信息被压扁了。数据集条目写作同理:报结果时保留误差结构(本条目 §6.3 的表格),比只报冠军分数更有长期价值。

§10 避坑清单:八个已踩过的坑

坑 1:"Trackerless"是任务属性,不是数据属性。数据集每帧都带 NDI Polaris Vicra 光学跟踪金标准位姿;免跟踪的是参赛算法的输入约束。把"TUS-REC2025 是无跟踪器数据"写进任何文档都是事实错误——正确表述:“数据带光学跟踪金标准,任务禁止算法使用跟踪器输入”。

坑 2:主 DOI 记录不是数据 + 联合论文未发表。concept DOI 10.5281/zenodo.15052755 的本体只有一份 19 页 BIAS 结构化描述 PDF(107,736 字节),没有一帧超声;数据本体在 Train(concept 15224703/version 15224704)与 Validation(concept 15699958/version 15699959)独立记录。同时,本挑战赛的联合论文截至 2026-09-26 未发表(expected by end of 2026)——引用回落到前作 arXiv:2506.21765 与 Li 等三篇方法论文。

坑 3:帧数四口径。~1500 帧/段(官网 Images 段)vs ~1600 帧/段(Train Zenodo)vs ~260k 总帧(挑战赛描述)vs 272,000(邀请函 PDF)vs ~263k(官网划分段 164k+9k+90k)。成稿以官网划分段为主口径;"约 26 万帧"作概括可接受;272,000 不建议正式使用。

坑 4:许可与获取的三层异构。挑战赛描述 CC BY-4.0(open)vs 训练/验证数据 CC BY-NC-SA-4.0(禁商用)——引用与使用必须分层。训练数据 restricted 且 Zenodo 文件区为空(注册/访问请求发放);验证数据 open;测试集不公开。任何"本数据集开放下载"或"本数据集 CC BY-4.0"的一刀切表述都是错的。

坑 5:双 DOI 体系 + 2024 记录双链接。三条 2025 记录各有 concept DOI 与 version DOI 两套(OpenAIRE 同时收录);TUS-REC2024 四条记录在官网与 Train 2025 页内分别用 concept(11178508/11180794/11355499)与 version(11178509/11180795/11355500)两套链接——同一数据两套 DOI 是常态不是错误,引用建议用 concept DOI。检索侧同坑:%us% 匹配会把 uspto-50k(USPTO 化学专利数据)误当超声条目。

坑 6:索引起点不一致。landmarks 文件第 1 列帧索引 0 起,第 2/3 列图像坐标 1 起(与标定一致)——评测脚本里两者起点弄混,误差以"差一帧/一像素"的隐蔽形式出现。复现时先跑一帧 sanity check 再上全量。

坑 7:文件名两写。官网目录树注释 RH_rotation.h5 vs Train Zenodo 描述 RH_rotating.h5——同一文件两种写法,自动化脚本按官网树写死路径会 404。以解压后实际文件名为准。

坑 8:final score 不可跨届直比。归一化的天花板 largest_GPE 依赖当届数据与金标准重建实现,2024 与 2025 的 final score 不在同一标尺;跨届比较用 GPE/GLE/LPE/LLE 原始毫米值(且注意 2025 扫描协议加了旋转)。"2025 冠军分数比 2024 高/低"式表述均为无效比较。

§11 总结

11.1 三句话总结

  1. TUS-REC2025 用 85 人 170 段带光学跟踪金标准的前臂超声,把免跟踪 3D 重建从"各说各话"拉进了统一基准时代——四组位移向量输出与四指标归一化排名是它给社区的方法学公共品。
  2. 2025 届榜单的诊断结论清晰:相邻帧估计已近天花板(冠军 LPE 0.153 mm),长序列累积漂移未解决(GPE 9.249 mm)——下一程在漂移校正,不在帧间模型。
  3. 它的获取结构是挑战赛光谱的标准型:描述与验证数据 open、训练数据 restricted 禁商用、测试集只进不出——三种入口对应学习者/研究者/竞争者三种用户。

11.2 适合谁

  • 免跟踪超声重建/序列建模研究者:需要带金标准的大规模基准与可复现 baseline。
  • 图像配准与 SLAM 方向的迁移者:位移向量表示与漂移问题是两个现成的切入点。
  • 挑战赛设计者:BIAS 结构化描述+输出表示标准化+归一化排名三件套是可抄的模板。
  • 超声 AI 综述作者:库内 2D 分割系条目之外的"3D 重建极"由本条目补全。

11.3 不适合谁

  • 需要临床病灶数据的项目:健康志愿者前臂,无病理标签。
  • 需要商用授权的管线:训练/验证数据 CC BY-NC-SA-4.0,禁商用是硬条款。
  • 只想"下载即训"的团队:训练数据要注册等待,先评估时间成本或从验证数据+baseline 入手。

11.4 30 秒决策卡

你的情况 行动
想跑通管线学习 Validation(open)+ baseline repo(GitHub),无需注册
想训练自己的模型 Microsoft Forms 注册 → Train 记录访问请求(restricted)→ 等待发放
想要测试集分数 注册 → docker 提交 → 主办方运行(总 runtime ≤6 h)
想引用基准 concept DOI(15052755/15224703/15699958)+ arXiv:2506.21765 + Li 等三论文
想跨届比较 用原始毫米值(GPE 等),别比 final score(坑 8)
想做超声家族综述 本条目 + camus/busi(2D 系)+ echonet-dynamic(序列系)三极合读

FAQ(高频问答 38 问)

A. 基础认知

Q1:TUS-REC2025 是论文数据集吗?
不是。它是 MICCAI 2025 官方挑战赛的数据集;联合挑战论文未发表(expected by end of 2026)。当前引用的事实综述是前作论文 arXiv:2506.21765。

Q2:名字怎么断句?
TUS-REC 2025 = Trackerless 3D Freehand Ultrasound Reconstruction Challenge 2025。“TUS-REC"是系列名(2024 首届、2025 第二届),不是"TUS 记录"也不是"胸部超声”。

Q3:"Trackerless"和"freehand"各指什么?
freehand 指医生手持普通 2D 探头自由扫查(区别于机械驱动或 2D 阵列 3D 探头);trackerless 指重建时不依赖外部位置跟踪器。两者合起来:手持 2D 探头 + 纯图像三维化。

Q4:数据为什么扫前臂?
伦理与实操可行性(前人反复采用的志愿者试验场),不是临床兴趣所在。它是通向器官/胎儿/介入等复杂场景前的第一步基准(§2.1)。

Q5:和 TUS-REC2024 什么关系?
同一 UCL 团队的第二届。2025 加了旋转扫描协议、统一了四组位移向量输出;2024 数据(non-rotation)作为可选附加训练数据,两届 patient IDs 一致可控泄漏(§2.6)。

Q6:85 人、170 段,为什么"段"不说"例"?
每名志愿者左右前臂各扫一段,是 2 个独立扫描序列(各 ~1500-1600 帧),不是 2 个"病例"——前臂健康,无病例可言。

Q7:金标准是怎么来的?
探头上的跟踪工具被 NDI Polaris Vicra 光学跟踪器逐帧定位,经 pinhead 法标定矩阵对齐到图像空间,时间戳与帧对齐(temporally calibrated)——这条链路只在评测侧使用(§3.4)。

Q8:最大的卖点一句话?
免跟踪重建第一次有了大规模统一基准,并且四指标设计直接量出了"局部准、全局漂"的误差结构——问题从"能不能做"变成了"漂移怎么治"。

Q9:它自己有什么局限?
前臂非临床部位、85 人人口学细分未披露、训练数据 restricted 等待周期不确定、summary paper 未发表导致引用链悬空、注册队数 2025 未公布。

Q10:开源吗?
分层:描述与验证数据 open、baseline 代码公开(Python)、训练数据注册制、测试集不公开——"开源"二字须拆开说(坑 4)。

B. 数据与获取

Q11:三条 Zenodo 记录各下什么?
15052755 下 19 页描述 PDF(读懂规则);15224704 请求训练数据(restricted);15699958 直接下验证数据(open)。见 §5.1 全表。

Q12:训练数据怎么申请?
Train 记录的 restricted 通道:Zenodo 访问请求 / 挑战赛 Microsoft Forms 注册表单。无公开响应时限承诺,规划时把等待当不确定周期处理(§5.3)。

Q13:验证数据里有什么?
3 名受试者 6 段扫描(~9k 帧),frames/ 与 transfs/ 分开存放 + dataset_keys.h5 清单——结构与测试集一致,可演练提交评测(§2.5)。

Q14:测试集真的拿不到吗?
拿不到。64 段(32 人)由主办方持有,唯一通道是 docker 提交算法在主办方环境运行——这是防测试集泄漏的标准设计。

Q15:h5 文件怎么读?
h5py 读 frames [N,480,640] 与 tforms [N,4,4];landmarks 另有文件;calib_matrix.csv 提供像素-毫米缩放与刚体变换。加载骨架见附录 E。

Q16:可以用 2024 数据吗?
可以,官方认可为可选附加训练数据;两届 patient IDs 一致,合并训练时可控分布防泄漏。注意 2024 是 non-rotation 协议,与 2025 任务有分布缝。

Q17:能用这些数据训练商用模型吗?
不能。CC BY-NC-SA-4.0 + Data Usage Policy 明文禁止训练与验证数据的商业使用;模型权重的商用属性同样视为不清(§5.4)。

Q18:引用义务是什么?
未来的 summary paper(发表后补引)+ Li 等三篇方法论文(ISBI 2023/TBME 2024/MICCAI 2024)+ 数据记录的 concept DOI。参赛团队单独发表须等联合论文之后。

C. 评估与结果

Q19:final score 的理论范围是什么?
[0,1]。0 = 全单位矩阵(什么都不估),1 = 完美复现金标准重建。实际冠军 0.622、baseline 0.163——中段有充足区分度。

Q20:为什么四项等权 0.25?
官方设计;等权的前提是各自归一化(否则毫米级 GPE 会淹没亚毫米级 LPE)。四组参考分(global/local/pixel/landmark)提供非官方的画像视角(§4.2)。

Q21:GPE 9.249 mm 严重吗?
要看参照系:扫描深度 9 cm、序列 ~1500 帧——全局漂移被压到厘米内毫米级是当前最好的成绩,但距"金标准地板"(0)尚远;同届 local 误差 0.153 mm 说明差距不在帧间估计而在累积(§6.3)。

Q22:runtime 26.7 s 是快吗?
这是全部帧位姿预测的每扫描平均耗时。亚军 107.5 s、上限 6 小时/全部测试扫描——冠军比亚军快 4 倍且精度同档,效率优势在"同分短者优先"规则下是实质护城河。

Q23:post-challenge 提交还算数吗?
进 leaderboard 但标注 “* Post-challenge submissions before 13 Oct 2025”;2025-10-13 后榜单是否继续更新取决于主办方维护(open call 生命周期)。

Q24:能只优化 local 指标拿高分吗?
不能——四项等权。但 local 指标容易高(亚毫米饱和区),global 指标才是区分度所在;反过来只卷 global 而 local 崩了同样掉分。

Q25:为什么没有 Dice?
前臂数据无分割金标准,Dice 定义成本高;官网明说不纳入 final drift/Dice 等指标是为精简评估——但"没测"不等于"没问题"(§4.4)。

D. 复现与工程

Q26:baseline 能直接跑吗?
能。GitHub repo QiLi111/TUS-REC2025-Challenge_baseline(Python),配套三篇方法论文;在验证数据上可完整演练。baseline 分数 0.163 是你的下界参照。

Q27:位移向量怎么变回 3D 体?
按提交口径,位移向量经标定矩阵进入毫米空间,逐帧重投影并融合为体——评测方统一执行;本地复现时用 calib_matrix.csv 与 h5 的 tforms 自建重建管线(附录 E 骨架)。

Q28:评测脚本的索引坑在哪?
landmarks 帧索引 0 起、像素坐标 1 起(坑 6);先跑单帧 sanity check。

Q29:文件名为什么对不上官网树?
RH_rotation vs RH_rotating 两写并存(坑 7)——以解压后实际文件名为准,脚本做模糊匹配或建索引。

Q30:想对标 leaderboard,评测环境一致吗?
官方评测在主办方测试集环境运行 docker;本地只有验证集,分数不可直推测试榜(分布不同+归一化天花板不同)。验证集分数用于自检与选型,不用于对外宣称名次。

Q31:帧数统计口径混乱影响复现吗?
不影响训练,影响"你论文里写多少帧"。以官网划分段 ~164k/~9k/~90k 为主口径并注明出处(坑 3)。

Q32:如果只记住一件事?
数据带跟踪、任务免跟踪、金标准在评测侧——TUS-REC2025 的全部规则设计都从这三句派生。

E. 生态与库内定位

Q33:库内还有哪些超声条目,本条目和它们怎么分工?
8 个真实互链:busi/ddti(2D 静态分类分割)、camus(2D 序列分割金标准)、hc18(2D 测量)、us-nerve-seg(2D 神经分割)、echonet-dynamic/echonet-lvh(心脏超声视频功能)、maternal-ultrasound-nutrition(科研队列)。分工:它们覆盖"判读"(分类/分割/测量/功能),本条目独占"几何"(3D 重建)——合读覆盖超声 AI 任务光谱(§8.1)。

Q34:检索时为什么会命中 uspto-50k?
%us% 子串误匹配:uspto-50k 的 url_name 含 “us”(USPTO),实为美国专利局化学反应数据集,与超声无关。超声域检索请加 %ultrasound% 或标题 %超声% 双条件(坑 5)。

Q35:本条目与库内其他挑战赛条目(如 trackrad)的异同?
同为 MICCAI 系挑战赛、同为"开放描述+注册制数据+docker 评测"光谱;差异在任务类型(trackrad 是跟踪/分割系,本条目是几何重建系)与输出表示(语义掩码 vs 位移向量场)。两者互为"挑战赛评测设计"的平行样本。

Q36:冠军方法论文能引吗?
截至抓取时点只知"已挂 arXiv"(团队博客口径),编号未核验——引用时写"ImFusion 团队挑战赛方案(2025,论文详见其团队页面)"并待附录 K 触发点 4 更新,不要手写猜测的 arXiv 编号。

Q37:如果 2026 底 summary paper 发表了,本条目哪些部分会过时?
引用结构(坑 2 的回落引用)、结果分析细节(summary paper 会披露数据集分析与更多结果统计)、可能还有参赛队总数(未公布项)。核心硬事实(85 人/170 段/划分/设备/许可)不会变——它们来自数据记录本体而非论文。

F. 方法与迁移

Q38:我没有超声背景,能直接上手这个基准吗?
可以但有三步功课:读 BIAS 描述 PDF(19 页,规则全覆盖);跑通 baseline+验证集(无需任何超声先验);理解凸阵几何与散斑的基本性质(§2.2 注脚)。散斑不是噪声而是信号载体——这是超声视觉与自然图像最大的思维转换。

Q39:SLAM/里程计的现成方法能直接搬吗?
前端思想(相邻帧运动估计)可搬但特征提取要换(无角点,用散斑/学习特征);后端思想(位姿图、回环)是开放方向但"重访检测"在软组织上无现成定义(§3.7)。直接搬运自然图像 VO/SOTA 的期望收益有限——2025 榜单证明前端已近天花板,价值在 后端。

Q40:位移向量表示对网络设计有什么具体影响?
输出层是逐像素/逐标志点的 3 维回归(无激活约束或轻约束),损失用位移的 L1/L2 即可;不需要旋转参数化(四元数归一化、6D 表示等技巧都省了)——监督信号连续无奇异点,训练稳定性好(§3.3)。

Q41:为什么不用 IMU 帮忙?规则禁止的话学术界怎么看?
IMU 辅助是合法研究路线(文献活跃),但本基准的立意是"纯图像能做到什么"——把 IMU 路线隔离出去,免跟踪的主张才纯粹。两者是互补而非竞争:IMU 路线适合有硬件控制权的场景,纯图像路线适合存量设备与极简硬件。

Q42:这个基准上 0.622 的分数还有多少提升空间?
天花板是 1.0(金标准地板为 0)但物理不可达(跟踪器自身的毫米级误差+软组织形变);更现实的参照是 local 指标的 0.12-0.15 mm 亚毫米区——global 指标若能从 9.2 mm 压到 2-3 mm(漂移校正生效),final score 的提升空间大约还有 0.2-0.3 分。这是推测而非官方口径。

G. 数据工程细节

Q43:数据是 uint8 还是 float?读进来要不要归一化?
按 h5 存储口径 frames 为 480×640 灰度帧;预处理按你的模型惯例(baseline 代码内置其归一化配置)。注意关闭散斑降噪意味着原始散斑对比度较低——不要用激进对比度拉伸破坏散斑统计特性(散斑统计是传统方法的信号源)。

Q44:能只加载部分帧训练吗?
可以(h5 支持切片读),但要注意帧间变换的监督是序列性的:随机抽帧破坏了 local 参考系的连续性语义——抽帧训练时 LP/LL 的"前一帧"应按原序列相邻关系定义,而不是数组相邻。

Q45:多卡训练时序列怎么切?
以扫描(.h5)为单位切分而不是以帧为单位——同一段扫描的帧必须留在同一进程/设备(递归位姿不可分片);50 名受试者 100 段的划分天然适合按受试者分组做分布式。

Q46:如果我发现自己的复现分数与验证集口径差很多,先查什么?
按序查:参考系混用(§3.6-2)→ 索引起点(坑 6)→ 凸阵几何映射(§3.6-3)→ 插值实现与官方差异(§3.6-1)→ 天花板 identity 误差的实测方式(附录 F 注)。五步覆盖绝大多数"分数异常低"。


Q33:扫描是 2D 图像序列,为什么说它是 3D 数据集?
因为每帧都绑定一个 3D 空间位姿(tforms)——图像+位姿合起来才是完整的自由手持超声记录;任务也是把 2D 序列重建成 3D 体。只看 frames 键会把它误当普通 2D 分类/分割数据集。

Q34:85 人里训练只用 50 人,会不会太少?
对免跟踪重建这个细分方向,50 人/100 段/~16 万帧已是领域最大训练集之一(此前学习类研究普遍 12-40 名受试者)。且可叠加 TUS-REC2024 的同队列数据。但与通用视觉预训练的规模相比仍是小数据——这正是"序列建模+几何先验"类方法占优的结构性原因。

Q35:我可以只用验证集做研究吗?
可以且是低成本起点:验证数据 open 直下、结构与测试集一致、附 dataset_keys.h5 索引,配 baseline 代码可跑通"加载→推理→位移→重建→四指标"全管线。局限:6 段扫描只够做方法验证与消融演示,训练需要注册获取的 100 段。

Q36:怎么判断我的方法在验证集上的分数"算好"?
可参照的锚点:官方 baseline 在测试集 final 0.163(GPE 26.1 mm);2025 正式榜入门线 QBME 0.188;冠军 0.622(GPE 9.2 mm)。注意验证集与测试集分数会有偏移(归一化天花板不同+数据不同),验证集分数只用于自评趋势与消融,不能直推名次。

Q37:runtime 上限为什么定为 6 小时?
官网 NOTE 原文给出的理由是 “to encourage usability in the clinical applications”——把效率写进评测基因:一个测试集要跑 6 小时以上的重建方法,离床旁/术中可部署性太远。配套的同分裁决(runtime 短者列前)进一步把效率变成一等公民指标。

Q38:19 页 BIAS 结构化描述对使用者有什么实际价值?
它把挑战赛的目的、数据、任务、指标、参与政策、奖项规则写在一份固定模板里(CC BY-4.0 直链)——使用者不必从零散网页拼装规则;对做评测方法学的人,它是一份"挑战赛如何被设计"的完整样本。读取顺序建议:BIAS PDF(规则全景)→ 官网 assessment 页(指标公式细节)→ baseline 仓库(工程实现)。

事实清单(硬事实 38 条)

  1. TUS-REC2025:Trackerless 3D Freehand Ultrasound Reconstruction Challenge 2025,MICCAI 2025 官方挑战赛。
  2. 主办:UCL(Qi Li 联系人、Yuliang Huang、Shaheer U. Saeed、Dean C. Barratt、Matthew J. Clarkson、Yipeng Hu)+ KCL(Tom Vercauteren),共 7 名组织者。
  3. 与第 6 届 ASMUS 2025 workshop 同场,获 MICCAI SIGMUS 支持;2025-09-23 至 27 韩国大田,现场活动 09-27 IBS-2F-100。
  4. 平台为 GitHub(UCL GitHub Pages + repo),非 grand-challenge.org(BIAS 描述原文)。
  5. 生命周期 Open call;post-challenge 截止 2025-10-13。
  6. 描述记录 concept DOI 10.5281/zenodo.15052755(version 15119085,v2,2025-03-21 发布),open,CC BY-4.0,本体为 19 页 BIAS 模板 PDF(107,736 字节);stats:views 1406/downloads 1317。
  7. Train Dataset concept DOI 10.5281/zenodo.15224703(version 15224704),2025-04-28 发布 v1.0.0(modified 2025-11-17,revision 16),restricted + CC BY-NC-SA-4.0,Zenodo 文件区为空;stats:views 3109/downloads 613。
  8. Validation Dataset concept DOI 10.5281/zenodo.15699958(version 15699959),2025-06-23 发布,open access。
  9. TUS-REC2024 四记录:Train Part1/2/3 concept 11178508/11180794/11355499 + Validation 12979481;官网与页内链接存在 concept/version 双写。
  10. 数据:85 名志愿者左右前臂 170 段扫描;队列 “racial-, gender-, age-diverse”;排除超声凝胶过敏与皮肤病。
  11. 划分:train/val/test = 50/3/32 subjects = 100/6/64 scans = ~164k/~9k/~90k frames(官网权威口径)。
  12. 帧数四口径并存:~1500/段(官网 Images)vs ~1600/段(Train Zenodo)vs ~260k(描述)vs 272,000(邀请函)vs ~263k(划分段)。
  13. 设备:Ultrasonix(BK)+ 4DC7-3/40 凸阵探头;NDI Polaris Vicra 光学跟踪器。
  14. 采集参数:20 fps;480×640;6 MHz;83 dB;增益 48%;深度 9 cm;无散斑降噪;时间已标定。
  15. 扫描协议:肘部附近固定接触点,短轴 fanning → 长轴 rocking → 探头旋转约 90 度重复;2024 为 non-rotation。
  16. 两届数据 patient IDs 一致(合并训练可控分布);2024 数据为可选附加训练数据。
  17. h5 结构:frames [N,480,640] + tforms [N,4,4](tool space → camera space);RH=右臂/LH=左臂。
  18. landmarks:每受试者一个 .h5,每段 100 点,坐标 [100,3]——帧索引 0 起、图像坐标 1 起。
  19. calib_matrix.csv:pinhead 法标定;含 scaling_from_pixel_to_mm 与 image→tool 刚体变换。
  20. 验证集 frames/ 与 transfs/ 分开存放 + dataset_keys.h5 清单;与测试集结构相同。
  21. 任务输出:GP/GL/LP/LL 四组位移向量(global/local × pixel/landmark);不强制刚体矩阵(规避 gimbal lock 与局部极小)。
  22. 四指标:GPE/GLE/LPE/LLE(全像素/标志点欧氏距离,mm,global/local 双参考)。
  23. 归一化:smallest=0(金标准)、largest=单位矩阵误差;final score = 0.25×(GPE*+GLE*+LPE*+LLE*),全测试扫描平均,3 位小数,越高越好。
  24. 参考分四组(global/local/pixel/landmark score)不参与正式排名;Maier-Hein et al. 2018 “aggregate then rank”(doi:10.1038/s41467-018-07619-7)。
  25. runtime 规则:每扫描平均耗时;同分短者列前;全部测试扫描总时长 ≤6 小时;跑不通=0 分。
  26. 不纳入:final drift、Dice overlap 等(官网原文:为精简评估)。
  27. 指标设计依据:Luo et al. 2023(doi:10.1016/j.media.2023.102810)、Wein et al. 2020(doi:10.1007/978-3-030-59716-0_49)。
  28. Baseline:UCL Li et al.(ISBI 2023/TBME 2024/MICCAI 2024 三论文),repo QiLi111/TUS-REC2025-Challenge_baseline。
  29. 正式榜 7 实体:ImFusion 0.622±0.071(GPE 9.249/GLE 6.986/LPE 0.153/LLE 0.120 mm,runtime 26.744 s)、MUSIC Lab(深圳大学)0.620±0.060(GPE 9.851,runtime 107.479 s)、COCHE 0.503±0.134(GPE 13.892)、AGH-MedApp 0.383±0.128、AMI-Lab 0.301±0.155、QBME 0.188±0.206、Baseline 0.163±0.216(GPE 26.110)。
  30. 赛后榜 9 实体:新增 T3DR(Dmytro Yesyp,AGH,0.310,第 5)、SMART Lab(上海大学,0.235,第 7);前三不变。
  31. ImFusion 团队 8 人(ImFusion GmbH + Queen’s University),成员含 Raphael Prevost——与 2018 年首个 DL 免跟踪重建方法作者署名同名(是否同一人未核验);团队博客确认获奖、论文已挂 arXiv(编号未核验)。
  32. 冠军误差结构:local 亚毫米(0.12-0.15 mm)vs global 毫米级(7.0-9.2 mm)——帧间估计近解决、累积漂移未解决。
  33. 前作 TUS-REC2024:43 支注册队、6 队 21 份有效 docker 提交;挑战论文 arXiv:2506.21765(27 作者,v1 2025-06-26/v2 2025-11-13);方法谱系含 state space model/recurrent/registration-driven refinement/attention/physics-informed。
  34. 领域痛点原文:此前研究 “none of these studies used the same dataset”;学习类方法数据仅 12-40 subjects。
  35. 引用政策:数据使用须引 summary paper(未发表,expected by end of 2026)+ Li 三论文;参赛队单独发表须等联合论文之后。
  36. Data Usage Policy 原文:训练与验证数据商业用途禁止;参与政策:fully automatic、公开+私有数据可用但须披露、主办方机构成员可参加但不获奖不进榜。

  1. 冠军 ImFusion 的参考分画像:global score 0.656 / local 0.588 / pixel 0.627 / landmark 0.617;MUSIC Lab 对应 0.623 / 0.617 / 0.639 / 0.601——冠军全局更强、亚军局部更强——来源:官网 leaderboard.html 参考分列。
  2. landmarks 以受试者为单位独立成文件(landmark_xxx.h5,含该受试者两条扫描的标志点)——来源:官网 data.html 目录树。

术语表(34 条)

术语 释义
Freehand 3D US 手持 2D 探头自由扫查 + 逐帧位姿拼接成 3D 体的技术路线
Trackerless 免外部位置跟踪器;此处为任务约束(数据带跟踪金标准)
Speckle decorrelation 散斑去相关:从相邻帧散斑统计变化恢复探头位移的经典原理
Fanning / Rocking 扇摆/摇摆:探头以接触点为轴的两个正交摆动方向,本数据集标准协议动作
Cumulative drift 累积漂移:帧间变换递归连乘导致的误差复利积累
帧间变换(T_j←i) 第 i 帧坐标系到第 j 帧坐标系的刚体(或近刚体)变换
位移向量(displacement vector) 像素/标志点在两参考系间的三维位移,本挑战赛的统一输出表示
GP/GL/LP/LL global/local × pixel/landmark 的四组位移向量缩写
Gimbal lock 欧拉角参数化旋转的自由度退化现象;位移表示规避其影响
齐次变换矩阵 4×4 矩阵同时编码旋转与平移;tforms 的存储形式
Tool space / Camera space 光学跟踪工具坐标系 / 光学跟踪相机坐标系;tforms 的变换方向
NDI Polaris Vicra Northern Digital Inc. 的光学位置跟踪器,本数据集金标准来源
Pinhead 标定 针尖尖点法标定:确定图像坐标系与跟踪工具坐标系的几何关系
Temporal calibration 时间标定:跟踪位姿与图像帧时间戳的对齐
标志点(landmark) 预定义解剖参考点;每段扫描 100 个,用于 GLE/LLE
GPE/GLE/LPE/LLE Global/Local × Pixel/Landmark reconstruction error,四项毫米误差指标
Aggregate then rank 先多指标归一化聚合再排名的挑战赛评测范式(Maier-Hein 2018)
单位矩阵基线(identity baseline) 所有帧用恒等变换重建——归一化的"天花板"(0 分锚点)
Docker 提交 打包算法环境为容器由主办方在测试集运行——防泄漏的标准评测通道
HDF5 (.h5) 层级数据格式;frames/tforms/landmarks 的存储容器
BIAS Initiative Biomedical Image Analysis ChallengeS:挑战赛结构化描述模板的组织方
ASMUS MICCAI 医学超声计算 workshop;TUS-REC2025 与第 6 届同场
SIGMUS MICCAI 医学超声特别兴趣组
Convex transducer 凸阵探头:扇形视野的曲面阵元探头(4DC7-3/40)
concept DOI / version DOI Zenodo 双 DOI:前者指向全部版本,后者指向具体版本
Restricted access Zenodo 访问控制档位:需请求/注册获得,文件区不直接提供下载
CC BY-NC-SA-4.0 署名-非商业性-相同方式共享;训练/验证数据许可
Open call 挑战赛会后持续接收提交的生命周期类型
Post-challenge submission 赛后窗口提交(2025-10-13 截止),榜单独立标注
Summary paper 联合挑战论文的通称;TUS-REC2025 的 expected by end of 2026
  1. Docker 黑盒评测:算法以镜像提交、测试集与评测环境不出主办方的考务模式——可复现性与防泄漏的折中。

  2. Sanity check(理智检查):上全量实验前先跑最小样例验证管线正确性——对索引起点(坑 6)与文件名两写(坑 7)尤其必要。

  3. Restricted access:Zenodo 的受限访问类型——记录元数据公开、文件区不展示本体、需走权利人设定的请求流程;与"embargo(限期封存)"和"closed(完全关闭)"不同。

  4. Open call vs one-time event:挑战赛生命周期的两类——前者会后持续收提交(榜单演化),后者截止即冻结;TUS-REC2025 属前者。

附录

附录 A:条目信息速查卡

项 值
条目名 TUS-REC2025
url_name tus-rec
类型 挑战赛+数据集+基准(三合一)
主办 UCL + KCL(联系人 Qi Li)
场合 MICCAI 2025(Daejeon, Korea)+ ASMUS 2025 + SIGMUS
规模 85 人 170 段 ~263k 帧(主口径)
划分 50/3/32 subjects = 100/6/64 scans
许可 描述 CC BY-4.0 / 数据 CC BY-NC-SA-4.0(禁商用)/ 测试不公开
关键 DOI 15052755(描述)/ 15224703(Train)/ 15699958(Validation)
冠军 ImFusion 0.622±0.071(GPE 9.249 mm)
抓取时点 2026-09-26
库内互链 echonet-dynamic(526)/echonet-lvh(530)/camus(533)/hc18(535)/ddti(536)/us-nerve-seg(537)/busi(539)/maternal-ultrasound-nutrition(615)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 7 官网(GitHub Pages)+ Zenodo 三记录 + MICCAI 官方挑战列表 + arXiv 前作论文可索引;"TUS-REC"系列名与 2024 届易混淆微降分
A 可获取性 6 Validation open + 描述 open;训练数据 restricted(注册等待)+ 测试集不公开——挑战赛防泄漏设计是合理但硬性的门槛
I 可互操作 7 HDF5 标准容器 + CSV 标定 + 官方 baseline Python 代码 + docker 评测接口;无官方 DICOM/NIfTI 导出工具
M 元数据质量 8 BIAS 结构化描述 19 页(目的/数据/任务/评估/规则全字段)+ Zenodo 标准 JSON;帧数四口径与文件名两写微降分
S 可持续性 7 UCL 机构背书 + Zenodo 长期存档 + open call 持续接收;summary paper 未发表与主办方维护依赖是中等风险
综合评级 7.0/10(中上) 元数据与可复现性基建是挑战赛样本中的优等生;可获取性被 restricted 拖低但属设计使然而非疏漏

附录 C:逐项证据链自证

关键数字 来源 位置
85 人/170 段/50-3-32 划分/~164k/~9k/~90k 官网 data.html 划分段 github-pages.ucl.ac.uk/tus-rec-challenge/data.html
设备与采集参数(20fps/480×640/6MHz/83dB/48%/9cm) 官网 data.html Images 段 同上
扫描协议(fanning/rocking/旋转 90 度) 官网 data.html + Zenodo 描述 PDF data.html;zenodo.15119085
Train restricted + CC BY-NC-SA-4.0 + 禁商用 Zenodo API 记录 JSON + Data Usage Policy zenodo.org/api/records/15224704
Validation 发布日 2025-06-23 Zenodo API 记录 JSON zenodo.org/api/records/15699958
时间线(04-01 至 10-13 全链) 官网首页 schedule github-pages.ucl.ac.uk/tus-rec-challenge/
四指标定义与排名公式 官网 assessment.html …/assessment.html
leaderboard 全部分数与四项毫米值 官网 leaderboard.html …/leaderboard.html
前作 43 队/21 提交/方法谱系 arXiv:2506.21765 摘要与正文 arxiv.org/abs/2506.21765
引用政策/发表限制/summary paper 时点 Train Zenodo 描述段 + 官网 zenodo.15224704;data.html
ImFusion 团队构成与获奖 官网 leaderboard + 团队博客 leaderboard.html;zettinig.eu

附录 D:数据获取决策树

需求是什么?
├── 快速学习/跑通管线
│   └── Validation(open,15699958)+ baseline repo(GitHub)——无需注册
├── 训练自己的模型
│   ├── 1) Microsoft Forms 注册(2025-04-01 起开放)
│   ├── 2) Train 记录访问请求(restricted,15224704)——等待发放
│   └── 3) 可选:并入 TUS-REC2024 数据(四记录,注意 non-rotation 分布缝)
├── 想要测试集名次
│   └── 注册 → docker 提交 → 主办方运行(≤6 h 总时长)→ leaderboard
├── 只想引用/综述
│   ├── 引 concept DOI 三件套(15052755/15224703/15699958)
│   ├── 方法综述引 arXiv:2506.21765 + Li 三论文
│   └── 别引"未来的 summary paper"——它还没发表(坑 2)
└── 想商用
    └── 训练/验证数据不可商用(NC-SA + Policy 明文)——换数据或联系主办方书面授权

附录 E:h5 加载与 sanity check 骨架(代码)

import h5py
import numpy as np

def load_scan(h5_path):
    """读取一段扫描:帧序列 + 金标准位姿。"""
    with h5py.File(h5_path, "r") as f:
        frames = f["frames"][:]    # [N, 480, 640] 灰度帧
        tforms = f["tforms"][:]    # [N, 4, 4] 齐次变换(tool->camera)
    return frames, tforms

def load_landmarks(h5_path, scan_key):
    """读取标志点:[100,3] = 帧索引(0起) + 图像坐标(1起)。"""
    with h5py.File(h5_path, "r") as f:
        lm = f[scan_key][:]        # 假设按扫描键组织
    assert lm.shape[1] == 3
    frame_idx = lm[:, 0].astype(int)          # 0-based
    pixel_xy = lm[:, 1:3]                     # 1-based(与标定一致)
    return frame_idx, pixel_xy

def sanity_check(frames, tforms, calib):
    """三条快速自检,防坑 6/坑 7。"""
    N = frames.shape[0]
    assert tforms.shape == (N, 4, 4), "frames/tforms 帧数不一致"
    assert np.isfinite(tforms).all(), "位姿含 NaN"
    s = calib["scaling_from_pixel_to_mm"]     # 像素->毫米
    assert s > 0, "标定缩放异常"
    # 文件名模糊匹配:RH_rotation / RH_rotating 都可能是同一文件(坑 7)
    return True

附录 F:归一化分数计算骨架(代码)

def normalize_score(err, err_identity, err_gold=0.0):
    """GPE* = (err - largest) / (smallest - largest)
    largest = err_identity(全单位矩阵误差);smallest = err_gold = 0。"""
    return (err - err_identity) / (err_gold - err_identity)

def final_score(gpe, gle, lpe, lle, gpe_id, gle_id, lpe_id, lle_id):
    """四项各自归一化后等权 0.25,3 位小数,越高越好。"""
    comps = [normalize_score(e, e_id) for e, e_id in
             [(gpe, gpe_id), (gle, gle_id), (lpe, lpe_id), (lle, lle_id)]]
    return round(0.25 * sum(comps), 3)

# 注意:identity 误差须在当届数据上实测——跨届复用他人天花板是坑 8 的代码级来源。

附录 G:挑战赛时间线总表

日期(2025,23:59 BST) 事件
03-21 Zenodo 挑战赛描述记录发布(v2 modified 04-10)
04-01 官网开放/注册开始
04-28 训练数据 + baseline 代码发布(= Train Zenodo 发布日)
06-23 验证数据 + 提交代码发布(= Validation Zenodo 发布日)
07-07 提交开始
08-31 提交截止
09-01 冠军公布
09-23 至 27 MICCAI 2025(大田);09-27 现场挑战赛活动(IBS-2F-100)
10-13 赛后提交截止(post-challenge)
2025-11-13 前作论文 v2(arXiv:2506.21765)
2025-11-17 Train 记录最后修改(revision 16)
by end of 2026 联合挑战论文(未发表,待核)

附录 H:许可条款细读(三层+代码)

  1. 描述记录:CC BY-4.0——署名即可自由使用/分享/改编(19 页 PDF 是挑战赛的"户口本",引用它不会踩 NC 坑)。
  2. 训练+验证数据:CC BY-NC-SA-4.0——署名、非商业、相同方式共享;Data Usage Policy 叠加明文禁商用与"用途模糊时避免挑战范围外再分发";模型权重商用属性视为不清。
  3. 测试集:无公开许可——不存在"使用",只存在"提交评测"。
  4. baseline 代码:GitHub repo 许可为准(Python 代码随 repo 声明)。
  5. 引用优先级:用数据按数据许可(NC-SA),引规则/观点引描述记录(BY-4.0),引方法引三篇论文——三层勿混(坑 4)。

附录 I:坑点档案(与 §10 对照)

坑 一句话档案 触发场景
坑 1 Trackerless=任务属性非数据属性(数据带跟踪金标准) 命名转述/文档撰写
坑 2 主 DOI 只有一份 19 页 PDF;summary paper 未发表 下载/引用
坑 3 帧数四口径(1500/1600/260k/272k/263k) 统计表述/论文写作
坑 4 许可与获取三层异构(BY-4.0/NC-SA/restricted/不公开) 使用/商用/再分发
坑 5 双 DOI 体系+2024 记录双链接+%us% 误匹配 uspto-50k 引用/检索
坑 6 landmarks 帧索引 0 起、像素坐标 1 起 评测脚本
坑 7 RH_rotation vs RH_rotating 文件名两写 自动化路径
坑 8 final score 不可跨届直比(归一化天花板不同) 跨届比较

附录 J:双口径登记表

# 项 口径 A 口径 B 处理
1 总帧数 ~263k(官网划分段,主口径) 272,000(邀请函 PDF);~260k(描述);1500/1600 每段 主口径+存照
2 数据许可 CC BY-4.0(描述记录) CC BY-NC-SA-4.0(训练/验证数据) 分层表述
3 DOI concept(15052755 等) version(15119085 等) 引用用 concept
4 2024 记录链接 官网用 concept(11178508 等) 页内链接用 version(11178509 等) 同数据两套链接存照
5 文件名 RH_rotation(官网树) RH_rotating(Train Zenodo) 以实际解压为准
6 冠军论文 博客称已挂 arXiv 编号未核验 待核不引编号

附录 K:维护计划与触发点

触发点 条件 动作 优先级
summary paper 发表 联合挑战论文上线(≤2026 底?) 更新引用结构、§7.4、结果分析章节 1
训练数据转 open restricted 撤销/直链开放 重写 §5,升 AI-Ready 评级 2
榜单更新 post-challenge 后新方法进入 §6.2 扩行 3
冠军论文编号公开 ImFusion arXiv 编号可核验 补 §6.3 与附录 J#6 4
下一届 TUS-REC 公告 2026+ 新届启动 §7.4 展望更新、新条目互链 5

附录 L:检索决策树

你想找什么?
├── 官方规则/任务/评估定义
│   └── github-pages.ucl.ac.uk/tus-rec-challenge/(home/data/assessment/leaderboard)
├── 挑战赛结构化描述
│   └── Zenodo concept 15052755(19 页 BIAS PDF,CC BY-4.0)
├── 数据
│   ├── 训练:15224703(restricted,注册)
│   └── 验证:15699958(open,直下)
├── 方法综述/前作
│   └── arXiv:2506.21765(TUS-REC2024 挑战论文)
├── baseline 代码
│   └── github.com/QiLi111/TUS-REC2025-Challenge_baseline
└── "TUS-REC"检索卫生
    └── 区分 2024/2025 两届(核对 DOI);超声域检索排除 uspto-50k(坑 5)

附录 M:引文规范

@misc{tusrec2025challenge,
  title       = {TUS-REC2025: Trackerless 3D Freehand Ultrasound
                 Reconstruction Challenge 2025},
  author      = {Li, Qi and Huang, Yuliang and Saeed, Shaheer U. and
                 Barratt, Dean C. and Clarkson, Matthew J. and
                 Hu, Yipeng and Vercauteren, Tom},
  year        = {2025},
  howpublished = {MICCAI 2025 Challenge},
  doi         = {10.5281/zenodo.15052755}
}

@article{tusrec2024challenge,
  title   = {TUS-REC2024: A Challenge to Reconstruct 3D Freehand Ultrasound
             Without External Tracker},
  author  = {Li, Qi and others},
  journal = {arXiv preprint arXiv:2506.21765},
  year    = {2025}
}

附录 N:本条目生产档案

  • 生产通道:50 篇冲刺批量生产·批次 2(agentA-tusrec)
  • 事实研究:WebSearch 多轮 + Zenodo API 三记录 JSON + UCL 官网四页(home/data/assessment/leaderboard)+ arXiv abs 页 + 第三方交叉验证(ImFusion/COCHE 博客),三源互证通过
  • FACTS.md:writing/tus-rec/FACTS.md 九节
  • 成稿方式:五 part 直写拼接(part1-5,/tmp 唯一化文件名),全程不用 Edit 追加
  • 坑点:§10 八则(坑 1-8"坑 N:"编号制)
  • 互链查询:url_name ILIKE '%ultrasound%'/'%us%'+title '%超声%',命中 18 行、筛真 8 项、排除 uspto-50k 误匹配
  • 查重:url_name ILIKE '%tus-rec%' 0 rows,无同名条目

附录 O:缩写速查

缩写 全称
TUS-REC Trackerless 3D Freehand Ultrasound Reconstruction(Challenge)
MICCAI Medical Image Computing and Computer Assisted Intervention
ASMUS MICCAI 医学超声计算 workshop(第 6 届与 2025 挑战赛同场)
SIGMUS MICCAI Special Interest Group on Medical Ultrasound
BIAS Biomedical Image Analysis ChallengeS
UCL / KCL University College London / King’s College London
NDI Northern Digital Inc.
GPE/GLE/LPE/LLE Global/Local Pixel/Landmark reconstruction error
GP/GL/LP/LL Global/Local Pixel/Landmark(位移向量组)
DoF Degrees of Freedom(自由度)
SD Standard Deviation(标准差)
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability

附录 P:坐标系与时间同步详解(复现者向)

复现评测链路时涉及的四个坐标系与一次时间对齐:

光学相机坐标系(camera space)
    ← NDI Polaris Vicra 追踪探头上的跟踪工具
跟踪工具坐标系(tool space)
    ← tforms[N,4,4] 逐帧记录(tool → camera)
图像坐标系(image space,像素,1 起)
    ← calib_matrix.csv:image → tool 刚体变换
毫米物理空间(mm)
    ← calib_matrix.csv:scaling_from_pixel_to_mm
要点 说明
变换方向 tforms 的存储方向为 tool space → camera space(官网原文),左乘/右乘顺序按齐次变换惯例核对
像素坐标 1 起 image space 以 1 为起点(与标定一致);landmarks 第 1 列帧索引以 0 起——同文件两制(坑 6)
凸阵几何 像素→毫米的映射沿扇形几何展开,标定矩阵隐含曲率;线性索引直乘是系统性错误源(§3.6)
时间对齐 数据 temporally calibrated:第 i 帧 tforms[i] 即该帧曝光时刻位姿,无需用户再做插值对齐
金标准地板 光学跟踪精度(Vicra 标称 RMS 亚毫米级)+ pinhead 标定误差构成指标地板;归一化把地板定义为 0 是约定而非物理事实(§3.4)

附录 Q:TUS-REC2024 vs 2025 全面对照

维度 TUS-REC2024 TUS-REC2025
场合 MICCAI 2024 挑战赛 MICCAI 2025 挑战赛(+ASMUS 2025+SIGMUS)
描述记录 —(描述模板化始于 BIAS 推广期) 19 页 BIAS PDF(15052755,CC BY-4.0)
数据规模 43 注册队口径下的队列(同一 85 人前?官网未并表——待核) 85 人 170 段 ~263k 帧
扫描协议 non-rotation(固定轴向) rotation(+90 度旋转再扫)
数据记录 Train Part1/2/3(11178508/11180794/11355499)+ Validation 12979481 Train 15224703 + Validation 15699958(均双 DOI)
训练数据访问 restricted restricted(revision 16,2025-11-17 最后修改)
输出表示 届内统一但跨届不同 GP/GL/LP/LL 四组位移向量(跨队同构)
注册队 43 未公布(待核)
有效提交 6 队 21 份 正式榜 7 实体
挑战论文 arXiv:2506.21765(已发) 未发(expected by end of 2026)
冠军 挑战论文含获奖团队作者 ImFusion 0.622(Prevost 回场)
亚军团队 — 深圳大学 MUSIC Lab(= 2024 挑战论文作者团队)
跨届可比性 final score 与 2025 不可直比(坑 8) 同左;比毫米值+注意协议差异

附录 R:库内超声家族对照速览(8 项互链 + 1 项排除)

条目(rid) 任务类型 输入形态 输出目标 与 TUS-REC2025 的对照价值
echonet-dynamic(526) 功能估计 心脏超声视频序列 EF 等功能参数 同为"序列输入"——一个学功能、一个学几何,序列建模技巧可互通
echonet-lvh(530) 表型分类 心脏超声视频 HCM 表型 视频级临床任务;采集变异问题同源
camus(533) 多结构分割 2D 心脏超声帧 分割掩码 2D 分割金标准的质量标杆;与 3D 重建的金标准哲学对照
hc18(535) 测量 2D 胎儿超声帧 头围测量 标准平面依赖 vs 任意扫查路径的采集自由度对照
us-nerve-seg(537) 分割 2D 颈部超声帧 臂丛神经掩码 同为"非病灶结构"基准(神经/肌肉骨骼 vs 前臂)
ddti(536) 分割 2D 甲状腺超声帧 结节掩码 静态图像 vs 动态序列的典型对照
busi(539) 分类+分割 2D 乳腺超声帧 良恶性分类与掩码 超声家族流量入口;2D 判读系代表
maternal-ultrasound-nutrition(615) 队列研究 孕期超声影像组 营养表型关联 同为非 DICOM 原生格式+志愿者/队列采集模式
uspto-50k(324) 化学反应提取 专利文本 反应产物集 排除:USPTO 子串误匹配,与超声无关(坑 5)

用法提示:写超声家族综述时按"判读系(busi/ddti/camus/hc18/us-nerve-seg)—序列功能系(echonet-dynamic/echonet-lvh)—几何重建系(本条目)—队列系(maternal-ultrasound-nutrition)"四象限组织,检索入口可从 busi(热度最高)与本条目(任务独占)双向进入。

尾注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-27,抓取与核验时点为 2026-09-26(见附录 A)。事实陈述以 UCL 官网四页、Zenodo 官方记录(concept DOI 15052755/15224703/15699958)、前作论文 arXiv:2506.21765 及 ImFusion/COCHE 团队博客为源;帧数四口径、许可三层异构、双 DOI 体系、文件名两写、summary paper 未发表等原始文档状态已在坑点与附录 J 存照。条目与库内 echonet-dynamic(526)、camus(533)、hc18(535)、ddti(536)、us-nerve-seg(537)、busi(539)、echonet-lvh(530)、maternal-ultrasound-nutrition(615)等超声家族条目互链,填补库内超声"3D 重建"任务极;后续维护触发点见附录 K。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • 3dteethland — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
  • ulf-enc — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
  • rsna-pneumonia — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
  • osic-pulmonary-fibrosis — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
  • heichole — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
  • toothfairy2 — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
  • curvas — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
  • toothfairy3 — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
  • stsr — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
  • mitoem — 共享标签:医学影像 / 挑战赛数据集 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集