信息速览
INFOBOX — TUS-REC2025 一屏速览
维度 内容 本质 MICCAI 2025 官方挑战赛数据集:2D 超声帧序列 + 光学跟踪金标准 → 免跟踪器 3D 重建任务(非单一论文数据集) 主办 University College London(UCL,6 人)+ King’s College London(KCL,Tom Vercauteren),联系人 Qi Li 场合 MICCAI 2025(韩国大田,2025-09-23 至 27)官方挑战赛,与 ASMUS 2025 workshop 同场,SIGMUS 支持 数据 85 名志愿者 × 左右前臂 = 170 段扫描,约 26 万帧(帧数四口径见坑 3);20 fps,480×640,凸阵探头 金标准 NDI Polaris Vicra 光学跟踪位姿(仅作评测,不作算法输入)+ pinhead 法标定 划分 train/val/test = 50/3/32 名受试者(100/6/64 段,~164k/~9k/~90k 帧);测试集不公开 任务 估计帧间变换:输出 GP/GL/LP/LL 四组位移向量(不强制刚体矩阵) 评估 GPE/GLE/LPE/LLE 四项毫米误差 → 归一化排名,final score = 0.25×四项之和(越高越好) 结果 冠军 ImFusion 0.622±0.071(GPE 9.249 mm);亚军深圳大学 MUSIC Lab 0.620;季军 COCHE 0.503;baseline 0.163 诊断 local 误差亚毫米(相邻帧估计近乎解决)vs global 误差毫米级(长序列累积漂移未解决)——四指标暴露误差结构 获取 描述记录 open(CC BY-4.0)|验证数据 open|训练数据 restricted 注册获取(CC BY-NC-SA-4.0 禁商用)|测试集不公开 论文 联合挑战论文未发表(expected by end of 2026);前作论文 arXiv:2506.21765 库内互链 echonet-dynamic(526)、camus(533)、hc18(535)、ddti(536)、us-nerve-seg(537)、busi(539) 等超声家族
TUS-REC2025 是一场"把外部跟踪器从超声三维化里去掉"的挑战赛:它给参赛者 85 名志愿者、170 段前臂自由手持超声扫描(约 26 万帧),每帧都附带光学跟踪器记录的金标准位姿——但参赛算法不许用任何外部跟踪器,只准从图像序列本身推断探头怎么动、并把 2D 帧序列拼成 3D 体。名字里的 “Trackerless” 说的是任务目标,不是数据属性——这正是本条目要替你拆穿的第一层名实之辨(坑 1)。
导语读法三则:
- 只想下数据:直奔 §5 获取与许可——训练数据是注册获取且禁商用的,验证数据开放,测试集拿不到;别把 19 页 PDF 的描述记录当数据本体下(坑 2)。
- 想复现或参赛:直奔 §3 任务定义与 §4 评估体系——输出表示(位移向量)与排名公式(aggregate then rank)是两处最容易做错的工程细节。
- 关心方法学:直奔 §6 结果解读——local 亚毫米 vs global 毫米级的误差结构,是整个挑战赛设计最有诊断价值的产出。
§0 导读:这个数据集解决什么问题
三维超声(3D US)在临床上是有真需求的:定量生物测量、多模态配准、3D 可视化、介入引导,都需要一个体数据而不是一段 2D 视频。获得 3D 超声的传统路线有三条:买一台专用 3D 探头(2D 阵列,昂贵且视野受限)、用机械扫查装置(笨重)、或者给自由手持(freehand)2D 探头配一个外部位置跟踪器(光学或电磁)——第三条路线技术上成熟,但跟踪器带来额外成本、标定负担、视野遮挡与便携性损失,在资源受限的临床场景(急诊床旁、基层筛查、野战与低收入地区)尤其难落地。
免标记(trackerless)freehand 3D 重建是第三条路线的"减法版本":只用图像序列本身估计帧间变换。直觉上这是可行的——相邻帧的重叠区域携带探头运动的信息(散斑模式、组织结构的视差),早在 1997 年就有散斑去相关(speckle decorrelation)方法从图像对里恢复探头位移。深度学习时代,CNN 直接回归帧间变换(2018)、ConvLSTM 建模序列(2021)、transformer(2022)相继登场。但这个领域长期有个致命的方法学缺陷:每篇论文用自己的数据(挑战赛描述原文:“none of these studies used the same dataset”),且学习类方法的数据规模只有 12-40 名受试者——方法之间无法公平比较,"SOTA"无从谈起。
另一个被测量揭穿的幻觉是"局部准=全局准":帧间(相邻两帧)的位移估计误差可以做到亚毫米,但把几百帧的变换递归乘起来,误差像复利一样累积成轨迹漂移(cumulative drift)——全局上探头已经"飘"出几个厘米。只报告一个误差指标的工作,往往把这两层混在一起;要诊断方法的真实能力,需要把 local 与 global、pixel 与 landmark 四个维度分开测。
TUS-REC2025 的回答分三层。第一层是数据:85 名志愿者的左右前臂、170 段扫描、约 26 万帧,每帧带光学跟踪金标准——这是免跟踪重建方向规模最大的公开基准之一(此前学习类方法普遍只有 12-40 人),并且扫描协议加入了旋转等多样探头运动,比前作 2024 版更难。第二层是任务定义:参赛者输出的不是 3D 体也不是轨迹矩阵,而是四组位移向量(相对首帧/前一帧 × 逐像素/逐标志点),把"怎么重建"的自由留给方法、把"评什么"的口径统一给社区。第三层是评估:四项毫米误差(GPE/GLE/LPE/LLE)各自归一化后等权平均为 final score,"aggregate then rank"防止单一指标劫持排名——这套设计直接暴露了误差结构:冠军的相邻帧误差已经亚毫米(近乎解决),而整段序列的全局漂移仍在毫米级(未解决)。
§0 读法三则:
- 这个条目是"挑战赛+数据集+基准"三合一:本体是 170 段带金标准的扫描序列,衍生品是 leaderboard 与 baseline 代码,副产品是一套可复用的免跟踪重建评测协议——三者许可与获取方式各不相同(§5)。
- 全文统计数字均出自官网四页、Zenodo 官方记录与前作论文(arXiv:2506.21765);帧数、许可、DOI 等多口径处已在坑点与 §9 存照。
- 检索时注意:主 DOI(10.5281/zenodo.15052755)的记录本体只是一份 19 页 PDF 结构化描述,不是数据——数据在 Train 与 Validation 两条独立记录里(坑 2)。
§1 数据集速览:十问十答
Q1:TUS-REC2025 到底是什么——数据集、论文还是比赛?
三合一。它是 MICCAI 2025 官方挑战赛(2025-09-27 于韩国大田现场举办),赛题围绕一个公开数据集展开:UCL 团队采集的 85 名志愿者 170 段前臂自由手持超声。挑战赛以 Zenodo 记录群 + GitHub 官网 + docker 提交系统运行,会后转为 open call(post-challenge 截止 2025-10-13),持续接收提交并更新 leaderboard。
Q2:"Trackerless"是说数据没有跟踪器吗?
恰恰相反——这是个高频误读。数据集每帧都带 NDI Polaris Vicra 光学跟踪器记录的金标准位姿,用于评测;"trackerless"说的是参赛算法不得使用任何外部跟踪器输入,必须纯靠图像序列推断探头运动。名实之辨详见坑 1:数据有跟踪、任务免跟踪、金标准供评测,三句话缺一不可。
Q3:数据从哪来、扫的什么部位?
UCL 采集,85 名健康志愿者的左、右前臂(in vivo),每人 2 段扫描共 170 段。队列刻意覆盖多种族、多性别、多年龄(官网原文 “racial-, gender-, age-diverse”);无特殊排除标准(超声凝胶过敏与皮肤病患者除外)。选前臂是因为其伦理与实操可行性已被前人反复验证——这是通向更复杂临床应用前的"第一步"设计。
Q4:规模有多大?帧数到底是多少?
170 段、约 26 万帧。但"约"字下有四套口径并存:~1500 帧/段(官网 Images 段)、~1600 帧/段(Train Zenodo)、~260k 总帧(挑战赛描述)、272,000(邀请函 PDF);官网划分段给出 train/val/test ≈ 164k/9k/90k(总 ~263k)。本条目以官网划分段为主口径,其余存照(坑 3)。划分:50/3/32 名受试者 = 100/6/64 段。
Q5:参赛者要输出什么——3D 体?轨迹?
都不是(严格说:不只是)。官方要求输出四组位移向量:GP(相对首帧逐像素)、GL(相对首帧逐标志点)、LP(相对前一帧逐像素)、LL(相对前一帧逐标志点)。评测方用它们重建成帧并与金标准比对。输出表示刻意避开刚体矩阵——旋转矩阵参数化有 gimbal lock 与局部极小的坑(§3.3)。内部方法随便你用什么,网络输出位移向量即可。
Q6:怎么排名?
四项毫米级误差:GPE/GLE(global 像素/标志点重建误差)与 LPE/LLE(local 同两项),各自按"金标准=0 分、全单位矩阵=最差"归一化到 [0,1],再以 final score = 0.25×(GPE*+GLE*+LPE*+LLE*) 汇总,测试集全扫描平均,保留 3 位小数,越高越好;同分时 runtime 短者列前(总时长上限 6 小时)。这是 “aggregate then rank” 范式(Maier-Hein et al. 2018)。
Q7:比赛结果如何?
正式榜 7 个实体:冠军 ImFusion(德国/加拿大联合团队)final score 0.622±0.071(GPE 9.249 mm);亚军深圳大学 MUSIC Lab 0.620±0.060(GPE 9.851 mm);季军 COCHE(香港)0.503±0.134;主办方 baseline 仅 0.163±0.216。最有信息量的不是名次而是误差结构:冠军 local 误差 LPE 0.153 mm / LLE 0.120 mm(亚毫米,近乎解决),global 误差 GPE 9.2 mm(毫米级漂移仍在)——四指标设计正是为了让这一结构显形。
Q8:我现在能拿到什么?
三层:挑战赛结构化描述记录(19 页 PDF,open,CC BY-4.0);验证数据集(open,2025-06-23 发布,结构与测试集相同);训练数据集(restricted——Zenodo 文件区为空,经注册表单/访问请求发放)。测试集 64 段不公开,只能通过 docker 提交由主办方在测试集上运行。
Q9:能商用吗?
训练与验证数据不可。Train 记录 Data Usage Policy 原文:“commercial use of the training and validation data is prohibited”,许可 CC BY-NC-SA-4.0(署名-非商业-相同方式共享)。注意与挑战赛描述记录的 CC BY-4.0 分开——描述文档可以宽松引用,数据本体必须按 NC-SA 对待(坑 4)。
Q10:为什么它对 AI-Ready 重要?
它是"注册制训练数据 + 开放验证数据 + 不公开测试集 + docker 提交评测"的挑战赛光谱标准型:本体 AI-Ready 得分被 restricted 训练数据拖低,但官方 baseline 代码(Python 公开)、结构化描述(BIAS 模板 19 页)与开放验证集补上了可复现性入口——想立即上手的人可以用验证数据+baseline 代码跑通全管线,想出成绩的人必须走注册通道,想比测试分数的人只能提交 docker。三种入口对应三种用户,这种分层设计本身就是 AI-Ready 评估的活教材。
§1 补充:五个高频误解快查表
| 误解 | 事实 | 依据 |
|---|---|---|
| “Trackerless 数据集 = 没有跟踪信息” | 恰相反:每帧都带 NDI Polaris Vicra 光学跟踪金标准位姿;“trackerless” 只约束参赛算法的输入 | 官网 data.html “Labels / Transformations” 段 |
| “DOI 10.5281/zenodo.15052755 能下到超声数据” | 该记录本体是一个 107,736 字节的 19 页 PDF(挑战赛结构化描述);数据在独立记录 | Zenodo API files 字段 |
| “Train 集在 Zenodo 上点 Download 就能下” | Train 记录 access_right=restricted、files 数组为空,需注册表单/访问请求 | Zenodo API + Train 记录页 |
| “数据集许可 CC BY-4.0” | CC BY-4.0 只属于挑战赛描述 PDF;数据本体是 CC BY-NC-SA-4.0(禁商用) | 两条 Zenodo 记录的 license 字段 |
| “官方挑战赛论文已发表,引用它即可” | 联合挑战论文主办方预告 “expected by end of 2026”,截至 2026-09 未发表 | Train 记录 Data Usage Policy 节 |
§1 补充:数据集的四条使用路径
- 训练路径:Train 100 段序列 + 可选并入的 TUS-REC2024 四条记录——学习方法的主粮仓;受试者 ID 跨年一致,可显式做跨协议实验设计。
- 调参与验证路径:Validation 6 段序列结构与测试集完全相同(frames/ 与 transfs/ 分开 + dataset_keys.h5)——官方在此"提前演练"提交评测时的数据形态,走通管线再提交。
- 上榜路径:docker 化算法经 Microsoft Forms 提交,主办方在私有不公开的 64 段测试序列上评测——这是拿到官方 final score 的唯一途径。
- 方法研究路径:只读 19 页 BIAS 结构化描述 PDF(CC BY-4.0 直链)+ 官网 assessment 页,即可完整理解任务定义、指标公式与排名策略——不碰数据也能做评测方法学研究。
§2 数据构成与规格
2.1 队列、部位与规模
| 属性 | 规格 |
|---|---|
| 志愿者数 | 85 名(健康志愿者,in vivo) |
| 扫描部位 | 左、右前臂(每人各 1 段) |
| 扫描序列总数 | 170 段(85 × 2) |
| 队列多样性 | “racial-, gender-, age-diverse subject cohort”(官网原文;人口学细分未披露) |
| 排除标准 | 超声凝胶过敏、皮肤病患者;前臂本身均健康 |
| 采集方 | UCL(University College London) |
| 扫描帧率 | 20 fps |
| 单段时长 | 约 75-80 秒(按 ~1500-1600 帧/20 fps 折算) |
为什么是前臂?挑战赛描述给出的理由是"伦理与实操可行性"(ethically and practically feasible):前臂志愿者研究在文献里已被反复采用(Prevost et al. 2018、Luo et al. 2022),无病灶、无伦理重负、扫描协议可标准化——它是通向更复杂临床应用(器官、胎儿、介入)之前的方法学试验场。这个设计的代价是:在本基准上练出的模型不能直接宣称适用于临床部位;它的价值在于方法与评测协议,不在于即用的临床模型。
队列规模的意义要放在领域背景里看:此前学习类免跟踪重建研究"relied on data from only 12-40 subjects"(挑战赛描述原文),85 人是此前研究规模的 2-7 倍,是免跟踪重建方向规模最大的公开基准之一。更大的队列意味着序列内与序列间的多样性(体型、皮肤、肌肉形态、扫查手法),模型不太可能靠记住几十个人的散斑纹理"作弊"。
2.2 设备与采集参数
| 参数 | 值 |
|---|---|
| 超声主机 | Ultrasonix(BK, Europe) |
| 探头 | 4DC7-3/40 凸阵探头(convex transducer) |
| 跟踪设备 | NDI Polaris Vicra 光学跟踪器(Northern Digital Inc., Canada) |
| 分辨率 | 480 × 640(H × W) |
| 帧率 | 20 fps |
| 超声频率 | 6 MHz |
| 动态范围 | 83 dB |
| 总增益 | 48% |
| 扫描深度 | 9 cm |
| 散斑降噪 | 关闭(无 speckle reduction——保留原始散斑纹理) |
| 时间同步 | 数据已做时间标定(temporally calibrated)——跟踪位姿与 US 帧时间戳对齐 |
三处参数选择值得展开:
- 凸阵探头而非线阵:凸阵视野呈扇形、深部更宽,是腹部与产科的常规配置;线阵(浅表高频)才是前臂浅表结构的"自然"选择。主办方选凸阵是为了让基准更接近未来临床应用(深部器官)的成像几何,而不是为浅表结构优化。对算法的含义:扇形视野下像素的物理位置随深度变化,逐像素位移的语义要结合标定矩阵解读。
- 关闭散斑降噪:散斑(speckle)既是免跟踪重建的信息载体(散斑去相关测位移的经典原理),也是深度模型的输入纹理。关闭降噪保留原始散斑,让"传统方法与深度方法在同一起跑线"——这是基准公平性的细节。
- 20 fps × 时间标定:帧间运动幅度与帧率直接相关(帧率低→帧间位移大→估计更难)。20 fps 属于常规采集帧率;时间标定保证第 i 帧对应的跟踪位姿就是该帧曝光时刻的位姿,评测的金标准没有时间错位。
2.3 扫描协议:扇摆、摇摆与 2025 新增的旋转
扫描协议是**旋转式(rotation)**的标准化动作序列:
- 探头置于肘部附近的固定接触点;
- 先沿皮肤-探头界面做短轴扇摆(short-axis fanning):探头以接触点为轴 side-to-side 扇形摆动;
- 再沿长轴摇摆(long-axis rocking):垂直方向摇摆;
- 探头旋转约 90 度,重复上述扇摆与摇摆。
与 TUS-REC2024 的 non-rotation 协议相比,2025 版加入旋转/倾斜等多样探头运动。这不是随意加难——临床扫查中探头旋转与斜角进针是常态(避开骨骼遮挡、改善声耦合),2024 的固定轴向协议训练出的方法在"探头转了 90 度"的场景下未必还成立。对参赛者的直接冲击是:帧间变换不再局限在小角度小位移区间,序列建模方法要处理更大姿态跨度;也意味着 2024 模型不能无成本迁移到 2025(这正是主办方想测的泛化差)。
2.4 划分与帧数口径
官方权威划分(官网 data.html):
| 集合 | 受试者数 | 扫描数 | 帧数(约) | 可获取性 |
|---|---|---|---|---|
| Train | 50 | 100 | ~164k | restricted(注册获取) |
| Validation | 3 | 6 | ~9k | open(Zenodo 直下) |
| Test | 32 | 64 | ~90k | 不公开(docker 提交评测) |
| 合计 | 85 | 170 | ~263k | — |
帧数四口径存照(详见坑 3):
| 口径来源 | 说法 |
|---|---|
| 官网 data.html Images 段 | “around 1500 frames for each scan”(×170 ≈ 255k) |
| Train Zenodo 记录 | “around 1600 frames for each scan”(train 100 段 ≈ 160k) |
| Zenodo 挑战赛描述 | “170 scans with about 260k frames” |
| 邀请函 PDF | “approximately optically-tracked 272,000 frames in total” |
| 官网 data.html 划分段 | train/val/test ≈ 164k/9k/90k(总 ~263k) |
处理原则:成稿与引用以官网划分段(~164k/~9k/~90k)为主口径——它粒度最细、与划分结构直接对应;"约 26 万帧"作为概括表述可接受;272,000 是邀请函口径,与其他口径差约 3%,疑为含金标准位姿帧或早期统计,不建议在正式表述中使用。
2.5 文件结构与 h5 数据字典
训练集目录结构(官网 data.html 目录树逐字口径):
Freehand_US_data_train_2025/
frames_transfs/
000/
RH_rotation.h5 # 受试者 000 右前臂旋转扫描:frames + tforms 同文件
LH_rotation.h5 # 受试者 000 左前臂旋转扫描
001/
...
...(共 50 个受试者文件夹,编号 000 起)
landmarks/
landmark_000.h5 # 每受试者一个标志点文件(含其 2 段扫描的标志点)
...
calib_matrix.csv # 标定矩阵
h5 数据字典:
| 键 | 形状 | 语义 |
|---|---|---|
frames |
[N, 480, 640] | 灰度超声帧序列(20 fps) |
tforms |
[N, 4, 4] | 每帧金标准位姿:tracking tool space → optical camera space 的 4×4 齐次变换矩阵 |
landmarks 文件(每受试者一个 .h5,每段 100 个标志点):
| 列 | 含义 | 索引起点 |
|---|---|---|
| 第 1 列 | 帧索引(该标志点出现在哪一帧) | 0 起 |
| 第 2/3 列 | 图像坐标系内的像素坐标 | 1 起(与标定一致) |
两处索引起点不一致(帧 0 起、像素 1 起)是复现时的经典坑——写评测脚本时若把两者起点弄混,误差会以"恰好差一帧/一像素"的形式出现且不易察觉(坑 6)。
calib_matrix.csv 含两个关键量:scaling_from_pixel_to_mm(像素-毫米缩放)与 image → tracking tool space 的刚体变换。标定采用pinhead 法(针尖标定)。评测时,预测位移向量经标定矩阵进入毫米空间与金标准重建帧比对——所有 GPE/GLE/LPE/LLE 的"毫米"都由此而来。
验证集结构差异(与训练集不同、与测试集相同):
frames/ # 帧序列单独一个文件夹
transfs/ # 金标准位姿单独一个文件夹
dataset_keys.h5 # 全部扫描路径清单
验证集把 frames 与 transfs 分开存放并附 dataset_keys.h5 索引——这个结构正是测试集的结构,主办方让验证集"提前演练"提交评测时的数据形态。
文件名笔误存照:官网目录树注释写 RH_rotation.h5,Train Zenodo 描述写 RH_rotating.h5——同一文件两种写法(坑 7)。实际以解压后文件名为准。
2.6 与 TUS-REC2024 数据的衔接
TUS-REC2024 数据集(Zenodo 四条记录:Train Part1/2/3 + Validation)在 2025 年仍开放,作为可选附加训练数据。两届数据有一个人性化设计:patient IDs 一致——2024 的某号受试者与 2025 的同号受试者之间有可控的对应关系,参与者在合并训练时可以显式控制数据分布(避免同一人在两届数据里同时出现在训练与验证侧的泄漏)。
两届数据的差异在扫描协议:2024 为 non-rotation(固定轴向扇摆/摇摆),2025 加入旋转。这意味着"2024 数据 + 2025 任务"组合在分布上是有缝的——用 2024 数据预训练、2025 数据微调是官方认可的合法策略,但效果如何正是 leaderboard 上各队的隐形竞赛维度。2024 四条记录的 DOI 还有 concept/version 双写现象(官网用 concept DOI 11178508/11180794/11355499,Train 2025 页内链接用 version DOI 11178509/11180795/11355500——同一数据两套链接,坑 5 的延伸案例)。
2.7 使用前检查清单:拿到数据后先做什么
restricted 训练数据发放后,建议按顺序执行以下检查(每条对应一个已知坑或易错点):
| 步骤 | 检查项 | 对应坑 |
|---|---|---|
| 1 | 解压后 `ls -R | head` 核对目录树:50 个受试者文件夹 × RH/LH 两个 .h5 + landmarks/ + calib_matrix.csv |
| 2 | 文件名以实际为准建索引(RH_rotation/RH_rotating 两写并存,勿写死) | 坑 7 |
| 3 | 逐文件读 h5 键:frames [N,480,640] 与 tforms [N,4,4] 帧数一致性 |
— |
| 4 | tforms 有限性检查(NaN/Inf 扫描)与齐次性检查(末行 [0,0,0,1]) | — |
| 5 | landmarks 帧索引范围 [0, N-1] 与像素坐标范围 [1, 640]/[1, 480] 边界核查 | 坑 6 |
| 6 | calib_matrix.csv 读入后与官网参数对照(480×640、9 cm 深度) | — |
| 7 | 抽 1 段扫描用 tforms 重建粗体并可视化(哪怕只是深度图投影)——肉眼确认位姿合理 | — |
| 8 | 记录你使用的帧数统计口径并写进实验配置(~164k 主口径) | 坑 3 |
这套清单的价值在于把"数据看起来对"变成"数据确认对":本条目存照的全部文档级不一致(坑 3/6/7)都发生在"没跑 sanity check 直接上全量"的工作流里。第 7 步的可视化尤其重要——位姿链路错误(标定方向搞反、坐标系左右混淆)在数字指标上可能只表现为"分数偏低",在重建图上则一眼可见(体翻转、蛇形扭曲)。
§3 任务定义与输出表示
3.1 任务形式化
输入:一段 2D 超声帧序列 I₁, I₂, …, I_N(N ≈ 1500-1600,20 fps)。
目标:估计帧间变换 {T_j←i},使得仅用帧序列与其几何关系即可重建出与金标准重建体对齐的 3D 体。
禁止:使用任何外部位置跟踪器(光学/电磁/机械)信息作为输入。
金标准:NDI Polaris Vicra 光学跟踪位姿——只用于评测,不进入算法。
任务的麻烦在误差的复利结构:重建体是由逐帧变换递归拼接而成,第 j 帧相对首帧的位姿是前 j−1 个帧间变换的连乘积。相邻帧估计哪怕只有 0.1 度的角度误差与 0.05 mm 的平移误差,几百帧连乘后全局漂移也可达厘米级。这就是为什么 local 指标(相邻帧)近乎解决而 global 指标(全程序列)仍在毫米级——§6 的结果会把这个结构摆到台面上。
3.2 四组位移向量:GP/GL/LP/LL
官方要求的输出不是轨迹矩阵也不是 3D 体,而是四组位移向量(displacement vectors):
| 组 | 参考系 | 对象 | 语义 |
|---|---|---|---|
| GP(global pixel) | 首帧(global reference frame) | 逐像素 | 每个像素从第 i 帧回到首帧坐标系的三维位移 |
| GL(global landmark) | 首帧 | 逐标志点 | 100 个预定义解剖标志点相对首帧的位移 |
| LP(local pixel) | 前一帧(local reference frame) | 逐像素 | 每个像素从第 i 帧到第 i−1 帧的位移 |
| LL(local landmark) | 前一帧 | 逐标志点 | 标志点相对前一帧的位移 |
设计意图有三层:
- 统一评测口径:所有参赛队输出同构的四组量,评测方可以统一地"从位移重建帧→与金标准重建帧比对",不再需要为每家的输出格式写适配器(对比 2024 届的多样化提交格式)。
- 分解误差维度:global/local × pixel/landmark 的 2×2 正好把"漂移"与"局部估计"、"全场误差"与"关键结构误差"四个维度解耦——§6 的解读全靠这个分解。
- 不强制刚体:位移向量可以编码非刚体的形变残差(探头压力导致的组织形变),比强制输出 6-DoF 刚体矩阵的表达上限更高。
3.3 为什么不要求输出刚体矩阵
官网给出的理由(大意):旋转矩阵的欧拉角参数化存在 gimbal lock(万向节死锁),旋转估计的数值优化容易陷入局部极小;位移向量表示规避了这些坑,“允许近刚体但量化更准的重建”,同时不限制方法内部的设计自由。
工程上的注脚:网络最后一层输出 3 个平移分量 + 每像素/每标志点的位移残差,激活函数与损失设计都比"输出合法旋转矩阵"(需要正交化或四元数归一化)简单得多。监督信号(金标准变换的位移分解)是连续的、无奇异点的——这对回归任务的训练稳定性是实打实的友好。
3.4 金标准与标定:跟踪器在数据里、不在输入里
金标准链路:NDI Polaris Vicra 光学跟踪器 → 探头上的跟踪工具位姿(tool space)→ 经 calib_matrix.csv 的刚体变换对齐到图像空间 → 逐帧 tforms [N,4,4]。时间维度上,数据已做时间标定(temporally calibrated),位姿与帧时间戳对齐。
评测管线:参赛位移向量 → 重建各帧(经标定进入毫米空间)→ 与金标准重建帧逐像素/逐标志点算欧氏距离(mm)→ 按四指标汇总。跟踪位姿从头到尾只在评测侧出现——这正是本挑战赛"数据带跟踪、任务免跟踪"结构的落点(坑 1 的技术细节层)。
一个评测设计的细节:金标准本身的误差(光学跟踪精度 ≈ 亚毫米级 + 标定误差)构成所有指标的"地板"。归一化设计(§4.2)把"金标准重建"的误差定义为 0——即默认金标准无误差;这是基准的约定而非物理事实,解读极端精细的误差差异(如 0.001 mm 级)时应记得地板的存在。
3.5 Baseline:主办方自留的起跑线
Baseline 是主办方 UCL 的 Li et al. 系列算法(代码公开于 GitHub repo QiLi111/TUS-REC2025-Challenge_baseline,Python),方法谱系对应三篇论文:
| 论文 | 年份/场合 | 贡献 |
|---|---|---|
| 序列建模 + 未来/过去帧辅助变换估计 | ISBI 2023(doi:10.1109/ISBI53787.2023.10230773) | 帧间变换估计的序列化基础 |
| 长期依赖建模 | IEEE TBME 2024(doi:10.1109/TBME.2023.3325551) | 跨长序列的依赖捕捉 |
| 非刚体扩展 | MICCAI 2024(doi:10.1007/978-3-031-72083-3_64) | 位移表示下的非刚体处理 |
Baseline 的 final score 只有 0.163±0.216(GPE 26.110 mm)——与冠军 0.622 差了近 4 倍。这个差距本身是信息:它说明基准有充足的提升空间(不是"人人接近满分"的失效基准),同时 baseline 公开代码给了后来者一个能跑通全流程的真实起点。引用政策要求:使用数据须引用未来的 summary paper + 上述三篇方法论文(§5.4)。
3.6 从位移向量到 3D 体:重建管线拆解
参赛者输出四组位移向量之后,到"3D 体"之间发生了什么?把评测方的重建管线拆开看(本地复现时同理自建):
位移向量(GP/GL/LP/LL,任意一组)
| 经 calib_matrix.csv:像素坐标 x scaling_from_pixel_to_mm → 毫米空间
逐帧像素的毫米空间坐标
| 位移向量施加:源帧像素 → 目标参考系(首帧或前一帧)位置
参考系下的逐帧点云
| 全帧融合:体素栅格化(插值:最近邻/线性)
3D 体(voxel grid)
| 与金标准重建体逐像素对齐比较
GPE/GLE/LPE/LLE(mm)
三处工程细节决定复现质量:
- 插值选择:体素化时的插值策略直接影响逐像素误差的下限——最近邻引入量化误差,线性插值平滑散斑。评测方的插值实现是"地板误差"的一部分;自建管线时对齐官方实现(或容忍 0.1 mm 级系统差)。
- 参考系一致性:global 组(GP/GL)以首帧为参考、local 组(LP/LL)以前一帧为参考——混用参考系是新手最常见的管线 bug(表现为 local 指标异常大)。
- 凸阵几何:像素到毫米的映射沿探头扇形几何展开(凸阵的曲率半径与张角由标定隐含),不能套用线阵的等距假设——直接用 scaling × pixel index 会在深部引入系统性位置偏差。
3.7 任务视角定位:配准、里程计与 SLAM 的亲缘
免跟踪重建在计算机视觉的任务谱系里有三个近亲,理解亲缘关系有助于方法迁移:
| 近亲任务 | 共享什么 | 本任务的特殊性 |
|---|---|---|
| 图像配准(registration) | 帧间变换估计的核心几何 | 配准通常一次估一对,这里要估计整条序列且误差累积 |
| 视觉里程计(visual odometry) | 相邻帧运动估计 + 累积漂移问题 | US 无纹理角点可用,散斑/组织结构替代自然特征 |
| SLAM | 漂移校正、回环检测的思想 | US 场景"重访"定义模糊(软组织形变+声窗变化),经典回环难以直接搬用 |
2025 届结果(§6.3)已经证明:帧间估计(≈里程计的前端)接近解决、全局漂移(≈里程计的后端/回环)未解决——这意味着 SLAM 社区的后端思想(位姿图优化、回环约束、因子图)是尚未被充分开采的方法迁移方向。反方向的迁移也存在:US 重建的"可微重建"思想(重建损失直接回传到位姿估计)在传统视觉里程计里并不常见,是医学影像侧对更广社区可能的反哺。
对库内检索者的定位参考:本条目是库内少有的"几何重建型"条目——大多数影像条目是分类/分割/检测任务(输出语义标签),本条目输出几何变换(输出连续位姿场),评测哲学(毫米误差 vs Dice/accuracy)完全不同。做跨条目方法迁移时,先把"任务输出类型"对齐再谈网络结构。
§4 评估体系:四指标、归一化排名与规则细节
4.1 四项毫米误差的定义
| 指标 | 全称 | 参考系 | 对象 | 含义 |
|---|---|---|---|---|
| GPE | Global Pixel reconstruction error | 相对首帧重建 | 全部像素 | 预测重建帧 vs 金标准重建帧的全像素平均欧氏距离(mm) |
| GLE | Global Landmark reconstruction error | 相对首帧重建 | 100 标志点 | 同上但只对预定义解剖标志点平均(mm) |
| LPE | Local Pixel reconstruction error | 相对前一帧重建 | 全部像素 | local 参考系的逐像素误差(mm) |
| LLE | Local Landmark reconstruction error | 相对前一帧重建 | 100 标志点 | local 参考系的标志点误差(mm) |
读法:第一维(global/local)区分"整段序列累积到位"与"相邻帧估计";第二维(pixel/landmark)区分"全场几何"与"关键解剖结构"。GPE 9 mm 而 LPE 0.15 mm 的组合意味着:帧到帧贴得很准,但几百帧叠起来漂了 9 mm——这正是 §6 结果解读的核心结构。
为什么用"重建误差"而非"轨迹误差"?官方引用的方法学论证:Luo et al. 2023(Medical Image Analysis,doi:10.1016/j.media.2023.102810)论证距离空间误差优于变换参数空间误差(旋转角/平移的参数差不直接映射到临床关心的几何偏差);Wein et al. 2020(doi:10.1007/978-3-030-59716-0_49)同向。落到 Ultrasound 场景:医生在乎的是"重建的体长歪了没有",不是"旋转向量的第三个分量差了几度"。
4.2 归一化与排名:“aggregate then rank”
四项指标各自归一化到 [0,1](Maier-Hein et al. 2018,doi:10.1038/s41467-018-07619-7 的 “aggregate then rank” 范式):
GPE* = (GPE − largest_GPE) / (smallest_GPE − largest_GPE)
其中 smallest_GPE = 0(金标准重建的误差,定义为地板)
largest_GPE = 全部使用单位矩阵(identity transform)重建的误差(定义为天花板)
即:金标准=1 分,全躺平(什么都不估、每帧原位叠加)=0 分。GLE*/LPE*/LLE* 同构。
final score = 0.25·GPE + 0.25·GLE + 0.25·LPE* + 0.25·LLE***,对测试集所有扫描取平均,保留 3 位小数,越高越好。
另设四组参考分(不参与正式排名,供方法画像):
| 参考分 | 组成 | 画像维度 |
|---|---|---|
| global score | 0.5·GPE* + 0.5·GLE* | 长程重建能力 |
| local score | 0.5·LPE* + 0.5·LLE* | 相邻帧估计能力 |
| pixel score | 0.5·GPE* + 0.5·LPE* | 全场几何能力 |
| landmark score | 0.5·GLE* + 0.5·LLE* | 关键结构能力 |
归一化的用意是抗量纲劫持:GPE 是全像素平均(数值毫米级),LPE 是相邻帧误差(数值亚毫米级)——若直接加权平均原始毫米数,LPE/LLE 的贡献会被 GPE/GLE 淹没。各自归一化后再等权,四项才真正"等票"。这套设计的代价是:分数不可跨届直比(天花板 largest_GPE 取决于当届数据与金标准重建的实现),2024 与 2025 的 final score 不在一个标尺上(坑 8 的延伸)。
4.3 Runtime 与提交规则
| 规则 | 内容 |
|---|---|
| runtime 定义 | 预测全部帧位姿的耗时,按扫描平均 |
| 同分规则 | final score 相同时,runtime 短者列前 |
| 硬上限 | 全部测试扫描总 runtime ≤ 6 小时 |
| 失效条款 | 代码跑不通或指标算不出 = 0 分 |
| 提交形态 | dockerized 算法,主办方在测试集上运行 |
| 参与政策 | fully automatic 方法;公开+私有数据均允许但必须披露 |
| 机构回避 | 主办方所在机构成员可参加但不获奖、不进 leaderboard |
三条规则的导向值得注意:6 小时上限与同分短者优先,是把"效率"写进评测基因(临床落地场景里重建速度不是奢侈品);0 分条款把可复现性变成硬约束(提交的 docker 必须真能跑);主办方回避条款是 “aggregate then rank” 系列方法学倡议里的标准防利益冲突设计。
4.4 刻意不纳入的指标
官网明确列出不纳入的指标:final drift(终帧漂移)、Dice overlap 等——原文理由是为精简评估(尽管这些指标在文献中常用)。这个取舍可以商榷:Dice 需要分割定义(前臂数据无病灶分割金标准,定义成本高),final drift 与 GPE 高度相关;但在解读时要注意——没有纳入不等于没有发生:一个 final score 0.62 的方法,其终帧漂移可能仍然显著,使用者不能因为 Dice 不在榜单就默认重建体"分割可用"。指标集定义了基准测什么,也定义了它不测什么。
4.5 读懂分数的四条守则
- 别只报 final score。0.622 与 0.620 的冠亚之争(差 0.002)远小于四指标内部的误差结构差异(GPE 9.249 vs 9.851 mm)——任何严肃的方法比较都应四项并报,最好附四组参考分画像。
- 分数是归一化的,别当毫米用。0.5 分不等于"误差是金标准与躺平的一半"——归一化是线性的,但测试集平均与 3 位小数舍入都在其上;要报毫米数请回 GPE/GLE/LPE/LLE 原始值。
- 同届内比名次,跨届比毫米。final score 不可跨届直比(天花板不同);GPE 等原始毫米误差跨届可比性更强,但仍受扫描协议差异(2025 加了旋转)限制。
- runtime 是并列维度。临床可部署性语境下,26.7 s(冠军)与 107.5 s(亚军)的差距和 0.002 分的差距可能同等重要——榜单把它作为同分裁决,方法论研究者应把它作为一等公民分析。
4.6 归一化数值算例:一个假想扫描上的完整计算
设某条测试扫描上,某提交方法的四项原始误差为:GPE = 12.000 mm、GLE = 9.000 mm、LPE = 0.200 mm、LLE = 0.160 mm。该扫描的"天花板"(全部用单位矩阵重建的误差)为:largest_GPE = 40.000 mm、largest_GLE = 30.000 mm、largest_LPE = 0.400 mm、largest_LLE = 0.320 mm;地板(金标准重建)全部为 0。
GPE* = (12.000 − 40.000) / (0 − 40.000) = 28.000 / 40.000 = 0.700
GLE* = (9.000 − 30.000) / (0 − 30.000) = 21.000 / 30.000 = 0.700
LPE* = (0.200 − 0.400) / (0 − 0.400) = 0.200 / 0.400 = 0.500
LLE* = (0.160 − 0.320) / (0 − 0.320) = 0.160 / 0.320 = 0.500
final score(该扫描)= 0.25×0.700 + 0.25×0.700 + 0.25×0.500 + 0.25×0.500
= 0.175 + 0.175 + 0.125 + 0.125 = 0.600
三个读数:其一,“全躺平”(所有帧原位叠加)在这条扫描上正好对应 0 分——单位矩阵不是随意的坏方法,而是"什么都不估"的精确语义;其二,global 与 local 在归一化后可比(原始量纲差 100 倍的两类误差被拉回同一标尺);其三,该方法的 0.600 是"单扫描分",最终榜分还要在 64 段测试扫描上平均——SD 列(如冠军 final 0.622±0.071)描述的正是这个跨扫描波动。
4.7 指标设计三问三答
问:为什么 pixel 与 landmark 要分开测?
答:全像素平均(GPE/LPE)对"整幅图像的几何一致性"敏感,landmark 平均(GLE/LLE)对"解剖结构落位"敏感。一个方法可能全场平均不错但关键结构偏移( landmark 差),也可能标志点贴准了但全场分布歪——两组指标交叉才能定位误差的"形态"。
问:local 已经亚毫米了,为什么还要认真测 global?
答:因为两者测的是方法的不同组件。local 只考"帧间变换估计"这一个环节;global 考"估计 + 递归累积"的复合结果。临床上一个完整的扫查重建必须走完几百帧的累积链——global 不过关,local 再准也不可部署。2025 榜单 local 近解决而 global 未解决,正是把"该往哪里投入研究"指了出来。
问:为什么不用 Dice/重叠度这类"下游指标"?
答:官网 rationale 节给出了取舍——前臂数据没有分割金标准,Dice 的定义成本高且会引入分割器自身的偏差;GPE/GLE/LPE/LLE 与金标准重建帧直接比对,评估链路里没有第三方模型。基准设计的一般原则:每引入一个中间模型,评测的方差来源就多一层。
4.8 评估管线的工程实现:从提交到分数
把"一个 docker 镜像如何变成 leaderboard 上的一行"完整走一遍,评测的工程闭环如下:
| 阶段 | 动作 | 失败模式 |
|---|---|---|
| 1. 接收 | 提交表单登记 + docker 镜像入库 | 镜像过大/依赖缺失 |
| 2. 运行 | 主办方在测试集 64 段上逐一执行 | 代码跑不通 → 0 分(硬条款) |
| 3. 计时 | 每段预测耗时记录,全扫描求和 | 超 6 小时上限 → 判不合格 |
| 4. 重建 | 位移向量 → 毫米空间 → 重建体 | 插值/参考系实现不一致 |
| 5. 误差 | 四项毫米误差逐段计算 | 索引起点混淆(坑 6) |
| 6. 归一化 | identity 天花板在测试集实测 | 天花板实现差异(跨届不可比的根源) |
| 7. 汇总 | final score 3 位小数 + runtime 平均 | — |
| 8. 排名 | 分数降序;同分 runtime 短者前 | — |
这张表对参赛者的含义:阶段 2/3 的失败模式与算法质量无关却直接清零——docker 环境冻结(含 CUDA 版本、依赖锁版本)与 runtime 预算管理是工程必修课;阶段 4-6 的实现细节在官方评估代码与验证集上先行对齐,是"验证集分数"与"测试集分数"可迁移性的前提。
§5 获取与许可:记录群、双 DOI 与注册制
5.1 四条(组)Zenodo 记录全景
| 记录 | concept DOI | version DOI | 发布日 | 访问 | 许可 | 本体 |
|---|---|---|---|---|---|---|
| 挑战赛结构化描述 | 10.5281/zenodo.15052755 | 10.5281/zenodo.15119085(v2) | 2025-03-21(v2 modified 2025-04-10) | open | CC BY-4.0 | 19 页 BIAS 模板 PDF(107,736 字节) |
| Train Dataset | 10.5281/zenodo.15224703 | 10.5281/zenodo.15224704 | 2025-04-28(v1.0.0;modified 2025-11-17,revision 16) | restricted | CC BY-NC-SA-4.0 | Zenodo 文件区为空——经注册/访问请求发放 |
| Validation Dataset | 10.5281/zenodo.15699958 | 10.5281/zenodo.15699959 | 2025-06-23 | open | open access | 帧序列+位姿+dataset_keys.h5 |
| 前作 TUS-REC2024(可选附加训练数据) | 11178508 / 11180794 / 11355499(Train Part1/2/3)+ Validation 12979481 | 11178509 / 11180795 / 11355500 等 | 2024 | Train restricted / Validation open | NC-SA 系 | 四条独立记录 |
抓取时点(2026-09-26)的 Zenodo stats:描述记录 views 1406 / downloads 1317;Train 记录 views 3109 / downloads 613——下载比(downloads/views)显著低于 open 记录的常态,与 restricted 的门槛一致。
主记录不是数据(坑 2):任务头给的概念 DOI 15052755 是挑战赛的"户口本"——19 页 PDF 描述(BIAS Initiative 结构化模板,含挑战赛目的/数据/任务/评估/规则全景),本体没有一帧超声。要数据去 Train(15224704)与 Validation(15699958);要理解规则读 15052755 的 PDF。
5.2 双 DOI 体系
Zenodo 为每条记录同时发两个 DOI:concept DOI(指向该概念的全部版本,跨版本稳定)与 version DOI(指向具体某个版本)。TUS-REC2025 三条 2025 记录都有两套(见上表),OpenAIRE 同时收录。引用建议:引 concept DOI(15052755/15224703/15699958)保证引用不因版本更新失效;引用特定实验口径(如"v1.0.0 训练数据")时才用 version DOI。2024 前作记录在官网与 Zenodo 页内就有 concept/version 两套链接并存的实际案例(坑 5)。
5.3 注册与提交的实操流程
想参赛/出测试分:
1) Microsoft Forms 注册表单(一式)——注册开放自 2025-04-01
2) 训练数据经 Train 记录的访问请求/注册表单发放(restricted 通道)
3) 验证数据 Zenodo 直接下载(open)
4) 本地训练 + 验证集自评(验证集结构与测试集相同,可演练)
5) Microsoft Forms 提交表单(一式)+ docker 镜像提交
6) 主办方在测试集(64 段)上运行 → 四指标 → leaderboard
只想复现/学习:
验证数据(open)+ 官方 baseline 代码(GitHub)即可跑通全管线,
无需注册——代价是没有训练数据,只能做推理侧或小样本实验。
时间线对照(官网口径,均 23:59 BST):2025-04-01 网站开放/注册开始 → 04-28 训练数据+baseline 发布 → 06-23 验证数据+提交代码发布 → 07-07 提交开始 → 08-31 提交截止 → 09-01 冠军公布 → 09-27 MICCAI 现场活动 → 10-13 赛后提交截止(post-challenge,open call 生命周期)。日期与 Zenodo 记录发布日精确互证(04-28=Train 发布日;06-23=Validation 发布日)。
5.4 许可与使用政策:三张通行证各管一段
| 资产 | 许可 | 关键条款 |
|---|---|---|
| 挑战赛描述 PDF | CC BY-4.0 | 署名即可自由使用/分享/改编 |
| Train + Validation 数据 | CC BY-NC-SA-4.0 | 署名-非商业-相同方式共享;Data Usage Policy 原文 “commercial use of the training and validation data is prohibited” |
| 测试集 | 无许可可言 | 不公开,仅 docker 提交评测 |
| 官方 baseline 代码 | GitHub 公开(Python) | 按 repo 内许可执行 |
Data Usage Policy 的完整口径(Train 记录原文大意):训练与验证数据可用于挑战范围及后续研究发表;商业用途禁止;用途模糊时应避免挑战范围外的再分发或使用。三处对使用者的实际约束:
- 商用模型训练出局:用本数据训练的模型权重若用于商业产品,许可链不清(NC 约束数据使用,模型权重的衍生属性在 NC-SA 语义下属灰色地带)——稳妥结论是不可商用。
- 再分发要同方式共享:SA 条款要求数据的再分发按 CC BY-NC-SA-4.0 继续——自建镜像、打包教程分发数据时注意携带许可。
- 引用义务:使用数据须引用(未来的)summary paper + Li 等三篇方法论文(ISBI 2023/TBME 2024/MICCAI 2024)。summary paper 截至 2026-09-26 未发表——引用回落到前作论文 arXiv:2506.21765 与三篇方法论文,并在 summary paper 发表后补引(坑 2 的引用侧)。
发表限制的细节:参赛团队可单独发表自己的方法,但只能在该联合挑战论文发表之后(expected by end of 2026)——这解释了为什么截至抓取时点,榜单上各队方法的正式论文极少(冠军 ImFusion 团队博客称其论文已挂 arXiv 但编号未公开核验)。
5.5 AI-Ready 评估:挑战赛光谱的标准型
以库内 AI-Ready 检查单过一遍:
| 检查项 | 评级 | 依据 |
|---|---|---|
| 机器可读元数据 | 良好 | BIAS 结构化描述 19 页(含目的/数据/任务/评估/规则字段)+ Zenodo API 标准 JSON + GitHub 官网 |
| 公开直链 | 部分 | Validation open;Train restricted 且 Zenodo 文件区为空——最大失分项 |
| 许可明确性 | 良好但异构 | 三层许可各自明确,但 CC BY-4.0(描述)与 CC BY-NC-SA-4.0(数据)并存,检索者易误引 |
| 可复现性 | 良好 | baseline 代码公开(Python)+ 验证集结构与测试集一致 + docker 评测管线标准化 |
| 文档自洽 | 中 | 帧数四口径、文件名两写、2024 记录双链接——不影响主线但自动化抓取需指定主口径 |
综合:AI-Ready 等级"中"——元数据与可复现性基建高于多数挑战赛(BIAS 模板+baseline 代码+结构一致的验证集是三件加分器),可获取性被 restricted 训练数据与不公开测试集拖低(两者是挑战赛防泄漏的合理设计,但对 AI-Ready 得分是硬成本)。
5.6 库内可获取性光谱上的位置
| 档位 | 本条目对应 |
|---|---|
| 注册获取(restricted) | 训练数据(Zenodo access request 通道) |
| 平台托管 open | 验证数据 + 描述记录(Zenodo) |
| 不公开金标准 | 测试集(docker 提交评测) |
| 代码资产直链 | baseline 仓库(GitHub) |
特色结构是"三层入口对应三类用户":学习者走 open 层(验证数据+baseline)、研究者走 restricted 层(注册拿训练数据)、竞争者走 docker 层(提交出测试分)。与纯"打包放 Zenodo"的单层公开相比,这种分层是挑战赛数据集在防泄漏与可及性之间的折中解——但它也意味着任何"本数据集开放"的一刀切表述都是错的(坑 4 的获取侧)。
5.7 注册与等待期的实操建议
restricted 训练数据的等待期是本数据集使用者最现实的成本。三条把等待变异步的策略:
- 验证集先行:验证数据 open 且结构与测试集一致——注册提交的同一天就可以用验证数据+baseline 代码把"加载→训练→推理→位移→重建→四指标"全管线跑通,等训练数据到位时只换数据不换代码。
- 2024 数据并行评估:TUS-REC2024 四记录虽也受限,但发布更早、历史请求通道成熟;若 2025 训练数据等待过长,可先在 2024 数据上完成方法原型(注意 non-rotation 分布缝)。
- 等待期做漂移分析:用验证集的 6 段扫描做"误差-序列长度"曲线实验——你的方法在第几帧开始发散?global 误差随帧数的增长是线性还是指数?这类分析不需要 100 段训练数据,但直接决定方法改进方向(§6.3 的诊断逻辑)。
5.8 AI-Ready 三视角详评
同一套获取结构,三种用户视角下的体验差异很大——这是"分层入口"设计的真实成本收益:
| 视角 | 体验 | 得/失 |
|---|---|---|
| 检索者(找数据的人) | Zenodo 搜索/Google 命中描述记录 → 点开发现"不是数据" → 需再跳两跳到 Train/Validation | 得:BIAS 描述让规则透明;失:主 DOI 不是数据本体,第一跳有挫折感(坑 2) |
| 使用者(要用数据的人) | 验证数据即下即用;训练数据要注册等审批 | 得:验证集结构=测试集,演练成本低;失:训练等待周期不确定,无法排期 |
| 评测者(要出分数的人) | docker 提交,环境由主办方保证 | 得:评测环境统一,公平性好;失:本地分数不可直推(归一化天花板不同) |
结论与 §5.5 一致但更具体:本数据集的 AI-Ready 短板集中在"训练数据的时间成本不可预期",而不是"数据不可得"——这与"注册墙+审批门"式数据集有本质区别(后者是资格问题,前者是排期问题)。写综述或做数据集选型时,建议把这两类注册制分开评级。
§6 挑战赛结果:榜单、误差结构与获奖者
6.1 正式榜(before submission deadline,7 个上榜实体)
| 名次 | 团队 | final score(±SD) | GPE (mm) | GLE (mm) | LPE (mm) | LLE (mm) | runtime (s) |
|---|---|---|---|---|---|---|---|
| 1 | ImFusion | 0.622 ± 0.071 | 9.249 ± 2.906 | 6.986 ± 3.012 | 0.153 ± 0.020 | 0.120 ± 0.018 | 26.744 ± 2.997 |
| 2 | MUSIC Lab(深圳大学) | 0.620 ± 0.060 | 9.851 ± 3.140 | 8.116 ± 3.018 | 0.138 ± 0.018 | 0.116 ± 0.017 | 107.479 ± 24.052 |
| 3 | COCHE(香港) | 0.503 ± 0.134 | 13.892 ± 6.748 | 10.705 ± 4.628 | 0.172 ± 0.026 | 0.143 ± 0.029 | 43.054 ± 3.274 |
| 4 | AGH-MedApp(波兰) | 0.383 ± 0.128 | 18.605 ± 6.492 | 15.955 ± 5.850 | 0.179 ± 0.026 | 0.153 ± 0.031 | 40.367 ± 3.230 |
| 5 | AMI-Lab(釜山大学,Korea) | 0.301 ± 0.155 | 21.800 ± 6.477 | 19.645 ± 6.310 | 0.177 ± 0.027 | 0.157 ± 0.035 | 10.439 ± 0.683 |
| 6 | QBME(上海交通大学) | 0.188 ± 0.206 | 25.708 ± 8.263 | 21.728 ± 9.009 | 0.216 ± 0.026 | 0.183 ± 0.032 | 34.686 ± 2.808 |
| 7 | Baseline(UCL 主办方) | 0.163 ± 0.216 | 26.110 ± 7.256 | 23.681 ± 9.049 | 0.214 ± 0.025 | 0.181 ± 0.030 | 19.753 ± 1.570 |
另附官网同表的分数画像列(供解读对照):ImFusion global score 0.656 / local 0.588 / pixel 0.627 / landmark 0.617;MUSIC Lab global 0.623 / local 0.617 / pixel 0.639 / landmark 0.601——亚军局部更强、冠军全局更强的结构在参考分一栏同样显形。
人员与机构(前三名,官网 leaderboard 全披露):
- ImFusion:Paul Wilson, Matteo Ronchetti, Ruediger Goebl, Viktoria Markova, Sebastian Rosenzweig, Raphael Prevost, Parvin Mousavi, Oliver Zettinig——ImFusion GmbH(Germany)+ Queen’s University(Canada)。存照:团队成员 Raphael Prevost 与 2018 年首个深度学习免跟踪重建方法(挑战赛描述引文 Prevost et al. 2018)署名者同名,冠军团队博客称"论文已挂 arXiv、代码权重已公开";是否同一人未做传记级核验,引用时以团队与榜单口径为准。
- MUSIC Lab:Mingyuan Luo, Jiongquan Chen, Zhongnuo Yan, Xin Yang, Dong Ni——深圳大学(China)。这五人正是前作 TUS-REC2024 挑战论文(arXiv:2506.21765)作者团队的成员——上届论文作者组队参赛拿亚军。
- COCHE:Lei Zhao, Yuan Zhao, Kannie WY Chan——香港心脑血管健康工程中心(Centre for Cardiovascular Health Engineering)+ 香港城市大学。
6.2 赛后榜(including post-challenge submissions,9 实体)
post-challenge 窗口(截止 2025-10-13)新增两名:
| 名次 | 团队 | final score | 备注 |
|---|---|---|---|
| 5 | T3DR | 0.310 | Dmytro Yesyp(AGH);“* Post-challenge submissions before 13 Oct 2025” |
| 7 | SMART Lab | 0.235 | 上海大学;同上 |
前三名次在赛后榜保持不变。post-challenge 榜的价值在于持续基准活性:挑战赛不是一次性事件而是 open call(§5.3),新方法仍可进场对标——截至抓取时点(2026-09-26)榜单在 GitHub Pages 上公开可查。
6.3 结果的真正读法:四指标暴露的误差结构
把冠军数字单独拎出来看:
| 维度 | 数值 | 解读 |
|---|---|---|
| LPE 0.153 mm / LLE 0.120 mm | 亚毫米 | 相邻帧估计近乎解决——0.15 mm 已接近光学跟踪金标准的精度地板 |
| GPE 9.249 mm / GLE 6.986 mm | 毫米级 | 长序列累积漂移未解决——在 9 cm 深度、约 1500 帧的序列上,全局漂移仍是厘米内毫米级 |
| SD:GPE 2.906 / final 0.071 | 扫描间方差可观 | 有的扫描漂得多、有的少——漂移与扫描内容(组织纹理、运动模式)强相关 |
三个推论:
- 挑战赛的诊断价值已经兑现:local 指标证明"帧间变换估计"这一环节接近天花板(再卷下去收益有限),global 指标证明"误差复利"才是真问题——下一阶段的创新应聚焦漂移校正(回环检测、全局优化、不确定性加权)而非继续堆帧间模型。
- 冠亚之争(0.622 vs 0.620)小于结构性差距:两队四项几乎同分,runtime 是显著差异(26.7 s vs 107.5 s,4 倍)——若按 §4.5 守则 4 把效率当一等公民,ImFusion 的优势在"同精度下快 4 倍",这正是临床部署的语言。
- baseline 0.163 与榜尾 0.188:QBME(0.188)仅比官方 baseline 高 0.025 分——跨过"baseline 水平"这条线本身就是门槛,7 个上榜实体中 5 个显著超越 baseline,说明基准有区分度且社区方法有实质进步。
6.4 与 TUS-REC2024 届的对照
| 维度 | TUS-REC2024 | TUS-REC2025 |
|---|---|---|
| 场合 | MICCAI 2024 | MICCAI 2025 |
| 注册队 | 43 支 | 未公布(待核) |
| 有效提交 | 6 队 21 份 docker 方案 | 正式榜 7 实体(含 baseline) |
| 扫描协议 | non-rotation | rotation(新增旋转) |
| 任务输出 | 官方基线框架下的位移估计(届内约定) | 四组位移向量(GP/GL/LP/LL,跨队同构) |
| 挑战论文 | 已发(arXiv:2506.21765) | 未发(expected by end of 2026) |
两届之间最实质的可见进步是扫描协议的泛化压力(旋转)与持续运作机制(open call + 赛后榜);2025 届输出表示的 2×2 标准化(global/local × pixel/landmark)在官网 assessment 页有完整定义——注册队数从 43(2024)到未公布(2025)的信息缺口,提示读者谨慎做"参与度对比"——只能确认有效产出规模相近(榜单 7 vs 7 实体)。
6.5 从榜单读技术趋势:三个信号
把 7 个上榜实体与其分数放在一起,能读出三个超出名次的技术信号:
- 工业界工程化的胜利:冠军 ImFusion 是医疗影像软件公司(ImFusion GmbH),其 runtime 26.7 s 与稳定的 ±0.071 方差体现的是"产品级管线"(环境控制、推理优化、边界处理)而非单点算法突破——工业界与学术界的差距在工程闭环上。亚军深圳大学 MUSIC Lab(107.5 s)精度几乎持平但慢 4 倍,正是"算法够好、工程待优"的学界画像。
- 方差信息比均值信息更丰富:Baseline 的 ±0.216 巨大方差说明官方方法在某些扫描上接近失效(序列建模方法的不稳定面);ImFusion ±0.071 与 MUSIC ±0.060 的小方差说明头部方法的鲁棒性已达实用门槛。选型时方差与均值同看——医疗部署场景里"最差情况"比"平均情况"更致命。
- 地理分布的东亚集中度:7 实体中 4 个来自中国/韩国实验室(MUSIC Lab 深大、QBME 上交、AMI-Lab 釜山、SMART Lab 上大),加上香港 COCHE——超声 AI 研究在东亚的集群效应与库内其他超声条目的贡献者分布互为印证;欧洲(ImFusion、AGH)与北美(Queen’s via ImFusion 团队)由工业与跨机构合作补位。
对方法开发者的直接启示:榜单中段(COCHE 0.503 到 QBME 0.188)的分数间隔大(0.5→0.38→0.30→0.19),说明中腰部方法之间存在实质代差——基准尚未"卷平",后来者仍有清晰的爬升空间。
§7 生态与影响:谱系、脉络与临床定位
7.1 前作论文与领域谱系
TUS-REC2024 的挑战论文(arXiv:2506.21765,v1 2025-06-26 / v2 2025-11-13,27 位作者含获奖团队)是当前免跟踪重建领域的事实综述(在 2025 联合论文发表前)。其核心数据:43 支注册队、6 支队提交 21 份有效 docker 方案;提交方法的谱系涵盖 state space model / recurrent model / registration-driven volume refinement / attention mechanism / physics-informed model——五条技术路线在统一基准上的首次同台。
领域技术脉络(挑战赛描述的引文谱):
| 时代 | 代表工作 | 思路 |
|---|---|---|
| 非深度学习 | Chen et al. 1997(散斑去相关);Prager et al. 2003(linear regression,Stalking/Stradwin 系) | 从图像对/图像流的统计特性恢复位移 |
| DL 元年 | Prevost et al. 2018(首个 DL 方法,CNN vs 散斑去相关) | 端到端回归帧间变换 |
| 序列建模 | ConvLSTM(Luo et al. 2021) | 时序依赖显式建模 |
| 注意力 | transformers(Ning et al. 2022) | 全局依赖 |
| 多模态辅助 | IMU 辅助(Prevost 2018, Luo 2022, Guo 2022) | 外部惯性信号补充(本挑战赛禁止) |
脉络里的两个讽刺值得存照:其一,IMU 辅助路线在本挑战赛中被规则禁止——这恰恰是基准的价值:把"有传感器辅助"的的成绩与"纯图像"的成绩分开,免跟踪的主张才成立;其二,2025 冠军团队成员名单中有 Raphael Prevost——与 2018 年 DL 元年开创者(Prevost et al. 2018)署名者同名(§6.1 存照:是否同一人未做传记级核验);若为同一人,则是一个“开创者八年后在统一基准上以工业级工程能力(runtime 26.7 s)夺冠”的象征性闭环。
7.2 组织与支持生态
| 环节 | 实体 |
|---|---|
| 主办 | UCL(Qi Li、Yuliang Huang、Shaheer U. Saeed、Dean C. Barratt、Matthew J. Clarkson、Yipeng Hu)+ KCL(Tom Vercauteren) |
| 场合 | MICCAI 2025 官方挑战赛(第 28 届,韩国大田,2025-09-23 至 27;现场活动 09-27 于 IBS-2F-100) |
| Workshop | 第 6 届 ASMUS 2025(MICCAI 医学超声 workshop)同场 |
| 学术支持 | MICCAI SIGMUS(医学超声特别兴趣组) |
| 描述规范 | BIAS Initiative(Biomedical Image Analysis ChallengeS)结构化模板,19 页 PDF |
| 平台 | GitHub(UCL GitHub Pages 官网 + GitHub repo + 提交系统)——BIAS 描述原文 “Report the platform used to run the challenge. https://github.com/UCL” |
| 赞助 | 主办方称两家赞助商有意资助奖项,SIG 预算兜底;冠军/亚军加发证书,成功参与者发参与证书 |
生命周期类型为 Open call:会后持续接收提交(post-challenge deadline 2025-10-13),leaderboard 公开更新——挑战赛是基准的"启动仪式"而非终点。
7.3 临床意义与定位
挑战赛描述的临床意义链条:2D→3D 重建服务定量生物测量、多模态配准、3D 可视化与介入引导;免跟踪方案提供 “low-cost, portable, and widely deployable” 的体超声替代(前作 arXiv 摘要原文),对资源受限临床场景尤其有价值;斜角采集在临床常见(避开遮挡、改善声耦合)——2025 协议加入旋转正是对这一临床现实的模拟。
定位上的诚实边界(§2.1 已展开):健康志愿者前臂是方法学试验场,不是临床终点;基准测的是"纯图像能否重建几何",不是"重建体能否支撑诊断"。把 TUS-REC2025 上的分数直接外推为临床能力,是超出基准设计的主张。
7.4 展望:summary paper 与开放问题
三个待决事项构成后续生态的观察点:
- 联合挑战论文(expected by end of 2026):将包含数据集分析与结果分析,顶级团队受邀合著——它将成为免跟踪重建 2025 状态的权威综述,发表后本条目的引用结构应更新(§9 维护触发点)。
- 漂移问题的解法演进:2025 榜单确认 local 近解决、global 未解决——回环检测/全局图优化/序列级不确定性等路线是否出现在 post-challenge 提交中,是基准持续价值的风向标。
- 向临床部位的迁移基准:前臂之后,器官/胎儿/介入场景的免跟踪重建基准尚缺——TUS-REC 系列若延续,下一届的协议扩展方向比分数增长更值得关注。
7.5 对设备厂商与临床工作流的意义
把视角从算法社区拉远,免跟踪重建对医疗设备生态的潜在扰动有三层:
- 入门级设备的"三维化升级":大量在役的 2D 超声主机(含便携与掌上设备)不配位置跟踪、也不配 3D 探头;免跟踪重建若成熟,纯软件升级即可为存量设备附加 3D 采集能力——软件定义硬件的又一个案例。本基准(凸阵探头、常规帧率、关闭降噪的原始散斑)刻意贴近真实在役设备的工作条件。
- 工作流增量而非替换:免跟踪 3D 重建不要求医生改变扫查习惯(仍用普通 2D 探头),重建发生在采集之后——这与"换 3D 探头/装跟踪器"的重工作流路线形成互补。冠军方案 26.7 s 的重建耗时已进入"扫完即得"的临床可接受区间。
- 验证缺口仍在前方:前臂基准到临床部位(肝脏、心脏、产科)之间隔着器官运动、声窗受限、组织形变三座山;设备厂商若要把此类功能推向认证,需要的证据等级远超挑战赛榜单——本基准的角色是方法筛选器,不是注册证据。
对库内检索者的含义:把本条目放进"体超声/便携超声"的生态叙事里读,它的位置是"软件路线的公开基准起点";与 echonet-dynamic(设备端功能估计的先行商业化案例)对照,可以看到超声 AI 从"单帧判读"到"序列几何"的产业路线图正在合流。
§8 与库内条目的关系:超声家族图谱
8.1 八个真实互链点(库内查询 2026-09-26)
查询口径:url_name ILIKE '%ultrasound%' OR url_name ILIKE '%us%' OR title ILIKE '%超声%',剔除子串巧合误匹配后剩 8 个真实超声条目:
| 条目(record_id) | 内容 | 与本条目的关系 |
|---|---|---|
| echonet-dynamic(526) | 心脏超声视频→左室功能估计 | 同为视频级超声任务(序列输入);EchoNet 是"序列→功能参数",本条目是"序列→3D 几何"——任务光谱的两侧 |
| echonet-lvh(530) | 左心室肥厚超声表型 | 超声视频临床任务;其"图像质量与采集变异"问题在本条目中由多样探头运动显式放大 |
| camus(533) | 心脏超声多结构分割金标准 | 2D 单帧分割系金标准;反衬本条目 3D 重建任务的几何本质——两者一起覆盖"分割 vs 重建"两大超声 AI 任务族 |
| hc18(535) | 胎儿头围超声测量基准 | 2D 单帧测量系;其"标准平面依赖"与本条目"任意扫查路径"形成采集自由度对照 |
| us-nerve-seg(537) | 颈部超声臂丛神经分割 | 2D 分割系;同为"健康/无症状结构"的超声基准(神经 vs 前臂肌肉骨骼) |
| ddti(536) | 甲状腺结节超声分割 | 2D 分割系;静态图像 vs 动态序列的典型对照 |
| busi(539) | 乳腺超声三分类与病灶分割 | 2D 分类/分割系;超声家族中下载热度最高的条目之一,可作流量入口互链 |
| maternal-ultrasound-nutrition(615) | 孕期母体超声与营养 | 同为"非 DICOM 原生格式"的超声数据集;其科研队列模式与本条目的志愿者队列模式同构 |
互链叙事的三条主线:(1) 任务维度——库内超声条目绝大多数是 2D 单帧分类/分割/测量(busi/ddti/camus/hc18/us-nerve-seg),本条目是唯一的 3D 序列重建,填补"几何重建"空位;(2) 序列维度——echonet-dynamic/echonet-lvh 与本条目共享"视频级输入"的问题结构(时序建模、帧间一致性);(3) 工程维度——maternal-ultrasound-nutrition 与本条目共享"原生格式非 DICOM、需按 h5/专用格式进管线"的 AI-Ready 特征。
8.2 检索警示:误匹配排除
%us% 子串匹配的高误报率在本库有活例:uspto-50k(324)是美国专利局 USPTO 的化学反应提取数据集(药物发现与化学域),与超声无关——按 url_name 检索超声家族时必须显式排除(坑 5 的检索侧)。其余命中(virus-registry/monuseg/health-data-nexus/all-of-us/tuh-eeg-corpus 等)同为子串巧合,不互链。
8.3 检索路径建议
- 检索词组合:“TUS-REC2025”(精确)+ “trackerless” + “freehand ultrasound”;勿与 TUS-REC2024 混淆(引用时核对 DOI 15224703/15699958 归属 2025)。
- 若目标是快速上手:Validation 记录(open)+ baseline repo(GitHub)先行,训练数据注册并行等待。
- 若目标是方法对比:引前作论文 arXiv:2506.21765(2024 届五条技术路线)+ 2025 leaderboard 四指标原始毫米值(§6.1),final score 只作名次参考(§4.5 守则 1)。
- 若目标是超声家族综述:本条目 + camus + echonet-dynamic + busi 三类(重建/序列分割/单帧分类)合读,可覆盖超声 AI 任务光谱的三极。
§9 方法学启示:六条可迁移的经验
9.1 把"任务命名"与"数据属性"分开
"Trackerless 3D Freehand Ultrasound Reconstruction Challenge"这个名字里,“Trackerless"修饰的是任务(算法不得使用跟踪器),而数据集恰恰带着跟踪器——所有评测金标准都来自它。这个命名策略在检索与转引中造成了实际的理解负担(坑 1)。可迁移的原则:给数据集命名时,把"数据包含什么"与"任务禁止什么"分开表述;凡"任务型命名”(trackerless/annotation-free/reference-free)的数据集,第一条说明就应写清金标准从哪来。
9.2 “用有跟踪的数据考无跟踪的算法”
凡是"去依赖化"研究(去跟踪、去造影剂、去多模态)都面临同一困境:被去掉的依赖恰恰是唯一可信的金标准来源——去掉它之后,"做得对不对"失去了裁判。TUS-REC 的解法是把依赖保留在评测侧、从算法输入侧剥离:光学跟踪位姿始终留在主办方手里,只在打分时生成金标准重建帧;参赛 docker 拿到的输入从头到尾只有图像序列。这一范式可平移到免配准影像融合(用配准金标准考免配准方法)、免标注分割(用专家掩码考自监督分割)等领域——共同要点是:金标准通道与算法输入通道物理隔离,且隔离方式写进提交协议(docker 黑盒)而不靠自觉。
9.3 归一化排名是挑战赛评测的公共品
“aggregate then rank”(Maier-Hein et al. 2018)在本挑战赛的落地有三个值得复用的细节:天花板/地板物理化(金标准=满分、单位矩阵=零分,归一化不是抽象统计而是基准内可复现的两个真实端点);多指标等权合成前的量纲归一(防止毫米级 GPE 淹没亚毫米级 LPE);主办方回避与 runtime 并列(防利益冲突+效率进评测)。任何"多指标合成一个 leaderboard 分数"的场景都可直接借用这套模板——它把"为什么是这个分数"变成三句话能说清的算术。
9.4 输出表示的标准化比指标统一更难也更值钱
2024→2025 两届之间最实质的进化不是新指标,而是输出表示的跨队同构(四组位移向量)。它的价值链:统一输出→统一重建管线→统一误差计算→跨队可比且可复用评测代码。代价是主办方要替社区预判"什么是好的输出表示"(本例:位移向量 vs 刚体矩阵,§3.3 的理由链)。给后续挑战赛设计者的启示:输出表示的决策要在赛事设计期完成并写成文档(本例写进了 BIAS 描述),赛后再改输出格式等于换基准。
9.5 open call + docker 黑盒:基准的"活体运维"
挑战赛结束基准就死掉,是医学影像竞赛的常态。TUS-REC 系列用两个机制对抗它:其一,open call 生命周期——赛后持续接收提交(post-challenge 截止 2025-10-13,榜单继续演化),让新方法随时进场对标;其二,docker 黑盒评测——测试集永不公开、评测环境统一、runtime 可比、跑不通记 0 分,使榜单长期可信。代价也明摆着:外部研究者无法本地复现官方测试分数。TUS-REC 的补偿是"全部指标原始值公开"(assessment 页原文)与验证集结构等于测试集结构——用透明度与可演练性弥补不可复现性。这套"活体运维"组合拳,对国内挑战赛与基准建设者的参考价值不亚于数据集本身。
9.6 从"一个分数"到"误差结构画像"
四指标设计的最大产出不是名次而是诊断:local 亚毫米(帧间估计解决)+ global 毫米(漂移未解决)的组合,把社区注意力从"继续卷帧间模型"转向"漂移校正"。单一指标做不到这一点——final score 里 local 与 global 的信息被压扁了。数据集条目写作同理:报结果时保留误差结构(本条目 §6.3 的表格),比只报冠军分数更有长期价值。
§10 避坑清单:八个已踩过的坑
坑 1:"Trackerless"是任务属性,不是数据属性。数据集每帧都带 NDI Polaris Vicra 光学跟踪金标准位姿;免跟踪的是参赛算法的输入约束。把"TUS-REC2025 是无跟踪器数据"写进任何文档都是事实错误——正确表述:“数据带光学跟踪金标准,任务禁止算法使用跟踪器输入”。
坑 2:主 DOI 记录不是数据 + 联合论文未发表。concept DOI 10.5281/zenodo.15052755 的本体只有一份 19 页 BIAS 结构化描述 PDF(107,736 字节),没有一帧超声;数据本体在 Train(concept 15224703/version 15224704)与 Validation(concept 15699958/version 15699959)独立记录。同时,本挑战赛的联合论文截至 2026-09-26 未发表(expected by end of 2026)——引用回落到前作 arXiv:2506.21765 与 Li 等三篇方法论文。
坑 3:帧数四口径。~1500 帧/段(官网 Images 段)vs ~1600 帧/段(Train Zenodo)vs ~260k 总帧(挑战赛描述)vs 272,000(邀请函 PDF)vs ~263k(官网划分段 164k+9k+90k)。成稿以官网划分段为主口径;"约 26 万帧"作概括可接受;272,000 不建议正式使用。
坑 4:许可与获取的三层异构。挑战赛描述 CC BY-4.0(open)vs 训练/验证数据 CC BY-NC-SA-4.0(禁商用)——引用与使用必须分层。训练数据 restricted 且 Zenodo 文件区为空(注册/访问请求发放);验证数据 open;测试集不公开。任何"本数据集开放下载"或"本数据集 CC BY-4.0"的一刀切表述都是错的。
坑 5:双 DOI 体系 + 2024 记录双链接。三条 2025 记录各有 concept DOI 与 version DOI 两套(OpenAIRE 同时收录);TUS-REC2024 四条记录在官网与 Train 2025 页内分别用 concept(11178508/11180794/11355499)与 version(11178509/11180795/11355500)两套链接——同一数据两套 DOI 是常态不是错误,引用建议用 concept DOI。检索侧同坑:%us% 匹配会把 uspto-50k(USPTO 化学专利数据)误当超声条目。
坑 6:索引起点不一致。landmarks 文件第 1 列帧索引 0 起,第 2/3 列图像坐标 1 起(与标定一致)——评测脚本里两者起点弄混,误差以"差一帧/一像素"的隐蔽形式出现。复现时先跑一帧 sanity check 再上全量。
坑 7:文件名两写。官网目录树注释 RH_rotation.h5 vs Train Zenodo 描述 RH_rotating.h5——同一文件两种写法,自动化脚本按官网树写死路径会 404。以解压后实际文件名为准。
坑 8:final score 不可跨届直比。归一化的天花板 largest_GPE 依赖当届数据与金标准重建实现,2024 与 2025 的 final score 不在同一标尺;跨届比较用 GPE/GLE/LPE/LLE 原始毫米值(且注意 2025 扫描协议加了旋转)。"2025 冠军分数比 2024 高/低"式表述均为无效比较。
§11 总结
11.1 三句话总结
- TUS-REC2025 用 85 人 170 段带光学跟踪金标准的前臂超声,把免跟踪 3D 重建从"各说各话"拉进了统一基准时代——四组位移向量输出与四指标归一化排名是它给社区的方法学公共品。
- 2025 届榜单的诊断结论清晰:相邻帧估计已近天花板(冠军 LPE 0.153 mm),长序列累积漂移未解决(GPE 9.249 mm)——下一程在漂移校正,不在帧间模型。
- 它的获取结构是挑战赛光谱的标准型:描述与验证数据 open、训练数据 restricted 禁商用、测试集只进不出——三种入口对应学习者/研究者/竞争者三种用户。
11.2 适合谁
- 免跟踪超声重建/序列建模研究者:需要带金标准的大规模基准与可复现 baseline。
- 图像配准与 SLAM 方向的迁移者:位移向量表示与漂移问题是两个现成的切入点。
- 挑战赛设计者:BIAS 结构化描述+输出表示标准化+归一化排名三件套是可抄的模板。
- 超声 AI 综述作者:库内 2D 分割系条目之外的"3D 重建极"由本条目补全。
11.3 不适合谁
- 需要临床病灶数据的项目:健康志愿者前臂,无病理标签。
- 需要商用授权的管线:训练/验证数据 CC BY-NC-SA-4.0,禁商用是硬条款。
- 只想"下载即训"的团队:训练数据要注册等待,先评估时间成本或从验证数据+baseline 入手。
11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 想跑通管线学习 | Validation(open)+ baseline repo(GitHub),无需注册 |
| 想训练自己的模型 | Microsoft Forms 注册 → Train 记录访问请求(restricted)→ 等待发放 |
| 想要测试集分数 | 注册 → docker 提交 → 主办方运行(总 runtime ≤6 h) |
| 想引用基准 | concept DOI(15052755/15224703/15699958)+ arXiv:2506.21765 + Li 等三论文 |
| 想跨届比较 | 用原始毫米值(GPE 等),别比 final score(坑 8) |
| 想做超声家族综述 | 本条目 + camus/busi(2D 系)+ echonet-dynamic(序列系)三极合读 |
FAQ(高频问答 38 问)
A. 基础认知
Q1:TUS-REC2025 是论文数据集吗?
不是。它是 MICCAI 2025 官方挑战赛的数据集;联合挑战论文未发表(expected by end of 2026)。当前引用的事实综述是前作论文 arXiv:2506.21765。
Q2:名字怎么断句?
TUS-REC 2025 = Trackerless 3D Freehand Ultrasound Reconstruction Challenge 2025。“TUS-REC"是系列名(2024 首届、2025 第二届),不是"TUS 记录"也不是"胸部超声”。
Q3:"Trackerless"和"freehand"各指什么?
freehand 指医生手持普通 2D 探头自由扫查(区别于机械驱动或 2D 阵列 3D 探头);trackerless 指重建时不依赖外部位置跟踪器。两者合起来:手持 2D 探头 + 纯图像三维化。
Q4:数据为什么扫前臂?
伦理与实操可行性(前人反复采用的志愿者试验场),不是临床兴趣所在。它是通向器官/胎儿/介入等复杂场景前的第一步基准(§2.1)。
Q5:和 TUS-REC2024 什么关系?
同一 UCL 团队的第二届。2025 加了旋转扫描协议、统一了四组位移向量输出;2024 数据(non-rotation)作为可选附加训练数据,两届 patient IDs 一致可控泄漏(§2.6)。
Q6:85 人、170 段,为什么"段"不说"例"?
每名志愿者左右前臂各扫一段,是 2 个独立扫描序列(各 ~1500-1600 帧),不是 2 个"病例"——前臂健康,无病例可言。
Q7:金标准是怎么来的?
探头上的跟踪工具被 NDI Polaris Vicra 光学跟踪器逐帧定位,经 pinhead 法标定矩阵对齐到图像空间,时间戳与帧对齐(temporally calibrated)——这条链路只在评测侧使用(§3.4)。
Q8:最大的卖点一句话?
免跟踪重建第一次有了大规模统一基准,并且四指标设计直接量出了"局部准、全局漂"的误差结构——问题从"能不能做"变成了"漂移怎么治"。
Q9:它自己有什么局限?
前臂非临床部位、85 人人口学细分未披露、训练数据 restricted 等待周期不确定、summary paper 未发表导致引用链悬空、注册队数 2025 未公布。
Q10:开源吗?
分层:描述与验证数据 open、baseline 代码公开(Python)、训练数据注册制、测试集不公开——"开源"二字须拆开说(坑 4)。
B. 数据与获取
Q11:三条 Zenodo 记录各下什么?
15052755 下 19 页描述 PDF(读懂规则);15224704 请求训练数据(restricted);15699958 直接下验证数据(open)。见 §5.1 全表。
Q12:训练数据怎么申请?
Train 记录的 restricted 通道:Zenodo 访问请求 / 挑战赛 Microsoft Forms 注册表单。无公开响应时限承诺,规划时把等待当不确定周期处理(§5.3)。
Q13:验证数据里有什么?
3 名受试者 6 段扫描(~9k 帧),frames/ 与 transfs/ 分开存放 + dataset_keys.h5 清单——结构与测试集一致,可演练提交评测(§2.5)。
Q14:测试集真的拿不到吗?
拿不到。64 段(32 人)由主办方持有,唯一通道是 docker 提交算法在主办方环境运行——这是防测试集泄漏的标准设计。
Q15:h5 文件怎么读?
h5py 读 frames [N,480,640] 与 tforms [N,4,4];landmarks 另有文件;calib_matrix.csv 提供像素-毫米缩放与刚体变换。加载骨架见附录 E。
Q16:可以用 2024 数据吗?
可以,官方认可为可选附加训练数据;两届 patient IDs 一致,合并训练时可控分布防泄漏。注意 2024 是 non-rotation 协议,与 2025 任务有分布缝。
Q17:能用这些数据训练商用模型吗?
不能。CC BY-NC-SA-4.0 + Data Usage Policy 明文禁止训练与验证数据的商业使用;模型权重的商用属性同样视为不清(§5.4)。
Q18:引用义务是什么?
未来的 summary paper(发表后补引)+ Li 等三篇方法论文(ISBI 2023/TBME 2024/MICCAI 2024)+ 数据记录的 concept DOI。参赛团队单独发表须等联合论文之后。
C. 评估与结果
Q19:final score 的理论范围是什么?
[0,1]。0 = 全单位矩阵(什么都不估),1 = 完美复现金标准重建。实际冠军 0.622、baseline 0.163——中段有充足区分度。
Q20:为什么四项等权 0.25?
官方设计;等权的前提是各自归一化(否则毫米级 GPE 会淹没亚毫米级 LPE)。四组参考分(global/local/pixel/landmark)提供非官方的画像视角(§4.2)。
Q21:GPE 9.249 mm 严重吗?
要看参照系:扫描深度 9 cm、序列 ~1500 帧——全局漂移被压到厘米内毫米级是当前最好的成绩,但距"金标准地板"(0)尚远;同届 local 误差 0.153 mm 说明差距不在帧间估计而在累积(§6.3)。
Q22:runtime 26.7 s 是快吗?
这是全部帧位姿预测的每扫描平均耗时。亚军 107.5 s、上限 6 小时/全部测试扫描——冠军比亚军快 4 倍且精度同档,效率优势在"同分短者优先"规则下是实质护城河。
Q23:post-challenge 提交还算数吗?
进 leaderboard 但标注 “* Post-challenge submissions before 13 Oct 2025”;2025-10-13 后榜单是否继续更新取决于主办方维护(open call 生命周期)。
Q24:能只优化 local 指标拿高分吗?
不能——四项等权。但 local 指标容易高(亚毫米饱和区),global 指标才是区分度所在;反过来只卷 global 而 local 崩了同样掉分。
Q25:为什么没有 Dice?
前臂数据无分割金标准,Dice 定义成本高;官网明说不纳入 final drift/Dice 等指标是为精简评估——但"没测"不等于"没问题"(§4.4)。
D. 复现与工程
Q26:baseline 能直接跑吗?
能。GitHub repo QiLi111/TUS-REC2025-Challenge_baseline(Python),配套三篇方法论文;在验证数据上可完整演练。baseline 分数 0.163 是你的下界参照。
Q27:位移向量怎么变回 3D 体?
按提交口径,位移向量经标定矩阵进入毫米空间,逐帧重投影并融合为体——评测方统一执行;本地复现时用 calib_matrix.csv 与 h5 的 tforms 自建重建管线(附录 E 骨架)。
Q28:评测脚本的索引坑在哪?
landmarks 帧索引 0 起、像素坐标 1 起(坑 6);先跑单帧 sanity check。
Q29:文件名为什么对不上官网树?
RH_rotation vs RH_rotating 两写并存(坑 7)——以解压后实际文件名为准,脚本做模糊匹配或建索引。
Q30:想对标 leaderboard,评测环境一致吗?
官方评测在主办方测试集环境运行 docker;本地只有验证集,分数不可直推测试榜(分布不同+归一化天花板不同)。验证集分数用于自检与选型,不用于对外宣称名次。
Q31:帧数统计口径混乱影响复现吗?
不影响训练,影响"你论文里写多少帧"。以官网划分段 ~164k/~9k/~90k 为主口径并注明出处(坑 3)。
Q32:如果只记住一件事?
数据带跟踪、任务免跟踪、金标准在评测侧——TUS-REC2025 的全部规则设计都从这三句派生。
E. 生态与库内定位
Q33:库内还有哪些超声条目,本条目和它们怎么分工?
8 个真实互链:busi/ddti(2D 静态分类分割)、camus(2D 序列分割金标准)、hc18(2D 测量)、us-nerve-seg(2D 神经分割)、echonet-dynamic/echonet-lvh(心脏超声视频功能)、maternal-ultrasound-nutrition(科研队列)。分工:它们覆盖"判读"(分类/分割/测量/功能),本条目独占"几何"(3D 重建)——合读覆盖超声 AI 任务光谱(§8.1)。
Q34:检索时为什么会命中 uspto-50k?
%us% 子串误匹配:uspto-50k 的 url_name 含 “us”(USPTO),实为美国专利局化学反应数据集,与超声无关。超声域检索请加 %ultrasound% 或标题 %超声% 双条件(坑 5)。
Q35:本条目与库内其他挑战赛条目(如 trackrad)的异同?
同为 MICCAI 系挑战赛、同为"开放描述+注册制数据+docker 评测"光谱;差异在任务类型(trackrad 是跟踪/分割系,本条目是几何重建系)与输出表示(语义掩码 vs 位移向量场)。两者互为"挑战赛评测设计"的平行样本。
Q36:冠军方法论文能引吗?
截至抓取时点只知"已挂 arXiv"(团队博客口径),编号未核验——引用时写"ImFusion 团队挑战赛方案(2025,论文详见其团队页面)"并待附录 K 触发点 4 更新,不要手写猜测的 arXiv 编号。
Q37:如果 2026 底 summary paper 发表了,本条目哪些部分会过时?
引用结构(坑 2 的回落引用)、结果分析细节(summary paper 会披露数据集分析与更多结果统计)、可能还有参赛队总数(未公布项)。核心硬事实(85 人/170 段/划分/设备/许可)不会变——它们来自数据记录本体而非论文。
F. 方法与迁移
Q38:我没有超声背景,能直接上手这个基准吗?
可以但有三步功课:读 BIAS 描述 PDF(19 页,规则全覆盖);跑通 baseline+验证集(无需任何超声先验);理解凸阵几何与散斑的基本性质(§2.2 注脚)。散斑不是噪声而是信号载体——这是超声视觉与自然图像最大的思维转换。
Q39:SLAM/里程计的现成方法能直接搬吗?
前端思想(相邻帧运动估计)可搬但特征提取要换(无角点,用散斑/学习特征);后端思想(位姿图、回环)是开放方向但"重访检测"在软组织上无现成定义(§3.7)。直接搬运自然图像 VO/SOTA 的期望收益有限——2025 榜单证明前端已近天花板,价值在 后端。
Q40:位移向量表示对网络设计有什么具体影响?
输出层是逐像素/逐标志点的 3 维回归(无激活约束或轻约束),损失用位移的 L1/L2 即可;不需要旋转参数化(四元数归一化、6D 表示等技巧都省了)——监督信号连续无奇异点,训练稳定性好(§3.3)。
Q41:为什么不用 IMU 帮忙?规则禁止的话学术界怎么看?
IMU 辅助是合法研究路线(文献活跃),但本基准的立意是"纯图像能做到什么"——把 IMU 路线隔离出去,免跟踪的主张才纯粹。两者是互补而非竞争:IMU 路线适合有硬件控制权的场景,纯图像路线适合存量设备与极简硬件。
Q42:这个基准上 0.622 的分数还有多少提升空间?
天花板是 1.0(金标准地板为 0)但物理不可达(跟踪器自身的毫米级误差+软组织形变);更现实的参照是 local 指标的 0.12-0.15 mm 亚毫米区——global 指标若能从 9.2 mm 压到 2-3 mm(漂移校正生效),final score 的提升空间大约还有 0.2-0.3 分。这是推测而非官方口径。
G. 数据工程细节
Q43:数据是 uint8 还是 float?读进来要不要归一化?
按 h5 存储口径 frames 为 480×640 灰度帧;预处理按你的模型惯例(baseline 代码内置其归一化配置)。注意关闭散斑降噪意味着原始散斑对比度较低——不要用激进对比度拉伸破坏散斑统计特性(散斑统计是传统方法的信号源)。
Q44:能只加载部分帧训练吗?
可以(h5 支持切片读),但要注意帧间变换的监督是序列性的:随机抽帧破坏了 local 参考系的连续性语义——抽帧训练时 LP/LL 的"前一帧"应按原序列相邻关系定义,而不是数组相邻。
Q45:多卡训练时序列怎么切?
以扫描(.h5)为单位切分而不是以帧为单位——同一段扫描的帧必须留在同一进程/设备(递归位姿不可分片);50 名受试者 100 段的划分天然适合按受试者分组做分布式。
Q46:如果我发现自己的复现分数与验证集口径差很多,先查什么?
按序查:参考系混用(§3.6-2)→ 索引起点(坑 6)→ 凸阵几何映射(§3.6-3)→ 插值实现与官方差异(§3.6-1)→ 天花板 identity 误差的实测方式(附录 F 注)。五步覆盖绝大多数"分数异常低"。
Q33:扫描是 2D 图像序列,为什么说它是 3D 数据集?
因为每帧都绑定一个 3D 空间位姿(tforms)——图像+位姿合起来才是完整的自由手持超声记录;任务也是把 2D 序列重建成 3D 体。只看 frames 键会把它误当普通 2D 分类/分割数据集。
Q34:85 人里训练只用 50 人,会不会太少?
对免跟踪重建这个细分方向,50 人/100 段/~16 万帧已是领域最大训练集之一(此前学习类研究普遍 12-40 名受试者)。且可叠加 TUS-REC2024 的同队列数据。但与通用视觉预训练的规模相比仍是小数据——这正是"序列建模+几何先验"类方法占优的结构性原因。
Q35:我可以只用验证集做研究吗?
可以且是低成本起点:验证数据 open 直下、结构与测试集一致、附 dataset_keys.h5 索引,配 baseline 代码可跑通"加载→推理→位移→重建→四指标"全管线。局限:6 段扫描只够做方法验证与消融演示,训练需要注册获取的 100 段。
Q36:怎么判断我的方法在验证集上的分数"算好"?
可参照的锚点:官方 baseline 在测试集 final 0.163(GPE 26.1 mm);2025 正式榜入门线 QBME 0.188;冠军 0.622(GPE 9.2 mm)。注意验证集与测试集分数会有偏移(归一化天花板不同+数据不同),验证集分数只用于自评趋势与消融,不能直推名次。
Q37:runtime 上限为什么定为 6 小时?
官网 NOTE 原文给出的理由是 “to encourage usability in the clinical applications”——把效率写进评测基因:一个测试集要跑 6 小时以上的重建方法,离床旁/术中可部署性太远。配套的同分裁决(runtime 短者列前)进一步把效率变成一等公民指标。
Q38:19 页 BIAS 结构化描述对使用者有什么实际价值?
它把挑战赛的目的、数据、任务、指标、参与政策、奖项规则写在一份固定模板里(CC BY-4.0 直链)——使用者不必从零散网页拼装规则;对做评测方法学的人,它是一份"挑战赛如何被设计"的完整样本。读取顺序建议:BIAS PDF(规则全景)→ 官网 assessment 页(指标公式细节)→ baseline 仓库(工程实现)。
事实清单(硬事实 38 条)
- TUS-REC2025:Trackerless 3D Freehand Ultrasound Reconstruction Challenge 2025,MICCAI 2025 官方挑战赛。
- 主办:UCL(Qi Li 联系人、Yuliang Huang、Shaheer U. Saeed、Dean C. Barratt、Matthew J. Clarkson、Yipeng Hu)+ KCL(Tom Vercauteren),共 7 名组织者。
- 与第 6 届 ASMUS 2025 workshop 同场,获 MICCAI SIGMUS 支持;2025-09-23 至 27 韩国大田,现场活动 09-27 IBS-2F-100。
- 平台为 GitHub(UCL GitHub Pages + repo),非 grand-challenge.org(BIAS 描述原文)。
- 生命周期 Open call;post-challenge 截止 2025-10-13。
- 描述记录 concept DOI 10.5281/zenodo.15052755(version 15119085,v2,2025-03-21 发布),open,CC BY-4.0,本体为 19 页 BIAS 模板 PDF(107,736 字节);stats:views 1406/downloads 1317。
- Train Dataset concept DOI 10.5281/zenodo.15224703(version 15224704),2025-04-28 发布 v1.0.0(modified 2025-11-17,revision 16),restricted + CC BY-NC-SA-4.0,Zenodo 文件区为空;stats:views 3109/downloads 613。
- Validation Dataset concept DOI 10.5281/zenodo.15699958(version 15699959),2025-06-23 发布,open access。
- TUS-REC2024 四记录:Train Part1/2/3 concept 11178508/11180794/11355499 + Validation 12979481;官网与页内链接存在 concept/version 双写。
- 数据:85 名志愿者左右前臂 170 段扫描;队列 “racial-, gender-, age-diverse”;排除超声凝胶过敏与皮肤病。
- 划分:train/val/test = 50/3/32 subjects = 100/6/64 scans = ~164k/~9k/~90k frames(官网权威口径)。
- 帧数四口径并存:~1500/段(官网 Images)vs ~1600/段(Train Zenodo)vs ~260k(描述)vs 272,000(邀请函)vs ~263k(划分段)。
- 设备:Ultrasonix(BK)+ 4DC7-3/40 凸阵探头;NDI Polaris Vicra 光学跟踪器。
- 采集参数:20 fps;480×640;6 MHz;83 dB;增益 48%;深度 9 cm;无散斑降噪;时间已标定。
- 扫描协议:肘部附近固定接触点,短轴 fanning → 长轴 rocking → 探头旋转约 90 度重复;2024 为 non-rotation。
- 两届数据 patient IDs 一致(合并训练可控分布);2024 数据为可选附加训练数据。
- h5 结构:frames [N,480,640] + tforms [N,4,4](tool space → camera space);RH=右臂/LH=左臂。
- landmarks:每受试者一个 .h5,每段 100 点,坐标 [100,3]——帧索引 0 起、图像坐标 1 起。
- calib_matrix.csv:pinhead 法标定;含 scaling_from_pixel_to_mm 与 image→tool 刚体变换。
- 验证集 frames/ 与 transfs/ 分开存放 + dataset_keys.h5 清单;与测试集结构相同。
- 任务输出:GP/GL/LP/LL 四组位移向量(global/local × pixel/landmark);不强制刚体矩阵(规避 gimbal lock 与局部极小)。
- 四指标:GPE/GLE/LPE/LLE(全像素/标志点欧氏距离,mm,global/local 双参考)。
- 归一化:smallest=0(金标准)、largest=单位矩阵误差;final score = 0.25×(GPE*+GLE*+LPE*+LLE*),全测试扫描平均,3 位小数,越高越好。
- 参考分四组(global/local/pixel/landmark score)不参与正式排名;Maier-Hein et al. 2018 “aggregate then rank”(doi:10.1038/s41467-018-07619-7)。
- runtime 规则:每扫描平均耗时;同分短者列前;全部测试扫描总时长 ≤6 小时;跑不通=0 分。
- 不纳入:final drift、Dice overlap 等(官网原文:为精简评估)。
- 指标设计依据:Luo et al. 2023(doi:10.1016/j.media.2023.102810)、Wein et al. 2020(doi:10.1007/978-3-030-59716-0_49)。
- Baseline:UCL Li et al.(ISBI 2023/TBME 2024/MICCAI 2024 三论文),repo
QiLi111/TUS-REC2025-Challenge_baseline。 - 正式榜 7 实体:ImFusion 0.622±0.071(GPE 9.249/GLE 6.986/LPE 0.153/LLE 0.120 mm,runtime 26.744 s)、MUSIC Lab(深圳大学)0.620±0.060(GPE 9.851,runtime 107.479 s)、COCHE 0.503±0.134(GPE 13.892)、AGH-MedApp 0.383±0.128、AMI-Lab 0.301±0.155、QBME 0.188±0.206、Baseline 0.163±0.216(GPE 26.110)。
- 赛后榜 9 实体:新增 T3DR(Dmytro Yesyp,AGH,0.310,第 5)、SMART Lab(上海大学,0.235,第 7);前三不变。
- ImFusion 团队 8 人(ImFusion GmbH + Queen’s University),成员含 Raphael Prevost——与 2018 年首个 DL 免跟踪重建方法作者署名同名(是否同一人未核验);团队博客确认获奖、论文已挂 arXiv(编号未核验)。
- 冠军误差结构:local 亚毫米(0.12-0.15 mm)vs global 毫米级(7.0-9.2 mm)——帧间估计近解决、累积漂移未解决。
- 前作 TUS-REC2024:43 支注册队、6 队 21 份有效 docker 提交;挑战论文 arXiv:2506.21765(27 作者,v1 2025-06-26/v2 2025-11-13);方法谱系含 state space model/recurrent/registration-driven refinement/attention/physics-informed。
- 领域痛点原文:此前研究 “none of these studies used the same dataset”;学习类方法数据仅 12-40 subjects。
- 引用政策:数据使用须引 summary paper(未发表,expected by end of 2026)+ Li 三论文;参赛队单独发表须等联合论文之后。
- Data Usage Policy 原文:训练与验证数据商业用途禁止;参与政策:fully automatic、公开+私有数据可用但须披露、主办方机构成员可参加但不获奖不进榜。
- 冠军 ImFusion 的参考分画像:global score 0.656 / local 0.588 / pixel 0.627 / landmark 0.617;MUSIC Lab 对应 0.623 / 0.617 / 0.639 / 0.601——冠军全局更强、亚军局部更强——来源:官网 leaderboard.html 参考分列。
- landmarks 以受试者为单位独立成文件(landmark_xxx.h5,含该受试者两条扫描的标志点)——来源:官网 data.html 目录树。
术语表(34 条)
| 术语 | 释义 |
|---|---|
| Freehand 3D US | 手持 2D 探头自由扫查 + 逐帧位姿拼接成 3D 体的技术路线 |
| Trackerless | 免外部位置跟踪器;此处为任务约束(数据带跟踪金标准) |
| Speckle decorrelation | 散斑去相关:从相邻帧散斑统计变化恢复探头位移的经典原理 |
| Fanning / Rocking | 扇摆/摇摆:探头以接触点为轴的两个正交摆动方向,本数据集标准协议动作 |
| Cumulative drift | 累积漂移:帧间变换递归连乘导致的误差复利积累 |
| 帧间变换(T_j←i) | 第 i 帧坐标系到第 j 帧坐标系的刚体(或近刚体)变换 |
| 位移向量(displacement vector) | 像素/标志点在两参考系间的三维位移,本挑战赛的统一输出表示 |
| GP/GL/LP/LL | global/local × pixel/landmark 的四组位移向量缩写 |
| Gimbal lock | 欧拉角参数化旋转的自由度退化现象;位移表示规避其影响 |
| 齐次变换矩阵 | 4×4 矩阵同时编码旋转与平移;tforms 的存储形式 |
| Tool space / Camera space | 光学跟踪工具坐标系 / 光学跟踪相机坐标系;tforms 的变换方向 |
| NDI Polaris Vicra | Northern Digital Inc. 的光学位置跟踪器,本数据集金标准来源 |
| Pinhead 标定 | 针尖尖点法标定:确定图像坐标系与跟踪工具坐标系的几何关系 |
| Temporal calibration | 时间标定:跟踪位姿与图像帧时间戳的对齐 |
| 标志点(landmark) | 预定义解剖参考点;每段扫描 100 个,用于 GLE/LLE |
| GPE/GLE/LPE/LLE | Global/Local × Pixel/Landmark reconstruction error,四项毫米误差指标 |
| Aggregate then rank | 先多指标归一化聚合再排名的挑战赛评测范式(Maier-Hein 2018) |
| 单位矩阵基线(identity baseline) | 所有帧用恒等变换重建——归一化的"天花板"(0 分锚点) |
| Docker 提交 | 打包算法环境为容器由主办方在测试集运行——防泄漏的标准评测通道 |
| HDF5 (.h5) | 层级数据格式;frames/tforms/landmarks 的存储容器 |
| BIAS Initiative | Biomedical Image Analysis ChallengeS:挑战赛结构化描述模板的组织方 |
| ASMUS | MICCAI 医学超声计算 workshop;TUS-REC2025 与第 6 届同场 |
| SIGMUS | MICCAI 医学超声特别兴趣组 |
| Convex transducer | 凸阵探头:扇形视野的曲面阵元探头(4DC7-3/40) |
| concept DOI / version DOI | Zenodo 双 DOI:前者指向全部版本,后者指向具体版本 |
| Restricted access | Zenodo 访问控制档位:需请求/注册获得,文件区不直接提供下载 |
| CC BY-NC-SA-4.0 | 署名-非商业性-相同方式共享;训练/验证数据许可 |
| Open call | 挑战赛会后持续接收提交的生命周期类型 |
| Post-challenge submission | 赛后窗口提交(2025-10-13 截止),榜单独立标注 |
| Summary paper | 联合挑战论文的通称;TUS-REC2025 的 expected by end of 2026 |
-
Docker 黑盒评测:算法以镜像提交、测试集与评测环境不出主办方的考务模式——可复现性与防泄漏的折中。
-
Sanity check(理智检查):上全量实验前先跑最小样例验证管线正确性——对索引起点(坑 6)与文件名两写(坑 7)尤其必要。
-
Restricted access:Zenodo 的受限访问类型——记录元数据公开、文件区不展示本体、需走权利人设定的请求流程;与"embargo(限期封存)"和"closed(完全关闭)"不同。
-
Open call vs one-time event:挑战赛生命周期的两类——前者会后持续收提交(榜单演化),后者截止即冻结;TUS-REC2025 属前者。
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | TUS-REC2025 |
| url_name | tus-rec |
| 类型 | 挑战赛+数据集+基准(三合一) |
| 主办 | UCL + KCL(联系人 Qi Li) |
| 场合 | MICCAI 2025(Daejeon, Korea)+ ASMUS 2025 + SIGMUS |
| 规模 | 85 人 170 段 ~263k 帧(主口径) |
| 划分 | 50/3/32 subjects = 100/6/64 scans |
| 许可 | 描述 CC BY-4.0 / 数据 CC BY-NC-SA-4.0(禁商用)/ 测试不公开 |
| 关键 DOI | 15052755(描述)/ 15224703(Train)/ 15699958(Validation) |
| 冠军 | ImFusion 0.622±0.071(GPE 9.249 mm) |
| 抓取时点 | 2026-09-26 |
| 库内互链 | echonet-dynamic(526)/echonet-lvh(530)/camus(533)/hc18(535)/ddti(536)/us-nerve-seg(537)/busi(539)/maternal-ultrasound-nutrition(615) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 7 | 官网(GitHub Pages)+ Zenodo 三记录 + MICCAI 官方挑战列表 + arXiv 前作论文可索引;"TUS-REC"系列名与 2024 届易混淆微降分 |
| A 可获取性 | 6 | Validation open + 描述 open;训练数据 restricted(注册等待)+ 测试集不公开——挑战赛防泄漏设计是合理但硬性的门槛 |
| I 可互操作 | 7 | HDF5 标准容器 + CSV 标定 + 官方 baseline Python 代码 + docker 评测接口;无官方 DICOM/NIfTI 导出工具 |
| M 元数据质量 | 8 | BIAS 结构化描述 19 页(目的/数据/任务/评估/规则全字段)+ Zenodo 标准 JSON;帧数四口径与文件名两写微降分 |
| S 可持续性 | 7 | UCL 机构背书 + Zenodo 长期存档 + open call 持续接收;summary paper 未发表与主办方维护依赖是中等风险 |
| 综合评级 | 7.0/10(中上) | 元数据与可复现性基建是挑战赛样本中的优等生;可获取性被 restricted 拖低但属设计使然而非疏漏 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 85 人/170 段/50-3-32 划分/~164k/~9k/~90k | 官网 data.html 划分段 | github-pages.ucl.ac.uk/tus-rec-challenge/data.html |
| 设备与采集参数(20fps/480×640/6MHz/83dB/48%/9cm) | 官网 data.html Images 段 | 同上 |
| 扫描协议(fanning/rocking/旋转 90 度) | 官网 data.html + Zenodo 描述 PDF | data.html;zenodo.15119085 |
| Train restricted + CC BY-NC-SA-4.0 + 禁商用 | Zenodo API 记录 JSON + Data Usage Policy | zenodo.org/api/records/15224704 |
| Validation 发布日 2025-06-23 | Zenodo API 记录 JSON | zenodo.org/api/records/15699958 |
| 时间线(04-01 至 10-13 全链) | 官网首页 schedule | github-pages.ucl.ac.uk/tus-rec-challenge/ |
| 四指标定义与排名公式 | 官网 assessment.html | …/assessment.html |
| leaderboard 全部分数与四项毫米值 | 官网 leaderboard.html | …/leaderboard.html |
| 前作 43 队/21 提交/方法谱系 | arXiv:2506.21765 摘要与正文 | arxiv.org/abs/2506.21765 |
| 引用政策/发表限制/summary paper 时点 | Train Zenodo 描述段 + 官网 | zenodo.15224704;data.html |
| ImFusion 团队构成与获奖 | 官网 leaderboard + 团队博客 | leaderboard.html;zettinig.eu |
附录 D:数据获取决策树
需求是什么?
├── 快速学习/跑通管线
│ └── Validation(open,15699958)+ baseline repo(GitHub)——无需注册
├── 训练自己的模型
│ ├── 1) Microsoft Forms 注册(2025-04-01 起开放)
│ ├── 2) Train 记录访问请求(restricted,15224704)——等待发放
│ └── 3) 可选:并入 TUS-REC2024 数据(四记录,注意 non-rotation 分布缝)
├── 想要测试集名次
│ └── 注册 → docker 提交 → 主办方运行(≤6 h 总时长)→ leaderboard
├── 只想引用/综述
│ ├── 引 concept DOI 三件套(15052755/15224703/15699958)
│ ├── 方法综述引 arXiv:2506.21765 + Li 三论文
│ └── 别引"未来的 summary paper"——它还没发表(坑 2)
└── 想商用
└── 训练/验证数据不可商用(NC-SA + Policy 明文)——换数据或联系主办方书面授权
附录 E:h5 加载与 sanity check 骨架(代码)
import h5py
import numpy as np
def load_scan(h5_path):
"""读取一段扫描:帧序列 + 金标准位姿。"""
with h5py.File(h5_path, "r") as f:
frames = f["frames"][:] # [N, 480, 640] 灰度帧
tforms = f["tforms"][:] # [N, 4, 4] 齐次变换(tool->camera)
return frames, tforms
def load_landmarks(h5_path, scan_key):
"""读取标志点:[100,3] = 帧索引(0起) + 图像坐标(1起)。"""
with h5py.File(h5_path, "r") as f:
lm = f[scan_key][:] # 假设按扫描键组织
assert lm.shape[1] == 3
frame_idx = lm[:, 0].astype(int) # 0-based
pixel_xy = lm[:, 1:3] # 1-based(与标定一致)
return frame_idx, pixel_xy
def sanity_check(frames, tforms, calib):
"""三条快速自检,防坑 6/坑 7。"""
N = frames.shape[0]
assert tforms.shape == (N, 4, 4), "frames/tforms 帧数不一致"
assert np.isfinite(tforms).all(), "位姿含 NaN"
s = calib["scaling_from_pixel_to_mm"] # 像素->毫米
assert s > 0, "标定缩放异常"
# 文件名模糊匹配:RH_rotation / RH_rotating 都可能是同一文件(坑 7)
return True
附录 F:归一化分数计算骨架(代码)
def normalize_score(err, err_identity, err_gold=0.0):
"""GPE* = (err - largest) / (smallest - largest)
largest = err_identity(全单位矩阵误差);smallest = err_gold = 0。"""
return (err - err_identity) / (err_gold - err_identity)
def final_score(gpe, gle, lpe, lle, gpe_id, gle_id, lpe_id, lle_id):
"""四项各自归一化后等权 0.25,3 位小数,越高越好。"""
comps = [normalize_score(e, e_id) for e, e_id in
[(gpe, gpe_id), (gle, gle_id), (lpe, lpe_id), (lle, lle_id)]]
return round(0.25 * sum(comps), 3)
# 注意:identity 误差须在当届数据上实测——跨届复用他人天花板是坑 8 的代码级来源。
附录 G:挑战赛时间线总表
| 日期(2025,23:59 BST) | 事件 |
|---|---|
| 03-21 | Zenodo 挑战赛描述记录发布(v2 modified 04-10) |
| 04-01 | 官网开放/注册开始 |
| 04-28 | 训练数据 + baseline 代码发布(= Train Zenodo 发布日) |
| 06-23 | 验证数据 + 提交代码发布(= Validation Zenodo 发布日) |
| 07-07 | 提交开始 |
| 08-31 | 提交截止 |
| 09-01 | 冠军公布 |
| 09-23 至 27 | MICCAI 2025(大田);09-27 现场挑战赛活动(IBS-2F-100) |
| 10-13 | 赛后提交截止(post-challenge) |
| 2025-11-13 | 前作论文 v2(arXiv:2506.21765) |
| 2025-11-17 | Train 记录最后修改(revision 16) |
| by end of 2026 | 联合挑战论文(未发表,待核) |
附录 H:许可条款细读(三层+代码)
- 描述记录:CC BY-4.0——署名即可自由使用/分享/改编(19 页 PDF 是挑战赛的"户口本",引用它不会踩 NC 坑)。
- 训练+验证数据:CC BY-NC-SA-4.0——署名、非商业、相同方式共享;Data Usage Policy 叠加明文禁商用与"用途模糊时避免挑战范围外再分发";模型权重商用属性视为不清。
- 测试集:无公开许可——不存在"使用",只存在"提交评测"。
- baseline 代码:GitHub repo 许可为准(Python 代码随 repo 声明)。
- 引用优先级:用数据按数据许可(NC-SA),引规则/观点引描述记录(BY-4.0),引方法引三篇论文——三层勿混(坑 4)。
附录 I:坑点档案(与 §10 对照)
| 坑 | 一句话档案 | 触发场景 |
|---|---|---|
| 坑 1 | Trackerless=任务属性非数据属性(数据带跟踪金标准) | 命名转述/文档撰写 |
| 坑 2 | 主 DOI 只有一份 19 页 PDF;summary paper 未发表 | 下载/引用 |
| 坑 3 | 帧数四口径(1500/1600/260k/272k/263k) | 统计表述/论文写作 |
| 坑 4 | 许可与获取三层异构(BY-4.0/NC-SA/restricted/不公开) | 使用/商用/再分发 |
| 坑 5 | 双 DOI 体系+2024 记录双链接+%us% 误匹配 uspto-50k | 引用/检索 |
| 坑 6 | landmarks 帧索引 0 起、像素坐标 1 起 | 评测脚本 |
| 坑 7 | RH_rotation vs RH_rotating 文件名两写 | 自动化路径 |
| 坑 8 | final score 不可跨届直比(归一化天花板不同) | 跨届比较 |
附录 J:双口径登记表
| # | 项 | 口径 A | 口径 B | 处理 |
|---|---|---|---|---|
| 1 | 总帧数 | ~263k(官网划分段,主口径) | 272,000(邀请函 PDF);~260k(描述);1500/1600 每段 | 主口径+存照 |
| 2 | 数据许可 | CC BY-4.0(描述记录) | CC BY-NC-SA-4.0(训练/验证数据) | 分层表述 |
| 3 | DOI | concept(15052755 等) | version(15119085 等) | 引用用 concept |
| 4 | 2024 记录链接 | 官网用 concept(11178508 等) | 页内链接用 version(11178509 等) | 同数据两套链接存照 |
| 5 | 文件名 | RH_rotation(官网树) | RH_rotating(Train Zenodo) | 以实际解压为准 |
| 6 | 冠军论文 | 博客称已挂 arXiv | 编号未核验 | 待核不引编号 |
附录 K:维护计划与触发点
| 触发点 | 条件 | 动作 | 优先级 |
|---|---|---|---|
| summary paper 发表 | 联合挑战论文上线(≤2026 底?) | 更新引用结构、§7.4、结果分析章节 | 1 |
| 训练数据转 open | restricted 撤销/直链开放 | 重写 §5,升 AI-Ready 评级 | 2 |
| 榜单更新 | post-challenge 后新方法进入 | §6.2 扩行 | 3 |
| 冠军论文编号公开 | ImFusion arXiv 编号可核验 | 补 §6.3 与附录 J#6 | 4 |
| 下一届 TUS-REC 公告 | 2026+ 新届启动 | §7.4 展望更新、新条目互链 | 5 |
附录 L:检索决策树
你想找什么?
├── 官方规则/任务/评估定义
│ └── github-pages.ucl.ac.uk/tus-rec-challenge/(home/data/assessment/leaderboard)
├── 挑战赛结构化描述
│ └── Zenodo concept 15052755(19 页 BIAS PDF,CC BY-4.0)
├── 数据
│ ├── 训练:15224703(restricted,注册)
│ └── 验证:15699958(open,直下)
├── 方法综述/前作
│ └── arXiv:2506.21765(TUS-REC2024 挑战论文)
├── baseline 代码
│ └── github.com/QiLi111/TUS-REC2025-Challenge_baseline
└── "TUS-REC"检索卫生
└── 区分 2024/2025 两届(核对 DOI);超声域检索排除 uspto-50k(坑 5)
附录 M:引文规范
@misc{tusrec2025challenge,
title = {TUS-REC2025: Trackerless 3D Freehand Ultrasound
Reconstruction Challenge 2025},
author = {Li, Qi and Huang, Yuliang and Saeed, Shaheer U. and
Barratt, Dean C. and Clarkson, Matthew J. and
Hu, Yipeng and Vercauteren, Tom},
year = {2025},
howpublished = {MICCAI 2025 Challenge},
doi = {10.5281/zenodo.15052755}
}
@article{tusrec2024challenge,
title = {TUS-REC2024: A Challenge to Reconstruct 3D Freehand Ultrasound
Without External Tracker},
author = {Li, Qi and others},
journal = {arXiv preprint arXiv:2506.21765},
year = {2025}
}
附录 N:本条目生产档案
- 生产通道:50 篇冲刺批量生产·批次 2(agentA-tusrec)
- 事实研究:WebSearch 多轮 + Zenodo API 三记录 JSON + UCL 官网四页(home/data/assessment/leaderboard)+ arXiv abs 页 + 第三方交叉验证(ImFusion/COCHE 博客),三源互证通过
- FACTS.md:writing/tus-rec/FACTS.md 九节
- 成稿方式:五 part 直写拼接(part1-5,/tmp 唯一化文件名),全程不用 Edit 追加
- 坑点:§10 八则(坑 1-8"坑 N:"编号制)
- 互链查询:
url_name ILIKE '%ultrasound%'/'%us%'+title '%超声%',命中 18 行、筛真 8 项、排除 uspto-50k 误匹配 - 查重:
url_name ILIKE '%tus-rec%'0 rows,无同名条目
附录 O:缩写速查
| 缩写 | 全称 |
|---|---|
| TUS-REC | Trackerless 3D Freehand Ultrasound Reconstruction(Challenge) |
| MICCAI | Medical Image Computing and Computer Assisted Intervention |
| ASMUS | MICCAI 医学超声计算 workshop(第 6 届与 2025 挑战赛同场) |
| SIGMUS | MICCAI Special Interest Group on Medical Ultrasound |
| BIAS | Biomedical Image Analysis ChallengeS |
| UCL / KCL | University College London / King’s College London |
| NDI | Northern Digital Inc. |
| GPE/GLE/LPE/LLE | Global/Local Pixel/Landmark reconstruction error |
| GP/GL/LP/LL | Global/Local Pixel/Landmark(位移向量组) |
| DoF | Degrees of Freedom(自由度) |
| SD | Standard Deviation(标准差) |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability |
附录 P:坐标系与时间同步详解(复现者向)
复现评测链路时涉及的四个坐标系与一次时间对齐:
光学相机坐标系(camera space)
← NDI Polaris Vicra 追踪探头上的跟踪工具
跟踪工具坐标系(tool space)
← tforms[N,4,4] 逐帧记录(tool → camera)
图像坐标系(image space,像素,1 起)
← calib_matrix.csv:image → tool 刚体变换
毫米物理空间(mm)
← calib_matrix.csv:scaling_from_pixel_to_mm
| 要点 | 说明 |
|---|---|
| 变换方向 | tforms 的存储方向为 tool space → camera space(官网原文),左乘/右乘顺序按齐次变换惯例核对 |
| 像素坐标 1 起 | image space 以 1 为起点(与标定一致);landmarks 第 1 列帧索引以 0 起——同文件两制(坑 6) |
| 凸阵几何 | 像素→毫米的映射沿扇形几何展开,标定矩阵隐含曲率;线性索引直乘是系统性错误源(§3.6) |
| 时间对齐 | 数据 temporally calibrated:第 i 帧 tforms[i] 即该帧曝光时刻位姿,无需用户再做插值对齐 |
| 金标准地板 | 光学跟踪精度(Vicra 标称 RMS 亚毫米级)+ pinhead 标定误差构成指标地板;归一化把地板定义为 0 是约定而非物理事实(§3.4) |
附录 Q:TUS-REC2024 vs 2025 全面对照
| 维度 | TUS-REC2024 | TUS-REC2025 |
|---|---|---|
| 场合 | MICCAI 2024 挑战赛 | MICCAI 2025 挑战赛(+ASMUS 2025+SIGMUS) |
| 描述记录 | —(描述模板化始于 BIAS 推广期) | 19 页 BIAS PDF(15052755,CC BY-4.0) |
| 数据规模 | 43 注册队口径下的队列(同一 85 人前?官网未并表——待核) | 85 人 170 段 ~263k 帧 |
| 扫描协议 | non-rotation(固定轴向) | rotation(+90 度旋转再扫) |
| 数据记录 | Train Part1/2/3(11178508/11180794/11355499)+ Validation 12979481 | Train 15224703 + Validation 15699958(均双 DOI) |
| 训练数据访问 | restricted | restricted(revision 16,2025-11-17 最后修改) |
| 输出表示 | 届内统一但跨届不同 | GP/GL/LP/LL 四组位移向量(跨队同构) |
| 注册队 | 43 | 未公布(待核) |
| 有效提交 | 6 队 21 份 | 正式榜 7 实体 |
| 挑战论文 | arXiv:2506.21765(已发) | 未发(expected by end of 2026) |
| 冠军 | 挑战论文含获奖团队作者 | ImFusion 0.622(Prevost 回场) |
| 亚军团队 | — | 深圳大学 MUSIC Lab(= 2024 挑战论文作者团队) |
| 跨届可比性 | final score 与 2025 不可直比(坑 8) | 同左;比毫米值+注意协议差异 |
附录 R:库内超声家族对照速览(8 项互链 + 1 项排除)
| 条目(rid) | 任务类型 | 输入形态 | 输出目标 | 与 TUS-REC2025 的对照价值 |
|---|---|---|---|---|
| echonet-dynamic(526) | 功能估计 | 心脏超声视频序列 | EF 等功能参数 | 同为"序列输入"——一个学功能、一个学几何,序列建模技巧可互通 |
| echonet-lvh(530) | 表型分类 | 心脏超声视频 | HCM 表型 | 视频级临床任务;采集变异问题同源 |
| camus(533) | 多结构分割 | 2D 心脏超声帧 | 分割掩码 | 2D 分割金标准的质量标杆;与 3D 重建的金标准哲学对照 |
| hc18(535) | 测量 | 2D 胎儿超声帧 | 头围测量 | 标准平面依赖 vs 任意扫查路径的采集自由度对照 |
| us-nerve-seg(537) | 分割 | 2D 颈部超声帧 | 臂丛神经掩码 | 同为"非病灶结构"基准(神经/肌肉骨骼 vs 前臂) |
| ddti(536) | 分割 | 2D 甲状腺超声帧 | 结节掩码 | 静态图像 vs 动态序列的典型对照 |
| busi(539) | 分类+分割 | 2D 乳腺超声帧 | 良恶性分类与掩码 | 超声家族流量入口;2D 判读系代表 |
| maternal-ultrasound-nutrition(615) | 队列研究 | 孕期超声影像组 | 营养表型关联 | 同为非 DICOM 原生格式+志愿者/队列采集模式 |
| 化学反应提取 | 专利文本 | 反应产物集 | 排除:USPTO 子串误匹配,与超声无关(坑 5) |
用法提示:写超声家族综述时按"判读系(busi/ddti/camus/hc18/us-nerve-seg)—序列功能系(echonet-dynamic/echonet-lvh)—几何重建系(本条目)—队列系(maternal-ultrasound-nutrition)"四象限组织,检索入口可从 busi(热度最高)与本条目(任务独占)双向进入。
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-27,抓取与核验时点为 2026-09-26(见附录 A)。事实陈述以 UCL 官网四页、Zenodo 官方记录(concept DOI 15052755/15224703/15699958)、前作论文 arXiv:2506.21765 及 ImFusion/COCHE 团队博客为源;帧数四口径、许可三层异构、双 DOI 体系、文件名两写、summary paper 未发表等原始文档状态已在坑点与附录 J 存照。条目与库内 echonet-dynamic(526)、camus(533)、hc18(535)、ddti(536)、us-nerve-seg(537)、busi(539)、echonet-lvh(530)、maternal-ultrasound-nutrition(615)等超声家族条目互链,填补库内超声"3D 重建"任务极;后续维护触发点见附录 K。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- 3dteethland — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
- ulf-enc — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
- rsna-pneumonia — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
- osic-pulmonary-fibrosis — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
- heichole — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
- toothfairy2 — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
- curvas — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
- toothfairy3 — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
- stsr — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
- mitoem — 共享标签:医学影像 / 挑战赛数据集 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

